据MarkTechPost报道,Liquid AI于8月25日开源了一款名为Pipette的基准测试平台,用于衡量基础模型在边缘设备上的实际表现。该平台由Liquid AI与独立方法论验证机构Artificial Analysis合作推出,其核心理念是将端侧行为视为整个部署系统的属性,而非孤立模型的属性。Pipette的度量单位是一个完整配置,即模型、量化、运行时与设备的组合。
Pipette的发布数据集涵盖五项目端侧性能指标,覆盖超过1000个模型乘以量化乘以运行时乘以设备乘以上下文长度的配置,涉及30多个模型、面向macOS、iOS、Windows和Android的llama.cpp构建版本,以及256至8192 token的上下文长度。首批验证结果来自搭载M5 Max的MacBook Pro、iPhone 17 Pro和Galaxy S26 Ultra,AMD Ryzen AI Max+ 395和Radeon 8060S的结果标注为即将推出。
该平台以Apache 2.0许可证开源基础架构,包括pipette-mgmt、pipette-clients和pipette-scores,同时提供公开结果数据集、托管仪表板以及原生iOS和Android基准测试应用。社区提交结果的公开发布仍处于测试阶段。Liquid AI表示,任何将模型部署到非自有硬件上的团队都可使用该平台,从个人开发者到大型OEM厂商皆可应用。
Pipette公布的对比数据直观展示了部署上下文对决策的影响。在Galaxy S26 Ultra上,采用Q4_K_M量化时,Granite-4.0-H-350M模型从256至4096输入token的解码吞吐保留率为78.4%,而Granite-4.0-350M仅保留33.8%。在2048输入token下,LFM2.5-8B-A1B模型解码速度比Qwen3.5-4B快2.4倍,比Ministral-3-3B-Instruct-2512快2.6倍,但峰值内存仍达5.29 GiB,因为所有专家权重都占用内存。速度和质量也并非总是一致:在iPhone 17 Pro的Q4_K_M下,MiniCPM5-1B完成2048输入/256输出任务耗时3.47秒,比LFM2.5-1.2B-Instruct快15.8%,但在相同配置下,LFM在MATH-500上得分高9.0分。
性能测量的生成遵循已发布的方法论:固定token形状、贪婪解码、丢弃预热、五次测量重复以及就绪门控。每次计时重复前,平台会检查温度和负载条件,不满足条件的运行会被丢弃。模型质量分数则在IFBench、GPQA Diamond和MATH-500上分别追踪,这些质量分数目前来自NVIDIA H100 80GB参考系统上的llama.cpp评估运行,然后与共享相同模型和量化的端侧运行进行匹配。Liquid AI强调,与手机吞吐量并排显示的质量分数并非在手机上生成。