据MarkTechPost报道,英伟达、南洋理工大学和麻省理工学院研究人员发布SoL-Pi,这是一套面向开源Pi编码智能体的四项效率机制。报道称,一个研究型AI在harness层运行自动研究循环后发现这些机制,在51项任务的EdgeBench评测中,SoL-Pi把记录的令牌流量较Pi降低44.7%至49.0%,API成本降低约33%,在GPT-5.6 Sol和Opus 5上的得分接近Pi。
SoL-Pi以MIT许可在GitHub的NVlabs下发布,可在未修改的Pi版本上运行,已用Pi 0.85.1和Node.js 22.19或更新版本测试。多数效率工作通过更快内核、量化或更便宜模型降低每令牌成本,SoL-Pi则试图减少任务消耗的令牌数量。harness负责工具调用、上下文、观察和委派,手工调优慢且部件耦合;Meta-Harness等系统可自动化,但近期研究发现演化出的harness可能过拟合搜索任务,在未见任务上收益有限。
搜索由一个研究型AI观察运行基础Pi的另一个智能体的执行轨迹,提出harness修改并测试。搜索覆盖六个家族的152个方向,以及535个可执行环境,累计超过3000次运行和6万多次智能体与环境交互。接受规则在搜索前固定,优化器不能改动;候选方案须保持能力指标容差并至少改善一项效率指标。EdgeBench的51项公开任务中,11项用于冻结候选的单向接受,40项用于最终评估,留出结果不回馈搜索。
最终存活四项机制。Action Fusion把编辑文件与测试、构建或运行命令合并为一次工具请求,省去一次模型往返。Online Context Compact通过update_plan跟踪步骤,比较预计输入节省与重写提示缓存成本,必要时调用Pi原生压缩。ObservationPack把超过10 KiB的工具输出本地归档,前两次请求完整发送,此后只给稳定句柄、原始大小和头尾摘录,精确页面仍可检索。Evidence-Preserving Reducer把至少4 KiB的构建测试日志交给更便宜的GPT-5.6 Luna high生成回执,由确定性验证器检查并在不可用时回退原始日志。
EdgeBench数据显示,GPT-5.6 Sol后端,Pi令牌流量21.5亿、API成本1339美元、平均分44.8;SoL-Pi效率点11.0亿、894美元、42.0分,性能点20.2亿、1271美元、47.2分。Opus 5后端,Pi为23.7亿、1741美元、44.8分;SoL-Pi效率点13.1亿、1158美元、42.2分,性能点21.0亿、1605美元、50.5分。全栈从GPT-5.6 Sol迁移到Opus 5后,保留Pi得分的94.3%,令牌减少44.7%,成本降低33.5%;在GPT-5.6 Sol上保留93.7%得分,令牌减少49.0%,成本降低33.2%。性能点使用各后端最佳单一机制,得分分别比Pi高5.3%和12.8%。论文估计每小时相较Codex和Claude Code原生harness省8.75至13.50美元,相较Pi省4.36至5.71美元。
在EdgeBench之外,Terminal-Bench 4的63项纯CPU任务中,SoL-Pi解决15项,Codex和Pi各解决18项;其总成本较Pi降低26.3%,为211.12美元对286.45美元。IMO 2026的Lean 4验证任务中,SoL-Pi通过6题中的3题,与Pi持平,每道通过题成本最低为20.90美元;Codex通过5题。