据雷峰网报道,9月15日,英伟达开源工作流优化工具SoL-Pi。该工具让AI进入Agent工作流充当监工,自动发现并修复冗余和Token浪费,通过自我迭代提升效率。英伟达公布的数据显示,使用后Token消耗最高减少64%,API调用成本下降50%至54%,实际开发中每小时可节省8.75至13.5美元。SoL-Pi基于开源项目Pi改造。
英伟达没有让AI直接在线盲改代码,而是先让AI批量提出152个优化工作流的想法,再放入自动化沙盒筛选,这一过程被称为“自动研究循环”。团队比较了三种AI管理AI的方式:计划经济模式由人或主模型定死步骤,因规则死板被放弃;中心化管理模式设一个超级主管AI,运行时写代码、派任务、调流程,灵活但令主模型核心代码库臃肿;共享快闪模式只维护一份最简工作模板和说明书,每个实验复制模板后自由修改和运行,实验结束即丢弃临时指挥代码。最终第三种方案跑完152个实验,只有4个机制存活,成为SoL-Pi核心骨架。
四个机制针对Agent工作流常见浪费。动作融合把改代码、跑测试等固定连续动作合并,省去多余决策推理。在线上下文压缩把大任务拆成独立小任务,每完成一个就压缩历史,只保留关键结论,需要核对细节时再调取原始记录。观察包把工具完整输出存在本地,上下文只留摘要和索引,AI需要时再调取对应段落。证据保存型简化器用成本更低的小模型把错误日志提炼成诊断报告,报告每个结论都能对应回原文位置,主模型只看精简报告,有疑问再核对原文。
为验证效果,英伟达搭建535个可验证环境。其中495个任务来自GitHub真实开源项目bug,团队把代码仓库还原到修复前状态,在离线环境装好依赖,并隐藏人类程序员的修复答案。另外40个是盲盒通关题,英伟达先写好验证器,再把AI放入开放式沙盒,由AI自由探索触发通关条件。实验让4种Harness同台竞赛:原生框架驱动的GPT-5.6 Sol、Claude Opus 5、开源智能体底座Pi以及SoL-Pi。对比Pi,SoL-Pi的Token消耗减少45%至49%,开发成本削减约三分之一;对比模型原生官方代理框架,Token消耗最高下降64%,API价格最多下降54%。
英伟达在论文中提出,效率本身也是一种RSI。与其一味让AI更聪明,不如先让AI干活更有效率,省下的预算可用于跑更多实验、尝试更多想法,反过来加速AI能力泛化和进步,论文称之为“Efficiency for efficiency”。团队认为,这四个机制挖出的是AI工作流普遍存在的通病,换模型、换任务后依然存在;它们得以诞生依靠广撒网、多尝试,当前阶段“广度比深度更重要”。即使不使用SoL-Pi,这四个优化思路也可套用到其他AI工作流。