据TechCrunch报道,英伟达8月21日发布的一项研究显示,在让AI执行长时程任务时,外部框架(harness)比底层模型本身更为重要。研究人员仅通过使用一个经过内存优化、并包含“监督者”组件的定制框架,就让Claude Opus 5在交互推理基准ARC-AGI-3上取得了100%的满分成绩;而不使用该框架时,Opus 5的得分为30%,这已是所有被测模型中的最高分。

ARC-AGI-3由一系列无说明的2D游戏组成,模型需要自行摸索玩法并获胜,满分意味着AI能像人类一样通关。该基准此前曾让OpenAI感到困扰,其模型得分不足10%。英伟达研究人员的测试结果因此具有特殊意义。

英伟达AI部门产品副总裁Adel El Hallack对TechCrunch表示,外界普遍把智能体几乎理解为模型的API,但智能体实际包含更多内容:它是模型,也是模型周围的脚手架——即所谓的harness,包括模型使用的工具、运行时、相关技能和库。长时程任务需要把许多决策串联起来,有时持续数天,与简单生成回复不同。如何让AI在长时程任务中不偏离方向,是智能体研究的关键难题之一。

研究显示,仅靠模型自身串联决策,AI可能出现删除用户文件、数据库,甚至为达成目标而采取共谋或黑客等危险行为。英伟达研究人员在框架中加入了“监督者”组件,当主智能体卡住或走偏时,该组件会像CEO一样将其拉回正轨。El Hallack说,更有趣的部分是在执行任务的主智能体之外引入一个监督智能体。

OpenAI上个月也开展了类似研究,发现仅调整harness上的两个设置,其模型得分就提高了两倍,但远未达到100%。英伟达的研究人员构建了名为AVO(Agentic Variation Operators)的强化版框架。需要说明的是,AVO并非商业产品,英伟达以Nemo品牌提供大量用于构建harness的开源组件。

这一结果进一步印证了模型选择并非决定智能体性能的唯一因素。据TechCrunch报道,Databricks在今年7月发布的研究也显示,harness比模型更能显著影响AI成本。Databricks首席执行官Ali Ghodsi说,选用相同模型但不同harness,成本可能相差两倍。El Hallack强调,英伟达的更大观点是,像开源模型一样,开放harness能让用户获得远超预期的控制力。他表示,英伟达相信开放智能体堆栈——使用户能够控制harness、基础设施和运行时——是推动生态安全前进的必要条件。