据MarkTechPost报道,字节跳动Seed与新加坡科技设计大学、佐治亚理工学院、M-A-P、TokenWave.AI的研究者提出HarnessDev,把评估对象从模型答案改为模型自行编写、可运行的智能体执行框架。在64次相邻版本切换中,只有34次开发反馈与留出集得分同向变化;自建框架在写作和机器学习实验上达到或超过人工参考,在代码与搜索上明显落后。

harness指模型周围的代码,包括执行循环、工具、上下文、状态、恢复与验证。据Terminal-Bench 2.1排行榜,GPT-5在Terminus 2中解决35.2%的任务,在Codex CLI中解决49.6%,而模型权重相同。多数基准固定harness,HarnessDev让模型自己构建。

HarnessDev分Creation和Evolution两阶段。Creation阶段,创建者拿到相同弱种子,没有循环、规划器、验证器、重试或停止规则,未修改时得分为0;他们获得任务族说明、简短教程和1至3个开发案例,构建完整harness后在隐藏任务前冻结。Evolution阶段从冻结代码出发,用固定100个SWE-bench Pro任务和全部89个Terminal-Bench 2.1任务的反馈修改。每个正式候选须成对完成两项评估,预算10对,对之间最多2次五任务探测,最终在630个未见过的留出SWE-Pro实例上评分,兼顾成功率与执行器token效率。

实验测试6个创建者LLM:Opus 4.8、GPT-5.5、Gemini 3.1 Pro、DeepSeek V4 Pro、Qwen 3.7 Max和Seed 2.0 Pro,运行于Claude Code 2.1.177,GPT-5.5使用Codex 0.144.3。Creation覆盖SWE-bench Pro公开划分、Terminal-Bench 2.1、MLE-bench、EQ-Bench3和BrowseComp五个基准,共2207个实例。每个创建者对每个基准构建3个harness,报告avg@3;Self-Eval由创建者自己运行,Unified-Eval统一由Gemini 3.1 Pro运行。

Self-Eval下,Opus 4.8平均分最高为67.8,人工工程参考为86.2。Opus 4.8在SWE-Pro得69.3,参考80.0;Gemini 3.1 Pro在Terminal-Bench得68.8,参考88.8;BrowseComp最佳为GPT-5.5的52.6,参考92.2。写作中Opus 4.8在EQ-Bench3得84.6,高于83.7的参考;机器学习实验中Opus 4.8得32.9、Gemini得32.4,均超过MLE-bench的24.0参考。前三项参考来自OpenAI GPT-5.6报告的外部结果,并非重跑。

代码量未预示质量。18个代码harness净增17111行,但Gemini增行最少,仅1006行,且在Terminal-Bench领先。自测数量与得分相关性弱,Spearman为0.13至0.26。108个代码组件实例中72个触发,18个从未触发,全部属于状态与记忆;18个harness中有11个定义State类,但26679条轨迹中没有检查点事件。587个写作特征中有124个是死代码。

成本方面,MLE-bench的token用量相差约19倍。GPT-5.5以2930万token达到19.1%的奖牌率,DeepSeek V4以2.084亿token达到19.6%。将执行器换成Gemini后排名重排:Qwen在BrowseComp提高17.6分,在MLE-bench提高12.9分;Opus 4.8的SWE-Pro得分从69.3降至33.0,部分原因是一个harness围绕原执行器硬编码了120步限制。Opus搜索harness的重复查询率从10.1%升至88.2%。

Evolution中,9个谱系产生73个正式版本和64次相邻切换。5个自运行时创建者都在留出任务上改进,提升1.43至4.44分,平均3.11分;固定Gemini时只有Opus改进,GPT-5.5回退10.32分。进展并非单调:8次切换在两个基准上都回退,16次在一个基准上回退,27次只在噪声区间内提升,2次显示明确正向证据。反馈与留出得分同向变化仅34次,占53.1%,9个申报最终版本中只有2个在留出集上最优。最清晰的胜利是Opus 4.8发现100次运行有99次报告成功但只有48次通过,加入完成门控;失败诊断仍是最弱环节,专用轨迹接口只被调用两次。