据 Hugging Face 博客9月15日发布,一个在 AppWorld 基准上平均成功率为77.4%的 ReAct 智能体,在同一任务五次重复运行中全部成功的比例只有53.0%,两者相差24.4个百分点。该博客称,平均分掩盖了智能体重复执行同一请求时的不稳定性,对于核对金融交易、检查合同义务等关键任务,这可能让工作流中断。

多数基准以 Mean@k 报告结果,即运行 k 次后取平均通过率,常见 k=3,有时仅 1 次。博客说,这个数字回答的是智能体平均有多好,却不回答真实用户关心的问题:如果再次提出完全相同的问题,它是否仍然能做好。要回答后者,需要 Pass^k,即 k 次运行全部成功的任务比例。博客强调 Pass^k 不是 Pass@k:熟悉的 Pass@k 问至少一次尝试是否成功,适合可验证、可重试的场景;Pass^k 要求每次尝试都成功,三者恒有 Pass^k ≤ Mean@k ≤ Pass@k。

在 AppWorld 的 test_normal 上,使用 GPT-4.1 的 ReAct 智能体 Mean@5 为77.4%,Pass^5 只有53.0%。这意味着近四分之一基准任务属于智能体有时能解、有时不能解,而任务本身在每次运行之间没有变化。博客把 Mean@k 减去 Pass^k 称为一致性缺口,在困难任务上该缺口达到30个百分点。博客称,这不是靠更大模型解决的能力问题,而是一个正交维度,智能体可以同时具备能力且表现不一致。

博客解释,LLM 智能体每次决定调用哪个 API、传递什么参数或是否重试,都来自下一 token 的概率分布。分布尖锐时,概率大量集中在单一 token 上,同样选择会反复出现;分布平坦时,几个接近并列的 token 获得相近概率,最终选择接近抛硬币。平坦分布更容易受到微小扰动影响,例如 GPU 浮点非结合性、请求批处理等平台侧效应,可能改变接近并列的排序。由于一条轨迹串联数十个决定,每步很小的翻转概率会累积成某次运行结果不同的较大概率。博客称,这也是贪心解码和固定随机种子不能消除问题的原因:它们规定分布如何变成 token,却不改变分布本身;在托管端点上,概率会逐次轻微变化,温度为零时同一提示同一模型也可能今天解决一个接近并列的选择,明天解决另一个。其设置中 ReAct 智能体运行温度为0.0,因此上述方差并非普通采样造成。

为找出轨迹中哪些步骤容易翻转,博客介绍了 Consistency Analyzer。该工具重采样智能体自身记录的轨迹,寻找易翻转决策点,即模型距离采取不同行动只差一个 token 采样的步骤。博客称,它只需要一条轨迹,不需要真实标签;它在轨迹的每个决策点用一次请求生成 k 个补全,默认 k=5,而不是端到端重新运行任务。

把这种诊断转化为一致性指南后,缺口从24.4个百分点降至12.0个百分点。同一任务 Pass^5 提升16.0个百分点,相似任务提升13.0个百分点,平均准确率没有损失。一致性指南是 altk-evolve 中新增的指南类型,建立在 Consistency Analyzer 之上。博客称,此前介绍的 ALTK-Evolve 能把智能体自身过去的轨迹自动蒸馏为可复用指南,并在推理时注入,可测量地提高任务成功率,但那些结果也只针对平均情况。完整方法和评估见 arXiv 技术报告。