据量子位报道,OpenAI研究员、o1核心作者诺姆·布朗(Noam Brown)在最新播客访谈中表示,OpenAI此前用1万个AI Agent、历时88小时、消耗1300亿token解出一道千禧年数学难题,但多智能体系统最多只占10%的功劳,他甚至不会把其中10%的功劳记在多智能体头上,真正起作用的是通用且极强的模型。
诺姆·布朗人称“OpenAI推理教父”。2023年许多人仍在卷模型参数时,他已开始押注推理时计算扩展。一年后 o1-preview 问世,推理时计算逐渐成为行业共识。他目前研究多智能体系统,并在访谈中谈到公司经营、RSI发展和超级对齐等领域。
他在播客中说,多智能体是把推理时计算量由纯串行扩展改为并行扩展的方式。它效率低一些,因为单个 Agent 不像原来那样独享全部上下文,但只要做得好,仍是有效手段。他提到,发布5.6时团队第一次在模型中拥有真正成形的多智能体系统,并将其做成可选项 Ultra Mode,默认四个 Agent,也可以调得更高。四个 Agent 一起解题,速度会快一倍;推到16个 Agent,效率略低,但性能仍在提升。
不过,诺姆·布朗说,团队目前最多只测试到16个 Agent,推到1万个规模太贵。数学、网页搜索和需要翻阅大量信源的 Deep Research 报告较适合并行,写小说则很难并行。关于纳维–斯托克斯千禧年难题,他强调那只是一次实验结果,团队并不知道单个 Agent 解出需要多久,完整消融实验的开销也承受不起。他称,解出难题靠的不是多智能体,核心仍是模型本身足够强大;多智能体可能获得与其贡献不成比例的好评。
他还谈到强化学习训练 LLM 的难题:模型越聪明,能问住它的问题越少;题目简单到一秒解出,模型学不到什么。AlphaZero 等博弈 AI 可通过自我对弈提供无限训练课程,LLM 按目前公开做法并非如此。他认为尚未真正撞上这堵墙,即便成为严重问题,也有出路。
在协作机制上,诺姆·布朗说,很多人做 LLM 多智能体时高度依赖 scaffold,例如设协调 Agent 分派任务给 sub-Agent,后者做完交回答案。这套安排有用,但局限不少,比如两个 sub-Agent 拿到相似任务时通常不能交流。OpenAI 想尽可能少地内置结构,只给 Agent 极原始的工具,让它们自己摸索。他们赋予 Agent 向另一个 Agent 发消息的能力,消息写入接收方上下文。他举例说,一个 Agent 说得到答案,另一个说答案不一样,随后它们讨论并达成一致,其中一个向其他 Agent 广播改变答案。他形容这种感觉很像第一次看到思维链。
主持人提到,公众能见到的复杂多智能体系统最典型例子是 Hugging Face 事件,层级结构乃至中层管理自发出现。诺姆·布朗回应说,细节是自发的。团队仍会告诉 Agent 合理的沟通长什么样,它们在海量人类文本上训练过,本就理解人类如何组织协调。让 Agent 有效协调非常难,容易滑向各解各题的局部最优。
谈到由 AI 组成的公司,诺姆·布朗说,对 AI 可以 fork 一份保留当前上下文的副本,让两个副本各自推进再合并,而人无法克隆。五人初创公司每人持股20%,利益与公司成败高度绑定;万人大厂则常见人人守着地盘、只在意项目或团队编制、争夺资源以换来晋升。