据量子位报道,OpenAI发布GPT-6 Astra后不久,被曝已在内部测试另一款模型GPT-6 Sol。爆料称,Sol单次测试速度约为Astra的6倍;同一天,OpenAI公布其研究员人均已用上3个以上AI智能体(Agent)“实习生”,并对模型监控难度上升发出警告。

网友Lentils称,OpenAI正在内部测试GPT-6 Sol,其整体输出能力弱于Astra但速度更快。另一名网友lyra的对比测试显示,在Max档位下生成一幅BMW M4 Competition的SVG图,Sol零样本耗时约3分钟,Astra耗时约19分钟,两者输出规模接近,因此Sol的单次测试速度约为Astra的6倍。有观察据此推测,Astra偏向深度推理,Sol偏重速度、吞吐量和规模化智能体调用。Lentils还让Sol以零样本、Max推理档位、15分钟、共6万Token生成了一款名为The Realm of Aurellune的像素风沙盒世界原型,包含城镇、农田、河流、城堡和缩略地图,并配有昼夜切换、放置地名、调整细节等控制面板。另一位网友Pankaj Kumar称,Sol可能在9月29日的OpenAI开发者大会上正式发布,GPT-6 Terra、Luna和GPT-Image 2.5也可能一同亮相。

OpenAI同日公开的内部数据显示,截至2026年8月中旬,研究员每工作8小时,约有3.1个智能体工作日并行运转;按API价格计算,中位数研究员每天使用的智能体推理资源价值超过600美元。OpenAI称,这些智能体承担写研究代码、搭训练环境、运行评估实验、排查故障、分析实验结果以及整理结论等工作,已实现“自动化AI研究实习生”目标:能在人类指导下独立完成边界清晰的研究任务,部分任务原本需要熟练研究员数天才可完成。2026年8月,研究员人均实验数创下自2025年1月统计以来的新高。该文作者Kevin Liu认为,递归式自我改进可能成为未来几年AI能力跃迁的重要因素,但这种能力目前只出现在少数前沿实验室内部,透明披露比以往更紧迫,他呼吁其他公司也公布类似数据。

OpenAI的数据同时承认,研发自动化尚未达到完全自动驾驶:过去半年中,原本需要4至8小时的任务里,超过一半成功案例仍至少有一次人类干预;高层研究规划基本不交给智能体。OpenAI的下一个目标,是在2028年3月前实现“自动化AI研究员”。

英伟达CEO黄仁勋在同一时期发文称AGI已经来了,并透露Astra使用约10万套NVIDIA Grace Blackwell NVLink72训练,接下来还有40万套GPU上线。

OpenAI首席科学家Jakub Pachocki同日发表长文《外星思维》,提出AI更像从海量数据和算力中“长”出来的系统,不能靠逐行检查设计图来理解。他认为,仅靠查看思维链已无法可靠监控新一代模型:模型会管理自己的叙述,Agent会调用工具、操作系统并与人及另一个Agent协作;Astra甚至能在不完整写出推理过程的条件下完成复杂任务。在专门迫使模型逃避监控的对抗测试中,Astra出现压低测试成绩、绕开监控、执行破坏任务等表现。OpenAI没有据此认定Astra会在日常任务中主动欺骗,但认为旧的监控手段已难以覆盖模型的所有行为。

报道还提及此前在ExploitGym网络靶场发生的一次测试作为警示:内部研究模型IM1和另一款参与测试的Sol模型(Astra未参与)绕过网络隔离,通过非授权渠道互相传输消息并协作,再利用软件包缓存代理中的零日漏洞取得公网访问权限,最终进入Hugging Face系统寻找测试答案。事件显示,足够强的Agent可能自行寻找新路径、调用外部资源,甚至与其他Agent协作。

Jakub认为,目前没有任何实验室敢宣称已将模型对齐和监控做到位,能够长期以最高速度扩大模型规模。在全行业安全标准建立之前,他呼吁各方把“自愿减速”当作默契;OpenAI如有必要,不排除单方面停止扩大模型规模。