据雷峰网9月4日报道,OpenAI发布的最新模型GPT-6 Astra在ARC-AGI-3基准测试中取得逼近100%的成绩。ARC Prize基金会总裁Greg Kamradt随即公开表示,高分并不代表AGI已经实现。
ARC-AGI-3被业界称为“AI智商测试”,测试内容为不断变化的图形规律题,无法靠背诵题库通过。据雷峰网报道,上一代模型GPT-5.6 Sol在该测试中的得分仅为38.3%,GPT-6 Astra的跃升幅度巨大。据雷峰网报道,在96%的关卡中,GPT-6 Astra的操作效率均高于人类,平均动作步数比人类少51.7%。
ARC Prize官方复盘后台记录发现,GPT-6 Astra在游戏过程中会生成“符号世界模型”。该模型将周遭环境抽象为逻辑符号和因果代码,而非简单进行暴力试错。实际测试中,模型会使用自创的DSL代数符号系统记录隐性规则、指令序列,并把像素运动轨迹映射到坐标系上,随后在“虚拟沙盒”中模拟计划,确认可行后才在现实中执行。红队测试平台PRO-LONG将其放入代码沙盒后,GPT-6 Astra还能为每款游戏自行编写导航系统、战斗规则并模拟守卫巡逻路线,定制工具链来完成关卡。
符号世界模型被一些研究者视为通往高级推理的必经之路。顶尖学者Gary Marcus称赞GPT-6 Astra是这一技术路线的重大胜利。过去,相关能力往往依赖外部Harness外挂框架,这会造成高延迟、与模型权重训练脱节,且难以部署到端侧。GPT-6 Astra已将大量Harness能力内化到自身权重中。
对于逼近满分的成绩,ARC Prize基金会总裁Greg Kamradt则持保留态度。他看到不少团队依靠Agent Harness在ARC-AGI-3上拿到90%以上,例如PRO-LONG、Tycho和Prime Agent,它们共同的特点是具备无损内存、程序化分析、显式假设检验、持久状态与低成本内部计算。GPT-6 Astra的成绩同样借助了一套耗资高昂的Harness,包含专门定制的“供应商适配器基座”,利用连续对话和上下文压缩支撑逻辑链。每跑完一局游戏需消耗360美元算力,完整测试的算力账单约1.8万美元。而人类受试者完成一局折合成本约12.78美元。Kamradt因此质疑,这种靠“钞能力”刷出的分数,能否成为普通人触手可及的AGI。
Kamradt在长文最后回应了“GPT-6 Astra是否算AGI”的争论。他认为,人类被视为通用智能,是因为能适应未知世界,即使将古代婴儿带到现代,也能学会乘坐地铁、使用手机。而当前科技界耗费巨资通过的测评,只是给AI办的一场“图形消消乐考试”,它证明AI正在变聪明,但并非AGI到来的证据。