据量子位2026年10月1日报道,MIT何恺明团队提出纯视觉ARC解题方案NAT-ARC,用ImageNet自然图像预训练后迁移到抽象彩色格子推理。论文称,其最佳单模型在ARC-1上取得63.4%的pass@2分数,集成后达70.2%,纯视觉方案首次逼近专用大语言模型系统水平。

ARC全称Abstraction and Reasoning Corpus,由Keras之父François Chollet在2019年提出。每道题给出最大30×30的二维格子、最多10种颜色和2到5组输入输出示例,解题者需推断隐藏变换规则,再应用到新输入格子并预测输出。规则不固定、示例极少,使其成为测量AI抽象推理能力的标杆。

过去ARC主流解法几乎都是大语言模型,先把格子翻译成文本或符号序列,再交给语言模型推理。视觉路线后来崛起:同一个MIT团队的VARC把ARC重新定义为条件图生图翻译任务,用1900万参数模型跑出54%;LoopViT和Loop-OWM等后续方法以更小参数量继续提升,已开始追平LLM方案。但多数视觉ARC方案从随机初始化开始训练,没有吃到预训练红利。

NAT-ARC在VARC视觉流程前插入ImageNet MAE预训练。MAE是Masked Autoencoder,为何恺明2022年在FAIR提出,训练时遮住图像大部分区域,让模型从剩余碎片复原原图,从而理解物体形状、结构和空间关系。NAT-ARC把MAE在ImageNet约130万张自然图像上训出的encoder权重用于初始化视觉编码器,decoder随机初始化。流程包括用ImageNet MAE预训练encoder,在ARC训练集上离线训练整个编解码器,以及测试时对每道题单独做LoRA微调。为适配64×64像素的ARC格子,NAT-ARC只保留MAE的backbone权重,改用2D RoPE位置编码。

论文用注意力可视化解释迁移原因。同一道ARC题尚未训练前,随机初始化模型注意力均匀分散;ImageNet MAE预训练模型已能区分前景和背景,注意力自动聚焦到格子中有意义的图案区域。研究人员筛出15道预训练后显著提升的题,发现提升集中在匹配复制与连通区域推理两类任务上。

在ARC-1上,NAT-ARC最好的单模型采用huge尺度,参数量0.6B,pass@2为63.4±0.7%。集成时,研究人员把无预训练、ImageNet MAE预训练和ARC风格格子MAE预训练三种策略训出的模型池化多数投票,得到70.2±0.6% pass@2,总参数量约2B。作为参照,专门针对ARC微调的The ARChitects拿到71.6%,使用8B语言模型。视觉路线以约四分之一参数量接近专用LLM系统。

论文还报告,预训练打通了视觉路线的scaling瓶颈。没有预训练时,模型从base到large性能上升,但从large到huge反而掉点;加入ImageNet预训练后,base、large、huge三个尺度一路向上,模型越大效果越好。

一个可视化实验把ImageNet图像映射到60×60、10种颜色的离散格子表示,相当于把猫片翻译成ARC格子。研究人员用NAT-ARC对该格子执行ARC变换,旋转180°并加一圈蓝色边框,再解码回像素,结果显示猫确实被旋转,边框也加上。论文由此提出,自然图像和ARC格子共享同一套表征空间。

论文一作Xiaoman Delores Ding是MIT CSAIL成员,来自何恺明组,也是VARC一作;通讯作者何恺明是ResNet和MAE作者。据量子位报道,VARC已被CVPR 2026接收,NAT-ARC是其直接后续。论文地址为https://eccv.ecva.net/virtual/2026/poster/5527。