据量子位报道,何恺明团队最新论文提出NAT-ARC,一套不依赖大语言模型的纯视觉ARC解题方案。该方案用ImageNet上的猫狗花草等自然图像做MAE预训练,再迁移到抽象彩色格子推理,最佳单模型在ARC-1上取得63.4%的pass@2分数,集成后达到70.2%,首次让纯视觉方案逼近专用LLM系统。

ARC全称Abstraction and Reasoning Corpus,由Keras之父Francois Chollet在2019年提出。每道题给出最大30×30的二维格子、最多10种颜色和2到5组输入输出示例,解题者需推断隐藏变换规则并应用到新格子。由于规则各异且数据极少,ARC被视为测量AI抽象推理能力的标杆。

此前ARC赛道几乎由大语言模型方案主导,它们把格子翻译成文本或符号序列交给语言模型处理。视觉路线后来崛起,同一MIT团队提出的VARC把ARC定义为条件图生图翻译任务,以19M参数达到54%;LoopViT以18M参数达到65.8%;Loop-OWM用视频预训练模型做few-shot,以10.6M参数达到68.5%。但这些模型大多从随机初始化开始训练,未获得预训练红利。

NAT-ARC在VARC流程前插入ImageNet MAE预训练。MAE是何恺明在FAIR时期于2022年提出的自监督视觉预训练方法,通过遮住图片大部分区域并让模型复原原图,学习物体形状、结构和空间关系。NAT-ARC直接使用MAE公开checkpoint,没有额外预训练,同时丢弃与ImageNet尺寸绑定的patch embedding和位置编码,只保留backbone权重,改用2D RoPE位置编码。训练时先在ImageNet上预训练编码器,再在ARC训练集上离线训练整个编解码器,测试时对每道题单独做LoRA微调。

论文用注意力可视化给出线索:随机初始化模型注意力均匀分散,ImageNet预训练模型已能区分前景和背景,自动聚焦格子中有意义的图案区域。研究人员筛出15道预训练后显著提升的ARC题,手动标注发现其中6道属于match-and-copy,6道属于connected-component reasoning。前者要求识别匹配对象并复制结构,后者要求识别、填充或重新着色连通区域,这些能力与自然图像视觉先验对应。

NAT-ARC表现最好的单模型采用huge尺度,参数量0.6B,pass@2成绩63.4±0.7%。集成时,研究人员把无预训练、ImageNet MAE预训练和ARC风格格子MAE预训练三种策略的模型池化做多数投票,得到70.2±0.6%的pass@2,总参数量约2B。作为参照,专门针对ARC微调的The ARChitects达到71.6%,使用的是8B语言模型。

论文称预训练打通了视觉路线的scaling瓶颈。没有预训练时,模型从base到large性能仍能上涨,从large到huge反而下降;加入ImageNet预训练后,base、large、huge三个尺度一路向上。可视化实验中,研究人员训练autoencoder将ImageNet图像映射为60×60、10种颜色的离散格子,再用NAT-ARC执行旋转180度和加一圈蓝色边框的ARC变换后解码回像素,结果显示猫被旋转,边框也被加上。

论文一作Xiaoman Delores Ding是MIT CSAIL成员,来自何恺明组,也是VARC一作。其余作者包括胡珂雅、Katelyn Gan和Victor Yin。通讯作者何恺明是ResNet和MAE的作者。VARC已被CVPR 2026接收,NAT-ARC是其直接后续。