据量子位10月11日报道,何恺明团队在最新论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出视觉原生Harness框架VISTA。该框架让现有多模态模型直接观察环境、保存原始画面,并在推理时随时回看、放大和检查细节,无需从头训练。

传统做法常把环境抽象成文字或代码。在ARC-AGI-3等交互式视觉推理基准中,已有思路是先把画面转换为数字文本网格,再让模型编写程序模拟环境规则、验证行动方案。但环境越复杂,物体外观、空间关系和动态变化越难完整转化为文字和代码;交互历史变长后,早期画面也可能被移出上下文或被文字摘要替代。VISTA要解决的问题是,在不额外训练基础模型的情况下,让智能体在推理需要时重新检查过去看到的视觉信息。

VISTA设计了三个核心组件:视觉观测、无损视觉记忆和主动视觉检查。视觉观测负责把环境画面提供给模型,在ARC-AGI-3实验中,官方提供的64×64画面被放大为512×512的PNG图像,保留颜色、外观和空间关系。无损视觉记忆在每次执行动作后完整保存环境返回的所有画面,包括动作过程中的动画中间帧,并按回合号和帧号建立索引。主动视觉检查通过inspect工具,让模型指定历史回合调出画面,或裁剪、放大局部区域,也能一次调出多帧对比动作前后的变化。

执行时,模型先观察当前画面和可用动作,结合此前经验判断环境状态并提出行动假设。如果信息不足,模型可调用工具回看历史画面、放大局部甚至读取像素信息寻找证据。动作执行后,模型把实际结果与预测对比,修正对规则的理解。框架完整保存历史画面,但默认每次动作后只向模型展示最后一帧,中间画面留在视觉档案中,需要时再主动调取。VISTA还引入两份文字笔记:GUIDE.md记录不同关卡间可复用的规则和经验,WORKING.md记录当前关卡状态、进度和后续计划。当上下文接近上限时,模型先整理交接摘要,再进入新的上下文窗口继续执行任务,此前的文字笔记、动作历史和视觉档案都会保留。

评测结果显示,搭配VISTA,Claude Opus 5.0完成了ARC-AGI-3全部25个公开游戏,相对人类动作效率得分达到满分100,所用游戏动作数比首次游玩的人类基线少57.4%。换成GPT-5.6 Sol,同样全部通关,得分达到99。团队还在GameWorld、AI GameStore和BabyVision三个基准上测试VISTA,覆盖浏览器游戏、迷宫和连线等任务。使用相同GPT-5.6 Sol模型,相比官方基础框架,VISTA在GameWorld的170项任务中把成功率从40.0%提高到63.3%;在AI GameStore的10个游戏中,综合得分从47.3升至140.3,人类中位数被归一化为100;在BabyVision选取的39道迷宫与连线题上,准确率从41.0%提高到63.2%。

论文的三位共同第一作者为Qiushi Han、胡珂雅和Linlu Qiu,另外两位作者为Cathy Wu和何恺明,作者主要来自MIT。研究将更接近物理世界的具身任务列为后续验证方向,即让模型在持续变化的环境中保存、复查并利用视觉经验决定下一步行动。