据量子位报道,紫东太初9月16日发布并开源通用多模态大模型ZDTaichu5.0-9B。该模型在九项国际权威空间理解基准测试中有八项排名第一,在10B参数以下通用模型中空间具身能力领先,同时其图文理解、文字识别、数学推理和代码能力仍处于第一梯队。
量子位公布的测试结果显示,ZDTaichu5.0-9B在空间感知、三维推理、多视角变换和具身交互等基准中整体领先。以MindCube-tiny为例,ZDTaichu5.0-9B得分78.27,Gemma4 8B-E4B为48.8462,Gemini 3 Pro为70.87,Grok 4为63.56。通用能力方面,其AI2D得分91.48,仅次于Gemini 3 Pro并高于其他对照模型;WeMath为75.9,MathVista Mini为84.5,OCRBench为85.5。量子位称,该模型在Agent与文本任务上表现突出,代码成绩尤为明显。
在空间任务演示中,模型能从杂物台面找到从左至右第二个银色盒子,给出归一化坐标(237,226);在三个视角输入下,模型需设想移动至绿框窗帘位置并面向蓝框沙发,再判断红框柜子相对自身的方位,其回答为右前方;在“找空位”任务中,模型需识别最右侧杯子的杯柄方向并找到未被占用区域,结果落入正确区域。量子位称,这些任务分别对应目标选择、参照系转换和交互条件判断。
具身操作演示显示,ZDTaichu5.0-9B可完成美工刀具收纳等高层任务规划,也能在仿真中把奶酪盒放入碗内,并参与试管转移、机台上料等流程。在试管转移中,模型需持续区分样品身份,判断哪支已入架、哪支仍待处理;在机台上料中,模型把工单目标和位置要求转化为随现场状态更新的操作规划。
据量子位介绍,该模型训练采用三阶段全栈数据生产管线。预训练阶段覆盖开源图文、网页结构化文档、公开视频多视角素材和仿真渲染三维场景,并进行去重、过滤、重写解析和视频抽帧描述,以建立视觉、语言、时序和空间概念之间的对齐。监督微调阶段纳入开源SFT指令、真实业务问答、空间具身案例和Agent工具调用轨迹,并检查图像、问题、对象关系和操作约束是否一致。第三阶段采用高质量退火与GRPO强化学习,通过能力域、难度和质量标签筛选样本,将答案正确性、空间坐标命中率和输出格式合规性转化为奖励信号。
推理方面,模型引入内置自适应循环推理,根据预测不确定性决定当前Token是否需要更多计算。分布越分散,模型对输出把握越小;确定性较高时直接输出,遇到高不确定性节点则在内部重复执行部分层块计算。该过程发生在模型前向传播内部,无需调用外部工具。模型还采用阻尼更新、双重停止判据和轨迹读出与状态回滚,控制每轮修正幅度并选择风险较低的表征结果。
ZDTaichu5.0-9B通过内外两套循环协同处理连续任务。内部循环围绕当前输入改善感知与推理,外部任务循环接收新观测和执行反馈,更新任务进展,使每次行动成为下一轮判断的新条件。紫东太初此次开放模型权重,同时公开整套经过工业级验证的数据生产管线详细方案,企业可用自有数据和机器人继续训练,迭代个性化空间多模态模型。
量子位称,ZDTaichu5.0-9B已在科研自动化和智能制造场景进行验证,包括试管转移和机台上料。对紫东太初而言,此次发布意味着通用多模态能力向空间理解与具身任务规划延伸,其产业价值将在更换工件、调整对象位置、增加操作前提等具体任务中继续接受检验。