Black Forest Labs 发布 7B 开放权重世界动作模型(WAM)FLUX 3 Action,用于机器人控制。据 MarkTechPost 报道,该模型在 RoboLab-120 排行榜上以 42.92% 的任务成功率排名第一,权重、代码和训练配方已一同释出。
FLUX 3 Action 读取相机帧、机器人状态和文本指令,同时预测未来视频帧与下一段动作。模型输出关节目标,本身不包含速度、力或工作空间限制,需由应用层约束。部署上,DROID 策略在 H200 上以 BF16 运行约需 32 GB 显存,采用 FP8 量化并卸载文本编码器后可放入 24 GB 显卡。权重以 FLUX Kommunity 许可证发布,允许非商业使用。
在 RoboLab-120 上,该模型以 42.92% 排名第一,领先 NVIDIA 的 Cosmos 3 Nano(16B,36.8%)6.1 个百分点,参数量少 56%。同一榜单上,π0.5(3.3B,VLA)为 28.0%,DreamZero(14B,WAM)为 25.7%,GR00T N1.6(3B,VLA)为 7.2%。BFL 说明,42.92% 是排行榜提交成绩,其 guidance-distilled FP8 检查点的多随机种子均值为 42.24% ± 0.36。
真实硬件方面,Positronic Robotics 在 Franka 机械臂上做了盲评,10 个 DROID 任务各尝试 3 次。FLUX 3 Action 完成 28/30,成功率 93.3%;Cosmos 3 Nano 为 27/30,DreamZero 为 20/30,π0.5 为 13/30。
FLUX 3 Action 派生自多模态 FLUX 3 主干,预训练使用图像、视频和音频数据,视频占训练 token 的 95% 以上。文本、视频和机器人状态被编码为 token,主干的未来 token 解码为视频帧,动作 token 解码为机器人动作。中期训练将预训练数据与动作对齐视频按 36.95% 和 63.05% 的比例混合,动作数据覆盖游戏录像、第一人称人手视频、手持夹爪和遥操作,涉及 14 种本体,多数使用共享的 50 维末端执行器动作空间 EE50。BFL 称,仅用 DROID 数据训练时模型在 RoboLab 上低于 1%,加入预训练后同一协议达到 11.6%。
BFL 提供 3 个检查点,各有 BF16 和 FP8 版本。Base 使用 4 个采样步骤和分离引导(视频 CFG 4、动作 CFG 1);guidance-distilled 去掉第二次引导,快 1.8 至 2 倍,得分高 0.6 至 1.08 个百分点;step-distilled 只需 1 个采样步骤,快 3.15 至 4 倍,成功率下降 3.51 至 4.32 个百分点。与 FP8 的 Cosmos 3 Nano 相比,前两个检查点在消费级、工作站和数据中心 GPU 上快 1.52 至 3.95 倍。每次调用生成 32 个动作,频率 15 Hz,即 2.13 秒运动;π0.5 每次调用为 1.0 秒。FP8 的 step-distilled 检查点在工作站和数据中心 GPU 上比 π0.5 快 1.34 至 2.28 倍,在 RTX 5090 上则慢于 π0.5。
BFL 还按 Su 等人(2026)的设置测试了与 GPT 6 Astra 的混合控制。推理模型可以执行、编辑或替换策略预测的动作。低推理强度下,混合方案解决了 90% 的回合,每次成功花费 8.77 美元、用时 8 分 08 秒;纯 Astra 在最高强度下解决 100%,但每次成功花费 13.47 美元、用时 16 分 23 秒。
开发者可在自有演示数据上微调 FLUX 3 Action。BFL 公开了 DROID 配方和 SO-101 LoRA 配方,文档展示了从约 200 次演示中学会的 SO-101 拾取放置技能。BFL 还与 NVIDIA 合作,将模型原生集成进 Hugging Face LeRobot,并支持在 NVIDIA Jetson 上做边缘部署。