据MarkTechPost报道,Reflection AI于2026年10月5日发布其首个开放权重模型Beam。该模型为稀疏MoE架构,总参数501B、每token激活23B,面向编程、推理和智能体工作负载,计划以Apache 2.0许可证在本月晚些时候开放权重。
Beam尚未开放自托管,正进行最终红队测试,早期访问通过Reflection平台等待名单。Reflection AI将其定位为从零训练的通用智能体模型,目标企业编程与智能体任务,并称其推进西方开放权重前沿。团队承认Kimi K3在原始能力上仍领先,因此Beam主打推理效率,称在推理基准上比GLM 5.2等更大开放模型少用3至4倍推理算力。模型提供推理努力参数,较低设置偏向简短回答,较高设置允许困难任务进行更长推理。
预训练使用23.8万亿token,来自网络、公开来源和专有授权数据。Reflection称,数据整理移除约95%原始互联网token,并保留约1.8万亿高质量token,这些token通常会被常规过滤器丢弃。架构交替使用局部与全局注意力,并采用细粒度路由专家;负载均衡基于DeepSeek-V3的无辅助损失均衡,增加专家偏置更新的余弦衰减。预训练在6144块NVIDIA GB300 NVL72 GPU上不到4周完成,临近结束时吞吐效率92.3%,进行9次半自动回退。中期训练将有效上下文扩展至100万token。
强化学习是Beam核心扩展轴。该轮训练使用10500块NVIDIA GB300 GPU,持续4周,生成超1亿次rollout,最大rollout上下文25.6万token。训练和评分在近100万个编程、智能体和STEM环境中消耗约13亿个沙箱。Reflection采用完全异步策略梯度,每个token标记生成时的策略版本;新算法在落后当前策略107个权重版本、延迟一天时仍保持学习稳定,团队称随RL算力增加未见平台期。系统平均维持11万并发rollout,新权重到达推理集群中位约12秒,期间处理71起推理事故而未停止训练。可控长度惩罚使Beam用更少token解决任务,RL混合中无浏览任务但浏览技能仍提升。
安全与对齐方面,Reflection从预训练检查点训练单独的安全与对齐教师,并用多教师同策略蒸馏与RL教师合并。安全训练采用审慎对齐,评估结果将出现在技术报告中。
基准测试中,Reflection报告Beam在SWE-bench Verified得80.9,Nemotron 3 Ultra为70.7;在Terminal Bench v2.1得80.1,接近GLM 5.2的81.0,但低于DeepSeek V4.1 Flash的90.6和Kimi K3的88.3。这些数字来自Reflection表格,竞争模型分数取自Artificial Analysis和DataCurve。对比中,Beam总参数最小,23B激活参数低于GLM-5.2、Nemotron 3 Ultra和Kimi K3;其计划采用Apache 2.0许可证,权重本月晚些时候发布。