据 MarkTechPost 报道,Fireworks AI 旗下的 Fireworks Research 发布 Ember-1,这是一个由 Moonshot AI 开放权重的 Kimi K3 后训练而成的专用模型。该公司称,Ember-1 学会了生成更短的推理轨迹,同时保持任务准确率,效果上相当于以约少 40% 的 token 达到 Kimi K3 的质量。这一思路与在推理阶段调低推理强度设定不同。Ember-1 目前仅通过 Fireworks 的无服务器 API 以研究预览形式提供,Fireworks 未公布其权重、训练代码和具体训练算法,因此现阶段无法自行部署。
Fireworks 团队给出的问题背景是,Kimi K3 这类推理模型有时会把超过 90% 的生成 token 用在内部推理上。这一开销在多轮智能体工作负载中会不断叠加:每一轮都会把此前的推理重新送回模型,上下文随轮数大致呈二次增长,早期轮次产生的长推理轨迹在后续每次调用中都被重复读取并重复计费。该团队称,客户希望以更低成本获得 K3 的编码能力,而调低 K3 的推理强度并未解决问题,低强度设定牺牲的质量过多,因此改为训练模型更高效地推理。
按照 Fireworks 的说法,K3 的推理并非全部是浪费,其中一部分是有用的自我反思,例如重新审视某个假设或对反馈作出反应。Ember-1 保留这类行为,同时削减冗余推理和没有产出的循环。训练数据覆盖数学、编码、指令遵循、对话、搜索、工具使用和软件工程,既包含独立问题也包含多步长交互,任务与环境反馈用于指导在策略规划与学习。Fireworks 称共进行了 50 多次训练实验和 200 多次评估,并开发了未予公开的新训练算法,全部训练在 Fireworks Serverless Training 上完成,使用自有数据,未使用客户数据。
Fireworks 将 Ember-1 与 Kimi K3 在三个推理强度档位上做了比较,成本按公开的 Kimi K3 API 价格计算,结果均来自 Fireworks 自行发布的评估。在 Terminal Bench 2.1 上,Ember-1 得分 82.0%,高于 K3 Max 的 80.9%,成本低 51.9%,即每任务少 23.1 美元;DeepSWE 1.1 上为 75.2%,高于 K3 Max 的 66.4%,成本低 23.7%,每任务少 126.9 美元。SWE-bench Verified 上 Ember-1 为 92.2%,略低于 K3 Max 的 93.2%;SWE-Interact 上为 20.0%,低于 K3 Max 的 21.3%;τ-2 Bench Airline 上为 66%,高于 K3 Max 的 64%。Fireworks 称,在七个基准和两个客户的生产流量上,K3 的推理长度被缩短了 35% 至 50%,准确率没有因此下降。在 Doximity 的 Bedside Bench,即一组 500 个经医生验证的临床病例上,Ember-1 在 Fireworks 新推出的 Specialized Intelligence Index 中创下新的每任务成本帕累托前沿。
Fireworks 还在两个客户的生产编码工作负载上做了实时 A/B 测试,两者均在质量相当的情况下实现每任务 token 减少约 35%。在公布的这次测试中,每任务输出 token 从 49.3K 降至 29.9K,推理 token 下降 71.3%,总 token 下降 39%;任务得分基本持平,Ember-1 为 0.753,K3 为 0.751;平均步数从 23.8 降至 21.4。目前已有一个客户在生产环境中使用 Ember-1。
在 Fireworks 平台上,Ember-1 的每 token 价格与 Kimi K3 相同:每百万 token 输入 3.00 美元、缓存输入 0.30 美元、输出 15.00 美元,节省完全来自生成更少的 token。按该输出价格折算,上述 A/B 数据对应每任务输出成本约为 0.74 美元对 0.45 美元,该计算由原文作者给出,且仅计输出部分。