据 MarkTechPost 报道,Sakana AI 于 9 月 11 日发布 Sakana Fugu 系列的两款新模型 Fugu Max 与 Fugu Ultra v2。两者共用同一套编排架构,Fugu Max 以单位成本产出为目标,Fugu Ultra v2 面向高难度多步任务追求最高能力。两款模型当天起通过 Sakana 兼容 OpenAI 的 API 提供托管服务,不开放权重供自行部署,也不在欧盟及欧洲经济区提供该服务。
Fugu 并非单一基础模型,而是一个学习型编排器,在单一 API 背后把任务分发给多个模型组成的池子。Sakana 对这套设计的解释是,真实工作负载的评判同时取决于能力与成本,把一次简单的数据查询交给数万亿参数模型只会浪费预算,系统应当挑选仍能解决问题的最便宜工具。该公司用帕累托前沿描述这一点:在前沿上提升质量要付出更多成本,压缩成本则损失质量。两款新模型共用同一核心编排架构,差别只在优化目标。
Fugu Max 扩大了可编排的模型池,加入大量开放权重与专用模型,其中通过 Sakana 与 NVIDIA 的合作纳入 NVIDIA Nemotron 系列。它把每个任务路由给足以解决该任务的最精简模型。据 Sakana 公布的数据,Fugu Max 定价为每百万输入 token 2 美元、每百万输出 token 6 美元,输出价格比 Sonnet 5、GPT 5.6 Terra 与 Kimi K3 低 40% 至 60%;在 Terminal Bench 2.1、GPQA Diamond、AA-LCR、GDP.pdf、AutomationBench 与 SWEFish 六项基准上取得最佳总体得分,并在十项基准中的七项扩大了成本性能帕累托前沿。Sakana 称其以低 2 至 6 倍的成本接近顶尖模型水平。SWEFish 是 Sakana 基于自有编程题构建的内部基准,该结果属于厂商信号。
Fugu Ultra v2 面向复杂推理、自主研究与全栈软件开发,在视觉与结构化数据上的持续推理提升最为明显。据 Sakana 公布,它在 Chartography 上得分 48.3,Opus 5 为 27.3,Fable 5 为 29.5;在 DeepSWE 上得分 74.3,领先每 token 价格高 3 至 5 倍的模型。它在八项基准中的五项为最佳或并列最佳,包括 GDP.pdf、Chartography、SWEFish、DeepSWE 与 Toolathon,并在八项中的七项进入前二。Fable 5、Fable 5.1 与 GPT-6-Astra 不在 Fugu Ultra v2 的智能体池中,该模型的训练截止日期为 2026 年 8 月 28 日。
Sakana Fugu 的技术报告把 Fugu 模型描述为本身就是语言模型,读取查询后即时构建智能体脚手架,训练结合大规模微调、进化算法与强化学习,并建立在两篇 ICLR 2026 论文之上:TRINITY 使用轻量进化协调器在多个回合中分配 Thinker、Worker、Verifier 三种角色;The Conductor 通过强化学习发现自然语言协调策略与聚焦提示。按 Sakana 公布的时间线,Fugu 于 4 月进入测试,6 月正式可用,7 月增加 Fugu-Cyber 与 Claude Code 接口。研究团队称,这一路径减少了对单一专有模型的依赖,从而降低供应商锁定、API 吊销与突然停止服务的暴露。