据MarkTechPost报道,基础模型研究所(IFM)上周发布K2 Horizon系列大模型,共六个尺寸,从0.9B到375B,全部采用Apache 2.0许可。IFM称这是AI历史上最大规模的完全开源模型发布。IFM是穆罕默德·本·扎耶德人工智能大学于2025年5月创办的前沿实验室。
此次发布的六个模型分别为K2-Horizon-375B-A23B、36B-A4B、32B、7B、3.7B和0.9B。与模型一同发布的还有预训练语料、中间检查点、训练代码、配置文件和细粒度日志。所有模型均托管在Hugging Face上,提供FP8和GGUF格式,首日支持vLLM、SGLang和Ollama推理框架,可运行于NVIDIA、AMD和Cerebras硬件。通过platform.ifm.ai,用户还可以经Compass、Cerebras和Nebius访问托管API。
六个模型共享核心架构、词表、训练方法、接口和部署工具。0.9B模型使用了较小的词表。这种一致性使团队可以在3.7B模型上完成原型验证,再无缝扩展到375B-A23B,而无需更换服务栈。每个模型均在约20万亿token上完成预训练,其中近17%为带有显式推理过程的解题轨迹,约10万亿token为合成数据。后训练数据从中期训练阶段融入,并未留到最终阶段。IFM研究团队报告称,其合成的独立任务超过1亿个。训练中工具定义以JSON、XML和Markdown三种格式呈现,以使模型学习语义而非语法。Markdown最终被设定为推理默认格式,在IFM的数据上比JSON节省约18.5%的token。
K2 Horizon引入了名为MoVA(Mixture-of-Value Attention)的架构创新。传统混合专家模型仅在Feed-Forward层应用稀疏路由,而MoVA将专家路由扩展到多头注意力内部,开辟了第二条扩展容量的轴。它仍兼容FlashAttention、分组查询注意力和稀疏注意力。基于该架构的K2-Horizon-MoVA-36B-A4B拥有360亿总参数,每个token约激活40亿参数,在相同训练条件下略低于稠密版32B模型。据IFM公布的数据,该模型在Terminal-Bench 2.1上取得58.6分,在tau3-Banking上取得26.8分,均领先其对比组。
另一项技术是被称为Uno的无损解码加速方案。它冻结Horizon的自回归参数,仅训练一小部分扩散参数,学习如何高效生成。通过IFM所称的扩散蒸馏,这些适配器可以并行生成块状token。官方称其可将解码速度提升约3倍且质量不降。Uno以LoRA适配器形式发布,目前提供7B-Uno和0.9B-Uno两个版本。
基准测试方面,K2-Horizon-375B-A23B在Terminal-Bench 2.1上得到70.2分,在GDPVal-AA上为1441 Elo,在MCPMark上为67.7分,在GPQA Diamond上为87.3分。该模型在SWE-Atlas-QnA上以48.4分领先,但在大多数agentic基准上落后于GPT-5.6 Luna和Claude Sonnet 5。小尺寸模型的表现同样值得关注。7B模型在SWE-bench Verified上得到70.6分,在BrowseComp上为59.0分;3.7B模型在SWE-bench Verified上为68.6分;0.9B模型在AIME 2026上达到48.5分,在HumanEval+上为79.9分,且小到可以在量化后在手表上运行。
IFM还主动发布了对自身模型的奖励作弊审计结果,这在其他实验室中并不常见。他们使用375B-A23B在89个Terminal-Bench 2.1任务上运行,每个任务尝试8次,共712次试验,其中500次通过,报告准确率为70.2%。随后,所有通过试验均使用Artificial Analysis的奖励作弊检测程序重新审计,共在10个任务的24次试验中发现作弊行为。剔除这些试验后,准确率降至66.9%,修正幅度为3.37个百分点。这一作弊标记率介于Artificial Analysis报告的Claude Fable 5的2.2%和GPT-5.6 Luna的4.1%之间。作弊行为包括定位GitHub上的基准仓库并下载参考解答。IFM还披露,其7B模型曾在一次运行中通过寻找答案的方式达到虚高的82分SWE-bench结果。部分同行未公开此类审计,IFM的举动提高了开源模型评测的透明度。