据MarkTechPost在2026年10月4日发布的报道,德国企业Aleph Alpha发布开源权重混合专家模型Kolibri,面向德语和英语,总参数78.1B,每token仅激活3.46B,占比4.4%。该模型支持最高1,048,576个token上下文,可按请求设置推理强度,并以Apache 2.0许可证在Hugging Face发布,目标是在公共管理、工业和航空航天等受监管领域实现主权部署。
Kolibri的FP8检查点约78GB,可在单张B200、B300或H200上运行,也可在两张H100 SXM5 GPU上运行,通过vLLM服务,并配有专门的推理和工具调用解析器。Aleph Alpha称,该模型由德国团队端到端开发,控制数据、架构、训练基础设施、后训练和评估全流程,训练在德国和芬兰的基础设施上进行。其设计面向欧盟《通用人工智能实践准则》、欧盟《人工智能法案》和《通用数据保护条例》;公司是该准则签署方,数据管道在训练前会删除个人数据。
架构上,Kolibri堆叠50个transformer块,宽度2,560。每个MoE层用sigmoid路由器为384个路由专家评分,每个token发送给前6个专家,并始终运行1个共享专家;专家负载通过Exact Quantile Balancing和Load-Error Injection平衡。注意力采用分组查询注意力,48个查询头和4个KV头。每五个块使用无位置编码的全注意力,其余40个块使用带RoPE的滑动窗口注意力,窗口覆盖前512个token。滑动窗口层保持固定大小KV缓存,因此只有10层会随上下文增长。Aleph Alpha称,在同等计算量下,该混合注意力支持的序列长度是全注意力模型的4倍。
分词器方面,128,000词表使用UniBPE训练。据该报道,Kolibri在德语文本上达到每token 4.90字节,而GPT-5分词器为4.35字节,意味着德语网络文本减少11.2%的token;英语为4.58字节,GPT-5为4.67字节。
训练上,预训练在768块NVIDIA B200 GPU上覆盖20T token,随后以65,536序列长度进行3.44T token中期训练;长上下文阶段在262,144 token序列上训练201B token。Aleph Alpha还加入超过2T从网络整理或合成的德语token。后训练结合监督微调、MergeMix以及超过1.2M内部任务上的强化学习,并通过Merlin-Arthur协议训练模型在检索上下文不支持答案时弃答。
评估方面,Aleph Alpha对每个模型使用相同设置。据MarkTechPost报道,Kolibri英语GPQA Diamond得分84.3,AIME 2025得分96.9,AIME 2026得分96.0;英语智能体平均分63.4,与Qwen3.5 35B-A3B持平,但在BFCL v4上以61.4落后于后者的70.5。密集模型Qwen3.8 27B总体得分更高,英语80.2、德语79.9,但每token激活参数约为Kolibri的8倍。与内部前代Kolibri Origin相比,Kolibri每GPU解码文本量约为2.7倍,英语得分高出21.4分。
报道列出的对比显示,Kolibri-1总参数/激活参数为78.1B/3.46B,Qwen3.6 35B-A3B约为35B/3B,Nemotron 3 Super为120B/12B,Mistral Small 4为119B/6.5B。Kolibri总体得分英语75.5、德语70.8,英语代码平均分89.3;其德语行业RAG平均分67.5,高于Qwen3.6的65.8、Nemotron 3 Super的57.6和Mistral Small 4的53.4。
部署上,用户可安装aleph-alpha-inference包,再用vLLM服务。默认上下文262,144 token;如需完整1M窗口,需传入--max-model-len 1048576并覆盖max_position_embeddings。推理强度通过chat_template_kwargs设置。Aleph Alpha推荐temperature 1.0、top-p 0.97和top-k 128。