据MarkTechPost于9月11日报道,Cohere已发布开放权重机器翻译模型North Small Translate,称其在覆盖50种语言的WMT26评测中平均得分83.6。该模型采用218B总参数、25B激活参数的稀疏专家混合架构,是Cohere North家族首个翻译模型。

该模型覆盖从阿尔巴尼亚语到越南语的50种语言。Cohere称其表现超过DeepL和Google Translate,也超过GLM 5.2、Mistral Large 3等开放选项。其部署方式包括在Cohere API上按速率限制免费调用、非商业自托管,以及商业授权。Cohere与RWS合作,后者的Language Weaver科学家和语言专家参与塑造模型的实际质量。按Cohere的多语言产品线,该模型紧随Tiny Aya和Command A Translate。

Cohere在X的发布帖中将翻译视为“主权”议题,称无法进行全球沟通的组织无法保持主权。2017年,谷歌研究人员以《Attention Is All You Need》提出Transformer,主要结果来自WMT 2014英语到德语、英语到法语的翻译。9年后,Cohere用专用模型回到这一原始问题。

据该报道,North Small Translate是仅解码器稀疏MoE Transformer。它包含128个专家,每个token激活8个,另有应用于每个token的共享专家。路由器对专家logits做sigmoid,并在选出的top-k上归一化。注意力由滑动窗口层(窗口4096,RoPE)与不含位置嵌入的全局层按3:1交错组成,这一布局最早出现在Command A。上下文为16K输入和16K输出,仅支持文本,后训练专门针对翻译质量。约11.5%的权重在每个token激活,单token计算跟随25B激活参数,但内存仍需容纳全部218B。

Cohere博客给出的WMT26全语言得分为:Agentic版84.36,标准版83.60,Qwen 3.5 397B A17B为81.56,DeepL NextGen为81.37,Gemma 4 31B为79.46,GLM 5.2 FP8为76.50,Google Translate为68.20。Agentic版运行多轮流程,发现并修正自身错误。Cohere将80至100分视为完美或仅有小错。报道同时说明,这些是Cohere自行运行的评测,由GPT-5.6-Sol担任评委,在独立WMT26结果出现前应视为厂商报告数据。区域表现上,两个版本在欧洲均超过Gemma 4 31B;欧盟语言标准版得82.17,Gemma为72.73。南亚得分接近,North为86.16,Gemma为88.04。Cohere测试中,模型在低并发相同硬件上每秒生成112个输出token,Gemma 4 31B为81;高并发为39对30,Cohere称吞吐最高提升1.4倍。长文档方面,一次调用翻译两章书得48.9分,Google Translate为21.3,Gemma 4 31B为19.4,质量按段落用xCOMET-XL衡量。成本方面,模型得80.1分,每任务0.000676美元,平均661个token;Gemini 3.1 Pro Preview(high)每任务0.038928美元,约为其58倍;Qwen 3.5 397B A17B为0.004525美元,Command A+为0.005158美元。

使用时,最快路径是Cohere Chat V2 API,模型在速率限制内免费。自托管方面,Cohere发布3个checkpoint,并称与生产环境相同:BF16可在4块B200或8块H100上运行,FP8可在2块B200或4块H100上运行,NVFP4 W4A16可在1块B200或2块H100上运行。报道将4位checkpoint列为可在1块B200或2块H100上运行。