据TechRadar 9月23日报道,Vambo AI和Tether AI Research先后发布面向非洲语言及离线场景的人工智能模型。Vambo AI的MORENA以15亿参数覆盖12种非洲语言,并称在非洲语言任务上超过更大模型;Tether的AfriSLM和EuroNano无需联网,可在手机或笔记本电脑本地运行。
MORENA覆盖尼日利亚皮钦语、伊博语、约鲁巴语、豪萨语、斯瓦希里语、奇绍纳语、祖鲁语、科萨语、基尼亚卢旺达语、茨瓦纳语、南非荷兰语和恩德贝莱语,并支持英语、法语和代码。开发方称其比谷歌、Meta、阿里巴巴和HuggingFace的模型更小,却能在非洲语言建模和翻译上胜出。关键基准中,MORENA得1.408 bpb,为26个受测模型最佳;最接近的Lugha-Llama-8B参数多五倍,得1.423 bpb,在12种语言中的8种落败。12B Gemma消耗约11倍算力但得分更弱。
Vambo AI称,MORENA训练前即固定分词器、数据配比和语言列表。相同文本下,其词表表示非洲语言所需token比Gemma 3少1.39倍,比Llama 3.2少1.53倍;但非洲文本每字节仍比英语多用约6% token,团队无法完全解释。模型预训练使用2517亿token,中期训练630亿token,开发耗逾2.2万A100 GPU小时,计算资源价值约4万美元,并获UNDP、AIHub4SD和CINECA支持。
除15亿参数主模型,Vambo AI还发布5亿和2亿参数版本。5亿版据称在12种语言中的11种超过所有外部受测系统;2亿nano版用于语音识别重打分、键盘和文本规范化,每字节成本比Lugha-Llama-8B低58倍,单张A100每秒生成104个token,并有可在笔记本离线运行的CPU版本。
同一天刊发的另一篇TechRadar报道中,Tether AI Research发布离线翻译系统QVAC TranslatePsy-AfriSLM和EuroNano。AfriSLM覆盖19种非洲语言,含豪萨语、阿姆哈拉语、约鲁巴语、斯瓦希里语、祖鲁语、索马里语等,Tether称合计覆盖非洲约50%人口,指语言覆盖范围而非用户数。该模型有8亿参数,Tether称其超过Qwen3.5-122B-A10B、TranslateGemma-27B和NLLB-3.3B;测试使用FLORES-200、BOUQuET和SMOL,但基准表现不等于实际场景结果。公司称筛选时剔除多达96%的不合适材料,并发布0.8B、2B和4B配置。
EuroNano以英语为中介,连接90条欧洲语言翻译路径,占用36MB,Tether称比可比的Firefox离线方案少约94%存储。Tether表示,对非洲语言的投入与其在撒哈拉以南非洲的太阳能信息亭有关,这些站点提供手机充电、电池更换和数字金融服务,未来可分发本地翻译的教育和农业内容。首席执行官Paolo Ardoino称,语言不应决定谁能从人工智能中受益,开放翻译模型可让教育和AI工具触达缺乏可靠连接或无力承担昂贵系统的人。AfriSLM已上线Hugging Face,相关研究被EMNLP 2026接收。