据Hugging Face博客消息,阿布扎比技术创新研究所(TII)2026年10月7日发布Falcon-ASR。这是一个16亿参数的语音识别模型,主要面向阿拉伯语,尤其关注阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。模型支持词级时间戳,可将转写中的每个词对应到音频中的位置。
在阿拉伯语评测中,Falcon-ASR在六个阿拉伯语测试集上的平均词错误率(WER)为20.92%,平均字符错误率(CER)为8.79%。博客称,其对比的是ELM研究中心维护的Open Universal Arabic ASR Leaderboard在2026年9月30日检查的已发布平均成绩,该榜单按六个测试集的等权平均WER排序,数值越低越好。在同一榜单快照中,已发布的最佳结果为23.17%,Falcon-ASR比该结果低2.25个百分点。榜单中,Audar-ASR-V1-Turbo为23.17%,Cohere Transcribe Arabic(2026年7月)为25.87%,omniASR LLM 7B为28.32%。
针对阿联酋语音,Falcon-ASR在TII内部评测中取得22.73%的WER和10.19%的CER,为所比较系统中最低。该结果比排名其后的Qwen3-Omni-30B-A3B-Instruct低4.07个百分点,后者WER为26.80%。其他对比系统包括Audar-ASR-V1-Turbo、Cohere Transcribe Arabic(2026年7月)、Qwen3-ASR-1.7B-hf、Audar-ASR-V1-Flash,WER分别为27.89%、31.05%、31.52%和32.87%。博客称,公开评测数据中的Casablanca已包含阿联酋子集,TII还用额外阿联酋和海湾语音进行内部评测,使用留出录音和人工验证转写来评估公开子集之外的转写准确率。
Falcon-ASR的训练数据包括阿联酋方言、现代标准阿拉伯语、其他海湾和阿拉伯语方言以及英语。博客称,目标是转写人们日常使用的词语,包括方言形式和语言切换。训练中加入了背景噪声、重叠语音、音乐、房间混响、电话效应,以及语速和音高变化,并对阿联酋录音采用相同处理,以覆盖会议、通话和其他日常录音条件。
除阿拉伯语外,Falcon-ASR使用同一组模型权重转写英语。在Hugging Face Open ASR Leaderboard使用的七个公开英语测试集上,其平均WER为5.74%。其中LibriSpeech clean为1.75%,LibriSpeech other为4.21%,SPGISpeech为2.02%,VoxPopuli为3.87%,GigaSpeech为8.15%,AMI为8.33%,Earnings-22为11.86%。模型还支持法语、西班牙语和葡萄牙语,五种语言共用同一权重,无需语言标记,输出为所说话言的转写文本。Falcon-ASR基于TII此前的Falcon3-Audio工作,相关架构和训练方法见论文《Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data》。
用户目前可在Hugging Face Demo Space中试用Falcon-ASR,体验其转写能力。博客称,API访问和原生应用已在计划中,并邀请用户用自己的录音测试该演示。