据科技媒体MarkTechPost报道,Meta超级智能实验室本周宣布推出Muse Voice Transcribe实时语音转写模型。Meta称这是其首个实时音频感知模型,可在单一自回归模型内同时完成流式语音识别、20余名说话人分离和端点检测,无需传统的后处理步骤。
传统语音产品通常将语音转写、说话人分离和端点检测交给三个独立系统,每次衔接都会增加延迟和错误风险。Muse Voice Transcribe将三项任务合为一体。该模型属于Muse Spark系列,音频以80毫秒为一个音频块输入,每个音频块转换成一个soft token;模型每处理一个音频块便自主决定是继续收听还是输出文字,从而在保持转录准确率的同时按词控制延迟,这被称为“自适应延迟”。Meta表示,强化学习将词错误率奖励与延迟奖励相乘,使模型在速度-准确率的帕累托前沿上领先于Soniox、Cartesia和ElevenLabs等系统。
对于说话人分离和端点检测,Meta并未使用额外模型,而是在同一数据流中增加特殊标记。<|start_of_turn|>用于标记可能的说话人切换,<|speaker_{A-Z}|>用于标识说话人;语音开始和结束则由<|speech_onset|>与<|speech_endpoint|>表示。训练中,这两项任务叠加在语音识别奖励之上与流式语音识别联合训练。该模型在70余种语言上训练,其中25种语言经过充分验证;支持句内和句间的语码转换,并能处理超过1小时音频。开发人员还可通过语言、关键词和上下文偏置进一步改善识别结果。
在性能上,Meta公布的数据显示,截至2026年9月1日,Muse Voice Transcribe在Artificial Analysis流式语音转文字测试和公共说话人分离基准中排名第一。在语音结束后0.16秒时,其最终转录词错误率为3.1%;在延迟0.13秒时,首个部分转录词错误率为3.6%。在AMI-IHM、AMI-SDM和VoxConverse测试集上,平均说话人错误率为17.5%,对比之下,另五个系统在21.1%至28.6%之间。定价上,该模型以托管API形式提供,收费为每1000分钟音频3美元,即每小时0.18美元,低于Cartesia Ink-2的每千分钟4美元和ElevenLabs Scribe v2 Realtime的6.5美元。
据同一报道,Muse Voice Transcribe已用于Meta AI for Mac和Muse Code的听写功能;但Meta未发布模型权重,用户只能通过Meta Model API调用,无法自托管部署。