Meta于9月1日发布其首个实时音频模型Muse Voice Transcribe。据Engadget报道,该模型可同时处理20多名说话人的听写与转写,并能无缝切换多种语言,还能识别句中的“语码转换”。

Meta首席执行官马克·扎克伯格在X平台上分享了演示视频,显示转录能够自动区分多名说话人,在语言之间切换,并转写混用多语言词汇的句子。他解释,模型会自行判断何时听取,遇到困难词语等待稍长一些,对简单词语更快提交,通过自适应延迟预测每一个词元以提高准确率。模型在70多种语言上训练,发布时有25种语言通过验证,可处理20多名说话人、时长一小时的会话。

Meta发布该模型不到一周前,谷歌也推出了具备类似能力的音频模型Gemini 3.5 Transcribe。谷歌正将其音频模型集成到Android和Chrome,而Meta尚未明确是否会在旗舰服务中整合Muse Voice Transcribe。

目前用户可在Meta新发布的Meta AI Mac应用中体验该模型能力。由于Mac应用能为其他应用提供语音功能,Muse Voice Transcribe将支持其他服务中的听写功能。开发者也可在Muse Code和Meta Model API中使用该模型,价格为每1000个音频分钟3美元。Meta研究博客还提供了Muse Transcribe的演示版本。

Muse Voice Transcribe是Meta超级智能实验室(MSI)的最新发布。过去几周,该实验室还推出了首个专用编码代理、一个开放权重模型,以及上述Meta AI Mac应用。