据9to5Mac报道,Meta于9月1日发布其首个实时音频感知模型Muse Voice Transcribe。该模型支持多语言流式转录,已经为Mac上的Meta AI、Muse Code以及通过Meta Model API为开发者提供实时语音转文字能力,并在Mac上实现系统级听写。

Meta Superintelligence Labs称,Muse Voice Transcribe将流式自动语音识别、说话人分离和端点检测结合。它能够在语音发生时同步转录,区分录音中20多个说话人,并判断对方是否已经说完,整个过程无需单独的后处理步骤。

该模型使用了超过70种语言的数据进行训练,发布时已有25种语言通过验证。它支持超过一小时的音频,并原生支持句内或句间的代码切换。语言、关键词和上下文偏置功能可进一步提升识别准确度。

在速度与准确度的权衡上,Muse Voice Transcribe并非采用固定的折中方案,而是自行决定在确认每个词之前需要听取多长时间,Meta将其称为“自适应延迟”。该系统处理清晰语音时反应更快,遇到困难词汇时则调用更多音频上下文。Meta表示,截至9月1日,该模型在Artificial Analysis的流式语音转文字排行榜上排名第一。

Muse Voice Transcribe今天通过Meta Model API提供,价格为每1000音频分钟3美元,折合每小时0.18美元。它同时已经为Mac上的Meta AI和Muse Code提供听写功能。在Mac上,用户可按住Fn键在任何应用中开始听写。