微软人工智能(Microsoft AI)于2026年10月1日发布MAI-Transcribe-2-Streaming,这是该公司首款流式语音转文字(STT)模型,同时推出的还有两款语音合成模型MAI-Voice-2.1和MAI-Voice-2.1-Flash。在Artificial Analysis的流式语音识别评测中,该模型在最终转写和首个部分转写两项准确率上均排在38款模型首位,面向语音代理、实时字幕和听写等对延迟敏感的场景。
MAI-Transcribe-2-Streaming是2026年9月发布的批处理模型MAI-Transcribe-2的实时版本。它支持60种语言,可连续自动检测语言。音频持续输入的同时,文字在说话人尚未结束讲话时即开始回传。模型在收到音频后100毫秒出头即给出被称为partial的首次假设,随后随上下文增加不断修正,最终提交稳定的转写结果。微软团队称,其内部测试显示词出现的速度比最接近的竞争对手快一倍。这意味着语音代理可以在句子尚未说完时就开始推理或调用工具。
据Artificial Analysis的AA-WER Streaming指数,测试使用约8小时音频,构成为AA-AgentTalk(50%)、VoxPopuli(25%)和Earnings22(25%),延迟由SileroVAD检测的语音结束时刻起算。该模型最终转写词错率为2.5%,在语音结束后0.13秒给出,位列38款模型第一;首个部分转写同样为2.5%词错率,用时0.12秒,也排名第一。紧随其后的Grok Voice Transcribe 2.0为2.7%、0.49秒,Muse Voice Transcribe为3.1%、0.16秒。速度最快的并非该模型:Cartesia Ink-2(外部端点)可在0.07秒返回最终结果,但词错率为4.0%。首个部分转写的准确率与最终转写相同,这对需要在说话人讲完之前就采取行动的代理具有重要意义。微软同时将该模型置于准确率与延迟的帕累托前沿。
在对比数据中,Grok Voice Transcribe 2.0由xAI于2026年9月18日发布,Muse Voice Transcribe由Meta Superintelligence Labs于9月1日发布,Gemini 3.5 Transcribe Live由谷歌于8月26日发布,后者在Artificial Analysis评测中的词错率为4.0%,该机构未列出其出最终结果的时间。说话人分离方面,Muse Voice Transcribe支持20人以上,Gemini的Live模式不支持,微软未就此说明;四款模型均未公开权重。
价格方面,MAI-Transcribe-2-Streaming为每音频小时0.54美元,属2026年底前的推介价,Artificial Analysis折算为每1000分钟9.00美元。批处理版MAI-Transcribe-2为每小时0.10美元。在流式场景中,微软的定价高于xAI的每小时0.20美元和Meta的每小时0.18美元,与谷歌约每小时0.54美元的估算水平大致相当。
集成方面,微软给出两条路径:已经使用兼容OpenAI Realtime的WebSocket的应用可采用Realtime API,Azure Speech SDK则负责连接管理、重试与音频流传输,两者都返回中间结果和最终结果。模型还可在MAI Playground、Vercel和Azure Voice Live中使用,LiveKit支持标注为即将推出。微软将它与MAI-Voice-2.1-Flash搭配组成完整语音回路,后者以150毫秒端到端延迟生成45秒音频,价格为每100万字符15美元;MAI-Voice-2.1覆盖23种语言和26个区域,价格为每100万字符22美元。该模型目前以公开预览形式提供,没有服务等级协议,也未开放权重。