据MarkTechPost报道,Sarvam AI于9月26日发布第四代语音识别模型Saaras V4,覆盖22种印度附表语言和英语,并纳入全球英语口音。该模型即日起通过Sarvam API提供,调用参数为model=“saaras:v4”;权重未公开,Sarvam的SageMaker自托管文档目前仍只覆盖Saaras v3。

Saaras V4采用编码器-解码器结构。音频编码器把波形转换为携带语音和声学细节的嵌入,时间下采样适配器随后缩短序列并投影到语言模型嵌入空间,使长录音处于解码器上下文预算内。解码器为Sarvam-3B,是Sarvam内部从零训练的30亿参数混合状态空间语言模型;它读取音频特征和文本提示后自回归输出转写,并把每个生成的词元反馈为下一步输入。

基准测试方面,Sarvam用7个英语数据集评估Saaras V4,其中6个来自Hugging Face开放ASR榜单,另一个是AI4Bharat带印度口音的Svarah。Sarvam称,在参与对比的模型中,Saaras V4取得最低平均词错误率。在Vistaar上,该公司报告了10种印度语言的词错误率和LLM-WER;LLM-WER加入语义检查,用于区分真实语义错误与印度文字中常见的拼写或格式差异。在Kathbath Noisy上以LLM-WER衡量,Sarvam称其错误率不到Deepgram Nova-3和GPT-4o Transcribe的一半,该数据集包含压缩、削波和背景噪声较重的录音。语言识别方面,在经核验的IndicVoices语句上,前10种印度语言识别错误率为2.9%,全部22种为5.22%。上述数字均由厂商提供,独立复现尚未公布。

同一模型可通过mode参数输出5种结果:transcribe为默认,使用本地文字并归一化数字和日期;verbatim保留每个口语词、填充词和口播数字;codemix保留本地文字但英文单词仍用英文;translit把整句转为拉丁字母;translate输出英文翻译并归一化数字。Sarvam称,把这些处理放在模型内部可减少后处理步骤叠加的错误。

V4新增关键词语提示功能,仅适用于saaras:v4。用户可在keyterms下传入JSON列表,最多50个词,每个词最长64个字符。这些关键词用于偏置识别,并不保证出现在输出中;如果品牌名如PhonePe必须保持拉丁字母,应使用codemix模式。在IndicContextEval(Interspeech 2026论文)的L5关键词提示设置中,Saaras V4报告16.03%的词错误率,Sarvam称这是该基准上的最低分。

部署方面,WebSocket流式支持部分结果,首词元时间低于150毫秒;REST同步转写支持最长30秒片段;批处理异步任务单文件最长2小时,可选说话人分离。SDK支持Python 3.9+和Node.js 18+,并集成LiveKit Agents、Pipecat和Vercel AI SDK。Sarvam列出的语音转文本价格为实时、流式和批处理每小时30印度卢比,带说话人分离每小时45印度卢比。Saaras v3仍是默认模型,V4请求结构与v3相同,切换只需改一行。

Sarvam还把Saaras V4与Deepgram Nova-3、ElevenLabs Scribe v2和OpenAI GPT-4o Transcribe对比,数据来自各厂商公开文档和定价页。按这些材料,Saaras V4覆盖22种印度附表语言、总计23种语言;Deepgram Nova-3为11种印度语言、总计45种以上;ElevenLabs Scribe v2为14种印度语言、总计90种以上;OpenAI GPT-4o Transcribe未按语言列出,标为多语言。