据MarkTechPost报道,SpaceXAI于9月19日发布语音转文字模型Grok Voice Transcribe 2.0,其开发团队称该模型在价格与1.0版本持平的情况下准确率提升一倍。模型已以托管API形式上线,模型ID为grok-voice-transcribe-2.0。
该模型面向的是难度较高的音频,包括嘈杂的电话线路、多人同时说话、地方口音以及口述的账号密码。它可通过Speech to Text API以批量与实时流式两种模式运行。SpaceXAI没有公布开放权重,因此用户无法自行部署。据该团队介绍,模型基于支撑Grok Voice的音频基础模型构建,Grok Voice目前每天处理数万通客户支持通话,还负责转写数百万小时的视频解说,并在特斯拉车辆中运行Grok助手。训练数据为在多种环境下录制的真实、嘈杂、多语言音频,此后团队通过后训练对模型进行了优化。
基准测试方面,SpaceXAI称该模型在Artificial Analysis公开榜单的32个流式模型中准确率排名第一。该榜单的AA-WER Streaming评测使用约8小时音频,权重为AA-AgentTalk占50%、VoxPopuli占25%、Earnings22占25%。SpaceXAI还在取自生产流量的4个内部数据集上测量词错误率,分别覆盖8千赫兹的英语客户支持通话、与Grok的英语对话、英语口述的电话号码邮箱与地址,以及19种语言的语音助手短句。团队称2.0版本在这4个数据集上均优于1.0,在电话场景中领先其测试过的所有模型。上述内部结果由厂商自行报告,未经第三方复现。
多语言转写是该模型的一项重点能力。它可以转写数十种语言并自动识别语种,还能在一次处理中跟随录音中途的语言切换。SpaceXAI团队称多语言准确率是相比1.0版本提升最大的部分。车载指令这类短句可供模型判断语种的上下文很少,在这一数据集上,词错误率从20.6%降至6.8%,相当于词错误减少约67%。文档列出了25种语言支持数字、货币和单位的书面形式格式化。
开发者可用的功能均在同一API中提供:批量与流式转写,支持文件、链接以及通过WebSocket在wss://api.x.ai/v1/stt传输音频;词级时间戳,包含每个词的起止时间与置信度;说话人分离,不额外收费;最多8个声道的独立转写;关键词偏置,每次请求最多100个领域词、每个词不超过50个字符;将数字、日期、货币、电话号码和邮箱按书面形式返回;默认移除“um”“uh”等填充词;以及面向语音代理的智能轮次检测,由机器学习模型预测说话结束。批量接口接受最大500MB的文件,覆盖12种音频格式;流式接口支持约4KB/s的Opus,而24千赫兹原始PCM为48KB/s。
定价与1.0版本一致:批量转写每小时音频0.10美元,流式转写每小时0.20美元,说话人分离、时间戳和关键词功能均包含在内,折算约为每1000分钟1.67美元和3.33美元。调用方式为向https://api.x.ai/v1/stt 发送POST请求,并显式指定model=grok-voice-transcribe-2.0。
Atlassian旗下的Loom已采用该模型转写所有视频。Atlassian发现它比原有方案更准确。SpaceXAI描述的工作流是录制、转写、编码:用户在Loom中录下一段行动计划,转写文本被送入Cursor,由后者完成代码更新。Atlassian团队协作产品集合高级副总裁Sanchan Saxena将其形容为“从上下文到代码的闭环”。