据MarkTechPost报道,Gradium AI于2026年8月31日发布新版文本转语音(TTS)模型,并已设为API和Studio的默认模型。公司报告称,该模型在500句高难度评测集上的人工评分通过率为81.0%,首音频延迟中位数为216毫秒,两项指标均优于多个竞品。
该评测集覆盖英语、德语、法语、西班牙语、葡萄牙语五种语言,包含拼写、缩写、字母数字混合、日期、常规数字、大数及浮点数、电子邮件等七项原子标准,以及订单、IT工单、索赔三项复合标准。评分由独立母语者进行,句子须每个元素都正确完整才算通过。在对比测试中,Cartesia Sonic 3.6为75.1%,ElevenLabs v3 Conversational为65.4%,Fish Audio S2.1 Pro为49.5%,Inworld TTS 1.5 Max为46.5%。所有音频均于2026年8月用默认设置生成。
在Coval的TTS基准测试中,该模型P50首音频延迟为216毫秒,比被替换的模型快170毫秒;480次运行的p75-p25四分位距为30毫秒,是五个测试模型中最窄的。Cartesia Sonic 3.6的中位延迟为454毫秒,四分位距165毫秒。Inworld TTS 2中位延迟166毫秒,Fish Audio S2.1 Pro为291毫秒,ElevenLabs v3 Conversational为329毫秒。Gradium AI称其优势在于同时具备低硬案例失败率和低于250毫秒的首音频。此外,该模型无需文本归一化即可直接读取电话号码、电子邮件、IBAN和引用代码。
部署方面,现有用户无需任何迁移,现有声音包括自定义克隆均可继续使用。新团队可通过Python SDK接入WebSocket TTS端点,并复用现有声音ID。Gradium AI还在Discord上为完整硬案例失败报告提供100万积分奖励。
该评测集已在Hugging Face以CC BY 4.0许可证开源。需要指出的是,上述评测由厂商自行开展,但数据集公开可查。