据MarkTechPost报道,Cartesia公司于8月18日发布实时文本转语音模型Sonic-3.6。该模型在Artificial Analysis的两个语音竞技场中均排名第一,其中提供者语音榜Elo评分为1283,受控语音榜Elo评分为1123。受控语音榜将每个模型克隆到相同的八个参考音色上,因此更能反映合成引擎本身的性能,而非音色库的差异。

这距Sonic-3.5发布约三个月,新版本在自然度上有所提升。Sonic-3.6基于状态空间模型而非Transformer架构。Cartesia称其首音频时延低于90毫秒,而其语音识别模型Ink-2的转录时延为100毫秒。这些均为厂商声明的模型时延,并非端到端实测往返时间。

Sonic-3.6以测试版形式提供托管API,不开放自托管权重,属于闭源商业模型。定价方面,Artificial Analysis将Sonic 3.6标准化为每百万字符49美元,约为ElevenLabs Eleven v3的一半;Cartesia本身按积分销售,Scale套餐每月299美元约含10667分钟语音和15个并发请求,Line语音代理另按每分钟0.06美元计费。免费版和Pro版(每月5美元)面向个人开发者和初创公司。

Sonic-3.6支持在转录文本中直接插入[laughter]等非语言表情标签、约10秒音频即时克隆音色、自定义发音字典(含IPA覆盖)、通过API和LiveKit Agents插件调节语速、音量和情感。原生字母数字支持可正确读出订单号、电话号码和确认码。演示展示了英语中的自然停顿和填充词,以及印地语与英语混合的Hinglish码转换。

当前该模型仅在Cartesia API上提供测试版,文档仍将Sonic 3.5列为稳定版,合作伙伴也仍搭载3.5版本。