据MarkTechPost报道,总部位于巴黎的语音人工智能公司Gradium近日推出Voice Design功能。该功能允许用户仅凭一段最多500字的文字描述,在数秒内生成全新的合成语音,无需参考音频、无需真实说话人,也无需处理授权和许可问题。Gradium由人工智能研究实验室Kyutai孵化而来,这项语音设计工具已通过Gradium API和Studio向用户开放,所有付费和免费套餐均可使用。用户最终保存的语音与目录中的既有语音一样,通过同一个流式文本转语音端点运行,延迟和输出格式均保持一致。
在Gradium的语音设计中,文字描述是唯一的输入条件。其文档列出了系统会响应的属性,包括性别、年龄段、口音或来源、音高、语速、能量、音色与共鸣、语气与风格,以及该语音所执行的任务。目前描述语言支持英语、法语、西班牙语、葡萄牙语和德语。每次请求可返回1至5个候选语音,通常在3至5秒内生成;这些候选是同一角色的变体,若要塑造不同角色,应当修改描述,而非增加采样次数。
从候选语音到正式语音,需要经过四步API调用:先生成候选ID,再轮询嵌入状态,然后通过普通文本转语音端点试听,最后将选中的候选转换保存。候选语音在转换前存在三条限制:试听文本上限为100字符,仅能通过REST方式调用,且不支持TTS WebSocket和语音转语音。未转换的候选会在30天后自动删除。转换操作免费,并占用一个与声音克隆功能共享的自定义语音槽位,免费套餐提供5个槽位,付费套餐提供1000个。采样过程刻意采用非确定性设计,每次请求都会扩展描述,因此即使提示文本和随机种子完全相同,生成结果也会不同。
Gradium公布了一项盲听对比测试结果:在六个可通过公开API访问的语音设计系统、五种语言合计7627次比较中,Voice Design的获胜率为72.6%,高于ElevenLabs的59.0%,其余参测系统为Inworld、Fish Audio和MiniMax。Gradium称其在全部五种语言中均位列第一,优势最大的是地区口音类别。另一个模型评委在相同提示集上得出的排名与盲听结果一致。Gradium产品页面还称,其在学术基准InstructTTSEval英文子集上的提示遵循率为83.4%。需要注意的是,上述评测数据均由厂商自行设计并执行。