据科技媒体SiliconANGLE报道,谷歌已在云平台上线两款文本转语音模型Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,并将二者一并纳入其音频处理模型产品线。
两款模型的应用程序接口高度相似,便于开发者并行调用。其中Flash-Lite TTS针对成本效率和推理速度做了优化,Flash TTS则以更高的价格提供更好的音频质量,谷歌设想客户将其用于有声书制作等任务。二者在启动阶段的差异还包括语言支持范围:Flash TTS可生成130种语言的语音,Flash-Lite TTS支持101种。
两款模型均可调用一个包含2000多种预制音色的声音库,开发者可用自然语言提示创建自定义音色,并可调整AI说话者的音色、口音和语速。第二种定制方式是基于一段30秒的音频样本生成合成语音,谷歌要求开发者在此前取得说话人的同意。该公司还计划后续加入第三种定制方式,即通过修改某一个预制音色来生成新声音。
在语音表达上,开发者可以为脚本的每一行添加演讲提示,模型据此生成非词汇发声、节奏变化等音频元素。谷歌使用名为SynthID的技术在AI生成的语音中嵌入音频水印,该水印人耳无法察觉,但可被AI检测工具识别;此外,每个生成的音频文件都附带一份C2PA记录,注明文件的生成时间、此后是否被修改等信息。
谷歌采用初创公司Hume AI开发的音频质量基准对两款新模型进行评估,Flash TTS和Flash-Lite TTS分列第一和第二位。在Voice Arena的多个语种版本上,这两款模型的表现也超过了若干竞品,该基准依据人类反馈衡量文本转语音算法的输出质量。谷歌员工Leland Rechis和Alan Cowen在博客文章中称,这些模型使创作者、开发者和企业能够打造更丰富、更具表现力的音频体验,同时改善Gemini Notebook和Google Vids等产品中的用户体验。
Flash TTS和Flash-Lite TTS是谷歌更广泛的音频处理模型阵容的一部分。此前,该公司已发布针对语音智能体、转录和翻译优化的算法。