据 MarkTechPost 与 Android Authority 报道,Google 于 9 月 23 日发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,并将 Google Vids 向个人 Google 账户和 Workspace 账户开放,用户可免费生成 1080p 视频。新 TTS 模型通过 Gemini API 和 Google AI Studio 提供,Vids 将在不久后加入 Gemini 3.8 Flash-Lite TTS 用于配音。

据 MarkTechPost 报道,Google 将新 TTS 拆分为两个层级。Flash TTS 面向深度创意指导和角色设计,目标用途包括游戏、沉浸式有声书、播客和互动媒体,可对表演提示、节奏、方言转换和反馈性插话进行细粒度控制。Flash-Lite TTS 面向高吞吐、低成本生产,定位用于配音、音频内容创作和语音智能体,可控制语气、节奏和表达细节。两款模型都允许开发者用自然语言逐行指导语音表达,Google 称它们是迄今最具表现力的音频生成模型。

两款模型正通过 Gemini API 和 Google AI Studio 推出,仅提供 API 访问,不开放权重供自行托管。MarkTechPost 称,Gemini Enterprise 的企业 API 访问列在“即将推出”。此前 Gemini TTS 提供 30 个原创声音,3.8 版本转向更大语音系统。Flash TTS 可根据描述角色、口音和声音特征的提示词生成新声音,覆盖 100 多种语言和方言;Google 演示包括墨尔本 DJ、单调机器人和日本龙。开发者还可使用 2000 多个生产就绪声音,覆盖墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。自定义声音可保存和重复使用,项目间漂移较小;声音重混即将推出,可通过提示词调整声音库中声音的音色、音高、速度和口音。

两款模型可接受写在脚本中的舞台指示,也能根据自然脚本线索调整表达。MarkTechPost 称,长音频生成中,语音质量、节奏和音色可在连续数小时音频中保持稳定;单条脚本可驱动双说话人多轮对话,并保持声音分离。非语言提示音可增加对话质感,|mhm| 和 |yeah| 等积极倾听插话可控制反应节拍和喜剧时机。

声音复制功能可从 30 秒音频样本建立一致声音轮廓。样本必须是用户自己的声音或用户有权使用的声音,复制还需声音所有者录制口头同意,并与参考说话人匹配。MarkTechPost 称,Gemini Audio 模型的每个片段都带有 SynthID 水印,复制声音还带有 C2PA 内容凭证。该报道还称,声音复制在 AI Studio 中无法在包括英国、欧洲经济区和印度在内的多个地区使用。

基准测试方面,MarkTechPost 称,Hume AI Voice Design Benchmark 中 Flash TTS 以 71.4 分排名第一,口音建模以 60.8 分领先;Hume AI Overall Quality Index 中 Flash TTS 第一,Flash-Lite TTS 第二。Voice Arena 盲测偏好中,两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语中占据前列。

另一则 Android Authority 报道显示,Google Vids 在 2024 年推出时面向专业人士,即便访问权限扩大到 Gemini for Workspace 客户之外,这款 AI 视频生成器仍被锁定在订阅计划后。Google 近几个月逐步放宽,今年早些时候让免费用户试用。现在,Google 宣布将最新 AI 模型集成到 Vids,包括 Gemini Omni 1.1 Flash-Lite;任何拥有个人 Google 或 Workspace 账户的用户都可以使用最新 Omni 模型免费生成 1080p 视频。Google 还将在 Vids 中推出 Gemini 3.8 Flash-Lite 文本转语音,用于配音。同一篇报道的摘要写的是 Gemini Omni 1.1 Flash,正文写的是 Gemini Omni 1.1 Flash-Lite,具体模型名称存在不一致。