谷歌 9 月 24 日推出 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款文本转语音模型,同时让 Google Docs 中的 Gemini 可以调用用户自己整理的 Gemini Notebooks 作为写作依据。据 Android Authority 报道,前者把 AI 配音从照稿朗读推进到可按脚本表演,后者则省去了在文档与笔记之间来回切换核对信息的过程。
谷歌在一篇博客文章中表示,Gemini 3.8 Flash TTS 可以依据自然语言描述生成全新的声音,支持超过 100 种语言和方言,并提供 2000 多种可直接投入生产的声音。用户还能对配音表现进行控制,涉及口音、语速、情绪,以及双人对话。声音复刻功能可从一段 30 秒的样本中重建出稳定一致的声音,谷歌同时说明,使用该功能需先取得声音本人的授权。
新模型正在进入 Gemini Notebook 和 Google Vids,两款模型也通过 Google AI Studio 与 Gemini API 向开发者开放。谷歌称,过去数周它已把 Gemini 3.8 从最初的 Gemini 3.8 Flash 扩展出 Live 与 Live Extended Thinking 等模型,这一次是让同一系列承担表演脚本的角色。
在文档一侧,谷歌同日宣布 Gemini Notebooks 可以作为 Google Docs 的上下文来源。用户把研究资料整理进 Gemini Notebook 后,可将其添加为 Docs 的素材来源,Gemini 在写作时会从中提取信息,使生成的回答有据可依。起草文档时它还会给出内联引用,用户无需切换到其他标签页即可核对事实。
在此之前,Gemini 在 Google Docs 中已能生成长文档的音频摘要、为文档补充图片、图表和示意图,并按用户的行文风格跨文档写作。此次更新把笔记本内已筛选过的来源直接接入写作流程,谷歌未在材料中披露该功能的上线范围与收费方式。