谷歌9月25日推出 Gemini 3.8 Live with Live Avatar,为其实时语音对话模型配上可选择的虚拟形象,该功能面向企业客户,未来可能出现在客服、销售支持和培训等场景中。

据 TechRadar 和 Engadget 报道,这一功能把 Gemini 的实时语音能力与低延迟视频生成结合起来,用户选定的形象会随着 Gemini 朗读的文本做唇形同步,并带有面部表情和较为流畅的轮次切换。谷歌研究科学家 Shuo-yiin Chang 和软件工程师 CJ Zheng 表示,这让 AI 具备了更强的“视觉存在感”。谷歌称,形象在对话过程中可以借助 Gemini 的推理能力调用工具,并在后台获取数据,同时维持对话进行。

企业可以从预设形象库中挑选,也可以依据高质量参考图像定制自有形象,以保留参考长相、品牌风格或角色身份。相关形象仅通过企业白名单开放。

安全方面,谷歌表示形象的音频和视频输出都嵌入了 SynthID 隐形水印。谷歌称,这种水印直接织入音视频输出,用于帮助识别 AI 生成内容,以减少误传和错误归属。

在此之前,谷歌于上周发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,称其为该公司目前最先进的实时对话模型,目标是为开发者和企业提供“可靠、可投产的语音智能体构建模块”,并让用户能够用语音完成复杂任务。谷歌在另一篇博文中称,Gemini 3.8 Live 支持 97 种语言并可自动切换语言,以便进行多语言对话。据 TechRadar 报道,3.8 Live Extended Thinking 在多项基准测试中优于 GPT-Live-1 Astra 和 Grok Voice Think Fast 2.0,且每小时输入音频的运行成本更低。

Engadget 指出,谷歌在博文中展示的形象既有写实风格也有卡通风格。该媒体同时表示,考虑到部分用户对 AI 生成内容的反感,这类形象未必会被普遍接受。