据科技媒体 Slashdot 9 月 25 日报道,谷歌已为其语音代理 Gemini 3.8 Live 推出名为“实时虚拟形象”(Live Avatar)的能力,宣称具备精准的唇形同步、自然的表情和流畅的轮流对话,主要面向需要“有吸引力的客户服务”或提供交互式导览的 Google Enterprise 企业账户。谷歌在发布公告时附带了演示视频。
据 The Verge 报道,谷歌除了提供一套预设虚拟形象供客户挑选,还允许机构自行创建形象。Slashdot 的报道同时援引了 YouTube 频道“AI with Surya”上展示的部分示例。
科技博客 Android Police 对这项能力提出保留意见。该博客文章称,即便不看虚拟形象,与计算机的对话也从未像一场真正的交谈。文章认为,这种体验最好时也不过像给电话客服或技术支持人员打电话——人们遇到问题才去找他们,他们帮忙解决而已。
文章进一步解释了背后的技术差异。GPT-Live 以及紧随其后的 Gemini Live 省去了把语音转成文字、再转回语音的中转环节,模型在同一系统内全程处理原始音频,输入和输出都不经过翻译。文章称,这听起来像是管线上的小细节,却是关键所在:去掉文字这一步,模型能在几分之一秒内作出回应,而不是人们已经习惯的那种停顿;同时模型能听到文字无法承载的信息,比如语气、迟疑,以及说话人是恼火还是在开玩笑。
该文作者描述了自己的测试过程:作者说话,模型回应;作者说得更快,模型答得也更快;作者换用另一种语言,模型跟着切换,即便在同一个句子里多次换语言也没有卡住。作者称最令人印象深刻的一幕是,当被问及“T-O-P-G-3-3-K”拼出什么时,模型立刻回答:“你在拼 Top Geek 这个词,但用数字 3 代替了倒过来的 E。”尽管反应迅速,作者表示全程都没有像是在和另一个人说话的感觉。
文章写道,Gemini 无法复制、也从未被设计去复制的是人与人之间的联结。作者称,与大型语言模型自然地交谈,反而放大了电话那头没人的感觉,它可能像一通电话那样流畅,但感觉并不像。
Slashdot 读者 MrBrklyn(编号 4,775)称,他曾与 Gemini 讨论“主流媒体为何回避报道屏幕依赖问题”,并最终让 Gemini 作出回应,称它只是“同一批科技巨头打造的又一个工具,目的是确保你依赖它们的系统来告诉你该想什么、该怎么说话,以及什么是真实的”。