谷歌公司9月15日发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款语音模型,称其针对语音人工智能代理的延迟问题设计,可在接近实时的条件下完成推理,并同时处理语音与思考。据美国科技媒体SiliconANGLE报道,这是谷歌迄今发布的最先进语音处理模型。
谷歌在一篇博客文章中说,新模型能够在与用户保持自然对话节奏的同时,在后台执行第三方软件的工具调用和应用程序接口调用。这意味着人工智能代理可以一边与用户交谈,一边处理刚刚接到的任务,用户不会频繁看到代理中断对话去检索信息,通话体验因而更接近真人。
基准测试方面,谷歌称Gemini 3.8 Live Extended Thinking在Artificial Analysis语音对话质量指数上取得82.6分的新高,超过GPT-Live-1-Astra和Grok Voice Think Fast 2.0。Gemini 3.8 Live在另一项Speech Agent Arena基准中排名第二,在ServiceNow的EVA-Bench中排名第一;Extended Thinking在T-Voice、T-Voice-banking和Big Bench Audio上的得分分别为68.6%、35.1%和97.7%。
功能上,两款模型均支持自动语言检测和对话中途切换语言,可理解并生成97种语言的语音,支持接近实时的视觉定位,并能用“让我查一下”这类提前给出的口头提示回应用户。谷歌还说,生成的音频文件会带有不可见的SynthID水印,可用于识别虚假信息。
可用性方面,Gemini 3.8 Live已通过Gemini API和Google AI Studio开放,并在Gemini Enterprise和Search Live中以企业私有预览形式提供。Extended Thinking的渠道相同,另外还进入Google Workspace的Docs、Gmail和Keep(面向订阅用户)以及Gemini Live应用。开发者可通过Vercel、Agora、LiveKit、Pipecat、Fishjam和Vision Agents等谷歌合作平台将模型集成到自己的应用中。
价格方面,谷歌称标准版Gemini 3.8 Live音频输入每分钟0.005美元,输出每分钟0.018美元;Extended Thinking版本还对推理token以及视频、文档等额外输入计费。