Google 于 9 月 15 日发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,即日起在 Gemini Live API 和 Google AI Studio 上线,面向生产级语音智能体。两款均为托管模型,不提供开放权重,也没有自托管方案。

据 Google 介绍,这两款模型是原生语音到语音模型,属于上月发布 Gemini 3.5 Transcribe 之后进一步扩展的 Gemini Audio 系列。Google 称其针对的是一类具体缺口:语音智能体在推理和执行工具调用时不打断对话流。Google 将二者定位为串联 ASR、LLM 与 TTS 的级联式语音流水线的替代方案。两款模型分工不同:Gemini 3.8 Live 侧重规模化与成本效率,结合对话智能、流畅对话和视觉接地能力;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,在说话的同时进行多步推理。

基准测试方面,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的语音到语音质量指数上以 82.6 分位列第一,在 τ-Voice 上以 68.6% 领先智能体任务完成度,在 Sierra 的 τ-Voice-banking 上得分 35.1%,在面向音频模型的推理基准 Big Bench Audio 上得分 97.7%。Gemini 3.8 Live 在人类偏好评测 Speech Agent Arena 中排名第二。Google 表示,在 ServiceNow 的 EVA-Bench 上,两款模型在 Gemini Enterprise Agent Platform 上通过 Live API 测试时,在任务准确率与对话质量之间推动帕累托前沿。

开发者能力方面,Live API 在新模型中开放五项核心能力。异步函数调用让模型在后台执行 API 与工具调用,任务完成期间音频回复持续向用户流式输出;视觉上下文使模型近乎实时处理实时视觉输入,理解用户所说的内容与看到的画面;字母数字精度用于准确解析确认码、理赔编号和技术数据,这是语音系统常见的出错环节;多语言支持可在对话中途自动检测并在 97 种支持语言之间切换,同时保持口音一致;增量内容更新则把实时音频与结构化数据合并,返回贴合上下文的回应。Extended Thinking 另增可配置的思考能力,用于后台多步推理,它一边推理一边说话,先用“让我查一下”之类的早期口头提示确认收到指令,再在长时间任务执行过程中逐步说明进展。Google 的演示显示,该模型能把草图加语音反馈转换为可用的 React 组件,并协调多步预订流程。

价格与生态方面,两款模型音频输入为每分钟 0.005 美元,音频输出为每分钟 0.018 美元。Google 称这一估算基于每百万输入 token 3 美元、每百万输出 token 12 美元。开发者也可通过 Live API 集成伙伴构建应用,这些伙伴负责实时媒体流基础设施,包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents。Google 还与 Salesforce、Genspark 和 Lumeris 合作,三家公司提到了模型的延迟、流畅度和工具调用能力。示例应用已在 GitHub 发布。所有生成的音频都带有 Google DeepMind 的 SynthID 不可感知水印。