Google于8月26日发布Gemini Audio系列,包括Gemini 3.5 Live、3.5 Live Experimental和3.5 Transcribe三个模型,用于改善AI的实时对话与语音识别,相关能力已开始向macOS版Gemini应用、Android设备及开发者工具推送。
据Android Authority和TechRadar报道,Gemini 3.5 Live在中断处理、实时视觉识别、多语言混合及调用后台工具方面较上代改进明显。实验版则会在处理复杂任务时同步以语音说明推理步骤。Gemini 3.5 Transcribe是新增的转录模型,官方称其在多语言能力和词错率上相比上一代Chirp 3有显著提升,可识别85种以上语言,自动滤除“嗯”“啊”等填充词,还能学习用户自定义词汇和特殊拼写,并为最多三位说话人分配词级时间戳。
该系列模型已经集成到多个产品中。据The Verge,即日起macOS版Gemini应用将向所有用户以英语推送这些功能,Android端Gboard的Rambler听写功能在部分国家和语言上线,开发者则可在Gemini API及Antigravity平台使用。Google称Chrome支持即将到来,届时用户可在任意网页文本框中通过语音输入。
与此同时,Google扩展了Gemini Live的任务处理能力。据Android Authority报道,Live不再局限于对话,可通过Gemini Spark将自然语音请求转化为多步操作,并新增Daily Brief、免提Gmail管理和Personal Intelligence。Google表示,63%的Gemini用户会通过语音与助手交流,这是此番升级的直接原因。这些新功能的获取门槛不同,Spark仅向Google AI Pro及以上订阅用户开放,Daily Brief需要Google AI Plus及以上,部分功能可能仅限特定市场。
对于这种功能命名方式,TechCrunch评论文章提出了批评。文章认为,将Spark、Daily Brief等作为独立品牌并列,会让用户困惑于该用哪个界面,而这种把内部架构直接暴露给消费者的做法在AI行业普遍存在。评论还援引风险投资公司a16z投资合伙人Justine Moore的观点称,用户倾向于像发短信一样与AI打交道,而不是在多个应用和功能间切换。