谷歌8月28日推出Gemini 3.5 Transcribe语音转文本模型,并为Gemini Notebook新增从Google Play Books导入电子书的功能,使其AI工具链覆盖语音转写与知识管理两大场景。
据MarkTechPost报道,Gemini 3.5 Transcribe包含两个API端点:流式端点gemini-3.5-transcribe-live通过Live API提供实时双向流式转写,非流式端点gemini-3.5-transcribe通过Interactions API处理预录音频。据称平均词错误率流式4.0%、非流式2.6%,由Artificial Analysis测评;最终转录时间比前代模型Chirp 3缩短70%。该模型支持85种以上语言自动检测,并能处理句中代码切换。
两个端点功能不同。Live API支持亚秒级连续转写,但连续会话最长10分钟,不支持说话人分离和词级时间戳。Interactions API支持说话人分离、词级时间戳和自定义词汇表,标准请求可处理1小时音频,启用分离或时间戳后处理时长降至30分钟。模型提供verbatim和smart两种转写模式:verbatim保留所有词汇,smart去除语气词并整合口头自我修正,但smart模式不能与词级时间戳或说话人分离组合。
该模型仅通过API提供,无开放权重和自托管路径。据MarkTechPost,批量处理成本约为每分钟0.005美元,实时约每分钟0.009美元。开发者可通过Google AI Studio免费层使用,中等规模团队付费层保证内容不用于改进谷歌产品,受监管企业可通过Gemini Enterprise Agent Platform获得更高吞吐量和合规控制。目前两个端点均处于公开预览阶段。Live API已接入LiveKit、Pipecat、Agora等开发框架,消费者端支持Android上的Rambler、macOS上的Gemini应用和Google Antigravity,Chrome即将支持。
另据Android Authority报道,谷歌与作者合作,通过Gemini Notebook(原NotebookLM)的“Expert Intelligence”选项,用户可导入自己拥有的Google Play Books电子书。该功能允许在单个笔记本中组合多本书的见解,并可使用音频概览(Audio Overviews)和信息图表(Infographics)等功能。谷歌此前因使用版权文本训练AI面临法律纠纷,此次合作提供了一条正式付费的渠道。