据雷峰网报道,9月15日,阶跃发布新一代语音大模型StepAudio 3系列,一次性推出StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型,覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。其中多款模型在第三方AI模型评测机构Artificial Analysis榜单中位列全球第一。
StepAudio 3 Realtime面向实时语音交互,支持原生全双工对话,可在持续交流中判断何时回应、何时等待,并处理临时打断和连续反馈。该模型在Artificial Analysis Conversational Dynamics榜单中以98.9%的综合得分排名全球第一。与主要追求低延迟和自然对话的传统实时语音模型不同,StepAudio 3 Realtime还加入语音推理和任务执行能力,能同时理解语义、语气、情绪及环境声音,支持推理与语音生成并行;Tool Call和长任务可异步执行,任务运行期间不打断当前对话。该模型在Artificial Analysis Speech Reasoning榜单中同样位列全球第一。
语音识别方面,StepAudio 3 ASR将高精度识别与大语言模型的上下文理解和知识能力结合,在“听清楚”之外提升对专业术语、人名、地名、方言及复杂上下文的理解能力。该模型支持中文、英文、方言、中英混说、长音频和专业领域等场景,并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在Artificial Analysis非流式语音识别准确性榜单中,StepAudio 3 ASR的词错误率为1.7%,并列全球第一。词错误率越低意味着转写错误越少。
语音生成方面,StepAudio 3 TTS面向真人级语音生成,在音色、语调、节奏、停顿和情绪表达之外,还能生成笑声、迟疑、重复、改口等副语言表现。该模型采用流式生成架构,可生成与播放同时进行,满足实时语音应用需求。StepAudio 3 Gen将人声、音效、环境声和背景音乐等原本分散的生成环节整合在一起。用户可通过自然语言描述角色、场景和剧情,一次生成包含多种声音元素的完整音频,并控制角色音色、情绪以及不同声音出现的时间与顺序,适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。
面向音乐创作的StepAudio 3 Music不再局限于“一句话生成一首歌”,支持歌曲创作、清唱配乐、歌曲翻唱以及基于ABC记谱法的多轮交互创作。用户可通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代。报道称,过去一年语音大模型正从单项语音识别和生成能力,逐渐走向实时交互、声音理解与内容创作的融合竞争;随着StepAudio 3系列发布,阶跃音频模型产品版图已覆盖听、说、理解、推理和创作。目前,StepAudio 3系列五款模型均已上线阶跃星辰开放平台。