据Hugging Face博客9月23日发布的文章,英伟达推出一款开源权重说话人分离模型Nemotron 3 Diarization,参数量为1亿,在Voice Arena的Diarization-Bench首轮榜单中排名第一,分离错误率(DER)为14.72%。
说话人分离识别的是“谁在什么时间说话”,与自动语音识别配合后,可以生成带说话人归属的转写文本。文章举例说,一份会议、客服通话或播客的转写即使每句话都准确,如果没有任何一句标注说话人,读者就无法判断谁做出了承诺、谁提出了异议、谁打断了别人,检索、摘要、行动项、对话分析和语音智能体记忆的效果都会打折扣。
该模型支持最多8名说话人,适用于实时和录制对话,能够处理重叠语音,支持按块处理以适应不同长度的录音,并允许自定义流式延迟。此前的NVIDIA Streaming Sortformer已确立这一技术路线,支持4人分离,其diar_streaming_sortformer_4spk-v2.1检查点被用作对比基线。Nemotron 3 Diarization把支持人数扩展到8人,并在准确率和吞吐量上有所提升。
流式场景的难点在于保持说话人归属的连续性。离线模型可以一次检视整段录音,流式系统每次只拿到一小段新音频和有限上下文,如果缺少有效的记忆机制,当前音频块中分配给某个输出通道的说话人,可能在下一块被分配到另一个通道。Nemotron 3 Diarization沿用Sortformer的做法,按说话人首次出现的时间排列输出通道:第一个新声音为第一通道,第二个为第二通道,依次类推,从而使通用标签保持稳定,无需为每个音频块重新求解说话人排列。
训练数据方面,该模型使用公开和授权语音数据,其中包括从David AI授权的多人标注真实对话。另有David AI授权音频用于生成覆盖21种语言的大规模模拟英语和多语种混合素材。文章称,将David AI数据加入训练后,复合分离错误率在离线式和超低延迟两种工作点上都下降了0.77个百分点,从11.19%降至10.42%。
模型输出的8个说话人通道属于匿名标签,并非真实身份。它可以报告“说话人2”在某段时间内说话,但不能判断说话人2具体是谁。下游应用可通过把时间戳与会议元数据、用户画像或活跃说话人验证模型结合,将这些匿名通道编号映射到具体身份。
架构上,模型接收16kHz单声道音频,转为帧移10毫秒的梅尔频谱特征,再按8倍堆叠为80毫秒帧,输入带旋转位置嵌入(RoPE)的31层Transformer编码器。编码器之上的一层Conv1D把预测上采样到输入特征分辨率,默认输出为[T, 8]浮点张量,即T个时间步乘8个可能的说话人通道,每个数值表示该时刻该说话人处于活跃状态的概率,默认步长为10毫秒,也可配置为10毫秒的其他倍数。这种表示方式可以自然处理语音重叠:两人同时说话时,同一帧内可有两个通道处于活跃状态。流式推理时,到达顺序说话人缓存(AOSC)按到达顺序通道保存此前音频块中说话人的信息,先进先出(FIFO)队列则提供上下文。