据MarkTechPost报道,NVIDIA已发布开源权重说话人分离模型Nemotron 3 Diarization。该模型有1亿参数,可在离线录音和实时流式场景中追踪最多8名说话人,并处理多人同时说话的重叠语音。
模型已上架Hugging Face,采用允许商业使用的OpenMDW License 1.1,通过NVIDIA NeMo在Linux上运行,支持Ampere、Ada Lovelace、Hopper和Blackwell GPU。据MarkTechPost报道,自动语音识别(ASR)提供文字,却不说明每句话由谁说出;说话人分离输出每名说话人活跃的时间区间,再与ASR结果结合,生成带说话人归属的转录文本。会议工具、通话分析、播客流水线和语音智能体记忆等应用都依赖这一环节。
与此前支持4名说话人的Streaming Sortformer检查点diar_streaming_sortformer_4spk-v2.1相比,Nemotron 3 Diarization将上限提高到8人,面向多人同时说话的复杂音频。模型接受16 kHz单声道音频,支持.wav、.flac、.opus和.mp3格式。音频先转为10毫秒步长的梅尔频谱特征,再以8倍堆叠形成80毫秒编码器帧,由带旋转位置嵌入的31层Transformer编码器处理,随后Conv1D层将预测上采样回10毫秒分辨率,输出[T,8]张量,表示每个说话人的逐帧活跃概率。该设计可直接处理重叠,并按到达时间排序说话人,使流式分块中的标签保持稳定。流式处理使用到达顺序说话人缓存和FIFO队列;标签是匿名的,映射到真实身份需下游应用完成。
输入缓冲延迟等于(分块加右上下文)乘以80毫秒。离线风格配置缓冲延迟30.4秒,DIHARD III全集DER为12.73%,批处理32编译吞吐15113倍RTFx;低延迟配置为1.04秒、13.18%和865倍;极低延迟配置为0.64秒、13.28%和579倍;超低延迟配置为0.32秒、13.55%和292倍。该延迟不含计算、网络和ASR时间,0.32秒是最低推荐设置。
在Voice Arena最初的Diarization-Bench结果中,该模型在12个系统、17种配置中排名第一。测试覆盖139段英语对话,总时长约22小时;其DER为14.72%,排名第二的系统为19.3%,相对降低约24%。NVIDIA指出,Voice Arena完成Version 1评估后,这些结果可能变化。与1.04秒延迟下的4说话人基线相比,模型在全部8个评估条件下DER均下降,相对降幅从CALLHOME-Part2的9.0%到NOTSOFAR1 MHM的65.2%,未加权平均为41.0%。一项回退出现在30.4秒配置下的2说话人CALLHOME,DER从5.68%升至5.98%;全集CALLHOME-Part2仍从10.32%改善到9.10%。30.4秒配置吞吐达到15113倍RTFx,基线为2619倍。测试使用BF16,在NVIDIA RTX PRO 5000上配合torch.compile()完成,是批处理数据,不是单流应用延迟。
训练数据由约10000小时真实对话和82611小时模拟多人混合音频组成,包含从David AI授权的真实多说话人音频。加入该数据后,复合DER从11.19%降至10.42%,用于模拟混合的授权源音频覆盖21种语言。用户需安装支持Python 3.12或更高版本的NVIDIA NeMo Speech,并从nvidia/Nemotron-3-Diarization加载模型;输出格式为start end speaker_id,若还需文字,可按ASR集成指南与Parakeet TDT 0.6B v3配合。实时演示Space提供合成对话、实时麦克风、多语言实时麦克风和音频上传。