Nari Labs 于 9 月 14 日在 Hacker News 的 Show HN 板块发布并开源了针对 Qwen3-TTS 与 Qwen3-ASR 的专用推理引擎,据该公司称,其 Qwen3-TTS 端点在 Coval 语音 AI 基准测试中准确率(WER)排名第一、延迟排名第二,同时是测试名单中价格最低的端点。

该推理引擎的代码托管在 GitHub 的 nari-labs/nari-qwen3-tts 仓库。发帖人、Nari Labs 的 Toby 表示,系统在每秒 10 次请求的负载下延迟低于 50 毫秒,这一结果表明开源模型可以运行得比外界一般认为的更快、更便宜。

Toby 在帖子里回顾说,Nari Labs 去年推出 Dia,称这是首个能够进行自然对话的开源文本转语音模型。此后公开的语音模型数量明显增加,但他认为市场仍由闭源模型主导,问题出在推理环节:vLLM、SGLang 等现有系统并不适合多模态推理。为此团队专门为 Qwen3-TTS 构建了推理引擎并对外开源,随后又将这一服务扩展到更广的语音模型托管。

按照帖子给出的基准结果,在 Coval(YC S24)的语音 AI 测试中,其 Qwen3-TTS 端点与 11Labs、Cartesia 等闭源服务同场比较,延迟排第二、准确率排第一,价格则是所有端点中最低的。语音识别方面,其 Qwen3-ASR 端点延迟最低,准确率排第二,与第一名相差 0.1%,价格在榜单上列第二低。Toby 称,要做到速度、效果和成本兼顾,需要不少推理工程上的处理。

帖子还提到一项对比差异:Toby 称阿里巴巴的官方端点在准确率和延迟两项上的表现都不及 Nari Labs 的端点,但他同时感谢 Qwen 团队将这些语音模型开源。上述性能与价格排名均为 Nari Labs 单方面公布的说法,基准测试的完整方法与复现条件未在帖文中给出。

关于后续计划,Toby 表示目标是继续把价格压低,让语音技术成为一种通用能力,使每个应用都能用上文本转语音和语音识别而无需担心单位成本。他还提到团队正在做说话人分离(diarization)等音频领域的其他环节,以及视频和世界模型推理,并称后续会有更多进展公布。