据MarkTechPost报道,Kyutai发布Voice of Reason,包括两个开放权重的语音到语音模型,可直接用语音解答数学题。模型从GLM-4-Voice-9B出发,加入监督微调与强化学习,流程中不需要语音转写,也没有独立文本大模型参与,在口语GSM8K上的准确率从基座的27.3%提升到77.1%。

两个检查点分别名为glm-4-voice-of-reason-9b和glm-4-voice-of-reason-stitch-9b。前者直接回答,不生成额外推理标记,任何分步演算都以语音说出;后者在语音块之间写入100个标记的静默推理块。Kyutai表示,后续推理块可在前段语音播放时生成,因此思考不会增加额外延迟。材料称,此处采用的STITCH-R布局中,第一个推理块出现在第一个语音块之前。

Kyutai称这是首次将强化学习应用于语音原生模型的数学推理。材料指出,语音转文本、文本大模型、文本转语音的级联流程在推理上仍占优势,但每一级都会增加延迟,并丢失语气等副语言线索。语音原生模型必须按固定间隔输出音频以保持交互性,这限制了它能负担的隐藏推理标记数量。基座GLM-4-Voice在GSM8K上得分为27.3%,此前的STITCH方法通过加入推理块把它提升到58.7%。

训练分两阶段。GLM-4-Voice的输出交错进行,先13个文本标记,再26个音频标记,循环重复。第一阶段SFT使用Orca-Math的150,616道题,Qwen3-235B把每道题改写为适合语音的形式,Kyutai的DSM TTS再用多种声音朗读。仅SFT就把GLM-4-Voice从27.3%提升到61.7%。第二阶段RL对每个口语问题采样4个回复,温度0.9;裁判Qwen3-235B-A22B-2507根据解码文本给出二元奖励,且从不查看参考答案。在100个手工检查案例中,裁判与人类一致率为88%。奖励在每个组内中心化,形成组相对REINFORCE目标,与GRPO相关,但去掉了PPO裁剪和KL正则化。训练在16张H100上进行,共1500次RL更新。

两项设计选择最关键。其一是温度校正:在损失函数的log-softmax之前,把logits除以采样温度;若不这样做,GSM8K会从65.5%崩至12.3%。其二是音频标记合并:在每个音频位置,把所有音频词表概率求和为1个抽象标记,损失只问下一个是否为音频,而不问是哪个音频标记。论文证明,在值不变假设下,该估计量无偏且方差更低。

论文报告的成绩使用top-k 50解码、3个随机种子平均。直接版Voice of Reason为65.5%±1.1,发布检查点为70.3%;Stitch版为74.8%±1.1,发布检查点为77.1%。去掉top-k后分别得到70.3%和77.1%,发布检查点对应这组运行。作为更大模型的上限参考,Qwen2.5-Omni文本输出7B为84.7%,Qwen3-Omni文本输出30B为94.6%,级联ASR-LLM-TTS-ASR的31B LLM为95.7%;Kyutai指出这些并非匹配比较。PersonaPlex全双工8B为3.2%,GLM-4-Voice 9B为27.3%,STITCH为58.7%。

其他发现包括:用Qwen3-ASR-1.7B转写后,Stitch模型在真实语音上仍有72.0%±1.9%;RL后UTMOSv2自然度从4.067变为4.069(直接版)、从4.174变为4.164(Stitch版);RL并未让答案变长,直接版平均回复时长从41.9秒降到36.4秒,Stitch版推理标记仅从167增至176。使用10%的SFT数据时,更长RL运行达到58.5%,仅SFT为43.9%。直接版口语TriviaQA从40.6%降至34.0%,作者主要归因于全量数据SFT,而非RL。

在污染检查中,团队从评估中移除了AddSub、MultiArith、SingleEQ和SVAMP;在678个被检查问题中,54.0%与Orca-Math在转述层面重叠。评估音频来自GPT-4o-mini-TTS,与训练音频所用TTS不同;GPT-4o担任评估裁判。部署方面,两个模型可自托管,BF16检查点可在单张H100上运行,但还需要GLM-4-Voice仓库提供语音分词器和解码器。权重沿用GLM-4-Voice许可证,目前尚无Hugging Face推理提供商托管这些权重。两个9B检查点已在Hugging Face开放。