🔥 今日值得一读 口语数学准确率从27.3%飙到77.1%!Kyutai开源语音原生模型,单张H100就能跑
Kyutai Releases Voice of Reason: A Speech-Native Model that Solves Spoken Math with Reinforcement Learning
MarkTechPost 🔥 重点 多模态开源论文方法大模型 🕐 今天 14:33

📖 AI 总结

Kyutai发布了两款开放权重的语音到语音模型Voice of Reason,可直接通过语音解答数学题,无需转录步骤或独立文本大模型参与。模型基于GLM-4-Voice-9B,经过监督微调与强化学习两阶段训练。在口语版GSM8K测试中,准确率从基座的27.3%提升至77.1%,其中监督微调阶段贡献至61.7%,强化学习进一步拉升。研究团队称这是首次将强化学习应用于语音原生模型的数学推理。训练数据来自Orca-Math的15万余道题,经Qwen3改写并由自研TTS合成多语音频;强化学习阶段采用组相对REINFORCE目标,由Qwen3担任评判,与人工判断一致率约88%。两个BF16检查点可在单张H100上自托管运行,权重沿用GLM-4-Voice许可。该工作表明,语音原生模型无需依赖级联管线也能在推理任务上取得显著进步。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅