Meta Superintelligence Labs发布了Muse Voice Transcribe,这是一款将流式语音识别、说话人分离(支持20+人)和端点检测整合为单一自回归模型的实时音频感知系统。传统语音处理需串联三个独立系统,而该模型通过80毫秒音频块输入和软令牌机制,在统一解码循环中完成听写,无需后处理。模型通过强化学习训练,结合词错误率与延迟的乘法奖励,实现按词难度自适应调整延迟,在准确性与响应速度间取得帕累托最优平衡。目前该模型仅以托管API形式提供,定价为每千分钟3美元,已应用于Meta AI for Mac和Muse Code的听写功能,但未开放权重,无法自托管部署。这一设计简化了语音处理管线,降低了多系统衔接带来的延迟与故障风险。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅