Meta发布了其首个实时音频感知模型Muse Voice Transcribe,旨在为AI助手提供不间断的语音交互基础。该模型将音频分解为80毫秒的片段,并针对每个词动态调整等待时间,在速度与准确性之间实现灵活平衡。它无需额外系统即可同时完成语音转写、区分最多20位说话者及检测句子边界,支持超过70种语言,并能在长于一小时的录音中保持实时处理。Meta通过强化学习训练模型优化延迟与错误率,定价为每小时0.18美元,低于OpenAI和ElevenLabs等竞争对手。该模型已在Meta AI和Meta Model API中提供,其多语言及代码切换能力被视为关键卖点,测试显示其在最终转写准确性上领先。这一发布标志着实时语音AI在成本、集成度和性能上的重要进展,为未来持续聆听的智能助手铺平了道路。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅