微软AI于2026年10月1日发布其首个流式语音转文字模型MAI-Transcribe-2-Streaming,同时推出两款文本转语音模型MAI-Voice-2.1和MAI-Voice-2.1-Flash。该模型支持60种语言的自动连续检测,可在收到音频后约100毫秒内输出首个部分转录结果,并随上下文不断修正,最终生成稳定文本,使语音智能体能够在说话者尚未说完时即开始推理或调用工具。据微软内部测试,其出词速度约为最接近竞品的两倍。在Artificial Analysis的流式评测中,该模型以2.5%的词错误率和0.13秒延迟在38个模型中位列第一,首个部分转录同样达到2.5%词错误率和0.12秒延迟,均排名第一,领先于Grok Voice Transcribe 2.0和Muse Voice Transcribe。其定价为每小时音频0.54美元,为2026年底前的 introductory 价格。该模型的发布意味着实时语音转写首次在准确率与延迟之间同时达到领先水平,对语音智能体、实时字幕和听写等延迟敏感场景具有直接意义。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅