🔥 今日值得一读 微软新模型实时语音转文字登顶第一!38个模型中夺冠,错误率仅2.5%,延迟0.13秒,覆盖60种语言。
Microsoft AI Releases MAI-Transcribe-2-Streaming: #1 Real-Time Speech-to-Text Model on Artificial Analysis
MarkTechPost 🔥 重点 多模态商业化大模型 🕐 今天 13:09

📖 AI 总结

微软AI于2026年10月1日发布其首个流式语音转文字模型MAI-Transcribe-2-Streaming,同时推出两款文本转语音模型MAI-Voice-2.1和MAI-Voice-2.1-Flash。该模型支持60种语言的自动连续检测,可在收到音频后约100毫秒内输出首个部分转录结果,并随上下文不断修正,最终生成稳定文本,使语音智能体能够在说话者尚未说完时即开始推理或调用工具。据微软内部测试,其出词速度约为最接近竞品的两倍。在Artificial Analysis的流式评测中,该模型以2.5%的词错误率和0.13秒延迟在38个模型中位列第一,首个部分转录同样达到2.5%词错误率和0.12秒延迟,均排名第一,领先于Grok Voice Transcribe 2.0和Muse Voice Transcribe。其定价为每小时音频0.54美元,为2026年底前的 introductory 价格。该模型的发布意味着实时语音转写首次在准确率与延迟之间同时达到领先水平,对语音智能体、实时字幕和听写等延迟敏感场景具有直接意义。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅