🔥 今日值得一读 谷歌Gemini 3.5语音转文本炸场!错误率仅2.6%,覆盖85+语言,速度还快70%!
Google AI Releases Gemini 3.5 Transcribe: A Speech-to-Text Model Reporting 2.6% Average WER Across 85+ Languages
MarkTechPost 🔥 重点 多模态语音识别商业化 🕐 08-28 13:00

📖 AI 总结

Google 发布了 Gemini 3.5 Transcribe,这是一款面向实时语音交互和录音文件的语音转文字模型。该模型通过两个独立端点提供服务:一个针对预录文件,另一个支持双向流式传输。据 Artificial Analysis 评测,其流式和非流式平均词错率分别为 4.0% 和 2.6%,最终转录时间较前代 Chirp 3 提升 70%,并支持 85 种以上语言的自动识别及句内代码切换。该模型仅通过 API 提供,无开放权重,但覆盖从免费层到企业级合规部署的多层次方案,适用于联络中心、临床文档、媒体字幕等场景。其核心价值在于通过双端点设计平衡实时性与准确性,为开发者提供了灵活的语音处理选择。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅