🔥 今日值得一读 85种语言实时转文字,口误自动纠正!谷歌Gemini 3.5延迟暴降70%
Google's Gemini 3.5 Transcribe turns speech to text in 85 languages while auto-correcting your verbal stumbles
The Decoder 🔥 重点 多模态大模型语音识别 🕐 08-27 18:40

📖 AI 总结

Google 发布了 Gemini 3.5 Transcribe,这是一款面向实时转录的语音转文本模型,支持超过 85 种语言的自动识别。该模型能自动去除“嗯”等填充词、纠正口误,并自主完成文本格式化。据 Google 数据,其流式转录的词错误率为 4.0%,录音音频为 2.6%,延迟较前代 Chirp 3 降低 70%。模型还支持函数调用,可将图像生成或网页搜索等任务转交给其他 Gemini 模型处理。该模型提供两种接口:Live API 用于低延迟实时流式处理,Interactions API 则处理带说话人标注和时间戳的录音音频。目前,Gemini 3.5 Transcribe 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 上线,并集成至 Android 版 Gboard 和 macOS 版 Gemini 应用中,Chrome 支持即将推出。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅