Google 发布了 Gemini 3.5 Transcribe,这是一款面向实时转录的语音转文本模型,支持超过 85 种语言的自动识别。该模型能自动去除“嗯”等填充词、纠正口误,并自主完成文本格式化。据 Google 数据,其流式转录的词错误率为 4.0%,录音音频为 2.6%,延迟较前代 Chirp 3 降低 70%。模型还支持函数调用,可将图像生成或网页搜索等任务转交给其他 Gemini 模型处理。该模型提供两种接口:Live API 用于低延迟实时流式处理,Interactions API 则处理带说话人标注和时间戳的录音音频。目前,Gemini 3.5 Transcribe 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 上线,并集成至 Android 版 Gboard 和 macOS 版 Gemini 应用中,Chrome 支持即将推出。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅