Google发布了Gemini Audio系列新模型,包括Gemini 3.5 Live、3.5 Live Experimental和全新的3.5 Transcribe,旨在提升语音转写精度。3.5 Transcribe是本次更新的亮点,支持超过85种语言,能自动识别专业术语和自定义词汇,并去除“um”“uh”等填充词,实现自然语音编辑。该模型还具备多说话人识别(最多三人)和词级时间戳功能,显著优于前代Chirp 3,尤其在多语言表现和词错率方面。值得注意的是,此次发布正值用户等待Gemini 3.5 Pro模型之际,后者原定于6月推出但至今未上线。新模型强化了Google在语音AI领域的竞争力,但3.5 Pro的延迟仍引发外界关注。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅