🔥 今日值得一读 Gemini 3.5 Transcribe来了!语音转文字更聪明,准确率飙升!
Intelligent transcription with Gemini 3.5 Transcribe
Google DeepMind Blog 🔥 重点 多模态商业化 🕐 08-27 01:01

📖 AI 总结

Gemini 3.5 Transcribe 是谷歌推出的最新语音转文本模型,旨在提供高精度、智能化的实时转录服务。该模型能直接将原始音频转换为整洁、格式化的文本,有效处理背景噪音、专业术语和语音自我修正,并自动清除“嗯”“啊”等填充词。其核心优势包括:支持流式与非流式两种API,流式延迟低于一秒,适合交互式语音应用;非流式则提供说话人分离和词级时间戳,适用于会议和通话分析。据评测,该模型在流式场景下平均词错率(WER)为4.0%,非流式场景为2.6%,在嘈杂环境中表现稳健,并能准确识别邮政编码等字母数字实体。此外,它支持自定义词汇和函数调用,可委派图像生成等任务给其他Gemini模型。目前,该模型已集成于Gemini应用和Android系统,开发者可通过Gemini API、Google AI Studio等平台使用。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅