Gemini 3.5 Transcribe 是谷歌推出的最新语音转文本模型,旨在提供高精度、智能化的实时转录服务。该模型能直接将原始音频转换为整洁、格式化的文本,有效处理背景噪音、专业术语和语音自我修正,并自动清除“嗯”“啊”等填充词。其核心优势包括:支持流式与非流式两种API,流式延迟低于一秒,适合交互式语音应用;非流式则提供说话人分离和词级时间戳,适用于会议和通话分析。据评测,该模型在流式场景下平均词错率(WER)为4.0%,非流式场景为2.6%,在嘈杂环境中表现稳健,并能准确识别邮政编码等字母数字实体。此外,它支持自定义词汇和函数调用,可委派图像生成等任务给其他Gemini模型。目前,该模型已集成于Gemini应用和Android系统,开发者可通过Gemini API、Google AI Studio等平台使用。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅