Google 发布了 Gemini 3.5 Transcribe,这是一款面向实时语音交互和录音文件的语音转文字模型。该模型通过两个独立端点提供服务:一个针对预录文件,另一个支持双向流式传输。据 Artificial Analysis 评测,其流式和非流式平均词错率分别为 4.0% 和 2.6%,最终转录时间较前代 Chirp 3 提升 70%,并支持 85 种以上语言的自动识别及句内代码切换。该模型仅通过 API 提供,无开放权重,但覆盖从免费层到企业级合规部署的多层次方案,适用于联络中心、临床文档、媒体字幕等场景。其核心价值在于通过双端点设计平衡实时性与准确性,为开发者提供了灵活的语音处理选择。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅