Sarvam AI 发布新一代语音识别模型 Saaras V4,覆盖全部 22 种印度表列语言及英语,并首次纳入全球英语口音。该模型采用编码器-解码器架构,音频编码器提取声学特征后经时间下采样适配器压缩序列,再交由自研的 30 亿参数混合状态空间语言模型 Sarvam-3B 自回归生成转写文本。Sarvam 称其在 22 种语言上均达到当前最优准确率。基准测试显示,Saaras V4 在 7 个英语数据集上取得所测模型最低平均词错误率;在 Vistaar 的 10 种印度语言上同时报告 WER 与引入语义校验的 LLM-WER;在含压缩、削波和强背景噪声的 Kathbath Noisy 集上,其 LLM-WER 不足 Deepgram Nova-3 和 GPT-4o Transcribe 的一半。语言识别错误率在前十大印度语言中为 2.9%,全部 22 种语言为 5.22%。模型已通过 API 开放部署,但权重未公开。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅