22种印度语言全拿下!Sarvam AI新模型首词延迟不到150毫秒,每小时仅30卢比
Sarvam AI Releases Saaras V4: A Speech-to-Text Model for All 22 Indian Languages and Global English
MarkTechPost 重要 多模态大模型商业化 🕐 今天 05:56

📖 AI 总结

Sarvam AI 发布新一代语音识别模型 Saaras V4,覆盖全部 22 种印度表列语言及英语,并首次纳入全球英语口音。该模型采用编码器-解码器架构,音频编码器提取声学特征后经时间下采样适配器压缩序列,再交由自研的 30 亿参数混合状态空间语言模型 Sarvam-3B 自回归生成转写文本。Sarvam 称其在 22 种语言上均达到当前最优准确率。基准测试显示,Saaras V4 在 7 个英语数据集上取得所测模型最低平均词错误率;在 Vistaar 的 10 种印度语言上同时报告 WER 与引入语义校验的 LLM-WER;在含压缩、削波和强背景噪声的 Kathbath Noisy 集上,其 LLM-WER 不足 Deepgram Nova-3 和 GPT-4o Transcribe 的一半。语言识别错误率在前十大印度语言中为 2.9%,全部 22 种语言为 5.22%。模型已通过 API 开放部署,但权重未公开。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅