英伟达免费放出1亿参数模型,实时认出8个说话人!
Nvidia drops a free 100M-parameter model that identifies up to eight speakers in real time
The Decoder 重要 多模态开源论文方法 🕐 今天 19:01

📖 AI 总结

英伟达发布了免费开放的说话人分离模型 Nemotron 3 Diarization,参数量约1亿,权重可自由获取。该模型能实时识别对话中谁在说话,最多区分八位说话人,并可检测多人同时发言的情况。在 VoiceArena 说话人分离基准测试中,它以14.7%的分离错误率位居第一,领先第二名19.3%的成绩,相比前代 Streaming Sortformer 平均降低约41%的错误率。模型支持录音和实时音频,配合语音识别系统可生成带说话人标签的转录文本,但标签为匿名形式。其音频缓冲可设为四档,缓冲越短准确率越低。背景噪声、混响和更多参与者会推高错误率。该模型的发布降低了说话人分离技术的使用门槛,为会议记录、实时转录等场景提供了高性能的免费方案。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅