🔥 今日值得一读 英伟达开源1亿参数模型:实时追踪8人对话,重叠声音也不怕!
NVIDIA Releases Nemotron 3 Diarization: A 100M-Parameter Open-Weight Model That Tracks 8 Speakers in Real Time
MarkTechPost 🔥 重点 开源多模态论文方法 🕐 今天 02:17

📖 AI 总结

NVIDIA 在 Hugging Face 上发布了 Nemotron 3 Diarization,一个 100M 参数的开源说话人分离模型,采用允许商用的 OpenMDW License 1.1,可通过 NVIDIA NeMo 在 Linux 及 Ampere、Ada Lovelace、Hopper、Blackwell 等 GPU 上运行。该模型回答“谁在何时说话”,最多可同时追踪 8 位说话人,并支持语音重叠场景,单一检查点即可兼顾离线录音与实时流式处理。相比此前仅支持 4 人的 Streaming Sortformer,其容量翻倍,面向多人同时发言的复杂音频。架构上,模型接收 16 kHz 单声道音频,提取 10 毫秒步长的梅尔频谱特征并按 8 倍堆叠为 80 毫秒编码帧,经 31 层带旋转位置编码的 Transformer 编码器处理后,由 Conv1D 上采样回 10 毫秒分辨率,输出每位说话人的活动概率张量,并按到达时间排序。该能力可与语音识别结果结合生成带说话人标注的转写,是会议工具、通话分析、播客流程和语音智能体记忆的关键环节。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅