🔥 今日值得一读 让AI会议转写“选择性失聪”:退出说话人转写准确率暴跌至27.3%,每天数百万在线会议迎来隐私保护新方案!
Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition
arXiv CL (cs.CL) 🔥 重点 #语音识别#机器遗忘#隐私保护 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
需要隐私合规的语音转写场景可用此模块,让指定用户语音不被转写但仍标记其发言时段。

📖 AI 总结

本文提出了一项名为TSU-ASR的新任务,即在基于大语言模型的端到端多说话人语音识别与说话人日志框架中,实现推理时的目标说话人遗忘。给定一段多说话人语音及一组不愿被转录的退出说话人,系统需转录其余说话人,同时仍标注退出者的活跃时段。为此,作者设计了一个轻量级的注册条件门控模块,可附加于冻结的双流语音大模型,支持在推理阶段动态处理训练时未见过的退出说话人。在AMI和AliMeeting数据集上的实验表明,退出说话人对应词或字的转录准确率分别从72.3%降至48.2%、从73.6%降至27.3%,而保留说话人的转录错误率基本不变。该方案为视频会议平台提供了实用的隐私保护接口,使说话人无需退出会议即可动态选择不被AI转录。

🔑 关键词速览

TSU-ASR目标说话人遗忘ASR任务,要求系统转写除指定退出说话人外的所有说话人,同时标记其活跃时段。
ECG注册条件门控模块,一种轻量级附加模块,使冻结的语音LLM能在推理时动态处理新的退出说话人。
Dual-Stream Speech LLM双流语音大语言模型,一种同时处理两路语音信号(如重叠语音)的端到端语音识别模型。
Diarization说话人日志,指识别音频中“谁在什么时候说话”的过程。
Opt-Out Speakers退出说话人,指明确表示不希望自己的语音被自动转写的说话人。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅