仅62.3小时合成对话,让语音助手唤醒后秒懂你该不该接话!
Training Intelligent Voice Assistant Wakeup with Controllable Synthetic Conversations
arXiv AI (cs.AI) 重要 论文方法多模态 🕐 09-24 12:00

📖 AI 总结

该论文提出了一种新型语音助手唤醒系统,在传统直接关键词检测的基础上增加了上下文触发检测能力。系统在初始唤醒词激活后,通过推理机制区分用户指令与无关语音,从而实现更高效、更具上下文感知的交互。为支撑这一方法,作者构建了一套数据生成架构,可产出可控的多说话人对话语料库,总时长62.3小时,涵盖直接唤醒、上下文后续指令及非针对性语音三类场景。实验结果表明,该方法在多种合成对话场景下均表现有效。作者同时开源了代码、数据集和训练模型,以促进可复现性和智能助手技术的后续研究。

🔑 关键词速览

Wake word detection唤醒词检测,指设备持续监听并识别特定关键词(如“Hey Siri”)以启动交互的技术。
Contextual trigger detection上下文触发检测,在初始唤醒后根据对话上下文判断后续语音是否针对助手,而非仅依赖关键词。
Controllable multi-speaker conversations可控多说话人对话,指可指定说话人、话题及交互类型(如直接唤醒、后续对话)的合成对话数据。
Non-addressed speech非指向性语音,指并非对助手发出的语音,系统需将其与用户命令区分开以避免误触发。
Reproducibility可复现性,指公开代码、数据和模型以便其他研究者重复实验结果并验证结论。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅