长视频盲人解说新突破!AI精准预测“讲什么”和“何时讲”,性能暴涨12分!
From Visual Cues to Spoken Narration: Rethinking Audio Description
arXiv CV (cs.CV) 重要 #多模态#视频理解 🕐 09-03 12:00

📖 AI 总结

该论文提出了一种重新定义电影音频描述(AD)任务的新方法。传统研究将AD简化为对预分割视频片段的字幕生成,忽略了叙述内容的插入时机。作者提出Cue2Narrate两阶段流水线,可同时预测“叙述什么”和“何时叙述”:通过双头音视频定位器分别识别视觉线索窗口和口述旁白窗口,再利用经LoRA适配的视觉语言模型生成简洁描述,并引入描述排序损失以提升生成质量。为验证该方法,研究团队构建了LongLSMDC基准,包含平均时长约6.5分钟的长电影片段。实验表明,Cue2Narrate在平均mAP上比纯视频或纯音频定位基线高出5至12个百分点,在预测窗口和真实窗口条件下均优于微调的基础视觉语言模型。该研究首次为长片段多段AD生成建立了评测基准,对提升视障人士观影体验具有实际意义。

🔑 关键词速览

Audio Description (AD)音频描述,为视障观众提供的视觉事件口头叙述,通常插入在电影对话间隙。
Cue2Narrate本文提出的两阶段流水线模型,用于联合预测长电影片段中音频描述的内容和插入时机。
Visual Cue Window视觉线索窗口,指AD语句对应的视觉事件发生的时间段,由定位器预测。
LoRA-adapted VLM使用低秩适配(LoRA)技术微调的大视觉语言模型,用于从视觉证据生成简洁的音频描述。
Description Ranking Loss描述排序损失,一种训练损失函数,用于将同一帧的负样本候选字幕排名低于真实AD,以提升生成质量。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅