该论文提出了一种重新定义电影音频描述(AD)任务的新方法。传统研究将AD简化为对预分割视频片段的字幕生成,忽略了叙述内容的插入时机。作者提出Cue2Narrate两阶段流水线,可同时预测“叙述什么”和“何时叙述”:通过双头音视频定位器分别识别视觉线索窗口和口述旁白窗口,再利用经LoRA适配的视觉语言模型生成简洁描述,并引入描述排序损失以提升生成质量。为验证该方法,研究团队构建了LongLSMDC基准,包含平均时长约6.5分钟的长电影片段。实验表明,Cue2Narrate在平均mAP上比纯视频或纯音频定位基线高出5至12个百分点,在预测窗口和真实窗口条件下均优于微调的基础视觉语言模型。该研究首次为长片段多段AD生成建立了评测基准,对提升视障人士观影体验具有实际意义。
| Audio Description (AD) | 音频描述,为视障观众提供的视觉事件口头叙述,通常插入在电影对话间隙。 |
| Cue2Narrate | 本文提出的两阶段流水线模型,用于联合预测长电影片段中音频描述的内容和插入时机。 |
| Visual Cue Window | 视觉线索窗口,指AD语句对应的视觉事件发生的时间段,由定位器预测。 |
| LoRA-adapted VLM | 使用低秩适配(LoRA)技术微调的大视觉语言模型,用于从视觉证据生成简洁的音频描述。 |
| Description Ranking Loss | 描述排序损失,一种训练损失函数,用于将同一帧的负样本候选字幕排名低于真实AD,以提升生成质量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅