本文提出BodyCam-VQA框架,旨在解决警用随身摄像头(BWC)视频的多模态理解难题。此类视频常存在画面混乱、画质低、动作交互快、音频噪声大等问题,即便是当前最先进的多模态模型也容易忽略关键取证细节,如证据存在与否及警民互动的潜在细微之处。为此,作者设计了一种自适应视觉问答(VQA)框架,采用结构化推理方式提取传统字幕系统难以捕捉的细粒度视觉证据,并对比了基础模型与微调开源模型等多种问题生成模型的性能差异。结果表明,该VQA驱动架构能生成更可靠、客观且详尽的执法事件记录,有助于通过AI辅助取证清晰度保护执法人员与公众权益。
| Body-Worn Camera (BWC) | 随身摄像头,指执法人员佩戴在身上用于记录执法过程的摄像设备。 |
| Vision-Language Model (VLM) | 视觉语言模型,一种能够同时处理视觉和文本信息的多模态人工智能模型。 |
| Visual Question Answering (VQA) | 视觉问答,一种结合图像理解和自然语言处理的任务,模型需根据图像内容回答问题。 |
| Forensic Details | 取证细节,指在法律调查中具有证据价值的关键视觉或听觉信息。 |
| Adaptive VQA Framework | 自适应视觉问答框架,一种能够根据场景动态调整问题生成和推理过程的VQA系统。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅