LAION发布了大型开放视频数据集Big Video Dataset(BVD),包含1000万小时的视频内容,专为AI研究设计。该数据集从CommonCrawl中筛选出13亿个视频URL,实际下载了其中8000万个视频,并从中提取了5500万个带自动生成视频和音频描述的片段,以及3亿张静态图像。研究显示,基于BVD训练的模型在视频到文本基准测试中,性能比基于InternVid训练的同类模型最高提升2.1个百分点。该数据集将视频、音频和文本联合训练,使模型能学习视觉内容与描述或声音的匹配关系。LAION仅将数据集用于研究目的,其合法性依据2024年汉堡地区法院的裁决,该裁决允许为非商业研究收集受版权保护的内容。数据集和代码已免费开放,但LAION要求用户尊重原始内容创作者的权益。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅