🔥 今日值得一读 50万张图、标注密度超1.67倍,OverLay++让布局生成收敛更快!
OverLay++: Dense-Overlap Layout-to-Image Generation Dataset
arXiv CV (cs.CV) 🔥 重点 #数据集#布局生成#图像生成 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
提供密集重叠物体的布局生成训练数据,提升复杂场景可控生成能力。

📖 AI 总结

布局到图像生成在空间与物体级控制方面已取得显著进展,但面对包含大量重叠与交互物体的复杂场景仍表现不佳。该研究认为训练数据是主要瓶颈:现有数据集缺乏密集、复杂物体交互的样本。为此,作者提出OverLay++,一个面向结构复杂场景的大规模布局到图像数据集,包含约50万张图像,平均每张6.6个物体,标注密度达到现有数据集的1.67倍,且每个物体的描述文本长度超过现有数据集六倍以上。其数据生成流程简洁,可产出密集重叠的物体标注与丰富的逐物体描述。在多个基准上,使用OverLay++训练的最先进布局到图像方法均取得一致提升并加快收敛,表明密集、重叠感知且描述丰富的监督信号对可控图像生成具有重要价值。

🔑 关键词速览

Layout-to-Image Generation根据给定的对象布局(如边界框或掩码)生成对应图像的任务,强调对空间位置和对象类别的可控性。
OverLay++本文提出的大规模布局到图像数据集,包含约50万张图像,以密集重叠对象和长描述为特色。
Annotation Density数据集中每张图像平均标注的对象数量,反映场景的复杂程度和标注的密集性。
Object Captions对图像中每个对象进行的文本描述,提供比类别标签更丰富的语义信息。
Controllable Image Generation能够根据用户指定的条件(如布局、文本描述)精确控制生成图像内容与结构的技术。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅