布局到图像生成在空间与物体级控制方面已取得显著进展,但面对包含大量重叠与交互物体的复杂场景仍表现不佳。该研究认为训练数据是主要瓶颈:现有数据集缺乏密集、复杂物体交互的样本。为此,作者提出OverLay++,一个面向结构复杂场景的大规模布局到图像数据集,包含约50万张图像,平均每张6.6个物体,标注密度达到现有数据集的1.67倍,且每个物体的描述文本长度超过现有数据集六倍以上。其数据生成流程简洁,可产出密集重叠的物体标注与丰富的逐物体描述。在多个基准上,使用OverLay++训练的最先进布局到图像方法均取得一致提升并加快收敛,表明密集、重叠感知且描述丰富的监督信号对可控图像生成具有重要价值。
| Layout-to-Image Generation | 根据给定的对象布局(如边界框或掩码)生成对应图像的任务,强调对空间位置和对象类别的可控性。 |
| OverLay++ | 本文提出的大规模布局到图像数据集,包含约50万张图像,以密集重叠对象和长描述为特色。 |
| Annotation Density | 数据集中每张图像平均标注的对象数量,反映场景的复杂程度和标注的密集性。 |
| Object Captions | 对图像中每个对象进行的文本描述,提供比类别标签更丰富的语义信息。 |
| Controllable Image Generation | 能够根据用户指定的条件(如布局、文本描述)精确控制生成图像内容与结构的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅