这篇论文针对图像外扩任务中主体清晰度易受损的问题提出了一种新方法。现有基于扩散模型的外扩方法虽能生成视觉上合理的补全内容,却常因结构不一致、语义漂移或细节丢失而降低主体保真度。作者提出结合视觉语言模型引导的语义条件与多尺度小波监督的主体清晰度外扩框架,并构建了以主体为中心的数据整理流程,从广告和自然图像中生成主体相交的外扩训练对。该方法不增加额外推理成本,且兼容扩散模型骨干。在四个广告与自然图像基准上,该方法将主体中心DreamSim误差和FID较匹配的监督微调平均降低3.0%和2.4%,较各数据集最强现有方法平均降低10.8%和7.7%,为提升外扩图像的主体表达质量提供了有效方案。
| Image Outpainting | 图像外绘,指在给定图像边界之外生成新内容以扩展图像的技术。 |
| Subject Clarity | 主体清晰度,指图像清晰传达其主要主体的能力。 |
| Multiscale Wavelet Supervision | 多尺度小波监督,一种利用小波变换在不同尺度上监督细节保留的方法。 |
| Vision-Language Model (VLM) | 视觉语言模型,一种能同时处理视觉和文本信息的人工智能模型。 |
| DreamSim | 一种用于评估图像感知相似度的度量指标,此处用于衡量主体中心的误差。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅