本文提出 SafeStyle,一种面向参考图引导扩散风格化的免训练框架,旨在解决风格迁移中长期存在的风格保真与内容泄漏之间的权衡问题。由于图像条件往往将可迁移的风格线索与参考图特有的内容纠缠在一起,增强条件会提升风格相似度却加剧内容泄漏,而过度抑制又会削弱风格表达,且纹理主导与几何主导风格在空间组织上的差异进一步加大了难度。SafeStyle 的做法是先从紧凑校准集中估计风格支持子空间与内容关联子空间,在保留二者有效重叠的同时抑制无用的内容变化,再将纯化后的风格证据按自适应空间粒度进行传输,并通过显式的残差范数预算约束其影响强度。实验表明,该方法在纹理与几何主导风格上取得 0.432 的 DINO 风格相似度并保持有竞争力的文本对齐;在语义不相交的泄漏压力基准上,以仅 0.8% 的语义泄漏实现 0.474 的风格相似度,验证了其在风格保真与参考内容抑制之间的有效平衡。
| 扩散风格化 | 利用扩散模型将参考图像的视觉风格迁移到目标图像,同时保持文本提示指定的语义内容。 |
| 风格残差注入 | 将风格信息作为残差项注入到冻结的扩散模型中,以控制风格迁移的程度而不重新训练模型。 |
| 内容泄漏 | 在风格迁移过程中,参考图像中与内容相关的信息意外地出现在生成结果中,导致语义偏离文本提示。 |
| DINO 风格相似度 | 使用 DINO 模型提取特征来度量生成图像与参考图像之间风格相似程度的指标。 |
| 免训练框架 | 无需重新训练或微调扩散模型,仅通过推理阶段的干预实现风格控制的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅