🔥 今日值得一读 冻结DiT也能精准控图!AcFlow让风格对齐飙至0.5365,还能干掉不想要的画面
AcFlow: Controlling Text-to-Image Diffusion Transformers via Learned Conditional Activation Flow
arXiv CV (cs.CV) 🔥 重点 #文生图#扩散模型#可控生成#推理时控制 🕐 09-11 12:00
👨‍💼 主理人解读 · 为什么值得关注
无需微调即可连续调节生成图像的风格强度或屏蔽特定概念,适合内容安全与风格定制场景。

📖 AI 总结

AcFlow是一种面向文本到图像扩散Transformer(DiT)的推理时控制器,旨在解决直接提示在风格强度调节和抑制不良概念方面的局限。其核心思路是在保持基础DiT冻结的前提下,通过学习到的概念条件速度场,对中间层图像token激活进行传输:文本概念描述指定干预目标,积分时长则提供连续的控制参数,且该速度场产生随token变化、依赖激活状态的更新。由于同一任务族内各概念共享参数,该方法无需针对单个概念拟合,即可支持细粒度描述并泛化到训练中未见的概念。在风格控制任务上,AcFlow在高风格对齐区间取得了最优的风格—内容权衡,固定操作点下风格与内容对齐度达0.5365/0.2860,优于最强基线风格对齐方法的0.4397/0.2684;定性结果还显示其能抑制多种概念,包括直接提示失效的情形。分析表明,该学习速度场是一种自适应控制机制,其更新方向因token而异并取决于激活状态。

🔑 关键词速览

AcFlow一种推理时控制器,通过学习的条件速度场传输中间层激活,以控制文本到图像扩散Transformer的风格强度和概念抑制。
Diffusion Transformers (DiTs)基于Transformer架构的扩散模型,用于文本到图像生成,具有强大的生成能力。
Conditional Activation Flow以概念为条件的速度场,用于在推理时传输中间层图像token激活,实现连续控制。
Style-Content Trade-off在风格控制中,平衡风格对齐与内容保持之间的权衡关系。
Inference-time Controller在模型推理阶段介入的控制机制,无需重新训练或微调基础模型。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅