AcFlow是一种面向文本到图像扩散Transformer(DiT)的推理时控制器,旨在解决直接提示在风格强度调节和抑制不良概念方面的局限。其核心思路是在保持基础DiT冻结的前提下,通过学习到的概念条件速度场,对中间层图像token激活进行传输:文本概念描述指定干预目标,积分时长则提供连续的控制参数,且该速度场产生随token变化、依赖激活状态的更新。由于同一任务族内各概念共享参数,该方法无需针对单个概念拟合,即可支持细粒度描述并泛化到训练中未见的概念。在风格控制任务上,AcFlow在高风格对齐区间取得了最优的风格—内容权衡,固定操作点下风格与内容对齐度达0.5365/0.2860,优于最强基线风格对齐方法的0.4397/0.2684;定性结果还显示其能抑制多种概念,包括直接提示失效的情形。分析表明,该学习速度场是一种自适应控制机制,其更新方向因token而异并取决于激活状态。
| AcFlow | 一种推理时控制器,通过学习的条件速度场传输中间层激活,以控制文本到图像扩散Transformer的风格强度和概念抑制。 |
| Diffusion Transformers (DiTs) | 基于Transformer架构的扩散模型,用于文本到图像生成,具有强大的生成能力。 |
| Conditional Activation Flow | 以概念为条件的速度场,用于在推理时传输中间层图像token激活,实现连续控制。 |
| Style-Content Trade-off | 在风格控制中,平衡风格对齐与内容保持之间的权衡关系。 |
| Inference-time Controller | 在模型推理阶段介入的控制机制,无需重新训练或微调基础模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅