本文提出 ImIR,一种面向全能图像复原的图像指令微调方法。针对图像退化类型多样、单一模型需应对多种任务的需求,作者改进了现有基于文本提示与低秩适配器微调大型预训练图像编辑模型的方案,用源自退化图像本身的指令替代文本提示。图像通过两条路径进入编辑器:结构信息由模型 VAE 提供,语义指令则由轻量级 token 映射器生成,将退化图像的视觉-语言嵌入向干净图像的嵌入靠拢。由于指令是连续向量,对其缩放可得到一族有效复原结果,适用于低光增强等目标不唯一的任务。实验表明,仅用单个适配器、在单块 GPU 上训练约三小时,即可让一个 Qwen-Image-Edit 模型适配六项任务;在匹配对比下,图像指令优于文本条件,并支持无需退化标签的任务无关复原,而文本方案无法做到。
| 低秩适配器 | 一种参数高效的微调方法,通过注入低秩矩阵来适配大模型,大幅减少可训练参数。 |
| VAE | 变分自编码器,一种生成模型,此处用于从图像中提取结构化的潜在表示。 |
| 令牌映射器 | 轻量级网络模块,将退化图像的视觉-语言嵌入映射为干净图像对应的语义指令向量。 |
| 任务无关复原 | 无需预先知道退化类型标签,模型即可对多种退化进行复原的能力。 |
| Qwen-Image-Edit | 一种大型预训练图像编辑模型,作为基础模型被适配用于图像复原任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅