该论文针对多模态图像生成(尤其是主体驱动定制)中评估方法滞后的问题,指出现有基于嵌入或基于多模态大模型的评估方式均孤立地衡量各模态条件的对齐程度,与多模态生成需同时满足多条件对齐的目标相矛盾,导致与人类判断一致性较差。为此,作者提出UFO,首个面向全条件对齐同时评估的统一框架,其核心是“原子化评估链”范式:将全条件对齐分解为一系列细粒度、解耦的原子评估单元,按模态相关性分类,再通过通用或专用功能调用进行验证。实验显示,UFO与人类评估偏好的相关性最高,平均提升15.25%。作者同时发布UFO-Bench基准,用于在文本与视觉条件多样交互下全面评估现有定制模型。该工作为多模态图像生成提供了更贴近人类判断的评估方案,已被ICML 2026接收。
| UFO | 首个用于多模态图像生成中全条件对齐同时评估的统一框架。 |
| Atomized Chain-of-Evaluation | 一种将全条件对齐分解为细粒度、解耦的原子评估单元序列的评估范式。 |
| Atomic Evaluation Units (AEUs) | 细粒度、解耦的评估单元,用于验证多模态条件对齐的不同方面。 |
| UFO-Bench | 一个专用基准,用于全面评估定制化模型在文本和视觉条件交互下的性能。 |
| Multi-modal Large Language Model (MLLM) | 多模态大语言模型,能够处理文本和视觉等多种模态信息的大型语言模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅