本文提出 OmniHarness 框架,旨在解决现有统一多模态大模型与多智能体系统在视觉生成中的三项局限:任务经验泛化性不足、反思机制滞后于任务完成、知识获取被动依赖下游需求。该框架将已验证的执行过程抽象为面向视觉生成任务族的符号化策略,保留共享流程与适用条件并剔除实例特定输入,再通过实例化、适配与组合应对新任务,同时借助中间验证在执行中引导修正与失败恢复。OmniHarness 还能在目标明确前自主生成并执行接近能力边界的练习任务,利用执行反馈持续优化策略,而模型参数保持冻结。在六个基准、三种 MLLM 主干和三种视觉智能体框架上的实验显示,该方法在 ComfyBench 创意任务上达到 95.0% 的解决率,超出最强基线 27.5 个百分点,且冻结的策略快照可通过即插即用方式提升现有系统性能。
| OmniHarness | 本文提出的框架,通过符号策略学习实现可泛化的视觉生成。 |
| 符号策略学习 | 将已验证的执行抽象为符号策略,以捕获任务家族的共享流程和适用条件。 |
| 多模态大语言模型(MLLMs) | 能够处理文本、图像等多种模态信息的大规模语言模型。 |
| 视觉智能体框架 | 用于构建和运行视觉生成任务的智能体系统,通常包含规划、执行和验证等组件。 |
| ComfyBench | 一个用于评估视觉生成任务的基准测试平台,包含创意等任务类型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅