本文提出 DOGS 方法,将提示驱动的标志生成从传统的文本改写范式重新定义为结构化设计空间中的采样问题。作者认为,语言空间的提示优化难以胜任标志设计这类结构化视觉任务,因为一句话的简要描述无法确定大量设计决策,且可能无意中复现受保护商标。DOGS 从真实标志语料库中挖掘出带类型的图结构设计语法,并利用 GFlowNet 采样器生成设计图,其概率与综合可识别性、美学和语料库相对原创性的终端奖励成正比。每个设计槽位仅从封闭的设计级词汇中取值,解析过程中会剔除侵权或有害标记,原创性奖励则惩罚与现有标志的接近程度,从而在设计层面内建侵权规避机制。在两个开源渲染器和九个基线的对比实验中,DOGS 生成的标志在可识别性和美学上更优,多样性显著提升,商标侵权风险大幅降低。该工作为结构化视觉设计任务的提示优化提供了新思路。
| GFlowNet | 一种生成模型,通过按与奖励成比例的概率采样组合对象来学习生成多样化样本。 |
| 设计空间采样 | 在结构化设计空间中进行采样,而非在文本序列空间中优化提示,以处理未指定的设计决策。 |
| 设计语法 | 一种带类型的图结构语法,用于表示标志设计元素及其经验共现关系。 |
| 原创性奖励 | 一种奖励函数,惩罚生成标志与现有标志的相似性,以促进原创并避免侵权。 |
| 文本到图像生成 | 根据文本提示生成图像的技术,通常涉及提示优化以改善输出质量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅