该论文提出“艺术智能”这一新框架,将其定义为以探索驱动的世界实现过程,在保留语义、艺术与构图结构的同时为创造性留出空间。作者据此开发了文本到图像模型Moonworks Lunara,采用新颖的扩散混合Transformer架构,并通过信息性样本采集与定向注入人类艺术作品的训练算法迭代演化数据分布。在评测中,Lunara与FLUX.2-Klein-4B、Qwen-Image、GPT-Image-1-Mini等七个模型对比,以GPT-5.6 Sol为评估器,其美学质量排名第一(8.473对8.457),情感共鸣排名第二,内容完整性保持竞争力;盲测人类评估结果与自动指标一致,同样将其列为第一。在GenEval上,该模型与包括GPT Image 2和Seedream 4.0在内的十六个模型竞争表现不俗。Lunara在活跃参数不足10B、推理延迟低于10秒的条件下达到前沿水平,其意义在于将视觉智能的追问从“模型能否画对”转向“模型能多深入地诠释意义并将其实现为富有想象力的表达世界”。
| Artistic Intelligence | 艺术智能,指模型在生成图像时不仅追求正确性,还追求创造性、表现力和对意义的深度解读。 |
| Diffusion Mixture Transformer | 扩散混合 Transformer,一种结合扩散模型与混合专家 Transformer 的新型架构,用于文本到图像生成。 |
| CLIPScore | 一种基于 CLIP 模型的自动评估指标,衡量生成图像与文本提示之间的语义一致性。 |
| LAION Aesthetic Predictor | 基于 LAION 数据集训练的美学预测器,用于自动评估图像的美学质量。 |
| GenEval | 一个用于评估文本到图像生成模型在组合性、对象计数、颜色和空间关系等方面能力的基准测试。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅