该研究针对AI生成艺术可能引发的抄袭争议,提出了一种量化原创艺术作品与AI生成图像相似度的方法。研究使用Stable Diffusion XL Refiner 1.0生成图像,并构建了包含原始图像与生成图像配对的数据集,通过图像到图像生成和自定义提示词增强数据多样性,同时引入语义描述符和BLIP-2字幕丰富特征。方法上采用冻结CLIP编码器的孪生网络,结合三元组损失优化余弦相似度。结果显示,模型训练准确率达99.9%,最佳配置下测试准确率为99.4%,类别间分离度显著(δμ=0.677),表明语义-视觉嵌入能有效区分原创与AI生成图像。该研究为检测AI艺术抄袭提供了可靠的技术手段,对版权保护和AI内容监管具有重要意义。
| Siamese Neural Networks | 孪生神经网络,一种使用两个共享权重的子网络来比较输入对相似性的架构。 |
| CLIP encoders | CLIP编码器,一种基于对比学习的多模态模型,用于将图像和文本映射到同一语义空间。 |
| triplet loss | 三元组损失,一种用于度量学习的损失函数,通过拉近正样本对、推远负样本对来优化嵌入。 |
| Stable Diffusion XL Refiner 1.0 | 稳定扩散XL精炼器1.0,一种先进的文本到图像生成模型,用于生成高质量AI图像。 |
| BLIP-2 captions | BLIP-2字幕,由BLIP-2模型生成的图像描述文本,用于增强语义信息。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅