图像分词器决定多模态模型成败?新研究用损失函数揭秘4大关键发现!
Studying Image Tokenizers as Visual Languages in Unified Multimodal Models
arXiv CL (cs.CL) 重要 #多模态#图像分词#预训练 🕐 09-08 12:00

📖 摘要

研究图像分词器作为统一多模态模型视觉语言的行为与学习特性。

🔑 关键词速览

图像分词器 (Image Tokenizer)将图像转换为离散视觉标记的模型,类似于文本分词器处理文本的方式。
统一多模态模型 (Unified Multimodal Models)能够同时处理文本和图像等多种模态的模型,通常通过共享的架构进行联合建模。
纯自回归测试平台 (Pure-Autoregressive Testbed)一种仅使用自回归机制(逐标记预测)的评估环境,用于控制变量并研究模型行为。
多模态持续预训练 (Multimodal Continual Pretraining)在预训练阶段持续更新模型,以同时学习多种模态的任务,如文本生成和图像生成。
T2I和I2T损失 (T2I and I2T Losses)分别指文本到图像生成和图像到文本生成的预测损失,用于衡量模型在这些任务上的表现。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅