研究图像分词器作为统一多模态模型视觉语言的行为与学习特性。
| 图像分词器 (Image Tokenizer) | 将图像转换为离散视觉标记的模型,类似于文本分词器处理文本的方式。 |
| 统一多模态模型 (Unified Multimodal Models) | 能够同时处理文本和图像等多种模态的模型,通常通过共享的架构进行联合建模。 |
| 纯自回归测试平台 (Pure-Autoregressive Testbed) | 一种仅使用自回归机制(逐标记预测)的评估环境,用于控制变量并研究模型行为。 |
| 多模态持续预训练 (Multimodal Continual Pretraining) | 在预训练阶段持续更新模型,以同时学习多种模态的任务,如文本生成和图像生成。 |
| T2I和I2T损失 (T2I and I2T Losses) | 分别指文本到图像生成和图像到文本生成的预测损失,用于衡量模型在这些任务上的表现。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅