本文提出RGSQ,一种面向大型视觉语言模型(VLM)的黎曼几何敏感量化方法。针对现有训练后量化(PTQ)方法多面向单模态大语言模型、将量化误差视为欧氏空间下各向同性扰动、难以识别VLM中量化敏感方向的问题,RGSQ将量化建模为统一Fisher-黎曼度量下的重建问题:通过模态划分的经验Fisher因子构建黎曼流形映射,识别模态特定的敏感方向并融合为模态感知的Kronecker结构度量;再施加几何对齐旋转,将低比特扰动导向损失不敏感轴;最后通过白化变换将黎曼目标映射为等价欧氏形式,使标准单模态PTQ方法可在原有假设下评估多模态量化误差。在主流VLM基准上,RGSQ在W2A8和W3A8极低比特设置下取得最高精度与稳定性,较MBQ、MQuant等VLM感知基线最高提升5.9%,较单模态改进方案最高提升8.6%。该工作为VLM低比特部署提供了兼顾几何敏感性与通用性的量化框架。
| 训练后量化 (PTQ) | 一种在模型训练完成后进行的量化技术,用于压缩模型大小和加速推理,无需重新训练。 |
| 视觉语言模型 (VLM) | 能够同时处理视觉和语言信息的多模态大型模型,如结合图像和文本的任务。 |
| Fisher-黎曼度量 | 一种基于Fisher信息矩阵的黎曼几何度量,用于衡量参数空间中的局部敏感性。 |
| Kronecker结构度量 | 利用Kronecker积分解的度量矩阵,用于高效近似高维参数空间中的二阶信息。 |
| 白化变换 | 一种线性变换,将数据转换为具有单位协方差矩阵的形式,用于简化优化问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅