🔥 今日值得一读 ViT和SSM异构合并新突破,免训练融合准确率飙至82.37%!
Riemannian--Lorentz Fusion of Vision Transformers and State-Space Models
arXiv CV (cs.CV) 🔥 重点 #模型融合#ViT#状态空间模型#黎曼几何 🕐 09-18 12:00
👨‍💼 主理人解读 · 为什么值得关注
想把不同架构的预训练视觉模型合并省算力,可用该黎曼-洛伦兹融合法,无需重训即可组合ViT与SSM。

📖 AI 总结

该研究针对深度学习扩展面临的数据枯竭、训练成本指数级增长等瓶颈,探索模型融合这一无需梯度下降即可组合预训练检查点的路径。由于视觉Transformer(ViT)与状态空间模型(SSM)采用不同的令牌混合算子,现有权重空间融合方法难以处理架构与参数形状不一致的异构模型。作者提出黎曼—洛伦兹参数融合方法(RLPF),按语义角色对齐参数组,将其投影至公共坐标并提升到双曲空间的洛伦兹双曲面模型,计算正则化测地线重心后解码回两个分支,再通过可学习门控融合各分支输出。实验显示,微调后系统在CIFAR-10、Oxford-IIIT Pet和ImageNet-1K上分别达到82.37%、75.04%和78.58%的准确率,均优于最佳单亲模型;ImageNet-1K上预微调初始化达77.80%。结果支持几何感知异构融合的进一步研究,但RLPF本质是含训练门控的双分支混合模型,并非免训练的单检查点合并。

🔑 关键词速览

Vision Transformer (ViT)一种将图像分割为块并应用Transformer架构进行视觉任务的模型。
State-Space Model (SSM)一种通过状态空间表示序列动态的模型,常用于序列建模。
Riemannian-Lorentz Parameter Fusion (RLPF)一种在黎曼几何和洛伦兹双曲面空间中进行参数融合的方法。
Lorentz hyperboloid model双曲空间的一种模型,嵌入在闵可夫斯基空间中,用于表示负曲率几何。
Geodesic barycenter在黎曼流形上,一组点的测地线重心,即距离平方和最小的点。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅