该研究针对深度学习扩展面临的数据枯竭、训练成本指数级增长等瓶颈,探索模型融合这一无需梯度下降即可组合预训练检查点的路径。由于视觉Transformer(ViT)与状态空间模型(SSM)采用不同的令牌混合算子,现有权重空间融合方法难以处理架构与参数形状不一致的异构模型。作者提出黎曼—洛伦兹参数融合方法(RLPF),按语义角色对齐参数组,将其投影至公共坐标并提升到双曲空间的洛伦兹双曲面模型,计算正则化测地线重心后解码回两个分支,再通过可学习门控融合各分支输出。实验显示,微调后系统在CIFAR-10、Oxford-IIIT Pet和ImageNet-1K上分别达到82.37%、75.04%和78.58%的准确率,均优于最佳单亲模型;ImageNet-1K上预微调初始化达77.80%。结果支持几何感知异构融合的进一步研究,但RLPF本质是含训练门控的双分支混合模型,并非免训练的单检查点合并。
| Vision Transformer (ViT) | 一种将图像分割为块并应用Transformer架构进行视觉任务的模型。 |
| State-Space Model (SSM) | 一种通过状态空间表示序列动态的模型,常用于序列建模。 |
| Riemannian-Lorentz Parameter Fusion (RLPF) | 一种在黎曼几何和洛伦兹双曲面空间中进行参数融合的方法。 |
| Lorentz hyperboloid model | 双曲空间的一种模型,嵌入在闵可夫斯基空间中,用于表示负曲率几何。 |
| Geodesic barycenter | 在黎曼流形上,一组点的测地线重心,即距离平方和最小的点。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅