本文提出Phase-HDC方法,针对超维分类器中以低比特角度(相位记忆)存储参数的模型,探讨能否在不保存任何优化器历史记录的情况下完成训练。该方法每次更新仅将存储角度沿当前梯度反方向移动至多一步,且仅当梯度足够大时才触发。作者证明这一简单规则是一阶损失模型在参数变动需付出固定代价时的精确解。在其余条件固定时,Phase-HDC以少三倍的存储量达到Adam(6比特矩)的精度;在十一个图像、表格和文本数据集上,其存储量比标准float32 Adam少16至23倍,比8比特Adam少4至6倍。代价是平均损失约五个精度点,但在十一个数据集中的六个上优于8比特Adam,包括8比特Adam失效的字节级文本预测任务。分析表明,参数离散化后Adam的矩主要决定参数是否移动,而该决策可由当前梯度阈值无记忆地完成,矩的粗量化会破坏这一决策。需注意存储节省为逻辑状态而非实测硬件内存。
| Phase-HDC | 一种超维计算分类器训练方法,用梯度阈值替代优化器历史,仅存储模型参数本身。 |
| 相位记忆 (phase memory) | 超维分类器中以低比特角度形式存储的学习参数集合。 |
| 超维计算 (hyperdimensional computing) | 一种受大脑启发的高维向量计算范式,用于分类和推理任务。 |
| Adam 优化器 | 一种自适应学习率优化算法,通过维护梯度的一阶和二阶矩估计来更新参数。 |
| 梯度阈值 (gradient threshold) | 仅当当前梯度的幅度超过某个阈值时才更新参数,从而避免存储历史梯度信息。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅