预训练让注意力模型学会决策阈值,误差仅O((m∧n)⁻¹+N⁻¹)!
Learning Decision-Stump Thresholds in Context: Dynamics of Softmax Attention
arXiv ML (stat.ML) 重要 #Transformer#注意力机制#学习理论 🕐 今天 12:00

📖 AI 总结

本文研究基于梯度的预训练如何在上下文中学习决策树桩阈值这一统计规则。作者构建了一个双参数softmax注意力模型,特征与不等式方向固定,预训练使用带标签的上下文及其真实阈值,而新阈值需仅凭上下文推断。在大分辨率初始化下,对m个任务(每个含n个样本)进行恒定步长梯度下降,可得到一个冻结估计器,其误差为Õ((m∧n)⁻¹+N⁻¹),其中N为新鲜上下文规模;两项分别对应有限预训练精度与新鲜上下文定位能力。其机制在于参数的协同发散:总体训练先校准标签与特征的相对得分,再以t^{1/4}速率增大注意力尺度,使总体阈值误差为O(t^{-1/4})。为将该机制迁移至固定有限语料,作者通过控制相对于各参数尺度下收缩方向的梯度误差,证明了训练区间可增长而无需长期追踪总体轨迹。研究还指出单头模型的边界局限,并从统计角度解释了反射对称化可能实现的效果。

🔑 关键词速览

softmax attention一种注意力机制,使用softmax函数将查询和键的相似度转换为概率分布,用于加权聚合值。
decision threshold在分类或决策中,用于区分不同类别的临界值,观测值超过该阈值则归为一类,否则归为另一类。
gradient-based pretraining使用梯度下降等优化方法对模型进行预训练,以学习通用特征或规则,便于后续任务微调。
parameter divergence在训练过程中,模型参数逐渐增大或发散的现象,通常与学习率、初始化等因素有关。
reflected symmetrization一种通过反射操作使数据或模型对称化的技术,常用于处理边界问题或增强泛化能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅