长记忆预测误差以e^{-Θ(√r)}衰减,达到精度τ仅需Θ(log²(1/τ))个状态!
The Cost of Long Memory: State, Context, and Stability Complexity in Sequence Models
arXiv LG (cs.LG) 重要 #序列模型#长程依赖#理论分析#复杂度 🕐 今天 12:00

📖 AI 总结

本文研究序列模型在长程时间依赖下的资源代价问题:给定特定的预测记忆规律,模型需要多少状态、上下文或动态临界性才能实现准确预测。作者以预测风险为切入点,针对代数衰减的预测记忆,证明了指数模式与有限状态模式下匹配的上下界逼近结果:最优r模式预测误差按e的负Θ(√r)次方衰减,达到误差τ需要r=Θ(log²(1/τ))个状态或模式,从而确定了该典型预测目标的最优资源指数。研究进一步表明,真正的分数阶长记忆会改变问题的几何结构:预测误差在分数积分后度量,有限长度L上下文的预测误差主导阶恰为1/L,固定分数强度d仍保持平方对数状态复杂度律,并在短记忆边界附近识别出d²与d⁴尺度及中间区域的统一构造律。对于具有一致收缩动态的非线性上下文递归模型,作者推导出指数级首次混沌包络及将预测精度与收缩裕度关联的必要条件,指出在代数目标上实现零预测误差会迫使递归定量地趋向临界性,但该条件必要而非充分。有限样本KL计算进一步将预测几何与统计信息联系起来。与定理匹配的实验在收缩状态空间、门控递归和注意力模型上验证了状态与稳定性预测。

🔑 关键词速览

预测记忆律描述序列模型中过去信息如何随时间衰减的规律,通常用代数或指数形式表示。
分数长记忆一种具有长程依赖的时间序列特性,其自相关函数按幂律衰减,由分数阶参数 d 控制。
状态复杂度模型为达到一定预测精度所需的状态或模式数量,通常与误差成对数平方关系。
收缩状态动力学递归神经网络中状态更新具有收缩性质,确保稳定性,但可能限制长程记忆能力。
临界性动力系统处于稳定与混沌边缘的状态,此时信息传播和记忆能力达到最优。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅