新方法让下一词元预测误差以参数速率衰减,留一法失效场景下依然精准!
Next-token functional estimation
arXiv ML (stat.ML) 重要 #统计学习理论#泛函估计#语言模型 🕐 09-18 12:00

📖 AI 总结

这篇论文研究“下一词泛函估计”问题:在观察到长度为n+1的随机变量序列的前n个点后,估计依赖于未观测末点与已观测经验测度的泛函,涵盖惊喜概率、最近邻距离尾部概率及分类器测试误差等。经典留一法在时间相依情形下不一致,作者提出“留窗口法”,在每个索引后删除长度为τ的窗口再构造经验测度,τ=1时退化为留一法。在平稳β混合且满足Marton耦合的假设下,估计误差达到参数速率,并给出混合马尔可夫链上惊喜概率的极小极大下界。马尔可夫链、滑动平均与自回归过程的模拟表明,该方法在留一法和加常数基线失效的场景中仍有效。

🔑 关键词速览

下一词元泛函指依赖于序列中未观察到的下一个词元与已观察训练点经验测度的统计量,如惊奇概率、尾部概率和分类误差。
留一法一种经典估计方法,每次删除一个观察点来形成经验测度,但在时间相依数据下不一致。
留窗估计量本文提出的估计方法,删除每个索引后长度为 τ 的窗口来形成经验测度,τ=1 时退化为留一法。
β-混合过程一种描述时间序列相依性的混合条件,要求过去和未来事件之间的依赖随间隔增大而衰减。
Marton 耦合一种概率耦合技术,用于控制随机变量之间的依赖结构,常用于混合过程的集中不等式。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅