新算法让SGD探索更广收敛更准,强化学习无需解HJB方程!
Continuous Delayed-Memory Stochastic Gradient Descent and Continuous-Time Reinforcement Learning from History of Astrophysical Time Series Studies
arXiv LG (cs.LG) #随机微分方程#强化学习#时间序列 🕐 今天 12:00

📖 AI 总结

本文回顾了随机微分方程结合神经网络参数化方法在类星体光变曲线建模中的应用历史。类星体亮度随机变化编码了其超大质量黑洞的信息,从地面巡天时间序列数据中建模这些变化是一项统计挑战。在此基础上,作者提出了连续延迟记忆随机梯度下降方法,其迭代过程依赖离散迭代的历史状态。在二维景观上的模拟表明,通过调整超参数,该方法相比普通随机梯度下降展现出更广泛的探索能力和更精确的收敛行为。此外,作者提出了一种无需求解HJB偏微分方程的连续时间策略梯度强化学习结构,并证明其最优性条件可恢复此前工作中的Gibbs策略。

🔑 关键词速览

类星体宇宙中极其明亮的活动星系核,其亮度随机变化,蕴含超大质量黑洞的信息。
随机微分方程一种包含随机项的微分方程,用于建模受随机因素影响的动态系统。
连续延迟记忆随机梯度下降本文提出的一种优化算法,在连续时间框架下利用过去迭代状态信息进行梯度下降。
HJB偏微分方程Hamilton-Jacobi-Bellman方程,是连续时间最优控制问题的核心偏微分方程。
Gibbs策略一种基于玻尔兹曼分布的随机策略,常用于强化学习中平衡探索与利用。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅