提出AlphaRJM,用奖励跳跃记忆解决公式化alpha发现的延迟反馈问题。
| AlphaRJM | 一种用于公式化阿尔法发现的强化学习方法,通过奖励跳跃记忆和随机回报评论家解决延迟反馈问题。 |
| Reward-Jump Memory | 一种事件驱动的潜在状态,仅在评估事件时更新,以保留完整的评估历史。 |
| SDE return critic | 基于随机微分方程的回报评论家,用随机粒子表示未来折现回报的分布。 |
| Formulaic alpha discovery | 通过符号搜索自动发现量化交易中有效阿尔法因子的过程。 |
| Distributional Bellman objective | 一种用于学习回报分布的目标函数,结合能量距离匹配、均值校准和跳跃正则化。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅