该研究针对有限时域表格型马尔可夫决策过程,提出了一套精确快速仿真框架,旨在解决传统强化学习仿真即使只需聚合统计量、仍须逐条生成完整轨迹所导致的计算冗余问题。框架包含两种互补模式:在直接批量仿真中,以聚合马尔可夫流表示整个批次,当并行仿真资源充足时可通过轨迹聚合获得该流;若仿真代价高昂但初始状态与转移分布可直接获取,则通过前向马尔可夫流采样生成同分布流,无需物化单条轨迹,从而将仿真端对批量规模m的计算依赖从O(m)降至O(1)。在自适应批量仿真中,当批量长度由数据依赖条件决定时,采用精确多元超几何分裂递归细化候选马尔可夫流,同时保持条件分布不变,使对m的代价依赖从O(m)降至O(log m)。两种模式的核心思路是尽可能保持轨迹聚合、仅在需要定位数据依赖边界时细化流。该框架可广泛适用于基于仿真器、离线及在线的批量或阶段式强化学习场景,论文并以各场景的代表性算法进行了说明。
| 表格强化学习 | 一种强化学习设置,其中状态和动作空间是有限的,通常用表格表示值函数或策略。 |
| 马尔可夫决策过程 | 一个数学框架,用于建模在随机环境中进行序列决策的问题,其中状态转移具有马尔可夫性。 |
| 马尔可夫流 | 在马尔可夫决策过程中,表示状态-动作对之间概率质量流动的聚合量,用于批量模拟。 |
| 多元超几何分裂 | 一种精确采样方法,用于从多元超几何分布中生成样本,在自适应批量模拟中递归细化候选流。 |
| 批量模拟 | 一种模拟方式,其中同时生成多个轨迹或流,以提高计算效率,适用于批量或阶段式强化学习。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅