本文研究时变环境下的贝叶斯优化问题,其中未知奖励函数遵循高斯过程漂移模型。作者针对现有GP-UCB算法分析中探索参数需随时间范围增长以维持置信界的问题,提出基于逐轮局部置信事件的新分析方法,证明GP-UCB可采用恒定探索参数运行,且期望遗憾界系数仅依赖于漂移率。研究还推导出更紧致的时变最大信息增益界:对于平方指数核,在持续漂移机制下得到平均遗憾为O(ε^(1/4))的改进结果。该恒定探索分析同样适用于实际遗憾保证。模拟实验验证了理论预测的探索参数对1/ε的对数依赖关系。这一工作简化了时变高斯过程bandit算法的参数调节,为动态环境下的高效优化提供了更实用的理论支撑。
| GP-UCB | 高斯过程上置信界算法,一种用于贝叶斯优化的经典方法,通过平衡探索与利用选择采样点。 |
| Gaussian process drift model | 高斯过程漂移模型,描述奖励函数随时间动态变化的一种随机过程模型。 |
| exploration parameter | 探索参数,控制算法在探索未知区域与利用已知信息之间的权衡。 |
| maximum information gain | 最大信息增益,衡量通过采样获得关于未知函数的信息量的指标。 |
| expected regret | 期望遗憾,算法性能的度量,表示与最优策略相比的累积损失期望。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅