GP-UCB新突破:恒定探索参数,平均遗憾降至O(ε^1/4)!
Sharper Regret Bounds for Time-Varying Gaussian Process Bandits with Constant Exploration
arXiv ML (stat.ML) 重要 #贝叶斯优化#高斯过程#遗憾界 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
提出恒定探索参数的GP-UCB方法,在时变环境下获得更紧遗憾界,提升贝叶斯优化效率。

📖 AI 总结

本文研究时变环境下的贝叶斯优化问题,其中未知奖励函数遵循高斯过程漂移模型。作者针对现有GP-UCB算法分析中探索参数需随时间范围增长以维持置信界的问题,提出基于逐轮局部置信事件的新分析方法,证明GP-UCB可采用恒定探索参数运行,且期望遗憾界系数仅依赖于漂移率。研究还推导出更紧致的时变最大信息增益界:对于平方指数核,在持续漂移机制下得到平均遗憾为O(ε^(1/4))的改进结果。该恒定探索分析同样适用于实际遗憾保证。模拟实验验证了理论预测的探索参数对1/ε的对数依赖关系。这一工作简化了时变高斯过程bandit算法的参数调节,为动态环境下的高效优化提供了更实用的理论支撑。

🔑 关键词速览

GP-UCB高斯过程上置信界算法,一种用于贝叶斯优化的经典方法,通过平衡探索与利用选择采样点。
Gaussian process drift model高斯过程漂移模型,描述奖励函数随时间动态变化的一种随机过程模型。
exploration parameter探索参数,控制算法在探索未知区域与利用已知信息之间的权衡。
maximum information gain最大信息增益,衡量通过采样获得关于未知函数的信息量的指标。
expected regret期望遗憾,算法性能的度量,表示与最优策略相比的累积损失期望。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅