该论文提出了一种名为WMLLM的自进化优化智能体框架,旨在解决黑箱优化问题中搜索空间大、结构弱且维度高导致的样本效率低下难题。其核心思路是“先预测后行动”的世界建模:智能体先利用大语言模型的内在知识预测有潜力的优化方向,再据此生成候选方案,从而避免盲目试错。框架结合了多轮智能体细化、群体搜索和强化学习,使智能体在搜索过程中不断优化其隐式世界模型与优化策略。实验聚焦于多目标分子优化等黑箱任务,结果显示WMLLM在有限评估预算下显著提升了样本效率和最终优化性能,并在该基准上达到了当前最优水平。这一工作为利用语言模型进行高效搜索优化提供了新思路。
| Black-box optimization | 黑箱优化,指优化目标函数形式未知,只能通过输入输出评估的优化问题。 |
| World modeling | 世界建模,指构建对环境的内部预测模型,以模拟或预测候选结果。 |
| WMLLM | 本文提出的基于预测后行动世界建模的自我进化优化智能体框架。 |
| Self-evolving | 自我进化,指智能体在搜索过程中不断改进自身模型和策略的能力。 |
| Multi-objective molecular optimization | 多目标分子优化,指同时优化分子多个性质(如药效、毒性)的优化任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅