本研究探讨小型大语言模型智能体能否在明确的墙钟时间预算下有效运作,即既遵守分配的运行时长,又高效利用可用时间。作者在MLE-Bench Lite的五项竞赛和Zork I两个智能体基准上分别评估了Qwen3.6-27B与Qwen3-4B。结果发现,仅靠提示词告知预算时,智能体无法将预算转化为受控的时间使用,原因包括缺乏计时反馈、难以预估动作耗时,以及缺少从可用时间到策略的映射。研究尝试了两类干预:通过运行框架暴露计时信息并强制执行截止时间,以及采用预算感知奖励的强化学习。计时信息注入显著提升了预算遵守度且未损失性能,强制执行钩子进一步收紧遵守度;GRPO强化学习在Zork I上实现近乎完美的预算遵守并能泛化到未见预算,但在MLE-Bench上未提升任务表现。更关键的是,即便智能体学会遵守预算,仍无法利用额外时间提升任务表现,多预算训练还会向最短预算策略坍缩。研究揭示了时间遵守与高效时间分配之间的鸿沟,这是预算条件智能体面临的核心挑战。
| LLM agents | 基于大语言模型的智能体,能够自主感知环境、做出决策并执行动作以完成任务的AI系统。 |
| wall-clock time budgets | 墙钟时间预算,指以真实世界时间(而非计算步数或令牌数)为衡量标准的运行时间限制。 |
| MLE-Bench Lite | 一个用于评估机器学习工程能力的轻量级基准测试集,包含多个竞赛任务。 |
| GRPO | Group Relative Policy Optimization,一种强化学习算法,通过组内相对比较来优化策略。 |
| budget-conditioned agents | 预算条件智能体,指在明确的时间或资源预算约束下进行决策和行动的AI智能体。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅