2K到32K预算全扫描,BudgetBench暴露本地LLM智能体记忆策略预算违规真相
BudgetBench: A Budget-Tiered Protocol and Pilot Harness for Memory Strategy Evaluation in Local Large Language Model Agents
arXiv LG (cs.LG) 重要 #Agent#记忆机制#评测基准#推理优化 🕐 09-15 12:00

📖 AI 总结

本文提出 BudgetBench,一套面向本地大语言模型智能体的“预算分层”评测协议与参考工具。其核心思路是将每次调用的输入 token 预算作为自变量,在固定模型、任务、采样与解码的前提下,扫描 2K、4K、8K、16K、32K 五档预算,记录质量、预算利用率、延迟以及预算违规率。作者强调可复用的测量界面,包括可替换的记忆策略接口、显式预算约束、确定性或版本化评分器、提示审计元数据与可复现产物。研究以试点而非最终排名验证协议,覆盖本地 qwen2.5:1.5b、托管的 Qwen3 30B-A3B 复现以及 LongMemEval 评测,揭示出单预算评测所掩盖的预算违规、质量非单调曲线与运行点差异。预算与全上下文孰优尚无定论,本地结果接近无差异,托管复现的点估计偏向全上下文。作者同时坦承早期试点因分词近似导致部分违规行仅为诊断性质,所有时延数据也属操作性诊断。其真正贡献在于协议、工具与失败报告规范,为固定预算下的记忆策略评测提供可扩展基础。

🔑 关键词速览

BudgetBench一种将每次调用输入令牌预算作为自变量的协议和测试框架,用于评估本地LLM智能体的记忆策略。
MemoryStrategy可替换的记忆策略契约,定义了在预算约束下如何管理上下文和记忆的接口。
预算违规率衡量智能体调用超出指定输入令牌预算的频率的指标,是评估记忆策略合规性的首要结果。
LongBench v2一个用于评估长上下文语言模型能力的基准测试数据集。
LongMemEval一个评估长期记忆能力的基准测试,本研究中使用官方GPT-4o评估器进行评分。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅