本文提出 BudgetBench,一套面向本地大语言模型智能体的“预算分层”评测协议与参考工具。其核心思路是将每次调用的输入 token 预算作为自变量,在固定模型、任务、采样与解码的前提下,扫描 2K、4K、8K、16K、32K 五档预算,记录质量、预算利用率、延迟以及预算违规率。作者强调可复用的测量界面,包括可替换的记忆策略接口、显式预算约束、确定性或版本化评分器、提示审计元数据与可复现产物。研究以试点而非最终排名验证协议,覆盖本地 qwen2.5:1.5b、托管的 Qwen3 30B-A3B 复现以及 LongMemEval 评测,揭示出单预算评测所掩盖的预算违规、质量非单调曲线与运行点差异。预算与全上下文孰优尚无定论,本地结果接近无差异,托管复现的点估计偏向全上下文。作者同时坦承早期试点因分词近似导致部分违规行仅为诊断性质,所有时延数据也属操作性诊断。其真正贡献在于协议、工具与失败报告规范,为固定预算下的记忆策略评测提供可扩展基础。
| BudgetBench | 一种将每次调用输入令牌预算作为自变量的协议和测试框架,用于评估本地LLM智能体的记忆策略。 |
| MemoryStrategy | 可替换的记忆策略契约,定义了在预算约束下如何管理上下文和记忆的接口。 |
| 预算违规率 | 衡量智能体调用超出指定输入令牌预算的频率的指标,是评估记忆策略合规性的首要结果。 |
| LongBench v2 | 一个用于评估长上下文语言模型能力的基准测试数据集。 |
| LongMemEval | 一个评估长期记忆能力的基准测试,本研究中使用官方GPT-4o评估器进行评分。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅