这篇论文研究了一个实际问题:围绕大型语言模型规划器运行的智能体框架,能否用现成的小语言模型来处理诸如自动批准shell命令、写入记忆、选择工具、排序历史对话等微任务。作者构建了包含四类微任务的基准测试,每项都设有基于廉价非LLM基线锚定的预设阈值,并采用置信区间感知的合格判定规则。在Qwen3 0.6B至8B四个规模上以最优配置测试,结果16种组合无一合格,呈现出明显的“合格性缺口”。通过logprob决策阈值诊断,作者将失败区分为能力不足和可通过调整解码阈值解决两类,共四种情形。量化到4比特的损害取决于模型规模,且未能使任何配置达标,说明缺口更多与模型规模相关而非精度。该结论在Llama-3.x上复现,且对锚点选择和提示措辞均稳健。实践建议是:将小模型置于满足置信阈值要求的基线之后,仅在其未达标处使用。
| Agent Harness | 智能体框架,指围绕大语言模型规划器构建的、用于执行微任务(如命令审批、记忆写入)的软件系统。 |
| SLM (Small Language Model) | 小语言模型,参数规模较小(如 0.6B-8B)的语言模型,通常用于资源受限或低延迟场景。 |
| Eligibility Gap | 合格性差距,指现成小语言模型在微任务上未能达到实践者预设阈值(τ)的现象。 |
| Quantization | 量化,将模型权重从高精度(如 FP16)转换为低精度(如 4 位)以减少内存和计算开销的技术。 |
| CI-aware Eligibility Rule | 考虑置信区间的合格性规则,要求配置的置信下界超过阈值 τ 才算通过,以控制统计不确定性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅