这篇论文针对开源模型路由器缺乏统一评测标准的问题,提出了一套通用测量协议,并在 RouterBench、BFCL v4、tau2-bench 和 WebArena 四个基准上,对四种开源路由器实现进行了混合评测,覆盖 290 个固定任务和 2610 个候选结果的锁定矩阵。关键发现是:三种路由器输出的层级分配基本恒定,只有 vLLM Semantic Router 会随提示内容明显变化,但它在四个基准上均未取得最高成功率;始终选择中间层级的基线在三个基准上与 Aurelio 完全一致,在第四个上差距不超过 0.003。对 vLLM 的任务级优势检验也未发现其相对按比例匹配的内容盲分配具有任务特异性优势,仅在 WebArena 上于协议设定的五个百分点边际内达到等价。研究由此指出,观察到的性能增益更多来自所选层级的组成结构,而非真正的任务特异性路由能力,因此固定层级基线和所选层级分布应成为路由器评测的必要控制项。结论仅适用于该配置、候选池和固定基准样本,不代表对所有路由范式的普遍判断。
| Model Routing | 模型路由,指根据任务或会话特征自动选择合适模型的过程。 |
| RouterBench | 一个用于评估模型路由器的基准测试套件。 |
| BFCL v4 | Berkeley Function Calling Leaderboard v4,评估模型函数调用能力的基准。 |
| tau2-bench | 一个用于评估智能体任务完成能力的基准测试。 |
| WebArena | 一个用于评估智能体在网页环境中执行任务能力的基准测试。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅