本文提出"推理网络"这一图结构框架,用于刻画多个大语言模型协同推理时的调用关系:节点代表不同模型,连边代表条件激活。研究聚焦于由多个成本与能力各异的专家模型串联组成的基础拓扑,将模型选择问题形式化为在满足目标性能约束下最小化期望推理成本。作者证明最优激活策略具有阈值结构:先调用成本最低的模型,仅当置信度低于阈值时才启用更昂贵的模型;判别式任务对应每类一个阈值,生成式任务则只需单一阈值。论文给出了阈值的计算方法及置信度估计机制,并通过开源模型实验验证,在满足性能预算的同时显著降低了推理成本。该工作为多模型协同推理提供了有原则的优化依据。
| 推理网络 | 一种基于图的框架,节点表示不同的LLM,链接表示条件模型激活,用于优化模型使用策略。 |
| 专家LLM | 指在特定任务或领域具有专长的语言模型,通常具有不同的成本和能力水平。 |
| 成本-性能权衡 | 在推理过程中平衡计算成本与模型性能之间的关系,以找到最优的使用策略。 |
| 阈值结构 | 最优激活策略的一种形式,即根据置信度是否低于某个阈值来决定是否调用更昂贵的模型。 |
| 置信度估计 | 评估模型对当前查询的自信程度,用于决定是否需要调用更强大的模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅