🔥 今日值得一读 多模型协作反降智!COMED选择性升级,MedQA暴涨10.7%,GPT-5.5冲至28.1%
COMED: The Missing Middle Between Routing and Collaboration in Multi-LLM Inference
arXiv CL (cs.CL) 🔥 重点 #多LLM协作#模型路由#推理优化 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
多模型推理时不必每次都全员协作,COMED可判断何时升级到更强模型,节省成本又避免答案被改坏。

📖 AI 总结

本文提出COMED,一种介于模型路由与密集协作之间的多LLM推理控制方法。作者指出,现有路由方法在选定初始模型后即停止调整,而密集协作虽能整合多个模型输出,却存在非单调性:同伴模型既能纠正无人单独解决的错误,也可能破坏原本正确的答案。COMED作为锚定后的选择性协作控制器,利用锚模型自一致性、路由器边际值和轻量级同伴探测,对高置信答案直接采纳,对模糊情形进行验证,仅在协作可能带来收益时才升级调用其他模型。研究通过“救援—损害”分解形式化了这一权衡,表明当被挽救的错误多于协作引入的损害时,选择性协作才有效。在医学、科学和通用推理基准上,COMED在全部16个开放权重设置中均优于固定与路由锚点,MedQA最高提升10.7个百分点,且调用模型更少、解码token更少;在HLE上,它将GPT-5.5从23.1%提升至28.1%,超过密集协作并取得最佳结果。

🔑 关键词速览

COMED一种用于多LLM推理的选择性跨模型协作控制器,通过锚定自一致性、路由器边际和同伴探测来决定是否升级到同伴模型。
多LLM推理利用多个大语言模型进行推理的系统,通过路由或协作方式组合不同模型的输出以提高可靠性。
路由在多个模型中选择一个初始模型来处理查询的机制,选定后不再调用其他模型。
密集协作对每个查询都调用多个同伴模型进行协作推理的方式,计算成本较高。
救援-危害分解一种形式化权衡的方法,分析协作带来的错误救援与协作引发的危害之间的平衡。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅