本文提出GT Bench基准与GTA智能体,旨在系统评估并提升大语言模型执行多步图算法的能力。GT Bench涵盖24类经典图问题、44种任务结构设置,提供超过10万个样本,覆盖自然语言、结构化语言、邻接表和邻接矩阵四种输入表示。对八种大模型的评测显示,准确率高度依赖输入表示形式,最优表示会随图的密度、规模和拓扑结构以及模型本身而变化,且这种敏感性在最强推理模型中依然存在,只是有所减弱。为此,作者设计了GTA,将偏好训练的表示选择器与"规划—分解"框架结合,围绕冻结的执行模型工作。GTA将Phi-4在简单集上的准确率从53.5%提升至69.1%,在困难集上从33.0%提升至41.5%,优于八种提示与智能体基线,并可无需重新训练迁移至GraCoRe和NLGraph。该工作揭示了表示选择对图推理的关键影响,为LLM结构化推理提供了可复用的评测与增强方案。
| GT Bench | 一个涵盖24个经典图问题、44种任务结构设置、超过10万示例的图论推理基准,支持四种输入表示形式。 |
| GTA (Graph Theory Agent) | 一种图论智能体,结合偏好训练的表示选择器和计划-分解脚手架,围绕冻结的LLM执行器提升图算法推理性能。 |
| 表示选择器 (representation selector) | 一个经过偏好训练的组件,用于为给定的图推理任务选择最合适的输入表示形式(如自然语言、邻接表等)。 |
| 计划-分解脚手架 (plan-and-decompose scaffolding) | 一种将复杂图算法任务分解为子计划并逐步执行的提示框架,用于引导LLM进行多步推理。 |
| Phi-4 | 一个大型语言模型,在GT Bench上作为执行器LLM,通过GTA框架显著提升了图推理准确率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅