🔥 今日值得一读 LLM图推理新基准:GTA让Phi-4准确率从53.5%飙至69.1%!
GTA: Graph Theory Agent and Benchmark for Algorithmic Graph Reasoning with LLMs
arXiv AI (cs.AI) 🔥 重点 #Agent#图推理#评测基准 🕐 09-14 12:00
👨‍💼 主理人解读 · 为什么值得关注
可用GT Bench测LLM图算法推理,并借GTA提升结构化数据上的多步推理。

📖 AI 总结

本文提出GT Bench基准与GTA智能体,旨在系统评估并提升大语言模型执行多步图算法的能力。GT Bench涵盖24类经典图问题、44种任务结构设置,提供超过10万个样本,覆盖自然语言、结构化语言、邻接表和邻接矩阵四种输入表示。对八种大模型的评测显示,准确率高度依赖输入表示形式,最优表示会随图的密度、规模和拓扑结构以及模型本身而变化,且这种敏感性在最强推理模型中依然存在,只是有所减弱。为此,作者设计了GTA,将偏好训练的表示选择器与"规划—分解"框架结合,围绕冻结的执行模型工作。GTA将Phi-4在简单集上的准确率从53.5%提升至69.1%,在困难集上从33.0%提升至41.5%,优于八种提示与智能体基线,并可无需重新训练迁移至GraCoRe和NLGraph。该工作揭示了表示选择对图推理的关键影响,为LLM结构化推理提供了可复用的评测与增强方案。

🔑 关键词速览

GT Bench一个涵盖24个经典图问题、44种任务结构设置、超过10万示例的图论推理基准,支持四种输入表示形式。
GTA (Graph Theory Agent)一种图论智能体,结合偏好训练的表示选择器和计划-分解脚手架,围绕冻结的LLM执行器提升图算法推理性能。
表示选择器 (representation selector)一个经过偏好训练的组件,用于为给定的图推理任务选择最合适的输入表示形式(如自然语言、邻接表等)。
计划-分解脚手架 (plan-and-decompose scaffolding)一种将复杂图算法任务分解为子计划并逐步执行的提示框架,用于引导LLM进行多步推理。
Phi-4一个大型语言模型,在GT Bench上作为执行器LLM,通过GTA框架显著提升了图推理准确率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅