🔥 今日值得一读 智能体技能自修复新基准:350个任务,修复成功率绝对提升21.9%!
SkillScriptBench: Benchmarking Self-Evolution of Executable Agent Skill Packages Beyond Markdown
arXiv AI (cs.AI) 🔥 重点 #评测基准#Agent#技能自进化#代码修复 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做Agent技能包的开发者可用它检验技能修改时是否修好错误又不破坏原有正确行为。

📖 AI 总结

本文提出 SkillScriptBench,一个包含 350 项任务的基准,用于评估可执行智能体技能包在自我演化过程中的修复能力。研究者从逾 3.5 万个 GitHub 技能根目录中筛选出 100 个技能包,构建 150 项修复任务,每项任务在注入脚本故障的技能包上给出维护请求与可执行行为校验;另设 200 项受控任务,在干净、文档故障、脚本故障及双重故障四种状态下用同一请求评估。对四个大模型的测试显示,同时编辑文档与脚本的方法虽能修复脚本故障,但在文档修复与行为保持上并未稳定优于仅修改 Markdown 的方案。为此作者提出 AST-Guided Skill Revision,利用抽象语法树与调用关系将维护需求定位到相关代码位置,限定脚本修改范围并同步更新文档。该方法平均使修复成功率绝对提升 21.9%(Raw Package)与 27.7%(CoEvoSkills),三次运行全部成功的任务比例提升 20.8% 与 31.5%,表明修复一致性显著增强。

🔑 关键词速览

Executable Agent Skills可执行智能体技能,指将自然语言指令和脚本结合成可复用包,供LLM智能体执行任务。
SkillScriptBench一个包含350个任务的基准测试,用于分别评估智能体技能自演化中的文档修复、脚本修复和保持性能力。
AST-Guided Skill Revision一种利用抽象语法树和调用关系将维护需求链接到相关代码位置,从而指导脚本编辑和文档更新的方法。
CoEvoSkills一种基线方法,可能指协同演化技能,用于与所提方法进行比较。
Raw Package原始包,指未经修改的智能体技能包,作为评估修复效果的基线状态。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅