这项研究针对智能体技能(Agent Skills)的下游效用展开实证分析,基于87个SkillsBench任务,将下游效用定义为在相同模型与执行框架配置下,使用技能相对于无技能基线在通过率上的差异。研究在九种配置下对比同一批技能,并考察已发布替代技能及固定技能集的组织方式,候选技能从包含37596个技能的语料库中检索。关键发现是:同一技能在36.78%的任务上对部分配置有益、对另一些配置有害,推荐流程有时反而成为执行负担;相关性排序会遗漏更有用的候选技能,而按所需操作支持度重新排序可使首选通过率提升4.35至5.80个百分点。研究还归纳出17条编写实践,并发现阶段计划与依赖DAG优于单纯使用顺序,DAG的额外收益集中在配备五到六个技能的任务上。该研究提示开发者应评估可用的操作支持、在保留任务要求的前提下允许流程适配,并在组织技能时明确产物依赖关系。
| Agent Skills | 为智能体打包过程性指导和可复用资源的技能模块。 |
| SkillsBench | 用于评估智能体技能下游效用的基准任务集。 |
| 下游效用 | 在相同配置下,使用技能相对于无技能基线在任务通过率上的差异。 |
| Dependency DAG | 用有向无环图表示技能间依赖关系的组织方式。 |
| Stage Plan | 按阶段组织技能执行顺序的计划方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅