Anthropic为Claude Code推出了插件评估工作流,通过claude plugin eval命令,让插件开发者首次能够量化衡量插件的实际价值。该工具针对真实提示词运行插件并自动评分,同时与未加载插件的基线运行进行对比,回答三个此前无法测量的问题:技能是否被触发、能否在编辑或更换模型后依然有效、是否真正优于裸模型。评估套件置于插件的evals目录下,每个用例包含prompt.md和graders文件夹,支持六种评分器类型:regex、tool_used、tool_order、file_exists四种基于转录和磁盘文件计算、零成本;llm和baseline两种调用评判模型、产生费用。核心指标是Δ,即加载插件与不加载插件的得分差值,若两者均为满分则说明插件并非通过原因。该功能需Claude Code v2.1.269及以上版本,每次评估均为真实模型调用并计入账单,同时支持CI集成,标志着插件质量评估从主观判断走向可量化、可复现的工程化流程。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅