AI补丁测试通过却上线就崩!真实模型一加载全暴露
How SWE-Serve Exposes the Gap Between Local Tests and Live Serving
NVIDIA Developer Blog 重要 Agent论文方法算力 🕐 今天 00:00

📖 AI 总结

SWE-Serve 是 NVIDIA 联合 SGLang 团队开发的评测基准,用于检验 AI 编程智能体在推理服务工程中的真实表现。它基于 83 个已合并的 SGLang 拉取请求构建了 53 项任务,覆盖模型启用、解码、缓存、调度、服务 API 和分布式执行六大类。关键发现是:在 19 项包含实时服务检查的任务中,同一补丁在排除实时验证时通过率为 69.4%,但经过完整验证后骤降至 45.9%,意味着约三分之一的补丁虽能通过其他测试,却在实际服务路径中失败。跨多个运行时域的任务通过率比单一域任务低 21.3 个百分点,且所有被测模型均呈现这一差距。在闭卷条件下评测的 11 个模型中,平均 pass@1 从 34.6% 到 75.5% 不等,顶尖模型得分相近但成本与耗时差异显著。该基准揭示了本地测试与真实服务之间的系统性鸿沟,强调评估推理软件变更必须验证完整服务路径。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅