🔥 今日值得一读 每个技能单看都无害,组合执行却让严重药物警告在医生眼前消失,213个级联攻击测试用例已覆盖多个智能体系统!
Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems
arXiv AI (cs.AI) 🔥 重点 Agent安全对齐论文方法 🕐 今天 12:00

📖 AI 总结

本文提出了一种针对基于技能的智能体系统的新型威胁范式——技能级联攻击。技能是智能体在运行时加载的模块化能力包,包含自然语言指令、可执行脚本和参考资源。现有研究主要关注单个技能内部的漏洞,而忽视了技能之间交互所产生的风险。技能级联攻击的核心思路是将恶意目标分散到多个技能中,使每个技能的修改在孤立审视时都显得无害,但其组合执行却会产生危害。论文以处方审核流程为例说明:第一个技能削弱近期停用药物的信号,第二个技能降低相关药物相互作用的严重等级,第三个技能在最终摘要中压制由此产生的低优先级警报,最终使严重的药物相互作用警告在到达医生之前悄然消失。为系统研究这一安全盲区,作者开发了自动化多智能体红队测试框架SkillCascade,并发布了包含213个经过验证的级联测试用例的SkillCascade-Bench基准,覆盖多种智能体系统和领域。实验表明,在OpenClaw、Claude Code、Codex等代表性智能体及多种大模型基座上,级联交互能够稳定诱发有害行为,同时规避现有的单技能扫描器和运行时监控器。该研究揭示了组件级完整性与系统级安全之间的差距,呼吁防御机制应从孤立审视单个技能转向对跨技能交互进行推理。

🔑 关键词速览

技能级联攻击 (Skill Cascading Attacks)一种将恶意目标拆分到多个技能中的攻击范式,每个技能单独看都无害,但组合执行后产生危害。
基于技能的智能体系统 (Skill-Based Agent Systems)允许智能体在运行时加载模块化技能包(含指令、脚本和资源)以扩展任务能力的系统。
SkillCascade本文提出的自动化多智能体红队测试框架,用于系统性地发现和验证跨技能级联攻击。
SkillCascade-Bench本文发布的基准数据集,包含 213 个经过验证的级联攻击测试用例,覆盖多个智能体系统和领域。
单技能扫描器 (Per-Skill Scanner)仅检查单个技能内部是否存在恶意内容的现有安全检测工具,无法识别跨技能组合攻击。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅