Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems¶
会议: NeurIPS2026(录用信息由任务包提供)
arXiv: 2609.30383
领域: LLM 安全 / 安全评测
关键词: 技能级联、组合安全、共享上下文、反事实验证、安全评测
一句话总结¶
本文以 SkillCascade-Bench 的 213 个经过筛选的案例说明:逐技能审查通过不等于联合执行安全;在三类智能体系统与八种模型的沙箱压力测试中,作者报告平均成功率 89.4%,而面向行为组合的防御只取得部分改善。
研究背景与动机¶
技能(skill)不是一个简单函数,而是自然语言说明、脚本、参考资料与资源文件组成的能力包。 基于技能的智能体按任务动态加载这些能力,复用第三方组件,因此安装审查成为供应链的重要边界。 然而,各技能并不拥有完全独立的语义执行空间:同一个大语言模型读取共享上下文,前一步的输出会参与下一步的解释与选择。 这意味着组件之间不仅传递数据,也传递对数据的判断;某项局部结论是否仍然适用于后续任务,并不能由安装时的一次批准自动保证。
既有技能扫描主要问“这个组件是否包含可疑行为”,运行时监控则常问“当前调用是否越过权限边界”。 本文关注的是另一种问题:单个组件的局部判断均被接受,联合结果却偏离用户的真实目标。 这种失败未必伴随显眼的异常调用,也不要求改变底层模型权重;它可能发生在事实解释、结果聚合与决策语义之间。 因此,局部合规性与端到端正确性是两个不同的命题,把前者相加不能直接推出后者。
研究的切入点是把跨组件风险变成可检验的条件,而不是仅展示一个令人担忧的例子。 作者同时要求单技能审查通过、联合执行产生不安全结果,以及恢复任意一项修改后该结果消失,以区分真正的组合效应和单点问题。 核心 idea:以联合行为及恢复组件后的反事实结果作为安全分析对象,检验“各组件分别通过审查”能否支持“整个工作流安全”的结论。
方法详解¶
整体框架¶
SkillCascade 是构建与验证压力测试案例的研究框架,SkillCascade-Bench 则是其中经过验证和筛选的案例集合。 本文笔记仅介绍威胁条件、证据结构与防御评估,不提供技能修改内容、生成提示、攻击构造流程或附录载荷。 这是评测与机制分析,不是训练一个新模型,也不是部署攻击的操作指南,因此不把研究阶段画成执行网络。
研究首先限定威胁边界:第三方供应链中的两个或更多受控技能被共同安装,随后在正常用户工作流中被调用。 攻击者不能修改模型权重、系统提示或平台机制,也不能操纵用户输入与用户会话,更不能修改其控制范围之外的技能。 共同安装是重要前提;论文讨论同一供应商的技能套件,但没有测量现实市场中这种受控共安装的发生概率。
框架由场景发现、候选案例构建、独立扫描、测试案例生成与结果裁判五类研究角色组成。 从防御审计角度,关键不是这些角色如何制作候选内容,而是它们提供了哪些证据:任务是否合理、组件是否被分别批准、沙箱轨迹是否实现评测条件,以及组件恢复后是否仍有同样结果。 独立扫描只见一个技能,结果裁判依据输出与轨迹判断,不接收攻击计划;人工审核进一步核查真实性、联合依赖与结果证据。 这些信息边界减少部分评测污染,却不能消除案例筛选或共享模型带来的相关误差。
关键设计¶
1. 组合安全条件:把组件批准与工作流安全分开
论文中的“单独隐蔽”首先是扫描器返回通过的操作性定义,并非证明修改在所有上下文中均无害。 设被评测的修改后系统为 \(\mathcal{A}^{*}\),恢复第 \(i\) 项修改的系统为 \(\mathcal{A}^{*\setminus i}\);\(h\) 是结果危害指标,\(\tau\) 是联合危害阈值,\(\varepsilon\) 是远小于它的容许残余值。 定义的核心可以写成以下三个条件,符号沿用原文:
第一项描述组件审查结果,第二项描述联合执行结果,第三项描述逐项恢复后的反事实结果。 三者回答不同问题:发现联合失败不能证明组件分别被批准;分别被批准也不能证明危害依赖整个组合。 这里的不可或缺性(indispensability)要求恢复的是修改,而不是删除整个技能;后者可能只是破坏正常任务能力,难以归因。 同样,工作流包含三个技能不代表存在三项修改,附录也包含未修改的渲染组件。
这个定义的价值在于提供系统级审计目标,而不是说明某种扫描器永远不能改善。 所有判定仍依赖所选任务、危害标准与扫描器;一种工具的通过结果不能被提升为普遍的安全认证。 防御者需要保留从用户目标到最终输出的证据链,明确每项局部判断在什么范围内有效。
2. 级联模式:区分顺序依赖与聚合依赖
因果级联(causal cascade)依赖执行顺序:前一步的结果必须进入共享上下文,后一步才能以它为依据继续解释。 组合级联(compositional cascade)强调多个相对独立的贡献共同形成最终问题,理论描述中不要求固定的出现顺序。 混合级联(hybrid cascade)同时包含顺序传递与多贡献汇合,不能简单归入其中一类。 这里的“组合安全”是统称,而“组合级联”仅是三种模式之一;“因果”也不等于已经完成严格的因果识别。
共享上下文使这些区别具有实际意义:安全检查不仅要知道哪个组件产生了什么,还要知道后续组件把它当成事实、判断还是授权。 顺序依赖应检查跨步骤的前提继承,聚合依赖应检查最终结果是否违反整体约束,混合依赖需要同时覆盖两者。 只把多个技能文本放进同一次查询,并不保证检查器真正推理了这些关系。 因此,联合审查的“看到更多内容”与“理解内容组合后的后果”是不同能力。
模式标签也需要谨慎使用。 附录对某个组合案例强调贡献独立,却又描述下游组件依赖上游字段;这提示实际案例可能同时具有数据流依赖与贡献汇合。 若要形成稳健分类,应明确区分执行先后、字段依赖和危害贡献,而不能仅凭作者标签推断完全可交换性。 本笔记不复述案例中的修改细节,只保留这一分类与证据口径的限制。
3. 验证与选择:把成功案例集视作条件性压力测试
基准收录 213 个案例,覆盖 10 个领域、七类目标与三种模式,平均工作流长度为 3.25 个技能。 目标分别涉及输出错误、决策偏移、功能失效、质量下降、范围偏移、信息泄露及未经授权的动作。 这些是评测结果的类别,不是技能内容或可执行行为;其共同点是检验当前用户请求是否遭受端到端损害。 案例先经自动结果判定,再由三名专家独立审核,只有三人均同意的案例才进入基准。
人工审核检查联合依赖、用户工作流合理性与输出是否满足评测条件;候选审核的 Fleiss's \(\kappa=0.82\)。 每种目标系统配置对每个案例执行三次,报告三次运行的平均成功率。 结果裁判的另一个人工抽查只有 30 条判断,报告 Cohen's \(\kappa=0.86\);这一数字支持有限的一致性检查,而不是全领域准确性保证。 裁判依据案例自身的评测条件,因而条件写得过窄或只检查某个措辞时,判定也可能偏离用户真正关心的损害。
附录说明四类反馈预算的默认上限均为 3,项目总 API 开销约为 8,000 美元,含预实验与失败尝试。 这些信息应作为选择机制与资源条件来理解,不作为调整或复现指令。 成功案例经过有预算的筛选,因此报告成功率是对已验证案例再次运行的条件性结果,不是随机技能套件的失败概率。 论文未给出足以估计市场发生率的共安装分母,也不能从总 API 费用推算单案例成本。
4. 行为组合审查:验证跨技能承诺的整体后果
作者提出行为组合扫描器(Behavior-Composition Scanner)作为概念验证防御。 它先概括每个技能在什么条件下承诺何种行为,再联合推理这些承诺的后果,最后用假设场景判断整体结果是否不安全。 该方向与简单的联合文本审查不同:审计对象从“组件有没有问题”变成“这些局部承诺共同成立时会发生什么”。 它不依赖本笔记复现任何原始攻击内容,也不构成完整防护方案。
这一防御可看作生成式反事实审计:对系统应当保持的约束进行端到端检查,而不是只对孤立文本作分类。 论文报告因果级联的扫描通过率下降超过 30 个百分点,但组合级联改善较小,混合级联更弱。 文本缓存没有该图的完整数值,不能据此补出精确的检测率或各模式排名差距。 作者也明确将它定位为概念验证,不能把“比既有检查更敏感”写成“已经解决组合安全”。
实验关键数据¶
主实验¶
下表摘录原文表 2 的全部模型配置;ASR 是结果裁判判定目标已实现的案例比例,越高表示受测系统越脆弱。 所有数值均为百分比,最后一列保留原文显示的行均值,不重新替换。
| 模型 | OpenClaw ASR | Claude Code ASR | Codex ASR | 原文 Avg |
|---|---|---|---|---|
| GPT-5.4 | 82.6 | 78.4 | 80.9 | 80.6 |
| GPT-5.4 Mini | 100.0 | 95.8 | 94.3 | 96.7 |
| Claude Opus 4.6 | 78.5 | 74.2 | 76.8 | 76.5 |
| Claude Sonnet 4.6 | 91.7 | 89.2 | 88.5 | 89.8 |
| Gemini 2.5 Pro | 90.2 | 86.4 | 88.9 | 88.5 |
| Gemini 2.5 Flash | 94.1 | 91.3 | 92.6 | 92.7 |
| Qwen 3 72B | 99.1 | 96.7 | 95.4 | 97.1 |
| Kimi K2.5 | 95.2 | 92.4 | 93.1 | 93.6 |
报告值与表值核对:正文报告全局 ASR 为 89.4%;表中 24 个显示值的等权平均约为 89.43%,四舍五入到一位小数后同为 89.4%。 显示值的平均与作者报告一致,但显示值并非逐次运行的原始数据。 舍入后的表格不能替代原始运行统计,因此这里的一致性仅限于已显示数值的精度。
消融实验¶
下表合并原文表 3–4 的部署前审查结果,SR 是审查通过比例,不是检测准确率。 单技能审查的分母是技能提交,联合审查的分母是整个技能组合,两个粒度不能直接相减解释成防御提升。 \(\Delta\) 保留原文“修改后减原始”的百分点差;原始技能被拒绝的比例也不是经完整金标验证的误报率。
| 审查粒度 | 扫描器 / 模式 | 原始 SR (%) | 修改后 SR (%) | \(\Delta\)(百分点) |
|---|---|---|---|---|
| 单技能 | Skill-Scanner / Static | 96.8 | 94.3 | -2.5 |
| 单技能 | SkillScan / Static | 95.4 | 92.1 | -3.3 |
| 单技能 | Skill-Scanner / LLM | 91.3 | 86.6 | -4.7 |
| 单技能 | Skill-Vetter / LLM | 94.2 | 90.5 | -3.7 |
| 单技能 | AIG-Scanner / LLM | 93.0 | 89.2 | -3.8 |
| 联合 | Skill-Scanner / Static | 82.7 | 82.7 | 0.0 |
| 联合 | SkillProbe / Hybrid | 86.0 | 81.7 | -4.3 |
| 联合 | Joint-LLM / LLM | 88.2 | 83.0 | -5.2 |
下表摘录原文表 5,仅适用于 OpenClaw + GPT-5.4-mini 的运行时防御评测。 DER 是未被运行时防御发现的案例比例,不能当作部署防御后的残余 ASR,也不能与 SR 混为同一指标。
| 运行时防御 | 监控范式 | DER (%) |
|---|---|---|
| DefenseClaw | 静态与动态策略 | 90.6 |
| ClawGuard | 逐调用规则执行 | 88.9 |
| HITL Defense | 按风险分级的阶段门控 | 91.8 |
| AgentDoG | 轨迹级检查 | 82.5 |
不可或缺性分析针对三技能工作流:恢复一项修改后残余 ASR 为 13–18%,恢复两项后降到个位数。 这支持大部分危害依赖多项修改,但不等于每次运行均满足定义中近乎消失的残余危害要求。 图形未在文本缓存中给出完整逐模式数值,不能补造更精细的消融表。
关键发现¶
- 不同模型的行均值为 76.5–97.1%,同一模型跨宿主差距小于 6 个百分点;在这个已筛选基准上,模型差异比宿主差异更明显。
- 逐技能与联合扫描都仍批准多数修改样本,但这不证明未来所有联合防御无效,也不构成统计“不可区分”的正式检验。
- 四项运行时防御的 DER 平均约为 88.5%;AgentDoG 的 82.5% 是表内最低值,仍不代表它在所有系统与任务上最优。
- 恢复实验留下非零残余,行为组合扫描器也只取得部分改善;安全结论应保留这两项非理想结果。
亮点与洞察¶
- 安全单元的改变:论文把组件批准与联合结果明确分开。对第三方技能套件而言,组件审核记录不能替代工作流级证据。
- 反事实验证的价值:恢复修改而保留技能功能,有助于判断失败是否确实依赖组合。残余成功率也提醒审计者不要把强定义和经验近似混为一谈。
- 联合可见性不是联合理解:检查器同时看到多个技能仍可能漏掉整体后果。行为承诺、数据来源与端到端约束比简单拼接更值得防御研究关注。
局限与展望¶
- 选择偏差与外推边界:基准只保留已成功且经一致认可的案例,评测运行在沙箱;89.4% 不是现实世界事故率或任意技能组合的风险估计。
- 裁判覆盖有限:30 条判断的人工抽查无法支撑每个领域、目标和模型上的可靠性。应增加分层盲审、置信区间以及与具体输出措辞无关的危害标准。
- 定义与验证存在距离:恢复一项后仍有 13–18% 残余 ASR;应逐案例、逐修改报告反事实结果,并区分不可或缺的修改与未修改的辅助组件。
- 模式分类有歧义:贡献独立与字段依赖可以同时存在。未来应以明确的数据流关系和危害聚合规则描述案例,减少仅凭标签的解释。
- 防御评估尚不完整:行为组合扫描器没有完整数值表,且尚缺正常任务效用、误报代价与不同工作流长度的系统性比较,不能声称胜出或全覆盖。
相关工作与启发¶
- vs Skill-Inject / SkillJect:这些工作主要研究单技能层面的风险;本文强调多项修改共同作用及逐项恢复后的结果,关注点是安全判断的组合性而非某个局部载荷。
- vs STAC 与工具链研究:原文将其与不修改组件、主要改变调用或消息的研究相区分。具体工作的威胁模型仍需逐篇核对,这里仅采用本文提出的比较维度,不把其综述概括当成统一事实。
- vs SkillProbe / Joint-LLM:它们提供跨技能可见性,但本基准的审查通过率仍高;行为组合扫描器进一步要求推理共同承诺的后果,结果显示方向有价值而方案未成熟。
- 防御研究启发:可优先研究中间判断的来源与适用范围、关键事实在工作流中的保留,以及最终结果对用户目标的符合性,而不是增加组件批准次数。
评分¶
- 新颖性: 4/5 — 将局部审查、联合危害与不可或缺性结合为明确研究对象。
- 实验充分度: 3/5 — 跨系统覆盖较广,但成功案例筛选、裁判抽查规模与防御效用评估限制结论。
- 写作质量: 3/5 — 主线清楚,但表号引用、模式边界与严格定义和残余结果的对应仍需澄清。
- 价值: 4/5 — 为工作流级安全审计提供证据与方向,没有给出完整防御保证。