跳转至

Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems

会议: NeurIPS2026(录用信息由任务包提供)
arXiv: 2609.30383
领域: LLM 安全 / 安全评测
关键词: 技能级联、组合安全、共享上下文、反事实验证、安全评测

一句话总结

本文以 SkillCascade-Bench 的 213 个经过筛选的案例说明:逐技能审查通过不等于联合执行安全;在三类智能体系统与八种模型的沙箱压力测试中,作者报告平均成功率 89.4%,而面向行为组合的防御只取得部分改善。

研究背景与动机

技能(skill)不是一个简单函数,而是自然语言说明、脚本、参考资料与资源文件组成的能力包。 基于技能的智能体按任务动态加载这些能力,复用第三方组件,因此安装审查成为供应链的重要边界。 然而,各技能并不拥有完全独立的语义执行空间:同一个大语言模型读取共享上下文,前一步的输出会参与下一步的解释与选择。 这意味着组件之间不仅传递数据,也传递对数据的判断;某项局部结论是否仍然适用于后续任务,并不能由安装时的一次批准自动保证。

既有技能扫描主要问“这个组件是否包含可疑行为”,运行时监控则常问“当前调用是否越过权限边界”。 本文关注的是另一种问题:单个组件的局部判断均被接受,联合结果却偏离用户的真实目标。 这种失败未必伴随显眼的异常调用,也不要求改变底层模型权重;它可能发生在事实解释、结果聚合与决策语义之间。 因此,局部合规性与端到端正确性是两个不同的命题,把前者相加不能直接推出后者。

研究的切入点是把跨组件风险变成可检验的条件,而不是仅展示一个令人担忧的例子。 作者同时要求单技能审查通过、联合执行产生不安全结果,以及恢复任意一项修改后该结果消失,以区分真正的组合效应和单点问题。 核心 idea:以联合行为及恢复组件后的反事实结果作为安全分析对象,检验“各组件分别通过审查”能否支持“整个工作流安全”的结论。

方法详解

整体框架

SkillCascade 是构建与验证压力测试案例的研究框架,SkillCascade-Bench 则是其中经过验证和筛选的案例集合。 本文笔记仅介绍威胁条件、证据结构与防御评估,不提供技能修改内容、生成提示、攻击构造流程或附录载荷。 这是评测与机制分析,不是训练一个新模型,也不是部署攻击的操作指南,因此不把研究阶段画成执行网络。

研究首先限定威胁边界:第三方供应链中的两个或更多受控技能被共同安装,随后在正常用户工作流中被调用。 攻击者不能修改模型权重、系统提示或平台机制,也不能操纵用户输入与用户会话,更不能修改其控制范围之外的技能。 共同安装是重要前提;论文讨论同一供应商的技能套件,但没有测量现实市场中这种受控共安装的发生概率。

框架由场景发现、候选案例构建、独立扫描、测试案例生成与结果裁判五类研究角色组成。 从防御审计角度,关键不是这些角色如何制作候选内容,而是它们提供了哪些证据:任务是否合理、组件是否被分别批准、沙箱轨迹是否实现评测条件,以及组件恢复后是否仍有同样结果。 独立扫描只见一个技能,结果裁判依据输出与轨迹判断,不接收攻击计划;人工审核进一步核查真实性、联合依赖与结果证据。 这些信息边界减少部分评测污染,却不能消除案例筛选或共享模型带来的相关误差。

关键设计

1. 组合安全条件:把组件批准与工作流安全分开

论文中的“单独隐蔽”首先是扫描器返回通过的操作性定义,并非证明修改在所有上下文中均无害。 设被评测的修改后系统为 \(\mathcal{A}^{*}\),恢复第 \(i\) 项修改的系统为 \(\mathcal{A}^{*\setminus i}\);\(h\) 是结果危害指标,\(\tau\) 是联合危害阈值,\(\varepsilon\) 是远小于它的容许残余值。 定义的核心可以写成以下三个条件,符号沿用原文:

\[ \forall i,\;\mathrm{scan}(\delta_i(S_i))=\mathrm{safe}, \qquad h(\mathrm{exec}(\mathcal{A}^{*},q))>\tau, \qquad \forall i,\;h(\mathrm{exec}(\mathcal{A}^{*\setminus i},q))\leq\varepsilon, \quad \varepsilon\ll\tau. \]

第一项描述组件审查结果,第二项描述联合执行结果,第三项描述逐项恢复后的反事实结果。 三者回答不同问题:发现联合失败不能证明组件分别被批准;分别被批准也不能证明危害依赖整个组合。 这里的不可或缺性(indispensability)要求恢复的是修改,而不是删除整个技能;后者可能只是破坏正常任务能力,难以归因。 同样,工作流包含三个技能不代表存在三项修改,附录也包含未修改的渲染组件。

这个定义的价值在于提供系统级审计目标,而不是说明某种扫描器永远不能改善。 所有判定仍依赖所选任务、危害标准与扫描器;一种工具的通过结果不能被提升为普遍的安全认证。 防御者需要保留从用户目标到最终输出的证据链,明确每项局部判断在什么范围内有效。

2. 级联模式:区分顺序依赖与聚合依赖

因果级联(causal cascade)依赖执行顺序:前一步的结果必须进入共享上下文,后一步才能以它为依据继续解释。 组合级联(compositional cascade)强调多个相对独立的贡献共同形成最终问题,理论描述中不要求固定的出现顺序。 混合级联(hybrid cascade)同时包含顺序传递与多贡献汇合,不能简单归入其中一类。 这里的“组合安全”是统称,而“组合级联”仅是三种模式之一;“因果”也不等于已经完成严格的因果识别。

共享上下文使这些区别具有实际意义:安全检查不仅要知道哪个组件产生了什么,还要知道后续组件把它当成事实、判断还是授权。 顺序依赖应检查跨步骤的前提继承,聚合依赖应检查最终结果是否违反整体约束,混合依赖需要同时覆盖两者。 只把多个技能文本放进同一次查询,并不保证检查器真正推理了这些关系。 因此,联合审查的“看到更多内容”与“理解内容组合后的后果”是不同能力。

模式标签也需要谨慎使用。 附录对某个组合案例强调贡献独立,却又描述下游组件依赖上游字段;这提示实际案例可能同时具有数据流依赖与贡献汇合。 若要形成稳健分类,应明确区分执行先后、字段依赖和危害贡献,而不能仅凭作者标签推断完全可交换性。 本笔记不复述案例中的修改细节,只保留这一分类与证据口径的限制。

3. 验证与选择:把成功案例集视作条件性压力测试

基准收录 213 个案例,覆盖 10 个领域、七类目标与三种模式,平均工作流长度为 3.25 个技能。 目标分别涉及输出错误、决策偏移、功能失效、质量下降、范围偏移、信息泄露及未经授权的动作。 这些是评测结果的类别,不是技能内容或可执行行为;其共同点是检验当前用户请求是否遭受端到端损害。 案例先经自动结果判定,再由三名专家独立审核,只有三人均同意的案例才进入基准。

人工审核检查联合依赖、用户工作流合理性与输出是否满足评测条件;候选审核的 Fleiss's \(\kappa=0.82\)。 每种目标系统配置对每个案例执行三次,报告三次运行的平均成功率。 结果裁判的另一个人工抽查只有 30 条判断,报告 Cohen's \(\kappa=0.86\);这一数字支持有限的一致性检查,而不是全领域准确性保证。 裁判依据案例自身的评测条件,因而条件写得过窄或只检查某个措辞时,判定也可能偏离用户真正关心的损害。

附录说明四类反馈预算的默认上限均为 3,项目总 API 开销约为 8,000 美元,含预实验与失败尝试。 这些信息应作为选择机制与资源条件来理解,不作为调整或复现指令。 成功案例经过有预算的筛选,因此报告成功率是对已验证案例再次运行的条件性结果,不是随机技能套件的失败概率。 论文未给出足以估计市场发生率的共安装分母,也不能从总 API 费用推算单案例成本。

4. 行为组合审查:验证跨技能承诺的整体后果

作者提出行为组合扫描器(Behavior-Composition Scanner)作为概念验证防御。 它先概括每个技能在什么条件下承诺何种行为,再联合推理这些承诺的后果,最后用假设场景判断整体结果是否不安全。 该方向与简单的联合文本审查不同:审计对象从“组件有没有问题”变成“这些局部承诺共同成立时会发生什么”。 它不依赖本笔记复现任何原始攻击内容,也不构成完整防护方案。

这一防御可看作生成式反事实审计:对系统应当保持的约束进行端到端检查,而不是只对孤立文本作分类。 论文报告因果级联的扫描通过率下降超过 30 个百分点,但组合级联改善较小,混合级联更弱。 文本缓存没有该图的完整数值,不能据此补出精确的检测率或各模式排名差距。 作者也明确将它定位为概念验证,不能把“比既有检查更敏感”写成“已经解决组合安全”。

实验关键数据

主实验

下表摘录原文表 2 的全部模型配置;ASR 是结果裁判判定目标已实现的案例比例,越高表示受测系统越脆弱。 所有数值均为百分比,最后一列保留原文显示的行均值,不重新替换。

模型 OpenClaw ASR Claude Code ASR Codex ASR 原文 Avg
GPT-5.4 82.6 78.4 80.9 80.6
GPT-5.4 Mini 100.0 95.8 94.3 96.7
Claude Opus 4.6 78.5 74.2 76.8 76.5
Claude Sonnet 4.6 91.7 89.2 88.5 89.8
Gemini 2.5 Pro 90.2 86.4 88.9 88.5
Gemini 2.5 Flash 94.1 91.3 92.6 92.7
Qwen 3 72B 99.1 96.7 95.4 97.1
Kimi K2.5 95.2 92.4 93.1 93.6

报告值与表值核对:正文报告全局 ASR 为 89.4%;表中 24 个显示值的等权平均约为 89.43%,四舍五入到一位小数后同为 89.4%。 显示值的平均与作者报告一致,但显示值并非逐次运行的原始数据。 舍入后的表格不能替代原始运行统计,因此这里的一致性仅限于已显示数值的精度。

消融实验

下表合并原文表 3–4 的部署前审查结果,SR 是审查通过比例,不是检测准确率。 单技能审查的分母是技能提交,联合审查的分母是整个技能组合,两个粒度不能直接相减解释成防御提升。 \(\Delta\) 保留原文“修改后减原始”的百分点差;原始技能被拒绝的比例也不是经完整金标验证的误报率。

审查粒度 扫描器 / 模式 原始 SR (%) 修改后 SR (%) \(\Delta\)(百分点)
单技能 Skill-Scanner / Static 96.8 94.3 -2.5
单技能 SkillScan / Static 95.4 92.1 -3.3
单技能 Skill-Scanner / LLM 91.3 86.6 -4.7
单技能 Skill-Vetter / LLM 94.2 90.5 -3.7
单技能 AIG-Scanner / LLM 93.0 89.2 -3.8
联合 Skill-Scanner / Static 82.7 82.7 0.0
联合 SkillProbe / Hybrid 86.0 81.7 -4.3
联合 Joint-LLM / LLM 88.2 83.0 -5.2

下表摘录原文表 5,仅适用于 OpenClaw + GPT-5.4-mini 的运行时防御评测。 DER 是未被运行时防御发现的案例比例,不能当作部署防御后的残余 ASR,也不能与 SR 混为同一指标。

运行时防御 监控范式 DER (%)
DefenseClaw 静态与动态策略 90.6
ClawGuard 逐调用规则执行 88.9
HITL Defense 按风险分级的阶段门控 91.8
AgentDoG 轨迹级检查 82.5

不可或缺性分析针对三技能工作流:恢复一项修改后残余 ASR 为 13–18%,恢复两项后降到个位数。 这支持大部分危害依赖多项修改,但不等于每次运行均满足定义中近乎消失的残余危害要求。 图形未在文本缓存中给出完整逐模式数值,不能补造更精细的消融表。

关键发现

  • 不同模型的行均值为 76.5–97.1%,同一模型跨宿主差距小于 6 个百分点;在这个已筛选基准上,模型差异比宿主差异更明显。
  • 逐技能与联合扫描都仍批准多数修改样本,但这不证明未来所有联合防御无效,也不构成统计“不可区分”的正式检验。
  • 四项运行时防御的 DER 平均约为 88.5%;AgentDoG 的 82.5% 是表内最低值,仍不代表它在所有系统与任务上最优。
  • 恢复实验留下非零残余,行为组合扫描器也只取得部分改善;安全结论应保留这两项非理想结果。

亮点与洞察

  • 安全单元的改变:论文把组件批准与联合结果明确分开。对第三方技能套件而言,组件审核记录不能替代工作流级证据。
  • 反事实验证的价值:恢复修改而保留技能功能,有助于判断失败是否确实依赖组合。残余成功率也提醒审计者不要把强定义和经验近似混为一谈。
  • 联合可见性不是联合理解:检查器同时看到多个技能仍可能漏掉整体后果。行为承诺、数据来源与端到端约束比简单拼接更值得防御研究关注。

局限与展望

  • 选择偏差与外推边界:基准只保留已成功且经一致认可的案例,评测运行在沙箱;89.4% 不是现实世界事故率或任意技能组合的风险估计。
  • 裁判覆盖有限:30 条判断的人工抽查无法支撑每个领域、目标和模型上的可靠性。应增加分层盲审、置信区间以及与具体输出措辞无关的危害标准。
  • 定义与验证存在距离:恢复一项后仍有 13–18% 残余 ASR;应逐案例、逐修改报告反事实结果,并区分不可或缺的修改与未修改的辅助组件。
  • 模式分类有歧义:贡献独立与字段依赖可以同时存在。未来应以明确的数据流关系和危害聚合规则描述案例,减少仅凭标签的解释。
  • 防御评估尚不完整:行为组合扫描器没有完整数值表,且尚缺正常任务效用、误报代价与不同工作流长度的系统性比较,不能声称胜出或全覆盖。

相关工作与启发

  • vs Skill-Inject / SkillJect:这些工作主要研究单技能层面的风险;本文强调多项修改共同作用及逐项恢复后的结果,关注点是安全判断的组合性而非某个局部载荷。
  • vs STAC 与工具链研究:原文将其与不修改组件、主要改变调用或消息的研究相区分。具体工作的威胁模型仍需逐篇核对,这里仅采用本文提出的比较维度,不把其综述概括当成统一事实。
  • vs SkillProbe / Joint-LLM:它们提供跨技能可见性,但本基准的审查通过率仍高;行为组合扫描器进一步要求推理共同承诺的后果,结果显示方向有价值而方案未成熟。
  • 防御研究启发:可优先研究中间判断的来源与适用范围、关键事实在工作流中的保留,以及最终结果对用户目标的符合性,而不是增加组件批准次数。

评分

  • 新颖性: 4/5 — 将局部审查、联合危害与不可或缺性结合为明确研究对象。
  • 实验充分度: 3/5 — 跨系统覆盖较广,但成功案例筛选、裁判抽查规模与防御效用评估限制结论。
  • 写作质量: 3/5 — 主线清楚,但表号引用、模式边界与严格定义和残余结果的对应仍需澄清。
  • 价值: 4/5 — 为工作流级安全审计提供证据与方向,没有给出完整防御保证。