Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3308
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/869.pdf
项目: Anti-Prompt
领域: AI 安全
关键词: 图像保护、图生视频、文本抑制、视觉主导、失效评估
一句话总结¶
Anti-Prompt 在图像所有者发布图片前加入微小保护性扰动,通过削弱文本条件、增强视觉通路的相对主导性并扰乱图像编码,使未经授权的图生视频更难保持连贯;在 CogVideoX 白盒实验中,其视频评估均分为 3.25,低于复现 I2VGuard 的 3.92,表示更强的保护效果。
研究背景与动机¶
图生视频不只是把静态照片加上运动:文本提示还会影响主体是否保持原貌、几何结构是否稳定,以及前后帧是否相容。 对图像所有者而言,问题在于公开图片可以被反复用于未获授权的视频生成,而所有者通常既不能控制后续提示,也不能修改生成服务。 保护性扰动因此试图保留图片本身的正常观看价值,同时降低它作为生成条件的可用性。 已有 I2VGuard 针对时空一致性进行保护,但其优化依赖辅助视频生成等额外计算,对大视频模型尤其昂贵。
本文的切入点来自一个具体观察:给 CogVideoX、LTX-Video 和 Wan 去掉文本提示,视频不仅变得不符合指令,还会发生主体变形、结构失稳和时间不连贯。 这说明文本在这些系统里兼有生成稳定器的作用,而不只是提供用户想要的动作描述。 但图像所有者无法让后来使用图片的人主动删除提示;可控制的对象只有待发布图片,因此需要通过图像对中间表示的影响,间接削弱文本对去噪的贡献。 这个观察是经验依据,不构成所有图生视频模型都依赖文本的普遍定理。
只针对一个已知提示优化,容易把保护效果绑定到特定文本;完全忽略图像条件,又可能留下仍能生成连贯视频的视觉线索。 论文因而把文本通路、视觉通路与图像编码放在一起考虑,并用关注具体失效的视频评估补充通用品质指标。 核心 idea:不去预测未来使用者的具体提示,而是利用生成器对文本条件的依赖,让保护图片改变模态之间的相对影响,同时削弱图像编码中可供生成利用的信息。
方法详解¶
整体框架¶
输入是所有者希望公开分享的图像;输出是外观尽量接近原图的保护图像,而不是修改后的生成模型。 保护阶段使用可访问内部表示的代理生成器,在固定模型参数的条件下优化每张图片的扰动。 文本抑制和视觉主导作用于去噪过程的中间注意力统计,编码扰动则约束图像条件表示;三者共同影响同一个保护图像,并非三个顺序执行的图像编辑器。 保护完成后,生成器按通常方式接收图片和文本;独立的失效评估检查生成视频,不把评估器评分作为扰动优化目标。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["所有者原图"] --> B["代理模型中间表示"]
B --> C["文本抑制"]
B --> D["视觉主导"]
B --> E["编码扰动"]
C --> F["联合优化保护图像"]
D --> F
E --> F
F --> G["独立生成评测视频"]
G --> H["证据优先评估"]
关键设计¶
1. 文本抑制:针对文本进入去噪的实际通路
同样是“降低文本影响”,不同注意力架构需要观察不同对象。 在 CogVideoX 所代表的全注意力结构中,视频查询共同访问视频、图像和文本 token,三者共享 softmax 归一化。 论文关注视频到文本的 softmax 前注意力 logits,在各注意力头及相关 token 对上求平均,推动这部分交互减弱。 这里不能把 logits 直接称为“文本注意力概率”:概率还取决于与其他模态的竞争,二者不是同一个统计量。
在 LTX-Video 所代表的交叉注意力结构中,文本经专门的交叉注意力残差进入视频表示,而视觉自注意力走另一条残差通路。 因此,论文衡量的是文本残差的平方范数能量,而不是照搬共享 softmax 的模态权重。 缩小该残差意味着降低文本对表示更新的直接贡献。 两种实现统一在“抑制文本依赖的更新”这一目标上,但并不声称两类模型有相同的内部计算图;这种区分是理解方法能跨架构实例化的关键。
2. 视觉主导:通过相对竞争降低对特定提示的依赖
只压低当前文本的交互,可能学到与已知 token 相关的局部效果,换一段提示后便不稳定。 视觉主导转而增强不直接读取文本的通路,使文本即使变化,也更难在整体更新中占据主导地位。 在全注意力模型里,论文增强视频到视频、视频到图像的平均 logits,利用共享 softmax 中的竞争来降低文本的相对份额。 在交叉注意力模型里,则增强视觉自注意力残差的能量,让它相对文本交叉注意力残差更占优势。
这里的“视觉主导”不等于“视觉质量更好”,也不等于“更忠实地重建原图”。 它是关于模型内部更新来源的相对强度,而本文恰恰利用这些生成器失去文本稳定作用后容易失效的现象。 所谓视觉专属通路,只表示当前交互不直接访问文本 token,并不保证它的输入在更早层从未受过文本影响。 因此这是一种架构相关的代理目标,而不是把整个模型严格分解成完全独立的语言系统和视觉系统。
3. 编码扰动:减少剩余图像条件对连贯生成的支撑
去掉文本也不必然让每次生成失败:某些场景单靠图像仍能保留部分主体与结构。 论文沿用已有图像保护研究中的编码器目标,使保护图像经过 VAE 编码后的表示靠近缺乏有效内容的目标表示,文中采用黑图作为共同目标。 这发生在潜在表示层,不是直接把发布图片变黑;图片外观仍受微小扰动约束。 它与视觉主导看似相反,实则控制不同因素:前者减少条件中有用的信息,后者增加视觉通路在更新中的相对影响,两者可以共同削弱图像忠实的视频生成。
这部分并非 Anti-Prompt 独有的新贡献,而是实验里默认保留的共同基础。 论文也给 I2VGuard 使用相同编码目标,避免把一个方法有额外编码保护、另一个没有的差异误认为文本机制的优势。 最终优化只改变输入扰动,不训练新的图生视频骨干;计算上的节省来自中间统计,不是把逐图优化变成一次训练后直接前向的轻量保护网络。 缓存中的式(7)至最终联合目标有明显排版提取损坏,本笔记按第 4 节可读正文解释各项含义,不重建无法可靠核对的损失公式、符号或更新细节。
4. 证据优先评估:先说明哪里失效,再给分
通用视频指标倾向于评价整体生成品质,而保护任务常常只需出现一处显著的主体或结构错误,就可能破坏视频的可信度。 论文因此增加一个独立评估协议:按每秒 4 帧均匀取样,并包含首尾帧,要求视频语言模型先给出带帧编号的可见观察,再分别评分。 实际实验采用 Qwen3-VL-8B,四个维度为主体保留、结构一致性、动态一致性和伪影抑制。 主体保留考察主体是否仍可辨认,结构一致性关注形状与部件边界,动态一致性考察运动及状态过渡,伪影抑制关注异常纹理和渲染缺陷。
每个维度采用 1–5 分,5 表示相应品质基本保持,1 表示严重失效;汇总分是四维分数的算术平均,再进行数据集层面的统计。 因此低分代表较差的视频、较强的保护,而不是评估器本身性能差;这也不是“成功保护百分比”。 尽管动机强调单个显著错误,实际均分仍可能稀释某一维度的极端失效,因此逐维解释比只看平均值更重要。 证据先行增加了可检查性,却不能自动消除评估模型偏见,所以作者同时报告 VBench 与人工偏好结果。
实验关键数据¶
主实验¶
评测采用 VBench I2V 的 355 张图片及配套文本,目标模型为 CogVideoX-5B 与 LTX-Video-2B;这是保护评测,不是新模型训练集上的精度实验。 I2VGuard 是作者在公共数据集上的复现,并非其原论文非公开数据集数字的直接搬用;同模型内使用一致的生成设置、扰动预算和编码目标。 保护扰动预算为 \(8/255\);两个生成器的分辨率、帧数与帧率不同,因此以下比较应以同一模型内为主。 下表选择原文表 1 的主体一致性和表 4 的协议均分;所有列均为越低表示生成失效越严重、保护越强。 “已见/未见”指生成提示是否参与保护优化,不是训练/测试图像划分。
| 模型 | 输入或方法 | 主体一致性 ↓,已见提示 | 协议均分 ↓,已见提示 | 协议均分 ↓,未见提示 |
|---|---|---|---|---|
| CogVideoX | 原图 | 95.06 | 4.58 | 4.38 |
| CogVideoX | I2VGuard | 93.32 | 3.92 | 3.86 |
| CogVideoX | Anti-Prompt | 87.54 | 3.25 | 2.99 |
| LTX-Video | 原图 | 95.09 | 4.13 | 3.13 |
| LTX-Video | I2VGuard | 90.25 | 3.28 | 2.46 |
| LTX-Video | Anti-Prompt | 89.36 | 3.12 | 2.38 |
未见提示由 GPT-4 根据输入图像生成,比原始提示通常更丰富、动态更复杂,所有方法和原图使用同一组未见提示。 原图的 LTX-Video 均分也从 4.13 降到 3.13,说明提示难度本身贡献了退化;不能把 Anti-Prompt 的已见到未见降分全部当成保护增强。 同提示条件内,Anti-Prompt 对 CogVideoX 的优势更明显,在 LTX-Video 上则是较小幅度的改善。
消融实验¶
下表摘取原文表 8;全部使用 CogVideoX 白盒设置和同一 VBench I2V 评测,编码扰动是共同起点。 \(L_{\mathrm{sup}}\) 表示文本抑制,\(L_{\mathrm{vis}}\) 表示视觉主导,\(L_{\mathrm{enc}}\) 表示编码扰动。 所列 VBench 列是视频品质分,方向仍按保护目标解读为越低越好,而非“错误率”。
| 配置 | 主体一致性 ↓ | 成像质量 ↓ | 协议均分 ↓ |
|---|---|---|---|
| 仅 \(L_{\mathrm{enc}}\) | 91.96 | 64.22 | 4.11 |
| \(L_{\mathrm{enc}}+L_{\mathrm{sup}}\) | 92.94 | 66.55 | 3.92 |
| \(L_{\mathrm{enc}}+L_{\mathrm{vis}}\) | 90.53 | 66.95 | 3.59 |
| 完整 Anti-Prompt | 87.54 | 63.71 | 3.25 |
文本抑制单独加入后,协议均分改善,但主体一致性和成像质量反而升高,说明两套评估对失效的敏感性不同。 视觉主导单独加入带来更大的协议均分下降,但也没有改善每一项 VBench 指标:成像质量由 64.22 升到 66.95。 因此第 6.3 节“持续改善”的文字应谨慎理解,不能覆盖表内的反例;三项联合才在这里列出的指标上同时最佳。
关键发现¶
- 计算量下降不等于免优化。 表 9 中 CogVideoX 总计算量由 54.25 降至 26.82 PFLOPs,峰值显存由 51.56 降至 48.98 GB;它省掉辅助视频生成,但保护阶段仍有较高成本。
- 跨模型转移存在方向性。 表 3 中 CogVideoX 到 LTX-Video 的成像质量为 62.63,而 I2VGuard 为 61.42;按保护目标这一列并不占优,不能概括为所有转移指标都胜出。
- 人工判断支持退化,但不是部署保证。 表 6 的盲测中,Anti-Prompt 视频被选为最差的比例为 79.1%,I2VGuard 为 10.9%;协议与人工总体排序的 Spearman 相关系数为 0.84。
- 图像保真度也有例外。 表 7 的 LTX-Video DISTS 为 0.138,差于 I2VGuard 的 0.130;作者明确说明其 LPIPS、PSNR、SSIM 改善不意味着所有感知指标一致改善。
亮点与洞察¶
- 把条件依赖变成保护目标。 文本不仅负责语义控制,也可能稳定结构和时间演化;论文把这一经验现象落实到可观测的内部通路,而非只改变最终视频的像素距离。
- 同一思想不等于同一个损失实现。 共享 softmax 的竞争和独立残差的相对强度是不同机制;对架构差异的明确处理,比笼统声称“抑制注意力”更有解释力。
- 保护效果需要两端一起看。 发布图片的外观保真度与后续视频的失效是不同目标;把两者分开度量,能避免以明显损坏原图的方式换取看似有效的保护。
局限与展望¶
- 作者明确承认: 视频语言模型评估可能存在模型特定偏差和随机性,因而必须与 VBench 和人工评测互证,不能把一套评估器当成客观裁判。
- 证据边界: 本地全文覆盖主方法和实验,但不含正文另引的补充材料;未见提示完整清单、跨评估器一致性与重复评估细节无法在当前缓存核对。
- 读者判断: 两种开源架构的结果不能推出对所有闭源服务、纯图像驱动模型或未来模型都有效;Wan 在文中用于动机观察,不是完整保护实验的第三个目标模型。
- 读者判断: 主文未提供足以验证压缩、缩放、重编码后保护是否保持的系统结果,也未给出长期公开分发场景的可靠性保证;这些是进一步评估的边界,而非已解决能力。
- 读者判断: 表 6 主文未充分交代参与者数量、视频样本量和置信区间,表 9 报告的是计算量与显存而非完整墙钟耗时,均限制了结论的外推强度。
相关工作与启发¶
- 对比 I2VGuard: 两者都保护图像免于未授权图生视频使用,也共享编码扰动基础;Anti-Prompt 的差异是直接针对文本依赖通路,减少依赖辅助视频的计算。
- 对比 PhotoGuard 与 Distraction: 前者提供编码/扩散层保护思路,后者强调注意力级目标的效率;本文把问题推进到文本条件参与时空生成的场景,而不是单纯复用图像编辑评价。
- 对比 VBench: 通用品质指标提供标准化参照,证据优先评估补充具体失效解释;消融中的分歧提示,两类工具应互补,而不能用一个均分替代全部可用性判断。
评分¶
- 新颖性: 4/5。文本稳定作用驱动的双通路目标有明确特点,但编码扰动继承已有方法。
- 实验充分度: 3/5。包含两架构、未见提示、转移、消融和人工评估,但部署鲁棒性与统计细节仍有限。
- 写作质量: 3/5。架构差异解释清楚,个别消融概括宽于表格证据,缓存公式损坏也限制复核。
- 价值: 4/5。为图像所有者的主动保护提供有解释性的研究方向,不应被理解为绝对防护承诺。