PISCO: Precise Video Instance Insertion with Sparse Control¶
会议: NeurIPS2026
arXiv: 2602.08277
论文: 项目页
领域: 视频生成
关键词: 视频实例插入、稀疏关键帧控制、时序掩码、深度条件、视频扩散模型
一句话总结¶
PISCO 用可变密度条件训练、编码前补帧与编码后掩码,以及深度和外观增强,把少量实例关键帧传播到已有视频;在 PISCO-Bench 上,14B 模型的首尾帧控制将全视频 FVD 从 VACE 的 371 降至 204,但比较方法的输入条件并不相同。
研究背景与动机¶
视频实例插入不是从头生成一段“看起来像”的视频,而是在已有镜头里加入指定物体,同时保留原本的相机运动、背景人物和场景动态。用户还希望物体出现在准确的位置与时刻,之后能够自然运动,并产生阴影、反射等环境变化。传统视频修补依靠逐帧空间掩码划定修改区,但尚未出现的物体没有现成轨迹可供分割;要求用户为它画完整掩码序列,会把生成问题变成繁重的人工动画工作。
另一条路线是先编辑一张图,再用图像到视频模型生成后续帧。它容易保住第一帧的外观,却会重新想象原镜头的背景动态。参考图驱动的视频编辑能够利用原视频,但通常不能用任意时刻的少量实例切图,精确约束位置、姿态和身份。PISCO 要解决的是这种条件不对称:背景视频始终完整可见,待插入实例只在少数时刻有信息;这些缺失时刻既不代表物体应消失,也不能被伪造的稠密条件当成真实观测。
困难还落在预训练视频编码器上。把非关键帧全部置零,会让时序 VAE 接收与自然视频差异很大的序列;仅仅微调生成网络并不足以解释为何条件本身引发闪烁和错色。核心 idea:把“给编码器一个分布更正常的连续输入”和“告诉生成器哪些信息真的可用”分开处理,再通过不同条件密度的训练学习传播,并以深度和外观增强处理遮挡与光照。
方法详解¶
整体框架¶
输入是完整背景视频、少量放置好的实例 RGB 切图及空间掩码,以及背景和实例的深度条件;输出是加入实例后的整段视频。训练时另有带实例的目标视频,作为重建监督,而不是推理输入。骨干沿用 Wan 与 VACE 上下文适配器,不先重建完整 4D 场景。
流程先由可变信息引导决定训练中哪些实例帧可用;推理时则直接使用用户提供的时刻。保分布时序掩码先在像素域补齐条件序列,再在潜在域屏蔽不真实可用的信息。几何与外观鲁棒条件提供相对深度,并通过训练增强教模型正确遮挡完整物体、调整光照,最后由多通道适配与分阶段训练把这些条件接入视频去噪。
空间掩码标记一帧里物体在哪;可用性掩码标记哪一帧有用户信息;潜在域掩码标记编码后的条件能否作为有效提示。三者用途不同,不能把“该时刻没给条件”解释成“该时刻物体必须不存在”。背景视频和背景深度不随实例条件一起丢弃,模型因此仍可利用整个原镜头推断运动与遮挡。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
T["训练实例序列"] -.-> A["可变信息引导"]
A -.->|采样可用时刻| B["保分布时序掩码"]
I["推理:用户关键帧"] -->|指定可用时刻| B
B --> C["几何与外观<br/>鲁棒条件"]
V["完整背景与深度"] --> C
C --> D["多通道适配与<br/>分阶段训练"]
Y["训练目标视频"] -.->|去噪监督| D
D --> O["实例插入视频"]
图中实线表示推理条件流,虚线表示训练中的条件采样与目标监督;非模态补全和重打光是训练数据增强,不是每次推理都必须执行的后处理链。
关键设计¶
1. 可变信息引导:让一个模型适应从单帧到稠密的控制
可变信息引导(Variable-Information Guidance,VIG)实际上是动态上下文 dropout,而不是额外的分类器,也不是论文给出的推理时 guidance scale 公式。训练时采样二值可用性掩码,覆盖仅保留一帧、不同稀疏程度和完整条件的组合,让模型反复经历“只有部分实例信息,但整段目标都要生成”的任务。稀疏训练迫使模型利用背景和视频先验推断中间运动;稠密训练则约束身份和细节,避免传播能力以外观漂移为代价。
用 \(A\) 表示逐帧可用性、\(I\) 表示实例 RGB、\(M\) 表示空间掩码、\(D_I\) 表示实例深度,条件屏蔽边界为:
背景深度 \(D_V\) 不受 \(A\) 屏蔽,背景视频也完整输入。可用性说的是条件来源的可靠性,而不是输出的存在性约束;仅给首帧不能精确指定后续所有轨迹,更不能保证物体在任意未观测时刻按某个唯一运动出现。论文描述混合密度训练,但没有给出各采样分支的概率或精确密度分布,不能据此编造可复现的采样配方。
2. 保分布时序掩码:补帧为编码服务,掩码为信息边界服务
保分布时序掩码(Distribution-Preserving Temporal Masking,DPTM)针对的不是生成视频缺帧,而是条件序列太稀疏时会破坏预训练时序 VAE 的输入分布。它先用时间上最近的可用实例帧填充缺失帧,向前、向后传播关键帧切图,使编码器不再看到大量“正常图像与全零帧交替”的突变。这里不是光流估计,也不是生成中间姿态;补出的内容只是帮助编码的占位信息。
补齐序列经 VAE 编码后,对原本未观测时刻对应的条件 token 再做掩码,避免生成器把重复切图当成用户真实提供的轨迹。编码器存在时序压缩,多个原始帧会进入一个压缩 token,所以只用一位 token 级可用性会损失组内信息。作者把一个局部时序窗口的逐帧可用性移到通道维,并与其他条件一起输入适配器。
论文给出的可用性张量形状是 \(C_t\times T'\times H'\times W'\),其中 \(C_t\) 为时序压缩因子,\(T'=\lceil T/C_t\rceil\)。这保留了每个压缩位置内部“哪些原帧被提供”的模式。不过缓存没有给出混合可用与不可用帧时的完整 token 掩码实现,不能把它描述成已经证明的逐帧信息完全隔离,更不能声称补帧消除了所有时序 VAE 的跨帧混合。
3. 几何与外观鲁棒条件:学会遮挡物体,也允许改变不合场景的光照
深度条件来自两个来源:用 Depth Anything V3 估计完整背景视频深度,再从带实例的目标视频深度中按物体掩码提取实例深度。背景深度始终可见,实例深度只在被保留的关键帧可见。模型据此学习谁在前、谁在后,而不是简单把完整物体贴在所有前景遮挡物之上。这是学习式条件生成,并非带有精确相机标定的几何渲染器;论文也没有完整说明实际用户输入的实例深度如何与目标场景统一尺度。
训练实例往往是分割得到的可见部分,但用户通常提交完整物体。若一直用残缺切图训练,模型可能把切图上的缺口当成外观,而不是场景造成的遮挡。作者先从完全可见的实例构造数据,用其他切图随机遮挡,再以 LoRA 微调图像编辑模型恢复完整外观;逐帧补全后得到伪非模态实例,掩码由阈值产生,缺失深度由已有值插值。将这种完整条件配回原来仍有遮挡的目标视频,模型才有机会学习“输入完整、输出按场景遮住”的关系。
重打光增强则用 IC-Light 在随机背景光照下改变实例条件,但目标仍要求与原场景协调。这样降低对输入颜色和照明的机械复制,容许实例入景后适应环境光。它并不允许随意改变实例身份;目标是在身份与关键帧控制保留的同时纠正不合场景的照明。阴影和反射可能发生在空间掩码之外,因此方法不是把背景每个像素硬锁死的复制粘贴系统。
4. 多通道适配与分阶段训练:先接通条件,再调整视频先验
VACE 上下文适配器接收背景、实例 RGB、深度、空间掩码和可用性等信号。作者修改适配器的首个线性投影以接纳新的输入维度,其余层先复用预训练权重。这样主要变化发生在“如何把任务条件送入骨干”,而不是重新训练一个视频生成模型;条件 token 经适配器影响去噪,最终生成的是带实例和必要环境作用的整个视频。
训练依次只更新新输入投影、更新完整适配器、联合更新适配器与扩散骨干,再引入补全和重打光增强并用 LoRA 继续联合适配,最后扩展时空分辨率。这个顺序给随机初始化的条件入口先建立有效表示,再放开昂贵的生成骨干,减少一开始就破坏视频先验的风险。PISCO-14B 使用 Wan2.2 的高噪声与低噪声两个去噪器,作者分别按同一训练日程训练它们,不应理解成一个额外的实例传播网络。
一个完整示例¶
以论文首尾帧协议的 49 帧片段为例,用户在第 1 帧和第 49 帧放置同一物体的切图、掩码及相应深度,背景视频则保留全部 49 帧。两端关键帧提供身份、位置与姿态锚点,中间 47 帧没有实例观测,并非 47 帧都禁止出现物体。
DPTM 用距离最近的端点切图填充中间的条件帧,交给时序 VAE 编码,再屏蔽未提供时刻的条件信息,同时保留两端真实可用性的编码。模型结合完整背景的运动与深度生成中间实例。如果背景中的柱子挡住物体,输出应产生遮挡;如果环境光变化,输出可以调整物体照明。端点条件降低路径歧义,但不等同于为所有中间帧提供精确轨迹。
损失函数 / 训练策略¶
监督来自有实例的目标视频与去噪预测误差,关键帧稀疏化只作用于输入条件,目标仍覆盖整段视频。缓存式 (2) 显示的是误差的二范数,并未显示平方;这里不将其补写成作者精确的均方误差公式,也不额外假设独立的遮挡损失、背景复制损失或物理约束损失。
训练素材来自 ROSE、VPData、MOSE 和 DAVIS,经可移除实例筛选得到 16,642 个片段,每段至少 49 帧。通过在 ROSE 上训练的副作用感知移除模型生成无实例背景,形成目标与背景配对;这不同于直接把实例区域涂黑,也意味着训练配对会继承移除模型的误差。
骨干分别为 Wan2.1-VACE-1.3B 和 Wan2.2-VACE-Fun-A14B。前四阶段采用 \(832\times480\)、49 帧,第五阶段扩展至 \(1280\times720\)、120 帧;优化器为 AdamW,硬件为 NVIDIA H100。缓存未提供各阶段步数、学习率、批大小及采样概率,不将“有五阶段日程”等同于完整复现说明。
实验关键数据¶
主实验¶
PISCO-Bench 从 BURST 选取 100 个与训练集不重叠的视频,人工检查并修正实例掩码,用 ROSE 生成干净背景。所有对比采用 \(832\times480\)、49 帧、50 次去噪;不能把这些结果直接当作 720p、120 帧扩展配置的验证。
全视频指标对生成结果与原始带实例视频比较;前景指标先用目标实例掩码分别乘生成视频和目标视频,再计算指标。前景 LPIPS 因而是在掩码视频上评估,不应被误解为只裁出物体的独立图像评价,也不评价掩码外全部阴影与反射。
下表摘录原文表 2;FVD、LPIPS 越低越好,PSNR 越高越好。
| 方法与控制 | 全视频 FVD | 全视频 LPIPS | 全视频 PSNR | 前景 FVD | 前景 LPIPS |
|---|---|---|---|---|---|
| 图像编辑 + I2V,首尾帧 | 624 | 0.392 | 16.44 | 250 | 0.030 |
| CoCoCo,稠密掩码 | 590 | 0.191 | 23.62 | 398 | 0.031 |
| VideoPainter,稠密掩码 | 524 | 0.154 | 23.11 | 384 | 0.035 |
| VACE-14B,稠密掩码 | 371 | 0.103 | 25.55 | 273 | 0.028 |
| UniVideo,无掩码条件 | 485 | 0.211 | 19.22 | 310 | 0.031 |
| PISCO-1.3B,首尾帧 | 269 | 0.103 | 27.01 | 171 | 0.024 |
| PISCO-14B,首尾帧 | 204 | 0.097 | 26.58 | 138 | 0.022 |
输入不等价:I2V 管线用 Nano-banana-Pro 编辑端点,再用 Wan2.2-Fun-A14B-InP 生成,但不利用完整背景视频逐帧约束;CoCoCo、VideoPainter 使用稠密掩码和由 Qwen3-VL-32B-Instruct 产生的描述,没有直接参考实例图;VACE 使用背景视频、参考图、文本和完整掩码;UniVideo 使用背景视频、参考图和文本,不支持掩码。PISCO 使用完整背景和稀疏实例图、掩码及深度,比较体现的是不同工作流,而非完全相同的信息预算。
消融实验¶
缓存未包含 VIG、DPTM 或深度条件的定量去模块表。图 3、4、6 分别给出深度、DPTM 和重打光的定性分析;不能将这些图推导为不存在的数值消融。可核对的定量分析是控制密度变化,下表对应表 2、表 3。
| 模型与控制 | 全视频 FVD | 前景 FVD | VBench 主体一致性 | VBench 八项平均 |
|---|---|---|---|---|
| PISCO-1.3B,首帧 | 398 | 243 | 87.16 | 64.43 |
| PISCO-1.3B,首尾帧 | 269 | 171 | 91.33 | 65.45 |
| PISCO-1.3B,五帧 | 172 | 104 | 91.45 | 65.89 |
| PISCO-14B,首帧 | 337 | 222 | 87.26 | 64.56 |
| PISCO-14B,首尾帧 | 204 | 138 | 91.57 | 65.64 |
| PISCO-14B,五帧 | 136 | 75 | 91.98 | 66.04 |
五帧设置是首尾帧加三个随机中间帧,作为额外参考设置,不纳入标准协议排名。VBench 的背景与主体一致性使用掩码隔离相应区域,并基于 CLIP/DINO 特征评价;其他项目沿用官方实现,因此其平均分不是用户控制成功率或物理正确率。
关键发现¶
- 首尾帧 PISCO-14B 相比 VACE 将全视频 FVD 降低 167,前景 FVD 降低 135;但它获得两个时刻的实例外观,而 VACE 获得稠密位置掩码,不能把改进归因于单一模块。
- 从首帧到首尾帧再到五帧,两种模型的 FVD 与 VBench 平均分都持续改善,支持“补充锚点能够减少传播歧义”;这仍不是任意控制帧数量和位置的完整敏感性曲线。
- 更大模型不是每项都更好:首尾帧全视频 PSNR 是 1.3B 的 27.01 对 14B 的 26.58。首帧 14B 的全视频 LPIPS 0.116 也不优于 VACE 的 0.103,原文“始终超过所有基线”的措辞应限缩到实际支持的指标与协议。
- 原文对“单调提升”的表述并非逐项成立:14B 的 VBench Temporal Flickering 从首帧 97.26 到首尾帧 97.21,再到五帧 97.34;不能把综合改进写成所有指标严格单调。
亮点与洞察¶
- 条件缺失不仅是生成网络的问题,也会先破坏编码器的输入分布。先补齐再掩码,把编码稳定性和观测真实性分别处理,是比直接零填充更有针对性的设计。
- 完整背景与稀疏实例是不同信息源,不能统一 dropout。保留背景几何使模型在没有实例观测的时刻仍有遮挡和运动参照。
- 完整物体条件配遮挡目标,比仅学习残缺分割切图更接近实际插入操作。可迁移的重点是条件与目标的可见性关系,而不是要求输出永远复制条件切图。
局限与展望¶
- 单帧条件下中间轨迹存在歧义,论文定性比较也承认轨迹会漂移。增加关键帧有帮助,但尚无明确的逐帧位置误差或控制失败率统计。
- 背景由实例移除模型生成,可能残留对象线索或引入修补错误;100 个视频的自建基准不能完全代表开放场景的任意新物体插入。
- 深度尺度对齐、混合时序 token 的掩码规则及训练超参数描述不足。后续应提供明确实现与对深度误差、关键帧位置的敏感性测试。
- 定量评测集中在 49 帧配置,没有系统的长视频、720p 性能或时延与显存表,也缺少完整组件的数值消融。
- 背景替换、重定位、缩放、变速及动态模拟以应用示例展示,不是已由独立基准验证的物理仿真能力;遮挡和阴影合理不等同于物理规律得到保证。
相关工作与启发¶
- vs VACE / UniVideo:通用参考编辑提供生成骨干和控制接口,PISCO 专门训练任意稀疏时刻的实例条件。其优势是实例级控制,但稠密掩码、文本和实例锚点的作用不同,不能视作同接口替换。
- vs CoCoCo / VideoPainter:修补更依赖逐帧编辑区域,PISCO 从少量实例切图推断传播并允许区域外副作用。前者的背景复制有利于一致性,却不自动解决准确身份和自然光照适配。
- vs InsertAnywhere 等 4D 方法:显式几何方案更强调空间结构,PISCO 以深度条件配合生成先验避免重建链。代价是遮挡和运动主要由学习式生成完成,缺少几何或物理硬保证。
- 研究启发:可以在可用性条件上加入置信度,区分真实用户锚点、估计深度和伪补全信息,再用轨迹误差与背景副作用分别评价;这是延伸方向,不是本文已实现的模块。
评分¶
- 新颖性: 4/5,针对稀疏实例控制的编码分布问题提出明确组合设计。
- 实验充分度: 3/5,有配对基准与控制密度分析,但缺少定量组件消融及完全匹配的输入协议。
- 写作质量: 3/5,任务边界清楚,掩码实现与超参数仍不充分,部分概括超过表格证据。
- 价值: 4/5,对低交互成本的视频编辑有实用意义,物理一致性与长视频部署仍需验证。