PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion¶
会议: ECCV2026
论文: ECCV 原文
PDF: 论文全文
代码: https://github.com/showlab/PAI-Studio
领域: 其他(视频生成 / 视频背景替换)
关键词: 相机运动感知、背景替换、前景重光照、双向注意力、时间位置编码克隆
一句话总结¶
PAI-Studio 将前景视频和 1–3 张背景参考图作为联合生成条件,用真实镜头数据、时间位置编码克隆及双向注意力同时学习背景运动、前景保持和重光照,在 Cine-Restore 多参考图设置下获得 MSE 0.00645、SSIM 0.789 和 LPIPS 0.197。
研究背景与动机¶
传统绿幕流程先抠出人物,再把人物叠到准备好的背景上;当镜头固定时,这种做法相对直接。 但摄影机推近、摇摄或跟拍时,背景必须随视点改变,而不是在人物后面放一张不动的图片。 参考图只能说明目标场景长什么样,前景视频则隐含主体动作和摄影机运动,两者需要共同决定背景如何变化。 现有生成式编辑方法还可能在修改背景时改变人物身份,或者保留了原来的人物光照,使人物与新环境明显脱节。
困难也不止于运动:实际分割会出现边缘闪烁、细小孔洞以及局部缺失,逐像素固定前景会把这些错误带进成片。 允许模型重新生成前景有助于补全边界和调整光照,却又带来了面部、衣服纹理和身体结构漂移的风险。 因此,这不是普通背景修补,而是在前景身份约束下,对整段视频的运动、照明和边界关系进行联合建模。 大幅镜头运动还会让首帧看不到的背景逐渐进入视野,单张参考图无法完整提供这些后续内容。
作者选择以真实电影和网络视频提供前景运动与背景变化的配对监督,再把多张背景图对齐到指定时间。 训练时故意扰乱输入前景的照明,让模型不能靠复制输入光照完成重建。 核心 idea:让同一个视频生成模型同时看到前景动态、指定时刻的背景参考和运动语义,在时间对齐的条件下重建整段场景,而不是独立生成背景后再粘贴人物。
方法详解¶
整体框架¶
输入是一段前景视频、1–3 张背景参考图,以及可选的场景文本或结构化运动描述;输出是背景已替换且光照协调的完整视频。 训练目标视频来自原始真实片段,条件前景经过分割与光照扰动,背景参考图则通过移除人物并补全缺失区域得到。 模型基于 WAN 2.2-5B 视频 Diffusion Transformer,图像与视频经预训练视频 VAE 编码,文本经文本编码器进入条件序列。 时间位置编码克隆负责把背景参考图和前景帧对齐到输出时间,双向联合注意力负责在每一步去噪中整合所有条件。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["真实电影与网络视频"] --> B["场景恢复式数据构造"]
B --> C["结构化运动引导"]
I["推理输入:前景视频<br/>背景参考图与可选文本"] --> C
C --> D["时间位置编码克隆"]
D --> E["双向联合注意力"]
B -->|原视频监督,仅训练| E
N["带噪输出视频潜变量"] --> E
E --> F["迭代去噪与 VAE 解码<br/>完整替换视频"]
这里的“相机感知”不是输入一条精确的三维相机轨迹,也没有显式深度重建或相机标定模块。 它主要依靠真实视频的运动统计、文字中的镜头描述,以及条件帧与输出帧的时间对应关系形成。 光流用于筛选训练视频,CoTracker3 用于评测运动,二者不能误写成推理时的相机控制模块。
关键设计¶
1. 场景恢复式数据构造:把换背景需求变成可监督的重建任务
CineStudio 约含 30K 个片段,来源是电影和在线高质量视频,原视频本身就是具有自然前景、背景和照明关系的训练目标。 先做镜头切分,再根据光流统计过滤运动较弱的片段,保留明显的摄影机或背景动态。 Qwen3-VL 识别主要前景概念,将简短标签交给 SAM3 做视频分割和跟踪,随后把前景提取到绿幕上。 这种真实分割结果仍可能带有孔洞、闪烁或局部缺失,而模型学习利用完整时空上下文恢复合理画面。 这不等于另加一个专门修边网络,也不意味着训练数据里的掩码都完美。
从开始、中间或结束位置选取 1–3 帧,移除前景,再用 Gemini-3 Pro Image 补全被遮挡区域,得到干净背景参考图。 这让训练样本同时具有前景条件、背景外观条件与完整视频监督,不必拍摄昂贵的真实换景配对数据。 不过,参考背景与目标来自同一原始场景,训练仍以场景恢复为基础,跨环境泛化需要另行验证。 为了防止模型直接照抄前景照明,作者对前景施加 HSV 通道抖动、对比度调整、色温变化和 gamma 校正。 原文式 (7) 的机制可清楚写为:
输入变成扰动后的前景,但监督目标保持原视频不变,因此恢复正确光照必须参考背景环境。 这是一种光度数据增强驱动的重光照学习,而不是显式估计光源、反射率或法线。 前景纹理与身份仍由原视频监督约束,模型需要学会区分“应保留的主体内容”和“可改变的照明外观”。
2. 结构化运动引导:把镜头语义与主体动作分开描述
Gemini-3 为视频提供结构化 JSON,字段包含前景内容、背景内容、前景运动、背景运动、相机运动分析,以及相机角度和焦距。 另有一个简洁 caption,把这些字段整合成自然语言描述;图 3 将结构化标注步骤标为 Gemini-3 Flash。 这些字段主要帮助模型明确“人物在动”与“摄影机在动”的语义区别,同时说明场景和光照环境。 例如跟拍主体时,人物可能保持在画面中央,而背景持续横向变化,单纯描述人物动作不足以约束后者。
结构化标注既用于数据整理,也可在推理时从输入前景视频提取,作为高层运动提示。 它不是必须人工逐帧输入的轨迹,也不是具有标定保证的真实焦距测量值。 与只给短文本相比,丰富字段能提供更多照明与场景线索,但本文消融并未证明它改善所有运动指标。 表 4 中去掉结构化标注后运动一致性略高,说明它的作用应理解为多维条件补充,而非单一运动分数的必胜组件。
3. 时间位置编码克隆:给每张背景参考图一个明确的输出时刻
如果只是把多张背景图拼到条件序列里,模型知道场景有哪些视图,却不一定知道哪张图应对应开头或结尾。 作者为第 \(k\) 张参考图指定目标时间 \(t_k\),直接复制输出视频在该时刻使用的时间位置编码。 同时,输入前景第 \(t\) 帧与待去噪输出第 \(t\) 帧使用相同的时间编码。 原文式 (5)–(6) 的时间对齐关系为:
\(Z^{bg}_k\) 是背景参考 token,\(Z^{fg}_t\) 是前景帧 token,\(Z_s(t)\) 是去噪步 \(s\) 对应输出时间 \(t\) 的 token。 克隆的是时间位置编码,不是把参考图像素复制到输出帧,也不是复制一条已知光流。 开始、中间、结束的背景因此成为有时间标签的条件锚点,模型再生成这些锚点之间的连续变化。 这尤其适合镜头运动导致可见背景内容显著变化的场景,但仍是生成式条件约束,不是逐像素硬锁定。
4. 双向联合注意力:让前景、参考背景和待生成画面共同推理
在每个去噪步骤,模型把文本 token、前景视频 token、各背景参考 token 和带噪输出 token 拼成一个序列。 单流 Transformer 在这个序列上使用完整双向自注意力,各类条件不是通过独立控制分支逐级注入。 原文式 (1) 的序列组织方式为:
双向意味着信息可以跨时间与模态交互,而非只沿前景到背景的单向路径传递。 前景连续帧提供主体结构与运动线索,背景参考提供环境外观,当前输出潜变量则承载正在形成的完整场景。 模型能够在同一生成过程中修改人物照明、补全边缘,并生成随镜头变化的背景。 最后通过视频 VAE 解码输出,因此最终前景也是生成结果,而不是原始前景像素的不可变拷贝。 这解释了为什么该方法可以修复不完整边界,也解释了为什么身份保真必须单独评测,不能由合成方式自动保证。
一个完整示例¶
以下是解释流程的示意,不是新增实验:输入一段人物跟拍绿幕视频,并提供目标场景开头、中间、结尾三张参考图。 结构化描述指出人物动作、跟拍方向和目标场景语义,避免把背景应有的运动误解为人物本身的动作。 三张背景图分别绑定对应输出时刻,前景帧则与输出帧逐时刻对齐。 联合注意力在去噪时结合人物动态与不同时间的场景内容,生成连续变化的背景,而不是三张静态图片之间的简单切换。 若目标环境偏暖,模型还需改变人物的颜色与明暗;这种能力来自训练时“扰乱前景、恢复原片”的监督。 若某几帧袖口分割缺失,模型可利用邻近帧推断合理轮廓,但论文没有给出任意大小缺失都能恢复的保证。
损失函数 / 训练策略¶
论文报告以 WAN 2.2-5B 为基础,使用 rank 80 的 LoRA 微调,优化器为 AdamW,学习率 \(5\times10^{-5}\)。 训练采用 BF16,在 8 张 H200 上运行约 6,000 步,每张 GPU 的 batch size 为 1。 条件使用受扰动前景,目标仍是原始完整视频;本文没有给出新的独立损失公式,不能自行添加身份损失或相机轨迹损失。 生成配置为 97 帧、24 FPS,约 4 秒,空间大小为 \(1920\times1056\)。 作者将该尺寸称为 1080P,但它并非通常的 \(1920\times1080\),复现时应以实际尺寸为准。 主文没有完整列出去噪采样器、采样步数、推理耗时和全部光照增强范围,不能据此宣称实时生成。
实验关键数据¶
主实验¶
Cine-Benchmark 将“恢复原场景”和“生成新背景”分开,以免把像素重建能力直接当作跨场景泛化能力。 Cine-Restore 含 150 个与训练集不重叠的 CineStudio 视频,参考背景来自对应原片并经过补全。 Cine-NBG 含来自 DAVIS 2017 和 IVEBench 的 50 个视频,用 Gemini 修改背景以构造新风格和布局,没有对应真值视频。 开源基线是同数据、同分辨率微调的 VACE-1.3B;商业系统使用默认 API 配置,模型规模和实际系统预算并不完全相同。
下表摘录原文表 2 的 Cine-Restore 结果,Single / Multi 分别表示单参考图与多参考图协议。 MSE、SSIM、LPIPS 衡量生成视频对真值的重建接近程度,运动一致性由 CoTracker3 轨迹比较得到。 光照协调度是 Gemini 的 1–10 分感知评分;原文主文未提供轨迹分数的完整计算公式和评审提示词。
| 方法与条件 | MSE ↓ | SSIM ↑ | LPIPS ↓ | 运动一致性 ↑ | 光照协调度 ↑ |
|---|---|---|---|---|---|
| VACE,Single | 0.0270 | 0.595 | 0.393 | 0.792 | 7.67 |
| Kling O1,Single | 0.0282 | 0.646 | 0.402 | 0.706 | 7.62 |
| PAI-Studio,Single | 0.0164 | 0.717 | 0.303 | 0.872 | 9.11 |
| Kling O1,Multi | 0.0190 | 0.682 | 0.341 | 0.721 | 7.44 |
| Kling 3.0 Omni,Multi | 0.0210 | 0.622 | 0.370 | 0.715 | 7.44 |
| PAI-Studio,Multi | 0.00645 | 0.789 | 0.197 | 0.894 | 9.61 |
多参考图同时增加了可见场景信息与时间锚点,因此 Single 到 Multi 的变化不能全部归因于位置编码设计。 在相同 Multi 条件下,PAI-Studio 的 LPIPS 0.197 优于 Kling O1 的 0.341,运动一致性为 0.894 对 0.721。 下表摘录原文表 3 的 Cine-NBG 结果,所有列均为 Gemini 的 1–10 分评分,不能与表 2 的轨迹分数混用。
| 方法 | 运动一致性 ↑ | 边缘质量 ↑ | 前景保持 ↑ | 前背景融合 ↑ | 光照协调度 ↑ |
|---|---|---|---|---|---|
| VACE | 6.92 | 7.82 | 2.44 | 7.04 | 8.38 |
| Kling O1 | 7.12 | 8.04 | 6.48 | 7.36 | 7.72 |
| Switchx | 7.12 | 7.40 | 8.88 | 6.16 | 7.88 |
| PAI-Studio | 8.16 | 8.86 | 9.58 | 8.40 | 9.22 |
前景保持关注人物身份,边缘质量关注分割缺陷处的过渡,前背景融合关注整体几何、光度和时序协调。 这些感知维度补充了重建指标,但它们不是身份认证准确率,也不是物理照明误差。
消融实验¶
下表摘录原文表 4,所有行均为 Cine-Restore 的 Multi 协议,因此可以在相同参考图条件下比较组件作用。
| 配置 | MSE ↓ | SSIM ↑ | LPIPS ↓ | 运动一致性 ↑ | 前背景融合 ↑ | 光照协调度 ↑ |
|---|---|---|---|---|---|---|
| 去掉位置编码控制 | 0.0160 | 0.681 | 0.287 | 0.843 | 8.41 | 8.88 |
| 去掉光照适配 | 0.0130 | 0.681 | 0.279 | 0.879 | 7.24 | 7.31 |
| 去掉结构化标注 | 0.00695 | 0.787 | 0.198 | 0.902 | 9.21 | 9.57 |
| 完整模型 | 0.00645 | 0.789 | 0.197 | 0.894 | 9.33 | 9.61 |
关键发现¶
- 去掉位置编码控制后,运动一致性从 0.894 降至 0.843,LPIPS 从 0.197 升至 0.287,支持时间锚定有助于同时保持运动与场景内容。
- 去掉光照适配后,光照协调度从 9.61 降至 7.31,前背景融合从 9.33 降至 7.24,是该表中这两项退化最大的配置。
- 去掉结构化标注后,运动一致性从 0.894 升至 0.902,但 MSE、融合和光照指标变差;完整模型并非每个消融指标都最优。
- 原文第 4.5 节和图 7 报告 25 名有相关经验的参与者,本文在五个评价维度获得 29.7%–35.6% 的最佳票占比。
- 作者报告各维度显著性为 \(p<0.01\);最佳票占比不是两两胜率,缓存主文也未给出完整配对统计。
亮点与洞察¶
- 数据监督直接对应真实失配:保留目标原片、扰乱条件前景的照明,使“依赖环境重光照”成为完成任务所必需的行为。
- 多参考图的关键不只是数量,而是每张图绑定哪个输出时刻。时间位置编码提供了廉价的对应关系,不必额外训练相机轨迹预测器。
- 全视频生成把边界修复与光照协调纳入同一个过程。它解除硬合成对完美掩码的依赖,但同时把身份保持变成需要实验验证的能力。
- 分开评估恢复与新背景更有解释力。前者验证已知场景重建,后者才检验跨背景泛化,二者的指标不可直接合并排序。
局限与展望¶
以下是依据主文设置的阅读判断;论文没有独立、系统的失败案例章节。 - 97 帧约 4 秒不足以证明长镜头稳定性。更长时间跨度、镜头切换及多主体遮挡仍需要专门验证。 - 没有显式三维相机控制或物理照明建模,因而“相机感知”不代表精确轨迹可执行,“重光照”也不代表光照参数可编辑。 - Cine-NBG 只有 50 个视频且依赖 Gemini 评分;数据构造与评测均使用 Gemini 家族,潜在评估偏好值得独立评审和指标交叉验证。 - VACE-1.3B 与 WAN 2.2-5B 的容量不同,商业 API 也存在版本和配置差异,优势不能全部解释为本文控制机制的净收益。 - 主文缺少系统的掩码腐蚀强度曲线、身份失败率和运行效率报告,因此不能推断任意前景缺失都稳健或可用于实时制作。 - 可进一步加入可控相机轨迹测试、长时序基准和更严格的人物细节评估,区分视觉上合理与几何、身份上准确。
相关工作与启发¶
- 对比 VACE:同样面向视频创作和编辑;本文更专注于前景视频与多背景图的联合条件,基线虽同数据训练,但模型容量不相同。
- 对比传统视频抠像:传统流程输出精确前景层并依赖已有背景,本文生成整个场景以同时解决背景运动和照明失配,代价是失去前景像素不变保证。
- 对比 Kling O1 与 Switchx:商业方法提供实际应用参照;表 3 中 Switchx 的前景保持为 8.88、本文为 9.58,但该差异属于特定基准的模型评审分数。
- 可迁移启发:当多张参考图对应不同视频时刻时,可以先建立时间语义,再让生成模型处理帧间过渡;迁移到其他编辑任务仍需验证数据是否含有足够运动监督。
评分¶
- 新颖性: 4/5。任务约束、时间锚定与光照扰动组合明确,主要贡献在任务和训练设计,而非新的注意力算子。
- 实验充分度: 4/5。具有恢复、新背景、组件消融和用户研究,但样本规模、评审独立性与效率披露仍有限。
- 写作质量: 4/5。方法主线和表格较清楚,部分评测实现与统计细节需要补充材料才能核实。
- 价值: 4/5。为电影背景替换提供可复用设计,但尚不能据主文判断长镜头生产可靠性。