跳转至

InsertAnywhere: Geometrically Grounded and Optics-Aware Video Object Insertion

会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 视频物体插入, 4D场景重建, 场景流追踪, 光学感知表征对齐, 视频扩散模型

一句话总结

InsertAnywhere 结合 4D 场景重建、KNN 场景流追踪与基于扩展掩码特征对齐的视频扩散架构,在用户仅需标注单帧 3D 位姿的前提下,精准处理动态遮挡并自然生成超出物体外边缘的真实投影与反光。

研究背景与动机

视频物体插入(Video Object Insertion, VOI)旨在将参考物体无缝整合至现有视频片段中,在影视后期特效、虚拟广告投放与数字内容创作中具有极高应用价值。该任务的核心挑战在于生成结果必须在时序运动、空间几何透视以及局部物理光影(如投射阴影、高光与镜面反射)上与原始场景达到生产级一致。然而,现有的视频生成与编辑范式在几何感知与光学交互两个维度上面临明显断层。

目前主流的 VOI 方案大致分裂为两大阵营:其一是无掩码(mask-free)编辑范式,通常依赖文本指令或仅修改首帧后利用视频生成先验传播,这类方法虽然没有边界束缚、在理论上能自由幻化阴影,但由于缺乏空间约束,往往会导致非编辑背景区域出现严重的漂移变形,且面对复杂遮挡与视角变换时难以保持目标刚性;其二是掩码驱动(mask-conditioned)的视频修复范式,通过空间掩码对生成区域施加严格限制,虽然能完美保护背景,但封闭的掩码边界将生成过程锁死在物体内部,根本无法生成外溢到周围场景的接触阴影与反射倒影,使插入物体呈现生硬的“贴纸感”。更严峻的是,单张 2D 参考图缺乏尺度与深度先验,无法感知场景物理支撑面在 4D 时空中的动态运动。

针对上述几何失真与光影缺失的矛盾,本文提出了一种显式解耦几何传播与光学合成的两阶段架构。系统允许用户在交互式 3D 界面中仅微调首帧锚点的 3D 姿态与尺度,随后利用时空点云与局部场景流将物体刚性运动沿时间轴精确传播并重投影为抗遮挡掩码,同时引入光学表征对齐机制让紧致掩码学会预测外部光影。核心 idea:利用 4D 时空场景重建与局部 KNN 场景流实现遮挡鲁棒的几何掩码传播,并构建 ROSE++ 四元组数据集与 stop-gradient 扩展掩码特征对齐损失,使掩码扩散模型能够自主合成溢出物体边界的逼真阴影与反射。

方法详解

整体框架

InsertAnywhere 采用分阶段协同架构,全流程分为两大核心阶段:几何感知掩码传播(Geometrically Grounded Mask Propagation)与光学感知视频合成(Optics-Aware Video Synthesis)。首先,系统对输入的单目视频进行 4D 动态解耦重建,结合单图 3D 生成模型将参考物体嵌入 3D 场景;用户在首帧交互确认物体空间位姿后,模块利用局部 3D 场景流追踪计算物体的时序位移,重投影生成精确且抗遮挡的时序掩码序列。在第二阶段,以源视频、掩码序列与参考图像为条件,通过在专门构建的物理光影数据集 ROSE++ 上进行 LoRA 微调与特征对齐训练,配合首帧图像锚定,最终渲染出高保真度、光影自然的插入视频。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:源视频 V_src + 参考物体图 I_ref"] --> B["4D 几何感知掩码传播<br/>Uni4D 解耦重建 + TRELLIS 3D 刚体锚定"]
    B --> C["KNN 场景流时空追踪<br/>SEA-RAFT 3D 流聚合 + SAM 2 重投影细化"]
    C --> D["首帧先验锚定与 ROSE++ 微调<br/>OmniPaint 引导首帧 + 解耦参考图构建"]
    D --> E["光学感知表征对齐<br/>扩展掩码教师特征对齐 L_align"]
    E --> F["输出:生产级无缝融合视频"]

关键设计

1. 4D 几何感知掩码传播:解耦静态背景与动态实体的时空刚性追踪

传统 2D 目标追踪或光流插值在遇到视角剧烈变化、局部表面运动(如放置在行进中的行李推车上)或前景动态物体穿插遮挡时极易发生漂移与变形。为此,本文首先基于 Uni4D 架构将单目源视频分解为静态全局几何与动态移动实体的 4D 时空点云,同时结合 UniDepthV2 与 CoTracker3 获得高精度的相机外参 \(P_t = [R_t | t_t]\) 及内参 \(K\)。对于参考物体图 \(I_{ref}\),利用 TRELLIS 将其升维至 3D 刚体点云 \(y\)。用户仅需在选定的锚定帧 \(s\) 中通过刚体变换交互调整其旋转 \(R_{obj}\)、平移 \(t_{obj}\) 与缩放 \(s_{obj}\)

\[y_s = s_{obj} R_{obj} y + t_{obj}\]

为了让物体自然随承载表面运动,系统使用 SEA-RAFT 估计局部像素光流并反投影到 3D 空间计算位移 \(\Delta p_i^t\)。针对物体中心选取 3D 空间中的 Top-\(K\) 最近邻场景点,聚合得到物体的时序位移步长:

\[\Delta p_{obj}^t = \frac{1}{K} \sum_{k \in \text{TopK}} \Delta p_k^t\]

物体的 3D 坐标据此递推更新 \(y'_t = y'_{t-1} + \Delta p_{obj}^{t-1}\),并通过相机参数透视重投影至二维像平面。利用 SAM 2 对光栅化点云轮廓进行多边形边缘精确细化,最终输出时序严格对齐、自适应动态遮挡的二值掩码序列 \(\{M_t\}_{t=1}^T\)

2. 光学感知表征对齐:以扩展掩码教师监督打破紧致掩码的生成边界

标准掩码条件视频扩散模型(如 VACE)为了保证背景像素不被破坏,训练目标使模型将注意力严格局限在掩码内部,导致接触面阴影与环境反光被完全截断。为在推理阶段仅提供精细紧致掩码 \(M\) 的前提下突破这一限制,本文设计了光学感知表征对齐策略(Optics-Aware Representation Alignment)。

在包含真实光影变化的成对训练数据中,通过源视频与目标视频的绝对像素差分与阈值形态学膨胀,构建包裹了阴影和高光区域的扩展掩码 \(M_{ext}\)(满足 \(M \subset M_{ext}\))。在训练时,双分支将基础掩码条件 \(M\) 与扩展掩码条件 \(M_{ext}\) 分别输入共享权重的扩散骨干网络。提取各 Transformer 模块的深层中间特征 \(F^l\)\(F^l_{ext}\),并构建均方误差对齐损失:

\[\mathcal{L}_{align} = \sum_{l} \| F^l - \text{sg}(F^l_{ext}) \|_2^2\]

式中 \(\text{sg}(\cdot)\) 为停止梯度算子(stop-gradient)。通过将扩展掩码特征作为固定的光学校准教师,模型被强制学习在仅看到精细物体掩码时,其潜在表征也能自发激活并在扩散去噪过程中重塑周围局部的光照与反光纹理。

3. ROSE++ 数据集构建与首帧先验锚定:杜绝复制粘贴偏置的外观稳定生成

现有视频编辑数据集普遍缺乏配对的物理光影真值,直接使用现有物体移除数据集(如 ROSE)存在关键弊端:原始数据没有孤立的高清物体参考图,若简单从目标视频中裁剪目标,网络会倾向于死记硬背该视角和环境光照,退化为简单的“复制-粘贴”,丧失在多视角与变光照下的泛化能力。

本文构建了专用四元组数据集 ROSE++(包含源视频、目标视频、精细掩码序列及独立参考图像)。通过利用图像编辑模型以白色背景重新合成候选参考图,剔除与场景强绑定的光照先验;随后借助 DINOv2 特征提取器 \(\Phi_{DINO}\),在多视角真实裁剪帧 \(\{f_j\}_{j=1}^N\) 与候选参考图 \(\hat{o}_k\) 之间进行余弦相似度拒绝采样:

\[s_k = \frac{1}{N} \sum_{j=1}^N \text{sim}(\Phi_{DINO}(\hat{o}_k), \Phi_{DINO}(f_j))\]

选取相似度最高的高质量物体图像作为监督信号。此外,在生成前向流水线中,借助图像级插入成熟模型(OmniPaint)生成第一帧高质量图象作为条件输入,通过时序注意力网络有效锚定物体纹理、反光和颜色基调,杜绝长序列中的身份衰减。

损失函数 / 训练策略

模型在 VACE 视频扩散模型基础上引入 LoRA 适配器进行轻量化参数微调,训练目标结合了标准潜在扩散去噪损失 \(\mathcal{L}_{diff}\) 与光学表征对齐损失 \(\mathcal{L}_{align}\)

\[\mathcal{L}_{total} = \mathcal{L}_{diff} + \lambda_{align} \mathcal{L}_{align}\]

训练过程冻结 VAE 编解码器与文本编码器,仅对扩散注意力层 LoRA 权重进行更新,且在 \(\mathcal{L}_{align}\) 中对扩展掩码路径施加严格梯度截断,保证训练稳定收敛。

实验关键数据

主实验

论文构建了包含 200 个复杂视频序列的评估基准 VOIBench,全面覆盖室内、室外、自然场景,并针对动态遮挡和复杂光照设立严苛测试条件。评估指标涵盖主体一致性(CLIP-I、DINO-I)与 VBench 综合视频质量指标(背景一致性、主体一致性、运动平滑度、成像质量)。

方法 类型 CLIP-I ↑ DINO-I ↑ 背景一致性 ↑ 主体一致性 ↑ 运动平滑度 ↑ 成像质量 ↑
Pika-Pro 商业工具 0.4940 0.3856 0.9080 0.8720 0.9889 0.6546
Kling 商业工具 0.6349 0.5028 0.9335 0.9494 0.9940 0.7069
AnyV2V 开源方案 0.7033 0.2217 0.8884 0.8699 0.9795 0.5973
ReVideo 开源方案 0.7385 0.3651 0.9391 0.9403 0.9906 0.6526
Señorita 开源方案 0.7499 0.3982 0.9262 0.9266 0.9902 0.6333
VACE (使用本文掩码) 开源基线 0.7368 0.5060 0.9011 0.8855 0.9887 0.6046
InsertAnywhere (本文) 完整模型 0.8132 0.5669 0.9503 0.9534 0.9925 0.7473

注:数据源自原论文 Table 1。在除运动平滑度与 Kling 处于统计方差内的接近水平外,本文在所有保真度与质量指标上大幅超越现有商业工具与开源模型。

消融实验

论文逐步验证各核心组件的增益(Table 3):配置 (a) 仅采用 4D 掩码;配置 (b) 加入首帧修复先验;配置 (c) 加入 ROSE++ 上的 LoRA 微调;Ours 为加入光学感知表征对齐损失 \(\mathcal{L}_{align}\) 的完整模型。此外,Table 4 进一步针对阴影与光学区域进行成对定量对比。

配置 核心改动 CLIP-I ↑ DINO-I ↑ 背景一致性 ↑ 成像质量 ↑ 多视角一致性 ↑ 说明
Config (a) 仅 4D 掩码 0.7532 0.3861 0.9232 0.6298 0.5308 解决动态遮挡,但物体外观漂移
Config (b) + 首帧先验锚定 0.7880 0.5135 0.9175 0.6318 0.5436 显著提升主体身份一致性
Config (c) + ROSE++ LoRA微调 0.8122 0.5678 0.9429 0.7101 0.5857 消除时序闪烁,稳定纹理
Ours + 光学对齐损失 \(\mathcal{L}_{align}\) 0.8132 0.5669 0.9503 0.7473 0.5865 自然生成外部阴影与环境反光

注:数据源自原论文 Table 3。

针对光学区域(Optics Mask)的光影保真度消融对比(数据源自原论文 Table 4 右侧): - VACE (使用本文掩码): LPIPS 0.0130, PSNR 19.8345 dB, SSIM 0.9877 - Ours w/o \(\mathcal{L}_{align}\): LPIPS 0.0121, PSNR 19.9065 dB, SSIM 0.9883 - Ours (完整模型): LPIPS 0.0089, PSNR 27.2362 dB, SSIM 0.9920

关键发现

  1. 光学对齐带来 +7.3 dB 的光影保真度跃升:在光学影响区域(Optics Mask),完整模型相比未加对齐损失的版本,PSNR 从 19.91 dB 激增至 27.24 dB,提升幅度超过 7.3 dB,且 LPIPS 从 0.0121 显著下降至 0.0089。这表明 \(\mathcal{L}_{align}\) 成功引导网络自发关注物体邻域,学会了在没有扩展掩码提示时准确重塑投影。
  2. 非编辑背景无损保留:实验证明 \(\mathcal{L}_{align}\) 没有造成未编辑区域的画质劣化。在未编辑区域,完整模型的 PSNR(33.30 dB)与无对齐版本(33.31 dB)和基线 VACE(33.27 dB)基本持平,成功实现了“局部光影外溢”与“全局背景保真”的完美平衡。
  3. 消除复制粘贴偏置:对比直接从目标视频抠图的基线(Ours-random),采用 DINO 拒绝采样重构的独立参考图使多视角一致性从 0.5295 跃升至 0.5865(Table 4 左侧),迫使模型真正去理解 3D 几何与场景光源。

亮点与洞察

  • 教师-学生形式的跨掩码表征对齐:通过 stop-gradient 截断梯度,巧妙利用扩展掩码作为光学校准教师,使标准紧致掩码分支在推理阶段也能自发预测外部阴影,突破了传统掩码扩散模型“画地为牢”的物理瓶颈。
  • 4D 解耦点云与 KNN 场景流的时空自适应:不依赖全场景密集刚性假设,而是通过物体周围的局部 \(K\) 近邻 3D 场景流聚合物体运动,使得放置在推车、传送带等动态局部平面上的物体能够自然同步移动。
  • 高质量 ROSE++ 数据集的解耦工程:利用多视角 DINO 过滤生成纯白底独立参考图,打破了视频编辑任务中数据泄露导致的“复制-粘贴”退化,为社区提供了首个面向物理光影微调的视频物体插入基准。

局限与展望

  • 复杂软体动力学与接触物理缺失:当前模型基于刚体点云假设与局部场景流聚合,若物体落在柔软表面(例如重物陷压进软沙发、踩踏雪地),无法合成几何变形或材料接触位移。
  • 依赖前置几何估计的鲁棒性:掩码序列的质量依赖于单目深度估计(UniDepthV2)与相机姿态恢复,在水面、反光地面或极低光照等极端无纹理场景下,场景流可能产生噪声导致掩码边缘轻微抖动。

相关工作与启发

  • vs 无掩码视频插入(OmniInsert / AnyV2V / Kling):无掩码方法依赖文本与视频先验扩散,自由度高但无法提供毫米级的位置与尺寸控制,且经常篡改背景。InsertAnywhere 依靠 4D 掩码将背景变动限制在几何自洽与光影合法的物理邻域内。
  • vs 掩码条件视频插入(VACE / VideoAnyDoor / DreamInsert):传统掩码方法生成的物体缺乏阴影,呈漂浮虚空感。InsertAnywhere 提出的表征对齐技术无需改变推理时的输入掩码格式,便能无痛赋予扩散模型“光影外溢”能力,具备直接迁移到其他图像/视频编辑架构的潜力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次打通 4D 几何感知掩码生成与扩散模型的外部光学表征对齐,思路巧妙优雅。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖自建 VOIBench 200 个视频、成对光影定量测试、注意力图可视化与多基线对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照极佳,问题剖析深入直击痛点。
  • 价值: ⭐⭐⭐⭐⭐ 解决了视频物体插入从实验室 Demo 走向影视特效与商业广告“落地可用”的核心障碍。