跳转至

FlowPainter: Inpainting Optical Flow via Confidence-Guided Completion

会议: ECCV 2026
论文: ECCV 原文
代码: 暂未开源
领域: 图像生成
关键词: 光流估计, 扩散模型, 置信度引导, 图像修复, 残差引导

一句话总结

FlowPainter 将密集光流生成重构为置信度引导的软补全任务,先通过轻量置信度感知网络提取简单区域光流先验,再在扩散去噪中进行置信度初始化与时间衰减残差引导,以大幅降低去噪负担并加速收敛。

研究背景与动机

光流估计旨在推断相邻视频帧之间每个像素的密集运动矢量,是视频理解、自动驾驶与底层图像恢复等领域的核心技术。现有基于深度学习的光流方法主要分为迭代优化范式与扩散生成范式两大流派。以 RAFT 为代表的迭代优化方法通过构建全对相关体和循环迭代更新取得了极高精度,但在面对大位移、严重遮挡和复杂非刚性运动时,特征匹配与循环更新容易失真;而以 FlowDiffuser 和 DDVM 为代表的扩散模型引入生成建模,在模糊和极端复杂运动区域展现出优异的恢复能力。

然而,现存扩散光流模型普遍从纯高斯噪声开始去噪恢复整幅密集光流场。在真实物理场景中,光流的难度分布极不均匀:前景运动虽然复杂剧烈,但伴随相机运动或刚性平移的大面积背景往往属于位移平缓、纹理清晰的简单区域。轻量级判别式网络即可极低成本地可靠估计这些简单区域的光流,而让扩散模型在全图简单区域上重复承担从噪声重建结构的沉重去噪负担,不仅浪费了宝贵的生成容量,更导致了训练初期结构缺失、收敛极其缓慢且优化不稳定的痛点。

针对判别式迭代模型与生成式扩散模型在不同难度区域表现出的互补特性,本文提出打破“全场纯噪声生成”的传统思维,将密集光流生成重构为以简单区域为锚点的置信度引导补全过程。核心 idea:利用轻量置信度感知网络预测粗光流与显式监督的置信度掩码作为可靠先验,在扩散去噪中执行置信度加权初始化与时间步衰减的残差引导,实现简单区域稳固约束与困难区域灵活扩散的双重优势。

方法详解

整体框架

FlowPainter 包含两大核心模块:轻量级置信度感知网络(Confidence-Aware Network)与光流补全去噪网络(Flow Inpainting Network)。输入相邻两帧图像后,置信度感知网络首先以极低开销预测粗略光流场和像素级置信度掩码,二者点乘得到简单光流先验;随后,光流补全网络以该先验为基础,在扩散去噪的起始步执行置信度掩码加权初始化,并在后续各采样步中通过时间步衰减模块注入置信度门控残差引导,结合图像条件特征完成困难与遮挡区域的高保真细化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["连续双帧图像输入<br/>Frame 1 & Frame 2"] --> B["置信度感知预测<br/>轻量网络输出粗光流与置信度"]
    B --> C["简单光流先验构建<br/>像素级门控过滤可靠区域"]
    C --> D["置信度初始化<br/>可靠区域填入先验/不确定区域注入噪声"]
    D --> E["时间步衰减残差引导<br/>早步强约束稳粗模/晚步弱引导保细节"]
    A --> F["标准图像条件特征提取<br/>上下文与跨帧匹配表征"]
    F --> E
    E --> G["最终高精度密集光流<br/>简单与困难区域自适应融合"]

关键设计

1. 显式多源监督的置信度感知网络:解耦简单运动与不可靠区域

为了在极低计算开销下为扩散模型提供可信的先验支撑,模型采用轻量级 PWC-Net 变体作为置信度感知网络,同步输出粗光流 \(F_r\) 与置信度掩码 \(M_{\text{conf}} \in [0, 1]\)。传统无监督遮挡学习倾向于产生模糊、保守的中等置信度,无法有效表征大位移与复杂运动带来的结构性失效。为此,本文设计了显式的双重退化真实标签 \(M_{\text{gt}} = \min(M_{\text{hf}}, M_{\text{occ}})\):其中困难光流掩码 \(M_{\text{hf}}\) 通过对粗光流与真值的归一化均方误差图进行 \(7 \times 7\) 卷积核腐蚀操作得到,保守收缩运动边界;遮挡掩码 \(M_{\text{occ}}\) 则通过前后向一致性校验获取,强制将光度不变假设失效区域置零。通过这种强监督,网络能够精准将整幅画面切分为高置信的简单流动区域与需要扩散补全的困难区域。

2. 软约束置信度初始化:赋予扩散采样高质量起点

在初始化扩散状态时,若将可靠区域完全“硬固定”为判别式先验,会导致判别网络的系统性偏差无法在后续去噪中被纠正。FlowPainter 构建简单光流先验 \(F_s = F_r \odot M_{\text{conf}}\),并基于阈值 \(\tau = 0.5\) 构建二值初始化掩码 \(B = \mathbf{1}[M_{\text{conf}} > \tau]\)。扩散起始状态 \(x_T\) 定义为:

\[x_T = B \odot F_s + (1 - B) \odot \epsilon, \quad \epsilon \sim \mathcal{N}(0, I)\]

高置信区域直接继承简单光流先验,不确定区域则填充标准高斯噪声。更重要的是,模型在后续采样步骤中不进行硬截断夹紧(hard clamping),而是允许扩散去噪器根据图像全局上下文对高置信区域同样保留修正空间,兼顾了快速定型与全局自洽。

3. 时间步衰减的置信度门控残差引导:动态平衡粗模稳定性与细节灵活性

在迭代去噪过程中,不同时间步对先验的需求截然不同:早期去噪步骤噪声极大,亟需强先验以稳定全局运动骨架;而后期去噪步骤主要负责恢复运动边缘与微小位移细节,先验过强会限制扩散模型的生成上限。FlowPainter 引入时间步衰减权重 \(W_t = (1.0 - t_{\text{cur}}/T) \cdot s\)(采样总步数 \(T=6\),基础缩放系数 \(s=0.95\)),并在当前去噪流 \(\hat{F}_t\) 下计算残差引导量:

\[R_t = W_t \cdot F_s - W_t \cdot M_{\text{conf}} \odot \hat{F}_t\]

该残差量通过轻量级卷积编码器 \(\phi_g(\cdot)\) 转换为引导特征,以加法形式直接注入扩散骨干网络的特征层 \(\tilde{H}_t = H_t + \phi_g(R_t)\)。随着 \(t_{\text{cur}}\) 逐步递减至 0,引导强度平滑释放,使得模型在初期快速压制噪声发散,在末期则充分利用图像上下文匹配特征完成细粒度精修。

损失函数 / 训练策略

置信度感知网络采用分步训练:第一阶段在 FlyingChairs 与 FlyingThings3D 上仅监督光流预测(EPE 损失与自监督变形损失权重分别为 0.1 与 0.01);第二阶段在 Sintel 与 KITTI 上引入置信度掩码的 \(L_1\) 监督(权重为 0.8)联合微调。对于以 FlowDiffuser 为骨干的光流补全网络,训练和推理均采用统一的 \(T=6\) 扩散采样步数。由于引入了简单光流先验,扩散网络的收敛迭代次数大幅压缩:在 FlyingChairs/Things3D/Sintel/KITTI 上仅需 20k/50k/50k/15k 次迭代(FlowDiffuser 原需 100k/200k/180k/50k),在 8×A100 GPU 上的训练耗时从 7 天 2 小时骤降至 2 天 1 小时,收敛效率提升超过 3 倍。

实验关键数据

主实验

在 Sintel、KITTI-15 以及 Spring 基准上的定量评测结果表明,FlowPainter 在无需额外大规模刚性流预训练的前提下,全面超越了代表性迭代优化与扩散光流方法。

数据集 / 分割 评估指标 FlowPainter (本文) FlowDiffuser (基线) RAFT SEA-RAFT
Sintel Clean (train) EPE \(\downarrow\) 0.87 0.88 1.43 1.18
Sintel Final (train) EPE \(\downarrow\) 1.32 2.23 2.71 4.13
KITTI-15 (train) EPE \(\downarrow\) 3.17 3.75 5.04 3.62
KITTI-15 (train) Fl-all (%) \(\downarrow\) 6.84 11.1 17.4 12.8
Sintel Clean (test) EPE \(\downarrow\) 1.01 1.02 1.61 1.31
Sintel Final (test) EPE \(\downarrow\) 1.71 2.03 2.86 2.60
KITTI-15 (test) Fl-all (%) \(\downarrow\) 3.02 4.17 5.10 -
Spring (train) EPE \(\downarrow\) 0.40 0.43 0.45 0.41

消融实验

消融实验系统验证了置信度掩码构建方式(遮挡掩码 O.M. 与困难光流掩码 H.M.)、时间步衰减模块(T.D.)以及补全策略(I.P.)的有效性,以及初始化阈值 \(\tau\) 的敏感度。

实验模块 / 配置 Sintel Clean (train) Sintel Final (train) KITTI EPE (train) KITTI Fl-all (%) (train) 说明
完整模型 (Full Model) 0.87 1.32 3.17 6.84 双掩码 + 时间衰减残差引导 (\(\tau=0.5\))
无遮挡掩码 (w/o O.M.) 0.88 1.37 3.22 7.01 缺少遮挡区域严格抑制,误用失效先验
无困难光流掩码 (w/o H.M.) 1.01 1.95 3.47 8.13 大位移区域误标为高置信,引入偏差
双掩码均无 (w/o Both Masks) 1.05 2.17 3.69 8.92 完全失去区域可靠性判别能力
无时间衰减模块 (w/o T.D.) 1.11 2.32 3.98 10.12 固定引导权重导致后期细节受限
无补全先验策略 (w/o I.P.) 0.95 1.67 3.49 8.97 退化为普通条件扩散生成
初始阈值 \(\tau = 0.3\) 0.95 1.78 3.76 8.54 阈值过低引入不准确粗流,加重纠错负担
初始阈值 \(\tau = 0.7\) 0.97 1.85 3.98 8.71 阈值过高导致可用先验过少,退化为纯噪声

关键发现

  • 复杂降质场景收益显著:在 Sintel Final 测试集上,FlowPainter 相比 FlowDiffuser 的 EPE 下降达 15.8%(1.71 vs 2.03),在训练集上更是降低了 40.8%(1.32 vs 2.23)。Final 分割包含运动模糊、散焦与复杂光照变化,实验表明简单区域的稳固锚定极大降低了扩散模型在极端恶劣观测下的生成不确定性。
  • 双重掩码不可或缺:去除 \(M_{\text{hf}}\) 导致 Sintel Final EPE 从 1.32 恶化至 1.95,表明仅凭遮挡检测无法涵盖判别网络容量受限引起的拟合失效;显式监督预测误差是构建可靠置信度门控的关键。
  • 训练收敛效率倍增:由于避免了全图从纯噪声中学习平坦平移运动,扩散骨干在仅用原版 \(25\%\sim 30\%\) 迭代步数的情况下即可完成收敛,大幅提升了扩散光流模型落地的实用性。

亮点与洞察

  • 将密集生成重构为软补全:突破了以往密集扩散模型必须“从零生成全图”的思维定势,巧妙地将判别网络的快速结构推断与扩散模型的强生成能力结合,实现了计算预算的区域按需分配。
  • 软残差引导替代硬约束夹紧:传统图像 Inpainting 常用掩码强制覆盖已知像素,这在光流任务中极易锁定先验误差。FlowPainter 采用动态衰减的残差特征注入,既在初期提供了强引导,又在后期保留了全局修正自由度。
  • 泛化潜力广泛:这种“轻量判别模型提先验 + 置信度门控 + 扩散残差补全”的混合范式,可以自然迁移至立体匹配(Stereo Matching)、单目深度估计与场景流估计等密集几何视觉任务中。

局限与展望

  • 两阶段流水线依赖:整体框架依赖前置判别网络与后置扩散网络的级联推理,虽然扩散采样步数仅为 6 步,但相比纯前向轻量级判别网络,整体推理延迟与内存占用仍偏高。
  • 置信度伪标签的启发式设计\(M_{\text{gt}}\) 依赖固定的高斯差分、形态学腐蚀与前后向一致性检测等启发式规则,在某些极端反光或非朗伯体表面可能产生误判。
  • 端到端联合自适应探索:未来可探索将置信度感知模块与扩散去噪器进行端到端联合梯度反传,让判别网络自发学习输出最契合扩散去噪特性的先验表征。

相关工作与启发

  • vs FlowDiffuser / DDVM: FlowDiffuser 等扩散光流模型直接从高斯噪声生成完整流场,在简单区域存在严重的计算浪费与初期优化不稳;FlowPainter 将其重构为置信度引导补全,大幅压减训练时长并显著提升复杂场景精度。
  • vs RAFT / SEA-RAFT: 纯判别式迭代模型在严重遮挡和大位移非刚性区域容易受局部匹配代价限制;FlowPainter 将判别模型作为提供低频结构先验的基座,疑难区域由扩散模型补齐,兼具了两者的长处。

评分

  • 新颖性: ⭐⭐⭐⭐ [打破全图去噪惯性,提出置信度引导的软补全混合光流范式]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 Sintel、KITTI 和 Spring 完整训练与测试集,消融对比详实严谨]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机链条清晰,图表逻辑工整,数学公式表达精练到位]
  • 价值: ⭐⭐⭐⭐ [大幅缩短扩散光流训练周期,为密集预测混合架构提供了通用范例]