跳转至

Following Motion for Sequential Modeling in Video Frame Interpolation

会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 视频理解
关键词: 视频插帧, 状态空间模型, Mamba, 运动引导序列化, 上下文合成

一句话总结

针对传统状态空间模型在视频插帧中采用固定扫描顺序导致动态运动下语义割裂的问题,本文提出 MGMVFI,将光流运动轨迹重构为 Mamba 的 1D 序列化机制,并结合空洞卷积上下文合成修复光流失效区域,实现了线性复杂度下的高精度视频插帧。

研究背景与动机

视频插帧(Video Frame Interpolation, VFI)旨在从连续的输入视频帧对中合成中间时间戳的高质量画面,广泛应用于视频高帧率转换、慢动作视频生成以及新视角合成等领域。现有的深度学习插帧方案主要建立在卷积神经网络(CNN)与 Transformer 架构之上。然而,CNN 受限于局部感受野,在面对大尺度和快速运动时极易出现鬼影与伪影;Transformer 虽能建立全局长程依赖,但其针对高分辨率特征的自注意力计算具有二次复杂度 \(O(N^2)\),在处理 2K、4K 高清视频时面临巨大的显存与算力瓶颈。

近期,以 S6(Mamba)为代表的选择性状态空间模型(Selective State Space Models, SSM)以其线性计算复杂度 \(O(N)\) 和动态循环建模能力成为极具潜力的替代路线。然而,SSM 本质上是因果时序模型,其隐藏状态更新严格受制于输入序列的 1D 扫描顺序。现有的视觉 Mamba 插帧方法(如 VFIMamba 的交替扫描、LC-Mamba 的 3D 希尔伯特曲线扫描)均采用预设的、与运动解耦的空间扫描路径。当画面中存在剧烈物体运动时,同一运动实体在前后帧中的对应特征块在 1D 序列中往往被相隔极远的扫描距离所切断,这强行迫使下层 SSM 在有限的状态容量中既要跨步长盲目追踪复杂的运动轨迹,又要建模帧间微观特征演化,导致大运动场景下重建质量显著下降。

面对这一结构性矛盾,本文跳出了“仅在图像空间利用光流进行特征变形或加权融合”的传统定势,而是将运动对齐重新诠释为时序模型的序列化(Serialization)问题核心 idea:利用双向光流估计的物理运动轨迹直接定义状态空间模型的 1D 输入序列排列顺序(运动引导序列化 MGS),使 Mamba 的因果状态转移严格沿着运动连续的语义对应块发生,并辅以空洞卷积上下文合成模块自适应修复光流失真区域。

方法详解

整体框架

MGMVFI 整体架构由三个级联阶段组成:多尺度特征提取与光流估计、运动引导特征处理(MGM 模块)、以及最终帧合成。模型首先利用共享 CNN 编码器从输入帧 \(I_0, I_1\) 提取多尺度深层特征 \(F_0, F_1\),并利用预训练光流网络估计双向光流场 \(f_{0 \to 1}, f_{1 \to 0}\);随后,MGM 模块利用双向光流前向泼溅与双线性插值生成目标时刻的运动对齐特征,通过双向光流一致性检测定位遮挡与突变失效区域,调用掩码适配器执行上下文合成;合成后的时空特征重排为 1D 序列送入 SS2D 状态空间块与频域前馈网络(EDFFN)进行多尺度残差建模;最终由轻量级帧合成头重建输出中间帧 \(I_t\)

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入帧对 I0, I1 及双向光流 f01, f10"] --> MGS["运动引导序列化<br/>前向泼溅估算中间流并反向重采样"]
    MGS --> CS["上下文合成<br/>双向一致性掩码 + 空洞卷积填补失效区"]
    CS --> Fusion["序列重组与融合<br/>残差相加与帧间空间交织拼接"]
    Fusion --> SS2D["SS2D 状态空间建模<br/>四向扫描因果更新建模时空动态"]
    SS2D --> EDFFN["频域前馈网络 EDFFN<br/>低维频域门控增强高频纹理细节"]
    EDFFN --> Out["帧合成输出 It"]

关键设计

1. 运动引导序列化:将运动对齐重构为 SSM 状态转移序列机制 传统插帧模型利用光流将特征扭曲到中间帧网格后直接做像素级加权,而本文的核心洞察是利用运动轨迹来决定 1D 序列的令牌输入顺序。给定源帧间双向光流 \(f_{0 \to 1}\)\(f_{1 \to 0}\),假设运动在相邻帧间呈局部线性,通过前向泼溅(Forward Splatting \(\mathcal{S}\))将缩放后的光流投影到目标时间网格 \(p_t\) 上,计算目标帧到两端帧的中间位移场 \(f_{t \to 0} = \mathcal{S}(-t \cdot f_{0 \to 1})\)\(f_{t \to 1} = \mathcal{S}(-(1-t) \cdot f_{1 \to 0})\)。据此获得源坐标 \(p_0 = p_t + f_{t \to 0}\)\(p_1 = p_t + f_{t \to 1}\),并通过双线性重采样获取运动对齐特征 \(F'_0 = \mathcal{B}(F_0, p_0)\)\(F'_1 = \mathcal{B}(F_1, p_1)\)。此时,在目标网格上执行标准光栅扫描,其展开后的 1D 序列中相邻的令牌天然对应运动实体在前后帧的同质内容。这种对齐极大降低了 SSM 的建模负担,让隐藏状态只专注于微观形变和残差恢复。

为了定量表征序列中相邻特征的语义连贯度,论文定义了 1D 序列特征相似度指标(Sequential Feature Similarity \(S\)): $\(S = \frac{1}{N-1} \sum_{n=1}^{N-1} \cos(\phi(z_{n+1}), \phi(z_n))\)$ 其中 \(N\) 为序列长度,\(\phi(z_n)\) 为序列中第 \(n\) 个令牌的特征向量。实验证实该设计将相邻令牌的平均余弦相似度从交替扫描的 0.35 显著提升至 0.46。

2. 基于空洞卷积的上下文合成:解决光流不可靠区域的特征退化 尽管反向扭曲在几何上重构了特征,但在物理遮挡、出视野以及光照突变违反亮度恒常性假设的区域,光流估计会严重失效。光流算法在这些区域通常退化为零向量,导致特征采样取自静态背景而非真实运动前景,引发严重鬼影。若仅简单将不可靠特征置零,又会迫使网络完全依赖单侧单帧信息,造成局部模糊与褪色。为此,本文设计了基于双向光流一致性检测的掩码适配器。首先计算闭环往返误差: $\(\epsilon_{0 \to 1}(p) = \left\| f_{0 \to 1}(p) + f_{1 \to 0}(p + f_{0 \to 1}(p)) \right\|_2^2\)$ 通过自适应阈值条件判别生成二值可靠性掩码 \(M_{0 \to 1}(p)\),当误差大于平均光流幅度的 \(\alpha\) 倍(\(\alpha=1.1\))时标记为失效。针对失效掩码标记区域,引入具有 \(7 \times 7\) 空洞卷积核的掩码适配器 \(\mathcal{A}_1\),显式排除中心损坏点、仅聚合周边完好的有效上下文特征: $\(F^c_1 = \text{Conv}_{1 \times 1}(\text{GELU}(\text{ConvHollow}_{7 \times 7}(F'_1))) + F'_1\)$ 随后由掩码门控动态重组特征 \(F^{\text{ref}}_1 = (1 - M_{0 \to 1}) \cdot F'_1 + M_{0 \to 1} \cdot F^c_1\)。对反向流 \(M_{1 \to 0}\)\(F'_0\) 执行完全对称的上下文填补。

3. 频域判别前馈网络(EDFFN)协同:弥补 Mamba 的高频纹理感知短板 由于视觉 Mamba 的长程递归状态转移在频域上更偏向低频全局轮廓,容易在细微纹理和高频边缘处产生过度平滑现象。同时,运动引导序列化重排带来了一定计算负载,亟需高效轻量的互补模块。为此,本文在 SS2D 状态空间块之后引入了经过改进的频域判别前馈网络(EDFFN)。该模块将特征映射到降维空间后在频域执行自适应滤波与门控调制,仅以极低的参数增量与计算开销,定向补充细粒度的高频空间细节,确保插帧结果在运动轮廓清晰的同时兼具锐利的纹理真实感。

一个完整示例

以一辆小汽车在第 0 帧位于画面左侧(Patch 7)、第 1 帧快速移动到右侧(Patch 9)的动态场景为例: 在传统的交替扫描机制中,模型按照固定网格依次排列 \(F_0\)\(F_1\) 的特征块,Patch 7 与 Patch 9 在最终生成的 1D 展开序列中相距数十甚至上百个步长,因果状态更新必须跨越极长时序才能把前后帧同一物体的特征结合起来; 在 MGMVFI 流程中: 1. 光流网络估计出小汽车对应的高速运动向量,前向泼溅将其映射至目标时刻 \(t=0.5\) 的中央网格; 2. 反向重采样将 \(F_0\) 的 Patch 7 与 \(F_1\) 的 Patch 9 准确抓取并对齐至目标网格的同一局部空间位置; 3. 一致性检测发现汽车遮挡住的原背景树干光流失真,被掩码标记并通过 \(7 \times 7\) 空洞卷积提取树冠周围纯净背景进行上下文补偿; 4. 目标网格执行四向光栅扫描时,对齐后的小汽车特征在 1D 序列中成为紧挨着的连续相邻令牌,SS2D 仅需单步因果状态更新即可完成精准的跨帧运动特征融合,最后经 EDFFN 增强车牌与车窗反光的高频细节。

损失函数 / 训练策略

模型采用复合损失函数 \(\mathcal{L}_{\text{total}}\) 进行端到端优化: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{lap}}(I_t, I_t^{\text{GT}}) + \lambda \mathcal{L}_{\text{warp}}\)$ 其中 \(\mathcal{L}_{\text{lap}}\) 是生成帧 \(I_t\) 与真实帧 \(I_t^{\text{GT}}\) 之间的拉普拉斯金字塔 L1 损失,用于在多频带尺度上惩罚结构失真;\(\mathcal{L}_{\text{warp}} = \sum_s \mathcal{L}_{\text{lap}}(I_t^s, I_t^{\text{GT}})\) 是对多尺度特征金字塔中各层中间变形画面施加的辅助监督,权重超参数设为 \(\lambda = 0.5\)。模型在 Vimeo-90K 三元组数据集上训练 150 个 epoch,图像随机裁剪为 \(256 \times 256\),采用 AdamW 优化器,余弦退火学习率从 \(2 \times 10^{-4}\) 衰减至 \(2 \times 10^{-5}\)。光流网络采用预训练且冻结的 RAFT-Large,预计算双向流以加速训练。

实验关键数据

主实验

在主流插帧基准数据集(Vimeo-90K、UCF101、SNU-FILM 及其四档运动难度分级)上与先进的 CNN、Transformer 及 SSM 插帧模型进行客观质量指标对比(PSNR / SSIM):

数据集 指标 本文 (MGMVFI) 之前 SOTA (VFIMamba) 经典基准 (EMA-VFI) 提升
Vimeo-90K PSNR / SSIM 36.67 / 0.9820 36.64 / 0.9819 36.64 / 0.9819 +0.03 dB / +0.0001
UCF101 PSNR / SSIM 35.53 / 0.9710 35.45 / 0.9702 35.48 / 0.9701 +0.08 dB / +0.0008
SNU-FILM (Easy) PSNR / SSIM 40.45 / 0.9910 40.51 / 0.9912 39.98 / 0.9910 -0.06 dB / -0.0002
SNU-FILM (Medium) PSNR / SSIM 36.38 / 0.9804 36.40 / 0.9805 36.09 / 0.9801 -0.02 dB / -0.0001
SNU-FILM (Hard) PSNR / SSIM 31.04 / 0.9411 30.99 / 0.9401 30.94 / 0.9392 +0.05 dB / +0.0010
SNU-FILM (Extreme) PSNR / SSIM 25.86 / 0.8732 25.79 / 0.8682 25.69 / 0.8661 +0.07 dB / +0.0050
Xiph 2K PSNR / SSIM 37.15 / 0.9454 37.13 / 0.9451 36.74 / 0.9445 +0.02 dB / +0.0003
Xiph 4K PSNR / SSIM 34.65 / 0.9059 34.62 / 0.9059 34.54 / 0.9054 +0.03 dB / 0.0000

消融实验

1. 各功能模块逐步递进消融分析(Vimeo-90K 与 SNU-FILM Hard)

配置 Vimeo-90K PSNR / SSIM SNU-FILM Hard PSNR / SSIM 说明
基线纯 SSM (SS2D) 35.96 / 0.9793 29.71 / 0.9293 缺乏运动序列引导与频域增强,大运动下鬼影严重
+ EDFFN 36.10 / 0.9797 29.80 / 0.9300 频域门控带来高频纹理重构增益 (+0.14 / +0.09 dB)
+ MGS (运动引导序列化) 36.26 / 0.9802 30.24 / 0.9345 序列语义连续对齐,大运动性能大幅飞跃 (+0.44 dB)
+ 上下文合成 (完整模型) 36.67 / 0.9820 31.04 / 0.9411 空洞卷积修复遮挡失真,带来全场最大提升 (+0.80 dB)

2. 不同序列扫描方式及特征平滑度对比

扫描策略 序列相似度 \(S \uparrow\) Vimeo-90K PSNR / SSIM SNU-FILM Hard PSNR / SSIM
序列光栅 (Sequential) 0.15 35.39 / 0.9791 29.45 / 0.9336
螺旋扫描 (Spiral) 0.12 35.17 / 0.9781 28.83 / 0.9302
Z 型扫描 (Z-scan) 0.29 35.50 / 0.9792 29.79 / 0.9335
希尔伯特曲线 (Hilbert Curve) 0.33 36.45 / 0.9813 30.57 / 0.9376
空间交替扫描 (Interleaved) 0.35 36.56 / 0.9817 30.88 / 0.9390
本文 MGS (运动引导) 0.46 36.67 / 0.9820 31.04 / 0.9411

关键发现

  • 大运动场景增益最为显著:随着 SNU-FILM 运动难度从 Easy 提升至 Extreme,MGMVFI 的优势不断放大,在 Extreme 上超出第二名 VFIMamba 达 0.07 dB,SSIM 领先 0.0050,充分证实运动对齐扫描顺序在大幅度位移下的决定性作用。
  • 上下文合成是抑制遮挡失真的关键催化剂:消融实验显示,引入上下文合成使得 SNU-FILM Hard 的 PSNR 从 30.24 dB 剧烈飙升至 31.04 dB(净增 0.80 dB),消除了反向扭曲在非刚性形变和遮挡区引入的畸变特征。
  • 对光流骨干具有良好的鲁棒性与速度弹性:在 SNU-FILM Hard 上,将 RAFT-Large 替换为轻量级 RAFT-Small,参数量从 5.26M 骤降至 0.99M、耗时从 415.9 ms 降至 277.9 ms,而 PSNR 仅微跌 0.12 dB(30.92 dB),仍优于采用交替扫描的 VFIMamba。

亮点与洞察

  • 视角转换的思维革新:以往研究仅将光流视作空间坐标映射函数,而本文独辟蹊径将光流提升为因果序列模型的“拓扑重排器”,巧妙破解了 1D 循环扫描与 2D+T 动态物理运动之间的内在维度错配。
  • 空洞卷积的克制与精准补缺:在上下文合成中设计 \(7 \times 7\) Hollow Convolution 刻意挖空中心受损点,迫使网络仅能从周边可信空间借力填补,优雅避免了污染特征的次生扩散。
  • 频域门控对低频退化的针对性纠偏:精准洞悉 Mamba 在图像生成任务中对高频细节捕捉不足的固有特性,引入低维频域 EDFFN,以轻量级结构实现了细节与边缘的锐利重建。

局限与展望

  • 外部光流质量的级联依赖:MGS 的序列化质量高度依赖前置光流估计;若极端光照或剧烈运动导致光流产生结构性塌缩,排序错误将向后传播至 SSM。未来可探索光流与状态空间模型的联合端到端联合迭代优化。
  • 单一运动轨迹无法完全覆盖复杂多目标场景:当前 MGS 基于单一中间流场进行全局网格重采样,面对多层透明运动、反向交叠运动时难以解耦多条不同速度的轨迹。构建多轨迹分流序列化(Multi-trajectory Serialization)是值得探索的演进方向。

相关工作与启发

  • vs VFIMamba [47]: VFIMamba 首次将 S6 引入插帧任务,但依赖固定的逐列逐块跨帧交替扫描,时空运动特征距离过大;本文通过光流动态排序将相似语义 patch 邻近化,序列相似度提升 31%,在大运动下取得绝对优势。
  • vs LC-Mamba [18]: LC-Mamba 采用基于滑动窗口的 3D 希尔伯特曲线遍历来维护空间连续性,但依然属于预设运动无关扫描;本文由光流数据驱动自适应扫描路径,在 Xiph 4K 上表现出更优异的结构保真度。
  • vs EMA-VFI [48]: EMA-VFI 依赖基于 Transformer 的帧间注意力提取运动与外观,计算复杂度随分辨率平方级上升;MGMVFI 在具备线性显存可扩展性的同时,在高难度大运动上全面超越了 EMA-VFI。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [将光流运动轨迹升维为 SSM 的 1D 序列化机制,视角独特且极具启发性]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 个基准、跨 4 档运动尺度与 4K 超高清,消融实验设计紧凑严谨]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述层层递进,方法机制阐述深入透彻,图表自洽详实]
  • 价值: ⭐⭐⭐⭐⭐ [为状态空间模型在动态视频处理与底层视觉序列化建模中指明了新的范式]