跳转至

SVI360: Spherical Video Interpolation

会议: ECCV 2026
论文: ECCV 原文
代码: https://icb-vision-ai.github.io/video360_interpolation/
领域: 视频理解
关键词: 球面视频插帧, 全景光流估计, 正交双分支, 等变先验, 多候选场融合

一句话总结

针对等距柱状投影(ERP)两极畸变剧烈与大位移匹配失效的瓶颈,SVI360 提出引入 \(90^\circ\) 旋转正交视角的双分支多尺度架构,利用跨视角等变位移协同修正光流与中间特征,结合多候选帧合成与球形加权 Charbonnier 损失实现高质量 360° 视频插帧。

研究背景与动机

全景(360°)视频在虚拟现实、沉浸式娱乐与机器人导航中具有广泛应用。为减轻用户的晕动症并提供逼真的临场感,沉浸式头显对超高帧率(如 90–120 fps)提出了近乎刚性的需求。然而,全景视频的数据吞吐量极其庞大,原生超高帧率的传输和流式分发会占用海量网络带宽。通过在终端本地部署视频插帧(Video Frame Interpolation, VFI)算法,从低帧率流中平滑重建连续过渡帧,是破解传输瓶颈的核心路径。然而,直接将现有的透视图像插帧算法(如 FILM、RIFE、AMT)迁移至球面视频时,重建质量会出现断崖式下跌,在两极及大运动边界处产生极其严重的鬼影与涂抹伪影。

造成这一退化的核心矛盾在于:标准 2D 平面插帧算法依赖于透视投影的各向同性假设,而球面的等距柱状投影(Equirectangular Projection, ERP)在空间上存在极端非均匀性——赤道区域畸变较小、信息集中,两极纬度区域则被横向无限拉伸,伴随严重的几何形变与巨大的像素流位移。先驱工作 360VFI 首次尝试利用球面先验与可学习形变卷积缓解极区畸变,但在运动位移较大的中高动态场景下,其单视角形变补偿机制迅速失效。另一方面,尽管 PriOr-Flow 等工作验证了旋转正交视角对全景光流估计的几何补益,但光流估计本身不能直接等同于帧合成,插帧任务亟需在光流匹配与图像纹理特征层面同时实现全景几何感知的端到端解耦与修正。

本文的切入角度是:利用球面旋转的等变性质构建正交视角,将两极强畸变区域在正交空间中旋转至赤道中心,从而将难以匹配的极区位移转化为易于追踪的低畸变平移。核心 idea:设计正交双分支金字塔结构,通过双代价协作查找与球面细化器将正交视角捕获的高纬度可靠运动与特征先验反向注入原视角,并在末端融合双视角多候选流场预测,配合抑制两极误差发散的纬度加权 Charbonnier 损失实现精细插帧。

方法详解

整体框架

SVI360 接收两个连续时刻的 ERP 球面输入帧 \(I_0^p, I_1^p\),目标是合成任意中间时刻 \(t \in (0, 1)\) 的高保真插值帧 \(I_t\)。算法整体遵循从粗到精(Coarse-to-fine)的多阶段残差细化逻辑:首先将原始输入映射为旋转 \(90^\circ\) 的正交视角帧 \(I_0^o, I_1^o\),由双分支特征编码器分别抽取多尺度特征;在各阶段构建全对相关体,利用双代价协作查找(DCCL)与轻量化更新网络联合迭代双向流与中间特征;随后通过球面细化器将正交分支的信息对齐并补偿回主视角;最后在最细分辨率下,双分支分别生成多个候选插帧场,由卷积融合头整合成最终图像。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入原始连续全景帧对<br/>I0_p, I1_p"] --> Rot["正交视角投影变换<br/>绕 x 轴旋转 90 度生成 I0_o, I1_o"]
    Rot --> Feat["双分支特征编码与多尺度相关体构建"]
    Feat --> Upd["AMT 风格双代价协作查找与循环更新<br/>迭代提取同视角与跨视角相关特征"]
    Upd --> SR["球面细化器<br/>正交流与特征反向旋转对齐,残差修正原分支"]
    SR --> MF["球面多场细化与双分支候选融合<br/>双分支各预测 N 个候选,逆旋转并卷积融合"]
    MF --> Out["输出最终高保真全景插值帧 It"]

关键设计

1. 正交视角投影变换:将高纬度畸变区域转换为易匹配的低畸变带 等距柱状投影在南北两极区域(\(v \to 0\) 或 \(v \to H\))像素拉伸严重,直接在两极计算相关体容易陷入局部极小值。为建立可靠几何先验,模型将像素坐标 \((u, v)\) 经球面经纬度 \((\theta, \phi)\) 映射为 3D 笛卡尔坐标 \((x, y, z)\),并施加绕 \(x\) 轴 \(\alpha = 90^\circ\) 的刚体旋转变换 \(\mathbf{T}_p^o\)。此变换将原本处于高纬度极区的内容旋转映射至正交帧的赤道附近,使得原本扭曲变形的物体结构转化为低畸变纹理,为后续运动估计提供互补视角输入对 \(\{\mathbf{I}_0^o, \mathbf{I}_1^o\}\)。

2. AMT 风格双代价协作查找与循环更新:双分支协同解耦大位移流与特征 为了在高动态和大位移运动下保持稳定,模型在原始分支与正交分支均构建 4 级相关体金字塔。在每次更新迭代中,采用双代价协作查找(Dual-Cost Collaborative Lookup, DCCL)策略:当前分支的暂估光流不仅检索本视角的局部相关体响应,同时映射到对应旋转分支的相关体中抓取特征。两个分支的更新模块 \(\mathcal{U}_1\) 接收对应层级的光流、跨视角相关特征以及隐层中间特征,同步预测光流残差与中间特征残差,使特征表达自适应大位移运动。

3. 球面细化器:跨视角等变运动与特征的反向对齐与注入 仅依靠独立的分支循环更新无法彻底消除原始视角的伪影。球面细化器(Spherical Refiner, SR)在粗到精的各个解码阶段专为原始分支提供残差增益。模块先将正交分支当前估计的光流 \(\mathbf{f}^o\) 与特征 \(\mathbf{X}_t^o\) 经由反向投影变换 \(\mathbf{T}_o^p\) 旋转对齐回原始视角的空间基准: $\(\mathbf{f}^{o\rightarrow p} = \mathbf{T}_o^p(\mathbf{f}^o), \qquad \mathbf{X}_t^{o\rightarrow p} = \mathbf{T}_o^p(\mathbf{X}_t^o)\)$ 更新模块 \(\mathcal{U}_2\) 随后联合汇聚原始分支的光流与中间特征、正交分支对齐后的流与特征、以及基于两路流重采样的相关特征图,预测出原始分支光流与特征的精细修正残差 \(\Delta \mathbf{f}^p\) 和 \(\Delta \mathbf{X}_t^p\)。这一设计实现了跨视角几何信息在不同分辨率下的层层纠偏。

4. 球面多场细化与双分支候选融合:多假设采样破解遮挡与奇异区域模糊 在高度扭曲或存在复杂遮挡的边界区域,单组双向光流难以完全解释纹理流动。为此,两分支在最细尺度解码器处分别预测 \(N\) 组候选场(文中取 \(N = 5\)),每组包含前后向双向流、遮挡掩码 \(\mathbf{M}\) 与残差图像 \(\mathbf{R}\),分别通过双向后向变形合成 \(N\) 个中间帧假设。正交分支生成的 \(N\) 个中间帧候选通过反向投影对齐至原始空间: $\(\mathbf{I}_t^{o2p, n} = \mathbf{T}_o^p(\mathbf{I}_t^{o, n}), \quad n = 1, \dots, N\)$ 最终,原始分支的 \(N\) 个候选帧与对齐后的 \(N\) 个正交候选帧拼接送入轻量双层卷积融合头 \(\mathcal{F}_{\text{fuse}}\),在像素级自适应赋权组合,充分吸收正交分支在极区的结构保真度与原分支在赤道区的色彩清晰度。

损失函数 / 训练策略

模型综合采用 Census 结构损失与球形加权 Charbonnier 损失进行端到端监督: $\(\mathcal{L}_{r} = \mathcal{L}_{\text{cen}} + \lambda \mathcal{L}_{\text{char}}\)$ 其中 \(\mathcal{L}_{\text{cen}}\) 计算 \(7\times 7\) 局部 patch 的软汉明距离以保持结构在光照变化下的稳定性。为了解决两极区域像素被拉伸后在常规损失中占比过大、导致优化器过度迁就两极而忽视信息最密集的赤道区域的问题,作者引入随纬度自适应衰减的球形加权项: $\(\mathcal{L}_{\text{char}} = \sum_{\mathbf{p}} \rho \Big( \boldsymbol{\omega}(\mathbf{p}) \odot (\hat{\mathbf{I}}_t(\mathbf{p}) - \mathbf{I}_t^{gt}(\mathbf{p})) \Big), \qquad \rho(x) = (x^2 + \epsilon^2)^\alpha\)$ 加权系数 \(\boldsymbol{\omega}(\mathbf{p}) = \cos(\boldsymbol{\theta}_{\mathbf{p}})\),其中纬度角 \(\boldsymbol{\theta}_{\mathbf{p}} = \pi (v_{\mathbf{p}} / H - 0.5)\)。该权重在赤道处为 1、向两极平滑衰减至 0,迫使模型重点优化视觉内容集中的有效信息区。

模型在两张 H100 GPU 上采用 AdamW 优化器训练 300 个 epoch,学习率采用余弦退火从 \(2 \times 10^{-4}\) 衰减至 \(2 \times 10^{-5}\),批大小为 16,超参数 \(\lambda=1, \alpha=0.5, \epsilon=10^{-3}\)。除常规翻转与擦除外,引入了专用的 360° 随机偏航、俯仰、滚转(Yaw-Pitch-Roll)三轴旋转数据增强。

实验关键数据

主实验

论文在合成基准 FlowScape(中间帧 \(t=0.5\) 评测,含光流真值)、Flow360(8 倍任意时间步插帧)以及真实全景基准 ODV360 和 360VFI 上展开全面评测。涵盖标准透视指标(PSNR / SSIM)、球面几何加权指标(WS-PSNR / WS-SSIM)以及光流端点误差(EPE / SEPE / AE)。

数据集 / 场景 指标 SVI360 (本文) 次优基线 (AMT-G) 性能增益
FlowScape (中间帧) PSNR (dB) 38.68 38.05 +0.63 dB
FlowScape (中间帧) WS-PSNR (dB) 37.73 37.40 +0.33 dB
FlowScape (中间帧) SSIM / WS-SSIM 0.9754 / 0.9647 0.9704 / 0.9622 +0.0050 / +0.0025
FlowScape (光流) SEPE / AE 15.22 / 19.74 25.91 / 20.90 -10.69 / -1.16
Flow360 (任意时间步) PSNR / WS-PSNR (dB) 34.02 / 33.30 33.77 / 33.22 +0.25 / +0.08 dB
Flow360 (任意时间步) SSIM / WS-SSIM 0.9752 / 0.9615 0.9708 / 0.9594 +0.0044 / +0.0021
ODV360 (真实场景) PSNR / WS-PSNR (dB) 29.25 / 29.93 29.07 / 29.75 +0.18 / +0.18 dB
ODV360 (真实场景) SSIM / WS-SSIM 0.9332 / 0.9105 0.9303 / 0.9067 +0.0029 / +0.0038

在面向不同运动幅度的真实基准 360VFI 上(Easy、Middle、Hard、Extreme 四档难度),SVI360 均取得了最佳的 WS-PSNR 和 WS-SSIM,尤其在大幅度复杂运动下展现出更强韧的抗恶化能力:

难度等级 (360VFI) 360VFI [15] (WS-PSNR/SSIM) AMT-G [13] (WS-PSNR/SSIM) SVI360 (本文)
Easy (位移 < 2) 33.95 / 0.9537 34.84 / 0.9726 34.81 / 0.9731
Middle 28.96 / 0.9060 29.74 / 0.9376 29.98 / 0.9409
Hard 27.81 / 0.8879 28.58 / 0.9209 28.95 / 0.9264
Extreme (极端位移) 25.63 / 0.8517 25.55 / 0.8817 25.92 / 0.8880

消融实验

消融实验在 FlowScape 数据集上深入验证了各损失项和核心模块的必要性:

实验配置 PSNR (dB) WS-PSNR (dB) SSIM WS-SSIM 配置说明
完整模型 (Full model) 38.68 37.73 0.9754 0.9647 包含全部组件与损失函数
去掉球形加权 Charbonnier 损失 33.99 33.85 0.9099 0.9471 严重掉点 (-4.69 dB),两极过度拉扯赤道区域
去掉 Census 损失 38.34 37.63 0.9734 0.9644 纹理结构一致性下降,训练稳定性降低
去掉球面多场融合 (仅原分支生成) 38.08 37.29 0.9715 0.9627 掉点 (-0.60 dB),证明跨分支多场互补极其关键
去掉球面细化器 (w/o SR 模块) 38.59 37.65 0.9748 0.9640 跨尺度特征与光流无法获益于正交纠偏

关键发现

  • 球形加权损失是保底核心:去掉球形加权 Charbonnier 损失后,PSNR 发生断崖式下跌 4.69 dB。这证明如果不通过余弦纬度因子抑制两极极端误差的放大,梯度会被无意义的两极奇异值主导,严重破坏主视觉区域的画质。
  • 正交视角的双重收益:正交视角不仅能用于中间阶段的特征纠偏(SR 模块),在末端图像合成阶段作为独立的候选帧生成器(多场融合)同样带来 0.60 dB 的显著增益,验证了正交旋转在几何先验上的完备互补性。
  • 大位移抗跌落能力卓越:在 360VFI 的 Extreme 极端位移场景下,主流平面方法大多崩塌至 23–24 dB,而 SVI360 依然维持在 25.92 dB / 0.8880,显著优于 360VFI 原作与强基线 AMT-G。

亮点与洞察

  • 正交旋转解耦两极奇点:巧妙利用 \(90^\circ\) 正交变换将两极区域转至赤道平面,无需引入复杂的非欧几何网格即可在标准 2D 卷积架构内消除极点扭曲,概念简洁且计算友好。
  • 从单一光流约束到全图合成迁移:突破了以往 PriOr-Flow 仅用正交视角优化单向光流的局限,首次将正交视角先验同时打通至“光流残差更新 + 中间特征传播 + 多候选帧反向变形合成”全链路。
  • 泛化潜力广阔:双分支正交等变交互设计不仅适用于帧插值,亦可无缝推广至 360° 视频超分辨率、深度估计与全景场景补全等下游高畸变恢复任务。

局限与展望

  • 作者承认的局限:模型参数量达 50.1M,单帧推理延迟约为 365 ms(折合约 2.7 fps),无法满足 VR 实时交互渲染所需的高帧率低时延标准(>120 fps),目前更适合离线视频增强、流媒体预编码等场景。
  • 潜在改进方向:可探索正交分支与原始分支的权重共享机制,或引入知识蒸馏将双分支的正交等变表征迁移压缩至单分支紧凑网络中,在维持极区保真度的同时大幅削减计算延迟。

相关工作与启发

  • vs 360VFI [15]:360VFI 依靠从预估形变图学习可形变卷积偏移量,但其隐式偏移难以适应剧烈大运动;SVI360 采用显式正交投影与双代价关联查找,从根本上重构了大位移下的对应关系搜索空间。
  • vs PriOr-Flow [14]:PriOr-Flow 仅聚焦于单向全景光流估计;SVI360 则将其正交先验思想拓展至帧插值任务,并在特征对齐、细化器设计以及多候选场图像合成融合维度完成了系统性架构升级。
  • vs AMT-G [13]:AMT 专为常规透视视频设计,在 ERP 图像的两极遭遇严重失真;SVI360 在其多场转换思想基础上,注入了正交双视角交互体系与球形加权 Charbonnier 准则,实现了全景域的质变突破。

评分

  • 新颖性: ⭐⭐⭐⭐ [正交旋转先验在全景视频插帧中的全面系统化落地,机制清晰有效]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 个公共基准、多级难度、主客观指标齐全且消融扎实]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图文对照清晰,公式克制且物理动机明确]
  • 价值: ⭐⭐⭐⭐ [为 360° 沉浸式视频处理提供了扎实的基线范式与几何交互思路]