跳转至

SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/taco-group/SparkVSR
领域: 图像恢复
关键词: 视频超分辨率、稀疏关键帧、交互式恢复、时序传播、参考引导

一句话总结

SparkVSR 让用户先修好少量关键帧,再以低分辨率视频为运动约束传播这些视觉先验,在 MovieLQ 上用 PiSA-SR 参考取得 MUSIQ 68.88、DOVER 0.6212,同时允许通过参考引导强度选择更忠实或更具生成细节的结果。

研究背景与动机

视频超分辨率不只是补像素:同一段低分辨率视频可能对应多种合理的高分辨率纹理。DOVE、SeedVR2 等生成式恢复方法能补出细节,却通常把“应该补成什么样”留给模型。用户若发现文字、纹理或外观不符合预期,很难只纠正这些细节并让修改贯穿整段视频;给视频模型一条文字提示,也不等于提供了明确的逐帧视觉目标。

单图超分辨率与图像编辑已经提供较强的空间先验和交互能力,但逐帧运行它们又会造成闪烁,因为每一帧都可能生成不同的合理细节。反过来,单纯把关键帧编辑传播方法搬来做视频超分辨率也不够:生成视频可以容许一定内容变化,恢复任务却必须尽量保留输入的结构与运动。因此,需要同时给模型两类证据:关键帧说明期望的外观,完整低分辨率视频说明每一时刻实际发生了什么。

SparkVSR 将外观决策放在少量可检查、可修改的锚点上,把其余工作交给一个保留低分辨率时序信息的传播模型。关键帧既能来自自动 ISR 模型 PiSA-SR,也能来自受用户提示控制的 Nano-Banana-Pro,不要求对整段视频逐帧编辑。核心 idea:用稀疏高分辨率关键帧提供外观先验、用连续低分辨率视频约束运动,并训练同一个模型在有参考和无参考两种条件下工作,使恢复结果的参考依赖程度成为可调参数。

方法详解

整体框架

输入是一段退化的低分辨率视频,以及用户或策略选出的少量帧。先用外部图像超分辨率模型生成高分辨率参考,再分别编码参考帧与原视频,将两路特征拼接后输入基于 CogVideoX1.5-5B I2V 的扩散 Transformer,最后由 VAE 解码成高分辨率视频。

这里的“传播”不是先计算光流再复制纹理,而是让模型在完整视频条件下学习利用稀疏参考。潜空间到像素空间的两阶段训练为这一传播能力提供监督;推理时的无参考引导则控制已学会的参考条件有多强。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["低分辨率视频"] --> Select["可编辑关键帧锚点"]
    Select --> Fuse["双路稀疏条件融合"]
    Input -->|连续视频潜变量| Fuse
    Fuse --> Guide["无参考引导"]
    Guide --> Output["单步去噪与解码<br/>高分辨率视频"]
    Train["潜空间到像素空间训练"] -.->|训练所得传播能力| Guide
    GT["训练用真实视频与图像"] -.-> Train

图中实线表示推理数据流,虚线表示训练监督与模型能力来源;两阶段训练不是每次恢复视频时都要执行的在线操作。

关键设计

1. 可编辑关键帧锚点:把外观选择变成可检查的图像

参考帧可由人工指定、从编码器 I 帧中提取,或随机采样。人工选择适合优先处理退化严重、内容重要的位置;I 帧提供编码结构中的候选锚点;随机采样则适合自动运行。选出来的低分辨率帧先交给 ISR 模型,得到真正输入视频恢复器的高分辨率参考,而不是直接把低清帧当作新增信息。

交互式分支把任务提示与内容提示分开:前者指定放大、去模糊等目标,后者描述用户希望修复的文字或外观。提示作用于外部图像模型,并非论文新增了一个直接消费这些双提示的视频控制分支。用户因此可以先确认关键帧是否满意,再让视频模型传播;使用 PiSA-SR 时则不要求人工干预。

2. 双路稀疏条件融合:让外观先验始终与输入运动一起进入模型

低分辨率视频由预训练模型的 3D 因果 VAE 编码,时间下采样率为 4,潜变量有 16 个通道。参考分支将高分辨率关键帧按其时间位置放到对应潜变量索引,其他位置置零,形成同样为 16 通道的稀疏条件。两路沿通道维拼成 32 通道输入:零值意味着该处没有参考,而不是让模型忽略该时刻的视频证据。

去噪从低分辨率视频潜变量开始,而不是从完全随机噪声开始,并沿用受 DOVE 启发的单步策略,固定时间步为 399。这样模型从输入结构出发补充细节,稀疏参考只提供额外外观信息。它减少了反复扩散采样的开销,但“单步”不包含外部 ISR 的生成成本,也不自动等于整条交互流水线实时。

3. 潜空间到像素空间训练:先学传播,再校正可见纹理与闪烁

第一阶段固定 VAE 解码器,只在潜空间训练 Transformer,用预测恢复潜变量与真实高分辨率潜变量之间的 MSE 学习参考传播。训练参考取自真实视频,数量随机、上限为视频帧数的四分之一,相邻参考帧间隔严格大于 4。ColorJitter、GaussianBlur 和噪声增强让理想真值锚点更接近外部 ISR 可能产生的偏差,而不是假定参考永远完美。

第二阶段把结果解码到像素空间,联合训练视频与单图分支。视频分支仍使用稀疏参考,由像素 MSE、DISTS 感知损失和帧一致性损失共同监督;单图分支用零参考,只有 MSE 与 DISTS。后者既保持 32 通道输入格式,也强化无参考恢复能力。训练中以 0.1 的概率丢弃参考,避免模型只能在外部锚点充分且准确时工作;缓存没有清楚给出帧一致性损失的内部定义,不能将它擅自写成某种光流损失。

4. 无参考引导:调节参考依赖,而不是承诺同时提升所有指标

训练时的参考丢弃,使同一个模型既能做“原视频加参考”的预测,也能做“原视频加零参考”的预测。推理时利用两种预测之间的差异调节参考影响,这里的“无参考”仍保留低分辨率视频条件,不是无条件视频生成。引导尺度为 0 时使用盲恢复,1 时使用标准参考条件,大于 1 时强化参考,小于 1 时减弱可能有瑕疵的外部先验。

这一旋钮改变的是感知质量与失真之间的工作点,而非简单的去噪力度。表 4 显示,更强的参考通常让纹理与无参考质量分数上升,但会牺牲 PSNR、SSIM,甚至增大 LPIPS。缓存中的公式 (3) 抽取损坏,因此这里依据原文的条件定义与尺度说明解释机制,不重构作者的精确公式。

一个完整示例

以 MovieLQ 中一段 192 帧的老电影为例,表 3 的 I 帧配置选择第 1、48、96、144 帧。先用 Nano-Banana-Pro 修复这 4 张图像,检查人物细节或画面文字,再将它们编码到相应时间位置;未选中的位置保持零参考,但全部 192 帧的低分辨率运动信息仍进入视频分支。

模型学习到的传播能力把锚点外观带到其余时刻,再由引导尺度决定依赖外部修复多少。如果锚点出现不可信细节,可以降低尺度或重新编辑锚点后重跑。这个流程说明了“交互”的接口所在,并不意味着论文已经验证多轮交互的平均耗时或用户纠错成功率。

损失函数 / 训练策略

按方法文字概括,第二阶段视频目标由以下三项组成;这里只写已明确的组合关系,不补写缓存中未清晰定义的帧一致性项:

\[ \mathcal{L}_{\mathrm{video}}=\mathcal{L}_{\mathrm{MSE}}+\lambda_1\mathcal{L}_{\mathrm{DISTS}}+\lambda_2\mathcal{L}_{\mathrm{frame}},\qquad \lambda_1=\lambda_2=1. \]

单图分支不包含帧一致性项,第一阶段则只监督潜变量 MSE。两阶段分别解决“参考怎样影响视频”和“解码后是否有好纹理、少闪烁”,不能把前者已经有较高 PSNR 当作无需后者的依据。

训练数据包含 HQ-VSR 的 2,055 段高分辨率视频和 DIV2K 的 900 张图像,分别用 RealBasicVSR 与 Real-ESRGAN 的退化流程构造输入。训练使用 4 张 A100-80GB、总 batch size 8;第一阶段用 33 帧、320 × 640 视频训练 10,000 次迭代,学习率为 \(2\times10^{-5}\)

第二阶段联合视频与图像训练 500 次迭代,学习率为 \(5\times10^{-6}\),混合参数为 \(\varphi=0.5\)。原文将优化器写为 AdamW,却同时列出三个 beta 参数,这与常规 AdamW 定义不一致;笔记不据此给出可直接复现的优化器配置。

实验关键数据

主实验

UDM10、SPMCS、YouHQ40 使用与训练退化流程匹配的合成输入,RealVSR 包含手机拍摄的低质与高质配对视频。MovieLQ 包含 10 段 1940 至 1950 年代老电影,每段分辨率 360 × 480、时长 8 秒、24 fps,共 192 帧;它用于评估真实历史退化,不提供表 1 中其他数据集的全参考指标。

短序列基准只使用首帧作为参考,MovieLQ 使用 I 帧。下表摘自原文表 1;“无参考”“NBP”“PiSA”分别表示盲恢复、Nano-Banana-Pro 参考和 PiSA-SR 参考,必须视为不同运行模式。

数据集 / 指标 DOVE FlashVSR-Full SparkVSR 无参考 SparkVSR NBP SparkVSR PiSA
UDM10 PSNR ↑ 26.52 23.58 26.62 23.70 23.43
UDM10 SSIM ↑ 0.7697 0.6993 0.7756 0.6807 0.6710
UDM10 CLIP-IQA ↑ 0.5011 0.5016 0.4303 0.5501 0.6252
UDM10 DOVER ↑ 0.5664 0.5317 0.5494 0.6902 0.6411
RealVSR LPIPS ↓ 0.1850 0.2316 0.1809 0.1678 0.2165
MovieLQ MUSIQ ↑ 60.71 66.38 56.34 65.48 68.88
MovieLQ CLIP-IQA ↑ 0.5433 0.5754 0.4622 0.6128 0.6361
MovieLQ FasterVQA ↑ 0.7647 0.7822 0.7065 0.797 0.8028
MovieLQ DOVER ↑ 0.5101 0.5544 0.5121 0.6194 0.6212

MUSIQ、CLIP-IQA 为无参考图像质量指标,FasterVQA、DOVER 为视频质量指标;它们不能单独证明每个恢复细节都与真实场景一致。表中 UDM10 的 CLIP-IQA 从最强外部基线 0.5016 到 0.6252,约提高 24.6%;DOVER 从 0.5664 到 0.6902,约提高 21.8%,但两项分别来自 PiSA 与 NBP 模式。

消融实验

下面摘录原文表 2 与表 4 的 UDM10 结果。消融表本身采用更短的小数精度,因此保留其原值,不用主表精度补位。

来源 / 配置 PSNR ↑ LPIPS ↓ MUSIQ ↑ CLIP-IQA ↑
表 2:仅 S1,无参考 26.73 0.330 44.04 0.331
表 2:S1+S2,无参考 26.62 0.283 55.79 0.430
表 2:仅 S1,NBP 24.53 0.338 62.57 0.474
表 2:S1+S2,NBP 23.70 0.338 66.16 0.550
表 4:PiSA,尺度 0.5 25.66 0.312 60.17 0.496
表 4:PiSA,尺度 1.0 23.43 0.355 67.52 0.625
表 4:PiSA,尺度 1.5 20.94 0.399 70.39 0.652

第二阶段在无参考条件下使 MUSIQ 增加 11.75、LPIPS 降低 0.047,PSNR 仅降低 0.11 dB。但对 NBP 模式,LPIPS 在表 2 的精度下保持 0.338,不宜把作者“所有感知评价都改善”的概括理解成每个单元格严格改善。

关键发现

  • 参考质量提升与像素忠实度并非同一件事。PiSA 引导尺度从 0.5 到 1.5 时,MUSIQ 从 60.17 升至 70.39,而 PSNR 从 25.66 降至 20.94。
  • 表 3 在 MovieLQ 上用一个首帧参考,使 MUSIQ 从 56.34 升到 61.73;4 个均匀分布参考达到 65.76,I 帧参考为 65.48,说明不是某一种选帧策略在所有指标上都最好。
  • 同一表中 I 帧配置的 DOVER 为 0.619,高于 4 个均匀参考的 0.606。参考数量之外,时间覆盖和内容位置也影响视频质量。

亮点与洞察

  • 将用户意图落实为少量可见图像,而不是让用户反复猜提示词如何影响整段视频。锚点可先检查再传播,适合需要明确外观修正的恢复流程。
  • 保留完整低分辨率条件,让模型同时知道“外观应像什么”和“动作原本如何变化”。参考帧不需要覆盖全部时间点,这才使单图模型的能力可以复用于视频。
  • 参考丢弃、零参考图像训练与推理引导构成一条完整设计链。无参考分支既是缺失条件下的退路,也是调节参考强度的基准。

局限与展望

  • 外部图像模型可能生成错误文字或纹理,传播模型也可能把这些错误带到更多帧。降低引导能够减弱影响,但并不提供事实正确性的保证。
  • 实验包含 5 个基准,但 MovieLQ 只有 10 段视频;零样本上色与风格化主要是定性展示,不能直接等同于已充分评测的通用视频编辑能力。
  • 当前全文未报告交互用户研究、端到端 ISR 加 VSR 延迟,以及独立的运动误差或闪烁指标。DOVER 等综合质量指标支持视频质量改善,却不能完全隔离时序一致性的贡献。
  • 训练参考来自增强后的真值,推理参考来自外部生成器,仍存在分布差异。可进一步研究参考可信度估计、遮挡后的重新锚定及基于内容变化的选帧策略;这些属于后续方向,不是本文已验证模块。

相关工作与启发

  • vs DOVE:继承单步扩散与潜空间到像素空间训练思路,新增可编辑稀疏参考和可调参考引导。价值在于控制接口与传播能力,而不是首次提出高效单步 VSR。
  • vs PiSA-SR / Nano-Banana-Pro:两者提供单帧细节或交互修复,SparkVSR 则负责把结果放回连续视频。它们是参考生成器,不应被误写成视频传播基线。
  • vs STAR:STAR 的文本引导主要提供较粗粒度语义信息,SparkVSR 用具体参考图像规定期望外观。代价是额外的锚点生成与可能的人工筛选。
  • 对其他恢复任务的启发:在老片上色或局部风格编辑中,可以把“如何改”交给图像模型,把“如何随时间保持”交给视频模型,但仍需单独验证运动保真和错误传播风险。

评分

  • 新颖性: 4/5。将交互关键帧、低分辨率运动条件与无参考引导整合为可控 VSR 流程,基础架构和两阶段路线沿用已有工作。
  • 实验充分度: 4/5。多基准与训练、引导、选帧消融较完整,但缺少交互用户评价及端到端成本数据。
  • 写作质量: 4/5。主线清楚,但“更好感知”与逐指标提升需区分,优化器参数表述也有疑点。
  • 价值: 4/5。为可编辑视频恢复提供实用接口,尤其适合愿意先校正少量关键帧的工作流。