跳转至

DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3667
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/2477.pdf
领域: 视频生成
关键词: HDR重建、视频扩散、Log-Gamma映射、曝光掩码、可控生成

一句话总结

DiffHDR 把单段 8-bit LDR 视频中被裁剪的高光和被噪声淹没的暗部视为辐射度修复区域,借助 Log-Gamma 映射在冻结的 LDR 视频 VAE 潜空间中生成 HDR;它在 Cinematic Video 的 FOVVDP 上达到 6.89,优于 SingleHDR 的 6.56,并支持文本或参考图控制恢复内容。

研究背景与动机

绝大多数消费级视频和生成视频仍以 8-bit LDR 保存。量化和 \([0,1]\) 裁剪不仅压缩了亮度范围,还不可逆地抹掉过曝天空、灯光以及欠曝阴影中的结构。传统多曝光融合能从不同曝光帧补回信息,却依赖特殊采集流程;单图 HDR 网络只接收一份 LDR,通常以确定性的逐像素回归猜测丢失辐射度,面对严重饱和区域时容易产生平坦高光、伪影和跨帧闪烁。

这个问题本质上是一对多逆问题:同一片纯白天空可能对应云层、太阳或完全不同的高亮纹理,原始 LDR 已无法给出唯一答案。视频扩散模型拥有从海量 LDR 视频学到的时空生成先验,适合生成“合理但不唯一”的细节;然而它的 VAE 只见过标准 LDR 分布,直接编码数值远超 1 的线性 HDR 会造成严重重建误差。与此同时,真正高质量且成对的 LDR-HDR 视频又不足以从头训练大型模型。

DiffHDR 的切入点不是改造 VAE,而是把 HDR 信号压到它熟悉的表示域,再只对扩散骨干做参数高效适配。核心 idea:用 Log-Gamma 映射把 HDR 辐射度对齐到预训练 LDR 潜空间,将曝光损失区域作为视频辐射度修复目标,并以时序平滑掩码和区域化文本或图像条件控制扩散模型补出一致细节。

方法详解

整体框架

训练数据先由静态 16K HDRI 渲染成带相机运动的线性 HDR 视频,再模拟曝光偏移、相关传感器噪声、量化和裁剪得到配对 LDR。推理时,输入 LDR 经线性化和 Log-Gamma 映射后由 Wan-2.1-VAE 编码到 VACE 的上下文分支;主分支从随机噪声出发,在 LDR 潜变量、曝光掩码及可选文本或参考图的共同条件下生成 HDR 潜变量,最后经 VAE 解码和逆映射回线性 HDR。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入 8-bit LDR 视频"] --> B["HDRI 合成配对数据<br/>训练时构造监督"]
    B --> C["Log-Gamma 潜空间适配<br/>线性化→映射→VAE编码"]
    C --> D["曝光掩码引导的<br/>双分支扩散修复"]
    D --> E["上下文聚焦控制<br/>文本或参考图"]
    E --> F["VAE解码 + 逆映射<br/>线性 HDR 视频"]

关键设计

1. HDRI 合成配对数据:用静态环境图生成时序一致的 HDR 监督

成对 HDR 视频稀缺,DiffHDR 从约 800 张 Polyhaven 16K HDRI 出发,把相机置于 Blender 天空盒中心,渲染三种轨迹:朝最亮区域的变焦、朝最暗区域的变焦,以及每段旋转 \(120^\circ\) 的三段环拍。变焦起始焦距从 18--30 mm 采样,结束焦距从 50--70 mm 采样。最终得到约 5,400 段、每段 81 帧的线性 Rec.709 HDR 视频;静态 HDRI 虽没有真实物体运动,却能提供严格连续的辐射度和可控相机运动。

配对 LDR 不是简单做一次色调映射。系统先随机施加 \(\Delta\in[-2,2]\) 档曝光,使线性信号乘以 \(2^\Delta\),再加入信号相关与固定噪声。噪声场采用 AR(1) 过程保持跨帧相关,而非逐帧独立采样:

\[ \epsilon_t=\rho\epsilon_{t-1}+\sqrt{1-\rho^2}u_t,\qquad \rho=0.5. \]

最后转为 sRGB、裁剪到 \([0,1]\) 并量化为 8-bit。这条退化链让模型同时学会恢复高光、抑制暗部噪声和跨帧稳定,而不只是逆转一条固定色调曲线。

2. Log-Gamma 潜空间适配:不微调 VAE 也能承载 HDR 辐射度

直接把线性 HDR 送入 LDR VAE 会超出其训练数值域;重新训练 VAE 又会移动潜空间,削弱预训练视频扩散先验。DiffHDR 先用对数压缩把最大可表示辐射度 \(M\) 归一化,再施加 gamma 压缩,使 HDR 的统计分布更接近自然 LDR:

\[ \mathcal{T}(x)=\left(\frac{\log(1+x)}{\log(1+M)}\right)^{1/\gamma}. \]

推理末端使用逆变换恢复线性辐射度。关键不是单纯把数值塞进 \([0,1]\),而是让 VAE 看到接近原训练域的亮度分布;消融中去掉 gamma 后 PSNR 只有 25.38 dB,完整映射达到 32.86 dB,说明 gamma 部分显著减少高对比边缘和颜色重建误差。

3. 曝光掩码引导的双分支扩散修复:只在信息真正丢失处调用生成先验

DiffHDR 以 VACE 的上下文分支编码输入 LDR,主分支从高斯噪声生成 HDR。它先按 Rec.709 计算线性亮度,将高于 \(\tau_{high}=0.95\) 的像素标为过曝、低于 \(\tau_{low}=0.05\) 的像素标为欠曝,再以指数移动平均抑制逐帧阈值抖动:

\[ \widetilde M_t=\alpha M_t+(1-\alpha)\widetilde M_{t-1},\qquad \alpha=0.7. \]

掩码告诉扩散模型哪些区域需要合成新细节,其余区域则由 LDR 上下文约束,避免无必要地改写已可靠的结构和颜色。骨干 Wan-2.1-VACE-14B 保持冻结,只在 DiT 注意力层和前馈层插入 rank-32 LoRA;这样既保留通用时空先验,又降低约 5,400 段合成训练视频上的过拟合风险。

4. 上下文聚焦控制:把高光与暗部语义分别路由到对应区域

全局提示词无法说明“哪段语义属于天空高光、哪段属于树木阴影”。DiffHDR 将描述写成 [overexposed: ...]; [underexposed: ...],分别计算基础、高光和暗部三组交叉注意力响应,并仅在相应掩码内注入差分残差:

\[ r=r_{base}+\alpha_{over}M_{over}\odot(r_{over}-r_{base})+\alpha_{under}M_{under}\odot(r_{under}-r_{base}). \]

这种上下文聚焦交叉注意力只在推理时修改每层注意力输出,不改变训练权重或目标,因此同一个模型可在保持全局结构的同时定向生成太阳、云层或阴影纹理。需要更精细外观时,参考图经同一 VAE 编码后沿时间维拼接进条件序列,提供比文字更具体的视觉约束。

一个完整示例

以一段窗口过曝、室内立柱欠曝的 8-bit 视频为例:亮度检测先把窗口像素归入 \(M_{over}\),把暗柱归入 \(M_{under}\),EMA 则避免相机运动时边界在相邻帧跳动。Log-Gamma 表示进入上下文分支后,主分支从噪声生成潜在 HDR;若提示词指定“过曝区域是带云的天空、欠曝区域是木质立柱”,两段描述只增强各自掩码中的注意力。解码和逆映射后,用户可把结果重曝光到 EV-4 检查天空,也可到 EV+2 检查柱面纹理,而未裁剪区域仍由原视频约束。

损失函数 / 训练策略

训练遵循整流流匹配。对 HDR 潜变量 \(x_1\)、高斯噪声 \(x_0\sim\mathcal N(0,I)\) 和随机时间 \(t\in[0,1]\),先在线段上构造中间状态,再让条件速度场预测从噪声指向数据的恒定速度:

\[ x_t=t x_1+(1-t)x_0, \]
\[ \mathcal L=\mathbb E_{x_0,x_1,t}\left[\left\|u_\Theta(x_t,t,c)-(x_1-x_0)\right\|_2^2\right]. \]

条件 \(c\) 包括 LDR 潜变量、曝光掩码以及可选文本或参考图。模型以 \(33\times720\times1280\) 的时空分辨率训练 10,000 步,使用 AdamW、恒定学习率 \(10^{-4}\) 和 8 张 NVIDIA A100。DiT 微调用 BF16,VAE 解码保留 FP32;后者是为了避免 BF16 精度不足在连续 HDR 色调中引入条带。

实验关键数据

主实验

数据集 方法 参考指标 DOVER ↑ MUSIQ ↑ CLIPIQA ↑
Cinematic Video SingleHDR FOVVDP 6.56 0.77 51.79 0.33
Cinematic Video LEDiff FOVVDP 3.75 0.63 47.90 0.28
Cinematic Video DiffHDR FOVVDP 6.89 0.81 58.38 0.41
Polyhaven Synthetic SingleHDR FOVVDP 7.48 0.66 57.60 0.46
Polyhaven Synthetic LEDiff FOVVDP 4.68 0.59 58.92 0.46
Polyhaven Synthetic DiffHDR FOVVDP 7.65 0.68 60.02 0.50
数据集 方法 HDR-VDP3 ↑ PU21-PIQE ↓ FID ↓
SI-HDR HDRCNN 6.82 24.30 19.26
SI-HDR SingleHDR 7.37 26.64 27.55
SI-HDR LEDiff 6.56 22.71 25.98
SI-HDR DiffHDR 6.98 19.37 18.68

SI-HDR 上 DiffHDR 的 HDR-VDP3 并非第一,作者解释为生成修复得到的合理细节未必与唯一真值逐像素一致,因此会被全参考指标惩罚;但其 PU21-PIQE 和 FID 最优。视频数据上,它在所有报告指标上领先。额外的无参考评估也保持一致:在 50 段野外视频上达到 DOVER 0.74、MUSIQ 55.79、CLIPIQA 0.48,在 10 段 Veo2 视频上分别为 0.61、46.06、0.34。

消融实验

配置 PSNR ↑ SSIM ↑ LPIPS ↓
线性 HDR 直接编码 22.16 0.74 0.28
纯 Log 映射 14.61 0.74 0.57
Log-Gamma 去掉 gamma 25.38 0.75 0.34
完整 Log-Gamma 32.86 0.86 0.15
配置 FOVVDP ↑ DOVER ↑ MUSIQ ↑ CLIPIQA ↑
去掉数据增强 7.57 0.67 59.86 0.49
去掉曝光掩码 7.58 0.67 59.42 0.48
完整模型 7.65 0.68 60.02 0.50

关键发现

  • Log-Gamma 是最强的定量消融因素:相对去掉 gamma,完整映射的 PSNR 提高 7.48 dB、SSIM 提高 0.11,LPIPS 从 0.34 降至 0.15。
  • 去掉数据增强主要留下暗部噪声;去掉掩码则更明显损害阴影纹理,MUSIQ 从 60.02 降至 59.42。两者数值差距不大,但可视化对应不同失效机制。
  • 上下文聚焦提示的消融只提供定性结果:相较全局提示,它能更准确恢复太阳轮廓和阴影树木;论文没有为该模块报告独立数值增益,因此不应把图示优势解释成定量结论。

亮点与洞察

  • 最关键的工程洞察是“适配数据表示,而不是适配 VAE”。Log-Gamma 让一个只见过 LDR 的大规模视频 VAE 继续可用,避免小型 HDR 数据集破坏潜空间和生成先验。
  • 曝光掩码不只是一张修复区域图,它还把文本语义路由到高光和暗部。由同一掩码同时承担空间定位、时序平滑和条件控制,减少了训练与推理接口之间的错位。
  • 用静态 HDRI 训练却能泛化到真实动态视频,说明通用视频骨干提供了主要运动先验,合成数据只需补足“辐射度如何退化和恢复”的监督。这一思路可迁移到缺少真值的高位深、RAW 或光照编辑任务。

局限与展望

  • 作者明确指出模型只在 720p 训练和评估。直接推理 4K 会遇到显存、计算成本和训练测试分辨率差距,尚不能视为实际 4K 后期流程的即插即用方案。
  • 训练 HDR 视频由静态全景图和虚拟相机运动构成,缺少非刚体运动、动态光照、真实镜头响应与压缩伪影。当前真实视频结果证明一定泛化能力,却没有成对真实 HDR 真值来衡量辐射度准确性。
  • 生成式补全追求“合理”而非恢复唯一事实。提示词或参考图可控制歧义,但在纪实、科学成像等要求真实性的场景中,幻觉的高光结构可能不可接受;后续可引入不确定性图、保守恢复模式和可追溯的生成区域标记。
  • 上下文聚焦提示仅有定性消融,文本/图像控制强度、随机种子稳定性和条件冲突仍缺少系统评估。更完整的用户研究与跨提示一致性指标能补足这一证据链。

相关工作与启发

  • vs SingleHDR: SingleHDR 从单图逆转相机成像流程,输出确定性 HDR,结构简单但缺少视频时序先验和强生成能力;DiffHDR 更擅长严重裁剪区域与跨帧稳定,代价是 14B 视频骨干带来的计算量和生成歧义。
  • vs LEDiff: LEDiff 在潜空间执行 HDR 曝光生成,但实验中其视频质量和动态范围均弱于 DiffHDR。DiffHDR 的差异在于显式对齐预训练 VAE 的 Log-Gamma 表示、曝光掩码及区域化条件控制。
  • vs 多曝光 HDR 视频融合: 多曝光方法利用真实互补观测,辐射度恢复更有物理依据,却要求交替曝光和运动对齐;DiffHDR 只需一段普通 LDR,因此适用历史素材和生成视频,但不可避免地以先验猜测完全丢失的信息。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次把预训练视频扩散模型、无需微调的 HDR 潜空间映射与区域化可控修复组合成单段 LDR-to-HDR 视频框架。
  • 实验充分度: ⭐⭐⭐⭐ 覆盖合成、电影、野外和生成视频及多种指标,但真实成对 HDR 视频、控制模块定量消融和高分辨率评估仍不足。
  • 写作质量: ⭐⭐⭐⭐ 方法链路和视觉对比清楚,部分关键映射超参数与控制消融细节仍需读补充材料才能完整复现。
  • 价值: ⭐⭐⭐⭐⭐ 将海量既有 LDR 与生成视频接入 HDR 显示、重曝光和调色流程,研究与制作价值都很直接。