跳转至

Consistent Feature Transport for Image Relighting

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Dixin-Lab/CFT
领域: 图像生成
关键词: 图像重光照, 特征传输, 整流流, 肖像生成, 图像编辑

一句话总结

将图像重光照重构为光照特征传输问题,提出基于整流流的双传输一致性特征传输(CFT)框架,利用平行四边形法则与同光照跨实例轨迹监督解耦光照变化与主体内容,并在构建的大规模复杂光照肖像数据集上取得 SOTA 表现。

研究背景与动机

图像重光照旨在改变输入图像的光照条件(如光源方向、光强、色温与阴影交互),同时严格保留非光照内容,包括面部身份、几何结构、材质纹理与背景环境。随着以扩散模型与流匹配(Flow Matching)为代表的生成模型飞速发展,图像重光照已在肖像美化、虚拟影视制作与视觉特效等实际场景中展现出巨大价值。然而在复杂光照条件下,如何精准控制局部阴影与多光源交互,并维持原始图像结构不失真,仍是一大核心瓶颈。

现有基于扩散模型的重光照方案大致可归结为三类范式,但各自存在显著局限:基于显式控制的方法引入环境贴图或本征分量作为外部条件引导去噪,但高度依赖控制信号的完备性与测量精度,难以泛化到复杂遮挡与非均匀阴影;基于本征分解的方法试图将图像拆分为反射率与光照着色,但反演分解本身在复杂环境光下病态且易累积误差,直接引发颜色偏移与阴影伪影;基于直接图到图翻译或扩散轨迹操控的方法(如桥匹配或反演编辑)虽然依靠源图约束保持了实例结构,但将重光照退化为泛化的实例级变换,缺乏显式建模光照特征位移的机制,导致光照编辑精度与表达力不足。此外,公开的肖像重光照数据集多数在受控实验室环境下采集,缺乏复杂、多样化光源(如丁达尔光、霓虹灯、百叶窗阴影等),制约了模型在真实复杂场景下的泛化能力。

本文的切入角度是:重光照的本质不应是泛化的图到图修改,而应是潜空间中特定光照属性的定向位移向量传输。若直接用同一对源图与目标图监督重光照轨迹,模型会不可避免地过拟合样本特异性的内容与姿态差异;唯有将光照传输解耦出来,才能实现内容不变下的纯净光照编辑。核心 idea:将图像重光照重构为光照特征传输问题,在整流流框架下联合优化噪声到图像生成与基于平行四边形法则的源到目标传输,并通过共享相同光照变化的其他图像对提供跨实例轨迹监督(CFT),从机制上隔离光照变动与主体内容。

方法详解

整体框架

方法建立在整流流(Rectified Flow)框架之上,将潜空间中的噪声分布、源图像分布与目标图像分布统筹考虑。给定源图像 \(x_{\text{src}}\)、目标重光照图像 \(x_{\text{tgt}}\) 及其文本光照提示词 \(c_{\text{tgt}}\),速度网络 \(v_\theta\) 不仅学习从高斯先验到目标图的生成速度场,还学习从同一噪声先验在平中性光照条件 \(c_{\text{src}}\) 下还原源图的重建路径。更关键的是,模型通过平行四边形法则显式构建源潜变量到目标潜变量的直接传输速度场 \(v_t^{\text{direct}}\),并引入具有相同光照变化模式但来自不同人物/场景的辅助图像对 \((x'_{\text{src}}, x'_{\text{tgt}})\) 提供速度矢量监督,强迫流场仅编码纯光照特征迁移。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据<br/>源图与目标光照提示词"] --> B["双向整流流生成<br/>噪声到目标生成与源图重建"]
    B --> C["平行四边形直接传输<br/>基于流线性构建直达路径"]
    C --> D["跨实例一致性特征传输<br/>同光照对解耦内容与光照"]
    D --> E["大规模复杂光照肖像数据集<br/>集成三阶段质量过滤"]
    E --> F["输出重光照图像<br/>物理可信与结构保真"]

关键设计

1. 双向整流流生成:锚定目标光照合成与源图结构重建 标准的条件整流流往往只学习从高斯噪声先验 \(\pi_0\) 到目标图像分布的单向生成,其损失函数定义为: $$ \mathcal{L}1 = \mathbb{E} - z_0) \right|^2 $$ 然而,单纯依赖条件生成极易让模型忽略输入图像的高频结构先验,导致面部身份与细节特征发生漂移。为此,本文设计了共享相同先验噪声 }},\, t} \left| v_\theta(z_t^{\text{tgt}}, t, x_{\text{src}}, c_{\text{tgt}}) - (z_{\text{tgt}\(z_0\) 的辅助重建路径,输入源图像并附带中性光照条件 \(c_{\text{src}}\),训练模型将噪声平滑传输回源图潜表示: $$ \mathcal{L}2 = \mathbb{E} - z_0) \right|^2 $$ 这一重建分支不改变任何光照属性,它的引入在速度场底层强力锚定了原始人脸几何与背景语义,为后续光照迁移提供了坚固的结构参照基准。}},\, t} \left| v_\theta(z_t^{\text{src}}, t, x_{\text{src}}, c_{\text{src}}) - (z_{\text{src}

2. 平行四边形直接传输:线性流几何下的直达编辑路径 在整流流的常微分方程(ODE)线性几何特性下,潜变量沿时间 \(t \in [0, 1]\) 呈直线插值流动。根据平行四边形法则,从源图像潜变量 \(z_{\text{src}}\) 直接到目标图像潜变量 \(z_{\text{tgt}}\) 的中间插值状态可解析近似为: $$ z_t^{\text{direct}} = z_{\text{src}} + z_t^{\text{tgt}} - z_t^{\text{src}} $$ 对时间求导后,沿该直接传输轨迹切线方向的瞬时流场速度便可由目标生成速度与源图重建速度之差显式表示: $$ v_t^{\text{direct}} = v_\theta(z_t^{\text{tgt}}, t, x_{\text{src}}, c_{\text{tgt}}) - v_\theta(z_t^{\text{src}}, t, x_{\text{src}}, c_{\text{src}}) $$ 这一设计摆脱了费时的反演迭代步骤,使模型在推理阶段直接获得从源图奔向目标光照的几何位移向量场。

3. 跨实例一致性特征传输:消除样本特异性相关性的本质监督 若直接使用原始图像对自身 \((x_{\text{src}}, x_{\text{tgt}})\) 作为地标来监督 \(v_t^{\text{direct}}\),网络会轻而易举地拟合个体特有的几何形变或非光照细节,造成内容与光照的虚假耦合。CFT 的核心突破在于解耦这一监督链条:在训练集内检索或配对另一组包含完全不同人物与背景场景、但承受完全相同光照变换属性(如同样是正午顶光转霓虹侧光)的独立图像对 \((x'_{\text{src}}, x'_{\text{tgt}})\),将其真实潜变量差值 \((z'_{\text{tgt}} - z'_{\text{src}})\) 作为直接速度场的监督目标: $$ \mathcal{L}3 = \mathbb{E}{z'{\text{src}},\, z' - (z'}},\, t} \left| v_t^{\text{direct}{\text{tgt}} - z') \right|^2 $$ 由于输入端与监督目标在人脸身份、场景布局和衣着材质上截然不同,模型唯一的通用最小化解就是学会提取并在流场中仅传输与光照强相关的特征分量,从而从根本上消除内容泄漏。}

4. 大规模复杂光照肖像数据集:多源生成与多模型集成过滤 针对现有公开数据光照单一的缺陷,作者从开源肖像集合中精选出无特殊光照的多样化源图,结合光照方向、典型布光配置(伦勃朗光、丁达尔效应、蓝调时刻)以及测光属性(色温、光强、柔和阴影),调用高精度生成模型合成候选目标图。随后建立基于 QwenVL、EditScore 与 GPT-4o 的三阶段集成过滤系统,只有在三个大模型同时确认满足光照品质可信、内容完全一致、物理阴影合理三项标准后才予入选,最终沉淀出涵盖 34,695 对高质量人像的基准数据集(含 34,249 对训练集与 446 对测试集),覆盖室内(48.1%)与室外(51.9%)共十余种典型复杂场景。

损失函数 / 训练策略

模型的联合优化总损失函数表述为: $$ \mathcal{L} = \mathcal{L}_1 + \mathcal{L}_2 + \alpha \mathcal{L}_3 $$ 其中超参数 \(\alpha\) 控制一致性特征传输损失的约束权重,文中通过严格消融证明 \(\alpha = 0.1\) 为最优平衡点。训练在 8 块 NVIDIA H20 GPU 上进行,采用 Adam 优化器,学习率设为 \(1 \times 10^{-4}\),批大小为 4,迭代 4,000 步完成收敛。

实验关键数据

主实验

实验在构建的肖像重光照基准测试集上进行,涵盖像素级保真度(SSIM、PSNR)、感知相似度(LPIPS)、分布级真实感(FID)以及光照专属评估指标(估算辐照度误差 IE,即预测与真实辐照图的 MAE)。基线模型覆盖主流控制生成模型、本征分解模型、图到图传输模型及开源底模。

方法 范式类别 SSIM ↑ PSNR ↑ LPIPS ↓ FID ↓ IE ↓
IC-light 控制型生成 0.7436 15.3314 0.2209 47.3196 15.3575
LBM 图到图翻译 0.7908 15.5954 0.2267 40.8663 16.9276
FlowEdit 轨迹反演编辑 0.7133 13.6775 0.3298 78.1236 23.2227
Intrinsic Edit 本征分解编辑 0.7148 15.4219 0.2646 57.3994 14.2292
Latent Intrinsic 潜本征编辑 0.8425 18.1809 0.2379 35.0617 16.2387
Nano Banana 预训练无微调 0.7339 14.9196 0.2507 46.5012 15.9686
Flux-Kontext (原版) 预训练底模 0.6386 14.1543 0.2700 53.3793 18.2834
Qwen-Image-Edit (无 CFT) 控制型微调 0.8820 20.1170 0.1140 30.2147 11.5505
Qwen-Image-Edit (含 CFT) 本文方法 0.8894 20.9176 0.1132 25.5529 10.8670
Flux-Kontext (无 CFT) 控制型微调 0.9153 22.9192 0.0985 20.3817 7.8155
Flux-Kontext (含 CFT) 本文方法 0.9202 23.5105 0.0946 18.7338 7.4231

消融实验

在 Flux-Kontext 基座上对 CFT 的损失项组合与监督源选择展开充分消融。

配置 说明 SSIM ↑ PSNR ↑ LPIPS ↓ FID ↓
\(\mathcal{L}_1\) 标准整流流单向生成基线 0.9153 22.9192 0.0985 20.3817
\(\mathcal{L}_1 + \mathcal{L}_2\) 仅增加源图自重构路径 0.9141 22.8299 0.1018 21.6054
\(\mathcal{L}_1 + \mathcal{L}_3\) 引入跨实例传输但缺自重构 0.9161 23.3778 0.0972 19.3191
原始图像对监督 \(\mathcal{L}_3\) 使用 \((x_{\text{src}}, x_{\text{tgt}})\) 自身监督直接传输 0.9141 22.8031 0.1003 20.2961
随机图像对监督 \(\mathcal{L}_3\) 使用随机图像对 \((x^{\text{rand}}_{\text{src}}, x^{\text{rand}}_{\text{tgt}})\) 监督直接传输 0.9135 22.7958 0.1035 19.5538
CFT (完整模型) \(\mathcal{L}_1 + \mathcal{L}_2 + 0.1 \mathcal{L}_3\)(同光照跨实例监督) 0.9202 23.5105 0.0946 18.7338

关键发现

  • 跨实例监督是解耦光照特征的定海神针:消融表明,若用原图像对监督 \(\mathcal{L}_3\),PSNR 反倒由 22.9192 跌至 22.8031,甚至劣于仅有 \(\mathcal{L}_1\) 的基线。这是因为自监督迫使流场去死记个体的身份和背景变动;而同光照跨实例对监督下 PSNR 大幅拉升至 23.5105,方差分析(图 5)也证实此时预测速度场的方差在整条轨迹上保持最低,证明流场高度平滑且一致。
  • \(\mathcal{L}_2\) 重建与 \(\mathcal{L}_3\) 传输具备互补协同性:单独增加 \(\mathcal{L}_2\) 并不能改进光照,但在 \(\mathcal{L}_3\) 存在时,\(\mathcal{L}_2\) 锚定的几何结构能防止特征传输破坏高频细节,两者协同实现最优结构保持。
  • 权重 \(\alpha\) 存在精妙平衡点:在 \(\alpha \in [0.05, 0.6]\) 扫描中,\(\alpha = 0.1\) 取得全面最佳。过小则退化为标准条件生成,过大(如 0.3、0.6)则过度强加传输正则,扰乱了流生成动力学,导致图像质量急剧恶化。
  • 真实场景迁移零样本泛化出众:在未经微调的真实世界多光照基准(Multi-Illumination Dataset)测试中,CFT 驱动的 Flux-Kontext 相比无 CFT 微调版本,SSIM 由 0.6924 提升至 0.7325,PSNR 提升 0.63 dB,IE 估算辐照度误差由 28.96 降至 27.34,展示出强大的跨域物理光照感知能力。

亮点与洞察

  • 将属性编辑转化为跨实例流速度传输:摆脱了以往要么靠外部硬性控制引导、要么做黑盒端到端翻译的定势,利用平行四边形法则将条件流编辑转化为向量传输,机制优雅简洁。
  • 同光照跨样本解耦技巧:以具有相同物理光照变换的异源图像对作为速度地标,用数据组织逻辑天然剥离内容泄漏,是一种极具普适性、可推广到其他受控编辑任务的训练构型。
  • 通用编辑泛化能力:论文成功将 CFT 拓展至风格迁移任务(在 OmniStyle 骨干上 PSNR 达 14.1224 vs 基线 13.8040),证明该理论不仅限于光照,更适用于任意需要隔离内容与风格/属性的生成传输问题。

局限与展望

  • 风格多样性与确定性传输的权衡:在多对一/一对多的发散性编辑任务中(如风格迁移),CFT 引入的强几何对其一致性可能压制全局生成的多样性,导致 FID 指标出现轻微反弹(如 OmniStyle 风格迁移实验中 FID 从 82.23 上升到 85.64)。
  • 极端复杂阴影的自遮挡物理建模限制:尽管构建的数据集经过三模型物理合理性筛查,但生成模型先验在极其复杂的人体自遮挡(如发丝透光、手指投影)与二次反弹漫反射上仍缺乏刚性物理渲染引擎的绝对精度。
  • 未来方向:探索可变强度的自适应传输加权系数,并将 3D 几何法线先验融合进特征传输约束中,进一步增强复杂三维动态肖像的重光照一致性。

相关工作与启发

  • vs IC-light: IC-light 依赖环境贴图条件引导扩散过程,需繁琐的标注与控制先验构建;CFT 无需额外环境贴图,纯粹在潜空间中通过跨样本整流流传输学习光照特征,在保真度和阴影自然度上全面超越。
  • vs Latent Intrinsic: Latent Intrinsic 试图在隐空间解耦反光率与着色分量,但分解步骤的不准确会级联至生成结果中引发色偏;CFT 无需中间解耦,通过流场传输直接端到端解耦光照变化。
  • vs LBM (Latent Bridge Matching): LBM 采用桥匹配进行实例级图像翻译,缺乏对光照物理属性的定向正则,导致在结构复杂时重光照幅度过小或不均匀;CFT 则建立了基于平行四边形法则的光照专用特征流。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将整流流双传输机制与跨实例同光照约束引入图像重光照,理论优雅且创新性极强。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖多基座评测、真实多光照泛化测试、用户主观调研、多重消融以及风格迁移泛化,实验扎实严密。
  • 写作质量: ⭐⭐⭐⭐⭐ 叙述逻辑严丝合缝,公式与直观物理动机高度契合,数据呈现清晰完整。
  • 价值: ⭐⭐⭐⭐⭐ 为基于整流流的高保真可控图像编辑提供了崭新的理论范式与高质量肖像基准。