h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform¶
会议: ECCV 2026
论文: ECCV Official
领域: 图像生成
关键词: 流匹配、图像编辑、Doob's h-Transform、正交速度分解、FLUX
一句话总结¶
针对流匹配模型在图像编辑中源图像保真度与目标文本对齐难以解耦的痛点,本文借助 Doob's h-Transform 建立等价 SDE 桥梁,推导出闭式重建引导与编辑方向,并通过正交速度分解实现结构保真与语义编辑的独立无干涉控制。
研究背景与动机¶
基于 Rectified Flow(RF)的大规模文本到图像扩散与流匹配模型(如 FLUX.1)展现出极强的图像合成能力,但在可控图像编辑任务中,模型必须同时兼顾两大核心诉求:精确契合目标提示词的语义改动(目标对齐,target alignment),以及严格保留非编辑区域的原图内容与几何结构(源一致性,source consistency)。早期的基于反演(inversion-based)方案依赖前向 ODE 将原图编码至潜在噪声分布,再在目标提示词引导下反向积分生成;然而反演过程累积的数值离散误差使得即便耗费大量计算做精确反演,生成阶段依然频繁发生结构漂移,迫使后续工作不得不引入针对特定网络架构的注意力图注入等启发式手段。另一方面,近期涌现的免反演(inversion-free)方案尝试直接在源域与目标域之间构建耦合变换轨迹,但其对高斯采样随机种子、流积分步数高度敏感,缺乏统一的概率论数学根基。
这一困境的本质矛盾在于:确定性流匹配生成是一条单向 ODE 轨迹,将轨迹拉向源图像结构所需的重建速度,与将轨迹推向目标提示词所需的语义编辑速度,在同一高维速度场中通常并不平行甚至互相冲突。现有方法粗暴地将二者在同一向量空间中线性叠加或交替采样,导致编辑强度稍有提升便破坏背景结构,而过分强调结构约束又会扼杀文本语义的修改幅度。更关键的是,经典概率论中用于对马尔可夫过程未来终态施加硬约束的强大工具——Doob's h-Transform,其理论基础建立在带有扩散项的随机微分方程(SDE)之上,而 Rectified Flow 本身是扩散系数为零的纯确定性概率流 ODE,若直接套用,h 引导梯度项前的系数会直接退化为零,导致连续时间 h 变换在流匹配框架下从数学上失效。
本文的切入角度是打破确定性 ODE 与随机桥过程的壁垒:既然存在无数个与确定性 RF 具有完全一致边际概率分布的等价 SDE,便可通过构造扩散系数严格匹配的等价过程,将 Doob's h-Transform 引入流匹配框架,从而把图像编辑显式重构为受双终态事件联合约束的条件生成问题。核心 idea:构造与 Rectified Flow 边际分布严格等价的 SDE 桥过程以激活 Doob's h-Transform,推导出无误差闭式几何重建速度与纯净语义编辑方向,并通过正交投影彻底剔除编辑速度在重建方向上的投影分量,实现完全解耦且即插即用的无训练编辑。
方法详解¶
整体框架¶
h-Flow 将文本图像编辑严格表述为给定原图潜在表示 \(x_0^{src} = \mathcal{E}(I_{src})\) 与目标提示词 \(c^{edit}\) 下的终态条件生成问题,即从后验分布 \(p(\cdot \mid x_0^{src}, c^{edit})\) 中采样。针对 RF 确定性 ODE 中扩散系数 \(g(t) \equiv 0\) 导致 h-Transform 引导项失效的障碍,框架首先构造一个具有非零扩散系数 \(g_{eq}(t)\) 但边缘分布与原 RF 处处等价的 SDE,以此激活概率流桥 ODE(Bridge PF-ODE)。随后将复合终态约束拆解为结构保真度专家 \(h_{rec}\) 与目标对齐专家 \(h_{edit}\)。在对数梯度空间完成力的叠加后,通过正交投影将编辑速度投影到重建速度的正交补空间,最终输出无干涉的复合引导速度场,驱动逆向生成过程。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:原图隐变量与目标文本"] --> B["等价 SDE 桥过程构建<br/>对齐边际分布激活连续 h-Transform"]
B --> C["双目标 h 专家函数设计<br/>推导闭式重建速度与纯净编辑方向"]
C --> D["正交速度分解<br/>剔除平行分量消除结构干扰"]
D --> E["无干涉复合逆向积分生成"]
关键设计¶
1. 等价 SDE 桥过程构建:解决确定性流匹配下 h 变换退化
经典 Doob's h-Transform 要求基础马尔可夫过程的扩散项严格大于零(\(g(t) > 0\)),使得无穷小转移核具有非退化方差;而 RF 生成依靠纯确定性 ODE \(\frac{dx_t}{dt} = v_\theta(x_t, t)\),扩散系数恒等于零,导致修正漂移项 \(\frac{g^2(t)}{2} \nabla_{x_t} \log h\) 恒等于零。为打破这一限制,本文利用边际分布相同但具有随机涨落的等价性,构造了扩散系数为 \(g_{eq}(t) = \sqrt{\frac{2t}{1-t}}\) 的等价 Itô SDE。当处于纯净数据终点 \(t=0\) 时 \(g_{eq}(0)=0\) 无噪声干扰,而在过程内部 \(t>0\) 处扩散项严格为正。将该系数代入反向时间概率流 ODE 后,引导项系数正好化简为 \(\frac{g_{eq}^2(t)}{2} = \frac{t}{1-t}\),从而将确定性 RF 严格升级为条件流匹配桥 ODE: $\(\frac{dx_t}{dt} = v_\theta(x_t, t) - \frac{t}{1-t} \nabla_{x_t} \log h(x_t, t)\)$ 这一构造在不改变预训练模型边际先验的前提下,为施加严格的终态条件提供了坚实的数学桥梁。
2. 双目标 h 专家函数设计:闭式重建速度与纯净语义编辑方向推导
在获取连续时间桥 ODE 后,需要将编辑任务的两个核心目标映射为具体的调和函数。假定在中间状态 \(x_t\) 条件下,保持原图结构与遵循目标提示词是条件独立的终态事件,调和函数自然分解为专家之积 \(h(x_t, t) = h_{rec}(x_t, t) \cdot h_{edit}(x_t, t)\),其对数梯度转换为力的线性叠加 \(\nabla \log h = \nabla \log h_{rec} + \nabla \log h_{edit}\)。对于源图像保真度 \(h_{rec}\),将其终态条件设为狄拉克分布 \(\delta(x_0 - x_0^{src})\),利用 RF 的各向同性高斯转移核并结合贝叶斯公式与 Tweedie 公式展开,时间依赖因子完美相消,导出的引导速度恰好为将当前状态拉直指向原图的闭式重建速度 \(v_{rec} = (x_t - x_0^{src}) / t\)。为了避免差分形式将模型预测误差引入无误差的基准,本文采用加权叠加形式定义基底重建方向: $\(\tilde{v}_{rec} = v_\theta(x_t, t, c^{src}) + \lambda_{rec} v_{rec}\)$ 对于目标语义对齐 \(h_{edit}\),其终态约束为符合目标提示词分布 \(p(c^{edit} \mid x_0)\)。通过引入源文本条件基线替代无条件基线,消除了源提示词与目标提示词共享的冗余内容,借助 Tweedie 估计后得到纯净语义变化量: $\(\Delta_{edit} = v_\theta(x_t, t, c^{edit}) - v_\theta(x_t, t, c^{src})\)$ 这种设计仅保留提示词修改带来的有效语义位移,显著优于传统分类器无引导(CFG)直接相减导致的背景破坏。
3. 正交速度分解:彻底解耦结构保真与语义编辑控制
尽管双目标在对数梯度空间形成了加性叠加,但在高维隐空间中,原始语义编辑方向 \(\Delta_{edit}\) 依然可能包含沿着重建方向 \(\tilde{v}_{rec}\) 的平行投影分量。这一平行分量要么冗余加强、要么破坏性削弱原图的结构几何重建,构成了保真度与编辑性相互缠绕的根源。为此,h-Flow 引入正交投影算子,将 \(\Delta_{edit}\) 显式分解为平行与正交两个互补子空间,并严格剔除平行分量,仅保留正交补空间分量: $\(\Delta_{edit}^\perp = \Delta_{edit} - \frac{\langle \Delta_{edit}, \tilde{v}_{rec} \rangle}{\|\tilde{v}_{rec}\|^2} \tilde{v}_{rec}\)$ 由于数学上保证了 \(\langle \Delta_{edit}^\perp, \tilde{v}_{rec} \rangle = 0\),最终的逆向积分速度场由两部分正交张成: $\(v = \tilde{v}_{rec} + \lambda_{edit} \Delta_{edit}^\perp\)$ 该机制使得用户在增大 \(\lambda_{edit}\) 增强修改幅度时完全不侵蚀原图结构,调节 \(\lambda_{rec}\) 强化背景保真时也丝毫不压制目标语义变换。整套操作仅需每步计算一次内积与向量减法,无需反向传播梯度或微调模型。
损失函数 / 训练策略¶
h-Flow 是一种完全免训练(training-free)且免反向传播梯度(gradient-free)的推理期算法。在预训练模型推理阶段,每个时间步仅需执行两次网络前向评估(分别输入 \(c^{src}\) 与 \(c^{edit}\) 计算 \(v_\theta^{src}\) 与 \(v_\theta^{edit}\))。实验默认基于 FLUX.1-dev 骨干网络,逆向编辑过程采用 \(N=28\) 步欧拉数值积分,步长超参数默认设为 \(\lambda_{rec} = 1.2\) 和 \(\lambda_{edit} = 1.5\)。前向初始化过程完全解耦,可无缝配合标准 ODE 积分反演、RF-Inversion 或一步加噪(SDEdit)等任意前向方案。
实验关键数据¶
主实验¶
在单属性编辑基准 PIE-Bench(700 张包含人、动物、物体的精细标注图像)及多属性复杂编辑基准 PIE-Bench++ 上,h-Flow 与目前最先进的反演类与免反演类方法进行了全面对比(骨干网络统一采用 FLUX.1-dev)。
| 数据集 | 方法 | 平均排名↓ | PSNR↑ | LPIPS↓ | SSIM↑ | MSE↓ | 结构距离↓ | CLIP-Entire↑ | CLIP-Edited↑ | HPSv2↑ | 美学评分(AS)↑ |
|---|---|---|---|---|---|---|---|---|---|---|---|
| PIE-Bench | SDEdit | 6.06 | 18.01 | 0.240 | 0.650 | 0.021 | 0.063 | 24.67 | 22.54 | 27.08 | 5.05 |
| FlowEdit | 4.39 | 21.92 | 0.111 | 0.833 | 0.009 | 0.028 | 25.19 | 22.54 | 27.70 | 4.87 | |
| ODEInv | 5.44 | 13.44 | 0.349 | 0.620 | 0.071 | 0.130 | 26.56 | 23.83 | 28.73 | 4.92 | |
| FireFlow | 5.89 | 18.15 | 0.207 | 0.738 | 0.026 | 0.057 | 25.69 | 22.56 | 26.45 | 4.63 | |
| RF-Inversion | 5.00 | 20.59 | 0.186 | 0.706 | 0.013 | 0.042 | 25.26 | 22.34 | 28.21 | 4.98 | |
| UniEdit-Flow | 3.00 | 29.45 | 0.060 | 0.900 | 0.002 | 0.011 | 25.80 | 22.34 | 26.77 | 4.96 | |
| RF-Solver | 3.22 | 22.90 | 0.140 | 0.819 | 0.007 | 0.031 | 26.09 | 22.68 | 27.24 | 5.48 | |
| h-Flow (本文) | 2.33 | 23.88 | 0.110 | 0.840 | 0.006 | 0.026 | 25.80 | 22.80 | 27.79 | 4.98 | |
| PIE-Bench++ | SDEdit | 7.11 | 19.92 | 0.230 | 0.680 | 0.014 | 0.090 | 22.50 | 21.80 | 27.08 | 4.00 |
| FlowEdit | 4.11 | 22.27 | 0.109 | 0.841 | 0.009 | 0.031 | 24.94 | 24.24 | 27.70 | 4.86 | |
| ODEInv | 5.44 | 17.21 | 0.240 | 0.720 | 0.028 | 0.080 | 25.50 | 24.92 | 28.20 | 4.73 | |
| FireFlow | 5.67 | 18.95 | 0.188 | 0.760 | 0.021 | 0.060 | 25.71 | 24.77 | 26.45 | 4.56 | |
| RF-Inversion | 4.44 | 21.13 | 0.180 | 0.730 | 0.011 | 0.040 | 25.23 | 24.49 | 27.93 | 5.18 | |
| UniEdit-Flow | 3.56 | 29.46 | 0.060 | 0.900 | 0.018 | 0.018 | 25.37 | 24.39 | 26.96 | 4.89 | |
| RF-Solver | 2.89 | 23.69 | 0.129 | 0.832 | 0.006 | 0.033 | 25.79 | 24.89 | 27.24 | 5.43 | |
| h-Flow (本文) | 2.78 | 24.30 | 0.109 | 0.850 | 0.005 | 0.029 | 25.48 | 24.54 | 27.67 | 4.92 |
消融实验¶
1. 正交投影算子的核心作用消融(PIE-Bench)
| 配置 | SSIM↑ | 结构距离↓ | CLIP-Entire↑ | CLIP-Edited↑ | 说明 |
|---|---|---|---|---|---|
| 无正交投影(w/o projection) | 0.834 | 0.026 | 25.37 | 22.79 | \(\Delta_{edit}\) 平行分量干扰重建速度,全图对齐指标显著受损 |
| 完整模型(w/ projection) | 0.840 | 0.026 | 25.80 | 22.80 | 投影后完全消除对重建轨迹干涉,CLIP-Entire 提升 +0.43 且 SSIM 提高 |
2. 核心超参数解耦性分析(PIE-Bench)
| 控制项 | 参数值 | SSIM↑ | 结构距离↓ | CLIP-Entire↑ | CLIP-Edited↑ | 核心结论与表现 |
|---|---|---|---|---|---|---|
| 重建强度 \(\lambda_{rec}\) (固定 \(\lambda_{edit}=1.5\)) |
0.0 | 0.830 | 0.026 | 25.97 | 22.92 | 无额外闭式锚定时保真度偏低 |
| 1.2 (默认) | 0.840 | 0.026 | 25.80 | 22.80 | 最佳平衡点,编辑指标几乎不掉(仅微降 0.12) | |
| 1.5 | 0.856 | 0.025 | 25.65 | 22.73 | 保真度进一步提升,编辑度变化微弱(证明完全解耦) | |
| 编辑强度 \(\lambda_{edit}\) (固定 \(\lambda_{rec}=1.2\)) |
0.0 | 0.846 | 0.020 | 22.84 | 20.49 | 不修改语义,表现为纯重建 |
| 1.5 (默认) | 0.840 | 0.026 | 25.80 | 22.80 | CLIP-Edited 跃升 +2.31,结构指标维持优异 | |
| 3.0 | 0.804 | 0.034 | 26.26 | 23.49 | 过度追求编辑强度开始侵蚀非编辑区结构 |
3. 对多样化前向过程的即插即用兼容性验证
| 基础前向方案 | 是否搭配 h-Flow | SSIM↑ | 结构距离↓ | CLIP-Entire↑ | CLIP-Edited↑ | 影响与改进 |
|---|---|---|---|---|---|---|
| RF-Inversion | Baseline | 0.70 | 0.070 | 25.26 | 22.34 | 基线表现均衡但文本对齐度有限 |
| + h-Flow (本文) | 0.73 | 0.082 | 26.10 | 23.60 | 保持高保真同时 CLIP-Edited 显著提高 +1.26 | |
| SDEdit | Baseline | 0.65 | 0.063 | 24.67 | 22.54 | 噪声注入导致结构与语义双重受限 |
| + h-Flow (本文) | 0.65 | 0.063 | 25.28 | 23.10 | 零结构损伤下 CLIP-Edited 提高 +0.56 | |
| ODE-Inv | Baseline | 0.62 | 0.130 | 26.56 | 23.83 | 虽具备高编辑性但结构发生灾难性崩塌 |
| + h-Flow (本文) | 0.70 | 0.077 | 26.44 | 23.65 | 结构距离骤降 -0.053,SSIM 飙升 +0.08,强力挽回图像崩溃 |
关键发现¶
- 综合表现第一:基线中 UniEdit 追求极致保真度(PSNR 达到 29.45)但严重牺牲了编辑能力与人类视觉偏好(HPS 仅 26.77,无法执行复杂动作修改);ODEInv 虽文本对齐高但结构崩溃(Distance 高达 0.130)。h-Flow 在 9 项指标的综合平均排名中高居第一(PIE-Bench 达 2.33,PIE-Bench++ 达 2.78),达到了目前最佳的帕累托前沿。
- 正交分解实现完美解耦:当 \(\lambda_{rec}\) 从 0.0 扫描到 1.5 时,CLIP-Edited 指标仅有 0.19 的轻微波动,而 SSIM 持续上升;当 \(\lambda_{edit}\) 从 0.0 提升到 1.5 时,CLIP-Edited 带来超过 2.3 分的质变跃迁。这直接证实了正交投影彻底隔离了两个参数的控制子空间。
- 普适稳定性器:即使配合极易导致图像结构发散崩坏的传统直接 ODE 反演(ODE-Inv),h-Flow 的闭式重建项也能充当强大的几何阻尼器,将结构距离从 0.130 迅速拉回至 0.077,表现出卓越的跨流程通用性。
亮点与洞察¶
- 等价 SDE 的概率论转化:创新性地通过边际同分布的等价 SDE 构造,填补了连续时间 Doob's h-Transform 在确定性 Rectified Flow 模型中因扩散项为零而无法使用的理论空白。
- 正交子空间速度投影:巧妙地借鉴约束优化中的投影梯度下降思想,在速度场层面将编辑向量拆为平行与垂直分量,彻底切断了语义更新反噬原图背景的数值通道。
- 零开销即插即用:无需任何训练、微调或梯度反向传播,对任意预训练 Flow 模型每步只需两次前向推理与一次向量内积,并能无缝嫁接于现有各类反演及免反演管线。
局限与展望¶
- 作者指出的局限:方法目前主要集中于 2D 文本图像编辑任务,尚未直接验证在时间维度强相关的视频生成以及高维三维场景生成等连续流匹配任务中的表现。
- 思考发现的局限:正交投影仅消除了全局速度层面的共线性,对于高度局部的精细几何交互(如要求在不改变猫体态的前提下局部修改项圈),在无局部注意力掩码显式约束时仍可能存在细微的局部结构牵引。
- 未来改进方向:可进一步将空间注意力机制或频域解耦引入正交分解权重的局部空间计算中,并探索将该理论框架拓展到视频流匹配模型与多模态通用编辑领域。
相关工作与启发¶
- vs UniEdit-Flow / RF-Solver:此类方法依赖复杂的求解器优化或启发式交叉注意力注入,而 h-Flow 拥有严谨的概率桥理论支撑,且不依赖特定的 Transformer 注意力结构。
- vs FlowEdit / FlowAlign:此类免反演方法直接构造双轨迹 ODE,对采样随机噪声极其敏感;h-Flow 引入闭式重建目标函数与正交解耦,数值稳定性大幅超越经验性双轨迹。
- vs h-Edit:h-Edit 仅能在扩散模型的 SDE 框架下利用文本提示词代理隐式近似原图,而 h-Flow 成功拓展至流匹配并利用狄拉克终态给出了严谨的闭式原图引导速度。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次打通 Doob's h-Transform 与确定性 Rectified Flow,理论推导严密且优雅。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 PIE-Bench / PIE-Bench++ 两大权威基准,包含正交投影消融、参数正交性扫描及 3 种前向方案兼容性测试。
- 写作质量: ⭐⭐⭐⭐⭐ 数学论证环环相扣,从问题分析、引理推导到算法正交分解层层递进。
- 价值: ⭐⭐⭐⭐⭐ 为流匹配模型的精准可控生成提供了兼具深厚理论底蕴与实用工程价值的通用解耦范式。