跳转至

Wavelet-Guided Semantic Signal Compensation for Inversion-Free Image Editing

会议: ECCV 2026
论文: ECCV 原文
代码: https://zoey-tang-33.github.io/wavelet-edit-project
领域: 图像生成
关键词: 免反演图像编辑 / 整流流 / 小波变换 / 语义信号补偿 / 扩散模型

一句话总结

针对基于整流流的免反演图像编辑在高噪声阶段语义引导力弱、全局属性难以偏航的问题,本文提出基于同点探测与二维离散小波低频分解的语义信号补偿机制,在生成早期通过二次时间调制注入全局语义,在不牺牲背景保真度的前提下大幅提升大尺度属性编辑能力。

研究背景与动机

基于扩散模型与整流流(Rectified Flow, RF)的文本引导图像编辑近年来取得了显著进展。传统方法通常依赖精确的语义反演(如 DDIM Inversion 或 RF-Inversion),先将源图像反推回噪声隐空间再根据目标文本重新生成。然而反演过程极易引入累积数值误差与重建漂移,且计算开销高昂。为了摆脱这一计算瓶颈,FlowEdit 等免反演编辑框架应运而生。它们通过在源图像和目标轨迹之间动态估算速度场差值并沿时间步积分,在免除显式反演的同时自然继承源图像的几何与结构先验。

然而,现有的免反演流模型在执行全局语义属性修改(如大范围改变物体整体颜色、材质或风格)时存在严重缺陷。研究表明,在生成初始的高噪声区间,隐变量几乎完全由无序高斯噪声主导。此时神经网络预测的速度场主要由“将纯噪声拉向自然图像流形”的基础生成流向主导,文本条件所提供的语义引导信号极其微弱,出现严重的“高噪声语义不可分辨性”(Semantic Indistinguishability)。在决定粗粒度轮廓与全局低频特性的生成最初期,编辑轨迹未能积累足够的偏航动量,过强地附着在源图像分布周围;等时间步推进到噪声降低、文本控制力增强的后半程时,图像的全局布局和色调结构早已固化,导致编辑彻底失败或产生未完全转变的伪影。

这一困境的核心矛盾在于:如果在高噪声阶段盲目放大文本差分速度场,源轨迹与目标轨迹在隐空间的空间距离会引入严重的几何混淆与高频扰动,直接摧毁源图像的未编辑区域结构与细节。核心 idea:在源图像同一点位隐变量上探测纯净的文本引导速度差,利用二维离散小波变换滤除随机噪声扰动并剥离出低频全局分量,以二次时间衰减的调度权重在早期精准补偿全局语义,实现激进全局属性编辑与严苛背景保真度的解耦协同。

方法详解

整体框架

本文提出的框架建立在整流流(Rectified Flow)与 FlowEdit 的线性插值常微分方程之上。针对 FlowEdit 速度差分信号 \(\Delta v_t\) 混合了几何空间位移与文本语义差异的问题,本文在生成流程中引入辅助前向流向探测:在每个激活的编辑时间步,以源图像当前加噪隐变量为共同锚点,估算纯粹由文本驱动的共位语义信号;接着通过多级离散 Haar 小波变换剥离所有高频细节子带,仅提取纯净的低频全局逼近分量;最后以随时间二次衰减的权重将该低频补偿注入速度更新量中,驱动轨迹在生成初期快速脱离源分布。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入源图像与目标文本"] --> B["同点语义探测<br/>锁定源隐空间消除几何混淆"]
    B --> C["多级小波低频提取<br/>Haar小波分离低频与细节"]
    C --> D["二次时间调制注入<br/>二次衰减权重强化早期导向"]
    D --> E["整流流轨迹迭代更新<br/>输出编辑图像"]

关键设计

1. 同点语义探测:消除空间几何位移干扰 FlowEdit 的原始几何编辑信号 \(\Delta v_{t_i} = v_\theta(x^{\mathrm{tar}}_{t_i}, t_i; e_{\mathrm{tar}}) - v_\theta(x^{\mathrm{src}}_{t_i}, t_i; e_{\mathrm{src}})\) 是在两个不同空间点位 \(x^{\mathrm{tar}}_{t_i}\)\(x^{\mathrm{src}}_{t_i}\) 处评估网络输出。因此该差值不仅包含目标文本与源文本的语义差异,还夹杂着两组隐变量在隐空间中的几何分离所带来的流形差异,导致早期阶段方向混淆。为了获取未被空间几何位移污染的纯净语义引导流向,本文设计了同点语义探测机制。在源图像当前的加噪隐变量 \(x^{\mathrm{src}}_{t_i}\) 处,额外评估一次目标文本条件下的网络预测: $\(v_{\mathrm{sem}}(x^{\mathrm{src}}_{t_i}, t_i) = v_\theta(x^{\mathrm{src}}_{t_i}, t_i; e_{\mathrm{tar}}) - v_\theta(x^{\mathrm{src}}_{t_i}, t_i; e_{\mathrm{src}})\)$ 由于输入点位严格一致,两者共享相同的基础流形流向,速度差值 \(v_{\mathrm{sem}}\) 精确捕捉了文本条件改变所激发的局部瞬时方向。因为 \(v_\theta(x^{\mathrm{src}}_{t_i}, t_i; e_{\mathrm{src}})\) 在标准管线中已计算完毕,整个过程在每个编辑步仅需额外增加一次前向推理。不同于 FlowAlign 等方法在目标点 \(x^{\mathrm{tar}}\) 处施加校正,将锚点固定在源隐变量确保了该信号作为全局辅助先验的客观性与稳定性。

2. 多级小波低频提取:解耦全局语义与高频噪声扰动 尽管同点探测得到了方向正确的语义差分 \(v_{\mathrm{sem}}\),但由于 \(x^{\mathrm{src}}_{t_i}\) 在高噪声步包含大量前向高斯白噪声 \(\epsilon_i\),原始的 \(v_{\mathrm{sem}}\) 夹杂着剧烈的高频空间抖动与随机扰动。若直接将其加权合并到更新方程中,高频随机性会破坏未编辑背景的纹理连续性,诱发画面伪影。为此,本文设计了基于二维离散 Haar 小波变换(DWT)的低频提取算子 \(\mathcal{F}_{\mathrm{low}}\)。对空间张量进行 \(L\) 级多尺度正向小波分解,在每一级将逼近子带分解为低频逼近系数 \(cA\) 与水平 \(cH\)、垂直 \(cV\)、对角 \(cD\) 三个高频细节子带: $\((cA^{(l)}, cH^{(l)}, cV^{(l)}, cD^{(l)}) = \mathrm{DWT}(cA^{(l-1)})\)$ 在各层级递归操作中,将全部细节子带强制置零,仅保留最顶层的粗粒度逼近系数 \(cA^{(L)}\),并通过多级逆离散小波变换(IDWT)重建回空间域尺寸: $\(v_{\mathrm{low}} = \mathcal{F}_{\mathrm{low}}(v_{\mathrm{sem}}(x^{\mathrm{src}}_{t_i}, t_i)) = \mathrm{IDWT}^{(1:L)}\left(cA^{(L)}, \{\mathbf{0}, \mathbf{0}, \mathbf{0}\}_{l=1}^L\right)\)$ 该算子严格滤除了随机扰动,提炼出对应整体色调、大块面材质和全局能量分布的平缓慢变场。更重要的是,高频局部细节依然由主干的几何信号 \(\Delta v_{t_i}\) 正常传递,从而在空间频率域实现了“全局语义补偿”与“局部几何细节保持”的显式解耦。

3. 二次时间调制注入:早期强化偏航与后期保真收敛 在流模型的整个积分轨迹中,高频细节与全局结构的形成阶段截然不同:前期 \(t_i \approx 1\) 确立主体构图与全局色彩,后期 \(t_i \to 0\) 沉淀细粒度边缘与微观质感。因此,低频语义补偿信号不能以固定强度全局注入,否则后期会抑制模型细腻高频纹理的生成能力。本文提出二次时间调度加权函数 \(w(t_i) = \lambda t_i^2\)\(\lambda \ge 0\) 为语义强度超参),并构建最终的离散更新方程: $\(x_{t_{i+1}} = x_{t_i} + (t_{i+1} - t_i) \left( \Delta v_{t_i} + \lambda t_i^2 \cdot v_{\mathrm{low}} \right)\)$ 这一设计满足四个关键数学性质:在 \(t_i \approx 1\) 的高噪声极早期,\(t_i^2 \approx 1\),补偿项以近乎最大强度 \(\lambda\) 爆发,驱动编辑轨迹冲破流形吸收盆、在全局属性上产生实质性偏航;当时间演进至 \(t_i \to 0\) 时,权重平滑单调衰减至零,补偿项自动消退,ODE 更新完全退化回标准 FlowEdit,保证精细纹理与背景像素无缝保真;全过程平滑可导,无需设定任何离散阈值或硬截断区间;若设定 \(\lambda = 0\),则完全退化为原始 FlowEdit 轨迹。

一个完整示例

以将“一只绿色的蜥蜴”修改为“一只棕色的蜥蜴”为例: 1. 初始阶段(\(t=1.0 \to 0.8\):若仅采用 FlowEdit,流向被自然图像流形吸引,几何差分 \(\Delta v_t\) 极弱,Tweedie 单步前向投影预估图 \(\hat{x}_0\) 依然显示出完整的绿色蜥蜴轮廓。而本文方法通过同点探测计算 \(v_{\mathrm{sem}}\),经 3 级 Haar 小波滤除高频噪点后提取低频棕色色调偏向 \(v_{\mathrm{low}}\),并以 \(\lambda \cdot (1.0)^2 = 3.0\) 的高强度叠加,使隐变量在生成前 20% 时间步内迅速积累偏向棕色的全局色相偏航。 2. 中间过渡(\(t=0.8 \to 0.3\):主体的基础色相已锁定为棕色,此时时间衰减因子 \(t_i^2\)\(0.64\) 迅速降至 \(0.09\),低频色彩推动逐步让位给标准的几何差分项 \(\Delta v_{t_i}\),细化鳞片轮廓与光影立体感。 3. 收敛阶段(\(t=0.3 \to 0.0\):补偿权重 \(3.0 \times (0.1)^2 = 0.03 \to 0\),模型回到纯粹的 FlowEdit 轨迹,背景岩石与树枝的微小纹理完全依靠源传输项精准复原,最终生成背景毫发无损而蜥蜴全身转变为自然棕色的编辑结果。

实验关键数据

主实验

在涵盖 10 类编辑场景、包含 700 张图像的标准评测基准 PIE-Bench 上,以先进的流匹配大模型 FLUX 为骨干网络,对比主流扩散模型编辑方案(PnP、MasaCtrl、FreeDiff)、整流流反演方案(RF-Inv、StableFlow、RF-Edit、FireFlow、DNA-Edit)以及免反演方案 FlowEdit。评测指标覆盖结构一致性(DINO 特征自相似矩阵余弦距离 Struct)、背景保真度(PSNR、LPIPS、MSE、SSIM)及文本-图像对齐度(CLIP Similarity 全图与编辑区)。

方法 模型架构 Struct. \(\times 10^3\) \(\downarrow\) PSNR \(\uparrow\) LPIPS \(\times 10^3\) \(\downarrow\) MSE \(\times 10^4\) \(\downarrow\) SSIM \(\times 10^2\) \(\uparrow\) CLIP-Whole \(\uparrow\) CLIP-Edited \(\uparrow\)
PnP [36] Diffusion 23.47 22.48 105.70 79.83 80.22 25.44 22.60
MasaCtrl [4] Diffusion 23.68 22.66 87.54 80.66 81.89 24.37 21.36
FreeDiff [40] Diffusion 17.98 24.78 89.02 54.81 81.92 25.16 22.15
RF-Inv [32] FLUX 64.61 17.97 242.00 221.24 64.92 25.29 22.91
StableFlow [1] FLUX 19.25 23.04 77.09 84.78 87.22 24.06 21.18
RF-Edit [38] FLUX 24.45 24.41 113.44 56.46 83.84 25.03 22.28
FireFlow [7] FLUX 27.27 23.08 128.65 71.11 81.25 25.34 22.92
FlowEdit [19] FLUX 27.61 22.23 111.32 90.98 83.64 25.39 22.62
DNA-Edit [41] FLUX 16.83 25.21 86.48 48.11 87.23 24.82 22.12
Ours FLUX 30.95 26.17 54.02 39.24 90.60 25.52 23.05

消融实验

1. 频带选择消融(验证低频提取的必要性) 在 FLUX 架构下对比无补偿(Zero/FlowEdit 基线)、全频段恒等注入(Identity)、仅高频注入(Highpass only)与 Haar 小波低频注入的性能差异:

注入频带配置 Struct. \(\times 10^3\) \(\downarrow\) PSNR \(\uparrow\) LPIPS \(\times 10^3\) \(\downarrow\) MSE \(\times 10^4\) \(\downarrow\) SSIM \(\times 10^2\) \(\uparrow\) CLIP-Whole \(\uparrow\) CLIP-Edited \(\uparrow\) 说明
Zero (无补偿基线) 27.61 22.23 111.32 90.98 83.64 25.39 22.62 原始 FlowEdit,背景与文本对齐均受限
Identity (全频谱直接注入) 41.53 23.61 69.77 63.31 88.05 25.03 22.24 高频扰动破坏背景几何,Struct 恶化严重
Highpass only (仅注入高频) 33.20 24.81 59.69 50.37 89.25 24.97 22.34 缺乏全局语义引导,CLIP 分数最低
Haar wavelet (本文低频注入) 30.95 26.17 54.02 39.24 90.60 25.52 23.05 最优背景保真度与最高文本对齐度

2. 小波层数 \(L\) 与语义强度 \(\lambda\) 敏感度分析

设置 \(L\) \(\lambda\) Struct. \(\times 10^3\) \(\downarrow\) PSNR \(\uparrow\) LPIPS \(\times 10^3\) \(\downarrow\) MSE \(\times 10^4\) \(\downarrow\) SSIM \(\times 10^2\) \(\uparrow\) CLIP-Whole \(\uparrow\) CLIP-Edited \(\uparrow\)
\(L\) 扫描 (\(\lambda=3.0\)) 1 3.0 35.31 25.26 58.48 46.12 89.95 25.56 23.01
\(L\) 扫描 (\(\lambda=3.0\)) 2 3.0 34.21 25.51 57.36 44.14 90.16 25.59 23.01
默认设定 3 3.0 30.95 26.17 54.02 39.24 90.60 25.52 23.05
\(L\) 扫描 (\(\lambda=3.0\)) 4 3.0 26.06 27.05 49.12 33.36 91.17 25.39 22.90
\(\lambda\) 扫描 (\(L=3\)) 3 2.0 25.72 26.88 49.64 34.09 91.16 25.48 22.98
\(\lambda\) 扫描 (\(L=3\)) 3 2.5 28.30 26.52 51.83 36.59 90.88 25.54 23.05
\(\lambda\) 扫描 (\(L=3\)) 3 3.5 33.67 25.80 56.24 41.99 90.33 25.55 23.09
\(\lambda\) 扫描 (\(L=3\)) 3 4.0 36.65 25.44 58.68 45.00 90.04 25.44 22.94

关键发现

  • 频域低频提取是破局核心:消融实验清晰证明,若不经过小波低频滤波而直接注入全频带信号(Identity),LPIPS 与 MSE 虽有改善,但结构距离激增至 \(41.53 \times 10^3\),CLIP 甚至低于基线,说明高频噪声直接扰乱了生成流场;而仅注入高频(Highpass only)则完全无法提供全局偏航能力。只有保留纯粹的低频分量,才能实现保真度与编辑度的双向提升。
  • 背景保真度实现实质性飞跃:在所有 FLUX 基准模型中,本文方法在 PSNR(26.17)、SSIM(90.60)、LPIPS(\(54.02 \times 10^3\))和 MSE(\(39.24 \times 10^4\))四项关键指标上全线大幅刷新 SOTA,相较于 FlowEdit 基线,PSNR 提升近 4 dB,LPIPS 降低超过 50%,证明定向低频补偿有效遏制了生成后期的背景漂移。
  • 超参数灵敏度表现稳健:分解层级 \(L\) 越大,保留的频带越低粗,背景结构越保守稳固;\(\lambda\) 控制语义偏航冲力,数值增大带来更激进的文本贴合(CLIP 分数微升),但过大(\(\lambda=4.0\))会导致背景扰动。\(L=3, \lambda=3.0\) 处于极佳的帕累托前沿。
  • 用户主观评测优势显著:在 100 组成对盲测中,本方法相较于 FlowEdit 的胜率达到 66% 对 34%,相较于 FireFlow 与 StableFlow 的胜率分别高达 71% 和 68%,评测者普遍赞誉本方法在准确完成颜色/材质改变的同时,背景丝毫不出现模糊或扭曲。

亮点与洞察

  • 流形支配性视角的机理揭示:敏锐指出免反演编辑在高噪声区间并非“完全无信号”,而是“有用的文本方向被粗粒度流形恢复流场所掩盖”,从概率流常微分方程的角度解释了全局属性编辑失败的根本病因。
  • 同点探测巧妙消除空间几何混淆:通过强制在相同的源隐变量点评估目标条件速度,仅需一次额外网络前向传播便锁定了纯粹的文本差分方向,以极小算力代价解构了空间几何位移与语义偏向的强耦合。
  • 经典小波分解在连续流模型中的极简重生:没有引入任何需要复杂训练的适配器或复杂的注意力重加权(如无需修改 Self/Cross-Attention),纯粹借助 Haar 离散小波的线性与正交分解特性完成频带分离,算法即插即用、结构极简优雅。
  • 通用的频率分离与流引导思路:将“高噪声期全局属性难以建立”抽象为频域与时间步联合调制问题,该思想可平滑迁移至视频生成流匹配、3D 高斯泼溅(3DGS)流式编辑等更广泛的连续生成建模任务中。

局限与展望

  • 算力开销略有增加:由于同点探测需要在每个激活的编辑时间步对源隐变量增加一次目标 prompt 前向推理,每步模型评估次数由 FlowEdit 的 2 次增至 3 次(增加约 50% 的单步推理延迟)。未来可探索将早期高频步与后期间隔步的探测进行时间稀疏化抽样。
  • 极端几何形态突变仍具挑战:当前方法主要侧重于全局属性(色彩、光影、纹理分布)的补偿,对于需要剧烈改变物体拓扑几何结构(如将坐着的猫完全替换为展翅翱翔的老鹰)的大规模变形,受限于免反演框架固有的源轨迹几何束缚,仍不如深度反演或结构重构模型灵活。
  • 小波基函数固化:当前仅采用标准 Haar 小波基函数进行固定 \(L=3\) 级分解,未针对不同图像分辨率或语义层级自适应学习动态频带滤波器,未来可探索自适应可微分小波门控机制。

相关工作与启发

  • vs FlowEdit [19]: FlowEdit 采用源与目标双轨迹差分更新,在局部形状编辑上优秀,但在高噪声阶段缺乏足够的全局语义脱轨动量;本文在保留其轻量免反演骨架的同时,增设同点探测与 Haar 小波低频二次调制,彻底攻克其全局属性无法偏航的缺陷。
  • vs FreeDiff [40]: FreeDiff 在传统扩散模型中利用快速傅里叶变换(FFT)对隐空间做频率截断以约束结构,属于“施加保真度限制”;而本文在整流流速度场(Velocity Field)中利用小波变换进行“低频语义动力注入”,二者作用领域(隐变量 vs 速度场)与目的(结构约束 vs 语义增强)完全相反。
  • vs FlowAlign [18] / CVC [21]: FlowAlign 与 CVC 同样尝试引入额外前向评估,但它们将校正施加在目标隐变量 \(x^{\mathrm{tar}}\) 处,容易加剧数值震荡;本文将探测锚定在源隐变量 \(x^{\mathrm{src}}\),作为纯粹的辅助引导向量,配合二次时间调度使得轨迹积分极其平滑。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [敏锐识别流模型高噪声阶段流形吸引对语义的掩蔽,提出同点小波低频补偿,思路清晰巧妙]
  • 实验充分度: ⭐⭐⭐⭐⭐ [在 PIE-Bench 上覆盖 10 余种基线模型,包含详尽的频带消融、参数扫描、频域功率谱分析与用户盲测]
  • 写作质量: ⭐⭐⭐⭐⭐ [数学推导严谨自洽,动机阐述直击要害,方法逻辑与图表表达清晰连贯]
  • 价值: ⭐⭐⭐⭐☆ [免训练且无需修改模型内部注意力,代码轻量,对流匹配生成模型的实用化图像编辑具有重要推动意义]