跳转至

Be Tangential to Manifold: Discovering Riemannian Metric for Diffusion Models

会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4638
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/6801.pdf
作者: Shinnosuke Saito, Takashi Matsubara
领域: 图像生成 / 扩散模型
关键词: 黎曼度量、分数函数雅可比、测地线插值、切向与法向、无分类器引导

一句话总结

本文把预训练扩散模型的分数函数雅可比转化为无需额外训练的黎曼度量,让插值和引导更倾向沿数据流形运动,在 Animal Faces-HQ 插值上将 GeoDiff 的 FID 从 25.80 降至 21.01,并在 CFG 强度 12.5 时将生成 FID 从 17.28 降至 16.04。

研究背景与动机

VAE 和 GAN 通常具有显式低维潜空间,可以通过解码器把图像空间的距离拉回潜空间,从而定义符合生成器几何结构的路径。扩散模型却没有同类低维语义坐标:即使 Stable Diffusion 使用压缩后的潜变量,其噪声空间仍与去噪数据表示同维,而不是专门参数化语义流形的坐标系。因此,直接线性插值 LERP 容易穿过不自然区域,球面插值 SLERP 虽保留范数,也没有真正识别流形的局部方向。

已有几何方法试图绕开这个问题。GeodesicDiffusion(下文简称 GeoDiff)用密度构造距离,使路径偏向高密度区域;FIM-inspired 方法则利用分数方向构造度量。但“样本更常见”不等于“图像细节更好”,高密度吸引可能产生过度平滑的中间图。更根本地,分数向量只提供一个方向,而高维表示中流形的法空间通常不止一维,单一方向不足以说明哪些运动会偏离流形。

本文利用前人对分数函数雅可比谱结构的观察:小奇异值对应近似切向,大奇异值对应近似法向。贡献不是首次发现这种谱分离,而是将其转成能实际优化路径、修正采样的度量。核心 idea:按运动引起的分数变化计费,让法向偏移昂贵、切向运动便宜,从而尊重流形方向,而非单纯追逐高概率区域。

方法详解

整体框架

输入是预训练分数网络和一个带噪样本;核心是从网络的局部导数定义“向不同方向移动有多贵”。该度量服务于两个独立应用:全局插值固定一对端点并优化中间路径,局部引导修正则在每个去噪步抑制偏离流形的 CFG 分量,两者不是必须串行执行的模块。

插值分支先以 DDIM inversion 把干净端点映射到固定噪声时刻,在该时刻优化路径后再确定性去噪。引导分支从当前条件分数及 CFG 增量出发,求一个保留文本引导、但减少高几何代价运动的修正量。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["预训练分数网络<br/>带噪样本"] --> B["雅可比拉回度量"]
    B -->|固定端点路径| C["分数差测地线"]
    B -->|逐步 CFG 增量| D["度量引导修正"]
    E["图像端点<br/>DDIM inversion"] --> C
    C --> F["确定性去噪<br/>插值图像序列"]
    D --> G["修正后的去噪步<br/>生成图像"]
    G -->|下一时刻| B

关键设计

1. 雅可比拉回度量:用全部局部方向衡量运动成本

\(s_\theta(x_t,t)\) 为分数函数,\(J_{x_t}=\nabla_{x_t}s_\theta(x_t,t)\) 为对输入求导的雅可比。这里“分数”指对数密度梯度的模型估计,不是给图片打出的质量分数。原文式 (1) 定义:

\[ g_{x_t}(v,w)=\langle J_{x_t}v,J_{x_t}w\rangle =v^\top G_{x_t}w,\qquad G_{x_t}=J_{x_t}^\top J_{x_t}. \]

直观上,同样长度的一小步,如果让分数变化很大,就被视为昂贵。将雅可比分解成奇异方向后,每个方向的代价由其奇异值平方控制;小奇异值方向便宜,对应流形的近似切空间,大奇异值方向昂贵,对应近似法空间。这比 \(I+\lambda s_\theta s_\theta^\top\) 形式的 FIM-inspired 度量更丰富,后者在各向同性背景上只额外强调一个方向,无法区分多个法向方向。实际算法不需要显式形成完整雅可比或进行完整 SVD。

这里存在重要条件:\(J^\top J\) 无条件是半正定,只有雅可比满秩时才正定。作者认为真实带噪数据在中间时刻 \(t>0\) 满秩且保留谱间隙;理想的干净低维流形在 \(t=0\) 则可能退化。谱间隙与切向/法向的对应是支撑算法的几何近似,不宜理解为任意网络、任意噪声水平都有严格保证。

2. 分数差测地线:固定端点,让相邻路径点的分数变化更平缓

在固定时刻 \(\tau\),路径能量是速度的度量范数平方积分。利用链式法则,原文式 (2) 可写为下式;缓存的公式排版有缺损,此处依据式 (1) 和正文解释整理为标准数学记号:

\[ E[\gamma]=\frac12\int_0^1\|J_{\gamma(u)}\gamma'(u)\|_2^2\,du =\frac12\int_0^1\left\|\frac{d}{du}s_\theta(\gamma(u),\tau)\right\|_2^2\,du. \]

把路径离散成 \(N+1\) 个点,间隔 \(\Delta u=1/N\),就能用相邻点的分数差代替路径方向导数。原文式 (3) 的缓存同样存在排版缺损,下面是由上述能量得到的有限差分表达,系数与记号应结合原文核对:

\[ E_{\mathrm{disc}}=\frac{1}{2\Delta u}\sum_{i=0}^{N-1} \left\|s_\theta(x_\tau^{(u_{i+1})},\tau)-s_\theta(x_\tau^{(u_i)},\tau)\right\|_2^2. \]

这样做的价值是避开显式构造高维度量矩阵:只需沿离散路径计算网络输出,再对中间点优化。端点由 DDIM inversion 给定且保持固定,内部点从 SLERP 初始化;最终将所有路径点通过 DDIM 反向过程还原成图像。优化的是输入路径,不是重新训练分数网络。相较 LERP/SLERP 的闭式路径,这多了一轮数值优化,但与其他需要求测地线的方法属于同类开销。

最小化分数变化与“偏向高密度中心”不同:一个端点附近的带噪样本可以沿流形平行方向移动,而不必先压到密度峰值。原文把这解释为保留端点概率水平,但本笔记不把它扩张成任意分布下的严格等密度定理;高维实验检验的是重建、感知变化和分布距离,而非直接验证整条路径密度恒定。

3. 度量引导修正:保留引导意图,软抑制高代价方向

采样时,算法 2 以条件分数 \(s=s_\theta(x_t,t,c)\) 为基准,将完整 CFG 分数与它的差记为 \(\Delta s\);不要把这里的基准误读为无条件分数。优化目标一方面让修正结果在欧氏距离上接近原 CFG 更新,另一方面让它在新度量下接近未添加额外引导增量的更新。通过相邻时刻流形变化平滑、局部路径只取一个区间等近似,可得到线性系统:

\[ (I+\lambda G_{x_t})\Delta\hat s=\Delta s. \]

在理想精确解下,奇异值为 \(\sigma\) 的方向被缩放为原来的 \(1/(1+\lambda\sigma^2)\):法向的高奇异值分量受抑制,切向的低奇异值分量得到更多保留。这是从线性系统得到的解释,不是硬投影到已知切空间,也不意味着每个分量在实际近似中都被精确缩放。原文没有求完整逆矩阵,而是以 \(\Delta s\) 为初值,仅执行一次共轭梯度更新:

\[ \epsilon=\Delta s-(I+\lambda G_{x_t})\Delta s,\qquad \Delta\hat s\approx\Delta s+ \frac{\epsilon^\top\epsilon}{\epsilon^\top(I+\lambda G_{x_t})\epsilon}\epsilon. \]

计算 \(Gv\) 原本需要先做雅可比向量积,再做转置雅可比向量积。作者以有限差分近似前者,并利用雅可比近似对称的经验假设,以同类有限差分替代后者。因此每步多调用分数网络 4 次;基准 CFG 每步调用 2 次,总成本约为原来的 3 倍。无需额外训练并不等于无需额外计算。若将修正放到蒸馏教师端,学生则可继承收益而不增加其推理成本。

一个完整示例

以一对语义接近的 Animal Faces-HQ 图像为例,先用 DDIM inversion 将两张图映射到 \(\tau=0.6T\),实验取 \(T=50\)。用 SLERP 初始化 9 张中间图对应的带噪表示,两端点固定,总计 11 个路径点。随后运行 500 次路径优化:若一段路径穿过使分数快速变化的方向,相关相邻分数差会增大,优化便调整中间点,寻找更便宜的绕行方向,而不是直接抬高样本密度。

完成后对这些点确定性去噪,获得端点重建和中间序列。插值能否保住纹理由感知和分布指标间接检验;端点是否被破坏另用 RE 衡量。这个流程示例采用论文设定,不代表额外测得的一组单样本结果;CFG 修正是另一应用分支,并未默认叠加到这里。

损失函数 / 训练策略

图像实验使用 Stable Diffusion v2.1-base,路径优化采用 Adam,学习率由 \(10^{-3}\) 余弦衰减至 \(10^{-4}\)。DDIM inversion 和去噪阶段不用 CFG 或负向提示;计算测地线时却使用负向提示形成的更新作为分数函数,并采用 GeoDiff 的提示嵌入调整。因此“无需训练”指无需重新训练扩散骨干,不代表没有输入路径或提示嵌入优化。

引导实验用有限差分步长 \(h=10^{-4}\)、权重 \(\lambda=0.1\),在 50 个采样步中做局部修正。蒸馏遵循 LCM 协议与 diffusers 默认设置,采用 AdamW,学生推理使用 4 步;缓存未包含附录 D.3,不能据此补写训练步数、批量大小或其他未给出的细节。

实验关键数据

主实验

图像插值评估 MorphBench animation/metamorphosis(MB(A)/MB(M))、CelebA-HQ(CA)及 Animal Faces-HQ(AF)。CA 和 AF 各筛选 50 对 LPIPS 小于 0.6 的端点。PPL 是相邻图像 LPIPS 之和,PDV 是相邻 LPIPS 的标准差,RE 是端点重建均方误差,FID 比较参考与插值图像特征分布,均越低越好。CA/AF 的 FID 使用 900 张插值图和 200 张参考图,属于小样本协议,不宜与常规大样本生成 FID 直接横比。

下表摘取原文表 2 中的三个代表方法;RE 按原表以 \(10^{-3}\) 为单位,非原始未缩放值。

数据集 方法 PPL PDV FID RE(\(10^{-3}\)
MB(A) SLERP 0.644 0.030 62.81 0.401
MB(A) GeoDiff 0.402 0.024 28.70 0.188
MB(A) 本文 0.380 0.021 27.44 0.177
MB(M) SLERP 1.065 0.055 48.99 0.397
MB(M) GeoDiff 1.021 0.073 38.12 0.272
MB(M) 本文 0.977 0.073 36.00 0.201
CA SLERP 0.707 0.033 37.84 1.010
CA GeoDiff 0.669 0.044 35.98 0.891
CA 本文 0.633 0.036 32.54 0.888
AF SLERP 0.871 0.022 26.07 2.049
AF GeoDiff 0.842 0.027 25.80 1.969
AF 本文 0.767 0.023 21.01 1.962

为补足“指标改善未必等于流形更忠实”的缺口,视频实验取三帧中的首尾帧作输入,用真实中间帧评估。DAVIS、Human、RE10K 分别有 21、56、26 个片段,分辨率统一为 \(512\times512\)。下表摘取原文表 3;这是对几何合理性的验证,不是对专用视频插帧系统的领先声明。

数据集 GeoDiff MSE(\(10^{-3}\) 本文 MSE(\(10^{-3}\) GeoDiff LPIPS 本文 LPIPS
DAVIS 13.253 8.777 0.334 0.318
Human 3.363 2.018 0.184 0.170
RE10K 5.941 2.771 0.229 0.178

消融实验

证据边界:缓存只有正文和参考文献,没有附录 E 的模块消融。 因此下表如实呈现表 4 的引导强度敏感性与方法对照,不冒充移除模块的消融,也不能由此确定哪个近似贡献最大。生成实验使用 MS-COCO 2014 validation 提示生成 30,000 张图像,FID 越低越好,CLIP Score 越高越好。

CFG 强度 \(w\) CFG FID CFG++ FID 本文 FID 三种方法的 CLIP Score
5.0 11.69 11.87 11.53 0.313
7.5 14.29 13.98 13.81 0.314
12.5 17.28 17.76 16.04 0.315

\(w=12.5\) 时,相对 CFG 的 FID 绝对降低 1.24;CLIP Score 在报告的三位小数精度下相同,不等于证明语义完全无损。表 5 的 4 步蒸馏结果为 FID 17.91 对 16.98,CLIP Score 均为 0.306;这是 5 次运行的均值,作者报告每次都改善,单侧精确二项检验 \(p<0.05\)

关键发现

  • 在图像表中,本文所有数据集的 PPL、FID、RE 都最好,但 PDV 只在 MB(A) 最好;其他数据集 SLERP 更低。路径更短、更清晰与逐步感知变化更均匀不是同一目标。
  • 合成 C 形数据用 50 对端点评估路径密度标准差:LERP 0.1606、SLERP 0.0833、密度方法 0.1073、本文 0.0701。它支持该分布上的概率水平保持解释,但不足以证明高维真实图像也严格等密度。
  • 引导强度越大时修正相对 CFG 的收益更明显,但这不是对 \(\lambda\)、有限差分步长或 CG 迭代次数的消融;这些敏感性在当前缓存中没有可核验数字。

亮点与洞察

  • 把“往哪里走”和“哪里概率大”分开。度量使用分数的导数来识别方向结构,避免把高密度直接当作感知质量的代理目标。
  • 同一几何定义同时支持全局路径和局部更新。前者通过分数差优化,后者通过线性系统抑制高代价运动,不需要另学一个语义潜空间。
  • 计算昂贵的几何修正可以放到教师端。蒸馏把修正后的采样行为传给学生,为减少部署开销提供了实验支持,但教师训练与采样成本仍然存在。

局限与展望

  • 几何假设有适用范围。 雅可比满秩、谱间隙和近似对称性均不能对任意预训练网络直接保证;向 flow matching、更新架构迁移仍是作者列出的未来方向。
  • 计算并不便宜。 插值需 500 次路径优化,直接 CFG 修正约增加到 3 倍网络调用成本。蒸馏消除了学生的额外推理成本,却不能据此宣称整个方法零开销。
  • 精确系统与实现近似有距离。 单次 CG、有限差分和以近似对称性替代转置运算叠加,可能影响修正精度;可进一步比较精确自动微分乘积、多次 CG 与现有实现,但当前缓存没有这些消融数字。
  • 评测仍以较早骨干及受限图像对为主。 CA/AF 筛选语义接近的端点,视频实验只取连续三帧,不能直接证明跨语义大形变或长视频时序稳定性;小样本 FID 也增加解释的不确定性。
  • 证据完整性有限。 正文声称附录提供 SD v2.0-base、谱间隙与消融结果,但附录不在本地缓存中;本笔记不补写其数值,也不提供缓存未确认的代码或 arXiv 地址。

相关工作与启发

  • 对比 GeoDiff:GeoDiff 通过密度定义噪声空间路径,本文通过雅可比拉回度量定义方向代价。两者都需要路径优化,本文的主要差异是避免将高密度吸引作为几何代理。
  • 对比 FIM-inspired metric\(I+\lambda s_\theta s_\theta^\top\) 的各向异性部分只有一个方向,本文使用完整局部谱结构。正文 FIM 基线由作者重实现,比较结果应连同其实现与超参数条件理解。
  • 对比 CFG++ 与 TCFG:这些方法也试图减少流形偏离;本文的区别在于先给出显式度量,再推导软修正。当前正文定量表比较了 CFG++,没有 TCFG 的同协议数据,不能据此声称全面优于 TCFG。
  • 后续启发:可将度量用于编辑或噪声空间聚类,但需要先验证相应骨干上的谱结构,再评估下游收益。论文展示的是插值和引导两个应用,不是这些扩展任务已经完成。

评分

  • 新颖性: 4/5。将已有切向/法向谱观察转化为可操作的拉回度量,并统一两个应用,贡献明确但不是首次发现流形谱结构。
  • 实验充分度: 3/5。覆盖合成数据、图像、真实视频帧、生成与蒸馏,但本地缺少消融附录,骨干和评测规模也有限。
  • 写作质量: 4/5。理论到算法的链条清楚,需谨慎区分近似解、几何解释与严格保证;缓存中的公式排版缺损不作为论文写作缺点计分。
  • 价值: 4/5。提供可复用的流形感知操作思路,直接部署需权衡额外网络调用和路径优化成本。