跳转至

DRIFT: Difficulty-aware Rectified Flows for Through-plane MRI Super-Resolution

会议: ECCV 2026
论文: ECCV 2026 Poster 3862
代码: https://yoonseokchoi-ai.github.io/drift-eccv2026/
领域: 医学图像
关键词: 磁共振成像、层间超分辨率、Rectified Flow、物理感知自适应调度、流形投影

一句话总结

针对各向异性 MRI 导致的层间阶梯状伪影与连续层厚退化,DRIFT 提出了由解剖投影网络与残差 Rectified Flow 构成的两阶段框架,结合物理感知难度(PAD)自适应 ODE 调度器与邻近层厚轨迹对齐损失(CETA),在极低评估开销下实现了高保真各向同性体数据重建。

研究背景与动机

高分辨率各向同性磁共振成像(MRI)在精确的临床诊断与定量神经解剖分析中不可或缺。然而,受限于信噪比(SNR)、扫描时间和比吸收率等物理生理约束,临床日常采集通常采用各向异性扫描策略——在层内保持高分辨率,但层厚较大。这种大层厚采集在重切片和三维多平面重建视图中会沿切片选择方向产生严重的阶梯状锯齿伪影(stair-step artifacts),极大地干扰了细微病灶的边界判读。

解决这一难题的传统前向回归模型通常针对特定离散尺度进行优化,在面对临床实际中连续变化的采集层厚时泛化受限,且在超分辨大层厚图像时因过度惩罚高频误差而趋向保守平滑。隐式神经表示(INR)模型虽然支持任意尺度查询,但在三维医学体数据上受限于多层感知机固有的谱偏差(spectral bias),严重欠缺对诊断至关重要的微细纹理,且多数模型基于各向同性下采样假设,违背了 MRI 射频脉冲积分的真实物理退化规律。基于扩散的生成模型虽能重构锐利边缘,但多步随机采样耗时过长,且依赖图像域感知的动态加速模块计算开销大、脱离采集物理。

本文的切入角度是:MRI 层间退化的严重程度由层厚导致的物理带宽截断直接决定,因此无需用额外的黑盒网络去估计图像难度,完全可以由采集元数据引导直线的残差流模型。核心 idea:将层间超分辨建模为两阶段「解剖流形投影-直角残差流运输」过程,利用解剖投影网络确定性地缩短运输距离,并由层厚元数据计算物理感知难度(PAD)自适应分配 ODE 步数,辅以邻近层厚一致轨迹对齐(CETA)约束连续性。

方法详解

整体框架

DRIFT 的整体重建流程包含两个阶段:输入任意切片厚度 \(T_i\) 的低分辨率(LR)切片 \(\mathbf{x}_{p,i}\),目标是重建厚度为 \(T_{\mathrm{hr}}\) 的各向同性高分辨率(HR)图像。模型以 2D 切片为基本操作单元,沿退化轴正交方向逐切片处理后再拼接回 3D 体数据。

在 Stage 1 中,解剖投影网络(APN)以输入切片和层厚逆参数为条件,确定性地将退化切片映射到目标厚度的粗粒度 HR 解剖流形 \(\mathbf{z}_{p,i}\) 上,消除阶梯状伪影并缩短后续运输距离;在 Stage 2 中,冻结 APN,通过 Rectified Flow 速度网络学习从粗粒度解剖估计到真实 HR 纹理的直线速度场。在推理时,系统直接从 DICOM 元数据读取层厚计算物理感知难度(PAD),自适应确定最佳积分步数。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["各向异性输入切片 x 与层厚倒数 τ"] --> B["解剖流形投影<br/>APN 确定性映射至粗 HR 状态 z"]
    B --> C["物理感知难度评估<br/>由元数据计算带宽损失 PAD"]
    C --> D["自适应积分调度器 AIS<br/>动态确定 ODE 步数 N"]
    D --> E["Rectified Flow 残差细化<br/>基于直线速度场补全高频纹理"]
    E --> F["输出高保真各向同性切片并拼装为 3D 体"]

关键设计

1. 解剖流形投影:消除随机方差并大幅缩短流运输距离 生成模型通常从高斯白噪声出发执行长距离采样,但切片级独立采样会在相邻切片间引入随机波动,导致重组后的三维体在切片正交截面上出现条纹不一致。DRIFT 设计了解剖投影网络(APN)\(f_\phi\),利用基于 Shinnar-Le Roux(SLR)射频脉冲积分合成的退化切片进行监督训练。APN 输入退化切片 \(\mathbf{x}_{p,i}\) 与通过 MLP 融合的层厚条件向量 \(\mathbf{c}_i\),直接输出粗粒度高分辨率解剖估计 \(\mathbf{z}_{p,i} = f_\phi(\mathbf{x}_{p,i}, \mathbf{c}_i)\)。该确定性前向映射将样本锚定在真实 HR 流形邻域,既消除了切片间的独立随机扰动,又将第二阶段的生成任务转变为微小高频残差的定向运输,从根本上降低了后续 ODE 求解所需的迭代步数。

2. 物理感知自适应调度:零网络开销的元数据驱动步数分配 现有扩散加速算法通常引入辅助判别网络来估计图像局部复杂度,但这在三维体数据推理中带来了不可忽视的显存与计算负担。DRIFT 提出物理感知难度(Physics-Aware Difficulty, PAD)指标。由于 MRI 层厚选择方向上的高频衰减是由射频激发层剖面滤波造成的频带截断引起的,层厚越大,丢失的有效频带比例就越严格地遵循物理关系。PAD 直接定义为归一化带宽缺失率: $\(\mathrm{PAD}(T_i, T_{\mathrm{hr}}) = 1 - \frac{T_{\mathrm{hr}}}{T_i}\)$ 自适应积分调度器(AIS)将该物理标量映射至 ODE 步长预算:\(N = \mathrm{clamp}\left(\lfloor N_{\max} \cdot \mathrm{PAD}(T_i, T_{\mathrm{hr}}) \rceil, N_{\min}, N_{\max}\right)\),其中 \(N_{\min}=0, N_{\max}=15\)。对于薄层轻度退化切片,系统仅需 4–8 步甚至直接依靠 APN 输出;对于厚层重度退化切片,系统自动分配更多步数细化微细解剖结构,全程无需任何前向感知网络,开销几乎为零。

3. CETA 损失与 U 型时间步采样:近邻连续性正则化与端点聚焦 为了保证模型在连续层厚变化下的输出一致性,DRIFT 提出了近邻层厚端点轨迹对齐损失(Consistent Endpoint Trajectory Alignment, CETA)。在训练 Stage 2 时,针对同一高分辨率目标采集成对的邻近厚度条件 \(T_j = T_i - \Delta T\)(固定 \(\Delta T = 1.0\text{ mm}\)),构建端点代理 \(\tilde{\mathbf{y}}_{p,k}(t) = \mathbf{z}_{p,k} + \mathbf{v}_{p,k}(t)\),并通过最小化代理间距离来施加局部几何平滑: $\(\mathcal{L}_{\mathrm{CETA}} = \left\|\tilde{\mathbf{y}}_{p,i}(t) - \tilde{\mathbf{y}}_{p,j}(t)\right\|_2^2\)$ 这一设计形成了横跨连续层厚空间的链式局部约束,避免了随机配对导致的优化震荡。同时,针对残差运输两端最敏感的特性,Stage 2 引入了 \(U\) 型时间步重加权采样分布 \(p_\alpha(t)\)\(\alpha=2.0\)),在直角流的起始端(\(t \approx 0\))与终止端(\(t \approx 1\))集中训练权重,配合输出层零初始化,实现了残差流平滑、确定且稳定的高频增强。

损失函数 / 训练策略

训练采用两阶段解耦策略: - Stage 1 (APN):损失函数采用 Charbonnier 惩罚项结合结构相似度 SSIM: $\(\mathcal{L}_{\mathrm{recon}} = \mathcal{L}_{\mathrm{Char}}(\mathbf{z}_{p,i}, \mathbf{y}_p) + \lambda_{\mathrm{ssim}}\mathcal{L}_{\mathrm{SSIM}}(\mathbf{z}_{p,i}, \mathbf{y}_p)\)$ 其中权重超参数 \(\lambda_{\mathrm{ssim}} = 0.5\)。 - Stage 2 (Rectified Flow):冻结 APN,速度网络 \(v_\theta\) 在时间步分布 \(t \sim p_\alpha(t)\) 下拟合直线速度向量 \(\mathbf{u}_{p,i} = \mathbf{y}_p - \mathbf{z}_{p,i}\),结合 Huber 损失(阈值 \(\delta=0.1\))与 CETA 损失联合优化: $\(\mathcal{L}_{\mathrm{Stage2}} = \mathbb{E}_{t \sim p_\alpha(t)}\left[\mathrm{Huber}_\delta(\mathbf{v}_{p,i}(t), \mathbf{u}_{p,i})\right] + \lambda_{\mathrm{ceta}}\mathcal{L}_{\mathrm{CETA}}\)$ 其中 \(\lambda_{\mathrm{ceta}} = 1.0\)

实验关键数据

主实验

在三个包含各向同性金标准的权威公开脑部 MRI 数据集(HCP、MIND、IDEAS)上评估,DRIFT 无论在训练范围内的固定尺度下,还是在外推至 \(6.5\text{ mm}\) 的任意连续尺度下,均显著优于现有固定尺度回归、隐式神经表示及多步扩散基线。

原论文 Table 1 实验结果对比如下(PSNR [dB] / SSIM):

数据集 尺度 / 输入层厚 SwinIR [16] AFCM [25] ResShift [36] TPDM [14] DRIFT (Ours)
HCP \(\times 6\) (\(4.2\text{ mm}\)) 34.10 / 0.901 27.11 / 0.642 32.89 / 0.888 29.31 / 0.798 37.64 / 0.952
HCP \(\times 8\) (\(5.6\text{ mm}\)) 33.13 / 0.882 26.08 / 0.501 30.34 / 0.853 28.24 / 0.755 35.93 / 0.936
MIND \(\times 5\) (\(4.5\text{ mm}\)) 30.15 / 0.874 27.74 / 0.728 29.48 / 0.839 22.50 / 0.452 32.74 / 0.904
MIND \(\times 6\) (\(5.4\text{ mm}\)) 29.01 / 0.838 26.02 / 0.713 29.00 / 0.833 22.11 / 0.413 30.02 / 0.886
IDEAS \(\times 5\) (\(5.0\text{ mm}\)) 31.64 / 0.924 23.89 / 0.825 31.93 / 0.910 26.64 / 0.744 32.75 / 0.946
IDEAS \(\times 6\) (\(6.0\text{ mm}\)) 31.62 / 0.914 22.55 / 0.796 30.40 / 0.899 26.11 / 0.720 32.01 / 0.938

在任意连续尺度评估中(例如输入层厚 \(6.0\text{ mm}\)\(6.5\text{ mm}\)),DRIFT 的 PSNR 较代表性任意尺度 INR 基线(LIIF、LTE、SA-INR、ArSSR)普遍高出 \(3.29\sim 6.29\text{ dB}\),展现出对非整数倍大倍率物理退化的适应性。

消融实验

原论文 Table 2 与 Table 3 针对 Stage 2 的各核心设计组件和 CETA 邻近层厚间距 \(\Delta T\) 进行了消融分析(在 HCP 上对 \(T_i \in \{1.5, 3.0, 5.0\}\text{ mm}, T_{\mathrm{hr}} = 0.7\text{ mm}\) 的平均表现):

组件消融(原论文 Table 2)

层厚条件 U型采样 CETA损失 (\(\lambda_{\mathrm{CETA}}=1\)) PSNR (dB) ↑ SSIM ↑ LPIPS ↓
36.92 0.9416 0.0308
N/A 34.82 0.8986 0.0491
38.12 0.9458 0.0342
40.85 0.9634 0.0229

CETA 邻近间距 \(\Delta T\) 消融(原论文 Table 3)

配对设置 / 间距 \(\Delta T\) 覆盖率 (Coverage) PSNR (dB) ↑ SSIM ↑ LPIPS ↓ 说明
Random(随机配对) 65% 38.23 0.9460 0.0290 缺乏近邻拓扑约束
\(0.5\text{ mm}\) 91% 37.24 0.9430 0.0301 间距过小趋同于恒等约束
\(1.0\text{ mm}\) (本文设定) 81% 40.85 0.9634 0.0229 最佳约束强度与覆盖平衡
\(2.0\text{ mm}\) 62% 39.10 0.9540 0.0265 跨度稍大,优化受阻
\(4.0\text{ mm}\) 25% 37.58 0.9445 0.0338 跨度过大且覆盖率剧降

关键发现

  • 层厚条件是核心支柱:在 Stage 2 中去除层厚条件导致 PSNR 从 40.85 dB 暴跌至 34.82 dB,证明显式感知退化强度是处理多层厚混合输入的前提。
  • CETA 的近邻链式约束优于随机配对:固定 \(\Delta T = 1.0\text{ mm}\) 的近邻约束比无序随机采样提升了 2.62 dB PSNR,同时 LPIPS 降至 0.0229;间距过小(0.5 mm)监督信号过弱,间距过大(4.0 mm)则破坏局部流形连贯性。
  • 推理效率与感知保真度极致平衡:在 HCP \(\times 8\) 上,DRIFT 单体体积推理仅需约 20 秒,LPIPS 达到 0.043;相比三维神经表示 ArSSR(0.112,约 280 秒)速度快 14 倍且保真度大幅提升,相比双向扩散模型 TPDM(约 9000 秒)提速达 450 倍。

亮点与洞察

  • 物理退化先验替代黑盒网络:巧妙利用 MRI 层面物理选择的频带截断比率构建 PAD 指标,使得 ODE 积分步数调度直接依赖采集元数据,完全避免了额外感知网络带来的显存与延迟损耗。
  • 流形投影为流模型提供确定性捷径:让确定性 APN 先吃掉低频恢复与去阶梯伪影这一主要位移,使 Rectified Flow 仅专注于高频残差的微步直线传输,极大克服了传统扩散模型在医学切片间引入随机斑点伪影的问题。
  • 近邻对齐解决连续退化空间不一致:CETA 损失通过约束步长为 1 mm 的相邻层厚输出端点,以局部链式传递方式保证了超分网络在任意连续层厚输入下的输出几何稳定性。

局限与展望

  • 目标分辨率的离散性限制:目前主实验设定固定目标分辨率为数据集的原生各向同性分辨率,若需要任意目标连续分辨率的超分输出,仍需在训练阶段对目标层厚进行密集采样与泛化增强。
  • 跨扫描协议与非脑部解剖结构的泛化挑战:当前验证主要集中于脑部 MRI(T1w、T2w、FLAIR),对于具有强烈呼吸运动伪影腹部或心脏 MRI,层间错位更加复杂,需要结合运动补偿机制进一步拓展。

相关工作与启发

  • vs TPDM [14]: TPDM 依靠正交 2D 扩散模型的反问题迭代求解来实现 3D 超分辨率,单例需要 2000 步采样(耗时上千秒)且易出现人工伪影;DRIFT 通过确定性 APN 投影与 Rectified Flow 将步数压制至 8–13 步,速度提升数百倍且解剖保真度更高。
  • vs ResShift [36]: ResShift 虽采用残差转移策略减少步数,但其使用固定的 15 步调度,对不同层厚一视同仁;DRIFT 引入物理感知难度(PAD)自适应分配计算量,薄层快速推理,厚层深度细化。
  • vs ArSSR / SA-INR [32, 34]: INR 方法受坐标 MLP 的高频谱偏差限制,在多平面重切片中常出现模糊;DRIFT 基于流模型的生成先验重构出锐利的灰白质解剖边界。

评分

  • 新颖性: ⭐⭐⭐⭐ [结合 MRI 物理退化先验、残差流模型与无额外开销元数据自适应调度的系统性设计]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖三大公开金标准数据集、真实前瞻厚层临床序列、多角度消融与下行全三维重切片保真度评估]
  • 写作质量: ⭐⭐⭐⭐⭐ [问题定义明确,数学公式与物理机制推导严谨自洽,论据翔实]
  • 价值: ⭐⭐⭐⭐⭐ [有效解决临床常规快速厚层 MRI 在多平面重构和体积形态测量中的质量瓶颈,具极高转化价值]