跳转至

Resolution-Agnostic Neural Operators for Multi-Rate Sparse-View CT

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/neuraloperator/sparse_ct
领域: 物理计算 / 医学图像
关键词: 稀疏视角CT, 神经算子, DISCO卷积, 分辨率无关, 旋转等变性

一句话总结

本文提出了首个面向稀疏视角 CT 重建的神经算子框架 CTO,利用函数空间中的离散-连续(DISCO)卷积以及正弦图频空双分支滤波,实现了单模型跨多采样率与网格分辨率的零样本高保真重建。

研究背景与动机

计算机断层扫描(CT)通过探测器在多个角度采集 X 射线投影并经由反 Radon 变换重建人体内部切片。在临床诊断中,为了尽量减少患者受到的电离辐射剂量并缩短扫描扫描时间,稀疏视角 CT(Sparse-View CT, SVCT)成为核心技术途径。然而,大幅削减投影角度会使 CT 图像重建退化为一个极其病态的反问题(ill-posed inverse problem)。传统的滤波反投影(FBP)算法在视角高度稀疏时会产生严重的条状伪影,而经典基于总变差(TV)的压缩感知优化算法虽然能够压制伪影,但计算极其耗时且在高欠采样下容易导致组织纹理过度平滑。

近年来,以深度卷积神经网络(CNN)与级联展开网络(Unrolled Networks,如 Learned Primal-Dual、LEARN、RegFormer)为代表的深度学习方法显著提升了图像恢复质量。但现有基于深度学习的重建模型普遍受限于固定的离散网格与采样率。以 CNN 为例,其离散卷积核尺寸固定,当输入的视角采样率改变或探测器分辨率提升时,卷积核所覆盖的物理感受野发生剧烈变化,导致模型在未见过的采样率下性能急剧恶化。临床实际中,针对不同器官、诊断协议与硬件设备,扫描的视角数与图像分辨率往往动态调整;现有工作为了应对多采样率,通常不得不为每个固定视角数分别训练一套专用网络,不仅维护成本高昂,更丧失了跨分辨率与采样率的泛化能力。扩散模型虽具一定跨分辨率灵活性,但其数百步迭代的推理延迟(单张需数十秒)严重阻碍了临床落地。

为突破离散网络对网格采样的绑定,本文将 CT 重建重新表述为无限维连续函数空间之间的算子映射问题。既然投影测量与待求图像在物理本质上均是连续空间函数,网络应当直接学习函数空间之间的映射。核心 idea:将神经算子引入稀疏视角 CT,通过函数空间参数化的离散-连续卷积(DISCO)构建正弦图域与图像域双重神经算子,配合频空双分支先验与极坐标旋转等变性,实现单个统一模型对任意视角采样率与图像分辨率的零样本泛化。

方法详解

整体框架

CTO(Computed Tomography neural Operator)采用深度级联展开网络(Unrolled Network)骨架,在函数空间内交替执行正弦图域补全、物理投影一致性约束以及图像域特征精细化重建。

输入为任意欠采样视角下的稀疏正弦图测量 \(\tilde{p}(\omega, r) = \mathcal{M}p(\omega, r)\),其中 \(\omega\) 为投影角度,\(r\) 为探测器通道坐标,\(\mathcal{M}\) 为视角欠采样算子。正弦图首先送入正弦图域神经算子(\(\text{NO}_s\)),该算子由空域与频域两个平行的 U 型离散-连续卷积块(UDNO)构成,分别提取局部几何与全局频域滤波先验。经过 \(\text{NO}_s\) 恢复后的正弦图通过反 Radon 变换 \(\mathcal{R}^{-1}\) 映射至图像空间,生成初始图像估计。随后,特征进入包含 3 个级联步骤的展开网络中,每个级联单元交替执行基于物理正投影算子的数据一致性更新与图像域神经算子(\(\text{NO}_i\))的纹理增强降噪,最终输出高分辨率连续 CT 图像。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["输入:多采样率稀疏视角正弦图<br/>p(ω, r) ∈ S¹ × ℝ"] --> DISCO["连续函数空间 DISCO 算子<br/>连续基函数参数化核,自适应采样离散化"]
    DISCO --> SinogramNO["旋转等变频空双分支正弦图算子<br/>空域 UDNO + 径向 1D-FFT 频域 UDNO"]
    SinogramNO --> Radon["反 Radon 投影<br/>正弦图域转换至图像域"]
    Radon --> UnrolledDC["双域级联展开与物理数据一致性<br/>图像域 NO_i 降噪细化 + 物理一致性梯度更新"]
    UnrolledDC --> Output["输出:分辨率无关高保真 CT 图像<br/>支持多视角采样与零样本超分辨率重建"]

关键设计

1. 连续函数空间 DISCO 算子:解耦网格分辨率的局部连续卷积

传统 CNN 卷积核定义在离散整数网格上,当网格细化或重采样时,固定的离散支持会导致局部积分算子退化为逐点线性映射,失去相对感受野的一致性。为了让网络真正具备分辨率无关性,CTO 采用离散-连续卷积(DISCO)作为基础构建模块。DISCO 将卷积核 \(\phi\) 参数化为定义在紧致连续域上的连续函数,并展开为有限个连续基函数的线性组合 \(\phi(v) = \sum_{l=1}^L w_l \phi_l(v)\)。在离散网格上运算时,根据当前输入网格的分辨率自适应积分采样: $\((\phi * g)(v_i) \approx \sum_{j=1}^m \phi(u_j - v_i) g(u_j) q_j\)$ 其中 \(q_j\) 为对应网格顶点的正交权重。CTO 采用分段线性基函数构建 1 个各向同性基底与 5 个各向异性同心环基底(每个环包含 7 个基函数),设置固定截断半径。当图像或正弦图分辨率成倍缩放时,DISCO 能够严格保持固定的物理感受野,具有离散化收敛性(discretization-convergent),保证算子逼近误差随分辨率提高单调收敛于零。

2. 旋转等变频空双分支正弦图算子:物理先验与傅里叶切片指导的测量补全

正弦图数据具有独特的物理与几何对称性:物体旋转角度 \(\theta\) 等价于正弦图沿角度轴 \(\omega\) 的平移;且根据平行束投影对称性,投影满足 \(p(\omega + \pi, r) = p(\omega, -r)\)。为了充分利用这一物理约束,\(\text{NO}_s\) 采用改进的翻转循环填充(circular padding with detector flip):在 \(\omega\) 边界填充时,先将探测器 \(r\) 轴进行镜像翻转,再拼接到角度轴两侧,严格杜绝了边界不连续引起的放射状伪影,赋予模型旋转等变性。此外,受滤波反投影(FBP)算法中斜坡滤波(ramp filter)与傅里叶切片定理(Fourier Slice Theorem)的启发,\(\text{NO}_s\) 设计为空域与频域双分支结构: $\(\hat{p} = \frac{1}{2} \left( \text{NO}_{s,\text{spatial}}(\tilde{p}) + \mathcal{F}_r^{-1}\left( \text{NO}_{s,\text{freq}}\left( \mathcal{F}_r(\tilde{p}) \right) \right) \right)\)$ 其中 \(\mathcal{F}_r\) 代表沿探测器 \(r\) 轴进行的一维傅里叶变换。由于傅里叶切片定理表明正弦图沿 \(r\) 轴的 1D 频谱直接对应待重建图像的 2D 极坐标切片,频域分支 \(\text{NO}_{s,\text{freq}}\) 能够在对偶空间以数据驱动的方式自适应学习频段权重(取代脆弱的人工滤波),强力抑制低频模糊,同时空域分支补充几何结构,实现高质量正弦图补全。

3. 双域级联展开与物理数据一致性:图像域神经算子与物理投影联合迭代

单纯在正弦图域或图像域单向处理往往会丢失物理一致性约束。CTO 将基于迭代优化的近端梯度下降算法展开为端到端网络,包含 3 个级联更新单元。在第 \(t\) 个级联阶段,当前图像状态 \(x_t\) 首先送入图像域神经算子 \(\text{NO}_i^t\)\(\text{NO}_i\) 同样采用 U 型 DISCO 结构(UDNO),直接在二维连续笛卡尔坐标系下进行多尺度高频细节恢复与伪影消除。随后,网络施加严格的物理前向投影一致性修正: $\(x_{t+1} = x_t - \varrho_t \mathcal{A}^* (\mathcal{A}(x_t) - \tilde{p}) + \vartheta_t \text{NO}_i^t(x_t)\)$ 其中 \(\mathcal{A} = \mathcal{M}\mathcal{R}\) 为结合欠采样掩码的 Radon 前向投影算子,\(\mathcal{A}^*\) 为其伴随算子(反投影),\(\varrho_t\)\(\vartheta_t\) 均为可学习的步长权重标量。通过将物理退化模型的伴随更新与连续函数空间先验紧密耦合,既保证了重建图像在已知采样视角上与实际测量完全吻合,又赋予了级联模块对连续图像分辨率的无缝支持。

损失函数 / 训练策略

CTO 采用端到端均方误差(MSE)损失函数进行优化,通过 Adam 优化器在初始学习率 \(10^{-3}\) 下进行训练。为了实现多采样率通用泛化,训练阶段采用多采样率协同训练策略(Multi-Rate Co-Training):在每个训练 batch 中,从预设视角集合(如 \(N_v \in \{9, 18, 36, 72\}\))中随机均匀抽取采样率生成稀疏正弦图输入,使得模型在同一组权重下均匀接触各种极度欠采样与轻度欠采样分布,有效避免了单采样率过拟合。

实验关键数据

主实验

在 AAPM 低剂量腹部 CT 数据集(5,936 张切片,526 张独立测试集)上,所有可学习方法均采用统一的多采样率协同训练(统一训练 9、18、36、72 视角)。测试时分别在 18-view、36-view 与 72-view 下评估 RMSE(HU 单位,越低越好)、PSNR(dB,越高越好)与 SSIM(越低越差,\(\times 10^{-2}\))。

数据集 方法类别 方法 18-view PSNR (dB) 18-view RMSE (HU) 36-view PSNR (dB) 36-view RMSE (HU) 72-view PSNR (dB) 72-view RMSE (HU)
AAPM Abdomen 无监督/传统 FBP 13.14 ± 1.63 632.58 ± 42.17 13.36 ± 1.63 616.66 ± 41.07 13.82 ± 1.63 584.72 ± 38.87
AAPM Abdomen 代数重建 SART 24.97 ± 1.46 161.91 ± 5.93 25.91 ± 1.41 145.15 ± 2.59 26.66 ± 1.40 133.24 ± 1.81
AAPM Abdomen 扩散模型 DPS 25.68 ± 1.77 149.97 ± 17.34 28.33 ± 1.46 110.19 ± 8.78 31.64 ± 1.43 85.17 ± 4.71
AAPM Abdomen 扩散模型 ALD 25.78 ± 1.71 148.13 ± 14.63 29.13 ± 1.51 100.50 ± 7.33 30.56 ± 1.41 75.19 ± 5.35
AAPM Abdomen 级联网络 LEARN 25.51 ± 1.94 153.39 ± 22.22 27.53 ± 1.81 121.31 ± 16.15 29.90 ± 1.59 92.49 ± 12.91
AAPM Abdomen 级联网络 RegFormer 25.67 ± 1.91 150.57 ± 21.34 28.00 ± 1.82 114.93 ± 15.18 30.43 ± 1.70 86.83 ± 10.46
AAPM Abdomen 级联网络 Unrolled CNN 29.14 ± 1.84 100.65 ± 11.36 31.76 ± 1.80 74.44 ± 8.32 33.35 ± 1.81 62.38 ± 11.16
AAPM Abdomen 神经算子 CTO (本文) 31.57 ± 1.73 75.97 ± 7.32 35.06 ± 1.64 50.79 ± 4.27 37.88 ± 1.56 36.64 ± 2.44

在 18 视角极度稀疏设置下,CTO 相比 Unrolled CNN 提升达 2.43 dB PSNR,RMSE 降低 24.68 HU;在 72 视角下,CTO 相比 Unrolled CNN 提升达 4.53 dB,相比扩散模型 DPS 提升超过 6.2 dB。

消融实验

下表系统评估了不同训练机制下的跨采样率泛化能力(Table 2a),以及核心模块去除后的性能退化(Sec 5.4):

配置 / 模型 18-view PSNR (dB) 36-view PSNR (dB) 72-view PSNR (dB) 说明
LEARN (仅72-view训练) 4.16 22.40 32.32 严重过拟合单一采样率,在 18 视角崩溃
RegFormer (仅72-view训练) 5.04 24.63 35.11 单采样率模型无法跨视角泛化
LEARN (多采样率协同训练) 25.51 27.53 29.90 协同训练有效缓解欠拟合崩塌
RegFormer (多采样率协同训练) 25.67 28.00 30.43 多采样率提升整体跨度鲁棒性
CTO (完整模型,多采样率) 31.57 35.06 37.88 神经算子在所有视角全面大幅领跑
CTO w/o 图像域算子 \(\text{NO}_i\) - - - 全视角平均 PSNR 骤降 3.86 dB
CTO w/o 正弦图算子 \(\text{NO}_s\) - - - 全视角平均 PSNR 骤降 4.82 dB
CTO w/o 正弦图频域分支 \(\text{NO}_{s,\text{freq}}\) - - - 正弦图域去除频域分支平均下降 2.70 dB
CTO w/o 正弦图空域分支 \(\text{NO}_{s,\text{spatial}}\) - - - 正弦图域去除空域分支平均下降 3.10 dB
CTO w/o 旋转循环填充 (24-view) 32.17 (24-view) - - 去除旋转等变性边界填充下降 0.83 dB

在推理效率方面,在 NVIDIA A100 上评估:CTO 单切片推理耗时仅 0.065s,且无需任何采样率特定微调;相比之下,扩散模型 DPS 耗时 51.58s,ALD 耗时 32.72s。CTO 推理速度比扩散模型快 500 倍以上

关键发现

  • 双域神经算子互补且不可或缺:正弦图域算子 \(\text{NO}_s\) 贡献最大,去除导致 4.82 dB 崩塌,证明了在投影域直接修复缺失射线的必要性;图像域算子 \(\text{NO}_i\) 去除导致 3.86 dB 损失,说明两域协同对多尺度去噪至关重要。
  • 频域算子大幅抑制模糊伪影:在正弦图域内引入 1D 傅里叶变换的频域 UDNO,为网络赋予了类似解析 FBP 的可学习频域滤波能力,带来 2.7 dB 的净增益。
  • 卓越的零样本超分辨率泛化能力:在固定 18 视角、仅在 \(256 \times 256\) 分辨率训练的模型上,推理直接测试 \(512 \times 512\) 分辨率,CTO 相比 CNN 基线保持了 3.0 dB PSNR 优势;在正弦图探测器数目与视角数双翻倍设置下(144 视角 × 1344 探测器),CTO 零样本测试依然高出 Unrolled CNN 达 3.7 dB,展现了函数空间连续核的物理保真度。

亮点与洞察

  • 物理与函数空间的有机结合:不仅将输入与输出视为连续函数,更严格契合了 CT 平行束投影的几何周期性(\(\pi\) 周期带探测器翻转),通过改进循环填充天然实现了旋转等变性,使算法对患者摆位与旋转变换具有本征鲁棒性。
  • 突破深度学习“固定分辨率”枷锁:彻底摆脱了医学影像领域针对每种扫描协议单独训练一套权重的臃肿开发范式,首次证明单个连续算子权重可以在极度稀疏(9-view)到稠密、低分辨率到超分辨率之间自由切换。
  • 对偶空间局部-全局转换机制:利用 Radon 变换与傅里叶切片定理的对偶特性,正弦图上的局部连续滤波对应图像域的全局方向信息,以轻量级局部卷积实现了兼具全局感受野与计算效率的算子架构。

局限与展望

  • 目前局限于平行束 2D 几何:论文当前主要验证了二维平行束断层成像,而现代临床多层螺旋 CT 多采用扇形束(Fan-beam)或锥形束(Cone-beam 3D)几何,其正弦图曲面与投影轨迹更为复杂,需要扩展连续流形上的神经算子形式。
  • 极端各向异性探测器采样的适配:当角度采样与探测器通道采样的间距比例极不均匀时,连续基函数的尺度选择需要更精细的自适应超参数调节。
  • 未来方向:将 CTO 拓展至三维动态 CT 与光声成像(PACT),并结合贝叶斯神经算子开展重建结果的不确定度量化分析。

相关工作与启发

  • vs Learned Primal-Dual / LEARN / RegFormer: 现有级联展开模型依赖离散卷积或离散 Vision Transformer,与特定输入矩阵尺寸硬编码绑定,跨采样率测试时性能剧降;CTO 将级联核替换为函数空间 DISCO 算子,在保留物理投影一致性优势的同时获得了完全的网格无关性。
  • vs DuDoNet / DuDoTrans: 双域方法虽然同时利用了正弦图与图像空间,但其跨域融合依赖离散网络;CTO 进一步在正弦图域引入基于傅里叶切片定理的频空双分支神经算子与旋转等变性边界约束,结构泛化性更强。
  • vs 扩散模型(DPS / ALD): 扩散模型具备经验上的连续采样鲁棒性,但需经历数百次反向扩散与数据一致性迭代,单图耗时数十秒且需要针对不同采样率微调超参数;CTO 为单次前向级联网络,推理速度快 500 倍且无需采样率微调。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次将神经算子引入稀疏视角 CT 重建,提出频空双分支正弦图连续算子与旋转等变设计]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖腹部、肾脏多个基准,详细对比了传统、级联、扩散等数类主流模型,提供了跨分辨率、跨采样率及 OOD 完备验证]
  • 写作质量: ⭐⭐⭐⭐⭐ [物理数学推导清晰严谨,从函数空间建模到工程实现逻辑严密,图表详实直观]
  • 价值: ⭐⭐⭐⭐⭐ [成功解决了临床 CT 协议变化导致模型无法复用的核心痛点,具有重大的临床落地与理论参考价值]