Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://lingrayy.github.io/MSSA/
领域: 医学图像
关键词: 测试时自适应, 医学图像分割, 视觉语言模型, 无需训练, 原型匹配
一句话总结¶
针对医学 VLM 测试时微调容易破坏预训练对齐并引发误差放大的问题,本文提出无需微调参数的协同自适应框架 MSSA,通过高斯点采样与双重多数投票稳定粗分割,构建基于语义和形状双重评分的动态记忆库,并利用原型匹配实现跨图像结构一致性引导。
研究背景与动机¶
近年来,大规模视觉-语言模型(VLM)与通用分割模型(如 BiomedCLIP 和 SAM)的结合彻底革新了医学图像分割范式。这类方法通过注意力机制将图像与文本提示(如解剖学描述)直接对齐,展现出卓越的零样本泛化能力。然而,临床实际场景中不可避免地存在严重的域偏移(Domain Shift),如成像设备差异、医院采集协议变动以及复杂的病理形态改变。当目标域数据与预训练分布存在显著偏离时,零样本分割的定位能力会剧烈下降,生成的注意力图容易出现结构粗糙甚至定位漂移。
为了缓解域偏移,测试时自适应(Test-Time Adaptation, TTA)成为研究热点。然而现有的 TTA 方案主要针对单模态视觉主干网络设计,直接迁移到医学视觉-语言多模态架构上面临严重瓶颈。传统 TTA 通常依赖自监督损失(如熵最小化、伪标签一致性正则化)并在线反向传播更新模型参数(如 BatchNorm 统计量或 LoRA 权重)。由于测试阶段完全没有真实标签引导,伪标签中不可避免的噪声会破坏 VLM 在预训练阶段建立的精细图文表征空间,导致更新过程极度不稳定,甚至引发灾难性的性能崩溃与误差级联放大。
本文的切入视角源于对图文跨模态与图像间单模态互补特性的深入洞察:VLM 的图文对齐能够提供不可替代的语义语义先验(告诉模型“是什么”),但在域偏移下空间结构粗糙;而基于自监督特征(如 DINOv2)的图像间相似度匹配具备极强的空间几何与边缘结构一致性,却缺乏类别语义锚定能力(无法自行区分目标前景)。核心 idea:摒弃破坏预训练特征的参数更新范式,提出无需训练的协同自适应框架 MSSA,以稳定的图文定位筛选高质量伪标签构建在线动态记忆库,并利用跨图像相关性原型匹配将样本间结构一致性转化为密集分割指导。
方法详解¶
整体框架¶
MSSA 采用无需反向传播更新的双阶段协同流水线:首先,在图像-文本粗糙定位阶段,利用大型语言模型生成的解剖学描述文本与 BiomedCLIP 计算显著性图,并通过高斯点提示采样与双重多数投票克服初始跨模态定位的随机性与噪声,生成候选掩码;随后,在测试时自适应阶段,通过噪声感知记忆库构建模块对候选掩码进行语义对齐度与空间边界平滑度的双重质检,采用自适应递增阈值筛选高质量样本写入动态记忆库;最后,针对任意输入测试图像,在记忆库中检索视觉特征最相关的锚点样本,提取局部前景与背景原型并计算特征相似度图,直接解码得到高精度、结构自洽的最终分割预测。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入测试图像流与文本提示"] --> B["图像-文本粗糙定位稳定化<br/>高斯点采样 + 双重多数投票"]
B --> C["噪声感知记忆库构建<br/>语义对齐与空间平滑双重质检"]
C -->|满足自适应递增阈值| D["动态特征-掩码记忆库"]
A --> E["DINOv2 特征提取"]
E --> F["基于相关性原型的非参数化适配<br/>最近邻锚点检索 + 局部原型匹配"]
D --> F
F --> G["最终高精度分割掩码"]
关键设计¶
1. 图像-文本粗糙定位稳定化:平抑随机提示与跨模态注意力扰动
标准视觉-语言提示分割方案(如 MedCLIP-SAMv2)直接从 BiomedCLIP 显著性阈值化区域中均匀随机抽取点作为 SAM 的提示,极易受到边缘毛刺或假阳性噪点的影响,导致 SAM 预测出偏离重心的劣质掩码。为此,本文设计了高斯点采样机制,首先对二值化显著性掩码进行距离变换,以掩码几何中心 \((x_0, y_0)\) 为均值构建高斯权重核: $\(G_M(x, y) = \exp\left( -\frac{(x - x_0)^2 + (y - y_0)^2}{2\sigma^2} \right)\)$ 通过赋予中心高置信区域更高的采样概率,有效确保提示点落在解剖目标核心腹地。此外,针对跨模态注意力在域偏移下的闪烁不稳定现象,引入双重多数投票策略:在生成显著性图时施加 CLAHE 与 Gamma 校正等光度增强并投票聚合;在输入 SAM 时施加翻转、缩放、旋转等几何增强并聚合输出,从源头上稳定候选预测掩码 \(Y_{\text{cand}}\)。
2. 噪声感知记忆库构建:语义与形状双重质检结合自适应单调阈值
尽管前序步骤提升了候选掩码质量,但在未标注数据流中直接信任全部预测仍会导致脏数据污染记忆库。本文提出了结合语义一致性与解剖学先验的双重质检评分机制 \(\mathcal{Q}_{\text{total}} = \mathcal{Q}_{\text{sem}} \cdot \mathcal{Q}_{\text{smo}}\)。其中语义对齐分 \(\mathcal{Q}_{\text{sem}}\) 将原图前景区域抠出后送入 BiomedCLIP 计算其与目标文本提示的余弦相似度,过滤语义错配目标;空间平滑分 \(\mathcal{Q}_{\text{smo}} = R_s + B_s\) 则基于多边形轮廓逼近,联合评估面积周长比构成的形状规则度 \(R_s\) 与多边形顶点密度衍生的轮廓平滑度 \(B_s\),专门惩罚破碎、多孔及锯齿状伪影。
为了避免在不同域偏移下人工调节固定阈值,本文设计了动态历史分位数阈值更新机制:在经历少量预热样本后,设定阈值 \(\tau_t = \max(\tau_{t-1}, \operatorname{Percentile}(\mathcal{H}_t, P))\),其中 \(P=80\)。引入严格的单调非递减约束确保了筛选标准随高置信样本的出现只升不降,杜绝了低质量样本在局部波动时渗入记忆库。通过质检的高质量样本以其 DINOv2 图像特征为键、预测掩码为值存入固定容量(容量设为 15)的 FIFO 记忆库 \(\mathcal{B} = \{(F_j, Y_j)\}\) 中。
3. 基于相关性原型的非参数化适配:无参数更新的跨图像原型引导与解码
在传统 TTA 中更新网络参数容易破坏预训练权重且面临灾难性遗忘,MSSA 转而利用 DINOv2 强大的跨图像视觉结构表征能力,以非参数化方式完成自适应分割。当测试样本输入时,首先提取其特征 \(F_t\),计算其与记忆库中所有键特征的余弦相似度,检索出全局表征最接近的锚点样本 \((F_a, Y_a)\)。不同于简单单向量原型无法捕捉局部空间异质性的缺陷,本文借鉴局部自适应原型思想(ALPNet),在锚点特征图 \(F_a\) 上使用滑动窗口对掩码 \(Y_a\) 指示的前景与背景区域分别进行自适应平均池化,生成多组局部前景原型集合 \(\mathcal{P}^1\) 与背景原型集合 \(\mathcal{P}^0\): $\(P_c^{(m,n)} = \frac{1}{|\Omega^{(m,n)}|} \sum_{(u,v) \in \Omega^{(m,n)}} F_a(u,v) \cdot \mathbb{I}[Y_a(u,v) == c]\)$ 随后,计算当前测试特征 \(F_t\) 与各局部原型的余弦相似度图,通过取类别内最大响应聚合为前景与背景相似度图 \(\tilde{M}^1, \tilde{M}^0\),经 Softmax 归一化并取 \(\operatorname{argmax}\) 获得最终分割掩码 \(\hat{Y}_t\)。整个推理过程完全无需反向传播或梯度计算,彻底消除了误差累积的根源。
实验关键数据¶
主实验¶
论文在视盘/视杯(Optic Disc)5 个公开眼底数据集(Domain A: RIM-ONE-r3, Domain B: REFUGE, Domain C: ORIGA, Domain D: REFUGE-Valid, Domain E: Drishti-GS)以及 3 个胸部 X 光肺部数据集(COVID-QU-Ex, MC, SZ)上与当前前沿的微调类 TTA 方法和零样本 VLM 分割方法进行了全面评测。
| 数据集 / 任务 | 评估指标 | 本文 (MSSA) | 之前最强 TTA (TTCS) | 提升幅度 (vs TTCS) | 零样本基线 (MedCLIPv2) |
|---|---|---|---|---|---|
| 视盘分割 (Domain A) | DSC (%) / mIoU (%) | 76.6 / 63.1 | 65.3 / 52.4 | +11.3 / +10.7 | 59.8 / 44.5 |
| 视盘分割 (Domain B) | DSC (%) / mIoU (%) | 87.0 / 77.1 | 86.7 / 79.1 | +0.3 / -2.0 | 82.2 / 71.0 |
| 视盘分割 (Domain C) | DSC (%) / mIoU (%) | 84.6 / 73.8 | 65.2 / 54.1 | +19.4 / +19.7 | 64.9 / 49.8 |
| 视盘分割 (Domain D) | DSC (%) / mIoU (%) | 81.5 / 69.5 | 64.7 / 54.0 | +16.8 / +15.5 | 71.1 / 57.2 |
| 视盘分割 (Domain E) | DSC (%) / mIoU (%) | 89.9 / 82.1 | 76.4 / 67.4 | +13.5 / +14.7 | 79.0 / 67.2 |
| 视盘分割 5 域平均 | DSC (%) / mIoU (%) | 83.9 / 73.1 | 71.7 / 61.4 | +12.2 / +11.7 | 71.4 / 58.0 |
| 肺部分割 (COVID-QU-Ex) | DSC (%) / mIoU (%) | 73.2 / 58.7 | 57.8 / 44.6 | +15.4 / +14.1 | 54.6 / 40.7 |
| 肺部分割 (MC) | DSC (%) / mIoU (%) | 79.2 / 69.4 | 65.2 / 43.1 | +14.0 / +26.3 | 62.1 / 54.6 |
| 肺部分割 (SZ) | DSC (%) / mIoU (%) | 82.9 / 72.1 | 65.2 / 43.1 | +17.7 / +29.0 | 60.2 / 50.5 |
| 肺部分割 3 域平均 | DSC (%) / mIoU (%) | 78.4 / 66.7 | 62.8 / 43.6 | +15.6 / +23.1 | 59.0 / 48.6 |
消融实验¶
论文在视盘分割任务上对核心模块进行了详细的逐项消融分析,揭示了各机制对性能恢复的关键贡献。
| 配置编号 | 组件配置 (SAM-MV / ATN-MV / GP / NMC / Similar) | 视盘平均 DSC (%) | 视盘平均 mIoU (%) | 说明与结论 |
|---|---|---|---|---|
| 1 | Baseline (MedCLIPv2) | 71.4 | 58.0 | 基础零样本模型 |
| 2 | + SAM-MV (SAM 几何多数投票) | 72.8 | 61.8 | 增强 SAM 推理几何鲁棒性 (+3.8% mIoU) |
| 3 | + ATN-MV (显著性图光度多数投票) | 73.9 | 62.9 | 稳定初始跨模态注意力激活区域 |
| 4 | + GP (高斯点提示采样) | 75.7 | 64.7 | 规避边缘杂点,大幅提升初始提示精度 |
| 5 | 单纯图像-图像自迭代记忆库 (+Bank) | 79.2 | 67.0 | 无图文稳定支持,单模态迭代有一定增益 |
| 6 | 自迭代记忆库 + 筛选 (+Select) | 71.2 | 59.7 | 缺乏多样性输入,在 Domain D 暴跌至 18.6% mIoU |
| 7 | MSSA 完整流程 (锚点随机选取 w/o Similar) | 83.2 | 70.8 | 验证双阶段协同与记忆库筛选的巨大效能 |
| 8 | MSSA Full Model (结合特征最相似锚点匹配) | 83.9 | 73.1 | 最佳完整方案,各域均取得最高综合指标 |
关键发现¶
- 微调类 TTA 在密集 VLM 上普遍失效甚至负迁移:如表 1 与表 2 所示,主流单模态 TTA 方法(如 TENT, EATA, CoTTA, DELTA, SVDP)移植到 VLM 架构时,平均 DSC 提升几乎停滞(仅 +0.0% ~ +0.4%),部分方法在肺部数据集上 mIoU 下滑 3%~70%(UniVPT 崩溃至 12.4%)。这证明带梯度的参数微调会迅速破坏多模态预训练对齐,而 MSSA 的无参数自适应彻底避免了性能崩溃。
- 自迭代图像匹配存在灾难性累积风险:消融实验第 6 行表明,脱离图文跨模态持续输入的单模态自迭代闭环极易陷入自证陷阱,在 Domain D 上因早期微小误差累积引发崩溃(mIoU 从 57.2% 坠落至 18.6%),验证了图文语义锚与图像结构引导两者协同的不可或缺性。
- 质检标准的双重互补性至关重要:在记忆库打分消融中,单独使用语义分 \(\mathcal{Q}_{\text{sem}}\) 容易选出语义正确但边缘残缺的破碎掩码;单独使用形状平滑分 \(\mathcal{Q}_{\text{smo}}\) 容易误选轮廓工整的假阳性背景块。两者结合使肺部平均 DSC 显著从 ~69.8% 跃升至 78.4%。
亮点与洞察¶
- 训练-free 规避模型遗忘与漂移:打破了 TTA 必须反向传播更新参数的传统思维,利用记忆库与特征原型匹配直接引导后续测试样本,既保留了基座模型的丰富表征,又赋予模型针对未见分布的自适应灵活性。
- 跨模态语义锚定与单模态几何一致性的优雅协同:将 VLM 擅长类别定位但不精于细粒度边缘的特质,与 DINOv2 擅长致密几何对齐但缺乏显式类别概念的优势完美拼合,形成 1+1 > 2 的互补闭环。
- 单调递增历史分位数阈值机制:无需在各个未知目标域上手动微调过滤阈值,利用非递减分位数自适应对齐目标域难度,能够有效防止早期低质量伪标签污染在线检索池。
局限与展望¶
- 推理延迟与计算开销相对较高:由于需要执行光度与几何增强的双重多数投票,以及在线记忆库特征比对与局部原型滑动提取,MSSA 单图推理时间约为 12.1 秒,明显高于纯前向或传统轻量微调方法(1.7~5.9 秒)。在急诊等对实时性有极端要求的临床场景下部署受到限制。
- 对复杂拓扑与微细解剖结构的适应性尚待验证:当前验证主要集中在边界相对清晰平滑的眼底视盘和肺部轮廓上;对于高曲率、分支繁复的微血管网络或高度弥散浸润的病灶,空间平滑度假设可能会误伤真实的病理特征,未来需引入细粒度拓扑先验以做拓展。
相关工作与启发¶
- vs TTCS [BIBM 2024]: TTCS 是首个探索医学多模态 VLM 测试时自适应的工作,但仍沿袭 LoRA 微调参数路径,在未知域上面临伪标签噪声放大与特征空间退化风险。MSSA 证明完全无需参数微调,通过动态记忆库构建与跨图像原型匹配不仅推理稳定,平均 DSC 更是大幅领先 12.2%。
- vs 传统无源域适应/TTA (TENT / CoTTA / DELTA): 传统方法严重依赖批归一化层更新或自训练伪标签熵最小化,在密集医学语义分割中容错率极低。MSSA 为密集预测 TTA 提供了一条“免训练检索式适应”的全新路线。
- vs ALPNet / ProtosAM 等小样本原型分割: ALPNet 依赖标注精良的源域支持集(Support Set)。MSSA 的巧思在于无需任何人工标注,利用 VLM 与高斯点采样的自举能力在线动态清洗出高质量的伪支持集,打通了少样本匹配技术通往无监督 TTA 的桥梁。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次提出针对多模态医学图像分割的免训练 TTA 架构,颠覆了传统依赖梯度微调的范式]
- 实验充分度: ⭐⭐⭐⭐⭐ [跨越 5 个眼底视盘数据集与 3 个胸部 X 光跨机构/重度病理数据集,包含详尽消融与时延分析]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图文协同的动机阐述深刻,方法各阶段公式与算法定义清晰自洽]
- 价值: ⭐⭐⭐⭐⭐ [彻底解决医学模型上线后的域偏移漂移与崩溃问题,为高可靠免训练临床自适应部署树立标杆]