跳转至

λSplit: Self-Supervised Content-Aware Spectral Unmixing for Fluorescence Microscopy

会议: ECCV 2026
论文: ECCV 官方页面
代码: https://github.com/juglab/lambdaSplit
领域: 图像修复
关键词: 光谱解混、自监督学习、荧光显微成像、层次变分推断、物理一致性

一句话总结

λSplit 用层次 VAE 学习细胞结构先验,再将预测的荧光团浓度图通过已知光谱重新混合,以观测重建实现无需解混真值的训练;在 CellAtlas 的 5 ms、32 波段模拟实验中,PSNR 达到 34.03 dB,而该设置下最强对照 RLU 为 28.91 dB。

研究背景与动机

荧光显微镜需要区分不同标记所对应的生物结构。逐通道采集通常只能方便地观察少量结构,还会增加采集时间、光漂白和光毒性;光谱采集则把多个荧光团的发射同时记录到若干波段,将分离任务留给计算。困难在于一个波段通常混有多个荧光团的贡献,发射谱越相似、光子越少,逐像素最小二乘得到的浓度图就越容易放大噪声或残留串色。

传统 LU、NNLU 等方法主要依赖某个像素的光谱向量,并不知道相邻像素应组成连续的微管或离散的细胞结构。学习方法可以利用这种空间规律,但监督式模型需要混合观测与干净浓度图成对出现,而真实采集中很难取得这样的真值。遥感解混网络也不能直接解决问题:显微图像的噪声、空间分辨率和浓度含义均不同,尤其不能默认各荧光团在一个像素上的浓度之和为 1。

本文保留已知发射光谱这一可获得的物理信息,把缺失的监督从“输出应是什么浓度图”改为“这些浓度图重新混合后,应能解释输入”。仅靠这个约束仍有多解,所以再用层次潜变量学习生物结构的分布。核心 idea:让内容感知的结构先验选择合理的解混结果,让固定的光谱前向模型检查结果是否解释观测,从而在没有成对解混真值时联合完成分离与隐式去噪。

方法详解

整体框架

输入是含 \(L\) 个波段的二维或三维光谱图像,输出是对应 \(F\) 种荧光团的浓度图。λSplit 首先通过层次结构先验生成可能的浓度分布,再通过物理光谱闭环重建输入;训练只比较光谱观测,不把原始浓度图作为监督目标。

测试时保留编码器和浓度解码器,从后验分布采样 50 次并取平均。光谱混合器负责训练中的物理约束,不是测试时将混合图像直接求逆的模块;图中的虚线表示训练监督,实线表示图像和预测的数据流。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["光谱观测"] --> Prior["层次结构先验"]
    Prior --> Maps["浓度图样本"]
    Maps --> Mixer["物理光谱闭环"]
    Spectra["已知发射光谱"] --> Mixer
    Mixer --> Recon["重建光谱"]
    Input -. "观测目标" .-> Loss["光谱 MSE + KL"]
    Recon -. "重建误差" .-> Loss
    Prior -. "层次 KL" .-> Loss
    Loss -. "训练更新" .-> Prior
    Maps --> Average["测试时平均<br/>50 个后验样本"]
    Average --> Output["解混浓度图"]

关键设计

1. 层次结构先验:用空间上下文约束逐像素难以判定的归属

主干采用 Ladder Variational Autoencoder(LVAE)。自下而上的卷积编码器提取多个分辨率的观测特征;最高潜变量层使用标准多元高斯先验,其余层的可学习先验由上层状态向下条件化,再与同尺度编码特征结合形成后验。解码时逐层采样、传播特征,最后的解混卷积块将特征转成 \(F\) 个浓度通道。因此,网络不是先做 LU 再给结果去噪,而是直接在结构先验约束下预测源图像。

这使一个局部像素的解释能借助周围的形态信息:当光谱难以区分两种标记时,网络还可以利用训练数据中的结构分布,而非只比较当前像素的波段强度。四个随机层的空间分辨率逐层减半,特征通道保持 128;二维、三维版本分别采用相应维度的卷积。KL 项将观测后验与层次先验联系起来,但这种正则化并不保证欠定情况下存在唯一正确解。

推理阶段对 50 个后验样本求平均,得到近似的最小均方误差(MMSE)估计。这里平均的是多次可能的解混结果,而不是重复采集的显微图像;随机细节因平均而减弱,多个样本中稳定出现的结构被保留。论文展示了隐式去噪现象,但没有在当前正文中给出不确定性校准结果,因此不能把“能采样”直接等同于“置信度可信”。

2. 物理光谱闭环:把不可获得的浓度监督转成可观察的光谱重建

已知混合矩阵 \(M\in\mathbb{R}^{L\times F}\) 的每一列表示一种荧光团在各采集波段的离散发射谱。作者按波段对连续光谱取平均,并对每一列做 \(\ell_1\) 归一化,使其元素之和为 1;光谱可以来自 FPBase,也可以由单荧光团对照样本实测。矩阵在训练中固定,只让梯度通过混合运算回到预测浓度图。

对任一空间位置 \(p\),混合器的运算及其强度守恒关系可简洁写为:

\[ \widehat S_{\ell,p}=\sum_{j=1}^{F}M_{\ell j}\widehat U_{j,p},\qquad \sum_{\ell=1}^{L}\widehat S_{\ell,p}=\sum_{j=1}^{F}\widehat U_{j,p}. \]

其中 \(\widehat U\) 是预测浓度,\(\widehat S\) 是重建光谱。这个归一化约束属于混合矩阵的列,绝不是要求每个像素的各浓度之和为 1;后者会错误地限制显微图像的亮度变化。由于混合器可微,光谱重建误差能够端到端指导浓度预测,不需要干净浓度真值,也不需要学习一个任意的光谱解码器。

物理闭环解决的是“预测能否解释观测”,不是从数学上消除歧义。特别是 \(L<F\) 时,不同浓度组合可能产生相同的光谱观测,结构先验仍是选解的重要依据。因而本文是已知光谱条件下的解混,不属于同时估计光谱与浓度的盲解混;错误的参考谱会直接破坏这个闭环的可信度。

一个完整示例

以 CellAtlas 的低波段实验为例,待恢复的是细胞核、微管、内质网和线粒体,共 4 个浓度通道。当观测只有 3 个波段时,每个像素提供的光谱约束少于未知浓度数,简单逐像素求逆无法唯一确定解。

λSplit 把三波段图像块送入编码器,依据多尺度特征形成后验,再由解码器给出四通道浓度样本。固定的 \(3\times4\) 混合矩阵将这些样本重新投影到三波段观测域,重建误差负责排除不能解释输入的预测,层次先验则偏向训练数据支持的细胞结构。

测试时将 50 次样本平均。在表 2 的固定每波段 SNR 设置中,这一三波段任务的 PSNR 为 27.25 dB,RLU 为 26.39 dB;这说明先验能改善欠定重建,但并不说明三波段可无损替代更多波段,也不证明每个输出结构都能从观测唯一恢复。

损失函数 / 训练策略

作者从层次 VAE 的变分目标出发,将不可观察的浓度重建项替换为光谱域 MSE,再加入层次 KL 正则。正文明确表示没有显式指定概率噪声模型,所以更准确的说法是使用 MSE 近似重建项,而不是严格推导了泊松光子计数似然。

缓存中的公式排版存在字符丢失;下面按照正文叙述概括训练机制,不作为原文公式(6)的逐字转录:

\[ \mathcal L=\mathbb E_{q_\phi(\mathbf z\mid S)}\left[\frac{1}{LP}\sum_{\ell=1}^{L}\sum_{p=1}^{P}\left(S_{\ell,p}-\widehat S_{\ell,p}(\mathbf z)\right)^2\right]+\beta\mathcal L_{\mathrm{KL}},\qquad \beta=1. \]

这里 \(P\) 为像素或体素总数;实现中的 KL 先在各潜变量层的张量条目上平均,再对各层平均,以 Monte Carlo 方式估计。不能把这种实现归一化忽略后,直接将其权重与其他 VAE 的 KL 系数比较。

训练使用 Adamax,batch size 为 32,初始学习率为 \(10^{-3}\),计划训练 150 个 epoch;采用混合精度、patience 为 30 的早停和 patience 为 15 的平台期学习率衰减。二维块大小为 \(64\times64\),三维块为 \(8\times64\times64\);测试采用 inner tiling,相邻块重叠四分之一。

输入采用全局均值和标准差归一化,以保留波段间相对强度,不对各波段任意独立缩放。训练硬件为 NVIDIA DGX H200 的 18 GB 或 35 GB MIG 分区,分别用于二维和三维模型;正文报告训练耗时约 2 小时至一天,依数据规模和维度变化。

实验关键数据

主实验

实验从 BioSR、CellAtlas、HHMI25 三个真实显微数据集取得结构图像,再使用 microsim 合成光谱观测,构造 58 个受控基准,并在不同实验中共比较 10 种基线。模拟包含光学点扩散、光子统计、读出噪声与波段配置;真实结构来源不等于在原生真实光谱采集上完成了定量验证。

下表摘录正文表 1 的 CellAtlas 32 波段结果。PSNR 与 MS-SSIM 使用 range-invariant 评估以补偿全局强度尺度差异;PSNR 单位为 dB,LPIPS 越低越好。对照选取该曝光下 PSNR 最好的非 λSplit 方法,提升为两者差值。

曝光 方法 PSNR ↑ MS-SSIM ↑ LPIPS ↓ λSplit 的 PSNR 提升
2 ms TAEU 24.52 0.761 0.520
2 ms λSplit 27.14 0.904 0.373 +2.62 dB
5 ms RLU 28.91 0.927 0.316
5 ms λSplit 34.03 0.980 0.155 +5.12 dB
10 ms RLU 33.14 0.971 0.221
10 ms λSplit 36.66 0.989 0.137 +3.52 dB
20 ms RLU 36.68 0.988 0.125
20 ms λSplit 36.46 0.988 0.155 -0.22 dB

较低曝光下优势明显,但 20 ms 时 RLU 的 PSNR 与 LPIPS 均更好。表 1 的 2 ms 设置中,λSplit 的 MicroMS-SSIM 为 0.625,低于 TAEU 的 0.652;不能将 PSNR 优势延伸为所有质量指标均领先。

消融实验

当前缓存只含正文,未含作者引用的补充材料 S.5,因此无法核实随机层数与 KL 权重的架构消融数字。下表改为呈现正文表 2 的波段数受控分析,不将其冒称为模块消融;比较对象固定为 RLU,目标始终为 4 个浓度通道。

采集控制 波段数 λSplit PSNR ↑ RLU PSNR ↑ λSplit MS-SSIM ↑ RLU MS-SSIM ↑ λSplit LPIPS ↓ RLU LPIPS ↓
每波段 SNR 固定 3 27.25 26.39 0.878 0.866 0.283 0.238
每波段 SNR 固定 4 29.95 27.56 0.960 0.921 0.267 0.258
每波段 SNR 固定 5 31.12 28.91 0.971 0.943 0.313 0.220
每波段 SNR 固定 32 36.46 36.68 0.988 0.988 0.155 0.125
总光子预算固定 3 27.45 27.13 0.868 0.882 0.273 0.187
总光子预算固定 4 31.54 28.63 0.967 0.938 0.238 0.229
总光子预算固定 5 31.12 28.91 0.971 0.943 0.313 0.220
总光子预算固定 32 31.32 26.15 0.971 0.872 0.218 0.387

两组控制回答不同问题:第一组隔离光谱维度变化,第二组允许更少波段获得更高的每波段 SNR。它们共享 5 波段参考设置,而 32 波段的光子条件不同,不能把两组同列数字当作同一采集条件。

关键发现

  • 结构先验在困难设置更有帮助,但不是越少波段越好。固定每波段 SNR 时,λSplit 从 32 波段的 36.46 dB 降至 3 波段的 27.25 dB。
  • 固定总光子预算时,4 波段 λSplit 为 31.54 dB,32 波段为 31.32 dB,说明更多波段带来的可分性可能被更低单波段信噪比抵消。
  • 指标间存在明确权衡。固定总光子预算的 3 波段设置中,λSplit 的 PSNR 高于 RLU,但 MS-SSIM 为 0.868 对 0.882,LPIPS 为 0.273 对 0.187,均不占优。
  • 光谱重叠实验使用 2、5、10、20、50 nm 位移,在 32 和 5 波段下开展共 40 组实验;正文图 4 显示重叠越强,λSplit 的优势越明显,但当前缓存没有相应补充表的精确结果。

亮点与洞察

  • 把物理模型用作监督桥梁。 可获得的是混合观测而非纯净通道,因此将输出投回观测域比要求成对标签更实际;固定混合器也防止任意解码器绕开浓度解释。
  • 利用形态而不只利用光谱差异。 多尺度先验让欠定解混不再完全依赖单像素方程,但其价值应理解为数据分布上的选解能力,而不是新的唯一性保证。
  • 同时控制光谱信息与光子预算。 两种波段实验拆开了“信息维度少”和“每波段光子多”两个因素,比只改变通道数更能指导显微采集配置。

局限与展望

  • 方法假设线性混合且参考光谱已知。作者将光谱估计列为后续方向;实用验证还应检查谱漂移、参考谱误差及标记环境变化造成的偏差。
  • 定量证据来自真实结构驱动的合成光谱观测。标准共聚焦硬件的兼容性不等于已证明跨仪器、跨实验室和真实采集域中的稳定性能。
  • 学习先验可能偏向训练中常见形态。罕见结构、强共定位或分布变化下是否出现错误分离,需要独立验证,尤其不能只凭低光谱重建误差判断生物学真实性。
  • 后验采样平均增加推理工作量,而正文未报告完整延迟对比。模型约 3M 参数并不自动意味着端到端实时,部署需计入 50 次采样和分块开销。
  • 补充材料未包含在当前缓存,无法复核架构消融、详细指标实现和额外监督基线表;本文也披露相关专利申请,代码可获取不等同于全部使用场景均无许可限制。

相关工作与启发

  • vs LU / NNLU / RLU: 这些方法主要由光谱和像素观测决定结果,λSplit 额外学习空间结构分布。高 SNR 时 RLU 仍有竞争力,因此学习模型的主要价值在噪声和歧义较强的场景。
  • vs MicroSplit: MicroSplit 已用层次变分架构从单张荧光图像分离结构;λSplit 的关键增量是显式利用多波段测量与已知发射谱,并将光谱前向模型纳入自监督闭环。
  • vs AutoUnmix: 文中监督对照使用模拟器提供的无噪声浓度真值,具有额外监督优势。正文报告其 5 波段与 32 波段模型分别约 450M、10B 参数,而 λSplit 均约 3M;不能据此声称 λSplit 在全部监督任务上精度更高。
  • vs FCLU / TAEU: 二者在本文显微实验中的适配较差,提示遥感丰度约束与显微浓度图的统计含义不同;这不是对它们原始遥感任务表现的否定。

评分

  • 新颖性: 4/5。层次 VAE 与已知光谱闭环的结合贴合显微解混需求,基础组件本身并非全新。
  • 实验充分度: 4/5。58 个受控设置覆盖主要难点,但真实光谱域验证及本次未获得的补充消融仍构成证据边界。
  • 写作质量: 4/5。问题、物理模块和控制实验衔接清楚,但概括性领先表述需结合各指标例外阅读。
  • 价值: 4/5。无需成对浓度真值且适配常规光谱显微采集,落地仍依赖参考谱准确性与跨域验证。