跳转至

Towards Scalable Context-Aware Single-Cell Spatial Transcriptomics Prediction from Histology Images

会议: NeurIPS2026
arXiv: 2609.36429
代码: https://github.com/zjgao02/CELLO
领域: 计算生物学
关键词: 单细胞空间转录组、组织病理图像、位置查询、距离衰减交叉注意力、病理基础模型

一句话总结

CELLO 在每个组织图像 tile 上共享一次病理基础模型编码,以连续位置查询和距离衰减交叉注意力预测细胞基因表达,在 52 对 H&E–Xenium 样本上提高平均 PCC,并在不计上游分割的计时中达到相对 DeepSpot2Cell 的平均 14.0 倍加速。

研究背景与动机

H&E 染色展示组织形态,空间转录组则补充细胞所在位置的分子表达信息。已有图像到表达预测通常对齐 Visium 的 spot:一个区域内许多细胞共享一个聚合表达向量,因此即使区域预测准确,也不意味着恢复了每个细胞的状态。Xenium 提供更细粒度的配对监督,使直接预测单细胞表达成为可能,但图像编码器的空间尺度仍是障碍:一个视觉 token 可以覆盖多个细胞,把 token 当作独立细胞表示会混入邻居信息。

DeepSpot2Cell 用逐细胞裁剪接入病理基础模型,能够利用预训练形态表示,却需要为大量细胞分别运行大编码器,裁剪或缩放还会改变形态和上下文。GHIST 一类掩码方法保留分割界定的细胞结构,但没有同样强的现代病理基础模型表示,且会继承边界误差。本文的切入点不是让所有细胞重新各看一张图,而是保留整块图像的共享空间表示,再按细胞位置查询;这样既能摊薄编码成本,也不必把不可靠的边界掩码直接用于特征池化。

这里的“细胞级”指输出与已给定的细胞位置一一对应,而不是从图像自动发现细胞,也不是把混合视觉 token 完美分离成纯细胞信号。核心 idea:先在每个 tile 上共享病理基础模型的空间 token,再通过连续位置查询和带空间先验的上下文精炼,为所有给定细胞位置产生可训练的表达预测。

方法详解

整体框架

输入是从 WSI 切出的 H&E 图像 tile,以及落入其中的细胞质心坐标;输出是每个位置对应的非负基因表达向量。默认采用 Virchow2 编码一个 224×224 tile,得到空间 token 网格;双线性采样初始化细胞查询,随后用带 2D RoPE 和高斯距离先验的交叉注意力读取 tile 内的空间 token,最后由表达头回归基因值。

训练另有预测 tile 聚合表达的辅助分支,监督来自该 tile 内细胞表达之和。推理只需要图像与细胞位置,不需要该样本的实测表达;但获得位置仍依赖空间转录组坐标或上游检测/分割,不能称为无需分割的完整部署流程。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    I["H&E tile"] --> A["共享空间编码"]
    A --> B["连续位置查询"]
    S["细胞质心坐标"] --> B
    B --> C["距离衰减交叉注意力"]
    A -->|空间 token| C
    C --> D["掩码表达回归"]
    D --> O["推理:每细胞表达"]
    A -.->|训练:聚合表达辅助分支| D
    Y["训练:实测细胞表达<br/>及其 tile 内总和"] -.->|监督;仅已测基因| D

关键设计

1. 共享空间编码:把重复的大模型计算移到 tile 级别

逐细胞裁剪的主要成本来自重复编码重叠组织区域。CELLO 对一个 tile 只运行一次病理基础模型,并保留空间 token,而不是仅取一个 CLS 向量作为整块区域内所有细胞的表示。空间 token 重排成规则二维特征图后,其位置仍能对应图像区域,这为后续查询提供了几何锚点。编码成本主要随 tile 数量增长,而不再要求每个细胞一次大模型前向;细胞查询与注意力本身仍随细胞数量增加,并非总成本与细胞数无关。

此处“一次编码”不是整张 WSI 只前向一次。训练和评估都使用非重叠 224×224 tile,每个细胞归属包含其坐标的 tile,只能读取该 tile 的视觉 token。模型也没有显式建立跨 tile 的细胞图;文中关于细胞相互作用的表达,应理解为读取局部形态上下文,而不是直接测量或识别了真实细胞间通信。

2. 连续位置查询:在稀疏 token 网格上保留细胞坐标差异

原始细胞坐标位于 WSI 像素坐标系。先减去 tile 左上角得到局部坐标,再归一化到 GridSample 所需的 [-1,1] 范围。双线性采样依据细胞周围最近的四个空间 token 插值得到初始查询,使落在不同亚 token 位置的细胞不必机械地共享同一个离散 token。该操作可微,因此查询出的特征能够参与后续任务训练。

位置插值避免了逐细胞裁剪、缩放和按边界掩码池化,却没有制造编码器原本不存在的分辨率。默认 Virchow2 的 token 步长为 14 像素,224×224 tile 对应 16×16 的空间网格;同一个邻域内多个细胞的初始查询仍可能非常接近。它提供的是位置特定的组织表示,不是被完美隔离的细胞内部图像表示,这也是继续引入上下文精炼的原因。

3. 距离衰减交叉注意力:让位置先验指导局部上下文读取

每个初始细胞查询作为 query,tile 的所有空间 token 提供 key/value。2D RoPE 将相对位置引入注意力:细胞像素坐标先除以 token 步长,转为连续 token 网格坐标,而 key 使用 token 中心网格坐标。因此两者处于同一尺度,不是把原始像素坐标直接与 token 索引混用。

在 softmax 前,模型还加入距离衰减偏置。对局部细胞位置 \(\mathbf{s}_i^{\mathrm{loc}}\)、token 像素中心 \(\mathbf{c}_m\) 和步长 \(p\),原文式(4)的清晰 LaTeX 部分为:

\[ b_{i,m}=-\frac{\|\mathbf{s}_i^{\mathrm{loc}}-\mathbf{c}_m\|^2}{2p^2}. \]

该偏置在指数归一化中对应高斯型距离先验:相同内容匹配程度下,邻近 token 更容易获得权重。它不是半径内保留、半径外删除的硬截断,远处 token 仍可参与,而且内容相关性与距离先验共同决定注意力。随后通过层归一化得到上下文精炼的细胞表示,供表达头使用。

设计的生物学直觉是细胞状态与周围组织微环境相关,但实验必须分层解释。CELLO 相对 Grid 的增益支持“加入上下文精炼”的整体方案;附录仅移除距离偏置的短程实验却没有显示性能下降,因而不能把全部收益归因于高斯先验本身。CLS 融合也不是默认有效模块:作为对照,将当前 tile 的 CLS 与细胞表示通过标量门融合总体变差。这只检验了 patch 级摘要,不能据此否定真正的整张 WSI 上下文。

4. 掩码表达回归:在不同 Xenium panel 之间共享预测头

表达头覆盖 1,915 个基因的并集,但单一样本仅测量其中 280–480 个基因,排除阴性对照和 antisense 探针。训练和评估只选择该样本实际测得的基因;没有测到的基因不是“表达为零”的负例。否则模型会把 panel 差异当作组织差异,缺失测量也会污染评价。

细胞表示输入两层 MLP 和 ReLU 得到非负预测。目标值不是原始转录本计数,而是每细胞归一化到 100 后的 \(\log(1+x)\) 表达。辅助 tile 表达目标为该 tile 内这些细胞目标向量的总和,不能偷换成先对原始计数求和再取对数,也不等价于额外获得了独立 spot 测量。这里是同一单细胞配对监督的两种粒度,而非从弱 spot 监督解卷积细胞表达。

一个完整示例

以一个 224×224 tile 为例,假设上游给出了其中 30 个细胞质心;30 是说明流程的示例数字,不是原文统计。Virchow2 只编码这个 tile 一次,得到 16×16 空间 token。模型为 30 个位置分别插值,再让各自查询读取同一份 256-token 上下文,因此两个靠得很近的细胞会共享候选上下文,却有不同的连续查询位置和距离偏置。

如果该样本测得 377 个基因,模型仍输出 1,915 维向量,训练损失只考察对应的 377 个维度,并用 30 个细胞目标之和监督辅助 tile 分支。推理时不输入这些基因值,也不输入表达掩码来提供分子信号;图像和上游位置通过已训练的表达头产生预测。未测基因的输出不能因为维度存在就被视为已在该样本中验证。

损失函数 / 训练策略

原文采用细胞级与 tile 级 Huber 回归的加权和:

\[ \mathcal{L}=\mathcal{L}_{\mathrm{cell}}+\lambda\mathcal{L}_{\mathrm{patch}},\qquad \lambda=0.5. \]

细胞损失对细胞及其已测基因平均,辅助损失回归 tile 聚合目标。Huber 的理由是标准化表达有长尾与离群值,目标又是回归及 PCC 评价,而非拟合原始计数的生成分布。原文没有提供足够清晰的所有辅助分支细节,此处不补造精确分支公式。

附录 C 使用 4 张 H100、每 GPU 128 个 tile,全局 batch 为 512,训练 200 个 epoch;采用 FP16、AdamW、余弦学习率调度及最大范数 1.0 的梯度裁剪。backbone 基础学习率为 \(5\times10^{-6}\)、权重衰减 0.01,任务头为 \(2\times10^{-4}\)、权重衰减 0.05。前 10% epoch 冻结 backbone,接下来 30% 逐步解冻并将学习率线性增至 \(2\times10^{-5}\),随后完全微调。

每 5 个 epoch 在验证集按 WSI 非重叠滑窗评价,选最高基因级 PCC 的 checkpoint,固定随机种子 42。DeepSpot2Cell 则保留冻结基础模型;作者承认表示自适应差异可能贡献一部分精度差距,因此该比较不是严格隔离查询方式的控制实验。

实验关键数据

主实验

数据来自 HEST-1k 的 52 对同切片 H&E–Xenium 样本,覆盖 12 个器官。附录 B 给出 36/4/12 个训练/验证/测试样本,处理后 520,402 个 tile、9.53M 个细胞;组织切片在原位解码后进行 H&E 染色并再次成像,沿用 HEST-1k 的配准和质量控制,作者未额外配准。

评价是基因级 Pearson 相关系数:对一个基因在细胞间的预测与测量计算线性相关,再在指定基因集合上平均。HVG、MPG、SVG 的 top-k 只是评价子集,不参与训练基因筛选;top-k PCC 不等于完整 panel 的精度,更不等于临床有效性。以下保留表 1 的组平均值。

配置 ID HVG-10 ID HVG-50 ID HVG-200 OOD HVG-10 OOD HVG-50 OOD HVG-200
UNet3+ 0.3569 0.2044 0.0711 0.2513 0.1395 0.0431
DeepSpot2Cell 0.4577 0.2773 0.0925 0.2884 0.1635 0.0524
Grid,无上下文精炼 0.5567 0.3700 0.1474 0.4083 0.2413 0.0862
CELLO 0.6421 0.4390 0.1718 0.4768 0.2801 0.0916

HVG-50 相对 DeepSpot2Cell 的提升为 ID 58.5%、OOD 71.3%;相对 Grid 为 18.6%、16.2%。原文称 DeepSpot2Cell 为“最强基线”,但表内 Grid 的平均数更高,故在解释方法模块增益时应优先比较 Grid,而不是沿用该排序措辞。

消融实验

下面汇总附录 E 的两种预算。前四行是主模型编码器/CLS 对照;后三行仅为同数据、单 GPU、batch 16、50 epoch、单随机种子的短程训练,不可与前四行直接比较效果大小。

配置 ID HVG-50 OOD HVG-50 说明
UNI 0.3648 0.2417 编码器对照
H-Optimus-0(H0) 0.3827 0.2524 编码器对照
Virchow2 / CELLO 0.4390 0.2801 主设置,无细胞 CLS 融合
Virchow2 + CLS 融合 0.3975 0.2656 融合当前 tile 的摘要
短程训练,\(\lambda=0\) 0.3882 0.2574 无辅助 tile 损失
短程训练,\(\lambda=0.5\) 0.3750 0.2349 默认权重的短程版本
短程训练,\(\lambda=0.5\),无距离偏置 0.3822 0.2468 保留注意力,移除距离先验

表 7 测试的权重为 0、0.1、0.25、0.5、1.0;默认 0.5 在该预算下反而最低,移除距离偏置也未降低性能。因此“辅助聚合监督和距离先验各自必要”没有被这些短程结果支持,仍需相同充分训练预算和多种子的隔离实验。

关键发现

  • 平均增益不表示每器官、每基因集合都占优:Kidney 的 HVG-50 为 Grid 0.3147、CELLO 0.2743;Heart 为 0.1868、0.1469。Heart HVG-200 的 CELLO 0.0258 也低于 UNet3+ 0.0430,说明某些 OOD 细粒度信号仍较弱。
  • Virchow2 融合 CLS 后,九个组平均指标的简单平均由 ID 0.4793 降至 0.4143,OOD 0.3298 降至 0.2867;但个别项有收益,如 OOD HVG-200 从 0.0916 升到 0.0972。结论应是总体不稳定收益,而非每项都下降。
  • 附录 H 的五个额外 HEST-1k 样本无适配测试中,HVG-50 从 TENX158 的 0.196 到 TENX94 的 0.575,显示样本间差异;它们仍来自同一数据资源,不能等同于多中心临床外部验证。
  • 附录 I 在固定 3,000 个测试 tile 上扰动位置:质心噪声标准差 10 像素时平均每 tile PCC 从 0.1348 到 0.1336,40 像素时到 0.1206;删除 40% 细胞后到 0.1286。该指标在 tile 内跨细胞及已测基因计算,与主表的基因级 PCC 不是同一口径,亦未验证分割合并/拆分错误。

效率实验在单张 L40S 上运行,FP16、每次 16 张图像,预热和 GPU 同步后重复五次;每张测试 WSI 抽 200 个 tile 计时,再按 tile 数外推。因此下表是投影的整片时间,不是每张整片完整运行的直接计时,且排除模型加载。

效率指标 数值 边界
CELLO 单 WSI 时间 67.5 ± 48.8 s 不含细胞分割
DeepSpot2Cell 单 WSI 时间 947.2 ± 1068.3 s 不含细胞分割
UNet3+ 单 WSI 时间 73.9 ± 52.1 s 不含细胞分割
DeepSpot2Cell / CELLO 平均 14.0×;中位数 11.7× 各片比值范围 3.5–26.3×
CellViT-SAM-H 分割 382.5 ± 334.1 s 上游公共成本
含分割的 DeepSpot2Cell / CELLO 中位数 2.5× 不能称为端到端 14×
含分割的 UNet3+ / CELLO 中位数 1.02× 两者近似持平

结论段写“up to 7.1×”,与正文/附录 J 的平均 14.0×及范围 3.5–26.3×不一致,原文未解释对应口径,本笔记不将两者自行统一。附录计时分解还包含 CLS fusion,而主结果默认不融合 CLS;计时配置与主精度配置的精确对应需要代码进一步核验。

亮点与洞察

  • 真正重要的工程改变是共享空间编码后再查询,而不是先为每个细胞构造独立输入。它同时让位置级预测更高效,并使大 backbone 的任务微调更可行。
  • 连续查询与同尺度 RoPE 将规则视觉网格接到不规则细胞位置上。类似设计可迁移到带已知坐标的组织标记预测,但不能借此声称超越编码器分辨率地恢复独立分子信号。
  • panel 掩码明确区分“未测量”与“零表达”。这对跨实验平台监督尤其重要,也提醒读者不要把并集预测维度等同于每个样本都有 1,915 基因的评价证据。

局限与展望

  • 推理仍依赖细胞位置,减少的是对精细边界掩码的依赖,不是消除检测/分割误差。应增加真实分割错误、坐标配准漂移及不同检测器之间的鲁棒性实验。
  • 每个未见器官只有一张测试 WSI,Kidney 和 Liver 则是在训练已见器官上的未见健康状态;这些 OOD 结果更适合作为迁移案例,而非器官级泛化估计。Table 2 中 Lymphoid 训练仅 Cancer/Healthy,测试却为 Diseased,与正文将其纳入“器官及健康状态均已见”的 ID 定义不符,应单独标注这一划分问题。
  • 主文平均改进混合了查询、上下文与 backbone 微调,附录 G 的冻结逐细胞裁剪对照也未完全隔离因素。该表的 CELLO 数值与主表不同且未充分解释配置,不将它们并入同一结果系列。
  • 距离偏置和辅助损失的独立因果贡献仍缺乏充分实验支持。下一步宜在一致 200-epoch 预算下交叉消融二者、重复随机种子,并报告 slide 级置信区间。
  • 当前上下文止于 tile 边界,CLS 对照也仅是当前 patch 摘要。更大范围的组织结构或跨 tile 通信是否有帮助仍开放,不能由局部 CLS 失败直接推断。
  • PCC 衡量线性共变,不验证表达绝对值校准、罕见状态、临床终点或治疗决策有效性。预测表达不能替代真实分子测量,需要独立实验及前瞻验证。

相关工作与启发

  • vs DeepSpot2Cell:后者逐细胞裁剪并利用冻结病理基础模型,原始方法依赖 spot 弱监督;CELLO 共享 tile 特征并直接使用配对单细胞监督。速度改进针对逐细胞大模型前向,准确率差距也包含微调和监督设定因素。
  • vs GHIST / UNet3+:这条路线从边界掩码构造细胞表示,CELLO 改为坐标查询共享预训练特征。本文实际比较的是 UNet3+ 基线,不能把其结果等同于覆盖 GHIST 全部方法能力;两者含分割的时间近似持平。
  • vs Grid:Grid 保留共享编码与位置查询,省去距离衰减交叉注意力,是最接近的方法消融。它比 DeepSpot2Cell 的平均结果更高,表明共享表示本身已贡献显著收益。
  • vs iStar / scstGCN:这类方法结合 ST 输入做超分辨表达重建,目标与仅凭 H&E 加细胞位置预测不同。区分输入和监督粒度比笼统比较“单细胞分辨率”更有意义。

评分

  • 新颖性: 4/5 — 将共享病理 token、连续细胞查询与空间偏置精炼整合为可微调框架,单个机制并非全新。
  • 实验充分度: 3/5 — 器官、效率和附录分析较丰富,但 OOD 样本少、因果消融及配置一致性不足。
  • 写作质量: 3/5 — 方法主线清晰,但加速口径、基线排序、ID 状态和 CLS 上下文措辞存在不一致。
  • 价值: 4/5 — 对可扩展形态到单细胞表达研究有实用价值,尚不能作为分子测量或临床验证的替代。