VesselTok: Tokenizing Vessel-like 3D Biomedical Graph Representations for Reconstruction and Generation¶
会议: ECCV2026
论文: ECCV 2026
代码: https://github.com/chinmay5/vessel_tok
领域: 医学图像
关键词: 血管图 tokenization / 神经隐式表示 / 图生成 / 拓扑保持 / 管状结构
一句话总结¶
VesselTok 把血管、气道这类三维中心线图先用固定伪半径膨胀成连续的"图占据场",再用 VAE 式 Transformer 在中心线点上学出定长紧凑 token(512×4),让同一个隐空间同时支撑高保真重建、跨解剖泛化、血管图生成与缺失连接补全。
研究背景与动机¶
血管、气道、神经元、淋巴网络这类管状结构遍布生理系统,承担连接不同解剖区域、输运信号与物质的功能,其正常与异常形态在脑血管病、肺疾病、糖尿病周围神经病变等研究中都有关键意义。用中心线构成的三维空间图来表征它们是很自然的选择:一张图就把长度、半径、分支拓扑,以及计算流体力学所需的结构信息都装下了。问题出在分辨率上——高分辨率下这类图动辄上万个节点、十几万条边,现成的图算法和生成模型都难以处理,因此既有工作只能退回到简化结构(如只处理树状图)、小尺度子图或单个血管段的做法,规模一直上不去。
形状 tokenization 这条线上其实已经有了成熟方案:3DShape2VecSet、Hunyuan3D 2.0 这类方法能把一个三维形状压成一组紧凑隐向量,并直接作为扩散模型的接口。但它们都在表面点上采样,而血管网络恰恰是"稀疏、细、高度分叉"的高表面积比结构:原文给出的一个代表性 ATM 样例有大约 64,000 个表面点,中心线点却只有约 3,000 个。固定查询预算的 tokenizer 会把大量容量花在重复的管壁上,反而对小分支、端点和分叉这些真正决定拓扑的位置采样不足。作者进一步指出,血管半径虽然在解剖上变化很大,却并不是学紧凑表示的瓶颈——在气道和脑血管等系统中半径受解剖约束、沿中心线平滑变化,可以从中心线坐标可靠回归(补充材料 Sec. B 有验证),因此可以给中心线点一个固定的伪半径,把真实半径当作可推断属性,从而把模型容量集中在三维几何与拓扑上,避开宽半径分布带来的尺度失衡。核心 idea:不把图当作节点集合去 token 化,而是把中心线图膨胀成一条连续的占据场,只在中心线点上做 VAE 式 token 化——省下的容量换成了对复杂 3D 拓扑的表达力,而这个紧凑隐空间本身就能当生成与补全的共享接口。
方法详解¶
整体框架¶
问题被形式化为:给定三维空间图 \(G=(V,E,\{P\})\)(顶点、边、以及节点坐标),学一个 tokenizer \(\mathcal{T}\) 把 \(G\) 映射成长度 \(l\)、通道数 \(c\) 的 token 序列(连续情形即隐变量 \(Z\in\mathbb{R}^{l\times c}\)),再学一个解码器 \(\mathcal{D}\),使 \(\tilde{G}=\mathcal{D}(\mathcal{T}(G))\) 与输入图 \(G\) 保持同样的拓扑与结构。整条流程分三步:先把离散中心线图变成连续的图占据场,再在中心线点上编码成定长紧凑 token,最后把 token 解码回占据场、经由骨架化与邻域连接还原成离散图。之所以要绕一圈走"场",是因为中心线点的位置和个数都可以任意变化却不改变血管结构(图到点的映射不是单射),连续场对这类采样选择天然不变;而之所以要绕一圈回到"图",是因为下游的拓扑分析、连接补全、血流建模要的是可用的中心线图,不是体素场。
编码器与解码器都采用近期形状 tokenizer 的 Transformer 结构(VAE 式),编码器把中心线点云连同初始化查询一起压成隐变量,解码器则用三维网格上的查询点通过交叉注意力重建占据场。下图给出整体数据流,其中"生成 / 补全"是隐空间的下游用法,不改变 tokenizer 本身。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:三维中心线图"] --> B["中心线占据场<br/>伪半径膨胀成连续场"]
B --> C["中心线点 token 化<br/>FPS 查询 + 注意力编码"]
C --> D["定长紧凑 token 空间<br/>512 x 4,无量化码本"]
D --> E["解码回离散图<br/>阈值、骨架化、邻接"]
E --> F["重建图"]
D -->|EDM 扩散 / 条件流匹配| G["血管图生成与连接补全"]
关键设计¶
1. 中心线占据场:把离散图变成对采样密度不变的连续场
如果直接让网络吃节点坐标,同一根血管换个采样密度、换条边的细分方式就成了"另一张图",模型学到的东西会跟采样约定绑死。VesselTok 的做法是把每条边当作 \(\mathbb{R}^3\) 中的直线段、按固定伪半径 \(r>0\) 把它加粗,于是整张图变成一个连续的占据场 \(\phi_r\):空间中任一点 \(p\) 的值只取决于它到最近边的距离,若该距离不超过 \(r\) 就记为占据。
其中 \(\alpha_{ij}(p)\) 是点 \(p\) 在边 \((i,j)\) 上的投影参数、并被截断在 \([0,1]\),保证最近点落在线段而不是延长线上;第二项处理孤立节点与边界节点。这样一来,网络的监督信号就与"这条边被切成几段、点采样在哪"无关了,同一张血管图无论怎么离散化,占据场几乎一致。
伪半径 \(r\) 是这一设计里唯一需要权衡的量:太小则场过于稀疏、网络学不动,太大则细分支和短连接被"糊"掉、破坏拓扑(消融见实验部分,\(r=0.016\) 被选为全局折中点)。这个写法还顺带解耦了一个长期约束:生成时不必事先知道图有多少节点,而 MIDI、Prabhakar 等人的原生图生成方法都必须先定节点数。
2. 中心线点 token 化:把查询预算花在拓扑上而不是管壁上
占据场解决了"用什么监督",接下来是"在哪里放查询"。表面点 tokenizer 对普通三维形状有效,用在管状网络上却低效:管壁面积随半径线性增长,一张 3,000 个中心线点的气道图能渲染出 64,000 个表面点,固定预算的交叉注意力会被冗余表面样本占满,而分支点、端点和分叉这些拓扑关键位置反而是少数派。VesselTok 因此完全放弃表面采样,直接在中心线点云 \(P\) 上工作,并且不做子采样——所有中心线点一次性参与编码。
编码器的构造是:用最远点采样(FPS)从 \(P\) 里挑出 \(L\) 个点当作初始查询 \(Q_{in}\),为整张图提供一个覆盖均匀的初始骨架;点云 \(P\) 与查询 \(Q_{in}\) 都过 Fourier 位置编码加线性层升到隐藏维度 \(d\);编码器第一层用查询对点云做交叉注意力,把点云上下文注入查询,随后若干层自注意力得到隐藏表示 \(H\in\mathbb{R}^{l\times d}\),最后两个线性层输出均值与方差 \(Z_\mu,Z_\sigma\in\mathbb{R}^{l\times c}\)。这里的关键差别不是"用了注意力"(大家都在用),而是注意力的键值来自中心线而不是表面:同样的 \(l\) 个 token,每个都对应结构上的一个语义位置,而不是管壁上一块可以随便挪的曲面。
3. 定长紧凑 token 空间:连续 VAE 隐变量而非量化码本
要让 token 真的能当生成接口,隐空间必须"短"且"稳"。VesselTok 用的是 VAE 式的连续隐变量(重参数化采样自 \(\mathcal{N}(Z_\mu,\mathrm{diag}(Z_\sigma))\)),而不是 VQ 式的离散码本——这一点与专门做血管的 VesselGPT 形成直接对比。连续隐变量的好处是解码器可以直接对任意实值 token 求梯度、扩散模型也能在连续空间里做去噪,不必处理码本坍缩和量化误差;代价是没有"词表"带来的显式压缩上限,所以 token 数与通道数是显式设计出来的。
压缩程度用平均压缩比 \(\kappa\) 来量化:对 \(M\) 个样本、每个样本 \(N_i\) 个节点(每节点 3 个坐标),
其中 \(K\) 是每张图的 token 数、\(C\) 是每个 token 的通道维。论文最终取 \(K=512\)、\(C=4\),即一张图只占 2,048 个浮点数、在 ATM 上平均压缩比约 7。定长序列(512 token)是这套设计能接生成模型的前提:与之相比,图 tokenizer 类方法(VQGraph、OpenGraph 等)虽也做 token 化,但隐表示保持原始节点数,做大规模图生成时算力上不可行。消融实验表明 \(K\) 与 \(C\) 都不是越大越好(见实验部分),512×4 是保真度与压缩比的折中点。
4. 解码回离散图:阈值、骨架化、邻域连接
只有占据场是不能用的——下游要的是中心线图。解码器先用若干自注意力层处理隐变量,再从三维网格采查询点 \(Q_{out}\)、过 Fourier 位置编码与线性投影,最后用交叉注意力预测这些点上的占据值 \(\tilde{\phi}_\theta\)。推理时在规则网格上评估这个场,用一个介于 0 与 1 之间的阈值 \(\tau\) 二值化得到离散占据体,再用三维骨架细化算法提取骨架点 \(\hat{V}\),最后按确定性的邻域连通规则连边得到 \(\hat{E}\),输出对拓扑友好的离散图 \(\hat{G}\)。
这一设计被刻意做成模块化的一步:论文对所有对比方法都用同一套图提取流程,保证比较的是占据场的质量而不是后处理技巧;如果以后有更鲁棒的图提取方法(例如 Voreen 那类基于分割的工具),可以直接替换而不改动前面任何部分。模型的容量也因此完全押在"场预测得准不准"上——这也是后面 Betti 误差分析值得细看的原因。
一个完整示例¶
拿 ATM 气道数据集里一张约 3,000 个中心线点的图走一遍:先把每条边按 \(r=0.016\) 加粗成占据场,中心线点云 \(P\)(约 3,000 个点)全部保留;FPS 从中选出 512 个初始查询 \(Q_{in}\),与 \(P\) 一起做 Fourier 编码后进入编码器,第一层交叉注意力把点云信息取到查询上,之后几层自注意力细化,最后两个线性层输出 \(512\times 4\) 的 \(Z_\mu\) 与 \(Z_\sigma\);重参数化采样得到 token \(Z\)(2048 个数,相对原始 \(3\times 3000\) 个坐标平均压缩约 7 倍)。解码阶段在 512³ 网格上采查询点、交叉注意力预测占据值,阈值化后骨架化得到中心线点,再按邻域连通补边,得到重建图 \(\hat{G}\)——这张图在 ATM 上拿到 clDice 96.61、Chamfer 距离 0.005、\(|\Delta\beta_1|\) 8.97。若换到生成任务,这串 512 token 直接喂给 EDM 扩散模型;若做连接补全,则把缺了约 40% 边的图编码成 token 当作条件、用条件流匹配把 token 去噪到完整图那一侧。
损失函数 / 训练策略¶
训练目标是重建损失加隐空间正则,重建项在查询点上算预测占据与参考占据的二值交叉熵,正则项是隐变量分布对标准正态的 KL 散度:
由于占据场在整个域里极其稀疏,查询点若纯随机采样会几乎全是背景,因此沿用 3DShape2VecSet 的失衡感知查询选择策略,重点采在物体边界附近。关键超参:伪半径 \(r=0.016\)(全局统一,不按数据集调)、token 数 \(K=512\)、通道数 \(C=4\)。生成阶段另外训练扩散模型:在 token 空间用 EDM 骨干,条件版本以解剖类别为条件,超参与 3DShape2VecSet 对齐;连接补全任务则改用 Diffusion Transformer 加条件流匹配目标。
实验关键数据¶
数据集覆盖三类解剖:气道(ATM、AIIB、AeroPath)、脑血管(COSTA)、肺血管(HiPas、PARSE、Pulmonary-AV),图统一由分割掩膜经 Voreen 图提取工具得到,保持原始中心线几何、不做会扰动结构的后处理;分布外验证用 TopCoW(Willis 环)和肾血管(RV)。重建指标除了 clDice(中心线重叠,强调连通性)和 Chamfer 距离(CD,几何偏差),还用 Betti 数差 \(|\Delta\beta_0|\)(连通分量)与 \(|\Delta\beta_1|\)(环/回路)衡量拓扑是否被保真,指标在 512³ 网格上按伪半径 \(r\) 渲染成占据场后计算。
主实验¶
下表是重建任务在六个测试解剖上的主结果(clDice 越高越好,CD 越低越好):
| 数据集 | 方法 | clDice ↑ | CD ↓ |
|---|---|---|---|
| ATM | Hunyuan3D 2.0 / 3DShape2VecSet / VesselTok | 86.75 / 90.08 / 96.33 | 4.08 / 2.14 / 0.96 |
| AIIB | Hunyuan3D 2.0 / 3DShape2VecSet / VesselTok | 85.13 / 87.22 / 94.85 | 2.90 / 2.74 / 0.66 |
| COSTA | Hunyuan3D 2.0 / 3DShape2VecSet / VesselTok | 56.53 / 59.65 / 77.26 | 4.28 / 2.29 / 1.64 |
| HiPas | Hunyuan3D 2.0 / 3DShape2VecSet / VesselTok | 52.58 / 55.58 / 67.59 | 3.95 / 2.92 / 1.82 |
| PARSE | Hunyuan3D 2.0 / 3DShape2VecSet / VesselTok | 42.64 / 42.44 / 57.03 | 3.42 / 3.19 / 0.69 |
| Pulmonary-AV | Hunyuan3D 2.0 / 3DShape2VecSet / VesselTok | 79.46 / 86.40 / 94.30 | 6.99 / 1.59 / 0.74 |
拓扑误差方面,VesselTok 在有环结构上优势最明显:COSTA 的 \(|\Delta\beta_0|\) 从 70.85 / 79.15 降到 26.81,\(|\Delta\beta_1|\) 从 54.35 / 56.19 降到 26.83;\(|\Delta\beta_0|\) 在 ATM(4.91 vs 7.28/7.46)、AIIB(4.47 vs 8.40/8.60)、PARSE(128.06 vs 155.06/159.06)上也一致更低。\(|\Delta\beta_1|\) 并非全面最优——AIIB 上与 Hunyuan 打平(11.00,略差于 3DShape2VecSet 的 10.85),HiPas(38.42)反而高于两个基线,说明回路保持在这类致密肺血管上仍是弱项。
血管专用基线只在气道树 ATM 上可比(VesselGPT 是纯树方法,需先删掉分割噪声带来的伪环才能训练,VesselTok 不需要这种清洗):
| 方法 | clDice ↑ | CD ↓ | \(|\Delta\beta_0|\) ↓ | \(|\Delta\beta_1|\) ↓ | |------|----------|------|------|------| | VesselGPT | 77.09 | 0.008 | 0.05 | 10.28 | | Hunyuan3D 2.0 | 87.31 | 0.007 | 0.11 | 9.31 | | 3DShape2VecSet | 90.11 | 0.007 | 0.09 | 9.48 | | VesselTok | 96.61 | 0.005 | 0.07 | 8.97 |
⚠️ 该表的 CD 量级(0.005~0.008)与主表(0.66~6.99)不在同一尺度,两表不可直接横向比数;VesselVAE 因为训练不收敛未进入对比。
分布外泛化(训练时未见的解剖与尺度,肾血管超过 10 万节点、Willis 环平均不到 1,000 节点;大图用 150³ 网格空间分块推理):
| 数据集 | 方法 | clDice ↑ | CD ↓ | \(|\Delta\beta_0|\) ↓ | \(|\Delta\beta_1|\) ↓ | |--------|------|----------|------|------|------| | TopCoW(Willis 环) | 3DShape2VecSet / VesselTok | 97.96 / 99.42 | 0.001 / 0.002 | 0.06 / 0.07 | 0.14 / 0.04 | | RV(肾血管) | 3DShape2VecSet / VesselTok | 79.66 / 88.86 | 0.019 / 0.017 | 11.91 / 13.09 | 6.45 / 6.25 | | ATM(矢状面切割) | 3DShape2VecSet / VesselTok | 96.26 / 99.16 | 0.097 / 0.001 | 0.049 / 0.049 | 5.34 / 5.29 | | COSTA(矢状面切割) | 3DShape2VecSet / VesselTok | 82.65 / 95.44 | 0.123 / 0.125 | 0.85 / 0.24 | 5.20 / 3.49 |
带 * 的是把血管沿矢状面切开、人为制造解剖上不合理的拓扑断口后的合成集,用来探测模型对长程一致性的维持能力——VesselTok 在这两个集合上仍保持 99.16 / 95.44 的 clDice,说明它学到的不只是局部拟合。注意 RV 的 \(|\Delta\beta_0|\) 上 VesselTok(13.09)略逊于 3DShape2VecSet(11.91),原文也是以"competitive \(\beta_0\)"表述而非全面领先。
生成任务在 token 空间训练 EDM 扩散模型(每张图固定 512 token),条件版本以解剖类别为条件:
| 设置 | 方法 | FID ↓ | MMD-CD ↓ | MMD-EMD ↓ | MMD-\(\beta_0\) ↓ | MMD-\(\beta_1\) ↓ | COV-CD ↑ | COV-EMD ↑ |
|---|---|---|---|---|---|---|---|---|
| 条件 | 3DShape2VecSet / VesselTok | 73.58 / 43.13 | 1.92 / 0.25 | 0.18 / 0.14 | 24.07 / 7.25 | 6.82 / 1.01 | 0.44 / 0.48 | 0.50 / 0.53 |
| 无条件 | 3DShape2VecSet / VesselTok | 146.57 / 96.87 | 1.88 / 0.30 | 3.45 / 2.35 | 127.60 / 78.36 | 3.22 / 2.64 | 0.39 / 0.42 | 0.26 / 0.32 |
(MMD-CD、MMD-EMD 原文以 \(10^{-2}\) 为单位报告;FID 在 PointNet++ 编码器空间计算,该编码器被训练来预测中心线的解剖标签,比较的是训练集样本与 1,000 个生成样本的嵌入分布。)
逆问题(连接补全)在 ATM 上把约 40% 的边去掉,让模型推断缺失连接:
| 方法 | clDice ↑ | CD ↓ | \(|\Delta\beta_0|\) ↓ | \(|\Delta\beta_1|\) ↓ | |------|----------|------|------|------| | Autodecoder | 83.49 | 0.066 | 4.32 | 8.68 | | VesselTok | 88.13 | 0.043 | 3.19 | 8.58 |
消融实验¶
伪半径 \(r\) 直接决定占据场刻画拓扑的忠实程度,论文在 ATM 上用 0.008 / 0.016 / 0.032 三档训练编码器:\(r\) 越大越好学、重建越准(clDice loss ≈0.007)但细拓扑被抹掉(每样本 \(|\Delta\beta_1|\) 误差 ≈16),\(r\) 越小拓扑保得越好(\(|\Delta\beta_1|\) ≈4)但重建明显变差(clDice loss ≈0.28),最终取 \(r=0.016\) 作为全局统一值。
token 数与通道维的压缩-保真权衡(在 ATM 上从头训练 VAE):
| 配置 | clDice ↑ | CD ↓ | \(|\Delta\beta_0|\) ↓ | \(|\Delta\beta_1|\) ↓ | 压缩比 κ ↑ | |------|----------|------|------|------|------| | \(K=768,\ C=4\) | 97.13 | 0.005 | 0.07 | 8.93 | 4.68 | | \(K=512,\ C=4\) | 96.61 | 0.005 | 0.07 | 8.97 | 7.03 | | \(K=256,\ C=4\) | 80.35 | 0.006 | 25.61 | 10.02 | 14.06 | | \(K=128,\ C=4\) | 12.29 | 0.114 | 1.90 | 10.39 | 28.12 | | \(K=64,\ C=4\) | 8.42 | 0.116 | 2.52 | 10.27 | 56.24 | | \(K=512,\ C=16\) | 96.32 | 0.004 | 0.06 | 8.52 | 1.76 | | \(K=512,\ C=8\) | 95.95 | 0.004 | 0.06 | 8.80 | 3.51 | | \(K=512,\ C=2\) | 7.08 | 0.058 | 1.68 | 10.36 | 14.06 |
关键发现¶
- 重建上中心线 token 化的收益是全面且稳定的:六个数据集上 clDice 与 CD 全部优于两个强基线,环路最复杂的 COSTA 上 \(|\Delta\beta_1|\) 从 54~56 直接减半到 26.83——这正好对应"高表面积比结构上表面采样浪费预算"的动机:环越多、分支越密,中心线表示相对表面表示的优势越大。
- token 数存在悬崖而非平滑退化:\(K\) 从 768 降到 512 几乎无损(clDice 97.13→96.61),降到 256 掉到 80.35,128 及以下直接崩到 12 附近(CD 也从 0.005 跳到 0.114)。通道维同理,\(C=4\) 与 \(C=8\) 只差 0.6 个点,\(C=2\) 直接失效(clDice 7.08)。512×4 落在悬崖之前,这也是论文敢把 token 压到 2,048 个浮点数的依据。
- 伪半径把"重建好"和"拓扑对"变成一对显式可调的矛盾:\(r\) 增大时 clDice loss 从 0.28 降到 0.007,\(|\Delta\beta_1|\) 误差却从 4 涨到 16。换句话说,拓扑错误很大程度上是"场太胖把细连接糊住了"造成的,这提示后续可以按尺度自适应地选 \(r\),而不是全局一个值。
- 泛化能力来自表示而非规模:模型只在气道、全脑血管、肺树上训练(2,500~10,000 节点),却在不到 1,000 节点的 Willis 环上拿到 99.42 clDice、在超过 10 万节点的肾血管上拿到 88.86,且矢状面切割这种解剖上不合理的编辑下仍有 95+ 的 clDice。
- 性能瓶颈是拓扑复杂度而不是图大小:作者按节点数把样本分成 ≤5.5K 与 >5.5K 两组,ATM 的 clDice 只从 98.90 掉到 91.43,而拓扑更复杂的 COSTA 从 89.19 掉到 75.20。这条分析也解释了为什么 PARSE、HiPas 这类致密肺血管的绝对指标偏低(clDice 57.03 / 67.59)。
- token 空间确实"语义化"到能生成:条件生成 FID 从 73.58 降到 43.13(几乎腰斩),MMD-\(\beta_1\) 从 6.82 降到 1.01,说明生成样本在连通分量与回路分布上都更贴近真实解剖,而不只是点云几何更像。
亮点与洞察¶
- "先膨胀成场、再只在中心线上取 token"是一组互相成全的设计:占据场让监督信号与采样密度解耦,中心线点又让查询预算落在拓扑上。这两点单独看都不新鲜,但合起来才同时解决"表示对采样不变"和"预算花在刀刃上"两个问题,是很干净的问题重述。
- 把半径从建模目标里摘出去:作者没有去拟合半径,而是用固定伪半径 + 声明半径可由中心线回归得到来论证这一步的合理性。这让模型不必处理宽半径分布带来的尺度失衡,也顺带摆脱了"生成前必须先定节点数"的约束——代价是生成结果没有半径信息,这是一笔明码标价的交易。
- 用连续 VAE 隐变量而不是 VQ 码本是个反直觉但合理的选择:血管 token 这条路线上 VesselGPT 用的是离散码本,而 VesselTok 选择连续隐变量,换来的是扩散/流匹配可以直接在 token 上做、没有码本坍缩风险;用 512 定长 token 替代原生节点数,才使大规模图生成在算力上可行。
- 指标选择本身值得借鉴:只用 Betti 数会漏掉空间覆盖,只用 clDice/CD 又看不出拓扑对不对,所以论文把两者并列,还额外在生成任务上算了 Betti 摘要的 MMD 与 Coverage——这套"几何 + 拓扑"的双轨评估可以直接迁移到其他曲线状结构的生成评测上。
- 可迁移的思路:任何"高表面积比曲线结构"(神经元形态、角膜神经纤维、血管化的肿瘤类器官、道路/河道网络)都可以套用"中心线 + 伪半径占据场"的 token 化配方,把体素级的高分辨率问题压缩到几百个 token 上再做生成或补全。
局限与展望¶
- 作者承认的局限是固定容量隐表示的固有问题:输入越复杂性能越掉。他们的分层分析显示瓶颈在拓扑复杂度(COSTA 上 clDice 从 89.19 掉到 75.20)而非单纯节点数(ATM 只从 98.90 掉到 91.43),但没有给出解决拓扑复杂度的方案。
- 伪半径是全局单一超参(\(r=0.016\)),而消融显示它同时拉扯重建与拓扑;对半径尺度跨数据集差异很大的场景(如小鼠脑微血管 vs 人体主动脉),单一 \(r\) 很可能不是最优,自适应或多尺度 \(r\) 是直接可做的改进。
- 半径信息在整条管线里被丢弃:训练用伪半径,评估渲染也用伪半径,生成与补全的结果因此不含真实管径。对需要半径的血流模拟、狭窄定量等下游任务,还需要额外回归半径,论文只在附录里论证了"半径可从中心线回归"这一前提,没有端到端验证。
- 重建的拓扑误差依然可观(COSTA \(|\Delta\beta_1|\) 26.83、PARSE 128.06 级别的 \(|\Delta\beta_0|\)),而且部分来自确定性的骨架化 + 邻域连接后处理;更换更鲁棒的图提取方法能否系统性降低 Betti 误差,论文没有做这个消融。
- 大图泛化依赖 150³ 网格的空间分块推理,分块边界是否引入伪连接或切断长程分支没有被讨论,而这恰恰是"长程一致性"最脆弱的环节。
- 生成评估的 FID 建立在一个用解剖标签训练的 PointNet++ 编码器上,标签体系与训练覆盖面会直接影响分数,跨方法比较虽公平但绝对值的可解释性有限。
相关工作与启发¶
- vs 3DShape2VecSet / Hunyuan3D 2.0:两者都是面向通用三维形状的表面点 tokenizer(前者用查询向量集合做神经场与扩散建模,后者在形状编码中加入查询点采样改进),VesselTok 与它们共享 Transformer 编解码骨架,但把采样面从表面换到中心线,并在同一套图提取流程下比较。优势是管状结构上的重建与生成指标全面更好;代价是这套设计对"有明确中心线"的结构才成立。
- vs VesselGPT:VesselGPT 用 VQ-VAE 给血管建离散码本、把结构压成短 token 序列,思路最接近,但只支持血管树、训练前必须删除伪环,且在 ATM 上重建指标(clDice 77.09)远低于 VesselTok(96.61)。差别在于离散码本 + 树假设,而 VesselTok 用连续隐变量 + 连续占据场,天然容纳非树连通。
- vs VesselVAE:递归式 VAE 把血管树映射到紧凑隐向量,在本文的设定下训练不收敛,未能进入对比。
- vs 原生图生成方法(Prabhakar 等的点云空间扩散、MIDI 等):这些方法能处理分支与环,但在未压缩空间工作、且生成前必须先定节点数;本文的贡献恰恰是把这类生成搬到压缩 token 空间上,使其在万级节点规模可行。
- vs 通用图 tokenizer(VQGraph、图量化 tokenizer、OpenGraph 等):它们关注语义丰富的节点/子图级 token 以服务下游分析,隐表示保持原始节点数,因此做大规模生成时算力上不可行;VesselTok 明确优先压缩,这也是它能在 token 空间直接训扩散的原因。
- vs 层次化/部件式血管生成(Batten 等、Chen 等的 part-based 模型):那类方法先采样树拓扑再生成段级几何,本质上受限于树结构与较小几何;VesselTok 面向任意连通(含环)的大规模网络。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把"中心线 + 伪半径占据场"作为 token 化对象是对表面点 tokenizer 的一次有据可依的重述,而非全新机制,但问题重述得干净、动机有数据支撑。
- 实验充分度: ⭐⭐⭐⭐⭐ 六个数据集 + 分布外 + 合成扰动 + 生成 + 逆问题,指标同时覆盖几何与拓扑,且对基线与后处理做了公平控制。
- 写作质量: ⭐⭐⭐⭐ 动机链条(表面积比 → 查询预算 → 中心线)讲得很清楚,消融也紧扣设计选择;但部分表格数值量纲不一致、个别结论表述偏乐观。
- 价值: ⭐⭐⭐⭐ 为血管/气道这类管状网络提供了一个可复用的 token 接口,接生成与补全都很顺,局限是半径被排除在外、拓扑误差在大图上仍偏高。