iMED: A Multi-Endoscope Dataset for Surgical 3D Perception¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/surgical-vision/imed
领域: 医学图像
关键词: 手术三维感知 / 多内窥镜数据集 / 新视角合成 / 机器人辅助微创手术 / 几何泛化
一句话总结¶
针对微创手术视觉基准普遍局限于单相机狭窄前向轨迹、无法区分真实三维几何与局部光度插值的根本缺陷,iMED 构建了首个双独立立体内窥镜硬件同步手术数据集(340 条序列、约 17 万时间步),并提出“一镜训练、另一镜测试”的跨轨迹评测协议,对 23 种 SOTA 算法的基准测试揭示出纯光度驱动方法在独立视角下的崩溃以及通用大模型向手术场景的优异迁移能力。
研究背景与动机¶
非刚性场景伴随强受限相机运动是基于图像的三维感知任务(包括相机位姿估计、特征匹配、光流、深度估计及新视角合成 NVS)中极具挑战性的极端工况。在机器人辅助微创手术(RAMIS)中,这种挑战被推向了极致:内窥镜探头只能经由人体微小切口(套管穿刺针)伸入体腔内部,视野高度狭窄且只能沿狭长前向路径移动;与此同时,体腔内组织处于呼吸跳动、器械接触与变形挤压等全场非刚性动态变化中,伴随强烈的高光反光、烟雾、出血及拓扑撕裂。长久以来,学术界评估三维重建与渲染模型广泛依赖 PSNR 与 SSIM 等光度保真度指标。然而,这些指标仅仅是重建质量的近似代理,当训练视角与测试视角均密集采样于同一条单向连续轨迹时,极高的新视角合成指标往往掩盖了模型依靠局部连续性“死记硬背”和光度插值的事实,根本无法证实模型是否真正学到了底层一致的物理三维几何。
在通用计算机视觉与动态人体捕获领域,评测几何泛化的通用金标准是多相机阵列系统——利用多台相机环绕拍摄,通过在一组固定相机上训练、并在独立架设的留出视角(Held-out Views)上测试来直接测量空间几何泛化能力。然而,受限于手术人体腹腔解剖空间的严苛生理限制和手术机器人硬件约束,在真实或模拟手术场景中布设多台独立同步内窥镜存在极高的工程壁垒。现有的手术视觉数据集(如 SCARED、SERV-CT、STIR、StereoMIS 等)无一例外均采用单个立体内窥镜进行单轨迹推移采集,导致全行业长期缺乏可用于跨轨迹几何验证的基准数据集与评估协议。
面对手术三维视觉中光度插值假象与真实几何泛化评估脱节的核心困境,本文的核心 idea 是搭建双独立立体内窥镜硬件同步采集平台并设计微型高精度标定物,构建首个涵盖离体、尸体与活体多解剖场景的手术多视数据集 iMED,开创“一镜训练、另一镜测试”的跨外极线视角评测协议以真正检验三维几何泛化能力。
方法详解¶
整体框架¶
iMED 系统的完整流程涵盖硬件平台搭建与双立体内窥镜多路数据采集、基于定制微型 ArUco 标定立方体的时空几何标定与五阶段位姿解算、建立严格隔离的跨内窥镜基准评测协议,以及多任务三维感知算法的大规模横向基准评测。整个系统由硬件采集端出发,通过精密标定建立相机间的刚体空间变换与亚毫米级参考轨迹,进而支撑下游不同任务在物理隔离视角下的泛化检验。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["双立体内窥镜硬件同步采集<br/>四路 HDMI 视频流 (60 FPS)"] --> B["双立体内窥镜同步采集平台<br/>涵盖离体/尸体/活体多解剖部位"]
B --> C["定制 ArUco 标定物与五阶段几何位姿解算<br/>PnP求解 + 极线立体融合 + 滤波与不确定度量化"]
C --> D["跨内窥镜泛化评测协议<br/>Endoscope 2训练 / Endoscope 1测试"]
D --> E["多任务三维感知基准测试<br/>评测 NVS / 位姿估计 / 深度估计等 23 种方法"]
关键设计¶
1. 双立体内窥镜同步采集平台:大基线多视角硬件与解剖场景覆盖
针对传统手术数据集仅有单内窥镜单条狭窄轨迹导致视角多样性匮乏的问题,本文在临床级实验室环境下构建了双立体内窥镜同步采集平台。系统采用商业手术机器人系统,配备三套 8mm 0° 和四套 8mm 30° 高清立体内窥镜。在硬件布局上,将固定于患者台无源关节臂上的内窥镜命名为 Endoscope 1(在采集过程中保持静止),将安装在手术机器人从动臂上、具备主动光源照明的移动内窥镜命名为 Endoscope 2。为了保证真实微创手术代表性的光照分布,仅开启 Endoscope 2 的内置照明光源,并通过全序列统计量进行光度归一化以抑制两镜间的曝光差异。两台硬件同步的立体内窥镜共输出 4 路 HDMI 高清视频流(60 FPS),两镜平均物理间距达 \(2.6 \pm 1.2\text{ cm}\),光轴夹角达 \(18.7^\circ \pm 10.0^\circ\)。这一镜间基线显著超越了单镜头内部仅 4mm 的微弱双目视差,达到了微创腹腔手术典型视野尺度(6–13 cm)的 20%–50%,在真实人体与动物组织上构成了真正意义上的大基线立体环绕视场。数据集中包括 10 个离体器官样本(鸡、猪、牛组织,各约 7 条序列)、3 例人体遗体解剖目标(每例约 6 个解剖部位,各部位约 7 条序列)以及 1 例活体家猪实验(涵盖 10 个解剖区域),累计录得 340 条序列、约 17 万对四目同步时刻帧,时间步同步误差均值仅为 \(3.36\text{ ms}\)(标准差 \(3.90\text{ ms}\)),远远小于单帧曝光持续时间(约 \(17\text{ ms}\))。
2. 定制 ArUco 标定物与五阶段几何位姿解算:亚毫米级参考位姿重建
微创手术穿刺套管(Trocar)口径通常受限于 \(\le 12\text{ mm}\),常规大尺寸标定板完全无法送入体内,同时潮湿的手术体腔环境容易造成标定物反光与血液染色失效。为此,作者研发了边长仅为 8mm 的高对比度硬木质标定立方体,并在各面高精度激光雕刻 5.7mm 的 ArUco 标记(采用 ARUCO_MIP_36h12 字典)。标记物可通过手术钳灵活夹持与摆放,并依赖表面张力稳定贴附于湿润组织表面。为了从双镜观测中获得高精度的参考相机运动轨迹,构建了五阶段位姿解算流水线: - RANSAC 初始化与重投影微调:检测双目视野中共视的标记角点,通过 Perspective-n-Point(PnP)解算 6-DOF 位姿,利用 RANSAC 剔除误匹配假设后,采用 Levenberg-Marquardt 非线性优化算法联合最小化双向角点重投影误差; - 双目立体融合(Stereo Fusion):内窥镜本身自带左右目立体成像,流水线独立解算“左镜-左镜”与“右镜-右镜”的空间相对变换矩阵,并在四元数空间中执行插值平均,从而获得闭环一致的全局相机外参; - 异常跳变过滤(Outlier Detection):依据外科医生操作腹腔镜器械的最大生理线速度(\(< 8.5\text{ cm/s}\),在 60 FPS 采样下对应单帧位移小于 0.14 cm),设置严格的物理动力学门限,自动过滤平移突变 \(> 0.7\text{ cm/帧}\) 或旋转突变 \(> 3.0^\circ/\text{帧}\) 的标记检测抖动; - 时序平滑(Temporal Smoothing):平移分量采用参数为 \(W = 15, p = 1\) 的 Savitzky-Golay 滤波器滤除机械高频微振动,旋转分量在四元数流形上进行符号连续性约束平滑,离群帧则通过线性插值与球面线性插值(SLERP)补全; - 不确定性量化(Uncertainty Quantification):通过比对左右目独立求解轨迹之间的几何残差,显式输出各时刻平移(米)与旋转(度)的方差度量。在 5cm 典型手术工作距离下,该流程在活体实验中达到了惊人的 0.58 mm 物理测量精度(重投影误差仅 11.87 px)。
3. 跨内窥镜泛化评测协议:打破狭窄轨迹过拟合的真实几何鲁棒性验证
传统的神经辐射场与动态三维重建评估中,通常从单条前向视频轨迹中每隔几帧挑出一帧作为测试集。由于相邻时刻相机位姿位移极小,模型仅凭局部神经网络插值即可在 PSNR 和 SSIM 上获得极高分数,但这与外科临床导航真正关心的多视角解剖结构保真度完全脱节。本文正式提出“在移动的 Endoscope 2 上训练、在物理独立的留出视角 Endoscope 1 上测试”的新范式。由于 Endoscope 1 与 Endoscope 2 拥有不同的物理穿刺点、高达约 18.7° 的视角转向差以及非共线的成像射线集合,任何依靠局部高频辐射插值或视角依赖反射假象欺骗指标的模型都将在留出视角下彻底暴露几何畸变。该协议消除了轨迹重叠,成为手术视觉领域首个能够严格解耦“光度插值拟合”与“底层空间几何泛化”的评估基准。
4. 多任务三维感知基准测试:显式几何先验与通用基础模型的迁移优势
基于 iMED 构建的丰富临床场景与跨视角评测体系,团队横跨四项核心 3D 感知任务系统评测了 23 种 SOTA 算法,涵盖刚性 NVS、非刚性可形变 NVS、特征匹配与相对位姿解算、以及单目深度估计。评测重点分析了不同结构先验对跨视角几何外推的影响机制。实验发现,对于隐式表征 NeRF,引入单目深度图监督反而诱发了严重的半透明“幽灵体”伪影,导致从训练视角过渡到测试视角时 SSIM 呈现非单调震荡衰减;而对于显式表征 3DGS,深度监督则有效约束了空间高斯分布。在可形变动态重建任务中,缺乏显式几何正则化的纯光度驱动方法(如 D-3DGS)在新视角下全面崩溃(PSNR 仅 14.50 dB);唯有如 DynOmo 引入局部刚性、等距变换与基于基础特征聚类的密集 3D 正则化约束后,方能实现跨视角高质量渲染(PSNR 提升至 25.29 dB)。与此同时,在特征匹配与单目深度任务中,未经过手术领域微调的跨领域通用基础模型(如 RoMa、MASt3R、UniDepth-V2、MoGe-V2)在精度与鲁棒性上全线战胜了专门在手术内窥镜数据上训练的领域小模型,揭示出通用大模型在微创感知领域深厚且尚未被充分释放的几何先验潜力。
实验关键数据¶
主实验¶
iMED 在相同测试环境下对刚性与非刚性新视角合成(NVS)、特征匹配与位姿解算、以及单目深度估计进行了详尽对比。下表汇总了跨内窥镜协议(Endoscope 2 训练,Endoscope 1 留出测试)下核心新视角合成算法与单目深度估计算法的关键性能指标。
| 任务类别 | 算法与监督配置 | PSNR (dB)↑ | SSIM↑ | 渲染速度 (FPS)↑ | 训练速度 (FPS)↑ |
|---|---|---|---|---|---|
| 刚性 NVS | NeRF (无深度先验) | 17.24 | 0.65 | 0.11 | 0.21 |
| 刚性 NVS | NeRF + Depth Anything 先验 | 16.29 | 0.55 | 0.11 | 0.19 |
| 刚性 NVS | NeRF + FoundationStereo 先验 | 15.93 | 0.55 | 0.11 | 0.18 |
| 刚性 NVS | 3DGS (无深度先验) | 14.82 | 0.59 | 487.62 | 0.59 |
| 刚性 NVS | 3DGS + Depth Anything 先验 | 14.77 | 0.63 | 509.99 | 0.36 |
| 刚性 NVS | 3DGS + FoundationStereo 先验 | 15.33 | 0.63 | 497.43 | 0.31 |
| 动态可形变 NVS | 4DGS (Yang 等人) | 13.74 | 0.57 | 578.46 | 0.38 |
| 动态可形变 NVS | D-3DGS (纯光度损失) | 14.50 | 0.51 | 31.41 | 0.14 |
| 动态可形变 NVS | 4DGS (Wu 等人) | 15.65 | 0.33 | 38.99 | 0.76 |
| 动态可形变 NVS | Endo-4DGS + Depth Anything | 16.26 | 0.59 | 309.37 | 0.66 |
| 在线动态 NVS | Hayoz 等人 + RAFT 深度先验 | 15.66 | 0.40 | 224.15 | 0.15 |
| 在线动态 NVS | Hayoz 等人 + FoundationStereo | 15.92 | 0.40 | 229.39 | 0.14 |
| 在线动态 NVS | DynOmo + Depth Anything | 24.16 | 0.87 | 65.18 | 0.07 |
| 在线动态 NVS | DynOmo + FoundationStereo | 25.29 | 0.90 | 63.58 | 0.06 |
下表展示了单目深度估计算法在 30 条校准测试序列上与高质量立体双目参考真实值(超过 \(6 \times 10^8\) 个有效像素)对比的主实验结果。
| 模型 | 中值缩放 (Median Scaled) | Abs Rel↓ | RMSE↓ | RMSElog↓ | \(\delta_1 (< 1.25)\uparrow\) | \(\delta_2 (< 1.25^2)\uparrow\) |
|---|---|---|---|---|---|---|
| UniDepth-V2 (通用大模型) | 是 | 0.081 | 0.012 | 0.111 | 0.936 | 0.992 |
| MoGe-V2 (通用大模型) | 是 | 0.109 | 0.014 | 0.140 | 0.889 | 0.989 |
| EndoDAC (手术领域微调) | 是 | 0.119 | 0.017 | 0.164 | 0.854 | 0.968 |
| Endo3R (纯手术数据训练) | 是 | 0.187 | 0.023 | 0.236 | 0.704 | 0.927 |
| UniDepth-V2 (度量尺度直出) | 否 | 11.573 | 1.098 | 2.465 | 0.000 | 0.000 |
| MoGe-V2 (度量尺度直出) | 否 | 14.556 | 1.329 | 2.683 | 0.000 | 0.000 |
消融实验¶
针对特征匹配与位姿解算任务,下表汇报了在 30 条校准双目手术序列下的绝对旋转误差、内点率及平均内点数,以及在 23 条仅组织变形而相机静止的序列上测算的时序漂移误差(反映连续跟踪稳定性)。
| 方法体系 | 匹配算法 | 旋转误差 (°)↓ | 时序漂移 (°)↓ | 内点率 (%)↑ | 平均匹配内点数↑ |
|---|---|---|---|---|---|
| 密集匹配基石大模型 | RoMa | 1.79 ± 1.41 | 1.41 | 78.1 | 3905 |
| 密集匹配基石大模型 | MASt3R | 1.81 ± 1.38 | 1.38 | 70.3 | 1676 |
| 学习型稀疏匹配 | GIM + LightGlue | 1.87 ± 1.48 | 0.41 | 43.1 | 264 |
| 学习型稀疏匹配 | ALIKE + LightGlue | 1.91 ± 1.52 | 0.64 | 68.2 | 211 |
| 无检测器密集匹配 | LoFTR | 1.91 ± 1.40 | 0.43 | 47.2 | 513 |
| 学习型稀疏匹配 | DISK + LightGlue | 1.93 ± 1.52 | 0.59 | 55.2 | 446 |
| 轻量加速特征 | XFeat | 2.13 ± 1.47 | 0.77 | 25.9 | 854 |
| 经典自监督点特征 | SuperPoint + LightGlue | 2.15 ± 1.41 | 0.70 | 34.2 | 74 |
| 手术专用多域匹配 | EndoMatcher | 3.40 ± 1.91 | 2.11 | 39.9 | 1255 |
| 传统手工算子 | SIFT | 4.04 ± 14.45 | 5.44 | 52.9 | 91 |
此外,针对位姿解算流水线各阶段的标定精度检验(Table 3),在离体标定、尸体解剖和活体手术场景下的重投影误差分别为 38.33 px、17.00 px 和 11.87 px;在 5cm 典型手术工作距离下的物理精度误差分别达到 1.88 mm、0.83 mm 以及 0.58 mm,充分验证了五阶段多目位姿求解流水线在复杂动态组织背景下的几何可靠性。
关键发现¶
- 纯光度驱动可形变三维高斯的严重视角坍塌:在单轨迹前向基准中表现尚可的 D-3DGS,在独立留出测试视角下的 PSNR 骤降至 14.50 dB,SSIM 仅为 0.51。其原因在于未受几何约束的高斯基元肆意变形去拟合训练轨迹的光度像素,并未重建出合理的组织三维形貌。
- 显式 3D 正则化在几何保真与实时性间的尖锐冲突:DynOmo 凭借密集的局部刚性、长期距离等距保持与大模型特征聚合,将跨视角 PSNR 提升至 25.29 dB,但也付出了巨大的计算代价——其训练速度仅为 0.06 FPS(单帧需耗时 16 秒),比 Endo-4DGS(0.66 FPS,单帧 1.5 秒)慢了整整一个数量级,揭示出实时高保真手术可形变 SLAM 仍有巨大的算法优化空间。
- 通用大模型展现出惊人的跨域零样本迁移性能:在大规模自然图像与视频上预训练的基础模型(UniDepth-V2、MoGe-V2、RoMa、MASt3R)在零样本应用于内窥镜复杂体腔时,全线压制了采用手术数据专门调优或纯手术数据训练的 Endo3R、EndoDAC 和 EndoMatcher。但同时,所谓“绝对度量深度模型”在无中值缩放时误差飙升(Abs Rel \(> 11\)),说明基础模型具备优异的相对几何拓扑理解能力,但绝对物理尺度的精准锚定在手术场景中依然不可或缺。
- 特征匹配中的精度与时序平滑度权衡:RoMa 与 MASt3R 等密集大模型提供了高达数千个的高密度可靠内点(内点率 \(> 70\%\)),绝对旋转误差最优;而 GIM+LightGlue 则凭借时序视频传播训练带来的强一致性先验,取得了最低的时序漂移(0.41°),表现出更适合实时前端视觉里程计的时序稳定性。
亮点与洞察¶
- 切中手术 3D 视觉基准长期以来的核心痛点:过去十余年手术视觉数据集均被困在单内窥镜的“前向自拍”视角中,无法辨别算法是真正恢复了活体组织几何还是仅仅记住了视频纹理。iMED 首次通过硬件物理隔离视角确立了严格的几何泛化评测规范。
- 低成本、微型化的硬木 ArUco 立方体标定设计:巧妙利用激光雕刻木质材料克服腹腔高反光与液体染色问题,将尺寸控制在 8mm 以顺利进出套管穿刺口,并配合重投影误差非线性优化实现亚毫米级位姿精度。
- 打破了“医疗专用模型必然优于通用模型”的思维惯性:揭示了目前许多在狭窄手术数据集上“小样本微调”的做法可能破坏了大模型原本鲁棒的通用几何视觉表征,为后续医学专用基础模型的构建策略提供了重要反思。
局限与展望¶
- 离体序列采用徒手引导导致运动平滑度有限:在离体组织采集时,受限于两台机器人从臂的物理摆放限制,两台内窥镜采用非机械臂徒手握持引导,部分轨迹存在偶发微抖动。
- 动态位姿追踪仍需借助标定块辅助:在完全无标记的动态手术序列中,目前尚无法直接获取纯无源标记下的绝对方位真值,仍需部分依赖图像修复工具(如 DiffuEraser)在预处理阶段抹除画面中可见的 ArUco 标记。
- 解剖结构与病种多样性仍待扩充:尽管涵盖了 14 个样本与 17 万帧,但活体手术数据目前仅来自于 1 例猪模型,未来若能在多中心、更广泛的人体临床手术中部署该评测体系,将进一步提升基准的代表性。
相关工作与启发¶
- vs SCARED / SERV-CT / StereoMIS: 以往的手术三维基准要么是在死体/模型上利用结构光和 CT 扫描获得静态单轨迹真值,要么是活体但仅有单目/双目单内窥镜序列。iMED 首次提供了双独立物理内窥镜同步四视角流,开创了跨视角泛化测试基准。
- vs Panoptic Studio / Immersive Video: 通用多视角基准依赖数十甚至数百台环形相机阵列拍摄静态背景下的特定目标;而 iMED 在微创手术体腔极端物理受限空间内,在全场发生非刚性连续形变的前提下实现了多视几何追踪。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次建立手术多内窥镜跨轨迹立体基准,从根本上重构了手术三维感知的评估协议。
- 实验充分度: ⭐⭐⭐⭐⭐ 横跨 4 大任务全面测试 23 种 SOTA 算法,涵盖 14 个标本与 17 万对同步帧,数据翔实。
- 写作质量: ⭐⭐⭐⭐⭐ 问题阐述切中要害,硬件与几何标定细节完备,深入揭示了光度插值与真实几何的矛盾。
- 价值: ⭐⭐⭐⭐⭐ 为未来手术机器人 3D 场景重建、数字孪生与具身智能导航建立了具有里程碑意义的真实几何评测基准。