Rosetum3D: A Large-Scale 3D Vision Dataset from Preharvest Roses¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://huggingface.co/datasets/WaterMelon2333/Rosetum3D/tree/main
领域: 3D视觉
关键词: 3D视觉数据集、采前玫瑰定位、关键点检测、深度反投影、农业视觉
一句话总结¶
针对采前鲜花表型与采摘自动化缺乏三维空间基准的瓶颈,本文构建了包含 2.1 万张高分辨率 RGB-D 图像与 4.6 万株玫瑰的三维视觉数据集 Rosetum3D,提出植物学引导的 2D-to-3D 混合标注方案,并建立了涵盖目标检测、关键点定位与时序多帧三维空间定位的完整基准。
研究背景与动机¶
全球切花月季与商业玫瑰种植产业持续扩张,市场对花朵品质的评级标准涵盖花瓣数量、花冠形态、花茎长度及垂直挺拔度等多个几何维度。长期以来,这类形态指标高度依赖人工专家在采摘后逐一测量与分级,不仅耗时耗力,而且采后破坏性评估无法在生长过程中指导精准的水肥管理与适时采收。利用 3D 计算机视觉技术在采收前实现原位非接触式三维形态测量与空间定位,是实现精准农业和自动化采摘机器人的关键途径。然而,现有的花卉视觉数据集绝大多数局限于二维分类或目标检测,完全无法获取植株的三维坐标与茎秆空间曲线。
通用 3D 视觉数据集(如自动驾驶的 KITTI、nuScenes 或室内场景的 ScanNet、SUN RGB-D)的标注范式无法直接迁移至农业温室。温室种植中植株冠层极度茂密、枝叶交互遮挡严重,花瓣和细幼茎秆形态脆弱且易受扰动,加之日光透射与补光灯导致剧烈的光照波动,使得基于激光雷达或纯几何三维重建(如 SfM/MVS 与神经辐射场)在大规模密集植物场景下极易产生鬼影、空洞和网格拓扑断裂,无法直接在点云或网格上进行稳定可靠的三维语义标注。
本文的切入角度是:与其强行依赖易出错的大场景全局三维几何重建,不如将二维图像空间成熟的高精度关键点标注与经过严格标定的深度传感器测量几何结合起来。核心 idea:通过胸前穿戴式结构光 RGB-D 传感器沿温室产垄连续采集多视角序列,提出结合 5 个植物学生理关键点与 4 个空间插值辅助点的 2D-to-3D 深度反投影标注架构,构建起首个大规模采前玫瑰 3D 视觉基准,并进一步引入跨帧 Re-ID 约束实现时序一致的三维定位优化。
方法详解¶
整体框架¶
Rosetum3D 的构建与定位基线建立涵盖四大环节:温室连续动态数据采集与传感器标定、植物学生理引导的 2D-to-3D 标注与物理验证、农业多任务感知基准评测,以及基于时序一致性优化的 3D 空间定位框架。
整个数据与算法流程自顶向下运转:操作员佩戴胸戴式结构光双目相机沿垄平移采集连续 RGB-D 帧;标注员在 2D 彩色图像中标注实例检测框和 9 个骨干关键点,随后依据透视投影内参矩阵与同步深度图将二维关键点反投影至三维相机坐标系;在下游三维定位阶段,系统结合 2D 关键点推理器与单目深度估计模型预测单帧三维位置,并通过轻量级实例重识别模型建立前后帧关联,利用时间插值先验完成三维坐标的加权平滑修正。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["连续温室动态采集<br/>胸戴式 RGB-D (30Hz, 1280x800)"] --> B["结构光多视角采集与标定<br/>棋盘格内外参解算与深度对齐"]
B --> C["仿植物学 2D-to-3D 混合标注<br/>5个生理关键点 + 4个插值辅助点"]
C --> D["深度反投影物理验证<br/>实测刻度尺 MAE 验证 (0.14 cm)"]
D --> E["多任务农业视觉基准套件<br/>检测/姿态/深度/匹配/Re-ID 评测"]
E --> F["跨帧 Re-ID 与时序一致性优化<br/>跨帧关联与时间先验加权融合"]
F --> G["高精度 3D 玫瑰定位结果<br/>输出花冠与茎秆时序 3D 坐标"]
关键设计¶
1. 结构光多视角连续采集与标定:规避温室复杂光照与深度畸变 温室复杂的漫反射和直射阳光极易造成传统单目深度推断或主动红外散斑的信噪比劣化。本文选用奥比中光 Orbbec Gemini 335L/336L 立体视觉传感器,融合主动结构光与被动双目立体匹配技术,使其在强光及弱光交替的温室环境中依然能稳定捕获有效视差。采集设备通过胸前肩带固定于人体正前方,连接移动智能终端以 30 Hz 同步录制 1280×800 分辨率的彩色图与深度图。操作员以 0.3–0.5 m/s 的恒定步行速度沿玫瑰垄平行平移,保持与植株 0.8–1.2 m 的作业间距,相机略微向下俯视倾斜以同时覆盖顶部花蕾与靠近地表的根茎部。采集前后严格执行基于大平面标定棋盘格的多距离标定流程,获取彩色相机与深度相机的精确内参矩阵 \(\mathbf{K}\) 及双目外参旋转平移矩阵,为亚厘米级空间重建奠定硬件精度基础。
2. 仿植物学形态的 2D-to-3D 混合标注架构:解耦复杂遮挡与三维点云重建困难 针对密植作物在三维网格上无法精确标注的问题,设计了由粗到细的生物学生理拓扑标注方案。标注者首先框选整株玫瑰的 2D 目标边界框,继而依次标定 5 个具备关键农学评估意义的解剖学生理点: - 花冠几何质心(Corolla Center):标识花冠开度与视觉中心; - 萼片-花梗交界点(Sepal-Pedicel Junction):表征花托与花梗连接过渡处; - 花梗-主茎过渡点(Stem-Pedicel Transition):记录花茎粗细发生明显渐变的分界位置; - 地上部分中点(Median Point):指示植株地上部垂直维度的几何中心; - 出土根颈点(Soil-Emergence Point):主茎穿出土壤表面的基准位置。
由于花梗与主茎自然弯曲且存在较大间距,仅靠 5 个生理点难以精确刻画茎秆三维弯曲流形。系统在萼片交点与花梗过渡点之间增加 1 个中点,在花梗过渡点与中点之间增加 1 个中点,并在中点与根颈点之间引入三等分点(2 个附加点),共形成 9 关键点的骨架链。二维标注完成后,利用对齐的深度图 \(D(u, v)\) 与相机内参 \(\mathbf{K}\),通过透视逆投影映射公式计算关键点的三维空间坐标: $$ \mathbf{P}_{3D} = \mathbf{K}^{-1} \cdot \begin{bmatrix} u \ v \ 1 \end{bmatrix} \cdot D(u, v) $$ 针对采集期间视线被遮挡的关键点赋予不可见标签(invisible)并从误差统计中剥离。为严格验证该混合标注的反投影真实性,采集过程中在主茎平行侧布置毫米级刻度尺,选取 10 cm 刻度区间计算反投影欧氏距离,在 137 次抽样实测中取得了 0.14 cm 的平均绝对误差(MAE),证明了反投影方案在厘米级植物测量上的可靠性。
3. 多任务农业视觉基准套件:建立全流程采前感知评估体系 Rosetum3D 超越了单一检测或分割任务,构建了涵盖 6 大视知觉子任务的标准基准: 1. 2D 玫瑰目标检测:评测 Faster R-CNN、DETR、RT-DETR 及 YOLOv5 在复杂藤蔓背景下的召回与精度; 2. 2D 姿态估计:基于 MMPose 框架评测 Top-down(RTMPose、ViTPose)与 Bottom-up(YOLOXPose、DEKR+HRNet)两类架构在柔性细长分支上的关键点定位; 3. 单目深度估计:评估经典模型在零样本(Zero-shot,基于 NYU Depth V2 训练)与微调(Fine-tuned)模式下的泛化表现,涵盖 Depth Anything、BinsFormer、DepthFormer 等; 4. 局部特征匹配:构建 Rosetum3D-1800 基准子集,利用 COLMAP 生成伪真值评测 DeDoDe、DKM、RoMa 等在重复纹理与反光叶片上的匹配鲁棒性; 5. 实例重识别(Re-ID):对 1,923 个独立植株样本进行跨视角跨时间跨垄标注,评测 OSNet、TransReID、SOLIDER 等模型对细微生物个体差异的辨识度; 6. 3D 空间关键点定位:综合 2D 姿态与深度预测输出空间坐标。
4. 基于跨帧 Re-ID 与时间平滑约束的 3D 玫瑰定位优化:抑制单帧深度跳变与漂移 单帧预测往往因叶片边缘误检、反光或深度图边缘缺失(飞点噪声)导致三维点发生剧烈离群震荡。针对这一问题,本文提出跨帧关联的时间连续性融合机制。在连续滑动的 3 帧时序窗口(\(t-1, t, t+1\))中,首先采用预训练的 OSNet 模型对相邻帧内的玫瑰实例边界框进行特征提取并建立跨时间实例匹配;其次,利用前后两帧的空间坐标线性插值构造出当前帧的时间先验预测: $$ \mathbf{P}{\text{interp}}^t = \frac{1}{2} \left( \mathbf{P}} + \mathbf{P{t+1} \right) $$ 最后,根据当前帧 2D 关键点预测置信度计算观测权重 \(w_d = W_{\text{depth}} \cdot \text{conf}\),赋予时间平滑先验恒定权重 \(w_t = W_{\text{temp}}\),执行归一化加权几何融合: $$ \mathbf{P}_t^* = \frac{w_d \mathbf{P}_t + w_t \mathbf{P} $$ 该设计显著抑制了因单帧深度估计不准或关键点轻微漂移引起的三维空间阶跃误差。}}^t}{w_d + w_t
一个完整示例¶
以一株处于半开花期、存在部分叶片遮挡的玫瑰植株为例,系统执行时序三维定位的具体数值流如下: 1. 多视角检测与关键点打分:在第 \(t\) 帧中,YOLOv5 检测器定位出高置信度目标框,Top-down ViTPose 模型回归出花冠中心二维坐标 \((u_t, v_t) = (640.5, 312.4)\),输出置信度 \(\text{conf}_t = 0.92\); 2. 深度获取与反投影:利用微调后的 BinsFormer 提取深度,对应点预测深度为 \(D(u_t, v_t) = 0.985\text{ m}\)。利用标定内参反投影得单帧三维坐标 \(\mathbf{P}_t = [0.035, -0.120, 0.985]^T\text{ m}\); 3. 跨帧匹配与插值:OSNet 提取外观特征,在 \(t-1\) 帧与 \(t+1\) 帧成功关联到同一植株实例,反投影坐标分别为 \(\mathbf{P}_{t-1} = [0.065, -0.121, 0.978]^T\text{ m}\) 与 \(\mathbf{P}_{t+1} = [0.004, -0.119, 0.990]^T\text{ m}\)。线性插值生成的时间先验 \(\mathbf{P}_{\text{interp}}^t = [0.0345, -0.120, 0.984]^T\text{ m}\); 4. 加权时序更新:设置超参数 \(W_{\text{depth}}=1.0, W_{\text{temp}}=0.5\),计算权重 \(w_d = 0.92, w_t = 0.5\)。融合后得到滤波平滑坐标 \(\mathbf{P}_t^* = [0.0348, -0.120, 0.9846]^T\text{ m}\),有效修正了单帧深度脉冲波动。
实验关键数据¶
主实验¶
论文对农业场景下的二维检测、关键点估计、单目深度估计以及 3D 关键点定位展开了详尽的对比实验。
表 1:Rosetum3D 2D 目标检测基线结果 | 算法 | 主干网络 (Backbone) | \(\text{AP}\) | \(\text{AP}_{50}\) | \(\text{AP}_{75}\) | \(\text{AP}_M\) | \(\text{AP}_L\) | | :--- | :--- | :---: | :---: | :---: | :---: | :---: | | Faster R-CNN | ResNet50 | 31.0 | 66.8 | 24.7 | 13.1 | 32.1 | | DETR | ResNet50 | 33.0 | 66.5 | 28.8 | 14.2 | 34.3 | | RT-DETR | ResNet50 | 33.6 | 64.8 | 30.7 | 13.8 | 34.7 | | YOLOv5 | CSPDarkNet53 | 35.0 | 67.1 | 32.4 | 19.1 | 35.9 |
注:\(\text{AP}_M\) 统计 \(32\times 32 \sim 96\times 96\) 像素中等尺度目标,\(\text{AP}_L\) 统计 \(>96\times 96\) 大尺度目标。
表 2:2D 玫瑰关键点定位实验对比 | 方法类型 | 算法 | 主干网络 | 前端检测器 | \(\text{AP}\) | \(\text{AP}_{50}\) | \(\text{AP}_{75}\) | \(\text{AR}\) | \(\text{AR}_{50}\) | \(\text{AR}_{75}\) | | :--- | :--- | :--- | :--- | :---: | :---: | :---: | :---: | :---: | :---: | | Top-down | RTMPose | CSPNeXt-L | YOLOv5 | 16.6 | 45.2 | 8.6 | 27.1 | 54.9 | 22.9 | | Top-down | RTMPose | CSPNeXt-L | Ground Truth | 37.2 | 82.2 | 28.9 | 48.0 | 86.5 | 44.4 | | Top-down | ViTPose | ViT-L | YOLOv5 | 21.9 | 48.5 | 17.2 | 32.0 | 56.9 | 31.2 | | Top-down | ViTPose | ViT-L | Ground Truth | 42.1 | 85.8 | 37.2 | 53.6 | 90.7 | 53.7 | | Bottom-up | YOLOXPose | CSPDarknet | — | 25.0 | 60.3 | 19.3 | 53.7 | 88.7 | 55.2 | | Bottom-up | DEKR + HRNet | HRNet | — | 24.9 | 57.8 | 18.6 | 43.9 | 81.2 | 41.8 |
消融实验¶
表 3:3D 玫瑰定位在不同深度估计来源下的误差对比 (MPJPE,单位 mm) | 2D 关键点推理器 | 检测器 | 深度估计来源 | 深度编码器 | \(\text{MPJPE} \downarrow\) | | :--- | :--- | :--- | :--- | :---: | | ViTPose | DETR | Depth Anything (Zero-shot) | ViT-L | 656.9 | | ViTPose | DETR | BinsFormer (Fine-tuned) | Swin-Large | 647.2 | | ViTPose | DETR | Ground Truth Depth (传感器) | — | 556.8 | | RTMPose | DETR | Depth Anything (Zero-shot) | ViT-L | 650.6 | | RTMPose | DETR | BinsFormer (Fine-tuned) | Swin-Large | 644.5 | | RTMPose | DETR | Ground Truth Depth (传感器) | — | 558.4 | | DEKR + HRNet | — | Depth Anything (Zero-shot) | ViT-L | 669.4 | | DEKR + HRNet | — | BinsFormer (Fine-tuned) | Swin-Large | 654.3 | | DEKR + HRNet | — | Ground Truth Depth (传感器) | — | 522.8 | | YOLOXPose | — | Depth Anything (Zero-shot) | ViT-L | 653.2 | | YOLOXPose | — | BinsFormer (Fine-tuned) | Swin-Large | 645.1 | | YOLOXPose | — | Ground Truth Depth (传感器) | — | 589.3 |
表 4:多帧时序一致性优化消融实验 (MPJPE,单位 mm) | 2D 关键点推理器 | 前端检测器 | 采用多帧时序优化 | \(\text{MPJPE} \downarrow\) | 误差改善 | | :--- | :--- | :---: | :---: | :---: | | ViTPose | DETR | ✗ | 556.8 | 基线 | | ViTPose | DETR | ✓ | 539.1 | -17.7 mm | | RTMPose | DETR | ✗ | 558.4 | 基线 | | RTMPose | DETR | ✓ | 542.2 | -16.2 mm |
关键发现¶
- 检测瓶颈制约 Top-down 姿态估计:在 2D 关键点任务中,若采用检测器预提取候选框,Bottom-up 架构(YOLOXPose 达到 25.0 AP)明显优于基于 YOLOv5 检测的 Top-down 架构(ViTPose 仅 21.9 AP);但一旦给 Top-down 供给真值边界框(GT Boxes),ViTPose 的 AP 飙升至 42.1,表明在茂密交叉生长的植物场景中,目标检出的漏检与框偏移是姿态估计的核心误差来源。
- 特定领域微调对单目深度至关重要:零样本单目深度模型在温室表现极差(例如 Depth Anything 的 AbsRel 为 0.498、RMSE 为 1.092 m),经 Rosetum3D 微调后,BinsFormer 将 AbsRel 压低至 0.165、RMSE 优化至 0.734 m,大幅提升了深度置信度。
- 时序插值平滑有效弥补深度缺陷:引入多帧时序优化后,ViTPose 与 RTMPose 在真实传感器深度下的 3D 关节定位误差(MPJPE)分别从 556.8 mm 降至 539.1 mm、558.4 mm 降至 542.2 mm,验证了利用多视角平移的时间冗余能显著对冲飞点与遮挡缺失。
亮点与洞察¶
- 植物学生理解耦的高保真 2D-to-3D 采集路径:巧妙地将人类姿态骨架的概念引申为植物 5 大生理节点加 4 个空间插值点,绕开了大场景密集植物三维重建几何变形与拓扑紊乱的死穴;经实地厘米刻度尺验证,反投影三维标定误差仅 0.14 cm。
- 完备的温室多任务真实基准覆盖:数据集不仅用于 3D 定位,还同步开辟了 2D 检测、姿态、深度估计、局部特征匹配(Rosetum3D-1800)与跨垄植物 Re-ID(1,923 个独立植株,3.6 万张图像),为农业具身智能提供了全栈式评测土壤。
- 可迁移的轻量跨帧时序平滑范式:结合跨视角 Re-ID 与时间插值先验的时序融合机制简单轻巧,不需要依赖高开销的三维光流或神经 SLAM,即可直接迁移到果蔬采摘机械臂或无人巡检小车的实时三维跟踪流中。
局限与展望¶
- 整体 3D 定位绝对误差仍偏大:作者坦承目前结合纯视觉检测与深度推断所获得的 3D 玫瑰定位 MPJPE 误差仍在 500–600 mm 水平,对毫米级精度的采摘末端执行器而言仍显粗糙,主要归因于远距离深度噪声以及茎秆极端遮挡。
- 时序优化未建模相机运动位姿:当前多帧融合方案直接在相机坐标系下基于时间线性插值,假设相机以严格恒定线速度水平平移,忽略了操作员胸戴相机的微幅晃动与姿态旋转带来的坐标系变换误差。
- 未来改进方向:后续工作可引入 SLAM 系统实时解算相机 6-DoF 位姿并变换至全局世界坐标系进行 Bundle Adjustment 优化;同时可结合高斯泼溅(3D Gaussian Splatting)等新兴神经隐式表征,提升细长花茎的亚毫米级三维重建精度。
相关工作与启发¶
- vs ScanNet / SUN RGB-D 等室内三维数据集: 传统室内数据集依赖大尺度结构化静态刚体(墙面、桌椅),可直接在三维点云中完成包围盒与语义标注。Rosetum3D 面对高密度非刚性植株、极度遮挡与细幼茎秆,开创性地采用 2D 生理关键点深度反投影方案,解决了复杂生物体的空间真值获取难题。
- vs Pheno4D / Plant3D / ROSE-X 等农业 3D 扫描数据集: 现有农业三维数据集多采集于实验室控制环境下的少量离体或离散单株盆栽(如 ROSE-X 仅包含 11 株 X 射线扫描模型),缺乏高通量真实生产环境数据。Rosetum3D 深入真实商业温室,提供 2.1 万张自然遮挡序列与 4.6 万株实例,兼具多样化品种与生长阶段。
- vs 人体姿态估计 (HPE) 体系: 本文成功将 COCO 姿态估计与 MMPose 评价体系迁移到植物表型学中,启示我们细长生物器官(如主茎、叶柄、分枝拓扑)完全可以被建模为可参数化的运动学树状图结构,为复杂植物拓扑自动分析提供了全新视角。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (构建了首个面向采前切花玫瑰的大规模三维视觉基准,开创了 2D-to-3D 农业植物解剖学关键点标注流程)
- 实验充分度: ⭐⭐⭐⭐⭐ (全面覆盖检测、姿态、单目深度、特征匹配、Re-ID 以及 3D 定位六大任务,对比了数十种 SOTA 模型)
- 写作质量: ⭐⭐⭐⭐☆ (逻辑结构清晰,数据统计全面详实,基准设计层次严整)
- 价值: ⭐⭐⭐⭐⭐ (填补了高端设施农业采前 3D 视觉数据的空白,对智慧温室智能巡检、表型分析与自动采摘机器人具有极高的应用与研究价值)