跳转至

Geo-DPO: Aligning Semantic Intent with Geometry for 3D Affordance Segmentation

会议: ECCV 2026
论文: ECCV 原文
领域: 语义分割
关键词: 3D 可用性分割、点云、多模态大语言模型、直接偏好优化、分层几何适配器

一句话总结

针对 3D 多模态大语言模型在序列可用性分割中因 <SEG> token 过度压缩导致的几何模糊与边界外溢问题,Geo-DPO 提出了分层几何适配器注入多尺度 3D 物理先验,并结合基于软 IoU 与形状原型的对比式可用性偏好优化,实现了语义意图与真实物理几何边界的高精度对齐。

研究背景与动机

3D 语言引导的可用性分割(3D affordance segmentation)旨在根据自然语言指令,在物体的三维点云中精确定位可交互或具备特定功能的作用区域。这一任务对于具身智能与机器人操作至关重要,它直接打通了上层抽象语言指令与下层机器人执行末端所需的精确物理接触面。近期随着 3D 多模态大语言模型(3D MLLMs)的兴起,基于常识推理的序列可用性任务(sequential affordance reasoning)成为了研究焦点。与单步执行不同,序列可用性要求模型推理出一连串符合操作逻辑的功能部件(例如“用水壶浇水”需要先定位“把手”抬起水壶,再定位“壶嘴”进行倾倒)。现有的 3D MLLM 框架通常在自回归文本响应末尾生成一个特殊的 <SEG> 标识符,将其作为高维语义 query 驱动下游解码器预测逐点二进制掩码。

然而,这种设计存在一个致命的结构性缺陷:将复杂的空间语义推理过度压缩进单一的一维 <SEG> token,不可避免地丢失了大量底层的三维结构细节与精细的空间坐标信息。这种语义过压缩引发了严重的“几何模糊(geometric ambiguity)”现象——预测出来的分割掩码无法捕捉清晰的物理部件轮廓,频繁溢出到空间相邻但功能完全不同的无关区域(例如抓取杯柄时,掩码大量渗透到杯体主干)。传统方法仅依赖逐点独立监督的分割损失(如 BCE、Dice),在面对紧密相连的几何边缘时无力约束这种外溢,导致序列推理过程中误差快速累积。

为了从根本上消除几何模糊,本文的核心构想是构建一个语义与物理几何的双向对齐机制:不仅在结构上前向补全丢失的细粒度结构先验,还要在目标优化侧引入以真实几何边界为导向的偏好反馈机制。核心 idea:提出 Geo-DPO 框架,在结构上通过分层几何适配器(HGA)自底向上将 3D 视觉编码器的多尺度稠密物理特征注入 <SEG> token,在训练上设计对比式可用性偏好优化(CAPO),利用软 IoU 位置奖励与局部特征原型形状奖励显式惩罚边界外溢,实现语义意图与真实 3D 几何边界的严谨对齐。

方法详解

整体框架

Geo-DPO 的输入包含物体 3D 点云 \(X \in \mathbb{R}^{N \times 3}\) 和自然语言指令 \(T\)。点云首先经由预训练冻结的 3D 视觉编码器(Uni3D)提取多尺度几何特征,并映射至语言模型的隐层空间。多模态大模型基座(基于 ShapeLLM-7B,通过 LoRA 参数高效微调)结合文本指令进行序列逻辑推理,并在文本末尾输出聚合了目标部件宏观概念的初始语义标识符 \(h_{\text{raw}} \in \mathbb{R}^{1 \times D}\)。为了恢复底层结构,分层几何适配器(HGA)级联查询 3D 视觉编码器的浅层与中间层稠密特征,将 \(h_{\text{raw}}\) 提炼为具备精确空间几何感知的 \(h_{\text{geo}}\)。最后,\(h_{\text{geo}}\) 与高分辨率逐点特征计算点积并通过 Sigmoid 生成预测掩码 \(P\)。在训练阶段,除基础生成与逐点分割损失外,对比式可用性偏好优化(CAPO)利用正负样本计算位置与形状组合奖励,通过偏好排序彻底消除几何模糊。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:3D 点云与自然语言指令"] --> B["3D 视觉编码器与 MLLM 推理<br/>生成初始语义 h_raw"]
    B --> C["分层几何适配器 HGA<br/>级联跨注意力注入多尺度几何特征"]
    C --> D["几何感知 Query 解码<br/>点积生成逐点可用性掩码 P"]
    D --> E["对比式可用性偏好优化 CAPO<br/>混合位置与形状奖励显式惩罚边界外溢"]
    E --> F["输出:高精度物理对齐 3D 可用性掩码"]

关键设计

1. 分层几何适配器:级联跨注意力重塑几何感知 针对单一语义 token 过度压缩导致的空间细节遗失,分层几何适配器(Hierarchical Geometry Adapter, HGA)旨在直接从 3D 视觉编码器的中间层级中提取结构线索并注入语义 query。由于 3D 编码器的浅层擅长捕捉边缘、曲率等微观结构,而中间层蕴含局部部件级的几何上下文,HGA 采用了级联跨注意力(cascaded cross-attention)机制进行逐级特征汲取:

\[\mathbf{h}_1 = \mathbf{h}_{\text{raw}} + \text{Attention}(\mathbf{Q}=\mathbf{h}_{\text{raw}}, \mathbf{K}=\mathbf{F}_{\text{low}}, \mathbf{V}=\mathbf{F}_{\text{low}})$$ $$\mathbf{h}_{\text{geo}} = \mathbf{h}_1 + \text{Attention}(\mathbf{Q}=\mathbf{h}_1, \mathbf{K}=\mathbf{F}_{\text{mid}}, \mathbf{V}=\mathbf{F}_{\text{mid}})\]

其中 \(F_{\text{low}}\) 与 \(F_{\text{mid}}\) 分别代表经过线性投影至语言隐藏维度 \(D\) 的浅层与中层几何特征。通过先对齐底层边缘细节再对齐部件几何外形,得到的 \(h_{\text{geo}}\) 摆脱了抽象语义漂移,成为具备精确 3D 几何锚定的条件向量,随后与点云全局稠密特征 \(F_{\text{point}}\) 计算点积生成初始预测掩码 \(P = \sigma(h_{\text{geo}} F_{\text{point}}^\top)\)。

2. 混合偏好奖励设计:解耦空间重合与局部几何形状 针对标准点级交叉熵损失无法感知部件整体轮廓与几何外溢的问题,CAPO 构建了针对掩码预测的混合奖励函数 \(R(P, G)\),由位置奖励(Position Reward)与形状奖励(Shape Reward)复合而成。位置奖励采用 Soft-IoU 指标量化宏观重合程度:

\[R_{\text{pos}}(P, G) = \frac{\sum_{i=1}^N P_i G_i}{\sum_{i=1}^N P_i + \sum_{i=1}^N G_i - \sum_{i=1}^N P_i G_i + \epsilon}\]

然而,若仅依赖 Soft-IoU,当掩码预测整体较大并溢出至相邻部件时,并不能严厉惩罚这种“形状变异”。为此,作者设计了基于物理特征原型的形状奖励 \(R_{\text{shape}}\)。利用 3D 编码器中间层 \(F_{\text{mid}}\),分别对预测掩码 \(P\) 与真实掩码 \(G\) 进行加权池化,提取各自所选区域的物理特征原型向量 \(v_P, v_G \in \mathbb{R}^{C_2}\):

\[v_P = \frac{\sum_{i=1}^N P_i F_{\text{mid}, i}}{\sum_{i=1}^N P_i}, \quad v_G = \frac{\sum_{i=1}^N G_i F_{\text{mid}, i}}{\sum_{i=1}^N G_i}\]

形状奖励定义为两个特征原型的余弦相似度 \(R_{\text{shape}}(P, G) = \frac{v_P^\top v_G}{\|v_P\|_2 \|v_G\|_2}\)。当预测掩码侵占曲率或结构截然不同的非目标区域时,池化特征 \(v_P\) 会显著偏离真实原型 \(v_G\),从而导致形状奖励大幅衰减。最终混合奖励表达为 \(R = R_{\text{pos}} + \alpha R_{\text{shape}}\)(实验中 \(\alpha\) 设为平衡常数)。

3. 对比偏好目标优化:批内负采样驱动边界对齐 在获得能够敏感反映几何质量的奖励后,如何将其高效转化为可微分的优化梯度是关键。不同于直接对文本自回归做 RLHF/DPO,CAPO 将掩码与几何真实性的对齐转化为奖励边界最大化问题。采用批内负采样(In-Batch Negative Sampling)策略,在批量大小为 \(B\) 的训练批次中,对于第 \(i\) 个指令-点云样本,将正确标注 \(G_i\) 视为偏好目标(positive target),而将同批次内其他互斥样本的真实掩码 \(G_j (j \neq i)\) 视为负目标(negative targets),构造如下直接偏好优化损失:

\[\mathcal{L}_{\text{CPO}} = - \frac{1}{B(B-1)} \sum_{i=1}^B \sum_{j \neq i} \log \sigma \left( \beta \left( R(P_i, G_i) - R(P_i, G_j) \right) \right)\]

其中 \(\beta\) 为温度系数。这一对比式推挽机制迫使模型生成的预测掩码不仅在正样本上得分极高,而且对于不相关的负几何区域形成显著的奖励边际差异,从训练目标端强制模型学会严守物理界限。

损失函数 / 训练策略

Geo-DPO 采用端到端联合训练策略,总损失由三部分构成: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{txt}} + \mathcal{L}_{\text{seg}} + \lambda \mathcal{L}_{\text{CPO}}\)$ 其中 \(\mathcal{L}_{\text{txt}}\) 为 MLLM 的自回归文本生成交叉熵损失,用于引导序列部件推理;\(\mathcal{L}_{\text{seg}}\) 为基础分割损失,由二值交叉熵(BCE)与 Dice 损失相加组成,保障基础点级分类稳定性与正负样本均衡;\(\mathcal{L}_{\text{CPO}}\) 为本文的核心对比偏好损失,超参数 \(\lambda\) 控制偏好正则化强度(默认设置为 0.2)。基座大模型采用 ShapeLLM-7B 配套 LoRA(rank=8)微调,3D 视觉编码器 Uni3D 在训练期间保持冻结,优化器采用 AdamW,初始学习率为 \(2 \times 10^{-4}\),配合余弦退火学习率调度与 FlashAttention 加速。

实验关键数据

主实验

在涵盖单步与长程复杂推理的 SeqAfford 数据集上,针对 Seen(已知类别)、Unseen(未知类别新颖物体泛化)和 Sequential(序列推理)三种测试配置,将 Geo-DPO 与当前先进基线进行全面对比,核心评估指标包含 mIoU (%)、AUC (%)、相似度 SIM 与平均绝对误差 MAE。

测试配置 方法 mIoU (↑) AUC (↑) SIM (↑) MAE (↓)
Seen ReferTrans (NeurIPS 2021) 11.4 77.2 0.449 0.135
Seen ReLA (CVPR 2023) 12.1 76.3 0.480 0.130
Seen 3D-SPS (CVPR 2022) 10.1 75.2 0.413 0.141
Seen IAGNet (ICCV 2023) 14.2 81.7 0.510 0.117
Seen LASO (CVPR 2024) 16.3 84.3 0.568 0.108
Seen SeqAfford (CVPR 2025) 19.5 86.9 0.594 0.098
Seen Geo-DPO (本文) 20.9 88.1 0.610 0.091
Unseen ReferTrans 9.1 67.4 0.427 0.151
Unseen ReLA 9.3 68.2 0.423 0.147
Unseen 3D-SPS 7.1 66.9 0.397 0.162
Unseen IAGNet 11.7 73.6 0.438 0.143
Unseen LASO 12.4 76.1 0.502 0.132
Unseen SeqAfford 13.8 82.4 0.518 0.128
Unseen Geo-DPO (本文) 14.8 85.6 0.528 0.126
Sequential ReferTrans* 10.8 74.5 0.425 0.142
Sequential ReLA* 11.4 74.8 0.463 0.136
Sequential 3D-SPS* 9.9 73.1 0.407 0.148
Sequential IAGNet* 13.5 78.2 0.496 0.131
Sequential LASO* 14.3 80.7 0.521 0.124
Sequential SeqAfford 14.6 84.2 0.573 0.118
Sequential Geo-DPO (本文) 15.1 86.5 0.601 0.115

(注:基线方法带有 * 表示提供真实序列步骤信息以辅助其进行单步分解推理。)

消融实验

在最具挑战性的 Sequential 序列可用性任务上,作者对核心模块与关键参数进行了系统消融。

1. 核心模块有效性验证

HGA 结构适配 CAPO 偏好优化 mIoU (↑) AUC (↑) SIM (↑) MAE (↓) 说明
✗ ✗ 14.5 84.0 0.572 0.117 基线无几何增强架构
✓ ✗ 14.7 84.9 0.585 0.116 单独引入分层几何结构注入
✗ ✓ 14.8 85.4 0.591 0.117 单独采用偏好边界损失
✓ ✓ 15.1 86.5 0.601 0.115 结构注入与偏好优化联合 (本文)

2. HGA 内部多尺度特征融合机制消融

特征融合策略 mIoU (↑) AUC (↑) SIM (↑) MAE (↓) 说明
元素相加 (Addition) 14.4 84.1 0.572 0.118 空间相关性退化
通道拼接 (Concatenation) 14.5 84.5 0.579 0.118 静态融合缺乏语义灵活性
级联跨注意力 (Cross-Attention, 本文) 15.1 86.5 0.601 0.115 动态上下文自适应几何注入

3. 推理步长复杂度与模型稳定性分析

推理步骤复杂度 基线 SeqAfford mIoU Geo-DPO mIoU 性能绝对提升
1 步 (Single Affordance) 19.5 20.9 +1.4
2 步 (2 Steps) 14.8 15.2 +0.4
\(\ge 3\) 步 (\(\ge 3\) Steps) 14.5 15.1 +0.6

关键发现

  • 两模块高度正交互补:单独使用 HGA 或 CAPO 均能带来 0.2%~0.3% 的 mIoU 提升,而二者结合时跃升至 15.1% mIoU,证明“结构侧找回底层物理特征”与“优化侧施加边界惩罚”相互促进,缺一不可。
  • 长程推理鲁棒性显著增强:随着指令从 2 步增加到 3 步以上,基准方法 SeqAfford 发生了明显的累积误差衰减(mIoU 从 14.8% 跌落至 14.5%),而 Geo-DPO 仅微幅波动 0.1%(保持在 15.1%),说明严格的几何边界对齐极大增强了多轮推理时的物理抗漂移能力。
  • 偏好损失权重敏感度适中:在超参消融中,\(\lambda=0.2\) 时性能达到全局最优;当 \(\lambda\) 进一步过大增加至 0.4 时,性能下滑至 14.8%,说明过强的偏好外溢惩罚会轻微干扰基础语义特征的判别学习。

亮点与洞察

  • 将 DPO 范式创新性迁移至 3D 物理几何对齐:传统 DPO 依赖人工构建的偏好文本,而本文巧妙地将 3D 点云的自然几何边界与局部特征原型直接视作“客观偏好目标”,无需任何人类标注即达成了高质量的物理对齐。
  • 以特征原型相似度作为形状惩罚:单纯使用 Soft-IoU 等点级指标容易陷入掩码重叠局部极值,作者通过加权局部稠密特征提取物理原型向量,以余弦距离敏锐捕捉外溢区域的曲率畸变,构思极其精巧。
  • 模块即插即用且兼容性高:HGA 与 CAPO 几乎不需要改变基础大语言模型的自回归文本生成主干,仅对下游定位 query 和训练损失层轻量嵌入,可直接推广至其他基于 MLLM 的 3D 指代分割或具身规划架构。

局限与展望

  • 7B 自回归大模型带来的推理时延瓶颈:当前架构依赖 ShapeLLM-7B 的逐 token 自回归生成,计算开销较大,难以直接部署于高频闭环(如 30Hz+)的真实机器人具身交互场景。未来需要借助知识蒸馏技术将几何推理能力压缩入轻量级前馈网络。
  • 目前局限于静态刚体对象:CAPO 的物理原型基于刚体几何特征,面对衣物等高形变物体或带有复杂多关节连接的运动机械结构(如多轴机械臂、复杂折叠结构)时,特征原型的聚类表征面临严峻挑战。
  • 缺少通用 3D 语义分割的直接扩展验证:作者指出几何外溢是所有密集预测任务的共性痛点,未来可将该偏好学习机制推广至通用室内场景 3D 实例分割与部件分割。

相关工作与启发

  • vs SeqAfford (CVPR 2025): SeqAfford 首次将 3D MLLM 引入序列可用性推理,但仅依赖纯语义 <SEG> token 和隔离的点级损失,在复杂物理边界处频繁发生掩码大面积外溢;Geo-DPO 补充了分层几何适配机制与对比偏好正则,显著修复了边缘混乱问题。
  • vs LASO (CVPR 2024) / 3D-SPS: 传统语言引导可用性分割方法主要采用浅层跨模态对齐网络,缺乏深层语义常识推理,在处理长程复合指令时全面落后;Geo-DPO 既保留了 7B MLLM 强大的常识推理,又补齐了物理底层的几何精度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将偏好优化机制(DPO)结合几何特征原型引入 3D 可用性分割,巧妙攻克了 MLLM 语义 token 几何模糊难题。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 Seen、Unseen 及长步长 Sequential 多种任务测试,消融实验详实,可视化证据充分。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,公式符号严谨,图表编排紧凑,逻辑层层递进。
  • 价值: ⭐⭐⭐⭐⭐ 为具身智能中大模型指令落地到底层精确物理接触提供了极具实用价值的对齐范式。