Learning Generatable Mutual Distance for Scene-Aware Human Motion Generation¶
会议: ECCV 2026
论文: ECCV 原文
PDF: PDF
领域: 3D视觉
关键词: 场景感知人体动作生成、相互距离、交互表征、扩散模型、视觉语言模型
一句话总结¶
针对相互距离在随机动作生成中因缺少绝对坐标参考而产生的歧义性,本文提出两阶段扩散框架 MDNet,引入大语言视觉模型(VLM)推理语义空间锚点消除几何歧义,并在频域中建模平滑互距轨迹以引导物理真实且时序连贯的场景人体动作生成。
研究背景与动机¶
语言引导的场景感知 3D 人体动作生成旨在根据自然语言指令合成符合文本语义意图、且严格遵从复杂 3D 场景物理约束的全动态骨骼序列。然而,该任务长期面临自然语言意图抽象模糊与 3D 环境几何硬约束之间的双重制约。现有生成方法大多受困于表征瓶颈:以 HUMANISE 为代表的隐式特征融合策略将动作合成与场景推理深度交织,极易掩盖任务关键的空间区域,导致严重的语义偏离与“空中悬浮”;而以接触图(affordance maps)为代表的显式引导方案仅关注稀疏的人体触点,完全忽略了非接触肢体在三维空间中的时序演化与全局运动约束,在长时序动作中频繁出现身体穿模、抖动以及运动停滞。
相互距离(Mutual Distance)结合了关节点到场景表面的符号距离(SDF)与场景基准点到人体的欧氏距离,天然具备编码全身时空人-场景交互关系的优势。但在开环的随机生成设定下,相互距离仅表征相对几何构型,缺少全局绝对坐标系基准。在动作预测任务中,历史帧可以自然消除这一多义性;而在随机生成任务中,同一场景内两个语义和空间轨迹完全不同的动作(如走向左侧椅子与走向右侧桌子)可能对应高度相似甚至几乎重合的互距曲线。这种固有的几何歧义性导致相互距离无法直接独立驱动文本引导的随机动作合成。此外,扩散模型在时域逐步去噪时容易累积高频噪声,使得生成的长序列动作出现时间不连贯与高频抖动。
针对上述核心矛盾,本文打破了传统端到端直接拟合空间姿态的范式,选择将空间定位与动作生成解耦。通过引入视觉语言模型对鸟瞰场景图进行链式推理以建立起止绝对空间基准,并将相互距离变换到频域以抑制时序高频扰动。核心 idea:通过引入 VLM 语义空间锚点为相对相互距离补齐绝对空间参考,提出两阶段扩散架构 MDNet,在 DCT 频域显式合成低频互距轨迹并以此闭环引导物理真实且时序平滑的全身 3D 人体动作生成。
方法详解¶
整体框架¶
MDNet 包含两大串联阶段:第一阶段为相互距离生成器(Mutual Distance Generator, MDG),第二阶段为基于相互距离的动作生成器(Mutual Distance-based Motion Generator, MDMG)。系统首先通过预训练的 2D 视觉语言模型(Gemini-1.5-Pro)对 3D 场景俯视渲染的鸟瞰图(BEV)执行思维链(CoT)推理,定位指令指定的交互目标物体并输出合理的起始与终止骨盆 2D 坐标(语义锚点),随后将其提升回 3D 空间。MDG 阶段将含噪的相互距离通过离散余弦变换(DCT)映射至低频截断的频域空间,结合场景 SDF 特征、文本 CLIP 嵌入以及语义锚点位置编码进行扩散去噪,并通过逆离散余弦变换(IDCT)还原出全局连续平滑的相互距离序列 \(\hat{M}\)。MDMG 阶段则以生成的 \(\hat{M}\)、场景几何特征和语义条件为引导,通过条件扩散模型逆向去噪生成最终的 SMPL-X 骨骼姿态序列 \(\hat{X}\),并借助场景 SDF 插值构建的关节点符号距离和基准点距离一致性损失保证高保真交互。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:3D场景SDF与文本指令"] --> B["VLM语义锚点预测<br/>BEV推理提取起止空间锚点"]
B --> C["频域交互距离生成<br/>DCT变换与时空语义扩散"]
C --> D["距离引导动作生成与一致性约束<br/>交互融合与双重距离一致性损失"]
D --> E["输出:物理真实的全动态姿态序列"]
关键设计¶
1. VLM语义锚点预测:为相对交互距离提供绝对空间参考 相互距离天然缺失绝对全局坐标信息,直接导致多义解的出现;而基于固定词表的 3D 目标检测器面对开集词汇与开放场景泛化能力极弱。针对这一痛点,本文提出基于鸟瞰图(BEV)和通用大视觉语言模型(VLM)的零样本语义锚点定位策略。系统首先通过虚拟正交顶视相机将场景 SDF 投影渲染为二维 BEV 图像,完整覆盖室内可通行区域与障碍物轮廓。随后利用 Gemini-1.5-Pro 配合设计的思维链(CoT)提示词分步推理:第一步识别场景内全部物体并描述整体布局;第二步依据文本指令精确定位交互目标物体;第三步在开阔可达区域推断合理的起始骨盆坐标;第四步在目标物体边缘推断易于到达的终止骨盆坐标。所得 2D 坐标通过逆投影提升为 3D 空间锚点 \(P_{se} \in \mathbb{R}^{2 \times 2}\)。该机制不仅避开了复杂的 3D-LLM 特征重建,且为无绝对参照的相对互距提供了锚定点,彻底消除了相互距离在随机生成中的几何多义性。
2. 频域交互距离生成:消除高频抖动并解耦交互表征 相互距离 \(M = [D; B] \in \mathbb{R}^{U \times (J+K)}\) 包含两部分:关节点到场景表面的符号距离 \(d_{ju}\)(穿透为负,外部为正)以及场景中预先均匀采样的 \(K=150\) 个固定基准点到人体关节点的最小欧氏距离 \(b_{ku}\)。在扩散模型的时域去噪过程中,随机高斯噪声会导致时序曲线剧烈震颤,破坏动作与场景接触的连贯性。MDG 引入离散余弦变换(DCT),沿时间维度对互距序列的每一通道独立进行频域映射: $\(Z^{(t)} = C M^{(t)}, \quad \tilde{Z}^{(t)} = C_d M^{(t)}\)$ 其中 \(C_d \in \mathbb{R}^{d \times U}\) 为正交余弦基矩阵的前 \(d\) 行截断基底。由于人体动作的能量高度集中于低频段,模型仅保留前 \(d=50\) 个低频系数即可滤除绝大部分高频噪声。在去噪网络内部,空间-语义 Transformer 首先通过多层感知机将语义锚点映射为位置嵌入 \(F_{pos}\),并利用自注意力模块 \(Att_{fp}\) 与频域潜码融合;随后将 3D-CNN 提取的场景几何特征 \(F_{sce}\) 通过跨注意力模块 \(Att_{es}\) 注入编码器表征;最后由解码器接收文本嵌入 \(F_{text}\)、时间步编码 \(F_{step}\) 与可学习查询向量进行联合解码,输出去噪频域特征 \(\hat{Z}^{(t)}\),经逆变换 \(\hat{M}^{(t)} = C_d^\top \hat{Z}^{(t)}\) 重构出时序平滑无抖动的相互距离轨迹。
3. 距离引导动作生成与一致性约束:闭环对齐人-场景物理几何 第二阶段的 MDMG 网络旨在以生成的互距轨迹 \(\hat{M}\) 为刚性骨架合成真实的 SMPL-X 骨骼动作 \(X\)。为了克服传统扩散模型单向预测缺少几何约束的问题,MDMG 首先通过注意力模块 \(Att_{ms}\) 将互距特征与场景几何特征深度融合,送入 Transformer 骨干网络重构出动作序列 \(\hat{X}\)。在此基础上,本文利用场景预计算的 SDF 体积建立双重可微分的几何一致性监督。在训练阶段,模型将生成的各关节点坐标直接在场景 SDF 体积中三线性插值,解析出实时的预测符号距离 \(\hat{d}_{ju}\) 与基准点距离 \(\hat{b}_{ku}\),并分别与真实值构建 \(\ell_1\) 一致性损失: $\(\mathcal{L}_{joint} = \frac{1}{UJ}\sum_{u=1}^{U}\sum_{j=1}^{J} |\hat{d}_{ju} - d_{ju}|, \quad \mathcal{L}_{basis} = \frac{1}{UK}\sum_{u=1}^{U}\sum_{k=1}^{K} |\hat{b}_{ku} - b_{ku}|\)$ 该设计迫使姿态生成网络不仅学习动作流形的统计分布,更在显式几何层面上强制对齐人-场景的物理间距,有效消除了足底滑步、关节穿模和悬空假动作。
损失函数 / 训练策略¶
MDNet 采取两阶段独立训练策略: - 第一阶段优化 MDG 扩散网络,直接在频域空间计算去噪目标与真值低频 DCT 系数的 \(\ell_1\) 损失: $\(\mathcal{L}_{MDG} = \mathbb{E}_{\tilde{Z}^0, t} \left[ \|\tilde{Z}^0 - G_\theta(\tilde{Z}^{(t)}, t, S, F_{text}, P_{se})\|_1 \right]\)$ - 第二阶段优化 MDMG 扩散网络,总损失结合姿态重建与几何一致性约束: $\(\mathcal{L}_{MDMG} = \mathcal{L}_{motion} + \mathcal{L}_{joint} + \mathcal{L}_{basis}\)$ 其中 \(\mathcal{L}_{motion} = \mathbb{E}[\|X^0 - G_\phi(X^{(t)}, t, \hat{M}, S, F_{text}, P_{se})\|_1]\)。两阶段均采用 AdamW 优化器,学习率设为 \(1 \times 10^{-4}\),批大小为 32,在单张 NVIDIA A100 GPU 上训练。测试推理时,为每个文本指令利用 Gemini-1.5-Pro 生成 5 组锚点候选以增强动作采样的丰富多样性。
实验关键数据¶
主实验¶
在公开室内动作生成基准 HUMANISE 上,评估指标涵盖语义对齐(目标到达距离 goal dist.)、物理合理性(接触率 contact、防碰撞率 non-collision、平均穿模量 penemean、最大穿模量 penemax)以及动作质量与多样性(成对姿态距离 APD、时序动作方差 TMV)。对比结果如表 1 所示。
| 方法 | goal dist. (m) ↓ | contact (%) ↑ | non-collision (%) ↑ | penemean (cm) ↓ | penemax (cm) ↓ | APD ↑ | TMV → |
|---|---|---|---|---|---|---|---|
| 真实数据 (G.T.) | 0.014 | - | - | - | - | 0.000 | 0.1875 |
| Humanise (NeurIPS'22) | 0.422 | 84.06 | 99.77 | 1.283 | 2.656 | 4.094 | 0.2055 |
| Cen et al. (CVPR'24) | 0.384 | 86.36 | 99.60 | 1.144 | 2.551 | 2.073 | 0.1908 |
| Wang et al. (CVPR'24) | 0.156 | 95.86 | 99.69 | 1.367 | 14.768 | 2.597 | 0.1486 |
| MDNet (本文) | 0.057 | 95.05 | 99.81 | 0.635 | 1.849 | 2.235 | 0.1870 |
消融实验¶
在 HUMANISE 测试集上针对相互距离表征、各子距离分量、语义锚点与频域建模进行系统消融,如表 2 所示。
| 实验配置 | goal dist. ↓ | contact ↑ | non-collision ↑ | penemean ↓ | penemax ↓ | APD ↑ | TMV → | 说明 |
|---|---|---|---|---|---|---|---|---|
| 完整模型 (Ours) | 0.057 | 95.05 | 99.81 | 0.635 | 1.849 | 2.235 | 0.1870 | 完整双阶段框架与频域约束 |
| w/o mutual distance | 0.298 | 86.54 | 99.77 | 1.921 | 6.680 | 3.903 | 0.3573 | 彻底移除互距,穿模与抖动剧增 |
| w/o per-joint signed dist. | 0.059 | 93.98 | 99.80 | 0.992 | 3.998 | 2.229 | 0.2524 | 缺失关节点SDF,局部穿透恶化 |
| w/o per-basis point dist. | 0.158 | 94.66 | 99.76 | 0.701 | 2.829 | 2.361 | 0.2083 | 缺失全局基准点,目标定位偏差扩大 |
| w/o semantic anchors | 0.365 | 90.37 | 99.79 | 0.767 | 4.010 | 4.433 | 0.2383 | 缺失绝对锚点,互距多义性引发失控 |
| w/o DCT & IDCT | 0.059 | 94.96 | 99.80 | 0.741 | 3.246 | 2.178 | 0.2046 | 直接在时域建模,高频抖动上升 |
| Rand-proj. mutual dist. | 0.147 | 94.42 | 99.70 | 1.343 | 3.928 | 2.369 | 0.2145 | 随机正交投影破坏互距固有几何结构 |
跨场景泛化实验¶
在未经任何微调的零样本迁移设定下,将 HUMANISE 上训练的模型直接迁移至真实扫描三维场景数据集 PROX 上测试,结果如表 3 所示。
| 方法 | goal dist. (m) ↓ | non-collision (%) ↑ | contact (%) ↑ | penemean (cm) ↓ | penemax (cm) ↓ |
|---|---|---|---|---|---|
| Cen et al. (CVPR'24) | 0.281 | 99.65 | 86.62 | 0.963 | 1.921 |
| Wang et al. (CVPR'24) | 0.283 | 99.69 | 95.67 | 0.816 | 2.237 |
| MDNet (本文) | 0.054 | 99.87 | 95.93 | 0.270 | 0.654 |
关键发现¶
- 相互距离表征的基石作用:移除相互距离后,模型的平均穿模量从 0.635 cm 激增至 1.921 cm(增加超 200%),时序方差 TMV 从 0.1870 恶化至 0.3573,表明显式全身体时空几何交互表征是保证物理真实性与消除悬浮伪影的核心驱动力。
- 语义锚点定海神针效应:去除 VLM 语义锚点后,目标对齐误差 goal dist. 从 0.057 m 剧烈攀升至 0.365 m,充分验证了相对相互距离在无绝对参考系下无法唯一定位动作目标的论断。
- 频域低频先验大幅平滑时序:在 DCT 模块中,仅保留前 50 个低频余弦系数即可实现重构误差与平滑度的最优权衡。去掉 DCT 直接在时域扩散会导致最大穿模量从 1.849 cm 恶化至 3.246 cm,且动作伴随明显的高频颤动。
- 卓越的零样本跨域鲁棒性:在 PROX 数据集上,固定词表检测基线因场景域转移大幅失效,而 MDNet 凭借开放词表 VLM 空间推理和归一化的相互距离几何约束,穿模量(0.270 cm)不足基线的 30%,展现了极强的泛化能力。
亮点与洞察¶
- 将相对交互表征引入生成任务的范式突破:相互距离此前仅在具备历史轨迹的预测任务中被证明有效,本文首次指出其在随机生成中的核心痛点为“绝对参考缺失导致的空间歧义”,并通过融合 VLM 语义锚点成功激活了该表征在生成领域的巨大潜力。
- 频域截断与扩散模型的巧妙结合:利用 DCT 将动作时序的长程物理演化映射至低频正交基底,天然在表征层面构筑了低通滤波屏障,有效解决了扩散模型生成时空连续场时常见的高频振荡与接触漂移问题。
- 可复用的 BEV-VLM 跨模态空间推理机制:无需耗费算力预训练重型 3D 视觉语言模型,仅通过 2D 鸟瞰正交图配合 CoT 提示词即可精确完成 3D 空间内的目标交互起止定位,为具身智能与人机交互任务提供了极具性价比的空间先验提取方案。
局限与展望¶
- 作者承认的局限:动作生成质量依赖于 VLM 输出锚点的准确度。若场景物体极度密集导致 BEV 严重遮挡,或 VLM 推理出现幻觉生成了错误的起止点,第二阶段动作生成会被引导至错误轨迹。
- 潜在的研究盲区:目前模型仅显式建模了静态场景物体与人体之间的相互距离,尚未拓展至动态物体操作(如搬运椅子、开门)或多人交互场景,动态环境下的互距场维护计算开销将成倍增加。
- 未来改进方向:可进一步将 VLM 从两端静态锚点预测升级为包含中间关键路标的路径拓扑引导,或引入物理仿真引擎(如 Isaac Gym / MuJoCo)进行强化学习后微调,实现带接触力反馈的闭环物理动作控制。
相关工作与启发¶
- vs Humanise (NeurIPS 2022):Humanise 采用 cVAE 架构将场景点云与文本特征粗暴拼接进行隐式融合,导致动作生成与场景推理高度耦合,易出现足底打滑与目标悬空。本文通过两阶段解耦,先生成显式互距场再合成动作,目标对齐误差大幅降低了 86.5%(0.057 m vs 0.422 m)。
- vs Cen et al. (CVPR 2024):Cen 等人依赖固定的 3D 目标检测器预测边界框进行空间约束,但在未见过的室内布局与开放词表指令下鲁棒性极差。本文利用大视觉语言模型的常识推理与 BEV 思维链定位,在真实场景 PROX 上泛化优势显著。
- vs Wang et al. (CVPR 2024):Wang 等人基于接触图(affordance map)对人体接触部位进行约束,但仅约束接触点无法管束悬空关节与全局躯干运动,造成严重的人体内部扭曲与穿透(penemax 高达 14.768 cm)。本文的相互距离覆盖全身体 3D 关节点与场景全局基准点,将最大穿模量骤降至 1.849 cm。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙发现并攻克相互距离在生成任务中的绝对参考缺失盲区,提出 VLM 锚点结合频域扩散的创新范式。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖语义对齐、物理穿透、时序平滑度全套指标,消融详尽且具备 PROX 零样本跨域验证与扰动鲁棒性分析。
- 写作质量: ⭐⭐⭐⭐⭐ 问题阐述切中要害,理论公式严密,图表对比直观明晰。
- 价值: ⭐⭐⭐⭐⭐ 为场景感知 3D 人体动作生成和具身交互轨迹建模提供了极具启发性的显式几何表征基线。