Interaction-Aware 4D Gaussian Splatting for Dynamic Hand-Object Interaction Reconstruction¶
会议: ECCV 2026
论文: ECCV 2026
领域: 3D 视觉
关键词: 4D 高斯泼溅、手物交互重建、变形场、交互感知正则、渐进式优化
一句话总结¶
在不用任何物体形状/类别/位姿先验的前提下,本文把动态手物交互场景拆成手、物体、背景三套解耦的隐式场来驱动 4D 高斯泼溅,给高斯追加可学习的权重 \(w\) 与半径 \(o\) 来刻画遮挡与边缘锐度,把手部关键帧位置拼进物体变形场让物体形变由手条件化,再配合显式的手部/物体旋转/交互正则与五阶段渐进式优化,在 HOI4D 与 HO3D 上把视图合成指标推到超过 4DGS、Deform3DGS、SC-GS 以及专门的 HOLD/BIGS 的水平(HOI4D 平移场景 PSNR 30.32 dB,比最强基线高 3.99 dB)。
研究背景与动机¶
手物交互(Hand-Object Interaction, HOI)的精确重建是 VR 与机器人遥操作的基础能力,它要求同时拿下手部形状、物体几何以及两者之间的接触关系。偏偏最日常的"抓杯子""拧瓶盖"就是最难建的:手指与物体互相遮挡、接触边界在图像上模糊、动作又快又带不规则旋转。早期的路线把交互物体当作已知量,靠物体 6D 位姿或模板去拟合,精度高但代价也高——给每个物体准备模板或可靠位姿标注在工业场景里几乎不可行;另一条无先验路线是 SDF 与 NeRF 系方法,前者基本只重建几何、没有外观,后者受限于 ray-marching 式的反向映射渲染效率,训练开销大到难以实用。3D 高斯泼溅(3D-GS)出现后,4DGS、Deform3DGS、SC-GS 这类动态高斯方法在通用动态场景上兼顾了保真度与速度,但它们在 HOI 上普遍失效:把场景里所有高斯塞进同一个变形 MLP,模型既要去拟合几乎静止的背景,又要在接触瞬间给出高度局部化、高频的手部变形,结果是高斯错位、大量重叠,交互边界糊成一片。
更细一层的观察是,交互中三种成分的运动性质根本不同:手是主动的、快速而局部的;物体在被动接触(比如被握住)时运动主要由手带动;背景几乎静止。用一套场同时吃下这三种运动既不合理也没必要。而 4D-GS 类方法的变形场是内容无关的——它只根据规范坐标和时间给出全局偏移,压根不知道"谁在碰谁",于是物体该跟着手转的时候不转,不该转的时候又乱翻。优化层面还有一重困难:HOI 的旋转与平移幅度大、遮挡频繁,一上来就把全部高斯丢进优化器,收敛慢并且位置对不齐。
本文的切入角度是把手和物在表示上彻底拆开,再让交互信息以"条件 + 约束"的形式显式回到优化中:手、物体、背景各用一套隐式场分别变形,物体场的输入直接拼上关键帧的手部位置,使物体形变由手条件化;同时给每个高斯追加两个可学习标量(权重 \(w\)、半径 \(o\)),让高斯自己在遮挡与边缘处决定该平滑还是该锐利;再补上手部平移、物体旋转、手物交互三条显式 3D 正则(以及一条穿透正则)和一个由粗到细的五阶段优化流程。整个过程不需要任何物体形状、类别或 3D 框先验,唯一的外部输入是一个现成手部跟踪器给出的粗略 MANO 参数(论文称其开销不到总运行时间的 3%)。核心 idea:把手物交互重建当作"分治 + 条件化"问题——三套解耦隐式场各负责一种运动频段,交互信息以物体场的手部条件、手部旋转先验和显式接触正则三种形式进入优化,从而在零物体先验下把遮挡与交互边界恢复干净。
方法详解¶
整体框架¶
输入是一段单目第一人称 RGB 视频,外加一个现成手部跟踪器给出的 MANO 参数;输出是任意时刻 \(t\)、任意视角都能渲染的完整 HOI 场景,并且手、物体、背景三部分既能分开渲染也能合成渲染。整条链路可以概括为"三套隐式场 + 三套高斯 + 一个渐进式优化循环":手部高斯 \(G_H\) 与物体高斯 \(G_O\) 共用一套为交互场景改造过的高斯参数化 \(G_{HO}\)(比标准 3D-GS 多了权重 \(w\) 与半径 \(o\) 两个可学习量),背景高斯 \(G_{BG}\) 沿用 Deform3DGS 的建模方式;三套场 \(F_H\)、\(F_O\)、\(F_{BG}\) 各自把自己那组高斯从规范空间变形到时间 \(t\) 的目标空间,并在最后的协同重建阶段统一到同一个目标空间里一起光栅化。之所以要拆开,一是手与物在接触处的遮挡需要对两侧分别施加更细粒度的监督才能对齐,二是三者的运动频段差得太远——背景只需低频更新,手物交互却要求高频建模,塞进一套场必然互相拖累。
交互信息在这个框架里以三种形式进入优化,这是理解全文的关键:其一,物体变形场 \(F_O\) 的输入包含关键帧的手部位置,物体的运动被手"条件化";其二,物体旋转损失以手部关节的平均旋转为先验,只在接触高斯上生效;其三,手与物是两组显式高斯点集,可以直接算双向 Chamfer 交互损失与穿透损失。三条都只依赖手部跟踪器,不依赖任何物体先验。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:第一人称 RGB 视频<br/>+ 手部跟踪器 MANO 参数"] --> B["三场解耦与手条件化的物体变形场<br/>手场 / 物体场 / 背景场"]
B --> C["交互感知手物高斯<br/>可学习权重 w 与半径 o"]
C --> D["显式交互感知正则<br/>手部 / 物体旋转 / 交互 / 穿透"]
D --> E["渐进式优化<br/>初始化 → 预热 → HOI 精修<br/>→ 背景优化 → 协同重建"]
E --> F["任意时刻 t 的完整 HOI 场景"]
需要说明的是,渐进式优化并不是链条末端的一步,而是横跨全流程的调度框架:前四节设计里除了表示本身,其余都挂在它的某个阶段上(预热阶段用两条 3D 损失、精修阶段激活 \(w\) 与 \(o\)、协同阶段用交互正则)。
关键设计¶
1. 三场解耦与手条件化的物体变形场:物体的形变应当由手来决定
先看三个场各自吃什么。手部场 \(F_H\) 以时间戳 \(t\)(做位置编码 \(\gamma(t)\),并按 Deform3DGS 的做法给 \(t\) 加噪声以对抗过度平滑)和规范空间的手部高斯坐标作为输入,输出位移/旋转/缩放的偏移量。值得注意的是它不把 MANO 参数当作输入——手部形变由场自己学,MANO 只在初始化和手部损失里作为粗引导出现。这样做是有针对性的:基于回归网络预测 MANO 参数的方法存在误差传播问题,初始的手部估计误差会一路累积成级联的重建错误,把手部变形交给可学习的场、只让 MANO 提供粗 3D 引导,等于把跟踪器的误差从"硬约束"降级成"软先验"。物体场 \(F_O\) 则刻意多了一项输入:在关键帧 \(k\)(手物接触前的那一帧)处,把手部位置与物体位置拼接后再与规范高斯坐标一起送进场,让它在预测时间 \(t\) 的偏移时知道手当时在哪:
(⚠️ 缓存中该式渲染损坏,此处按正文文字描述重写,符号细节以原文为准。)这正是本文对"单一变形场不够用"与"手物各用一套独立场又丢掉耦合"这对矛盾的折中:场是分开的,但物体场的条件里带着手,接触引发的形变于是有据可依,而不是像隐式方法那样只给一个全局偏移。背景场 \(F_{BG}\) 基于 Deform3DGS,按时间 \(t\) 做低复杂度变形,并在渐进式优化的第四阶段被单独预训练若干轮,避免它去追赶前景的高频抖动——实验里单独建模背景之后,暗部细节和整体对比度确实变好了。三个场最终在协同阶段变形到同一目标空间,遮挡关系与光照一致性由共享的光度监督隐式对齐。
2. 交互感知手物高斯:让每个高斯自己决定该平滑还是该锐利
交互瞬间手部剧烈运动、互相遮挡、边界模糊,而标准 3D-GS 的协方差参数没有任何表达"这里正被挡住"的能力,传统 4D 高斯又忽略了不同高斯之间的相互影响,结果是交互区出现纹理漂移与边缘发虚。本文的做法是给每个高斯追加两个可学习标量:权重 \(w\in\mathbb{R}^{+}\) 平滑运动、抑制噪声,同时充当"结构信息强弱 / 是否被遮挡"的软指示;半径 \(o\in\mathbb{R}^{+}\) 控制边缘锐度,\(o\) 越小轮廓越清晰。这两个量不是渲染后处理,而是直接改写 HOI 精修阶段的变形计算。先看它们如何变成邻域权重:对高斯 \(i\) 取 \(K\) 个最近邻,用 \(o_i\) 作带宽的 RBF 核把邻居距离转成空间邻近权重,归一化后乘上全局重要性 \(\sigma(w_i)\):
其中 \(d_{ik}\) 是两个高斯中心的欧氏距离,\(\sigma\) 是 sigmoid(保证 \(w_i\in(0,1)\))。这组权重随后驱动一个 LBS 式的局部刚性变换混合:每个邻居 \(k\) 由隐式场预测一个 6D 旋转(转成 \(3\times3\) 的 \(\Delta R^{t}_{k}\))与平移偏移,高斯 \(i\) 在 \(t\) 时刻的变形位置是这些局部变换按上述权重加权的结果:
(⚠️ 以上三式按缓存中的公式残骸与正文描述重写,以原文为准。)这样"谁在混合里说话更响"就同时由全局重要性与局部邻域结构决定:被遮挡处 \(w\) 小、\(o\) 收紧,高斯的位置更多由自身承担,不会被邻近的手或物拽走;边缘处 \(o\) 小使 RBF 退化成接近硬选择的最近邻加权,轮廓不被糊开。消融里把这一模块(参数与配套训练方案)整体移除,PSNR 从 32.96 dB 掉到 28.76 dB(−4.20 dB),是全文所有消融中最大的一处降幅,也反过来说明"交互边界该由谁来建模"确实是这套表示的核心。
3. 显式交互感知正则:把"手在抓东西"写进损失,但不需要任何物体先验
只有 2D 光度损失在重遮挡与剧烈运动下不够——高斯会在图像约束"看不见"的地方漂成浮点或错位。本文因此加了三条显式 3D 正则,且它们的外部依赖只有手部跟踪器。
第一条是手部损失,只监督平移:把每个手部高斯拉到最近的 MANO 顶点上,促使高斯贴合手面,为规避手臂与手部顶点的差异,只在经过滤的 MANO 顶点范围 \(\mathcal{V}_h\) 内取最近点,距离用 Chamfer 形式 \(\mathcal{L}^{H}_{\text{trans}}=\frac{1}{N}\sum_{i}\min_{v\in\mathcal{V}_h}\|\mathbf{p}_i-\mathbf{p}_v\|_2\)。第二条是物体旋转损失,针对的是物体平移可以靠空间邻近隐式对齐、而旋转在被动接触中经常发生非物理翻转这一不对称现象:先对 MANO 关节旋转做 SVD 旋转平均(rotation averaging)得到全局目标旋转 \(R^{\text{target}}_{\text{hand}}(t)\),再惩罚每个物体高斯预测旋转与它的测地距离,并用接触权重 \(\omega_j(t)=\sigma(w_j^{O})\) 门控——\(w\) 小(被遮挡或未参与接触)的物体高斯不受此项约束:
\(\log(\cdot)\) 是 SO(3) 到李代数 so(3) 的对数映射,所以这是一个几何度量意义上的角度差而非欧氏误差,能在抑制不合理旋转的同时保留物体局部的形变自由度。第三条是交互损失:手与物既然是两组显式点集 \(C_H\)、\(C_O\),就能直接算它们之间双向的 Chamfer 距离(\(\epsilon=10^{-6}\) 防止无接触时除零),把接触面拉近;这条损失是自监督的,不需要任何接触标注。
三条损失之外还有一条穿透损失:只靠"拉近"会让手和物粘在一起甚至互相穿插,所以额外惩罚手物之间过近或重叠的高斯对,一拉一推才构成完整的接触约束(⚠️ 穿透损失的具体形式在补充材料,缓存正文未给出)。这里也是本文与 HOLD、BIGS、MagicHOI 等工作的定位差异:后者要么依赖物体模板或位姿,要么借外部扩散先验去"脑补"被遮挡的几何,而本文只用粗粒度手部引导加显式接触约束。
4. 渐进式优化:把背景和手物分开、由粗到细地拟合
HOI 场景里旋转、平移、遮挡都很剧烈,直接优化全部高斯收敛慢且位置对不齐,而且背景与前景需要的更新频率完全不同,所以本文把优化拆成五个阶段。初始化:手部高斯用跟踪器的 MANO 顶点冷启动(仅用于 bootstrap);物体不假设形状、类别或 3D 框先验,而是在 MANO 顶点扩展出的轴对齐包围盒(AABB)内均匀随机采样;背景高斯来自 SfM 稀疏点云。预热:在 2D 损失之外接入手部平移损失与物体旋转损失,先把手的形变与物体的旋转扳到正确趋势上,期间周期性执行基于梯度的密度调整(3D-GS 的自适应密度控制)。HOI 精修:启用 \(w\)、\(o\) 与上一节的 KNN + LBS 混合,让接触区的高斯获得受控的局部自由度。背景优化:把背景高斯单独预训练固定轮数并做密度调整,得到干净的背景初始化。协同重建:三套场各自把高斯变形到同一目标空间,由交互损失与 2D 正则联合监督,最终同时保证遮挡关系物理合理、边缘过渡平滑、光照一致。
这个流程里真正被设计的是顺序:手部有 MANO 冷启动所以最先可靠;物体既无先验又与手强耦合,所以放到手部粗引导生效之后再放开;背景最容易被前景的高频抖动带偏,于是单独预训练、最后才进入联合优化。至于"光照一致",论文没有给出单独的光照损失项,可以理性地理解为三套高斯最终要在同一张图上接受同一个光度监督,手、物、背景对同一像素的贡献必须彼此协调,阴影与明暗因此被隐式对齐(⚠️ 论文未展开论证这一点)。一个容易被忽略的细节是物体初始化的弱先验假设:在 MANO 顶点的扩展 AABB 里均匀采样意味着默认"物体就在手附近",对推、扔这类物体远离手的交互并不成立。
一个完整示例¶
以一段"握住并转动杯子"的平移+旋转序列走一遍。初始化后,手部高斯落在 MANO 顶点上,物体高斯散布在手的扩展 AABB 里,此时两侧都没有形状与外观信息,渲染基本是噪声。预热阶段手部平移损失把 \(G_H\) 拉到跟踪器给出的姿态附近,物体旋转损失开始把与手接触的物体高斯往手部的旋转趋势上扳。HOI 精修阶段 \(w\) 与 \(o\) 被激活:按设计意图,接触边界处 \(o\) 变小使邻域加权更接近硬选择、轮廓更锐利,被遮挡处 \(w\) 变小使这些高斯更多保留自身位置而不被邻居拖走。背景优化把区域高斯单独拟合干净,暗部细节随之出现。最后的协同重建让三套高斯在同一次光栅化里对齐,交互损失与穿透损失把手与物拉到接触但不穿模。整个过程在单张 RTX 3090(24G)上跑 21,000 次迭代、约 1 小时 20 分钟收敛。
损失函数 / 训练策略¶
总目标由 2D 光度损失(沿用 3D-GS 谱系的图像损失,⚠️ 缓存正文只写"2D losses",具体形式以原文/补充材料为准)加上手部平移损失、物体旋转损失、交互损失,以及补充材料里的穿透损失与动量损失构成。正文给出的关键设置:KNN 的 \(K\) 同时用于精修与变形;关键帧 \(k\) 取手物接触前的那一帧;高斯与变形模型都用 Adam 优化;总迭代 21,000 次,单卡 RTX 3090 上 1 小时 20 分钟达到最优;手部跟踪器的开销低于总运行时间 3%。评测协议沿用 EgoGaussian,用隔帧测试(alternate-frame testing)分别评估纯平移与平移+旋转两类动作,以考察对未见交互的外推能力。
实验关键数据¶
主实验¶
HOI4D 上与三个通用动态高斯基线的对比(纯平移 2 个场景 + 平移旋转 2 个场景):
| 方法 | 平移 PSNR↑ / SSIM↑ / LPIPS↓ | 平移+旋转 PSNR↑ / SSIM↑ / LPIPS↓ |
|---|---|---|
| 4DGS | 24.86 / 0.80 / 0.47 | 23.68 / 0.85 / 0.39 |
| Deform3DGS | 26.33 / 0.87 / 0.29 | 23.57 / 0.89 / 0.28 |
| SC-GS | 25.08 / 0.84 / 0.46 | 17.32 / 0.71 / 0.48 |
| Ours | 30.32 / 0.93 / 0.29 | 24.16 / 0.86 / 0.37 |
| Ours*(全帧评估) | 33.03 / 0.95 / 0.27 | 24.02 / 0.85 / 0.39 |
HO3D 上的对比(平移+旋转场景,Ours* 为全帧评估,† 表示只在手与物体区域上评估):
| 方法 | PSNR↑ | SSIM↑ | LPIPS↓ |
|---|---|---|---|
| BIGS | 3.85 | 0.24 | 0.70 |
| HOLD | 18.03 | 0.84 | 0.26 |
| 4DGS | 19.44 | 0.82 | 0.25 |
| Deform3DGS | 9.68 | 0.36 | 0.65 |
| SC-GS | 20.37 | 0.80 | 0.26 |
| Ours | 25.19 | 0.89 | 0.15 |
| Ours*(全帧) | 25.17 | 0.89 | 0.16 |
| BIGS†(仅手物区域) | 24.51 | 0.92 | 0.07 |
| Ours†(仅手物区域) | 28.16 | 0.95 | 0.07 |
需要说明的是,论文报告的全部是视图合成指标(PSNR/SSIM/LPIPS),没有给出 Chamfer 距离、F-score 这类显式的几何精度指标;对几何质量最接近的旁证是 HO3D 上"仅手物区域"的评估(† 行)——即便把评估口径换成对 BIGS 更有利的前景区域,本文仍高出 3.65 dB。手部区域的质量在定性上被反复强调(Fig. 3、Fig. 4),但同样没有单独的报告数字。
消融实验¶
在 HOI4D 第 1 个场景上的消融(Full Model 的 32.96 dB 与主表 30.32 dB 的差异来自评测序列不同):
| 配置 | PSNR↑ | SSIM↑ | LPIPS↓ | 说明 |
|---|---|---|---|---|
| Full Model | 32.96 | 0.95 | 0.35 | 完整模型 |
| w/o Interaction-Aware Module | 28.76 | 0.91 | 0.40 | 去掉 \(w\)、\(o\) 及其训练方案,−4.20 dB(−12.7%) |
| w/o HOI Refinement | 32.23 | 0.94 | 0.39 | PSNR −2.2%、LPIPS −11.4% |
| w/o Object Loss | 31.45 | 0.94 | 0.38 | PSNR −4.6%、LPIPS −8.6% |
| w/o Hand Loss | 32.45 | 0.95 | 0.37 | PSNR −1.5%、LPIPS −5.7% |
| w/o Interaction Loss | 31.79 | 0.94 | 0.40 | PSNR −3.5%、LPIPS −14.3% |
| w/ noise \(\sigma=0.01\) | 32.80 | 0.95 | 0.35 | 物体初始位置加噪,−0.16 dB |
| w/ noise \(\sigma=0.05\) | 32.72 | 0.95 | 0.35 | 更强的初始化噪声,−0.24 dB |
关键发现¶
- 贡献最大的是交互感知模块(\(w\)、\(o\) 及其训练方案),去掉后 PSNR 掉 4.20 dB,远大于任何单条损失;说明"交互边界该由表示本身建模"是本文最实质的部分,而三条 3D 正则更像是辅助收敛。
- 三条损失的重要性排序是:物体旋转损失(−1.51 dB,LPIPS +8.6%)> 交互损失(−1.17 dB,LPIPS +14.3%)> 手部损失(−0.51 dB,LPIPS +5.7%)。这与方法的定位一致——物体既无先验又要跟着手转,是约束最薄弱的一环;手势有 MANO 冷启动兜底,所以对额外手部损失最不敏感。注意交互损失对 LPIPS 的杀伤(+14.3%)在所有单项里最大,说明它主要买的是感知质量而非峰值信噪比。
- 对物体初始化噪声相当鲁棒:\(\sigma=0.01\) 与 \(\sigma=0.05\) 的高斯噪声只带来 0.16 dB 与 0.24 dB 的下降,作者据此论证方法不依赖精确的物体初始化。
- HO3D 上所有基线都被位姿误差拖累:Deform3DGS 直接不收敛(9.68 dB),BIGS 只重建前景手物、不做背景所以全帧指标崩到 3.85 dB,HOLD 面向几何而非视图合成(18.03 dB)。这说明该基准上"会不会被输入噪声带崩"比"峰值性能"更能区分方法。
- 论文正文称平移场景取得"+9% PSNR 增益",但按 Table 1 的 26.33 → 30.32 dB 计算,相对提升约为 15%;两处口径不一致(⚠️ 以原文为准,本文未解释 9% 的算法)。旋转较多的场景则从 Deform3DGS 的 23.57 dB 提到 24.16 dB,提升幅度小得多,说明高速不规则旋转仍是难点。
亮点与洞察¶
- 把"交互"从抽象概念落到三个可操作的位置:物体变形场的手部条件(表示层)、以手部旋转为先验且被接触权重门控的损失(优化层)、手物点集之间的双向 Chamfer + 穿透损失(约束层)。这种"表示条件化 + 损失门控"的分离设计,比笼统地说"引入交互先验"清晰得多,也解释了为什么去掉表示层的 \(w\)、\(o\) 代价最大。
- \(w\) 一量两用:既是控制运动平滑/噪声抑制的连续权重,又被 sigmoid 归一化后当作接触权重去门控旋转损失(\(\omega_j=\sigma(w_j^O)\)),还兼作"被遮挡"的软指示。一个可学习标量同时服务表示与监督两件事,是很省参数的复用思路。
- Chamfer 拉近 + 穿透惩罚的张力才是接触约束的完整形态。很多 HOI 工作只做前者,结果手与物"糊"在一起;本文明确意识到"拉近不等于不穿模",这个认识可以直接迁移到任何以显式点集/高斯表示多体接触的任务(灵巧手抓取、人-物-场景联合重建)。
- 可迁移的写法:用 AABB 内的随机采样替代物体先验初始化,再靠噪声鲁棒性实验证明"不依赖精确初始化"——这套"弱先验初始化 + 鲁棒性验证"的组合,很适合那些拿不到物体模板但又能接受近似空间假设的场景(如机器人抓取中的未知物体)。
局限与展望¶
- 作者承认的局限:五阶段渐进式优化流程较长,未来若有更强的优化器可以把这些阶段统一起来;在极端情况(极快运动、复杂轨迹)下会失败(细节见补充材料),可能的补救是引入更多交互先验。
- 我自己看到的问题:评测规模偏小,HOI4D 只取 2 个平移 + 2 个旋转场景,HO3D 只取 camera 4 的 4 段平移+旋转序列,且 HO3D 降采样到一半分辨率;在这种规模上 3.99 dB 的领先需要更多场景来确认。
- 指标单一:没有 Chamfer / F-score / 手部关节误差这类几何指标,"几何保真"只能靠渲染图的定性对比与手物区域 PSNR 侧面支撑;而论文的卖点之一恰恰是几何与外观同时建模。
- 物体初始化仍隐含空间先验:物体高斯在 MANO 顶点的扩展 AABB 内均匀采样,等于假设物体就在手的近邻;对"抛开物体""远距离操作"这类物体与手分离的交互,这个初始化会失效。噪声鲁棒性实验只验证了在该 AABB 内部的抖动,没有验证 AABB 本身错位的情形。
- 穿透损失依赖补充材料且形式未公开,"物理真实"目前是 Chamfer + 穿透惩罚的近似,没有接触力、摩擦或可形变物体的建模;对可形变物体、铰接物体的适用性完全未验证(相关工作里那些铰接物体工作被作者明确定位为正交方向)。
- 手部跟踪器是离线依赖项:跟踪失败(强遮挡、运动模糊)时,手部损失与旋转损失会同时给出错误引导,论文只论证了跟踪开销小,没有论证其失败模式下的鲁棒性。
- 可改进方向:把三个隐式场在协同阶段做一次轻量的相互注意力或共享规范空间,让"条件化"从单向(手→物)升级为双向;用逐帧的接触概率替代关键帧 \(k\) 这一单点假设,使物体场的条件在整段序列上连续有效。
相关工作与启发¶
- vs 4DGS / Deform3DGS / SC-GS:它们用一套变形场处理全部高斯,对交互本质不可知。本文拆成手、物、背景三套场,并给物体场加手部条件,因此在 HOI4D 平移场景拿到 30.32 dB(Deform3DGS 26.33 dB);代价是流程更重(五阶段、1 小时 20 分钟训练),且引入了对关键帧 \(k\) 的依赖。
- vs EgoGaussian:同样面向第一人称交互场景的 3D-GS 重建,但 EgoGaussian 需要物体位姿估计、且只重建可交互物体、把手排除在外。本文不需要物体位姿、重建完整场景(手 + 物 + 背景),代价是失去了一部分"物体专项精度"。
- vs HOLD:HOLD 是类别无关的手物重建,但目标是几何而非视图合成,在 HO3D 的渲染指标上落后本文 7.16 dB;本文的定位是"完整场景的视图合成 + 几何",两者在几何精度上缺少同口径的比较。
- vs BIGS:BIGS 用 3D-GS 加扩散先验做单目双臂交互重建,但假设物体网格已知、且不重建背景。若只在手物区域评估,BIGS 为 24.51 dB、本文 28.16 dB——即使在更有利的口径下本文仍领先。
- vs MagicHOI / G-HOP 等生成式先验路线:它们同样无先验,但用扩散模型"幻觉"被遮挡的物体几何,把灵活性换成了生成式正则;本文的方向是不引入任何外部生成模型,只用显式接触约束,路线更轻但可能在严重遮挡下的几何完整性上不占优势。
评分¶
- 新颖性: ⭐⭐⭐⭐ 交互感知高斯参数 + 手条件化物体变形场 + 接触门控旋转损失的组合是新的,但每个部件(RBF 邻域权重、LBS 混合、Chamfer 接触损失)都能在前作里找到影子。
- 实验充分度: ⭐⭐⭐ 消融做得完整(含噪声鲁棒性),但只有两个数据集共 8 个场景,缺少几何指标,也没有与 HOLD/BIGS 在同一口径下的完整对比。
- 写作质量: ⭐⭐⭐⭐ 动机层层递进、三个挑战与三项贡献对应清楚;扣分在于多处关键公式与穿透损失被推给补充材料,正文的 "+9% PSNR" 与表格对不上。
- 价值: ⭐⭐⭐⭐ "零物体先验 + 全场景"的第一人称 HOI 重建设定很实用(VR/遥操作),把交互拆成表示条件化与显式接触约束的做法可迁移到其他多体交互重建任务。