跳转至

JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation

会议: ECCV 2026
论文: ECCV 2026 / 项目页
领域: 3D 视觉 / 人体理解
关键词: 手物交互生成、动态接触图、扩散模型、文本驱动运动生成、物理合理性

一句话总结

JointHOI 把"接触"当作与手物运动同源的内生模态,用一个单阶段扩散模型把双手 MANO 姿态、物体轨迹和左右手逐帧接触距离图拼进同一条序列联合去噪,再在推理时用自生成接触图与运动隐含几何之间的一致性梯度引导采样,从而在 GRAB / ARCTIC 上同时提升动作语义保真度(ARCTIC Top-1 0.948)与物理合理性(穿模体积比 Text2HOI 降一半以上)。

研究背景与动机

手物交互(HOI)的本质就是接触:手在物体的哪个部位接触、接触何时建立与断开、接触区域如何在动作推进中迁移。这决定了 HOI 生成与一般人体动作生成不同——它不只是把动作编得像,还必须让接触在时空上自洽,因为人眼对穿模、悬空手指和抓握不稳这类伪影极其敏感(哪怕是几毫米的接触误差)。现有文本驱动的做法(Text2HOI、DiffH2O、LatentHOI、HOI-GPT 等)都在尝试补上"交互"这一块,但补的方式各有代价:Text2HOI 显式预测接触图并把它当作运动生成的条件信号,可它的接触图是静态且二值的,既丢掉了"接触随动作逐帧演化"这件事,又把距离关系粗化成"碰/没碰";而它随后还要接一个后处理精修模块才能用。DiffH2O 走两阶段(抓握先规划、动作后生成),LatentHOI 与 HOI-GPT 则把交互关系塞进 latent 空间或自回归序列,虽然有效,却没有任何显式、可检查、可在推理时施加的接触信号,同时多阶段管线会把上一阶段的误差逐级放大。归根结底,这些设计要么砍掉时间维度、要么把几何藏进隐向量,接触的空间-时间结构被压缩掉了。

核心矛盾在于:接触天然是时空结构化的信号——它在物体表面上随位置变化、在时间上连续演化(接近、滑动、滚动、释放),而生成侧的表示却普遍是静态的、二值的或隐式的。两者不匹配的直接后果就是"每一帧看起来都还像样,整段播放却有漂浮和穿模"。本文的目标于是很明确:让接触在生成过程中就以动态、稠密、显式的形式存在,并且和运动一起被生成出来,而不是事后补一个约束、或者从隐向量里"猜"。

本文的切入角度是借用近期生成模型中的一个观察:把可从主输出直接导出的内生模态(inner modality)当作额外的生成目标联合建模,能反过来提升主输出的质量(如 VideoJAM 联合生成光流提升时序连贯性、Redi 联合生成 DINOv2 特征改善图像合成)。HOI 里最符合"可从主输出导出、又恰恰是任务核心"的信号就是接触图。核心 idea:把接触图当作手物运动的内生模态,用一个单阶段扩散模型在同一条序列里联合去噪运动与逐帧接触距离场,让运动维度与接触维度在 self-attention 中互相条件,并在推理时用"显式生成的接触"与"运动隐含的接触"之间的一致性梯度引导采样,在不需要后处理和多阶段训练的前提下压低穿模与漂浮。

方法详解

整体框架

输入是一段文本提示、物体的规范系点云(以及目标序列长度 \(L_{\max}\)),输出是一段双手的手物交互序列:每帧的左右手 MANO 参数与物体位姿(关节物体还含关节角),外加每帧的左右手动态接触图。整条流水线只有一个生成模型、一次扩散——训练时先用真值动作解析出逐帧接触图作为监督目标,把运动状态与接触图拼成逐帧 token 交给 Transformer 扩散模型,用 clean-sample prediction 回归干净序列;推理时这整条 token 从纯噪声出发联合去噪,每个反向步用一次接触一致性引导(CIG)修正当前噪声变量,最后把干净估计按维度切片,解析出运动与接触。三个环节对应下面三个关键设计:接触怎么表示、运动与接触怎么联合生成、生成出来的接触怎么在采样时被用来纠正几何。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["文本提示 + 物体点云"] --> B["动态接触图<br/>锚点 → 手面最小距离"]
    B -->|训练时作为监督目标| C["逐帧联合序列<br/>运动 token + 左右接触 token"]
    C --> D["单阶段联合扩散<br/>同一 Transformer 协同去噪"]
    D --> E["Contact Inner Guidance<br/>接触一致性梯度引导"]
    E --> F["双手/物体运动 + 动态接触图"]

关键设计

1. 动态接触图:把"接触"写成逐帧连续的表面距离场

针对的痛点很具体:二值接触图在阈值附近不稳定、无法表达"手正在靠近但还没碰到"这种对物理合理性最关键的中间状态,静态表示又丢掉了接触随时间的迁移。JointHOI 的接触表示建立在物体表面的锚点上:对每个物体,在其规范系里用最远点采样(FPS)固定 \(N_c=1024\) 个锚点,让它们均匀覆盖物体表面。锚点定义在物体自身坐标系里,因此与物体的全局运动解耦,物体怎么平移旋转,锚点跟着一起走,接触就能被一致地追踪——这也是它比"世界系里逐帧重算"更适合做引导的原因(锚点身份稳定,逐帧比对才有意义)。

每帧的接触图按左右手分别计算:把锚点用当前帧物体位姿变换到世界系得到 \(\{a_{l,n}\}\),对每个锚点取它到该手全部网格顶点的最小欧氏距离

\[\hat{C}^{H}_{l}[n]=\min_{u\in\mathcal{U}^{H}_{l}}\lVert u-a_{l,n}\rVert_{2},\qquad n=1,\dots,N_c,\ H\in\{L,R\}\]

其中 \(\mathcal{U}^H_l\) 是该帧该手的 MANO 网格顶点集合(778 个顶点)。用"顶点最小距离"代替精确的表面距离是一个可微且高效的近似;连续距离代替二值标签则避免了阈值敏感,让接触边界附近的信号是平滑的,这正是后面能用梯度做引导的前提。消融也验证了"左右手分开"不是细节:把双手的接触图合并成一份统一表示时,ARCTIC 上 FID 从 0.038 退化到 0.145,说明双手接触的动力学是非对称、松耦合的,强行共享一份表示会把两只手的信息搅在一起。

2. 单阶段联合扩散:运动与接触在同一条序列里互相条件

这是全文的核心。做法是把每帧的运动状态与接触图拼成一个 token:

\[y_l=\big[x^{L}_{l},\,x^{R}_{l},\,x^{O}_{l},\,C^{L}_{l},\,C^{R}_{l}\big]\in\mathbb{R}^{d_y},\qquad d_y=99+99+10+2N_c\]

其中单手的 \(x^H_l\in\mathbb{R}^{99}\) 是全局平移加 16 个关节的 6D 旋转(MANO 参数),物体 \(x^O_l\in\mathbb{R}^{10}\) 是平移、6D 旋转与一个关节角标量(GRAB 这类刚体数据去掉关节项,为 9 维);\(N_c=1024\)\(d_y\) 共 2256 维。整条序列按时间堆叠后直接在 \(y\) 上定义扩散过程,去噪器是一个 Transformer,输入加噪序列 \(y_t\),预测对应的干净序列 \(\hat y_0\),训练目标就是干净样本回归:

\[\mathcal{L}_{\mathrm{joint}}=\mathbb{E}_{y_0,t,\epsilon}\Big[\big\lVert y_0-D_\theta\big(y_t,o,e,\tau(t)\big)\big\rVert_2^2\Big]\]

条件通过前缀条件注入给出:把一个文本 token(CLIP 嵌入 \(e\))、一个物体 token(PointNet 全局/局部特征加尺度与质心,\(o\in\mathbb{R}^{1088}\))和一个时间步 token(\(\tau(t)\))拼在序列开头,然后对 \([z;\phi(y_t)]\) 做标准全自注意力,不额外引入 cross-attention 模块。

这里的关键在于"联合"到底体现在哪。因为运动维度和接触维度处在同一个 token、同一次注意力里,损失 \(\mathcal{L}_{\mathrm{joint}}\) 会迫使模型去学跨模态依赖:运动通道可以影响接触通道,接触通道也能反过来影响运动通道。这是双向的耦合,而不是"先生成运动再算接触"或"先生成接触再当条件"的串行依赖——因此像接近时距离平滑减小、释放时距离增大、滑动/滚动时接触区域协同变化这类物理共变模式,是作为先验被内化进模型权重的。相比之下,Text2HOI 把(静态二值的)接触图当输入条件、再接后处理精修,误差会沿阶段传播;LatentHOI / HOI-GPT 把交互藏在 latent 或自回归 token 里,接触既不可检查也无法在采样时施加约束;HOIDINI / CODA 那类接触约束方法要在推理时做几百步的噪声优化。JointHOI 则是一条序列、一个模型、一次扩散就把运动和接触一并产出了。

3. Contact Inner Guidance:用自生成的接触图在采样时纠正几何

联合生成并不保证采样出来的运动真的兑现了它自己预测的接触——长序列、高动态的交互里,迭代去噪仍会累积几何不一致。CIG 的思路是:模型已经同时给出了两份接触——一份是它显式生成的接触图 \(\hat C^H\),另一份是从它生成的手物几何解析算出来的接触图 \(\bar C^H\)(锚点用预测的物体轨迹变换、手顶点用 \(\mathrm{MANO}(\hat x^H)\) 得到,再取同样的最小距离)。两者本该一致,不一致的地方就是伪影所在。

于是每个反向步先取当前干净估计 \(\hat y_0\) 并解析出运动与接触,算出运动隐含的 \(\bar C^H\),再用一个对数尺度的能量度量二者的偏离,并把这个能量对当前噪声变量求梯度:

\[\mathcal{L}_{\mathrm{cig}}=\sum_{H\in\{L,R\}}\Big\lvert\log\big(\hat C^{H}+\varepsilon\big)-\log\big(\bar C^{H}+\varepsilon\big)\Big\rvert,\qquad y_t\leftarrow y_t-w\,\nabla_{y_t}\mathcal{L}_{\mathrm{cig}}\]

用对数尺度是有针对性的:它把权重集中到近接触的小距离区域,而真正决定交互真实感的正是这些区域,远场的大距离信息量很低;常数 \(\varepsilon\) 防止 \(\log\) 在距离趋零时数值发散。梯度要穿过 MANO 和最小距离这两个可微算子一路回传到 \(y_t\),因此引导作用在整条联合序列上(运动中物体轨迹也在内),修正完再走标准的扩散反向转移。它在家族上属于 classifier-based guidance,但这里的"分类器"不是额外网络,而是一个闭式能量,所以既不需要额外训练、也不需要抓取规划阶段或后处理——单阶段的性质被完整保留,代价只是每个采样步多一次反传(见主实验的效率表)。原文对能量形式还有一点值得注意的细节:正文把它称作 log-ratio energy,而引导消融里列出的最优变体名为 Log-ℓ1,本缓存中该公式排版损坏,上面按"对数差的绝对值"给出,⚠️ 精确形式以原文为准。引导权重取 \(w=0.05\)

损失函数 / 训练策略

训练目标就是上面的 \(\mathcal{L}_{\mathrm{joint}}\),采用 clean-sample prediction(直接回归干净序列)而非噪声预测;线性噪声调度、训练 \(T=1000\) 步扩散,推理用 100 步采样。整个模型在单张 RTX A6000(48GB)上训练:Adam 优化器、学习率 \(10^{-4}\),GRAB 上 batch size 128、ARCTIC 上 64,分别训练至多 380K 与 60K 次迭代,训练损失进入平台即早停。CIG 不参与训练,只在推理时以 \(w=0.05\) 生效,且权重扫描显示它在相当宽的范围内都稳定(Acc 几乎不变、穿透深度持续下降),说明这个超参不需要精细调。推理时生成序列的长度与对应真值片段一致,以保证与基线在同一口径下比较。

实验关键数据

主实验

在 GRAB(51 个刚体、29 类动作,30 fps,最长 196 帧)与 ARCTIC(11 个关节物体、10 类动作,30 fps,最长 64 帧)上评估,文本提示沿用 Text2HOI 发布的版本。两个数据集都没有文本到 HOI 场景下的官方划分,作者用统一协议自建:按"物体-动作"对均匀采样构成平衡测试集,其余作训练集,所有方法在同一划分上训练与评估。评价分两面:语义侧用按 IMOS 协议训练的 RNN 动作分类器提特征,报告 Acc(Top-1/Top-3)与 FID;物理侧报告手物网格的穿模体积 IV(cm³)、最大穿透深度 ID(cm)与接触比 CR(物体发生平移或关节运动的帧中保持 <5 mm 有效接触的比例)。

数据集 方法 Acc Top-1 ↑ Acc Top-3 ↑ FID ↓ IV (cm³) ↓ ID (cm) ↓ CR (%)
ARCTIC GT 0.966 0.992 4.419 0.288 95.56
ARCTIC MDM 0.739 0.839 0.365 9.542 0.581 61.37
ARCTIC DiffH2O* 0.636 0.862 0.424 6.491 0.475 94.28
ARCTIC DiffH2O 0.560 0.823 0.547 6.412 0.527 94.91
ARCTIC LatentHOI 0.549 0.846 0.301 8.597 0.496 78.81
ARCTIC Text2HOI* 0.815 0.923 0.152 8.930 0.587 93.28
ARCTIC Text2HOI 0.816 0.927 0.148 8.281 0.524 97.33
ARCTIC JointHOI 0.948 0.983 0.033 4.406 0.426 93.71
GRAB GT 0.779 0.895 2.790 0.526 95.02
GRAB MDM 0.395 0.500 1.203 4.915 0.650 81.22
GRAB DiffH2O* 0.595 0.737 0.410 3.282 0.610 87.24
GRAB DiffH2O 0.458 0.526 0.533 3.607 0.846 87.82
GRAB LatentHOI 0.584 0.721 0.214 4.356 0.570 88.39
GRAB Text2HOI* 0.716 0.805 0.118 8.114 0.810 97.85
GRAB Text2HOI 0.711 0.831 0.116 7.790 0.778 98.24
GRAB JointHOI 0.663 0.847 0.031 3.419 0.525 93.00

196 帧序列在单张 A6000 上的推理开销:

指标 MDM DiffH2O LatentHOI Text2HOI JointHOI
时间 (s) ↓ 10.61 124.44 15.95 16.79 10.98
FPS ↑ 18.47 1.57 12.29 11.67 17.85

ARCTIC 上 JointHOI 取得了合成方法里最高的语义保真度(Top-1 0.948、Top-3 0.983,已接近真值运动的 0.966/0.992)与最低 FID(0.033,次优的 Text2HOI 是 0.148),同时把穿模压到 4.406 cm³——这个数字甚至略低于真值动作的 4.419,但注意它的穿透深度 0.426 cm 仍高于真值的 0.288 cm,所以不能读成"比真值还物理",只能说是穿模总面积被压得很小。它同时优于 oracle 辅助的 DiffH2O(抓握阶段直接用真值抓握信号)与去掉后处理的 Text2HOI。GRAB 上 JointHOI 拿到最好的 Top-3(0.847)与最低 FID(0.031,Text2HOI 0.116),但 Top-1(0.663)低于 Text2HOI 的 0.711——作者的解释是 Top-3 上的明显优势说明它对语义歧义的动作(如 use 与 inspect)更稳健,且穿模体积只有 Text2HOI 的一半出头(3.419 vs 7.790),穿透深度 0.525 cm 几乎与真值的 0.526 cm 持平。需要注意 CR 这一列不能按"越高越好"读:Text2HOI 的 CR(ARCTIC 97.33、GRAB 98.24)反而超过真值(95.56 / 95.02),正是因为穿模本身就能把接触比刷高,所以合理的读法是"CR 接近真值的同时 IV/ID 尽量低"。

消融实验

在 ARCTIC 上做逐项累加的增量消融,每一行在前一行基础上再加一个组件:

配置 Acc Top-1 ↑ Acc Top-3 ↑ FID ↓ IV (cm³) ↓ ID (cm) ↓ CR (%)
Baseline(两阶段) 0.520 0.738 0.291 8.096 0.528 73.40
+ 单阶段联合生成 0.795 0.919 0.274 7.057 0.548 81.72
+ 动态接触图(双手统一) 0.894 0.948 0.145 7.146 0.432 85.28
+ 动态接触图(左右分开) 0.935 0.981 0.038 6.988 0.439 92.21
+ Contact Inner Guidance 0.948 0.983 0.033 4.406 0.426 93.71

CIG 的损失设计与引导权重在原文图 4 中给出(本缓存无该图的数值表,故只述结论):作者对比了 None、\(\ell_1\)\(\ell_1\)+mask、cosine 与 Log-\(\ell_1\) 五种一致性形式,结论是强调近接触相对误差的 Log-\(\ell_1\) 取得最好的 Acc–ID 折中,\(\ell_1\)+mask 这类近邻感知变体也表现接近;权重 \(w\) 的扫描显示两个数据集上都存在一段很宽的稳定区间,Acc 几乎不变而 ID 稳定下降,因此统一取 \(w=0.05\)

关键发现

  • 单阶段联合生成是最大的单项增益:从两阶段基线切到一阶段联合训练,ARCTIC 上 Top-1 从 0.520 直接跳到 0.795,是消融里最大的一跳。这正面支持了"分阶段会累积误差"这一动机——把抓握/接触与运动合成放在同一个生成过程里,比先做交互再做动作要划算得多。
  • 接触表示从"静态/统一"走向"动态/分左右"贡献了最大的真实性提升:引入距离型动态接触图后 FID 从 0.274 降到 0.145;把左右手拆开再降到 0.038,翻了一倍多的改善幅度。这条链说明"接触必须是时变的信号"以及"双手接触不同质"两件事都不是锦上添花。
  • 穿模主要靠 CIG 压下来,而它不以牺牲语义为代价:动态接触图那一步 IV 甚至略微上升(7.057 → 7.146),Acc 与 FID 却大幅改善;真正的 IV 下降(6.988 → 4.406)发生在加上 CIG 之后,同时 Top-1 还从 0.935 微升到 0.948。这正是"CIG 是训练无关的推理期修正、而非又一个语义模型"的证据。
  • 引导能量为什么用对数尺度有了直接经验支持:只惩罚近接触区域相对误差的 Log-\(\ell_1\) 最优,与"近接触才决定真实感"的设计直觉一致;同时 CIG 对权重不敏感,说明它带来的收益不是靠精细调参换来的。
  • 效率上它几乎没有付出多阶段方法的代价:196 帧序列 10.98 s / 17.85 FPS,与单阶段的 MDM(10.61 s)基本持平,远快于同样显式建模接触的 Text2HOI(16.79 s)和两阶段的 DiffH2O(124.44 s)。CIG 的开销之所以可控,是因为它直接在锚点表示的接触上算能量,不需要求解额外的规划或优化问题。
  • 定性上受益的场景:双手协同("用双手检查方块"时基线常只有一只手真正参与)、细结构物体("双手戴眼镜",基线难以贴合镜框)、以及需要稳定控制的放置类动作("用右手放剪刀"时基线常出现漂浮或抓握不稳)。
  • 一个诚实的小瑕疵:GRAB 上 Top-1 输给了 Text2HOI。虽然在物理指标上大幅领先、Top-3 也更高,但"语义对齐全面最优"这句话并不成立。

亮点与洞察

  • 把"接触"从条件升级为内模态,是这篇论文最漂亮的一步:静态接触图只能当输入条件,而同时生成的运动与接触让"模型自己预测的接触"变成了一个可在推理时自检的对象——有了它才能做 CIG。也就是说,接触从"生成之前给定的约束"变成了"生成过程的一部分,并且可以反过来约束生成过程"。这个转换本身与具体网络无关,值得迁移。
  • 引导不需要额外网络:CIG 属于 classifier-based guidance,但"分类器"是一个闭式能量(显式接触与解析接触的对数差),因此不训练、不加模块、不做后处理。凡是任务里存在"显式预测的量"与"从预测几何解析出的同一个量"这种冗余对,都可以照搬这套自一致性引导(例如物理仿真里的速度场、深度估计里的多视图几何)。
  • 左右手分图带来的 FID 跳变是个有信息量的发现:合并表示会迫使两只手共享一套接触模式,而真实双手交互里主手与辅手的接触动力学差异很大,分开建模相当于给模型省去了"先解耦再耦合"的负担。
  • 锚点式接触表示把"接触"变成了一张固定大小的表:1024 个物体表面锚点既是监督目标、又是引导时的被比较对象,身份跨帧稳定、与物体位姿解耦。相比"逐帧在世界系里算接触",这种参数化让时间维度上的比对和梯度回传都干净得多。
  • 从"接触"可再往前一步的迁移思路:内模态不一定是接触图,也可以是接触力/接触法向这类更能刻画操作语义的量;而 CIG 的一致性损失甚至可以换成一个学到的接触判别器,把"物理合理性"从手写的对数差升级为可学习的先验。

局限与展望

  • 只在两个短片段数据集上验证:GRAB 最长 196 帧、ARCTIC 只有 64 帧,且都是单人双手与单个物体的桌面级交互。更长的任务级序列(拿取-使用-放置)与多物体场景没有覆盖,"长序列上联合去噪是否仍能维持接触一致"这个问题并未被回答。
  • 数据划分非官方:文本到 HOI 场景没有官方 split,作者自建的平衡测试集虽然对所有方法一致,但与别人论文里的数字不能直接横向比较。
  • 接触图的几何精度受限于 1024 个锚点与"顶点最小距离"近似:对眼镜、剪刀这类细结构物体,1024 个锚点的采样密度可能不足以刻画关键接触区;用网格顶点的最小距离近似表面距离虽然可微高效,但在薄壁或凹陷部位会有偏差。
  • 物体侧的表达能力有限:关节物体只用一个标量关节角描述,无法覆盖多自由度或可变形的物体;锚点固定在规范系也意味着物体一旦发生形变(布料、软体)表示就失效。
  • 物理指标之间存在耦合:CR 会被穿模抬高(Text2HOI 的 CR 超过真值即是明证),因此"物理合理性"实际上要靠 IV/ID/CR 三者的折中人工判读,缺少一个单一的、抗博弈的物理指标。
  • GRAB 上语义并未全面领先:Top-1 低于 Text2HOI,说明直接借接触图做条件的那条路线在语义歧义小的数据集上仍有优势;本文的相对优势集中在运动真实性与物理合理性。
  • 可以尝试的改进方向:把锚点做成自适应密度或学习出来的查询点,让细结构区域获得更多表示能力;把 CIG 的一致性约束从"接触距离"扩展到接触法向/局部表面朝向,直接抑制滑动过程中的错误朝向;把物体关节表示换成多维关节向量,向多指多关节物体推广。

相关工作与启发

  • vs Text2HOI:他们也显式用接触图,但接触图是静态、二值的,且作为运动生成的前置条件,后面还要接一个后处理精修模块;本文的接触图是逐帧连续的距离场,与运动在同一个扩散过程里联合生成,且不依赖任何后处理。代价是 GRAB 上本文的 Top-1 语义指标略低(0.663 vs 0.711),但物理合理性(IV 3.419 vs 7.790)与 FID(0.031 vs 0.116)大幅领先。这也说明"接触条件化"与"接触联合生成"各有适用面:前者在语义上更"贴题",后者在物理自洽上更强。
  • vs DiffH2O:两阶段(先抓握后动作),本文将抓握与动作合成合并为一个扩散过程;即便把抓握阶段直接喂真值(DiffH2O*),ARCTIC 上 Top-1 仍只有 0.636,远低于本文的 0.948,而且 DiffH2O 的推理时间(124.44 s)是本文的十倍以上。
  • vs LatentHOI / HOI-GPT:两者都把交互关系放到隐空间或自回归 token 里,好处是不需要人工设计接触表示,坏处是接触信号不可检查、无法在采样时施加约束;本文用显式的锚点距离场同时换来了可解释性与可引导性,但引入了"锚点密度"这一新的表示瓶颈。
  • vs HOIDINI / CODA(推理期接触约束优化):那类方法靠噪声优化(如 DNO)在推理时满足接触约束,往往需要几百步;本文把接触直接生成出来,引导只需在本来就要做的采样步上多一次反传(10.98 s vs Text2HOI 16.79 s),代价结构完全不同。
  • vs BimArt:BimArt 也预测 HOI 接触图,但假定物体轨迹已知;本文面向的是物体运动也要一并合成的文本到 HOI 设定,接触、物体与手是三者互相约束的。
  • 方法论的启发:把"可从主输出解析出来的量"当作额外的生成目标联合建模(VideoJAM 的光流、Redi 的特征、本文的接触图),是一种成本低、收益直接的增强手段;更关键的是,这类内生模态在推理时天然提供了一组自一致性检查,可以直接转化成无需额外训练的引导信号——凡是任务里存在冗余的中间量,这条路径都可以复制。

评分

  • 新颖性: ⭐⭐⭐⭐ "把接触当内生模态 + 用自生成接触做推理期引导"是一个干净的组合,联合生成和自一致性引导各自不算首创,但落到 HOI 生成上解决了真实痛点。
  • 实验充分度: ⭐⭐⭐⭐ 两个数据集、六个指标、四条基线含 oracle 辅助与去后处理变体、逐项增量消融加引导损失/权重分析都齐了;扣分在于缺官方划分、序列偏短、也没报告方差与显著性。
  • 写作质量: ⭐⭐⭐⭐ 动机链与三个设计的因果交代清楚,设计矩阵表把与四条基线的差别一次说清;但接触能量公式的排版/表述前后不一致(log-ratio vs Log-ℓ1),部分图表信息只存在于图里。
  • 价值: ⭐⭐⭐⭐⭐ 单阶段、无后处理、推理快,且在物理合理性上给出可观的量化改善,对机器人操作与 AR/VR 动画这类在乎接触稳定性的应用有直接价值。