跳转至

Soft Geometric Inductive Bias for Object Centric Dynamics

会议: NeurIPS2026
arXiv: 2512.15493
代码: https://github.com/hlinander/soft-geometric-inductive-bias
领域: 物理/科学计算、对象中心动力学
关键词: 软几何归纳偏置、Clifford 代数、几何注意力、块因果建模、动力学预测

一句话总结

本文把已给定的对象状态编码为 Clifford 多向量,用不强制精确等变的几何乘积层和块因果 Transformer 学习下一时刻状态,在墙面碰撞、各向异性约束和真实交通轨迹等对称性破缺场景中改善预测与自回归 rollout。

研究背景与动机

对象中心世界模型将场景拆成对象及其相互作用,适合学习碰撞、运动和多对象组合关系。对象位置、速度与朝向天然具有几何结构,严格等变网络因此能减少模型重新学习旋转或平移关系的负担。然而,这种优势依赖输入与任务真正满足所假定的对称性;现实环境中的固定边界、重力方向、材料差异和交通规则并不总能随对象一起变换。

本文的关键例子是箱内刚体运动:动态对象的状态作为输入,静态墙面却没有编码成对象。只旋转或平移这些动态状态,不能同时旋转或平移箱子,因而观察到的转移规律不是严格的几何等变映射。硬性要求模型等变,会限制它学习墙面附近的特殊响应;完全普通的 MLP 或 Transformer 又可能需要更多数据才能学会基本运动与接触规律。作者要解决的不是从图像发现对象,而是在对象状态已知的条件下,怎样保留有用的几何参数化,同时容纳环境造成的非等变动力学。

Clifford 代数提供了一种可选路径:状态和变换都能用多向量表示,几何乘积则为特征交互提供结构。作者不把每一层限制在严格等变算子内,而是允许可学习的多向量权重改变不同几何分量之间的关系。核心 idea:用几何代数规定模型表达动力学的方式,而不是用精确等变约束规定它只能表达哪些动力学,再通过按时间块组织的对象注意力学习连续状态转移。

方法详解

整体框架

输入是一段具有对象身份对应关系的状态序列,而非原始图像。每个对象在每个时刻对应一个 token;位置、速度、朝向等量分别嵌入多向量通道。模型先扩展通道并加入时间位置编码,再将时间和对象两维展平成 token 序列,经过几何乘积参数化、几何注意力和块因果时序建模,输出所有对象的下一帧状态。

二维采用 \(Cl(2,0,1)\),每个多向量有 8 个实数分量;三维采用 \(Cl(3,0,1)\),有 16 个分量。二维序列的组织方式是 \((B,S,K,C,8)\),其中批次、时间、对象和通道各自有独立含义;展平后成为 \((B,SK,C,8)\)。这不是把一个对象的 8 个代数分量当成 8 个 token,而是让它们共同组成一个对象 token 的内部表示。

训练时输入真实历史,监督信号也是下一帧的真实多向量;推理时则把预测结果继续送入模型,形成自回归 rollout。连续变量的训练误差在多向量空间计算,展示或评估对象轨迹时才解码到对象坐标。Waymo 还包含活动标记,其二元监督与连续状态监督分开处理。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["已给定对象状态<br/>训练:真实历史"] --> B["多向量嵌入<br/>通道扩展与时间编码"]
    B --> C["几何乘积参数化"]
    C --> D["几何注意力"]
    D --> E["块因果时序建模"]
    E --> F["下一帧多向量<br/>解码对象状态"]
    F -->|推理:rollout 回馈| A
    F -.->|训练:连续变量| L["多向量 L2<br/>活动标记 BCE"]
    G["真实下一帧<br/>仅作训练监督"] -.-> L

关键设计

1. 几何乘积参数化:保留结构化交互,但不把非等变动力学排除在外

普通线性层直接混合实数特征,本文则让权重本身也是多向量,并通过几何乘积作用于输入。二维位置使用投影相关的双向量分量,速度使用向量分量,朝向与角速度使用旋量表示;圆形对象的这些量分别占据 4 个多向量通道,形状相关信息也可以加入。不同物理量既不必挤进单一标量向量,也能在共同的代数中交互。

主要软模型 S-CliffordTransformer 使用单侧几何乘积,S-Ad-CliffordTransformer 使用夹心乘积。下面保留两种核心映射,重复的通道索引表示求和,星号表示几何乘积:

\[ \mathrm{S}(x)^i=W^{ij}\star x_j,\qquad \mathrm{S}_{\mathrm{Ad}}(x)^i=W^{ij}\star x_j\star(W^{ij})^r. \]

夹心形式更直接地借用了几何变换的参数化,但上标 \(r\) 是 Clifford reverse,不是 inverse;可学习权重也没有被限制为合法的单位旋量。因此不能把该层解释为每次都执行一个严格刚体变换。层间采用门控 sigmoid 非线性,注意力与 MLP 子层仍有残差连接。

“软”在这里指架构参数化,而不是另加一个等变正则化损失,也不是数学上保证近似等变误差很小。附录用几何乘积的非交换性解释:固定权重一般不能与作用于输入的群变换交换,所以单侧映射及夹心映射均不保证精确等变。对照模型 E-CliffordTransformer 则使用按代数阶次组织的等变线性组合,限制更强。

这种设计针对的正是未显式建模的固定环境:模型仍能借几何乘积学习运动关系,但可学习权重允许它对某一绝对方向或墙面区域产生特殊响应。代价是失去了严格的群对称性保证;效果必须靠实验判断,不能仅由“使用 Clifford 代数”推出。

原文嵌入约定存在需要保留的差异:方法节将二维朝向写为 \(\cos(\theta)+\sin(\theta)e_{12}\),Waymo 描述及代数附录则写为 \(\cos(\theta/2)+\sin(\theta/2)e_{12}\)。两者涉及完整角度与半角的不同约定,原文没有统一说明;复现时应核查代码,不能在笔记中直接认定一种是作者实际使用的唯一形式。

2. 几何注意力:在代数中比较对象,并用可学习投影传递状态信息

多向量的查询、键和值由相应线性映射生成,注意力相似度不是随意把所有分量做普通点积,而是使用投影几何代数诱导的内积。二维情况下,只有标量、两个欧氏向量分量及其平面双向量分量贡献相似度,投影基相关分量不直接参与。这把代数结构引入对象之间的匹配,而不只是给普通 Transformer 换一个输入编码。

不直接参与内积,不等于位置信息被整个网络丢弃:前面的可学习多向量投影与几何乘积能改变各分量的组合,值分支也继续携带多向量信息。但由于这些投影可以非等变,使用几何内积本身并不足以让整个注意力层或网络精确等变。

原文式 (4) 的缩放因子位于 softmax 外,按其写法保留如下:

\[ \mathrm{att}(x)_i=\frac{1}{\sqrt{dC}}\mathrm{softmax}_j\!\left(Q(x)_i\cdot K(x)_j\right)V(x)_j. \]

其中 \(d\) 是代数维数,\(C\) 是多向量通道数。该位置不同于常见的“在 softmax 前缩放 logits”;两种写法分别影响输出幅度与注意力分布,不应视为等价。缓存原文未解释这一差异,笔记不把缩放因子擅自移入 softmax,也不据此猜测实现。

3. 块因果时序建模:同帧对象联合推理,未来帧仍不可见

若把展平后的对象序列套上逐 token 的下三角遮罩,同一帧中排在前面的对象就看不到排在后面的对象,预测将依赖人为的对象排序。本文按“时间帧”而非“单个对象”切分因果块:一个时刻的所有对象可以互相注意,同时可以访问更早时刻,不能访问未来时刻。每个对象的输出监督对应它在下一帧的状态,所以这不构成偷看下一帧标签。

具体而言,当前帧的两个刚体在预测下一帧时都能读取彼此的当前位置与速度,碰撞判断不必等另一个对象被顺序生成。下一帧所有对象并行输出,再整体进入下一次预测;所谓 next-token objective 在这里不意味着逐个对象自回归。时间正弦位置编码负责标记历史顺序,块因果遮罩负责限制可见范围。

这种组织还把真实数据与合成物理任务放在同一套框架内。Waymo 每帧最多有 32 个 actor、64 个车道中心线片段和 24 个其他地图 token,共 120 个 token;地图提供静态环境信息,actor 携带动态状态。51 个类别特征放在额外多向量通道的标量分量中,避免把所有交通信息都误当作几何向量。

需要区别两个任务的环境可见性:Kinetix 中墙面没有进入动态对象输入,Waymo 中却显式包含车道和地图。论文并不是在所有数据集上都完全忽略静态环境,也不能把 Waymo 的提升全部归结为“学会隐藏的墙”。

一个完整示例

以有墙面和重力的 10 个多边形场景、2 帧上下文为例,展平后有 20 个对象 token。后一帧的任一对象可以访问这 20 个 token;前一帧对象只能访问前一帧的 10 个 token。后一帧的 10 个输出共同预测第三帧,而不是先预测第一个对象,再用其预测帮助生成其他对象。

训练时,第三帧真实状态仅用于监督,下一段历史仍来自真实轨迹。rollout 时,预测的第三帧加入上下文,再预测第四帧;因此墙面响应的小误差可能逐步积累。模型没有得到显式墙面 token,软参数化允许它从状态与训练分布学习固定边界附近的转移规律,但不保证换一个箱子后仍能正确泛化。

损失函数 / 训练策略

连续状态使用预测与目标多向量之间的 L2 损失,Waymo 对相关 token 的活动标记增加二元交叉熵。Waymo 的回归目标具体是 actor 位置增量和朝向旋量增量;不能把它描述成对全部地图 token 都预测运动。训练采用 teacher forcing,没有为了缓解 rollout 漂移加入训练噪声,从而尽量单独观察几何偏置的贡献。

主配置为 10 个 block、8 个 head、24 个多向量通道,约 1.5M 参数。普通 Transformer 保留相同注意力块与块因果组织,通过调整嵌入宽度匹配参数量;因此对比不只是“Transformer 对 MLP”,也检验了几何参数化相对于普通注意力的增益。

所有模型使用 batch size 128、AdamW 和学习率 \(5\times10^{-4}\)。Transformer 与 CliffordMLP 的 weight decay 为 \(10^{-7}\),普通 MLP 为 \(3\times10^{-6}\)。作者报告 Kinetix 10k 配置在单张 A100 上约 20 小时收敛;这是特定训练配置,不是任意数据规模的统一耗时。

实验关键数据

主实验

实验覆盖箱内二维刚体、三维带电粒子和 Waymo 交通轨迹。Kinetix 数据生成描述为 100 或 1000 个 episode、每个 128 帧,即 12,800 或 128,000 帧;部分实验图标作 10k,应保留这种命名差异,不能把所有图都直接认作相同精确帧数。三维实验使用 5 个粒子、3000 条训练轨迹、每条 50 帧。

下表取自附录表 2,是 4096 个训练场景的 Waymo 下一步 XY 位置 RMSE,不是 1.6 秒 rollout ADE,也不是跨数据集的统一总误差。数值越低越好。

对象类型 S-CliffordTransformer E-CliffordTransformer Transformer
SDC(自驾驶车辆) 0.0334 0.0708 0.1023
Non-SDC(其他参与者) 4.5321 4.6867 4.8162

SDC 上软模型的优势明显,Non-SDC 上优势较小且绝对误差高得多,说明不同 actor 子集的难度差异不可忽略。不能用 SDC 的结果概括所有道路参与者。

长时预测方面,Kinetix 主文考察到 35 帧:1 帧上下文配置中,S-Ad-CliffordTransformer 在该最长时域表现最好;增加到 2 帧上下文后,普通 Transformer 在短 rollout 上可以接近 Clifford 模型,但长 rollout 仍拉开差距。这也说明“软模型始终在所有条件下第一”不是正确概括。

Waymo 主文段落把图 7 称为位置 RMSE,而指标节和图注将其标为 1.6 秒 ADE;本笔记保留这一原文冲突,不把两者合并。图 7 比较 4k 与 16k 场景,16k 点是 single-seed runs,不能据此宣称两个规模均完成多随机种子验证。缓存未提供图 7 的精确纵轴数值,因此不填造 ADE 数字。

消融实验

附录表 3、4 的逐变量分析揭示软模型并非全面胜出。下表沿用同一 4096 场景设置,属于输出变量分析,而不是“删除某模块”的消融;只列最能检验结论边界的项。

对象类型与指标 S-CliffordTransformer E-CliffordTransformer Transformer 最低误差
SDC:x 位置 RMSE 0.0163 0.0369 0.0703 S-CliffordTransformer
SDC:y 速度 RMSE 0.0682 0.0651 0.0775 E-CliffordTransformer
SDC:合并速度 RMSE 0.0791 0.0777 0.1028 E-CliffordTransformer
SDC:朝向 RMSE(rad) 0.0083 0.0084 0.0099 S-CliffordTransformer
Non-SDC:合并速度 RMSE 0.6514 0.6603 1.0993 S-CliffordTransformer
Non-SDC:朝向 RMSE(rad) 0.2337 0.2270 0.2261 Transformer

更直接检验机制的受控实验是三维对称性破缺。作者沿 z 轴施加恒定重力或位置相关的谐振约束;约束强度 \(k_z\in\{0,0.5,1,3,10\}\) 增大时,E-CliffordTransformer 相对软模型变差,而单纯加入恒定重力时二者接近。这里的证据是原文图 5 及其说明,缓存没有可可靠提取的逐点数值。

架构附录还比较 block 数 5、10、20,head 数 4、8、16,以及软模型通道数 12、24、48。作者选用普通 Transformer 表现较好的 10 block、8 head 和宽度 64,再将 Clifford 模型匹配到 24 个多向量通道;这减轻了故意给基线选差配置的疑虑,但参数匹配不等于 FLOPs 匹配。

关键发现

  • 墙面碰撞比自由运动更能检验软偏置:自由运动中严格等变模型可以最低误差,墙面碰撞中软模型更占优势。结论是根据对称性是否成立选约束,而不是一概放弃等变性。
  • rollout RMSE 比较预测轨迹与同一初态的真实轨迹;Euler RMSE 则从模型当前预测状态再做一次真实模拟,与下一步预测比较。后者用于区分局部动力学误差与历史累积漂移,并非另一种长时轨迹 ADE。
  • 附录定性例子仍有能量消散过快、碰撞后轨迹偏移等问题。更低误差并不意味着精确守恒,也不意味着可以无漂移地无限 rollout。

亮点与洞察

  • 几何表示与严格等变约束可以拆开。多向量和几何乘积仍提供结构,但非等变权重允许学习固定环境造成的例外,这一思路适合有明确几何状态、却存在遗漏环境变量的预测任务。
  • 以时间帧为因果单位很契合相互作用系统。对象之间共享同一帧的信息,同时保留时间方向,避免把人为 token 顺序变成物理依赖关系。
  • 对称性破缺实验比单纯多报一个数据集更有解释力。位置相关约束强度可控,让“硬约束何时成为负担”与实际误差变化建立联系,而不是只凭交通数据结果推测原因。

局限与展望

  • 输入假定已有对象状态与身份对应关系,未验证从图像提取对象、处理严重遮挡或联合学习感知与动力学。若上游 slots 没有明确几何含义,多向量嵌入的优势未必直接成立。
  • 软几何偏置没有显式等变误差或守恒约束保证,长时 rollout 仍漂移。可进一步研究在保持非等变表达能力的同时,加入接触有效性或能量行为检查,但这些不是本文已有模块。
  • 对比范围主要是参数匹配的 MLP、Transformer 和等变 Clifford 变体,不能据此声称超过所有物理模拟或交通预测方法。本文也未证明非自回归任务同样受益。
  • Waymo 大规模结果存在单种子边界,正文与图注的指标名称也不一致;半角嵌入及式 (4) 缩放位置需在复现中核查。另一个附录表述差异是混合对象实验图注写 10 帧,随后正文写 20 帧,不宜将其当作统一已确认的时域。
  • 几何乘积有额外计算开销,训练数据效率提升不能直接等同于运行时间或固定 FLOPs 效率提升。作者引用相关架构的固定预算研究,并不替代本文自身的完整计算效率评测。

相关工作与启发

  • 与 GATr 的关系:都使用几何代数表示及注意力,但 GATr 的等变映射强调严格群结构,本文重点是放松投影与 MLP 的约束。它还学习可重复使用的下一步转移模型,而非仅从初态预测短期积分后的终态。
  • 与 Residual Pathway Priors 的关系:后者通过残差路径及先验容纳对称性偏离;本文选择非等变 Clifford 层这一结构参数化。不能把两者都简单描述为“在损失中增加软等变正则项”。
  • 与 SlotFormer 等对象中心模型的关系:这些工作涉及从视觉内容获得对象表征并预测动态,本文把对象状态已知作为前提,单独检验几何动力学。潜在后续方向是连接感知模型,但需要验证 slots 能否提供稳定、可解码的几何量。

评分

  • 新颖性: 4/5。将非等变 Clifford 参数化与对象时间块建模结合,机制清楚,但复用了几何代数注意力等已有构件。
  • 实验充分度: 4/5。覆盖二维、三维和真实轨迹,并有可控破缺实验;计算预算与大规模多种子证据仍不完整。
  • 写作质量: 3/5。问题与机制易理解,但旋量角度、注意力缩放及部分指标和时域表述需要核对。
  • 价值: 4/5。为近似对称的动力学提供可复用结构,适用范围以已有几何对象状态和自回归预测为主。