Objects as Audio-Visual Modal Sound Fields¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 撞击声合成、视听多模态、3D高斯泼溅、模态声音场、物理先验
一句话总结¶
提出视听模态声音场(AV-MSF),将 3D 高斯泼溅视觉几何先验与紧凑的物理模态振动参数相结合,仅需多视角图像和少量撞击录音即可高保真重建空间连续的物体级撞击声场,并支持撞击定位与文本驱动的声音编辑。
研究背景与动机¶
人类对物理世界的感知不仅依赖视觉观察,更依赖与物体的物理交互所激发的振动与声音反馈。日常生活中,仅凭被动视觉观察很难区分材质相近但力学属性迥异的物体,例如外观几乎一致的透明高脚杯,敲击时玻璃会发出清脆持久的高频余音,而塑料则呈现沉闷且迅速衰减的声响。这种撞击声音内嵌了物体的弹性模量、密度、刚度、厚度及内部结构等关键物理属性。然而,当前主流的三维物体数字化管线(如 NeRF、3D Gaussian Splatting)大多专注于几何重构与高保真外观渲染,缺乏对物理交互声学特性的建模,制约了高拟真虚拟现实交互、具身智能多模态仿真等场景的发展。
现有物体撞击声建模方法主要分为两大学派,但在实用性与保真度上面临严峻瓶颈。基于经典线性模态分析的物理仿真方法依赖高精度三维体积网格及精确的材料常数(杨氏模量、泊松比与瑞利阻尼),计算开销极大且高度敏感于材料参数误差;即便借助近期提出的可微反向渲染流水线(如 DiffSound),长优化链条与高阶有限元求解依然极易陷入局部最优。另一方面,基于数据驱动的生成式声学模型(如 SonicGauss)虽然无需网格模拟,但高度依赖海量训练数据,缺乏明确的物理约束,在少样本敲击条件下极易产生失真与幻觉,且无法泛化到未知的物理交互位置。
解决这一矛盾的关键在于利用物理规律与视觉先验之间的内在关联:一方面,物体撞击声音随敲击位置平滑变化,且与局部表面几何(如曲率、厚度、对称部位)高度相关;另一方面,刚体振动可解耦为由物体形状与材料决定的全局模态频率与衰减系数,以及随敲击坐标变化的局部空间激发增益。核心 idea:将物体撞击声场解耦为全局固有的紧凑模态参数与空间连续的神经增益场,利用 3D 高斯泼溅提升的几何与对称对齐视觉特征提供强先验,仅需多视角图像与极少量真实敲击录音即可实现物理自洽的撞击声合成、敲击定位与材质编辑。
方法详解¶
整体框架¶
AV-MSF 接收标定的多视角 RGB 图像集合与物体表面稀疏采样点处的少样本撞击音频录音,构建出可连续查询的三维物体级模态声音场。整体流水线包含三个紧密耦合的阶段:首先在视觉处理阶段,利用 3DGS 建立物体的三维几何表征,并将预训练 DINOv2 特征提升至三维高斯点上,施加对称性对齐与聚类池化以构建紧凑的区域视觉先验;其次在声学处理阶段,通过窄带滤波与希尔伯特变换从参考音频中提取全局固有模态频率、初始阻尼,并对非模态环境底噪进行频带残差建模;最后在模态声场重建阶段,通过局部几何偏置编码与跨区域注意力机制,利用神经网络预测任意查询坐标处的模态增益,驱动可微模态声音合成器完成高保真端到端优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
InV["多视角 RGB 图像"] --> D1["几何对称感知的三维视觉特征场<br/>3DGS点云重构 + DINOv2特征提拉 + 对称对齐池化"]
InA["少样本撞击音频与点位"] --> D2["模态参数物理提取与环境残差解耦<br/>STFT窄带分解 + 希尔伯特阻尼回归 + 频带噪声滤波"]
D1 --> D3["局部与全局上下文协同的神经增益场<br/>空间聚类 + 相对偏移位置编码 + 跨区域注意力"]
InA --> D3
D2 --> D3
D2 --> Syn["可微模态声音合成器<br/>正弦振动模态衰减叠加 + 频带噪声残差"]
D3 --> Syn
Syn --> Out["新位置撞击声渲染 / 撞击定位"]
Out --> D4["物理自洽的分层频率声音编辑<br/>全局音高缩放 + 模态残差微调 + Audio-SDS蒸馏"]
关键设计¶
1. 几何对称感知的三维视觉特征场:消除视角光照干扰并强化物理几何对称性
直接将二维预训练特征提升至三维表面常因视角差异与光照阴影导致特征在物理对称区域不一致,进而破坏声学振型预测的对称性。本文首先利用 3D Gaussian Splatting(3DGS)重建稠密的三维高斯中心点云 \(\mathcal{P} = \{o_i\}_{i=1}^O\),将 DINOv2 提取的多视角二维嵌入投影并赋予每个高斯中心得到特征向量 \(f_i \in \mathbb{R}^D\)。为了确保物理一致性,系统自动检测物体的旋转或镜面对称变换,通过候选几何对齐误差确定对称群,并在对应对称轨道(orbit pooling)或镜像对应点间对特征执行平均池化,生成精炼特征 \(f_i^{\text{refined}}\)。随后,在三维欧氏空间将高斯中心聚类为 \(K\) 个空间簇,计算每个簇内高斯特征的均值向量 \(\bar{f}_k = \frac{1}{|\mathcal{C}_k|} \sum_{i \in \mathcal{C}_k} f_i\),构成紧凑且具有几何拓扑意识的全局区域特征库。
2. 模态参数物理提取与环境残差解耦:为非凸优化锚定物理基准
直接从稀疏撞击音频优化模态声音场的参数高度非凸,极易收敛至不符合声学规律的局部极小值,且真实录音中往往混杂了敲击力度差异与低频环境噪声。本文基于线性模态动力学中频率与衰减是物体全局固有属性的物理定律,通过短时傅里叶变换(STFT)及其逆变换将音频分解为各个频带窄带信号 \(s_{j,n}(t)\)。在过滤掉非显著阻尼和异常时间峰值后,利用希尔伯特变换 \(\mathcal{H}\) 对窄带包络进行对数线性回归:
提取每个频段的初始阻尼系数 \(d_n\) 与候选增益 \(g_n\)。通过跨录音统计共有峰值频率,获得全局共享的模态频率 \(\{f_i\}_{i=1}^N\) 与平均阻尼 \(\{d_i\}_{i=1}^N\)。同时,针对接触力波动与麦克风距离引起的非模态扰动,将非模态残差建模为可微可学习频带能量幅值 \(m = \{m_i\}_{i=1}^F\) 调制的静态滤波噪声 \(\epsilon(m, t) = \sum_{i=1}^F m_i (b_i * \epsilon(t))\),有效将环境噪声从物理模态振动中剥离。
3. 局部与全局上下文协同的神经增益场:自适应预测空间连续的模态激励
给定物体表面任意查询撞击坐标 \(x \in \mathbb{R}^3\),模型需准确预测各个振动模态在此处的激励增益向量 \(\mathcal{G}_\theta(x) = [g_1(x), \dots, g_N(x)]^\top\)。本文采用局部细粒度几何与全局结构注意力相融合的机制:首先检索距离 \(x\) 最近的高斯中心点 \(i^\star = \arg\min_i \|x - x_i\|_2\),取出局部高斯特征 \(f_{i^\star}\);同时计算查询点到所有 \(K\) 个空间聚类中心的相对位移向量 \(r_k = x_{i^\star} - c_k\),并通过正弦-余弦高频位置编码生成几何上下文向量 \(\text{PE}(r)\)。将局部特征与位置编码拼接生成查询向量 \(q = W_q [\text{PE}(r); f_{i^\star}]\),并以各区域聚类描述子投影生成键值对 \(k_k = W_k \bar{f}_k, v_k = W_v \bar{f}_k\)。通过点积注意力聚合全局上下文特征:
最终由轻量级多层感知机 \(\mathcal{G}_\theta(x) = \text{MLP}_\theta(z; f_{i^\star})\) 输出该坐标处的各模态增益,实现了局部微观几何与宏观形体结构对振动激励强度的协同约束。
4. 物理自洽的分层频率声音编辑:在跨材质扩散引导下保持空间振型守恒
为了支持基于自然语言提示词的材质音效泛化编辑,本文结合预训练文本生成音频扩散模型引入 Audio-SDS 分数蒸馏。针对独立优化模态频率因稀疏频峰与大谱间隙难以收敛至对比材料(如从陶瓷变换到木材)的问题,提出分层频率参数化表达:\(f_i = \exp(\log \alpha + \log f_{i,\text{init}} + \Delta f_i)\),其中标量 \(\alpha\) 负责全局基频与音高整体缩放,而 \(\Delta f_i\) 负责各振动模态的精细残差微调。更为关键的是,根据线性弹性动力学原理,改变材料的杨氏模量、密度与瑞利阻尼仅会全局缩放固有频率与阻尼比,而物体的空间振型(mode shapes)保持不变。这意味着任意两处撞击位置的模态增益比值在材料替换前后严格守恒:
该物理守恒定律使得模型无需重新优化空间神经增益场,仅更新全局标量与模态频率参数即可无缝完成完全物理自洽的跨材质音效生成。
损失函数 / 训练策略¶
模型采用两阶段优化训练。在热身阶段(Warm-up Stage),直接使用第二关键设计中提取的目标增益向量 \(g_i\) 监督神经增益场,最小化均方误差损失以锚定参数初值:
在端到端联合训练阶段,可微合成器输出预测波形 \(\hat{s}_i(t) = \sum_{k=1}^N \mathcal{G}_\theta(x_i) e^{-d_k t} \sin(2\pi f_k t) + \epsilon(m, t)\),通过多尺度 STFT 损失在整段波形与瞬态起始段 \(s_i[:t]\)(能量最集中、噪声干扰最弱的时间窗)上联合监督优化:
其中 \(r\) 索引不同的 FFT 分辨率窗口,\(w_c\) 为起始截断损失权重。
实验关键数据¶
主实验¶
在两个真实世界多模态撞击声基准数据集 ObjectFolder Real(100 个物体,20% 稀疏样本训练)与 RealImpact(50 个物体,留一法交叉验证)上评估新位置撞击声渲染质量,评估指标包括声谱 L1 距离(L1)、对数梅尔谱 L1 距离(L1 Log)、振幅包络距离(ENV)以及感知音频相似度(CDPAM,越低越好)。
| 数据集 | 方法 | L1 ↓ | L1 Log ↓ | ENV ↓ | CDPAM ↓ |
|---|---|---|---|---|---|
| ObjectFolder Real | White Noise | 3.774 | 6.859 | 0.305 | 1.35e-3 |
| Random Impact | 0.035 | 1.367 | 0.019 | 2.47e-4 | |
| KNN (\(K=3\)) | 0.014 | 0.930 | 0.014 | 1.53e-4 | |
| DiffSound (Physics-based) | 0.031 | 1.298 | 0.030 | 2.53e-4 | |
| SonicGauss (Data-driven) | 0.033 | 1.281 | 0.018 | 2.01e-4 | |
| Ours (AV-MSF) | 0.013 | 0.951 | 0.014 | 1.35e-4 | |
| RealImpact | White Noise | 3.789 | 7.258 | 0.308 | 1.23e-3 |
| Random Impact | 0.039 | 1.582 | 0.022 | 2.71e-4 | |
| KNN (\(K=3\)) | 0.026 | 1.036 | 0.017 | 2.25e-4 | |
| DiffSound (Physics-based) | 0.029 | 1.533 | 0.024 | 2.39e-4 | |
| SonicGauss (Data-driven) | 0.039 | 1.580 | 0.025 | 2.43e-4 | |
| Ours (AV-MSF) | 0.021 | 0.996 | 0.017 | 2.16e-4 |
消融实验¶
在 ObjectFolder Real 子集上评估各个核心组件的消融效果,证明了特征提升、参数初始化、对称对齐与残差噪声建模的不可替代性。
| 配置 | L1 ↓ | L1 Log ↓ | ENV ↓ | CDPAM ↓ | 说明 |
|---|---|---|---|---|---|
| Full model (Ours) | 0.019 | 0.927 | 0.015 | 2.00e-4 | 完整模型配置 |
| w/o visual | 0.028 | 1.148 | 0.015 | 4.20e-4 | 移除 DINOv2 视觉特征(仅靠坐标)感知质量大幅劣化 |
| w/o init | 0.045 | 1.077 | 0.026 | 2.97e-4 | 移除模态参数提取与热身,优化陷于局部极值 |
| w/o align | 0.019 | 1.002 | 0.016 | 2.62e-4 | 移除几何对称对齐,对称区域声学预测失真 |
| w/o residual | 0.031 | 5.764 | 0.026 | 3.22e-4 | 移除环境噪声残差建模,对数谱误差剧烈恶化 |
此外,针对非对称物体的个案研究及下游任务评估显示: - 非对称物体测试:在非对称子集上,KNN 基线因失去镜像先验而性能下降(L1: 0.0135, L1 Log: 0.9724),而本文方法凭借空间连续增益场显著占优(L1: 0.0110, L1 Log: 0.9259, CDPAM: 1.53e-4)。 - 撞击接触定位(RMED ↓):基于余弦距离匹配反向定位撞击点坐标,DiffSound 误差为 41.78%,而 AV-MSF 降低至 34.61%。 - 材质声音编辑(UMAP 语义距离 ↓):直接文本生成基线为 3.077,标准 Audio-SDS 为 4.234,而本文分层优化方案达到 2.753。
关键发现¶
- 物理与视觉融合解决少样本困境:相较于预训练在大规模合成数据上的 SonicGauss,AV-MSF 在仅有 20% 敲击数据时取得了翻倍的重建精度提升,彻底克服了纯数据驱动模型在稀疏采样下的幻觉失真问题。
- 残差建模对解耦物理模态至关重要:消融数据显示,去掉频带残差噪声模块后,L1 Log 指标从 0.927 剧增至 5.764,且定位误差从 38.4% 扩大至 43.8%。这表明若不显式剥离非模态环境噪声,增益场将被迫拟合高频扰动与底噪,破坏物理模态表征。
- 视觉特征超越粗糙几何:仅使用 3D 坐标而移除 DINOv2 视觉语义时,CDPAM 感知误差增加了一倍以上,证实预训练视觉模型能够有效感知表面曲率、边缘与材料质感等细微声学特征。
亮点与洞察¶
- 模态解耦实现少样本极致泛化:将声学场严格拆解为位置无关的全局物理固有模态(频率/衰减)与空间变化的局部增益场,大幅降低了待估计参数的自由度,使得仅凭数个敲击点位即可泛化全表面。
- 声学振型不变性驱动物理自洽编辑:巧妙利用连续介质力学中“均质材料变换保持固有模态振型比值恒定”的物理规律,将复杂的跨材质生成约束在低维频率缩放空间,保证了编辑后三维声场的物理协调性。
- 跨模态对称性对齐:针对神经视觉特征在多视角投影中的不对称破缺,提出基于几何变换误差检测的轨道特征池化,在无需人工先验的情况下自动对齐了物体的视听物理对称性。
局限与展望¶
- 均质单材料假设:当前方法主要面向单一均质材料物体展开建模,对于复合材料拼装物体(如带有金属把手的木柄锤、镶嵌橡胶底座的陶瓷杯),各位置模态频率与阻尼的不一致性仍需进一步建模。
- 声源力学接触模型简化:目前依赖预先采集的敲击力传感器曲线进行力幅值归一化,未来可将敲击头材质(如橡胶槌、金属杆)与接触弹性力学模型直接纳入可微声场表征中。
- 全频带相位恢复:当前模态合成假设静止初始状态且各模态相位理想对齐,对于高频复杂的瞬态摩擦与非线性混沌碰撞声的建模仍有提升空间。
相关工作与启发¶
- vs DiffSound (SIGGRAPH 2024): DiffSound 采用基于高阶有限元(FEM)的可微反向渲染推断杨氏模量等物理量,但计算极其沉重且极易累积优化误差;AV-MSF 绕过耗时的网格反演,直接在 3DGS 视觉先验引导下优化模态参数与隐式神经增益场,效率与保真度显著占优。
- vs SonicGauss (2025): SonicGauss 是基于扩散模型的纯数据驱动音视频生成方案,极度消耗数据且易在少样本下产生幻觉;AV-MSF 紧扣物理模态结构,以紧凑的物理先验保障了几何自洽性与极佳的少样本泛化性能。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将 3DGS、自监督视觉先验与经典物理模态分析优雅统一于物体级少样本撞击声场建模。
- 实验充分度: ⭐⭐⭐⭐⭐ 在两大真实基准数据集上进行了详尽的定量对比、消融验证、非对称个案分析及定位编辑下游测试。
- 写作质量: ⭐⭐⭐⭐⭐ 物理机理阐述严密,数学符号与系统模块对应清晰,实验设计逻辑完整。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能触觉-听觉-视觉多模态物理交互资产的低成本真实数字化提供了极具实用价值的范式。