Reconstructing the Vocal Tract with Differentiable Acoustic Simulation¶
会议: NeurIPS2026
arXiv: 2609.36737
领域: 音频/语音
关键词: 可微声学仿真、发音反演、频域合成、神经场、声道可视化
一句话总结¶
本文把声道建模为可微的动态声学管道,用频域求解、平滑湍流门控和神经几何参数化,从声音反推声道面积及 MRI 可视化;默认配置的前向合成达到实时的 71.5 倍,但重建结果是声学兼容的几何解释,不是唯一的解剖真值。
研究背景与动机¶
语音产生可以理解为声源经过声道滤波:声带振动提供周期性激励,舌头、嘴唇和下颌改变管道形状,从而移动共振峰;局部狭窄处的湍流则产生辅音。已有 Kelly–Lochbaum、Maeda 和 VocalTractLab 等发音合成器能够描述这些机制,但逐时间步求解昂贵,元音与辅音的分支还会造成求导不连续。相反,神经声码器更擅长生成逼真波形,却不直接说明声音对应怎样的发音几何。
从音频恢复发音动作不只是缺少一个回归网络。配对语音与 MRI、EMA 数据难以采集,而声音到几何本身又是病态、非凸的映射:多个声道形状可能产生相似声音。即使仿真器可微,逐段独立更新面积也可能让不同管段的梯度相互竞争,停在不合理的局部解。因此,本文需要同时解决计算效率、辅音可导性和几何优化空间三个问题,而不是仅把传统合成器接到自动求导系统上。
本文沿用声学管道的物理约束,但把短窗内的传播改写为可并行的频域传输矩阵,再以神经网络耦合不同位置的面积。这样既能逐条音频优化,也能训练从音频直接预测面积的编码器,还能把声学误差传回 MRI 生成器的潜变量。核心 idea:让语音本身通过可微的物理合成过程监督声道几何,用神经参数化改善反演,而不依赖配对的语音—发音测量数据。
方法详解¶
整体框架¶
输入是目标语音,输出是随时间变化的 32 段声道面积,以及由这些面积重新合成的音频;在 MRI 应用中还输出生成的声道视频。系统先用 Swift-F0 估计基频,以 Liljencrants–Fant(LF)模型构造声门脉冲,再让神经几何参数化提供面积,交给频域合成和可微湍流门控产生嘴唇处的声压。目标与合成音频的多尺度对数 Mel 频谱误差负责监督几何,而不是拿真实面积作标签。
“神经几何参数化”有三种不同用途,不能当成串联的三个网络:神经场逐条拟合面积,Wav2Vec 2.0 编码器学习音频到面积的映射,StyleGAN2 则通过 MRI 图像提供几何先验。实线表示已给定参数时的前向合成;虚线表示训练或逐条反演时的损失与更新。编码器训练后可以直接预测面积,但神经场拟合及 GAN 潜变量反演仍需要对新音频优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["目标语音"] --> B["神经几何参数化<br/>三种替代路径"]
A --> S["基频估计与<br/>LF 声门脉冲"]
B --> C["频域合成"]
S --> C
C --> D["可微湍流门控"]
D --> O["合成音频"]
A -.-> L["多尺度频谱损失"]
O -.-> L
L -.->|训练或逐条反演| B
关键设计¶
1. 神经几何参数化:让各管段共享优化结构,而不是独立争夺梯度
最直接的表示是一个“空间管段 × 时间窗”的面积数组,但原文发现,从均匀管道开始优化时,不同管段会振荡,难以恢复简单元音。神经场把位置与时间输入共享网络,输出面积函数;参数更新因而同时影响多个位置,提供一种隐式的空间耦合。作者用带随机 Fourier 特征(RFF)的全连接网络和乘性滤波网络(MFN)比较这一表示,认为共享权重有利于粗到细的恢复。这是经验性的优化优势,不是非凸问题已被全局解决的证明。
RFF 网络为 4 层,位置编码维度 64,隐藏维度 256;MFN 为 3 层,输入尺度 256,隐藏维度同为 256。附录称对输出使用 softmax 并把最小面积截到 \(10^{-2}\),笔记保留这一描述,不自行改写成 softplus。面积正值约束与这种参数化有关,但并不等价于完整的人体解剖约束;主文所说“无需正则项”也不意味着不存在网络表示、截断等先验。
如果每条新音频都重新拟合神经场,仍然很慢,于是第二种路径把面积预测摊销到编码器中。原始波形经 CNN、12 层 Transformer 得到面积,物理解码器再把面积变回音频。训练只要求重建语音,不要求面积标签,因此能利用真实语音而非局限于合成的辅音—元音组合。这里的“自监督”指没有配对发音测量监督,并不意味着真实声道已经被唯一识别。
第三种路径用 MRI 图像先验缩小可搜索的几何空间。StyleGAN2 先在 MRI 图像上训练,并使用数据集中的身份标签作条件;反演时固定生成器,优化逐帧的 512 维潜变量。图像先经 sigmoid 软二值化,再沿从声门到嘴唇的固定引导线求和,近似提取截面积;引导线由四分之一圆弧和一段直线组成。这样声学损失可以穿过面积提取过程回传到潜变量,但二维像素截面只是声学管道的代理,不能当成直接测得的三维面积。
MRI 模型使用 \(64\times64\) 图像,每段 3 秒语音优化 30 个潜变量。它不使用配对语音—MRI 样本训练反演映射,却仍然依赖真实 MRI 数据及身份标签训练视觉先验。优化后的帧数与评测所用的 9,900 视频帧不是同一个统计口径,原文未充分交代两者之间的重采样细节。
2. 频域合成:把逐采样时间递归换成按频率独立求解
声道被近似为截面积沿长度变化的一维声学管道。短时间窗内面积保持不变,线性化 Euler 方程就定义了一个线性时不变滤波器;共振峰对应滤波器频率响应的峰值。其物理基础是小扰动和截面内近似平面波,附录指出低于 4 kHz 时这一近似较合理,不能理解为完整的三维流体求解。
在频域,每个管段的压力与体积流速通过一个 \(2\times2\) 传输矩阵联系,相邻矩阵连乘得到总传输矩阵。再结合声门激励和嘴唇辐射阻抗,就能计算声道滤波器。采用主文的矩阵元素记号,其关键关系为:
这里 \(\mathbf{A},\mathbf{C}\) 是总传输矩阵的元素,不是截面积;\(Z_{\text{lips}}\) 描述嘴唇开口的辐射负载。声门激励频谱经过该滤波器后逆 Fourier 变换得到输出。附录还把黏性边界层损耗和可振动声道壁写成等效电路阻抗,因此这一滤波器不只是一个自由学习的全极点滤波器。
关键收益不是“频域天然比时域更真实”,而是不同频率的计算可以在 GPU 上并行,不再把梯度沿大量时间步递归传播。原文的元音插值损失图表明,所实现的频域合成损失面更平滑,随后音频拟合也更好。不过时域基线把频率相关的壁摩擦阻力替换成了直流阻力,两个数值实现并非只差时间递归;不能把全部质量提升都单独归因于坐标域转换。
动态语音用逐窗近似连接起来:对声源用参数 \(\alpha=0.25\) 的 Tukey 分析窗,对输出用 Hann 合成窗,再重叠相加。默认仿真窗为 25 ms,步长为窗长的 \(1/4\),即 6.25 ms。这是窗内准静态、窗间拼接的近似,不是对连续快速运动声道的精确频域解;快速闭塞或运动时的误差仍需另行验证。
3. 可微湍流门控:让辅音噪声随狭窄位置和气流平滑变化
线性声学传播可以合成元音,却不会自行产生狭窄处的非线性湍流。传统辅助模型在最狭窄的管段注入噪声,并用临界 Reynolds 数触发;硬选位置和硬阈值使梯度不连续。本文以截面积的负值做 softmax,让所有管段按狭窄程度分担噪声,再用 softplus 平滑替代开启门控。保留原文式(5)—(6)的机制写法:
\(u_n\) 是该段体积流速,\(A_n\) 是面积,\(\rho\) 和 \(\mu\) 分别为空气密度与动力黏度;此处 \(\alpha\) 是噪声增益,不是上一设计中的窗参数。噪声 \(z_n\) 使用分形 Perlin 噪声,临界 Reynolds 数为 3500。面积变小会提高门控强度,同时软位置分配允许损失向多个可能的狭窄处传递梯度,不必在一次硬选择之后只更新单个管段。
湍流项先在时域计算,再转到频域,分别经过从其注入位置到嘴唇的传输函数,最后与声门激励传播的声压相加。因此元音与辅音可以在同一个可导流程中连续过渡,噪声也受声道几何滤波,而不是简单贴到输出波形上。这是可优化的辅助湍流模型,并未求解完整 Navier–Stokes 方程;softplus 的平滑开启也不等于精确的物理临界行为。
一个完整示例¶
考虑从一段 3 秒语音生成 MRI 可视化。先从音频提取基频与 RMS 能量,构造 LF 声源,再初始化 30 个潜变量,生成 30 张身份条件化的 MRI 图像。每张图像通过软二值化和固定引导线变成 32 段面积,构成一条粗时间序列的声道几何。
仿真器在 25 ms 的准静态窗内计算传播,并按 6.25 ms 步长重叠相加;存在狭窄时,平滑湍流噪声一起经过管道滤波。频谱损失把“某处共振峰或辅音能量不对”的误差传回图像潜变量,逐步改变可生成的舌位、唇形等。这里只展示原文组件的协同逻辑,不补造潜变量时间序列到仿真窗的插值规则;原文没有完整说明这部分实现。
损失函数 / 训练策略¶
三个反演路径共享多尺度对数 Mel 频谱目标,而不是波形逐点对齐。附录式(56)给出的是各分辨率 \(L_2\) 范数的平均;主文称“平方距离”,与展示公式并不完全一致,下面保留公式而不擅自添加平方:
每种分辨率使用 128 个 Mel 频带;\(\mathcal{C}\) 中的 FFT、窗长、步长分别为 \((512,160,40)\)、\((1024,400,80)\)、\((2048,800,160)\),单位为采样点。这些是损失的 STFT 配置,不应与 25 ms 的声学仿真窗混淆。多分辨率让优化同时看到不同时间—频率尺度的共振结构,减少单一频谱分辨率对目标的限制。
神经场拟合使用 Adam,学习率 \(10^{-2}\),迭代 200 步;附录报告拟合 5 秒语音约需 1 分钟。编码器使用 Adam,学习率 \(10^{-4}\),先在英语的 3 秒片段上以批量 64 训练 15,000 次,再对其他语言各微调 10 个 epoch;作者称累计训练音频为 800 小时,这不是明确的独立数据时长。
编码器的 Transformer 有 12 个注意力头和 768 维隐藏表示。英语使用 LibriTTS-R,其他欧洲语言使用 Multilingual LibriSpeech,韩语、日语、中文分别使用 KSS、JVS、AISHELL-3。MRI 重建目标音频先经 Adobe Express 去噪,因此视觉实验的输入不是未经处理的 MRI 同步录音。
实验关键数据¶
主实验¶
频域与时域拟合实验使用 25 条随机 LibriTTS-R 语音、MFN 面积表示、Adam 200 步;通常采用 16 kHz 和 32 个管段。SI-SDR、STOI 和 PESQ 由 TorchAudio-Squim 估计,分别反映失真、可懂度和感知质量,均越高越好;它们不是本文另行实施的听觉主观测评。
| 合成方式 | 窗长 / 步长比例 | SI-SDR | STOI | PESQ | 实时倍数 |
|---|---|---|---|---|---|
| TDS | 不适用 | 7.32 ± 2.42 | 0.77 ± 0.03 | 1.55 ± 0.14 | 1.08× |
| FDS | 25 ms / 1/8 | 17.83 ± 2.19 | 0.93 ± 0.02 | 2.02 ± 0.31 | 35.0× |
| FDS | 25 ms / 1/4 | 16.39 ± 2.42 | 0.93 ± 0.02 | 1.98 ± 0.26 | 71.5× |
| FDS | 50 ms / 1/8 | 17.47 ± 1.94 | 0.93 ± 0.02 | 1.97 ± 0.26 | 36.0× |
| FDS | 50 ms / 1/4 | 15.82 ± 2.47 | 0.93 ± 0.02 | 1.98 ± 0.25 | 70.0× |
上表来自原文表 1。“实时倍数”是合成音频时长与前向耗时之比,不是相对 TDS 的倍率,更不是反演优化速度。原文图 3 及正文另报 FDS 相对 TDS 平均约 70× 加速;正文还称 1 秒合成分别耗时 1.08 秒与 14.2 ms,其中 TDS 的 1.08 秒与表 1 的“快于实时 1.08×”口径不一致,不能自行统一。
自监督编码器在 11 种语言上测试,每种语言评估 200 条合成语音。下面节选表 3;WER/CER 越低越好,Speaker ID 是 ECAPA-TDNN 身份嵌入的余弦相似度,保留原表数值尺度而非识别准确率;误差范围为 95% 置信区间。
| 语言 | 原音频 WER / CER | TensorTract2 WER / CER | 本文 WER / CER | TensorTract2 ID | 本文 ID |
|---|---|---|---|---|---|
| English | 3.91 ± 0.84 / 2.05 ± 0.70 | 13.00 ± 1.82 / 7.37 ± 1.11 | 5.30 ± 0.94 / 2.82 ± 0.75 | 16.86 ± 1.01 | 52.0 ± 1.39 |
| Spanish | 3.35 ± 0.69 / 1.37 ± 0.44 | 9.71 ± 0.93 / 5.13 ± 0.44 | 9.27 ± 1.25 / 4.43 ± 0.59 | 14.74 ± 1.49 | 52.9 ± 1.81 |
| Korean | 8.00 ± 2.42 / 2.10 ± 0.79 | 32.32 ± 4.27 / 14.58 ± 2.42 | 19.45 ± 3.49 / 6.05 ± 1.25 | 23.51 ± 0.77 | 63.4 ± 0.94 |
| Chinese | — / 13.54 ± 3.63 | — / 53.27 ± 42.97 | — / 30.11 ± 13.0 | 17.06 ± 1.12 | 47.9 ± 1.52 |
| Japanese | — / 6.89 ± 1.19 | — / 15.01 ± 2.38 | — / 11.88 ± 1.57 | 23.76 ± 1.41 | 53.9 ± 1.44 |
WER/CER 使用 Whisper 计算,原音频也有非零识别错误,因此这些结果同时受到识别器及语言差异影响。TensorTract2 使用合成辅音—元音数据训练,本文使用真实语音并进行语言微调,比较体现整体训练方案优势,不能仅归因于可微仿真器。
MRI 实验在 40 段、每段 3 秒、共 9,900 帧的视频上比较:本文与 Speech2rtMRI 的 FVD 分别为 623 与 2949,SSIM 为 0.352 与 0.317,LPIPS 为 0.159 与 0.355。本文同时合成音频,SI-SDR 为 13.08、STOI 为 0.92、PESQ 为 2.09,对手未提供音频指标。2949/623 约为 4.73,而不是正文所称的数量级差距;低 SSIM 也提示视觉匹配远未精确。
消融实验¶
附录表 5 在相同的 25 条语音拟合设置下比较面积参数化,说明可微仿真器之外,表示本身也影响优化。
| 面积参数化 | SI-SDR | STOI | PESQ |
|---|---|---|---|
| Discrete | 10.78 ± 2.22 | 0.81 ± 0.02 | 1.57 ± 0.12 |
| RFF | 14.51 ± 3.78 | 0.84 ± 0.05 | 1.76 ± 0.26 |
| MFN | 16.39 ± 2.42 | 0.93 ± 0.02 | 1.98 ± 0.26 |
真实语音上 MFN 的三个指标都优于 RFF,但面积重建表 2 并不呈现统一胜者。例如 /e/ 的面积 MSE(单位 \(\mathrm{cm}^{4}\))为 Discrete 26.22 ± 1.36、RFF 1.29 ± 0.90、MFN 15.00 ± 7.06;/u/ 分别为 28.19 ± 2.54、27.26 ± 22.30、19.98 ± 5.04。RFF 在 /u/ 上仍接近离散基线且波动大,不能概括成神经场总能精确恢复解剖形状。
关键发现¶
- 默认 FDS 的 SI-SDR 为 16.39,而 TDS 为 7.32,差值 9.07;更密集的 1/8 步长改善 SI-SDR,但实时倍数降低到 35.0×。
- 神经场改善音频拟合与几何拟合的证据互补,但共振峰正确不保证面积正确,更不保证 MRI 中的舌位唯一。
- 作者从 1,000 张随机生成 MRI 提取面积、计算前两个共振峰,观察到类似 IPA 元音梯形的空间。这支持声学结构有意义,不是对真实个体解剖的定量验证。
- 原文没有单独列出关闭平滑湍流门控的数值消融,不能据现有表格判断三项贡献各自占多少收益。
亮点与洞察¶
- 把物理方程变成适合 GPU 与反向传播的频域电路,而非仅给旧时间步循环加自动求导。这里数值表示影响的是可优化性,值得在其他波动反问题中关注。
- 网络权重共享是几何反演的一种隐式先验,真实语音上的 MFN 优势也提醒:静态几何误差与动态声学质量不是同一个模型选择目标。
- 物理解码器把音频重建误差变成无需发音标签的监督信号。若迁移到别的逆问题,需要先明确哪些潜变量确实受观测约束,不能把低重建误差当成所有隐变量都可辨识。
局限与展望¶
- 作者明确承认声道反演病态,不同几何可以发出同一声音;当前 MRI 应视为具有声学依据的可视化,而非诊断级恢复。
- 鼻腔不在使用的 MRI 帧中,因此没有显式重建鼻道。附录讨论分叉传输线及等效面积表示,但这不能替代鼻腔几何和反共振的真实验证。
- 一维平面波、窗内准静态和辅助噪声模型都是近似。值得按音素类别、快速闭塞及高频段分析误差,并与更高保真仿真比较。
- 25 条语音的逐条拟合样本量有限;MRI 依赖低分辨率先验和目标去噪,模型对新说话人、噪声与非标准发音的稳健性仍需专门测试。
- 作者尝试 DPS 做 MRI 反演时难以产生大的舌部几何变化,表现不及 GAN,但没有提供相应量化表。未来可研究更适合形变与声学约束的生成先验,而不能把这一结果推广为所有扩散模型均不适用。
- 附录要求明确标识仿真生成样本。应用于教学或临床时还应展示不确定性和多解,避免把单个声学兼容结果误当成真实内部观测。
相关工作与启发¶
- vs VocalTractLab / Maeda:传统发音合成保留物理解释,本文着重改进 GPU 并行及梯度连续性;优势是易接入学习系统,不是已经替代所有高保真发音模型。
- vs DDSP / neural source-filter:都采用可导的信号处理链,但本文用面积、传输阻抗和嘴唇辐射决定滤波器,把隐变量与几何连接起来,而不是只学习声学滤波参数。
- vs Südholt 等面积梯度反演:对方主要展示静态元音与辅音及显式面积表示;本文进一步以神经场改善优化,并扩展到动态词语、编码器和 MRI 先验。
- vs TensorTract2 / Speech2rtMRI:配对数据驱动模型分别学习发音编码或视频生成;本文用声学一致性约束代替配对反演监督,但仍需真实语音、视觉先验和独立的解剖验证。
评分¶
- 新颖性: 4/5 — 把可微频域声道、辅音门控与神经几何反演组合为可复用基础设施。
- 实验充分度: 3/5 — 覆盖多语言与 MRI,但逐条拟合较少,缺少门控独立消融及多解评估。
- 写作质量: 3/5 — 机制和附录较完整,但表引用、损失平方及运行时口径存在不一致。
- 价值: 4/5 — 对可解释发音建模和自监督声学反演有价值,医学用途仍需额外验证。