🎵 音频/语音¶
🧠 NeurIPS2026 · 5 篇论文解读
📌 同领域跨会议浏览: 🎞️ ECCV2026 (25) · 📷 CVPR2026 (22) · 🔬 ICLR2026 (79) · 💬 ACL2026 (70) · 🧪 ICML2026 (36) · 🤖 AAAI2026 (31)
- Audible World Models: Spatially Aware Sound Generation for 3D Worlds
-
Audible World Models 将全景生成、声源语义解析、干声合成和几何声学连接起来,把声音存为三维世界的持久状态;在保持较强语义匹配的同时,得到更准确的运动相关方向线索,但目前仍是静态世界的离线构建系统。
- OpenWhistle: A Large-Scale Longitudinal Dataset and Benchmark of Bottlenose Dolphin Vocalizations
-
OpenWhistle 将单一海豚群体的多年水下录音整理为约 18 万声哨声的预训练语料和 8,354 声专家标注子集,用会话级划分与冻结表示线性探测建立类型分类和检测基准,语料内预训练的 Wav2Vec2.0 达到 81.1% 分类准确率和 75.6% 检测 mAP,但不涉及海豚语言意义的解码。
- Passing: An Endless Journey through Reconstructed Spacetime with AI-Generated Sound
-
Passing 将一段单轨列车窗景重采样为可分支播放的非线性时空旅程,让观众的在场状态间接改变视觉路径,再由经过装置适配的 SpecMaskFoley 实时生成声音,呈现的是展览案例与创作观察,而非声音还原精度的受控实验。
- Reconstructing the Vocal Tract with Differentiable Acoustic Simulation
-
本文把声道建模为可微的动态声学管道,用频域求解、平滑湍流门控和神经几何参数化,从声音反推声道面积及 MRI 可视化;默认配置的前向合成达到实时的 71.5 倍,但重建结果是声学兼容的几何解释,不是唯一的解剖真值。
- SENSE: Semantic Neural Speech Synthesis from Brain Dynamics via Spatial Graph Encoding
-
SENSE 用电极几何图编码和仅在语义一致试次上学习的 EEG 语义条件,改善被动听觉 N400 数据中的脑电到语音波形重建;未见被试上的 WER 从 FE-Phoneme 的 1.1231 降到 0.9948,但仍远非可靠语言恢复。