跳转至

Passing: An Endless Journey through Reconstructed Spacetime with AI-Generated Sound

会议: NeurIPS 2026 Creative AI Track(非主会)
arXiv: 2609.27489
论文: 作品页面
领域: 音频/语音(交互式视听艺术装置)
关键词: 视频到音频生成、时空重构、实时声音合成、观众在场、分布式创作主体性

一句话总结

Passing 将一段单轨列车窗景重采样为可分支播放的非线性时空旅程,让观众的在场状态间接改变视觉路径,再由经过装置适配的 SpecMaskFoley 实时生成声音,呈现的是展览案例与创作观察,而非声音还原精度的受控实验。

研究背景与动机

视频到音频生成通常以画面为依据,合成与场景语义和事件时刻相符的声音。MMAudio、SpecMaskFoley 等方法的同步能力,使这一技术可以超出离线配音,进入持续运行的视听装置。但 Passing 的画面并不是普通视频:艺术家把列车窗景的帧堆成时空体,再改变切片平面的方向和运动轨迹。原先同一时刻的不同位置可能被重新组织,不同时间的运动痕迹也可能同时出现,因此无法给每个画面指定唯一、物理正确的原始声轨。

作品的目标不是修复这种不一致,而是追问:当熟悉的空间和线性时间被打乱,机器会怎样解释它所“听见”的世界?在这里,音画同步仍然重要,因为声音需要回应当前视觉流;但同步不等于忠实复原。创作同时面临具体工程要求:有限的素材要形成可持续播放的旅程,观众参与不能退化成直接调节音量或音高,生成模型也必须跟上高帧率展示所驱动的视觉变化。

Passing 因此把艺术家的规则、观众的在场和模型的声音解释连接起来,而不是把模型单独当作配音工具。核心 idea:以观众在场驱动预渲染时空切片的路径选择,让保留列车声学语境的实时视频到音频模型解释当前视觉流,从而把创作主体性分配给艺术家、机器与观众。

方法详解

整体框架

输入包括一段连续列车窗景、车厢内录得的环境声音,以及摄像头估计的观众在场状态。视觉端先进行时空切片重构,再由在场介导的序列重排选择片段;展示与条件分流分别供给屏幕和声音模型,最后通过音频语义引导的同步合成输出立体声。

图中的实线表示展览时的控制或数据流,不表示训练监督。观众在场只进入视频控制器,环境声音经 CLAP 编码后进入音频条件路径;模型训练与适配另见后文,不把观众行为作为学习标签。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    I["连续列车窗景"] --> A["时空切片重构"]
    A --> B["在场介导的序列重排"]
    P["摄像头在场估计"] --> B
    B --> C["展示与条件分流"]
    C -->|4K HDR / 120 fps| V["屏幕"]
    C -->|224 × 224 / 25 fps| D["音频语义引导的<br/>同步合成"]
    S["车厢环境声音<br/>CLAP 条件"] --> D
    D --> O["32 kHz 立体声"]

关键设计

1. 时空切片重构:从有限录影中提取不同的时间组织

作品使用 2025 年 3 月 27 日拍摄的 Tama Monorail 窗景,路线为 Tachikawa 至 Tama Center,行程约 20 min,源素材为 4K、480 fps、HDR。普通播放逐帧沿时间轴前进;Passing 则把每一帧视为一个切片,将它们沿时间轴堆叠成虚拟时空体。改变切片平面的位置和角度,就能从同一录影中抽取新的二维画面,而连续移动或旋转该平面,就得到新的动态序列。

这与生成模型凭空创造风景不同:画面内容仍来自真实录影,改变的是空间与时间的取样关系。原文用 90° 旋转说明时间轴与图像水平方向的交换,但这只是原理示意,不代表所有展示片段都采用同一个角度。平面倾斜后,列车前进、近远物体的相对运动以及局部车辆或行人的活动,可以表现为停滞、拉伸、反向或位移。

为了维持“窗外景物不断掠过”的身体经验,艺术家约束总体景物流向始终为从右向左,必要时结合水平镜像与反向播放。不同出发时刻、旋转速度的轨迹提前渲染成视频片段。因此,实时阶段不是重新计算高分辨率切片,而是在已准备的时空轨迹之间选择;所谓无尽旅程来自有限材料的重新组织,不是无限产生新地景。

2. 在场介导的序列重排:让观众改变模型所面对的世界

视频片段分成 A、B、C、D 四组。A 是标准正向序列,B 是反向播放结合左右镜像的序列;默认路径依次播放 A1 至 A131,再播放 B131 至 B1,随后回到 A1。正反时间组织交替,但镜像帮助景物保持统一的横向流动。A、B 各有 131 个片段,每段约 10 s。

观众出现时,控制器以概率方式允许选择 C 或 D 的分支,而不是每次检测到观众都必然跳转。C 有 58 个片段,连接正向路径与反向镜像材料;D 有 52 个片段,承担逆向连接。C 播完自动返回 B 系列,D 播完自动返回 A 系列。若未选择分支,或未检测到观众,系统继续默认路径;刚播放过的 C/D 片段约 60 min 内暂时不再进入候选池,降低短时间内重复遇到同一转换的机会。

摄像头只向控制器发送在场状态,不记录或存储摄像图像;触发转换时,控制器用 OSC 向播放引擎发送提示。这个设计把交互限定为路径影响,而非声音参数控制:观众改变运动速度、事件密度和转换节奏等视觉条件,模型才据此改变声音。它也意味着观众不拥有任意选择片段或直接操纵音色的接口。

3. 展示与条件分流:高质量呈现不要求逐帧执行模型输入处理

屏幕播放 4K HDR、120 fps 的预渲染片段,声音模型却接收对应的 224 × 224、25 fps 条件图像序列。这些条件图像在展览前转换并缓存,播放时根据所选片段加载。这里有三个不同的采样环节:480 fps 是拍摄规格,120 fps 是屏幕播放规格,25 fps 是模型视觉条件规格,不能互相替代或解释为统一的推理速度。

把展示内容与模型条件分开,可以避免运行时处理每一张 4K、120 fps 显示帧。高帧率承担视觉体验,较低分辨率和帧率的条件路径承担声音同步所需的信息。这是一种缓存和输入带宽设计,而不是证明模型能对全部显示帧逐帧推理。原文明确缓存条件图像,但没有提供足够细节去断言所有视觉特征都已离线提取。

模型运行在 RTX 4080 工作站,实时生成 32 kHz 立体声,再经音频接口送到扬声器。预先准备的是视频和条件输入,不是最终配套声轨;声音仍为当前所选视觉路径持续生成。原文没有公布端到端延迟、实时因子或长期运行失败率,所以“实时”应理解为作者报告的装置运行能力,而非一个已量化的性能指标。

4. 音频语义引导的同步合成:用车厢声境约束对异常运动的解释

SpecMaskFoley 以预训练 SpecMaskGIT 为音频骨干,利用 ControlNet 和 FT-Aligner 接入基于 SynchFormer 的时序视频特征。FT-Aligner 将这些特征适配到时频 ControlNet 路径,后者为持续运动和瞬时事件提供音画时间对齐。Passing 沿用这一机制,而不是提出一种新的声音生成骨干。

装置版本去掉原配置中的 CLIP 视觉编码器,把语义引导交给 CLAP 音频条件:预训练 CLAP 编码车厢内的环境声音,为 SpecMaskGIT 提供稳定的列车声学语境。视觉路径负责当前运动的时间结构,音频路径限制声音的大致语义空间。这样既允许模型响应重构后的异常视觉,又避免声音完全漂移到与车厢无关或过于人工的纹理;这不是把原始声轨按顺序重播。

去掉 CLIP 同时有艺术与工程动机。艺术上,不让视觉语义显式决定声音解释;工程上,作者报告 CLIP 是实时推理的重要瓶颈。最终配置使用 32 kHz SpecVQGAN、SpecMaskGIT 和 Vocos,将音频表示转为可播放波形。论文给出组件规格和移除理由,却没有报告 CLIP 移除前后的延迟或质量差值,不能把这个选择写成已完成的量化消融结论。

一个完整示例

假设系统当前沿 A 系列显示正向窗景,观众进入屏幕前的观看区域。摄像头发送“有人”的状态;若此时没有选中分支,A 序列照常推进,声音模型仍接收当前片段的条件图像。这里不会因为观众出现就直接改变音量,也不会立刻切换到任意声音。

若控制器选中一个 C 片段,播放引擎展示对应的时空扭曲画面,同时加载其 25 fps 条件图像。声音模型保留车厢环境声音提供的 CLAP 语义条件,却根据变化后的运动结构合成新的声景。C 播完后回到 B 系列,该转换片段随后约 60 min 暂时退出候选池。这个例子解释系统规则,不是原文记录的一次用户试验。

损失函数 / 训练策略

SpecVQGAN、SpecMaskGIT 和 Vocos 的训练数据来自 AudioSet 与 VGGSound。作者预处理时通过源分离去除人类语音成分,以降低无意生成类似人声的风险;这是风险缓解措施,不是绝不生成类似人声的保证。

SpecMaskFoley 基于预训练 SpecMaskGIT 进行微调,除 VGGSound 外加入约 35 min 的 Tama Monorail 自采音视频。为了扩展有限的列车材料,训练使用视频空间裁剪、音频通道操作和同步反转的音视频对。反转时保留配对同步尤其贴近装置的非线性视觉材料,但论文没有单独测量这一增强的收益。

附录表 1 将 V2A 适配数据列为 VGGSound 500 h 加列车录影。约 20 min 描述窗景路线,约 35 min 描述自采适配数据;二者口径不同,不应直接改写成同一个时长。本文没有给出新的损失函数、学习率或完整优化配置,笔记不补写这些未报告内容。

实验关键数据

主实验

这是一篇艺术装置论文,证据包括部署配置、原模型与装置版本的规格对照,以及现场稳定性测试和艺术家的试听观察。下表整理附录表 1 的代表性变化,不把配置差异当作质量提升。

项目 原 SpecMaskFoley Passing 配置 可支持的结论
V2A 适配数据 VGGSound 500 h VGGSound 500 h + 列车自采数据 增加装置场景材料;正文记约 35 min
音频采样率 22.05 kHz 32 kHz 输出规格改变,不是主观质量评分
SpecVQGAN 参数量 72M 72M tokenizer 参数量不变
Mel 表示 80 × 848 128 × 800 Mel 频带数与时间帧配置不同
token 网格 265(5 × 53) 400(8 × 50) 音频离散表示长度不同
压缩倍率 820× 800× 按源文列值,未据此推算加速
SpecMaskFoley 参数量 300M 300M 表中报告的总量相同
主网络 / ControlNet 24 / 12 Transformer blocks 24 / 12 Transformer blocks 两列均为 768 维、8 注意力头
声码器 HiFi-GAN Vocos 波形生成组件更换

附录图 5 引用原 SpecMaskFoley 工作在 VGGSound 测试集上的 FAD 与 DeSync 比较,二者都是越低越好。该图用于解释模型选择,并非 Passing 最终声景的独立评测;当前文本缓存未提供可可靠抄录的图中数值,因此不列排行榜或提升幅度。

消融实验

原文没有受控消融。以下改用部署与观察分析表,区分实际规格、交互规则和非量化现场观察。

层面 原文配置或观察 证据边界
原始录影 4K、480 fps、HDR;路线约 20 min 输入素材规格,不是模型吞吐量
展示 4K HDR、120 fps 预渲染视频播放规格
模型视觉条件 224 × 224、25 fps;提前缓存 不代表每张显示帧都进入模型
运行与输出 RTX 4080;32 kHz 立体声 未公布延迟、实时因子或故障统计
默认 A/B 路径 A、B 各 131 段,每段约 10 s 交替播放并保持右向左景物流动
C/D 分支 C 58 段、D 52 段;近期片段约 60 min 排除 在场概率启用,不是确定性的用户指令
现场 A/B 观察 保留较稳定的车厢氛围 艺术家试听及作者描述,无听众统计
现场 C/D 观察 视觉扭曲对应较强声音变化 不构成量化因果效应或质量提升

关键发现

  • 装置运行的关键是预渲染视觉与实时声音的组合,不是所有模态都在线生成;缓存条件输入也不等于播放预录声音。
  • A/B 与 C/D 的听感差异提供创作上的反馈,但没有用户人数、评分分布或显著性检验,不能推断普遍的沉浸感提升。
  • CLIP 移除、Vocos 替换和场景适配共同构成最终配置,原文未隔离各项贡献,无法判断哪个组件带来最大收益。

亮点与洞察

  • 把同步与真实分开:视觉世界没有唯一正确声轨,但声音仍能响应运动时间结构。这使视频到音频生成从复原工具变成解释机制,同时保留可感知的音画关联。
  • 间接交互有明确因果路径:在场改变片段,片段改变模型条件,条件改变生成声音。它避免把“观众参与”泛化成直接控制,也让创作权限的边界可被解释。
  • 语义条件来自音频域:车厢环境声音维持听觉场景,视觉特征提供时间变化。对需要稳定声境而画面持续变形的装置,这种分工比单纯追随视觉类别更贴近创作目标。

局限与展望

  • 作者把音画错配、歧义和意外对应视为创作素材,但这不意味着所有错配都被证明具有艺术价值;目前主要依赖作者与艺术家的解释。
  • 分支概率、在场检测准确率、完整训练超参数和端到端延迟没有给出,限制工程复现。后续可报告不同路径下的延迟分布、音频中断率与长时间运行日志。
  • 作品仅使用一个路线与声学场景,不能据此推出跨场景泛化能力。受众研究还需明确参与人数、比较条件与评价问题,且区分艺术解释和生成质量。
  • 源分离与不存储摄像图像体现风险意识,但未提供残余人声生成或在场检测误差的审计结果;后续可补充这两类针对性检查。

相关工作与启发

  • vs SpecMaskFoley:原工作提出基于 SpecMaskGIT、ControlNet 与 FT-Aligner 的同步生成方法;Passing 的贡献是装置适配、视觉路径组织与创作主体性的案例研究,不能把骨干架构重新记为本文新方法。
  • vs MMAudio:MMAudio 作为高质量同步视频到音频方法被引述;Passing 选择满足现场连续运行需要的 SpecMaskFoley,而非证明其优于 MMAudio。原文未进行两者的同条件装置对比。
  • vs Khronos Projector / Liquid Time:这些作品把观众当前动作引入录影的时间结构;Passing 以预渲染轨迹和在场分支应对高分辨率展示,再接入实时生成声音,交互不是任意的逐像素时空操作。
  • vs Studies for:前作围绕艺术家的声音档案与文本/音频条件展开合作;Passing 增加动态重排的视觉条件和观众在场,让声音解释受一条可变视觉路径介导。

评分

以下按艺术装置案例的贡献评价,不等同于主会算法论文的基准排名。

  • 新颖性: 4/5 — 非线性时空视觉、间接观众交互与实时声音解释的组合具有清晰创作立场。
  • 实验充分度: 2/5 — 配置和现场观察有据,但没有受控消融、系统延迟统计或正式观众研究。
  • 写作质量: 4/5 — 主体分工与附录规则清楚,模型性能背景和作品评估的边界有明确说明。
  • 价值: 4/5 — 提供可借鉴的持续视听装置设计,价值主要在创作实践和系统整合而非新的算法性能。