跳转至

Who Says What: Symbolic Trimodal Binding Mechanisms in Audio-Visual LLMs

会议: NeurIPS2026
arXiv: 2609.31193
领域: 多模态 VLM / 可解释性
关键词: 三模态绑定、符号 ID、因果中介分析、活跃说话人检测、视听提示

一句话总结

本文在受控成功轨迹上用表征分析和激活干预解释视听大模型如何经由时间与位置 ID 绑定“谁说了什么”,据此以现成活跃说话人检测器生成视觉提示,并通过可选轻量微调改善对话理解,但免训练收益依赖模型的视觉标记理解能力。

研究背景与动机

视听大模型能识别画面内容,也能处理语音,却不一定知道一句话属于画面中的哪个说话人。在多位角色同时出现的单镜头视频中,回答“老虎说了哪个词”不只需要看清老虎、听清词语,还需要把文本指代、视觉角色与声音片段接起来。分别理解三种模态,并不保证三者之间的对应关系正确。

已有语言模型与视觉语言模型的绑定研究表明,模型可能不是直接匹配完整语义,而是借助内容相对独立的结构变量:例如用左、右位置追踪视觉对象。加入音频后,位置不再是唯一坐标;说话顺序也可能成为组织语音事件的索引。因此,本文先问模型是否用不同模态的结构 ID 进行中转,再问无提示时究竟在哪次中转中出错,而不是把所有错误归为“多模态理解不足”。

研究的实际切入点是外部活跃说话人检测(Active Speaker Detection,ASD):若模型已经能找到文本所指的声音或角色,却无法把两者连起来,就可以把同步对应关系直接画在视频上。核心 idea:将三模态绑定解释为“锚点 ID 检索—目标 ID 选择—特征检索”,用可控干预定位跨模态 ID 转换瓶颈,再用标记当前说话人的边界框补充这条对应关系。

方法详解

整体框架

论文包含机制研究和应用改进两条线,不能把它们当成同一个部署网络。机制研究在四动物合成视频中定义双向绑定任务,先观察成功回答的内部表征,再用激活替换检验不同类型信息的因果作用。应用线则接收普通对话视频,由现成 ASD 模型逐帧定位当前说话人,叠加红框并解释其含义,让 AVLLM 回答问题或生成对话描述。

作者的三阶段解释是:文本锚点先对应本模态的结构 ID,随后选择另一模态的目标 ID,最后检索该 ID 所指的语义。这里的 ID 是对隐状态所携带结构信息的解释,不是模型显式输出的整数寄存器,也不是新增的离散编码模块。

可选 ASD-FT 在带框合成视频上进行监督微调,帮助模型理解标记及视听对应关系。真实测试中的 ASD 框由检测器给出;合成训练框由生成过程直接确定。机制研究中用正确提示轨迹生成的激活缓存只是诊断工具,不用于真实部署。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["受控视频与文本锚点"] --> B["符号绑定任务"]
    B --> C["因果瓶颈诊断"]
    C -.->|启发改进,不传递正确激活| E["活跃说话人提示"]
    D["对话视频与问题"] --> E
    E -->|推理数据流:带框视频与说明| F["AVLLM 回答或描述"]
    E -.->|可选训练:合成视频及标准答案| G["提示感知微调"]
    G -.->|更新 LoRA 参数| F

关键设计

1. 符号绑定任务:分离语义、空间和时间,观察模型实际使用哪种索引

每个合成视频包含四个动物,随机放在四个象限,每个动物按随机顺序说一个不同国家名。动物种类、所在象限、说出的词和发言顺序构成一次绑定事件。位置 ID 为 0–3,分别对应左上、右上、左下、右下;时间 ID 为 0–3,对应四次发言的先后。改变词语或动物而保持结构,便能区分模型在追踪语义内容还是结构索引。

声学锚定视觉检索(AAVR)从文本中的词语出发,要求找到说该词的动物;视觉锚定音频检索(VAAR)从动物描述出发,要求找出其说出的词。AAVR 的假设路径是“词语→发言顺序→画面位置→动物”,VAAR 则反向使用“动物→画面位置→发言顺序→词语”。关键不在于再做一次分类,而在于把两种结构坐标之间的对应作为可检验的中间步骤。

由于自然无示范设置的准确率很低,主要机制分析只纳入正确预测,并以另外三个动物的词语绑定作上下文示范。它没有直接给出所查询动物的答案,却提供了很强的任务结构和绑定线索。因此,成功轨迹上的机制证据不能直接等同于所有无提示视频中都存在稳定、正确的完整计算。

2. 因果瓶颈诊断:先测相关结构,再改变中间信息检验输出是否跟着变化

表征相似性分析(Representational Similarity Analysis,RSA)比较隐状态与时间、位置、目标语义三个假设空间的样本两两相似性,再计算 Pearson 相关。作者在文本锚点 token 和提示最后 token 上抽取逐层注意力输出,汇总 800 个样本。锚点处中后层更接近本模态 ID,最后 token 后层更接近目标模态 ID,最深层更接近答案语义。这样的次序支持三阶段解释,但相关性本身不说明该信息真的决定答案。

因果中介分析(Causal Mediation Analysis,CMA)进一步构造原始、修改、替换三个前向过程。修改视频时分别交换发言顺序、交换动物位置,或替换目标语义,再把修改过程中的注意力输出注入原始过程。前两种交换保持所问动物与其词语的真实绑定,故两个完整前向过程的正确答案可以相同;混合其中间状态后,预期答案却会转向被交换事件。这样能检验模型是否真的通过结构 ID 中转,而非只受视频内容变化影响。

原文式(1)的 CM Score 衡量替换前后,反事实答案相对原答案的 logit 优势变化:

\[ s=\left(M(c_1^*)[y_1^*]-M(c_1^*)[y_1]\right)-\left(M(c_1)[y_1^*]-M(c_1)[y_1]\right). \]

这里 \(c_1\) 是原始上下文,\(c_1^*\) 是激活替换后的过程,\(y_1\) 是原答案,\(y_1^*\) 是预期反事实答案;\(M(c)[y]\) 表示对应 token 的 logit。分数越大,说明被替换信息越能把输出推向预期反事实。CMA 汇总 960 个样本,每次替换覆盖总深度四分之一的层窗口,所以这是较粗粒度的阶段证据,不是精确定位单层离散 ID 电路。

随后作者比较有示范与无示范的 RSA,发现锚点 ID 差异小、目标 ID 差异大。为验证瓶颈,又在每阶段用 100 个样本筛出 CM Score 最高的 10 个注意力头—层组合,以 800 个有示范实例平均输出形成正确激活缓存,再替换到无示范过程。目标 ID 选择处的替换明显恢复准确率;这是依赖正确内部状态的诊断干预,不能作为无需正确信息的推理方法宣传。不同模型的阶段可跨两个 token 展开,也不必严格占据互不重叠的层段。

3. 活跃说话人提示:把跨模态对应画出来,而不是只让目标更显眼

应用阶段使用现成 LASER ASD 模型,逐帧在检测到的当前说话人周围画红色边界框。框随发言事件变化,因此提供的是“这个时刻的声音对应这个位置”,不是静态对象框。AVLLM 仍接收原来的音频和视频,但视频多了一条可见的同步线索,减少从时间 ID 到位置 ID、或反向转换时的歧义。

文本说明同样必要。问答任务在原问题前解释红框代表当前说话人;描述任务在原提示后补充这一说明。模型需要理解框的语义,再把它与听到的发言对应,而不是凭红色区域猜答案。标记不活跃角色、随机区域,或者省略说明,都不能替代正确的同步标记。

免训练 ASD 不更新 AVLLM 参数,但仍需要运行外部检测器,并不意味着没有额外计算。其效果取决于模型原有的视觉定位与标记理解能力:Qwen2.5-Omni 和 MiniCPM-o-4.5 能利用提示,video-SALMONN2+ 却在多项免训练结果中下降。对于经常没有语音或可见说话人的三个通用基准,作者不应用 ASD 画框,因此该行与 vanilla 相同,不能解读为提示改善了通用任务。

4. 提示感知微调:用少量可控监督教会模型读取标记

ASD-FT 使用 400 个合成人物视频,而非继续使用动物作为训练主体:200 个双人单镜头、100 个四人单镜头、100 个双人多镜头。角色、国家词和 TTS 声音独立组合,且当前说话人的准确边界框在合成时直接生成。这将训练中的框误差与模型学习问题分开,但也形成了准确训练框到真实检测框的分布差异。

训练样本包含 1,000 个 AAVR 选择题、1,000 个 VAAR 选择题和 40 个开放式描述,共 2,040 个样本。前两类要求按外观或词语做对应,描述题要求汇总各角色的外观及其话语。模型因此不仅学习红框的外观,还反复接触“在正确视觉区域取回对应声音信息”的监督。作者微调后观察到无示范设置的目标 ID 相关增强,不过这仍是 RSA 支持,不能据此宣称已完成对微调效果的全面因果归因。

一个完整示例

采用正文示例:熊猫在左上说 Mexico,是第 2 个发言者;老虎在右上说 Japan,是第 4 个发言者;猴子在左下说 Canada,是第 3 个发言者;兔子在右下说 Egypt,是第 1 个发言者。这里序号从 1 开始叙述,而 ID 从 0 开始。

问“谁说了 Japan”时,AAVR 的三阶段解释是先把 Japan 对应时间 ID 3,再把时间 ID 3 对应位置 ID 1,最后在右上位置检索出老虎。反问“老虎说了什么”时,VAAR 先取位置 ID 1,再选时间 ID 3,最后检索 Japan。若第二步错选左下位置,模型即使听清 Japan、认出所有动物,也会把词语归给猴子。

在机制实验里交换老虎和猴子的位置,两者仍说原来的词,所以完整视频的正确答案仍为老虎。若只把修改过程的目标位置状态替换到原视频,原视频左下位置仍是猴子,模型可能转向猴子;这正是中间索引具有因果作用的检验,不是声称交换后老虎真的改说了 Canada。

在提示推理里无需上述激活替换:Japan 发声时,让红框落在右上老虎,并说明框代表当前说话人。可选 ASD-FT 学习如何读取这种线索;这个合成动物示例仅解释流程,不是新增评测数值。

损失函数 / 训练策略

训练使用 LoRA 监督微调(SFT),原文没有提出专门的符号 ID 损失或额外对齐损失,故不补造损失公式。LoRA rank 为 16,batch size 为 1,梯度累积 8 次,在单张 NVIDIA RTX A6000 上进行。

video-SALMONN2+ 训练 140 个优化步骤,另外两种模型训练 250 步,均少于 300 步。评测采用 greedy decoding。免训练 ASD 与 ASD-FT 是两种不同设置,后者不能称为免训练方法。

实验关键数据

主实验

下表选择正文 Table 1 中四个对话基准和一个通用基准;AVSpeaker、DailyOmni、SocialOmni、OmniBench 为准确率(%),SocialOmni 使用感知任务子集。DiaDemBench 的 REF 评估说话人归属一致性,ASR 评估转写准确性,不是攻击成功率,也不应直接当作词错误率。

DiaDemBench 由 gemini-2.5-Pro 和 gemini-2.5-Flash 评分。附录 B.2.2 明确:±反映同一模型输出经多次 Gemini 评判的变化;原文称其为 variance,但未给出标准差或标准误的严格定义,不能将其解释为训练随机种子误差或置信区间。

模型与设置 AVSpeaker DailyOmni SocialOmni DiaDem REF DiaDem ASR OmniBench
Qwen2.5-Omni 7B 44.86 64.33 38.95 19.1±0.4 28.1±0.1 50.79
+ ASD 45.59 64.66 41.90 22.5±0.2 33.0±0.2 50.79
+ ASD-FT 48.79 71.09 44.25 20.7±0.2 32.3±0.1 52.80
MiniCPM-o-4.5 9B 49.41 61.99 46.05 6.3±0.5 7.4±0.7 47.99
+ ASD 50.34 62.49 50.00 9.7±0.4 10.8±0.1 47.99
+ ASD-FT 51.77 63.41 49.70 24.8±0.2 30.9±0.0 51.84
video-SALMONN2+ 7B 44.74 65.13 43.49 14.0±0.3 19.3±0.1 37.04
+ ASD 44.65 62.57 43.89 11.8±0.3 19.0±0.0 37.04
+ ASD-FT 49.10 69.13 49.62 19.7±0.2 26.7±0.2 44.92

通用任务不画 ASD 框。ASD-FT 的 DAVE / WorldSense 分别为:Qwen 33.91 / 53.73,对应 vanilla 30.75 / 50.06;MiniCPM 57.97 / 57.37,对应 55.80 / 55.73;SALMONN 39.65 / 46.38,对应 35.28 / 45.04。这支持微调相对原模型的通用收益,不证明实际红框提示在这些任务中有贡献。

消融实验

下表来自正文 Tables 2–4,均使用 Qwen2.5-Omni 7B;AVSpeaker 与 DAVE 都是准确率(%)。DAVE 的 FT 对照保留在表中,避免误读成 ASD-FT 在所有任务上都胜过普通微调。

配置或比较 AVSpeaker DAVE 说明
Vanilla 44.86 30.75 无额外提示或微调
ASD:活跃角色、红框、中等粗细、有说明 45.59 30.75 通用任务不画框
标记不活跃角色 44.77 不适用 有说明、红框、中等粗细
标记随机区域 44.52 不适用 有说明、红框、中等粗细
标记活跃角色但无文本说明 44.80 不适用 红框、中等粗细
活跃角色、绿框、中等粗细、有说明 45.95 不适用 替换颜色仍有效
活跃角色、红框、粗框、有说明 45.70 不适用 粗细变体
活跃角色、红框、细框、有说明 45.58 不适用 粗细变体
普通 FT,无框视频训练 46.89 35.15 不含 ASD 提示的训练对照
ASD-FT 48.79 33.91 AVSpeaker 更高,但 DAVE 低于普通 FT

机制分析的补充证据来自附录 Table 5 与 A.1;每模型准确率统计基于 800 个样本,激活干预值为附录文字报告,未对 MiniCPM 补造数值。

模型 无示范 有示范 仅有示范文本,无音视频 目标 ID 激活干预后无示范
video-SALMONN2+ 7B 27.0% 99.2% 1.00% 51.0%
Qwen2.5-Omni 7B 29.6% 100.0% 12.50% 49.0%
Qwen2.5-Omni 3B 28.7% 99.94% 12.50% 45.4%
MiniCPM-o-4.5 9B 0.0% 99.31% 0.06% 未在该段给出

关键发现

  • 正确标记比颜色本身重要:错对象、随机框和缺少解释均低于 44.86 的 vanilla,绿色正确框却达到 45.95。收益不是单纯增加视觉显著性。
  • ASD-FT 相对 vanilla 的改进不能替换成“优于所有设置”:MiniCPM 的 SocialOmni 为 49.70,低于免训练 ASD 的 50.00;Qwen 的 DiaDem REF / ASR 为 20.7 / 32.3,低于 ASD 的 22.5 / 33.0。
  • 正文 Table 2 中,AVSpeaker 上 ASD 的 45.59 高于 AVCD 42.82、FMD 45.27、OutRo 45.24、NumPro 45.08、VISER 44.55;这一排序仅适用于该模型和该数据集。
  • 约 2,000 个 SocialOmni 双人片段上的扩展是位置与时间 ID 的 RSA,未进行完整语义空间比较,也没有同规模真实数据 CMA。附录还在五、六说话人及 20 / 10 dB 噪声合成设置中验证 RSA 趋势。

亮点与洞察

  • 将“认得对象、听懂内容”和“知道对应关系”拆开,能把模型失败解释得更具体。目标 ID 干预的恢复效果为这一拆分提供了超出相关曲线的证据。
  • 外部提示携带的是时间变化的角色位置,而非静态检测结果。这说明跨模态问题可能需要同步结构线索,而不是更多关于对象外观的描述。
  • 准确合成框与真实检测框分离,便于研究标记理解能力。但训练成功和检测器可靠性仍需分别评价,不能把二者混为一种端到端能力。

局限与展望

  • 机制主证据来自有示范、正确输出的合成轨迹,覆盖不了自然视频中的重叠发言、角色移动、复杂语音与遮挡。真实 RSA 支持趋势,却不能替代真实场景的因果验证。
  • ID 是从表征与干预推断的抽象变量,四分之一深度窗口不能支持精确离散电路结论。进一步可用更细粒度、跨上下文的干预检验位置和时间变量的可迁移性。
  • 方法依赖现成 ASD 的准确性及公平性,也依赖 AVLLM 读取标记的能力。适用于经授权的普通对话描述时,应同时记录检测误差、遮挡和不同人群的表现,而不只报告平均问答分数。
  • 原文 Table 1 的“所有基准增益”应理解为 ASD-FT 相对 vanilla,不是相对 ASD 或普通 FT;Table 4 也明确只有 4/5 个数据集优于 FT。正文比较免训练方法时将对应结果误引为 Table 3,实际数值位于 Table 2。
  • 机制分析不覆盖多镜头,但训练数据确有 100 个双人多镜头视频;两者并不矛盾。正文称替换注意力输出,附录 C.2 另称 residual stream,缓存不足以进一步核实具体 hook 位置,不能补写实现细节。

相关工作与启发

  • vs LLM / VLM 符号绑定研究:先前工作关注实体—属性或视觉位置的绑定,本文加入音频时间顺序与视觉位置之间的转换。它扩展了绑定假设的模态范围,而不是证明所有 AVLLM 都采用唯一同构机制。
  • vs NumPro / VISER 视觉提示:通用编号或视觉结构有助于定位,本文的框由当前发言事件决定,直接补充视听同步信息。AVSpeaker 对照支持这一选择,但不能推出对所有视觉推理任务都更好。
  • vs AVCD / FMD / OutRo 解码改进:这些方法修改推理时的输出或模态利用方式,ASD 直接修改输入视频并解释标记。后续可检验二者是否互补,而非仅凭单一基准排序判断普遍优劣。
  • vs LASER 活跃说话人检测:LASER 是调用的现成模块,不是本文提出的新检测器。本文贡献在于机制诊断、提示方式及轻量训练验证,而非重新设计目标检测器。

评分

  • 新颖性: 4/5。用模态特定结构 ID 解释三模态绑定,并把诊断连接到实用提示。
  • 实验充分度: 4/5。含多模型干预、七个应用基准和提示消融,但真实复杂场景的因果覆盖有限。
  • 写作质量: 4/5。三阶段叙述清晰,个别表引用及整体收益措辞需要结合数值阅读。
  • 价值: 4/5。提供可操作的视听对应改进方向,同时明确依赖外部检测和标记理解能力。