跳转至

Evidence-Backed Video Question Answering

会议: ECCV 2026
论文: CVF / ECCV 官方链接
代码: https://github.com/SalesforceAIResearch/EVQA
领域: 语义分割
关键词: 证据溯源视频问答、时空分割、稠密掩码跟踪、多模态视频大模型、指令微调

一句话总结

针对传统视频大模型作为黑盒缺乏视觉依据溯源的问题,本文提出了证据溯源视频问答任务(E-VQA),要求模型联合生成语义答案、时序支撑片段与 6 FPS 稠密时空分割掩码,并构建了高质量基准 ST-Evidence 与 160k 规模指令微调数据集 ST-Evidence-Instruct。

研究背景与动机

当前的视频大语言模型(Video LLMs)在各类视频问答(Video QA)基准测试上取得了令人瞩目的准确率,但绝大多数模型本质上仍然是黑盒系统:它们仅输出文本答案,缺乏经得起检验的视觉定位依据。这种黑盒特性导致模型极易依赖静态语言先验(Language Bias)或产生视觉幻觉,而非真正感知到了视频中的动态物理过程;一旦发生错误,也几乎无法追溯其感知失败的根源。虽然近期研究尝试引入思维链(CoT)推理来增强可解释性,但这类纯文本推导同样缺乏物理空间和时间上的确定性视觉证据,在自动驾驶、医疗辅助和具身机器人等高安全要求的场景中难以被信赖。

已有探讨定位型视频推理的工作大多局限于“答案定位”(仅圈出构成答案本身的物体),且在空间上主要依赖关键帧上的稀疏边界框(Bounding Box)或粗粒度时间片段。然而,面对真实视频中的复杂动态现象——诸如严重遮挡、连续状态改变、非刚性形变(例如飞溅的液体、柔性绳索)以及多目标交错穿插(例如猜杯子魔术中的身份保持)——稀疏边界框完全无法准确刻画实体边界与交互事实。要想无可争议地证明模型确实观察到了支撑推理的视觉线索,模型必须具备沿着时空维度输出稠密像素级跟踪轨迹的能力。

本文的核心矛盾在于:高层语义推理与底层像素级时空感知在现有模型架构和数据集中严重脱节——文本推理模型缺乏精细空间输出头,而定位分割模型通常只能响应简单的指示短语,无法应对复杂的因果逻辑。核心 idea:将视频问答形式化为联合输出“语义答案-时序片段-稠密时空掩码”的三元组任务(E-VQA),通过双向自动化数据合成管线构建 16 万条对齐的指令微调数据,使模型在掌握高层因果推理的同时提供可验证的像素级时空证据链。

方法详解

整体框架

E-VQA 任务将传统的单向语义问答扩展为三元组推理任务。给定输入视频 \(V\) 和自然语言问题 \(Q\),模型 \(F\) 必须联合预测一个包含三个要素的输出元组 \((A, E_t, E_s)\):其中 \(A\) 为自然语言答案;\(E_t = \{[start_i, end_i]\}_{i=1}^N\) 为非重叠的关键时序证据片段,指示回答该问题所依赖的核心时间跨度;\(E_s\) 为关键证据物体的时空分割掩码(Masklets),以 6 FPS 的采样率实现稠密像素跟踪。

为了解决该任务缺乏大规模训练数据和评测基准的问题,本文设计了包含人工精细核验的基准测试集 ST-Evidence(分为生成式 ST-Evidence-Gen 与多选判别式 ST-Evidence-MCQ 两个评测变体),并提出了两套互补的自动化数据生成管线构建大规模指令数据集 ST-Evidence-Instruct。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["输入:视频 V + 问题 Q"] --> TaskDef["任务形式化:E-VQA 三元组定义<br/>联合输出 (答案 A, 时序证据 Et, 空间掩码 Es)"]
    TaskDef --> Bench["人工验证基准:ST-Evidence<br/>ST-Evidence-Gen (生成) + ST-Evidence-MCQ (判别)"]
    TaskDef --> PipeG2S["管线一:自底向上掩码生成语义 (ViCaS 数据源)<br/>VLM 提问 → 文本一致性过滤 → 4 FPS 时序定位"]
    TaskDef --> PipeS2G["管线二:自顶向下语义驱动定位 (复杂 QA 数据源)<br/>证据实体识别 → 帧级边界框滤波 → SAM-3 时空掩码传播"]
    PipeG2S --> Dataset["ST-Evidence-Instruct 数据集<br/>160k 规模 (QA, Et, Es) 对齐三元组"]
    PipeS2G --> Dataset
    Dataset --> JointModel["端到端证据感知模型基线<br/>UniPixel 架构 + 文本/时序/掩码联合优化"]

关键设计

1. 证据溯源任务与基准分流设计:解耦生成式与判别式评测能力 传统通用视频大模型不具备原生稠密掩码预测头,若强行使用统一指标评测,往往会掩盖模型在“语义感知”与“空间表征”上的真实瓶颈。为此,ST-Evidence 设立了两个互补的评测变体:生成式评测 ST-Evidence-Gen 要求模型端到端直接合成 \((A, E_t, E_s)\) 三元组(对于通用无掩码头大模型,采用两阶段代理方案,先由大模型生成证据实体的指代文本与时间范围,再接入冻结的 UniPixel-3B 分割器产生掩码);判别式评测 ST-Evidence-MCQ 则将答案、时序片段和关键帧空间掩码全部构造成 4 选 1 的多选题,其中空间干扰项由专业标注员人工圈定语义相关但非因果支撑的物体,从而纯粹检验模型区分因果证据与混淆干扰的辨别力。

2. 掩码生成语义的自底向上合成管线:复用高质量稠密先验 针对从零标注长视频稠密掩码极度昂贵的问题,管线一从具有现成稠密掩码和描述的视频库(如 ViCaS)出发反推问答。系统利用 Qwen3-VL 与 Gemini 双模型,根据视频和候选物体掩码的指代短语,独立生成问答对、支撑物体、置信度以及因果解释。为了杜绝幻觉,引入两级过滤机制:首先丢弃置信度低或格式异常的样本,随后调用 Gemini-2.5-Pro 进行纯文本因果闭环审计,审查该问题是否确实由对应的物体动作所决定。通过验证后,再让 Qwen3-VL 在 4 FPS 采样下精确预测对应时序片段 \(E_t\),并将原始的精细多边形掩码直接挂载为空间证据 \(E_s\)

3. 语义驱动定位的自顶向下分解管线:因果自洽检查与 SAM-3 传播 针对 Perception Test、STAR 和 CLEVRER 等富有因果深度但缺乏定位标注的语义数据集,管线二设计了“实体识别-时序定点-掩码传播”三步分解策略。首先由 Qwen3-VL-235B 识别推导答案不可或缺的核心证据实体,并提供其清晰可见的时间戳;此时引入关键的因果自洽检查(Self-consistency Check)——让大模型仅基于识别出的证据实体重新回答原始问题,仅当重新预测的答案与真实答案严格一致时才予以保留(允许最多 5 次重试,超时则丢弃)。随后,大模型在对应时间戳的关键帧上预测紧凑边界框,并滤除面积过大(\(>90\%\))、过小(\(<1\%\)$)或帧间跳变的退化框。最后,将过滤后的多帧边界框输入 SAM-3 进行全视频时空体积的双向传播,并对重叠度大于 0.9 的冗余 Masklet 进行去重,生成 160k 条严丝合缝的三元组训练样本。

4. 联合感知架构与多任务损失平衡:高层推理与低层像素流协同 为了建立 E-VQA 的强基线模型,本文基于 UniPixel 架构构建了参数量为 3B 与 7B 的模型。模型将 Qwen2.5-VL 作为多模态语言中枢,将 SAM-2.1-Base+ 集成于解码端作为时空掩码生成器。为了防止模型在专用微调后发生灾难性遗忘并保留通用感知能力,训练混合了通用视频理解(MVBench、VideoGPT+)与经典视频分割数据。针对语言答案 \(A\) 与时序片段 \(E_t\)(格式化为文本时间戳标记),采用自回归的下词预测交叉熵损失 \(\mathcal{L}_{\text{text}}\);针对空间掩码 \(E_s\),则利用投影层输出的感知嵌入指导 SAM-2.1 解码器计算 Focal 损失与 Dice 损失 \(\mathcal{L}_{\text{mask}}\),整体通过加权联合损失驱动模型同步习得高层逻辑推断与精准的时空定位: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{text}}(A, E_t) + \lambda \mathcal{L}_{\text{mask}}(E_s)\)$

损失函数 / 训练策略

训练采用 LoRA 针对视觉编码器与主干多模态大语言模型进行参数高效微调,而对后置的时空掩码解码器(SAM-2.1-Base+)进行全参数微调。在输入序列组织上,针对具有高时空分辨率要求的任务,大模型不仅输出答案 token,还会按预设格式直接输出证据实体的时序区间 [[start_s, end_s]],并将特定分割 token 传入交互映射网络生成提示向量,引导掩码解码器在前向过程中完成多帧掩码解码。

实验关键数据

主实验

在 ST-Evidence-Gen 基准上,评估各主流大模型(通用 Video LLM 配合 UniPixel-3B 代理分割器,以及专门的 Grounded Video LLM)在答案准确率(QA acc)、时序证据(mIoU, mIoP, t-mean)以及空间证据(J, F, J&F)上的表现。

模型类别 代表模型 QA acc (%) T-Evidence (t-mean) S-Evidence (J&F)
闭源前沿模型 OpenAI-o3 (UniPixel-3B 代理) 82.6 36.1 41.9
闭源前沿模型 Gemini-2.5-Flash (UniPixel-3B 代理) 81.2 35.2 42.9
闭源前沿模型 Gemini-2.5-Pro (UniPixel-3B 代理) 83.7 49.9 44.0
开源通用模型 Video-LLaMA3-7B 51.0 16.3 13.2
开源通用模型 Qwen2.5-VL-72B 76.2 25.3 39.5
开源通用模型 Qwen3-VL-235B-A22B 83.6 44.5 41.9
定位大模型基线 Sa2VA-Qwen2.5-VL-7B 76.8 0.0 26.2
定位大模型基线 UniPixel-3B 72.2 6.5 42.7
定位大模型基线 UniPixel-7B 75.0 1.9 40.3
微调后基准(本文) Ours-3B 72.4 (+0.2) 26.9 (+20.4) 52.7 (+10.0)
微调后基准(本文) Ours-7B 76.0 (+1.0) 29.1 (+27.2) 54.1 (+13.8)

在判别式 ST-Evidence-MCQ 评测中(表 3),即使大模型 QA 准确率高达 80% 左右,多数通用开源大模型在空间证据 4 选 1 上的表现接近随机猜测(25%):例如 Video-LLaMA3-7B 仅 27.12%,LLaVA-OV-1.5-8B 仅 23.42%,InternVL-3.5-8B 仅 27.43%,证实了传统模型答案准确率与底层视觉感知之间的严重脱节;而 Qwen3-VL-235B-A22B 依靠强大的交错时间戳多模态对齐架构达到了 86.90% 的 S-Evidence 准确率。

消融实验与诊断验证

为了验证标注的空间掩码是否确实承载了回答问题所必需的因果证据(而非无意义的显著前景),作者在 ST-Evidence-Gen 的 200 个样本子集上执行了图像区域腐蚀实验(Table 5):

模型 原始输入准确率 (%) 证据掩码区域打码破坏 (%) 非证据背景区域打码破坏 (%) 证据破坏相对掉点
Gemini-2.5-Flash 81.32 61.12 76.43 -20.20 (vs 非证据 -4.89)
Qwen3-VL-8B 79.31 58.32 73.66 -20.99 (vs 非证据 -5.65)

在通用分割与视频理解基准上的泛化表现(Table 4): - 在复杂时空指示分割基准 MeViS 上,Ours-7B 达到 62.5 J&F(超越原始 UniPixel-7B 的 61.7 与 Sa2VA-4B 的 52.1);在 Ref-DAVIS17 上达到 77.8 J&F(提升 +1.4);在 ReVOS 上达到 64.2 J&F(提升 +0.3)。 - 在综合多模态视频理解基准 MVBench 上,Ours-7B 达到 65.6% 准确率(相比 UniPixel-7B 的 64.3% 提升 +1.3%),证明联合微调并没有损害模型的通用感知与文本认知能力。

关键发现

  • QA 准确率与证据定位严重解耦:在判别式评测中,诸多模型具备 70%~80% 的文字回答水准,但选对支撑该答案的空间物体的概率却在 25% 左右徘徊,说明模型大量依赖提示词语法先验和语义联想蒙对答案。
  • 参数规模扩展(Scaling)无法自然解决定位瓶颈:在 Qwen2.5-VL 体系内,参数量从 3B 扩充到 72B,生成式空间分割 J&F 仅从 31.6 提高至 39.5,时序预测 t-mean 停留在 25.3;而具备显式时间戳-帧特征交错设计的 Qwen3-VL-4B 就能超越 Qwen2.5-VL-72B,说明专门的架构设计与精细时空数据是打破瓶颈的关键。
  • 因果证据判别有效性得到证实:当遮挡被识别出的证据物体时,大模型的回答准确率剧降超 20 个百分点,而遮挡同样面积的非关键物体仅导致不足 5 个百分点的轻微扰动,无可辩驳地证明了 E-VQA 证据标注在因果机制上的真实性。

亮点与洞察

  • 任务形式化完备:摒弃传统仅提供粗粒度边框或时间片段的简易设定,首次要求模型同时产出文字结论、时间区间与 6 FPS 的高精度像素级跟踪 Masklet,在视频领域真正树立了“视觉判决书”式的严格标准。
  • 自洽反向闭环的数据生成哲学:在没有现成定位标签的视频上合成数据时,通过“识别实体 → 自反问重答验证”的因果闭环检验,若模型仅靠该实体推导不出真值答案则果断丢弃,极大保障了 ST-Evidence-Instruct 160k 数据的因果真实性。
  • 可复用的多阶段时空掩码提纯流程:将大模型的语义因果解析、单帧精细边界框过滤与 SAM-3 的稠密体积传播有机串联,解决了复杂多模态视频推理到精细像素分割之间缺少直接监督的工程瓶颈。

局限与展望

  • 推理与评测流程依赖外部代理组件:当前多数顶级通用大模型无法原生地逐帧吐出稠密掩码,在 ST-Evidence-Gen 评测中需借助 UniPixel-3B 充当视觉代理,这在一定程度上将评测效果受制于代理分割器的文本解析力。
  • 长时序多目标并发交互的算力开销:当视频长度超过百秒且涉及多个交错互动的微小物体时,SAM-3 的时空掩码传播和 6 FPS 密度计算带来了较高的显存和时间成本。
  • 未来方向:探索端到端全自回归的“交错生成文本与时空 Token”原生统一大架构,在无需外部 SAM 解码器中继的前提下实现任意复杂逻辑的实时证据可视化。

相关工作与启发

  • vs TVQA+ / NeXT-GQA / V-STaR: 早期工作要么仅在关键帧上标注边界框,要么局限于回答物体本身的定位(Answer Grounding);E-VQA 强调“证据溯源”(Evidence Grounding,定位引发事件的因果媒介而非仅是结论实体),并升级为 6 FPS 的全时程密集像素跟踪。
  • vs UniPixel / Sa2VA: 现有的稠密定位视频大模型主要设计用于被动响应简短的指示性短语(Referring VOS),在面对多步因果逻辑时缺乏自发推导时序边界和因果实体的能力;本文通过指令微调使模型在保持强大分割能力的同时获得了逻辑溯源与时序定位能力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次完整确立包含高精像素级追踪证据的 E-VQA 任务形式,突破传统边框与粗粒度时间戳局限]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖了开源与闭源 15+ 种大模型,并精心设计了区域打码腐蚀验证因果必要性]
  • 写作质量: ⭐⭐⭐⭐⭐ [结构严密清晰,动机直击大模型黑盒幻觉痛点,自动化数据生成管线设计精妙]
  • 价值: ⭐⭐⭐⭐⭐ [公布的高质量基准 ST-Evidence 与 160k 指令微调数据集为可解释视频大模型领域注入了关键资源]