跳转至

Synthetic Visual Genome 2: Extracting Large-scale Spatio-Temporal Scene Graphs from Videos

会议: ECCV2026
论文: ECCV 原文
项目: SVG2
领域: 视频理解
关键词: 时空场景图、全景轨迹、开放词汇、双重采样器、合成标注

一句话总结

SVG2 将真实视频自动标注扩展到 636K 视频规模,并训练轨迹条件模型 TraSeR,以分割对齐和全局/局部双重采样器生成时空场景图,在 SVG2test 上达到 79.0% 对象准确率和 27.1% 属性召回率,但关系预测并未全面超过 GPT-5。

研究背景与动机

视频场景图需要回答的不只是“画面里有什么”,还包括“谁与谁在什么时间发生什么关系”。 节点表示对象及其属性,有向边表示交互,而视频还要求这些节点跨帧保持身份一致。 例如,同一个人可以先骑车再推车,类别没有变化,关系却必须对应不同时间段。 Visual Genome 和后续图像场景图提供了静态结构监督,但不能直接解决这种身份连续性与关系切换。 既有视频数据集通常依赖昂贵的人工标注,稀疏抽帧容易漏掉中途出现的对象,固定类别和长尾关系也限制开放词汇泛化。

这里存在两个相互关联的瓶颈:既要得到大量细粒度训练图,又要让模型知道语言描述究竟属于哪条视觉轨迹。 只增加自动描述并不够,因为上游跟踪若发生身份切换,后续对象名称、属性和关系都会被串到错误实体上。 只把全部帧的视觉 token 送入大模型也不理想,长视频和多个对象会带来大量重复 token。 另一方面,把整条轨迹压成一个摘要虽然有利于识别对象,却可能抹去“何时开始接触、何时分离”等时序细节。 因此,数据构建需要可靠的对象发现与验证,预测模型则需要同时保留稳定身份和局部时间变化。

作者据此提出两部分工作:先组合基础模型生成稠密时空图,再训练较小的模型学习这种结构化输出。 这里的“synthetic”主要指合成标注,视频来自 SA-V 和 PVD,并不是生成模型合成的视频画面。 SVG2test 另外提供人工精标的开放词汇诊断集,避免只在既有封闭类别上衡量效果。 这也解释了为什么论文既讨论跟踪和标注质量,又讨论 token 组织与关系定位,而不是单纯提出一个更大的数据集。 核心 idea:先以对象轨迹建立可扩展的结构监督,再把同一轨迹的全局语义与局部时间信息分别压缩,使语言模型生成有明确实体和时间依据的场景图。

方法详解

整体框架

数据侧先生成全景轨迹,再为轨迹添加对象名称、属性和带时间范围的关系,形成 SVG2。 模型侧的 TraSeR 接收视频以及已有对象掩码轨迹,将视觉 token 绑定到对象,经过双重采样器压缩后由语言模型输出结构化场景图。 两条流程职责不同:昂贵的多模型标注链生成监督,训练好的 TraSeR 执行轨迹条件预测。 原文图 3 特别说明,它不在同一次预测中联合发现和跟踪对象,因此“单次前向”不包含从裸视频得到轨迹的全部成本。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        Input["源视频"] --> Synthesis["轨迹驱动的标注合成"]
        Synthesis -->|训练样本的掩码轨迹| Tokens["轨迹对齐的 token 排列"]
        Given["视频与给定轨迹"] --> Tokens
        Tokens --> Resample["全局与局部双重采样"]
        Resample --> Decoder["语言模型解码"]
        Synthesis -.->|场景图训练监督| Decoder
        Decoder --> Output["对象、属性和时序关系"]

图中给定轨迹在主场景图评测中来自真值,在视频问答实验中来自自动管线的第一阶段。 标注合成不是 TraSeR 每次推理都必须调用的语义教师链;部署时仍需某种上游轨迹来源。 输出需要保留对象 ID、语义标签及关系的时间范围,而不是只写一段自然语言视频摘要。

关键设计

1. 轨迹驱动的标注合成:先固定实体,再生成名称与关系

第一阶段使用 SAM2 和多尺度网格提示生成逐帧候选掩码,随后执行在线与离线两阶段跟踪。 在线阶段向前传播已有掩码,同时检查当前跟踪尚未覆盖的区域,超过阈值的新候选触发新对象 ID。 这补上了 SAM2 不能仅靠初始提示主动发现后来出现对象的缺口。 保守的非对称重叠匹配用于减少遮挡和再次出现时的身份切换。 离线阶段重新播放视频,从每个对象首次出现的位置初始化,并联合向前追踪所有实例。 随后过滤冗余重叠轨迹并修正小的掩码伪影,使后面的文本描述有较稳定的空间载体。 SA-V 子集还会传播人工掩码,并与自动轨迹融合,在没有人工覆盖的区域保留合成掩码,因此不能把整个训练集说成完全不含人工信息。

第二阶段让 DAM-3B-Video 为每条轨迹生成详细描述,再用 GPT-4.1-nano 抽取对象名和颜色、形状等形容词属性。 SAM3 随后以这些对象标签为提示生成验证轨迹,通过视频级时空 IoU 和 Hungarian 分配与原轨迹匹配。 它只承担标签验证:保留原掩码,丢弃缺乏匹配轨迹支持的对象,而非用 SAM3 掩码替换整套数据。 第三阶段把抽样帧、对象 ID、名称和边界框交给 GPT-5,推断对象之间的时空关系。 关系覆盖空间、功能、状态、运动、社交、注意和事件级共七类,既包含接触与携带,也包含相对运动和延时事件。 由于空间关系数量容易淹没其他关系,作者分开请求空间与非空间关系,并压制仅由掩码布局即可得到的 left of、right of 等简单二维关系。 这种处理旨在把标注预算用于视觉语义,但不能消除教师模型在拥挤、遮挡或事件解释上的错误。

2. 轨迹对齐的 token 排列:用掩码覆盖度决定视觉证据归属

Qwen2.5-VL 的视觉 token 对应一块经过空间与时间合并的像素区域,而不是一个天然标记好的对象。 作者将对象掩码按 token 的实际空间像素范围做平均池化,得到每帧在该区域的覆盖比例。 随后在 token 覆盖的连续帧上取最大值,避免对象只在其中部分帧可见就被平均稀释。 覆盖度达到阈值 \(\tau_{\mathrm{eff}}=0.5\) 的 token 才归入对应对象轨迹。 这里的空间池化核和步长必须匹配视觉 token 的真实像素足迹,否则掩码坐标与模型表征会错位。 这比只告诉语言模型“某个框位于何处”更直接,因为对象内部的视觉内容先被组织到对应输入流中。

归属确定后,同一对象的 token 按时间顺序排列,不同对象轨迹用特殊 [TRJ] token 分隔。 于是模型看到的是显式划分实体边界的序列,而不是自行从整段视频 token 中猜测每次提问指的是谁。 这种选择是按对象独立进行的覆盖筛选,原文没有要求所有 token 必须在对象间互斥分配。 细粒度部分与较大物体可能共享视觉区域,也因此仍需要后续压缩来控制重复与序列长度。 原文缓存的式 (1) 至 (5) 存在排版损坏,本笔记依据其相邻文字解释运算,不把猜测修复后的表达式当成作者原式。

3. 全局与局部双重采样:稳定类别与动态关系使用不同时间尺度

直接把排列好的所有 token 输入语言模型,会让长轨迹、密集帧和重复区域占据过多注意力与计算。 对象轨迹重采样器使用一组可学习查询,通过 Perceiver-Resampler 汇总某个对象全时段的视觉证据。 这样不同长度的轨迹都变成固定规模的全局摘要,适合回答对象是什么,以及跨帧保持稳定的外观语义。 全局摘要的代价是时间分辨率下降:知道对象整体像自行车,不意味着知道人何时开始骑它。 因此,论文没有把这个全局汇总当成唯一视觉表示。

时间窗重采样器将视频划分为长度为 \(\Delta t\) 的不重叠窗口,分别汇总每个对象在各窗口中的 token。 对象在某个窗口不存在时不产生该窗口摘要,使表示长度随实际出现时间变化。 每个时间重采样 token 前还加入时间戳嵌入,让语言模型能够把局部变化对应到具体时段。 最终,每个对象的输入表示由全局摘要及按时间排列的局部摘要共同组成。 两个分支都读取该对象对齐后的视觉 token;局部分支不是只对已经丢失时间信息的全局摘要再做一次压缩。 这一点对解释消融很关键:只有全局分支会明显损害关系定位,保留时间窗才有机会区分同一对象的不同阶段。 原文主文没有给出窗口长度的具体取值,因而不能仅据这里复现全部时间压缩设置。

一个完整示例

设视频中同一个人先骑自行车,随后下车推行;这是用于解释机制的示例,不是论文新增的定量实验。 自动管线先为人和自行车建立跨帧轨迹,如果自行车后来才进入画面,在线发现步骤会为它新增 ID。 对象描述阶段应保持两条实体身份稳定,关系阶段则需要把 riding 与推行行为分配到不同时间范围。 TraSeR 推理时从这两条已有轨迹选出各自的视觉 token,并按轨迹边界组织输入。 全局摘要保留人和自行车的类别信息,局部窗口则保留骑乘姿态转变为推行动作的证据。 语言模型据此输出带实体端点和时间范围的关系,而不是把整段视频概括成一个始终成立的 riding 三元组。 如果上游把人和另一条人物轨迹串错,后面的语义模型并没有被证明能自动修复该身份错误。

损失函数 / 训练策略

TraSeR 基于 Qwen2.5-VL-3B,使用 SVG2 及人工标注的学术数据混合训练。 LV-VIS、OVIS、VIPSeg 提供视频实例信息,VidOR 和 VidVRD 补充关系监督。 其中边界框标注通过 SAM2 转为分割掩码,不同数据源再通过任务模板序列化为统一的自回归输出格式。 主文说明了这种训练格式,但没有提出需要单独复现的新损失公式。 两个 Perceiver-Resampler 均为三层,每个使用 32 个可学习查询。 训练冻结 Qwen2.5-ViT,更新视觉语言投影器、两个重采样器和语言模型。 对应学习率分别为 \(5\times10^{-5}\)\(1\times10^{-4}\)\(2\times10^{-5}\),新模块使用较大学习率以适应轨迹压缩任务。 主模型训练一个 epoch,共 37K 步,硬件为单节点 8 张 H100。 架构消融则只在 SVG2 的 SA-V 子集训练三个 epoch,不能把消融分数与主模型分数直接混成同一设置。

实验关键数据

主实验

表 2(原文第 11 页)使用给定真值轨迹,关系与三元组的时间 IoU 阈值为 0.5,数值为百分数。 下表摘取 SVG2test 的四项完整指标;基线接收由轨迹提供的边界框信息,TraSeR 则利用分割掩码对齐。 因此比较控制了对象轨迹来源,但并不是所有模型以完全相同形式消费轨迹信息。

模型 三元组召回率 关系召回率 对象准确率 属性召回率
GPT-4.1 6.4 7.5 58.5 15.8
GPT-5 17.9 19.4 65.5 24.1
Qwen2.5-VL-3B 0.2 0.3 24.2 1.4
FT-Qwen2.5-VL-3B(完整框轨迹) 1.4 3.0 46.1 13.4
TraSeR 16.7 18.7 79.0 27.1

对象准确率评价轨迹标签;属性和关系召回率评价可匹配的真值元素,三元组还要求主语、宾语和谓词同时正确。 表中采用宽松语义标准:GPT-4o-mini 仅作为成对词汇匹配器,区分相同、同义、上下位、语义重叠和不匹配。 除不匹配外均算语义正确,关系还必须满足时间交并比要求;这比精确字符串匹配宽松,不能直接解释成严格类别识别性能。 表 3 的人类一致性检查抽取 250 个对象与 150 个关系,宽松匹配的 Cohen's \(\kappa\) 分别为 0.877 和 0.791。 这一验证支持评测器的可用性,但不等于对所有长尾类别或时间定位进行了人工复核。

消融实验

表 4(原文第 12 页)在 SA-V 子集训练三个 epoch;以下只摘取 PVSG* 列,指标均为百分数。 原表说明不带重采样器的变体无法支持长视频,因此 PVSG 使用其 VidOR 子集,不是表 2 的完整 PVSG。

时间窗重采样器 对象轨迹重采样器 对齐信号 三元组召回率 关系召回率 对象准确率
分割 7.03 7.15 73.34
分割 2.44 2.68 77.10
分割 8.52 8.63 77.84
边界框 8.69 9.39 73.05
分割 10.14 11.38 78.21

只保留对象全局汇总时,关系召回率为 2.68;恢复时间窗后达到 11.38,说明压缩必须保留局部时间结构。 同样使用两个重采样器时,分割对齐相较框对齐把对象准确率从 73.05 提高到 78.21。 不过,表 4 的 VidOR 关系召回率在仅时间窗配置为 16.78,高于双分支的 16.30,不能把“双分支最好”理解成每一列都最优。

表 6(原文第 14 页)让 GPT-4.1 以 1 fps 视频帧作答,抽取 AGQA 2.0 的 1K 道开放题和 Perception-Test 的 500 道选择题。 此处先由自动管线生成轨迹,再生成场景图,属于比真值轨迹评测更接近完整应用链的验证;指标为准确率百分数。

输入 AGQA 2.0 Perception-Test
仅视频 25.9 66.8
视频 + Qwen2.5-VL-3B 场景图 24.8 68.6
视频 + TraSeR 场景图 26.3 71.4

关键发现

  • SVG2test 上,TraSeR 对象准确率比 GPT-5 高 13.5 个百分点,属性召回率高 3.0 个百分点,但三元组与关系召回率仍略低。
  • 视频问答相对仅视频的收益分别为 0.4 和 4.6 个百分点;相对 Qwen 场景图输入则为 1.5 和 2.8 个百分点,比较基线必须写清。
  • 标注人工核验见第 6 页:1.2K 条对象轨迹、2K 个属性、1.1K 个关系的准确率分别为 93.8%、88.3%、85.4%,另检验 350 个完整三元组得到 84.3%。
  • 表 5 的完整训练配置在 PVSG 的三元组/关系列为 16.91/16.13,而表 2 为 16.1/16.9;原文未解释这一差异,本笔记不将两表强行合并。

亮点与洞察

  • 对象身份在进入语言模型前就由分割证据建立。模型不必仅凭坐标文字维持跨帧指代,这是比增加提示词更直接的结构约束。
  • 两个重采样器分别服务稳定语义与动态语义。只看 token 数量的压缩方案会漏掉时间信息损失,而本论文用关系定位消融展示了这一代价。
  • SAM3 验证器检查标签是否得到视觉支持,却不替换原掩码。这把“轨迹几何是否连贯”和“对象命名是否可信”拆成了不同检查环节。
  • 结构化图并非越多越好:Qwen 图让 AGQA 从 25.9 降到 24.8。读者可以据此推断,中间表示的准确性比是否采用图格式本身更重要。

局限与展望

  • 作者明确承认依赖上游轨迹,未来才考虑把对象提议、跟踪与场景图生成统一起来;当前结果不能代表端到端检测跟踪的性能。
  • 标注继承基础模型错误,人工检查关系错误中约 86% 来自遮挡或拥挤下的谓词错误,14% 来自时间范围错误,扩容并不自动消除这些偏差。
  • SVG2test 仅含 100 个视频,且宽松语义评测接纳上下位和部分重叠;读者应把结论限定为该诊断集和评测协议,而非任意开放世界准确率。
  • 原文多处附录引用显示为 Appx. ??,缓存没有相应附录,公式亦有抽取损坏;严格匹配扩展结果、窗口长度等不能在这里独立核验。
  • 原文没有完整报告数据合成成本或端到端推理延迟,因此“小模型单次前向”不能直接推出整个应用链廉价。
  • 作者还指出监控和大规模行为分析的双重用途风险,实际使用应约束视频来源、个人可识别信息及结构化关系数据的用途。

相关工作与启发

  • Visual Genome / Synthetic Visual Genome:前者建立图像中的对象、属性和关系资源,后者扩展自动图像标注;SVG2 增加对象持续性、出现消失和关系时间范围。
  • PVSG / VidOR:提供重要的人工视频关系基准,但类别与属性覆盖有限;SVG2 的互补价值是开放词汇、稠密轨迹和属性监督,不是简单替代人工真值。
  • SAM2 / DAM / SAM3:分别贡献轨迹、局部描述和标签验证能力。本文创新主要在这些能力如何组成稳定的时空标注流程,以及其结果如何训练专门预测器。
  • Flamingo 的 Perceiver-Resampler:提供可学习查询压缩的基础机制;TraSeR 的任务化改动是把查询限定在实体轨迹及其时间窗上,而不是提出全新的注意力算子。
  • 研究启发:可以进一步研究关系时间边界附近的自适应窗口,让有限 token 优先保留交互变化;这是读者建议,论文尚未验证。

评分

  • 新颖性: 4/5。大规模轨迹标注与对象/时间双尺度表示结合明确,底层视觉和重采样机制主要复用既有模型。
  • 实验充分度: 4/5。覆盖结构预测、人工核验、架构与数据消融及下游问答,但诊断集规模和成本报告仍有限。
  • 写作质量: 3/5。任务边界和方法逻辑清楚,但附录引用缺失、公式抽取及跨表数值差异影响复核。
  • 价值: 4/5。对开放词汇视频结构监督有实际参考价值,使用时需同步考虑轨迹质量、教师偏差和隐私边界。