MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://marineevt.hkustvgd.com
领域: 多模态VLM / LLM推理
关键词: 海洋视频理解、事件中心推理、视觉工具调用、强化学习、GRPO
一句话总结¶
针对水下视频中关键生态事件稀疏、难以捕捉且缺乏时序因果推理能力的瓶颈,本文构建了首个涵盖 2 万对高质量多维问答的以事件为中心的海洋视频基准 MarineEVT,并提出了融合时空视觉工具多轮交互与双重奖励 GRPO 优化的 EVT-R1 推理框架。
研究背景与动机¶
海洋覆盖了地球表面超过 70% 的面积,对其生态系统的理解与监测对生物多样性保护、气候变化应对和可持续海洋资源管理具有核心科学价值。近年来,多模态视觉语言模型(VLM)在陆地日常视频以及静态水下图像分析(如海洋生物检测、分割与图像描述)中取得了巨大进展。然而,当多模态模型拓展到海洋水下视频时,其推理表现往往大幅度退化。水下视频环境面临着极为恶劣且独特的时空特征:水下拍摄视角受光线折射、水质浑浊和悬浮物干扰极大,摄像机在静态或缓慢巡航过程中捕获了大量冗余背景与重复画面,而真正具有关键生态价值的事件(如罕见物种捕食、领地防御、种间互动或异常行为)却高度稀疏、短暂且不可预测。
通用视频 VLM 通常偏向于粗粒度的整段场景摘要,严重缺乏辨识细粒度动态实体与特定时序片段因果关系的能力。即使是最顶级的通用商业大模型(如 GPT-5),在面对水下复杂互动时,也极易将其平庸地概括为“鱼类在沙地上平静巡游”,完全忽略掩斑鲀遭到红海热带雀鲷两度猛烈冲击领地的关键生态防御事件。这背后的核心矛盾在于:海洋视频理解需要极其专业的领域生态学知识,并且必须在冗余帧的淹没下精确定位并放大关键时空窗口,而现有模型既缺乏专注于水下动态事件的多任务时空基准,又缺乏主动剥离冗余视觉信号、动态调用专家工具辅助反思的推理机制。即便对通用模型直接进行水下数据监督微调(SFT),模型依然缺少时空定位的决策闭环与自适应裁剪能力。
为了打破这一僵局,本文提出了将长程复杂水下视频理解解构为多轮视觉工具交互决策过程的方法。核心 idea:构建首个包含 20 维生态推理任务的事件中心水下视频基准 MarineEVT,并提出基于强化学习的多轮视觉工具交互推理框架 EVT-R1,通过动态调用时序与空间定位工具剔除冗余帧并聚焦关键线索,配合工具使用与答案准确性的双重奖励模型实现鲁棒的事件级因果推理。
方法详解¶
整体框架¶
EVT-R1 将复杂的事件级海洋视频理解建模为序贯决策过程。面对输入的用户查询 \(q\)、原始水下视频序列 \(V_0\) 以及视觉工具箱 \(\mathcal{T}\),策略模型 \(\pi_\theta\) 展开多轮推理轨迹。在第 \(k\) 步推理中,模型结合当前问题上下文、当前视觉观测 \(V_k\) 和历史对话轨迹 \(H_k\) 生成思维链推理文本 \(r_k\),自主决策是直接输出最终答案还是调用特定视觉工具 \(T_k \subseteq \mathcal{T}\)。若选择调用工具,工具执行器根据生成的参数在视频中截取精炼的时序片段或提取特定空间实体的视觉线索,以新观测 \(o_k\) 替换对话历史中的旧视觉输入,从而彻底剔除无关冗余 token 并浓缩有效特征,直至模型积累足够置信的证据后输出最终答案 \(a\)。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入海洋视频 V0 与查询 q"] --> B["多阶段事件数据生成与验证<br/>TransNet切分+SAM3空间标注+双层校验"]
B --> C["多轮视觉工具推理轨迹<br/>时空动态工具调用与视觉替换"]
C --> D["双重奖励强化学习优化<br/>工具推理奖励与多任务答案奖励解耦"]
D --> E["输出事件级精准回答 a"]
关键设计¶
1. 多阶段事件数据生成与验证:构建高密度领域监督基准
直接使用通用 LLM 面对原始冗余水下视频生成问答必然导致知识幻觉和时空错位。为此,研究团队设计了分层粗细渐进的数据构建管线。首先利用 TransNet 将 7,300 个水下视频切分为 97,284 个离散场景,结合物种、人类潜水活动、环境及特殊事件等领域专家级 Prompt,驱动模型生成粗粒度场景伪描述;随后利用 SAM3、DepthAnythingV2 和 OrientAnything 提取了 94,028 条高精度空间几何与边界框标注(涵盖 240,017 个目标边界框)。最后通过 QwenVL-Max 基于多片段组合与时空标注生成跨 20 维推理维度的问答对,并经由三款 LLM 自动化初筛与 3 位海洋领域专家进行严格的双层核验,从而确保了 MarineEVT 基准在物种生态、时序定位和因果动态上的专业性与准确性。
2. 多轮视觉工具推理轨迹:主动消除时空冗余的序贯决策
传统思维链(CoT)仅在文本空间展开推理,无法克服视频帧数膨胀与水下视觉信噪比极低的问题。EVT-R1 将推理过程拓展为具备视觉主动交互能力的多轮环境交互轨迹。在每一轮决策中,模型根据上下文输出调用参数,工具箱包含两类核心工具:时序定位工具负责根据起始与终止时间截取关键动作窗口,空间定位工具利用目标提示词提取特定水下生物或人造潜水设备的局部区域。工具调用返回的增强视觉观测会直接替代对话历史中陈旧的高开销原始视觉 token,不仅防止了上下文窗口被海量冗余帧撑爆,还强制模型在由粗到精的视觉线索引导下完成关键证据链闭环。
3. 双重奖励强化学习优化:解耦工具使用与答案生成的协同对齐
常规 GRPO 强化学习方案仅依据最终输出的单一标量奖励进行策略梯度回传,在多轮工具调用场景下极易引发奖励过拟合、死循环调用或工具滥用。EVT-R1 提出了 turn-level 的双重奖励模型,将单步奖励显式解耦为工具推理奖励 \(R_{\text{tool}}\) 与多任务答案奖励 \(R_{\text{ans}}\):
其中工具奖励 \(R_{\text{tool}}\) 综合考量工具调用的合理性(Invocation Validity,判断当前步骤是否符合工具调用真值)与工具执行精度(Invocation Accuracy,评估时空定位交并比 IoU 是否达标);答案奖励 \(R_{\text{ans}}\) 则兼顾格式合规性与语义正确性(封闭题采用精确字符串匹配,开放题采用嵌入余弦相似度并做分组归一化)。通过组相对策略优化目标 \(L_{\text{GRPO}}(\theta)\) 进行更新,辅以 KL 散度约束,促使模型学会在正确的时间以正确的参数调用工具。
损失函数 / 训练策略¶
EVT-R1 采用两阶段训练策略:首先在 MarineEVT 训练集上执行 1 个 epoch 的监督微调(SFT)作为热身冷启动,赋予模型基础的海洋生物常识和工具调用接口语法;随后执行 4 个 epoch 的 GRPO 强化学习训练,群组采样大小为 \(G\),优化目标包含裁剪优势函数与参考策略的 KL 散度约束:
超参数设置上,奖励加权系数设定为 \(\lambda = 0.75\),采用 LoRA 针对 Qwen3-VL-8B 主干进行参数高效微调,优化器为 AdamW,学习率 \(5 \times 10^{-6}\),权重衰减 \(1 \times 10^{-2}\),支持长达 50k tokens 的长上下文优化。
实验关键数据¶
主实验¶
在从 MarineEVT 划分出的 2,000 个测试问答对上,评估涵盖语义推理(SemR)、语境推理(ConR)、空间推理(SpaR)、时序推理(TemR)和因果推理(CasR)五个维度的平均准确率。基线涵盖开源与闭源顶级 VLM:
| 模型 | 工具调用 | 训练方式 | SemR | ConR | SpaR | TemR | CasR | 平均准确率 (Avg.) |
|---|---|---|---|---|---|---|---|---|
| Video-LLaVA-7B | ✗ | 零样本 | 24.40 | 29.00 | 8.40 | 5.80 | 42.00 | 21.92 |
| LLaVA-NeXT-Video-7B | ✗ | 零样本 | 35.40 | 34.33 | 9.00 | 6.75 | 42.67 | 25.63 |
| VideoLLaMA3-7B | ✗ | 零样本 | 41.00 | 46.33 | 5.40 | 3.50 | 61.77 | 31.60 |
| InternVL3-8B | ✗ | 零样本 | 53.40 | 50.33 | 17.20 | 10.33 | 71.77 | 40.61 |
| Qwen3-VL-8B-Instruct | ✗ | 零样本 | 58.20 | 52.77 | 22.40 | 14.00 | 71.00 | 43.67 |
| Grok-4-1-FR | ✗ | 零样本 | 41.20 | 37.33 | 17.40 | 6.25 | 50.67 | 30.57 |
| Gemini-3.0-Flash | ✗ | 零样本 | 48.20 | 43.00 | 27.00 | 7.75 | 62.00 | 37.59 |
| GPT-5-Mini | ✗ | 零样本 | 58.40 | 30.67 | 22.80 | 10.00 | 66.67 | 37.71 |
| GPT-5-Mini | ✓ | 提示词驱动 | 58.40 | 43.67 | 22.40 | 13.00 | 64.33 | 40.35 |
| Qwen3-VL-8B | ✓ | GRPO (仅后训练) | 44.60 | 37.00 | 20.00 | 10.75 | 62.66 | 35.58 |
| Qwen3-VL-8B | ✓ | SFT 全量微调 | 61.40 | 53.33 | 22.60 | 15.00 | 74.00 | 45.27 |
| EVT-R1 (本文) | ✓ | SFT + RL | 65.80 | 53.33 | 30.60 | 20.75 | 74.00 | 48.89 |
消融实验¶
消融实验深入验证了训练模式、时序与特征压缩 baseline、工具调用质量及奖励加权超参的影响:
| 配置 / 对比算法 | 类别 | SemR | ConR | SpaR | TemR | CasR | 平均准确率 (Avg.) | 说明 |
|---|---|---|---|---|---|---|---|---|
| VisionZip (Qwen2.5-VL) | Token 压缩 | 26.60 | 13.00 | 10.80 | 2.75 | 47.33 | 20.42 | 压缩粗暴丢失关键微小目标特征 |
| PVC (InternVL2-8B) | Token 压缩 | 45.60 | 24.67 | 9.40 | 2.50 | 69.00 | 30.23 | 缺乏定位能力导致时空推理极差 |
| MaxInfo (关键帧选择) | 时序算法 | 48.00 | 23.67 | 19.20 | 11.00 | 50.00 | 30.37 | 体积最大化无法匹配稀疏动态事件 |
| VideoITG (时序定位) | 时序算法 | 47.40 | 48.67 | 20.20 | 14.25 | 67.33 | 39.57 | 经典时序 grounding 方案 |
| Qwen3-VL (SFT-only) | 训练模式 | 61.40 | 53.33 | 22.60 | 15.00 | 74.00 | 45.27 | 仅通过 SFT 微调未能学透工具策略 |
| EVT-R1 (仅 RL,无 SFT) | 训练模式 | 44.80 | 39.00 | 21.40 | 13.75 | 63.33 | 36.52 | 缺乏先验导致长轨迹奖励崩溃与死循环 |
| EVT-R1 (\(\lambda = 0.00\)) | 奖励权重 | 44.80 | 38.67 | 18.80 | 14.50 | 65.00 | 36.35 | 无中间工具奖励,策略收敛缓慢 |
| EVT-R1 (\(\lambda = 0.50\)) | 奖励权重 | 54.00 | 38.33 | 18.20 | 12.25 | 66.67 | 37.89 | 工具与答案奖励权重等分 |
| EVT-R1 (\(\lambda = 0.75\)) | 完整模型 | 65.80 | 53.33 | 30.60 | 20.75 | 74.00 | 48.89 | 最优组合,时空与因果表现全面领先 |
关键发现¶
- SFT 冷启动对多轮 RL 必不可少:直接在通用 VLM 上进行强化学习后训练(RL-only)会导致性能暴跌(35.58/36.52),原因在于模型缺少水下物种常识与工具语法规范,极易在多步推理中陷入死循环;而 1 轮 SFT 热身后接 RL 则激发出强劲的推理收益(48.89)。
- 工具调用质量大幅提升:评估显示,EVT-R1 相比纯 SFT 模型,在工具选择正确率上提升了 +4.45%(达到 70.00%),调用步数准确率提升 +2.95%(达到 87.35%),空间定位 IoU \(\ge 0.5\) 提升了 +3.75%,有效引导注意力聚焦在极细小的深海水生物种上。
- 视觉主动裁剪优于无差别压缩:被动式 token 压缩(VisionZip、PVC)平均准确率仅 20~30%,远落后于通过主动时空工具裁剪聚焦的 EVT-R1(48.89),证明了在稀疏长视频中主动截取局部视觉观测的优越性。
亮点与洞察¶
- 视觉替换式多轮对话设计:在每轮工具调用后,模型并非无限堆叠图像或边框提示,而是用截取后的时序/空间局部观测直接替换上一轮的高冗余视觉输入。这种设计既严格控制了上下文长度,又从根本上阻断了无关背景对注意力权重的稀释。
- 解耦式转轮奖励机制:将强化学习奖励明确区分为工具调用有效性与最终答案正确性,通过系数 \(\lambda=0.75\) 强化对过程决策的密集反馈,避免了传统端到端强化学习因最终奖励过稀疏而难以探索有效工具调用轨迹的顽疾。
- 可迁移的专业领域智能体范式:将“视频长程冗余+稀疏关键事件”的痛点转化为“主动时空工具检索+自适应视觉更新”的解题思路,这一框架可直接推广至无人机野外航拍巡检、内窥镜微创手术视频分析等高专业度、低信噪比的视觉领域。
局限与展望¶
- 工具箱种类相对收敛:目前工具箱主要聚焦于时序切分与空间检测分割(SAM3 等),对于水质浑浊度自适应去雾、多目标水下持续三维轨迹追踪等专业图像增强工具的集成仍有待拓展。
- 推理延迟与调用开销:多轮串行决策和外部视觉模型推理引入了额外的延迟,在实时水下机器人潜航器(AUV/ROV)边端算力受限平台上的轻量化部署与工具蒸馏将是未来重要课题。
相关工作与启发¶
- vs UVLM: UVLM 首次探索了水下视频语言基准,但其问答主要围绕静态物种标签和孤立粗粒度动作展开;MarineEVT 首次深入到事件中心级别,系统覆盖时序因果、捕食防御与环境交互等复杂生态动态。
- vs VideoITG & Chain-of-Frames: 现有时序定位与关键帧筛选方法多采用固定的单向检索或注意力剪枝;EVT-R1 则将工具调用深度嵌入强化学习的序贯思考链条中,赋予模型“边看、边想、边调工具”的双向交互能力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次建立事件中心水下视频基准,提出时空工具多轮交互与双重奖励 GRPO 机制。
- 实验充分度: ⭐⭐⭐⭐⭐ 详尽对比了 11 种开源/闭源模型、Token 压缩与时序定位算法,提供了严密的消融数据。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,问题动机、框架流程与理论阐述清晰通畅。
- 价值: ⭐⭐⭐⭐⭐ 为海洋生态科研观测、深海生物行为学分析和专业长视频多模态 Agent 奠定了重要基石。