跳转至

VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning

会议: ECCV 2026
论文: ECCV 2026
领域: 多模态 VLM / 视频理解
关键词: 长视频理解、工具集成推理、智能体强化学习、多轮检索、信用分配

一句话总结

VideoTIR 让 MLLM 在多轮循环里答题——低分辨率低帧率起手,由「文本路由器」判断当前画面够不够,不够就调用分层内部视觉工具(全局浏览 / 段检索 / 帧检索 / 局部放大)取回更细的线索再拼回上下文,同时用 TAGPO 把轨迹级奖励按「离答案的步数」衰减地拆到每一次工具调用上,抑制工具的滥用与过度使用,在 Video-MME / MVBench / LongVideoBench 上同时改善准确率与效率(平均 1.42 次调用、4.6s 延迟)。

研究背景与动机

长视频理解(LVU)要回答几分钟到几小时视频上的问题,MLLM 凭借强大的视觉语言推理能力成为主流解法,但直接「看完再答」会出幻觉,根因是文本 token 与视觉 token 的失衡:上下文窗口受限迫使激进下采样,跨场景依赖被抹平、时长引发的错误被放大。已有的缓解思路分两条。一条是非 TIR 的帧选择:在最终推理之前先挑出相关帧或片段,确实省了冗余视觉 token,但它在推理循环之外运行,推理过程中无法自适应补证。另一条是工具集成推理(TIR):把检索工具接进推理链,允许迭代取证。这条路又有两个分支——重外部工具集把 MLLM 和 ASR、OCR、片段定位器、记忆系统拼在一起(VideoAgent、DrVideo、Video-MultiAgents、COLT 等),流程预定义、交互开销大、换一个长视频场景就未必泛化;轻量内部检索让 MLLM 自己输出文本时间戳来切片段(VideoMTR、LongVT),更紧凑,却把「定位」和「推理」纠缠在同一个文本解码过程里。

这就构成了本文要处理的核心矛盾:要准确就得迭代取证,要迭代取证就得有可靠的工具;可工具放在模型外部太贵、流程太僵,放进模型内部又退化成「用文本猜时间戳」,精度被基座本身的时序定位能力卡死(MLLM 并没有在细粒度时空标注的视频数据上充分预训练),结果就是反复调用、检索相似片段、答案还不一定对。更麻烦的是,这些方法基本只有单一工具,而长视频问题是异构的——「整段视频在讲什么」和「人物拍手之后发生了什么」需要的证据粒度完全不同,一个工具撑不起这种按需切换。

本文的切入角度是:工具不一定要是外部服务,也可以是模型自己编码器的一部分。把「文本查询 token」和「视频 token」在 VLM 自身的嵌入空间里做余弦相似度比对,就能不引入任何外部进程地定位片段、挑选关键帧、裁剪出最相关区域;再配一个文本路由器,在多轮循环里决定「现在能不能答、不能答该调哪一类工具」。核心 idea:把长视频理解建模成「多轮、多内部工具」的决策过程,用 RL 学工具使用策略,并用 TAGPO 把轨迹级奖励按距最终答案的步数衰减地分配(同工具内归一化)到每一次调用上——冗余调用自动拿到负优势,失败轨迹里的重复探索拿不到相对优势,从而同时治住工具的「过度使用」与「滥用」。

方法详解

整体框架

VideoTIR 的输入是一段长视频和一个问题(评测里多为多选题),输出是答案,整条推理在 VLM 内部以多轮形式展开。它模仿人看长视频的方式:先粗看,觉得信息不够再回头找细节。出于效率考虑,初始只用低分辨率、低 fps 采样(默认每视频最多 32 帧、首轮每帧 196 token、总计约 1960 视频 token),把问题和当前画面交给文本路由器。路由器在此刻做三选一:当前视觉信息足够就直接作答;问题意图是全局性的(如「整段视频在讲什么」)就调用全局浏览工具,它同屏提高分辨率与采样帧率;意图落在具体视觉线索上(如「某人拍手之后发生了什么」)就进入时空定位工具链——段检索 → 帧检索 → 局部放大,任何一级拿到足够线索即可早停。工具产出的细粒度视觉信息并入此前上下文,再次送入路由器,循环直到模型给出答案或达到最大轮数(4 轮)。

训练侧还有两个部件。沙箱轨迹合成在 RL 之前用外部 MLLM 加伪环境反馈造出多工具调用的冷启动数据——没有它,小模型连合法的工具调用格式都写不出来;TAGPO 则在 RL 阶段把轨迹级奖励拆到每一次工具调用上,用更细的信用分配换更短的工具调用链。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    Q["长视频 + 问题<br/>低分辨率、低帧率初采样"] --> R["文本路由器"]
    R -->|"信息已足够"| ANS["输出答案"]
    R -->|"全局性问题"| BR["全局浏览工具<br/>同屏提高分辨率与帧率"]
    R -->|"局部细节问题"| TG
    subgraph TG["时空定位工具链(支持早停)"]
        direction TB
        SR["段检索工具<br/>文本 token 比对视频 token"] --> FR["帧检索工具<br/>段内挑最相关关键帧"]
        FR --> ZI["局部放大工具<br/>裁出最相关区域"]
    end
    BR --> CTX["视觉线索拼回上下文"]
    TG --> CTX
    CTX -->|"未达最大轮数"| R
    ANS --> TR["TAGPO<br/>给每次调用分配步进奖励"]
    SYN["沙箱轨迹合成<br/>伪环境反馈造多工具轨迹"] -->|"冷启动 SFT"| R

关键设计

1. 文本路由器:先判断「画面够不够」,再决定调哪一类工具

如果每题都把全部帧、全部分辨率看一遍,长视频的视觉 token 直接爆掉;而固定的工具流水线又无法适配异构问题。文本路由器的做法是把「要不要更多信息」这个决策交给语言模型自己生成,而不是外部规则:它结合当前视觉线索与文本意图,输出三种行为之一——视觉信息足够就直接给答案;意图偏全局就调浏览工具;意图指向具体视觉线索就调时空定位工具链。它同时还是检索语句的生成器:定位类工具需要一句文本查询,这句话由路由器规划(论文图 2 里生成的检索语句是 "snatch grip deadlift gym background activity"),再交给内部编码器做相似度检索。这种「路由 + 查询重写」合一的设计让工具调用带上问题语义,而不只是机械地放大采样率;实验里路由器确实按问题类型分流(见消融表)。

2. 全局浏览工具:用「更高分辨率 + 更高帧率」换取一次更慢更仔细的浏览

针对「整体理解」类问题:当问题需要综合整段视频、而当前低分辨率低帧率的画面给不出答案时,人的做法是放慢、看得更细。浏览工具照这个动作设计——它不换工具类型,只是同时提高分辨率和采样帧率,把同一段视频以更密的帧、更大的像素重新喂回模型。这样「全局理解」被建模成一次成本递增的再采样,而不是一次性把预算拉满:只有路由器判断需要时,才付这笔 token 开销。这条设计与局部定位工具共用同一套内部编码器,因而没有引入任何额外模型或进程。

3. 时空定位工具链:段 → 帧 → 放大的早停式内部检索

局部问题要的是「定位 + 看清」,本文把它做成一条可早停的三级链。段检索用文本查询 token 与视频 token 的余弦相似度在原视频里选出相关片段——注意检索发生在 VLM 自己的嵌入空间,不需要外部检索模型或 API;帧检索在该片段内挑出与问题和检索语句最相关的关键帧,把时间粒度进一步收紧;局部放大则直接作用在图像模态上,裁出最相关的区域。链上每一步只在上一步不够用时才继续,「要定多细」由模型自己按需决定(论文图 4 的示意即「That's enough」处提前终止)。与两类前作的关键区别在于分工:时间戳式方法把定位预测和推理纠缠在同一个文本解码过程里,精度被基座时序能力拖累;外部工具方法则要付进程间调用与固定流程的代价。本文把定位交给编码器的特征相似度(信号更可靠),把「还要不要继续往下找」留给语言推理。

4. TAGPO:把轨迹级奖励拆到每一次工具调用上

多工具设定下,标准 GRPO 只对整条轨迹给一个 episode 级奖励(答案对错 + 格式 + 工具使用 bonus),这会同时纵容两种坏行为:滥用——调了一堆工具仍然答错,属于 reward hacking,白白加重早期探索负担;过度使用——粗粒度检索其实够用,模型偏要一路调到最细的帧。TAGPO 的思路是把信用分配下沉到每一次调用。对轨迹 \(\tau_i\) 中第 \(j\) 步调用的工具 \(k\),先给一个局部奖励:它只在轨迹答对时非零,并按「这一步离最终答案还有多远」做指数衰减,

\[R^{k}_{i,j} = \mathbb{I}_{R_{\mathrm{acc}}(\tau_i)>0}\cdot \gamma^{\,L_i-j}\cdot R_i,\qquad \gamma\in(0,1]\]

其中 \(L_i\) 是该轨迹的工具调用总数,\(\gamma\) 是预定义的衰减系数:越靠近最终答案的调用权重越大,早先的调用被衰减得越狠。随后只在同一个工具内部(只取调用过工具 \(k\) 的那些步)做归一化,得到该次调用的优势 \(A^k_{i,j}\),再把一条轨迹上所有调用的优势取平均,作为轨迹级的工具动作优势 \(A^{\mathrm{TAGPO}}_i\)。这个设计在三种对比情形下的行为最能说明意图:若 (A,A,B) 与 (A,B) 都答对,前者的第二个 A 与后者的 A 拿到相同局部奖励,而前者多出来的那个 A 因额外衰减在同工具归一化下变成负优势,「过度使用」被直接惩罚;若 (A,A,B) 成功而 (A,B) 失败,前者所有调用拿正信用、后者全为零,重复调用 A 的必要性被强化;若两者都失败,则没有任何局部信用被分配,也就没有相对优势,模型被推向探索别的工具组合——这正是对「滥用」的抑制。最终策略用复合优势 \(A^{\mathrm{GRPO}}_i + A^{\mathrm{TAGPO}}_i\) 做策略梯度更新。

5. 沙箱轨迹合成:用伪环境反馈造出多工具冷启动数据

RL 阶段的奖励只有「答案对错」和「调用串能否解析」两种,对「工具用得合不合适」几乎没有监督;而多工具场景里工具提示离系统提示很远,指令漂移/遗忘的风险陡增,小模型尤其严重——论文报告 3B 直接跑 Zero-RL 会失败,因为合法工具调用串太稀少,同组优势的标准差接近 0,优势估计器失效。本文的办法是先把数据造出来:借助视频-文本 grounding 数据(VideoXUM、QV-Highlights 等)合成 QA,先用 MLLM 直答一轮做工具必要性过滤,能不用工具答对的样本搁置一旁;对剩下的样本给出 VQA 与带工具模板的初始系统提示,让外部 MLLM(GLM-4.5V)预测一条合理的工具调用顺序;再改写系统提示(尤其是工具模板)以增加调用语法与推理行为的多样性;然后在一个沙箱模拟器里按改写后的提示与预测顺序生成逐步推理、显式调用命令和预期的环境反馈(即伪工具返回),免去真实环境交互;最后用大模型按简洁性与准确性对候选轨迹排序裁决,只保留合理的。产出的轨迹用于 SFT 冷启动,先把「能按格式调工具」教会,再交给 RL 学「该不该调」。

一个完整示例

以论文图 2 的多选题为例:视频是健身房场景,问题是「After the man started lifting weights, what else was happening in the gym?」,选项 A 是「他身后有个女人开始在跑步机上跑步」。

第 1 轮:输入 8 帧低分辨率画面(约 1960 token)。模型在 <think> 里判断:用户想知道主角开始举重之后健身房里还发生了什么,背景细节在当前画面里看不清,检索工具应该能帮上忙,于是把检索语句规划为 "snatch grip deadlift gym background activity",发出 <tool_call> 调用 temporal_retriever_tool(topk=1)。第 2 轮:段检索返回一个更高分辨率的片段的裁剪图,画面里能看到健身房的其他活动,但还没完全锁定;模型继续沿链往下,调帧检索、再调局部放大。第 3 轮:拿到放大的局部画面后,模型在 <think> 里确认「裁剪图显示健身房中有可见的运动器械和活动」,够答了,输出 <answer>A</answer>,循环终止。整个过程用 2–4 轮、平均 1.42 次工具调用就完成,而不是把所有帧都推到最高分辨率。

损失函数 / 训练策略

训练分两阶段。冷启动 SFT(主要针对 3B):从 NextQA/NextGQA、PerceptionTest 与 VTG 数据集 VideoXUM / QV-Highlights 合成轨迹,取 4.5k 条工具调用轨迹,再配 3 倍量的文本 CoT 数据(来自 Video-R1),共 17,384 条;其中 3B 还对比了 Normal-SFT 与 Random-Noising-SFT(把视觉模态换成占位符并在 attention 层 mask)。Agent RL:3B 用 4.5k、7B 用 9k 训练样本,由难度估计(10 次作答中正确 3–7 次的 medium 难度)与答案核验筛出;最大轮数 4、每样本 8 条 rollout,Zero-RL 与 SFT 冷启动设置使用不同的奖励系数(因为 SFT 后格式遵循能力起点已经很高,模型应更多从其他奖励里学),并采用 online rollout filtering 保证训练稳定。优化目标是带复合优势的策略梯度:

\[\mathcal{L} = -\sum_{i}\left(A^{\mathrm{GRPO}}_i + A^{\mathrm{TAGPO}}_i\right)\nabla_\theta \log \pi_\theta(a_i \mid s_i)\]

其中 \(a_i\) 是基座模型的动作(输出 token),\(s_i\) 是环境状态(⚠️ 原文公式 4 在本笔记所用抽取文本中排版损坏,此处按上下文重建记法)。硬件上,SFT 用 8×NVIDIA 4090(Normal-SFT)/ 2×AMD MI308X(Random-Noising-SFT),RL 用 8×NVIDIA H20 + VeRL 训 7B Zero-RL、4×AMD MI308X 训 3B;训练框架为 LLaMA-Factory。

实验关键数据

主实验

在一个统一的三个长视频基准(Video-MME 去字幕子集 2700 题、MVBench 4500 题、LongVideoBench val 1377 题)上评测。表中「Low」= 与训练一致的 1960 视频 token,「High」= 1 fps 采样(最多 32 帧、16384 视频 token)。† 表示按 [48] 的观察,小于 7B 的 MLLM 开启思考模式反而损伤长视频理解,为公平起见也报告思考模式结果。

模型 规模 输入 分辨率 思考 Video-MME (mean) MVBench LVBench
Qwen2.5-VL(基座) 3B 16-frame High × 54.0 60.9 51.8
Qwen2.5-VL(基座) 7B 16-frame High × 53.8 60.6 51.8
Qwen2.5-VL(基座) 7B 16-frame High 49.5 55.2 47.5
Qwen2.5-VL(基座) 7B 8-frame Low 35.0 40.3 28.1
Video-XL 7B 128-frame High 55.5 55.3 50.7
Video-MTR 7B 32-frame High 59.0
LongVT-RL ‡ 7B 64-frame High 66.1
VideoTIR w/ Tool(Zero-Shot) 7B 8-frame Low 42.9 47.8 38.6
VideoTIR w/ Tool + GRPO 7B 8-frame Low 54.1 56.9 50.9
VideoTIR w/ Tool + TAGPO 7B 8-frame Low 54.2 56.0 51.3
VideoTIR w/ Tool + TAGPO 7B 16-frame High 57.9 64.3 53.1

‡ 该方法在约 100k 条 TIR / 非 TIR 轨迹上做过 SFT。

消融实验

效率对比(论文表 3):外部工具方法要么打 GPT-4o / Gemini API,要么挂 8 个专家模型;VideoTIR 的内部工具直接建在骨干编码器上,没有进程间开销、可 GPU 并行。

方法 工具类型 平均工具调用次数 端到端延迟 (↓)
VideoMA 外部 API(GPT-4o / Gemini) 3 † 27.4s
COLT 外部工具(8 个专家模型) 3 † 68.3s
VideoMTR 内部检索 2 † 5.9s
VideoTIR 内部(骨干编码器) 1.42 4.6s

† 这些数字由原论文手工设定。

TAGPO / 路由器 / 冷启动消融

配置 指标 数值
7B + GRPO(30 步,bs=32) 验证准确率 21.1
7B + TAGPO(30 步,bs=32) 验证准确率 24.6
3B Zero-RL(无冷启动) 训练状态 失败:合法工具调用串极稀少,组内优势 std ≈ 0
3B Normal-SFT MVBench / VideoMME / LVBench(随机抽 10%) 36.3 / 35.0 / 34.0
3B Random-Noised-SFT 同上 40.7 / 38.5 / 39.0
路由器 · Information Synopsis 任务 浏览工具 / 检索链 / 直接答 309 / 1 / 13
路由器 · Object Recognition 任务 浏览工具 / 检索链 / 直接答 3 / 335 / 16

格式质量随系统提示与训练策略的变化(论文表 2):长系统提示(含完整工具模板)下,7B 还能维持较高格式合规率,3B 几乎为零;SFT 冷启动把 3B 拉回 90 以上。

模型 系统提示 格式质量
Qwen2.5-VL-7B Short ≤1.0
Qwen2.5-VL-7B Long 81.7
Qwen2.5-VL-3B Short ≤1.0
Qwen2.5-VL-3B Long ≤1.0
Qwen2.5-VL-3B w/ SFT Short 91.7
Qwen2.5-VL-3B w/ SFT Long 90.1

关键发现

  • 工具 + RL 是把「低预算」拉到「高预算」的关键杠杆,但并非全面反超。 同样 8 帧低分辨率(1960 token)下,未训练的工具模型只有 42.9 / 47.8 / 38.6,经过 TAGPO 训练后升到 54.2 / 56.0 / 51.3,相对同预算基座(35.0 / 40.3 / 28.1)提升接近 19 分;而 16 帧高分辨率下再去掉一部分预算劣势后达到 57.9 / 64.3 / 53.1。注意 MVBench 上 16-frame High 的未开思考基座本身就有 60.6,所以本文的增益主要体现在用更少视觉 token 达到接近甚至更好的平均分,而不是在每一项上都碾压高帧率基座。
  • 在 MVBench 上本文仍落后于 LongVT-RL(64.3 vs 66.1)。 后者用 64 帧输入并在约 100k 条 TIR 轨迹上做过 SFT,属于「更多帧 + 更多监督」的配置;论文把优势论证放在效率与同等预算下的对比上,这一横向比较大小时需要注意帧预算与训练数据量的差异。
  • 效率是这篇论文与外部工具方法拉开差距的地方。 平均工具调用从 2–3 次降到 1.42 次,端到端延迟从 5.9–68.3s 降到 4.6s;这两个数字都受益于「检索发生在模型自己的嵌入空间」,不需要跨进程调用外部模型。
  • TAGPO 的收益在训练早期最明显。 30 步、batch 32 时验证准确率 24.6 vs GRPO 的 21.1;训练曲线上有效工具奖励上升更快,跨过 0.45 所需步数减少约 50%,且在早期保持了与 GRPO 相当的工具调用次数——说明它省的是「无用探索」而不是「少用工具」。
  • 路由器确实学到了按问题类型分流。 Information Synopsis(需全局理解)任务上选择浏览工具 309 次、检索链仅 1 次;Object Recognition(需局部细节)任务上反过来,检索链 335 次、浏览工具 3 次。这说明「多工具」不是摆设,模型没有退化成只用某一个工具。
  • 小模型的格式遵循是 TIR 的硬门槛。 3B 在长系统提示下格式质量 ≤1.0,Zero-RL 直接因组内优势 std≈0 而失效,必须靠 SFT 冷启动;而冷启动之后 RL 阶段甚至可以用更低的格式奖励权重(SFT 阶段获得的格式能力足够稳)。
  • Random-Noising-SFT 优于 Normal-SFT(36.3→40.7 / 35.0→38.5 / 34.0→39.0)。 把视觉模态替换为占位符并在 attention 层 mask,反而带来更高的验证准确率,同时格式质量维持在 ~100。论文把详细讨论放在补充材料,正文只给出结果(⚠️ 机制解释以原文补充材料为准)。
  • 训练动态呈现「先探索、后规范」。 早期响应长度上升而格式质量下降,说明模型优先进行合理的工具探索;响应长度稳定后格式质量逐步回升,理性与合规达到平衡。

亮点与洞察

  • 「内部工具」这个提法把工具使用从系统设计问题变成了模型内部问题。 检索用的是 VLM 自己的文本/视觉编码器嵌入,相似度比对就是定位;因此没有 API 往返、没有专家模型加载、可以 GPU 并行。这一招把工具增强方法的延迟从几十秒压到 4.6s,是整篇论文最实用的一条经验——能复用模型自身编码器做到的事,就不该外包给外部服务
  • TAGPO 用「同工具内归一化 + 距答案步数衰减」两个操作,同时覆盖了过度使用与滥用两种失败模式,而且不引入额外网络或价值模型。 尤其第二种情形(成功轨迹里的冗余调用拿到负优势、失败轨迹里的探索拿到零优势)在数学上很干净:不需要显式定义「冗余」标签,衰减系数和组内统计就自动区分出了它们。
  • 把「工具必要性过滤」当前置步骤,是数据合成里容易被忽略但很关键的一环。 先让模型直答,答对的样本不进工具轨迹,等于同时给 RL 提供了「该直接答」的样本——否则训练集里几乎全是工具调用,模型会学成「不管什么题都先调个工具」。
  • Random-Noised-SFT 的发现可以迁移。 在小样本轨迹数据上,把视觉模态换成占位符并 mask 掉注意力,反而提升了下游准确率,这对任何「用少量多模态 agent 轨迹做冷启动」的场景都是一个可直接复用的 trick。
  • 可迁移的整体范式:任何「先粗看、不够再取细节」的任务(长文档 RAG、长音频、网页 agent)都能套用「路由器 + 分层工具 + 工具级 credit assignment」这套骨架,TAGPO 的奖励形式与任务无关,只依赖「工具调用序列 + 最终对错」。

局限与展望

  • 工具集只覆盖视觉模态。 浏览 / 段检索 / 帧检索 / 放大全是「看画面」的工具,没有 ASR、OCR 或字幕分支;而 Video-MME 本身是带音频和字幕的(本文刻意只评测了 w/o sub 子集)。对依赖屏幕文字、语音内容的题目,这套工具直接缺一块能力。
  • 3B 无法 Zero-RL,冷启动依赖外部 MLLM 与人工设计的沙箱。 轨迹合成的每一步(必要性过滤、顺序预测、提示改写、裁决)都由 GLM-4.5V 驱动,数据质量的上限被这个外部模型卡住,且论文未报告合成数据的质量评测(只有最终下游指标)。
  • 超参固定,未见预算自适应。 最大轮数 4、最大帧数 32、初始 1960 token 都是固定值;「efficient」目前是「省在调用次数和工具实现方式上」,而不是让模型自己决定该花多少 token。视频超过 1 小时后的可扩展性论文也没有展开。
  • 对比的公平性有保留。 与 LongVT-RL 这类方法在不同帧预算、不同 SFT 数据量(100k 轨迹)下比较,结论只能说明「同等或更低预算下更好」;论文缺少与同类 TIR 方法在完全相同帧预算下的受控对比。
  • 若干细节在正文中缺失。 工具的具体实现(每级检索的 top-k、相似度阈值、早停判据)都放在补充材料;奖励里的 tool-use bonus \(R_{\mathrm{tool}}\) 只说明了「鼓励合适的工具调用」并引用了外部工作,正文没给具体形式,复现时需要查补充材料。
  • 数据集命名在文中不一致:正文写从 "LLaVa-Video-155k" 过滤,图 7 中标注的是 "LLaVA-Video-178k"(⚠️ 以原文/补充材料为准)。
  • 可改进方向:把音频/OCR 分支接进同一路由器做跨模态工具路由;让路由器同时决定 token 预算(自适应分辨率/fps);用「工具调用序列的必要性/充分性」做自动轨迹筛选以替代外部 MLLM 裁决。

相关工作与启发

  • vs VideoMTR(多轮 RL 的单工具 TIR):VideoMTR 用强化多轮推理,但工具仍是「输出文本时间戳再切片段」的单工具形态,MVBench 59.0(32 帧)。本文换成多层级内部工具链 + 特征相似度检索,在 16-frame High 下 MVBench 64.3,同时把平均调用次数从 2 次降到 1.42 次。区别的核心在于定位由编码器完成而非语言解码器猜
  • vs LongVT / LongVT-RL(native tool calling):LongVT 走 RL-after-SFT 冷启动路线,用 64 帧输入、约 100k 条 TIR 轨迹,MVBench 66.1,高于本文 64.3。本文的差异在于把工具做成内部多层级(而非单一调用原语),并用 TAGPO 显式优化调用链的简洁性——以更少的帧和调用次数换接近的精度。
  • vs 外部工具 agent(VideoAgent / DrVideo / Video-MultiAgents / COLT):它们靠 ASR、OCR、片段定位器、记忆系统或 8 个专家模型拼出流程,工具集固定、依赖多智能体协同或结构化记忆分解,延迟 27.4–68.3s。本文的工具全部长在骨干编码器上,延迟 4.6s,代价是放弃了音频/文字模态的工具覆盖。
  • vs 帧选择方法(先选帧再推理):帧选择在推理循环之外一次性决定看哪些帧,省 token 但无法在推理中补证;本文把「再看一眼」变成循环内的显式动作,代价是多轮调用。
  • vs GRPO / 通用 agentic RL(DeepEyes、SimpleTIR 等):它们以 episode 级奖励 + 工具使用 bonus 为主,在多工具场景下会同时纵容滥用与过度使用;TAGPO 的贡献是给出一个不需要额外价值网络的、可插拔的工具级优势项,与 GRPO 优势相加即可用。
  • 启发:这套「路由器 + 分层内部工具 + 工具级 credit assignment」的骨架与视频无关。任何多工具 agent(搜索 / 代码 / 浏览器)都可以试把 TAGPO 的衰减式局部奖励搬过去,用「同工具内归一化」自动区分冗余调用与必要探索——这是一个低成本的即插即用改进点。

评分

  • 新颖性: ⭐⭐⭐⭐ 内部多层级工具集 + TAGPO 的工具级优势估计是实质性新组合,尤其后者把「冗余调用」的惩罚写进奖励而无需额外标签,思路干净。
  • 实验充分度: ⭐⭐⭐ 覆盖 3 个长视频基准并给出效率、路由器行为、SFT 变体、TAGPO 早期收敛等多角度分析,但缺同帧预算下的受控对比,工具细节与部分奖励定义被推到补充材料。
  • 写作质量: ⭐⭐⭐ 方法脉络(多轮循环 + 工具分层 + 奖励设计)讲得清楚,但公式排版在抽取文本中严重损坏、部分符号(如 \(R_{\mathrm{tool}}\))未在正文定义,图表信息密度过高。
  • 价值: ⭐⭐⭐⭐ 工具级 credit assignment 与「内部工具」的设计对 agentic video RL 有直接可复用价值,效率数字(1.42 次调用 / 4.6s)对实际部署有参考意义。