跳转至

Towards Temporal Compositional Reasoning in Long-Form Sports Videos

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/ustiniansy/SportsTime
领域: 多模态VLM
关键词: 长视频理解、时序组合推理、视频问答基准、时序锚定、GRPO

一句话总结

本文提出长视频体育理解基准 SportsTime(14K+ 开放式问答、50K+ 分步时序证据标注)与 Chain-of-Time Reasoning(CoTR)方法:训练时用带时序奖励的 tr-GRPO 把每个推理步对齐到可验证的时间锚点,推理时用"锚定-观察-推断"回环按预测锚点取局部片段逐轮校验证据,在 Qwen3-VL-4B 上把平均准确率从 25.15% 提到 29.24%、跨度 IoU 从 0.26 提到 0.58。

研究背景与动机

体育视频是"高动态、长时段、关键事件稀疏"的一类多模态内容——一场足球比赛里理解"这个球是怎么进的",往往要回溯进球前很久的一连串传球与跑位。过去十年,球员检测跟踪、动作事件定位、战术分析等任务已被专用视觉模型大幅推进;而 MLLM 的兴起让"统一理解"变得可能,评论生成、视频问答这类开放式任务开始被纳入同一框架。但长时段推理恰恰是当前 MLLM 最薄弱的一环:模型能描述看得见的那几秒,却很难把散布在整场比赛里、彼此相隔几分钟的少量决定性证据串成一条推理链。作者把这种能力称为时序组合推理(temporal compositional reasoning),即定位时间上离散的多段证据、再把它们组合成答案的能力。

这种失败并非单纯的"上下文不够长"。作者认为它由两个紧耦合的原因造成:一是缺乏显式刻画跨时间段证据的高质量标注,导致长时段推理几乎没有监督信号——现有体育问答数据要么是短片段、要么只给最终答案,模型学不到"该看哪几秒";二是缺乏鼓励模型显式定位并论证其答案所依赖证据的方法,答案正确与否和推理依据是否成立是两件事,而现有训练目标只盯前者。二者叠加的结果是模型过度依赖语言先验,产出的回答看似合理却几乎不扎根于画面——"球进了"这句话不需要看视频也能猜对,这正是幻觉的来源。

于是本文的方向是把"证据"本身变成一等公民:先造一个每一步推理都配上可核对时间戳/时间跨度的基准,让"依据对不对"可被直接测量;再设计一套同时约束答案锚点的训练目标与推理流程,逼模型在画面里找证据而不是在语言里找套路。核心 idea:把长视频问答形式化为"时间锚点上的链式推理"——每个中间陈述必须携带一个可检索的时间锚点,训练时用覆盖度与正确性双项时序奖励(tr-GRPO)让锚点变得可学,推理时把预测出的锚点当作局部取片指令做多轮校验,从而把"时序组合推理"从不可监督的隐性行为变成可监督、可验证的显式轨迹。

方法详解

整体框架

本文是"基准 + 方法"双贡献。SportsTime 提供任务定义与监督信号:每个样本是一段长视频、一个开放式问题、一个开放式答案,以及一条逐步推理链——链上每个中间步都标注了支撑它的时间戳或时间跨度(Chain-of-Time)。需要组合的时序要素有三类:事件的先后顺序(哪一步发生在哪一步之前)、跨事件的因果链(后一事件为什么由前一事件导致)、以及事件的时长与相对间隔(哪一段是关键瞬间、两段证据相隔多远)。由于每一步都带锚点,"模型是否真的整合了多段证据"这件事第一次可以被分步测量:答案准确率测结果,SGA(Step-wise Grounding Alignment)评测测证据本身。

CoTR 则规定模型该怎么在这份监督下工作,分三个阶段:先把时间变得可见(视觉时间锚定,把时间戳烧进画面),再让模型学会给出锚点(带时序奖励的 tr-GRPO),最后在推理时用锚点去看画面(锚点触发的交互式观察,形成"生成锚点 → 取局部片段 → 校验修正 → 再生成"的闭环)。前两阶段改变模型的行为倾向,第三阶段改变模型的输入分布,三者互补。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["SportsTime 基准<br/>14K 开放问答 + 50K 时序锚点"] --> B["视觉时间锚定<br/>画面烧录 mm:ss 时间戳"]
    B --> C["tr-GRPO<br/>覆盖 + 正确性双奖励"]
    C --> D["锚点触发的交互式观察<br/>局部取片 → 校验 → 修正"]
    D -->|按修正后的锚点再取片| D
    D --> E["答案 + 可验证的时序证据链"]

形式上,第 \(t\) 步被定义为一个二元组 \(n_t=\langle s_t,\tau_t\rangle\)\(s_t\) 是该步的文本陈述,\(\tau_t\) 是支撑它的时间锚点(一个时间戳,或一个时间跨度)。整条轨迹是 \(\mathcal{T}=[n_1,\dots,n_T,a]\),模型对答案与整条链的联合概率按"逐步条件生成 + 最后基于全链出答案"分解:

\[\pi_\theta(\mathcal{T}\mid V,q)=\Big(\prod_{t=1}^{T}\pi_\theta(n_t\mid V,q,n_{<t})\Big)\cdot\pi_\theta(a\mid V,q,n_{\le T})\]

(⚠️ 缓存版式把该式末尾渲染成了乱码,此处按原文上下文整理为对全链条件出答案,以原文为准。)这个分解的用意不在于数学上的方便,而在于它规定了一个接口:每个中间陈述都必须挂一个可检索的锚点——有了这个接口,推理时才可能"回到现场"核对,训练时才可能对锚点单独给奖励。

关键设计

1. SportsTime 基准:把"多段证据的组合"变成可监督的分步时序标注

长时段推理之所以学不会,根子在标注:只说"要整合多段证据",却不告诉模型证据在哪几秒,监督就是空的。SportsTime 的做法是把证据锚点显式写进标注里,并围绕它做了三个选择。其一是开放式问答而非选择题——不只更贴近真实分析场景,也堵住了"从候选里排除"这条捷径,模型的输出空间是整个答案空间。其二是五类任务覆盖不同能力层级:感知(perception)、时序(temporal)、战术(tactical)、因果(causal)、反事实(counterfactual),从"看清画面"一直排到"假设另一选择会怎样";其中因果与反事实类问题几乎无法靠单帧判断,必须把相隔较远的事件串起来。其三是逐步 Chain-of-Time 标注:推理链的每个中间步都配一个时间戳或秒级时间跨度,这让"答案对不对"与"依据找没找到"彻底解耦,既可直接监督,也可直接评测。

数据规模与构成上,基准覆盖五支团队项目——美式橄榄球、冰球、足球、篮球、排球,它们在机位约定、剪辑风格、事件结构上差异明显;同时纳入男子与女子比赛、国际/职业/大学赛事以引入结构化多样性。总计 1,575 段视频(208 场完整比赛 + 1,367 段集锦),平均时长 1053.25 秒,14,326 条开放式问答,50,000+ 条分步时序证据标注。完整比赛用来考察"证据极稀疏"条件下的长时段推理,集锦用来提升事件密集与风格多样场景的覆盖。

标注流程是"专家引导的半自动"三阶段流水线,动机很实际:长视频体育问答同时要求规模化、时序有效、领域正确,纯手工做不起,纯自动不可信。第一阶段请体育领域专家设计问题模板,把问题类型与语义范围框死,把开放式生成变成受控生成;第二阶段由强 MLLM 依据视频与模板实例化出候选问答及其时序证据,解决规模问题;第三阶段是两阶段人工复核——先由同伴标注者做初检,盯格式一致性、时序有效性与表述清晰度,剔除明显低质样本;再由领域专家终审,盯规则正确性、战术合理性与反事实情景的可行性。这条流水线保留了规模化的效率,同时压掉了时序错误、语义歧义与领域知识偏差。

2. 视觉时间锚定:让模型直接"读"出时间,而不是"猜"出时间

一个很实际的障碍是:即使模型正确识别了事件,把它对准具体时间点仍会漂。原因不在视觉识别能力,而在时间在视频里不是可直接观测的量——帧序号、采样率、上下文长度都会让"这是第几分钟"变得需要推断,而推断在长上下文里极易累积误差,锚点于是系统性偏移。作者受 DeepSeek-OCR 与 Number_it"一图胜千言"思路的启发,用了一个几乎零成本的做法:把显式时间戳以统一的 mm:ss 格式烧录到每帧右上角,让视频自己带上时钟。

这一招把"时序定位"从推理问题降级成了视觉-文本识别问题:模型不需要从长上下文里重建时间轴,只要读出画面里的数字即可,长上下文中的锚点漂移随之大幅减少。它的好处是即插即用、不增加任何参数或训练目标,且与后续的奖励设计正交;代价是轻微破坏画面内容且依赖固定的时间格式。消融里去掉时间戳叠层后整体准确率从 27.31% 掉到 26.12%,说明这个"最简单的一招"确实在起作用;而它同时是第三阶段锚点回环的前提——只有当模型能稳定输出可解析的 mm:ss,锚点才能被当作检索指令使用。

3. tr-GRPO:用"覆盖 + 正确性"双项时序奖励替代稀疏的答案奖励

仅用答案对错做强化学习,模型完全可以用"不给任何时间锚点、照样猜对答案"的策略拿到奖励,通用 RL 微调之所以只能小幅提升甚至伤到时序(消融里 Native-GRPO 在 Temporal 上从 13.14 掉到 11.76),就是因为它没有对"证据从哪来"施加任何压力。CoTR 的做法是在 GRPO 里补上专门奖励时序扎根的项。总奖励是三项加权和:

\[R(\mathcal{T})=\lambda_{\text{fmt}}r_{\text{fmt}}(\mathcal{T})+\lambda_{\text{acc}}r_{\text{acc}}(\mathcal{T})+\lambda_{\text{temporal}}r_{\text{temporal}}(\mathcal{T})\]

其中 \(r_{\text{fmt}}\) 是二值结构奖励(输出是否遵循要求的格式),\(r_{\text{acc}}\) 是任务级答案正确性奖励,真正的重点是 \(r_{\text{temporal}}\),它又被拆成互补的两半:

\[r_{\text{temporal}}(\mathcal{T})=\alpha\,r_{\text{cov}}(\mathcal{T})+(1-\alpha)\,r_{\text{cor}}(\mathcal{T})\]

覆盖项 \(r_{\text{cov}}\) 把模型的 <thinking> 按步切分,统计"至少含一个显式时间锚点的步"所占比例——它防的是,即模型跳过某段证据不给锚点就往下推。正确性项 \(r_{\text{cor}}\) 则抽取 <thinking> 里预测的锚点,与监督标注的真值步锚点逐一匹配:对每个真值锚点取它与预测锚点集的最佳匹配分,跨度-跨度之间用 span IoU,点-跨度或点-点之间用考虑距离的相似度,最后对所有真值锚点求平均,得到 \([0,1]\) 内的分数——它防的是,即模型给了一堆时间戳却贴在错误的时刻上。(\(\lambda_{(\cdot)}\)\(\alpha\) 的具体取值与匹配细则在附录 B.2 / A.3,正文未给,⚠️ 以原文为准。)

两项合起来的作用是让"时间锚点"从一个装饰性的输出片段变成有回报的中间状态\(r_{\text{cov}}\) 保证证据被覆盖到,\(r_{\text{cor}}\) 把预测锚点往标注证据上拉,于是策略倾向于生成锚点与可验证证据对齐的推理链。用 GRPO 而非普通策略梯度,是因为组内相对优势的构造在长链、稀疏奖励场景下更稳:同一个 \((V,q)\) 采样多条轨迹、算完奖励后组内比较,避免了绝对值尺度带来的方差。效果在 SGA 上最直观——tr-GRPO 的锚点覆盖率 95.76%,mIoU 0.5812、[email protected] 56.89%,而 Native-GRPO 覆盖率只有 13.10%、mIoU 0.3128:两者答案准确率接近(27.31 vs 26.72),但证据质量差了一个量级。

4. 锚点触发的交互式观察:把预测出的锚点变成"回去看"的检索指令

训练让模型愿意给锚点,但一次前向生成完的链仍可能是错的,因为长视频下采样的帧预算有限,模型可能压根没采到关键瞬间。CoTR 在推理阶段把这个缺口补上:既然模型已经吐出了带锚点的推理轨迹 \(\mathcal{T}=[n_1,\dots,n_T,a]\),那就把每个预测锚点 \(\tau_t\) 当作一次显式的时序查询,去视频中对应邻域取局部证据。对点锚点 \(\tau_t=\texttt{mm:ss}\),取以它为中心的一小段窗口;对跨度锚点 \(\tau_t=[t_s,t_e]\),则在该跨度内均匀取多个片段。每个锚点由此转换为一组局部片段,每段按固定步长采 \(L\) 帧——这把"全局扫描长视频"换成了"在预测证据位置附近的有界局部观察",代价可控。

拿到片段后做证据扎根的推理:第 \(t\) 轮把问题 \(q\)、当前步陈述 \(s_t\)、锚点 \(\tau_t\) 与检索到的局部片段一起给模型,模型依据这些真实画面校验并修正当前步,再进入下一轮;逐轮走完后,最终答案以多轮累积的已验证证据为条件生成。这一步补的是纯奖励训练补不上的东西:奖励只在训练分布上塑造行为,而回环让模型在具体这条视频上把每个中间论断都对着画面复核一遍,因此消融里加上 AT-IO 后整体从 27.31% 进一步升到 29.24%(Temporal 13.73 → 15.43),说明测试时的验证与训练时的奖励是互补而非重复的。

一个完整示例

(说明:论文未给出逐轮样例,以下按上述机制构造一个示意走查,用于说明状态如何逐轮变化。)设问:"Why did the defense fail on this play?"(这次防守为什么被打穿?)第一轮模型先给出一个猜测性步骤 \(s_1\)="防守方在中场出现对位失误",并带锚点 \(\tau_1\)12:34;AT-IO 以 12:34 为中心取一段窗口,模型看到画面里其实是正常的对位站位,于是修正该步为"防守方在 12:34 尚保持阵型",并改锚点13:02(真正的错位发生时刻)。第二轮模型基于修正后的第二步陈述再取 13:02 附近的片段,确认错位后继续向前追溯至 11:47 的一次换人,把"换人 → 对位错配 → 被打穿"这条因果链接起来,最终答案以这三段已验证的证据为条件给出。整个过程的关键在于:锚点不是解释的装饰,而是下一轮取片的输入——锚点错,看到的画面就错,模型就有机会自我纠正,这正是"组合多段证据"从隐性变成显式的机制所在。

损失函数 / 训练策略

基座模型为 Qwen3-VL-4B,训练时每段视频采样 128 帧,推理时最多 768 帧,全部实验在 2× NVIDIA H100 (80GB) 上完成。优化目标是第 3 个设计里描述的 tr-GRPO 目标:对每个 \((V,q)\) 采样多条带锚点轨迹,按 \(R(\mathcal{T})\) 计算奖励并构造组内相对优势后更新策略;从初始策略 \(\pi_0\) 出发,在提升奖励的同时保持"带锚点生成"的输出协议不变。一个值得注意的负结果:直接做 SFT 反而比基座更差(25.15% → 17.61%),作者归因于时序推理链的结构多变且不唯一——同一条视频可以有多种合理的证据组合与表述顺序,逐 token 模仿这种多模态输出在 4B 规模上很脆,且出现大量重复生成,这也正是改用奖励塑形而非模仿学习的直接理由。

实验关键数据

主实验

SportsTime 上的主结果(开放式问答,LLM-as-Judge 用固定的 Qwen2.5-VL-7B,单位 %)。可以看出天花板很低:

模型 视觉输入 Perception Temporal Tactical Causal Counterfactual Avg.
GPT-5 0.2 fps 38.77 27.45 43.85 44.77 46.93 40.72
Gemini-2.5-Pro 0.2 fps 39.66 19.78 29.49 39.41 13.71 29.37
Qwen3-VL-8B-Instruct 768 frames 24.27 14.31 33.26 23.08 44.47 27.45
Qwen3-VL-4B-Instruct(基座) 768 frames 23.26 13.14 31.11 22.92 34.17 25.15
Video-R1-7B 768 frames 19.26 8.04 23.25 18.62 33.01 20.40
VideoLLaMA3-7B 768 frames 20.06 10.98 16.92 14.00 28.54 17.96
InternVideo2.5-8B 512 frames 18.12 10.39 19.83 9.85 26.21 16.68
MiniCPM-V4.5-8B 512 frames 16.38 10.14 13.50 16.18 27.27 16.48
GLM-4.6v-Flash-9B 640 frames 2.27 1.18 3.76 3.54 13.20 4.62
Ours (tr-GRPO) 22.01 13.73 35.73 25.54 39.81 27.31
Ours (full) 26.42 15.43 34.55 27.21 42.22 29.24

CoTR 相对基座 Qwen3-VL-4B 的绝对提升:感知 +3.16、时序 +2.29、战术 +3.44、因果 +4.29、反事实 +8.05、整体 +4.09;在 200 条分层抽样的人工评测子集上,整体从 24.50% 升到 30.50%(+6.00),说明 LLM 评委的排序与人工判断一致。在通用长视频基准上也有一致的迁移收益:相对同一基座,LVBench 56.2 → 59.9(+3.7)、VideoMME 69.3 → 72.1(+2.8)、MLVU 75.3 → 76.2(+0.9)。

消融实验

方法各组件在 SportsTime 上的消融(单位 %):

配置 Temporal Tactical All
Base(Qwen3-VL-4B-Instruct) 13.14 31.11 25.15
+ SFT 6.98 19.90 17.61
+ Native-GRPO 11.76 32.65 26.72
+ tr-GRPO w/o ts(去掉时间戳叠层) 13.14 32.21 26.12
+ tr-GRPO w/ ts 13.73 35.73 27.31
+ AT-IO(Ours,完整) 15.43 34.55 29.24

关键发现

  • SGA 揭示"问时间戳"与"用时间戳"是两回事,这是全文最有说服力的对照:
模型 Acc(%)↑ Anchor(%)↑ mIoU↑ [email protected](%)↑
Base 25.15 11.95 0.2601 30.03
Zero-shot CoT 24.01 19.49 0.2042 26.34
Time-prompted CoT 19.53 91.80 0.1244 12.12
Native-GRPO 26.72 13.10 0.3128 32.09
tr-GRPO(Ours) 27.31 95.76 0.5812 56.89

只用 prompt 要求"给出时间戳",锚点覆盖率能冲到 91.80%,但 mIoU 反而掉到 0.1244、[email protected] 只有 12.12%——模型学会了格式服从,却给中间结论随手贴上无关的时间窗来"显得有依据"。tr-GRPO 把同样的覆盖率推到 95.76% 的同时把 mIoU 提到 0.5812,说明奖励塑形改的是证据忠实度而非输出格式。 - SFT 是负收益:直接监督微调掉到 17.61%,低于不训练的基座,表现为大量重复生成。原因在于时序推理链的结构多变、不唯一,token 级模仿在这种多解任务上既脆又难优化——这条负结果本身是对"证据链任务该用奖励塑形而非模仿"的有力论证。 - 组件收益互补而非重复:tr-GRPO 贡献 +2.16(25.15 → 27.31),AT-IO 再贡献 +1.93(27.31 → 29.24),且 AT-IO 主要补的是 Temporal(13.73 → 15.43)。去掉画面时间戳叠层净掉 1.19 个点,说明"把时间变成可读信号"确实是时序奖励能生效的前提。 - 提升最大的是反事实(+8.05)与因果(+4.29),恰是两类最依赖跨事件证据组合的任务;感知类也有 +3.16,说明方法同时改善了"找到相关视觉证据"和"把分散线索整合成因果归因"两件事。 - 视频更长不等于更难:准确率随视频长度并非单调下降,作者认为难度主要由视频类型与事件结构等混杂因素决定,而非长度本身;CoTR 在长视频上仍保持优势。 - 评委可靠性:三个 LLM 评委(GLM-4.7、MiniMax-M2.5、Qwen2.5-VL-7B)两两平均一致率 88.34%,Fleiss' κ = 0.57(中等一致);与人工判断的 Cohen's κ 分别为 0.6467 / 0.5759 / 0.5882,支持将 LLM-as-Judge 用于规模化评测,但一致度仍非强。 - SGA 人工评估显示链的逻辑一致性最好(FLC 4.50/5)、中间结论基本可靠(ICR 4.02/5),但证据跨度准确性偏弱(ESA 3.65/5)——即"链读起来通顺,但具体那几秒还没掐准",这与 mIoU 0.58 的客观结果一致。

亮点与洞察

  • 把时间戳烧进画面是全文性价比最高的一招:零训练成本、零参数,只是把"时间"从需要推理的隐变量变成需要识别的显式信号。任何需要模型输出时间/位置(时间定位、引用出处、框选区域)的任务都可以照搬这个思路——让被引用的东西在输入里"看得见"。
  • "问时间戳 ≠ 用时间戳"的对照实验设计得很漂亮:Time-prompted CoT 高覆盖率配低 mIoU,一针见血地证明 prompt 只能买到格式、买不到忠实度;这为"证据质量必须单独度量"提供了干净的经验证据,也解释了为什么需要 \(r_{\text{cov}}\)\(r_{\text{cor}}\) 两项而不是一项。
  • 覆盖 / 正确性的奖励分解可复用到任何"证据链"监督:漏证据用覆盖率防、贴错证据用最佳匹配相似度防,这个二元范式对 RAG 的引用质量、多步 agent 的工具调用轨迹、可解释性中的 rationale 监督都成立。
  • 锚点即检索指令(AT-IO)把"生成的中间结果"重新变成"下一轮的输入",形成生成-检索-校验的回环;它不依赖外部检索器,检索范围完全由模型自己提出的锚点决定,是一种很轻的 test-time 验证机制。
  • 基准与方法互为因果:没有 step-wise 时序标注就定义不出 \(r_{\text{cor}}\),而没有 \(r_{\text{cor}}\) 就暴露不出"乱贴时间窗"这一失败模式——这种"数据设计使某种监督成为可能"的组合,是双贡献论文最扎实的一种形态。

局限与展望

  • 作者承认的局限:细粒度时序定位仍有提升空间(ESA 仅 3.65/5,mIoU 0.5812),跨度与真值往往方向正确但边界不准。
  • ⚠️ 我注意到的局限:正文未报告 \(\lambda_{\text{fmt}}/\lambda_{\text{acc}}/\lambda_{\text{temporal}}\)\(\alpha\) 的取值及敏感性分析(推给附录),读者无法判断时序奖励权重是否敏感——而这恰恰是方法最关键的旋钮。
  • 方法只在 Qwen3-VL-4B 上验证,没有更大基座或更强专有模型的增强实验。SportsTime 上 GPT-5 仍有 40.72%,而 CoTR 增强后的 4B 模型只有 29.24%,二者的差距是否被方法显著缩小、方法能否叠加到 8B/30B 上,正文没有回答。
  • "必须整合多段证据、无法单帧猜对"目前主要依靠数据设计意图、两阶段人工复核与 SGA 指标来保证,缺少定量的捷径对照:例如只给单帧的 oracle 上界、把时间戳随机打乱后的性能、或对同一问题做"删掉关键证据片段后有损多少"的扰动实验。缺少这些,"组合的必要性"仍是论点而非实测结论。
  • 人工评测规模较小:开放式问答 200 条、SGA 100 条(5 位评分者)。AT-IO 的推理开销(多轮局部取片带来的总帧数、延迟、显存)未报告,而推理预算本身就是长视频方法的关键成本项。
  • 数据仅覆盖五个项目、以北美职业/大学赛事与足球为主,其他运动(个人项目、格斗、田径)与不同转播文化下的迁移性未知;英文解说/规则语境也限制了跨语言适用性。
  • 改进思路:把 \(r_{\text{cor}}\) 的"逐真值锚点最佳匹配"换成序列对齐(如 DTW),以奖励顺序正确性而非集合相似度——当前设计对"锚点集合对了但先后颠倒"的链给不出惩罚,而顺序恰是因果推理的核心;进一步可把时间锚点与球员/空间锚点联合奖励,从"哪一秒"走向"哪一秒、谁、在哪"。

相关工作与启发

  • vs SportQA / Sports-QA / SPORTU / SPORTR / DeepSport 等体育问答基准:它们多聚焦短片段或细粒度动作标签(时长从数秒到片段级),SPORTU / SPORTR / DeepSport 虽引入 CoT 监督,但都没有把推理步对齐到时间轴。SportsTime 的差别在于长视频(平均 1053 秒)、全开放式问答,且每一步推理都带时间戳或秒级跨度,使中间路径可直接监督与评测。
  • vs VRBench:VRBench 同样有 CoT 与 step-wise 时间标注,但面向叙事视频、时间跨度常是分钟级。体育的决定性事件是"瞬间"的,SportsTime 要求秒级时间戳或短跨度,时序定位的精度要求严格得多——这也是本文方法必须处理锚点漂移的原因。
  • vs TOGA:TOGA 联合预测开放式答案与支撑最终回答的时间跨度,本质是"答案 + 一组证据"的单步映射;CoTR 把它升级为多步链,锚点成为步骤间的中间状态,既用于训练监督也用于测试时的证据获取。
  • vs LongVT / VITAL:这两者用时间定位作为工具增强推理流程的一部分(模型调用工具去查视频)。CoTR 的锚点同样起到检索指令的作用,但锚点由模型在推理链中自然生成、无需单独的检索器或工具接口,因而更轻;代价是检索质量完全依赖锚点质量。
  • vs Video-R1 / Native-GRPO 等通用视频 RL 微调:它们在通用奖励下提升了答案准确率却几乎不改善时序扎根(覆盖率 13.10%、mIoU 0.3128)。本文的启发是:当任务的瓶颈是"依据从哪来"而不是"答得对不对"时,必须把依据本身写进奖励,否则 RL 只会强化已有的语言先验。

评分

  • 新颖性: ⭐⭐⭐⭐ 基准与方法的组合很完整(step-wise 时序标注 + 时序奖励 + 锚点回环),但单项技术有先例(画面时间戳叠层见 Number_it,GRPO 为通用框架),创新主要体现在"把时间锚点做成可监督的中间状态"这一形式化上。
  • 实验充分度: ⭐⭐⭐⭐ 主结果、SGA 客观/主观双轨、组件消融、视频设置消融、通用基准迁移、多评委一致性研究齐全;但只在 4B 基座上验证,缺"单帧捷径"的定量对照,AT-IO 的推理开销未报告,关键奖励超参在附录。
  • 写作质量: ⭐⭐⭐⭐ 论证链条清楚,"Time-prompted CoT 高覆盖低对齐"的反差是全文的高光;缺点是关键公式在版式中损坏、部分实现细节(奖励权重、锚点解析器)推给附录,正文自足性稍弱。
  • 价值: ⭐⭐⭐⭐ 为长视频"证据链"理解同时提供了可监督的基准与可迁移的奖励/推理范式,"覆盖 + 正确性"的奖励分解和"锚点即检索指令"的思路对长视频问答、引用质量监督、多步 agent 轨迹都直接可用。