跳转至

NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/apple/ml-NarrativeTrack
领域: VLM 推理
关键词: 视频叙事理解、实体中心推理、组合式推理递进、MLLM 评测基准、时序一致性

一句话总结

本文提出 NARRATIVETRACK,首个以「实体中心」方式评测多模态大模型视频叙事理解的基准:用一条全自动管线(集成检测 → ReID 身份追踪 → 高亮上下文识别)从原始视频里抽出带时间戳的人体实体表示,再按「实体存在性 → 实体变化 → 实体歧义」三级组合式推理递进(CRP)程序化生成 1006 道题并做精确匹配判分,结果最强的 Gemini-2.5-Pro 也只到 83.80%,开源模型全部低于 57%,暴露出「感知落地」与「时序整合」二者难以兼得的权衡。

研究背景与动机

视频理解基准这两年铺得很开:Video-MME、MVBench、NExT-QA、PerceptionTest 覆盖动作识别、因果与时空推理,LVBench、LongVideoBench 把时长推到几千秒量级考全局语境。但这两类工作之间存在一个被忽略的中间地带。短片段数据集(平均十几到几十秒)场景变化极少,题目往往靠单帧的静态线索就能答对;而长视频基准虽然时长够长,考的多是粗粒度的整体语境概括,并不要求模型维持某个具体对象在长时间跨度上的状态。近期有工作直接验证了这种担忧:把视频帧顺序打乱后,不少基准上的模型性能几乎不变,说明它们依赖的是语言先验和静态画面,而不是真正的时序推理。VELOCITI 试图用严格的视频—语言蕴含把 agent–action 绑定错误单独隔离出来,设计很干净,但它的实体在整个片段里持续可见,考的是片段内的绑定,不是跨场景的连续性。

真正难的部分恰恰在跨场景:一个角色可能在中途消失、几场戏之后重新出现,期间换了衣服、换了场景,并与相隔很长时间的其他事件因果相连。要评测模型能不能跟上这类信息,需要「谁、在什么时间、做了什么、在哪里、穿着什么」这种时间锚定的实体级结构标注——而现有数据集一个都没有(论文 Table 1 横向对比了 AVA、TVQA、MovieQA、How2QA、NExT-QA、Video-MME、PerceptionTest、LongVideoBench、LVBench,没有一家同时给出边界框、动作、场景、服装四类实体属性)。对未剪辑的长视频做人工标注不仅贵,而且一致性很差,这正是这个方向长期空着的原因。

转机在于构建这类数据的原语已经齐了:现成的多目标检测器能稳定出框,ReID 模型能把同一个人跨帧聚成一条轨迹,而 MLLM 已经能对高亮后的片段给出可用的属性描述。本文的设计选择是自下而上——不再从场景级语义或故事级摘要出发,而是先把视频拆成一个个实体(作者限定只做人类实体,因为人是叙事视频里的主要行动者、外观与动作变化最丰富,而背景物体视觉变化小、容易把评测退化成简单的身份匹配),把叙事理解还原成「实体能否在时间上被持续跟踪、其状态演化能否被正确落地」这个可程序化生成、可精确判分的问题。核心 idea:把叙事理解形式化为一条实体中心(entity-centric)的组合式推理递进——用全自动管线抽出时间锚定的实体轨迹与属性,按「存在性→变化→歧义」三级递进生成确定性 QA,从而既能规模化评测,又能把失败精确归因到时间连续性、属性落地或相似实体混淆中的某一环。

方法详解

整体框架

给定一段原始视频 \(V\),按固定帧率采样成带时间戳的帧序列。方法不需要任何人工标注:一条三阶段的实体中心管线先把视频转成结构化的实体表示——每个实体在它出现的每个时间戳上记下一组量:该时刻的边界框、它正在执行的动作、所在场景、以及它的服装;同一实体的这些观测按时间串起来就构成一条时间锚定的轨迹。在此基础上,CRP(组合式推理递进)定义三个难度递增的评测维度,模板化 QA 生成器把实体表示确定性地填进题目模板并配好干扰项,最终用精确匹配判分。整条链路是串行的,输入是原始视频,输出是 1006 道带标准答案的题目与模型得分。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["原始视频<br/>按固定帧率采样"] --> B["集成检测与身份追踪"]
    B --> C["高亮上下文识别"]
    C --> E["CRP 三级递进"]
    E --> F["模板化 QA 生成与干扰项设计"]
    F --> G["精确匹配评测"]

关键设计

1. 集成检测与身份追踪:把「跨镜头持续存在的人」变成一条稳定轨迹

评测实体中心推理的前提是先有可靠的实体,而单个检测器在长视频上一定会漏检或误检——漏检会把一条轨迹切成两段,误检会把两个人合成一个,错误会一路级联到追踪和属性标注。作者没有把 Detectron2 和 OWLv2 的预测直接并集,而是做空间共识:对两个检测器给出的框两两算 IoU,超过 0.5 就判定它们指向同一个实体,此时只保留置信度更高的那个,否则两个都留。这样既补上了单一检测器漏掉的框,又不会因为同一个实体被两个模型各报一次而在后面生成重复轨迹。在 AVA 上做帧级匹配评测,这套集成检测的召回率从 Detectron2 单用的 0.780、OWLv2 单用的 0.801 提到 0.848。

检测完之后要决定「谁值得跟」。朴素地追踪所有检测框既低效又容易出错,很多实体只是短暂入画、对叙事没有贡献。作者用 OSNet-x1.0 抽 ReID 嵌入并聚类,每个簇对应一个实体,按簇的大小排序取前四作为主要角色——背后的经验假设是「反复出现 = 叙事中心」。这个 4 的选择有实测支撑:在 100 段抽样视频里,中心角色通常占据画面高或宽 50% 以上,且前四簇中至少有 50% 的实例满足这一条件,因此取四是捕捉显著角色的稳定启发式。为了进一步压住身份漂移,作者又用人脸识别精修轨迹对齐,并对轨迹做多 MLLM 集成验证 + 多数投票来剔除错误身份——本质上是用一个无监督的「模型间共识」去模拟人工标注者之间的一致性。在 1108 个检测上,这套模型多数投票与人类专家的多数投票在 96.08% 的案例上一致,说明共识机制确实能筛掉错误轨迹、保住身份的一致。

2. 高亮上下文识别:给轨迹的每个时间点补上动作、服装与场景

只有位置信息还不够,叙事理解要回答的是「这个人在做什么、穿什么、在哪里」,因此需要给每条轨迹的每个时间步补上动作、服装、场景三类属性。这里的关键细节是标注方式:作者用 Gemini-2.5-Pro 推断这些属性,但把目标实体在片段中高亮标出后再喂给模型,而不是直接把原始片段丢过去。原因很直接——一段视频里往往有多个人,不做高亮时模型会把属性归因给画面中最显眼的那个人,从而污染目标实体的表示;高亮既保留了周边语境,又强制模型把注意力放在正确的个体上。属性按实体实际出现的片段为单位标注,逐步填入该实体的表示中,得到一份时间对齐的结构化记录。同一套 Gemini-2.5-Pro 还被反过来用于筛选素材:借助预测出的属性,找出那些存在显著属性变化的视频(用来出「变化」类题)和存在视觉相似实体的视频(用来出「歧义」类题),保证后续问题不是平凡可答的。

3. CRP 三级递进:把「叙事理解」拆成可归因的诊断链条

如果只给一个笼统的准确率,没人知道模型到底是没跟上时间、没看懂状态变化、还是分不清两个长得像的人。CRP 把实体中心推理拆成三个互相依赖、难度递增的维度。第一级是实体存在性(entity existence),直接考时间连续性:实体在视频里出现、消失、再次出现,模型能否判断它是不是只在一开头露过面、之后就没再出现。这是最基础的要求,这一级失败意味着长程时间跟踪本身崩塌。第二级是实体变化(entity changes),考的是目标实体状态转移的检测与落地,细分为动作变化(动态事件的时序定位)、服装变化(细粒度外观转变的感知)、场景变化(把实体与环境语境关联起来);这一级要求模型在连续性之外,还必须整合动态的视觉与语境线索,失败意味着对演化信号的落地能力弱。第三级是实体歧义(entity ambiguity),引入视觉上相似的实体,要求模型同时做时间推理和细粒度的感知消歧,这一级出错说明组合式推理本身不稳。三级串起来形成从「持续存在」到「有依据的状态转移」再到「时间与感知的联合消歧」的递进,恰好对应三种可区分的失败来源——时间连续性断裂、演化属性落地不牢、相似实体混淆——这是本文相对已有基准最有价值的设计:评测结果能直接指出模型坏在哪一环。

4. 模板化 QA 生成与干扰项设计:确定性的生成与判分协议

题目不是人写的,而是从实体表示程序化实例化出来的。作者预先设计了与 CRP 各维度对齐的推理模板,把模板槽位用实体表示里的属性确定性地填满,标准答案也从同一份元数据推出,保证题面与答案语义一致;GPT-4o 只负责语法与流畅度润色、以及过滤掉没有有效状态变化的无效题,不参与事实生成。题目有三种格式:二选一(binary)、多选(MC)和排序(ordering)。排序格式要求把实体的属性转移按时间先后排列,是三种格式里对时间组合性要求最高的——它不能靠认出某一个事件蒙对,必须把整条轨迹的先后关系排对。

在同一批实体表示上,作者还通过改变时间参照点程序化地生成三种推理方向:前向(从开头推结尾)、后向(从结尾回推开头)、以及无关向(从中点同时向两端推理的双向形式)。这个设计让基准可以单独测量模型的时间方向偏置。干扰项分两类:真实干扰项取自同一段视频里的其他实体(intra-clip negatives),这些实体与目标在时空上共存,模型必须真的把目标跟住、区分开,考的是现实多实体场景下的细粒度判别;合成干扰项取自其他视频里的实体(cross-clip negatives),它们在当前片段中根本不存在,考的是模型会不会靠「语义上说得通」就接受一个不该出现的实体,也就是幻觉抑制与存在性验证。

质量控制分两步。第一步抽样 100 条题做三人独立评审(有效/无效),70% 被一致判定有效,评审者间一致性 Fleiss' κ = 0.767;无效案例大多来自合成干扰项过于明显、属性搭配不合理,而不是实体追踪或语境落地出错,这与管线本身 96.08% 的一致率吻合。第二步让人工标注者逐条核对 Gemini 推断的属性与视频证据是否相符,并据此修三类问题:纠正不一致的标准答案、修正题面中含糊或落地不牢的属性、把过于平凡的合成干扰项换成视觉上确实容易混淆的替代项。最终得到来自 406 段视频的 1006 道题,覆盖纪录片、新闻、电视剧等多种类型,时长最长 659 秒,五个子维度分布均衡(存在性 200、动作变化 222、服装变化 192、场景变化 191、歧义 201),选项答案分布也做了平衡;清理后的基准由三名标注者重测,平均人类准确率 96%,说明题目本身是清楚可靠的。

评测协议刻意避开了 LLM 判分和开放式生成:所有题都是二选一、多选或选项排序,模型预测用与标准答案的精确匹配判分,消除措辞、词汇变化和主观评价带来的歧义。

一个完整示例

取论文 Fig. 4 里的那段视频:目标实体一共出现在四个片段。片段 1 里她微笑着、穿露肩装、在卧室;片段 2 她在舞台上唱歌,换成了黄色背心加白衬衫;片段 3 她仍在舞台上、衣着不变,动作变成递出麦克风;片段 4 她在昏暗房间里低头侧视,外面套了件深色翻领夹克。这四段观测拼成一条轨迹后,模板可以同时实例化出五道分属不同 CRP 层次的题:

存在性(二选一)——「那位一开始在卧室里微笑、穿露肩装的人,是不是只在开头出现、之后就消失了?」;动作变化(排序)——「把开头在卧室微笑、穿露肩装的人所做的动作按顺序排列:(a) 递出麦克风 (b) 在舞台上唱歌 (c) 低头侧视」,按轨迹时间顺序正确答案是 (b)→(a)→(c);服装变化(二选一)——「那位一开始在卧室微笑、穿露肩装的人,后来是不是穿着深色翻领夹克?」(由片段 4 可知为真);场景变化(多选)——「那位一开始在卧室微笑、穿露肩装的人后来出现在哪个场景?(a) 舞台 (b) 厨房 (c) 浴室」(由片段 2、3 可知选 a);实体歧义(二选一)——「在开头穿露肩装、在卧室微笑之后,同一个人后来是不是在厨房里穿着米色衬衫和围裙做饭?」(否定,这是同视频里另一个实体的真实干扰项)。同一个实体的同一份表示被复用出五种不同粒度的考题,这正是这套模板化生成能做到规模化与可归因的原因。

实验关键数据

主实验

评测素材来自 AVA、Video-MME、LVBench 三段来源的原始视频,作者先过滤掉过暗、低质量以及只有单一角色且没有有意义属性变化的片段。共评测 13 个开源模型与 7 个闭源模型:开源又分通用型(OGP-MLLM,走图文对齐、强调视觉落地)与视频专用型(OVS-MLLM,走视频—文本对齐、强调时序建模)。开源模型统一采 20 帧(§5 的帧密度实验显示这是最优设置),闭源模型默认采 128 帧以发挥其更大的视觉上下文,GPT-4o 额外在 20 帧下评测以便公平对比。

模型 类型 帧数 平均准确率
Gemini-2.5-Pro 闭源 128 83.80
Gemini-3.1-Pro 闭源 128 83.40
Gemini-3-Flash 闭源 128 79.32
GPT-4.1 闭源 128 74.85
Gemini-2.5-Flash 闭源 128 74.25
GPT-4o 闭源 128 72.27
GPT-4o 闭源 20 70.97
Gemini-2.0-Flash 闭源 128 60.24
Qwen-2.5-VL-32B 开源通用 20 56.96
InternVL3-38B 开源通用 20 55.47
Video-LLaMA2-72B 开源视频 20 49.70
Qwen-2.5-VL-7B 开源通用 20 48.81
InternVL3-8B 开源通用 20 48.81
VILA-8B 开源视频 20 45.33
Video-LLaMA2-7B 开源视频 20 43.04
mPLUG-Owl3-7B 开源视频 20 42.94
LLaVA-NeXT-Video-7B 开源视频 20 42.94
VideoChat2-7B 开源视频 20 42.55
LLaVA-NeXT-Video-34B 开源视频 20 39.36
LLaVA-Video-7B 开源视频 20 34.39
Video-LLaVA-7B 开源视频 20 33.00

排序(ordering)是三种题型里最难的一档,开源与闭源在这上面的差距被拉得极大:

模型 动作变化(排序) 服装变化(排序) 场景变化(排序)
Gemini-2.5-Pro 60.98 83.33 91.30
Gemini-3-Flash 63.42 94.44 95.65
Gemini-3.1-Pro 48.78 88.89 95.65
GPT-4.1 46.34 66.67 73.91
Qwen-2.5-VL-7B 17.07 22.22 34.78
InternVL3-8B 29.27 22.22 39.13
Video-LLaMA2-72B 19.51 11.11 43.48
LLaVA-Video-7B 17.07 5.56 21.74
LLaVA-NeXT-Video-7B 2.44 0.00 13.04

消融实验

基准本身没有可拆的模块,作者用一组受控分析代替消融,逐一验证「模型究竟靠什么答对/答错」:

分析设置 对比对象 关键数值 说明
去掉视觉输入 GPT-4o 准确率下降 30.52%,接近随机基线 排除纯语言先验可以解题的可能
反转视频帧顺序 实体变化排序题 51.2% → 6.1% 时序被打乱后性能崩塌,说明确实在做时序推理
帧采样密度 k 开源 MLLM k ∈ {8,12,16,20,24,28,30,40,128},峰值在 k=20,之后下降 瓶颈不是时间覆盖量;Video-LLaMA2 只用 8 帧训练,给 128 帧时最不稳定
真实 vs 合成干扰项 OGP-MLLM 合成干扰项上反高 0.44% 依赖局部视觉线索,能有效拒绝无关属性
真实 vs 合成干扰项 OVS-MLLM 合成干扰项下降最多 9.69% 时序建模变强但幻觉倾向也变强
真实 vs 合成干扰项 闭源 MLLM 真实—合成差距最大 20.03% 即使最强模型也难抑制语境无关的生成
受控分析(只在存在性判断正确的前提下) OVS-MLLM 真实干扰项 −11.5%,合成干扰项 −14.9% 排除「只是检测失败」的解释,权衡真实存在于时序与感知之间
前向 vs 后向推理 OGP / OVS / 闭源 差距 20.65% / 9.96% / 17.55% 时间方向偏置;无关向(双向)条件下准确率最低
实体连续性类型 三类模型 OGP 最好于 disappear;OVS 与闭源最好于 reappear 前者靠静态线索,后者时序整合更强但会过度预测「再次出现」

关键发现

  • 感知落地与时序整合存在此消彼长的权衡。开源通用模型(Qwen-2.5-VL-32B 56.96%)反超了最好的开源视频专用模型(Video-LLaMA2-72B 49.70%)。前者能准确认出静态视觉线索,却维持不住时间上的一致性;后者时序连续性更可靠,但在实体歧义或外观变化下频繁产生幻觉。作者据此认为叙事理解是二者的乘积式能力,只有任一维度单独强都不够。
  • 时间方向偏置是一个独立且严重的短板。前向推理一致优于后向,差距在 OGP、OVS、闭源三档上分别是 20.65%、9.96%、17.55%,与 LLM 里的「反转诅咒」(Reversal Curse,模型学了「A 是 B」却推不出「B 是 A」)高度类似:模型能把实体状态沿时间轴向前传播,却学不会反向映射;要求从中间点同时向两端推理的双向形式准确率最低。作者的说法很传神——模型能把叙事读下去,却读不回来。
  • 增加帧数不等于更强的实体推理。开源模型的准确率在 20 帧达到峰值后随帧数增加反而下降,这与长视频推理任务上「采样越密越好」的单调趋势相反。多出来的帧带来的是冗余信息,而模型维持时序一致性、保持感知落地的能力没有同步提升。模型规模也不是保障:InternVL3-38B 比 8B 高 6.66%、Video-LLaMA2-72B 比 7B 高 5.66%,但 LLaVA-NeXT-Video-34B(39.36%)反而低于自己的 7B 版本(42.94%)。
  • 合成干扰项对多数模型并不简单。直觉上「其他视频里的实体」应该更容易被排除,但实际上视频专用模型在合成干扰项上最多掉 9.69%,闭源模型的真实—合成差距最大到 20.03%,说明它们更容易被文本或全局先验牵着走,而不是做细粒度的视觉判别。反倒是通用模型在两类干扰项上表现几乎一致。
  • 最基础的存在性维度上也藏着巨大落差。多数开源模型在存在性的二选一上还能拿到 40–70%,一旦换成多选就骤降——LLaVA-Video-7B 从 67.00% 掉到 2.00%,Qwen-2.5-VL-7B 从 57.00% 掉到 36.00%。这说明「是否出现过」这类判断在很大程度上依赖格式带来的猜测空间,而不完全是稳定的实体跟踪能力。
  • 失败是分层级联的。定性分析中,存在性层面模型倾向于高估连续性(实体只在开头短暂出现,却被判成贯穿全片);变化层面会产生语义上说得通但视觉上没有依据的回答(答出「在舞台上唱歌、递麦、低头」这类符合场景套路的动作序列却与实际不符);歧义层面最严重,多个实体交互或再次出现时,连很强的闭源模型也会混淆身份或凭空断定实体出现。

亮点与洞察

  • 把「叙事理解」还原成可程序化生成与判分的实体追踪问题,是这篇论文最关键的转译。它把此前只能靠人工标注、难以规模化的一致性评测,变成了「检测 + ReID + MLLM 属性标注」就能批量产出的流水线,而且标准答案由元数据直接推出,天然自洽。这套「先把任务形式化成结构化表示,再从表示生成题目」的思路可以迁移到任何有明确跟踪目标的评测上。
  • CRP 的三级递进不是难度分层,而是失败归因器。多数基准只能告诉你模型得了多少分,CRP 能告诉你它是时间上跟丢了、属性落地不牢、还是被相似实体骗了;再叠加前向/后向/双向的推理方向与真实/合成干扰项两个切面,同一份数据被切出了多个正交的诊断轴,这种「一份数据、多维结论」的设计非常划算。
  • 用模型间共识替代人工一致性。轨迹验证完全无监督,靠多 MLLM 多数投票模拟标注者共识,并与人类多数投票达到 96.08% 一致;这比「找几个人标注一部分再推广」更可扩展,也是整条管线敢宣称「全自动」的底气所在。
  • 高亮目标再问 MLLM 这个细节很实用:多实体视频里属性归因极易错到最显眼的人身上,一步简单的视觉提示就把错误率压下去了。任何做实体级属性抽取的工作都可以直接复用。
  • 最有「啊哈」感的一条结论是时间方向偏置与 Reversal Curse 的类比——它提示「模型能把叙事读下去却读不回来」可能不是数据不够,而是自回归从左到右的解码范式带来的结构性限制,指向双向时序建模或对比式反转目标这类新训练目标。

局限与展望

  • 作者明确承认当前只覆盖人类实体。理由是人体在动作和外观上变化丰富、最具代表性,而非人类实体与背景物体视觉变化有限、容易把评测退化成简单的身份匹配,还会引入混淆。代价是人—物交互、动物行为、物体被传递/改造这类叙事线索被整体排除在外。
  • 「主要角色 = 出现频次高的簇中最大的四个」是个启发式,仅由 100 段抽样视频的经验支撑。次要但对叙事关键的实体(比如只在关键场景出现一次的关键人物)会被直接丢掉,而这些恰恰可能是最难的时间推理对象。
  • 属性标注依赖 Gemini-2.5-Pro,是闭源模型,且作者只做了抽样人工复核与修正,没有给出全量属性的错误率估计。换一个 MLLM 或换一版模型权重,标注结果与最终题目分布是否稳定,论文没有回答。
  • 质量评审的结果本身留有余地:抽样 100 条中只有 70% 被三人一致判为有效(κ = 0.767 属于「显著」但非「几乎完全」一致),其余 30% 存在争议,主要问题在合成干扰项过于平凡;虽然作者做了替换,但替换后的分布是否彻底解决了这一点没有量化。
  • 平均片段时长 55.3 秒、最长 659 秒,相对于真正的长片叙事仍然偏短;而评测协议只用精确匹配,不做开放式生成,因此无法评估模型生成连贯叙事的能力——存在性多选上的崩塌(67.00% → 2.00%)也提示部分题目的得分受格式猜测空间影响,论文只报告了平衡选项分布,没有进一步分析是/否偏置。
  • 帧数设置不对等(开源 20 帧、闭源 128 帧),跨类别比较只能作为趋势参考,不能当作同条件下的模型质量排序,论文本身也明确说明分析是按类别内趋势解读的。
  • 可改进方向:把实体定义从人类扩展到物体与动物(可以用属性变化幅度而非实体类别来决定是否纳入评测);把「四个主要角色」换成基于叙事贡献度的动态筛选;在属性标注环节改用多模型交叉验证 + 全量抽检以量化标注噪声;引入双向时序建模或反转对比目标,专门针对前向/后向不对称做优化。

相关工作与启发

  • vs Video-MME / NExT-QA / MVBench / PerceptionTest:这些基准以短片段为主、场景变化少,很多题可以靠单帧线索或语言先验答对(打乱帧序性能几乎不变)。NARRATIVETRACK 的题必须跨镜头追踪实体才能答对:反转帧序后实体变化排序题从 51.2% 跌到 6.1%,去视觉输入掉 30.52%,证明它确实在考时序。
  • vs LVBench / LongVideoBench / Video-MME 长视频部分:这些长视频基准时长更长,但考的是粗粒度的全局语境概括,不要求维持具体实体跨场景的状态;本文反过来只考实体级细粒度连续性,因此对模型的诊断更尖锐,代价是任务类型更窄。
  • vs VELOCITI:VELOCITI 用严格蕴含在视频—语言层面隔离 agent–action 绑定错误,正负样例构造严谨,但实体在片段内持续可见,推理局限在片段内绑定。本文把场景推到跨场景、跨时间间隔,实体可消失再出现、可换装、可被相似实体混淆,考的是长程身份与状态的持续性。
  • vs MovieQA / TVQA:电影与电视剧问答同样面向叙事,但依赖人工标注(TVQA 只有 11.2 秒的平均片段,MovieQA 2,144 条题),没有边界框/动作/场景/服装这类实体级结构化属性,也无法把失败归因到实体跟踪的哪一环;本文的全自动管线在规模与诊断粒度上都不同。
  • vs 通用 MLLM 评测:本文按训练目标把开源模型分成 OGP 与 OVS 两类再分别看趋势,这个切分本身值得借鉴——它把「模型为什么强/弱」从参数量叙事拉回到训练目标与能力结构的对应关系上。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首个从实体中心、自下而上定义叙事理解的基准,CRP 三级递进与正向/反向/双向推理方向切分都是新的诊断工具。
  • 实验充分度: ⭐⭐⭐⭐⭐ 20 个模型(13 开源 + 7 闭源)、三个受控分析轴(推理方向、干扰项类型、帧密度)加受控对照,管线本身也用 AVA 召回率与人类一致性做了验证。
  • 写作质量: ⭐⭐⭐⭐ 论证链条清晰、失败归因讲得具体,但部分示意图在缓存文本中排版错乱、附录公式信息缺失,个别数字需要回原文核对。
  • 价值: ⭐⭐⭐⭐⭐ 它把「模型能读叙事却读不回来」这一结构性缺陷量化出来,并给出可规模化的评测方案,对后续做实体中心训练目标与双向时序建模有直接指导意义。