How Far Are Video Models from True Multimodal Reasoning?¶
会议: ECCV 2026
论文: ECCV 2026
领域: 视频生成 / 多模态VLM
关键词: 视频生成评测、多模态推理、零样本基准、自动 prompt 优化、语义集合匹配
一句话总结¶
本文把「真多模态推理」操作化为一批上下文只给素材、不给结论的零样本视频生成任务,构建了覆盖四模态输入、6 大类 47 子类约 1390 条数据的 CLVG-Bench,并提出用语义集合匹配做自动 prompt 优化的评审器 AVE;评测结果是当前最好的视频模型在常规编辑上能到 60% 以上通过率,一到需要自己补物理因果或逻辑关系的任务就跌到 21% 左右,多轮交互第二轮全部失败。
研究背景与动机¶
视频模型近两年正从「跟随指令」走向「理解与推理」:参考条件生成从单参考(首帧、深度、姿态)扩展到多主体、多模态参考,任务重心也从画面保真度转向是否理解并遵守上下文里的因果关系。但社区始终缺少对这一范式的统一表述与评测——现有基准要么只接受单一模态输入(VBench 只有文本条件),要么把编辑类任务当成全部,没有一个「任意组合的多模态上下文 → 生成」的通用框架。作者于是把这类任务形式化为 Context Learning in Video Generation:以文本、图像、音频、视频的任意组合为上下文,零样本生成符合该上下文的视频。
评测侧同样卡住了三代做法。启发式基础指标(CLIP-Score、FVD、LPIPS 之类)便宜,但只吐出一个粗粒度总分,出错时说不出错在哪里;训练型奖励模型(如 VideoScore 系列)能给人对齐的多维打分,代价是大量专家标注,跟不上视频任务的变化速度,而且容易被 reward hacking;最近流行的 agent / LLM-as-judge 框架虽然同时给分和文字反馈,却依赖手工编写的 system prompt 与固定的 in-context 示例,换个任务就得重写,复现性和泛化性都差,更关键的是它们主要盯视觉保真度,几乎不检查视频内部的逻辑推理。于是「视频模型离真正的多模态推理还有多远」这个问题,一直没有可复现、可归因的答案。
本文同时补上「考什么」和「怎么判」两块:CLVG-Bench 把上下文学习拆成 6 大类 47 子类、全部人工构建以保证无版权与无数据污染;AVE 则把开放式评价变成一个可以搜索的 prompt 优化问题,让评审智能体自己从错误里学出细粒度评审规则。核心 idea:把「真多模态推理」操作化为「上下文只给素材、不给结论」的零样本生成任务(物理仿真 / 感知 / 逻辑推理 / 多轮交互),再让评审智能体自己迭代出评审规则——答案是当前视频模型只会在字面编辑上过关。
方法详解¶
整体框架¶
整篇工作分两半:一半是基准(考什么),一半是评审器(怎么判)。输入是任意模态组合的上下文 \(X\)(text / 参考视频 / image / audio),被测视频模型 \(M\) 零样本生成一段视频 \(v_o=M(X)\);基准侧用 6 大类 47 小类覆盖从表面编辑到多轮交互的推理负荷梯度,评审侧先让一个 VLM 评审智能体在系统 prompt \(p\) 下指出 \(v_o\) 的弱点,用语义匹配函数把它和人工标注的弱点集对齐,得到实例级混淆矩阵与一句文字反馈,再据此迭代重写 \(p\);预算耗尽后冻结最优 prompt \(p^*\),用它给所有被测模型打出六类通过率。最后用两组不改模型、只改输入信息量或交互轮数的受控探针,把「真的在推理」和「照着字面模式生成」分开。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
A["四模态上下文<br/>文本 / 图像 / 音频 / 视频"] --> B["四模态上下文<br/>× 六类推理任务"]
B --> C["无污染的人工元数据构建"]
C --> D["被测视频模型<br/>零样本生成 v_o"]
subgraph AVE["AVE:语义集合匹配 + prompt 迭代优化"]
direction TB
E["语义集合匹配<br/>预测弱点 vs 标注弱点"] --> F["混淆矩阵 + 文本反馈"]
F --> G["候选池 Pareto 采样<br/>重写评审 prompt"]
G --> E
end
D --> E
G -->|冻结 p*,全量评测| H["受控探针:指令显式化 + 多轮反馈"]
H --> I["诊断:哪些维度接近 / 远离真推理"]
关键设计¶
1. 四模态上下文 × 六类推理任务:把「输入格式」和「要不要推理」解耦
现有基准把模态和任务绑得很死(VBench 只有文本条件,FiVE-Bench 是文本+视频),并且任务难度没有按「需要自己补多少隐含信息」分层,于是单独看一个高分,说不清模型到底是会推理,还是只会照字面执行。CLVG-Bench 的做法是先按模态格式抽象用户输入:不管下游任务是什么,输入都是 text、image、audio、video 四种基础模态的任意组合,这样「支持几种模态输入」和「任务要多难的推理」就成了两个正交的维度。
随后它把上下文分成六类:元素编辑(E.E.)、局部参考(P.R.)、剧本续写(S.C.)这三类本质是显式指令跟随——该做什么已经写在指令里;物理仿真(P.S.)、感知(Perc.)、逻辑推理(L.R.)这三类的关键信息隐含在上下文素材里,需要模型自己补出物理因果或逻辑关系(比如油滴因为密度比水小而逐渐上浮、被压缩的球体应该如何回弹);论文还把多轮交互生成作为第七类任务引入,要求模型根据用户反馈预测下一段视频脚本,而不是复述当前输入指令(论文 3.1 节称该类暂时并入剧本续写统计)。47 个子类的作用是让出错可以被归因到具体能力,而不是只给一个总分。
这套分类法就是论文对「真多模态推理」的操作化:真推理 = 上下文只给素材、结论要模型自己推;捷径 = 结论已经写在指令里的表面编辑。因此同一模型在 E.E. 上 61.25%、在 L.R. 上只有 21.25% 的这个落差,本身就是「会不会推理」的度量——如果把它俩平均成一个数,这个信息就没了。
2. 无污染的人工元数据构建:上下文、脚本、参考素材全部手造
网络抓取的评测视频有两个麻烦:版权风险,以及更致命的数据污染——被评测的模型很可能在预训练里见过这些素材,分数会被记忆抬高。所以 CLVG-Bench 的每一条内容都是人工创建或人工核验的。上下文(context)先用 Seed 2.0 Pro 按「提取六大类及其子类的主题 → 把主题扩写成贴近真实用户需求』两步生成,再由三名标注者按各自负责的类别独立核验语义完整性与需求准确性,并用 Gemini 3 Pro 额外交叉检查其中的事实性陈述;任何不符合类别规范的上下文都要走协同复审,由标注者讨论分歧并产出修正版本。
参考视频的构造更讲究:脚本先按电影理论(Andrew、Bordwell 等人的著作)定义五个基本元素——主体、主体的声音特征、镜头数、运镜、视频类型;每条脚本从这五个维度随机不放回抽样标签,保证标签分布均匀、不会所有样本都塌到同一种电影风格;再让 Seed 2.0 Pro 依据抽到的标签写出完整连贯、可直接用于生成的剧本,最后由 Seedance 2.0 生成视频。参考图像取自 UniVBench(本身已规避版权),并人工过滤掉会造成风格漂移或参考歧义的样本;音频来自 Seed-VC 开源仓库,过滤掉噪声背景与低质量片段。手工构建的代价是规模上不去(约 1390 条),换来的是评测结果不能用「模型见过」来解释。
3. AVE:语义集合匹配 + prompt 迭代优化,把开放式评价变成可搜索的目标
开放式评价没法用精确匹配判对错:评审智能体输出的是一段自由文本批评,人工标注的也是一组「值得注意的弱点」,两边措辞不同、数量不同,本质上是集合对集合的比较。AVE 的第一个组件就是为此设计的语义匹配函数 \(S\)。它把预测弱点集 \(\hat y\) 与标注弱点集 \(y\) 按语义求交得到 \(TP_{set}\),再从两侧分别减掉交集得到 \(FP_{set}\)(模型瞎报的)与 \(FN_{set}\)(模型漏掉的),然后补上四个边界情形:两边都有弱点则至少记一个 TP、两边都空记 TN、标注为空而预测非空记 FP、标注非空而预测为空记 FN,四项归一化后得到一个各元素之和为 1 的实例级混淆矩阵:
同时输出一句可读反馈——完美预测时写 "Perfect prediction.",否则写 "Omissions: ⟨漏判⟩; Hallucinations: ⟨误报⟩"。把漏判和误报分开写是刻意的:优化器看到的不是「你错了」,而是「你错在哪一类」,才能有针对性地往 prompt 里加规则。
第二个组件是围绕这个矩阵的 prompt 搜索。把标注数据切成训练/验证/测试三份,在预算 \(B\) 内循环:从候选表 \(T\) 里选一个 prompt(优先取验证集上最好的,或用 Pareto 采样保持多样性),在训练集小批上评估并拿到文字反馈,由优化器 \(O\) 依据反馈重写 prompt,再把新 prompt 放回验证集打分并记入候选表;预算耗尽后取验证集上 \(\Phi\) 最大的 \(p^*\) 冻结,只在没见过的测试集上报成绩。相比传统 APO 为 QA、数学题设计的确定性精确匹配,这里的匹配是语义层面的集合运算,因此能容忍「意思对但说法不同」的弱点;而最终学到的 prompt 里长的不是套话,是具体规则——物理任务上学到「先找至少两个固定不动的参照物,再比较目标物相对它们的大小变化,只有多个参照都确认一致才判异常」这类可操作条款。
4. 受控探针:指令显式化 + 多轮反馈,把「会推理」和「照着字面生成」分开
高通过率不等于会推理,模型也可能只是在匹配指令里的字面模式,所以需要一个把隐含信息显式写出来的反事实对照。论文的探针一是指令显式化:用 Seed 2.0 Pro 先解读上下文,把原指令改写成显式陈述物理或逻辑条件的版本(图中案例把「玉米被烧焦」改写成「玉米变成爆米花」),再交给同一个视频模型生成。如果模型原本真的在自己补隐含因果,这个「帮忙把话说清」的操作不该带来大幅提升;实测 Seedance 1.5 在物理仿真上 +14.9、Seedance 2.0 在逻辑推理上 +27.7,而且加了外援的 Seedance 1.5 反而超过了更强的 Seedance 2.0 与 Veo 3.1 Fast,说明模型此前主要靠字面模式,隐含因果并没有被它自己推出来。
探针二是多轮交互:设计一个早期教育场景,模型扮演老师,环境根据其生成内容随机给出用户反馈,模型必须逐轮推演出下一段视频脚本。这把「有没有持续维护的推理状态」变成一个可观测指标——如果模型只是在复述当前输入,那么一旦反馈把目标改写,它就会失手。两个探针都不改模型、不改训练,只改输入的信息量或交互轮数,因此是干净的反事实设计;配合六类通过率的难度梯度,就能把「看起来会推理」和「真的会推理」区分开。
一个完整示例¶
用论文图 5 的物理评测 prompt 演化,走一遍 AVE 的迭代。
初始 system prompt 只有一句「判断视频里有没有物理异常」,它在验证集上的 F1 是 65.6。AVE 在训练小批上评估:评审智能体吐出一组弱点,语义匹配把它与人工标注对齐后,暴露出两类典型错误——它把物体沿深度方向移动时的透视缩放误判成「物体尺寸变了」(FP,幻觉),又漏掉了需要跨帧确认才能发现的持续性异常(FN,漏判)。反馈因此被写成 "Omissions: …; Hallucinations: …" 的形式送回优化器。优化器据此重写 prompt,新版里出现了多条具体规则:跨连续多帧交叉验证异常是否一致,避免把一次瞬时观察误差当异常;判断任何属性变化前先找至少两个固定不动的参照物(支架之类),比较目标物相对它们的大小与位置,只有多个固定参照都确认变化一致才判异常,以此把真实物理变化和 3D 透视投影造成的表观变化分开;涉及耗材(粉笔、铅笔、橡皮、蜡烛、墨水)或会在多个物体上产生均匀效应的过程时,按对应的专门条款检查。加上这些规则后 F1 从 65.6 升到 79.4(+13.8)。这个例子说明 AVE 不是在拟合指令的表面措辞,而是把「上一轮错在哪」沉淀成了可复用的检查清单。
损失函数 / 训练策略¶
这里没有梯度训练,被优化的对象是评审智能体的 system prompt(上下文里的「参数」)。优化目标 \(\Phi\) 在实验中取 Recall 减 False Positive Rate(Rec-FPR)、F1、MCC 三种指标,配合语义匹配给出的混淆矩阵在验证集上打分;搜索用 TextGrad 与 GEPA 两种自动 prompt 优化方法作为优化器 \(O\),prompt 优化模型是 Seed 2.0 Pro,评审模型是 Seed 2.0 Lite。关键设置:总优化预算 30 美元、温度 0、最大 32,000 token;每条样本由评审模型独立评 5 次取多数票以抑制随机波动;标注数据 600 条,训练/验证/测试各 200 条。评测时六类任务被合并成三个更粗的训练任务——感知(Perc.)、指令跟随(E.E.+P.R.+S.C.)、物理与逻辑推理(P.S.+L.R.),但主结果(Tab. 2)仍按六类分别报告人工通过率。
实验关键数据¶
主实验¶
CLVG-Bench 的测试用例难度递增,从标准文生视频一直到多镜头、多主体、多参考视频设置。由于部分 baseline 对输入格式或参考数量有限制,作者采用分组比较协议:只有同一组内的模型才在同一批测试用例上比较,因此不同组的分数不能直接横向比大小。
| 模型 | 输入模态 | E.E. | P.R. | S.C. | P.S. | Perc. | L.R. |
|---|---|---|---|---|---|---|---|
| Seedance 2.0* | 视频+音频+图像 | 61.25 | 52.64 | 67.65 | 63.54 | 43.37 | 21.25 |
| Sora 2† | 视频+图像 | 46.38 | 49.45 | 52.49 | 48.91 | 45.86 | 38.96 |
| Seedance 1.5‡ | 仅图像 | - | 35.47 | - | 37.50 | 40.00 | 8.75 |
| Veo 3.1 Fast‡ | 仅图像 | - | 46.38 | - | 46.88 | 36.00 | 16.25 |
| Wan 2.2 14B‡ | 仅图像 | - | 46.67 | - | 39.00 | 16.00 | 11.25 |
| HunyuanVideo 13B‡ | 仅图像 | - | 26.67 | - | 26.00 | 14.00 | 5.00 |
| UniVideo† | 视频+图像 | 8.10 | 8.06 | 4.08 | 10.00 | 3.00 | 3.75 |
| LTX-2† | 视频+图像 | 0.72 | 11.29 | 2.04 | 16.00 | 2.00 | 2.50 |
(指标为人工标注的通过率 %;- 表示该模型所属分组未覆盖该任务;* 支持视频/音频/图像输入,† 支持视频/图像输入,‡ 仅支持图像输入。)
消融实验¶
第一组消融回答「模型是不是在自己补隐含条件」:用 Seed 2.0 Pro 先把上下文解读清楚、把原指令改写成显式陈述物理与逻辑条件的版本,再交给同一个视频模型生成。
| 模型与配置 | 物理仿真 P.S. | 逻辑推理 L.R. | 平均 |
|---|---|---|---|
| Seedance 1.5 | 37.5 | 8.8 | 23.2 |
| Seedance 1.5 + Seed 2.0 Pro 改写指令 | 52.4 | 23.8 | 38.1 |
| 提升 | +14.9 | +15.0 | +14.9 |
| Seedance 2.0 | 63.5 | 21.3 | 42.4 |
| Seedance 2.0 + Seed 2.0 Pro 改写指令 | 70.3 | 49.0 | 59.7 |
| 提升 | +6.8 | +27.7 | +17.3 |
第二组消融拆解评审器:底座是 Seed 2.0 Lite,先在 prompt 优化框架(TextGrad / GEPA)上做优化,再叠加语义匹配模块。
| 评审 prompt 配置 | E.E.+P.R.+S.C. MCC | P.S.+L.R. MCC | Perc. MCC | Perc. F1 | Perc. Rec−FPR |
|---|---|---|---|---|---|
| Seed 2.0 Lite(原始 prompt) | 23.9 | 36.8 | 43.3 | 79.0 | 40.3 |
| + TextGrad | 39.4 | 48.5 | 67.1 | 87.2 | 65.0 |
| + TextGrad + 语义匹配 | 43.8 | 57.7 | 70.7 | 88.6 | 67.7 |
| + GEPA | 39.3 | 54.6 | 64.3 | 86.4 | 60.0 |
| + GEPA + 语义匹配 | 47.8 | 51.6 | 70.7 | 88.6 | 67.7 |
| Seed 2.0 Pro(原始 prompt) | 0.00 | 46.2 | 37.9 | 78.7 | 29.2 |
| + 迁移 Seed 2.0 Lite 的优化 prompt | 17.8 | 62.0 | 44.0 | 80.0 | 38.1 |
关键发现¶
- 编辑类接近及格线,推理类远未及格。 Seedance 2.0 在剧本续写上拿到全场最高的 67.65%,元素编辑 61.25%,物理仿真 63.54%;同一模型在逻辑推理上只有 21.25%。这个 40 个百分点以上的落差,比任何单一平均分都更能说明瓶颈在哪。
- 闭源与开源之间存在断层,而且输入模态更宽不等于推理更强。 开源阵营里最好的 Wan 2.2 14B 在逻辑推理上只有 11.25%,UniVideo 在感知上只有 3.00%;但只能吃图像输入的 Veo 3.1 Fast 在局部参考上与支持视频+图像的 Sora 2 打平(同为 46.38%)。
- 逻辑推理是各家分歧最大的一维。 论文正文称生态在逻辑推理上「天花板为 21.25%」,但表里 Sora 2 实际拿到 38.96%,明显高于 Seedance 2.0(⚠️ 正文的「21.25% 天花板」与表中的 38.96% 不一致,以原表为准),这本身说明该维度上还没有稳定领先者。
- 把隐含条件写出来,分数就回来了。 Seedance 1.5 加了 VLM 改写后逻辑推理从 8.8 涨到 23.8(+15.0),反超了未加外援的 Seedance 2.0(21.3)和 Veo 3.1 Fast(16.25)。外部理解只能算部分补救,但也反证了生成模型自身没有在做这份推断(论文图 4(a) 给出原指令与改写指令的定性对比,缓存中的图注文字较零碎,具体对应关系 ⚠️ 以原文图为准)。
- 多轮交互是最硬的瓶颈。 原始设置下最强的视频模型第一轮成功率不到 10%,第二轮全部失败;接入 Seed 2.0 协助组织上下文与预测脚本后,第一轮成功率分别提升 44% 与 50%,多轮后的最终通过率达到 26% 与 34%(论文图 4(b)(c),未在正文表格中给出完整分项)。
- 语义匹配不是万能增益,它依赖底层 APO 先找对方向。 TextGrad 单用就把感知任务的 MCC 从 43.3 拉到 67.1(+23.8);叠加语义匹配后平均再涨 4.9(MCC)、1.7(F1)、4.5(Rec-FPR)。但在 P.S.+L.R. 上,GEPA + 语义匹配反而比 GEPA 单用低 3.0 MCC,说明匹配模块放大的是已有优化方向,方向错了就一起错。
- 优化出的 prompt 可以跨模型白拿。 在 Seed 2.0 Lite 上优化出的 prompt 直接搬到 Seed 2.0 Pro,三类任务平均增益 +13.2 MCC、+3.0 F1、+12.7 Rec-FPR,且无需任何额外优化预算。与人工判断的 Kendall's τ 也同步上升:Seed 2.0 Lite 在感知上 0.433 → 0.707,物理与逻辑推理上 0.368 → 0.577,指令跟随 0.239 → 0.480;Seed 2.0 Pro 迁移后物理与逻辑推理达到 0.620。
亮点与洞察¶
- 把「推理」变成可控变量的任务分类法。 用「结论是否写在指令里」把六类任务分成执行型与推断型两组,于是「会不会推理」不再需要主观判断,而是同一模型跨类别通过率的落差。这个思路可以迁移到任何「生成 + 评测」场景:先按信息隐含程度给任务分层,再看落差。
- 用语义集合匹配替代精确匹配,解决了开放式评价无法优化的问题。 把自由文本批评变成 TP/FP/FN 集合运算,既得到可优化的数值目标(混淆矩阵),又保留了可读反馈,还顺手把「漏判」和「误报」解耦——这个组件本身可以搬去做任何 LLM-as-judge 的 prompt 调优。
- 「指令显式化」是一个便宜且干净的反事实探针。 不改模型、不重训,只让一个 VLM 把隐含条件写出来,就能测出模型此前是在推理还是在做字面模式匹配。任何声称具备推理能力的生成模型都可以用这一招做体检。
- 评审 prompt 的可迁移性被显式验证。 论文没有止步于「我们的 prompt 更好」,而是证明在弱评审模型上优化出的 prompt 可以直接搬给更强的评审模型并继续涨点,这降低了整套评测框架的部署成本——只需在一个便宜模型上做一次优化。
局限与展望¶
- 作者承认的限制:外部 VLM 辅助理解只是部分补救,提升生成模型内在的推理能力仍然要在训练阶段解决;这正是论文呼吁「理解与生成更紧密耦合」的原因。
- 论文始终没有给「true multimodal reasoning」一个形式化定义,只能靠任务分类(P.S. / Perc. / L.R. 对编辑类)间接界定,因此「某类任务算不算真推理」的边界带有作者判断,别人难以证伪。
- 主结果由人工标注给出,但 Tab. 2 没有报告标注者一致性(Kendall's τ 只在评审器一侧给出),1390 条数据的标注质量缺少量化保证。
- 多轮交互的类别归属前后不一致:3.1 节说它「暂时并入剧本续写」,Tab. 1 却把 Interaction 单列为第 ⑦ 类,4.3 节又单独分析。读者无法判断它到底算不算在 S.C. 的统计里。
- 4.1 节把 CogVideoX1.5-5B 与 Wan 2.7 列为 baseline,Tab. 2 中却没有它们的成绩,主结果表覆盖不全。
- 分组比较协议让不同组分数不可直接横向比,但正文「闭源普遍优于开源」的结论没有明确限定这是组内比较。
- Tab. 4 的表头写作 "P.E.",正文写的是 "Physical Simulation"(⚠️ 以原文为准);AVE 是按三个粗任务训练/调优,但最终要产出六维细分分数,评审器在细粒度类别上的可靠性没有单独验证。
- 可改进方向:给「真推理」一个可证伪的定义(例如在反事实上下文下要求模型给出正确结果);补报标注者一致性;把多轮交互独立成正式类别并给出轮次级指标的定义与分项数值。
相关工作与启发¶
- vs VBench / FiVE-Bench / OpenVE-3M:这三类面向编辑与保真度,输入基本只有文本或文本+视频,完全不考推理;本文覆盖文本/图像/音频/视频四模态,并把推理类任务作为主战场。规模上本文(约 1390 条)不算大,是用人工可控换来的。
- vs RBench-V / Video-CraftBench / VBVR-Bench:它们已经开始考推理,但输入仍限于文本与图像,没有音频、也没有多轮交互;VBVR-Bench 规模最大(7500 条)而类别集中在物理仿真、感知、逻辑推理三类,且数据来自网络抓取,存在版权与污染风险——这正是本文坚持全人工构建的对照面。
- vs VideoScore / VideoScore2(训练型奖励模型):它们用 Video-LLM 回归人偏好分数,需要大量专家标注且难以跟上任务变化;本文只用了 600 条标注,靠 prompt 优化加语义匹配就达到了与人工判断较高的相关性(感知任务 τ 达 0.707)。
- vs Video-Bench / UniVBench / VideoGen-Eval(agent 评测框架):它们能同时给分和文字反馈,但依赖手写 system prompt 与静态 in-context 示例,换任务就要重写,复现性和泛化性受限;AVE 让 prompt 自己迭代,并额外验证了跨模型迁移,把「适配新任务」的成本压到接近零。
评分¶
- 新颖性: ⭐⭐⭐⭐ 问题提法(把「真推理」落成任务分类法)和语义集合匹配评审器都有新意,但基准 + LLM-as-judge 的大框架本身并不新。
- 实验充分度: ⭐⭐⭐⭐ 覆盖 8 个主流视频模型、两组受控探针、评审器完整消融与跨模型迁移,说服力强;扣分在多轮交互缺分项数值、主结果表漏掉两个列出的 baseline。
- 写作质量: ⭐⭐⭐⭐ 问题—方法—证据的链条清晰,图 5 的 prompt 演化案例很有说服力;扣分在类别归属前后不一致与「21.25% 天花板」这类表述与表格的出入。
- 价值: ⭐⭐⭐⭐⭐ 给「视频模型到底会不会推理」提供了可复现、可归因的答案,指出的物理因果与多轮状态两个瓶颈对后续模型设计有直接指导意义。