ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/taoxj2001/ViewFusion
领域: 多模态VLM / LLM推理
关键词: 多视图空间推理;结构化思维链;GRPO;跨视图对齐;多模态后训练
一句话总结¶
ViewFusion 把多视图空间推理拆成「先跨视图对齐、再按问题作答」的两段式思维链(<spatial_thinking> → <thinking> → <answer>),用 Qwen3-32B-VL-Instruct 合成的推理轨迹做 SFT 冷启动、再用带格式与长度整形的复合奖励做 GRPO,把 Qwen3-VL-4B-Instruct 在 MMSI-Bench 上从 30.1% 提到 35.4%(MindCube 77.0% vs. 37.0%)。
研究背景与动机¶
多视图空间推理要求模型在不同视角之间建立空间对应——相机怎么动、哪些物体在视角变化后仍是同一个、遮挡如何随视角推进而变化——再据此回答方向、位置、透视变换类问题。当前 MLLM 在这件事上并不可靠:Cambrian-1、Spatial-MLLM、SpaceR、ViLaSR 这类工作主要靠空间感知的指令微调与数据扩充提升单图空间能力,Visual Spatial Tuning(VST)用大规模空间数据训练后泛化明显变好,但一到多视图输入,模型仍然普遍把每张图当作独立的证据源,直接跳到答题,把多视图上下文当成弱辅助信息而不是必须联合对齐的互补观测。即使中间插入了「观察/描述」阶段(如 HumanOmniV2、Visionary-R1、Observe-R1 的 observe-first 设计),这一步也基本是视图内的描述性总结:它写出每个画面里显著实体是什么,却不写这些实体在视角变换下如何变化。于是最有信息量的线索恰好被漏掉——物体是因为被遮挡而消失还是真的离开了场景、背景地标在相机运动下的相对次序如何改变、尺度与透视畸变如何让同一个物体看起来位置偏移。模型给出的推理链读起来自洽,但建立在一个不完整的跨视图空间模型上,预测因此在真正需要多视图整合的题目上非常脆:错误分析里常见的是「两个视图被当成两个不同地点」「转身后左右混淆」「物体被匹配到错误的对应物」,而且这些错误靠加长文本推理是修不回来的。
作者进一步指出,把 RL 当作后训练手段也解决不了这个问题。GRPO 这类方法确实能按 rollout 提升任务级表现、也常常鼓励更长的思考,但它的奖励只定义在最终答案上:在多视图场景里奖励稀疏、且完全不约束模型「该怎么用这些视图」。作者的预备实验观察到 vanilla GRPO 训练出的模型频繁出现捷径行为——还没整合完整的多视图上下文就开始解题、或者主要依赖某一视图、把其余图像当陪衬;结果是推理看起来更详细,但跨视图空间模型依旧残缺,给更多视图并不能可靠地换来更好的多视图推理,有时反而放大捷径并让中间推理变得不稳定。
问题的症结因此很清楚:跨视图对齐是答对的前提,但它本身在现有训练范式里没有任何显式的监督信号,只能寄希望于「答题」这个目标顺带把它学出来。本文的切入角度是把这件事从「答题的副产物」翻转成「答题前的第一步」:核心 idea:用一个结构化的两段式思维链把跨视图空间预思考显式化——第一段 <spatial_thinking> 专门推断视角关系与跨视图对应,形成一个文本形式的空间工作区;第二段 <thinking> 在这个工作区上做问题驱动推理;再用合成推理轨迹做 SFT 冷启动、用「正确性 + 格式合法性 + 长度整形」的复合奖励做 GRPO,使这套两阶段生成行为在 RL 中稳定下来。
方法详解¶
整体框架¶
输入是 2–8 张同一场景的多视图图像加一个多项选择问题,输出是一段固定三段式的文本序列:先 <spatial_thinking>(跨视图空间预思考),再 <thinking>(问题驱动推理),最后 <answer>(单个选项)。训练上分两步走:先用 18K 合成推理轨迹做 SFT,让模型在教师强制下学会这套协议;再用 16K 不含推理轨迹的数据做 GRPO,用复合奖励把策略推向「答对」同时保持协议不塌。整条链路没有引入任何额外的对齐模块、空间 token 或 3D 几何头,跨视图对齐完全由语言链本身承载。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多视图输入 + 问题"] --> B["结构化两阶段思维链"]
B --> C["合成推理监督<br/>trace 重写 + 严格过滤"]
C --> D["复合奖励<br/>正确性 + 格式 + 长度"]
D --> E["两阶段优化<br/>SFT 冷启动 + GRPO 对齐"]
E --> F["输出最终选项"]
这里有三件事值得先说清楚,后面三个设计点分别对应它们。「结构化」到底结构在哪:不是图结构、也不是空间 token 或坐标量化,而是「分阶段 + 固定标签顺序 + 职责分工」——第一个思考段只负责跨视图对齐,第二个思考段才允许做问题驱动的推理与坐标映射,两个段的职责不允许互换或合并,而且标签的开闭与顺序在训练中被硬性约束。多视图信息如何在链中融合:方法不做「逐视图编码再对齐」的显式匹配,而是让同一条自回归文本链承担对齐工作——模型在 <spatial_thinking> 里把同一元素在不同视图中的出现显式链接起来、写出相机是旋转还是平移、判断某个物体是退出视野还是被遮住、比较背景地标在两张图里的相对次序,这段文本本身就是后续推理要条件化的中间工作区;因此跨视图对应是「写出来的」,而不是某层注意力隐式算出来的。监督信号从哪来:SFT 侧由 Qwen3-32B-VL-Instruct 把公开数据集的原始 rationale 重写成三段式 trace 并经严格过滤得到,RL 侧只保留多视图输入与答案、刻意不给重写轨迹,用结果奖励优化。
关键设计¶
1. 结构化两阶段思维链:把跨视图对齐从副产物变成必须的第一步
现有范式(含带观察步的 observe-first 变体)失败的共同点是让模型「边看边解」:观察步是视图内的描述,答题步直接从这些描述跳到答案,跨视图关系始终是隐式的。ViewFusion 把输出固定成 <spatial_thinking>、<thinking>、<answer> 三段并规定职责:第一段必须回答「这些视图之间发生了什么」——哪两张图共享哪些视觉元素、相机相对运动是旋转还是前移、哪些物体因遮挡消失、背景地标的相对次序如何变化,最终形成一份一致的跨视图空间描述;第二段才在这个工作区上做问题驱动的推理,把目标物体的位置映射进题目给定的参考系(例如题目里说的「面朝北」);第三段只输出一个选项字母。
这样做之所以有效,机制上有两点:其一,它把「先调解多视图证据再下结论」写进了生成序列的因果顺序里,模型无法在没写出对齐结论之前就开始解题,单视图捷径在结构上被挡住了入口;其二,对齐错误从「隐式、事后不可归因」变成「显式、逐 token 可见」,因此在训练中可以被直接约束(例如格式奖励要求这一段的标签必须存在且闭合),也便于人工检查模型到底在哪一步对齐错了。这也是它与「让模型思考更久」的本质差别——它约束的是思考的内容与顺序,而不是思考的长度。
2. 合成推理监督:把原始 rationale 重写成三段式 trace,再用严格过滤挑数据
公开的多视图数据(VST-500K、MindCube-Trainset)只有问答对,原始 rationale 并不是按两阶段协议写的,直接拿来 SFT 学到的是「先描述再答案」的旧行为。作者的构造方式是用 Qwen3-32B-VL-Instruct 把每条原始 rationale 重写成含 <spatial_thinking>、<thinking>、<answer> 三部分的轨迹,让第一段显式承担跨视图预思考;随后施加严格过滤规则,剔除缺字段、段序错误、标签未闭合、格式错乱的样本,最终得到 18K 干净 SFT 语料。RL 侧另从同源数据取 16K 实例,只保留多视图输入与用于算结果奖励的答案,不带任何重写轨迹。
这里的取舍很具体:SFT 需要一份结构一致、格式可控的冷启动语料,否则两阶段协议在训练早期就会被捷径答案冲掉、或者产出解析不了的畸形格式(论文明确把 SFT 定位为「防止早期塌缩」的冷启动);而 RL 侧刻意不给 rationale,是为了避免策略过拟合到某一份教师理由的措辞上——它要学的是「什么行为能带来正确答案」,而不是复述 Qwen3-32B-VL-Instruct 的写法。两侧数据同源但监督不同,这也让「结构化协议」与「RL 能力提升」两个因素在消融里可以分开考察。
3. 复合奖励:正确性 + 格式合法性 + 长度整形,把奖励稀疏与生成退化一起管住
多视图 RL 的奖励天然稀疏,只优化正确性会同时诱发两类退化:策略上,模型会靠单张图的显著线索直接下注、或者还没建立跨视图一致就开始答题;生成上,模型可能干脆省掉中间段、输出难以解析的畸形文本,或者塌缩成极短回答,使多阶段推理失去足够的推理内容。针对这一点,奖励被写成三项之和:
其中正确性项 \(r_{\mathrm{ans}}\) 是二元的:从 <answer> 里抽出预测选项,与标签相同得 1,否则 0(所有训练实例都是多项选择)。格式项 \(r_{\mathrm{fmt}}\) 也是二元指示,只有三段标签按固定顺序全部出现、且每个标签都正确开闭时才为 1,缺标签、换序、重复段、闭合错乱一律判非法——它直接堵死「跳过预思考直接吐答案」这条逃逸路线,是维持两阶段协议在 RL 中不退化到摆设的关键。长度项 \(r_{\mathrm{len}}\) 是一个整形项:只在预测正确、并且生成长度落在偏好区间 \([\ell_{\min}, \ell_{\max}]\) 时才给一个权重 \(\omega\),否则为 0(论文式(6) 在缓存文本中被 OCR 打乱,此处按其正文描述复述,⚠️ 以原文为准);实验里取 \(\omega = 0.2\)、\(\ell_{\min} = 320\)、\(\ell_{\max} = 512\),同时抑制推理内容不足的欠生成和啰嗦的过生成。⚠️ 原文式(7) 把三项直接相加,但正文又提到用一个 \(\lambda \in [0,1]\)(实验中取 0.02)控制格式正则强度,二者在缓存文本里对不上,具体形式以原文为准。
4. 两阶段优化:先 SFT 冷启动锁住协议,再 GRPO 直接强化「答对」的轨迹
两个训练阶段解决的是两个不同问题。SFT 在 lr \(1\times10^{-5}\) 下最大化目标序列的似然,作用是把协议与格式刻进模型,让生成结构稳定可解析——它便宜、稳定,但会继承教师 rationale 的偏差,而且教师强制下的目标与测试时的自由生成并不一致,无法直接优化任务级成功率。GRPO 阶段用更小的 lr \(1\times10^{-6}\):对每个输入采 \(K = 8\) 条轨迹,用组内平均奖励作基线算相对优势(不需要额外价值网络,方差也低),再用 PPO 式的裁剪目标配合对参考策略的 KL 正则更新策略。这样做的收益在实验里是可见的:SFT 模型在 MMSI-Bench 上是 32.4%,加上 GRPO 后到 35.4%,同时训练曲线显示总奖励与正确性奖励持续上升、KL 先升后平台——说明策略确实在参考模型之外做了探索,但被 KL 项控制在合理范围内;格式奖励则一开始就接近饱和,与「格式在 SFT 之后已经基本学会」这一消融结论互相印证。
一个完整示例¶
用 MMSI-Bench 里的一个客厅例子走一遍(对应论文图 3 的第一例)。两张照片拍的是同一间客厅——电视柜居中、两侧书架、L 形深色沙发;问题问:「假设第一张照片是我拍的,第二张照片的主体相对我大致在哪个方向?A 左后、B 左前、C 右后、D 右前」。
ViewFusion 的第一段先做对齐:它写出第一张图的机位与布局(面朝电视,左、右两侧各是书架),再描述第二张图——机位更低、更贴近书架与墙的交角,画面下缘出现红色地毯,主体是书架的底部——据此推断相机相对第一张视角「明显向左旋转、并略微前移」,相当于踏进了书架与沙发之间的位置。第二段才在此基础上答题:既然机位相对第一张是左 + 前,那么第二张图的主体(书架底部与墙角)相对第一张照片的拍摄者就位于左前方。最终输出 <answer>B。
对照基线 Qwen3-VL-4B-Instruct 的回答:它只写了「第一张是房间左侧的书架,第二张(题面说)是房间右后方的主体」,于是直接按题面推出「右后」,选了 C——它把题目给出的前提当成了已经对齐好的结论,整段推理里没有出现任何跨视图对应或相机运动的推断。这个对比很能说明问题:基线的错误不是描述错了物体,而是根本没有建立视图间的关系。
损失函数 / 训练策略¶
SFT 阶段在 18K 合成轨迹上以 lr \(1\times10^{-5}\) 做教师强制训练,作为冷启动;RL 阶段在 16K 无轨迹数据上用 GRPO,lr \(1\times10^{-6}\),每个实例采 \(K=8\) 条轨迹算组内相对优势,训练 1500 步(8×H100 上约 18 小时)。奖励为正确性、格式合法性、长度整形三项之和,超参 \(\omega = 0.2\)、\([\ell_{\min}, \ell_{\max}] = [320, 512]\)(⚠️ 正文另提到格式正则强度 \(\lambda = 0.02\),与式(7) 的对应关系以原文为准)。评测时从 <answer> 字段抽取预测,只接受单个选项字母,格式违规或解析不上的输出计为错误;解码与推理超参沿用 Qwen3-VL-4B 的推荐设置。
实验关键数据¶
主实验¶
在三个多视图 / 多视角基准上评测:MMSI-Bench(跨视图对齐、视角变换、遮挡敏感)、MindCube(从有限视图构建心智模型、部分可观测下的视角推理)、ViewSpatial-Bench(视角相关的空间定位与跨视图参考系)。全部为多项选择,报告准确率。
| 模型 | 规模 | MMSI-Bench | MindCube | ViewSpatial | 平均 |
|---|---|---|---|---|---|
| RandomChoice | – | 25.0 | 33.0 | 26.3 | 28.1 |
| GPT-5 | – | 41.8 | 56.3 | 45.5 | 47.9 |
| Gemini-3-Pro-Preview | – | 45.2 | 70.8 | 50.3 | 55.4 |
| Qwen3-VL-4B-Instruct | 4B | 30.1 | 37.0 | 42.5 | 36.5 |
| Qwen3-VL-8B-Instruct | 8B | 31.1 | 29.4 | 42.2 | 34.2 |
| SpatialLadder-3B | 3B | 27.4 | 43.4 | 39.8 | 36.9 |
| Cambrian-S-7B | 7B | 25.8 | 39.6 | 40.9 | 35.4 |
| ViLaSR-7B | 7B | 30.2 | 35.1 | 35.7 | 33.7 |
| VST-7B-RL | 7B | 34.8 | 39.1 | 42.4 | 38.8 |
| ViewFusion (SFT) | 4B | 32.4 | 68.5 | 45.1 | 48.7 |
| ViewFusion (SFT+RL) | 4B | 35.4 | 77.0 | 45.4 | 52.6 |
主结果是:在开源 4B 量级里 ViewFusion 平均分最高(52.6),比 Qwen3-VL-4B-Instruct 高 16.1 个点;MMSI-Bench 上 +5.3(35.4 vs. 30.1),ViewSpatial 上 +2.9(45.4 vs. 42.5),MindCube 上从 37.0 拉到 77.0。相对 7B 的 VST-7B-RL(38.8)也领先 13.8 个平均点。需要注意的是 SFT 模型在 MindCube 上已经拿到 68.5,说明该基准上的大部分增益来自合成监督本身,RL 再贡献 +8.5。
细粒度分析(MMSI-Bench)¶
| 模型 | Cam.–Cam. | Obj.–Obj. | Reg.–Reg. | Cam.–Obj. | Obj.–Reg. | Cam.–Reg. | Meas. | Appr. | Motion Cam. | Motion Obj. | MSR | 平均 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3-VL-4B-Thinking | 25.8 | 26.6 | 34.5 | 33.7 | 25.9 | 36.1 | 48.4 | 28.8 | 21.6 | 26.3 | 23.2 | 29.0 |
| Qwen3-VL-4B-Instruct | 30.1 | 34.0 | 29.6 | 34.9 | 29.4 | 39.8 | 45.3 | 19.7 | 21.6 | 23.7 | 26.7 | 30.1 |
| ViewFusion | 46.2 | 41.5 | 30.9 | 44.2 | 21.2 | 53.0 | 35.9 | 34.9 | 40.5 | 32.9 | 23.2 | 35.4 |
列名为 MMSI-Bench 的子类别缩写:Cam./Obj./Reg. 分别指相机、物体、区域,两两组合表示「某两者之间的关系」类问题;Meas./Appr. 为属性类下的测量与外观;Motion Cam./Obj. 为运动类下以相机/物体为主语的问题;MSR 为多步关系推理。粗体标出 ViewFusion 优于两个基线的地方。
消融实验¶
| 配置 | Cam.–Cam. | Cam.–Reg. | Motion Cam. | 平均 | 说明 |
|---|---|---|---|---|---|
| 完整方法 | 46.2 | 53.0 | 40.5 | 35.4 | 结构化协议 + SFT + GRPO |
| 自由格式推理 + RL | 37.6 | 49.4 | 31.1 | 33.4 | 去掉两段式协议,RL 不变,-2.0 |
| w/o GRPO | 28.0 | 47.0 | 32.4 | 32.4 | 只用 SFT 冷启动,-3.0(降幅最大) |
| w/o 格式奖励 | 40.9 | 51.8 | 37.8 | 35.0 | 去掉 \(r_{\mathrm{fmt}}\),仅 -0.4 |
关键发现¶
- GRPO 是能力提升的主要来源,结构化协议是防捷径的归纳偏置:去掉 GRPO(即只剩 SFT)平均掉 3.0 个点,降幅最大;把两段式协议换成自由格式推理但保留 RL,平均掉 2.0 个点,且掉点集中在需要视角推断的子类(Cam.–Cam. 46.2 → 37.6,Motion Cam. 40.5 → 31.1),说明没有显式的预思考段时模型确实会退回捷径。
- 格式奖励是稳定器而非性能来源:去掉它只掉 0.4 个点,因为 SFT 之后模型对三段格式的遵守度已经很高;训练曲线也印证这一点——格式奖励从训练一开始就接近饱和。它真正的价值是防止 RL 阶段协议塌掉。
- 增益确实来自「真正的跨视图对齐」:相对 Qwen3-VL-4B-Instruct,提升最大的是相机–相机(+16.1)、相机–区域(+13.2)、运动–相机(+18.9)、属性–外观(+15.2)这类必须推断视角或需要在视角变换后重新定位的问题,而不是纯单图可解的子类。
- 但存在明显的负迁移子类:物体–区域关系从 29.4 掉到 21.2、属性–测量从 45.3 掉到 35.9、Reg.–Reg. 从 29.6 到 30.9 基本持平。论文只强调了增益集中的部分,没有讨论这些下降;一种合理解释是两段式协议把容量倾斜给了跨视图方向判断,对单视图内的精细度量类问题反而挤占了推理预算(属本文笔记的推测,原文未给出分析)。
- 「想得更长」不等于「想得更对」:ViewFusion 在 MMSI-Bench 上超过 Qwen3-VL-4B-Thinking(35.4 vs. 29.0),而后者是用大量高质量思维链数据训练的推理模型。这说明多视图空间推理的瓶颈是跨视图一致性,而不是推理长度或思维链质量。
- 训练动态健康:1500 步 GRPO 中总奖励与正确性奖励稳步上升,格式奖励高位饱和,KL 先升后平台,说明探索被 KL 正则有效约束。
亮点与洞察¶
- 把「隐式的隐变量」变成「显式的中间产物」:跨视图对齐原本是模型内部一个从未被监督、也难以检查的隐变量;本文强制把它写成一段可读文本,于是它既能被条件化消费(第二段推理用),也能被奖励约束(格式项要求它存在且合法)。这个「让中间状态可见才能约束它」的思路可以迁移到任何有隐藏前提的多步任务(如工具调用前的意图消解、长文档问答前的证据归并)。
- 奖励设计的分工很清晰:正确性项负责能力、格式项负责行为不变式、长度项负责输出分布。尤其是「格式奖励是稳定器而非性能来源」这一点被消融和训练曲线双重证实,避免了把格式奖励当性能卖点的常见夸大。
- RL 侧数据刻意不给 rationale:SFT 用重写轨迹、RL 只用问答对,是比「两侧都用同一套合成 trace」更克制的选择——它把 RL 的目标限定为任务成功,从而避免策略被某一份教师理由的措辞锁死。换成「两边都用合成 trace」大概会更好看但更脆弱。
- 协议本身零额外参数:不引入对齐模块、空间 token、坐标回归头,全部靠标签结构与奖励实现,工程上极容易复用到任何已有多图输入能力的基础模型上。
局限与展望¶
- 基座单一、规模单一:只在 Qwen3-VL-4B 上验证,没有 2B/8B 的缩放曲线,也没有换基座(如 InternVL3)的迁移实验,无法判断增益是协议带来的还是特定基座带来的。
- MindCube 的增益可能被训练分布污染:训练数据来自 VST-500K 与 MindCube-Trainset,而 MindCube 同时是评测基准;37.0 → 77.0 这种接近翻倍的提升,很可能有相当一部分来自同分布匹配而非跨视图能力泛化。相比之下 MMSI-Bench(+5.3)与 ViewSpatial(+2.9)的提升更可信,也更值得作为主要结论。论文没有讨论这一潜在重叠。
- SFT 监督的上限由教师决定:全部 trace 由 Qwen3-32B-VL-Instruct 一次性重写并经规则过滤,没有人工校验或质量打分;如果教师在跨视图对齐上本身出错,错误会以「结构正确的错误对齐」形式被固化,而格式奖励只保证结构合法、不保证空间正确。
- 奖励形式偏经验:长度区间 [320, 512] 是手工设定的固定值,没有敏感性实验;正文提到的 \(\lambda\) 与式(7) 中三项直接相加的形式不一致(⚠️ 以原文为准),格式项与长度项的相对权重是否最优缺乏证据。长度奖励还给「答对的长回答」额外加分,在正确性奖励之外引入了二次激励,可能掩盖部分正确但冗长的轨迹。
- 缺少成本对比:两阶段链更长,但论文没有报告相对基线与 Thinking 模型的平均输出长度与推理延迟;18 小时 8×H100 的 RL 成本也只对 4B 模型给出,没有讨论更小/更大模型的可行性。
- 「工作区」只是自然语言:所有跨视图对齐都以文本形式表达,没有几何约束或 3D 一致性校验,因此仍可能继承语言先验与常识偏置(例如凭「厨房通常靠窗」这类先验编造视角关系)。一个自然的改进方向是给
<spatial_thinking>增加可验证的几何或对应关系输出,再用一致性检查做额外奖励。
相关工作与启发¶
- vs Observe-R1 / Visionary-R1 / HumanOmniV2:这些工作同样让模型「先观察再推理」,但观察步是对视觉输入的描述性总结(视图内有哪些实体、场景是什么),本质是让模型别急着答;ViewFusion 要求的是跨视图关系推断——相机怎么动、哪些元素在视角变化下对应、遮挡如何演化,属于必须整合多视图信息才能写出的内容,而不是单图也能写的描述。
- vs R1-VL / Insight-V / Video-R1 等 GRPO 系推理 RL:它们通过步级密集奖励或自生成轨迹选择来提升多模态推理路径的质量,优化的仍是「推理质量」这一通用目标;ViewFusion 把奖励拆成正确性 + 协议格式 + 长度三部分,其中格式项专门用来把「必须跨视图对齐」这一结构约束维持住,是针对多视图捷径这一具体失败模式设计的。
- vs Visual Spatial Tuning(VST):VST 用大规模空间感知与推理数据训练,是数据侧路线,VST-7B-RL 在 MMSI-Bench(34.8)与 ViewSpatial(42.4)上都很强;ViewFusion 是训练协议与奖励侧路线,用 4B 基座达到 35.4 / 45.4,说明在同等数据来源下,「怎么组织推理过程」也能带来可观增益,两条路线彼此正交、可叠加。
- vs Qwen3-VL-4B-Thinking:后者靠大量高质量思维链数据获得更长的 deliberation,在 MMSI-Bench 上只有 29.0,甚至在多个子类上低于 Instruct 版。这是本文最有力的对照——它说明多视图空间推理的瓶颈不在思考长度,而在思考是否包含跨视图一致性这一步。
- 可迁移的启发:把「跨视图一致性」换成其他任务里的隐藏前提(如时序一致性、多文档证据一致性、多轮对话中的指代一致性),「显式写出中间工作区 + 用格式奖励保证该工作区存在 + 用结果奖励优化正确性」这套配方大概率仍然成立。
评分¶
- 新颖性: ⭐⭐⭐⭐ 两段式「先对齐再作答」的协议本身不算全新(observe-first 已有),但把跨视图对齐显式化为受奖励约束的中间工作区、并系统说明它为什么能压住多视图捷径,是有价值的重新表述与落地。
- 实验充分度: ⭐⭐⭐ 三个基准确有增益,消融与训练曲线也基本说清了各组件分工;但只有单一 4B 基座、无缩放与跨基座实验,MindCube 存在训练/评测同源的重叠嫌疑,长度奖励与 \(\lambda\) 也缺敏感性分析。
- 写作质量: ⭐⭐⭐⭐ 失败模式诊断(late fusion、视图内描述、RL 捷径)写得具体且有例子支撑,框架与奖励定义清楚;不足是式(7) 与 \(\lambda\) 的描述不一致,且对负迁移子类避而不谈。
- 价值: ⭐⭐⭐⭐ 方法零额外模块、配方清晰、有开源代码,对任何做多图/多视图 MLLM 后训练的团队都可直接复用;MMSI-Bench 与 ViewSpatial 上的稳定增益比 MindCube 的暴涨更有参考价值。