跳转至

title: >- ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space description: >- ECCV2026 论文笔记:ProLaViT 用原生视觉编码器蒸馏四步视觉潜在思维,并以距离加权多样性约束减少状态坍塌,在无需推理时视觉工具的条件下改善空间与拼图推理。 tags: - ECCV2026 - 多模态推理 - 潜在视觉思维 - 自蒸馏 - 结构化潜在空间 date: 2026-09-17


ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

会议: ECCV2026
论文: ECCV 原文
项目: ProLaViT
领域: 多模态 VLM / 视觉推理
关键词: 潜在视觉思维、自蒸馏、渐进推理、反事实验证、多样性约束

一句话总结

ProLaViT 将程序合成的视觉操作轨迹蒸馏为四步连续潜在状态,再按步骤距离约束状态差异,使 Qwen2.5-VL-7B-Instruct 不调用推理时视觉工具也能逐步推理,BLINK-Jigsaw 准确率由基座的 59.33% 提升至 76.00%。

研究背景与动机

视觉语言模型(vision-language model,VLM)能够把图像描述得很流畅,但流畅的文字不一定保留正确的空间关系。 例如,回答“电视放在哪件家具上”需要区分电视柜、地板与遮挡边界;将这些细节先压成语言,再沿文字思维链推理,可能得到语义顺畅却定位错误的答案。 显式生成中间图像或调用裁剪、分割工具,可以把视觉证据重新带回推理过程,但每次生成、调用和重编码都增加延迟。 潜在视觉推理试图跳过像素输出,直接在连续特征中保存中间状态,因此提供了一条不同的效率路径。

问题在于,把所有目标定位与视觉变换压进一次潜在预测,并不自动赋予模型可靠的中间推导能力。 在本文的单步基线中,模型需要一次性预测复杂视觉线索,容易把背景信息带入最终表示。 即使增加多个潜在步骤,如果各步最后学成几乎相同的向量,多步序列仍然只是重复存储,而不是逐渐收紧证据。 因此本文同时关心两个问题:每一步应该学什么,以及怎样避免这些步骤在训练中退化成同一个状态。

作者把中间监督建立在可编程视觉操作上:空间任务从全局网格走向目标框、裁剪和分割,拼图任务则加入错误拼接与正确拼接的对照。 这些图像只在训练时提供目标特征,教师采用模型自身冻结的视觉编码器,以减少跨模型特征空间的不匹配。 这里的“结构化”既指有顺序的操作语义,也指潜在状态之间不应全部相似或全部正交。 核心 idea:用原生视觉特征教会模型一条有任务含义的渐进潜在轨迹,再让相距较远的步骤承担更强的差异约束,使额外步骤真正携带新的视觉信息。

方法详解

整体框架

输入是一张图像及文本问题,输出仍然是文本答案;中间新增的是潜在视觉思维 token,而不是必须呈现给用户的图像或文字解释。 框架以 Qwen2.5-VL-7B-Instruct 为基座,使用四个推理步骤,每步四个特殊 token,总计 16 个潜在 token。 训练侧通过“内生自蒸馏”为这些 token 提供视觉目标,模型侧用“渐进潜在视觉思维”组织中间状态,再由“距离加权多样性约束”抑制跨步坍塌。 推理时只对输入图像进行一次视觉编码,之后依靠学到的潜在状态完成推导并输出答案,不再逐步生成辅助图像或执行视觉工具。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        Aux["训练辅助图像序列"] --> Teacher["内生自蒸馏"]
        Teacher -.->|训练特征监督| Thoughts["渐进潜在视觉思维"]
        Input["输入图像与问题"] --> Thoughts
        Thoughts --> Answer["文本答案"]
        Thoughts -.->|训练状态质心| Diversity["距离加权多样性约束"]
        Diversity -.->|训练正则化| Thoughts

图中虚线表示训练监督或正则化关系,不是推理时再调用教师、分割器或评价器。 辅助图像也不是测试时提供的正确答案图;模型需要从原始输入中学会预测相应的潜在视觉信息。 下面先解释监督如何落到潜在 token 上,再解释四步分别承载什么,以及为何还需要跨步约束。

关键设计

1. 内生自蒸馏:用同一视觉空间监督压缩后的中间状态

缺少中间“思考图像”标注,是训练潜在视觉推理的直接障碍。 作者为每个训练样本程序化合成四张辅助图像,例如根据目标框裁剪图像,或根据目标信息生成隔离对象的视图。 这些操作的角色是构造可核对的视觉轨迹,而不是让模型在推理时运行一段程序。 随后,冻结的原生视觉编码器分别编码辅助图像,得到每一步的教师特征序列。 采用同一编码器的理由是,学生最终依赖的输入视觉空间与监督目标更一致,避免再去适配一个外部模型偏好的纹理、语义或重建空间。

学生端每步只有四个 token,教师端每张辅助图像却有长度为 \(L\) 的视觉序列,两者不能直接逐位置做匹配。 作者先对全部潜在 token 的隐藏状态做线性投影和归一化,再以它们作为一次交叉注意力的 key 与 value。 可学习查询原本对应单张图像长度,再扩展到四张图像的总长度;注意力输出据此拆成四段,与各步教师特征进行均方误差对齐。 这一解码头是在训练时把压缩状态展开为可比较的监督表示,并不等同于生成辅助图像的像素。 尤其要注意,原文 §3.3 明确说所有查询都能访问同一组压缩潜在 token,并非每个教师步骤只允许读取对应的四个学生 token。 因此特征重建可以利用整条链的信息,而“每组 token 都已独立学到指定操作”不能仅凭重建目标就被保证。

2. 渐进潜在视觉思维:为四组 token 指定有顺序的视觉任务

空间任务采用从粗到细的因果链,概括为 Locate、Focus、Isolate,但实际训练包含四个状态。 第一步 Grid View 给图像叠加空间网格,先建立位置参照;第二步 Bounding Box 指出相关目标区域,完成定位。 第三步 Crop 放大并检查目标区域,减少无关背景;第四步 Segmentation 用对象边界隔离目标,避免把相邻表面误认为目标本身。 这四步不是四种等价的数据增强:它们分别强调全局参照、区域选择、局部细节与对象边界。 把最后的精确目标拆成逐步收紧的视觉证据,是作者希望优于单步预测的关键。

拼图类任务则使用辩证推理链,概括为 Hypothesize、Critique、Verify,同样落实为四种视觉操作。 第一步增强边缘以观察可能对接的轮廓;第二步以箭头展示候选移动方向;第三步构造合理但错误的拼接状态;第四步展示正确组装结果。 第三步的反事实样本很重要,因为只展示正确结果不能直接教会模型区分细微错位与真正吻合。 不过,这是一种训练轨迹设计,并不意味着部署时额外运行一个搜索器,枚举候选拼图并进行显式回溯。 论文没有在所提供正文中详细交代任意新问题如何自动选择两种范式,因而不应把它描述为已经验证的通用动态路由系统。

两种轨迹都用四组特殊 token 表示,组内 token 可以共同编码一个中间视觉状态。 16 个 token 是论文的固定实验配置,不是根据问题难度自适应选择的思考预算。 这种设置让状态间比较和监督都很直接,但也把轨迹长度与可用视觉操作限制在预定义结构里。 “潜在思维”在此应理解为被训练目标约束的隐藏表示,不应直接等同于可读、忠实的自然语言推理证据。

3. 距离加权多样性约束:保留邻近步骤的共享信息,拉开远距离状态

仅有视觉重建损失时,连续步骤可能都依赖共同的全局信息,后面几组 token 变得高度相似。 作者先对每一步的 token 求质心,再比较不同步骤质心的余弦相似度。 简单的间隔式多样性损失允许一定程度的共享,只惩罚超过可学习阈值的相似性;阈值初始值为 0.8。 但若对所有步骤对采用同样惩罚,裁剪与分割这些本来应共享对象外观的相邻状态,也可能被拉得过远。

距离加权版本因此按照步骤下标距离分配惩罚:邻近状态弱一些,远距离状态强一些。 原文将距离定义为 \(d(i,j)=|i-j|\),最大距离为 \(K-1\),最小权重设为 0.1。 可学习的陡峭度参数限制为至少 1,用来调整权重随距离增加的形状。 对于空间链,全局网格与最终分割应明显不同,而目标框与裁剪仍可以保留共同视觉线索。 这比要求所有状态正交更符合渐进视觉操作的关系,也给“多走一步应该带来什么”提供了具体训练信号。 缓存中的式 (7) 至式 (9) 运算符与指数存在损坏,因此这里仅陈述正文可确认的阈值、距离和作用方向,不猜补完整损失公式。

一个完整示例

以论文图 1 的“电视放在哪件家具上”为例,最终答案是 Cabinet,而不是画面中同样带木纹的地板。 在空间轨迹训练中,网格视图先保留电视与周围环境的位置关系,目标框再标出相关家具区域。 裁剪视图让模型集中检查柜体,分割视图则进一步强调柜体边界与地板的区别。 四张视图经冻结编码器变成教师特征,由交叉注意力重建头监督那 16 个潜在 token。 多样性约束阻止后面几个状态继续复制最初的全局表示,但允许框选与裁剪保留相同家具的特征。 测试时,模型只接收原图与问题,不会收到这四张目标视图;它用已学到的潜在链来生成 Cabinet。 这一例子说明作者希望模型内化的操作含义,而不是声称每个测试样本都有经过逐步人工验证的内部轨迹。

损失函数 / 训练策略

总体训练目标由答案的语言建模交叉熵、视觉蒸馏损失和多样性正则化组成。 根据 §3.5 对三个分量及权重的文字说明,可将总目标写为:

\[ \mathcal{L}=\mathcal{L}_{\mathrm{LM}}+1.0\mathcal{L}_{\mathrm{distill}}+0.2\mathcal{L}_{\mathrm{div}}. \]

训练先做潜在锚点初始化:冻结视觉编码器与语言模型骨干,只训练特殊思维 token 的嵌入,让它们先进入合适的语义空间。 第二阶段加入内生知识蒸馏,优先学习重建目标视觉特征,暂不施加多样性约束。 第三阶段引入距离加权多样性损失,在已有重建能力上分化不同步骤,而不是一开始就要求尚未形成语义的状态彼此分离。 第四阶段联合一般视觉问答数据训练,减少专门学习视觉推理后对通用指令能力的遗忘。 教师视觉编码器不接收梯度;正文未完整列出后续各阶段骨干解冻范围、训练样本数量及课程时长,不能据阶段名称补写实现细节。 实验使用 2 张 NVIDIA H20;作者报告约 28 GPU-hours 的训练成本,但未在正文中提供足够细节来复现全部成本口径。

实验关键数据

主实验

下表摘录原文表 1(第 10 页),指标均为准确率(%),基座为 Qwen2.5-VL-7B-Instruct;BLINK-J 指 BLINK-Jigsaw。 保留各任务成绩而不重新命名为统一综合指标,避免把不同类型的评测混为同一种能力。

方法 MMVP VisPuzzle VStar ChartQA BLINK CV-Bench BLINK-J
Qwen2.5-VL-Instruct 77.33 34.75 76.44 78.45 54.49 73.61 59.33
CoT SFT 77.66 69.75 75.91 75.83 56.54 64.55 68.66
One-step Latent Pred. 79.33 72.00 78.01 63.02 56.28 76.10 66.00
ProLaViT (Base) 78.00 74.00 79.05 76.18 57.49 77.24 71.33
ProLaViT (Full) 79.00 74.25 80.11 78.99 57.23 77.66 76.00

Full 相比单步预测的 ChartQA 从 63.02% 增至 78.99%,提高 15.97 个百分点;BLINK-J 从 66.00% 增至 76.00%,提高 10.00 个百分点。 这并不是逐项全面胜出:单步预测的 MMVP 为 79.33%,高于 Full 的 79.00%;Base 的 BLINK 为 57.49%,也高于 Full 的 57.23%。 原文表 1 将 Full 的 Avg. 写为 75.11%,但七个展示值的简单算术平均约为 74.75%,且未说明另一个加权口径。 因此 75.11% 只能视为原文报告值,不能当作已由表内数字复核的平均值;此处不擅自替换源表数值。

消融实验

下表为原文表 3(第 13 页),在渐进潜在结构下比较多样性损失,指标为准确率(%)。 这一表的 Avg. 仅覆盖所列四项,不能直接与表 1 的七列结果比较。

配置 VisPuzzle VStar ChartQA BLINK-J Avg.
无多样性损失 74.00 79.05 76.18 71.33 75.14
间隔式约束,无距离权重 75.25 79.05 75.66 67.33 74.32
距离加权约束,Full 74.25 80.11 78.99 76.00 77.34

相对于无多样性约束,统一间隔惩罚使 BLINK-J 下降 4.00 个百分点,而距离加权版本提高 4.67 个百分点。 VisPuzzle 上间隔式约束却达到最高的 75.25%,说明距离加权改善的是总体表现,并非对任何任务都最优。 另据表 5(第 14 页),随机打乱步骤顺序使 CV-Bench 从 77.66% 降至 69.14%,支持操作顺序有用,但本身不是对潜在链忠实性的完整证明。

关键发现

原文表 6(第 15 页)比较显式工具调用与潜在蒸馏;延迟及计算量列按基座归一化,不能把数值直接读成秒或未经归一化的绝对 TFLOPs。

方法 VStar 准确率(%) BLINK-J 准确率(%) 相对延迟 相对计算量
Qwen2.5-VL (Base) 76.44 59.33 1.00× 1.00
Explicit Tool-Use SFT 79.60 74.00 3.40× 2.17
ProLaViT 80.11 76.00 1.21× 1.12

效率优势来自避免逐步重新编码辅助图像,而不是完全取消额外推理:相比基座,ProLaViT 仍增加 21% 延迟和 12% 计算量。 表 4(第 14 页)还显示,原生教师的 VisPuzzle 为 74.25%,DINOv2 为 73.75%,SDXL-VAE 为 45.50%;教师表示适配性比单纯增加外部视觉模型更重要。

亮点与洞察

  • 监督的是“视觉状态如何变化”,而不只是最终答案。可编程操作因而成为训练中间表示的资源,而不必成为部署时的依赖。
  • 多样性正则化不应无差别地追求去相关。本文把步骤关系写进惩罚强弱,提示有序状态学习应保留局部连续性。
  • 原生教师使学生无需跨越另一个专家的特征空间。表 4 的差异支持这一选择,但不能证明所有外部教师都必然较差。

局限与展望

  • 作者明确把当前范围限定在静态图像的空间与逻辑推理,视频时序推理和复杂几何变换仍属于后续方向。
  • 四步模板依赖可合成的操作与目标信息;给定正文把详细合成实现指向补充材料,未说明所有真实场景中的目标框、掩码如何获得。
  • 读者判断:质心差异与相似度热图能支持“不完全坍塌”,却不能单独证明每一步具有真实因果作用;尤其训练解码头允许跨组读取信息。
  • 文本轨迹对照能提示潜在表示的收益,但正文 §4.4 的平均值口径未充分交代;不宜沿用作者“收益纯粹来自连续空间”的强因果表述。
  • 公式抽取损坏、表 1 平均值不一致,以及缺少重复实验方差信息,限制了精确复现与统计可靠性判断;本笔记没有用猜测补齐这些缺口。

相关工作与启发

  • 与 CoT SFT 相比:文字推理把视觉信息压入离散语言;ProLaViT 增加受视觉特征监督的连续状态,但不提供同等可直接阅读的推理文本。
  • 与 LVR、Mirage 相比:本文强调显式定义的多步操作轨迹与距离感知约束,而不是只证明视觉潜在 token 可以帮助推理。
  • 与 CoVT 相比:区别在于教师来源和轨迹结构;本文使用冻结的原生编码器,减少外部专家的依赖,而非取消视觉监督。
  • 与 ThinkMorph 等显式视觉生成相比:本文避免推理时的像素级中间输出,效率较高,但也失去了直接查看生成中间图像这一观察窗口。
  • 可延伸问题:在相同 token 预算下逐组遮蔽或交换潜在状态,再测答案变化,可以更直接检查“定位、聚焦、隔离”是否真的具有分工;这是研究建议,不是本文已完成实验。

评分

  • 新颖性:4/5。将操作轨迹、原生自蒸馏与距离感知正则化结合,重点在结构设计而非提出全新骨干。
  • 实验充分度:3/5。包含结构、教师、顺序和工具效率对照,但平均值口径与复现细节仍有缺口。
  • 写作质量:3/5。方法意图清楚,但强因果措辞超出部分证据,且当前缓存无法可靠恢复所有公式。
  • 价值:4/5。为低开销视觉推理提供了可借鉴的训练方案,尤其适合有明确中间视觉操作的任务。