跳转至

Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens

会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4447
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/5952.pdf
领域: 视觉语言模型推理
关键词: 连续视觉令牌、视觉思维链、感知蒸馏、深度估计、实例分割

一句话总结

CoVT 让 VLM 在回答前生成受分割、深度和语义专家监督的连续视觉 token,用 16 个潜在感知状态代替单纯文字化的中间观察,在 Qwen2.5-VL-7B 上将 CV-Bench 从 74.5 提至 80.0,其中深度子任务提高 14.0 个百分点。

研究背景与动机

视觉语言模型能组织流畅的解释,却未必真正辨清图像中的实例、边界和前后关系。文字思维链可以把“先识别物体,再判断距离”写得很完整,但如果第一步把物体位置看错,后面的推理只是沿着错误继续展开。这里的问题不是完全没有视觉编码,而是回答端主要接受文字监督,缺少直接约束中间状态保留深度、轮廓和区域结构的机制。

外部视觉工具能够提供分割图或深度图,但增加了运行与调度成本;把这些结果再描述成文字,也可能丢掉需要精确比较的空间细节。本文因此不把重点放在生成更长的解释,而是让推理序列本身包含能够承载感知信息的连续向量。与无监督的“思考占位符”不同,这些向量必须通过专门的解码路径重建视觉专家提供的目标,不能仅仅学会延长答案前的序列。

这也带来一个训练难题:模型既要读懂新的视觉 token,又要能生成它们,最后还要让答案真正利用这些状态。核心 idea:用密集视觉任务给少量连续 token 赋予感知语义,再通过“理解、生成、推理、灵活使用”的四阶段课程,把专家能力内化到 VLM 的视觉思维链中。

方法详解

整体框架

输入仍是图像和问题,输出仍是文字答案;变化发生在中间推理序列。CoVT 将文字与连续视觉 token 交错生成,后续答案以这些状态为条件。训练时,视觉 token 经过可训练投影和专家相关的解码路径,接受分割、深度、边缘或 DINO 特征监督;常规推理时可以跳过这些密集输出,只保留潜在视觉思考。

下图概括训练到部署的关系:专家信号负责塑造 token,而不是在每次回答时作为外部工具返回结果。主配置使用分割、深度、DINO 三类共 16 个 token;加入边缘后是四类共 20 个。论文表中的“3 Visual Tokens”指三类,不是总共三个向量。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["图像与问题"] --> Tokens["紧凑视觉思考槽"]
    Experts["SAM / 深度 / 边缘<br/>DINO 专家信号"] --> Align["按感知粒度对齐"]
    Tokens --> Align
    Align --> Curriculum["四阶段视觉课程"]
    Curriculum --> Latent["潜在推理与可选解码"]
    Latent --> Answer["文字答案"]
    Latent -->|需要可视化时| Maps["掩码 / 深度 / 边缘"]

关键设计

1. 紧凑视觉思考槽:让中间状态保留不同种类的感知信息

CoVT 沿用自回归序列框架,但序列中的状态不再都对应离散文字。分割 token 负责实例位置、形状和二维布局,深度 token 负责像素级远近关系,边缘 token 负责轮廓与细小结构,DINO token 则承载 patch 级语义表示。它们并不是把预测深度值写成一句话,而是作为连续向量参与后续答案生成;推理时不需要先把向量还原成图像,再重新送入 VLM。

具体预算是 8 个分割 token、4 个深度 token、4 个 DINO token,可额外加入 4 个边缘 token。三类主配置已经覆盖区域、几何和语义,边缘作为补充并不保证所有任务都受益。这里的紧凑性来自“少量可解码的潜在状态”,不意味着这些 token 独自存储了原图全部信息:训练解码路径还会利用专家编码器的密集特征。

2. 按感知粒度对齐:任务型专家走解码器,表征型专家对齐特征

如果直接把所有专家都当作特征向量做 MSE 对齐,就忽略了分割与深度真正关心的输出结构。CoVT 的投影层包含一层多头注意力和两层全连接层。对任务型专家,它把 token 投到能控制任务解码的提示空间;对 DINOv2 这样的表征模型,则投影到 patch 特征的形状后做特征匹配。这是同一 token 框架内部的两种监督接口,而不是让四种专家共享一个不加区别的目标。

分割分支沿用 LISA 式接口:每个分割 token 作为 SAM 解码器的一个提示,与 SAM 编码器的密集图像特征一起生成一个掩码。8 个 token 产生 8 个掩码,训练时通过匈牙利匹配对应目标掩码,再用 Dice 与 focal loss 监督。匹配避免把 token 的输出顺序误当作实例的固定编号;“8 个掩码”也不应被误解为模型计数答案最多只能是 8。

深度分支把 4 个 token 分别作为提示,与 DepthAnything v2 的中间层密集特征进行批量矩阵乘法交互,并通过 softmax 相关运算重建深度图;四路预测取平均,以 L1 损失对齐目标。边缘分支则把 4 个 token 当作作用在 PIDINet 密集特征上的 \(1\times1\) 卷积核,得到四张边缘图,平均后同样使用 L1 损失。二者都要求 token 对空间输出产生实际作用,而不只是接近某个全局图像嵌入。

DINO 分支不需要人为定义分割或深度标签:4 个 token 经投影后匹配 DINOv2 的 patch 特征,用 MSE 传递语义与局部表征知识。缓存中的深度公式抽取已损坏,因此这里保留正文可确认的运算与平均关系,不补写 softmax 轴、张量尺寸或未经确认的完整等式。

3. 四阶段视觉课程:先会理解与生成,再学会用视觉状态回答

第一阶段是理解:在输入图像之后加入视觉 token,再要求模型回答原问题,使这些新状态成为模型能够读取的条件。第二阶段是生成:把问题改成请求图像的分割、深度、边缘和 patch 特征,让模型输出相应 token,训练其生成受专家监督的视觉状态。只做第一阶段,不能保证模型会自行产生这些状态;只做第二阶段,也不能保证它们有助于问答。

第三阶段把视觉 token 放进思考部分,再接最终答案,使模型学习从自己生成的感知状态推导回答。第四阶段随机丢弃若干整类视觉 token,丢弃类别数从 0 到类别总数不等,打破固定输出全部专家状态的格式依赖。论文称其为高效推理阶段;需要区分的是,训练时随机丢弃类别有助于灵活使用,但不是已经证明存在最优的、显式的问题条件路由器。

4. 潜在推理与可选解码:把回答路径和观察内部状态的路径分开

完成训练后,模型直接在文字与连续视觉状态组成的链上生成答案,不要求调用 SAM、DepthAnything 或 PIDINet 来获得每个问题的外部工具反馈。只有需要解释时,才把相应 token 送入解码路径,观察掩码、深度或边缘结果。这样既保留可视化接口,又避免把密集预测的生成作为每次问答的硬性前提。

这种可解释性应理解为“中间状态可以关联到感知输出”,不能直接等同于因果忠实的解释。尤其任务解码器还使用专家密集特征,漂亮的可视化并不能单独证明答案只依赖 token 中的信息。本文进一步通过答案与图像特征的相似度、关注区域的可视化提供支持,但这些仍是关联证据。

一个完整示例

论文图 5 中的一个问题询问两个标记点哪一个更靠近相机。基线根据表面上的前景位置给出 A;CoVT 的分割状态定位到 B 所在的人脸区域,深度状态补充该区域与周围场景的远近关系,最终回答 B。若需要检查,分割和深度 token 可以解码成对应的空间输出;不需要检查时,答案直接使用潜在状态生成。

这个例子的重点不是把“B 更近”多说几遍,而是让区域定位与几何关系以两类不同的连续状态进入推理链。它是论文提供的定性案例,不应据此推广为所有两点深度问题都能解决,也不应编造像素深度数值。

损失函数 / 训练策略

联合目标包含文字交叉熵,以及各视觉任务损失的加权和。依据第 3.4 节文字,可将目标概括为下式;这是对损坏公式的结构性转述,不是逐符号复原原式:

\[ \mathcal{L}_{\mathrm{total}} =\mathcal{L}_{\mathrm{CE}}+ \gamma\sum_{t\in\{\mathrm{seg},\mathrm{depth},\mathrm{edge},\mathrm{dino}\}} \lambda_t\mathcal{L}_t. \]

只对当前配置启用的视觉任务求和;分割为 Dice 与 focal,深度和边缘为 L1,DINO 为 MSE。原文将 \(\gamma\) 与各 \(\lambda\) 均设为 1。正文的这些描述优先于图 3 中笼统的 CE 标注,不能把全部视觉分支都写成交叉熵训练。

主骨干是 Qwen2.5-VL-7B,采用 LoRA,rank 为 16、alpha 为 32;LoRA 学习率为 \(5\times10^{-5}\),投影层学习率为 \(10^{-5}\)。四阶段分别训练 4,000、3,000、3,000、5,000 步,batch size 为 4,硬件为 1 张 A100 或 4 张 A6000。投影层可训练,标准视觉编码器在方法的基础设定中冻结。

训练数据来自 LLaVA-OneVision 的视觉中心/真实场景子集,以及 TallyQA、ADE20K-Depth 空间感知数据。缓存正文未给出各子集精确规模与混合比例,也没有完整说明连续状态回馈、起止判定及全部专家参数的冻结细节,因此这些复现参数不能自行补齐。评测使用 VLMEvalKit。

实验关键数据

主实验

下表摘录原文表 2、3。分数按原表报告,增量为两者相减的百分点,不是相对百分比;CoVT 主配置为分割 8、深度 4、DINO 4,共 16 个 token。

评测 Qwen2.5-VL-7B CoVT 三类 提升(百分点)
CV-Bench 总分 74.5 80.0 +5.5
CV-Bench Count 65.0 66.2 +1.2
CV-Bench Depth 72.8 86.8 +14.0
CV-Bench Distance 75.5 82.5 +7.0
MME-RealWorld 60.0 63.7 +3.7
BLINK 55.7 56.0 +0.3
RealWorldQA 68.6 71.6 +3.0
MMStar-P 67.1 69.2 +2.1
MMVP 56.0 58.7 +2.7
HRBench4K 68.6 72.9 +4.3
HRBench8K 64.9 69.4 +4.5

MMStar-P 仅包含粗粒度感知、细粒度感知与实例推理子集,不能当作完整 MMStar 分数。结果最强的是深度与距离,计数与 BLINK 的提升明显更小;“提高视觉推理”不意味着所有视觉能力同幅度增长。

消融实验

下表来自原文表 5。分割 token 为 1、8、32 时,深度与 DINO 各固定为 4;0 token 指在相同训练数据上直接微调,不是上表未进行该微调的原始基线。“16 empty”指 16 个无视觉对齐的普通 token。

配置 CV-Bench BLINK RealWorldQA MMVP HRBench4K
0 token,直接微调 76.6 55.5 70.7 55.3 68.6
16 empty,无视觉对齐 75.7 56.0 70.3 56.7 68.1
1 个分割 token,共 9 个 78.9 55.6 70.8 56.7 73.0
8 个分割 token,共 16 个 80.0 56.0 71.6 58.7 72.9
32 个分割 token,共 40 个 73.9 54.4 68.4 55.3 70.8

完整配置相对直接微调的 CV-Bench 增量是 3.4 个百分点,相对无视觉对齐 token 是 4.3 个百分点。这比只引用对原始骨干的 5.5 点提升更能区分“多看训练数据”和“有视觉监督的中间状态”。不过该对照仍不是视觉监督与潜在链结构的完整因子分解。

下表摘录表 2、3 中三类与四类的对比,用于检验边缘信息是否始终有益。

配置 CV-Bench CV-Bench Depth CV-Bench Distance MMVP HRBench8K
三类,共 16 个 token 80.0 86.8 82.5 58.7 69.4
四类,共 20 个 token 79.8 89.2 80.5 56.7 69.9

关键发现

  • 加入边缘后深度提高 2.4 点,但 CV-Bench 总分降低 0.2 点,MMVP 降低 2.0 点。专家信息互补不等于堆叠专家必然单调增益。
  • 32 个分割 token 比 8 个时的 CV-Bench 低 6.1 点,且低于直接微调;作者推测大量分割 token 更难对齐。表中未给训练方差,不能据此断言退化机制已被证明。
  • LLaVA-v1.5-13B 上也有正向结果:表 4 中 BLINK 相对深度为 CoVT-depth 75.8、复现 Aurora-depth 62.9;这是同骨干的 +12.9 点,不应与 Qwen 主表拼成同一个模型结果。
  • 原文表 6 的 depth 对齐配置在 MMVP/V* 写为 48.7/77.5,而表 3 的对应单深度配置为 58.7/79.1。当前缓存不能消解该不一致,因此不采用“解码器对齐在所有指标都更好”的强结论。

亮点与洞察

  • 监督决定潜在状态的用途。 相同数量的无视觉对齐 token 不能复现增益,说明关键不只是多一些计算位置,而是这些位置被迫承载能解码的视觉信息。
  • 专家不必以在线工具形式存在。 通过训练期的感知接口把能力蒸馏进推理状态,为降低部署时的工具依赖提供了路径;这不等于训练期没有专家成本。
  • 粒度决定对齐接口。 对任务专家监督输出结构、对表征专家监督特征,比统一套用特征 MSE 更符合各自目标。这个原则值得迁移,但具体任务仍需单独验证。

局限与展望

  • 效率证据不足。 论文强调 token 少且通常不解码,但缓存正文没有成体系的端到端延迟、显存或吞吐对照。20 个视觉 token 也不等于整条回答链只有 20 个 token。
  • 监督增益与推理机制尚未完全分离。 直接微调和空 token 对照很有价值,但还需要“相同密集监督、无视觉链”的控制,以及干预或替换视觉 token 的因果实验。
  • 专家知识存在边界。 SAM、单目深度与边缘模型的偏差可能传入潜在状态;本文结果主要支持图像感知问答,不能直接外推到视频、动作规划或医疗部署可靠性。
  • 四阶段与动态选择仍待细化。 正文没有逐阶段移除的完整量化消融,也未给问题难度与 token 选择成本的系统分析。随机类别丢弃是否实现有效自适应,还需要专门评测。
  • 复现与结果报告有缺口。 训练数据比例、连续 token 实现细节未完全展开;部分表格数字不一致,图中细项及公式的缓存抽取也有损坏。本笔记不补齐这些数字;未来应核对原始排版并补充重复实验和置信区间。

相关工作与启发

  • 与文字 CoT 相比:文字 CoT 主要改善符号组织,CoVT 额外约束中间状态中的感知信息。本文的文字 CoT 对照在视觉任务上常退化,但不能推广为文字 CoT 对所有多模态问题都无用。
  • 与 Coconut、CCoT 相比:共同点是使用连续潜在状态;CoVT 的区分点是把这些状态绑定到密集视觉专家目标,而不是仅压缩语言推理或加入潜在计算步骤。
  • 与 LISA 相比:分割 token 到 SAM 解码器的提示接口继承了已有思路,CoVT 将它纳入多类感知 token 与问答课程。创新重心是多专家连续视觉推理框架,而非首次用语言隐状态驱动 SAM。
  • 与 Aurora 相比:Aurora 利用深度、检测等感知信息的 VQ-VAE 潜变量,CoVT 采用连续 token 与按专家粒度设计的对齐。LLaVA 对照支持其跨骨干适用性,但复现结果不应被表述为所有设置下的绝对排名。

评分

  • 新颖性: 4/5。把专家约束的连续视觉状态、多粒度对齐与课程训练结合起来,切中视觉 CoT 的感知瓶颈,但接口与潜在推理均有清晰前作。
  • 实验充分度: 4/5。覆盖多个基准、两种骨干及 token 对照;仍缺运行成本、阶段消融、重复实验与更强的因果隔离。
  • 写作质量: 3/5。整体训练逻辑清楚,但 token 类别与数量容易混淆,部分表格存在不一致,复现细节不够完整。
  • 价值: 4/5。为感知密集型 VLM 问答提供了可迁移的设计思路,但部署效率和解释忠实性还需独立验证。