跳转至

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4776
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/7421.pdf
代码: https://github.com/hulianyuyy/CoLT
领域: 多模态推理
关键词: 潜在思维链、前向解码、后向对齐、步级监督、推理加速

一句话总结

CoLT 用训练期的前向文本解码、后向语义对齐和相邻状态预测,把多模态文本推理压进默认 3 个连续潜在状态,在八项基准上取得 79.1 的平均得分,并在单张 H200 的 MMStar 测试中相对文本 CoT 实现约 10.1 倍端到端加速。

研究背景与动机

视觉问答中的文本思维链有一个直接的成本:模型不仅要识别图像、得出答案,还要逐 token 写出解释。即使最终只需一个数字,中间描述图表、定位证据和计算的文字仍然占用自回归解码时间。本文的 MMStar 对照中,文本 CoT 平均产生 142.1 个推理 token,生成阶段耗时 7.24 秒,远高于 0.47 秒的输入编码。因而真正需要压缩的是推理的表达过程,而不只是图像输入。

CoCoNut、CODI 等方法让模型在连续隐空间里思考,但只把文本 token 换成向量,并不保证这些向量保存了逐步推进的语义。只看最终答案的监督无法明确指出中间哪一步出了问题,潜在状态可能退化为难以解释的表示。另一类潜在视觉推理方法以额外中间图像提供监督,却又需要辅助视觉标注。CoLT 选择复用已有文本 CoT:文字不必在部署时生成,但可以在训练时检查隐状态是否包含推理信息。

核心 idea:将文本推理作为训练期可撤除的语义约束,用双向解码监督约束潜在状态的内容,再用内部预测约束相邻状态的衔接,使部署时只需短潜在链和最终答案生成。

方法详解

整体框架

输入是图像和文本问题,视觉编码器先生成视觉 token,再与问题一起送入 Qwen3-VL-8B-Instruct。主干连续产生默认 3 个潜在思维状态,每个状态都作为下一位置的输入嵌入,最终答案可以关注整条潜在链,而不是只依赖最后一个向量。

训练分两阶段:先利用文本 CoT 做监督微调,加入双向外部解码器和内部预测头;随后用 GRPO 进行结果奖励优化,此时撤除这些辅助约束。正常推理只保留主干,固定完成设定的潜在步数后生成答案;论文没有提出自适应停止判据。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["图像与问题"] --> Latent["连续状态回馈"]
    Latent --> Answer["最终答案生成"]
    Latent --> External["双向外部解码监督"]
    Text["训练用文本 CoT"] --> External
    Latent --> Internal["内部相邻状态预测"]
    External --> Training["先约束后释放训练"]
    Internal --> Training
    Answer --> Training
    Training --> Deploy["部署:仅主干<br/>潜在链与答案"]

图中的解码监督和相邻状态预测是并行训练分支,不是推理时串行调用的额外模型。文本 CoT 也仅在训练中提供目标,测试时不需要参考答案、教师推理或辅助中间图像。

关键设计

1. 连续状态回馈:一个潜在位置承载一段推理内容

普通语言生成会把最后一层隐状态映射到词表,选取一个离散 token,再把对应词嵌入送回模型。CoLT 在潜在推理位置跳过这个离散选择,直接把最后一层隐状态回馈为下一位置的输入嵌入。自注意力仍保留对图像、问题及此前全部潜在状态的访问,因此它没有取消自回归计算,只是把许多文本生成位置压成少量连续位置。论文说明不扩充词表,也不引入新的特殊 token。

训练文本被动态切分为 \(K\) 段,为各潜在步骤提供语义目标;默认 \(K=3\)。这意味着一个状态承载的是一段推理的压缩表示,而不是一个可直接读出的词。论文同时以逻辑步骤和连续文本切分描述这一过程,但没有在缓存中给出完整的边界选择算法;不能据此假定一定使用句号切分,也不能把所有样本解释成恰好三个自然语言逻辑步骤。潜在表示“能保留多种路径”是作者的解释,不等同于显式枚举或执行多分支搜索。

2. 双向外部解码监督:既检查可生成的语义,也学习文本到潜态的对应

外部解码器采用 Qwen3-0.6B,与主干使用相同 tokenizer 和词表。前向模式以已有潜在状态为条件,自回归预测下一段文本推理,并计算目标文本的负对数似然。关键不在于把答案再预测一遍,而在于要求压缩状态仍能支持下一步推理内容的展开。解码器损失通过潜在状态反向传播到主干,让中间向量获得比“最终答案对不对”更细粒度的训练信号。

后向模式则输入前一段文本推理,取解码器末层隐状态,与对应主干潜在状态做归一化后的方向对齐。这里的“后向”指文本到潜态的映射,不是从最终答案反推整条推理链。一个重要细节是主干潜在状态作为 stop-gradient 目标:此项损失直接训练的是解码器侧,而不是把主干状态强行拉向一个可能退化的解码器输出。由于同一个解码器还参与前向训练,这种共享形成间接耦合;不应把三项损失都说成直接更新同一潜在向量。缓存中后向损失的范数与幂次抽取不完整,因此不补写其精确代数形式。

3. 内部相邻状态预测:约束的是状态之间的可预测性

即使每个潜在状态分别能够解码出合理文本,相邻状态仍可能互不衔接。作者添加一个带 GELU 的两层 MLP,从当前潜态预测下一潜态,并使用余弦距离,使链条中的相邻表示形成可学习的过渡关系。它不是另一个答案分类器,也不要求相邻状态完全相同,而是允许 MLP 学习两者之间的变换。

按正文定义及式(9)可辨内容整理,内部损失为:

\[ \mathcal L_{\mathrm{int}}= \frac{1}{K-1}\sum_{k=1}^{K-1} \left[1-\frac{f_\theta(\mathbf h_k)^{\mathsf T}\operatorname{sg}(\mathbf h_{k+1})} {\|f_\theta(\mathbf h_k)\|_2\,\|\operatorname{sg}(\mathbf h_{k+1})\|_2}\right]. \]

其中 \(\operatorname{sg}\) 表示停止梯度:目标分支不因这项对齐而移动,预测头和当前状态分支则接受训练。作者将此解释为降低表示坍塌风险,但它并不是数学上保证不坍塌的证明。另一个实现边界是 \(K=1\) 时没有相邻状态对,上式不能直接计算;论文虽报告单步实验,缓存未说明代码如何处理这一分支。

4. 先约束后释放训练:用监督建立结构,再让结果奖励调整潜在策略

第一阶段同时训练主干的语言模型部分和外部解码器,让答案预测、文本对应和状态过渡共同塑造潜在链。第二阶段在 50K 个 CoT 样本上使用 GRPO,不再保留外部解码损失和内部预测约束,只由结果奖励驱动优化。这个安排的意图是先避免无约束潜在空间训练不稳定,再允许模型超出教师文本划定的中间轨迹。

部署时外部解码器和预测头全部移除,所以“小解码器”影响的是训练成本,不是每次问答的部署成本。定性分析时作者可以重新使用前向解码器读出潜态内容,但这属于解释性分析,不能计入默认低延迟推理流程。论文没有独立给出 GRPO 阶段带来的增益,也未充分说明连续状态如何接入策略概率计算,不能仅凭方法名称补出具体策略梯度实现。

一个完整示例

论文图 2 的 MathVista 位值题问图中积木表示哪个数。其解码文本识别出 9 个千位大块、5 个百位板、6 根十位条和 7 个个位块,对应 \(9000+500+60+7=9567\),最终回答 9567。

在 CoLT 的正常运行中,主干先编码这张图与问题,再连续执行设定的 3 个潜在位置,最后输出数字。只有做解释性分析时,才把这些潜态交给前向解码器读成“识别位值组成、计算各部分、求和”这样的文字。缓存丢失了原图的颜色分段,无法准确恢复每个状态对应哪一句,因此这里不把上述内容强行分配给第 1、2、3 步。这个例子展示可解码的推理内容,但不证明解码文字完整揭示了模型作答的因果过程。

损失函数 / 训练策略

按正文对式(10)的说明,监督阶段目标整理为:

\[ \mathcal L=\mathcal L_{\mathrm{task}} +\alpha\mathcal L_{\mathrm{fwd}} +\beta\mathcal L_{\mathrm{bwd}} +\gamma\mathcal L_{\mathrm{int}}, \qquad \alpha=\beta=\gamma=0.2. \]

任务损失是以输入和潜在链为条件的最终答案 next-token 负对数似然;前向项监督文本推理,后向项做方向对齐,内部项预测相邻状态。缓存部分公式的符号被 PDF 抽取打乱,上面只整理能够由正文核对的目标,不恢复损坏的后向距离细节。

实现使用 OneThinker 的图像子集进行 1 个 epoch 的训练,AdamW、余弦学习率调度、batch size 8,默认潜在步数为 3;随后执行前述 50K 样本的 GRPO 阶段。缓存未列出具体学习率、GRPO 分组大小、奖励函数和完整训练耗时,也未充分说明不同模型隐层维度的适配方式。相同词表并不自动保证两个模型隐状态维度相同,因此“无需投影即可对齐”的实现需要进一步查代码,而本笔记不把它补写为已验证事实。

实验关键数据

主实验

下表摘录原表 1 的同主干对照,数值沿用论文百分制得分,越高越好;各基准有各自评测协议,Avg. 是论文汇总分,不是跨所有样本合并计算的准确率。最后一列由显示数值相减,单位为分数点。

基准 SIM-CoT Qwen3-VL 文本推理 CoLT 相对文本推理增益
SeedBench 72.4 76.4 77.5 +1.1
MMBench 82.0 83.4 84.6 +1.2
ChartQA 66.7 65.1 74.7 +9.6
TextVQA 70.2 75.2 81.3 +6.1
ScienceQA 90.8 91.8 92.8 +1.0
MMStar 65.6 67.1 68.9 +1.8
AI2D 82.0 83.6 85.4 +1.8
MMT-Bench 62.4 63.3 67.4 +4.1
Avg.(论文报告) 74.0 75.7 79.1 +3.4

主表把平均提升印为 +3.3,而正文写 +3.4;按已经四舍五入的均值相减得到 \(79.1-75.7=3.4\)。逐项得分先求平均再相减的舍入口径可能不同,本笔记保留原均值并明确计算口径,不把两种写法混用。相对 SIM-CoT 的平均增益为 5.1 个分数点,但不能外推为超越所有开源模型:例如原表的 InternVL3 在 ChartQA 上为 86.6,高于 CoLT 的 74.7。

消融实验

原表 2 使用 SeedBench、MMStar、AI2D、MMT 四项子集;以下均值不能与主表八项 Avg. 直接比较。“无辅助监督”仍保留任务学习,不表示未经训练。

前向解码 后向对齐 内部预测 四项 Avg.
关闭 关闭 关闭 61.4
开启 关闭 关闭 65.8
关闭 开启 关闭 67.2
关闭 关闭 开启 63.6
开启 开启 关闭 69.8
开启 关闭 开启 68.1
关闭 开启 开启 69.1
开启 开启 开启 72.6

移除后向对齐使完整模型从 72.6 降至 68.1,下降 4.5 个分数点;移除前向解码和内部预测分别下降 3.5 和 2.8 个分数点。这支持三项监督互补,但消融全开行的逐项分数也低于主表同名基准,缓存没有清楚交代是否由于 RL 阶段或其他设置不同,不能擅自把差值归因给 GRPO。

关键发现

  • 步数不是越多越好。 原表 4 中 \(K=1,2,3,4,6,8\) 的四项均值依次为 66.8、70.3、72.6、72.2、71.7、71.2;训练和测试同为 3 步时最好,增加潜在计算并不自动增加推理能力。
  • 轻量解码器已提供主要收益。 原表 3 中,0.6B、1.7B、4B、8B 解码器的四项均值为 72.6、72.9、73.1、73.2。规模大幅增加只换来有限收益,但论文未给出对应训练成本,不能据此精确计算性价比。
  • 抗噪结果不等于机制证明。 原表 6 在 MMStar 的 30% 遮挡条件下报告 Direct Answer、Text CoT、CoLT 的准确率下降量分别为 19.0、13.8、9.0,按原表百分数口径记录。它支持该设置下更稳健,但没有直接证明增益来自多路径搜索。

速度结果摘自原表 7,同为 Qwen3-VL-8B、单张 H200、逐样本平均;“推理位置”对文本方法指文本 token,对 CoLT 指连续潜在状态,不是最终答案的 token 数。

基准 方法 推理位置数 编码时间(秒) 生成时间(秒) 得分
MMStar Direct Answer 0 0.45 0.14 58.6
MMStar Text CoT 142.1 0.47 7.24 67.1
MMStar CoLT 3 0.44 0.32 68.9
MMT-Bench Direct Answer 0 0.46 0.15 55.6
MMT-Bench Text CoT 138.5 0.48 7.38 63.3
MMT-Bench CoLT 3 0.45 0.33 67.4

MMStar 生成阶段加速为 \(7.24/0.32\approx22.6\) 倍,端到端为 \((0.47+7.24)/(0.44+0.32)\approx10.1\) 倍。CoLT 仍比直接回答慢,优势是相对文本 CoT 的推理质量与延迟组合,而不是所有策略中绝对最快。原表 7 标题写 MMStar 和 SeedBench,但列名与实验正文写 MMStar 和 MMT-Bench,此处按后两者标注并保留这一来源差异。

亮点与洞察

  • 把解释能力放在训练侧。 解码器要求潜态可承载文本语义,部署却不必支付生成解释的成本。这适用于最终只需简短答案、但训练期拥有详细过程标注的任务。
  • 内容监督与过渡监督各管一层。 外部解码约束状态里有什么,内部预测约束状态如何衔接。消融比单看最终精度更能说明二者并不完全重合。
  • 理解梯度方向比记住“三个损失”更重要。 后向项停止主干目标梯度,不能简单理解为文本教师直接蒸馏学生;共享解码器的耦合才是值得复用和进一步验证的机制。

局限与展望

  • 仍依赖文本过程数据。 不需要辅助中间图像,不等于不需要额外监督;CoT 质量和动态切分方式仍可能决定潜态学到什么。
  • 适用范围与成本证据有限。 实验主要基于一个 8B 主干和图像任务,未验证长视频、其他模型家族或更长多轮任务;推理加速也不能替代训练成本、显存或吞吐量评估。
  • 复现细节有缺口。 隐层维度适配、单步内部损失处理、GRPO 的策略定义以及主实验与消融设置差异都需进一步核实;本文缓存无法支持补全这些实现。
  • 跨步数鲁棒性表述偏强。 原表 5 的 MMStar 中,训练 3 步、测试 1 步由 66.5 降到 61.0,并非所有步数不匹配都只造成轻微损失。自适应步数是作者提出的未来方向,不是当前已经验证的机制。
  • 可解码不等于忠实解释。 定性示例未包含因果干预或系统失败率分析。后续可结合潜态干预、错误链诊断,以及作者提出的潜态与文本混合推理,检验模型何时需要显式文字校正。

相关工作与启发

  • 与 CoCoNut、CODI 对比: 都尝试从离散文本转向连续推理;CoLT 的重点是多模态任务中的逐步监督,以及前向、后向、内部三种信号的组合,而非首次提出潜在思维链。
  • 与 SIM-CoT 对比: 两者都有辅助解码器和步级监督,因此不能将“用解码器解释潜态”本身当成全部创新。CoLT 更值得关注的是额外的后向语义对应和相邻状态预测是否提供独立增益。
  • 与 LVR、MoNet 对比: 这些方法利用辅助图像特征约束潜在视觉推理;CoLT 以文本过程替代这种中间视觉监督。代价是解释更依赖文本所表达的语义,不能直接推断其更擅长保留细粒度空间信息。
  • 可迁移的研究问题: 将现有过程标注用于训练一个可撤除的检查器,同时分别评估信息保真、状态过渡和部署成本。下一步应优先分离 SFT 与 RL 的贡献,而不只是继续增加潜在步数。

评分

  • 新颖性:4/5。三路监督组合和多模态应用有明确价值,但潜在链与辅助解码器已有先例。
  • 实验充分度:4/5。八项主测试、监督组合、步数、解码器、抗噪与速度分析较全面,但缺少独立 RL 消融及重复实验不确定性。
  • 写作质量:3/5。主线清晰,部分表格口径、跨步数结论和实现细节仍需澄清,缓存还有公式抽取缺损。
  • 价值:4/5。展示了短潜在链压低文本推理延迟的实际潜力,但应在补齐复现与跨模型验证后再判断部署收益。