跳转至

Can Linguistic Reasoning Vectors Enhance Multimodal Reasoning Ability?

会议: NeurIPS2026
arXiv: 2609.31140
领域: 视觉语言模型推理
关键词: 推理向量、激活干预、跨模态迁移、表示匹配、思维链

一句话总结

LIFT 从基础大语言模型中提取“有无推理过程时,同一答案 token 的隐状态差”,将其注入对应视觉语言模型的语言层,在不更新主干的条件下,把两个模型的六任务平均准确率从 66.6/67.8 提升到静态干预的 68.3/69.0,向量适配后达到 69.1/69.4。

研究背景与动机

视觉语言模型(VLM)通常在大语言模型(LLM)上接入视觉编码器和跨模态投影器,再进行多模态训练。语言主干虽然来自已有的 LLM,其原有推理行为却未必完整保留:模型可能正确列出问题关系,但在后续生成中抄错数字、丢掉条件,或者回答了与题目不同的目标。论文观察到,对某些纯文本问题,基础 LLM 比对应 VLM 更可靠。这提出了一个比“继续训练更多推理数据”更具体的问题:基础 LLM 中已有的推理相关表示,能否在 VLM 内重新发挥作用?

现有多模态思维链(CoT)监督、验证和强化学习主要改变目标 VLM 的训练或解码行为。本文选择激活干预,把外显推理带来的内部表示变化压缩为一个可复用方向。不过,直接平均推理文本的隐状态容易混入题目内容、推理长度和输出格式,不能清楚地区分“知道这个答案”与“经过推理后组织这个答案”。作者因此固定问题和最终答案,只改变答案前是否存在推理过程,在相同答案 token 上作比较。

这种比较并不把完整思维链编码成一个可解码的程序,而是用任务级平均差向量作为干预工具,检验其是否能稳定改善后续生成。核心 idea:从基础 LLM 的成功解题样本中提取推理条件引起的答案表示偏移,再将该方向转移到对应 VLM 的语言层;必要时只学习向量本身,而不重训模型主干。

方法详解

整体框架

LIFT 的输入分成两类:离线阶段使用带问题、模型生成推理过程和正确答案的支持样本;推理阶段使用普通文本或图文问题。它先进行答案态差分抽取,再选择直接使用静态向量,或进行可学习向量适配,最后通过选层语言干预改变目标 VLM 的自回归生成。

静态方案没有参数优化,但仍需要支持数据的正确性筛选以及开发集选层,不能称为完全无标签。学习方案也不更新 VLM、视觉编码器或投影器,训练变量只是注入语言层的一条向量。两者都不把支持样本拼进测试提示,推理时仍采用与基线一致的零样本 CoT。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["离线支持样本<br/>问题、推理、正确答案"] --> B["答案态差分抽取"]
    B -->|可学习方案| C["可学习向量适配"]
    B -->|静态方案| D["选层语言干预"]
    C --> D
    E["开发集正确性评估"] -.->|离线选层| D
    F["推理时文本或图文问题"] --> D
    D --> G["生成推理与最终答案"]

关键设计

1. 答案态差分抽取:用相同答案隔离推理条件带来的表示变化

对每个支持样本,源模型先在逐步推理提示下生成推理过程,只保留最终回答正确的样本。之后进行两次教师强制前向计算:Reasoner 路径包含问题、推理过程和最终答案;Solver 路径只包含问题和相同的最终答案。教师强制意味着两条路径接收预先给定的 token,而不是各自自由生成可能不同的答案。抽取时按答案 token 对齐,而不是按两段序列的绝对位置对齐;问题 token 和推理 token 都不参与向量平均。

每个语言层先对单个样本的答案位置求平均差,再对支持样本求平均,因此答案更长的样本不会仅凭 token 更多而取得更大的权重。下面的公式直接体现这个两级平均:

\[ \boldsymbol{r}_{l}=\frac{1}{N}\sum_{i=1}^{N}\frac{1}{|\mathcal{A}_{i}|}\sum_{a\in\mathcal{A}_{i}}\left[\boldsymbol{h}_{l}(a;\mathcal{C}_{R,i})-\boldsymbol{h}_{l}(a;\mathcal{C}_{S,i})\right]. \]

其中,\(\mathcal{C}_{R,i}=(q_i,t_i,a_i)\)、\(\mathcal{C}_{S,i}=(q_i,a_i)\),\(\mathcal{A}_i\) 表示最终答案的 token 集合,\(N\) 是纳入平均的支持样本数。每层独立得到一条任务级向量;它不是测试题专属的推理轨迹,也不是取出推理 token 后直接拼接到模型中。

作者比较三种来源。LLM-derived 从基础 LLM 的纯文本成功样本中抽取;VLM-derived 从目标 VLM 的纯文本成功样本中抽取;VLM-MM 从目标 VLM 的图文支持样本中抽取。三者都只使用语言侧答案隐状态,所以“多模态来源”不意味着在视觉编码器里计算或注入向量。

源模型和数据分布必须分开理解。纯文本来源的数学向量来自 GSM8K,可用于 GSM8K、MathVista 和 MathVision;CommonsenseQA 向量还用于 ScienceQA,StrategyQA 使用自身训练数据。VLM-MM 则使用相应多模态任务的支持数据。LLM-derived 与 VLM-derived 虽遵循同一抽取协议,各自正确的样本子集却可能不同,这使“来源模型更优”的解释仍存在样本组成因素。

固定答案的意义是避免把两个不同答案本身的表示差误当成推理方向,但它不能完全消除上下文长度、位置变化和推理措辞的影响。因此这里提取的是推理条件下的表示偏移近似,而不是已被证明纯净、通用或可独立执行的推理能力。

2. 可学习向量适配:保留方向初始化,只优化注入向量

静态转移隐含假设:基础 LLM 的表示方向仍可用于对应 VLM。然而多模态训练可能改变其适用位置和幅度。LIFT 将抽取向量作为初始值,在支持集上学习一个适合目标 VLM 的向量;Reasoner 提供有推理条件的答案表示,Solver 在选定层接受向量后产生干预表示,训练把两者拉近。

这里匹配的是支持集平均的答案表示,而不是要求 Solver 逐 token 复述完整推理,也不是用语言模型交叉熵训练新答案。学习的是向量参数,不是主干权重或一个额外的推理网络。由于幅度也由优化决定,可学习版本不再单独使用静态方案的缩放系数。

\[ \mathcal{L}_{\mathrm{rec}}=\left\|\boldsymbol{z}_{l}^{\mathcal{R}}-\boldsymbol{z}_{l}^{\mathcal{S}}\right\|_{2}^{2},\qquad\mathcal{L}=\lambda_{\mathrm{rec}}\mathcal{L}_{\mathrm{rec}}. \]

\(\boldsymbol{z}_{l}^{\mathcal{R}}\) 是 Reasoner 的支持集平均答案表示,\(\boldsymbol{z}_{l}^{\mathcal{S}}\) 是注入向量后 Solver 的对应平均表示。这个损失只约束平均表示接近,不等价于保证每道题的推理过程正确;其实际有效性需要最终准确率和控制实验来支撑。

有意义的初始化是本设计的关键。LLM 来源初始化优于随机初始化,而 VLM 来源初始化在 InternVL2.5 上甚至会使均值低于基线。因此,“只增加少量可训练参数”本身并不足以解释收益,也不能假设任何来源的向量经适配都会改善模型。

3. 选层语言干预:把离线向量作为生成过程中的持续偏移

激活方向在不同深度的作用不同。作者逐一尝试候选语言层,在每个基准随机取出的 100 个训练样本开发子集上评估,选择表现最好的层,然后固定该层进行完整测试。不同来源和静态、学习设置遵循同一选层协议;这不是针对测试答案逐题选择层,也不是在所有层同时注入一整组向量。

在选定层,静态方案把向量加到语言 token 的隐状态中;学习方案使用优化后的向量。推理仍生成自己的 CoT 和答案,没有调用基础 LLM 为每道测试题重新生成一个向量,也没有从支持集检索演示放进提示:

\[ \tilde{x}_{l}=x_{l}+\mu r_{l},\qquad\tilde{x}_{l}=x_{l}+\theta_{l}. \]

左式为静态干预,右式为可学习干预。主实验静态强度固定为 \(\mu=1.0\),干预发生在自回归生成的语言侧,而不是仅在最终答案生成后修改输出。抽取只看答案 token,使用却作用于生成过程,正是其可能改变中间推理行为而不只是改变最终答案的原因。

一个完整示例

以 MathVision 的数学图文题为例,离线抽取可先从基础 LLM 在 GSM8K 上答对的样本形成任务级向量。每个样本的两条教师强制路径给定同一答案,区别只在答案前有没有生成的推理过程;由此平均出各层方向,再用 MathVision 的开发子集选定注入层。

测试时,VLM 读取实际图像和问题,支持样本不进入提示。静态版在生成过程中叠加选定层的数学向量,学习版则叠加经过支持集表示匹配的向量。论文的靶子计分案例中,LLM 来源干预后的回答保留重复命中的情况,并把计分组合与不同总分区分开,得到 9;VLM 来源干预仍把组合数量当成不同分数数量。这是个案层面的过程证据,不代表所有视觉错误都被修复。

损失函数 / 训练策略

默认每个支持来源采样 500 个例子,再筛选源模型回答正确的样本,所以最终参与抽取的数量不能直接视为固定 500。推理过程由相应源模型生成,支持集只用于离线抽取或适配,不进入最终测试集,也不作为上下文演示。

可学习向量使用 AdamW 训练 6 个 epoch,学习率 \(1\times10^{-4}\),batch size 为 1,梯度累积 4 步;权重衰减 \(1\times10^{-3}\),warmup ratio 为 0.1,梯度裁剪最大范数为 1.0,采用 16-bit 混合精度。优化目标只有表示匹配损失,整个 VLM 主干和视觉编码器冻结。

基线与 LIFT 使用相同零样本 CoT 提示、答案解析器和确定性解码:beam size 为 1,关闭采样;纯文本任务最多生成 512 个新 token,多模态任务最多 4096 个。支持采样、选层采样和适配默认随机种子为 42。冻结主干降低训练成本,但不应把抽取、开发集选层和向量学习的离线开销忽略为零。

实验关键数据

主实验

两个目标模型分别是 Qwen2.5-VL-7B-Instruct 和 InternVL2.5-8B,对应基础 LLM 为 Qwen2.5-7B-Instruct 与 InternLM2.5-7B-Chat。下表为原文表 1 的准确率(%);平均值是六个基准的算术平均,而非按样本数加权。MVista、MVision、CSQA、SQA、SciQA 分别表示 MathVista、MathVision、CommonsenseQA、StrategyQA、ScienceQA。

模型 配置 GSM8K MVista MVision CSQA SQA SciQA 平均
Qwen2.5-VL 基线 82.2 68.5 25.0 77.3 58.6 87.8 66.6
Qwen2.5-VL LLM-derived 84.2 69.1 26.6 78.0 63.5 88.1 68.3
Qwen2.5-VL VLM-derived 83.0 70.7 25.7 77.7 60.3 87.8 67.5
Qwen2.5-VL LLM-learnable 85.6 71.8 27.3 78.3 62.4 88.9 69.1
InternVL2.5 基线 77.1 62.8 22.7 82.3 65.6 96.5 67.8
InternVL2.5 LLM-derived 78.1 64.0 25.0 83.1 67.1 96.8 69.0
InternVL2.5 VLM-derived 77.9 63.0 23.4 82.6 65.9 96.7 68.3
InternVL2.5 LLM-learnable 78.0 64.6 25.3 83.2 67.6 97.4 69.4

静态 LLM 来源在两个模型上的均值分别增加 1.7 和 1.2 个百分点,学习版相对基线增加 2.5 和 1.6 个百分点。这是同协议干预比较,不是对所有已有多模态推理方法的 SOTA 宣称;4-shot CoT 的对应均值为 67.4/68.5,改变提示的少样本方案与 LIFT 的资源需求也不同。

消融实验

下表结合原文表 3 和附录表 11,只展示最能区分“方向有用”和“增加参数或扰动就有用”的六任务均值。随机初始化仍接受向量学习;同范数随机向量则是不学习的静态方向替换,二者不能混为一类控制。

配置 Qwen2.5-VL 平均准确率(%) InternVL2.5 平均准确率(%) 说明
基线 66.6 67.8 无向量干预
同范数随机向量 66.4 66.1 保留静态扰动幅度,替换方向
LLM-derived 68.3 69.0 静态 LLM 来源方向
LLM-learnable 69.1 69.4 LLM 来源初始化后适配
随机初始化,LLM-learnable 对照 66.7 68.3 原文对应学习设置的随机初始化
VLM-learnable 67.2 66.6 VLM 来源初始化后适配

关键发现

  • LLM 来源优势主要是跨任务平均趋势,不是逐项必胜:Qwen2.5-VL 的 MathVista 上,静态 VLM-derived 为 70.7,高于 LLM-derived 的 69.1;InternVL2.5 的 GSM8K 上,静态 LLM-derived 的 78.1 也略高于学习版 78.0。
  • VLM-MM 只在 MathVision 和 ScienceQA 的两任务比较中报告,均值为 57.0/60.6,介于 LLM-derived 的 57.4/60.9 与 VLM-derived 的 56.8/60.1 之间,不能与六任务均值直接比较。InternVL2.5 的 ScienceQA 上 VLM-MM 为 96.4,低于基线 96.5,所以平均改善不代表每项改善。
  • 附录配对 bootstrap 使用 10,000 次重采样,跨模型—基准对的静态 LLM-derived 相对基线宏平均增益为 1.45 个百分点,95% CI 为 [0.45, 2.45];相对 VLM-derived 为 0.75,区间为 [0.15, 1.35]。这不是每个数据集分别显著的证明。
  • GSM8K 上跨层向量的平均对角余弦相似度为 InternVL2.5 的 0.866、Qwen2.5-VL 的 0.531,支持对应深度仍有部分结构相似性,但没有证明这些向量对应唯一的推理机制。

亮点与洞察

  • 对齐答案 token 而不是平均推理 token,给出了一个明确、可操作的表示差定义。其价值在于把“推理上下文对回答表示的影响”变成可控制变量,同时仍承认这是近似。
  • 纯文本数学和常识支持数据能改善图文任务,说明部分收益可以来自语言侧计算和条件保持。它不要求每个测试图像都拥有标注推理轨迹,也不意味着视觉感知瓶颈已经消失。
  • 同范数随机控制和随机初始化控制分别检查方向与学习起点。两种对照共同增强了干预有效性的证据,但仍不足以把多模态训练确定为推理退化的唯一原因。

局限与展望

  • 只覆盖两个具有对应基础 LLM 的模型家族,尚不清楚异构语言主干、不同对齐流程或更强推理模型是否同样适用。
  • 支持集正确性筛选与开发集选层依赖答案信息;500 是采样规模,不是各来源实际正确样本数。后续应控制相同正确样本子集、支持规模和推理长度,进一步区分模型来源与数据组成的贡献。
  • MathVision 测试只有 304 个样本,其他评测规模为 GSM8K 1319、MathVista 1000、CommonsenseQA 1221、StrategyQA 687、ScienceQA 4241。宏平均置信区间和额外一个种子的趋势不能替代每项任务的充分稳定性分析。
  • 附录 A 的单头注意力分解提供加性偏移的直觉,不是完整多层 Transformer 的能力恢复定理。正文对对齐改变推理方向的解释应视为假说,而非因果证明。
  • 干预不直接修改视觉编码器,无法保证纠正识别或视觉定位错误。可考虑联合视觉定位验证与条件保持诊断;缓存中的附录 F 主要保留案例观察文字,不能据此声称已核对图中的完整推理轨迹。

相关工作与启发

  • vs Task Arithmetic:任务算术通常在模型参数差上操作;LIFT 在激活空间操作,不合并基础 LLM 与 VLM 权重。它更适合轻量干预和来源比较,但不能直接推断参数级迁移效果。
  • vs Contrastive Activation Addition / latent CoT vectors:这些工作也用激活方向控制行为;LIFT 的重点是固定答案的 Reasoner–Solver 抽取及基础 LLM 到对应 VLM 的迁移,而不是提出一般性的“向量加法能推理”。
  • vs multimodal CoT supervision / MM-Verify / reasoning-oriented RL:这些方法训练或验证外显推理行为;LIFT 用离线支持数据构造内部偏移,推理提示保持不变。本文没有同训练预算下的全面比较,二者更可能互补而非相互替代。

评分

  • 新颖性: 4/5。将答案态差分用于基础 LLM 到 VLM 的推理迁移,问题定位明确,但激活引导本身已有先例。
  • 实验充分度: 4/5。六任务、两模型、随机控制与置信区间较完整,来源样本混杂和逐项稳定性仍需加强。
  • 写作质量: 4/5。抽取与测试协议清楚,但表示变化的解释强于现有因果证据,案例图的细节需结合原论文查看。
  • 价值: 4/5。提供了冻结主干的轻量推理增强工具,也提供了研究多模态训练前后语言表示变化的实验切口。