跳转至

ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/RISys-Lab/ReasonCLIP
领域: 多模态VLM
关键词: 视觉常识推理, 视觉语言模型, CLIP, 持续预训练, 评测基准

一句话总结

提出两阶段持续预训练框架 ReasonCLIP-58M,通过构建 42M 开放式视觉溯源推理数据与 16M 细粒度类别推理数据,在不改变网络架构且无损客观描述对齐的前提下,系统性为 CLIP 注入深层视觉常识推断能力,在检索、组合推理与下游 MLLM 上取得显著增益。

研究背景与动机

作为现代多模态系统与多模态大语言模型(MLLM)的核心视觉底座,对比语言-图像预训练模型(CLIP)及其变体通过在大规模图文对上进行跨模态对比学习,奠定了视觉与文本表征对齐的基础。然而,现有主流 CLIP 的预训练高度依赖由网络爬虫抓取的客观浅层描述文本(例如“桌子上有两台显示器和两只猫”)。这种传统的监督信号仅驱动模型学习图像实体名词与可见像素区域之间的表面统计共现,严重缺乏关于场景中物理接触、几何遮挡、时序因果及生物行为意图等深层视觉常识推理的显式引导。

随着下游应用对复杂具身交互、时空组合理解与多步逻辑推理的需求与日俱增,这种“浅层描述对齐”与“深层视觉常识”之间的错配愈发突出。近期的改进工作大多局限于单纯扩充描述性语料规模(如 DataComp、MetaCLIP)或微调注意力层等网络结构,并未触及表征缺乏常识推理能力的本质瓶颈。若直接使用高自由度、包含多步思维链的通用复杂推理数据对 CLIP 进行端到端微调,极易破坏原有的跨模态几何度量结构,引发灾难性遗忘并导致通用检索能力断崖式下跌。

面对这一两难困境,本文探索了在不改变任何骨干网络架构的前提下,通过注入高质量视觉常识监督信号实现非侵入式持续预训练的可行路径。核心 idea:构建包含 5890 万级视觉溯源常识推理对的高质量多阶段监督语料,采用“平滑退火的双目标推理感知对齐(Stage 1)+ 显式分类判别约束驱动的范式解耦学习(Stage 2)”的两阶段持续预训练策略,在严密保全基础描述对齐的前提下,将深层视觉常识推断能力无损注入 CLIP 视觉编码器,并构建三层级诊断基准 RCLIP-Bench。

方法详解

整体框架

ReasonCLIP-58M 的目标是在保持视觉与文本编码器原有架构不变、推理零额外开销的前提下,将深层常识推理能力持续注入多模态表征空间。整个方案涵盖数据构建、两阶段渐进式持续预训练以及下游即插即用集成三大环节。在数据侧,系统基于 CC12M 构建了开放式可验证推理数据集 ReasonLite-42M 与结构化五大类别推理数据集 ReasonPro-16M;在训练侧,Stage 1 利用双目标损失与动态权重调度实现常识感知平滑过渡,Stage 2 引入多标签/单标签辅助分类分支迫使模型解耦五大类常识范式;在部署侧,训练完成的视觉塔可作为 drop-in 编码器直接接入 LLaVA-NeXT 等主流 MLLM 架构。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:CC12M 原始图像与高质量精炼描述 Tb"] --> B["两级互补的视觉常识推理语料构建<br/>基于视觉证据提取生成 ReasonLite-42M 与 ReasonPro-16M"]
    B --> C["动态退火的双目标推理感知对齐<br/>双分支联合优化 Tb 与 Trl,动态权重退火与 L2 正则保全基底"]
    C --> D["显式分类监督驱动的范式解耦学习<br/>聚焦五大物理常识范式,双端轻量分类头联合优化 Trp 对齐"]
    D --> E["零开销即插即用的多模态架构集成<br/>直接替换 MLLM 预训练视觉塔,无额外计算与参数开销"]

关键设计

1. 两级互补的视觉常识推理语料构建:从开放式事实推断到结构化范式标注 现有多模态推理数据集多面向生成式大模型设计,充斥着脱离视觉直接证据的臆断或冗长文本,不适合对比式编码器。为了构建可视觉溯源、紧凑且高可信的常识监督信号,作者以 CC12M 的 1040 万张有效图像为源,首先调用 Qwen2.5-VL-72B 为每张图像重新生成 3 条事实对齐的高质量细粒度基础描述 \(T_b\)(构建出 3120 万对的 CC12M-Refined),彻底清洗原始网络文本噪声。随后将图像集划分为两部分分别构建两级语料:第一级 ReasonLite-42M 面向开放式常识推断,先指示大模型从图像与 \(T_b\) 中抽取出可观测的视觉证据集合并聚类为 3 个子集,再针对每个证据子集推导出一条紧密依托该视觉线索的高阶常识结论 \(T_{rl}\)(例如依据画面中“食物整齐排列在便携盒中”推论出“便于携带与直接食用”),生成 4200 万对图像-开放推理文本;第二级 ReasonPro-16M 面向结构化范式监督,严格定义了与视觉感知强绑定的五大常识维度:空间与几何(Spatial/Geometric, S)、属性与状态(Attribute/State, A)、生物与动作(Creature/Action, C)、时序与阶段(Temporal/Phase, T)以及直觉物理(Intuitive Physics, P)。利用判别能力更强的 Qwen3-VL-32B 先对 570 万张候选图像进行多标签标注,筛选出同时满足至少 3 种推理模式的 550 万张高质量图像,再针对其中选定的 3 个维度分别生成严格基于局部事实的类别推理文本 \(T_{rp}\),产出 1660 万对结构化推理样本。

2. 动态退火的双目标推理感知对齐:在保全描述对齐基底中平滑过渡 直接使用推理文本微调预训练 CLIP 会迅速打破原有的概念分布平衡,造成严重的灾难性遗忘。Stage 1 设计了双目标协同优化机制,在 ReasonLite-42M 上同时计算图像对客观描述 \(T_b\) 与对开放推理文本 \(T_{rl}\) 的跨模态对齐损失。为了引导模型从“完全锚定基础客观描述”平滑渐进地过渡到“具备敏锐的常识推理感知”,客观描述损失与推理损失的配比由随训练步数动态递减的时间系数 \(\lambda(t)\) 进行调度:

\[\mathcal{L}^{(1)} = \lambda(t)\,\mathcal{L}_{\text{align}}(x, T_b) + \bigl(1 - \lambda(t)\bigr)\,\mathcal{L}_{\text{align}}(x, T_{rl}) + \beta\,\|\theta - \theta_0\|_2^2\]

其中 \(\mathcal{L}_{\text{align}}\) 为骨干原生对齐损失(CLIP 采用对称 InfoNCE,SigLIP 采用基于 Sigmoid 的二值交叉熵),\(\theta\)\(\theta_0\) 分别代表当前步与初始模型权重,\(\ell_2\) 正则化惩罚项强力约束参数空间不发生剧烈漂移。权重调度函数定义为从初始最大值 \(\lambda_{\max}\) 线性衰减至目标最小值 \(\lambda_{\min}\)

\[\lambda(t) = \lambda_{\min} + (\lambda_{\max} - \lambda_{\min}) \cdot \mathrm{clip}\left(\frac{t_2 - t}{t_2 - t_1}, \; 0, \; 1\right)\]

该动态调度确保模型在训练初期牢牢巩固视觉概念定位,在后期逐步加大对推断性线索的注意力,在同一表征空间中实现语义描述与常识感知的无缝融合。

3. 显式分类监督驱动的范式解耦学习:五大物理常识维度的特征组织 经过 Stage 1 训练后,模型已具备泛化推理感知,但对于相互交织的不同物理常识关系(如几何空间距离 vs 物理受力平衡)仍缺乏显式判别能力。Stage 2 迁移至 ReasonPro-16M 语料,完全移除基础描述 \(T_b\),专攻类别特定推理文本 \(T_{rp}\) 的精准对齐。为了迫使视觉与文本特征空间自主组织不同推理类型的拓扑边界,模型在图像侧与文本侧分别挂载轻量级 MLP 分类头 \(g_v(\cdot)\)\(g_t(\cdot)\),引入双端类别判别辅助损失:

\[\mathcal{L}^{(2)} = \mathcal{L}_{\text{align}}(x, T_{rp}) + \gamma\,\Bigl(\mathcal{L}_{\text{img-cls}}(x, Y) + \mathcal{L}_{\text{txt-cls}}(T_{rp}, c)\Bigr)\]

其中图像端由于自然场景通常同时蕴含多维物理属性,采用基于多热标签向量 \(\mathbf{y} \in \{0, 1\}^5\) 的二值交叉熵损失 \(\mathcal{L}_{\text{img-cls}} = \mathrm{BCE}\bigl(g_v(x), \mathbf{y}\bigr)\);而每条推理文本仅针对特定单一维度生成,因此文本端采用基于类别索引 \(c \in \{1,\dots,5\}\) 的标准多分类交叉熵 \(\mathcal{L}_{\text{txt-cls}} = \mathrm{CE}\bigl(g_t(T_{rp}), c\bigr)\)。这两个轻量辅助头仅在预训练阶段反向传播梯度以规整特征分布,在推理时直接丢弃,不改变模型前向计算图。

4. 零开销即插即用的多模态架构集成:为下游 MLLM 提供具常识感知的视觉塔 现存 MLLM(如 LLaVA 系列)在面对复杂逻辑问答或因果幻觉时,其瓶颈往往不在于大语言模型本身,而在于视觉前端所提取的特征仅仅是“词袋式”的物体堆叠。Stage 3 展示了 ReasonCLIP 编码器的即插即用特性:下游多模态系统只需将其原生的视觉塔替换为同规模的 ReasonCLIP 编码器 \(\phi_{\text{ReasonCLIP}}\),保留其余投影连接层与语言模型骨干参数即可:

\[\mathcal{M}(x, \cdot) = \mathcal{F}\bigl(\phi_{\text{Baseline}}(x), \cdot\bigr) \longrightarrow \mathcal{F}\bigl(\phi_{\text{ReasonCLIP}}(x), \cdot\bigr)\]

由于 ReasonCLIP 完全遵循标准 ViT 结构,token 序列长度、隐层维度与注意力机制均未做任何侵入式修改,因此下游系统能够以零代码重构代价、零新增推理显存与延迟,直接从前端汲取蕴含常识因果的丰富视觉表征。

损失函数 / 训练策略

  • 预训练基线对照(Stage 0):设置纯描述对齐基线 S0-Des(仅用 \(T_b\) 训练)与无序混合基线 S0-Rea(将 \(T_{rl}\)\(T_{rp}\) 简单混洗直接训练),验证阶段式划分与显式监督的必要性。
  • 训练超参:在 NVIDIA A100 64GB 集群上进行全流程训练,有效批大小为 24,576 或 32,768。Stage 1 在 ReasonLite-42M 上单轮 epoch 训练,Stage 2 在 ReasonPro-16M 上单轮 epoch 训练。涵盖 CLIP ViT-B/32、ViT-L/14(224 与 336 分辨率)、SigLIP/SigLIP2 So400m/14 及 SigLIP2 Giant-Opt(1B)等 6 种主流视觉骨干。

实验关键数据

主实验

主实验在四大图文检索基准(包含标准检索 COCO-5K、Flickr-30K,长文本检索 Urban-1K,以及本文提出的常识推理诊断检索 RCLIP-V3-5K)与多项细粒度组合推理基准上进行了系统评测。

架构 / 模型 预训练数据量 COCO-5K (I→T / T→I R@1) Flickr-30K (I→T / T→I R@1) Urban-1K (I→T / T→I R@1) RCLIP-V3-5K (I→T / T→I R@1)
ViT-Base (86M)
OpenCLIP [34] 0.4B 52.3 / 34.2 39.7 / 24.0 55.8 / 55.4 54.8 / 27.8
MetaCLIP [97] 0.4B 51.8 / 35.9 39.3 / 25.7 57.2 / 52.6 56.5 / 30.1
DataComp [26] 1.4B 53.4 / 37.2 39.0 / 24.6 64.4 / 59.9 60.8 / 32.2
原生 CLIP [69] 0.4B 50.0 / 30.4 40.7 / 21.8 61.0 / 46.8 51.0 / 26.7
+ Stage 1 +42M 56.2 / 37.9 42.5 / 29.1 70.4 / 68.6 56.0 / 30.4
+ Stage 2 (ReasonCLIP) +16M 52.3 / 37.0 41.9 / 27.5 59.2 / 60.4 55.3 / 33.8
ViT-Large (307M, 336px)
ViTamin [10] 1.0B 64.3 / 47.3 56.1 / 39.9 80.6 / 76.0 69.7 / 39.8
EVA-CLIP-02 [79] 2.0B 64.2 / 47.9 59.7 / 43.4 77.1 / 70.7 67.9 / 39.1
SigLIP2 [106] 10.0B 70.9 / 55.5 68.6 / 51.2 66.9 / 61.9 66.5 / 41.8
原生 CLIP [69] 0.4B 58.0 / 37.0 51.4 / 31.6 73.0 / 57.0 55.9 / 33.2
+ Stage 1 +42M 65.1 / 46.9 61.0 / 41.9 83.0 / 81.9 67.2 / 38.5
+ Stage 2 (ReasonCLIP) +16M 61.3 / 47.1 57.2 / 40.8 75.5 / 78.2 68.0 / 42.8
ViT-So400m (428M)
原生 SigLIP [106] 10.0B 72.6 / 54.3 69.9 / 51.3 74.5 / 73.4 70.5 / 43.4
+ Stage 1 +42M 73.6 / 56.5 69.3 / 52.3 77.5 / 82.3 68.3 / 45.5
+ Stage 2 (ReasonSigLIP) +16M 73.7 / 57.3 73.3 / 53.9 78.6 / 80.6 72.4 / 49.5

在细粒度组合推理基准(WhatsUp、VALSE、CREPE、SugarCREPE、SugarCrepe++)上的表现同样大幅跃升:以 CLIP-B/32 为例,ReasonCLIP 的平均组合推理得分从 52.1 攀升至 57.7(+5.6 分),其中空间推理 WhatsUp 提升 10.1 分,SugarCrepe++ TOT 更是暴涨 14.8 分;在 SigLIP-So400m 上,ReasonSigLIP 在 SugarCrepe++ TOT 上取得了 21.7 分的惊人增益(从 51.2 提升至 72.9)。将 ReasonCLIP 视觉塔作为替换放入 LLaVA-NeXT(Qwen3-1.7B 语言底座)测试下游表现,OKVQA 得分从 34.0 跃升至 35.8,MMVP 从 58.7 提升至 62.3,同时保持基础通用问答(如 SciQA、AI2D)稳定无损。

消融实验

消融实验聚焦于不同阶段与训练配置对常规检索能力与三层级视觉常识推理诊断(RCLIP-Bench 的 V1 视觉定位、V2 证据意识、V3 常识推理)的影响。

训练配置 / 变体 COCO 检索 (R@1) Flickr 检索 (R@1) RCLIP-V1 (视觉定位) RCLIP-V2 (证据意识) RCLIP-V3 (常识推理) 说明
Stage 1 主配置 55.6 50.5 26.6 19.2 24.3 双目标平滑退火 + L2 正则约束
- 偏向描述 (Des.-heavy) 55.8 48.6 26.1 18.4 24.1 增加描述文本损失权重,常识敏感性下降
- 偏向推理 (Rea.-heavy) 52.5 46.0 23.5 15.3 19.0 忽视基础描述锚定,引发严重表征漂移
- 指数衰减 (Exp-Sched) 53.2 47.7 25.8 17.6 23.3 替代线性调度,过渡不够平缓
Stage 2 主配置 53.2 47.3 28.6 18.3 23.1 类别推理对齐 + 双端轻量分类头
- 去除分类监督 (w/o cls) 53.3 47.3 28.6 18.0 22.6 移除 MLP 分类头,范式解耦能力受损
- 增加 L2 正则 (w/ L2) 53.1 47.1 28.4 17.3 23.0 限制了类别特定特征拓扑的收敛空间
- 单标签分类 (Single-Label) 52.8 46.5 28.1 17.5 22.0 无法拟合多维物理事实共存的自然场景

关键发现

  • 阶段特化与容量依赖:Stage 1 依靠动态退火和双目标监督,在强化基础描述检索的同时激活了对推断线索的敏感度;Stage 2 则在更结构化的常识维度上进行特征空间重整。对于较小容量的 CLIP-B,过度依赖 Stage 2 显式推理监督易发生检索退化,而对于大容量的 SigLIP-So400m,Stage 2 则带来了各项指标的全面均衡突破。
  • 事实锚定的不可替代性:Rea.-heavy 变体在所有指标上遭遇全线溃败(V3 从 24.3 骤跌至 19.0),表明如果缺乏对客观视觉事实的强力约束,模型无法学习到真正的常识推理,反而陷入幻觉与表征坍塌。
  • 多标签物理事实监督的必要性:真实视觉场景中的物理常识从来不是单维度的,例如跳跃动作往往交织着空间几何、动作意图与直觉重力。将图像端分类头强行简化为单标签分类(Single-Label)直接导致 V3 下跌 1.1 分,验证了多标签分类建模的必要性。

亮点与洞察

  • 平滑渐进式的表征演进路径:传统持续学习极易顾此失彼,本文通过动态衰减双对齐权重与参数锚定正则,巧妙化解了“保留事实描述”与“习得常识因果”之间的根本冲突,证明 CLIP 架构不仅是“对齐工具”,其特征空间具备容纳深层推理维度的极强可塑性。
  • 可验证证据链的数据合成方法论:提出基于视觉证据聚类(Evidence Clustering)生成推理文本的策略,从根源上截断了生成式多模态模型常见的空中楼阁式常识臆测,为对比式视觉编码器的监督数据工程提供了可复用的清洗范式。
  • 诊断解耦的 RCLIP-Bench:将推理失败归因严谨拆解为“事实定位错误(V1)”、“依据错误事实推断(V2)”以及“依据正确事实得出错误推断(V3)”三级阶梯,不仅厘清了模型在长链推理中的盲区,更为未来视觉常识评估提供了高分辨率标尺。

局限与展望

  • 计算资源与数据吞吐受限:受制于算力,当前持续预训练数据总量为 58.9M,与工业级基础预训练的数十亿规模存在量级差异;扩大常识监督规模是进一步释放潜力的关键路径。
  • 判别式任务与生成式推理的粒度界限:对比式特征空间在处理单步至两步的直觉常识判断时表现优异,但面对需要严密多步代数运算、复杂逻辑排错的形式化推理时,对比目标本身的信息密度仍显不足。
  • 未来演进方向:未来可探索将此类结构化常识先验拓展至密集预测(如开放世界 3D 接地与具身位姿规划)以及自回归长视频生成模型的世界先验建模中。

相关工作与启发

  • vs MetaCLIP / DataComp 等大规模数据工程:后者通过清洗更大规模的网络图文对提升客观表征泛化度,但本质依然是“浅层语义对齐”;ReasonCLIP 证明在更小的参数与数据预算下,通过深层常识推理监督,能够反超大规模数据堆叠的检索与推理指标。
  • vs READ-CLIP / Triplet-CLIP 等组合推理微调:既有方法多在 COCO 等小规模下游数据集上做针对性负样本挖掘微调,泛化空间狭窄;ReasonCLIP 属于通用表征层面的持续预训练,且能够作为这些下游特定方法的更优底座进一步叠加增益。
  • vs DANCE 等外部知识图谱注入方法:DANCE 依赖外部符号知识库(Knowledge Graph Riddles)辅助对齐,构造门槛高且易引入图谱域偏置;ReasonCLIP 直接从图像原生视觉证据中推演常识,保持了纯粹且严谨的视觉溯源性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性论证并实现了面向 CLIP 架构的大规模视觉溯源常识推理持续预训练,框架设计极具创新性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖从 Base 到 1B 多尺度架构、涵盖四大检索、五大组合推理、三级诊断基准及下游 MLLM,实验严谨详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照精准,问题剖析透彻,数据组织极为规范。
  • 价值: ⭐⭐⭐⭐⭐ 为多模态表征从“表面对齐”走向“深层常识理解”指明了非侵入式演进范式,开源模型与评测集具有很高的学术与应用价值。