跳转至

Natural Image Pretraining Improves Abstract Reasoning

会议: ECCV 2026
论文: ECCV 原文
PDF: Conference PDF
代码: https://github.com/facebookresearch/mae
领域: VLM推理 / 抽象视觉推理
关键词: 抽象视觉推理, ARC 基准, 掩码自编码器, 视觉自监督预训练, 测试时训练

一句话总结

本文提出 Nat-ARC,首次系统证实将自然图像(ImageNet)上的掩码自编码器(MAE)自监督预训练迁移至视觉中心型求解器,可大幅提升少样本网格抽象推理(ARC)性能,单模型达到 63.4% pass@2,跨范式预测级集成进一步达到 70.2% pass@2。

研究背景与动机

抽象推理与归纳基准(Abstraction and Reasoning Corpus, ARC)旨在评估人工智能系统的流动智力(fluid intelligence)。每个 ARC 任务仅给出 2 至 5 对输入-输出网格示例(尺寸最大 30×30、仅含 10 种离散颜色),要求模型在极度匮乏的任务监督下自主归纳出潜在的几何与逻辑变换规则,并泛化应用至未见测试网格。长期以来,该领域的高性能求解器几乎全被基于大语言模型(LLM)的系统垄断——这些系统通过将二维网格序列化为文本或符号数组,借助 LLM 预训练阶段习得的代码合成或思维链(Chain-of-Thought)规划能力进行显式假设搜索与规则验证。

然而,ARC 问题本质上是高度具象的视觉网格,人类在解决此类谜题时严重依赖对目标对象性(objectness)、空间拓扑、对称性以及前景-背景连通性的直觉感知,而非机械的文本解析。近期以 VARC 和 LoopViT 为代表的“纯视觉中心”(vision-centric)求解范式将 ARC 重构为条件图像到图像转换任务,展现了端到端纯视觉模型挑战 LLM 垄断的潜力。然而,现有视觉求解器存在显著的“预训练不对称性”:主流 LLM 系统依托海量文本语料预训练所赋予的扩展定律与迁移先验,而视觉端求解器却普遍从随机初始化开始、仅在规模极其有限的 ARC 离线合成任务上从头训练,导致模型极易在低数据环境下出现严重的过拟合与尺度扩展瓶颈。

面对这一不对称性,本文的核心切入点在于探究计算机视觉领域最核心的资产——基于海量无标注自然图像学到的自监督表征——是否能够跨越真实物理世界图像与高度人工抽象网格之间的巨大语义鸿沟。核心 idea:将 ImageNet 掩码自编码器(MAE)自监督预训练表征引入纯视觉 ARC 求解管线,通过冻结编码器先验与轻量测试时 LoRA 自适应,为极少样本抽象网格推理提供稳健的视觉基元与几何归纳偏置。

方法详解

整体框架

Nat-ARC 延续了 VARC 将 ARC 抽象网格推理视作条件图像到图像转换的视觉中心型建模范式,但构建了端到端的三阶段训练与自适应框架:无监督自然图像预训练、离线 ARC 多任务联合训练,以及测试时逐任务参数高效微调(TTT)。输入抽象网格被嵌入为 64×64 固定画布并切分为视觉 Patch Token,编码器直接承接在大规模自然图像上预训练的权重以赋予模型基础的目标感知能力;在离线训练阶段由随机初始化的轻量级解码器与编码器协同拟合跨任务变换;最终在推理测试时保持骨干网络冻结,仅微调特定任务的 LoRA 权重与任务嵌入,并通过多视角采样与多数投票完成最终解的确定。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["输入:少样本网格示例与测试输入<br/>D_demo 与 x_infer"] --> Pretrain["自然图像自监督预训练:MAE 编码器表征初始化<br/>ImageNet-1K 掩码重构赋予视觉感知基元"]
    Pretrain --> OfflineTrans["离线 ARC 跨任务训练:统一画布与 2D RoPE<br/>64x64 画布离散颜色嵌入 + 2x2 Patch + 任务条件化"]
    OfflineTrans --> AdaptLoRA["测试时参数高效自适应:冻结骨干与任务 LoRA<br/>微调注意力/MLP 适配器与任务嵌入,防止小样本灾难性过拟合"]
    AdaptLoRA --> EnsembleVote["预测级跨范式集成与多视角多数投票<br/>整合无预训练/自然图像/网格预训练候选池并筛选精确匹配解"]
    EnsembleVote --> Output["输出:测试网格精确预测结果<br/>pass@2 顶级支持模式"]

关键设计

1. 自然图像自监督预训练:解耦感知先验与规则归纳 在少样本抽象推理中,直接从仅有数千对样本的 ARC 离线数据集训练深层 Vision Transformer,网络极易陷入浅层局部模式的记忆而无法形成高阶拓扑表征。Nat-ARC 采用标准的掩码自编码器(MAE)自监督学习框架,直接复用在 ImageNet-1K 上以 75% 掩码率预训练的官方 ViT 权重。由于 ImageNet 图像的分辨率和 Patch 尺寸(通常为 224×224、16×16 Patch)与 ARC 网格离散画布并不匹配,模型丢弃原始 patch 投影层与绝对位置编码,仅保留纯净的深层 Transformer 编码器块权重。该预训练使编码器在未经任何 ARC 监督前即拥有对目标轮廓、局部连续性及前景结构的高级敏感度,成功将基础的“通用视觉感知能力”与后续的“任务抽象规则推断”进行分阶段解耦。

2. 统一画布与二维位置感知编码:弥合离散网格与连续视觉表征 ARC 网格各任务尺寸不一(从 1×1 到 30×30 不等)且包含 10 种类别型离散颜色值,直接以连续 RGB 图像处理会破坏离散符号语义。为此,Nat-ARC 将所有网格统一放置于 64×64 的虚拟画布中央,并通过可学习的颜色词表将 0 至 9 的离散颜色索引投影为高维嵌入向量。画布被严格分割为非重叠的 \(2\times 2\) Patch,展平为包含 1024 个视觉 Token 的序列,并引入可学习的任务前缀 Token(Task Token)。为了在保持 Transformer 灵活度的同时强力保留严密的几何空间相对坐标,Nat-ARC 在编码器与解码器的每个自注意力层均显式注入二维旋转位置编码(2D RoPE):

\[ \mathbf{q}_m^\top \mathbf{k}_n = \mathbf{q}^\top \mathbf{R}_{\Theta, m-n}^{\text{2D}} \mathbf{k} \]

其中相对位置旋转矩阵 \(\mathbf{R}_{\Theta, m-n}^{\text{2D}}\) 将水平与垂直网格坐标严格正交解耦,使自注意力头具备精确测量网格平移、对称与相对距离的能力,有效弥补了标准 ViT 在像素级网格对齐任务中的几何感知短板。

3. 冻结骨干的高效测试时自适应:轻量 LoRA 与任务嵌入联合优化 在推理评估阶段,测试任务 \(T_{\text{eval}}\) 仅提供 2 至 4 对示例,全量微调数百兆参数的模型会导致严重的灾难性过拟合。Nat-ARC 提出了一种极端参数高效的测试时自适应(Test-Time Training, TTT)机制:完全冻结离线阶段训练好的编码器与解码器骨干参数,仅在自注意力机制的所有投影矩阵(\(W_q, W_k, W_v, W_o\))和 MLP 前馈层中插入低秩适应矩阵(LoRA),同时为该任务及其基于翻转、旋转、颜色置换构建的辅助对称变换任务分别从头优化独立的可学习任务嵌入。这种约束使得模型仅在极小的低秩子空间内针对演示示例调整注意力路径,既快速拟合了当前任务的特定变换逻辑,又牢固守住了骨干网络所沉淀的通用视觉结构先验。

4. 预测级跨范式集成与多视角多数投票:利用模型多样性筛选稳健解 单次前向推理极易因画布坐标微小偏移或局部离散色块误判而导致严格全图匹配(Exact Match)失败。Nat-ARC 在推理期执行多重视角增强,通过随机画布平移、尺度缩放与旋转生成多样化测试视角,模型输出预测后再逆变换反解至原始网格空间。在最终决策阶段,算法并不在连续 logits 或特征空间做软加权,而是在离散候选网格集合 \(\{\hat{y}^{(v)}\}\) 上执行严格的精确全图多数投票(Exact-Match Majority Voting)。此外,该投票范式天然支持跨训练范式的异构集成:将无预训练模型、自然图像 MAE 预训练模型以及在 190 万对合成数据上进行网格自监督预训练的 ARC-MAE 模型预测池化,跨越不同归纳偏置的多样化假设在精确匹配投票中形成互补,大幅提升了对复杂边缘任务的覆盖度。

损失函数 / 训练策略

离线训练阶段,模型联合 400 个 ARC-1 训练任务与 RE-ARC 合成任务(40 万对输入-输出)进行跨任务优化,损失函数采用标准多分类交叉熵损失:

\[ \mathcal{L}_{\text{offline}}(\theta) = -\frac{1}{M \cdot H \cdot W} \sum_{i=1}^M \sum_{u=1}^H \sum_{v=1}^W \sum_{c=0}^9 \mathbb{I}(y_{i, u, v} = c) \log \left[ f_\theta(x_i, T)_{u, v, c} \right] \]

离线训练历经 200 个 epoch,并施加剧烈的随机分辨率扰动、色彩重排列与平移数据增强。在测试时训练(TTT)阶段,仅对演示对 \(D_{\text{demo}}\) 计算相同形式的交叉熵损失,并在更新任务嵌入和 LoRA 权重时辅以旋转、翻转和置换生成的对称辅助任务联合正则化,优化步数通常在数百步之内完成快速收敛。

实验关键数据

主实验

论文在标准的 ARC-1 与 ARC-2 评测基准上与主流人类表现、通用大语言模型、ARC 专用微调系统及无外部预训练的神经系统进行了全面对比。评估指标采用 ARC 官方严苛的 pass@2 精确匹配率(允许提交两次预测,任一全图完全一致即算正确)。

体系类别 / 代表模型 参数量 预训练数据源 ARC-1 (pass@2, %) ARC-2 (pass@2, %)
人类平均水平 (Avg. Human) – 人类视觉生活经验 60.2 –
人类顶尖水平 (Best Human) – 竞赛级专家归纳 98.0 100.0
DeepSeek-R1 671B 语言语料 + RL 强化学习 15.8 1.3
GPT-5 (o系列前沿模型) – 海量多模态/文本语料 44.0 1.9
Gemini 3 Pro (最新前沿多模态) – 专有极大规模多模态语料 98.0 77.1
TTT + BARC 16B 文本预训练 + 专用合成微调 62.8 –
The ARChitects 8B 文本预训练 + 领域集成 71.6 –
HRM (分层递归模型) 27M 从零训练 (无外部预训练) 40.3 5.0
TRM (微型循环网络) 7M 从零训练 (无外部预训练) 44.6 7.8
VARC (纯视觉基线) 19M 从零训练 (无外部预训练) 54.0 8.3
LoopViT (循环 Transformer) 18M 从零训练 (无外部预训练) 65.8 14.2
Loop-OWM (可组合世界模型) 10.6M 从零训练 (无外部预训练) 68.5 22.5
Nat-ARC (单模型, 本文) 0.6B ImageNet-1K MAE 预训练 63.4 ± 0.7 8.6 ± 0.8
Nat-ARC (跨范式集成, 本文) 2.0B ImageNet + ARC-Grid MAE 70.2 ± 0.6 13.1 ± 0.7

消融实验

为了严格排除随机初始化与评测方差的偶然性,论文针对模型参数规模(Base / Large / Huge)以及不同预训练策略(从零初始化、ImageNet MAE、ARC 网格 MAE、多模型集成)进行了严格的多次重复实验(5 个独立离线检查点 × 2 次独立 TTT 评估)。

预训练范式 模型规格 编码器配置 (层数/维度/头数) 参数量 离线收敛优势 ARC-1 (pass@2, %)
从零训练 (No Pretrain) Base 12 / 768 / 12 114M 较慢,基线 ~55.2 ± 0.9
从零训练 (No Pretrain) Large 24 / 1024 / 16 334M 渐进改善 ~58.4 ± 0.8
从零训练 (No Pretrain) Huge 32 / 1280 / 16 664M 出现容量过拟合退化 57.6 ± 0.8
ImageNet MAE 预训练 Base 12 / 768 / 12 114M 前 50 轮精度显著跃升 58.7 ± 0.6
ImageNet MAE 预训练 Large 24 / 1024 / 16 334M 收敛速度倍增 61.2 ± 0.7
ImageNet MAE 预训练 Huge 32 / 1280 / 16 664M 持续单调扩展无退化 63.4 ± 0.7
ARC 网格自监督预训练 (单模型) Huge 32 / 1280 / 16 664M 域内最优 ~64.8
集成:2× 从零训练 (Scratch) Huge 2× 独立种子模型 ~1.3B 仅提供检查点扰动 ~61.5 ± 0.7
集成:2× ImageNet MAE 预训练 Huge 2× 独立预训练模型 ~1.3B 高置信候选重叠 ~66.8 ± 0.6
集成:Scratch + ImageNet 混合 Huge 跨初始化预测池化 ~1.3B 表征互补明显 ~66.5 ± 0.5
全范式大集成 (Nat-ARC Ensemble) Huge Scratch + ImageNet + ARC-Grid ~2.0B 预测级多数投票 70.2 ± 0.6

关键发现

  • 打破视觉模型的低数据缩放瓶颈:在无预训练条件下,单纯扩大模型规模并不能持续带来增益(从 Large 扩至 Huge 时,ARC-1 得分从约 58.4% 跌落至 57.6%),表明极低数据量下深层视觉网络易受过拟合反噬;而注入 ImageNet MAE 预训练后,模型从 Base(58.7%)到 Large(61.2%)再到 Huge(63.4%)呈现稳健的单调上升趋势,证实自然图像预训练赋予了视觉网络类似语言模型的良好可扩展性(Scalability)。
  • 注意力图谱的零样本前景发现能力:注意力机制可视化显示,在完全未经 ARC 训练的 Epoch 0 初始化阶段,随机初始化模型对网格图块呈现均一无序的弥散注意力,而 ImageNet MAE 预训练模型在第 8 层与第 12 层就已经自发涌现出将前景色块与背景衬底清晰分离的拓扑聚集倾向。
  • 受益任务的高度聚集性:在 ImageNet 模型相对从零训练模型取得压倒性胜利(零样本求解率从 \(\le 30\%\) 跃升至 \(\ge 70\%\))的 15 个 ARC 任务中,有 12 个呈现出极度清晰的经典视觉先验属性——其中 6 个为“匹配与复制”(Match-and-Copy,识别局部图案并在另一区域保真复制),另 6 个为“连通分量推理”(Connected-Component Reasoning,识别封闭几何区域、边界填充或同色连通域重着色)。

亮点与洞察

  • 证明了现实物理感知与抽象离散逻辑的表征共通性:传统认知常认为 ARC 这一纯离散二维抽象符号系统需要符号推导或代码语法,本文首次确切证明在真实世界猫狗、风景图像上训练的连续感知表征,能够跨模态、跨领域直接激活离散几何网格中的对齐与分割推理。
  • 极具说服力的“自然图像逆向 ARC 变换”概念验证:作者设计了一个轻量级离散自编码器将 ImageNet 真实照片压缩至 \(60\times 60\)、10 种离散灰度值的 ARC 格式潜空间,直接利用训练好的 Nat-ARC 网格推理模型执行旋转 180° 或外加边框等抽象规则,成功在解码回真实照片后观察到平滑的猫咪旋转与相框叠加,直观验证了潜空间的表征一致性。
  • 纯视觉阵营首次突破 70% 大关:通过结合测试时数据增强与跨初始化范式的预测级投票,纯视觉模型在无需任何外部 LLM 辅助、无代码生成干预的情况下在 ARC-1 上达到 70.2%,超越了人类平均水平(60.2%)并逼近顶尖专用符号系统。

局限与展望

  • ARC-2 极限泛化能力依然薄弱:虽然在 ARC-1 上表现亮眼,但面对更长推理链与未见复合变换的 ARC-2 评测集,Nat-ARC 单模型仅获得 8.6%、集成获得 13.1%,与人类顶尖水平(100%)及前沿多模态大模型(如 Gemini 3 Pro 的 77.1%)存在巨大鸿沟,暴露出纯端到端前馈匹配对于深度多步递归推导的乏力。
  • 依赖大量离散数据增强与合成数据集支撑:离线阶段依然需要 40 万条 RE-ARC 合成样本以及推理期的大规模旋转/平移/颜色置换辅助任务微调,预训练表征尚未达到在“仅有 2 个原始示例”下直接执行零微调即时归纳的理想状态。
  • 未来方向:探索类似 LoopViT 或 OWM 的循环神经架构(Recurrent Transformer)与自然图像预训练大模型的有机融合,引入动态测试时自适应计算时间(Test-Time Compute),通过潜空间世界模型模拟更深层的试错与验证路径。

相关工作与启发

  • vs VARC (Hu et al., 2025): VARC 首创将 ARC 建模为图像到图像条件变换,但其完全依赖随机初始化并局限于 19M 参数小模型;Nat-ARC 补齐了关键的“自监督预训练”拼图,成功将参数规模拓展至 664M 且消除了尺度过拟合,性能从 54.0% 大幅跃升至 63.4%。
  • vs LoopViT (Shu et al., 2026) / Loop-OWM (Gao et al., 2026): 后两者着眼于时间维度上的循环递归推理机制(Recurrent Loops)与可组合世界模型设计;Nat-ARC 则专注于输入表征层面的视觉基础先验,两者机制高度互补,将自然图像预训练引入循环递归架构是显而易见的突破路径。
  • vs LLM 程序合成流派 (BARC / The ARChitects): 语言流派将网格转为字符串并调用巨大算力进行 DSL 代码抽样;Nat-ARC 证明仅需 0.6B 参数的纯视觉模型即可在无需编写任何代码的前提下达成相当的准确度,计算密度与推理时延具备显著优势。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次系统确证自然图像 MAE 预训练对抽象视觉网格推理的正向迁移机制]
  • 实验充分度: ⭐⭐⭐⭐⭐ [严谨的 5 种子重复实验、全尺度对照消融、注意力可视化与跨域概念验证实验完备]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密收敛,实验洞察深刻透彻,图表呈现极具专业学术水准]
  • 价值: ⭐⭐⭐⭐⭐ [打破了抽象推理只能依赖语言模型的固有成见,为纯视觉基础模型的抽象智力演进奠定了关键基石]