On Locality and Length-Generalization in Visual Reasoning¶
会议: ECCV 2026
论文: ECCV 原文
PDF: EventHosts
领域: 多模态VLM / LLM推理
关键词: 视觉推理, 长度泛化, 局部感知, 循环注意力, 状态追踪
一句话总结¶
论文揭示了现有视觉模型因全局单次感知极易习得全局捷径从而丧失长度泛化能力,证明了非线性循环网络结合严格局部注视点感知(Foveated Perception)是实现视觉组合推理与分布外长度泛化的充分必要条件。
研究背景与动机¶
当前主流的计算机视觉基础模型与多模态大模型(如 ViT、Qwen-VL、GPT-4o 系列)普遍采用全局单次前向推理机制,将整张高分辨率图像切分成网格 Token 并施加全注意力计算。这种全局前向计算与人类视觉系统存在本质差异——人类视觉依赖中央凹注视点(Foveal Glimpses)配合眼跳轨迹(Saccades)在二维空间中按需串行采样局部信息。近期大语言模型的研究表明,标准 Transformer 在位串奇偶校验等状态追踪任务上难以实现长度泛化,其核心病因是全局自注意力机制促使模型学到了浅层“快捷解”(Shortcut Solutions),无法实现归纳式的逐步符号推演。
这种失败在视觉域中表现得更为隐蔽且严重。在文本场景下,输入天然是预先切分好且有序排列的离散符号流;而在二维视觉推理任务中,信息在空间画布上呈非规则离散分布,模型必须同时完成“在空间中主动搜集局部信息”和“逐步更新隐式物理/符号状态”两个正交挑战。虽然语言域已有证据表明非线性循环网络(RNN)具备长度外推能力,但在视觉领域,循环架构是否足以抵抗分布外扰动?如果模型依然能总览全局图像,它是否仍会堕入捷径学习的陷阱?
为了回答这一核心问题,本文通过严格受控的视觉推理测试基准展开系统研究,发现单纯将全局图像输入循环网络依然会引发严重的捷径学习并在长度外推时彻底崩溃。实验证明,要实现真正的视觉状态追踪长度泛化,必须同时满足两大条件:状态更新必须依赖离散时间步的非线性循环计算,以及空间感知必须受到严格的局部视野约束。核心 idea:通过构建双尺度局部凝视循环智能体(FoveAgent-LSTM),迫使模型将全局二维视觉推理分解为局部信息采样与时序状态递推两阶段,从感知归纳偏置层面彻底阻断全局捷径学习,从而在未见任务长度与图像分辨率下实现稳健的分布外长度泛化。
方法详解¶
整体框架¶
本文针对视觉长度泛化提出了受控评测基准与局部循环感知智能体 FoveAgent-LSTM。系统针对二维视觉任务(如 Visual Parity、State Machine、Finding Roots)建立主动探索与序列决策机制:在每个离散时间步 \(t\),智能体维持自身内部隐藏状态 \(h_t\),并基于当前注视坐标 \(x_t\) 从高分辨率画布中截取两路视野:一路为高分辨率但空间跨度极小的中心注视切片(Foveated Glimpse \(G_l\)),另一路为空间覆盖范围较大但经双线性下采样到固定传感器分辨率的周边粗糙切片(Peripheral Glimpse \(G_p\))。
视觉编码器将两路视野特征拼接后送入非线性循环网络(LSTM),网络在更新系统全局状态表征的同时,通过多层感知机(MLP)预测下一步的空间位移向量 \(u_t\)、辅助局部探针属性 \(P_t\) 以及终止判定信号 \(s_t\)。整个推理过程由主动局部探索驱动,当收集到完备证据后输出最终推理答案。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["高分辨率输入画布"] --> B["双尺度局部视野感知<br/>中心注视切片 + 周边粗糙切片"]
B --> C["视觉骨干编码与特征拼接<br/>ResNet 提取并对齐局部表征"]
C --> D["时序状态递推与追踪<br/>LSTM 内部隐藏状态非线性更新"]
D --> E["双路动作与决策输出<br/>预测位移向量与辅助状态探针"]
E -->|未达终止条件| B
E -->|终止标志置位| F["系统全局状态与最终答案输出"]
关键设计¶
1. 双尺度局部视野感知:阻断全局感知捷径并保障导航探索 传统视觉大模型直接将全局图像送入 Transformer,这使得模型能够在浅层利用全局统计相关性拟合训练分布,从而跳过真实的逐步符号聚合。为从物理层面阻断全局捷径,FoveAgent 在位置 \(x_t\) 仅感知两个局部视窗:中心注视切片 \(G_l\) 尺寸精细且保持原图分辨率,专用于解析当前开关/符号的精细视觉细节;周边视窗 \(G_p\) 覆盖面积为 \(G_l\) 的 4 倍(即尺度因子 \(s=4\)),但被强制下采样到与 \(G_l\) 相同的固定传感器分辨率。这种非对称设计构成了极强的物理瓶颈:低分辨率周边切片能提供足够的地标方向线索以支持空间导航,但由于像素退化,模型无法直接通过周边切片偷窥相邻实体的具体微观状态,从而迫使模型必须将长程任务拆解为真实的局部跳转序列。
2. 步进式空间位移与局部探针多任务预测:约束局部跳转空间并加速轨迹学习 在序列决策中,如果允许模型在全局坐标空间任意跳跃,模型仍可能依赖全局坐标回归形成隐式空间快捷映射。FoveAgent 输出的下一步位移向量 \(u_t = (\theta, d)\) 被严格约束在极坐标参数空间中,其中方向角 \(\theta \in [0, 2\pi]\),步长 \(d \in [0, G_p]\)。这意味着下一个注视点中心 \(x_{t+1} = x_t + u_t\) 必须严格落在当前周边视窗的物理覆盖范围之内,确保了智能体视线轨迹的空间连续性与因果可达性。同时,模型配置了辅助探针预测头,在每个时间步输出当前注视切片的局部属性状态 \(P_t \in \{0, 1, \text{null}\}\)。该探针作为辅助监督信号,在不泄露未来全局状态的前提下,大幅增强了中间局部表征的语义对齐效率。
3. 外挂标记画布与缩放动作扩展:支持无序主动探索与长程外部工作记忆 在没有预置箭头指引的无序主动搜索场景中(如无序视觉奇偶校验),智能体不仅要计算系统状态,还必须记忆哪些实体已被访问。如果在 RNN 内部硬编码访问历史,随着实体数量激增(如 OOD 10-20 个开关),有限隐状态容量将迅速饱和。为此,架构引入轻量级外部工作记忆机制:当智能体处理完当前开关后,在环境画布对应的坐标位置渲染一个黑色标记点,后续经过该区域的切片均可见该物理标记。同时,将动作空间扩充离散的放大(Zoom-in)与缩小(Zoom-out)操作,使智能体能够在更大视野的低分辨率粗略寻径与高分辨率精细判别之间动态切换,成功将主动视觉搜索与局部循环状态追踪无缝统一。
损失函数 / 训练策略¶
模型采用行为克隆(Imitation Learning)策略在环境预置的最优策略(Oracle Policy)轨迹上进行端到端多任务监督训练。轨迹总损失由位移预测损失、辅助探针损失及终止预测损失加权组合: $$ \mathcal{L} = \mathcal{L}{\text{action}}(u_t, u_t^) + \lambda_1 \mathcal{L}_{\text{probe}}(P_t, P_t^) + \lambda_2 \mathcal{L}(s_t, s_t^*) $$ 其中位移预测采用平滑 }\(L_1\) 或角度/距离回归损失,探针分类与终止标志采用交叉熵损失。为了增强智能体在推理执行中的容错与纠偏能力,训练过程中对采样的注视点坐标施加高斯位置扰动噪声,确保智能体在发生轻微偏航时依然能通过低分辨率周边视觉重新对齐目标实体。
实验关键数据¶
主实验¶
论文在四类视觉推理任务上展开系统测试,重点对比模型在分布内(In-Distribution, InD)与分布外复杂度假定下的准确率。在视觉奇偶校验(Visual Parity)与有限状态机(State Machine)中,训练集仅包含 2–10 个开关,测试集考察 11–20 个开关的分布外长度外推;在函数零点查找(Finding Roots)中,测试集包含更多函数零点(OOD-numroots)与子图数量(OOD-subplots)。主对比涵盖 FoveAgent 系列与前沿全局模型(Qwen2.5-VL-3B-Instruct、GPT-5.4、Claude Sonnet 4.6 等)。
| 测试任务与模型配置 | InD 准确率 (%) | OOD 复杂度泛化 (%) | OOD 分辨率泛化 (%) |
|---|---|---|---|
| Visual Parity (2-10 vs 11-20 switches) | |||
| Qwen2.5-VL-3B-Instruct (CoT 微调) | ~92.0 | ~45.0 | ~38.0 |
| GPT-5.4 (Zero-Shot) | ~82.0 | ~35.0 | ~31.0 |
| Claude Sonnet 4.6 (Zero-Shot) | ~80.0 | ~32.0 | ~28.0 |
| FoveAgent-LSTM (本文方法) | 99.5 | 98.2 | 97.6 |
| State Machine (Modulo-3 Group Action) | |||
| Qwen2.5-VL-3B-Instruct (微调) | 95.8 | 32.4 | 26.5 |
| Qwen3.5-VL-27B (Zero-Shot) | 88.4 | 24.1 | 19.8 |
| Mamba (状态空间模型骨干) | 89.2 | 18.5 | 15.2 |
| xLSTM (带 M-LSTM 并行块) | 91.0 | 22.3 | 17.6 |
| FoveAgent-LSTM (本文方法) | 99.1 | 96.8 | 95.4 |
在真实数学图表推理任务 Finding Roots 上的细粒度对比(Table 1)如下:
| 测试场景配置 | 全局基线 G(1200,800) | G(300,200)+L | G(480,320)+L | G(600,400)+L | G(1200,800)+L (本文完整配置) |
|---|---|---|---|---|---|
| In-distribution (1-6 roots, 1-6 subplots) | 57.24 | 52.86 | 74.50 | 80.44 | 82.26 |
| OOD-subplots (7-9 subplots) | 50.12 | 43.94 | 57.49 | 68.78 | 77.24 |
| OOD-numroots (7-10 roots) | 32.63 | 57.81 | 61.62 | 65.85 | 67.12 |
| OOD-(subplots + numroots) | 35.53 | 49.25 | 50.92 | 59.70 | 57.46 |
消融实验¶
论文设计了严格控制的感知范式消融(图 5),探究不同视觉信息可见度对循环 LSTM 泛化性能的根本影响:
| 感知机制配置 | 输入信息形式 | InD 准确率 (%) | OOD 长度外推准确率 (%) | 失败模式分析 |
|---|---|---|---|---|
| Global (全局基线) | 完整任务高分辨率大图 | 94.6 | 28.3 | 严重依赖全局统计捷径,实体增多后注意力发散 |
| Local + Global (混合输入) | 局部高分辨率切片 + 全局高分辨率大图 | 95.2 | 31.5 | 只要存在全局高分辨率信息通道,模型便会抄近道退化 |
| FoveAgent-LSTM (局部+降采样周边) | 局部高清切片 + 低分辨率周边切片 | 99.5 | 98.2 | 强迫依赖局部因果推演,实现近乎无损的长度外推 |
同时,在周边视野尺度因子 \(s\) 与传感器分辨率 \(r\) 的权衡探索中,以综合指标 \(p_{rs} = A / L\)(成功率除以平均探索步长)评估感知效率:当尺度过大(如 \(s=16\))或分辨率过高(如 \(r=320\))时,指标剧烈恶化跌至 0.05 以下;而在 \(s=4, r=80\) 的适度模糊感知下,综合效能达到最高值 0.99。
关键发现¶
- 局部感知与循环计算的“双重必要性”:单纯拥有循环架构但具备全局视野的模型(Global / Local+Global)在 OOD 上依然完全失效;而只具备局部视野但采用非纯正循环(如带有全局计算因子的 Mamba、xLSTM 或 Transformer)的模型同样无法外推。只有二者结合才能实现稳健泛化。
- 状态追踪与检索绑定的本质分野:在无需状态递推的 RECALL 控制实验中,Qwen2.5-VL 等全局模型借助并行特征绑定显著超越串行模型;但在需要状态维护的奇偶校验与零点计数中,全局模型发生灾难性跌落。这证明局部循环感知针对的是纯粹的状态追踪瓶颈。
- 计算缩放定律的失效与有效边界:在 Finding Roots 实验中,直接将全局视窗计算量扩大 10 倍仅换来微弱的 +3.8% 提升,而采用同等计算量的局部中心凹策略(FoveAgent-Qwen)带来了高达 +29.0% 的绝对精度飞跃,证明算力必须合理分配给粗粒度寻径与细粒度局部感知。
亮点与洞察¶
- 触及视觉推理捷径学习的物理根源:论文指出现存视觉大模型长度泛化失败并非单纯是模型参数量或注意力上下文长度不够,而是全局单次注意力机制内生诱导出的捷径学习病态。
- 周边视野的分辨率退化是精妙的归纳偏置:通过主动把周边视野双线性下采样到模糊级别,既保留了空间位置用于引导下一跳导航,又在物理层面剥离了语义细粒度信息,从根源上阻止了全局捷径的渗透。
- 外部画布标记解耦内部记忆与几何遍历:在无序主动视觉搜索中,通过在图像上原地“打黑点”建立外部环境记忆,使固定维度的 RNN 隐状态彻底从“记忆几何访问历史”的沉重包袱中解脱出来,专注于递推系统状态。
局限与展望¶
- 策略获取高度依赖预置 Oracle 轨迹:当前 FoveAgent 的注视策略主要依赖人工编写的环境最优专家轨迹通过模仿学习获得,在复杂开放场景中难以直接生成通用的探索动作标签。
- 离散机械跳转缺乏自适应连续动态调整:目前的眼跳步长和传感器视窗分辨率属于静态固定配置,尚未实现根据场景拥挤程度和信息熵动态自适应调节的智能注视机制。
- 与大规模基础 VLM 预训练的深度融合有待探索:将局部注视感知机制无缝融入现有自回归或扩散架构的十亿级多模态底座中,仍需攻克训练吞吐与高效切片采样的工程瓶颈。
相关工作与启发¶
- vs Transformer 长度泛化研究 (Abbe et al., NeurIPS 2024; Anil et al., NeurIPS 2022):以往研究局限于离散文本词表,认为自注意力在长序列上无法精确按序检索;本文将该理论实质性拓展至连续二维视觉空间,揭示了空间聚合阶段面临的严重捷径学习。
- vs 自适应循环视觉模型 (Veerabadran et al., NeurIPS 2023):该工作虽然引入了循环网络进行难度外推,但模型每个时间步依然感知整幅全图,导致分辨率缩放时性能急剧下降;本文明确指出“严格局部感知”是治愈该缺陷不可或缺的拼图。
- vs 传统空间注视模型 (Mnih et al., NeurIPS 2014 RAM):早期 RAM 等模型侧重于降低计算开销与模拟生物视觉注意力;本文跳出了单纯计算效率的视角,首次将中心凹注视上升到解决算法组合性与分布外长度泛化理论瓶颈的高度。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次从状态追踪与长度外推视角确立了局部感知在视觉推理中的必要性。
- 实验充分度: ⭐⭐⭐⭐⭐ 合成可控基准与真实数学图表任务互为印证,机制消融深入透彻。
- 写作质量: ⭐⭐⭐⭐⭐ 论点递进严密,从生物视觉隐喻到算法捷径剖析条理清晰。
- 价值: ⭐⭐⭐⭐⭐ 为破除多模态大模型在复杂结构化图表与空间长程推理中的幻觉捷径提供了崭新架构范式。