跳转至

NAPA: Natively Multimodal Autoregressive Perception Architecture

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/tiiuae/falcon-perception
领域: 语义分割
关键词: 原生多模态, 自回归感知, 开放词表分割, 混合注意力, 特征上采样

一句话总结

提出单阶段早期融合 Transformer 架构 Falcon Perception (NAPA),通过混合双向-因果注意力与粗到细自回归感知链,消除编码器-解码器割裂并实现高分辨率掩码并行高效生成。

研究背景与动机

现有的开放词表目标检测与密集分割系统长期依赖于模块化的编码器-解码器(Encoder-Decoder)范式。这一范型通常采用独立的视觉主干网络提取高维图像特征,再通过交叉注意力或后融合解码器与文本查询进行交互并预测几何边界或掩码。虽然这种流水线结构在传统封闭集检测中表现稳健,但它人为割裂了视觉与语言表征空间,导致跨模态交互被局限在顶层较晚的阶段。随着多模态大语言模型(VLM)的发展,研究者尝试将目标检测与分割任务离散序列化为多边形或边界框 Token,但这种纯序列化策略在面对密集感知场景(数百个目标实例、数千个坐标顶点)时会导致序列极度膨胀、自回归解码代价极高。

模块化拆分带来的深层矛盾在于:视觉表征与文本语义在浅层无法双向交互,面对属性绑定、空间关系判断以及复杂组合推理时容易发生幻觉或注意力脱节;而如果直接套用纯自回归语言模型生成密集像素级输出,又会遭遇计算复杂度的灾难性瓶颈。现有的早期融合多模态模型往往不得不引入模态专属的投影层、归一化甚至 MoE 结构,不仅破坏了参数同构的优雅性,也依然难以兼顾端到端密集掩码的高分辨率精细度。

本文的核心思路是探索密集感知任务是否真的需要割裂的编码器与解码器,提出一种统一的原生多模态自回归架构。核心 idea:将图像 Patch、文本提示与任务 Token 映射至完全共享的单个 Transformer 参数空间中,采用视觉双向与文本/任务因果的混合注意力掩码,并提出基于“感知链”(Chain-of-Perception)的轻量连续解耦接口,以离散 Token 锚定实例、以特征点乘并行解码高分辨率连续掩码。

方法详解

整体框架

Falcon Perception 打破了传统将“看”与“预测”拆解给独立编码器与解码器的做法。模型由单一密集 Transformer 主干 \(f_\theta\)、傅里叶特征坐标/尺度编码器,以及无参/轻量任务头组成。模型输入将图像切块投影得到的视觉嵌入 \(V \in \mathbb{R}^{N \times d}\)、文本提示嵌入 \(T \in \mathbb{R}^{L \times d}\) 与各个待预测对象的任务 Token 拼接为单一序列 \(X \in \mathbb{R}^{(N + L + 3K) \times d}\)。

在自回归解码中,模型按照结构化的感知链(Chain-of-Perception)顺序依次预测每个实例的中心坐标 Token <coord>、尺寸 Token <size> 以及分割 Token <seg>。预测出的中心与尺寸连续数值经傅里叶特征投影后作为强空间先验回注序列,而最终生成的 <seg> 隐藏状态则与图像感知上采样特征直接进行点乘,并行计算高分辨率二值掩码。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态输入<br/>图像原生Patch + 文本提示词"] --> B["单主干早期融合 Transformer<br/>混合注意力:图像双向 + 文本因果"]
    B --> C["3D 旋转位置编码<br/>1D 序列因果 + GGRoPE 2D 各向同性空间旋转"]
    C --> D["感知链自回归解码<br/>Raster顺序:coord → size → seg"]
    D --> E["傅里叶特征空间编码<br/>高斯随机映射抑制谱偏差并先验回注"]
    D --> F["通用特征上采样与掩码点乘<br/>AnyUp跨注意力图引导 + seg向量点积输出"]
    E -->|连续几何约束注入| D
    F --> G["多任务输出<br/>目标边界框 + 实例高分辨率分割掩码"]

关键设计

1. 混合注意力机制:兼顾二维视觉全局上下文与一维生成因果性 传统自回归因果掩码在处理二维视觉 Patch 时存在本质缺陷,破坏了空间邻域各向同性的双向上下文关系;而全双向注意力又无法支持自回归式的变长序列预测。为此,设计了针对异构序列的混合注意力掩码(Hybrid Attention Mask):图像 Patch 之间允许全双向自注意力交互,充当双向视觉编码器;而文本提示词与任务 Token 则对所有图像 Patch 开放全连接注意力,但在文本和任务序列内部严格遵循因果因果掩码(Causal Mask)。这一设计使得同一个 Transformer 权重矩阵在底层同时扮演了双向视觉特征抽取器与自回归序列推理机,彻底移除了编码器-解码器跨注意力桥接模块。

2. 3D 旋转位置编码:分解解耦序列时序与二维连续空间关系 针对扁平化展开的图像序列破坏二维几何结构的问题,将多头注意力的头维度 \(d_{\text{head}}\) 严格解耦为两个正交子空间:前半部分 \(d_{\text{head}} / 2\) 采用标准 1D RoPE 编码展平序列中的绝对索引 \(t\),维持语言与自回归生成的时序因果性;后半部分 \(d_{\text{head}} / 2\) 则引入 Golden Gate RoPE (GGRoPE) 编码二维连续网格坐标 \(p = (x, y)\)。GGRoPE 沿着由黄金分割比 \(\phi\) 在单位圆上均匀采样的基向量集合 \(\{u_j\}\) 计算投影旋转角: $\(\theta_j = \omega_j (p \cdot u_j)\)$ 这种各向同性的旋转编码使模型摆脱了传统 Axial RoPE 轴向正交的归纳偏置,赋予模型在任意几何方向与非标准纵横比下稳健的空间感知能力,且该二维旋转仅施加于有效视觉 Patch 上,保证了文本与视觉特征的计算隔离。

3. 连续傅里叶特征投影与光栅扫描感知链:化解离散量化与实例歧义 为解决直接自回归输出密集像素掩码带来的计算爆炸,提出“粗到细”的感知链输出拓扑。将每个实例解耦为中心坐标 \(c\)、尺寸 \(s\) 以及掩码 Token <seg>。针对传统 1000-bin 离散坐标分箱带来的谱偏差(Spectral Bias)与低频优先问题,采用随机高斯映射矩阵 \(B \in \mathbb{R}^{d/2 \times 2}\)(标准差 \(\sigma = 10.0\))将连续空间坐标映射至高维频域流形: $\(\gamma(c) = [\cos(2\pi B c), \sin(2\pi B c)]\)$ 投影后的高频连续特征直接替换静态 Token 嵌入注入输入流。在多目标预测中,采用从上至下、从左至右的光栅扫描(Raster Ordering)顺序,使模型摆脱了无序匹配歧义,显著加快坐标头的收敛速度。

4. 基于通用特征上采样的密集掩码并行点乘:去重型解码器设计 在完成坐标与尺度锚定后,<seg> Token 已经消除了实例混淆并吸收了全图的早期融合多模态上下文。为了以最小开销重构精细边缘,集成冻结的通用图像感知特征上采样模块 AnyUp。该模块以原始高分辨率图像 \(I \in \mathbb{R}^{H \times W \times 3}\) 为 Query 提取边缘指纹,以主干网络输出的视觉特征 \(V_{\text{out}}\) 为 Key/Value 进行交叉注意力插值,构建高分辨率高保真特征图 \(V^* \in \mathbb{R}^{H \times W \times d}\)。实例二值掩码无需经过复杂的掩码解码器,仅通过一个投影点乘操作即时闭式解出: $\(\hat{m} = \sigma\left(V^* \cdot \text{Proj}(h_{\text{seg}})^T\right)\)$ 将复杂的实例稠密预测压缩为单步内积运算,兼顾了自回归生成的表达灵活性与密集像素生成的并行吞吐效率。

损失函数 / 训练策略

训练采用两阶段递进式蒸馏与对齐课程: 1. 多教师特征蒸馏阶段:引入 DINOv3 与 SigLIP2 作为冻结视觉教师,同时引入 Gram 矩阵正则化损失,约束学生网络浅层 Patch 表征的相关性矩阵与教师对齐,保障底层视觉几何结构的稳定性。 2. 感知链多任务预训练(约 700 GT): - Stage 1 (450 GT):全序列端到端自回归列表生成,采用反向学习率衰减(\(4\times 10^{-4} \to 1\times 10^{-4}\)),每条表达最多输出 100 个掩码; - Stage 2 (225 GT):任务与推理对齐微调,开启查询隔离掩码(Query Masking)并屏蔽 Prompt 上的损失计算,学习率衰减至 \(4\times 10^{-6}\); - Stage 3 (10 GT):密集长上下文精调,最大掩码容量扩充至 600 个/表达。 3. 优化与工程技巧:采用针对隐层优化的 Muon 优化器配合 Kimi Moonlight 更新规则;面对任意长宽比图像采用 Scatter-and-Pack 序列打包,并利用跨 rank 全局归一化解决变长 Token 导致的梯度倾斜问题。

实验关键数据

主实验

在开放词表密集分割基准 SA-Co 与细粒度能力解耦基准 PBench 上,Falcon Perception(仅 600M 参数)展现出了超越大体量专有模型与通用 VLM 的综合感知实力。

模型 参数量 SA-Co Avg Macro F1 SA-Co pmF1 SA-Co MCC PBench Avg Macro F1 RefCOCOm F1
gDino-T ~170M - 16.2 0.15 - -
OWLv2* ~430M - 42.0 0.57 - -
DINO-X - - 55.2 0.38 - -
Qwen3-VL-2B + SAM 2B 50.3 36.8 0.65 37.0 54.0
Qwen3-VL-8B + SAM 8B 56.4 41.1 0.79 49.0 64.7
Qwen3-VL-30B + SAM 30B 62.8 49.9 0.64 52.7 72.1
Moondream2 2B 62.5 53.5 0.43 44.7 62.0
Moondream3 9B 58.0 47.8 0.45 50.5 87.1
SAM 3 0.9B 62.3 66.1 0.82 44.4 36.4
Falcon Perception (本文) 0.6B 68.0 62.1 0.64 57.0 77.3

在 PBench 的各级细粒度能力评测中,Falcon Perception 随着提示词复杂度与空间约束提升展现出了巨大优势:

模型 L0 (简单物体) L1 (属性绑定) L2 (OCR引导) L3 (空间理解) L4 (关系绑定) Dense (密集极端场景)
SAM 3 64.3 24.6 54.4 31.6 33.3 58.4
Moondream3-9B 63.2 41.8 59.6 45.4 42.3 12.9
Qwen3-VL-8B + SAM 65.6 58.2 65.6 49.1 50.9 4.7
Qwen3-VL-30B + SAM 69.2 61.2 68.8 52.9 55.2 8.9
Falcon Perception (0.6B) 65.1 38.0 63.6 53.5 49.1 72.6

消融实验

针对架构关键优化器、正则化及序列建模设计的消融验证:

消融维度 配置变量 PBench 评估指标 SA-Co 评估指标 关键机制说明
优化算法 AdamW 56.4 (Det F1) 49.0 (Det F1) 标准优化器多任务多头收敛较慢
优化算法 Muon (采用) 57.7 (Det F1) 53.8 (Det F1) 隐层矩阵正交化更新显著降低各头 Loss
特征正则化 w/o Gram Loss 52.7 (Seg F1) 51.1 (Seg F1) 缺少结构正则化,自回归调优破坏预训练底层特征
特征正则化 With Gram Loss 53.8 (Seg F1) 52.6 (Seg F1) 维持与视觉教师 Patch 间相关性,分割质量提升
实例生成顺序 Random 随机排序 52.2 (Det F1) 46.3 (Det F1) 目标跳跃带来严重的空间自回归学习歧义
实例生成顺序 Size 降序排序 57.7 (Det F1) 53.8 (Det F1) 大目标优先稳定大轮廓,但忽略局部扫描连续性
实例生成顺序 Raster 光栅扫描 59.3 (Det F1) 56.2 (Det F1) 符合空间局部性连续探索模式,检测头 Loss 最低

关键发现

  • 密集场景的“分辨率相变”现象:在图像分辨率从 \(448^2\) 提升至 \(1024^2\) 时,语义识别(如存在性判别 MCC)仅提升了 1.6 倍,而在 PBench Dense 极端密集切片上,密集实例定位(pmF1)暴增了 15 倍(从 3.9% 跃升至 61.0%)。这揭示出通用大模型在拥挤场景下的瓶颈不在于语义“认不出”,而在于高频“空间细节无法离散解析”。
  • Pass@k 随机采样挖掘潜在分布能力:通过对坐标头与尺寸头进行随机采样并取最优预测,Pass@8 模式使 SA-Co 上的 cgF1 从确定性生成的 34.7 激增至 54.3(+19.6 点),尤其在 Wiki-Common 难例上实现翻倍提升,证明自回归极大似然训练有效保留了多义性感知分布。
  • 冷启动崩溃与蒸馏初始化的不可替代性:在从零随机初始化(Scratch)训练稠密掩码分割时,模型由于浅层缺乏空间结构感知而发生梯度爆炸迅速发散,而多教师特征蒸馏不仅稳定了训练,且性能大幅领先训练超过 230K 步的从零初始化基线。

亮点与洞察

  • 极简主义感知自回归:将原本臃肿的视觉骨干与交叉掩码解码器压扁为单个 Transformer,用一个包含 <coord><size><seg> 的 3-Token 感知链就优雅打通了从实例定位到高分辨率密集像素生成的全过程。
  • GGRoPE 空间各向同性探索:将旋转位置编码按照黄金分割比分解在单位圆多方向投影,避免了直角坐标系下水平/垂直的归纳偏见,对不规则长宽比图像和倾斜排布目标的定位精度提升极为明显。
  • 可复用的通用密集点乘接口:结合预训练且冻结的 AnyUp 交叉特征上采样器,掩码生成被简化为一个矩阵内积,不仅让 600M 模型拥有了极高推理吞吐,还直接规避了传统分割头中沉重的多层特征金字塔与计算开销。

局限与展望

  • 负样本与空目标校准偏弱:在 SA-Co 存在大量无目标干扰项(Hard Negatives)的数据集上,Image-Level MCC(0.64 vs. 0.82)落后于 SAM 3,自回归模型倾向于过度联想并产生误检。
  • 超小文字与极端重度退化泛化受限:虽然在 300M 参数的 Falcon-OCR 实验中取得了优秀成绩(olmOCR 80.3%),但在极低分辨率模糊字符或强反光严重扫描件上,单一小模型的恢复精度依然存在天花板。
  • 未来方向:探索在感知链中引入视觉强化学习(RLAIF/DPO)以校准误检率,并将该统一无编码器架构扩展至视频目标跟踪及交互式具身控制任务。

相关工作与启发

  • vs SAM 3: SAM 3 依托巨量提示微调与双分支跨注意力编码器,在常规视觉提词与存在性校准(MCC 0.82)上极强,但在需要 OCR 定位、复杂空间方位及复合关系绑定的长尾高阶场景中频频失效;Falcon Perception 依托底层早期语义融合,在 L3 空间理解上大幅超越 SAM 3 达 21.9 个百分点。
  • vs Qwen3-VL / Moondream 通用通用模型: 通用大模型采用离散文本输出边界框,在普通场景下具备较好推理常识,但在密集实例场景(Dense split)发生严重的幻觉与序列过长导致的遗忘现象(Qwen3-VL-30B 仅得 8.9 分);Falcon Perception 凭借专有光栅化感知链机制在该场景砍下 72.6 分,在轻量化与高密度感知上建立了显著优势。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 彻底抛弃 Encoder-Decoder 范式,首次在 600M 尺度验证纯原生早期融合自回归架构在稠密高分辨率分割中的优越性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 构建五级递进评测集 PBench、跨 SA-Co 及 RefCOCO 评估,并覆盖消融、分辨率相变及 OCR 多任务横向验证。
  • 写作质量: ⭐⭐⭐⭐⭐ 论证脉络极度严密,方法设计兼顾优雅理论与工程可落地性。
  • 价值: ⭐⭐⭐⭐⭐ 为下一代具身感知、轻量端侧视觉基础模型以及统一多模态大模型的密集视觉解码开辟了清晰的新路径。