Scaling Dense Prediction with Latent Decoding¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://pointcept.org/l-dpt
领域: 模型压缩
关键词: 密集预测, 隐空间解码, 模型扩展性, 极高分辨率推理, 轻量化架构
一句话总结¶
针对传统金字塔像素解码在超高分辨率下显存激增且细节退化的瓶颈,L-DPT 提出将密集预测的表示容量与像素渲染彻底解耦,在 ViT patch 尺度的紧凑隐空间内通过 RoPE 注意力完成全量语义与几何推理,仅在末端使用极轻量 PixelShuffle 读出,实现固定 768 训练分辨率外推至 100MP(1 亿像素)超清图像的高保真平稳推理。
研究背景与动机¶
现代密集预测模型(如 DPT、Mask2Former、U-Net 等)长期主导着深度估计、语义分割及底层视觉任务,其核心设计遵循自底向上的金字塔像素解码范式:通过多级上采样层级将低分辨率特征逐步提升至与输入或目标对齐的密集像素网格,并在每个像素尺度上进行通道融合与空间卷积/注意力精炼。然而,随着自动驾驶、具身智能与专业级摄影对极高分辨率密集感知的需求日益迫切,这种将建模容量与像素网格物理绑定的机制迅速撞上了难以逾越的“双重墙”。
首先是系统层面的“效率墙”:金字塔解码迫使系统在多个中间尺度上显式实例化庞大的特征图激活值,导致解码器的峰值显存占用随分辨率呈平方级爆炸,推理延迟亦剧烈恶化。例如配备 ViT-7B 骨干的 DINOv3 传统 DPT 解码器在输入推高至 32MP 时在 192GB 显存的 B200 GPU 上直接遭遇 OOM,并在超高清输入下面临高达数百秒的系统级卡顿。更为致命的是算法层面的“能力墙”:当盲目增大输入图像分辨率时,传统金字塔解码器并未将新增的像素转化为更精确的高频几何结构,反而因多级连续上采样与插值平滑效应,使得树叶、细枝、细杆等纤细结构被过度模糊与抹平,呈现出“像素越多、预测越糊”的倒退悖论。
这一困境的根源在于将“密集表征容量”与“高分辨率像素网格”硬性交织在一起。密集预测本质上需要的是全局连贯的语义关系与跨层级的几何抽象,这完全可以在低维紧凑的隐空间中高效完成,而非在数以千万计的像素点上反复堆叠重型网络层。核心 idea:将密集预测明确拆解为隐空间“高容量推理”与像素空间“轻量级渲染”两个独立阶段,解码计算完全留在紧凑的 token 隐空间内,末端仅靠轻量算子读出像素,实现计算成本与输出分辨率的解耦。
方法详解¶
整体框架¶
L-DPT 将密集预测任务重构为“隐空间推理(Reasoning in Latents)+ 像素空间渲染(Rendering to Pixels)”的流线型双阶段架构。给定输入图像 \(x \in \mathbb{R}^{H \times W \times 3}\),冻结的 Vision Transformer 骨干网络(如 DINOv3 ViT-7B)将其划分为 patch 尺寸为 \(P \times P\) 的 token 序列,有效 token 数量为 \(N = \frac{H}{P} \times \frac{W}{P}\),并输出 \(S\) 个指定中间层的特征集合 \(\{F^{(s)}\}_{s=1}^S\)。
整个解码过程完全在一个单尺度的隐状态网格 \(Z \in \mathbb{R}^{N \times D}\) 上展开,初始状态 \(Z^{(0)}\) 采用全零初始化。在解码器的各个阶段中,阶段自适应选择模块将多层骨干特征动态投射为该阶段专用的特征库,通过轻量级加法注入隐状态流,随后由配备 2D 连续坐标 RoPE 的自注意力与 FFN 块完成密集的上下文聚合与几何解算。当且仅当所有多阶段隐空间推理执行完毕后,终态隐特征才通过一个极轻量的投影层配合 PixelShuffle 还原为原始尺寸的高分辨率密集预测场。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 (H × W × 3)<br/>超高分辨率摄影输入"] --> B["冻结 ViT 骨干网络<br/>抽取 S 层多级特征池 F"]
B --> C["阶段自适应特征选择<br/>拼接全层通道,按阶段线性压缩投影"]
C --> D["极简隐状态注入机制<br/>轻量加法注入单尺度隐状态 Z"]
D --> E["连续坐标 RoPE 增强注意力<br/>隐空间自注意力与 FFN 迭代精炼"]
E --> F["轻量像素重排读出<br/>单层线性投影 + PixelShuffle 读出"]
F --> G["密集预测输出 (H × W × K)<br/>高保真深度图 / 语义分割图"]
关键设计¶
1. 阶段自适应特征选择:解耦通道压缩与多层级特征池
传统金字塔解码器采用硬编码的阶段绑定策略,将深层特征分配给小分辨率粗阶段,浅层特征分配给上采样后的高分辨率细阶段,严重限制了语义交互的灵活性。L-DPT 彻底打破这种层级绑定,将选取的 \(S\) 个编码器中间层特征在通道维度全量拼接,构建统一特征池 \(\bar{F} = [F^{(1)} \parallel F^{(2)} \parallel \cdots \parallel F^{(S)}] \in \mathbb{R}^{N \times \sum C_s}\)。在解码器的第 \(\ell\) 个阶段,引入专用的线性投影矩阵 \(W_{\text{sel}}^{(\ell)}\),直接从全层特征池中自适应提取当前阶段所需的语义与几何组合:
该设计的精妙之处在于将空间金字塔层级的特征融合转化为纯粹的通道空间动态筛选。每个解码阶段面对完全相同的全局特征池,却能依据自身的抽象层级自主决定是重用低层纹理细节还是提取高层语义先验,不仅消除了跨分辨率对齐的重计算开销,更赋予了模型远超传统固定调度(Fixed-Schedule)的表征自由度。
2. 极简隐状态注入机制:轻量加法条件注入
在完成阶段特征选择后,如何将外部编码器引导信号融入持续演进的隐状态流是保持高效性的关键。为避免在解码过程中重新引入沉重的交叉注意力(Cross-Attention)或复杂的密集融合算子,L-DPT 将注入操作定位于纯粹的特征暴露机制。在默认实现中,直接采用元素级轻量加法更新隐状态:
该机制完全消除了任何空间尺度的冗余交互开销,将计算复杂度严格约束在 \(O(N \cdot D)\)。实验证明,由于前置的阶段自适应选择已经在线性空间内完成了充分的特征重加权,极简的加法注入足以支撑高质量的下游几何重建与语义解算,同时保持了解码主干计算图的极致纯粹。对于多任务学习或异质模态输出场景,该模块亦可无缝切换为交叉注意力或自适应归一化(AdaLN)。
3. 连续坐标 RoPE 增强注意力:摆脱像素金字塔的位置外推
在单尺度的隐状态网格上进行全局推理,要求模型在输入分辨率剧烈缩放时仍能保持对空间几何拓扑的精确感知。L-DPT 在所有自注意力层中引入基于二维连续坐标的旋转位置编码(2D RoPE),将归一化到 \([0, 1]\) 连续区间的空间相对坐标编码进查询向量与键向量的旋转变换中。
更为核心的是其配套的尺度泛化增强策略:在训练期间,输入坐标在计算 RoPE 之前会施加随机坐标缩放(Rescaling 范围为 \(\times 1/8\) 至 \(\times 8\))与坐标抖动(Coordinate Jitter 强度 1.2)。这种将连续相对几何变换内化到自注意力内部的机制,使得即使仅在 \(768 \times 768\) 固定尺寸下训练,模型也能直接理解数万乃至数十万 token 组成的密集隐式网格,实现向 100MP 超大分辨率的零样本免微调平滑外推,彻底摆脱了传统金字塔结构对特定网格尺度的先验依赖。
4. 轻量像素重排读出:让像素仅承担渲染职能
为了坚决杜绝“读出头退化为伪装的第二解码器”,L-DPT 将空间升采样与像素生成严格限制在最后一层的瞬时读出。读出层仅由一个线性投影矩阵与标准的 PixelShuffle(子像素卷积重排)算子构成。线性层将隐通道扩展至 \(P^2 \times K\)(其中 \(P\) 为 ViT 的 patch 大小,\(K\) 为目标通道数),随后通过内存视图重排直接展开为 \(H \times W \times K\) 的密集场。
该算子不包含任何可学习的空间卷积核或非线性层级迭代,计算量相对于主干近乎忽略不计。由此,随着输入图像尺寸的扩张,模型所承担的仅是确定性的通道到像素重排开销,真正做到了“容量留在隐空间,像素仅作为读出表面”。
损失函数 / 训练策略¶
L-DPT 采用全局统一且面向超高分辨率外推的训练方案。模型冻结预训练的 DINOv3 ViT-7B 骨干网络参数,仅对轻量级的 L-DPT 解码头进行端到端优化。
在数据增强方面,所有下游任务均采用强尺度抖动:首先以 \([0.5, 2.0]\) 的随机双三次插值缩放比调整图像,随后裁剪为统一的 \(768 \times 768\) 分辨率进行训练。结合前述的 RoPE 连续坐标缩放(\(\times 1/8 \sim \times 8\))与坐标抖动(1.2),迫使模型在受控的固定显存开销下学习适应跨越数个数量级的有效采样密度变化。对于相对深度估计任务,采用仿射不变损失函数(Scale and Shift Invariant Loss);对于语义分割任务,采用标准交叉熵损失配合辅助监督,优化器使用 AdamW,保持学习率稳定收敛。
实验关键数据¶
主实验¶
评估在相对单目深度估计(Zero-shot 泛化至真实数据集)和语义分割两个核心密集感知任务上展开。所有基于 DINOv3 的方法均冻结相同的 ViT-7B 骨干网络,仅训练解码器。
下表展示了合成数据训练后在 NYUv2、KITTI、ETH3D 与最难的转移基准 DIODE 上的相对深度估计零样本性能:
| 方法 | 骨干网络 | 解码器参数 | 可训参数 | NYUv2 (ARel ↓ / \(\delta_1\) ↑) | KITTI (ARel ↓ / \(\delta_1\) ↑) | ETH3D (ARel ↓ / \(\delta_1\) ↑) | DIODE (ARel ↓ / \(\delta_1\) ↑) |
|---|---|---|---|---|---|---|---|
| MiDaS | 87M | 19M | 106M | 11.1 / 88.5 | 23.6 / 63.0 | 18.4 / 75.2 | 33.2 / 71.5 |
| LeReS | 89M | 44M | 133M | 9.0 / 91.6 | 14.9 / 78.4 | 17.1 / 77.7 | 27.1 / 76.6 |
| Marigold | - | 2.3B | 2.3B | 5.5 / 96.4 | 9.9 / 91.6 | 6.5 / 96.0 | 30.8 / 77.3 |
| DPT (Depth Anything V2) | 1.1B | 200M | 1.3B | 4.4 / 97.9 | 7.5 / 94.7 | 13.1 / 86.5 | - / - |
| DPT (DINOv3 Baseline) | 7B (冻结) | 230M | 230M | 4.3 / 98.0 | 7.3 / 96.7 | 5.4 / 97.5 | 25.6 / 82.2 |
| L-DPT S (本文) | 7B (冻结) | 23M | 23M | 5.0 / 98.4 | 8.6 / 94.8 | 6.8 / 96.4 | 22.6 / 84.4 |
| L-DPT B (本文) | 7B (冻结) | 98M | 98M | 4.9 / 98.4 | 8.2 / 95.5 | 6.0 / 97.0 | 22.2 / 84.9 |
| L-DPT L (本文) | 7B (冻结) | 269M | 269M | 4.3 / 98.2 | 7.4 / 96.5 | 5.2 / 97.6 | 22.0 / 84.5 |
下表展示了语义分割任务在 COCO-Stuff 164k 与 PASCAL VOC 2012 上的 mIoU 对比(单尺度测试与水平翻转 TTA):
| 方法 | 骨干网络 | 解码器参数 | 可训参数 | COCO-Stuff (Simple / TTA) | PASCAL VOC 2012 (Simple / TTA) |
|---|---|---|---|---|---|
| Previous Best | - | - | 1.5B/0.5B | 53.7 / 53.7 | - / 90.0 |
| DINOv3 Segmentor (Mask2Former) | 7B (冻结) | 927M | 927M | 53.8 / 54.0 | 90.1 / 90.4 |
| L-DPT S (本文) | 7B (冻结) | 23M | 23M | 53.5 / 53.6 | 93.4 / 93.6 |
| L-DPT B (本文) | 7B (冻结) | 98M | 98M | 53.8 / 54.0 | 93.8 / 93.8 |
| L-DPT L (本文) | 7B (冻结) | 269M | 269M | 54.0 / 54.2 | 94.0 / 94.1 |
消融实验¶
1. 特征注入与选择机制消融(Hypersim 相对深度验证集)
| 特征注入与选择机制 | ARel ↓ | \(\delta_1\) ↑ (%) | 说明 |
|---|---|---|---|
| 固定调度金字塔融合 (Fixed-Schedule) | 9.67 | 91.77 | 模拟传统金字塔分阶段硬绑定融合 |
| 跨阶段共享选择器 (Shared Selection) | 9.24 | 92.06 | 全阶段复用同一个压缩投影矩阵 |
| 阶段自适应动态选择 (Stage-wise Adaptive Selection) | 8.89 | 92.76 | 本文方案:各阶段独立学习通道重加权投影 |
2. 极高分辨率下显存与延迟极限评测对比(对比传统 DPT 与隐式场 InfiniDepth)
| 测试配置 / 模型 | 输入分辨率 | 硬件平台 | 峰值显存 (Mem) | 推理延迟 (Lat) | 状态 / 表现 |
|---|---|---|---|---|---|
| DINOv3 + DPT | 32MP | NVIDIA B200 (192G) | OOM | - | 显存爆炸崩溃 |
| DPT 解码器测试 | 63MP 极限 | 单 GPU | 59.4 GB | 394.0 s | 延迟恶化,系统卡死 |
| InfiniDepth (DINOv3-L) | 任意分辨率连续场 | NVIDIA H800 | 10.2 GB | 3.38 s | 基于隐式坐标采样查询 |
| L-DPT L (DINOv3-L) | 任意分辨率等效 | NVIDIA H800 | 5.7 GB | 1.74 s | 显存降低 44%,速度快近 2 倍 |
| L-DPT 解码器测试 | 63MP 极限 | 单 GPU | 15.3 GB | 5.3 s | 保持平稳线性扩展,极度流畅 |
关键发现¶
- 跨域泛化出现显著质量逆转:在域分布偏离最严峻的 DIODE 基准上,仅有 23M 参数的 L-DPT S 取得了 22.6 的 ARel 和 84.4% 的 \(\delta_1\),全面大幅碾压拥有 230M 参数的金字塔 DPT 基线(ARel 25.6,\(\delta_1\) 82.2%)。这表明像素空间的层层上采样卷积容易对特定训练域的局部模式产生严重过拟合,而隐空间内的纯注意力推理保留了更为本质的几何拓扑关系。
- 阶段自适应特征选择的不可替代性:消融表明将硬绑定的金字塔调度替换为自适应选择使得 ARel 显著下降了 0.78(9.67 \(\rightarrow\) 8.89)。而各阶段独立的重加权投影进一步优于共享选择器,证实了在单尺度隐空间内,网络需要针对不同的推理深度重新组合深浅层特征混合比。
- 打破重型分割头迷信:在语义分割任务中,仅 98M 参数的 L-DPT B 即追平了由 ViT-Adapter 与 Mask2Former 堆叠而成的 927M 巨型金字塔解码头(COCO-Stuff 53.8 mIoU),且在 PASCAL VOC 2012 上以 93.8 对 90.1 形成 3.7 mIoU 的巨大领先优势。
亮点与洞察¶
- 重构密集预测设计哲学:“在隐空间推理,由像素来读出(Reason in Latents, Render to Pixels)”。该思想将传统密集预测从像素网格的物理奴役中解放出来,将分辨率仅仅当作末端输出渲染的一个普通超参数,而非计算复杂度的放大器。
- 零样本分辨率超外推的有效范式:通过连续坐标 2D RoPE 配合宽范围坐标缩放与抖动,模型得以将空间几何规律与绝对像素密度解耦。训练时仅消耗 \(768 \times 768\) 的廉价开销,推理时直接支持 100MP(1 亿像素)专业图像输入,且叶片、藤蔓等微小细丝结构清晰逼真,杜绝了传统架构的高清变模糊现象。
- 通用的模型压缩与极速部署模板:L-DPT 证明了无需复杂的多尺度特征金字塔、可变形注意力或重型掩码分类器,仅需单尺度自注意力配合两处极轻量的线性变换即可达成 SOTA 性能,为移动端与云端超清图像密集感知提供了极致紧凑的高性能标杆。
局限与展望¶
- 密集全注意力对极端 token 序列的平方复杂度:虽然 L-DPT 将计算从像素级压制到了 ViT patch 级(如 \(P=14\) 或 \(P=16\)),但在 100MP 输入下,输入 token 数仍达到了约 40 万。直接进行全局稠密自注意力计算会导致显存与计算量二次方增长,当前依赖分块或线性注意力技巧,未来引入稀疏动态查询(Sparse Queries)与自适应计算分配是进一步突破算力极限的关键。
- 缺乏端到端全分辨率原生联合训练:目前模型优异的分辨率外推能力完全依靠训练时的坐标尺度扰动实现,未曾真正使用原生超高分辨率无损大图进行端到端微调。构建分辨率感知的动态 Batching 训练管线是释放其极限潜力的重要方向。
- 确定性预测向概率生成式的拓展:当前模型采用确定性读出,未来可借鉴潜扩散模型(Latent Diffusion)的思想,在紧凑隐空间中引入流匹配(Flow Matching)或扩散迭代机制,以更好地表达超高清图像中的几何深度不确定性与遮挡多模态性。
相关工作与启发¶
- vs DPT (Vision Transformers for Dense Prediction):DPT 作为目前最普遍的 ViT 密集解码头,采用多层重组(Reassemble)将 Transformer 特征逐级还原为 \(\frac{H}{8}, \frac{H}{4}, \frac{H}{2}\) 的空间金字塔,并借助卷积融合块逐步恢复全分辨率。L-DPT 彻底抛弃了金字塔多尺度网格,将全量计算收敛在单尺度隐空间内,不仅显存开销降低 70% 以上,更规避了上采样卷积带来的高频细节退化。
- vs Mask2Former / ViT-Adapter:这类重量级通用分割架构引入了多尺度像素解码器以及密集交叉注意力掩码机制,参数量往往高达近 1B,训练与推理极其昂贵。L-DPT 凭借纯粹的阶段自适应通道投影加轻量自注意力,在仅使用其 \(\frac{1}{10}\) 参数量的情况下全面超越其分割精度。
- vs InfiniDepth:InfiniDepth 采用隐式神经表示(INR)对连续坐标进行空间特征采样以实现任意分辨率深度生成。L-DPT 则聚焦于解码器架构本身的计算扩展瓶颈,在更低显存(5.7GB vs 10.2GB)与更快速度(1.74s vs 3.38s)下达到相当或更优的深度精度,证明离散隐空间注意力重排是比隐式连续场更为高效紧凑的工程路线。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 颠覆了统治领域十年的多尺度金字塔像素解码范式,率先确立“隐空间推理、像素读出”的扩展性新基准。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖相对深度与语义分割两大领域、多达 6 个主流真实基准,并完成了推向 100MP 极限分辨率的完备系统级评测与消融。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,直面“效率墙”与“能力墙”双重痛点,概念阐述清晰透彻,图表数据自洽详实。
- 价值: ⭐⭐⭐⭐⭐ 为超高清视觉感知、机器人与摄影后处理开辟了一条兼具极致能效与卓越保真度的全新架构路径。