跳转至

Implicit Neural Representation Facilitates Unified Universal Vision Encoding

会议: ECCV 2026
论文: ECCV 2026
领域: 自监督/表示学习
关键词: 隐式神经表示, INR 超网络, 统一视觉编码, 知识蒸馏, 表示压缩

一句话总结

本文把面向图像的隐式神经表示(INR)超网络训练成统一视觉编码器 HUVR:同一套 ViT 骨干既输出标准 token、又输出最多小 96 倍的压缩 token(TinToks)和逐 patch 的 INR 调制量,以像素重建加教师蒸馏做自监督预训练,使同一份表示在分类、语义分割、深度估计和图像重建上同时可用。

研究背景与动机

当前的视觉编码器基本沿两条互不相通的路线发展。一条是识别路线:图像级对比学习(CLIP、SigLIP 2)、图像内自蒸馏(DINO/DINOv2/DINOv3)以及掩码图像建模,学到的 embedding 在检索、分类、语义分割上很强,但它们对像素本身不负任何责任,无法直接支撑生成;另一条是生成路线:变分自编码器(如 Stable Diffusion 的 VAE)以像素重建、感知损失和对抗损失训练,latent 与扩散/自回归生成兼容,可是它的语义很弱,做分类分割时远不如前者。已有工作大多是在这两类模型之间做事后(post-hoc)缝合——把文本无关的扩散模型改造成判别器,或者用识别模型去指导生成模型(如 REPA),这些结果说明两条路线之间确实存在可利用的协同,但缝合终究不是原生统一。

一个原生统一的编码器,其表征应当开箱即用地同时携带高层(分类)、中层(分割)、低层(深度)和像素级(重建)的信息。难点在于这两种目标对 latent 的要求方向相反:识别希望丢弃与类别无关的像素细节以换取不变性,重建则希望把像素细节一字不漏地保留下来。"统一"在实践中还有第二层含义常被忽略——不同任务可用的算力预算不同,检索类任务在数据规模增长时会因 embedding 太大而急剧变难,因此真正的统一不止要跨任务,还要能让模型同时产出压缩与非压缩的表示。

本文的切入角度是:面向图像的 INR 超网络天然就是候选人。它接受图像输入、输出一组 INR 网络权重,而这些权重本身就是一种像素级表示;与卷积 VAE 不同,它基于 Transformer,可以原样沿用 ViT 的 patch 划分、patch 尺寸和 latent 维度。作者进一步指出,INR 超网络天生沿两个方向压缩:先把一张具体图像压成 latent,再让所有图像共享同一个"基底" INR。核心 idea:把 INR 超网络的输出端改造成逐 patch 的权重预测(图像 token 直接兼任权重 token,全局 token 与 patch token 外积得到调制矩阵),在后端插入一层可学习的降/升采样得到 TinToks,并用预训练视觉编码器蒸馏补上 INR 天然缺失的高层语义,从而用同一套自监督预训练同时支撑识别与生成。

方法详解

整体框架

HUVR 的输入是一张图像(预训练分辨率 256×256),流程与标准 ViT 类似:先 patchify、前置一个可学习的全局 token,送进带 RoPE 的 ViT 编码器。分歧出现在编码器之后,编码器的输出被分成三路。第一路是标准 token(ViT-B 为 768 维、ViT-L 为 1024 维),它直接用于分类、语义分割、深度估计等识别任务。第二路是压缩 token TinToks:token 先经线性层降到很小的维度 \(d_t\)(论文用 8/16/32,最高比标准 token 小 96 倍),过一个 Transformer 解码器之后再由线性层升维解码,用于同一批识别任务以及作为压缩表示。第三路只服务重建:每个 patch token 被投影到基 INR 权重的输入维 \(d_\text{in}\),全局 token 被投影到输出维 \(d_\text{out}\),两者外积得到每层的调制矩阵,逐元素乘到共享基底 INR 的对应层权重上。调制后的 INR 是"这一个 patch 专属"的 INR:输入该 patch 内的像素坐标 \((x,y)\),输出 RGB 值;把所有 patch 的预测按空间位置拼起来,就得到重建的整图。训练信号有两类,一类是重建图像与输入的像素差,另一类是把编码器、解码器输出对齐到 DINOv3 等预训练视觉编码器特征的蒸馏损失——后者是让标准 token 和 TinToks 真正具备识别语义的关键。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像"] --> B["ViT 编码器<br/>patchify + 全局 token"]
    B --> C["Patch 级 INR 超网络<br/>图像 token 兼任权重 token"]
    C --> D["全局 token 外积调制<br/>外积得每层调制矩阵"]
    D --> E["TinToks 压缩表示<br/>降维 → 解码器 → 升维"]
    E --> G["标准 / 压缩 token<br/>分类 · 分割 · 深度估计"]
    E --> H["逐 patch INR<br/>坐标 → RGB → 拼回整图"]
    B -.-> F["蒸馏注入语义<br/>L2 对齐教师特征"]
    E -.-> F

关键设计

1. Patch 级 INR 超网络:让图像 token 直接兼任权重 token

原版 INR 超网络的输入是一批可学习的 weight token,它输出对应的 weight token,再经全连接层和重复操作拼成调制矩阵;而输出的 image token 既不算损失也不用做推理,直接被丢掉。这带来两个后果:其一,weight token 的数量必须能整除基权重的 \(d_\text{in}\)\(d_\text{out}\),超网络与 INR 的配置空间被卡得很死;其二,图像信息几乎全部压在 weight token 里,而这些 token 与图像的空间位置没有明确对应关系,语义分割这类要求"哪个 token 管哪块区域"的稠密任务根本无从下手,同时一半算力被浪费。

本文的做法是把预测单位从"每张图一个 INR"改成"每个 patch 一个 INR":编码器输出的 patch token 本身就被当作权重 token 使用,每个 patch token 负责预测该 patch 对应的那个小 INR,重建时只负责自己的 patch,最后拼接得到整图。这样一来输出 token 不再有冗余,而且天然建立了"token ↔ 图像 patch"的一一对应,稠密任务才有可能。代价是显存——每个 patch 都要实例化一个 INR 做前向计算。表 8 的消融表明这是全文贡献最大的一个改动:在 ImageNette 上,从"只调制第二层"过渡到 patch-wise 后,PSNR 由 27.15 猛增到 51.96,SSIM 从 0.8000 升到 0.9974。

2. 全局 token 的外积调制:一个 token 同时充当 cls token 与调制源

即使改成 patch 级,还有一个维度对不上的问题:输出 token 的维度是 \(d_\text{ViT}\),而基权重 \(W_i\) 的维度是 \(d_\text{in} \times d_\text{out}\)。前人的简单做法是强制 \(d_\text{ViT} = d_\text{in}\) 并把同一个 token 复制 \(d_\text{out}\) 次当作调制矩阵,实验证明这并非最优;与此同时,原始 INR 超网络的公式里压根没有 class token,识别任务缺少一个全局摘要。

作者用一个可学习全局 token \(g\) 同时解决这两件事:把 \(g\) 与 patch token \(p\) 分别做线性投影到 \(\mathbb{R}^{d_\text{out}}\)\(\mathbb{R}^{d_\text{in}}\),取外积得到每层的调制矩阵,再逐元素调制基权重:

\[M_i = g_\text{proj}\, p_\text{proj}^{\top} \in \mathbb{R}^{d_\text{in} \times d_\text{out}}, \qquad \tilde{\omega} = \{W_i \odot M_i\}_{i=1}^{n}\]

这样调制矩阵不是复制出来的秩一常向量,而是由"全局语义 × 局部 patch"共同决定,架构里也因此有了 cls token 和 patch token 且没有浪费任何一个 token。表 8 中,加上全局 token 后 ImageNette 的 PSNR 从 51.96 进一步升到 53.36、SSIM 达到 0.9985——它本来是为分类而引入的,却意外地也改善了重建。表 10 的蒸馏实验从另一侧印证了这一点:只把蒸馏损失加在全局 token 上对分类最有利。

3. TinToks:在骨干与 INR 预测层之间插入可学习的降采样与升采样

计算受限的场景需要远小于标准 token 的表示,而标准 ViT token 的维度又被基 INR 的 \(d_\text{in}\)/\(d_\text{out}\) 绑住,不便自由设定。一个直接的办法是对 DINOv3 特征做 PCA,它确实有效,但 PCA 变换不是为重建或下游任务训练出来的。

HUVR 改为在 Transformer 骨干与产生最终 INR 预测的层之间插入一个中间表示 TinToks:先用一个线性层把 token 从 \(d_\text{ViT}\) 降到 \(d_t\),用一个 Transformer 解码器处理(默认 4 层,实验表明解码器对重建有实质帮助),再用线性层升回,最后分别投影到 patch token 的 \(d_\text{in}\) 和全局 token 的 \(d_\text{out}\)。论文强调这里存在双重压缩——图像先被压成 latent,所有图像又共享同一个基底 INR,作者认为正是这种压缩让 latent 在像素级之外也保住了低/中/高层信息。效果上,TinToks 在识别与重建上同时大幅超过 PCA 与可学习自编码器基线(ViT-B、32 维:ImageNet 76.7 vs 64.1/67.3,PSNR 27.83 vs 17.68),而且压缩比越大优势越明显——8 维时相对 DINOv3 PCA 的 ImageNet 准确率是 57.1 对 16.1。

4. 蒸馏注入语义:给纯重建目标补上高层语义

INR 超网络的训练信号只有像素重建,学到的 latent 适合还原像素却不利于分类分割,而且它的 token 设计本身也难以恢复 patch 级信息。作者的做法是从一个预训练视觉编码器(绝大多数实验用 DINOv3)蒸馏:对学生最后一层编码器块和最后一层解码器块的输出,各学一个线性投影去对齐教师特征,并且在每个块内再按 token 类型(全局 / patch)分开,于是共得到 4 个 L2 损失分量,各自带权重 \(\lambda_{t,o}\)

\[\mathcal{L}_{\text{distill}} = \sum_{t \in \{g,\,p\}} \sum_{o \in \{\text{enc},\,\text{dec}\}} \lambda_{t,o} \left\| \phi_{t,o}(F_{t,o}) - F_{t,\text{teacher}} \right\|_2\]

有一点值得注意:作者并没有对压缩 token 直接做蒸馏,因为实验发现只要编码器与解码器被蒸馏到位,TinToks 会自然继承语义,这比直接对齐压缩后的向量更有效。表 10 显示蒸馏目标的选择有明显偏好——只蒸全局 token 对分类更有利(768 维 82.9、32 维 71.3),只蒸 patch token 对分割更有利(ADE20K mIoU 45.23),两者都蒸时整体分类最好(83.2)但重建显著变差(PSNR 25.33,不蒸馏时是 28.42);作者最终仍选择都蒸,并靠更长训练和更大的教师模型来补偿重建损失。

损失函数 / 训练策略

重建项直接取输入图像与拼接后 patch 预测之间的像素均方误差,可选地再加上 SSIM 与 LPIPS 以提升视觉质量;语义项即上面 4 个分量的蒸馏损失。

预训练数据是 DataComp(仅图像)与 ImageNet22k(不带标签)的混合,并仿照 DINOv3 保证至少 10% 的样本来自 ImageNet22k,训练量对齐到在 ImageNet22k 上约 50 个 epoch;数据增强只用随机缩放裁剪。骨干是带 RoPE 的现代 ViT,聚焦 ViT-B/16 与 ViT-L/16,batch size 与学习率按可用资源线性缩放。教师选择上,ViT-B 学生蒸 ViT-L 教师、ViT-L 学生蒸 ViT-H 教师。评测稠密任务时另有第二阶段:考虑到 ADE20K 分割在 512×512、NYUv2 深度在 480×480 上评测,作者在 256×256 预训练之后,再用 ImageNet22k 的 256×256 与 512×512 混合分辨率多训 3 个 epoch(同样 follow DINOv3)。

实验关键数据

主实验

评测覆盖四类任务:识别(ImageNet-1k 原始标签与 ReaL 标签、ObjectNet、5 个细粒度 FGVC 数据集,均为线性探测、不做微调)、稠密预测(ADE20K 语义分割与 NYUv2 深度线性探测)、重建(ImageNet-1k 验证集 50,000 张,训练中从未见过,报告 PSNR/SSIM/LPIPS)以及生成(沿用 DiT 协议训练类别条件 DiT-XL,报告 FID/IS/Precision/Recall)。

压缩 token(TinToks)的统一能力是本文的核心卖点。下表为 ViT-B、32 维设置,PCA 与 AE/L2B 基线分别是在 ImageNet-1k 训练集上拟合的变换与可学习自编码器;重建基线是在冻结的 DINOv3 PCA 特征上训练一个参数量与本文相当的解码器(AE 与 L2B 不报告重建):

方法(ViT-B,32 维) ImageNet ReaL ObjectNet PSNR SSIM
DINOv3 + PCA 64.1 70.3 35.7 17.68 0.5398
DINOv3 + AE 53.8 59.9 32.7 - -
DINOv3 + L2B 67.3 74.1 41.3 - -
HUVR (ours) 76.7 83.2 49.4 27.83 0.7845

标准 token 的识别结果同样不弱,ViT-B/16(d=768)在 ImageNet 上以 85.0 超过 DINOv3 的 84.6:

编码器(ViT-B/16, d=768) ImageNet ReaL ObjectNet Cars CUB DTD Flowers Food
C-RADIOv3 82.4 87.6 54.5 88.6 79.8 83.5 99.1 91.5
SigLIP 2 84.5 89.0 68.4 92.8 82.6 83.7 99.3 94.2
DINOv3 84.6 88.9 59.4 93.4 89.7 83.9 99.7 93.7
HUVR (ours) 85.0 89.2 62.0 93.1 89.4 84.3 99.7 94.3

稠密预测上,标准 token 在 ADE20K 分割上小幅领先 DINOv3(ViT-B 52.0 vs 50.8 mIoU),而 32 维 TinToks 的优势要明显得多(37.6 vs 29.7):

设置 方法 ADE20K mIoU mAcc NYUv2 RMSE↓
ViT-B, d=768 DINOv3 50.8 62.6 0.3305
ViT-B, d=768 HUVR (ours) 52.0 63.4 0.3263
ViT-B, d=32 DINOv3 (PCA) 29.7 38.6 0.7056
ViT-B, d=32 HUVR (ours) 37.6 48.4 0.5440
ViT-L, d=1024 DINOv3 54.2 66.2 0.3235
ViT-L, d=1024 HUVR (ours) 53.5 65.2 0.3287
ViT-L, d=32 DINOv3 (PCA) 29.4 39.2 0.6685
ViT-L, d=32 HUVR (ours) 30.9 41.1 0.5726

作为 INR 超网络本身,HUVR 也刷新了同类的重建指标(单位 PSNR,括号内为训练 epoch,三个数据集分别是 ImageNette / LSUN / CelebA 的协议):

方法 ImageNette LSUN CelebA
TransINR 29.01 (4000) 24.21 (12.67) 31.96 (300)
IPC 38.46 (4000) - 35.93 (300)
LA-IPC 46.10 (4000) - 50.74 (300)
ANR - 28.30 (12.67) -
HUVR (ours) 48.44 (400) 34.00 (12) 56.91 (100)

生成侧则诚实得多:把类别条件 DiT-XL 训在 HUVR 的压缩 latent 上,与训在 SD VAE latent 上相比仍有差距(FID 24.72 / 24.53 对 23.05),作者只称其"有潜力",并指出把 TinTok 维度从 16 提到 256 对生成有帮助。

Autoencoder Latent FID↓ sFID↓ IS↑ Precision↑ Recall↑
SD VAE(32×32×4) 23.05 68.65 70.34 0.4318 0.4775
HUVR(16×16×16) 24.72 76.09 60.17 0.3850 0.4645
HUVR(16×256×256) 24.53 68.37 66.13 0.4307 0.4367

消融实验

超网络设计逐项累加的消融(ImageNette,后一行在前一行基础上继续加改动,最后一行是完整方法):

配置 PSNR↑ SSIM↑ LPIPS↓
TransINR + RoPE 23.78 0.7041 0.3866
+ 只调制第二层 27.15 0.8000 0.2424
+ patch-wise 51.96 0.9974 0.0026
+ 全局 token 53.36 0.9985 0.0007
+ 压缩 48.58 0.9962 0.0019
+ 解码器(完整) 48.44 0.9954 0.0014

蒸馏目标 token 的消融(DINOv3 ViT-B 教师、仅 5 个 ImageNet22k epoch;⚠️ 原文该表列在 PDF 抽取中与相邻表交错,"两者都蒸"一行的数值按上下文对齐,以原文为准):

蒸馏目标 ImageNet d=768 ImageNet d=32 ADE20K mIoU PSNR SSIM
不蒸馏 11.4 1.9 4.18 28.42 0.7973
只蒸全局 token 82.9 71.3 39.29 26.42 0.7468
只蒸 patch token 81.9 65.5 45.23 26.95 0.7580
两者都蒸(本文) 83.2 69.3 43.68 25.33 0.7133

解码器设计的选择(同样 5 个 ImageNet22k epoch):

配置 ImageNet d=768 ImageNet d=32 ADE20K mIoU PSNR SSIM
默认 83.1 69.7 43.85 25.35 0.7135
Tiny dim=768 83.1 69.1 44.00 25.65 0.7243
INR 隐层 256→512 82.3 70.8 23.36 ⚠️ 25.30 0.7119
INR 层数 4→3 83.1 69.6 43.36 25.08 0.7015
INR 层数 4→5 83.1 70.2 44.44 25.48 0.7188
解码器 4 层→1 层 83.1 69.6 43.65 24.78 0.6962
解码器去掉 attention 83.1 73.5 43.83 24.90 0.6943

蒸馏块的选择(编码器 12 个块、解码器 4 个块)也是折中:蒸馏 (12, 1) 时标准分类与重建最好(83.2 / PSNR 26.18),(11, 4) 时 TinTok 分类最好(72.6),最终取中间的 (12, 4)。

关键发现

  • patch-wise 是压倒性的贡献项。表 8 中它单项把 ImageNette PSNR 从 27.15 拉到 51.96,其余设计都是在此基础上的边际改进;作者也直言代价是前向计算的显存开销。
  • 压缩与解码器不是重建的必要条件,但它们是 TinToks 与蒸馏的必要条件。加上这两项后重建指标反而略降(PSNR 53.36 → 48.58 → 48.44),说明"统一"是有价格的,作者用更长训练去平衡。
  • 识别与重建可以一起涨,但幅度不同步。训练时间越长两者都提升,重建饱和得更早(图 3);教师规模也存在 crossover——用更大的教师一开始更差,训练足够久后反超,且 TinToks 与重建几乎立刻受益于大教师,而标准 token 分类要到约 40 个 ImageNet22k epoch、分割要到约 10–20 个 epoch 才反超(原文表述为分割 10 epoch,表中 mIoU 首次反超出现在 20 epoch,⚠️ 以原文为准)。
  • 不蒸馏等于完全失去语义:不蒸任何 token 时 768 维分类只有 11.4、mIoU 只有 4.18,但重建反而最好(PSNR 28.42)。这直接说明 INR 超网络的原生目标里不含识别语义,蒸馏是补上这一课的唯一来源。
  • TinToks 与标准 token 是性能互补而非简单退化。图 4 显示在个别类别上 8 维 TinTok 的准确率反而高于标准 token;同时 t-SNE 也暴露出 TinToks 的特征结构更松散、易混类更多。
  • 本文的定位要如实看:识别上 ViT-L 规模仍略逊 DINOv3(86.9 vs 87.1),生成上 FID 未超过 SD VAE,作者本人也把生成结果称为"promising"而非 SOTA。

亮点与洞察

  • 把"重建目标"当作语义的载体而不是敌人。通常认为像素重建会把 latent 拉向低层细节、损害语义,本文用"重建 + 蒸馏"的组合让同一个 latent 两边都吃:蒸馏负责高层语义,重建负责像素级保真,二者在同一个 latent 上共存,并用 TinToks 把这种共存延伸到极小维度。
  • 用输出 token 兼任权重 token,一举解决三个问题。这一改动同时消掉了浪费一半算力的冗余 token、解开了"权重 token 数必须整除 \(d_\text{in}/d_\text{out}\)"的约束、还顺带建立了 token 与图像 patch 的空间对应,使稠密任务第一次成为可能——单点设计带来三重收益,是全文最"啊哈"的地方。
  • 外积调制比复制式调制更有表达力。把全局语义和局部 patch 做外积,得到的调制矩阵同时携带"这是哪一类物体"和"这是图像的哪一块"两重信息,比前人把单个 token 复制 \(d_\text{out}\) 次的做法更灵活;而全局 token 本来只为分类引入,却让重建也涨了 1.4 PSNR。
  • 压缩表示可以顺带继承语义。作者发现不必对压缩 token 单独蒸馏——只要编码器和解码器被蒸馏到位,中间那层小维度 token 会"免费"获得语义,这让压缩分支的引入几乎不需要额外的对齐工程。
  • 可迁移的思路:任何"编码器 + 重建设计头"的结构(例如需要同时服务检索与重建的多模态编码器、视频/3D 的神经表示)都可以套用"patch 级权重预测 + 全局 token 外积调制 + 教师蒸馏补语义"这套组合,尤其是当目标表示要同时满足"小"和"语义强"时。

局限与展望

  • 作者承认的局限很直接:预训练的规模与广度不及同期图像表示方法;生成没有端到端打通,当前定位是"替代 VAE 的 latent 提供者",而即便这一格也没赢过 SD VAE;要接入 VLM 还需要文本对齐的预训练。
  • 实验范围其实比"universal"这个词听起来窄:全程只做图像,没有视频、3D、音频;"universal"主要体现为跨任务(分类/分割/深度/重建/生成)与跨 token 维度,而不是跨模态。识别评测也全部是线性探测,未验证微调场景。
  • 消融的统计口径偏弱:蒸馏相关的消融(表 10、表 11、表 12、表 13)都只训练 5 个 ImageNet22k epoch,远短于最终模型,作者自己也指出"ViT-L 看起来更差"实为训练不足所致;这类短跑结论不宜直接外推到完整训练。
  • 表 13 中"INR 隐层 256→512"一行 mIoU 骤降到 23.36,与同列其他行差出一个量级,原文未作解释,读数时需谨慎(⚠️ 以原文为准)。
  • 改进方向:把教师换成多教师混合(作者认为最优解大概率是混合蒸馏,但归于工程范围之外);把 TinToks 接入现有生成管线并借助"冻结预训练编码器 + 表征自编码器"的并发工作思路,可能补上生成端的差距;补做视频/多模态扩展才能撑起"universal"的说法。

相关工作与启发

  • vs DINOv3 / DINO 系列:它们是自蒸馏 + 掩码建模的识别专才,表示里不含像素级信息,也不能重建;HUVR 在 ViT-B 规模的分类上反超(85.0 vs 84.6),稠密任务小幅领先,ViT-L 规模仍略逊,但额外获得重建与压缩能力。
  • vs 统一表示方法(BigBiGAN / MAGE / Sorcen):这些方法同样横跨识别与生成,但能力面窄——BigBiGAN 只有生成 + 识别(ImageNet 56.6),MAGE 74.7/11.11,Sorcen 75.1/9.61;HUVR 达到 85.0,并且是唯一同时提供稠密预测与极端压缩(TinToks)的。
  • vs REPA:REPA 用识别模型指导生成模型的训练,本质是"生成模型借用识别特征";本文反过来,用识别模型指导重建模型的训练,并且因为学生本身就是编码器,识别性能不降反升(ViT-B 超过 DINOv3),而 REPA 训出的生成模型在识别上仍有明显差距。
  • vs 前人 INR 超网络(TransINR / IPC / LA-IPC / ANR):它们预测整图一个 INR,输出 token 冗余且无空间对应,只能做重建与压缩;HUVR 改成 patch 级预测并补上蒸馏,既在重建上领先(ImageNette 48.44 vs LA-IPC 46.10,且只用 400 而非 4000 epoch),又第一次让这类模型能做分类与分割。
  • vs Latent-INR:同样追求带语义的 INR,但 Latent-INR 是为每个视频单独拟合超网络、把可学习 latent 对齐到 CLIP embedding;HUVR 学的是一个通用超网络,可以直接处理训练中没见过的输入。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次把 INR 超网络当作通用视觉编码器来训练,patch 级权重预测 + 全局 token 外积调制是真正原创的设计,并顺带产出 96 倍压缩的可用表示。
  • 实验充分度: ⭐⭐⭐⭐ 覆盖分类/分割/深度/重建/生成五类任务、多个骨干与维度,消融维度完整;但蒸馏类消融只跑 5 个 epoch,规模也远小于同期表示学习方法。
  • 写作质量: ⭐⭐⭐⭐ 动机与设计动机交代得清楚,多个表的数值与摘要口径存在小出入(如 +8.2 mIoU、+1.26 PSNR),少数表在 PDF 抽取后列错位需对照原文。
  • 价值: ⭐⭐⭐⭐ 给"统一视觉编码"提供了一条不经 VAE、也不经对比学习的新路径,压缩 token 与超网络设计可复用到其他需要"小而有语义"表示的场景;生成端尚需后续工作补齐。