Implicit Neural Representation Facilitates Unified Universal Vision Encoding¶
会议: ECCV 2026
论文: ECCV 2026
领域: 自监督/表示学习
关键词: 隐式神经表示, INR 超网络, 统一视觉编码, 知识蒸馏, 表示压缩
一句话总结¶
本文把面向图像的隐式神经表示(INR)超网络训练成统一视觉编码器 HUVR:同一套 ViT 骨干既输出标准 token、又输出最多小 96 倍的压缩 token(TinToks)和逐 patch 的 INR 调制量,以像素重建加教师蒸馏做自监督预训练,使同一份表示在分类、语义分割、深度估计和图像重建上同时可用。
研究背景与动机¶
当前的视觉编码器基本沿两条互不相通的路线发展。一条是识别路线:图像级对比学习(CLIP、SigLIP 2)、图像内自蒸馏(DINO/DINOv2/DINOv3)以及掩码图像建模,学到的 embedding 在检索、分类、语义分割上很强,但它们对像素本身不负任何责任,无法直接支撑生成;另一条是生成路线:变分自编码器(如 Stable Diffusion 的 VAE)以像素重建、感知损失和对抗损失训练,latent 与扩散/自回归生成兼容,可是它的语义很弱,做分类分割时远不如前者。已有工作大多是在这两类模型之间做事后(post-hoc)缝合——把文本无关的扩散模型改造成判别器,或者用识别模型去指导生成模型(如 REPA),这些结果说明两条路线之间确实存在可利用的协同,但缝合终究不是原生统一。
一个原生统一的编码器,其表征应当开箱即用地同时携带高层(分类)、中层(分割)、低层(深度)和像素级(重建)的信息。难点在于这两种目标对 latent 的要求方向相反:识别希望丢弃与类别无关的像素细节以换取不变性,重建则希望把像素细节一字不漏地保留下来。"统一"在实践中还有第二层含义常被忽略——不同任务可用的算力预算不同,检索类任务在数据规模增长时会因 embedding 太大而急剧变难,因此真正的统一不止要跨任务,还要能让模型同时产出压缩与非压缩的表示。
本文的切入角度是:面向图像的 INR 超网络天然就是候选人。它接受图像输入、输出一组 INR 网络权重,而这些权重本身就是一种像素级表示;与卷积 VAE 不同,它基于 Transformer,可以原样沿用 ViT 的 patch 划分、patch 尺寸和 latent 维度。作者进一步指出,INR 超网络天生沿两个方向压缩:先把一张具体图像压成 latent,再让所有图像共享同一个"基底" INR。核心 idea:把 INR 超网络的输出端改造成逐 patch 的权重预测(图像 token 直接兼任权重 token,全局 token 与 patch token 外积得到调制矩阵),在后端插入一层可学习的降/升采样得到 TinToks,并用预训练视觉编码器蒸馏补上 INR 天然缺失的高层语义,从而用同一套自监督预训练同时支撑识别与生成。
方法详解¶
整体框架¶
HUVR 的输入是一张图像(预训练分辨率 256×256),流程与标准 ViT 类似:先 patchify、前置一个可学习的全局 token,送进带 RoPE 的 ViT 编码器。分歧出现在编码器之后,编码器的输出被分成三路。第一路是标准 token(ViT-B 为 768 维、ViT-L 为 1024 维),它直接用于分类、语义分割、深度估计等识别任务。第二路是压缩 token TinToks:token 先经线性层降到很小的维度 \(d_t\)(论文用 8/16/32,最高比标准 token 小 96 倍),过一个 Transformer 解码器之后再由线性层升维解码,用于同一批识别任务以及作为压缩表示。第三路只服务重建:每个 patch token 被投影到基 INR 权重的输入维 \(d_\text{in}\),全局 token 被投影到输出维 \(d_\text{out}\),两者外积得到每层的调制矩阵,逐元素乘到共享基底 INR 的对应层权重上。调制后的 INR 是"这一个 patch 专属"的 INR:输入该 patch 内的像素坐标 \((x,y)\),输出 RGB 值;把所有 patch 的预测按空间位置拼起来,就得到重建的整图。训练信号有两类,一类是重建图像与输入的像素差,另一类是把编码器、解码器输出对齐到 DINOv3 等预训练视觉编码器特征的蒸馏损失——后者是让标准 token 和 TinToks 真正具备识别语义的关键。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像"] --> B["ViT 编码器<br/>patchify + 全局 token"]
B --> C["Patch 级 INR 超网络<br/>图像 token 兼任权重 token"]
C --> D["全局 token 外积调制<br/>外积得每层调制矩阵"]
D --> E["TinToks 压缩表示<br/>降维 → 解码器 → 升维"]
E --> G["标准 / 压缩 token<br/>分类 · 分割 · 深度估计"]
E --> H["逐 patch INR<br/>坐标 → RGB → 拼回整图"]
B -.-> F["蒸馏注入语义<br/>L2 对齐教师特征"]
E -.-> F
关键设计¶
1. Patch 级 INR 超网络:让图像 token 直接兼任权重 token
原版 INR 超网络的输入是一批可学习的 weight token,它输出对应的 weight token,再经全连接层和重复操作拼成调制矩阵;而输出的 image token 既不算损失也不用做推理,直接被丢掉。这带来两个后果:其一,weight token 的数量必须能整除基权重的 \(d_\text{in}\) 或 \(d_\text{out}\),超网络与 INR 的配置空间被卡得很死;其二,图像信息几乎全部压在 weight token 里,而这些 token 与图像的空间位置没有明确对应关系,语义分割这类要求"哪个 token 管哪块区域"的稠密任务根本无从下手,同时一半算力被浪费。
本文的做法是把预测单位从"每张图一个 INR"改成"每个 patch 一个 INR":编码器输出的 patch token 本身就被当作权重 token 使用,每个 patch token 负责预测该 patch 对应的那个小 INR,重建时只负责自己的 patch,最后拼接得到整图。这样一来输出 token 不再有冗余,而且天然建立了"token ↔ 图像 patch"的一一对应,稠密任务才有可能。代价是显存——每个 patch 都要实例化一个 INR 做前向计算。表 8 的消融表明这是全文贡献最大的一个改动:在 ImageNette 上,从"只调制第二层"过渡到 patch-wise 后,PSNR 由 27.15 猛增到 51.96,SSIM 从 0.8000 升到 0.9974。
2. 全局 token 的外积调制:一个 token 同时充当 cls token 与调制源
即使改成 patch 级,还有一个维度对不上的问题:输出 token 的维度是 \(d_\text{ViT}\),而基权重 \(W_i\) 的维度是 \(d_\text{in} \times d_\text{out}\)。前人的简单做法是强制 \(d_\text{ViT} = d_\text{in}\) 并把同一个 token 复制 \(d_\text{out}\) 次当作调制矩阵,实验证明这并非最优;与此同时,原始 INR 超网络的公式里压根没有 class token,识别任务缺少一个全局摘要。
作者用一个可学习全局 token \(g\) 同时解决这两件事:把 \(g\) 与 patch token \(p\) 分别做线性投影到 \(\mathbb{R}^{d_\text{out}}\) 和 \(\mathbb{R}^{d_\text{in}}\),取外积得到每层的调制矩阵,再逐元素调制基权重:
这样调制矩阵不是复制出来的秩一常向量,而是由"全局语义 × 局部 patch"共同决定,架构里也因此有了 cls token 和 patch token 且没有浪费任何一个 token。表 8 中,加上全局 token 后 ImageNette 的 PSNR 从 51.96 进一步升到 53.36、SSIM 达到 0.9985——它本来是为分类而引入的,却意外地也改善了重建。表 10 的蒸馏实验从另一侧印证了这一点:只把蒸馏损失加在全局 token 上对分类最有利。
3. TinToks:在骨干与 INR 预测层之间插入可学习的降采样与升采样
计算受限的场景需要远小于标准 token 的表示,而标准 ViT token 的维度又被基 INR 的 \(d_\text{in}\)/\(d_\text{out}\) 绑住,不便自由设定。一个直接的办法是对 DINOv3 特征做 PCA,它确实有效,但 PCA 变换不是为重建或下游任务训练出来的。
HUVR 改为在 Transformer 骨干与产生最终 INR 预测的层之间插入一个中间表示 TinToks:先用一个线性层把 token 从 \(d_\text{ViT}\) 降到 \(d_t\),用一个 Transformer 解码器处理(默认 4 层,实验表明解码器对重建有实质帮助),再用线性层升回,最后分别投影到 patch token 的 \(d_\text{in}\) 和全局 token 的 \(d_\text{out}\)。论文强调这里存在双重压缩——图像先被压成 latent,所有图像又共享同一个基底 INR,作者认为正是这种压缩让 latent 在像素级之外也保住了低/中/高层信息。效果上,TinToks 在识别与重建上同时大幅超过 PCA 与可学习自编码器基线(ViT-B、32 维:ImageNet 76.7 vs 64.1/67.3,PSNR 27.83 vs 17.68),而且压缩比越大优势越明显——8 维时相对 DINOv3 PCA 的 ImageNet 准确率是 57.1 对 16.1。
4. 蒸馏注入语义:给纯重建目标补上高层语义
INR 超网络的训练信号只有像素重建,学到的 latent 适合还原像素却不利于分类分割,而且它的 token 设计本身也难以恢复 patch 级信息。作者的做法是从一个预训练视觉编码器(绝大多数实验用 DINOv3)蒸馏:对学生最后一层编码器块和最后一层解码器块的输出,各学一个线性投影去对齐教师特征,并且在每个块内再按 token 类型(全局 / patch)分开,于是共得到 4 个 L2 损失分量,各自带权重 \(\lambda_{t,o}\):
有一点值得注意:作者并没有对压缩 token 直接做蒸馏,因为实验发现只要编码器与解码器被蒸馏到位,TinToks 会自然继承语义,这比直接对齐压缩后的向量更有效。表 10 显示蒸馏目标的选择有明显偏好——只蒸全局 token 对分类更有利(768 维 82.9、32 维 71.3),只蒸 patch token 对分割更有利(ADE20K mIoU 45.23),两者都蒸时整体分类最好(83.2)但重建显著变差(PSNR 25.33,不蒸馏时是 28.42);作者最终仍选择都蒸,并靠更长训练和更大的教师模型来补偿重建损失。
损失函数 / 训练策略¶
重建项直接取输入图像与拼接后 patch 预测之间的像素均方误差,可选地再加上 SSIM 与 LPIPS 以提升视觉质量;语义项即上面 4 个分量的蒸馏损失。
预训练数据是 DataComp(仅图像)与 ImageNet22k(不带标签)的混合,并仿照 DINOv3 保证至少 10% 的样本来自 ImageNet22k,训练量对齐到在 ImageNet22k 上约 50 个 epoch;数据增强只用随机缩放裁剪。骨干是带 RoPE 的现代 ViT,聚焦 ViT-B/16 与 ViT-L/16,batch size 与学习率按可用资源线性缩放。教师选择上,ViT-B 学生蒸 ViT-L 教师、ViT-L 学生蒸 ViT-H 教师。评测稠密任务时另有第二阶段:考虑到 ADE20K 分割在 512×512、NYUv2 深度在 480×480 上评测,作者在 256×256 预训练之后,再用 ImageNet22k 的 256×256 与 512×512 混合分辨率多训 3 个 epoch(同样 follow DINOv3)。
实验关键数据¶
主实验¶
评测覆盖四类任务:识别(ImageNet-1k 原始标签与 ReaL 标签、ObjectNet、5 个细粒度 FGVC 数据集,均为线性探测、不做微调)、稠密预测(ADE20K 语义分割与 NYUv2 深度线性探测)、重建(ImageNet-1k 验证集 50,000 张,训练中从未见过,报告 PSNR/SSIM/LPIPS)以及生成(沿用 DiT 协议训练类别条件 DiT-XL,报告 FID/IS/Precision/Recall)。
压缩 token(TinToks)的统一能力是本文的核心卖点。下表为 ViT-B、32 维设置,PCA 与 AE/L2B 基线分别是在 ImageNet-1k 训练集上拟合的变换与可学习自编码器;重建基线是在冻结的 DINOv3 PCA 特征上训练一个参数量与本文相当的解码器(AE 与 L2B 不报告重建):
| 方法(ViT-B,32 维) | ImageNet | ReaL | ObjectNet | PSNR | SSIM |
|---|---|---|---|---|---|
| DINOv3 + PCA | 64.1 | 70.3 | 35.7 | 17.68 | 0.5398 |
| DINOv3 + AE | 53.8 | 59.9 | 32.7 | - | - |
| DINOv3 + L2B | 67.3 | 74.1 | 41.3 | - | - |
| HUVR (ours) | 76.7 | 83.2 | 49.4 | 27.83 | 0.7845 |
标准 token 的识别结果同样不弱,ViT-B/16(d=768)在 ImageNet 上以 85.0 超过 DINOv3 的 84.6:
| 编码器(ViT-B/16, d=768) | ImageNet | ReaL | ObjectNet | Cars | CUB | DTD | Flowers | Food |
|---|---|---|---|---|---|---|---|---|
| C-RADIOv3 | 82.4 | 87.6 | 54.5 | 88.6 | 79.8 | 83.5 | 99.1 | 91.5 |
| SigLIP 2 | 84.5 | 89.0 | 68.4 | 92.8 | 82.6 | 83.7 | 99.3 | 94.2 |
| DINOv3 | 84.6 | 88.9 | 59.4 | 93.4 | 89.7 | 83.9 | 99.7 | 93.7 |
| HUVR (ours) | 85.0 | 89.2 | 62.0 | 93.1 | 89.4 | 84.3 | 99.7 | 94.3 |
稠密预测上,标准 token 在 ADE20K 分割上小幅领先 DINOv3(ViT-B 52.0 vs 50.8 mIoU),而 32 维 TinToks 的优势要明显得多(37.6 vs 29.7):
| 设置 | 方法 | ADE20K mIoU | mAcc | NYUv2 RMSE↓ |
|---|---|---|---|---|
| ViT-B, d=768 | DINOv3 | 50.8 | 62.6 | 0.3305 |
| ViT-B, d=768 | HUVR (ours) | 52.0 | 63.4 | 0.3263 |
| ViT-B, d=32 | DINOv3 (PCA) | 29.7 | 38.6 | 0.7056 |
| ViT-B, d=32 | HUVR (ours) | 37.6 | 48.4 | 0.5440 |
| ViT-L, d=1024 | DINOv3 | 54.2 | 66.2 | 0.3235 |
| ViT-L, d=1024 | HUVR (ours) | 53.5 | 65.2 | 0.3287 |
| ViT-L, d=32 | DINOv3 (PCA) | 29.4 | 39.2 | 0.6685 |
| ViT-L, d=32 | HUVR (ours) | 30.9 | 41.1 | 0.5726 |
作为 INR 超网络本身,HUVR 也刷新了同类的重建指标(单位 PSNR,括号内为训练 epoch,三个数据集分别是 ImageNette / LSUN / CelebA 的协议):
| 方法 | ImageNette | LSUN | CelebA |
|---|---|---|---|
| TransINR | 29.01 (4000) | 24.21 (12.67) | 31.96 (300) |
| IPC | 38.46 (4000) | - | 35.93 (300) |
| LA-IPC | 46.10 (4000) | - | 50.74 (300) |
| ANR | - | 28.30 (12.67) | - |
| HUVR (ours) | 48.44 (400) | 34.00 (12) | 56.91 (100) |
生成侧则诚实得多:把类别条件 DiT-XL 训在 HUVR 的压缩 latent 上,与训在 SD VAE latent 上相比仍有差距(FID 24.72 / 24.53 对 23.05),作者只称其"有潜力",并指出把 TinTok 维度从 16 提到 256 对生成有帮助。
| Autoencoder Latent | FID↓ | sFID↓ | IS↑ | Precision↑ | Recall↑ |
|---|---|---|---|---|---|
| SD VAE(32×32×4) | 23.05 | 68.65 | 70.34 | 0.4318 | 0.4775 |
| HUVR(16×16×16) | 24.72 | 76.09 | 60.17 | 0.3850 | 0.4645 |
| HUVR(16×256×256) | 24.53 | 68.37 | 66.13 | 0.4307 | 0.4367 |
消融实验¶
超网络设计逐项累加的消融(ImageNette,后一行在前一行基础上继续加改动,最后一行是完整方法):
| 配置 | PSNR↑ | SSIM↑ | LPIPS↓ |
|---|---|---|---|
| TransINR + RoPE | 23.78 | 0.7041 | 0.3866 |
| + 只调制第二层 | 27.15 | 0.8000 | 0.2424 |
| + patch-wise | 51.96 | 0.9974 | 0.0026 |
| + 全局 token | 53.36 | 0.9985 | 0.0007 |
| + 压缩 | 48.58 | 0.9962 | 0.0019 |
| + 解码器(完整) | 48.44 | 0.9954 | 0.0014 |
蒸馏目标 token 的消融(DINOv3 ViT-B 教师、仅 5 个 ImageNet22k epoch;⚠️ 原文该表列在 PDF 抽取中与相邻表交错,"两者都蒸"一行的数值按上下文对齐,以原文为准):
| 蒸馏目标 | ImageNet d=768 | ImageNet d=32 | ADE20K mIoU | PSNR | SSIM |
|---|---|---|---|---|---|
| 不蒸馏 | 11.4 | 1.9 | 4.18 | 28.42 | 0.7973 |
| 只蒸全局 token | 82.9 | 71.3 | 39.29 | 26.42 | 0.7468 |
| 只蒸 patch token | 81.9 | 65.5 | 45.23 | 26.95 | 0.7580 |
| 两者都蒸(本文) | 83.2 | 69.3 | 43.68 | 25.33 | 0.7133 |
解码器设计的选择(同样 5 个 ImageNet22k epoch):
| 配置 | ImageNet d=768 | ImageNet d=32 | ADE20K mIoU | PSNR | SSIM |
|---|---|---|---|---|---|
| 默认 | 83.1 | 69.7 | 43.85 | 25.35 | 0.7135 |
| Tiny dim=768 | 83.1 | 69.1 | 44.00 | 25.65 | 0.7243 |
| INR 隐层 256→512 | 82.3 | 70.8 | 23.36 ⚠️ | 25.30 | 0.7119 |
| INR 层数 4→3 | 83.1 | 69.6 | 43.36 | 25.08 | 0.7015 |
| INR 层数 4→5 | 83.1 | 70.2 | 44.44 | 25.48 | 0.7188 |
| 解码器 4 层→1 层 | 83.1 | 69.6 | 43.65 | 24.78 | 0.6962 |
| 解码器去掉 attention | 83.1 | 73.5 | 43.83 | 24.90 | 0.6943 |
蒸馏块的选择(编码器 12 个块、解码器 4 个块)也是折中:蒸馏 (12, 1) 时标准分类与重建最好(83.2 / PSNR 26.18),(11, 4) 时 TinTok 分类最好(72.6),最终取中间的 (12, 4)。
关键发现¶
- patch-wise 是压倒性的贡献项。表 8 中它单项把 ImageNette PSNR 从 27.15 拉到 51.96,其余设计都是在此基础上的边际改进;作者也直言代价是前向计算的显存开销。
- 压缩与解码器不是重建的必要条件,但它们是 TinToks 与蒸馏的必要条件。加上这两项后重建指标反而略降(PSNR 53.36 → 48.58 → 48.44),说明"统一"是有价格的,作者用更长训练去平衡。
- 识别与重建可以一起涨,但幅度不同步。训练时间越长两者都提升,重建饱和得更早(图 3);教师规模也存在 crossover——用更大的教师一开始更差,训练足够久后反超,且 TinToks 与重建几乎立刻受益于大教师,而标准 token 分类要到约 40 个 ImageNet22k epoch、分割要到约 10–20 个 epoch 才反超(原文表述为分割 10 epoch,表中 mIoU 首次反超出现在 20 epoch,⚠️ 以原文为准)。
- 不蒸馏等于完全失去语义:不蒸任何 token 时 768 维分类只有 11.4、mIoU 只有 4.18,但重建反而最好(PSNR 28.42)。这直接说明 INR 超网络的原生目标里不含识别语义,蒸馏是补上这一课的唯一来源。
- TinToks 与标准 token 是性能互补而非简单退化。图 4 显示在个别类别上 8 维 TinTok 的准确率反而高于标准 token;同时 t-SNE 也暴露出 TinToks 的特征结构更松散、易混类更多。
- 本文的定位要如实看:识别上 ViT-L 规模仍略逊 DINOv3(86.9 vs 87.1),生成上 FID 未超过 SD VAE,作者本人也把生成结果称为"promising"而非 SOTA。
亮点与洞察¶
- 把"重建目标"当作语义的载体而不是敌人。通常认为像素重建会把 latent 拉向低层细节、损害语义,本文用"重建 + 蒸馏"的组合让同一个 latent 两边都吃:蒸馏负责高层语义,重建负责像素级保真,二者在同一个 latent 上共存,并用 TinToks 把这种共存延伸到极小维度。
- 用输出 token 兼任权重 token,一举解决三个问题。这一改动同时消掉了浪费一半算力的冗余 token、解开了"权重 token 数必须整除 \(d_\text{in}/d_\text{out}\)"的约束、还顺带建立了 token 与图像 patch 的空间对应,使稠密任务第一次成为可能——单点设计带来三重收益,是全文最"啊哈"的地方。
- 外积调制比复制式调制更有表达力。把全局语义和局部 patch 做外积,得到的调制矩阵同时携带"这是哪一类物体"和"这是图像的哪一块"两重信息,比前人把单个 token 复制 \(d_\text{out}\) 次的做法更灵活;而全局 token 本来只为分类引入,却让重建也涨了 1.4 PSNR。
- 压缩表示可以顺带继承语义。作者发现不必对压缩 token 单独蒸馏——只要编码器和解码器被蒸馏到位,中间那层小维度 token 会"免费"获得语义,这让压缩分支的引入几乎不需要额外的对齐工程。
- 可迁移的思路:任何"编码器 + 重建设计头"的结构(例如需要同时服务检索与重建的多模态编码器、视频/3D 的神经表示)都可以套用"patch 级权重预测 + 全局 token 外积调制 + 教师蒸馏补语义"这套组合,尤其是当目标表示要同时满足"小"和"语义强"时。
局限与展望¶
- 作者承认的局限很直接:预训练的规模与广度不及同期图像表示方法;生成没有端到端打通,当前定位是"替代 VAE 的 latent 提供者",而即便这一格也没赢过 SD VAE;要接入 VLM 还需要文本对齐的预训练。
- 实验范围其实比"universal"这个词听起来窄:全程只做图像,没有视频、3D、音频;"universal"主要体现为跨任务(分类/分割/深度/重建/生成)与跨 token 维度,而不是跨模态。识别评测也全部是线性探测,未验证微调场景。
- 消融的统计口径偏弱:蒸馏相关的消融(表 10、表 11、表 12、表 13)都只训练 5 个 ImageNet22k epoch,远短于最终模型,作者自己也指出"ViT-L 看起来更差"实为训练不足所致;这类短跑结论不宜直接外推到完整训练。
- 表 13 中"INR 隐层 256→512"一行 mIoU 骤降到 23.36,与同列其他行差出一个量级,原文未作解释,读数时需谨慎(⚠️ 以原文为准)。
- 改进方向:把教师换成多教师混合(作者认为最优解大概率是混合蒸馏,但归于工程范围之外);把 TinToks 接入现有生成管线并借助"冻结预训练编码器 + 表征自编码器"的并发工作思路,可能补上生成端的差距;补做视频/多模态扩展才能撑起"universal"的说法。
相关工作与启发¶
- vs DINOv3 / DINO 系列:它们是自蒸馏 + 掩码建模的识别专才,表示里不含像素级信息,也不能重建;HUVR 在 ViT-B 规模的分类上反超(85.0 vs 84.6),稠密任务小幅领先,ViT-L 规模仍略逊,但额外获得重建与压缩能力。
- vs 统一表示方法(BigBiGAN / MAGE / Sorcen):这些方法同样横跨识别与生成,但能力面窄——BigBiGAN 只有生成 + 识别(ImageNet 56.6),MAGE 74.7/11.11,Sorcen 75.1/9.61;HUVR 达到 85.0,并且是唯一同时提供稠密预测与极端压缩(TinToks)的。
- vs REPA:REPA 用识别模型指导生成模型的训练,本质是"生成模型借用识别特征";本文反过来,用识别模型指导重建模型的训练,并且因为学生本身就是编码器,识别性能不降反升(ViT-B 超过 DINOv3),而 REPA 训出的生成模型在识别上仍有明显差距。
- vs 前人 INR 超网络(TransINR / IPC / LA-IPC / ANR):它们预测整图一个 INR,输出 token 冗余且无空间对应,只能做重建与压缩;HUVR 改成 patch 级预测并补上蒸馏,既在重建上领先(ImageNette 48.44 vs LA-IPC 46.10,且只用 400 而非 4000 epoch),又第一次让这类模型能做分类与分割。
- vs Latent-INR:同样追求带语义的 INR,但 Latent-INR 是为每个视频单独拟合超网络、把可学习 latent 对齐到 CLIP embedding;HUVR 学的是一个通用超网络,可以直接处理训练中没见过的输入。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次把 INR 超网络当作通用视觉编码器来训练,patch 级权重预测 + 全局 token 外积调制是真正原创的设计,并顺带产出 96 倍压缩的可用表示。
- 实验充分度: ⭐⭐⭐⭐ 覆盖分类/分割/深度/重建/生成五类任务、多个骨干与维度,消融维度完整;但蒸馏类消融只跑 5 个 epoch,规模也远小于同期表示学习方法。
- 写作质量: ⭐⭐⭐⭐ 动机与设计动机交代得清楚,多个表的数值与摘要口径存在小出入(如 +8.2 mIoU、+1.26 PSNR),少数表在 PDF 抽取后列错位需对照原文。
- 价值: ⭐⭐⭐⭐ 给"统一视觉编码"提供了一条不经 VAE、也不经对比学习的新路径,压缩 token 与超网络设计可复用到其他需要"小而有语义"表示的场景;生成端尚需后续工作补齐。