Rapidly Deploying On-Device Eye Tracking by Distilling Visual Foundation Models¶
会议: ECCV 2026
论文: ECCV 2026
领域: 模型压缩
关键词: 知识蒸馏, 眼动追踪, 视觉基础模型, 合成到真实, 端侧部署
一句话总结¶
本文提出 DistillGaze:先用合成注视标签加无标注真实红外眼图把 DINOv3 自蒸馏成领域教师(86M),再把它蒸馏进一个 256K 参数的端侧学生,全程不使用任何真实注视标签,在 Project Aria 众包数据集上把中位注视误差从 3.48° 降到 1.44°(↓58.6%),尾部分布 E90U90 从 14.84° 降到 8.45°(↓43.1%),且模型尺寸与合成监督基线完全相同。
研究背景与动机¶
眼动追踪是 AR/VR 的核心传感能力,前向注视点渲染、注视交互、注意力感知界面都依赖它。但把一套高精度注视估计真正落到一块新硬件上,代价高得离谱:团队要依次走完硬件打样、标定、数据采集、人工标注,才能拿到可用的注视真值。麻烦在于这套流程几乎不可继承——相机位置、相机位姿、照明几何、传感器特性、甚至端侧 ISP 的任何一点变化,都会让上一代训练好的模型失配,于是每换一代设备就要把数据采集和模型重训整个重来一遍;在众包协议下,单是一代设备变体的采集周期就要以周甚至月计。更糟的是注视监督本身就不可靠:即便在受控标定协议下,受试者也会出现注视不完美、配合不完整的情况,产生的标签噪声在规模化时几乎无法检测。
合成数据是眼下最现实的出路。只要知道新设备的相机内参外参和照明几何,就能用 Blender 批量渲染出照片级真实的近眼图像,并且天然带有像素级精确的注视标签,可以覆盖真实采集中很难凑齐的眼部外观与注视方向多样性;而既有的 3D 眼球资产和受试者外观模型是可以跨代复用的,每代新产品只需要更新已知的光学参数,交付周期就能从月压缩到天。代价是渲染图和真实目标分布之间仍有残差——纹理、噪声特性、光学伪影都对不齐。于是自然会想到再往前一步:视觉基础模型(DINOv3、SAM3、Sapiens2 等)在自然图像基准上迁移性极好,能不能干脆跳过采集和适配?论文的实验给出了否定答案。把现成 DINOv3(ViT-B,86M)冻结后在线性探测下评测,注视误差超过 5°,参数量是对照的 336 倍,精度却明显不如一个只用合成数据训练的 256K 端侧小模型;同样的结论在 DINOv3 的整个 ViT 与 ConvNeXt 家族上都成立。t-SNE 可视化解释了原因:近眼图像的 DINOv3 嵌入是按受试者身份紧密聚类的,注视方向被身份信息压制,但簇内分布又呈现出与注视方向平滑相关的梯度——也就是说,注视信号确实编码在 VFM 里,只是被组织成了身份表示,需要域内重塑才能取出来。这里就是本文要解的核心矛盾:VFM 有信号但不合用,而它能发挥全部性能所需的算力又远超端侧预算。
本文的核心 idea 是把"从 VFM 取信号"和"端侧部署"拆成先后两步:第一步用合成标签加无标注真图(自蒸馏 + 伪标签)把 VFM 优化成领域教师,第二步把这个教师蒸馏成一个 256K 的端侧学生,整条链路不需要任何真实注视标签。真实注视标签的缺席意味着新设备上线不必等采集周期,而无标注真图可以在产品还没有标定好的眼动系统之前就随用户日常使用被动收集——这正是"rapidly deploying"的实际含义:不是训练更快,而是新硬件配置的适配不再被标注周期卡住。
方法详解¶
整体框架¶
DistillGaze 是一个两阶段框架,输入是左右眼一对近红外眼图,输出是每只眼的注视方向(yaw/pitch 两个角)。第一阶段(VFM 优化)拿一个现成的 DINOv3 ViT-B 当初始化,用带标签的合成眼图 + 无标注的真实眼图做教师-学生自蒸馏,把它从"按身份聚类"的通用表示重塑成"按注视回归"的领域表示,得到一个 86M 的优化后 VFM 教师;第二阶段(端侧蒸馏)把这个教师的知识迁移进一个 256K 参数的端侧学生,学生只在推理时部署,教师和 EMA 学生都只在训练期存在。两个阶段共用同一套设备感知的强/弱数据增强,用来模拟端侧相机与光照的实际退化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["合成眼图 + 无标注真实眼图"] --> B["设备感知的强弱双增强<br/>MTF / 运动模糊 / glint"]
B --> C["混合监督的 VFM 域内优化<br/>合成标签 + 真图自蒸馏"]
C --> D["优化后 VFM 教师<br/>86M,仅作蒸馏源"]
D --> E["双源蒸馏到端侧学生<br/>特征 VIC-KD + 预测伪标签"]
G["EMA 学生<br/>学生权重的动量副本"] --> E
E --> F["256K 端侧学生<br/>FBNet 骨干,实时部署"]
值得注意的是,两个阶段的"教师/学生"称呼虽然重名,角色却完全不同:阶段一的教师和学生都是 DINOv3 骨干,教师只是学生的 EMA 副本,目的是让 DINOv3 在眼动域里自己长出注视结构;阶段二的教师是已经优化好的那个 86M VFM,学生则换成 FBNet 骨干的端侧模型,中间隔了 336 倍的参数鸿沟,所以这一阶段的难点不是"同架构自蒸馏"而是"跨容量、跨架构的知识搬运"。
关键设计¶
1. 设备感知的强弱双增强:把无标注真图变成可用的监督信号
第一阶段和第二阶段都靠无标注真实眼图来弥合合成-真实域差,但无标签的图本身不携带任何监督,唯一能榨出信息的方式是"同一张图的不同视图应当给出一致的注视"。为此论文设计了两条增强流水线,并且刻意按模型角色分配:教师和 EMA 学生只吃弱增强视图(gamma 抖动 + 随机缩放),学生吃强增强视图。弱增强让教师侧的监督目标尽量稳定可靠,强增强则逼学生在恶劣条件下复现教师/EMA 的判断。
强增强在弱增强之外叠加了两类各以 0.3 概率触发的变换,它们不是通用的图像增强,而是照着眼动场景的失效模式设计的:相机类增强模拟传感器退化,包括调制传递函数(MTF)滤波、运动模糊、压缩伪影;光照类增强针对主动红外照明下的成像问题,包括亮度/对比度调整、glint inpainting(角膜反光修补)、随机阴影和 coarse dropout。角膜反光正是头戴式红外眼动最典型的伪影——反光点和瞳孔高光会直接污染瞳孔边界,模型如果只在干净渲染图上训练,到真实设备上就会把这些伪影当成外观线索。这一设计的意义在于:它让"被动收集的无标注真图"真正可训练,学生是在被人工注入这些退化之后仍被要求与干净的弱增强教师保持一致,等于把域差当成了数据增强来做。
2. 混合监督的 VFM 域内优化:让通用表示自己长出注视结构
阶段一如果只做合成监督微调(论文里的 DINOv3 SynFT),确实已经把 E50U50 从线性探测的 5.47° 拉到 2.01°,但那仍然是把 VFM 当普通骨干用,没有利用无标注真图。另一个自然的替代方案是无监督域适应(UDA),论文试了为回归任务设计的 DARE-GRAM,结果反而比纯合成微调更差(E50U50 4.84° vs 2.01°),作者归因于它过拟合到合成分布、反而放大了合成与真实之间的错位。真正有效的做法是把"合成监督"和"无标注真图上的自蒸馏"接进同一个教师-学生框架:教师看弱增强图、学生看强增强图,两者各自再过 projector 得到嵌入,用嵌入对齐损失把两侧拉近;同时在有合成标签的样本上施加合成监督注视损失,在无标注真图样本上把教师的预测当伪标签来监督学生。
(⚠️ 以原文为准:缓存中的公式排版已损坏,上式按正文文字描述重写。)这里的权重 \(\lambda_{\text{SynSup}}\) 不是固定的,而是用余弦调度从高到低退火:训练初期重压合成监督,先把 VFM 表示强行掰向注视任务;随后逐步把重心移交给全体数据上的自蒸馏与伪标签监督,让真实域的分布接管细节。教师参数则通过 EMA 更新(\(\theta_t \leftarrow \alpha\theta_t + (1-\alpha)\theta_s\),其中 \(\theta\) 涵盖骨干、projector 和注视头),避免学生追一个自己也在剧烈移动的目标。消融显示这个配方把 E50U50 从 2.01° 进一步压到 1.33°(↓33.8%)、E90U90 从 12.11° 压到 8.32°(↓31.3%)——而这 86M 教师最后并不部署,它的全部价值就是当第二阶段的知识源,这也解释了为什么作者愿意在教师侧花 336 倍的参数。
3. 双源蒸馏到端侧学生:特征空间对齐与预测空间伪标签同时上
第二阶段要跨越 336 倍的容量鸿沟,单一类型的监督不够用。论文搭了三个模型:教师是阶段一得到的优化 VFM(骨干与注视头都冻结可用),学生是合成数据预训练好的 256K 端侧模型(FBNet 骨干,左右眼共享权重),另外再维护一个 EMA 学生——学生骨干、projector、注视头的指数滑动平均副本。这一设计的灵感来自 Community KD,但有两处关键改造:其一是同时蒸馏特征空间和预测空间,其二是 EMA 学生的更新走动量而非梯度下降(后者借自 BYOL/DINO 一类的动量自监督)。学生因此在特征侧同时对齐两个目标:一个是从教师投影过去的 \(z_{s\to t}\),一个是对齐 EMA 学生的 \(z_{s\to e}\),两个方向各有自己的 projector。
特征空间的蒸馏用的是 VIC-KD 形式的组合损失——教师与学生的投影之间施加不变性损失,再补上方差正则与协方差正则,防止学生为了对齐教师而把表示压塌成常数:
(⚠️ 以原文为准:缓存中该式下标与正则项参数已损坏,此处按正文说明重写,其中 \(v(\cdot)\)、\(c(\cdot)\) 即 VICReg 的方差与协方差正则项。)预测空间则两头都用伪标签:教师给出 \(\mathcal{L}_{\text{Pseudo-}t}\),EMA 学生给出自蒸馏项的注视监督 \(\mathcal{L}_{\text{Pseudo-}e}\),学生的注视头同时被这两个稳定目标牵着走。两路监督的相对权重 \(\lambda_t\) 同样走余弦调度——早期偏向优化 VFM 教师,让学生先继承结构化表示,后期逐渐转向 EMA 自蒸馏,用更稳定的动量目标打磨细节。这样安排的好处是:教师容量大但目标偏"硬",EMA 学生容量与学生同构、目标是"平滑"的,两者在不同训练阶段各补对方的短板。推理时只导出学生网络,教师与 EMA 学生全部丢弃,所以端侧开销与合成监督基线完全一致。
一个完整示例¶
以阶段二的一次训练迭代为例。取一对左右眼近红外图(原始 640×480,按 [29] 下采样到 320×240):弱增强视图送进 86M 的优化 VFM 教师,得到投影 \(z_t\) 与注视预测 \(\hat y_t\);同一对图的强增强视图送进 256K 学生(FBNet 骨干,左右眼共享权重,特征拼接后由注视头输出左右眼各自的 yaw/pitch),得到 \(z_s\)、注视预测 \(\hat y_s\);EMA 学生也只吃弱增强视图,输出 \(z_e\)、\(\hat y_e\)。学生的梯度来自四项:与 \(z_t\) 对齐的不变性损失(外加方差/协方差正则)、与 \(z_e\) 对齐的 L2 损失、对 \(\hat y_t\) 的伪标签回归、对 \(\hat y_e\) 的自蒸馏回归,两边权重由 \(\lambda_t\) 的余弦调度决定。教师不更新;EMA 学生的骨干、projector、注视头各自按动量从学生对应部分滚动更新。整轮结束后,只有学生的那一份 256K 权重会被保留到部署包里。
损失函数 / 训练策略¶
注视监督统一用带离群抑制的 smooth L1 损失(沿用 [29]):误差小时按二次项惩罚、中等误差退化为线性、超过阈值 \(\gamma\) 的离群点再乘一个小于 1 的系数 \(k\) 缩放,以抵抗众包标注里的标签噪声。值得注意的是论文在教师侧放弃了 DINO 一类的 centering + prototype 软聚类损失,改为简单的 MSE 回归对齐,理由有两点:软聚类会诱导离散、类别化的表示,这与注视估计需要的连续细粒度回归相冲突;而合成监督本身已经提供了足够的正则信号来防止表示坍塌,不必再依赖软聚类机制。这个选择在消融里得到了验证。
端侧模型是 256K 参数、FBNet 骨干、左右眼共享权重。优化用 AdamW + 余弦学习率(10% warm-up),batch size 256,学习率在 \(10^{-3}\) 到 \(10^{-5}\) 之间调整,每个实验最多训练 50,000 次迭代;自蒸馏的 EMA 教师每 100 次迭代更新一次,动量在 0.95 到 0.99 之间调整;特征投影头是三层带 GELU 的全连接。VFM 实验从 DINOv3 ViT-B(86M)初始化,全部实验在 4× NVIDIA A100 80GB 上完成。训练数据侧:真实数据来自 Project Aria,共 6,299 段录制、2,222 名众包受试者,按 1,825 / 397 划分训练与验证受试者,训练集的人为把真实注视标签全部扣掉以模拟无标注设定;相机是两台全局快门单色相机配漫射红外照明,20 fps 录制约 60 秒,训练时按 10 倍时间下采样;合成数据是 Blender 渲染的 165K 帧、998 名受试者。
实验关键数据¶
评测沿用 Error-User(EU)表:先对每个用户算逐帧角度误差的 E50/E75/E90 分位,再在用户维度上聚合出 U50/U75/U90,因此 E50U50 表示"中位用户的中位误差",E90U90 刻画尾部用户;角度误差是按帧在左右眼上取平均后的预测与真值三维注视向量夹角。每段录制均匀采样 64 帧,其中 9 帧留作测试时个性化校准,指标在剩余 55 帧上计算,置信区间由用户与帧的两级 bootstrap(1,000 次)给出。
主实验¶
教师侧(VFM 是否值得优化)对比:
| 方法 | 推理参数量 | E50U50 ↓ | E75U75 ↓ | E90U90 ↓ |
|---|---|---|---|---|
| On-device SynSup(合成监督) | 256 K | 3.48 | 7.41 | 14.84 |
| DINOv3 线性探测 | 86 M | 5.47 | 10.64 | 18.74 |
| DINOv3 合成微调(SynFT) | 86 M | 2.01 | 4.29 | 12.11 |
| DARE-GRAM(UDA) | 86 M | 4.84 | 9.36 | 17.89 |
| Optimized VFM(本文阶段一) | 86 M | 1.33 | 3.07 | 8.32 |
端侧学生对比(⋆ 为本方法,粗体为端侧模型中的最优):
| 方法 | 推理参数量 | E50U50 ↓ | E75U75 ↓ | E90U90 ↓ |
|---|---|---|---|---|
| On-device SynSup | 256 K | 3.48 | 7.41 | 14.84 |
| DARE-GRAM | 256 K | 2.96 | 6.20 | 13.41 |
| 端侧自蒸馏(无 VFM 教师) | 256 K | 2.20 | 4.64 | 10.95 |
| Optimized VFM ▲(不部署) | 86 M | 1.33 | 3.07 | 8.32 |
| 仅伪标签 | 256 K | 1.59 | 3.49 | 8.19 |
| SP | 256 K | 1.59 | 3.50 | 8.21 |
| VIC-KD | 256 K | 1.46 | 3.32 | 8.40 |
| Community KD | 256 K | 1.48 | 3.24 | 8.47 |
| DistillGaze(本文) | 256 K | 1.44 | 3.29 | 8.45 |
| 全监督(上界,参考) | 256 K | 0.82 | 1.94 | 5.91 |
消融实验¶
| 配置 | 骨干/参数量 | E50U50 ↓ | E90U90 ↓ | 说明 |
|---|---|---|---|---|
| 合成监督基线 | 256 K | 3.48 | 14.84 | 只用合成标签 |
| + DARE-GRAM | 256 K | 2.96 | 13.41 | 无教师的域适应,收益有限 |
| + 端侧自蒸馏(无 VFM 教师) | 256 K | 2.20 | 10.95 | 无标注真图本身有效,↓36.8% |
| + 仅伪标签(有 VFM 教师) | 256 K | 1.59 | 8.19 | 加教师后收益最大的一步 |
| DistillGaze(完整) | 256 K | 1.44 | 8.45 | 特征蒸馏再补一点 E50 提升 |
| 教师改用 DINO 式软聚类损失 | 86 M 教师 | 1.50 | 8.86 | 回归任务上 MSE 反而更好 |
关键发现¶
- 优化教师是最大的一步,而不是蒸馏技巧。从合成监督(3.48°)到"有 VFM 教师的伪标签蒸馏"(1.59°)这一步吃掉了绝大部分收益;而在蒸馏阶段内部,VIC-KD、Community KD、SP、纯伪标签几个方案在 E50U50 上只差 1.44°–1.59°,说明当教师足够强时,学生性能更多由教师质量而非具体蒸馏目标决定。这一点在论文给出的只换损失函数不改流程的消融里也能看到:教师侧用 MSE 回归(1.33°/8.32°)明显优于 DINO 式软聚类损失(1.50°/8.86°),对连续回归任务而言,离散化的表示目标本身就是负担。
- 无标注真图确实在补合成-真实的差,但补法有讲究。不加任何 VFM 教师、只把阶段一的 EMA 自蒸馏套到端侧模型上,也能把 E50U50 从 3.48° 降到 2.20°(↓36.8%);而无教师的 UDA 方法 DARE-GRAM 只有 2.96°,说明自蒸馏的一致性约束比显式的域对齐更适合这个任务。
- 尾部指标的行为和中部不一样。论文明确观察到,众包数据集的尾部样本更容易受标签噪声影响(注视目标本身模糊、采集条件不一致),因此仅伪标签的方案反而拿到了最好的 E90U90(8.19°),而加了额外蒸馏损失的版本在尾部略吃亏;Community KD 则在 E75U75 上最好(3.24°)。作者的处理是诚实的:不宣称全面最优,而是说明在只有强教师的场景下,直接回归教师预测已经是足够稳健的目标。
- 跨架构消融推翻了一个直觉假设。作者原本猜测 ConvNeXt 会比 ViT 更适合眼动,因为注视特征高度集中在瞳孔附近、而 ViT 的 patch 分辨率可能成为瓶颈;实测恰好相反,ViT-B 在线性探测、合成微调和自蒸馏三个阶段都优于 ConvNeXt-S,只是优势随着适配加深而逐渐收窄。作者的解释是 patch 内的周边区域(眼睑、虹膜边缘)提供了足够的上下文线索来弥补 tokenization 的分辨率损失。
- 精度接近上界但尾部仍有距离。优化 VFM 与 DistillGaze 学生在 E50、E75 的各用户分位上曲线几乎重合(说明知识迁移得很完整),只在 E90 上有小幅退化;两者都明显逼近用真实标注训练的全监督端侧模型(0.82°/5.91°),但 6° 级的尾部差距仍然是真实存在的。
亮点与洞察¶
- 把"端侧部署"重新定义为"摆脱标注周期",而不仅是"模型更小"。整篇文章的论点是:新硬件的适配时间被众包标注卡住(周/月级),而合成标签 + 被动收集的无标注真图可以把这条链路从月压到天——这让 256K 这个数字服务于一个明确的工程叙事,而不是为压缩而压缩。
- 用 t-SNE 把"VFM 为什么不行"讲成了可操作的空间诊断。不是笼统地说"域不匹配",而是指出嵌入按身份聚类、注视被压制,但簇内有与注视方向平滑相关的梯度——这一句直接决定了后面该做"域内重塑"而不是"换更强的骨干"。这种"先证明信号存在、再证明它被错误组织"的分析路径,在把基础模型迁移到专有模态时可以直接复用。
- 强增强模拟的是设备的失效模式,不是通用的图像扰动。MTF 滤波、运动模糊、压缩伪影、glint inpainting、coarse dropout 这套组合,本质上是把"合成渲染与真实红外成像的物理差异"清单化,再当成数据增强注入。任何做 sim-to-real 的端侧任务(深度、手部、人脸)都可以照这个思路把自己传感器的失效模式列一遍,而不是照抄 ImageNet 的增强配方。
- EMA 学生在蒸馏里当"第二个教师"。教师容量大、目标偏硬;EMA 学生与学生同构、目标是平滑的动量版本,两者互补并且用余弦调度切换主导权——既避免了早期被同容量的自己拖住,也避免了后期被大教师的硬目标带偏。这是一个可以低成本搬进任何"大教师 + 端侧学生"场景的组件。
- "教师只用于蒸馏、不部署"这个取舍算得很清楚。花 336 倍参数训练一个永远不会上端的教师,换回端侧模型 58.6% 的中位误差下降且尺寸零增长——在算力便宜、端侧预算昂贵的场景里,这个交换比非常划算。
局限与展望¶
- 作者承认的最大局限是与全监督上界仍有明显差距,且差距集中在尾部:外观不典型的使用者、极端注视角度这些难例,在没有标注监督的情况下依然难解;优化 VFM(1.33°)到全监督(0.82°)还有一条尾巴没追上。
- 作者给出的后续方向包括:用更强的生成式建模去弥合真实与合成的域差、设计更强的自监督目标、以及在推理时加入轻量在线自适应。
- 所有训练与评测都只在单一设备配置上完成(Project Aria),论文据此提出的"快速适配新硬件"目前是一个有说服力的论证框架,而不是被跨设备实验验证过的结论;多设备(不同相机几何、照明、传感器特性)迁移被列为未来工作。这是本文叙事与实验覆盖之间最明显的一处张力。
- 端侧约束只用了参数量来论证。论文反复强调 256K "suitable for real-time on-device deployment",但缓存全文里并没有给出实测的端侧延迟、内存占用或功耗数字,也没有和合成监督基线做端侧性能的对照——考虑到 FBNet 骨干本来就是硬件感知 NAS 的产物,这一块本可以补上更有说服力的数据。⚠️ 端侧实测数据可能存在于补充材料中,以原文为准。
- 从方法本身看,"无标注真图"的获取成本被描述为"可被动收集",但真实产品里这些图像同样需要一位正在使用的用户;一台上线前的新设备要凑到足够的无标注真图,仍然依赖早期用户规模,论文没有讨论这一点对"rapidly"的时间线意味着什么。
- 技术上的改进思路:既然尾部主要受标签噪声和难例支配,可以在蒸馏阶段对伪标签做置信度加权(而不是全量等权回归),或者按受试者做难例感知的重加权;另外目前 \(\lambda_{\text{SynSup}}\) 与 \(\lambda_t\) 都用固定的余弦调度,换成基于验证误差的自适应调度或许能省掉一次调参。
相关工作与启发¶
- vs DINOv3 线性探测 / 合成微调: 两者都是把现成 VFM 直接用到眼动上。线性探测说明冻结特征在线性映射下完全不够(5.47°,比 256K 小模型还差);合成微调已经能到 2.01°,但仍只把 VFM 当骨干、完全没用上无标注真图。本文的区别在于把 VFM 放进一个自蒸馏框架里做域内重塑,不额外增加推理成本(教师不部署),最终 1.33°。
- vs DARE-GRAM: 面向回归任务的 SOTA 无监督域适应方法,思路是显式对齐源域与目标域的表示二阶统计量。本文实测它在 86M 教师侧(4.84°)和 256K 端侧(2.96°)两个尺度上都打不过更简单的自蒸馏,作者归因于它对合成分布的过拟合反而放大了域差。启发是:在合成数据本身就带强先验的任务里,"对齐"不如"让模型在真图上自己保持一致"。
- vs Community KD: 本文的直接基础,通过多学生在预训练教师下协同蒸馏做双向知识传递。本文的两处改造是同时蒸馏特征空间与预测空间、并把协同学生换成走动量更新的 EMA 学生(借鉴 BYOL/DINO 的动量自监督),消融显示两者性能接近(1.44° vs 1.48°),本文的收益更体现在缺少强教师时的鲁棒性(补充材料用 ConvNeXt-S 教师做了验证)。
- vs VIC-KD / SP: VIC-KD 把 VICReg 的方差-不变性-协方差正则搬到蒸馏上,SP 对齐样本间的相似度结构。本文直接复用 VIC-KD 作为特征空间的蒸馏损失,在端侧对比里它是纯蒸馏方法中 E50U50 最好的(1.46°),但仍略逊于本文同时使用双源伪标签的完整版本(1.44°)。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把基础模型域内重塑与端侧蒸馏串成"无标注真图即可适配新硬件"的完整链路,并给出 t-SNE 层面的可操作诊断;单个组件多为已有方法的组合与改造,但组合方式和问题定义有新意。
- 实验充分度: ⭐⭐⭐⭐ 2,222 名众包受试者的大规模评测、95% 置信区间、覆盖教师侧/端侧/损失函数/骨干架构的多组消融,且诚实报告了尾部指标上并非全面最优;扣分在于端侧延迟/功耗没有实测、跨设备适配只有论证没有实验。
- 写作质量: ⭐⭐⭐⭐ 动机链条(标注周期痛点 → 合成数据 → VFM 失效 → t-SNE 诊断 → 两阶段方案)讲得很顺,两个阶段的"教师/学生"同名不同义也交代清楚了;不足是部分公式在排版上难以核对,端侧约束的量化描述偏弱。
- 价值: ⭐⭐⭐⭐⭐ 对任何要把基础模型落到专有传感器模态的端侧产品都有直接参考价值:教师不上端、只用于蒸馏,合成标签 + 被动无标注真图的组合把新硬件的适配周期从月压到天,且不增加任何推理开销。