MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/SamsungLabs/MOCHA
领域: 目标检测
关键词: 知识蒸馏 / 跨架构对齐 / 多模态监督 / 少样本个性化检测 / 表示对齐
一句话总结¶
MOCHA 让冻结的 LLaVa 教师按「检测框 + 类名」这个组合产出对象级多模态嵌入,用一个通道注意力翻译模块把 YOLO 学生的多尺度区域特征映射到该嵌入空间,再用「逐点对齐 + 关系几何保持」的双目标损失监督,使 3.2M 参数的轻量检测器在四个个性化检测基准上比 YOLOv8n 基线平均高 10.1 个点,推理仅增加 3 ms/图。
研究背景与动机¶
个性化目标检测要把一个通用于「狗」的检测器,适配成能认出「用户自己的那条狗」,而且只允许用户提供 1-5 张样本。这个场景在手机、机器人这类端侧设备上最有用,也最难:轻量检测器的语义先验本来就薄,在低数据下还会往神经坍缩(neural collapse)方向退化——不同类别的特征被挤到几乎同向,判别力直接消失。反过来,CLIP、Flamingo、LLaVa 这类视觉语言模型拥有很强的对象级语义,但 7B 量级的模型在端侧既跑不动、也不适合放进实时回路。于是最自然的思路是知识蒸馏:把 VLM 的语义搬进小检测器,部署时只留小模型。
难点在于这次要跨的东西比通常的跨架构蒸馏更多。OFA、跨架构 KD 这类方法大多假设师生在做同一件事,把两边多尺度特征投影到共享空间做稠密监督;与本文设定最接近的 AuXFT 则用 DINO 的视觉特征注入轻量检测器,支撑原型分类,是少见的「教师指导一个相关辅助任务」的路线。但 AuXFT 只用纯视觉线索,且对齐对象是稠密的中间激活。而 VLM 真正稀缺的东西并不是另一个更容易对齐的视觉特征图,而是「这块区域 + 这个类别名」联合起来的多模态语义——它才是 CLIP 系表示在开放词汇与少样本下好用的原因。矛盾由此而来:教师的语义表示是对象级、单尺度、带语言条件的,学生的特征是像素级、多尺度、纯视觉的;两者既隔一层模态鸿沟(视觉 vs 视觉-语言),又隔一层结构错位(多尺度检测器特征图 vs 对象中心表示)。硬搬稠密激活,既搬不到语义,也丢掉了「只用紧凑嵌入」本来能省下的算力。
本文的切入角度是把对齐粒度收窄到真正需要的那一层:既然最终要的是实例级判别而不是复制特征图,那就以检测框为锚点做对齐——教师端把框裁出来配类名做文本查询,融合成一个紧凑的对象嵌入;学生端把同一个框在各尺度上的特征池化成定长描述子;中间放一个小翻译模块负责弥合空间差异;再补一个关系项约束嵌入空间的整体几何,防止逐点对齐把类间结构抹平成「每个点都抄对了、但彼此关系全乱」。核心 idea:把跨架构蒸馏从「稠密特征图对齐」改成「以检测框为锚点的对象级多模态嵌入对齐」,用翻译模块加逐点/关系双目标损失,把 VLM 的语义与几何一起搬进轻量检测器,而推理时既不需要教师也不需要文本。
方法详解¶
整体框架¶
MOCHA 是一个三阶段的知识蒸馏流程,目标是把冻结的视觉语言教师的多模态语义搬进一个纯视觉的轻量检测器。输入是一批带框标注的检测数据(用于预训练与蒸馏)和用户提供的少量个性化样本(用于个性化);输出是一个部署时完全独立、不需要教师也不接受文本输入的小检测器。三个阶段依次是:基座预训练(用标准检测目标在 COCO/OpenImages 上练出通用检测器 \(m_S=l_S\circ g_S\),\(g_S\) 是骨干、\(l_S\) 是检测头)、特征蒸馏(教师冻结,学生在对象级嵌入空间里被对齐与正则化)、少样本个性化(学生骨干与翻译模块一起冻结,只训练一个基于原型的分类器)。核心贡献集中在第二阶段。
需要强调的是对齐发生在对象区域级嵌入上,而不是稠密特征图、也不是检测头输出:教师端每个 GT 框被裁成一张小图,配上该框的类别名一起送进 VLM,产出一个承载「这块区域是什么」的融合向量;学生端同一个框在多尺度特征图上被池化成描述子。空间维度被完全消掉,两端比较的是同一块语义对象,这才是「objects-aware」在这个方法里的具体含义。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 + 框标注"] --> B["多模态对象级监督信号构建<br/>框裁剪 + 类名文本查询<br/>融合 → PCA → 通道归一化"]
A --> C["区域对齐的学生多尺度特征聚合<br/>多尺度裁剪 + 池化 + 拼接"]
B --> D["翻译模块 t_S<br/>通道注意力 + MLP"]
C --> D
D --> E["双目标蒸馏损失<br/>逐点对齐 + 关系一致性"]
E -->|学生与 t_S 冻结| F["少样本个性化<br/>原型分类器覆盖通用标签"]
关键设计¶
1. 多模态对象级监督信号构建:让教师回答「这块区域 + 这个类别」而不是只给视觉特征
教师端要产出的是「锚在框上的语义」,这决定了后面所有对齐的上限。做法是:把每个框 \(b_i\) 裁出的区域送进教师的视觉编码器(LLaVa-1.5-7B 里的 CLIP ViT-B/32)得到视觉嵌入 \(Z_{V,i}\),同时把类别名 \(c_i\) 当作文本查询嵌入成 \(Z_{Q,i}\),两者经教师共享的投影矩阵 \(W_T\) 进入同一表示空间后,交给冻结的语言模型计算「区域与类别交互」的 token 序列,沿时间维平均得到融合语义 \(h_i\)。这个 \(h_i\) 是带语言条件的——它描述的不是「这里有一块纹理」,而是「这里是 dog 这种对象」,这正是纯视觉教师给不出的东西。
但只用 \(h_i\) 会丢外观:原文明确指出多模态特征不必然保留 appearance-level 的线索,而个性化检测恰恰要靠外观区分「这条狗」和「那条狗」。所以再拼上对应的视觉类 token \(z_{V,i}\),用 \(\gamma=\|h_i\|\) 把它缩放到与文本特征同量级后拼接,得到既含原始外观、又含语言条件下语义解释的表示 \(u_i\):
这个向量维度很高且冗余(\(d\) 最大到 4608),于是离线在蒸馏数据集上做一次 PCA 取前 \(d_t\) 维,再逐通道除以该通道激活的标准差 \(\sigma_c\) 做归一化(原文附录观察到 \(\sigma_c\) 随通道序号近似双曲衰减,因此可以只按通道下标估计)。PCA 是离线预计算并缓存教师嵌入的,训练迭代里不跑 VLM;归一化则把各通道的贡献拉平,避免少数高幅通道主导距离度量——消融里归一化版本在 1-shot 下明显优于未归一化版本。
2. 区域对齐的学生多尺度特征聚合:把「同一个框」翻译成学生侧可比较的描述子
学生是多尺度 CNN 检测器,教师给的是一个对象 token,尺度与粒度都对不上,所以学生侧必须先构造出「也在描述这个框」的表示。做法完全对称于教师的裁剪:对每个 GT 框,先把各层特征图 resize 到一个公共尺寸以消除分辨率差异,保证不同层级上的空间位置能对应到同一块区域;然后从每个尺度 \(j\) 抽出区域对齐特征 \(F_{A,j,i}\),做空间平均池化得到定长描述子 \(f_{A,j,i}\),最后把各层池化结果拼接成 \(f_{A,i}\)。这样「框内的多尺度上下文」被压成一个向量,且与教师端的框裁剪在语义上指向同一块像素——两端看的是同一个对象,对齐才有意义。
这里值得说的是池化而不是保留特征图:对象级监督只需要一个区域描述子,保留 dense 激活反而会带来维度灾难与巨大对齐开销。消融里把框换成「不池化的稠密等价形式」并不占优,而拼接多尺度相比只用单层能带来稳定增益,说明多层上下文对细化小目标与遮挡目标是有用的。
3. 翻译模块 \(t_S\):跨架构做的是语义映射,而不是一次线性投影
学生的区域描述子和教师的 PCA 目标即使维度对齐了,也仍处在两个异质空间中:一端是卷积检测器在监督检测任务里学出的、以尺度和纹理为主轴的 latent,另一端是 VLM 在图文对齐目标下学出的、以语义与语言条件为主轴的 latent。\(t_S\) 的任务就是把前者搬到后者:它按一个 transformer encoder block 搭起来,主体是通道维的多头自注意力加一个轻量 MLP,注意力用来建模通道之间的依赖、让网络自己决定哪些通道承载的是可迁移的语义,MLP 则负责调整到目标维度 \(d_t\)。\(t_S\) 与检测器联合训练而不是分阶段预训练,因此对齐是随着检测器一起演化的:检测器逐渐产生更好对齐的特征,翻译模块也随之上移。个性化阶段 \(t_S\) 连同骨干一起冻结并复用,用户样本也要经过它才能落进同一个空间。
4. 双目标蒸馏损失:逐点对齐之外,还要保住嵌入空间的相对几何
只做逐点回归会有一个隐蔽的失败模式:学生把每个区域都尽量贴到对应目标上,但目标之间的相对位置关系(哪些类别彼此接近、同类实例是否聚拢)可能被压坏,而实例级判别恰恰依赖这种近邻结构。MOCHA 因此加了关系项 \(L_{\mathrm{emb}}\):对同一批区域,分别算学生特征与教师目标之间的两两欧氏距离矩阵,去掉对角线自距离后过 softmax 变成两个分布,再让它们的交叉熵最小——也就是要求学生复现「谁离谁近」的全套相对关系,而不只是复现每个点的绝对位置。距离取负号再过 softmax,意味着越近的一对在分布中权重越大,梯度因而集中在真正重要的近邻对上。
这一项理论上 \(O(N^2)\),但每个框都对应一个 GT 区域,实际每图只有很少的目标(OpenImages 上平均 \(N\approx8\)),开销相对卷积可忽略。论文用一个玩具实验验证它的作用:把十个 2D 点(学生嵌入的代理)去拟合一组固定 3D 参考点(教师嵌入的代理)的两两距离分布,在只用 \(L_{\mathrm{emb}}\) 的情况下,2D 点的 top-k 近邻与 3D 参考分布的匹配率随迭代稳定上升并快速收敛,说明关系监督确实能在大幅降维的同时保住邻域结构。在真实消融中,去掉 \(L_{\mathrm{emb}}\) 在两个数据集上都掉点,是除预训练策略外最敏感的一个组件。
一个完整示例¶
以一张 POD 场景图(原文特征相似度可视化用的就是含三个物体的 POD 场景)走一遍:
- 预训练:YOLOv8n 在 OpenImages 上按标准检测目标练出通用检测器;若从 AuXFT 权重起步,通用检测与实例判别都已经更好。
- 构造教师目标:图上约 8 个 GT 框各裁一张小图,配类名分别过冻结 LLaVa,得到 \(h_i\);与缩放后的视觉类 token 拼接成 \(u_i\)(最高 4608 维),离线 PCA 压到 512 维,再按通道除以 \(\sigma_c\)。
- 对齐:同一批框在学生各尺度特征图上做 resize + 区域池化 + 拼接,过 \(t_S\) 得到 512 维 \(f'_{A,i}\),与 \(u'_i\) 算逐点距离,同时用全部 8 个区域算关系项。检测损失仍在监督框回归与分类。
- 个性化:用户给 1 张带个人标签的样本(如“我的杯子”),冻结的骨干 + \(t_S\) 把该实例的嵌入算成类原型,训练最近类均值分类器;推理时检测头原来的通用类别预测被个人标签覆盖。整条推理路径没有 LLaVa、没有文本提示、没有在线自适应,只多出 \(t_S\) 这一小段计算(YOLOv8n 上约 3 ms/图,相对增加约 10%)。
损失函数 / 训练策略¶
蒸馏阶段总目标是检测损失加两个辅助项:
逐点蒸馏损失 \(L_{\mathrm{dist}}\) 取 \(\ell_1\) 与 \(\ell_2\) 距离的平均(原文表述为「\(\ell_1\) 与 \(\ell_2\) 距离的平均」,抽取到的公式只保留了在 \(n\) 个区域上的求和,其中是否含 \(1/2\) 系数 ⚠️ 以原文为准):\(\ell_1\) 项对离群区域更鲁棒,\(\ell_2\) 项对幅度做精细拉近,两者互补让对齐既稳又准。
关系项 \(L_{\mathrm{emb}}\) 的写法在关键设计 4 已给出。训练配方上,蒸馏默认跑 50 个 epoch,从 AuXFT 权重起步时因为收敛更快降到 20 个;PCA 维度取 \(d_t=512\);检测器、翻译模块与两个损失联合优化,教师全程冻结且嵌入预计算缓存。个性化阶段骨干与 \(t_S\) 全部冻结,只训练原型分类器,在 1-shot 与 5-shot 两种预算下评测。
实验关键数据¶
主实验¶
四个个性化数据集:PerSeg 与 POD 报端到端 mAP50-95,CORe50 与 iCubWorld 沿用 AuXFT 的检索协议(目标出现在排序靠前的检测提议中即算命中)。学生 YOLOv8n,教师 LLaVa-1.5-7B,除特别说明外蒸馏 50 epoch。
| 教师 | 方法 | PerSeg 1s | POD 1s | POD 5s | CORe50 1s | CORe50 5s | iCubWorld 1s | iCubWorld 5s | Avg |
|---|---|---|---|---|---|---|---|---|---|
| – | YOLOv8n 基线 | 41.2 | 23.6 | 30.4 | 57.8 | 67.3 | 51.2 | 68.4 | 48.6 |
| DINO | AuXFT | 48.8 | 31.5 | 38.8 | 58.8 | 69.3 | 55.0 | 74.5 | 53.8 |
| LLaVa | KL div. + MSE | 50.1 | 27.6 | 30.5 | 53.3 | 65.7 | 61.1 | 78.5 | 52.1 |
| LLaVa | GLIP | 52.1 | 27.3 | 32.7 | 58.7 | 64.6 | 61.2 | 71.1 | 52.2 |
| LLaVa | SKDF | 47.0 | 25.8 | 28.4 | 58.4 | 67.3 | 62.7 | 74.1 | 52.0 |
| LLaVa | MOCHA(AuXFT 初始化) | 59.1 | 36.3 | 45.9 | 60.9 | 70.6 | 61.4 | 77.0 | 58.7 |
学生架构消融(Tab. 3)显示监督方式换到别的检测器上同样有效:
| 学生 | 无蒸馏 | AuXFT | MOCHA(AuXFT) |
|---|---|---|---|
| YOLOv8n(≈3.2M,PerSeg 1s / iCub 1s / iCub 5s) | 41.2 / 51.2 / 68.4 | 48.8 / 55.0 / 74.5 | 59.1 / 61.4 / 77.0 |
| YOLOv11n(≈2.6M) | 49.3 / 52.7 / 72.8 | 52.8 / 53.9 / 73.3 | 56.2 / 57.5 / 74.1 |
| RT-DETR-l(≈45M) | 43.5 / 45.0 / 63.5 | 45.2 / 46.1 / 64.0 | 47.0 / 47.8 / 64.4 |
消融实验¶
组件与超参消融(PerSeg 1-shot / iCubWorld 1-shot / iCubWorld 5-shot,均以 AuXFT 初始化、\(d_t=512\) 的完整模型为参照):
| 配置 | PerSeg 1s | iCub 1s | iCub 5s | 说明 |
|---|---|---|---|---|
| 完整 MOCHA(AuXFT,\(d_t=512\)) | 59.1 | 61.4 | 77.0 | 参照 |
| 去掉 \(L_{\mathrm{emb}}\) | 56.6 | 59.8 | 74.9 | 关系项去掉后两个数据集齐掉 |
| 翻译模块去掉注意力 | 56.8 | 57.5 | 73.2 | iCubWorld 掉得最多(-3.9) |
| 翻译模块去掉 MLP | 55.7 | 61.4 | 76.6 | PerSeg 掉 3.4 |
| \(d_t=256\) | 56.4 | 61.2 | 75.7 | 压得过狠,语义有损 |
| \(d_t=384\) | 56.2 | 59.6 | 74.7 | 同上 |
| \(d_t=1024\) | 53.8 | 58.4 | 77.0 | 更大无收益,PerSeg 反而掉 5.3 |
| 蒸馏数据加颜色增强 | 53.3 | 58.4 | 73.4 | 标准 YOLO 增强反而伤鲁棒性 |
| 编码器学习率 ×2 | 53.6 | 59.0 | 75.8 | 单独放大任一侧都掉点 |
| 解码器学习率 ×2 | 53.9 | 59.7 | 75.9 | 同上 |
| 预训练用 OpenImages | 53.8 | 56.8 | 70.4 | 仅 OI 预训练最弱 |
| 预训练用 COCO | 55.4 | 60.6 | 77.6 | COCO 权重已超过全部前作 |
| 预训练用 AuXFT | 59.1 | 61.4 | 77.0 | 最佳,且与 MOCHA 架构兼容 |
教师信号的对照实验(oracle 设定,直接用 GT 框、只看分类能力):单用 DINO 平均 59.9、单用 CLIP 视觉 token 72.7、单用 LLaVa 的融合语义 \(h_i\) 只有 62.2,而「\(h_i\) + CLIP 视觉 token」拼起来到 74.2/74.3;学生侧同一组监督蒸馏后分别为 43.2(无蒸馏)/ 50.7 / 48.0 / 54.0,说明视觉与文本线索确实是互补的,而不是「换个更强的教师」带来的增益。
关键发现¶
- 单模态监督不够,互补才是关键:教师侧只给文本语义(\(h_i\),62.2)甚至不如只给视觉 token(CLIP,72.7);但两者拼接后(74.3)超过任一单项,而且 CLIP 本来就是 LLaVa 的一部分,融合几乎不额外增加成本。这也解释了为什么 \(u_i\) 里必须保留外观 token——语义负责「是什么类」,视觉负责「是哪一个个例」。
- 关系项是第二敏感的组件:去掉 \(L_{\mathrm{emb}}\) 在 PerSeg 掉 2.5、iCubWorld 1-shot 掉 1.6、5-shot 掉 2.1。论文给出的解释是逐点对齐容易压坏嵌入空间的相对几何,而少样本个性化正是靠这种近邻结构做判别的;玩具实验(2D 拟合 3D 距离分布)进一步显示关系监督能在强降维下保住 top-k 邻域并快速收敛。
- PCA 不是越紧越好、也不是越大越好:\(d_t\) 从 512 往上到 1024 时精度平台化甚至下滑(PerSeg 掉到 53.8),往下到 256/384 也掉点,512 是紧凑性与表达力的平衡点;归一化版本在 1-shot 下尤其优于未归一化版本,说明通道尺度对齐对少样本很重要。
- 学生越像 YOLO、收益越大:YOLOv8n 上 MOCHA 相对 AuXFT 提升最大(PerSeg +10.3),换到 YOLOv11n 仍有增益但幅度缩小(PerSeg +3.4),到 transformer 系的 RT-DETR-l 只剩 +1.8 左右。原文的解释是 RT-DETR-l 参数多了一个量级、且与 YOLO 差异大,翻译模块跨过去的难度更高;不过它本身架构上更接近教师,所以「需要搬的东西本来就少」。
- 预训练初始化很关键:仅用 OpenImages 预训练时 MOCHA 只有 53.8,COCO 权重就足以超过所有前作(55.4),从 AuXFT 权重起步最好(59.1),说明这套蒸馏和监督信号与一个已经具备实例判别能力的初始化是互相加成的。
- 代价极低:个性化与推理阶段完全没有 VLM、没有文本提示、没有在线自适应,YOLOv8n 在 PerSeg 上只增加约 3 ms/图(相对 +10%),这是它区别于 ViLD、GLIP、PerSAM 这类必须带着大模型或提示推理的方法的核心优势。
- 定性上 MOCHA 在 PerSeg 上的框更准、类别预测更少出错,而 ViLD 这类开放词汇方法在高度个性化的场景里表现挣扎——开放词汇能力并不等于实例级判别能力。
亮点与洞察¶
- 把对齐粒度从「特征图」改成「对象」:这是全文最关键的取舍。因为目标本身就是实例级判别,就没必要也不应该去复制稠密激活;把空间维度消掉后,两端比较的是同一块语义对象,对齐问题从「跨分辨率特征回归」简化成「紧凑嵌入匹配」,顺带把训练与部署开销都压下去了。任何「大模型教师 → 小模型学生」且最终任务是实例/区域级判别的场景都可以照搬这个思路。
- 教师的「多模态」不是拿来当更强特征,而是拿来当语言条件下的标签监督:单看 \(h_i\) 反而弱于 CLIP 视觉 token,真正的增益来自把语义与外观拼起来。这个反直觉的对照实验很有价值,它提醒我们 VLM 的知识要按它擅长的那部分去取用。
- 关系损失作为「几何保存器」:用 pairwise 距离分布的交叉熵代替逐点回归,缓解了蒸馏中常见的「每个点都对了但结构塌了」问题;由于只在 GT 区域上算,\(O(N^2)\) 在实践中几乎免费。这个技巧可以迁移到任何需要保结构的表示对齐任务(跨模态检索、原型网络、持续学习中的表示漂移约束)。
- 个性化与训练解耦:把「学语义」放在服务器侧的蒸馏阶段,把「认个体」留给冻结特征上的原型分类器,于是端侧只需付出一次前向和最近类均值。这个分工让个性化变成了零重训练的操作,工程上很实用。
局限与展望¶
- 跨架构收益高度依赖学生与教师的差距:在 RT-DETR-l 这种又大又接近教师架构的学生上,增益只剩一两个点,说明方法的主战场仍是 YOLO 这类小型 CNN 检测器,作者也把这点写成了 on-device 场景的适配性限制。
- 蒸馏对象是 GT 框:训练时用人工标注的框做裁剪,意味着教师监督的质量上限受标注质量约束,且无法利用无标框数据;若要扩展到开放世界或半监督设定,需要先解决「用谁预测的框当锚点、如何避免错误框污染对齐目标」的问题。
- 每张图需要把若干区域裁出来过一遍 VLM 来预计算目标(虽然离线且缓存),这一步在超大规模数据上的成本与工程复杂度论文没有展开;同时 PCA 与通道标准差 \(\sigma_c\) 都是在蒸馏数据集上离线拟合的,换成差异很大的目标域时这套统计量是否还成立值得验证。
- 个性化仍是「用户给样本 → 覆盖标签」的封闭集形式,没有处理用户随时新增类别、类别间存在层级关系或用户样本本身含噪的情况;原型分类器在 1-shot 下的方差(表中标准差常在 3-6)也说明它离稳健还有距离。
- 作者报告 YOLOv8n 上约 3 ms/图的额外开销来自翻译模块,这是个一次前向的小模块;但论文没有给出端侧真实设备的延迟与内存实测,也没给出与学生同等参数量的纯视觉自监督预训练基线作对比,因此「多模态监督」相对「更好的视觉预训练」的净收益仍留有疑问。
相关工作与启发¶
- vs AuXFT(IROS 2024):AuXFT 是目前唯一处理同类设定的前作,用 DINO 的高层视觉特征注入轻量检测器以支撑原型分类。MOCHA 的差别有三点:监督信号是多模态的(视觉 + 文本)而非纯视觉;对齐对象是紧凑的区域级嵌入而非稠密中间激活(更省、且语义密度更高);显式加了关系正则去约束实例之间的几何。实测平均 +4.9,且在 PerSeg、POD 这类需要细粒度语义对齐的困难域上领先更明显。
- vs OFA / 跨架构 KD:这类方法把师生多尺度特征投到共享空间做稠密监督,前提是师生做同一件事、共享任务语义。MOCHA 的目标更接近「用教师指导一个相关辅助任务」,对齐只在对象级嵌入上进行,因此不受分辨率与特征图形状的严格对应约束。
- vs GLIP / SKDF / DRKD / KL(+MSE):这些代表不同的监督范式——相似度/特征回归、关系匹配、输出空间 KL。在 MOCHA 自己的多模态区域级设定下重实现后,KL 与 OFA 式监督收益有限,相似度与关系型(GLIP、SKDF、DRKD)更好但仍低于 MOCHA,说明「逐点回归」与「纯关系匹配」都不够,逐点对齐加显式关系正则是这套信号能生效的组合条件。
- vs ViLD / GLIP / PerSAM / SwissDINO 等开放词汇与提示式方法:它们靠文本或视觉提示驱动通用模型,能零样本识别但推理开销大,且不直接解决「同一类里的哪个实例」这一层。MOCHA 把 VLM 只在服务器侧离线用一次,部署时完全去掉,路线上的取舍正好相反。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把跨架构蒸馏的对齐粒度从特征图收到对象级多模态嵌入是个干净且有说服力的重构,但翻译模块、关系损失、原型个性化都是已有组件的有机组合。
- 实验充分度: ⭐⭐⭐⭐ 四个个性化基准、三种学生架构、完整的组件与超参消融,还配了玩具实验解释关系项;缺端侧实测延迟与「更好视觉预训练」的对照基线。
- 写作质量: ⭐⭐⭐⭐ 三阶段与贡献划分清晰,教师信号的对照实验写得有信息量;部分公式在论文排版中抽取后不完整,个别数值表格的列对齐需要读者自行辨认。
- 价值: ⭐⭐⭐⭐ 对端侧个性化检测是一个直接可用、开销很小的方案,且「对象级对齐」的思路可以迁移到其他大模型教师蒸馏到小模型的任务上。