跳转至

Human-like Object Grouping in Self-supervised Vision Transformers

会议: ECCV 2026
论文: ECCV 2026
领域: 语义分割
关键词: 物体分组、自监督视觉 Transformer、双点范式、Gram 矩阵、人类视觉感知

一句话总结

本文把经典「双点同/异物体判断」心理物理学范式放大成 255 张 COCO 自然场景、1020 个试次的人类行为基准,用两个点所在 patch 特征的简单 MLP 读出预测人的判断与逐试次反应时,发现 DINO 系自监督 ViT 对齐最好(分组准确率最高 91.9%),并提出基于亲和图 ROC 的「物体中心性 AUC」——该指标跨 9 个模型与行为对齐强相关(Spearman r=0.950),最后用 Gram 矩阵蒸馏把监督模型的分组准确率提升约 8–18 个百分点。

研究背景与动机

把视觉输入绑定成一个个完整的物体,是大脑和 AI 系统共同面对的基本问题。人类处理这件事时动用了一整套信号:部分—整体关系、格式塔线索、以及关于物体类别的语义先验;在视觉皮层上,这一整合过程被认为由「关联场」(association fields)介导,即视网膜拓扑映射区里的长程横向连接,把相距较远的点连起来。现有的物体感知模型基本是在实现这些线索、把分组看作横向连接的渐进激活,但相应的行为与建模实验大多停留在边界清晰、刺激简单的格式塔图样上,自然场景里物体彼此重叠、轮廓含糊的情形反而很少被系统研究。

与此同时,视觉基础模型这条线出现了有意思的镜像:用自监督目标大规模训练的 Transformer 自发涌现出物体分割性质,模型里的自注意力机制会在输入的不同位置之间建立动态上下文连接,形式上很像皮层映射中的关联场;近来的大规模模型比较还显示,轮廓整合能力会随训练数据与模型规模增长而出现,最强的模型已开始接近人类的整合水平。但轮廓整合仍然是低层格式塔线索,把它当作人类物体感知的试金石并不充分——这些涌现出来的物体性到底有没有在自然场景中与人达成一致,此前完全没有行为层面的答案。

缺口之所以一直存在,是因为缺少一把足够细的标尺。此前用双点范式做的对照实验要么规模很小(例如只用 24 张手工挑选的图),要么只用简单刺激,既覆盖不到自然场景中「同一物体内跨部件、跨纹理、被遮挡」的困难情形,也无法提供逐试次的人类反应时供模型对齐;而模型一侧又缺少一个不需要物体级监督、能跨模型比较的「表示有多物体中心」的内在度量。核心 idea:用放大版的双点行为范式给自然场景里的物体分组造一把人类标尺,用最简读出把 patch 特征映射到人的判断与反应时,再用一个基于亲和图 ROC 的「物体中心性 AUC」说明表示里的物体结构才是行为对齐的驱动力,最后用 Gram 矩阵蒸馏证明这种结构可以被显式注入到监督模型里。

方法详解

整体框架

本文并不训练新的视觉模型,而是搭一套「行为标尺 + 表示读出 + 内在度量 + 干预验证」的对照框架。输入是 COCO2017 的自然场景图与九种预训练视觉模型(ViT-B 与 ConvNeXt-B)的 patch 特征;输出有三项:每个模型预测人类「同/异」判断的分组准确率、与人类逐试次反应时的(噪声归一化)Spearman 相关、以及该模型表示自身的「物体中心性 AUC」。在这个基线矩阵之上,工作再往前推一步做干预——把 DINOv3 ViT-B 的 Gram 矩阵蒸馏进四个监督模型,观察三项指标是否同步改善,从而把「物体中心结构 ↔ 行为对齐」的相关关系推到因果方向。

整个流程可以拆成四段:先在自然场景上跑一遍人类行为实验,得到 1020 个带反应时的试次作为标尺;再从每个模型最后一层取 patch 特征,把两个点所在 patch 的特征拼接成试次表示,用两层 MLP 读出预测判断与反应时;接着,对每个 patch 做余弦相似度亲和图并在物体边界上做 ROC 分析,得到不依赖物体标注的物体中心性 AUC;最后做 Gram 对齐实验,检验这个内在度量是否可被训练信号改变。四项分析共用同一批 1020 个试次与同一套 patch 位置,因此三项指标可以在同一个坐标系里直接对照。

关键设计

1. 把双点范式放大成自然场景行为基准:让反应时成为分组难度的连续标尺

双点范式的逻辑很直接:在图上放两个点,问被试它们落在同一个物体还是两个物体上,按键反应的时间就反映分组的难易。这个范式本身不新,但它此前从未被放大到自然场景。本文的做法是从 COCO2017 验证集选图:先挑出中心位置被某个物体覆盖的图(保证中心点一定落在明确的物体边界内),再从这些图里挑出还有第二个物体与第一个重叠的;然后用一个算法为「同/异 × 近/远」四个条件各找一个外周点,并刻意让同物体与不同物体两种条件下的点距分布匹配,防止被试光靠距离猜答案;只有四个条件都能找到合法落点的图才保留。经过人工复核,剔除标注不准导致点落在物体外、以及目视下目标物体有歧义的图,剩 288 张(32 张练习 + 256 张正式);分析阶段再剔除 1 张真值有歧义的,最终是 255 张图 × 4 条件 = 1020 个试次。72 名被试参与,每人每张图只在一个条件下看到(四个条件在被试间轮转平衡),中心点先呈现 500 ms 提示位置,两个点再单独呈现 1000 ms,随后叠加到图上以 5 Hz 闪烁以保证可见;全程要求注视中心点,偏离超过 1° 视角即终止试次(因此剔除 7% 试次)。按 70 cm 观看距离换算,近点距中心约 3°、远点约 6° 视角。

这套设计之所以能当标尺,是因为反应时在这个任务里确实对应分组难度,而本文的行为结果再次确认了这一点:两个点在同一个物体上时被试明显更快(经典的 same-object advantage),并且只有同物体条件下反应时才随点距变慢,不同物体条件下点距几乎没有影响。这个「同物体更快 + 距离效应只出现在同物体条件」的交互,成了一个模型必须复现的定性签名。文中还记录了同条件下反应时变慢的具体情形——两点之间隔着物体内部边界、落在纹理不同的部件上、落在物体较窄的部位、靠近物体边界、场景中存在多个同类物体——说明这批数据抓的正是自然分组里真正困难的样本,而不是一批容易的图。

2. 两点 patch 特征 + 两层 MLP 读出:把「分组」变成可监督的判断与回归

要把模型与人的逐试次行为对上,必须先把 patch 级表示压成一个「这两个点是不是同一物体」的判断,以及对这个判断难度的连续预测;直接观察注意力图既给不出逐试次打分,也没法和人类的反应时做相关。本文的做法是取模型最后层的 patch token——ViT 直接用最后一层 Transformer 的 patch 特征;卷积模型则调整输入尺寸,使其特征图的空间分辨率与 patch size 16 的 ViT-B 对齐,再从最后一层卷积特征切成同样大小的 token。每个试次取中心点与外周点两处 patch 的特征,按「中心在前、外周在后」的顺序拼接成试次表示(特征维度取决于模型,ViT-B 为 768)。

拼接后接一个两层 MLP 读出头。分组实验里它是一个二分类器:为了让读出器有足够训练数据,作者把同一套放点算法跑到 COCO2017 训练集上,自动生成约 3 万个试次,再在 1020 个留出的人类行为试次上报告准确率。反应时预测则换一种训练方式——直接在 1020 个行为试次上做嵌套交叉验证:外层 10 折,每折用 90% 试次训练、10% 测试;每折内部再把训练数据按 90/10 切成训练—验证,用于早停与选参;每个外层折训 10 个随机种子并平均预测,以抵消小数据上的抖动。模型表现最终用「人类噪声上限」归一化:

\[\rho_{\text{norm}}=\frac{\rho\left(\text{模型预测 RT},\ \text{人类平均 RT}\right)}{\rho_{\text{ceiling}}}\]

其中噪声上限的估计完全不依赖任何模型——把被试随机对半分 20 次,每次计算两半平均 RT 之间的 Spearman 相关,20 次取平均;模型一侧则是对 20 个被试分半分别算相关再平均,两者相除,1.0 表示达到了人类自身一致性所允许的上限(原始未归一化的相关值在补充材料里)。

读出器刻意做得极简,是这套设计的关键:只有两层 MLP、只用两个 patch 的特征,任何模型之间的差异就只能来自特征本身,而不是读出容量的差别;用 COCO 训练集自动生成的大规模代理试次,避免了在 1020 个人类试次上过拟合;而噪声上限归一化既让不同模型的相关值可比,也诚实地把「与人类之间还差多少」暴露出来。

3. 物体中心性 AUC:用亲和图的 ROC 把「像不像按物体组织」变成一个免标注的分数

要说明行为对齐的来源,就需要量化「一个模型的 patch 表示在多大程度上是按物体组织的」。难点在于不能拿分割标注去监督这件事,否则测到的是分割能力而不是表示的内在结构;只看少数样例的亲和图也无法跨模型比较。本文提出的度量把这个问题转成一次排序评测:对中心点 patch 的特征与图像内所有其它 patch 的特征算余弦相似度,得到一张亲和图(值越高表示越相似),再把亲和度当成「该 patch 是否属于这个物体」的打分做 ROC 分析。对某个阈值 \(\theta\)

\[\mathrm{TPR}(\theta)=\frac{\#\{i:\ i\ \text{在物体内},\ s_i\ge\theta\}}{\#\{i:\ i\ \text{在物体内}\}},\qquad \mathrm{FPR}(\theta)=\frac{\#\{i:\ i\ \text{在物体外},\ s_i\ge\theta\}}{\#\{i:\ i\ \text{在物体外}\}}\]

其中 \(s_i\) 是中心点 patch 与第 \(i\) 个 patch 的余弦相似度,物体内/外由 COCO 的实例标注界定。把阈值从高扫到低,物体内的 patch 会先被点亮、物体外的 patch 后亮,于是 TPR 在 FPR 还很低时就大幅上升;对全部 1020 个试次的 TPR/FPR 取平均得到每个模型的 ROC 曲线,曲线下面积就是物体中心性 AUC(0.5 为随机,1.0 为完全按物体分组)。举例来说,DINOv3 ViT-B 在一张样例图上把阈值降到 0.42 时 TPR 已经很高而 FPR 仍低,直到 TPR 接近饱和 FPR 才开始上升,这正是物体结构强的表现。

这个指标的好处是只依赖 patch 特征之间的相似度排序、不需要任何物体级监督,因此可以原样套在自监督、监督、重建三类模型上比;ROC 形式也对「某些模型整体相似度尺度不同」这类差异不敏感。更重要的是,它与设计 2 共用同一批试次与同一套 patch 位置,使得「读出的行为表现」和「表示的内在物体性」能落在同一个坐标系里——这正是后文两者相关系数高达 r=0.950 的前提。

4. Gram 矩阵对齐:用蒸馏把「物体中心性」从自监督模型搬进监督模型

前面三项分析给出的都是相关证据:物体中心性强的模型行为对齐也好,但完全可能只是训练数据规模或模型整体质量这类混淆变量在同时推高两者。要说明 Gram 结构本身在起作用,必须做一次干预。Gram 矩阵的定义是把 \(h\times w\) 个 patch token 两两算余弦相似度,得到一个 \((h\times w)\times(h\times w)\) 的矩阵:

\[G_{ij}=\cos\!\left(f_i,\ f_j\right)\]

在物体结构强的表示里,属于同一物体的 patch 之间相似度更高,矩阵沿对角线就呈现出块状结构,块边界大致对应物体边界——这也是作者在论文首图里展示的现象。

干预的做法是:取四个监督模型(IN21k / IN1K 上的 ViT-B 与 ConvNeXt-B),在 ImageNet 分类训练的同时,把 DINOv3 ViT-B 的 Gram 矩阵作为教师信号蒸馏给它们,即让被训模型的 patch 间相似度结构去逼近教师模型的对应结构(⚠️ 正文未给出蒸馏损失的具体形式,自然写法是让学生与教师 Gram 矩阵的差异最小化,例如 \(\|G^{(s)}-G^{(t)}\|_F^2\),以原文及补充材料为准);训练完成后重测分组准确率、物体中心性 AUC 与行为对齐三项指标。

这个设计之所以有说服力,是因为它在保持分类任务不变的前提下只改变了 patch 之间的相关结构:如果三项指标同步变好,说明起作用的是相似度结构而不是别的。结果正是如此——四个模型的分组准确率一致提升,物体中心性 AUC 也一致上升并逼近 DINO 系自监督模型的水平,行为对齐普遍改善;而且两个 Transformer 模型在三项指标上的增益都大于 ConvNeXt,说明自注意力机制本身就是编码 patch 对关系的天然底座。有趣的是,即便没有大规模预训练的模型也从 Gram 对齐中获得了可观的提升,意味着对齐能部分补偿数据规模的不足。这个发现还与 DINOv3 自身的做法互相印证:DINOv3 把 Gram 矩阵锚定作为显式训练信号引入,正是为了保住并增强密集特征质量。补充材料里还报告了一个只蒸馏 CLS token 的基线,用来隔离出「Gram 结构才是有效成分」。

一个完整示例

以一张典型的试次走一遍四步。假设图中是一只猫占据画面中心,外周点在猫的背部(同物体、较远条件)。行为侧:中心点先提示 500 ms,两点单独呈现 1000 ms,然后叠加到图上闪烁;被试注视中心点、尽快按键回答「同一个」。这类试次在数据里对应的是偏慢的一类(同物体 + 远距),因为两点之间要跨过猫身体上一段纹理不同、且靠近轮廓的区域。读出侧:模型把这张图编码成一串 patch token,中心点与外围点各自取到该处的特征向量,拼接后送进两层 MLP,输出「同/异」的预测与一个可用于预测反应时的标量;注意这个读出器只看到两个 patch,猫的其余部分只能通过它们在特征里的痕迹间接起作用。度量侧:取中心点 patch 的亲和图(与全图所有 patch 的余弦相似度),把数值当作打分、把 COCO 里这只猫的实例掩码当作真值扫 ROC;如果与猫身 patch 的相似度普遍高于猫外的背景与其它物体,这条曲线就会向左上角鼓出,贡献一个高 AUC。干预侧:如果这是一个监督模型,它的 Gram 矩阵在猫身 patch 之间可能并不呈现清晰块状;用 DINOv3 的 Gram 矩阵做蒸馏后,同一张图的块状结构变清楚,上述三项指标也会随之变化。

损失函数 / 训练策略

本文没有端到端训练新模型,训练只出现在两处。其一是行为读出:分组任务用 COCO2017 训练集自动生成的约 3 万试次训练两层 MLP 分类器,再在 1020 个留出行为试次上评测;反应时任务则直接在 1020 个行为试次上做嵌套交叉验证(外层 10 折、折内 90/10 早停与选参、每折 10 个随机种子平均),并用前述噪声上限归一化。二是 Gram 对齐:四个监督模型在 ImageNet 分类目标之外,额外地对齐 DINOv3 ViT-B 的 Gram 矩阵结构;⚠️ 原文正文未给出蒸馏项的权重、训练轮数与优化器设置,这些细节在补充材料中。

实验关键数据

主实验

Table 1 报告九个模型在 1020 个留出行为试次上的分组准确率(即两点 patch 特征的 MLP 读出能否复现被试的「同/异」判断)。被试自身的平均正确率为 90%(两者含义并不完全等同,人类数字里含被试自身的判断噪声,不宜直接当作同一基准线比较)。

模型 架构 训练方式 大规模数据 分组准确率
DINOv3 ViT B Transformer 自监督 91.9
DINOv2 ViT B Transformer 自监督 89.0
DINOv3 ConvNext B Convolutional 蒸馏 86.7
MAE ViT B Transformer 自监督 80.7
DINO ViT B Transformer 自监督 76.5
IN21k ViT B Transformer 监督 72.2
IN1K ViT B Transformer 监督 70.6
IN21k ConvNext B Convolutional 监督 67.4
IN1K ConvNext B Convolutional 监督 60.0

消融与分析实验

(a)Gram 矩阵对齐的干预效果:四个监督模型在 ImageNet 分类训练中额外蒸馏 DINOv3 ViT-B 的 Gram 矩阵,三项指标同时变化。正文只给出了四个模型合计的提升区间(分组准确率约提升 8–18 个百分点),逐模型的对齐后数值以柱状图形式呈现在 Fig. 7 中,本笔记不臆测具体数字(⚠️ 以原文为准)。

模型 架构 对齐前分组准确率 分组准确率 物体中心性 AUC 行为对齐
IN21k ViT B Transformer 72.2 ↑(+8~18 pt 区间内) ↑ 逼近 DINO 系自监督模型
IN1K ViT B Transformer 70.6 ↑(+8~18 pt 区间内) ↑ 逼近 DINO 系自监督模型
IN21k ConvNext B Convolutional 67.4 ↑(+8~18 pt 区间内) ↑(增益小于 Transformer)
IN1K ConvNext B Convolutional 60.0 ↑(+8~18 pt 区间内) ↑(增益小于 Transformer)

(b)物体中心性的来源分析(均基于 DINOv3 ViT-B 与全部 9 个模型):

分析维度 对象 观察
层深度 DINOv3 ViT-B 的 12 层 层越深物体中心性越强,最后一层 AUC 最高(ROC 曲线按 AUC 递减排列)
注意力头 最后一层 12 个头 各头曲线接近,物体结构广泛分布在所有头,而非集中在少数头
跨模型关联 9 个模型的 AUC vs 行为对齐 Spearman r=0.950,p=0.0001,跨 Transformer 与卷积两种架构都成立

关键发现

  • 训练目标比架构更能解释差异:同为 ViT-B,自蒸馏的 DINOv2/DINOv3(89.0/91.9)远高于监督训练的 IN1K/IN21k(70.6/72.2);论文自己也指出这两个因素并未完全解耦(DINO 系同时用了更大规模数据与不同的训练流程),因此结论应读作「训练目标是主要因素」而非「架构无关」。
  • 重建目标处在中间位置:MAE ViT B(80.7)夹在 DINO 系与监督模型之间,说明重构式自监督确实学到了一部分物体结构,但程度不及自蒸馏。
  • 物体中心表示不是 Transformer 的专利:DINOv3 ConvNext B(86.7)大幅超过同架构的监督版本(67.4 与 60.0),说明这种表示可以通过蒸馏在卷积架构里获得,只是自注意力对 Gram 对齐的反应更灵敏。
  • 内在度量能预测行为对齐:物体中心性 AUC 与噪声归一化的行为相关跨 9 个模型高度相关(r=0.950,p=0.0001),且这种关系同时横跨两种架构与三种训练目标,支持「patch 级物体性是行为对齐的一般性驱动因素」。
  • 最优模型复现了人类的定性签名:DINOv3 ViT-B 预测的反应时同样呈现出同物体更快的优势,以及只出现在同物体条件下的距离效应,说明它抓到的不只是准确率层面的东西。
  • 深度有帮助、头之间没有明显分工:物体中心性随层数加深而增强;但最后一层各注意力头贡献相近,这与「少数专门的物体头」的直觉不同。
  • 仍有明确的上限差距:最好的模型与人类噪声上限之间仍有一段距离,作者把它留作后续模型的空间。

亮点与洞察

  • 把评价标准从「分割精度」换成「人类一致性」:不训练分割器、不报 mIoU,而是用逐试次反应时相关来评价表示,这直接回答了「模型是否像人一样分组」,而不仅是「能不能分出物体」。这个思路可以迁移到任何「表示属性 ↔ 人类感知」的对照研究,例如深度、材质、可操作性判断。
  • 物体中心性 AUC 是一个免标注、跨架构通用的诊断指标:只需要 patch 相似度与现成实例标注做一次 ROC,就能给任意骨干网络打分,比依赖注意力图可视化或下游分割微调都更轻、更可比。适合作为选骨干时的密集特征质量探针。
  • 噪声上限归一化让行为对齐可比较:用被试对半分的一致性估计测量噪声上限,再除掉;这一步看似琐碎,却是小样本行为实验里让不同模型的相关值可比的必要操作,避免把测量噪声算进模型差异。
  • 「相关 + 干预」的组合是本文最有力的论证结构:先证明内在指标与行为对齐强相关,再通过 Gram 蒸馏给出方向性证据,同时与 DINOv3 自身的 Gram anchoring 设计互相印证——两条独立证据链收敛到同一个机制,比单独的观察性分析可信得多。
  • 一个反直觉的收尾观点:作者明确指出「完美的物体中心性未必是目标」——如果表示完全按物体边界组织,它就退化成一张语义分割图,反而丢掉支撑其它视觉任务的细粒度特征;行为上最对齐的模型可能是在物体级组织与特征敏感性之间取得平衡的那一类。这句话对「把所有能力都往物体性上推」的直觉是一个有益的提醒。

局限与展望

  • 训练目标与数据规模未完全解耦:DINO 系模型都在大规模数据上用自蒸馏训练,监督基线则是 DeiT3 方法在 IN1K/IN21K 上训练,两组之间至少有数据规模、训练轮数、增强策略等多处差异。论文自己承认这一点,因此「训练目标比架构更重要」这一结论在本文的模型集合内成立,作为普遍规律仍需更严格的单一变量对照。
  • 行为数据的规模与人群有限:72 名以修课学分参与的本科生、255 张图、1020 个试次,样本在年龄与视觉经验上都偏同质;论文没有报告跨人群或跨文化的稳健性。
  • 真值依赖 COCO 实例标注的质量:物体中心性 AUC 的 TPR/FPR 完全由实例掩码界定,标注边界不准会直接变成度量的噪声。作者已剔除真值有歧义的图,但边界模糊物体(毛发、透明、细长结构)残留的误差没有被单独量化。
  • 读出与度量都只用最后层特征:层与头的分析只在 DINOv3 ViT-B 上做,且行为读出固定取最后一层;跨层拼接、加入上下文 patch、或改用注意力权重而非 token 相似度,是否会改变模型排序没有被系统探索。
  • 蒸馏损失细节不透明:正文未给出 Gram 蒸馏的具体形式与权重,CLS token 基线也只放在补充材料,复现时需要查阅原文补充材料。
  • 可延伸的方向:把逐试次反应时预测扩展为逐被试预测(当前只用平均 RT),可以检验模型是否也捕捉个体差异;把 Gram 对齐用到更大模型和更多下游任务上,看提升物体中心性是否会在细粒度识别、密集预测等任务上付出代价,正好可以验证作者关于「物体中心性不是越多越好」的猜想。

相关工作与启发

  • vs 双点范式的前作(Korjoukov et al., 2012): 他们用 24 张手工挑选的图研究自然场景中分组的时间进程,结论是心理学层面的;本文沿用同一范式但把规模放大到 255 张自然图与 1020 个试次,并把它第一次当作模型评测标尺使用,两者的差别主要在规模与用途(心理学现象 → 行为对齐基准)。
  • vs LOST / TokenCut(无监督物体发现): 它们同样利用 patch 相似度图,但目标是直接产出物体发现或分割结果,用分割指标评价;本文不追求生成掩码,而是把同一套相似度结构用于预测人类的逐试次判断与反应时,并把它定义成一个可跨模型比较的内在度量。
  • vs DINO 系列涌现分割性质的分析工作: 那些工作主要观察注意力图的物体性;本文用的是 token 特征的余弦相似度(而非注意力权重)做读出与度量,并且补上了行为层面的外部效度验证——注意力图好看不等于与人类判断一致。
  • vs 轮廓整合的模型—人类比较(Lonnqvist et al., 2025): 那条线用低层格式塔线索比较模型与人类,发现最强模型已接近人类水平;本文把问题推进到自然场景中的物体分组,回答了「这些性质在物体相互重叠、轮廓不清时是否依然成立」。
  • vs Gram anchoring(DINOv3 自身): DINOv3 把 Gram 矩阵锚定当作训练信号来保住密集特征质量;本文做了反向的验证——把 DINOv3 的 Gram 矩阵蒸馏给监督模型,物体中心性与行为对齐同样提升,两条证据从不同方向指向同一个机制。

评分

  • 新颖性: ⭐⭐⭐⭐ 行为基准与物体中心性度量都是新的,但双点范式和 Gram 分析各自都有前作,贡献在于把它们第一次接到「模型—人类对齐」这个问题上。
  • 实验充分度: ⭐⭐⭐⭐ 九种模型横跨两种架构与三类训练目标,相关分析与干预实验互补;不足是训练目标与数据规模未解耦、行为被试规模有限、部分细节留在补充材料。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机链条清楚,三项指标的定义与归一化方式交代得干净,结论部分的自我限制(物体中心性不是越多越好、架构与目标未完全解耦)写得诚实。
  • 价值: ⭐⭐⭐⭐ 提供了一个可复用的行为基准与免标注诊断指标,并把「Gram 结构」这一机制推到了因果层面,对自监督表示设计和感知对齐评测都有参考价值。