Multidimensional Observer Model and Perceptual Dimensions of Human Image Quality Assessment¶
会议: NeurIPS2026
arXiv: 2609.38487
领域: 图像恢复
关键词: 图像质量评估、多维观察者模型、感知空间、行为建模、视觉腹侧通路
一句话总结¶
本文把图像表示为低维感知空间中的高斯分布,用带噪采样后的参考距离比较拟合人类选择,发现 CORnet-S Multi 模型在 BAPPS、PieAPP、NIGHTS 上分别以 3、9、96 维达到自身超随机性能的 95%,表明不同质量判断任务需要不同的感知结构。
研究背景与动机¶
图像质量评估(IQA)不只是判断像素误差,也是去噪、超分辨率、生成与渲染系统选择结果的重要依据。PSNR 和 SSIM 用手工关系衡量失真,LPIPS、DISTS、DreamSim 等方法利用学习到的视觉特征提高与人类判断的一致性。但一个指标能预测哪张图更好,并不意味着它说明了人类究竟比较什么:颜色、纹理和对象结构是否属于不同维度,多少维度足以支撑判断,以及这些维度如何随任务变化,仍然缺少可检验的建模工具。
直接给每张图一个质量标量,会先把这些问题压扁。与此同时,同一观察者重复作答可能改变选择,不同观察者也会有分歧;把平均偏好当作一个绝对正确的标签,会丢掉这种可重复的概率结构。本文因此从三元组二选一实验出发:一张参考图与两张候选图同时呈现,观察者选择更接近参考图的候选。真正需要拟合的不是某一次回答,而是多次回答的选择分布。
为了让潜在空间具有解释依据,作者不是从像素训练任意深层嵌入,而是冻结与视觉腹侧通路相对应的特征编码器,仅学习仿射投影和图像相关噪声,再系统改变潜在维数。核心 idea:将“图像的多维带噪表示”与“相对参考的距离决策”分开建模,以行为似然约束感知空间,并用预测饱和点而非预设维数检验任务所需的表示复杂度。
方法详解¶
整体框架¶
模型输入是参考图与两张候选图,输出是选择第一张候选图的概率,以及可供分析的均值、协方差和距离参数。每张图先经过冻结的视觉编码器,再通过仿射投影进入同一个低维空间;协方差预测器依据投影均值生成这张图的噪声分布。每次模拟试次分别为三张图采样,比较两张候选与同一个参考样本的距离,重复模拟后得到选择概率。
这一过程是统计观察者模型,不是新的图像恢复网络,也不是对真实神经活动的直接测量。训练用人类选择频率监督模型头,推理只需要三张图和随机采样,不再输入人类标签。研究阶段还要分别训练不同维数、编码器和任务的模型,观察性能何时饱和,再分析所学维度对应的视觉内容。
这里的核心是分布几何与随机决策,而非多个神经模块的串行协作,因此不把参数关系硬画成网络结构图。以下四个设计分别说明表示来源、噪声结构、选择机制和维数诊断。
关键设计¶
1. 视觉约束的仿射投影:让潜在维度仍能追溯到视觉特征
直接从像素学习低维投影虽简单,却难以解释为人类视觉中的质量表示。作者主要使用 CORnet-S,其四个计算块分别与 V1、V2、V4、IT 的神经响应具有层级对应关系。每个块做空间平均池化,得到 64、128、256、512 维向量;Multi 版本拼接为 960 维。编码器保持冻结,单层特征和多层拼接都可以作为观察者模型的输入。
在这些特征上学习仿射投影,而不再叠加任意非线性编码,是为了直接控制潜在维数,同时保留每个潜在维度来自哪些原始通道的可追溯关系。用 \(B(x)\) 表示冻结特征,核心关系为:
改变 \(N\) 即可比较相同视觉来源下的表示容量。投影的每一行给出一个感知维度如何加权视觉通道,之后可以结合 BRODEN 通道概念解释其偏向颜色、纹理还是对象。作者另用近似视网膜/LGN 空间处理的对比度金字塔,以及 VGG 特征检验结论是否依赖 CORnet-S。这里的“生物约束”是特征来源与投影形式的约束,不是证明学习坐标就是脑内真实坐标。
2. 图像相关协方差场:用分布表达感知歧义,而非只给统一噪声
两张图即使平均感知位置相近,也可能具有不同的判断稳定性。模型因此为每张图学习一个高斯分布,均值描述位置,协方差描述各方向的不确定性及噪声相关性。协方差不是所有图共享的常量,而是投影均值的函数;这也意味着噪声预测依赖压缩后的表示,不能凭空利用被投影丢掉的特征。
为了保证每张图的协方差有效,MLP 输出 Cholesky 因子的下三角元素,两个隐藏层均为 64 维并使用 ReLU;对角线经过 softplus 再加 \(10^{-4}\)。这避免直接预测矩阵时出现负特征值,并使表示随输入连续变化。
这种噪声是对观察者内在波动和观察者间差异的合并建模,并没有分别辨认两种来源。低维可视化中,作者展示均值空间不同位置的协方差椭圆,以便检查歧义是否随图像内容变化;椭圆变化本身不是确定的人类神经噪声测量。
3. 带噪距离比较:把多维表示转成可拟合的人类选择概率
一个模拟试次从参考和两张候选的分布中各抽一个样本。两次候选距离必须使用同一个参考样本:参考图的表示噪声因此共同影响两次比较,不能把两条距离当成完全独立的随机变量。距离采用可学习的加权 Minkowski 形式,权重补偿维度尺度,指数调节不同维度贡献的组合方式。
当 \(p=1\) 时,一个维度对距离的局部贡献不依赖其他维度的幅度;\(p=2\) 对应更整体化的欧氏组合。作者不预先固定这个指数,而是随任务学习。候选 0 被选中的条件是它离参考更近,不是它的均值必然更近。通过 \(K\) 次联合模拟得到概率:
这样,相近的候选可以产生不稳定选择,差距很大的候选则产生更确定的选择。重要的是,概率来自带噪表示的反复比较,而非额外对确定距离差套一个 sigmoid。附录报告 sigmoid 替代方案预测相近,却可能让模型把概率主要交给平滑比较函数,从而学出很窄、近乎均匀的协方差场,削弱噪声结构的解释价值。
4. 超随机性能饱和诊断:把“需要多少维”变成可操作的问题
维数不能仅凭可视化效果或最终预测分数确定。作者对每个编码器与数据集组合扫描 \(N\),把模型自身最佳性能作为参照,寻找最小的维数,使其解释超过 95% 的超随机性能。二选一的随机基线为 0.5,定义为:
这里 \(m(N)\) 是对应维数的性能,\(m^{*}\) 是不限制维数时扫描得到的最佳性能。这个判据刻意衡量“达到该模型能解释的行为所需的维数”,不是达到人类理论上限的 95%,更不是直接测量人脑的绝对内在维数。较弱编码器很快饱和也可能只是信息不足,必须同时看其最高预测分数。
为排除低维结果只是自然图像压缩性的副产物,作者还做频域对照:转到 YUV 后,每个通道只保留最大的 \(K\) 个 DCT 系数,再重建图像并训练观察者头。三个通道共保留 \(3K\) 个系数,所以与 \(N\) 维感知表示的预算匹配条件是 \(K=N/3\)。对照中的投影保持为方阵,不进一步降维;它检验的是频域稀疏重建能否支持同等行为预测,而非证明所有可能的图像压缩方案都无效。
损失函数 / 训练策略¶
对于第 \(i\) 个三元组,\(y^{(i)}\) 是人类选择候选 0 的比例,\(J^{(i)}\) 是观察次数。模型最大化按观察次数加权的二项对数似然,相应最小化:
训练更新投影、协方差 MLP、距离权重和指数,不微调视觉编码器。采样采用重参数化:把标准高斯噪声经 Cholesky 因子变换后加到均值;硬距离比较用直通估计器(STE)传播梯度。默认 Adam 学习率 \(10^{-3}\)、余弦退火、batch size 256、50 epochs、每次比较 \(K=64\) 个 Monte Carlo 样本。
附录还把模型扩展到 MOS/DMOS 评分:以候选和参考分布之间的期望距离为质量依据,用单调评分头映射到坏度分数,在完整 KADID-10k 上以 L1 加相关性损失训练,采用 512 次采样,再跨数据集评估。该设置与三元组似然训练不同,不能把评分结果当成同一个未经重训模型的直接输出。
实验关键数据¶
主实验¶
BAPPS 和 PieAPP 对应低层失真判断,NIGHTS 则使用相同提示、不同种子生成的图像,包含结构与语义差异。前两者的 agreement 使用人类选择比例与模型二值选择计算平均一致概率,并非普通正确率;为与确定性指标公平比较,作者将模型选择概率多数投票二值化。KL 使用未二值化的选择分布,越低越好;NIGHTS 已有二值标签,报告准确率。
下表来自主文 Table 1,本文配置为 CORnet-S Multi,保留代表性基线而非宣称全面领先。
| 数据集与指标 | 本文 | DreamSim | DISTS | PieAPP 指标 | CVVDP |
|---|---|---|---|---|---|
| BAPPS agreement ↑ | 0.688 | 0.683 | 0.678 | 0.629 | 0.645 |
| PieAPP agreement ↑ | 0.710 | 0.719 | 0.690 | 0.717 | 0.591 |
| NIGHTS accuracy ↑ | 0.859 | 0.957 | 0.860 | 0.629 | 0.703 |
| BAPPS KL ↓ | 0.170 | 不适用 | 不适用 | 0.236 | 0.265 |
| PieAPP KL ↓ | 0.088 | 不适用 | 不适用 | 0.083 | 0.985 |
BAPPS agreement 的理论上限为 0.797,人类独立观察者间一致性为 0.731;本文的 0.688 尚未达到这两者。PieAPP 的人类间一致性为 0.687,模型为 0.710;这不矛盾,因为模型二值选择可以比两名独立带噪观察者更一致。NIGHTS 上本文仍比 DreamSim 低 0.098,不应把“接近其他指标”写成“达到最佳语义判断性能”。
消融实验¶
主文 Table 2 给出不同视觉来源的最佳性能及饱和维数;它是编码器与维数分析,而非删模块消融。每个单元格是“峰值性能 / \(n^{*}\)”,前两列为 agreement,最后一列为 accuracy。
| 特征编码器 | BAPPS | PieAPP | NIGHTS |
|---|---|---|---|
| Contrast Pyramid | 0.645 / 3 | 0.647 / 2 | 0.703 / 7 |
| CORnet-S V1 | 0.685 / 4 | 0.701 / 6 | 0.747 / 8 |
| CORnet-S V2 | 0.689 / 3 | 0.712 / 5 | 0.793 / 14 |
| CORnet-S V4 | 0.688 / 4 | 0.714 / 8 | 0.855 / 48 |
| CORnet-S IT | 0.677 / 6 | 0.702 / 14 | 0.853 / 96 |
| CORnet-S Multi | 0.688 / 3 | 0.710 / 9 | 0.859 / 96 |
以下进一步保留 CORnet-S Multi 的控制实验,均按各自协议读取,不横向混合指标。
| 分析配置 | 数据集与指标 | 结果 | 对照与解释 |
|---|---|---|---|
| 感知空间 \(N=6\) | BAPPS agreement | 0.686 | 主文 Table 3 |
| DCT 每通道 \(K=2\) | BAPPS agreement | 0.566 | 与 \(N=6\) 系数预算匹配,低 0.120 |
| DCT 每通道 \(K=200\) | BAPPS agreement | 0.684 | 总计 600 系数,接近 6 维感知模型 |
| PCA 投影 | BAPPS agreement / \(n^{*}\) | 0.664 / 12 | 学习投影为 0.688 / 3,附录 Table 5 |
| BAPPS 训练 → PieAPP | PieAPP agreement | 0.707 | 域内训练 0.710,附录 Table 6 |
| BAPPS 训练 → NIGHTS | NIGHTS accuracy | 0.825 | 域内训练 0.859,附录 Table 6 |
关键发现¶
- 低层任务主要依赖早期至中间视觉特征,IT 并非越高层越好:BAPPS 的 IT agreement 为 0.677,低于 V2 的 0.689;NIGHTS 的 V1 accuracy 为 0.747,明显低于 V4 的 0.855。
- 低维并不是“压缩到相同数量频域系数也一样好”:匹配预算下 Multi 模型的 agreement 差距为 0.120;但此结论只排除了论文所用的 DCT 对照。
- 二维 BAPPS 可视化主要呈现纹理/空间频率与颜色方向;高维 BRODEN 通道分析显示,NIGHTS 更多利用 IT 的部件和对象信息,BAPPS、PieAPP 仍偏向颜色与纹理。
- 附录的维度间相关性分析报告平均非对角相关系数小于 0.25。这支持低冗余,但低 Pearson 相关不等于统计独立,也不证明投影矩阵严格正交。
- 原文有数值与表述不一致:PieAPP 上限在 Table 1 为 0.766、指标段为 0.765;Multi 的 BAPPS KL 在 Table 1 为 0.170、附录 Table 5 为 0.167;主文“低层任务 3–8 维”的概括与 Table 2 的 2、9、14 维条目不完全一致。本笔记保留相应表格值,不自行统一。
亮点与洞察¶
- 把分歧变成研究对象:协方差场不是只为提高分数添加的误差项,而是用来描述图像内容相关的判断歧义。选择概率由随机比较产生,使均值位置与不确定性能够一起接受行为数据约束。
- 用冻结层级特征提出可比较的解释问题:同一个观察者头接入 V1、V2、V4、IT,可以区分低层失真和高层相似性分别需要什么信息。结果提醒质量指标设计者,不应默认对象识别特征对所有恢复任务都最合适。
- 饱和点与峰值必须一起读:Contrast Pyramid 在 NIGHTS 上只需要 7 维就饱和,但峰值仅为 0.703。低维饱和不能单独作为“更接近人类”或“任务本身简单”的证据。
局限与展望¶
- 作者承认均值和协方差共同学习存在尺度不可辨识性:成比例改变位置与噪声尺度可能保持选择概率不变,因此跨三元组比较分布的绝对尺度困难。神经记录或跨内容判断可提供额外约束。
- 高斯分布、平滑协方差、Minkowski 距离及特征池化都是建模假设。行为拟合竞争力支持模型作为分析工具,但不能证明人类视觉系统确实执行这些计算。
- 饱和维数取决于编码器、数据集、扫描范围与 95% 判据,不是通用的脑内维数常数。NIGHTS 的语义判断来自特定生成图像分布,也不代表所有自然场景任务。
- 当前合并建模个体间差异与重复试次噪声,且 BAPPS 验证三元组只有 5 次观察。未来可用更密集的重复测量和个体级模型检验协方差结构是否稳定。
- 附录 Bradley–Terry 对照保留多维嵌入,并同时更换噪声与距离形式,不能视为只删除协方差的纯消融;其跨域 BAPPS → NIGHTS 平均优势为 0.022,说明本文机制并不保证更强泛化。
相关工作与启发¶
- vs LPIPS / DISTS / DreamSim:这些指标主要优化感知预测;本文更关注支持预测的空间维数与噪声结构。它在 BAPPS 主表领先,但 NIGHTS 明显落后于 DreamSim,解释性不能替代性能边界说明。
- vs Bradley–Terry / Thurstone:经典心理测量模型把随机性放到一维质量分数;本文从多维带噪表示和距离决策生成分数分布。附录也明确,加入多维嵌入的 BT 模型原则上同样可以研究维数,不能把这类分析能力说成本文独占。
- vs 频域稀疏表示:DCT 控制保留图像可重建信息,行为投影保留判断所需信息,两者压缩目标不同。后续可在恢复评估中比较更强压缩基线与任务条件化投影,检验低维结论是否仍成立;这是延伸建议,非本文已验证结果。
评分¶
- 新颖性: 4/5 — 将多维分布、视觉层级约束与行为维数诊断结合,目标不只是提高质量指标分数。
- 实验充分度: 4/5 — 包含三类三元组任务、频域控制、投影对照、跨域评估与评分扩展,但缺直接神经验证。
- 写作质量: 4/5 — 机制清楚,主文与附录存在少量数值和概括边界冲突。
- 价值: 4/5 — 为感知质量建模提供可解释工具,对恢复和生成评估有参考意义,但不宜当作普适脑模型。