跳转至

Reference-Free Quality Assessment for Virtual Try-On via Human Feedback

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/litelightlite/VTON-IQA
领域: 人体理解
关键词: 虚拟试穿、无参考质量评估、人类反馈、跨图像注意力、基准测试

一句话总结

针对真实电商试穿缺乏参考图且传统指标与人类审美脱节的难题,论文构建了包含 6.2 万张试穿图和 43 万条众包标注的最大虚拟试穿质量评估基准 VTON-QBench,并提出基于非对称交错交叉注意力(ICA)的无参考评估模型 VTON-IQA,实现了高度契合人类主观判定的试穿质量量化评测。

研究背景与动机

在时尚电商场景中,图像级虚拟试穿(Virtual Try-On, VTON)通过将指定服装无缝迁移至目标人物身上,显著提升了在线选购体验。然而,虚拟试穿系统在真实工业界落地时面临着根本性的评测瓶颈:真实部署环境下根本不存在同一模特穿着目标服装的真实参考图(Ground Truth)。这导致依赖成对真值图的全参考指标(如 SSIM、LPIPS)完全无法直接应用;而数据集级别的分布散度指标(如 FID、KID)虽然能在宏观层面反映域分布相似性,却无法衡量单张生成图像的感知质量与瑕疵。尽管人工主观评测被视为黄金标准,但其高昂的成本、冗长的周期与不可复现性限制了其实时部署与算法快速迭代。

现有的无参考试穿评测尝试(如基于 MLLM 生成文本评语或通用美学打分)缺乏针对试穿任务的大规模人类主观对齐验证,且缺乏开源实现与标准化基准。更关键的是,虚拟试穿的图像评估与传统单图画质评估(IQA)存在本质差异:试穿结果不仅要求图像自身逼真无伪影,还必须严格保证服装属性(领型、纹理、版型)的高保真迁移,以及非目标区域(模特面部身份、发型、肤色、肢体姿态与背景)的严格一致性。现有指标在面临视角微调或合理姿态自适应时极易产生严重误判。

本文的切入角度是打破对真值图的依赖,从大规模人类反馈中学习多图交叉关系的主观评价分布。核心 idea:构建经过严密一致性筛选的大规模人类反馈基准 VTON-QBench,并设计融合服装保真度与人物非目标区域一致性的非对称交错交叉注意力模型 VTON-IQA,在无需真实参考图的前提下实现对单张试穿结果的端到端拟合与排序。

方法详解

整体框架

VTON-IQA 的核心输入包含三幅图像:平铺服装图像 \(I_G\)、原始人物图像 \(I_P\) 以及由任意虚拟试穿模型生成的待评测图像 \(I_V\)。模型基于三分支 Vision Transformer 骨干(DINOv3 ViT-L/16)进行分层特征编码。网络的前半部分采用独立的自注意力层分别提取三者的基础视觉表征;后半部分引入核心模块交错交叉注意力(Interleaved Cross-Attention, ICA),显式建立试穿图分别与服装图、人物图的双向交互,随后提取三路最终的 [CLS] 全局 token,通过服装保真度与人体保持度的自适应加权余弦相似度计算,最终通过仿射变换与双曲正切函数输出 \([-1, 1]\) 范围内的标量连续质量评分。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["三路输入图像<br/>平铺服装 IG / 原始人物 IP / 生成试穿图 IV"] --> S1["浅层特征提取<br/>DINOv3 前 L/2 层独立自注意力"]
    S1 --> S2["交错交叉注意力 ICA<br/>深层 L/2 层非对称建模 V↔G 与 V↔P"]
    S2 --> S3["双路关系评分聚合<br/>服装保真度与人体保持度余弦加权"]
    S3 --> S4["联合对齐优化<br/>成对偏好交叉熵 + 主观分数连续回归"]
    S4 --> Out["输出人类对齐连续质量分 s ∈ [-1, 1]"]

关键设计

1. VTON-QBench 基准构建与严密众包数据清洗 为给质量评测模型提供可靠且具有代表性的主观监督信号,研究团队构建了涵盖 14 个主流 VTON 模型(涵盖传统 GAN、U-Net 扩散模型、DiT 架构及商业闭源大模型)生成的 62,688 张试穿图像,并覆盖了基于 FLUX.1-dev 与 LoRA 扩充的 24 种服装风格多样化假三元组数据。面对众包评测中固有的注意力涣散与噪声偏置问题,设计了两阶段清洗流程:首先在每位标注员分配的 50 道题目中嵌入 5 个答案确定的锚点测试题,并剔除雷同选项超过 80% 或与群体多数意见偏离超过 60% 的作答者;随后对问卷计算有序等级的 Krippendorff's \(\alpha\) 一致性系数,硬性过滤掉 \(\alpha \le 0.4\) 的低一致性问卷。该清洗流程将整体 Krippendorff's \(\alpha\) 均值从 0.286 大幅提振至 0.550,保留了来自 13,838 位合格标注者的 431,800 条高置信度主观标签。

2. 非对称交错交叉注意力(ICA) 传统多分支特征交互多采用全对称的全连接交叉注意力,但这忽略了试穿评估以生成图 \(I_V\) 为绝对核心的任务特性。ICA 模块在深层 Transformer 块中将双向交叉注意力仅约束在 \((V, G)\) 与 \((V, P)\) 两对模态之间,阻断了对评分无直接指导意义的 \(G \leftrightarrow P\) 耦合。在深层第 \(\ell\) 层中,生成图特征分支汇聚来自服装与人物特征的双向补充信息: $\(\widehat{X}_V^{(\ell)} = \widetilde{X}_V^{(\ell)} + C_{V\leftarrow G}^{(\ell)} + C_{V\leftarrow P}^{(\ell)}\)$ 而服装与人物分支仅单向融入生成图特征更新,即 \(\widehat{X}_G^{(\ell)} = \widetilde{X}_G^{(\ell)} + C_{G\leftarrow V}^{(\ell)}\) 和 \(\widehat{X}_P^{(\ell)} = \widetilde{X}_P^{(\ell)} + C_{P\leftarrow V}^{(\ell)}\)。该非对称拓扑既大幅削减了不必要的交互冗余,又强制注意力权重专注于服装迁移误差(如领型篡改、花纹变形)与人体非目标区域畸变(如手部扭曲、面容失真、背景污染)。

3. 双路关系评分聚合与有界映射 在网络最终层,提取服装、人物与试穿图像对应的全局 token \(c_G, c_P, c_V \in \mathbb{R}^d\)。模型将试穿质量显式解耦为两项正交的感知维度——服装外观一致性与主体非目标元素保持度,通过可学习标量参数 \(\alpha \in [0, 1]\) 动态调节两者的重要性权重: $\(\tilde{s} = \alpha \frac{c_G^\top c_V}{\|c_G\|\|c_V\|} + (1-\alpha) \frac{c_P^\top c_V}{\|c_P\|\|c_V\|}\)$ 随后,通过可学习仿射参数 \(a, b\) 与双曲正切函数 \(\tanh\) 将中间相关度映射至规范化的有界区间: $\(\hat{s} = \tanh(a\tilde{s} + b)\)$ 该设计不仅约束了预测范围、抑制极端离群预测,还具备高度可解释性,直观揭示了人类在权衡“衣服像不像”与“人保没保留好”时的感知偏好。

损失函数 / 训练策略

考虑到绝对打分存在个体间的主观漂移,而同一人物-服装对下不同生成结果的相对优劣排序具有更强的跨人一致性,模型采用成对偏好概率建模与绝对分数回归相结合的双目标损失函数。对于同一服装-模特对 \((I_G, I_P)\) 生成的两个不同试穿结果 \(I_{V_i}\) 与 \(I_{V_j}\),基于 Bradley-Terry 模型构建预测偏好概率 \(p_\theta\) 与经验主观偏好概率 \(q_{ij}\): $\(p_\theta(I_{V_i} \succ I_{V_j} \mid I_G, I_P) = \sigma\left(\frac{\Psi_\theta(I_{V_i}) - \Psi_\theta(I_{V_j})}{\tau}\right), \quad q_{ij} = \sigma\left(\frac{S_i - S_j}{\tau}\right)\)$ 总损失函数由软标签交叉熵与均方误差回归项线性加权: $\(\mathcal{L}_\theta = - \sum_{(i, j)} \left[ q_{ij} \log p_\theta + (1 - q_{ij}) \log(1 - p_\theta) \right] + \lambda \sum_{k} \|\Psi_\theta(I_{V_k}) - S_k\|^2\)$ 训练基于冻结前 12 层、微调后 12 层及插入层参数的策略,在单张 NVIDIA A100 GPU 上采用 AdamW 与 bfloat16 混合精度完成快速高效收敛。

实验关键数据

主实验

在 VTON-QBench 划分的独立测试集(13,038 个样本,服装与人物 ID 均与训练集完全不重叠)上,将 VTON-IQA 与全参考图像质量指标及零样本 DINOv3 进行主观相关性评测。由于 SSIM、LPIPS 和未微调 DINOv3 的分数尺度与人类主观打分范围不一致,无法计算线性皮尔逊相关系数(PLCC)与拟合优度(\(R^2\)),因此主要对比斯皮尔曼等级相关系数(SRCC)以及宏/微观成对排序准确率(\(A_{\text{macro}}, A_{\text{micro}}\))。

评测方法 参考图需求 任务微调 \(\rho_{\text{SRCC}} \uparrow\) \(\rho_{\text{PLCC}} \uparrow\) \(R^2 \uparrow\) \(A_{\text{macro}} \uparrow\) \(A_{\text{micro}} \uparrow\)
SSIM 需要真值 否 0.150 — — 0.596 0.593
LPIPS (取负) 需要真值 否 0.406 — — 0.701 0.695
DINOv3 (零样本) 无需参考 否 0.244 — — 0.637 0.641
VTON-IQA (无 ICA) 无需参考 是 0.617 0.615 0.372 0.722 0.747
VTON-IQA (本文完整版) 无需参考 是 0.750 0.751 0.553 0.781 0.790

此外,在对人类内部一致性评估的基准对照中(将测试集标注员随机对半拆分并互测),人类评测者之间的上限指标为:\(\rho_{\text{SRCC}} = 0.760 \pm 0.004\)、\(\rho_{\text{PLCC}} = 0.762 \pm 0.004\)、\(A_{\text{macro}} = 0.782 \pm 0.002\)、\(A_{\text{micro}} = 0.791 \pm 0.002\)。VTON-IQA 在成对偏好准确率上达到了 \(A_{\text{macro}} = 0.771 \pm 0.003\) 和 \(A_{\text{micro}} = 0.783 \pm 0.002\),已逼近人类专家内部的一致性上限。

消融实验

为验证交错交叉注意力(ICA)对细粒度语义交叉与关系建模的有效性,对比了去除 ICA 交互模块(退化为独立提取特征后直接计算余弦相似度)的系统性能表现:

配置 \(\rho_{\text{SRCC}} \uparrow\) \(\rho_{\text{PLCC}} \uparrow\) \(R^2 \uparrow\) \(A_{\text{micro}} \uparrow\) 说明
VTON-IQA 完整模型 0.750 0.751 0.553 0.790 完整非对称跨图像关系建模
去除 ICA 交互模块 0.617 0.615 0.372 0.747 仅独立提取特征,拟合度 \(R^2\) 骤降 32.7%
零样本 DINOv3 基准 0.244 — — 0.641 未在 VTON-QBench 进行人类偏好微调

在 VITON-HD 与 Dress Code 基准上评估 14 个主流 VTON 模型的整体表现,展现了 VTON-IQA 与传统指标的对比:

模型分类 代表模型 VITON-HD 成对 Ours \(\uparrow\) VITON-HD 非成对 Ours \(\uparrow\) VITON-HD FID \(\downarrow\) VITON-HD SSIM \(\uparrow\)
商业闭源模型 Nano Banana Pro 0.303 0.315 3.318 0.904
商业闭源模型 GPT-Image-1.5 0.255 0.234 9.613 0.768
DiT 架构模型 FitDit 0.230 0.189 8.048 0.843
DiT 架构模型 CatVTON-FLUX 0.207 -0.025 5.470 0.872
U-Net 架构模型 IDM-VTON 0.151 0.039 6.007 0.865
U-Net 架构模型 CatVTON -0.163 -0.266 9.082 0.833
传统 GAN 模型 SD-VITON -0.368 -0.479 7.746 0.886
传统 GAN 模型 VITON-HD -0.512 -0.559 9.450 0.877

关键发现

  • ICA 交互机制是跨模态保真度判断的决定性支柱:消融表明,缺少 ICA 交互时,\(R^2\) 从 0.553 暴跌至 0.372,\(\rho_{\text{SRCC}}\) 降低 0.133。单纯的全局语义池化无法察觉细微的局部服饰形变与边缘伪影,必须依靠深层 patch 级双向注意力匹配。
  • 全参考指标(SSIM / LPIPS)存在严重的全局畸变惩罚偏差:在质性评估中,当新型模型根据人体姿态或构图轻微调整镜头缩放或自然姿态时,SSIM 和 LPIPS 会因为像素未精确对齐而给予极低评价(如 GPT-Image-1.5 在 VITON-HD 上 SSIM 仅 0.768,甚至低于早期 GAN),而 VTON-IQA 则能不受全局刚性位移干扰,准确捕捉生成画质的真实优劣。
  • 商业闭源大模型综合表现占优,但开源 DiT 架构迅速追赶:Nano Banana Pro 与 GPT-Image-1.5 在各基准上均稳居前列;开源模型中 FitDit 与 CatVTON-FLUX 显著优于传统 U-Net 与 GAN 模型,展现了扩散 Transformer 架构在大范围依赖建模上的优势。

亮点与洞察

  • 严密去噪的数据质量工程驱动高上限模型:论文没有盲目堆砌未清洗的众包数据,而是通过锚点题、一致性率与 Krippendorff's \(\alpha\) 过滤掉超过 60% 的噪声标注,使得平均一致性提升近一倍。这揭示出主观评价学习任务中,“标注一致性治理”远比“单纯扩大标注规模”更能决定模型性能上限。
  • 非对称跨图像注意力精准对应任务物理先验:将注意力计算约束在试穿图对服装图、试穿图对人物图的双向路径上,刻意剔除平铺服装与原始人像之间的无意义耦合,既保证了计算轻量化,又让网络表征天然贴合“保服装、保非换装人体”的双重任务准则。
  • 具备极强的算法审计与自动化评测迁移价值:该无参考打分机制不仅可作为各大顶会学术打榜的标准化评价套件(替代昂贵易作弊的用户调研),还可直接转化为强化学习中用于对齐人类审美的奖励模型(Reward Model),引导生成扩散模型反向迭代。

局限与展望

  • 作者承认的局限:数据主要覆盖单人正向站立或轻度倾斜的典型电商商品图展示视角,在多人复杂互动场景、剧烈大幅度运动及极端遮挡环境下的泛化鲁棒性尚未充分检验。
  • 设计与实践局限:评分机制将最终预测高度简化为全局 [CLS] 的加权余弦相似度,尽管增加了物理可解释性,但对于极小尺度的局部瑕疵(如衬衫纽扣脱落、极微小商标拼写漂移)的捕获灵敏度仍可能被全局背景稀释。
  • 改进与延伸思考:未来可探索多尺度或基于分割掩码的局部补丁级质量反思机制;同时可将 VTON-IQA 作为即插即用的判别头集成进 Diffusion 采样迭代步中,进行测试时引导(Test-time guidance)。

相关工作与启发

  • vs VTONQA (Wei et al., 2026):VTONQA 仅采集了约 8,000 张图像和 40 位标注者且未完全开源;本文构建的 VTON-QBench 规模扩充至 6.2 万张图像、43 万条标注和 1.3 万余名合格标注者,且全程开源,具备更可靠的统计学显著性与复现性。
  • vs VTON-VLLM (Wan et al., 2025):VTON-VLLM 侧重于利用多模态大语言模型生成可解释的定性语言批评;而本文 VTON-IQA 专注于输出精确、低延时、可微分的数值连续质量得分,更适合作为自动化排位打榜与 RL 训练奖励。
  • vs SSIM / LPIPS:传统指标强依赖成对参考真值图,且对平移、视角缩放极其敏感;VTON-IQA 摆脱参考图依赖,且对非刚性合理形变具备人类级别的宽容度。

评分

  • 新颖性: ⭐⭐⭐⭐ [针对真实落地中试穿无真值难题,提出非对称交错注意力与全套主观对齐框架]
  • 实验充分度: ⭐⭐⭐⭐⭐ [6.2 万图像、43 万清洗标注、14 种主流模型跨基准系统横评,人机一致性验证严谨]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,从数据治理、模型拓扑到实验分析环环相扣,图表详实]
  • 价值: ⭐⭐⭐⭐⭐ [彻底解决虚拟试穿领域缺乏可靠无参考评测基准的行业痛点,代码与数据完全开源,社区价值极大]