Layering Virtual Try-On¶
会议: ECCV 2026
论文: CVF Open Access
领域: 语义分割
关键词: 虚拟试穿、多层叠穿、扩散变换器、跨帧数据合成、掩码无关图像编辑
一句话总结¶
针对传统虚拟试穿依赖服装无关掩码导致无法保留内层衣物的难题,本文提出将通用试穿先验与特定叠穿逻辑解耦的两阶段训练范式,通过视频跨帧姿态失配合成与时序反转增强,首次实现了自然保真、支持连续穿脱叠加的掩码无关多层虚拟试穿。
研究背景与动机¶
虚拟试穿技术在电商零售与数字时尚领域展现出巨大潜力,但现有主流方法几乎完全局限于单件衣物的“以旧换新”替换模式。在真实着装场景中,穿搭天然具有层次性与遮挡交互,例如外套下露出衬衫领口或开衫内搭的印花短袖。然而,现有主流试穿框架通常预先使用人体分割掩码擦除模特的原有服装,构建“无衣人像”作为生成条件。这种强行抹除原始衣物的做法彻底破坏了服装上下文与内层结构,使得模型完全丧失了在原有服装之上额外套穿外层衣物的基础信息。此外,VITON-HD 和 DressCode 等基准数据集仅收录单衣替换对,导致模型从未学过多层服装之间的遮挡交互与层级关系。
尽管部分无掩码编辑尝试基于扩散模型直接改写衣物,但在真实世界中采集大规模、多姿态的多层叠穿配对数据成本极其高昂。更棘手的是,真人在逐层添加衣物时不可避免地会出现身体姿态漂移,若直接在有限且姿态不一致的叠穿数据上从头端到端微调,模型将陷入灾难性平衡困境:既要从极少样本中学习复杂的叠穿遮挡逻辑,又要同时拟合非刚性空间变形、衣物纹理与纽扣身份保持,最终导致生成结果虽然保留了内层衣领,但目标外套的纽扣、纹理等关键细节严重失真。
为了打破这一训练僵局,本文提出了关键切入视角:将多层试穿任务显式解耦为互补的两个子能力——一是包含变形、打光与身份保持的“通用试穿先验”,二是包含层级顺序与遮挡推理的“特定叠穿逻辑”。核心 idea:通过基于无结构时尚视频的跨帧修复合成无掩码、姿态失配的训练对,使模型率先攻克非刚性空间变形并建立通用试穿先验,随后在小规模真实叠穿数据上利用时序反转增强高效微调叠穿逻辑,以极高的样本效率实现高保真多层虚拟试穿。
方法详解¶
整体框架¶
整体框架由“通用试穿先验学习”与“特定叠穿知识微调”两个阶段组成。在输入侧,系统接收模特原图 \(I_M\)、待穿目标衣物图 \(I_G\)、目标姿态图 \(I_P\) 以及层级操作文本指令 \(T\)(如 add a jacket 或 remove a sweater),最终生成保留内层细节并精准叠加外层的目标图 \(I_T\)。
核心网络基于 Qwen-Image-Edit 架构构建,由 VAE 图像分词器、Qwen2.5-VL 多模态条件编码器与多模态扩散变换器(MMDiT)组成双流骨干网络,并通过低秩自适应(LoRA)实现高效参数调优。在第一阶段,模型利用时尚视频自动挖掘跨帧姿态失配对,学习掩码无关的复杂变形与纹理迁移先验;在第二阶段,冻结基础结构并在少样本真实叠穿视频片段上注入增删衣物的时序逻辑。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["时尚视频序列<br/>同一着装/姿态变化"] --> B["跨帧姿态失配先验合成<br/>分割+修复生成+异帧配对"]
B --> C["MMDiT 双流主干网络<br/>Qwen2.5-VL 语义流 + VAE 潜空间流"]
D["真实逐层穿搭视频<br/>稳定着装聚类区间"] --> E["时序反转双向增广<br/>穿衣正向加层 ↔ 脱衣反向减层"]
C --> F["两阶段解耦微调策略<br/>先验饱和注入 → 叠穿逻辑适配"]
E --> F
F --> G["多层试穿编辑输出<br/>精准遮挡+内层完整保留"]
关键设计¶
1. 跨帧姿态失配先验合成:以无掩码视频配对突破非刚性变形建模
针对传统单图生成缺乏姿态变化以及掩码抹去上下文的痛点,该设计从海量单人时尚视频中提取同一套着装在不同时间步的视频帧。先利用视频分割模型 SAM 2 提取原始衣物区域与掩码,结合姿态估计与图文描述生成工具,使用前沿图像修复模型将原视频帧 \(F_i\) 中的衣物擦除并替换为全新的合成衣物,生成中间编辑帧 \(F_i'\)。关键机制在于,模型并不将 \((F_i', F_i)\) 作为静态训练对,而是从同序列中跨时间步采样存在明显姿态偏移的真实后继帧 \(F_j\)(满足 \(i \neq j\)),构成五元组训练对: $\((I_M, I_G, I_P, T, I_T) := (F_i', G_j, P_j, T_j, F_j)\)$ 这种设计迫使模型在完全不依赖人工涂抹掩码的前提下,根据目标姿态 \(P_j\) 与文字指导 \(T_j\),学会将平铺或单帧衣物 \(G_j\) 自主变形并贴合至变姿态的人体躯干上。这彻底规避了模型在静态重合像素间走捷径记忆对齐的弊端,奠定了兼具光影一致性与复杂形变鲁棒性的通用试穿底座。
2. 时序反转双向增广:对称挖掘穿衣与脱衣的逆物理过程
针对多层叠穿真实数据极端匮乏且标注成本极高的问题,本文构建了一个由 60 段连续着装视频组成的基准集,并通过时序反转解决数据偏置。视频被根据稳定着装配置划分为若干离散的时间簇序列 \(\{C_1, C_2, \dots, C_K\}\),利用多模态大语言模型自动生成簇间状态转移文本 \(T_{m \to m+1}\)(例如从内搭短袖状态转移至套上毛衣)。正向数据三元组为从前一簇抽取的源帧 \(F_i \in C_m\) 与后一簇的目标帧 \(F_j \in C_{m+1}\),描述为 add <garment>。
其核心巧妙之处在于逆向物理观察:穿衣过程在时间轴上倒放即等价于自然的脱衣过程。系统据此对称构造反向反事实样本 \((F_j, G_i, P_i, T_{m+1 \to m}, F_i)\),自动将文本倒置为 remove <garment>。该策略不仅使得昂贵的真实叠穿视频训练集规模无损翻倍,而且赋予了扩散模型统一理解“添加外层并遮挡内层”与“移除外层并重新显露内层”的可逆几何推理能力。
3. 双流 MMDiT 适配器微调:高保真解耦调控
为了在高保真编辑与严格指令遵循之间取得最优权衡,模型采用 Qwen-Image-Edit 作为基础架构。Qwen2.5-VL 负责编码细粒度提示词 \(T\) 与待穿衣物的全局高维语义特征,而连续三组 VAE 编码器分别提取带噪人像潜变量、目标服装的高频纹理潜变量以及目标骨架姿态潜变量。在 MMDiT 主干中,两路信息流在自注意力与交叉注意力层深度交互,利用 LoRA 低秩矩阵更新注意力投影权重。通过两阶段分步优化策略,第一阶段在大规模跨帧合成数据上沉淀空间映射能力,第二阶段固定所有预处理接口并仅在叠穿流上适配微调,在保持模型原生复杂背景与人脸身份恒定性的同时,精准限定修改区域仅作用于指定的服装增删边界。
实验关键数据¶
主实验¶
在作者构建的专用多层试穿评测基准 LVTON(包含 532 对真实测试图像对)上,本文方法与前沿代表性掩码无关试穿模型及工业级多模态图像生成/编辑大模型进行了严格定量对比。
Table 1: Quantitative comparisons on our LVTON dataset (ECCV 2026 Table 1) | 模型 | SSIM ↑ | LPIPS ↓ | FID ↓ | KID×10³ ↓ | | :--- | :---: | :---: | :---: | :---: | | OmniTry [16] | 0.810 | 0.176 | 54.585 | 3.165 | | Any2AnyTryon [19] | 0.787 | 0.229 | 89.567 | 18.645 | | Nano Banana [11] | 0.798 | 0.195 | 49.179 | 2.362 | | HunyuanImage-3.0-Instruct [6] | 0.767 | 0.246 | 88.070 | 15.561 | | Ours | 0.843 | 0.127 | 48.957 | 1.463 |
注:由于 LVTON 测试集规模较小(532 张),全模型 FID 绝对数值整体呈现统计性偏高。
Table 2: Traditional VTON Benchmarks (VITON-HD & DressCode, ECCV 2026 Table 2 部分摘录) | 模型类型 / 模型 | VITON-HD SSIM ↑ | VITON-HD LPIPS ↓ | VITON-HD FID ↓ | DressCode SSIM ↑ | DressCode LPIPS ↓ | DressCode FID ↓ | | :--- | :---: | :---: | :---: | :---: | :---: | :---: | | IDM-VTON [9] (Cloth-Agnostic) | 0.870 | 0.102 | 6.290 | 0.920 | 0.062 | 8.640 | | FitDit [25] (Cloth-Agnostic) | 0.899 | 0.066 | 4.731 | 0.926 | 0.043 | 2.638 | | CATVTON [10] (Mask-Free) | 0.870 | 0.057 | 5.425 | 0.892 | 0.046 | 3.992 | | OmniTry [16] (Mask-Free) | 0.698 | 0.368 | 57.871 | 0.842 | 0.188 | 25.364 | | Stage 1-only (Zero-Shot) | 0.887 | 0.086 | 5.235 | 0.898 | 0.101 | 4.710 | | Ours (Full Fine-tuned) | 0.928 | 0.055 | 3.235 | 0.948 | 0.042 | 2.598 |
消融实验¶
消融实验聚焦于两阶段解耦训练范式的不可或缺性以及时序反转数据增强的贡献验证。
Table 4: Ablation study on training components on LVTON dataset (ECCV 2026 Table 4) | 配置 | SSIM ↑ | LPIPS ↓ | FID ↓ | KID×10³ ↓ | 说明 | | :--- | :---: | :---: | :---: | :---: | :--- | | Stage 2-only | 0.817 | 0.192 | 58.561 | 13.242 | 仅用真实叠穿数据从头训练,缺乏基础变形先验导致剧烈崩塌 | | Stage 1-only | 0.821 | 0.183 | 56.663 | 12.286 | 仅在跨帧合成数据上训练,缺乏叠穿逻辑,直接应用于叠穿任务受阻 | | Ours w/o Aug | 0.832 | 0.131 | 49.353 | 3.003 | 移除时序反转增强,数据量减半,各项指标明显掉点 | | Ours (完整模型) | 0.843 | 0.127 | 48.957 | 1.463 | 两阶段解耦结合时序增强,达到最优表现 |
关键发现¶
- 直接单阶段训练的灾难性瓶颈:Stage 2-only 的 KID 指标恶化至 13.242(是完整模型的 9 倍以上),表明在小样本且伴随姿态位移的数据上直接微调,模型无法兼顾高保真细节与非刚性形变,证明了将通用变形先验与叠穿逻辑解耦的必要性。
- 跨帧先验的强大零样本迁移力:仅经历 Stage 1 预训练的模型在 VITON-HD 上实现零样本 FID 5.235,甚至显著优于经过全量监督训练的 IDM-VTON(6.290),有力佐证了跨帧姿态失配合成策略在捕捉空间物理变形规律上的卓越通用性。
- 合成数据规模的边际效应:阶段 1 合成数据量与阶段 2 真实数据量的比例实验显示,当数据比例达到 4.0× 时模型性能逼近饱和点,证明在构建通用先验时无须无限制盲目扩增合成噪声数据。
亮点与洞察¶
- 任务视角的范式破局:敏锐指出了传统试穿技术长期以来对掩码(cloth-agnostic)的路径依赖所造成的致命缺陷,首次将真实世界高频存在的穿脱叠穿(LVTON)确立为独立课题,为数字化时尚落地奠定了新基石。
- 跨时序异帧配对构造法:巧妙利用时尚单品展示视频中模特姿态自然变换但服装一致的物理特性,通过 \(i \neq j\) 强制构造姿态错位样本对,低成本且高效率地教会了扩散变换器处理非刚性空间流形变换。
- 时序反转的几何对称直觉:洞察到着装与褪衣在时空维度上的逆操作对称性,以纯规则反转提示词和帧序列顺序,在零标注额外成本的前提下同时解决了外层穿戴遮挡与内层移除重现的双向生成难题。
局限与展望¶
- 上游生成质量的误差累积:阶段 1 伪真实训练对的质量严重依赖于 SAM 2 视频分割掩码的精细度以及通用的图像修复模型。若修复背景出现伪影或边缘融化,扩散先验将被动吸收此类系统性噪声。
- 长尾复杂形变的分布局限:尽管在野外真实场景中泛化表现优秀,但受限于 Stage 2 真实叠穿视频的类型范围(60 段视频),对于厚重羽绒服紧裹修身毛衣、宽大风衣多层领结等极端复杂物理形变交互,仍存在一定的几何失真。
- 动力学细节模拟的简化缺失:基于时间反转的数据增强在物理上是准对称而非严格对称的,无法捕捉到真实脱衣过程中内层织物被带动拉扯的拉伸褶皱或发型因穿脱受到的扰动,未来需引入微观物理交互约束。
相关工作与启发¶
- vs OmniTry [16] & Any2AnyTryon [19]:这两者虽然尝试摆脱掩码以实现全图试穿,但训练数据仍局限于单件替换场景,在遇到叠加指令时倾向于将原有所有服装全部抹去覆盖;本文通过显式建模两阶段叠穿先验,完好保留了非目标衣物的内部视觉完整性。
- vs IDM-VTON [9] & FitDit [25]:经典 SOTA 方法重度依赖精细的姿态估计与身体部位遮罩(Cloth-Agnostic),本质上无法进行开衫露出内搭等半遮挡操作;本文的两阶段框架不仅彻底摆脱对人体部位修剪掩码的束缚,且在传统单衣替换基准上同样刷新了 SOTA。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统定义多层虚拟试穿任务,解耦通用形变先验与叠穿逻辑的设计极富启发性。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖自建 LVTON 基准、主观盲测、传统 VITON-HD/DressCode 跨域评测及深入消融,论据扎实。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑推进严谨通畅,图例清晰生动,动机构建与方案呈现高度自洽。
- 价值: ⭐⭐⭐⭐⭐ 突破了十余年来虚拟试穿领域仅能做单衣替换的技术围墙,对智能穿搭与服饰渲染具有极高工业落地价值。