Unpaired Geometry-Guided Sim2Real Translation for Autonomous Driving¶
会议: ECCV 2026
论文: ECCV 2026
领域: 自动驾驶
关键词: Sim2Real / 扩散模型 / 自动驾驶 / 几何引导 / 无配对图像迁移
一句话总结¶
针对自动驾驶仿真图像向真实世界迁移中配对几何监督缺失及多条件控制开销巨大的难题,提出 CDCT 框架,通过跨域分数合成将合成域几何差分注入真实域外观先验,并设计轻量级多条件适配器 LMCA,实现高保真无配对真实感纹理生成并大幅提升下游感知性能。
研究背景与动机¶
自动驾驶仿真平台能够以低成本提供具备完备三维真值的海量驾驶场景,并在极端长尾工况的鲁棒性测试中发挥着不可替代的作用。然而,仿真器渲染引擎与物理世界相机成像机制之间存在着显著的 Sim2Real 域间差距。这一差距通常解耦为场景拓扑与目标分布层面的内容差距(Content Gap),以及底层纹理分布、光照漫反射与材质属性层面的外观差距(Appearance Gap)。现代高精度感知网络对低层视觉统计特征极度敏感,导致在纯合成数据上训练的模型直接部署到真实世界时性能出现断崖式下跌。
借助扩散模型强大的真实分布建模能力缩小外观差距已成为极具潜力的路径,但在实际自动驾驶落地中面临两大核心困境。其一是无配对几何引导的先验错配困境:在动态开放的驾驶场景中,真实图像与其精确像素对齐的几何真值(如 G-buffers)无法同步获取,而直接在合成域训练的几何控制器切换至真实域推理时会遭遇灾难性的域偏移。其二是多模态几何条件注入的计算冗余困境:自动驾驶场景依赖法线、深度、语义和材质等多重空间几何约束,若按照常规 ControlNet 范式堆叠多路分支,模型参数量与显存开销将呈爆炸式增长。
面对上述挑战,单纯依赖概率流 ODE 反转或循环一致性约束的方法难以维持精细空间拓扑,而强制控制网络跨域泛化又极易破坏真实外观分布。本文切入角度在于:几何结构本身作为场景客观物理属性具有域无关性,合成域完全能够提供精确的几何差分梯度,无需迫使控制器去拟合未知的真实几何条件分布。核心 idea:将 Sim2Real 几何控制解耦为真实域外观引导与合成域几何修正,提出跨域分数合成机制从合成域得分差分中提炼域无关几何项并注入真实域外观先验,配合单路轻量级多条件适配器 LMCA 实现零配对监督下的高保真几何保真迁移。
方法详解¶
整体框架¶
CDCT 整体采用三阶段流水线,基于多模态扩散 Transformer(MM-DiT,以 Stable Diffusion 3 为基座)与 Rectified Flow 速度预测目标构建。阶段一在无配对真实图像与合成图像上联合微调基座,学习带有离散域指示符的外观先验;阶段二冻结基座,在带几何真值的合成域上训练多条件几何控制网络;阶段三在推理采样时,通过跨域分数合成机制将合成域预测的几何导向更新项实时融合进真实域外观生成流中。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
InSynth["输入:合成图像与多模态 G-buffers<br/>(BaseColor, Depth, Normal, Seg, Material)"] --> LMCA["轻量级多条件适配器 LMCA<br/>LoRA 键值投影 + Zero Linear 门控调节"]
LMCA --> Stage2["合成域条件分支<br/>预测速度 v_theta(x_t, t, d_synth, g)"]
InPrior["输入:真实域与合成域外观条件<br/>(d_real / d_synth)"] --> UnifiedBB["统一 MM-DiT 基座模型<br/>域嵌入映射解耦外观先验"]
UnifiedBB --> Stage1Real["真实域无条件分支<br/>预测速度 v_theta(x_t, t, d_real)"]
UnifiedBB --> Stage1Synth["合成域无条件分支<br/>预测速度 v_theta(x_t, t, d_synth)"]
Stage2 --> ScoreComp["跨域分数合成<br/>提取合成域纯几何差分并注入真实域速度"]
Stage1Real --> ScoreComp
Stage1Synth --> ScoreComp
ScoreComp --> OutReal["输出:高保真真实域迁移图像<br/>严格保持合成布局,下游感知性能大幅提升"]
关键设计¶
1. 统一域特异性外观先验学习:解耦无几何约束的边缘分布 为使单一生模网络兼具拟合真实街景低层统计特征与合成域表征的能力,阶段一构建了基于离散域标记的条件引导空间。将域指示符 \(d \in \{d_{\text{real}}, d_{\text{synth}}\}\) 通过可学习轻量线性投影层映射为连续向量并广播注入 MM-DiT 的各注意力模块中。在 Rectified Flow 框架下,模型联合优化无配对合成数据与真实街景的速度预测目标 \(v_\theta(z_t, t, d)\),使其能够在单一权重中分别收敛至两域的边缘数据分布 \(p(x \mid d_{\text{real}})\) 与 \(p(x \mid d_{\text{synth}})\)。该设计避免了为两个域维护多套冗余模型,同时确保在冻结主干后,仅通过域指示符即可独立激发高保真的真实感街景纹理先验。
2. 跨域分数合成:利用合成域梯度差分实现无配对几何注入 在缺乏真实图像配对 G-buffers 的前提下,直接将合成几何特征强行输入真实域分支会引发严重的特征域漂移。针对这一核心矛盾,本文建立条件独立性假设:在给定生成图像 \(x\) 的条件下,其所属域标记 \(d\) 与底层几何结构 \(g\) 条件独立,即 \(p(d, g \mid x) = p(d \mid x) p(g \mid x)\)。根据贝叶斯法则,真实域条件得分可严格展开为真实域边缘得分与纯几何引导得分之和: $\(\nabla_x \log p(x \mid d_{\text{real}}, g) = \nabla_x \log p(x \mid d_{\text{real}}) + \nabla_x \log p(g \mid x)\)$ 由于纯几何梯度 \(\nabla_x \log p(g \mid x)\) 与域标记无关,可在有配对标注的合成域通过条件得分与无条件得分的差分直接估计,即 \(\nabla_x \log p(g \mid x) \approx \nabla_x \log p(x \mid d_{\text{synth}}, g) - \nabla_x \log p(x \mid d_{\text{synth}})\)。在采样推理过程中,将其转化为 Rectified Flow 的速度合成表达式: $\(\tilde{v}(x_t, t) = v_\theta(x_t, t, d_{\text{real}}) + \lambda \left[ v_\theta(x_t, t, d_{\text{synth}}, g) - v_\theta(x_t, t, d_{\text{synth}}) \right]\)$ 其中超参数 \(\lambda\) 精确调控几何引导强度。该机制巧妙地利用无条件真实分支锚定照片级外观逼真度,同时利用合成域的内外差分剥离掉合成纹理偏置,仅萃取出场景布局约束,从理论上彻底摆脱了真实配对几何监督的依赖。
3. 轻量级多条件适配器 LMCA:线性扩展的注意力层级条件融合 自动驾驶场景仅靠单一深度图或语义图不足以约束细粒度反光与物体边界,必须同时引入法线图、深度图、语义分割、基础反照率(BaseColor)以及材质缓冲(Material)。若采用传统 ControlNet 式复制编码器分支,参数量将随条件数呈倍数急剧膨胀;而直接将条件 token 与图像 token 串联计算全局自注意力,计算复杂度会随条件数呈二次方 \(O(N^2)\) 激增。LMCA 创新性地在 MM-DiT 冻结的自注意力投影层上挂载条件特定的 LoRA 旁路。对于第 \(i\) 种几何条件 \(g^i\),其生成键值矩阵定义为: $\(K_g^i = (W_K + \Delta W_K^i) g^i, \quad V_g^i = (W_V + \Delta W_V^i) g^i\)$ 为防止初始训练阶段引入扰动并自适应分配模态权重,引入零初始化线性层 \(\alpha^i = \text{ZeroLinear}(g^i)\),仅对值向量执行门控缩放 \(V_g^i \leftarrow \alpha^i \cdot V_g^i\),而键向量 \(K_g^i\) 保持未经缩放以完整保留几何拓扑路由信息。在注意力计算时,图像查询 \(Q_{\text{x\&t}}\) 统一联合检索原文本-噪声键与各模态条件键 \([K_{\text{x\&t}}, K_g^1, \dots, K_g^N]\),实现复杂度随条件数 \(O(N)\) 严格线性扩展,每个几何条件仅额外增加 2.8% 的极小参数量。
损失函数 / 训练策略¶
模型基于 Rectified Flow 速度匹配目标进行多阶段渐进训练: - 阶段一采用 \(1 \times 10^{-5}\) 学习率微调 MM-DiT 全参数,对合成域与真实域无配对图像做平衡批次采样,优化流匹配速度误差; - 阶段二完全冻结阶段一基座,使用 \(1 \times 10^{-4}\) 学习率仅训练各条件 LoRA 分支(默认 rank=4)及零初始化线性层,域指示符固定为 \(d_{\text{synth}}\); - 推理阶段采用 25 步欧拉数值求解器,几何引导系数设为 \(\lambda = 6\)。
实验关键数据¶
主实验¶
在 CARLA 模拟器生成数据向 Cityscapes 真实街景迁移基准上,CDCT 在控制保真度、生成质量与跨域分布相似度三个维度全面超越对比方法。
| 方法 | 可控性 SSIM ↑ | 可控性 LPIPS ↓ | 生成质量 NIQE ↓ | 生成质量 MANIQA ↑ | 域相似度 FID ↓ | 域相似度 KID (\(\times 10^3\)) ↓ |
|---|---|---|---|---|---|---|
| EPE (PAMI 2022) | 0.82 | 0.26 | 4.19 | 0.32 | 34.78 | 25.23 |
| VSAIT (ECCV 2022) | 0.89 | 0.18 | 3.26 | 0.41 | 29.45 | 27.67 |
| HIE (arXiv 2023) | 0.84 | 0.26 | 4.87 | 0.33 | 32.76 | 42.05 |
| UNSB (ICLR 2024) | 0.73 | 0.34 | 5.44 | 0.37 | 41.62 | 39.46 |
| CACTIF (CVIU 2025) | 0.69 | 0.39 | 6.63 | 0.31 | 50.91 | 36.06 |
| CDCT (本文) | 0.85 | 0.17 | 3.21 | 0.44 | 26.45 | 22.17 |
在下游感知任务的跨域零样本迁移评测中,使用迁移后数据训练感知模型(分割 Mask2Former、目标检测 YOLOv8、单目深度 NeWCRFs)并在 Cityscapes 真实验证集上评测:
| 训练数据源 | 语义分割 mIoU ↑ | 目标检测 mAP50 ↑ | 深度估计 AbsRel ↓ | 深度估计 SILog ↓ | 深度估计 \(\delta < 1.25\) ↑ |
|---|---|---|---|---|---|
| 原始 CARLA | 14.6 | 20.2 | 0.56 | 44.18 | 0.29 |
| EPE | 36.9 | 33.9 | 0.20 | 25.04 | 0.73 |
| VSAIT | 33.8 | 35.7 | 0.19 | 21.15 | 0.78 |
| HIE | 30.5 | 31.8 | 0.21 | 28.93 | 0.68 |
| UNSB | 26.4 | 28.6 | 0.25 | 39.11 | 0.51 |
| CACTIF | 32.1 | 31.7 | 0.23 | 18.06 | 0.60 |
| CDCT (本文) | 48.3 | 40.5 | 0.16 | 19.24 | 0.81 |
| Cityscapes 真实上限 | 65.2 | 48.8 | 0.11 | 14.92 | 0.87 |
联合数据增广训练进一步展现出合成数据对真实训练集的实用价值:单独使用 Cityscapes 训练时 YOLOv8 为 48.8 mAP50,Mask2Former 为 65.2 mIoU;而采用「CDCT 迁移数据 + Cityscapes」联合训练后,分别提升至 52.5 mAP50 (+3.7) 与 67.0 mIoU (+1.8),显著突破了仅用真实数据的性能天花板。
消融实验¶
消融实验深入验证了跨域分数合成模块的必要性,以及 LMCA 架构在参数与显存开销上的压倒性优势。
| 消融配置 / 架构方案 | 多条件支持 | 新增参数量 | FID ↓ | KID (\(\times 10^3\)) ↓ | 机制效果说明 |
|---|---|---|---|---|---|
| 无分数合成 (w/o Score Comp.) | ✔ | 57M \(\times N\) | 63.77 | 57.11 | 强行输入真实域导致严重偏向 G-buffers 纹理,丢弃真实外观先验 |
| 完整模型 (w/ Score Comp.) | ✔ | 57M \(\times N\) | 26.45 | 22.17 | 真实外观先验与合成域几何梯度完美解耦正交融合 |
| 传统 ControlNet (SD3) | ✘ | 1.1B (+55%) | - | - | 完整复制 Transformer 骨干导致多条件堆叠显存不可承受 |
| LMCA (本文设计) | ✔ | 57M (+2.8%) \(\times N\) | - | - | 键值 LoRA 共享映射,参数与注意力耗时随条件数仅线性递增 |
关键发现¶
- 跨域分数合成是解决无配对控制的核心枢纽:若舍弃该模块(w/o Score Comp.)而直接用真实域标记搭配合成几何条件,FID 指标从 26.45 急剧恶化到 63.77,生成图像几乎丧失了真实照片级分布,证实控制模块直接跨域存在无法逾越的域偏移。
- 几何引导对语义一致性的保护作用极其显著:原始 CARLA 训练的 Mask2Former 迁移到 Cityscapes 只有 14.6 mIoU,而 CDCT 将其大幅拉升至 48.3 mIoU(净增 +33.7),在道路(83.9 vs 22.1)、车辆(79.5 vs 36.1)和行人(38.4 vs 1.6)等关键交互类目上表现尤为抢眼。
- 合成数据能有效扩充真实数据集的多样性:CDCT 生成数据不仅自身具备优异的下游迁移能力,与真实 Cityscapes 混合训练后还能使目标检测和语义分割反超真实数据上限,证明其合成样本在拓扑和视角上提供了真实数据稀缺的有效互补信息。
亮点与洞察¶
- 优雅的分数空间解耦设计:规避了在网络特征层强行对齐无配对域的繁琐对抗损失或循环一致性损失,直接基于条件独立性假设从两域速度差分中提纯几何梯度,数学形式优美且完全免配对。
- 显存友好的多条件适配结构:LMCA 将几何条件视为额外的键值 token 注入自注意力层,利用零初始化门控网络只缩放 Value 向量而保留 Key 拓扑,既避免了破坏预训练先验,又将参数增量压缩到每个条件仅 2.8%。
- 下游感知任务闭环验证:不仅局限于感知距离指标(FID/KID),还完整评测了分割、检测、单目深度估计以及联合真实数据微调的全套指标,为生成式 Sim2Real 数据引擎在工业自动驾驶落地提供了扎实的数据支撑。
局限与展望¶
- 固有内容差距(Content Gap)依然存在:CDCT 能够近乎完美地抹平纹理、光照与材质的外观差距,但对于 CARLA 与 Cityscapes 之间客观存在的交通标志样式差异、红绿灯制式不同以及特殊车辆外观分布等内容鸿沟,无法仅靠图像风格层面的几何引导消除。
- 极端动态物体的时序一致性:目前框架主要基于单帧扩散模型,未引入时序注意力或光流约束,在连续视频序列的生成过程中可能出现帧间闪烁和动态前景运动不连贯问题。
- 后续可探索方向:将 CDCT 扩展至多相机周围环视一致生成(Surround-View Consistency)及视频生成扩散 Transformer 中,同时结合 3D 边界框空间引导以进一步收敛内容差距。
相关工作与启发¶
- vs EPE (PAMI 2022): EPE 依赖传统卷积与中间几何缓冲区做图像真实感增强,容易在复杂光影处引入伪影和失真纹理;CDCT 基于新一代 MM-DiT 扩散大模型,生成纹理更加自然且 FID/KID 显著占优。
- vs VSAIT (ECCV 2022): VSAIT 通过向量符号架构保持结构绑定,但在高动态范围光照和真实材质细节(如高光反射、粗糙度)上表现僵硬;CDCT 显式引入法线和材质 G-buffers 配合 LMCA 适配,真实感与下游感知迁移精度全面领先。
- vs CACTIF (CVIU 2025): CACTIF 基于扩散模型探索风格迁移,但缺乏显式稠密几何引导机制,导致复杂街景生成中易出现物体结构变形和布局错乱;CDCT 通过跨域分数合成建立强约束,在语义分割和检测任务上大幅领先(mIoU 48.3 vs 32.1,mAP50 40.5 vs 31.7)。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出基于条件独立性假设的跨域分数合成与 LMCA,首次系统解决无配对多条件几何引导的 Sim2Real 扩散迁移问题。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖无参考图像质检、感知相似度、下游三大类感知评测(分割/检测/深度)及与真实数据联合增广训练,评测极其详实完备。
- 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰自然,架构图与消融设计严谨,逻辑层层递进。
- 价值: ⭐⭐⭐⭐⭐ 为自动驾驶仿真数据闭环及大规模无监督数据增广提供了高质量、高保真的生成范式。