跳转至

Domain Adaptation with Adaptive Imagination for Visual Reinforcement Learning under Limited Target Data

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5440
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/10626.pdf
领域: 机器人与具身智能 / 视觉强化学习
关键词: sim-to-real、领域适配、自适应想象、世界模型、自一致性

一句话总结

AIDA 先把目标图像映射到源状态空间,再由冻结策略和动力学模型展开想象,用三分类判别器逐状态截掉偏离目标流形的后缀,并在保留轨迹上做状态→图像→状态自一致性;仅用 50 条目标轨迹便在 7 个任务中取得 6 个最高回报比和全部最低状态 RMSE。

研究背景与动机

视觉强化学习的 sim-to-real 难点不只来自物理参数变化,也来自像素观测对纹理、光照和传感条件极其敏感。领域随机化试图在模拟器里预先覆盖这些变化,领域泛化则学习外观不变表征,但二者都要猜测部署时会遇到什么。领域适配可以直接观察目标域,针对实际偏移更新表示,却通常依赖大量目标数据;真实机器人采集昂贵,这一前提往往最先失效。

已有 CODAS 一类方法可将目标图像映射到模拟器的低维状态,让在状态上训练好的策略直接复用,从而避开图像强化学习最高可达约 20 倍的训练开销。不过,当目标轨迹很少时,轨迹对齐只覆盖狭窄的状态区域。用世界模型向外想象似乎能补数据,但滚动越长,模型误差和映射误差越容易把状态推到目标数据从未支持的区域;固定时域无法同时适应不同任务与不同起始状态。

本文因此把问题设为更困难但实用的跨模态适配:源域提供低维状态,目标域只提供图像与动作;两个域共享状态空间、动作空间、转移动力学和奖励,适配期间不再与目标环境交互。核心 idea:不把所有模型想象都当作训练数据,而是让三分类判别器为每条策略条件轨迹动态确定可信边界,只在边界内执行状态-图像-状态自一致性学习。

方法详解

整体框架

AIDA 分成源域学习和目标域适配两阶段。第一阶段在可访问真实状态的模拟器中,以 SAC 训练策略 \(\pi\),同时拟合一步动力学模型 \(f_\omega\);第二阶段冻结二者,只从少量目标图像轨迹学习映射器 \(q_\phi\) 和观测生成模型 \(p_\theta\)。部署时,\(q_\phi\) 把目标图像恢复为源状态,冻结策略据此输出动作。

目标适配的基础仍是轨迹级重建与对抗对齐。AIDA 从目标图像推断出的状态出发,让冻结策略和动力学模型生成多步状态轨迹;独立的三分类判别器逐转移给出“像目标推断数据”的置信度,一旦低于阈值便终止。每个可靠想象状态再经 \(p_\theta\) 渲染为图像并由 \(q_\phi\) 映射回来,形成额外的循环监督。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["源状态交互"] --> B["跨模态轨迹对齐<br/>训练策略与动力学模型"]
    B --> C["少量目标图像轨迹<br/>图像→源状态"]
    C --> D["判别器门控想象<br/>逐状态动态截断"]
    D --> E["想象数据自一致性<br/>状态→图像→状态"]
    E --> F["目标图像→状态→动作"]

关键设计

1. 跨模态轨迹对齐:把昂贵的图像策略学习改成图像到源状态的适配

源策略直接在模拟器低维状态上训练,目标侧则学习时序映射 \(q_\phi(s_t\mid \hat{s}_{t-1},a_{t-1},o_t)\)。它同时读取前一推断状态、前一动作和当前图像,而不是逐帧猜状态;这是因为单帧可能被映射到一个外观合理却动力学不连贯的状态,轨迹上下文能排除这种歧义。自回归观测模型 \(p_\theta(o_t\mid \hat{s}_t,o_{t-1})\) 负责重建目标画面,二分类对齐判别器 \(D_\eta\) 则让推断轨迹接近源状态轨迹。

该基础目标写为

\[ \mathcal{L}_{\mathrm{align}}=\mathcal{L}_{\mathrm{recon}}+\alpha\mathcal{L}_{\mathrm{adv}}. \]

这样,部署策略就是 \(\pi(q_\phi(o))\),无需在目标图像上重新学习控制。需要注意的是,这里的二分类 \(D_\eta\) 只负责源轨迹与目标推断轨迹的分布对齐,和下一步判断想象可靠性的三分类 \(D_\psi\) 不是同一个判别器。

2. 判别器门控想象:为每个起始状态选择不同的可靠时域

从目标轨迹推断状态后,AIDA 让冻结策略选动作,再用冻结动力学模型递归预测下一状态。固定滚动长度会混入两类误差:动力学模型的多步累积误差,以及映射器在目标数据支持之外的误差。AIDA 因而训练三分类判别器,将转移区分为目标推断、源域和想象三类。显式加入“想象”类很关键:二分类源/目标判别器面对同时不属于两边的 OOD 转移时可能输出约 0.5,错误地把它解释成中等可信。

\(D_\psi^{\mathrm{tgt}}\) 为转移属于“目标推断”类的概率,可靠时域取第一个低于阈值 \(\delta\) 的位置,并受最大长度 \(K_{\max}\) 限制:

\[ K^*=\min\!\left(\min\left\{k\geq0\mid D_\psi^{\mathrm{tgt}}(\tilde{s}_{t+k},a_{t+k},\tilde{s}_{t+k+1})<\delta\right\},K_{\max}\right). \]

训练只接纳 \(k=0,\ldots,K^*-1\) 的转移。这里的收益不只是自动调一个全局超参数:同一回合不同状态对应的可信长度明显波动,因此门控是在样本级决定“还能想多远”。

3. 想象数据自一致性:把可靠的可达状态变成稠密语义监督

仅生成状态转移不会自动改善图像到状态的映射。对每个获准的想象状态 \(\tilde{s}_{t+k}\),观测模型先按前一画面生成目标风格图像 \(\tilde{o}_{t+k}\),映射器再从该图像和时序上下文恢复 \(\bar{s}_{t+k}\)。AIDA 最小化恢复状态与原想象状态的差异:

\[ \mathcal{L}_{\mathrm{sc}}=\frac{1}{K^*}\sum_{k=1}^{K^*}\left\|\bar{s}_{t+k}-\tilde{s}_{t+k}\right\|_1. \]

这比只在真实数据点上做循环一致性更有针对性:想象由当前策略条件化,覆盖的是部署策略实际可能到达的状态;判别门又阻止错误状态反过来污染映射器。完整适配目标为 \(\mathcal{L}=\mathcal{L}_{\mathrm{align}}+\lambda\mathcal{L}_{\mathrm{sc}}\)

一个完整示例

以目标域某一帧 Swimmer 图像为例,映射器先结合上一状态和动作推断当前低维状态。冻结策略在该状态上给动作,动力学模型连续外推;每一步都由 \(D_\psi^{\mathrm{tgt}}\) 检查。论文可视化显示,截断前解码出的身体形态连贯,越过红色截断点后则出现身体扭曲和模糊。AIDA 丢弃后半段,只把前半段逐一渲染并重新编码,用恢复状态约束原想象状态。换一个回合位置,门控可能给出完全不同的长度,这正是固定 \(K\) 无法表达的差异。

损失函数 / 训练策略

源阶段用低维状态训练 SAC 策略,并以一步平方预测误差训练动力学模型;目标适配阶段将策略和动力学模型全部冻结。训练数据只有 50 条由专家策略预先采集的目标图像轨迹,相当于 CODAS 既有设置数据量的 \(1/6\),除在线基线 PAD 外不允许额外目标交互。实验结果均报告 3 个随机种子的均值与标准差。

实验关键数据

主实验

回报比定义为 \(r_{\mathrm{ratio}}=r/r^*\),其中 1.0 表示恢复源专家的平均回报。AIDA 在 7 个任务中的 6 个取得最高适配回报比;Walker2d 是唯一例外,BC 为 0.101,而 AIDA 为 0.058。

方法 HalfCheetah Hopper Swimmer Walker2d Inv. Pend. Shadow Fetch
BC 0.462±0.011 0.121±0.018 0.403±0.042 0.101±0.013 0.319±0.052 0.836±0.033 0.453±0.009
GAN_STACK 0.340±0.087 0.056±0.008 0.261±0.066 0.026±0.004 0.063±0.004 0.645±0.122 0.823±0.053
PAD 0.573±0.075 0.142±0.023 0.347±0.058 0.036±0.005 0.155±0.012 0.395±0.088 0.821±0.044
CODAS 0.711±0.098 0.356±0.086 0.468±0.069 0.038±0.009 0.440±0.038 0.893±0.059 0.897±0.007
AIDA 0.810±0.113 0.440±0.142 0.512±0.047 0.058±0.018 0.561±0.049 0.931±0.027 0.984±0.012

状态 RMSE 直接衡量 \(q_\phi\) 恢复真实本体状态的准确度。论文只对 GAN_STACK、CODAS 和 AIDA 报告该指标,AIDA 在全部 7 个任务上最低。

方法 HalfCheetah Hopper Swimmer Walker2d Inv. Pend. Shadow Fetch
GAN_STACK 3.006±0.153 0.862±0.059 1.360±0.272 2.525±0.317 0.328±0.042 0.452±0.029 0.025±0.009
CODAS 1.550±0.081 0.540±0.021 0.482±0.057 2.180±0.405 0.108±0.007 0.425±0.037 0.017±0.004
AIDA 1.403±0.116 0.523±0.023 0.356±0.015 1.784±0.320 0.075±0.004 0.391±0.016 0.015±0.008

消融实验

对照 任务 / 观测 论文报告的结果 说明
自适应 \(K^*\) Hopper 回报曲线,3 seeds 所有配置中最高 逐状态过滤低置信转移
固定 \(K=0\) Hopper 回报曲线,3 seeds 基准 不使用想象
固定 \(K=5,10,20\) Hopper 回报曲线,3 seeds \(K=0\) 相当或更差 延长时域会无差别纳入漂移转移
AIDA(有 \(\mathcal{L}_{\mathrm{sc}}\) InvertedPendulum 解码图 角度与位置更贴近 GT 循环监督保留物理构型
CODAS(无 \(\mathcal{L}_{\mathrm{sc}}\) InvertedPendulum 解码图 角度持续偏离 GT 图像可似真但状态语义错误

该消融图只给训练曲线而未列精确收敛终值,因此表中保留论文可核验的排序与结论,不从图像估读数字。三分类门控的可视化还显示:截断前图像物理连贯,截断后出现扭曲与模糊;单回合中的想象长度随状态显著变化,支持逐状态截断而非固定时域。

关键发现

  • 相比最接近的 CODAS,AIDA 的回报比在 HalfCheetah、Hopper、Swimmer、Walker2d、InvertedPendulum、Shadow、Fetch 上分别提高 0.099、0.084、0.044、0.020、0.121、0.038、0.087。
  • AIDA 在 Swimmer(0.512 对 0.304)和 Fetch(0.984 对 0.975)超过具有无限在线交互的图像 Oracle,但这不表示适配普遍优于 Oracle:图像 Oracle 还要联合学习表示和策略,而 AIDA 复用了稳定的状态策略。
  • Walker2d 上 AIDA 的 RMSE 最低却回报低于 BC,说明平衡任务会放大很小的状态误差;表示误差和控制收益不能互相替代。

亮点与洞察

  • 三分类判别器不是普通的源/目标域判别器改名。额外的想象类别专门吸收“两边都不像”的状态,避免二分类约 0.5 的模糊输出被误当成可信度。
  • 自适应时域把世界模型的数据增广从“生成越多越好”改为“只消费仍在支持集内的前缀”。这可迁移到模型式规划、离线强化学习和机器人视频预测:用支持度估计器控制模型数据进入训练的边界。
  • 自一致性把无标签想象变成对表示的监督,而不是直接拿可能有偏的合成转移更新策略。冻结控制器并只适配感知接口,缩小了低数据条件下会被共同优化放大的误差面。

局限与展望

  • 作者明确指出,适配策略仍未普遍恢复源专家性能,尤其 Walker2d 这类平衡敏感任务差距很大。可在保持离线初始化的前提下加入受约束的在线适配或不确定性触发的数据采集。
  • 方法假设源域与目标域共享转移动力学和奖励,只处理观测分布偏移;真实 sim-to-real 往往同时存在摩擦、延迟、质量等动力学差异。下一步需要联合估计动力学偏移,或让门控区分感知 OOD 与动力学 OOD。
  • 目标数据由专家策略采集,50 条轨迹虽少但覆盖质量较高;论文没有验证次优、混合行为或更极端数据预算。门控判别器本身也依赖这 50 条轨迹学习“目标样”,在覆盖偏斜时可能过早截断有价值的新状态。
  • 固定时域与自一致性的证据主要来自 Hopper 曲线和 InvertedPendulum 定性图,未给逐任务、带精确终值的组件消融。补充完整的 \(D_\psi\) 类别设计、阈值 \(\delta\)\(K_{\max}\)\(\lambda\) 敏感性会更有说服力。

相关工作与启发

  • vs CODAS:CODAS 已提供图像到特权状态的轨迹级对抗映射,AIDA 沿用这一跨模态骨架,但用门控的策略条件想象扩大低数据覆盖,再以自一致性约束新增状态;优势是低数据表现更好,代价是额外训练动力学模型、观测模型和三分类判别器。
  • vs PAD:PAD 在部署时用逆动力学自监督持续更新图像编码器,适合较小的图像到图像外观变化;AIDA 不需部署交互,并处理更大的状态到图像鸿沟,但依赖共享动力学与源状态访问。
  • vs 领域随机化 / 领域泛化:DR 和 DG 不看目标数据,必须预先猜测变化因素;AIDA 用少量目标轨迹专门化,适合目标数据少但并非为零的场景,也不提供对完全未知目标域的零样本保证。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 将 OOD 感知的逐状态截断与想象轨迹自一致性组合到跨模态视觉 RL 适配中,切入点明确,但建立在 CODAS 式轨迹对齐之上。
  • 实验充分度: ⭐⭐⭐⭐☆ 覆盖 5 个 MuJoCo 和 2 个 Gymnasium-Robotics 任务、5 类基线和 3 seeds,但关键组件缺少跨任务数值消融与超参数敏感性。
  • 写作质量: ⭐⭐⭐⭐☆ 问题设定、两个判别器的职责和四个研究问题组织清楚,部分实现细节留在补充材料。
  • 价值: ⭐⭐⭐⭐☆ 针对真实部署中“目标数据贵且不能继续交互”的约束,给出了可复用的模型数据质量控制思路。