Trust Guided Decision Transformer¶
会议: NeurIPS2026
arXiv: 2609.31586
领域: 强化学习
关键词: 离线强化学习、决策 Transformer、上下文可靠性、保形校准、价值引导
一句话总结¶
TGDT 用已实现转移的滚动下一状态预测误差先筛选可信历史后缀,再用冻结的 IQL critic 对候选动作排序,在长时域导航上改善回报与持续高误差,但不提供闭环覆盖率或安全保证。
研究背景与动机¶
Decision Transformer(DT)把离线强化学习写成以剩余回报、状态与历史动作为条件的序列预测问题。训练时,输入窗口来自数据集中的真实轨迹;部署时,历史逐步变成策略自己执行动作后产生的轨迹。即使训练损失已经收敛,长回合中的自生成历史也可能偏离离线窗口分布。此时问题不只是当前动作质量差,而是模型正在依据一个训练数据没有充分支持的上下文做决定,作者称其为 rollout context mismatch。
价值引导方法给 DT 添加 critic,试图在既定历史下选出更好的动作;行为正则化限制动作偏离数据的程度;Elastic Decision Transformer(EDT)等方法则允许在线调整历史长度。不过,高 Q 值并不能证明生成该动作的上下文可靠。若长历史已经漂移,critic 仍可能偏爱它产生的候选动作,让一个缺乏支持的条件输入继续影响后续控制。反过来,只要误差升高就清空历史,又可能丢掉任务拼接所需的有效信息。
作者先用独立、冻结的转移预测探针诊断原始 DT,发现高预测误差常以持续区段而非孤立尖峰的形式出现,再把可在线读取的可靠性信号纳入 DT。核心 idea:把“哪些上下文值得信任”放在“哪些动作价值更高”之前,用离线校准的历史误差筛选上下文,再在可信集合内进行价值排序。
方法详解¶
整体框架¶
TGDT 保留 DT 的回报条件策略,但改变了训练辅助组件与推理时上下文选择顺序。离线阶段先训练 IQL critic 并冻结,再训练带有界残差动作头和内部可靠性头的 DT;留出轨迹提供预测误差阈值。部署阶段,每一步读取同一条实际轨迹的多个近期后缀,依据它们截至上一步的误差记录剔除不可信后缀,再由 critic 选择剩余候选中的最高价值动作。
默认最大上下文长度为 \(K=20\),候选集合是 \(\mathcal{L}=\{1,5,10,20\}\)。不同后缀不是四条模拟轨迹,而是同一实际历史的四种截断视图。下一状态预测头只充当可靠性传感器,不生成模型 rollout、不产生合成训练转移,也不在学习的动力学模型中优化策略。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
D["离线轨迹"] -.->|训练监督:数据动作与下一状态| A["近数据动作与<br/>内部可靠性头"]
D -.->|留出轨迹:教师强制误差| B["离线误差校准"]
H["实际历史与剩余回报"] --> A
A -.->|离线滚动误差| B
A -->|各后缀候选动作| C["先信任后价值"]
B -.->|固定阈值| C
Q["预训练并冻结的<br/>IQL critic"] -.->|训练价值项| A
Q -->|可信候选的Q值| C
C -->|执行一个动作| E["环境返回真实下一状态"]
E --> F["同动作误差反馈"]
F -->|更新队列:下步筛选| C
虚线表示离线监督、校准或冻结训练信号,实线表示推理时数据流。诊断原始 DT 的外部探针不在这条部署路径上;运行时使用内部可靠性头。四个贡献节点的名称与下文关键设计一致。
关键设计¶
1. 近数据动作与内部可靠性头:让误差信号尽量反映上下文问题
如果动作头为了追求 critic 高分而大幅偏离离线动作,状态预测误差也会升高,但这时它可能反映的是动作分布偏移,而不是历史上下文失真。TGDT 因此从基础动作预测出发,用 \(\delta_{\max}\tanh(\cdot)\) 限制残差幅度,再对基础预测与残差之和应用 tanh。行为克隆损失把最终动作拉回数据动作,额外残差惩罚限制局部修正,较小的价值项才负责偏向高价值行为。这些约束降低了误差信号的混淆,并不意味着动作一定处于数据支持集内。
内部可靠性头从动作 token 的隐表示预测下一状态,并以按状态维度归一化的均方误差监督。它与动作学习共享上下文表示,使训练后的模型既能提出动作,也能提供当前历史的转移预测。原文 Eq. 4 写的是从动作 token 表示输出下一状态;运行规则 Eq. 12 又显式写成以实际执行动作为条件的预测。原文没有完整说明两种写法之间的 token 注入、重算或缓存实现,因此这里保留该实现细节疑点,不补造网络连接。
IQL critic 在离线数据上预训练后始终冻结。训练期间,其梯度信号可通过动作值影响动作头,但 critic 参数本身不更新;推理期间,它仅比较有限个 DT 候选动作,不在连续动作空间做无约束搜索。外部探针只用于证明原始 DT 也存在上下文失配,不是内部头的训练教师,也不是部署时必须保留的额外模型。
2. 离线误差校准:用数据给持续异常定标,而不是给闭环运行作保证
不同任务的状态维度、动力学难度和预测器拟合程度不同,不能共享一个任意的绝对误差阈值。TGDT 在留出离线轨迹上采用教师强制,先计算每步归一化状态预测误差,再对最近 \(K_e=10\) 步取均值。这样,单次随机尖峰被平滑,而持续偏离更容易被识别;阈值也与部署时使用的滚动统计量对应,而不是直接对单步误差定标。
设留出集得到 \(n\) 个滚动分数,原文按 split conformal 的顺序统计量取阈值:
这个有限样本校准规则接近留出误差的第 95 百分位,但不能推出“测试时只有 5% 步骤不可靠”。闭环转移依赖过去动作,滚动窗口重叠带来时间相关性,测试动作分布也不同于行为策略。作者明确不主张在线 coverage guarantee;阈值是具有离线参照的经验可靠性标准,效果要由回报和持续超阈误差验证。
3. 先信任后价值:先缩小上下文集合,再允许 critic 排序
在时间 \(t\),模型独立读取每个候选后缀并提出动作。每个后缀还维护自己的历史误差队列,筛选时只能用截至 \(t-1\) 的观测误差,不能把尚未出现的下一状态当作当前决策证据。令 \(e_j^{(L)}\) 是后缀 \(L\) 在实际转移上的归一化预测误差,则选择规则为:
这是一种硬门控,而不是在 Q 值上减去误差惩罚。不可信上下文生成的动作即使得到最高 Q 值,也不会进入正常排序集合。与 critic-only 的受控比较保持训练模型、冻结 critic 和候选长度完全相同,只改变是否先过滤,因此能较直接地隔离选择顺序的贡献。critic-only 体现价值驱动的弹性上下文思想,但不是对 EDT 原方法的完全匹配复现。
如果所有后缀都被拒绝,TGDT 回退到 \(L=1\),确保每一步都有可执行动作。这个最短上下文也可能不可信,因此回退不是安全控制器,更不是“总能选到可靠动作”的证明。可靠性窗口尚未装满时如何初始化、如何处理短回合的队列边界,正文没有给出足够细节,笔记不自定实现规则。
4. 同动作误差反馈:所有后缀都评估已经发生的同一次转移
执行选定动作后,环境揭示真实下一状态。每个后缀的可靠性预测都应按原文 Eq. 12 以这个实际执行动作为条件,再与同一个观测状态比较。未被选中的后缀不会执行自己的候选动作,因此不能把其候选动作对应的预测直接与真实状态相减,冒充未执行动作的误差。
各后缀队列追加该误差后得到 \(S_t^{(L)}\),供下一次决策使用。它们是对同一实现轨迹的不同上下文解释,不是反事实 rollout。这个时间顺序把“当前依据过去误差选动作”和“执行后更新证据”分开,避免未来信息泄漏;具体如何让内部头接受已执行动作,仍受前述 Eq. 4 与 Eq. 12 的实现说明不足所限。
一个完整示例¶
考虑 Maze2D 中一次已经偏离离线轨迹的导航决策。当前四个后缀中,长度 20 和 10 的历史滚动误差超过阈值,长度 5 和 1 尚未超过;即使长度 20 提出的动作有全体最高 Q 值,它仍先被排除。critic 只比较长度 5 与 1 的候选,若长度 5 价值更高,就执行它,而不是无条件清空到最短历史。
环境返回下一状态后,四个后缀都围绕这一个已执行动作更新误差。之后长度 10 或 20 的误差若重新落到阈值内,就能再次参与排序;方法没有永久禁用长历史。这是流程示意而非额外实验数值,也说明了为什么 TGDT 与 hard reset 不等价。
损失函数 / 训练策略¶
训练目标把行为模仿、冻结 critic 价值引导、残差约束和状态预测放在一起:
其中 \(w_t\) 可使用归一化优势权重;它是可选训练配方,不应被解读为所有报告结果都必然用了同一种优势加权。默认 \(\lambda_Q=0.01\)、\(\lambda_s=1.0\)、\(\delta_{\max}=0.05\)、\(\beta=0.05\),使价值修正保持局部,同时训练可用的可靠性头。
附录 A.1 给出 3 层 Transformer、1 个注意力头、128 维嵌入、batch size 64,以及 AdamW、学习率与 weight decay 均为 \(10^{-4}\)、梯度裁剪 0.25。IQL 使用 expectile 0.7、折扣 0.99,critic 训练 20,000 步后冻结。训练组件改善候选质量,但真正决定测试时用哪段历史的是上述运行规则。
实验关键数据¶
主实验¶
任务覆盖 D4RL 的 Maze2D、AntMaze、MuJoCo、Adroit 和 Kitchen,均为状态输入。本文方法训练 3 个独立种子,每种子评估 100 回合,报告跨种子的均值与标准误,而非标准差;内部执行模式采用配对评估种子。外部基线主要取各自论文的最佳结果,缺失项由作者复现,因此横向表不是所有方法统一重新训练的严格对照。
下表选取原文 Table 1 的代表结果。分数是 D4RL 归一化分数,不能直接当作统一的成功率;MuJoCo 为 9 项平均。
| 任务 | DT | VDT | TGDT | 比较边界 |
|---|---|---|---|---|
| maze2d-umaze-v1 | 31.0 | \(88.0\pm4.6\) | \(92.0\pm0.4\) | TGDT 高于此处 VDT |
| maze2d-medium-v1 | 8.2 | \(60.3\pm0.5\) | \(66.1\pm0.9\) | 长时域导航改善明显 |
| antmaze-umaze-v0 | 59.2 | \(100.0\pm5.5\) | \(98.8\pm2.3\) | TGDT 低于 VDT 均值 |
| antmaze-umaze-diverse-v0 | 66.2 | \(100.0\pm4.7\) | \(95.2\pm3.1\) | TGDT 低于 VDT 均值 |
| antmaze-medium-diverse-v0 | 7.5 | \(30.0\pm2.8\) | \(60.0\pm5.2\) | 仍低于 IQL 的 70.0 |
| MuJoCo 平均 | 76.2 | 84.1 | 86.3 | 平均提高不代表逐项领先 |
| hopper-medium-replay-v2 | 82.7 | \(96.0\pm1.9\) | \(95.5\pm2.2\) | 此项 TGDT 均值较低 |
| pen-human-v1 | 79.5 | \(126.7\pm4.3\) | \(123.2\pm5.2\) | 此项也未超过 VDT |
原文 Table 1 的 Maze2D 平均行有算术疑点:COMBO 的两行是 76.4 与 38.5,但平均写为 72.5;DC 的两行是 20.1 与 38.2,但平均写为 57.6。两行简单平均分别为 57.45 和 29.15。这里保留原文数字与冲突,不把自行计算结果替换成作者结果,也不据这些平均宣称领先。
消融实验¶
以下单独使用附录 Table 5 的 maze2d-medium-v1 内部消融,不能与 Table 1 的 66.1 混成同一测量。括号里的原文指标为所选上下文滚动误差超过阈值的步骤比例;它不是最长连续超阈区段。
| 训练 / 执行配置 | 归一化分数,均值 \(\pm\) 标准误 | 超阈步骤比例 |
|---|---|---|
| DT / none | \(8.7\pm0.8\) | 45.2% |
| DT + SP / none | \(10.2\pm0.9\) | 40.9% |
| DT + Critic / none | \(35.9\pm1.7\) | 37.6% |
| DT + Critic + SP / none | \(56.7\pm1.5\) | 29.8% |
| 同一完整模型 / full context | \(56.3\pm1.4\) | 30.1% |
| 同一完整模型 / hard reset | \(58.2\pm1.6\) | 11.5% |
| 同一完整模型 / critic-only | \(60.1\pm1.3\) | 28.7% |
| 同一完整模型 / TGDT | \(68.6\pm1.5\) | 8.6% |
Table 5 中 TGDT 对 critic-only 的 medium 提升为 8.5 分,而 umaze 为 91.3 对 87.1,即 4.2 分;附录文字概括为“5–7 分”,与表格不完全一致。Table 1 与 Table 5 的 TGDT 分数也不同,原文没有充分解释测量差异,故分别标注来源而不合并。表中训练完整模型的 none 与执行 full context 也略有差异,不将其强行修成相同值。
关键发现¶
- 状态预测单独加入时,medium 分数仅从 8.7 到 10.2;训练完整模型提高到 56.7,但仍有 29.8% 超阈步骤。能读取误差不等于已经控制上下文。
- 同模型的 critic-only 与 TGDT 对照最能隔离筛选贡献:分数从 60.1 到 68.6,超阈比例从 28.7% 到 8.6%。这不意味着所有任务的回报都提高;Table 5 的 hopper-medium-expert 为 TGDT 111.3、critic-only 112.0。
- 正文 Figure 2 描述 medium 的最长连续超阈区段显著缩短,引言约称 8 倍;缓存未给该图完整数值,不把这个近似倍数改写成精确表格结果。
- 附录 A.2 中,medium 的外部探针与内部头 Pearson 相关 0.82、阈值判断一致率 0.89、探针阳性召回率 0.78。两者各用自己的离线阈值,不能共享一个绝对误差阈值。
- 附录 A.6 在 RTX A4500 20GB 上测得 full context 为 \(0.62\pm0.03\) ms/步、critic-only 为 \(2.35\pm0.08\)、四后缀 TGDT 为 \(2.48\pm0.09\);默认 TGDT 约为完整上下文的 4 倍时间,密集 20 后缀为 \(11.4\pm0.4\) ms/步。
亮点与洞察¶
- 把 critic 的能力边界显式化:价值估计负责在可接受候选间排序,而不是替上下文可靠性作担保。改进来自决策顺序,不来自更大的模型或新 critic。
- 同执行动作的多后缀反馈可复用到其他历史条件策略。它允许比较不同记忆长度,而无需假装环境同时执行了多个动作。
- 独立探针与内部头分工清楚:前者建立与架构无关的诊断证据,后者承担低耦合的运行信号。这比仅展示自家辅助头误差更能支撑问题定位,但仍不等于证明误差完全由上下文失配引起。
局限与展望¶
- 离线保形式阈值没有闭环覆盖保证;相关窗口、策略诱导的状态分布与动作分布变化都破坏交换性。可研究非交换数据校准,但不能将其未实现的保证归给本文。
- 误差还可能来自动力学随机性、预测器偏差或动作分布变化。近数据动作约束缓解混淆,却没有把误差变成上下文失配的充分必要条件。
- 仅验证状态型 D4RL,未验证图像观察、真实机器人、非平稳动力学或严格延迟预算。多后缀前向的绝对耗时不大,不代表相对成本可以忽略。
- 最短后缀回退没有安全证书;错误队列启动规则及内部头如何显式接受已执行动作的实现说明不足,影响独立复现。
- 表格平均、主表与内部消融的数值差异,以及“5–7 分”的文字概括应由作者进一步澄清。更统一的基线重跑与更多训练种子可提高结论稳健性。
相关工作与启发¶
- vs DT:DT 固定使用历史进行回报条件动作预测;TGDT 增加内部可靠性传感器与在线后缀筛选。核心变化是部署时管理条件输入,而不只是提高模仿损失。
- vs EDT / critic-only:都允许历史长度变化,但本文先按误差过滤再按 Q 排序。严格受控的是自己的 critic-only 版本,不应把它的劣势直接归给 EDT 的完整方法。
- vs TD3+BC / ReBRAC / VDT:行为正则化和价值引导是已有训练思想,TGDT 用它们维持近数据候选,再增加可靠性门控。训练配方本身不是本文声称的主要新意。
- vs MOPO / MOReL / COMBO:这些方法利用动力学模型进行模型式策略学习或 rollout;TGDT 的下一状态预测只读取可靠性,不用预测轨迹替代环境。应归为离线强化学习的序列策略与运行时上下文控制,而非模型式规划。
评分¶
- 新颖性: 4/5 — 先可信后价值的选择顺序清晰,辅助组件大多沿用已有方法。
- 实验充分度: 3/5 — 多域、配对执行消融和成本分析较完整,但只有 3 种子、状态输入与数值冲突。
- 写作质量: 3/5 — 诊断到干预的叙事明确,动作条件实现与多处表文差异仍待澄清。
- 价值: 4/5 — 为长时域序列策略提供可复用的上下文可靠性管理思路,不应解读为安全保证。