CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3708
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/2696.pdf
作者: Li Gao, Liu Liu, Mingyang Lv, Yang Cai
领域: 机器人 / 具身视觉跟踪
关键词: 竞争式训练、非对称奖励、GRPO、连续路点、多视角记忆
一句话总结¶
CoMaTrack 让两台 VLA 机器人竞争跟随同一个语言指定目标,以非对称奖励和带 SFT 约束的 GRPO 形成动态训练课程,使 3B 跟踪模型在 EVT-Bench 的 STT、DT、AT 成功率达到 92.1%、74.2%、57.5%,其中同模型 STT 从单智能体 RL 的 89.5% 提升到 92.1%。
研究背景与动机¶
具身视觉跟踪并不是在视频里画框:机器人必须根据“跟着穿某种衣服的人”识别目标,同时决定自己的移动路线,在遮挡、目标运动和其他行人干扰下持续保持视野与安全距离。TrackVLA 等方法以专家轨迹监督视觉语言动作模型,将目标理解与路点预测放在同一网络中;但离线示范覆盖哪些轨迹,模型就主要学到哪些情境,罕见的遮挡恢复和被其他机器人挤占路线的情况不容易被充分覆盖。
改用单智能体 RL 可以让机器人从闭环反馈中修正动作,却不自动解决训练分布的瓶颈。如果目标行为和干扰生成器长期固定,策略仍可能适应一组有限的追踪套路。这里缺少的不是更多无方向的运动噪声,而是能随着跟踪器变强、继续对其施加有效压力的互动对象。论文因此把难例生成交给另一个会学习的机器人,使有利跟随位置成为双方争夺的资源。
这并不是首次在视觉跟踪中引入对抗博弈:作者明确承接 AD-VAT 的非对称对决思想,新增的重点是语言条件、现代 VLA 表征、连续路点输出以及在线 GRPO 的结合。核心 idea:让对手通过更靠近同一个目标制造有目的的路线竞争,再让跟踪器在安全约束下学会应对这种持续变化的干扰,而不是仅靠扩大静态示范集。
方法详解¶
整体框架¶
输入是自然语言目标描述、当前前后左右四路 RGB 图像,以及滑动窗口中的历史前视图;输出是未来 5 个连续路点,每个路点包含机器人坐标系下的平面位移与朝向。系统先进行多任务监督学习,获得能识别人并规划动作的 VLA,再复制为跟踪器和竞争对手,在 Habitat 中共同采样轨迹并分别更新策略。
整个训练过程由多视角时序 VLA、非对称竞争奖励、双策略 GRPO 三部分连接起来。执行时仍以一个跟踪器完成任务,多智能体机制主要用于训练;新增基准另行测试它在对手存在时是否还能保持跟随。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["语言目标描述<br/>四路当前图像与历史前视图"] --> VLA["多视角时序 VLA<br/>多任务监督与路点预测"]
VLA --> Rollout["跟踪器与对手<br/>共同环境采样"]
Rollout --> Reward["非对称竞争奖励<br/>安全跟随与近距争位"]
Reward --> GRPO["双策略 GRPO<br/>独立回报与冻结 SFT 参照"]
GRPO --> Rollout
GRPO --> Output["部署跟踪器<br/>输出连续路点"]
关键设计¶
1. 多视角时序 VLA:保留当前空间细节,同时压缩过去的观察
一次跟踪失败可能来自两种不同的信息缺口:目标刚从正前方移到侧面,或被短暂遮挡后失去了身份线索。CoMaTrack 因此并用当前四视角观察和历史前视图,而不是只处理一张当前图像。Qwen2.5VL-3B 提取视觉特征后,通过多尺度网格池化保留近期图像的细粒度空间信息,并用粗粒度 token 表达更久的历史。这样,当前目标的外观与方位不会过早被压缩,远期上下文又不会无限占用序列长度。缓存描述了这种粗细粒度时序组织,但没有提供可据此复现的完整窗口长度和 token 预算。
视觉 token 与语言嵌入、导航任务标识一起送入语言模型。识别类任务走常规自回归文本分支,导航与跟踪则由条件化于视觉语言表征的 flow-matching 动作头预测路点序列。这里的输出是连续运动计划,而不是在“左转、右转、前进”的离散菜单中选择;每个路点包括 \((x,y,\theta)\),连续 5 步共同描述未来短程运动。动作头建立在通用 flow matching 上,论文贡献并非重新发明该生成机制。
监督阶段把跟踪、导航和 VQA 一起训练:跟踪示范提供“怎样走”,语言视觉任务保留“怎样辨认目标和理解描述”的能力。后续 RL 不重新训练整个动作系统,而只调整 LLM 的 LoRA;视觉编码器与动作头被冻结。因此,同一个动作头仍可因条件表征改变而给出不同路点,策略更新发生在动作生成所依赖的上游表示中。
2. 非对称竞争奖励:让双方争位置,但不把跟踪器奖励成危险追逐者
训练中的两个机器人都跟随同一个人类目标。对手不是被跟踪者,也不是一个以逃跑为唯一目的的目标策略;它通过抢占近处的跟随位置,间接造成遮挡、交叉路径和物理阻挡。两者采用相同 VLA 架构,但目标距离不同:跟踪器的距离奖励中心为 2.25 m,对手的中心改为 1.25 m。这种差异使对手有动力进入更靠近目标的位置,而跟踪器不能简单靠“跟得更紧”取得高回报。
单智能体基础奖励把距离、朝向与持续跟随结合起来。距离项是以理想距离为中心的高斯函数,宽度参数为 0.75 m;偏离理想跟随区域时奖励降低。另有面向目标的奖励、连续保持安全跟随的奖励,以及完成回合的终端奖励和目标丢失、碰撞的惩罚。按缓存文字与可辨认公式整理,距离项为:
这里 \(d\) 是机器人到目标的距离,\(w_{\mathrm{distance}}\) 是距离奖励权重。缓存的公式字符存在缺损,上式是根据“以理想距离为中心的高斯”及明确参数整理的表达,不代表已核对 PDF 排版;其余奖励权重未在缓存中完整给出,不能据此补造完整奖励函数。多智能体版本保留跟踪器的基础奖励,并增加感知对手距离的安全项,惩罚双方过近或碰撞;对手则使用更近的距离中心。
这构成有竞争性的训练,但并不等价于严格零和博弈:对手的回报不是跟踪器回报的相反数,论文也没有给出纳什均衡求解。真正的作用机制是改变训练过程中遇到的状态分布,让机器人必须学习如何绕开占路者而不丢掉目标,而不是增加一个抽象的“博弈推理”模块。
3. 双策略 GRPO:共同采样,分别优化,并限制策略漂移
当双方同时在环境里行动,跟踪器看到的干扰会随着对手学习而改变,对手也会遇到越来越能避让的跟踪器。论文使用同步的 on-policy 更新节奏:双方共同产生交互轨迹,各自用自己的轨迹回报进行 GRPO 更新,而不是共享一个团队总奖励。组内相对回报为动作选择提供相对优劣信号,策略比率裁剪限制一次更新的幅度。默认分组大小为 \(K=10\);缓存没有清楚说明组内采样如何与连续 flow-matching 动作的概率计算衔接,这属于复现时需要进一步确认的接口。
为了不让竞争训练破坏已学会的目标理解和导航先验,两个策略都受冻结 SFT 参照的 KL 约束,另用熵奖励保留探索。参照的是监督模型,不是上一轮对手;它的作用是约束自身偏离已有能力的速度。这样做尤其针对多智能体的非平稳性:双方都会变,若每次更新再大幅偏离原策略,训练目标会更加难以追踪。
论文报告使用 k3 估计器估计 KL,但缓存里的 GRPO 与总损失公式已严重残缺,无法可靠恢复全部符号与正负号,因此这里保留机制、明确超参数与消融证据,不伪造可直接实现的完整目标。也不能把“使用 KL”理解为已经证明稳定收敛:作者在方法中称稳定性与单智能体相近,却在局限中仍承认非平稳性带来的成本和不稳定问题。
一个完整示例¶
设语言指令指定一名穿着特定衣服的人,另一台机器人正处在跟踪器与目标之间。多视角时序 VLA 用当前侧视图及历史前视图维持目标线索,动作头输出包含位移与朝向的 5 个路点。执行并获得下一批观察后,跟踪器继续根据新状态重新规划,而不是把最初路径一次走到底。
在训练中,对手靠近 1.25 m 的奖励中心,可能继续占据目标身后的直线路线;跟踪器则围绕 2.25 m 的理想距离,结合碰撞与朝向反馈学习避让。两者的轨迹分别计算回报,再进入双策略 GRPO。这个例子说明模块如何衔接,不是原文公布的单条轨迹,也不声称某个具体绕行方向已被量化验证。
损失函数 / 训练策略¶
监督目标由路点回归和文本交叉熵组成,可可靠记录的组合关系为:
其中 \(\alpha\) 平衡两项任务。原文方法段称路点损失为均方误差,示意图却标为 L1,提取的公式也不完整;因此不能确定其实际采用的范数、平方与归约形式,复现时须核对作者实现。
跟踪数据包括 STT 6913、DT 6685、AT 6524 个回合,场景来自 HM3D 与 MP3D;另外加入 ScanQA、LLaVA-Pretrain、SYNTH-PEDES、RefCOCO、Flickr30k,以及 R2R-CE、RxR-CE、ObjectNav、OVON 等导航来源。SFT 使用 96 张 H20 训练 1 个 epoch,约 15 小时;AdamW 学习率为 \(10^{-5}\),权重衰减为 \(10^{-3}\),采用余弦调度。
RL 使用 8 张 L20,仅训练 LLM LoRA,每 20 次 rollout 更新一次;1 个 epoch 约 7000 次 rollout、约 100 万环境步。AdamW 学习率仍为 \(10^{-5}\),裁剪系数为 0.2,熵系数为 0.01,KL 权重从 0.02 增加到 0.10,自适应目标 KL 为 0.01。这些数字体现的是训练配置,不能把 3B 的较小模型规模直接解释为低训练成本。
实验关键数据¶
主实验¶
STT、DT、AT 分别为单目标跟踪、干扰跟踪和歧义跟踪。SR 为成功率,TR 为跟踪率,CR 为碰撞率;以下数值均为百分比,SR/TR 越高越好,CR 越低越好。论文定义成功跟随需保持 1–3 m 安全距离、目标在前方视野内并避免碰撞;缓存没有完整复述 TR/CR 的统计分母,故不补造更细的计算规则。
| EVT-Bench 任务 | TrackVLA++ 7B:SR / TR / CR | CoMaTrack 3B:SR / TR / CR | SR 变化(百分点) |
|---|---|---|---|
| STT | 90.9 / 82.7 / 1.5 | 92.1 / 90.3 / 0.9 | +1.2 |
| DT | 74.0 / 73.7 / 3.5 | 74.2 / 80.5 / 2.1 | +0.2 |
| AT | 55.9 / 63.8 / 15.1 | 57.5 / 73.4 / 12.0 | +1.6 |
CoMaTrack-Bench 基于 EVT-Bench 的 STT 回合,在起点前方 0.5 m 放置第二台机器人,设置静态障碍、随机干扰和竞争跟踪三种对手。竞争测试对手加载 SFT 策略,不应与训练中持续更新的对手混为一谈。原表 2 标注为 zero-shot,报告 CoMaTrack 的 SR/TR/CR 为 85.0/82.9/5.5,Uni-NaVid 为 42.4/56.5/23.8;但未给出这张汇总表的完整分设置明细与聚合权重。该基准只比较了作者称有公开权重的 Uni-NaVid,不能外推为已经全面击败所有强基线。
消融实验¶
原表 3 在 EVT-Bench STT 上比较同一体系的训练阶段,比跨模型规模的比较更能说明多智能体训练的增益。
| 配置 | SR | TR | CR |
|---|---|---|---|
| 仅 SFT | 88.2 | 85.4 | 3.1 |
| 单智能体 RL | 89.5 | 88.0 | 2.2 |
| 多智能体 RL | 92.1 | 90.3 | 0.9 |
原表 4 进一步检查 RL 设置;变化量均相对于完整模型,单位为百分点。
| 配置 | SR | SR 变化 |
|---|---|---|
| 完整模型,默认 \(K=10\) | 92.1 | 0.0 |
| 分组大小 \(K=5\) | 91.1 | -1.0 |
| 分组大小 \(K=20\) | 92.1 | 0.0 |
| 去掉 KL 约束 | 90.7 | -1.4 |
| 去掉熵奖励 | 88.4 | -3.7 |
| 去掉 KL 约束和 SFT 参照 | 87.6 | -4.5 |
关键发现¶
- 多智能体相对单智能体 RL 的 STT 成功率增加 2.6 个百分点,碰撞率从 2.2% 降到 0.9%;相对仅 SFT,成功率增加 3.9 个百分点。收益不能全部归给“用了 RL”,竞争阶段确有额外增益。
- DT 的 SR 只比 TrackVLA++ 高 0.2 个百分点,但 TR 高 6.8 个百分点;AT 的 TR 高 9.6 个百分点。更持续地跟住目标,比仅看最终成功率更能体现改进方向。
- 去掉熵奖励损失 3.7 个百分点,比单独去掉 KL 的 1.4 更大;把分组从 10 加到 20 没有进一步提升,说明这里不能单靠扩大采样组解决问题。
- 第 5.3 节称静态障碍仅小幅改善、随机干扰略有退化、竞争跟踪最好;结论却概括成三者逐级提升。应以详细实验段为准,且缓存缺少图 4 的可读取坐标值,不为该图编造数值。
亮点与洞察¶
- 对手是一个面向任务的难例生成器。它不是盲目添加噪声,而是追求更有利的位置,迫使跟踪器处理与真正跟随行为相关的遮挡和路径冲突。
- 非对称距离偏好把竞争和安全目标区分开。可以借鉴到共享空间导航:用不同但可解释的资源偏好产生冲突,同时保留主体的安全约束;这种迁移是启发,尚非本文验证结果。
- 只更新上游 LoRA、冻结动作头,展示了通过调整视觉语言条件来改善闭环动作的可能性。但这不是动作头无关紧要的证据,论文没有消融其架构或解冻策略。
局限与展望¶
- 作者承认验证主要集中于跟踪及其竞争版本,尚无大规模指令导航或目标导航实验。多任务 SFT 数据的存在不等于已经证明跨任务收益。
- 对手仍受模拟器先验限制,多智能体非平稳性带来计算成本与潜在不稳定。未来需用更多对手类型、独立随机种子和学习曲线方差验证鲁棒性,而不是只展示一条上升趋势。
- 新基准的强基线覆盖有限;DT 成功率的 0.2 个百分点领先也缺乏置信区间,不能断言统计显著。跨 3B/7B 的结果还混合了训练数据、架构和优化方法差异。
- 真机使用 Unitree GO2 X、四路 RGB,并将视频发往远端 RTX 4090 处理。展示涵盖相似干扰者、障碍和昏暗受限环境,但主要是定性结果,缺少真机成功率、延迟和网络失效分析。
- 连续动作的 GRPO 概率接口、完整奖励权重、路点损失定义及部分测试聚合细节不充分。后续复现应先补齐这些接口,避免把“game-theoretic”误读为已有形式化均衡或收敛保证。
相关工作与启发¶
- 相对 AD-VAT / AD-VAT+:非对称对决已有先例;CoMaTrack 将其接到语言条件 VLA 与连续路点预测,并使用 GRPO 在线优化。创新定位应落在这一适配与验证上,而不是声称首次用对手训练跟踪器。
- 相对 TrackVLA / TrackVLA++:前者强调统一目标识别与动作规划,后者增加空间推理和身份记忆;本文侧重通过交互改变训练分布。这些方向可能互补,但没有组合实验支持可叠加收益。
- 相对单智能体导航 RL:共同点是利用环境反馈减少闭环误差,区别在于对手策略同时改变未来状态分布。可迁移的研究问题是“什么样的对手能提供有效学习压力”,而不只是“多加几个 agent”。
评分¶
- 新颖性: 4/5。语言条件 VLA 与竞争式 GRPO 的结合有价值,但非对称对决的基础思想来自已有研究。
- 实验充分度: 3/5。有标准基准、训练阶段和正则消融,但竞争基线覆盖、统计检验和真机量化仍不足。
- 写作质量: 3/5。总体流程易理解,但奖励与概率接口交代不足,损失描述和随机对手结论存在不一致。
- 价值: 4/5。为具身跟踪提供了可借鉴的动态难例训练范式,但复现成本和部署边界需要认真评估。