ProCompNav: Proactive Instance Navigation with Comparative Judgment for Ambiguous User Queries¶
会议: NeurIPS2026 Oral
arXiv: 2605.06223
代码: https://github.com/tree-jhk/procompnav
领域: 机器人/具身智能
关键词: 实例导航、歧义消解、比较判断、二元反馈、多视角记忆
一句话总结¶
ProCompNav 先在未知环境中收集同类物体,再递归寻找能区分候选的属性并向用户提是非问题,在模拟 CoIN-Bench 的三个划分上将成功率提升至 23.7%、28.1%、17.0%,同时显著缩短用户模拟器的回答。
研究背景与动机¶
实例导航不是找到任意一把椅子,而是找到用户心里那把椅子。既有方法常假设用户一开始就提供充分详细的描述;真实请求却可能只有“找到柜子”。AIUTA 允许导航中追问,但主要逐个判断眼前候选是否匹配已累积的描述。如果错误柜子也有相同颜色、把手和材质,更多描述不一定提供真正区分它与目标的证据,机器人仍可能过早停止。
先收集多个候选再匹配,可以减少被第一个干扰物吸引的问题,却不自动解决歧义。论文实现的 Pooled Independent Matching 对候选依次提开放问题,最后统一打分;这样的信息累积仍可能围绕共有属性打转,而且要求用户不断描述。这里真正缺少的不是更多目标细节,而是根据已经见到的候选,知道哪些细节值得问。问题还不能默认把图像展示给用户:CoIN 任务只允许语言交互,用户必须凭自己对目标的认识回答。
因此,ProCompNav 把决策从“这个物体像不像目标”改为“当前候选在哪个属性上不同”。它不要求每轮找到只属于目标的独有属性,只需找到能把当前候选分成两个非空组的属性值,一次回答即可排除一组。核心 idea:先形成可比较的候选池,再围绕候选间的属性差异递归提二元问题,用短反馈逐步隔离目标,而不是逐个候选索取完整描述。
方法详解¶
整体框架¶
输入是一个开放词汇类别和探索过程中获得的 RGB-D 观测,输出是选定实例及到达它附近后的停止动作。机器人只具有 30° 视野,可前进、左转、右转、停止,也可提出语言问题;环境中同类实例数量和位置都未知。完整系统先做“多视角候选池”,再循环执行“相似核心选择”“判别属性与组修正”“二元剪枝与重新探索”,后三步组成递归比较判断(Recursive Comparative Judgment,RCJ)。
候选池默认达到 5 个候选才开始比较;CoIN 到第 400 步仍未达到门槛时也启动比较,避免探索占满 500 步预算。每轮问题的依据是当前池内候选的差异,而不是固定的颜色或材质问卷。回答保留相容组,剩一个候选时转向该实例;若反馈表明池内没有合适候选,则回到探索。这个回环能处理部分“目标尚未进入池”的情况,但不等于能恢复已被错误回答剪掉的目标。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["类别请求 + RGB-D"] --> B["多视角候选池"]
B --> C["相似核心选择"]
C --> D["判别属性与组修正"]
D --> E["二元剪枝与重新探索"]
E -->|至少两个候选| C
E -->|否且余组为空:补一个候选| B
E -->|一个候选| F["导航到实例并停止"]
U["用户回答"] --> E
图中是 CoIN 的推理数据流,不是训练网络;用户反馈用于在线剪枝,不用于更新模型参数。TextNav 不允许提问,其目标描述替代用户反馈,另有最终候选核验,不能把这张图直接理解为 TextNav 的交互过程。
关键设计¶
1. 多视角候选池:先收集可比较实例,避免第一次遇见就下结论
系统沿用 VLFM 作为探索骨干,但不把首次检测到类别物体视为结束。每次检测区域反投影成 3D 点云,并与已有候选的累积点云比较。附录 B 的重叠计算以 0.03 m 为邻域半径,分别计算两个方向的点邻近比例,再取两者最大值;最大重叠达到 0.3 就归到已有实例,否则建立新候选。这是基于几何重叠的关联规则,不是准确实例身份的保证。
每个候选保存多个 RGB 视角,用 DINOv2 嵌入做 KMeans 聚类,默认取 6 个簇的中心邻近视角拼成 collage,再由多模态模型生成统一描述。描述同时覆盖外观与附近物体、空间关系,使“旁边有红盒子”这类上下文也成为比较证据。多视角的目的不只是增加图像数,而是减少一个角度看不到关键上下文造成的属性缺失;但检测关联错误仍可能把一个真实物体拆成几个候选。
探索还加入两项辅助启发式:近期位置停滞分数连续 5 步达到 0.9 时,临时屏蔽同网格的前沿;周围开放度至少 0.1 且离上次旋转点至少 1.0 m 时原地转 360°。它们分别应对局部循环和窄视野漏检,不是 RCJ 的新推理阶段,也没有提供穷尽环境的保证。
2. 相似核心选择:用两个相像的候选锚定可言说的差异
如果候选大于两个,直接让模型总结所有候选之间的差异,容易得到杂乱、难以形成问题的属性。RCJ 先把当前候选分成核心组与余组:候选间相似度是归一化文本嵌入余弦相似度和视觉嵌入余弦相似度的平均。随后反复删除与其他候选总相似度最低的实例,直到剩两个,它们就是核心组;被删除的候选构成余组。
相似核心通常有共同属性,便于下一步从它们的描述提炼一个共享属性,再检验这个属性是否区分余组。这里的贪心剥离只保证沿剥离路径组内平均相似度不下降,不能读作找到了全局最相似的二元组,也不是最大信息增益或严格平衡划分。当仅剩两个候选时,系统跳过剥离,把两者分别作为单元素组,并选择蕴含分数差异最大的属性。
3. 判别属性与组修正:把模型提出的差异变成可验证的划分
大语言模型从核心组描述提取共享的属性值对,例如“附近有红盒子”,而不是只提“颜色”这种属性名。自然语言推断(Natural Language Inference,NLI)模型以候选描述为前提、以“该实例拥有此属性”为假设,对每个候选和每个属性计算支持程度。论文附录 C 将蕴含、未知、矛盾三个 logits 转为以下分数;它衡量的是描述对属性的支持,不是图像级真实概率,也不能据此断言做过经验概率校准。
RCJ 选择核心组平均支持度减去余组平均支持度最大的属性。这样既要求属性在核心组内共享,又要求它相对余组有区分力;LLM 负责提出自然语言假设,NLI 负责一致地比较这些假设。它比单次提示直接要求 LLM 完成选属性和分组更可控,但如果候选描述已经漏掉或写错上下文,NLI 仍会验证错误的文字证据。
初始核心组并不等于所有拥有该属性的候选,因此还要扫描余组,把属性支持度至少达到 \(\tau=0.9\) 的候选移入核心组。这一步避免用户回答“是”时误删同样具有属性、但不在相似核心内的目标。如果修正后任一组为空,按分数差的降序尝试下一个属性;如果始终不能得到两个非空组,则仍询问最后一个属性。因此“每问必定排除候选”只对有效划分成立,不是整个系统无条件满足的性质。
4. 二元剪枝与重新探索:让回答决定保留哪组,并识别池缺失的信号
对选出的属性,系统只问目标是否具有它;回答“是”保留核心组,回答“否”保留余组。只要剩余候选至少两个,就重新做核心选择和属性比较;剩一个时确定目标。问题是相对于当前候选池构造的,所以不需要某个属性一次性唯一标识目标,连续几轮局部区别即可完成消歧。收集候选后集中提问还减少了探索期间反复打断用户的机会。
若没有有效划分,“是”可能让候选池不变;若用户回答“否”且余组为空,系统把它解释为池内可能尚无目标,继续探索补一个候选,再用先前回答得到的目标事实预剪枝,随后恢复 RCJ。重新探索是池缺失时的补救,不是通用回滚:一旦错误二元反馈把真正目标剪掉,当前方法没有恢复机制。噪声实验中的“不知道”则跳过该属性、尝试排名靠后的属性,与“否”不是同一种反馈。
非交互 TextNav 使用同样的收集和比较思想,但开始就从详细目标描述提取固定属性集,后续总保留属性支持的核心组,不再询问用户。当只剩一个候选,或余组为空时,文本 LLM 对候选描述和完整目标描述做接受/拒绝核验;多候选且余组为空时,核验属性支持度最高者。拒绝后重新探索。因此 TextNav 的优势是详细描述条件下的候选相对比较,不是对歧义请求进行真实用户澄清的证据。
一个完整示例¶
论文图 5 的请求是“找到斗柜”。机器人先收集多个斗柜,而不是因为一个斗柜的颜色和把手匹配就停止。第一轮选出“附近有红盒子”,用户回答“是”,一次排除三个干扰物;第二轮再问“上面是否有电视”,从剩余候选中隔离目标。
这个例子关键在于两轮问题各自只要求局部区分。红盒子不需要是目标独有的标志,电视也不需要预先出现在用户的初始请求里;只有比较过候选,系统才知道这两个上下文属性值得问。若第二轮涉及的电视只在某个侧视角中可见,多视角描述是否保留该证据就会影响后续剪枝。
损失函数 / 训练策略¶
这是零样本、无需任务专门训练的推理框架,没有新增导航损失、策略训练或用户反馈微调。文本和多模态模块共用 Qwen3-VL-8B,NLI 使用 DeBERTa-v3-large。CoIN 最大 500 步、提问预算 4;TextNav 最大 1000 步,最晚第 600 步开始比较。两任务都以在目标 1 m 内执行停止作为成功条件。
实验主结果依赖这些预训练模型、探索骨干和规则共同工作,不能把零样本理解为没有外部模型或计算成本。附录 M 在两张 24 GB RTX 3090 上测量每回合成本;模型推理和探索的耗时都包含在系统开销中。
实验关键数据¶
主实验¶
CoIN-Bench 初始输入只有类别,用户模拟器可看到目标图像,机器人仍只能收到语言回答。SR 是成功回合比例;SPL 将成功按实际路径与最短路径的比值加权,衡量导航效率。RL 是每回合模拟用户回答的总 token 数,NQ 是发生交互回合的平均问题数,不能把 RL 当成人类字数或 NQ 当作所有回合的无条件均值。
下表的 SR/SPL 单位为百分比,单元格顺序为 SR / SPL / RL / NQ。SR、SPL 来自表 2,RL、NQ 来自表 1;AIUTA* 是使用相同语言模型的复现,Pooled 是共享候选池构造的独立匹配基线。
| 方法 | Val Seen | Val Seen Synonyms | Val Unseen |
|---|---|---|---|
| AIUTA* | 10.5 / 4.5 / 109.5 / 1.2 | 15.3 / 8.4 / 129.2 / 1.2 | 8.9 / 4.0 / 122.8 / 1.3 |
| Pooled Independent Matching | 17.5 / 5.1 / 460.2 / 3.6 | 22.0 / 8.1 / 519.2 / 3.7 | 13.3 / 5.1 / 467.7 / 3.4 |
| ProCompNav | 23.7 / 7.0 / 4.2 / 2.2 | 28.1 / 8.5 / 4.3 / 2.2 | 17.0 / 6.2 / 4.2 / 2.3 |
Val Seen 相对 AIUTA 增加 13.2 个 SR 百分点,论文报告约 126% 相对提升;相对共享候选池的 Pooled 增加 6.2 个百分点。ProCompNav 的问题数比 Pooled 少,但比 AIUTA 多,因此收益不是“所有基线上问题都更少”,而是更短回答带来的低表达负担和更可靠消歧。详细描述输入的非交互基线与类别输入的交互方法条件不同,不能只按表 2 排名忽略这一差别。
TextNav 表 3 中,ProCompNav 的 SR/SPL 为 28.5/6.9,Context-Nav 为 26.2/9.1,UniGoal 为 20.2/11.4,3D-Mem* 为 14.1/9.6。本文 SR 最高,但 SPL 低于这些三者;相对 Context-Nav 的 SR 增益为 2.3 个百分点、约 8.8%,不能概括为导航效率全面更好。
消融实验¶
以下为表 5 的 CoIN-Bench Val Seen 消融,SR/SPL 单位为百分比。
| 配置 | SR | SPL | RL | NQ |
|---|---|---|---|---|
| 完整模型 | 23.7 | 7.0 | 4.2 | 2.2 |
| 无多视角聚合 | 23.1 | 6.3 | 4.2 | 2.1 |
| 仅 LLM 选属性,无 NLI | 20.6 | 5.5 | 4.2 | 2.2 |
| 用 KMeans 替代相似核心选择 | 20.5 | 6.5 | 4.1 | 2.2 |
| 无组修正 | 21.8 | 6.0 | 4.2 | 2.1 |
| 单次提示选属性并分组 | 20.9 | 5.9 | 4.7 | 2.5 |
核心选择和 NLI 的移除分别降低 3.2、3.1 个 SR 百分点,是该表较大的下降;组修正降低 1.9 个百分点。多视角消融只下降 0.6 个百分点,不宜据此把多视角描述说成主实验增益的唯一来源。附录 I 将池门槛从 4、5 调至 6 时,SR 为 19.4、23.7、25.5,SPL 为 7.1、7.0、6.1,平均步数为 212.7、257.0、299.3,显示更多候选以探索成本换成功率。
表 6 与附录 O 的两项人类实验均为 20 人的被试内网页研究,不是人在真实机器人导航回合中的端到端评测。
| 研究与条件 | 每题响应时间中位数 | 偏好人数 |
|---|---|---|
| 研究 1:开放问题 | 9.25 s | 0/20 |
| 研究 1:二元问题 | 2.69 s | 20/20 |
| 研究 2:交错提问 | 6.27 s | 6/20 |
| 研究 2:集中提问 | 5.28 s | 14/20 |
研究 1 每人回答 13 个二元问题和 27 个开放问题,两组都集中呈现;其结果同时涉及问题内容与数量差异,不能视作只改变回答格式的严格控制实验。研究 2 两组都为三个二元问题,通过不同等待间隔模拟交错或集中呈现,不要求参与者导航。集中提问的响应时间差异不显著(\(p=0.55\)),偏好人数的单侧精确二项检验为 \(p=0.058\);70% 偏好只是描述性结果,不能写成显著优于交错提问。
关键发现¶
- 反馈错误比“不知道”更危险。表 4 在 20% Flip 下 SR 从 23.7 降至 17.1;20% IDK 下为 21.2。二元剪枝效率高,但错误回答会直接删除目标所在组。
- 真实开放回答远短于模拟器:韩语人类回答中 89.1% 不超过三个空格分词的词,中位数为一个词、三个字符,不能与模拟器 token 级 RL 直接比较。
- 失败主要不在最后一轮比较。634 次失败中,436 次目标未进入池、160 次目标后来被剪掉、38 次最终导航失败;160 次剪枝失败中,候选拆分和描述属性错位共占 72.5%。
- 原文数值与编号需保留边界:表 1 的 Val Seen AIUTA*/Pooled RL 为 109.5/460.2、NQ 为 1.2/3.6,表 4 的 Original 列则为 113.7/439.7、1.3/4.0,原文未解释差异,本文不合并。正文及附录 P 将失败归因表指为表 4,当前版本实际是表 7。
亮点与洞察¶
- 消歧问题的价值取决于候选间的差异,而非目标描述的长度。把“收集事实”改成“排除一组候选”,可以迁移到交互式检索或机器人抓取中的实例选择,但必须先保证候选覆盖目标。
- LLM 提假设、NLI 做一致性打分,使自然语言属性可以参与结构化筛选。组修正尤其重要,因为几何或嵌入相似性划分与属性是否成立并不天然一致。
- 用户负担不仅包括回答长度,也包括被打断的时机。论文把集中提问与二元格式分开研究,但当前证据对二元格式更强,对集中呈现仍应保持统计上的克制。
局限与展望¶
- 仅在模拟导航环境中评测,没有真实机器人部署证据;网页人类研究也不能替代真实环境中移动、观察、交互的联合验证。
- 候选召回和跨视角合并是主要瓶颈。附录 N 在池含目标的 379 回合中,仅 50.9% 将目标视角合并为单一候选,49.1% 分散到多个候选,直接影响描述完整性与问题数量。
- 当前不能恢复被错误反馈删除的目标,可研究软保留、回答置信度、矛盾检测和回滚候选历史;这些是后续方向,不是本文已有机制。
- 固定 5 个候选的门槛对同类物体很少的环境可能浪费探索,应按覆盖度或候选不确定性动态触发比较。
- 失败归因是借助额外目标身份和事后 VLM 标注得到的诊断,不是因果分析;每回合只赋一个主因,属性不可见与无法判断还可能被混为一类,不能由一次 NLI 误路由推断其通常无误。
相关工作与启发¶
- vs AIUTA:AIUTA 边探索边询问开放问题,并独立匹配候选;本文先收集、再通过候选对比构造二元问题。它减少表达负担和过早承诺,但需要等待候选池形成,且错误二元回答的后果更直接。
- vs Pooled Independent Matching:两者共享池构造,后者先逐个候选问问题,再根据完整事实集统一评分。这个控制更能隔离 RCJ 的作用,说明只有“先收集”还不足以获得最强消歧结果。
- vs Context-Nav / UniGoal:这些方法用空间谓词或图结构评分匹配详细目标描述;本文选择相对于当前候选有区分力的属性。TextNav 结果支持这种比较策略,但较低 SPL 提醒它不是免费提升。
- vs 3D-Mem:3D-Mem 建立探索视觉记忆,并用 VLM 选择目标;本文强调显式属性差异与二元筛除。表 2/3 将 3D-Mem* 的 Judge 标为 Comp,不能把“缺少显式判别属性抽取”误写为完全不比较候选。
评分¶
- 新颖性: 4/5 — 将候选相对比较、属性核验与二元剪枝结合,问题设计明确针对同类干扰物。
- 实验充分度: 4/5 — 有双任务、消融、反馈噪声和人类研究,但无实机验证,部分交互结论受模拟用户与统计边界限制。
- 写作质量: 4/5 — 机制和失败分析较清楚,但存在表号误引及跨表基线数字差异。
- 价值: 4/5 — 为低表达负担的实例导航提供可复用思路,实际价值仍依赖候选召回、描述忠实性及错误反馈恢复。