跳转至

RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios

会议: ECCV 2026
论文: ECCV 2026 官方页
代码: https://github.com/crazyxiaoxi/RGBT-GroundBench
领域: 目标检测(视觉定位)
关键词: 视觉定位、RGB-Thermal 多模态、基准数据集、跨光谱融合、低光照鲁棒性

一句话总结

本文构建了首个面向复杂真实场景的大规模 RGB-Thermal 视觉定位基准 RGBT-GroundBench(21,535 对 RGB-TIR 图像、38,760 条指代实例、场景/环境/物体三级标注),配套给出支持 RGB-only、TIR-only、RGB+TIR 的统一评测协议并评测 11 个 VG 模型,同时提出参考基线 RGBT-VGNet,在三个子数据集上取得最高 [email protected]

研究背景与动机

视觉定位(visual grounding, VG)要求模型根据一句自然语言描述在图像中框出被指代的目标,是人机交互、具身智能、自动驾驶和辅助技术的基础能力。过去十年它靠 RefCOCO/+/g、ReferIt、Flickr30K 这一批大规模基准和 CLIP、BEiT-3、LLaVA 这类视觉语言预训练范式快速推进,TransVG、QRNet、D-MDETR、FSVG、CLIP-VG、HiVG 一类方法已经把"语言找物体"这件事做得相当准。但这些基准本身有三个共同的盲区:一是场景复杂度有限,图像大多来自干净环境、目标是居中且显著的物体,无法反映真实场景的杂乱与动态;二是目标多样性不足,小而远、被严重遮挡的目标占比极低,使得自动驾驶、具身感知这类安全攸关场景的鲁棒性无从评估;三是模态设计是纯 RGB 的——而真实感知恰恰经常发生在夜间、低照度和雨雾天气里,此时 RGB 传感器给出的视觉线索本身就不可靠。用数字说话:RefCOCO 的小目标占比是 0.0%,RefCOCOg 的弱光样本只占 10.7%、平均 query 长度 8.47 个词,也就是说这些基准几乎测不到"传感器失效时模型还行不行"。

补上这个缺口最直接的模态是热红外(TIR):它对照明不变,在夜间、低照度和恶劣天气下依然能提供稳定的热签名。RGB-Thermal 融合在目标检测和语义分割里已经很成熟,但一旦把语言条件加进来就基本是空白;另一条被尝试过的路线是 RGB-D 定位,可它的表述面向 3D 环境、并不直接适用于 2D 定位,而且深度传感器在弱光与恶劣天气下同样退化,做不了互补模态。真正卡住这个方向的是评测口径:RGBT 感知要么在检测数据集上比 mAP,要么在分割数据集上比 mIoU,没有人能回答"把热红外接进定位模型到底值不值、在哪些工况下值",因为既没有配对的 RGB-TIR 指代标注,也没有一套让 RGB-only / TIR-only / RGB+TIR 在同一预处理、同一训练流程、同一指标下公平对流的方法。

本文的做法是把"数据"和"口径"一起补齐:从 FLIR、M3FD、MFAD 三个已配准的多模态检测数据集出发,经过滤、MLLM 描述生成和分层随机抽检的人工校验,构造出带三级细粒度标注的指代数据,再切出面向难度的 TestA/TestB/TestC 专门子集,用统一协议把 11 个代表性 VG 模型在三模态设置下全跑一遍,从结果里提炼出"场景复杂度决定精度、LoRA 类方法更抗复杂场景、低照度是最大失效模式、MLLM 跨光谱融合不可靠"四条观察,最后顺着这些观察设计一个参考基线 RGBT-VGNet。核心 idea:用空间配对的 RGB-TIR 检测数据 + MLLM 生成并人工校准的指代描述,把视觉定位从 RGB 单模态推进到可跨光谱对照、可按工况切片诊断的评测基准,并用一套可靠性感知的融合基线把"该信谁"这件事显式建模出来。

方法详解

这篇论文的"方法"有两半:前半是把 RGBT 视觉定位这件事变成一个可评测的任务(数据怎么来、标注怎么做、协议怎么定),后半是在这个协议下给出一个可复现的参考基线 RGBT-VGNet。两半是串联的——基准先暴露出"低照度掉点最狠""LoRA 类方法最抗复杂场景"这些现象,基线才针对性地去设计模块。

整体框架

整体流程是"数据 → 标注 → 划分与协议 → 评测 → 基线"这条链。数据侧从 FLIR、M3FD、MFAD 三个配对的多模态检测数据集收集原始图像对,先按三条规则清洗,再用 Qwen3-VL 生成指代描述和属性标注,接着用分层随机抽样做人工校验与修正,最后按来源数据集划分 train/val/test,并从 test 里切出按难度筛选的 TestA/TestB/TestC。协议侧把 TransVG、MMCA、D-MDETR、CLIP-VG、FSVG、AttBalance、HiVG、OneRef 八个模型族接进同一套代码,统一支持 RGB-only、TIR-only、RGB+TIR 三种输入。模型侧则是 RGBT-VGNet:RGB 与 TIR 两路各自过共享权重的 CLIP 视觉编码器,经过非对称模态适配、语言感知的跨模态协同和三先验融合后得到融合视觉 token,与文本 token、可学习的回归 token [Reg] 一起送进 VL-Transformer,由轻量 MLP 头回归出边界框。

规模上,RGBT-GroundBench 含 40K+ 张图像(21,535 对 RGB-TIR)与 38,760 个带指代描述的物体实例,标注分三级:场景级 13 类(城市、路口、住宅区、郊区、高速、校园、桥梁、停车场、乡村、隧道、市场、滨水、工业区),环境级 4 档光照(极弱/弱/正常/强)与 4 类天气(阴/晴/雨/雾),物体级尺度(小/正常)与遮挡(无或部分/严重)。与已有基准相比它的定位差异非常明显:

基准 模态 典型分辨率 #实例 弱光占比 小目标占比 Query 长度
Flickr30K RGB 500×375 276,000 0.9% 0.0% 1.59
ReferIt RGB 480×360 96,654 2.77% 0.0% 3.45
RefCOCO RGB 640×480 50,000 6.1% 0.0% 3.49
RefCOCO+ RGB 640×480 49,856 2.8% 12.0% 3.58
RefCOCOg RGB 640×480 49,822 10.7% 45.4% 8.47
RGBT-GroundBench RGB+TIR 640×512 38,760 43.2% 56.8% 14.24

另外,本文特意强调了目标的"非中心分布":经典 VG 基准里目标多在中部,而 RGBT-GroundBench 的目标位置分布明显更靠边缘,指向的是真实驾驶/巡检场景里目标出现在画面边角的情形。资源侧论文承诺全部公开且没有隐藏测试集或私有服务器:标注与划分随论文发布,数据集托管在 HuggingFace(JiawenXi/RGBT-Ground-Dataset),代码与 checkpoint 在 GitHub,源数据集沿用各自原始许可。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["FLIR / M3FD / MFAD<br/>RGB-TIR 检测数据"] --> B["数据构建管线"]
    B --> C["三级细粒度标注<br/>与难度导向的评测协议"]
    C --> D["非对称模态适配(AMA)"]
    D --> E["语言感知的视觉协同(LAVS)"]
    E --> F["光照-局部-全局三先验融合(TPF)"]
    F --> G["[Reg] 回归框"]

关键设计

1. 数据构建管线:从检测数据到可校验的指代描述

指代数据最难的不是"生成一句描述",而是让这句描述真的唯一指向一个框。本文的管线分采集、过滤、描述生成、人工质控四段。采集直接复用 FLIR、M3FD、MFAD 三个已有的配对检测数据集,它们天然提供空间对齐(或弱对齐)的 RGB-TIR 图像对和物体级框;过滤环节立了三条规则——剔除只占几个像素、连可靠标注都撑不起的极小目标;丢掉 RGB 与 TIR 之间空间错位严重的图像对;滤掉长尾类别(论文点名了 FLIR 里的 dog 和 M3FD 里的 lamp)以避免类别失衡;对保留下来的样本,每对图像每个类别只保留最大的那个实例,保证跨模态一致性和描述的可写性。描述生成用 Qwen3-VL,靠精心设计的任务 prompt 一次产出两类标签:一类是物体指代描述(referring expression),另一类是场景级、环境级、物体级的属性标注。prompt 里覆盖了四个要点——物体外观细节与关键特征、上下文关系、如何区分同类相似物、语言简洁清晰。

生成之后是质控:按场景、光照、天气、物体尺度、遮挡做分层随机抽样,人工检查幻觉、歧义、属性错误、框与描述不匹配以及严重语法问题,用重写/重标或判废来修正。论文把质量指标写得比较实:抽检 15% 的实例,其中 5% 的描述被改过、0.5% 被判废,抽检子集里 95% 的描述正确指向目标;一条标注只有在"描述唯一确定一个目标、且与最终框和跨模态属性一致"时才被接受。除了人工抽检,论文还做了统计层的物理一致性校验:光照-天气交叉统计(见下表)显示各档光照与天气的分布符合现实规律,例如弱光主要落在雨天和阴天、强光几乎全部落在晴天,这种"聪明过头"的统计关系正是 MLLM 生成标签容易出错的地方,能对上说明标注整体没有系统性漂移。

光照 / 天气
极弱光 71 (0.33%) 29 (0.13%) 0 (0.00%) 101 (0.47%)
弱光 2,754 (12.79%) 1,298 (6.03%) 14 (0.07%) 4,704 (21.84%)
正常光 521 (2.42%) 150 (0.70%) 2,191 (10.19%) 6,157 (28.59%)
强光 4 (0.02%) 0 (0.00%) 3,152 (14.64%) 389 (1.81%)

2. 三级细粒度标注与难度导向的评测协议:让"难"变成可切片的维度

仅有多模态图像并不构成一个可诊断的基准,关键是把"难度"拆成可独立统计的开关。本文的标注体系把每个实例同时挂在场景、环境、物体三个轴上,于是同一个模型精度下降可以被追问到具体是哪一档光照、哪一类天气、哪个尺度造成的,而不是只给出一个总体均值。数据按来源划分为 RefFLIR(9,712 实例)、RefM3FD(7,548)、RefMFAD(21,500),总计 38,760,其中 train 26,604、val 2,032、test 10,124。在 test 之上,论文又切了三个专门子集用于诊断:TestA 覆盖正常尺度目标在正常光与强光下的表现,TestB 专挑弱光与极弱光的夜间场景,TestC 专挑小尺度目标。需要说明的是这三个子集是"按条件筛出的子集"而非对 test 的划分——例如 RefFLIR 的 test 有 2,104 个实例,而 TestA/B/C 分别是 837/640/968,三者之和大于 test(这说明子集之间允许重叠,一个弱光小目标可以同时进 TestB 和 TestC),⚠️ 该重叠关系以原文与补充材料为准。评测指标沿用 VG 社区的 [email protected]:预测框与真值框的 IoU 超过 0.5 即算定位正确;论文另外报告了 val/test/TestA/TestB/TestC 各切片的数值,[email protected] 放在补充材料。

评测协议本身也是贡献的一部分。作者把八个模型族——TransVG、MMCA、D-MDETR、CLIP-VG、FSVG、AttBalance、HiVG、OneRef——改造成同一份代码库,统一数据预处理、统一训练流程、统一指标,并且让每个模型都能吃 RGB-only、TIR-only、RGB+TIR 三种输入(多模态版本以 MV- 前缀区分)。这一步看似工程,实际是本文结论可信的前提:只有预处理和训练轮次一致,"LoRA 类方法更鲁棒""多模态平均涨点"这类横向比较才不是被训练策略差异污染的假象。

3. 非对称模态适配(AMA):给 TIR 分支更高的适配容量

CLIP 这类视觉语言预训练模型的表征是偏 RGB 的,直接拿它的视觉编码器去编码热红外图像,中间隔着一道很大的模态鸿沟;已有的 LoRA 微调范式通常对两个模态套同样的配置,等于默认两者与预训练的"距离"相同,忽视了这个偏置。AMA 的做法是在每个视觉编码器层的注意力投影权重上做低秩分解,并给两路不同的适配容量:

\[W_{v}^{l}=W_{E_v}^{l}+\alpha_{v}^{l}A_{v}^{l}B_{v}^{l},\qquad W_{t}^{l}=W_{E_t}^{l}+\alpha_{t}^{l}A_{t}^{l}B_{t}^{l}\]

(两路共享同一个冻结 CLIP 初始化,\(A\)\(B\) 是可学习低秩矩阵、\(\alpha\) 是缩放因子;缓存文本在 PDF 提取时吞掉了加号,此处按 LoRA 标准形式还原,⚠️ 以原文为准。)关键设定是非对称 rank \(r_v \le r_t\):RGB 分支保持较小的秩以尽量保留预训练的视觉语言对齐,TIR 分支用更大的秩换取更强的适配能力,理由是 TIR 与预训练域的偏移更大、需要更多自由度去对齐。此外论文沿用了 HiVG 的层级设计,让低层结构表征与高层语义表征分阶段渐进对齐。这条设计的特别之处在于它是"由观测反推"的:基准评测先发现 LoRA 类方法(HiVG)在复杂场景里明显更稳,作者才把它作为基线的主干适配方式,而不是先有架构再有结论。

4. 语言感知的视觉协同(LAVS):用文本当 query 去挑两路特征

RGBT 定位与 RGBT 检测的差别在于"要找什么"是语言给的,因此两路视觉特征该在哪些区域、以多大权重被融合,本质上应由文本语义来定,而不是让两路特征自己盲目对齐。LAVS 把文本 embedding 当作 query 去分别检索 RGB 与 TIR:文本特征出 \(Q_s\),每一路的视觉特征出 \(K\)\(V\),先算出语言引导的跨模态注意力图,再用它做残差更新:

\[A_{\text{attn}_v}^{l}=\sigma\!\left(\frac{Q_s^{l}(K_v^{l})^{\top}}{\sqrt{d}}\right),\qquad F_v^{l}=f_v^{l}+\left(A_{\text{attn}_v}^{l}\right)^{\top}\left(A_{\text{attn}_v}^{l}V_v^{l}\right)\]

TIR 一路同理得到 \(A_{\text{attn}_t}^{l}\)\(F_t^{l}\)。右乘 \(V\) 再左乘注意力图转置的写法不只是形式上的讲究——它保证更新后的特征维度与原始 patch 特征一致,可以直接接后面的融合模块。两路各自被语言"洗"过一遍之后,再通过一次模态间 cross-attention 交换信息,并各自过线性投影 \(P_v\)\(P_t\) 映射到统一的定位空间。这样做的效果是文本在最前面就决定了"值得融合的是哪些区域",后续融合拿到的输入本身已经是语义对齐的,而不是把两路原始特征硬拼。

5. 光照-局部-全局三先验融合(TPF):按可靠性动态决定信谁

低照度下 RGB 退化而 TIR 依然可用,这是引入第二个模态的全部理由;但"什么时候该信 TIR"如果只靠一个可学习的门控,在小规模数据上很容易学歪。TPF 选择把可靠性写成显式的先验。它先把 RGB 的每个 patch 转灰度、池化到 patch 网格并归一化到 \([0,1]\) 得到照度强度 \(i_p\),再用它到"最优照度点 0.5"的距离定义照度质量:

\[q_p = 1-|2i_p-1|\]

也就是说亮度越接近中灰、RGB 越可信。接着算局部-全局语义先验:把两路归一化后的 patch token 及其逐元素差送进一个小 MLP 再过 sigmoid,得到逐 patch 的先验 \(g_p\);把两路全局池化特征做同样处理、再跨通道取均值,得到全图共享的先验 \(b\)\(b\) 广播到所有 patch)。三项先验以 0.5 为中性点等权相乘再 sigmoid,得到 RGB 的可靠性权重 \(w_p\),最终融合 token 为:

\[w_p=\sigma\big((i_p-0.5)\,q_p\,(g_p-0.5)\,(b-0.5)\big),\qquad z_p^{l}=w_p\,t_{v,p}^{l}+(1-w_p)\,t_{t,p}^{l}+g^{\mathrm{ch}}\odot\left(t_{v,p}^{l}-t_{t,p}^{l}\right)\]

这里 \(g^{\mathrm{ch}}\) 是语义 MLP 在通道维上的门控。整个式子的可读性很强:\(w_p\) 接近 1 说明该 patch 的 RGB 亮度和语义都可信、以 RGB 为主,接近 0 则在弱光或 RGB 语义可疑时切到 TIR;最后一项再加一个由语义门控控制的差异项,把两路的互补信息补回来。作者自己也交代了这个模块的定位——它是个轻量启发式融合,用来在受控协议下把"跨光谱互补"这条观察具体化,而不是要单独建模光照;等权相乘、中性点取 0.5 的写法也避免了引入额外超参。

损失函数 / 训练策略

训练统一在 224×224 输入、相同数据增强策略下进行,batch size 8,AdamW,学习率 \(1\times10^{-3}\),训练 120 个 epoch,硬件为 RTX 4090。所有 CLIP 编码器(视觉与文本)保持冻结以保住预训练的视觉语言对齐,只训练 LoRA 分支、LAVS/TPF 模块、投影层与回归头;被改造的基线方法尽量沿用各自原实现的默认超参。回归目标由 [Reg] token 经轻量 MLP 输出 \(\hat{B}=(\hat{x},\hat{y},\hat{w},\hat{h})\);正文没有给出具体的框回归损失形式(按统一框架的常见做法应为 L1/GIoU 类组合),⚠️ 以原文与开源代码为准。

实验关键数据

主实验

三种输入设置下的主结果([email protected],%,test 划分)如下,三种模态分别是零样本迁移、单模态域内训练和多模态域内训练:

方法 输入模态 RefFLIR test RefM3FD test RefMFAD test
HiVG-L(零样本) RGB 44.46 53.10 40.42
HiVG-L(零样本) TIR 23.80 28.89 23.11
HiVG-B(域内训练) RGB 66.65 68.15 64.02
HiVG-B(域内训练) TIR 64.07 61.77 62.63
MV-TransVG RGB+TIR 46.06 48.04 53.84
MV-D-MDETR RGB+TIR 47.42 46.50 57.31
MV-HiVG-B RGB+TIR 69.20 72.35 67.04
MV-HiVG-L RGB+TIR 72.50 68.67 61.31
MV-OneRef-L RGB+TIR 60.89 69.70 62.73
RGBT-VGNet(本文) RGB+TIR 72.43 74.89 67.58

在三个难度子集上,RGBT-VGNet 同样处于最高档:TestA(正常/强光 + 正常尺度)为 89.64/94.16/91.29,TestB(弱光/极弱光夜间)为 69.22/80.75/64.80,TestC(小目标)为 52.53/55.52/51.18(顺序为 RefFLIR/RefM3FD/RefMFAD);论文把这一组概括为"TestA/TestB/TestC 上 [email protected] 分别超过 91%、64%、49%"。

消融实验

三个组件的逐步叠加([email protected],%):

AMA LAVS TPF RefFLIR val / test / testB / testC RefM3FD val / test / testB / testC RefMFAD val / test / testB / testC
55.42 / 46.19 / 41.56 / 22.81 54.16 / 57.57 / 65.63 / 34.46 53.50 / 54.63 / 51.91 / 36.62
74.01 / 71.17 / 66.25 / 49.69 70.83 / 72.53 / 80.16 / 50.43 68.07 / 65.27 / 62.19 / 47.96
73.68 / 72.65 / 67.19 / 52.23 73.21 / 74.34 / 81.93 / 53.63 67.83 / 66.62 / 64.07 / 49.76
75.33 / 72.43 / 69.22 / 52.53 73.21 / 74.89 / 80.75 / 55.52 68.31 / 67.58 / 64.80 / 51.18

在同一协议下把 TPF 换成其他 RGBT 融合策略:

融合方法 出处 RefFLIR val RefM3FD val RefMFAD val RefFLIR testC RefM3FD testC RefMFAD testC
Naive Add - 73.68 70.24 67.91 46.86 51.46 49.41
CMX TITS'24 64.31 60.71 53.74 38.87 38.15 32.33
LIF ICCV'25 74.34 69.64 67.59 49.70 51.30 49.96
TPF(本文) - 75.33 73.21 68.31 52.53 55.52 51.18

关键发现

  • 模态适配是跨光谱定位的门槛,不是可选项。零样本迁移时所有模型都塌得很惨,论文报告相对域内训练平均低约 30%(RGB)与 50%(TIR);而消融里光加上 AMA 一步,RefFLIR test 就从 46.19 涨到 71.17(+24.98),是全部组件里单步增益最大的一项。这说明预训练 CLIP 的表征偏 RGB,不先把 TIR 分支对齐过来,后面的融合模块拿到的输入本身就是错位的。
  • LAVS 与 TPF 的价值集中在"难"的格子上,且会牺牲一点容易的格子。加上 LAVS 后 RefFLIR testB 从 66.25 升到 67.19、testC 从 49.69 升到 52.23,但 val 从 74.01 微降到 73.68;再加 TPF 后 RefM3FD testC 从 53.63 升到 55.52、RefFLIR testB 升到 69.22,可 RefFLIR testA 从 91.31 回落到 89.64。这种"难样本换易样本"的取舍与 TPF 按可靠性调权重的设计是一致的——它本来就是为了救弱光和小目标。
  • 多模态确实涨点,但论文"平均约 10%"的说法需要谨慎对待。从表里能直接核对的 HiVG/OneRef 行看,RGB+TIR 相比单模态 RGB 的涨幅多落在 1-4 个点(如 RefM3FD test 上 HiVG-B 68.15→72.35、RefMFAD test 上 HiVG-B 64.02→67.04);"约 10%"更像是对全部模型与全部子集取平均的口径,⚠️ 具体统计范围以原文和补充材料为准。可以确认的是 testB/testC 上的增益最明显,也就是弱光与小目标这两个工况最吃多模态。
  • 融合策略的对比说明"显式先验"比"更复杂的融合网络"更划算。代表性 RGBT 融合基线 CMX 在三个子数据集上全面落后(RefFLIR val 只有 64.31,比 TPF 低 11 个点),而结构更简单的 Naive Add 和 LIF 虽在个别格子(如 LIF 的 RefFLIR testA 90.00)反超 TPF,跨数据集的稳定性明显不如 TPF。
  • 场景复杂度与定位精度强相关,LoRA 类方法更抗复杂场景。模型在 TestA 这类光照好、尺度正常的格子里普遍很稳,一到杂乱场景、有干扰物、遮挡或很小的偏心目标就明显掉点;而使用 LoRA 适配的 HiVG 系列在不同场景间的波动明显小于全量微调或非 LoRA 方法。作者由此推测,参数高效适配在域偏移下比架构设计更能稳住鲁棒性。
  • 低照度是被长期忽视的最大失效模式。TestB 是所有模型掉点最狠的一档,热红外线索能缓解但救不回来,小目标叠加恶劣天气时尤其困难——这正是本文要把它单列成子集的理由。
  • MLLM 还没准备好做跨光谱定位。论文额外评测了 GLM-4.6V、Kimi-K2.5、Qwen3.5-Plus 三个多模态大模型,在 224×224 与原分辨率两种设置下,结论是"简单地把热红外图加进去并不能稳定提升定位精度",而且性能对输入分辨率非常敏感;细节数据放在补充材料。

亮点与洞察

  • 把质检指标公开写出来,比只说"高质量"可信得多。"抽检 15%、改写 5%、判废 0.5%、抽检子集 95% 正确"这一组数字配上光照-天气交叉统计的物理一致性校验,构成了两层验证:人工保证单条描述不歧义,统计保证整体分布不漂移。这套"LLM 生成 + 分层抽检 + 统计校验"的标注范式可以直接搬到任何用 MLLM 造数据的场景。
  • 把"难"拆成可切片的维度而不是一句形容词。三级标注让"低照度掉点"这种结论可以落到具体格子(TestB),而不是被总体均值掩盖;TestA/B/C 的划分逻辑(好光照正常尺度 / 夜间弱光 / 小目标)是一套几乎可以直接套用到其他鲁棒性评测上的模板。
  • 统一协议是 benchmark 论文最容易被低估的贡献。把八个模型族改成同一份代码、同一套训练与指标、还能自由切换三种输入模态,才让"多模态涨点""LoRA 更鲁棒"这类横向结论站得住;否则读者无从判断差异来自方法还是训练细节。
  • TPF 的可靠性权重是一个很轻的可复用 trick。它把"这个 patch 的 RGB 该不该信"写成"照度质量 × 语义先验 × 全局先验"的等权乘积再过 sigmoid,中性点固定在 0.5、不引入任何额外超参;这种"先归一化到 [0,1]、以 0.5 为中性、乘法链融合"的写法可以原样迁移到任意双模态/双分支融合场景。
  • benchmark 观察直接变成 baseline 设计,形成闭环。AMA 来自"LoRA 类方法更鲁棒"的观察,TPF 来自"低照度掉点最狠"的观察,LAVS 则是为了给 TPF 提供语义对齐的输入——模块不是拍脑袋堆的,每个都能追到一条实验结论,这种写法本身值得学习。
  • 诚实地暴露了取舍。消融表里 TPF 会让 TestA 小幅回落的细节没有被藏起来,反而与"可靠性感知融合偏向困难工况"的叙事自洽。

局限与展望

  • 数据来源只有 FLIR、M3FD、MFAD 三个检测数据集,类别以行人和车辆为主,场景与语义多样性受限;描述由 MLLM 生成,人工只抽检了 15%,剩下 85% 的质量靠统计校验间接背书。
  • RGB 与 TIR 被假定为空间对齐或弱对齐,真实部署中未配准、模态缺失(只有 RGB 或只有 TIR)的情形没有覆盖,而后者恰恰是工程落地时最常见的问题。
  • TPF 的先验设计偏手工:三项先验都归一化到 \([0,1]\)、以 0.5 为中性点、等权相乘,这个"中性点"假设在不同传感器、不同曝光策略下未必成立,也没有看到对权重形式的敏感性分析。
  • 主实验的细粒度结论大量依赖补充材料:TestA/B/C 之外的场景、天气、遮挡切片,以及 [email protected] 和 MLLM 的完整数据都不在正文,正文只给了提炼后的四条结论,读者难以自行复核。
  • 论文正文没有交代框回归的具体损失形式和更多训练细节(如 LoRA rank 的具体取值、\(\alpha\) 的设定),复现需要依赖开源代码。
  • 可以推进的方向:把可靠性先验从手工乘积换成可学习或经过校准的门控;在协议里加入模态缺失与未配准的鲁棒性设定;把 MLLM 的定位头(如注意力转 mask 的做法)纳入同一协议对比;扩充到更多类别与更细的天气/遮挡切片。

相关工作与启发

  • vs RefCOCO/+/g、ReferIt、Flickr30K:这些是 RGB 单模态基准,图像来自干净环境、目标居中显著,小目标占比为 0 或很低(RefCOCO 0.0%、RefCOCO+ 12.0%),弱光样本最高也只有 RefCOCOg 的 10.7%。本文在模态(RGB+TIR)、工况占比(弱光 43.2%、小目标 56.8%)和语言复杂度(平均 14.24 词,远高于 RefCOCOg 的 8.47)上同时拉高,代价是实例规模只有 RefCOCO 量级的 3/4 左右。
  • vs RGB-D 视觉定位(Refer-it-in-RGBD、Cross3DVG、Unit3D):那条路线把定位表述扩展到 3D,任务形式不同、无法直接迁移到 2D 框回归;更关键的是深度传感器在弱光与恶劣天气下同样退化,做不了"照明不变"的互补模态。本文选热红外的理由正在于此。
  • vs RGBT 检测与分割(C2Former、D3T、UniRGB-IR、ABMDRNet 等):这些工作已经在融合架构上做了大量探索,但输出是无语言的框或掩码,模型不需要理解"找哪一个"。本文把语言条件引入同一套双模态输入,评测的失败模式也随之不同——不再只是漏检,而是"框错了对象"。
  • vs HiVG / OneRef / CLIP-VG / TransVG 等被评测的 VG 模型:它们在这篇论文里既是对比对象也是组件来源。HiVG 的层级 LoRA 微调思想被 AMA 借用,但本文把它改成了 RGB/TIR 非对称 rank 的版本;OneRef、CLIP-VG 等在多模态改造后(MV- 版本)成为 RGBT-VGNet 的直接竞争者,但整体仍低于本文基线。
  • 启发:这套"先建基准把失效模式测出来、再顺着失效模式设计模块、最后把模块放回同一协议里验证"的研究路径,对其他跨模态任务(如 RGB-事件相机、RGB-深度、多光谱)同样适用,尤其是当某个模态的增益一直停留在 anecdote 层面时。

评分

  • 新颖性: ⭐⭐⭐⭐ 首个 RGBT 视觉定位基准,三级细粒度标注加统一三模态协议是这个方向缺的基础设施;方法侧(AMA/LAVS/TPF)是组合式创新,单看模块不算突破。
  • 实验充分度: ⭐⭐⭐⭐ 11 个模型 × 3 种模态 × 3 个子数据集 × 5 个划分,消融与融合策略对比齐全,还给了零样本/域内/多模态三档;扣分在于 MLLM 评测、天气与场景细分、[email protected] 都推到了补充材料,正文无法自证。
  • 写作质量: ⭐⭐⭐ 结构与图表组织清楚,观察与设计的对应关系讲得明白;但关键公式在缓存文本中存在提取损坏,且大量结论依赖补充材料,正文留下了需要读者自行拼合的空档。
  • 价值: ⭐⭐⭐⭐⭐ 数据、标注、划分、代码、checkpoint 和评测脚本全部公开且无隐藏测试集,配套的鲁棒性诊断切片(TestA/B/C)可被后续工作直接复用,对整个跨光谱定位方向有直接的推动。