RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios¶
会议: ECCV 2026
论文: ECCV 2026 官方页
代码: https://github.com/crazyxiaoxi/RGBT-GroundBench
领域: 目标检测(视觉定位)
关键词: 视觉定位、RGB-Thermal 多模态、基准数据集、跨光谱融合、低光照鲁棒性
一句话总结¶
本文构建了首个面向复杂真实场景的大规模 RGB-Thermal 视觉定位基准 RGBT-GroundBench(21,535 对 RGB-TIR 图像、38,760 条指代实例、场景/环境/物体三级标注),配套给出支持 RGB-only、TIR-only、RGB+TIR 的统一评测协议并评测 11 个 VG 模型,同时提出参考基线 RGBT-VGNet,在三个子数据集上取得最高 [email protected]。
研究背景与动机¶
视觉定位(visual grounding, VG)要求模型根据一句自然语言描述在图像中框出被指代的目标,是人机交互、具身智能、自动驾驶和辅助技术的基础能力。过去十年它靠 RefCOCO/+/g、ReferIt、Flickr30K 这一批大规模基准和 CLIP、BEiT-3、LLaVA 这类视觉语言预训练范式快速推进,TransVG、QRNet、D-MDETR、FSVG、CLIP-VG、HiVG 一类方法已经把"语言找物体"这件事做得相当准。但这些基准本身有三个共同的盲区:一是场景复杂度有限,图像大多来自干净环境、目标是居中且显著的物体,无法反映真实场景的杂乱与动态;二是目标多样性不足,小而远、被严重遮挡的目标占比极低,使得自动驾驶、具身感知这类安全攸关场景的鲁棒性无从评估;三是模态设计是纯 RGB 的——而真实感知恰恰经常发生在夜间、低照度和雨雾天气里,此时 RGB 传感器给出的视觉线索本身就不可靠。用数字说话:RefCOCO 的小目标占比是 0.0%,RefCOCOg 的弱光样本只占 10.7%、平均 query 长度 8.47 个词,也就是说这些基准几乎测不到"传感器失效时模型还行不行"。
补上这个缺口最直接的模态是热红外(TIR):它对照明不变,在夜间、低照度和恶劣天气下依然能提供稳定的热签名。RGB-Thermal 融合在目标检测和语义分割里已经很成熟,但一旦把语言条件加进来就基本是空白;另一条被尝试过的路线是 RGB-D 定位,可它的表述面向 3D 环境、并不直接适用于 2D 定位,而且深度传感器在弱光与恶劣天气下同样退化,做不了互补模态。真正卡住这个方向的是评测口径:RGBT 感知要么在检测数据集上比 mAP,要么在分割数据集上比 mIoU,没有人能回答"把热红外接进定位模型到底值不值、在哪些工况下值",因为既没有配对的 RGB-TIR 指代标注,也没有一套让 RGB-only / TIR-only / RGB+TIR 在同一预处理、同一训练流程、同一指标下公平对流的方法。
本文的做法是把"数据"和"口径"一起补齐:从 FLIR、M3FD、MFAD 三个已配准的多模态检测数据集出发,经过滤、MLLM 描述生成和分层随机抽检的人工校验,构造出带三级细粒度标注的指代数据,再切出面向难度的 TestA/TestB/TestC 专门子集,用统一协议把 11 个代表性 VG 模型在三模态设置下全跑一遍,从结果里提炼出"场景复杂度决定精度、LoRA 类方法更抗复杂场景、低照度是最大失效模式、MLLM 跨光谱融合不可靠"四条观察,最后顺着这些观察设计一个参考基线 RGBT-VGNet。核心 idea:用空间配对的 RGB-TIR 检测数据 + MLLM 生成并人工校准的指代描述,把视觉定位从 RGB 单模态推进到可跨光谱对照、可按工况切片诊断的评测基准,并用一套可靠性感知的融合基线把"该信谁"这件事显式建模出来。
方法详解¶
这篇论文的"方法"有两半:前半是把 RGBT 视觉定位这件事变成一个可评测的任务(数据怎么来、标注怎么做、协议怎么定),后半是在这个协议下给出一个可复现的参考基线 RGBT-VGNet。两半是串联的——基准先暴露出"低照度掉点最狠""LoRA 类方法最抗复杂场景"这些现象,基线才针对性地去设计模块。
整体框架¶
整体流程是"数据 → 标注 → 划分与协议 → 评测 → 基线"这条链。数据侧从 FLIR、M3FD、MFAD 三个配对的多模态检测数据集收集原始图像对,先按三条规则清洗,再用 Qwen3-VL 生成指代描述和属性标注,接着用分层随机抽样做人工校验与修正,最后按来源数据集划分 train/val/test,并从 test 里切出按难度筛选的 TestA/TestB/TestC。协议侧把 TransVG、MMCA、D-MDETR、CLIP-VG、FSVG、AttBalance、HiVG、OneRef 八个模型族接进同一套代码,统一支持 RGB-only、TIR-only、RGB+TIR 三种输入。模型侧则是 RGBT-VGNet:RGB 与 TIR 两路各自过共享权重的 CLIP 视觉编码器,经过非对称模态适配、语言感知的跨模态协同和三先验融合后得到融合视觉 token,与文本 token、可学习的回归 token [Reg] 一起送进 VL-Transformer,由轻量 MLP 头回归出边界框。
规模上,RGBT-GroundBench 含 40K+ 张图像(21,535 对 RGB-TIR)与 38,760 个带指代描述的物体实例,标注分三级:场景级 13 类(城市、路口、住宅区、郊区、高速、校园、桥梁、停车场、乡村、隧道、市场、滨水、工业区),环境级 4 档光照(极弱/弱/正常/强)与 4 类天气(阴/晴/雨/雾),物体级尺度(小/正常)与遮挡(无或部分/严重)。与已有基准相比它的定位差异非常明显:
| 基准 | 模态 | 典型分辨率 | #实例 | 弱光占比 | 小目标占比 | Query 长度 |
|---|---|---|---|---|---|---|
| Flickr30K | RGB | 500×375 | 276,000 | 0.9% | 0.0% | 1.59 |
| ReferIt | RGB | 480×360 | 96,654 | 2.77% | 0.0% | 3.45 |
| RefCOCO | RGB | 640×480 | 50,000 | 6.1% | 0.0% | 3.49 |
| RefCOCO+ | RGB | 640×480 | 49,856 | 2.8% | 12.0% | 3.58 |
| RefCOCOg | RGB | 640×480 | 49,822 | 10.7% | 45.4% | 8.47 |
| RGBT-GroundBench | RGB+TIR | 640×512 | 38,760 | 43.2% | 56.8% | 14.24 |
另外,本文特意强调了目标的"非中心分布":经典 VG 基准里目标多在中部,而 RGBT-GroundBench 的目标位置分布明显更靠边缘,指向的是真实驾驶/巡检场景里目标出现在画面边角的情形。资源侧论文承诺全部公开且没有隐藏测试集或私有服务器:标注与划分随论文发布,数据集托管在 HuggingFace(JiawenXi/RGBT-Ground-Dataset),代码与 checkpoint 在 GitHub,源数据集沿用各自原始许可。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["FLIR / M3FD / MFAD<br/>RGB-TIR 检测数据"] --> B["数据构建管线"]
B --> C["三级细粒度标注<br/>与难度导向的评测协议"]
C --> D["非对称模态适配(AMA)"]
D --> E["语言感知的视觉协同(LAVS)"]
E --> F["光照-局部-全局三先验融合(TPF)"]
F --> G["[Reg] 回归框"]
关键设计¶
1. 数据构建管线:从检测数据到可校验的指代描述
指代数据最难的不是"生成一句描述",而是让这句描述真的唯一指向一个框。本文的管线分采集、过滤、描述生成、人工质控四段。采集直接复用 FLIR、M3FD、MFAD 三个已有的配对检测数据集,它们天然提供空间对齐(或弱对齐)的 RGB-TIR 图像对和物体级框;过滤环节立了三条规则——剔除只占几个像素、连可靠标注都撑不起的极小目标;丢掉 RGB 与 TIR 之间空间错位严重的图像对;滤掉长尾类别(论文点名了 FLIR 里的 dog 和 M3FD 里的 lamp)以避免类别失衡;对保留下来的样本,每对图像每个类别只保留最大的那个实例,保证跨模态一致性和描述的可写性。描述生成用 Qwen3-VL,靠精心设计的任务 prompt 一次产出两类标签:一类是物体指代描述(referring expression),另一类是场景级、环境级、物体级的属性标注。prompt 里覆盖了四个要点——物体外观细节与关键特征、上下文关系、如何区分同类相似物、语言简洁清晰。
生成之后是质控:按场景、光照、天气、物体尺度、遮挡做分层随机抽样,人工检查幻觉、歧义、属性错误、框与描述不匹配以及严重语法问题,用重写/重标或判废来修正。论文把质量指标写得比较实:抽检 15% 的实例,其中 5% 的描述被改过、0.5% 被判废,抽检子集里 95% 的描述正确指向目标;一条标注只有在"描述唯一确定一个目标、且与最终框和跨模态属性一致"时才被接受。除了人工抽检,论文还做了统计层的物理一致性校验:光照-天气交叉统计(见下表)显示各档光照与天气的分布符合现实规律,例如弱光主要落在雨天和阴天、强光几乎全部落在晴天,这种"聪明过头"的统计关系正是 MLLM 生成标签容易出错的地方,能对上说明标注整体没有系统性漂移。
| 光照 / 天气 | 雾 | 雨 | 晴 | 阴 |
|---|---|---|---|---|
| 极弱光 | 71 (0.33%) | 29 (0.13%) | 0 (0.00%) | 101 (0.47%) |
| 弱光 | 2,754 (12.79%) | 1,298 (6.03%) | 14 (0.07%) | 4,704 (21.84%) |
| 正常光 | 521 (2.42%) | 150 (0.70%) | 2,191 (10.19%) | 6,157 (28.59%) |
| 强光 | 4 (0.02%) | 0 (0.00%) | 3,152 (14.64%) | 389 (1.81%) |
2. 三级细粒度标注与难度导向的评测协议:让"难"变成可切片的维度
仅有多模态图像并不构成一个可诊断的基准,关键是把"难度"拆成可独立统计的开关。本文的标注体系把每个实例同时挂在场景、环境、物体三个轴上,于是同一个模型精度下降可以被追问到具体是哪一档光照、哪一类天气、哪个尺度造成的,而不是只给出一个总体均值。数据按来源划分为 RefFLIR(9,712 实例)、RefM3FD(7,548)、RefMFAD(21,500),总计 38,760,其中 train 26,604、val 2,032、test 10,124。在 test 之上,论文又切了三个专门子集用于诊断:TestA 覆盖正常尺度目标在正常光与强光下的表现,TestB 专挑弱光与极弱光的夜间场景,TestC 专挑小尺度目标。需要说明的是这三个子集是"按条件筛出的子集"而非对 test 的划分——例如 RefFLIR 的 test 有 2,104 个实例,而 TestA/B/C 分别是 837/640/968,三者之和大于 test(这说明子集之间允许重叠,一个弱光小目标可以同时进 TestB 和 TestC),⚠️ 该重叠关系以原文与补充材料为准。评测指标沿用 VG 社区的 [email protected]:预测框与真值框的 IoU 超过 0.5 即算定位正确;论文另外报告了 val/test/TestA/TestB/TestC 各切片的数值,[email protected] 放在补充材料。
评测协议本身也是贡献的一部分。作者把八个模型族——TransVG、MMCA、D-MDETR、CLIP-VG、FSVG、AttBalance、HiVG、OneRef——改造成同一份代码库,统一数据预处理、统一训练流程、统一指标,并且让每个模型都能吃 RGB-only、TIR-only、RGB+TIR 三种输入(多模态版本以 MV- 前缀区分)。这一步看似工程,实际是本文结论可信的前提:只有预处理和训练轮次一致,"LoRA 类方法更鲁棒""多模态平均涨点"这类横向比较才不是被训练策略差异污染的假象。
3. 非对称模态适配(AMA):给 TIR 分支更高的适配容量
CLIP 这类视觉语言预训练模型的表征是偏 RGB 的,直接拿它的视觉编码器去编码热红外图像,中间隔着一道很大的模态鸿沟;已有的 LoRA 微调范式通常对两个模态套同样的配置,等于默认两者与预训练的"距离"相同,忽视了这个偏置。AMA 的做法是在每个视觉编码器层的注意力投影权重上做低秩分解,并给两路不同的适配容量:
(两路共享同一个冻结 CLIP 初始化,\(A\)、\(B\) 是可学习低秩矩阵、\(\alpha\) 是缩放因子;缓存文本在 PDF 提取时吞掉了加号,此处按 LoRA 标准形式还原,⚠️ 以原文为准。)关键设定是非对称 rank \(r_v \le r_t\):RGB 分支保持较小的秩以尽量保留预训练的视觉语言对齐,TIR 分支用更大的秩换取更强的适配能力,理由是 TIR 与预训练域的偏移更大、需要更多自由度去对齐。此外论文沿用了 HiVG 的层级设计,让低层结构表征与高层语义表征分阶段渐进对齐。这条设计的特别之处在于它是"由观测反推"的:基准评测先发现 LoRA 类方法(HiVG)在复杂场景里明显更稳,作者才把它作为基线的主干适配方式,而不是先有架构再有结论。
4. 语言感知的视觉协同(LAVS):用文本当 query 去挑两路特征
RGBT 定位与 RGBT 检测的差别在于"要找什么"是语言给的,因此两路视觉特征该在哪些区域、以多大权重被融合,本质上应由文本语义来定,而不是让两路特征自己盲目对齐。LAVS 把文本 embedding 当作 query 去分别检索 RGB 与 TIR:文本特征出 \(Q_s\),每一路的视觉特征出 \(K\)、\(V\),先算出语言引导的跨模态注意力图,再用它做残差更新:
TIR 一路同理得到 \(A_{\text{attn}_t}^{l}\) 与 \(F_t^{l}\)。右乘 \(V\) 再左乘注意力图转置的写法不只是形式上的讲究——它保证更新后的特征维度与原始 patch 特征一致,可以直接接后面的融合模块。两路各自被语言"洗"过一遍之后,再通过一次模态间 cross-attention 交换信息,并各自过线性投影 \(P_v\)、\(P_t\) 映射到统一的定位空间。这样做的效果是文本在最前面就决定了"值得融合的是哪些区域",后续融合拿到的输入本身已经是语义对齐的,而不是把两路原始特征硬拼。
5. 光照-局部-全局三先验融合(TPF):按可靠性动态决定信谁
低照度下 RGB 退化而 TIR 依然可用,这是引入第二个模态的全部理由;但"什么时候该信 TIR"如果只靠一个可学习的门控,在小规模数据上很容易学歪。TPF 选择把可靠性写成显式的先验。它先把 RGB 的每个 patch 转灰度、池化到 patch 网格并归一化到 \([0,1]\) 得到照度强度 \(i_p\),再用它到"最优照度点 0.5"的距离定义照度质量:
也就是说亮度越接近中灰、RGB 越可信。接着算局部-全局语义先验:把两路归一化后的 patch token 及其逐元素差送进一个小 MLP 再过 sigmoid,得到逐 patch 的先验 \(g_p\);把两路全局池化特征做同样处理、再跨通道取均值,得到全图共享的先验 \(b\)(\(b\) 广播到所有 patch)。三项先验以 0.5 为中性点等权相乘再 sigmoid,得到 RGB 的可靠性权重 \(w_p\),最终融合 token 为:
这里 \(g^{\mathrm{ch}}\) 是语义 MLP 在通道维上的门控。整个式子的可读性很强:\(w_p\) 接近 1 说明该 patch 的 RGB 亮度和语义都可信、以 RGB 为主,接近 0 则在弱光或 RGB 语义可疑时切到 TIR;最后一项再加一个由语义门控控制的差异项,把两路的互补信息补回来。作者自己也交代了这个模块的定位——它是个轻量启发式融合,用来在受控协议下把"跨光谱互补"这条观察具体化,而不是要单独建模光照;等权相乘、中性点取 0.5 的写法也避免了引入额外超参。
损失函数 / 训练策略¶
训练统一在 224×224 输入、相同数据增强策略下进行,batch size 8,AdamW,学习率 \(1\times10^{-3}\),训练 120 个 epoch,硬件为 RTX 4090。所有 CLIP 编码器(视觉与文本)保持冻结以保住预训练的视觉语言对齐,只训练 LoRA 分支、LAVS/TPF 模块、投影层与回归头;被改造的基线方法尽量沿用各自原实现的默认超参。回归目标由 [Reg] token 经轻量 MLP 输出 \(\hat{B}=(\hat{x},\hat{y},\hat{w},\hat{h})\);正文没有给出具体的框回归损失形式(按统一框架的常见做法应为 L1/GIoU 类组合),⚠️ 以原文与开源代码为准。
实验关键数据¶
主实验¶
三种输入设置下的主结果([email protected],%,test 划分)如下,三种模态分别是零样本迁移、单模态域内训练和多模态域内训练:
| 方法 | 输入模态 | RefFLIR test | RefM3FD test | RefMFAD test |
|---|---|---|---|---|
| HiVG-L(零样本) | RGB | 44.46 | 53.10 | 40.42 |
| HiVG-L(零样本) | TIR | 23.80 | 28.89 | 23.11 |
| HiVG-B(域内训练) | RGB | 66.65 | 68.15 | 64.02 |
| HiVG-B(域内训练) | TIR | 64.07 | 61.77 | 62.63 |
| MV-TransVG | RGB+TIR | 46.06 | 48.04 | 53.84 |
| MV-D-MDETR | RGB+TIR | 47.42 | 46.50 | 57.31 |
| MV-HiVG-B | RGB+TIR | 69.20 | 72.35 | 67.04 |
| MV-HiVG-L | RGB+TIR | 72.50 | 68.67 | 61.31 |
| MV-OneRef-L | RGB+TIR | 60.89 | 69.70 | 62.73 |
| RGBT-VGNet(本文) | RGB+TIR | 72.43 | 74.89 | 67.58 |
在三个难度子集上,RGBT-VGNet 同样处于最高档:TestA(正常/强光 + 正常尺度)为 89.64/94.16/91.29,TestB(弱光/极弱光夜间)为 69.22/80.75/64.80,TestC(小目标)为 52.53/55.52/51.18(顺序为 RefFLIR/RefM3FD/RefMFAD);论文把这一组概括为"TestA/TestB/TestC 上 [email protected] 分别超过 91%、64%、49%"。
消融实验¶
三个组件的逐步叠加([email protected],%):
| AMA | LAVS | TPF | RefFLIR val / test / testB / testC | RefM3FD val / test / testB / testC | RefMFAD val / test / testB / testC |
|---|---|---|---|---|---|
| 55.42 / 46.19 / 41.56 / 22.81 | 54.16 / 57.57 / 65.63 / 34.46 | 53.50 / 54.63 / 51.91 / 36.62 | |||
| ✓ | 74.01 / 71.17 / 66.25 / 49.69 | 70.83 / 72.53 / 80.16 / 50.43 | 68.07 / 65.27 / 62.19 / 47.96 | ||
| ✓ | ✓ | 73.68 / 72.65 / 67.19 / 52.23 | 73.21 / 74.34 / 81.93 / 53.63 | 67.83 / 66.62 / 64.07 / 49.76 | |
| ✓ | ✓ | ✓ | 75.33 / 72.43 / 69.22 / 52.53 | 73.21 / 74.89 / 80.75 / 55.52 | 68.31 / 67.58 / 64.80 / 51.18 |
在同一协议下把 TPF 换成其他 RGBT 融合策略:
| 融合方法 | 出处 | RefFLIR val | RefM3FD val | RefMFAD val | RefFLIR testC | RefM3FD testC | RefMFAD testC |
|---|---|---|---|---|---|---|---|
| Naive Add | - | 73.68 | 70.24 | 67.91 | 46.86 | 51.46 | 49.41 |
| CMX | TITS'24 | 64.31 | 60.71 | 53.74 | 38.87 | 38.15 | 32.33 |
| LIF | ICCV'25 | 74.34 | 69.64 | 67.59 | 49.70 | 51.30 | 49.96 |
| TPF(本文) | - | 75.33 | 73.21 | 68.31 | 52.53 | 55.52 | 51.18 |
关键发现¶
- 模态适配是跨光谱定位的门槛,不是可选项。零样本迁移时所有模型都塌得很惨,论文报告相对域内训练平均低约 30%(RGB)与 50%(TIR);而消融里光加上 AMA 一步,RefFLIR test 就从 46.19 涨到 71.17(+24.98),是全部组件里单步增益最大的一项。这说明预训练 CLIP 的表征偏 RGB,不先把 TIR 分支对齐过来,后面的融合模块拿到的输入本身就是错位的。
- LAVS 与 TPF 的价值集中在"难"的格子上,且会牺牲一点容易的格子。加上 LAVS 后 RefFLIR testB 从 66.25 升到 67.19、testC 从 49.69 升到 52.23,但 val 从 74.01 微降到 73.68;再加 TPF 后 RefM3FD testC 从 53.63 升到 55.52、RefFLIR testB 升到 69.22,可 RefFLIR testA 从 91.31 回落到 89.64。这种"难样本换易样本"的取舍与 TPF 按可靠性调权重的设计是一致的——它本来就是为了救弱光和小目标。
- 多模态确实涨点,但论文"平均约 10%"的说法需要谨慎对待。从表里能直接核对的 HiVG/OneRef 行看,RGB+TIR 相比单模态 RGB 的涨幅多落在 1-4 个点(如 RefM3FD test 上 HiVG-B 68.15→72.35、RefMFAD test 上 HiVG-B 64.02→67.04);"约 10%"更像是对全部模型与全部子集取平均的口径,⚠️ 具体统计范围以原文和补充材料为准。可以确认的是 testB/testC 上的增益最明显,也就是弱光与小目标这两个工况最吃多模态。
- 融合策略的对比说明"显式先验"比"更复杂的融合网络"更划算。代表性 RGBT 融合基线 CMX 在三个子数据集上全面落后(RefFLIR val 只有 64.31,比 TPF 低 11 个点),而结构更简单的 Naive Add 和 LIF 虽在个别格子(如 LIF 的 RefFLIR testA 90.00)反超 TPF,跨数据集的稳定性明显不如 TPF。
- 场景复杂度与定位精度强相关,LoRA 类方法更抗复杂场景。模型在 TestA 这类光照好、尺度正常的格子里普遍很稳,一到杂乱场景、有干扰物、遮挡或很小的偏心目标就明显掉点;而使用 LoRA 适配的 HiVG 系列在不同场景间的波动明显小于全量微调或非 LoRA 方法。作者由此推测,参数高效适配在域偏移下比架构设计更能稳住鲁棒性。
- 低照度是被长期忽视的最大失效模式。TestB 是所有模型掉点最狠的一档,热红外线索能缓解但救不回来,小目标叠加恶劣天气时尤其困难——这正是本文要把它单列成子集的理由。
- MLLM 还没准备好做跨光谱定位。论文额外评测了 GLM-4.6V、Kimi-K2.5、Qwen3.5-Plus 三个多模态大模型,在 224×224 与原分辨率两种设置下,结论是"简单地把热红外图加进去并不能稳定提升定位精度",而且性能对输入分辨率非常敏感;细节数据放在补充材料。
亮点与洞察¶
- 把质检指标公开写出来,比只说"高质量"可信得多。"抽检 15%、改写 5%、判废 0.5%、抽检子集 95% 正确"这一组数字配上光照-天气交叉统计的物理一致性校验,构成了两层验证:人工保证单条描述不歧义,统计保证整体分布不漂移。这套"LLM 生成 + 分层抽检 + 统计校验"的标注范式可以直接搬到任何用 MLLM 造数据的场景。
- 把"难"拆成可切片的维度而不是一句形容词。三级标注让"低照度掉点"这种结论可以落到具体格子(TestB),而不是被总体均值掩盖;TestA/B/C 的划分逻辑(好光照正常尺度 / 夜间弱光 / 小目标)是一套几乎可以直接套用到其他鲁棒性评测上的模板。
- 统一协议是 benchmark 论文最容易被低估的贡献。把八个模型族改成同一份代码、同一套训练与指标、还能自由切换三种输入模态,才让"多模态涨点""LoRA 更鲁棒"这类横向结论站得住;否则读者无从判断差异来自方法还是训练细节。
- TPF 的可靠性权重是一个很轻的可复用 trick。它把"这个 patch 的 RGB 该不该信"写成"照度质量 × 语义先验 × 全局先验"的等权乘积再过 sigmoid,中性点固定在 0.5、不引入任何额外超参;这种"先归一化到 [0,1]、以 0.5 为中性、乘法链融合"的写法可以原样迁移到任意双模态/双分支融合场景。
- benchmark 观察直接变成 baseline 设计,形成闭环。AMA 来自"LoRA 类方法更鲁棒"的观察,TPF 来自"低照度掉点最狠"的观察,LAVS 则是为了给 TPF 提供语义对齐的输入——模块不是拍脑袋堆的,每个都能追到一条实验结论,这种写法本身值得学习。
- 诚实地暴露了取舍。消融表里 TPF 会让 TestA 小幅回落的细节没有被藏起来,反而与"可靠性感知融合偏向困难工况"的叙事自洽。
局限与展望¶
- 数据来源只有 FLIR、M3FD、MFAD 三个检测数据集,类别以行人和车辆为主,场景与语义多样性受限;描述由 MLLM 生成,人工只抽检了 15%,剩下 85% 的质量靠统计校验间接背书。
- RGB 与 TIR 被假定为空间对齐或弱对齐,真实部署中未配准、模态缺失(只有 RGB 或只有 TIR)的情形没有覆盖,而后者恰恰是工程落地时最常见的问题。
- TPF 的先验设计偏手工:三项先验都归一化到 \([0,1]\)、以 0.5 为中性点、等权相乘,这个"中性点"假设在不同传感器、不同曝光策略下未必成立,也没有看到对权重形式的敏感性分析。
- 主实验的细粒度结论大量依赖补充材料:TestA/B/C 之外的场景、天气、遮挡切片,以及 [email protected] 和 MLLM 的完整数据都不在正文,正文只给了提炼后的四条结论,读者难以自行复核。
- 论文正文没有交代框回归的具体损失形式和更多训练细节(如 LoRA rank 的具体取值、\(\alpha\) 的设定),复现需要依赖开源代码。
- 可以推进的方向:把可靠性先验从手工乘积换成可学习或经过校准的门控;在协议里加入模态缺失与未配准的鲁棒性设定;把 MLLM 的定位头(如注意力转 mask 的做法)纳入同一协议对比;扩充到更多类别与更细的天气/遮挡切片。
相关工作与启发¶
- vs RefCOCO/+/g、ReferIt、Flickr30K:这些是 RGB 单模态基准,图像来自干净环境、目标居中显著,小目标占比为 0 或很低(RefCOCO 0.0%、RefCOCO+ 12.0%),弱光样本最高也只有 RefCOCOg 的 10.7%。本文在模态(RGB+TIR)、工况占比(弱光 43.2%、小目标 56.8%)和语言复杂度(平均 14.24 词,远高于 RefCOCOg 的 8.47)上同时拉高,代价是实例规模只有 RefCOCO 量级的 3/4 左右。
- vs RGB-D 视觉定位(Refer-it-in-RGBD、Cross3DVG、Unit3D):那条路线把定位表述扩展到 3D,任务形式不同、无法直接迁移到 2D 框回归;更关键的是深度传感器在弱光与恶劣天气下同样退化,做不了"照明不变"的互补模态。本文选热红外的理由正在于此。
- vs RGBT 检测与分割(C2Former、D3T、UniRGB-IR、ABMDRNet 等):这些工作已经在融合架构上做了大量探索,但输出是无语言的框或掩码,模型不需要理解"找哪一个"。本文把语言条件引入同一套双模态输入,评测的失败模式也随之不同——不再只是漏检,而是"框错了对象"。
- vs HiVG / OneRef / CLIP-VG / TransVG 等被评测的 VG 模型:它们在这篇论文里既是对比对象也是组件来源。HiVG 的层级 LoRA 微调思想被 AMA 借用,但本文把它改成了 RGB/TIR 非对称 rank 的版本;OneRef、CLIP-VG 等在多模态改造后(MV- 版本)成为 RGBT-VGNet 的直接竞争者,但整体仍低于本文基线。
- 启发:这套"先建基准把失效模式测出来、再顺着失效模式设计模块、最后把模块放回同一协议里验证"的研究路径,对其他跨模态任务(如 RGB-事件相机、RGB-深度、多光谱)同样适用,尤其是当某个模态的增益一直停留在 anecdote 层面时。
评分¶
- 新颖性: ⭐⭐⭐⭐ 首个 RGBT 视觉定位基准,三级细粒度标注加统一三模态协议是这个方向缺的基础设施;方法侧(AMA/LAVS/TPF)是组合式创新,单看模块不算突破。
- 实验充分度: ⭐⭐⭐⭐ 11 个模型 × 3 种模态 × 3 个子数据集 × 5 个划分,消融与融合策略对比齐全,还给了零样本/域内/多模态三档;扣分在于 MLLM 评测、天气与场景细分、[email protected] 都推到了补充材料,正文无法自证。
- 写作质量: ⭐⭐⭐ 结构与图表组织清楚,观察与设计的对应关系讲得明白;但关键公式在缓存文本中存在提取损坏,且大量结论依赖补充材料,正文留下了需要读者自行拼合的空档。
- 价值: ⭐⭐⭐⭐⭐ 数据、标注、划分、代码、checkpoint 和评测脚本全部公开且无隐藏测试集,配套的鲁棒性诊断切片(TestA/B/C)可被后续工作直接复用,对整个跨光谱定位方向有直接的推动。