跳转至

Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray

会议: ECCV 2026
论文: ECCV 2026
领域: 多模态 VLM
关键词: X 光安检、组合威胁推理、功能组装、结构化安全状态、指代功能定位

一句话总结

本文把 X 光行李安检中的「威胁」从「检测到某个类别的物体」重新定义为「空间上分离的部件能否按功能兼容性组合成一件可用装置」,给出约 7,000 张真实扫描 + 反事实扩展的基准 Falcon-X(密集掩码 + 部件存在/功能链接/场景风险的结构化监督),并提出 Falcon:用分割感知的区域编码与三个部件查询把可变数量的部件实例压成固定结构化安全状态,再把该状态 token 化注入 LLM,在指代功能定位(RFG)上以 50.45 cIoU 超过次优方法 30.38 个点。

研究背景与动机

X 光行李安检是一个被透明材质、严重重叠与高度杂乱支配的场景。过去十年,深度学习方法在 SIXray、OPIXray、HiXray、PIDray 等大规模基准上把违禁品检测推进得相当成熟,近期的工作(如 STCray 数据与 Sting-Bee 模型)又把多模态模型引入该领域,让机器能对扫描图做描述与问答。但这些系统无论新旧,骨子里都是 object-centric 的:威胁被归属到单个类别上——有枪是枪、有刀是刀。而真实安检里的风险经常不是这么出现的:简易爆炸装置(IED)常常被拆散运输,电池、起爆器、主装药在同一个包里彼此分离。这三样东西单独看都无害——充电电池和充电电池没有区别——只有按「功能兼容性」组合起来才构成威胁。于是真正要回答的问题不是识别物体,而是关系性的安全推断:在严重叠放与透明干扰下,空间分离的若干部件合起来是否足以构成一件功能性威胁?

现有工作无法回答这个问题,原因有两层。表面的一层是评测口径:现有 X 光基准几乎都是闭集、对象级的,标注的是完整的违禁品(整把枪、整把剪刀),评测的是「有没有检出来」,没有任务去问「这几个零件能不能拼成一件东西」。更深的一层是监督信号与数据的双重壁垒。多模态大语言模型(MLLM)虽然能把区域编码成 token、能指代分割,但它们对区域之间关系的推断完全依赖隐式注意力,没有任何显式监督告诉模型「电池与起爆器之间的兼容性在风险判断里占了多大权重」;同时,要训练「缺件」这一类推理,就必须有覆盖「只有电池」「电池 + 起爆器」「三件齐全」全谱系的样本,而这种部分组装的真实 X 光图在安检流水线里几乎采不到——总不能在真实行李里摆一套拆散的 IED 去扫描。于是关系一致的安全推断在这类图像里基本是一片空白。

本文的切入角度是:既然风险本质上是「部件之间关系」的性质,那就不该让它藏在注意力权重里,而应该把它写成显式的中间量。作者把安全状态定义成三元组——哪些部件在场(存在向量)、它们在类型层面有多兼容(功能链接矩阵)、以及由此推出的场景风险(连续分数),再用分割掩码把「部件」锚定到像素上;数据端用掩码引导的 inpainting 在同一张真实图上合成可控的缺件变体,把上面缺失的那段监督补齐;模型端则在区域级感知与语言解码之间插进一个结构化适配器,把可变数量的区域压缩成固定的功能状态,并把这个状态变成 LLM 能读到的 token。核心 idea:把「组合威胁」从隐式的注意力推断改写为「存在向量 + 类型级功能兼容矩阵 + 场景风险」的显式结构化安全状态,用部件查询注意力从掩码感知的区域特征中把它预测出来,再作为 7 个安全 token 注入冻结的 LLM,从而让功能组装推理变成可监督、可消融的感知侧计算。

方法详解

整体框架

Falcon 解决的是「区域级感知 → 功能状态 → 语言」这条链上的信息断裂:输入一张 X 光图(可带一句查询或指代表达式),模型先做分割感知的实例定位,再把实例特征聚合成按部件类型组织的结构化安全状态,最后把这个状态与图像、区域、文本 token 一起交给 LLM 解码出定位结果、缺失部件判断与风险分数。论文把这条链显式写成 \(I \rightarrow R \rightarrow \{h_c\} \rightarrow (\hat{\mathbf{p}}, \hat{L}, \hat{r}) \rightarrow Y\),其中 \(R\) 是实例区域、\(\{h_c\}\) 是部件级槽嵌入、\((\hat{\mathbf{p}}, \hat{L}, \hat{r})\) 是预测的存在、功能链接与场景风险,\(Y\) 是生成回复。这条链就是论文所称的「语义瓶颈」:语言侧能拿到的新信息,只有这几个结构化标量,关系推理因此被强制在感知与适配器一侧完成。

工程上它由四段拼成。视觉骨干用 DINOv2-L/14 把 448×448 的输入编码成密集 patch token,再按 2×2 不重叠窗口线性聚合一次,把序列长度压到四分之一,得到兼顾空间局部性的特征图 \(F\)。类别无关的 RF-DETR 检测头在 \(F\) 上产出实例提案(框、掩码、置信度),经 NMS 与分数过滤后保留 top-100 个;每个提案的框内特征与掩码内特征被融合成「语言对齐」的区域 token。Structured Safety Adapter(SSA)接过这组数量可变的区域 token,用三个可学习的部件查询把它们聚合成三个部件槽,并从槽嵌入上并行预测部件存在、成对功能链接与场景风险。最后这七个标量被逐个 token 化,与图像 token、区域 token、文本 token 拼接后送入 Vicuna-7B 生成回答。训练分三段:先单独训检测器,再冻结检测器与 LLM 只训 SSA,最后开 LoRA 做指令微调。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["X 光图像 + 查询"] --> B["DINOv2 编码<br/>2×2 token 聚合"]
    B --> C["掩码感知的区域编码<br/>ROIAlign + 掩码池化"]
    C --> D["结构化安全状态<br/>SSA 部件槽 + 三组预测头"]
    D --> E["安全 token 注入<br/>7 个结构化 token"]
    E --> F["Vicuna-7B 解码"]
    F --> G["定位 / 缺失部件 / 风险"]
    H["反事实数据构造<br/>掩码引导 inpainting"] -->|训练监督| D

关键设计

1. 掩码感知的区域编码:让视觉 token 贴住叠放中的部件轮廓

X 光图里物体彼此穿透叠放,一个包围框往往框进大量背景杂物,框内的平均特征也就被稀释了。Falcon 因此不只取框:对每个提案,它一路用 ROIAlign 从特征图 \(F\) 上抽出框内特征,另一路在预测掩码上做掩码池化,把掩码覆盖区域内的骨干特征求加权平均

\[f_i^{\text{mask}} = \frac{\sum_x m_i(x)\,F(x)}{\sum_x m_i(x)}\]

两路拼接后经可学习投影得到区域嵌入 \(z_i = W[f_i^{\text{roi}} \,\|\, f_i^{\text{mask}}]\),作为送入后续模块的语言对齐区域 token。这一步的价值在论文里被反复强调:正因为部件在叠放下会被遮挡、被打断,只有掩码给出的精确空间支撑才能让「部分可见的电池」和「它周围那堆线缆」在特征层面分开;而下游的指代功能定位要输出像素级结果,也直接依赖这条掩码通路。换句话说,组合推理的第一步必须先有干净的区域,否则后面所有关系判断都是在噪声上做。

2. 结构化安全状态:用三个部件查询把可变区域集压成固定功能槽

一张图里部件实例的数量是任意的——可能只有一块电池,也可能有两块电池加一个起爆器——但「功能组合」这个概念是定义在部件类型之间的,数量不定就没法做固定维度的监督。SSA 的解法是维护三个可学习的部件查询 \(q_c\)(分别对应电池、起爆器、主装药),每个查询对整个区域集做缩放点积注意力,再按注意力权重把区域嵌入加权聚合成一个部件槽

\[A_{c,i} = \mathrm{softmax}_i\!\left(\frac{q_c^{\top} z_i}{\sqrt{d}}\right), \qquad h_c = \sum_{i=1}^{N} A_{c,i}\, z_i\]

同一部件类型的多个实例会按权重比例共同贡献到同一个槽里,槽的语义特化则由部件级监督在训练中自然涌现(论文把这个查询聚合记作 CAA,全称原文未给出全称展开)。在三个槽嵌入之上,SSA 并行输出三类结构化信号:每个槽经线性投影加 sigmoid 给出该部件的存在概率 \(\hat{p}_c\);对三个预定义部件对(电池–起爆器、电池–主装药、起爆器–主装药)拼接两个槽嵌入过轻量 MLP 给出成对功能链接概率 \(\hat{\ell}_{uv} = \sigma(f_\ell([h_u; h_v]))\),论文特别澄清这里的「链接」指的是功能兼容性而非物理连接;场景风险则由三个槽嵌入连同三个链接概率一起回归 \(\hat{r} = \sigma(f_r([h_1, h_2, h_3, \hat{\ell}_{bd}, \hat{\ell}_{be}, \hat{\ell}_{de}]))\),而不是直接从原始视觉 token 回归。把风险挂在链接概率之后而不是直接看图,是这一步最关键的设计:它让风险在计算图上真正变成「存在 × 兼容性」的函数,于是「三件都在但配不起来」和「缺一件但兼容性很高」这两种情况在结构上就可区分了,而不是留给 LLM 去猜。

3. 安全 token 注入:把结构化预测变成 LLM 的解码前置条件

如果结构化预测只当作训练时的辅助损失,LLM 解码时根本看不到这个状态,关系偏置就白算了。Falcon 的做法是把七个标量 \(v = [\hat{r}, \hat{p}_1, \hat{p}_2, \hat{p}_3, \hat{\ell}_{bd}, \hat{\ell}_{be}, \hat{\ell}_{de}]\) 逐个变成一个 token:\(t_k = e_k^{\text{type}} + \phi(v_k)\),其中类型嵌入 \(e_k^{\text{type}}\) 告诉模型「这个数是什么变量」,投影 \(\phi\) 把数值搬进 LLM 的嵌入空间。七个安全 token 与图像 token、区域 token、文本 token 拼成 \([T_{\text{image}} \| T_{\text{region}} \| T_{\text{SSA}} \| T_{\text{text}}]\) 再交给 Vicuna-7B 解码。这个设计之所以有效,是因为它在第二阶段训练里制造了一个信息上的强约束:此时检测器和 LLM 都是冻结的,唯一还带梯度的通路就是 SSA 与投影层,模型想让生成文本变好,只能把关系判断塞进这七个数字里。后续消融里「打开链接头涨得最多」正是这条约束起作用的结果——它证明关系量确实承担了主要的信息量,而不是靠 LLM 自己看图就能补上。

4. 反事实数据构造:用掩码引导 inpainting 造出可控的缺件状态

缺失部件识别与功能完整性这两类任务需要覆盖单部件、部分组装、完整配置的完整谱系,但真实安检流水线里几乎采不到「拆散到一半」的样本。最直接的做法是把选定部件区域的像素抹掉(mask 置零),但这会在图上留下肉眼可见的人工痕迹,模型极可能学会「看到方形的干净空洞就报告缺件」,用捷径替代推理。Falcon 改用掩码引导的 inpainting:从同一张图里取一块背景掩码去覆盖选定的部件实例,这样填进来的是真实的 X 光杂乱纹理与遮挡关系,语义上更自洽;再枚举部件集合 \(C\) 的可行子集,生成覆盖各类组合的平衡语料,真实图与反事实变体合计约 50,000 张。与这一步配套的还有风险标签的设计:风险分由专家给出,并刻意保留感知层面的不确定性——只缺一个部件也可能因为「可能被遮挡或藏匿」而拿到高分。这个看似不起眼的设定其实很关键,它切断了 \(r\) 从存在向量 \(\mathbf{y}\) 平凡推导的路径,逼模型去做带不确定性的判断。

一个完整示例

以论文定性图里那张「包中有起爆器与电池、但没有主装药」的扫描为例走一遍:图像被缩放到 448×448 送入 DINOv2,patch token 经 2×2 聚合得到特征图;RF-DETR 生成最多 300 个类别无关提案,NMS(0.6)与分数过滤(0.15)后保留 top-100 个实例区域;每个区域经 ROIAlign 与掩码池化融合成一个区域 token。SSA 的三个部件查询对这批区域做注意力聚合:电池查询与起爆器查询分别在对应实例上取得较大权重,主装药查询因为图里没有可聚合的区域而得不到有效支撑。三组预测头随之给出:存在向量中电池、起爆器为 1、主装药趋近 0,链接概率显示电池–起爆器这一对兼容性较高,而涉及主装药的两条链接偏低,场景风险据此落到 0.5 附近。这七个标量变成七个安全 token,与图像/区域/文本 token 拼接后由 LLM 输出「缺失部件:主装药;风险分 0.5」。作为对照,若同一场景三件齐全,链接概率整体抬升、风险分被推到接近 1.0,模型的回答也会从「缺件」切换为「可组成功能性 IED」——风险分与存在、链接两组量在输出上保持同向变化,这正是把状态显式注入所期望得到的关系一致性。

损失函数 / 训练策略

训练分三段,目的是把分割学习与结构化多模态推理解耦。第一阶段(分割感知提案学习):以类别无关的方式训练 RF-DETR,把所有权重部件当作一个统一的「威胁」类,损失为检测与分割之和 \(\mathcal{L}_{S1} = \mathcal{L}_{\text{det}} + \mathcal{L}_{\text{seg}}\),其中 \(\mathcal{L}_{\text{det}}\) 是 DETR 的标准集合预测损失(分类、框回归、GIoU),\(\mathcal{L}_{\text{seg}}\) 由掩码 BCE 与 Dice 组成;此阶段只优化 RF-DETR,多模态模块全部冻结,训练 12 个 epoch,产出的提案在后续阶段固定不变。第二阶段(结构化多模态对齐):冻结 RF-DETR 与 LLM,只更新 SSA 与投影层,目标同时监督语言生成与结构化安全预测——语言侧是标准的自回归负对数似然,结构化侧是对存在概率、链接矩阵与场景风险的 L1 回归:

\[\mathcal{L}_{S2} = -\sum_t \log P_\theta\!\left(y_t \mid y_{<t}, I, Z, \hat{\mathbf{p}}, \hat{L}, \hat{r}\right) + \lambda\,\mathcal{L}_{\text{struct}}(\hat{\mathbf{p}}, \hat{L}, \hat{r})\]

(⚠️ 原文该式在 PDF 抽取后 LaTeX 已损坏,上面是按正文描述重写的结构示意,权重 \(\lambda\) 与各项的具体形式以原文为准。)第三阶段(指令微调):从第二阶段的检查点出发,在 LLM 的注意力层中打开 LoRA(rank 16),RF-DETR 仍然冻结,优化目标不变但梯度开始流经 LoRA 参数,以提升指令遵循能力以及结构化预测与生成解释之间的一致性。优化器统一为 AdamW + 混合精度,跑在两张 A100 上;第二、三阶段各 1 个 epoch。推理侧的配置是:DINOv2-L/14 输入 448×448,RF-DETR 用 seg-2xlarge、6 层解码器,最多 300 个提案 → NMS 0.6 → 分数 0.15 → top-100 区域,最终注入 7 个安全 token。

实验关键数据

主实验

评测在自建的 Falcon-X 上进行:微调类方法在官方训练/测试划分上训练并评测,零样本方法只在测试划分上评测。表 1 是 Layer I / Layer II 的定位类任务,RS / PS / RPS 分别指指代分割、全景分割与指代全景分割,RFG 是本文新提出的指代功能定位(要求定位出所有「能共同组成功能装置」的部件,而不是某一个类别的实例)。

方法 RS cIoU RS mIoU PS cIoU PS mIoU RPS cIoU RPS mIoU RFG cIoU RFG mIoU
Sa2Va(零样本) 14.96 32.78 35.53 54.14 17.50 37.98 14.26 20.64
Sting-Bee(微调) 18.72 26.81 31.05 33.49 15.40 19.59 12.72 14.96
Groma(微调) 14.25 21.99 36.73 13.78 17.94 24.10 20.07 29.55
Falcon 25.86 35.39 14.37 38.02 21.74 35.30 50.45 69.58

(原文表格中部分括号内的 Δ 标注与列的对应关系看起来有串位,这里只保留数值本身;RFG 一列的提升幅度与正文表述一致:cIoU +30.38、mIoU +40.03。)

表 2 是 Layer II 的组合语义定位与 Layer III 的关系安全指标。CPC 为部件存在检查,MCI 为缺失部件识别,FC 为功能完整性,SRL 为场景风险水平,PCS 为潜在部件集合,CLR 为部件链接风险;除 CPC / MCI / PCS 报准确率与 F1 外,其余报误差(越低越好)。

方法 CPC Acc / F1 MCI Acc / F1 FC MAE / RMSE SRL MAE PCS Acc / F1 CLR MAE
Sa2Va(零样本) 58.40 / 46.20 12.60 / 15.80 0.60 / – 0.40 13.56 / 54.90
Sting-Bee(微调) 98.00 / 98.00 93.45 / 96.31 0.031 / 0.36 0.23 14.89 / 56.34 0.24
Groma(微调) 98.00 / 98.00 97.10 / 98.60 0.019 / 0.13 14.90 / 57.06
Falcon 98.10 / 97.97 94.75 / 97.33 0.017 / 0.09 0.02 15.10 / 57.69 0.005

场景理解与 VQA(论文 Table 2)没有单列,但它的结论很干脆:零样本通用模型迁移到 X 光域很差(例如 Groma 零样本 caption BLEU 18.8、VQA BLEU 3.32),连域内适配过的 Sting-Bee 零样本也只有 caption BLEU 24.61;一旦在 Falcon-X 上微调,各模型的 caption 与 VQA 指标几乎全部饱和(VQA BLEU 普遍到 99.9 上下、METEOR 91 左右),Falcon 只是小幅领先(caption BLEU 40.92、ROUGE-L 47.74、CIDEr 0.064;VQA BLEU 99.93、METEOR 91.98)。也就是说,常规场景理解在这个域里基本只是一个域适应问题,不是本文要解决的难点。

消融实验

表 3 逐个开关 SSA 的三组预测头(R = 风险、P = 部件存在、L = 链接),全部在指代功能定位(RFG)上评测。

变体(R / P / L) RFG cIoU 相对无头 RFG mIoU 相对无头
✗ ✗ ✗(退化为无结构化信号的区域级 VLM) 35.82 43.43
✓ ✗ ✗ 39.33 +3.51 47.98 +4.55
✓ ✓ ✗ 45.52 +6.19 58.60 +10.62
✓ ✓ ✓ 50.45 +4.93 69.58 +10.98

表 4 用 Oracle 设置把感知误差与推理误差分开:Oracle-Reasoning 在同一批预测区域上替换成真值关系分配(固定感知、只隔离决策层),Oracle-Perception 用真值掩码替换预测区域但保留学到的推理(给出感知上界)。

模式 感知 推理 RFG cIoU Δ RFG mIoU Δ
Falcon 预测 预测 50.45 69.58
Oracle-Reasoning 预测 真值 59.61 +9.16 79.53 +9.95
Oracle-Perception 真值 预测 79.49 +29.04 83.42 +14.84

关键发现

  • 链接头是功能定位的主要驱动力。 关掉全部结构化头时 RFG 只有 35.82 / 43.43;只开风险头只涨 3.51 / 4.55,加上存在头到 45.52 / 58.60,而再打开链接头又涨了 4.93 / 10.98。风险与存在都是「单点」标量,链接才是唯一承载「部件之间关系」的量——这条消融直接支撑了论文「关系监督而非更好的物体分类带来提升」的论点。
  • 感知仍是比推理更大的瓶颈。 推理侧余量是 9.16 cIoU / 9.95 mIoU(把关系分配换成真值);而在此之上再换成真值掩码还能再涨 19.88 cIoU / 3.89 mIoU。也就是说即使关系推理做到完美,分割质量仍压着整体上限,SSA 不能替代一个更好的分割器。
  • 存在识别已经饱和,关系指标才是分水岭。 微调后 CPC 全员约 98%,说明「有没有电池」不难;但零样本模型的 MCI 准确率只有 12%–14%,微调后 FC 的 MAE 仍能差到 0.031(Sting-Bee)对 0.017(Falcon)、CLR 的 MAE 差到 0.24 对 0.005。提升集中在依赖兼容性的指标上,与「改进来自结构化建模」的解释一致。
  • 本文并非在所有任务上取胜,作者也如实写了。 在外观驱动的 PS / RPS 上 Falcon 没有全面超过微调基线(PS cIoU 14.37 低于 Groma 微调的 36.73),在缺失部件识别(MCI)上 Groma 微调(97.10 / 98.60)也高于 Falcon(94.75 / 97.33)。这个反差其实强化了论文的主张:一旦目标由「长什么样」变成「怎么组合」,结构化建模的收益才显现出来。
  • 逻辑一致性(PCS)对所有人都很难。 各方法的潜在部件集合准确率都只有 14%–15% 左右,F1 在 57 上下,说明从预测的存在与链接推出「哪些集合可行」这一步,即使是本文方法也只是略有改善。

亮点与洞察

  • 把「威胁」从类别标签改成关系量,并让模型预测这些关系量,是本文最可迁移的设计。任何「单独看没事、组合起来才出事」的判断——危险品配伍、药品相互作用、设备故障链——都能套这个「部件存在 + 类型级兼容矩阵 + 场景风险」的模板;论文自己指出,只要更换部件词表与兼容规则,模板即可平移到其他模块化威胁。
  • 语义瓶颈(semantic bottleneck)把关系推理逼回感知侧。 第二阶段冻结检测器与 LLM、只训 SSA,LLM 能拿到的新信息只有 7 个标量,这等于用架构约束取代了口号式的「让 LLM 学会推理」。好处是可诊断:消融能精确定位到是哪个头在起作用,而不是只能报一个端到端指标。
  • 反事实用掩码引导 inpainting 而不是置零,避免模型走「识别伪影」的捷径;同时风险标签刻意保留「缺件也可能高风险」的模糊性,切断风险分从存在向量平凡推导的路径。这两个细节都是数据构造层面的巧思,对任何需要「缺件/缺模态」监督的任务都可直接借用。
  • Oracle 消融把感知余量与推理余量分开量化,是评估结构化多模态系统时很值得抄的诊断方式:先证明「关系分配换成真值能涨多少」,再证明「掩码换成真值还能涨多少」,读者一眼就能看出瓶颈在哪一侧。
  • 最「啊哈」的一点是:论文并没有靠更大的模型赢,而是在一个冻结的 7B LLM 前面接了一个很轻的适配器,就把功能定位从 20 cIoU 拉到 50 cIoU——说明在这类任务上,注入什么结构化信号比骨干网络多大更关键

局限与展望

  • 部件词表过窄、兼容关系是预定义的。 类型集合只有 {电池、起爆器、主装药},兼容矩阵 \(L\) 在类型层面预定义并作为标注脚手架,无法表达实例级或上下文相关的兼容(例如某种电池配某种起爆器的匹配度)。论文承认换词表即可扩展,但没有做实验验证。
  • 数据以合成为主。 真实基础图约 7,000 张,最终约 50,000 张里大部分是反事实变体;合成样本与真实缺件场景之间的分布偏移没有被单独评估(例如模型是否会利用 inpainting 的痕迹),这是基准可信度上最需要补的一环。
  • 风险标签的主观性使绝对数值的跨方法比较需要谨慎。 \(r\) 由同一批专家给出且允许「缺件但高风险」,MAE 的绝对大小受标注口径影响,论文没有报告标注者一致性。
  • 单视角、未利用双能信息。 数据来自双能 X 光扫描,但方法把输入统一 resize 成 448×448 的图像通路,材料属性信息在架构中没有被显式利用,这对区分「电池」与形状相近的金属件其实很有价值。
  • 只验证了一种威胁模板。 跨数据集泛化的结果在附录,正文没有给;跨域(其他模件威胁、工业或医疗 X 光)完全未验证。
  • 可改进方向:把类型级兼容矩阵升级为可学习的实例级兼容(例如在链接头上引入实例 slot 之间的注意力而非类型拼接);把感知瓶颈当一等公民处理(联合微调检测器或引入更强的开放词汇分割);在基准里加入合成痕迹检测作为阴性对照,以证明模型不是靠伪影识别缺件。

相关工作与启发

  • vs STCray / Sting-Bee:他们给 X 光域带来图文对数据与域适配的 VLM,任务仍是图像描述、目标定位与 VQA,威胁被归到单个物体上。本文保留这些任务作为 Layer I 的基线,但把评测推进到「部件组合是否成立」:新增功能完整性、缺失部件识别、指代功能定位与关系一致性分析,监督也从文本扩到结构化安全状态。
  • vs SIXray / OPIXray / HiXray / PIDray 等检测基准:这些是闭集、对象级、针对完整违禁品的大规模基准,评测「有没有检出来」。Falcon-X 规模最小(约 7,000 张基础图),但它是唯一同时提供密集掩码、多模态任务与结构化功能威胁监督的基准——论文的对比表把「是否显式建模拆散部件」单列成一项。
  • vs Groma / LISA / GLaMM / KOSMOS-2 等区域级 MLLM:它们用区域 token 或框 token 让 LLM 能指代与分割,但没有对区域之间关系的显式监督。本文在区域集与 LLM 之间插入一个固定的关系状态,把「区域 → 语言」改成「区域 → 关系状态 → 语言」,代价是多了几个必须准确标定的中间量。
  • vs 神经符号组合推理(如 NS-CL、NAVER 这类显式程序/自动机方案):那些方法用可解析的符号程序表达组合逻辑,本文用的是「类型级兼容模板 + 可微预测头」这种软符号方案——不需要程序解析器,端到端可训,但兼容关系因此不能随上下文变化,也无法给出可回溯的推理链。
  • 启发:这套「先预测结构化关系状态、再 token 化注入冻结 LLM」的范式可以直接搬到视频异常检测(人物 + 物品 + 动作的时序组合)、工业质检(多零件装配缺陷)等场景;关键是把「组合成立的条件」写成一个维度固定、可监督、可消融的中间量,而不是期待 LLM 从隐式注意力里自己悟出来。

评分

  • 新颖性: ⭐⭐⭐⭐ [把安全威胁形式化为「存在 + 类型级兼容 + 风险」的关系量并显式注入 LLM,问题定义与基准都是新的,方法本身是已有组件的合理组合。]
  • 实验充分度: ⭐⭐⭐⭐ [主表覆盖 7 个基线 × 9 类任务,另有头部消融与 Oracle 感知/推理解耦消融;但基础图仅约 7,000 张、合成样本占比高,且只验证了一种威胁模板。]
  • 写作质量: ⭐⭐⭐⭐ [问题形式化清晰,任务分层合理,并如实写出自己在 PS / RPS / MCI 上不占优;部分公式在抽取后损坏,表格中 Δ 标注的列对应也有串位。]
  • 价值: ⭐⭐⭐⭐ [为「组合性安全推理」提供了一个可复用的评测范式与一个干净的结构化注入方案,对安全关键场景的 VLM 落地有直接参考意义。]