跳转至

Divide and Align: Disentangled Vision-Language Learning for Text-Based Person Anomaly Search

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/ErgastiAlex/SeDA
领域: 多模态VLM
关键词: 文本行人异常检索, 语义解耦, 视觉语言表示, 语义Token投影, 特征解耦损失

一句话总结

针对基于文本的行人异常检索中外观、动作与背景混杂导致的误匹配问题,本文提出解耦视觉语言检索框架 SeDA,通过语义 Token 投影与大模型分解监督,将表征解耦为外观、动作与背景三路子空间并自适应重组,显著提升异常行为检索与跨域泛化能力。

研究背景与动机

基于自然语言描述的行人检索在视频监控与智能安防领域具有极高的实用价值。以往传统的文本行人检索基准(如 CUHK-PEDES、ICFG-PEDES 等)绝大多数聚焦于静态外观属性,例如服装颜色、发型或随身配饰等。然而在真实场景中,不同行人的外观往往高度相似,单纯依赖静态外观往往无法准确定位目标个体,亟需利用行人的具体动作行为以及发生所处的环境背景来进行细粒度语义消歧。为此,近年来学术界提出了基于文本的行人异常检索(Text-Based Person Anomaly Search, TPAS)任务,要求模型同时检索展现正常与异常行为的个体,大幅拓宽了检索的语义复杂度和实际监控价值。

然而,现有的 TPAS 模型大多直接沿用通用视觉语言对齐架构或仅在图像侧引入姿态图等先验信息,其核心问题在于将外观、行为动作与背景环境纠缠在单一的全局联合表征空间中。由于缺乏显式的解耦约束,模型极易产生捷径学习(Shortcut Learning),过度依赖行人的外观身份先验或局部静态背景,而在处理以动作行为为核心的异常文本查询时发生对齐失效,难以及时区分“同样穿深色衣服,一个人在正常行走,另一个人在摔倒受伤”等细粒度差异。

为了打破这种特征维度的语义混杂,必须在视觉与文本双模态中结构化地拆分出互补且正交的语义因式,让模型在保持统一跨模态度量空间的同时具备局部属性感知力。核心 idea:提出解耦视觉语言学习框架 SeDA,通过语义 Token 投影模块将视觉与文本全局表征动态解耦为外观、动作与背景三个正交因子并自适应重组,结合大语言模型引导的特征解耦损失与多粒度图文匹配,实现精准的细粒度跨模态异常对齐。

方法详解

整体框架

SeDA 的整体架构以双分支跨模态网络为骨干,包含图像分支、文本分支以及跨模态交互分支。输入包含 RGB 图像 \(I\) 及其渲染的 2D 骨骼姿态图 \(P\)(共同送入 Swin-B 提取视觉嵌入序列 \(f_I\)),以及自然语言描述 \(T\)(送入 BERT 前 6 层提取文本嵌入序列 \(f_T\))。在训练阶段,原始文本描述还被大语言模型(Qwen3-8B)解构为外观、动作与背景三个子描述作为锚点。随后,视觉与文本特征分别通过语义 Token 投影(STP)模块,衍生出解耦的外观、动作与背景 Token,并重构生成更具判别力的全局 \([CLS]\) Token。最后,通过特征解耦损失(FDL)、对比损失、跨模态编码器(BERT 后 6 层)上的细粒度图文匹配损失(ITM 与 ITM-sem)以及掩码语言建模损失(MLM)进行联合优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
    A["输入数据<br/>RGB图像+姿态图 / 原始文本描述"] --> B["模态编码骨干<br/>Swin-B 视觉编码 / BERT 前6层文本编码"]
    B --> C["语义Token投影 STP<br/>全局查询生成 → 协同加权聚合 → 因子重构"]
    C --> D["特征解耦损失 FDL<br/>LLM子描述锚点约束三维语义正交"]
    C --> E["细粒度图文匹配 ITM-sem<br/>跨模态编码器对齐各因子图文配对"]
    D --> F["综合跨模态检索目标<br/>对比损失 + 语义ITM + 掩码建模联合优化"]
    E --> F
    F --> G["紧凑判别表征输出<br/>用于高效跨模态异常行人检索"]

关键设计

1. 语义Token投影(STP):协同加权解耦与自适应表征重构

传统的单向量表征由于全局池化不可避免地将多种属性杂糅在一起。STP 模块的设计目的是在不破坏全局上下文的前提下,结构化地提取并重组单模态表征中的特定语义因式。以模态 \(M \in \{I, T\}\) 为例,STP 首先利用模态特定的投影矩阵 \(W_d^M \in \mathbb{R}^{d \times 3d}\) 将全局 \([CLS]\) Token \(x_{[CLS]}^M\) 映射并均等切分为三个语义查询向量:外观查询 \(q_M^{App}\)、动作查询 \(q_M^{Act}\) 和背景查询 \(q_M^{Bg}\)

\[[q_M^{App}, q_M^{Act}, q_M^{Bg}] = \mathrm{Split}(x_{[CLS]}^M W_d^M)\]

对于每个语义因子 \(k \in \{App, Act, Bg\}\),STP 计算该查询与模态序列所有 Token \(x_i^M\) 的点积,并通过 Sigmoid 函数获得注意力权重 \(\alpha_M^{i,k} = \sigma(x_i^M \cdot q_M^k)\)。相比于 Softmax 容易带来的“赢者通吃”竞争效应,Sigmoid 允许图像或文本中的多个相关区域协同贡献,从而聚合得到因子特征 \(\tilde{x}_M^k = \sum_{i=1}^L \alpha_M^{i,k} x_i^M\)。随后将查询与聚合特征拼接并通过投影矩阵 \(W_m^M\) 映射为解耦语义 Token \(z_M^k\)。最后,为了输出供检索匹配的紧凑 \([CLS]\) Token,图像侧拼接三个因子 Token 经 \(W_p^I\) 输出 \(z_I^{[CLS]}\)(排除原全局池化 Token,避免重新引入全局杂糅),而文本侧由于句序语义的互补性,保留原 \(x_{[CLS]}^T\) 与三个因子 Token 共同拼接映射出 \(z_T^{[CLS]}\)

2. 特征解耦损失(FDL):基于大模型分解锚点的显式语义正交监督

仅靠网络结构自身无法确保投影出的三个 Token 真正落在语义定义的外观、动作和背景概念上。为了提供显式的语义锚定,在离线训练阶段利用 Qwen3-8B 将原始文本描述无损分解为外观子句 \(T^{App}\)、动作子句 \(T^{Act}\) 与背景子句 \(T^{Bg}\)。这三个子句被同样的文本编码器与 STP 处理,分别提取出单一因子的锚点 Token \(z_{T^k}^k\)。FDL 借助 InfoNCE 形式的对比目标,拉近模态特定因子 Token 与其对应子句语义锚点的距离,同时推开批次内非配对样本:

\[\mathcal{L}_{FD} = \sum_{k \in \{App, Act, Bg\}} \left( - \log \frac{\exp(\mathrm{sim}(z_I^k, z_{T^k}^k) / \tau)}{\sum_{j=1}^N \exp(\mathrm{sim}(z_{I_j}^k, z_{T^k}^k) / \tau)} - \log \frac{\exp(\mathrm{sim}(z_T^k, z_{T^k}^k) / \tau)}{\sum_{j=1}^N \exp(\mathrm{sim}(z_{T_j}^k, z_{T^k}^k) / \tau)} \right)\]

其中温度参数 \(\tau = 0.07\)。该损失不仅促使视觉与文本分支的 \(z^k\) 专注于特定语义属性,还隐式抑制了各因子捕获无关模态特征,彻底消除由于身份先验引起的语义偏差。

3. 语义感知图文匹配(ITM-sem)与多层级难负例挖掘

在跨模态编码层中,模型不仅需要全局判断整图与整句是否匹配,还需要确保细粒度属性的一致性。本文将传统的全局图文匹配损失扩展为语义感知匹配损失 \(\mathcal{L}_{ITM-sem}\),将图像分别与三个解耦子句构造成对样本 \((I, T^{App})\)\((I, T^{Act})\)\((I, T^{Bg})\) 并计算二元交叉熵损失之和。同时,在批次内不仅依据全局归一化 \([CLS]\) 相似度采样最具挑战性的难负例,还在因子级别依据各子空间相似度挖掘外观混淆、动作差异或背景迥异的细粒度难负例,促使模型在极度相似的候选池中依然保持敏锐的判别能力。

损失函数 / 训练策略

模型总训练损失为各项任务的多目标等权联合:

\[\mathcal{L} = \mathcal{L}_{FD} + \mathcal{L}_{C} + \mathcal{L}_{ITM} + \mathcal{L}_{ITM-sem} + \mathcal{L}_{MLM}\]

模型在 4 块 NVIDIA L40S GPU 上训练 30 个 epoch,每个 GPU 的 batch size 为 22。初始学习率设为 \(1 \times 10^{-4}\),并线性衰减至 \(1 \times 10^{-5}\),采用 AdamW 优化器(权重衰减 0.01),基干权重基于 X-VLM 初始化。值得注意的是,大模型文本分解仅在训练期用于构建锚点监督,推理阶段无需分解文本,保持与基线相同的推理延迟与显存开销。

实验关键数据

主实验

在行人异常检索基准 PAB(100 万对图文)以及基于真实监控截取的分布外异常检索数据集 UCC 上进行全面对比。SeDA 显著超越了先前的 SOTA 方法 CMP 以及各主流图文检索模型。

数据集 方法 训练数据量 R@1 (%) R@5 (%) R@10 (%) mAP (%)
PAB MRA 0.1M 70.53 94.69 97.47 81.59
PAB APTM 0.1M 72.14 95.30 97.17 82.78
PAB CLIP 0.1M 77.60 98.84 99.75 87.35
PAB X-VLM 0.1M 81.95 98.84 99.19 89.86
PAB CMP (前SOTA) 0.1M 83.06 98.89 99.49 90.41
PAB SeDA (Ours) 0.1M 85.14 99.24 99.80 91.83
PAB CMP (前SOTA) 1.0M 84.93 99.09 99.75 91.66
PAB SeDA (Ours) 1.0M 86.45 99.44 99.85 92.59
UCC (OOD) CMP (前SOTA) 1.0M 55.23 71.67 77.99 44.35
UCC (OOD) SeDA (Ours) 1.0M 58.97 73.37 79.08 44.57

同时,在包含风、雨、雪、暗光等 10 种恶劣天气变化的复杂城市场景测试中,SeDA 在多天气平均 R@1 上达到 69.55%(相比 CMP 的 67.12% 提升 +2.43),平均 mAP 提升 +1.90。

消融实验

在 PAB 0.1M 子集上对 STP 结构变体、各损失函数模块以及语义因子组合进行系统消融:

实验编号 配置 / 变体 R@1 (%) R@5 (%) R@10 (%) mAP (%) 说明
(0) CMP (Baseline) 83.06 98.89 99.49 90.41 未解耦基线
(I) \(\text{STP}_{\text{softmax}}\) 83.82 99.04 99.65 90.95 将 Sigmoid 改为 Softmax 归一化
(II) \(\text{STP}_{\text{CA}}\) 83.92 98.94 99.44 90.92 采用标准交叉注意力模块
(III) STP (Sigmoid) 84.78 99.04 99.59 91.54 完整 STP,但未加入 \(\mathcal{L}_{ITM-sem}\)
(IV) STP w/o \(\mathcal{L}_{FD}\) 83.15 99.09 99.39 90.52 移除特征解耦损失,性能跌回基线
(V) Full Model (STP + \(\mathcal{L}_{ITM-sem}\)) 85.14 99.24 99.80 91.83 完整模型(加各因子独立匹配)
(VI) 仅外观 (App) 83.67 98.43 98.69 90.64 单独使用外观分支
(VII) 仅动作 (Act) 83.92 97.42 97.92 90.39 单独使用动作分支
(VIII) 仅背景 (Bg) 82.10 97.07 97.52 89.33 单独使用背景分支
(IX) 外观 + 动作 84.50 98.94 99.34 91.41 两两组合均优于单分支
(X) 全部三因子融合 85.14 99.24 99.80 91.83 三因子互补效果最佳

关键发现

  • 解耦监督的核心必要性:移除 \(\mathcal{L}_{FD}\) 后,R@1 大幅跌落 1.63 个百分点(从 84.78% 降至 83.15%),几乎回退至原始 CMP 基线。这表明单纯依靠模块结构无法实现特征自发解耦,必须引入基于语义分解文本的强监督信号。
  • 协同权重优于竞争性注意力:在注意力聚合设计中,基于 Sigmoid 的软加权比 Softmax(83.82%)以及标准交叉注意力(83.92%)高出近 1 个百分点。Softmax 的归一化特性会产生“胜者通吃”,破坏了不同属性词或图像多区域的协同表达。
  • 数据高效与泛化增益:SeDA 仅需 0.1M 训练样本(85.14% R@1)即可击败在 1.0M 全量数据上训练的 CMP 基准(84.93% R@1);且在分布外的真实监控暴力/事故检测数据集 UCC 上实现 +3.74% R@1 的显著提升,验证了解耦表征对抗环境干扰与数据漂移的卓越鲁棒性。

亮点与洞察

  • 训练解耦与推理紧凑的统一:在训练期通过 LLM 拆分文本提供细粒度锚点,而在推理期直接使用模态自身的 STP 生成重组紧凑表征,在未增加任何推理额外计算开销的前提下实现了深度解耦。
  • Sigmoid 协同聚合机制:摒弃传统跨模态检索常用的 Softmax 注意力归一化,采用独立 Sigmoid 权重,避免了文本中多个相关关键词(如“蓝色衬衫”、“黑色短裤”)或人体多个局部在归一化下的相互抑制。
  • 因子间非排他性互补:消融实验证明,动作与背景因子的有效建模直接填补了传统行人检索“重外观、轻行为”的空白,特别是在异常检测中,背景线索(如泳池边、机房、马路)对动作合理性提供了关键上下文约束。

局限与展望

  • 依赖预训练骨干与姿态检测质量:视觉编码强依赖姿态估计生成的 2D 骨骼关节图,若在极度低光照、大面积遮挡或严重模糊场景下姿态检测失效,动作解耦分支的特征提取质量将受到拖累。
  • 离线 LLM 分解的静态约束:目前仅使用固定的 Qwen 提示词进行三元分解,对于包含复杂时序或因果推理的长描述,这种预定义的机械三元切分(外观/动作/背景)可能存在语义边缘模糊的问题。
  • 未来改进方向:可探索无需显式姿态图的端到端隐式行为表征建模,并结合视觉语言大模型(VLM)进行交互式的因果反事实推理以辅助异常判定。

相关工作与启发

  • vs CMP [ICCV 2025]: CMP 首次提出了 PAB 基准并结合姿态信息与难负例挖掘,但其所有特征在单一空间混合编码,极易造成以身份外观为主导的捷径偏置;SeDA 提出了显式的 STP 模块与 FDL 损失,在视觉和文本两端实现正交解耦与自适应融合。
  • vs 传统 TBPS 方法 (如 IRRA, RaSa): 传统方法默认行人以行走等静止/常规动作为主,缺乏动作与场景交互建模;SeDA 证明将背景、动作独立成子空间后,不仅在异常动作检索中大幅领先,在常规身份检索上也保持了精度提升。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 针对 TPAS 任务提出了优雅的语义 Token 投影和基于 LLM 拆分的解耦对齐机制,结构清晰切中痛点。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 1M 全量基准、多天气鲁棒性评测、OOD 泛化验证、模块消融以及各因子组合全面分析,证据详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑推进严谨自然,从混杂痛点到解耦设计叙述连贯,实验图表排布清晰。
  • 价值: ⭐⭐⭐⭐☆ 为开放环境下的文本行人异常检索与智能监控提供了高效实用的范式,训练解耦与推理免切分的思路具有很强的可推广性。