跳转至

Region-Aware Multimodal Interleaving for Animal Re-Identification

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/ML-4-SocialGood/RAMI.git
领域: 多模态 VLM
关键词: 动物重识别, 区域感知, 多模态交错, 细粒度判别, 计算机视觉赋能社会公益

一句话总结

针对野生动物重识别中全局特征易过拟合背景且纯文本难以精细刻画个体纹理的问题,本文提出 RAMI 框架,利用轻量级无监督图像处理挖掘具生物学辨识度的前景局部区域,并在浅层 Transformer 中将区域视觉 token 与文本占位符交错融合进行密集跨模态交互,显著刷新了多个基准与野外数据集的 SOTA。

研究背景与动机

动物重识别(Animal ReID)旨在跨时间、跨机位从红外相机与监控影像中精准识别个体,是野生动物生态监测、种群动态评估与行为追踪的关键技术底座。然而,相较于具有规范姿态与先验结构的人体与车辆重识别,野生动物面临更极端的形态形变、视角变化、复杂遮挡以及剧烈的野外光照与环境域漂移。现有主流方法大多依赖整图的全局视觉表征,注意力极易被杂草、泥土、树木等复杂背景所干扰,从而学习到脆弱的虚假相关性;即便引入全局花纹提取方法,其粗粒度模式仍然对背景介入和局部遮挡十分敏感,难以稳定捕捉区分个体的细粒度身份证据。

近年来,将对比语言-图像预训练模型(如 CLIP)引入动物重识别展现了利用多模态语义引导表征学习的潜力。然而,现有范式通常局限于简单的全局跨模态对齐或事后特征拼接,且野生动物赖以区分个体的关键特征(例如细碎独特的皮毛斑纹、面部斑块、局部轮廓纹理)极其繁复微妙,很难仅用自然语言纯文本穷尽描述。传统多模态大模型中的交错(interleaving)机制虽然在长文本与多图生成推理中取得突破,但如何将其适配至基于预训练视觉语言模型的细粒度判别表征学习,此前仍是一片空白。

本文的切入点在于将多模态语义引导从全局下沉至生物学显著的局部区域,通过显式的视觉-文本交错序列实现密集的细粒度语义交互。核心 idea:构建轻量级无监督局部区域挖掘流程获取高辨识度生物学斑块,并将其映射为区域 token 嵌入文本模板占位符,在浅层 Transformer 中利用自注意力实现细粒度视觉-文本交错融合,以极小参数开销实现精准且具有因果可解释性的个体判别。

方法详解

整体框架

RAMI 框架将动物重识别形式化为局部高信息量区域上的密集跨模态语义交互过程。整个流水线包含四大核心阶段:首先,通过无监督的图像驱动区域挖掘算法从输入图像中提取前景区域斑块;接着,利用 SigLIP 视觉编码器提取区域特征并经轻量级 TokenProjector 投影至文本隐藏空间;随后,将区域视觉 token 插入包含物种与 ID 的文本模板占位符中,构造出带有可学习 pooling token 的交错序列;最后,送入单层 Transformer 结构的 Interleaver 进行自注意力交互,输出富含细粒度跨模态线索的表征,并结合联合损失函数进行训练。在推理阶段,模型完全舍弃文本与区域挖掘分支,直接利用 SigLIP 视觉编码器提取查询和底库图像特征进行常规匹配,保持了与实际部署完全一致的高效性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入样本图像"] --> B["图像驱动的生物学局部区域挖掘"]
    B --> C["区域感知视觉词元化与投影"]
    C --> D["区域引用文本占位符交错锚定"]
    D --> E["浅层 Transformer 密集交错注意力交互"]
    E --> F["对齐损失与联合判别目标优化"]
    A -.->|推理阶段仅保留视觉主干| G["SigLIP 视觉表征提取与余弦匹配"]

关键设计

1. 图像驱动的生物学局部区域挖掘:无参数且统计稳健的显著模式提取

为了摆脱对昂贵人工局部标注的依赖并防止背景噪声干扰,RAMI 设计了一套全自动且轻量化的图像处理流水线。该设计首先利用冻结的通用分割模型(如 SAM 3)提取动物前景掩码,彻底剔除外部环境背景;随后对前景区域进行灰度归一化以消除颜色偏差,并计算 Sobel 梯度幅值图,精准量化表征局部纹理变化剧烈度(如斑纹条纹、面部轮廓、斑点)的像素级重要性分数。针对野外图像中由于遮挡或姿态变化导致的分数波动,RAMI 引入基于假设检验的统计控制策略,计算每个像素重要性分数的单尾检验 \(p\) 值: $\(p(s_l) = \frac{|\{s_k \in S_i : s_k \geq s_l\}|}{L}\)$ 并在全图利用 Benjamini–Hochberg(BH)过程将错误发现率(FDR)严格控制在 5% 水平,在数据集层面取显著区域计数的众数(mode)作为基准,稳定筛选出最具生物学代表性且对个体判别最关键的候选区域集合 \(R_i = \{r_{i,1}, \dots, r_{i,N}\}\)

2. 区域感知词元化与区域引用文本占位符锚定:跨模态语义空间的一致性映射

针对自然语言难以精确描述复杂动物斑纹的痛点,RAMI 建立了一种将图像局部细节与语言结构紧密绑定的锚定机制。挖掘出的 \(N\) 个局部区域被送入冻结或微调的 SigLIP 视觉编码器,提取各区域的视觉 patch 嵌入 \(r_i \in \mathbb{R}^{N \times pats \times d_v}\)。由于视觉与文本特征维度不匹配,模型通过一个极轻量的投影层 TokenProjector \(\mathcal{P}(\cdot)\) 将其映射到与文本隐藏层完全相同的维度空间中: $\(\mathbf{z}_i = \mathcal{P}(\mathbf{r}_i) \in \mathbb{R}^{N \times pats \times d_t}\)$ 与此同时,系统根据图像样本的物种和身份构建结构化描述模板:“A photo of a {species} individual with identity {id}. This individual has \(\langle\text{reg}_1\rangle \dots \langle\text{reg}_N\rangle\) patterns.”。文本编码器将该模板编码为包含占位符的文本 token 序列 \(\mathbf{z}_i^{(t)}\),进而将投影后的区域视觉 token 精确交错拼接填入对应占位符位置,构建出统一的多模态交错表征 \(\kappa_i = \mathbf{z}_i^{(t)} \oplus \mathbf{z}_i\)

3. 浅层 Transformer 密集交错注意力交互:全局语义与微观花纹的深度融合

传统的多模态对齐仅依靠单向量对比损失,无法在 token 级别实现深层次的双向信息流动。RAMI 引入一个仅包含单层多头自注意力(Multi-Head Self-Attention)的浅层 Transformer Interleaver 模块 \(\mathcal{F}(\cdot)\)。在交错 token 序列的最前端,显式拼接一个可学习的汇聚 token(pooling token)\(\mathbf{z}_i^{pool}\): $\(\boldsymbol{\kappa}_i = [\mathbf{z}_i^{pool}, \mathbf{z}_{i,1}^{(t)}, \mathbf{z}_{i,1}, \mathbf{z}_{i,2}^{(t)}, \mathbf{z}_{i,2}, \dots, \mathbf{z}_{i,N}, \mathbf{z}_{i,M}^{(t)}]\)$ 在自注意力计算过程中,该汇聚 token 作为全局跨模态感知中枢,动态汇聚来自物种上下文、身份文本以及每一个局部视觉斑块之间的相互关系,最终输出高度凝练且融合了密集跨模态线索的综合表征 \(\bar{\kappa}_i = \mathcal{F}(\boldsymbol{\kappa}_i) \in \mathbb{R}^{d_t}\)。整个模块仅带来约 15.94M 的极小参数增量,却实现了微观特征与全局语境的深度穿透。

4. 渐进式多任务目标优化与反事实因果正则化:兼顾对齐稳定性与细粒度判别

为了确保轻量投影模块与跨模态交互模块的收敛稳定性,RAMI 采用渐进式训练方案。第一阶段,冻结 SigLIP 预训练主干,仅利用 SigLIP 风格的 Sigmoid 对比损失 \(\mathcal{L}_{Sig}\) 对 TokenProjector 与 Interleaver 进行充分预热: $\(\mathcal{L}_{Sig} = -\frac{1}{B}\sum_{i=1}^B \sum_{j=1}^B \log \frac{1}{1 + \exp(-\sigma_{i,j} \cdot s(v_i, t_j))}\)$ 第二阶段进入联合微调,同时解冻视觉编码器,联合优化带有标签平滑(\(\epsilon=0.1\))的交叉熵身份分类损失 \(\mathcal{L}_{id}\)、带边界间隔(\(\gamma=0.7\))的三元组损失 \(\mathcal{L}_{tri}\) 以及对比对齐损失 \(\mathcal{L}_{Sig}\)。此外,为了从因果层面严谨验证各局部斑块的必要性,论文还构建了反事实扰动策略:在特征空间中逐一遮蔽第 \(n\) 个区域以评估语义相似度的变化量 \(\Delta_{i,n}(x_i) = s(v_i, t_i) - s(v_i, t_i^{\setminus n})\),从而精确量化并证实了局部关键区域对个体身份判别的因果主导贡献。

损失函数 / 训练策略

总联合训练目标表示为: $\(\mathcal{L}_{overall} = \mathcal{L}_{id} + \mathcal{L}_{tri} + \mathcal{L}_{Sig}\)$ 其中 \(\mathcal{L}_{id} = -\sum_{\phi=1}^\Phi q_\phi \log(p_\phi)\) 采用平滑真实分布 \(q_\phi = (1-\epsilon)\delta_{\phi, y_i^c} + \epsilon/\Phi\)\(\mathcal{L}_{tri} = \max(d_{pos} - d_{neg} + \gamma, 0)\)。主干网络采用 SoViT-400m 架构的 SigLIP 视觉模型。训练过程首先在 batch size 为 32 下使用 AdamW 优化器对投影与交互层预热 10 个 epoch(学习率 \(1 \times 10^{-3}\)),随后以视觉主干学习率 \(1 \times 10^{-5}\)、交互模块学习率 \(1 \times 10^{-4}\) 联合优化 60 个 epoch,并全程辅以余弦退火调度。

实验关键数据

主实验

论文在四个公开基准数据集(东北虎 ATRW、长颈鹿 Giraffes、南非薮羚 NyalaData、贝加尔海豹 SealID)以及全新收集的野外白鼬数据集(Stoat)上,与五种前沿 ReID 模型展开了全面对比(均汇报 10 次独立运行的均值及 95% 置信区间):

数据集 指标 TransReID CLIP-ReID GloPER MDReID CARE (前SOTA) RAMI (本文) 相对前SOTA提升
ATRW (东北虎) mAP (%)
Rank-1 (%)
44.6±0.9
89.7±1.0
54.1±0.3
94.2±0.2
37.8±0.0
81.4±0.0
49.5±0.7
91.9±0.6
57.0±0.4
95.4±0.2
63.2±0.1
97.4±0.1
+6.2%
+2.0%
Giraffes (长颈鹿) mAP (%)
Rank-1 (%)
25.1±1.7
51.6±4.1
48.9±0.1
77.2±0.8
20.7±0.0
44.7±0.0
34.9±0.8
66.7±1.8
60.0±0.5
80.9±0.7
69.3±0.4
88.0±0.2
+9.3%
+7.1%
NyalaData (薮羚) mAP (%)
Rank-1 (%)
9.0±0.1
12.9±0.5
13.4±0.1
21.9±0.3
9.3±0.0
12.2±0.0
6.4±0.2
7.7±0.8
16.6±0.1
29.0±0.2
35.3±0.2
58.8±1.1
+18.7%
+29.8%
SealID (环斑海豹) mAP (%)
Rank-1 (%)
11.2±0.4
26.5±3.5
20.4±0.2
57.0±0.5
10.4±0.0
25.0±0.0
12.2±0.9
34.6±2.0
21.6±0.3
58.5±1.1
30.1±0.2
71.0±0.1
+8.5%
+12.5%
Stoat (野外白鼬) mAP (%)
Rank-1 (%)
58.1±1.4
85.7±2.0
62.8±0.3
91.5±0.7
28.9±0.0
63.8±0.0
57.8±0.7
89.3±0.4
64.1±0.2
91.9±0.4
66.8±0.5
91.6±0.5
+2.7%
-0.3%

消融实验

为了严格解耦多模态交错机制以及局部区域建模各自的增益,论文对比了传统纯文本微调基线(SigLIP-FT)与基于全局模式交错的变体(RAMI-Global):

数据集 配置 (SigLIP-FT: 仅全局文本微调) 配置 (RAMI-Global: GloPER 全局模式交错) 配置 (RAMI: 本文区域感知多模态交错) 说明
ATRW mAP: 55.1±0.3 / R-1: 94.2±0.2 mAP: 61.4±0.3 / R-1: 96.5±0.2 mAP: 63.2±0.1 / R-1: 97.4±0.1 区域交错相对全局文本微调 mAP 提升 8.1%
Giraffes mAP: 67.2±0.5 / R-1: 87.1±0.6 mAP: 69.0±0.2 / R-1: 88.2±0.5 mAP: 69.3±0.4 / R-1: 88.0±0.2 长颈鹿大斑块模式下区域建模稳步增益
NyalaData mAP: 25.8±0.8 / R-1: 41.8±1.5 mAP: 34.1±0.3 / R-1: 56.6±0.8 mAP: 35.3±0.2 / R-1: 58.8±1.1 条纹极端细小数据集上区域交错 mAP 提升达 9.5%
SealID mAP: 20.2±0.4 / R-1: 48.8±0.4 mAP: 28.8±0.2 / R-1: 69.6±0.4 mAP: 30.1±0.2 / R-1: 71.0±0.1 斑点花纹下局部感知大幅超越全局模式
Stoat mAP: 61.7±0.6 / R-1: 91.3±0.4 mAP: 64.8±0.4 / R-1: 90.4±0.2 mAP: 66.8±0.5 / R-1: 91.6±0.5 复杂野外环境下细粒度局部信息稳步提点

此外,在反事实因果分析与参数开销分析中: 1. 反事实遮蔽分析(RAMI-CF vs RAMI):遮蔽影响最大的单个区域后,模型在 NyalaData 上的 mAP 由 35.3% 跌至 34.4%,Rank-1 由 58.8% 跌至 56.9%;在 SealID 上 mAP 从 30.1% 降至 29.0%,证明了所挖掘区域承载着决定性的个体因果判别证据。 2. 算力与参数分析:相比于 SigLIP-FT 的 878.01M 总参数量与 428.27M 可训练参数量,RAMI 引入的 TokenProjector 仅占 2.66M,Interleaver 仅占 15.94M(可训练参数量共计增加约 18.6M),反向传播计算量仅由 1440.23G FLOPs 微增至 1504.84G FLOPs,开销基本可忽略。

关键发现

  • 局部区域交错是突破极难细粒度瓶颈的核心:在细小条纹密布的 NyalaData 上,RAMI 相比基线 SOTA 取得了高达 18.7% 的 mAP 与 29.8% 的 Rank-1 巨幅跨越,消融实验证实单单引入局部模式交错就比全局模式交错带来额外 1.2%~2.2% 的 Rank-1 增益。
  • 注意力与解剖学特征高度吻合:Grad-CAM 可视化显示,RAMI 的关注区域与挖掘出的局部斑块高度重合,且对不同物种呈现了特异性聚焦(如长颈鹿皮毛纹理、老虎腿部花纹、海豹环斑、白鼬头部与尾尖毛色),有效抑制了背景杂草和光影虚假相关。
  • 训练辅助-测试脱耦机制极其实用:在推理阶段完全无需运行耗时的图像分割与区域提取,仅靠微调后的视觉编码器提取单图全局表征即可维持全量性能提升,解决了细粒度模型在野外边缘设备上线延迟过高的痛点。

亮点与洞察

  • 将多模态交错范式引入细粒度判别任务:打破了过去仅将视觉-文本交错序列用于自回归多图推理或图文生成的定势,首次证明交错自注意力机制同样能极高精度地指导细粒度判别表征学习。
  • 基于假设检验统计控制的无监督区域挖掘:巧妙结合 SAM 3 前景遮罩与 Sobel 梯度幅值,并引入 Benjamini–Hochberg 统计检验控制 FDR,摆脱了昂贵的生物学关键点人工标注,在保持零可学习参数的同时稳定提供了高质量的判别性局部特征。
  • 反事实扰动量化局部因果贡献:不仅利用常规注意力热力图做解释,更通过系统性剔除单个区域评估表征漂移,为深度模型在生物学与生态学应用中的可信决策提供了因果层面的理论支撑。

局限与展望

  • 对初始分割质量存在依赖:区域挖掘的第一步依赖通用分割模型(如 SAM 3)提取前景掩码。在夜间严重红外噪声、严重植被遮挡或水下浑浊环境中,若分割掩码产生断裂或将背景误认为主体,可能引入噪声区域。
  • 区域语义提示模板较为简单:目前文本端采用固定模板和占位符拼接,未引入大语言模型根据特定物种生理结构先验(如“耳标”、“背鳍切口”)自适应生成的细粒度解剖学描述,未来可探索动植物领域专有知识图谱对占位符语义的协同增强。
  • 固定模式区域数量约束:目前整个数据集统一采用统计众数确定每张图片的区域数量,对于因视角导致可见有效区域差异极大的样本(例如侧身全身照 vs 局部面部特写),动态自适应区域数量应是进一步优化的方向。

相关工作与启发

  • vs CARE (WACV 2026):CARE 通过图像条件提示学习和全局跨模态对齐来缓解动物多变姿态,但其跨模态对齐仍停留在整图粗粒度级别;RAMI 显式分解出生物学显著区域并进行交错注意力融合,彻底解决了复杂背景对细微花纹表征的掩盖问题。
  • vs GloPER (ICCV 2025):GloPER 使用无监督局部重构来抽取全局花纹模式,但完全局限于单模态视觉空间;RAMI 不仅将模式粒度精细化至局部区域,更通过与文本占位符的多模态交错引入了语言语义先验的强有力监督。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将多模态交错机制与无监督统计学区域挖掘引入动物细粒度重识别判别任务,构思精巧。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖五大代表性动物数据集,包含全面的基线对比、模块消融、反事实因果分析与可视化验证。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然流畅,方法拆解清晰严谨,数学公式与图表呈现规范扎实。
  • 价值: ⭐⭐⭐⭐⭐ 显著刷新了生态监测中动物个体识别的技术指标,代码完全开源,对生物多样性保护具有重大实用价值。