跳转至

FoundYou: A Unified Model for Personalized Segmentation and Retrieval

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://ga1i13o.github.io/FoundYou/
代码: https://ga1i13o.github.io/FoundYou/
领域: 语义分割
关键词: 个性化分割, 个性化检索, 目标实例对齐, SAM 2, 参数高效微调

一句话总结

FoundYou 基于冻结的 SAM 2,重释其视频记忆注意力机制用于跨独立图像的实例对齐,仅引入 5.9M 可训练参数即构建出统一的个性化分割与检索模型,推理速度达 90 FPS(比先前统一方案 PDM 快 75 倍),在 PerMIS 分割和 ILIAS 检索基准上分别提升 18.4 mIoU 和 17.8 mAP。

研究背景与动机

个性化图像理解旨在根据用户给定的视觉参考(如某个特定手提包、宠物或个人物品),在其他无关联的照片中精准识别出「同一个物理实体」。这一目标在视觉任务中主要衍生出两个分支:个性化分割需要在目标图像中生成该实体的像素级掩码,而个性化检索则需要在海量图库中挑出包含该实体的所有图像。尽管二者本质上均依赖细粒度的实例级匹配,以往的研究却沿着相互割裂的路径演进:分割方案(如 PerSAM、Matcher)通常借助 DINOv2 或扩散模型先寻找关键点再提示 SAM 生成掩码,但在语义相近的同类干扰物面前极易混淆;检索方案(如 AMES、RoMav2)则侧重全局或局部特征重排,缺乏密集空间定位能力。先前唯一的联合模型 PDM 依赖 Stable Diffusion 反向去噪特征与耗时的 SAM 级联,单图推理耗时近 1 秒(仅 1.2 FPS),参数量高达 1200M,难以应用于实际高吞吐场景。

这两大任务长期割裂的核心瓶颈在于:通用的视觉基础模型要么偏向高层语义类别判别(忽视同一类别下不同实体的细微外观差异),要么依赖图像间重叠视角的几何对齐先验,无法低成本地同时兼顾「实例级跨图像判别」与「高质量密集掩码预测」。值得注意的是,面向视频目标分割的 Segment Anything 2(SAM 2)为了跨帧追踪目标,其记忆机制天生蕴含了极强的个体身份一致性感知能力。然而,SAM 2 的预训练建立在严苛的时空连续性假设之上——帧与帧之间的位移小、背景上下文高度连续;一旦直接迁移到场景、视角、光照完全独立的不同照片中,其内部特征便会因失去连续性先验而大幅退化,且原始模型缺乏输出图像级相似度得分的机制。

本文的切入角度是激活并修正 SAM 2 的记忆机制,使其从「视频帧间追踪」平滑拓展至「跨独立图像实例对齐」。核心 idea:冻结 SAM 2 主干与分割解码器,仅在图像编码器高层嵌入轻量 AdaptFormer 消除时空连续性偏差,并通过一个双向交叉注意力检索头将密集记忆特征聚合为全局相似度得分;在训练阶段引入基于 DINOv2 的离线语义难负例对比与基于 SAM 2 原生预测的掩码自蒸馏正则化,仅用 5.9M 训练参数即实现高效、高精度的个性化分割与检索一体化。

方法详解

整体框架

FoundYou 接收用户提供的参考视觉提示 \(V_r = (I_r, A_r)\)(其中 \(A_r\) 可以是掩码、边界框或单点)以及待测目标图像 \(I_t\)。若待测任务为个性化分割,模型输出目标实例的二值掩码 \(M_t \in \{0, 1\}^{H \times W}\);若为个性化检索,模型输出指示该实体存在概率的标量相似度得分 \(s_t \in [0, 1]\)

整个系统围绕冻结的 SAM 2-small 架构展开:首先利用配备轻量适配层的图像编码器分别提取参考图像特征 \(F_r\) 与目标图像特征 \(F_t\);接着由记忆编码器结合参考提示构建实体记忆表示 \(S_r\) 并存入记忆库;随后通过记忆交叉注意力将目标特征 \(F_t\) 与记忆表征 \(S_r\) 进行稠密对齐,生成条件记忆特征 \(F_t^{\text{mem}}\);最后分流至两条路径——原始冻结的掩码解码器直接利用 \(F_t^{\text{mem}}\) 预测精细分割,而新增的紧凑检索解码器则通过可学习 token 聚合全图线索预测匹配得分。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:参考提示 Vr 与目标图像 It"] --> B["特征自适应机制<br/>AdaptFormer 消除时空连续性偏差"]
    B --> C["记忆编码与跨图像记忆注意力<br/>生成记忆条件特征 Ft_mem"]
    C --> D["双向交叉注意力检索头<br/>聚合生成图像级相似度得分 st"]
    C --> E["冻结分割解码器<br/>输出目标实例密集分割掩码 Mt"]
    F["掩码自蒸馏与语义难负例挖掘"] -.->|正则化与判别监督| B
    F -.->|BCE 监督| D

关键设计

1. 特征自适应机制:消除时空连续性先验并增强跨图像实例对齐

SAM 2 的图像编码器是在连续视频中预训练的,其特征对物体的空间平移以及背景的剧烈切换高度敏感。直接将其用于独立图像匹配时,若同一实体在不同照片中处于完全不同的背景或画幅位置,特征相似度将急剧衰减。为了在不破坏原始高质量空间表征的前提下打破这一时空连续性束缚,FoundYou 在冻结的图像编码器最后两个阶段(blocks 2–3)引入了 AdaptFormer 残差瓶颈分支。对于输入 token 特征 \(x_{\text{self}}\),适配分支通过下投影矩阵 \(W_{\text{down}} \in \mathbb{R}^{d \times \tilde{d}}\) 压缩维度,经过 ReLU 激活后再通过上投影矩阵 \(W_{\text{up}} \in \mathbb{R}^{\tilde{d} \times d}\) 还原,与主干自注意力及 MLP 特征残差相加:

\[x' = x_{\text{self}} + \text{MLP}(x_{\text{self}}) + \text{ReLU}(x_{\text{self}} W_{\text{down}}) W_{\text{up}}\]

其中瓶颈维度 \(\tilde{d}\) 设为原始维度 \(d\)\(0.5\times\)。这种设计仅调整高层抽象语义 token 的交互偏置,保留了前序浅层网络的低层几何细节,从而使得模型在面对背景突变和物体大位移时依然能够稳健匹配同一物理实体。

2. 双向交叉注意力检索头:从密集记忆特征聚合图像级实例相似度

SAM 2 原生架构中虽然包含预测遮挡的输出头(occlusion score),但该头是在帧间渐变假设下判别目标是否暂时出画,直接迁移到非连续图像检索时性能濒临崩溃(mAP 仅 3.5%)。然而,密集条件特征 \(F_t^{\text{mem}} = \text{MHCA}(Q(F_t), K(S_r), V(S_r))\) 中已经包含了目标图像各区域与参考实体的匹配响应。FoundYou 设计了一个极轻量的检索解码器,去除了原掩码解码器中的上采样卷积、特征金字塔融合及多重掩码 token,引入一个可学习的全局检索 token \(z^{(0)} \in \mathbb{R}^{1 \times D}\),令其与空间尺寸展平后的特征序列 \(F^{(0)} \in \mathbb{R}^{L \times D}\)(其中 \(L = \frac{H}{16} \cdot \frac{W}{16}\))展开两轮双向交叉注意力交互:

\[\begin{aligned} F^{(k)} &= \text{MHCA}(F^{(k-1)}, z^{(k-1)}) \\ z^{(k)} &= \text{MLP}(\text{MHCA}(z^{(k-1)}, F^{(k)})), \quad k \in \{1, 2\} \end{aligned}\]

最终通过一个浅层单层感知机映射并经过 Sigmoid 函数输出匹配概率 \(s_t = \text{sigmoid}(\text{MLP}_{D \to 1}(z^{(2)}))\)。该结构计算量极低,能够充分汇总图像中孤立局部的有效对应点,在抑制背景噪声的同时给出可靠的图像级置信度。此外,得益于记忆库机制,当用户在少样本个性化检索场景中提供多个参考视图时,多张参考图的表征只需直接拼接入 Memory Bank,检索头无需重新训练即可在单次前向中联合聚合多视角线索。

3. 掩码自蒸馏与语义难负例挖掘:兼顾细粒度类内判别与密集空间结构保留

在训练仅有 5.9M 参数的适配层与检索头时,若随机采集负样本(如拿杯子对比汽车),模型很容易借助粗粒度类别语义走捷径,无法学会区分同类别不同个体(例如两个不同样式的马克杯)。而在训练过程中在线挖掘难负例计算开销过大。FoundYou 借助冻结的 DINOv2 全局特征 \(\phi(\cdot)\) 的语义聚类特性,在离线阶段预先构建难负例池:针对参考图 \(I_r\),在非同一实体的候选集中挑选余弦相似度最高的前 \(K\) 张同类图像作为负样本集合 \(N_r = \text{argmax top-}K_{I_k \notin P_r} (\phi(I_r)^\top \phi(I_k))\),使得二值交叉熵检索损失 \(\mathcal{L}_{\text{ret}}\) 专注于细粒度类内区分。

同时,单纯依靠图像级检索损失反向传播,容易破坏自适应特征中保留的密集空间定位能力,导致分割边缘质量下滑。为此,FoundYou 引入了无缝的掩码自蒸馏机制:以原始完全冻结的 SAM 2 作为教师模型,以注入适配层后的 FoundYou 作为学生模型,输入相同图像并分别生成前背景概率图 \(P^T, P^S \in \mathbb{R}^{H \times W}\),通过最小化像素级 KL 散度进行正则化:

\[\mathcal{L}_{\text{dist}} = \frac{1}{HW} \sum_{h, w} \text{KL}\big(P^T(h, w) \parallel P^S(h, w)\big)\]

最终联合优化总损失 \(\mathcal{L} = \mathcal{L}_{\text{ret}} + \lambda_{\text{dist}} \mathcal{L}_{\text{dist}}\)(其中 \(\lambda_{\text{dist}} = 0.5\)),既保证了跨图像检索的精准判别力,又完全守护了 SAM 2 原生卓越的精细掩码生成品质。

损失函数 / 训练策略

模型在 UnED 数据集上进行端到端微调,保持 SAM 2-small 基础权重(46M)全冻结,仅更新 5.9M 参数。优化器采用 Adam,学习率设为 \(1 \times 10^{-4}\),批大小为 16,训练总迭代步数为 150k。每个查询由 4 个正样本与 8 个离线挖掘的难负样本构成候选对。蒸馏损失权重固定为 \(\lambda_{\text{dist}} = 0.5\)

实验关键数据

主实验

在个性化分割基准 PerSeg、PerMIS 以及个性化检索基准 PerMIR、ILIAS 上的对比实验结果如下表所示。对于 ILIAS,统一遵循标准协议先用 SigLIP 检索 Top-1k 候选再由各方法重排(SigLIP 初始得分为 19.6 mAP)。

模型类别 模型名称 PerSeg (mIoU / bIoU) PerMIS (mIoU / bIoU) PerMIR (mAP) ILIAS (mAP) 推理速度 (FPS) 参数量 (M)
仅分割 SEEM (NeurIPS'23) 87.1 / 55.7 34.2 / 31.8 n.a. n.a. 8.5 341
仅分割 SegGPT (ICCV'23) 94.3 / 76.5 38.7 / 35.5 n.a. n.a. 12.7 354
仅分割 PerSAM (ICLR'24) 89.3 / 71.7 42.1 / 34.4 n.a. n.a. 2.5 945
仅分割 PerSAM-F (ICLR'24) 95.3 / 77.9 47.8 / 34.5 n.a. n.a. 2.5 945
仅分割 GF-SAM (NeurIPS'24) 91.7 / 74.2 45.6 / 38.1 n.a. n.a. 1.5 945
仅检索 RRT (ICCV'21) n.a. n.a. 41.7 9.2 31.0 50
仅检索 MatchAnything (ArXiv'25) n.a. n.a. 19.7 23.2 3.4 111
仅检索 MASt3R (ECCV'24) n.a. n.a. 37.7 25.3 1.7 688
仅检索 RoMav2 (ArXiv'25) n.a. n.a. 32.3 26.6 2.7 425
仅检索 AMES (ECCV'24) n.a. n.a. 38.2 26.4 90.9 89
分割+检索 PDM (NeurIPS'24) 89.5 / 72.0 44.2 / 38.0 65.3 14.7 1.2 1200
分割+检索 FoundYou (本文) 96.4 / 85.6 62.6 / 57.4 92.1 32.5 90.2 52

在少样本个性化检索设置下(ILIAS 数据集,多参考图提供更丰富实例视角),FoundYou 与主流匹配与重排基线对比随样本数扩增表现出强劲的增益弹性:

评估模型 1-shot (mAP@1k) 2-shot (mAP@1k) 3-shot (mAP@1k) 4-shot (mAP@1k)
SigLIP 基线 22.9 22.9 22.9 22.9
XFeat 15.5 16.5 17.4 17.1
RoMa 22.0 21.9 22.1 21.9
SP-LightGlue 22.9 23.0 23.3 22.4
ELoFTR 23.8 24.6 25.7 25.0
MASt3R 24.3 26.0 27.2 27.5
MatchAnything 25.2 26.3 27.2 26.8
RoMa v2 27.5 28.2 28.4 27.7
AMES 27.6 28.2 29.0 30.2
FoundYou (本文) 30.1 31.8 32.5 34.2
Oracle 上限 38.9 38.9 38.9 38.9

消融实验

下表系统展示了微调策略、自适应结构选择与适配层插入位置在 PerMIS 分割(mIoU, %)与 ILIAS 检索(mAP, %)上的消融数据:

实验维度 具体配置 分割 PerMIS (mIoU) 检索 ILIAS (mAP) 说明与结论
微调方案对比 冻结 SAM 2 (原生遮挡头) 60.2 3.5 原生遮挡头无法应对非连续图像检索
微调方案对比 全量微调 (Full FT) 27.8 13.8 灾难性遗忘严重,破坏预训练表征
微调方案对比 主干微调 (Backbone FT) 57.2 20.5 分割和检索均落后于轻量适配
微调方案对比 QKV 投影微调 (QKV FT) 59.8 27.2 表现优于主干微调,但仍逊于模块化适配
微调方案对比 适配且去除自蒸馏 (w/o Distill) 56.7 32.7 缺少空间正则化使分割掉点 5.9 mIoU
微调方案对比 FoundYou 完整适配方案 62.6 32.5 兼备最优分割性能与顶尖检索表现
适配模块结构 LoRA - 28.9 检索增益有限
适配模块结构 传统 Adapter - 30.2 次优表现
适配模块结构 AdaptFormer (0.3x 通道瓶颈) - 29.8 表达能力略显不足
适配模块结构 AdaptFormer (0.8x 通道瓶颈) - 30.5 参数过多带来轻度过拟合
适配模块结构 AdaptFormer (0.5x 通道瓶颈) - 32.5 达到最佳检索性能平衡点
适配层插入位置 浅层阶段 (0–1 blocks) - 21.7 过早扰乱低层几何特征反而害处大
适配层插入位置 中层阶段 (1–2 blocks) - 29.6 检索性能明显上升
适配层插入位置 全阶段插入 (0–3 blocks) - 31.8 全局调整稍逊于仅针对高层微调
适配层插入位置 深层阶段 (2–3 blocks) - 32.5 专注高层语义,取得最优实例判别收益

关键发现

  • 掩码自蒸馏对分割至关重要:在仅依据检索损失训练时,模型在 ILIAS 上的 mAP 达到 32.7%,但 PerMIS 分割直接下滑至 56.7 mIoU。引入基于像素级 KL 散度的 SAM 2 原生掩码自蒸馏后,检索性能几乎无损(32.5%),而分割大幅反弹至 62.6 mIoU(净增 +5.9),充分证明了特征空间正则化的必要性。
  • 高层适配优于全网微调:全量微调会导致严重的表征崩塌(分割仅 27.8 mIoU)。仅在图像编码器最后两个阶段注入 AdaptFormer,既能精确定制高层语义 token 的跨图像交互行为,又完整保留了浅层网络的空间定位敏锐度。
  • 对弱提示展现出极高鲁棒性:在 PerMIS 上,输入提示从精细掩码退化为单点时,PDM 掉点 9.4 mIoU,PerSAM-F 掉点 6.2 mIoU,而 FoundYou 仅微降 4.0 mIoU(62.6 → 58.6),在 PerSeg 上更是仅相差 1.2 mIoU(96.4 → 95.2),证明记忆注意力与适配特征对粗粒度交互提示具有强大的几何容错力。

亮点与洞察

  • 将视频记忆注意力机制推广至跨图像实例对齐:跳出 SAM 2 原生的视频追踪假设,创造性地利用其天然的个体身份保持能力来处理无序图库检索与跨场景分割,以 52M 紧凑结构实现了 1200M 扩散大模型才能勉强达到的跨任务统一。
  • 解耦式离线难负例挖掘:巧妙规避了高开销的训练期动态负例挖掘,利用冻结 DINOv2 全局特征离线提取类内混淆图像,以零额外训练开销直接逼出模型的细粒度实例判别潜能。
  • 低成本赋能多视角记忆扩充:利用 Memory Bank 的天然级联能力,无需对多图输入设计特殊的融合网络,便能直接支持推理阶段的少样本多图检索,并在 4-shot 设定下达到 34.2 mAP。

局限与展望

  • 依赖第一阶段候选粗筛:在超大规模检索(如 100M 图库)场景下,FoundYou 依然依赖 SigLIP 等全局检索模型召回 Top-1k 候选池,无法直接在无索引库上进行单次极速全局检索。
  • 未建模极端非刚性形变与长期时间演化:当目标物体遭遇严重损毁、大面积撕裂遮挡或拓扑变形时,仅靠单张参考视觉提示的匹配置信度仍可能下降。
  • 未来方向:探索结合多模态大语言模型(MLLM)的指代文本联合微调,使统一模型能够同时响应「图像 + 属性描述」的多模态复杂查询;进一步设计层次化分级特征,将检索解码器扩展为支持十万级库秒级比对的轻量嵌入索引。

相关工作与启发

  • vs PDM: PDM 依赖 Stable Diffusion 提取多时间步反向去噪特征并串联 SAM 进行掩码生成,导致结构庞大(1.2B 参数)且推理极慢(1.2 FPS);FoundYou 基于 SAM 2 自身记忆机制实现轻量端到端联合,参数量骤降至 52M,推理速度提升 75 倍(90.2 FPS),在复杂场景分割(PerMIS +18.4 mIoU)和大规模检索(ILIAS +17.8 mAP)上形成碾压优势。
  • vs PerSAM / PerSAM-F: PerSAM 仅针对分割任务设计,依赖无参数或少参数的特征相似度生成粗糙提示再传给 SAM,缺乏全局相似度评估机制,且在拥挤背景下极易匹配至同类干扰物;FoundYou 同时支持分割与检索,并通过特征适配与难负例挖掘获得了卓越的类内个体区分度。
  • vs AMES / RoMa v2: AMES 与 RoMa v2 作为专业检索或图像匹配方法,侧重局部密集对应点重排或几何单应一致性,在同视角场景有效,但在背景剧烈变动、缺乏连续重叠的个性化物体检索中受制于局部混淆;FoundYou 继承了 SAM 2 的全局实例感知,兼具分割掩码输出能力,检索精度高出 5.9~6.1 mAP。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙重释 SAM 2 视频记忆机制,破除时空连续性限制并打通个性化分割与检索任务闭环。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖分割、检索、少样本拓展、弱提示鲁棒性及类级别泛化等完整评测,消融严密详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑主线严谨清晰,问题定义与动机切入深刻,图表与分析极具说服力。
  • 价值: ⭐⭐⭐⭐⭐ 仅用 5.9M 参数和 90 FPS 速度为个性化视觉与相册整理开辟了极具工程落地价值的新范式。