跳转至

Show Me Examples: Inferring Visual Concepts from Image Sets

会议: ECCV 2026
论文: ECCV 2026
领域: 多模态 VLM
关键词: 视觉上下文学习, 概念推断, 图像集推理, 集合学习器, 流匹配

一句话总结

针对现有多模态大模型无法仅从图像示例集推断隐式视觉概念并迁移至新图像的缺陷,本文提出了视觉集合概念推断任务(VICIS)以及基于集合学习器、投影实例化与流匹配扩散生成相结合的架构,实现了纯视觉示例驱动的概念提取与高保真多样化生成。

研究背景与动机

多模态视觉语言模型在跟随复杂文本指令、视觉问答以及文本到图像生成方面取得了突破性进展,其泛化能力在很大程度上源于大语言模型中的上下文学习范式。然而,人类视觉认知的核心机制往往依赖非言语经验:面对一组展示共同特质的参考样本,人类无需显式语言标注或规则定义,就能敏锐捕捉其中的共性维度,并将其精准投射到新场景中进行识别或类比。现有前沿模型严重依赖显式文本提示,当要求模型纯粹从视觉上下文推断隐式概念时,往往出现灾难性退化——要么直接忽视参考图像集合,要么将查询图像中的显著前景全盘复制,无法完成基于视觉示例的抽象归纳与概念迁移。

这种失败的核心矛盾在于,现存的视觉上下文生成范式通常将参考图退化为全局样式条件或拼贴画式的上下文修复,缺乏一种能解耦“概念语义子空间”与“具体实例特征”的表征机制。当查询图像同时包含多种属性时,模型缺乏机制去约束生成过程只保留参考集合所指定的那个特定属性维度,而让其他无关维度自由变化。若仅评测模型能否生成与参考集相似的样本,任务极易退化为无意义的样本摘要或模式记忆,无法真正探究模型是否具备从视觉集合中提炼出抽象语义维度的推理能力。

本文的切入角度是引入查询-目标对偶验证机制,构建 Visual Concept Inference from Sets(VICIS)任务基准,并设计端到端的集合推断与流匹配扩散框架。核心 idea:利用集合学习器从参考图像集推断出概念子空间的方向向量基底,将查询图像的正交嵌入投影到该子空间中以滤除无关视觉变化,并将该投影标记作为流匹配扩散模型的生成条件,以纯视觉非言语方式实现概念的精准提取与多样化重建。

方法详解

整体框架

VICIS 任务要求模型输入包含若干展示共同概念的参考图像集合 \(X_{\text{set}}\) 以及一张查询图像 \(x_{\text{query}}\),目标是生成与 \(x_{\text{query}}\) 在该特定概念上完全一致、而在其他无关属性上自由解耦的全新目标图像 \(x_{\text{target}}\)。整体架构由三个核心阶段串联构成:首先,预训练视觉编码器对参考集各图像分别提取表征,输入集合学习器(Set Learner)以推断出一组跨样本对齐的概念方向向量;随后,实例化模块(Instantiation Module)将查询图像的特征投影到该方向向量所张成的概念子空间中,过滤掉背景和无关语义干扰,得到概念专一的条件标记;最后,扩散模型(Diffusion Model)以该标记为调节条件,采用整流流(Rectified Flow)目标联合优化网络,由纯噪声平滑生成目标图像。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入参考集合与查询图像<br/>X_set 与 x_query"] --> B["集合学习器<br/>多图交互推断概念方向基底"]
    B --> C["实例化模块<br/>投影查询嵌入滤除无关属性"]
    C --> D["流匹配扩散模型<br/>条件注入时间步生成目标图像"]

关键设计

1. 集合学习器:多图交互推断概念方向基底 针对传统模型无法从无标注图像集中提取共性概念维度的问题,该模块专门负责发现特征空间中表征该概念的方向基底。首先利用冻结的预训练视觉 Transformer \(E\)(如 DINOv2)对参考集合 \(X_{\text{set}}\) 中的每一张图像独立编码提取图像词元序列。随后,集合学习器作为一个专门的 Transformer 架构,接收参考集中所有图像词元的拼接序列作为输入,利用自注意力机制跨图像建模多实例间的共变关系,进而显式预测一组相互正交的概念方向向量 \(D_c = \{d_1, d_2, \dots, d_k\}\)。这组向量构成了该隐式概念的局部语义子空间,能够跨越单个样本的表观变异,精准捕获由参考集约束的抽象视觉概念。

2. 实例化模块:投影查询嵌入滤除无关属性 为了确保生成的图像仅继承查询样本中与参考集相关的那个概念属性,同时彻底丢弃查询图像的背景、姿态或非目标类别干扰,系统引入了正交投影实例化机制。对于给定的查询图像 \(x_{\text{query}}\),通过相同编码器 \(E\) 提取其类别标记嵌入 \(e_{\text{query}}\)。随后将 \(e_{\text{query}}\) 分别与概念方向集 \(D_c\) 中的每一个基向量做内积,计算其在该概念空间中的标量坐标 \(s_i = \langle e_{\text{query}}, d_i \rangle\)。通过线性组合还原为投影标记: $\(e_{\text{query}}^{\text{proj}} = \sum_{i=1}^k s_i d_i\)$ 该投影过程在几何上构成了硬性的语义瓶颈,任何不能被概念子空间 \(D_c\) 解释的属性特征(例如查询物体处于草地还是室内、颜色是红是黑)都会被正交剔除,从而严格隔离出专属于目标概念的表征嵌入。

3. 流匹配扩散模型:条件注入时间步生成目标图像 在生成端,模型采用基于整流流(Rectified Flow)形式的扩散主干网络 \(DM_\theta\)。与传统的非平衡扩散相比,整流流通过连续向量场线性插值连接纯高斯噪声与真实数据流形,优化目标更平滑且具备更快的采样收敛速度。投影得到的纯净概念标记 \(e_{\text{query}}^{\text{proj}}\) 被直接加和注入到扩散模型的时间步嵌入(timestep embedding)中,全局引导反向去噪过程。通过最小化流匹配损失函数实现端到端参数更新: $\(\mathcal{L}_{\text{FM}}(\theta) = \mathbb{E}_{t \sim U[0,1], x_t, e_{\text{query}}^{\text{proj}}} \left[ \| DM_\theta(x_t, t, e_{\text{query}}^{\text{proj}}) - u(x_t, t) \|_2^2 \right]\)$ 其中 \(u(x_t, t) = x_{\text{target}} - x_0\) 为直连速度场。该损失无需大批次对比学习的负样本构造,在有限批次下即可稳定收敛,驱动网络生成既符合概念约束又具高感知多样性的高质量图像。

实验关键数据

主实验

评估在基于 WordNet 分层构建的 ImageNet 真实图像数据集、ImageNet-Sketch 跨模态草图数据集以及 ImageNet21k 未见类别泛化设置下展开。评价指标包括:按概念平均准确率(per con. %)、按查询实例平均准确率(per inst. %)以及基于概念层级相对熵构建的生成多样性得分(Diversity)。

方法 数据集/设置 按概念准确率 (%) 按实例准确率 (%) 多样性得分 (Div.)
查询复制基线 (Copy Query) Hierarchy 层级评测 – – 0.47
ILLUME+ 3B Hierarchy 层级评测 37.15 55.00 0.57
BAGEL 7B-MoT Hierarchy 层级评测 26.05 33.76 0.46
Visual Prompting Hierarchy 层级评测 26.02 45.89 0.70
本文方法 (Ours) Hierarchy 层级评测 46.34 54.46 0.81
Visual Prompting Sketch Queries (草图查询) 23.76 44.57 0.68
本文方法 (Ours) Sketch Queries (草图查询) 32.60 47.11 0.72
Visual Prompting Sketch Context (草图参考) 27.67 47.04 0.71
本文方法 (Ours) Sketch Context (草图参考) 41.50 52.24 0.79
Visual Prompting Sketch C+Q (参考与查询全草图) 25.69 44.45 0.68
本文方法 (Ours) Sketch C+Q (参考与查询全草图) 31.90 46.47 0.71
Visual Prompting 21k Context (未见新类别) 29.07 49.95 0.76
本文方法 (Ours) 21k Context (未见新类别) 39.63 51.40 0.79

消融实验

为了探究参考集合大小以及参考样本中噪声污染对概念推断性能的影响,论文在 ImageNet 分层验证集上进行了详细消融实验:

配置 参数设定 按概念准确率 (%) 按实例准确率 (%) 多样性得分 (Div.)
参考集合规模消融 Set Size = 2 44.74 48.92 0.719
参考集合规模消融 Set Size = 3 45.26 53.51 0.801
参考集合规模消融 (默认) Set Size = 5 46.34 54.46 0.811
参考集合规模消融 Set Size = 7 46.56 54.74 0.824
噪声污染鲁棒性消融 纯净参考集 (Clean) 46.34 54.46 0.811
噪声污染鲁棒性消融 1/5 样本替换为随机噪声 37.62 46.85 0.812
噪声污染鲁棒性消融 2/5 样本替换为随机噪声 26.01 36.42 0.906

关键发现

  • 集合规模效应:当参考集合由 2 张递增至 5 张时,准确率与生成多样性均呈现显著上升,随后在 7 张时进入平缓平台期,说明少量高质量示例即足以提供稳定的概念归纳信号。
  • 抗噪平稳退化:在 5 张参考图像中强行混入 1 张完全无关的随机样本时,模型准确率平缓下降至 37.62%,而多样性指标保持稳健(0.812),证实集合注意力机制对部分离群样本具备较强容错性。
  • 对比闭源前沿模型:在包含多概念冲突的端到端问答测试中,Nano Banana 准确率仅为 46%,Gemini 2.5 Flash Image 仅为 40%,而本文方法准确率达到 93%,证明通用 VLM 极易陷入单纯偏好查询显著图元的捷径偏见。

亮点与洞察

  • 几何正交投影瓶颈:通过集合推断方向基向量并强制查询特征做投影分解,天然规避了模型机械复述查询背景与无关图元的倾向,形式优美且计算开销极低。
  • 弱监督分层训练范式:利用 WordNet 现成的树状语义分类自动构建多层次的概念包与测试 episode,无需耗费昂贵人工逐像素标定概念属性,实现了视觉上下文学习的大规模自适应训练。
  • 多模态草图泛化能力:即便仅在自然照片上完成训练,模型在处理抽象线描草图查询和参考集时依然保持优于基线的概念迁移水准,体现出对语义本质的高度表征能力。

局限与展望

  • 抽象属性解耦受限:论文构建的真实世界概念主要基于 WordNet 的分类学分层体系(多为实体分类概念),对于光照、材质、微观物理关系等非名词性概念的探索仍较初步。
  • 复杂组合概念干扰:当参考图像集包含多个交织的非显式共有属性时(例如既同属猫科又均为夜间场景),模型缺乏显式机制让用户交互式指定消歧。
  • 拓展方向:未来可将此架构与交互式视觉对话智能体深度集成,让用户通过直接圈选、上传图像相册即可无缝定义个性化生成规则。

相关工作与启发

  • vs Visual Prompting (Bar et al.): Visual Prompting 采用拼接网格与图像修复的方式诱导上下文学习,难以对齐非配对的高层语义维度;本文利用集合学习器与子空间投影,在保留概念的同时实现了图像级自由生成。
  • vs 通用自回归/扩散 VLM (ILLUME+, BAGEL, Gemini 2.5 Flash): 传统 VLM 在视觉上下文学习中存在严重的显式文本先验与图像复制捷径;本文方法从表征子空间解耦出发,彻底摆脱了语言提示的依赖。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出非言语图像集视觉概念推断基准并给出子空间投影解决方案。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖合成控制集、大规模真实分层集、草图跨域、未见类别泛化以及前沿闭源模型对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述清晰透彻,形式化定义精炼严密。
  • 价值: ⭐⭐⭐⭐⭐ 为推动多模态模型从“文本指令跟随”跨越到真正的“纯视觉自主类比归纳”提供了关键范式。