跳转至

Mapping the Concept Landscape: Structural Perception of Global Distributions for Transparent Data Pruning

会议: ECCV 2026
论文: ECCV 2026
领域: 可解释性
关键词: 数据剪枝, 概念图, 多模态指令微调, 可解释性, 边际覆盖贪心

一句话总结

针对传统基于黑盒嵌入向量的数据剪枝无法反映细粒度语义覆盖且不可解释的问题,本文提出 Mapping the Concept Landscape (MCL),将图文样本显式解耦为实体、事件和属性构成的概念图并聚合为数据集全局语义景观,基于结构化稀缺度与关系度数以贪心最大化边际覆盖的方式实现高效、透明的数据剪枝。

研究背景与动机

随着 LAION、CC12M 等大规模多模态数据集的爆发,视觉语言模型(VLM)的训练面临着高昂的计算与存储开销,且自动化网络爬取不可避免地混入海量低质、冗余和噪声样本。为了提升数据效率,基于样本重要性评分(如损失值、不确定度、学习难度)或特征嵌入空间几何多样性(如聚类中心采样、距离度量)的数据剪枝技术被广泛探索。然而,现有方法普遍将单个样本视为不可分割的整体,将其压缩为单一高维向量进行表征,这一范式造成了深层的嵌入-概念错配(Embedding–Concept Misalignment)。

这种错配的核心症结在于:向量空间中的几何距离无法忠实对应语义概念的真实多样性。当多个语义概念被压缩投影进耦合的数值向量时,表征空间里看似冗余的样本可能包含独特的长尾细粒度概念,而几何上分布分散的样本在概念构成上反而高度重叠。这导致现有多样性采样算法本质上优化的是几何分散度而非语义覆盖率,容易系统性丢弃具有重要语义价值的长尾概念。更严重的是,基于黑盒数值向量的筛选逻辑缺乏数据集层面的可解释性,人工无法审查被保留或丢弃的语义分布,难以对剪枝过程进行透明化审计与干预。

本文的切入视角是打破样本作为不可分割原子的传统假设,将多模态数据剪枝从样本级几何度量推进至细粒度概念覆盖最大化。核心 idea:将图文样本显式解析为实体、事件和属性的原子概念图,通过全局聚合构建透明的数据集语义景观并量化概念稀缺度与结构度数,进而以动态边际增益贪心迭代选择样本,实现高效、防冗余且完全透明可审计的数据集剪枝。

方法详解

整体框架

MCL 的核心在于将图文样本解耦为具象语义,并在全数据集尺度上追踪概念的全局分布与拓扑关系。整体流程由三大部分串联:首先,通过语义依存分析将每个图文对解析为包含实体、事件与属性的样本级概念图;其次,将所有样本图合并为全局数据集概念图,结合出现频次和节点拓扑度数计算各概念的重要性权重;最后,以集合覆盖函数为优化目标,在每轮迭代中贪心选取能带来最大边际概念增益的候选样本,直到达到预定剪枝预算。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["图文输入对 (I_i, T_i)"] --> B["样本级概念图构建<br/>解析实体/事件/属性三类原子概念节点与依存边"]
    B --> C["数据集级概念图与结构重要性建模<br/>合并全局拓扑,结合频次与度数计算归一化权重"]
    C --> D["边际增益驱动的贪心概念覆盖剪枝<br/>动态评估未覆盖概念边际收益,并行贪心选取样本"]
    D --> E["剪枝后核心子集与透明语义景观"]

关键设计

1. 样本级概念图构建:将耦合样本显式解耦为细粒度语义三元组

针对黑盒数值向量模糊内部语义交互的问题,MCL 将每个图文样本 \(x_i = (I_i, T_i)\) 显式映射为一个结构透明的概念图 \(G_i = (V_i, E_i)\)。其中文本描述 \(T_i\) 既可以是原始配文,也可以是由预训练视觉模型生成的描述。利用 spaCy 对文本进行无监督依存句法分析(Dependency Parsing)和词性标注(POS tagging),过滤停用词后抽取语义节点并分类为三类核心原子概念:表示物体或视觉主体的实体(Entities,名词)、描述动作或相互作用的事件(Events,动词),以及修饰物体与事件属性状态的属性(Attributes,形容词与副词)。图中的边 \(E_i\) 则直接编码这些概念在上下文中的依存与共现关系。这种结构化解耦不仅计算极其轻量,而且为后续在概念粒度进行统计分析和人类可解释审计提供了结构基础。

2. 数据集级概念图与结构重要性建模:融合全局稀缺度与拓扑交互的重要性度量

单个样本抽取出的概念可能带有噪声,但汇聚到整个数据集尺度时,相对频次与统计分布具备极强的鲁棒性。MCL 将全数据集 \(N\) 个样本图取并集构造全局概念图 \(G_D = (V_D, E_D)\),其中每个概念节点 \(v\) 的权重 \(w(v) = \sum_{i=1}^N \mathbf{1}[v \in V_i]\) 即为其在数据集中出现的样本总数。在此基础上,概念的重要性不能单看低频稀缺性,因为仅出现在孤立边缘上下文中的长尾词其泛化价值可能并不高,而在全局图中与多种不同概念存在高频相互作用的节点更能承载丰富的语义纽带。为此,MCL 联合考虑语义稀缺度与结构交互度,定义节点未归一化重要性得分:

\[\tilde{\phi}(v) = \log\left(\frac{N_{\text{type}(v)}}{w(v)} \cdot d(v)\right)\]

其中 \(N_{\text{type}(v)}\) 为该节点所属语义类别(实体、事件或属性)在全局图中的节点总数,\(d(v)\) 为节点在 \(G_D\) 中的度数。为避免不同词性类别由于基础词汇量差异导致某单一类别主导重要性排序,随后在各自类别集合 \(V_{\text{type}(v)}\) 内执行 Min-Max 归一化得到最终重要性 \(\phi(v)\),确保罕见的动词或修饰属性能够与常见物体实体公平竞争。

3. 边际增益驱动的贪心概念覆盖剪枝:动态消除语义冗余并跨分块并行加速

若直接根据样本包含概念的静态得分进行离散排序,极易选中大量同质化堆叠高分概念的重复样本。为了真正实现紧凑且多样的高效剪枝,MCL 将数据集剪枝形式化为受限集合覆盖优化问题:给定剪枝保留预算 \(b = (1-p) \cdot |D|\),目标是最大化已选样本集合 \(\mathcal{S}\) 所覆盖的独立概念重要性总和 \(F(\mathcal{S}) = \sum_{v \in V_{\mathcal{S}}} \phi(v)\),其中 \(V_{\mathcal{S}} = \bigcup_{x_i \in \mathcal{S}} V_i\)。在该目标下,一个概念一旦被已选子集覆盖,后续再加入包含相同概念的样本将不再带来任何目标收益,天然具备收益递减与抑制冗余的特性。

在具体求解时,采用贪心迭代选择:在第 \(t\) 步,对任意未选样本 \(x_i \in D \setminus \mathcal{S}_t\),其边际收益为其所携带的尚未被覆盖的新概念的重要性之和:

\[\Delta(x_i \mid \mathcal{S}_t) = F(\mathcal{S}_t \cup \{x_i\}) - F(\mathcal{S}_t) = \sum_{v \in V_i \setminus V_{\mathcal{S}_t}} \phi(v)\]

每轮选取边际收益最大的样本 \(x^* = \arg\max \Delta(x \mid \mathcal{S}_t)\) 归入保留集并更新覆盖集合。面对百万级大规模多模态数据集,MCL 通过将全量数据集切分为若干个子分块(如将 665K 混合数据切分为 8 个 chunk)进行多路并行独立贪心剪枝,仅需差集查找与标量累加,使整个图构建与筛选耗时大幅压缩至小时级别。

实验关键数据

主实验

论文在多模态视觉指令微调数据集 LLaVA-1.5-mix-665k(Backbone: LLaVA-v1.5-7B, LoRA 微调)以及经典纯视觉目标检测数据集 COCO 2017(Backbone: DETR-ResNet50)上进行了系统评估。

在 LLaVA-1.5-mix-665k 上,测试保留 50k(7.5%)和 133k(20%)数据下的跨评测基准表现:

方法 保留数据量 MME-P MME-C SEED-I POPE MMMU SQA GQA TextQA 相对全量性能
Full Dataset 665k 1476.9 267.9 67.4 86.4 32.8 70.0 63.0 58.2 100.0%
Random 50k (7.5%) 1387.5 287.5 59.7 85.7 32.2 68.4 55.0 53.1 95.7%
EL2N 50k (7.5%) 1077.3 252.5 59.3 80.8 33.6 71.0 61.0 41.7 90.1%
InsTag 50k (7.5%) 1317.1 345.0 57.4 82.1 34.0 69.3 52.5 53.3 97.0%
LESS 50k (7.5%) 1344.8 281.8 61.2 79.4 33.0 71.0 53.4 52.0 94.4%
TIVE 50k (7.5%) 1434.8 291.5 61.6 84.9 33.3 71.2 56.3 52.0 97.2%
DataTailor 50k (7.5%) 1447.4 322.3 60.6 82.4 33.9 70.4 57.1 52.9 98.6%
MCL (Ours) 50k (7.5%) 1455.8 318.2 60.3 84.8 33.8 70.0 57.6 53.9 99.0%
COINCIDE 133k (20%) 1496.0 298.1 62.9 86.1 32.7 69.2 59.8 55.6 99.3%
ICONS 133k (20%) 1487.1 295.3 63.0 87.5 33.0 70.8 60.7 55.6 99.9%
MCL (Ours) 133k (20%) 1501.5 308.4 63.4 85.7 33.4 70.7 60.3 56.0 100.5%

在纯视觉目标检测 COCO 2017(70% 数据选择比率,DETR-ResNet50)上的对比结果:

方法 保留比例 \(\text{AP}_{50:95}\) \(\text{AP}_{50}\) \(\text{AP}_{75}\) \(\text{AP}_{\text{small}}\) \(\text{AP}_{\text{mid}}\) \(\text{AP}_{\text{large}}\)
Full Dataset 100% 40.06 61.12 42.03 19.27 43.39 59.24
Random 70% 38.26 (-1.80) 58.91 39.77 17.83 41.19 56.69
EL2N 70% 34.35 (-5.71) 53.29 36.14 16.58 37.64 48.54
InfoBatch 70% 34.95 (-5.11) 53.86 36.55 17.00 38.74 49.05
DivBS 70% 39.74 (-0.32) 60.84 41.98 18.07 43.14 58.78
PFB 70% 39.69 (-0.37) 60.85 41.74 18.45 43.25 59.07
MCL (Ours) 70% 40.12 (+0.06) 61.06 42.27 18.95 43.78 59.13

消融实验

  1. 动态贪心选择 vs. 静态分数排序(COCO 2017 目标检测 AP):
选择比例 静态重要性排序(Static Ranking) MCL 动态贪心覆盖(Greedy Coverage) 性能差距
40% ~36.8% 38.1% +1.3%
50% ~37.9% 39.0% +1.1%
60% ~38.8% 39.6% +0.8%
70% ~39.4% 40.12% +0.72%
  1. 全局概念覆盖率对比(LLaVA-1.5-mix-665k \(|V_{\mathcal{S}}| / |V_D|\)):
采样比例 随机采样覆盖率(Random) MCL 贪心覆盖率(Ours) 绝对覆盖增益
5% 32.83% 92.76% +59.93%
10% 46.31% 99.12% +52.81%
15% 56.42% 99.99% +43.57%
20% 64.05% 100.00% +35.95%
  1. 端到端耗时对比(4 张 NVIDIA RTX 3090 GPU):
  2. Full Training:100 小时训练,0 小时剪枝。
  3. TIVE:100 小时预热/梯度推断 + 8 小时筛选 + 7.5 小时剪枝后训练 = 115.5 小时。
  4. DataTailor:15 小时多模态聚类抽取 + 7.5 小时训练 = 22.5 小时。
  5. MCL (Ours):仅需 1.7 小时(包含概念图构建与贪心剪枝)+ 7.5 小时训练 = 9.2 小时,相比全量节省 >90% 总时间。

关键发现

  • 低比例下概念覆盖决定性能下限:在保留 5%~7.5% 数据时,MCL 的概念覆盖率已超过 92%,使其在仅使用 7.5% 数据时便达到了全量微调 99.0% 的综合水准,并在 20% 数据下超越全量基准(100.5%)。
  • 静态排序存在长尾偏置陷阱:单纯按概念稀缺度静态打分(Static Ranking)会导致模型全部去拟合生僻长尾,忽视了核心高频实体对表征学习的基础支撑;而动态边际覆盖在饱和后自然停止吸收同类概念,自适应平衡了高频主干与长尾细节。
  • 跨模态与任务泛化优异:即便在纯视觉标注的 COCO 目标检测任务中,依托图像配文提取出的概念图同样有效指导了关键样本筛选,并在 70% 数据量下实现了超越全量的 40.12 AP。

亮点与洞察

  • 从隐空间几何距离转向显式符号概念覆盖:深刻指出了高维连续嵌入空间在衡量多样性时的语义塌陷缺陷,用轻量透明的离散概念图替代黑盒嵌入,使数据剪枝标准首次具有完全的人类可读审计性。
  • 频次与拓扑度数的双重视角刻画重要性:没有盲目偏袒孤立低频噪声,而是引入概念节点的全局度数作为关系修正因子,优先挑选“具有广泛语义交互潜力的关键低频概念”,提升了特征鲁棒性。
  • 计算复杂度极低且易于工程并行化:摒弃了昂贵的多卡前向反向梯度计算或模型特征提取,借助 spaCy 语法分析与分块并行集合差集计算,百万级数据集在消费级显卡上 1.7 小时即可完成全部筛选。

局限与展望

  • 依赖文本描述的完备性:方法核心依赖于文本 Caption 提炼概念,当图像缺乏文本或者伴随文本非常简短、存在幻觉时,需依赖前置 VLM 生成 caption,增加了流程对字幕生成质量的依赖。
  • 未建模高阶超图或空间定位约束:当前概念图的边主要由文本依存句法构建,对于图像中目标的空间几何位置、遮挡关系及场景复杂布局等视觉特有要素感知不足。
  • 改进思路:未来可探索结合轻量级开放词表检测器或开放场景图生成(Scene Graph Generation),将空间坐标与文本概念双向对齐,构建视听跨模态统一超图概念空间。

相关工作与启发

  • vs DataTailor / COINCIDE: DataTailor 与 COINCIDE 均依赖预训练模型提取的单向量特征进行特征空间聚类或密度估计;MCL 则将样本解耦为实体、事件与属性的离散图结构,彻底避免了向量混淆与高维维数灾难。
  • vs TIVE / LESS: TIVE 与 LESS 依赖目标模型或代理模型在线计算样本梯度与影响力函数,计算代价高达几十上百 GPU 小时;MCL 完全脱离模型训练动力学,仅通过语义分布图快速离线统计,耗时降低一个数量级以上。
  • vs EL2N / InfoBatch: 基于动态损失的剪枝方案容易受样本标签噪声与训练震荡干扰,而 MCL 基于全语料静态概念空间聚合,具有极强抗噪性和任务无关泛化性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 创新性地将透明语义概念图引入多模态数据剪枝,跳出了长期依赖向量特征嵌入空间的固有思维。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖多模态指令微调与纯视觉目标检测,横跨十余个评测基准,同时给出了详尽的时间开销、覆盖率与图可视化消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 论证严谨,嵌入与概念错配的切入点动机极具说服力,图表制作精良直观。
  • 价值: ⭐⭐⭐⭐⭐ 极具落地实用价值,能在极大降低训练能耗的同时赋予大模型数据工程团队清晰的语义审计能力。