跳转至

Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/MingliangLiang3/DynamiCS
领域: 多模态VLM
关键词: 视觉语言预训练、动态数据采样、聚类缩放、长尾分布、计算效率

一句话总结

针对视觉语言预训练计算成本高昂且网络噪声数据长尾概念代表性严重不足的问题,本文提出结合幂律聚类缩放与跨轮动态重采样的 DynamiCS 方法,在大幅削减 GPU 训练预算的同时显著提升长尾识别能力。

研究背景与动机

大规模视觉语言模型(如 CLIP)通过对比学习构建了强大的跨模态表征,在零样本分类、图文检索及下游多模态大模型中扮演着基础底座的角色。然而,全量预训练通常依赖数十亿甚至百亿级网络抓取图文对,需要耗费数千乃至上万 GPU 时,极高的算力开销严重制约了该技术的复现与迭代演进。为此,社区探索了两类低成本预训练途径:一类是通过图像分辨率缩放、图像 patch 掩码或文本词法掩码减少单样本计算量(如 RECLIP、FLIP、CLIPA);另一类则是通过启发式过滤或聚类剪枝缩减数据集规模(如 DataComp、DFN、DBP、MetaCLIP)。

尽管数据剪枝方法能够减小训练集总体积,但从互联网抓取的原始多模态数据普遍呈现极度倾斜的长尾分布——少数通用主题拥有海量重复或近重复样本(头部概念),而海量细粒度概念仅包含极少实例(长尾概念)。现有追求语义平衡的方法(例如 MetaCLIP 对元数据类别硬截断至 20k,或 DBP 基于聚类复杂度抹平密度)遵循的是“追求均匀(Aim for Even)”哲学。这种暴力削峰或均匀化密度的策略,不仅在下采样过程中容易不成比例地误伤乃至彻底剔除稀有长尾概念,还破坏了真实语义空间的自然相关层次;同时,像 DFN、HQ-CLIP 等方法高度依赖另一个性能更强的预训练模型进行质量打分或重新生成描述,这在降低训练成本的目标下引入了额外的依赖瓶颈。

本文改变了传统“盲目拉平分布”的思路,转向基于“效用优先(Aim for Utility)”的数据平衡哲学。核心切入点在于:预训练并不需要完全消除头部概念的优势,而是应在保留语义簇原有相对排序的前提下,通过连续受控的幂律缩放适度压缩头部规模,并主动对小样本聚类进行有放回上采样,再配合跨 Epoch 动态重抽样盘活样本多样性。核心 idea:提出动态聚类数据采样框架 DynamiCS,通过受控幂律缩放同时对大语义簇下采样并对稀疏簇上采样,并在训练各轮动态抽取不同子集,以仅约 3% 的算力成本达到与全量预训练相当的性能,并在长尾基准上取得大幅突破。

方法详解

整体框架

DynamiCS 的整体数据管线包含离线语义聚类、聚类缩放配额计算、跨轮动态重采样与渐进式两阶段高效预训练四个阶段。首先,利用预训练视觉表征模型(如 DINOv2-ViT-B/16)提取图像嵌入,并通过余弦距离 K-Means 算法将海量未标注多模态数据集划分为数万个语义簇,并合并质心余弦相似度高于阈值的冗余簇;随后,根据幂律聚类缩放公式为各个语义簇重新分配目标采样样本量,实现大簇压缩与小簇过采样的平滑过渡;在模型训练过程中,每个 Epoch 为每个簇独立动态随机抽取指定配额的样本,避免静态剪枝造成的样本固化;最后,模型在低分辨率与文本截断设置下完成绝大部分样本量训练,并在末期通过少量完整分辨率训练消除分辨率差距。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["原始海量多模态数据<br/>LAION-400M / DataComp"] --> B1["离线特征聚类与冗余合并<br/>DINOv2特征 + K-Means + 质心去重"]
    B1 --> B["聚类缩放<br/>幂律控制头部降采样与长尾上采样"]
    B --> C["动态采样<br/>跨 Epoch 随机重选样本提升多样性"]
    C --> D["两阶段高效预训练<br/>112×112 大批量预训练 + 224×224 高分辨率微调"]
    D --> E["长尾增强的视觉语言表征<br/>ImageNet / Let It Wag! / 检索 / 鲁棒性"]

关键设计

1. 聚类缩放:兼顾语义相对序与长尾上采样

针对传统剪枝方法要么无差别随机丢弃长尾样本、要么暴力硬截断导致长尾概念彻底消失的缺陷,本文设计了保持语义簇相对规模序关系的聚类缩放机制。在完成图像特征聚类与近邻簇质心合并后,面对簇大小极不均衡(部分大簇超过百万样本,小簇不足千个样本)的客观现实,算法不再追求绝对均分的分布,而是通过缩放因子 \(\alpha\) 调控采样平滑度。设全局聚类总数为 \(N\),簇 \(i\) 的原始样本规模为 \(c_i\),设定整个数据集期望保留的目标样本总量为 \(T\)(实验中通常设为原始数据集大小的 50%),则簇 \(i\) 重新分配后的样本容量 \(S_i\) 计算为:

\[S_i = \frac{c_i^\alpha}{\sum_{j=1}^N c_j^\alpha} \cdot T\]

参数 \(\alpha \ge 0\) 连续调控着从绝对均匀到无偏采样的整个空间:当 \(\alpha = 0\) 时退化为将所有簇强行截断至相同大小的“追求均匀”极端;当 \(\alpha = 1\) 时完全等价于全局均匀随机抽样;当 \(\alpha > 1\) 时则会灾难性地放大头部聚集效应。实验证明,取温和缩放值 \(\alpha = 0.2\) 能达到最佳权衡:它既保留了不同语义主题在自然界中原有的主次层次关系,又大幅削减了超大簇的冗余压制。特别地,对于样本稀疏的小簇,当计算出的目标规模满足 \(S_i > c_i\) 时,机制自动采用有放回抽样进行倍增上采样,使得罕见长尾概念在单轮训练中能够被模型充分反向传播学习。

2. 动态采样:利用跨 Epoch 差异性放大长尾效用

针对静态数据剪枝(固定丢弃部分数据后模型终身不可见)导致的训练多样性受损问题,本文引入了按 Epoch 触发的动态随机重采样机制。若直接在静态集上对小簇进行倍增上采样,模型极易因反复拟合完全固定的长尾图文对而产生严重过拟合;同时大簇中被舍弃的一半样本若永久无法参与训练,则损失了海量背景与物体变体。为此,在预训练的每一个 Epoch 开始时,算法以簇为单位计算其实例抽样概率:

\[P_i = \frac{S_i}{c_i}\]

在训练过程中,每个簇根据自身概率 \(P_i\) 独立且均匀地抽取 \(S_i\) 个样本送入该轮 DataLoader。对于下采样大簇(\(P_i < 1\)),模型在 6 个轮次内不断轮换遇见不同子集的真实图像文本对,使整体遍历到的全集信息覆盖率成倍高于静态裁剪,极大增强了模型跨轮次的数据多样性;对于上采样小簇(\(P_i > 1\)),有放回抽样仅在单轮内部产生频次加权,避免了静态冗余堆叠对梯度方差的不良影响,在保证每个 Epoch 计算总量 \(T\) 严密受控的同时,零额外代价实现了上采样的稳定落地。

损失函数 / 训练策略

模型采用标准对齐对称 InfoNCE 对比损失进行端到端优化。为将训练效率推向极限,全流程严格结合分辨率退火方案:在前 6 个 Epoch(例如累计见光 0.64B 到 2.56B 个样本),输入图像均降采样至 \(112 \times 112\) 低分辨率,配合 28k 的超大全局 Batch Size 与文本长度截断(最大 32 tokens)进行加速冲刺;完成主预训练后,仅追加一个额外的短周期(见光 128M 样本)切换到 \(224 \times 224\) 原生高分辨率进行对齐适配,迅速弥合测试集图像分布差异。

实验关键数据

主实验

在主实验中,作者在 LAION-400M 与 DataComp-DFN 两种主流基准上预训练 ViT-B/16 架构,并在标准零样本分类 ImageNet-1K 和权威长尾基准 Let It Wag!(包含 290 个从多模态模型常见预训练集中提取的长尾概念类别,共 130k 张测试图像)上与代表性基准对比。

模型 预训练数据集 (子集大小) 见光样本量 @ 分辨率 ImageNet-1K Top-1 (%) Let It Wag! Top-1 (%) GPU 耗时 (Hours)
OpenCLIP LAION-400M (400M) 12.8B @ 224 67.1 39.1 10736
MetaCLIP-400M LAION-400M (400M) 12.8B @ 224 70.8 46.5 ≈10700
RECLIP* LAION-400M (298M) 2.56B@112 + 128M@224 62.9 36.0 280
CLIPA* LAION-400M (298M) 2.56B@112 + 128M@224 63.2 36.4 269
DynamiCS (Ours) LAION-400M (298M) 1.28B@112 + 128M@224 65.0 42.1 163
DynamiCS (Ours) LAION-400M (298M) 2.56B@112 + 128M@224 67.5 45.5 299
DataComp (Image∩CLIP) DataComp (1.28B) 1.28B @ 224 63.1 33.7 ≈1070
DFN* DataComp-DFN (130M) 1.28B@112 + 128M@224 68.7 42.4 151
HQ-CLIP DataComp-DFN 3.20B @ 224 70.6 38.2 ≈2675
DynamiCS (Ours) DataComp-DFN (130M) 0.64B@112 + 128M@224 69.2 46.5 95
DynamiCS (Ours) DataComp-DFN (130M) 1.28B@112 + 128M@224 71.3 50.2 163
DynamiCS (Ours) DataComp-DFN (130M) 2.56B@112 + 128M@224 72.6 52.0 299

消融实验

消融实验深入验证了聚类缩放与动态采样的独立增益,以及缩放因子 \(\alpha\) 的调控敏感度。

表 1:采样策略与动态机制消融(DataComp 预训练 0.64B@112 + 128M@224)

配置 ImageNet-1K Top-1 (%) Let It Wag! Top-1 (%) 说明与增益分析
Random Pruning 64.5 35.5 静态随机抽取 50% 子集并固定训练
Random-Dynamic 66.2 36.2 每轮以 50% 概率随机重选样本(+1.7% / +0.7%)
Cluster-Scaling (静态) 68.0 43.7 引入幂律缩放但每轮使用固定采样集(+3.5% / +8.2%)
DynamiCS (完整模型) 69.2 46.5 聚类缩放 + 动态重采样组合(相比静态随机 +4.7% / +11.0%)

表 2:缩放指数 \(\alpha\) 敏感度分析(DataComp 见光 106M 样本 @ 112×112)

缩放参数 \(\alpha\) ImageNet-1K Top-1 (%) Let It Wag! Top-1 (%) 行为模式说明
\(\alpha = 0.0\) 38.5 19.5 绝对平均截断(追求均匀,每个簇固定抽相同数量)
\(\alpha = 0.2\) 39.2 20.2 效用优先最优折中(兼顾自然语义序与长尾上采样)
\(\alpha = 0.4\) 38.2 19.6 适度倾斜
\(\alpha = 0.6\) 36.9 17.5 长尾上采样强度减弱
\(\alpha = 0.8\) 36.4 15.6 接近原始分布比例
\(\alpha = 1.0\) 33.8 13.4 完全随机动态采样(无偏退化)
\(\alpha = 2.0\) 19.4 5.1 极度偏向超大头部簇,长尾概念被近乎清空

关键发现

  • 长尾上采样是释放小样本语义潜能的关键支柱:将静态随机采样替换为聚类缩放后,长尾评测 Let It Wag! 的准确率发生了质的跃升(由 35.5% 跃升至 43.7%,净增 8.2%),证明以往高效算法的性能瓶颈主要源自稀有概念在盲目剪枝中的流失。
  • 跨轮动态抽取有效破除了过拟合风险:动态重采样使得 DynamiCS 相比静态聚类缩放进一步在 ImageNet-1K 提升 1.2%、在 Let It Wag! 提升 2.8%,证明动态性不仅为下采样大簇带来了跨 Epoch 的视野广度,更为频繁过采样的小簇提供了更优的泛化正则效果。
  • 极佳的超参容忍度:\(\alpha\) 在 0.0 到 0.8 的宽广范围内表现均大幅胜过无偏随机采样(\(\alpha=1.0\)),表明算法对超参数并不严苛,默认取 \(\alpha=0.2\) 即可稳定迁移至各类数据集。
  • 细粒度与鲁棒性任务上的突出优势:在 CUB-200(鸟类细粒度)与 Flowers102 等依赖长尾类别区分度的基准上,DynamiCS 相比 DFN 和 RECLIP 均取得了超 10% 以上的惊人领先(例如 CUB-200 上达到 70.8%,较 DFN 的 58.1% 高出 12.7%)。

亮点与洞察

  • 从“追求均匀”到“效用优先”的理念革新:以往工作盲目追求语义密度的绝对平坦,但自然概念分布天然存在层次。DynamiCS 证明了通过温和的幂律缩放维持原有簇间相对序,并主动实施小簇上采样,比一刀切的硬截断更符合对比学习表征优化的本质需求。
  • 极高的算力性价比(3% 算力颠覆全量基线):通过动态采样与低分辨率预训练的两阶段结合,仅使用 299 个 GPU 小时即在 DataComp 上达成 72.6% 的 ImageNet-1K 精度与 52.0% 的长尾识别率,全面击败了耗费超过 10,700 GPU 时的 OpenAI 原版 CLIP、OpenCLIP 及 MetaCLIP。
  • 正交可叠加的高效模块化设计:该方法仅依赖通用的单模态图像自监督表征(DINOv2)完成一次性离线聚类,完全摆脱了对预先训练好的高质量大型 VLM 或 LLM 生成长描述的过度依赖,可无缝无损地与 CLIPA、FLIP 等 Patch/词法掩码方案结合使用。

局限与展望

  • 依赖图像单模态聚类的语义假设:聚类完全基于 DINOv2 图像表征构建,当图像呈现多义性或主体语义极大受制于配套文本中的抽象关系时,单一视觉聚类可能会将复杂复合概念粗暴归并。未来可探索基于图文多模态联合表征的快速双向聚类。
  • 离线聚类与质心合并的初始开销:在数百亿规模的数据集上进行大规模 K-Means 聚类与成对质心相似度合并虽然是一次性的,但在超大规模工业生产线上仍需要一定前置资源调度。未来可探索增量式流式聚类或在线近似采样算法。

相关工作与启发

  • vs MetaCLIP / DBP: MetaCLIP 基于人工元数据字典进行 20k 硬截断,DBP 基于聚类复杂度抹平密度,二者均严格遵循“追求均匀”哲学且仅向下采样。DynamiCS 则指出下采样必须与有放回上采样结合,且应保留各簇的相对主次层级(\(\alpha=0.2\)),在 Let It Wag! 上大幅拉开了领先身位。
  • vs DFN / HQ-CLIP / WhatIf: 后续工作高度依赖预先训练好的大规模 CLIP 计算图文相似度过滤,或调用前沿大语言模型进行重写描述生成合成数据(Captioning),耗费二次算力且可能削弱文本多样性。DynamiCS 纯粹利用自监督聚类动态抽样,不依赖外部 VLM 教师模型。
  • vs RECLIP / FLIP / CLIPA: 现有高效训练方案聚焦于减少单样本的 Token 数量(小分辨率、图像 Patch 掩码或文本词法掩码),而 DynamiCS 聚焦于宏观语义分布与数据选择维度,二者属于互补的正交关系,实验表明二者组合可进一步释放 ViT-L/16 等大模型的预训练潜力。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 突破传统将平衡等同于拉平分布的思维定式,提出保留相对序与动态过采样的实用新范式。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 LAION 与 DataComp 两大主流池,对比涵盖高效基线、数据过滤模型与百亿见光量的全量 SOTA,消融全面严密。
  • 写作质量: ⭐⭐⭐⭐⭐ 论点清晰,图表数据丰富详实,动机链路与数学公式推导自然严密。
  • 价值: ⭐⭐⭐⭐⭐ 真正实现以单卡机房级算力复现并超越工业级大厂全量预训练表征,且在长尾概念识别上具有明确的实用价值。