ARGENT: Adaptive Hierarchical Image-Text Representations¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5595
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/11589.pdf
项目: https://hmchuong.github.io/argent
领域: 多模态VLM / 双曲表征学习
关键词: 双曲几何、层级表征、自适应蕴含、范数正则、层级评估
一句话总结¶
ARGENT 在 HyCoCLIP 双曲双编码器中以自适应角度蕴含损失和范数正则替代不稳定的锥孔径约束,并重新设计层级评估 PEP,使 Large 模型相对 HyCoCLIP-L 的 ImageNet 准确率提升 1.7 个百分点、PEP AUC 提升 1.5 个百分点,但收益并非覆盖所有尺度和指标。
研究背景与动机¶
CLIP 可以把“狗”和“贵宾犬”拉近,却不一定区分“贵宾犬是一种狗”与“狗和牵引绳经常共同出现”。前者带有方向和抽象层级,后者只是相关性。双曲空间的体积随半径指数增长,适合容纳不断分叉的概念树;MERU 将图文对齐搬到双曲空间,HyCoCLIP 进一步用蕴含锥约束图像、裁剪、完整描述与短语之间的层级关系。
问题在于,锥的开口依赖父概念离原点的距离。越一般的概念通常越靠近原点,锥也越宽,但模型可能利用这条规则不断缩小父概念范数,直到孔径计算超出有效域。把孔径截断为半个平面虽然避免数值错误,却让“具体概念落在一般概念的锥内”退化成很弱的约束。与此同时,HierarCaps 检索把其他图像对应的描述都视作负例,即便“一群人”也确实适用于当前图像,模型仍可能被错误扣分。
因此,本文同时修改训练信号与验证方式:不再让孔径决定层级约束强度,并把层级评估从单一配对检索转为清理样本上的正负关系判别。核心 idea:直接约束有方向的蕴含角度,只对容易近乎重复的同模态配对自适应降权,再用范数正则维持可用的几何尺度,并以角度分数独立检查层级关系。
方法详解¶
整体框架¶
输入是图像及其描述;在继承的 HyCoCLIP 框架中,还利用裁剪和短语构造组合层级。图像和文本先由 CLIP 风格编码器生成欧氏向量,再经原点处的指数映射进入 Lorentz 双曲空间。模型保留以负测地距离为相似度的对比学习,用自适应角度蕴含、同模态自适应权重与范数正则共同训练表征。
训练后的表征用于零样本分类和图文检索,也用于独立的 PEP 层级评估。PEP 清洗与打分是评测流程,不是额外的训练监督;ARGENT 本身不生成图像,也不是带语言解码器的多模态对话模型。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图像、裁剪<br/>描述、短语"] --> B["双编码器<br/>Lorentz 映射"]
B --> C["自适应角度蕴含"]
C --> D["同模态自适应权重"]
D --> E["范数正则<br/>联合对比学习"]
E --> F["分类与图文检索"]
E -->|训练后评测| G["PEP 层级评估"]
H["清洗后的 HierarCaps<br/>及负例池"] --> G
关键设计¶
1. 自适应角度蕴含:绕开父概念范数控制的锥孔径
设具体概念为 \(x\)、一般概念为 \(y\),蕴含方向由以父概念为顶点的外角 \(\phi(x,y)=\pi-\angle Oyx\) 描述,其中 \(O\) 是原点。这个角度不是普通余弦相似度:它利用原点定义由一般到具体的径向方向,因此交换父子角色通常会改变结果。理想层级中,具体概念沿一般概念向外的方向延伸,外角较小。
原有孔径依赖 \(2C/(\sqrt{\kappa}\|\tilde y\|)\),这里 \(\tilde y\) 是 Lorentz 点的空间坐标,曲率为 \(-\kappa\)。当该比值超过 1,反正弦没有实数解;以文中 \(C=0.1\)、\(\kappa=0.1\) 为例,对应的范数下界约为 0.6325。截断孔径会使很多本该继续学习的配对不再受到有效约束。AdaEnt 改为直接惩罚外角,并使用带阈值 \(\beta\) 的 Huber 平滑机制,使约束不再依赖孔径是否有效。
缓存中式 (7) 已损坏,无法可靠确认自适应权重位于 Huber 函数内还是外、以及精确的归一化形式,因此这里不拼接一个貌似完整的损失公式。可以确认的是:优化对象是外角,使用 Huber 平滑,并按下述配对类型调节约束强度;精确实现须回查原始 PDF 或代码。
2. 同模态自适应权重:不要强行拉开近乎相同的裁剪与原图
当一个裁剪几乎覆盖整幅图时,二者语义可以近乎相同,并没有必要为了制造“层级”把它们硬分开。ARGENT 对同模态配对采用随双曲测地距离增大的权重,距离接近零时抑制层级损失,距离较大时恢复约束。跨模态图文配对则始终使用权重 1,因为削弱这一部分会破坏关键的模态间层级联系。
结合式 (8) 周围文字与图 4,可将同模态权重写为以下等价距离形式;这不是对损坏公式的逐字符转录:
这里 \(d_{\mathcal L}\) 是 Lorentz 流形上的测地距离,对比学习相似度为其负值。该设计针对的是“配对本身有多大区分空间”,而不是一律降低所有困难样本的权重;对所有配对降权在消融中明显损害 PEP,说明模态类型不是可以省略的条件。
3. 范数正则:防止去掉孔径约束后表征向外漂移
直接优化角度不再自动限制嵌入离原点的距离,表征可能变得过于稀疏。论文对空间坐标范数施加以下正则,小范数由负对数项排斥,大范数由平方项压制:
它约束的是空间坐标的欧氏范数,不应误写成 Lorentz 内积范数。孤立看这个正则,其最小值对应范数 \(1/\sqrt{2}\approx0.7071\);实际嵌入还受到对比和蕴含目标影响,并不会全部落到同一半径。HoroPCA 可视化与范数分布显示,ARGENT 的文本层级区分更清楚,裁剪分布出现双峰,但这些是结果分析,不是额外的网络模块。
4. PEP 层级评估:用清理后的正负关系检验角度分数
传统 Kendall 相关系数主要检查顺序,不区分同样排序下的角度间隔;检索又容易把语义成立但不属于原始配对的描述当成负例。作者因此用 Qwen3-VL 做图文验证,结合 Qwen3-VL-Embed 和 Qwen3-VL-Reranker 的相似性信息清洗 HierarCaps,从 1,000 个样本保留 522 个图文配对,再挑选检索度最低、较少成为其他图像候选的 100 条描述组成负例池。
评估时,每幅图像对应的各层级描述都作为正例,负例取非歧义池中的细粒度描述。式 (9) 的缓存同样破损;下式按正文给出的端点和截断语义重述线性角度分数,精确排版以 PDF 为准:
因此外角为 0 时分数为 1,达到或超过 \(\pi/2\) 时为 0。最终报告 AUC-ROC 和 AP,而不是只看最高分描述是否来自原始配对。“概率”在这里是分数名称;文中这些指标验证的是区分能力,并不证明分数已经完成概率校准。
一个完整示例¶
考虑一张“室内的一群人”图像及不同详细程度的描述。编码器把这些对象映射到 Lorentz 空间后,对比学习先保证图文配对接近;角度蕴含再检查较具体表征是否沿一般概念向外延伸。如果裁剪基本等同于原图,同模态距离接近 0,权重也接近 0;但对应的图文约束仍使用权重 1,不能一起消失。
范数正则同时抑制近原点坍塌与无限向外漂移。评测时,多个正确层级描述都参与正例打分,而不是互相竞争唯一正确答案。以上是机制示例,不是论文报告的单样本数值实验,不虚构具体嵌入坐标或模型分数。
损失函数 / 训练策略¶
总目标保留图文对比学习,将自适应蕴含与范数正则作为附加项:
主实验使用含 20.5M grounded 图文对的 GRIT,比较 Small、Base、Large 三种规模;图像输入为 \(224\times224\),patch 为 \(16\times16\),文本最多 77 tokens。消融使用按 HyCoCLIP 数据流程构建的 CC3M 子规模设置,训练 40,000 次迭代、累计处理 30M 数据点;这个累计量不等于 30M 张独立训练图像。
正文对框信息的表述存在需要复现者核查的地方:数据段称仅 HyCoCLIP 额外使用 box 信息,而架构段又说明 ARGENT 集成到利用裁剪与短语的 HyCoCLIP 框架。本文据此讲清继承关系,但不擅自断言两者的全部监督预算完全相同;Huber 阈值、优化器和完整训练日程也不从缺失信息中补造。
实验关键数据¶
主实验¶
下表摘录原表 2。准确率、Recall、AUC、AP 均按原文百分数尺度报告,越高越好;“平均分类”覆盖 16 个数据集。检索列固定为 COCO 文本到图像 R@5,不把不同数据集或方向混成一个指标。
| 模型 | ImageNet 准确率 | 16 集平均分类 | COCO T2I R@5 | PEP AUC | PEP AP |
|---|---|---|---|---|---|
| HyCoCLIP-S | 37.3 | 39.2 | 52.0 | 96.8 | 87.7 |
| ARGENT-S | 38.8 | 38.4 | 53.2 | 99.3 | 91.2 |
| HyCoCLIP-B | 43.1 | 42.6 | 56.7 | 97.2 | 88.5 |
| ARGENT-B | 44.0 | 42.8 | 57.9 | 99.4 | 90.6 |
| HyCoCLIP-L | 43.9 | 44.4 | 57.5 | 98.0 | 89.5 |
| ARGENT-L | 45.6 | 45.1 | 58.6 | 99.5 | 90.3 |
Large 模型在这些列上的增益分别是 +1.7、+0.7、+1.1、+1.5、+0.8 个百分点。Small 的平均分类反而下降 0.8 个百分点,不能把正文“几乎全面领先”的叙述写成无条件结论。这里只比较同规模 HyCoCLIP,不宣称超过任意数据预算下的 CLIP。
消融实验¶
下表摘录原表 3 的 HyCoCLIP-S 配置;Cls. Acc. 与 Ret. R@5 沿用消融表标签,原表未在该处明确其数据集及聚合口径,因此不能直接与上表 COCO 数字对比。“无正则”一行依据 6.3 节说明及完整配置对应关系解读,缓存中的开关图标已损坏。
| 来源与配置 | Cls. Acc. | Ret. R@5 | PEP AUC | PEP AP |
|---|---|---|---|---|
| 表 3(a):原始 Ent | 22.9 | 54.8 | 94.6 | 76.2 |
| 表 3(b):AdaEnt,不使用自适应权重 | 20.9 | 51.3 | 94.9 | 74.3 |
| 表 3(b):AdaEnt,所有配对使用权重 | 21.6 | 54.9 | 71.1 | 40.2 |
| 表 3(b):AdaEnt,仅同模态使用权重 | 22.8 | 55.5 | 97.3 | 76.9 |
| 表 3(c):移除范数正则 | 20.8 | 52.6 | 96.2 | 75.6 |
完整配置在表 3(a) 的 AdaEnt、表 3(b) 的 Intra 和表 3(c) 的启用正则行中均为 22.8 / 55.5 / 97.3 / 76.9。表内不同分组用于回答不同问题,不能把所有行当成在同一个基线上逐项累加组件。
关键发现¶
- 对所有配对降权相较仅同模态降权,AUC 下降 26.2 个百分点,AP 下降 36.7 个百分点;这是最清楚的设计边界,而非“自适应总是更好”。
- 移除范数正则后,分类从 22.8 降至 20.8,R@5 从 55.5 降至 52.6,说明仅修正角度损失并不足以保证下游泛化。
- ARGENT 从 S 到 L 的 ImageNet 准确率从 38.8 升至 45.6,但 AP 从 91.2 降至 90.3,规模收益与层级检索精度并不完全同步。
- 原表 1 中移除 top-10 相似图像的潜在歧义描述后,CLIPLFT 的 Precision 从 15.36 升至 18.05,Recall 从 43.23 升至 48.10;它支持评测歧义的存在,不代表所有被移除描述都经过人工确认。
亮点与洞察¶
- 把“几何合理”与“可优化”分开检查:双曲空间适合树,不意味着基于它的每个约束都稳定。本文定位的是孔径计算有效域与梯度消失的具体漏洞。
- 权重是否合理取决于配对语义:同模态近重复需要降低强制区分,跨模态关系却需要保留约束。这个经验可用于其他带局部视图或片段的表征学习任务,但要重新验证配对假设。
- 评估先检查负例是否真的错,再解释分数高低。清理候选池能揭示检索指标的标签假设,但也应同时公开清理规则以便检验选择偏差。
局限与展望¶
- 作者承认角度目标会使空间变稀疏,需要额外范数正则及损失权衡。文中没有由这些实验给出无坍塌的严格保证。
- PEP 仅保留 522 个配对,依赖 Qwen 系列模型清洗,且负例池倾向低混淆描述。接近 99.5 的 AUC 不等于开放世界细粒度层级问题已解决,应补充人工审核、困难负例和跨数据集验证。
- 现有实验没有消除所有复现不确定性:清洗阈值和完整训练细节指向补充材料,正文的 box 监督表述也需核对;表中未给出多随机种子的方差。
- 缓存中的式 (7)、式 (9) 和消融开关图标存在提取缺损。本笔记明确区分可确认机制、语义重述与无法恢复的实现细节,不把缺损当作作者没有定义。
相关工作与启发¶
- 对比 CLIP / ALIGN:它们以欧氏图文对齐为核心;ARGENT 增加有方向的双曲层级约束,但需要管理曲率空间的数值和半径行为。
- 对比 MERU:MERU 提供双曲图文表征基础;ARGENT 主要改进蕴含训练稳定性与层级评测,不是首次将 VLM 放入双曲空间。
- 对比 HyCoCLIP:继承其双编码器与组合层级框架,关键替换是角度目标、配对权重和范数正则。收益应结合监督预算与模型尺度解读。
- 对比 HierarCaps 原协议:保留多层级描述这一资源,改变样本清洗和评估单位。后续值得同时报告原协议、清洗后的 PEP 与人工困难负例,避免只在一种评估中寻找优势。
评分¶
- 新颖性:4/5。具体诊断蕴含锥失稳,并把训练修正与评估协议结合;架构本身沿用已有双曲 VLM。
- 实验充分度:4/5。覆盖三种规模、16 个分类数据集、双向检索和组件消融,但缺少表中方差与更广泛的独立层级基准。
- 写作质量:3/5。问题链条清楚,但正文概括与表格并非处处一致,部分监督说明需要交叉核查;不把缓存排版损坏计为作者写作缺陷。
- 价值:4/5。对层级多模态表征的稳定训练和评测设计有直接参考价值,对图像生成没有直接实验证据。