title: >- [论文笔记] Beyond Categorical Matching: Intra-Class Graded Relevance Estimation for Cross-Modal 3D Retrieval description: >- [ECCV 2026][多模态VLM][3D检索] ReMU3D以SCI和Q-MoE重参数化三模态表示,并用INGRE评测类内渐进相关度,在NDCG@10上达到0.93。 tags: - ECCV 2026 - 多模态VLM - 3D检索 - 渐进相关度 - 混合专家 date: 2026-09-16 content_hash: 9571fc9f1298e1f8
Beyond Categorical Matching: Intra-Class Graded Relevance Estimation for Cross-Modal 3D Retrieval¶
会议: ECCV 2026
论文: https://eccv.ecva.net/virtual/2026/poster/5096
代码: https://github.com/Listeningx/objaverse-benchmark-generation
领域: 多模态VLM / 3D视觉
关键词: 3D资产检索、类内渐进相关度、多模态融合、混合专家、软标签
一句话总结¶
ReMU3D通过SCI重参数化图像、文本与点云的联合语义空间,再用Q-MoE按查询模态动态聚合,在新建的INGRE渐进相关度基准上将NDCG@10从最佳基线的0.76提高到0.93。
研究背景与动机¶
跨模态3D检索通常把问题处理成类别匹配:查询与候选同类就是相关,不同类就是不相关。ULIP、OpenShape和Uni3D等方法因此擅长把“椅子”与“桌子”分开,却把同类中的扶手形状、材质、颜色和使用情境压缩到相近位置。真实用户要找的往往不是任意一把椅子,而是与参考图在风格和结构上最接近的那一把;二值标签无法表达这种排序偏好,也让常规Recall或mAP掩盖了类内差异。
将相关性改成连续分数后,模型同时面对两个问题。一方面,点云包含结构却缺少不少外观和语义线索,简单对齐到预训练CLIP空间容易继承其类内“语义塌缩”;另一方面,查询可能只有文本、图像或点云,也可能是任意组合,固定平均融合不能对不同模态可用性作出反应。评测端同样缺少能够规模化提供连续相关度、又与人类偏好一致的3D检索基准。
核心 idea:把跨模态3D检索从类别级二值命中改写为类内渐进排序,用SCI在联合三模态空间中保留细粒度差异、用Q-MoE适配任意模态组合,并以MLLM自动生成的INGRE软相关度基准检验排序质量。
方法详解¶
整体框架¶
ReMU3D以Uni3D为基础,接收图像、文本和点云的任意子集。SCI先把可用模态放入同一Transformer中交互,使外观与语言条件重新组织点云表示;Q-MoE再让学习到的查询token经过按输入模态动态路由的专家,池化并归一化为最终检索向量。训练仍使用图像-文本-3D对比学习,不直接拟合INGRE软标签;INGRE则是独立的MLLM标注与排序评测管线。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图像、文本、点云<br/>任意模态组合"] --> B["SCI语义条件交互<br/>重参数化联合空间"]
B --> C["Q-MoE查询引导聚合<br/>动态选择专家"]
C --> D["归一化检索向量<br/>余弦相似度排序"]
E["INGRE软标签构建<br/>MLLM生成渐进相关度"] --> F["NDCG与秩相关<br/>评测类内排序"]
D --> F
关键设计¶
1. SCI语义条件交互:在融合时扩展开类内差异,而非把3D强行压回CLIP类别簇
SCI分别取得图像、文本和点云token,将可用token串接后送入4层、16头的Transformer。每层先在完整序列上做全局多头自注意力,使任意模态token都能读取其他模态;随后按模态拆分,通过各自的前馈网络和残差归一化,再重新拼接进入下一层。图像token提供材质、颜色和风格,文本token提供功能与上下文,它们不是最后才与点云向量求平均,而是在每层注意力中改变点云token关注的几何部位。
这种设计把对齐推迟到交互后的统一空间。预训练CLIP中挤在同一类别簇里的样本可以依靠3D结构和跨模态条件重新分散,因此既保留类别可分性,又为类内排序留下表示容量。若某种模态缺失,SCI只对现有token执行相同计算,不需要替换架构。
2. Q-MoE查询引导聚合:让同一模型针对实际模态组合改变信息汇总方式
SCI输出后,模型附加30个可学习查询token,用它们从融合序列中抽取与检索有关的信息。Q-MoE包含3个专家,路由器读取全局上下文并判断当前有哪些模态,再产生和为1的专家权重;专家输出按权重求和:
模型最后对更新后的查询token做均值池化和 \(\ell_2\) 归一化,用余弦相似度检索。与固定平均不同,路由可以让纯点云查询偏向几何专家,让图文组合利用外观和语义专家;训练时还根据验证表现动态调整模态组合采样率,并提高含点云组合的比例,使缺模态鲁棒性来自真实训练覆盖,而不是测试时补零。
3. INGRE软标签构建:用查询相关的评分维度把“同类”展开成连续排序
INGRE整合ESB、NTU、ModelNet40、GSO和Objaverse,覆盖70多个类别。对以几何为主、外观信息有限的数据,标注管线按类别建立查询案例,再沿颜色、功能、纹理等固定维度评分,并混入跨类干扰项。对规模大且属性复杂的Objaverse,作者先筛出10,742个高质量资产;MLLM针对每个查询从维度库选择最关键的5个维度并赋权,生成候选的多维描述、逐维评分和总分,最后执行一致性检查。
评测把传统NDCG中的二值相关性替换为连续软分数。对前 \(K\) 个结果,指标为:
作者主要报告NDCG@5/10,并用Kendall's \(\tau\) 与Spearman's \(\rho\) 衡量同类对象的相对次序;候选列表还加入相关度为0的跨类对象,因此指标不会只奖励类内排序而忽略类别判别。100组查询候选列表上的人工复核显示,MLLM与专家的 \(\tau=0.68\),接近两位专家之间的0.76。
损失函数 / 训练策略¶
训练不回归INGRE分数,而对匹配的3D-文本和3D-图像对使用双向InfoNCE,四个方向取平均。若 \(\mathbf e^A,\mathbf e^I,\mathbf e^T\) 是归一化的3D、图像和文本向量,则每个方向都让同索引正对的相似度相对批内其他样本更高;温度初值为 \(\ln(1/0.07)\approx2.66\)。
优化使用AdamW、\(10^{-4}\) 基础学习率、0.1权重衰减、500步warmup和余弦衰减;点云编码器采用0.95逐层学习率衰减。8张RTX H20上每卡batch size为36并累积8步,有效batch size为2,304,配合ZeRO-2和checkpointing训练589M参数。冻结特征预计算后,在线编码为167--210 GFLOPs,单查询约0.03秒。
实验关键数据¶
主实验¶
| 方法 | NDCG@5 | NDCG@10 | NDCG@20 | NDCG@50 | Kendall's \(\tau\) | Spearman's \(\rho\) |
|---|---|---|---|---|---|---|
| ULIP | 0.69 | 0.71 | 0.72 | 0.88 | 0.22 | 0.30 |
| OpenShape | 0.76 | 0.76 | 0.79 | 0.88 | 0.30 | 0.41 |
| Uni3D | 0.71 | 0.73 | 0.75 | 0.88 | 0.32 | 0.43 |
| ReMU3D | 0.94 | 0.93 | 0.92 | 0.91 | 0.39 | 0.52 |
ReMU3D在最看重顶部结果的NDCG@5/10上分别领先最佳基线0.18和0.17;在全局次序上,Kendall's \(\tau\) 和Spearman's \(\rho\) 分别比Uni3D高0.07和0.09。NDCG@50的优势较小,说明方法的主要收益集中在用户最先看到的候选。
消融实验¶
| 配置 | NDCG@5 | NDCG@10 | Kendall's \(\tau\) | Spearman's \(\rho\) |
|---|---|---|---|---|
| 完整ReMU3D | 0.94 | 0.93 | 0.41 | 0.54 |
| 去掉SCI | 0.57 | 0.61 | 0.15 | 0.22 |
| 去掉Q-MoE | 0.66 | 0.70 | 0.24 | 0.35 |
| 两阶段训练 | 0.41 | 0.47 | 0.04 | 0.07 |
| 固定模态比例 | 0.68 | 0.70 | 0.18 | 0.26 |
去掉SCI造成最大模块跌幅,NDCG@10下降0.32,说明重新展开类内表示比仅做动态聚合更关键。两阶段分别训练SCI和Q-MoE甚至降至0.47,支持二者必须共同塑造连续嵌入空间;固定模态采样也明显弱于动态比例。
关键发现¶
- 在Objaverse-LVIS、ModelNet40和ScanObjectNN零样本分类上,ReMU3D的Top-1分别为53.2、89.3和68.1,均高于表中对应最佳基线,说明类内展开没有以类别识别崩坏为代价。
- 直接在InfoNCE上加入软标签MSE后,NDCG@5/10为0.93/0.93;加入KL后为0.92/0.91,均未超过原始0.94/0.93。收益来自架构学到的判别表示,而非记忆MLLM分数。
- 跨MLLM标注一致性为 \(\tau=0.58\),低于MLLM-人工的0.68和人工-人工的0.76,说明软标签可用但仍对标注模型敏感。
亮点与洞察¶
- 论文首先修正任务定义,而不是只在旧的二值类别指标上刷分。连续相关度把“检索到同类”与“把最像的放前面”区分开,使模型改进更贴近资产搜索体验。
- SCI的关键不是多放一个融合Transformer,而是推迟对齐并让语义条件参与点云token重组。这一思路可迁移到医学影像、商品检索等类间容易而类内排序困难的任务。
- 软标签只用于评测而不用于主模型训练,是很有价值的隔离实验:它减少了模型迎合自动标注器的风险,软标签损失消融也进一步验证结果并非标签泄漏。
局限与展望¶
- INGRE标签由MLLM生成,虽有人类一致性抽查,但仅复核100组候选列表;跨MLLM一致性0.58也表明维度选择与权重可能随标注器变化。后续可扩大人工复核并报告类别、数据源和属性维度分层置信区间。
- Objaverse先筛选10,742个高质量资产,有利于可靠评测,却可能低估真实资产库中的破损网格、渲染缺失和长尾噪声。应增加未清洗集合和跨域压力测试。
- ReMU3D有589M可训练参数,实验使用8张H20;尽管预计算后查询快,训练与索引侧成本仍高。蒸馏Q-MoE、稀疏激活专家和更小的点云骨干值得探索。
- 主表同时混合多个来源数据,尚不足以判断收益是否集中在某些类别或模态。按数据集、模态缺失模式和细粒度属性拆分结果,会更清楚地界定适用范围。
相关工作与启发¶
- vs Uni3D / ULIP:这些方法把图像、文本和点云对齐到共享空间,重点是开放词汇类别迁移;ReMU3D继续使用对比目标,但通过SCI和Q-MoE重参数化类内结构,优势是细粒度排序与模态组合鲁棒性,代价是模型更重。
- vs OpenShape:OpenShape依靠大规模3D预训练获得强类别级表示,并在INGRE中是NDCG@5/10最强基线;ReMU3D把NDCG@10从0.76推到0.93,说明规模化对齐并不自动解决类内语义塌缩。
- vs 传统3D检索基准:ModelNet、ShapeNet和ScanObjectNN主要提供类别标签,PartNet与3D-Future提供部件或家具属性;INGRE的增量在于给定查询的连续相关度,但其自动标注可靠性仍需持续的人类校准。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 从任务定义、模型到基准形成完整闭环,渐进相关度视角比单纯结构改造更有价值。
- 实验充分度: ⭐⭐⭐⭐☆ 主结果、模块训练消融、软标签可靠性与零样本泛化齐全,但分数据源和缺模态结果仍不够细。
- 写作质量: ⭐⭐⭐⭐☆ 动机清楚、模块因果链完整,不过部分公式排版和专家数、池化趋势只在图中呈现。
- 价值: ⭐⭐⭐⭐⭐ 直接对应真实3D资产搜索的排序需求,开源标注框架也能推动后续可比研究。