跳转至

Φeat: Physically-Grounded Material Feature Representation

会议: ECCV 2026
论文: ECCV 2026 官方页面
领域: 自监督/表示学习
关键词: 材质表征、自监督学习、物理先验、DINOv3、对比学习

一句话总结

针对通用视觉基础模型聚焦语义而忽略材质反射率与微观结构的缺陷,Φeat 基于 DINOv3 架构,利用海量高保真物理渲染在可控光照与几何变化下进行弱监督自监督预训练,使特征对宏观光影几何保持不变的同时对内在物理材质高度敏感。

研究背景与动机

现代计算机视觉的发展在很大程度上得益于以 DINO 系列为代表的自监督基础模型。这些模型通过跨视角的对比学习与掩码重建,成功将像素映射到高度鲁棒的语义流形上,在跨视角与不同图像风格下保持了优异的目标类别一致性。然而,这类通用视觉主干往往将表征优化完全偏向于高层语义,难以解耦构成真实场景物理外观的内在要素。在内在图像分解、材质捕获与具身智能等场景中,区分物体的高级语义(例如“椅子”)往往远不如准确识别其底层的物理材质身份(例如“抛光橡木”)关键;现有模型通常会将同一物体内的不同材质强行聚成一团,或受到光影剧烈变化的干扰。

这种不足的深层矛盾在于现有自监督预训练的输入扰动机制与材质内在物理规律的脱节。现有的自监督目标普遍依赖于颜色抖动(color jittering)或曝光反转(solarization)等图像级光度增强手段,这些生硬的数据增强不仅破坏了材质本身微妙的高光、粗糙度与表面中观结构(mesostructure)等物理光学线索,反而促使网络学会在忽略材质特性的前提下强行追求目标级一致性。而下游专用的材质理解方案又普遍依赖于昂贵且受限的高密度逐像素监督标注,或局限于闪光灯等严苛的物理采集环境,泛化能力受到极大制约。

本文的切入视角在于:与其依赖非物理的图像级合成增强,不如直接引入基于真实物理规律的弱监督信号。通过在多样化的宏观几何形体与复杂 HDR 环境光下渲染完全相同的物理材质,构建严谨的物理视角对(physical triplets),强制网络在像素外观因外在因素发生剧烈变化时依然将同一材质的局部区域拉近,并结合跨材质对比约束。核心 idea:利用几何与光照受控变化的物理渲染三元组弱监督信号专门微调自监督 ViT,在保留 DINOv3 空间结构的同时将特征流形从语义空间重新对齐到内在物理材质空间。

方法详解

整体框架

Φeat 旨在构建对宏观几何、空间朝向以及环境光照等外在变量(extrinsic factors)具有不变性,同时对表面反射率(BRDF)与中观微观几何(mesostructure)等内在物理属性(intrinsic properties)高度敏感的视觉表征。整个训练流程从构建的约 100 万张合成物理渲染集中采样,每批次选取同一材质在不同几何与光照条件下的多张渲染视图,经多尺度裁剪后输入学生网络与动量更新的教师网络,在图像级原型分配、掩码图像建模、特征散布正则化、二阶结构对齐以及全局跨材质对比五重目标联合监督下完成端到端优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["同一材质物理渲染对<br/>几何与光照受控变化"] --> B["语义对齐物理合成数据生成<br/>Substance 3D 材质 + 匹配模板 + HDR 路径追踪"]
    B --> C["图像级与局部多尺度裁剪<br/>Global (40-100%) + Local (10-40%)"]
    C --> D["ViT 编码器与结构化特征提取<br/>DINOv3 ViT-B/16 + RoPE + 寄存器 Token"]
    D --> E["多级物理约束联合优化<br/>Sinkhorn 图像级对齐 + 掩码 Patch 重建 + 跨材质对比"]
    E --> F["输出内在材质感知表征<br/>解耦光照几何 / 敏感于反射率与纹理"]

关键设计

1. 语义对齐物理合成数据生成:解决随机渲染组合带来的外观物理失真 以往面向逆渲染或材质相似度的数据集多采用物体几何、材质贴图与照明环境的完全随机匹配,这极易产生违反常理的物理组合(例如将刚性软木材质附着在高曲率褶皱布料上),破坏了材质在现实世界中的空间中观特征。为此,研究团队基于 Adobe Substance 3D Assets 库构建了规范化流程,涵盖布料、金属、木材、石材、大理石、塑料等 21 个外观大类、共 9,500 余种程序化材质。通过艺术家预设扰动程序化参数生成约 36,000 套独特的 PBR 材质贴图(含位移、粗糙度、法线等)。每种材质仅被赋予具有语义合理性的几何模板,并在 20 个高动态范围(HDR)环境图中随机抽取 4 种进行蒙特卡洛路径追踪渲染(每像素 128 采样并结合 GPU 原生降噪与几何位移细分),最终生成约 100 万张光影自遮挡与相互反射高度逼真的图像,为模型提供了坚实的物理不变性学习基准。

2. ViT 编码器与结构化特征提取:兼顾全局材质身份与局部密集空间结构 模型沿用 DINOv3 的 Vision Transformer 架构,采用 patch 大小为 \(16 \times 16\) 的 ViT-B 骨干。输入图像切块并线性投影为 patch token 序列,同时拼入全局 [CLS] token 以及一组可学习的“寄存器 token”(register tokens)。寄存器 token 充当全局上下文的专用记忆存储单元,能够有效消除无意义背景区域引发的 patch token 伪影。模型引入旋转位置编码(RoPE)以原生支持测试时的序列长度外推和任意分辨率输入。最终层输出的双重结构——即代表整图材质属性的 [CLS] 特征与代表局部中观物理细节的 patch 级密集特征,为下游材质密集分割与图像级检索提供了完备支撑。

3. 多级物理约束联合优化:解耦外在光影并重塑判别性材质流形 为了在消除光照几何影响的同时防止表征退化并建立清晰的跨材质决策边界,Φeat 组合了五种互补的自监督与弱监督损失项: - Sinkhorn 图像级原型对齐(\(\mathcal{L}_{\text{image}}\):学生网络和动量 EMA 教师网络分别处理多视角全局与局部裁剪,教师网络输出的 logits 通过 Sinkhorn-Knopp 算法在 \(K\) 个可学习原型间进行平衡软聚类分配,监督所有学生视图的预测概率分布: $\(\mathcal{L}_{\text{image}} = -\frac{1}{|V_t|\,|V_s|}\sum_{v_t\in V_t}\sum_{v_s\in V_s}\sum_{k=1}^{K}q_k(v_t)\log p_k(v_s)\)$ - 掩码 Patch 潜变量重建(\(\mathcal{L}_{\text{iBOT}}\):对学生输入的 patch token 进行 10%~50% 的随机空间掩码,利用投射头 \(h_\theta\) 强制被遮挡 patch 的表征预测出教师网络未掩码时相同空间位置的特征: $\(\mathcal{L}_{\text{iBOT}} = \frac{1}{M}\sum_{m=1}^{M}\|h_\theta(p^s_m) - p^t_m\|_2^2\)$ - 特征散布正则(\(\mathcal{L}_{\text{KoLeo}}\):基于最近邻距离在超球面上最大化特征熵,惩罚过近的嵌入,防止特征维度崩塌: $\(\mathcal{L}_{\text{KoLeo}} = -\frac{1}{B}\sum_{i=1}^{B}\log(\rho_i + \varepsilon)\)$ - 二阶相关性 Gram 锚定(\(\mathcal{L}_{\text{Gram}}\):在训练最后 2,000 步中引入冻结的 Gram 教师网络,对零均值化的 patch 特征矩阵第二阶自相关矩阵进行 Frobenius 范数对齐,稳固局部结构关系。 - 跨材质批内对比损失(\(\mathcal{L}_{\text{contrast}}\):由于单纯的物理数据微调可能削弱模型在不同材质间的类别可分性,模型在 \(L_2\) 归一化的全局学生嵌入上施加 InfoNCE 对比损失。对于锚点 \(z_i\),同一种材质的不同物理渲染视图构成正样本集 \(\mathcal{P}(i)\),批内其余不同材质一律作为负样本: $\(\mathcal{L}_{\text{contrast}} = -\frac{1}{N}\sum_{i=1}^{N}\log\frac{\sum_{j\in\mathcal{P}(i)}\exp(\operatorname{sim}(z_i,z_j)/\tau)}{\sum_{k\neq i}\exp(\operatorname{sim}(z_i,z_k)/\tau)}\)$ 总损失函数为: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{image}} + \lambda_p \mathcal{L}_{\text{iBOT}} + \lambda_k \mathcal{L}_{\text{KoLeo}} + \lambda_g \mathcal{L}_{\text{Gram}} + \lambda_c \mathcal{L}_{\text{contrast}}\)$

损失函数 / 训练策略

模型使用预训练的 DINOv3 ViT-B/16 权重进行初始化,使用 AdamW 优化器,基础学习率设为 \(0.001\),权重衰减为 \(0.05\)。教师网络权重通过余弦动量调度从 \(0.996\) 逐步平滑更新至 \(1.0\)。批次大小设置为 512 对物理渲染图像,每对包含同一材质在不同外在光影几何下的两个渲染视角,每张视图采样 2 个全局裁剪(面积覆盖 40%–100%)和 8 个局部裁剪(面积覆盖 10%–40%)。损失权重配置为 \(\lambda_p = 1.0\)\(\lambda_k = 0.1\)\(\lambda_g = 0.7\)\(\lambda_c = 0.25\);学生温度 \(\tau_s\) 与对比损失温度 \(\tau\) 均设为 \(0.1\)\(\varepsilon = 10^{-6}\)。在 16 张 NVIDIA A100 GPU 上进行混合精度分布式并行训练,共迭代 10,000 步(总训练耗时约 100 小时),最后 2,000 步启用 Gram 锚定。

实验关键数据

主实验

在材质选择(DuMaS 评测基准,以参考 patch 的余弦相似度图设定 0.5 阈值与 GT 分割比较)以及特征可分性(包含 16 类共 972 种材质在 24 种几何光照变体下的非参数化 \(k\)-NN 检索分类,总样本数 23,328)上,Φeat 与各大主流通用视觉基础模型进行了全面对比。

模型 类型 / 监督范式 材质选择 \(\ell_1 \downarrow\) 材质选择 mIoU \(\uparrow\) 材质选择 F1 \(\uparrow\) \(k\)-NN 准确率 \(\uparrow\) \(k\)-NN 精确率 \(\uparrow\) \(k\)-NN F1 \(\uparrow\)
Materialistic (Sharma et al.) 任务专用监督(上限) 5.7 85.8 90.6
Guerrero et al. 2025 任务专用监督(上限) 3.0 89.6 93.5
CLIP (ViT-B) 弱监督(图文对齐) 55.7 21.6 31.6 39.9 36.6 31.2
SigLIP 2 (ViT-B) 弱监督(图文对齐) 53.1 24.4 35.2 33.5 30.8 25.1
PE-core 弱监督(视觉特征) 37.3 40.5 54.6 44.2 37.0 33.9
PE Spatial 聚合式(Dense 特征) 25.2 61.4 72.3 50.3 44.0 39.0
RADIOv3 聚合式(多教师蒸馏) 25.6 63.5 74.7 35.9 32.9 28.8
DINOv2 自监督(DINO+iBOT) 26.7 56.5 69.3 64.3 56.9 53.3
DINOv3 自监督(基线骨干) 27.6 59.7 72.2 66.9 60.0 55.4
Φeat (本文) 物理弱监督自监督 25.4 72.0 80.8 71.8 75.0 66.6

消融实验

通过从初始 DINOv3 骨干逐步添加各训练模块,验证了物理渲染多视角策略与对比损失项的核心作用。

训练配置 材质选择 \(\ell_1 \downarrow\) 材质选择 mIoU \(\uparrow\) 材质选择 F1 \(\uparrow\) \(k\)-NN 准确率 \(\uparrow\) 关键机制与说明
DINOv3 (原始骨干) 27.6 59.7 72.2 66.9 原始语义表征基线,全局分类良好但材质分割较弱
+ single render (单渲染自监督) 26.5 69.4 78.1 34.5 引入单图材质弱监督提升局部物理感知,但全局流形可分性崩塌(Acc 骤降 32.4%)
+ multi render (多视角受控物理变化) 26.1 69.9 79.2 51.3 引入跨光照与几何的外在扰动对,表征稳定性显著回升
+ contrastive (加入批内跨材质对比) 25.4 72.0 80.8 71.8 显式拉开不同材质间隙,全面超越基线(mIoU +12.3%,\(k\)-NN Acc +4.9%)

外在扰动鲁棒性与语义权衡

在不同光照(固定几何)与不同几何(固定光照)下的成对 Hamming 距离测试中(越低代表越稳定),Φeat 均展现出最强的不变性: - 光照扰动 Hamming 距离:CLIP 为 \(0.403\),DINOv2 为 \(0.284\),DINOv3 为 \(0.240\),而 Φeat 降至 0.221。 - 几何扰动 Hamming 距离:CLIP 为 \(0.534\),DINOv2 为 \(0.435\),DINOv3 为 \(0.365\),而 Φeat 降至 0.305。 - 语义特化权衡(Linear Probing):在 ImageNet 分类(Top-1 Acc)、ADE20K 分割(mIoU)与 Cityscapes 分割(mIoU)中,DINOv3 分别为 \(83.5\%\)\(51.5\%\)\(71.5\%\);而微调后的 Φeat 分别为 \(80.1\%\)\(46.2\%\)\(66.1\%\)。Φeat 以极小的语义性能折损(分类下降 3.4%,分割下降 5.3%–5.4%)换取了显著跃升的物理材质感知能力。

关键发现

  • 单纯在材质数据上应用传统单视角自监督微调会导致严重的全局可分性退化(\(k\)-NN 准确率由 \(66.9\%\) 暴跌至 \(34.5\%\)),这表明仅拉近同一图像的不同裁剪会破坏不同材质类别的区分度。
  • 批内跨材质 InfoNCE 对比损失(\(\mathcal{L}_{\text{contrast}}\))是恢复并强化全局材质决策边界的决定性组件,使 \(k\)-NN 准确率从 \(51.3\%\) 飙升至 \(71.8\%\),同时进一步增强局部选择性能。
  • CLIP 和 SigLIP 2 等图文对齐多模态模型在密集材质选择上表现极差(mIoU 仅 \(21.6\% \sim 24.4\%\)),其特征高度绑定在物体级名词语义上,对局部物理反光和材质交界几乎完全脱敏。

亮点与洞察

  • 物理渲染三元组替代人工像素抖动:传统的颜色反相与抖动属于非物理算子,而 Φeat 巧妙利用蒙特卡洛路径追踪生成真实物理世界中的阴影、反射与几何形变三元组,使网络自然学会滤除外在光影干扰并提取本征材质表征。
  • 语义一致性材质模板匹配策略:摒弃以往合成数据集中任意贴图与任意三维物体的随机杂乱绑定,通过材质类别与几何载体的语义对齐(如木质配平整硬质结构、布料配柔性结构),保证合成数据严格契合真实世界物理环境分布。
  • 即插即用的通用物理特征骨干:无需修改模型架构或增加复杂的任务专用解码器,直接输出 patch 特征即可支持跨帧视频材质追踪与无监督 KMeans 分割,为三维数字化资产编辑、机器人接触感知及场景逆渲染提供了通用底座。

局限与展望

  • 潜在空间缺乏显式物理属性解耦:模型学到的材质嵌入是隐式混合表征,并未显式拆解为粗糙度、金属度、基础反射率(Albedo)或法线等具体物理维度的标量,用户无法直接在潜空间中定向编辑特定光学属性。
  • 纯合成数据预训练带来的域迁移差距:所有训练视图均来自 Substance 3D 渲染,尽管路径追踪精度极高,但面对真实拍摄场景中的相机噪声、非理想透镜畸变及未知混合光源时,仍可能存在域差异,亟需引入真实无标注图像的自适应微调机制。
  • 复杂体渲染与次表面散射支持有限:当前渲染模型主要建立在表面微表面反射模型之上,对于半透明介质(次表面散射)、复杂折射与薄膜干涉等复杂光学现象的建模能力仍有待拓展。

相关工作与启发

  • vs DINOv3 / DINOv2: DINO 系列依赖图像内部自监督与语义聚类,倾向于根据物体语义边界划分特征,无法区分同一物体上的反光变动或同一材质跨物体分布。Φeat 保留了 DINOv3 优秀的空间架构与正则化方案,但通过物理驱动视角对重塑了特征流形的几何属性。
  • vs PE Spatial / RADIOv3: PE Spatial 与 RADIO 追求通用的密集空间预测表征,但特征中依然混杂了强烈的几何与语义先验;在细粒度材质分类上表现欠佳(\(k\)-NN 准确率仅 \(35.9\% \sim 50.3\%\)),落后于 Φeat(\(71.8\%\))。
  • vs Materialistic / Guerrero et al.: 这类工作属于特定任务的高密度全监督回归模型,在特定评估集上指标略高,但需要昂贵的像素级材质分割掩码且难以作为通用下游骨干迁移。Φeat 属于无密集像素标注的弱监督自监督基础表征,具备极强的开箱即用迁移价值。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 提出首个基于受控物理渲染三元组解耦外在光影与内在材质的弱监督基础模型预训练范式,构思优雅。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖下游密集材质选择、非参数化分类检索、光照几何扰动鲁棒性以及语义权衡消融,论据扎实详尽。
  • 写作质量: ⭐⭐⭐⭐⭐ 论文逻辑清晰流畅,问题动机明确,方法图与实验可视化极具说服力。
  • 价值: ⭐⭐⭐⭐⭐ 为计算机图形学与计算机视觉的交叉融合提供了强有力的材质感知特征骨干,对神经逆渲染与具身材质交互意义重大。