Steering 3D Generations: Preference Alignment via Direct Reward and Preference Optimization¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/12161.pdf
领域: 3D 视觉
关键词: 3D生成, 偏好对齐, 直接奖励优化, 直接偏好优化, 整流流
一句话总结¶
针对单图到3D生成中几何伪影严重与用户偏好难以形式化的痛点,提出融合神经SDF高斯曲率数据清洗、直接奖励优化(DRO)与直接偏好优化(DPO)的整流流偏好对齐框架,利用轻量LoRA实现高保真度与几何风格可控生成。
研究背景与动机¶
随着生成式人工智能在游戏、工业设计与具身智能等场景的爆发,从单张图像快速合成高保真、可编辑的三维数字资产成为前沿核心需求。尽管主流范式已从基于2D提升的多视角重建(如SDS/VSD蒸馏及多视角扩散)演进至原生3D潜在空间扩散模型(如CLAY、Trellis与Hunyuan3D-2),并在结构生成速度与多样性上取得长足进展,但3D生成质量与2D图像生成之间仍存在显著差距。这种差距主要源于网格与神经场等3D几何表征本身的极高复杂度,以及大规模网络抓取3D数据中普遍存在的孔洞、非流形拓扑与法线紊乱等严重噪声。
现有基于简单统计回归(如潜在变量 \(L_2\) 损失或点云 Chamfer 距离)训练的3D生成系统,核心症结在于将生成过程视为黑盒映射,缺乏显式对齐用户隐式几何偏好的机制。在工业级建模和艺术创作中,用户往往对模型具有细粒度的质量与风格诉求,例如要求车身表面光滑平顺、机械构件边缘锐利挺拔或整体拓扑严丝合缝;这类以人类审美与物理可用性为中心的高阶偏好极难直接写成连续可微的像素级或点级显式损失函数。缺乏偏好引导的扩散模型极易陷入局部退化解,产生浮空碎屑、过度平滑或局部凹陷。
面对数据脏乱与偏好失准的双重阻碍,本文主张将大语言模型中的人类对齐思想引入3D结构化几何生成领域,形成“高质量几何数据打底 + 偏好奖励精准对齐”的双轮驱动路线。核心 idea:通过融合高斯曲率正则化的神经SDF重构管道获取高质量水密基底,并在整流流扩散骨干上构建无需成对比较的直接奖励优化(DRO)与成对直接偏好优化(DPO),配合LoRA低秩微调实现兼顾保真度与可控风格引导的3D偏好对齐。
方法详解¶
整体框架¶
本文框架以单张图像为输入,端到端合成高保真、水密且符合人类几何偏好的三维网格模型。整个流程由两大核心支柱构成:一是基于高斯曲率双凹槽势能先验的神经SDF数据清洗管线,将海量未定向脏点云提炼为拓扑优良的高质量水密网格,并自动化生成曲率扰动偏好对;二是基于整流流(Rectified Flow)的潜在集合扩散生成架构,冻结预训练骨干网络,仅在几何Transformer注意力层注入低秩自适应(LoRA)模块,分别利用自动化几何预言机驱动的直接奖励优化(DRO)和成对直接偏好优化(DPO)进行参数高效对齐微调。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["单图输入与原始3D资产"] --> B["高斯曲率先验神经SDF数据清洗<br/>双凹槽势能分离平坦区与锐边"]
B --> C["自动化几何预言机与偏好构建<br/>判别水密/复杂度/曲率方差"]
C --> D["整流流骨干与LoRA高效微调<br/>保持预训练先验且仅调1%参数"]
D --> E["双轨偏好优化对齐<br/>绝对反馈DRO与成对偏好DPO"]
E --> F["输出高保真水密网格与可控风格资产"]
关键设计¶
1. 高斯曲率先验神经SDF数据清洗:从脏点云中解耦平滑片元与拓扑锐边
传统从非结构化3D数据集(如Objaverse-XL、ShapeNet与ABO)提取几何表面时,直接网格化往往残留破洞、非流形自相交和法线倒置。本文引入基于NeurCADRecon的隐式神经SDF曲率重建管线,核心机制是设计了一个双凹槽(Double-Trough)高斯曲率势能能量景观: $\(\mathcal{L}_{\text{Gauss}} = \frac{1}{|\Omega|} \int_{\Omega} \text{DT}(|k_{\text{Gauss}}(\boldsymbol{x})|) \, \mathrm{d}\boldsymbol{x}\)$ 传统二阶曲率正则化往往无差别地压制曲率(\(|K| \to 0\)),导致机械边角被不可逆地抹平。双凹槽函数 \(\text{DT}(\cdot)\) 构筑了两个稳定的吸引盆:一是对应平滑可展曲面基底的可展盆(Developable Basin,\(|K| \approx 0\)),二是对应锐利棱角和接缝的奇异盆(Singularity Basin,\(|K| \approx \pi/2\)),两者之间由高惩罚壁垒阻隔,强力滤除由于噪声造成的模糊中间曲率。更关键的是,通过动态调节平衡超参数 \(\lambda_{\text{Gauss}}\)(如从平滑态 \(\lambda_{\text{Gauss}}=3\) 变化至锐利态 \(\lambda_{\text{Gauss}}=100\)),管线不仅能输出水密基底,还能针对同一物体自动化构造出成对的几何风格变体,为后续偏好对齐提供充沛的自监督正负样本对。
2. 自动化几何预言机与直接奖励优化(DRO):无需成对标注的绝对质量信号引导
在3D领域人工构建大规模成对偏好标注成本极其高昂且极具主观歧义。为此,本文设计了基于先验规则的自动化几何质量预言机 \(o(x_0) \in \{0, 1\}\),从三个互补维度程序化评估解密后的3D网格质量:第一,拓扑水密性,通过欧拉示性数与边界环检测确保无自交孔洞;第二,面片复杂度,硬性过滤面数低于50万的退化平庸结构;第三,表面光滑平稳度,计算顶点平均曲率的全局方差,当且仅当曲率方差低于阈值0.1时判定为高质量正样本(\(o(x_0)=1\)),其余判定为低质量负样本(\(o(x_0)=0\))。
基于该离散预言机信号,本文构建了直接奖励优化(Direct Reward Optimization, DRO)目标函数: $\(\mathcal{L}_{\text{DRO}} = \mathbb{E}_{t, x_0, \epsilon} \left[ w(t) (1 - 2 o(x_0)) \| \epsilon_\theta(x_t, t, I) - \epsilon \|^2 \right]\)$ 该目标函数巧妙地利用调制项 \((1 - 2 o(x_0))\) 作为自适应梯度放大与反向抑制因子。当样本满足几何规范(\(o(x_0)=1\))时,调制项变为负数,促使模型执行梯度下降以增强对高质量几何潜空间的恢复概率;反之则抑制低质量模式的扩散生成。相较于传统强化学习需额外拟合复杂可微奖励模型或依赖PPO高方差策略采样,DRO直接在流匹配扩散目标内闭环优化,训练极其平稳。
3. 成对曲率扰动与直接偏好优化(DPO):基于相对优势边界的精细风格对齐
针对特定风格控制或显式相对偏好场景,本文将Bradley-Terry偏好模型扩展至3D整流流扩散框架中。利用高斯曲率扰动生成的成对数据 \((x_0^w, x_0^l)\)(其中锐利特征且平整的网格作为胜出项 \(x_0^w\),模糊过度平滑项作为落败项 \(x_0^l\)),构建3D-DPO对齐损失: $\(\mathcal{L}_{\text{DPO}} = - \mathbb{E} \left[ \log \sigma \left( \beta \left( \Delta(x_t^l) - \Delta(x_t^w) \right) \right) \right]\)$ 其中隐式残差项定义为微调模型与冻结参考模型的去噪误差差值:\(\Delta(x_t) = \|\epsilon - \epsilon_\theta(x_t, t)\|_2^2 - \|\epsilon - \epsilon_{\text{ref}}(x_t, t)\|_2^2\)。通过调节温度超参数 \(\beta=500\),DPO强制模型增大胜出样本相对于基准模型的隐式奖励边界,有效引导去噪轨迹收敛至用户青睐的锐利细节区域。
4. 潜在集合整流流与LoRA参数高效微调:防止灾难性遗忘的轻量控制
3D主干采用Hunyuan3D-2的架构,由3D Shape VAE与整流流Transformer组成。Shape VAE将网格编码为无序潜在点集以解耦复杂拓扑,整流流则构建直线概率迁移路径,优化恒定速度场 \(v_\theta(x_t, t, c)\),在极少采样步数下实现稳定解算。为避免全量微调破坏预训练基础模型广泛的3D类别语义先验并导致灾难性遗忘,本文在微调对齐阶段完全冻结扩散骨干权重,仅在粗几何Transformer的自注意力模块(Q与V投影矩阵)中注入低秩自适应矩阵 \(\Delta W = BA\)(秩设为 \(r=64\))。可训练参数量被严格压缩至原模型的1%以内,既大幅降低了分布式计算显存开销,又实现了对表面粗糙度、锐度等几何属性的解耦精准调控。
实验关键数据¶
主实验¶
评估在未见过的标准测试集 Toys4k 上进行,所有生成的网格在评测前均归一化至单位立方体并采用 ICP 与 Ground Truth 进行空间对齐。定量指标涵盖几何外形相似度 Chamfer Distance(CD,越低越好)、表面细节精确度 [email protected](越高越好),以及法线图渲染视角下的 PSNR-N(越高越好)与感知相似度 LPIPS-N(越低越好)。
| 方法 | CD ↓ | F-Score ↑ | PSNR-N ↑ | LPIPS-N ↓ |
|---|---|---|---|---|
| InstantMesh | 0.0224 | 62.78 | 27.34 | 0.096 |
| 3DTopia-XL | 0.0228 | 65.90 | 31.87 | 0.090 |
| LN3Diff | 0.0299 | 59.17 | 27.10 | 0.094 |
| CLAY | 0.0124 | 72.59 | 35.35 | 0.035 |
| Trellis | 0.0083 | 73.12 | 36.11 | 0.024 |
| Hunyuan3D-2 (Baseline) | 0.0089 | 72.79 | 35.53 | 0.033 |
| Ours (DRO) | 0.0036 | 77.97 | 37.05 | 0.021 |
消融实验¶
消融实验系统对比了原始基线模型(Hunyuan3D-2骨干)、在高质量清洗数据上的标准监督微调(SFT),以及分别引入成对直接偏好优化(DPO)和绝对质量反馈直接奖励优化(DRO)的效果。
| 训练配置方案 | CD ↓ | F-Score ↑ | 说明 |
|---|---|---|---|
| Baseline | 0.0079 | 73.79 | 未经清洗数据微调的原始骨干网络 |
| Baseline + SFT | 0.0045 | 76.28 | 仅在清洗后高质量数据上进行监督微调,显著补全几何缺陷 |
| Baseline + SFT/DPO | 0.0048 | 76.77 | 结合曲率扰动成对数据进行DPO对齐,细节精确度进一步提升 |
| Baseline + SFT/DRO | 0.0036 | 77.97 | 采用规则预言机绝对质量反馈,探索空间更广且泛化最优 |
关键发现¶
- DRO绝对反馈优于成对DPO:消融数据显示,DRO在未见过的测试集 Toys4k 上取得了最低的 CD(0.0036)与最高的 F-Score(77.97)。成对 DPO 虽在细节感知上强于 SFT,但成对样本间的人工曲率扰动边界可能引入局部归纳偏差;而 DRO 的规则预言机提供了更加普适、客观的物理几何判别准则,使模型能够在更广阔的解空间中泛化。
- 高质量SFT打底至关重要:单纯引入清洗后的高质量水密数据集进行SFT,CD即从0.0079骤降至0.0045(降幅达43%),证实当前3D生成质量瓶颈很大程度上由公开网格的脏乱拓扑所致。
- 用户主观盲测偏好显著:在90名受试者针对45组输入图像的2AFC对比盲测中,本方法(Ours-DRO)面对强基线 CLAY 时斩获了 60.0% 的投票胜率,用户在表面洁净度、结构真实感与轮廓保真度上均给出了更高评价。
亮点与洞察¶
- 将LLM对齐机制成功移植至原生3D空间:首次在整流流潜集合扩散架构中系统性打通了绝对质量DRO与成对DPO两条偏好对齐路径,跳出了过去单纯依赖Chamfer距离或隐变量重构误差的单点瓶颈。
- 高斯曲率双凹槽势能数据引擎:巧妙利用微分几何中的高斯曲率不变量,通过双凹槽能量势能实现平整片元与尖锐拓扑棱线的数学解耦,不仅产出零瑕疵水密网格,还自然衍生出可控正负对抗样本对。
- 低开销且零退化的LoRA解耦微调:仅通过调整Transformer中1%的注意力投影权重即可精准转移曲面风格,完整保留了基础大模型强大的多品类通用几何先验。
局限与展望¶
- 预言机规则仍偏向确定性几何启发式:当前的DRO质量判断主要依据水密性、面数和平均曲率方差,尚未引入基于多视角渲染的大规模多模态美学打分模型(如VLM-as-a-judge),对复杂艺术拓扑的感知粒度有待增强。
- 单物体生成向复杂场景扩展的受限:目前的数据清洗管线与潜在点集表征主要适配孤立物体的几何重建,在包含遮挡交互、多物体层级关系的复杂室内外大场景中应用难度较大。
- 高斯曲率正则化对非流形极度脏数据的鲁棒性上限:当输入点云严重欠采样或缺失整体轮廓时,神经SDF拟合过程仍可能耗时过长或陷入局部几何退化。
相关工作与启发¶
- vs CLAY / Trellis / Hunyuan3D-2: 现有先进3D扩散模型侧重于扩展潜表征容量与模型规模,训练目标局限于无偏好的确定性重构;本文在此基础上开创性地叠加了偏好微调管线,在保持同等推理开销下显著降低了表面噪声与凹凸伪影。
- vs Diffusion-DPO (2D): 2D图像DPO大多依赖人类点赞或视觉语言模型打分,评判往往局限于美学与图文相关性;本文将对齐维度下沉至网格水密性、曲率连续性等3D特有的微积分几何约束,形成了端到端闭环的物理级评估体系。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 首次将DRO与DPO系统性引入3D潜在整流流模型,并结合高斯曲率双凹槽势能清洗数据。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖SOTA对比、双指标消融实验、曲率可控性分析以及严格设计的2AFC用户双盲调研。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严密清晰,动机剖析深刻,数学表达与实验论据相互印证。
- 价值: ⭐⭐⭐⭐⭐ 为解决3D生成资产不可控、多伪影及非水密等工业落地顽疾提供了可落地的标准化新方案。