CubicSplat: Differentiable Vector Graphics via Error-Bounded Forward Relaxation¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/CubicSplat/repo
领域: 其他(矢量图形与可微渲染 / 3D与图形学)
关键词: 可微渲染、矢量图形、高斯泼溅、梯度病态性、误差有界松弛
一句话总结¶
CubicSplat 针对可微矢量渲染中几何前向保真度与反向梯度质量之间的“梯度跷跷板”矛盾,提出误差有界的前向松弛框架,通过 \(\mathcal{O}(S^{-2})\) 几何误差界的均匀折线代理消除迭代最近点求解,配合符号残差覆盖核与透射率基尼系数剪枝,在训练速度提升最高达 4 倍的同时在闭合填充上实现超 2 dB 的 PSNR 飞跃。
研究背景与动机¶
矢量图形(Vector Graphics)凭借与分辨率无关的无限缩放特性、极高的存储压缩比以及天然的参数化可编辑性,成为数字艺术与图像生成领域的重要表示形式。通过基于梯度下降的可微栅格化直接从栅格图像反求连续贝塞尔参数(控制点、线宽、颜色、透明度)具有巨大的理论吸引力。然而,传统图形栅格化算子在图元几何边界处是非连续的,导致几何参数关于像素损失的梯度几乎处处为零,或者在边界跳变处发生梯度爆炸。为了使像素响应关于几何变化平滑可导,早期工作如 DiffVG 引入面积平均覆盖率,但需在反向传播中对三次贝塞尔曲线进行迭代式最近点求根;而近期工作如 Bézier Splatting 则沿着曲线密集撒布二维高斯泼溅点(Gaussian Splats)进行前向离散逼近。
尽管现有方法取得了显著的视觉效果,但随着场景几何复杂度提升,训练过程对不透明度启发式调整、曲率正则化惩罚以及复杂的学习率退火策略产生了严重的病态依赖。作者通过深入的诊断性实验发现,单纯提升前向渲染的几何精确度(例如更密集的采样、自适应细分或更严密的贝塞尔求根)虽然单调降低了几何逼近误差,但优化重建质量却迅速陷入平台期,甚至带来严重的梯度退化与计算耗时激增。这一反常现象揭示了可微渲染器前向通道的双重角色——它不仅需要评估目标损失,更关键的是作为梯度预言机(Gradient Oracle)为参数空间导航提供良态(well-conditioned)的梯度场。
现有方案普遍陷入了梯度跷跷板(Gradient Seesaw)困境:(1) 精确前向导致病态反向(如 DiffVG 在退化曲线处因迭代求根导致梯度爆炸或数值不稳定);(2) 平滑梯度伴随前向结构漂移(如 Bézier Splatting 的离散高斯累加无法与空间分辨率缩放交换,高曲率区域结构失真,跨尺度放大时伪影严重);(3) 自适应细分造成计算图动态破裂(如 de Casteljau 离散裂解事件导致计算图结构跳变,产生跨图元的非平滑异方差梯度)。核心 idea:与其盲目追求前向极限精度而破坏反向良态性,不如采用“误差有界的前向松弛”(Error-Bounded Forward Relaxation),利用几何误差在 \(\mathcal{O}(S^{-2})\) 内衰减的静态均匀折线代理替代贝塞尔求根,以可控的前向偏差换取闭式、无迭代且静态计算图的高质量梯度预言机,并利用渲染器固有的透射率基尼系数动态剔除退化图元。
方法详解¶
整体框架¶
CubicSplat 将矢量图形可微优化重新表述为一个“良态梯度预言机设计问题”。给定包含 \(N\) 个具有固定前后层叠顺序的连续图元参数 \(\theta\)(含控制点、线宽 \(r_p\)、颜色 \(c_p\) 与不透明度),整个前向松弛管线 \(R_S\) 通过三阶段映射将参数转化为光栅像素:首先,通过折线代理算子 \(\Pi_S\) 将每条三次贝塞尔曲线均匀离散化为 \(S\) 段线段,从而将像素到曲线的欧氏距离查询转化为完全闭式的点到线段几何距离;其次,将距离与卷绕数(Winding Number)结合构建拓扑符号残差 \(\delta_p(x)\),经由平滑可微覆盖核 \(\phi\) 映射为像素级软不透明度 \(\alpha_p(x)\);最后,自前向后执行标准的 Alpha 混合合成图像,并从各像素累积透射率中提取图元可见性统计量,在无需显式几何正则项的前提下由基尼系数驱动退化与遮挡图元的自动剪枝与致密化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:可微矢量图元参数<br/>控制点、半线宽、颜色与不透明度"] --> B["统一折线代理与闭式距离计算<br/>S 段均匀采样与点段闭式欧氏距离"]
B --> C["符号残差与平滑覆盖核<br/>卷绕数内外判定与自适应抗锯齿带"]
C --> D["透射率可见性统计与基尼系数剪枝<br/>前向 Alpha 混合与动态容量重分配"]
D --> E["输出:光栅化图像与反向梯度流<br/>无迭代求解且静态图良态梯度"]
关键设计¶
1. 统一折线代理与闭式距离计算:消除迭代求解器并锁定 \(\mathcal{O}(S^{-2})\) 几何误差界
针对传统分析型可微渲染(如 DiffVG)必须对三次贝塞尔多项式求解最近点根方程、在自交或高曲率退化构型下诱发梯度奇异性的根本痛点,CubicSplat 放弃在反向传播中保留贝塞尔非线性求根,引入均匀折线代理算子 \(\mathcal{P}_S = \Pi_S(\mathcal{B})\)。对于参数域 \(t \in [0, 1]\) 上的贝塞尔线段,采用固定步长的均匀细分构建包含 \(S\) 条线段的折线网络 \(\mathcal{P}_p\)。由此,任意像素中心 \(x\) 到图元的距离度量严格转化为闭式点到线段欧氏距离的极小值查询:
该操作全程由静态计算图表达,完全剔除了循环迭代求解器在反向微分中的数值震荡。更为关键的是,根据非光滑分析与样条几何逼近理论,均匀折线与原贝塞尔曲线之间的单调 Hausdorff 距离偏差被严格约束在 \(\mathcal{O}(S^{-2})\) 渐进界之内。这意味着前向近似带来的几何偏差不仅在理论上数学可控,而且在优化中表现出宽广的“解等变性(Solution-Equivariance)”:只要采样密度达到非退化门限 \(S_0\)(开放笔触 \(S=24\),闭合填充仅需 \(S=12\)),继续增大 \(S\) 对最优参数解的诱导梯度影响几乎为零,从而彻底切断了计算开销与梯度质量的病态耦合。
2. 符号残差与平滑覆盖核:解耦几何距离与拓扑卷绕数导数
为了在统一框架下兼容开放笔触(Open Strokes)与闭合填充(Closed Fills),同时规避离散内外拓扑判定破坏梯度流的难题,CubicSplat 设计了集几何度量与拓扑判定于一体的符号残差量 \(\delta_p(x)\):
其中 \(r_p \ge 0\) 为可学习的笔触半宽度。对于闭合区域,\(s_p(x) \in \{-1, +1\}\) 取决于基于折线多边形的非零卷绕数判定(Nonzero Winding-Number Test)。系统采用平滑单调核函数 \(\phi(\delta_p(x) / \tau_p)\) 将归一化符号残差映射至软透明度 \(\alpha_p(x)\),抗锯齿带宽 \(\tau_p > 0\) 严格决定边界过渡带。关键的机制设计在于梯度路由解耦:将离散的符号指示 \(s_p(x)\) 视为关于参数 \(\theta\) 的常数冻结其导数,所有空间几何更新完全通过连续的欧氏距离场 \(d(x, \mathcal{P}_p)\) 向控制点回传。由于符号跃变仅发生在折线边界穿过像素中心的零测度事件(余维 1 事件)上,此时平滑核 \(\phi\) 已经为边界连续法向平移提供了充分且良态的边界运动梯度,消除了传统方法在闭合轮廓优化时拓扑跳变造成的梯度噪声。
3. 透射率可见性统计与基尼系数剪枝:以内在容量分配取代外在几何正则化
多图元矢量优化在图元数目增多时极易因遮挡与相互覆盖导致大量冗余退化图元(如蜷缩成极小团块、完全被前景遮挡的死图元),以往方案往往强行施加凸性正则项、曲率平滑项或防自交罚函数,但这严重限制了复杂自然形状的表达能力。CubicSplat 坚持完全放开图元几何拓扑约束,转而从自前向后的标准 Alpha 混合合成过程(初始透射率 \(T_0(x)=1\))中挖掘“零附加成本”的内在渲染物理量:
合成管线在正向渲染中直接暴露出每个图元在各像素的有效透射权重 \(T_{i-1}(x)\alpha_i(x)\)。算法将其在全图积分聚合为图元重要度得分 \(w_p\)。当图元集合的贡献分布高度极化、即计算出的基尼系数(Gini Coefficient)超过阈值 0.35 时,系统自动判定当前处于容量分配失衡状态,精准切除 \(w_p\) 持续低下的被遮挡或退化图元;释放出的参数容量立即在残差高误差区域重新分裂致密化。这种机制将几何正则化问题转化为渲染器内置的资源分配问题,既保留了非凸自然轮廓的灵活表达力,又保障了大规模图元下的梯度有效性。
损失函数 / 训练策略¶
优化目标采用标准像素空间 \(\ell_2\) 渲染重建损失 \(\mathcal{L}(\theta) = \| R_S(\theta) - I^* \|_2^2\),未引入任何曲率、凸性或交叉惩罚等辅助几何正则项。优化器选用兼顾二阶动量与快速收敛的 Adan 优化器,学习率设定为:颜色与不透明度 \(0.1\),贝塞尔控制点 \(10^{-3}\),笔触半宽 \(10^{-4}\)。在开放模式下迭代 12,000 步,闭合模式下迭代 10,000 步。每 500 步基于基尼系数统计执行一次图元剪枝与残差致密化,并在最后 2,000 步锁死图元拓扑以保证边界细节精确收敛。在评估与推理时,直接将采样密度设为 \(S^* = 24\) 或精确贝塞尔光栅器渲染,确保零推理精度损失。
实验关键数据¶
主实验¶
实验在具有高分辨率挑战性的 DIV2K(200 张验证子集)和 Kodak(24 张完整数据集)基准上进行,并在单张 NVIDIA RTX 4090 GPU 上对比了单步耗时、端到端训练时长与重建质量。
表 1:在 2040×1344 分辨率、2048 条曲线下 RTX 4090 单步训练耗时对比
| 曲线拓扑 | 阶段指标 | DiffVG | Bézier Splatting | CubicSplat (本文) | 相对本文优势 / 加速比 |
|---|---|---|---|---|---|
| 开放曲线 (Open) | Forward 耗时 | 141.3 ms | 4.5 ms | 2.70 ms | 比 DiffVG 快 52.3×,比 Bézier Splatting 快 1.67× |
| Backward 耗时 | 701.3 ms | 4.7 ms | 4.07 ms | 比 DiffVG 快 172.3×,比 Bézier Splatting 快 1.15× | |
| 单步总耗时 | 842.6 ms | 9.2 ms | 6.77 ms | 比 DiffVG 快 124.5×,比 Bézier Splatting 快 1.36× | |
| 闭合曲线 (Closed) | Forward 耗时 | 85.2 ms | 14.1 ms | 10.68 ms | 比 DiffVG 快 7.98×,比 Bézier Splatting 快 1.32× |
| Backward 耗时 | 448.3 ms | 24.58 ms | 8.96 ms | 比 DiffVG 快 50.0×,比 Bézier Splatting 快 2.74× | |
| 单步总耗时 | 533.5 ms | 38.68 ms | 19.64 ms | 比 DiffVG 快 27.2×,比 Bézier Splatting 快 1.97× |
表 2:DIV2K 200 张图像集上不同图元预算下的量化重建质量与训练耗时对比
| 拓扑模式 | 方法 | 256 曲线 (SSIM / PSNR / 耗时) | 512 曲线 (SSIM / PSNR / 耗时) | 1024 曲线 (SSIM / PSNR / 耗时) |
|---|---|---|---|---|
| 开放模式 (Open) | DiffVG | 0.552 / 19.83 dB / 18.9 min | 0.587 / 21.47 dB / 22.0 min | 0.616 / 22.62 dB / 30.6 min |
| Bézier Splatting | 0.600 / 22.17 dB / 3.4 min | 0.646 / 23.79 dB / 3.3 min | 0.699 / 25.45 dB / 3.2 min | |
| CubicSplat (\(S=24\)) | 0.624 / 23.07 dB / 1.8 min | 0.662 / 24.43 dB / 1.8 min | 0.708 / 25.93 dB / 1.8 min | |
| 闭合模式 (Closed) | DiffVG | 0.578 / 20.69 dB / 16.4 min | 0.601 / 21.82 dB / 18.5 min | 0.631 / 22.95 dB / 25.1 min |
| LIVE | 0.576 / 20.09 dB / 2.6 h | 0.611 / 21.70 dB / 4.2 h | 0.648 / 23.11 dB / 5.1 h | |
| LIVSS | 0.586 / 17.71 dB / 39.2 min | 0.630 / 18.71 dB / 54.3 min | 0.678 / 19.83 dB / 1.4 h | |
| Bézier Splatting | 0.580 / 20.74 dB / 7.8 min | 0.607 / 22.11 dB / 8.3 min | 0.639 / 23.45 dB / 8.6 min | |
| CubicSplat (\(S=12\)) | 0.629 / 23.00 dB / 1.8 min | 0.664 / 24.31 dB / 1.9 min | 0.705 / 25.78 dB / 2.1 min |
消融实验¶
在均匀采样的 DIV2K 数据集上对采样密度 \(S\)、显式几何正则化、基尼剪枝机制以及自适应细分策略进行了全面消融,吞吐量以单 GPU 每分钟完成任务数(TPM, Tasks Per Minute)衡量。
表 3:DIV2K 消融实验结果(不同曲线预算、拓扑模式及架构组件配置)
| 拓扑模式 | 实验配置变体 | 256 曲线 (PSNR / TPM) | 512 曲线 (PSNR / TPM) | 1024 曲线 (PSNR / TPM) | 核心表现说明 |
|---|---|---|---|---|---|
| 开放模式 (Open) | 基准默认 (\(S=24\)) | 23.07 dB / 0.861 | 24.43 dB / 0.883 | 25.93 dB / 0.873 | 质量与吞吐量综合平衡最优 |
| + 显式几何正则化 | 22.60 dB / 0.894 | 23.89 dB / 0.938 | 25.28 dB / 0.917 | 限制非凸图元表达力,PSNR 显著下降 0.65 dB | |
| - 移除基尼剪枝 | 22.38 dB / 0.971 | 23.56 dB / 0.982 | 24.83 dB / 0.952 | 大预算下严重积压冗余遮挡图元,暴跌 1.10 dB | |
| 密度增加至 \(S=32\) | 23.06 dB / 0.859 | 24.42 dB / 0.868 | 25.94 dB / 0.830 | 呈现解等变性,过量采样无质量增益 | |
| 粗糙采样 \(S=8\) | 22.43 dB / 0.753 | 23.64 dB / 0.775 | 24.97 dB / 0.832 | 几何前向偏差过大,超出良态松弛阈值 | |
| de Casteljau 自适应细分 | 23.01 dB / 0.645 | 24.37 dB / 0.631 | 25.87 dB / 0.633 | 动态裂解导致计算图破裂与梯度震荡,耗时显著攀升 | |
| 闭合模式 (Closed) | 基准默认 (\(S=12\)) | 22.99 dB / 0.879 | 24.32 dB / 0.786 | 25.78 dB / 0.654 | 卷绕数提供高保真内外判定,小密度即达饱和 |
| 细化采样 \(S=24\) | 23.01 dB / 0.572 | 24.33 dB / 0.481 | 25.80 dB / 0.413 | 质量提升仅 0.02 dB,但吞吐量下降超 36% | |
| + 显式几何正则化 | 22.63 dB / 0.650 | 23.95 dB / 0.578 | 25.38 dB / 0.503 | 损害闭合复杂多边形轮廓拟合,跌 0.40 dB | |
| - 移除基尼剪枝 | 22.21 dB / 0.546 | 23.22 dB / 0.456 | 24.21 dB / 0.390 | 图元退化无法回收,大预算下性能崩溃 (-1.57 dB) | |
| de Casteljau 自适应细分 | 22.97 dB / 0.517 | 24.29 dB / 0.531 | 25.73 dB / 0.481 | 动态图异方差梯度使性能不及静态固定 \(S\) 采样 |
关键发现¶
- 显著的参数效率与代际性能跨越:CubicSplat 展现出极高参数利用率,仅用 256 条闭合曲线(DIV2K 23.00 dB)即可超越传统 SOTA DiffVG 使用 1024 条曲线(22.95 dB)的重建精度,在 1024 条曲线闭合场景下更是领先 Bézier Splatting 高达 2.33 dB,且端到端训练耗时由 8.6 分钟压缩至 2.1 分钟(提速超 4 倍)。
- 解等变性与前向松弛旋钮:实验清晰验证了“解等变性(Solution-Equivariance)”现象。当折线采样段数超过几何保真临界阈值(闭合 \(S=12\)、开放 \(S=24\))后,继续增大采样密度至 \(S=32\) 或 \(S=48\),PSNR 变动幅度不足 0.03 dB,但计算代价成倍攀升。这表明采样密度本质上是“梯度预言机良态性调节旋钮”,而非传统数值逼近中的精度约束。
- 基尼剪枝随图元规模效益倍增:移除基尼系数剪枝在小预算(256 曲线)下导致 PSNR 损失约 0.7 dB,而在大预算(1024 曲线)下损失剧烈放大至 1.1~1.57 dB。表明在稠密图元场景下,利用透射率内在信号修剪遮挡冗余对于压制梯度干涉至关重要。
- 极端跨尺度渲染与超大规模图元扩展:在放大至 24K 分辨率(144 倍像素量)的极端跨尺度渲染中,CubicSplat 的重投影 PSNR 波动严格控制在 0.5 dB 以内,完全克服了点采样高斯泼溅的高频相位失真;在复杂插画矢量化中,图元规模平稳扩展至 32,768(32K)个,PSNR 达到 38.09 dB,显存仅占用 2,118 MB,验证了瓦片并行与静态计算图的高扩展性。
亮点与洞察¶
- 重构可微栅格化的设计哲学:跳出“前向力求高保真”的传统执念,明确指出前向渲染器是反向优化的“梯度预言机”。以 \(\mathcal{O}(S^{-2})\) 的可控几何松弛消除非线性求根与动态分支,换取了完全静态的良态计算图。
- 透射率副产物的精妙复用:将 Alpha 混合前向过程计算出的瞬态透射率转化为图元贡献度与基尼分布,完全抛弃了人为设定的曲率、自交或凸性惩罚,实现了由渲染系统自身驱动的高效容量调度。
- 可泛化的可微物理模拟启示:这种“前向放松以稳定反向曲率、约束误差以保障全局收敛”的设计范式,对神经辐射场、可微碰撞检测及隐式曲面重构等深陷反向奇异值泥潭的研究方向具备极佳的借鉴意义。
局限与展望¶
- 低预算开放笔触下的感知微纹理偏好:在低曲线预算下,尽管 CubicSplat 获得了更高的 PSNR/SSIM 和更干净的几何边缘,但在 LPIPS 指标上略输于 Bézier Splatting。这是由于离散高斯散点在低频逼近不足时产生的随机高频噪点碰巧迎合了自然图像纹理统计,而严格的分段光滑矢量对自然微纹理表达略显刻板。
- 静态折线段数超参的全局一致性假设:目前全图所有贝塞尔图元共享固定的折线采样段数 \(S\),对于尺度差异极大、长短悬殊的图元混合场景,可能在超长曲线上采样稍显稀疏而在微小笔触上略有算力富余。
- 未来方向:作者指出 CubicSplat 的高速静态图特性非常适合与文本到矢量扩散模型(如 VectorFusion/DiffSketcher)或大模型先验结合,实现毫秒级交互式矢量设计以及长视频时空连续矢量化。
相关工作与启发¶
- vs DiffVG (ACM TOG 2020):DiffVG 采用分析型前向光栅化并在反向时微分贝塞尔迭代最近点求解器,导致在复杂几何下梯度病态且速度极其缓慢;CubicSplat 采用均匀折线代理将几何查询闭式化,单步训练提速达 27~124 倍,且彻底根除梯度爆炸。
- vs Bézier Splatting (arXiv 2025):Bézier Splatting 将曲线离散为点采样高斯泼溅,在闭合填充时需撒布数百万个高斯图元导致开销激增,且高斯叠加无法与空间尺度缩放交换、跨分辨率放大失真;CubicSplat 基于纯矢量多边形与符号残差,闭合填充提速 2~4 倍且跨尺度渲染放大至 24K 依然保真。
- vs LIVE / LIVSS (CVPR 2022 / 2025):层级式贪心矢量化方法需要耗费数小时逐层初始化并容易收敛至局部极值;CubicSplat 支持全图元端到端全局并行联合优化,DIV2K 单图优化仅需约 2 分钟。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐(深刻指出 DVG 中的“梯度跷跷板”本质,提出误差有界的均匀折线松弛与梯度预言机设计理论,极具洞察力)
- 实验充分度: ⭐⭐⭐⭐⭐(涵盖大尺度高分辨率 DIV2K/Kodak、24K 分辨率放大、32K 图元极限扩展、完备单步/吞吐量及消融指标)
- 写作质量: ⭐⭐⭐⭐⭐(逻辑严密自洽,从数学分析、计算图状态到经验实验一气呵成,图表规范精准)
- 价值: ⭐⭐⭐⭐⭐(大幅提升 DVG 运行效率与闭合图元表现,代码开源,对矢量生成和可微图形学基础设施具有重大推动作用)