Bridging Online and Offline Handwriting via Differentiable Physical Rendering¶
会议: ECCV 2026
论文: ECCV 原文
项目: https://seonmip.github.io/onoff/
领域: 图像生成
关键词: 手写文字生成 / 可微渲染 / 物理笔刷模型 / 在线与离线手写统一 / 机器人书法
一句话总结¶
本文提出了一种六参数紧凑物理笔刷模型与解析可微渲染器,首次打通在线运动轨迹与离线像素外观域,实现了端到端双模态生成以及真实机械臂零样本书法书写。
研究背景与动机¶
现实手写文字生成在个性化字体设计、OCR 训练集扩增、书写障碍辅助以及机器人书法等物理具身智能场景中具有重要价值。然而长期以来,该领域被割裂为两大独立范式:在线手写生成致力于预测随时间推移的笔尖时序轨迹坐标与起落笔状态,天然具备运动学动态信息与物理可执行性,却无法表达笔画粗细变化、墨水渗化以及笔触纹理等精细视觉特征;离线手写生成则直接在静态像素空间合成手写图像,能逼真还原风格外观,但完全丢弃了书写笔序与物理动态,导致其无法迁移至物理实体执行。
将在线轨迹与离线图像联合建模在理论与应用上极具前景,但面临两项本质瓶颈:一是缺乏将笔画运动学与像素级笔刷外观建立显式关联的物理模型,导致运动到纹理的映射高度欠约束;二是现实中几乎不存在严格对齐的「时序轨迹-高分辨率离线图像」成对手写数据集,缺乏端到端训练基石。传统图形学笔刷模拟虽具较高真实度,但计算繁重且不可微,无法反向传播梯度。
为化解动力学与像素外观的断层,本文的核心 insight 在于:不必构建复杂的全维度物理流体仿真,而是提炼出对笔迹视觉感知最关键的几何与光学变量,构建一个紧凑且解析可微的投影渲染桥梁。核心 idea:提出轻量化六参数物理笔刷模型与可微渲染器,将在线笔画运动学转化为离线图像,结合视觉风格观测器与零样本扩散增强器,构建同时输出物理执行轨迹与高保真图像的在线-离线统一手写生成框架。
方法详解¶
整体框架¶
本文框架以风格参考图像和目标文本字符串为输入,同时输出可物理执行的时序笔画轨迹、解析渲染图像以及纹理增强的离线图像。整个系统包含四个协同模块:笔刷参数观测器 \(O\) 从参考图像中推断物理笔刷参数;在线笔画生成器 \(G\) 预测多字符词级运动轨迹;可微笔刷渲染器 \(\mathcal{R}\) 将轨迹与物理参数光栅化为笔迹图像;零样本离线图像增强器 \(E\) 借助冻结的预训练扩散模型修补背景纸张纹理与传感器噪声。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入:目标文本字符串 + 风格参考图像"] --> O["1. 风格引导的物理参数观测器<br/>DINOv3 提取风格特征并预测六参数笔刷模型"]
In --> G["2. 词级在线笔画序列生成器<br/>多字符嵌入与跨注意力自回归预测时序轨迹"]
O --> R["3. 紧凑可微物理笔刷渲染器<br/>速度导向压力代理 + 几何足迹软化 + 最大化覆盖合成"]
G --> R
G --> OutTraj["输出:在线物理书写轨迹<br/>(直接用于机械臂笛卡尔运动控制)"]
R --> OutRend["输出:可微渲染笔迹图像"]
OutRend --> E["4. 预渲染引导的零样本扩散增强器<br/>以渲染图为潜空间中间先验添加环境纸张纹理"]
E --> OutOff["输出:高保真离线手写图像"]
关键设计¶
1. 紧凑可微物理笔刷模型与渲染管线:建立运动学到像素外观的解析微分桥梁
针对经典物理笔刷不可微且计算昂贵的问题,本文将复杂的毛刷-纸张力学交互提炼为六个核心参数 \(\theta = \{w_{\mathrm{base}}, k_{\mathrm{spread}}, \rho_{\mathrm{ink}}, \sigma_{\mathrm{sharp}}, p_{\mathrm{min}}, p_{\mathrm{max}}\}\)。由于在线数据集缺乏绝对物理压力,方法利用连续点速度 \(v_t = \|\mathbf{u}_{t+1} - \mathbf{u}_t\|_2\) 与书写压力的反比物理先验,经归一化与指数平滑构建瞬时压力代理 \(p_t\)。在此基础上,笔画有效宽度建模为基底宽度与压力展宽的乘积: $\(w_t = w_{\mathrm{base}} k_{\mathrm{spread}} p_t\)$ 对于每个线段,像素到笔划中心的归一化距离结合轮廓锐度指数 \(\gamma\) 形成足迹核函数 \(K_t(q)\),再由指数墨水转移方程计算不透明度 \(O_t = 1 - \exp(-\rho_{\mathrm{ink}} p_t)\)。全图合成舍弃了容易导致笔画自相交处过度变暗的简单累加混合,转而采用解析可微的逐像素最大值覆盖合成 \(\mathcal{A}(q) = \max_t \alpha_t(q)\),生成平滑连贯且严格保真笔划边界的可微渲染图像 \(I_{\mathrm{rend}} = 1 - \mathcal{A}\)。
2. 词级在线笔画序列生成器:突破单字限制的序列级轨迹建模
现有在线笔画生成模型大多局限于孤立单字符预测,难以应对连笔词汇与整行书写的长程结构依赖。本文对 Transformer 轨迹生成架构进行了序列化扩展,将单字符 content token 替换为任意长度目标文本字符串的字符嵌入序列,并在自回归解码器中额外引入跨注意力层,使得在预测当前笔尖坐标与起落状态时,能够动态感知前后文语义与相邻字形间的连笔过渡规律。模型每一步输出 20 个高斯混合分布分量以及起落笔状态概率,端到端捕获连续书写中的动力学惯性与运笔走势。
3. 风格引导的物理参数观测器与成对数据构建:无监督真实场景下的参数闭环
真实手写通常只有图像而缺少配对的轨迹与笔刷实测值。本文首先利用可微渲染器 \(\mathcal{R}\) 在在线数据集(IAM-OnDB、CASIA)上随机采样笔刷参数 \(\theta\),并叠加包含笔记本、硬纸板、木板等多样化真实背景补丁 \(B\),低成本合成了包含 15.5 万个词级样本的双模态成对数据集 \(\mathcal{D}_{\mathrm{syn}} = \{(T, S, I_{\mathrm{syn}}, \theta)\}\)。基于该监督源,参数观测器 \(O\) 采用 DINOv3 骨干网络提取风格图像特征,并在序列前端拼接可学习风格 Token,经由图内自注意力与跨参考图注意力聚合器,精准解耦局部笔触与全局书写风格,由投影头输出标准化物理笔刷参数 \(\theta\)。
4. 预渲染引导的零样本扩散增强器:保留几何结构的外观逼真度修补
纯粹解析渲染的图像能够精准还原笔画拓扑和笔触物理轮廓,但无法复现真实工业扫描仪噪点、纸张纤维微渗及局部墨水斑驳等高阶真实感分布。本文引入预训练手写扩散模型作为零样本增强器 \(E\),其核心原则是不做微调、不改动网络权重。增强器首先使用 VAE 编码器将可微渲染图编码为潜空间结构先验 \(z_{\mathrm{rend}} = \mathcal{E}(I_{\mathrm{rend}})\),并在中间预设时间步 \(t_0\) 处对 \(z_{\mathrm{rend}}\) 注入高斯噪声作为去噪起点: $\(z_{t_0} = \sqrt{\bar{\alpha}_{t_0}} z_{\mathrm{rend}} + \sqrt{1 - \bar{\alpha}_{t_0}} \epsilon, \quad \epsilon \sim \mathcal{N}(0, \mathbf{I})\)$ 这种非纯噪声起步策略在数学上为扩散反向过程设定了强几何边界约束,既彻底阻止了扩散模型生成字形幻觉或笔画断裂,又利用扩散先验在笔迹边缘与背景上自然补充了微观纸质纹理。
损失函数 / 训练策略¶
在线笔画生成器 \(G\) 采用自回归负对数似然损失与笔尖状态交叉熵损失联合训练: $\(\mathcal{L}_G = -\sum_{t} \log p(\mathbf{u}_t) + \lambda_{\mathrm{pen}} \sum_{t} \mathrm{CE}(\hat{\mathbf{m}}_t, \mathbf{m}_t)\)$ 笔刷参数观测器 \(O\) 则同时接受物理参数空间监督与渲染图像一致性监督: $\(\mathcal{L} = \mathrm{MSE}(\theta, \hat{\theta}) + \mathrm{MSE}(I_{\mathrm{rend}}, \hat{I}_{\mathrm{rend}})\)$ 其中可微渲染器 \(\mathcal{R}\) 使梯度能够直接穿透像素级误差反传至参数观测器。在增强器推理阶段,IAM 与 CVL 数据集针对不同基线分别微调了噪声注入起始步长 \(t_0\)(例如 DiffPen 设为 50,One-DM 设为 200/900),以在结构保真度与纹理丰富度之间取得最佳平衡。
实验关键数据¶
主实验¶
在线生成评估基于 IAM-OnDB 与 CASIA 测试集,采用动态时间规整(DTW)衡量时序轨迹相似度;离线生成评估在 IAM Words 与 CVL Words 基准上开展,对比 FID、BFID、HWD、CER 以及 LPIPS。
| 任务 / 数据集 | 评估指标 | 本文模型 (Ours / One-DM+Ours) | 对比基线 SOTA | 相对表现 |
|---|---|---|---|---|
| 在线轨迹 (Multi-letter) | DTW ↓ | 0.2936 | 0.8155 (SDT) | 轨迹对齐误差下降 64.0% |
| 在线轨迹 (Single-letter) | DTW ↓ | 0.3462 | 0.6056 (SDT) | 轨迹对齐误差下降 42.8% |
| 离线 IAM Words | FID ↓ | 25.89 | 29.00 (One-DM) | 生成图像真实度显著提升 |
| 离线 IAM Words | BFID ↓ | 8.15 | 16.35 (One-DM) | 背景解耦保真度改善 50.2% |
| 离线 IAM Words | HWD ↓ | 1.6442 | 1.8306 (One-DM) | 手写风格距离显著降低 |
| 离线 CVL Words | FID ↓ | 14.45 | 19.45 (One-DM) | 跨数据集泛化真实度优异 |
| 离线 CVL Words | BFID ↓ | 10.47 | 15.18 (One-DM) | 局部背景伪影大幅消除 |
| 离线 CVL Words | HWD ↓ | 1.5264 | 2.1500 (One-DM) | 风格相似度取得 SOTA |
消融实验¶
消融实验重点验证了合成成对数据集上各离线生成器对运动物理规律的建模能力,以及可微物理渲染器直接合成的图像质量:
| 模型配置 / 生成方案 | FID ↓ | BFID ↓ | HWD ↓ | CER ↓ | LPIPS ↓ | 说明 |
|---|---|---|---|---|---|---|
| VATr++ (纯离线基线) | 74.28 | 33.44 | 2.5990 | 0.329 | 0.622 | 无法捕捉运动规律,易产生畸变 |
| DiffPen (扩散基线) | 89.06 | 118.04 | 2.0030 | 0.496 | 0.602 | 纯图像空间生成缺乏字形骨架 |
| One-DM (强扩散基线) | 52.26 | 19.88 | 2.3650 | 0.229 | 0.539 | 识别率高但外观与轨迹脱节 |
| Emuru (自回归基线) | 89.97 | 60.88 | 2.6220 | 6.126 | 0.583 | 序列发散严重,文字可读性差 |
| Our Renderer (纯物理渲染输出) | 11.81 | 11.03 | 1.0833 | 0.361 | 0.001 | 无需扩散模型即达极高结构与感知保真度 |
关键发现¶
- 在线轨迹与可微笔刷几何的显式绑定极大释放了手写生成的泛化性:即便不依赖任何后续扩散增强,本文可微物理渲染器直接输出的图像在成对评测集上即取得了 11.81 的 FID 和 1.0833 的 HWD,显著优于主流黑盒离线生成模型。
- 零样本增强器与可微渲染器构成了完美的互补:在多项主流扩散骨干(DiffPen、One-DM)前级接入预渲染先验后,FID 和 BFID 均获得稳定提升,用户主观偏好排序测试中 One-DM+Ours 平均排名由 3.406 提升至 2.840。
- 在实际 7 轴机械臂(xArm7)物理书写验证中,生成的 2D 轨迹作为平面笛卡尔坐标执行,而压力代理 \(p_t\) 直接线性映射至机械臂垂直高度 \(z\) 控制笔尖下压深度,全程无需任何针对硬件的后处理优化,成功在铅笔、记号笔等多种物理书写工具上复现了人类笔迹。
亮点与洞察¶
- 以可微解析模型代替昂贵流体仿真:用六参数代数模型和基于局部速度反推的压力代理抓住了手写笔划的主要物理特征,兼具梯度回传与毫秒级推理速度。
- 巧借合成数据打通无标注孤岛:利用可微笔刷在在线开源轨迹库上大规模加噪与换底渲染,低成本创造出高质量的双模态成对训练环境,摆脱了人工采集昂贵物理手写板图像的硬性依赖。
- 预渲染中间态先验引导扩散去噪:放弃微调庞大扩散模型的沉重范式,通过把解析渲染图注入潜空间并在非零时间步注入扰动加噪,以纯零样本方式彻底杜绝了扩散模型常见的字形漂移和拼写错误。
局限与展望¶
- 物理笔刷参数尚未与真实物理量标定:当前模型的 \(\theta\) 属于无量纲的渲染空间代理参数,映射至真实机械臂接触力(牛顿或下压毫米级行程)时仍依赖人工试凑与经验映射。
- 词级生成限制了长篇章排版能力:当前网络针对单词级生成做了架构特化,扩展至长篇段落书写时,行间倾斜、页边距约束与整段笔画连续性仍需进一步建模。
相关工作与启发¶
- vs SDT [CVPR 2023]: SDT 采用解耦表征进行在线手写字符生成,但仅支持单字级别且完全不具备图像渲染能力;本文拓展至任意长度词级轨迹生成,并具备双模态渲染能力。
- vs One-DM [ECCV 2024]: One-DM 在离线图像生成上视觉效果优良,但纯图像操作导致缺乏笔画先后顺序与物理拓扑,不可直接控制机器人;本文可提供高精度的可执行物理轨迹,并在接入后使 One-DM 的图像生成质量进一步跃升。
- vs Hairy Brushes [SIGGRAPH 1986] / Chu & Tai [PG 2002]: 经典图形学模型追求毛刷动力学极致仿真但计算不可微;本文成功将其核心参数降维为可求导算子,使现代深度神经网络能够通过梯度学习控制虚拟笔刷。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出首个端到端可微物理笔刷模型,统一在线轨迹与离线手写图像。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖在线轨迹对齐、离线生成客观指标、消融对比以及真实机械臂物理部署。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构异常严谨清晰,物理假设与模型映射推导交代充分。
- 价值: ⭐⭐⭐⭐⭐ 打通数字手写与具身物理书写应用闭环,对机器人书法、数字笔迹编辑及字体工业极具应用前景。