Text-based Tactile Graphics Generation for the Visually Impaired¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://ruihangao.github.io/Text2TactileGraphics/
领域: 图像生成
关键词: 触觉图像、触觉纹理合成、盲文生成、3D打印制造、可穿戴辅助技术
一句话总结¶
本文提出了首个从自然语言直接端到端合成符合物理制造约束的 2.5D 触觉浮雕生成系统,联合优化全局底板基底几何、高频可平铺法线纹理与合规盲文标注,彻底打通触觉感知与 3D 打印制造。
研究背景与动机¶
触觉图形(Tactile Graphics)是通过凸起线条、表面浮雕纹理与盲文标注编码视觉和空间信息的关键物理媒介,全球超过 2.9 亿盲人与低视力(Blind and Low-Vision, BLV)人群在日常学习、地图导航、教育图表和博物馆导览中重度依赖此类触觉媒介感知复杂形状与材质。然而,长期以来触觉图形的制造高度依赖专家手工设计与微胶囊发泡纸(swell paper)、热成型压印等繁琐工序,不仅生产成本高昂、制作周期漫长,而且缺乏可定制性与规模化复用能力,现有触觉资源几乎完全受限于少数标准化基础教具。
尽管现代扩散模型在文本到图像、文本到视频和文本到 3D 领域实现了令人惊叹的视觉逼真度,但现有生成管线本质上是“以屏幕视觉观看为中心”(screen-based viewing)优化的,完全脱离了触觉物理交互。现存三维生成模型若直接用于触觉浮雕制造会遭遇根本性失败:模型仅关注宏观物体几何轮廓,无法生成手部触觉可分辨的微米/毫米级高频材质纹理;直接生成的网格往往存在非流形(non-manifold)、结构脆弱离散、缺失封闭底座等制造缺陷;同时,单目深度估计或全局三维网格生成模型无法满足触觉对比度、结构简化和盲文严苛的次毫米级平整度公差要求。
面对触觉三维配对数据稀缺、表达形式失配与物理制造严苛约束的三重鸿沟,本文的核心切入点是将触觉浮雕解耦为底座宏观几何、高频触觉纹理与合规语义盲文三个协同互补的物理层级。核心 idea:通过模板引导的浮雕生成构建稳定支撑底座,结合高频可平铺法线扩散模型生成触觉纹理,辅以刚性基底平整化算法与标准盲文集成,端到端合成完全满足 SLA 光固化 3D 打印制造公差的 2.5D 触觉交互图形。
方法详解¶
整体框架¶
本文系统包含四个紧密协作的制造感知流水线阶段:输入自然语言提示词后,首先通过基底模板约束在图像编辑模型中生成带有平整边缘的 2.5D 浮雕投影图像,并通过单目几何估计将其提升为基础浮雕网格;与此同时,专用的触觉纹理扩散模型从文本或触觉传感器测量中生成高分辨率法线贴图,经过频域高通滤波与块内/块间扩散去噪转换为无缝可平铺法线;随后,通过 SAM3 分割出的目标部件掩码,将法线贴图积分并作为法向置换场位移到基础几何表面;最后,对底板顶点执行严格的水平刚性投影以消除全局倾斜,并在平整净空区依据国际盲文标准排布语义点字,输出直接送往 Formlabs Form 4 SLA 光固化 3D 打印机的封闭流形网格。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["文本提示词输入<br/>物体描述与表面材质"] --> B["模板引导基底几何生成<br/>模板约束生成与单目几何提升"]
A --> C["触觉纹理合成与平铺<br/>专用纹理微调与块内扩散缝合"]
B --> D["部件级位移贴图融合<br/>SAM3 语义掩码引导法向置换"]
C --> D
D --> E["制造感知基底平整化与盲文排布<br/>刚性零倾斜投影与标准盲文集成"]
E --> F["SLA 3D 打印物理触觉浮雕成品"]
关键设计¶
1. 模板引导基底几何生成:消除单目深度提升中的尺度歧义与全局倾斜 常规文生图模型生成的三维实体漂浮在虚空背景中,直接做深度提升会导致支撑面深度漂移,无法满足桌面平稳触觉触摸的要求。作者将文生几何任务重新形式化为基于固定大理石底板模板 \(I_{\mathrm{bp}}\) 的上下文图文编辑任务(基于 Qwen-Image-Edit),强制生成的物体坐落于水平平面基底之上。得到生成的浮雕图像 \(I \in \mathbb{R}^{H \times W \times 3}\) 后,利用先进单目几何估计模型 MoGE v2 提取公制度量深度图与表面法线,并将深度映射为高于基准板的高度位移。此模板约束将平均板高度牢牢约束在预设标准范围内,底板检测成功率达到 100%,彻底消除了自由生成时基底严重起伏甚至基板缺失的现象。
2. 触觉法线纹理微调与块内扩散平铺:高频触觉细节的无缝延展 通用图像生成模型以物体为中心(例如输入“牛油果皮纹理”通常生成整个牛油果球体而非均匀表面细节),且容易抑制与物体类别冲突的跨域材质(如“海豚身上的牛油果皮”)。作者微调了文生图扩散模型,构建包含真实触觉传感器 GelSight 采集样本与合成高频图的纹理数据集,直接输出高分辨率法线贴图。为将生成的局部法线贴图连续平铺至大面积曲面,作者设计了“中心裁剪 + 频域高通滤波 + 块内点对称重排扩散修补”流水线。先将法线贴图从 \(1024^2\) 裁切至 \(512^2\),并在傅里叶域对各通道执行高通滤波以滤除导致拼接接缝断裂的低频起伏与扭曲: $\(G_{\mathrm{hp}}(u,v) = 1 - \exp\left(-\frac{d(u,v)^2}{2\sigma_f^2}\right)\)$ 随后通过向 \(z\) 通道补充直流常数偏置重构单位法向量: $\(N^{\mathrm{hp}}(p) = \frac{(\mathrm{HP}(N_x),\, \mathrm{HP}(N_y),\, \mathrm{HP}(N_z) + 1)}{\|(\mathrm{HP}(N_x),\, \mathrm{HP}(N_y),\, \mathrm{HP}(N_z) + 1)\|}\)$ 在此基础上,作者将法线贴图划分为四等分象限并沿点对称进行水平与垂直交叉对调(Intra-tile rearrangement),利用 SDEdit 扩散加噪在边界掩码区域进行前向加噪 \(z_{t_0} = (1 - t_0) \cdot E(I_{\mathrm{swap}}) + t_0 \cdot \epsilon\)(设定加噪强度 \(t_0 = 0.9\)),仅需 10 步 Euler 采样即可完成接缝融合,比传统 Tiled Diffusion 加速超过 3 倍且完全避免了宏观语义畸变。
3. 部件级位移贴图融合:精准控制材质与几何解耦 将平铺完成的法线纹理图梯度积分为高度位移场 \(D_{\mathrm{disp}} \in \mathbb{R}^{H_t \times W_t}\)。为将特定纹理准确赋给指定物体部件,系统采用零样本分割大模型 SAM3 解析文本中指代的目标子区域,得到表面顶点掩码,并允许交互式点击微调。对于处于掩码区域内的基础网格顶点 \(v\),沿其局部表面法向 \(n\) 进行位移调制: $\(v' = v + \lambda D_{\mathrm{disp}}(u) n\)$ 其中 \(u\) 为顶点 UV 纹理坐标,\(\lambda\) 为物理振幅控制参数。该设计使得纹理类型、起伏幅度与空间分配完全解耦,用户在调整微观触觉粗糙度时绝不破坏底座的宏观轮廓解剖结构。
4. 制造感知基底平整化与标准盲文集成:保障触觉可读性与物理打印流形 盲文的点字高度与点间距要求极其苛刻,任何亚毫米级的底板微倾斜或起伏都会彻底破坏盲人的摸读识别。由于单目提升网格不可避免存在低频全局翘曲,作者提出基底严格平整化操作:通过网格前景/背景分割定位底板所有顶点集合 \(V_{\mathrm{base}}\),计算其均值高度 \(h_{\mathrm{base}} = \frac{1}{|V_{\mathrm{base}}|} \sum_{v \in V_{\mathrm{base}}} v_z\),直接将所有底座顶点强制投影到水平面 \(v' = (x, y, h_{\mathrm{base}})\)。该操作在拓扑上严格保留网格连通性,消除外周台阶。随后,系统查表将文本转化为符合美标与国际标准的半球状凸起盲文点阵,强制排布在无几何浮雕与纹理的绝对净空平整区,最终自动封闭底部生成可直接送切片的流形水密网格(Watertight Manifold Mesh)。
一个完整示例¶
以生成“一盏台灯,灯罩为浮雕花朵纹理,底座为编织纹理”为例: 1. 模板引导输入文本至 Qwen-Image-Edit,在白色大理石板模板中合成台灯浮雕画面,MoGE v2 提取公制深度并拉伸为 2.5D 台灯白模网格; 2. 文本“embossed flower”送入微调纹理扩散模型,生成 \(1024^2\) 法线贴图,中心裁剪至 \(512^2\) 并高通滤波;四象限点对称对调后经 10 步 SDEdit 接缝修复,形成可平铺花朵法线;同样步骤并行生成平铺编织法线; 3. SAM3 分割出台灯的“灯罩”与“底座”两个独立掩码区域,分别以法向置换公式将两种纹理位移注入网格表面; 4. 识别台灯外部的平整底板顶点,将高度统一投影至均值 \(h_{\mathrm{base}}\),并在底板下方空白区生成对应英文单词的凸起点字; 5. 生成水密网格,在 Formlabs Form 4 SLA 打印机上使用高韧性树脂打印出实体触觉标本。
实验关键数据¶
主实验¶
针对端到端物理 3D 打印模型,作者在宾夕法尼亚无障碍媒体图书馆招募了 15 名受试者(8 名盲人与低视力 BLV 参与者、7 名蒙眼视力健全 BSP 参与者),使用 16 组提示词物理打印的 48 块展板进行双盲真机触觉交互实验(5 分制李克特量表评分),并与 Hunyuan3D 2.1、Naive 变体进行了评测:
| 评估群体 | 评价指标 | 本文方法 (Ours) | Hunyuan3D 2.1 | 朴素基线 (Naive) | 统计显著性检验 |
|---|---|---|---|---|---|
| 盲人/低视力群体 (BLV) | 触觉纹理符合度评分 (1-5) | 3.93 ± 1.32 | 3.62 ± 1.28 | 3.62 ± 1.20 | \(p = 0.006\) (vs Hunyuan), \(d = 0.16\) |
| 蒙眼健全人群 (BSP) | 触觉纹理符合度评分 (1-5) | 3.35 ± 1.39 | 2.97 ± 1.31 | 3.02 ± 1.24 | \(p = 0.008\) (vs Naive), \(d = 0.16\) |
| BLV 物体盲摸识别率 | 无盲文识别准确率 | ~20% | N/A (缺乏底座) | ~20% | 符合人类无触觉锚点认知规律 |
| BLV 物体盲摸识别率 | 带合规盲文识别准确率 | 接近 100% | 0% (无法打印盲文) | 0% (无盲文) | 彻底打通自主语义理解闭环 |
消融实验¶
作者分别在底座几何生成稳定性、法线纹理微调质量以及无缝平铺接缝质量三个关键模块上进行了系统量化消融:
| 实验模块 | 测试配置 | 核心评价指标 1 | 核心评价指标 2 | 耗时 / 异常表现说明 |
|---|---|---|---|---|
| 底座几何稳定性 | QIE-4 (无模板引导) | 文本 CLIP: 34.82 | 板平均高 \(\bar{\mu}\): 0.181, 波动 \(\sigma_{\mathrm{total}}\): 0.131 | 底板高度不稳,局部严重下凹 |
| QIE-4 (带模板引导, Ours) | 文本 CLIP: 36.64 | 板平均高 \(\bar{\mu}\): 0.337, 波动 \(\sigma_{\mathrm{total}}\): 0.122 | 底板平整,检测率 100% | |
| Nano Banana Pro (无模板) | 文本 CLIP: 36.83 | 板平均高 \(\bar{\mu}\): 0.467, 波动 \(\sigma_{\mathrm{total}}\): 0.188 | 50 组样本中 6 组完全丢失底板 | |
| Nano Banana Pro (带模板) | 文本 CLIP: 37.66 | 板平均高 \(\bar{\mu}\): 0.365, 波动 \(\sigma_{\mathrm{total}}\): 0.137 | 底板完全恢复标准厚度 | |
| 纹理微调质量 | Qwen-Image-4step (原始) | Patch 自相似度 LPIPS↓: 0.496 | 高频法线比 HF Ratio↑: 0.305 | 倾向于生成宏观物体,缺乏局部微结构 |
| Ours-4step (纹理微调) | Patch 自相似度 LPIPS↓: 0.412 | 高频法线比 HF Ratio↑: 0.396 | 微观纹理分布均匀,高频触觉细节突出 | |
| 法线无缝平铺 | 直接裁剪 Crop | 边缘不连续性 Border↓: 26.10 | 梯度不连续性 Grad↓: 52.82 | 接缝处存在明显断层与手感台阶 |
| 裁剪 + 高通滤波 HPF | 边缘不连续性 Border↓: 22.84 | 梯度不连续性 Grad↓: 46.53 | 消除低频扭曲,接缝仍可见 | |
| Tiled Diffusion | 边缘不连续性 Border↓: 4.43 | 梯度不连续性 Grad↓: 9.76 | 耗时 10.9s;法线结构畸变严重 | |
| Ours-Intra (块内重排+SDEdit) | 边缘不连续性 Border↓: 1.61 | 梯度不连续性 Grad↓: 3.19 | 耗时仅 3.18s,接缝平滑度全面领先 |
关键发现¶
- 触觉纹理对触觉识别体验起决定性作用:在实体双盲评测中,Ours 相比 Hunyuan3D 和无纹理 Naive 基线取得了显著偏好优势(BLV 评分达 3.93,显著性检验 \(p < 0.01\)),证明盲人用户能够敏锐分辨不同材料表面的微观质感差异(如编织纹、珊瑚孔洞、鳄鱼皮革纹)。
- 盲文是纯触觉认知中不可替代的语义锚点:纯被动触觉摸读对宏观物体外形的盲猜正确率仅为 ~20%,而集成合规盲文后准确率瞬时跃升至接近 100%,证实了多模态触觉图文中文字与浮雕并存的必要性。
- 块内点对称重排大幅超越传统 Tiled Diffusion:在法线平铺任务中,Intra-tile SDEdit 仅耗时 3.18 秒,边缘不连续性(1.61 vs 4.43)和梯度跳跃(3.19 vs 9.76)远优于 Tiled Diffusion,且彻底杜绝了模型在接缝处“脑补乱造物体”的破坏性瑕疵。
亮点与洞察¶
- 将物理制造公差转化为几何先验引导:以往文生 3D 研究盲目追求视觉照片级渲染,本文创新地将 3D 打印水密性、底座水平度公差以及盲文凸点几何标准作为正则与先验,开辟了“制造感知(fabrication-aware)”生成新范式。
- 点对称象限重排 + 快速轻量 SDEdit 的巧思:利用象限对调将缝隙外边界拉拢至图像中央,辅以浅层扩散重构,避免了构建大尺寸 3×3 拼接图的巨大显存与计算开销,是法线贴图无缝处理的极佳工程 trick。
- 软硬件协同设计的人文关怀:紧密结合工业级 SLA 光固化树脂打印机的高分辨率成型特性,让 AI 真正惠及全球视障群体,从软件算法直接落盘为可触碰的物理实体。
局限与展望¶
- 纯被动触觉的形状理解局限:单纯依靠指尖摸读 2.5D 几何外形仍有很大认知负荷,即使有盲文辅助,复杂的空间透视重叠物体仍可能让盲人混淆。
- 样本规模与人群代表性有待扩大:线下真机测试受限于物理打印制作与视障机构招募周期,样本规模为 15 人,后续需跨地域开展更大规模的长期教育跟踪实验。
- 多色与多材质触觉反馈拓展:目前仅支持单材质光固化树脂打印,未来可结合多喷头 3D 打印技术,赋予浮雕表面不同硬度、弹性、摩擦系数与温感的多物理维度触觉呈现。
相关工作与启发¶
- vs Pic2Tac / 传统凸图转译:Pic2Tac 等早期系统仅采用边缘检测或二维凸点图标填充,输出局限于单调粗糙的微胶囊发泡纸(swell paper);本文则实现了丰富生动、连续起伏的 2.5D 高精度浮雕立体打印,材料质感丰富度产生质的飞跃。
- vs Hunyuan3D 2.1 / Trellis 2 等三维扩散模型:三维大模型以屏幕多角度渲染观赏为主,生成的网格不仅缺失支撑基板、厚度不可控,而且经常出现非流形破面、自相交或悬空碎屑无法打印;本文通过模板引导与平整化投影保证 100% 的 3D 打印物理流形良品率。
- vs TactileDreamFusion:前作聚焦于针对已有 3D 模型的逐个材质优化,无法直接从文本自然语言任意生成新材料触觉;本文借助大规模微调扩散模型与平铺算法,支持任意开放域文字提示词的触觉纹理即时合成。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ (首次打通文本到实体 2.5D 制造级触觉浮雕与盲文排布的端到端生成体系)
- 实验充分度: ⭐⭐⭐⭐⭐ (包含精细定量模块消融、高分辨率切片打样与深度的线下视障群体双盲真机人因测试)
- 写作质量: ⭐⭐⭐⭐⭐ (制造约束与算法逻辑阐述紧密,数学符号节制清晰,架构完备自洽)
- 价值: ⭐⭐⭐⭐⭐ (极大降低无障碍辅具制作门槛,为全球 2.9 亿视障群体的艺术与教育平等赋能)