跳转至

ReDesign: Recovering Editable Design Structures from Raster Images via Agentic Decomposition

会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM
关键词: 光栅图像矢量化, 可编辑设计重建, 智能体树状分解, 渐进局部验证, Figma编辑回放基准

一句话总结

将光栅图像还原为可编辑设计文件建模为层次树生长过程,通过 VLM 控制器调度异质多模态工具链,并在每次节点扩展时执行带修剪与重试的局部宽容验证,实现了高保真且支持实时图层级精准编辑的逆向逆渲染。

研究背景与动机

现代数字设计流程中,设计师需要频繁在多平台分发、营销重定向和排版微调之间适配资产。然而在现实工程落地与跨团队交接中,大量历史设计成果往往仅以静态光栅截图或扁平导出图片的形式留存。若要对画面中的特定文本、图元颜色或排版位置进行二次修改,设计师必须从零手动重绘并重新编排矢量与文字层,这一手工重建过程耗时且极易引入视觉漂移。尽管现代扩散模型与图像编辑工具日益强大,但光栅级像素编辑本质上缺乏对图层、字体与几何实体的显式控制,不仅难以执行毫米级精度的排版调整,在多次连续编辑下更会引发全局形变与伪影累积。

实现“光栅图到可编辑设计(Raster-to-Editable Design)”的逆向工程,核心瓶颈在于光栅化过程是一个严重病态的多对一信息投射。平面像素阵列彻底抹除了图层的空间叠放次序(z-order)、对象编组结构(grouping)、字体属性以及矢量轮廓等高阶元数据。现有方法大多致力于攻关孤立的单一子任务,例如光学字符识别(OCR)、图层解耦或闭合轮廓矢量化;当尝试将这些专用模型拼接成端到端流水线时,线性串行的工具调用往往会引发严重的误差级联——早期阶段微小的分割或识别偏差会迅速污染下游环境,且传统智能体仅在末尾输出时进行全图判别,一旦失败只能推倒重来,系统容错率极低。

本文的切入视角在于重新思考专业设计软件(如 Figma、Adobe Illustrator)的底层数据范式:可编辑资产天然以树状图层层次(Layer Hierarchy)组织。如果将重建过程显式约束为树状拓扑的渐进式生长,不仅能将高层语义编组与底层图元解耦,更使每一次决策的验证边界限定在局部的父子节点间。核心 idea:将光栅图像的可编辑逆向重建建模为结构化树扩展问题,通过 VLM 规划器自顶向下递归派发多模态工具,并在每次节点扩展时引入兼具接受、剪枝与重试机制的局部宽容验证,在阻断级联错误的同时实现图层级别的并行化高精度重构。

方法详解

整体框架

ReDesign 的整体架构围绕“部分重构树(Partial Reconstruction Tree)”的迭代生长构建。系统以输入光栅图像作为根节点,VLM 控制器负责评估当前活跃叶子节点的外观与谱系上下文,从离散动作空间中选择适宜的专用多模态工具链生成候选子节点;随后由局部宽容验证器对本次分裂的几何与内容完备性进行即时裁决;通过验证的节点继续向下递归分裂,直至所有终端节点均收敛为带有精准矢量路径、文字排版参数或独立放置属性的原子可编辑图层。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["光栅图像输入 (Canvas Root)"] --> B["结构化树状层次分解<br/>VLM 控制器选取活跃节点并基于谱系历史规划动作"]
    B --> C["模块化动作空间与异质工具链<br/>派发文本提取 / 分层解耦 / 连通分支 / 目标分割"]
    C --> D["局部宽容验证与即时分支修复<br/>覆盖完备性与边界约束校验:接受 / 剪枝 / 重试"]
    D -->|未收敛至原子层| B
    D -->|通过校验| E["叶子节点参数化与矢量化<br/>SVG 路径拟合 / 字体属性识别 / 栅格定位"]
    E --> F["可编辑分层设计文件 (JSON / Figma 层次结构)"]

关键设计

1. 结构化树状层次分解:自顶向下拓扑生长与谱系记忆解耦并行

针对传统智能体将复杂图像分解扁平化为线性长序列导致规划难度骤增且执行极慢的瓶颈,ReDesign 严格遵循图层树的自组织逻辑,由粗到细逐步分裂。控制器以当前节点的局部渲染图及其“谱系记忆(Lineal Memory)”作为输入做出决策。谱系记忆仅记录从树根沿路径到达当前节点的祖先决策轨迹(包括历史工具调用、超参数及失败反馈),完全不与平级兄弟节点共享状态。这种局部解耦特性带来了两个决定性优势:其一,状态空间不会随树宽扩展而发生指数级爆炸,且规避了复杂的跨分支并发锁冲突;其二,由于各活跃分支间的扩展决策在拓扑上相互正交,系统可以天然在当前所有前沿叶子节点上启动并行扩展,使得算法的关键执行路径长度直接从总扩展调用数缩减为树的最大深度,极大提升了重构吞吐量。

2. 模块化动作空间与异质工具链:面向多模态设计图元的针对性解耦

真实图形设计由文字排版、矢量几何轮廓、重叠复杂图层及自然照片等高度异质的元素交织而成,单一模型无法兼顾全模态高保真还原。为此,ReDesign 构建了高内聚的离散动作空间,每个动作封装一组针对特定分解场景的原子工具流: - 文本提取(Text Extraction):调用高灵敏度 OCR 工具检测并定位文本实例,随后利用像素级文本分割网络提取文字掩码,并结合扩散 Inpainting 模型对文字剥离后的背景残差区域进行无痕修补,输出独立的纯文本层与平滑残差底图层。 - 多层解耦(Multi-layer Decomposition):针对多层图样交叠的复杂复合区域,引入图层化图像生成/分解模型(如 Qwen-Image-Layered),依据区域视觉复杂度自适应预估层数并分离为多个半透明透明通道(RGBA)图层。 - 连通分支标记(Connected Component Labeling):针对同一图层内空间离散、互不接触的独立小图标或散落图元,直接通过二值连通域算法进行轻量化无损切分,无需调度大模型算力。 - 纠缠目标检测与分割(Detection and Segmentation):面对前景与背景强耦合的复杂物体,利用 VLM 显式推理最顶层主体,结合开集检测器与 Segment Anything Model(SAM)完成高精度轮廓抠图,再经由 Inpainting 重建遮挡区背景,分离出纯净的前景节点与修补后的底层背景节点。 - 矢量化与排版属性终结(Vectorization & Typography Fitting):当节点到达叶子状态时,几何形状图元由 VTracer 拟合为无损 SVG 矢量曲线,文本图元调用字体识别网络估计字族、字号、字重与对齐参数,摄影类图元保留透明栅格与坐标,共同装配为结构化 JSON。

3. 局部宽容验证与即时分支修复:以覆盖与边界双准则切断级联崩溃

工具输出不可避免存在瑕疵(如 Inpainting 产生幻觉伪影、分割边缘残缺或重复抽取),线性串行系统只能在全流程结束时做终端判别,导致“一步错、步步错、全盘推倒”。ReDesign 的核心洞察在于树状扩展将每个动作的责任边界限定在“将父区域恰好分解为一组能够完全解释它的子区域”。因此,系统在每次父子分裂后立即执行轻量化的局部宽容验证(Graceful Verification),依托两个确定性物理准则判定有效性: 1. 覆盖完备性约束:检查所有生成候选子节点的像素并集是否完整覆盖了父节点的有效视觉内容,防止产生无法解释的黑洞或信息丢失; 2. 空间边界完备性约束:检查任一子节点的有效扩展是否超出了父节点限定的边界范围,以拦截 Inpainting 或生成模块无中生有的幻觉伪影以及兄弟节点间的冗余重叠。

验证器对扩展结果产生三类显式反馈:若完全合规则予以接受(Accept);若仅局部出现多余幻觉或重复碎片则予以剪枝(Prune)并保留有效分支;若整体质量不达标则触发重试(Retry),并将具体的失败诊断指标写入该节点的谱系记忆中,驱动控制器在下一轮选用备选工具组合或调整超参数。这种即时闭环将错误阻断在产生瞬间,避免了深层脏数据污染与全局回滚的高昂计算开销。

一个完整示例

以一张典型的电商促销海报为例: 1. Root 级扩展:整幅画布输入,控制器依据谱系上下文判定全图存在大号促销标题,派发 Extract Text。OCR 与分割提取出 "75+ Free illustrations" 及其文本区域,Inpainting 修补底图背景。局部验证器比对父子覆盖与边界,判定文本与残差底图有效,产生文本节点 \(N_1\) 与背景节点 \(N_2\)。 2. 并行分支展开: - 对文本节点 \(N_1\),控制器判定其已达原子状态,派发字体识别工具提取字体(Gilroy)、字重与绝对坐标 [10, 20, 80, 120],转换为可编辑文本层。 - 对背景节点 \(N_2\),控制器检测到底图包含多层矢量几何插图与纯色背景,派发 Multi-layer Decomposition。 3. 容错与剪枝:多层分解输出了绿色僵尸手臂、破碎断臂变体以及一本魔法书。局部验证器检测到“破碎断臂”与“完整僵尸手臂”存在严重的重叠冲突与冗余,立即触发 Prune 剔除无效残次图元,仅 Accept 完整僵尸手臂与魔法书图层。 4. 终结收敛:各矢量图层随后经由 VTracer 转换为清晰平滑的 SVG path 与填充色属性(如 #060016#F2F2F2),所有节点汇总装配为具备完整 z-index 排序的 Figma 树状文档。

实验关键数据

主实验

为了客观衡量逆渲染产物的“真正可编辑性”,论文构建了基于 909 个真实 Figma 文件的 Figma Edit Replay Benchmark,设计了 14,796 条可控编辑指令(包括位置移动、旋转、删除、重排序、文本修改与重新着色),将相同指令分别重放到真实设计文件与模型重构文件中,通过渲染图像的结构相似性(SSIM)与文字召回率(Text Recall)评估编辑表现;同时在 Figma 基准与经典 Crello 数据集上评测了像素与布局重建精度。

表 1:Figma 数据集上的重构精度对比(对象级、全局级与布局级)

方法 对象级 L1 ↓ 全局 PSNR ↑ 全局 LPIPS ↓ 布局 PQ ↑ 布局 F1 ↑
VTracer 0.0977 20.487 0.1917 24.64 0.309
LayerD 0.0704 16.141 0.3381 30.09 0.350
Qwen-Image-Layered 0.0493 26.192 0.1073 35.37 0.429
Tool Agent (ReAct) 0.0493 13.923 0.3869 45.33 0.527
ReDesign (本文) 0.0431 26.286 0.0883 45.37 0.535

表 2:Crello 数据集上的重构精度对比

方法 对象级 L1 ↓ 全局 PSNR ↑ 全局 LPIPS ↓ 布局 PQ ↑ 布局 F1 ↑
VTracer 0.0953 18.805 0.2919 19.55 0.243
LayerD 0.0938 14.452 0.4585 30.98 0.369
Qwen-Image-Layered 0.0506 26.419 0.0985 40.19 0.496
Tool Agent (ReAct) 0.0767 12.011 0.5674 44.16 0.527
ReDesign (本文) 0.0465 23.525 0.1249 49.57 0.587

消融实验

论文围绕局部验证机制的成本/收益权衡以及树状并行扩展加速比进行了细致的对照消融实验。

表 3:验证策略与并行执行机制消融分析

配置 / 机制 运行耗时与加速比 重建 PSNR / 稳定性 核心作用说明
终端集中验证 (Terminal Verification) 基准耗时 (高方差) 较低 PSNR / 工具调用数波动极大 错误在深层爆发导致频繁全局重跑,成本显著升高
局部宽容验证 (Graceful Verification) 耗时显著降低 (低方差) 最高 PSNR / 工具调用极稳定 步级即时阻断伪影并局部修剪,收敛路径最优
线性串行扩展 (Serial Tool Agent) 1.0× (串行基准) - 动作依次执行,耗时随元素数量线性暴增
2 前沿并行扩展 (Parallel frontier = 2) 1.7× 加速 - 谱系记忆无兄弟冲突,平级节点独立派发
4 前沿并行扩展 (Parallel frontier = 4) 2.2× 加速 - 充分利用子树正交性并行处理
全前沿充分并行 (Full Parallel Frontier) 7.1× 加速 - 关键路径耗时直接收敛至树深度,吞吐量极大提升

关键发现

  • 编辑回放维度的断层级优势:在 14,796 次编辑回放测试中,ReDesign 在重排(Reposition)、旋转、删除、重定序、文本编辑和改色所有六类操作上均取得了最高的 SSIM。特别是在重新着色(Recolor)等属性修改上,分层模型(LayerD、Qwen)由于图层未能精准解耦导致编辑时发生严重的色彩渗漏(Bleeding);而在文本修改后的文字识别召回率上,ReDesign 达到约 0.72,相比 Tool Agent(暴跌至 0.30 以下)优势明显,原因在于长串行工具链极易在早期损毁细小文字笔画。
  • 验证前置胜过终端兜底:直觉上为每一步增加检验会增加开销,但实验证明频繁的局部轻量验证反而大幅降低了总推理时间。终端集中检验一旦发现输出不合规,必须全盘推倒重来,带来高昂的重复计算与不可预测的重试方差。
  • 与黑盒生成式图像编辑的本质区别:与 SOTA 光栅级图像编辑工具(如 Nano Banana 2)的对比显示,纯扩散模型在执行微小旋转、指定像素平移时极易破坏非目标区域并扭曲全局纵横比,而 ReDesign 恢复的显式图层结构使得下游编辑具备完全确定性与可控性。

亮点与洞察

  • 树状拓扑作为天然解耦骨架:将图像逆渲染从“指令序列生成”转变为“图层层次树生长”,使状态机拥有了清晰的层级归属,从根本上解决了复杂图形元素间的依赖纠缠。
  • 谱系记忆赋能无锁并行:每个节点仅追踪自根向下的单一祖先链,使同层平级分支具备完全的独立性,将原本单线程排队的复杂智能体系统转化为具备高吞吐量的并发分布式树搜索。
  • 物理约束驱动的自愈反馈:无需庞大的外部判别器网络,仅凭借两项紧致的物理准则(子集并集覆盖与空间边界包络)便能准确识别冗余碎片与幻觉,实现了轻量高效的自我修复。

局限与展望

  • 粒度先验的主观不确定性:设计的可编辑粒度本身具有主观性。例如复杂图标究竟应保留为单个组合图层还是拆解为几百条细微贝塞尔曲线,取决于下游设计师的具体编辑意图。当前系统有时会出现层级拆解粒度与设计师原始心理模型不完全一致的情况(需配合交互式 Prompt 微调)。
  • 极端密集小元素的计算膨胀:对于包含海量细微密集噪点或超长段落小字的排版图,树状扩展的节点数与层深会迅速增加,导致并发调度和 OCR 预处理压力变大。
  • 未来方向:引入更强的人在回路(Human-in-the-loop)交互式粒度指引;结合本地代码执行沙盒直接生成与微调 Figma Plugin 原生脚本。

相关工作与启发

  • vs Qwen-Image-Layered / LayerD (分层图像生成/分解):现有分层方法聚焦于生成有限层数(如 4-8 层)的带透明通道 RGBA 光栅图层,图层内部依然是扁平不可编辑的像素;ReDesign 将分层模型降维纳为其动作空间中的一个子工具,最终输出具备矢量几何、字体和组层级的全结构化设计文件。
  • vs ReAct / 串行 Tool-Using Agents:通用工具智能体采用单路线性轨迹决策,伴随严重的误差累积与终端验证高试错成本;ReDesign 将搜索空间拓扑化为层次树,配合谱系记忆和步级局部宽容验证,实现了高容错率与 7.1 倍并行加速。
  • vs VTracer / 经典矢量化工具:纯算法矢量化工具倾向于将全图强行拟合为数以千计的琐碎多边形路径,完全破坏了文本语义与高层编组;ReDesign 能够自适应识别元素模态,将矢量化精准限制在几何图元叶子节点上。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙将逆向逆渲染与层次树分解相结合,提出谱系记忆与局部宽容验证机制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 提出包含 14,796 条控制编辑的 Figma 回放基准,兼顾像素保真度与实际可编辑性评估。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机严密,问题定义精准,图表与实验剖析深入透彻。
  • 价值: ⭐⭐⭐⭐⭐ 打通了由栅格像素直接生成现代化设计系统(Figma)的工程闭环,对设计自动化极具应用价值。