GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 户型图生成, 布局扩散模型, 高斯房间嵌入, 可控编辑, 结构化设计
一句话总结¶
提出高斯房间嵌入(Gaussian Room Embedding, GRE)将房间建模为连续空间高斯分布以指导矢量扩散过程,结合多条件 GuidanceNet 与双注意力 DenoisingNet,在 RPLAN 上实现了 FID 4.36 与 99.21% F1BC-RC 的高质量户型图生成与无损局部交互编辑。
研究背景与动机¶
功能合理且符合空间美学的户型平面图(floor plan)设计是一项高度繁琐的创造性工作。建筑师需要在满足外轮廓几何边界、采光通风、承重墙约束以及复杂设计规范的前提下,在极其庞大的组合空间中反复权衡拓扑邻接与尺度比例。近年来,基于数据驱动的生成模型尝试解决这一难题,但现有方法通常将户型生成退化为栅格图像绘制,或采用离散语义掩码(discrete masks)与有序顶点序列(vertex sequences)进行建模。
这种离散表示存在三大难以调和的矛盾:其一,多边形顶点序列对闭合轮廓的顺逆时针顺序与起始顶点标号极度敏感,微小的坐标扰动极易破坏几何拓扑有效性;其二,在空间可控生成中,现有多边形生成方法往往顾此失彼,难以在满足严苛建筑外轮廓硬约束的同时保持房间功能区划的语义连贯;其三,交互式编辑面临结构扰动扩散的困境——在真实设计场景中修改单间房间(如扩建卧室或平移卫生间)时,结构变化极易向相邻空间雪崩式蔓延,导致全局布局崩溃或未分配缝隙出现。
受到连续概率空间表征与空间可控生成模型的启发,本文认为解决该问题的根本突破口在于重新定义房间几何在生成框架中的表征形式。核心 idea:将每个房间抽象为连续的各向同性二维高斯分布(高斯房间嵌入,GRE)来表征其质心位置与空间范围,以此作为空间先验在扩散动力学中初始化并指导矢量多边形去噪,实现户型自主生成与局部硬约束交互编辑的统一。
方法详解¶
整体框架¶
GRE-Diff 包含三大工作阶段:约束规范化(Constraint Specification)、布局生成(Layout Generation)与双模交互编辑(Dual-Mode Editing)。系统输入包含用户自然语言指令(由大语言模型如 Kimi-K2 解析为房间类型与数量构成的语义结构体)与外轮廓几何边界(64 点均匀采样的轮廓点序列);生成核心由 GuidanceNet 与 DenoisingNet 两大网络构成。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["用户输入<br/>自然语言指令 / 外轮廓草图"] --> Spec["LLM 条件解析<br/>提取房间语义与轮廓点集"]
Spec --> DPEnc["双路径编码器<br/>独立全局语义/多边形与局部轮廓注意力"]
DPEnc --> AR["自回归 Transformer 预测<br/>时序推导各房间高斯参数 (μ_i, σ_i)"]
AR --> Samp["高斯分布初态采样<br/>x_T^i ~ N(μ_i, σ_i^2 I)"]
Samp --> Denoise["双注意力 DenoisingNet<br/>交叉轮廓约束 + 房间间自注意力去噪"]
Denoise --> PolyOut["矢量多边形户型输出<br/>封闭房间几何序列"]
PolyOut -.->|重编码 P_token| Edit["交互编辑操作<br/>Add / Delete / Move / Anchor 硬约束拷贝"]
Edit -.-> DPEnc
关键设计¶
1. 高斯房间嵌入:连续概率化的空间先验表征
针对离散顶点序列对顶点的起始编号与几何扰动极度敏感的问题,本文没有直接对高维离散顶点坐标施加无先验的标准高斯扩散,而是为每个房间引入各向同性高斯嵌入 \(g_i = \mathcal{N}(\mu_i, \sigma_i^2 I)\)。其中均值向量 \(\mu_i \in \mathbb{R}^2\) 代表房间几何质心位置,标量 \(\sigma_i\) 紧凑近似房间粗粒度尺度与空间辐射范围。GRE 并不取代最终的显式闭合多边形 \(x_0^i = [v_1^i, \dots, v_N^i]\),而是作为房间级的连续隐式状态,将扩散初态直接初始化为 \(x_T^i \sim \mathcal{N}(\mu_i, \sigma_i^2 I)\),从而将高维顶点坐标优化锚定在合理的空间分布之内,从根本上消除了有效顶点顺序变化对生成稳定性的负面干扰。
2. GuidanceNet:解耦双路径特征融合与自回归时序推导
为了在融合房间功能语义意图与外轮廓边界几何的同时防止模态冲突,GuidanceNet 将用户输入转化为语义令牌 \(S_{\text{token}}\)、边界采样点令牌 \(B_{\text{token}}\) 以及已有房间多边形令牌 \(P_{\text{token}}\)。双路径编码器对语义和几何多边形分别采用独立全局自注意力机制建模长程语义拓扑,两分支之间完全断开交叉注意力,使功能关系与几何先验在特征融合前独立解耦;边界令牌则通过局部注意力分支聚焦外围轮廓精细对齐。融合后的全局条件通过任务适配器 Adapter 调制(生成阶段屏蔽多边形输入 \(\gamma=0\),编辑阶段启用 \(\gamma=1\))。随后,自回归 Transformer(ARTrans)以 \(\langle\text{SOS}\rangle\) 起始,序列化输出各个房间的高斯参数 \((\mu_i, \sigma_i)\),在生成高斯参数的过程中精准捕捉相邻关系、功能聚类与尺度分配。
3. 双注意力 DenoisingNet 与 Anchor 硬约束编辑机制
DenoisingNet 承担将连续高斯先验解码为封闭多边形矢量的任务。网络内部构建并行双注意力通道:边界编码器提取外墙空间约束,通过交叉注意力注入去噪网络,同时多边形自注意力通道建模不同房间顶点间的相对排布与避让动力学。在交互编辑场景下,GRE-Diff 支持 Add、Delete、Move、Repurpose 和 Anchor 五大算子。针对局部编辑易破坏未修改区域稳定性的问题,模型引入固定索引掩码机制(Anchor):在每轮逆向去噪步后,直接将用户锚定固定的房间多边形顶点原样覆写拷贝回当前状态,仅对新增或调整的活动房间在当前全局上下文与残差边界条件引导下重新采样去噪,实现了编辑区域自适应重构与固定区域拓扑绝对保真的兼顾。
损失函数 / 训练策略¶
模型在 8 张 NVIDIA Quadro GV100 GPU 上训练 300 个 epoch,批大小为每卡 40,使用 AdamW 优化器(初始学习率 \(2 \times 10^{-4}\),配合线性预热与余弦退火策略)。去噪过程根据预定加噪衰减序列 \(\alpha_t\) 进行状态转移: $\(x_{t-1}^i = \frac{1}{\sqrt{\alpha_t}}\left( x_t^i - \frac{1-\alpha_t}{\sqrt{1-\bar{\alpha}_t}}\mathcal{D}(x_t, i, y) \right) + \sigma_t z^i\)$ 其中 \(\mathcal{D}(x_t, i, y)\) 预测以轮廓图像及编辑锚定掩码为条件结构引导 \(y\) 下的去噪残差,驱动顶点收敛至高真实感闭合多边形。
实验关键数据¶
主实验¶
在 RPLAN 数据集(72,709 训练集,8,079 测试集,包含 6 种主流功能房间)上,以 512 组测试样本 5 次运行的均值评估全流程生成质量,对比 7 个代表性 SOTA 方法(Table 1 原文数据):
| 方法 | 边界约束 | 气泡图约束 | 房间类型约束 | FID (↓) | KID (×10⁻³, ↓) | MMD (↓) | 覆盖率 COV (%, ↑) | 边界约束度 BC (%, ↑) | 房间约束度 RC (%, ↑) | F1_BC-RC (%, ↑) | 参数量 (M, ↓) | 推理耗时 (s, ↓) |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Graph2Plan | ✓ | ✓ | ✓ | 4.81 | 1.65 | 0.124 | 94.92 | 100.00 | 83.11 | 90.78 | 8 | 0.41 |
| iPLAN | ✓ | ✗ | ✓ | 12.63 | 12.20 | 0.148 | 75.11 | 47.53 | 85.65 | 60.75 | 46 | 1.61 |
| HouseDiffusion | ✗ | ✓ | ✓ | 6.55 | 2.83 | 0.193 | 76.36 | — | 93.35 | — | 27 | 8.76 |
| WallPLAN | ✓ | ✗ | ✗ | 6.73 | 4.46 | 0.149 | 58.40 | 99.01 | — | — | 106 | 0.72 |
| MaskPLAN | ✓ | ✗ | ✓ | 23.54 | 22.84 | 0.190 | 67.18 | 100.00 | 20.12 | 33.50 | 998 | 2.68 |
| GSDiff | ✓ | ✗ | ✗ | 4.55 | 1.13 | 0.118 | 86.13 | 91.61 | — | — | 137 | 0.67 |
| ChatHouseDiffusion | ✓ | ✓ | ✓ | 5.21 | 1.31 | 0.145 | 83.01 | 99.80 | 53.91 | 70.01 | 82 | 1.15 |
| GRE-Diff (本文) | ✓ | ✗ | ✓ | 4.36 | 0.96 | 0.107 | 96.09 | 98.44 | 100.00 | 99.21 | 60 | 0.91 |
消融实验¶
GuidanceNet 中全局注意力(Global Attention, GA)与局部注意力(Local Attention, LA)的消融分析(Table 3 原文数据):
| GA 配置 | LA 配置 | FID (↓) | KID (×10⁻³, ↓) | MMD (↓) | 覆盖率 COV (%, ↑) | BC (%, ↑) | RC (%, ↑) | F1_BC-RC (%, ↑) |
|---|---|---|---|---|---|---|---|---|
| ✗ | ✓ | 4.57 | 0.87 | 0.153 | 86.52 | 96.67 | 99.80 | 98.21 |
| ✓ | ✗ | 4.49 | 0.82 | 0.145 | 86.71 | 97.07 | 99.41 | 98.23 |
| ✓ (完整模型) | ✓ (完整模型) | 4.36 | 0.96 | 0.107 | 96.09 | 98.44 | 100.00 | 99.21 |
交互式编辑算子性能评估(Table 2 原文数据):
| 方法 | Add 错误率 Tiny-ROE (%, ↓) | Add 准确率 F1 (%, ↑) | Delete 错误率 Tiny-ROE (%, ↓) | Delete 准确率 F1 (%, ↑) | Anchor & Move 错误率 Tiny-ROE (%, ↓) | Anchor & Move 准确率 F1 (%, ↑) |
|---|---|---|---|---|---|---|
| MaskPLAN | 0.00 | 49.47 | 0.00 | 24.09 | 0.00 | 66.05 |
| ChatHouseDiffusion | 68.49 | 68.45 | 10.96 | 58.26 | 4.11 | 73.06 |
| GRE-Diff (本文) | 0.00 | 86.27 | 0.00 | 98.58 | 0.00 | 97.59 |
关键发现¶
- 几何与语义兼顾的绝对优势:GRE-Diff 在不需要显式拓扑气泡图先验的前提下,达成了 100.00% 的房间类型约束满足率(RC)以及 98.44% 的边界外轮廓满足率(BC),综合可控度 F1 达到 99.21%,显著超越此前无需后处理的扩散基线 ChatHouseDiffusion(70.01%)。
- 编辑无错漏与结构保真:在编辑任务中,GRE-Diff 实现了 0.00% 的 Tiny-ROE,且 Anchor & Move 的 F1 达到 97.59%,较 ChatHouseDiffusion 提升 24.53 个百分点,验证了固定房间顶点硬拷贝机制对维护未编辑区域拓扑一致性的关键作用。
- 功能可用性强:在 19,680 个生成样本中,无重叠区域合格率达到 95.56%,通过门连通性图验证的全屋可达率(reachability rate)达到 96.35%。
- 用户研究高度认可:在 58 位计算机专业研究生的盲测对比中,GRE-Diff 生成结果相对真实标注(GT)的胜率达到 60.69%,相对 Graph2Plan 的胜率达到 70.12%。
亮点与洞察¶
- 高斯房间嵌入的中间层表征思想:将房间表示为二维各向同性高斯分布,既保留了房间级质心与连续空间伸展范围的全局信息,又规避了直接对多边形顶点排列顺序敏感的刚性离散难题,设计十分精巧。
- 扩散去噪中的 Anchor 硬拷贝机制:在逆向扩散步骤间隙将固定区域顶点直接无缝拷贝注入,化解了局部微调诱发全图布局几何形变的长期难题,使得局部交互设计极其鲁棒。
- 可迁移至其他结构化布局任务:这种“粗粒度连续概率高斯分布引导 + 细粒度几何多边形去噪”的分层生成范式,能无缝迁移至 3D 室内家具陈设、室外建筑总平面规划乃至芯片宏单元(macro floorplanning)布局生成中。
局限与展望¶
- 作者承认的局限:在极端复杂、高度非曼哈顿(非正交)或斜角突出的异常外轮廓下,模型偶尔会生成顶点密度分布不均、房间形态扭曲或局部功能区错位的低质量布局。
- 自身观察与评估:目前房间高斯嵌入采用的是各向同性方差标量 \(\sigma_i^2 I\),忽略了长条形房间(如长廊、狭长厨房、跑道形阳台)的方向旋转角度与非对称长宽比特征;若拓展为带有旋转角与独立轴长的主动协方差高斯矩阵,表征能力有望进一步增强。
- 未来方向:作者团队计划将该框架推广至更广泛的建筑形式与户型分类中,并拓展为涵盖全屋家具陈设摆放的一体化室内智能设计系统。
相关工作与启发¶
- vs Graph2Plan: Graph2Plan 强依赖显式拓扑气泡图与密集的检索式后处理拼接,若去除其非神经网络后处理,其 FID 会恶化至 20.10,RC 暴跌至 50.19%;GRE-Diff 为原生端到端扩散生成,无需检索库即可直接输出闭合矢量多边形。
- vs HouseDiffusion / ChatHouseDiffusion: 后者直接在多边形顶点坐标上施加无引导扩散,容易出现房间断裂分离、重叠和拓扑混乱;GRE-Diff 引入高斯房间嵌入初始化并贯穿扩散动力学,在保持高多样性的同时大幅提升几何规范性。
- vs MaskPLAN: MaskPLAN 基于图像语义分割掩码生成并搭配重度后处理,参数量高达 998M,生成易发生边界漂移且无法实现精细顶点控制;GRE-Diff 仅需 60M 参数即可在 0.91 秒内快速推导出高质量矢量多边形。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [高斯房间嵌入搭建起粗粒度连续分布与细粒度矢量几何之间的桥梁,架构设计别具匠心]
- 实验充分度: ⭐⭐⭐⭐⭐ [对比 7 大 SOTA,涵盖生成、编辑、消融、下游客观功能性指标与双组盲测用户实验]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑链路清晰,图表绘制工整,方法动机与公式符号克制得当]
- 价值: ⭐⭐⭐⭐⭐ [为建筑计算机辅助设计、虚拟现实场景生成及交互式户型规划提供了端到端高可控的实用范本]