RoomPlanner: Reachability-Aware View Sampling for Text-to-Room 3D Gaussian Splatting¶
会议: ECCV 2026
论文: ECCV 2026 Poster 5856
代码: https://kaitlina-s.github.io/RoomPlanner/
领域: 3D 视觉
关键词: 3D高斯泼溅, 文本到3D场景生成, 布局规划, 可达性感知视角采样, 间隔时间步流匹配采样
一句话总结¶
针对文本驱动室内 3D 场景生成中布局不可行与相机视角采样脱节的痛点,RoomPlanner 提出了分层 LLM 规划与双重空间约束(碰撞与基于 A* 的可达性),并创新性地将可达性地图无缝桥接至 ReachView 相机轨迹采样与多区间时间步流匹配(ITFS)优化中,实现了仅凭简短文本输入在 30 分钟内生成物理合理、支持物体级解耦编辑的高保真 3D 高斯泼溅室内场景。
研究背景与动机¶
从文本直接合成完整的 3D 室内场景是具身智能、游戏、影视与虚拟现实的核心使能技术。然而,从单物体 3D 资产生成拓展到包含多物体与复杂背景的完整室内环境面临极其严峻的几何与布局挑战。现有的文本到 3D 场景生成方案主要分为视觉引导(Visual-guided)与基于规则(Rule-based)两类。视觉引导方法依赖全景图或多视角扩散模型生成中间图像再进行 3D 重建,通常将前景物体与房间背景混为不可分割的连续表征,不仅缺乏物体级别的解耦编辑能力,还极易在几何上产生模糊、漂浮或拉伸畸变;基于规则与早期 LLM 布局方法虽然引入了先验几何规则,但要么极度依赖繁琐的人工模板与专家介入试错,要么受限于检索已有现成 3D 模型库而丧失生成多样新颖物体的灵活性。
更深层的核心矛盾在于:高质量神经渲染(如 3D Gaussian Splatting)对视角采样轨迹有着极其苛刻的要求,但传统布局生成与渲染优化完全脱节。即使一个通过启发式规则生成的室内布局看似无碰撞且语义合理,也常常严重阻碍相机在房间内的自由穿行,使得相机无法顺畅接近目标物体进行多角度细致观察。这种脱节导致关键物体在微分渲染阶段缺少高质量特写视角,严重破坏了多视角观测集合的完整性,进而在优化过程中引发物体粘连、半透明伪影和几何表面崩溃。
本文的切入角度是打破“先孤立规划布局、再事后随机撒点相机”的割裂模式,将“可渲染性”(Renderability)与“物理可达性”(Reachability)作为第一等公民引入布局约束与相机调度中。核心 idea:将 LLM 分层规划生成的无碰撞布局显式融入基于虚拟智能体行走的 A* 可达性约束,构建全室连通的可遍历地图,并直接以此地图联合驱动兼具“全局漫游+物体环绕”的 ReachView 相机轨迹采样与多区间时间步流匹配(ITFS)优化,达成几何合理、可解耦编辑的高效端到端 3D 室内场景合成。
方法详解¶
整体框架¶
RoomPlanner 的整体处理流程分为三大阶段:分层 LLM 智能体规划(Hierarchical LLM Agents Planning)、布局编排规划(Layout Arrangement Planning)以及可微场景优化(Differentiable Scene Optimization)。系统输入仅为极短的自然语言文本提示(如“A bedroom”),输出为包含解耦物体与完整房间架构的高保真 3DGS 场景表征 \(\text{Scene}^\star\)。
整体数据流如下:首先,高层与低层 LLM 规划器将简短输入展开为带有语义标签、材质纹理与真实物理尺度的结构化规格;随后,利用单物体 Text-to-3D 生成器初始化各个物体的点云资产;在布局编排阶段,系统先进行碰撞约束优化避免物体穿模,再通过基于虚拟智能体包围盒的 A* 寻路执行可达性约束检查,淘汰孤立封闭配置;最后,可达性计算所产生的 2D 可遍历地图直接复用于 ReachView 相机轨迹规划,结合多区间时间步流匹配(ITFS)机制,在单一优化阶段内完成粗到细的 3D 高斯泼溅参数蒸馏与解耦重组。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
A["输入简短文本提示<br/>Short Prompt"] --> B["分层 LLM 规划与尺度对齐<br/>Hierarchical LLM Planning"]
B --> C["单物体 3D 资产点云初始化<br/>Point Cloud Assets Init"]
C --> D["双重布局约束规划<br/>Dual Layout Constraints"]
D --> E["ReachView 相机轨迹采样<br/>ReachView Camera Sampling"]
E --> F["区间时间步流匹配优化<br/>Interval Timestep Flow Sampling"]
F --> G["高保真可解耦 3DGS 室内场景<br/>Output 3DGS Scene"]
关键设计¶
1. 分层 LLM 规划与尺度对齐:将模糊语义转化为物理真实的场景规格
直接让大语言模型一步输出全场景坐标通常会导致尺度错乱或物体浮空。RoomPlanner 将语义解析拆分为高层推理与低层物理落地两个智能体。高层规划器(High-level Planner)分析简短输入,推断室内房间类别并选取风格相符的核心家具与装饰清单 \((O_i, S_i)\);低层规划器(Low-level Planner)负责为各资产扩充精细的风格、质感和材质属性描述。随后,系统调用轻量级 Text-to-3D 模型(如 Shap-E)为每个物体生成粗糙点云 \(p_i = (x_i, y_i, z_i, c_i)\) 并估计初始中心坐标 \((x_i^c, y_i^c, z_i^c)\)。更关键的是,物理智能体(Physical Agent)对照现实世界物理常识,严格校验每个物体的三维尺度,一旦发现尺度冲突即刻自适应重缩放,从而形成尺度统一、物理真实的布局准则 \(\varphi_{\text{layout}} = (\hat{O}_i, \hat{S}_i, p_i)\)。
2. 双重布局约束规划:融合碰撞避免与虚拟智能体 A* 可达性校验
在四壁限定的三维封闭空间内,系统采用深度优先搜索启发式编排物体空间位置,按象征性规则先铺设地板、墙体、门窗等结构,再摆放地面家具与上墙装饰。为了保证空间布置的物理有效性,框架先后执行两道硬约束优化。第一道是碰撞约束(Collision Constraint),通过计算物体之间以及物体与墙壁间的 3D 包围盒交并比(\(\text{IoU}_{3D}\))定义惩罚: $\(R_{\text{coll}} = - \sum_{i=1}^{N}\sum_{j \neq i}^{N} \text{IoU}_{3D}(b_i, b_j) - \sum_{i=1}^{N}\sum_{k=1}^{4} \text{IoU}_{3D}(b_i, b_k^{\text{wall}})\)$ 只有在 \(R_{\text{coll}} = 0\) 且满足房间边界内嵌测试时才算通过。第二道则是核心创新的可达性约束(Reachability Constraint)。传统方法常将家具塞满死角或形成封闭孤岛,导致人或视线无法接近。RoomPlanner 设立尺寸为 \(b_{\text{agent}}\) 的虚拟智能体,将三维场景栅格化为二维可行走地图,并在障碍物周围做膨胀安全距离。以房间入口或主锚点家具为起点,向每个物体的邻近接触区执行 A* 最短路径搜索。其可达性奖励定义为: $\(R_{\text{reach}} = \sum_{i=1}^{N} \mathbf{1}\left[\pi_i \neq \emptyset\right]\)$ 其中 \(\pi_i\) 表示通往第 \(i\) 个物体的有效路径。若某物体不可达,系统在局部邻域内微调重采样;若超出迭代预算仍不可达则予以剔除,确保场景不仅零碰撞,而且内部空间完全流通畅达。
3. ReachView 相机轨迹采样:打通物理可行域与渲染观测视角的连贯通路
在先前场景生成框架中,相机视角的选取往往是完全独立于空间布局的事后启发式随机采样,经常产生撞墙、被遮挡或无法聚焦局部物体的坏视角。ReachView 的核心突破在于直接复用布局可达性验证产生的二维可行走地图,在其上规划合法的无碰撞相机位姿,彻底杜绝穿模与视线盲区。ReachView 包含两种紧密协同的运动模式:其一是场景全局漫游(Scene-centric Global Walk),相机从门口锚点出发,按最近邻顺序沿增益感知的 A 路径穿行,提供全景全局上下文与多物体关联;其二是物体近景环绕(Object-centric Orbit)*,在当前目标物体上方半球采样特写仰俯视角,赋予局部精细几何更强的梯度拉力。两者交替形成的混合轨迹(Hybrid Trajectory)完美模拟了“由远及近、拉远拉近”的动态观测节奏,确保场景全局语义与物体局部结构在优化中获得均衡且充分的视觉监督。
4. 区间时间步流匹配优化:视点感知的时间步分配与高效特征蒸馏
为了解决传统单时间步得分蒸馏(SDS)导致的色彩过度饱和与几何发虚问题,RoomPlanner 引入整流流匹配(Rectified Flow Matching)范式,基于 Stable Diffusion 3.5 骨干网络构建流蒸馏采样(FDS)。针对单时间步无法同时兼顾宏观语义与微观几何的缺陷,提出多区间时间步流匹配(Interval Timestep Flow Sampling, ITFS),通过联合聚合多个时间步 \(\{t_i\}_{i=1}^m\) 的梯度进行联合更新: $\(\nabla_\theta \mathcal{L}_{\text{ITFS}}(\theta) = \mathbb{E}_{\{t_i\}, \boldsymbol{\epsilon}} \left[ \sum_{i=1}^{m} w(t_i) \left( v_\phi(x_{t_i}; y, t_i) - (\boldsymbol{\epsilon} - x_0) \right) \times \frac{\partial g(\theta, c)}{\partial \theta} \right]\)$ 更加关键的是,ITFS 与 ReachView 相机模式深度联动:当相机处于特写物体环绕模式时,时间步聚焦在较早的低噪声区间(如 \(t \in [200, 600]\)),优先强化局部微观几何刻画与轮廓收敛;当相机处于宏观全景漫游模式时,时间步自动提升至高噪声区间(如 \(t \in [400, 800]\)),集中协调跨物体的全局语义一致性与空间光影融洽度。该机制将传统场景生成数小时的耗时大幅压低至 20~30 分钟以内。
损失函数 / 训练策略¶
场景可微渲染采用 3D 高斯泼溅(3DGS)作为连续几何与外观表征。优化过程使用预训练的 Stable Diffusion 3.5 Medium 作为 2D 扩散先验指导,并在单个 NVIDIA RTX 4090(24GB)显卡上运行 1500 次渲染迭代,分辨率设定为 \(512 \times 512\)。训练策略严格配合 ITFS 的步长递增与 ReachView 的混合相机轨迹,避免了分阶段两步走所带来的累积误差,一阶段即实现几何平滑收敛与逼真渲染。
实验关键数据¶
主实验¶
论文在卧室、客厅、厨房、餐厅与工作区 5 种典型室内场景下进行了充分的定量对比。主实验包含两部分:一是由 30 位专业室内设计师、具身智能工程师和研究生参与的双盲用户主观评测(1~5 分制,评估物理合理性 Rationality 与视觉质量 Quality);二是基于渲染视角的自动化多模态指标评估,包括美学评分(Aesthetic Score, AS)、人类偏好打分(ImageReward, IR)以及 CLIP 文本图像相似度(CLIP Score, CS%)。
| 方法 (Method) | 合理性 (Rationality ↑) | 视觉质量 (Quality ↑) | 美学评分 (AS ↑) | ImageReward (IR ↑) | CLIP Score (CS % ↑) | 生成耗时 (Time) |
|---|---|---|---|---|---|---|
| Set-the-Scene | 1.13 | 2.80 | 4.83 | 41.10 | 26.05 | ~1.5 h |
| GALA3D | 2.61 | 3.22 | 5.07 | 42.67 | 25.40 | ~3.5 h |
| DreamScene | 3.10 | 3.15 | 5.13 | 43.85 | 26.77 | ~1.0 h |
| RoomPlanner (本文) | 4.10 | 3.86 | 5.31 | 48.83 | 28.44 | ~20 min |
此外,在空间布局物理质量的横向评测中,论文统计了平均碰撞物体对数(Col)、越界溢出物体数(OOB)以及从起始点出发的 A* 可达物体百分比(Reach %):
| 布局方法 (Method) | 碰撞对数 (Col ↓) | 越界物体数 (OOB ↓) | 可达性百分比 (Reach % ↑) |
|---|---|---|---|
| LayoutVLM | 11.09 | 7.53 | 86.2% |
| HOLODECK | 0.00 | 0.87 | 97.3% |
| RoomPlanner (本文) | 0.00 | 0.20 | 100.0% |
消融实验¶
论文针对核心模块 ReachView 轨迹规划与多区间时间步流匹配(ITFS)进行了细致的剥离实验,定性与定量验证各组件在消解过饱和、稳定几何形状及丰富语义细节方面的独立贡献:
| 实验配置 (Config) | 核心渲染机制 | 相机轨迹策略 | 渲染表现与几何质量说明 (Note) |
|---|---|---|---|
| w/o ITFS & w/o ReachView | 单时间步传统 SDS | 常规离散相机采样 | 严重色彩过饱和、过曝,几何表面不连续且缺失细节 |
| ITFS & w/o ReachView | 多区间整流流匹配 (ITFS) | 常规离散相机采样 | 色彩饱和度正常,但由于视角缺失导致物体几何不稳定,门窗与扶手椅边界模糊 |
| Full Model (ITFS & ReachView) | 模式感知多区间 ITFS | A* 可行域 ReachView 混合轨迹 | 最佳状态:几何轮廓锐利稳定,微观纹理与宏观光影融洽,完全消除粘连 |
关键发现¶
- 可达性约束是消除优化粘连的决定性前提:单纯的无碰撞检测(Col=0)并不足以保证渲染质量。若物体间没有留出虚拟智能体能够行走的通道,相机视角无法绕行至物体侧方和背部,梯度反传就会出现视线盲区,导致物体与墙面或相邻物体熔接在一起。引入 A* 可达性校验后,Reach 指标提升至 100%,彻底消除了优化阶段的几何盲点。
- ITFS 视点分流显著优于单时间步 SDS:消融表明,常规 SDS 在 3DGS 优化中极易过拟合到高饱和均值区域;而 ITFS 在近景采用 \([200, 600]\) 早时间步收敛高频几何轮廓,在远景采用 \([400, 800]\) 晚时间步锚定语义一致性,两者的互补使得 ImageReward 飙升至 48.83。
- 计算效率实现近 3~10 倍的飞跃:得益于整流流匹配的高效矢量场拟合与精准的相机采样,模型仅需 1500 轮渲染更新即可达到收敛,在单张 RTX 4090 上耗时从基线的 1~3.5 小时缩减至 20 分钟左右。
亮点与洞察¶
- 布局可达性向渲染视角的降维复用:将机器人导航领域的 2D 可行图(Occupancy Map)和 A* 寻路无缝迁移到 3D 高斯泼溅渲染的相机轨迹生成中,以极小的计算代价彻底解决了 3D 场景生成中相机穿墙和视角遮挡顽疾。
- 视点尺度与扩散时间步的协同配对:提出远景看宏观语义(大时间步)、近景磨微观几何(小时间步)的自适应区间调度机制,打破了以往 3D 蒸馏中全局随机采时间步的盲目性。
- 高自由度物体级解耦与编辑:与将全景图作为一体化连续表征的黑盒方案不同,RoomPlanner 的显式资产点云初始化让整个场景保持严格的物体级解耦,用户在生成后可自由执行单物体的旋转、平移、材质替换、新增或删除,实用性极强。
局限与展望¶
- 显存预算对高斯点密度的制约:当前管线主要在单张 24GB 显存的 RTX 4090 上验证,显存上限严格限制了高斯基元在后期的裂变与增长规模,在非常宽阔的大型复式房间中,对极其微细的局部材质和次级光影反弹的表现力仍有提升空间。
- 动态物理与关节可动资产缺失:目前的资产均为刚性几何体,尚不包含柜门开启、抽屉拉伸等铰接机构(Articulated assets)的物理约束,未来可结合关节模拟器进一步扩充具身交互能力。
相关工作与启发¶
- vs DreamScene (ECCV 2024): DreamScene 虽探索了基于 3DGS 的室内生成,但依赖传统单步模式采样,表面几何粗糙且存在明显的半透明漂浮物(Opacity artifacts),生成耗时约 1 小时;RoomPlanner 引入 A* 可达性相机规划与 ITFS,时间压缩至 20 分钟,渲染真实度与物体规整度全面超越。
- vs HOLODECK (CVPR 2024): HOLODECK 是优秀的基于 LLM 与规则的室内布局生成框架,但其本质是检索预存 3D 模型进行拼接摆放,缺乏根据自由文本生成全新多变资产的能力;RoomPlanner 则实现了“端到端自主资产生成 + 物理与可达性约束 + 可微神经场景渲染”的完整闭环。
- vs Pano2Room (SIGGRAPH Asia 2024): Pano2Room 依赖单张全景图像反推 3D 房间,前景与背景杂糅,无法实现精确的单物体级独立操控;RoomPlanner 坚持显式物体级解耦与点云初始化,保留了完善的下游平移、旋转与样式重置编辑功能。
评分¶
- 新颖性: ⭐⭐⭐⭐ [创新地将 A* 路径可达性与相机轨迹采样深度耦合,提出模式自适应的多区间流匹配 ITFS]
- 实验充分度: ⭐⭐⭐⭐⭐ [涵盖主观用户评测、客观美学与多模态指标、布局几何合规性统计及消融实验,对比充分]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑架构清晰严谨,从动机推导、符号定义到流程实现均具备高度自洽性与说服力]
- 价值: ⭐⭐⭐⭐⭐ [大幅降低了室内 3DGS 场景生成的门槛与渲染等待时间,对具身智能仿真环境与交互编辑具有高应用价值]