跳转至

AGE: Agentic Gaussian Editing in 3D Scenarios

会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5221
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/9447.pdf
领域: 多智能体 / 3D 视觉
关键词: 3D 高斯编辑、多智能体协作、空间感知记忆、多轮交互、回溯纠错

一句话总结

AGE 用规划、执行、反思与回溯四个智能体协调已有 3D 编辑工具,通过共享空间记忆支持连续修改与局部重做,在自建编辑基准上取得 0.192 的 CLIP 文本—图像方向相似度,高于 DGE 的 0.133,但尚缺组件消融来分离各项机制的贡献。

研究背景与动机

3D 高斯泼溅(Gaussian Splatting)把场景表示为可显式操作的高斯基元,让局部外观修改、物体插入与几何变换成为可能。 但可修改的表示不等于可交互的编辑系统:GaussianEditor、DGE 等方法通常把一条指令送进预先确定的流程,默认用户已经完整说明目标。 当用户先添加物体、再修正位置、最后改变风格时,每一步不只是新任务,还必须解释此前的对象、坐标和修改意图。 把每轮当成独立请求,容易忘记已经确认的布局,或为了修复一个错误重新破坏其他区域。

问题还在于,二维图像里看起来合理的修改,不一定符合三维空间关系。 “放到挖掘机右边”需要确定参照对象、当前视角以及相对尺度,而“位置不对,缩小一半”又要求找到上一轮具体执行了什么。 仅让语言模型在开头解释指令,并不能让后续工具理解这些状态变化;把所有细节都塞进规划提示,也会混淆高层目标与底层参数。 AGE 因此把研究重点放在多智能体的持续协调上,而不是再训练一个单体高斯编辑网络。

作者将编辑改写为有状态的长期决策过程:每轮接收当前高斯场景、用户指令和历史记忆,输出新的场景与更新后的记忆。 成功不仅是当前画面符合文本,还包括未编辑区域保真,以及连续多轮要求之间的一致性。 核心 idea:把空间约束、历史执行状态和可回退的场景资产放进共享记忆,让规划—执行—反思—回溯闭环决定下一次应改什么、从哪里重做,而不是反复从头运行固定编辑流程。

方法详解

整体框架

输入是已经存在的 3D 高斯场景、当前用户要求,以及可选的参考图像或点击拖拽等辅助信息;输出是可以继续接受下一轮修改的高斯场景。 四个智能体不是四个新训练的神经网络,而是承担不同职责的模型调用与工具编排角色。 贯穿流程的结构化空间记忆保存当前理解与历史资产,感知后规划确定技能序列,技能接口执行具体修改,反思回溯闭环决定接受、重新规划或局部重做。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["高斯场景与用户要求"] --> B["结构化空间记忆"]
    B --> C["感知后规划"]
    C --> D["技能接口执行"]
    D --> E["反思回溯闭环"]
    E -->|接受| F["更新场景与记忆"]
    E -->|重新规划| C
    E -->|局部重做| D
    F -->|下一轮| B

图中的记忆不是先离线建好的固定地图:初始记忆为空,各角色在自己的处理阶段读取、补充或修订它。 同样,反思也不只在用户投诉时启动;系统可以用内部验证提示主动检查编辑是否已经完成。 原文第 3 节的状态更新公式在本地文本抽取中有明显损坏,因此这里以正文和图 2 的流程说明机制,不重构不可核验的等式。

关键设计

1. 结构化空间记忆:把“之前改过什么”变成可查询、可恢复的状态

普通对话历史能记住用户说过“太大了”,却未必能找到被评价的资产版本或原始缩放参数。 AGE 把记忆分为三层:系统空间信息、轮级上下文和全局元数据仓库,分别处理空间约束、意图与步骤关系、实际场景资产。 系统空间信息包含规划器选出的相关视角,以及反思器总结的空间边界、相对尺度和朝向先验;执行器持续查询这些信息,避免每次调用工具都重新猜测坐标关系。 轮级上下文同时保留整轮摘要和逐步执行状态:摘要负责快速定位较早一轮的意图,细粒度日志负责定位这一轮中出错的某个技能。

全局元数据仓库存储各步高斯参数和场景状态的索引链接,并保留可用于检查的图像与日志等资产。 这使“回到添加物体之前”不仅是一句语言指令,还能落实到真实的场景版本,而非让生成模型凭空恢复旧结果。 相较于从头重做,保存中间状态允许系统保留已经正确完成的部分,仅重执行被定位为错误的步骤。 不过正文没有给出完整存储格式、检索算法或回放依赖处理规则,因此不能把这一设计等同于已经形式化验证的事务系统。

2. 感知后规划:先选相关视角,再选择技能而非直接填写工具参数

规划器采用“先感知、后规划”的两阶段方式。 它先对场景进行密集感知,再针对当前指令自适应选择相关视图;实验将保留视图数设为 8。 这样做的目的不是让八张图天然提供完整三维理解,而是减少无关背景干扰,把推理聚焦到被编辑对象及其空间参照物。 随后规划器读取技能库的功能描述,将复杂指令拆成有顺序的原子编辑目标,例如先定位参照物,再插入新对象。

一个重要接口约束是:规划阶段只取技能描述,不读取全部底层参数材料。 它负责决定“需要哪项能力、先后关系是什么”,具体坐标、尺度和生成提示则留给执行器处理。 如果这次规划由失败触发,规划器还会读取记忆中的反思思路,避免再次采用已经被否定的策略。 这里的空间感知主要通过相关视角及整理后的几何信息支撑决策,不能理解为模型已经直接学习了完整的原生 3D 高斯几何表示。

3. 技能接口执行:给工具调用同时提供参数约束与纠错知识

执行器逐项读取规划,把原子指令转换为具体技能参数,并在执行前后利用共享空间信息维持对象尺度、朝向和布局的一致性。 技能库连接高层推理与底层工具:例如用 SAM 做分割、FLUX 做资产生成、InstructPix2Pix 做风格迁移;这些工具的已有能力被组合使用,而不是由 AGE 重新实现。 每项技能既有名称与描述,也有参数模式和运行入口,还包含参数提示、少样本示例以及专门提供给回溯器的纠错指导。 这一区分避免“知道调用 Add”却不知道该如何设置坐标,也让纠错不必重新从自然语言推断整个工具接口。

图 3 的 Add 技能展示了这一点:输入涉及生成提示、三维放置位置与统一缩放系数;当位置由参考物确定时,应先定位参考物。 参数指导要求显式给出的坐标或尺度被准确提取,而不是随意重新估计;面向回溯的说明则解释高度对应的坐标轴,以及修改尺寸时如何保留未被用户要求改变的位置。 因此,技能定义不仅描述“能做什么”,也携带“哪些参数可以怎样修”。 它提高了工具调用的可控性,但能力边界仍由技能库决定:没有合适底层工具的编辑需求,不能仅靠增加反思次数获得保证。

4. 反思回溯闭环:先判断错误层级,再选择重做入口

反思器比较当前场景与用户目标,可以依据用户明确认可或内部多模态检查结束流程。 遇到负反馈时,它先判断错误属于整体策略还是某个执行步骤:前者交给规划器重排方案,后者交给回溯器选择重做位置。 回溯器再结合历史步骤和技能纠错指导,产生具体参数修正,并把这些提示写回记忆,供下一次执行使用。 这种分工避免将“方向判断错了”和“目标对了但位置参数错了”都处理为同一种全局重试。

回溯的价值也不是允许无限试错,而是尽量缩小修复范围。 例如新物体大小不合适时,系统应利用原有位置和历史调用状态,调整有关参数而不擅自改变已被用户接受的布局。 论文展示了这类局部纠错与多轮协作案例,但没有报告最大循环次数、终止失败率或不同回溯策略的量化比较。 因此“最优重入点”应理解为回溯器的决策目标,不是有数学最优性保证的搜索算法。

一个完整示例

图 6 给出一个连续编辑过程,说明四个角色如何利用同一份状态,而不是四次彼此独立的生成。 第一轮要求把苹果放到挖掘机右侧,规划器先安排 Locate,再安排 Add,执行器据此定位并插入资产。 第二轮用户指出左右放反,而且苹果过大,要求缩小到原来的一半。 反思器将其识别为空间理解与参数修正问题,回溯器利用已有执行状态调整添加位置及尺度,而不是重新定位整个场景。 第三轮要求在挖掘机左侧添加盆景并转为梵高风格,规划器继承此前校准的空间约束,再组合对象插入与风格编辑。 第四轮改要野兽派风格,最后用户确认完成;这里展示的是论文中的定性轨迹,不是每轮成功率统计。

损失函数 / 训练策略

论文没有提出联合训练四个智能体的新损失,也没有给出端到端训练实验;核心改动发生在推理时编排、状态管理和技能调用层。 第 4.1 节指定 Qwen3-VL-30B 承担规划与反思,DeepSeek-R1-32B 承担执行与回溯,使用 vLLM 部署,生成温度为 0.02。 编排采用 LangGraph,执行阶段在单张 NVIDIA A100 上完成;正文未给出完整交互耗时、峰值显存或每项任务的工具调用预算。 上述模型名称按论文记录,并不意味着本笔记另外验证了其具体发行版本。

实验关键数据

主实验

作者自建 57 个编辑场景:常规指令 20 个、复杂或模糊指令 20 个、多模态辅助输入 10 个、多轮交互 7 个(第 4.1 节)。 论文未在主表中拆分这些子集,也未说明表内汇总是否对各子集采用不同权重,因此不能把总表结果当作多轮子集单独的成绩。 以下选录表 1 的语义编辑与美学指标,均为越高越好;这是自建基准上的系统比较,并非等工具、等计算预算的组件实验。

方法 CLIP 方向相似度 Csim ↑ 图像美学 IAA ↑
GaussianEditor 0.104 4.51
DGE 0.133 5.79
AGE 0.192 6.65

Csim 衡量文本编辑方向与图像编辑方向的对齐程度;IAA 是引用现有美学评估方法得到的图像质量分数,不等同于下面的模型裁判评分。 表 1 还报告 CLIP 方向一致性 Ccon:AGE 为 0.907,DGE 为 0.892,用来补充观察多视图编辑的一致性。 这些继承指标的精确计算细节应查对应原始方法,AGE 主文没有重新展开公式。

消融实验

可用主文没有报告移除记忆、反思、回溯或空间感知的消融表,不能据此断言哪一组件贡献最大。 下表改为真实的补充评估分析:选录表 2 的结构保持与指令完成两个维度,裁判为 Gemini 3.1 Pro,输入是编辑后的多视图渲染,评分范围 1–10,越高越好。 结构一致性关注未编辑区域是否保持,完成程度关注用户编辑要求落实到什么程度;两者与前表的 CLIP 指标不是同一量纲。

方法 未编辑区域结构一致性 ↑ 指令完成程度 ↑
GaussianEditor 5.24 5.70
DGE 7.39 5.23
AGE 8.90 7.17

这张表与表 1 同属作者的总体比较,正文同样没有给出子集级汇总、重复试验误差或裁判与人工评分的一致性验证。 它补充了 CLIP 对局部结构与复杂要求不够敏感的问题,但模型裁判评分不是客观几何误差,也不能替代真实用户实验。

关键发现

  • AGE 相对 DGE 的 Csim 提高 0.059,IAA 提高 0.86,说明系统层面的指令对齐与视觉质量同时改善,而非只提升一种评价。
  • 表 2 中 DGE 的结构一致性高于 GaussianEditor,但指令完成程度反而更低,说明背景保真与完成编辑不能互相替代。
  • AGE 的指令完成程度为 7.17,并非所有复杂要求都被充分执行;第 4.3 节将低层工具能力列为主要瓶颈。
  • 当前证据支持完整系统优于所选基线,不支持把增益单独归因于记忆、四角色分工或更多重试。

亮点与洞察

  • 把历史变成资产而不是纯文本:轮级摘要帮助定位意图,逐步状态与资产索引落实实际回退。这比仅把旧对话拼进提示更贴近可编辑场景的恢复需求。
  • 技能接口内置修复知识:同一技能既暴露调用参数,也说明失败后如何调整。这样高层语言反馈更容易落到具体的空间参数,而不是再生成一次相似结果。
  • 区分重新规划与局部重做:两者对应不同错误来源。对于连续创作,保留已正确完成的部分可能比每次生成一个新版本更重要。

局限与展望

  • 作者指出的执行瓶颈:回溯器可能给出正确建议,但生成工具仍无法产生完全符合要求的高斯资产;提高规划能力并不自动提高底层编辑精度。
  • 作者提出的后续方向:改进专门的 3D 技能,并探索部分微调智能体,使其更直接理解高斯几何,而不只依靠二维视觉代理。
  • 阅读判断:因果证据不足:缺少组件消融与等预算比较,无法区分更强工具、更多推理机会和状态管理的各自贡献。
  • 阅读判断:长期能力尚未充分量化:基准仅含 7 个多轮场景,正文没有逐轮退化、回退成功率或长序列成本统计。
  • 材料边界:本地缓存包含完整 19 页主文与参考文献,但没有第 4.1 节提到的附录;具体场景清单、补充设置无法核验,损坏的状态方程也未在此补写。

相关工作与启发

  • vs GaussianEditor:本文表中对比的是 Chen 等人的 Swift and Controllable 3D Editing with Gaussian Splatting(参考文献 7),不是另一篇同名的 GaussianEditor。AGE 的区别集中在持续交互、共享状态与闭环纠错,而非单一编辑算子。
  • vs DGE:DGE 以一致的多视图编辑实现直接高斯编辑;AGE 在工具层之上管理多步骤计划和修复,因此两者不是同一层级的模块替换。
  • vs Vinedresser3D:AGE 将其作为已有智能体式 3D 编辑的相关工作,强调进一步引入记忆和反馈闭环,但主文未提供二者定量比较,不能据此宣称全面领先。

评分

  • 新颖性: 3/5 — 空间记忆、技能修复接口与回溯的组合有针对性,但多数构件来自既有智能体与编辑工具体系。
  • 实验充分度: 2/5 — 有两类量化评价及交互案例,但缺消融、预算控制、人工验证和子集统计。
  • 写作质量: 3/5 — 角色分工与记忆结构明确,关键实现细节和停止策略仍不充分。
  • 价值: 4/5 — 对需要保留历史状态的交互式 3D 编辑有实用启发,落地效果仍受工具精度与调用成本制约。