跳转至

MANGO: Unleashing Image Generation Capability of Unified Multimodal Models

会议: ECCV 2026
论文: ECCV 原文
代码: 待确认
领域: 图像生成
关键词: 统一多模态模型、思维链、图像生成、组合生成、Rectified Flow

一句话总结

针对统一多模态模型在复杂组合生成中面临的功能冲突与单次生成瑕疵,MANGO 提出面向功能的 Transformer 分支解耦架构(FoT)以抬高性能下限,并引入涵盖规划-执行-反思-纠错的拟人化绘画思维链(Paint-CoT)及其解耦联合训练范式以拓宽能力上限,在 1.3B 轻量参数下显著超越了更大体量的扩散与统一生成模型。

研究背景与动机

统一多模态模型(Unified Multimodal Models, UMMs)如 GPT-5、Gemini 3 以及各类开源架构,致力于将多模态理解与多模态生成统一在单个模型骨干中。相较于将多个专门专家模型拼凑级联的复杂系统,统一多模态模型在训练扩展、跨模态协同和推理部署上展现出更优雅的潜力。早期工作尝试通过统一的自回归离散视觉 token 完成图文建模,但离散离散化在建模图像和视频等高维连续视觉信号时存在固有信息瓶颈。近期主流的混合生成范式(如 Transfusion、Show-o、JanusFlow)转为将离散自回归文本预测与连续扩散模型/流动匹配(Rectified Flow)相结合。然而,现有模型要么使用单个共享 Transformer 分支处理所有模态,引发模态竞争;要么采用模态导向架构(如 MoT、LlamaFusion),将文本与图像拆分为不同模态分支,却依然让视觉理解和视觉生成挤在同一个共享的视觉分支中。

这种在单一视觉分支中兼顾理解与生成的设定,隐藏着深层的内在功能冲突(Functional Conflicts)。视觉理解任务通过自回归 Next-Token Prediction 优化,迫使视觉表征向高级文本语义空间对齐;而图像生成任务则通过最小化扩散去噪损失(Rectified Flow 速度场匹配)训练,驱动视觉特征精确捕捉像素级的噪声轨迹与高频空间细节。这两个截然相反的表征目标在同一视觉分支中反复拉扯,严重抑制了模型的图像生成质量下限。更为严峻的是,当面对现实场景中常见的复杂组合指令(如多物体共存、精细属性绑定、精确空间方位及复杂拓扑关系)时,现有统一模型在单次生成中普遍暴露出品类混淆、属性错配(如颜色泄漏)、空间倒置和结构残缺等顽疾。现有为图像生成引入思维链(CoT)的尝试,要么退化为理解大模型与扩散模型的双模型级联拼接,破坏了统一性;要么仅引入生成前的布局规划强化学习,无法纠正单次生成必定残留的局部瑕疵。

本文的切入点是:既要从网络架构底层彻底消除视觉理解与生成的内在功能竞争以夯实生成下限,又要借助模型原生的多模态理解能力实现生成后的自主审视与修复以抬升上限。核心 idea:提出面向功能的 Transformer 架构(FoT),解耦语言、语义视觉与生成视觉三路专有分支以根除跨功能干扰;并构建涵盖规划、执行、反思与纠错的拟人化绘画思维链(Paint-CoT)及解耦多任务联合训练范式,实现免全流程多步对齐标注的高精度复杂组合图像生成。

方法详解

整体框架

MANGO 旨在统一多模态架构下全面释放复杂图像生成潜能。输入端,文本通过 Qwen2 分词器(扩展 6 个功能特殊 token)转换为文本嵌入 \(x_{\text{text}}\);图像则由 SD3 的 VAE 编码为连续隐空间特征,经 \(2 \times 2\) patch 展平与线性投影后映射为每个代表 \(16 \times 16\) 像素块的图像 token \(x_{\text{image}}\),该表征在视觉理解与生成中对称复用。在模型骨干中,MANGO 采用面向功能的 Transformer 架构(FoT),包含语言分支、语义视觉分支与生成视觉分支,各分支保持独立的前馈网络与投影权重,并在层内通过共享的全局多模态注意力模块实现跨分支交互与特征对齐。在推理阶段,MANGO 执行完整的拟人化绘画思维链(Paint-CoT),通过“规划-执行-反思-纠错”四个阶段循环完成高质量图像合成。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["用户输入复合提示词与生成指令"] --> B["面向功能的 Transformer 架构 (FoT)<br/>语言分支 + 语义视觉分支 + 生成视觉分支"]
    B --> C["拟人化绘画思维链 (Paint-CoT)<br/>规划与执行 → 反思瑕疵 → 局部纠错"]
    C --> D["多任务解耦联合训练<br/>解耦训练子任务,避免生成错误样本与昂贵标注"]
    D --> E["高保真复合场景无缺陷生成图像"]

关键设计

1. 面向功能的 Transformer 架构 (FoT):分离理解与生成的异构视觉表征

传统模态导向架构虽然区分了文本与图像输入,但迫使单一视觉分支同时承担视觉理解(Next-Token Prediction)与图像生成(Rectified Flow 速度场匹配)两种异构任务,导致梯度竞争与表征妥协。针对这一痛点,FoT 依据功能而非单一模态来划分计算分支:设立语言分支(Linguistic Branch, T)统筹文本理解与自回归生成;设立语义视觉分支(Semantic Visual Branch, C)专精图像特征提取、视觉问答与反思理解;设立生成视觉分支(Generative Visual Branch, N)专职噪声扩散去噪与图像生成。

在具体计算过程中,设输入序列 \(x = x_T \circ x_C \circ x_N\) 分别包含文本 token、干净图像 token 与加噪图像 token,各分支经过独立的层归一化与路由变换后投影至专属的查询、键、值空间: $\(\hat{x}_i = W_i(\text{Router}(\text{LN}(x))), \quad \hat{x}_{q,k,v}^i = W_{Q,K,V}^i(\hat{x}_i), \quad i \in \{T, C, N\}\)$ 投影后的各分支表示沿特征维度拼接,进入共享的多模态注意力层进行信息交互: $\(\hat{x} = \text{Attn}(\hat{x}_q, \hat{x}_k, \hat{x}_v) + x\)$ 随后再由各自独立的 FFN 分支进行非线性映射 \(\hat{x}_i = \text{FFN}_i(\text{Router}(\text{LN}(x)))\)。在注意力机制上,语言 token 遵循单向因果掩码,视觉 token 内部保持双向注意力,不同阶段之间维持全局因果序列以杜绝未来信息泄漏。这种设计既杜绝了视觉理解与生成在隐空间中的相互挤压,又保留了跨分支上下文对齐能力,显著抬高了模型生成能力的下限。

2. 拟人化绘画思维链 (Paint-CoT):规划、执行、反思与纠错四阶闭环

针对单次前向扩散在多物体组合、空间拓扑与精细属性绑定中频发的结构残缺与概念缠绕,MANGO 借鉴人类艺术家的绘画创作流程,将图像生成展开为四个显式推理步骤。首先在规划(Planning)阶段,模型基于用户原始提示词自回归生成一段更加详尽、刻画了材质、光影与背景的稠密描述(Dense Caption),并预测场景内每个关键实体的归一化空间边界框(Layout Boxes, \([x_{\min}, y_{\min}, x_{\max}, y_{\max}]\)),明确不同物体的相对空间分布与拓扑关系。随后进入执行(Acting)阶段,模型结合稠密描述与空间边界框引导生成视觉分支,在限定区域内合成初版图像,有效缓解了物体漏画与空间错位。

然而,仅有前期规划依然无法避免复杂的渲染偶发瑕疵。为此,MANGO 引入后置的反思(Reflection)纠错(Correction)步骤。在反思阶段,语义视觉分支将初版生成图像与用户提示词输入模型,定位画面中存在的四类典型缺陷(结构残缺、实体纠缠、多余冗余、畸变失真),输出表征缺陷置信度与严重程度的瑕疵热力图(Artifact Map)。最后在纠错阶段,模型将瑕疵热力图转化为重绘掩码,结合规划阶段的布局和上下文条件,在生成视觉分支中执行局部 Inpainting 靶向修复,在不破坏正常区域的前提下精细替换缺陷区域,将组合生成的准确率与美学上限推向新高度。

3. 多任务解耦联合训练:拆解子任务以摆脱全流程多步对齐标注依赖

若将 Paint-CoT 组织为端到端的长轨迹思维链训练,需要规模化构建包含“用户提示词 \(\to\) 规划描述 \(\to\) 布局框 \(\to\) 错误初版图 \(\to\) 瑕疵热力图 \(\to\) 正确终版图”的严格对齐多步数据集,这在数据采集上极其昂贵且近乎不可行。更为严重的是,在端到端训练中强制模型在完成规划后先生成一张“包含逼真错误的有瑕疵图像”,在优化目标上与“生成高质量图像”背道而驰,容易引发负向优化。

针对这一困境,MANGO 提出多任务解耦联合训练范式,将全流程拆解为三类共享骨干权重的并行子任务: 1. 规划与执行任务(Planning and Acting Task):在现有图文对基础上,借助前沿 MLLM(如 Qwen2.5-VL)生成详尽描述,结合开放词表检测器(如 Grounding DINO)提取实体边界框,构建 {提示词, 稠密描述, 布局框, 目标图像} 四元组,训练模型根据提示词自回归输出规划并生成图像。 2. 反思任务(Reflection Task):利用现存伪影数据集与人工缺陷标注,训练语义视觉分支在输入 {待检图像, 提示词} 条件下准确输出瑕疵热力图。 3. 纠错任务(Correction Task):采用标准掩码图像修复(Inpainting)范式训练,输入规划上下文、掩码图与未遮挡图像块,指导生成视觉分支重建被遮蔽的目标区域。 该范式充分激活了现有单项监督数据的潜力,避免了端到端思维链的错误拟合问题,以极低的数据构建代价赋予了模型完备的自审自愈能力。

损失函数 / 训练策略

模型在多任务训练中交替优化语言建模损失与连续流去噪损失: - 语言分支及语义视觉分支采用自回归交叉熵损失: $\(\mathcal{L}_{\text{LLM}} = -\mathbb{E}_{z \sim \mathcal{D}} \left[ \sum_{i=1}^N \log P_\omega(z_i \mid z_{<i}, \varepsilon(x)) \right]\)$ - 生成视觉分支采用 Rectified Flow 速度场匹配均方误差损失: $\(\mathcal{L}_{\text{RF}} = \mathbb{E}_{t \in \mathcal{U}(0,1), x, \omega, c} \left[ \| (x - \omega) - v_\omega(x_t, t, c) \|_2^2 \right]\)$ 其中线性插值轨迹为 \(x_t = t x + (1-t)\omega\)\(t \in [0, 1]\)\(\omega \sim \mathcal{N}(0, I)\)

训练采用两阶段方案:首先在海量图文数据上预训练 FoT 骨干以确立基础的 T2I 与 I2T 表征能力;随后开展 Paint-CoT 解耦多任务微调。优化器选用 AdamW(\(\beta_1=0.9, \beta_2=0.999\),权重衰减 0.02),恒定学习率 \(5 \times 10^{-5}\),包含 10,000 步线性预热,依托 DeepSpeed ZeRO-2 框架进行多卡分布式训练。

实验关键数据

主实验

在评估复杂条件组合生成的权威基准 GenEval 与 T2I-CompBench 上,MANGO 展现出超越更大体量模型的优异性能。

表 1:GenEval 基准上的文本到图像生成性能对比

模型类别 模型 参数量 Overall ↑ 单物体 双物体 计数 颜色 位置 属性绑定
文生图扩散模型 SD v1.5 1.0B 0.43 0.97 0.38 0.35 0.76 0.04 0.06
SD v2.1 1.3B 0.50 0.98 0.51 0.44 0.85 0.07 0.17
SD-XL 3.4B 0.55 0.98 0.74 0.39 0.85 0.15 0.23
SD 3 12.7B 0.68 0.98 0.84 0.66 0.74 0.40 0.43
DALL-E 2 4.5B 0.52 0.94 0.66 0.49 0.77 0.10 0.19
DALL-E 3 0.67 0.96 0.87 0.47 0.83 0.43 0.45
IF-XL 10.1B 0.61 0.97 0.74 0.66 0.81 0.13 0.35
统一多模态模型 Chameleon 34B 0.39
Transfusion 7.3B 0.63
LWM 7B 0.47 0.93 0.41 0.46 0.79 0.09 0.15
Janus-Pro 7B 0.80 0.99 0.89 0.59 0.90 0.79 0.66
BAGEL 7B 0.82 0.99 0.94 0.81 0.88 0.64 0.63
GoT (MLLM+Diff) 2.8+3B 0.64 0.99 0.69 0.67 0.85 0.34 0.27
GoT-R1 7B 0.75 0.99 0.94 0.50 0.90 0.46 0.68
Show-o 1.3B 0.53 0.95 0.52 0.49 0.82 0.11 0.28
Janus 1.3B 0.61 0.97 0.68 0.30 0.84 0.46 0.42
JanusFlow 1.3B 0.63 0.97 0.59 0.45 0.83 0.53 0.42
本文方法 MANGO 1.3B 0.77 0.99 0.86 0.71 0.82 0.60 0.64
MANGO-4B 4.2B 0.82 0.99 0.89 0.76 0.87 0.68 0.70

表 2:T2I-CompBench 组合生成基准评估对比

模型类别 模型 参数量 颜色 ↑ 形状 ↑ 纹理 ↑ 空间关系 ↑ 非空间 ↑ 复杂场景 ↑
文生图扩散模型 SD v1.5 1.0B 37.65 35.76 41.56 12.46 30.79 30.80
SD-XL 3.4B 63.69 54.08 56.37 20.32 31.10 40.91
SD 3 12.7B 81.32 58.85 73.34 32.00 31.40 37.71
PixArt-\(\alpha\) 0.6B 68.86 55.82 70.44 20.82 31.79 41.17
DALL-E 2 4.5B 57.50 54.64 63.74 12.83 30.43 36.96
统一多模态模型 Emu 3 7B 75.44 57.06 71.64
Janus-Pro 7B 63.59 35.28 49.36 20.61 30.85 35.59
T2I-R1 7B 81.30 58.52 72.43 33.78 30.90 39.93
GoT-R1 7B 81.39 55.49 73.39 33.06 31.69 39.44
Show-o 1.3B 56.00 41.00 46.00 20.00 30.00 29.00
本文方法 MANGO 1.3B 82.37 59.81 74.21 35.71 34.19 42.78
MANGO-4B 4.2B 86.63 61.92 78.75 40.45 37.41 45.29

消融实验

表 3:Paint-CoT 关键流程在 GenEval 与 T2I-CompBench 上的逐步消融

实验配置 GenEval Overall ↑ GenEval 位置 GenEval 属性绑定 T2I-CompBench Overall ↑ 空间关系 复杂场景 说明
纯 T2I 生成 2 次取优 0.67 0.40 0.47 42.26 13.42 32.72 同等推理计算量基线
Paint-CoT 仅规划与执行 0.73 0.55 0.58 50.62 28.36 39.55 引入描述与布局规划
Paint-CoT 全流程 (含反思纠错) 0.77 0.60 0.64 54.85 35.71 42.78 完整四阶段闭环

表 4:FoT 架构在 MS-COCO 上的预训练表征消融

模型架构变体 CIDEr ↑ FID ↓ 说明
Dense(单分支完全共享参数) 116.2 11.30 传统单干网络,存在模态与功能双重冲突
Modality-Oriented(模态分离设计) 121.1 9.56 区分文本与视觉,但视觉理解与生成混杂
MANGO (FoT 面向功能分离设计) 126.5 7.24 语言/语义视觉/生成视觉三独立分支

关键发现

  • FoT 架构对生成下限的显著提质:在 MS-COCO 的基准消融中,将视觉分支按理解和生成进一步解耦使 FID 从 9.56 显著降低至 7.24,CIDEr 提升至 126.5。这证明消除视觉内部的表征对抗,能让去噪网络专注于拟合噪声流场,大幅夯实了模型的基础生成性能下限。
  • 规划与反思纠错的分工收益:消融显示,引入稠密描述与空间布局规划使得 GenEval Overall 从 0.67 跃升至 0.73,其中位置得分从 0.40 升至 0.55;在此基础上,增加反思热力图定位与局部重绘纠错进一步将 Overall 提升至 0.77,属性绑定从 0.58 提升至 0.64,空间关系在 T2I-CompBench 上进一步大幅提升 7.35 分。这表明反思纠错能有效修复规划执行阶段遗留的高阶细节缺陷。
  • 轻量参数下的超群规模效益:仅 1.3B 参数的 MANGO 在 GenEval(0.77)与 T2I-CompBench(54.85)上,全面超越了 12.7B 的 SD 3(0.68)、7B 的 GoT-R1(0.75)以及同体量的 Show-o(0.53)与 JanusFlow(0.63)。扩展至 4.2B 参数的 MANGO-4B 后,GenEval 达到 0.82,匹敌 7B 的 BAGEL,展现了优越的架构扩展性。
  • 反思纠错轮次收益收敛:附录针对执行多轮反思-纠错的探索显示,执行单轮反思纠错已能解决绝大多数可见瑕疵,进行第二轮纠错带来的指标提升极微(且带来翻倍的推理延迟),单轮闭环是效率与性能的最佳平衡点。

亮点与洞察

  • 功能解耦打破模态分类思维惯性:过去多模态架构大多局限于“文本 vs 图像”的输入模态切分,MANGO 敏锐洞察到“同一模态下的不同任务目标”(自回归文本预测 vs 连续扩散去噪)才是造成特征挤压的元凶。解耦出专有语义与生成视觉分支,在保持跨模态交互的同时消除了梯度层面的负向干扰。
  • 从单向开环走向自审自愈闭环:传统文生图思维链往往局限于文本 prompt 丰富或前置 bounding box 预测,一旦初始采样出现概念混淆或肢体残缺便无能为力。MANGO 将“反思定位-局部重绘”纳入标准链条,真正实现了类似画家的自主审视与局部精修。
  • 任务解耦规避逻辑悖论与标注陷阱:巧妙避开了端到端 CoT 训练需要“先让模型故意画错再修正”的目标冲突,以及高阶对齐数据无法规模化标注的瓶颈。利用通用检测器与 MLLM 构造子任务监督信号,兼顾了工程落地可行性与训练稳定性。

局限与展望

  • 推理延迟与计算开销增加:相比标准单步文生图模型,Paint-CoT 必须经历规划自回归解码、初次扩散采样、反思热力图推理以及局部 Inpainting 去噪四个阶段,推理总延时明显增加,难以直接满足高实时交互场景。
  • 复杂场景规划依赖基座语言理解能力:在极高难度的物理常识推理或反事实场景中,0.5B/1.5B 级别的语言分支可能出现不合常理的空间布局规划,导致后续执行出现先验偏差。
  • 反思机制对微小伪影的敏感度上限:当前反思模型依赖 SD3 VAE 特征与检测标注,对于超细粒度的微小伪影(如人手多指、眼球纹理细节等)的热力图定位仍有漏检可能,未来可结合强化学习奖惩或更高精度的视觉感知表征做进一步强化。

相关工作与启发

  • vs. Janus / JanusFlow: Janus 采用统一视觉编码与分离解码器,JanusFlow 则在单个 Transformer 内利用不同 loss 混合自回归与 Rectified Flow;MANGO 更进一步,在统一骨干内部彻底物理分离了语义视觉与生成视觉两个专属分支,既避免了表征冲突,又通过跨分支注意力保留了协同能力。
  • vs. GoT / GoT-R1: GoT 采用 MLLM 与外部扩散模型拼接的级联系统,缺乏原生单模型统一性;GoT-R1 依赖复杂的强化学习生成前置规划,但仍属单次开环生成。MANGO 在单模型原生统一框架下打通了完整的“规划-绘制-反思-纠错”闭环,以更轻量参数取得了显著更优的组合生成能力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出面向功能解耦的 Transformer 架构以根除视觉理解与生成的内在目标冲突,并构建了首个完整的绘画思维链反思纠错闭环。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 GenEval、T2I-CompBench、WISE 与 MS-COCO 四大基准,对架构分支、思维链各阶段及视觉质量均给出了翔实消融与量化论证。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密自洽,问题归因精准,架构与思维链流程图清晰易读。
  • 价值: ⭐⭐⭐⭐⭐ 为轻量级端到端统一多模态模型的架构设计及生成推理增强树立了极具参考价值的技术范例。