FlowInOne: Unifying Multimodal Generation as Image-in, Image-out Flow Matching¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://csu-jpg.github.io/FlowInOne.github.io
领域: 图像生成
关键词: 图像生成、流匹配、以视觉为中心、视觉提示、指令遵循
一句话总结¶
将文本描述、空间布局、几何标记与物理控制等异构指令统一渲染为单动画布,通过单模态图像输入到图像输出的流匹配模型建模连续隐空间输运,实现跨文本生图、精细图像编辑与物理动力学遵循的大一统生成。
研究背景与动机¶
多模态图像生成长期以来处于以文本为主导的范式之下:语言负责编码人类意图,而视觉模型仅仅被动执行条件采样。无论是在主流的潜在扩散模型(LDM)还是 Diffusion Transformer(DiT)中,文本提示通常依赖独立的文本编码器(如 CLIP、Flan-T5)转化为离散语义嵌入,再通过交叉注意力机制注入到图像生成网络。这种异构双塔设计引入了根本性的不对称性——语言可以单向调控视觉,但视觉表征无法在自身空间内直接推理和演进。当任务拓展到图像编辑、局部重绘以及空间几何控制时,传统架构不得不引入额外的控制网络(如 ControlNet)、多分支条件编码器或复杂的任务专用接口,导致特征对齐出现瓶颈,模型结构臃肿且难以统一。
近年来,以视觉为中心的研究逐渐揭示出像素空间本身具备承载符号语义的潜力,将文本直接渲染到图像画布上能够以纯视觉方式完成跨模态理解。然而,现有探索大多局限于视觉感知与离散图文对齐阶段,纯视觉输入在连续生成领域的潜力仍未被充分挖掘。传统扩散模型依赖逐步的高斯加噪与去噪过程,对连续空间变换施加了严格的布朗运动假设,不仅采样效率受限,而且在处理多尺度几何涂鸦、带方向指示的箭头标记以及物理受力动力学等连续演化指令时,极易因高斯噪声的破坏而丢失细粒度的空间拓扑结构。
面对上述困境,流匹配(Flow Matching)提供了一条兼具数学严谨性与采样效率的路径:它摒弃了繁琐的高斯噪声调度,直接在源分布与目标分布之间学习确定性速度场,支持非高斯且同构的端点分布设定。核心 idea:将多模态生成任务全面重构为以视觉为中心的图像输入、图像输出流匹配范式,将文本指令、空间框、指示箭头与涂鸦全部渲染为统一的视觉提示画布,利用单个流匹配网络在共享同构隐空间内学习从指令隐状态到目标图像的确定性连续输运。
方法详解¶
整体框架¶
FlowInOne 彻底剔除了传统生成管线中的独立文本编码器与离散条件分支,构建起端到端的纯视觉连续流匹配流程。整个系统的输入是一张集成了所有生成与控制意图的视觉提示画布 \(I_v\),输出为目标图像 \(I^\star\)。整个架构主要由三个核心阶段组成:统一视觉语义编码与隐变量映射、双路径空间自适应调制的流匹配骨干网络(DiT 变体)、以及基于常微分方程(ODE)求解的连续输运生成。
输入画布 \(I_v\) 首先由预训练的视觉编码器提取 patch 级别的跨模态融合特征序列 \(X_{\text{fuse}}\),并通过轻量级文本-图像变分自编码器(Text-Image VAE)映射为源隐状态 \(z_0 = Z_{TI}\);目标图像 \(I^\star\) 则通过冻结的图像 VAE 编码为同构的目标隐状态 \(z_1 = Z_I\)。在中间的主干网络中,FlowInOne 采用自注意力捕获全局上下文,并通过任务感知门控机制自适应决定是否激活参考图像的结构交叉注意力分支,从而在纯文本生成与结构受控图像编辑之间动态平衡。在推理阶段,模型仅需以输入画布提取的源隐状态为起点,对预测的速度场进行单向数值积分,即可平滑输运出最终的目标图像。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入视觉提示画布 Iv<br/>文本/边框/箭头/涂鸦统一渲染"] --> B["视觉提示输入统一化<br/>SigLIP与Text-Image VAE提取源隐状态 z0"]
B --> C["双路径空间自适应调制<br/>任务指示因子动态切换结构注入与门控权重"]
C --> D["跨模态向单模态同构流匹配<br/>学习从z0到z1的确定性速度场 ODE积分"]
D --> E["目标图像输出 I_hat<br/>冻结图像VAE解码器生成真实图像"]
关键设计¶
1. 视觉提示输入统一化:将异构文本与几何控制统一渲染至图像画布
传统多模态生成管线在处理位置坐标、边界框和编辑指令时,往往需要设计异构的 token 序列或外挂网络,导致空间语义与图像像素出现割裂。FlowInOne 直接将文本描述、目标类别标签、引导箭头、包围框以及草图涂鸦直接渲染绘制在二维画布 \(I_v\) 之上,使所有控制信号天然具备二维空间几何属性。系统利用 Janus-Pro-1B 的视觉编码器(基于 SigLIP Vision Transformer)对画布进行 patch 级特征提取,并通过投影层映射为融合特征序列: $\(X_{\text{fuse}} = \text{MLP}(\text{SigLIP}(I_v)) \in \mathbb{R}^{N \times D}\)$ 随后,设计专门的文本-图像 VAE 将该融合特征参数化为源分布的高斯参数并采样得到源隐状态 \(z_0 \sim \mathcal{N}(\bar{\mu}_{z_0}, \text{diag}(\bar{\sigma}_{z_0}^2)) \in \mathbb{R}^{H \times W \times C}\)。这种设计彻底摆脱了分词器带来的离散化误差与语义断裂,使模型在单一视觉模态内即可同时理解局部编辑意图与全局构图。
2. 跨模态向单模态同构流匹配:确定性速度场驱动的连续隐空间输运
现有扩散模型从纯各向同性高斯噪声出发逐步降噪,破坏了初始输入与生成目标之间的拓扑对应,编辑过程往往需要反向扩散或潜空间对齐 trick。FlowInOne 将生成任务严格定义为非高斯源分布 \(p_0\) 到目标分布 \(p_1\) 的连续输运问题。利用冻结的 LDM 图像编码器将真实目标图像 \(I^\star\) 编码为同构维度的目标隐状态 \(z_1 = \text{Enc}_{\text{img}}(I^\star) \in \mathbb{R}^{H \times W \times C}\),在 \(t \in [0, 1]\) 上构建确定性线性概率路径: $\(z_t = t z_1 + \left(1 - (1 - \sigma_{\min})t\right)z_0\)$ 目标瞬时速度场恒为 \(v_t^\star = z_1 - (1 - \sigma_{\min})z_0\)。通过训练 DiT 网络 \(v_\theta(z_t, t)\) 逼近该速度场,推理阶段转化为标准的常微分方程初值问题 \(\frac{\mathrm{d}z_t}{\mathrm{d}t} = v_\theta(z_t, t)\),从 \(z_0\) 出发单调平滑演化至 \(z_1\)。这种单模态同构映射避免了跨模态对齐损失与复杂的噪声衰减调度,显著提高了优化稳定性和生成轨迹的一致性。
3. 双路径空间自适应调制:解耦生图与编辑的自适应结构补偿
由于视觉编码与变分采样存在固有压缩,源隐状态 \(z_0\) 难以完整保全源图像的超精细纹理流形;若无条件引入源图像先验,又会导致在纯文本生图任务中引入无关结构干扰,或在图像编辑中产生过度保留背景而无法遵循指令的冲突。为此,模型在 Transformer 块中构建了由二值任务指示因子 \(\mathbb{I}_{\text{edit}} \in \{0, 1\}\) 控制的双路径调制机制。对于包含源图像的编辑任务,先用图像 VAE 提取源图隐变量并展平成参考序列 \(\mathbf{S} \in \mathbb{R}^{N \times C}\),以自注意力层更新后的隐状态 \(\tilde{\mathbf{H}}^{(l)}\) 为 Query,计算跨注意力结构增量: $\(\Delta \mathbf{H}_{\text{struct}} = \text{Softmax}\left(\frac{(\tilde{\mathbf{H}}^{(l)}\mathbf{W}_Q)(\mathbf{S}\mathbf{W}_K)^\top}{\sqrt{d_k}}\right)(\mathbf{S}\mathbf{W}_V)\)$ 为了防止局部修改区域受到源图特征的死锁干扰,模型通过串联当前特征与结构增量输入轻量门控网络,预测逐 token 的各向异性空间门控权重 \(\boldsymbol{\Lambda} = \sigma(\text{Linear}([\tilde{\mathbf{H}}^{(l)} \parallel \Delta \mathbf{H}_{\text{struct}}])) \in [0, 1]^N\)。最终层输出由下式统一计算: $\(\mathbf{H}_{\text{out}}^{(l)} = \tilde{\mathbf{H}}^{(l)} + \mathbb{I}_{\text{edit}} \cdot (\boldsymbol{\Lambda} \odot \Delta \mathbf{H}_{\text{struct}})\)$ 当执行纯文本生图时,\(\mathbb{I}_{\text{edit}} = 0\),结构分支完全旁路截断,保障语义自主生成;而在图像编辑时,\(\boldsymbol{\Lambda}\) 精确压制编辑区域的源图渗入并放大非编辑区域的背景保持,实现了高保真保留与灵活编辑的动态解耦。
损失函数 / 训练策略¶
FlowInOne 参数量为 1.2B,初始化自 CrossFlow 架构。模型基于大规模混合数据集 VisPrompt-5M 进行统一联合训练,涵盖文本生图、多类型指令编辑、涂鸦转换以及受力与轨迹动态预测等全部 8 个子任务。在分辨率 \(256 \times 256\) 下采用平衡 WebDataset 加载器训练 240k 步,批大小设为 512。整个训练过程优化的总目标函数结合了流匹配均方误差损失、变分潜空间的 KL 散度约束以及语义对齐辅助正则项: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{FM}} + \lambda_{\text{KL}}\mathcal{L}_{\text{KL}} + \lambda_{\text{CLIP}}\mathcal{L}_{\text{CLIP}}\)$ 其中流匹配核心损失为: $\(\mathcal{L}_{\text{FM}} = \mathbb{E}_{(z_0, z_1), t}\left[ \| v_\theta(z_t, t) - (z_1 - z_0) \|_2^2 \right]\)$ 通过全任务联合训练,避免了传统阶段式分步微调造成的灾难性遗忘,促使网络在单一参数空间内协同掌握语义合成、几何变形与物理规律。
实验关键数据¶
主实验¶
评估基于专门构建的视觉指令基准评测集 VP-Bench 进行。由于常规 FID 指标无法衡量精细的空间几何与物理指令遵循,评估采用了前沿多模态大模型(Gemini 3、GPT 5.2、Qwen 3.5)全维度裁决与严格人工评估双重体制。生成结果须同时满足指令忠实度(IF)、内容一致性(CC)、视觉真实感(VR)与空间精度(SP)四项严苛标准方判定为通过(Pass)。各模型在各评测器下的整体与细分任务通过率如下表所示。
| 评测器 / 方法 | C2I (类别生图) | T2I (文本生图) | TIE (文字编辑) | FU (受力理解) | TBE (文本框编辑) | TU (轨迹理解) | VME (标记编辑) | DE (涂鸦编辑) | Total (总通过率) |
|---|---|---|---|---|---|---|---|---|---|
| Evaluator: Gemini 3 | |||||||||
| Nano Banana (商业) | 0.810 | 0.980 | 0.521 | 0.500 | 0.600 | 0.020 | 0.537 | 0.740 | 0.589 |
| OmniGen2 | 0.720 | 0.760 | 0.313 | 0.013 | 0.020 | 0.000 | 0.020 | 0.140 | 0.248 |
| FLUX.1-Kontext-dev | 0.620 | 0.700 | 0.363 | 0.027 | 0.163 | 0.020 | 0.096 | 0.180 | 0.271 |
| Qwen-Image-Edit-2509 | 0.680 | 0.690 | 0.383 | 0.047 | 0.060 | 0.000 | 0.040 | 0.160 | 0.258 |
| FlowInOne (本文) | 0.890 | 0.700 | 0.355 | 0.727 | 0.302 | 0.520 | 0.292 | 0.535 | 0.540 |
| Evaluator: GPT 5.2 | |||||||||
| Nano Banana (商业) | 0.760 | 0.960 | 0.402 | 0.163 | 0.100 | 0.020 | 0.227 | 0.495 | 0.391 |
| OmniGen2 | 0.660 | 0.820 | 0.203 | 0.001 | 0.000 | 0.000 | 0.001 | 0.160 | 0.231 |
| FLUX.1-Kontext-dev | 0.620 | 0.690 | 0.266 | 0.013 | 0.093 | 0.000 | 0.056 | 0.160 | 0.237 |
| Qwen-Image-Edit-2509 | 0.640 | 0.680 | 0.286 | 0.040 | 0.020 | 0.020 | 0.020 | 0.140 | 0.231 |
| FlowInOne (本文) | 0.850 | 0.800 | 0.079 | 0.500 | 0.116 | 0.240 | 0.083 | 0.465 | 0.392 |
| Evaluator: Human | |||||||||
| Nano Banana (商业) | 0.790 | 0.940 | 0.372 | 0.287 | 0.220 | 0.020 | 0.306 | 0.740 | 0.459 |
| OmniGen2 | 0.720 | 0.710 | 0.268 | 0.013 | 0.020 | 0.000 | 0.010 | 0.120 | 0.233 |
| FLUX.1-Kontext-dev | 0.640 | 0.680 | 0.317 | 0.013 | 0.080 | 0.020 | 0.048 | 0.120 | 0.240 |
| Qwen-Image-Edit-2509 | 0.700 | 0.665 | 0.331 | 0.047 | 0.020 | 0.000 | 0.023 | 0.160 | 0.243 |
| FlowInOne (本文) | 0.800 | 0.645 | 0.242 | 0.705 | 0.255 | 0.280 | 0.255 | 0.400 | 0.449 |
在细粒度空间几何与物理结构表征(DINOv3 相似度)评估中,FlowInOne 展现出强大的控制能力:平均 DINOv3 Sim 达到 0.487,超过了商业闭源系统 Nano Banana 的 0.473,大幅领先所有开源基线(OmniGen2 0.125、Kontext 0.161、Qwen-IE-2509 0.201)。尤其在受力理解(FU:0.536 vs 0.474)与运动轨迹预测(TU:0.570 vs 0.486)上优势显著。在空间精度(Spatial Precision,满分 5 分)维度上,FlowInOne 在三大评测模型下分别获得 3.42、3.24 和 3.30 分,位居全榜第一。
消融实验¶
消融实验重点验证了特征压缩映射策略、空间调制机制以及训练阶段选择对最终性能的影响。评估指标为 Gemini 3、GPT 5.2 和 Qwen 3.5 评估通过率的平均值。
| 模块类别 | 消融配置 | Gemini 3 ↑ | GPT 5.2 ↑ | Qwen 3.5 ↑ | 平均通过率 (Avg) ↑ | 说明与结论 |
|---|---|---|---|---|---|---|
| 压缩映射方式 | MLP + 截断 (truncation) | 0.179 | 0.153 | 0.176 | 0.169 | 简单截断导致图像边界语义与关键空间拓扑严重丢失 |
| VAE 扩展 (expansion) | 0.169 | 0.147 | 0.155 | 0.157 | 直接加深 VAE 层数显著增加隐空间优化收敛难度 | |
| 双 MLP 投影 (MLP + MLP) | 0.192 | 0.170 | 0.185 | 0.182 | 序列与通道双投影有效对齐预训练先验与空间连续性 | |
| 空间调制机制 | 无交叉注意力 (Wo CA) | 0.192 | 0.170 | 0.185 | 0.182 | 仅用自注意力,编辑任务严重缺乏原图结构锚定支持 |
| 双路径交叉注意力 (W Dual-Path CA) | 0.227 | 0.185 | 0.229 | 0.214 | 引入结构 cross-attention 提升结构依从,但缺乏动态门控 | |
| 双路径自适应调制 (Dual-Path SAM) | 0.242 | 0.214 | 0.238 | 0.231 | 像素级自适应门控完美平衡背景高保真与局部修改自由度 | |
| 数据训练策略 | 两阶段训练 (2-stage training) | 0.336 | 0.256 | 0.283 | 0.291 | 粗粒度生图与细粒度编辑分步训练导致严重的灾难性遗忘 |
| 全量联合训练 (Joint training) | 0.540 | 0.392 | 0.503 | 0.478 | 8 大类数据统一联合训练带来 +18.7% 的质变跨越 |
关键发现¶
- 物理指令理解具备绝对统治力:传统基于文本描述的基线模型在受力动态(FU)和轨迹演变(TU)任务上几乎完全失效(如 OmniGen2 的 TU 通过率为 0.000,Nano Banana 仅为 0.020),因为离散文本词汇无法精确量化方向向量与连续加速度;而 FlowInOne 将箭头与力标直接转为连续视觉流,在 Gemini3 评测下受力通过率高达 72.7%、轨迹通过率达到 52.0%。
- 双路径空间门控是局部编辑的关键屏障:消融数据显示,缺乏自适应门控的 Dual-Path CA 虽然保全了结构,但在局部物体替换任务中极易产生重影伪影;Dual-Path SAM 通过各向异性权重矩阵 \(\boldsymbol{\Lambda}\) 实现了按需遮蔽,使综合平均得分从 0.214 进一步提升至 0.231。
- 统一联合训练优于分阶段微调:在数据策略消融中,一次性将 500 万全量多模态数据混合进行联合流匹配训练,相比先文本后编辑的两阶段策略取得了 47.8% vs 29.1% 的巨大优势。这证实了在统一的视觉几何空间内,不同任务之间的先验表征能够相互迁移促进,形成统一的连续视觉流动表征能力。
亮点与洞察¶
- 将离散控制全面重塑为连续几何基元:摒弃复杂的任务头与外挂适配器,将文本、边界框、箭头与线条全部“画”在输入画布上。这一设计巧妙利用了视觉骨干网络固有的二维几何先验,从根源上消除了文本符号与像素网格间的对齐鸿沟。
- 同构端点让流匹配摆脱布朗运动桎梏:与传统扩散模型将真实图像还原为纯高斯白噪声不同,FlowInOne 将输入画布隐变量作为确定的非高斯起点 \(z_0\),目标图像作为终点 \(z_1\)。两者位于同构隐空间,通过直线 ODE 轨迹单调输运,大幅减少了采样步骤并增强了空间可控性。
- 可复用的通用提示工程范式:将多传感器数据、机器人末端执行器受力、自动驾驶前瞻路径等任意复杂控制信号转化为画布上的几何标注,这一思路可直接无缝迁移到具身物理仿真、自动驾驶端到端控制以及工业交互式 CAD 设计中。
局限与展望¶
- 作者承认的局限:在复杂的长文本指令与密集排版编辑场景下,当画布上的文本标注过长或过密时,SigLIP 视觉编码器可能出现字符重叠粘连或局部误读;此外受限于 256 分辨率训练与计算资源限制,极端高频细节纹理的保真度相比于前沿商业闭源模型(如 Nano Banana)仍存在细微差距。
- 客观局限与评测边界:虽然模型在物理动力学和空间几何任务上表现出色,但数据集中大部分物理样本源于 Blender 仿真环境及合成力学数据,在真实复杂光照、强烈遮挡及多体碰撞非刚体接触等开放物理世界场景下的泛化能力仍需进一步实证。
- 未来改进思路:探索更高分辨率与动态宽高比的视觉分词器(如更高容量的 Native Resolution ViT),引入无文本光流蒸馏技术提升极限推理速度,并将输入画布拓展为时序视频帧流,直接赋能世界模型与物理引擎构建。
相关工作与启发¶
- vs 传统文本引导生成与编辑 (如 Stable Diffusion, InstructPix2Pix, Prompt-to-Prompt): 传统方案严重依赖跨模态文本编码器和交叉注意力图替换,文本对于空间边界和连续轨迹几乎缺乏直接约束;FlowInOne 将所有控制信息视觉化,在单模态内以确定性连续流动取代随机采样,空间精度(SP)大幅领先。
- vs 视觉上下文多模态生成基准 (如 OmniGen2, FLUX.1-Kontext): 现有以统一多模态为导向的工作虽然支持多图输入,但仍保留了多模态分词与文本嵌入注入的混合架构;FlowInOne 彻底剔除文本编码器,实现彻底的“纯图像进、纯图像出”,架构极致精简且训练高度稳定。
- vs 交叉模态流匹配模型 (如 CrossFlow): CrossFlow 探索了文本特征向像素特征的流演化,但两端表征存在明显的模态异构与维度不匹配;FlowInOne 通过文本-图像 VAE 将输入统一在与输出严格同构的潜在流形中,使得速度场估计的误差显著降低。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 彻底打破图文双模态不对称性,首次将文本生图与各类精细编辑统一为纯视觉流匹配输运过程。
- 实验充分度: ⭐⭐⭐⭐⭐ 提出 500 万规模的 VisPrompt-5M 数据集与严格的 VP-Bench 基准,结合三大前沿 MLLM 与人工盲测,消融严密。
- 写作质量: ⭐⭐⭐⭐⭐ 论证脉络行云流水,数学推导直观严密,图表信息量极其丰富且对比鲜明。
- 价值: ⭐⭐⭐⭐⭐ 为以视觉为中心的纯粹多模态大一统生成奠定了坚实的理论与工程基石,对仿真与物理交互领域启示深远。