InstanceControl: Controllable Complex Image Generation without Instance Labeling¶
会议: ECCV 2026
论文: ECCV 2026 Poster
PDF: ECCV Official PDF
代码: 待发布(论文声明即将开源)
领域: 图像生成
关键词: 可控图像生成, 多实例生成, 视觉语言模型, 掩码动态修正, 跨模态注意力约束
一句话总结¶
针对复杂多实例场景下可控图像生成容易出现属性混淆且现有方案极度依赖人工标注实例框或掩码的痛点,InstanceControl 利用视觉语言模型建立文本短语与视觉条件的无标注实例对应,并引入置信度与注意力驱动的自适应掩码精炼机制,在无需推理标注的前提下实现了高精度的细粒度多实例生成。
研究背景与动机¶
以 ControlNet 为代表的可控文本到图像生成方法,通过引入深度图、边缘线条等空间视觉条件,极大地拓宽了扩散模型在动漫生成、草图渲染和图像重绘等领域的应用落地。然而,现有的可控生成模型通常仅在单一主体或结构简单的画面中有效;当场景复杂度上升、画面包含数十个密集交错的实体时,模型往往难以维持细粒度的主体属性绑定,频繁产生严重的主体间属性混淆与色彩泄露。例如多个人物并排时,某个角色身穿的红外套极易被错误渲染到相邻角色的衣物上。
为了缓解这种属性混淆,近期方法如 FineControlNet、DreamRenderer 和 Seg2Any 开始引入显式的实例级空间标注,要求用户在推理阶段输入每个实例的详细文本描述,并为其手动指定边界框或逐像素分割掩码。这种范式虽然在一定程度上规范了局部注意力,却对人工交互带来了极高的门槛与繁重的标注负担,脱离了真实可控生成的灵活应用需求。造成现有全自动可控模型失败的根本瓶颈,在于模型内部无法自主地将长文本提示词中的多个实体描述与视觉条件中的具体几何区域一一关联。人类在面对画面条件时能够直观建立这种图文对应,而具备全局理解和跨模态推理能力的视觉语言模型(VLM)恰好为弥补这一感知空白提供了可能。
本文的切入角度是:利用 VLM 强大的图文理解与推理分割能力,全自动从自由文本中解析实例短语并在视觉条件上预测稠密实例掩码,进而以自适应修正机制注入生成主干。核心 idea:构建「实例级图文关联」与「实例感知可控生成」的两阶段框架,先由微调的 VLM 自动解析提示词中的实例描述并预测条件图上的对应掩码,再结合置信度与扩散层交叉注意力动态精炼带噪掩码并约束注意力交互,实现全程无需人工实例标注的精准多实例图像生成。
方法详解¶
整体框架¶
InstanceControl 的生成流水线划分为两个核心阶段:实例级图文条件关联(Stage 1)与实例感知可控生成(Stage 2)。在第一阶段中,系统接收全局文本提示词 \(p\) 与视觉控制条件 \(c\)(如 Canny 边缘、深度图或 HED 边缘),由结合了 SAM 的视觉语言模型 Sa2VA 同时执行实例短语解析与实例掩码预测,并借助共享 SEG 标记机制聚合多处提及,输出实例级对应元组 \(\mathcal{C} = \{(\mathbf{t}_i^{pred}, \mathbf{m}_i^{pred}, s_i^{pred})\}_{i=1}^N\)。在第二阶段中,针对 VLM 预测掩码可能存在的边界噪声与空间偏移,系统在 FLUX 扩散去噪过程中抽取当前步的跨注意力图,交由轻量级掩码精炼模块(MRM)动态生成修正后的实例掩码 \(\mathbf{m}_i^{rfn}\),最后构造实例对应掩码矩阵对图文注意力实施选择性抑制,确保每个主体的图像潜变量仅与对应属性描述充分交互。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:文本提示词 p + 视觉条件 c"] --> B["阶段1:实例级图文条件关联<br/>VLM 提取短语并预测实例掩码"]
B --> C["共享 SEG 标记聚合<br/>合并同一实例的多处描述表征"]
C --> D["阶段2:实例感知可控生成<br/>FLUX 主干去噪与特征提取"]
D --> E["掩码精炼模块<br/>融合置信度、注意力图与潜特征自适应校准"]
E --> F["对应关系注意力掩码矩阵<br/>约束图像-文本交叉注意力抑制属性混淆"]
F --> G["高质量细粒度多实例图像"]
关键设计¶
1. 实例级图文条件关联:跨模态短语解析与共享 SEG 标记聚合
在复杂提示词中,不同物体的描述常常夹杂在连续的长句、介词短语或动作叙述之中,并且同一个物体可能在文本的不同从句中被多次提及。现有的指代分割方法主要针对自然 RGB 图像,严重依赖强语义纹理匹配,直接迁移到边缘线条或深度图等稀疏几何条件时极易发生歧义。为此,模型以 Sa2VA 为骨干网络,通过 LoRA 微调 VLM 自回归输出带语义标签的短语序列 \(\mathbf{y}_{txt}^{pred}\)(例如标注 <p>a man in a black jacket</p><seg><1>)。对于属于同一个实体编号 \(i\) 但出现在不同位置的多个 <SEG> 标记,模型提出共享 SEG 标记策略(Shared SEG Token, SST),提取所有相关 <SEG> 标记最后一层隐藏状态并通过 MLP 投影后在通道维度拼接为统一表征:
$\(\mathbf{h}_i = \text{Concat}(\mathbf{h}_i^1, \mathbf{h}_i^2, \dots, \mathbf{h}_i^M)\)$
随后将聚合向量 \(\mathbf{h}_i\) 与 SAM 图像编码器从条件图提取的稠密视觉特征 \(\mathbf{f}\) 共同输入 SAM 解码器,同步输出各实体的初始空间掩码 \(\mathbf{m}_i^{pred}\) 及其预测置信度得分 \(s_i^{pred} \in [0, 1]\)。该设计保证了跨长文多重描述下的掩码预测一致性。
2. 掩码精炼模块:多源置信度驱动的动态空间校准
由第一阶段 VLM 预测生成的初始掩码 \(\mathbf{m}_i^{pred}\) 不可避免地存在几何欠分割、局部噪点或边缘定位偏移,若将其直接当作硬约束强制注入生成主干,扩散模型将严重受限并放大几何瑕疵。作者发现,扩散模型在生成过程中通过交叉注意力自发形成的注意力图 \(\mathbf{m}_i^{att}\) 与初始预测掩码具有极强的互补性。掩码精炼模块(Mask Refinement Module, MRM)设计为一个轻量级 U-Net 架构,在去噪时间步 \(t\) 同时接收预测掩码 \(\mathbf{m}_i^{pred}\)、当前步注意力掩码 \(\mathbf{m}_i^{att}\)、置信度得分 \(s_i^{pred}\) 以及图像潜特征 \(\mathbf{H}_{img}\): $\(\mathbf{m}_i^{rfn} = f(\mathbf{m}_i^{pred}, \mathbf{m}_i^{att}, s_i^{pred}, \mathbf{H}_{img})\)$ 模块内部构建了实例内与实例间双重注意力机制。当置信度得分 \(s_i^{pred}\) 较高时,MRM 倾向于保留高精度的预测结构;当置信度低、预测存在歧义时,模块自主倚重扩散模型内生的注意力线索 \(\mathbf{m}_i^{att}\),实现弹性的自适应校准,从而有效避免了硬性标注注入所带来的空间失真。
3. 对应关系掩码构建:基于软阻断的交叉注意力约束
为了将精炼后的实例对应集合 \(\{(\mathbf{t}_i^{pred}, \mathbf{m}_i^{rfn})\}_{i=1}^N\) 无缝植入扩散变换器(Diffusion Transformer, 如 FLUX),模型构造了一个空间-文本注意力调制矩阵 \(\mathbf{M} \in \mathbb{R}^{L_{img} \times L_{txt}}\)。设 \(\mathcal{T}_i\) 为第 \(i\) 个实例描述对应的文本词元集合,\(\mathcal{I}_i\) 为精炼掩码 \(\mathbf{m}_i^{rfn}\) 覆盖的图像补丁词元集合,\(\mathcal{I}_{bg}\) 为背景区域词元集合。注意力掩码定义为: $\(\mathbf{M}[q, k] = \begin{cases} \mathbf{m}_i^{rfn}, & \text{if } q \in \mathcal{I}_i \text{ and } k \in \mathcal{T}_i \\ 1, & \text{if } q \in \mathcal{I}_{bg} \\ 0, & \text{otherwise} \end{cases}\)$ 在注意力层计算时,该掩码以对数加和形式融入 Softmax: $\(\text{Attention}(\mathbf{Q}, \mathbf{K}, \mathbf{V}) = \text{Softmax}\left(\frac{\mathbf{Q}\mathbf{K}^T}{\sqrt{d}} + \log(\mathbf{M})\right)\mathbf{V}\)$ 当 \(\mathbf{M}[q, k] \to 1\) 时,\(\log(\mathbf{M}) \to 0\),保留标准交叉注意力的完全交互;当 \(\mathbf{M}[q, k] \to 0\) 时,\(\log(\mathbf{M}) \to -\infty\),彻底切断该图像区域对非本主体文本词元的注意力响应。这种机制严格隔离了跨实例属性干扰,从根本上消除了颜色混叠与概念窜位。
损失函数 / 训练策略¶
训练分为两个独立阶段: 1. 第一阶段(VLM 实例对应学习):在 Sa2VA 骨干的 VLM、视觉编码器及 SAM 模块中全部插入 Rank=256 的 LoRA。总损失结合文本自回归交叉熵与掩码分割损失: $\(\mathcal{L}_{Stage1} = \mathcal{L}_{txt} + \sum_{i=0}^N \left(\lambda_{bce} \text{BCE}(\mathbf{m}_i^{pred}, \mathbf{m}_i^{gt}) + \lambda_{dice} \text{DICE}(\mathbf{m}_i^{pred}, \mathbf{m}_i^{gt})\right)\)$ 其中损失权重设为 \(\lambda_{bce}=2.0, \lambda_{dice}=0.5\),使用 AdamW 优化器,学习率 \(4 \times 10^{-5}\),训练 30k 步。 2. 第二阶段(生成控制与掩码精炼):基于 FLUX.1(Canny、Depth 及 HED ControlNet)构建。先使用真值掩码微调 FLUX DiT 块的所有线性层(80k 步,学习率 \(1 \times 10^{-4}\),余弦退火调度),再固定主干并针对预测掩码训练掩码精炼模块 10k 步。损失结合流匹配流速度回归损失 \(\mathcal{L}_{flux}\) 与精炼掩码的分割损失 \(\mathcal{L}_{mask}(\mathbf{m}_i^{rfn}, \mathbf{m}_i^{gt})\)。
实验关键数据¶
主实验¶
在多实例基准 MIG-Eval(包含平均 11.64 个实例、平均 183.15 个词元长描述的 5,400 张测试图)上,与主流实例标注方法(需人工输入 Box/Mask)及无需标注的 FLUX ControlNet 进行全面量化评估。评估涵盖空间分割精度(MIoU)、局部区域对齐(Local CLIP、Qwen2-VL-72B VQA 空间/颜色/形状/纹理准确率)与全局图像质量(ImageReward、FID)。
| 方法 | 实例标注依赖 | 控制条件 | MIoU ↑ | Local CLIP ↑ | 空间精度 ↑ | 颜色精度 ↑ | 形状精度 ↑ | 纹理精度 ↑ | FID ↓ |
|---|---|---|---|---|---|---|---|---|---|
| EliGen | 依赖(Box) | 无额外几何 | 0.6104 | 17.49 | 91.97% | 84.98% | 85.59% | 87.93% | 27.82 |
| CreatiLayout | 依赖(Box) | 无额外几何 | 0.5247 | 16.84 | 88.16% | 80.87% | 83.00% | 85.91% | 21.40 |
| Seg2Any | 依赖(Mask) | 无额外几何 | 0.8316 | 18.62 | 91.71% | 87.25% | 88.39% | 90.14% | 21.23 |
| DreamRenderer | 依赖(标注) | Canny | 0.6497 | 16.25 | 80.74% | 67.55% | 69.20% | 74.68% | 14.51 |
| DreamRenderer | 依赖(标注) | Depth | 0.7738 | 17.88 | 89.52% | 80.91% | 81.45% | 86.69% | 15.36 |
| DreamRenderer | 依赖(标注) | HED | 0.7060 | 15.08 | 78.93% | 60.56% | 63.18% | 68.79% | 22.67 |
| FLUX ControlNet | 无需标注 | Canny | 0.6526 | 16.48 | 84.67% | 73.30% | 73.93% | 79.24% | 14.04 |
| InstanceControl (Ours) | 无需标注 | Canny | 0.8250 | 18.51 | 93.54% | 87.78% | 88.19% | 90.88% | 10.03 |
| FLUX ControlNet | 无需标注 | Depth | 0.7782 | 17.73 | 90.14% | 75.87% | 78.20% | 82.33% | 14.11 |
| InstanceControl (Ours) | 无需标注 | Depth | 0.8116 | 18.18 | 92.87% | 86.11% | 86.49% | 89.91% | 11.92 |
| FLUX ControlNet | 无需标注 | HED | 0.6817 | 15.67 | 83.09% | 70.15% | 70.51% | 77.08% | 20.08 |
| InstanceControl (Ours) | 无需标注 | HED | 0.8472 | 18.74 | 94.64% | 88.75% | 89.55% | 91.18% | 10.14 |
消融实验¶
针对所提出的核心组件,包括不同掩码来源(原始预测掩码 \(\mathbf{m}^{pred}\)、简单置信度插值融合掩码 \(\mathbf{m}^{fuse}\)、MRM 精炼掩码 \(\mathbf{m}^{rfn}\))以及共享 SEG 标记(SST)策略,在 MIG-Eval(Canny 条件)上进行消融验证。
| 实验配置 | 掩码处理方式 | SST 机制 | MIoU ↑ | Local CLIP ↑ | 颜色精度 ↑ | 纹理精度 ↑ | FID ↓ | 说明 |
|---|---|---|---|---|---|---|---|---|
| 配置 A | 原始预测 \(\mathbf{m}^{pred}\) | 包含 | 0.8155 | 18.07 | 84.88% | 89.10% | 10.93 | 未经精炼,受分割噪点干扰 |
| 配置 B | 线性插值 \(\mathbf{m}^{fuse}\) | 包含 | 0.8210 | 18.39 | 85.91% | 89.99% | 10.06 | 基于置信度的直接加权融合 |
| 配置 C (完整 MRM) | 精炼掩码 \(\mathbf{m}^{rfn}\) | 包含 | 0.8250 | 18.51 | 87.78% | 90.88% | 10.03 | 动态融合注意力与潜特征,指标最优 |
| 配置 D (去除 SST) | 精炼掩码 \(\mathbf{m}^{rfn}\) | 去除 | 0.8214 | 18.31 | 85.89% | 89.83% | 10.30 | 同一实例跨句描述表征未聚合,掉点明显 |
关键发现¶
- 在无需任何人工实例标注的同等设定下,InstanceControl 相比基线 FLUX ControlNet 在 Canny 条件下取得了局部属性精度的大幅飞跃(颜色准确率提升达 14.48%,纹理准确率提升 11.64%),同时 FID 从 14.04 显著降低至 10.03。
- 即便与输入了人工金标准标注框/掩码的方法相比,InstanceControl(无需标注)在绝大部分属性指标上仍全面超越了依赖标注的 CreatiLayout、EliGen 和 DreamRenderer,达到了与依赖真实逐像素分割掩码的 Seg2Any 相当甚至更优的水准。
- 消融实验表明,直接套用 VLM 预测掩码 \(\mathbf{m}^{pred}\) 会因为边界噪声使得颜色精度下降近 3 个百分点;而 MRM 模块通过引入交叉注意力图与潜特征空间约束,显著增强了对抗分割噪声的鲁棒性。
- SST(共享 SEG 标记)对多重长描述尤其关键,去掉 SST 后多处提及实体的局部一致性受损,Local CLIP 从 18.51 跌落至 18.31。
亮点与洞察¶
- 跨模态感知驱动可控生成:首次巧妙地将推理指代分割 VLM(Sa2VA)作为前置结构化解析器引入可控生成流水线,利用 VLM 的开放词表和细粒度接地能力自动解耦复杂多实例提示词,彻底摆脱了人工绘制边界框或掩码的苛刻束缚。
- 置信度协同的双向掩码动态精炼:没有将 VLM 的输出视为不可更改的硬真值,而是洞察到扩散模型内部的交叉注意力能够反映生成意图,通过轻量级 MRM 根据置信度自适应权衡两者,实现了感知错误在生成阶段的自我修复与平滑过渡。
- 交互式即时校正能力:设计支持轻量的人机交互接口,在极少数 VLM 严重漏检或偏移的极端样本上,用户只需轻点一个提示点或提示框即可刷新掩码,模型平均准确率可由 90.10% 进一步飙升至 93.19%。
局限与展望¶
- 极端密集与重叠遮挡下的感知上限:虽然方法大幅提升了多实例控制上限,但当场景中重叠物体极多且深度条件高度粘连时,第一阶段 VLM 仍存在少量目标漏检或空间定位偏差;当 Stage 1 发生完全漏检时,Stage 2 难以凭空恢复该实体的隔离掩码。
- 两阶段级联系统的计算与显存开销:由于在推理时需要先经过一个完整的 VLM + SAM 解码过程,随后在扩散去噪步骤中还要运行 U-Net 掩码修正网络,整体显存占用与端到端推理时延显著高于原生单一模型。未来可探索将 VLM 的多模态接地与 Diffusion Transformer 统一在同一个多模态自回归或流匹配架构中进行端到端联合训练。
相关工作与启发¶
- vs FLUX ControlNet: FLUX ControlNet 仅对整图施加全局条件特征注入,缺乏对文本短语与空间像素的解耦对应,导致多实例场景下属性跨主体混叠严重;InstanceControl 通过 VLM 建立显式实例绑定并施加注意力硬阻断,彻底解决了多主体属性混淆。
- vs DreamRenderer / Seg2Any: DreamRenderer 和 Seg2Any 依赖高质量的人工标注输入(Bounding Box 或精确 Mask),无法用于全自动生产管线;InstanceControl 实现了全自动推理,并且在指标上全面超越或匹敌这些依赖人工先验的方法。
- vs 纯布局生成模型 (EliGen / CreatiLayout): 纯布局模型仅有边界框坐标约束,缺乏底层轮廓几何细节,容易在密集交叉处生成形变失真的物体;InstanceControl 将几何视觉条件(Canny/Depth)与细粒度实例语义相结合,兼备高结构保真度与属性精确性。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 首次利用 VLM 自动关联可控生成的图文实例并结合置信度动态校准掩码,设计思路完备且极具实用价值。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 Canny、Depth、HED 多种条件,覆盖 MIG-Eval 与 COCO-POS 双基准,提供了详尽的 VQA 细粒度指标与消融对比。
- 写作质量: ⭐⭐⭐⭐⭐ 结构清晰,问题切入点直击多实例控制痛点,图表与实验分析严谨扎实。
- 价值: ⭐⭐⭐⭐⭐ 有效破除了可控图像生成向高复杂度工业场景落地时的人工标注瓶颈,对未来端到端多模态可控生成极具启发意义。