TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation¶
会议: ECCV 2026
论文: ECCV 原文
项目: https://seokhunchoi.github.io/TMI
领域: 图像生成
关键词: 扩散模型数据合成、长尾实例分割、文生图(T2I)、图生图(I2I)、教师-学生伪标签自适应
一句话总结¶
TMI 提出了一个将全局文本到图像(T2I)多样性生成与上下文感知图像到图像(I2I)编辑相结合的互补数据合成范式,利用提示一致性过滤与教师-学生自适应伪标签解决 T2I 噪声,并通过 VRAIN“放置-验证”机制实现高保真罕见类精准注入,大幅提升长尾实例分割在全类及稀缺类别上的表现。
研究背景与动机¶
在大规模词表实例分割(如拥有 1,203 个类别的 LVIS 基准)中,极度倾斜的长尾类别分布和细粒度类间混淆是制约检测器性能的核心瓶颈。现有针对长尾问题的算法级解决方案(如重加权损失、平衡采样和分类器后处理校准)虽然能在一定程度上缓解预测偏置,但无法从根本上消除尾部罕见类别在真实物理世界中固有的标注数据稀缺问题。随着前沿图像生成扩散模型(如 Flux 系列与流匹配模型)的演进,利用生成模型合成标注数据成为替代高昂人工采集与密集标注的高扩展性新路径。
然而,现存的生成数据合成方案均呈现出明显的单点局限与互补缺陷。纯文本到图像(T2I)生成范式(如 MosaicFusion)虽然具备广阔的场景构图与全类别语义覆盖度,但严重依赖离线感知模型打伪标签,合成域与真实域之间的域分布差异会导致严重的伪标签漏检与误报,在样本匮乏的罕见类别上几乎无法提供准确监督。与之相对,以 Copy-Paste 为代表的图像到图像(I2I)方法(如 X-Paste、DiverGen)虽能携带准确的目标掩码,却因光照、阴影和空间布局的不协调产生严重的上下文不协调;文献中观察到当 Copy-Paste 专门针对罕见类别实施增强时,尾部类别的分割指标反而发生灾难性下跌,证实检测器极易过拟合于合成粘贴边界等伪影而非真实特征。此外,基于局部 Inpainting 的编辑方案又受困于在复杂自然场景中难以自动化寻找合理掩码位置的难题。
本文的切入视角在于:T2I 具备宏观语义多样性但缺乏微观标注信噪比,I2I 能提供精准局域目标标注但容易破坏全局语境与现实感;两者在长尾分割任务上恰好形成天然互补。核心 idea:构建一套融合 T2I 全局多样性生成与 I2I 上下文感知编辑的协同互补框架,在 T2I 侧通过提示一致性过滤与动量教师自适应学习消除伪标签噪声,在 I2I 侧提出“放置-验证”机制(VRAIN)精准注入高保真罕见类实例,形成高质量双源合成监督。
方法详解¶
整体框架¶
TMI 整体架构由三个紧密耦合的阶段组成:(1) 全类别场景级文生图数据生成与提示一致性过滤分支;(2) 针对长尾罕见类别的 VRAIN(基于指令编辑的验证型罕见类增强)分支;(3) 结合动量更新教师(EMA Teacher)与在线伪标签域自适应的学生检测器联合训练机制。其端到端数据生成与训练流水线如下图所示:
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
subgraph S1["数据生成阶段"]
direction TB
A["真实数据集 D_real<br/>与全类别表 C_all"] --> B["提示一致性过滤与多样性 T2I 合成<br/>GPT-4o 提示采样 + Flux.1 + 提示类别对齐过滤"]
A --> C["VRAIN 放置-验证双阶段 I2I 编辑增强<br/>VLM 推荐指令 + Flux.1 Kontext + 空间红框校验 + SAM"]
end
B --> D["弱标注多样性集 D_T2I"]
C --> E["高保真罕见类精准标注集 D_I2I"]
D --> F["动量教师伪标签域自适应与长尾互补训练<br/>在线自适应阈值 + 未标注实例挖掘 + 动量教师跨域迁移"]
E --> F
A --> F
F --> G["高精度长尾实例分割模型 M_student"]
在数据准备阶段,系统首先并行构建包含全局多样性场景的弱标注数据集 \(\mathcal{D}_{\text{T2I}}\),以及专门针对尾部类别的精准增强集 \(\mathcal{D}_{\text{I2I}}\)。在模型训练阶段,主干分割模型同时接收真实数据、I2I 编辑数据以及带有动态调整伪标签的 T2I 数据,借助动量教师网络在训练演变过程中的域自适应能力,使稀疏类别的强监督信号通过反向传播反哺全类别检测精度。
关键设计¶
1. 提示一致性过滤与多样性 T2I 合成:借助先验约束消除离线伪标签幻觉
T2I 合成旨在为全类别集合 \(C_{\text{all}}\) 提供广阔的环境上下文和多目标组合。针对传统 T2I 依赖固定高置信度阈值挖掘实例时极易丢弃低置信度真实物体、或者在生成图像引入无关背景误检的问题,TMI 设计了基于文本提示先验的一致性过滤策略。系统首先从类别池 \(C_{\text{all}}\) 中均匀采样 \(l \in [5, 10]\) 个目标类别子集 \(C_m\),调用 GPT-4o 生成富含自然场景布局与光照描述的多类别合成提示词 \(t_m\),再通过 Flux.1-dev 生成高分辨率合成图像 \(I_m\)。
在离线伪标签构建阶段,预训练感知模型 \(M_P\) 预测出初始候选实例集合 \(\hat{A}_m^{\mathcal{P}}\)。区别于传统盲目设定极高置信度截断的做法,TMI 构建了提示一致性过滤器 \(\mathcal{F}_{\text{text}}\),仅保留预测类别显式属于输入提示集合 \(C_m\) 的实例: $\(A_m^{\mathcal{P}} = \mathcal{F}_{\text{text}}(\hat{A}_m^{\mathcal{P}}, C_m) = \{ a_k^{\mathcal{P}} \mid a_k^{\mathcal{P}} \in \hat{A}_m^{\mathcal{P}}, \, \text{class}(a_k^{\mathcal{P}}) \in C_m \}\)$ 这一设计的关键机制在于:即使某些小尺寸或具有域偏差的罕见类别得分未达全局高阈值,由于文本提示强行锁定了场景内理应存在的实体范围,提示一致性先验能安全地接纳这些低置信度正样本,同时强力切除生成模型产生的幻觉噪点。
2. VRAIN 放置-验证双阶段 I2I 编辑增强:上下文感知注入与空间定点审校
为了解决传统 Copy-Paste 方法破坏光照几何环境、以及 Inpainting 无法自动决策合理掩码位置的瓶颈,本文提出了 VRAIN(Verified Rare-class Augmentation via INstructed editing)模块,将其拆分为“放置(Place)”与“验证(Verify)”双阶段。在“放置”阶段,为了避免高频采样已饱和类别,系统维护各类别累计生成计数器,通过 softmax 概率分布对罕见类别库 \(C_{\text{I2I}}\) 进行低频偏置采样,为给定真实图像 \(I_{\text{real}}\) 提取 \(Q=5\) 个候选罕见类 \(C_q\);随后利用多模态大模型 InternVL3-14B 评估输入图像中现有的物体几何与语义背景,从中决策出最符合物理与常识规律的目标罕见类 \(c^*\),并生成精细编辑指令 \(inst^*\)(例如“在滑雪者头部佩戴黑色耳麦”)。指令编辑模型 Flux.1 Kontext 随之执行受控局部合成得到 \(I_{\text{edit}}\)。
在“验证”阶段,编辑图像面临局部过变、语义漂移或位置偏移等潜在失效模式。VRAIN 提出了一套级联检验与掩码修复流程: - 变化区定位与候选检出:计算 \(I_{\text{real}}\) 与 \(I_{\text{edit}}\) 之间的结构相似度(SSIM)差异图,以阈值 \(\tau_{\text{edit}}=5\) 定位发生像素修改的粗糙包围区域,在该区域内运行开集检测器(Open-vocabulary Detector)检索目标类别 \(c^*\),得到初始候选边界框集合 \(A_{\text{det}}\)。 - 空间红框 VLM 二值语义验证:为了克服 CLIP 在整图或裁剪图上缺乏细粒度空间对齐能力的缺陷,VRAIN 将候选边界框以红色矩形直接叠加绘制在整张编辑图像上得到 \(I^{\text{box}}_{\text{edit}}\),向 VLM 提出定点模板问题(“图中的红色边界框内是否为 \(c^*\)?”),唯有通过二值肯定回复的候选框才被接纳: $\(\mathcal{F}_{\text{VLM}}(A_{\text{det}}, c^*) = \{ a_k \mid a_k \in A_{\text{det}}, \, \mathrm{VLM}(I^{\text{box}}_{\text{edit}}, t^{c^*}; a_k) = \text{Yes} \}\)$ - SAM 分割与遮挡掩码更新:通过校验的目标框送入 SAM 生成精细实例轮廓;当新生成的实例与原图真实标注 \(A_{\text{real}}\) 发生空间重叠时,通过像素级布尔减法从原重叠掩码中扣除新物体遮蔽区域,生成最终的完美贴合标注 \(A_{\text{edit}}\)。
3. 动量教师伪标签域自适应与长尾互补训练:在线知识演进与无监督挖掘
在联合优化流程中,模型需要协同消化真实数据 \(\mathcal{D}_{\text{real}}\)、编辑数据 \(\mathcal{D}_{\text{I2I}}\) 和全生成数据 \(\mathcal{D}_{\text{T2I}}\)。若直接使用静态离线模型 \(M_P\) 指导 \(\mathcal{D}_{\text{T2I}}\),模型将受制于固定伪标签的固有偏差。TMI 引入以衰减率 \(\gamma=0.999\) 更新的动量教师网络 \(M_{\text{teacher}}\)。随着学生网络持续在注入了精确罕见类特征的 \(\mathcal{D}_{\text{I2I}}\) 上优化,教师网络不仅逐步适应了 T2I 合成图像的纹理域分布,而且对尾部罕见类的泛化判别能力显著跃升。
教师模型在每个 step 产生动态在线预测 \(\hat{A}_m^{\text{teacher}}\),并实施分类自适应解耦: - 提示内实例动态截断:维护每个类别的近期置信度滑动历史窗口(大小为 100),将提示一致实例(\(\hat{c} \in C_m\))的筛选门限设为历史均值的 \(\tau_{\text{label}} = 0.7\) 倍,实现阈值伴随学习进程动态演进; - 提示外未标注前景挖掘:对未出现在提示词中(\(\hat{c} \notin C_m\))却被教师以极高置信度(高于历史均值 \(\tau_{\text{unlabel}} = 1.2\) 倍)检出的物体,将其划归为“未标注类别(unlabeled)”,在反向传播中将其屏蔽于分类损失之外,但保留其边界框与掩码回归梯度,为潜在背景物体提供强隐式定位监督; - 双源标签 IoU 融合:在线精化标签 \(\tilde{A}_m^{\text{teacher}}\) 与静态离线标签 \(A_m^{\mathcal{P}}\) 依据空间 IoU 进行去重融合,静态标签维持常见类的精度基线,在线标签注入长尾罕见类的新增补全。
损失函数 / 训练策略¶
模型采用经典的 CenterNet2 架构作为检测与分割基线。训练批次按固定比例联合采样 \(\mathcal{D}_{\text{real}}\)、\(\mathcal{D}_{\text{I2I}}\) 与 \(\mathcal{D}_{\text{T2I}}\): $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{det/mask}}(I_{\text{real}}, A_{\text{real}}) + \mathcal{L}_{\text{det/mask}}(I_{\text{edit}}, A_{\text{edit}}) + \mathcal{L}_{\text{det/mask}}^{\text{adapt}}(I_m, A_m)\)$ 其中在 \(\mathcal{D}_{\text{T2I}}\) 样本计算损失时,标有“unlabeled”标签的实例仅计算回归定位损失 \(\mathcal{L}_{\text{box}} + \mathcal{L}_{\text{mask}}\),其分类交叉熵权重设为 0。模型总计优化 180k iterations,在 ResNet-50 配置下分辨率为 640、batch size 设为 32;在 Swin-L 配置下分辨率为 896、batch size 设为 16。
实验关键数据¶
主实验¶
在 LVIS 验证集上的主实验对比(表 2)涵盖了纯真实数据基线、纯文生图代表方法(MosaicFusion)以及主流 Copy-Paste 方案(DiverGen、X-Paste)。所有方法均在统一的 CenterNet2 框架下进行 180K iterations 训练测试。
| 主干网络 (Backbone) | 方法 (Method) | T2I 数据 | I2I 数据 | \(\text{AP}^{\text{box}}\) | \(\text{AP}^{\text{mask}}\) | \(\text{AP}^{\text{box}}_r\) (罕见类) | \(\text{AP}^{\text{mask}}_r\) (罕见类) |
|---|---|---|---|---|---|---|---|
| ResNet-50 | Real-only (基线) | - | - | 34.5 | 30.8 | 24.0 | 21.6 |
| ResNet-50 | MosaicFusion [45] | ✓ | - | 34.1 | 30.4 | 24.4 | 22.5 |
| ResNet-50 | DiverGen [6] | - | ✓ | 35.1 | 31.2 | 25.6 | 23.8 |
| ResNet-50 | X-Paste [51] | - | ✓ | 36.7 | 33.0 | 29.6 | 27.8 |
| ResNet-50 | Ours (TMI) | ✓ | ✓ | 38.1 | 34.0 | 33.9 | 31.7 |
| Swin-L | Real-only (基线) | - | - | 47.5 | 42.3 | 41.4 | 36.8 |
| Swin-L | MosaicFusion [45] | ✓ | - | 47.7 | 42.8 | 41.3 | 37.5 |
| Swin-L | DiverGen [6] | - | ✓ | 49.6 | 44.2 | 44.5 | 39.8 |
| Swin-L | X-Paste [51] | - | ✓ | 50.1 | 44.4 | 48.2 | 43.3 |
| Swin-L | Ours (TMI) | ✓ | ✓ | 50.7 | 45.2 | 49.1 | 44.0 |
注:原论文 Table 2。在 ResNet-50 上,本文方法相比 Real-only 在全类 \(\text{AP}^{\text{box}}\) 提升 +3.6,在罕见类 \(\text{AP}^{\text{box}}_r\) 取得高达 +9.9 点的巨大增益;在更强骨干 Swin-L 上保持一致优势。
消融实验¶
为了剖析 T2I 伪标签中离线与在线教师监督的协作机制,原论文在 Swin-L 主干下进行了伪标签源消融(表 4),同时评估了各组件在罕见类上的特定收益。
| 配置 (Supervision Source) | \(\text{AP}^{\text{box}}\) | \(\text{AP}^{\text{mask}}\) | \(\text{AP}^{\text{box}}_r\) | \(\text{AP}^{\text{mask}}_r\) | 说明 |
|---|---|---|---|---|---|
| (a) Real-only | 47.5 | 42.3 | 41.4 | 36.8 | 仅使用真实标注数据训练的性能下界 |
| (b) \(M_{\text{teacher}}\) 纯在线教师 | 49.4 | 43.9 | 47.9 | 43.0 | 动态适应生成域,罕见类大幅提升 (+6.5) |
| (c) \(M_P\) 纯离线感知器 | 49.9 | 44.9 | 45.3 | 41.7 | 静态置信度高,常见类表现稳健但尾部受限 |
| (d) \(M_{\text{teacher}} \oplus M_P\) 融合 | 50.3 | 45.1 | 47.5 | 43.8 | 结合两者互补优势,综合指标达到最佳均衡 |
注:原论文 Table 4。此外,在针对 I2I 模块独立性测试中(原论文 Table 7),若在完整方法中移除 \(\mathcal{D}_{\text{I2I}}\),全类 \(\text{AP}^{\text{box}}\) 从 50.7 降至 50.3,罕见类 \(\text{AP}^{\text{box}}_r\) 从 49.1 明显下滑至 47.5。
关键发现¶
- 罕见类定向合成的反直觉陷阱:在原论文 Table 3 的专项对比中,当传统 Copy-Paste 方法 DiverGen 专门针对罕见类生成数据时,其罕见类 \(\text{AP}^{\text{box}}_r\) 从真实基线的 41.4 暴跌至 34.5(下降 6.9 点);而 VRAIN 独立生效时即可将 \(\text{AP}^{\text{box}}_r\) 推升至 42.9。这有力地证明了未考虑物理场景上下文的生硬粘贴会导致模型过度拟合局域拼接瑕疵,而 VRAIN 的上下文感知生成与真实图像天然融合。
- 空间红框 VLM 审校的关键作用:如原论文 Table 5 所示,在 LVIS 验证集 244k 标注的受控扰动测试中,传统 CLIP 的假阳性率(FP Rate)高达 18.7%,而裁剪区域 VLM 的漏检率(FN Rate)达 47.8%。TMI 提出的整图红框标定 VLM 验证将 FP Rate 压缩至 3.3%,同时 FN Rate 仅为 15.4%,高保真过滤避免了模型遭受错误标签侵蚀。
亮点与洞察¶
- T2I 与 I2I 的分工正交性解耦:论文没有单纯依赖单一生成范式,而是将数据规模/多样性探索职责分配给 T2I,将高信噪比/长尾实体注入职责分配给 I2I,通过任务解耦化解了各自的根本瓶颈。
- 红框提示注入的多模态审校 Trick:直接将检测边界框绘制为红色线框输入 VLM 判断类别归属,相较于将物体抠图(Crop)送入模型,完整保留了周围环境的比例和语义参照物,显著解决了多模态模型在无语境小图上的误判难题。
- 可复用的伪标签动态记忆机制:基于类别滑动窗口动态放缩置信度阈值,并分离未声明实体的定位损失,这种兼顾 Precision 与 Recall 的伪标签策略可广泛迁移至半监督检测与开放词表目标定位任务中。
局限与展望¶
- 生成模型对复杂空间提示的遵从度缺陷:作者在文中坦承,底层依赖的现成扩散模型(Flux.1 系列)依然存在指令遵循不稳定的问题;例如 T2I 提示中指定的某些特定长尾小物体偶尔未被实际渲染,而 I2I 编辑器有时会忽略具体的位置描述(如“靠窗右侧”)发生摆放偏移。
- 计算开销与流水线复杂度:整套数据合成流水线串联了 GPT-4o、Flux.1、Flux.1 Kontext、InternVL3-14B、开集检测器和 SAM 等多个重型基础模型,离线合成的算力与时间成本相对较高。
- 未来方向:未来可探索统一的端到端生成-标注联合网络,或引入生成交互一致性奖励反馈,在合成过程中自适应约束掩码精度。
相关工作与启发¶
- vs MosaicFusion:MosaicFusion 采用纯 T2I 生成策略,通过拼贴多提示词构建多目标场景,但受限于离线伪标签噪声,在长尾罕见类上收益极弱;TMI 引入提示一致性约束与在线教师动态更新,显著弥补了 T2I 的标签噪声。
- vs X-Paste / DiverGen:X-Paste 与 DiverGen 依赖实体抠图后向背景执行 Copy-Paste,生成边界痕迹明显且破坏场景物理合理性;TMI 的 VRAIN 采用扩散指令局部编辑生成,光影结构自然,并在检测验证通过后利用 SAM 反向更新遮挡掩码,保证了高保真度。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 巧妙构筑了 T2I 宏观多样性与 I2I 微观精准增强的互补范式,VRAIN 放置-验证流程设计严谨。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 ResNet-50 与 Swin-L 完整对比、伪标签源消融、扰动基准检验及真实掩码保真度评测,论证扎实。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑线索清晰,问题痛点剖析深入透彻,图表与符号设计规整。
- 价值: ⭐⭐⭐⭐☆ 为通用大词表视觉任务利用生成模型合成高质量长尾监督数据提供了标准范本与实践指南。