跳转至

Kiroshi: An Agentic Perception System for High-Accuracy Image Parsing

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/haipengzhou856/Kiroshi
领域: 语义分割
关键词: 高精度图像解析, 图像抠图, 多模态大模型, 智能体感知, 直接偏好优化

一句话总结

针对传统交互抠图依赖人工反复核验、而多模态大模型(MLLM)在像素级密集预测上精度不足的瓶颈,Kiroshi 将图像解析建模为显式的 plan-and-act 智能体交互循环,通过 MLLM 输出紧凑的文本化网格动作指导动作模型进行局部注意力精修,并结合基于残差采样的轨迹偏好对齐(DPO),实现了全自动、高保真度的目标抠图与分割。

研究背景与动机

高保真图像解析(如精细语义分割与自然图像抠图)要求模型精确捕获复杂拓扑边界、透明度渐变以及发丝级细节,是 AR/VR、三维重建与内容编辑的基础支撑。然而,现有的高精度预测方案大多基于显著目标检测(如 DIS-5K)或单目标场景构建,在面对复杂多实例场景时极易出现漏抠、过抠或实例混淆。交互式抠图方法(如 ZIM、HQ-SAM)虽能借助点、框提示引导目标提取,却高度依赖人工反复核查与试错纠错,难以走向全流程自动化。

随着多模态大模型的演进,指代分割与推理分割取得了显著突破,具备了强大的文本与视觉语义对齐能力。但底层分割模块(通常基于 SAM)的分辨率瓶颈与表征粒度,限制了其在透明区域和高频发丝细节上的表达,导致预测掩码普遍过于粗糙。更深层的矛盾在于:若直接让 MLLM 产生像素级密集动作(如预测离散点坐标),其庞大的搜索空间和高度冗余的局部视觉线索会导致策略探索效率极低、反馈极不稳定;而传统稠密预测网络又缺乏高级语境推理与自省能力。

本文的切入角度是打破单次前向预测的范式,将图像解析解耦为分层的感知智能体系统:由高层 MLLM 策略负责语义理解与区域级自省决策,由底层动作模型执行高频边界像素恢复。核心 idea:将高精度图像解析建模为显式的 plan-and-act 马尔可夫决策过程,由 MLLM 策略生成器在 patch 尺度输出紧凑文本网格动作()决定“何处精修”,再由基于注意力掩码的动作模型执行像素级精修决定“如何精修”,并通过残差挖掘正负轨迹对进行 DPO 对齐,实现闭环自主感知与多轮迭代精化。

方法详解

整体框架

Kiroshi 将高精度解析表述为一个离散步长的马尔可夫决策过程(MDP)。给定输入图像 \(I\)、文本指令 \(X\) 以及初始先验(如边界框 \(B\)),系统维护一个随时间步更新的中间解析状态 \(s_t\)(分割二值掩码或抠图 alpha 哑光图)。在每个精化步骤 \(t\),策略生成器 \(\mathcal{P}\) 观察当前状态 \(o_t = (I, X, s_t)\),以文本形式输出区域级动作 \(\tau_t\);动作模型 \(\mathcal{A}\) 接收该动作并将其转换为注意力掩码,执行像素级预测更新得到 \(s_{t+1}\): $\(s_{t+1} = \mathcal{A}(I, s_t, \tau_t), \quad t=0,\dots,T-1\)$ 经过 \(T\) 轮(默认 3 轮)自省迭代后,系统输出最终高保真掩码 \(\hat{s} = s_T\)

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 I 与文本指令 X<br/>生成初始目标框 B 与初版掩码 s0"] --> B["文本化网格动作与游程编码表征<br/>MLLM 观察当前状态并生成区域网格动作 τt"]
    B --> C["网格感知动作模型与注意力掩码引导<br/>将网格动作转化为注意力掩码执行局部像素精修"]
    C -->|评估残差未收敛 且 轮次 t < T| B
    C -->|多轮精化结束 t = T| D["高精度解析输出<br/>输出高保真分割掩码或抠图 Alpha 图"]
    E["训练阶段:基于残差采样的轨迹挖掘与偏好对齐<br/>在中间状态下根据定量指标增益挖掘正负轨迹对,执行 DPO 优化"] -.->|对齐 MLLM 决策策略| B

关键设计

1. 网格感知动作模型与注意力掩码引导:以结构化区域约束替代离散点交互

传统交互式模型(如 SAM、ZIM)大多采用点击提示(positive/negative points)或包围框,实验表明此类模型对负点击极为钝感,且单点提示在高分辨率细节区域存在极大的语义歧义。为了降低搜索空间并保留完整局部结构,动作模型 \(\mathcal{A}\) 采用 DINOv2 作为视觉编码器,并结合 Mask2Former 风格的 Transformer 解码器。解码器各层在自注意力与交叉注意力计算时,直接将解调后的网格动作转化为空间注意力掩码 \(\mathcal{M}^b\): $\(\mathcal{M}^b(s) = \begin{cases} 0, & s \in \text{grid} \\ -\infty, & \text{otherwise} \end{cases}\)$ 该机制强行将注意力聚焦于策略指定的候选错误区与半透明边缘区,屏蔽背景无关特征干扰。像素解码器在此约束下联合多尺度特征逐步上采样,既避免了全局重算带来的边缘退化,又能针对发丝、孔洞及边缘走样等微观结构执行高频细节恢复。

2. 文本化网格动作与游程编码表征:将空间连续掩码离散化为紧凑语言单元

为了让语言模型直接理解并规划掩码更新,本文放弃了让 MLLM 输出高维浮点坐标的常规路线,而是将整幅图像在空间上离散化为规则网格(默认 \(32 \times 32\))。每个网格 patch 被定义为一个具备明确语义的文本单元,包含四类状态:目标前景(<human> 等目标词)、背景(<bg>)、待精修不确定区(<unknown>)以及非目标实例干扰区(<other>)。直接输出网格会导致长达 1024 个 token 的冗余序列,为此引入行向游程编码(Row-wise Run-Length Encoding, R-RLE)。同一行连续出现的相同语义 patch 会被压缩为单 token 计数形式(如一行 64 个背景块压缩为 bg*64)。得益于真实物体掩码的天然空间连续性,R-RLE 将平均动作长度压缩至数十个 token,极大减轻了 MLLM 上下文负担,使预训练多模态基座能够高效学习区域定位与误差分布判断。

3. 基于残差采样的轨迹挖掘与偏好对齐:在无密集人工标注下构建高质量 DPO 信号

尽管 SFT 能赋予 MLLM 生成结构化网格的基础能力,但模型依然无法自发感知“怎样修改才能让抠图质量更高”。为了解决像素级密集奖励建模困难的瓶颈,本文在动作模型迭代推理中设计了自监督正负轨迹挖掘机制。在给定的中间预测状态 \(s_{t-1}\) 下,系统计算当前掩码与真实标注之间的绝对残差图 \(r_t = |Y - s_{t-1}|\);筛选出非零误差像素占比超过阈值 \(\epsilon\)(默认 40%)的 patch 作为候选池,并随机下采样构建备选网格动作。动作模型执行不同的网格动作会产生不同的输出,系统根据均方误差(MSE)或 SAD 的定量变化量 \(\Delta_t = Q(s_t) - Q(s_{t-1})\) 进行判别:只有使结果显著变优的动作标记为正样本 \(\tau_t^+\),使结果变差的标记为负样本 \(\tau_t^-\)。在此基础上,借助 Qwen3-VL Plus 补充空间推理链与语义描述,生成包含 40,000 对轨迹的偏好数据集,并利用 DPO 损失进行策略优化: $\(\mathcal{L}_{\text{DPO}}(\mathcal{P}) = -\mathbb{E}_{(I,X,\tau^+,\tau^-)}\left[\log\sigma\left(\beta\log\frac{\mathcal{P}(\tau^+\mid I,X)}{\mathcal{P}_{\text{ref}}(\tau^+\mid I,X)} - \beta\log\frac{\mathcal{P}(\tau^-\mid I,X)}{\mathcal{P}_{\text{ref}}(\tau^-\mid I,X)}\right)\right]\)$ 该设计使 MLLM 在没有外部密集强化学习环境的情况下,学会了自主识别当前掩码缺陷并做出具备全局一致性收益的精化决策。

损失函数 / 训练策略

系统采用两阶段渐进式优化方案: - 动作模型训练:结合 \(\ell_1\) 损失与拉普拉斯金字塔损失(Laplacian loss),在合成抠图数据(SmartMat 规模)以及超高分辨率分割数据集 DIS-5K、UHR-SOD 上联合训练,保证模型兼具硬边界分割与半透明 alpha 估计能力。 - 阶段 I(MLLM SFT):在 RefCOCO 系列与 RefMatte 公开指代数据集上,利用膨胀与腐蚀操作构造 trimap 中的 <unknown> 标签,采用标准交叉熵损失对 MLLM 进行视觉定位与 R-RLE 文本网格生成的监督微调。 - 阶段 II(DPO 后训练):固定动作模型,利用残差采样挖掘出的 40k 条对齐轨迹对话,采用公式所示的 DPO 损失优化 MLLM 策略生成器。 - 推理期:采用 MLLM-as-Judge 范式,初始由 MLLM 提供定位框启动动作模型,随后展开 \(T=3\) 轮闭环自省与动作调用。

实验关键数据

主实验

为了公平评测多实例复杂场景下的指代抠图与分割性能,论文构建了真实世界基准 HiFiRefMS,划分抠图子集(468 张图 / 1187 掩码)与高精度分割子集(500 张图 / 1366 掩码)。下表展示了 Kiroshi 与显著性模型、交互式模型以及 MLLM 模型的综合对比:

方法 类型 / 会议 分割: \(\text{max}F_\beta \uparrow\) 分割: \(\text{MAE} \downarrow\) 分割: \(\text{HCE} \downarrow\) 抠图: \(\text{MSE} \downarrow\) 抠图: \(\text{SAD} \downarrow\) 抠图: \(\text{Grad} \downarrow\) 抠图: \(\text{Conn} \downarrow\)
IS-Net 显著性 / ECCV'22 0.749 0.086 1877 0.1134 138.7 93.44 106.8
DiffDIS 显著性 / NeurIPS'25 0.829 0.058 1386 0.0601 72.37 68.38 52.88
HQ-SAM 交互式 / NeurIPS'23 0.745 0.062 1684 0.0984 83.41 92.68 78.49
SmartMat 交互式 / CVPR'24 0.759 0.064 1633 0.0438 42.11 37.47 24.06
ZIM 交互式 / ICCV'25 0.774 0.057 1539 0.0384 36.41 27.88 17.49
LISA MLLM / CVPR'24 0.703 0.106 2384 0.1208 158.4 113.5 125.7
Text4Seg MLLM / ICLR'25 0.733 0.074 2072 0.0844 96.72 94.85 83.62
SegAgent MLLM / CVPR'25 0.739 0.089 1944 0.0903 87.19 92.33 84.36
Kiroshi (Ours) 智能体感知 / ECCV'26 0.875 0.033 1218 0.0263 26.34 23.71 13.48

消融实验

1. 策略配置与迭代轮次消融 论文验证了引入基于残差挖掘的 DPO 策略以及不同推理自省轮次的影响:

策略配置 轮次 分割: \(\text{max}F_\beta \uparrow\) 分割: \(S_\alpha \uparrow\) 分割: \(\text{HCE} \downarrow\) 抠图: \(\text{SAD} \downarrow\) 抠图: \(\text{Grad} \downarrow\) 抠图: \(\text{Conn} \downarrow\)
Vanilla (纯 Box 输入) - 0.764 0.784 1601 32.16 34.84 24.72
DPO 策略引导 1-round 0.838 0.827 1514 28.20 25.41 18.63
DPO 策略引导 (默认) 3-round 0.875 0.866 1218 26.34 23.71 13.48
DPO 策略引导 5-round 0.863 0.868 1276 25.87 24.10 13.77

2. 网格划分粒度消融 网格划分尺寸直接决定了 MLLM 空间先验指导的精细度与动作生成稳定性:

网格划分尺寸 分割: \(\text{max}F_\beta \uparrow\) 分割: \(S_\alpha \uparrow\) 分割: \(\text{HCE} \downarrow\) 抠图: \(\text{SAD} \downarrow\) 抠图: \(\text{Grad} \downarrow\) 抠图: \(\text{Conn} \downarrow\)
\(16 \times 16\) 0.862 0.854 1357 26.49 25.43 14.69
\(32 \times 32\) (默认) 0.875 0.866 1218 26.34 23.71 13.48
\(64 \times 64\) 0.820 0.809 1542 29.53 30.02 21.81

关键发现

  • DPO 轨迹对齐带来质的跃升:相比于直接使用 Grounding 预测初始框(Vanilla),即使仅引入 1 轮 DPO 网格提示,\(\text{max}F_\beta\) 也从 0.764 跃升至 0.838,SAD 误差由 32.16 骤降至 28.20。这证明利用相同上下文下的正负收益对齐策略,成功教会了 MLLM 主动锁定抠图最薄弱的半透明区域与边缘孔洞。
  • 迭代轮次存在边际效应阈值:从 1 轮提升至 3 轮时,模型综合性能达到峰值(\(\text{max}F_\beta\) 0.875,SAD 26.34,HCE 显著降至 1218)。但进一步增加至 5 轮时,过多的网格切换会引入少量噪声波动,导致指标微弱震荡,因此 3 轮是速度与精度的最优平衡点。
  • 网格尺度的权衡区间\(64 \times 64\) 网格因为块过于粗糙无法提供足够的局部精细先验,指标大幅下滑(\(\text{max}F_\beta\) 仅 0.820);而 \(16 \times 16\) 网格生成虽然空间分辨率更高,但长序列预测带来了更多的 token 幻觉与不稳定性,最终 \(32 \times 32\) 取得了最优的稳定性与引导效果。

亮点与洞察

  • 解耦“何处修”与“如何修”的双层协作机制:高层 MLLM 擅长全图多模态语境推理,但不擅长预测细粒度连续像素;底层 Mask2Former 擅长高频纹理与透明度拟合,但不具备语境常识。两者通过结构化注意力网格进行弱耦合,避免了在 MLLM 端端到端回归亚像素掩码的灾难。
  • 无需人工参与的自监督 DPO 轨迹挖掘:巧妙利用动作模型对残差采样网格的定量表现增益(\(\Delta Q > 0\) vs \(\Delta Q < 0\)),在相同图像和中间状态下直接生成极度对称的偏好对,解决了密集视觉任务中 RLHF 标注代价高昂、密集奖励难以设计的核心痛点。
  • 可复用的通用密集解析范式:将密集掩码通过 R-RLE 离散化为文本网格并作为交叉注意力掩码输入的流程,不仅适用于图像抠图与分割,还可平移扩展至医学图像病灶精修、三维高斯点云遮罩擦除或高保真图像修复任务中。

局限与展望

  • 计算开销随自省轮次线性增长:虽然 3 轮迭代能取得最优质量,但每轮均需调用一次 MLLM 策略推理与一次动作模型解码,单图耗时达到约 12.94 秒(1 轮为 7.42 秒),在强实时性应用中受限。
  • 依赖精准的初始定位:若在极小目标或严重遮挡场景下初始边界框 \(B\) 定位完全偏离,后续的局部网格精修可能被限制在局部极值无法逃逸,缺乏全局撤销或重定位机制。
  • 未来的统一端到端拓展:当前动作模型与 MLLM 策略独立训练、交替调用;未来可探索统一表征架构,直接在自回归生成过程中利用视觉 token 隐状态驱动解码器,实现单模型轻量化推理。

相关工作与启发

  • vs ZIM / SmartMat (交互式抠图): ZIM 和 SmartMat 依赖人工不断点选前景/背景提示点以消除漏抠,但多点提示在负向抑制上表现迟钝,且无法直接理解人类的自然语言指代。Kiroshi 将人工交互环节替换为 MLLM 文本自省循环,实现了从“人工交互式”向“全自动智能体闭环”的跃迁。
  • vs SegAgent / SAM4MLLM (MLLM 增强分割): SegAgent 模仿人类轨迹在像素级连续采样点提示,其动作空间庞大且容易陷入局部不收敛,底层依赖 SAM 导致无法处理发丝及半透明抠图。Kiroshi 改用 patch 级结构化注意力网格,大幅收敛了动作搜索空间,并通过残差 DPO 实现了对高频边缘的精准指导。
  • vs LISA / Text4Seg (多模态指代分割): LISA 使用特殊 token 借由 SAM 解码,Text4Seg 将分割视为纯文本生成;两者在处理自然复杂边缘与透明材质时均显粗糙。Kiroshi 引入网格感知动作模型与拉普拉斯金字塔监督,将分割边界保真度与抠图质量推向了全新标准。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [将高精度解析解耦为 MLLM 网格规划与动作模型注意力精修的 MDP,利用自监督残差构建 DPO 偏好对极具创新性]
  • 实验充分度: ⭐⭐⭐⭐⭐ [自建并重标注多实例 HiFiRefMS 高保真基准,涵盖分割与抠图全套指标,对比三类代表模型并提供跨数据集深度分析]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑架构清晰,问题切入精准,图表完整详实,数学形式化表达严谨规范]
  • 价值: ⭐⭐⭐⭐⭐ [为多模态推理模型在超高精度像素级任务中的落地提供了标杆范式,工程与学术价值极高]