跳转至

Re:Cognize: Open-Set Comic Character Re-Identification

会议: NeurIPS 2026 — ED Track(非 main track;任务包提供的会议归属)
arXiv: 2609.34032
论文: https://re-cognize.vercel.app
代码: https://github.com/eternal-f1ame/Re-Cognize
领域: 人体理解(漫画角色重识别)
关键词: 开放集重识别、流式评测、角色身份维护、图库更新、提交条件

一句话总结

Re:Cognize 用同一阅读顺序下的四种图库协议分离漫画角色的身份出现与身份维护,发现直接按预测标签扩充图库会损害随机种子下的识别,而 Re:Cast 通过角色均值、页内证据和跨页绑定,在明确条件下恢复部分正确标签更新的收益。

研究背景与动机

漫画角色重识别并不只是从一组已知人物照片中找最近邻。读者先看到几次角色,之后需要在不同姿态、遮挡和画风变化中认出他;角色名单通常不是预先完整给出的。传统闭集 Re-ID 却先为所有身份准备固定图库,再衡量查询能否找到正确参考图。这种设置能够评估视觉相似度,却不能回答系统第一次阅读一个故事时怎样建立和维护角色档案。

已有漫画专用编码器提供了可用的外观表示,因此现在可以把评测从“参考图足够多吗”推进到“新图应不应该加入”。关键障碍是图库会消费自己的预测:一次错误归档不仅答错当前查询,还可能成为后续查询的参考。作者用静态图库、预测标签更新和真实标签更新的对照,把编码器能力不足与图库接纳机制不足分开;身份首次出现则另设无标签协议诊断,不把维护结果包装成解决开放集发现。

核心 idea:图库更新的价值不由新增样本自身的正确率决定,而由它在实际改变答案的查询上,是否比原图库更准确决定;应先量清这个条件,再决定哪些流式证据值得提交。

方法详解

整体框架

输入是按数据集页码排列的角色裁剪流,输出是查询的角色身份,或在无标签协议中输出新建/已有簇。Re:Cognize 是评测框架,Re:Cast 才是针对已知角色身份维护的图库方案;两者不能混称为一个新网络。评测使用真实检测框,尚未覆盖从整页检测到最终角色命名的完整系统。

框架固定查询顺序,改变初始图库和更新权限。P1、P2、P4 衡量已知身份的维护;P3 从空图库出发,仅诊断身份出现。随机种子 Seq-R 与首次出现种子 Seq-T 具有相同标签预算,但标签在时间上的位置不同。尤其 Seq-R 可以把全卷任意位置的标注放入初始图库,并不等于严格的首次阅读监督。

Re:Cast 对随机种子使用角色均值、页内证据提交和可选种子扩展;首次出现种子缺少分散的标签锚点,因此再用跨页绑定传播一个已知身份。本文主要是协议与图库决策分析,不把四个协议画成串行网络,也不把 oracle 更新当成推理阶段可用的监督。

关键设计

1. 四协议对照:把少样本识别、图库增长和身份出现拆开测量

P1 每个角色随机拿约五分之一裁剪组成图库,其余为查询,按余弦相似度排序,报告 mAP 和 Rank-k。单裁剪角色被排除并计数。P2 每个角色保留 1 至 5 个有标签种子,图库不变,其余裁剪作为查询;样本数不超过种子数的角色只进入图库,不产生查询。

P3 不给任何身份标签,从空图库逐个处理裁剪。查询与各簇的归一化运行质心比较,最高相似度超过固定新颖性阈值就加入该簇,否则新开簇。参考阈值为 0.55,所有表示用同一个标准。它是测量工具,不是作者提出的最优聚类方法;评测同时给出簇数、Purity、NMI、ARI 和 Hungarian 匹配准确率,避免靠切成大量小簇抬高纯度。

P4 从 P2 的种子图库出发,先用当前图库给查询预测并评分,再决定是否加入。预测策略把裁剪加入其 top-1 预测身份;oracle 策略用真实身份归档,仅用于测量可恢复空间;静态策略完全不更新。每个角色保护原始种子,新增缓存上限为 50,超限淘汰最旧新增条目。

P4 报告 identity Rank-1,即 top-1 身份正确的查询比例。图库变大时,单个 exemplar 的排序位置和平均精度会随条目数变化,因此不能把 exemplar mAP 的变化直接解释为角色命名改善。所有指标先在单系列查询上计算,再对系列宏平均;系列内部仍受高频角色主导。

2. 提交条件:比较被更新接管的查询,而不是样本标签正确率

一次图库操作只会影响一部分查询:新增或改变的条目成为最近匹配,因而接管原本由旧图库回答的查询。令 \(c\) 为被接管查询占全部查询的比例,\(p_{\mathrm{eff}}\) 为更新后在这些查询上的身份准确率,\(a^{+}\) 为旧图库在同一批查询上的准确率,则整体准确率变化满足原文式(1):

\[ \Delta=c\bigl(p_{\mathrm{eff}}-a^{+}\bigr). \]

因此,在确实接管查询时,只有 \(p_{\mathrm{eff}}>a^{+}\) 才值得更新。正确归档的裁剪仍可能离其他角色更近,所以“新增条目的标签有多准”不等于“它接管查询后有多准”;旧图库整体准确率也不等于它在被接管查询上的准确率。强图库往往已经能回答那些与新裁剪相近的查询,更新反而更难超过它。

页内约束在 POPCharacters 上新增裁剪标签的正确率达 86.9%,但有效准确率只有约 31% 至 48%。Manga109 上 MagiV2 的有效准确率为 54.418%,旧图库在被接管查询上为 67.799%,接管率为 46.53%,所以净变化是 -6.23 个百分点,而不是新增标签很准就应该扩充。

这个等式是准确率差的精确分解,不是无需标签即可计算的在线置信度。作者在目标语料的一半已标注系列/卷上估计各项,再决定另一半是否更新。不同语料不能直接复用估计值;没有额外证据时,不能宣称推理系统已经知道每次更新是否满足条件。

3. 角色均值与页内证据提交:让新外观精炼档案而不是无限制造竞争条目

角色均值(cast sheet)把同一角色已归档特征合成一个 L2 归一化的运行均值,不再把每张裁剪都作为独立近邻。新裁剪改变的是一个角色原型,而不是新增一个会抢走其他角色查询的检索入口。均值本身是标准原型表示,贡献在于把它与流式接纳分析放在一起,而非发明新的均值运算。

页内证据提交要求同页分组里已有裁剪被归档到某个角色,才允许同组另一裁剪加入该角色。分组来自 MagiV2 的角色间 affinity head,每页运行一次,不重新训练;3,977 个页内配对中,同角色率为 89.9%。提交规则只咨询已经读过的裁剪,页面没有身份依据时便弃权,而不是强制把每个查询的预测当标签。

这条约束提高有效准确率,却降低可提交覆盖率,并且不保证对强图库有益。五个随机种子时,角色均值加提交比静态图库提升 3.34 至 6.51 个百分点;但 MagiV2 单独使用角色均值的 +6.81 反而略好。Manga109 上也应区分角色均值的 +2.78 与继续提交后的累计 +1.33,不能把“加模块”默认为单调改进。

种子扩展在开始查询流之前,利用同样的页内分组,补入与种子同组的裁剪,平均每个种子增加 1.43 张、标签正确率 90.6%。它改变查询集合,扩展裁剪必须从查询中删除,所以原文专门用相应静态参考评价,不宜与未删查询的列直接相加比较。

原文对单种子情况有表文不一致:第 6 节说角色均值和提交都不生效、收益来自种子扩展;表 5 却把 k=1 的 +4.71 至 +6.84 等数字放在“++ commitment”列,图注又说前两种改变重合。本笔记保留这一边界,不替作者重命名这些单种子结果,也不据此推断提交实现。

4. 跨页绑定:为首次出现种子补上离查询更近的身份参考

Seq-T 的标签集中在开头,同页提交很少碰到可用锚点。五个种子时,最近二十张裁剪中已标注比例在第一季度为 20.5%,之后低于 5%;提交覆盖率从 Seq-R 的 9.5% 降到 2.3%。只调整近期候选或图库容量无法把正确身份参考真正搬到后续查询附近。

绑定先用冻结表示按相似度对一页裁剪分组,再按阅读顺序把页内组并入最相近的历史组,或另开新组。某组遇到第一个有标签种子后,才被赋予该身份,之后成员可以按这个身份加入图库。共享 binder 使用微调后的 MagiV2 表示,页内阈值 0.7、跨页阈值 0.5,供所有五个检索骨干使用;它不需要检测器或 panel 几何。

这不是提出了新角色发现算法:身份名称仍来自给定种子,跨页组传递的是已经获得的标签。共享 binder 在 POPCharacters 的 Seq-T 上带来 12.51 至 16.94 个百分点增益;在 Manga109 上四个骨干受益,MagiV2 却损失 7.44,因为更强的静态图库超过 binder 所提供证据的质量。

绑定也可使用各骨干自己的表示。其阈值由提交条件预测的变化选择,而非按最终测得收益选取;POPCharacters 上增益为 1.73 至 8.46,低于共享 binder。共享 binder 的优势包含漫画专用表示带来的外部能力,不能解释为所有骨干自身表示都能产生同样高质量的跨页组。

损失函数 / 训练策略

Re:Cast 的图库规则没有为目标数据拟合新参数,但使用的表示和 affinity head 并非未经训练。作者另设编码器侧维护基线:冻结骨干,加可训练 BNNeck,再选择是否使用记忆块与 LoRA。这里“Finetuned”默认只训练 BNNeck,不是全量微调骨干;记忆块也不是 LoRA。

记忆块的工作记忆为每身份最近 8 个特征的 FIFO,情景记忆为每身份 5 个非参数原型。两路交叉注意力产生残差,经门控和小初始化投影加入骨干表示。推理先在所有原型中搜索,得到预测身份,再用这个预测路由工作记忆,第二遍情景记忆仍搜索全体原型;不能用真实查询标签作推理路由。P3 因没有初始图库而绕过记忆块,只测与它共同训练的 BNNeck。

训练组合原型分类、batch-hard triplet 和 InfoNCE 记忆一致性损失,权重分别为 1.0、1.0、0.1;辅助 CE 无记忆时权重 0.3,有记忆时为 0。使用 200 epochs、AdamW、学习率 \(10^{-4}\)、5 epochs warmup 和余弦退火。PK 采样通常每批 8 个身份、每身份 4 张,MagiV3 为 4 个身份;可选 LoRA 的秩为 8,只适配最后 4 层注意力,学习率 \(10^{-5}\)。

编码器记忆的收益很小且不是全部组件有效:移除工作记忆使 MagiV2/MagiV3 的 P1 mAP 相对完整块下降 0.59/0.98;移除情景记忆反而提升 0.26/0.06。原文附录 A.6 说原型保持干净的 BN 特征,算法 1 却用记忆增强特征更新 EM,两处规格不一致,复现前应核实代码而非猜补公式。

实验关键数据

主实验

主要域内训练使用 POPCharacters:13 个训练系列、2 个开发系列、8 个测试系列;测试包含 70 个角色和 4,058 张裁剪。Manga109 的 27 个保留卷包含 784 个角色、29,315 张裁剪,仅零样本迁移;Re:Verse 只有一系列、12 个角色、1,825 张裁剪,实际仅做 P1。

下表取原文表 2 的无记忆、无 LoRA Finetuned 行,POPCharacters、k=1、Seq-R、新增缓存上限 50,三次训练均值。P1 是闭集 mAP;后三列是 P4 identity Rank-1,均按百分制展示,不能跨指标直接作差。

骨干 P1 mAP P4 静态 P4 预测更新 P4 oracle 更新
TransReID 37.4 17.4 15.0 41.7
MagiV2 51.2 36.8 36.3 59.1
MagiV3 41.3 22.7 19.9 49.9
InstructReID 37.8 17.5 14.5 42.6
ReID5o 38.7 20.8 17.9 45.6

预测更新在这五行全部低于静态图库,oracle 则有很大提升空间。该结论限于随机种子;首次出现种子的一些预测更新行略有改善,不能推广成所有流式设置都必然变差。

消融实验

原文表 5 的逐步分析:POPCharacters、Seq-R、k=5,一次训练、三次种子抽样。变化列都是相对静态图库的累计百分点增益,“均值 + 提交”不是再加到上一列的增量。

骨干 静态 identity Rank-1 仅角色均值增益 角色均值 + 提交增益 oracle 增益
TransReID 23.82 +2.86 +4.27 +10.74
MagiV2 44.35 +6.81 +6.51 +15.97
MagiV3 32.88 +1.47 +3.34 +11.83
InstructReID 25.38 +1.49 +3.74 +9.66
ReID5o 28.68 +1.71 +3.74 +10.47

以下取表 6 的 Seq-T、k=5 绑定分析。POPCharacters 静态列仅保留原文一位小数;Manga109 列也是相对其各自静态图库的百分点变化,不使用 POPCharacters 静态列作基准。

骨干 POPCharacters 静态 共享绑定:POPCharacters 自身绑定:POPCharacters 共享绑定:Manga109
TransReID 20.7 +14.32 +4.96 +10.32
InstructReID 20.4 +15.45 +4.60 +10.34
ReID5o 20.9 +16.94 +2.52 +10.35
MagiV3 26.5 +16.45 +1.73 +8.00
MagiV2 37.4 +12.51 +8.46 -7.44

关键发现

  • 一个种子能恢复接近 P1 的 mAP,不代表角色命名接近解决:记忆配置的 P2 mAP 为 P1 的 102% 至 107%,但 Rank-1 仅为 43% 至 66%。不同图库大小和身份频率分布改变了指标基线。
  • P3 在阈值 0.55 下,TransReID/MagiV2 每系列产生 95.8/38.9 个簇,对应真实身份均值 8.8,ARI 百分制为 2.0/24.0。高纯度不能掩盖角色被过度拆分。
  • 标注目标语料一半系列/卷的 200 次随机拆分中,提交条件对表 4 七种设置的六种都判断对另一半的收益方向;剩余 MagiV2/POPCharacters 效应只有 -0.04。把 POPCharacters 的量直接迁移到 Manga109 则会预测 +0.33,实际为 -6.23。
  • 表 21 保留的是配对差值而非显示均值的简单相减:例如 MagiV2 完整块 51.75、移除工作记忆 51.15,原文差值写 -0.59。显示精度存在不一致,应保留原报告而不是改成 -0.60。

亮点与洞察

  • 更新应该与旧系统竞争,而不是只看自身置信度:同样的提交证据可以帮助弱图库、伤害强图库。把评价集中到实际被接管查询,解释了为何 86.9% 的新增标签正确率仍不足以保证正收益。
  • 标签位置是少样本问题的一部分:Seq-R 和 Seq-T 的标签数量相同,离查询的距离却不同。跨页绑定的价值是把一个已知身份的参考传播到后续页面,而不只是增加图库容量。
  • 负结果没有被藏进总分:记忆块对排名和 top-1 命名的影响不同,情景记忆没有贡献,强骨干也会被更新拖累。分别报告这些量比只挑最高 mAP 更能指导系统设计。

局限与展望

  • 论文只对身份维护提出方法性结论;P3 固定阈值诊断并未解决新角色出现、簇合并和身份命名,标题中的 open-set 不应被读作这些问题全部解决。
  • 所有证据来自日本漫画和真实检测框,没有早期篇章对晚期篇章的外观演化切分,也没有完整检测流水线。合成偏移/模糊实验不能替代真实检测误差、漏检和错误页面顺序。
  • 提交条件需要目标语料上的标注切片估计。能否在无标签部署中稳健估计有效准确率及原图库反事实准确率,仍是未解决的实际问题。
  • 共享 binder 依赖较强的 MagiV2 表示;在强图库上出现负收益,说明绑定质量、原图库质量和语料分布必须共同验收,不能无条件开启。
  • 记忆块在 768 维下增加 10.1M 可训练参数,已实现的两遍路径因重复骨干前向,成本为骨干单独推理的 2.5 至 3.1 倍。这个成本属于编码器记忆基线,不应误算成 Re:Cast 角色均值的成本。
  • 原文存在单种子提交/扩展命名以及 EM 更新特征规格不一致。正式复现应对照公开实现;笔记不以自行修补的公式或重标表格消除疑点。
  • 漫画页与裁剪受各自研究许可约束,论文许可不等于原始漫画图像可再分发。这里只概述技术与结果,不复制漫画画面或台词,也不把虚构角色识别泛化为真实人物识别能力。

相关工作与启发

  • vs TransReID/InstructReID/ReID5o:这些骨干提供不同预训练来源的表示,本文重点是让同一表示在四种图库条件下接受检验。编码器侧的小幅提升不能替代图库接纳规则。
  • vs MagiV2/MagiV3:漫画专用表示在同一聚类规则下体现更好的身份结构,也是页内分组和共享绑定的重要资源。本文复用其能力,而非从零训练全新的漫画视觉系统。
  • vs 原型网络:角色均值仍是标准类原型,区别在于支持集随着阅读流变化,接纳错误会影响后续查询。因此可迁移的启发是评估支持集更新的净收益,而不是仅复用均值池化。
  • vs 伪标签自训练/模板更新:传统规则常以单样本置信度决定是否接受,本文比较更新与旧图库在被接管查询上的条件准确率。对跟踪或参考库自增长有分析启发,但本文没有实验证明其跨任务有效性。

评分

  • 新颖性: 4/5 — 四协议统一评测与接纳问题的条件分析,比均值原型本身更有贡献。
  • 实验充分度: 4/5 — 五骨干、跨语料和大量负结果,但真实检测及长期外观演化仍缺失。
  • 写作质量: 3/5 — 主线清楚,单种子归因与记忆更新规格存在表文不一致。
  • 价值: 4/5 — 为漫画检索和角色档案维护提供明确测量框架,尚非完整开放集阅读系统。