跳转至

Beyond Script Family Boundaries: Towards Unified Open-Set Scene Text Recognition

会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
代码: https://github.com/lancercat/uni-zero
领域: 多模态 VLM
关键词: 场景文本识别、开集识别、零样本学习、多语系统一表征、字形原型网络

一句话总结

提出首个跨语系统一开集场景文本识别框架,通过 CAM-CTC 联合对齐、动态字形原型匹配与异构字词双层协同训练,首次实现单个模型在 CJK、印度语系与低资源彝文上的零样本跨语系开集识别。

研究背景与动机

通用视觉语言模型(如 Gemini、ChatGPT 系列)在英文、中文等高资源文字的文档和场景文本转录上已展现出极强能力,但在面对字形繁多、长尾且极度匮乏数字语料的少资源文字时,依然存在严重的性能塌陷。商业 VLM 即使分词词表已覆盖稀有文字的 Unicode 码位,但在对具体字形笔画与轮廓进行细粒度对比时经常完全退化,产生严重幻觉。这类退化暴露出基础多模态模型无法稳固建立字符“同形归一”(to be)与“异形互斥”(not to be)的底层度量边界。

针对未见字符的开集与零样本文字识别技术被寄予厚望,但现有探索几乎完全局限在以汉字为核心的 CJK(中日韩)语系内部。现有零样本汉字识别严重依赖部首拆解、笔画分解或特定结构树等特定语言的先验知识,这套先验不仅无法外推至无部首结构的文字,更无法识别并剔除数据流中未经注册的“未知中的未知”(unknown unknown)字符。尽管近年开集文本识别(OSTR)引入了拒识机制,但其实验评测仍拘泥于平假名、片假名或韩文等近缘文字,缺乏处理结构迥异的不同文字语系(如连写复杂的印度语系、独立音节的彝文)的通用架构。此外,跨语系联合训练常常引发不同文字间的特征表示冲突,导致模型顾此失彼甚至发生梯度崩溃。

为了打破语系壁垒并回答开集文字识别能否走出 CJK 的核心问题,本文从表征解耦与联合对齐的底层机制切入:既然人类识别未知符号依靠的是通用的轮廓匹配与字形视觉基元,那么模型同样可以通过共享视觉骨干、隔离语系统计分布、并引入时序弹性的特征采样,建立统一的字符度量空间。核心 idea:构建跨语系统一的多任务异构协同训练开集文字识别框架,以 CAM 注意力掩码结合 CTC 损失化解复杂布局切分难题,并融合字级字形度量与词级重排扰动协同训练,使单模型首次具备覆盖 CJK、印度语系及极稀有彝文的零样本识别与开集拒识能力。

方法详解

整体框架

本文提出的统一开集场景文本识别框架旨在用一套部分共享的模块池,统一处理具有异构排版与极端字形差异的多语系文字识别任务。整体框架包含两大类任务流:字符级合成识别任务与词级场景识别任务。每个任务组织为特定的语系分支,拥有各自的 Region of Interest(RoI)特征提取器、原型生成模块(\(mkproto\))以及开集分类器(\(OSC\))。

输入场景图像首先经过部分共享的卷积特征提取骨干,骨干网络共享核心卷积权重以复用通用低阶轮廓特征,但为每个特定语系挂载独立的域特化批归一化(Domain-specific Batch Normalization, BN)层,防止跨语系色彩与笔触分布互相干扰。随后,提取到的特征金字塔塔身输入采样器:字符任务采用浅层卷积前景采样器提取单字表征;词级任务则采用卷积注意力模块(CAM)动态生成时序注意力掩码序列。不同于以往依赖位置解码器预测固定序列长度的方案,本文将 CAM 抽取的 RoI 序列接入 CTC 目标优化,彻底摆脱了严格单字分割的先验假设。在判定阶段,原型模块将动态输入的字形渲染图转化为 L2 归一化的类别中心向量,开集分类器通过余弦相似度比对以及可学习的双曲正切未知阈值,同时输出类别预测或 [unk] 拒识决策。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:场景文本图像与候选字形模板"] --> B["语系特化归一化与任务分组<br/>共享主干卷积层 + 插入独立BN层"]
    B --> C["CAM-CTC 联合对齐流水线<br/>注意力空间采样 + CTC非严格对齐损失"]
    C --> D["动态原型网络与开集分类器<br/>字形编码生成中心向量 + tanh未知阈值拒识"]
    E["异构字词合成协同训练<br/>全字集字形交叉熵 + 词级Unicode重排CTC"] -.->|端到端多任务联合反传| C
    E -.->|端到端多任务联合反传| D
    D --> F["输出:闭集已知转录序列 / 开集未知样本拒识"]

关键设计

1. 语系特化归一化与任务分组:隔离语族表征冲突与梯度退化

将不同语系(如拉丁语、汉字、梵文衍生文字)直接塞入同一个单体模型训练时,往往会遭遇显著的负迁移与性能崩溃。印度语系的音节组合通常带有多方位的上下辅音结合符,其纹理密度和字符长宽比与象形方块汉字差异极大。为解决多语系联合优化中的表征撕裂,本文在共享卷积骨干特征提取能力的同时,为每一个语系子集(如 CJK、主要印度语、旁遮普语、泰米尔语、英文合成集等)分别维护独立的 Batch Normalization 参数组。在特征提取阶段,根据当前输入样本所属的语系分支动态挂载对应的 BN 层: $\(M = \text{ImEnc}(I^{dom}, BN^{dom})\)$ 不仅如此,作者通过实验发现印度语系内部也存在严重互斥,因此进一步把冲突极大的旁遮普语(Gurmukhi 字母)和泰米尔语从通用印度语主干中抽离为独立子任务,在保持底层几何特征共享的前提下彻底阻断了不同文字统计方差引起的梯度恶性震荡。

2. CAM-CTC 联合对齐流水线:兼顾局部注意力掩码与序列无序弹性

在跨语系零样本场景下,模型从未见过目标文字的字符边界和组字规律。传统基于位置的解码器(如 OpenCCD)必须显式对齐每一个字符位置并预估词长,一旦遇到连写、上下重叠或字距极度不均匀的未见文字(如孟加拉语或古吉拉特语),注意力中心稍有漂移便引发全序列预测崩塌;而单纯依靠一维高度压缩后接 CTC(如 Rosetta)又丢失了复杂的二维笔画空间分布。本文创新性地将卷积注意力模块(CAM)与时序连接分类(CTC)深度结合: $\(A = S^{seq}_{dom}(M) = \text{CAM}(\text{SpatialEmb}(\text{detach}(M)))\)$ $\(F^{dom}[t] = \frac{A[t] \cdot M[2]}{\sum A[t]}\)$ CAM 模块引入空间二维位置嵌入,基于特征塔底层 \(M\) 生成时序 RoI 掩码序列 \(A\),并在高层特征图 \(M[2]\) 上加权采样出字符表征序列 \(F^{dom}\)。更关键的是,模型不再要求掩码严格对齐单个字符物理边界,而是由后续 CTC 损失自动搜索无对齐的时序最优路径。这种设计允许注意力采样器在遇到未见结构时产生重叠或非严格分割,从而兼具二维局部分割的高分辨率感知与 CTC 的无序弹性容错能力。

3. 动态原型网络与可学习未知阈值分类器:解耦字符注册与开集拒识边界

为实现无需微调即可识别任意未见文字的开集能力,模型必须能够即插即用式注入新字符的类别中心。原型生成模块(\(mkproto\))接收未见文字的单一字形标准渲染图 \(I^{tem}\),利用专用的字级 RoI 提取模块与特化 BN 计算出原始原型嵌入 \(p_{raw}\),并在头部拼接可学习的 CTC 空白符号 [-] 控制嵌入 \(E_{sp}^{sg}\),最后经过 L2 归一化后存入原型缓存池: $\(p = \text{normalize}([E_{sp}^{sg}, p_{raw}])\)$ 在开集分类器(\(OSC\))中,模型摒弃了传统固定维度的全连接分类层,改为计算特征序列 \(F[t]\) 与各原型 \(p[j]\) 的余弦相似度。为了精准拒识不在注册名单内的未知字符,模块引入标量形式的可学习未知阈值参数 \(th_{[-]}\),通过双曲正切函数将其映射为平滑的未知分数 \(\tanh(th_{[-]} )\) 拼接入相似度向量: $\(s^{class}[t, i] = \|F[t]\|_2 \max_{y_t[j]=i} [\text{cosine}(F[t], p[j]), \tanh(th_{[-]})]\)$ 式中特征向量的模长 \(\|F[t]\|_2\) 并不改变各候选类别的相对相似度排序,而是作为动态自适应的温度系数调整 Softmax 分布的极化程度。当场景中的字符与已注册字形都不匹配时,其最大余弦相似度低于未知阈值,模型即可稳定触发 [unk] 标签,有效遏制了未见符号的胡乱转录。

4. 异构字词双层协同训练:打通微观字形基元与宏观语义重排表征

开集文字识别的泛化瓶颈在于真实标注数据覆盖的字符集与排版样式有限。本文设计了一套解耦的异构合成数据生成体系,在字级与词级同时开展协同训练。在字级层面,生成器渲染支持全量 Unicode 字形的纯黑白轮廓,通过去重机制剔除占位符空字形(将覆盖超过 5 个不同 UTF 码位的相同形状作为缺失占位符过滤),每批次动态采样 64 个字符类别,分别生成字形模板和经形变加噪的样本图像,施加交叉熵损失强迫模型学习跨字体跨语系细粒度几何比对能力。在词级层面,直接打散复用真实词库中的词汇,将其拆解为 Unicode Grapheme 基元并在词内打乱顺序,再挑选支持全字符的系统字体动态栅格化并融合复杂场景背景。这种字级专注局部笔形判别、词级专注多变字符时序组合的异构多任务联合反传,使得共享特征骨干对跨语系的视觉基元形成了极高的抽象泛化度。

一个完整示例

以识别带有生僻字符的合成彝文词图像为例,模型推理流程如下: 1. 字形模板注册:在推理前,系统载入彝文规范字符集的 1,165 个标准字形图片,通过冻结的原型生成模块 \(mkproto\) 抽取并缓存为 1,165 个维数为 \(d\) 的归一化原型向量 \(p\)。 2. 场景特征提取与掩码采样:输入一张 4 字长的彝文自然场景词图片(尺寸 \(32 \times 128\)),经过共享骨干与 CJK/通用分支的 BN 层提取特征塔 \(M\);CAM 采样器根据空间布局输出一系列时间步注意力掩码,在 \(M[2]\) 上聚合得到长度为 \(\max T\) 的字符表征向量序列 \(F[t]\)。 3. 相似度比对与阈值判别:在每个时序节点 \(t\),计算 \(F[t]\) 与 1,165 个彝文原型以及可学习未知阈值 \(\tanh(th_{[-]} )\) 的相似度。若前 3 个字符与注册字形高度吻合,对应的余弦相似度均在 0.85 以上(大幅超过未知阈值 0.35),则归属于对应的彝文字符类别;若第 4 个字符被严重遮挡损坏或不属于现代彝文规范字集,其与所有原型的相似度均低于 0.35,此时 \(\tanh(th_{[-]} )\) 胜出,输出 [unk]。 4. CTC 束搜索解码:输出的时序概率矩阵通过 CTC Beam Search 解码,滤除重复标签与空白符 [-],最终输出前 3 个字符的准确 Unicode 转录并标出末尾未知拒识,成功避免了传统 VLM 编造虚假字词的严重幻觉。

损失函数 / 训练策略

整个多任务框架在训练时端到端联合优化三类损失函数: 1. 合成字符级交叉熵损失: $\(L_{char} = \text{CrossEntropy}(OSC(FE_{seq}(I_{char}, BN^{sg}, S_{char}^{sg}), mkproto(I_{tem})), y_{char})\)$ 2. 真实词级场景 CTC 损失: $\(L_{word} = \text{CTC}(OSC(FE_{seq}(I_{real}, BN^{sg}, S_{seq}^{sg}), p_{batch}), y_{real})\)$ 3. 合成重排词级 CTC 损失: $\(L_{syn} = \text{CTC}(OSC(FE_{seq}(I_{syn}, BN_{syn}^{sg}, S_{seq}^{sg}), p_{batch}), y_{syn})\)$ 总损失为各激活任务分支损失的加权和。所有模型均在 PyTorch 框架下训练 140,000 次迭代,优化器采用 AdamW,批次内支持多任务交替或联合梯度累加。

实验关键数据

主实验

论文评测了广义零样本学习(Generalized Zero-Shot Learning, GZSL)设置下的词准确率(ACR)。在日语(JPN)、韩语(KR)、彝文(Yi)以及未见的印度语系孟加拉语(BEN)和古吉拉特语(GUJ)上与主流方法进行全面对比:

方法 JPN (ACR) KR (ACR) Yi (ACR) BEN-Val GUJ-Val BEN-Test GUJ-Test 说明
OpenCCD (CVPR 2022) 41.31 - - - - - - 局限于 CJK 语系
SAVR (ICDAR 2023) 42.58 - - - - - - 依赖视觉重构
CFOR (T-IP 2024) 44.47 22.14 - - - - - 单字体全量预训练
WnA-XL (ICDAR 2025) 48.02 24.00 - - - - - 动态 MoE 专家路由架构
Ours-CJK (仅中文字词+合成) 45.92 23.32 16.10 - - - - 单一密集架构输入 32×128
Ours-IND (仅印度语系+合成) - - - 8.04 7.52 6.82 8.68 验证印度语系迁移
Ours-Uni (全语系统一模型) 46.30 22.84 14.22 12.88 9.72 9.02 10.04 跨语系统一模型
ChatGPT-5.2 (50 张测试子集) - - 0.00 - - - - CER 148.44%,产生完全幻觉

在 50 张稀有彝文抽样测试集上,商业大模型 ChatGPT-5.2 在给定完整 1,165 字符候选集的情境下测试词识别准确率(ACR)为 0%,字符错误率(CER)高达 148.44%(预测超出真实长度导致 CER > 100%);而本文的 Ours-Uni 架构取得了 18.00% 的 ACR 以及 48.67% 的 CER,展现了专用开集模型在长尾语系细粒度字形判别上的不可替代性。

在带有未注册字符的开集文本识别(OSTR)基准测试(如日语平假名/片假名/罕见汉字混合场景)中,Ours-Uni 取得了 75.38% 的词准确率、78.34% 的拒识召回率、94.59% 的拒识精确率以及 85.70% 的 F-measure,证明该模型在跨语系大幅扩展字符集的同时,未牺牲开集拒识精度。

消融实验

1. 词识别流水线结构与对齐机制消融(对比不同采样与对齐方案在零样本文字上的 ACR 表现):

流水线结构 采样方式 (Sampling) 对齐方式 (Alignment) ACR (JP) ACR (KR) ACR (Yi) ACR (Bengali) ACR (Gujarati)
OpenCCD-like CAM (二维注意力) Position-wise (逐位置解码) 41.59 15.62 5.73 2.81 2.30
Rosetta-like Squeeze (高度压平) CTC (时序分类) 41.79 12.65 6.68 3.36 5.17
Ours (本文方案) CAM (二维注意力) CTC (时序分类) 42.36 19.18 8.51 4.74 5.98

2. 异构合成协同训练策略消融(在未见语系上的 ACR 增益对比):

训练配置 词级合成 (Word) 字级合成 (Char) ACR (JP) ACR (KR) ACR (Yi) 说明
基线 (No Co-training) 否 否 42.36 19.18 8.51 仅真实数据训练
双倍批大小 (2X Batch size) 否 否 43.39 16.60 7.49 样本总数与词合成相当,未见字性能反降
仅词级协同 (LSCT-Word) 是 否 44.24 21.87 11.42 词内重排增强上下文鲁棒性
仅字级协同 (LSCT-Char) 否 是 45.17 23.30 12.05 纯单字全字形度量能力提升
完整异构协同 (LSCT-Full) 是 是 46.08 23.50 17.07 双层协同激发最大跨语系泛化潜力

关键发现

  • CAM 与 CTC 的互补性不可或缺:单纯依赖逐位置解码(OpenCCD)在未见印度语系上崩溃严重(孟加拉语仅 2.81%),而压平特征做 CTC(Rosetta)又无法捕捉精细字形;CAM 提供局部高保真注意力掩码,CTC 赋予时序弹性,二者结合使得未见韩文暴涨 +6.53%,孟加拉语提升 +1.93%。
  • 合成协同训练绝非简单增加样本量:单纯将基线模型的 Batch Size 翻倍(2X Batch size),虽然由于见过的字符更多使日文略增 +1.03%,但在完全未见字符的韩文和彝文上分别骤降 -2.58% 和 -1.02%;相反,词级与字级异构数据协同训练(LSCT-Full)在彝文上取得了 +8.56% 的惊人绝对增益(从 8.51% 翻倍至 17.07%),表明几何基元对齐与无序排版合成才是跨语系泛化的真正源泉。
  • 语系内部的负迁移与极化效应:在印度语系实验中,将所有语系合并为单任务训练会导致孟加拉语、古吉拉特语、奥里亚语几乎完全归零(ACR ≤ 0.04%);而将冲突严重的旁遮普语与泰米尔语独立拆分后,全语系指标全面复苏(泰米尔语从 0.12% 恢复至 77.59%)。同时,加入非印度语系联合训练的 Ours-Uni 使得孟加拉语验证集 ACR 进一步从 8.04% 提升到 12.88%,印证了不同语系间的视觉特征共享具有精细的边界条件。

亮点与洞察

  • 跳出 CJK 语系舒适区:首次将场景文本开集识别框架拓展到完全异质的 CJK、印度语系、拉丁语及超大字符集彝文体系,验证了基于字符级字形原型的度量学习在跨语系下的可行性。
  • CAM-CTC 混合对齐结构:巧妙化解了“严格单字切分在未见文字上必然漂移”与“一维压平丢失细粒度笔画”的天然矛盾,用二维局部掩码结合无序 CTC 损失实现了免分词的柔性定位。
  • 击中通用多模态大模型的盲区:在当前顶尖商用 VLM(ChatGPT-5.2)出现 0% 识别率且幻觉横生的极度长尾文字场景下,本文仅使用轻量紧凑的端到端开集判别模型即取得了关键突破,为数字文化遗产保护与长尾文字识别提供了高可靠的技术基线。

局限与展望

  • 极端几何与艺术字鲁棒性依然受限:模型在输入极度模糊、旋转畸变或强艺术字体时,倾向于触发未知拒识,这虽然避免了文字幻觉,但也揭示出当前 CAM 模块的空间变换适应力仍有提升空间。
  • 语系冲突机制尚待理论建模:印度语系内部的互斥极化现象目前主要依靠人工经验进行任务分支拆分,未来需要引入自适应动态 MoE 路由或软聚类任务分组机制,实现全自动的跨语系冲突平抑。
  • 语系与模态覆盖仍未完全饱和:当前实验仅覆盖了印刷印刷体与场景招牌文字,尚未深入到历史手写文献领域;同时阿拉伯语系等带有严苛词内连写形态的语族尚未纳入评估体系。

相关工作与启发

  • vs WnA (ICDAR 2025):WnA 采用复杂的多方向混合专家系统(MoE)且测试时支持动态输入分辨率,在 CJK 上性能略高;本文在无动态路由、采用固定 \(32 \times 128\) 单一小分辨率的前提下取得了紧咬 WnA 的精度,且具备开箱即用的跨语系通用性。
  • vs CFOR (T-IP 2024):CFOR 依赖整套 Noto 字体全量单字做单调的无上下文预训练,仍局限在 CJK/拉丁语系内;本文引入了真实的词级上下文打乱重排机制与多语系特化 BN 隔离,在更广泛的真实场景和印度语系上展现了卓越的域外迁移力。
  • vs OpenCCD (CVPR 2022):OpenCCD 使用显式逐字符位置解码器并预测字符序列长度,无法应对未见文字字符粘连与重叠;本文保留了 CAM 注意力思想但彻底换装 CTC 目标函数,消除了对字符长度先验与刚性边界的依赖。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次跨出 CJK 语系边界,构建统一的多语系开集文本识别架构,开辟了低资源文字的零样本评测基准]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖日、韩、彝文及多种印度语言,对比包括商用顶尖 VLM、经典及最新 SOTA 开集识别方法,消融实验详实透彻]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,针对核心科学问题的提出与剖析非常清晰,实验发现诚实自洽,图表信息充实]
  • 价值: ⭐⭐⭐⭐⭐ [对打破当前 OCR 集中于高资源文字的偏见、解决稀缺文字识别中大模型幻觉与技术排斥问题具有很高的实用与学术价值]