跳转至

Embedding Rotation Invariance for Provable Multi-Oriented Scene Text Recognition

会议: ECCV 2026
论文: ECCV 原文
领域: NLP 理解 / OCR
关键词: 场景文本识别、旋转不变性、交叉注意力、多方向文本识别、群等变卷积

一句话总结

针对多方向场景文本识别中依赖显式朝向预测与数据增强导致误差累积和推理负担的问题,本文提出 RISTER,在编码器嵌入旋转等变性(群等变卷积与自注意力结合的 RELG)、在解码器嵌入旋转不变性(基于交叉注意力的 RITD),构建了具有理论保证的端到端旋转不变识别系统,在多方向基准上准确率大幅领先 SOTA 达 4.0%。

研究背景与动机

场景文本识别(Scene Text Recognition, STR)是将自然场景图像中的文字转换为机器可读文本的核心技术,广泛应用于自动驾驶、视觉环境理解与具身智能等场景。随着通用语言建模与视觉语言对齐技术的推进,常规从左至右的水平文本识别准确率已达到极高水平。然而,真实环境中的文字通常以多样化的朝向呈现。即便现代文本检测器通常采用最小外接矩形或多边形轮廓紧密贴合文本框,裁剪出的文本实例仍不可避免地带有显著的轴向偏转与镜像翻转,其中尤以 0°、90°、180° 和 270° 等典型角度(canonical angles)最为普遍。现有主流识别器强假设输入为水平排列,面对多方向输入时极易输出崩溃结果。

为了解决多方向文本识别,现有方法主要采用两类路线:一是引入外部显式朝向感知与几何校正模块(如基于 TPS 变换的 ASTER、ESIR 或方向分类器),二是采用多方向特征抽取与方向数据增强(如 AON)。然而,这些方案存在三大核心矛盾:其一,缺乏理论保证,外部校正模块一旦对文字朝向预测失误,后续识别便面临无法挽回的误差累积;其二,额外的校正网络或多方向多分支编码带来沉重的推理计算负担与延迟;其三,高度依赖昂贵的旋转数据增强,迫使模型用有限的表征容量去拟合多角度特征,反而削弱了在常规水平样本上的特征利用效率。

因此,摆脱经验主义的外部校正网络、在神经网络架构内部实现内生且可证明的旋转不变映射成为极具价值的切入点。核心 idea:将多方向文本识别的旋转对称性显式分解,在特征提取编码阶段嵌入旋转等变性(Equivariance),在序列解码阶段证明并利用交叉注意力的内生旋转不变性(Invariance),二者级联构建具有严格数学保证的端到端旋转不变场景文本识别网络 RISTER。

方法详解

整体框架

RISTER 整体遵循 Encoder-Decoder 范式,但系统级重构了特征与文本空间的对称变换映射。给定输入图像 \(x\),编码端通过旋转等变局部-全局特征提取网络(Rotation-Equivariant Local-Global Extractor, RELG)提取兼具局部几何细节与字符间依赖的视觉特征 \(F\);解码端则通过旋转不变文本解码器(Rotation-Invariant Text Decoder, RITD)自回归生成目标字符序列。当输入图像发生任意空间旋转时,RELG 提取的视觉特征与交叉注意力图呈现严格的等变变换,而交叉注意力输出在解码后保持不变,从而达成完全严格的端到端旋转不变性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入图像 x<br/>(128×128, 支持多方向)"] --> Stage1["阶段1-3: 旋转等变局部特征提取<br/>F-Conv局部块 (C4群) + 渐进式合并下采样"]
    Stage1 --> Stage2["阶段4: 旋转等变全局依赖建模<br/>多头自注意力 (MHSA) 捕获字符间关系"]
    Stage2 --> Feat["等变视觉特征 F<br/>(c×h/8×w/8, 随输入严格旋转等变)"]
    Feat --> CrossAttn["交叉注意力内生旋转不变映射<br/>Query固定,Key/Value随F等变,输出Q'严格不变"]
    FixedQ["历史解码字符 y_{0:t-1}<br/>固定Query生成 (Embedding+MHSA+MLP)"] --> CrossAttn
    CrossAttn --> Out["输出分类与序列预测<br/>MLP映射 + argmax迭代输出字符"]

关键设计

1. 旋转等变局部-全局特征提取网络(RELG):兼顾几何细节与字符依赖

现有的旋转等变网络(如纯卷积 G-CNN、PDO-eConv 或纯 Transformer LieTransformer)无法直接适配场景文本识别。纯卷积等变网络缺乏全局感受野,无法建模长序列字符间的语言依赖;而现有的等变 Transformer 往往依赖浅层词元化下采样,会丢失文本细粒度笔画与几何细节。RELG 针对性地解耦为局部与全局两阶段:在局部提取阶段,采用基于离散旋转群 \(C_4\) 的傅里叶级数滤波参数化卷积(F-Conv)堆叠局部块(Local Block),通过三阶段步长为 2 的 Merging 模块实现渐进式空间降采样(分别降至原图的 1/2、1/4、1/8)与通道扩展(96、192、384);在全局提取阶段,利用多头自注意力层天然具备的旋转等变特性,构建全局块(Global Block)对高层语义特征实施全图上下文交互,既完全保留了笔画几何形态,又注入了字符间上下文关系。

2. 交叉注意力的内生旋转不变性证明:解耦几何坐标与特征聚合

传统注意力解码器在输入旋转后往往失效,通常被认为是注意力机制无法感知几何所致。本文深入分析发现,标准交叉注意力机制本身定义在一个无序特征集合(unordered feature set)之上,天然具备对输入空间置换与旋转的内生不变性。若 Query 词元向量 \(Q\) 保持固定,当视觉特征输入 \(F\) 经历任意空间旋转矩阵 \(R_\theta\) 作用时,线性投影生成的键 \(K\)、值 \(V\) 以及注意力权重分布图 \(A\) 同步发生严格等变的空间重排。在连续注意力求和运算中,这种空间变换仅对应积分变量的置换,因此聚合后的上下文向量 \(Q'\) 严格守恒: $\(\mathcal{C}(Q, R_\theta(F)) \equiv \mathcal{C}(Q, F)\)$ 该数学性质在 \(C_4\) 离散典型角度(0°、90°、180°、270°)下严格精确成立,在任意连续角度下亦具备高度近似性。这为构建无需空间校正模块的轻量解码器奠定了坚实的理论基石。

3. 旋转不变文本解码器(RITD):基于固定 Query 的自回归序列生成

要让交叉注意力的理论不变性在完整解码过程中成立,必须严格保证输入交叉注意力的 Query 向量不受输入图像旋转的任何扰动。RITD 确立了两大核心准则:必须使用交叉注意力完成跨模态特征查询,且交叉注意力的 Query 必须独立于图像空间几何。具体实现中,在解码时步 \(t\),历史已预测的字符前缀序列 \(y_{0:t-1}\)(以起始符 \(y_0=\text{<s>}\) 起始)经过词嵌入层、固定多头自注意力与前馈网络,提取完全由字符语义先验驱动的查询向量 \(Q_{0:t-1}\): $\(Q_{0:t-1} = \text{MLP}(\text{MHSA}(\text{Embedding}(y_{0:t-1})))\)$ 随后以当前步查询向量 \(Q_{t-1}\) 去检索等变视觉特征 \(F\),经由前馈分类头直接预测下一字符类别 \(y_t = \text{argmax}(\text{MLP}(\mathcal{C}(Q_{t-1}, F)))\)。由于已生成字符与语言模型不包含任何图像空间坐标信息,Query 的严格旋转不变性与视觉特征的等变性相互咬合,使得整个自回归生成轨迹在图像旋转前后完全恒等。

损失函数 / 训练策略

模型采用标准自回归序列交叉熵损失函数(Autoregressive Cross-Entropy Loss)端到端训练: $\(\mathcal{L}(\mathcal{W}) = -\mathbb{E}_{(x, y)\sim\mathcal{D}} \sum_{t=1}^{L} \log p_{\mathcal{W}}(y_t \mid y_{<t}, x)\)$ 其中 \(\mathcal{W}\) 为模型全部可训练参数,\(L=25\) 为最大解码序列长度。得益于架构内生提供的旋转对称性约束,RISTER 在训练阶段完全无需引入旋转数据增强,仅需在纯正向/常规图像上训练即可自然泛化至多方向场景,大幅提升了训练收敛速度与参数表征效率。训练使用 AdamW 优化器,权重衰减为 0.05,批大小为 512,配合 OneCycleLR 调度器训练 20 个 epoch。

实验关键数据

主实验

论文在涵盖 14 个常用基准及挑战性多方向数据集上进行了全面评估。训练仅采用包含 3.2M 图像的真实场景数据集 Union14M-Filter,未引入任何旋转合成样本。评估指标统一采用忽略大小写的整词准确率(Word Accuracy Ignore Cases, WAIC)。下表对比了常见基准(Common Benchmarks)与挑战性基准(Union14M-Benchmarks)的表现:

数据集分类 具体数据集 本文 (RISTER-L) 本文 (RISTER-S) 之前 SOTA (SVTRv2 / IGTR) 提升 / 优势
常规基准 (CoB) IC13 98.9% 98.4% 98.7% (SVTRv2) +0.2%
常规基准 (CoB) SVT 98.1% 97.8% 98.4% (IGTR) -0.3%
常规基准 (CoB) IIIT5k 99.0% 98.6% 99.2% (SVTRv2) -0.2%
常规基准 (CoB) IC15 90.6% 90.0% 91.0% (SVTRv2) -0.4%
常规基准 (CoB) SVTP 95.7% 95.5% 94.7% (IGTR) +1.0%
常规基准 (CoB) CUTE80 97.6% 97.2% 99.0% (SVTRv2) -1.4%
多方向 (U14M-MO) Multi-Oriented (MO) 96.6% 96.0% 92.6% (IGTR) / 89.5% (SVTRv2) +4.0%
挑战基准 (U14M-B) Curved (CUR) 94.1% 92.5% 91.0% (SVTRv2) +3.1%
挑战基准 (U14M-B) Artistic (ART) 79.4% 76.7% 78.7% (SVTRv2) +0.7%
挑战基准 (U14M-B) Contextless (CTL) 80.6% 77.8% 81.3% (SVTRv2) -0.7%
挑战基准 (U14M-B) Salient (SAL) 90.3% 87.8% 85.9% (SVTRv2) +4.4%
挑战基准 (U14M-B) Multi-Words (MTW) 87.4% 84.6% 85.1% (SVTRv2) +2.3%
全局基准 (U14M-B) General (GEN 400k) 83.7% 81.9% 82.3% (SVTRv2) +1.4%
全基准平均 13 Benchmark Avg. 92.46% 90.37% 90.30% (SVTRv2) +2.16%

在专用的任意方向数据集 ASOT(3000 张图)与 U14M-Multi-Oriented 上,对比专用多方向识别器(如 AON、SLOAN、ASTER、SVTRv2),RISTER-S 达到 96.0%(MO)与 93.3%(ASOT),综合平均准确率达到 94.65%,显著超越之前的最佳方法 SLOAN(90.65%)和 SVTRv2(88.00%),展现了压倒性的多方向识别优势。

消融实验

为验证系统各组件的独立贡献与旋转鲁棒性,作者在 IC13 数据集上进行了四个轴向角度(0°、90°、180°、270°)的旋转扰动实验与编码器消融分析。

表1:端到端框架组件与旋转增强消融实验(IC13 识别准确率 %)

模型配置 0° 准确率 90° 准确率 180° 准确率 270° 准确率 平均准确率 说明
(a) 移除 Rot-E 编码器(换为标准卷积) 98.4 97.9 95.6 96.0 96.98 失去编码等变性,多角度掉点明显
(b) 移除 Rot-I 解码器(换为 CTC 解码器) 98.0 91.2 95.6 90.5 93.82 CTC强依赖空间方向,旋转后剧烈崩溃
(c) 变体 (a) + 随机旋转数据增强 97.5 96.9 97.7 96.9 97.25 增强弥补了部分角度,但损伤 0° 原性能
(d) 变体 (b) + 随机旋转数据增强 97.3 93.6 97.9 93.1 95.48 CTC 仍难以完全拟合正交大角度旋转
(e) RISTER-S(完整模型,无旋转增强) 98.4 98.4 98.4 98.4 98.40 严格理论对称,任意典型角度输出 100% 恒等

表2:不同编码器架构与旋转等变主干对比(IC13 / SVT / U14M-MO 准确率 % 与参数量)

编码器主干配置 IC13 (0°) IC13 (90°) SVT (0°) SVT (90°) U14M-MO 参数量 (M) 核心特性说明
ResNet45 97.1 94.5 95.5 89.8 90.8 14.4 无等变性,旋转后严重性能衰退
ResNet45 + G-CNN 97.2 97.2 94.9 94.9 90.9 14.4 具等变性,但纯卷积缺乏长程依赖
ResNet45 + F-Conv 97.3 97.3 95.7 95.7 94.9 14.4 傅里叶滤波等变卷积,局部特征优秀
ViT (Vision Transformer) 98.5 98.1 97.4 96.6 93.9 26.9 全局建模好,但不具备严格旋转等变性
ViT + Stand-Alone Self-Attention 98.3 98.3 97.1 97.1 94.5 27.2 等变注意力,但早降采样导致细节丢失
RELG† (全局部块,无自注意力) 98.0 98.0 96.4 96.4 95.0 28.4 缺乏字符级自注意力上下文,掉点 1.6%
RELG(本文完整主干:F-Conv + MHSA) 98.6 98.6 98.3 98.3 96.6 32.8 兼具渐进下采样几何细节与全局字符依赖

关键发现

  • 严格数学不变性的真实体现:输出 Logits 向量的余弦相似度热力图(Figure 4)证明,完整 RISTER 在 0°、90°、180°、270° 旋转下的余弦相似度均严格为 1.00,实现了输出概率与置信度的绝对恒等;而去掉任一模块后相似度跌至 0.67~0.89。
  • 数据增强的副作用与容量竞争:在有限模型容量下,引入随机旋转数据增强会迫使网络分散容量去学习不同姿态,导致水平基准(0°)准确率由 98.4% 跌落至 97.5%。RISTER 无需旋转增强便能自然具备全向泛化,保持了 0° 最优特征表达。
  • 零额外推理开销:F-Conv 群等变卷积在训练完成后,其多方向卷积核可通过循环移位融合展开为标准卷积权重,在推理时不产生任何额外 FLOPs 或显存交互,推理速度(31.4 FPS)与计算量(12.99 GFLOPs)与常规标准卷积模型完全持平。

亮点与洞察

  • 证明了交叉注意力的旋转不变性:揭示了跨模态注意力本质上是无序特征集合之间的软寻址机制,只要 Query 保持不变,Key/Value 的空间旋转不会改变聚合结果,打破了传统认为注意力解码器对几何扰动脆弱的固有认知。
  • 优雅的“等变编码 + 不变解码”架构分工:在图像层面保持几何变换响应(等变性以追踪文字笔画在旋转下的对应位置),在字符生成层面抹除几何方向干扰(不变性以输出统一的阅读语序),概念清晰且数学严密。
  • 参数免开销转化机制:利用离散群卷积在推理阶段参数合并的技巧,既在训练时充分享受了群对称性带来的强归纳偏置与样本高效性,又避免了引入如 TPS、STN 或双三次插值矫正网络的推理延迟。

局限与展望

  • 正方形输入长宽比约束:当前 \(C_4\) 旋转等变与交叉注意力的严格等变依赖于正方形输入特征图(\(128\times 128\)),对于超长文本条或代码公式行等极端宽高比场景,强行使用正方形分辨率会导致特征分辨率利用率不均衡。
  • 非典型角度的近似性:连续角度(如 37°、65°)在离散栅格化采样和双线性插值下存在不可避免的重采样误差,导致严格不变性退化为高精度近似不变性。未来结合连续旋转群(如可导李代数 Lie Group)值得进一步探索。

相关工作与启发

  • vs ASTER / ESIR / SVTRv2:现有方法均引入外部定位/校正网络(如 Thin-Plate Spline),不仅增加了约 15%~30% 的额外推理计算量,而且校正网络失效会导致灾难性错误;RISTER 从网络内生结构保证旋转不变,无任何外挂模块与累积误差。
  • vs AON / SLOAN:AON 采用 4 方向特征提取和门控融合,不仅计算冗余大且存在多方向语义混淆;SLOAN 采用极坐标转换将旋转化为平移,但在原点附近造成剧烈的几何形变失真。RISTER 在笛卡尔网格上通过群等变卷积和交叉注意力实现优雅对称。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次从理论上证明交叉注意力在 2D 特征上的旋转不变性,提出“旋转等变编码 + 旋转不变解码”范式,理论洞察深刻。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 14 个常用及挑战性基准,详尽提供了 Logits 余弦相似度、四向旋转退化与等变主干对比消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 结构清晰,理论推导严谨,图示直观,逻辑闭环。
  • 价值: ⭐⭐⭐⭐⭐ 为任意方向文本识别提供了无需外挂模块与无需数据增强的标杆范式,工程可落地性极强。