跳转至

Handwritten Text Recognition Lives in the High-Pixel Variance Subspace

会议: NeurIPS2026
arXiv: 2609.35473
领域: 自监督/表示学习
关键词: 手写文本识别、像素方差子空间、掩码图像建模、冻结编码器、字符错误率

一句话总结

本文用像素 PCA 投影与冻结编码器探针研究手写文本识别的信号分布,在六个拉丁文字基准上发现高方差像素方向更利于转录,且 MAE 的真实数据预训练表示取得 5.5% 平均探针 CER,结合语言解码器并全量微调后取得 4.5% 平均 CER。

研究背景与动机

手写文本识别(Handwritten Text Recognition,HTR)需要把笔画排列还原为字符序列。字体、连笔、倾斜、纸张和年代差异让标注数据难以覆盖真实分布;用字体渲染合成文本虽然便宜,却不能消除合成到真实手写的差距。因此,问题不只是增加解码器容量,而是编码器是否保留了可被读出的笔画和字符位置关系。已有文本自监督方法分别采用像素重建、对比学习和序列专用预任务,但跨论文的数据与探针不同,很难判断收益来自目标函数还是训练配方。

自然图像分类中的一种解释认为,重建损失偏重高方差像素,而这些变化不一定承载类别语义,因而像素重建会浪费表示容量。手写转录却可能正好相反:黑色笔画与浅色背景构成主要像素变化,字符区别也依赖这些笔画。不能直接把分类任务中的经验推广为所有视觉任务的规律;需要先检查输入空间中哪些方向能支持实际识别,再比较不同预训练目标。

本文由此采用分析研究而非提出新网络的路线:先对训练图像做 PCA,比较高、低方差重建的可识别性,再在统一视觉骨干上并行训练六种方法,以冻结探针、标签效率和带语言解码器的系统评测检验预测。核心 idea:是否应重建像素取决于任务信号位于哪些像素方差方向;对本文研究的手写行图像,保留高方差笔画内容比主动忽略这些细节更有利于转录。

方法详解

整体框架

研究包含两条互相印证的实验线,而不是 MAE、JEPA、MoCo 串联的架构。第一条直接研究输入:训练集像素 PCA → 高/低方差图像重建 → 各自训练同类 BiLSTM–CTC 探针 → 比较测试 CER。第二条研究表示:在合成或真实手写上分别预训练 MAE、SimMIM、I-JEPA、V-JEPA-2、MoCo-v3 和 SigLIP,再冻结编码器训练读出头,并测量表示与像素子空间的线性关系。

后续语言模型实验是另一种下游评测,不是前面探针的下一层。统一的视觉编码器输出位置特征,投影器将它们转换为语言模型的图像前缀,解码器自回归生成转录;冻结配置只训练下游部分,全量配置才更新视觉编码器。这里不画网络流程图,以免把并行比较和统计分析误表示为新架构。

关键设计

1. 匹配方差的投影探针:先检查识别信息在哪里

作者把图像转换为灰度,并放到高 64、宽 1024 的画布上,展平后维度为 65,536。PCA 的均值与基底只由训练图像估计,验证和测试图像不参与拟合。将特征值从大到小排列后,从两端分别累积,找到至少覆盖目标总方差比例的最小分量数;因此对照匹配的是方差预算,而不是子空间维数。高方差侧通常只需较少分量,低方差侧需要更多分量。

\[ k(p)=\min\left\{K:\sum_{j=1}^{K}\lambda_j\ge p\sum_{j=1}^{d}\lambda_j\right\},\qquad k'(p)=\min\left\{K:\sum_{j=d-K+1}^{d}\lambda_j\ge p\sum_{j=1}^{d}\lambda_j\right\}. \]

这个定义中的“至少”很重要:离散特征值使两侧可能超过阈值,不能称为精确相等能量。比例较大时,两组分量还可能重叠,不能把 top 与 bottom 始终理解为互补、互斥的信息分割。作者重新加回训练均值,并把重建值截断到有效灰度范围,再用带真实转录监督的探针测试可识别性。

\[ x_p^{\mathrm{top}}=\operatorname{clip}_{[0,1]}\left(\mu+\Pi_{V_{\mathrm{top}}(p)}(x-\mu)\right),\qquad x_p^{\mathrm{bot}}=\operatorname{clip}_{[0,1]}\left(\mu+\Pi_{V_{\mathrm{bot}}(p)}(x-\mu)\right). \]

因而探针实际看到的是“投影、均值回填、非线性截断”之后的图像,不是纯线性子空间坐标。实验能支持这套重建与训练协议下的可解码性差异,却不能证明所有低方差方向都没有任何标签信息。附录采用 Gram 矩阵降低计算量,但当训练样本数小于像素维度时,中心化训练矩阵的秩至多为样本数减一;Gram 分解只能恢复非零谱对应的像素方向,不能唯一恢复完整零空间基底。原文声称获得完整正交基的描述缺少零空间补全细节,复现 bottom 构造时尤其需要确认。

2. 并行比较预训练目标:保留像素、预测表示或学习不变性

六种方法共享 ViT-B 量级骨干,主文报告 113.55M 参数。每个输入条带覆盖完整高度和 4 像素宽度,一行产生 256 个位置 token;使用一维 RoPE,不使用类别 token。MAE 随机遮蔽 75% 条带,编码器只处理可见部分,再用四层小型 Transformer 解码器预测被遮蔽的原始像素,以 MSE 训练。SimMIM 遮蔽 60%,把掩码 token 留在编码器输入中,用线性头和 L1 损失重建像素。两者都直接监督笔画像素,但编码成本、掩码比例、损失和解码器并不相同。

I-JEPA 在条带序列上采样四个目标区间,每个宽度占全行的 0.15–0.25;上下文是目标区间并集的补集。在线编码器与预测器根据上下文预测 EMA 教师的目标特征,目标按每个位置的嵌入维度归一化后以 L1 比较。V-JEPA-2 使用相同的一维静态条带输入,不是真的把手写行变成视频帧;它拼接教师最后四层特征、加深预测器,并增加上下文侧辅助损失。目标归一化在作者实验中用于避免表示塌缩,但这些改动意味着比较对象是本文的 HTR 适配版本。

MoCo-v3 的附录实现不是纯全局图像对比:两种增强视图各被分为四个水平窗口,同位置窗口构成正样本,其余批内窗口构成负样本,以对称 InfoNCE 训练。SigLIP 则均值池化视觉特征,与六层文本编码器的转录表示做图文 sigmoid 对比;它明确使用真实转录标签,因此不能列为无标签视觉自监督。比较可以评价这些实现的效果,但不能推出所有序列对比方法必然劣于重建,也不能把差异仅归因于“是否接触像素”。

3. 冻结编码器读出:区分位置可读性和读出头补偿

线性–CTC 仅将每个冻结位置特征映射为字符 logits,没有递归或注意力读出。BiLSTM–CTC 则增加一层双向 LSTM,隐藏大小为 256,再做相同字符预测;它能整合左右位置上下文。两种探针共享 94 个字符加 CTC blank,使用真实训练集转录训练,测试时贪心 CTC 解码。作者把两种 CER 的差定义为 rescue gap:\(\Delta=\mathrm{CER}_{\mathrm{Linear}}-\mathrm{CER}_{\mathrm{BiLSTM}}\),单位为百分点。

较小的差表示浅层线性读出相对容易利用这些特征,而较大的差表示序列头带来更强补偿;这不是“编码器完全没有字符信息”的直接证明。MAE 的平均差为 5.7 pp,远小于 JEPA 和对比方法,但不是零,也不能说它不需要序列建模。线性读出头本身没有序列模型,不等于视觉编码器的特征完全不包含跨位置上下文。

4. 子空间–表示对齐:用线性可预测性连接几何与识别

对每个冻结编码器和数据集,作者分别从高、低方差像素投影拟合线性回归,预测编码器的图像级特征,以决定系数衡量可预测程度。正的差意味着这些特征更容易由高方差方向线性解释,而不是低方差方向。按附录关于阈值平均的描述,汇总量可以写成下面的紧凑表达;主文单阈值公式与图注的整合描述需一起阅读。

\[ \overline{G}(\mathcal E,\mathcal D)=\frac{1}{|P|}\sum_{p\in P}\left(R^2_{\mathrm{top},p}(\mathcal E,\mathcal D)-R^2_{\mathrm{bot},p}(\mathcal E,\mathcal D)\right),\qquad P=\{0.10,0.25,0.50,0.75,0.90\}. \]

图 4 在每一种 SSL 方法内部比较不同数据集,报告该差与 CER 的相关关系。因此,“方法内部”指固定方法、跨数据集的观察,不是固定数据集后控制其余因素的干预。不同数据集的文本难度、训练量和像素谱也可能共同影响两种量;该结果是有解释力的经验关联,而非高方差对齐造成低 CER 的因果证明,更不是 Bayes 充分性定理。缓存没有可直接读取的相关系数数值,笔记不补造图中数字。

损失函数 / 训练策略

共享预训练配方使用 AdamW、10,000 步预热、余弦衰减,500 个 epoch、每个 2,000 步,约一百万次更新;base 有效批大小为 32。MIM 与 JEPA 的峰值学习率为 \(3\times10^{-4}\),SigLIP 为 \(6\times10^{-4}\)。MAE 只对遮蔽位置的未归一化像素计算 MSE,SimMIM 使用 L1,JEPA 对教师特征计算 L1,另两种使用各自对比目标;同骨干与相近日程不等于严格相同计算量。

SSL 检查点通过在 IAM 标注特征上训练的在线 CTC 探针选择。虽然多数视觉预训练损失不用转录,模型选择仍引入标签,不能把整个流程称为完全无监督。下游 CTC 探针使用 Adam、学习率 \(10^{-3}\)、批大小 64,训练 100 个 epoch,选择验证 CER 最好的检查点;标签效率实验使用嵌套的 1%、10%、25%、50%、100% 标注子集。

语言解码器不是现成的通用巨型 LLM,而是在五种语言的 CC100 文本上从头预训练的因果模型,主文称约 200M 参数。阶段 1 冻结视觉编码器与语言模型,只在合成图像–转录对上训练投影器;阶段 2 保持视觉编码器冻结,在各真实训练集上训练投影器和语言模型;阶段 3 解冻整个系统并降低学习率。对应结果必须按冻结配置“1+2”和全量配置“1+2+3”理解,不能把冻结配置误当成只训练阶段 1。

主文概述把冻结与全量配置简写为 Stage 1、Stage 2,详细方法与附录则采用上述三阶段编号。主文还称线性投影器、约 200M 解码器,附录 F 描述两层 MLP、约 7.3M 投影器及约 218M 解码器;这些是源文配置描述差异,不能自行合并成一个已经核实的精确实现。语言模型及合成转录监督提供额外语言先验,因此语言系统结果与视觉探针结果应分开解释。

实验关键数据

主实验

指标为字符错误率(CER,越低越好)。附录定义为预测与参考的 Levenshtein 距离除以参考长度,再对测试样本均匀平均;不做大小写或标点归一化。下表来自主文表 1,真实预训练编码器冻结,读出头为 BiLSTM–CTC;最后一列为线性读出与该读出的平均 CER 差。

方法 IAM Rimes Bentham LAM Rodrigo Parzival 平均 CER (%) 平均 rescue gap (pp)
MAE 9.9 6.5 7.5 4.4 2.0 2.5 5.5 5.7
SimMIM 14.5 11.1 12.0 7.0 3.0 4.3 8.7 10.3
I-JEPA 23.2 16.9 22.1 13.6 6.0 6.5 14.7 39.0
V-JEPA-2 17.9 13.2 15.5 8.9 3.8 4.1 10.6 26.6
SigLIP 25.1 16.7 20.8 11.3 5.6 7.3 14.5 29.5
MoCo-v3 32.9 26.1 26.0 15.0 9.0 5.8 19.2 59.1

MAE 六个可见数据集数值的算术平均约为 5.47%,与表中一位小数的 5.5% 一致,不构成均值冲突。MAE 在全部六列最佳,但“像素家族每个成员都优于其余家族”过强:Parzival 上 V-JEPA-2 的 4.1% 好于 SimMIM 的 4.3%。同样,MAE 的每数据集 rescue gap 不是全部最小,例如 IAM 上为 8.8 pp,SimMIM 为 8.3 pp。

下表来自主文表 2,SSL 行采用真实手写预训练后带语言解码器的全量微调配置;监督基线使用作者的合成训练与真实微调日程。它是本文复现实验的比较,不等于覆盖所有公开系统的统一排行榜。

方法 / 配置 IAM Rimes Bentham LAM Rodrigo Parzival 平均 CER (%)
CRNN 7.4 4.9 9.6 5.6 2.8 2.8 5.5
DTrOCR-B 7.6 4.6 8.3 4.2 2.6 6.6 5.6
TrOCR-B 6.3 3.8 6.9 3.5 2.2 5.5 4.7
无 SSL,随机初始化 7.0 5.1 7.8 6.7 2.4 5.1 5.7
MAE,全量微调 6.9 4.2 5.6 4.0 1.9 4.6 4.5
SimMIM,全量微调 12.7 6.8 10.8 6.7 3.5 8.2 8.1
V-JEPA-2,全量微调 14.3 7.8 13.7 8.3 4.1 8.5 9.5
MoCo-v3,全量微调 13.9 7.5 12.0 5.8 3.4 7.9 8.4

MAE 冻结配置平均 CER 为 5.1%,全量微调降至 4.5%,收益为 0.6 pp;全量平均较 TrOCR-B 的 4.7% 低 0.2 pp,但 IAM、Rimes、LAM 仍分别落后于 TrOCR-B,Parzival 也落后于 CRNN。表 2 中 MoCo-v3 的全量平均 8.4% 优于 V-JEPA-2 的 9.5%,不能宣称视觉探针中的完整排序在语言解码器下原样保持。TrOCR-B 的起点还包含约 684M 印刷文本图像预训练,其他监督基线从头训练。

消融实验

下面汇总图 3 和正文给出的合成到真实预训练变化。CER 差为“真实减合成”,负值代表改善;这些是预训练分布比较,而非移除单一模块的严格消融。

方法 真实预训练平均 CER (%) 合成→真实 CER 差 (pp) 解释边界
MAE 5.5 -2.9 本文重建配方改善
SimMIM 8.7 -3.8 本文重建配方改善
V-JEPA-2 10.6 +1.9 本文静态条带适配退化
SigLIP 14.5 +1.7 使用转录监督的图文比较
I-JEPA 14.7 +4.6 本文一维适配退化
MoCo-v3 19.2 +5.2 本文窗口对比配方退化

关键发现

  • PCA 方差扫使用 0.05、0.10、0.20、0.30、0.50、0.70、0.90,定性图使用 0.80。原文图示支持 top 重建更易识别,但缓存未提供各点数值,不据图描述制造精确 CER 表。
  • MAE 只用 10% 标签时平均 CER 为 8.8%,低于最强非像素方法使用全部标签的 10.6%。它在 30 个数据集–标签预算组合中赢得 29 个;Parzival 的 1% 标签例外中,I-JEPA 为 93.8%,MAE 为 95.6%。
  • SimMIM 在至少 10% 标签时平均排名第二,不意味着逐数据集恒居第二:Parzival 上 V-JEPA-2 在 25%、50%、100% 标签时第二。
  • 平均 rescue gap 的巨大差异表明读出头容量会改变方法比较,但 MAE 的 5.7 pp 仍是实质收益,不能描述为完全无需读出补偿。

亮点与洞察

  • 先检验任务的像素统计结构,再解释预训练目标的效果,比仅凭最终排行榜选择方法更有解释力。可复用的是“投影后识别 + 冻结读出 + 表示回归”的证据组合,而不是默认所有文本任务都具有同一谱结构。
  • 同时报告线性与序列探针,让“表示已经对齐字符”与“下游网络补偿表示”有所区分。只看强解码器成绩容易遮蔽两者的差异。
  • 语言模型不能被当作免费的视觉表示修复器。冻结与全量配置的差距提供实用参考,但其收益仍包含 CC100 语言先验和转录监督。

局限与展望

  • 作者主要测试单个 ViT-B 尺度、每个实验单个随机种子,覆盖五种语言但均为拉丁文字。阿拉伯文、中文、天城文以及场景文本、乐谱、数学表达式尚未验证;小均值差尤其需要多种子置信区间。
  • PCA 重建并非等维对照,离散阈值不保证精确等能量;大预算可能存在子空间重叠,均值回填与截断改变输入,低秩训练数据的零空间处理也未完整交代。应报告实际保留方差、维数、重叠和无截断对照,再检验更广义的信息结论。
  • 方法之间掩码、损失、预测头、教师目标和计算成本均有差异;窗口 MoCo 只是一个序列配方,SigLIP 还使用转录。跨数据集的几何相关不能排除数据难度混杂,不足以建立因果关系。
  • 数据配置存在未解决的源文冲突:主文及附录 C 为 12.5M 合成行、每语言 2.5M,附录 B 为 10M、每语言约 2M;主文真实预训练为六个训练集的并集,附录 B 另加入 Saint-Gall 与 Washington。
  • 增强描述也冲突:附录 B 前段称合成图像不做增强,后段称两个预训练分布使用相同增强。字体数量主文约 3,000,附录 C 约一千;图 6 又提到 CulturaX 与 Gutenberg,而正文主要写 Gutenberg。需要代码或作者澄清,不能在复现时静默选一种。
  • 主文把 V-JEPA-2 输入称为帧,附录明确否认视频处理;JEPA 的 EMA 动量在不同段落写作 0.9999 与 0.999,目标区间既允许重叠又出现“disjoint”的表述。笔记遵循明确的静态条带机制,并保留这些实现不确定性。

相关工作与启发

  • 对比 Balestriero 与 LeCun 的重建分析:本文沿用像素子空间投影思路,却在手写转录上观察到不同于自然图像分类的现象。启发是重建与语义的关系依赖任务分布,而非一种损失天然适合或不适合全部视觉任务。
  • 对比 MaskOCR、Text-DIAE、DualMAE:既有工作将重建用于文本,本文主要增加跨目标的匹配比较与几何解释。它没有逐一复现这些专用方法,因此不能将六种代表性实现的排序扩展为整个文本 SSL 文献的排序。
  • 对比 SeqCLR、ChaCo、RCLSTR:这些方法改变对比单元或文本关系,本文 MoCo 已使用窗口正样本,但仍未覆盖字符级和关系级设计。进一步实验应在固定计算与数据下逐项比较对比粒度,而不是宣判对比学习普遍无效。
  • 对比 TrOCR 与 DTrOCR:本文将 SSL 视觉表示接入从头预训练的中等规模语言解码器,以评估系统层收益。复用时应分别记录视觉无标签数据、监督合成数据、模型选择标签和语言语料,避免把结果统称为无监督提升。

评分

  • 新颖性: 4/5 — 把任务相关像素方差结构与 HTR 预训练选择联系起来,分析视角清晰。
  • 实验充分度: 4/5 — 六种方法、六个基准、多种读出与标签预算较全面,但单种子及配置不一致削弱结论强度。
  • 写作质量: 3/5 — 主线明确,数据量、增强、阶段编号和实现细节仍有多处需澄清。
  • 价值: 4/5 — 为手写识别表示选择提供实用证据,但不是对所有文字体系或 SSL 家族的普适定论。