跳转至

Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation

会议: ECCV2026
论文: ECCV 原文
领域: 多模态 VLM
关键词: 文本图像机器翻译; 全局-局部双感知; 多模态大模型; 高分辨率文本图像; 跨区域一致性

一句话总结

GLoTran 把高分辨率文本图像翻译改写成「先检测文本区域并按阅读顺序切成局部切片,再让多模态大模型在低分辨率全局图的语境参照下逐区域递进翻译」的流程,用带源类型与空间偏置的早期层跨注意力把全局语义注入局部 token,并用 η 窗口译文回放和四段式结构化提示维持跨区域一致,在 MCiTon 英中翻译上把平均 BLEU 从 Qwen3-VL 8B 的 46.7 提到 50.2。

研究背景与动机

文本图像机器翻译(TIMT)要翻译的是"长在图片里"的文本,海报、菜单、截图、路牌、文档里的字既不能像纯文本机器翻译那样当作干净序列输入,也不能像图像描述那样只求大意——它同时要处理文本定位、识别和翻译三件事。目前主流有两条路线:一是级联方法,先用 OCR 逐块识别再交给神经机器翻译;二是端到端模型,把视觉与语言模态联合编码后直接映射成译文。级联路线结构清晰、可插拔,但识别错一个字后面整句都会跟着错,误差逐级累积,且多模型串行带来额外延迟;端到端路线缓解了误差传播,却是任务专用模型,换一种版面、字体或语言方向就要重训,难以覆盖真实场景的多样性。

近两年多模态大模型(MLLM)凭借强语言先验与视觉理解能力被引入 TIMT,出现了 InImageTrans 这类用偏好优化微调 MLLM 以抑制幻觉的工作,以及 MT3 这类用多任务强化学习提升翻译质量的工作。但它们的评测与训练大多停留在低分辨率、视觉内容相对简单的图像上;一旦换成真实世界的高分辨率文本丰富图像,问题就暴露了:MLLM 的输入分辨率上限有限,视觉编码器又是固定方形 patch 设计,整图直接输入要么产生超线性的计算开销与海量视觉 token,要么被迫降采样把字压糊。更麻烦的是,海报和文档里大量非文本元素(图标、装饰、杂乱背景)会分散视觉注意力,让模型把算力花在无意义区域上,最终表现为局部文本漏译、误识和碎片化的语义理解,并进一步引发跨区域的语义漂移与幻觉。

这里的核心矛盾在于:TIMT 与通用视觉问答的任务形态根本不同——通用 VQA 只需要围绕一个问题找出"够用的证据",而 TIMT 要求把图中全部文本以正确的阅读顺序、彼此语义一致地翻译出来。现有的高分辨率 VLM 方案恰恰是前一种思路:mPLUG-DocOwl2、URaDeR 一类用形状自适应切块把高分辨率图切成固定大小的子图,ZoomEye 用树式搜索、V* 用引导式视觉搜索挑选局部块,它们都把局部块当作回答整体问题的"辅助证据",随机切分会把一句话从中间截断、搜索式选择则会漏掉小字或低对比度的文本实例,而且这些方法都按"一图一译"的方式处理,对区域之间的术语一致性和指代连贯没有任何建模。本文的切入角度是反过来:文本区域本身可以被检测器较为可靠地定位,那就不要指望模型在整图上"找"文本,而是把翻译改写成以文本区域为单位的有序递进解码,同时始终保留一张廉价的全局视图提供场景语境(版面、主题、区域间关系),并用解码端的回放机制显式维持跨区域一致。核心 idea:用「低分辨率全局图 + 有序局部文本切片」的双路视觉输入替代整图输入,让局部 token 在早期层通过带源类型与空间偏置的跨注意力主动向全局图查询语境,再以 η 窗口的译文回放与四段式结构化提示强制跨区域一致,并配套构建 510K 量级的 GLoD 全局-局部配对数据集完成微调。

方法详解

整体框架

GLoTran 的输入是一张源语言高分辨率文本图像,输出是按阅读顺序排列的分区域目标语言译文。整条流程可以概括为「定位 → 切块编组 → 双路编码 → 语境注入 → 逐区域解码」:先用自训练文本区域检测器找出块级/段落级候选框,裁剪并按几何与排版线索合并成紧凑的局部切片,用内容排序模型确定阅读顺序;同时把原图降采样成一张低分辨率全局视图;两路图像由共享的 ViT 编码器加视觉投影器转成视觉 token,配上 ⟨image_g⟩ / ⟨image_l⟩ 两个类型标识 token 一起送入 LLM;在早期 Transformer 层插入全局-局部的层次化跨注意力,让每个局部 token 选择性地从全局 token 取语境;最后 LLM 按阅读顺序逐区域生成译文,第 \(i\) 个区域的提示里带上前 \(\eta\) 个区域已经产生的译文(回放窗口)。值得强调的是它不做显式 OCR——检测器只回答"文本在哪里",识别与翻译都由 MLLM 在切片上一次性完成,OCR 只出现在数据构建环节。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["高分辨率文本图像"] --> B["文本区域检测与切片编组<br/>块段级切片,按阅读顺序排序"]
    A --> D["全局-局部双路视觉编码<br/>降采样全局图 + 局部切片,共享 ViT"]
    B --> D
    D --> E["层次化跨注意力与源类型偏置<br/>局部 token 查询全局语义"]
    E --> F["逐区域递进翻译与译文回放<br/>结构化提示 + η 窗口历史译文"]
    F --> G["按阅读顺序的分区域译文"]

支撑这套双路感知范式的数据同样是一个独立贡献:作者构建了 GLoD,一个面向全局-局部双输入的 TIMT 数据集,覆盖 40 多个真实场景(文档、海报、菜单、路牌、收据、手写等)、5 种语言。构建流程分五步:场景概念化定义 40+ 翻译场景;大规模网页抓取加既有图文数据集,用严格过滤器剔除隐私/版权敏感、低分辨率、模糊畸变、OCR 置信度低(PaddleOCR)、风格单一和文本稀疏的样本;用 PaddleOCR 与 Qwen3-VL-Plus 两种互补检测器做跨区域校验与融合,再按阅读顺序、空间邻接和视觉线索层次化分组成语义连贯的块(短语/句子/段落);识别阶段用双 OCR 加双向翻译融合(PaddleOCR 抓局部细节,Qwen3-VL-Plus 提供全局语境做跨行消歧),再经 GPT-4o 与 DeepSeek-R1 的多轮互译回译融合生成译文,并由人工专家校验语义、语法与版面对应,得到约 200 万全局-局部图文对;最后两阶段质控,先删低置信 OCR、超短译文和非语言符号,再用多语 embedding 相似度(LaBSE / SimCSE)与往返翻译一致性度量全局与局部译文的一致性,剔除语义漂移的区域,收敛到约 51 万对(正文与表格分别给出 510K / 517,354 的口径,见"局限")。

关键设计

1. 文本区域检测与切片编组:让切块以文本为中心且保持阅读顺序

现有的高分辨率 VLM 通常用随机切分或搜索式选择把大图拆成子图,对 VQA 够用,对 TIMT 却是灾难——一句话被切成两半、一个街区的小字整体漏掉,都会直接变成漏译。GLoTran 反过来先做检测:一个自训练的文本区域检测器在图像 \(I\) 上给出候选框 \(\mathcal{B}=\{b_i\}\),每个框对应一个块级或段落级区域,即把属于同一段连贯文本的句子聚在一起,而不是逐行或逐词地切。裁剪归一化得到初始切片集合后,再根据重叠、行高、对齐等几何与排版线索把相邻或语义相关的区域合并,得到 \(N_s \ll N_b\) 个紧凑分组切片——这一步是关键,它把"检测器给出的碎片框"变成"一条可以独立翻译的文本单元"。合并后的切片再用内容排序模型(如 MinerU)确定性地排序,保证译文顺序与人类阅读顺序一致。选择"先检测再编组"而不是"先切块再识别"的代价是依赖检测器质量(见"局限"),但换来的是切片与文本语义单元的天然对齐,以及一个有穷、有序、可逐条核对的翻译清单。

2. 全局-局部双路视觉编码:用极低分辨率的整图换场景语境,用局部切片保字形细节

MLLM 的视觉编码器受固定分辨率和方形 patch 设计约束,直接吃高分辨率整图会同时踩两个坑:视觉 token 数量随分辨率超线性增长,而背景、图标、装饰等非文本元素又会挤占注意力,让真正要识别的字被稀释。GLoTran 因此把视觉输入拆成两路:一路把原图降采样成低分辨率全局视图 \(I_g\),只负责承载版面结构、场景主题和区域间关系这类粗粒度先验;另一路是保留原始裁剪分辨率的局部切片 \(I_i\),负责细粒度字形细节。两路共享同一个 ViT 编码器与视觉投影器,把视觉特征对齐到文本嵌入空间后,用标识 token 让 LLM 知道哪些 token 属于哪一路:

\[\hat{Y}_i = \text{LLM}\big([E_g; V_g; E_l; V_i; \mathcal{P}_{<i}]\big)\]

其中 \(E_g / E_l\) 是 ⟨image_g⟩ 与 ⟨image_l⟩ 的文本嵌入,\(V_g, V_i\) 是全局与局部视觉 token,\(\mathcal{P}_{<i}\) 是此前的提示与译文(⚠️ 公式按 PDF 提取的残损文本重写,以原文为准)。这样设计的合理性在实验里得到验证:全局图默认只用 224×224,分辨率继续往上加(448/896/1792)反而让 Introduction、Leaflet 这类小字散排场景掉点,因为更大的全局图带来的是更杂的视觉干扰而非更多可用字形信息——全局这一路要的是"知道这是张什么场景的什么版面",不是"看清字"。而这恰好是廉价的一路:GLoTran 在 224×224 下只需 4.9K 视觉 token,而同族模型为拿同样的准确率要处理 164K token 的原分辨率整图。

3. 层次化跨注意力与源类型偏置:只在早期层让局部 token 去全局图取语境

两路 token 简单拼接并不能保证局部 token 真的用上全局信息,模型完全可能把它们当成两段互不相干的视觉上下文,各自沉默地解码。GLoTran 因此在 Transformer 的早期层 \([0, 8, 16, 24]\) 显式插入全局到局部的跨注意力,让每个局部 token 作为 query 去检索全局 token;并且给注意力权重加了一个可学习的标量偏置,它同时以"来源类型(全局还是局部)"和"token 的空间邻近度"为条件:

\[\text{Att}(q_i,k_j)=\text{softmax}\!\left(\frac{q_i k_j^{\top}}{\sqrt{d_t}} + b_{ij}\right)\]

这一步的实际作用是消歧与聚焦:菜单里的 "House" 究竟译成"餐厅"还是"议院",取决于全局图给出的场景主题;而与此无关的装饰区域则应被忽略,\(b_{ij}\) 正是学出"该看哪类全局 token、该忽略哪些空间位置"的旋钮(⚠️ 公式依残损文本重写,\(b_{ij}\) 的具体参数化以原文为准)。只在 0/8/16/24 这几层做注入、而不是全程混合,是为了在早期把全局语境写进局部表示后,仍让后续层自由建模局部文本内部的结构——消融里去掉全局图这一路,Title、Sign 这类短文本场景的 BLEU 分别从 54.3/46.3 掉到 41.0/37.8,说明这种语境注入对"字少、歧义大"的区域收益最大。

4. 逐区域递进翻译与译文回放:把跨区域一致性写进解码过程

把图切成区域逐个翻译,天然会丢到区域之间的语篇关系——同一份海报里反复出现的栏目名可能被译成不同说法,代词和省略也可能因为看不到上文而指错。GLoTran 的做法是让翻译按阅读顺序"递进"地进行:第 \(i\) 个区域的解码条件是该区域的切片、全局图和前缀提示 \(\mathcal{P}_{<i}\),而 \(\mathcal{P}_{<i}\) 里显式携带前 \(\eta\) 个区域的译文(pre-region translation replay,回放窗口)。窗口内的历史译文提供的是目标语言侧的上下文线索——术语统一、句子的续接、指代的落地,因此它不是"再喂一遍原文",而是让模型在自己已经产出的译文语境中保持一致。训练时对回放窗口内的历史译文使用 teacher forcing,用真值替换模型自己的预测,避免早期错误在区域间滚雪球(⚠️ 原文表述为在回放窗口内用 \(Y_{<i}\) 替换 \(\hat{Y}_{<i}\),具体边界以原文为准)。与之配套的是四段式结构化提示:全局理解指令让模型先从全局图提取版面与场景语义,局部聚焦指令把注意力压到当前切片的文本内容上,全局-局部一致性规则要求模型在生成前核对局部译文是否与全局语境相符,翻译指令则给出明确任务目标并把前一区域的译文作为参考示例写进提示(例如译第二片时提示里已包含第一片的「斯克里布纳五月刊」)。窗口大小 \(\eta\) 是唯一需要调的旋钮,实验里 \(\eta=4\) 时 BLEU 峰值 43.54,太小缺乏目标语上下文、太大则累积噪声与漂移,还徒增开销。

一个完整示例

以一张 1573×2000 的英文杂志封面/海报为例(分辨率远超 MLLM 的舒适输入区)。整图直接喂给 Qwen3-VL 8B,会看到它漏掉页脚的小字、把刊名和栏目名译得前后不一致,甚至凭语言先验编出图里没有的内容。走 GLoTran 的流程:自训练检测器先框出约 12 个块级文本区域(刊名、日期行、栏目名、导读段落、价格标签……),编组阶段把重叠且行高一致的三四个框并成 2 个段落级切片,最终得到比如 6 个切片并按阅读顺序排好;同时原图被降采样成 224×224 的全局视图。编码后进入递进解码:译第 1 片「斯克里布纳五月刊」时提示里没有历史译文,模型只依赖全局图提供"这是一份期刊的封面"这一层语境;译第 2 片「每份25美分」时提示里已经带上第 1 片的译文,模型据此保持刊名与栏目的译法统一;到第 5、6 片时回放窗口里同时保留前面 4 片的译文,用于消解跨区域的指代。全部 6 片译完后按阅读顺序拼出完整译文,同时给每个片区保留对应关系,便于人工核对漏译——这正是级联方案与整图 MLLM 都给不出的"可逐条核对的翻译清单"。

损失函数 / 训练策略

训练目标就是在各区域译文 token 上做交叉熵,损失在整个数据集上按区域求和:

\[\theta^{*}=\arg\min_{\theta}\sum_{(I,Y)\in\mathcal{D}}\sum_{i=1}^{N_s}-\log p\big(\hat{Y}_i \mid I_g, I_i, \mathcal{P}_{<i};\theta\big)\]

(⚠️ 依残损文本重写,符号形式以原文为准。)实现上对现有 MLLM 做全参数微调:骨干为 InternVL2.5 4B 与 Qwen3-VL 8B,GLoD 按 99:1 划分成 512,180 训练对与 5,174 验证对(与 MCiTon、MTIT6 无图像重叠),所有输入统一缩放到 224×224,batch size 128 配 8 步梯度累积,AdamW,初始学习率 \(1.0\times10^{-5}\),共训练 10,000 步,8 张 A100 80GB。对照实验里作者还训了一个 GLoTran-LoRA 版本,性能明显低于全参数微调版本——说明这套把视觉输入结构改掉的方法需要动到视觉通路本身,仅靠低秩适配不够。

实验关键数据

主实验

英中翻译在 MCiTon(1,450 对图文,覆盖文档、自然场景、海报三类,细分 Paper/News/Novel/Title/Sign/Introduction/Cover/Leaflet 八个场景)上评测,指标为 BLEU / COMET;下表给出代表性方法与 GLoTran 在各场景的得分(完整 17 个基线见原文 Tab.2):

方法 规模 Paper News Novel Sign Introduction Leaflet 平均
GPT-4o ~200B 62.1 / 86.3 51.6 / 85.6 44.2 / 83.4 46.1 / 83.3 40.1 / 75.3 43.9 / 71.7 46.8 / 79.9
Qwen-VL-Max ~72B 60.5 / 85.7 58.3 / 85.7 44.8 / 83.5 43.2 / 80.5 37.8 / 74.6 43.7 / 69.9 46.5 / 78.6
Qwen2.5-VL-Instruct 7B 60.7 / 85.8 53.4 / 85.5 27.4 / 78.1 44.0 / 82.2 36.2 / 72.8 43.6 / 72.4 42.9 / 77.7
InternVL3 8B 59.8 / 86.0 48.9 / 83.9 31.2 / 79.8 41.8 / 81.6 32.8 / 72.6 35.8 / 70.9 41.4 / 77.9
InImageTrans 8B 59.0 / 85.0 46.5 / 80.9 33.5 / 76.5 28.9 / 66.9 32.0 / 71.7 32.1 / 70.8 35.9 / 72.7
Qwen3-VL-Instruct 8B 60.9 / 86.1 54.3 / 86.2 43.6 / 83.1 44.2 / 83.0 33.6 / 75.8 48.2 / 75.1 46.7 / 80.2
Qwen3-VL-Instruct⋆(仅 GLoD SFT) 8B 60.8 / 86.2 56.0 / 86.4 43.8 / 83.9 44.7 / 83.8 35.5 / 77.4 48.5 / 75.9 46.5 / 80.8
GLoTran-LoRA (Qwen3-VL 8B) ⚠️ 8B 64.8 / 85.9 56.0 / 86.7 45.5 / 84.8 45.0 / 82.7 40.0 / 74.5 49.5 / 75.8 42.2 / 78.6
GLoTran (Qwen3-VL 8B) 8B 66.3 / 87.9 57.5 / 88.6 46.8 / 86.6 46.3 / 84.8 41.3 / 76.4 51.1 / 77.9 50.2 / 82.2

(⚠️ GLoTran-LoRA 行各场景得分与消融表中「去掉回放」一行完全相同,其平均分 42.2/78.6 也与按行内八个场景算出的约 48.8 不符,疑似原文排版错误,以原文为准。)多语向结果在 MTIT6(jp→zh / ko→zh / zh→en / zh→jp / zh→ko,每语向约 200 张高分辨率图)上以柱状图给出(原文 Fig.5(a)(b)),GLoTran 在全部语向取得最优,超过 Qwen3-VL 8B 与 InternVL3 8B。

消融实验

组件级消融在 MCiTon 上以 Qwen3-VL 8B 为骨干进行(BLEU / COMET):

配置 Paper Novel Sign Introduction Leaflet 说明
Qwen3-VL 8B(基线) 60.9 / 86.1 43.6 / 83.1 44.2 / 83.0 33.6 / 75.8 48.2 / 75.1 整图直接翻译
Qwen3-VL♢(喂检测到的区域) 60.6 / 85.8 42.5 / 82.5 37.4 / 76.4 38.2 / 75.1 45.4 / 73.9 有精确定位但无双路与回放
GLoTran (PSC) 57.1 / 83.4 36.8 / 78.4 36.2 / 75.3 33.2 / 73.3 43.8 / 72.7 用无参形状自适应随机切块替换检测器
GLoTran (w/o Global Image) 60.7 / 85.9 44.1 / 82.9 37.8 / 77.4 33.1 / 74.6 44.9 / 73.1 只保留局部切片
GLoTran (w/o Replay Mechanism) 64.8 / 85.9 45.5 / 84.8 45.0 / 82.7 40.0 / 74.5 49.5 / 75.8 去掉跨区域译文回放
GLoTran 66.3 / 87.9 46.8 / 86.6 46.3 / 84.8 41.3 / 76.4 51.1 / 77.9 完整模型

骨干泛化性在 MTIT6 多语向与部分 MCiTon 场景上给出(基线 → GLoTran,括号内为原文报告的相对增益):

骨干 zh→en ko→zh jp→zh Novel Introduction Leaflet
InternVL2.5 4B 4.02 → 6.68 (+66.2%) 2.57 → 5.97 (+132.3%) 28.37 → 29.93 (+5.5%) 18.48 → 25.80 (+39.6%) 26.16 → 29.47 (+12.7%) 21.22 → 23.27 (+9.7%)
Qwen2.5-VL 7B 9.54 → 10.99 (+15.2%) 20.23 → 22.39 (+10.7%) 35.83 → 43.81 (+22.3%) 27.43 → 44.59 (+62.6%) 36.18 → 38.93 (+7.6%) 43.66 → 45.64 (+4.5%)
Qwen3-VL 8B 11.27 → 11.87 (+5.3%) 17.29 → 20.69 (+19.7%) 37.71 → 43.54 (+15.5%) 43.56 → 46.84 (+7.5%) 33.63 → 41.32 (+22.9%) 48.21 → 51.18 (+6.2%)

关键发现

  • 去掉全局图掉得最多,尤其是在短文本、歧义大的场景:Sign 从 46.3 掉到 37.8、Title 从 54.3 掉到 41.0,说明全局图的价值不是"看清字",而是给孤立短文本提供场景归属与主题约束;相比之下只去掉回放机制,Paper/Novel 只掉 1.5/1.3 BLEU。这个对比说明双路感知里"全局语境"是主项,"跨区域回放"是增益项(但在 Introduction/Leaflet 这类多段小字场景仍有 1.3–1.6 BLEU 的稳定贡献)。
  • 光有精确定位并不够:把 GLoTran 的检测器输出直接喂给 InternVL3 / Qwen2.5-VL / Qwen3-VL(表中 ♢ 行),多数场景并没有变好,Sign 甚至从 44.2 掉到 37.4——区域级输入在缺乏全局语境与跨区域一致性约束时,反而放大了模型对孤立文本块的误判。而换成无参随机切块(PSC)后 GLoTran 全面下滑(Paper 57.1),说明"文本中心的切片编组"是这套方法的必要条件而非可替换细节。
  • 参数规模与 TIMT 性能不成正相关:InternVL2 8B 与 40B 只差 2.2 BLEU / 1.8 COMET,Qwen2.5-VL 32B 的 BLEU 甚至低于其 7B 版本(42.2 vs 42.9),作者据此提出 TIMT 上可能存在缩放饱和——单纯堆参数解决不了高分辨率文本丰富图像的注意力稀释问题。
  • 仅在 GLoD 上做常规 SFT 收益有限:Qwen3-VL⋆(8B,同一份数据、普通监督微调)平均 46.5/80.8,与未微调的 46.7/80.2 基本持平,部分复杂场景甚至下降;GLoTran 相比未微调同骨干提升 3.5 BLEU(相对 7.49%)与 2.0 COMET(相对 2.49%)。数据本身不是瓶颈,把视觉输入结构改成全局-局部双路并配合回放解码才是。
  • 两个超参都有明确的工作区间:全局图分辨率 224 与 448 最好,超过 448 后 Introduction/Leaflet 明显下降;回放窗口 \(\eta=4\) 时 BLEU 峰值 43.54,\(\eta\in[3,5]\) 区间内 COMET 也最稳,过大不仅引入累积噪声与翻译漂移,还线性增加解码开销。
  • 效率上省 token 但慢在延迟:GLoTran 在 448×448 下平均视觉 token 为 8.4K(224×224 下 4.9K,显存约 18GB),而同族模型要拿到可比精度需按原分辨率处理,visual token 达 164K、FLOPs 约 215 倍(Novel 场景);但 GLoTran 的首 token 延迟明显更高(Novel 上 3.002s,Qwen3-VL♡ 为 0.099s),原因是逐区域串行解码——这套方法把计算从"一次性高分辨率编码"换成了"低成本编码 + 多次区域解码",吞吐换准确率,现阶段不适合低延迟场景。

亮点与洞察

  • 把 TIMT 从"一图一译"重构成"有序区域流式翻译":这个 formulation 层面的改动是全文最有价值的地方。一旦翻译单位变成按阅读顺序排列的文本区域,跨区域一致性就不再是玄学,而可以被显式建模(回放窗口、一致性规则、可逐条核对的译文清单),漏译也从"感觉少了点什么"变成"哪个切片没译"这种可定位的问题。
  • 224px 全局图能提供有效语境,反直觉但自洽:MLLM 社区的习惯是靠分辨率堆叠保细节,本文却证明另一路可以做得极廉价——全局那一路要的是版面与场景主题,不需要字形;把高分辨率留给真正需要它的局部切片,视觉 token 从 164K 降到 4.9K。
  • 带源类型与空间偏置的跨注意力是一枚可复用的小旋钮:用 ⟨image_g⟩/⟨image_l⟩ 标识来源、再用可学习标量偏置让局部 token 有选择地读全局 token,这套机制可以原样迁移到任何"多尺度 / 多图 / 主图+证据图"输入的 MLLM 场景,例如多页文档、视频关键帧加缩略图、遥感的大图加子区。
  • 数据配方值得复用:200 万粗配对经"双 OCR 融合 + 双向回译 + 多语 embedding 一致性过滤 + 人工抽检"收敛到 51 万高质量对,这个"先放大再严格收敛"的构建思路对任何需要区域级译文标注的任务(文档翻译、字幕、商品图)都适用。
  • 回放窗口的思想可直接搬到长文档/多页翻译:把 η 从"前 η 个区域"推广成"前 η 个句段/前若干页的译文",可以在不引入外部记忆的情况下获得术语一致性,代价只是提示变长。

局限与展望

  • 对检测器的依赖被低估:切片边界完全由自训练检测器决定,检测器细节又放在附录;手写、竖排、艺术字、极低对比度文本一旦漏检,就再也没有机会被翻译(实验中 PSC 的全面崩塌正说明切片质量是硬门槛)。一个自然的改进是把检测与翻译做端到端联合优化,或至少给 MLLM 一个"补漏"通道(在全局图上确认是否有未覆盖的文本区域)。
  • 延迟显著高于整图方案:Novel 场景首 token 延迟 3.0s 对 0.099s,FPS 0.035 对 0.041,逐区域串行解码是主要瓶颈。可考虑按语义分组做有限并行(同一段落内并行、段间保持顺序)、自适应 η,或对小区域用草稿-验证式解码。
  • 评测指标与主打的"完整性"错位:论文反复强调漏译是核心痛点,但主指标只有 BLEU / COMET,这两个指标对"少译了一句"的惩罚远不足以反映问题,也没有给出漏译率或区域召回这类直接指标——建议补一个区域级覆盖率/漏译率评测。
  • 统计口径与表格存在不自洽:GLoD 规模在摘要写作 510K 对、正文写作 "510K images and 517,354 image-text pairs"、Tab.1 与训练划分处又都是 517,354(512,180 + 5,174),需要统一;GLoTran-LoRA 行与其平均分不自洽(见主实验表注),且未说明 LoRA 的秩与目标模块,无法判断该对照是否公平。
  • 语言方向与场景覆盖仍偏窄:英中为主、MTIT6 每语向仅约 200 张图,且未报告非拉丁文字(如阿拉伯语、泰语)或极长文档场景的表现;GLoD 的 5 种语言与 40+ 场景在评测侧并未被充分覆盖。
  • 与偏好优化类方法尚未结合:InImageTrans 已证明 DPO 能压幻觉,本文只做全参数 SFT;把回放窗口内的一致性信号做成偏好对(一致译文 vs 漂移译文)来做 DPO/RL,是有希望进一步压低幻觉的方向。

相关工作与启发

  • vs 级联方法(PaddleOCR + NMT、Nougat 式文档处理、漫画翻译流水线):级联把识别与翻译解耦,单点可换、可解释,但误差逐级累积且多模型串行延迟高;GLoTran 由 MLLM 在切片上直接产出译文,识别与翻译共享同一套上下文,代价是丧失了 OCR 中间结果带来的可调试性。
  • vs 传统端到端 TIMT(Translatotron-V、LayoutDIT 等):它们联合编码视觉与语言直接映射成译文,效率好但任务专用、换版面就要重训;GLoTran 直接复用现成 MLLM 做全参数微调,泛化到 5 种语言、40+ 场景,代价是训练成本(8×A100、51 万训练对)。
  • vs InImageTrans:同样基于 MLLM 的 TIMT,同样在 MCiTon 上评测,InImageTrans 走的是多条件 DPO 路线来压幻觉;GLoTran 在平均分上明显领先(50.2/82.2 对 35.9/72.7),但它检验的是一个 8B 骨干上的结论,且两者正交——把 DPO 叠到双路感知框架上是一个自然的后续。
  • vs MT3(多任务强化学习)与 M4Doc(文档图像翻译):MT3 改的是训练目标,M4Doc 收缩到文档域;GLoTran 改的是视觉输入的组织方式与解码过程,与前者可叠加,与后者是"通用文本丰富场景 vs 文档专用"的分工。
  • vs 高分辨率 VLM 的通用策略(mPLUG-DocOwl2 / URaDeR 的形状自适应切块、ZoomEye 的树搜索、V* 的引导式视觉搜索):它们把局部块当作回答整体问题的辅助证据,切分随机或依赖搜索,容易截断文本、漏掉小实例;GLoTran 的判断是 TIMT 要求"全量、有序、语义一致",因此必须换成文本区域中心的抽取与保序编组,并把跨区域一致性显式放进解码——这是任务形态差异带来的方法学差异,而不只是工程细节的不同。

评分

  • 新颖性: ⭐⭐⭐⭐ 把 TIMT 重构成"低分辨率全局图 + 有序局部切片 + 译文回放"的双路递进翻译,formulation 的转变比单个模块更有价值;跨注意力偏置与双 OCR 数据构建本身则偏工程。
  • 实验充分度: ⭐⭐⭐⭐ 覆盖 8 个场景的英中评测、5 个语向的多语评测、3 个骨干的消融、超参与效率分析,还有"给现成 MLLM 喂检测区域"的对照;但只有 BLEU/COMET,缺少漏译率这类与主打卖点直接对应的指标,且部分表格数字不自洽。
  • 写作质量: ⭐⭐⭐ 方法主线清楚、图示到位,但 PDF 中公式提取残损、GLoTran-LoRA 行与平均分不自洽、数据集规模口径前后不一,细节打磨不足。
  • 价值: ⭐⭐⭐⭐ 对"高分辨率文本丰富图像怎么喂进 MLLM"给出了一个省 token、可复现、易迁移的答案,配套的 GLoD 与数据构建配方对后续 TIMT 工作有直接复用价值。