ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing¶
会议: NeurIPS 2026 — Evaluations and Datasets Track
arXiv: 2609.40356
代码: https://github.com/taco-group/ViTeX-Bench
领域: 视频生成 / 视频场景文字编辑 / 数据集与评测
关键词: 场景文字编辑、字形视频条件、字符正确性、时序一致性、编辑局部性
一句话总结¶
ViTeX-Bench 用真实视频配对训练数据、冻结评测集和三轴 13 项指标揭示文字正确、运动稳定与背景保留之间的差异,并提供带运动对齐字形条件的 ViTeX-Edit-14B 参考编辑器,其字符准确率均值在受测视频原生编辑器中最高,但并非所有指标最优。
研究背景与动机¶
视频生成模型已经能合成连贯画面,但把场景中的一串文字准确替换成另一串,比“让画面看起来合理”要求更严。每帧字符必须正确,文字还要贴着原来的表面运动,周围物体、光照和镜头动态不能被顺便改掉。FLUX-Text 等图像文字编辑器能在单帧上写对字,却没有跨帧约束;首帧编辑加 AnyV2V 传播容易让文字逐渐漂移;VACE、VideoPainter 和 Kling 等视频编辑器能够组织运动,却未必能控制精确字符序列。
已有视频质量或指令遵循指标不能直接回答“整个片段里是不是一直出现目标字符串”。一个模型可以完整保留源文字而取得很好的稳定性与背景保留分数,也可以生成漂亮画面却写错字。另一方面,真实视频的成对编辑样本难以获得:文字位置随透视变化、遮挡和运动改变,逐帧制作人工参考代价很高,而且目标字体、颜色和光照并不存在唯一正确答案。
本文因此把主要贡献放在可复用资源与测量协议上,再用一个参考编辑器展示数据的用途。核心 idea:用模型辅助、人工复核的流程构造训练参考,同时把字符正确性、视觉与时序质量、编辑局部性分别测量,避免把“稳定但没改对”误认成成功编辑。
方法详解¶
整体框架¶
每个任务输入源视频、逐帧文字区域掩码、源字符串和目标字符串,输出只在指定区域改字的视频。ViTeX-Dataset 提供 387 段真实源视频:230 段含经过复核的合成编辑参考用于训练,157 段构成永久冻结的评测集且不提供编辑参考。标准视频为 1280×720、120 帧、24 fps,即 5 秒;训练参考不是唯一真实标注渲染。
整个系统包括“配对数据构建”“运动对齐字形条件”“共享合成控制”“三轴评测”四个部分。前两者支持参考编辑器的训练和推理;共享合成控制是可选的确定性后处理;三轴评测独立读取源视频、掩码、字符串与模型输出,不参与优化。图中的虚线表示训练监督或测量依赖,实线表示编辑推理与后处理的数据流。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["源视频、掩码<br/>源串与目标串"] --> B["配对数据构建"]
A --> C["运动对齐字形条件"]
B -.->|230 段配对参考| T["监督微调"]
T -.->|训练后的编辑器| C
C --> R["原始编辑输出"]
R --> D["共享合成控制"]
R -.->|raw 测量| E["三轴评测"]
D -.->|Composite 单独测量| E
A -.->|冻结评测输入| E
关键设计¶
1. 配对数据构建:用首帧改字与视频传播得到可学习的参考
作者从 Panda-70M 和 InternVid 筛选真实场景文字片段,再构造四种资产。标注者在首帧提示 SAM 3,向后传播掩码并修正漂移,最后用 25×25 椭圆核膨胀 3 次,给字符边缘留下编辑余量。Qwen3-VL-32B-Instruct 读取首帧文字并提出长度接近的替换串,随后由人工审查。removal-1.3B 去除源文字及相关阴影、高光,形成干净背景;Gemini 3 Pro Image 重写首帧,再由 SAM 3 分出目标文字补丁。这样训练参考的生成不是单纯贴一行字体,而是利用图像编辑器先生成与场景外观相容的文字。
静止文字可以把同一个补丁 alpha 合成到所有背景帧,称为策略 A;运动文字则交给 PISCO 插入器传播首帧参考,称为策略 B。静态片段两种策略都运行并选更好的结果,动态片段只使用 B,因此最终 56 段 A、174 段 B 是构造策略数量,不能当成静态与动态视频数量。覆盖审计另报告约 25% 静态、75% 动态。PISCO 还在与这 387 段不重叠的辅助场景文字视频上微调,以去字视频为输入、原视频为恢复目标,并使用文字区域的非模态补全监督。
训练集提供源视频、编辑参考、掩码与字符串对;评测集仅提供编辑输入。人工复核不能消除所有合成误差:参考编辑的 OCR 完整匹配率为 0.585、CharAcc 为 0.790;人工读取校准裁剪的 CharAcc 为 0.917,97% 被判为可读。这既说明 OCR 会低估部分生成文字的可读性,也说明这些参考不能被视为无误差的唯一 ground truth。
2. 运动对齐字形条件:把目标字符结构沿源文字轨迹送入视频模型
ViTeX-Edit-14B 基于 Wan2.1-VACE-14B。原有两路条件分别是经冻结 uMT5-XXL 编码的目标文本,以及 VCU 接收的源视频和掩码;新增第三路不是语言描述,而是目标文字的字形视频。拉丁文字由 Qwen3-VL 从字体库选择近似源字体,非拉丁文字使用对应脚本的默认字体。目标串被渲染成黑底白字,首帧文字四边形由 EasyOCR 检出,CoTracker3 跟踪后续 119 帧,再用逐帧单应变换使目标字形跟随原文字的位置、尺度和透视。
字形视频经过冻结 Wan VAE,随后用步幅为 (1,2,2) 的 patch embedding 展成 token。64 个可学习查询通过交叉注意力汇聚它们,形成固定长度的字形 token 束;每个 VACE block 再通过新增条件交叉注意力读取这束 token,以残差方式注入。输出投影采用零初始化,使新分支在初始化时不改变原骨干输出。其针对的问题很具体:文本编码能告诉模型目标串的语义,却未必给出每个笔画应长什么样、在哪一帧出现在哪里;字形视频同时提供结构和运动参照。
这一路不是免训练外挂。作者尝试过只在推理时提供字形视频,以及微调时把字形视频直接塞入既有 VCU,两种定性试验的字符正确性都较差,因而引入专用字形分支。但没有完成受控组件消融,不能把主实验增益精确归因于字体选择、跟踪、64-query 汇聚或新增注意力中的某一个组件。
3. 共享合成控制:区分区域生成能力与恢复源背景的收益
全帧视频模型会重建原本不该改动的背景,而 TextCtrl、RS-STE 等局部裁剪编辑器天然复制大量源像素,直接比较局部性可能混入接口差异。Composite 因此对所有八个基线和参考编辑器使用同一后处理:在掩码外环带统计预测与源图的 LAB 颜色均值和标准差,校正预测区域的色调;再沿掩码边界用 4 像素羽化带,把编辑区域贴回源帧,最后统一编码。
它是无训练、无需 GPU 的后处理,不是参考编辑器独有的学习模块。编码前,除边界附近的窄带外,外部像素直接来自源视频;因此局部性大幅提升主要说明背景恢复有效,而不是生成模型学会了更好地保留背景。raw 与 Composite 必须分开报告,不能把后处理结果混入原始编辑器排序。所有基线的 Composite OCR 只做了抽样检查,完整的文字与文字裁剪时序重评分只对 ViTeX-Edit-14B 这对输出完成。
4. 三轴评测:把改对字、稳定画面与局部编辑分别检查
文字轴使用 PP-OCRv5,经 NFKC、大小写折叠及空白与标点移除后比较字符串。先在源帧上判断文字能否被识别:源 OCR 与源字符串的相似度至少 0.5 才进入可检测集合。评测集有 5 段没有这样的帧,SeqAcc 与 CharAcc 的视频均值因此只有 152 段支持;TTS 还要求至少一个相邻可检测帧对。先按帧计算、再按视频聚合,最后跨支持视频取均值,并不是把所有帧混成一个准确率。
核心距离是子串编辑距离:把目标串变成预测 OCR 串的任意连续子串所需的最少字符编辑数,预测串前后多出的字符不付代价。下式给出字符相似度和完整目标子串匹配率;\(r\) 是参考串,\(c\) 是候选串,\(\mathcal D\) 为源可检测帧集合。
CharAcc 是可检测帧上的目标串相似度均值,允许部分字符正确;SeqAcc 要求完整目标串作为子串出现,却不保证没有额外文字。TTS 只统计相邻可检测帧 OCR 字符串完全相等的比例,稳定地写错也能取得高分,必须结合前两项阅读。
视觉与时序轴有六项指标:全帧和文字裁剪两个范围各计算 Flicker、Warp、MUSIQ。Flicker 是相邻输出帧的平均绝对像素差;Warp 用源视频的 RAFT 光流对齐相邻输出帧后计算误差,不从编辑结果重新估计光流;MUSIQ 是无参考感知质量。文字裁剪始终采用所有逐帧掩码空间并集的包围框,再加 16 像素边距,整个视频使用同一窗口,避免移动裁剪框引入额外抖动。全帧 MUSIQ 使用全部帧,裁剪 MUSIQ 使用源可检测帧;Flicker 和 Warp 使用所有相邻帧。运动跨度大时,固定裁剪仍可能包含不少背景;低时序误差也可能来自平滑或近乎恒定的输出。
局部性轴另有 PSNR、SSIM、LPIPS、DreamSim 四项。测量时把预测帧的掩码内部替换回源像素,只保留掩码外的预测差异,再与源帧比较。下面是测量用的局部性合成,不是上一设计中真正输出的 Composite 后处理。
PSNR、SSIM 越高越好,LPIPS、DreamSim 越低越好。三轴主指标分别为 SeqAcc、文字裁剪 Warp、DreamSim-loc,剩余十项提供诊断;协议没有加权总分。Pareto 前沿只表示没有其他方法在三项上同时不差且至少一项更好,不能当成编辑成功认证:SeqAcc 为零的 VACE 也能凭稳定性与局部性进入前沿。
一个完整示例¶
考虑一段明确标注为研究素材的 5 秒白板视频,把中性文字 “LAB” 改成 “MAP”,镜头缓慢移动。此例用于解释机制,不是论文实验样本或新增结果。
先给原文字区域逐帧掩码,再跟踪首帧四边形;渲染出的 “MAP” 在 120 帧字形视频里随白板改变位置和透视。参考编辑器读取字形、目标串、源视频和掩码生成 raw 输出;可选 Composite 只把生成的文字区域融合回原视频,二者分别进入评测。
如果某帧 OCR 输出 “AMAPB”,子串距离仍为零,所以该帧可以获得完整匹配分;这暴露出额外字符不受罚的边界。如果每一帧都稳定输出 “LAB”,TTS 可以很高,但没有完成目标编辑。若字写对却从白板上漂移,源光流对齐后的文字裁剪 Warp 会揭示另一类问题。遮挡导致源 OCR 不可检测的帧不计入正确性,不能据此宣称整段所有帧都被验证。
损失函数 / 训练策略¶
训练用配对参考进行 Flow-Matching 监督微调,冻结主 DiT、uMT5-XXL 和 Wan VAE,仅更新 VACE 分支、字形编码器与条件交叉注意力。这里不把 OCR 指标写成训练损失;论文用它们做评测,也没有给出需要重新构造的特殊字符奖励公式。
第一阶段在 720p、49 帧上训练 5 个 epoch,学习率 \(5\times10^{-5}\),AdamW 权重衰减 0.01,数据重复 10 次;第二阶段接续训练 720p、121 帧,2 个 epoch,学习率 \(1\times10^{-5}\)。有效 batch size 都为 64,使用 8 张 H100 80GB、梯度累积、检查点与 CPU offload。两阶段约 22 小时与 50 小时,即合计 576 GPU-hours,只是参考编辑器这次微调的成本,不含上游预训练、配对数据生成或 PISCO 辅助微调。推理进行一次 50 步生成。
实验关键数据¶
主实验¶
下表摘取原文表 2 的代表性原始输出,覆盖四类基线及参考编辑器。SeqAcc、CharAcc 越高越好,文字裁剪 Warp 与 DreamSim-loc 越低越好;正确性支持 152 段,其他指标按各自支持集统计。
| 方法 / 编辑家族 | SeqAcc | CharAcc | TTS | 文字裁剪 Warp | DreamSim-loc |
|---|---|---|---|---|---|
| 源视频,仅作参照 | 0.000 | 0.317 | 0.760 | 1.27 | 0.000 |
| AnyText2 / 逐帧 | 0.280 | 0.633 | 0.382 | 3.95 | 0.043 |
| TextCtrl / 逐帧 | 0.475 | 0.734 | 0.511 | 2.09 | 0.004 |
| FLUX-Text / 逐帧 | 0.528 | 0.737 | 0.326 | 13.01 | 0.012 |
| RS-STE / 逐帧 | 0.354 | 0.626 | 0.534 | 1.81 | 0.007 |
| TextCtrl + AnyV2V / 首帧传播 | 0.057 | 0.308 | 0.257 | 3.97 | 0.073 |
| Wan2.1-VACE-14B / 视频修补 | 0.000 | 0.298 | 0.689 | 1.56 | 0.007 |
| VideoPainter / 视频修补 | 0.364 | 0.619 | 0.606 | 不参与排序 | 0.024 |
| Kling Video 3.0 Omni / 指令编辑 | 0.000 | 0.208 | 0.641 | 2.90 | 0.061 |
| ViTeX-Edit-14B / 参考编辑器 | 0.341 | 0.688 | 0.648 | 1.53 | 0.024 |
VideoPainter 由原生 8 fps、49 帧适配到 24 fps、120 帧,涉及重复填充、线性插帧和空间缩放;这会机械改变相邻残差,原文因此把其 Flicker、Warp 排除出时序排序,也不纳入三主指标 Pareto 比较。源视频没有编辑,排除出模型排序。
ViTeX-Edit-14B 的 CharAcc 比 VideoPainter 高 0.069,但 SeqAcc 反而低 0.023。表 3 的 95% 视频 bootstrap 区间分别为 CharAcc 0.688 [0.644, 0.732] 对 0.619 [0.559, 0.676],SeqAcc 0.341 [0.266, 0.413] 对 0.364 [0.300, 0.434]。这些区间重叠,论文没有建立成对显著性结论;“最高”限定于受测视频原生编辑器的字符准确率均值,不包括表现更高的逐帧 TextCtrl 和 FLUX-Text。
消融实验¶
原文没有受控字形组件消融,以下是表 2、附录 H 的共享后处理分析,不替代网络设计消融。ViTeX-Edit-14B 的 raw 与 Composite 完整重评分如下。
| 指标 | Raw | Composite | 解释 |
|---|---|---|---|
| SeqAcc | 0.341 | 0.345 | 完整目标子串匹配仅小幅变化 |
| CharAcc | 0.688 | 0.689 | 字符准确率基本接近 |
| PSNR-loc,dB | 29.08 | 42.95 | 恢复源背景带来主要局部性收益 |
| DreamSim-loc | 0.024 | 0.002 | 外部感知差异明显降低 |
| 文字裁剪 Warp | 1.53 | 1.56 | 后处理没有使这项时序误差下降 |
对所有八个基线使用同一 Composite 后,PSNR-loc 约为 43 dB,显示局部性收益跨模型存在。基线后处理的 OCR 仅抽样检查,报告的 \(|\Delta|\leq0.04\) 不等于全评测集正确性不变,不能据此构造完整 Composite 排名。
测量有效性还通过表 10 的三位非作者评分者、70 个输出进行校准。人工评分范围为 1–3;相关系数描述该样本上自动指标与人工判断的一致趋势,不是模型间显著性检验。
| 轴 | 评分者一致性,ordinal Krippendorff \(\alpha\) | 自动主指标 | 与人工评分的 Spearman \(\rho\) |
|---|---|---|---|
| 文字正确性 | 0.87 | SeqAcc | +0.71 |
| 时序质量 | 0.80 | 文字裁剪 Warp | -0.40 |
| 编辑局部性 | 0.37 | DreamSim-loc | -0.53 |
关键发现¶
- FLUX-Text 的 SeqAcc 为 0.528,但文字裁剪 Warp 为 13.01;逐帧字符准确不等于视频中稳定地改字。
- 源视频 TTS 为 0.760、SeqAcc 为 0;Kling 的全帧 MUSIQ 为 72.23、SeqAcc 也为 0。稳定性、画面质量和成功替换是不同命题。
- 三主指标 raw 前沿包含 FLUX-Text、TextCtrl、RS-STE、ViTeX-Edit-14B 和 VACE;VACE 零 SeqAcc 的成员身份再次说明前沿不是通过线。
- 152 段支持视频的 1,000 次重采样达到平均 Kendall \(\tau=0.936\),95% 保留首位方法;这支持域内排序稳定,不证明更广泛场景覆盖。
- 七段非拉丁评测切片上 AnyText2 的 SeqAcc 为 0.168、CharAcc 为 0.295,其余八个编辑器 CharAcc 均低于 0.19;样本太小,不能下分语言结论。
亮点与洞察¶
- 最有价值的是把“不编辑”保留为参照。它直接展示高稳定性和高局部性可以与零目标匹配共存,迫使评测同时检查语义成功。
- 固定掩码并集裁剪与源光流各消除一种测量混淆:前者避免裁剪窗口自身抖动,后者让输出运动接受源轨迹检验。但二者仍需与字符正确性一起解释。
- 字形条件从静态笔画提示变成随源表面运动的视频提示。这个思路把“写什么”和“字应该如何运动”耦合起来,可启发其他需精确局部结构的视频编辑研究。
- 统一 Composite 是对背景保留机制的控制分析。它让复制源像素的收益显式可见,而不把这种收益全部归给学习模型。
局限与展望¶
- 数据规模有限且偏向可读、局部、拉丁文字;评测集为 Latin 150、Chinese 4、Japanese 1、Cyrillic 2 段。密集布局、曲面、严重遮挡和极端运动仍覆盖不足。
- 参考编辑器依赖字体库、首帧 OCR 检测、四边形跟踪和投影模型;非拉丁默认字体与源风格可能不匹配,跟踪失败也会污染条件。应通过受控消融和失配测试分离这些依赖。
- 源可检测筛选减少不可读输入的干扰,却把最难的帧及五段视频排除出正确性支持;子串距离又不惩罚目标串外的额外文字。未来可并报严格整串准确率与遮挡分层结果。
- 人工转录研究只有一位作者;独立掩码审计仅 12 段且使用同一传播流程。局部性人工一致性仅 0.37,绝对感知分数的解释需要谨慎。
- 配对参考来自模型辅助流程,最初发布未记录逐条目标串拒绝、重采样及首帧编辑重试次数。应扩展 provenance 和独立审查,而不是仅增加合成数量。
- 数据为 CC-BY-NC 4.0 非商业研究用途,上游来源仍带各自许可约束;代码与参考模型为 Apache-2.0,不能据此推断数据可商用。研究示例应使用明确标注素材,不用于误导性或证据性篡改。
相关工作与启发¶
- vs STRIVE:同样研究视频场景文字替换,STRIVE 以静态编辑及传播、区域中心评测为主;本文补充配对训练资源、冻结真实视频评测以及字符、时序和外部保留的联合诊断。
- vs GlyphMastero:图像字形编码提供笔画先验,本文把它扩展成运动对齐的字形视频,再注入 VACE。新意在时序条件适配,但组件贡献尚未被受控实验分开验证。
- vs EditBoard / FiVE / IVEBench / VEFX-Bench:通用编辑评测关注指令、质量和保留,ViTeX-Bench 把指定字符串逐帧正确性变成可操作测量;两类协议互补,不是完全替代。
- vs 逐帧文字编辑器:TextCtrl、FLUX-Text 更擅长精确字符,视频原生编辑器更容易保留时间结构。后续研究可考虑两者结合,但必须同时复测三轴,不能仅优化一个漂亮分数。
评分¶
- 新颖性: 4/5 — 将真实视频文字替换资源与字符级三轴评测系统化,参考架构主要沿用已有字形条件思路。
- 实验充分度: 4/5 — 八个基线、置信区间、共享后处理及人工校准较完整,但规模、非拉丁覆盖与受控消融仍不足。
- 写作质量: 4/5 — 指标支持、适配例外与成功边界说明清楚,复现成本和标注 provenance 仍需进一步补全。
- 价值: 4/5 — 提供可复用的任务协议,尤其能识别“稳定但错误”的编辑;现实泛化仍有明显空间。