InstrAct: Towards Action-Centric Understanding in Instructional Videos¶
会议: ECCV 2026
论文: ECCV 官方页面
代码: https://zyyangzy.github.io/InstrAct/
领域: 自监督/表示学习
关键词: 教学视频理解, 以动作为中心, 静态偏差消除, 动态时间规整, 掩码动作建模
一句话总结¶
针对教学视频预训练中语音字幕噪声大以及模型严重依赖背景与物体的“静态捷径”问题,InstrAct 提出了包含大模型驱动的动词级难负例构建、Action Perceiver 紧凑动作表征蒸馏,以及结合 Soft-DTW 时序对齐和掩码动作建模(MAM)的自监督预训练框架,显著提升了以动作为中心的语义辨识与流程时序逻辑推理能力。
研究背景与动机¶
近年来,视频-语言预训练(Video-Language Pretraining)的重点逐渐从单原子动作的剪辑片段拓展至包含复杂多步工序的长时未剪辑教学视频(如 HowTo100M、COIN 等)。在现实教学场景中,完整任务往往由一系列具有因果与时序依赖性的动作步骤构成,模型不仅需要辨识单一的物体与动作,更必须建模工序展开的连贯时序演化。然而,当前主流的视频基础模型(Video Foundation Models, VFMs)在处理此类任务时普遍暴露出严重的“静态特征偏置(static bias)”——模型倾向于通过画面中的静态背景、常见物体(名词)等表观捷径来预测文本,而非真正理解动作(动词)及其动态交互。
这一困境在教学视频中尤为严峻。以往针对静态捷径的工作主要围绕短视频片段展开,通常依赖高质量人工标注或简单的动词替换策略。但未剪辑教学视频依靠自动语音识别(ASR)转录生成弱对齐字幕,存在大量的非教学闲聊、口语填充词,且语音和画面的动作发生时机存在显著的浮动和时序错位。这种弱而嘈杂的监督信号导致视频模型难以将多步动作与背景物体解耦,更无法准确对齐复杂的动作演进序列。单纯将短视频上的原子动作增强方法移植到长时教学视频中,既无法消除文本噪声,也无法学习到有序的操作逻辑。
本文的切入角度是将数据清洗、动作表征解耦与时序结构约束统一起来,建立一套面向工序性动作机制的预训练范式。通过 LLM 过滤无关口语并规范化抽取动词短语,合成动词替换与时序乱序两种强针对性的难负例;同时在视觉侧引入以动词特征为指导的 Action Perceiver 提炼动态 token,并以可微分动态时间规整与跨模态掩码预测联合驱动表征学习。核心 idea:通过大模型辅助提取结构化动词短语并生成动词替换与时序乱序难负例,结合 Action Perceiver 动作感知压缩、Soft-DTW 时序对齐与掩码动作建模(MAM),系统性消除静态物体捷径并强化教学视频的时序动作推理。
方法详解¶
整体框架¶
InstrAct 旨在从长时弱监督教学视频中学习真正“以动作为中心”的特征表示,其整体流程涵盖数据侧的结构化动作挖掘以及模型侧的三重优化目标。首先,输入视频帧序列经过预训练视频编码器提取时空特征,由 Action Perceiver 压缩为固定数量的时序动作潜变量 token;文本端则通过 LLM 清洗非教学噪声,提取出规范的结构化动词短语序列,并构造针对性的动词替换与时序乱序难负例。随后,框架通过多重目标协同训练:全局视频-文本对比损失强化宏观匹配,基于 Soft-DTW 的时序对齐目标对齐动作 token 与动词序列,掩码动作建模(MAM)解码器强化深层跨模态交互,并借助动词引导的知识蒸馏将动词语义隐式注入感知潜变量空间中。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["长时教学视频与弱对齐 ASR 字幕"] --> B["LLM 辅助数据清洗与难负例构建<br/>过滤闲聊 · 抽取动词短语 · 生成动词与时序负例"]
B --> C["Action Perceiver 动作特征压缩与蒸馏<br/>可学习时序查询交互 · 动词教师引导蒸馏"]
C --> D["DTW-Align 时序动作对齐<br/>Soft-DTW 序列对齐 · 乱序对比正则化"]
C --> E["掩码动作建模 MAM<br/>自回归因果语言解码 · 跨模态注意力预测动词"]
D --> F["以动作为中心的视频-语言表征输出"]
E --> F
关键设计¶
1. LLM 辅助数据清洗与动作难负例构建:消除非教学噪声并切断静态捷径
教学视频原生 ASR 字幕中充斥着“嗨大家好”、“欢迎回来”等无关口头表达,缺乏视觉实体支撑。该设计首先利用大模型二分类器过滤非教学文本,仅保留描述具体食物制备与物理操作的步骤。随后,利用 LLM 将保留文本解析为符合预定义句法模式(如“V + N”、“V-ing”、“V + Prep + N”)的结构化动词短语序列(例如将“用马克杯沿磕破鸡蛋并分离蛋清”标准化解构为 ['crack egg', 'separate white'])。在此基础上,构造两类硬负例(Hard Negatives):其一是保持物体与背景不变、仅替换核心动词的动词替换负例(Verb-altered HNs),迫使模型关注动态变化而非静态物体;其二是打乱动作先后次序的时序乱序负例(Order-swapped HNs),使词袋模型(Bag-of-Words)失效,迫使模型学习连续工序的严格因果时序。
2. Action Perceiver 与动词引导知识蒸馏:从冗余视频特征中提炼动作元
长视频特征往往被静态背景的大量冗余 token 主导。为滤除静态冗余,模型设计了基于 Perceiver 架构的 Action Perceiver。设视频帧输入提取的时空特征为 \(V \in \mathbb{R}^{T \times N \times C}\),引入一组包含局部时间窗口掩码的 \(K\) 个可学习查询向量 \(L \in \mathbb{R}^{K \times C}\),通过交叉注意力压缩生成学生的时序动作向量 \(S \in \mathbb{R}^{K \times C}\): $\(S = \text{Perceiver}(q = L, k = V, v = V)\)$ 由于下游推理时无法直接获得动词标注,训练时通过动词引导的教师分支施加蒸馏:将提取的动词短语嵌入 \(P \in \mathbb{R}^{M \times C}\) 作为查询与 \(V\) 计算交叉注意力得到教师动作向量 \(T\)。利用双向对比蒸馏损失函数将学生潜变量 \(S\) 的相似度分布对齐到以动词为中心的教师向量 \(T\) 的空间上: $\(\mathcal{L}_{\text{distill}} = \mathcal{L}_{\text{single}}(s_{v2t}, s'_{v2t}) + \mathcal{L}_{\text{single}}(s_{t2v}, s'_{t2v})\)$ 通过该软标签匹配,引导潜变量查询关注真正的动作时空演化,在推理期无需动词先验亦可输出动作敏感的浓缩表示。
3. 基于 Soft-DTW 的时序对齐与乱序对比正则:非线性弹性对齐操作工序
由于教学视频中各个动作的持续时间长短不一,且语音描述与画面发生往往存在时间偏移,刚性的一对一匹配极易产生错位。该设计将动作 token 序列 \(S = \{s_1, \dots, s_K\}\) 与动词嵌入序列 \(V = \{v_1, \dots, v_M\}\) 之间的余弦距离构建为代价矩阵 \(C \in \mathbb{R}^{K \times M}\),并采用可微分的 Soft-DTW 寻找具备极小累积代价的单调对齐路径: $\(\mathcal{L}_{\text{align}}(S, V) = \text{Soft-DTW}(C)\)$ 为防止单纯优化对齐损失带来的退化解,引入基于时序反转的对比正则项(Order-Aware Regularization):将动作序列完全倒序构造负样本 \(\tilde{S} = [s_K, \dots, s_1]\),并施加合页损失(Hinge Loss)确保正向工序的对齐代价显著低于反向序列,强制模型严格感知步骤的前后因果关系: $\(\mathcal{L}_{\text{order}} = \max\left(0, \mathcal{L}_{\text{align}}(S, V) - \mathcal{L}_{\text{align}}(\tilde{S}, V) + \beta\right)\)$
4. 掩码动作建模:细粒度跨模态动作语义与运动线索重构
尽管对比学习和 DTW 能建立序列级关联,但双编码器架构在 token 级别的跨模态细粒度交互上仍显不足。为此,InstrAct 接入一个多模态因果文本解码器,在每层文本自注意力后引入与视频动作 token \(S\) 的交叉注意力层。在预训练过程中,随机掩码字幕中的关键动作词汇,要求模型自回归预测被遮挡的动作词: $\(\mathcal{L}_{\text{mam}} = -\sum_{t=1}^{N-1} \log P(y_{t+1} \mid h_{1:t}, S)\)$ 该目标迫使多模态网络在文本动词缺失的条件下,必须深入挖掘视觉动作 token \(S\) 中的运动动态特征来重构缺失的动作意图,彻底打消仅凭文本上下文猜词的语言先验捷径。
实验关键数据¶
主实验¶
论文评测覆盖三个动作理解基准:InstrAct-Semantic(10 选 1 动词细粒度选择,控制物体完全相同,评估动作区分度)、InstrAct-Logic(时序乱序 3-4 选 1 逻辑多选题,评估动作工序推理)、以及 InstrAct-Dynamics(基于 120 个物体池的细粒度真实视频跨模态检索,共 16,326 个剪辑片段,避免利用物体作为检索捷径)。
| 基准与指标 | 评价指标 | 本文 (InstrAct) | 最佳基线 (VideoPrism) | 次佳基线 (PerceptionLM) | 经典基线 (MIL-NCE) |
|---|---|---|---|---|---|
| InstrAct-Semantic | R@1 (%) | 28.1 | 18.2 | 16.5 | 7.2 |
| R@5 (%) | 78.0 | 74.4 | 63.2 | 49.4 | |
| Mean Rank (↓) | 3.0 | 4.0 | 4.0 | 6.0 | |
| InstrAct-Logic | ACC (%) | 40.0 | 31.3 | 31.4 | 5.1 |
| InstrAct-Dynamics | T2V R@1 / R@5 (%) | 33.86 / 54.73 | 27.23 / 48.49 | 16.33 / 32.11 | 12.63 / 30.77 |
| V2T R@1 / R@5 (%) | 35.19 / 59.52 | 34.13 / 59.08 | 23.10 / 42.05 | 15.04 / 34.42 | |
| Mean R@1 / R@5 (%) | 34.53 / 57.13 | 30.68 / 53.79 | 19.72 / 37.08 | 13.84 / 32.59 |
消融实验¶
在 InstrAct Bench 上对难负例构建方式、Action Perceiver 模块以及对齐与生成式目标进行的细致消融实验如下表所示:
| 配置 / 变体 | 动词负例 | 乱序负例 | Action Perceiver | MAM 损失 | DTW 对齐 | Semantic R@1 (%) | Semantic R@5 (%) | Logic ACC (%) | 说明 |
|---|---|---|---|---|---|---|---|---|---|
| Full model (InstrAct) | ✓ | ✓ | ✓ | ✓ | ✓ | 45.1 | 90.8 | 44.7 | 完整模型协同效果最佳 |
| w/o DTW 对齐 | ✓ | ✓ | ✓ | ✓ | – | 43.7 | 90.0 | 39.4 | 缺少 DTW,时序逻辑 ACC 下降 5.3% |
| w/o MAM 目标 | ✓ | ✓ | ✓ | – | ✓ | 38.7 | 86.5 | 40.2 | 缺少 MAM,细粒度动词 R@1 下降 6.4% |
| w/o Action Perceiver (MAM) | ✓ | ✓ | – | ✓ | – | 41.0 | 89.4 | 37.6 | 仅用原始帧特征交互,特征冗余导致全面衰退 |
| w/o Action Perceiver (DTW) | ✓ | ✓ | – | – | ✓ | 37.3 | 87.2 | 37.4 | 原始帧计算 DTW 易受物体静态热点干扰 |
| 仅动词难负例 (单向评测) | ✓ | – | ✓ | ✓ | ✓ | 46.7 | 91.2 | 40.0 | 未受乱序干扰时动词辨识更专一,但泛化受限 |
| 仅乱序难负例 (单向评测) | – | ✓ | ✓ | ✓ | ✓ | 28.1 | 78.0 | 44.2 | 专注于时序次序,但动词辨析精度不足 |
在时序对齐代价(Normalized DTW Cost)分析中,基于原始帧嵌入的对齐代价为 0.97,而经过 Action Perceiver 提炼的潜变量代价降至 0.91,定性热力图显示原始帧激活大量分散于静态物体(如整个视频中无论动作均激活“果酱”),而 Action Perceiver 则呈现清晰的阶梯状对角线激活。
关键发现¶
- 双目标的互补性明确:MAM(掩码动作建模)的核心贡献在于局部细粒度动词语义辨析,为 Semantic R@1 带来显著跃升;而 Soft-DTW 对齐则专注全局多步工序的时间顺序建模,使 Logic ACC 提升超 5 个百分点。两者联合优化达成了动作辨析与逻辑推理的最佳平衡。
- Action Perceiver 破除静态物体注意力捆绑:定性与对齐代价实验证实,传统未压缩的时空特征严重被常驻物体吸引,导致 DTW 对齐发生病态坍缩;通过带局部时序掩码的潜变量 Resampler 与动词教师蒸馏,Action Perceiver 能在无需人工标注的情况下稳定提取纯动作动力学流。
- 跨骨干网络泛化性极强:InstrAct 框架扩展至 MIL-NCE、CLIP-ViP、CLIP4Clip 和 ViCLIP 四大主流骨干时均取得一致性提升,在 ViCLIP 上将 InstrAct-Semantic 的 R@1 从 14.7% 提升至 45.1%,InstrAct-Logic ACC 从 30.0% 提升至 44.7%。
亮点与洞察¶
- 通过物体受控评测剥离捷径:构建了 InstrAct-Dynamics 等以特定物体归类的同质检索池,从评测设定上迫使模型丢弃“通过物体名字匹配视频”的偷懒行为,为视频理解领域的偏差评估提供了坚实基准。
- 动词引导的软蒸馏设计精妙:仅在预训练阶段借助提取的动词文本作为教师引导查询去重构视觉动作,推理期则无需任何动词输入,有效解决了实际下游任务中没有精确动作先验的落地难题。
- 工序级动作可迁移至通用长视频推理:将连续时间规整(DTW)与时序乱序负例相结合的机制,可直接迁移到机器人操作演示学习(Robot Learning from Demonstration)及第一人称具身操作等长流程建模场景中。
局限与展望¶
- 作者承认的局限:数据清洗目前主要在 HowTo100M 的烹饪子集(Cooking domain)上进行训练和验证,虽涵盖丰富交互,但在工业制造、手工艺修缮等更长跨度、更精密工具操作中的跨领域迁移表现仍有待进一步拓展。
- 潜在改进方向:当前动词短语提取依赖离线 LLM 单步解析,未来可探索端到端的跨模态动态自举框架,让视觉动作模块反哺文本生成,实现无外部 LLM 辅助下的自监督动作发现。
相关工作与启发¶
- vs MIL-NCE [21]: MIL-NCE 依靠多示例对比学习在弱对齐未剪辑教学视频中粗粒度匹配正样本,但由于缺乏对抗性动词和时序难负例,模型极端依赖物体名词捷径,在 InstrAct-Semantic 上 R@1 仅 7.2%;本文通过数据清洗、难负例注入与 DTW 时序建模全面弥补了这一短板。
- vs VideoPrism [41] & PerceptionLM [3]: 尽管大规模预训练模型具有较强的时空表征能力,但在同物体干扰的精细步骤时序辨析(InstrAct-Logic)中准确率依然停留在 31% 左右;InstrAct 显式引入的 Order-Aware DTW 模块大幅强化了长工序因果依赖推理(达到 44.7%)。
评分¶
- 新颖性: ⭐⭐⭐⭐ [针对长教学视频静态捷径问题,联合设计了动词蒸馏 Perceiver 与非线性时序对齐机制]
- 实验充分度: ⭐⭐⭐⭐⭐ [设计了三类细粒度评测基准并对 4 种基础模型展开广泛测试,消融实验详实]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,问题定义明确,图表清晰直观]
- 价值: ⭐⭐⭐⭐⭐ [为长视频理解、具身工序建模与规避静态表征偏置提供了极具参考价值的范式]