跳转至

LogFA: Efficient Feature-Space Data Augmentation for Egocentric Temporal Action Segmentation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/ZijiaLewisLu/ECCV2026-LogFA
领域: 语义分割
关键词: 时序动作分割、特征空间数据增强、视觉语言模型、长视频理解、广义有向无环图

一句话总结

LogFA 针对第一人称长视频动作分割中少样本泛化差与数据采集成本高的瓶颈,提出在预提取特征空间直接进行局部(提示词增强的跨模态文本特征映射)与全局(基于广义 DAG 的合理步骤重排)数据增强,以极低计算开销显著超越图像变换与像素级生成式扩散方法。

研究背景与动机

第一人称(Egocentric)AI 助手旨在从佩戴者的第一人称长视频中实时推断操作意图与动作进展,广泛应用于日常任务辅助、工业流水线指导和具身交互。然而,相同的任务流程在现实中可能涉及差异巨大的操作工具、材质颜色、操作习惯以及工作空间布局。由于采集和逐帧标注第一人称长视频的成本极其高昂,现有开源数据集往往每个任务仅包含有限的几段演示,导致时序动作分割(Temporal Action Segmentation, TAS)模型在部署到未经见过的全新环境或非标准操作流程时性能大幅衰退。

解决该泛化瓶颈的直观途径是数据增强,但现有方法面临严峻的两难困境。传统图像层面的几何变换或光度抖动仅能提供低级视差变化,无法引入工具替换、物体属性改变或场景重排等深层语义多样性,且过度形变容易破坏判别特征;另一类利用图像/视频扩散模型进行像素级编辑的生成式方法虽然语义多样性强,但计算开销极其恐怖——为一段 400 帧的视频生成一次单遍增强需耗费约 13.3 GPU 小时,在大规模数据集(如 EgoProceL)上生成全套增强甚至需耗费数千 GPU 天,且容易引入时序不连贯与视觉伪影。更关键的是,现代 TAS 模型普遍直接在预提取的视觉特征上进行序列建模,耗费巨资生成像素帧后再重新编码特征存在严重的计算浪费。

因此,本文的核心切入点是跳过像素级合成,直接在视觉特征空间中实现语义一致且多样化的数据合成。核心 idea:提出局部与全局协同的特征空间增强框架 LogFA,在局部级利用多模态对比语言模型的对齐空间并通过可学习的提示词特征增强(PFE)消除跨模态鸿沟,在全局级构建支持重复与可选子例程的广义有向无环图(GDAG)合规采样动作序列,实现高效且高度保真的长视频特征扩增。

方法详解

整体框架

LogFA 将数据增强解耦为互补的两个粒度:局部增强(动作内部的物体、工具及属性变化)与全局增强(动作序列的顺序多样性与执行策略)。整个系统分为离线特征增强与 TAS 模型训练两阶段。首先,输入带动作标注的少量训练视频片段,多模态大模型与文本大模型协同生成动作变体描述,通过冻结的视觉语言模型(VLM)与可学习的前缀嵌入映射为增强后的视觉近似特征;同时利用 LLM 总结任务的步骤依赖构建 GDAG。在训练阶段,模型以特定概率动态采样局部增强特征(辅以线性插值过渡)或依据 GDAG 拓扑采样重排片段,使得下游 TAS 模型无需访问真实未知场景即可建立强鲁棒性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:少量标注视频片段 v"] --> B["阶段 1:LLM 驱动的细粒度动作改写<br/>生成基准文本 t0 与 M 个变体文本 tm"]
    B --> C["阶段 2:提示词特征增强 PFE<br/>对齐损失 + 保真损失优化嵌入 Ev"]
    C --> D["局部增强特征 fm_hat<br/>逼近真实视觉特征分布"]
    A --> E["阶段 3:广义有向无环图 GDAG 构建<br/>建模可选动作、重复次数与复合例程"]
    E --> F["GDAG 转 DAG 并拓扑排序采样<br/>重排动作片段生成全新时序流程"]
    D --> G["阶段 4:随机插值与混合训练<br/>r1 局部插值 + r2 全局时序重排"]
    F --> G
    G --> H["下游 TAS 模型(如 FACT / MSTCN++)"]

关键设计

1. 局部特征增强:利用对比式 VLM 与提示词优化填补模态鸿沟 针对像素级生成式扩散模型计算极其昂贵的问题,局部增强旨在直接生成不同工具、物体或背景下的片段级特征。在对比视觉语言模型(如 SigLIP2)的联合嵌入空间中,视觉特征与对应的精准文本描述特征高度对齐。为此,LogFA 首先使用多模态 LLM(Qwen2.5-VL)对片段 \(v\) 提取细粒度动作描述 \(t_0\)(如“从蓝色塑料盒中拿鸡蛋”),再利用纯文本 LLM(Qwen3)基于常识生成 \(M\) 个合理的语义改写变体 \(t_1, \dots, t_M\)(如修改容器、颜色或使用汤匙)。

然而,文本特征 \(f_0 = \Omega(E_0)\) 与视频真实视觉特征 \(g = \Psi(v)\) 之间存在固有的模态鸿沟(实测余弦相似度仅为 0.18),直接使用文本特征作为视觉输入会导致模型崩塌。为此,LogFA 为每个片段引入片段专属的序列级可学习嵌入 \(\widehat{E}_v\),拼接在文本嵌入之后: $\(\tau(E_m) = \text{concat}(E_m, \widehat{E}_v), \quad \widehat{f}_m = \Omega(\tau(E_m))\)$ 通过冻结文本编码器 \(\Omega\),仅优化 \(\widehat{E}_v\) 来补偿文本缺乏的背景、光照及非核心视觉细节,成功将余弦相似度拉升至 0.72。

2. 保持语义区分度的双重优化目标 为了防止可学习前缀 \(\widehat{E}_v\) 退化为过度拟合视觉特征 \(g\) 而遗忘原文本词元语义(导致所有变体的增强特征塌缩为同一个常数),LogFA 设计了联合优化损失。一方面通过对齐损失拉近原始描述增强特征与视觉真实特征: $\(\mathcal{L}_{\text{align}} = -\cos(\widehat{f}_0, g) = -\frac{\widehat{f}_0 \cdot g}{\|\widehat{f}_0\|\,\|g\|}\)$ 另一方面,提出语义保真损失(Preservation Loss),利用对比形式强制变换后的增强特征 \(\widehat{f}_m\) 与其对应的未增强文本特征 \(f_m\) 保持最高相似度,同时配合软正则项约束其不偏离原始视觉特征太远: $\(\mathcal{L}_{\text{preserve}} = \frac{1}{M}\sum_{m=1}^{M} \left[ -\log \frac{\exp(\cos(\widehat{f}_m, f_m))}{\sum_{n=1}^{M}\exp(\cos(\widehat{f}_m, f_n))} + w (1 - \cos(\widehat{f}_m, g)) \right]\)$ 该设计使增强特征在继承视频环境上下文底色的同时,忠实保留文本修改所激发的物体和工具语义变异。

3. 全局流程增强:基于广义 DAG(GDAG)建模复杂时序拓扑 传统数据增强完全忽视了程序性任务在动作顺序上的全局多样性,而标准有向无环图(DAG)仅能表达严格的前置因果依赖,无法表达现实生活中普遍存在的“可选动作”(如沙拉中可加或不加黑胡椒)、“重复动作”(如切胡萝卜多次)以及“复合连续例程”(如洗菜-切菜-装盘构成不可被打碎的独立子流程)。

LogFA 提出了广义有向无环图(GDAG)。GDAG 包含扁平动作节点与层次化节点(子 GDAG,代表必须连续执行的子流程),并为每个节点赋予重复次数随机变量 \(C \sim \text{Uniform}(c_1, c_2)\)。例如,\(C \in \{0, 1\}\) 表示可选动作,\(C \ge 2\) 表示重复执行。构建时由 LLM(GPT-5o 或 Qwen3-30B)根据少量演示提取并输出 JSON 规范。采样时,将 GDAG 实例化为具体 DAG(丢弃 \(C=0\) 节点,复本复制 \(C>1\) 节点),再通过拓扑排序和广度优先遍历生成合规的全局动作时序,最后按采样顺序拼接真实动作特征片段,并在边界处进行特征线性插值以消除跳变。

损失函数 / 训练策略

在 TAS 训练阶段,系统以概率 \(r_1=0.3\) 启用局部增强:从 \(M\) 个增强特征中随机选取 \(\widehat{f}_m\),并与原视觉特征 \(g\) 进行连续凸组合插值: $\(\widehat{f}_m^{(\alpha)} = (1 - \alpha) g + \alpha \widehat{f}_m, \quad \alpha \sim \text{Uniform}(0, 1)\)$ 从而为 TAS 模型模拟出属性连续形变的特征轨迹(如容器颜色逐渐渐变)。系统再以独立概率 \(r_2=0.3\) 触发全局动作重排,依据 GDAG 采样的新序列重组视频特征。下游网络采用 FACT 或 MSTCN++ 等标准 TAS 架构,仅在训练中注入上述特征,测试阶段直接对未经任何增强的原始视频特征进行评估。

实验关键数据

主实验

在代表性第一人称基准 EgoPER(包含正常视频与反常错误视频)以及跨场景数据集 EgoProceL 上进行评估。每个任务仅采用 3 段视频进行低资源训练,重点检验模型面对未见受试者与域外(OOD)错误视频时的鲁棒性。

数据集 / 场景 方法配置 Edit F1@10 F1@25 F1@50 Acc (%)
EgoPER (In-Domain) Base (3 视频无增强) 77.5 80.9 77.3 64.1 65.3
EgoPER (In-Domain) Base + 传统图像变换 79.3 82.2 78.9 66.4 67.7
EgoPER (In-Domain) Base + 扩散生成模型 (Qwen-Edit) 80.5 82.4 79.1 67.0 69.2
EgoPER (In-Domain) Base + LogFA (本文) 82.8 86.1 83.0 70.7 74.0
EgoPER (Out-of-Domain) Base (3 视频无增强) 60.2 67.8 62.9 47.7 53.8
EgoPER (Out-of-Domain) Base + 传统图像变换 62.0 69.1 64.8 50.0 55.5
EgoPER (Out-of-Domain) Base + 扩散生成模型 (Qwen-Edit) 63.2 69.9 65.7 51.3 56.8
EgoPER (Out-of-Domain) Base + LogFA (本文) 68.6 76.0 71.9 57.0 66.0
EgoProceL (多任务综合) Base (3 视频无增强) 45.9 46.6 41.1 28.8 44.3
EgoProceL (多任务综合) Base + 传统图像变换 46.7 48.2 44.6 32.4 46.3
EgoProceL (多任务综合) Base + LogFA (本文) 52.0 51.2 46.9 35.0 54.7

(数据源自原论文 Table 3 与 Table 5,测试指标涵盖时序段编辑距离 Edit、分段重叠 F1@{10, 25, 50} 以及帧级准确率 Acc)

消融实验

消融实验深入验证了不同的文本修改类型、VLM 底座选择以及全局 GDAG 的必要性。

实验组别 配置说明 Edit F1@10 F1@25 F1@50 Acc (%)
EgoPER Coffee 局部改写类型 Base (无增强) 47.1 52.7 47.5 32.2 36.7
+ Type 1 (纯同义重写) 51.9 55.8 50.3 34.1 43.7
+ Type 2 (非关键背景/桌面布局增加) 53.7 56.6 51.9 35.8 44.7
+ Type 3 (物体材质/颜色变更) 53.1 55.4 51.5 36.8 45.6
+ Type 4 (操作方式与工具替换) 53.2 55.5 51.3 37.0 45.4
+ All (组合上述 4 类,SigLIP2) 55.8 57.6 53.5 38.4 45.0
+ All (换用 EgoVLP 视频底座) 53.5 56.9 52.5 36.7 44.9
EgoProceL 全局拓扑建模 Base (3 视频基线) 45.9 46.6 41.1 28.8 44.3
Base + 标准 DAG (仅前置因果) 46.2 46.1 41.1 28.8 46.1
Base + GDAG (引入重复/可选例程) 50.9 50.4 45.4 32.2 53.0

(数据源自原论文 Table 1 与 Table 2)

关键发现

  • 分布外泛化增益尤为显著:在 EgoPER 的分布外(OOD)反常执行视频上,LogFA 相比无增强基线的 F1@50 暴涨 +9.3%(从 47.7% 提升至 57.0%),而传统图像变换仅提升 2.3%,生成式扩散模型提升 3.6%。这证明特征空间的高层次语义改变真正赋予了模型应对异常流程与异构工具的能力。
  • 计算效率带来数量级压制:扩散编辑模型(Qwen-Edit)在双卡 40GB GPU 上每编辑一帧需约 1 分钟,单段 400 帧视频增强需 13.3 GPU 小时;而 LogFA 绕过像素渲染,PFE 优化单个增强仅需 1 张 GPU 耗时约 6 秒,全局 GDAG 仅需离线运行一次 LLM 推理,整体计算加速比达到 \(10\times\) 到百倍级。
  • GDAG 相比朴素 DAG 带来结构性飞跃:在 EgoProceL 上,标准 DAG 由于无法建模可选步骤与重复步骤,F1@50 相比 Base 完全持平(28.8% 对 28.8%);而 GDAG 成功释放了灵活流程的建模能力,F1@50 跃升至 32.2%(+3.4%),Acc 提升 8.7%。

亮点与洞察

  • 跳过像素渲染的特征直出范式:传统观念认为高质量数据扩增必须回到像素空间重构画面,LogFA 敏锐抓住了“下游时序模型本身就建立在冷冻特征提取器上”的本质,直接在潜空间中结合多模态嵌入与可学习前缀合成特征,省去了极其沉重的“图像编辑 \(\to\) 图像再编码”双重开销。
  • PFE 软提示词巧妙解决多模态对齐鸿沟:直接拿文本嵌入当作视觉特征会因背景与视觉细节缺失而失效(相似度仅 0.18),PFE 通过针对单个片段轻量拟合少许前缀 token,在保留改写文本相对差分向量的同时补偿了特定场景的背景底色,使相似度提升到 0.72。
  • GDAG 弥补了纯时序数据重排的理论空白:长视频动作分割向来缺乏通用的数据扩增手段,简单的片段打乱会彻底破坏常识逻辑。GDAG 抽象出了包含扁平节点、层次化节点及多项式重复区间的通用拓扑,使 LLM 能以极低成本输出结构严谨的常识执行流。

局限与展望

  • 依赖预训练视觉语言模型的域适应能力:虽然 SigLIP2 在通用物体上表现优异,但在高度特异的工业设备或专业医疗手术等特种第一人称场景中,通用 VLM 的文本到特征对齐能力可能下降,限制 PFE 的模拟精度。
  • 时序连续性依赖简单的特征插值:重排后的动作边界处目前仅使用线性插值进行平滑,未显式建模手部运动或相机大幅晃动引起的动态过渡,未来可探索轻量级的潜空间运动流平滑模块。
  • 视角拓展:当前实验集中于第一人称 Procedural 视频,未来应进一步扩展至 50Salads、Breakfast 等经典第三人称动作分割基准上验证通用性。

相关工作与启发

  • 对比扩散生成式增强(如 Qwen-Edit / DiffAct):扩散模型生成效果逼真但时间成本高昂,且难以在大规模长视频中保证帧间时序一致性;LogFA 在特征空间进行操作,耗时降低两个数量级,完全消除了像素级瑕疵对特征提取器的干扰。
  • 对比传统图像变换与 MixUp:色彩抖动与旋转无法赋予模型对“拿勺子代替拿夹子”这类工具替换的理解能力;同时由于时序动作具备明确的因果转移规律,盲目进行时序 MixUp 会混淆动作边界和标签,而 LogFA 通过 GDAG 严格保证生成流程的现实物理合理性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [突破性地将 VLM 潜空间特征重映射与 GDAG 拓扑重排引入长视频动作分割,视角独到]
  • 实验充分度: ⭐⭐⭐⭐⭐ [评测涵盖 In-Domain、Out-of-Domain 以及 Few-Shot 迁移,并提供了深度的语义 token 分析与细致消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图表清晰,对计算开销与特征距离的量化对比极为扎实]
  • 价值: ⭐⭐⭐⭐⭐ [有效击中了第一人称视频少样本采集与适配的高成本痛点,在工业界穿戴设备端侧部署场景中极具实用价值]