跳转至

title: >- Learning Probabilistic Embeddings for Unsupervised Action Segmentation 论文笔记 description: >- ECCV2026 论文 PEOT 用时序图预测高斯帧嵌入,通过多次采样生成最优传输伪标签,缓解无监督动作分割的错误自强化;解析训练与推理、四数据集结果及概率建模和 GCN 的消融。 tags: - ECCV2026 - 视频理解 - 无监督动作分割 - 概率嵌入 - 最优传输 date: 2026-09-17


Learning Probabilistic Embeddings for Unsupervised Action Segmentation

会议: ECCV2026
论文: ECCV 原文
代码: https://github.com/derkbreeze/PEOT
领域: 视频理解 / 无监督时序动作分割
关键词: 概率嵌入、最优传输、图卷积网络、伪标签、异方差不确定性

一句话总结

PEOT 用局部时序图预测每帧的高斯嵌入,以多次采样驱动最优传输伪标签和交叉熵训练,测试时只用均值,在 Desktop Assembly 上相对代码复现的 ASOT 将 MoF 从 59.0 提高到 71.2、F1 从 63.7 提高到 75.8,但并非所有数据集的所有指标都领先。

研究背景与动机

无监督时序动作分割要把一段未裁剪长视频划成动作片段,同时发现哪些片段属于同一种动作,而训练时没有逐帧动作标签。 这与给整段视频判断一个类别不同:做早餐的视频可能先放茶包再倒水,也可能交换顺序,同一个倒水动作还可能出现多次。 较早的方法先学习预测相对时间等表征,再独立聚类和解码,表征学习未必直接服务于最终的分割目标。 TOT、ASOT 等方法把这两件事交替起来:用当前帧嵌入和动作原型求出最优传输分配,再把分配当作伪标签训练网络。 其中 ASOT 通过结构代价鼓励相邻帧保持动作一致,并允许动作占比不均衡,减轻固定顺序和等长动作假设的限制。

这种循环仍有一个薄弱处:当前嵌入如果把一段动作分错,后续交叉熵就会要求网络更确信这个错误,下一次 OT 又容易返回相似分配。 确定性帧向量只给优化器一个表征位置,无法显式表达某一帧其实还可能落在邻近的其他位置。 作者据此提出,应该改变进入聚类的表征,而不是继续堆叠更复杂的 OT 层级。 但直接添加统一强度的噪声也不够,因为动作内部、动作边界和模糊画面的不确定程度不同,单帧估计还可能缺少稳定上下文。 因此本文同时引入按输入学习的高斯分布和局部时序图,让模型利用邻帧决定表征的中心与可变化范围。

这里的概率建模主要是训练策略,不是要求部署时反复采样得到大量分割结果。 训练中,不同样本会产生不同的视觉代价和伪标签,使表征有机会脱离过早固定的错误划分;测试时仍输出一条确定的动作分割序列。 论文的核心问题因此不是“怎样用方差替代分类器置信度”,而是“怎样让自训练循环在早期保留重新划分动作的空间”。 核心 idea:以时序上下文预测数据相关的高斯帧嵌入,让 OT 在训练时看到多种可能表征及其伪标签,最后用学到的均值完成分割。

方法详解

整体框架

输入是每段视频的预提取逐帧特征,而不是直接从原始像素训练一个新视频骨干。 单隐层 MLP 先把特征投影到帧嵌入空间,随后“时序图高斯编码”预测每帧的均值和对角协方差。 训练分支经过“采样驱动的 OT 分配”,对每个高斯样本计算帧到动作原型的代价,并独立估计软伪标签。 “多样本训练与均值推理”将这些样本对应的交叉熵取平均,更新编码器和动作原型;推理分支跳过随机采样,只对均值执行 OT。 输出是每帧的动作簇归属及由此形成的时序片段,簇与真实动作名称的匹配属于评测步骤,不是训练监督。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        Input["预提取帧特征"] --> MLP["MLP 帧投影"]
        MLP --> Gaussian["时序图高斯编码"]
        Gaussian -->|训练:高斯样本| OT["采样驱动的 OT 分配"]
        OT -->|每个样本的伪标签| Strategy["多样本训练与<br/>均值推理"]
        Gaussian -->|推理:仅均值| Strategy
        Strategy -.->|训练:交叉熵更新| Gaussian
        Strategy -->|推理:均值经 OT| Output["动作簇与时序片段"]

图中的反馈表示训练目标更新表示网络,MLP 和动作原型也参与更新;它不表示梯度穿过 OT 伪标签求解器。 概率分布不是给动作类别直接建立一个贝叶斯后验,而是建立在连续帧嵌入上,再通过 OT 转成动作分配。 这一区别解释了为什么同一个概率嵌入思路还能接入 VASOT,而不必把它限定为某一种新的聚类目标。

关键设计

1. 时序图高斯编码:用相邻帧估计表征中心和可变范围

每个采样帧是图中的一个节点,默认连到前一帧、自己和后一帧,所以“3 帧连接”包含自连接,而不是左右各连 3 帧。 邻接边按特征相似度加权,加入自连接后再做对称的度归一化,使节点能够聚合邻域信息并保留自身特征。 一个 GCN 分支预测均值,另一个预测对数方差;每帧、每个嵌入维度都可以有不同的方差。 对数方差参数化用于保证方差为正,这里的数据相关变化就是异方差不确定性,而不是所有视频共享一个固定噪声尺度。 图卷积使用局部上下文,让同一动作内部的估计更平稳;边权随输入变化,也避免把每一个邻帧都同等对待。

\[ p(\mathbf z\mid\mathbf x_i)=\mathcal N\!\left(\boldsymbol\mu_i,\operatorname{diag}(\boldsymbol\sigma_i^2)\right), \qquad \mathbf z_i=\boldsymbol\mu_i+\boldsymbol\epsilon\odot\boldsymbol\sigma_i, \quad \boldsymbol\epsilon\sim\mathcal N(\mathbf0,\mathbf I). \]

这里的分布对应原文式 (5),采样关系来自第 6 页的重参数化说明,乘法按维度进行。 协方差为对角形式,意味着模型不显式估计嵌入维度之间的完整相关性;它不是任意形状的联合分布。 与固定卷积核的 TCN 相比,GCN 聚合权重依赖相邻帧内容;与单帧 MLP 相比,它有额外的时序证据判断方差。 不过更宽的邻域未必更好,跨越动作边界的聚合可能抹平短动作,论文因此用连接范围消融支持局部设计。 原文式 (6) 的提取文本在范数处存在异常,正文明确称边权为余弦相似度;这里依据文字解释,不把损坏的式子当作可直接照抄的实现。

2. 采样驱动的 OT 分配:让伪标签随表征样本重新估计

每次从高斯分布采样后,都将采样嵌入与可学习动作原型比较,得到帧到动作的视觉分配代价。 代价还包含帧相对位置与原型相对位置之间的时间先验;这是一项软偏好,不能理解成每段视频必须严格遵循同一动作顺序。 OT 本身沿用 ASOT,而不是本文新提出的求解器:Kantorovich 项衡量逐帧分配代价,Gromov-Wasserstein 项提供时序结构约束。 后者惩罚时间邻域内相近帧被分给不同动作的组合,对邻域外的帧则不施加同样惩罚。 这种约束在分配阶段鼓励连续性,与 GCN 在表征阶段平滑局部信息是两种不同作用,不能合并理解为同一个滤波操作。

每帧必须分配固定的总质量,但动作侧边际只通过 KL 正则软约束到均匀分布,因此不强迫所有动作获得相同数量的帧。 这对长短差异明显、重复出现或部分缺失的动作很重要;熵正则则控制分配的平滑程度。 原文用镜像下降求解该非凸 OT 问题,报告每次求解迭代复杂度为 \(O(NK)\),其中 \(N\) 是帧数、\(K\) 是动作原型数。 采样改变的是视觉证据与随后产生的伪标签,而不是简单对固定伪标签施加随机扰动。 因此它能够改变哪个动作簇解释哪些帧,理论动机是减轻错误标签与错误表征的相互强化,并不构成逃离所有局部最优的保证。

3. 多样本训练与均值推理:训练探索多种划分,部署只用一个表示

对每个采样嵌入,模型以帧与动作原型的温度缩放点积构成动作概率,并把该样本的 OT 软分配当作交叉熵目标。 同一视频采样 \(M\) 次,就得到 \(M\) 组嵌入、\(M\) 组伪标签和 \(M\) 个损失,最后取平均近似分布下的期望损失。 这不是先把所有采样嵌入平均成一个向量再求一次 OT,也不是多个模型之间的集成训练。 每个样本通过重参数化关系给均值与方差分支提供梯度,但伪标签估计与网络更新仍按交替优化方式进行。

\[ \mathcal L_{\mathrm{uncer}}\approx -\frac{1}{MN}\sum_{m=1}^{M}\sum_{i=1}^{N}\sum_{j=1}^{K} t_{ij}^{(m)}\log p_{ij}^{(m)}. \]

这是原文式 (11) 的 Monte Carlo 训练目标,\(t_{ij}^{(m)}\)\(p_{ij}^{(m)}\) 分别表示第 \(m\) 次样本的伪标签与动作概率。 论文将这一过程类比 EM:先用当前表示得到目标,再优化表示,而不是直接使用人工动作标签。 本文列出的目标没有额外引入一个 VAE 式的标准高斯先验 KL 损失,不应仅因出现高斯分布和重参数化就把它称为 VAE。 推理时保留均值分支,把均值作为最终帧表示计算 OT 代价,方差分支和 Monte Carlo 采样不再用于最终分割。 所以准确说法是推理没有多次采样的开销,而不是声称相对任何 MLP 基线都已经测得完全相同的运行时间。

一个完整示例

考虑论文讨论的做茶视频:放茶包与倒水的顺序可能变化,当前模型也可能把一个短动作并入相邻长动作。 MLP 先投影输入帧特征,局部 GCN 再结合相邻采样帧预测高斯分布,短动作附近可能具有较大的表示变化范围。 训练默认取 \(M=3\),因此同一视频会进入 3 次基于不同样本的 OT 分配,并分别产生交叉熵监督。 如果这些分配在模糊区域不同,更新不再只强化最初那一次划分,均值和方差都有机会随训练改变。 测试时仅使用学到的均值求一次对应的分割,不需要投票选择 3 个训练样本中的某一个。 这只是按论文机制构造的解释性例子,不代表作者报告了这段做茶视频的逐帧方差或 3 次具体标签结果。

损失函数 / 训练策略

实现使用带 ReLU 的单隐层 MLP 和单层 GCN,从每段视频均匀划分的区间采样 256 帧。 默认 \(M=3\),Adam 学习率为 \(10^{-3}\),权重衰减为 \(10^{-4}\),动作原型由 K-means 初始化。 原型数 \(K\) 采用每种活动的真实动作类别数;无逐帧监督不等于完全不知道动作词表规模。 四个数据集均沿用既有预提取特征,其中 Breakfast 和 50Salads 使用 IDT,训练和推理使用同一类输入特征。 原文将训练复杂度写为 \(O(MTNK)\),对照基线为 \(O(TNK)\);此处 \(T\) 指梯度下降步数,不是前文的运输矩阵。 更具体的耗时和超参数被指向补充材料,本笔记未从当前主文缓存中推断这些未提供的实测值。

实验关键数据

主实验

采用活动级 Hungarian 匹配:在同一种活动的所有视频上统一对齐预测簇与真实动作,而不是每个视频单独寻找最有利的对应。 MoF 是正确逐帧预测的百分比;F1 按片段统计,匹配片段中正确帧超过真实片段长度的 50% 才计为真阳性;mIoU 对动作类别求平均。 F1 和 mIoU 再在活动间平均,50Salads 使用包含 12 类的 Eval 粒度,因此不能与其他粒度直接混比。

下表摘录主文第 10 页表 1 与表 2,所有值沿用论文的百分数尺度;“文献”和“复现”是两套基线来源,不可混用。

数据集 方法及来源 MoF F1 mIoU
Breakfast ASOT,表 1 文献结果 56.1 38.3 18.6
Breakfast ASOT,表 2 代码复现 56.4 35.7 17.2
Breakfast PEOT,表 1/2 60.7 40.5 19.0
YTI ASOT,表 1 文献结果 52.9 32.1 24.7
YTI ASOT,表 2 代码复现 49.0 34.1 23.7
YTI PEOT,表 1/2 55.4 37.4 22.9
50Salads (Eval) ASOT,表 1 文献结果 59.3 53.6 30.1
50Salads (Eval) ASOT,表 2 代码复现 59.4 56.7 25.6
50Salads (Eval) PEOT,表 1/2 64.9 58.9 30.2
DA ASOT,表 1 文献结果 70.4 68.0 45.9
DA ASOT,表 2 代码复现 59.0 63.7 40.6
DA PEOT,表 1/2 71.2 75.8 51.7

DA 的 MoF 对代码复现提升 12.2 个百分点,即相对提高约 20.7%;F1 提升 12.1 个百分点,即相对提高约 19.0%。 若改与文献表比较,同一数据集的 MoF 只提高 0.8 个百分点,因此摘要中的最大增幅不能直接解释成超越既有发表结果的幅度。 表 1 的 12 个数据集与指标组合中,PEOT 在 9 个组合领先,但 CLOT 在 50Salads 的 F1/mIoU 为 63.2/38.8,高于 PEOT 的 58.9/30.2。 另一个反例是 YTI:VASOT 的 mIoU 为 25.2,高于 PEOT 的 22.9,说明逐帧准确率进步不自动意味着类别交并比进步。 来源一致性说明:第 9 页正文写 YTI 的 MoF 增幅为 +1.5,但表 1 的 55.4 与 52.9 相减为 +2.5;这里保留表值并明确指出冲突。

消融实验

下表为主文第 11 页表 3 的 Breakfast 与 50Salads (Eval) 子集,其他训练与评测设定遵循论文;“仅概率”由 MLP 预测分布,“仅 GCN”仍使用确定性嵌入。

配置 BF MoF BF F1 BF mIoU FS MoF FS F1 FS mIoU
无概率,无 GCN 56.4 35.7 17.2 59.4 56.7 25.6
仅概率 59.2 34.9 15.1 60.1 56.3 23.7
仅 GCN 58.2 40.7 18.5 50.4 48.7 17.2
概率 + GCN 60.7 40.5 19.0 64.9 58.9 30.2

仅概率在 BF 上使 MoF 提高,却让 F1 从 35.7 降至 34.9;仅 GCN 在 FS 上甚至把 MoF 从 59.4 降到 50.4。 两者结合才在所列数据集上产生较稳定的整体收益,但 BF 的确定性 GCN F1 40.7 仍略高于完整模型的 40.5。 这支持“时序条件下学习分布”这一组合设计,不支持“任意加噪声”或“任意加图卷积”都有效的结论。

主文第 11 页表 7 在 Breakfast 上比较 Monte Carlo 样本数,其余设置保持一致;\(M=1\) 仍然采样,不是确定性基线。

训练样本数 MoF F1 mIoU
\(M=1\) 60.0 39.4 18.4
\(M=2\) 60.3 40.1 18.8
\(M=3\) 60.7 40.5 19.0
\(M=5\) 60.6 40.3 18.9

关键发现

  • 收益在 \(M=3\) 后饱和,增加到 \(M=5\) 没有继续改善三个指标,支持采用较小采样预算。
  • 第 11 页表 5 中,3 帧图的 BF MoF 为 60.7,5 帧图为 58.9;作者将更宽邻域的退化解释为可能的过平滑,而不是已证明的唯一原因。
  • 第 12 页表 8 中,DA 上固定高斯噪声、Dropout、学习不确定性的 MoF 分别为 61.9、65.3、71.2,说明收益不只是统一噪声正则化。

亮点与洞察

  • 不确定性参与了伪标签的生成,而不只是训练结束后的置信度展示。变化发生在自训练目标的来源处,因而可能打断错误分配的自强化。
  • GCN 平滑表征、OT 约束分配,两层时序归纳偏置作用于不同对象。消融提醒我们,真正有用的是二者与概率建模的协作,而非单个模块的名字。
  • 训练使用分布、推理使用均值,使探索预算集中在学习阶段。这个接口适合迁移到其他依赖伪标签的聚类流程,但迁移收益仍需要专门验证。

局限与展望

  • 原型数采用每活动真实动作类别数,并依赖既有预提取特征;实验没有证明在类别数未知或原始视频端到端学习时仍保持同等优势。
  • 不确定性并非可靠的逐帧错误检测器:第 14–15 页图 6 与文字说明,一些错误帧仍具有低不确定性,不能把低方差直接当作正确保证。
  • 训练要重复求解 OT,推理无需采样不代表训练免费;当前主文表格未给出多次运行的误差条,微小分差的稳定性不能由这些表独立确定。
  • YTI 的 mIoU 和 50Salads 的部分片段指标不占优,说明该方法尚未同时解决类别覆盖、短片段和边界精度问题。
  • 作者提出训练早期按较高不确定性增加采样,以及让伪标签生成可微;这些是未来方向,而非现有实验已验证的功能。

相关工作与启发

  • ASOT:提供本文复用的不均衡融合 OT 框架。PEOT 的主要变化位于帧表征和训练采样,而不是重新设计一个更复杂的运输目标。
  • VASOT:联合视频对齐与动作分割,涉及同活动视频对的匹配。表 2 将概率嵌入接入它后,FS MoF 从 53.4 提高到 62.2,但 mIoU 从 26.7 降到 26.4,迁移也不是全指标单调改善。
  • CLOT:以帧与片段之间的反馈及多层 OT 改进分割,对短片段具有优势。本文简化了这类层级结构,但其 50Salads 片段指标差距说明简洁性伴随性能取舍。
  • 概率表征工作:已有词、图像、人脸和姿态概率嵌入多依赖监督匹配;本文把分布建模引入无监督时序聚类。可延伸的问题是让采样数量取决于训练阶段或帧不确定性,同时检验方差是否真的校准。

评分

  • 新颖性: 4/5。把概率嵌入用于 OT 自训练循环,贡献清晰,但高斯建模、GCN 和求解器本身都有既有基础。
  • 实验充分度: 4/5。四个数据集、两个接入基线及结构与采样消融较完整,统计稳定性和未知类别数设置仍不足。
  • 写作质量: 4/5。训练和推理逻辑明确,但部分正文数值与表格不一致,需要谨慎读取。
  • 价值: 4/5。为伪标签过早固化提供了相对简洁的改进方向,实际使用时应分别检查帧级与片段级收益。