跳转至

GuideMe: Benchmarking Multi-Domain Task Guidance and Intervention in Streaming Video

会议: ECCV 2026
论文: ECCV 原文
代码: https://guideme-benchmark.github.io
领域: 视频理解
关键词: 多模态大模型、交互式任务指导、流式视频、错误检测与干预、评测基准

一句话总结

构建了首个支持闭环交互式任务指导的多领域流式视频基准 GuideMe(包含 2,458 个长视频、47,775 个交互样本),并通过时空语义二部图匹配与行为分类评估框架,揭示了现有 MLLM 擅长单向步骤指令却在实时错误检测与纠正干预上普遍严重退化的关键能力不对称性。

研究背景与动机

近年来多模态大语言模型(MLLM)在离线视频理解与静态问答上取得了长足进步,但当试图将它们部署为真实场景下的“实时流程教练”(Procedural Coach)时,现存技术仍存在巨大鸿沟。在家具装配、日常烹饪、器械维修或健身指导等复杂活动中,人类执行者极易偏离既定流程——例如跳过关键步骤、误用错误工具或动作顺序倒错。一个真正可靠的 AI 助手绝不能仅充当被动的视频旁白解说员,而必须在严格的时间因果流约束下形成闭环交互机制:连续观察用户的局部执行、敏锐捕捉细微错误,并在关键时间节点主动介入,提供针对性的修正建议以将用户引导回正确轨迹。

然而,现有面向流程性活动的视频数据集与评测机制无法支持这种端到端的闭环评测。一方面,传统流程视频数据集(如 Epic-Kitchens、YouCook2、COIN、IKEA 等)大多记录专家理想演示,仅提供步骤级动作标注,完全缺乏用户犯错与修复的负例信号;另一方面,即便少数关注错误检测的数据集(如 CaptainCook4D、Assembly101、EgoPER 等)引入了错误标签,它们也止步于离线、事后的被动检测,既不提供纠正性干预指导,更未记录干预后用户动作改变的连续因果响应。更为关键的是,现存流式视频基准(如 StreamingBench 等)通常在预设时间戳强加外部 QA 查询,仅仅考察“何时回答已知问题”,根本无法评估智能体在无外部唤醒时自主决策“保持沉默还是主动发声”的核心能力。

针对上述多重困境,本文提出了首个覆盖多领域的流式交互式指导基准。研究的核心切入点在于将任务指导抽象为“指示-观察-纠偏”的循环过程,并将评估解耦为时序定位对齐、发声时机行为分类以及内容语义质量。核心 idea:构建包含烹饪、物体操作、日常生活与健身四大领域的流式闭环交互基准 GuideMe,结合时空语义二部图匹配、发声时机行为分类与 LLM-as-a-Judge 三维评测框架,全面诊断与约束 MLLM 在连续因果流下的主动纠偏能力。

方法详解

整体框架

GuideMe 将交互式任务指导形式化为因果流式环境下的在线决策任务。在推断过程中,智能体仅在视频起始处接收一次任务目标查询,此后必须在严格无未来信息的前提下以滑动窗口机制观察视频流,并自主决定当前时刻是输出 Silent 保持静默,还是主动介入输出下一阶段指引或错误纠正。该评测基准主要包含两大支撑体系:一是三阶段多源自动化标注管线,用于从非结构化多源数据中提炼高质量闭环对话;二是三维评估体系,实现对流式输出序列的时间覆盖、行为倾向和语言质量的无阈值度量。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多源非结构化流程视频<br/>EgoPER / CaptainCook4D / HoloAssist / QEVD"] --> B["三阶段自动化标注管线<br/>动作抽取分类 → 知识提炼 → 时间对齐对话生成"]
    B --> C["因果流式在线交互推断<br/>60s 滑动视觉窗口 + 对话历史 → 决策沉默或干预"]
    C --> D["时空语义二部图匹配<br/>时间高斯衰减 + 文本余弦代价最小化分配"]
    C --> E["发声时机行为分类<br/>CS / FA / NR / PC 四象限分类与综合评分"]
    D --> F["LLM-as-a-Judge 内容质量评估<br/>针对匹配交互对的事实性与因果逻辑评分"]

关键设计

1. 三阶段多源自动化标注管线:从异构流程数据提炼闭环交互样本

以往包含错误的数据源在动作粒度、状态图与纠正描述格式上极度碎片化,无法直接用于训练流式助手。为了低成本、高保真地构建大规模交互式对话,本文设计了包含三步的端到端管线: - 动作抽取与细微错误分类:从 EgoPER、CaptainCook4D、HoloAssist 和 QEVD 等数据源中抽取原子动作序列,合并连续冗余动作,剔除信息量极低的过渡动作(如单纯手部旋转、短暂握持)。将每个原子动作明确归类为正确动作(Correct)、错误动作(Wrong)或纠错动作(Correction)。 - 任务知识鲁棒提炼:利用大语言模型从动作序列中推断标准任务名称并归纳出高层规范步骤。针对输入动作混杂错误动作可能引入的逻辑污染,设计了并行采样机制(\(N=10\)),并在二次汇总提示词中通过跨候选一致性过滤矛盾步骤,提炼出规范流程知识。 - 动作边界对齐的对话生成:在时间轴上将长视频按最多 200 条动作分段,结合全局任务知识与局部子步骤上下文,在动作起始点生成动作前指示(Pre-action instruction),在动作终点生成执行确认反馈或错误检测与纠正指导(Error detection & Corrective guidance)。针对缺乏显式纠正文本的源数据集,利用状态转移任务图计算偏离节点与正确后继节点之间的语义差分,自动生成纠错指引。

2. 时空语义二部图匹配:摆脱刚性对齐的流式序列级评估

流式环境下模型自由发声的时间点与参考答案很难做到逐帧绝对对齐,传统的逐点对齐指标(如 TimeDiff)无法容忍微小时间抖动,且无法评估语义等价性。为此,本文将生成序列 \(G=\{(g_i, t_i)\}_{i=1}^N\) 与参考序列 \(R=\{(r_j, \hat{t}_j)\}_{j=1}^M\) 的评估建立在二部图匹配框架之上。 系统首先依据相邻参考时间戳的中点将视频分割为若干区间,保证每个评估片段内仅含一个真实的激活事件。在局部片段内构建代价矩阵 \(C_{i,j} = \mathcal{L}_{\text{text}}(g_i, r_j) + \mathcal{L}_{\text{dist}}(t_i, \hat{t}_j)\)。其中文本代价定义为:

\[ \mathcal{L}_{\text{text}}(g_i, r_j) = \begin{cases} 0, & \text{if } g_i, r_j \in \text{Silence} \\ 1 - |\cos(\mathbf{e}_i, \mathbf{\hat{e}}_j)|, & \text{otherwise} \end{cases} \]

式中 \(\mathbf{e}_i, \mathbf{\hat{e}}_j\) 为句向量编码器的嵌入向量。时间距离代价引入高斯衰减惩罚时间偏差:\(\mathcal{L}_{\text{dist}}(t_i, \hat{t}_j) = 1 - \exp\left(-\sigma |t_i - \hat{t}_j|^2\right)\)。 在基于匈牙利算法求得最优分配 \(\mathcal{A}\) 后,为避免二值阈值划分带来的刚性截断,本文引入连续语义相似度 \(S_{i,j}=|\cos(\mathbf{e}_i, \mathbf{\hat{e}}_j)|\) 作为软权重,分别计算软精度(sPrecision)、软召回(sRecall)及其调和平均值 Soft-F1(sF1),在完全无阈值设定的前提下联合度量时间定位准确度与语义覆盖率。

3. 发声时机行为分类与质量裁决:精细度量沉默与干预的平衡

在流式交互中,“知道何时闭嘴”与“知道何时说话”同等重要。仅凭覆盖率无法揭示模型是倾向于过度发声(聒噪)还是倾向于过度沉默(迟钝)。评测框架在每个视频中构建两类等量的测试实例:以真实干预时间戳为基准的助手锚定实例,以及距离任何干预点至少 5 秒以上的纯静默实例。 模型的每次决策被严格划分为四种互斥的行为结果: - 正确静默(Correct Silent, CS):在静默测试点准确输出 Silent; - 错误报警(False Alarm, FA):在应保持静默的时刻产生多余发声; - 无响应(No Response, NR):在真实需要干预的时间节点遗漏干预、输出静默; - 部分正确(Partly Correct, PC):在需要干预的节点成功介入。

为了建立综合衡量指标,CS 获得满分 100 分,FA 和 NR 均判定为 0 分,而对 PC 实例则通过 LLM-as-a-Judge 对其回复的事实性与因果指导质量进行打分(0-100 分),全样本的均值记为综合得分 Score。与二部图匹配相辅相成,这一分类直接量化了模型在流式互动中的主动权平衡。

一个完整示例

以烤箱/微波炉杯子比萨制作(Microwave Mug Pizza)为例: - 02:55 - 03:01 关键错误干预点:用户在刚加入香草后准备加盐,但手持一把潮湿且带残渣的量勺。 - 真实基准指导(GT):“稍等一下(Hold on a second),你好像正准备加盐,请务必使用干净且干燥的量勺,以免原料黏结。” - 现有模型表现:Doubao-Seed-1.8 与 Qwen3-VL 径直忽略量勺问题,输出 routine 指令“很好,香草已加好,下一步加入马苏里拉奶酪”;GPT-5.2 与 MMDuet2 保持沉默(输出 Silent,产生 NR 错误)。模型严重缺乏对细微隐患的监视敏感度。 - 05:06 - 05:07 工具/原料错误干预点:用户在涂抹酱料环节伸手拿取了辣味萨尔萨酱(Salsa),而非披萨所需的番茄玛格丽特酱(Marinara)。 - 真实基准指导(GT):“提醒一下,你伸手去拿酱料了,但请确保使用的是玛格丽特番茄酱,而不是萨尔萨辣酱。” - 现有模型表现:多数闭源商业模型仍输出“已拿到披萨酱,倒入两勺并抹平”,未能纠正原料混淆,导致下游步骤连锁失效。

实验关键数据

主实验

在 GuideMe-Test(473 个视频、46.7 小时、9,876 个交互样本)上全面评测了商业闭源模型、开源通用 MLLM 及开源流式专有模型,采用 Anchor-Based 采样与标准滑动窗口配置。

模型类别 模型 参数量 sPrecision (%) ↑ sRecall (%) ↑ sF1 (%) ↑ \(Score_m\) CS (%) ↑ NR (%) ↓ FA (%) ↓ PC (%) ↑ Score ↑
商业闭源 Doubao-Seed-1.8 - 30.6 47.5 36.8 63.1 8.8 6.1 34.8 44.2 38.8
GPT-5.2 - 30.2 36.8 32.5 64.4 13.4 16.8 30.6 39.2 38.9
Gemini 3 Pro - 39.3 36.9 36.5 66.6 17.5 22.0 19.0 41.5 44.8
Gemini 3.1 Pro - 29.3 46.9 35.7 61.5 7.4 6.3 36.4 49.9 37.8
开源通用 Qwen2.5-7B 7B 30.1 30.9 29.3 57.5 19.7 20.4 25.4 34.5 37.5
Qwen3-VL-8B 8B 29.7 46.8 35.7 62.0 5.2 6.7 37.7 50.5 31.9
Qwen3-VL-30B-A3B 30B 29.5 46.9 35.6 61.6 6.7 6.0 36.5 50.9 33.3
Qwen3.5-397B-A17B 397B 38.4 20.2 21.7 64.6 35.2 37.9 7.9 19.0 45.7
流式专用 VideoLLM-online 8B 22.3 41.1 28.7 40.8 0.0 0.0 43.6 56.4 22.6
Dispider 7B 1.0 0.1 0.1 46.7 43.6 56.3 0.0 0.1 43.6
LiveStar 8B 20.7 19.0 19.1 14.4 21.2 24.4 22.2 32.3 25.0
MMDuet2 3B 3.3 0.2 0.4 43.3 41.7 57.9 0.2 0.2 41.8
领域微调 Qwen3-VL-8B† 8B 40.3 43.7 39.7 58.1 19.5 20.6 24.5 35.3 42.1

注:† 表示在 GuideMe 训练集微调。

消融与灵敏度分析

1. 交互行为类别分项表现(Gemini 3 Pro vs. Doubao-Seed-1.8)

模型 指导类型 sF1 (%) ↑ NR (%) ↓ PC (%) ↑ Score ↑
Gemini 3 Pro Routine Instruction 42.0 33.3 66.7 33.0
Error Detection 33.8 39.6 60.4 20.2
Corrective Guidance 34.3 41.7 58.3 23.1
Doubao-Seed-1.8 Routine Instruction 49.6 8.9 91.1 41.9
Error Detection 41.9 14.8 85.2 26.2
Corrective Guidance 42.7 15.0 85.0 30.0

2. 推断协议与历史依赖消融实验(100 个抽样测试视频)

模型 采样协议与上下文设置 sPrecision (%) ↑ sRecall (%) ↑ sF1 (%) ↑ CS (%) ↑ NR (%) ↓ FA (%) ↓ PC (%) ↑ Score ↑
Doubao-Seed-1.8 Dense (1s 间隔全采样) 23.1 26.3 21.9 89.3 4.4 4.7 1.6 90.3
Anchor* (基准锚点采样) 30.6 47.9 36.9 7.8 6.1 34.3 51.9 38.6
w/o GT (使用自身模型预测历史) 43.5 14.2 20.0 33.9 50.9 8.4 6.8 38.3
Gemini 3 Pro Dense (1s 间隔全采样) 10.0 53.2 14.5 45.4 2.1 48.4 4.1 47.9
Anchor* (基准锚点采样) 39.7 35.6 35.7 18.1 23.1 19.0 39.9 43.7
w/o GT (使用自身模型预测历史) 35.7 25.1 28.0 27.6 36.4 14.6 21.3 39.1

关键发现

  • 行为模式呈现两极分化:模型分化为“激进型”与“保守型”。激进型(如 VideoLLM-online、Qwen3-VL-8B、Doubao)发声极高频,PC 达 50% 以上,但误报率 FA 畸高(>34%),近乎丧失沉默能力;保守型(如 Dispider、MMDuet2、Qwen3.5-397B)倾向于全程沉默,CS 偏高,但遗漏了绝大部分必要干预(NR 达 37% 至 57%)。
  • 严重的能力不对称性:所有模型在标准步骤指令(Instruction)上均表现优良,但在错误检测(Error)与纠偏干预(Correction)上性能急剧衰退。例如 Gemini 3 Pro 在指令上的 Score 为 33.0,而在错误与纠正上暴跌至 20.2 和 23.1。现有模型能够复述“流程应该发生什么”,却无法敏锐判断“现实发生了什么偏差”。
  • 模型体量与流式预训练并非灵丹妙药:参数量提升并不能解决闭环决策难题(397B 模型的 sF1 仅 21.7,反而大幅落后于 8B 模型)。早期流式专有模型出现极端崩塌(Dispider sF1 仅 0.1,VideoLLM-online CS 为 0)。
  • 历史累积误差的雪崩效应:在脱离真实标注对话历史(w/o GT)后,所有模型的未响应率(NR)发生断崖式激增(Doubao 从 6.1% 暴增至 50.9%),表明单步推断失误会迅速污染后续流式决策上下文。

亮点与洞察

  • 多维度闭环交互基准的确立:以往研究将视频理解与主动代理割裂,GuideMe 填补了集多领域、长时序流式因果约束、步骤指引与错误恢复于一体的基准空白。
  • 软权重二部图与行为矩阵结合的度量范式:通过连续语义相似度克服了硬边界时间切片评测的脆弱性,同时用四象限行为分析精准定位模型的发声倾向与沉默校准问题。
  • 揭示了“知道何时保持沉默”是当前 MLLM 最稀缺的感知能力:模型普遍无法在高信息密度流中抑制无效发言,这一见解为后续强化学习设计沉默惩罚与干预奖励提供了直接依据。

局限与展望

  • 用户执行动力学的开环评估限制:测试中用户后续动作是预录制视频片段,模型若给出与 GT 不同的纠正建议,无法动态改变预录制视频中的用户行为(非真实仿真环境交互)。
  • 计算开销对流式评测分辨率的制约:密集采样(Dense Sampling)受限于 API 调用成本与长视频推断开销,目前基准采用平衡的 Anchor-Based 采样作为妥协方案。
  • 具身智能与交互仿真器的演进:未来需结合 3D 具身仿真环境或人类在环交互测试,允许助手的错误纠正策略真正分支驱动不同的执行结局。

相关工作与启发

  • vs HoloAssist / QEVD: HoloAssist 与 QEVD 分别聚焦于单一的装配或健身场景,交互模式止步于离线打标或固定预设反馈;GuideMe 统一跨越四大复杂领域,将全流程抽象为包含指令、反馈、报错与纠正的严格因果交互闭环。
  • vs VideoLLM-online / StreamingBench: 现有流式基准大多依赖预设时间戳的用户 Query 唤醒,本质上是流式视频 QA;GuideMe 要求模型从始至终依靠视觉感知自主研判介入时机与沉默时机,对情境意识与因果推理提出了更高挑战。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出多领域流式闭环交互指导基准与三维评估体系。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖闭源主流顶尖模型与开源流式架构,包含详尽的行为分类与推断协议消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 概念界定清晰,形式化数学表述完备,图表呈现扎实。
  • 价值: ⭐⭐⭐⭐⭐ 明确指出了通用 MLLM 向实用型实时流程助理迈进时最核心的短板与优化方向。