CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态 VLM / 视频理解
关键词: 流式视频理解、特征轨迹曲率、分层视觉记忆、动态阈值、免训练
一句话总结¶
CurveStream 用视觉特征轨迹的转向程度识别语义变化,再以在线双阈值决定帧的高清保留、低清保留或丢弃,在不训练模型的条件下,将 Qwen2.5-VL-7B 的 StreamingBench / OVOBench 准确率从 73.31% / 59.90% 提升到 84.00% / 73.48%。
研究背景与动机¶
流式视频没有预先确定的终点,而多模态大语言模型只能接收有限的视觉上下文。把所有历史帧都留下,视觉 token 和 KV 缓存会不断增长;直接截断最旧内容,又可能丢掉回答当前问题所需的前因。均匀采样虽然简单,却可能在大量静止背景上浪费预算,同时错过短暂动作或新对象出现的瞬间。问题因此不是单纯减少帧数,而是在不知道未来问题的条件下,持续决定哪些视觉证据值得占用上下文。
只看相邻帧差异也不够。相机平移会让画面持续变化,但这种变化未必意味着新事件;反过来,关键动作可能只持续很短时间。基于问题的检索可以在提问后回找信息,却依赖额外存储及事后查询。CurveStream 将关注点放在写入记忆之前:如果连续帧在特征空间里一直沿相近方向移动,那么大的位移也可能只是平滑变化;如果轨迹突然转向,则更值得检查是否发生了语义转折。
作者据此把几何变化强度与记忆分辨率联系起来,而不是把全部入选帧都压缩成相同质量。核心 idea:用特征轨迹的曲率代理信号发现关键转折,让强转折保留高清细节、普通过渡保留低清上下文,再通过自适应阈值和有界队列控制长期成本。
方法详解¶
整体框架¶
输入是逐帧到达的视频,以及任意时刻提出的自然语言问题。CurveStream 在原有 MLLM 的视觉输入侧加入在线筛选与记忆管理:先计算曲率感知评分,再估计当前视频节奏下的动态阈值,最后更新分层视觉记忆;回答问题时使用保留的视觉上下文。
用于评估几何变化的前端是冻结的 DINOv2-small。它提供帧级全局特征,并不意味着把原模型的视觉编码器、投影器或语言模型重新训练成另一套网络。分辨率决策之后,保留帧仍进入基座模型的视觉编码与语言生成流程。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["到达帧与近期特征"] --> Score["曲率感知评分"]
Score --> Threshold["在线双阈值适配"]
Threshold --> Memory["分层视觉记忆<br/>高清、低清或丢弃"]
Query["查询时刻的当前帧"] -->|强制高清保留| Memory
Memory -->|超预算时 FIFO 淘汰| Context["有界视觉上下文"]
Context --> Model["原有 MLLM + 问题<br/>生成回答"]
图中的记忆更新发生在推理期间,不存在额外训练监督分支。高清记忆也不是永久保存区:一旦触发容量限制,最旧内容仍会被淘汰。
关键设计¶
1. 曲率感知评分:区分持续移动与轨迹突然转向
CAS(Curvature-Aware Scorer)首先对全局帧特征做 L2 归一化。它同时使用两类信号:第一类是当前帧与上一帧的运动变化,按文字定义为 1 减去两帧特征的余弦相似度;第二类不再比较特征本身,而是比较连续两次特征位移的方向。对于三帧特征,位移定义为:
曲率代理量同样采用 1 减去余弦相似度,但比较对象换成了这两个位移向量。两次位移方向一致,代理量趋近于 0;方向突然改变,代理量升高。因此,CAS 不是把光流大小改个名字,而是为普通帧差补上了“变化方向是否改变”这一信息。作者将一阶运动项与二阶几何项做线性组合,用权重 \(\lambda\) 调节后者的作用。
这里的“曲率”是离散特征轨迹的转角代理,不应理解为严格计算连续流形的微分几何曲率,也不是直接判断某个事件是否重要。相机平滑运动通常更容易形成方向一致的轨迹,但急转镜头、噪声或编码器不稳定也可能产生高分。几何信号与语义重要性的联系是方法的经验假设,而非数学保证。
提供的全文文本中,原式 (3)–(6) 的若干分子、运算符与下标存在抽取损坏。上述解释依据周围完整文字及位移定义;不把猜补后的评分式或方差递推式当作作者精确公式。
2. 在线双阈值适配:让同一变化幅度在不同视频节奏下有不同意义
固定阈值难以同时应对长时间静止与突然剧烈活动。HVMM(Hierarchical Visual Memory Management)对评分的均值和方差做指数移动平均(EMA)更新,以动量 \(\gamma\) 控制历史信息衰减速度。根据随时间更新的均值和标准差,得到两个 K-Sigma 阈值:
它们比较的是“这次变化相对近期常态有多突出”,不是用统一绝对刻度衡量所有视频。平稳阶段的小转折可能已经值得保存;进入持续剧烈变化后,整体评分分布抬高,阈值也会调整,避免每一帧都挤入高清记忆。
这种适配只需要维护少量统计量,不需要等用户问题到达后才计算相关性。但它依赖 EMA 对分布变化的跟随速度:历史过长会滞后,历史过短又可能受瞬时噪声影响。原文没有给出足够完整的默认超参数和初始化细节,复现时不能把示意阈值当作已确认实现。
3. 分层视觉记忆:把有限 token 分给关键细节和时间过渡
当评分达到或超过 \(g_2\),帧进入 Clear Memory,保留基座模型原生的动态高分辨率输入;当评分位于 \(g_1\) 与 \(g_2\) 之间,下界包含、上界不包含,帧进入 Blurred Memory,统一降采样至 \(224\times224\);低于 \(g_1\) 则直接丢弃。查询时刻的当前帧被强制归为高清状态,避免场景已稳定时因为变化分数低而看不清眼前内容。
低清帧不是低质量副本的无谓堆积,它们承担动作与事件之间的过渡证据。只存转折处的高清帧,可能知道“之前”和“之后”却丢掉中间联系;把全部帧都高清保存又会迅速用尽预算。分层保留将细节预算集中到关键帧,同时用较便宜的视觉上下文维持时间连续性。
队列超出容量后按 FIFO 删除最旧 token,不区分其原来是高清还是低清。因此,评分控制的是写入与表示精度,而不是长期保留优先级。这个区别很重要:该方法能够让存储成本有界,但不能保证任意久远的重要事件永不遗忘,也没有额外的外部检索库来恢复被删除的内容。
原文用 \(N_{\max}\) 表示队列容量,并强调最大视觉 token 预算;表 1 的 10–20 帧是动态记忆队列的观测规模,不能等同于全程只处理这些帧。高低分辨率帧的 token 成本不同,实际容量管理需要按 token 而不只是按帧计数。
一个完整示例¶
设一段视频中,相机先平稳沿街移动,随后转向一块广告牌,再恢复稳定。这个例子用于解释状态变化,不是论文中的定量案例。
平稳移动时,相邻特征可能有较大差异,但连续位移方向相近,曲率项不会仅因为移动持续就一直升高。转向广告牌时,特征轨迹改变方向;若综合评分超过上阈值,这一帧以高清写入,保留可能用于读取广告牌的细节。
转向过程中的中等分数帧以 \(224\times224\) 写入,为前后画面提供过渡。相机稳定后,冗余帧可以丢弃;如果此时提问“广告牌上是什么品牌”,查询时刻的当前帧仍会强制高清保留,而不会因低变化分数被滤掉。
随着视频继续,队列达到预算便淘汰最旧内容。若广告牌很久以后才被问到,且相关帧已经出队,CurveStream 本身并没有保证能找回答案的机制。
损失函数 / 训练策略¶
这是免训练的推理时方法,不新增监督损失,也不对基座模型微调。论文把策略目标表述为:在固定记忆容量下,提高模型基于当前记忆回答正确的条件概率;实际实现是几何评分、EMA 阈值和队列规则,而不是通过梯度优化该目标。
实验使用 DINOv2-small 计算评分特征,低清输入固定为 \(224\times224\),高清输入沿用基座模型原生设置,并在单张推理 GPU 上运行。效率实验的视频输入为 1 FPS。表 4 扫描 \(\lambda\) 从 0.2 到 1.0;图 4 分别在固定 \(k_1=0.0\) 或 \(k_2=1.0\) 时研究另一阈值参数,这不是对所有实验默认值的完整说明。
实验关键数据¶
主实验¶
表 1 报告 StreamingBench 的 10 个实时视觉理解子任务和 OVOBench 的 6 个实时视觉感知子任务的平均准确率。下面只列同基座对照;数值单位为 %,增益为百分点。
| 基座与配置 | StreamingBench | OVOBench | 相对同基座增益 |
|---|---|---|---|
| LLaVA-OneVision-7B | 71.34 | 63.06 | 基线 |
| + CurveStream | 75.12 | 70.57 | +3.78 / +7.51 |
| Qwen2-VL-7B | 69.04 | 60.65 | 基线 |
| + FreshMem | 74.20 | 66.67 | +5.16 / +6.02 |
| + CurveStream | 81.04 | 70.73 | +12.00 / +10.08 |
| Qwen2.5-VL-7B | 73.31 | 59.90 | 基线 |
| + HERMES | 79.44 | 68.98 | +6.13 / +9.08 |
| + CurveStream | 84.00 | 73.48 | +10.69 / +13.58 |
| Qwen3-VL-8B | 73.20 | 70.10 | 基线 |
| + CurveStream | 85.56 | 80.76 | +12.36 / +10.66 |
这些结果支持它对多种基座有效,但不支持“每个模型在每个任务都提升超过 10 个百分点”。例如 LLaVA-OneVision-7B 的增益明显低于这个幅度。表内 FreshMem、HERMES 的增益由对应行相减得到。
离线结果取自表 2,均为 Qwen2.5-VL-7B。这里同时保留正收益和负收益,避免把流式优势扩大成所有长视频任务上的保证。
| 配置 | MVBench | EgoSchema | VideoMME |
|---|---|---|---|
| 基线 | 65.00 | 58.47 | 64.52 |
| + HERMES | 65.53 | 59.47 | 60.63 |
| + CurveStream | 66.03 | 64.29 | 62.97 |
| CurveStream 相对基线增益 | +1.03 | +5.82 | -1.55 |
消融实验¶
表 3 是 StreamingBench 上选取帧数预算 \(N=10\) 的采样策略比较。免训练方法使用 Qwen2-VL-7B;StreamForest 使用 Qwen2-7B,是经过训练的参考系统,不是仅替换采样器的严格同条件对照。
| 采样策略 | 准确率 (%) | 解释 |
|---|---|---|
| 均匀采样 | 69.04 | 不考虑内容变化 |
| 余弦相似度 | 73.28 | 依据帧间差异 |
| 光流 | 46.54 | 本表中的普通光流方案 |
| 金字塔光流 | 75.69 | 不同的光流方案,不能与上一行混同 |
| StreamForest(训练) | 77.26 | 不同训练条件的参考 |
| CurveStream 曲率采样 | 77.31 | 比余弦相似度高 4.03 个百分点 |
表 3 的 77.31% 与表 1 的 81.04% 属于不同评估设置,不能替换使用。图 3b 显示自适应混合保留约 50% 高清帧时权衡较好,作者报告计算开销约减少 40%;这不是将所有视频的高清比例固定成 50% 的算法规则。
关键发现¶
- 表 4 的 \(\lambda\) 扫描准确率为 65.83、62.50、63.33、62.50、65.00,对应权重 0.2、0.4、0.6、0.8、1.0;范围为 62.50%–65.83%,均高于 60.65% 基线,但不等于表 1 完整配置的 70.73%。
- 表 5 在 15 分钟、1 FPS 输入下,E2E 从 63.28 降至 44.69 ms/token,TTFT 从 5.606 降至 1.234 s,对应 1.42 倍与 4.54 倍加速。TTFT 是首 token 延迟,不能解读为每帧处理时间。
- 第 4.6 节报告视觉 token 约稳定在 10K–12K、显存约 20 GB;这是所测实现的经验结果,不是所有基座与所有分辨率的统一资源上限。
亮点与洞察¶
- 二阶方向信息补充了一阶变化量。它把“画面在动”与“变化模式发生改变”区分开来,提供了无需额外训练的事件边界候选信号。
- 内容选择与表示精度联动。过渡帧不必在“完整保留”和“彻底删除”之间二选一,低清记忆可以用较少 token 留住动作连续性。
- 当前帧强制高清是重要的实用补丁。变化分数适合筛历史,却不等于当前问题所需细节的重要性,这条规则避免静态场景被评分机制误伤。
局限与展望¶
- 作者明确报告 VideoMME 从 64.52% 降至 62.97%,认为固定记忆预算牺牲了一部分全局细节。任务若依赖远距离、稀疏且低变化的线索,保留转折并不充分。
- FIFO 对高清关键帧也无例外,因而“可处理无限流”只表示持续运行时存储有界,不表示无限历史可无损访问。重要历史的低成本摘要或外部检索是可探索的补充,但并非本文已有机制。
- 从读者角度看,高曲率并不必然意味着高语义价值。需要进一步区分相机急转、噪声以及真正的事件变化,并专门测试低曲率但细节关键的场景。
- 可复现性仍有缺口:所给正文没有完整列出预算、EMA 初始化、零位移时余弦计算的数值处理及全部默认参数。公式抽取损坏也限制了仅凭当前文本复原精确实现。
- 效率实验显示整体延迟改善,但没有在表 5 中拆分 DINOv2 评分、视觉编码和语言生成的耗时;额外评分成本在不同硬件上仍需单独核验。
相关工作与启发¶
- vs FreshMem:FreshMem 使用频率与空间混合记忆,本文将调度依据改为特征轨迹几何及在线阈值。表 1 的 Qwen2-VL-7B 对照中,CurveStream 比它高 6.84 / 4.06 个百分点。
- vs HERMES:两者都研究层次化流式记忆,但本文明确在帧写入时做曲率驱动的分辨率决策。Qwen2.5-VL-7B 的同基座结果高 4.56 / 4.50 个百分点,不能与 FreshMem 那组差值混用。
- vs ReKV:ReKV 通过上下文内视频 KV 缓存检索恢复相关信息,CurveStream 更强调提问前、与问题无关的在线选择。二者分别对应“事后检索”和“提前决定保留什么”,并非等价替代。
- 可迁移启发:机器人或第一人称感知可用特征转向作为候选事件边界,但应将它与任务价值、时间新近性分开建模。否则几何显著却无关的镜头运动仍可能占据记忆。
评分¶
- 新颖性: 4/5。将离散特征曲率与在线分层分辨率调度结合,机制简洁,但本质上仍是启发式视觉记忆策略。
- 实验充分度: 4/5。覆盖多基座、在线与离线任务及效率分析,但预算说明和细分成本仍不够完整。
- 写作质量: 3/5。主线清楚,部分广泛改善的措辞强于逐表证据,不同实验设置也需要读者仔细区分。
- 价值: 4/5。适合资源受限的流式 VLM 原型,不能据此承诺长期历史的无损记忆。