SAFE-Pruner: Semantic Attention–Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation¶
会议: ECCV 2026
论文: ECCV 2026
领域: 机器人/具身智能
关键词: VLA 推理加速 / 视觉 token 剪枝 / 语义注意力一致性 / 免训练 / 机器人操作
一句话总结¶
SAFE-Pruner 发现 VLA 模型在连续操作中对「同一语义实体」的注意力在控制时间步之间高度一致(语义注意力一致性),于是用最近一个「关键帧」上逐层缓存好的注意力显著性去预测当前帧尚未算出的深层显著性,再与当前浅层显著性融合后做 top-K token 剪枝,并以浅层注意力漂移检测自适应刷新关键帧,在无需训练、不改结构的前提下取得最高 1.89× 加速、成功率下降不超过 1.5%。
研究背景与动机¶
视觉-语言-动作(VLA)模型把视觉感知、语言理解和动作生成统一进一个策略里,借助预训练视觉语言主干和大规模机器人演示数据,已经能在多样任务与环境里做端到端操作,OpenVLA、OpenVLA-OFT、CogACT、π0.5 等代表了当前主流架构。但这类模型序列里视觉 token 占了绝大部分长度,注意力开销随之水涨船高,单次前向的延迟往往难以满足闭环控制对实时性的要求——机器人手臂还在动、物体还在被遮挡,晚一步的动作就可能是无效甚至危险的。蒸馏、量化、层级剪枝这类传统加速手段能带来收益,但通常要求重新训练或改动网络结构,迁移到新主干上代价很高;相比之下,视觉 token 剪枝只需要在推理时丢掉冗余 patch,是免训练、可即插即用的路线。
现有的 VLA token 剪枝方法(FastV、SparseVLM、DivPrune、VLA-Cache、VLA-Pruner 等)大多把剪枝决策建立浅层信号上:用浅层交叉注意力权重或 token 相似度打分,选出 top-K 视觉 token,其余的直接丢弃。问题在于这个丢弃是不可逆的——被删掉的 token 在后续所有层里都不再存在。而 VLA 的注意力恰恰是「由粗到细」的:浅层注意力分散而宽泛,深层才收敛到真正关键的区域。论文在 OpenVLA-OFT 上量化了这一点:当剪枝率超过 70% 时,仅用浅层显著性做剪枝会误删其他层「核心 token」(各层重要性前 10% 的 token)的概率急剧上升(0–50% 是稳定区、50–70% 是过渡区、70–90% 是损失激增区)。也就是说,剪枝决策做在最没有把握的时刻,却要对整条深层推理链负责。近期一些工作(SpecPrune-VLA、动作感知动态剪枝)试图估计后段显著性来补救,但它们是在已经被剪过的 token 子集上做估计,真正关键的那些 token 早在浅层就被永久删除了,估计本身先天失真。
这就构成了本文要解决的核心矛盾:要避免误删,剪枝时就必须知道深层会关注哪些 token;但剪枝恰恰发生在深层还没算的浅层。SAFE-Pruner 的破局点来自一个关于 VLA 注意力时间演化的观察——语义注意力一致性:在执行同一任务的相邻控制时间步之间,尤其在收敛度更高的深层,模型注意力总是集中在携带相同语义信息的 patch 上(比如要被抓取的目标物体),即便这些 patch 的空间位置已经大幅移动(夹爪从中间移到右边抓汤罐、再移到左边放下,注意力始终锚在夹爪/物体附近而不是某个固定坐标)。既然注意力跟着语义走而不是跟着像素走,那么历史帧上算好的深层显著性,就可以当作当前帧深层显著性的「预报」。核心 idea:把「当前帧深层注意力不可知」这个困难,转化为「用历史关键帧的逐层显著性做跨帧语义迁移」的可解问题——以最近关键帧为参考,按语义最近邻建立 token 对应关系迁移深层显著性分数,与浅层分数融合后再剪枝,并用浅层注意力的余弦漂移触发关键帧刷新,从而在剪枝的同一刻同时看到「当下」和「未来」。
方法详解¶
整体框架¶
SAFE-Pruner 是一个包在 VLA 现有前向流程上的免训练剪枝外壳:输入是文本指令与一串连续观测帧,输出仍是每个控制时间步的动作。它在每次前向的浅层 \(\ell_s\) 处介入,决定这一帧保留哪些视觉 token 继续走完剩下的 Transformer 层。整体由三件事串成:先用「关键帧」把历史信息变成可用的显著性先验,再把先验与当前帧的浅层证据融合成一个剪枝分数,最后用注意力漂移检测决定什么时候必须重新建立先验。
具体到单个控制时间步 \(t\):首先照常算出浅层注意力显著性 \(\mathcal{S}^{\ell_s}_t\)(这是唯一不需要额外开销就能拿到的信号);接着从最近的关键帧 \(\tau_{\mathrm{ref}}\) 缓存里,按语义最近邻把每一层的显著性迁移到当前帧,并在深层集合 \(\mathcal{L}_d\) 上取平均,得到预测的深层显著性;然后比较当前浅层显著性与迁移来的浅层显著性,若余弦相似度低于阈值 \(\gamma\),说明注意力已经漂移、旧先验不可信,就把 \(t\) 判为关键帧——此时不做剪枝,直接全 token 前向,同时把每一层的真实显著性写回缓存;否则 \(t\) 是普通帧,按融合分数取 top-K 个视觉 token,只带着这 \(K\) 个 token 跑完后续层并输出动作。关键帧是整套机制的「锚点」:它付出了完整前向的代价,换来一份跨层、未被剪枝污染的显著性真值,供之后若干普通帧反复借用。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["指令 + 当前观测帧<br/>多模态 token 序列"] --> B["未来感知的显著性预测<br/>迁移参考帧的逐层显著性"]
B --> C["双阶段显著性分数融合<br/>浅层 + 预测深层"]
C --> D["自适应关键时间步刷新<br/>相似度低于阈值则触发"]
D -->|关键帧| E["跳过剪枝<br/>全 token 推理并更新缓存"]
D -->|非关键帧| F["保留 top-K token<br/>剪枝后继续推理"]
E --> G["输出动作"]
F --> G
E -.->|刷新参考关键帧 τ_ref| B
图中「未来感知的显著性预测 → 双阶段显著性分数融合 → 自适应关键时间步刷新」的顺序,对应下面三个关键设计,也是单个时间步内决策的实际先后。
关键设计¶
1. 未来感知的显著性预测:把历史关键帧的逐层显著性按语义对应关系迁移到当前帧,补上剪枝时刻看不到的深层信息
剪枝不可逆,而深层显著性在浅层无法直接计算,所以必须找一个已经算过深层、且未被剪枝污染的来源。本文的做法是把时间步分成两类:关键帧 \(\mathcal{T}_{\mathrm{key}}\) 上完全不做剪枝,跑完整前向,并把每一层的视觉 token 显著性向量 \(\{\mathcal{S}^{\ell}_{\tau}, \ell = 0, \ldots, L-1\}\) 全部缓存下来;普通帧 \(t\) 则取「早于 \(t\) 的最近一个关键帧」作为参考,即 \(\tau_{\mathrm{ref}} = \max\{\tau \in \mathcal{T}_{\mathrm{key}} : \tau < t\}\)。由于参考帧和当前帧的 token 在数量与排列上未必一一对应(视野在动、物体在被遮挡),不能直接整体拷贝分数,而是先为当前帧的每个视觉 token 在参考帧里找语义最近的那个 token——用隐状态的余弦距离作为语义接近程度的度量——建立跨帧的 token 对应关系,再把参考帧上该 token 的各层显著性分数搬运过来,得到 \(\{\hat{\mathcal{S}}^{\ell}_t\}\)。要预测的是深层,所以只看一组较深的层 \(\mathcal{L}_d\)(例如最后若干层),对它们逐层平均:
这样做之所以成立,正是因为前文观察到的语义注意力一致性:注意力锚定的是「是什么」而不是「在哪里」,所以夹爪位置大幅移动后,当前帧握爪附近的 patch 仍然与参考帧的握爪 patch 语义最接近,迁移过来的显著性依然指向正确的目标;反过来说,如果模型注意力真的跟着空间坐标走,这套对应关系立刻失效——这也是本文把「语义一致性」当作立论基石而非经验技巧的原因。与 SpecPrune-VLA 一类同样估计后段显著性的工作相比,关键差别在于先验的来源是全 token 的关键帧,而不是已经被剪掉一部分的残缺子集,因此不会把早期剪枝的错误一路放大。
(式中符号按原文重排,⚠️ 以原文为准。)
2. 双阶段显著性分数融合:让「当下直接测得但短视」的浅层分数与「前瞻但间接」的深层预测分数共同决定保留谁
迁移来的深层分数虽然看得到未来,但毕竟是从另一帧搬过来的二手信息,一旦对应关系建立得不完美或者参考帧已经略有过时,就会引入噪声;当前帧的浅层显著性则相反——它是当场算出来的,对浅层而言完全准确,但它本身就是那个导致误删的短视信号。两者单独用都偏,本文用一个标量把它们线性组合成最终的 token 重要性分数:
其中 \(\lambda\) 控制前瞻的权重:\(\lambda \to 0\) 时退化为纯粹的浅层剪枝(即 FastV/VLA-Pruner 那一类做法),\(\lambda \to 1\) 时则完全听信跨帧先验。按 \(\mathfrak{s}_t\) 取 top-K 个视觉 token 保留,其余剪掉,后续层只在这 \(K\) 个 token 上计算。这个融合只发生在分数层面而非特征或 token 层面:被保留下来的仍然全部是当前帧自己的 token,参考帧不向当前帧注入任何视觉内容,因此不会破坏动作回归所依赖的空间布局;同时它也不引入任何额外的前向开销,只是把两组已经算好的标量加一次权。
(\(\mathfrak{s}_t\) 的记号与 \(\lambda\) 的取值区间按原文重排,⚠️ 以原文为准。)
3. 自适应关键时间步刷新:用浅层注意力的余弦漂移检测,在子任务切换时及时把过期的参考帧换掉
关键帧集合 \(\mathcal{T}_{\mathrm{key}}\) 的质量直接决定预报的质量。最朴素的做法是固定间隔采样关键帧,但语义注意力一致性并非无条件成立:论文在可视化中看到,从「拿起」切到「放置」这类子任务边界上,注意力会突然从被操作物体转向目标容器(图中第 12 帧还在物体上,第 13 帧明显偏向篮子),此时旧先验已经讲的是另一个子任务的故事;而固定间隔既可能正好错过这个切换点,又会在平稳段白白浪费多次全 token 前向。本文的判断依据是:先验是否有效,与两个时间步是否属于同一子任务的相关性,远高于与它们时间距离的相关性,而子任务是否切换可以从注意力分布本身读出来。于是用一个极廉价的代理信号来做检测——把当前帧的浅层显著性向量 \(\mathcal{S}^{\ell_s}_t\) 与从参考帧迁移来的同层显著性 \(\hat{\mathcal{S}}^{\ell_s}_t\) 求余弦相似度:
当 \(\kappa_t < \gamma\) 时判定发生注意力漂移,令 \(t \in \mathcal{T}_{\mathrm{key}}\):这一步不剪枝、跑全 token 前向输出动作,并把所有层的真实显著性覆盖写入缓存,使 \(\tau_{\mathrm{ref}}\) 前进到当前帧;否则沿用原参考帧继续预报与剪枝。相比固定间隔策略,这种「按需刷新」既避开了子任务边界处的错误传播(消融中成功率从 95.8% 提到 96.4%),又因为平稳段不再强制触发全 token 前向而减少了关键帧数量(FLOPs 从 2.236 T 降到 1.722 T、延迟从 51.98 ms 降到 37.22 ms)——这是本文「精度与效率同向改善」而非此消彼长的关键一步。需要说明的是,\(\kappa_t\) 检测的是「当前注意力与历史先验发生偏离」这一事实,而非偏离的原因:预报本身出错时的表现与真实注意力漂移完全一样,两者都会被判为漂移并触发刷新——从安全角度看这是偏保守的,但也意味着频繁刷新会稀释加速收益。
一个完整示例¶
以论文可视化的那次「拿杯子再放到左侧」的长程操作为例(对应原文图中第 0/7/12/13/15 帧),走一遍决策流程:
第 0 帧没有任何历史先验,被当作关键帧处理:不剪枝、全 token 前向,并把这一帧每一层的视觉 token 显著性向量写进缓存,此后 \(\tau_{\mathrm{ref}} = 0\)。第 1–12 帧是普通帧:对当前帧的每个视觉 token,在第 0 帧里按隐状态余弦距离找语义最近的 token,把它各层的显著性搬过来、在深层集合上取平均,再与当前帧自己算出的浅层显著性按 \(\lambda\) 融合,取 top-K 后只带着这些 token 跑完剩余层。这段时间里夹爪先从中间移到右侧抓取、再往左移动,空间位置变化很大,但注意力始终锚在夹爪与物体上,\(\kappa_t\) 一直高于 \(\gamma\),因此参考帧始终是第 0 帧、不需要刷新。
到第 13 帧情况变了:子任务从「拿起」切换到「放置」,模型的注意力重心从物体转向篮子,当前浅层注意力与从第 0 帧迁移来的先验明显不再一致,\(\kappa_{13} < \gamma\) 触发刷新——第 13 帧被判为关键帧,跳过剪枝、跑一次完整前向,输出这一帧的动作,同时把缓存整体更新为第 13 帧的逐层显著性,\(\tau_{\mathrm{ref}} \leftarrow 13\)。第 14、15 帧于是以第 13 帧为参考继续做普通帧剪枝。整个过程中,只有第 0 帧和第 13 帧付出了全 token 的计算代价,其余帧都在剪枝状态下运行,而每一次剪枝的依据里都同时含有「当前浅层看到什么」和「深层接下来会关注什么」。
(以上帧号与场景取自原文图 3 的可视化;各步的具体数值为流程说明。)
损失函数 / 训练策略¶
SAFE-Pruner 是免训练的:它不引入任何可学习参数、不定义损失函数、不修改网络结构,只在推理时读取注意力权重并在浅层截断 token 集合,因此可以直接套到任意已有 VLA 主干上(论文在 OpenVLA、OpenVLA-OFT、CogACT、π0.5 四种架构上直接生效),也能与量化这类正交的加速手段叠加(与 HiF8 量化同用时 FLOPs 降 56.4%、显存降 38.1%,成功率基本不变)。
需要设定的量只有四个:融合权重 \(\lambda\)、漂移阈值 \(\gamma\)、用于平均的深层集合 \(\mathcal{L}_d\)、以及每帧保留的 token 数 \(K\)(等价于剪枝率)。论文正文没有给出这四个量的具体取值,也没有报告 \(\lambda\)、\(\gamma\) 的敏感度曲线(⚠️ 以原文正文/附录为准)。唯一必需的经验设置是:关键帧要付出一次完整前向的代价,因此论文报告的延迟是在所有控制时间步上取平均、并已计入本文引入的全部额外开销之后的结果,这样比较才与基线公平。
实验关键数据¶
主实验¶
实验覆盖 4 个 VLA 主干(OpenVLA、OpenVLA-OFT、CogACT、π0.5),对比基线包括通用 VLM 加速方法 FastV、SparseVLM、DivPrune,以及 VLA 专用效率方法 VLA-Cache、VLA-Pruner,全部在同一实验设置下做过超参调优。LIBERO 上共 4 个套件 × 10 个任务 × 50 条轨迹 = 2000 个 episode,延迟在 RTX 4090 上测得(指 VLM 主干的单步推理延迟)。为控制篇幅,下表只列每个主干的 vanilla、最强加速基线与本文方法:
| 模型 | 方法 | Spatial | Object | Goal | Long | 平均成功率(%) | FLOPs(T) | 延迟(ms) |
|---|---|---|---|---|---|---|---|---|
| OpenVLA | Vanilla | 84.6 | 86.6 | 78.2 | 53.2 | 75.7 | 1.862 | 48.24 |
| OpenVLA | VLA-Pruner | 82.0 | 84.4 | 77.8 | 52.6 | 74.2 | 0.793 | 36.47 |
| OpenVLA | Ours | 82.2 | 84.8 | 77.6 | 52.0 | 74.2 | 0.742 | 32.18 |
| OpenVLA-OFT | Vanilla | 98.4 | 98.2 | 96.4 | 94.2 | 96.8 | 3.970 | 70.25 |
| OpenVLA-OFT | VLA-Pruner | 97.4 | 93.0 | 94.0 | 92.0 | 94.1 | 2.234 | 54.53 |
| OpenVLA-OFT | Ours | 98.0 | 98.0 | 96.2 | 93.4 | 96.4 | 1.722 | 37.22 |
| π0.5 | Vanilla | 98.2 | 98.0 | 98.0 | 91.8 | 96.5 | 2.115 | 35.28 |
| π0.5 | VLA-Pruner | 95.8 | 97.2 | 95.6 | 88.0 | 94.2 | 1.583 | 32.64 |
| π0.5 | Ours | 97.0 | 98.8 | 96.0 | 90.2 | 95.5 | 1.482 | 24.33 |
OpenVLA-OFT 上的收益最直观:FLOPs 从 3.970 T 降到 1.722 T(降 56.6%)、主干延迟从 70.25 ms 降到 37.22 ms(1.89× 加速),而平均成功率只从 96.8% 降到 96.4%,比所有加速基线里最好的 94.1%(VLA-Pruner)高出 1.9 个百分点。SIMPLER 上以 CogACT 为基座:Visual Matching 设置下平均成功率 74.5%(vanilla 74.8%),FLOPs 只剩基线的 37.4%,加速 1.73×,明显优于 FastV 的 1.21× 与 VLA-Cache 的 1.38×;Variant Aggregation 下平均成功率 61.9%(vanilla 61.3%),FLOPs 保留 36.2%,加速 1.67×。值得注意的是,加速后的模型在个别设置上反而略高于未剪枝基线,作者沿用了 VLA-Cache 的解释——剪掉与任务无关的 token 让模型更集中在有用信息上。
真机实验在 Astribot S1 双臂平台上进行,固定底盘与躯干、只控制 14 自由度的双臂与夹爪,视觉来自两个腕部相机与一个跟随工作区中心的头部相机,用 200–1000 条 VR 遥操作演示微调任务专用的 π0.5 模型,每个模型评测 200 次,VLM 主干延迟在 RTX 3090 上测量:
| 方法 | Pick and Place | Throw Basketball | Pack Doll | 平均 | FLOPs(T) | 延迟(ms) |
|---|---|---|---|---|---|---|
| π0.5 | 94% | 77% | 73% | 81.3% | 2.264 | 80.36 |
| + FastV | 82% | 69% | 56% | 69.0% | 1.857 | 56.93 |
| + Ours | 90% | 81% | 67% | 79.3% | 1.543 | 43.56 |
真机上的结论比仿真更有说服力:本文方法在 FLOPs(1.543 T vs 1.857 T)和延迟(43.56 ms vs 56.93 ms)都低于 FastV 的前提下,平均成功率高出 10.3 个百分点(79.3% vs 69.0%),且只比未加速的 π0.5 低 2.0 个百分点。差距最大的 Throw Basketball(81% vs FastV 69%)需要精确抓取小物体,正是对视觉细节最敏感、浅层显著性最容易误删关键 patch 的场景;长程多阶段的 Pack Doll 也从 56% 提升到 67%。
消融实验¶
在 OpenVLA-OFT + LIBERO 上做四组对照:vanilla;只用浅层注意力剪枝、不做未来预测(w/o forecast);做了未来层预测但关键帧固定间隔选取(w/o adaptivity);完整方法。
| 配置 | 平均成功率(%) | FLOPs(T) | 延迟(ms) | 说明 |
|---|---|---|---|---|
| Vanilla | 96.8 | 3.970 | 70.25 | 未加速 |
| w/o forecast | 94.5 | 2.141 | 50.31 | 去掉未来显著性预测,退化为浅层剪枝,掉 2.3 个点 |
| w/o adaptivity | 95.8 | 2.236 | 51.98 | 保留预测但改用固定间隔关键帧,成功率回升 1.3 点,代价是 FLOPs 反比 w/o forecast 更高 |
| Ours | 96.4 | 1.722 | 37.22 | 自适应关键帧同时拿到最高成功率和最低开销 |
关键发现¶
- 未来预测是精度收益的主要来源,自适应关键帧是效率收益的主要来源。 去掉预测(w/o forecast)成功率掉到 94.5%,其数值与主表中 FastV 的 94.5%、2.141 T 几乎完全一致,说明「不做预测的本文方法」确实退化成了浅层剪枝基线;补上预测后成功率回到 95.8%,但因为关键帧按固定间隔触发,FLOPs 反而比 w/o forecast 高(2.236 T vs 2.141 T)——固定间隔既浪费全 token 前向又躲不开子任务边界。加上自适应刷新后两者同时改善。
- 加速比与主干架构强相关。 同一套方法在 OpenVLA 上只把 FLOPs 从 1.862 T 压到 0.742 T 却几乎不损失成功率(75.7% → 74.2%,与 VLA-Pruner 持平但更便宜),在 OpenVLA-OFT 上则同时拿到更高的绝对成功率(96.4%,比最好基线高 1.9 个点);而 OpenVLA 这类逐步解码模型的绝对成功率高点本就低(vanilla 75.7%),剪枝的可操作空间与感知敏感度与其他模型不同,横向比较时不宜只看「加速倍数」。
- 与量化正交可叠加。 在 OpenVLA-OFT 上把本文方法与 HiF8 量化同用,相对 vanilla 的 FLOPs 降 56.4%、显存从 17.83 GB 降到 11.03 GB(降 38.1%),成功率 96.6% 与 vanilla 的 96.8% 基本持平;而单独使用本文方法时显存甚至略升(18.31 GB),说明剪枝省的是计算而不是显存,两者互补。
- 在真机上,浅层剪枝的失效被放大。 仿真里 FastV 与本文方法的差距在 1–3 个点量级,真机上扩大到 10.3 个点,且集中在需要精细视觉的场景(小球抓取的 Throw Basketball)。这提示模拟器对视觉细节的敏感度不足,真机验证对这类剪枝方法不是可选项。
亮点与洞察¶
- 把「不可知的未来」换成「可迁移的过去」是这篇论文最漂亮的一步。 剪枝发生在浅层、却要为深层负责,这个时序错位本质无解;作者没有去加辅助头预测显著性(那需要训练),而是用「同一任务的相邻帧注意力锚在同一语义实体上」这一观察,把问题转成跨帧的分数搬运,让整套方法保持零训练成本。
- 用「关键帧 + 按需刷新」替代「固定间隔」的思路可以迁移。 凡是需要历史先验的在线决策(KV cache 淘汰策略、长视频 VLM 的 token 预算分配、动作分块的时间集成),都可以套用同一个模式:用当前可得的廉价信号与先验做相似度比对,偏离到一定程度才付出昂贵代价重建。它把「先验多久过期」从时间问题换成了状态问题。
- 分数层面融合而非特征层面融合是个克制的设计。 迁移只在标量上发生,当前帧的 token 及其空间位置原封不动,所以不会给动作回归引入参考帧的视觉内容——对空间布局敏感的 VLA 任务来说,这个边界划得很必要。
- 免训练 + 正交可叠加意味着工程价值高。 不改结构、不重训,还能和量化叠加(FLOPs −56.4%、显存 −38.1%),对已有 VLA 部署管线来说接入成本极低,这比单纯的加速比数字更实用。
局限与展望¶
- 超参与敏感度分析在正文缺失。 \(\lambda\)、\(\gamma\)、深层集合 \(\mathcal{L}_d\) 与保留 token 数 \(K\) 的具体取值论文正文未给出,也没有 \(\lambda\) / \(\gamma\) 的扫描曲线,读者难以判断方法对这几个量的鲁棒性;不同的主干可能各需要一套取值,这会削弱「即插即用」的实际便利。
- 漂移检测只判断「变了」,不判断「为什么变」,也不判断「变得对不对」。 \(\kappa_t\) 比较的是当前浅层注意力与迁移来的同层注意力,因此预报本身出错和真实注意力漂移在数值上不可区分:前者会导致不必要的刷新(白付全 token 的代价),后者如果恰好被错误的预报「对上」则会漏检。论文没有报告关键帧的实际触发频率,也没有分析其随任务长度、子任务数量的变化,无从判断最坏情况(频繁切换的任务)下加速比会退化到什么程度。
- 对比基线在真机上不完整。 真机只对比了 FastV 与 vanilla,缺少 VLA-Cache、VLA-Pruner 等更强的 VLA 专用基线;且只有 3 个任务、每个任务 200 次试验、单一机器人平台,统计上的置信区间较宽(例如 Pack Doll 上 67% vs 56% 的差距是否稳定,正文未给方差)。
- 跨帧 token 对应依赖余弦最近邻,对遮挡与视野变化脆弱。 本文用隐状态余弦距离建立对应关系,隐含假设「语义相近的 token 在不同帧中都能被看见」。当目标被机械臂遮挡、移出视野或发生大视角变化时,最近邻很可能匹配到错误的 patch,而论文没有针对这一失效模式的实验或量化。一个自然的改进是用注意力加权的软匹配或最优传输替代硬最近邻,并让匹配置信度反过来调节 \(\lambda\)。
- 保留率是固定的,但每帧真正需要的信息量并不相同。 平稳段或许可以用更激进的剪枝率,子任务切换前后则应保守。既然 \(\kappa_t\) 已经刻画了「当前帧与先验的一致程度」,完全可以把它当作动态保留率的控制器,而不是只用来触发二值的刷新。
相关工作与启发¶
- vs FastV:FastV 在第二层用注意力一次性决定丢弃哪些视觉 token,之后不再回头;本文承认浅层注意力不足以代表深层需求,用历史关键帧的深层显著性补齐这一视角。在真机上二者平均成功率相差 10.3 个点,且本文的 FLOPs 与延迟更低,差距主要来自「是否考虑未来层的需求」。
- vs VLA-Cache:VLA-Cache 挖掘的是跨时间步的 token 冗余,把变化不大的视觉 token 缓存复用;本文缓存的是注意力的分布(显著性先验)而非 token 本身,因此不存在「复用旧 token 导致当前帧视觉内容失真」的风险,迁移的只是「该关注谁」的先验。二者在 SIMPLER 上的差距明显:1.73× vs 1.38×(VM),1.67× vs 1.37×(VA)。
- vs VLA-Pruner:VLA-Pruner 做时间感知的双层 token 剪枝,是本文最接近的对手,在 OpenVLA 上与其打平(74.2%)但开销更低(0.742 T vs 0.793 T),在 OpenVLA-OFT 上反超 2.3 个点。区别在于 VLA-Pruner 的时序建模主要体现在剪枝层级与时间维度上,没有显式预测当前帧的深层显著性分布。
- vs SpecPrune-VLA / 动作感知动态剪枝:它们同样意识到「晚层才重要」,但后段显著性的估计建立在早期已经被剪过的 token 子集上,关键 token 一旦在浅层被删就无法挽回;本文的先验来自全 token 的关键帧,这是精度上最本质的差别。
- vs SparseVLM / DivPrune:这两者分别用文本引导的相似度稀疏化与多样性选择来决定保留哪些 token,是通用 VLM 加速方法;本文的信号是注意力显著性 + 跨帧时序先验,属于 VLA 专用路线,实验也显示通用方法直接搬到 VLA 上(FastV 在真机掉 12.3 个点)损失明显更大。
评分¶
- 新颖性: ⭐⭐⭐⭐ 「语义注意力一致性」这一可观测规律 + 用历史关键帧逐层显著性做跨帧迁移的组合是清晰的新切入点,但 top-K 剪枝、关键帧缓存、余弦漂移检测这些零件本身都是已有积木。
- 实验充分度: ⭐⭐⭐⭐⭐ 4 个 VLA 主干 + LIBERO/SIMPLER 两个仿真基准 + Astribot S1 真机三类任务,还额外验证了与量化的正交性,覆盖面在同类工作中少见。
- 写作质量: ⭐⭐⭐⭐ 观察 → 机制 → 设计的论证链条清楚,失败案例(子任务切换)也被正面用作设计动机;但关键超参取值与敏感度分析在正文缺失,部分公式在缓存中受损需回原文核对。
- 价值: ⭐⭐⭐⭐ 免训练、即插即用、可与量化叠加,对实时 VLA 部署有直接工程价值;扣分主要在真机对比基线不全、跨帧匹配的失效模式未被检验。