跳转至

PULSE: Identifying Demonstration-Utility Features with Sparse Autoencoders

会议: NeurIPS2026
arXiv: 2609.32469
领域: 可解释性
关键词: 上下文学习、稀疏自编码器、示例效用、特征定位、示例检索

一句话总结

PULSE 用少量带标签的发现样本定位与上下文示例效用相关的 SAE 特征,再分别用于完整示例集合排序和可缓存的逐例检索,在六个文本任务上改善示例选择,但这些特征目前只有关联性而非因果干预证据。

研究背景与动机

上下文学习(in-context learning,ICL)不更新模型参数,而是把带答案的示例放在待预测问题之前,因此示例选择本身就是适应任务的关键环节。Lex-Sim 和 SBERT 从词汇或语义相似度出发,CEIL 进一步考虑示例集合的多样性;这些方法能找到“与问题相像”的材料,却未必找到“对当前模型有用”的材料。同样相似的两个示例,可能在不同模型中触发不同内部表示,也可能因为集合中的重复、标签组合或上下文交互带来不同收益。

问题不只是缺少更强的检索器,还在于示例效用与内部表示之间的关系没有被直接定位。直接分析残差流隐藏维度会遇到特征叠加:一个维度混合多个语义因素,和任务有关的变化容易被大量无关变化淹没。稀疏自编码器(sparse autoencoder,SAE)提供了一个更适合分离这些因素的坐标系,但使用 SAE 的普通余弦相似度仍然把所有坐标近似平等地对待,并不知道哪些坐标真的对应示例收益。

PULSE 因而先在训练集内做小规模、带监督的发现,而不是直接给测试示例贴“好/坏”标签:针对同一个问题,比较多个完整示例集合的效用差异与 SAE 激活差异,把稳定相关的坐标保留下来。核心 idea:从同查询的示例集合对中定位效用相关稀疏特征,用带符号向量验证集合级预测能力,再用其绝对值构造逐例检索的特征相关性度量。

方法详解

整体框架

输入包括一个冻结的目标语言模型、对应层的预训练 SAE、带监督目标的示例池,以及少量训练集发现查询;输出是用于最终 ICL 提示的一个示例集合。PULSE 先进行“效用特征发现”,随后分成两个用途:“完整集合排序”在未参与发现的查询上验证定位结果,“幅值掩码检索”则面向实际逐例检索。排序验证不是检索时必须执行的步骤,也不是利用测试标签重新学习特征。

SAE 表示来自残差流:把完整提示送入模型,在选定层用 SAE 编码,并对提示 token 的激活取均值。发现阶段的完整提示包含带目标的示例和隐藏答案的查询;检索阶段的候选表示则只编码候选输入、隐藏其目标,所以可以预先缓存。目标直到候选被选中后才作为示例答案写入最终提示。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["训练集发现查询<br/>与带标签示例池"] --> B["效用特征发现"]
    B -->|带符号向量;留出查询| C["完整集合排序"]
    C --> V["验证:选择整组示例<br/>评测下游表现"]
    B -->|冻结向量的幅值;不需查询标签| D["幅值掩码检索"]
    Q["查询与候选输入<br/>零样本 SAE 编码"] --> D
    C ~~~ D
    D --> O["推理:组装示例及答案<br/>目标模型执行 ICL"]

关键设计

1. 效用特征发现:控制查询难度后定位示例带来的内部变化

发现集来自训练划分,与评测查询不重叠。每个发现查询随机采样多个完整的若干样本示例集合;若该查询本身位于示例池,则采样时排除它。作者为分类任务使用“正确标签的对数概率减去最强错误标签的对数概率”,为 CommonGen 和 GSM8K 使用监督目标序列的长度归一化、教师强制对数似然。后者测量模型在给定正确前缀时对目标序列的支持程度,不等于实际生成质量或数学答案正确率。

零样本相对效用定义为:

\[ \mathcal{U}_{\mathcal{T}}(q_x,E)=\mathcal{G}_{\mathcal{T}}(q_x,E)-\mathcal{G}_{\mathcal{T}}(q_x,\varnothing). \]

其中 \(\mathcal{G}_{\mathcal{T}}\) 是上述任务相关代理分数,\(E\) 是带监督目标的示例集合。这样定义能区分示例究竟改善还是损害了原有预测;真正估计特征权重时,作者进一步在同一查询内部配对集合,因此零样本项会抵消,查询本身的难度也不会被当成跨查询的效用差异。

对一个集合对,分别计算效用差 \(\Delta\mathcal{U}_{\mathcal{T}}\) 和第 \(j\) 个 SAE 坐标的激活差 \(\Delta A_{j,l}\)。所有发现查询及其无序集合对共同贡献一个分数:

\[ S_{j,l}=\frac{\sum_{(q_d,E_a,E_b)}\Delta\mathcal{U}_{\mathcal{T}}(q_d;E_a,E_b)\,\Delta A_{j,l}(q_d;E_a,E_b)}{n_{\mathrm{pairs}}\sqrt{\mathrm{Var}(\Delta A_{j,l})+\varepsilon}}. \]

分母使用全部集合对的激活差方差,减少高变动坐标仅因尺度大而占优的问题;这不是完整的 Pearson 相关系数,也不是作者已经证明的因果效应。保留分数最大的正坐标和最负的负坐标,以原分数作为权重,其余置零,得到稀疏效用定位向量 \(\mathbf{w}_l\)。负权重只表示更高激活与更低发现效用相关,不意味着“负面情绪特征”或“必须抑制的神经元”。

默认使用 64 个发现查询,每个采样 32 个候选集合,因此共有 \(64\binom{32}{2}=31{,}744\) 个集合对。但这些集合对来自 2,048 个查询—集合配置,彼此共享查询和集合,不是 31,744 个独立监督样本。发现成本主要仍在完整提示的模型前向计算,而不是闭式权重计算本身。

2. 完整集合排序:验证带符号向量能否预测整段上下文的收益

发现阶段学到的是完整上下文的变化方向,因此首先在同一尺度上验证。对每个留出查询,所有方法面对完全相同、预先采样好的完整示例集合;PULSE 对候选集合的完整上下文 SAE 激活减去零样本激活,再与带符号向量做内积:

\[ s_{\mathrm{rank}}(q_x,E)=\mathbf{w}_l^{\top}\bigl[\mathbf{A}_l(q_x,E)-\mathbf{A}_l(q_x,\varnothing)\bigr]. \]

选中最高分集合后才评测下游预测。正权重坐标的上升和负权重坐标的下降都会增加这个分数,所以它保留了发现时的方向信息。Lex-Sim、SBERT 和 KNN-SAE 在该协议下使用集合内查询—示例相似度的均值,CEIL 使用自身集合级多样性目标;它们不是在各自不同的候选池中比较。

这项实验回答的是“定位向量对未见查询上的完整集合是否有预测能力”,不是“实际检索器是否精确实现了集合效用最优化”。即使在该实验中预测准确,也不能据此断言这些坐标因果介导了 ICL:作者没有对特征进行消融、钳制或激活干预。

3. 幅值掩码检索:把集合级信号转成可缓存的相关性度量

如果实际示例池有约 2,000 个条目,枚举所有若干样本子集不可行;即使只对每个带答案的单例提示运行完整前向,也需要对每个查询—候选对重复计算,而且仍忽略多示例交互。PULSE-Retriever 因而采用更弱但可扩展的代理:查询和候选都使用输入侧的零样本 SAE 编码,只在效用相关的坐标上比较它们的相似度。

\[ \begin{aligned} s_{\mathrm{mask}}(q_x,x_i)&=\cos\!\bigl(|\mathbf{w}_l|\odot\mathbf{a}^{(q)},\;|\mathbf{w}_l|\odot\mathbf{a}^{(i)}\bigr),\\ s_{\mathrm{blend}}(q_x,x_i)&=(1-\beta)\hat{s}_{\mathrm{mask}}(q_x,x_i)+\beta\hat{s}_{\mathrm{cos}}(q_x,x_i). \end{aligned} \]

这里 \(s_{\mathrm{cos}}\) 是未加权 SAE 余弦相似度,帽号表示对同一查询的候选分数做 z-score 标准化。默认 \(\beta=0.3\),因此先标准化再以 0.7/0.3 混合,而不是对原始分数直接加权。对查询和候选两端同时乘幅值,等价于使用权重平方作为对角度量;它衡量“在重要坐标上是否相像”,不是候选的有符号效用估计。

使用绝对值的关键理由是尺度不匹配:集合级负权重没有被校准成“该候选输入应排在后面”。如果两端同时乘带符号权重再算余弦,符号也会在内积与范数中消失,结果其实与幅值掩码完全相同。附录 B 因此另用真正保留符号的双线性评分作为对照,而不是把“带符号余弦”当成另一种方法。

最后保留最高分的 50 个候选,从中逐步选择最终示例。第一步取相关性最高者,之后从混合分数中减去候选与已选示例之间最大的未加权 SAE 余弦相似度,惩罚系数为 0.3;每次排除已选条目。这样避免全部上下文被相互重复的近邻占据,但没有把集合级效用严格分解成可加单例效用。

损失函数 / 训练策略

PULSE 不训练新的检索头,不微调目标语言模型,也不重新训练 SAE;使用标签计算效用代理并闭式估计权重,不能因此称为“无监督”。分类使用教师强制标签似然决策;CommonGen 与 GSM8K 的最终评测采用贪心生成,最大新 token 数分别为 32 和 220。

Gemma2-2B 使用 Gemma-Scope 第 12 层、16,384 维字典,分别保留 512 个正特征与 512 个负特征。Llama3.1-8B 使用 Llama-Scope 131,072 维字典,分类、CommonGen、GSM8K 分别使用第 12、16、24 层,分别保留 2,048 个正特征与 2,048 个负特征。方差稳定项为 \(10^{-6}\);超参数在留出验证划分上校准后固定,测试集不用于特征发现。

实验关键数据

主实验

实验覆盖 AGNews、REST14、LAP14、EMOC、CommonGen、GSM8K。前三个中的 AGNews、REST14,以及 EMOC 使用固定 512 条留出评测查询;LAP14 使用完整的 463 条测试查询。示例池通常为 2,000 条,LAP14 为 1,850 条。因此分类结果不应被描述为所有数据集完整官方测试集的成绩。

下表摘取原文表 2 的四个分类数据集平均准确率(%);每个单元格依次为 1/2/4/8-shot。它是实际池级检索结果,不与表 1 的受控完整集合排序混用。

方法 Gemma2-2B:1/2/4/8-shot Llama3.1-8B:1/2/4/8-shot
Random 49.40 / 61.81 / 67.02 / 70.91 62.83 / 69.52 / 74.31 / 75.87
SBERT 68.58 / 71.01 / 73.45 / 77.37 72.99 / 77.56 / 78.46 / 79.68
CEIL 68.58 / 72.13 / 74.67 / 78.50 72.99 / 78.94 / 79.00 / 81.10
KNN-SAE 66.88 / 70.33 / 74.65 / 78.32 71.45 / 77.89 / 78.88 / 81.36
PULSE-Retriever 70.64 / 74.31 / 77.34 / 79.61 74.38 / 79.96 / 80.77 / 82.45

原文表 3 的生成与推理结果如下,数值为 1/2/4/8-shot 的均值;“最强基线”按该行任务与骨干的均值选取。

任务与骨干 指标 最强基线 PULSE-Retriever 提升
CommonGen,Gemma2-2B BLEU-4 CEIL:9.09 10.02 +0.93
CommonGen,Llama3.1-8B BLEU-4 SBERT:9.84 10.45 +0.61
GSM8K,Llama3.1-8B Exact match(%) CEIL:48.26 51.42 +3.16 个百分点

消融实验

下表汇总原文表 4、5、22 的 Gemma2-2B、4-shot 分类平均准确率;不同对照回答不同问题,不把所有行都当成单一模块删除实验。

配置 平均准确率(%) 说明
PULSE-Retriever 77.34 SAE 特征定位、混合评分与贪心去冗余
PCA 基底 73.87 保留配对目标和检索流程,替换内部基底
Raw 隐状态基底 73.38 使用同层均值池化原始隐藏维度
PULSE-Mask 73.46 仅用幅值掩码,去掉普通 SAE 相似度项
Anti-Retrieval 48.52 同一掩码,但选最低分条目
Sparse-Random 72.14 用随机稀疏特征替代定位特征
Bottom-Feats 71.31 使用绝对定位分数最低的特征
PULSE-NoTopK 73.36 纯掩码对照中不限制为最高分特征
纯 SAE 余弦,\(\beta=1\) 74.65 无效用掩码,与混合评分对照

关键发现

  • 受控排序在 32 个数据集—样本数—骨干组合中取得 30 个最佳或并列最佳;实际检索为 25/32。前者验证完整集合信号,后者验证转换为逐例代理后仍然有用,不能把前者数字当成后者成绩。
  • SAE 基底平均值 77.34 相对 PCA 的 73.87 和 Raw 的 73.38 分别高 3.47、3.96 个百分点。纯掩码 73.46 又低于混合检索 77.34,说明稀疏效用信息与更广泛的 SAE 相似度互补。
  • 附录 F 的 4-shot EPR-style 对照在 Gemma2-2B 与 Llama3.1-8B 上分别为 77.27、80.22,PULSE 为 77.34、80.77;分类平均优势较小,且 EPR 在 AGNews、LAP14 更强。PULSE 使用更少发现查询并不等于所有计算或反馈预算都严格匹配。
  • 跨数据集的 Gemma2-2B、4-shot 留一并集迁移平均为 76.71,对应目标内发现为 77.34;REST14 与 LAP14 的活跃特征 Jaccard 重合仅 0.112。部分迁移成功不意味着存在统一的任务无关效用方向。
  • 原文存在比较口径问题:摘要称分类相对“最强基线”提升 2–3 点,但实验正文的 2.93/1.99 实际相对 KNN-SAE;按表 2 各方法跨样本数均值,CEIL 是更强基线,PULSE 优势约为 2.01/1.38 点。另附录 F 用 EPR 的 GSM8K 4-shot 44.53 与 Random 的跨样本数均值 47.61 比较;同样 4-shot 的 Random 是 49.20。保留原值并区分口径,不把原叙述改写为一致证据。

亮点与洞察

  • 把“示例与问题相似”改成“哪些内部坐标与示例收益相关”,使特征选择直接对接目标模型。关键不是单纯换成 SAE 表示,而是利用完整集合的效用差异筛选表示维度。
  • 同查询配对降低查询难度混杂,排序实验再沿用集合级尺度验证方向信息。这个实验组织方式比仅报告一个下游检索提升更容易判断定位结果到底承载什么信号。
  • 对集合级符号和逐例相关性做了明确区分,避免把负权重草率解释成坏示例。幅值掩码也让候选编码可缓存,将解释性分析与可部署的检索代理连接起来。

局限与展望

  • 需要可用的目标模型 SAE、内部激活访问和带标签发现集,因此不直接适用于只有输出接口的闭源模型。附录 H 报告 Gemma 分类静态缓存约需 141–277 秒、发现前向约需 448–884 秒,梯度免费并不意味着计算免费。
  • SAE 激活的整段均值池化可能受示例长度影响;同查询配对无法自动排除不同集合长度带来的混杂。作者建议查询片段池化、等长集合或对激活差进行长度残差化。
  • 特征解释来自训练池高激活片段与事后语义归纳,尚无因果干预。应进一步检验改变指定特征是否真的改变示例效用,而不是把漂亮的语义解释当作机制证明。
  • GSM8K 的发现代理依赖监督解题序列,而不是只有最终答案。更弱监督下能否使用答案似然、执行奖励或生成推理轨迹,需要重新验证。
  • 三种种子只改变 PULSE 的发现样本及候选采样,未提供所有基线的匹配多种子显著性检验。附录 I 的 Llama3.1-8B、4-shot GSM8K 为 \(55.20\pm0.91\),不能直接与跨样本数均值提升 +3.16 构成显著性证明。

相关工作与启发

  • vs SBERT / KNN-SAE:前者使用外部句向量,后者使用内部 SAE 的普通相似度;PULSE 进一步从目标模型反馈发现重要坐标,但因此承担额外监督与离线计算成本。
  • vs CEIL:CEIL 通过集合多样性选择组合,PULSE 侧重效用相关内部表示;实际检索仍有去冗余步骤,所以这里不是“只要语义特征、不需组合设计”的证据。
  • vs EPR-style:EPR-style 将单例反馈用于梯度训练稠密检索头,PULSE 将完整集合配对反馈用于闭式特征定位。附录对照支持两者存在互补优势,尚不足以隔离监督规模、反馈单位和模型容量的所有差异。
  • 研究启发:可尝试保留查询片段的 SAE 激活,并在发现时同时控制上下文长度;再通过匹配预算的特征干预和多种子比较,区分效用预测、检索收益与真实因果机制。这是延伸方向,不是论文已经完成的实验。

评分

  • 新颖性: 4/5 — 将配对集合效用与 SAE 特征定位结合,并清楚区分排序与检索尺度。
  • 实验充分度: 4/5 — 六任务、两骨干及多类对照较完整,但匹配预算与统计检验仍不充分。
  • 写作质量: 4/5 — 代理边界解释清楚,摘要和部分附录比较口径需要谨慎阅读。
  • 价值: 4/5 — 为内部特征指导示例检索提供可复用方案,但部署依赖 SAE 与额外离线资源。