跳转至

Witness Overlap: Directional Provenance Inside Open-Weight Model Families

会议: NeurIPS 2026
arXiv: 2609.31784
代码: https://anonymous.4open.science/r/witness-llm-DCA3/
领域: 模型检查点溯源 / 可解释性 / AI 安全
关键词: 方向性溯源、见证检查点、权重更新几何、奇异子空间、谱系审计

一句话总结

在已知同族且权重对齐的开放权重模型中,Witness Overlap 引入第三个检查点,比较两个候选端点各自向目标与见证者的更新重叠,以较低重叠端预测父模型;Frobenius 余弦在 16 个 LLM 家族的 1,542 个单见证三元组上取得 95.3% 定向准确率。

研究背景与动机

开放权重模型经常经历监督微调、偏好对齐与再次发布,审计者不仅想知道两个模型是否相关,也想知道哪个检查点在前、哪个由它派生。模型卡和仓库描述可以提供来源线索,但其完整性取决于发布者。已有表示指纹、权重距离和行为测试能发现亲缘关系,却往往依赖已知源模型,或者输出交换两个端点后不变的相似度,因此不能单靠分数区分父与子。

本文没有把“发现模型家族”和“恢复家族内部方向”混成一个任务,而是假定上游已筛出同族候选集合。在这个边界内,单个模型的权重范数或峰度不一定随微调单调变化,作者转而观察更新之间的局部夹角。从同一父模型出发,不同任务的微调更新常常弱相关;若把锚点移到一个子模型,向父模型和另一个子模型的两条差分都会包含返回父模型的共同分量。两种锚点的几何因而不再对称。

核心 idea:利用同族第三方检查点作为见证者,把对称的两模型相似性问题改写成锚点条件化的更新重叠比较,以局部分支几何提供谱系方向证据。 本文的对象是模型检查点,不是个人身份;输出适合研究审计,不能直接证明许可违规或真实训练历史。

方法详解

整体框架

输入是上游提供的同族检查点集合,以及各模型中可以逐项对应的二维稠密权重矩阵。每个查询选择候选端点 A、B 和另一个见证检查点 W;分别以 A 和 B 为锚点,构造两条权重差分,计算矩阵级重叠,再按参数块聚合成端点分数。方法的核心是“锚点重叠”和“任务判决”,而不是训练一个大型谱系恢复网络。

LLM 实验使用稠密投影参数块,排除 embedding、lm head 和归一化权重;VLM 与扩散模型使用各架构对应的共享投影块。共享家族不等于只要参数个数相同就可比较:矩阵的名称、形状和参数坐标必须对齐。没有额外同族见证者时,应拒绝判断,而不是换入任意模型。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    I["上游同族集合<br/>对齐二维权重"] --> G["锚点重叠"]
    G --> A["参数块聚合"]
    A --> D["任务判决"]
    D --> O["根模型 / 边方向<br/>关系类型 / 链顺序"]
    T["训练家族的<br/>关系类型标签"] -.-> C["关系类型校准"]
    A -.->|训练分数| C
    C -.->|仅关系类型阈值| D

实线表示推断时的数据流,虚线表示关系类型分类器的训练与阈值校准。根模型识别、已知父子边定向和受控单链排序不需要这条监督分支;不能据此把所有实验都称为无需训练。

关键设计

1. 锚点重叠:第三个检查点让端点交换产生不同证据

记同一矩阵在三个检查点中的权重为 \(W_A,W_B,W_W\)。以 A 为锚点时,两条更新为 \(\Delta_{AB}=W_B-W_A\) 和 \(\Delta_{AW}=W_W-W_A\)。Frobenius 余弦使用矩阵内积衡量完整更新方向的一致性,取值范围为 \([-1,1]\):

\[ \operatorname{overlap}_{\cos}^{(\ell)}(A;B,W)=\frac{\langle\Delta_{AB}^{(\ell)},\Delta_{AW}^{(\ell)}\rangle_F}{\|\Delta_{AB}^{(\ell)}\|_F\|\Delta_{AW}^{(\ell)}\|_F}. \]

把锚点改成 B 时,比较的是 A−B 与 W−B,而非简单地交换余弦的两个输入。因此,即使底层余弦是对称函数,两个锚点分数仍可以不同。父模型的外出方向若接近独立,分数较低;子模型的两条方向共享逆向更新分量,分数较高。这里依赖的是更新几何,不是发布时间或模型性能。

第二种实现对两条矩阵更新分别做截断奇异值分解(SVD),保留默认 \(k=16\) 的右奇异向量正交基,再比较两个主子空间:

\[ \operatorname{overlap}_{\mathrm{svd}}^{(\ell)}(A;B,W)=\frac{1}{k}\left\|V_{AW}^{(\ell)\top}V_{AB}^{(\ell)}\right\|_F^2. \]

它等于主夹角余弦平方的平均值,范围为 \([0,1]\)。SVD 分数对奇异向量符号和子空间内部换基不敏感,也不区分一个矩阵与其整体取负后的子空间;方向信息仍来自锚点改变所带来的差分结构,而不是奇异向量的正负号。只看主更新子空间能削弱一些细粒度扰动,但这不保证所有任务都比完整余弦更好。

2. 参数块聚合:平均局部标量,而不是拼接全部权重后计算余弦

矩阵级分数先在同一参数块角色内平均,再在不同参数块角色之间平均,得到整个三元组的标量重叠。这样的块感知聚合使不同类型的投影更新都能贡献证据;它不是先拼接所有层的更新,也不是按参数总量加权的一次全模型余弦。复现时若把这些操作交换,得到的统计量和论文不同。

这也限定了理论解释的使用方式:原文命题用一组展平更新说明锚点不对称的机制,而实际判决用多个矩阵与参数块的平均分数。不能把某个单矩阵的条件直接说成整个家族必然恢复正确的证明。权重空间对齐是计算前提,架构变化、重参数化或跨家族合并可能使同名矩阵不再代表相同坐标。

3. 任务判决:根据问题分别比较端点、见证对或链分数

已知 A、B 是直接父子关系时,单见证定向比较 \(s_A=\operatorname{overlap}(A;B,W)\) 和 \(s_B=\operatorname{overlap}(B;A,W)\),较低分数端被预测为父模型。主实验每次只使用一个见证者;多见证消融才对多个 W 的端点分数取平均。这个规则负责定向,不负责先证明任意一对模型都是直接父子。

根模型识别采用另一种聚合:对每个候选 M,把其余检查点的所有无序二元组合当成目标—见证对,平均 M 的锚点分数,再选最小者。这里两个非锚点的地位对称,且使用全部可用组合,不是仅随机取一个见证者。因此“单见证边定向”和“根识别 100%”是不同任务设置。

关系类型判别用较小端点分数 \(\min\{s_A,s_B\}\) 区分父子与兄弟。父子通常呈低—高模式,兄弟通常呈高—高模式,但需要学习跨家族的决策边界。它只覆盖论文定义的两种关系,不是一般多代祖先、合并贡献者或任意图边的分类器。

单链排序则已知基座 r,对每个 SFT 检查点 A,平均 \(\operatorname{overlap}_{\cos}(A;r,W)\),其中 W 遍历其他 SFT 检查点,然后按平均值递增排序。越晚的检查点向基座和较早见证者的差分共享越多逆向更新分量。这项证据来自五条受控三步链,不等于未知基座下的通用有向无环图恢复。

4. 关系类型校准:只在训练家族上学习额外判别边界

实际关系类型实验将较小端点分数输入逻辑回归,采用留一族交叉验证(leave-one-family-out,LOFO)。训练家族提供父子/兄弟标签并用于阈值选择,测试家族不参与校准。几何分数本身无需训练,但最终关系类型分类并非完全无需训练;其性能也明显低于已知边的定向准确率。

这种区分很重要:同一组特征可以支持无标签的端点排序,也可以作为监督分类器的输入。论文的“prompt-free”意味着无需运行模型生成回答或设计查询提示,不意味着不需要读取权重、挑选对齐参数块、构建同族集合,或者为关系类型准备校准标签。

一个完整示例

考虑一个仅用于解释的单矩阵家族:父模型 p 有两个子模型 i、j,两条非零更新等长且正交。以 p 为锚点,向 i 与 j 的余弦为 0;以 i 为锚点,向 p 的差分为 \(-u_i\),向 j 的差分为 \(u_j-u_i\),二者余弦为 \(1/\sqrt{2}\approx0.7071\)。对已知父子对 p、i,选择 j 作为见证者,较低的 0 分因此把 p 判成父模型。真实模型会在各矩阵分别计算并聚合,不能把这个示意值当成实测结果。

原文 Proposition 4.1 与附录 C.1 给出更一般的两条更新解释。令 \(\rho\) 是两条父到子更新的余弦,\(\lambda=\|u_i\|/\|u_j\|>0\),非零非共线时:

\[ C(p;i,j)=\rho,\qquad C(i;p,j)=\frac{\lambda-\rho}{\sqrt{\lambda^2+1-2\lambda\rho}}. \]

对这些定义,原文的 \(C(i;p,j)>C(p;i,j)\iff\rho<\lambda/2\) 可由显式表达式核验,不能把等长时的边界误读成任意正相关都成立。若 \(\rho<0\),子锚点分数为正、父锚点为负,比较自动成立;若 \(\rho\ge0\),平方比较必须先保留分子为正的条件。条件 \(\lambda>2\rho\) 本身保证这一点,因而并非无条件平方推导。

例如等长且 \(\rho=0.75\) 时,子锚点分数为 \(\sqrt{(1-0.75)/2}\approx0.3536\),反而低于父锚点的 0.75;正确的等长边界是 0.5。另一方面,\(\rho=0.8,\lambda=1.9\) 时,子锚点约为 0.878,大于 0.8,也符合原文条件。这里保留的是限定更新模型中的结论,不把它升级为所有实际参数块平均分数的充要保证。

损失函数 / 训练策略

Witness Overlap 不更新被审计模型的参数,也没有用于根识别或已知边定向的训练损失。Frobenius 余弦和 SVD 分数直接来自检查点差分,SVD 默认保留 16 个方向;关系类型分支另行拟合一维逻辑回归并校准阈值。

受控链实验中的模型微调只是为了生成有已知顺序的测试对象:依次在 MMLU、UltraChat、PubMedQA 上各训练一个 epoch,得到三个连续 SFT 检查点,使用全权重微调或 LoRA。不能把生成测试谱系所需的微调与溯源评分器的训练混为一谈。

实验关键数据

主实验

LLM 集合包含 176 个检查点、16 个家族,其中 16 个基座、130 个 SFT 后代和 30 个 RLHF/对齐后代,来自 80 多个 HuggingFace 组织。标签来自模型卡和仓库描述,直接父子边采用公开元数据约定,而非作者逐一验证的真实训练日志。完整 LLM 评估在一张 48 GB L40S 上约耗时 8 GPU·h。

下表选取原文 Tables 1–2 的根识别与单见证定向结果。根识别按家族计数;LLM 定向的 95.3% 对应 1,469/1,542 个正确三元组,不是 176 个彼此独立的模型决策。

方法 LLM 根识别 LLM SFT 定向 LLM RLHF 定向 LLM 综合定向 VLM 定向 扩散模型定向
Witness Overlap,Frobenius 余弦 93.8% 96.2% 91.4% 95.3% 100.0% 85.0%
Witness Overlap,SVD,\(k=16\) 100.0% 95.2% 86.4% 93.5% 87.5% 90.0%
L2 medoid 81.3% 不报告 不报告 不报告 不报告 不报告
Neural Phylogeny,范数规则 18.8% 79.2% 66.7% 76.9% 50.0% 50.0%
MoTHer,定向使用峰度 18.8% 79.2% 53.3% 74.4% 68.8% 70.0%

“LLM 综合定向”在此指原文 Combined 列,即 SFT 与 RLHF 样本合并统计,不指模型权重合并。两个 Witness 指标的 VLM 根识别均为 100.0%,扩散根识别均为 80.0%;SVD 的 LLM 根识别为 16/16,余弦为 15/16。标量基线不使用见证者;Neural Phylogeny 的监督版本未纳入此训练自由设置,故不是与该方法全部能力的比较。

跨域样本数存在原文表述冲突:贡献段称 16 个 VLM 检查点、20 个扩散检查点,但附录 N 的组成表给出 4 个 VLM 家族和 5 个扩散家族,每族一个基座及四个后代,分别对应 20 和 25 个总检查点。前述 16/20 与后代数一致,笔记保留冲突,不替作者改写实验口径。

消融实验

原文 §5.3 的见证池化实验先随机抽取见证者,再平均端点分数。其单见证起点与主表不同,下面保留原值,不能把它们强行对齐或当作同一采样结果。

指标 1 个见证者 3 个见证者 全部见证者 解释
Frobenius 余弦,LLM 定向 95.6% 97.9% 99.4% 与主表 95.3% 属于不同统计设置
SVD,LLM 定向 94.1% 97.9% 100.0% 与主表 93.5% 属于不同统计设置

关系类型实验是 LOFO 逻辑回归,不是上述无训练定向规则。原文 Table 3 的结果如下。

指标 LLM AUROC LLM 平衡准确率 VLM AUROC VLM 平衡准确率 扩散 AUROC 扩散平衡准确率
Frobenius 余弦 0.898 82.4% 0.903 79.9% 0.855 80.3%
SVD,\(k=16\) 0.780 68.6% 0.715 54.9% 0.855 53.3%

关键发现

  • SVD 对 LLM 根识别更好,但余弦对 LLM 单见证定向和关系类型判别更好;主子空间并不在所有决策上占优。LLM 单见证失败数分别为余弦 73/1,542、SVD 100/1,542,共享检查点产生相关三元组,不能视作独立试验。
  • 附录 J 按边平均全部见证者后,LLM 父/子锚点余弦均值为 0.0232/0.5527,SVD 为 0.0725/0.3961。这个分布差异支持机制解释,但不能替代对任意新家族的置信度校准。
  • 五条已知基座、三个 SFT 阶段的受控链都恢复了顺序。它是链内排序证据,不包含任意树、多基座或合并节点恢复。
  • 扰动结果具有明确边界:子模型噪声仅测 GPT-2 与 TinyLlama;GPT-2 全后代 10% 剪枝时,单见证 SVD/余弦为 77.8%/53.3%,全部见证者为 70.0%/50.0%,说明见证池化并非总能救回共同扰动。
  • INT8 实验采用特定逐张量量化—反量化并恢复共同稠密坐标:三族全部量化时,两指标均恢复 3/3 根、37/37 全见证边。不能据此推广到所有量化格式;同族合并实验也只支持根到合并模型的放置,不恢复贡献者集合。

亮点与洞察

  • 第三方见证者改变了相似性问题的参照系。无需为每个模型设计全局单调标量,就能从局部更新之间的共同分量构造非对称证据。
  • 参数块平均让机制能迁移到不同模型架构的共享投影空间。可迁移的是对齐更新的比较方法,而不是跨架构直接相减的权利。
  • 同一几何统计覆盖多种审计问题,但每种问题使用不同聚合和监督要求。把特征构造与决策校准分开,有助于避免把一个准确率扩大解释成完整谱系恢复能力。

局限与展望

  • 同族集合是外部输入,不解决家族发现;一个错入家族成员的有限压力测试不能证明对任意污染稳定。无见证者、坐标不对齐或来源混杂时,合理做法是拒绝或保留不确定性。
  • 更新高度相关或幅度严重失衡时,端点几何会反转;非零非共线的单更新命题也不等于块平均的全局保证。后续可研究每块可靠性、端点分数接近时的弃权及家族级校准。
  • 多数公开模型实验使用元数据声明的基座—后代边;真实中间节点缺失会影响“直接父子”标签。审计应结合可核实的训练记录,而不是由权重分数直接推出来源事实或许可责任。
  • 复杂分支、跨家族合并、贡献者恢复和对抗性改变不在验证范围内。本文只提供研究审计证据,不提供改变检查点以掩盖来源的操作指南。
  • VLM/扩散样本规模小且正文计数与附录口径不一致;主表、见证池化与不同剪枝子集的结果也不能混成一个统一准确率。扩大多代谱系、更多家族与明确统计单位的评估更有价值。

相关工作与启发

  • vs REEF、LLM DNA 与黑盒溯源测试:这些方法主要识别相关模型,适合作为上游家族筛选;Witness Overlap 假定家族已知,解决其内部方向。两阶段应组合审计,而非用定向结果取代来源筛选。
  • vs Neural Phylogeny:本文对比的是无需训练的参数范数规则,不是其监督检测器。锚点条件化几何减少了对微调后范数单调变化的依赖,但需要额外同族见证者和白盒权重。
  • vs MoTHer:MoTHer 用距离进行边放置、峰度线索确定方向并恢复树;本文比较局部更新重叠,实验并未完成一般树结构恢复。方向证据和图结构搜索是可分开的研究问题。
  • 研究启发:在有可信家族边界的模型供应链审计中,可将几何分数与模型卡证据一起报告,并区分定向置信度、边存在性与关系类型。新的方向是可靠性与弃权,而非把高分解释成法律结论。

评分

  • 新颖性: 4/5 — 用第三检查点的锚点条件化几何提取方向,而非再定义一个模型级标量。
  • 实验充分度: 4/5 — 16 个 LLM 家族、多任务及压力测试较丰富,但标签依赖元数据,跨域与复杂谱系覆盖有限。
  • 写作质量: 4/5 — 分数定义和任务边界清楚,但跨域总数口径及单见证采样结果需要更明确说明。
  • 价值: 4/5 — 为白盒模型供应链研究提供简洁的方向证据,不能单独证明真实来源或许可违规。