跳转至

PersonaManifold: Revealing and Exploiting Curved Geometry in LLM Persona Representations

会议: NeurIPS2026
arXiv: 2609.34571
代码: https://github.com/airaer1998/PersonaManifold
领域: 可解释性
关键词: 人设表示、流形几何、各向异性、测地线引导、行为相似性

一句话总结

PersonaManifold 将 LLM 人设激活建模为弯曲且各向异性的低维流形,通过局部度量加权的图最短路衡量相似性并生成插值人设,使三种 7–8B 模型的 BST 综合三元组一致率较欧氏距离提高 5.1–6.1 个百分点,优势主要出现在高偏离人设对。

研究背景与动机

推理时激活引导让模型不经微调就能切换人设:先提取某种人格或角色对应的内部向量,再把向量加入残差流。PERSONA、Persona Vectors 等工作因此可以调节特质强度或组合多个特质,但通常默认人设空间足够线性:两个角色的向量平均就代表中间角色,不同方向的同等长度位移也具有相似的语义代价。已有工作观察到的特质耦合、引导效果不对称和组合偏差,则说明这个默认几何可能不合适。

这里的困难不是向量维数太高,而是“坐标中点”未必是“行为上成立的中间人设”。若两个角色位于一张弯曲的数据表面,直线可能穿过几乎没有真实角色支持的区域;若局部变化具有方向性,沿常见职业差异移动与沿罕见价值组合移动,也不该付出同样代价。仅增加一套人格问卷无法判断这种几何是否有实际意义,因为模型对自身特质的陈述可能与情境中的行为分离。

本文用两条相互补充的证据链回应问题:先分析人设激活的内在维数、方向代价和离散曲率,再看相应距离与路径是否改善行为相似性预测和人设插值。核心 idea:把人设控制从高维空间中的直线运算,改为沿观测人设支持的流形路径移动,并用情境行为而非仅靠自评问卷检验其效用。

方法详解

整体框架

输入是约 2,000 条人设描述和冻结的 LLM。离线阶段通过“人设激活提取”得到向量,以“流形几何估计”构建带局部度量的邻居图;推理阶段的“测地线引导”查询两个人设之间的路径,输出可注入残差流的中间人设方向。“BST 行为评估”独立生成行为相似性标签并评价距离,不参与 LLM 权重训练。

这不是新训练的生成网络,也不是每轮对话重新求解整个几何。人设池和图按模型预先建立,选定一对端点后才取路径、采样中间点和生成对话。曲率用于描述与分析空间;引导的直接机制是局部度量、图最短路及样条平滑,并没有把曲率值直接加入残差流。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["人设池与冻结 LLM"] --> B["人设激活提取"]
    B --> C["流形几何估计"]
    C -->|推理:端点路径| D["测地线引导"]
    D --> E["中间人设对话"]
    C -.->|距离评测| F["BST 行为评估"]
    G["独立情境问题与行为回答"] --> F

关键设计

1. 人设激活提取:用相同问题消去通用回答成分

人设池包含 PersonaHub 的约 1,500 条分层采样人设与 CoSER 的 500 个文学角色。前者覆盖职业、人口属性和价值描述,后者补充合成池里较少出现的特质组合。每个人设作为系统提示回答相同的 40 个探针问题;问题由 BFI-44、HEXACO-60、TIPI 条目改写为开放式情境,并经人工审阅。提取的是生成回答最后一个 token 在单个中间层的残差流,而非直接编码人设文本。

对每道题,人设条件下的激活减去无额外人设条件下的激活,再在 40 道题上求平均。这个差分旨在减去题目与通用回答的共同成分,得到人设相对中性状态的偏移;平均则减少单题上下文的影响。不过它也压缩了同一人设在不同情境中的变化,不能把向量理解为完备的心理模型。

作者以 200 个人设的验证集选择层,正文说明扫描候选 12–20 层,最终 Llama 与 Qwen 使用第 16 层、Mistral 使用第 14 层。随后 PCA 保留 99% 累积方差,将约 4,096 维压到 200–500 维。这一步保留的维数不等于后续估计的内在维数:PCA 保留表示空间,局部几何再判断其中有多少有效变化方向。

2. 流形几何估计:同时建模方向代价与可行路径

作者用局部协方差的 Marchenko–Pastur 谱检验及 Levina–Bickel 最大似然估计交叉判断内在维数,三种模型在所报告层上的估计落在 15–23 维。它比激活维数低很多,又明显高于 Big Five 的五个维度,说明低维并不意味着五维人格量表足以描述全部人设变化。

局部度量来自每个点的邻域协方差:取前若干个内在方向,把每个方向的方差加正则项后取倒数作为权重。常见变化方向方差大,移动代价较低;罕见组合方向方差小,等长移动更贵。因此它不是给所有点套同一个全局 Mahalanobis 矩阵,而是在不同位置使用不同的局部方向权重。默认邻居数是内在维数的 5 倍,正则项为 \(10^{-4}\)。

把这些点连成近邻图后,一条边分别用两个端点的局部度量测量,再取平均。以下是原文式(4)的核心路径机制,其中 \(g(x_i)\) 为上述局部度量,范数表示在该度量下的位移长度:

\[ w_{ij}=\tfrac{1}{2}\big(\|x_j-x_i\|_{g(x_i)}+\|x_i-x_j\|_{g(x_j)}\big). \]

Dijkstra 最短路的累计边长就是近似测地距离 \(d_g\)。局部度量改变“走哪个方向更便宜”,图连接则阻止跨越没有近邻支持的空洞;二者共同作用,不只是对欧氏距离乘一个缩放系数。路径受有限采样和邻居数影响,因此仍是图上的估计,不是已知连续流形的精确测地线。

另一个分析量是 Ollivier–Ricci 曲率:对相邻点,各自取均匀邻居分布,将两个分布的 Wasserstein-1 距离除以端点测地距离,再用 1 减去该比值;节点曲率则平均其邻边曲率。正值对应邻域趋于收敛,负值对应趋于发散。作者按密度分成五组再比较人设类型,试图检验职业与文学角色的曲率差异是否只是采样密度造成的。

3. 测地线引导:沿数据支持的路径形成中间角色

直接平均两个人设向量可能经过无人设样本支持的位置。本文先找图最短路,再在局部切空间用三次样条平滑离散路径,并沿弧长等间距采样 10 个中间点。平滑的作用是减少逐个邻居跳转产生的行为突变;它并不提供严格的“所有样条点都在真实流形上”的数学保证,流形贴合度因此仍需评测。

中间点经逆 PCA 映射回原始激活空间,在所选层加入残差流。原文式(6)先将映射后的方向归一化,再乘以端点范数的插值 \(s(t_k)\) 和引导系数 \(\alpha\):

\[ h_{\ell}\leftarrow h_{\ell}+\alpha\cdot\frac{P^{\dagger}\gamma(t_k)}{\|P^{\dagger}\gamma(t_k)\|}\cdot s(t_k),\qquad s(t_k)=(1-t_k)\|x_1\|+t_k\|x_2\|. \]

其中 \(\gamma\) 是平滑后的路径,\(P^{\dagger}\) 是逆 PCA 映射。这样路径形状负责“去哪一种人设”,强度则随端点范数平滑变化,避免把路径方向效果与中间点范数变化混在一起。实现表给出的 \(\alpha\) 范围是 0.5–2.0;该方法不需要更新 LLM 参数。

作者用 \(d_g/d_E\) 将人设对划为高偏离与低偏离组,并建议比值超过 1.2 时更值得采用测地线引导。需要注意,这个比值同时受各向异性度量与路径结构影响,不应直接等同于纯曲率。1.2 与约 60% 的覆盖率也是当前人设池中的经验结论,而非通用几何定理。

4. BST 行为评估:把相似性落实到情境选择与行动回答

BST 的问题覆盖道德基础、DOSPERT 风险倾向、人际环形模型、决策风格、Schwartz 价值观和沟通风格六类构念。GPT-5.2 每类生成 10 道强制选择题与 20 道开放题,共 180 道;用 500 个人设预试,去掉选择熵低于 0.8 nats 或开放回答嵌入方差低于 0.05 的题,保留 48 道选择题与 102 道开放题。它与提取激活所用的 40 道探针是不同的问题集。

行为距离组合选择题信号和开放回答嵌入信号,前者权重为 \(1/3\)。每个锚点从最近 5% 取正例、最远 20% 取负例,并要求锚点到负例的行为距离至少为正例的 3 倍,构成 10,000 个三元组。200 个抽样三元组由每组三名标注者验证,人类与系统一致率为 86.1%;不能把这个抽样验证理解为全部 10,000 组三元组均经人工审核。

距离是否遵循行为标签,由三元组一致率 TCR 衡量。给定锚点 \(a\)、行为正例 \(p\)、行为负例 \(n\),对待测表示距离 \(d\) 计算:

\[ \mathrm{TCR}=\Pr[d(a,p)<d(a,n)]. \]

论文分别报告由选择题、开放回答嵌入和组合信号构成的标签上的 TCR。TCR-choice 不依赖开放回答嵌入,为“用一种嵌入距离验证另一种嵌入距离”的循环性问题提供额外检查。

原文 §3.4 将行为距离分量描述为“选项一致性”与“嵌入余弦”,但没有明确写出将相似度转为距离的符号约定。这里保留其权重与三元组规则,不自行补出作者未明确给出的精确距离公式;复现时需要核对代码。

一个完整示例

附录 N 的一对端点是倾向避让冲突的儿科医生与善于对抗辩论的庭审律师,偏离比为 1.73。面对同事公开批评工作,直线中点容易同时表达感谢、强烈反对和犹豫;测地线中点则表现为冷静承认合理意见,再安排有证据的回应。这是沿可成立角色路径过渡,而不是把两种话术拼在一起。

该对的测地线与线性引导 IC 分别为 0.71 与 0.54,TS 为 0.74 与 0.51,MA 为 0.65 与 0.40。它说明了机制如何作用,但只是个案,不能替代下面按模型与偏离程度分组的结果。

实验关键数据

主实验

模型为 Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 和 Mistral-7B-Instruct-v0.3。下表摘取原文表 2,所有数字为百分比;“Choice / Combined”分别使用选择题与组合行为标签。

距离方法 Llama Choice / Combined Qwen Choice / Combined Mistral Choice / Combined
Euclidean 60.2 / 62.1 59.5 / 61.5 58.8 / 60.8
Mahalanobis 62.5 / 64.3 61.8 / 63.9 61.0 / 63.0
Isomap-Euclidean 63.8 / 65.8 63.0 / 65.1 62.5 / 64.3
Geodesic 65.2 / 68.2 64.3 / 67.0 63.9 / 65.9

综合 TCR 的绝对提升分别为 6.1、5.5、5.1 个百分点;选择题提升为 5.0、4.8、5.1 个百分点。原文报告相对欧氏距离的差异通过 bootstrap 检验,\(p<0.01\)。

引导实验选取 200 对人设,其中高偏离与低偏离各 50 对、随机 100 对,每条路径 10 个中间点、每点至少 20 轮对话。表 3 的以下结果仅对应高偏离组,不能当作全部人设对的平均表现。

模型 方法 IC TS MA
Llama Euclidean-Linear 0.58 0.52 0.41
Llama Graph-NN Chain 0.67 0.58 0.57
Llama Geodesic 0.72 0.69 0.62
Qwen Euclidean-Linear 0.55 0.49 0.38
Qwen Geodesic 0.69 0.65 0.58
Mistral Euclidean-Linear 0.53 0.47 0.36
Mistral Graph-NN Chain 0.66 0.53 0.56
Mistral Geodesic 0.66 0.63 0.55

IC 是每个中间点 20 轮回答嵌入的平均两两余弦相似度,再在中间点上平均;TS 是 Big Five 五种特质的相邻步变化方向与端点总体变化方向一致的比例。MA 用中间点到最近观测人设的测地距离除以人设间距离的第 95 百分位作归一化,再取平均并用 1 减去;它衡量贴近观测支持,不是独立的行为正确性指标。

外部表 L.1 中,Llama 的 PersonaGym PersonaScore 从线性的 3.12 提高到 3.71,BFI-44 Monotonicity 从 58.4% 到 72.8%,Trait Expression Score 从 61.3 到 76.5。独立自然度评价涉及 100 段对话、三名标注者,测地线为 3.82/5、线性为 3.41/5,Krippendorff 一致性系数为 0.73。

消融实验

下表摘取原文表 4。TCR 是 Llama 综合结果,IC/TS 是 Llama 高偏离组;未提供距离结果的引导变体以“不适用”标注。

配置 TCR(%) IC TS
默认:局部 PCA 度量、三次样条 68.2 0.72 0.69
各向同性欧氏边权 63.8 0.65 0.61
邻居数为内在维数的 3 倍 66.9 0.70 0.67
邻居数为内在维数的 10 倍 67.4 0.71 0.69
浅层(4–8) 63.1 0.63 0.58
PCA 保留 95% 方差 67.1 0.71 0.68
固定引导强度变体 不适用 0.69 0.65
无样条平滑 不适用 0.67 0.58

局部方向权重被移除后 TCR 降低 4.4 个百分点;去掉样条后 TS 从 0.69 到 0.58,显示图路径本身与路径平滑解决的是不同问题。

原文数值与表述边界需要保留:表 3 中 Mistral 的 Geodesic 与 Graph-NN Chain 的 IC 同为 0.66,MA 则为 0.55 对 0.56,因此不是所有指标严格领先。表 4 的各向同性变体 Qwen/Mistral TCR 为 63.1/62.0,与表 2 Isomap-Euclidean 的 65.1/64.3 不同;原文未充分解释设置差异,不能将它们当成同一行合并。

关键发现

  • 优势与偏离程度相关:附录表 K.1 中,最高四分位综合 TCR 提升为 11.7、11.3、11.1 个百分点,最低四分位仅为 1.4、1.2、1.1 个百分点。
  • 低偏离并不保证本文最优:表 K.2 中 Mistral 的 SLERP TS 为 0.64,Geodesic 为 0.63。几何估计最适合线性假设明显失效的位置。
  • 密度控制后类型曲率差异仍显著,\(p<0.001\);但这支持当前采样下的几何解释,不等于排除所有构图或表示提取因素。

亮点与洞察

  • 相似性预测与可操作干预相互支撑。好的几何不只把距离排序做得更好,还应让沿该几何移动产生可解释的行为过渡。
  • 各向异性与路径支持被放在同一框架内。前者回答局部方向代价,后者回答跨角色是否可以直接穿越,避免把所有收益笼统归给“非线性”。
  • 偏离程度可用于选择是否支付额外几何成本。迁移到其他属性引导任务时,应先验证距离尺度与行为增益,而不是直接沿用 1.2 的阈值。

局限与展望

  • 作者只测试 7–8B 模型;同一人设的均值向量忽略对话情境变化,BST 六类构念也不是完整的行为覆盖。更大模型与情境条件化表示仍待验证。
  • 离线计算与覆盖密度限制可扩展性。附录报告每模型提取约 45 分钟、几何估计约 15 分钟,但稀疏区域的最短路与切空间估计可能不稳定;合成验证也明确表明高噪声、高环境维数时精度下降。
  • 因素分离不是严格的二因素控制实验。Mahalanobis 到 Isomap 的比较同时更换度量与图路径,不能只凭这一阶梯证明曲率具有完全独立的因果贡献;可补充相同图上的各向同性/各向异性对照。
  • IC 可能把措辞重复误当作一致,MA 又依赖本文构建的几何。外部评测与人工评分缓解了这一问题,但还需要更丰富的行为任务和跨情境标注。
  • 高质量人设控制应限定于授权、透明的角色应用,并结合内容安全约束;行为自然度提升不等于部署风险已被评估充分。

相关工作与启发

  • vs PERSONA / Persona Vectors:这些工作以特质向量代数实现灵活激活控制,本文把端点间的直线替换成数据支持的路径。代价是需要人设池与图,而不是仅凭少数特质方向就能组合。
  • vs Isomap / Diffusion Maps:本文借用经典流形学习的邻域结构,并额外加入位置相关的方向权重、曲率分析与残差流干预。核心价值在于把几何与人设行为连接,而非提出全新的最短路算法。
  • vs 自评人格问卷:BST 关注情境中的行为选择,减少仅靠模型自我陈述的偏差;BFI-44 仍作为过渡指标参与评估,因此本文并非完全放弃问卷信息。

评分

  • 新颖性: 4/5 — 将局部几何分析与推理时人设插值联系起来,问题设定清晰。
  • 实验充分度: 4/5 — 三模型、距离和引导基线及外部评测较完整,因素控制和报告差异仍需澄清。
  • 写作质量: 4/5 — 主线明确,但行为距离符号约定和部分跨表结果不够清楚。
  • 价值: 4/5 — 为激活向量代数何时失效提供可测试的几何视角,适用范围仍需拓展。