PersonaManifold: Revealing and Exploiting Curved Geometry in LLM Persona Representations¶
会议: NeurIPS2026
arXiv: 2609.34571
代码: https://github.com/airaer1998/PersonaManifold
领域: 可解释性
关键词: 人设表示、流形几何、各向异性、测地线引导、行为相似性
一句话总结¶
PersonaManifold 将 LLM 人设激活建模为弯曲且各向异性的低维流形,通过局部度量加权的图最短路衡量相似性并生成插值人设,使三种 7–8B 模型的 BST 综合三元组一致率较欧氏距离提高 5.1–6.1 个百分点,优势主要出现在高偏离人设对。
研究背景与动机¶
推理时激活引导让模型不经微调就能切换人设:先提取某种人格或角色对应的内部向量,再把向量加入残差流。PERSONA、Persona Vectors 等工作因此可以调节特质强度或组合多个特质,但通常默认人设空间足够线性:两个角色的向量平均就代表中间角色,不同方向的同等长度位移也具有相似的语义代价。已有工作观察到的特质耦合、引导效果不对称和组合偏差,则说明这个默认几何可能不合适。
这里的困难不是向量维数太高,而是“坐标中点”未必是“行为上成立的中间人设”。若两个角色位于一张弯曲的数据表面,直线可能穿过几乎没有真实角色支持的区域;若局部变化具有方向性,沿常见职业差异移动与沿罕见价值组合移动,也不该付出同样代价。仅增加一套人格问卷无法判断这种几何是否有实际意义,因为模型对自身特质的陈述可能与情境中的行为分离。
本文用两条相互补充的证据链回应问题:先分析人设激活的内在维数、方向代价和离散曲率,再看相应距离与路径是否改善行为相似性预测和人设插值。核心 idea:把人设控制从高维空间中的直线运算,改为沿观测人设支持的流形路径移动,并用情境行为而非仅靠自评问卷检验其效用。
方法详解¶
整体框架¶
输入是约 2,000 条人设描述和冻结的 LLM。离线阶段通过“人设激活提取”得到向量,以“流形几何估计”构建带局部度量的邻居图;推理阶段的“测地线引导”查询两个人设之间的路径,输出可注入残差流的中间人设方向。“BST 行为评估”独立生成行为相似性标签并评价距离,不参与 LLM 权重训练。
这不是新训练的生成网络,也不是每轮对话重新求解整个几何。人设池和图按模型预先建立,选定一对端点后才取路径、采样中间点和生成对话。曲率用于描述与分析空间;引导的直接机制是局部度量、图最短路及样条平滑,并没有把曲率值直接加入残差流。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["人设池与冻结 LLM"] --> B["人设激活提取"]
B --> C["流形几何估计"]
C -->|推理:端点路径| D["测地线引导"]
D --> E["中间人设对话"]
C -.->|距离评测| F["BST 行为评估"]
G["独立情境问题与行为回答"] --> F
关键设计¶
1. 人设激活提取:用相同问题消去通用回答成分
人设池包含 PersonaHub 的约 1,500 条分层采样人设与 CoSER 的 500 个文学角色。前者覆盖职业、人口属性和价值描述,后者补充合成池里较少出现的特质组合。每个人设作为系统提示回答相同的 40 个探针问题;问题由 BFI-44、HEXACO-60、TIPI 条目改写为开放式情境,并经人工审阅。提取的是生成回答最后一个 token 在单个中间层的残差流,而非直接编码人设文本。
对每道题,人设条件下的激活减去无额外人设条件下的激活,再在 40 道题上求平均。这个差分旨在减去题目与通用回答的共同成分,得到人设相对中性状态的偏移;平均则减少单题上下文的影响。不过它也压缩了同一人设在不同情境中的变化,不能把向量理解为完备的心理模型。
作者以 200 个人设的验证集选择层,正文说明扫描候选 12–20 层,最终 Llama 与 Qwen 使用第 16 层、Mistral 使用第 14 层。随后 PCA 保留 99% 累积方差,将约 4,096 维压到 200–500 维。这一步保留的维数不等于后续估计的内在维数:PCA 保留表示空间,局部几何再判断其中有多少有效变化方向。
2. 流形几何估计:同时建模方向代价与可行路径
作者用局部协方差的 Marchenko–Pastur 谱检验及 Levina–Bickel 最大似然估计交叉判断内在维数,三种模型在所报告层上的估计落在 15–23 维。它比激活维数低很多,又明显高于 Big Five 的五个维度,说明低维并不意味着五维人格量表足以描述全部人设变化。
局部度量来自每个点的邻域协方差:取前若干个内在方向,把每个方向的方差加正则项后取倒数作为权重。常见变化方向方差大,移动代价较低;罕见组合方向方差小,等长移动更贵。因此它不是给所有点套同一个全局 Mahalanobis 矩阵,而是在不同位置使用不同的局部方向权重。默认邻居数是内在维数的 5 倍,正则项为 \(10^{-4}\)。
把这些点连成近邻图后,一条边分别用两个端点的局部度量测量,再取平均。以下是原文式(4)的核心路径机制,其中 \(g(x_i)\) 为上述局部度量,范数表示在该度量下的位移长度:
Dijkstra 最短路的累计边长就是近似测地距离 \(d_g\)。局部度量改变“走哪个方向更便宜”,图连接则阻止跨越没有近邻支持的空洞;二者共同作用,不只是对欧氏距离乘一个缩放系数。路径受有限采样和邻居数影响,因此仍是图上的估计,不是已知连续流形的精确测地线。
另一个分析量是 Ollivier–Ricci 曲率:对相邻点,各自取均匀邻居分布,将两个分布的 Wasserstein-1 距离除以端点测地距离,再用 1 减去该比值;节点曲率则平均其邻边曲率。正值对应邻域趋于收敛,负值对应趋于发散。作者按密度分成五组再比较人设类型,试图检验职业与文学角色的曲率差异是否只是采样密度造成的。
3. 测地线引导:沿数据支持的路径形成中间角色
直接平均两个人设向量可能经过无人设样本支持的位置。本文先找图最短路,再在局部切空间用三次样条平滑离散路径,并沿弧长等间距采样 10 个中间点。平滑的作用是减少逐个邻居跳转产生的行为突变;它并不提供严格的“所有样条点都在真实流形上”的数学保证,流形贴合度因此仍需评测。
中间点经逆 PCA 映射回原始激活空间,在所选层加入残差流。原文式(6)先将映射后的方向归一化,再乘以端点范数的插值 \(s(t_k)\) 和引导系数 \(\alpha\):
其中 \(\gamma\) 是平滑后的路径,\(P^{\dagger}\) 是逆 PCA 映射。这样路径形状负责“去哪一种人设”,强度则随端点范数平滑变化,避免把路径方向效果与中间点范数变化混在一起。实现表给出的 \(\alpha\) 范围是 0.5–2.0;该方法不需要更新 LLM 参数。
作者用 \(d_g/d_E\) 将人设对划为高偏离与低偏离组,并建议比值超过 1.2 时更值得采用测地线引导。需要注意,这个比值同时受各向异性度量与路径结构影响,不应直接等同于纯曲率。1.2 与约 60% 的覆盖率也是当前人设池中的经验结论,而非通用几何定理。
4. BST 行为评估:把相似性落实到情境选择与行动回答
BST 的问题覆盖道德基础、DOSPERT 风险倾向、人际环形模型、决策风格、Schwartz 价值观和沟通风格六类构念。GPT-5.2 每类生成 10 道强制选择题与 20 道开放题,共 180 道;用 500 个人设预试,去掉选择熵低于 0.8 nats 或开放回答嵌入方差低于 0.05 的题,保留 48 道选择题与 102 道开放题。它与提取激活所用的 40 道探针是不同的问题集。
行为距离组合选择题信号和开放回答嵌入信号,前者权重为 \(1/3\)。每个锚点从最近 5% 取正例、最远 20% 取负例,并要求锚点到负例的行为距离至少为正例的 3 倍,构成 10,000 个三元组。200 个抽样三元组由每组三名标注者验证,人类与系统一致率为 86.1%;不能把这个抽样验证理解为全部 10,000 组三元组均经人工审核。
距离是否遵循行为标签,由三元组一致率 TCR 衡量。给定锚点 \(a\)、行为正例 \(p\)、行为负例 \(n\),对待测表示距离 \(d\) 计算:
论文分别报告由选择题、开放回答嵌入和组合信号构成的标签上的 TCR。TCR-choice 不依赖开放回答嵌入,为“用一种嵌入距离验证另一种嵌入距离”的循环性问题提供额外检查。
原文 §3.4 将行为距离分量描述为“选项一致性”与“嵌入余弦”,但没有明确写出将相似度转为距离的符号约定。这里保留其权重与三元组规则,不自行补出作者未明确给出的精确距离公式;复现时需要核对代码。
一个完整示例¶
附录 N 的一对端点是倾向避让冲突的儿科医生与善于对抗辩论的庭审律师,偏离比为 1.73。面对同事公开批评工作,直线中点容易同时表达感谢、强烈反对和犹豫;测地线中点则表现为冷静承认合理意见,再安排有证据的回应。这是沿可成立角色路径过渡,而不是把两种话术拼在一起。
该对的测地线与线性引导 IC 分别为 0.71 与 0.54,TS 为 0.74 与 0.51,MA 为 0.65 与 0.40。它说明了机制如何作用,但只是个案,不能替代下面按模型与偏离程度分组的结果。
实验关键数据¶
主实验¶
模型为 Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 和 Mistral-7B-Instruct-v0.3。下表摘取原文表 2,所有数字为百分比;“Choice / Combined”分别使用选择题与组合行为标签。
| 距离方法 | Llama Choice / Combined | Qwen Choice / Combined | Mistral Choice / Combined |
|---|---|---|---|
| Euclidean | 60.2 / 62.1 | 59.5 / 61.5 | 58.8 / 60.8 |
| Mahalanobis | 62.5 / 64.3 | 61.8 / 63.9 | 61.0 / 63.0 |
| Isomap-Euclidean | 63.8 / 65.8 | 63.0 / 65.1 | 62.5 / 64.3 |
| Geodesic | 65.2 / 68.2 | 64.3 / 67.0 | 63.9 / 65.9 |
综合 TCR 的绝对提升分别为 6.1、5.5、5.1 个百分点;选择题提升为 5.0、4.8、5.1 个百分点。原文报告相对欧氏距离的差异通过 bootstrap 检验,\(p<0.01\)。
引导实验选取 200 对人设,其中高偏离与低偏离各 50 对、随机 100 对,每条路径 10 个中间点、每点至少 20 轮对话。表 3 的以下结果仅对应高偏离组,不能当作全部人设对的平均表现。
| 模型 | 方法 | IC | TS | MA |
|---|---|---|---|---|
| Llama | Euclidean-Linear | 0.58 | 0.52 | 0.41 |
| Llama | Graph-NN Chain | 0.67 | 0.58 | 0.57 |
| Llama | Geodesic | 0.72 | 0.69 | 0.62 |
| Qwen | Euclidean-Linear | 0.55 | 0.49 | 0.38 |
| Qwen | Geodesic | 0.69 | 0.65 | 0.58 |
| Mistral | Euclidean-Linear | 0.53 | 0.47 | 0.36 |
| Mistral | Graph-NN Chain | 0.66 | 0.53 | 0.56 |
| Mistral | Geodesic | 0.66 | 0.63 | 0.55 |
IC 是每个中间点 20 轮回答嵌入的平均两两余弦相似度,再在中间点上平均;TS 是 Big Five 五种特质的相邻步变化方向与端点总体变化方向一致的比例。MA 用中间点到最近观测人设的测地距离除以人设间距离的第 95 百分位作归一化,再取平均并用 1 减去;它衡量贴近观测支持,不是独立的行为正确性指标。
外部表 L.1 中,Llama 的 PersonaGym PersonaScore 从线性的 3.12 提高到 3.71,BFI-44 Monotonicity 从 58.4% 到 72.8%,Trait Expression Score 从 61.3 到 76.5。独立自然度评价涉及 100 段对话、三名标注者,测地线为 3.82/5、线性为 3.41/5,Krippendorff 一致性系数为 0.73。
消融实验¶
下表摘取原文表 4。TCR 是 Llama 综合结果,IC/TS 是 Llama 高偏离组;未提供距离结果的引导变体以“不适用”标注。
| 配置 | TCR(%) | IC | TS |
|---|---|---|---|
| 默认:局部 PCA 度量、三次样条 | 68.2 | 0.72 | 0.69 |
| 各向同性欧氏边权 | 63.8 | 0.65 | 0.61 |
| 邻居数为内在维数的 3 倍 | 66.9 | 0.70 | 0.67 |
| 邻居数为内在维数的 10 倍 | 67.4 | 0.71 | 0.69 |
| 浅层(4–8) | 63.1 | 0.63 | 0.58 |
| PCA 保留 95% 方差 | 67.1 | 0.71 | 0.68 |
| 固定引导强度变体 | 不适用 | 0.69 | 0.65 |
| 无样条平滑 | 不适用 | 0.67 | 0.58 |
局部方向权重被移除后 TCR 降低 4.4 个百分点;去掉样条后 TS 从 0.69 到 0.58,显示图路径本身与路径平滑解决的是不同问题。
原文数值与表述边界需要保留:表 3 中 Mistral 的 Geodesic 与 Graph-NN Chain 的 IC 同为 0.66,MA 则为 0.55 对 0.56,因此不是所有指标严格领先。表 4 的各向同性变体 Qwen/Mistral TCR 为 63.1/62.0,与表 2 Isomap-Euclidean 的 65.1/64.3 不同;原文未充分解释设置差异,不能将它们当成同一行合并。
关键发现¶
- 优势与偏离程度相关:附录表 K.1 中,最高四分位综合 TCR 提升为 11.7、11.3、11.1 个百分点,最低四分位仅为 1.4、1.2、1.1 个百分点。
- 低偏离并不保证本文最优:表 K.2 中 Mistral 的 SLERP TS 为 0.64,Geodesic 为 0.63。几何估计最适合线性假设明显失效的位置。
- 密度控制后类型曲率差异仍显著,\(p<0.001\);但这支持当前采样下的几何解释,不等于排除所有构图或表示提取因素。
亮点与洞察¶
- 相似性预测与可操作干预相互支撑。好的几何不只把距离排序做得更好,还应让沿该几何移动产生可解释的行为过渡。
- 各向异性与路径支持被放在同一框架内。前者回答局部方向代价,后者回答跨角色是否可以直接穿越,避免把所有收益笼统归给“非线性”。
- 偏离程度可用于选择是否支付额外几何成本。迁移到其他属性引导任务时,应先验证距离尺度与行为增益,而不是直接沿用 1.2 的阈值。
局限与展望¶
- 作者只测试 7–8B 模型;同一人设的均值向量忽略对话情境变化,BST 六类构念也不是完整的行为覆盖。更大模型与情境条件化表示仍待验证。
- 离线计算与覆盖密度限制可扩展性。附录报告每模型提取约 45 分钟、几何估计约 15 分钟,但稀疏区域的最短路与切空间估计可能不稳定;合成验证也明确表明高噪声、高环境维数时精度下降。
- 因素分离不是严格的二因素控制实验。Mahalanobis 到 Isomap 的比较同时更换度量与图路径,不能只凭这一阶梯证明曲率具有完全独立的因果贡献;可补充相同图上的各向同性/各向异性对照。
- IC 可能把措辞重复误当作一致,MA 又依赖本文构建的几何。外部评测与人工评分缓解了这一问题,但还需要更丰富的行为任务和跨情境标注。
- 高质量人设控制应限定于授权、透明的角色应用,并结合内容安全约束;行为自然度提升不等于部署风险已被评估充分。
相关工作与启发¶
- vs PERSONA / Persona Vectors:这些工作以特质向量代数实现灵活激活控制,本文把端点间的直线替换成数据支持的路径。代价是需要人设池与图,而不是仅凭少数特质方向就能组合。
- vs Isomap / Diffusion Maps:本文借用经典流形学习的邻域结构,并额外加入位置相关的方向权重、曲率分析与残差流干预。核心价值在于把几何与人设行为连接,而非提出全新的最短路算法。
- vs 自评人格问卷:BST 关注情境中的行为选择,减少仅靠模型自我陈述的偏差;BFI-44 仍作为过渡指标参与评估,因此本文并非完全放弃问卷信息。
评分¶
- 新颖性: 4/5 — 将局部几何分析与推理时人设插值联系起来,问题设定清晰。
- 实验充分度: 4/5 — 三模型、距离和引导基线及外部评测较完整,因素控制和报告差异仍需澄清。
- 写作质量: 4/5 — 主线明确,但行为距离符号约定和部分跨表结果不够清楚。
- 价值: 4/5 — 为激活向量代数何时失效提供可测试的几何视角,适用范围仍需拓展。