跳转至

Social Choice Foundations for Simulation-Augmented Generation

会议: NeurIPS2026
arXiv: 2609.38287
领域: AI 安全 / 多元对齐 / 社会选择理论
关键词: 比例代表性、模拟路由、观点嵌入、扩展批准规则、多元对齐

一句话总结

本文把模拟增强生成中的代表性路由形式化为比例聚类:先预测模拟响应的观点嵌入,再用 SEAR 选择少量模拟器;在明确的奖励分解与误差假设下给出近似代表性保证,并在两个模拟池上优于聚类和随机路由基线,但不研究最终回答的综合生成。

研究背景与动机

模拟增强生成(simulation-augmented generation,SAGE)希望在回答之前收集目标群体的不同观点,而不是把全部偏好压成一个平均奖励。直接查询每个模拟器可以得到完整的候选响应集合,却会增加生成成本、延迟和上下文负担。更现实的系统只能从已有模拟池中选择少数模拟器,而选择必须随当前问题变化:一个固定的代表集合未必能覆盖不同问题上的偏好结构。

这里的困难不是一般意义上的“多样性”。距离最小化的聚类可能把稀疏离群点分配为单独中心,却只给一个规模很大、观点一致的群体留下一个位置;随机抽样也不能对每个足够大的凝聚群体提供确定性保证。论文因此借用社会选择理论中的比例代表性公理,把问题改写为:如果某个群体占总人数的一定比例,而且共同认可一个未入选响应,它应该在输出响应集合中获得相应数量的代表位置。

论文进一步区分三种规模:真实总体、维护的模拟池,以及每次实际查询的模拟器数量。减少模拟池规模是抽样问题,减少当次生成调用是路由问题,两者的前提和误差不能混为一谈。核心 idea:将群体的比例代表要求转成观点空间中的预算约束,用廉价嵌入预测替代全池生成,再在预测几何上执行具有公理保证的 SEAR 路由。

方法详解

整体框架

输入是一个问题、已有模拟池及其上下文,输出是选中的模拟器索引和这几个模拟器生成的响应集合。理论首先讨论可访问个体奖励的理想情况;实际方案 Predictive Route–then–Simulate(PRS)只访问黑盒模拟器和观点嵌入模型,不要求在线取得真实个体奖励。

四个关键环节依次是“奖励几何”“观点代理”“预算路由”“选择性模拟”。离线阶段查询训练问题上的模拟响应,并用观点嵌入模型构造代理监督;推理时代理为全池预测向量,预算路由从中选出索引,最后只生成这些索引对应的响应。下图的虚线表示离线监督,不是当前问题上先运行全部模拟器。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["问题 + 模拟池"] --> B["奖励几何"]
    B --> C["观点代理"]
    T["离线模拟响应<br/>及观点嵌入"] -.->|训练监督| C
    C -->|推理:全池预测| D["预算路由"]
    D -->|选中索引| E["选择性模拟"]
    E --> F["代表响应集合<br/>不含最终综合"]

关键设计

1. 奖励几何:把代表性从平均质量改成群体的比例权利

设模拟池对应的人数为 \(n\),要选择的响应数为 \(k\)。对于任意 \(\ell\in[k]\),人数至少为 \(\ell n/k\) 的群体具有要求 \(\ell\) 个位置的资格。但资格还取决于偏好凝聚性:群体成员必须共同认可某个未入选候选,才能以它为比较基准。候选按来源索引区分,即使两个响应文本或向量相同,也仍是两个候选,而不是先去重后计算比例。

奖励比例正当代表性(rPJR+)要求,对每个这样的群体 \(S\) 和未入选候选 \(c\),入选集合 \(Y\) 中至少有 \(\ell\) 个响应满足:

\[ \max_{i\in S}r_i(p,o)\geq\min_{i\in S}r_i(p,c). \]

右边衡量群体对共同候选的最低认可程度,左边只要求某个群体成员认可入选响应。因而这是群体联合层面的代表条件,不是“每个人都满意”,也不要求同一个成员认可所有这 \(\ell\) 个响应。它更不保证所有小群体都有席位:低于一个位置对应的人数门槛时,公理可以不提供保护。

为了在未生成响应前路由,论文假设奖励能由单位球面上的共享响应嵌入与问题相关的个体偏好嵌入分解,并且每个个体都存在一个响应,其嵌入恰好等于该个体偏好向量:

\[ r_i(p,o)=\phi_i(p)^\top\psi(o),\qquad \phi_i(p),\psi(o)\in\mathbb{S}^{d-1}. \]

单位向量内积与欧氏距离单调对应,因此奖励公理等价于度量比例正当代表性(mPJR+):至少 \(\ell\) 个入选点到群体中最近成员的距离,不超过未入选候选到群体中最远成员的距离。这里“最近”和“最远”的不对称,正是上面群体最大奖励与最小奖励的几何版本。普通语义相似度并不能自动满足这个奖励解释;共享基底、单位化和最优响应可实现性都是理论假设。

总体抽样是独立的一层。固定问题、使用最优响应候选、从人数为 \(n_H\) 的总体中均匀无放回抽样时,定理 3 以至少 \(1-\delta\) 的概率把样本中的精确 rPJR+ 转为总体近似保证。样本量及总体群体资格变为:

\[ n=\left\lceil\frac{1}{2\varepsilon^2}\log\frac{2kn_H}{\delta}\right\rceil, \qquad |S|\geq(\ell/k+\varepsilon)n_H. \]

若群体共同候选的奖励至少为 \(\cos\beta\),总体保证至少 \(\ell\) 个入选响应对群体某个成员的奖励达到 \(\cos(\min\{\pi,4\beta\})\)。这不是无损转移,也不是一次抽样同时覆盖所有未来问题的结论;样本量还须在可行范围内支持所选响应数。原文用 \(n_H=8\) billion、\(k=10\)、\(\delta=0.05\)、\(\varepsilon=0.03\) 举例称约需 \(9\times10^3\) 个样本,但这个近似数与所列样本量公式不一致,应分别保留而不当作已核实的部署预算。

附录 B 的维度依赖结果用 VC 一致收敛替代对总体候选的联合界。它可使所需样本规模独立于总体人数和位置数,但定理 8 的比较候选限于样本中的未选点,并以距离的 3 倍近似保护任意凝聚群体;不能把它直接表述成定理 3 的同范围更强版本。分层抽样结果也要求指定抽样机制和群体规模松弛,不能仅凭样本构成接近总体就宣称公平性成立。

2. 观点代理:预测模拟器会表达的向量,而不是预测真实人类偏好

没有奖励访问时,最直接的做法是生成全池响应,再把每个响应送入观点嵌入模型(viewpoint embedding,VPE)。这种几何至少可以离线观测,却没有节省生成调用。PRS 改为训练一个问题与模拟器上下文共同条件化的代理:预测模拟器本来会生成的响应嵌入。代理既不生成响应文本,也不声称恢复不可见的真实偏好向量。

论文用已有偏好嵌入模型的一个副本进行 LoRA 微调。监督标签来自离线模拟响应经过原嵌入模型后的向量;推理时全池只执行代理前向计算。这样把在线瓶颈从全池自回归生成,转成全池编码、几何选择和少量自回归生成。代理仍随问题变化,而不是用固定聚类永久代表同一群体。

3. 预算路由:用批准预算防止同一个群体重复占用全部位置

SimulationRouter 将全池预测向量同时视为选民和候选,执行 Spatial Expanding Approval Rule(SEAR)。每个选民初始预算为 1;所有候选周围的批准球以共同半径扩张,某个尚未选中的候选球内剩余预算首先达到 \(n/k\) 时,就选择该候选,并从批准者处扣除总计 \(n/k\) 的预算,直到选满 \(k\) 个位置。奖励空间的对应版本 REAR 则逐步降低批准奖励阈值。

预算使已经获得代表的成员逐步失去再次资助候选的能力,给尚未充分代表的大群体留下资源。公理证明的关键是:如果一个足够大的群体共同认可的候选始终未选中,它必然已经把足够多预算花在相应数量的入选响应上。因此保障来自群体规模、凝聚程度与预算守恒,而不是来自最小化平均平方距离。

加速实现先为每个候选按距离排序选民,并保存逆排名、当前批准前缀和剩余预算和。扣费按排序依次进行:除每轮最后一个付款者外,正预算付款者都会耗尽预算;总正付款事件至多为 \(n+k\)。前缀指针又只前进不后退,因此排序后的维护工作可摊还到 \(O(mn)\),总选择时间为 \(O(mn\log n)\);模拟路由取 \(m=n\),得到 \(O(n^2\log n)\)。

这不是全部系统费用,更不是线性时间算法。它需要全池预测和候选—选民距离;若距离按显式 \(d\) 维向量计算,还应另计距离计算代价。论文比较的旧 \(O(k^2n^4)\) 是较早版本,其脚注说明此前工作在 2026 年 7 月已更新为 \(O(n^2(\log n+k))\),不能把旧界当成唯一现行基线。

4. 选择性模拟:先选索引再生成,并把两种误差分开记账

若模拟器总能生成其对应个体的最优响应,那么模拟响应嵌入等于真实偏好嵌入;在共同的决胜规则下,先模拟再选和先选再模拟会选择相同索引。因而在线生成调用可从 \(n\) 次减少为 \(k\) 次,且保留精确 rPJR+。非理想情况下,“交换顺序”仅保留近似代表性,而不保证相同结果。

误差有两个不同来源。模拟保真差距 \(\alpha\) 控制真实偏好向量与模拟响应嵌入的最大夹角;VPE 预测误差 \(\eta\) 控制代理向量与模拟响应嵌入的最大夹角。两者都是固定问题上对整个模拟池取最大值,不是训练损失或平均测试误差。PRS 的定理把群体共同认可候选的角度阈值 \(\beta\) 放宽到 \(\widetilde\gamma_\beta=\beta+2\alpha+4\eta\)。

这个结论还依赖奖励几何假设,不能仅凭代理准确就保证真实人群公平。原文定理 5 的正文写未截断角度界,附录证明则明确截断到 \(\pi\);定理 6 的正文和证明均写未截断的误差和。超出 \([0,\pi]\) 时不能继续把余弦当作单调奖励下界:这时应视为角度保证不再提供有用约束,而不是据余弦周期性推出更高奖励。这里记录原文表述差异,不另造作者定理。

可观测推论更窄:在预测几何中共同接近某个未选候选的足够大群体,选中响应在完整模拟响应几何中,至少有相应数量与该群体某个成员相距不超过 \(\beta+2\eta\)。这仍不等于对完整模拟几何中所有可能群体都满足精确 mPJR+,因此实验中的失败并不与近似理论矛盾。

一个完整示例

附录 A.2 给出一个不涉及具体问题内容的几何反例:\(n=6\) 个带索引的点中,4 个重合在原点,另外 2 个分别位于 \((1,0)\) 和 \((0,1)\),取 \(k=3\)。最优聚类可在三个不同位置各放一个中心,平方距离代价为 0,却只给原点群体一个入选候选。

原点群体人数为 4,恰好达到 \(\ell=2\) 时的比例门槛,而且对另一个未选原点候选的距离为 0,因此需要两个距离为 0 的入选代表。聚类结果只有一个,违反 mPJR+。SEAR 则允许两个不同索引、同位置的候选分别获得位置:代表数量对应群体占比,而不是对应视觉上不同的点位数量。

损失函数 / 训练策略

代理的训练同时拟合向量和保持群体间几何关系。一个批次采样同一问题下的 \(s\) 个模拟响应,损失是元素均方误差,加上预测与目标成对欧氏距离之间的 Pearson 相关损失:

\[ \mathcal L=\frac{1}{sd}\sum_{i=1}^{s}\|\hat{\mathbf e}_i-\mathbf e_i\|_2^2 +\lambda\left[1-\operatorname{Pearson}\bigl(\mathbf d(\hat{\mathbf E}),\mathbf d(\mathbf E)\bigr)\right]. \]

原文取 \(\lambda=1\),每批 16 个同问题用户响应。LoRA 的 rank 为 8、缩放参数为 16、dropout 为 0.05,应用于 query/value 注意力模块;这个缩放参数不是保真差距。AdamW 学习率为 \(10^{-5}\)、weight decay 为 0.01,训练 1 epoch,序列上限 2,048 tokens;附录报告使用 8 张 H100。降低在线生成调用并不免除这部分离线训练和数据采集成本。

实验关键数据

主实验

Remesh 使用 310 名参与者对应的模拟器,并由原有 4 个问题扩展生成 1,000 个训练/评测问题;其模拟器基于 Llama-3.1-8B-Instruct,不额外微调。Reddit AITA 数据有 992 个帖子、4,567 名用户,模拟器使用 HumanLM;由于公理验证昂贵,实际评测从中抽取 300 名用户。两域均在模拟响应的嵌入上验证,而不使用真实人类奖励作为评测真值。

核心指标是测试问题中满足精确 mPJR+ 的比例,选民和候选都来自完整模拟响应嵌入。缓存正文没有图 3 曲线的逐点数值,以下只记录正文明确给出的比较,不估读曲线。

方法 在线生成调用 两域中 \(k\in\{3,\dots,10\}\) 的结果 评测边界
Simulate–then–Route,oracle SEAR \(n\) mPJR+ 满足率 100% 完整模拟响应几何上的保证
PRS,预测向量 + SEAR \(k\) 所有所测 \(k\) 上优于两个路由基线 非零预测误差下不保证精确公理
PRS,预测向量 + \(k\)-means \(k\) 满足率低于 PRS-SEAR 选最近真实候选,不是输出任意中心
均匀随机路由 \(k\) 满足率低于 PRS-SEAR 抽样不提供逐问题比例保证

消融实验

论文没有报告去掉损失项或改变 LoRA 配置的系统消融。下面整理附录中六个展示案例在 \(k=4\) 时的公理验证标签,以案例编号代替具体问题或建议内容;它们是选择展示的案例,不是随机测试集,也不能据此计算整体胜率。

展示案例 PRS-SEAR PRS-\(k\)-means 随机路由 Oracle SEAR
Remesh,表 1 满足 不满足 不满足 满足
Remesh,表 2 满足 不满足 满足 满足
Remesh,表 3 不满足 不满足 满足 满足
Reddit,表 4 满足 不满足 满足 满足
Reddit,表 5 满足 满足 不满足 满足
Reddit,表 6 满足 满足 不满足 满足

关键发现

  • 增大 \(k\) 不等于更容易满足比例公理。正文报告非 oracle 方法的满足率随 \(k\) 增大而下降;作者解释为人数门槛变小,小群体更容易受预测误差影响,而非提供了已验证的因果消融。
  • PRS 的总体表现较好不意味着逐问题支配其他方法。附录表 3 明确出现 PRS-SEAR 失败而随机路由满足的案例。
  • 精确 mPJR+ 验证的时间为 \(O(mn\log n\cdot2^k)\),与路由选择的多项式复杂度不同;Reddit 缩小评测池正是为控制验证代价,不能据此宣称完整 4,567 人池已经通过同样评测。
  • Reddit 数据与模拟器存在判断类别偏斜。附录图 5 说明,在真实判断属于 YTA 的可分类响应对中,HumanLM 有 87% 输出 NTA;只统计双方输出含 NTA 或 YTA 的响应对,不能扩展为全部模拟响应的错误率。

亮点与洞察

  • 公理把“不同观点有多少”与“这些观点代表多少人”区分开来。索引多重集允许同位置候选占据多个位置,揭示几何去重可能破坏比例信息。
  • 代理监督直接对准路由所需的几何,而不是要求廉价模型复现长文本。成对距离相关损失也与后续批准球的结构更接近,但论文未用消融单独证实这一损失项的收益。
  • 将模拟保真差距与预测误差拆开很重要。前者决定能否解释为人类偏好代表性,后者决定廉价路由能否保持已有模拟池的结构;只观测后者不能审计前者。

局限与展望

  • 理论的共享、单位化、可实现奖励分解是强结构假设;现实观点嵌入未被实验证明满足它。方法的数学保证应与实际模型假设分开报告。
  • 实验只有两个领域,评测目标是模拟池,不是人类偏好真值或最终回答质量。路由后如何综合响应仍是开放问题,不能把候选集合代表性直接写成最终回答公平性。
  • 最大夹角误差会被个别模拟器主导;论文未给出真实总体上的保真差距测量,也没有报告完整部署的延迟、费用或公平性置信区间。
  • 低于人数门槛的群体可能没有保证;\(k\) 的选择因而改变保护范围,不是单纯的系统吞吐参数。作者也将不同群体、不同领域的异质保真度列为未来问题。
  • 原文样本量示例与公式不一致,且部分角度误差界遗漏截断说明。复用理论时应先核对公式适用区间,不能把宽松界当成非平凡奖励保证。

相关工作与启发

  • vs SAGE 总体架构:本文为其路由环节提供公理与算法,不负责总体确定、模拟器真实性或最终综合;本文 arXiv ID 为 2609.38287,不能与另一篇 SAGE 工作混同。
  • vs \(k\)-means / balanced \(k\)-means:聚类优化距离或簇大小,不自动获得比例代表性。附录分别给出反例,说明均衡簇规模仍不能替代群体的共同候选比较。
  • vs EAR / SEAR / REAR:贡献不是从零发明扩展批准思想,而是连接奖励与几何、给出特定付款规则下的快速实现,再证明路由与模拟的近似交换关系。
  • vs 固定社区模型与部署前偏好聚合:本文保持一个较大的模拟池,却按当前问题动态选择少量索引。可迁移的启发是审计“资源分配是否保护凝聚群体”,而不是把同一代表名单用于所有输入。

评分

  • 新颖性: 4/5。把比例代表性、抽样转移和生成调用缩减连成一套条件明确的路由理论。
  • 实验充分度: 3/5。两个模拟域支持比较结论,但没有真实人类奖励评测、损失消融或完整系统费用测量。
  • 写作质量: 4/5。奖励访问与黑盒访问的层次清楚,样本量示例和角度界表述仍需核对。
  • 价值: 4/5。为多元对齐提供可讨论、可验证的路由准则,其应用价值依赖模拟器与观点几何的可靠性。