XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication¶
会议: NeurIPS2026
arXiv: 2608.11676
代码: https://github.com/WooseongYang/XBridge
领域: 多智能体 / LLM 效率
关键词: 异构模型通信、实体锚定、词汇锚点映射、交叉注意力、潜在表示传输
一句话总结¶
XBridge 用确定性词汇锚点映射传递完整上下文 token,再用成对训练的交叉注意力桥读取发送者隐状态,在三个异构模型配对的七项任务上均优于 128-token 文本摘要通信,并在指定 H200 测试中把单样本延迟从 1.70 秒降至 0.15 秒。
研究背景与动机¶
不同模型家族拥有不同的训练数据、分词器和表示空间,可能给多智能体系统带来互补能力,但它们不能直接共享任意隐状态或 KV 缓存。文本摘要提供了通用接口,却要求发送者逐 token 生成消息,还会把完整文档压成有限长度的字符串。本文的 NLComm 基线让发送者只看文档、不看问题,以贪心解码生成 128-token 摘要;这种设定尤其容易丢失接收者后来需要的具体人名、数字或关系。
把隐状态投影到接收者维度并不能自动解决问题。维度相同不等于表示分布相同,而且连续信号可能保留“谁与谁有什么关系”的语义,却不再可靠地区分参与关系的罕见名字。作者将后一种现象称为 rare-token compression collapse:这里的“压缩”指连续桥接中的信息瓶颈,不是已经证明减少了网络传输字节。只用潜在桥的 HotpotQA F1 为 30.3%,远低于双通道方案的 78.8%,说明精确词汇身份与上下文推理并不是同一件事。
本文因而不再要求一个连续通道同时承担身份保存和知识迁移。它把原始上下文 token 映射成接收者自己的词汇输入,让接收者先拥有可识别的词汇锚点,再按自己的处理状态检索发送者的深层表示。核心 idea:用离散的完整上下文通道固定实体身份,用接收者驱动的潜在桥补充上下文信息,避免让连续表示独自承担跨词表的精确实体恢复。
方法详解¶
整体框架¶
任务是一次非对称通信:发送者获得文档,接收者起初只获得问题,最终由接收者生成答案。发送者进行一次预填充(prefill)前向计算,输出原始文档 token 和最后一层隐状态;XBridge 同时传输这两类信息,而不是先生成摘要。
词汇锚点映射(Lexical Anchor Mapping,LAM)把文档 token 转成接收者词表中的 token,并通过接收者的冻结嵌入矩阵放到问题前面。潜在增强桥(Latent Enrichment Bridge,LEB)则在接收者的多个层中,以接收者状态作查询、以发送者隐状态作键和值进行交叉注意力。两路在接收者计算中结合:LAM 塑造查询所包含的实体信息,LEB 提供围绕这些实体的连续上下文信号,不需要另加显式融合网络。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
C["发送者文档"] --> S["发送者单次预填充"]
S -->|原始上下文 token| L["词汇锚点映射 LAM"]
S -->|最后一层隐状态| B["潜在增强桥 LEB"]
L -->|接收者原生嵌入| R["接收者自回归生成"]
Q["接收者问题"] --> R
R -->|接收者层状态作查询| B
B -->|门控残差| R
R --> A["答案"]
T["训练:标准答案 token"] -.->|答案预测监督,仅更新 LEB| B
图中的两路从同一发送者预填充结果分出,但 LEB 并非先独立产出一段固定消息:它在接收者预填充及答案生成中接受接收者查询。虚线是训练监督,不是推理时给接收者提供标准答案。
这里的 decode-free 仅表示发送者不进行自回归消息生成。LAM 的回退规则包含字符串解码与重分词,接收者仍然自回归生成答案;因此它不是“系统没有任何解码”,也不是“接收者不必读长上下文”。
关键设计¶
1. 词汇锚点映射 LAM:把实体身份放回接收者原生输入
LAM 处理发送者的全部原始文档 token,而不是运行命名实体识别后只挑出人名,也不是训练一个摘要编码器。每个分词器配对预先建立确定性映射:如果某个 token 的表面字符串同时存在于两个词表,直接查表转换 ID;否则把该 token 解码成字符串,再用接收者分词器拆成一个或多个 token,按原位置展开。附录示例中,Llama 的 199 被映射为 Qwen 的 1、9、9,展示的是一对多重映射而非重新生成数字。
映射后的 ID 查接收者自己的冻结嵌入矩阵,再把完整映射上下文置于问题之前。这样接收者的自注意力能够沿用预训练时对自身词汇的处理方式,不必把异构隐向量误当成词嵌入。它同时保留大量非实体文本,因为关系描述和实体位置同样影响接收者查询;“实体锚点”是该通道的作用,不是一个只传实体的稀疏消息格式。
作者在 100 个 HotpotQA 验证样本上报告,Llama→Qwen 的实际 token 直接映射率为 97.1%,Mistral→Qwen 为 87.8%,其余分别有 2.9% 和 12.2% 使用字符串回退。这与词表共享比例 85.4% 和 32.2% 不矛盾:词表统计按词条计数,实际映射率按样本中出现的 token 计数。
原文称映射“lossless”,支持的具体描述是所列示例中表面字符串得以保留、序列可能展开。逐 token 回退不是对完整文档执行一次全局重分词,不能据此保证两者具有完全相同的 token 边界;缓存也没有覆盖所有 Unicode、字节片段、特殊 token 和归一化组合的证明。因此宜把它理解为作者的词汇内容保留主张,而非任意分词器组合的无条件无损定理。
2. 潜在增强桥 LEB:由接收者选择需要的发送者上下文
即使接收者已经读到全部词汇,它仍未获得发送者模型对文档的深层处理结果。LEB 读取发送者最后一层的整段隐状态,以分别归一化后的接收者状态产生查询,并把发送者状态投影成键和值。查询投影在接收者维度内工作,键和值投影处理发送者与接收者的维度差异;各插入层有独立参数,却检索同一份发送者状态。
交叉注意力的意义不是把异构向量宣布为兼容,而是让接收者当前的语境决定哪些发送者位置值得读取。LAM 已经通过自注意力把文档中的实体及其上下文融入接收者状态,因此 LEB 的查询不再只有一个脱离文档的问题。只有 LEB 时,模型可能知道大致关系却无法锁定词汇身份;只有 LAM 时,它有文本,却没有发送者额外提供的表征。这也解释了为什么加入 LEB 在 LAM 基础上提升 22.3 个百分点,而单独 LEB 相对 NoComm 只提升 5.7 个百分点。
在 28 层 Qwen 接收者的默认配置中,四个模块插在第 7、14、21、28 层之后,每个约 66M 参数,总计约 264M,即该接收者规模的 3.8%。这一具体层号与参数比例属于该配置,不应直接套到反向通信中的 Llama 接收者;各模型配对需要按维度适配并单独训练,本文没有证明一个桥能够直接服务所有模型。
每层的注意力输出通过门控残差加入接收者状态,原文的核心更新为:
其中 \(A^{(\ell)}\) 是该层从发送者读取的交叉注意力输出。门参数初始化为 \(\alpha^{(\ell)}=1.0\),所以初始系数 \(\tanh(1.0)\approx0.76\),并不是零初始化的恒等保持。残差结构保留原有计算路径,但加入非零信号仍会改变隐藏表示;“接收者使用自身状态查询”不能解释为“接收者表示不受扰动”。
一个完整示例¶
附录给出的一个实体替换例子询问:岭南美术馆以北约 25 km 的港口城市是哪一个?原始文档对应答案为 Keelung,干预时将答案实体替换为 Majuro。下面用它说明信息流,而不是宣称所有样本都能答对。
发送者先处理文档,把城市名及周围关系编码到原始 token 和最后一层隐状态中。LAM 把整份文档词汇映射给接收者,其中包括城市名;接收者再把问题与这些词汇一起处理,形成知道有哪些实体及相关语境的查询。LEB 根据这些查询读取发送者的连续状态,接收者最终生成城市名。
在该示例中,两路都用原文时回答 Keelung;仅把 LEB 的输入改成替换后的文档状态,回答仍为 Keelung;仅替换 LAM 输入,回答变成 Majuro。这说明在这类干预中,显式词汇通道对输出的实体身份具有明显控制作用,但不证明 LEB 从不影响任何实体选择,更不证明关系或答案始终正确。100 个样本的总体实验有 55–59 个回答落在“既非原实体,也非替换实体”类别,不能把展示的三个成功例子推广为全部样本。
损失函数 / 训练策略¶
发送者与接收者主干都冻结,只更新桥接模块,包括投影、归一化与门控参数。训练采用标准答案 token 的下一 token 预测监督;LAM 是确定性操作,不通过监督学会生成摘要。原文写出的目标为:
其中 \(e_{\text{ctx}}\) 是 LAM 提供的上下文嵌入,发送者隐状态通过桥模块参与条件计算,原式未在条件项中另外显式列出它。训练时按标准答案计算损失;推理时不再提供答案监督。
默认平衡训练集共 587 个样本,来自七个任务域。作者称训练与评估切分无重叠,但“训练后跨七任务使用”不等于“七个任务全是未见任务”:这些域已经参与有监督训练。各发送者→接收者配对分别训练一次,之后在这些任务上固定使用,不进行逐任务再适配。
由于发送者被冻结,可以预先缓存文档 token 与隐状态,把后续桥训练缩短到单 GPU 不到 10 分钟。这个时间建立在已有缓存的前提下,不能作为包含缓存生成、模型加载、下载及全部配对训练的端到端成本。
实验关键数据¶
主实验¶
下表取原文表 1 的 Llama-3.1-8B-Instruct→Qwen2.5-7B-Instruct 配对,指标为答案 F1(%),增益单位为百分点。NLComm 使用 128-token 贪心摘要;FullComm 是接收者直接读取完整文档的单模型参考,不是通信竞争方法,也未参加原文的最佳方法排名。
| 任务 | NoComm | FullComm | NLComm | XBridge | 相对 NLComm 增益 |
|---|---|---|---|---|---|
| Countries | 0.0 | 50.8 | 22.6 | 72.5 | +49.9 |
| Tipsheets | 66.5 | 98.5 | 96.3 | 99.8 | +3.5 |
| HotpotQA | 24.6 | 78.4 | 68.5 | 78.8 | +10.3 |
| QASPER | 7.1 | 31.3 | 33.7 | 47.5 | +13.8 |
| MuSiQue | 10.6 | 31.5 | 32.5 | 48.2 | +15.7 |
| MFldQA | 17.3 | 48.2 | 24.8 | 44.2 | +19.4 |
| 2Wiki | 19.3 | 47.6 | 14.2 | 51.1 | +36.9 |
| 七任务平均 | 20.8 | 55.2 | 41.8 | 63.2 | +21.4 |
其余两个异构配对也在七项任务上全部超过对应 NLComm:Qwen→Llama 的平均 F1 为 61.9,对比 47.6;Mistral→Qwen 为 65.0,对比 44.1。三个配对覆盖三个模型家族,但并非三个家族的所有有向组合。
XBridge 对 FullComm 的优势不是“完全不读文档却超过读文档”:LAM 已把完整映射上下文放入接收者输入,还额外提供发送者状态。平均分可以更高,但并非逐任务总是更高;例如上述 MFldQA 的 44.2 低于 FullComm 的 48.2。
消融实验¶
以下结果均来自 HotpotQA 的 Llama→Qwen 配对。基础模块删除取原文表 3,模块数量和门初始化取附录表 9,锚定格式取附录表 8;它们比较的控制条件不同,不应混成同一因素的排名。
| 分析维度 | 配置 | F1(%) | 解释 |
|---|---|---|---|
| 通信参照 | NoComm | 24.6 | 接收者只有问题 |
| 删除 LAM | 仅 LEB | 30.3 | 连续桥缺少原生词汇锚点 |
| 删除 LEB | 仅 LAM | 56.5 | 完整映射词汇,没有潜在增强 |
| 完整模型 | LAM + 四模块 LEB | 78.8 | 双通道配合 |
| 模块数量 | 1 个 / 66M | 66.3 | 较小桥 |
| 模块数量 | 2 个 / 132M | 74.6 | 容量增加 |
| 模块数量 | 7 个 / 462M | 75.8 | 增加模块没有继续提高 |
| 门初始化 | 零初始化 | 72.7 | 低于默认暖初始化 |
| 锚定格式 | NLComm 文本 + LEB | 81.0 | 仍承担发送者摘要生成成本 |
实体干预实验另用 100 个 HotpotQA 样本,统计回答中出现的是原实体、替换实体,还是两者都没有;数字为样本数,不是 F1。
| LAM 输入 | LEB 输入 | 原实体 | 替换实体 | 两者都没有 |
|---|---|---|---|---|
| 原文 | 原文 | 45 | 0 | 55 |
| 替换文档 | 替换文档 | 4 | 37 | 59 |
| 替换文档 | 原文 | 5 | 37 | 58 |
| 原文 | 替换文档 | 45 | 0 | 55 |
关键发现¶
- LAM 与 LEB 的效果具有互补性:完整模型相对仅 LAM 提升 22.3 个百分点,而仅 LEB 相对 NoComm 只提升 5.7。实体干预支持词汇身份主要跟随 LAM,但大量“都没有”回答限制了这一证据的覆盖范围。
- 平衡训练集的七任务均分为 63.2,优于 20K HotpotQA 单域训练的 49.5 和 42K 不平衡训练的 59.3。它说明任务覆盖比盲目堆数据更重要,不说明 587 个样本足以覆盖任意新任务或模型。
- H200 上 HotpotQA 单样本延迟为 XBridge 0.15 秒、NLComm 1.70 秒,约 11 倍加速;NoComm 为 0.09 秒,FullComm 与 KVComm 均为 0.13 秒。主要节省的是发送者 128-token 自回归摘要生成,不能直接推广成跨机器带宽受限环境的 11 倍加速。
- 同构 Qwen→Qwen 使用另行训练的桥,七任务平均为 63.1,KVComm 为 51.1,FullComm 为 55.2。XBridge 在六项任务超过 KVComm,MFldQA 则为 45.6,低于 KVComm 的 48.3。
- 两个独立训练的桥在双发送者测试中无需联合再训练,HotpotQA F1 为 70.4,对比该测试的单发送者完整上下文基线 67.0 和双 NLComm 56.8。这里的零样本组合只指已有桥的组合,不是未训练模型配对的零样本通信;67.0 也不是表 1 的 FullComm 78.4。
原文一致性提示:正文消融段将实体锚定消融引用为表 5,但实际消融是表 3,表 5 是延迟;发送者规模段同样把表 4 误引为表 5。附录 B.2 称 587 个样本比 42K 少约 30 倍,但按列出的规模约为 71.6 倍,并称平衡训练“每项最好”,而 Tipsheets 的 99.8 低于不平衡训练的 100.0。附录 C.2 将 MFldQA 的 44.2−37.3 标为 +7.0,显示值之差为 6.9,可能涉及未显示精度;同段又混用了异构 XBridge 44.2 与同构 KVComm 48.3,声称的 HotpotQA +13.5 也不对应其表 11 的 87.1−65.3。这里保留各表原值,不把这些文字整理成不存在的统一实验口径。
亮点与洞察¶
- 精确词汇身份和连续知识不是必须二选一。给接收者保留原生词汇入口后,潜在桥可以专注于补充上下文,而不是承担所有罕见 token 的恢复。
- 接收者驱动的检索比固定注入异构状态更有针对性。不同层可以从同一份发送者状态读取不同信息,残差门控则调节增强幅度,但不构成分布兼容性的形式保证。
- 锚点的具体格式不是唯一有效选择。文本锚点加 LEB 达到 81.0,超过默认 LAM 加 LEB 的 78.8,说明默认方案优先消除发送者生成延迟,而不是在所有格式中取得最高准确率。
局限与展望¶
- 当前主要验证单向、单轮文档问答,未验证长期多轮潜在对话;两个发送者的组合也不足以说明任意数量智能体能够稳定扩展。
- LEB 是约 264M 参数的有监督适配模块,不是无需训练的通用翻译器。冻结两个主干并不消除每个有向配对的训练、缓存和存储成本。
- 通信载荷包含完整文档 token 与整段最后层隐状态,接收者还要处理长输入。论文没有给出减少通信字节或在真实网络中节省带宽的证明;未来应分别报告传输字节、网络耗时、接收者预填充和答案生成成本。
- NLComm 的摘要长度固定为 128 token,且发送者不知道问题。对更长摘要、问题感知摘要或不同通信预算的结论需要额外实验,不能把本次比较解释成优于所有文本协议。
- 表征分析来自 196 个 HotpotQA 样本,多 token 答案的词汇排名采用首个答案 token 作为诊断代理;余弦相似度改善和首 token 排名都不等于所有实体、完整答案及关系的忠实性保证。
- 应进一步测试数字、日期、多语言、特殊 token 与上下文边界,以界定逐 token 映射的内容保留范围;对实体替换失败及长文检索任务的分析也比只展示成功例子更有价值。
相关工作与启发¶
- vs NLComm / 多智能体辩论:文本消息易解释且跨架构通用,XBridge 则避免发送者摘要生成并额外暴露隐状态。本文测的是非对称单轮摘要通信,不是对完整辩论系统的直接替代验证。
- vs KVComm / 激活共享:同构 KV 或激活通信依赖架构兼容。XBridge 用词汇映射加可训练交叉注意力处理异构接口,但付出全上下文输入和成对桥训练的成本;同构检索任务中 KVComm 仍可更强。
- vs C2C / MoT:按本文相关工作,前者进行跨模型缓存投影,后者让主专家读取其他专家表示,但接收者已经拥有相关输入。XBridge 强调接收者起初没有文档时的实体身份恢复,因此任务设定的区别与模块形式同样重要。
- vs Flamingo:借用冻结主干上的门控交叉注意力适配模式,但检索源从视觉表示变为另一个 LLM 的文档状态,门采用非零暖初始化。可迁移的思路是保留原生词汇入口,再通过受监督的检索通道利用外部连续信息。
评分¶
- 新颖性: 4/5 — 把异构通信中的实体身份与上下文增强分开,双通道设计针对具体失败模式。
- 实验充分度: 4/5 — 有三个异构配对、七任务、模块消融和干预,但缺少广泛未见域、网络成本及多轮验证。
- 写作质量: 3/5 — 主机制清楚,但表号、倍数与附录比较口径存在不一致。
- 价值: 4/5 — 为低生成延迟的异构协作提供实用接口,但应明确成对训练和全载荷传输的部署边界。