Externalized CPDAG Summaries Improve LLM Causal Deduction¶
会议: NeurIPS2026
arXiv: 2609.31071
代码: https://anonymous.4open.science/r/cpdag-llm-reasoning-B48A
领域: LLM 推理
关键词: 因果演绎、CPDAG、马尔可夫等价类、约束解码、结构化中间状态
一句话总结¶
Structured Thinking 先让同一个大语言模型生成受格式约束的 CPDAG 摘要,再依据该图判断因果命题是否在所有相容 DAG 中成立,在 Corr2Cause 上将 Qwen3.5-27B 主种子 F1(YES) 从 73.01 提升到 86.36,但结构合法性和全等价类推理仍没有形式化保证。
研究背景与动机¶
Corr2Cause 给出变量间的相关性与条件独立关系,要求判断一条因果命题是否可以推出。难点不是找到一个看起来合理的因果故事:观察信息通常只能确定一个马尔可夫等价类,其中多个有向无环图拥有相同的条件独立关系。因此,“存在一种图让命题成立”和“每一种相容图都让命题成立”是完全不同的答案标准。后者需要持续保存骨架、分离集、碰撞结构以及尚未确定的方向,不能只靠某一条局部路径下结论。
自由形式思维链容易把这些信息混在散文里:模型可能把相关误读成直接邻接,把无向边擅自定向,或者找到一个支持命题的 DAG 就停止。本文并不是把一个完全不懂因果发现的模型加上 PC 提示后,与普通问答比较;主要基线已经明确要求构造骨架、识别碰撞结构、传播强制定向并检查整个等价类。作者进一步追问的是:即使给了算法知识,隐含在文字中的图状态是否仍然是瓶颈?如果图正是标签依赖的对象,就应让它先成为可检查、可干预的中间产物。
CPDAG,即完成的部分有向无环图,适合承载这个对象:有向边表示等价类中被强制的方向,无向边表示真实存在的方向歧义。相比增加更多文字推理,把这些事实放入固定字段,能让后续模型直接查询,也能区分“图构造错了”和“图读错了”。核心 idea:先外显定义标签的 CPDAG 摘要并约束其输出形式,再让最终答案面向这个图状态进行全相容图判断,而不是重新凭散文组织一遍因果故事。
方法详解¶
整体框架¶
输入由相关性/条件独立前提和待判断的因果假设组成,输出为 YES 或 NO。整个方法是推理时的两轮对话:第一轮通过“PC 规则脚手架”组织图构造,并用“受约束图摘要”记录结果;第二轮执行“全相容图查询”,把摘要作为图状态读回同一个模型。这里没有自动运行的外部 PC 算法、符号因果求解器或新训练的验证器,真正生成图和判断命题的仍是 LLM。
第一轮不是输出一个唯一的因果 DAG,而是输出 CausalAnalysis 对象。第二轮接收这些字段及其紧凑 DOT 表示,默认仍能看见原始前提和假设,因此图状态是决策锚点,但不是唯一信息源。图中的所有箭头均为推理时数据流;参考 CPDAG 和标签只用于离线评估,不进入这条流程,也不存在训练监督分支。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["相关与独立前提<br/>因果假设"] --> B["PC 规则脚手架"]
B --> C["受约束图摘要"]
C -->|字段与 DOT 回传| D["全相容图查询"]
A -->|默认保留原始输入| D
D --> E["YES / NO"]
关键设计¶
1. PC 规则脚手架:把统计约束转换为图构造步骤
第一轮提示先要求从所有变量间的完全无向图出发。只要前提给出一对变量在某个集合条件下独立,就移除这条边,并保存相应分离集;不能因为两变量边际相关,就认为它们之间必有直接边。相关可能来自间接路径,而相邻变量在忠实 DAG 中不会被其他变量集合分离。这一步把“没有边”和“边还在但方向未知”分开,避免后续把两种不确定性混为一谈。
接着模型检查非相邻端点共享的中间节点。若该节点不在端点的分离集中,则应形成两条箭头汇入中间节点的 v-structure;若它位于分离集中,就不能凭这种三元组强制定向。随后提示要求迭代应用 Meek 规则,例如已有箭头接无向边且两端不相邻时传播定向,或已有有向路径约束一条捷径的方向。骨架、碰撞结构和强制定向必须连贯更新,剩余无法确定的边保留无向。
这里的 PC 是语言指令脚手架,不是由程序执行条件独立检验、枚举图并返回正确结果的黑盒工具。模型接收的也是已经写好的统计关系,而非原始观测样本。提示采用闭世界假设:没有列出的独立关系视为不成立;这一设定适合该基准的穷尽式前提,不应直接套到现实数据里不完整、带检验误差的独立性列表。
2. 受约束图摘要:让中间状态可解析而非只在散文中存在
模型必须把发现的图信息写入六个字段:variables 保存变量;skeleton 保存邻接对;non_adjacent 保存非邻接对及分离集;v_structures 保存碰撞结构;directed 保存已定向边;undirected 保存仍有歧义的边。保留分离集尤其重要,因为相同的无向骨架可能对应不同的碰撞结构,仅列邻接关系不足以恢复等价类。显式区分已定向边和无向边,也阻止读者把“存在邻接”误当成“父子关系已确定”。
对 Qwen,JSON Schema 被转成正则语法,由约束解码器限制工具调用区域;若启用 thinking,前置思考内容仍然是自由文本,而不是每个推理 token 都被图语法约束。API 模型通过严格 JSON-schema 工具调用实现相同接口。Gemma 的后端对该 tokenizer 不可靠,所以只保留结构化接口,没有硬约束解码;不能把不同模型的“Structured”都解释成完全相同的实现。
该工具调用只是记录模型自己的分析,并把字段回传,不会调用因果求解器补全遗漏方向。Schema 的主要保证是字段和类型可解析:这些列表包含字符串,不会自动证明其中的边无环、Meek 定向已闭包、各字段相互一致或存在有效 DAG 扩展。因而本文把输出称为 CPDAG,是对其意图的说明,不是对每个样本的语义认证。格式稳定的价值在于减少状态漂移并方便审计,而不是把错误的因果推理变成数学正确性。
3. 全相容图查询:区分“可能成立”与“可以推出”
第二轮把结构化字段和 DOT 图读回模型,要求针对假设检查相关邻接、强制方向和有向可达性。对于方向未定的边,提示要求考察所有有效 DAG 补全;对于间接因果关系,要求相应有向路径在每一种有效补全中都存在。有效补全不是随意给每条无向边选方向,还必须保持等价类约束,例如不能制造新的碰撞结构或有向环。
核心判定语义如下,其中前提为 \(P\)、假设为 \(H\),\(G\) 表示前提所确定的参考 CPDAG,\(\mathrm{MEC}(G)\) 为其马尔可夫等价类。公式描述任务的真值标准,并不意味着 LLM 实际调用了一个能够穷尽证明的求解器。
这也是为何“存在未定向边,所以一定 NO”不是通用规则。直接父子命题可能被可逆方向否定,但另一个更全局的命题仍可能在全部有效补全中成立;模型应检查具体命题而不是只看有没有无向边。反过来,一条支持假设的路径或一个支持假设的补全也不足以回答 YES,只要还有一个合法反例,就无法推出。
该设计与主要基线的区别是决策前必须形成图状态。基线虽有明确 PC 指导,却直接给最终答案;两轮散文控制则先写自由分析再回答,仍没有类型化图对象。它们排除了“只是多一轮”和“基线没学过 PC”等简单解释,但两套提示不逐 token 相同,最终方法同时包含图外显、字段语义、硬约束及第二轮查询指令,不能把全部收益纯粹归给其中一个因素。
一个完整示例¶
下面是用于解释流程的自拟三变量示例,不是论文中的新增实验结果。假设前提说明 A 与 B 相关、B 与 C 相关、A 与 C 相关,但给定 B 后 A 与 C 独立,其余独立关系都不成立。
第一轮从完全图移除 A 与 C 的边,把 B 记录为它们的分离集,得到 A—B—C 的骨架。因为 B 在分离集中,不能把这个三元组定向为 A→B←C;也没有其他规则强制方向。因此摘要中的 directed 为空,两条骨架边进入 undirected,非邻接字段记录 A-C|B。
第二轮若被问“A 是 B 的父节点”,就不能挑 A→B→C 后回答 YES。该等价类还允许 A←B→C 和 A←B←C,后两种图里这个父子命题不成立,正确答案是 NO。同理,看到 A 和 C 相关也不能把它们写成直接因果邻接。
若换成 A 与 C 边际独立、给定 B 后反而相关的前提,则分离集为空,三元组会成为 A→B←C,A 是 B 的父节点才被强制。这个对照说明,中间状态的作用不是把自然语言漂亮地排版,而是保存决定方向的分离集和碰撞信息,让后续答案不会把不同等价类混在一起。
损失函数 / 训练策略¶
本文没有新增损失函数或微调训练。开放权重模型使用 vLLM 推理,常规设置为温度 0.6、top-p 0.95、最大上下文长度 32768;GPT-5.4-mini 使用高 reasoning effort。方法应理解为提示、输出约束和第二轮读图的组合,而非学习出一个新的因果发现网络。
训练侧不存在从参考图到模型的监督箭头;评估侧则分别核对最终标签和模型所构造的图。这样的分离能查出一种重要情况:最终答案碰巧正确,但中间图并不完全正确,甚至内部不一致。它避免只凭任务准确率就宣布模型学会了完整 PC 过程。
实验关键数据¶
主实验¶
ID 测试集包含 1162 条样本,其中 YES 只有 180 条,因此主指标为正类 F1(YES),准确率作为补充。Paraphrase-OOD 包含 2246 条样本,改变表述但保留图实例,并非新的因果图分布。下表来自原文表 1 和表 6,准确率与 F1 均以百分数表示;均值行的“±”为跨种子标准差。
| 模型 | 设置 | 方法 | F1(YES) | 准确率 |
|---|---|---|---|---|
| Qwen3.5-27B | ID,seed 42 | BaselineEnhanced | 73.01 | 92.43 |
| Qwen3.5-27B | ID,seed 42 | TwoTurn-Prose-PC | 67.55 | 89.41 |
| Qwen3.5-27B | ID,seed 42 | Structured Thinking | 86.36 | 95.87 |
| Qwen3.5-27B | ID,3 seeds | BaselineEnhanced | 77.49 ± 4.07 | 93.61 ± 1.04 |
| Qwen3.5-27B | ID,3 seeds | Structured Thinking | 85.57 ± 1.70 | 95.58 ± 0.50 |
| Qwen3.5-27B | Paraphrase-OOD | BaselineEnhanced | 72.33 | 92.61 |
| Qwen3.5-27B | Paraphrase-OOD | Structured Thinking | 82.79 | 95.06 |
主种子的 F1 增益为 13.35 个百分点,配对 bootstrap 的 95% 置信区间为 [+8.42, +18.59],准确标签的精确 McNemar 检验为 \(p=2.4\times10^{-6}\)。三个种子的 F1 增益平均为 8.08 ± 5.34 个百分点,不能把主种子的较大收益当成稳定均值;额外两次运行的收益分别为 2.68 和 8.21 个百分点。
跨模型结果也为正:Qwen3.6-27B 从 75.92 到 85.71,Gemma-4-31B 从 85.38 到 87.39,Qwen3.5-9B 从 39.18 到 59.56,GPT-5.4-mini 从 85.39 到 88.58。除主要 ID 三种子比较外,这些结果及 OOD 多为单种子;Gemma 还缺少硬约束,跨后端比较应保留实现差异。
消融实验¶
下表为原文表 2 的 Qwen3.5-27B 完整 ID 消融。变化是相对完整方法的 F1 绝对百分点差,不是相对百分比下降。
| 配置 | F1(YES) | 准确率 | 相对完整方法变化 |
|---|---|---|---|
| Structured Thinking 完整方法 | 86.36 | 95.87 | — |
| 移除 thinking | 71.95 | 92.08 | −14.41 |
| 移除约束解码 | 76.88 | 93.37 | −9.48 |
| 移除 PC 算法提示 | 36.21 | 87.26 | −50.15 |
最严重的下降来自删掉 PC 内容,说明随便输出一个工具对象并不能解决任务。去掉硬约束时仍保留软工具格式指令,因此该消融比较的是强制语法与仅要求结构化输出,而不是“有工具提示”和“没有工具提示”。这些单因素移除属于敏感性分析,不构成可相加的独立贡献分解。
原文表 4 对中间图的审计进一步检验了“输出像图”和“输出对的图”之间的距离。边/碰撞结构 F1 采用小数标度;精确匹配、一致性违规和条件准确率采用百分数,不能把它们混为同一种指标。
| 审计指标 | ID | Paraphrase-OOD |
|---|---|---|
| 骨架 F1 | 0.960 | 0.959 |
| 有向边 F1 | 0.896 | 0.884 |
| v-structure F1 | 0.923 | 0.920 |
| CPDAG 精确匹配 | 75.9% | 74.4% |
| 图一致性违规 | 18.4% | 20.7% |
| 图精确匹配时的准确率 | 97.2% | 96.6% |
| 存在一致性违规时的准确率 | 91.1% | 90.1% |
关键发现¶
- 提高 F1 不等于每次都提高精确率。 主种子真阳性从 119 到 152、假阴性从 61 到 28、假阳性从 27 到 20;但额外两种子的精确率略降,主要改善来自召回。稳健表述应是 F1 和召回改善,而非所有错误类型普遍减少。
- 图内容确实影响后续答案。 第二轮去掉前提时 F1 为 82.56,全图打乱后为 74.32,相对完整方法分别下降 3.80 和 12.04 个百分点。不过破坏可能制造无效 CPDAG,这证明内容依赖,不证明模型逐条执行了合法的全等价类证明。
- thinking 的作用依赖规模。 附录中的 Qwen3.5-9B 去掉 thinking 后,Structured Thinking 从 59.56 升至 64.46;不能把在 27B 上有效的推理开关不加验证地移植到小模型。
- 更大图只是压力测试。 附录在随机及 ALARM 派生的七变量图、ASIA 派生的八变量图上继续观察到收益,但图族不同且是单种子,不能作为受控的变量规模趋势;网络名称和语义变量名也没有提供给模型。
亮点与洞察¶
- 中间表示对准真值对象。 图摘要不是通用“先计划再回答”,而是明确保存决定标签的等价类信息。类似思路可用于程序状态或约束系统,但应先确定任务真正依赖的形式对象,而不是默认任何 JSON 都有帮助。
- 把构造与读出分开评估。 高骨架 F1 与较低有向边 F1 揭示方向判断仍更困难;正确答案也不能掩盖图一致性违规。可审计的状态让后续修复能够针对缺边、错方向或命题读出,而不只重写更长提示。
- 控制实验约束了结论。 两轮散文与单轮结构化措辞没有恢复收益,支持类型化状态的价值。作者同时保留提示与接口的混合因素边界,没有把行为探针夸大成完整机制解释。
局限与展望¶
- 不等同于真实观测因果发现。 实验从文字化统计约束进行演绎,没有证明在有限样本、潜在混杂或错漏独立关系下仍能恢复因果图,也没有测出真实世界干预效果的准确性。
- 语法约束不是语义认证。 一致性违规包括字段冲突、碰撞结构不一致、缺少闭包或没有合法 DAG 扩展。更合理的下一步是增加独立图验证器,并将无法认证的摘要转入修复流程,而不是让模型把可解析状态当成真值。
- 因素仍然捆绑。 图字段名称、结构化输出、工具结果格式与第二轮指令一起变化;当前探针也不保持图合法性。更细的因子设计、轻结构化散文控制以及保持有效 CPDAG 的干预,有助于定位收益来源。
- 成本与接口有实质影响。 两轮大约消耗基线两倍 token,批处理 vLLM 的墙钟时间约为 1.5 倍。附录显示强制指定 API 工具可能压缩推理预算,改用自动工具选择加提示后才恢复效果,因此复现必须记录调用策略而非只记录模型名称。
- 错误图库不是总体错误比例。 附录手工标注的 32 个案例是为覆盖失败类别而选择,不能把其中缺边、读图错误、等价类歧义和非法图的比例当作无偏分布。对 SCM、干预问题或世界模型的迁移也尚待验证。
相关工作与启发¶
- vs Corr2Cause / Jin et al.:原基准定义了从相关与独立前提到因果命题的演绎任务;本文改进的是 LLM 在该任务上的推理接口,不是重新提出 PC 或发现新的可识别性定理。
- vs Sun et al. 的 Structured Thinking 前作:前作用知识图谱式中间表示提高因果泛化;本文把状态进一步收敛为 CPDAG 摘要,并引入强 PC 基线、图内容破坏探针和全划分字段审计。
- vs 模块化因果提示与 C2P:这些方法把过程拆成提示步骤或散文子答案;本文要求一个固定类型的图对象。启发是让每一步留下能够检查的任务状态,而不只是留下另一个自然语言结论。
- vs PAL / Program of Thoughts:程序辅助方法把计算交给代码,本文的工具只记录模型分析,没有符号求解器替它推导答案。这降低外部执行依赖,也意味着仍需承担模型构图与读图错误。
评分¶
- 新颖性: 4/5 — 将任务真值对象与中间状态绑定,并通过内容探针检验其作用,但仍属于结构化提示路线。
- 实验充分度: 4/5 — 有强基线、主要比较的多种子与全图审计,其他条件的单种子及混合因素仍限制机制结论。
- 写作质量: 4/5 — 方法、提示和后端差异说明清楚,尤其明确了格式合法与图语义合法的边界。
- 价值: 4/5 — 提供无需微调的因果演绎改进和可复用审计思路,但尚不能替代可靠因果求解器。