LogicTree-RAG: Logic Tree-guided Retrieval-Augmented Generation for Long-form Patent Drafting¶
会议: NeurIPS2026(任务归档;本笔记依据 arXiv v1)
arXiv: 2609.30943v1
领域: 信息检索/RAG
关键词: 逻辑树、检索增强生成、长文本生成、专利草稿、证据归因
一句话总结¶
LogicTree-RAG 先把研究论文组织为可检索、可递归扩展的证据关联逻辑树,再按章节混合遍历生成长篇专利说明书草稿,在 Pap2Pat 测试集上得到 20.22k 输出 tokens、43.79 覆盖度和 66.34 的来源结合事实性,但这些结果不等于可专利性或法律有效性认证。
研究背景与动机¶
从论文写专利,并不是把学术措辞换成法律措辞。论文通常围绕问题、方法和实验讲贡献,而专利说明书需要把技术问题、系统组成、操作过程与实现细节组织为独立可读的披露。一个模型即使能接收全文,也可能只生成几千 tokens 的概括;如果逐块扩写,又容易反复介绍同一模块,让某个分支很长、另一个关键分支缺失。输入上下文够长与输出技术内容完整,是两个不同问题。
已有专利生成方法常处理标题、摘要或权利要求等局部任务。面向整篇草稿的 COPGEN/Pap2Pat 使用分块大纲指导生成,AutoPatent 则需要草稿信息;作者指出,这些输入在相关任务设置中往往由参考专利提取,未必反映只有发明披露材料时的真实条件。本文希望直接从研究论文建立组织结构,而不是在推理时依赖参考专利的详细大纲。这里的论文只是发明报告的代理,不能直接推出公开论文仍满足专利申请的时间或新颖性要求。
因此,真正需要控制的是“哪些技术内容已经被覆盖、哪些细节属于哪个分支、下一次扩写应使用什么证据”。核心 idea:把带有来源证据关联的逻辑树作为生成状态,先在树上进行分支特异的检索、扩展和细化,再把同一结构按章节需要转换成有广度也有深度的说明书文本。
方法详解¶
整体框架¶
输入是作为发明披露代理的研究论文,输出是长篇专利草稿中的说明书内容。系统依次执行“语义分块与树初始化”“节点感知证据搜索”“证据引导扩展与细化”“章节混合遍历”:先建立来源文档知识库和浅层技术结构,然后通过 FIFO 队列处理节点,最后以不同遍历顺序组织背景、发明概要与详细说明。
每个节点代表一个技术要素,例如原理、步骤或子系统,同时保存生成内容和对应来源片段。这个中间表示不是形式逻辑证明树:父子边表示技术组织关系,而不是已验证的逻辑蕴含;证据片段或其 ID 与节点关联,也不意味着节点的每一句话都被该片段支持。
下图全部是推理时数据流与状态更新,不包含训练监督。搜索结果决定是否继续扩写;新增子节点回到队列,细化则修改当前节点,只有达到停止条件后才进入章节生成。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["研究论文"] --> B["语义分块与树初始化"]
B --> C["节点感知证据搜索"]
C -->|存在新证据| D["证据引导扩展与细化"]
D -->|新增子节点进入 FIFO| C
C -->|已覆盖则跳过并处理下一节点| C
D -->|队列清空或预算达到| E["章节混合遍历"]
C -->|队列清空或预算达到| E
E --> F["背景、发明概要、详细说明"]
Algorithm 1 明确列出的输出章节是 Background、Summary、Detailed Description。尽管摘要和人工评测讨论“完整专利”及 Claim Structure,所给算法没有独立的权利要求生成步骤,不能为其补造一个 Claims 模块。
关键设计¶
1. 语义分块与树初始化:先保留技术上下文,再建立可扩写的骨架
固定长度切块可能把术语定义和后续步骤分开,也可能把相邻但主题不同的段落拼在一起。本文先利用 PyMuPDF 提取文本块、字体、坐标和段落布局,恢复章节与段落边界,再计算相邻段落嵌入的余弦相似度。当相似度不低于阈值,且累计长度不超过上限时合并段落。这样,检索单位尽量是一段完整的技术语义,而不只是任意长度的字符串。
机制由原文 Eq. (2) 承载;相似度用于决定相邻段落是否合并,而不是判断生成内容的正确性:
默认语义阈值为 0.8,单块上限为 512 tokens。分块向量存入 Milvus 文档知识库,后续查询仍需取回对应原文片段。布局恢复与语义合并分别解决“边界在哪里”和“哪些相邻段落应留在一起”,不能把布局信息本身说成语义证据。
接着,LLM 生成初始技术描述作为根节点,再从描述中诱导第一层核心技术要素。根节点概括发明,内部节点组织较高层概念,叶节点承载待展开的细节;第一层节点进入后续队列,而非直接固定成专利章节大纲。论文正文与 Algorithm 2 用分块集合描述初始化输入,但 Appendix E 的实际初始化提示明确仅使用引言分块。这一范围差异应保留:全文用于知识库,初始根描述的提示配置更窄。
节点拥有生成文本及证据集合;实际理解这一关联时,应区分节点文本与用于回溯来源的片段/证据 ID。原文要求证据集合非空:
这个约束只规定“有可归因来源”。根节点关联分块集合,新子节点关联本轮检索上下文;并没有自动证明文本中的每个技术细节都由来源蕴含,尤其不能把后续内部知识补全当成来源已确认的实现。
2. 节点感知证据搜索:选择更属于当前分支的证据
假设同一父节点下有“相机跟踪”和“坐标校准”两个子节点,仅按当前节点相似度检索,可能让两者反复取回系统总览。本文先以当前节点文本查询知识库,最多取回 100 个候选,再用“与当前节点的相似度减去与其他兄弟节点的最大相似度”重新排序。证据不仅要相关,还要相对更适合当前分支,从而减少不同分支争用同一段泛化说明。
关键是减去最相似兄弟,而不是所有节点的平均相似度。原文 Eq. (6) 为:
其中当前节点的父节点是 \(v_f\),\(V_f^{child}\) 是该父节点的子节点集合。因此比较对象是当前节点的兄弟,而不是当前节点自己的孩子。主文 Remark 却把局部过滤写成与当前节点孩子重叠,和公式不一致;本笔记按公式及其变量定义解释,并保留该措辞问题。
正文把筛选写成分数阈值过滤;Appendix F.3 的实际配置则保留重排后的 top-5,并把阈值自适应设为第 5 名分数。这是按排名控制证据量,不宜描述成固定阈值实验。检索与重排后还要进行全局新颖性检查:若这些证据已被其他分支覆盖,则跳过当前节点。本地兄弟判别解决同一父节点下的分工,全局检查解决跨分支重复,二者不能混为一个“去重模块”。
主文把全局范围概括为父分支之外;Algorithm 2 的集合写法则排除父节点的直接子节点集合,并未完整定义该分支全部后代的排除方式。它们共同表达跨分支覆盖控制,但具体覆盖判定和精确排除边界没有充分展开,不能补写为已经实现的严格语义去重证明。
3. 证据引导扩展与细化:分别补技术层级和节点内部细节
逻辑树建设采用广度优先的 FIFO 调度,初始队列是现有叶节点。每次取出队首节点,完成节点感知搜索和全局覆盖判断;若缺少新证据就跳过,否则先扩展再检查是否需要细化。这样的调度避免一开始就深挖某个分支、耗尽预算后才发现其他核心技术尚未展开。
扩展提示根据本轮证据,把当前贡献写成更细的技术段落,再切成语义单位作为新的子节点。这些孩子保存本轮证据关联并追加到队尾,下一轮又以自己的内容检索。扩展改变树的规模和层级,不是简单地把原节点写长;它让后续查询逐步进入更细的技术空间。
细化处理另一种缺口:一个节点可能已经属于正确分支,却只写“执行校准”而没有定义输入、输出、参数或计算步骤。术语检测提示先识别欠具体的原文短语,再按来源可用性选择补全路径。对于来源中出现且能获得支持证据的领域术语,用证据引导的检索增强生成更新节点;没有相关来源证据时,使用模型内部知识给出通用、实现导向的描述。这一路径是补全,不是新增来源证明。
原文统计内部知识路径只在 8.6% 的步骤中触发,去掉它对覆盖度和事实性的影响较小。因此方法的主要收益更符合“检索证据组织得更好”,而不是“大量依靠模型常识扩写”。但较少触发不代表没有风险:来源没有说某种参数或实现时,通用补全可能把合理常识变成不属于该发明的确定性披露。
主文以队列为空或累计内容达到预算作为终止条件;实现配置进一步限制最大节点数为 64、最大深度为 3,根深度为 0。预算让内容增长可控,却不保证所有必要技术都被覆盖;节点数相同也不意味着每个分支获得同样有用的证据。来源不足时应暴露缺口,而不能把预算内生成完毕等同于技术完整。
4. 章节混合遍历:用广度形成全貌,用深度交代实现
树建好后,同一结构并不按单一顺序直接串接。背景和发明概要使用 BFS,优先覆盖高层概念与不同技术分支,避免其中一个实现细节压过整个发明的全貌。详细说明则先用 BFS 和 LLM 语义聚类识别连贯的逻辑子树,再在各子树内 DFS,沿技术链条逐层说明具体步骤。
这种区别针对的是章节的表达功能。概要需要“有哪些核心组成、它们如何配合”,详细说明需要“一个组成怎样具体运行”。BFS 的广度不是机械平均字数,DFS 的深度也不是凭空创造实现细节;章节文本仍应受已建节点及其来源证据约束。纯 DFS 消融生成得更长却覆盖更低,说明长输出不能替代章节均衡。
这里可控的是树预算、节点粒度和遍历策略,不是形式验证意义的法律控制。父子结构能暴露概念依赖,供专业人员检查和修订,但没有算法步骤验证权利要求范围、新颖性、创造性或司法辖区下的披露充分性。
一个完整示例¶
以下是基于 Appendix F.5 中光学患者定位系统材料的流程解释,不是论文报告的新实验,也不提供临床操作建议。
引言描述利用 CCD 相机跟踪单个红外反光标记,并用独立位置验证补充现有影像引导系统。初始化可以据此形成系统总览,再把“光学跟踪”“坐标校准”“工作流程”作为技术分支;具体第一层节点名称是说明性示例,不是原文公开的固定树。
处理“坐标校准”时,检索应关注标记坐标、相机坐标系与房间坐标系的对应,而不是重复相机跟踪总览。兄弟相似度惩罚有助于把这个分支和“光学跟踪”区分开;若证据没有被其他分支覆盖,就把来源中的校准步骤展开成子节点,再将它们加入 FIFO。
如果节点只说“通过 SVD 求相对位姿”,细化应从来源补齐坐标输入和变换步骤,而不是从常识发明该系统未报告的精度或参数。完成树后,概要以 BFS 讲清各组成如何协作,详细说明在校准子树内以 DFS 交代步骤。证据关联说明这些句子的查阅来源,不证明系统的临床安全性,也不证明相关专利的法律有效性。
损失函数 / 训练策略¶
LogicTree-RAG 是推理时编排框架,没有新增训练损失,也没有进行任务特定微调。默认骨干为 Qwen3-80B;温度 0.3、top-p 1.0,单次调用最大生成长度为 8,192 tokens,多次调用累计形成长输出。COPGEN 的 SFT 版本使用单独的训练配置,不能把它的训练收益归到 LogicTree-RAG 上。
实验关键数据¶
主实验¶
Pap2Pat 数据集包含 1813 对论文—已授权专利,本文主结果使用 500 对测试样本;COPGEN SFT 使用 1,000 对训练样本。LCFO 包含 252 篇长文档,用于非专利文档扩展验证;缓存只提供相关图的说明,未给可可靠转录的完整数字,因此不猜写 LCFO 分数。
Coverage 用生成文档作前提、参考专利句子作假设,经 BM25 检索和 NLI 最大蕴含概率平均衡量参考内容被覆盖的程度。\(\mathcal{F}_{Pat}\) 反向检查生成句子由参考专利支持的程度;\(\mathcal{F}_{Src}\) 的前提实际是“参考专利加来源论文”,不是来源论文单独。ROUGE-L 是文本重叠代理;Style 结合 n-gram 分布与 StyloMetrix;Repetition 是滑动窗口中的重复 n-gram 比例;Coherence 使用 DiscoScore。这些自动指标都不是法律或临床事实认证。
下表摘录主文 Table 1。COPGEN† 的符号按原文保留;Appendix F.2 说明使用空大纲与长大纲两种设置,但 Table 1 对符号映射没有清晰解释,因此不擅自给 † 指定一种输入条件。
| 方法 | 输出 tokens | Coverage ↑ | FPat ↑ | FSrc ↑ | ROUGE-L ↑ | Style ↑ | Repetition ↓ | Coherence ↑ | 时间 s ↓ |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3-80B | 8.91k | 39.09 | 37.50 | 44.88 | 34.08 | 35.06 | 6.05 | 95.71 | 81 |
| GPT-5 DT | 2.95k | 40.91 | 46.70 | 62.04 | 20.56 | 41.52 | 7.25 | 97.34 | 146 |
| COPGEN | 7.69k | 39.21 | 57.63 | 62.39 | 32.56 | 59.54 | 15.47 | 97.11 | 265 |
| COPGEN† | 8.96k | 32.85 | 52.44 | 58.16 | 28.96 | 43.38 | 18.94 | 97.21 | 216 |
| COPGEN w/ SFT | 25.85k | 40.77 | 50.12 | 59.69 | 38.72 | 62.21 | 21.58 | 97.50 | 221 |
| LongWriter | 10.81k | 37.21 | 36.65 | 45.21 | 21.12 | 34.26 | 6.67 | 95.62 | 197 |
| LogicTree-RAG | 20.22k | 43.79 | 58.92 | 66.34 | 38.91 | 65.68 | 4.14 | 97.45 | 311 |
| Contamination Control | 18.96k | 42.95 | 57.79 | 66.57 | 40.28 | 64.28 | 4.60 | 97.23 | 298 |
主结果在这些生成基线上表现出较好的覆盖、事实性、风格和重复控制,但 COPGEN w/ SFT 的 Coherence 为 97.50,高于本文 97.45,输出也更长。参考专利和直接使用来源论文的启发式行不属于生成基线,不能把“生成基线中最好”扩大为全表所有行最好。
Contamination Control 是按时间筛出的 post-2024 子集,不是与全测试集难度一致的配对比较。它的 FSrc 66.57、ROUGE-L 40.28 反而高于主结果 66.34、38.91,因此不应写成所有指标均略降。时间筛选只能减弱部分污染担忧,不能证明所有骨干的预训练语料没有重叠。
消融实验¶
下表来自主文 Table 2,采用原表数值与方向。
| 配置 | 输出 tokens | Coverage ↑ | FPat ↑ | Style ↑ | Repetition ↓ |
|---|---|---|---|---|---|
| w/o Logic Tree | 9.10k | 39.85 | 56.92 | 60.47 | 16.86 |
| Logic Tree w/o Retrieval | 8.21k | 40.56 | 51.16 | 59.05 | 9.38 |
| w/o Semantic Chunking | 19.42k | 42.09 | 53.74 | 62.27 | 10.93 |
| w/o Refinement | 18.58k | 39.92 | 56.85 | 61.87 | 4.09 |
| w/o Evidence-Grounded refinement | 19.60k | 40.16 | 56.98 | 62.64 | 4.67 |
| w/o Internal Knowledge refinement | 18.95k | 43.58 | 58.85 | 65.62 | 5.21 |
| w/o Node-aware Reranking | 20.85k | 42.60 | 57.13 | 64.79 | 8.32 |
| w/ DFS Traversal | 21.13k | 41.15 | 58.68 | 65.12 | 5.34 |
| LogicTree-RAG | 20.22k | 43.79 | 58.92 | 65.68 | 4.14 |
去掉树后覆盖度从 43.79 到 39.85,去掉检索后 FPat 从 58.92 到 51.16,说明结构和来源支撑作用不同。去掉节点感知重排时输出变长,重复率却从 4.14 到 8.32;纯 DFS 也更长而覆盖更低。因此收益不能只用输出长度解释。
“完整方法所有指标都最好”的原文表述过强:w/o Refinement 的重复率 4.09 低于完整方法 4.14。细化在覆盖、事实性和风格上有收益,但此表没有证明它对每个指标都占优。
关键发现¶
Appendix G.3 检查检索触发节点的生成内容是否被检索证据支持,结果如下。人审只抽取 20 个案例;“全部支持”是针对给定来源的判断,不是世界事实、临床有效性或法律真实性判定。
| 评估方式 | 方法 | Fully % ↑ | Partial % | Unsupported % ↓ |
|---|---|---|---|---|
| LLM-as-judge | COPGEN | 70.4 | 20.2 | 9.4 |
| LLM-as-judge | LogicTree-RAG | 85.6 | 12.0 | 2.4 |
| Human Audit | COPGEN | 60 | 30 | 10 |
| Human Audit | LogicTree-RAG | 75 | 25 | 0 |
- 计算预算有明确边界:Appendix G.4 报告每篇平均 20 次 LLM 调用、311s、7.60k 总输入 tokens;调用比例为初始化 5%、建树 45%、遍历 50%。节点数 64 和深度 3 是配置上限,不是每篇实际节点数,也不能从 20 次调用推断每个节点都单独调用一次。
- 效率不等于成本完全匹配:输出/总输入 tokens 是文中 token efficiency 的定义,不能替代 API 价格或相同成本条件下的质量比较。默认解码一致并不意味着骨干、训练数据、调用次数、输出长度或参考大纲信息完全一致。
- 人工偏好证据有限:Appendix G.5 称由 3 位专利从业者盲评 10 个样本;相对 COPGEN 的 Overall、Legality、Claim Structure、Antecedent Basis、Fidelity 胜率分别为 70.5、65.7、85.2、82.1、78.5。小数胜率如何由该样本量和胜/负/平结果汇总没有充分解释,不能据此推出稳定的法律结论。
- 结构控制可迁移,但数字边界要保留:LCFO 仅调整输出 schema;章节分析称详细说明覆盖度最多改善 17.4%,但缓存没有完整图值与明确配对行,因此不把这个比例改写成绝对百分点或重建图表。
亮点与洞察¶
- 把检索变成有分工的证据分配:普通 RAG 关心当前查询是否相关,本文还问这段证据是否更属于旁边的分支。这种相对相关性可用于技术报告的模块说明,减少每个章节都引用同一段总览。
- 把扩展和细化区别对待:前者增加技术层级,后者补节点内部缺口。对“漏了一个子过程”和“提到了过程却没讲清”采用不同更新,有助于定位生成不完整的来源。
- 遍历顺序是写作控制变量:同一组节点可以用于全局概要,也可以用于连贯的实施说明。把组织结构与最终章节文字分开,有利于人工检查某个遗漏究竟发生在建树还是文本呈现阶段。
局限与展望¶
- 不是形式验证系统:非空证据集合与较高支持率不保证逐句蕴含,部分支持与不支持仍存在。后续可增加细节级来源核验,并显式标记内部知识补全,避免把推测写成来源事实。
- 完整专利范围存在缺口:Algorithm 1 只展示说明书三类章节,人工评测却包含权利要求结构。未公开的 Claims 流程不能从评分反推出来,应要求明确的生成与核验协议。
- 人评叙述前后矛盾:正文和 Appendix G.5 把专家评测写成已开展;Appendix H 又把专利从业者评估视为未来验证方向。两者状态不一致,本笔记保留这一问题,不将它们自行整合为完全明确的已完成研究。
- 来源与参数有可复现性空白:初始化全分块/仅引言范围、兄弟/孩子措辞、全局覆盖的排除范围均需澄清。检索相似度也不能代替严格的新证据识别,图示数值不足时不应臆造结果。
- 高风险应用需专业审查:技术披露一致不等于新颖性、创造性、可专利性、法律有效性或可直接提交。系统是早期草稿辅助工具,不替代专利律师;医疗示例也不构成临床可靠性证据。
相关工作与启发¶
- vs COPGEN/Pap2Pat:COPGEN 围绕大纲块挑选来源并生成文本;本文自行形成逻辑树,用兄弟判别和跨分支覆盖控制其增长。优势是减少详细参考大纲依赖,代价是新增建树与覆盖判断的不确定性。
- vs LongWriter/LongWriter-Zero:这些方法主要增强长输出能力,本文侧重来源证据和技术层级组织。消融提示“更长”与“覆盖更全”需要分开评价,不能单凭 tokens 判断写作质量。
- vs ReAct/Plan-then-Execute:Appendix G.2 在相同核心工具基础上改用通用 agent 编排,覆盖度分别为 40.28、42.02,低于树编排的 43.79。它支持本任务中显式结构状态的价值,但不是通用 agent 在所有长文任务上都较差的证明。
评分¶
- 新颖性: 4/5。将分支特异检索、证据关联树和章节遍历组合为清晰的推理时框架。
- 实验充分度: 3/5。主实验、消融、成本和小规模人审较丰富,但评估范围与人评汇总仍有未澄清之处。
- 写作质量: 3/5。核心机制可理解,初始化范围、节点关系措辞和人评状态存在不一致。
- 价值: 4/5。对来源约束的长技术草稿组织有参考价值,不构成法律或临床可用性的保证。