Narrative-Driven Paper-to-Slide Generation via ArcDeck¶
会议: ECCV2026
论文: ECCV 原文
领域: LLM Agent
关键词: 幻灯片生成、篇章关系树、全局承诺、叙事规划、多智能体协作
作者为 Tarik Can Ozden、Sachidanand VS、Furkan Horoz、Ozgur Kara、Junho Kim 和 James M. Rehg,机构为 University of Illinois Urbana-Champaign。本笔记依据会议 PDF 正文;缓存未提供可确认的本论文 arXiv 或代码地址,因此不补猜链接。
一句话总结¶
ArcDeck 先用篇章关系树保留论证依赖,再以全局承诺约束多智能体修订大纲,最后生成可编辑幻灯片;在 ArcBench 上,GPT-4o 生成、GPT-5 评审时的叙事流评分为 43.25,高于 SlideGen 的 30.75,但尚未达到作者制作幻灯片的整体质量。
研究背景与动机¶
把论文变成报告并不是逐节压缩文字。论文允许读者回看定义、图表和前文,而听众只能沿幻灯片顺序接收信息;如果先展示方法,再补任务背景,即使每一页都准确,也会增加理解负担。直接让大语言模型一次生成 HTML 容易得到表面摘要,逐节生成则容易丢失跨页依赖,排版优化无法修复这些叙事错误。
已有 PPTAgent、Paper2Poster 和 SlideGen 等系统分别通过编辑模板、视觉反馈或多智能体协作改善生成质量,但“先生成一个全篇大纲”本身仍是困难的规划问题。章节标题只告诉系统内容属于哪里,不解释某段是在提供背景、支持一个主张,还是与另一段并列。ArcDeck 因此将结构信息显式化:局部关系由篇章树表达,面向听众与时长的全局取舍由独立文档表达,之后才审查大纲是否成立。
核心 idea:在布局生成之前,先把“哪些内容必须一起解释”和“整场报告要让听众记住什么”变成持续可用的约束,再通过批评、裁决和修订把这些约束落实到逐页叙事。
方法详解¶
整体框架¶
输入包括论文 PDF,以及目标听众和报告时长。Docling 与 Marker 将正文转成 Markdown,并排除参考文献表和附录;图表被提取到包含说明文字与尺寸信息的素材字典,正文引用另外建立短引用到编号参考文献的映射。
结构化正文分别送入篇章解析器与全局承诺构建器,两者共同指导叙事修订闭环。输出的大纲仍然是 JSON,不是排好的页面;随后才进行幻灯片构建与美化,最终由 python-pptx 渲染为可编辑的 .pptx。论文图 2 的七个智能体按职责组织,贡献可归纳为以下四项。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["PDF、听众与时长"] --> Prep["正文、图表与引用"]
Prep --> Parser["篇章解析器"]
Prep --> Commit["全局承诺构建器"]
Parser --> Loop["叙事修订闭环"]
Commit --> Loop
Loop --> Render["幻灯片构建与美化"]
Prep --> Render
Commit --> Render
Render --> Output["可编辑幻灯片"]
关键设计¶
1. 篇章解析器:让内容分组服从论证关系
解析器借鉴修辞结构理论(Rhetorical Structure Theory,RST),在每个章节内把段落当作基本篇章单元(EDU),构建二叉树。它不是对句子单独打重要性分数,而是给相邻单元赋予关系,再递归组合成更大的语义跨度。靠近树根的关系覆盖更大范围,靠近叶子的关系描述更细的解释顺序;输出序列化为 JSON,供规划器读取。
论文表 1 将关系分成两类:核心与卫星关系用于表达主张和支持信息,包括 Elaboration、Explanation、Context、Purpose、Evaluation、Organization;多核心关系则包含表示同级并列的 Joint,以及把跨边界但属于同一语义单元的内容连接起来的 Same-unit。区分两类关系很重要:实验细节可能支持某个方法主张,不能像两个平行贡献那样独立排列。
因此,树提供的是“如何组合与排序”的依据,而不是一棵逐节点照搬成幻灯片的目录。规划器仍要决定哪些段落放在同一页,并记录分组理由。正文描述的是逐章节构建树,再由全局规划衔接章节,不能误读成已经训练出一个覆盖全文全部修辞关系的专用解析模型。
2. 全局承诺构建器:给各页共享的报告目标
局部解释关系正确,不代表整场报告的取舍正确。构建器读取 Markdown、目标听众和报告时长,产生一份全局承诺(Global Commitment),包含论文快照、核心内容、报告约定、叙事主线和轻量章节计划。核心内容明确中心论点与关键信息;报告约定规定听众先验、报告目标、篇幅和表达要求;章节计划则给出各部分的用途与优先级。
这份文档相当于规划和审稿时共同参照的规格,而不是另一个摘要。它既传给修订闭环,也用于后续幻灯片构建,使生成单页时仍能看到整场报告的目标。图 4 的示例针对研究人员、20 分钟报告,给出 12–16 页的目标,并列出必须包含和必须避免的内容;这是示例配置,不是全部实验固定的时长或页数。
篇章树与全局承诺解决不同问题:前者保留原文的支撑关系,后者决定哪些关系值得在有限时间里展开。删除后者时,即使内容都取自论文,也可能出现“提出方法、再讲已有方法、最后补任务挑战”的倒置,论文图 8 正是用这样的顺序差异说明其作用。
3. 叙事修订闭环:把提出问题与决定修改分开
规划器先根据篇章树与全局承诺,按修辞关系对段落分组,生成包含标题、内容段落和分组理由的 JSON 大纲。批评者随后结合全局承诺检查五类问题:目标对齐、全局叙事流、章节平衡、单页连贯性,以及重复或遗漏。审查发生在内容规划层,因此能发现“某个概念尚未介绍”这类单页排版看不出来的问题。
批评意见不会直接被无条件执行。裁决者判断大纲是否已可用,给出理由,把必须修复的问题标为高、中、低严重程度,并向修订者提供可执行建议。修订者结合反馈更新大纲,再回到评审环节;当裁决者认可,或已完成最多 3 轮修订时停止。后一个条件只是预算上限,并不保证每个问题都已解决。
把批评与裁决分开,使系统具有明确的修改入口和停止规则,而不是让生成器不断自由重写。这里的优化对象是页与页之间的概念递进和覆盖范围;最后的视觉美化不能替代这一步,也不应被当作同一个反馈回路。
4. 幻灯片构建与美化:让已确定的论证落到图文页面
构建器结合大纲、素材字典和全局承诺,先用图表说明文字匹配视觉素材,再依据文本量、素材数量、尺寸和宽高比从 14 个模板布局中选择。它按信息密度组织项目符号层级或段落叙述,突出关键主题,并记录之后作为脚注加入的短引用;初稿 JSON 包含全局元数据及逐页标题、正文、图表和引用。
美化智能体读取素材匹配信息、大纲和初稿,执行四类相互关联的调整:给缺少视觉依据的页面补匹配图表;充实过疏内容、压缩过密文字或合并利用不足的布局;根据图中最常出现的颜色统一主题色;对关键词加粗。之后由 python-pptx 执行渲染,而不是要求模型直接输出完整二进制文件。
这一阶段并非任意创作插图,而是尽量使用论文现有素材表达已经规划好的叙事。优势是图表来源与引用可以保留,代价是受 PDF 提取质量和模板库限制;叙事正确也不自动保证每个页面布局都最优。
一个完整示例¶
以图 7 展示的相机位姿研究报告为例,期望的递进是“相机位姿预测的挑战、领域背景、稀疏视角位姿估计的挑战、任务介绍、提出的方法”。解析器负责保留背景与方法解释之间的关系,全局承诺确定报告要传达的主张,规划器据此组织页序。
如果草稿重复介绍任务,或先给方法再补必要背景,批评者指出重复与前置知识缺失,裁决者决定哪些问题必须修,修订者才调整页序或合并内容。最后构建器为方法页选择图表与布局,美化器调整密度。这里是对论文定性示例的流程解释,不是带有已报告逐轮分数的实验轨迹。
损失函数 / 训练策略¶
ArcDeck 是基于现有大语言模型和视觉语言模型(VLM)的推理时工作流。论文明确强调其 RST 解析不需要微调,没有提出新的训练损失或梯度优化过程;主要控制量是提示中的结构化约束、智能体分工和最多 3 轮修订。不能把闭环修订称为强化学习训练。
实验关键数据¶
主实验¶
ArcBench 从 2022–2025 年六个 CV/ML 会议的 994 对论文与报告材料中筛选 100 对,用于全部后续实验。入选论文须为 oral,并至少包含 3 幅图和 3 张表;参考幻灯片由作者制作。这个筛选强化了技术内容和视觉素材要求,也意味着它不是随机抽取的学术演示文稿样本。
ArcDeck 和四个基线分别采用 GPT-5、GPT-4o、Qwen3-VL-32B 生成,在相同源论文与评估协议下比较。所有生成页面采用 13.33 × 7.5 英寸画幅和固定主题。评审使用 GPT-5 与 Qwen3-VL,必须与生成骨干区分。
表 2 的问答评估覆盖 Story、Visuals、Hard、Depth 四类,每类列出 25 道选择题;文本类题目只给幻灯片提取文字,Visuals 则给页面图像。第 4.2 节对题数的文字描述略有歧义,此处以表 2 的逐类定义为准。准确率是答对题目的比例;VLM-as-Judge 则按每维 10 项检查表评估文本质量、叙事流、布局和视觉主题,正文报告 1–100 标度。问答和 A/B 评估随机化顺序并重复 11 次,使用均值或多数票汇总。
下表摘录论文表 3,固定为 GPT-4o 生成、GPT-5 闭源评审,避免把不同生成能力或评审偏好混在一起。Hard 与 Depth 是问答准确率(%),NF 与 VL 是评审分。
| 方法 | Hard ↑ | Depth ↑ | 叙事流 NF ↑ | 视觉布局 VL ↑ |
|---|---|---|---|---|
| HTML | 11.84 | 14.16 | 14.00 | 24.00 |
| Paper2Poster | 17.60 | 20.24 | 28.12 | 60.25 |
| PPTAgent | 15.12 | 18.56 | 26.75 | 59.12 |
| SlideGen | 17.84 | 21.36 | 30.75 | 84.75 |
| ArcDeck | 40.08 | 47.20 | 43.25 | 91.00 |
在这个固定条件下,相比 SlideGen,ArcDeck 的 Hard 增加 22.24 个百分点,Depth 增加 25.84 个百分点,NF 增加 12.50 分。它表明结构规划能改善较弱生成骨干的信息组织,但不等于所有骨干下都有同样幅度的提升。
消融实验¶
论文表 5 直接报告如下结果。“完整方法胜率”指 ArcDeck 相对该删减版本的胜率,不是删减版本的胜率。正文未明确交代此表的生成骨干、评审模型及 NF 标度换算,因此保留原值,不能与表 3 的 NF 直接合并比较。
| 配置 | NF ↑ | 完整方法胜率(%) | 对应缺失能力 |
|---|---|---|---|
| 去掉篇章解析器 | 7.50 | 89.1 | 缺少关系驱动的内容分组 |
| 去掉全局承诺 | 7.52 | 94.5 | 缺少统一的报告目标与顺序约束 |
| 去掉叙事修订闭环 | 8.68 | 61.8 | 大纲不再经过迭代审查 |
| ArcDeck | 9.70 | 不适用 | 完整系统 |
两种结构先验的删除影响均大于删除修订闭环;不过单独移除模块只能说明其在当前流水线中的作用,不能据此推出最优的智能体数量或同预算下的唯一最佳设计。
人工评测见论文表 7:25 名本科生或硕博学生从三个研究领域中选择自己最熟悉的领域,对该领域 5 篇 oral 论文的三个系统输出排序。第 1、2、3 名分别计 3、2、1 分,以下是平均排名积分,不是准确率。
| 方法 | 视觉语言/多模态 | 生成模型 | 核心计算机视觉 | 总体 |
|---|---|---|---|---|
| PPTAgent | 1.03 | 1.13 | 1.20 | 1.10 |
| SlideGen | 2.42 | 2.23 | 2.14 | 2.30 |
| ArcDeck | 2.55 | 2.63 | 2.66 | 2.60 |
关键发现¶
- 表 4a 的优势不是无例外:Qwen3 生成、GPT-5 评审时,对 SlideGen 的叙事胜率只有 48.5%;GPT-5 生成、GPT-5 评审时为 50.6%,也只是接近持平。
- 表 4b 中 ArcDeck 对作者幻灯片的六种条件胜率均低于 50%,最高为 48.1%。相对自动系统的进步不能写成超过人类参考。
- 图 9 报告大纲生成使用 128.5K tokens,幻灯片生成使用 83.3K tokens;这是较重的多次调用流程,不能仅凭质量提升推断成本优势。
亮点与洞察¶
- 最值得复用的是两种粒度的约束:篇章关系负责局部解释是否完整,全局承诺负责整体报告是否服务同一个目标。对长报告或课程材料,这比仅追加一个“保持连贯”的提示更可检查。
- 将大纲修订放在视觉布局之前,使错误可以在文本结构层被定位和修改。此时移动一个概念不需要同时重排所有图表,内容规划与页面实现的职责边界清楚。
- 作者幻灯片参照揭示了只做基线排名的盲区。自动系统之间获胜仍可能离可直接交付的演示质量有明显差距。
局限与展望¶
- 作者明确将扩展到其他学科留作未来工作。当前基准集中于 AI 会议、oral 论文和图表丰富的文章,不能外推到医学报告、纯理论论文或非技术商业演示。
- 本笔记的评估判断:VLM 同时参与生成和评审,开放与闭源评审有助于检查偏差,但分数差异仍很大;25 人的人工排序也不是听众知识掌握程度的直接测试。
- 当前正文未提供足够的表 5 评估配置、统计不确定性或等 token 预算基线。补齐这些信息,才能更严格区分结构设计、额外调用次数与模型能力的贡献。
- 篇章树和全局承诺均由模型产生,正文未报告树关系标注正确率。若初始理解错误,后续智能体可能一致地遵循错误约束;可进一步加入段落出处核验和报告事实检查。
- 预处理排除附录,布局限制为 14 个模板,修订最多 3 轮。这些选择限制了细节覆盖和设计自由度;更长或更复杂的报告需要明确展示质量、时延和成本之间的取舍。
相关工作与启发¶
- 与 SlideGen 对比:二者都使用协作式多模态智能体;ArcDeck 的重点不是“首次使用多智能体”,而是在大纲生成前引入 RST 关系和全局承诺,并单独进行叙事修订。表 4a 的接近或低于持平结果也说明差异并非普遍碾压。
- 与 PPTAgent 对比:PPTAgent 强调参考模板编辑,ArcDeck 强调先重建论证关系再落到模板。前者解决页面复用与编辑问题,后者更直接针对技术内容的先后依赖。
- 与 Paper2Poster 对比:论文将其适配为幻灯片基线;它原本面向海报,因此此处比较应理解为特定改造协议下的结果,而不是否定视觉反馈生成本身。
- 与 RST 文本生成研究对比:本文主要展示既有修辞关系建模对演示文稿规划的价值,而非提出新的语言学关系体系。可迁移的问题是如何用显式关系约束长文档生成,而不只是增加智能体角色。
评分¶
- 新颖性: 4/5。将篇章关系、全局报告约定和独立大纲修订结合,贡献集中在叙事规划。
- 实验充分度: 4/5。覆盖三个生成骨干、两类模型评审、消融与人工排序,但成本控制和部分消融配置不足。
- 写作质量: 4/5。模块输入输出较清楚,部分表格标度与文字概括需要读者谨慎核对。
- 价值: 4/5。适合技术演示初稿辅助,并提供了有用的作者参考基准,但不能视为无需人工审校的交付系统。