跳转至

Narrative-Driven Paper-to-Slide Generation via ArcDeck

会议: ECCV2026
论文: ECCV 原文
领域: LLM Agent
关键词: 幻灯片生成、篇章关系树、全局承诺、叙事规划、多智能体协作

作者为 Tarik Can Ozden、Sachidanand VS、Furkan Horoz、Ozgur Kara、Junho Kim 和 James M. Rehg,机构为 University of Illinois Urbana-Champaign。本笔记依据会议 PDF 正文;缓存未提供可确认的本论文 arXiv 或代码地址,因此不补猜链接。

一句话总结

ArcDeck 先用篇章关系树保留论证依赖,再以全局承诺约束多智能体修订大纲,最后生成可编辑幻灯片;在 ArcBench 上,GPT-4o 生成、GPT-5 评审时的叙事流评分为 43.25,高于 SlideGen 的 30.75,但尚未达到作者制作幻灯片的整体质量。

研究背景与动机

把论文变成报告并不是逐节压缩文字。论文允许读者回看定义、图表和前文,而听众只能沿幻灯片顺序接收信息;如果先展示方法,再补任务背景,即使每一页都准确,也会增加理解负担。直接让大语言模型一次生成 HTML 容易得到表面摘要,逐节生成则容易丢失跨页依赖,排版优化无法修复这些叙事错误。

已有 PPTAgent、Paper2Poster 和 SlideGen 等系统分别通过编辑模板、视觉反馈或多智能体协作改善生成质量,但“先生成一个全篇大纲”本身仍是困难的规划问题。章节标题只告诉系统内容属于哪里,不解释某段是在提供背景、支持一个主张,还是与另一段并列。ArcDeck 因此将结构信息显式化:局部关系由篇章树表达,面向听众与时长的全局取舍由独立文档表达,之后才审查大纲是否成立。

核心 idea:在布局生成之前,先把“哪些内容必须一起解释”和“整场报告要让听众记住什么”变成持续可用的约束,再通过批评、裁决和修订把这些约束落实到逐页叙事。

方法详解

整体框架

输入包括论文 PDF,以及目标听众和报告时长。Docling 与 Marker 将正文转成 Markdown,并排除参考文献表和附录;图表被提取到包含说明文字与尺寸信息的素材字典,正文引用另外建立短引用到编号参考文献的映射。

结构化正文分别送入篇章解析器与全局承诺构建器,两者共同指导叙事修订闭环。输出的大纲仍然是 JSON,不是排好的页面;随后才进行幻灯片构建与美化,最终由 python-pptx 渲染为可编辑的 .pptx。论文图 2 的七个智能体按职责组织,贡献可归纳为以下四项。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        Input["PDF、听众与时长"] --> Prep["正文、图表与引用"]
        Prep --> Parser["篇章解析器"]
        Prep --> Commit["全局承诺构建器"]
        Parser --> Loop["叙事修订闭环"]
        Commit --> Loop
        Loop --> Render["幻灯片构建与美化"]
        Prep --> Render
        Commit --> Render
        Render --> Output["可编辑幻灯片"]

关键设计

1. 篇章解析器:让内容分组服从论证关系

解析器借鉴修辞结构理论(Rhetorical Structure Theory,RST),在每个章节内把段落当作基本篇章单元(EDU),构建二叉树。它不是对句子单独打重要性分数,而是给相邻单元赋予关系,再递归组合成更大的语义跨度。靠近树根的关系覆盖更大范围,靠近叶子的关系描述更细的解释顺序;输出序列化为 JSON,供规划器读取。

论文表 1 将关系分成两类:核心与卫星关系用于表达主张和支持信息,包括 Elaboration、Explanation、Context、Purpose、Evaluation、Organization;多核心关系则包含表示同级并列的 Joint,以及把跨边界但属于同一语义单元的内容连接起来的 Same-unit。区分两类关系很重要:实验细节可能支持某个方法主张,不能像两个平行贡献那样独立排列。

因此,树提供的是“如何组合与排序”的依据,而不是一棵逐节点照搬成幻灯片的目录。规划器仍要决定哪些段落放在同一页,并记录分组理由。正文描述的是逐章节构建树,再由全局规划衔接章节,不能误读成已经训练出一个覆盖全文全部修辞关系的专用解析模型。

2. 全局承诺构建器:给各页共享的报告目标

局部解释关系正确,不代表整场报告的取舍正确。构建器读取 Markdown、目标听众和报告时长,产生一份全局承诺(Global Commitment),包含论文快照、核心内容、报告约定、叙事主线和轻量章节计划。核心内容明确中心论点与关键信息;报告约定规定听众先验、报告目标、篇幅和表达要求;章节计划则给出各部分的用途与优先级。

这份文档相当于规划和审稿时共同参照的规格,而不是另一个摘要。它既传给修订闭环,也用于后续幻灯片构建,使生成单页时仍能看到整场报告的目标。图 4 的示例针对研究人员、20 分钟报告,给出 12–16 页的目标,并列出必须包含和必须避免的内容;这是示例配置,不是全部实验固定的时长或页数。

篇章树与全局承诺解决不同问题:前者保留原文的支撑关系,后者决定哪些关系值得在有限时间里展开。删除后者时,即使内容都取自论文,也可能出现“提出方法、再讲已有方法、最后补任务挑战”的倒置,论文图 8 正是用这样的顺序差异说明其作用。

3. 叙事修订闭环:把提出问题与决定修改分开

规划器先根据篇章树与全局承诺,按修辞关系对段落分组,生成包含标题、内容段落和分组理由的 JSON 大纲。批评者随后结合全局承诺检查五类问题:目标对齐、全局叙事流、章节平衡、单页连贯性,以及重复或遗漏。审查发生在内容规划层,因此能发现“某个概念尚未介绍”这类单页排版看不出来的问题。

批评意见不会直接被无条件执行。裁决者判断大纲是否已可用,给出理由,把必须修复的问题标为高、中、低严重程度,并向修订者提供可执行建议。修订者结合反馈更新大纲,再回到评审环节;当裁决者认可,或已完成最多 3 轮修订时停止。后一个条件只是预算上限,并不保证每个问题都已解决。

把批评与裁决分开,使系统具有明确的修改入口和停止规则,而不是让生成器不断自由重写。这里的优化对象是页与页之间的概念递进和覆盖范围;最后的视觉美化不能替代这一步,也不应被当作同一个反馈回路。

4. 幻灯片构建与美化:让已确定的论证落到图文页面

构建器结合大纲、素材字典和全局承诺,先用图表说明文字匹配视觉素材,再依据文本量、素材数量、尺寸和宽高比从 14 个模板布局中选择。它按信息密度组织项目符号层级或段落叙述,突出关键主题,并记录之后作为脚注加入的短引用;初稿 JSON 包含全局元数据及逐页标题、正文、图表和引用。

美化智能体读取素材匹配信息、大纲和初稿,执行四类相互关联的调整:给缺少视觉依据的页面补匹配图表;充实过疏内容、压缩过密文字或合并利用不足的布局;根据图中最常出现的颜色统一主题色;对关键词加粗。之后由 python-pptx 执行渲染,而不是要求模型直接输出完整二进制文件。

这一阶段并非任意创作插图,而是尽量使用论文现有素材表达已经规划好的叙事。优势是图表来源与引用可以保留,代价是受 PDF 提取质量和模板库限制;叙事正确也不自动保证每个页面布局都最优。

一个完整示例

以图 7 展示的相机位姿研究报告为例,期望的递进是“相机位姿预测的挑战、领域背景、稀疏视角位姿估计的挑战、任务介绍、提出的方法”。解析器负责保留背景与方法解释之间的关系,全局承诺确定报告要传达的主张,规划器据此组织页序。

如果草稿重复介绍任务,或先给方法再补必要背景,批评者指出重复与前置知识缺失,裁决者决定哪些问题必须修,修订者才调整页序或合并内容。最后构建器为方法页选择图表与布局,美化器调整密度。这里是对论文定性示例的流程解释,不是带有已报告逐轮分数的实验轨迹。

损失函数 / 训练策略

ArcDeck 是基于现有大语言模型和视觉语言模型(VLM)的推理时工作流。论文明确强调其 RST 解析不需要微调,没有提出新的训练损失或梯度优化过程;主要控制量是提示中的结构化约束、智能体分工和最多 3 轮修订。不能把闭环修订称为强化学习训练。

实验关键数据

主实验

ArcBench 从 2022–2025 年六个 CV/ML 会议的 994 对论文与报告材料中筛选 100 对,用于全部后续实验。入选论文须为 oral,并至少包含 3 幅图和 3 张表;参考幻灯片由作者制作。这个筛选强化了技术内容和视觉素材要求,也意味着它不是随机抽取的学术演示文稿样本。

ArcDeck 和四个基线分别采用 GPT-5、GPT-4o、Qwen3-VL-32B 生成,在相同源论文与评估协议下比较。所有生成页面采用 13.33 × 7.5 英寸画幅和固定主题。评审使用 GPT-5 与 Qwen3-VL,必须与生成骨干区分。

表 2 的问答评估覆盖 Story、Visuals、Hard、Depth 四类,每类列出 25 道选择题;文本类题目只给幻灯片提取文字,Visuals 则给页面图像。第 4.2 节对题数的文字描述略有歧义,此处以表 2 的逐类定义为准。准确率是答对题目的比例;VLM-as-Judge 则按每维 10 项检查表评估文本质量、叙事流、布局和视觉主题,正文报告 1–100 标度。问答和 A/B 评估随机化顺序并重复 11 次,使用均值或多数票汇总。

下表摘录论文表 3,固定为 GPT-4o 生成、GPT-5 闭源评审,避免把不同生成能力或评审偏好混在一起。Hard 与 Depth 是问答准确率(%),NF 与 VL 是评审分。

方法 Hard ↑ Depth ↑ 叙事流 NF ↑ 视觉布局 VL ↑
HTML 11.84 14.16 14.00 24.00
Paper2Poster 17.60 20.24 28.12 60.25
PPTAgent 15.12 18.56 26.75 59.12
SlideGen 17.84 21.36 30.75 84.75
ArcDeck 40.08 47.20 43.25 91.00

在这个固定条件下,相比 SlideGen,ArcDeck 的 Hard 增加 22.24 个百分点,Depth 增加 25.84 个百分点,NF 增加 12.50 分。它表明结构规划能改善较弱生成骨干的信息组织,但不等于所有骨干下都有同样幅度的提升。

消融实验

论文表 5 直接报告如下结果。“完整方法胜率”指 ArcDeck 相对该删减版本的胜率,不是删减版本的胜率。正文未明确交代此表的生成骨干、评审模型及 NF 标度换算,因此保留原值,不能与表 3 的 NF 直接合并比较。

配置 NF ↑ 完整方法胜率(%) 对应缺失能力
去掉篇章解析器 7.50 89.1 缺少关系驱动的内容分组
去掉全局承诺 7.52 94.5 缺少统一的报告目标与顺序约束
去掉叙事修订闭环 8.68 61.8 大纲不再经过迭代审查
ArcDeck 9.70 不适用 完整系统

两种结构先验的删除影响均大于删除修订闭环;不过单独移除模块只能说明其在当前流水线中的作用,不能据此推出最优的智能体数量或同预算下的唯一最佳设计。

人工评测见论文表 7:25 名本科生或硕博学生从三个研究领域中选择自己最熟悉的领域,对该领域 5 篇 oral 论文的三个系统输出排序。第 1、2、3 名分别计 3、2、1 分,以下是平均排名积分,不是准确率。

方法 视觉语言/多模态 生成模型 核心计算机视觉 总体
PPTAgent 1.03 1.13 1.20 1.10
SlideGen 2.42 2.23 2.14 2.30
ArcDeck 2.55 2.63 2.66 2.60

关键发现

  • 表 4a 的优势不是无例外:Qwen3 生成、GPT-5 评审时,对 SlideGen 的叙事胜率只有 48.5%;GPT-5 生成、GPT-5 评审时为 50.6%,也只是接近持平。
  • 表 4b 中 ArcDeck 对作者幻灯片的六种条件胜率均低于 50%,最高为 48.1%。相对自动系统的进步不能写成超过人类参考。
  • 图 9 报告大纲生成使用 128.5K tokens,幻灯片生成使用 83.3K tokens;这是较重的多次调用流程,不能仅凭质量提升推断成本优势。

亮点与洞察

  • 最值得复用的是两种粒度的约束:篇章关系负责局部解释是否完整,全局承诺负责整体报告是否服务同一个目标。对长报告或课程材料,这比仅追加一个“保持连贯”的提示更可检查。
  • 将大纲修订放在视觉布局之前,使错误可以在文本结构层被定位和修改。此时移动一个概念不需要同时重排所有图表,内容规划与页面实现的职责边界清楚。
  • 作者幻灯片参照揭示了只做基线排名的盲区。自动系统之间获胜仍可能离可直接交付的演示质量有明显差距。

局限与展望

  • 作者明确将扩展到其他学科留作未来工作。当前基准集中于 AI 会议、oral 论文和图表丰富的文章,不能外推到医学报告、纯理论论文或非技术商业演示。
  • 本笔记的评估判断:VLM 同时参与生成和评审,开放与闭源评审有助于检查偏差,但分数差异仍很大;25 人的人工排序也不是听众知识掌握程度的直接测试。
  • 当前正文未提供足够的表 5 评估配置、统计不确定性或等 token 预算基线。补齐这些信息,才能更严格区分结构设计、额外调用次数与模型能力的贡献。
  • 篇章树和全局承诺均由模型产生,正文未报告树关系标注正确率。若初始理解错误,后续智能体可能一致地遵循错误约束;可进一步加入段落出处核验和报告事实检查。
  • 预处理排除附录,布局限制为 14 个模板,修订最多 3 轮。这些选择限制了细节覆盖和设计自由度;更长或更复杂的报告需要明确展示质量、时延和成本之间的取舍。

相关工作与启发

  • 与 SlideGen 对比:二者都使用协作式多模态智能体;ArcDeck 的重点不是“首次使用多智能体”,而是在大纲生成前引入 RST 关系和全局承诺,并单独进行叙事修订。表 4a 的接近或低于持平结果也说明差异并非普遍碾压。
  • 与 PPTAgent 对比:PPTAgent 强调参考模板编辑,ArcDeck 强调先重建论证关系再落到模板。前者解决页面复用与编辑问题,后者更直接针对技术内容的先后依赖。
  • 与 Paper2Poster 对比:论文将其适配为幻灯片基线;它原本面向海报,因此此处比较应理解为特定改造协议下的结果,而不是否定视觉反馈生成本身。
  • 与 RST 文本生成研究对比:本文主要展示既有修辞关系建模对演示文稿规划的价值,而非提出新的语言学关系体系。可迁移的问题是如何用显式关系约束长文档生成,而不只是增加智能体角色。

评分

  • 新颖性: 4/5。将篇章关系、全局报告约定和独立大纲修订结合,贡献集中在叙事规划。
  • 实验充分度: 4/5。覆盖三个生成骨干、两类模型评审、消融与人工排序,但成本控制和部分消融配置不足。
  • 写作质量: 4/5。模块输入输出较清楚,部分表格标度与文字概括需要读者谨慎核对。
  • 价值: 4/5。适合技术演示初稿辅助,并提供了有用的作者参考基准,但不能视为无需人工审校的交付系统。