VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection¶
会议: ECCV2026
论文: ECCV 原文
PDF: 论文全文
项目: VDC-Agent
领域: 视频理解 / 多模态推理
关键词: 视频详细描述、自反思、提示词优化、偏好数据、课程 DPO
一句话总结¶
VDC-Agent 让同一个多模态模型生成、评价并反思视频描述,再用轨迹偏好对进行由易到难的 DPO,将多轮改进转化为单次生成能力,在 VDC 上达到 49.08% 平均准确率,在 DREAM-1K 上达到 37.4% F1。
研究背景与动机¶
视频详细描述不仅要认出“有人在照料植物”,还要说明人物如何协作、物体如何排列、动作如何发展,以及镜头怎样移动。 通用视觉语言模型(VLM)已经能写出通顺的摘要,但流畅性并不保证细节覆盖与视觉证据一致。 一段描述可能遗漏托盘布局,也可能凭常识把不能辨认品种的植物说成番茄。 已有方法因此通过高质量描述数据来微调模型,例如 Cockatiel 使用人工反馈,ShareGPT4Video 和 AVC-DPO 等借助更强模型提供监督。 这种路线可以提升细粒度表达,却把扩展数据规模的成本转移给人工标注或外部教师。
本文关注的矛盾是:模型可能已经具备发现部分遗漏的能力,却没有在一次直接生成中充分调用这种能力。 如果让同一个模型换成评价者角色,依据视频和明确准则指出缺失内容,再据此修改生成提示词,就可能得到更好的候选描述。 但这种自我改进并非单调过程,要求更多细节也可能诱发猜测,或者使模型偏离原本正确的重点。 因此,仅重复“再写详细一点”不足以构成可靠的优化机制,还需要识别一次提示词修改何时带来了退步。
另一方面,即便反复评估与修订有效,也不能忽略上线后的时间成本。 论文把在线反思看作生成训练数据的手段,而不是最终模型每次服务用户时必须重复的流程。 它保留同一视频上好坏描述之间的对比,再把这种相对偏好写入模型参数。 核心 idea:用原则引导的自评与失败反思生成有质量分差的偏好对,再按分差由大到小训练,让一次描述生成获得多轮修订带来的收益。
方法详解¶
整体框架¶
输入是未配描述标注的视频、初始任务提示词和一组文字化的质量原则;输出分为离线的偏好数据集与训练后的详细描述器。 离线流程依次经过“原则引导自评”“退步触发反思”“轨迹偏好构建”“课程偏好内化”四个设计。 同一个多模态大语言模型(MLLM)通过不同指令承担生成者、评价者和提示词修订者,角色不同不意味着引入了三个独立教师模型。 候选描述、质量分数、修改建议,以及上一轮修订的推理记录,是连接这些角色的中间状态。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["视频与初始提示词"] --> Evaluate["原则引导自评"]
Evaluate --> Reflect["退步触发反思"]
Reflect -->|更新提示词,未终止| Evaluate
Reflect -->|保留完整轨迹| Pairs["轨迹偏好构建"]
Pairs --> Train["课程偏好内化"]
Train --> Model["训练后的描述器"]
Test["新视频与任务提示词"] --> Model
Model --> Output["单次生成描述"]
图中的循环属于离线数据生成;新视频在部署时直接交给训练后的描述器,不必经过评分与反思循环。 这里的“单次”指一次自回归描述生成调用,并非整段文本只用一个 token 前向计算。 论文也单独测试了测试时反思版本,但它与最终 VDC-Agent-7B 的部署路径不同。
关键设计¶
1. 原则引导自评:把笼统的详细要求变成可执行反馈
初始提示词先让模型对视频生成一份候选描述。 随后,评价角色同时读取视频、该描述和质量原则,而不是只凭文字是否通顺打分。 这些原则涵盖镜头运动、背景、主要物体等内容,作用是告诉模型当前任务究竟应检查什么。 评价结果包含一个 0 到 100 的质量分数,以及指导下一轮提示词修改的自然语言建议。 分数用于决定是否停止或是否发生退步,建议则提供可操作的修改方向,例如补充空间关系或突出主要物体。 这两个输出不可互换:一个总分能排序,却不能直接说明下一次生成应关注哪里。
评价者与生成者共享模型骨干,因此数据生成不依赖更大的外部评分模型。 这不意味着没有人为知识输入,初始提示词和文字原则仍由人指定。 更准确的表述是:该数据构建流程不需要逐视频人工描述标注,也不需要强教师生成偏好标签。 正文只举出原则的内容类别,完整原则与系统提示词被安排在附录;当前提供的全文缓存没有该附录。 因此无法从本材料逐字复原实际评价提示词,也不能假定分数已被校准成真实正确概率。
2. 退步触发反思:追查错误的提示词修改,而非盲目继续扩写
若当前评分达到阈值,循环立即停止;默认阈值为 90。 未达阈值但评分不低于上一轮时,提示词修订者直接利用当前建议生成下一轮提示词。 只有评分下降时,系统才进入额外的自反思分支,检查上一轮修订为什么有害。 它不仅看当前提示词与描述,还读取上一轮提示词、描述及提示词修订者留下的思维链(CoT)。 这样可以把失败追溯到一次具体的修改决定,而不是只收到“结果不够好”的模糊信号。 下一轮使用反思后修订的提示词重新读取同一视频生成描述,并不是仅对旧描述做文字润色。
这一设计的重要边界是:反思由自评分数的相对变化触发,不由外部正确答案触发。 如果评分模型没有识别出某种幻觉,循环仍可能接受错误的修改方向。 系统因此不是正确性的形式化验证器,而是利用同一模型不同任务指令之间的能力差异来寻找更好的输出。 正文把最大迭代参数设为 \(T=4\),但步骤索引写成从 0 到 \(T\);缺少附录伪代码时,不把它擅自换算成确定的模型调用总次数。 到达阈值或迭代上限后,所有候选及分数都会留下,而不是只保存最终一句描述。
3. 轨迹偏好构建:从同一视频的成功与失败中提取训练信号
数据源是 Cockatiel-4K 的 4,008 段高分辨率视频,论文只使用视频,不使用它提供的描述。 每段视频分别运行 camera、short、background、main object、detailed 五种任务,对应镜头、摘要、背景、主要物体和详细事件。 不同维度让模型练习互补能力,避免所有偏好对都只表达“越长越好”这一种倾向。 由此得到 20,040 组原始轨迹,每组对应一个视频和一个任务维度,而不是一个独立视频。 其中 1,078 组第一步就达到阈值,没有可供比较的修订过程,因此被剔除。 另有 76 组因 JSON 格式或解析错误被删除,最终保留 18,886 组,也就是 VDC-Agent-19K。
对每组保留轨迹,选自评分数最高的描述作偏好项,最低的描述作非偏好项。 最高分候选不必是最后一轮,最低分候选也不必是第一轮,这一点使反思中间出现的失败同样有训练价值。 两者的质量分差定义为:
这里 \(s^{+}\) 与 \(s^{-}\) 分别是最高分和最低分;分差既记录相对偏好强度,也为后续课程提供排序依据。 这不是人工认证的优劣标签,偏好质量需要另行验证,论文因此补充了盲评实验。 正文没有充分说明同分候选的处理方式,不能据此断言所有保留样本的分差都严格为正。
4. 课程偏好内化:先学明显优劣,再学细微差别
训练采用直接偏好优化(DPO),让当前模型相对参考模型更倾向于偏好描述,而非非偏好描述。 它直接利用成对文本的相对概率,不另外训练奖励模型,也不运行在线强化学习采样循环。 与普通随机 DPO 相比,本文只改变样本顺序:按分差从大到小排序,再依次组成小批次。 大分差被当作容易区分的偏好,优先用于建立较粗的正确行为;小分差后出现,用于调整更细的描述差异。 “难度”在这里是模型自评派生的代理量,而不是人工标注难度或视频本身的复杂度。
分差没有作为新的损失权重乘到每个样本上,也没有引入新的奖励函数。 这一点使贡献集中于数据构建和训练调度,而不是 DPO 目标的数学改写。 作者还将课程与余弦学习率衰减配合,让较明确的早期偏好获得较大更新步长,后期模糊偏好获得较小步长。 当前缓存的 DPO 公式排版损坏,笔记只保留文字可确认的机制,不将猜补公式冒充原文。 其结果应理解为偏好行为的参数内化,而不是已经证明模型在内部复现了同样的显式反思思维链。
一个完整示例¶
以论文图 4 的温室视频作为任务背景:描述需要覆盖人员协作、测量行为和托盘布局,同时避免无依据地指定植物品种。 图 4 是最终模型对比,并未展示完整反思轨迹;以下只演示方法如何处理这类输入,不是论文记录的逐轮日志。 初始描述若遗漏托盘布局,评价角色可以提出补充空间组织的建议,修订者据此让下一轮提示词关注可见的摆放关系。 若修改后又引入不可靠的品种推断,并使自评分数下降,反思者会结合上轮修改理由追查这一偏差。 轨迹结束后,从实际评分中选出最好与最差的描述形成一个偏好对,不为示例虚构分数或保证一定纠错成功。 上线时,新模型直接生成描述,不会为这段温室视频重新执行上述数据构建步骤。
损失函数 / 训练策略¶
基座为 Qwen2.5-VL-7B-Instruct,只对 LLM 骨干使用 LoRA,其余参数冻结。 LoRA rank 为 16,alpha 为 32,dropout 为 0.1;训练 3 个 epoch,全局 batch size 为 16。 初始学习率为 \(5\times10^{-5}\),预热占总步数 10%,随后使用余弦衰减,训练设备为 4 张 NVIDIA A800。 最多采样 32 帧,每帧最多 128 个视觉 token;解码 beam size 为 1、temperature 为 0.1,最大描述长度设为 1024。 这些是正文明确给出的配置;DPO 的具体 beta 数值、跨 epoch 重排细节和完整提示词未在所提供正文中说明。
实验关键数据¶
主实验¶
VDC 含 1,027 段视频,按照 AuroraCap 的 VDCscore 报告五维度 Accuracy/Score 及平均值;平均准确率不是训练时的 0 到 100 自评分。 DREAM-1K 含 1,000 段视频,报告事件级 Precision、Recall 和 F1:分别关注生成事件的正确比例、参考事件覆盖比例及两者的调和关系。 下表摘录原文表 1(第 9 页)与表 2(第 10 页),使用各自基准原有评测设置,数值越高越好。
| 模型 | VDC 平均 Acc. (%) | VDC 平均 Score | DREAM F1 (%) | Precision (%) | Recall (%) |
|---|---|---|---|---|---|
| Qwen2.5-VL-7B | 43.95 | 2.23 | 30.1 | 30.5 | 29.7 |
| OwlCap-7B | 46.90 | 2.40 | 34.7 | 34.1 | 35.3 |
| VDC-Agent-7B | 49.08 | 2.50 | 37.4 | 38.5 | 36.3 |
相对同一 Qwen 基座,VDC 平均准确率增加 5.13 个百分点,DREAM F1 增加 7.3 个百分点;这是绝对差值,不是相对百分比增长。 表 1 的 AVC-DPO-7B 为 47.70%/2.47,本文高出 1.38 个百分点和 0.03 分,但不代表每个子维度都领先。
消融实验¶
原文表 4(第 12 页)比较同一 Qwen 基座的原则提示、测试时反思与训练后内化;时间单位为秒,数值依赖论文计时设置。
| 配置 | VDC 平均 Acc. (%) | VDC 平均 Score | 推理时间 (s) |
|---|---|---|---|
| Baseline | 43.95 | 2.23 | 15.5 |
| Baseline + Principle | 46.47 | 2.35 | 22.3 |
| Baseline + Principle + Reflection | 47.10 | 2.38 | 164.9 |
| VDC-Agent | 49.08 | 2.50 | 15.5 |
原文表 5(第 12 页)在 VDC 上比较训练策略;随机 DPO 打乱数据,反课程 DPO 按分差升序,课程 DPO 按分差降序。
| 训练策略 | VDC 平均 Acc. (%) | VDC 平均 Score |
|---|---|---|
| SFT | 47.54 | 2.41 |
| Random DPO | 48.03 | 2.42 |
| Anti-Curriculum DPO | 47.65 | 2.40 |
| Curriculum DPO | 49.08 | 2.50 |
关键发现¶
- 内化模型比测试时反思高 1.98 个准确率百分点,并把表内时间从 164.9 s 降至 15.5 s;不能把这一结果写成离线数据生成也没有成本。
- 课程 DPO 比随机 DPO 高 1.05 个准确率百分点;它支持当前实验中的排序收益,不证明任意自评分差都能可靠衡量难度。
- 表 7(第 13 页)给出默认 \(T=4\) 的数据构建时间:单样本 70.7 s,整套数据在 8 张 A800 上为 49.2 h。
- 同表把 \(T\) 增至 6 时,VDC 准确率为 49.55%,但 DREAM F1 降至 36.8%;更多反思并不使所有指标单调改善。
亮点与洞察¶
- 失败轨迹不是只能丢弃的数据。把同一视频上的最佳与最差描述配对,可以让错误修订本身成为偏好学习信号。
- 分数兼任停止依据、退步检测信号和课程依据。这个复用降低了流程复杂度,也使自评可靠性成为整个系统共同的依赖。
- 数据生成与部署解耦是实用价值所在。可以在离线阶段花费更多计算探索描述,再保持线上一次生成的接口。
局限与展望¶
- 自评仍可能强化模型共有盲点。表 3(第 11 页)的 500 对盲评中,三位人工评价者偏好高分描述的比例为 75.8%、69.0%、67.6%,支持总体有效但不是无噪声标签。
- 同表 GPT-5.1 在两种输入顺序下的偏好率为 84.4% 与 95.2%。作者认为结论对顺序稳健,但这 10.8 个百分点的差异表明位置偏差并未消失。
- 图 3 的长度分布重叠不能单独排除长度偏差。更严格的长度匹配评测与独立视觉核验属于读者建议,而非本文已完成实验。
- 所提供缓存止于参考文献,缺少附录,部分公式抽取损坏;完整提示词、反思触发率及若干复现细节仍需原始补充材料确认。
- 作者计划扩展到更大骨干和视频问答;现有描述基准结果尚不能直接证明通用视频推理能力全面提升。
相关工作与启发¶
- 与 Cockatiel 对比:本文复用其视频资源,但不使用描述标注,区别在于训练监督由同一模型的自评轨迹产生,并非独立构建了全新视频库。
- 与 AVC-DPO、VideoCap-R1 对比:它们使用强教师或奖励提供者,本文去掉这部分数据生成依赖;不应据此说预训练模型从未接受外部监督。
- 与 Best-of-N 对比:表 8(第 14 页)中,12 次候选的 BoN 为 45.12%/2.30、186.0 s,测试时反思为 47.10%/2.38、164.9 s,支持定向修订比这一配置的无方向采样更有效。
- 可迁移启发:对视频问答可尝试保留回答修订中的正负轨迹,但必须重新设计可核验的回答质量准则,不能照搬描述的“细节更多”偏好。
评分¶
- 新颖性: 4/5。将退步触发的提示词反思、轨迹偏好与课程排序连成完整流程,DPO 本身不是新目标。
- 实验充分度: 4/5。两套基准、多骨干、人工偏好和课程消融较完整,仍缺更严格的独立错误核验。
- 写作质量: 4/5。主流程与表格清晰,但可用正文没有覆盖所有实现细节,抽取公式不宜直接复用。
- 价值: 4/5。给出了用离线自改进降低线上反思成本的具体方案,适合详细视频描述的数据与模型迭代。