DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning¶
会议: ECCV2026
论文: ECCV 原文
领域: 音频/语音;多模态 VLM
关键词: 欺骗检测、结构化报告、多文化数据、特征校准、模态一致性蒸馏
一句话总结¶
DecepGPT 用结构化视听报告监督和 SICS、DMC 两个训练组件改进数据集内的欺骗分类,在 DOLOs 达到 73.23% 准确率,但这些结果不构成可靠现实测谎的证据。
研究背景与动机¶
视听欺骗检测通常把一段视频及其声音映射为 truthful 或 deceptive 标签。 早期工作使用表情、姿态、韵律等人工描述,后续模型通过视觉编码器和跨模态融合直接学习分类。 这种任务设定的问题并不只是准确率不足:一个二元输出无法说明模型看到了什么,也无法让复核者定位推断依据。 但把输出改成长解释同样不够,因为大模型可能将并不存在的表情、声音属性或因果关系编成流畅理由。 因此,论文希望让观察线索、跨模态解释和最终标签成为可以分别检查的对象,而不是把文本长度当作可信度。
数据条件进一步放大了这一困难:BoL 和 MU3D 分别只有 325、320 个样本,DOLOs 也仅有 1,675 个样本。 训练可能利用参与者风格、拍摄条件或某一种模态中的相关性,而不学习跨场景稳定的证据。 已有数据分别研究图像叙述、社会评价或故事编造,任务差异和文化差异也容易混在一起。 T4-Deception 于是选择四国同一节目形式中的职业身份冒充,让任务形式相对一致,再观察跨国家版本的迁移。 这里的“文化”是国家节目版本的操作性划分,仍混有语言、制作方式和参与者组成等变化,并非文化因素的因果隔离。
在模型侧,作者以 AffectGPT 为底座,保留预训练视听能力,只适配投影层、语言模型和新增组件。 SICS 对融合特征进行共享先验与样本残差结合的校准,DMC 则要求两个单模态分支学习完整视听判断的分布。 结构化报告负责暴露可检查内容,表示学习和蒸馏负责改善小数据训练,三者处理的不是同一个问题。 即使观察到了停顿或某种表情,它们也只是上下文中的行为描述,不能独立证明说话者撒谎。 核心 idea:把视听线索到分类标签的输出改成可分字段审查的报告,同时用稳定化融合与模态一致性蒸馏改善小样本学习,而不把解释文本本身等同于事实证据。
方法详解¶
整体框架¶
输入为同一片段的视频和音频,输出是字段顺序固定、用分号分隔的单行报告:Video Cues; Audio Cues; Reasoning; Prediction。
训练前,结构化监督与多文化数据提供报告目标和新的评测场景;训练时,冻结编码器提取视听 token,跨注意力产生融合 token,再由 SICS 校准并交给报告生成器。
DMC 从单模态 token 得到辅助预测,以报告最后的 Prediction 位置产生的多模态分布为教师,仅在训练中施加一致性约束。
因此,数据制作阶段的多个助手不是部署时需要逐一调用的代理,推理时也不保留 DMC 辅助分支。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
T["训练标注与四国视频"] --> S["结构化监督与<br/>多文化数据"]
I["输入视频与音频"] --> E["冻结编码器<br/>与跨模态融合"]
E --> F["SICS:稳定化校准"]
F --> R["生成四字段报告<br/>含最终预测分布"]
S -.->|训练报告监督| R
E -.->|单模态 token| D["DMC:模态一致性蒸馏"]
R -.->|训练教师分布| D
关键设计¶
1. 结构化监督与多文化数据:先定义可审查内容,再扩展任务覆盖
报告把视频线索和音频线索分开填写,再要求推理字段整合这些观察,最后给出二元标签。 这种顺序为审阅提供了接口:可以检查线索是否存在、描述属性是否正确,以及结论有没有超出前面观察。 它并不从结构上保证推理正确,也没有证明生成顺序就是模型内部决策的因果顺序。 训练目标是学习经过修订的完整报告文本,而不是仅学习标签,也不是在推理时查询外部事实库。 这一区分很重要:可审查性来自可定位的字段,事实正确性仍须回到原始视频和音频核实。
数据制作时,Qwen-Omni 音频助手提取韵律与言语模式,GPT-4o 视频助手提取面部动态和肢体行为。 另一个 GPT-4o 推理助手整合两种线索;人工标注者修正这些输出中的幻觉和逻辑问题。 随后 GPT-4o 增广助手改写文字以增加措辞变化,过滤流程依次检查线索与推理是否矛盾、格式是否合规、样本是否近重复,最后再人工复核。 图 2 将相似度检查标为 CLIP-similarity,但正文没有给出具体阈值和完整实现,不能补写成已明确的去重算法。 两个标注者经过三轮预标注校准,离散线索与推理审核标签上的 Cohen's \(\kappa\) 为 0.73。 这是标注一致性的结果,不是模型预测正确率,也不意味着被审核的行为线索具有测谎效度。
T4-Deception 从美国、德国、越南和保加利亚版本的 “To Tell the Truth” 节目取材,统一任务为职业身份冒充。 表 1 记录 1,695 个片段、1,695 位参与者,包含 1,130 个 deceptive 和 565 个 truthful 样本。 图 3 的 565 个 identity 指共同声称的身份:每个身份由一个真实参与者和两个冒充者共享,不应误读为只有 565 位参与者。 四国片段数依次为 876、702、66、51,平均片段时长为 3.65 秒,短片段侧重即时互动而非完整叙事。 同一节目形式减轻了不同任务之间的混杂,但表演动机、节目剪辑和短片段选择仍与现实调查差别很大。 作者称其为当时最大的非实验室欺骗检测数据集;这限定于作者的领域比较,不能外推为最大通用真实性判断数据集。
2. SICS:稳定化校准
Stabilized Individuality-Commonality Synergy 首先对跨注意力得到的融合 token 做时间平均,得到片段级上下文。 两层全连接网络及中间的 tanh 从上下文生成样本自适应残差,再从残差预测门控系数。 门控把可学习的全局向量与当前样本残差结合,使所有样本共享的基准和样本特有调整共同决定特征校准。 这里的全局向量是训练得到的参数,不是预先验证的通用欺骗规律;样本残差也不等于已分离出的真实个体心理状态。 这是一种表示层的归纳偏置:数据很少时,不必为每个样本完全独立地学习一套调制规则。
之后,独立参数生成正、负两组调整权重,通过 ReLU 后分别作用于输入特征,并将负支路结果相减。 原文第 7 页明确给出的极性调整形式为:
\(x_i\) 是融合 token,\(w_i^+\)、\(w_i^-\) 是按特征维度生成的调整权重,\(\odot\) 表示逐元素乘法。 随后把调整后的特征与原输入加权结合;作者给出平衡超参数 \(\lambda=0.2\)。 缓存中的式 (2)、式 (3) 有缺失符号,无法逐字确认完整门控混合式与最终残差混合式,因此这里不猜补作者精确公式。 从明确的文字机制看,这不是简单的单支路注意力加权,而是引入共享基准、样本调整和有符号校准。 不过,数值上更平滑的特征并不自动意味着去掉了文化偏差或身份捷径,仍需要独立实验判别。
3. DMC:模态一致性蒸馏
Distilled Modality Consistency 在冻结的视觉与音频 token 后各接模态专用投影器,再使用共享蒸馏头产生 truthful/deceptive 概率分布。 论文将投影器称为 Causal Projector;该命名不代表它完成了因果识别或去混杂。 教师分布来自语言解码器最后的 Prediction 位置,条件是完整的视听上下文及报告格式要求。 训练对每个单模态分布施加从教师到学生方向的 KL 散度约束,使单模态投影层也获得与完整判断相联系的学习信号。 直观上,如果任务只靠视觉分支拟合,音频分支仍须尽可能匹配教师分布,因而不能一直停留在无效表示上。
这不同于对两种模态强行使用相同特征,也不同于随机丢掉一条分支:一致性发生在预测分布层面。 两条辅助分支共享蒸馏头,但各自保留投影器,以容纳视听输入的差异。 教师来自当前模型,并非具有额外真实标签知识的独立专家,因此教师错误也可能被传播。 正文没有充分交代教师分布是否停止梯度、温度设置和标签 token 的具体归一化实现,复现时仍需核对代码。 推理时这些辅助组件被丢弃,保留视听编码、融合、SICS 和报告解码路径。
损失函数 / 训练策略¶
整体目标结合报告 token 级交叉熵与 DMC 一致性蒸馏,作者给出蒸馏权重 \(\alpha=0.1\)。 报告的最后一个字段需要匹配样本真实标签,其余字段学习人工修订的线索与解释文本。 缓存式 (5)、式 (8) 也有排版提取损坏,这里依据正文说明目标,不将猜补的公式冒充原式。 模型使用 AffectGPT 预训练权重,冻结视听编码器,对 LLM 使用 LoRA,全量训练投影器和新增组件。 优化器为 AdamW,学习率 \(5\times10^{-5}\),训练 200 epochs,batch size 为 4。 硬件为一张 NVIDIA H100 80GB,每段视频采样 8 帧,分辨率为 \(224\times224\)。 冻结编码器限制了小样本更新范围,但 LoRA 训练 200 epochs 仍需严格的拆分与选择协议,不能仅凭参数高效推断不易过拟合。
实验关键数据¶
主实验¶
以下摘录原文表 2(第 10 页);Acc. 与 F1 均按表中百分数尺度呈现,越高越好。 BoL、DOLOs 使用官方 3-fold 协议,MU3D 使用 4-fold;F1 的平均方式在所给正文中未明确。 GPT-4o 是视觉输入的零样本评测,其他下列模型使用视听输入;训练条件并不相同。
| 方法与条件 | DOLOs Acc. | DOLOs F1 | BoL Acc. | BoL F1 | MU3D Acc. | MU3D F1 |
|---|---|---|---|---|---|---|
| PECL,全量训练 | 64.75 | 71.20 | 59.51 | 51.06 | 55.31 | 60.07 |
| GPT-4o,零样本、仅视觉 | 66.38 | 64.21 | 57.14 | 56.35 | 54.12 | 52.47 |
| VideoLLaMA2,LoRA | 53.48 | 56.12 | 47.65 | 49.34 | 51.84 | 54.62 |
| DecepGPT,LoRA | 73.23 | 76.13 | 63.46 | 63.72 | 61.25 | 67.22 |
在表 2 的 DOLOs 完整比较中,AFFAKT 准确率为 68.10%,DecepGPT 高 5.13 个百分点。 这支持其在该评测设置中的分类收益,不证明更好的语言解释就是更真实的行为推断。
消融实验¶
以下为原文表 6(第 13 页),沿用对应数据集的域内协议;Base 不含 SICS 与 DMC。
| 配置 | DOLOs Acc. | DOLOs F1 | BoL Acc. | BoL F1 | MU3D Acc. | MU3D F1 |
|---|---|---|---|---|---|---|
| Base | 67.24 | 71.18 | 57.69 | 54.26 | 53.75 | 65.34 |
| Base + DMC | 68.77 | 71.94 | 59.62 | 58.15 | 55.00 | 66.27 |
| Base + SICS | 72.68 | 76.02 | 62.50 | 61.43 | 60.15 | 67.08 |
| Full,SICS + DMC | 73.23 | 76.13 | 63.46 | 63.72 | 61.25 | 67.22 |
SICS 单独加入 Base 的准确率增益依次为 5.44、4.81、6.40 个百分点;其单独收益大于 DMC。 在已有 SICS 的基础上加入 DMC,实际增益为 0.55、0.96、1.10 个百分点。 正文第 12 页所称 DMC “further” 增益 1.53、1.93、1.25,实际对应 Base + DMC 减 Base,不能作为上述叠加增益。
关键发现¶
下表摘录表 1(第 5 页)与表 5(第 12 页);域内按 3-fold 评估,跨文化行表示源文化训练后不做目标域微调。
| 训练版本 → 测试版本 | 测试版本总片段数 | Acc. | F1 |
|---|---|---|---|
| U.S. → U.S. | 876 | 64.65 | 73.28 |
| Germany → Germany | 702 | 61.11 | 53.33 |
| Vietnam → Vietnam | 66 | 63.10 | 68.42 |
| Bulgaria → Bulgaria | 51 | 61.46 | 66.25 |
| U.S. → Germany | 702 | 59.50 | 52.14 |
| U.S. → Bulgaria | 51 | 63.00 | 71.62 |
片段数是整个国家版本的数据规模,不是每个交叉验证折的测试数。 四个域内准确率平均为 62.58%,12 个跨文化方向平均为 57.69%;差值 4.89 是百分点,正文称其为相对下降并不准确。 每国都是 2:1 的 deceptive/truthful 比例;若测试集保持该比例,恒预测 deceptive 的准确率即为 66.67%,高于全部四个域内准确率。 这是依据表 1 比例计算的读者基线,不是作者实际报告的实验;缺少每折分布、平衡准确率与多数类对照,不能据此宣称跨文化判别已可靠。 表 4(第 11 页)还显示,MU3D + BoL → DOLOs 的 F1 为 61.79,低于 PECL 的 69.55,尽管准确率更高,说明优势并非覆盖所有指标。
亮点与洞察¶
- 分字段报告使错误可以定位到观察、属性描述或推断环节;其主要价值是让复核更具体,而非赋予输出自动可信性。
- SICS 与 DMC 分别作用于融合特征和预测分布,消融支持互补收益,但后者的叠加增益明显小于单独增益。
- 统一节目任务是减少跨数据集任务混杂的一种可复用设计,但国家版本仍不是纯粹的文化变量。
局限与展望¶
- 数据来自实验室及娱乐节目,职业身份表演、短剪辑与司法调查在动机、压力和标签含义上不同;不能用于证明现实场景中个人是否撒谎。
- T4 的小样本国家、类别失衡及多数类基线问题限制结论,应补充平衡准确率、分组误报率、置信区间和校准评估。
- 正文把采集与标签验证细节指向 Appendix 1,但所给缓存只含主文和参考文献,无法核验节目、身份及增广样本是否完全跨拆分隔离。
- 第 15 页仅说明随机抽取 100 个输出进行人工审核;图 7 的具体类别比例未在缓存中清晰给出,因此不补写幻觉率。
- 表 3 的文本相似度与 GPT-Score 不能单独验证视听线索存在,更不能验证线索与欺骗之间的因果关联;未来应区分观察准确性与标签决策效度。
相关工作与启发¶
- AffectGPT:提供可解释视听情感理解底座;本文增加欺骗任务报告监督、融合校准和一致性蒸馏,并非从零训练通用多模态模型。
- PECL / DOLOs:代表参数高效跨模态分类及故事编造数据;本文扩展到结构化报告和职业身份冒充,但跨域 F1 并非总是更好。
- ModDrop 与模态重加权:通过输入缺失模拟或优化权重改善模态失衡;DMC 改用完整视听预测监督各分支,仍受教师错误影响。
- 可迁移启发:在其他视听行为任务中,也可将“观察是否正确”和“推断是否成立”分开审核;研究假设应由独立证据检验,而不是由报告措辞背书。
评分¶
- 新颖性:3/5。结构化监督、适配器和蒸馏的组合有任务针对性,多文化数据提供了新评测入口。
- 实验充分度:3/5。包含多数据集与消融,但类别基线、拆分细节和不确定性报告不足。
- 写作质量:3/5。主线清楚,部分增益表述与表格不一致,公式缓存损坏另限制了精确复述。
- 价值:3/5。适合作为可审查视听分类研究参考,不应作为现实测谎或高风险个体判断的部署依据。