跳转至

Video2Reaction: Mapping Video to Audience Reaction Distribution in the Wild

会议: ECCV 2026
论文: ECCV 原文
代码: https://information-fusion-lab-umass.github.io/video2reaction-bench.github.io/
领域: 时间序列
关键词: 诱发情绪识别, 标签分布学习, 视频理解, 多模态大模型, 受众反应预测

一句话总结

针对真实场景下视频受众反应多样且随时间演化的难题,本文构建了首个包含 10,348 个电影片段、389 小时视频与 21 类细粒度情绪标签分布的大规模基准数据集 Video2Reaction,提出两阶段多智能体 LLM 标注流水线,并系统评测了经典分布学习与微调视觉语言模型在受众反应预测上的表现。

研究背景与动机

在情感计算与视频内容理解领域,长期存在着“感知情绪”(Perceived Emotion)与“诱发情绪”(Induced Emotion)的关键分野。前者关注视频内容本身、画面主体或创作者意图传递的情感,而后者则着眼于真实观众在观看内容后所实际产生的心理与生理反应。现有绝大多数视频情感数据集(如 IEMOCAP、MELD、CMU-MOSEI)均集中在实验室受控环境下对感知情绪的标注;少数探索诱发情绪的工作(如 LIRIS-ACCEDE、DEAP)往往局限于低维连续的效价-唤醒度(Valence-Arousal)空间,且多采用少样本实验室共同观看设置,无法反映现实大众观看时的生态多样性。

现实场景中,受众对同一视频片段的反应具有高度的异质性与主观性。一段恐怖电影画面在导演意图中代表着悬疑与惊悚,但在大众受众中,有人会体验到真实的恐惧与焦虑,有人会因看穿俗套桥段而发笑,亦有人可能因创伤记忆而引发不适。若将此类复杂的受众反馈强行压缩为多数投票决定的单标签或硬多标签分类,将彻底抹平受众反应的多样性方差。此外,真实世界观众的情感反应并非静止不变,而是随着社会思潮、网络迷因与时间推移而动态漂移,导致依靠高成本人工逐条标注的传统数据集难以实现持续迭代。

针对上述挑战,本文将受众反应预测形式化为标签分布学习(Label Distribution Learning, LDL)任务,并直接利用社交媒体上海量、自然发生的用户互动数据来刻画真实的受众反应分布。核心 idea:构建首个大规模野生环境电影受众诱发情绪分布基准 Video2Reaction(涵盖 10,348 个视频片段与 21 类情绪分布),设计两阶段多智能体 LLM 标注与双盲验证流水线实现可扩展更新,并建立兼顾全分布拟合与主导情绪判别的双轴评测基准。

方法详解

整体框架

Video2Reaction 旨在从输入的多模态视频中预测群体受众的诱发反应分布。整个研究流水线主要包含三个部分:大规模电影视频与受众评论数据采集、两阶段多智能体评论标注与分布聚合、以及基于多模态基线与基础大模型的标签分布学习预测体系。在数据端,系统从授权的 Movieclips 频道筛选出具备充分观众讨论度的片段,由三款开源大语言模型组成的智能体团队协同提取去噪后的情感标签并聚合为片段级概率分布;在预测端,模型接收视频画面特征、音频特征与文本描述,输出归一化的 21 维情绪反应概率分布向量。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据<br/>电影片段 + 社交媒体评论"] --> B["两阶段多智能体用户评论标注流水线<br/>Stage 1 重述过滤 + Stage 2 多数投票"]
    B --> C["21类细粒度情绪分类学与标签分布学习建模<br/>频数统计归一化为连续概率分布"]
    C --> D["全分布与主导情绪双轴评测基准<br/>分布几何对齐 + 强反应分类排序"]
    D --> E["基础视觉语言模型低秩微调适配<br/>LoRA 微调与标签重排正则"]
    E --> F["输出预测<br/>受众反应概率分布与主导情绪"]

关键设计

1. 两阶段多智能体用户评论标注流水线:通过重述过滤与异构大模型多数投票消除噪声
直接从社交媒体评论中提取诱发情绪面临严重的语义隐含与语境离题问题。大量评论包含反讽、双关或针对演员演技的侧面赞赏,若直接输入情感分类器极易造成误判(例如“这位演员没拿奥斯卡真让我失望”会被误标为“失望”,而其真实表达的情感是赞赏)。为此,流水线设计了串行递进的两阶段机制:第一阶段结合电影片段描述对原始评论进行语义重述(Rephrasing),将隐含情绪显式转化为直接陈述,并同步剔除缺乏明确情绪倾向的离题内容(过滤准确率达 0.83,灵敏度达 1.00,确保相关评论无漏网);第二阶段引入由三款中等体量开源模型(LLaMA-3.1-8B-Instruct、Qwen2.5-14B-Instruct、DeepSeek-R1-Distill-Qwen-7B)构成的并行集成系统,通过多数投票(\(\ge 2\) 模型一致)判定最终情绪标签,有效避免单一模型的偏见。在包含 1,000 条评论的双盲人类交叉验证中,该智能体流水线标注准确率达 86%,在 21 类细粒度情绪上与人类评估者间的一致性相关度达 0.402,完全比肩真实人类标注者间的信度水平(0.428),同时具备近乎零边际成本的持续增量更新能力。

2. 21类细粒度情绪分类学与标签分布学习建模:从离散主观反馈构建受众反应概率分布
传统单标签或多标签分类将标签视为主观对错的绝对指标,无法建模群体受众反应的分歧度与概率结构。本文以涵盖 Reddit 社交特性的 GoEmotions 分类法为起点,在剔除在电影评论中分布均值低于 0.01% 的 7 个极度罕见类别后,构建了包含 21 种细粒度情绪的分类体系(涵盖 7 种正向、10 种负向与 4 种中性模糊情绪)。设输入视频片段为 \(x\),群体受众对 \(x\) 的情绪反应表示为离散概率分布向量 \(d_x = \{d_{xm}\}_{m=1}^M\)(其中 \(M=21\)),每一维分量 \(d_{xm} \in [0, 1]\) 严格等于将该片段标注为情绪 \(m\) 的有效评论占总有效评论数的比例,且满足全概率归一化约束: $\(\sum_{m=1}^{M} d_{xm} = 1\)$ 该分布本质上代表了给定视频内容 \(x\) 时观察到受众产生反应 \(m\) 的条件概率分布 \(p(m|x)\)。统计表明,视频片段间的主导情绪概率中位数为 0.4 左右,且同一部电影不同片段之间的反应分布切比雪夫距离中位数高达 0.48,证实了在片段级别进行分布建模的必要性。

3. 全分布与主导情绪双轴评测基准:结合几何分布对齐与强反应排序的全面衡量
受众反应预测不仅需要衡量模型恢复全局情感概率密度的能力,更需要在推荐系统、内容合规与预告片剪辑等工业下游应用中准确捕获受众最强烈的主导响应。为此,本文建立了双轴评测体系:分布轴涵盖切比雪夫距离(Chebyshev,反映最大单项误差)、Clark 距离、KL 散度、累积绝对距离(CAD,将 21 类映射至效价-唤醒度空间以惩罚语义遥远的误判)、余弦相似度(Cosine)与交叠度(Intersection);主导反应轴则包含 Top-1 概率误差(TPE)、平均倒数排名(MRR)以及加权 Top-\(k\) F1 分数(\(k \in \{1, 2, 3\}\))。这一评测框架消除了传统单一指标对长尾不均衡分布的评估盲区。

4. 基础视觉语言模型低秩微调适配:打破零样本预测瓶颈并实现跨域迁移
针对通用大模型在未经专门对齐时难以理解受众情感反应的痛点,研究评测了前沿多模态基础模型(Gemini 2.5 Flash、LLaVA-Next-Video-7B、Qwen2.5-VL)。实验揭示所有零样本预训练 VLM 均无法建立有效的视频至受众反应映射(Top-1 F1 均低于 0.30,余弦相似度低于 0.51)。为此,方案采用低秩自适应(LoRA, rank \(r=8\), \(\alpha=16\))对开源 VLM 进行 3 个 Epoch 的轻量微调,并在微调提示词中引入标签空间随机重排与同义词替换策略,防止模型形成位置偏置与文本过拟合。微调使得 VLM 在分布对齐与分类指标上均实现跨越式提升,不仅击败全部经典 LDL 算法,更在小样本跨数据集迁移测试(VCE 数据集)中展现出强劲的领域泛化能力。

损失函数 / 训练策略

对于经典专用算法(如 SA-BFGS),模型直接以预测分布 \(\hat{d}_x\) 与经验真实分布 \(d_x\) 之间的 Kullback-Leibler 散度作为核心优化目标,利用准牛顿优化算法求解: $\(\mathcal{L}_{\text{KL}}(d_x, \hat{d}_x) = \sum_{m=1}^{M} d_{xm} \ln \left( \frac{d_{xm}}{\hat{d}_{xm}} \right)\)$ 对于基础视觉语言模型(LLaVA-Next-Video-7B 与 Qwen2.5-VL),输入被格式化为包含视频关键帧、文本描述以及要求输出结构化概率分布的提示词。模型使用交叉熵损失进行因果语言建模训练,并通过温度缩放(Temperature Scaling)在验证集上优化概率校准,使自回归生成的数值概率在全类别上形成合规且鲁棒的概率分布预测。

实验关键数据

主实验

在 Video2Reaction 测试集上,系统对比了四大流派算法:问题转换法(PT)、专用分布算法(SA)、算法适配法(AA)以及基础视觉语言模型(Foundation VLMs)。全分布预测(指标涵盖切比雪夫距离、KL 散度、交叠度、余弦相似度)与主导情绪评测结果如下表所示:

模型类型 模型名称 切比雪夫距离 (Cheb) ↓ KL 散度 (KL) ↓ 交叠度 (Inter) ↑ 余弦相似度 (Cos) ↑ 主导反应 MRR ↑ 主导 Top-1 F1 ↑ 主导 Top-3 F1 ↑
Foundation VLM Gemini 2.5 Flash (Zero-shot) 0.3425 4.8102 0.3787 0.5029 0.4378 0.2735 0.3794
LLaVA-Next-Video-7B (Zero-shot) 0.4110 1.5547 0.2970 0.4185 0.1992 0.0143 0.1374
LLaVA-Next-Video-7B (LoRA 微调) 0.1882 3.1765 0.6861 0.8663 0.7833 0.6521 0.7672
Qwen2.5-VL (Zero-shot) 0.3985 1.5216 0.3140 0.4401 0.3088 0.1958 0.3037
Qwen2.5-VL (LoRA 微调) 0.2047 3.4431 0.6656 0.8427 0.7548 0.6577 0.7725
问题转换 (PT) PT-Bayes 0.9668 21.1994 0.0144 0.0272 0.1535 0.0001 0.0741
LDSVR 0.2584 4.9794 0.6146 0.7872 0.7054 0.5034 0.5696
专用算法 (SA) SA-BFGS 0.2306 0.5976 0.6254 0.8089 0.7163 0.5283 0.6265
LDL-LRR 0.3293 2.2569 0.5242 0.7115 0.6700 0.4965 0.5803
TLRLDL 0.3368 7.9606 0.4264 0.5968 0.5559 0.4516 0.4858
算法适配 (AA) CubeMLP 0.2738 0.6900 0.5624 0.7513 0.5996 0.2376 0.5587
CTEN 0.2432 0.6033 0.6071 0.7977 0.6939 0.4826 0.5109
MMIM 0.2442 0.6076 0.6019 0.7946 0.6749 0.4503 0.5775

消融实验

针对不同模态(视觉 Visual、音频 Audio、文本描述 Text)对受众反应预测的增益,论文在代表性专用算法 SA-BFGS 与代表性大模型 LLaVA-Next 上进行了系统模态消融:

模型 输入模态配置 切比雪夫距离 (Cheb) ↓ KL 散度 (KL) ↓ 主导 MRR ↑ 主导 Top-1 F1 ↑ 说明
SA-BFGS 视觉 (Visual) + 音频 (Audio) 0.314 0.907 0.552 0.306 缺乏场景上下文,性能有限
视觉 (Visual) + 文本 (Text) 0.234 0.588 0.709 0.515 引入片段描述后性能大幅提升
视觉 + 音频 + 文本 (全模态) 0.231 0.598 0.716 0.528 完整配置,音频带来微弱边际增益
LLaVA-Next 视觉 (Visual) 0.218 4.148 0.731 0.586 仅基于视频帧,具备不错视觉理解力
文本 (Text) 0.202 3.693 0.750 0.605 仅凭文本描述在分类上略优于纯视觉
视觉 + 文本 (Visual + Text) 0.188 3.177 0.783 0.652 多模态互补,各项指标均达最优

关键发现

  • 微调是释放 VLM 反应预测潜力的唯一路径:未经微调的零样本基础大模型(含 Gemini 2.5 Flash 与开源模型)在全分布与主导情绪上全面失效(Top-1 F1 均 < 0.30)。然而仅经过 3 个 Epoch 的 LoRA 微调,LLaVA-Next-Video 的余弦相似度翻倍(从 0.4185 升至 0.8663),切比雪夫距离减半(从 0.4110 降至 0.1882),主导 Top-1 F1 暴涨 44 倍(达 0.6521)。
  • 专用 LDL 算法与 VLM 展现出鲜明的特化互补性:SA-BFGS 在直接优化 KL 散度方面展现出极致优势(KL 散度仅 0.5976,远低于微调 VLM 的 3.1765),且显存开销与推理速度远胜 VLM;但在主导情绪识别(Top-1 F1 仅 0.5283 vs VLM 的 0.65+)和低熵单峰尖锐预测上明显不及大模型,倾向于输出平滑但峰值不足的分布。
  • 文本语义模态提供决定性上下文增益:消融实验显示,文本信息(片段描述)对两者性能均有决定性提升,单纯依赖音视频视听特征难以准确捕捉电影戏剧冲突中微妙的情感转折;而音频模态在已有视听文本基础上仅提供微小的边际收益。
  • 跨数据集正向迁移证实监督信号有效性:在外部 VCE 数据集上,将 Video2Reaction 与仅 1% 的 VCE 数据混合微调 Qwen2.5-VL,可获得 0.46 的 Top-3 准确率,超越了仅使用 10% 域内 VCE 数据训练的表现(0.35),证明自动生成的受众分布蕴含通用的情感先验。

亮点与洞察

  • 从“所画即所感”到“千人千面”的范式进阶:论文敏锐抓住了情感计算中感知情绪与诱发情绪的本质脱节,用标签分布学习精准刻画大众真实观影时非对称、多峰共存的情感光谱,为解决“创作者意图与受众感知偏差”提供了量化基石。
  • 低成本、抗时效漂移的自演进标注范式:利用“先语义重述解耦上下文、后多模型集成多数投票”的两阶段 LLM 流水线,在噪声极大的野生社交评论中实现了 86% 的双盲人工复核准确率,彻底摆脱了传统实验室数据集动辄数百名受试者、耗费巨大且一经采集即沦为静态历史标本的局限。
  • 可复用的多模态 LDL 评估方案:在传统统计散度外引入基于效价-唤醒度排序的 CAD 距离与兼顾下游业务的主导情绪 Top-\(k\) 综合指标,为后续跨模态分布预测任务树立了兼顾几何保真度与决策敏感性的评测标杆。

局限与展望

  • 平台来源单一与用户人口统计学不可知:数据集完全依赖 YouTube 单一平台与 Movieclips 频道,可能存在平台特有的网民言论偏置与算法推荐聚集效应;受限于平台隐私协议,无法获取评论者的年龄、性别、地域与文化背景,难以展开群体细分受众分析。
  • 极度不均衡的长尾情绪分布:数据集中 21 类情绪的不均衡比例(Imbalance Factor)高达 28.36,如尴尬(embarrassment)、悲痛(grief)等罕见情绪样本极度稀缺,现有模型在低频极端情绪上的预测召回率依然偏低。
  • 时序纵向漂移与跨平台泛化待验证:尽管论文指出了受众反应在数年间存在显著的情绪跃迁(平均经历 3.46 次主导情绪变更),但现有建模仍以静态聚合分布为目标,尚未构建显式融入时间戳的动态演化预报模型;未来亟需拓展至 TikTok、Bilibili 等多文化短视频平台。

相关工作与启发

  • vs VCE (Mazeika et al., NeurIPS 2022): VCE 是此前规模最大的诱发情绪数据集(6.1 万视频),但其依赖实验室与众包平台(400 名固定标注员),样本静态封闭且无法反映真实互联网受众的生态多样性;Video2Reaction 首次利用无受控社交评论与多智能体标注实现了“野生状态”(In the Wild)的大规模生态采集与持续更新能力。
  • vs CMSV (Xu et al., NeurIPS 2024): CMSV 同样探索了社交媒体诱发情绪,但其任务被设定为在给定“视频+特定评论”配对下推断该评论的情绪;而 Video2Reaction 挑战更为严苛真实的源头前瞻任务——仅从无评论的多模态视频内容直接预报全局受众反应分布。
  • vs 传统标签分布学习 (Geng, TKDE 2016): 经典 LDL 方法多在人脸年龄估计、静态图片情感上验证;本文将 LDL 成功拓宽至包含复杂视听文本的高阶视频理解领域,并率先探索了基础多模态大模型在分布对齐上的适配潜力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次提出野生环境下视频到受众诱发情绪分布预测这一极具现实应用价值的新任务与大规模基准]
  • 实验充分度: ⭐⭐⭐⭐⭐ [横跨4类12种基线模型、双轴9项评测指标、详细消融实验与严格的人机双盲交叉验证]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机阐释极其深刻,概念区分清晰,图表完备详实,实验逻辑链条严密完整]
  • 价值: ⭐⭐⭐⭐⭐ [为影视制作试映预测、智能推荐、视频内容审核及多模态大模型的社会感知力评测提供了不可替代的基础设施]