ESC: Emotional Self-Correction for Reliable Vision-Language Models¶
会议: ECCV2026
论文: ECCV 原文 / 项目页
领域: 多模态 VLM
关键词: 视觉语言模型;自校正;情绪提示;幻觉缓解;免训练
一句话总结¶
ESC 发现把人写的情绪化表达插到问题前面就能让 VLM 主动"慢下来"重走一遍推理,于是用一个独立验证器判断初始回答是否可疑、再据此注入情绪反馈触发一次免训练的自我校正,最后在原答案与修订答案之间二选一;在安全、幻觉、视觉感知与多模态推理四类基准上一致降低攻击成功率或提点,且没有出现性能退化。
研究背景与动机¶
视觉语言模型已经能完成图像问答、图表阅读、数学推理等任务,并开始进入医疗、安防这类高风险场景,但它们的回答仍然经常与视觉证据不符——也就是幻觉。已有的缓解路子大致是三板斧:补域内数据、做微调、改架构,代价都不小;于是在推理时让模型"自己改自己"(nascent self-correction)看起来是一笔划算的买卖。问题是,真正拿到大幅提升的自校正方法大多靠后训练:要么用强化学习显式优化纠错轨迹,要么用精心构造的反思轨迹做监督微调或偏好优化,普遍需要密集标注与可观算力,很难跨模型、跨领域复用。更麻烦的是自校正的质量高度依赖反馈质量,而模型又存在"自校正盲区"——它能纠正别的模型给出的错误,却很难发现自己的错。这让"推理时到底什么条件下自校正才可靠"一直没有一个清楚的答案。
另一条线索来自人的行为:人们改口并不总因为被明确指错,很多时候是因为情绪——紧张、不安、担忧这类感受会让人放慢节奏、重新审视自己的判断。已有工作大多把情绪当成一种"能力维度"来评测(模型能不能识别情感、能不能共情回复),或把情绪离散地建模成若干标签,忽略了它在连续情感空间里的组织方式。本文改用 Russell 的环状情感模型,把情绪表示在效价(valence)× 唤醒(arousal)的二维连续坐标上,做了一组受控探测:视觉输入与任务指令完全不动,只在查询里加入情绪化表达,5 个不同架构与规模的开源 VLM 在 VLSafe 上的 ASR 一致下降 7.2 到 26.4 个百分点——无论是本来就脆弱的 LLaVA-1.5-7B(71.6% → 45.2%)还是安全对齐较强的 Qwen2-VL-7B(20.0% → 7.5%)都有效。进一步按四个象限拆分后发现,四个象限相对中性基线都能降 ASR,但负效价的降幅稳定更大,而且敏感程度依赖架构。核心 idea:情绪在这里不是要被模型识别的内容,而是一个可以直接插进提示词、控制模型推理模式的信号——用外部验证器判定初始回答是否需要修订,需要就把一段取自"负效价 + 低唤醒"象限的情绪提示前置到问题之前,让目标模型在更审慎的模式下重走推理并给出修订答案,再由验证器在两个候选答案之间仲裁,全程不改动任何权重。
方法详解¶
整体框架¶
ESC 的输入是一对(图像 \(I\),问题 \(Q\)),系统里有两个角色:要被改进的目标 VLM \(M_T\)(实验中是 LLaVA-1.5-7B 与 Qwen2-VL-7B),以及一个独立的验证器 VLM \(M_V\)(默认 Gemma3-12B)。整条流程只有三步:先由 \(M_T\) 生成初始回答 \(R_{\mathrm{initial}}\);再让 \(M_V\) 在看过 \((I, Q, R_{\mathrm{initial}})\) 之后自己重新作答一次,若它的回答 \(R_{\mathrm{decided}}\) 与 \(R_{\mathrm{initial}}\) 不同,就说明初始回答可疑——ESC 据此选出一条情绪反馈 \(F_{\mathrm{emotional}}\) 前置到问题之前,让 \(M_T\) 重新走一遍推理、生成修订回答 \(R_{\mathrm{revised}}\);最后 \(M_V\) 同时看到两个版本,挑出更合适的那个作为最终输出。
要强调的是,ESC 与大多数自校正方法最大的差别是它并不总是修订:多数方法拿到反馈就无条件重写一遍,而 ESC 在修订之前先加了一道验证闸门,初始回答已经可靠时就直接返回,既不浪费算力,也不会把本来对的答案改坏。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图像 + 问题"] --> B["目标 VLM 生成初始回答"]
B --> C["外部验证器把关<br/>先验证、后修订"]
C -->|"回答被接受,直接返回"| G["输出最终回答"]
C -->|"判定需要修订"| D["情绪反馈注入<br/>负低唤醒情绪前置到问题前<br/>目标 VLM 重走推理"]
D --> E["原答案 / 修订答案<br/>二选一仲裁"]
E --> G
关键设计¶
1. 外部验证器把关:用"两个模型答案不一致"定义"需要修订"
这一步直接针对前面说的自校正盲区。论文给了实证:当 LLaVA-1.5-7B 同时充当目标模型和验证器(也就是纯内在自校正)时,VLSafe 上 ASR 仍停在 50.3%,远高于任何一个外部验证器的结果。因此 ESC 把把关权交给另一个模型,但它没有让验证器输出"对/错"标签或打一个置信分——\(M_V\) 只是拿着 \((I, Q, R_{\mathrm{initial}})\) 重新作答一次,用 \(R_{\mathrm{decided}} \neq R_{\mathrm{initial}}\) 这个分歧信号作为触发条件。这样做有两个好处:一是验证器不需要额外的判别头、奖励模型或标注,任何一个现成 VLM 都能直接顶上;二是闸门天生带了一个"什么都不做"的出口——初始回答被接受就原样返回,保住模型原本的强项。这个出口在实践中不是摆设:Qwen2-VL-7B 在 POPE 上会出现"一律回答 yes"的推理坍缩(Acc 50.80、F1 只有 3.40),ESC 的验证阶段正是先把这种明显失效的作答挡下来,再靠后续仲裁把预测分布掰回平衡(见实验部分)。
论文另外做了一组验证器替换实验来回答"增益是不是来自更强模型的知识蒸馏":把默认的 Gemma3-12B 换成三个 3–4B 的小验证器(Qwen3-VL-4B 33.9%、Qwen2.5-VL-3B 34.0%、Gemma3-4B 34.3%),ASR 仅比 12B 默认(31.2%)略高。这说明验证器在里面只是一个便宜的"触发开关",真正干活的是后面注入的情绪反馈。
2. 情绪反馈注入:把情绪当作让模型"慢下来"的控制信号
要读懂这个设计,先得把"情绪"在这里指什么说清楚——它既不是情感分析任务(不是让模型判断图中人物的心情),也不是模型自身的置信度或不确定性估计,更不是靠多次采样算出来的一致性分数;它就是一段人工写好的、表达情感状态的自然语言文本。ESC 按 Russell 的环状情感模型把它定位在效价(愉快—不愉快)× 唤醒(激活—平静)的二维连续空间里,共四个象限,默认采用 Negative-Low Arousal(负效价 + 低唤醒,方向是"担忧、不安、这件事得格外小心"这类表达),并把它前置在问题之前。所谓"自我校正",就是让目标模型在这个情绪前缀下重新生成一遍回答:
其中 \(F_{\mathrm{emotional}}\) 由 Algo. 1 里的 Selection 函数依据验证器的判定选出(原文主文未展开该函数的实现细节,只说默认取负低唤醒象限的一条情绪提示,⚠️ 以原文为准)。因为模型要重新生成完整回答,被改动的其实不只是最终选项,还有中间的推理链条。
为什么这样有效?作者借 Schwarz 的 affect-as-information 框架解释:负性情绪传递的信号是"当前情况有问题",会促使信息处理转向细节导向;正性情绪则更容易诱使模型走启发式捷径——这正好对上消融里 Positive-Low Arousal 的 ASR(49.5%)明显高于 Negative-Low Arousal(31.2%)的结果。Sec. 3 的探测也显示,情绪的影响是普适的(四个象限相对中性都能降 ASR)但负效价降幅更大,且敏感度因架构而异(Qwen2-VL 全象限都敏感,Pixtral-12B 对正效价几乎无反应),这解释了 ESC 为什么固定使用负低唤醒这一格而不是随机挑。更直接的机制证据来自审慎度分析:作者让 Qwen3-VL-8B-Thinking 在 VLSafe 上留下思维链,再用 Gemma-4-26B 按 1–5 分给每条思维链的"审慎程度"打分(分数越高越仔细,完整打分 prompt 见原文附录)。只有验证-修订循环而不带情绪(VO)时,思维链审慎度与基线几乎一模一样(3.31 vs 3.30),说明单纯多跑一轮并不改变模型的推理方式;通用纠错提示与心理学提示把审慎度抬到 4.22 和 4.15;ESC 最高(4.50,中位数 5.0)。换言之,情绪改的不是"答什么",而是"想得多仔细"。此外 ESC 用的情绪提示是全部对比条件里最短的,排除了"靠更长提示刷分"这个混淆因素。
3. 原答案 / 修订答案二选一仲裁:给校正加一个下限保护
让模型在情绪下重写答案是一把双刃剑:它可能改对,也可能把原本正确的回答改坏,变成过度保守或答非所问。ESC 的兜底做法是让 \(M_V\) 在两个版本之间做仲裁,而不是无条件采信修订版——这一步把"情绪校正"从一个单向的改写算子变成了一个带退路的候选选择。它解释了论文里一处最反直觉的结果:Qwen2-VL-7B 在 POPE 三个划分上的基线是"全答 yes"式的坍缩,ESC 把 Acc 从 50.80 提到 80.43、F1 从 3.40 提到 76.17,靠的并不是把回答改得更严格,而是"先否掉坍缩答案、再在两个候选里挑一个"这套机制把预测分布重新掰平。也正因为修订不通过就退回原答案,ESC 在论文评测的所有基准上都没有出现掉点——这既是它区别于"越修越保守"式方法的地方,也是它能作为即插即用组件的前提。
损失函数 / 训练策略¶
ESC 完全免训练:不改权重、不算梯度、不做任何后训练,全部动作都发生在推理时的提示词上。因此这里只有超参选择需要交代——验证器默认 Gemma3-12B,情绪象限默认 Negative-Low Arousal,情绪提示默认 1 条、前置在问题之前;目标模型是 LLaVA-1.5-7B 与 Qwen2-VL-7B,HallusionBench 与 MM-Vet 用 GPT-4o 打分,其余基准用准确率/ASR 类常规指标。需要注意的是,"默认 1 条"并非消融里的最优设置(2 条更好,见下),论文把它作为默认配置但未说明取舍理由。
实验关键数据¶
主实验¶
安全性用 VLSafe 与 MMSafetyBench 的 ASR(攻击成功率,越低越好),幻觉用 POPE 三个划分与 HallusionBench(GPT-4o 评判)。安全性上 ESC 在两个基准、所有场景类别上都降低了 ASR;MMSafetyBench 的 13 个场景(取 SD、SD+Typo、Typo 三种图片类型的平均)同样一致下降。
| 基准 | 模型 | 指标 | Baseline | ESC | Δ |
|---|---|---|---|---|---|
| VLSafe | LLaVA-1.5-7B | ASR↓ | 71.6% | 25.3%(Fig. 5)/ 31.2%(Tab. 4、7) | −46.3 / −40.4 |
| VLSafe | Qwen2-VL-7B | ASR↓ | 20.0% | 9.9% | −10.1 |
| VLSafe | Qwen3-VL-8B | ASR↓ | 8.4% | 3.2% | −5.2 |
| VLSafe | InternVL3-8B | ASR↓ | 10.5% | 6.5% | −4.0 |
| POPE-Adversarial | LLaVA-1.5-7B | Acc↑ / F1↑ | 83.47 / 82.57 | 84.53 / 84.15 | +1.06 / +1.58 |
| POPE-Popular | LLaVA-1.5-7B | Acc↑ / F1↑ | 86.07 / 84.94 | 87.40 / 86.72 | +1.33 / +1.78 |
| POPE-Random | LLaVA-1.5-7B | Acc↑ / F1↑ | 87.90 / 86.65 | 89.57 / 88.73 | +1.67 / +2.08 |
| POPE-Adversarial | Qwen2-VL-7B | Acc↑ / F1↑ | 50.80 / 3.40 | 80.43 / 76.17 | +29.63 / +72.77 |
| POPE-Popular | Qwen2-VL-7B | Acc↑ / F1↑ | 50.83 / 3.41 | 80.93 / 76.65 | +30.10 / +73.24 |
| POPE-Random | Qwen2-VL-7B | Acc↑ / F1↑ | 50.83 / 3.41 | 81.27 / 77.04 | +30.44 / +73.63 |
| HallusionBench | LLaVA-1.5-7B | aAcc / qAcc / fAcc↑ | 44.11 / 17.58 / 16.87 | 45.17 / 17.58 / 17.37 | +1.06 / +0.00 / +0.50 |
| HallusionBench | Qwen2-VL-7B | aAcc / qAcc / fAcc↑ | 55.00 / 26.37 / 29.53 | 55.62 / 28.57 / 30.27 | +0.62 / +2.20 / +0.74 |
多模态推理(MM-Vet 用 GPT-4o 打分)与视觉中心感知(MMVP 是配对准确率,考核细粒度视觉判别)的结果:推理侧增益温和但方向一致,视觉感知侧在 MMVP 和 RealWorldQA 上出现了全场最大的两个跳变。
| 基准 | 模型 | 指标 | Baseline | ESC | Δ |
|---|---|---|---|---|---|
| MM-Vet | LLaVA-1.5-7B | Score↑ | 24.31 | 25.39 | +1.08 |
| MathVista | LLaVA-1.5-7B | Acc↑ | 22.20 | 23.40 | +1.20 |
| MMStar | LLaVA-1.5-7B | Acc↑ | 33.53 | 34.13 | +0.60 |
| MMMU | LLaVA-1.5-7B | Acc↑ | 34.66 | 34.77 | +0.11 |
| AI2D | LLaVA-1.5-7B | Acc↑ | 51.23 | 53.72 | +2.49 |
| MM-Vet | Qwen2-VL-7B | Score↑ | 39.66 | 40.05 | +0.39 |
| MathVista | Qwen2-VL-7B | Acc↑ | 56.10 | 56.10 | +0.00 |
| MMStar | Qwen2-VL-7B | Acc↑ | 55.93 | 56.07 | +0.14 |
| MMMU | Qwen2-VL-7B | Acc↑ | 39.67 | 40.02 | +0.35 |
| AI2D | Qwen2-VL-7B | Acc↑ | 60.98 | 62.53 | +1.55 |
| MMVP | LLaVA-1.5-7B | Pair Acc↑ | 18.67 | 26.00 | +7.33 |
| MMVP | Qwen2-VL-7B | Pair Acc↑ | 41.33 | 45.33 | +4.00 |
| RealWorldQA | LLaVA-1.5-7B | Acc↑ | 53.59 | 53.86 | +0.27 |
| RealWorldQA | Qwen2-VL-7B | Acc↑ | 40.00 | 54.51 | +14.51 |
| BLINK | LLaVA-1.5-7B | Micro / Macro Acc↑ | 41.71 / 42.20 | 42.14 / 42.61 | +0.43 / +0.41 |
| BLINK | Qwen2-VL-7B | Micro / Macro Acc↑ | 49.61 / 50.42 | 49.61 / 50.44 | +0.00 / +0.02 |
表中列归属按原文正文的叙述对齐(+0.27 与 +14.51 被原文归给 RealWorldQA,+7.33 与 +4.00 归给 MMVP);缓存文本里该表表头存在列分组歧义,且 MMVP 的 Question Acc 列(LLaVA 54.67 → 59.33、Qwen2 69.00 → 70.33)未在上表列出,⚠️ 以原文为准。
消融实验¶
最核心的一组消融是在完全相同条件下替换"反馈内容",用来验证情绪本身是不是因果因素(目标模型统一 LLaVA-1.5-7B、验证器统一 Gemma3-12B、单条提示、位置一致):
| 配置 | ASR↓ | Δ | 说明 |
|---|---|---|---|
| Baseline(无干预) | 71.6% | — | 不做任何修订 |
| VO(只有验证-修订循环) | 69.1% | −2.5 | 有校正流程但没有情绪反馈,几乎无效 |
| ZeroCoT | 70.1% | −1.5 | 只加"Let's think step by step." |
| SR(Self-Refine 式提示) | 49.3% | −22.3 | 让它复查上一轮答案并给出修正 |
| Corr(通用纠错提示) | 48.6% | −23.0 | 让它重新审视并视情况修改 |
| Psych(心理学提示) | 54.4% | −17.2 | 只改语气不给情感依据,如"这对我事业很重要" |
| ESC(Ours) | 31.2% | −40.4 | 负低唤醒情绪提示,前置 |
其余设计变量的取舍(同样在 VLSafe、LLaVA-1.5-7B 上):
| 变量 | 设置 | ASR↓ | 说明 |
|---|---|---|---|
| 验证器 | LLaVA-1.5-7B 自验(内在自校正) | 50.3% | 明显高于外部验证器,撞上自校正天花板 |
| 验证器 | Gemma3-12B(默认) | 31.2%(Fig. 7(a) 正文记为 40.1%,口径存疑) | 原文称其为四者最低 |
| 验证器 | Qwen3-VL-4B / Qwen2.5-VL-3B / Gemma3-4B | 33.9% / 34.0% / 34.3% | 小验证器也接近默认,排除知识蒸馏解释 |
| 情绪象限 | Negative-Low Arousal(默认) | 31.2% | 最低 |
| 情绪象限 | Positive-Low Arousal | 49.5% | 最高,正效价稀释校正信号 |
| 插入位置 | 前置(默认) | 31.2% | 比后置好 10.5 个百分点 |
| 插入位置 | 后置 | 41.7% | — |
| 情绪条数 | 1(默认) | 31.2% | — |
| 情绪条数 | 2 | 25.3% | 唯一比默认更优的设置 |
| 情绪条数 | 3 / 4 | 26.8% / 25.4% | 继续加没有进一步收益 |
审慎度打分(Qwen3-VL-8B-Thinking 的思维链,Gemma-4-26B 按 1–5 分评判,越高越审慎):
| 条件 | 均值↑ | 中位数↑ |
|---|---|---|
| Base | 3.31 | 4.00 |
| VO | 3.30 | 4.00 |
| Psych | 4.15 | 4.00 |
| Corr | 4.22 | 4.00 |
| ESC | 4.50 | 5.00 |
关键发现¶
- 情绪是因果因素,流程本身不是:只有验证-修订循环(VO,−2.5)或通用思维链提示(ZeroCoT,−1.5)几乎不改变 ASR,说明收益不来自"多跑一轮";通用纠错类提示能拿到约 22–23 个点的改善,而 ESC 比它们再多出 17 个点以上,证明情绪内容本身在起作用。审慎度打分从另一侧面印证:VO 与基线持平(3.30 vs 3.31),ESC 才真正让思维链变审慎(4.50)。
- 增益与基线脆弱度正相关:提升最大的三处都发生在基线本身就坏掉的地方——Qwen2-VL 在 POPE 上的坍缩(F1 3.40 → 76.17)、RealWorldQA(+14.51)、MMVP(+4.00 / +7.33);而在 MMMU、MathVista 这类已经较稳的知识密集型基准上,Qwen2-VL 的增益只有 +0.35、+0.00。重要的一点是没有任何一个基准出现下降,说明二选一仲裁确实兜住了"改坏"的风险。
- 情绪不靠强验证器撑场:3–4B 的小验证器(33.9%–34.3%)已经接近 12B 默认(31.2%),换个说法,把验证器从 12B 缩到 3B 只损失 2–3 个百分点,而把情绪反馈换成通用纠错提示会损失 17 个点以上。
- 情绪提示有"剂量"效应且非单调:1 条 → 2 条带来 5.9 个点的改善(31.2% → 25.3%),但 3 条(26.8%)与 4 条(25.4%)没有进一步收益,作者据此认为适度强化有益、过度堆叠只增冗余。值得注意的是默认配置仍用 1 条,并未采用消融中最优的 2 条。
- 情绪类型与位置的排序自洽:负低唤醒 < 负高唤醒/正高唤醒 < 正低唤醒,且随机从四象限采样会稀释校正信号;前置优于后置 10.5 个点,说明情绪要先于问题影响模型对整件事的 framing,而不是事后补一句评论。
- 数字口径提示:VLSafe 上 ESC 的 ASR 在 Fig. 5 中报 25.3%、在 Tab. 4/7 中报 31.2%;验证器消融中 Gemma3-12B 在正文被记为 40.1%,与 Tab. 4 的 31.2% 不在同一口径上(可能一处含情绪反馈、一处不含)。引用时应锁定具体出处,⚠️ 以原文为准。
亮点与洞察¶
- 把"情绪"从被识别的对象翻转成控制信号:以往情感计算关心模型识别得准不准、回复得贴不贴心,这里关心的是情绪能不能当旋钮用。一次概念上的小转身(情绪从能力维度变成控制维度),打开了一条完全不依赖后训练的推理时扩展路线——这是全文最"啊哈"的地方。
- 用"分歧"而不是"打分"来定义"需要修订":验证器只要重新作答一次,答案不一致就触发修订。这省掉了训练判别器/奖励模型的全部成本,也让验证器可以是任何现成 VLM;同时它天然继承了自校正盲区的教训——把关必须来自另一个模型。
- 审慎度打分是一个可复用的诊断手段:用第三方模型给思维链打 1–5 分,把"改了答案"和"改了推理方式"这两件事拆开,正好补上了行为指标(ASR/Acc)说不清的机制层。任何做自校正或推理增强的工作都可以照搬这套对照设计。
- "越修越保守"的反面证据:因为加入二选一仲裁,ESC 在推理与感知基准上没有掉点。这提示自校正系统里"候选选择"应该和"候选生成"分开设计——生成阶段可以激进,选择阶段负责保底。
局限与展望¶
- 作者承认的局限不多,主要在结论中把 ESC 定位为"未来可控多模态智能的一个基础",没有展开失效场景。
- 情绪提示的写法仍是黑盒:Algo. 1 里的 Selection 函数、提醒模板的具体措辞与筛选逻辑主文都没有给出(多处指向附录),而这恰恰是复现与迁移时最敏感的部分。
- 默认配置并非消融最优:默认 1 条情绪提示对应 31.2% 的 ASR,而 2 条可达 25.3%,论文没有解释为何不采用 2 条;同时 VLSafe 上出现了 25.3%(Fig. 5)与 31.2%(Tab. 4/7)两套读数,读者不宜把两条线的收益混着引用。
- 对比维度偏弱:表格里的 SR / Corr / VO / Psych 都是本文自己复现的提示式基线,而不是那些需要后训练的自校正方法的原实现,所以"免训练也够好"这一结论缺少同评测协议下的直接对手。
- 机制解释依赖 affect-as-information 这套心理学类比,证据形态是行为指标加审慎度评分,缺少模型内部表征层面的证据(例如情绪前缀究竟改变了哪些注意力或激活模式)。
- 安全基准只报 ASR,没有专门报告 over-refusal / helpfulness 指标;多模态推理基准不掉点是有力但间接的证据。
- 可改进方向:把情绪象限与条数做成自适应选择(如按验证器的分歧程度分配"情绪预算"),或把验证器的判定转成内容更具体的反馈而非固定模板;也可以试着把情绪信号接到 test-time scaling 的算力分配上——只在可疑样本上付第二次生成的钱。
相关工作与启发¶
- vs 后训练式自校正(RL / SFT 类,如 VL-Rethinker、RecoT、Sherlock):他们用强化学习或反射轨迹训练把纠错能力"练进"权重里,代价是大规模合成数据、多阶段训练与工程化奖励,且换模型就要重来;ESC 完全不碰权重,只在推理时插一段情绪提示,即插即用且可跨模型迁移。代价是它的提升幅度受限于目标模型本身已有的能力(对知识密集型基准几乎无效)。
- vs 内在自校正 / 提示式自校正(Self-Refine、ZeroCoT 等):这些方法要么撞上自校正盲区的天花板(本文复现的自验只有 50.3% ASR),要么靠通用纠错指令拿固定收益(约 22–23 个点)。ESC 指出真正的杠杆在反馈的"情绪内容"上,同样单条提示、同样位置,靠内容差异把 ASR 再压低 17 个点以上。
- vs 幻觉纠正流水线(如 Woodpecker 式的"检测-纠正"):那类方法要专门训练检测器与纠正器,属于模块化流水线;ESC 只用两个现成 VLM 和一句情绪提示,把"检测"简化成了回答不一致这个信号,把"纠正"简化成了重新生成加二选一。
- vs 情感计算方向的工作(Emotion-LLaMA、EmoBench 等):他们研究模型能不能识别与表达情绪,把情绪当能力维度;ESC 关心的是情绪能不能被当作控制量使用,两者对"情绪"的定义和使用方式完全不同,这也意味着这条线索还有很大探索空间。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 把情绪从"要识别的对象"翻成"可注入的控制信号",并用环状情感模型系统化其选择,视角新且实证扎实
- 实验充分度: ⭐⭐⭐⭐ 覆盖安全/幻觉/推理/感知四类基准,含反馈内容、验证器、象限、位置、条数、审慎度与跨模型泛化七组分析;但缺同协议下与后训练式自校正方法的直接对比,且个别数字口径不一致
- 写作质量: ⭐⭐⭐⭐ 逻辑链清楚(观测→发现→框架→消融),方法极简好复现;缺点是关键实现细节(情绪模板、Selection 函数)大量外推到附录,主文对默认超参与读数差异交代不足
- 价值: ⭐⭐⭐⭐ 提供了一条几乎零成本的推理时可靠性改进路径,且"情绪即控制信号"这个思路可迁移到 LLM 与 agent 场景,工程价值明确