跳转至

ESC: Emotional Self-Correction for Reliable Vision-Language Models

会议: ECCV2026
论文: ECCV 原文 / 项目页
领域: 多模态 VLM
关键词: 视觉语言模型;自校正;情绪提示;幻觉缓解;免训练

一句话总结

ESC 发现把人写的情绪化表达插到问题前面就能让 VLM 主动"慢下来"重走一遍推理,于是用一个独立验证器判断初始回答是否可疑、再据此注入情绪反馈触发一次免训练的自我校正,最后在原答案与修订答案之间二选一;在安全、幻觉、视觉感知与多模态推理四类基准上一致降低攻击成功率或提点,且没有出现性能退化。

研究背景与动机

视觉语言模型已经能完成图像问答、图表阅读、数学推理等任务,并开始进入医疗、安防这类高风险场景,但它们的回答仍然经常与视觉证据不符——也就是幻觉。已有的缓解路子大致是三板斧:补域内数据、做微调、改架构,代价都不小;于是在推理时让模型"自己改自己"(nascent self-correction)看起来是一笔划算的买卖。问题是,真正拿到大幅提升的自校正方法大多靠后训练:要么用强化学习显式优化纠错轨迹,要么用精心构造的反思轨迹做监督微调或偏好优化,普遍需要密集标注与可观算力,很难跨模型、跨领域复用。更麻烦的是自校正的质量高度依赖反馈质量,而模型又存在"自校正盲区"——它能纠正别的模型给出的错误,却很难发现自己的错。这让"推理时到底什么条件下自校正才可靠"一直没有一个清楚的答案。

另一条线索来自人的行为:人们改口并不总因为被明确指错,很多时候是因为情绪——紧张、不安、担忧这类感受会让人放慢节奏、重新审视自己的判断。已有工作大多把情绪当成一种"能力维度"来评测(模型能不能识别情感、能不能共情回复),或把情绪离散地建模成若干标签,忽略了它在连续情感空间里的组织方式。本文改用 Russell 的环状情感模型,把情绪表示在效价(valence)× 唤醒(arousal)的二维连续坐标上,做了一组受控探测:视觉输入与任务指令完全不动,只在查询里加入情绪化表达,5 个不同架构与规模的开源 VLM 在 VLSafe 上的 ASR 一致下降 7.2 到 26.4 个百分点——无论是本来就脆弱的 LLaVA-1.5-7B(71.6% → 45.2%)还是安全对齐较强的 Qwen2-VL-7B(20.0% → 7.5%)都有效。进一步按四个象限拆分后发现,四个象限相对中性基线都能降 ASR,但负效价的降幅稳定更大,而且敏感程度依赖架构。核心 idea:情绪在这里不是要被模型识别的内容,而是一个可以直接插进提示词、控制模型推理模式的信号——用外部验证器判定初始回答是否需要修订,需要就把一段取自"负效价 + 低唤醒"象限的情绪提示前置到问题之前,让目标模型在更审慎的模式下重走推理并给出修订答案,再由验证器在两个候选答案之间仲裁,全程不改动任何权重。

方法详解

整体框架

ESC 的输入是一对(图像 \(I\),问题 \(Q\)),系统里有两个角色:要被改进的目标 VLM \(M_T\)(实验中是 LLaVA-1.5-7B 与 Qwen2-VL-7B),以及一个独立的验证器 VLM \(M_V\)(默认 Gemma3-12B)。整条流程只有三步:先由 \(M_T\) 生成初始回答 \(R_{\mathrm{initial}}\);再让 \(M_V\) 在看过 \((I, Q, R_{\mathrm{initial}})\) 之后自己重新作答一次,若它的回答 \(R_{\mathrm{decided}}\)\(R_{\mathrm{initial}}\) 不同,就说明初始回答可疑——ESC 据此选出一条情绪反馈 \(F_{\mathrm{emotional}}\) 前置到问题之前,让 \(M_T\) 重新走一遍推理、生成修订回答 \(R_{\mathrm{revised}}\);最后 \(M_V\) 同时看到两个版本,挑出更合适的那个作为最终输出。

要强调的是,ESC 与大多数自校正方法最大的差别是它并不总是修订:多数方法拿到反馈就无条件重写一遍,而 ESC 在修订之前先加了一道验证闸门,初始回答已经可靠时就直接返回,既不浪费算力,也不会把本来对的答案改坏。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["图像 + 问题"] --> B["目标 VLM 生成初始回答"]
    B --> C["外部验证器把关<br/>先验证、后修订"]
    C -->|"回答被接受,直接返回"| G["输出最终回答"]
    C -->|"判定需要修订"| D["情绪反馈注入<br/>负低唤醒情绪前置到问题前<br/>目标 VLM 重走推理"]
    D --> E["原答案 / 修订答案<br/>二选一仲裁"]
    E --> G

关键设计

1. 外部验证器把关:用"两个模型答案不一致"定义"需要修订"

这一步直接针对前面说的自校正盲区。论文给了实证:当 LLaVA-1.5-7B 同时充当目标模型和验证器(也就是纯内在自校正)时,VLSafe 上 ASR 仍停在 50.3%,远高于任何一个外部验证器的结果。因此 ESC 把把关权交给另一个模型,但它没有让验证器输出"对/错"标签或打一个置信分——\(M_V\) 只是拿着 \((I, Q, R_{\mathrm{initial}})\) 重新作答一次,用 \(R_{\mathrm{decided}} \neq R_{\mathrm{initial}}\) 这个分歧信号作为触发条件。这样做有两个好处:一是验证器不需要额外的判别头、奖励模型或标注,任何一个现成 VLM 都能直接顶上;二是闸门天生带了一个"什么都不做"的出口——初始回答被接受就原样返回,保住模型原本的强项。这个出口在实践中不是摆设:Qwen2-VL-7B 在 POPE 上会出现"一律回答 yes"的推理坍缩(Acc 50.80、F1 只有 3.40),ESC 的验证阶段正是先把这种明显失效的作答挡下来,再靠后续仲裁把预测分布掰回平衡(见实验部分)。

论文另外做了一组验证器替换实验来回答"增益是不是来自更强模型的知识蒸馏":把默认的 Gemma3-12B 换成三个 3–4B 的小验证器(Qwen3-VL-4B 33.9%、Qwen2.5-VL-3B 34.0%、Gemma3-4B 34.3%),ASR 仅比 12B 默认(31.2%)略高。这说明验证器在里面只是一个便宜的"触发开关",真正干活的是后面注入的情绪反馈。

2. 情绪反馈注入:把情绪当作让模型"慢下来"的控制信号

要读懂这个设计,先得把"情绪"在这里指什么说清楚——它既不是情感分析任务(不是让模型判断图中人物的心情),也不是模型自身的置信度或不确定性估计,更不是靠多次采样算出来的一致性分数;它就是一段人工写好的、表达情感状态的自然语言文本。ESC 按 Russell 的环状情感模型把它定位在效价(愉快—不愉快)× 唤醒(激活—平静)的二维连续空间里,共四个象限,默认采用 Negative-Low Arousal(负效价 + 低唤醒,方向是"担忧、不安、这件事得格外小心"这类表达),并把它前置在问题之前。所谓"自我校正",就是让目标模型在这个情绪前缀下重新生成一遍回答:

\[R_{\mathrm{revised}} = M_T\big(I,\; F_{\mathrm{emotional}} \,\|\, Q\big)\]

其中 \(F_{\mathrm{emotional}}\) 由 Algo. 1 里的 Selection 函数依据验证器的判定选出(原文主文未展开该函数的实现细节,只说默认取负低唤醒象限的一条情绪提示,⚠️ 以原文为准)。因为模型要重新生成完整回答,被改动的其实不只是最终选项,还有中间的推理链条。

为什么这样有效?作者借 Schwarz 的 affect-as-information 框架解释:负性情绪传递的信号是"当前情况有问题",会促使信息处理转向细节导向;正性情绪则更容易诱使模型走启发式捷径——这正好对上消融里 Positive-Low Arousal 的 ASR(49.5%)明显高于 Negative-Low Arousal(31.2%)的结果。Sec. 3 的探测也显示,情绪的影响是普适的(四个象限相对中性都能降 ASR)但负效价降幅更大,且敏感度因架构而异(Qwen2-VL 全象限都敏感,Pixtral-12B 对正效价几乎无反应),这解释了 ESC 为什么固定使用负低唤醒这一格而不是随机挑。更直接的机制证据来自审慎度分析:作者让 Qwen3-VL-8B-Thinking 在 VLSafe 上留下思维链,再用 Gemma-4-26B 按 1–5 分给每条思维链的"审慎程度"打分(分数越高越仔细,完整打分 prompt 见原文附录)。只有验证-修订循环而不带情绪(VO)时,思维链审慎度与基线几乎一模一样(3.31 vs 3.30),说明单纯多跑一轮并不改变模型的推理方式;通用纠错提示与心理学提示把审慎度抬到 4.22 和 4.15;ESC 最高(4.50,中位数 5.0)。换言之,情绪改的不是"答什么",而是"想得多仔细"。此外 ESC 用的情绪提示是全部对比条件里最短的,排除了"靠更长提示刷分"这个混淆因素。

3. 原答案 / 修订答案二选一仲裁:给校正加一个下限保护

让模型在情绪下重写答案是一把双刃剑:它可能改对,也可能把原本正确的回答改坏,变成过度保守或答非所问。ESC 的兜底做法是让 \(M_V\) 在两个版本之间做仲裁,而不是无条件采信修订版——这一步把"情绪校正"从一个单向的改写算子变成了一个带退路的候选选择。它解释了论文里一处最反直觉的结果:Qwen2-VL-7B 在 POPE 三个划分上的基线是"全答 yes"式的坍缩,ESC 把 Acc 从 50.80 提到 80.43、F1 从 3.40 提到 76.17,靠的并不是把回答改得更严格,而是"先否掉坍缩答案、再在两个候选里挑一个"这套机制把预测分布重新掰平。也正因为修订不通过就退回原答案,ESC 在论文评测的所有基准上都没有出现掉点——这既是它区别于"越修越保守"式方法的地方,也是它能作为即插即用组件的前提。

损失函数 / 训练策略

ESC 完全免训练:不改权重、不算梯度、不做任何后训练,全部动作都发生在推理时的提示词上。因此这里只有超参选择需要交代——验证器默认 Gemma3-12B,情绪象限默认 Negative-Low Arousal,情绪提示默认 1 条、前置在问题之前;目标模型是 LLaVA-1.5-7B 与 Qwen2-VL-7B,HallusionBench 与 MM-Vet 用 GPT-4o 打分,其余基准用准确率/ASR 类常规指标。需要注意的是,"默认 1 条"并非消融里的最优设置(2 条更好,见下),论文把它作为默认配置但未说明取舍理由。

实验关键数据

主实验

安全性用 VLSafe 与 MMSafetyBench 的 ASR(攻击成功率,越低越好),幻觉用 POPE 三个划分与 HallusionBench(GPT-4o 评判)。安全性上 ESC 在两个基准、所有场景类别上都降低了 ASR;MMSafetyBench 的 13 个场景(取 SD、SD+Typo、Typo 三种图片类型的平均)同样一致下降。

基准 模型 指标 Baseline ESC Δ
VLSafe LLaVA-1.5-7B ASR↓ 71.6% 25.3%(Fig. 5)/ 31.2%(Tab. 4、7) −46.3 / −40.4
VLSafe Qwen2-VL-7B ASR↓ 20.0% 9.9% −10.1
VLSafe Qwen3-VL-8B ASR↓ 8.4% 3.2% −5.2
VLSafe InternVL3-8B ASR↓ 10.5% 6.5% −4.0
POPE-Adversarial LLaVA-1.5-7B Acc↑ / F1↑ 83.47 / 82.57 84.53 / 84.15 +1.06 / +1.58
POPE-Popular LLaVA-1.5-7B Acc↑ / F1↑ 86.07 / 84.94 87.40 / 86.72 +1.33 / +1.78
POPE-Random LLaVA-1.5-7B Acc↑ / F1↑ 87.90 / 86.65 89.57 / 88.73 +1.67 / +2.08
POPE-Adversarial Qwen2-VL-7B Acc↑ / F1↑ 50.80 / 3.40 80.43 / 76.17 +29.63 / +72.77
POPE-Popular Qwen2-VL-7B Acc↑ / F1↑ 50.83 / 3.41 80.93 / 76.65 +30.10 / +73.24
POPE-Random Qwen2-VL-7B Acc↑ / F1↑ 50.83 / 3.41 81.27 / 77.04 +30.44 / +73.63
HallusionBench LLaVA-1.5-7B aAcc / qAcc / fAcc↑ 44.11 / 17.58 / 16.87 45.17 / 17.58 / 17.37 +1.06 / +0.00 / +0.50
HallusionBench Qwen2-VL-7B aAcc / qAcc / fAcc↑ 55.00 / 26.37 / 29.53 55.62 / 28.57 / 30.27 +0.62 / +2.20 / +0.74

多模态推理(MM-Vet 用 GPT-4o 打分)与视觉中心感知(MMVP 是配对准确率,考核细粒度视觉判别)的结果:推理侧增益温和但方向一致,视觉感知侧在 MMVP 和 RealWorldQA 上出现了全场最大的两个跳变。

基准 模型 指标 Baseline ESC Δ
MM-Vet LLaVA-1.5-7B Score↑ 24.31 25.39 +1.08
MathVista LLaVA-1.5-7B Acc↑ 22.20 23.40 +1.20
MMStar LLaVA-1.5-7B Acc↑ 33.53 34.13 +0.60
MMMU LLaVA-1.5-7B Acc↑ 34.66 34.77 +0.11
AI2D LLaVA-1.5-7B Acc↑ 51.23 53.72 +2.49
MM-Vet Qwen2-VL-7B Score↑ 39.66 40.05 +0.39
MathVista Qwen2-VL-7B Acc↑ 56.10 56.10 +0.00
MMStar Qwen2-VL-7B Acc↑ 55.93 56.07 +0.14
MMMU Qwen2-VL-7B Acc↑ 39.67 40.02 +0.35
AI2D Qwen2-VL-7B Acc↑ 60.98 62.53 +1.55
MMVP LLaVA-1.5-7B Pair Acc↑ 18.67 26.00 +7.33
MMVP Qwen2-VL-7B Pair Acc↑ 41.33 45.33 +4.00
RealWorldQA LLaVA-1.5-7B Acc↑ 53.59 53.86 +0.27
RealWorldQA Qwen2-VL-7B Acc↑ 40.00 54.51 +14.51
BLINK LLaVA-1.5-7B Micro / Macro Acc↑ 41.71 / 42.20 42.14 / 42.61 +0.43 / +0.41
BLINK Qwen2-VL-7B Micro / Macro Acc↑ 49.61 / 50.42 49.61 / 50.44 +0.00 / +0.02

表中列归属按原文正文的叙述对齐(+0.27 与 +14.51 被原文归给 RealWorldQA,+7.33 与 +4.00 归给 MMVP);缓存文本里该表表头存在列分组歧义,且 MMVP 的 Question Acc 列(LLaVA 54.67 → 59.33、Qwen2 69.00 → 70.33)未在上表列出,⚠️ 以原文为准。

消融实验

最核心的一组消融是在完全相同条件下替换"反馈内容",用来验证情绪本身是不是因果因素(目标模型统一 LLaVA-1.5-7B、验证器统一 Gemma3-12B、单条提示、位置一致):

配置 ASR↓ Δ 说明
Baseline(无干预) 71.6% 不做任何修订
VO(只有验证-修订循环) 69.1% −2.5 有校正流程但没有情绪反馈,几乎无效
ZeroCoT 70.1% −1.5 只加"Let's think step by step."
SR(Self-Refine 式提示) 49.3% −22.3 让它复查上一轮答案并给出修正
Corr(通用纠错提示) 48.6% −23.0 让它重新审视并视情况修改
Psych(心理学提示) 54.4% −17.2 只改语气不给情感依据,如"这对我事业很重要"
ESC(Ours) 31.2% −40.4 负低唤醒情绪提示,前置

其余设计变量的取舍(同样在 VLSafe、LLaVA-1.5-7B 上):

变量 设置 ASR↓ 说明
验证器 LLaVA-1.5-7B 自验(内在自校正) 50.3% 明显高于外部验证器,撞上自校正天花板
验证器 Gemma3-12B(默认) 31.2%(Fig. 7(a) 正文记为 40.1%,口径存疑) 原文称其为四者最低
验证器 Qwen3-VL-4B / Qwen2.5-VL-3B / Gemma3-4B 33.9% / 34.0% / 34.3% 小验证器也接近默认,排除知识蒸馏解释
情绪象限 Negative-Low Arousal(默认) 31.2% 最低
情绪象限 Positive-Low Arousal 49.5% 最高,正效价稀释校正信号
插入位置 前置(默认) 31.2% 比后置好 10.5 个百分点
插入位置 后置 41.7%
情绪条数 1(默认) 31.2%
情绪条数 2 25.3% 唯一比默认更优的设置
情绪条数 3 / 4 26.8% / 25.4% 继续加没有进一步收益

审慎度打分(Qwen3-VL-8B-Thinking 的思维链,Gemma-4-26B 按 1–5 分评判,越高越审慎):

条件 均值↑ 中位数↑
Base 3.31 4.00
VO 3.30 4.00
Psych 4.15 4.00
Corr 4.22 4.00
ESC 4.50 5.00

关键发现

  • 情绪是因果因素,流程本身不是:只有验证-修订循环(VO,−2.5)或通用思维链提示(ZeroCoT,−1.5)几乎不改变 ASR,说明收益不来自"多跑一轮";通用纠错类提示能拿到约 22–23 个点的改善,而 ESC 比它们再多出 17 个点以上,证明情绪内容本身在起作用。审慎度打分从另一侧面印证:VO 与基线持平(3.30 vs 3.31),ESC 才真正让思维链变审慎(4.50)。
  • 增益与基线脆弱度正相关:提升最大的三处都发生在基线本身就坏掉的地方——Qwen2-VL 在 POPE 上的坍缩(F1 3.40 → 76.17)、RealWorldQA(+14.51)、MMVP(+4.00 / +7.33);而在 MMMU、MathVista 这类已经较稳的知识密集型基准上,Qwen2-VL 的增益只有 +0.35、+0.00。重要的一点是没有任何一个基准出现下降,说明二选一仲裁确实兜住了"改坏"的风险。
  • 情绪不靠强验证器撑场:3–4B 的小验证器(33.9%–34.3%)已经接近 12B 默认(31.2%),换个说法,把验证器从 12B 缩到 3B 只损失 2–3 个百分点,而把情绪反馈换成通用纠错提示会损失 17 个点以上。
  • 情绪提示有"剂量"效应且非单调:1 条 → 2 条带来 5.9 个点的改善(31.2% → 25.3%),但 3 条(26.8%)与 4 条(25.4%)没有进一步收益,作者据此认为适度强化有益、过度堆叠只增冗余。值得注意的是默认配置仍用 1 条,并未采用消融中最优的 2 条。
  • 情绪类型与位置的排序自洽:负低唤醒 < 负高唤醒/正高唤醒 < 正低唤醒,且随机从四象限采样会稀释校正信号;前置优于后置 10.5 个点,说明情绪要先于问题影响模型对整件事的 framing,而不是事后补一句评论。
  • 数字口径提示:VLSafe 上 ESC 的 ASR 在 Fig. 5 中报 25.3%、在 Tab. 4/7 中报 31.2%;验证器消融中 Gemma3-12B 在正文被记为 40.1%,与 Tab. 4 的 31.2% 不在同一口径上(可能一处含情绪反馈、一处不含)。引用时应锁定具体出处,⚠️ 以原文为准。

亮点与洞察

  • 把"情绪"从被识别的对象翻转成控制信号:以往情感计算关心模型识别得准不准、回复得贴不贴心,这里关心的是情绪能不能当旋钮用。一次概念上的小转身(情绪从能力维度变成控制维度),打开了一条完全不依赖后训练的推理时扩展路线——这是全文最"啊哈"的地方。
  • 用"分歧"而不是"打分"来定义"需要修订":验证器只要重新作答一次,答案不一致就触发修订。这省掉了训练判别器/奖励模型的全部成本,也让验证器可以是任何现成 VLM;同时它天然继承了自校正盲区的教训——把关必须来自另一个模型。
  • 审慎度打分是一个可复用的诊断手段:用第三方模型给思维链打 1–5 分,把"改了答案"和"改了推理方式"这两件事拆开,正好补上了行为指标(ASR/Acc)说不清的机制层。任何做自校正或推理增强的工作都可以照搬这套对照设计。
  • "越修越保守"的反面证据:因为加入二选一仲裁,ESC 在推理与感知基准上没有掉点。这提示自校正系统里"候选选择"应该和"候选生成"分开设计——生成阶段可以激进,选择阶段负责保底。

局限与展望

  • 作者承认的局限不多,主要在结论中把 ESC 定位为"未来可控多模态智能的一个基础",没有展开失效场景。
  • 情绪提示的写法仍是黑盒:Algo. 1 里的 Selection 函数、提醒模板的具体措辞与筛选逻辑主文都没有给出(多处指向附录),而这恰恰是复现与迁移时最敏感的部分。
  • 默认配置并非消融最优:默认 1 条情绪提示对应 31.2% 的 ASR,而 2 条可达 25.3%,论文没有解释为何不采用 2 条;同时 VLSafe 上出现了 25.3%(Fig. 5)与 31.2%(Tab. 4/7)两套读数,读者不宜把两条线的收益混着引用。
  • 对比维度偏弱:表格里的 SR / Corr / VO / Psych 都是本文自己复现的提示式基线,而不是那些需要后训练的自校正方法的原实现,所以"免训练也够好"这一结论缺少同评测协议下的直接对手。
  • 机制解释依赖 affect-as-information 这套心理学类比,证据形态是行为指标加审慎度评分,缺少模型内部表征层面的证据(例如情绪前缀究竟改变了哪些注意力或激活模式)。
  • 安全基准只报 ASR,没有专门报告 over-refusal / helpfulness 指标;多模态推理基准不掉点是有力但间接的证据。
  • 可改进方向:把情绪象限与条数做成自适应选择(如按验证器的分歧程度分配"情绪预算"),或把验证器的判定转成内容更具体的反馈而非固定模板;也可以试着把情绪信号接到 test-time scaling 的算力分配上——只在可疑样本上付第二次生成的钱。

相关工作与启发

  • vs 后训练式自校正(RL / SFT 类,如 VL-Rethinker、RecoT、Sherlock):他们用强化学习或反射轨迹训练把纠错能力"练进"权重里,代价是大规模合成数据、多阶段训练与工程化奖励,且换模型就要重来;ESC 完全不碰权重,只在推理时插一段情绪提示,即插即用且可跨模型迁移。代价是它的提升幅度受限于目标模型本身已有的能力(对知识密集型基准几乎无效)。
  • vs 内在自校正 / 提示式自校正(Self-Refine、ZeroCoT 等):这些方法要么撞上自校正盲区的天花板(本文复现的自验只有 50.3% ASR),要么靠通用纠错指令拿固定收益(约 22–23 个点)。ESC 指出真正的杠杆在反馈的"情绪内容"上,同样单条提示、同样位置,靠内容差异把 ASR 再压低 17 个点以上。
  • vs 幻觉纠正流水线(如 Woodpecker 式的"检测-纠正"):那类方法要专门训练检测器与纠正器,属于模块化流水线;ESC 只用两个现成 VLM 和一句情绪提示,把"检测"简化成了回答不一致这个信号,把"纠正"简化成了重新生成加二选一。
  • vs 情感计算方向的工作(Emotion-LLaMA、EmoBench 等):他们研究模型能不能识别与表达情绪,把情绪当能力维度;ESC 关心的是情绪能不能被当作控制量使用,两者对"情绪"的定义和使用方式完全不同,这也意味着这条线索还有很大探索空间。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 把情绪从"要识别的对象"翻成"可注入的控制信号",并用环状情感模型系统化其选择,视角新且实证扎实
  • 实验充分度: ⭐⭐⭐⭐ 覆盖安全/幻觉/推理/感知四类基准,含反馈内容、验证器、象限、位置、条数、审慎度与跨模型泛化七组分析;但缺同协议下与后训练式自校正方法的直接对比,且个别数字口径不一致
  • 写作质量: ⭐⭐⭐⭐ 逻辑链清楚(观测→发现→框架→消融),方法极简好复现;缺点是关键实现细节(情绪模板、Selection 函数)大量外推到附录,主文对默认超参与读数差异交代不足
  • 价值: ⭐⭐⭐⭐ 提供了一条几乎零成本的推理时可靠性改进路径,且"情绪即控制信号"这个思路可迁移到 LLM 与 agent 场景,工程价值明确