跳转至

FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing

会议: ECCV2026
论文: ECCV 原文
代码: https://github.com/hiixfj/FED-Bench
领域: 图像生成
关键词: 表情编辑、图像编辑基准、解耦评测、跨粒度、数据构建

一句话总结

FED-Bench 用一条"生成候选 → 三极性表情验证 → 双锚保真度排序 → 人工复核定稿"的级联管线造出 747 组(源图 / 编辑指令 / GT)三元组,并提出把评测拆成保真、对齐、相对表情增益三个正交维度、以乘积聚合的 FED-Score,在 18 个编辑模型上同时压住了"直接复制源图"的懒惰编辑与"夸张扭曲"的过拟合编辑。

研究背景与动机

文本引导的图像编辑在扩散模型推动下已经相当成熟:InstructPix2Pix 确立了"在合成配对数据上训条件扩散模型"的主流范式,AnyEdit 引入任务感知路由与专家混合来覆盖更多编辑类型,OmniGen 用单一 Transformer 骨干联合编码图文,Step1X-Edit 靠双流桥接机制提升复杂指令跟随与背景一致性。人脸表情编辑是其中要求格外苛刻的一类——它不只是"把这张脸变开心一点",而是要在严格保住人物身份与背景的前提下,只改动面部肌肉层面的细微运动。现有的编辑评测基准(ImgEdit、EditBench、I2EBench)主要面向通用场景,既缺少高质量人脸样本,也没有为面部肌肉的微动设计对应的编辑指令;更关键的是,它们大多只给一张源图和一条文本指令,不提供 Ground Truth 参考图——没有像素级的锚点,评估就只能停在粗粒度或主观打分上。

数据之外,指标本身还带着系统性偏差。现有图像质量指标一旦权重偏向保真(如 DINO Score),评测就会奖励懒惰编辑(lazy editing):模型直接输出源图,保真分数高得离谱;一旦偏向语义对齐(如 CLIP Score),评测又会奖励过拟合编辑(overfit editing):生成夸张扭曲的表情去迎合提示词,代价是丢掉人物身份。这种偏差不只是让排名失真,还会把后续模型的设计方向带偏——一个只会复制输入图的模型能在排行榜上压过真正做编辑的模型,这个信号本身就是错的。

让这件事现在才可能做的关键使能因素是:编辑模型已经能生成足够逼真的候选目标图,MLLM 又同时具备细粒度视觉差异分析(说得清两张脸之间肌肉怎么动)与自动评判两件事,于是"合成候选 + 多级自动筛选 + 人工复核"这条路径可以批量产出近似 GT 的参考图,不必去等真正配对的野外表情数据。本文据此做了两个互补的设计:一是把候选逐级筛成可信 GT 的级联管线(先降极性做表情验证,再用身份/背景双锚排序,最后人工定稿并回流生成稠密指令),二是放弃"给单一指标调权重"的思路,把"编辑得好不好"拆成互不替代的维度、再用乘积要求它们同时成立。核心 idea:用一条可扩展的级联管线把生成候选筛成带 GT 的 747 组三元组,并用"保真 × 对齐 × 相对表情增益"的乘积式 FED-Score,让任一维度的塌陷都无法被其他维度的高分补偿。

方法详解

整体框架

本文的产出分两块:一块是评测基准 FED-Bench(747 组三元组,外加一条可扩展的 20k+ 训练集),另一块是评测协议 FED-Score。构建侧的输入是野外来源的人脸图(取自 SFEW 2.0 与 DFEW 两个电影片段来源的表情数据集),输出是"源图 / 编辑指令 / GT 目标图"三元组;流程是:先清洗源图,再用编辑模型为每张源图生成其余六类表情的候选目标图,然后依次经过表情验证、保真度排序、人工复核三道漏斗把候选收缩成唯一 GT,最后用 MLLM 对比源图与 GT 生成稠密指令。评测侧则在完整测试集上跑 18 个编辑模型,每个模型在简单指令与稠密指令两种粒度下各评一次,按保真、对齐、相对表情增益三个维度打分后合成 FED-Score。整条管线不依赖人工逐张绘制 GT,因此可以按同一配方放大:把源图池换成 RAF 与 DFEW 的 2 万余张野外人脸、生成器换成 Qwen-Image-Edit-2511,就得到论文发布的 20k+ 训练集。

"跨粒度"落在哪里:论文没有给这个说法逐条下定义,但从协议构成能看到它同时在三个地方跨越尺度。一是度量尺度——背景一致性落在像素级(面部掩码外的 RMSE)、身份保持落在特征级(ArcFace 嵌入余弦)、表情变化幅度落在感知级(面部裁剪上的 LPIPS)、语义层面交给 MLLM 打分,从像素到语义四档并用。二是信号来源——规则计算(ID、BG、REG)与模型感知(PQ、SC、GTA)混合,论文原文的表述正是"把规则度量与 MLLM 的感知能力深度整合"。三是指令粒度——每个三元组同时配一条模板式简单指令和一条稠密指令,评测在两种粒度下各跑一遍,用来暴露模型在不同控制精度下的能力落差。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["源图筛选<br/>SFEW 2.0 + DFEW"] --> B["候选表情验证<br/>三极性归约 + 多模型投票"]
    B --> C["GT 定稿<br/>双锚排序 + 人工复核 + 稠密指令"]
    C --> D["FED-Bench<br/>747 组三元组"]
    D --> E["FED-Score 三维解耦<br/>保真 × 对齐 × 相对表情增益"]
    E -->|第三维展开| F["相对表情增益 REG<br/>以 GT 为锚的高斯惩罚"]
    E --> G["18 个模型排名<br/>保真-对齐权衡与瓶颈"]

关键设计

1. 候选表情验证:把 7 类表情降成 3 极性,再用多模型投票把自动筛选做到可用

候选目标图是生成模型造出来的,必须验证它真的表达出了目标表情,否则整条管线的产物就是一堆"指令说变开心、图还是原表情"的废样本。但野外人脸(电影片段、遮挡、极端光照)上专家 FER 模型几乎失效:BEiT、Luxand、DeepFace 在 7 类上分别只有 35.7%、39.8%、36.5% 的精度,连最强的 MLLM——Gemini-2.5-Pro——也只有 64.93%。按这个精度硬筛,会把大量其实有效的样本当成失败案例丢掉;放宽阈值,又会让错误表情混进 GT。

本文的办法是放弃细分类别、只判极性:把七类表情归约成 Positive(happy)、Neutral、Negative(其余五类)三个极性,最高精度立刻从 64.93% 抬到 81.23%;再叠一个多模型投票集成,5 模型配置(Gemini-2.5-Pro、GLM-4.6V、Kimi-K2.5、ERNIE-5.0、Step-3;粗粒度版把 Step-3 换成 Doubao-seed-1.6-vision)把粗粒度最佳精度推到 84.87%、平均 82.27%。这样有效的原因在于需求与模型能力的匹配:筛选阶段只需要回答"表情是否真的变了、变到了正向还是负向",极性判别正好是这个粒度,而七类细分超出了当前 MLLM 在野外数据上的可靠范围;投票则把单模型的随机误判摊平。代价是这一层只保证"极性对了",三极性内部仍可能把 surprise 认成 happy,这类残留误差交给下一层的保真度排序和人工复核兜住。

2. GT 定稿:双锚保真度排序、人工复核与稠密指令回流

每张源图有六个候选(其余六类表情各一个),过完表情验证后常常还剩好几个,需要挑出最像"同一张脸、只换了表情"的那张。本文用两个互补的"该保持不变的东西"做锚点:一是用预训练人脸识别网络 ArcFace 提身份特征、算源图与候选图的余弦相似度(身份保持 \(S_{\text{id}}\)),二是在面部掩码之外的像素上算 RMSE(背景一致性 \(S_{\text{bg}}\));两者各自归一化后加权融合成保真总分,按降序只保留 top-2 进入人工环节。人工这一步不是形式主义——自动筛选看不出微妙的面部动态和细微伪影,所以先让 MLLM 为每个候选写一段详细的表情描述作为客观参照,再由三位标注者独立检查候选对的表情自然度、指令对齐度、身份与背景保持度,多数投票定出唯一 GT。

定稿之后还有一个回流步骤:把源图与 GT 一起送进 MLLM 做视觉差异分析(面部肌肉怎么动、眼形曲率怎么变、嘴部开还是合),据此为每个三元组生成一条高度描述性的稠密编辑指令,与早期筛选阶段用的模板指令"change the expression from {src_emotion} to {trg_emotion}"并存。这条稠密指令有两个用途:对生成模型是更精细的控制信号,对评测是更难的一档语言输入——它把"指令跟随能力"从"能不能听懂 happy"抬到"能不能落实嘴角上扬成微笑、眼睛略微眯起、上牙可见"。

3. FED-Score 三维解耦:把评估拆成正交三维,再用乘积要求它们同时成立

单一指标必然可以被钻空子:只看保真就奖励懒惰编辑(直接复制源图,ID 与 BG 接近满分),只看对齐就奖励过拟合编辑(把表情画得夸张扭曲去刷语义相似度)。本文不去给指标调权重找平衡点,而是把"编辑得好"拆成三件互不替代的事,再要求它们同时成立。三个维度分别是:保真度 \(S_{\text{fid}}\)、对齐度 \(S_{\text{align}}\)、相对表情增益 \(S_{\text{reg}}\)(第三维的机制见下一个设计)。

保真度由三项等权平均:身份保持 ID 是源图与生成图的 ArcFace 嵌入余弦相似度,背景一致 BG 是面部掩码外像素的 RMSE 经归一化函数转成"越大越好",感知质量 PQ 则由 MLLM 检查伪影与退化。对齐度由两项等权平均:语义一致性 SC 让 MLLM 判断生成图与输入指令的匹配程度;GT-based 表情对齐 GTA 直接把生成图与我们造出的 GT 参考图交给 MLLM 比对表情相似度——这是有 GT 之后才能做的一档监督,比纯文本对齐可靠得多,因为它绕过了"文本描述与表情之间本来就不精确"这一层损耗。三维合成总分用的是乘积而非加权和:

\[\text{FED-Score}=\mathcal{S}_{\text{fid}}\times\mathcal{S}_{\text{align}}\times\mathcal{S}_{\text{reg}}\]

乘积的含义是:任何一维接近 0 都会把总分压到接近 0,模型无法用某一维的高分补偿另一维的崩坏——这恰好是懒惰编辑和过拟合编辑在加权和里能拿高分的原因。Tab. 3d 的消融也支持这种"缺一不可":去掉任意一维,与人类判断的一致性都下降。

4. 相对表情增益 REG:用 GT 归一化改动幅度,同时惩罚懒惰与过拟合

即使补上保真与对齐,懒惰编辑的漏洞仍在:输出源图时 ID 和 BG 完美,而对齐打分对"只动了一点点"也不敏感——一句"把这张脸变开心",几乎没笑的微笑同样能通过语义匹配。本文于是直接量"到底改了多少",且这个量必须相对 GT 才有意义。做法是用 LPIPS 算面部裁剪上源图到生成图的感知距离,再用源图到 GT 的距离归一化,得到比值 \(r\)\(r=1\) 表示改动幅度与 GT 一致。为了让这个维度自己不至于变成"改得越多越好",最终分数取中心在 1.0 的高斯型惩罚:

\[\mathcal{S}_{\text{reg}}=\exp\!\left(-\frac{(r-1)^2}{2\sigma^2}\right),\qquad r=\frac{\text{LPIPS}_{\text{face}}(I_{\text{src}},I_{\text{trg}})}{\text{LPIPS}_{\text{face}}(I_{\text{src}},I_{\text{gt}})}\]

\(\sigma\) 控制容差宽度,实验中取 0.5。这样一来 \(r\ll1\) 的懒惰编辑与 \(r\gg1\) 的过拟合编辑同时被压分,只有改动幅度与 GT 匹配才拿满分 1.0——一个指标同时封住了两种失衡。Tab. 3b 的验证显示这个比值型指标确实比别的更贴合人的判断:LPIPS-Ratio_F 一致性 0.7386,高于 LPIPS_F,GT(0.7045)、DINO_F,GT(0.6818)与另一个比值型指标 RPM-Modify_F(0.6154);而身份导向的 ArcFace_F,GT(0.5455)、CLIP-I_F,GT(0.5909)掉到接近随机,说明它们的特征空间根本不刻画表情变化幅度。作者同时标出了边界:REG 量的是面部区域感知变化的强度,是"表情改变强度"的代理量而非动作单元(AU)级别的语义度量,LPIPS 比值会顺带吸收一部分纹理与光照变化,论文在补充材料里用 AU 度量做了对照。

一个完整示例

以一张通过清洗的 neutral 源图为例(具体数字为示意)。候选生成阶段,Nano Banana 按模板生成其余六类表情各一张,共 6 个候选;表情验证阶段,三极性归约后 6 个候选被判为 1 个正向、3 个负向、2 个中性而被丢弃(其中一个是模型压根没改动表情),5 模型投票确认后剩 4 个候选;保真度排序用 ArcFace 余弦与背景 RMSE 加权打分,取 top-2;三位标注者人工复核后多数投票定下 happy 候选为 GT,另一位候选被淘汰;定稿后 MLLM 对比源图与 GT,写出"嘴角上扬成微笑、眼睛略微眯起、上牙可见"这类稠密指令。评测时假设某模型对该源图的输出与源图的面部 LPIPS 距离只有 GT 的一半,则 \(r\approx0.5\)、REG 得 \(\exp(-0.5)\approx0.61\)——即便它的 ID 与 BG 都接近满分,总分也会被这一维拖下来。

损失函数 / 训练策略

本文的评测部分是纯推理的评测协议,不涉及训练;训练侧唯一的动作是验证数据构建范式的可扩展性:用 Qwen-Image-Edit-2511 在 RAF 与 DFEW 的 20k+ 野外人脸上按同一套配方造出训练对,再拿它微调 FLUX-Kontext-Dev,得到 FLUX-Kontext-FED。论文只说明微调显著提升表情精度与保真度,未给出学习率、步数等超参细节。

实验关键数据

主实验

指标可靠性用 2AFC 人类研究验证:随机抽 2,760 对编辑结果(同一源图与指令下两个不同模型的输出),三位标注者各自从身份保持、表情变化幅度、整体质量三个角度选更好的那张,多数投票作为人类共识,再统计各指标偏好与人类共识的一致率。

评测维度 指标 与人类判断一致性 Acc.
身份保持 ArcFace_F 0.6606
身份保持 DINO_F 0.6596
身份保持 LPIPS_F 0.6528
身份保持 CLIP-T_F 0.5420
表情变化幅度 LPIPS-Ratio_F(本文 REG) 0.7386
表情变化幅度 LPIPS_F,GT 0.7045
表情变化幅度 DINO_F,GT 0.6818
表情变化幅度 RPM-Modify_F 0.6154
表情变化幅度 ArcFace_F,GT 0.5455
整体质量 FED-Score(本文) 0.7700
整体质量 CLIP-I_GT 0.6850
整体质量 CLIP-I 0.6325
整体质量 CLIP-T 0.4480

18 个编辑模型在 FED-Bench 完整测试集上的排名(Dense = 稠密指令,Simple = 简单指令;ID 越高越好,REG 最优为 1.0):

方法 Dense Score Dense ID Dense REG Dense GTA Simple Score Simple REG
Qwen-image-edit-plus .469 .58 1.18 5.7 .492 1.13
SeedDream 4.0 .379 .62 1.37 4.3 .413 1.26
FLUX.2 Pro .377 .58 1.37 4.0 .400 1.37
Qwen-image-edit .337 .45 1.37 4.2 .343 1.37
FLUX-Kontext-FED(本文微调) .332 .68 0.95 3.4 .325 0.96
FLUX-Kontext-Pro .327 .52 0.99 3.5 .227 0.97
FLUX-Kontext-Max .320 .50 1.07 3.5 .259 1.03
Qwen-image-edit-2511 .317 .46 1.43 3.4 .361 1.42
Step1X v1p2 .303 .56 1.31 3.0 .333 1.41
FLUX-Kontext-Dev .243 .72 0.67 3.0 .120 0.35
SeedEdit 3.0 .203 .49 1.55 1.9 .239 1.56
UniWorld-v2 .201 .37 1.45 2.5 .110 1.60
DreamOmni2 .168 .81 0.45 2.6 .049 1.40
OmniGen2 .155 .56 1.52 2.6 .122 1.61
FLUX-Kontext-Fill .155 .11 1.56 1.7 .096 1.52
Step1X .127 .33 1.72 1.3 .149 1.67
Bagel .115 .42 1.57 1.8 .163 1.29
InstructPix2Pix .001 .08 2.56 0.0 .004 2.42

消融实验

FED-Score 各维度的消融(同样按与人类判断的一致性衡量):

配置 一致性 Acc. 说明
FED-Score(完整) 0.7700 完整协议
w/o REG 0.7577 去掉相对表情增益,降 0.0123
w/o Rule 0.7422 去掉全部规则度量(ID / BG / REG),降 0.0278
w/o Fidelity 0.7379 去掉保真维度,降 0.0321
w/o Alignment 0.7279 去掉对齐维度,降 0.0421
w/o Model 0.7202 去掉 MLLM 打分(PQ / SC / GTA),降 0.0498

数据管线里"表情验证"一层的两级设计(极性归约、投票集成)各自的效果:

配置 7 类细粒度 Best / Avg 3 极性粗粒度 Best / Avg
专家 FER(BEiT / Luxand / DeepFace) 35.7 / 39.8 / 36.5
单模型最佳(Gemini-2.5-Pro) 64.93 81.23
3 模型投票 66.13 / 59.94 84.47 / 81.04
5 模型投票 66.67 / 61.75 84.87 / 82.27
7 模型投票 66.00 / 62.78 84.61 / 82.88
9 模型投票 63.99 / 63.25 83.40 / 82.90

关键发现

  • 没有模型能同时做到高保真和高对齐,这正是 FED-Score 想暴露的东西。FLUX-Kontext-Dev 与 DreamOmni2 拿到了最高的身份保持(ID 分别为 .72 和 .81),但 REG 只有 0.67 和 0.45——典型的懒惰编辑:靠几乎不改表情来保住身份。反方向的 InstructPix2Pix 是教科书式的过拟合编辑,REG 高达 2.56 而感知质量 PQ 掉到 0.0,总分行几乎归零(.001)。FLUX-Kontext-Fill 则是第三种失效模式:背景一致性(BG 5.1)与感知质量(PQ 9.9)最好,但身份保持最差(ID .11),生成了一张高质量但已经换了人的脸。只看单指标的话,懒惰编辑者会凭 ID 或 BG 被排到榜首。
  • 细粒度指令跟随是当前的主要瓶颈。对齐类指标(SC、GTA)在两种指令粒度之间波动最大:FLUX-Kontext-Pro 从 Dense 切到 Simple 时 SC 几乎减半,说明它过度依赖稠密指令里的详细信息;FLUX-Kontext-Dev 的懒惰倾向在简单指令下进一步恶化(REG 从 0.67 掉到 0.35)。前 3 名的排序在两种设置下保持稳定(Qwen-image-edit-plus、SeedDream 4.0、FLUX.2 Pro),说明头部模型具备的是通用编辑能力,而不是只擅长某一档指令粒度。
  • 发布的数据确实有用:只用 20k+ 合成训练对微调 FLUX-Kontext-Dev 得到 FLUX-Kontext-FED,稠密指令下从第 10 名升到第 5 名(.243 → .332),简单指令下从第 14 名升到第 7 名(.120 → .325),且 REG 从 0.67/0.35 提到 0.95/0.96,正落在理想值 1.0 附近,说明懒惰编辑的毛病被数据纠正了。
  • 消融里最不能少的是 MLLM 打分:去掉 PQ/SC/GTA 后一致性掉到 0.7202(降 0.0498),比去掉任一规则维度都多,说明感知质量与语义一致性不是规则计算能替代的;反过来 w/o Rule(0.7422)也明显低于完整版,说明即便有强 MLLM,身份与背景的客观度量仍有独立价值。REG 单删的影响最小(0.7577),符合预期——它专门针对"表情变化幅度"这一维,在身份导向与质量导向的对比对里本来就不常被用到。
  • 文本-图像相似度指标在这类任务上不可靠:CLIP-T_F 在身份维度只有 0.5420,CLIP-T 在整体质量上甚至只有 0.4480,低于随机基线 0.5;而所有"与 GT 比较"的变体都稳定优于对应的"源图-目标图比较"版本,印证了 GT 参考对评测的价值。

亮点与洞察

  • 用"降极性"绕开模型能力上限,是一个可迁移的筛选设计。当自动判别模型的细粒度精度不够时(7 类 64.93%),硬筛会同时损失召回和精度;把判别目标降到一个模型真正可靠的粒度(3 极性 84.87%)再做投票,就能在"筛得干净"和"筛得够多"之间取得可用点。任何需要 LLM/MLLM 做数据质检的管线都可以照搬这个思路:先问"我到底需要多细的判别",再问"模型在这个粒度上够不够稳"。
  • REG 用"比值 + 高斯惩罚"而不是"距离本身"来度量改动幅度,是整个协议里最巧的一步。如果直接用与 GT 的感知距离,模型会被鼓励"改得越像越好",仍然可以靠过度夸张去逼近;而把分值孤立在"幅度比 = 1"这一个点上,就把懒惰(比 <1)与过拟合(比 >1)两种相反的失效拉到了同一个漏斗里,也让这个指标不依赖任何绝对尺度。
  • 乘积聚合把"均衡"写进了协议本身。加权和永远可以被单维高分补偿,而乘积让任何一维塌陷都直接否决总分——这让排行榜不再奖励"把某一方面做到极端"的模型。这个聚合方式可以直接迁移到任何多维度质量评估(如视频生成的质量/一致性/运动幅度,或 Agent 的正确性/效率/安全性)。
  • 稠密指令回流是个低成本的附加价值:GT 已经造好了,顺手让 MLLM 对比源图和 GT 写一条详细指令,就同时得到了更细的控制信号和更难的一档评测输入。这种"让已有标注顺带产出第二份监督"的做法在数据集构建里很值得复用。

局限与展望

  • 作者明确承认:参考图是伪 GT——由编辑模型合成、而不是拍自同一人物的真实配对,所以每组数据只代表"一种合理的目标表情",不是唯一答案。补充材料里的鲁棒性分析显示,替换参考图生成器和 MLLM 裁判后模型排名保持稳定,但这一层根本的不确定性(一位人物做同一个表情可以有多种合理呈现)并没有被消除;收集真正配对的表情数据仍是未来工作。
  • REG 是感知层面的代理量,会吸收纹理与光照变化,与 AU 级别的语义度量并不等价。这意味着一个"改了光照但对表情改动幅度恰好匹配"的结果可能被误判为合理;论文只在补充材料里给了与 AU 的对照,主文没有给出这一偏差的量级。
  • 基准规模偏小(747 组),且源图全部来自 SFEW 2.0 与 DFEW 两个电影来源的数据集,人脸分布偏向影视场景与特定人群;对自拍、监控、动画风格等分布没有覆盖。评测只覆盖七类基本表情,复合表情(如"惊喜交加")与强度分级(微笑 vs 大笑)都不在范围内,而后者恰恰是用户指令里最常出现的模糊地带。
  • 评分的三大感知分量(PQ、SC、GTA)统一由 Gemini-2.5-Pro 一个模型担任,存在单一裁判的偏置风险;换裁判是否稳定只在补充材料中做了讨论,主实验没有多裁判的交叉验证。
  • 一个可改进的方向:把 REG 的"幅度比"从 LPIPS 换成对面部动作单元(AU)强度的估计,既保留比值形式又让代理量更贴近表情语义;另外可以给每个三元组配多个合理 GT,把评测从"与唯一参考比对"改成"与一组参考的分布比对",从根上处理伪 GT 的多解问题。

相关工作与启发

  • vs ImgEdit / EditBench / I2EBench:它们面向通用编辑(增删物体、颜色改换、全局风格迁移),只给源图与指令;FED-Bench 专门面向人脸表情,提供高质量野外源图、为面部微动设计的指令,以及最关键的一副 GT 参考图。差异带来的后果是直接的:没有 GT 就只能用 CLIP/DINO 这类无参考指标,而这类指标恰恰是懒惰编辑与过拟合编辑的温床。
  • vs MagicBrush / HQ-Edit / AnyEdit(数据侧):这些数据集靠人工标注或合成流水线覆盖通用编辑操作,规模更大,但没有针对表情这一细粒度任务做筛选。FED-Bench 的取舍相反——只有 747 组,但每一组都经过表情验证、身份/背景双锚排序和三个人工复核,是"小而可信"的取舍。
  • vs VIEScore(指标侧):本文的 MLLM 评分框架(PQ / SC / GTA)直接受 VIEScore 启发,都是让 MLLM 当裁判;区别在于 FED-Bench 把 MLLM 打分与规则度量(ArcFace 身份、背景 RMSE、LPIPS 比值)混在一起,并用乘积强制各维度共同成立,而不是把全部权重交给一个(可能存在系统性偏好的)模型裁判。
  • vs MagicFace / LaTo(方法侧):它们用动作单元增量或人脸关键点这类结构化几何条件做细粒度表情编辑,效果扎实但依赖监督标签或几何先验,无法直接吃自然语言指令;本文不提出新的编辑模型,而是提供评测与训练数据,FLUX-Kontext-FED 的微调结果说明这批数据能反过来提升通用指令编辑模型。

评分

  • 新颖性: ⭐⭐⭐⭐ [第一个带 GT 参考的细粒度表情编辑基准,REG 用"比值 + 高斯惩罚"同时封住懒惰与过拟合两种失效,问题定位准、方案不花哨但切中要害]
  • 实验充分度: ⭐⭐⭐⭐ [18 个模型 × 两种指令粒度 + 2,760 对 2AFC 人类验证 + 完整维度消融 + 数据管线内部两级消融,规模扎实;不足是感知分量只用单一 MLLM 裁判、REG 与 AU 的对照放在补充材料]
  • 写作质量: ⭐⭐⭐⭐ [动机里"懒惰编辑 vs 过拟合编辑"的对立讲得很清楚,协议每维度的定义与消融互相印证;表格排版的 OCR 质量一般,个别公式在原文排版中已损坏]
  • 价值: ⭐⭐⭐⭐ [数据 + 评测 + 20k 训练集三件套齐备且已开源,懒惰/过拟合两种失效的诊断方式对所有做编辑评测的工作都有直接参考价值,主要折扣来自伪 GT 与 747 的小规模]