跳转至

Q-REAL: Towards Naturalness and Distortion Evaluation for AI-Generated Content

会议: ECCV 2026
论文: ECCV 原文
数据集: Hugging Face
领域: AIGC 检测
关键词: AIGC质量评价、细粒度评测、自然度与失真、多模态大模型、视觉定位推理

一句话总结

针对文生图质量评估仅依赖单标量评分且缺乏可解释归因信号的缺陷,本文提出了包含10K张图像、3.2万余个实体级问答与归因描述的细粒度基准Q-Real,并构建了“对象判别-全图定位推理-CoT质量回归”三阶段训练管线,显著提升了多模态大模型在AI生成图像瑕疵检测与可解释质量评分上的综合能力。

研究背景与动机

随着扩散模型与自回归生成模型的迅猛发展,以Flux、Kolors、SD3.5为代表的前沿文生图算法在照片级真实感生成上取得了瞩目突破。然而,生成图像中依然频繁出现肢体解剖结构异常、物理纹理违和以及典型“AI假感(AI look)”等瑕疵。现有的生成内容质量评估(IQA)体系与基准(如AGIQA-3K、Pick-a-Pic、Q-Eval-100K等)大多将复杂的视觉感知压缩为单一的标量均值意见分(MOS)或两两偏好排序,缺乏对图像内部局部缺陷位置与生成机理的具象解释,难以直接为底层生成模型的针对性迭代优化提供反馈信号。

实现细粒度质量评估的核心矛盾在于评估维度的正交拆解与高精细局部标注成本之间的失衡。一方面,真实感生成图像的缺陷往往兼具感知真实度与底层结构退化两个层面,既往方法(如RichHF-18K、FakeXplain、X-AIGD)要么仅依赖粗糙的热力图无法提供显式语义归因,要么缺乏结构化判别问题与空间定位的统一建模;另一方面,全图实体级别的多维度缺陷定位与主观成因分析需要极其庞大的人工标注成本,单纯依赖人工或单纯依赖大模型生成都会面临效率低下或严重幻觉的困境。

本文的切入角度是:将真实感AIGC评测解耦为互补的“自然度(Naturalness)”与“失真度(Distortion)”两大物理正交维度,构建自动化提取与多审校员仲裁协同的高质标注闭环。核心 idea:构建包含10K图与32.8K实体的双维度细粒度基准Q-Real,并设计“对象级判别预热 \(\to\) 全图缺陷检测与推理描述 \(\to\) 训练推理一致的动态CoT评分”三阶段渐进式MLLM微调范式,使模型兼备局部缺陷定位、细粒度成因归因与全局精确评分能力。

方法详解

整体框架

Q-Real围绕“高质量细粒度评测数据构建”与“全能力MLLM多阶段微调”展开。整个评测体系涵盖实体级二值问答(ObjectQA)与全图缺陷定位推理(ImageQA)两大互补任务,训练流程则遵循从简单单实体二值分类判别,到全图多实体缺陷边界框回归与因果描述,最终将推理痕迹作为动态思维链(CoT)注入质量评分器的渐进式演化逻辑。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["文生图样本库<br/>Q-Eval-100K子集 + 顶尖模型新生成"] --> B["半自动化协同标注流水线<br/>GPT-4o命名 + Grounding DINO检测 + 三审校机制"]
    B --> C["Q-Real基准与数据集<br/>10K图像 / 32,815实体 / 自然度与失真双维度"]
    C --> D["阶段1:对象级判别预训练<br/>单实体6项二值QA微调,建立基础缺陷认知"]
    D --> E["阶段2:细粒度定位与因果推理微调<br/>全图缺陷实体筛选 + 边界框回归 + 详细解释生成"]
    E --> F["阶段3:推理一致性CoT质量评分<br/>阶段2动态缺陷上下文 + 5级评级Token期望回归"]
    F --> G["多任务输出<br/>实体判别 + 缺陷定位 + 成因分析 + 连续质量分"]

关键设计

1. 半自动化人机协同标注流水线:解耦双维度与多审校仲裁

针对多实体、多维度细粒度标注成本高昂且大模型易出现视觉幻觉的问题,Q-Real设计了五步级联标注协议。首先利用GPT-4o联合图像与Prompt提取全图主要实体名称;随后引入开集目标检测器Grounding DINO进行精准框级定位,过滤掉低置信度及微小模糊目标;接着调用预训练Q-Eval-Score评估目标局部质量分,以此分值作为强先验先导Prompt引导GPT-4o生成针对“自然度”与“失真度”的初步客观判别问题与主观解释。最后引入严格的人工校验流程:质检员核对并修正实体边界与错标;3位独立标注员盲审描述并补充遗漏,若原描述有误则重写并对6个客观问题进行独立投票,以多数决(Majority Voting)锁定真实标签,并在400张精细人像上进一步细化人脸、手部、肢体、躯干、衣物五大子维度的形变标记。

自然度维度聚焦于颜色搭配、全局光照与材质真实感,辨识是否具有明显的“AI感”;失真度维度则严格审视结构配置异常、几何形变、物理材质不符及乱码文本等退化。该流程系统性建立了涵盖32,815个实体的双维度多任务基准。

2. 空间定位匹配与语义因果评测基准:Q-Real Bench

为了全面评测MLLM在AIGC细粒度质量评估上的真实水平,Q-Real Bench设计了两种梯度的评测范式。在实体级客观判别任务(ObjectQA)中,针对每个提取出的目标分别提出2个自然度问题与4个失真度问题,直接采用准确率(Acc)、精确率(Precision)、F1分数与ROC曲线下面积(AUC)进行二值分类能力检验。

在全图定位与描述任务(ImageQA)中,模型需要自主定位出所有存在瑕疵的目标边界框并生成缺陷描述文本。为了排除传统检测中多目标匹配的偶然性,评估在预测框集 \(P=\{p_i\}_{i=1}^N\) 与真值框集 \(G=\{g_j\}_{j=1}^M\) 之间构建二分图坐标重叠代价矩阵 \(C \in \mathbb{R}^{N \times M}\),利用匈牙利算法求解最优匹配置换:

\[C_{ij} = 1 - \text{IoU}(p_i, g_j)\]

在此基础上,定义了兼顾空间与语义一致性的严格检测率指标(Detection Rate):只有当预测框与真值框的最优匹配 \(\text{IoU} > 0.5\),且经由GPT-4o评测的描述语义一致性得分 \(\text{LLM-Score} > 0.5\) 时,该瑕疵区域才被计为成功检测。

3. 渐进式三阶段微调与训练-推理一致性(TIC)驱动的质量评分

通用MLLM在未经领域微调时往往“能检全实体却分不清好坏”,导致检测率极低。本方法提出了三阶段渐进式训练方案。阶段1在对象裁剪尺度上进行6个判别QA的预训练,为MLLM注入底层视觉感知对缺陷的判别敏锐度;阶段2输入整图,要求模型仅定位存在自然度或失真缺陷的瑕疵实体,输出 <label><coordinate><description>,完成从“局部二值判断”向“全图开放定位推理”的能力迁移。

阶段3将细粒度归因能力升华为全局质量评分器(Q-Real-Score)。模型不仅被要求输出质量评级,更需要将阶段2生成的缺陷定位与描述 <detected_issues> 动态插入作为思维链(CoT)前置参考。关键设计在于训练-推理一致性策略(TIC):训练阶段3时不直接借用人工标注的真值瑕疵信息,而是直接使用阶段2微调好的检查模型动态推理生成缺陷上下文,彻底抹平了训练期拥有“完美真值引导”而推理期依赖“自身嘈杂预测”带来的分布漂移。

损失函数 / 训练策略

在第三阶段的连续质量分数预测中,为了克服直接数值回归破坏语言模型表征空间的问题,将连续主观意见分(MOS,范围 \([1, 5]\))离散化映射为5个评级词元(Rating Tokens):\(\mathcal{R} = \{\text{Bad}, \text{Poor}, \text{Fair}, \text{Good}, \text{Excellent}\}\),对应分段权重 \(w_j \in \{0, 0.25, 0.5, 0.75, 1.0\}\)

推理时提取这5个特定Token的Logits \(z_j\),经过Softmax归一化得到概率分布 \(p_j = \frac{\exp(z_j)}{\sum_{k=1}^5 \exp(z_k)}\),并通过加权期望重构连续质量估计分 \(\hat{r} = \sum_{j=1}^5 p_j \cdot w_j\)。模型采用多任务联合损失进行端到端LoRA微调:

\[\mathcal{L} = \alpha \mathcal{L}_{CE} + \beta \mathcal{L}_{MSE}\]

其中 \(\mathcal{L}_{CE} = -\sum_{i=1}^{N_{ans}} y_i \log(p_i)\) 负责监督问答词元的语义生成,\(\mathcal{L}_{MSE} = (\hat{r} - r_{MOS})^2\) 显式拉近加权期望分数与真实MOS标签 \(r_{MOS}\) 之间的数值误差。默认超参数设为 \(\alpha = 1, \beta = 1\)

实验关键数据

主实验

实验采用Qwen3-VL-8B、InternVL3-8B等先进开源骨干网,并在Q-Real Bench上同GPT-5.4、Gemini3.1-Pro等顶级闭源模型以及Q-Eval-Score进行全面横向对比。

表1:Q-Real Bench 上 ImageQA 任务的缺陷定位与描述对比(原论文 Table 2)

模型配置 自然度 IoU 自然度 Detection Rate 自然度 LLM Score 失真度 IoU 失真度 Detection Rate 失真度 LLM Score
GPT-5.4 0.700 0.069 0.439 0.661 0.063 0.197
Gemini3.1-Pro 0.752 0.481 0.376 0.820 0.136 0.431
Q-Eval-Score 0.835 0.165 0.353 0.838 0.038 0.249
Qwen3-VL-8B (Zero-Shot) 0.848 0.313 0.435 0.848 0.206 0.341
Qwen3-VL-8B (Q-Real微调) 0.834 0.548 (+23.5%) 0.722 (+28.7%) 0.832 0.523 (+31.7%) 0.639 (+29.8%)
InternVL3-8B (Zero-Shot) 0.888 0.060 0.230 0.878 0.274 0.413
InternVL3-8B (Q-Real微调) 0.829 0.527 (+46.7%) 0.737 (+50.7%) 0.825 0.481 (+20.7%) 0.645 (+23.2%)

表2:生成图像质量评估跨数据集泛化性能(原论文 Table 3)

评估模型 Q-Real (SRCC ↑) Q-Real (PLCC ↑) AGIQA-3K (SRCC ↑) AGIQA-3K (PLCC ↑) ImageReward (Acc ↑)
CLIP-IQA 0.264 0.262 0.074 0.088 0.493
IPCE 0.631 0.636 0.074 0.057 0.495
Q-Align 0.651 0.644 0.587 0.582 0.601
Q-Eval-Score 0.690 0.693 0.572 0.558 0.556
Q-Real-Score (本文) 0.710 0.720 0.608 0.611 0.607

消融实验

消融实验围绕第三阶段中的提示词设计策略进行,验证自然度缺陷CoT(N-CoT)、失真度缺陷CoT(D-CoT)以及训练-推理一致性(TIC)的核心贡献。

表3:第三阶段评分提示词策略与训练推理一致性消融(原论文 Table 6)

自然度CoT (N-CoT) 失真度CoT (D-CoT) 训练-推理一致性 (TIC) Q-Real SRCC Q-Real PLCC AGIQA-3K SRCC AGIQA-3K PLCC ImageReward Acc
- 0.700 0.694 0.570 0.598 0.558
- 0.696 0.700 0.576 0.601 0.560
- 0.692 0.686 0.550 0.574 0.557
0.710 0.720 0.608 0.611 0.607

关键发现

  • 失真度感知对质量评分相关性贡献更大:从表3消融可知,仅使用失真度CoT(D-CoT)相比仅使用自然度CoT(N-CoT)在Q-Real自身测试集上SRCC更高(0.700 vs 0.696),说明人体肢体畸变、纹理错乱等硬性结构失真比单纯的光影色调假感对人类主观质量评判的负面冲击更为强烈。
  • 训练-推理一致性(TIC)是防范性能崩塌的关键机制:当移除TIC而直接使用真值缺陷进行阶段3训练时,在测试阶段由于只能依赖模型自身的缺陷预测,模型产生明显的分布不适,Q-Real上的SRCC急剧下跌至0.692,AGIQA-3K的SRCC从0.608骤降至0.550。
  • 开源MLLM在微调后大幅反超闭源商业标杆:通用前沿闭源模型(如GPT-5.4在自然度Detection Rate仅0.069,失真度Detection Rate仅0.063)存在严重的“盲目全图框选而无法区分好坏”的盲区;经过Q-Real阶段2微调后,Qwen3-VL-8B的Detection Rate分别提升至0.548和0.523,LLM-Score突破0.72,实现了定位与因果推理的跨越式质变。

亮点与洞察

  • 解耦“自然度”与“失真度”双维度:明确划分了高层语义真实感(AI感/质感)与底层像素几何结构退化(肢体错位/模糊),使生成模型不仅知道“得分低”,还能明晰究竟是画风假还是解剖结构崩塌。
  • 训练-推理一致性(TIC)的数据构造理念:在阶段3质量评分微调时,主动摒弃干净的Ground-Truth缺陷,改用微调后阶段2模型在线推理出的带噪上下文作为Prompt输入,构筑了极强的推理鲁棒性。
  • 可复用的多模态质检-定位评估范式:结合匈牙利匹配与LLM-as-a-Judge的Detection Rate指标,为未来多模态大模型的视觉定位联合因果解释(Grounding with Reasoning)任务提供了标准化的评估工具链。

局限与展望

  • 作者承认的局限:尽管构建了多审校与众包验证流程,部分极度抽象的艺术风格自然度判定依然带有一定的人民主观色彩;目前精细人像结构解剖分析仅覆盖了400张图像,规模仍有待扩充。
  • 自主发现的局限:Q-Real目前仅专注于单图生成的静态图像真实感质检,未涉及序列生成与文生视频(T2V)的时序连贯性、动态物理规律违背等时空失真评测。
  • 未来改进方向:可进一步将定位出的缺陷实体与扩散模型的跨注意力图(Cross-Attention Map)或反向去噪过程结合,将离线质检模型转化为即插即用的强化学习奖励模型(RLHF / DPO Critic)以实现在线引导优化。

相关工作与启发

  • vs RichHF-18K: RichHF-18K主要通过像素级热力图捕捉不合理区域,标注颗粒度粗且无法给出结构化自然语言因果解释;本文Q-Real不仅给出精确框级定位,更提供了细粒度语义问答与因果陈述。
  • vs Q-Eval-100K: Q-Eval-100K侧重于宏观图文对齐与总体美学质量的标量MOS预测;本文Q-Real基于其高质量子集扩充了实体级缺陷与双维度标注,将宏观评分深入推进到微观归因定位。
  • vs FakeXplain & X-AIGD: FakeXplain偏重AIGC伪造鉴伪判别,缺乏系统性的多维度客观QA体系;X-AIGD仅执行区域级分类而无解释生成能力。Q-Real则统一了判别、定位、解释与打分全栈能力。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次系统构建面向AIGC自然度与失真双维度的细粒度实体评测基准与多阶段微调管线]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖闭源与开源MLLM横向对比、多基准跨域迁移、匈牙利匹配因果双重检验及完整消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,任务定义清晰,问题公式化严密]
  • 价值: ⭐⭐⭐⭐⭐ [为AIGC图像生成提供了极具指导意义的细粒度可解释反馈信号与高质量开源评估基准]