Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs¶
会议: ECCV2026
论文: ECCV 原文
领域: 多模态VLM
关键词: 消化内镜诊断 / 多模态大模型 / 临床认知对齐 / 反事实强化学习 / GRPO
一句话总结¶
针对消化内镜诊断中多模态大模型"推理不遵循专家认知流程、诊断被背景伪相关带偏"这两个问题,本文先用 Gemini 3 Pro 生成、专家复核出带"解剖定位→形态评估→微细节分析"三段推理链的数据集做 SFT,再从理论上证明标准监督微调必然收敛到背景捷径,最后用"掩膜生成反事实正常样本 + 临床认知中心奖励"的 GRPO 做因果矫正,在五个内镜基准上平均准确率 67.67%,比 Qwen3-VL-Plus 高约 26 个百分点。
研究背景与动机¶
消化系统恶性肿瘤占全球癌症负担的很大一部分,内镜筛查是早发现、早干预的金标准。但内镜检查质量高度依赖操作者经验,观察者之间差异明显,于是计算机辅助诊断被当作降低漏诊率的关键支撑。过去十年这个方向由判别式深度学习主导:CNN 与 ViT 在息肉检测、解剖标志识别、溃疡分类等单点任务上已经做到专家级精度。问题在于这类模型本质上是闭集分类器——只吐出一个类别标签,不提供任何诊断依据。依据缺失意味着结果无法被临床医生复核,在高风险医疗场景里直接损害可信度。
多模态大模型(MLLM)把视觉编码器的感知能力和 LLM 的知识与推理接在一起,能同时产出视觉描述和结论,理论上可以模仿内镜医师的工作流。但把通用 MLLM 直接搬到消化内镜上有两个具体障碍。第一是临床认知错位:内镜医师的诊断遵循严格的分层流程——先定位解剖部位,再评估宏观形态(形状、隆起高度、大小、颜色、边界),再分析微细节(绒毛/腺管等表面构型与微血管构型),最后才给出结论;而通用 MLLM 的推理是散乱的,会跳过关键分析步骤,甚至凭空编造图像里没有的特征。原文给了一个很有说明力的失败案例:Gemini 3 Pro 面对一张黏膜下肿瘤(SMT)图像,被"这是胶囊内镜"这一环境线索牵着走,输出的诊断建立在胶囊模态的上下文上,而不是真正的病灶特征上。第二是视觉特征与诊断结论之间缺乏因果关联:模型对背景中的伪相关很敏感(器械反光、泡沫、胆汁残留),学到的往往是最省力的环境线索,而不是病变本身。这两点叠加,使得模型在真实临床环境里非常脆弱。
已有的医学多模态工作(通用医学 VQA 模型、内镜报告生成模型)大多把内镜分析处理成一个标准的图像描述问题:训练信号只有图文对,模型学到的是捷径特征而非临床逻辑。本文的做法是分两步把这个缺口补上:先把专家诊断逻辑本身做成数据与监督信号,让模型"会按流程看";再指出这种监督在统计上必然滑向背景捷径,并用一个可构造的反事实惩罚把它拉回病灶。核心 idea:用三段式临床认知链的数据集加 SFT 把专家的分层诊断流程内化成生成范式,再通过"抹掉病灶、保留背景"的反事实正常样本与格式/认知/诊断三项奖励做 GRPO,强制模型把结论只挂在病灶特征上。
方法详解¶
整体框架¶
输入是一张内镜图像加上一句诊断指令,输出既要给出正确诊断,也要给出一条符合临床标准的推理链。CogAlign 用两个串行阶段实现这种"双重对齐":先对齐推理过程,再对齐因果依据。第一阶段构造分层临床认知数据集——每张图配一条"解剖定位 → 形态评估 → 微细节分析 → 诊断结论"的推理链,用 SFT 把这条链的生成范式写进模型;此时模型会按流程说话,但仍可能只看背景。第二阶段先给出一个形式化分析,说明为什么标准 SFT 的梯度会优先吃掉背景伪特征,然后据此设计反事实驱动的 GRPO:把病灶区域掩膜后高斯模糊、配"正常"标签造出反事实样本,再用格式、临床认知、诊断一致性三项奖励做组内相对优化,凡是靠背景答题的生成都会被惩罚。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["内镜图像 + 诊断指令"] --> B["分层临床认知数据集<br/>三段式推理链"]
B --> C["认知链内化的 SFT"]
C --> D["视觉捷径的形式化<br/>与反事实惩罚"]
D -->|"λ→∞ 迫使敏感度归零"| E["反事实驱动 GRPO<br/>掩膜合成正常样本<br/>三项临床认知奖励"]
E --> F["结构化认知链<br/>+ 最终诊断"]
关键设计¶
1. 分层临床认知数据集:把专家的三段式流程固化成可监督的推理链
公开的内镜数据集基本只有图像-标签对,缺少诊断所需的中间推理步骤;在这种数据上训练,模型只会去拟合捷径特征而不是临床逻辑。本文先定义了一套来自专家工作流的标注协议,强制一条由粗到细的推理路径,包含三个固定阶段:解剖定位(识别器官部位、记录成像条件,提供空间上下文)、形态评估(病灶形状、隆起高度、大小、颜色、边界等宏观特征)、微细节分析(绒毛状结构等细粒度表面构型与血管构型),三段之后才是最终诊断。大规模人工标注推理链代价过高,因此采用半自动流水线:先从五个公开库聚合图像并做质量与多样性过滤;再用 Gemini 3 Pro 作教师模型,用显式写出三段层级结构的提示词为每张图生成结构化推理描述;最后是人在回路精修——专家逐条复核,通过的自动入库,含事实错误的退回人工修订。最终语料 24,515 条(CrohnIPI、GastroVision、HyperKvasir、Kvasir-Capsule、The SEE-AI Project 五个来源),按分层切分 19,736 训练 / 4,779 测试,覆盖 23 个单标签类别与 49 种多标签病理组合,记作 \(\mathcal{D}=\{(x_i,q_i,r_i,l_i)\}_{i=1}^{N}\)。这套数据的关键不在规模,而在于它把"专家怎么看"从一个隐含的先验变成了可以逐 token 监督的目标序列。
2. 认知链内化的 SFT:让诊断结论成为前三段分析的后果
有了推理链数据,本文用最直接的方式约束生成流形:把推理链 \(r\) 与诊断标签 \(l\) 拼成目标序列 \(y=r\oplus l\),对整条序列做自回归的负对数似然优化,训练时图像经视觉编码器投影进 LLM 的嵌入空间,损失覆盖推理步骤和结论的每一个 token。这样做的效果不是"多输出一段解释"这么简单,而是在统计上强制了一个依赖结构:诊断标签出现在序列末尾,它的条件概率里已经包含了前面的形态描述与微细节描述,于是标签变成前序分析的条件后果,而不是从视觉特征直接跳过去的黑箱分类。这恰好对应通用 MLLM 的认知错位——它们不是不会描述,而是描述和结论之间没有因果链,随时可以跳过中间步骤直接报答案;SFT 把中间步骤和结论绑在同一条被监督的序列里,跳步的生成方式在训练分布上就被抑制了。
3. 视觉捷径的形式化与反事实惩罚:说清"为什么只做 SFT 不够"
SFT 会按流程说话,但说话的依据不一定对。本文给了一个简化但不空泛的形式化:把图像看成由因果潜因子 \(Z_c\)(病灶)与伪相关潜因子 \(Z_e\)(背景、器械、气泡、黏膜反光)共同生成,模型输出是特征的 logistic 函数,并定义有效特征敏感度为输出对该因子的雅可比范数
用来衡量模型到底有多依赖某个因子。在这个框架下可以证明(Theorem 1):当伪特征比因果特征更"简单"时,梯度下降解出的权重满足 \(\|w_e\|>\|w_c\|\),即 \(S_e>S_c\)——依据是 simplicity bias,低复杂度特征对应的特征映射谱范数更大、在训练早期收敛更快,而当预测误差趋于零后优化就停滞了,此时因果特征的权重还没有学充分。也就是说,只用图文对做监督微调,模型在数学上就是会先学会看背景。作者进一步证明(Theorem 2):若引入反事实惩罚 \(R_{cf}=\mathbb{E}\left[f(\Psi(0,Z_e))^2\right]\),即把因果因子置零、只保留背景后仍然产生的预测,并在总目标 \(J=L+\lambda R_{cf}\) 中让 \(\lambda\to\infty\),则最优解必须满足 \(f(x_{cf})\to 0\),伪因子的敏感度 \(S_e\to 0\);此时为了继续降低原样本上的损失,梯度只能转向因果特征 \(w_c\)。这段分析的价值在于它把"模型看背景"从一个经验抱怨变成了一个可操作的处方:不需要更多数据,只需要构造一个"背景不变、病灶消失"的输入,并惩罚它上面的预测。
4. 反事实驱动的 GRPO:掩膜造正常样本,用三项临床认知奖励做因果矫正
第二阶段把上面的处方落地。反事实正常样本合成:先由 MLLM 给出病灶初始框、专家精修得到精确掩膜 \(M\),对 \(M\) 内做高强度高斯平滑得到 \(x_{cf}\),再给它配上"正常"标签与阴性推理链。这个样本的构造方式是关键——背景原封不动,只抹掉病灶,于是它天然构成一个对照:如果模型仍然根据背景报出病理诊断,说明它的结论没有落在病灶上,应当被重罚。用高斯模糊而非纯白遮挡是刻意的选择:纯白掩膜会引入锐利的人工边界和分布外信号,让强化学习的优化不稳定,而高斯模糊在抹掉诊断证据的同时保持了视觉纹理的自然性,模型能更干净地隔离出病灶表征。三项奖励:格式奖励 \(R_{fmt}\) 是 all-or-nothing 的全或无约束——输出必须依次覆盖 (1) 位置与成像环境、(2) 黏膜形态与局灶病变、(3) 表面纹理与微血管构型三个小节,缺任意一节即得 0,否则得 1,这把结构完整性变成硬约束;临床认知奖励 \(R_{cog}\) 针对语义精度,对每条真值推理链预先用 LLM 抽出每个认知小节各 3 个关键特征词、共 9 个,训练时直接检查这些词是否出现在生成文本中
它的作用是把"中间推理"从可以含糊其辞的旁白变成必须点到具体征象的中间监督,否则模型会退化成一堆缺乏视觉依据的笼统描述;诊断一致性奖励 \(R_{diag}\) 则解析生成文本末尾的结论,与真值标签一致得 1 否则 0,保证推理链最终收口到正确判断——消融显示去掉它之后模型会沉迷于写描述、偶尔忘了从自己的分析里得出结论。三项奖励按 1.0 / 1.0 / 2.0 加权求和作为总奖励,再用 GRPO 在组内做相对优势归一化后优化。值得注意的是反事实样本在这一步并不是额外加一个损失项,而是作为普通训练样本进入同一个奖励体系:在 \(x_{cf}\) 上,正确的行为是输出阴性推理链并给出"正常",靠背景答题的模型会在这里拿到 0 的诊断奖励——形式上等价于理论里的 \(R_{cf}\),实现上却只是一批多造出来的数据。
一个示例:一次 GRPO 采样内部的奖励计算¶
以一张胃窦白光图像为例(真值标签 Erosion,图像被大量泡沫状胆汁染色黏液遮挡)。对同一个 query 采样 \(G=8\) 条输出,取其中三条:
- 输出 A:三个小节标题齐全 → \(R_{fmt}=1\);命中 9 个关键特征词中的 5 个 → \(R_{cog}=5/9\approx0.56\);结论 Erosion 正确 → \(R_{diag}=1\)。总奖励 \(r=1+0.56+2\times1=3.56\)。
- 输出 B:只写了两节(缺"表面纹理与微血管构型")→ \(R_{fmt}=0\);命中 4 个 → \(0.44\);结论正确 → 1。总奖励 \(r=0+0.44+2=2.44\)。结构与语义两项同时被惩罚。
- 输出 C:三节齐全、但只看泡沫说"黏膜表面平整、未见异常"→ \(R_{fmt}=1\);命中 2 个 → \(0.22\);结论 Normal → 0。总奖励 \(r=1+0.22+0=1.22\)。
三条输出在组内算出均值与标准差后归一化得到优势 \(\hat{A}_i\),C 这种"格式漂亮但被背景带偏"的样本被压到最低。与此同时,同一张图经过病灶掩膜与高斯模糊后的反事实样本(标签为正常)也在同一批训练里,模型若在它上面仍然报 Erosion,诊断奖励同样为 0——这正是第二阶段与第一阶段的分界点:前者教会模型按流程说话,后者逼它把话说在病灶上。
损失函数 / 训练策略¶
第一阶段是标准的自回归负对数似然,\(y_i=r_i\oplus l_i\)、\(L_i\) 为序列长度:
第二阶段在每个 query 上采样 \(G\) 条输出 \(\{y_1,\dots,y_G\}\),先算总奖励 \(r_i=R_{fmt}(y_i)+\lambda_1 R_{cog}(y_i)+\lambda_2 R_{diag}(y_i)\),再在组内标准化得到优势 \(\hat{A}_i=(r_i-\mu_r)/(\sigma_r+\epsilon)\),最后优化带 KL 惩罚的裁剪代理目标(\(\rho_i=\pi_\theta(y_i|q)/\pi_{\theta_{old}}(y_i|q)\),\(\beta\) 控制偏离参考模型 \(\pi_{ref}\) 的代价):
⚠️ 上述两式为按原文文字描述还原的标准形式(缓存中公式 (2) 与 (15) 存在排版乱码),以原文为准。
实现上使用 SWIFT 框架、8 张 NVIDIA L20。第一阶段 SFT 训练 400 步,AdamW 优化器、学习率 \(1\times10^{-4}\)、余弦调度、全局 batch size 128;视觉编码器与 aligner 冻结,仅在全部线性模块上加 LoRA(rank 16、\(\alpha=32\)),序列长度上限 2048。第二阶段 GRPO 训练 200 步,延续 LoRA 优化,全局 batch size 256、学习率降到 \(1\times10^{-6}\),KL 惩罚系数 \(\beta=0.04\);每个 query 采样 \(G=8\) 条生成,格式、临床认知、诊断一致性三项奖励权重分别为 1.0、1.0、2.0。两个阶段都是轻量适配——可训练参数只有 LoRA 部分,这也是 2B/4B/8B 三档模型都能跑完整流程的原因。
实验关键数据¶
主实验¶
测试集共 4,779 张内镜图像,来自 CrohnIPI (CI.)、GastroVision (GV.)、HyperKvasir (HK.)、Kvasir-Capsule (KC.)、The SEE-AI Project (SA.) 五个基准,指标为准确率。其中 SEE-AI 的难度明显更高,含 235 个多标签样本;多标签采用严格判定,必须完全匹配整组真值病理才算正确。
| 模型 | CI. | GV. | HK. | KC. | SA. | 平均 |
|---|---|---|---|---|---|---|
| Gemini 3 Pro | 30.58% | 44.73% | 44.40% | 21.83% | 19.20% | 24.82% |
| GPT-5.2 | 6.80% | 18.80% | 33.20% | 5.32% | 8.32% | 11.13% |
| Qwen3-VL-Plus | 52.91% | 64.10% | 72.78% | 34.72% | 33.63% | 41.16% |
| Hulu-Med-7B(医学专模) | 19.42% | 13.39% | 9.46% | 10.86% | 6.22% | 8.58% |
| Qwen3-VL-8B | 39.32% | 47.01% | 67.57% | 30.14% | 29.22% | 35.30% |
| Qwen3-VL-8B (SFT) | 62.14% | 76.92% | 89.38% | 72.74% | 58.77% | 66.31% |
| CogAlign-2B | 50.00% | 73.79% | 89.77% | 53.99% | 50.96% | 57.40% |
| CogAlign-4B | 59.22% | 76.35% | 89.19% | 66.77% | 57.22% | 64.05% |
| CogAlign-8B | 63.11% | 77.21% | 91.51% | 74.01% | 60.18% | 67.67% |
消融实验¶
奖励项的消融在原文中只以 Fig. 6 的曲线给出(缓存无法读出具体数值),因此下表把能从表 1 与表 2 直接对上的两级增益与奖励移除的定性结论放在一起:
| 配置 | 平均准确率 | 说明 |
|---|---|---|
| Qwen3-VL-8B(未训练) | 35.30% | 通用基座,多模态能力已有但无内镜认知 |
| + 临床认知对齐 SFT | 66.31% | 仅结构与推理链监督,+31.01 |
| + 反事实驱动 GRPO(CogAlign-8B) | 67.67% | 完整模型,再 +1.36 |
| w/o 临床认知奖励 \(R_{cog}\) | 见 Fig. 6,明显下降(⚠️ 无具体数值) | 中间推理退化为缺乏视觉-病理依据的笼统描述 |
| w/o 诊断一致性奖励 \(R_{diag}\) | 见 Fig. 6,显著下降(⚠️ 无具体数值) | 模型专注生成描述,偶尔不给出正确结论 |
单标签与多标签的拆分(同一批模型、同一测试集):
| 模型 | 单标签 | 多标签 | 平均 |
|---|---|---|---|
| Qwen3-VL-Plus | 42.76% | 10.21% | 41.16% |
| Qwen3-VL-8B | 36.77% | 6.81% | 35.30% |
| Qwen3-VL-8B (SFT) | 69.19% | 10.64% | 66.31% |
| Hulu-Med-7B | 9.02% | 0.00% | 8.58% |
| CogAlign-2B | 59.93% | 8.09% | 57.38% |
| CogAlign-4B | 66.81% | 10.64% | 64.05% |
| CogAlign-8B | 70.47% | 13.62% | 67.67% |
关键发现¶
- 增益主体来自数据集与 SFT,反事实 RL 是"矫正量"而非涨点主力:8B 上从 35.30% 到 66.31% 的 +31.01 全部由认知链监督贡献,GRPO 阶段只再涨 1.36。但换个角度看,RL 阶段对小模型更划算——2B 涨 2.91(54.49→57.40)、4B 涨 2.07(61.98→64.05)、8B 涨 1.36,模型越小越依赖第二阶段的因果矫正,这与"小模型更容易吃背景捷径"的直觉一致。
- 多标签诊断是所有模型的短板,也是提升最明显的地方:通用大模型在这个子集上几乎失效(Gemini 3 Pro 0.85%、GPT-5 系列 0.43%~2.55%),医学专模 Hulu-Med-7B 直接 0.00%,Qwen3-VL-8B 为 6.81%;CogAlign-8B 达到 13.62%。作者把原因归到推理链迫使模型逐段扫查黏膜表面,而不是盯着单个显著特征。但 13.62% 与单标签 70.47% 之间仍有近 57 个百分点的鸿沟,说明并发病理识别远未解决。
- 医学专模并不天然占优:Hulu-Med-4B/7B 平均只有 7.72%/8.58%,甚至低于同规模通用模型。作者的解释是它们的训练目标是通用医学视觉问答,缺乏内镜所需的细粒度识别能力——"医学领域"和"内镜专科"并不是同一件事。
- 数据集难度分层清晰:Kvasir-Capsule 与 SEE-AI 是全部模型的低分区(CogAlign-8B 也只有 74.01% 与 60.18%),与胶囊内镜的图像质量、以及 SEE-AI 中更高的多标签比例对应。
- 鲁棒性与掩膜策略都被单独验证:人工加斑点干扰后,只做 SFT 的模型准确率严重下滑、而完整 CogAlign 在各规模上都保持稳定,直接印证了"SFT 过拟合背景伪相关"的判断;掩膜方式上,高斯模糊一致优于纯白遮挡,作者归因于白块会引入锐利人工边界与分布外信号、破坏 RL 优化的稳定性。
- 一处数值不一致:CogAlign-2B 的平均准确率在表 1 中为 57.40%、在表 2 中为 57.38%,两个表都在同一测试集上(⚠️ 以原文为准,本文按各自来源引用)。
亮点与洞察¶
- 把"认知错位"拆成数据问题而不是提示词问题:与其在推理时反复 prompt 模型"先看位置再看形态",不如把这条轨迹做成被监督的目标序列,让跳步在训练分布上就不被允许。这个思路可以整体迁移到任何有行业规范流程的诊断/审查任务(病理、放射、工业质检)。
- 反事实样本的构造极简却直接对应理论项:不需要第二个模型、不需要人工重绘,一个病灶掩膜加高斯模糊就能造出"背景不变、病灶消失"的对照样本,把抽象的反事实惩罚 \(R_{cf}\) 变成一批可用的训练数据。低成本是这个设计最漂亮的地方。
- 关键词奖励把"语义精度"变成可自动计算的离散信号:用 LLM 离线抽 9 个关键特征词,训练时只做字符串匹配就能给出稠密奖励,比再训一个 reward model 便宜得多,也不需要人工打分。这个 trick 可以迁移到任何"结构 + 内容都要对"的生成任务,如报告生成、CoT 质量评估。
- 理论部分只服务一个惩罚项,但给出了可操作的处方:Theorem 1 说明只做 SFT 必然学到伪特征,Theorem 2 说明把因果因子置零并惩罚其预测即可消掉伪敏感度。它不追求严格刻画真实 MLLM,但把"为什么要引入反事实"从经验直觉提升为方向明确的推导。
- 奖励分工清晰:格式奖励锁结构、关键词奖励锁语义、诊断奖励锁结论,三者构成"结构—过程—结果"的闭环,而且权重(1:1:2)本身就说明了诊断结论在整个体系里的优先级。
局限与展望¶
- 反事实样本依赖病灶掩膜,掩膜又依赖专家:初始框由 MLLM 给出、但要专家精修才能定准 \(M\)。真实部署中没有专家在环,掩膜质量下降会直接削弱反事实样本的对照效果,甚至可能抹掉错误区域、向模型注入错误监督。
- 诊断奖励只看最终标签是否匹配(0/1),不约束推理链的忠实性:关键词奖励只验证词是否出现,不验证是否用对了位置——模型完全可以在形态段里罗列一堆术语而描述的并不是图中病灶。缺一个"描述与图像一致"的视觉校验项。
- 理论分析建立在简化的 logistic 特征模型上:Definition 1 把图像拆成两个潜因子、把模型写成 \(\sigma(w^\top\phi(X))\),真实 MLLM 的表示远不满足这一假设,\(K(Z_e)<K(Z_c)\)、\(\lambda\to\infty\) 都是理想化条件,结论应作为方向性指引而非定量预测。
- 数据与评测规模有限:测试集仅 4,779 张,其中 SEE-AI 的多标签样本只有 235 张,多标签百分比在这种样本量下波动较大;数据集本身类别分布不均(23 个单标签类 + 49 种多标签组合),多标签准确率普遍偏低也可能反映标注覆盖不足而非模型能力上限。
- 消融证据不完整:奖励项的移除实验只给出 Fig. 6 的曲线,正文没有给出可核对的数值,也没有报告 LoRA rank、奖励权重、\(G\) 的敏感性分析;加权系数 1.0/1.0/2.0 的选取依据未见说明。
- 可改进方向:用迭代式自生成掩膜(先粗掩膜训练、再用模型自身的注意力/定位能力细化)替代专家精修以降本;在奖励里加入视觉一致性校验(如对形态描述做图文匹配打分);把反事实干预扩展到"改变背景、保留病灶"的方向,验证模型是否真正双向因果。
相关工作与启发¶
- vs 通用大模型(Gemini 3 Pro / GPT-5 系列 / Qwen3-VL-Plus):它们把内镜图当作通用视觉问答来做,平均准确率 24.82% / 11.13% / 41.16%,失败模式是被环境线索牵着走(Fig. 1(c) 的胶囊内镜幻觉)。本文的差异在于不依赖通用视觉能力,而是先注入领域认知流程、再强制因果依据。
- vs 医学专模(Hulu-Med 等):它们在通用医学 VQA 上规模更大、数据更多,但在内镜上平均只有 7.72%~8.58%,多标签几乎为 0。差别在于训练目标——医学广覆盖 vs 内镜细粒度识别,本文用领域内的分层推理链补齐了后者。
- vs 内镜报告生成 / 视觉语言描述方法:这类工作把内镜分析当成 image captioning(VILA-M3、Fleming-VL 等),输出描述性文本但不强制"描述服务于诊断"的结构与因果。本文的三项奖励把描述变成诊断的因果前提,而不是可选的附加说明。
- vs 本文的 Base-SFT(消融视角):单纯 SFT 已经能到 66.31%,但在 Fig. 4 下排的噪声样例里会被胆汁泡沫误导、把 Erosion 报成 Normal,在斑点干扰测试中掉点严重。这个对比正好界定了 SFT 的能力边界——它对齐结构和语言,不对齐因果。
- vs GRPO 本身:GRPO 的组内相对优势原本在数学与推理任务上验证,本文把奖励整体替换为"格式 + 关键词 + 诊断"的临床认知中心奖励,并额外把反事实样本并进同一奖励体系,是把通用 RL 算法用于领域因果矫正的一个直接迁移范例。
评分¶
- 新颖性: ⭐⭐⭐⭐ 两个问题(认知错位、因果缺失)的组合切得准,理论刻画 + 反事实 GRPO 的组合有想法,但单项技术更多是已有组件(SFT、GRPO、反事实干预)在医学场景的领域适配。
- 实验充分度: ⭐⭐⭐⭐ 五个数据集、三档模型规模、多标签拆分、鲁棒性与掩膜策略都做了,但奖励消融只有曲线无数值,缺少奖励权重与 LoRA 的超参敏感性分析。
- 写作质量: ⭐⭐⭐ 故事线清晰、失败案例很有说服力,但公式排版混乱(Theorem 的梯度式与 Eq. 11/12/14 在缓存中均不可读)、理论证明较为粗糙(依赖未证明的谱范数假设),部分消融结论只有定性描述。
- 价值: ⭐⭐⭐⭐ 内镜 MLLM 的可信度是真实痛点,"数据 + SFT 立认知、反事实 RL 立因果"这一两阶段范式与关键词奖励的低成本实现都可直接复用;数据集与 24,515 条推理链本身也有独立价值。