DeepArrhythmia: Segment-Contextualized ECG Arrhythmia Classification via Selective Evidence Acquisition¶
会议: NeurIPS2026(按任务清单归档;本文依据 arXiv v2,2026-09-27)
arXiv: 2605.16441
代码: https://github.com/jimmylihui/DeepArrhythmia_repo
领域: 医学图像
关键词: 心电心律失常、片段上下文、逐心搏分类、生理证据、置信度路由
一句话总结¶
DeepArrhythmia 在 10 秒心电片段中按 R 峰输出逐心搏标签,并根据初步预测的片段置信度选择是否追加数值与形态证据,在四个数据集上展示了上下文和生理证据的价值,但路由并非在所有指标上优于始终使用丰富证据。
研究背景与动机¶
逐心搏心律失常分类需要给每次心搏判定类别,却不意味着只看这一次心搏就足够。室性与室上性异位搏动都可能提前出现,随后伴随较长间隔;判断时还要比较目标心搏与邻近正常搏动的 QRS 形态、P 波表现和节律变化。孤立心搏裁剪容易丢失这种相对关系,而直接处理长波形的端到端模型又未必留下可核对的生理测量,难以追问它究竟依据什么做出判断。
把专门的峰检测和特征提取工具接入视觉语言模型,可以让精确测量与异质证据整合各司其职。然而,工具越多并不一定越好:简单片段可能不需要额外测量,低质量信号导出的特征还可能误导分类。VitalDB 上丰富证据模型的 Macro-F1 为 0.858,低于最小证据模型的 0.877,说明这里的关键不是堆叠模态,而是识别何时值得获取辅助证据。
本文把这一问题收敛为两种证据预算之间的选择,先根据原始信号、波形图和峰位置形成初判,再用置信度决定是否追加数值与文字证据。核心 idea:保留多心搏上下文与明确的 R 峰对齐,用片段级置信度控制生理证据获取,而不是对所有片段固定调用全部工具。
方法详解¶
整体框架¶
输入是同一段 10 秒 ECG 的原始多通道信号与渲染波形图,输出是每个 R 峰对应的 N/S/V/F 标签序列。三项关键设计依次是峰对齐上下文、置信度门控路由、丰富证据整合:先定位心搏并做最小证据预测,置信度不足时才提取节律和形态数值,再生成形态文字并重新分类。
信号由冻结的 ECG-CoCa 编码器处理,图像单独编码,两路特征投影到 Qwen3.5-4B 的语言模型嵌入空间。中心模型负责调用工具和综合证据,不承担全部精确测量;峰检测器、手工特征计算和置信度计算也不能都理解成相互协商的自主智能体。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
I["10 秒信号与波形图"] --> A["峰对齐上下文<br/>R 峰与最小证据初判"]
A --> B["置信度门控路由"]
B -->|置信度达到阈值| O["逐心搏 N/S/V/F"]
B -->|置信度低于阈值| C["丰富证据整合<br/>数值特征与形态文字"]
C --> O
D["开发集标签<br/>阈值选择与路由 SFT"] -.训练监督.-> B
T["训练受试者标签<br/>教师解释蒸馏"] -.训练监督.-> C
图中的实线是测试时数据流,虚线只表示训练监督。测试时既不使用开发集标签,也不向形态分析器提供真实心搏类别。
关键设计¶
1. 峰对齐上下文:分类单位是心搏,证据范围是整个片段
10 秒指固定的物理时间,不是所有数据集都固定为相同采样点数。不同采样率下信号长度会变化,片段内心搏数也随心率变化;模型不能把输入简单当作固定数量的孤立心搏,也不是给整个片段只输出一个类别。AAMI 粗粒度映射保留 N(正常)、S(室上性异位)、V(室性异位)、F(融合),排除未知或不可分类的 Q 类。
峰检测器使用 1D U-Net++,先产生逐采样点概率,再通过阈值和峰选择得到 R 峰。峰位置同时定义三个接口:最终答案在哪里发出标签、数值特征围绕哪里计算、形态分析查看哪个心搏。中心模型按“采样位置:类别”序列化答案,因此时间锚点不仅是附带信息,而是把不同证据绑定到同一实例的共同索引。
保留周围多个心搏,是为了让提前程度、后续停顿和形态一致性成为可比较的关系。数值特征可以说明目标心搏提前了多少,波形图则帮助判断它是否仍接近邻近正常搏动的形状;两者作用不同。图像由原始波形生成,没有引入独立测量信息,价值在于为模型提供不同的表示方式,而不是增加一个独立传感器。
这种设计也暴露了上游依赖:漏峰意味着少一个待分类实例,错位会污染局部特征,伪峰会制造不真实的间隔关系。无峰检测器的消融不能完成可靠对齐,论文以横线表示不可用,而不是报告零分。固定窗口边界上的心搏还可能缺少完整的前后间隔,不能把 10 秒上下文理解为所有心搏都获得同样充分的信息。
2. 置信度门控路由:用逐心搏后验的均值决定整段是否升级证据
最小证据包括原始信号、波形图与 R 峰。中心模型先生成逐心搏预测,在每个类别生成位置对规范类别标记 N/S/V/F 的 logits 做 softmax;每个心搏取最大类别概率作为自身置信度,再对片段内所有心搏求平均。若片段有 \(K_x\) 个心搏,核心路由量为:
这个均值不是“出现异常心搏的概率”,也不是工具能带来多少收益的直接估计,而是当前证据是否足够的实用代理。达到数据集阈值就返回初判;低于阈值则调用特征提取器和形态分析器,再输出丰富证据条件下的答案。一次路由覆盖整个片段,因为两个可选工具利用的是片段节律和跨心搏关系,论文没有评估逐心搏独立路由。
均值可以避免一个不确定心搏自动触发整段升级,但也可能被大量高置信正常搏动抬高。附录 E 在 MIT-BIH 比较均值与最小心搏置信度,两者 Macro-F1 都为 0.588,均值规则的 Micro-F1 为 0.951,最小值规则为 0.948。这是当前协议下的经验依据,不证明均值对稀有异常永远更合适。
阈值不是只凭直觉设定,也不是用测试集标签选择。训练受试者内部另划出未参加第一阶段优化的开发受试者,在其上比较最小和丰富证据预测,扫描阈值并最大化逐心搏 Micro-F1。选出的阈值固定后才测试;MIT-BIH 为 0.990529,MIT-BIH-SUP 为 0.980933,INCART 为 0.993532,VitalDB 为 0.98519。
门限接近 1 与正常搏动占多数、初判置信度集中于高值有关,不能按通用分类器的 0.5 门限理解。由于阈值选择优化 Micro-F1,部署时若更关心稀有心搏漏检或专家复核负担,还需要另行定义目标;跨设备后的高置信错误也不一定会触发升级。
3. 丰富证据整合:测量提供数值,蒸馏模型提供形态文字
特征提取器围绕同一批峰位置计算 RR 间隔、归一化 RR、R 峰幅度、高阶统计量和数值形态描述。高阶统计把心搏分为五段,分别计算偏度与峰度,得到十维描述;形态描述则使用 R 峰到局部代表点的距离。它们把“提前”“幅度变化”“形状不同”转成可对照的数值,而不是要求中心语言模型从图中猜精确时间和幅度。
形态分析器是另一个基于 Qwen3.5-4B 的视觉语言学生模型,读取 ECG 图像、目标心搏位置与辅助数值上下文,给出形态文字。训练时 Gemini 3.1 教师能看到真实类别,生成有类别支持的解释;这些解释只来自训练受试者。学生在测试时不接收真实标签,其文字被交给中心模型作为支持性证据,并保留下来供核查。
这一区分很重要:文字不是独立临床专家的结论,也不是与类别完全无关的观测。它经过标签条件教师蒸馏,可能继承教师的偏差或合理化倾向;因此“可审计”意味着可以查看中间结果,不等同于解释已被证明完全忠实。论文的证据删除实验提供了局部依赖证据,但不能消除全部解释风险。
中心模型把工具调用与返回内容以显式调用/输出片段串入上下文,在丰富证据状态下综合信号、图像、峰、数值和文字,再生成峰对齐标签。这里不是让三个自主代理投票,而是专门模块产出证据,中心模型完成决策。追加证据只改变输入条件,不改变每个标签仍对应一个明确 R 峰的任务定义。
一个完整示例¶
附录 L 给出一个 13 心搏片段:最小证据初判全部为 N,片段置信度为 0.989392,低于 MIT-BIH 阈值 0.990529,因此继续调用两个可选工具。
位置 2045 的目标心搏位于约 5.68 秒。它之前的 RR 为 236 个采样点,之后为 358 个采样点;形态文字指出它比正常节律提前,QRS 仍窄且与邻近心搏接近,随后出现较长间隔。中心模型因此把该位置从 N 改成室上性异位,其余位置保持 N。
这个例子说明了数值与形态的互补:提前与停顿不足以单独区分 S 和 V,还要比较 QRS。原文示例最终写成 SVEB,正式任务的规范标签是 S;此处仅说明语义映射,不把示例中的不同拼写当成新增类别,也不把该单例当作临床诊断规则。
损失函数 / 训练策略¶
中心模型进行两阶段带掩码的监督微调。生成的工具调用和最终答案 token 参与损失,外部返回的工具结果与其他上下文不参与损失;这样训练的是调用行为与分类,而不是让模型模仿工具产生精确测量。
先建立受试者互不重叠的训练/测试分区,再把训练受试者按 9:1 划为第一阶段优化集 \(D_1\) 与第二阶段路由诱导集 \(D_2\)。第一阶段分别训练最小证据和丰富证据专家,学习标签格式、峰对齐以及不同证据预算下的预测;第二阶段在 \(D_2\) 上选择阈值,并构造由阈值确定的调用轨迹。
路由模型从最小证据专家初始化,再对这些轨迹微调。路由监督指“停止或追加证据”,不是“正常或异常”;阈值选择使用开发标签来衡量分类结果,但测试标签不参与阈值、工具解释蒸馏或中心模型微调。训练数据的再利用范围需要与这个受试者级隔离一起理解。
类别不平衡通过窗口平移再锚定缓解:围绕非 N 心搏生成额外 10 秒窗口,让少数类的 R 峰出现在不同相对位置,稀有类别使用更多偏移。窗口裁到有效记录边界并去重,只扩充训练分区,不靠改变测试分布提升分数。
实现中 ECG-CoCa 保持冻结,中心骨干为 Qwen3.5-4B;训练学习率为 \(2\times10^{-5}\),最大序列长度 8000,使用 bfloat16、FlashAttention-2 与 DeepSpeed ZeRO-3。三张 A6000、每设备 batch 1、梯度累积 4 对应有效 batch 12;这与推理延迟实验中的三个独立单卡 worker 是不同运行方式。
实验关键数据¶
主实验¶
四个数据集均采用受试者隔离的 DS1/DS2 式协议,报告逐心搏 Macro-F1 与 Micro-F1。机器学习及深度学习基线取三个随机种子均值,VLM 使用温度 0;测试集中不存在的类别不计入 Macro-F1 平均。
下表摘录表 1 中最能说明证据预算与基线差异的配置;每格为 Macro-F1 / Micro-F1,不把整表的所有模型重复列出。
| 配置 | MIT-BIH | MIT-BIH-SUP | INCART | VitalDB |
|---|---|---|---|---|
| 最小证据专家 | 0.534 / 0.917 | 0.562 / 0.938 | 0.620 / 0.963 | 0.877 / 0.923 |
| 丰富证据专家 | 0.593 / 0.950 | 0.614 / 0.952 | 0.710 / 0.981 | 0.858 / 0.911 |
| 阈值诱导路由模型 | 0.588 / 0.951 | 0.615 / 0.953 | 0.689 / 0.979 | 0.885 / 0.922 |
| 完整证据非智能体融合 | 0.567 / 0.937 | 0.536 / 0.926 | 0.641 / 0.967 | 0.821 / 0.900 |
| SVM | 0.523 / 0.934 | 0.575 / 0.938 | 0.681 / 0.985 | 0.600 / 0.747 |
| Gemini 3.1 | 0.410 / 0.878 | 0.522 / 0.849 | 0.653 / 0.924 | 0.389 / 0.693 |
丰富证据在前三个数据集提升最小专家,但在 VitalDB 反而下降。路由在 VitalDB 的 Macro-F1 最高,不过 Micro-F1 0.922 仍略低于最小专家 0.923;INCART 上丰富专家两项指标都高于路由,且 SVM 的 Micro-F1 0.985 高于丰富专家 0.981。原文正文的泛化式最佳表现措辞不应据此扩写成“所有数据集所有指标均为 SOTA”。
语言模型基线收到峰与数值特征,但不收到经数据集监督训练的形态分析器输出;因此它们与完整 DeepArrhythmia 并非完全相同的监督预算。非智能体融合基线使用同类信号、图像及文字表示和监督分类头,是更直接的整合方式对照,但仍不能把全部差异仅归因于工具调用。
消融实验¶
表 2 的 MIT-BIH 完整配置为丰富证据模型量级,不是表 1 中 Macro-F1 为 0.588 的路由模型。以下保留原表精度;不可用项不补造分数。
| MIT-BIH 配置 | Macro-F1 | Micro-F1 |
|---|---|---|
| 完整 DeepArrhythmia | 0.5929 | 0.9501 |
| 去掉平移增强 | 0.4259 | 0.9120 |
| 去掉 ECG 图像 | 0.5394 | 0.9426 |
| 去掉特征提取器 | 0.3527 | 0.9066 |
| 去掉形态分析器 | 0.5694 | 0.9433 |
| 去掉峰检测器 | — | — |
数值特征消融的 Macro-F1 降幅为 0.2402,大于去掉形态分析器的 0.0235;平移增强的降幅为 0.1670。这里支持的是完整配置中这些组成的贡献,不是路由自身的独立增益估计。
表 3 的延迟以秒/片段计,包含对应证据获取流程,而不只是语言模型解码。测试使用三个独立单卡 A6000 worker、batch 1、bfloat16、贪心解码,最多生成 8192 个新 token。
| 推理配置 | MIT-BIH | MIT-BIH-SUP | INCART | VitalDB |
|---|---|---|---|---|
| 最小证据专家 | 2.83 | 2.73 | 2.88 | 3.01 |
| 丰富证据专家 | 3.89 | 3.85 | 3.94 | 4.02 |
| 丰富证据非智能体融合 | 3.40 | 3.39 | 3.50 | 3.59 |
| 简单路由 | 3.24 | 3.28 | 3.53 | 3.48 |
| 阈值诱导路由 | 3.58 | 3.40 | 3.45 | 3.27 |
阈值路由比始终丰富证据更快,但不总比简单路由快;去掉自回归中心骨干也仍有明显证据处理成本。原文延迟段声称简单路由范围为 3.24–3.48 秒,表 3 的 INCART 却为 3.53 秒,此处保留表值并明确冲突,不自行修正。
关键发现¶
- 证据价值具有数据集差异:附录 D 的特征单独分类 Macro-F1 在 MIT-BIH 为 0.5209,在 VitalDB 为 0.3851,支持辅助数值在后者较弱的解释,但不足以单独确定是信号噪声还是标签噪声造成。
- 少数类仍然难:表 16 中 MIT-BIH 的 S 类 F1 为 0.3922,F 类仅 0.0659;INCART 的 F 类为 0.0992。总体 Micro-F1 高不能代替稀有异常的识别能力。
- 解释评价不是效用试验:三名专家盲评每系统 200 个输出,形态学生生理正确性为 4.92/5、整体有用性为 4.19/5,低于标签条件教师的整体 4.97/5;这不是临床结局或工作流获益验证。
亮点与洞察¶
- 证据获取比工具数量更重要:同一组工具可以在一个数据集帮助分类、在另一个数据集增加噪声。把“是否需要证据”纳入策略,比固定全调用更接近真实的预算控制问题。
- 时间锚点是多模态对齐的骨架:峰位置把波形、数值、形态文字和最终标签绑定到同一心搏。可迁移的是事件实例对齐接口,而非把所有生理信号都直接套进 ECG 标签体系。
- 重复表示可以改善可用性:波形图没有增加独立信息,却让某些被标量特征压缩掉的形态更容易被骨干利用。其价值应通过表示消融来衡量,而不是以“模态更多”作解释。
局限与展望¶
- 跨数据集迁移远未解决:附录 J 对目标测试集固定种子抽取 10% 进行评估,沿用源模型与源路由策略,不使用目标数据调参;十二个非对角迁移的平均 Micro-F1 为 0.698,优于 1D ResNet 的 0.457,但 VitalDB 到 MIT-BIH-SUP 仅为 0.0935,不能称为临床泛化认证。
- 平均置信度可能掩盖单个异常:均值路由和 Micro-F1 阈值目标都受多数类影响。可研究面向异常风险的分位数或逐心搏路由,但需要重新验证成本、校准与漏检率,不能假定更激进调用一定有效。
- 解释与抗噪证据有边界:形态学生依赖标签条件蒸馏;附录 Q 的噪声实验固定干净峰与 RR,只测试波形质量影响,不能等同于噪声下检测器与分类器全部同时失效的部署场景。
- 适用定位是离线辅助:当前为回顾性基准,目标是 Holter 复核和可疑片段二次阅读,不是硬实时设备报警或自主诊断。仍需多中心前瞻验证、隐私治理、分布外检测和人工复核。
相关工作与启发¶
- vs SVM 与手工 ECG 特征:两者都利用节律和形态测量,本文进一步将信号、图像与文字交给中心模型整合;INCART 的 SVM Micro-F1 更高,说明传统模型仍有强竞争力。
- vs GEM、PULSE、ECG-R1:这些方法侧重 ECG 多模态理解或解释,本文明确输出 R 峰对齐的逐心搏标签,并把外部测量作为决策中的中间证据。该任务和监督条件下的表 1 差异不等同于全面优于这些模型的所有 ECG 能力。
- vs ECG-Agent 与通用工具使用:重点不是自由规划多轮工具交互,而是受监督学习两种证据状态之间的置信度门控。一个值得后续检验的方向是直接预测追加工具的边际收益,而不只用分类置信度作代理。
评分¶
- 新颖性: 3.5/5。单个组件不新,贡献主要在上下文逐心搏预测、明确生理接口和选择性获取的结合。
- 实验充分度: 4/5。四数据集、受试者隔离、消融与迁移分析较全面,但前瞻临床和真实设备验证缺失。
- 写作质量: 3.5/5。方法路径明确,但最佳表现的概括性措辞与部分表值不一致,延迟范围也有正文/表格冲突。
- 价值: 4/5。为可核查的离线 ECG 辅助分析提供具体接口,尚不足以支持自主临床部署。