跨导联注意力变换器与生成对抗网络过采样用于鲁棒心电图心律失常检测Cross-Lead Attention Transformers with GAN Oversampling for Robust ECG Arrhythmia Detection

环球医讯 / AI与医疗健康来源:www.mdpi.com阿尔及利亚 - 英文2026-10-09 13:44:17 - 阅读时长39分钟 - 19277字
本文提出一种结合逐导联卷积编码器与跨导联变换器的混合深度学习框架,用于鲁棒的心电图心律失常检测。该框架通过生成对抗网络合成罕见心律失常的生理学合理心拍片段以解决类别不平衡问题,利用注意力机制提供临床可解释的可视化,并通过剪枝和量化实现高效部署。在MIT-BIH心律失常数据库上的实验取得了99.67%的准确率、99.66%的F1分数和99.8%的AUC。在ECG5000和圣彼得堡INCART数据集上的外部验证证实了其强大的泛化能力,F1分数分别为97.6%和98%。该框架在准确、可解释、稳定和可部署的心律失常检测方面表现出色,适用于多样化的临床环境。
心电图心律失常心脏健康心血管疾病健康监测深度学习生成对抗网络数据增强跨导联注意力可解释性临床部署
跨导联注意力变换器与生成对抗网络过采样用于鲁棒心电图心律失常检测

从心电图准确检测心脏心律失常对于罕见心律类别仍然具有挑战性,原因是类别不平衡和形态变异性。我们提出了一种混合深度学习框架,该框架结合了逐导联卷积编码器和一个跨导联变换器,后者通过自注意力建模不同导联信号之间的关系,并接受可变的导联配置。为了解决少数类稀缺问题,生成对抗网络为代表性不足的心律失常合成生理学上合理的心拍片段。基于注意力的可视化定位了与临床有意义结构一致的影响性波形区域。训练后剪枝和INT8量化使得在性能损失最小的情况下实现高效部署。在MIT-BIH心律失常数据库上,针对16种心跳类别的双导联记录进行了大量实验,在十次独立运行中取得了优异结果:准确率99.67%,F1分数99.66%,AUC 99.8%。在ECG5000单导联数据集和圣彼得堡INCART十二导联数据集上的外部验证证实了其强大的泛化能力,F1分数分别为97.6%和98%。我们的框架在多样化的临床环境中提供了准确、可解释、稳定且可部署的心律失常检测。

  1. 引言

心血管疾病仍然是全球主要的死亡原因,每年导致近1800万人死亡[1]。其中,心脏心律失常,即心脏电活动的异常,构成特定风险,如果不及时识别,可能导致中风、心脏骤停或心力衰竭。心电图是检测心律失常的主要非侵入性诊断方法,能够识别常见和罕见的心律紊乱。因此,早期准确检测对于有效的临床决策和改善患者预后至关重要[2,3]。

罕见心律失常的临床意义远远超出其低发病率,因为它们通常预示着急性、危及生命的状况。心室扑动可在数秒内恶化为心室颤动。尽管其占记录心电图的不到0.1%,但约占心脏性猝死病例的10%[4]。室性自主节律提示起搏器故障,延迟检测会使梗死后死亡率每小时增加23%[5]。房扑若不治疗,年卒中风险为3%至5%,但其细微的锯齿波模式常被误认为是窦性心动过速[6]。室上性快速性心律失常虽然通常为良性,但在脆弱患者中可能引发血流动力学崩溃[7]。这些诊断挑战因形态变异性而加剧,这种变异性甚至会使经验丰富的心脏病专家感到困惑[8]。能够可靠检测这些模式的自动化系统可以提供关键决策支持,特别是在资源匮乏的环境中,从而实施预防性干预,防止下游并发症并减少医疗资源利用。

然而,自动心电图分析面临多重挑战。信号本身是非平稳的,并表现出显著的患者间变异性、噪声和伪影[5]。临床数据集中严重的类别不平衡进一步复杂化了罕见心律失常的检测,其中正常心拍占主导地位,而危及生命的心律严重代表性不足。这种不平衡使传统机器学习模型偏向多数类,降低了对临床关键事件的敏感性[9]。

深度学习已显著推进了心电图心律失常检测。卷积神经网络和循环神经网络从原始信号中自动提取判别性特征,优于手工方法[10,11,12]。最近,变换器架构在建模长程时间依赖性和导联间关系方面展现了卓越的能力[4,8,13]。尽管有这些进展,现有方法由于数据不平衡,在处理不常见心律失常时仍然存在困难,并且通常作为黑盒系统运行,解释性有限,这限制了临床采用[6]。

为了解决这些限制,我们提出了一种用于罕见心律失常检测的混合深度学习框架。所提出的模型集成了用于局部特征提取的逐导联卷积编码器和一个跨导联变换器,该变换器捕获时间和导联之间的上下文依赖关系。生成对抗网络用合成心拍增强代表性不足的类别[14,15],而注意力机制提供了与临床相关特征一致的可解释性[16,17]。训练后剪枝和量化使得在资源受限环境中实现高效部署[18]。

所提出的框架对该领域做出了三项主要贡献。首先,它引入了一种混合卷积神经网络和变换器架构,具有跨导联注意力,既能捕获时间依赖关系,也能捕获导联间相关性,从而能够检测在不同导联上表现不同的细微心律失常。该模型的注意力机制提供了临床可解释的可视化,并通过与专家注释的交并比分数0.73进行了验证。其次,它结合了基于生成对抗网络的数据增强与全面的定量验证,包括相似性度量、专家临床审查确认合成样本在生理学上是合理的,以及下游任务评估证明对罕见类别敏感性的持续改善。第三,它提出了一个集成系统,通过训练后优化平衡了准确性、可解释性和计算效率,大幅减少了模型大小和推理延迟,同时保持了诊断性能,适用于便携式和床边监测设备的实时部署。

我们在MIT-BIH心律失常数据库上广泛评估了我们的方法,在十次独立运行中实现了99.67%的准确率。在两个额外数据集上的外部验证确认了泛化能力,F1分数超过97%。关键的是,该模型对临床显著的罕见心律失常保持高敏感性,证明了其在检测危及生命状况方面的有效性。这些结果确立了所提出的系统作为一种临床稳健、统计可靠且实际可部署的自动心电图解读解决方案。

  1. 相关工作

心电图心律失常检测的研究在过去二十年中经历了显著的演变,从经典的机器学习方法发展到现代的深度学习架构[19,20]。初始方法主要依赖于与传统分类器集成的手工特征提取技术。常用特征包括时域间期、形态学描述符和频域特征,然后通过支持向量机、k近邻和决策树等算法进行处理[21,22]。Mohebbanaaz等人[23]引入了一种优化的决策树以及自适应提升变体,用于改进心电图心拍分类,而Osowski等人[24]设计了一种基于支持向量机技术的自动心律失常检测系统,旨在提高心脏诊断的准确性和效率。Martínez-Khatibi等人[25]提出了一种特征工程策略,将深度学习与k近邻相结合,用于心电图心拍分类和心律失常识别,提高了诊断精度。尽管取得了一定成功,但这些方法严重依赖于特征工程的质量,并且经常面临跨患者泛化或管理罕见心律失常变异性的挑战。

深度学习通过实现直接从原始数据自动提取特征,引发了心电图信号分析的重大变革。由于卷积神经网络能够捕获心电图波形中的局部形态模式,已被广泛使用,其性能优于基于手工特征的方法。在文献[26]中,Jin等人提出了一种知识融合的深度神经网络,在自动心律失常诊断中实现了心脏病专家级别的性能,同时确保了临床使用的可解释性。相比之下,Abdalla等人[27]利用深度卷积神经网络进行心电图信号分类,实现了对多种心律失常类别的鲁棒识别。后来的研究引入了循环神经网络,特别是长短期记忆模型,以有效建模连续心跳之间的时间关系;如Tyagi等人[28]所示,深度学习技术在心律失常分析中显示出巨大潜力。此外,还探索了集成CNN和RNN组件的架构,以利用空间和时间信息。例如,Eleyan等人[29]引入了一种深度学习方法,将卷积层与LSTM单元相结合,以改进基于心电图的早搏分类。最近,Bi等人[30]开发了一种具有多个并行分支和多头注意力模块的时间卷积网络,能够从心电图信号中高精度识别心律失常,而Kan等人[31]提出了一种基于卷积神经网络的自动胎儿心律失常检测方法,该网络设计有多个并行分支和尺度特定的特征提取路径,旨在提高产前心脏诊断的准确性。尽管取得了这些进展,此类架构通常难以捕捉跨多个导联的长程依赖关系,而这对于检测复杂心律失常至关重要。

最近,受到在自然语言处理中成功的启发,基于变换器的模型已被研究用于心电图分类。诸如CATransformer[32]、ECG-TransCovNet[33]和DeepECG-Net[34]等架构利用自注意力机制建模长程关系和导联间关系,从而在准确性和可解释性方面取得了改进。Ji等人[35]提出了MSGformer,一种为12导联心电图分析量身定制的多尺度网格变换器网络,能够实现精确的心律失常检测,而Zhang等人[36]提出了一种分层导联感知变换器与卷积融合网络,通过利用跨多个导联的信息提高分类性能。Choi等人[37]开发了一种双路径变换器,Jiang等人[38]设计了DCETEN,一种轻量级的基于变换器的自动心电图分类网络,在平衡高准确度和降低计算成本方面表现良好。尽管这些模型为分析多导联信号提供了一个灵活的框架,但它们应用于罕见心律失常检测方面仍相对未被充分探索。

心律失常检测中的另一个重要挑战是类别不平衡,因为大多数心电图数据集包含大量正常心拍和非常少的罕见但临床显著的心律失常实例。已经引入了多种方法来解决这一挑战,包括过采样技术如合成少数类过采样技术[39],以及基于变分自编码器[40]和生成对抗网络[15]的生成方法,这些方法为代表性不足的类别生成合成心电图信号。Delaney等人[41]证明了生成对抗网络在生成现实性心律失常心拍方面的有效性,而Golany等人[14]提出了增强策略,改进了深度学习模型对类别不平衡的鲁棒性。Cao等人[42]进一步引入了一种特征匹配的心电图生成网络,以增强数据多样性和分类性能,Soltanieh等人[43]集成了一种自监督心电图表示学习框架,能够处理来自分布内和分布外源的数据。还应用了涉及信号变换和噪声注入的数据增强策略,Kachuee等人[44]表明,精心设计的增强流程可以提高跨患者群体的泛化能力。虽然这些方法在减轻不平衡方面显示出了前景,但将它们有效集成到高容量深度学习架构中仍然是一个挑战。

与此同时,增强深度学习模型的可解释性已成为一个关键研究焦点,尤其是在透明决策至关重要的临床环境中。诸如梯度加权类激活映射[45]、显著性图[46]和基于注意力的可视化技术[47]等方法已被用于突出显示与模型预测最相关的心电图片段。Strodthoff等人[6]应用显著性图可视化心律失常分类中的决策区域,Attia等人[48]研究了可解释的深度学习模型来预测房颤。Kilic等人[49]在多导联心电图数据上应用了基于SHAP的分析,为特定心律失常检测提供了可解释的见解,而Gliner等人[50]强调了临床上有意义的可解释性,以确保模型决策在医疗实践中保持透明和有用。类似地,Ojha等人[51]探索了用于心电图数据分类的可解释人工智能技术,旨在增强透明度和对自动心脏诊断的信任。这些方法提供了对模型决策过程的有意义理解,促进了临床医生之间的信任,然而许多方法仍停留在定性层面,缺乏严格的定量验证。

尽管取得了这些进展,文献中仍存在一个空白。很少有工作将用于罕见心律失常检测的基于GAN的数据增强、用于上下文建模的跨导联变换器架构以及用于临床对齐可解释性的注意力机制相结合,同时还通过剪枝和量化解决实时部署问题。我们的工作旨在通过提出一个端到端模型来弥合这一差距,该模型平衡了准确性、可解释性和效率,确保高研究影响力和实际临床适用性。

  1. 模型

3.1. 架构概述

如图1所示,所提出的框架通过几个集成阶段处理多导联心电图信号。该架构设计用于适应可变的导联配置,从单导联到完整的12导联临床系统,通过其灵活的逐导联处理和融合机制实现。

首先,每个导联专用的卷积编码器独立提取局部形态特征,如QRS波群和P波或T波。然后,这些逐导联表示被融合成一个统一的序列,并添加学习到的位置编码以保持时间顺序。使用共享权重的逐导联编码器使模型天生具有导联无关性:相同的架构可以在无需修改的情况下处理任意数量的导联,因为每个导联在融合前被独立编码。

这个融合后的序列通过一个堆叠的变换器编码器,这些编码器配备了跨导联注意力机制。这使得模型能够捕获每个导联内的时间依赖关系以及不同导联之间的相关性,这些能力对于检测可能在不同通道上表现不同的细微心律失常至关重要。然后,一个全局池化操作跨时间和导联聚合上下文表示,生成一个紧凑的特征向量,该向量被送入一个带有softmax层的多层感知器以输出类别概率。

为了对抗类别不平衡,训练数据通过GAN生成的、现实的罕见心律失常合成心拍进行增强。变换器的注意力权重也为模型可解释性提供了基础,使得能够可视化对预测最有影响的波形区域。最后,训练后剪枝和量化优化模型,以便在资源受限的设备上高效实时部署,减少模型大小和推理延迟,同时保持诊断性能。

3.2. 数据准备与特征提取

这个初始阶段将原始心电图信号转换为适合深度学习的结构化、平衡的表示。

3.2.1. 数据预处理

原始心电图信号经过几个步骤以确保一致性。首先,使用动态阈值检测R峰。然后,提取以每个R峰为中心的固定长度窗口,以创建单个心拍片段:

s_i = {x(t_r - Δ), ..., x(t_r + Δ)}, (1)

其中t_r是R峰时间,Δ是窗口大小的一半,确保每个片段包含完整的P-QRS-T周期。最后,每个片段被归一化为零均值和单位方差,以考虑患者间的变异。

3.2.2. 数据增强

为了解决严重的类别不平衡,我们采用生成对抗网络进行合成过采样。生成器G(z)学习从随机噪声z创建现实的心电图信号,而判别器D则试图将其与真实心拍区分开来。这种对抗过程由最小最大目标控制:

min_G max_D E_{x~p_data}[log D(x)] + E_{z~p(z)}[log(1 - D(G(z)))], (2)

这迫使生成器产生生理学上合理且多样化的信号。由此产生的增强数据集改善了类别平衡,使模型能够为临床关键但罕见的心律学习鲁棒特征。

3.2.3. 逐导联特征提取

预处理后,每个心电图导联通过专用的卷积编码器。一维卷积将可学习滤波器应用于信号:

h_j(t) = (x * w_j)(t) = Σ_τ x(t - τ) w_j(τ) , (3)

其中w_j是第j个滤波器的核函数。然后应用非线性激活函数(ReLU),随后进行最大池化以降低维数并提高鲁棒性。输出是每个导联的紧凑特征向量,保留了局部形态信息,如QRS形态或ST段抬高。

3.3. 表示融合与上下文建模

这个阶段整合了导联级特征并建模其依赖关系,这对于识别具有细微跨导联表现的心律失常至关重要。

3.3.1. 多导联特征融合

如果用f^l ∈ R^d表示来自导联l的特征向量,则所有L个导联的向量首先连接成一个单一序列:

F = [f^1, f^2, ..., f^L] ∈ R^{L×d}。 (4)

为了保持时间顺序,学习到的位置嵌入p_t被添加到这些特征向量中,创建了一个时间感知的融合表示。

3.3.2. 上下文建模

融合后的序列由堆叠的变换器编码器块处理。这些块的核心是多头自注意力,它允许模型动态权衡不同时间步和导联的重要性。对于输入序列X,注意力计算为:

Attention(Q, K, V) = softmax(QK^T / √d_k) V, (5)

其中Q、K和V是输入的学习投影。使用h个并行注意力头使模型能够捕获多样的跨导联和时间关系。每个变换器块还包括一个位置逐点前馈网络,带有残差连接和层归一化,以确保稳定训练。通过堆叠多个块,模型学习到越来越抽象的模式。这些块产生的注意力权重作为模型可解释性的基础。

3.4. 预测与优化

这个最终阶段将学习到的表示转换为预测,启用可解释性,并优化部署。全局平均池化将变换器输出聚合成一个固定长度的向量,然后由带有softmax的多层感知器将其映射到类别概率。为了可解释性,变换器的注意力权重被投影回心电图波形,生成突出显示有影响片段的热力图,并通过与心脏病专家注释区域的定量验证确保临床一致性。

为了能够在资源受限设备上部署,训练后剪枝移除低于阈值ε的权重:

w' = {0 if |w| < ε, w otherwise}。 (6)

这减少了模型大小和计算成本,同时保持了诊断性能。然后对优化后的模型进行基准测试,确保其推理延迟低于连续心跳之间的平均间隔,从而保证实时临床运行。

  1. 实验设置

4.1. 数据集

在本研究中,我们在三种不同的导联配置上评估所提出的架构:ECG5000数据集[52]的单导联记录、MIT-BIH心律失常数据库[2]的双导联记录以及圣彼得堡INCART数据集[3]的12导联记录。这些实验证明了我们的方法在不同临床设置和记录设备中的灵活性和泛化能力。

4.1.1. MIT-BIH心律失常数据库

所有主要实验均使用MIT-BIH心律失常数据库[2]进行,该数据库包含来自47名受试者的48个半小时双导联心电图记录,以360 Hz采样,11位分辨率[3]。每个记录由至少两名心脏病专家独立注释,提供了约110,000个心拍级标签,涵盖16种不同的心拍类别,包括正常窦性心律、常见心律失常以及罕见但临床显著的心律,如室性自主节律和心室扑动。

使用360毫秒的窗口(每个注释R峰前后Δ=180毫秒)提取以心拍为中心的片段,捕获完整的P-QRS-T周期。每个片段被归一为了解决患者间的振幅变异性。

3.2.2. 数据增强

为了解决严重的类别不平衡,我们采用生成对抗网络进行合成过采样。生成器G(z)学习从随机噪声z创建现实的心电图信号,而判别器D则试图将其与真实心拍区分开来。这种对抗过程由最小最大目标控制:

min_G max_D E_{x~p_data}[log D(x)] + E_{z~p(z)}[log(1 - D(G(z)))], (2)

这迫使生成器产生生理学上合理且多样化的信号。由此产生的增强数据集改善了类别平衡,使模型能够为临床关键但罕见的心律学习鲁棒特征。

3.2.3. 逐导联特征提取

预处理后,每个心电图导联通过专用的卷积编码器。一维卷积将可学习滤波器应用于信号:

h_j(t) = (x * w_j)(t) = Σ_τ x(t - τ) w_j(τ) , (3)

其中w_j是第j个滤波器的核函数。然后应用非线性激活函数(ReLU),随后进行最大池化以降低维数并提高鲁棒性。输出是每个导联的紧凑特征向量,保留了局部形态信息,如QRS形态或ST段抬高。

3.3. 表示融合与上下文建模

这个阶段整合了导联级特征并建模其依赖关系,这对于识别具有细微跨导联表现的心律失常至关重要。

3.3.1. 多导联特征融合

如果用f^l ∈ R^d表示来自导联l的特征向量,则所有L个导联的向量首先连接成一个单一序列:

F = [f^1, f^2, ..., f^L] ∈ R^{L×d}。 (4)

为了保持时间顺序,学习到的位置嵌入p_t被添加到这些特征向量中,创建了一个时间感知的融合表示。

3.3.2. 上下文建模

融合后的序列由堆叠的变换器编码器块处理。这些块的核心是多头自注意力,它允许模型动态权衡不同时间步和导联的重要性。对于输入序列X,注意力计算为:

Attention(Q, K, V) = softmax(QK^T / √d_k) V, (5)

其中Q、K和V是输入的学习投影。使用h个并行注意力头使模型能够捕获多样的跨导联和时间关系。每个变换器块还包括一个位置逐点前馈网络,带有残差连接和层归一化,以确保稳定训练。通过堆叠多个块,模型学习到越来越抽象的模式。这些块产生的注意力权重作为模型可解释性的基础。

3.4. 预测与优化

这个最终阶段将学习到的表示转换为预测,启用可解释性,并优化部署。全局平均池化将变换器输出聚合成一个固定长度的向量,然后由带有softmax的多层感知器将其映射到类别概率。为了可解释性,变换器的注意力权重被投影回心电图波形,生成突出显示有影响片段的热力图,并通过与心脏病专家注释区域的定量验证确保临床一致性。

为了能够在资源受限设备上部署,训练后剪枝移除低于阈值ε的权重:

w' = {0 if |w| < ε, w otherwise}。 (6)

这减少了模型大小和计算成本,同时保持了诊断性能。然后对优化后的模型进行基准测试,确保其推理延迟低于连续心跳之间的平均间隔,从而保证实时临床运行。

  1. 实验设置

4.1. 数据集

在本研究中,我们在三种不同的导联配置上评估所提出的架构:ECG5000数据集[52]的单导联记录、MIT-BIH心律失常数据库[2]的双导联记录以及圣彼得堡INCART数据集[3]的12导联记录。这些实验证明了我们的方法在不同临床设置和记录设备中的灵活性和泛化能力。

4.1.1. MIT-BIH心律失常数据库

所有主要实验均使用MIT-BIH心律失常数据库[2]进行,该数据库包含来自47名受试者的48个半小时双导联心电图记录,以360 Hz采样,11位分辨率[3]。每个记录由至少两名心脏病专家独立注释,提供了约110,000个心拍级标签,涵盖16种不同的心拍类别,包括正常窦性心律、常见心律失常以及罕见但临床显著的心律,如室性自主节律和心室扑动。使用360毫秒的窗口(每个注释R峰前后Δ=180毫秒)提取以心拍为中心的片段,捕获完整的P-QRS-T周期。每个片段被归一化为零均值和单位方差,以缓解患者间的振幅变异性。

为了防止数据泄漏,实施了严格的受试者级划分。记录201和202来自同一受试者[2];两者均被分配到训练集。47名受试者按60%、15%和25%的比例划分为28名患者(60%)用于训练,7名患者(15%)用于验证,12名患者(25%)用于测试,在确保足够训练数据的同时兼顾了可靠评估稀有类别的需要。我们验证了所有16个类别均出现在每个划分中,并且每个稀有心律失常在每次划分中都至少由两名不同的患者代表,确保了评估的是泛化性能而非患者特定的记忆效应。

4.1.2. 外部验证数据集

为了严格评估泛化能力和实际应用性,我们采用了两个具有不同特征的互补外部数据集:

ECG5000 [52]:包含来自一名充血性心力衰竭患者的5000个预提取心跳片段(每个片段140个时间点)。该数据集包含五个心跳类别,存在极端类别不平衡:正常心跳(类别1,2500个训练样本)和四种心律失常类型(类别2-5,其中最稀有的“未知病理”类别仅包含15个训练样本,占数据的0.3%)。该数据集因其单患者来源以及需区分细微形态变异而极具挑战性。我们遵循了先前工作中使用的500/4500训练/测试划分[52]。

圣彼得堡INCART 12导联心律失常数据库[3]:提供来自32名确诊冠状动脉疾病患者的75个注释记录,以257 Hz的频率采样,包含12个标准导联。该数据集包含超过175,000个跨多个心律失常类别的心跳注释,为测试模型泛化到更高导联计数和临床不同人群的能力提供了严格测试。我们维持了严格的受试者级60/15/25分层划分:19名患者用于训练,5名用于验证,8名用于测试,没有患者出现在多个划分中。

所有数据集都遵循相同的预处理流程,包括R峰检测、以心拍为中心的窗口提取(Δ=180毫秒)、归一化为零均值和单位方差,以及重采样至360 Hz,以确保实验间的一致性。

4.2. 超参数

所提出模型的训练和评估使用了经过仔细优化的超参数,以确保稳定收敛、鲁棒性能和可复现性。表1总结了关键设置,包括分类器参数、架构配置和GAN参数。这些设置在准确性、泛化能力和计算效率之间取得了合适的平衡,同时使GAN能够为罕见心律失常类别生成生理学上真实的合成心跳。所有实验均在配备NVIDIA Tesla V100 GPU(32 GB VRAM)、Intel Xeon Gold 6248 CPU和256 GB RAM的系统上进行。软件环境为Ubuntu 20.04.6 LTS,配备PyTorch 2.1.0、CUDA 11.8和cuDNN 8.7.0。每次运行(100个周期)的训练时间约为6.5小时,GAN预训练需要额外3.2小时。在NVIDIA Jetson Xavier NX(8 GB)上进行了部署测试,以验证实时可行性。

  1. 结果

5.1. 性能评估

通过包括准确率、精确率、召回率、F1分数和AUC-ROC在内的指标评估模型的有效性。为确保统计可靠性,所有实验均使用不同的随机初始化重复10次独立训练运行,结果以均值±标准差报告。通过10,000次重采样计算自举置信区间(95%),以确认统计显著性。

5.1.1. 主要结果

所提出的模型在MIT-BIH心律失常数据库上,十次独立运行的平均准确率为99.67% ± 0.08%,所有16个类别的精确率、召回率和F1分数均持续超过99.6%。每种心律失常类型的AUC-ROC均超过0.99。图2和3展示了模型的收敛行为。准确率曲线显示在初始epoch期间稳步提升,稳定在99%以上,训练和验证轨迹之间紧密对齐。损失曲线显示出快速初始下降,随后平稳达到平台期,确认了成功的泛化,没有过拟合。

图4展示了所有16个心跳类别的混淆矩阵。对角线值范围从90.64%到100%,其中十个类别实现了完美分类:AB、IVR、NOD、PREX、SBR、SVTA、VFL、VT、MISSB和TS。AFL实现了99.76%的准确率,只有0.2%被误分类为AFIB。B实现了99.43%的准确率。N是形态变异性最大的类别,实现了90.64%的准确率,误分类主要流向T(2.3%)、AFIB(1.63%)和B(1.05%)。

误分类主要发生在形态相似的心律之间,这反映了临床诊断挑战。AFIB实现了97.94%的正确分类,与AFL、B、N和T之间存在轻微混淆。N误分类为T、AFIB和B与临床上合理的歧义一致。VT和VFL实现了完美分类,确认了对危及生命的室性心律失常的敏感性。

表2展示了详细的逐类别指标。正常窦性心律(N)的召回率为90.70% ± 0.48%,精确率为98.86% ± 0.21%,F1分数为94.59% ± 0.35%。主要误分类一致为T(2.3% ± 0.12%)、AFIB(1.63% ± 0.09%)和B(1.05% ± 0.06%)。

几种罕见心律失常实现了完美分类且方差为零:AB、IVR、NOD、PREX、SBR、SVTA、VFL、VT和MISSB。AFL的F1分数为99.40% ± 0.11%,B达到98.79% ± 0.16%。AFIB的F1为97.68% ± 0.22%,T为98.17% ± 0.18%,TS为98.90% ± 0.12%。持续较低的标准偏差确认了所有类别鲁棒且可复现的性能。

5.1.2. 跨数据集泛化

为了评估所提出模型在MIT-BIH心律失常数据库之外的泛化能力,我们在两个互补的外部数据集上进行了实验:ECG5000 [52]和圣彼得堡INCART 12导联心律失常数据库[3]。表3展示了在ECG5000数据集上五次独立运行的逐类别性能。模型在ECG5000数据集上实现了97.6%的总体F1分数,在正常类别上实现了近乎完美的性能(98.9% F1)。性能随类别稀有度逐渐下降:类别2达到97.1% F1,类别3达到95.8% F1,类别4达到93.2% F1,最稀有的类别(类别5)尽管只有15个训练样本,仍达到了88.4% F1。标准差随着类别稀有度成比例增加,从正常类别的±0.16%到类别5的±1.30%,反映了有限样本下的预期变异性。自举置信区间为总体准确率生成95%置信区间[97.5%, 98.1%]。

圣彼得堡INCART数据集上五次独立运行的总体性能指标总结在表4中。在该数据集上,模型实现了98.2%的总体准确率,所有评估指标均超过98.0%,标准差较低,范围从±0.08%到±0.18%。AUC-ROC为99.1%,反映了所有类别的强大区分能力。自举分析为准确率生成95%置信区间[98.0%, 98.4%]。

选定心律失常类别的类别特定性能指标详见表5。所有类别均观察到强大性能,F1分数范围从92.5%到99.1%。正常类别的F1分数为99.1%,变异性极小(±0.10%)。对于具有数百个测试样本的常见心律失常,F1分数超过97.2%,标准差低于0.30%。对于测试样本少于100个的较稀有类别,性能仍然稳健:室性逸搏的F1为95.1%,室性自主节律的F1为93.8%,心室扑动的F1为92.5%。随着样本量的减少,标准差增加,最稀有类别达到±1.20%。

McNemar检验显示,对于12个重叠类别中的10个,MIT-BIH和INCART预测之间没有显著差异(p > 0.05),表明尽管导联配置不同,但分类行为一致。

不同数据集的性能各不相同,MIT-BIH达到了最高准确率(99.67%),其次是INCART(98.2%)和ECG5000(97.8%)。这种差异反映了数据集复杂性、导联配置和患者人群的差异。所有数据集的标准差始终较低(±0.08%至±0.23%),表明无论评估设置如何,性能都稳定且可复现。

5.2. 可解释性分析

所提出模型的可解释性通过代表性心电图信号上的注意力权重可视化以及针对专家注释区域的定量验证来评估。图5展示了四种不同心律的注意力加权预测:正常窦性心律、心房扑动、室性自主节律和室上性快速性心律失常。阴影区域表示模型分配较高注意力的区域,突出了对分类决策最有影响的波形片段。

对于正常窦性心律,注意力主要集中在QRS复合波上,这是确认健康心律的主要特征。在心房扑动中,注意力集中在重复性锯齿扑动波上,这是一个诊断标志。对于室性自主节律,注意力强调了与心室起源一致的增宽和异常形态的QRS复合波。在室上性快速性心律失常中,模型突出了围绕快速心房活动和异常P波形态的区域,注意力峰值恰好位于异常片段处。

为了客观验证临床相关性,两名心脏病专家独立注释了500个分层选择的心电图片段中的感兴趣区域,包括P波、QRS复合波、T波和心律失常特定特征,这些片段涵盖了所有16个类别。注释者间一致性很好,Cohen's kappa为0.89。表6展示了比较注意力突出区域与专家注释的定量指标。

总体交并比为0.73,表明注意力和临床相关区域之间存在显著的空间一致性,对于诊断意义最重要的特征QRS复合波,IoU达到了0.81。注意力-ROI相关性为0.76,确认了与临床重要性的一致性,QRS复合波的相关系数更高,为0.84。插入和删除分数分别为87.3%和91.5%,确认了注意力突出的区域确实对模型决策有实质性影响。心脏病专家对注意力图的临床相关性评分为4.2分(满分5分),其中87%的评分在4分或以上。

表7将我们的内在注意力机制与事后可解释性方法Grad-CAM进行了比较。我们的方法在所有指标上均显著优于Grad-CAM(p < 0.01)。

这些结果表明,该模型始终通过生理学上可解释的推理(而非虚假相关性)突出显示临床相关的心电图特征。注意力图与心脏病专家注释区域之间的高度一致性支持了该模型作为透明临床决策支持工具的潜力。

5.3. 合成信号评估

为了评估用于数据增强的合成心拍的质量和生理学合理性,我们将5000个生成样本(来自IVR、VFL、AFL、SVTA和异常房性早搏各1000个)与来自相应MIT-BIH类别的真实心拍进行了比较。所有信号均被归一化并重采样至360 Hz。

表8展示了比较合成心拍和真实心拍的定量相似性指标。平均动态时间规整为0.31,表明合成信号与真实信号之间具有良好的形态对齐。相关性为0.84,确认了强线性关系。最大均值差异为0.042(低于0.05),表明分布统计上相似。信噪比为23.7 dB,表明引入的噪声极小,与典型记录条件相当。

表9显示了生成保真度的类别特定变异。具有独特形态的类别(VFL和SVTA)显示出更高的保真度(DTW < 0.30,相关性 > 0.85)。具有细微或可变特征的类别(IVR和a)更具挑战性,相应具有更高的DTW和更低的相关性。各类别间的类内方差比(合成对真实)范围从0.88到1.12,表明保持了多样性,没有模式崩溃。

两名心脏病专家以盲法方式评估了200个合成心拍和200个真实心拍,两次评估间隔两周。表10总结了该专家评估的结果。

47.8%的识别准确率(低于随机水平)表明感知层面的高度真实性。91.5%的诊断一致性确认了临床相关特征得以保留。4.1/5的合理性评分反映了高度的真实性,7.5%的T波和4.2%的P波中存在轻微伪影。

在五次运行中,比较了模型在仅使用真实数据与使用增强数据训练时的性能。表11展示了增强后稀有类别F1分数的提升。

数据增强使稀有类别的F1分数提高了0.8至1.5个百分点(所有p < 0.05),对于最具挑战性的类别提升最大。增强条件下的标准差降低以下是接续前文的翻译结果:

(0.3–0.6% vs 0.4–0.8%),表明训练稳定性提高。评估确认,GAN生成的心拍与真实信号具有良好的形态相似性(DTW = 0.31,相关性 = 0.84),保留了诊断相关特征(91.5%一致性),并且感知上逼真(47.8%专家识别准确率)。与类别相关的质量变化与形态独特性相关。数据增强使F1分数在统计上显著提高了0.8至1.5个百分点,并减少了训练变异性,证实了其在解决类别不平衡方面的实际效用。

5.4. 消融研究

在相同的训练条件下,我们对MIT-BIH心律失常数据库进行了消融研究,以评估每个组成部分的影响。所有消融实验重复进行五次独立运行以确保统计有效性,结果以均值±标准差报告。使用配对t检验(p < 0.01)评估性能差异的显著性。分析集中于数据增强、跨导联变换器编码器、注意力机制以及剪枝与量化。使用准确性、F1分数、AUC-ROC和效率指标评估性能,结果如表12所示。

第一组实验检验了数据增强在解决类别不平衡中的作用。当模型在没有生成增强的情况下训练时,多数类(正常窦性心律)的性能保持高位,但稀有类别出现了明显退化。例如,室性自主节律的F1分数从100.0% ± 0.00%下降到98.2% ± 0.52%,而心室扑动的F1分数从100.0% ± 0.00%下降到97.5% ± 0.61%。这种对稀有心律失常敏感性的下降导致总体宏平均F1分数从99.66%降至94.75%,如表12所示。统计分析确认这种退化是显著的(p < 0.001,配对t检验)。相比之下,增强模型在常见和稀有类别之间保持了平衡的性能,且不影响模型大小、FLOPs或推理速度。

第二个实验阶段评估了跨导联变换器编码器的贡献。在此变体中,变换器块被替换为一个更简单的循环神经网络模块,同时保留卷积编码器。如表12所示,用RNN替换变换器导致性能显著下降(p < 0.001),准确率从99.67% ± 0.08%降至99.02% ± 0.15%,F1分数从99.66% ± 0.08%降至97.10% ± 0.31%,AUC从99.8% ± 0.05%降至98.3% ± 0.19%。尽管基于RNN的变体所需的参数和计算略少,但性能损失是显著的,证明了变换器在捕获长程时间依赖性和导联间关系方面的有效性。

第三个消融实验聚焦于注意力机制。如表12所示,移除注意力层导致总体数值性能出现适度但统计显著的下滑:准确率从99.67% ± 0.08%降至99.10% ± 0.12%(p < 0.01),F1分数从99.66% ± 0.08%降至98.60% ± 0.18%(p < 0.01)。重要的是,模型大小、FLOPs和推理时间保持不变。虽然性能下降是适度的,但最重要的影响在于可解释性。没有注意力,模型无法清晰指示哪些波形片段驱动了其预测。相比之下,注意力实现了临床有意义的解释,如5.2节所示,注意力始终突出显示诊断相关区域,与专家注释的IoU为0.73。

最后,我们研究了通过剪枝和量化进行实时优化的效果。如表12所示,剪枝使模型大小从45 MB减少到27 MB(减少40%),FLOPs从1.20 G降至0.78 G,推理时间从12毫秒加快到8毫秒。这种压缩引入了可忽略的性能损失,准确率从99.67% ± 0.08%降至99.55% ± 0.10%(p > 0.05)。量化到8位精度进一步将内存需求降低到22 MB(减少51%),并将推理时间提高到7毫秒,同时保持了99.40% ± 0.11%的准确率和99.30% ± 0.13%的F1分数。统计分析确认,无论是剪枝还是量化,均未造成与完整模型相比的显著退化(所有指标p > 0.05)。

5.5. 对比分析

所提出模型与选定最先进心律失常检测方法的对比概览见表13。尽管许多现有方法在基准数据集上取得了值得称赞的结果,但对报告指标的详细检查显示,所提出的系统提供了更平衡和鲁棒的性能,同时还解决了诸如类别不平衡、可解释性、统计稳定性和实时可部署性等关键限制。

早期的卷积方法,如文献[53]中的深度CNN和文献[9]中具有四个卷积层和两个全连接层的CNN架构,展示了卷积滤波器捕获心电信号形态模式的潜力。这些工作获得了高于98%的高准确率和AUC值。然而,它们的召回率和F1分数相对较低,特别是对于少数心律失常类别,表明虽然它们擅长识别如正常窦性心拍等主导心律,但泛化到稀有心律失常的能力仍然有限。这种模式反映了心律失常检测中的一个更广泛挑战:强大的总体准确率并不一定能保证对罕见但临床重要状况的可靠识别。

混合CNN-RNN模型,如文献[54]中的CNN-LSTM框架,试图通过将循环层与卷积编码器集成来解决时间依赖性问题。虽然这改善了上下文建模,并使准确率超过99%,但稀有心律失常的召回率仍低于最优水平,导致F1分数约为94%。这表明添加循环增强了时间敏感性,但在处理对于细微心律失常判别至关重要的导联间相关性和长程依赖性方面仍存在困难。

最近的研究转向了基于变换器的设计,如ECG-DETR [4]和ECG-TransCovNet [33],它们利用注意力机制捕获长程时间和心拍间关系。这些架构取得了有竞争力的准确率和AUC值,但它们的召回率和F1分数落后,特别是在不平衡的数据集上。例如,ECG-DETR报告了99.49%的准确率,但F1分数仅为93.88%,凸显了原始分类能力与跨类别的平衡检测性能之间的差距。这一不足凸显了需要补充策略(如数据增强)来减轻不平衡问题。

替代性设计,如文献[55]中的2D CNN模型和文献[56]中的混合CNN-BiLSTM模型DeepArr,报告了强劲的性能,准确率和精确率接近所提出的系统。2D CNN实现了近乎完美的指标,AUC为1.0,但这些结果部分依赖于可能无法完全反映患者间变异的评估协议。类似地,DeepArr提供了97.63%的F1分数以及平衡的敏感性和特异性。然而,这两项研究均未提供可解释性,而这是临床转化的决定性因素。没有解释哪些心电图区域驱动了预测,这些模型仍然是黑盒工具,限制了它们在真实世界医疗工作流程中的应用。

与大多数仅报告单次训练运行结果的先前工作不同,我们的模型在十次独立运行中展现出卓越的统计稳定性,所有全局指标的标准差低于0.1%。这种可复现性对于临床部署至关重要,因为一致性的性能是必不可少的。

相比之下,所提出的系统在所有指标上均实现了优越且更平衡的结果:准确率99.67% ± 0.08%,精确率99.65% ± 0.09%,召回率99.66% ± 0.08%,F1分数99.66% ± 0.08%,AUC 99.8% ± 0.05%。这些改进源于三个核心设计创新。首先,跨导联变换器的集成能够有效建模导联间依赖性,解决了在CNN-LSTM和单导联变换器方法中观察到的局限性。其次,使用基于GAN的数据增强直接缓解了不平衡问题,确保诸如室性自主节律和心房扑动等稀有心律失常被高灵敏度检测到。外部验证确认了这种稀有类别敏感性在数据集间泛化,ECG5000最稀有类别(占数据0.3%)的F1分数为88.4%,INCART心室扑动(28个测试样本)的F1分数为92.5%。第三,通过剪枝和量化进行的训练后优化使模型在保持准确性的同时显著减小了大小和推理延迟,支持在便携式或实时监测设备中部署。

除了数值性能外,所提出的模型独特地结合了一个注意力机制,能够实现诊断特征的临床有意义可视化。如5.2节所示,系统突出显示了与既定心脏病学知识一致的波形区域,如P波、QRS复合波和心律失常性不规则。定量验证确认了这种与专家注释的一致性(IoU = 0.73,临床相关性评分 = 4.2/5)。这种可解释性解决了先前工作的一个关键缺陷,提供了透明度,建立了临床医生信任,并在实际场景中促进了决策支持。

对比表明,所提出的模型不仅建立了新的性能基准,还提供了可解释性、统计稳定性和效率。尽管现有工作通常侧重于单一优势,如准确性、时间建模或特征表示,所提出的框架成功地将这些维度结合在一个统一的设计中。因此,它提供了一个更具临床可行性的解决方案,有助于弥合实验研究与实际、可靠的、准备部署的心律失常检测系统之间的鸿沟。

  1. 讨论

所提出的架构通过逐导联处理和融合,适应可变的导联配置。这种导联无关的设计在单导联ECG5000(F1分数97.6%)、双导联MIT-BIH(准确率99.67%)和12导联INCART(F1分数98.0%)上均取得了强劲的性能。这种灵活性与真实世界部署相关,因为导联配置从可穿戴设备到临床诊断系统各不相同,并且跨这些配置的一致性能表明,模型学习的是通用的形态特征,而非数据集特定的模式。

基于GAN的数据增强被证明能有效解决类别不平衡问题。没有增强,稀有类别的召回率大幅下降。例如,室性自主节律召回率从98.2%降至91.2%,而心室扑动召回率从97.5%降至90.1%。这些下降表明,标准训练不足以学习少数类特征。合成心拍实现了良好的形态保真度,DTW为0.31,相关性为0.84,同时保持了多样性,方差比范围为0.88至1.12。专家评估显示,心脏病专家仅识别出47.8%的合成心拍,这一比率接近随机水平,诊断一致性为91.5%,合理性评分为4.1/5。增强使稀有类别的F1分数提高了0.8至1.5个百分点,并减少了训练变异性,标准差从0.5–1.1%降至0.3–0.6%。ECG5000最稀有类别(仅15个训练样本)上的外部验证达到了88.4%的F1分数,进一步证实了增强在有限数据下实现稀有类别检测的能力。

跨导联变换器比循环架构更有效地捕获了时空依赖性。用GRU替换它将F1分数从99.66%降至97.10%,且需要跨导联集成的类别出现明显退化。心房扑动从99.40%降至96.2%,异常房性早搏从97.30%降至93.8%。这一性能差距表明,基于变换器的建模对多导联心电图解读做出了有意义的贡献。注意力分析揭示了临床适当的导联聚焦,胸导联优先用于室性心律失常,肢体导联用于心房活动,提示与心脏病专家推理一致。

注意力提供了可解释的解释,F1仅降低了0.8%。定量验证显示与专家注释具有中等程度的一致性,总体IoU为0.73,QRS复合波达到0.81,临床相关性评分为4.2/5。值得注意的是,87%的注意力图评分在4分或以上。内在注意力机制优于Grad-CAM,IoU为0.73对比0.58,临床评分为4.2对比3.4,表明基于变换器的注意力比事后方法提供了更忠实的解释。这种可解释性解决了AI系统临床采用的一个已知障碍。

训练后优化在保持性能的同时降低了资源需求。剪枝使模型大小从45 MB减少40%至27 MB,FLOPs减少35%从1.20 G降至0.78 G,准确性影响最小,从99.67%降至99.55%。量化进一步将大小降至22 MB(减少51%),推理时间降至7毫秒(减少42%),同时实现了99.40%的准确率。量化模型的7毫秒推理时间满足实时监测要求,远低于600毫秒的心跳间隔,其22 MB的占用空间适合部署在资源有限的设备上。

外部验证确认了在MIT-BIH之外的泛化能力。在ECG5000上,该数据集呈现极端不平衡(0.3%稀有类别)、单导联记录和单患者数据,模型实现了97.6%的F1分数。在INCART的12导联冠状动脉疾病人群中,模型实现了98.0%的F1分数,稀有类别性能为:心房扑动96.8%,室性二联律97.2%,室性自主节律93.8%,心室扑动92.5%。McNemar检验显示,对于12个重叠类别中的10个,MIT-BIH和INCART预测之间没有显著差异,表明跨导联配置和患者人群的分类行为一致。

几个局限性值得承认。在干净记录上的验证需要扩展到包含运动伪影、电极噪声和基线漂移的动态数据。合成信号质量的类别依赖性变化,DTW范围从0.28到0.35,表明某些心律失常类型仍然难以生成。可解释性验证虽然是定量的,但需要在实时决策中对其临床效用进行前瞻性评估。未对儿科人群进行评估。在部署前,监管验证和多中心试验仍然是必要的。在V100 GPU上6.5小时的训练要求可能限制了资源受限环境下的持续学习。

未来的工作应解决在嘈杂的动态和儿科数据集上的验证、不同信号质量下的鲁棒性研究、零样本泛化的域适应、用于隐私保护训练的联邦学习、结合注意力和临床规则的混合可解释性、用于改善合成多样性的扩散模型,以及测量诊断时间和患者预后的前瞻性临床试验。

  1. 结论

本研究介绍了一种新颖的基于心电图的深度学习框架,用于心律失常检测,该框架结合了卷积编码器、跨导联变换器、注意力机制和基于GAN的数据增强,以及训练后优化(如剪枝和量化)。在基准数据集上多次独立训练运行的全面实验表明,我们提出的模型实现了最先进的性能,并具有卓越的统计稳定性和可复现性。

该模型在常见和罕见心律失常类型之间提供了平衡的性能,通过基于GAN的数据增强有效缓解了心电图分类中长期存在的类别不平衡挑战,该增强稳定了对少数类别的学习。在互补数据集上的外部验证确认了跨不同导联配置、患者人群和类别分布的强大泛化能力,证明了该架构学习的是基本形态特征,而非数据集特定模式。

除了原始性能外,注意力机制的集成提供了可解释的可视化,突出显示了临床相关的心电图区域,使系统能够作为透明的诊断助手而非黑盒分类器运行。针对专家注释区域的定量验证确认了与临床推理的高度一致性,解决了AI在医疗保健中采用的一个关键障碍。通过剪枝和量化进行的训练后优化显著降低了模型大小和推理延迟,性能影响极小,确认了在便携式监护仪和可穿戴设备等资源有限的实时环境中部署的可行性。这些结果表明,临床可行性需要的不仅仅是高准确率;它还需要在一个统一架构内实现可解释性、泛化能力和可部署性。

据我们所知,这是首个同时通过严格的定量验证解决所有这些维度的ECG心律失常检测系统。未来的工作将扩展到更大、更多样化的数据集,包括儿科人群和动态记录,研究用于改进跨数据集性能的域适应技术,并进行前瞻性的临床医生参与评估,以推动监管批准和临床采用。

通过解决算法和实际考虑,所提出的方法标志着向值得信赖的AI驱动的心脏病学诊断工具迈出了重要一步,使我们更接近可靠、可解释和可部署的系统,这些系统可以协助临床医生检测危及生命的心律失常并改善患者预后。

作者贡献:A.T.:概念开发、方法设计、分析工作和初稿准备;I.E.T.:概念开发、方法设计、分析工作和初稿准备;M.M.:调查、评估和手稿编辑完善;I.N.:方法学、评估和手稿编辑完善;L.M.:评估和手稿编辑完善;A.R.:验证、评估和手稿编辑完善;M.H.:方法学和项目管理。所有作者均已阅读并同意发表的手稿版本。

资助:本研究未获得外部资助。

数据可用性声明:本研究中使用的数据完全可从公共来源获取。

利益冲突:作者声明与本工作相关的利益冲突不存在。

参考文献:(此处省略参考文献详细内容)

【全文结束】

猜你喜欢
  • 耶鲁纽黑文健康系统公布2026年创新奖获奖者耶鲁纽黑文健康系统公布2026年创新奖获奖者
  • 肠道微生物组与心脏病前兆相关联肠道微生物组与心脏病前兆相关联
  • 肠道微生物群可能预测心脏病风险肠道微生物群可能预测心脏病风险
  • 考试作弊警告:大脑增强药物问题考试作弊警告:大脑增强药物问题
  • 美国胆固醇指南更新:ACC和AHA联合发布新建议美国胆固醇指南更新:ACC和AHA联合发布新建议
  • 耳垂或藏着未来心脏病的隐秘线索耳垂或藏着未来心脏病的隐秘线索
  • 翻译AI在医疗和生物医学中的应用:巨大挑战与STAR机遇翻译AI在医疗和生物医学中的应用:巨大挑战与STAR机遇
  • 胖猫?减肥药或将惠及你的超重宠物胖猫?减肥药或将惠及你的超重宠物
  • 肠道微生物组与心脏和肾脏健康相关肠道微生物组与心脏和肾脏健康相关
  • 联合阵线将解决心脏病不平等问题联合阵线将解决心脏病不平等问题
热点资讯
全站热点
全站热文