利用机器学习模型在MID-NET®中验证高灵敏度脑出血病例识别算法Validation of a High-Sensitivity Identification Algorithm for Cerebral Hemorrhage Cases Using Machine Learning Models in MID-NET® | Proceedings of the 2026 14th International Conference on Software and Information Engineering

环球医讯 / 心脑血管来源:dl.acm.org日本 - 英语2026-08-24 14:35:51 - 阅读时长17分钟 - 8287字
本研究在MID-NET®(日本医药品医疗器械综合机构运营的医疗信息数据库网络)中开发并验证了一种基于机器学习的脑出血病例高灵敏度识别算法,通过LightGBM模型分析电子病历和DPC(诊断过程组合)数据,实现了外部验证集上0.828至1.000的高灵敏度和0.836至0.963的ROC AUC值,有效克服了传统基于规则算法中灵敏度与精确度难以兼顾的问题,为药物警戒领域安全信号检测提供了新工具,尤其适用于需要最大限度减少漏报的药物安全监测场景。
脑出血药物警戒药物流行病学真实世界数据电子病历DPC诊断代码病例识别高灵敏度不良事件MID-NET
利用机器学习模型在MID-NET®中验证高灵敏度脑出血病例识别算法

摘要

在利用MID-NET®等真实世界数据(RWD)进行的药物流行病学研究中,准确识别不良事件至关重要。传统的基于规则的算法通常面临显著的权衡问题,虽然可以实现高精确度,但灵敏度较低,导致漏诊病例。本研究旨在开发并验证一种使用MID-NET®结构化数据识别脑出血病例的机器学习模型,以实现高灵敏度。利用电子病历和DPC(诊断过程组合)数据,我们构建了LightGBM模型。使用一家医院的数据进行训练,而两家独立医院的数据作为外部验证集。预测变量包括患者个人信息、DPC诊断代码、药物和手术信息。性能评估采用与金标准病历审查数据对比的方式。该模型显示出高度的外部有效性。在两个测试数据集中,模型分别实现了1.000和0.828的高灵敏度(召回率),ROC AUC值分别为0.963和0.836。特征重要性分析表明,DPC诊断代码是最关键的预测因子。机器学习方法成功克服了基于规则方法的低灵敏度限制。该模型为药物警戒中的安全信号检测提供了一种可靠工具,特别是在需要最大限度减少漏报不良事件的情况下。

1 引言

近年来,真实世界数据(RWD)在药物开发和上市后安全监测(药物警戒:PV)中的应用迅速发展[1]。电子病历(EMR)、DPC(诊断过程组合,日本急性住院医疗费用计算方法)数据和索赔数据等医疗信息数据库作为RWD受到关注。在日本,医药品医疗器械综合机构(PMDA)运营医疗信息数据库网络(MID-NET®),作为多机构共享数据库,旨在将RWD用于药物警戒。MID-NET®从多个枢纽医院收集并存储标准化的EMR信息、住院数据和索赔数据,为药物流行病学研究提供重要基础设施。

在使用此类数据库的研究中,准确识别待分析的疾病结局(事件)对于确保研究有效性至关重要。迄今为止,已有研究对结合ICD-10代码与实验室值和治疗信息(药物、手术等)的基于规则算法进行验证,用于识别急性缺血性卒中(AIS)[2]和急性心力衰竭[3]等疾病。然而,这些研究认识到,旨在提高分类性能(特别是精确度)的更严格算法条件会导致灵敏度下降[2,3]。这一挑战并非MID-NET®独有;对行政数据的系统综述一致表明,虽然基于ICD代码的卒中算法通常具有高阳性预测值,但其灵敏度差异很大,可能导致病例识别不足[4,5]。

关于脑出血(CH)的识别,在作者先前进行的一项研究(报告未发表)中,验证了一种结合DPC诊断代码匹配与特定治疗条件(影像学检查和抗水肿药物处方)的基于规则算法[6]。当评估来自三家医院的367份经病历审查的病例,基于住院期间DPC诊断代码匹配和进行影像学检查/抗水肿药物处方的条件时,共识别出50例。其中48例为真病例,精确度达到0.960。虽然此结果显示出极高的精确度,但它表明在病历审查中被认为患有脑出血的大多数病例无法被提取出来。这表明在药物警戒中未能确保必要的灵敏度,精确度与灵敏度之间存在不平衡。为解决基于规则方法固有的这些限制,最近的研究 increasingly demonstrated the utility of machine learning (ML) for electronic health record phenotyping[7]。

2 目标

因此,在本研究中,我们引入机器学习(ML)模型以实现高灵敏度,这是传统基于规则方法难以达到的。机器学习模型可以捕捉DPC诊断代码、患者背景、药物处方、手术和康复状况等多种结构化数据之间的复杂非线性关系。通过采用这种方法,我们旨在克服先前研究中基于规则方法观察到的低灵敏度问题,并构建一个有助于药物流行病学研究的识别模型。

3 方法

在本研究中,我们基于日本多机构共享数据库MID-NET®中存储的DPC数据和EMR信息,构建了一种梯度提升决策树模型LightGBM,并评估其对脑出血住院病例分类的准确性。我们使用未用于训练的独立外部机构数据验证所构建模型的外部有效性。

3.1 MID-NET®

本研究使用了PMDA建立的MID-NET®。MID-NET®独特地整合了EMR和索赔数据,包括DPC系统。DPC是一种类似于DRG的诊断组分类系统,用于日本急性护理的支付。MID-NET®数据集包括临床数据,如实验室检查结果(标本、放射学、生理学、细菌学)和药物记录(医嘱和确认给药记录),以及患者档案和诊断名称(ICD-10)。

3.2 数据提取

数据从MID-NET®中提取,涵盖2015年4月至2017年3月期间来自总计三家医院(我们医院和两家合作研究机构[医院1和2])的病例。纳入标准为DPC数据中包含"脑出血"(排除创伤性、出血性梗死和蛛网膜下腔出血)作为诊断名称,且在入院前一天至出院当天之间进行了CT、MRI或MRA影像检查(定义1)。一次住院被视为一个病例。由包括专科医生在内的两名医生进行病历审查。在病历审查中被认为患有脑出血的病例定义为真病例,而脑出血可疑或被认为不存在的病例定义为假病例。数据选择流程图如图1所示。

3.3 机器学习模型构建

用于分析的变量包括从MID-NET®中提取的以下内容:年龄、性别、住院时长、入院科室、主要诊断名称、触发入院的诊断、需要最多医疗资源的诊断、需要第二多医疗资源的诊断、入院时合并症1-4、入院后出现的状况1-4、抗水肿药物处方情况、抗高血压药物处方情况、血肿清除手术执行情况以及康复执行情况。构建并使用了LightGBM进行分析。模型构建使用Python 3.13.9、lightgbm 4.6.0、numpy 2.3.5、scikit-learn 1.7.2、pandas 2.3.3、tableone 0.9.5[8]、optuna 4.6.0和simple-icd-10 2.1.1。关于诊断名称的ICD-10代码,我们使用simple-icd-10包将其转换为唯一索引值,然后在机器学习模型中作为分类变量处理。我们医院的病例用作训练数据集,合作研究机构的病例用作测试数据集以验证外部有效性。训练数据集进行了3折交叉验证(CV)。接下来,每个数据集进一步拆分为训练集和验证集,用于模型构建和超参数调整。使用验证数据从调优后的模型组中选择最佳模型。最后,通过软投票将三个CV折的最佳模型的预测概率计算测试数据集的预测概率。模型构建流程如图2所示。

3.4 模型评估

使用构建的模型预测外部医院(医院)的数据集,并使用准确率、精确度、召回率(灵敏度)、特异度、ROC AUC(受试者工作特征曲线下面积)和PR AUC(精确率-召回率曲线下面积)评估分类性能。

4 结果

表1显示了训练数据的组成,表2和表3显示了测试数据的组成。使用三个模型的软投票预测测试数据时,医院1的结果为:准确率0.792,召回率1.000,精确度0.672,特异度0.638,F1分数0.804,ROC AUC 0.963,PR AUC 0.951。医院2的结果为:准确率0.732,召回率0.828,精确度0.726,特异度0.613,F1分数0.774,ROC AUC 0.836,PR AUC 0.879。测试数据的混淆矩阵和ROC曲线如图3和图4所示。

LightGBM增益(重要性)分析显示,主要诊断、触发入院的诊断和需要最多医疗资源的诊断等DPC诊断代码信息的贡献,与性别、处方和手术信息相比明显更高。三个构建模型中各变量的平均增益如下:性别0.978,年龄10.942,住院时长36.616,科室4.438,主要诊断67.697,触发入院的诊断325.891,需要最多医疗资源的诊断322.452,需要第二多医疗资源的诊断9.980,入院时合并症(1-4)3.239、16.377、34.835、3.503,入院后出现的状况(1-4)37.205、2.093、29.098、7.827,抗水肿药物处方0.000,抗高血压药物处方12.057,血肿清除手术0.268,康复0.287。三个构建模型中各变量的增益如图5所示。

5 讨论

5.1 灵敏度与精确度之间的权衡及本模型的实用性

本研究表明,使用LightGBM的机器学习模型在使用MID-NET®数据识别脑出血病例时实现了高灵敏度(医院1召回率为1.000,医院2为0.828)。在先前使用MID-NET®的研究中,Tanigawa等人[2]验证了急性缺血性卒中(AIS)的识别算法,并报告称,虽然设置严格的条件(AND条件)结合影像学和治疗药物提高了精确度,但灵敏度降至约0.2。同样,在Inoue等人[3]对急性心力衰竭的验证中,结合DPC诊断代码与特定药物和实验室值的算法显示出77.78%的高精确度,但灵敏度保持在24.42%。因此,基于规则方法中灵敏度和精确度之间的权衡一直是一个共同挑战。在作者的先前研究[6]中,结合DPC诊断代码和治疗程序的基于规则方法记录了0.960的极高精确度;然而,提取的病例数量较少,表明可能遗漏了许多真正的脑出血病例(增加了假阴性)。尽管本研究构建的模型精确度为0.672-0.726,未达到先前研究[6]或严格基于规则方法的水平,但它成功捕获了测试数据集中大多数阳性病例,同时保持了较高的分类性能,ROC AUC约为0.84或更高,PR AUC为0.87或更高。在药物安全监测(药物警戒)实践中,特别是在不良事件信号检测中,通常优先考虑高"灵敏度"以确保不遗漏事件。因此,该模型可能有助于提取各种脑出血病例,包括传统基于规则方法无法完全捕获的"非典型治疗模式病例"和"轻症病例",可被视为对基于规则方法的补充。

5.2 DPC诊断代码信息在识别中的重要性

LightGBM增益(重要性)分析表明,主要诊断、触发入院的诊断和需要最多医疗资源的诊断等DPC诊断代码信息的贡献明显高于性别、处方和手术信息。Tanigawa等人[2]报告称,在AIS识别中,如果ICD-10代码"I63.x"包含在主要诊断或需要最多医疗资源的诊断中,则即使单独使用也显示出相对较高的精确度(0.784-0.923),表明在DPC系统下,这些主要诊断输入字段具有高可靠性。在本研究结果中,手术(血肿清除)和药物(抗水肿药物)增益出乎意料地低的一个因素是,DPC诊断代码(强变量)在决策树的上层用于分割,治疗信息所包含的大部分信息内容被诊断信息所涵盖。此外,由于观察到一定数量的脑出血病例仅通过保守治疗,因此可以推断,机器学习方法不将手术或特定药物作为强制条件,从而实现了高灵敏度。

5.3 模型的泛化能力和局限性

在本研究中,我们使用未用于训练的医院(医院1、2)的数据作为测试集验证了模型,确认了跨不同医疗机构保持一定水平的准确性(特别是高灵敏度)。这表明该模型学习了DPC数据的结构性特征,而不过度拟合特定医院的编码习惯。然而,存在局限性。首先,由于精确度低于基于规则的方法,提取后的人工审查负担可能会增加。其次,由于该模型将ICD-10代码视为索引分类变量,对于训练数据中不存在的罕见诊断代码的病例,预测准确性可能存在不稳定的风险。第三,正如Inoue等人[3]指出实验室值(如BNP)在识别心力衰竭中的重要性一样,通过包括影像学发现的文本数据或详细的实验室值,本研究的准确性可能会进一步提高;然而,目前仅限于结构化数据。

5.4 召回分母的合理性

在本研究中,我们基于几个关键理由定义了召回分母,以澄清为何没有脑出血诊断的病例未被考虑进行评估。首先,关于方法学有效性,由于手动审查整个数据库在物理上不可行,使用"广泛定义"人群估计召回率是ISPE和FDA采用的全球标准[9,10]。本研究也遵循日本JSPE工作组指南进行验证研究,以确保国内合规[11]。其次,从药物警戒中实际效用的角度来看,主要目标是检测可用真实世界数据(RWD)中的安全信号。评估"不可提取"的完全没有医疗记录的病例对该目的的实际意义不大;相反,优先考虑确保在可提取数据范围内准确检测。最后,采用这种方法确保与该领域主要先前研究的科学一致性,允许有效的学术比较并保持我们结果的可比性。

6 结论

在本研究中,我们使用MID-NET® DPC数据和EMR数据构建了识别脑出血住院病例的LightGBM模型,并验证了其有效性。所构建的模型克服了传统基于规则算法中"高精确度/低灵敏度"的挑战,在验证数据集中实现了高灵敏度(0.828-1.000)和良好的ROC AUC(0.836-0.963)。特别是,确认了DPC诊断代码信息在识别中起着极其重要的作用。虽然精确度有改进空间,但该模型可作为有用工具,补充传统算法用于药物流行病学研究和安全信号检测,特别是在需要最大限度减少漏报不良事件的情况下。未来工作应旨在通过引入ICD-10代码嵌入、提高对未学习诊断名称的鲁棒性来改进精确度并优化模型。

致谢

本研究已获得千叶大学医学研究生院伦理委员会的批准(批准号:M10813)。

参考文献

[1] Mohammed Salahudeen, Tatiane Da Silva Dal Pizzol, Li-Ting Kao, and Gregory M. Peterson. 2025. Editorial: Emerging Trends in Real-World Pharmacoepidemiology: 2023. Frontiers in Pharmacology 16 (April): 1601477.

[2] Masatoshi Tanigawa, Mei Kohama, Takahiro Nonaka, Atsuko Saito, Ado Tamiya, Hiroko Nomura, Yoko Kataoka, Masanobu Okauchi, Takashi Tamiya, Ryusuke Inoue, Masaharu Nakayama, Takahiro Suzuki, Yoshiaki Uyama, Hideto Yokoi. 2022. Validity of identification algorithms combining diagnostic codes with other measures for acute ischemic stroke in MID-NET®. Pharmacoepidemiol. Drug Saf. 2022;31(5):603-612.

[3] Ryusuke Inoue, Masaharu Nakayama, Hideki Ota, Naoki Nakamura, Susumu Fujii, Akira Ishii, Atsuko Saito, Takahiro Suzuki, Hiroko Nomura, Natsuko Goto, Shinya Watanabe, Hotaka Maruyama, Mayu Nozawa, Yoshiaki Uyama. 2025. Establishment of reliable identification algorithms for acute heart failure or acute exacerbation of chronic heart failure using clinical data from a medical information database network. Front. Cardiovasc. Med. 12 (1642323): 1642323.

[4] Natalie McCormick, Vidula Bhole, Diane Lacaille, Antonio Avina-Zubieta. 2015. Validity of Diagnostic Codes for Acute Stroke in Administrative Databases: A Systematic Review. PLoS One. 2015;10(8):e0135834.

[5] Rebecca Woodfield, Ian Grant, UK Biobank Stroke Outcomes Group, UK Biobank Follow-Up and Outcomes Working Group, Cathie Sudlow. 2015. Accuracy of electronic health record data for identifying stroke cases in large-scale epidemiological studies: a systematic review from the UK Biobank Stroke Outcomes Group." PLoS One. 2015;10(10):e0140533.

[6] Pharmaceuticals and Medical Devices Agency. Research Report on MID-NET® Data Characteristic Analysis and Data Extraction Conditions/Analysis Methods Research Task 3: Creation of Outcome Definitions and Establishment of Evaluation Criteria Across Multiple Sites ver.1.1. 2022.

[7] Siyue Yang, Paul Varghese, Ellen Stephenson, Karen Tu, Jessica Gronsbell. Machine learning approaches for electronic health records phenotyping: a methodical review. J Am Med Inform Assoc. 2023;30(2):367-381.

[8] Tom J. Pollard, Alistair E. W. Johnson, Jesse D. Raffa, and Roger G. Mark. 2018. Tableone: An Open Source Python Package for Producing Summary Statistics for Research Papers. JAMIA Open 1 (1): 26–31.

[9] International Society for Pharmacoepidemiology. 1996. Guidelines for Good Pharmacoepidemiology Practices(GPP).

[10] U.S. Food and Drug Administration. 2024. FDA's Sentinel Initiative.

[11] Masao Iwagami, Kotonari Aoki, Manabu Akazawa, Chieko Ishiguro, Shinobu Imai, Nobuhiro Ooba, Makiko Kusama, Daisuke Koide, Atsushi Goto, Norihiro Kobayashi, Izumi Sato, Sayuri Nakane, Makoto Miyazaki, Kiyoshi Kubota. 2018. Task Force Report on the Validation of Diagnosis Codes and Other Outcome Definitions in the Japanese Receipt Data. Japanese Journal of Pharmacoepidemiology. 2018;23(2): 95‒123.

【全文结束】

猜你喜欢
  • 淡马锡董事长张子贤:投资科技前必须考虑地缘政治风险淡马锡董事长张子贤:投资科技前必须考虑地缘政治风险
  • 汉阳大学圣心医院向日本代表团展示智能医院案例,包括人工智能、大数据和指挥中心汉阳大学圣心医院向日本代表团展示智能医院案例,包括人工智能、大数据和指挥中心
  • 特德·特纳所患痴呆症比人们认为的更为普遍特德·特纳所患痴呆症比人们认为的更为普遍
  • 现实世界测试中AI模型诊断患者能力超越医生现实世界测试中AI模型诊断患者能力超越医生
  • 生成式AI在医疗保健中的应用:案例、优势与挑战生成式AI在医疗保健中的应用:案例、优势与挑战
  • 治疗阿尔茨海默病的Lecanemab:讨论风险与益处至关重要治疗阿尔茨海默病的Lecanemab:讨论风险与益处至关重要
  • 流行减肥药物被发现可降低心脏病发作和中风风险流行减肥药物被发现可降低心脏病发作和中风风险
  • 泽西岛夫妇捐赠100万英镑支持南安普顿数字医疗中心建设泽西岛夫妇捐赠100万英镑支持南安普顿数字医疗中心建设
  • 没有合适的测试,最好的药物也无济于事没有合适的测试,最好的药物也无济于事
  • 生成式AI在医疗保健市场规模预计2034年达到216.4亿美元 | Zion Market Research研究报告生成式AI在医疗保健市场规模预计2034年达到216.4亿美元 | Zion Market Research研究报告
热点资讯
全站热点
全站热文