摘要
人工智能(AI)在自发性脑内出血(ICH)中的应用正在迅速扩展,特别是在围手术期影像分析和手术决策支持方面。由于大多数预测性AI模型是使用独立的临床数据集开发的,它们并不旨在明确复制随机试验协议或指南决策规则。因此,我们进行了一项描述性系统综述和证据映射研究,将AI模型的输入、预测目标和输出与主要手术试验和临床指南(ENRICH、MIND、MISTIE III、SWITCH、STICH II、CLEAR和AHA/ASA)进行交叉对照,识别AI实现试验相关构念的重叠区域以及AI衍生预测因子可能为未来试验设计提供假设生成的区域。在识别出的37项记录中(31项来自数据库搜索,6项来自手动搜索),21项研究符合资格标准。出版物在2021年后增加,在2024年达到峰值(n=5),并在2025年持续(n=3)。大多数队列是单中心的(13/21),主要来自中国、美国和德国。输入主要为非对比计算机断层扫描(CT);一项研究使用磁共振成像(MRI)进行轨迹规划。深度学习是最常见的分析方法(14/21),其次是经典机器学习(4/21)和基于放射组学的方法(2/21)。AI应用集中在围手术期影像任务上,包括资格评估、术后质量保证、轨迹规划、工作流程优化和治疗效果建模。三项研究表明与手术试验阈值(如MISTIE/CLEAR)直接一致,十项间接一致,八项没有明确联系。AI模型为基于影像的ICH围手术期评估增加了价值,并且经常针对试验和指南基础决策的核心构念,即使试验标准未明确编码。这种交叉对照明确了AI输出与试验和指南相关构念重叠的位置以及AI衍生决策边界偏离的位置,强化了可以与现有证据进行基准测试的测量目标,并确定了未来研究中假设生成评估的候选对象。
引言
脑内出血(Intracerebral hemorrhage, ICH)是最严重的中风类型之一,约占所有中风病例的10-15%,早期死亡率高达40%[1]。治疗决策主要依据临床标准,包括神经功能状态、年龄和合并症,以及颅脑计算机断层扫描(CT)的结果,如血肿大小、位置、脑室内出血(intraventricular hemorrhage, IVH)、脑积水和中线移位。通常的标准阈值包括幕上血肿大于30 mL或幕下血肿超过15 mL[1,2,3]。
预后工具,如ICH评分,可进一步估计30天死亡率[4]。为确定手术的作用,多项随机对照试验(Randomized Controlled Trials, RCTs)——包括ENRICH[2]、MIND[5]、MISTIE III[3,9]、SWITCH[6]、STICH II[7]和CLEAR[8]——评估了开颅术、微创手术(Minimally Invasive Surgery, MIS)、去骨瓣减压术和联合溶栓治疗的脑室外引流(External Ventricular Drainage, EVD)。尽管取得了这些进展,关于改善长期预后的特定手术指征或技术,尚未达成明确共识。
随着这些临床试验的进行,人工智能(Artificial Intelligence, AI)的进步为手术决策支持开辟了新的机会。机器学习(Machine Learning, ML),特别是深度学习(Deep Learning, DL),可以自动分析原始计算机断层扫描(CT)数据,以识别血肿、估计其大小、定位其位置,并以比传统体积测量方法更高的准确性预测结果。最近的几项研究调查了AI在ICH管理关键决策过程中的作用,包括筛查和体积评估,以及术后质量保证和并发症风险预测。
大多数应用于自发性ICH的AI模型是在独立数据集上训练的,并非设计用来复制随机试验协议或指南算法。然而,对于旨在告知或影响手术决策的AI工具,检查这些模型强调的变量以及其预测结果如何与主要手术试验中使用的入组标准和终点相关联是有价值的。这种比较将模型行为置于现有证据框架内,而不意味着AI系统应复制随机试验协议或指南阈值。因此,本综述系统地将AI模型的输入、输出和决策支持功能映射到基于试验和指南的自发性ICH证据框架,提供了当代AI研究与既定手术证据之间的描述性交叉对照。
方法
研究设计
进行了一项描述性系统综述和证据偏好映射研究,以确定脑内出血(ICH)的人工智能(AI)模型是否符合主要手术试验和指南的标准和发现。作为初步步骤,我们总结了指导ICH手术决策的关键随机试验和指南来源(表1)。对于每个来源,我们提取了主要证据声明、临床场景、推荐方法、治疗窗口和技术目标,这些作为分类AI研究的参考框架。
文献检索
2025年9月进行了全面的PubMed/MEDLINE搜索。预先设定的搜索字符串为:
"intracerebral hemorrhage"[tiab] AND (surg*[tiab] OR evacuation[tiab] OR endoscop*[tiab] OR "minimally invasive"[tiab]) AND ("artificial intelligence"[tiab] OR "machine learning"[tiab] OR radiomics[tiab] OR "deep learning"[tiab])
搜索限于过去十年,以反映临床AI出版物快速增长的时期。对纳入研究的参考文献列表进行了筛选,并纳入了符合资格标准的用户提供的文章。选择PubMed作为主要数据库,因为它对同行评审的生物医学和神经外科文献有全面覆盖[10]。
为确保透明度和可重复性,在最终提交前重新运行了搜索,得到31条记录。去除重复项和明显不符合资格的研究后,对所有检索到的记录在标题和摘要层面进行了筛选。更新后的数字在修订的系统综述和荟萃分析优先报告项目(Preferred Reporting Items for Systematic reviews and Meta-Analyses, PRISMA)流程图(图1)中报告。此更新不影响最终纳入研究的数量。
除了数据库搜索外,还进行了有针对性的手动搜索,以确保全面覆盖脑内出血手术中可能无法通过基于关键词的查询完全捕获的有影响力和方法学相关的AI研究。此过程包括筛选所有纳入文章的参考文献列表,审查在试验相关ICH影像和AI研究中活跃的主要作者群体的关键出版物,以及纳入符合所有预先指定资格标准的用户提供的同行评审文章。通过这种方法,确定了六项额外研究并纳入定性综合和证据映射。这些研究使用与数据库识别记录相同的纳入标准、数据提取框架和试验一致性分类进行评估。
纳入与排除标准
纳入标准(预先设定)
- 原始的、经过同行评审的人类研究符合资格,无论是回顾性的、前瞻性的,还是来自试验后或登记分析的研究。当直接指导手术决策或工作流程时,考虑病例系列和病例报告。
- 人群必须包括患有自发性脑内出血(ICH)的成年患者(≥18岁),无论是否伴有脑室内延伸。
- 研究需要有人工智能或机器学习组件——如基于放射组学的方法、经典机器学习算法、深度学习或可解释/因果ML——并与外科护理有明确联系。
- 相关领域包括患者选择、轨迹规划、术后质量保证(例如,残留体积、引流管位置或中线移位)、围手术期并发症风险、治疗效果估计以及手术工作流程和时间安排。
- 结局必须与手术管理相关,包括功能状态(90-180天时的改良Rankin量表评分mRS)、死亡率、再出血、技术成功阈值(≤15 mL残留或≥70%血块清除率)、中线移位变化或手术室时间指标。
排除标准
- 排除综述、社论、信件、没有完整同行评审手稿的会议摘要以及缺乏临床数据的纯技术论文。
- 没有AI组件或仅使用与手术决策无关的传统统计方法的研究被认为不符合资格。
- 其他排除标准包括继发性ICH(如来自肿瘤、动静脉畸形或创伤)、蛛网膜下腔、硬膜外或硬膜下出血、仅限儿科的队列以及非英文全文文章。
数据提取与评估
两名评审员独立筛选标题和摘要,然后根据资格标准进行全文评估。分歧通过共识解决。研究选择过程在系统综述和荟萃分析优先报告项目(Preferred Reporting Items for Systematic Reviews and Meta-analyses, PRISMA)流程图[11](图1)中总结。
研究识别和选择按照PRISMA框架(图1)报告。鉴于纳入的AI研究以影像为中心的性质以及尚未完成的PRISMA-AI扩展,我们额外采用了2024年更新的医学影像人工智能检查表(Checklist for Artificial Intelligence in Medical Imaging, CLAIM)[12]来组织AI特定研究特征的提取和报告(例如,数据来源、参考标准术语、内部与外部测试,以及关于模型/软件/数据可用性的透明度)。CLAIM被用作报告和组织工具,而不是评分系统。
对于每项研究,收集了引文和年份、国家/中心、队列特征(手术数量与总数;手术类型——开颅术、微创手术、内窥镜、立体定向、去骨瓣减压术)、输入(临床变量;影像——非对比CT/磁共振成像(MRI)、脑室内出血、中线移位、术后扫描;以及放射组学)、AI方法(分类为经典机器学习、深度学习、基于放射组学的机器学习或可解释/因果机器学习)、主要和次要结局(例如,改良Rankin量表评分mRS、死亡率、90/180天的并发症,技术终点如残留体积或≥70%清除率)、验证策略(内部交叉验证、外部测试、校准),以及任何明确编码的随机试验标准。数据记录在结构化提取表中,并标准化以确保跨研究的一致性。
为解决研究问题,将每篇AI论文映射到关键试验和指南——ENRICH[2]、MIND[5]、MISTIE III[3,9]、SWITCH[6]、STICH II[7]、AHA/ASA指南[1]和CLEAR[8]。一致性被分类为:
- 直接:明确使用试验阈值/数据集(例如,MISTIE残留≤15 mL或≥70%清除率,ENRICH脑叶30-80 mL≤24小时,CLEAR相关的脑室内出血清除指标,如>80%清除率和/或第三和第四脑室开放)。
- 间接:解决支持试验证据的构念的模型(例如,体积测量、中线移位、导管/引流管覆盖范围、轨迹规划、工作流程/手术室时间),但未明确编码试验标准。
- 无:没有手术证据联系的预后或并发症聚焦模型。
这些类别是描述性的,非层级的;"直接"表示明确使用试验标准/数据集,而非模型质量或临床表现更优。
鉴于人群、干预措施、AI方法和结局的异质性,我们进行了定性综合而非荟萃分析。尽管综合是定性的,但综述是使用预先问题、资格标准和结构化数据提取进行的;因此,我们按照PRISMA惯例(图1)报告研究选择和结果,同时认识到该方法的描述性证据映射元素。结果按决策支持功能(术后预后、术后质量保证、并发症风险、资格/质量保证、轨迹规划、治疗效果建模、工作流程/时间)和试验一致性类别(直接/间接/无)进行描述性呈现。
由于纳入研究的方法学异质性,进行正式的荟萃分析偏倚风险评估不可行。相反,研究质量基于设计特征进行评估,包括方法是前瞻性还是回顾性、是否有多中心参与、是否在独立数据集上进行外部测试、是否有校准,以及试验标准是否明确定义。这种方法符合生物医学研究中描述性系统综述和证据映射的当前指南。由于没有直接涉及人类受试者,不需要伦理批准。
结果
研究选择和时间趋势
PubMed搜索确定了31条记录,通过有针对性的搜索纳入了六项额外研究。经过全文筛选并去除重复项和不符合资格的记录后,21项研究被纳入定性综合。关于ICH手术AI模型的出版物在2021年后显著增加,在2024年达到峰值(n=5),并在2025年至今保持活跃(n=3)(图2)。
研究特征
大多数研究是单中心的(13/21),有八项多中心研究。从地理上看,中国贡献了七项研究,美国六项,德国四项,日本一项,英国一项,新加坡一项。样本量从单一病例报告到包含超过8000名患者的多中心电子医疗记录队列不等。影像输入主要为非对比CT;一项研究使用MRI进行手术轨迹规划(表2)。
AI方法和输入
深度学习是最常见的分析方法(14/21项研究),其次是经典机器学习(4/21)、基于放射组学的机器学习(2/21),以及一项研究中使用的经监管批准但未具体说明的AI工具(1/21)。输入主要是基于影像的,最常见的是自动分割或体积测量、脑室内出血负担评估和中线移位,少数研究整合了有限的临床变量。
决策支持功能
纳入的模型涉及一系列围手术期任务。最常见的应用包括资格评估和术后质量保证——例如测量残留血肿体积、引流管位置或覆盖范围以及中线移位变化。其他功能包括规划导管或内窥镜通路的轨迹、预测术后结果、优化工作流程和时间安排(如警报或转诊优先级)、预测并发症风险、通过比较手术与医疗管理来建模治疗效果,以及提供全面的决策支持或计划建议。总体而言,基于影像的围手术期任务占主导地位,而完全集成的决策支持模型仍然不常见。
与随机试验和指南的一致性
使用预定义标准,三项研究表明通过明确纳入MISTIE III和/或CLEAR III的阈值(例如,残留体积≤15 mL,≥70%血块清除率,或CLEAR相关的脑室内出血清除目标,如>80%清除率和/或第三和第四脑室开放)直接锚定于手术试验证据。十项研究间接锚定,解决与试验相关的构念,如体积测量、中线移位控制、导管或引流管覆盖范围、轨迹规划,或工作流程和干预时间指标,但未明确编码试验截止点。八项研究发现与手术试验或指南标准没有明确关联,而是专注于预后、并发症风险、工作流程优化或一般决策支持。值得注意的是,没有模型以端到端方式明确实施来自ENRICH、STICH II或SWITCH的入组或时间阈值(表3)。
讨论
与手术试验和指南的一致性
大多数用于自发性ICH的AI模型是独立于随机试验协议开发的,并不期望明确复制试验资格标准或指南决策规则。因此,缺乏直接试验编码不应被解释为缺陷。相反,本综述的目的是提供AI衍生输入和输出与主要手术试验和指南中使用的构念之间的描述性交叉对照。在纳入的21项研究中,3项展示了直接锚定于随机手术试验的证据,10项通过与试验相关的构念间接锚定,8项未与试验或指南标准进行比较。
在纳入的研究中,AI模型最常针对与试验和指南相关构念一致的变量,包括血肿和脑室内出血体积测量、中线移位、清除后残留血块体积、导管或引流管放置,以及工作流程或干预时间指标。这些变量对应于MISTIE III、CLEAR III和ENRICH等试验中使用的技术终点和围手术期目标,即使未明确编码特定试验阈值。较少的模型以直接可比于主要试验终点的方式解决功能结局(例如,90-180天时的mRS),并且明确实施来自ENRICH、STICH II或SWITCH的入组窗口或决策阈值的情况很少见。
本综述确定的几种AI应用自动测量传统上耗时或受观察者间变异性影响的指标,包括体积测量、残留体积目标、脑室内出血清除率和中线移位。自动化这些测量可能提高实际实践中的一致性,支持质量保证,并促进试验工作流程或事后分析。当AI系统旨在推荐干预措施(而非自动测量)时,预先指定如何评估输出很有帮助——例如,适当情况下针对试验/指南构念和/或针对独立学习的决策边界——以便透明地评估效益、安全性和通用性。
除了复制既定阈值外,AI模型通常还纳入现有试验中未明确使用的额外影像特征、放射组学模式或多变量风险谱。当在独立队列中一致观察到时,这些预测因子可以通过实现入组丰富化、完善基于影像的替代终点,或识别最可能从特定手术策略中受益的患者亚组来指导未来试验设计。在这种情况下,AI的价值不在于严格遵守历史试验标准,而在于提供数据驱动的见解,这些见解可以在严格的试验框架内进行前瞻性测试。
临床意义
与综述结果的临床相关性
本综述表明,当代AI在ICH手术中最有效的是当它集中在基于影像的围手术期终点——如血肿/脑室内出血体积测量、引流管检测/覆盖范围、残留体积和中线移位——因为这些变量常规获取、对时间敏感,并与手术评估紧密相关。在这种情况下,即使是仅间接一致的模型也可以通过提高测量一致性、减少观察者间变异性以及标准化术后质量保证而不规定治疗决策来提供有价值的临床支持。
一致性如何影响现实世界决策
试验一致性的重要性取决于预期的临床角色。对于用作有限助手的工具(如分割、体积测量、质量保证和工作流程分诊),缺乏明确的随机对照试验(RCT)阈值并不会降低其价值;临床医生可以将输出纳入现有决策框架。对于提供治疗建议的AI系统(如手术/不手术、时间或技术),指定如何相对于现有证据(包括相关试验/指南)和/或独立性能目标评估决策边界很有用。此外,部署应纳入防止自动化偏见的保障措施(例如,人机循环审查、不确定性透明报告和持续监测)。重要的是,严格遵守历史试验标准不应被视为创新的上限;相反,它应作为参考基线,新的策略可以前瞻性地与之比较。
多模态和时间整合的需求
研究中常见的差距是非影像信息的有限整合。手术ICH决策本质上是多模态和时间依赖的,涉及神经系统检查、严重程度量表、生理学、恶化轨迹和干预时间。因此,未来系统应超越仅影像的流程,并有意整合临床、生理和时间数据与放射学特征和试验定义目标,使模型能够模拟现实世界床边决策路径,而不仅仅是孤立的影像任务。
伦理、转化信息学和基于证据的实施
将AI工具转化为神经危重症护理需要的不仅仅是技术性能:模型必须在独立数据集上进行外部测试,监测性能漂移,并在明确责任和临床医生监督下部署。伦理考虑包括与风险成比例的可解释性、自动化偏见的缓解,以及关于模型局限性和数据来源的透明度。试验级存储库和基准测试资源(包括VISTA-ICH)可以促进可重复评估和外部测试,帮助将AI从有前景的回顾性工具转变为可以安全集成到手术决策支持中的基于证据的仪器。
AI能否协助ICH管理的临床决策,以及它是否最终可能以类似于CT扫描的方式重塑手术指征?
我们的综合表明,虽然AI在技术终点(如体积精度和术后质量保证)方面显示出前景,但其整合到手术决策框架中仍不完整。为了推进,旨在提供高风险决策支持的AI系统应超越孤立的影像输出,转向多模态、时间感知建模,并对临床影响进行前瞻性评估。对于此类系统,试验/指南构念可以作为有用的外部基准,但模型也可能定义需要单独验证安全性、效益和通用性的独立决策边界。
局限性
本综述存在一些需要承认的局限性。所有纳入的研究都是回顾性的,这限制了它们对实时临床决策的支持能力,并使它们容易受到观察性数据固有偏倚的影响。AI方法学的异质性——从经典机器学习到深度学习和基于放射组学的方法——排除了定量综合,需要进行描述性分析而非荟萃分析。虽然研究的地理多样性表明全球兴趣广泛,但单中心队列的主导地位限制了外部普遍性。只有少数研究明确将模型输出与试验或指南定义的构念(例如,入组标准、技术目标或预定义终点)进行评估,这限制了这种交叉对照将AI衍生决策边界与既定证据框架进行比较的能力(但并不意味着这种一致性对于AI模型有效性是必需的)。未来的前瞻性多中心研究应优先考虑外部验证、校准和针对具有临床意义的结果(包括相关试验终点)的预定义基准测试,而不是假设与历史阈值的一致性。
结论
总之,自发性脑内出血的当代AI研究正在迅速增长,并对围手术期评估做出有意义的贡献,特别是在基于影像的任务中,如体积测量、引流管评估、残留血块评估和中线移位分析。大多数模型适当地从独立数据集开发,未明确编码随机试验协议;然而,许多模型针对试验和指南基础手术决策的核心构念。本综述将AI输入和输出映射到公认的证据框架,阐明AI应用试验和指南相关构念的位置以及添加新的预测因子或决策点的位置。对于提供治疗建议的未来系统,确保安全将需要前瞻性测试、外部验证、校准和透明治理。虽然试验和指南级别的构念可以作为比较的基准,但不应自动假设或强制要求与之达成一致。
【全文结束】

