即使进行了基因组测序,许多患有罕见疾病的人仍无法获得明确的基因诊断。在经过广泛检测和专家评估后,约有一半人仍未得到诊断。他们的医疗数据可能包含线索,但寻找这些线索需要筛选成千上万甚至数百万种可能的基因变异、零散的临床记录以及快速变化的科学文献。
随着新的基因-疾病关系、病例报告和分类证据的积累,未解决的病例可能变得可以重新解读。
来自波士顿儿童医院(Boston Children's Hospital)Manton罕见病研究中心、哈佛大学(Harvard University)和OpenAI的研究人员使用OpenAI o3 Deep Research推理模型,分析了376个先前已分析但仍未解决的病例的去识别化临床和基因组信息。该模型为研究人员和临床医生提供了有证据支持的候选解释。在专家评审、额外检测和临床确认后,医生在18个病例中确定了诊断结果——在专家初步分析后,额外诊断率达到4.8%。这项研究于2026年6月18日发表在《新英格兰医学杂志AI》(NEJM AI)上,展示了AI辅助研究工作流程如何帮助专家在重新审视一些最困难的病例时生成线索。
这些病例中的许多已经逃避了多年的专家分析。在这项研究中,OpenAI o3 Deep Research帮助研究人员确定了后来通过既定临床流程评估的线索,这表明随着知识的发展,专家主导的定期重新分析可能会变得更加可扩展。该模型并未诊断任何患者或做出任何临床决策。它为专家提供了有证据支持的假设,供专家评审,并在适当情况下通过额外检测进行调查,并在临床实验室中确认。
为什么旧病例可能包含新答案
不确定的基因检测结果并不总是永久性的结论。患者的表型描述、检测结果和家族史可能分散在使用不同标识符、格式和词汇的数据库中。连接这些记录很困难,因此即使是专家也可能错过诊断。专家也可能在相关基因或其变异与疾病建立联系之前对儿童的基因组进行测序。随着科学知识的进步,相同的数据可以揭示以前无法发现的答案。
罕见疾病的重新分析既是科学问题,也是维护问题。患者的基因组可能保持不变,但周围的证据不断变化:研究人员将新基因和变异与疾病联系起来,实验室重新分类旧变异,病例数据库和论文积累新的观察结果。每次更新都可能使旧的不确定病例值得重新审视,因此许多机构继承了日益增长的基因组积压,需要与不断变化的知识库保持同步。
在这项研究中,研究人员设计的工作流程使模型作为现有基因组分析管道之上的"解释优先"推理层。它不是仅返回排序的基因,而是被要求将临床特征、遗传模式、变异证据和科学文献连接成人类评审者可以质疑的论证。
重新分析如何工作
对于每个病例,研究团队组装了一个去识别化数据包,包含描述患者临床表现的标准人类表型本体(Human Phenotype Ontology)术语、偶尔的临床医生笔记和任何描述性临床诊断、年龄和性别等元数据,以及过滤后的变异表。该表记录了每个变异的稀有性、其对编码蛋白的预测影响、ClinVar分类以及在可用家庭成员中的信号质量。大多数病例包含了来自儿童和双方生物学父母的数据。
研究团队要求模型提出最可能的分子解释并展示其推理过程。然后,研究人员使用临床实验室用于分类基因变异的相同ACMG/AMP框架评审输出结果。至少有两名团队成员评审每个候选,分歧通过共识解决,模型输出从不被视为诊断。只有在合格专家评审证据、变异被分类为致病或可能致病、经CLIA认证的实验室确认,并且临床团队将结果返回给家庭后,发现才被计为诊断。
在分析未解决的病例之前,研究团队在已有明确诊断的病例上完善了工作流程。在包含多种罕见疾病的51个病例中,该工作流程在重复运行中对48个病例正确识别了基因和变异。在一组57个神经肌肉疾病病例中,工作流程在重复运行中对45个病例返回了正确诊断。在15个长读长基因组病例中,它在每个病例中都正确识别了基因,并在12个病例中识别了两个致病等位基因。这些评估有助于提示开发,并显示了专家评审仍然至关重要的地方。
模型在这些先前已解决病例中的自报告置信度评分与正确诊断相关:一致正确调用的平均最低评分为85.6,而错误或未知调用的平均最低评分为42.1。这些评分不是校准的概率,研究团队也没有将其作为证据或临床裁决的替代品。但它们有助于指导专家评审者关注最有希望的候选诊断。
研究人员发现
然后,研究团队将工作流程应用于四组先前未解决的病例:患有神经发育疾病的儿童、患有罕见神经肌肉疾病的患者、患有早期精神病的儿童和青少年,以及儿科突发意外死亡病例。这些并不是等待首次评审的新病例。许多病例已经通过多个商业或机构管道进行了检查,并由多学科团队进行了讨论。
各队列结果
| 队列 | 病例数 | 诊断线索 | 诊断率 |
|---|---|---|---|
| 神经发育疾病 | 100 | 10 | 10.0% |
| 神经肌肉疾病 | 61 | 4 | 6.6% |
| 儿科突发意外死亡 | 200 | 2 | 1.0% |
| 早期精神病 | 15 | 2 | 13.3% |
| 总计 | 376 | 18 | 4.8% |
早期精神病队列较小,因此其百分比具有较宽的置信区间。诊断率还反映了每个队列具有单基因解释的可能性。
在模型提出候选并由专家完成评审和临床确认后,医生在4.8%的病例中确定了诊断。这一比率虽然不高,但在这个群体中是有意义的,因为先前的专家评审未能解决这些病例。类似的重新分析研究在经过大量评审的病例中报告了个位数的增长;较高的诊断率通常来自包含新病例或等待基因确认的已知疾病的研究。
在18个诊断中,7个是重新发现:在本地研究工作流程之外建立但未包含在研究团队审查的记录中的诊断。在几个病例中,变异在公共数据库中已被列为致病或可能致病,突显了跨数据源合成信息的操作挑战。
识别变异时展示的灵活性
在一个早期精神病病例中,模型推断出基因组中的一个结构事件,该事件未列在输入数据中。它将22号染色体上的一系列低质量调用与儿童的心脏、免疫、神经发育和精神特征联系起来,然后假设与DiGeorge综合征相关的22q11.2缺失。这一假设的变异通过后续基因组测序得到确认。
尽管提示要求单一单基因原因,但模型有时会提出两个能更好地解释复杂表现的基因。在一个病例中,LAMA2和FOXP1的变异共同解释了肌肉和神经发育特征;另一个病例有一个先前未被识别的双基因解释,涉及TTN和SRPK3。
生成可测试的生物学连贯假设
除了诊断外,模型还确定了对一种称为白癜风(vitiligo)的疾病可能的新型机制解释。在一个神经发育病例中,模型突出了白癜风患者S1PR1中的11个氨基酸缺失。S1PR1编码一种参与信号传导、免疫细胞移动和组织生物学的细胞表面受体。模型整合了证据,表明该缺失可能以减少色素产生同时帮助免疫细胞在皮肤中持续存在的方式改变受体结构和信号传导。
提出的S1PR1-白癜风关系需要额外的实验验证,但它说明了AI在将结构生物学、免疫学和临床遗传学中的零散发现转化为具体、可测试假设方面的强大作用。
研究团队还在神经肌肉队列中看到了可能的表型扩展。HSPB8和CDK13的有害变异并不完全符合这些基因最著名的疾病,表明更广泛的临床谱系需要更多病例和实验室工作来测试。
案例研究:凯拉近二十年后的诊断
一切始于空手道课,凯拉(Kyra)的母亲注意到她9岁的女儿在做姿势时无法像以前那样低。凯拉在足球训练中也变慢了,在走路和跑步时踮着脚尖。她的儿科医生无法确定她肌肉无力的原因,于是将她转诊给专家。随后是近20年的测试、治疗和咨询之旅,但没有得到诊断。
凯拉的病例是神经肌肉队列中提出的四个诊断之一。研究团队将她的病情与HSPB8中的移码变异联系起来,并诊断为一种肌原纤维肌病,其中异常蛋白质结构在肌纤维中积聚并导致无力。Manton中心的一位遗传咨询师在她28岁生日前一周给凯拉打了电话。
到那时,凯拉已经花了很多时间来适应这种疾病。到13岁时,她已经依赖呼吸机和轮椅,尽管她的病情此后已经稳定。尽管凯拉的肌原纤维肌病形式非常罕见,对其长期病程知之甚少,但诊断带来了一些闭合感。
局限性
这项研究表明,通用推理模型可以通过将表型、遗传、变异注释、数据质量模式和科学文献结合成可评审的假设,为回顾性基因组重新分析做出贡献。它还表明为什么定期重新分析很重要:一些答案只有在知识进步或零散记录被整合在一起后才会浮现。
这项研究并不是证据表明患者、临床医生或客户应该使用OpenAI模型来诊断疾病或做出医疗决策。它不描述或认可将OpenAI o3 Deep Research、ChatGPT或任何其他OpenAI产品用于诊断的预期客户用途。该模型没有诊断任何参与者;医生和其他合格的临床专家通过既定的评审、检测和临床确认流程做出了每个诊断。
该研究是回顾性的,队列是异质的,评审者没有对模型置信度进行盲审。研究人员没有测量节省的时间、成本、临床医生工作量、假阳性负担或护理变化。他们也没有系统地评估其他形式的基因变异,如结构变异、重复扩增、深内含子变化或嵌合现象。
大型语言模型可能会误解上下文或产生在仔细检查后失败的合理解释。因此,每个结果都经过了人工裁决和临床确认。该模型扩大了搜索范围并集中了随后的人工主导分析;它并未决定应向家庭返回哪些信息或诊断。
这项研究使用了去识别化信息,没有在批准环境之外使用或传输受保护的健康信息。更广泛的临床部署将需要与所有医疗保健相同的对隐私、安全性、可审计性和当地法规的关注。模型访问不能替代测序基础设施、遗传咨询、确认性检测或专家判断。
"瓶颈是时间。专家每天只能将有限的时间投入到任何一个特定的人身上。"
凯瑟琳·布朗斯坦(Catherine Brownstein)博士,波士顿儿童医院Manton罕见病研究中心
"像凯瑟琳和我这样的研究人员不可能记住8000种不同疾病的全部信息。这就是AI的力量。"
艾伦·贝格斯(Alan Beggs),Manton罕见病研究中心主任
接下来会发生什么
前瞻性、多中心研究应该比较LLM辅助重新分析与标准实践在诊断率、候选时间、临床医生工作量、假阳性负担、成本和对护理的影响方面的表现。版本化提示、参考检查、审计日志和校准的不确定性对于可重复性和安全性将非常重要。此类研究仍需要合格的临床医生来评估证据、订购适当的测试并做出任何诊断或治疗决定。
这项研究使用了OpenAI o3 Deep Research。更新的通用模型可以搜索和综合更多的科学材料,而专用系统如GPT-Rosalind则专为更深入的生物科学工作设计,包括变异对蛋白质结构和功能的影响。这些能力在这里没有经过测试,将需要自己的评估和访问控制。
虽然OpenAI帮助支持了这项初始研究,但Manton中心将通过OpenAI基金会的资助领导下一阶段的工作。该资助将支持该中心更广泛的努力,开发一个平台无关的、低成本的遗传学AI助手,帮助临床团队更快速、更一致地分析罕见疾病病例。
长期研究机会是探索专家主导的AI辅助重新分析是否能帮助科学理解跟上发现的步伐。承诺不在于AI取代医生的诊断,而在于经过仔细评估的研究工具可能帮助专家识别值得研究的证据。对于成千上万的家庭来说,今天未解答的问题不必永远保持未解答状态。
【全文结束】

