哈佛医学院和贝斯以色列女执事医疗中心的研究人员进行的一项新研究重新点燃了关于人工智能在医学中作用的讨论。研究结果显示,由OpenAI开发的AI模型在某些场景下,基于急诊室可用信息提供的诊断比两名人类医生更为精确。
这一发现令人瞩目,但也存在重要细微差别。该研究并非表明AI已准备好取代急诊室中的医生,也并非建议将生死攸关的决策交给算法。相反,研究显示大型语言模型可以成为有力的辅助工具,尤其是在信息有限、时间紧迫且正确诊断至关重要的时刻。
在其中一个实验中,研究人员分析了76名来到贝斯以色列医院急诊室的患者。由两名内科专家医生做出的诊断与OpenAI的o1和4o模型生成的诊断进行了比较。评估由另外两名医生进行,他们不知道这些诊断是来自人类还是AI。这种方法用于减少偏见风险,并观察当模型获得与医生完全相同的信息时的表现。
o1模型在诊断过程的多个环节中表现与医生相当或更佳。差异在最初的评估阶段最为明显,即在急诊室的初始分诊阶段,此时关于患者的信息最少,而做出快速决策的压力最大。
在这一阶段,o1在67%的病例中提供了准确或接近准确的诊断。相比之下,一名被评估的医生在55%的病例中达到准确或接近准确的诊断,另一名则为50%。对研究人员而言,这一结果表明,即使在数据不完整的情况下,AI也能快速识别有用模式。
尽管数据看起来令人印象深刻,但结论不应被夸大。研究人员强调,这些模型是在从电子病历中提取的文本信息上进行测试的。数据在输入系统前未经过特殊处理,这使结果更具相关性,但限制仍然重要。
在急诊医学中,诊断不仅仅是一个智力练习。医生不仅要猜出患者的最终疾病,还要快速决定患者是否患有危及生命的疾病。这种区别至关重要,尤其是在急诊室,稳定患者和识别即时风险是优先事项。
另一个重要细节是,人类诊断是由内科专家医生而非急诊医生做出的。该研究的批评者表示,为了进行更相关的比较,AI应该与实际在急诊工作的专家进行对比,而不是与其他实践领域的医生进行比较。
这一观察并不会否定研究结果,但为其提供了背景。AI模型可以在特定任务中表现出色,但这并不自动意味着它可以在真实的临床环境中承担医生的全部角色,在那里沟通、体格检查、直觉和法律责任都至关重要。
研究作者呼吁在真实临床环境中进行前瞻性测试,以了解这些系统在整合到患者护理中时的表现。在此之前,AI仍然是一个有前景的工具,但不能替代人类医疗决策。
其中一个主要问题是缺乏明确的责任框架。如果AI系统建议了错误的诊断,谁来负责:医生、医院、模型开发者还是所有人共同负责?没有明确的规则,在关键情况下使用这些技术仍然很困难。
患者需要精确性,但也需要有人向他们解释选择、风险和治疗方法。在危机时刻,信任、同理心和责任感不能简化为一个准确率分数。
哈佛研究显示,医疗AI正在迅速发展,可以成为医生的宝贵盟友。但它也表明,这一过渡必须谨慎构建。在未来的医院中,人工智能可能有助于诊断,但艰难的决策仍将需要人类判断。
【全文结束】

