生成式人工智能已经重塑了计算机编程、零售和制造业等行业。然而在医学领域,对临床错误的担忧减缓了其应用步伐。
目前,三分之二的医生表示在实际工作中使用了生成式AI工具,但其中一半的人认为需要更强有力的保障措施。
医生群体中这种急于采用AI与谨慎提防其风险的分歧,在HBO剧集《匹兹堡急诊室》(The Pitt)最近一集中成为了焦点,该剧背景设定在一个虚构的匹兹堡急诊部。
在题为“8:00 A.M.”的这一集中,主角迈克尔·“罗比”·拉比诺维奇医生(Dr. Michael "Robby" Rabinovitch)是一位对新技术持谨慎态度的资深急诊医生。而他的临时接替者巴兰·阿尔-哈希米医生(Dr. Baran Al-Hashimi)则更为热情。
她引入了一种名为“环境监听”(Ambient Listening)的AI文档工具,以简化病历记录。该应用程序节省了时间,给住院医生留下了深刻印象。然而,它错误地识别了一种药物,若非另一位医生及时发现,这个错误可能造成严重后果。
我曾广泛撰文探讨生成式AI对医学的影响,并认为这一集引人入胜。虽然该剧准确捕捉到了医学界中AI支持者与怀疑者之间的紧张关系,但其所遗漏的内容比它所描绘的更为重要。
《匹兹堡急诊室》正确地描绘出,许多临床医生仍然对这种强大的新技术感到恐惧。
除了担心AI会犯错导致患者受伤外,医生们还担心AI会变得过于强大,最终凌驾于临床判断之上,削弱医生的作用。这两种担忧都是合理的,它们共同减缓了生成式AI的应用。
在大多数医院中,生成式AI一直被局限于行政工作:听取患者就诊情况、为电子病历起草记录、总结病历以及协助计费和编码任务。尽管炒作很多,但只有最先进的医疗系统才在部署AI来帮助医生和患者进行诊断和制定治疗计划。
从这个意义上说,该剧准确地把握了核心动态。医学中的生成式AI既没有被普遍认为是完美的,也没有被完全视为无用。相反,它已被谨慎地应用于那些不太可能影响临床结果的领域。
在其中一个场景中,阿尔-哈希米医生向同事们保证,AI系统“98%准确”。但如果没有背景信息,这个数字极具误导性。
准确性取决于所衡量的内容。如果阿尔-哈希米的意思是AI避免了98%的微小文档错误,那么这个数字就严重夸大了其性能。但如果这个统计数据意味着AI有2%的时间会犯下危险错误,那么也没有证据支持这一论断。
该集最大的错误是,它在比较技术与人类表现时高估了人类的表现。当阿尔-哈希米医生告诉同事们,这项技术“优秀但不完美”,因此必须始终有人类监督时,她暗示临床医生很少犯错。这种假设严重失实。
误诊每年导致近40万美国人死亡,另有25万人的死亡与可预防的医疗错误有关。研究表明,至少一半的电子健康记录包含至少一处错误,并且当忙碌的医生复制粘贴之前的患者记录时,许多错误会持续存在。
关键问题不在于生成式AI是否完美无缺,而在于它是否比单独工作的临床医生表现更好。即使只是适度减少误诊和可预防的伤害,每年也能挽救数万人的生命。
这一集聚焦于当前围绕生成式AI的紧张局势。它所忽略的是这项技术的发展方向。
在头对头的诊断比较中,生成式AI的表现已经达到了与人类临床医生相当的水平。
而且,随着工具迅速改进,争论焦点很快就会转移。问题将不再是生成式AI是否应该进入医学领域,而是如何最有效地部署它。
其最大的影响可能不会出现在急诊室和医院里。它将体现在帮助管理数千万患有慢性病的美国人身上。
美国疾病控制与预防中心(CDC)的数据显示,更好地控制高血压和糖尿病,可以预防多达一半的心脏病发作、中风和肾衰竭。如今,患有这些疾病的患者每年只能见到医生几次,这有助于解释为什么只有一半美国人的高血压得到了有效控制。糖尿病的控制率甚至更低。
生成式AI可以分析来自家用血压计、血糖监测仪和可穿戴设备的数据,从而能够更早地调整用药并进行更及时的治疗。临床医生将不再需要等待患者的下一次门诊或病情危急,而是可以在出现警示信号时进行干预。更持续的监测已使美国一些医疗系统取得了接近90%的控制率。
更高的质量与更低的成本相结合,是《匹兹堡急诊室》未探讨的理想未来。未来的核心争论将不再是医生与机器的对抗,而是医生与技术如何合作以造福患者。最终,尽职的临床医生、赋能的患者和生成式AI的结合,将产生比三者单独作用叠加呈指数级更优的临床结果。
罗伯特·珀尔是《ChatGPT, MD》一书的作者,同时在斯坦福大学医学院和斯坦福大学商学院任教。他曾是凯撒医疗集团(The Permanente Medical Group)的首席执行官。他为非营利性、无党派新闻平台The Fulcrum撰写了本专栏,该平台致力于报道修复我们治理体系的努力。
【全文结束】

