人工智能已经证明它能执行特定的医疗任务,如解读X光片或标记患者数据中的风险。但是,照顾患者是一个随着时间推移而动态发展的过程,需要临床医生解读来自多个来源的信号,并在患者状况变化时进行干预。稳定患者的病情可能需要医生综合实验室数值和医学影像、听诊肺部或心脏声音、观察身体反应,并决定何时升级治疗——通常在严重的时间压力下。
考虑到这种复杂性,现代AI系统究竟能走多远?更具体地说,大型语言模型能否管理整个临床决策工作流程,而不仅仅是其中的个别任务?
这个问题是宾夕法尼亚大学沃顿商学院运营管理、信息与决策教授、Mack创新管理研究所联合主任Christian Terwiesch,Mack研究所博士前研究员Lennart Meincke,以及WHU奥托贝森管理学院的Arnd Huchzermeier所撰写的一份新白皮书的焦点。该论文是Terwiesch及其同事在沃顿商学院Mack创新管理研究所支持下进行的一系列生成式AI实验的最新成果。
为了探索这个问题,研究人员将一个多模态大型语言模型放入一个真实的医疗培训模拟系统中——这种系统用于评估医学生和执业临床医生。在屏幕上,虚拟患者的状况实时演变:生命体征变化,测试结果延迟到达,不采取行动会有后果。
与回应书面提示(如"一名50岁男性出现胸痛")不同,AI必须在每一步决定接下来该做什么。它可以询问患者、打开监测器、订购实验室测试或影像检查、给予治疗以及升级护理——所有这些都必须在时钟运行且患者状况可能改善或恶化的情况下完成。实际上,该系统不是基于单一答案进行评估,而是基于它能否从头到尾管理整个临床诊疗过程。
AI的表现如何
研究人员将一个现成的多模态大型语言模型(Gemini Pro 2.5)放入BodyInteract,这是一种广泛用于教育和认证的医疗培训模拟系统。他们在四个急性护理场景中评估了AI的表现,范围从简单的家庭低血糖病例到涉及肺炎、中风和充血性心力衰竭的复杂急诊室情况。
AI的表现与超过14,000次医学生的模拟运行结果进行了对比,同时也与一位完成了相同病例的有经验的急诊医生进行了对比。
在各种场景中,AI始终能够稳定患者并在可比甚至更高的比率下完成病例——有时比医学生更快。总体诊断准确性相似,在许多情况下,AI的操作序列与专家临床实践非常相似。
值得注意的是,该系统并未被训练来解决这些特定病例或模仿专家临床医生。相反,研究人员评估了一个通用模型——而非定制的医疗系统——并观察它在被置于真实的、时间紧迫的临床环境中时如何应对诊断和治疗决策。
理解AI的推理和置信度
除了AI是否达到正确结果外,研究人员还检查了它在过程中的推理方式。随着每个病例的展开,他们跟踪系统对不同可能诊断的置信度如何随着新信息的出现而变化,就像临床医生在测试结果到达时更新他们的思考一样。
一个清晰的模式出现了。在病例早期,AI倾向于订购能提供大量新信息的测试,迅速缩小可能诊断的范围。随着诊疗的进行,额外的测试产生的收益变小,不确定性降低。实际上,该系统的行为似乎是在优先考虑最有信息价值的操作,而不是不加区分地订购测试。
同样重要的是,AI的置信度是有意义的。当系统对诊断表现出高度置信时,它很可能确实是正确的;当它保持不确定时,错误的可能性更高。这种置信度与准确性的对齐表明,AI并非简单地过度自信,而是能够区分它已有效解决的病例和那些仍然模棱两可的病例。
这一发现引人注目,因为人们越来越担心大型语言模型常常表现出超出其实际可靠性的置信度。在这种动态、多模态的环境中,AI的置信度与表现表现出奇地吻合。
人类仍然重要的领域
该研究也突显了明显的局限性。虽然AI在稳定患者方面快速有效,但它与人类临床医生相比,始终较少进行患者沟通。它还倾向于比经验丰富的医生订购更多的诊断测试,这表明在成本意识的诊断决策方面,专家判断仍然更为优越。
出于这些原因,作者强调,他们的结果不应被解释为支持在医疗保健中使用无人监督的AI。相反,这些发现指向AI更针对性的角色,作为工作流程级别的支持系统,或作为医生旁边的"第二双眼睛"。在时间紧迫或资源受限的环境中,如急诊科,AI可以作为快速稳定器或分诊助手——管理信息、监测患者状况并标记高风险病例——而临床医生则专注于判断、沟通和监督。
从运营和管理的角度来看,更广泛的教训是,仅基于静态基准评估AI低估了其潜在影响。重要的是,不仅AI是否得到正确答案,还包括它如何管理不确定性、时间压力以及整个过程中的权衡。随着AI系统继续改进,核心挑战可能不再是它是否能够推理,而是如何将其整合到以人为中心的工作流程中。
【全文结束】

