先进医疗人工智能(AI)正快速进步。在基于真实患者案例构建的复杂诊断测试中,部分AI系统已能匹敌甚至超越经验丰富的医生。然而这一进展引发了关于安全性和患者护理的深层质疑。
在纯文本病例环境中表现优异的系统,可能在真实临床场景中遭遇困境,因为人类判断和体征表现至关重要。一项新研究揭示了在医学领域应用先进AI的潜力与风险。
在文本病例测试中,该系统能追踪症状、权衡诊断方案,并产出经医师评估符合专家标准的答案。弗林德斯大学博士阿什利·M·霍普金斯指出,仅凭高分答案并不等同于安全的医疗实践,必须考量真实的临床风险。这一警示聚焦于一个关键边界:文本可能掩盖患者亲临现场时呈现的信息,下一步挑战在于证明软件能在不危害患者的前提下提供帮助。
在独立实验中,OpenAI的o1-preview推理模型通过逐步分析医疗问题提升诊断准确率。在已发表的教学案例中,GPT-4在近四分之三的案例中正确识别或接近正确诊断。而新型推理模型o1-preview将这一比例提升至近90%,凸显医疗AI性能的迅猛发展。此类成果令医院和医生难以忽视,但高分测试成绩并不自动等同于临床可靠性。
在76例真实急诊案例中,系统分阶段接收患者信息,模拟医生在快节奏轮值中的工作方式。在初步分诊阶段——即临床医生判定紧急程度的环节——o1-preview在匹配最终诊断方面超越了两名资深医师。评审员也无法可靠区分书面推理源自人类医生还是软件系统。这种相似性为医院带来机遇与风险,因为自信的语言表述可能掩盖缺失的临床细节。
真实医疗包含身体表现、语音语调、家族病史、疼痛行为等文本病例无法呈现的要素。体格检查会改变诊断依据,因为触诊、呼吸音、肿胀和活动能力等可证实或削弱诊断结论。弗林德斯大学医学院博士候选人埃里克·科内利斯表示:"医疗决策复杂、高风险且高度人性化,仅凭文本案例的准确性并不足以保障患者安全。"缺乏这些验证环节,看似正确的答案仍可能将诊疗引向错误方向。
诊断并非终点,治疗还需权衡风险、价值观、成本及患者承受能力。当临床医生选择检查项目、调整药物或让带警示症状的患者回家时,必须承担相应责任。现代医疗还需判断力和伦理监督,因为当证据不完整时,必须有人权衡取舍。只有当医生明确了解工具的优势、弱点、沉默点和过度自信领域时,辅助系统才能发挥价值。
协作看似简单,但在繁忙状态下,医生可能未经质疑就接受机器的答案。2024年一项试验发现,相比标准医疗资源,获取GPT-4并未显著提升医生的诊断推理能力。该试验中,GPT-4单独评分高于使用资源的医生,这使"软件仅作辅助"的观点变得复杂。此类结果正推动医疗系统对比纯医生、纯软件及人机协作三种模式的效果。
未经充分测试的医疗软件可能导致不均衡伤害,尤其当训练数据未能充分代表特定群体时。2019年,一款广泛使用的医疗算法通过过往医疗支出替代疾病程度来预测护理需求,该捷径因黑人群体因医疗资源获取不均导致记录支出偏低,而减少了对他们的帮助。有偏见的模型可能在被发现前已将相同错误传播给数千患者。
优秀平均值可能掩盖危险失误,消费者健康工具显示狭窄任务极易超出预期用途。2026年2月的分诊评估测试了OpenAI的消费者健康聊天机器人ChatGPT Health对紧急程度的判断,在真实急症中,该工具将51.6%的病例导向延迟24-48小时评估而非急诊护理。此失误至关重要,因为患者常在症状未显严重或难以归类时寻求快速确认。
谨慎部署可帮助医生梳理病历、比对诊断并在高压轮值中捕捉关键细节。美国食品药品监督管理局已监管医疗产品并指导开发者设计更安全的医疗人工智能,而良好的机器学习实践要求持续监测模型、患者及医院工作流程的变化。霍普金斯强调:"患者值得能改善现实医疗的技术,而非仅在研究中看似出色的系统。"仅能处理文本推理的模型,唯有当测试聚焦真实患者结局而非 headline 分数时,才能真正强化医学。研究人员和医院必须在赋予这些系统更大临床权限前,衡量决策安全性、获取公平性、工作流程适用性及责任明确性。
该研究发表于《科学》期刊。
【全文结束】

