最近发表在《自然医学》杂志上的一项研究比较了专业临床AI系统(OpenEvidence和UpToDate Expert AI)与领先AI公司(OpenAI、Google和Anthropic)的大型语言模型(LLM)。在研究中的各项测试中,这些通用LLM的表现超过了专业医疗AI系统。
许多医生使用针对医学问题和研究的专业AI应用。提供商声称,他们的系统通过特定领域的训练数据或检索增强生成(Retrieval-Augmented Generation, RAG)进行了专门优化,非常适合医学应用。
来自纽约(NYU Langone Health)的一个研究团队在《自然医学》杂志发表的一项研究中,将两个专业医疗AI系统与领先AI公司的通用LLM进行了比较。结果很明确:在所有三个测试领域中,来自OpenAI、Google和Anthropic的LLM都优于专业临床AI。
比较三个不同的医学测试
临床AI工具OpenEvidence和UpToDate Expert AI都针对医疗专业人员,旨在回答专业问题。它们与领先的LLM——GPT-5.2 (OpenAI)、Gemini 3.1 Pro Preview (Google)和Claude Opus 4.6 (Anthropic)进行了比较。在研究的一部分中,Google搜索AI概览也被纳入作为现实比较,因为这一功能在日常实践中随时可供医生使用。
研究设计包括三个部分。第一部分中,系统回答了500道以美国医学执照考试风格(医学QA基准)的医学问题。第二部分涉及来自HealthBench的500项任务,这是一个根据医生标准评估医学答案的基准。第三部分特别注重实践,研究人员开发了"真实临床查询基准(RCQ)"。为此,使用了100个匿名查询,这些查询是医生在日常实践中实际向NYU Langone Health的GPT实例提出的。这些真实临床问题的答案由12名美国医生进行盲评和随机评估。临床正确性、完整性、安全性和可理解性按1到4的等级进行评估。总计,这产生了1800个模型-问题评估结果。
通用LLM在医学知识方面取得更好结果
在经典医学知识基准MedQA中,Gemini以97.4%的准确率领先,而GPT-5.2达到了94.2%,Claude达到了90.2%。两个专业临床系统分别仅达到89.6%(OpenEvidence)和88.4%(UpToDate AI)。
在HealthBench测试中,通用LLM也表现更好。GPT-5.2在100分中获得了88.0分,而Gemini获得了79.3分,Claude获得了77.0分。OpenEvidence和UpToDate Expert AI则大幅落后,分别获得62.6分和61.3分。
通用LLM在RCQ基准中也更好地回答了来自医生的真实匿名查询。在四级评分标准上,它们获得了平均3.62分(Gemini)、3.54分(GPT-5.2)和3.52分(Claude),而OpenEvidence得分为3.24分,UpToDate Expert AI得分为3.17分。Google AI概览——Google中带有AI答案的通用搜索功能——得分约为3.27分,与医疗系统处于同一水平。
这些结果与一个明显的预期相矛盾,即经过医学优化的AI在医学问题上的表现应该优于领先科技公司的更通用系统。作者怀疑,领先的通用LLM更广泛训练数据和更快的开发周期在许多任务中可能比后续针对医学数据的专业化更具分量。
完整性、结构和遗漏方面的问题
在医生对答案的评估中,系统在安全性方面没有发现统计上显著的差异。然而,这并不意味着专业系统的答案同样好。在医学评审者的自由文本评论中,OpenEvidence和Google AI概览特别频繁地出现临床内容不完整和与安全相关的遗漏。OpenEvidence还因其相对不清晰或难以理解的答案而引人注目。
UpToDate Expert AI拒绝回答的频率也明显高于其他系统。在RCQ测试中,19%的查询被UpToDate Expert AI拒绝回答。相比之下,通用LLM的这一比例仅为1%到3%。
为什么专业化并不自动有所帮助
科学家们强调,由于系统的专有架构,他们无法明确解释为什么临床系统表现较差。一个可能的解释是,规模明显更大的通用LLM受益于其规模和广泛的知识,特别是在结合医学知识、推理和可理解沟通的任务中。这项研究不应被视为对所有方法的最终排名。作者明确指出,高度专业化的子领域、复杂的本地工作流程或特定机构的模型可能会产生不同的结果。
对诊所和监管的影响
这些结果对医院和诊所很重要,因为专业临床AI产品通常以机构信誉出现。然而,研究表明,AI系统并非仅仅因为它专门为医学开发就自动更好。至少在所检查的任务中,来自OpenAI、Google和Anthropic的通用模型明显优于临床AI系统。
这对医疗AI的采购、报销和监管有重要影响。决定性因素应该是系统在独立测试和现实任务中的表现如何,而不是它是否被宣传为专业临床产品。因此,作者建议在将AI系统广泛整合到临床工作流程之前进行更严格的独立评估。
【全文结束】

