医学领域:领先的大语言模型明显优于专业小型语言模型Medicine: Leading LLMs clearly outperform specialized small language models | heise online

环球医讯 / AI与医疗健康来源:www.heise.de德国 - 英语2026-07-25 09:49:12 - 阅读时长5分钟 - 2137字
一项发表在《自然医学》杂志上的研究表明,领先的大语言模型(GPT-5.2、Gemini 3.1 Pro Preview和Claude Opus 4.6)在医学测试中的表现明显优于专业医疗AI系统(OpenEvidence和UpToDate Expert AI)。研究通过三个不同维度评估了这些系统:500道美国医学执照考试风格问题的MedQA基准测试、500项HealthBench任务评估以及100个真实临床查询的"真实临床查询基准"。结果显示通用大型语言模型在医学知识准确性、临床问题回答质量等方面均大幅领先,这对医疗机构采购和监管AI系统具有重要意义,表明系统性能应基于独立测试而非是否专为医学设计。
医学AI通用大语言模型专业临床AI系统医学知识基准真实临床查询医疗AI评估临床正确性临床安全性
医学领域:领先的大语言模型明显优于专业小型语言模型

最近发表在《自然医学》杂志上的一项研究比较了专业临床AI系统(OpenEvidence和UpToDate Expert AI)与领先AI公司(OpenAI、Google和Anthropic)的大型语言模型(LLM)。在研究中的各项测试中,这些通用LLM的表现超过了专业医疗AI系统。

许多医生使用针对医学问题和研究的专业AI应用。提供商声称,他们的系统通过特定领域的训练数据或检索增强生成(Retrieval-Augmented Generation, RAG)进行了专门优化,非常适合医学应用。

来自纽约(NYU Langone Health)的一个研究团队在《自然医学》杂志发表的一项研究中,将两个专业医疗AI系统与领先AI公司的通用LLM进行了比较。结果很明确:在所有三个测试领域中,来自OpenAI、Google和Anthropic的LLM都优于专业临床AI。

比较三个不同的医学测试

临床AI工具OpenEvidence和UpToDate Expert AI都针对医疗专业人员,旨在回答专业问题。它们与领先的LLM——GPT-5.2 (OpenAI)、Gemini 3.1 Pro Preview (Google)和Claude Opus 4.6 (Anthropic)进行了比较。在研究的一部分中,Google搜索AI概览也被纳入作为现实比较,因为这一功能在日常实践中随时可供医生使用。

研究设计包括三个部分。第一部分中,系统回答了500道以美国医学执照考试风格(医学QA基准)的医学问题。第二部分涉及来自HealthBench的500项任务,这是一个根据医生标准评估医学答案的基准。第三部分特别注重实践,研究人员开发了"真实临床查询基准(RCQ)"。为此,使用了100个匿名查询,这些查询是医生在日常实践中实际向NYU Langone Health的GPT实例提出的。这些真实临床问题的答案由12名美国医生进行盲评和随机评估。临床正确性、完整性、安全性和可理解性按1到4的等级进行评估。总计,这产生了1800个模型-问题评估结果。

通用LLM在医学知识方面取得更好结果

在经典医学知识基准MedQA中,Gemini以97.4%的准确率领先,而GPT-5.2达到了94.2%,Claude达到了90.2%。两个专业临床系统分别仅达到89.6%(OpenEvidence)和88.4%(UpToDate AI)。

在HealthBench测试中,通用LLM也表现更好。GPT-5.2在100分中获得了88.0分,而Gemini获得了79.3分,Claude获得了77.0分。OpenEvidence和UpToDate Expert AI则大幅落后,分别获得62.6分和61.3分。

通用LLM在RCQ基准中也更好地回答了来自医生的真实匿名查询。在四级评分标准上,它们获得了平均3.62分(Gemini)、3.54分(GPT-5.2)和3.52分(Claude),而OpenEvidence得分为3.24分,UpToDate Expert AI得分为3.17分。Google AI概览——Google中带有AI答案的通用搜索功能——得分约为3.27分,与医疗系统处于同一水平。

这些结果与一个明显的预期相矛盾,即经过医学优化的AI在医学问题上的表现应该优于领先科技公司的更通用系统。作者怀疑,领先的通用LLM更广泛训练数据和更快的开发周期在许多任务中可能比后续针对医学数据的专业化更具分量。

完整性、结构和遗漏方面的问题

在医生对答案的评估中,系统在安全性方面没有发现统计上显著的差异。然而,这并不意味着专业系统的答案同样好。在医学评审者的自由文本评论中,OpenEvidence和Google AI概览特别频繁地出现临床内容不完整和与安全相关的遗漏。OpenEvidence还因其相对不清晰或难以理解的答案而引人注目。

UpToDate Expert AI拒绝回答的频率也明显高于其他系统。在RCQ测试中,19%的查询被UpToDate Expert AI拒绝回答。相比之下,通用LLM的这一比例仅为1%到3%。

为什么专业化并不自动有所帮助

科学家们强调,由于系统的专有架构,他们无法明确解释为什么临床系统表现较差。一个可能的解释是,规模明显更大的通用LLM受益于其规模和广泛的知识,特别是在结合医学知识、推理和可理解沟通的任务中。这项研究不应被视为对所有方法的最终排名。作者明确指出,高度专业化的子领域、复杂的本地工作流程或特定机构的模型可能会产生不同的结果。

对诊所和监管的影响

这些结果对医院和诊所很重要,因为专业临床AI产品通常以机构信誉出现。然而,研究表明,AI系统并非仅仅因为它专门为医学开发就自动更好。至少在所检查的任务中,来自OpenAI、Google和Anthropic的通用模型明显优于临床AI系统。

这对医疗AI的采购、报销和监管有重要影响。决定性因素应该是系统在独立测试和现实任务中的表现如何,而不是它是否被宣传为专业临床产品。因此,作者建议在将AI系统广泛整合到临床工作流程之前进行更严格的独立评估。

【全文结束】

猜你喜欢
  • 妙佑医疗国际与微软合作开发医疗健康领域前沿人工智能模型妙佑医疗国际与微软合作开发医疗健康领域前沿人工智能模型
  • 大麻二酚在焦虑、抑郁和认知方面展现临床前研究前景大麻二酚在焦虑、抑郁和认知方面展现临床前研究前景
  • 大学推出培训项目助医疗工作者"快速掌握"人工智能技术大学推出培训项目助医疗工作者"快速掌握"人工智能技术
  • 大学生转向人工智能寻求心理健康支持大学生转向人工智能寻求心理健康支持
  • 头部相连连体双胞胎"创造奇迹" 英国外科医生通过"开创性"40小时手术成功分离头部相连连体双胞胎"创造奇迹" 英国外科医生通过"开创性"40小时手术成功分离
  • 如何合法地在人体上测试MDMA和迷幻蘑菇?FDA刚刚明确了规则如何合法地在人体上测试MDMA和迷幻蘑菇?FDA刚刚明确了规则
  • 天普大学衍生企业"Ladder Bio"研发"黄金分子"或改变药物服用方式天普大学衍生企业"Ladder Bio"研发"黄金分子"或改变药物服用方式
  • 如果FDA不监管医疗健康领域人工智能的方方面面 谁来监管 高管们在圣地亚哥海滨展开讨论如果FDA不监管医疗健康领域人工智能的方方面面 谁来监管 高管们在圣地亚哥海滨展开讨论
  • 大鼠基因组编辑技术助力构建更精准的雌激素受体阳性乳腺癌模型大鼠基因组编辑技术助力构建更精准的雌激素受体阳性乳腺癌模型
  • CAIO Connect播客:主持人Sanjay Puri与信诺集团Katya Andresen探讨人工智能治理与医疗转型CAIO Connect播客:主持人Sanjay Puri与信诺集团Katya Andresen探讨人工智能治理与医疗转型
热点资讯
全站热点
全站热文