医学:领先的大型语言模型明显胜过专业的小型语言模型
一项发表在《自然医学》上的研究表明,在医学测试中,领先科技公司(OpenAI、Google和Anthropic)的大型语言模型表现优于专业医学AI系统。研究通过三个不同测试(MedQA Benchmark、HealthBench和真实临床查询基准)评估了GPT-5.2、Gemini 3.1 Pro Preview和Claude Opus 4.6等通用模型与OpenEvidence、UpToDate Expert AI等专业系统的性能,结果显示通用模型在医学知识准确率、临床回答质量和实用性方面均明显领先,这对医疗机构选择AI系统和相关监管政策具有重要启示意义,表明AI系统在医学领域的效能更取决于其基础模型能力而非专业化程度。

