根据宾夕法尼亚州立大学的最新研究,以ChatGPT为代表的人工智能聊天机器人能够准确回答约四分之三的健康相关问题,这一发现既凸显了AI用于医疗指导的潜力,也揭示了其局限性。
由宾夕法尼亚州立大学副教授兼研究员阿穆利亚·亚达夫(Amulya Yadav)领导的研究团队招募参与者,向ChatGPT等多种AI系统提交了200多个与健康相关的症状描述和医疗问题。随后,九名经委员会认证的医师对这些回答的准确性和可靠性进行了评估。
AI"医生"准确率达76%
研究发现,大型语言模型(LLMs)在回答用户提交的健康问题时,平均准确率约为76%。在分析中,ChatGPT的表现优于其他大型语言模型。
总体而言,在回答健康相关问题时,AI系统的表明显著优于Google和Bing等传统搜索引擎。
亚达夫对美联社表示:"我惊讶于[大型语言模型]表现得如此之好。但当然,我认为我们都应该非常谨慎地对待语言模型输出的任何内容,因为它本质上是一个随机标记生成器。"
这些发现将于本周在蒙特利尔举行的2026年计算机协会公平性、问责制与透明度会议(FAccT)上公布。
AI表现最佳与最差的领域
研究还确定了AI表现不佳的几个领域。与皮肤科、心理健康和内科相关的问题通常获得较低的准确率评分。
皮肤科问题通常需要图像分析,而AI系统在这方面的能力仍不如处理基于文本的信息。心理健康问题也带来挑战,因为它们需要细致的判断。
相比之下,AI在更常规的健康咨询方面表现最佳,包括常见疾病和一般医疗问题。
AI成为无医生可及人群的资源
根据世界卫生组织的数据,全球超过50%的人口无法获得适当的医疗保健和全面覆盖。
亚达夫表示,虽然普通有医生可及的人不应放弃医生而转向AI医生,但对于全球无法获得医生服务的人群来说,AI可以成为一个重要资源。
亚达夫说:"这对那半数无法获得医生服务的人口来说似乎是一件好事,对吧?这就是一种解读方式。"但他警告说:"目前大型语言模型的准确度不如人类医生,因此我们不应,或者说我们应该非常谨慎。这是我们向公众传达的信息:在使用大型语言模型进行自我诊断时应非常谨慎。"
越来越多的人转向AI
这些发现出现的背景是,越来越多的人转向AI工具获取传统上从医疗保健提供者或在线搜索获取的信息。
事实上,最近的一项盖洛普民意调查发现,近一半的美国人在其医疗决策中,AI扮演着某种角色。
在大多数情况下,AI的作用是补充其他医疗建议或提供快速答案的途径。然而,在某些情况下,AI正被完全取代前往医生诊所的替代品。
调查显示,超过70%的受访者告诉民调人员,他们在过去30天内因某种目的使用了AI;然而,给出的原因各不相同。对大多数人来说,原因是希望更快地获得答案或想要了解更多关于自身健康的信息。超过一半的人还表示,他们希望在看医生前后进行研究。
14%的受访人员还声称,他们因为AI提供的信息而跳过了前往医生诊所的行程。盖洛普指出,这相当于估计有1400万人因AI建议或信息而放弃了与医疗专业人士的会面。
在前30天内使用AI的人中,超过40%还表示他们不想支付或无法支付医生就诊费用。其他人表示他们在工作时间外需要帮助或没有时间预约,而21%的人表示他们过去感觉被医疗提供者忽视或不被理睬。
亚达夫补充道:"我更关心的是那些能够并且确实能获得医疗服务的人。我们真的想走这条路吗——仅仅因为大型语言模型能回答问题就消除对人类医生的需求?我们应该让他们立即回答吗?这句古老的谚语——仅仅因为你有一把锤子,并不意味着所有东西都必须是钉子。"
消息来源:本报道来自洛杉矶。美联社校园洞察和此前FOX Local的报道提供了贡献。
【全文结束】

