人工智能工具已成为我们生活的关键组成部分。从编程到脚本写作,如今AI已被应用于许多行业。像ChatGPT这样的工具在回答健康相关问题以及评估患者数据以提示症状方面可能非常有效。
宾夕法尼亚州立大学信息科学与技术学院副教授阿穆利亚·亚达夫发现,经过委员会认证的医生评估,大语言模型在回答健康相关问题时正确率将近76%。这项研究正值人们逐渐转向AI聊天机器人寻求健康建议之际,引发了关于AI是否值得信任用于自我诊断的疑问。
AI“医生”的正确率为76%
研究人员为何开展这项研究?
阿穆利亚·亚达夫表示,研究团队希望了解AI聊天机器人是否有潜力成为下一代在线自我诊断工具。“长期以来,我们了解到人们一直使用谷歌等工具进行健康症状的自我诊断,”亚达夫说。他强调,先进的AI工具促使研究人员探究大语言模型用于健康建议是否会有用或带来问题。他断言:“我们想了解,如果人们开始使用大语言模型进行自我诊断,问题会有多严重——或者说可能没那么严重,也许更有用。”
AI聊天机器人准确率如何?
据亚达夫介绍,研究人员从参与者处收集了200多个健康相关的提示,并将其提交给包括OpenAI的ChatGPT在内的多个大语言模型。亚达夫指出,大语言模型准确率约为76%。他表示ChatGPT表现最为出色。
AI能否帮助无法就医的人群?
值得注意的是,亚达夫认为主要发现之一与医疗可及性相关。这位教授指出,全球估计约有半数人口缺乏足够的医疗服务。“事实上,全球任何人都可以使用这些大语言模型获得健康建议,且正确率达到76%,这似乎是一件很棒的事,”他说。亚达夫认为,对于生活在难以获得医疗专业人员地区的居民而言,AI可以成为宝贵的资源。“如果一个人无法见到任何医生,那么从语言模型那里获得一些不完美的帮助不是很有意义吗?”亚达夫反问道。
人们应该信任AI提供医疗建议吗?
尽管结果令人鼓舞,但研究人员反复警告不要完全依赖AI进行医疗决策。“大语言模型目前阶段还不能像人类医生那样准确,”亚达夫强调。他敦促用户在使用聊天机器人进行自我诊断时要谨慎,并强调医疗专业人员仍然更擅长解读症状和医疗建议。“我们在使用大语言模型进行自我诊断时应非常谨慎,”他说。据亚达夫称,医生在识别AI回答可能不准确或具有误导性方面更有能力。
【全文结束】

