达特茅斯学院的新研究表明,在某些任务中使用人工智能实际上可能导致部分医生的负担加重。根据达特茅斯学院的研究,AI工具有时会引入错误,并在医生写给患者的消息中添加不必要的细节,从而加剧医生的工作量。该研究于周二在加利福尼亚州圣地亚哥举行的计算语言学协会年会上发表。报告还指出,医生编辑AI生成回复所花费的时间,可能比不使用AI工具直接撰写回复的时间还要长。
达特茅斯学院计算机科学助理教授莎拉·普雷姆在一份声明中表示:“我们发现,AI可以像医生一样说话,但不会像医生一样思考。”根据达特茅斯学院的新闻稿,普雷姆是这项研究的共同通讯作者,另一位是普雷姆PersistLab实验室的博士生、瓜里尼研究生与高级研究学院的帕克·西格米勒。
研究人员还评估了多个AI平台(包括Claude、Google Gemini、ChatGPT、Llama、Aloe和Qwen)生成的医生回复。研究表明,这些AI生成的答案有时与医生实际撰写信息的方式不一致。报告指出,AI常见的错误包括:回复过于冗长、遗漏必要的后续问题、以及强调不相关、不准确或与临床实践不一致的医学细节。
“有一些小型研究说,‘哦,AI太棒了’,但我们意识到,现有文献中缺乏对这一技术的大规模评估,”普雷姆说。“我们不仅想衡量一个平台的准确性,还想知道它是否真的有助于减轻工作量——在这种情况下,工作量是通过医生需要进行多少编辑来衡量的。”
这项研究发布之际,人工智能近年来已开始被美国医疗专业人士更广泛地采用。美国医学会3月12日发布的一项调查显示,81%的医生表示在专业环境中使用了AI工具。美国医学会2025年2月发布的另一项调查发现,61%的美国医生担心健康计划对AI的使用“正在增加预先授权拒赔数量,加剧可避免的患者伤害,并导致现在和未来不必要的浪费。”最近的民意调查还显示,许多美国人正在转向AI获取健康相关建议。凯撒家庭基金会3月发布的一项调查发现,32%的成年人依赖AI获取医疗信息和建议。
【全文结束】

