谷歌的新AI可能永远改变医疗保健(谷歌DeepMind AI联合临床医生解析)Google’s new AI could change healthcare forever (Google DeepMind AI co-clinician explained)

环球医讯 / AI与医疗健康来源:www.msn.com美国 - 英语2026-10-09 10:19:58 - 阅读时长13分钟 - 6001字
谷歌DeepMind发布了一款全新的AI医疗助手,能够通过实时视频与患者进行诊断对话、指导体检,并在多项基准测试中超越现有AI系统和部分人类医生。本文通过三个演示案例展示了该AI在急性胰腺炎、重症肌无力和肩部损伤诊断中的表现,以及其在证据理解、药物咨询和临床技能评估上的优异数据。但研究者强调该技术目前仍为辅助工具,存在局限性,需进一步改进。
医疗AI健康诊断临床患者医生远程医疗体检医疗咨询
谷歌的新AI可能永远改变医疗保健(谷歌DeepMind AI联合临床医生解析)

但谷歌刚刚发布了一款让地球上每一位医生都必须真正关注的东西。这并非因为AI正在取代他们,而是因为它在实际医疗咨询的68个不同方面刚刚超越了众多医生。这就是AI认知能力:它能看见你、听见你、与你对话、观察你的呼吸和行走方式,并实时指导你完成体格检查。在接下来的几分钟里,我将向大家展示三个关键演示,并解析相关基准测试,让你准确理解这背后的原理。让我们开始吧。你好,我是你的虚拟医疗助理。今天有什么可以帮你的?我肚子疼得厉害。多年来,我们的团队一直在研究如何让AI有意义地增强医患关系。今天,我们希望为大家提供一个透明的窗口,了解我们的进展。医生们谈论超级智能医疗AI已经超过70年了。这是最令人着迷的事情——比如,如何评估那些像人类专家一样行动但在其他方面却会失败的机器?进行非常自然的诊断对话,同时不牺牲深入的临床推理能力,一直是核心的技术挑战。你即将看到我假装成一位急性胰腺炎患者。我可以清晰地看见你。你看起来不舒服,这和你描述的疼痛以及无法喝水的情况相符。为了帮助确定病因,我想进行一次简短的引导式体检。这是一种新型系统,它不仅能在输入文本空间中交流,还能说话,更重要的是,它可以通过摄像头观察患者,并指导患者完成体检。疼痛是局限在那个区域,还是会移动到其他地方,比如背部或下腹部?大部分时间都在那个区域,但我感觉背部也有些疼。大多数医生看到这个病例,脑子里都会尖叫:是否放射到背部?是否放射到背部?看到推理轨迹,看到模型本身在过程中的思考,真的很酷。为了帮助确定病因,我想进行一次简短的引导式体检。如果可以,请躺下来并露出你的腹部,这样我就能看到你提到的区域。不能,但我可以在椅子上做。不,我的肚脐不疼。好的,谢谢您澄清肚脐本身不疼。既然疼痛在肚脐周围并且有灼烧感,您能否试着按压肚脐正上方,并告诉我是否会引起压痛?哦,是的,真的很疼。AI让我按压自己的肚脐,不疼。然后它根据这一点调整了体检要求,说:“你能按压肚脐上方吗?”那是上腹部区域,正是急性胰腺炎疼痛的地方,就像这个病例一样。这正是医生会做的,令人印象深刻。你可以实时看到它在响应我们的视频,真正观察我们,并根据所见调整评估。它还做了一件通常是体检最佳实践的事情:你想先检查你认为患者不疼的区域,了解基线情况,然后才移动到疼痛区域。这个智能体正在制定一个非常具体的计划,说明需要调查什么,以及采用什么策略来降低诊断的不确定性。按压时疼,还是松开时疼?都疼,真的很疼。它在测试所谓的“反跳痛”。这是个好问题。我个人绝不会在远程医疗中问患者这个问题。反跳痛通常是医生在患者躺着时评估的。这绝对是个好问题。再说一次,如果我要问反跳痛,我希望患者在我面前,我不会通过远程医疗这样做。肚脐周围持续的灼烧痛、严重呕吐且无法喝水、按压和松开时感觉到的压痛——我担心这可能是一个严重的医疗问题,比如阑尾炎或胰腺炎。这需要立即进行当面评估。请立即呼叫急救服务或让人送你去最近的急诊室。我认为在鉴别诊断中包含阑尾炎或胰腺炎是合理的。有时临床会诊并没有像多选题那样简单的答案。我当然对这两种不同诊断的概率排名非常不同。最终重要的是后续步骤。从这个角度看,AI系统是完全正确的:下一步是急诊护理、生命体征监测、补液、化验,以及在美国和世界许多地方几乎都会进行的CT扫描,从而得到明确的诊断。在急诊室,他们可能会先检查你的生命体征,比如血压和脉搏,因为呕吐可能导致脱水。然后他们会抽血检查感染或炎症的迹象,并可能进行超声波或CT扫描,看看你的阑尾、胰腺或胆囊是否有问题。他们可能会给你静脉输液补水,并用药缓解疼痛和恶心。这听起来是个清晰的计划吗?这很有趣,对吧?你可以在这个片段中看到,这些系统确实取得了进展,它们显然具备一些能力:识别正确诊断、以有用的方式引导患者完成体检,甚至对相当严重的医疗问题进行分诊。但另一方面,希望这些片段也能展示这个系统还有哪些显著的改进空间。虽然还处于早期阶段,但前景……下一个案例中,哈佛大学的医生杰森向他的医生主诉眼皮下垂。这是一个非常有趣的案例,因为它要求一名好医生提出非常复杂的问题,同时仔细检查患者。这位患者表现出的体征我称之为“未被诱发的体征”。这对任何观看的人来说当然非常明显。其中一个问题是:这对AI系统来说有多明显?在这个案例中,我假装成一位患有重症肌无力的患者。你的眼皮这样下垂从来都不正常。我们想测试一下:AI是否能看到我的眼皮不正常?它会不会问起这件事?我注意到我的右眼皮最近比左眼皮下垂得更多。我能看到你提到的右眼皮下垂。你第一次注意到这种情况是什么时候?大概一个月前。我抱怨右眼皮下垂,它立刻看着我的脸,核实我的眼皮确实下垂了。它在思维日志中写道——我们有这个日志可以评估——“我看到患者眼皮下垂”。它并没有说“哦,看起来他的眼皮下垂了”。它是在患者说出之后才这样说的。这是人类与AI系统之间的一个非常有趣的差异。AI系统真的注意到了吗?如果患者继续谈论他失眠的事实,它会不会提到他的下垂眼?你的瞳孔大小有没有变化?有没有复视或眼睛疼痛?瞳孔大小没有变化,也不疼,但我确实有时候会看到重影。复视在一天中的特定时间更常见吗?比如当你疲劳的时候?是的,我注意到刚醒来时不太严重,然后过了一两个小时,开始日常活动后,我的眼皮下垂得更厉害,重影也更多。有一种非常相似的疾病叫兰伯特-伊顿肌无力综合征,它会在一天中逐渐好转。所以它立刻问出了神经科医生会知道要问的最重要的相关问题之一。在这里我们可以看到思维日志中写道:“上睑下垂和复视的疲劳性特点强烈提示神经肌肉接头疾病,最突出的是重症肌无力。”这是一个准确的评估。现在,你能抬头看天花板并保持凝视约30秒吗?这不是一个对每个患者都会做的常规检查动作。你几乎从来不做这个体检动作。这相当令人印象深刻。这是一个适合远程医疗的恰当体检动作。也许神经科医生会这么做。我实际上不太了解。可能有神经科医生通过远程医疗这样做,但我从未想过这么做。所以看到它这样做很酷。根据我们讨论的情况,最可能的是重症肌无力。其他可能的原因包括兰伯特-伊顿肌无力综合征或机械性问题,但疲劳性使得重症肌无力成为首要关注点。下一步是进行一些进一步检查,并转诊给专家,比如神经科医生,以确认诊断并开始治疗。我大体上同意AI模型所说的。这是一个典型的、几乎是刻板印象的重症肌无力表现。更重要的是,模型是正确的。还有很多检查要做,其中很多需要当面进行。所以患者应尽快看神经科医生。如果我在初级保健诊所通过远程医疗看到这位患者,我的鉴别诊断、推理和下一步行动会完全一样。我是否应该对某种疾病非常担心?虽然重症肌无力是一种慢性疾病,但好消息是它通常可以通过治疗很好地控制。大多数患者可以过上充实而积极的生活。主要需要注意的一点是,在极少数情况下,它可能影响呼吸肌肉,因此让专科医生参与监测非常重要。你是否担心疾病的某个特定方面?这与我诊断这类疾病时所说的话非常相似:安慰患者这是一种可治疗的疾病,他们能够过上正常的生活。AI在医疗保健中的潜力是巨大的。但这类具有实时、低延迟、流畅视频模型的非常新颖。正如我们的研究所揭示的,它们在令人惊讶和细致的方面既有优势也有局限性。引入的视角越多越好。我们希望分享这些片段能让这一点变得生动。你好,我是你的虚拟医疗助理。今天有什么可以帮你?你好,我的右肩真的很疼,我想检查一下。在这个例子中,你看到的是实时、低延迟的视频处理如何让AI系统不仅能够采集病史,还能真正进行体格检查——寻找患者非常细微的线索,同时指导他们进行一系列动作和测试,这正是真正的医生在通话中可能做的事情。你即将看到我的同事Ryu Tano,DeepMind的研究科学家之一,他正在扮演一位肩部受伤的患者。我们构建了这个场景来展示一个逐渐过度使用的损伤。当我们构建这样的场景时,我们非常明确:哪些信息应该主动提供,哪些信息除非被明确询问否则不应该提供。很抱歉听到你的右肩疼。当你试图抬手臂、伸手过顶或做特定动作时,疼痛会加重吗?我想是的。好的,考虑到你的工作,这说得通。从1到10打分,1为不痛,10为能想象到的最痛,你现在感觉有多痛?4或5分。有时患者会进来试图淡化疼痛,看起来舒适,你无法一开始判断他们有多痛。你问他们这个问题,有时他们会说“10分”。突然间,这个疼痛比他们说“1分或2分”时要严肃得多。有时你能在人们脸上看到,但有时真的看不出来。所以这是一个很棒的问题,AI问了它,很好。我想看看你的肩膀能怎么动。请试着将你的右臂向前伸直,然后向侧面尽可能高地抬起,但不要引起太多疼痛。好的,让我试试。向前。是的,很疼。是的,有点疼。这个时刻特别有趣,因为它很好地展示了我们医疗AI智能体的视频处理能力。例如,通过检查它的内部思维,你会看到智能体对视频画面进行了相当详细的观察:首先是初始引导体检步骤中测试的特定动作的活动范围,而且值得注意的是,智能体还注意到患者在做这个动作时犹豫了。此外,智能体还令人印象深刻地列出了还需要测试哪些其他动作,以便确定可能的诊断。谢谢你的配合。看起来你可以向前抬臂很远,但会疼。现在,请试着将你的手臂向侧面伸直抬起来,同样尽可能高,但不要引起太多疼痛。哦,是的,这个很疼,相当疼。这个体检中我喜欢的其中一点是,模型实际上让他做他还没做的事情。它让他向前和向侧面做,他只做了其中一个。然后模型当然恰当地注意到他只做了一个,并让他做另一个。这是一个非常像人类的特点——首先,让患者做太多事情是一种很人性的倾向,因为同时做多项体检动作在认知上是密集的;其次,意识到自己要求太多并重新回头,这也是很人性的。所以我喜欢这个细节。谢谢你的展示。你在向前抬臂和向侧面伸臂时感到的疼痛,以及你提到的僵硬和夜间疼痛,表明你的肩袖可能有问题,可能是撞击或肌腱炎,这与你的工作经历相符。对于即时管理,我建议继续休息肩膀,定期冰敷,如果安全的话考虑服用非处方止痛药如布洛芬。去看物理治疗师也会有益,他们可以提供针对性锻炼。根据症状是否改善,以后可能需要进一步影像学检查,如超声波或MRI。它在这里做得很好:即使确实有肩袖损伤,程度并不严重,患者还能动臂,现在不需要做MRI。这是一个非常重要的判断——当我们看患者时,需要决定现在是否需要影像学检查?是否需要MRI?还是可以通过物理治疗和非处方止痛药如泰诺和布洛芬来给时间恢复?它做出了正确的评估。当Ryu进行这个体检时,我们开始看到哪些动作引起他的疼痛,我当然开始想这听起来像肩袖肌腱炎。然而,我的头脑很清楚:还有其他测试需要做。我认为这里演示的可能存在过早闭合的问题,还有其他一些很容易做的体格检查征象可以给我们更多确定性。我需要手术吗?根据我们讨论的情况,对于我们所怀疑的肩部问题(如肩袖撞击或肌腱炎),手术通常不是首选治疗方案。我们通常会先尝试保守治疗,如休息、调整活动(尤其是在工作中)和物理治疗。如果这些治疗在几个月内没有改善你的症状,或者存在明显的肌腱撕裂,才会考虑手术。鉴于你的工作,明智的做法是暂时避免搬运重物。它做的一切都合适,但它可能只选择了八个最合适测试中的三个。而且它绝对没有精确定位到具体位置。尤其是,我想看到做撞击测试。对。回顾视频,我认为不能说这绝对是肩袖损伤,也可能是粘连性肩囊炎。鉴别诊断中还有其他项目。但最终,保守治疗——我们称之为物理治疗、休息、冰敷、布洛芬、泰伦诺等非处方药——看看是否能自行愈合是正确的判断,并且他们恰当地评估了疾病的急性程度。我认为这是一个有趣的案例,你可以看到模型如何让患者进行一系列动作,但并非随机或僵化地遵循一系列规则。相反,在体检的每个方面,你可以看到AI系统试图解读发现,利用这些发现筛选最可能的诊断,然后智能地推理下一步应该进行哪些检查方面。

所以DeepMind做的第一件事,是每个AI实验室都声称能做到但几乎没有真正做到的:他们让真实的医生对模型进行盲测——头对头,没有营销,没有挑选。看看这张图:顶部横条,医生将AI联合临床医生与2026年3月临床医生已经在使用的现有临床工具进行对比。67%的情况下,医生更喜欢AI联合临床医生。26%选择了现有工具,5%保持中立。但这里更激烈的部分来了:看底部横条。他们将其与GPT-5.4 thinking with search进行了测试——大狗,模型是大多数人每月花20美元订阅的。AI联合临床医生仍然以63%对30%获胜。现在当你思考这一点时,这不仅仅是一个“氛围检查”。这是经过适应医学领域的“无伤害框架”,由学术医生测试所谓的“过失性错误”——基本上是说AI是否说谎,以及“遗漏性错误”——遗漏关键信息。因为在医学中,AI没说的东西和它说的东西一样容易致命。在98个真实的初级保健查询中,AI联合临床医生在97个案例中记录了零个关键错误。97/98。这太疯狂了,因为这是医疗AI以前从未达到的数字。好了,证据敏感性是一回事,但药物呢?这里变得有趣了。这是RxQA基准测试。它基于OpenFDA数据构建。其重点是向AI系统提出那种真正医生在真实咨询中会问的残酷的开放式药物问题:药物相互作用、剂量、边缘案例。这是几乎所有历史AI模型都会崩溃的部分,因为大型语言模型是在开放网络上训练的,而开放网络在药物数据方面是“垃圾进垃圾出”。AI联合临床医生不仅稍稍领先,而是在这个测试中超越了所有其他前沿AI系统,尤其是当问题以医生实际提问的方式提出时——开放式、模糊、带有真实患者的混乱背景。这个区别很重要。大多数医疗AI基准测试都是多项选择(A、B、C、D),那只是教科书式测试。真实的医学不会提供选项。真实的医学是:“我妈妈吃这个药10年了,现在她的脚踝肿了,这有问题吗?”而正是这类问题,这个系统正在获胜。

好了,它能阅读证据,能推理药物,但它能实际像医生一样行动吗?这就是第三个基准测试的用武之地。这是整个事情中最重要的之一。DeepMind与哈佛大学和斯坦福大学的医生合作构建了20个合成临床场景。然后他们让10位真实医生扮演患者。AI联合临床医生运行咨询,然后他们在140个不同的咨询技能方面进行了评估。而下面这个数字是需要你关注的重点:AI联合临床医生在140个评估领域中,有68个领域的表现达到或超过了初级保健医生的水平。现在,在评论区爆发之前,必须说明:人类医生整体上仍然领先,尤其是在危险信号识别和指导关键检查方面。而DeepMind对此也表述得非常清楚——他们的结论是,这是一个辅助工具,而非替代品。这当然是负责任的说法。但你我都清楚,140分之68实际上意味着什么。这意味着差距正在缩小,并且缩小得非常快。这是首次我们看到一个多模态医疗AI经过如此严格的测试并经受住了考验。

【全文结束】

猜你喜欢
  • 肿瘤学中的大型语言模型:潜力遭遇基础设施问题肿瘤学中的大型语言模型:潜力遭遇基础设施问题
  • 胖猫?减肥药或将惠及你的超重宠物胖猫?减肥药或将惠及你的超重宠物
  • 肿瘤学前沿:回顾2026年2月FDA审批里程碑肿瘤学前沿:回顾2026年2月FDA审批里程碑
  • 肠道微生物组与心脏和肾脏健康相关肠道微生物组与心脏和肾脏健康相关
  • 胃肠科医生认为这是最有益肠道健康的晚餐胃肠科医生认为这是最有益肠道健康的晚餐
  • 聚焦心脏健康聚焦心脏健康
  • 肯尼亚押注AI驱动的放射治疗以缩小非洲癌症护理差距肯尼亚押注AI驱动的放射治疗以缩小非洲癌症护理差距
  • 肠道检查:7天腹胀消除挑战,助你实现卓越消化与肠道健康肠道检查:7天腹胀消除挑战,助你实现卓越消化与肠道健康
  • 肿瘤学多模态人工智能的进展肿瘤学多模态人工智能的进展
  • 肯特大学宿舍学生将接种脑膜炎疫苗,斯特里廷称此次疫情“史无前例”肯特大学宿舍学生将接种脑膜炎疫苗,斯特里廷称此次疫情“史无前例”
热点资讯
全站热点
全站热文