2011年9月,IBM宣布其在《危险边缘》(Jeopardy!)节目中获胜的超级计算机沃森将与WellPoint公司合作,彻底改变医疗决策。当时承诺的前景令人震惊:一个能够在三秒内处理2亿页医疗数据的系统将帮助医生诊断疾病、推荐治疗方案并降低成本。十五年后,沃森健康已成为一个警示故事,但它为真正实现这一愿景的AI系统铺平了道路。
人工智能在医疗健康领域的发展并非从失败到成功的直线进程。它是一个从过度炒作的基于规则的系统,到真正具有变革性的机器学习工具的复杂演变过程,这些工具如今正在拯救生命。本文将完整回顾这段历史,从沃森的辉煌崛起与跌落,到重塑全球患者护理的现代医疗AI革命。
IBM沃森健康:150亿美元的警示故事
承诺与期望(2011-2015年)
2011年2月,当IBM沃森击败《危险边缘》冠军肯·詹宁斯(Ken Jennings)和布拉德·鲁特(Brad Rutter)时,这一成就震惊了全球。IBM迅速转向商业化这一技术,医疗健康成为其旗舰应用领域。2011年9月与WellPoint(现为Anthem)的合作伙伴关系只是开始。
IBM投入巨资,花费超过150亿美元收购了多家公司,包括Truven Health Analytics(26亿美元)、Merge Healthcare(10亿美元)和Phytel(金额未公开)。愿景十分宏大:沃森将分析患者记录、医学文献和临床试验数据,提供在速度和广度上超越任何人类医生的治疗建议。IBM的营销将沃森定位为个性化医疗的未来。
2011年与WellPoint的原始声明概述了一个分阶段实施的方法。第一阶段将协助护士管理复杂的患者病例;第二阶段将把沃森部署到肿瘤科实践中,医生可以输入症状并获得基于证据的治疗建议。WellPoint的首席医疗官称其为"无价资源",将"极大地提高医疗服务的质量和有效性"。
惊人的失败(2015-2022年)
问题早在初期就已显现。最具破坏性的失败是沃森与德克萨斯大学MD安德森癌症中心(MD Anderson Cancer Center)的合作。该合作始于2013年,旨在构建"肿瘤学专家顾问"系统,在2017年因大学审计发现项目未达目标而被搁置前,已耗资6200万美元。内部文件显示,沃森经常生成错误甚至危险的治疗建议。
根本问题在于架构。沃森并非像现代AI那样运作的学习系统。它严重依赖人类专家编写的规则,难以从有限的训练数据中进行泛化。肿瘤学因其巨大的复杂性和不断涌现的新研究,暴露了沃森无法跟上医学知识快速发展的局限性。医生报告称,沃森的建议常常与他们已知的内容一致,没有提供任何价值,甚至更糟的是,提出了与既定指南相矛盾的治疗方案。
到2018年,IBM已悄然缩减沃森健康部门,裁员并缩小业务范围。多家医院系统放弃了与沃森的合作关系。2022年1月,IBM以约10亿美元的价格将沃森健康出售给私募股权公司Francisco Partners,仅为IBM在该部门投资的150多亿美元的一小部分。此次出售实际上结束了将AI引入医疗健康领域最雄心勃勃、也是最受公众关注的尝试。
沃森为何失败:对现代AI的启示
沃森的失败并非概念上的失败,而是执行和时机的问题。多个因素导致了这一结果。首先,IBM过度承诺。营销材料将沃森描述为具有接近人类推理能力的系统,而本质上它只是一个复杂的搜索和匹配系统。其次,沃森的训练方法需要医学专家进行大量手动整理,使其扩展成本高昂且更新缓慢。第三,医疗数据杂乱无章。电子健康记录使用不一致的格式,不同机构间的缩写各不相同,关键信息常常埋藏在非结构化的临床笔记中。沃森无法在大规模上应对这一现实。
这些教训直接塑造了下一代医疗AI的构建方式。现代系统使用在更大规模数据集上训练的深度学习,能够原生处理非结构化数据,并且无需手动规则编程即可持续改进。
谷歌DeepMind与药物发现革命
当沃森陷入困境时,谷歌DeepMind正悄然取得将从根本上改变生物医学科学的突破。2020年,DeepMind的AlphaFold系统解决了生物学的一个重大挑战:从氨基酸序列预测蛋白质的三维结构。这个问题困扰研究人员长达50年。
AlphaFold的预测准确度之高令科学界震惊。2022年,DeepMind通过AlphaFold蛋白质结构数据库免费发布了几乎所有已知蛋白质(超过2亿个结构)的预测结构。到2024年,该系统的后续版本被用于将药物发现时间从数年缩短至数月。包括辉瑞(Pfizer)、诺华(Novartis)在内的制药公司以及数十家生物技术初创公司已将AlphaFold整合到其研究管道中。
与沃森的对比颇具启发性。沃森试图复制广泛的临床推理却失败了,而AlphaFold则专注于一个特定的、定义明确的科学问题,并彻底解决了它。这种"窄而精"而非"宽而泛"的模式成为成功医疗AI的定义性方法。
FDA批准的AI:800多款获批医疗设备
截至2026年初,美国食品药品监督管理局(FDA)已批准800多款AI赋能的医疗设备,且批准速度逐年加快。大多数设备集中在放射学和心脏病学领域,但如今AI获批设备已覆盖病理学、眼科、皮肤科、胃肠病学和神经病学。
AI在放射学中的应用:发现人类遗漏之处
放射学已成为医疗AI的试验场。来自Viz.ai、Aidoc和RADLogics等公司的系统可以在几秒钟内分析医学图像,标记出人类放射科医生在长时间阅读过程中可能忽略的潜在癌症、中风和骨折。
2024年发表在《柳叶刀数字健康》(The Lancet Digital Health)上的一项里程碑式研究表明,与标准的双人人工阅片相比,AI辅助乳腺X光检查将假阴性率降低了20%。该系统发现了最初人工审查中遗漏的癌症,尤其是在致密乳腺组织中,这些肿瘤在视觉上最难检测。
到2026年,AI辅助阅片已成为美国、欧洲和亚洲部分地区主要放射科诊所的标准做法。该技术不会取代放射科医生,而是作为不知疲倦的第二位审阅者,优先处理紧急病例,标记异常,并减轻每天处理数百次扫描的医生的认知负担。
AI辅助手术
外科AI已从科幻走向临床现实。达芬奇手术系统(da Vinci system)的制造商直觉外科公司(Intuitive Surgical)已将AI能力整合到其实时组织识别和手术引导中。该系统现在能够在手术过程中识别关键解剖结构,降低意外损伤神经和血管的风险。
强生公司的Ottava手术平台和美敦力(Medtronic)的Hugo系统都整合了AI驱动的规划和术中指导。2025年发表的研究表明,AI辅助手术规划将复杂手术的操作时间缩短了15-20%,并降低了并发症率。虽然完全自主手术仍需数年时间,但AI对人类外科医生的增强已经改善了患者预后。
大型语言模型在临床实践中的应用:GPT-4及以后
大型语言模型(LLMs)的出现改变了医疗AI在临床文档和决策支持方面的潜力。2023年,OpenAI的GPT-4在美国医师执照考试(USMLE)中取得了远超及格线的分数,展示了沃森从未达到的广泛医学知识。
然而,LLM在医疗健康领域最具影响力的应用并非诊断,而是文档记录。医生每进行一小时的直接患者护理,大约需要花费两小时处理文书工作。微软的Nuance DAX Copilot(Dragon Ambient eXperience,达芬奇环境体验)使用环境AI来监听医生-患者对话,并自动生成临床笔记。到2026年,DAX已部署在数千家医疗机构中,据报道平均为每位患者就诊节省了七分钟。
其他环境文档工具,包括Nabla、Abridge和DeepScribe,也在这一领域展开竞争。综合影响十分显著:医生报告称职业倦怠减少,与患者面对面的时间增加,文档处理周转更快。这可能是医疗AI应用中最不起眼但最具即时影响力的应用。
心理健康与AI聊天机器人
由AI驱动的心理健康支持发展迅速,这由全球治疗师短缺和对可及性护理日益增长的需求所推动。Woebot和Wysa等应用程序使用对话式AI提供认知行为疗法技术、情绪追踪和危机支持。临床试验显示,使用这些平台的用户焦虑和抑郁症状有可测量的减少。
这一类别仍然存在争议。批评者认为,AI聊天机器人无法替代人类治疗关系,对急性心理健康危机期间安全的担忧是合理的。2025年,一起涉及通用AI聊天机器人向脆弱用户提供有害建议的事件加剧了监管呼声。大多数专注于医疗健康的心理健康AI平台现在都将人工升级协议和危机检测系统作为标准安全功能。
监管环境:欧盟AI法案和FDA框架
医疗AI的监管正在迅速演变,以跟上技术发展。欧盟AI法案(EU AI Act)自2024年开始分阶段实施,将大多数医疗AI系统归类为"高风险",要求进行合规评估、建立人工监督机制,并对训练数据和系统限制保持透明。
FDA已调整其监管框架,以解决AI医疗设备的独特特性,特别是那些随时间学习和变化的系统。该机构的预先确定变更控制计划允许制造商提前描述预期的修改,使AI系统能够在无需为每次更新提交全新监管申请的情况下进行改进。到2026年,FDA还加强了对AI训练数据中人口统计偏见的审查,要求证明系统在不同种族、民族和年龄组中表现公平。
中国、英国和其他几个国家已制定各自的医疗AI监管框架,形成了跨国公司必须应对的复杂拼图。通过国际医疗器械监管论坛正在进行协调努力,但不同司法管辖区之间仍存在显著差异。
伦理问题:偏见、责任与同意
医疗AI提出了技术本身无法回答的深刻伦理问题。训练数据中的偏见仍然是一个持续关注的问题。研究表明,AI系统对少数种族和民族群体的患者表现明显较差,通常是因为训练数据集过度代表来自资源丰富医疗系统的白人患者。
责任是另一个未解决的挑战。当AI系统促成误诊时,法律责任应归于开发者、医院还是依赖该建议的医生,在大多数司法管辖区缺乏明确的法律先例。患者对AI参与其护理的同意问题处理不一致,许多患者不知道AI系统影响了他们的诊断或治疗计划。
透明度是监管机构和患者倡导者日益增长的需求。许多深度学习系统的"黑箱"性质使得难以解释为何做出特定建议。可解释AI(XAI)研究正在解决这一问题,但该领域仍在发展中。医疗机构越来越认识到,赢得患者信任需要就AI何时以及如何参与其护理进行清晰沟通。
医疗AI的未来走向(2026-2030年)
即使具体细节尚不确定,发展趋势已十分清晰。将医学影像、实验室结果、基因组数据和临床笔记结合起来进行统一评估的多模态AI系统正在进入临床试验。基于患者完整数据档案的个性化治疗建议——沃森最初承诺却无法实现的目标——正通过现代深度学习架构在技术上变得可行。
AI驱动的药物发现预计将在2027-2028年产生首批完全由AI发现并上市的药物,Insilico Medicine、Recursion Pharmaceuticals和Isomorphic Labs(DeepMind的衍生公司)等公司正引领这一潮流。由AI驱动的远程患者监测,利用可穿戴设备的数据,正在为心力衰竭和糖尿病等慢性疾病提供早期干预。
从沃森的失败和现代AI的成功中得出的根本教训是:医疗AI在增强而非替代人类专业知识时效果最佳。当今最具影响力的系统是让医生更快、更准确、减轻行政工作负担的工具。这不是IBM在2011年兜售的科幻愿景,但它正在全球真实的医院中拯救生命。
常见问题解答
IBM沃森健康为何失败?
IBM沃森健康失败的主要原因在于它是一个被宣传为人工智能的基于规则的搜索和匹配系统。它需要医学专家进行昂贵的手动整理,无法有效处理现实世界中杂乱的医疗数据,也无法跟上快速发展的医学研究。MD安德森癌症中心的合作项目在2017年被放弃前已耗资6200万美元。IBM在2022年以约10亿美元的价格将沃森健康出售给Francisco Partners,而此前已投资超过150亿美元。
FDA已批准多少AI医疗设备?
截至2026年初,FDA已批准800多款AI赋能的医疗设备,其中大多数集中在放射学和心脏病学领域。批准速度逐年加快,AI设备现已覆盖病理学、眼科、皮肤科、胃肠病学和神经病学。FDA还调整了其监管框架,允许能够学习和改进的AI系统进行更新。
AI如何应用于放射学?
Viz.ai、Aidoc和RADLogics等公司的AI系统可以在几秒钟内分析医学图像,标记潜在的癌症、中风和骨折。2024年的一项里程碑研究表明,AI辅助乳腺X光检查将假阴性率降低了20%。到2026年,AI辅助阅片已成为主要放射科诊所的标准做法,作为一个不知疲倦的第二审阅者,优先处理紧急病例并减轻医生的认知负担。
GPT-4能行医吗?
GPT-4在美国医师执照考试中取得了远超及格线的分数,展示了广泛的医学知识。然而,它在医疗健康领域最具影响力的应用是临床文档记录而非直接诊断。像微软的Nuance DAX Copilot这样的工具使用LLM技术从医生-患者对话中自动生成临床笔记,平均为每次患者就诊节省七分钟。
AI是否用于手术?
是的。直觉外科公司的达芬奇系统现在整合了实时组织识别和手术引导的AI功能。强生的Ottava和美敦力的Hugo平台都整合了AI驱动的规划。2025年的研究表明,AI辅助手术规划将手术时间缩短了15-20%并降低了并发症率。虽然完全自主手术仍需数年时间,但AI对人类外科医生的增强正在改善预后。
医疗AI的主要伦理问题是什么?
关键的伦理问题包括训练数据中的偏见(AI系统对少数族裔患者表现较差)、当AI促成误诊时未解决的责任问题、不一致的患者同意实践,以及深度学习系统的"黑箱"性质使建议难以解释。欧盟AI法案将大多数医疗AI归类为高风险,要求进行合规评估和人工监督。
【全文结束】

