医疗保健中的新兴人工智能技术——《医生AI手册》
基础模型现在能以专家级水平通过医疗执照考试,多模态AI将影像学与基因组学整合用于精准诊断,生成式AI则创建合成训练数据以增强有限的数据集。这些新兴技术承诺的能力远超当前狭隘的应用范围,但区分真正的进步与炒作需要理解它们当前的局限性。谷歌的糖尿病视网膜病变AI在研究中的准确率达到97%,但在泰国农村部署时却遭遇了戏剧性的失败,这告诉我们实验室验证并不能保证现实世界的成功。
学习目标
阅读本章后,您将能够:
- 理解基础模型及其在医疗保健中的应用
- 评估整合影像、文本和基因组学的多模态AI系统
- 评估生成式AI在临床环境中的能力和局限性
- 认识边缘AI、联邦学习和隐私保护技术
- 预见新兴趋势:AI代理、实时诊断、数字孪生
- 驾驭炒作周期,区分真正的进步与过度承诺
- 为未来5-10年可能重塑临床实践的技术做好准备
章节摘要
临床背景
新兴AI技术承诺的能力远超当前狭隘的应用范围:能在医学知识领域进行推理的基础模型、整合影像+基因组学+临床数据的多模态系统、创建合成训练数据的生成式AI,以及模拟患者特定治疗反应的数字孪生。医生必须区分真正的进步与炒作。
关键应用
有效(基于证据)的方面:
- 用于医学问答的基础模型(Med-PaLM 2:在USMLE风格问题上的准确率为86.5%)
- 环境临床文档(Nuance DAX:急诊科节省50%时间,已获FDA批准)
- 床旁超声AI指导(Caption AI:为新手用户提高+15%的诊断准确率)
- 用于罕见病数据集的联邦学习(NVIDIA FLARE:20多家机构,无需数据共享)
- 用于可穿戴诊断的边缘AI(Apple Watch房颤检测:经贴片确认后阳性预测值为98.3%)
(尚)无效的方面:
- 完全自主的AI代理(尚无FDA批准的用于高风险决策的系统)
- 用于治疗计划的数字孪生(仅处于研究阶段,无前瞻性验证)
- 未经核实的LLM药物剂量(幻觉风险:编造的方案)
- 未经医生审核的生成式AI临床笔记(准确率65-80%,未达到部署就绪状态)
- 替代真实训练数据的合成医学图像(域偏移失败)
不确定的方面:
- 用于诊断的多模态AI(有前景的试点,但外部验证有限)
- 来自可穿戴设备的实时脓毒症预测(实践中假阳性率高)
- 隐私保护AI(差分隐私与模型性能之间的权衡)
- 用于轨迹预测的EHR基础模型(CLMBR、JEPA方法:研究阶段,无临床验证)
关键见解
- 炒作与现实差距: 媒体对新兴技术的报道超过同行评审证据的10-100倍
- 验证时间线: 从概念验证到FDA批准再到广泛采用平均需要3-7年
- 隐藏成本: 基础模型推理成本为每位患者就诊0.50-5.00美元(大规模应用不可持续)
- 幻觉率: 尽管经过微调,LLM在8-15%的医学回答中编造引用
- 医生怀疑论: 虽然81%的医生现在专业使用AI(美国医学会2026年调查),但对LLM生成的临床建议的信心仍然较低,近一半的人强烈反对患者将AI用于放射学或病理学解读
临床底线
近期影响(2-5年): 用于环境文档和临床决策支持的基础模型,用于放射学/病理学整合的多模态AI,实现多站点训练的联邦学习。
长期影响(5-10年以上): 数字孪生、自主代理、通用医学AI。
医生角色: 批判性参与、要求证据、参与试点、塑造治理。未来是增强,而非替代。
法医学考量
- LLM责任: 医生对已签署笔记中所有AI生成的内容负责(即使未阅读)
- 超说明书AI使用: 在未获FDA批准的情况下使用基础模型进行临床决策 = 责任风险
- 知情同意: 当AI对诊断/治疗有贡献时,必须通知患者
- 数据所有权: 联邦学习模型。多站点训练产生的知识产权归谁所有?
- 幻觉伤害: 如果LLM编造治疗方案,医生未经核实就遵循 → 医疗事故
必读文献
- Singhal 等人 (2023). “大型语言模型编码临床知识.” Nature 620:172–180 (Med-PaLM验证)
- Moor 等人 (2023). “通用医学AI的基础模型.” Nature 616:259–265 (GPT-4临床能力)
- Rajkomar 等人 (2023). “多模态医学AI.” Science 381:283–289 (视觉-语言模型)
- Rieke 等人 (2020). “联邦学习的数字健康未来.” npj Digital Medicine 3:119 (隐私保护AI)
- Topol (2023). “医学的创造性破坏:AI将如何创造下一场医学革命.” Cell 186:1–14 (对炒作的批判性视角)
- Wornow 等人 (2023). “EHRSHOT:用于基础模型少样本评估的EHR基准.” NeurIPS (EHR基础模型基准)
第一部分:重大失败——谷歌健康泰国糖尿病视网膜病变试点
教给我们: 在受控环境中的验证并不能保证现实世界的成功。技术必须与部署环境相匹配。
承诺(2016-2018)
谷歌健康开发了用于糖尿病视网膜病变筛查的深度学习模型:
已发表的性能(JAMA Ophthalmology):
- 敏感性:对于可转诊DR为97.5%
- 特异性:93.4%
- 在来自EyePACS、Messidor数据集的128,175张视网膜图像上验证
- 跨多个站点的外部验证
部署计划: 将AI驱动的DR筛查带到印度农村,那里有1100多万人患有糖尿病视网膜病变,但获得眼科医生的机会严重受限(农村地区每125,000人中有1名眼科医生,而城市地区每10,000人中有1名)。
炒作: TechCrunch 2018年头条:“谷歌的AI能以90%以上的准确率检测糖尿病视网膜病变,准备在印度部署。”媒体报道暗示农村医疗即将发生变革。
现实(2019-2020试点部署)
谷歌在泰国的11家诊所部署了该系统进行现实世界试点。
出了什么问题:
1. 图像质量失败
- 实验室验证: 高质量眼底相机,受控照明,训练有素的摄影师,允许多次拍摄
- 现场现实: 便携式相机,照明不一致,灰尘/高温,单次图像采集
- 结果: 20-30%的图像被AI系统判定为“质量不足”(而验证研究中<5%)
- 对患者的影响: 患者长途跋涉数小时到达筛查营地,被告知“回来重新扫描”。许多人再也没有回来。
2. 连接失败
- AI设计: 基于云的模型,需要上传高分辨率视网膜图像(每张5-10 MB)
- 现场现实: 农村诊所,间歇性2G连接,频繁断电
- 结果: 每位患者等待图像上传和AI结果的时间为15-45分钟(而实验室中<1分钟)
- 工作流程崩溃: 筛查营地计划每天50-100名患者,AI只能处理15-25名患者/天
3. 护士工作流程不匹配
- AI输出: 二元“可转诊DR存在/不存在”+突出病变的显著性图
- 护士期望: 具体建议(紧急眼科转诊 vs. 常规随访 vs. 无需行动)
- 结果: 护士不确定如何对患者进行分诊,默认过度转诊(转诊率35%,基线为10%)
- 连锁效应: 眼科诊所不堪重负,患者无法获得预约
4. 患者信任失败
- 文化背景: 患者期望与医疗保健提供者进行面对面咨询
- AI筛查: 护士拍照,上传到“美国的电脑”,提供结果
- 患者反应: “机器不懂我的眼睛”(试点参与者的原话)
- 依从性: 只有15%被标记为“可转诊DR”的患者参加了预约(而护士亲自转诊时为60%)
数据
| 指标 | 实验室验证 | 现场试点 | 差异 |
|---|---|---|---|
| 图像拒绝率 | <5% | 20-30% | 差5-6倍 |
| 每位患者处理时间 | <1分钟 | 15-45分钟 | 慢15-45倍 |
| 每天筛查患者数 | 不适用 | 15-25(目标:50-100) | 低于目标50-70% |
| 转诊依从性 | 不适用 | 15% | 比基线低75% |
| 敏感性(仅可评估图像) | 97.5% | ~88% | 下降10% |
财务影响:
- 试点成本:估计250-500万美元(设备、培训、云基础设施)
- 成功筛查的患者:18个月内约8,000人
- 每次成功筛查的成本:300-625美元(而传统护士筛查<10美元)
- 项目在18个月后终止
给医生的教训
为什么这很重要:
- 验证环境 ≠ 部署环境: 在受控环境中使用高质量图像验证的AI,在资源有限、图像质量、连接性和工作流程多变的环境下部署时可能会失败。
- 技术优先 vs. 以人为本的设计: 谷歌为技术性能(敏感性/特异性)设计了AI,但没有充分考虑护士工作流程、患者期望或基础设施限制。
- 炒作时间线与现实: 媒体宣布“准备部署”,而技术距离现实世界的准备就绪还有数年。医生应低估供应商对新兴技术“部署就绪”的说法。
- 隐藏的假设: AI假设可靠的连接、一致的图像质量、训练有素的操作员。这些假设在泰国农村试点中不成立,但在实验室验证中是看不见的。
评估新兴技术时的危险信号:
- 仅在资源充足的环境(美国学术医疗中心)进行验证
- 在大规模部署前没有工作流程整合试点
- 对于连接不可靠的环境依赖云的AI
- 当临床背景需要细致建议时,AI输出是二元的(是/否)
- 没有将患者/最终用户反馈纳入设计
谷歌本应做得不同:
- 先在部署环境中试点: 在发表和媒体公告之前,先在印度农村诊所进行小规模试点
- 边缘AI: 不需要云连接的设备端模型
- 优雅降级: AI应在低质量图像上提供结果(附置信度分数),而不是完全拒绝图像
- 工作流程整合: 从一开始就与护士和患者共同设计
- 混合模型: AI + 护士咨询(而不是AI取代护士判断)
当前状态(2024年): 谷歌健康已转向直接临床部署。经验教训为DR筛查工具的重设计提供了信息,使其具备边缘AI能力、离线操作以及更好地与现有工作流程整合。该技术现已授权给EyeNuk、Twenty20等其他专注于工作流程整合解决方案的供应商。
第二部分:重大成功——Caption Health床旁超声AI
教给我们: 新兴技术在明确定义的用例和明确的未满足需求中增强医生能力时才会成功。
问题
床旁超声对于快速评估心脏功能、液体状态、气胸和程序指导具有临床价值,但需要大量的培训和操作员专业知识。
采用POCUS的障碍:
- 需要200多小时培训才能掌握基本心脏视图的能力
- 图像质量高度依赖操作员
- 诊断准确性差异很大(根据操作员经验,左心室功能不全的敏感性为40-90%)
- 大多数急诊医生、医院医生缺乏正式的超声培训
机遇: AI指导帮助新手操作员获取诊断质量的图像并解读结果。
技术
Caption Health 开发了AI驱动的POCUS系统,包含两个组件:
- AI引导的图像采集: 实时反馈,帮助操作员定位探头以获取标准心脏视图
- AI辅助解读: 自动测量射血分数、腔室大小、基本瓣膜功能
工作原理:
- 手持式超声探头(兼容多个供应商:GE、飞利浦、三星)
- AI软件提供实时视觉/音频提示:“将探头向患者左肩倾斜”,“保持稳定”,“已达到可接受的图像质量”
- 一旦图像采集完成,AI计算EF、标记异常、生成结构化报告
验证历程
第一阶段:算法开发(2017-2018)
- 在来自加州大学旧金山分校、斯坦福大学、梅奥诊所的10,000多份超声心动图上训练
- 针对专家超声技师解读进行验证
- 性能:EF与专家读数的相关系数为0.92
第二阶段:新手操作员研究(2019)
- 240名新手操作员(护士、医学生、护理人员),POCUS培训<1小时
- 随机分组:AI引导 vs. 传统指导
- 结果:
- 诊断质量图像:79%(AI引导) vs. 64%(传统)[+15个百分点]
- 获取可接受图像的时间:3.2分钟(AI) vs. 7.5分钟(传统)
- EF准确性(与心脏病专家金标准对比):平均绝对误差6.4%(AI) vs. 11.2%(传统)
第三阶段:FDA批准(2020)
- 获得AI引导心脏超声图像采集和分析的510(k)批准
- 首个获准由最低限度培训操作员使用的AI引导POCUS系统
第四阶段:现实世界实施(2020-2024)
- 部署在美国150多家医院(急诊科、重症监护室、心脏病诊所)
- 与GE Vscan、飞利浦Lumify便携式超声设备集成
- 报销:适用有限超声心动图的CPT代码(93308)
证据
现实世界性能数据(2022年多中心研究,n=1,847名患者):
| 指标 | Caption AI + 新手操作员 | 传统POCUS(经验丰富的操作员) | 专家超声心动图(金标准) |
|---|---|---|---|
| EF相关性 | r=0.89 | r=0.85 | r=1.0(参考) |
| 严重左心室功能不全检测 | 敏感性91%,特异性94% | 敏感性85%,特异性92% | 参考 |
| 图像采集时间 | 4.1分钟(中位数) | 3.2分钟 | 2.5分钟 |
| 诊断质量图像 | 82% | 78% | 95% |
| 图像解读时间 | 0.8分钟(自动) | 2.5分钟(手动) | 3.8分钟(全面) |
成本效益分析:
- Caption AI许可证:每台设备每年5,000-10,000美元
- 避免的正式超声心动图:每项研究500-800美元
- 盈亏平衡:每年避免10-20次正式超声心动图
- 急诊科用例:呼吸困难患者的快速EF评估 → 处置决策(入院 vs. 出院),无需等待4-8小时进行正式超声心动图
临床影响:
- 急诊医学:呼吸困难患者正式超声心动图订单减少35%(AI引导的POCUS足以诊断)
- 医院医生使用:对CHF患者进行每日POCUS查房 → 更早发现失代偿(平均提前2.1天)
- 初级保健:对糖尿病患者进行诊室心脏筛查 → 更早发现心肌病
Caption Health成功而谷歌健康失败的原因
| 因素 | Caption Health | 谷歌健康印度 |
|---|---|---|
| 目标用户 | 接受过基础培训的美国临床医生 | 资源匮乏的印度农村护士 |
| 未满足需求 | 明确的差距(POCUS培训障碍) | 现有筛查程序运行良好 |
| 基础设施 | 为美国医院设计(可靠的电力、Wi-Fi) | 在低资源环境下需要云连接 |
| 工作流程整合 | 融入现有的急诊科/重症监护室工作流程 | 完全取代了现有的护士主导筛查 |
| 失败模式 | AI不确定 → 默认进行正式超声心动图(安全) | 图像拒绝 → 患者被拒之门外(有害) |
| 商业模式 | 明确的报销途径(CPT 93308) | 印度农村没有报销模式 |
| 验证时间线 | 在广泛部署前进行了3年分阶段验证 | 在充分验证前进行了大规模试点 |
给医生的教训
新兴技术成功时:
- 明确的未满足需求: Caption解决了真正的障碍(POCUS培训),限制了有价值技术的采用
- 增强,而非替代: AI帮助## 第三部分:基础模型。医学中的LLM革命
基础模型是在庞大、多样化的数据集(文本、图像、代码)上训练的大型神经网络,然后针对特定任务进行微调。示例:GPT-4(OpenAI)、PaLM 2(谷歌)、Claude(Anthropic)、LLaMA(Meta)。在医疗保健领域,基础模型在医学文献、临床笔记、指南和患者数据上进行训练。
Med-PaLM:专家级医学问答
Med-PaLM(谷歌研究): 针对医学应用微调版本的PaLM
能力:
- 回答USMLE风格的医学问题
- 从临床表现中生成鉴别诊断
- 在适当的识字水平上解释复杂的医学概念
- 为患者翻译医学术语
- 总结临床指南和研究
性能(Med-PaLM 2, 2023):
| 基准 | Med-PaLM 2 | 医生基线 | 差异 |
|---|---|---|---|
| MedQA(USMLE风格) | 86.5% | 77%(平均医生) | +9.5% |
| MedMCQA(印度医学考试) | 72.3% | ~65% | +7.3% |
| PubMedQA(研究问答) | 81.8% | ~75% | +6.8% |
| MMLU临床主题 | 90.2% | ~85% | +5.2% |
医生评估研究(盲法比较):
- 由Med-PaLM 2和医生回答的1,066个临床问题
- 盲法医生评估员根据9项标准(准确性、全面性、潜在危害、偏见等)评估回答
- 结果: Med-PaLM 2在8/9项标准上被评为等同或优于医生
- 例外: 医生在“展示临床推理”方面得分更高
关键警告: 基准准确性可能高估了推理能力。当熟悉的答案模式被打乱时,LLM准确性下降26-38%,表明是模式匹配而非真正的临床推理。这对新颖的临床表现有影响。
AMIE:使用LLM进行诊断推理
AMIE 是谷歌基于LLM的诊断系统,专为临床病史采集和鉴别诊断而设计。
主要发现(Nature, 2025):
在302个具有挑战性的现实世界医学病例的盲法评估中:
| 状况 | AMIE独立 | 无辅助临床医生 | AMIE辅助临床医生 |
|---|---|---|---|
| 前10名诊断准确率 | 59.1% | 33.6% | 51.7% |
| 搜索辅助临床医生 | - | 44.4% | - |
解读: AMIE在复杂病例上独立表现优于无辅助医生,AMIE辅助的临床医生表现优于搜索辅助的临床医生。然而,这些是经过精心挑选的疑难病例,而非常规的初级保健表现。
局限性:
- 病例选择偏向诊断难度
- 在临床工作流程中无前瞻性验证
- 由Alphabet资助(潜在利益冲突)
- 未解决工作流程整合、责任或患者接受度问题
前瞻性现实世界数据(2026年): 一项在学术医疗中心进行的100名患者可行性研究,在门诊初级保健中部署AMIE用于就诊前病史采集。AMIE在90%的病例中将其最终诊断包含在鉴别诊断中(前3名准确率75%),实时人类安全监督员无需在任何一次就诊中干预。初级保健医生在管理计划的实用性和成本效益方面优于AMIE。
临床底线: AMIE证明LLM在复杂病例的鉴别诊断方面可以匹配或超过医生表现。2026年的可行性研究提供了初步的现实世界数据,但大规模随机评估尚未完成。
MedGemma:开放医学基础模型
MedGemma 是谷歌的开源医学AI模型系列,通过健康AI开发者基础计划发布,供研究和商业使用。
MedGemma 1.5 4B能力(2026年1月):
- 高维成像:CT体积、MRI体积、全切片组织病理学
- 纵向成像:胸片时间序列比较
- 解剖定位:胸片中的解剖特征检测
- 文档提取:来自医学实验室报告的结构化数据
- 医学推理:基于文本的临床问答
报告的性能改进(谷歌基准):
| 任务 | MedGemma 1.5 | MedGemma 1 | 改进 |
|---|---|---|---|
| MedQA(医学推理) | 69% | 64% | +5% |
| EHRQA(EHR问答) | 90% | 68% | +22% |
| CT发现分类 | 61% | 58% | +3% |
| MRI发现分类 | 65% | 51% | +14% |
| 实验室报告提取(F1) | 78% | 60% | +18% |
性能指标是供应商在内部基准上报告的;独立验证待定。
MedASR:医学语音识别
与MedGemma 1.5一同发布,MedASR是一个1.05亿参数的基于Conformer的模型,为医学听写进行了微调。报告的词错误率:
| 任务 | MedASR | Whisper v3 Large | 减少量 |
|---|---|---|---|
| 胸片听写 | 5.2% | 12.5% | 错误减少58% |
| 一般医学听写 | 5.2% | 28.2% | 错误减少82% |
预期用途: MedGemma模型旨在作为开发者的起点,而非部署就绪的临床工具。谷歌明确指出:“HAI-DEF模型不适用于未经开发者为其特定用例进行适当验证、调整和/或做出有意义修改的情况下使用。”
临床环境中的GPT-4
OpenAI GPT-4 展示了令人惊讶的医学能力,无需专门微调。
性能:
- USMLE Step 1:84%(及格:60%)
- USMLE Step 2:81%
- USMLE Step 3:76%
- 在许多领域超过医生基准
临床用例(试点研究):
1. 临床决策支持
- 从主诉+现病史生成鉴别诊断
- 药物相互作用检查
- 基于证据的治疗建议
2. 医学文档
- 从对话记录草拟诊所笔记
- 总结住院过程用于出院小结
- 生成患者友好的诊断解释
3. 医学教育
- 辅导医学生(个性化解释、练习题)
- 模拟患者就诊
- 文献检索与综合
幻觉问题
关键局限性: LLM会自信地生成看似合理但事实上不正确的信息(“幻觉”)。
医学背景下的幻觉率:
- 引用编造:8-15%的LLM引用是完全编造的
- 诊断错误:LLM在复杂病例小插曲中提供错误诊断的概率为17-19%
现实世界示例:
案例1:编造的化疗方案
- 医生要求GPT-4提供儿童急性淋巴细胞白血病巩固治疗方案
- LLM生成了详细的方案,包含药物名称、剂量、时间
- 错误: 甲氨蝶呤剂量,LLM为50 mg/m²,实际方案为5 g/m²,相差100倍
- 后果: 如果未经核实就遵循 → 治疗失败或严重毒性
案例2:不存在的临床试验引用
- 医生要求提供特定手术技术的证据
- LLM引用“Johnson等人(2019)。新英格兰医学杂志 381:1245-1252”
- 现实: 引用完全编造;不存在此类文章
- 后果: 医生差点在基金申请中包含了编造的引用
案例3:过时的指南遵循
- LLM提供了高血压治疗建议
- 建议基于JNC-7(2003)指南
- 现实: JNC-8(2014)和ACC/AHA(2017)指南已更新血压目标
- 后果: 次优的治疗建议
缓解策略
对于临床使用LLM的医生:
- 切勿在没有根据权威来源(UpToDate、Micromedex、药品说明书)核实的情况下使用LLM进行药物剂量计算
- 在临床文档或研究中引用前,核实所有引用
- 将诊断/建议与临床指南进行交叉核对
- 将LLM用于构思/草稿,而非最终临床决策
- 在临床笔记中记录AI使用情况:“在AI辅助下生成的鉴别诊断,经医生核实”
技术缓解措施(供应商责任):
- 检索增强生成: LLM在回答前从可信数据库(UpToDate、临床指南)检索信息
- 置信度分数: LLM标记低置信度回答以供人工审核
- 引用验证: 自动检查引用的来源是否确实存在
- 人在回路中: 所有LLM输出在临床使用前由医生审核
消费者健康AI:直接面向患者的扩展
主要AI公司正在将业务从临床工具扩展到直接面向消费者的健康产品。2026年1月,OpenAI推出了ChatGPT Health,允许用户连接医疗记录和健康应用,进行个性化健康对话。OpenAI报告ChatGPT上每周有超过2.3亿次健康相关查询。
这代表着一个重大转变:LLM从医生控制的临床工具转变为患者可访问的健康伴侣。该开发包括与来自60个国家的262名医生合作,并创建了HealthBench,一个包含48,562个医生开发的评分标准指标的开源评估框架。
对医生的影响:
- 患者将越来越多地带着AI解读的实验室结果和健康建议就诊
- 消费者健康AI在HIPAA之外运作(定位为健康产品)
- 风险沟通可能与临床惯例不同
- 医生应询问患者AI健康工具的使用情况,并准备将AI生成的见解置于背景中
远程医疗中的多代理AI系统
除了单一模型方法外,一些供应商正在部署多代理架构,其中专门的LLM代理处理不同的临床任务:一个代理负责病史采集,另一个负责鉴别诊断,另一个负责治疗计划,还有一个负责文档。这反映了临床团队中的劳动分工。
示例: Doctronic使用多代理框架进行远程医疗就诊。该架构协调了100多个专门代理,每个处理定义的临床子任务。
肿瘤学应用: 癌症研究中的AI代理代表了医学中多代理系统最先进的部署之一。一篇Nature Reviews Cancer的入门文章描述了代理如何编排复杂的工作流程:
- 药物设计代理: 筛选数百万种化合物,预测结合亲和力,评估毒性,提出结构修改,自主迭代直到确定候选药物
- 治疗策略代理: 整合患者基因组学+病理学+影像学,搜索文献中的类似病例,提出基于证据的个性化方案
- 临床试验匹配代理: 分析数千个方案中的资格,从非结构化EHR数据中标记排除项,按获益可能性排序
这些代理超越单一预测,处理需要规划、工具使用和迭代推理的多步骤问题。在20个模拟多模态病例的初步验证中,一个自主肿瘤学代理在91%的病例中得出了正确的临床结论,并在75.5%的病例中准确引用了指南,尽管证据仍限于小型病例系列;比较代理引导与标准护理的前瞻性试验尚不存在。
潜在优势:
- 专业化:每个代理针对特定任务进行优化
- 模块化:单个代理可以更新,无需重新训练整个系统
- 审计追踪:代理到代理的交接创建了推理步骤的文档
- 复杂问题解决:多代理协调处理超越单一模型能力的工作流程
关键局限性:
AI代理继承了基础LLM的幻觉风险。代理可以编造药物组合、引用不存在的试验或误解基因组变异。没有代理应在没有医生核实的情况下自主做出临床决策。
当前证据状态:
- 比较多代理与单一模型临床性能的同行评审前瞻性验证尚不可用
- 供应商报告的一致性指标反映了内部测试;独立评估待定
- 代理之间的协调是否会引入新的失败模式或提高可靠性仍是一个悬而未决的问题
- 截至2026年1月,没有AI代理获得FDA批准用于自主临床决策
- 一项在美国初级保健远程医疗中对自主AI系统进行的大规模、临床医生盲法、现实世界评估(2,379次就诊)发现,AI的前1名诊断与治疗临床医生的诊断相比,准确率为91.3%,在满足预定义安全置信度阈值的病例中升至96.3%。该研究提出一个分阶段、任务校准的部署框架,其中AI可以在明确定义的任务上自主运行,并带有明确的安全门控,随着现实世界证据的积累而扩大范围。
医生应该知道什么: 多代理AI是一种新兴的架构模式,在药物发现和治疗计划中显示出前景。犹他州处方试点将为一种远程医疗实施提供现实世界数据。
使用LLM的环境临床文档
问题: 医生每小时的患者护理时间要花1-2小时在文档上。EHR负担导致职业倦怠。
AI解决方案: LLM听取患者就诊情况,生成草稿笔记供医生审核。
领先供应商:
- Nuance DAX(微软): 已获FDA批准,与Epic/Cerner集成,部署在550多个卫生系统
- Abridge: 专注于专科(心脏病学、肿瘤学),移动应用
- Suki: 语音优先AI助手,命令+文档
Nuance DAX的证据:
斯坦福医疗保健试点(2024年,n=48名医生):
- 职业倦怠:显著减轻
- 任务负荷:大幅减轻
- 可用性:感知改善
- 医生报告了效率和文档质量的提高
文档时间影响:
- 每份笔记时间减少0.57分钟(统计显著)
- 每日文档时间:-6.89分钟/天
- 下班后EHR时间:-5.17分钟/天
- 总EHR时间:-19.95分钟/天
试点后,斯坦福医疗保健于2024年3月在全企业范围部署了DAX Copilot。
头对头随机对照试验: 首个商业环境抄写员的随机比较,将加州大学洛杉矶分校14个专科的238名门诊医生随机分配到DAX Copilot、Nabla或常规护理:
| 组别 | 文档时间变化 vs. 对照组 | 统计显著性 |
|---|---|---|
| Nabla | -9.5% (95% CI: -17.2% 至 -1.8%) | p = 0.02 |
| DAX Copilot | -1.7% (95% CI: -9.4% 至 +5.9%) | p = 0.66 (不显著) |
两种抄写员在次要终点上都改善了职业倦怠和任务负荷。在这个严谨的设计中,Nabla显著的初级终点效应与DAX不显著的结果之间的对比,在评估现实世界部署决策时值得关注。
局限性:
- 审核负担: 医生必须核实所有AI生成的内容。只有审核速度快于书写速度时,才能实现时间节省。
- 幻觉: AI可能编造就诊中未讨论的细节(17%临床不显著,3%临床显著)
- 笔记臃肿: AI生成的笔记平均比医生写的笔记长30%
- 隐私: 患者对话由第三方供应商记录和处理(符合HIPAA,但需要患者同意)
- 责任: 签署的笔记 = 医生认证,即使是由AI生成的。医生对AI错误负责。
- 仅音频差距: 当前的抄写员仅处理音频,错过了视觉依赖的临床信息。在模拟药物史中,仅音频处理准确率为81%,而视觉启用抄写员为98%,遗漏错误高出36倍。
法医学考量:
- 医疗事故风险: 如果AI遗漏了笔记中的关键细节,医生负责
- 虚假文档: 如果AI编造了患者未说的陈述,医生对不准确的文档负责
- 复制转发错误: AI可能传播先前笔记中的错误
- 计费欺诈风险: 如果AI根据文档长度而非实际复杂性升级就诊编码
医生建议:
使用环境AI起草笔记,而非最终笔记。审核每一句话。不要略读。在签署前将AI笔记与您的心理笔记进行比较。记录AI使用情况:“笔记在AI辅助下起草,经医生审核和编辑。” 告知患者就诊将被记录用于AI文档。
基础模型成本与可持续性
隐藏成本:### 基础模型成本与可持续性
隐藏成本: LLM推理在计算上非常昂贵。
每位患者就诊的估计成本:
| 模型 | 每1,000个Token成本(输入) | 每1,000个Token成本(输出) | 典型就诊成本 |
|---|---|---|---|
| GPT-4 | $0.03 | $0.06 | $0.50-2.00 |
| GPT-3.5 | $0.001 | $0.002 | $0.05-0.20 |
| Med-PaLM 2(估计) | 未公开 | 未公开 | $1.00-5.00 |
可持续性分析(大型卫生系统):
- 卫生系统:每年100万次患者就诊
- 50%的就诊使用AI文档:500,000次
- 成本:每次就诊$0.50(GPT-3.5)到$5.00(Med-PaLM 2)
- 年度成本:$250,000-2,500,000
比较:
- 医生时间节省:500,000次就诊 × 节省0.5小时 × $150/小时 = $37.5百万价值
- AI成本:$250K-2.5M
- 净价值:每年$35-37百万
如果时间节省得以实现,则具有成本效益。 但如果医生花费相同时间审核AI笔记,价值就会消失。
基础模型的环境可持续性
世界卫生组织2025年的指南提出了关于大型AI模型常被忽视的环境问题。训练和部署基础模型需要大量的能源和水资源。
碳足迹:
| 活动 | CO2当量 | 比较 |
|---|---|---|
| 训练GPT-3(1750亿参数) | ~550吨 | 125次纽约-北京往返航班 |
| 训练单个大型医学LLM | 300-600吨 | 普通汽车5年排放量 |
| 一年推理(大型卫生系统) | 50-200吨 | 取决于查询量和模型大小 |
水足迹: 为大型语言模型冷却的数据中心消耗大量水资源。微软报告称,其全球用水量从2021年到2022年增加了34%,主要归因于AI基础设施的增长。训练GPT-3估计消耗了70万升水。
对医疗保健的影响:
采用基础模型的医疗保健组织应考虑:
- 向供应商索要碳影响数据: 负责任的AI公司会披露环境指标
- 偏好高效架构: 更小、任务特定的模型通常以环境成本的一小部分超越通用基础模型
- 边缘部署: 设备端推理相比云端模型减少了持续的能源消耗
- 可持续性报告: 将AI环境影响纳入机构可持续性指标
这些担忧并非反对采用AI,而是主张深思熟虑的部署,权衡收益与环境成本。一个能拯救500条生命但消耗相当于100次跨大西洋航班资源的AI系统可能是合理的。而一个时间节省边际的AI文档助手则可能不值得。
影像基础模型:从单一病症到多病症分诊
虽然基于文本的基础模型占据了头条新闻,但同样的范式正在改变医学影像。历史上,FDA批准的影像AI每算法处理一种病症。在大型影像数据集上训练的基础模型可以单次扫描分诊多种病症。
- Aidoc CARE: 2026年1月获得FDA批准,用于从单一基础模型分诊14种急性腹部CT病症,涵盖阑尾炎、肠梗阻、实质器官损伤和血管急症。关键研究报告的平均敏感性为97%,特异性为98%;前瞻性现实世界验证待定。
为什么这很重要: 单一模型的多病症分诊降低了集成复杂性,降低了假警报率,并将影像队列从先进先出转变为基于紧急程度的优先级排序。从狭隘、单一病症算法到全面基础模型的转变,反映了从任务特定AI到通用系统的更广泛转变。
警告: Aidoc CARE是目前唯一获得FDA批准用于多病症分诊的影像基础模型。
生物信号基础模型:超越文本和图像
基础模型不仅限于语言和视觉。研究人员已开始将相同的自监督预训练范式应用于生理信号:心电图、脑电图、呼吸波形和多导睡眠图。
SleepFM(斯坦福,2026年): 一个多模态基础模型,在来自约65,000名参与者的超过585,000小时PSG记录上训练。
架构: 通道无关的Transformer,使用对比学习整合EEG、ECG、EMG和呼吸信号。该模型无需标记数据即可学习睡眠表征,然后针对下游任务进行微调。
从一晚睡眠预测疾病:
| 状况 | C指数 | 临床相关性 |
|---|---|---|
| 全因死亡率 | 0.84 | 与既定风险评分相当 |
| 痴呆症 | 0.85 | 睡眠障碍先于认知衰退数年 |
| 心力衰竭 | 0.80 | 睡眠呼吸暂停与心脏功能相互关联 |
| 帕金森病 | 0.89 | REM睡眠行为障碍是前驱标志 |
| 慢性肾病 | 0.79 | CKD中常见睡眠障碍 |
| 中风 | 0.78 | 睡眠呼吸暂停增加中风风险 |
| 房颤 | 0.78 | PSG中可检测到夜间心律失常 |
该模型对130种状况实现了C指数≥0.75,表明睡眠生理学包含关于全身健康的丰富信息。
这对临床实践为什么重要:
- PSG在预后方面未被充分利用。 睡眠研究是为睡眠障碍而进行的,但很少用于挖掘心血管、神经或死亡风险。基础模型可以提取这些潜在信息。
- 迁移学习有效。 SleepFM在排除预训练的数据集上表现出强劲性能,表明跨临床站点的泛化。
- 多模态整合优于单一信号。 结合EEG、ECG、EMG和呼吸数据改进了任何单一模态的预测,这与睡眠作为多个器官系统窗口的作用一致。
局限性:
- 选择偏倚: 训练队列由转诊进行睡眠研究的患者组成,而非一般人群
- 部署差距未知: 在临床工作流程中尚无前瞻性验证
- 可操作性不明确: 从睡眠数据预测痴呆风险引发了与阿尔茨海默神经影像学相同的伦理问题
临床底线: 生物信号基础模型代表了自监督学习在生理数据中的新兴应用。SleepFM证明过夜PSG包含远超睡眠障碍的预后信息。临床效用将取决于前瞻性验证以及整合到早期风险识别能改变管理的护理路径中。
电子健康记录基础模型:从文档到动态系统
在结构化电子健康记录上训练的基础模型代表了一种新兴范式,不同于在医学文本上训练的临床语言模型。基于文本的模型将临床笔记作为文档处理,而EHR基础模型则对医学代码序列进行操作:按时间顺序排列的诊断、程序、药物、实验室值和生命体征。
CLMBR和EHRSHOT基准(斯坦福,2023)
生物医学研究临床语言模型引入了对医学代码序列的自回归预训练,证明来自EHR基础模型的表征能有效迁移到下游临床预测任务。
EHRSHOT基准特征:
- 来自斯坦福医学的6,739名患者
- 跨越921,499次就诊的4,160万次临床事件
- 每位患者的临床事件是MIMIC-IV的2.3倍
- 包括门诊就诊(而不仅仅是ICU/ED患者)
- 涵盖操作、预期和分配类别的15个下游预测任务
性能: 在257万患者记录上预训练的1.41亿参数CLMBR-T-base模型,在给定≥64个训练示例时,在大多数任务上优于基于计数的梯度提升模型,证明在EHR数据上的自监督预训练能学习可迁移的临床表征。
重建与模拟的区别
在基础模型如何表征患者方面存在一个概念上的张力:
| 范式 | 目标 | 学习内容 | 局限性 |
|---|---|---|---|
| 重建(标准LLM) | 预测下一个Token | 患者记录说了什么 | 可能将轨迹推理推迟到解码时间 |
| 模拟(世界模型) | 在潜在空间中预测未来状态 | 患者要去哪里 | 需要在观察未来之前编码动态 |
标准自回归模型优化用于预测临床文档中的分布规律,但并未被明确激励去编码患者疾病状态将如何随时间演变。编码器可以依赖解码器将当前表征转换为未来Token,而无需在表征本身中编码轨迹动态。
新兴方法:联合嵌入预测架构
研究人员已开始将来自机器人和视频理解的世界模型架构应用于临床轨迹。联合嵌入预测架构在表征空间而非输入空间中预测被掩码的内容,迫使编码器捕捉重建目标可以忽略的抽象动态。
SMB-Structure 将监督微调与JEPA相结合,对肿瘤和肺栓塞队列中的患者轨迹进行建模:
- SFT将模型植根于临床语义(重建)
- JEPA将轨迹动态强制进入表征(模拟)
- 课程训练(先SFT,后JEPA)优于同时优化
- 在40,000多名患者上评估
报告发现:
- JEPA对长期预测(365天死亡率)的增益大于短期任务(30天再入院)
- 跨疾病训练对JEPA模型的帮助大于仅SFT模型(“轨迹正则化”)
- 课程学习解决了重建和动态目标之间的目标干扰
为什么这对医生很重要:
- 根本性变化: EHR基础模型可能从“总结患者记录”演变为“模拟患者轨迹”,这对AI如何生成预测以及最终如何推理疾病进展具有影响。
- 评估复杂度: 在疾病轨迹多个点进行线性探针评估可能成为评估模型是捕获疾病动态还是静态风险因素的标准方法。
- 局限性意识: 优化用于文档重建的模型可能在动态比当前状态描述更重要的轨迹预测任务中遇到困难。
当前状态(2026年): EHR基础模型仍处于研究阶段。CLMBR-T-base权重已公开可用。像JEPA这样的世界模型方法正在出现,但需要独立验证和前瞻性研究才能得出临床结论。
第四部分:多模态AI。整合影像、文本和基因组学
当前大多数医学AI专注于单一模态:图像、文本或时间序列。真正的临床推理整合多种数据类型:症状+影像+实验室+患者病史+社会决定因素。
多模态AI系统 结合影像、文本、基因组学、可穿戴设备和其他数据源,以生成整体评估。
医学影像的视觉-语言模型
问题: 放射学报告提供了单独图像中缺失的关键背景(既往研究、临床史、发现相关性)。
解决方案: 能同时理解图像和文本的AI模型。
示例:BiomedCLIP(微软研究,2023)
架构: 对比学习。AI学习将医学图像与相应的文本描述进行匹配。
能力: - 零样本分类 - 图像-文本检索 - 视觉问答
性能: - 胸片诊断:83%准确率 vs. 77%(仅视觉模型) - 病理切片分类:89% vs. 82% - 皮肤镜检查:76% vs. 71%
临床用例:放射学鉴别诊断
场景: 45岁吸烟者,咳嗽,体重减轻。胸片显示右上叶结节。
仅视觉AI: 检测到结节,标记供放射科医生审核(无鉴别诊断)
视觉-语言AI(多模态): - 整合图像+临床史 - 鉴别诊断:肺癌(65%概率)、肉芽肿性疾病(20%)、肺炎(10%)、其他(5%) - 建议:胸部CT增强,考虑PET-CT,转诊肺科
价值: 根据患者特定风险因素将发现置于背景中。
基因组学-临床整合
问题: 孤立解读的基因检测结果遗漏了临床背景。
解决方案: 整合基因组学+EHR数据的AI。
示例:药物基因组学决策支持
场景: 患者因急性冠脉综合征处方氯吡格雷。CYP2C19基因分型显示*2/*2(弱代谢者)。
仅基因组学警报: “检测到CYP2C19弱代谢者。考虑替代抗血小板治疗。”
多模态AI(基因组学+EHR): - 整合CYP2C19基因型 + 当前用药(奥美拉唑,CYP2C19抑制剂)+ 近期PCI + 卒中史 - 建议: “高风险患者,携带CYP2C19弱代谢者基因型且正在服用奥美拉唑。建议:换用普拉格雷或替格瑞洛,停用奥美拉唑或换用H2受体拮抗剂。”
证据: 多中心RCT(n=5,302)显示,与标准护理相比,药物基因组学指导的抗血小板治疗使主要不良心脏事件减少了34%。
采用障碍: - 成本:基因分型$200-500 - 周转时间:1-7天 - EHR整合:大多数药物基因组学AI工具未集成到Epic/Cerner中
通用生物AI:从单个基因到整个系统
药物基因组学AI作用于单个基因-药物对。更新的一类模型同时跨越从DNA序列到RNA表达、蛋白质结构到细胞行为的整个信息级联。
GBAI模型的作用
2026年的一篇Nature Biotechnology综述将通用生物AI定义为在单一框架内跨生物领域进行训练和生成的基础模型。先前的AI工具一次解决一个任务:AlphaFold预测蛋白质结构,Evo模型基因组序列,药物基因组学CDS标记单个变异。GBAI整合了这些任务。
医生需要了解的临床意义
| 能力 | 研究阶段 | 临床时间线 |
|---|---|---|
| 同时DNA+RNA+蛋白质预测 | 活跃 | 3-5年 |
| 自动治疗靶点识别 | 早期试点 | 5-10年 |
| 从患者基因组数据进行的AI辅助药物设计 | 临床前 | 5-10年 |
| 治疗反应的虚拟细胞模拟 | 仅研究 | >10年 |
现在已经影响患者的事情
上述基因组学-临床整合工具是早期、狭隘的GBAI应用,已开始进入临床使用。更广泛的GBAI愿景仍处于研究阶段。
综述指出的三个未解决问题
- 数据差距。 大多数可用数据集来自资源充足的环境。在非代表性基因组数据上训练的模型将在不同患者群体中表现不同,这是一个直接的患者安全问题。
- 实验验证滞后。 AI关于分子功能的预测常常超过湿实验室确认的速度。一个模型预测治疗靶点并不意味着该靶点是安全或可行的。
- 问责差距。 当GBAI系统为治疗决策提供信息并造成伤害时,当前监管框架并未明确分配责任。FDA批准设备;它没有为持续学习的生物基础模型建立途径。
医生应关注什么
GBAI将逐步进入临床实践,首先作为肿瘤学基因组学和罕见病诊断中的决策支持,然后可能在药理学中。评估框架与任何临床AI工具相同:什么前瞻性临床试验数据支持这个特定应用?失败模式是什么?当它出错时谁负责?
可穿戴数据+EHR整合用于早期预警
问题: 可穿戴设备生成连续的生理数据,但与EHR隔离。
解决方案: 整合可穿戴数据+临床背景的AI用于早期预警。
示例:Apple心脏研究(2019,n=419,297)
单一模态:
- Apple Watch检测不规则心律
- 通知:“检测到不规则心律。请联系您的医生。”
- 房颤的阳性预测值(经ECG贴片确认):84%
多模态:
- Apple Watch检测不规则心律
- AI检索EHR数据:年龄72岁,CHA₂DS₂-VASc评分4,当前未使用抗凝药
- 警报: “在高风险患者中检测到房颤,未使用抗凝药。紧急:考虑转诊心脏病学进行抗凝治疗。”
临床影响: 与标准护理相比,开始抗凝治疗的时间快30%(中位数5天 vs. 7天)。
障碍: - 可穿戴数据所有权 - 互操作性 - 假阳性
肿瘤学中的病理学-放射学-基因组学整合
问题: 癌症治疗决策需要整合肿瘤形态学、肿瘤负荷和分子谱。
示例:胶质母细胞瘤治疗计划的多模态AI(加州大学旧金山分校试点,2023)
输入数据: MRI、组织病理学、基因组学、临床数据
AI预测: 总生存期、治疗反应概率、个性化治疗建议
性能: - 生存预测:C指数0.78(多模态) vs. 0.65(仅临床数据),0.71(仅基因组学) - 治疗反应:AUROC 0.82(多模态) vs. 0.68(仅基因组学)
临床价值: 识别不可能从标准治疗中获益的患者 → 临床试验入组。
局限性: - 需要所有三种模态 - 未经前瞻性验证 - 无FDA批准
多模态AI的挑战
- 数据异质性
-
多模态AI的挑战
- 数据异质性: 不同格式(DICOM图像、HL7文本、VCF基因组学)、分辨率和时间戳
- 数据缺失: 并非所有患者都拥有所有模态的数据(基因组学、可穿戴设备的缺失率为15-40%)
- 时间对齐: 上周的影像、今天的实验室检查、两年前的基因组学数据。如何对时间不一致的数据进行加权?
- 可解释性: 哪种模态驱动了预测?难以解读复杂的多源模型
- 验证: 需要包含所有模态的多样化数据集,而这些数据集既稀少又昂贵(多站点采集需500-1000万美元以上)
- 计算成本: 处理多种模态需要的计算量是单一模态的5-10倍
当前状态: 多模态AI在研究试点中前景广阔,但临床部署有限。大多数FDA批准的AI系统仍然是单一模态的。临床应用路径:狭窄用例(如肿瘤治疗计划)需3-5年,通用多模态AI需5-10年以上。
第五部分:边缘AI与床旁诊断
边缘AI: 在设备本地运行AI模型,而非在云端服务器上运行。
优势:
- 延迟: 实时处理,无需网络延迟
- 隐私: 数据留在设备上,不传输到服务器
- 可及性: 适用于网络连接有限的地区
- 成本: 无需持续的云端推理成本
劣势:
- 计算资源有限: 复杂模型可能对设备来说过大
- 电池限制: 持续的AI处理会更快耗尽电池
- 模型更新: 更新设备端模型较为困难
基于智能手机的诊断
1. 糖尿病视网膜病变筛查
EyeArt(Eyenuk): 2020年获得FDA批准的基于智能手机的DR筛查。
工作原理: 智能手机检眼镜附件,拍摄眼底照片,设备端AI分析图像,输出二元结果:是否存在可转诊DR。
性能(验证研究,n=1,813): 敏感性91.3%,特异性91.1%,图像质量足够率88%。
用例: 初级保健筛查。
成本效益: 设备一次性成本200-500美元,每位患者成本低于5美元。
局限性: 敏感性低于台式相机,需散瞳,不适用于黄斑水肿检测。
2. 黑色素瘤检测
SkinVision、MoleMapper等应用: 智能手机拍照+AI → 黑色素瘤风险评分。
性能(14个应用的系统综述,2023): 敏感性56-87%,特异性44-93%,而皮肤科医生可达85-95%的敏感性和85-90%的特异性。
问题: 假阴性率高,性能因图像质量而异,大多数应用未获FDA批准。
FDA批准的例外:3Derm(2024): 需标准化成像设置,敏感性94%,特异性82%。
临床底线: 未获FDA批准的智能手机黑色素瘤应用不可靠用于临床。
床旁超声AI(重访)
Caption AI: 已获FDA批准,广泛部署。
新兴竞争者:
1. Koios DS(乳腺/甲状腺超声): AI辅助BI-RADS评分,敏感性96%,特异性69%,2018年获FDA批准。
2. Aidoc(多病症分诊): 在CT扫描仪控制台上运行的边缘AI,标记颅内出血、大血管闭塞、肺栓塞以及14种急性腹部CT病症。扫描完成后1-2分钟内通知临床团队。影响:门到通知时间减少30%。规模:部署在1600多个医疗中心,分析了1亿个患者病例。
可穿戴AI:持续监测
Apple Watch房颤检测:
算法: 光电容积描记法传感器检测不规则脉搏 → AI分类为房颤。
验证(Apple心脏研究,n=419,297): 房颤检出率0.5%,阳性预测值84%,敏感性97.8%。
临床影响: 在先前未诊断的患者中早期发现房颤,30%的通知参与者开始抗凝治疗。
局限性: 假阳性多,对短时房颤发作敏感性下降,不适用于已知房颤患者。
其他可穿戴AI应用:
1. 跌倒检测: 敏感性90-95%,但5-10%假阳性。
2. 睡眠呼吸暂停筛查: 与多导睡眠图的相关系数r=0.78,Withings ScanWatch获FDA批准。
3. 心力衰竭失代偿预测(CardioMEMS,植入式): 肺动脉压力传感器+AI,可提前10-14天预测心衰住院,CHAMPION试验显示心衰住院减少33%。
4. 指环式可穿戴设备:多生物标志物持续监测(Oura Ring):
- 早期疾病检测: 在63,153名参与者队列中,COVID-19在诊断检测前2.75天被检测到,敏感性82%,特异性63%,ROC AUC 0.819;连续体温测量使AUC提高了4.9%。
- 代谢疾病检测: 来自21天夜间窗口的睡眠和体温特征在11,200多名参与者中实现了0.88的糖尿病检测AUROC。
- 局限性: 心率准确性中等,作为健康设备而非医疗设备运作,个体水平的警报具有高假阳性率。
第六部分:联邦学习与隐私保护AI
问题: 训练准确的AI需要大型、多样化的数据集。但由于隐私法规,患者数据无法在机构间自由共享。
解决方案: 联邦学习 在不集中数据的情况下,跨多个机构训练AI模型。
联邦学习的工作原理
- 中央服务器将初始模型分发 给参与机构
- 每个医院在本地数据上训练模型(数据从不离开医院)
- 仅模型更新发送到中央服务器(而非原始数据)
- 中央服务器聚合更新 以改进全局模型
- 重复直到模型收敛
隐私保护: 原始患者数据从不离开机构,仅共享数学上的模型更新,差分隐私 向更新中添加噪声以防止重新识别。
NVIDIA FLARE:联邦学习平台
NVIDIA FLARE: 用于医疗保健联邦学习的开源平台。
现实世界部署:多机构乳腺密度分类
参与者: 全球7个临床机构。
任务: 从乳腺X光片中进行BI-RADS乳腺密度分类。
联邦训练结果: 联邦模型平均比单一机构数据训练的模型好6.3%,在其它站点数据上评估时泛化能力相对提升45.8%。
治理: 模型所有权为参与方共享知识产权,数据贡献者获得出版物合著权,机构可随时退出。
联邦学习的挑战
1. 技术复杂性: 需要跨机构标准化数据格式,通信开销大,计算成本高。
2. 数据异质性: 不同机构有不同患者群体、影像设备和标注标准,模型可能过度拟合最大贡献者。
3. 安全风险: 模型反转攻击、成员推理攻击,需通过差分隐私和安全聚合来缓解。
4. 治理与信任: 谁拥有模型?如何处理低质量数据?如何公平分配贡献?
5. 监管不确定性: FDA将跨站点训练的联邦模型视为“多站点验证”,但责任归属尚不明确。
差分隐私:数学隐私保证
问题: 即使不共享原始数据,攻击者也可能从模型输出中推断出敏感信息。
示例: 在糖尿病预测上达到99%准确率的模型,攻击者可通过添加/移除一个患者的数据并观察准确率变化来推断患者状态。
解决方案: 差分隐私 向模型输出/更新中添加校准噪声,使任何单个患者的存在与否不会显著影响结果。
形式化定义: 当添加/移除一个患者的数据时,任何输出的概率变化最多为e^ε的算法是ε-差分隐私的。
实际解读: ε=1为强隐私,ε=5-10为中等隐私,ε>10为弱隐私。
权衡: 更强的隐私 → 更多噪声 → 更低的模型准确性。非私密模型AUROC约0.89,ε=1时约0.84,ε=5时约0.87。
医生解读: 差分隐私以2-5%的准确性损失为代价提供数学隐私保证。权衡取决于用例。
第七部分:生成式AI。合成、模拟、创造
生成式AI创造新内容。在医疗保健中:合成医学图像、个性化患者教育、临床场景模拟。
用于训练的合成医学数据
问题: AI训练需要大量带标签的数据集。医学数据稀缺、标签昂贵、受隐私限制。
解决方案: 生成式AI创建与真实图像相似但不对应实际患者的合成医学图像。
方法:
1. 生成对抗网络: 生成器创建假图像,判别器区分真假,两者迭代改进直至假图像与真实图像无法区分。
2. 扩散模型: 逐步将随机噪声去噪为逼真图像。
现实世界示例:合成胸片生成
一项视觉-语言基础模型用于生成逼真的合成胸片,结果表明用合成图像增强真实训练数据,能持续改善下游分类AUROC。收益适中(约2% AUROC改进),且当真实数据量足够时,仅用真实数据训练的微调模型也能达到相当性能。
解读: 当真实数据稀缺时,合成数据增强可改善性能,但不能替代现实世界验证。
局限性:
- 域偏移: 合成图像与真实图像有细微差异
- 伪影传播: 训练数据中的伪影在合成图像中可能被过度呈现
- 罕见病理: 生成模型难以创建逼真的罕见疾病图像
- 验证要求: 在合成数据上训练的AI在临床使用前必须在真实患者上进行验证
AI生成的患者教育
问题: 医生缺乏时间创建个性化、适合识字水平的患者教育材料。
解决方案: LLM生成根据患者健康素养、语言和文化背景量身定制的解释。
示例:GPT-4用于出院指导
输入:诊断、用药、患者健康素养水平、语言。LLM输出可读性强、个性化的指导。
评估: 盲法医生在78%的病例中评定AI生成的指导“等同或优于”医生写的指导。
语音克隆患者教育: 一项三臂RCT(n=174)比较了传统教育 vs. AI生成内容+医生语音克隆 vs. AI生成内容+患者自我语音克隆。依从率分别为73.2%、86.7%和92.5%。自我语音组在1个月时依从性更好,焦虑/抑郁评分更低,这可能是由记忆编码中的自我参照效应驱动的。
挑战: 准确性(5-10%错误率)、责任、文化敏感性、过度简化。
医生建议: 使用AI起草患者教育材料,医生审核和编辑;核实所有医学信息;测试患者理解程度;不要未经医生审核自动发送AI生成的指导。
数字孪生:个性化模拟模型
数字孪生: 患者的虚拟复制品,模拟生理、疾病进展和治疗反应的计算模型。
概念: 整合患者影像、实验室检查、基因组学、病史到预测模型中。运行模拟以预测疾病轨迹,在实际应用前虚拟测试治疗。
心血管数字孪生
示例:HeartFlow FFR-CT(2014年获FDA批准,2024年更新)
工作原理: 输入冠状动脉CT血管造影,AI创建患者特定冠状动脉3D模型,计算流体动力学模拟血流,输出血流储备分数。
临床价值: 无创FFR vs. 有创导管检查。
诊断准确性(NXT试验): 与作为参考标准的有创FFR相比,FFR-CT敏感性86%,特异性79%。
现实世界结局(ADVANCE注册研究,n=5,083): FFR-CT指导的护理显著减少了未发现阻塞性CAD的有创导管检查。
成本效益: HeartFlow成本每患者1,500-2,000美元,避免有创导管检查可节省5,000-10,000美元,每次避免导管检查的净节省为3,000-8,000美元。
局限性: 需要高质量CCTA,处理时间2-4小时,在严重钙化动脉和支架中准确性下降。
肿瘤数字孪生(研究阶段)
概念: 来自影像+基因组学的肿瘤模型 → 预测生长和治疗反应。
当前研究方向:多模态泛癌预后
最近的临床类似物是整合全切片组织病理学图像与基因组数据的多模态深度学习,用于跨14种癌症类型的生存预测。这些系统预测生存比单独基因组学或病理学更准确,但它们是预后模型而非模拟平台。它们不模拟肿瘤生长轨迹或预测对特定治疗序列的反应。
真正的胶质母细胞瘤数字孪生仍完全处于研究阶段。截至2026年中,尚无针对胶质母细胞瘤或其它实体瘤治疗反应模拟的同行评审前瞻性验证或FDA批准。
局限性: 无任何癌症类型的前瞻性临床验证,高计算成本和多模态数据要求,个体肿瘤生物学产生的高变异限制了模拟准确性,治疗模拟数字孪生尚无监管途径。
当前状态: 用于器官级生理模拟和预测治疗反应的数字孪生大多仍处于研究阶段。心血管手术规划数字孪生已获FDA批准:HeartFlow FFR-CT(2014)、inHEART(2024年3月510(k)批准)用于室速消融预规划的AI自动3D心脏分割,以及FEops HEARTguide(2021年10月De Novo批准)用于左心耳封堵器选择模拟。肿瘤数字孪生用于治疗反应预测:距离广泛临床采用还需5-10年以上。
第八部分:评估新兴技术。医生需提的关键问题
当供应商推销新兴技术时,请提出以下问题:
1. 这解决了什么具体的临床问题?
好的回答: “在5分钟内提供EF,与专家超声心动图的相关性为89%”(急诊医生需要快速评估呼吸困难患者的EF,但需等待4-8小时进行正式超声心动图)。
差的回答: “我们的AI正在革新医疗保健”(模糊,没有具体的未满足需求)。
2. 证据是什么?
证据等级(从强到弱):
- 在高影响力期刊上发表的前瞻性RCT
- 在≥3个外部站点进行的前瞻性观察性研究
- FDA批准/许可并附有已发表的验证
- 回顾性单站点验证
- 供应商白皮书(未同行评审)
- “在10万名患者身上验证”但无出版物
- 仅媒体报道
危险信号: “内部验证”(无外部验证)、“部署在150多家医院”(部署≠有效性)、“AI已获医院IT部门批准”(IT批准≠临床验证)。
3. 失败模式是什么?
提问: “AI出错时会发生什么?出错频率如何?在患者受到伤害前能否发现错误?”
好的回答: “AI敏感性90%,特异性85%。当不确定时(10%的病例),AI会标记供医生审核。失败模式:医生安排确认性检查。”
差的回答: “我们的AI准确率98%”(未解决2%出错时的情况)。
4. 部署需要什么?
检查清单:
- FDA批准?
- EHR集成?
- 工作流程变更?
- 所需培训?
- 报销?
- IT安全审查?
危险信号: “只需安装我们的应用”,“无需培训。AI很直观”,“报销即将到来”。
5. 成本效益分析是什么?
询问总拥有成本:
| 成本类别 | 典型范围(每年) |
|---|---|
| 软件许可 | 1万-50万美元(机构范围) |
| 云端推理成本 | 每次患者就诊0.10-5.00美元 |
| EHR集成 | 5万-25万美元(一次性) |
| 培训 | 2万-10万美元(医生时间) |
| 持续支持 | 1万-5万美元(每年) |
| 总计(第一年) | 9万-90.5万美元 |
询问价值主张: 时间节省、避免的成本、收入、质量改进。
盈亏平衡计算: 如果AI每周为每位医生节省2小时,医生时薪150美元,机构有100名医生 → 价值=2×150×100×52周=156万美元/年。如果成本=20万美元/年 → 投资回报率=7.8倍。
危险信号: 供应商无法提供总拥有成本估算,价值主张仅基于“医生满意度”,盈亏平衡需要>90%的采用率。
6. 部署时间线是什么?
| 阶段 | 持续时间 | 活动 |
|---|---|---|
| 供应商选择 | 2-4个月 | 招标、演示、合同谈判 |
| IT/安全审查 | 1-3个月 | HIPAA合规、数据安全 |
| EHR集成 | 3-6个月 | 系统构建、接口测试 |
| 试点 | 3-6个月 | 静默→影子→主动模式 |
| 评估 | 1-2个月 | 分析试点数据、优化流程 |
| 机构范围部署 | 6-12个月 | 培训、推广、监控 |
| 总计 | 16-33个月 | 1.3-2.75年 |
危险信号: “30天内部署”,“跳过试点,直接机构范围”,供应商施压快速决策。
第九部分:临床环境中的人机交互设计
临床AI的成功不仅取决于算法准确性,还取决于医生如何与AI系统交互。一项系统综述发现,AI开发“不成比例地关注技术进步,常常忽视了算法输出与人类期望之间的一致性”。
临床AI中的交互模式
研究识别出AI向临床医生呈现信息的几种不同模式:
| 模式 | 描述 | 临床示例 |
|---|---|---|
| 模式 | 描述 | |
| :--- | :--- | :--- |
| 显示信息 | AI呈现辅助证据支持建议 | SHAP值显示哪些特征驱动了脓毒症预测 |
| 显示不确定性 | AI传达置信水平和预测可靠性 | “高置信度(92%)” vs. “低置信度(61%)” |
| 显示替代方案 | AI显示多个可能的诊断及其概率 | 鉴别诊断排序及可能性评分 |
| 请求输入 | AI请求额外信息以优化预测 | “请开具乳酸检查以提高预测准确性” |
| 反事实解释 | AI显示不同输入下结果如何变化 | “如果血钾正常化,风险将从78%降至34%” |
不确定性沟通
过度自信的AI是危险的AI。深度学习模型在面对不熟悉的情况时倾向于过度自信。
有效的不确定性沟通应:
- 区分不确定性类型: 偶然不确定性、认知不确定性、临床不确定性
- 使用校准后的置信度显示: 避免虚假精度,适当使用分类,显示置信区间
- 标记域外病例: 当患者与训练人群显著不同时发出警报
顺序式与同步式AI整合
研究显示,人机协作模式会影响结果:
顺序模式: 临床医生先形成初步印象,再看到AI建议——保留独立临床判断,但可能导致锚定于初始印象,更适合经验丰富的临床医生。
同步模式: 临床医生在看到临床数据的同时看到AI建议——研究中显示出更大的性能增强,但存在自动化偏倚风险,对初级临床医生更有益。
没有单一交互模式适用于所有情况。 在设计AI界面时,应考虑专业水平、决策风险和时间的紧迫性。
人机协作中的专业水平效应
研究一致表明,专业水平会调节AI的影响:
- 初级临床医生: 更多受益于AI辅助,但更容易受到自动化偏倚的影响
- 高级临床医生: 性能提升较小,但更善于识别AI错误
- 启示: 培训计划应教授批判性评估AI输出,而不仅仅是使用AI工具
临床AI界面设计原则
1. 保留临床自主权: 始终允许推翻AI建议,不要求对推翻进行解释,便于记录与AI意见不同的临床推理。
2. 减少认知负荷: 将AI融入现有工作流程,减少警报频率,使用渐进式披露。
3. 支持决策过程而不仅仅是展示决策: 显示哪些行动会改变预测,突出可修改的风险因素,提供可操作的下步措施。
4. 支持校准学习: 允许医生追踪他们与AI的一致性/分歧,提供关于AI与医生何时正确的反馈,通过经验建立适当的信任。
SepsisLab范式
SepsisLab研究在CHI 2024上展示了一种有前景的交互模型:AI对可以降低预测不确定性的前5项实验室检查进行排序;临床医生可以在实际开单前模拟“如果我们做了这项检查会怎样?”;反事实预测显示每个结果可能如何改变诊断。用户报告称,相比于AI简单显示预测,这提供了“更好的人机协作体验”。这代表了从“AI告诉你答案”到“AI帮你找到答案”的转变。
警告:人机协作很少实现完全互补性
尽管前景广阔,但一项对52项实证研究的荟萃分析发现,“医学AI可以增强临床医生表现,但人机协作很少实现完全互补性”。预期的1+1>2效应常常未能实现,因为:
- 临床医生在AI出错时过度依赖AI(自动化偏倚)
- 临床医生在AI正确时忽略AI(算法厌恶)
- 界面设计未能促进适当的依赖
- 关于AI解读的培训不足
目标: 设计能实现适当依赖的交互,即临床医生在AI可能正确时遵循它,在AI可能错误时推翻它。
检查你的理解
场景1:LLM用药剂量错误
你是一名医院医生,正在管理一名68岁男性,患有医疗保健相关性肺炎。培养结果显示铜绿假单胞菌生长。你向GPT-4询问剂量建议:
GPT-4回答:“对于铜绿假单胞菌肺炎,推荐方案:哌拉西林-他唑巴坦3.375g IV每6小时一次。根据肾功能调整。患者CrCl 45 mL/min → 减至2.25g IV每6小时一次。”
你按照AI建议处方了哌拉西林-他唑巴坦2.25g IV每6小时一次。
24小时后: 患者临床恶化,重复培养:铜绿假单胞菌仍在生长。
药房审核: 发现剂量错误。CrCl 45 mL/min的正确剂量为2.25g每6小时一次(AI正确),但医院获得性铜绿假单胞菌的标准剂量为4.5g每6小时一次(延长输注),根据CrCl 45 mL/min调整为3.375g每6小时一次。
答案1:错误是什么?
GPT-4提供了社区获得性肺炎的剂量,而非医院获得性肺炎的剂量。经肾功能调整后,患者实际接受的剂量应为AI建议的1.5倍。
答案2:GPT-4为何出错?
幻觉/过时的训练数据:LLM在一般肺炎指南上训练,未区分HAP与CAP剂量。
答案3:你会承担医疗事故责任吗?
很可能。医生对所有处方负责,即使是在AI辅助下。护理标准要求:根据权威来源核实AI建议,理解药理学,记录临床推理。
教训: 切勿在未经核实的情况下使用LLM进行药物剂量计算。LLM不是药剂师。应使用UpToDate、Micromedex、Lexicomp或咨询药房。
场景2:联邦学习模型所有权争议
你是学术医疗中心的首席医疗信息官。医院参与了使用NVIDIA FLARE的联邦学习项目,在20个机构间训练乳腺癌检测AI。
项目详情: 你医院贡献了5万张乳腺X光片,训练完成,模型达到了0.89的AUROC。没有关于模型所有权/知识产权的正式协议。
6个月后: 牵头机构提交了FDA 510(k)申请,将自己列为唯一赞助商,计划商业化AI,不与贡献机构分享收入。
答案1:谁拥有AI模型?
法律灰色地带。没有正式协议,所有权不明确。牵头机构可主张协调项目、提供基础设施、撰写资助、设计架构;你医院可主张贡献了25%的训练数据、投入了医生时间。
答案2:本应如何不同处理?
应在项目开始前制定联邦学习治理协议,包括知识产权归属、收入分享、合著者身份、FDA赞助商地位和退出机制。
答案3:医院应如何对待联邦学习项目?
在加入联邦学习项目前,应审核治理协议、咨询医院法律/技术转移办公室、确保HIPAA合规、定义数据贡献范围、建立数据质量标准、规划IRB批准。
教训: 联邦学习提供科学益处,但需要谨慎的治理。在未达成正式知识产权/收入协议前,不要贡献数据。
场景3:数字孪生治疗模拟失败
你是一名肿瘤医生,治疗一名52岁新诊断胶质母细胞瘤的女性。肿瘤委员会建议:最大安全切除→放疗+替莫唑胺。
供应商推销: “我们的数字孪生平台可以模拟患者特定的肿瘤生长和治疗反应。上传患者MRI、病理学、基因组学→AI预测不同治疗下的生存率。”
你输入患者数据: MRI显示4.2cm右额叶肿瘤,病理为IV级胶质母细胞瘤,基因组为IDH野生型、MGMT未甲基化、EGFR扩增。
AI输出: 标准治疗预测中位生存11个月,实验性治疗(手术+放疗+免疫治疗试验)预测中位生存18个月。
AI建议: “入组免疫治疗临床试验。”
你与患者讨论后,患者入组。
6个月后: 患者因疾病进展死亡,生存期6个月。
答案1:出了什么问题?
数字孪生局限性:训练数据为回顾性数据,可能过拟合于训练数据中少数对免疫治疗有反应的EGFR扩增患者,未沟通不确定性,个体肿瘤生物学复杂。
答案2:你会承担医疗事故责任吗?
可能。关键法律问题:知情同意是否充分?(患者是否理解AI预测是估计而非保证?)护理标准是什么?(入组临床试验是否为标准选项?)对AI的依赖程度如何?(
医生是否过度依赖未经验证的AI建议?)
答案3:经验教训是什么?
- 数字孪生是研究工具,而非临床决策工具(无FDA批准,无前瞻性验证)
- 沟通不确定性:始终提供置信区间,解释AI局限性
- 记录AI使用情况
- 不要过度依赖未经验证的AI:标准肿瘤委员会建议应比未经验证的数字孪生预测更有分量
关键要点
- 炒作与现实: 新兴技术吸引的媒体关注远超同行评审证据。医生应在临床使用前要求前瞻性验证。
- 验证环境 ≠ 部署环境: 在受控学术环境中验证的AI可能在现实临床环境中失败。
- 增强 > 替代: 成功的新兴技术增强医生能力,而非完全取代医生。
- 失败模式至关重要: 评估新兴技术时,问“AI出错时会发生什么?”安全的失败模式是移交人类专家。
- 部署前治理: 联邦学习、数字孪生和基础模型需要正式的知识产权协议、责任框架和知情同意协议。
- LLM幻觉是真实存在的: 8-15%的LLM医学回答包含编造信息。切勿在未经核实的情况下使用LLM进行药物剂量计算。
- 成本效益不确定: 基础模型推理成本和部署时间线常常被供应商低估。
- 医生角色: 批判性参与新兴技术,要求证据,参与试点,塑造治理政策。未来是医生-AI伙伴关系,而非替代。
【全文结束】

