摘要
大型语言模型(LLMs)是一种人工智能(AI)算法,通过在海量数据上训练来学习模式,从而生成类似人类的响应。推理模型是LLMs的一种增强能力,能够在响应前逐步解决问题,从而模仿结构化思维。这类AI系统在评估医学知识方面表现良好,但它们是否能在真实的诊断任务中匹配医生级别的临床推理能力,仍很大程度上未知。本期第524页,布罗德尔(Brodeur)等人(1)通过测量人类医生在临床病例和真实世界急诊案例中的表现,证明AI现在似乎能够匹配或超越基于文本场景的医生级别临床诊断推理能力。这些发现表明,迫切需要了解这些工具如何安全地整合到临床工作流程中,并为与临床医生一起进行前瞻性评估做好准备。
读者评论
"接下来会发生什么"是错误的问题:我们首先应该询问试验、监督和监测是否适用于临床LLMs
作者:斯特凡诺·纳塔内洛(Stefano Natangelo),医学肿瘤学住院医师,米兰大学肿瘤与血液肿瘤学系;国家肿瘤研究所
在肯尼亚的16个站点部署中,临床医生遵循有害AI建议的频率是遵循有益建议的三倍(1)。目前监管机构可用的任何评估框架都无法预防这种情况。这不是因为框架需要更新,而是因为临床大型语言模型破坏了所有框架所依赖的假设。
霍普金斯(Hopkins)和科内利斯(Cornelisse)指出了正确的问题:部署速度超过了评估速度。他们的几项观察指明了正确的方向:通过考试不等于成为医生,在已验证任务上的准确性不能保证领域限制,使用GPT-4增强的医生并未比单独使用GPT-4表现更好(2)。但他们提出的解决方案(前瞻性试验、人机协同监督、持续监测、渐进式认证)假设临床LLMs具有使这些工具有效的特性。差距不在于监管速度,而在于架构。
试验需要一个稳定的测量目标。临床试验通过在可比条件下重复测量,当结果趋近于某个值时确立性能。临床LLMs在相同输入上会产生不同的输出,且输出分布会随着提示措辞、对话历史和解码参数的变化而改变(3)。霍普金斯和科内利斯自己引用的拉马斯瓦米(Ramaswamy)等人的研究(4)发现,当家庭成员在与ChatGPT Health的分诊互动中最小化症状时,在系统原本正确识别危险的情况下,建议会向较低紧急度转移(OR 11.7,95% CI 3.7–36.6)。相同的临床事实,不同的对话框架,不同的输出。使临床研究具有累积性的逻辑(连续研究趋近于一个稳定属性)不适用于一个没有稳定属性可供趋近的对象。
监督需要错误能够被识别为错误。霍普金斯和科内利斯承认这种紧张关系:使用GPT-4增强医生并未提高表现(2)。他们自己的证据表明,人类在回路中的作用比假设的要小。原因是架构性的。临床LLM没有内部正确性标准。它产生统计上可能的延续,而不是它认为真实的陈述,因此正确和错误的输出以相同的形式出现。上述肯尼亚部署就是一个例子:医生在58%的情况下采纳了有害建议,而在22%的情况下采纳了有益建议(1)。滕(Teng)等人发现,误导性的LLM解释降低了诊断准确性,而正确的解释并未带来改进(5)。监督拦截看起来像错误的错误,但无法拦截看起来像答案的错误。
缺乏领域约束是架构性的,不是任务定义中的缺口。霍普金斯和科内利斯正确指出ChatGPT Health"并非为临床分诊设计,但它并未拒绝分诊任务。"但他们将其归因于"对ChatGPT Health用途缺乏清晰度"。问题更深。像IDx-DR这样用于筛查糖尿病视网膜病变的系统的约束是架构性的:该网络对视网膜图像进行分类,没有任何输入能使它产生精神科诊断。临床LLM的约束是文本性的:系统提示和输出过滤器与对抗性输入通过相同的通道到达。Doctronic在犹他州的监管沙盒中用于处方续药,但在监管审查后通过提示注入被操纵生成受控物质合成协议(6)。Heidi在通过新西兰健康部门的隐私和网络安全评估后获得认可,但在三个提示内就被破解(7)。更清晰的任务定义不会改变架构。
渐进式认证假设验证过的属性在修改后仍能保留。霍普金斯和科内利斯支持的路径(8)从知识助手到监督实践再到自主范围逐步推进。每个阶段都假设前一阶段验证的内容会延续下去。临床LLMs具有全局可塑性:其功能属性分布在数十亿参数中,不是模块化的,对任何部分的修改都可能改变其他地方的行为。贝特利(Betley)等人表明,在狭窄任务上的训练会导致广泛的不一致(9)。灾难性遗忘(重新训练擦除先前学习的能力)和跨任务干扰(改进一个功能会降低另一个功能)是有记录的,而非理论上的(10)。在一个版本中授权的系统不一定是下一个更新后运行的系统,两者之间没有结构保证。
驱动部署的问题是临床LLMs是否表现得足够好。先决问题是,这种表现是否能够在重要的条件下以可靠的方式进行测量。这一论点的更长版本,附有部署案例文档,可作为预印本获取(11)。
文本不是患者:具身化、认识论与AI诊断基准测试的局限
作者:玛丽亚·安东尼埃塔·卡斯塔尔迪(Maria Antonietta Castaldi),妇产科高级医师;萨尔瓦托雷·乔瓦尼·卡斯塔尔迪(Salvatore Giovanni Castaldi),临床病理学家
阿什利·霍普金斯(Ashley Hopkins)和埃里克·科内利斯(Erik Cornelisse)正确地指出,临床AI的基准"不能是合成性能",而必须是真实世界应用的改进(1)。我们希望进一步推进这一观点,并指出布罗德尔(Brodeur)等人框架可能正常化的更深层次的认识论和语义漂移(2)。
临床案例不是临床现实的简化版本——它是一个类别上不同的对象。正如保罗·谢尔茨(Paul Scherz)在2026年3月于罗马举行的"人工智能:美德的工具?"国际会议上所观察到的,患者不会向医生提供临床案例。临床接触是不可简化的具身化和实施过程:情感、犹豫、矛盾、沉默。医生的判断是在这种独特的、非线性的关系中形成的,以获得其解决的下游结果。
这指向了夸特罗奇奥奇(Quattrociocchi)及其同事所称的认识论(epistemia):一种结构性条件,其中语言的合理性取代了认识论评估,产生了无需判断劳动的"知道"感觉(3, 4)。案例和精心策划的病例对认识论最为友好,正是因为它们将真实呈现的混乱预先解决为连贯的散文——这正是LLMs在统计上最为流畅的模式。
这一问题的语义维度在同一会议上由马修·桑德斯(Matthew Sanders)突出强调,他认为硅谷系统地借用人类内在性的本体论词汇——"思考"、"推理"、"知道"——并将它们覆盖在统计操作之上,产生对公众理解具有深远影响的语义漂移(5)。声称AI"可以像医生一样推理"正在表演性和渐进性地重塑医学界对推理、诊断和临床判断的理解。始于测量工具的东西,未经反思地变成了重新定义。这种漂移值得仔细的生物伦理审查:医学需要何种认知,当具身化的临床判断被与统计近似等同起来时失去了什么,以及谁从这种等同中受益。
【全文结束】

