医疗AI的新范式:为何模型间的分歧可能比共识更有价值A new paradigm for medical AI: why disagreement between models may be more valuable than consensus | Karolinska Institutet

环球医讯 / AI与医疗健康来源:news.ki.se瑞典 - 英语2026-09-11 03:04:06 - 阅读时长9分钟 - 4406字
本文提出了一个名为MEDLEY的医疗AI新范式,挑战了当前追求单一、强大AI模型的趋势。MEDLEY通过并行部署多个AI模型,并刻意保留它们之间的分歧,将模型差异视为临床推理的宝贵资源,而非需要解决的问题。该方法强调保持“人在回路中”,通过渐进式信息披露等设计减轻医生认知负担,并利用模型差异作为对抗数据投毒等安全威胁的天然防御机制。研究指出,当前的可解释AI(XAI)可能产生“数字诡辩”,导致过度信任,而MEDLEY的多元视角结构能有效对抗自动化偏差,并促进医疗公平,保护少数人群的观点。
医疗AI健康诊断临床决策患者安全医学影像医疗公平偏差人类监督
医疗AI的新范式:为何模型间的分歧可能比共识更有价值

当医疗保健领域的AI系统给出一个自信的答案时,临床医生应该信任它吗?在《人工智能前沿》杂志的一篇新文章中,卡罗林斯卡学院的研究员Farhad Abtahi及其同事认为,这个问题本身是错误的,整个领域需要重新思考医疗AI系统的设计方式。在此,他阐述了自己的推理。

卡罗林斯卡学院的研究人员提出了MEDLEY(具有杠杆多样性的医疗集成诊断系统)这一概念性范式,挑战了构建日益庞大的单一AI模型的主流方法。MEDLEY并非寻求一个最佳答案,而是并行编排多个AI模型,并刻意保留它们之间的分歧,将输出的多样性视为临床推理的资源,而非需要解决的问题。

我们采访了该研究的通讯作者,临床科学、干预与技术系SMAILE(斯德哥尔摩医疗AI与学习环境)核心设施的负责人兼研究员Farhad Abtahi。

您将MEDLEY描述为一种范式转变。这是什么意思?

“目前,医疗AI领域的主流趋势是构建一个单一的、强大的模型,并将其输出视为答案。MEDLEY提出了根本不同的方案。我们不是将多种视角合并为一个共识,而是保留它们。临床医生可以看到模型在哪里达成一致,在哪里存在分歧,以及分歧的原因,因为每个模型的训练背景和偏差都被透明地记录。这便将目标从通过一致性最大化准确性,转变为通过结构化多样性增强洞察力。这是一种关于医疗AI应如何运作的不同思考方式。”

为什么在MEDLEY中,保持临床医生在决策回路中如此重要?

“因为医疗保健中的最终决定必须由人类做出。这不仅是监管要求,也是伦理责任。但要让人类监督有意义,临床医生需要真正理解他们在监督什么。一个呈现自信答案并附带精致解释的单一模型,实际上可能通过鼓励自动化偏差(即过度信任自动化系统的倾向)来削弱人类的判断。研究表明,当AI提供有说服力的解释时,临床医生更有可能接受错误的输出而不加质疑。”

“MEDLEY旨在抵消这一点。通过呈现多种视角,包括少数派观点和分歧模式,该框架使临床医生积极参与到推理过程中。它的运行方式更像一个结构化的会诊小组,而非一个黑箱神谕。临床医生成为了多样化分析视角的编排者,而不是单一答案的被动接受者。”

但是,同时呈现来自众多不同模型的输出,会不会压垮医生?

“这是一个关键的设计问题,我们在论文中直接进行了论述。认知负荷理论告诉我们,同时呈现过多信息可能会削弱而非增强决策能力。MEDLEY通过我们所谓的‘渐进式信息披露’来解决这个问题。默认的临床视图只显示带有总结性不确定性指标的共识发现。备选和少数派诊断结果是可用的,但只有当临床医生选择展开时才会显示,通常针对复杂或模棱两可的病例。”

“该系统还使用基于阈值的激活。对于常规的高共识病例,MEDLEY提供精简的输出,仅在对分歧确实增加诊断价值的病例中,才保留完整的集成多样性。像置信带和分歧指标这样的可视化编码传达了集成级别的模式,而无需临床医生逐一处理每个模型的输出。目标是在需要多元性时可见,在不需要时隐而不用。”

目前人们对可解释AI(XAI)热情高涨。您似乎对此表示怀疑?

“并非怀疑目标本身,而是怀疑‘解释等于可信’这一假设。这是本文最重要的论点之一。大型语言模型非常擅长生成听起来临床可信的解释:自信、清晰、结构良好。但越来越多的研究表明,这些解释往往与模型实际得出其输出的方式关系不大。我们称之为‘数字诡辩’:伪装成透明度的有说服力的语言。”

“危险是真实存在的。一个模型可能给出错误的诊断,却附带一个似乎无懈可击的合理解释。如果临床医生相信了这个解释,他们就会相信这个答案,患者就可能受到伤害。可解释性,按照目前的做法,实际上可能使自动化偏差变得更糟,而非更好。”

“MEDLEY完全规避了这个悖论。它不依赖任何单个模型解释自身的能力,而是通过跨多个模型的趋同和趋异视角的结构化互动来寻求可靠性。这是一种输出的辩证关系,而非推理的表演。如果几个具有不同训练背景的独立模型达成一致,那么这种趋同就具有真正的证据分量。如果它们存在分歧,那么这种分歧本身就是一个有临床意义的信号。”

偏差通常被视为AI的缺陷。您持不同观点?

“是的,这正是范式转变的核心。AI中的偏差反映了模型训练所依据的数据:哪些人群、哪些机构、哪些临床实践。MEDLEY并未将此完全视为负面因素,而是将偏差记录为一种专业化形式。一个主要在东亚人群数据上训练的模型,可能比在北欧训练的模型更能识别某些疾病,反之亦然。关键在于让这些差异透明化,以便临床医生能在具体情境中权衡它们。”

“这并不意味着所有偏差都是可接受的。论文划定了清晰的伦理界限:强化刻板印象、编码歧视性代理、或用统计相关性替代临床因果关系的偏差是永远不可接受的。但是,一个产生偏差的模型,若能贡献于一个保持透明性的集成系统,与同一个模型作为独立决策者部署,在伦理上是截然不同的。”

您构建了一个概念验证。它显示了什么?

“为了说明MEDLEY在实践中如何运作,我们开发了一个用于鉴别诊断(即生成并排序可能诊断结果的临床任务)的演示器,使用了超过30个来自不同地理、架构和时间来源的大型语言模型。需要强调的是,这只是该范式的一次特定应用,而非MEDLEY本身。该框架旨在广泛应用于医疗AI的各个领域。”

“例如,在医学影像方面,论文讨论了MEDLEY如何能够让不同的分割模型在肿瘤边界上的分歧显现出来。在放射治疗计划中,这些分歧并非噪音;它们对于避免敏感结构受到辐射暴露至关重要。传统的集成方法将这些输出汇总成单一边界,隐藏了差异。而MEDLEY则将它们保留下来,供肿瘤科医生评估。”

“在鉴别诊断演示器中,我们发现,在合成病例中,共识率差异很大,从复杂病例的大约48%到诊断明确的病例的90%以上。共识率较低的病例中,罕见或特定区域的病症比例更高,而这恰恰是多元视角最能体现价值的地方。在一个案例中,一个基于东地中海地区数据训练的单一模型标记出了一种所有其他模型都遗漏的遗传病。这个少数派输出被附上透明的来源信息呈递,让临床医生决定是否需要进行进一步检查。”

“这些是基于合成病例的概念验证观察结果,并非经过验证的临床发现。但它们证明了该方法在技术上是可行的,并且有意义的共识与分歧模式可以从多样化的集成系统中涌现出来。”

MEDLEY与谷歌、微软等公司开发的医疗AI系统有何不同?

“这是一个重要的区别。像谷歌的AMIE和微软的MAI-DxO这样的系统是令人印象深刻的成就,但它们是在根本上不同的范式下运作的。例如,AMIE使用通过自我对弈训练的单个大型语言模型,其中模型模拟医患对话的双方。MAI-DxO分配了多个角色,例如不同的专科视角,但这些角色仍然由同一个底层模型执行。”

“MEDLEY则不同,因为它使用了真正异构的、并行的模型:由不同团队构建、基于不同数据训练、采用不同架构的系统。多样性是真实的,而非模拟的。当AMIE扮演心脏病专家,然后又扮演神经病学家时,它仍然是带有相同训练偏差的同一个模型。当MEDLEY编排一个基于斯堪的纳维亚医院数据训练的模型,与另一个基于东南亚临床记录训练的模型时,这些是根本不同的分析视角。这一区别对于患者安全至关重要。”

您提到了健康公平。MEDLEY如何解决医疗护理中的差异问题?

“这是该范式最重要的启示之一。当前的‘通用’AI模型通常主要在来自高收入国家多数人群的数据上进行训练。研究表明,这些模型对少数族裔患者会产生大量错误,并且即使在偏差评估之后,性能差异仍然存在。实际上,追求单一的、无偏差的模型可能会积极恶化对代表性不足群体的护理,因为跨人群的平均化会抹去临床上有意义的差异。”

“MEDLEY采取了相反的方法。通过编排基于不同人群训练的模型,并保留而非平均化它们的视角,该框架明确保护了少数派观点。一个使用撒哈拉以南非洲数据、或来自原住民健康服务机构、或来自罕见病登记处数据开发的模型,能够提供在单一通用模型中会被稀释或丢失的视角。使每个模型的训练人群透明化,也反驳了AI系统天生客观这一危险假设。”

MEDLEY是否对诊断之外的领域也有启示,例如AI安全?

“是的,我们认为这一联系尤其引人注目。医疗AI领域日益增长的担忧之一是数据投毒,即操纵训练数据可以引导AI系统走向不安全的行为。如果你依赖一个单一的模型,且该模型被攻破,那就没有安全网了。”

“MEDLEY的架构提供了固有的防御。由于集成系统中的模型是在独立的数据源上使用不同架构训练的,它们不太可能共享相同的漏洞。如果一个模型被投毒,它将以可被检测的方式突然与其他模型产生分歧。同样的、用于丰富诊断推理的分歧监控,也充当了抵御对抗性攻击的警报系统。在我们发表在《医学互联网研究杂志》上关于医疗AI安全的相关工作中,我们详细探讨了这一交汇点。”

MEDLEY能否改变医疗AI市场?

“我们认为是这样的。当前市场正倾向于少数几家大公司提供单一‘超级模型’。MEDLEY创造了一种根本不同的动态。如果多样性被重视,而不仅仅是单一来源的原始准确性,那么拥有专业模型的小公司将变得至关重要。专注于罕见病的初创公司、拥有本地人群数据的地域团队、或针对代表性不足人群的学术团体,都将能在集成系统中发挥相关作用。他们的贡献在单一模型范式下被贬值,但在MEDLEY中却是不可或缺的。”

“从概念上讲,这类似于医疗AI的应用商店生态系统,多样化的贡献共存并相互补充,使参与民主化,并可能加速创新。”

这与欧盟AI法案有何关联?

“欧盟AI法案将医疗AI列为高风险类别,要求进行偏差缓解、保持透明度和实施人类监督。MEDLEY自然地与这些要求相符,因为它通过设计使偏差可见,并坚持临床医生作为最终决策者。然而,当前的监管环境尚未建立认证集成级别系统的既定路径,而这类系统的价值恰恰源于模型组合,而非任何单个模型。为监管机构和研究界制定这些路径是重要的下一步。”

接下来需要做什么?

“概念验证确立了技术可行性。将该范式转化为临床实践需要:前瞻性临床研究,将MEDLEY辅助的决策与单模型和无辅助临床医生的基线进行比较;人因工程研究,探索临床医生如何与多模型输出互动,以及认知过载何时成为风险;与监管机构就集成级别认证进行合作;以及将其扩展到多模态数据,在同一个保留多样性的架构中结合影像、实验室值和临床病历。愿景是实现人与AI的合作,让多元视角增强而非负担临床推理,这正如卡斯帕罗夫曾经所说的‘进阶象棋’,即人机团队的表现优于任何单独一方”,Farhad Abtahi总结道。

发表

利用不完美与MEDLEY:一种利用医疗AI偏差的多模型方法。Abtahi F, Astaraki M and Seoane F (2026). 人工智能前沿 9:1701665. doi: 10.3389/frai.2026.1701665

【全文结束】

猜你喜欢
  • 了解阿尔茨海默病:不容忽视的早期警示信号了解阿尔茨海默病:不容忽视的早期警示信号
  • 两种观点:扩大减重药物可及性的理由两种观点:扩大减重药物可及性的理由
  • Vail Health为那些被现代医疗保健选择弄得不知所措的人提供长寿指导Vail Health为那些被现代医疗保健选择弄得不知所措的人提供长寿指导
  • 奥兹博士主张为每位Medicare成员提供代理型人工智能奥兹博士主张为每位Medicare成员提供代理型人工智能
  • 2026年西非制药与医疗保健博览会聚焦医疗创新与投资,将在阿克拉举行2026年西非制药与医疗保健博览会聚焦医疗创新与投资,将在阿克拉举行
  • PRISM BioLab 与 Receptor.AI 宣布药物发现合作协议PRISM BioLab 与 Receptor.AI 宣布药物发现合作协议
  • 人工智能预测心力衰竭患者病情恶化人工智能预测心力衰竭患者病情恶化
  • 临床医生在评估医疗人工智能工具中发挥更大作用临床医生在评估医疗人工智能工具中发挥更大作用
  • 在向AI聊天机器人寻求健康建议前需要了解什么在向AI聊天机器人寻求健康建议前需要了解什么
  • 医院管理者反对保护医生护士免受辐射暴露的法案医院管理者反对保护医生护士免受辐射暴露的法案
热点资讯
全站热点
全站热文