摘要
人工智能(AI)已经从根本上改变了社会,医学也不例外。AI将影响我们的行医方式、医院的运作方式,甚至医学实践本身。基于AI的产品已经开始使用,例如AI抄写员和像ChatGPT这样的大型语言模型。目前正在开发具有医学特定功能的模型,例如肾损伤预测。然而,像AlphaFold(用于蛋白质结构预测)这样的变革性基础性工作,也承诺将彻底改变我们处理医学的方式。因此,临床医生必须对AI有清晰的理解,这不是一项可选技能,而是现代医学实践的核心能力。本文作为一篇教程,旨在指导医疗专业人员掌握AI的基本原理。它将教临床医生构建一个心理框架,以理解并进入AI领域。本文的核心部分按步骤组织,并在文章末尾的模块中讨论其他相关主题。核心步骤应顺序阅读。为了让读者为后续内容做好准备,本教程将首先介绍AI是什么,然后涵盖一些理解其他概念所需的基本定义。之后,读者将准备好理解什么是深度学习,以及监督学习和无监督学习之间的区别。最后,读者将了解深度学习模型是如何学习的。文中还包含关于安全性和临床应用的独立模块。本教程适用于各级临床医生,但对那些在没有该领域正规教育的情况下接触到AI工具的执业临床医生可能特别有用。本教程的用户可以参考特定章节,也可以阅读全文。
Interact J Med Res 2026;15:e85266
doi:10.2196/85266
关键词:医学教育;机器学习;人工智能;AI;深度学习
步骤1:理解人工智能是什么
在深入探讨人工智能(AI)背后的概念之前,理解AI的含义很重要。AI是一个广义术语,通常指能够执行历史上与人类相关的复杂任务的计算机系统,例如人类学习、理解、问题解决、决策、创造力和自主性[1]。在计算机科学中,AI算法涵盖了多种方法论。现代大多数AI都是机器学习(ML),更具体地说是深度学习(DL;图1)。虽然所有ML都被视为AI,但并非所有AI都是ML。
[图1:人工智能术语的维恩图]
专家系统是AI的一种较老范式,其中领域专家的知识被硬编码到复杂的基于规则的算法中,以模拟人类决策(例如,“如果x条件,则y结果”)。著名的例子包括Edward Shortliffe于1974年设计的用于预测抗生素选择的MYCIN系统[2],以及传统的国际象棋AI系统。即使是像Deep Blue(IBM公司)这样著名的例子也依赖于硬编码知识[3]。专家系统及其硬编码方法在现代已被基本放弃,因为开发它们需要巨大的努力,且生成的系统脆弱且不灵活。在医疗保健中,也存在一些专家系统的例子,例如较旧的脓毒症和药物相互作用临床决策支持系统。目前AI主要是ML。ML算法不是依赖于专家的硬编码,而是通过训练来学习数据中的关系和模式。术语DL和ML经常互换使用;然而,值得指出的是,DL实际上是ML的一个子集。有许多类型的ML不是DL(例如,k-means聚类和决策树)。DL将在后续章节中深入讨论。
步骤2:理解基本定义
为了理解ML算法和模型,需要一些基线认知。ML算法是工具(例如,逻辑回归),通过数据训练创建一个ML模型。用于分类的ML模型通常称为分类器。用于训练算法的数据质量对模型的性能至关重要。数据集中的每条记录或事件称为一个实例。实例的每个方面(例如,颜色、持续时间、测试结果)用于训练模型,称为特征。在简单数据集中,实例是数据电子表格中的行,而特征则是列标题。许多ML数据集可能有数千个实例和数百个特征。
标签是数据集中某个实例的特定特征的信息(例如,特征“颜色”的“红色”,特征“持续时间”的“30分钟”,特征“葡萄糖水平”的“34 mg/dL”)。标签通常指基于人工或传统分析方法应用于数据的信息,代表分类、排名或问题的答案。例如,在一个住院至少30天的患者数据集中,特征为“患者住院期间是否发生医院获得性感染”,则标签为“阳性”(如果感染)或“阴性”(如果未发生),需注意阳性或阴性的判定必须由分析患者数据的人完成。
需要指出的是,未经人工标记的数据仅称为数据。也可以选择只使用数据集中的一部分数据进行训练。
步骤3:区分监督学习和无监督学习
一个核心的初始概念是理解ML的两大主要类别之间的区别。通常,ML可分为监督学习和无监督学习,尽管还有其他类别或方法,如强化学习和迁移学习。
在监督学习中,带有标签的数据被输入ML算法进行训练。算法训练完成后,称为模型。开发高质量模型的最大挑战之一通常是获得大量(通常数千个实例)准确标记的数据。监督学习的一个例子是使用胸部X光片及其对应诊断数据集训练的算法[4-6]。在无监督学习中,未标记的数据被输入算法,算法自行发现关系和分组。这种区别如图2所示。无监督学习的一个例子是算法识别出COVID-19患者的不同亚群或分组[7,8]。
[图2:(A)监督学习和(B)无监督学习的示意图]
在图2A中,形状由人工标记为圆形和正方形。数据集被输入算法,通过这些标签,机器学习哪些特征对形状分类贡献最大。在图2B中,机器被输入没有标签的原始数据。通过探索和特征间数据的差异,模型学习到存在两种不同的对象类别。需要注意的是,模型可能并不固有地识别它们为圆形或正方形,而是作为两种不同的对象类别。
还存在其他形式的学习,例如强化学习。在强化学习中,算法体验一个环境并采取行动。基于该行动,模型会得到奖励或惩罚作为反馈。算法学习哪些模式会导致奖励或惩罚,并相应调整其行为。此外,监督学习和无监督学习存在于一个连续谱上,有些学习形式是两者的混合(即某些实例有标签,某些没有)。对这些概念的完整描述超出了本文的范围。
迁移学习是另一种方法,其中算法首先在针对期望结果非常大但非特定数据集上进行训练,然后使用学习到的模式在更小但更具体的数据集上微调,从而将算法优化为模型。迁移学习通常用于特定领域的高质量标记数据集有限,而更广泛、非特定数据集更丰富的情况。
步骤4:定义深度学习和神经网络
ML的一个子类别是深度学习。这一ML分支高度专注于神经网络。神经网络最早在20世纪中期被描述[9,10],旨在模拟人类神经系统中的神经过程。尽管该领域的基础性工作已经持续了几十年[11-13],但早期工作受到硬件和数据可用性的限制。强大的并行计算(称为图形处理单元)的出现、利用图形处理单元的平台以及大型数据集的可用性帮助克服了这些障碍[14]。
人工节点称为神经元,按层连接形成网络。数据被输入网络的输入层;网络通过一层到多层隐藏层处理数据,然后在输出层提供结果。
深度学习特指在具有许多层的神经网络上进行的ML(因此称为“深度”)。目前没有普遍公认的精确层数阈值。然而,常见的例子如ResNet(微软)和ChatGPT(OpenAI)背后的架构可以包含数百层和数十亿个参数[15,16]。
步骤5a:ML算法工作原理的逐步讲解
接下来,本教程将阐述ML算法的工作过程,通过一个例子描述过程,然后定义其他关键术语。为了学习如何在监督学习中正确预测、分类或排名实例,算法分析数据以确定哪些特征对数据标签贡献最大。这个学习过程称为训练。在训练过程中,机器学习调整内部参数(称为权重),以产生期望的输出。这些权重对应于单个神经元。这是通过最小化损失函数来实现的,其中观测预测与预期预测之间的差距被最小化。
例如,考虑一个旨在评估住院患者念珠菌病风险的模型。该模型可能学习到重症监护入院、发热、腹部症状或白细胞计数正常等特征与念珠菌病的较高或较低风险相关。特征通常以复杂的方式映射到一系列神经元和层上。应用于每个特征的权重的修改,通过多层分析的复杂交互影响模型输出,使模型能够学习将输入特征与目标结果联系起来的模式。在较简单的ML形式中,有时可以确定哪些特征对结果贡献最大;然而,在DL中,由于涉及的节点和层数众多,这通常很困难。因此,在DL中,重要性的变化可能无法直接解释。
数据集通常很大,包含许多特征,其中一些逻辑上与所检查的结果无关。如果用于训练算法的数据包含这些完全无关的变量,算法可能会做出无意义的关联,从而在后续产生虚假的错误结果。例如,它可能将病号服的颜色和/或患者的三明治偏好与总住院时长关联起来。然而,如果重症监护病房与普通病房的病号服颜色或菜单选择不同,但数据中未记录这些信息,则模型可能完全错过混杂变量。这些模型开发中的错误在所有ML中都难以检测,在DL中更难。
步骤5b:使用示例的基本ML数学讲解——损失函数
为了说明ML训练的数学原理,我们可以使用一个极度简化的监督学习连续变量示例。需要注意的是,大多数现代DL需要大量数据集。虽然具体细节在其他ML形式中可能有所不同,但此示例将说明一般概念。在此示例中,数据集包含一种肾毒性药物的谷浓度以及患者实际测量的估计肾小球滤过率(eGFR)。在这个监督ML中,测量的eGFR是标记数据。选择一个合适的ML算法,尝试根据药物浓度预测eGFR(表1)。
[表1:预测肾毒性模型样本数据]
| 肾毒性药物浓度 (mg/L) | 真实eGFR (y; mL/min/1.73 m²) | 机器学习模型预测的eGFR (ŷ; mL/min/1.73 m²) |
|---|---|---|
| 10 | 100 | 95 |
| 13 | 95 | 92 |
| 15 | 100 | 90 |
| 20 | 90 | 85 |
| 25 | 80 | 80 |
| 30 | 65 | 75 |
| 40 | 55 | 65 |
a eGFR:估计肾小球滤过率。
模型根据肾毒性药物浓度(x)产生预测值(ŷ)。算法将预测的eGFR(ŷ)与真实测量值(y)进行比较。在图形上,将预测的eGFR值(图3中的橙色线)与真实值(蓝色线)绘制在一起。为了确定肾毒性药物浓度(x)与测量eGFR(y)之间的模式,算法计算损失函数。大多数区域差异可能很小,但在某些区域显著。为了捕捉模型在所有数据点上的性能,我们使用这个损失函数,它是一个量化预测值与观测值之间总误差的数学函数。
[图3:预测肾毒性模型的样本数据。eGFR:估计肾小球滤过率]
按照惯例,在训练中的每个批次后更新损失函数。然后模型调整权重并再次尝试,以确定在数据集的所有实例中,哪些权重组合能在训练数据上产生平均最低的损失函数。使用高质量、能代表模型可能遇到的所有情况的数据进行训练,有助于确保模型在平均水平上表现良好,不会产生虚假的错误预测。算法计算损失函数的具体方式因算法类型而异,不同的函数针对不同任务进行了优化。例如,均方误差是一种常见的损失函数,它计算ŷ和y之差的平方。通过平方差,它确保负的损失值在求和时不会抵消正的损失值,并有助于惩罚严重错误的预测。
在一个对新数据表现良好(即泛化良好)的模型中,任何新患者的肾毒性药物浓度输入后,ŷ和y都会相似。泛化不佳的模型可能会对一小部分具有特定数据点差异的患者做出巨大、无意义的预测错误。这就是为什么使用高质量、能准确代表部署后可能遇到的数据类型的数据来训练模型至关重要。
步骤6:理解反向传播和梯度下降的概念
另一组需要理解的关键概念是反向传播和梯度下降。在深度学习中,模型修改神经网络中特定神经元的权重以产生其预测。当数据输入时,它们会向前传播通过网络。初始运行会创建随机权重,因此初始模型的预测能力可能很差。然而,在这次前向传播之后,模型评估其产生的损失函数,并尝试通过一个称为梯度下降的过程来最小化损失。在梯度下降中,我们设定一个学习率,它决定了我们沿着损失函数曲线移动的步长(图4)。如果模型发现损失在增加,它将向后移动以减少损失。相反,如果它发现损失在减少,它将朝那个方向继续移动。通过这种方式,它最终寻求局部最小值,从而最小化损失函数并提高模型的预测能力。
[图4:概念的图形说明]
数学上,梯度下降可以表示为 ( w = w - \eta \left( \frac{dL}{dw} \right) )。请记住,损失函数的导数 ( \left( \frac{dL}{dw} \right) ) 给出了任何点的梯度。这使得模型能够知道损失是在增加还是减少。学习率(η)告诉模型在每个方向上移动多少。回想一下,损失函数量化了预测值与观测值之间的差异,其目标是找到最低点,从而最小化这种差异。这些概念再次在图4中直观地展示出来。我们示例模型简单线条(图3)的均方误差是一条抛物线,为说明方便,这为梯度下降提供了一个易于可视化的例子。当η设置得太大时,模型可能会向后跳跃得非常远,以至于错过局部最小值。相反,η值太小可能导致移动极小,永远无法达到最小值。
在训练过程中,为了具体更新梯度,模型将经历一个称为反向传播的过程。训练算法将遍历神经网络,并改变神经元的权重,目的是减少损失。这个过程最终会提高ML模型的预测能力。
模块1:AI可解释性与安全性的简要说明
随着AI变得更加强大并融入社会,已经观察到各种风险和错误。这里简要讨论安全性,还有许多其他出版物详细深入探讨了每一个方面。
ML模型如何从输入确定其输出(即最终预测或呈现给用户的结果)通常不清楚。这指的是所有ML,特别是深度学习和神经网络所具有的“黑箱”特性。一个称为可解释AI的领域已经出现,它不仅试图更好地理解模型如何做出预测,还尝试向ML模型添加组件,要求模型解释它是如何得出其结果的(即哪些特征影响最大)[17]。
对于所有AI,尤其是在医学中,必须检查模型性能是否存在结果差异,这可能表明数据中的人类偏见已被模型传播或加剧。AI算法是极其敏感的模式检测工具。因此,它们可以检测到由人类偏见和歧视导致的数据细微差异。更糟糕的是,它们可以将这种偏见传播到模型中。因此,必须检查模型是否存在可归因于种族、性别、社会经济地位、宗教等的结果差异,因为模型中存在这些元素将导致模型在某些患者群体中产生不准确的结果。具体的例子包括模型在诊断肤色较深者的皮肤病时存在困难[18],以及一个软件程序意外地将白人患者优先于非洲裔美国患者转诊接受特殊护理[19]。在后一个例子中,虽然目标是确保患者得到所需的护理,但该算法被设计用于预测谁的护理费用会更高,结果发现,尽管非洲裔美国患者需求水平相同,但花费在他们身上的钱却更少[19]。此外,一项研究发现,一个AI系统可以仅从放射影像中学习预测种族[6]。现在有工具可以帮助检测这些元素,包含这些元素的模型需要在优化后的数据上重新训练,或以其他方式加以缓解,以确保所有患者都能得到最好的护理。最后,AI基础设施也存在相关风险。由于许多模型使用基于云的计算模型,并且一些公共商业大型语言模型(LLM)使用输入数据重新训练模型,临床医生需要意识到敏感数据被发送和存储的位置。
现在,随着AI的使用迅速变得更加普遍,有理由认为AI将自主执行(即无需人工介入)的程度将会增加。一些出版物讨论了随着AI变得更加自主并集成到系统中,为减轻风险所需的安全措施。这些风险从当今的实际风险到更强大模型的理论风险不等。专家将这些风险分为四类:滥用、偏离、错误和结构性风险。滥用发生在用户故意指示AI工具以有害方式行为时(即用户是敌手)。偏离发生在AI系统明知故犯地违背人类意图时(即AI是敌手)。这包括AI的故意欺骗。错误发生在AI系统在没有故意犯错的情况下产生不正确的输出时,通常是因为现实世界的数据很复杂,受许多因素影响。最后,结构性风险可能出现,即融入社会的普遍AI系统通过多个独立代理在多因素、多代理的方式下造成伤害[20]。
大量正在进行中的AI研究专注于确保和提高AI安全性。例如,研究关注对抗性攻击对模型的影响,以了解安全性。开发人员还尝试在模型中构建安全措施,并使用红队测试,即安全专业人员尝试模拟攻击以确定模型的鲁棒性[4,18]。同样重要的是,努力制定细致入微、信息充分的开发法规和指南[18,21-26]。
模块2:AI在医学中的当代临床应用
医疗保健是AI最有前景的行业之一。虽然像理解蛋白质折叠能力这样的颠覆性工作正在进行中[27],但AI在医疗保健中已有许多常规应用。
众所周知,文书工作往往过多,并导致医生倦怠。美国医学信息学协会的一项调查发现,73.26%的医疗保健专业人员认为花费的时间不合理,77.42%的人报告与文书工作相关的加班,74.83%的人认为文书工作阻碍了患者护理[28]。加拿大的数据也显示了类似的结果,医生花费过多时间在导致倦怠的行政任务上[29,30]。
AI抄写员是能够环境聆听患者互动并自动为医生生成笔记的工具,减轻了医生的行政负担。许多公司都推出了产品;但总的来说,抄写员使用大型语言模型,这些模型基于Transformer架构(该架构使用注意力机制来处理前置信息并学习它们之间的关系)[31,32]。在抄写员的语境中,LLM利用这种自注意力机制来帮助生成逻辑文本。因此,Transformer和LLM的局限性同样适用于AI抄写员。例如,在许多LLM中,幻觉是一个问题,理论上这是由于算法因正确回答而获得奖励,从而使得猜测比承认不确定性更具优势。医疗保健提供者必须意识到AI抄写员的这些局限性以及它们可能如何出现。
LLM也被Epic等供应商用于从现有记录中自动提取信息,例如创建出院小结、阅读放射报告、提供摘要、根据正在创建的记录准备任务以及提供见解[33]。它们还被用作聊天机器人,扮演文书角色,并作为医学知识的搜索引擎[34,35]。虽然像ChatGPT(OpenAI)、Claude(Anthropic)和Gemini(Google)这样的LLM被公众广泛使用,但OpenEvidence(OpenEvidence LLC)专门针对医学文献进行了训练,减少了错误和幻觉[36]。适用于研究和科学的模型也存在,例如Perplexity(Perplexity AI)和Elicit(Elicit Research)[36,37]。没有界面的开源、医学专注型模型也存在,例如MedGemma(Google)[38]。
根据本文讨论的更广泛定义,AI几十年来一直使用简单的基于规则的算法用于诊断。然而,最近,基于ML-DL的方法由于性能提高而开始获得关注。ML-DL表现出潜力的领域是放射学和病理学[39,40]。在放射学中,像CINA-iPE(Avicenna.AI)这样的DL软件在检测肺栓塞方面显示出前景[41]。在病理学中,ML改善了基于DNA甲基化标记的快速患者诊断[42]。脓毒症和心脏骤停预测是一个持续的工作领域[43,44]。虽然这项工作的结果令人鼓舞,但部分由于可解释性、准确性以及发现临床上无关异常(“偶发瘤”)的可能性,目前尚不清楚临床医生应如何应对这些发现[45]。AI工具的使用量正在增加,AI将不可避免地影响临床医生在不久的将来的工作流程。AI还可以支持医院基础设施[46]。
尽管有其潜在益处,AI整合到医疗保健中仍是一个不断发展的领域。对于医疗保健AI来说,法规和指导仍然是一个重要的研究领域,众多国家和国际机构正在制定AI使用的框架和指南[47-49]。仍在辩论中的重要问题包括AI错误的责任(许多机构认为医生最终对临床决策负责)、如何减轻由训练数据中固有偏见传播的医疗保健AI偏见,以及隐私的重要性[6,18,19,50]。此外,许多研究表明,由于患者和医疗保健专业人员缺乏认识和参与,以及任何健康技术固有的后勤实施挑战,将AI整合到工作流程中也可能具有挑战性[51]。
未来方向
AI有望成为人类社会最关键的变革之一,可以说是与工业革命甚至农业革命相媲美。AI将影响人类社会的每一个领域,包括医疗保健。
虽然目前的实现,如LLM、预测模型(如卷积神经网络)以及它们创建的工具(例如,AI抄写员和ChatGPT)具有影响力,但大多数改变社会的工作正致力于创造通用人工智能和超级人工智能。虽然这些术语的确切定义,甚至其可能性,都存在争议[52],但它们通常指的是在广泛领域和任务中与人类一样智能或比人类更智能的AI系统。
在此目标实现过程中,AI对于人类在后通用人工智能社会中的角色将产生影响。虽然存在关于人类失业的严重担忧,但也有创造富足、减少稀缺性以及加速科学发现的潜力[53]。
鉴于其重要性,作者认为临床医生接受关于该主题的结构化教育内容很重要。领导者可以考虑将正式的基础AI教学纳入医学院课程,然后在后续年份提供机会讨论其在医疗保健中的影响和应用。这些课程也可以纳入研究生教育和由工作场所提供的继续医学教育课程中。
致谢
作者声明在研究过程和写作过程中使用了生成式人工智能(GAI)。根据生成式人工智能授权分类法(2025年),以下任务在完全人工监督下委托给了GAI工具:校对;编辑;调整和改编情感基调;以及在特定、有限的文本部分重新格式化句子结构。有时,ChatGPT被用作搜索引擎,以查找相关参考文献的链接,作者进一步审查并确保这些参考文献的准确性。使用的GAI工具是ChatGPT(5.1版;OpenAI)。最终手稿的责任完全由作者承担。GAI工具未被列为作者,也不对最终结果负责。
资金
本研究未从任何公共、商业、非营利或其他实体获得任何外部财政支持或资助。
利益冲突
作者声明无利益冲突。
【全文结束】

