摘要
人工智能融入医学教育和实践既有益处也有风险。这项针对埃及医务人员和学生的全国性网络横断面调查旨在评估他们对人工智能使用的知识、态度和担忧。该研究包括2765名医学生和500名医务人员,平均年龄分别为20.8岁和29.9岁,两组中女性比例均较高。与医务人员相比,医学生对人工智能的知识掌握情况令人满意(p<0.001)。不幸的是,大多数受访者(80.4%的医务人员和81.6%的学生)对人工智能使用持负面态度。在两组中,男性参与者的平均态度得分显著高于女性。知识得分和性别是医务人员对人工智能态度的重要预测因素(p<0.005),而性别是医学生态度得分的重要预测因素(p<0.001)。本研究中,学生的人工智能使用总分高于医务人员,特别是在创意生成方面。与学生相比,医务人员对在医学教育和实践中使用人工智能的总体担忧得分略高。研究结果强调了参与、有针对性的教育和培训、兼容的解决方案、统一标准、指南以及将人工智能顺利融入医学教育和临床实践的必要性。
背景
人工智能(AI)是一种能够分析环境并基于人类智能做出决策以实现特定目标的系统。人工智能已在经济、制造、教育和医疗等多个领域得到应用。在医疗领域,人工智能正在迅速发展,有望彻底改变包括诊断、治疗规划和个性化医疗在内的医疗保健各个方面。医生、学者和临床医生都对人工智能这一医疗保健领域的变革性发展表现出浓厚兴趣。人工智能在医学中的应用预计将对患者护理、医学研究和卫生系统产生重大影响。在医学教育中,人工智能技术如机器学习(ML)、自然语言处理(NLP)和生成式人工智能工具(例如基于GPT的系统)正在改变医学教育的内容和过程。随着技术的不断进步,有必要审视这些发展对医学教育各个方面的所有影响,从招生到课程、教学和评估。除了教育之外,人工智能在公共卫生应用中也展现出巨大潜力,包括利用搜索引擎查询和社交媒体数据检测疾病暴发。值得注意的是,谷歌预测了流感流行,而中国科学院则利用多源信息融合模拟了新冠疫情。尽管取得了这些进展,关于医疗保健中的人工智能仍存在一些误解,包括认为人工智能将取代医生或需要高级编程技能才能使用。实际上,人工智能旨在增强而非取代临床决策,其有效使用需要概念理解而非技术专长。人工智能正变得越来越普及,在医学教育和医学实践中有着许多应用。然而,许多障碍可能阻碍人工智能的实施,也应考虑伦理问题。要充分实现人工智能在医疗保健中的潜力,必须在将人工智能融入医疗保健过程中仔细解决四个主要伦理问题:使用数据的知情同意、安全性和透明度、算法公平性和偏见,以及数据隐私。此外,关于使用人工智能技术的一个主要担忧是数据隐私和安全,以及用户对技术的成瘾。此外,当发达国家在人工智能研究方面投入大量资金时,发展中国家由于成本高昂而在教育和研究中面临人工智能实施的挑战。
在埃及现有文献中,据作者所知,所有埃及研究都探索了单一机构中医学学生对人工智能的相关知识、认知和/或态度,使用相对较小的样本量。因此,先前的研究通常局限于单一机构和单一领域,要么是医学教育,要么是临床医学实践。此外,大多数研究针对医学生,对医务人员的纳入或不同专业群体之间的比较分析相对有限。缺乏同时评估人工智能使用的多个维度的综合性研究。为解决这些差距,本研究旨在评估医学生和医务人员对人工智能的相关知识、使用模式、态度和担忧。通过采用多维度方法并包含不同的参与者群体,本研究提供了对人工智能在教育和临床环境中整合的更全面理解。该研究还采用了具有代表性的全国性方法,大样本量支持了报告数据的有效性和可推广性,构成了其原创性和对文献贡献的关键方面。
方法学
研究设计、持续时间和参与者
这项全国横断面研究涉及埃及医务人员和学生,研究期间从2025年4月1日到2025年9月1日。
所有方法均按照相关指南和规定执行。
样本量
样本量使用以下公式计算:n = Z²P(1-P)/d²,其中n是计算出的样本量,z等于1.96(95%置信区间),d等于0.05,p是假设为50%的人工智能工具正面态度比例。计算出的每组样本量为385名参与者,因此两组的总样本量为770名。
抽样策略
根据医学院的类型(政府、国家或私立)进行了分层。在2024-2025学年,埃及有27所政府医学院、32所国家医学院和20所私立医学院。通过数据收集者向所有目标院校的学生发出参与研究的邀请,采用混合抽样技术。通过所有通信渠道使用方便抽样和滚雪球抽样技术,尽可能接触更多参与者。
研究工具和数据收集过程
在广泛文献综述后,本研究采用的问卷改编自先前已发表的开放获取研究,这些研究已经验证了该工具。问卷由7个部分组成:
第1部分:社会人口学特征:年龄、性别、年级、平均绩点(GPA)、居住地、省和大学类型。
第2部分:人工智能技术知识,包含7个问题,回答为是、否和不确定。正确答案得1分,错误或不知道得0分;最高得分为7分,最低得分为0分。如果达到总分的≥50%,则知识水平被视为满意。
第3部分:对人工智能工具使用的态度,包含10个问题,采用五点李克特量表,其中非常同意得5分,非常不同意得1分,负面句子反向计分,最高得分为50分,最低得分为10分;得分越高,对人工智能使用的积极态度越强。当态度得分≥总分的80%时,视为积极态度。
第4部分:对人工智能工具输出的看法,包含6个问题,采用五点李克特量表,其中非常同意得1分,非常不同意得5分,最高得分为30分,最低得分为6分。得分越高,对人工智能输出的看法越积极。
第5部分:在医学教育和研究中使用人工智能工具的模式,采用五点李克特量表,范围从从不(得1分)到非常频繁(得5分),最高得分为35分,最低得分为7分(得分越高,表示在医学教育和研究中使用人工智能的模式越频繁)。
第6部分:对医学教育中人工智能技术的担忧。
第7部分:对医学实践中人工智能技术的担忧,其中同意得3分,不同意得1分(得分越高,表示担忧越大)。
研究工具的验证
研究工具来自先前已发表并经过验证的研究。将先前单独研究中经过验证的问卷整合到一个工具中,以涵盖本研究旨在探索的所有维度,这些工具在原始研究中由3-4位专家小组进行了验证,对30-40名参与者进行了试点测试,并使用Cronbach's alpha测量了内部一致性。然而,在当前研究中,3位专家(2位公共卫生专家和1职职业健康专家)确认了问卷的表面效度和内容效度。对30名医学生和10名医务人员进行了试点研究,以评估问卷的理解度和清晰度(表面效度)。对工具进行了细微的语言调整,以确保上下文适当性和清晰度。
通过计算Cronbach's alpha测试了问卷的可靠性(内部一致性);知识得分为0.70,态度得分为0.70,人工智能输出观点得分为0.74,人工智能工具使用模式得分为0.80,医学教育中人工智能使用担忧得分为0.75,医学实践中人工智能使用担忧得分为0.73。因此,总体Cronbach's alpha为0.74。
数据收集方法
通过电子邮件、WhatsApp、Facebook和Telegram将问卷的Google表单分享给医务人员和学生。来自Benha医学院的医学生和医务人员,以及数据收集者被指示通过所有社交媒体平台(WhatsApp、Telegram、Instagram、Facebook和Twitter)将问卷的Google表单分发给埃及政府、国家和私立医学院的朋友和医学同事网络。向非回应者发送了三次提醒,间隔一周,以尽可能多地邀请参与者。
结果
本研究包括500名医务人员和2,765名医学生,两组中女性比例均较高。医务人员的平均年龄为29.93岁(SD=8.67),学生的平均年龄为20.82岁(SD=1.98)。大多数参与者都隶属于公立大学。学生中比例最高的是二年级(33.9%)。
研究结果表明,在医务人员中,男性的感知知识平均得分显著高于女性(5.22 vs. 4.83,p=0.012),而在学生中未观察到性别差异。
在医务人员和学生中,男性的平均态度得分均显著高于女性(p<0.001)。大学类型与医务人员的态度得分显著相关(p<0.001),私立大学的态度平均得分最高。感知知识水平与医务人员和学生的态度得分均呈高度显著相关。感知知识水平良好的医务人员和学生表现出更积极的态度得分(p<0.001),而感知知识水平较差的则不然。年龄、居住地和国籍与任一组的知识或态度得分均无显著相关性。总体而言,57.6%的医务人员和69.5%的学生获得了良好的知识得分(>50%),而只有19.6%的医务人员和18.4%的学生对人工智能使用表现出积极态度(≥80%)。与医务人员(57.6%)相比,更高比例的医学生具有良好的感知知识(69.5%)。
进行了多元线性回归分析,以确定医务人员和学生知识得分的预测因素。医务人员的整体模型具有统计学意义(F=2.212,p=0.025),但仅解释了知识得分1.9%的方差(调整后R²=0.019)。年龄和性别成为独立预测因素,年轻的医务人员知识得分显著更高(B=-0.020,95%CI:-0.040至-0.001,p=0.037),而女性医务人员的知识得分显著低于男性(B=-0.372,95%CI:-0.692至-0.052,p=0.023)。另一方面,医学生知识得分的整体模型无统计学意义(p=0.636)。然而,鉴于模型解释力非常有限,这种关联应谨慎解释,因为它不太可能具有实际意义。
进行了多元线性回归分析,以检查与医务人员态度得分相关的因素。该模型达到统计学显著性(F=8.960,p<0.001),并显示出适度的解释力(调整后R²=0.126)。性别、私立大学以及对医学教育、研究和医学实践的担忧得分成为显著的独立预测因素,因为女性医务人员的态度得分低于男性(B=-2.078,95%CI:-3.036至-1.120,p<0.001),私立大学的医务人员态度得分更高(B=4.738,95%CI:2.105至7.371,p<0.001),对医学教育的担忧得分更高是态度得分高的显著预测因素(B=0.388,95%CI:0.227至0.549,p<0.001)。同时,对医学实践的担忧得分较低是医务人员态度得分较高的显著预测因素(B=-0.181,95%CI:-0.354至-0.008,p=0.040)。在医学生中,进行了多元线性回归分析以确定态度得分的预测因素。该模型具有统计学显著性(F=14.666,p<0.001),但仅解释了4.8%的方差(调整后R²=0.048)。性别和对医学教育、研究的担忧得分是显著的预测因素,因为女性医学生的态度得分低于男性(B=-1.170,95%CI:-1.570至-0.770,p<0.001),对医学教育、研究的担忧得分更高是态度得分高的显著预测因素(B=0.291,95%CI:0.216至0.366,p<0.001)。然而,鉴于模型的解释力有限,这些发现也应谨慎解释。
研究人群中对人工智能工具输出的看法
所有平均得分在2.06至2.55之间,更接近"同意"而非"不同意"。最高平均分是"人工智能工具可能在输出中表现出偏见和不公平"。最低平均分是"人工智能工具在处理复杂任务方面存在局限性"。在所有项目中,医务人员表现出略为负面的看法,这反映在他们较低的平均得分上。在四个项目中观察到医务人员和学生之间的统计学显著差异:处理复杂任务的局限性(p<0.001)、事实不准确的输出(p=0.002)、脱离语境或不适当的输出(p=0.001)以及偏见/不公平性(p=0.002)。
医学生和研究中人工智能使用的模式
在本研究中,医学生在量表的所有项目中使用率均显著高于医务人员(p<0.001)。医学生报告的最频繁使用模式(评为"非常频繁"或"频繁")是创意生成和头脑风暴(30.7%),其次是用于拼写和语法检查(29.9%),然后是为考试、演示或作业做准备(29%)。报告最少的模式是使用人工智能工具完成作业或研究并直接提交输出而不做修改(18.1%)。
对医学教育、研究和医学实践中使用人工智能的担忧
在3点量表上(1=不同意,3=同意),大多数平均得分在2.16至2.55之间,表明对列出的担忧有中等程度的同意。对于教育担忧,医务人员表达的担忧显著高于学生,这反映在他们更高的平均得分上,即使用人工智能完成作业/研究会削弱大学教育的价值(p=0.023),以及人工智能可能引入偏见和公平问题(p=0.003)。对于医学实践担忧,医务人员对人工智能贬低医学专业(p=0.003)和可能影响医疗公平性(p=0.029)的担忧显著高于学生。大多数其他项目在两组之间没有显著差异。
值得注意的是,两组都报告了对隐私侵犯、人工智能偏见和不准确性以及技术故障风险的高水平担忧,反映了对医疗保健系统中人工智能部署潜在风险的广泛认识。大多数项目缺乏显著差异表明,对人工智能在伦理、技术和关系方面影响的担忧在经验水平上是普遍存在的。
讨论
人工智能的影响已大幅扩展,注定成为未来医学世界的重要支柱。这项全国横断面研究代表了在埃及进行的规模最大的研究,旨在评估埃及医务人员和学生对人工智能使用的知识、态度和担忧,也是继Abokresha等人(2025年)在Sohag大学进行的研究之后,第二项比较医学生与教师员工的研究。
研究人群中社会人口学特征与人工智能知识和态度的关系
当前研究表明,与医务人员(57.6%)相比,更大比例的学生(69.5%)报告了良好的感知知识,两组之间存在高度统计学显著差异(p<0.001)。这与Kansal等人的研究结果一致。这些发现可能归因于年轻一代对数字技术的更多接触和对在线资源的积极参与,而医务人员可能没有足够时间在其临床和学术职责之外探索新技术,而且一些人可能面临适应快速发展的数字工具的挑战。在同一背景下,男性医务人员报告的感知知识得分显著高于女性(5.22 vs. 4.83,p=0.012)。这与Serbaya等人(2024年)的研究结果不一致,在沙特阿拉伯私立诊所的医护人员中,男女在人工智能知识平均得分方面没有显著差异。医务人员之间的这种差异可能归因于获取或参与技术、专业角色或自我报告知识信心方面的差异。
关于态度,本研究发现医学生和医务人员的平均态度得分几乎相等(35.13±5.04 vs. 35.29±5.29),这与Kansal等人(2022年)的研究结果相反,后者发现对人工智能持负面态度的医生比例高于医学生。两组中,男性的态度得分均显著高于女性,这与Heinrichs等人的研究结果一致。
感知知识得分良好的医务人员和学生表现出显著更高的态度得分。尽管存在这些差异,但大多数参与者(80.4%的医务人员和81.6%的医学生)对人工智能持负面态度。本研究结果与Khater等人的研究结果一致。感知知识得分和性别是医务人员对人工智能态度的重要预测因素,而性别是医学生态度得分的重要预测因素,这与Allam等人(2024年)的研究以及Khan Rony等人的研究结果一致。
研究人群中对人工智能工具输出的看法
本研究中最常报告的担忧是人工智能处理复杂任务的能力有限(74%的医务人员和66.1%的学生),其次是有限的情感智能和同理心担忧(69.4%和63.8%),这与Chan & Hu(2023年)的研究结果一致。然而,在Al-Kahtani等人(2025年)的研究中,90.8%的健康专业人员和93.9%的健康学生同意人工智能输出的可靠性和准确性是影响人工智能采用的最关键因素。
医务人员一致报告认为人工智能在处理复杂任务、产生不准确或脱离语境的输出以及显示偏见方面可能存在问题,这反映了他们更多的临床经验和在准确性、公平性和情境理解至关重要的决策中的第一手经验。总体而言,这些差异表明临床经验增强了对特定人工智能风险的认识,而学生则表现出更广泛但基于经验较少的担忧。然而,软件开发和新的生成式人工智能解决方案的最新进展旨在解决医疗和医学实践中的事实核查问题,以及克服静态训练数据的限制和大型语言模型中经常出现的幻觉问题。TrumorGPT集成了基于图的检索增强生成(GraphRAG),GraphRAG涉及使用和访问频繁更新的语义健康知识图,包括最新的健康和医疗新闻,确保TrumorGPT的事实核查基于最新数据。
因此,建议为研究中的医务人员和学生提供基于最新医学证据的人工智能应用结构化教育和培训。
人工智能工具的使用模式
本研究表明,约三分之一的医学生主要将人工智能用于创意生成、校对和学术准备,用于研究和职业指导的使用较少,18.1%报告了潜在的问题使用,平均使用得分为19.89。与其他研究相比,本科生中人工智能用于学习的使用率最高(64.4%),而约旦健康专业学生主要将人工智能用于语法检查和研究,用于职业建议和考试准备的使用较少,中位实践得分为21/35。
本研究中的总人工智能使用得分在学生中显著高于医务人员,这些发现与Varshney等人的研究结果一致。学生更高的AI使用模式可归因于他们的学术工作量更重、数字适应能力更强,以及更依赖快速和可访问的资源来支持学习。
一个值得注意的发现是,承认使用AI生成的工作不做进一步编辑的学生比例显著更高,这表明可能存在过度依赖的风险,可能会损害原创性、学术诚信和批判性思维发展。学生中显著更高的总平均使用得分进一步强化了AI在学术环境中的影响力比临床实践更强。
研究参与者对将AI整合到教育和研究环境中的担忧
医务人员最突出的问题是与AI相关的抄袭和数据伪造(59.2%),其次是隐私和科学数据安全担忧(58.6%),以及对AI偏见和公平性的担忧(57.8%)。与AlZahrani等人(2025年)相比,最常报告的担忧是AI技术的准确性和可靠性(21.2%),其次是过度依赖技术的担忧(20.5%)和数据隐私及安全相关问题(20.0%)。
医学生主要关注隐私和作弊,其次是抄袭、社交互动减少、职业影响、技能发展、可靠性和偏见问题,以及可能贬低大学教育的价值。而在Wobo等人的研究中,AI最常报告的限制是伦理问题,其次是缺乏人际互动和技术过度依赖。
Mehrabi等人强调了在评估过程中使用AI相关的重要的伦理问题。Fischer等人指出,学生可能试图将AI生成的答案作为自己的答案提交。Williams指出,许多具有不同学术规范和伦理期望的国际学生可能不完全理解什么是学术不端行为。
在本研究中,医务人员对在医学教育和研究中使用AI的总担忧得分略高于学生,差异接近显著性(p=0.055),这与Abokresha等人的研究结果一致。
尽管在统计上不显著,但这种模式表明教育工作者可能需要更多的保证、指导和结构化政策框架,以自信地采用AI支持的实践,并强调需要机构政策和培训计划,不仅要规范AI使用,还要在创新与学术诚信和技能发展之间取得平衡。
研究参与者对在医学实践中使用AI的担忧
医务人员更有可能相信AI贬低了医学专业,并可能损害医疗保健获取的公平性。相比之下,仍在形成其专业身份的学生在这些领域表达了略低的担忧。
多项研究强调了医疗保健提供者对AI使用的重大担忧。在Alsaedi等人的研究中,主要担忧是工作替代,其次是担心AI可能证明人员减少的合理性。Abdelwanis等人确定数据隐私是最常报告的问题,并强调了可能对医患互动造成的潜在危害。同样,Akudjedu等人注意到对护理中人类方面丧失以及信任和融洽关系减弱的担忧。Sangers等人报告了诸如准确性担忧、临床判断整合有限、缺乏透明度以及有偏见的数据可能导致健康差异的风险,以及对角色替代的担忧。Quinn等人警告过度依赖AI会增加对技术故障和网络攻击的脆弱性。此外,Mache等人提出了对数据质量、算法偏见以及AI相关错误责任的担忧。
研究结果表明,医务人员和学生都对医疗保健中AI整合存在重要的伦理和公平相关担忧。在本研究中,59.8%的医务人员担心AI系统无法做出道德判断或考虑临床决策的道德和社会维度,这一担忧得到了Farhud等人的支持,他们强调了在AI辅助护理中可能丧失同理心和人类同情心的风险。同样,学生也报告了显著的伦理担忧,正如Jackson等人所强调的,反映了对医学中AI使用的道德影响的共同焦虑。关于公平和可负担性的担忧在两组中也很普遍。超过一半的医务人员(58.4%)担心AI相关成本——特别是在个人医疗设备方面——可能限制公平获取护理,这与Eltorai等人的研究结果一致。同样,Al-Qerem等人报告的约旦学生担心昂贵的AI工具可能会扩大医疗保健和教育中的差距。此外,Khater等人发现学生既认识到AI的好处,也认识到挑战,表现出平衡但谨慎的态度。
本研究结果表明,工作人员和学生实际使用AI与医学教育机构控制该使用的准备之间存在重大、基于证据的差距。人员关注长期职业和社会后果,而学生更关注完成课程。担忧得分的接近显著差异(p=0.055)不应被忽视,应通过联合学生-工作人员委员会让学生成为制定政策变化的一部分,以起草AI指南,否则将被忽视或规避。这些发现提出了几个明确的高优先级研究问题,必须超越AI使用模式和担忧的普遍性,以了解过度依赖的认知和专业后果,并评估在医学生和工作人员中保留批判性思维同时利用AI优势的干预措施。
研究的优势和局限性
该研究可能存在一些局限性;首先,横断面设计排除了在知识、态度和担忧之间建立因果关系。其次,使用方便抽样和滚雪球抽样技术可能会引入选择偏差并限制可推广性。
尽管存在这些局限性,该研究展示了几个显著优势,如及时性和相关性:人工智能正在迅速发展,这项全国性快照捕捉了变革时期当前的认知、态度和伦理担忧,并为未来的纵向研究提供了全面的基线数据。此外,大样本量和研究的全国性增强了代表性,反映了学术环境中的更广泛多样性,并加强了国内的可推广性。而且,医务人员和学生的参与提供了多级学术视角,而非单一群体观点。
结论
研究显示,医务人员和学生中普遍存在着负面态度。满意的知识感知是积极态度的有力预测因素。学生报告了在医学教育中显著更高的人工智能使用率;然而,他们存在错误的使用模式。医务人员表达了对在医学教育中使用人工智能的更强担忧;两组都表达了对在医学实践中使用人工智能的担忧;然而,医务人员明显更担忧人工智能使用会贬低医学专业,以及医疗服务提供中的公平性。
本研究结果突显了通过以下步骤对医学教育和实践采取综合方法的迫切需要:
- 通过研讨会、真实案例研究、结构化的人工智能素养计划和继续专业发展活动,提高对人工智能基于证据的益处和风险的认识。
- 将结构化的人工智能教育纳入医学课程。
- 解决伦理和法律问题,制定明确的机构指南和标准。
- 促进跨学科合作。
- 建议进一步研究医学领域中与人工智能相关的风险以及如何应对这些风险。
通过解决这些问题,医务人员和学生可以从人工智能技术中受益,确保人工智能技术能够增强而非复杂化医学教育和临床实践。
统计分析
收集的数据经过清理和编码,然后使用SPSS 25版软件(SpssInc, Chicago, ILL Company)进行制表和分析。分类数据以数字和百分比表示,而定量数据则以平均值±标准差(SD)表示。使用卡方检验(χ²)分析分类变量。Z检验(Z)用于两个比例。通过直方图和正态Q-Q图的视觉检查测试连续数据的正态性。使用独立t检验(t)分析两个独立组之间的正态变量,而使用方差分析(ANOVA)分析两个以上独立组。通过Pearson相关系数(r)评估参数相关性。进行多元线性回归分析以确定知识和态度得分的独立预测因素。检查并满足线性、正态性、残差独立性和无多重共线性(VIF<5)的假设。对医务人员和学生的知识和态度得分进行了多元线性回归分析。所有自变量均基于其理论相关性包含在回归分析中。基于理论相关性将担忧得分包含在内。报告了完整的模型,包括非标准化B系数、标准误、95%置信区间、p值、整体模型拟合(调整后R²)和F统计量,以表示解释方差。本工作中的可接受显著性水平设定为0.05(p≤0.05被视为显著)。
【全文结束】

