医学院入学AI生成的多站迷你面试题目:心理测量学评估JMIR Medical Education - AI-Generated Multiple Mini Interview (MMI) Stations for Medical School Admissions: Psychometric Evaluation

环球医讯 / AI与医疗健康来源:mededu.jmir.org澳大利亚 - 英语2026-07-26 22:48:57 - 阅读时长20分钟 - 9773字
本文首次在真实世界医学院入学环境中对AI生成的多站迷你面试(MMI)题目进行了心理测量学评估,分析了2025年Monash大学入学周期中56个MMI题目(17个AI生成,39个传统开发),通过克朗巴哈α系数评估信度,通过分数标准差和范围评估区分能力。结果显示AI生成题目(平均α=0.82)与传统题目(平均α=0.81)具有相当的内部一致性信度,AI生成题目中更优比例达到最优信度水平(41.2% vs 33.3%),需审查比例更低(5.9% vs 12.8%)。研究证实AI可作为MMI题目开发的有效工具,提供可扩展方法减轻教师资源负担,同时保持心理测量学质量,这对解决传统MMI题目开发资源密集且易受人为因素影响的问题具有重要意义,但强调了持续质量保证对确保公平性和有效性的必要性。
医学院入学多站迷你面试(MMI)AI生成面试题心理测量学评估医学教育医学教育创新
医学院入学AI生成的多站迷你面试题目:心理测量学评估

摘要

背景: 多站迷你面试(MMIs)在医学院入学中被广泛使用,以结构化和可靠的方式评估申请人的非学术特质。然而,高质量MMI题目的开发资源密集且依赖专家输入。

目的: 本研究探讨了人工智能(AI)在Monash医学院国内申请人直接和研究生入学医学项目入学流程中生成MMI题目的实用性。据我们所知,本研究代表了在真实世界医学院入学环境中首次对AI生成的MMI题目进行实证评估。

方法: 评估了2025年入学周期的56个MMI题目,包括17个(30.4%)AI生成和39个(69.6%)传统开发的题目,在824名国内申请人中进行了总计4897次申请人-题目互动。我们通过信度(使用克朗巴哈α系数检查内部一致性)和区分能力(使用分数的标准差和范围)在题目级别评估题目质量。

结果: AI生成的题目表现出略高的信度(α=0.82),与传统题目(α=0.81)相比,但这种差异在统计上不显著(P=.91)。AI生成和传统开发的题目都表现出可变的区分能力,每种开发方法的一些题目都展示了高信度和强区分能力的优秀组合,而其他题目则表现出天花板效应,限制了它们的区分能力。值得注意的是,更大比例的AI生成题目被归类为最优(α>0.85),而被归类为需审查类别(α<0.75)的比例较小,与传统题目相比。这些结果表明,AI生成的题目可以达到与传统开发题目相当的心理测量学表现。

结论: 我们的研究结果突显了AI作为MMI题目生成的有用工具的价值,提供了一种可扩展的方法,可能减少教师的资源负担,同时为申请人保持或提高心理测量学质量。持续的质量保证和评估对于确保整个入学过程的公平性和有效性仍然至关重要。

JMIR Med Educ 2026;12:e86208

doi:10.2196/86208

关键词

人工智能(2623);AI(930);医学院入学(1);医学教育(696);多站迷你面试(2);MMI(1);评估信度(1);教育技术(55);生成式人工智能(111);生成式AI(110);心理测量学评估(8);医学教育创新(1)

引言

医学院入学正在适应不断变化的医疗保健环境需求。随着竞争加剧和对预测专业能力及患者护理质量的非学术特质日益重视,新工具正在重塑候选人选拔方式。多站迷你面试(MMI)格式已在医学院入学中被广泛采用,能够评估一系列非学术技能,如沟通、伦理推理、团队合作和同理心。

尽管MMI被广泛采用,但高质量MMI题目的开发仍然具有挑战性。对有限名额的激烈竞争需要大量且不断更新的MMI题目池,以维持测试安全性和确保对所有申请人的公平性。通过传统方法开发和更新这一题库既耗费资源,又给教师带来相当大的负担,而在多位贡献者之间匆忙或不一致的开发可能会损害题目质量和可靠性。

人工智能(AI)为这些挑战提供了潜在解决方案,通过简化题目开发和支持创建更可靠和可扩展的评估工具池。先前研究表明,AI可以生成具有可接受质量或心理测量学属性的评估项目或场景。然而,迄今为止,没有已发表的研究系统评估AI生成的MMI题目在真实世界入学环境中的有效性。

在本研究中,我们对17个新MMI题目(使用AI辅助生成)和39个现有MMI题目(从非AI来源开发)进行了全面的信度分析,这些题目用于2025年入学周期Monash大学国内学生直接入学和研究生入学医学项目的选拔过程。使用克朗巴哈α评估内部一致性,使用分数标准差以及范围评估区分能力,我们的分析旨在探索单个题目的信度和整体质量,揭示AI生成和传统题目之间性能的差异,并确定需要修改、替换或作为未来开发模型的题目。这些见解可用于指导MMI设计的循证改进和AI在医学入学中的整合。

方法

研究设计

本研究分析了2025年入学周期中用于Monash大学国内申请人直接入学和研究生入学医学项目的56个MMI题目。56个题目分为两类:(1)AI生成题目(n=17, 30.4%),(2)现有或传统题目(n=39, 69.6%)。每个题目被映射到7个MMI领域之一:倡导、合作、批判性思维、同理心、伦理推理、动机和韧性。这些领域映射到成功申请人所需的理想品质,并用于指导题目的焦点。它们不是MMI中统计确定的离散构念。

传统MMI题目是先前在入学中使用并通过既定的教师主导流程开发的现有场景。AI生成的MMI题目是使用Claude 3.5 Sonnet (Anthropic)开发的,这是一个专有的闭源AI平台。选择Claude用于本研究主要是因为其当时的数据隐私政策,该政策规定用户输入不会被保留或用于模型训练。鉴于考试材料包含在提示中,这为保护评估内容和机构数据提供了额外保障。

AI平台提供了以下用户生成的提示:

"请基于提供的文档生成一个面试。这些面试针对申请医学院的高中生,测试学生的批判性思维能力。面试结构应包含申请者场景的单个段落、面试官场景关键组件的单个段落以及5个问题,并附有优秀回答的要点。"

我们设计此提示以引发现实、情境适当且与医学入学评估相关的具体内容,并指导AI生成完整的场景、相关面试问题和示例候选人回答。

为确保内容有效性、相关性和与评估目标的一致性,所有AI生成的场景都经过了结构化的质量保证流程。一个由澳大利亚和马来西亚校区招生相关的学术工作人员组成的工作组参与了这一过程。每个场景由该工作组中两名具有医学教育和入学专业知识的教师成员独立审查。审查员评估了与预期能力领域的对齐性、场景的清晰度以及潜在的偏见或模糊来源。这些审查的反馈通过提示和题目内容的迭代完善被纳入。最终批准取决于两名高级学术主管的共同决定,提供了额外的监督和质量控制层。虽然此流程缓解了AI生成内容固有的一些风险,但它并未消除与专有大型语言模型相关的潜在偏见,这些模型对训练数据和内部参数缺乏透明度。

数据收集

数据来自2024年9月至2025年1月进行的MMI,涉及824名国内申请人,共产生4897次申请人-题目互动。申请人被随机分配到56个可用题目的子集,这些题目分布在多个面试日。每个MMI题目在20分制上评分,由5个问题组成,每个问题评分从0到4分。

共有252名面试官参与了面试流程,涵盖直接和研究生入学招生。所有面试官在MMI周期前完成了标准化培训。面试官来自包括医疗专业人员、学者、社区代表,偶尔还包括高年级学生或近期毕业生在内的各种背景。面试官通过表达兴趣流程招募,并对资格和潜在利益冲突进行筛选。培训包括通过预备材料和现场研讨会对MMI流程、评分框架和面试官责任进行介绍。在每个面试日,面试官还参加与分配到同一题目的其他评估者进行的题目特定校准会议,以促进对评分标准的一致解释。

每位候选人在每个MMI题目中由一名经过培训的面试官评估。每个题目在面试会话中分配了多名面试官,每个题目的面试官数量从2到17名不等,取决于每个题目的候选人数量。由于每次表现由一名面试官评分,本分析未检查面试官间信度和面试官方差。为减轻申请人间内容传播的风险,不同题目安排在不同天。

信度分析

为评估单个MMI题目的信度,我们使用2025年入学周期的申请人响应为每个题目计算克朗巴哈α系数。克朗巴哈α系数范围从0到1,是内部一致性的度量;它反映了评估中的项目在多大程度上测量相同的潜在构念或一组相关能力。在5项MMI题目的背景下,较高的α值表示评分问题之间更大的一致性,而较低的值可能表明项目错位、评分不一致或其他测量误差来源。由于α是在本研究中每个题目内计算的,它反映了该题目的评分量表的信度,而非整体MMI决策的信度。

克朗巴哈α系数用于评估信度的分类仍然是一个有争议的问题,许多专家同意阈值应由评估的目的和重要性决定。正如Downing所述,高风险评估,如医学中的执照或认证考试(对候选人和公众都有重大后果),通常预期展示0.90或以上的可靠性系数。对于中等风险的评估,如医学院的主要总结性考试,通常认为0.80至0.89的最小可靠性阈值是可接受的。低风险评估,包括形成性评估或教学中使用的内部开发测试,可能需要0.70至0.79范围内的可靠性。

医学院入学流程通常被视为中等到高风险评估,鉴于它们对申请人未来职业的重大影响以及选择适合承担重大社会后果职业的候选人的责任。然而,MMI格式中的题目级可靠性估计也必须结合用于评分每个题目的短评分量表(5个项目)和单个题目中评估的能力的多维性质来解释。

根据此框架,我们将本研究中的题目分为3个保守的可靠性组。这些类别用于支持描述性比较和结构化质量保证,而非作为题目可用性的二元标准。在此背景下,最优和可接受都满足预期可靠性,而审查表示题目需要进一步检查。

区分能力分析

除了信度外,我们还通过区分能力评估题目质量,这通过每个题目的平均分数、标准差和观察到的分数范围来衡量。区分能力指题目在评分谱上区分不同能力水平候选人的能力。具有足够区分能力的题目展示较高的标准差和更广泛的分数范围,表明它们能有效区分高表现候选人和低表现候选人。相反,区分能力差的题目表现出低标准差或受限的分数范围,通常由于天花板效应(大多数候选人接近最高分)或地板效应(大多数候选人接近最低分)。这种受限的分数分布限制了题目的选拔决策效用,因为无论候选人实际能力水平如何,它们都无法提供有意义的区分。虽然信度确保测量一致性,但区分能力决定该一致测量是否为区分候选人表现提供有用信息。

信度和区分指标被分析为不同的心理测量属性,但在适当情况下一起报告,以支持题目质量的综合评估。

统计分析

所有统计分析均使用R(版本4.5.1;R统计计算基金会)进行,主要使用psych包进行信度分析(Revelle,2025;版本2.5.6)。图表使用GraphPad Prism(版本10.4.1;Dotmatics)生成。

伦理考虑

本研究在标准医学院入学流程的背景下进行,并与常规质量保证和项目评估活动保持一致。伦理批准由Monash大学人类研究伦理委员会(49569)获得。所有申请人数据在分析前完全匿名化,以保护参与者机密性。由于本研究涉及去识别行政数据的二次使用,不需要申请人额外同意。

结果

概述

表2展示了使用克朗巴哈α系数评估的内部一致性信度以及56个MMI题目的平均分数,包括标准差和范围。以下小节概述了在题目类型和领域中观察到的关键模式和比较。

AI生成和传统题目的总体信度

我们进行了Mann-Whitney U检验,比较AI生成和传统开发的MMI题目的内部一致性信度。平均而言,AI生成的题目表现出略高的克朗巴哈α值(平均α=0.82,SD 0.06),而现有题目(平均α=0.81,SD 0.09)。然而,这种差异既无统计学显著性(U=325;z=–0.116;r=−0.015;P=.91),在实际意义上也不够大。这些发现表明,虽然AI生成的题目可能显示出略高的信度指标,但两种题目类型的内部一致性总体水平相当。

当将题目分类为审查、可接受或最优可靠性组时,AI生成的题目显示出略高比例达到最优可靠性,41.2%(7/17;95% CI 22%-64%)的AI生成题目达到这一阈值,而传统开发的题目为33.3%(13/39;95% CI 21%-49%)。此外,AI生成题目中处于审查类别的比例为5.9%(1/17;95% CI 1%-27%),低于传统开发题目的12.8%(5/39;95% CI 6%-27%)。大多数现有和AI生成的题目表现出可接受的可靠性,占传统开发题目的53.8%(21/39;95% CI 39%-68%)和AI生成题目的52.9%(9/17;95% CI 31%-74%)。然而,置信区间宽且在类别间显著重叠,表明这些比例差异应谨慎解释。

为评估小样本量对题目分类的影响,我们进行了敏感性分析,排除了少于50名参与者的题目。当限制在n≥50的题目时,AI生成和传统开发题目之间的内部一致性仍无显著差异(P=.89)。可靠性类别的分布与各组相似,AI生成题目中41%(7/17)和传统开发题目中37%(33/39)被归类为最优,53%(9/17)和54%(21/39)被归类为可接受,6%(1/17)和13%(5/39)被归类为审查。这些发现表明,完整数据集中观察到的基于类别的差异对小N题目的纳入敏感。除非另有说明,所有后续分析均使用完整数据集进行。

为解决潜在的混杂因素并确保明显差异不是由于AI生成题目在MMI领域中分布不均造成的,我们进行了线性回归分析。该分析评估了题目类型与克朗巴哈α之间的关联,同时控制MMI领域,本质上询问如果两种题目类型在所有领域中均等代表,AI生成题目是否仍会显示不同的可靠性。尽管克朗巴哈α在0和1之间有界,但本数据集中的观察值未集中在边界附近(范围0.39-0.93)。因此,线性回归被认为适用于估计α中调整后的平均差异。分析显示,题目类型不是可靠性的显著预测因子(β=−0.003;P=.90),表明观察到的AI生成题目的轻微优势并非归因于题目开发方法的系统性差异。还拟合了beta回归模型作为敏感性分析;这得出了相同的实质性推断(P=.77)。

回归分析还检查了某些领域是否本质上更难开发可靠题目,这可能解释了明显的题目类型差异,如果AI生成题目集中在自然高可靠性领域。然而,领域之间未观察到可靠性显著差异(所有P>.10),表明批判性思维、同理心、倡导和其他领域无论题目类型都表现出相似的可靠性水平。

最后,我们进行了交互模型测试,以确定AI生成题目是否可能与传统题目相比在特定领域有优势或劣势;例如,AI是否擅长生成批判性思维题目但在同理心场景中表现不佳。此分析未发现显著交互作用(所有P>.48),证明题目类型与可靠性之间的关系在所有MMI领域中保持一致。

总体而言,这些分析表明,虽然AI生成题目在多个指标上显示出略高的描述性可靠性指标,但这些差异在统计上不显著。研究结果表明,AI生成的题目开发产生与传统教师主导开发方法相当的可靠性结果,在不同MMI领域中表现保持一致。

题目质量分析:信度和区分能力

对单个题目表现的分析显示,AI生成和传统开发的题目在信度和区分特征方面都存在显著差异。一些题目表现出卓越的信度,克朗巴哈α值超过0.90。值得注意的是,EMP_17(α=0.90),一个AI生成的题目,和EMP_6(α=0.93),一个传统开发的题目,表现出最高的内部一致性。此外,EMP_17(平均13.8,标准差3.9;范围2-20)和EMP_6(平均14.2,标准差4.5;范围3-20)题目都展示了出色的区分能力。其他展示这种高信度和强区分能力理想组合的题目包括ADV_18(α=0.8925;平均12.6,标准差4.1)和ER_6.1(α=0.88;平均14.2,标准差4.0)。这些题目可作为未来MMI题目开发的典范。它们的结构特点是有清晰专注的提示以及明确定义的评估标准,有助于不同评估者之间的一致评估。这些题目的高信度和区分能力表明它们在稳健和可重复的方式中有效激发和测量目标能力。

相反,一些具有可接受信度的题目显示出有限的区分能力。例如,ADV_21(α=.75;平均分17.3,标准差2.3)和MOT_12(α=.79;平均分17.6,标准差2.1)表现出天花板效应,大多数候选人得分在量表的上限范围内,限制了它们区分高表现候选人的能力。虽然这些题目表现出合理的信度,但它们受限的分数分布表明它们可能太容易或缺乏足够的挑战,无法有效区分不同能力水平的候选人。

值得注意的是,传统开发的题目COLL_14在两个指标上表现不佳,克朗巴哈α为0.3925,远低于可接受阈值,区分能力差(平均17.3,标准差1.6;范围15-20),分数集中在最高可能分数附近。尽管该题目的样本量有限(18/824,2%),但信度低和分数范围严重受限的组合表明题目设计或实施存在根本问题,需要彻底修改或替换。

相比之下,表现最差的AI生成题目ER_26显示亚最优信度,克朗巴哈α为0.6876,但保持合理的区分能力(平均15.8,标准差2.7;范围8-20),表明虽然该题目需要完善内部一致性,但它在评分范围内保持足够的区分功能。

应指出,题目ADV_21、MOT_12和COLL_14的候选人响应少于50个,这可能导致不太稳定的可靠性估计。因此,这些题目的题目级克朗巴哈α值应谨慎解释。尽管如此,综合来看,这些结果表明,AI生成和传统开发方法都能够产生跨越心理测量学质量全谱的题目,从在信度和区分能力方面表现出色的典范题目到需要修改或替换的问题题目。研究结果表明,题目效果主要取决于个体设计特征和实施,而非所使用的开发方法。

讨论

主要发现

本研究比较了在高风险医学院入学过程中使用的AI生成和传统开发的MMI题目的心理测量学表现。AI生成的题目表现出与传统题目相当的内部一致性信度,克朗巴哈α无统计学显著差异。更大比例的AI生成题目被归类为内部一致性最优,而较少落入审查类别。两种题目类型都表现出可变的区分能力,表明整体题目质量取决于个体设计特征而非开发方法。综合来看,这些发现支持AI生成和传统开发的MMI题目之间的心理测量学等效性,而非优势证据。

AI在医学院入学中使用的启示

医学教育中的人工智能应用在各个领域都显示出有希望的结果,包括临床考试的自动评分、医学课程开发的自然语言处理以及医学执照考试的多项选择题生成。同样,AI已越来越多地集成到专业课程的入学流程中,应用范围从标准化测试中的自动作文评分到学生成功的预测建模。

本研究扩展了这一新兴研究领域,证明AI可以为高风险医学院选拔流程产生心理测量学上合理的评估内容。与现有文献不同,现有文献主要关注AI用于预测或自动评分申请人表现,本研究检查了AI用于内容生成,特别是MMI题目的开发。

我们的结果显示,AI生成的题目与传统开发的题目相比表现出相当的内部一致性(平均α=0.82,标准差0.06 vs 平均α=0.81,标准差0.09;P=.91)。值得注意的是,更大比例的AI生成题目被归类为最优(α≥0.85),而较少被归类为审查类别(α<0.75)。然而,这一结果仅仅是描述性的,应谨慎解释。这些比例周围的置信区间宽且显著重叠,反映了题目的小数量,表明明显差异在统计上或实际上不稳健。尽管如此,这些发现突显了将AI整合到入学流程中的潜在价值,并为检查此类工具如何进一步优化和整合到未来选择框架中提供了基础。

我们的研究结果与关于AI生成评估内容的更广泛研究一致,这些研究一直表明,AI生成项目质量更取决于人类输入,包括提示工程、内容验证流程和生成后完善,而非AI系统本身。比较教育环境中AI生成和人类开发测试项目的研究所同样发现,当实施适当的质保措施时,心理测量学属性相当。这表明AI生成和传统MMI题目中观察到的可变性反映了评估开发中的基本挑战,而非特定于任一方法的局限性。

区分能力分析显示,AI生成和传统开发的题目在区分不同能力水平候选人的能力方面都表现出可变的性能。每种开发方法的一些题目都展示了高信度和强区分能力的优秀组合,包括AI生成的题目EMP_17和传统开发的题目EMP_6。相反,两种方法的其他题目展示了可接受的信度但有限的区分能力,这是由于天花板效应,大多数候选人在量表的上限范围内得分。这种可变性表明,题目效果主要取决于个体设计特征和实施质量,而非开发方法。

综合来看,这些发现强调,虽然AI生成的MMI开发过程显示出巨大的潜力,但它应被视为更广泛的基于证据的入学评估框架中的补充工具,而非专家监督和持续质量保证的替代品。我们观察到两种开发方法都能产生跨越心理测量学质量全谱的题目,这强调了持续审查、校准和改进的必要性,以确保所有题目,无论其来源如何,都符合公平有效候选人评估所需的严格标准。

本分析的一个显著限制是某些题目的小样本量(n<50),特别是对于一些新的AI生成题目。较小的样本量可能导致不太稳定的可靠性估计,需要在分析特定题目的表现时谨慎解释个别题目级克朗巴哈α值。尽管排除小样本量(n<50)题目的敏感性分析减弱了基于类别的差异,但未来的可靠性评估应争取每个题目n≥50的最小样本量,以确保更稳健和稳定的估计。

尽管如此,当考虑到整体MMI题目开发过程时,这些发现的影响尤为显著,该过程传统上耗时、资源密集且依赖大量教师输入。设计高质量题目不仅需要内容专业知识,还需要对公平性、清晰度和与评估目标的一致性给予仔细关注;这些因素可能引入可变性和潜在偏见。AI生成题目与传统开发题目相比表现相当,甚至在某些情况下信度更高、区分能力更好的事实表明,AI可能为生成高质量评估场景提供可扩展和高效的替代方案。通过简化开发过程并减少对个人判断的依赖,AI有可能支持MMI设计的效率和公平性,同时保持评估的心理测量学稳健性。未来研究应通过前瞻性、多机构研究和更大样本量,正式评估AI生成题目在信度、有效性和公平性方面是否真正不劣于传统题目。

在未来基于MMI的入学过程中使用AI的建议

在本研究中,我们确定了几个可操作的策略,以使用AI实现MMI题目开发的质量和一致性。基于AI生成和传统开发题目中观察到的可靠性数据,以下建议旨在指导未来MMI设计和实施的改进。

支持继续使用AI生成题目开发。AI生成的题目展示了出色的内部一致性和区分能力,表明这种方法可以产生高质量的评估工具。维持和扩展AI在MMI设计中的使用可能提高未来题目开发的效率和可靠性,同时保持心理测量学质量。

为保持MMI系统随时间的心理测量学完整性,应建立例行监控可靠性和区分能力的正式流程。此流程应包括定期计算克朗巴哈α以及评估分数分布和区分指标,特别是对于新引入或修改的题目。系统监控将能够及时识别表现不佳的题目,并促进基于数据的关于其修改或替换的决策。

我们进一步建议标准化题目设计。高性能题目(例如,α>0.85且标准差高的题目)应作为模板指导未来场景的开发。展示出色信度和强区分能力的高性能题目(如本研究中的EMP_17和EMP_6)应作为模板指导未来场景的开发。题目结构、响应标准和预期能力的一致性可能提高公平性并减少MMI题目间的可变性。

应优先审查信度低于可接受水平(α<0.70)或区分能力有限的题目。这包括克朗巴哈α值低的题目(如COLL_14)以及由于天花板效应限制其区分能力的题目(如ADV_21和MOT_12)。适当情况下,这些题目应修改或从选拔过程中移除。此外,对于响应数据有限的题目(n<50),需要进一步数据收集以获得更稳定的可靠性估计并支持基于证据的决策。

最后,随着AI在MMI开发中作用的扩大,使用当代AI模型进行持续完善将至关重要。提高AI生成内容质量和情境对齐将需要AI研究人员和医学教育专业人士之间的持续合作。这种跨学科方法对于确保AI工具不仅支持心理测量学可靠性,还与医学院入学的教育和专业目标保持一致至关重要。

结论

在本文中,据我们所知,我们提供了首次在真实世界医学院入学过程中实施的AI生成MMI题目的实证评估,为在MMI题目开发中使用AI辅助方法提供了证据支持。与传统完全人工开发的题目相比,AI生成的题目表现出相当的信度和区分能力,更高比例达到最优内部一致性,更少低于可接受阈值。鉴于传统题目开发的耗时性和资源密集性,我们的研究结果表明,AI可能提供一种可扩展、高效且心理测量学可靠的选择。

然而,AI生成和传统题目中观察到的信度和区分能力的可变性强调了持续质量保证的必要性。定期心理测量学评估和迭代改进对于维持MMI过程的有效性和公平性仍然至关重要。展望未来,AI在医学院入学中的整合可能会扩展到题目生成之外,包括更广泛的应用,如申请人成功的预测建模。然而,AI使用的任何扩展都必须在仔细考虑伦理问题的指导下进行,包括透明度、算法偏见和公平性,以确保入学系统保持公平和包容。

【全文结束】

猜你喜欢
  • 一名学生对AI在医疗保健中应用的看法一名学生对AI在医疗保健中应用的看法
  • 医疗保健中的人工智能研讨会系列医疗保健中的人工智能研讨会系列
  • AI正在重塑医生的培训方式及职业发展AI正在重塑医生的培训方式及职业发展
  • 新加坡国立大学牙医学院研发“活体”实验室模型 加速安全医疗方案开发新加坡国立大学牙医学院研发“活体”实验室模型 加速安全医疗方案开发
  • 人工智能如何可能改变医生的思维方式人工智能如何可能改变医生的思维方式
  • 医学中的增强智能医学中的增强智能
  • 下一场骨科技术竞赛将不在手术室中展开下一场骨科技术竞赛将不在手术室中展开
  • 探究用户与人工智能在健康信息查询中的互动模式探究用户与人工智能在健康信息查询中的互动模式
  • 使用生成式人工智能加速健康技术评估准备使用生成式人工智能加速健康技术评估准备
  • UT西南医学中心创新中心助力研究人员将发现带入现实世界UT西南医学中心创新中心助力研究人员将发现带入现实世界
热点资讯
全站热点
全站热文