数字健康与健康信息管理教育中评估类型对AI生成内容的敏感性:准实验性初步研究
摘要
背景: 生成式人工智能工具,如ChatGPT,在高等教育中的使用日益增多,引发了关于评估有效性和学术诚信的重大担忧。在数字健康与健康信息管理项目中,评估旨在评估支撑医疗和健康实践的技术技能、情境推理和专业判断的综合能力。因此,理解生成式AI在不同评估类型中的表现,对于识别哪些形式最容易受到AI生成内容的影响,以及如何重新设计评估以保持其真实性和教育意义至关重要。
目的: 本研究旨在通过考察任务复杂性如何影响AI生成输出的质量,评估ChatGPT在数字健康与健康信息管理教育中不同评估类型上的表现,并为评估中伦理和有效的AI整合提出建议。
方法: 一项初步准实验性设计比较了ChatGPT生成的回答与已去标识化的学生提交作业,涉及五种评估类型:数字健康解决方案设计、商业案例分析、反思性评估、SQL健康数据库编程和健康分类测验。对于每项任务,使用不同的提示策略(包括整合评分标准和使用ChatGPT的GPT-4和o1 Preview模型)生成了多份AI提交作业。盲审的学术评分员使用标准评分标准评估了所有AI生成的提交作业和先前提交的已去标识化学生评估,并使用描述性统计比较了表现。
结果: ChatGPT的表现因评估类型而异。在客观、基于规则的任务中,如健康分类的多项选择题,其准确率最高(平均88%,标准差0%);在反思性评估中,其生成了结构良好、连贯的回复(平均69%,标准差12.8%),但通常缺乏个性化和微妙的行业背景。在描述性分析任务中,如数字健康商业案例和解决方案设计,ChatGPT生成了逻辑结构清晰的工作,并合理使用了证据,但未能提供数字健康与健康信息管理实践所期望的深度情境化、领域特定见解或视觉元素。技术性评估揭示了最大的局限性:SQL编程任务平均得分为42%(标准差17.2%),存在持续的架构错误、不完整的查询以及对健康数据输出的解释薄弱;而基于场景的临床编码仅得7%(标准差0%),反映了在应用《国际疾病分类第十次修订版-澳大利亚修订版》规则和编码惯例方面的精确性不足。结构化提示和评分标准整合改善了结果,特别是在描述性和反思性任务中(高达80%),但更先进的o1 Preview模型并未持续优于早期版本。
结论: 尽管ChatGPT在结构化、基于规则和反思性任务中表现良好,但在技术准确性、情境推理和应用性数字健康与健康信息管理能力方面仍存在局限。为支持学术诚信和劳动力准备度,评估设计应优先考虑与医疗实践相一致的批判性思维、伦理推理和基于场景的问题解决能力。将AI用作批判和完善的工具,而非学生工作的替代品,可以帮助教育者培养学习者在医疗和健康专业教育中负责任地使用AI。
引言
背景
人工智能是一种变革性技术,使系统能够基于人类定义的目标生成输出,如内容、建议或决策。一个关键分支,生成式AI,能够根据提示生成类似人类的媒体。其中的前沿技术是大语言模型,如ChatGPT、Microsoft Copilot和Gemini,它们利用深度学习和大规模数据集来理解上下文、生成连贯的回复并调整语气和风格。这些模型通过带人类反馈的强化学习不断改进。
在高等教育中,大语言模型迅速引起了学术界和学生的关注,支持评估设计、自动评分和课程开发,提高了反馈的及时性并减少了评分错误。它们还帮助学生完善语言、产生想法和启动研究探究。总体而言,医学教育中近期证据表明,生成式AI的应用在资源、教学方法和评估实践方面呈现出快速多样化,在文档支持、模拟培训和个性化学习等领域提供了切实的机会。
尽管有这些好处,但将生成式AI技术整合到高等教育中可能带来重大的伦理挑战。这些挑战包括ChatGPT使用不准确的内容、关于取代人类教师的担忧,以及对学生的批判性思维和问题解决能力的负面影响。最重要的是,使用ChatGPT可能对学术诚信和伦理构成威胁。最近的一项2024年范围综述强调,传统的评估方法在生成式AI辅助的学习环境中无法有效运作,这促使需要创新和重新聚焦的评估设计,以培养职业驱动能力和终身学习技能。围绕学生在教育评估中使用AI的伦理框架主要涉及透明度、问责制和可靠性。透明度要求学生在其提交作业中适当地承认使用AI。学生还必须对他们提交的内容负责,因为“AI工具的输出可能包含用户应该意识到的有偏见、不准确或不正确的内容”。在某些情况下,生成式AI可能编造信息,这引发了关于输出可靠性的问题。
AI工具的可访问性以及检测AI生成内容的困难可能会诱使学生进行学术不端行为。这引发了对评估公平性、公正性以及通过数字平台获得的学术证书可信度的担忧。因此,教育者在维护评估的完整性和确保教育质量方面面临挑战。最近的研究也报告了学习者希望获得关于适当使用AI的明确机构指导,这与对明确政策和培训的呼吁相一致。
澳大利亚拉筹伯大学提供广泛的健康项目。数字健康与健康信息管理项目提供支持当代医疗和医学实践学科的正规教育,旨在发展学生的技术、专业和人际交往技能。典型的入学学生包括来自临床或准临床背景的本科生和硕士生,如护理、辅助医疗、健康科学、健康管理、生物医学科学及相关领域,以及寻求在医疗服务、健康数据和数字系统交叉领域工作的毕业生。课程与医学教育优先事项保持一致,包括临床文档、健康分类、健康数据治理、数字健康系统设计以及健康信息的伦理使用,所有这些都直接支持当代医学实践和健康服务提供。数字健康与健康信息管理项目强调学科特定和通用能力,包括问题解决、批判性思维和伦理决策,这些通常通过学术论文、报告、多项选择测验、演示、案例研究、编程练习和实践模拟进行评估。AI生成内容的激增威胁着这些领域中大多数评估的有效性和可靠性,可能损害评估学生理解能力和胜任力的有效性。在此背景下,更广泛的医学教育文献现在按任务类型和能力领域进行区分:从自动简答题评分和病例生成,到模拟和反思性工作,这加强了针对数字健康与健康信息管理评估敏感性和重新设计进行分析的理由。
先前关于生成式AI工具在高等教育中影响的研究主要集中在特定类型的评估上,如多项选择题或论文评估,主要是在医学和商业领域。例如,Chaudhry等人对商业管理学士学位中AI生成的评估进行了评估,包括案例分析、实证研究报告、自我反思、小组工作和基于计算的评估。这些发现不一定能很好地转化为更为专业的数字健康和健康信息管理领域,每个领域都需要独特的技术、分析和决策技能组合。例如,数字健康与健康信息管理项目要求具备健康分类、流行病学和生物统计学、数字健康解决方案设计、健康数据治理和互操作性等方面的专业知识。这些专业学习领域需要严格且多样化的评估方法,包括基于场景的问题解决、数据解释和系统实施任务,以测试理论知识和实际应用。鉴于数字健康的跨学科性质,旨在弥合临床实践、数据科学和IT之间的鸿沟,有必要对生成式AI如何与这些独特的评估互动进行单独评估。本研究回应了这一空白,通过检查数字健康与健康信息管理中的评估类型敏感性,并将启示与当代重新设计策略以及2024-2025年文献中出现的治理建议相结合。
目标
本研究考察了生成式AI,特别是ChatGPT,在不同数字健康与健康信息管理评估类型中的表现,以及其输出与学生工作的比较,目的是识别最易受AI生成内容影响的评估形式。它进一步寻求通过识别促进真实性、高阶推理和负责任AI使用的方法来指导评估重新设计,从而通过设计而非检测来加强学术诚信。
方法
研究设计
一项准实验性设计被试点用于评估ChatGPT在一系列评估类型上的表现,并将其结果与过去学生的已提交评估进行比较。这种探索性方法旨在提供初步见解,并为更大规模研究的设计提供信息。虽然类似的方法已应用于教育部门的ChatGPT回答评估中,但本研究在数字健康与健康信息管理背景下试点该方法,而该领域尚未对此进行过考察。
评估材料和评分员
从5个数字健康与健康信息管理科目中有目的地选择了评估,因为这些评估具有特定的评估特征,以最大化所选评估类型和性质的多样性和广度。过去学生的已去标识化评估(最初为获得学分而提交)被重新评估作为研究基准,并与ChatGPT生成的回答进行比较。评分员对每份评估的来源不知情,负责评估ChatGPT生成的评估和过去学生的评估。评分员是学术人员,包括全职和临时员工,具有研究生学历以及在数字健康或健康信息管理方面与被分配的具体评估相关的高级专业和教学经验,并展示了使用标准化评分标准评估学生作业的专业知识。
样本
对照组: 科目协调员选择了一份在2023年7月1日至2024年6月30日期间完成的学生评估样本(每种评估类型3份),以形成对照组。为确保代表性,评估选自三个成绩等级:高绩效(>80%)、中等绩效(70%-79%)和低绩效(50%-59%)。这导致在5个科目和5种评估类型中总共包含了15份学生评估。所有评估在分析前均已去标识化,以保持学生匿名性。
实验组: 使用ChatGPT完成与对照组相同的评估任务。每种评估类型创建了2-4份AI生成的评估,以反映典型学生可能如何完成任务的变化。这些变化的标准及其与学生输入模式的一致性在下文“实验”部分详述。
总共选择了33份评估,涵盖5种评估类型:18份是AI生成的,15份是过去学生的评估。这5种评估类型包括本科和研究生评估,反映了发展直接与医学教育相关能力的核心教育活动,包括临床文档、健康分类、健康数据分析、数字健康系统设计以及在医疗环境中的反思性实践。
实验
概述: 一名独立研究助理遵循研究人员制定的结构化流程,收集所选评估样本的ChatGPT评估回答。
生成ChatGPT回答: 为确保可靠性、完整性和与学术期望的一致性,针对每种评估类型开发了多个提交版本(即基本答案生成、基于部分的细化、基于评分标准的细化以及使用o1 Preview模型的基于评分标准的细化)以提交给ChatGPT及其版本。在初步测试阶段之后,创建了一个细化且详细的协议,以指导研究助理生成所有四个结构化版本。预计完整指令和逐步方法将允许对AI生成输出进行细致的分析,其中后两个版本专门设计用于评估增量指导如何影响回答质量。此外,评分标准的纳入预计将进一步改善上下文对齐。o1 Preview的纳入使用了专为高级推理设计的o1模型,并提供了对生成式AI不断发展的能力的见解。对于SQL任务,提交版本包含了数据库架构和评分标准以支持上下文准确性;然而,基础健康数据集本身并未提供给ChatGPT。相比之下,对于健康分类评估中的客观题型,由于问题的结构化格式和所需回答的直接性,只需要两个提交版本。需要注意的是,在所有版本中,ChatGPT都获得了最初给学生提供的相同评估指导和评分标准,确保了人工和AI生成工作之间的可比性。
盲审准备: 研究助理将ChatGPT生成的回答格式化为类似于学生提交作业。然后,这些AI生成的回答与真实的、已去标识化的学生评估混合在一起,以保持盲审。为确保公正的评审过程,所有评估均匿名化并分配了编码标识符。
评估分配: 基于其在科目中的专业知识,每位科目协调员向研究助理推荐了潜在的评分员,以评估和评分ChatGPT的回答和学生评估。研究助理通过电子邮件单独联系潜在的评分员,寻求他们的参与,并最终为每种评估类型筛选出一名评分员。评分员获得了参与者信息同意书。为保持公正,指定的评分员不包括最初评分学生评估的学术人员。评估由研究助理作为独立协调员随机分配给评分员,以确保公平分配并防止任何利益冲突。
评分过程: 评分员遵循标准化评分标准来评估评估。为确保评分的一致性,首席研究员提供了明确的指示,并由独立研究助理传达。此外,在整个过程中提供支持,以解决任何问题或不确定性。除了数字分数外,评分员还提供了与评分标准一致的书面反馈,以及整体的自由格式评论,以证明其评分的合理性并提供对工作质量的见解。为进一步确保可靠性,如果在任何学生评估中发现了超过10分的差异,则该评估类型中的所有评估均由第二位学科专家独立审查。然后讨论任何差异,并达成共识以确定最终成绩。
数据追踪和管理: 研究助理维护了一个Microsoft Excel电子表格来追踪评分过程,包括发送给教职员工的评估细节及其反馈。
测试和审查: 作为实验过程的一部分,进行了初步测试以完善方法并确认计划研究的可行性。这涉及各种类型中较小的评估样本,以试验AI回答的生成、学生工作的收集和去标识化,以及盲审过程。来自此阶段的见解用于在主要实验之前进行必要的调整。在此测试阶段使用的评估被排除在最终数据分析之外。在初步测试中,我们确定从相同输入生成多个输出不适用于本研究的设计。当在同一个ChatGPT账户内发出重复提示时,模型状态的遗留效应由于潜在的对话记忆而在回答之间产生了依赖性,从而损害了输出之间的独立性。相反,当使用不同账户生成相同输入时,产生的输出在结构、顺序和措辞上高度相似。这种相似性对盲审过程构成了风险,因为评估近相同回答的单一评分员很容易将其识别为AI生成的,从而引入潜在的确认偏差。由于这些原因,我们采用了结构化版本方法,而不是为相同输入生成多个输出。
综合与分析
学术评分员提供的分数和定性反馈被编译到每种评估类型中。在所有学生成绩等级中计算了描述性统计量,以支持盲审过程并确保对照组内的自然变异。虽然ChatGPT的输出与所有重新评分的评估进行了比较,但主要的分析重点是最高分的提交作业,因为这些提供了一个稳定且有意义的基准,用于评估AI生成的工作是否能够接近高质量的类人表现。在单个评估类型内和跨评估类别均考察了表现。
进行了比较趋势分析,以评估ChatGPT版本之间的进展,重点关注与结构化提示、架构包含和评分标准整合相关的改进。此外,还进行了评分标准级别的综合,以识别反复出现的优势和劣势。
对AI生成和学生提交作业的反馈评论进行了审查和比较,特别关注表现最佳的学生工作。这种比较有助于识别AI输出的评估反馈与人类作者工作的差异最显著之处。
结果进一步综合成跨评估比较,将表现分组为更广泛的任务类别,以识别AI在哪些方面表现出相对优势,在哪些方面存在持续的限制。
使用的生成式AI工具
本研究在实验中使用GPT-4和o1 Preview。研究人员使用可用功能选择退出ChatGPT的AI训练模型,确保提交的评估指南和指令不被用于进一步训练AI。在整个研究过程中,启用了所有必要的隐私设置,以维护数据机密性。
伦理考虑
本研究已获得拉筹伯大学人类研究伦理委员会的批准。作为本研究的一部分,没有学生评估提交作业、学生生成的内容或可识别的教育数据被输入到任何生成式AI工具中。只有公开可用的评估指南和评分标准被提供给ChatGPT以生成AI回答。用于比较的所有学生作业均已去标识化、安全存储,并由学术评分员离线评估。
结果
按评估类型划分的表现
**概述:**评估类型2:数字健康商业案例提案报告
该评估要求学生撰写一份数字健康商业提案,识别系统差距并推荐创新技术,强调基于证据的论证、实施障碍分析以及体现医疗价值与影响的专业沟通。
ChatGPT生成的各版本得分相近。GPT-4 (V2) 得分最高(68%),引用更规范、结构更清晰。然而,尽管有逐步改进,所有AI输出都被批评为内容泛化、缺乏针对性见解,且缺少患者旅程图或系统流程图等视觉元素。更先进的o1 Preview模型(V4)并未提升性能(得分64%),且仍呈现指令性而非战略性框架。相比之下,表现最佳的学生提交作业(得分82%)展现了针对性的问题-方案匹配、更强的分析深度,并通过整合良好的视觉辅助工具提升了清晰度。
评估类型3:健康信息管理反思性评估
该评估要求学生批判性地反思其健康信息管理实习经历,利用实证证据评估专业能力,识别优势与不足,设定可行的改进目标,并展示专业沟通能力。
ChatGPT的回答表现差异较大。GPT-4 (V3) 获得了AI最高分(80%),呈现结构良好的报告,包含详细反思和系统化的实证证据使用,甚至超过了学生最高分(70%)。但它超出了字数限制,缺乏视觉增强,部分目标过于宽泛,与健康行业期望的能力不符。早期版本有显著弱点:V1(53%)简洁但不够深入,缺乏与实习经历的联系;V2(70%)在结构和相关性上有所改进,但包含编造的参考文献和过于临床化的目标。最先进的o1 Preview (V4) 仅得55%,符合字数但内容浅薄、重复、模糊。
尽管ChatGPT展现了流畅性、结构性和反思框架的有效运用,但在个性化、情境相关性和深度方面不足,而这些都是优秀学生提交作业的突出特点,后者提供了具体的实习见解、细致的分析和切实可行的专业发展策略。
评估类型4:健康数据库SQL编程
该评估测试学生识别健康信息需求、编写准确SQL查询以分析健康数据、提取相关信息并解释结果以支持医疗决策的能力。
AI生成的回答各版本改进有限,架构和评分标准的整合略微提高了分数。GPT-4 (V1) 未使用架构,得分最低(17%),所有查询使用了错误的表名和列名。V2 加入架构后,结构准确性提高(47%),但数据分组错误和输出缺失依然存在。V3 (49%) 查询逻辑略有改善,但拼写错误和关键字段遗漏仍成问题。最先进的o1 Preview (V4) 获得AI最高分(56%),正确执行了约一半的查询,对SQL惯例的遵循有所改进,但仍存在年龄组划分错误、计数错误以及诊断说明等上下文细节缺失。
相比之下,学生最高分(100%)展示了精确的SQL逻辑应用、完整的查询执行以及基于上下文的健康趋势解读,在架构注意、数据准确性和专业沟通方面远超AI。
评估类型5:健康信息管理健康分类/临床编码在线测验
该测验评估学生应用《国际疾病分类第十次修订版-澳大利亚修订版》健康分类标准的能力,包括基于场景的编码、线性编码和客观题。
AI回答(GPT-4 V1 和 o1 Preview V2)在客观题部分表现最佳(88%),但在场景式编码任务中仅得7%,总分为32%,而学生最高分为87%。主要问题包括错误的区块编号、不准确的排序以及模糊或缺失的代码依据。相比之下,学生展现了精确性和与国家编码标准一致的情境理解。这些结果强化了AI在处理结构化回忆方面表现良好,但缺乏应用型临床编码所需的细致推理。
按评估类型和任务的整体表现比较
跨评估类型比较
总体而言,ChatGPT在各评估类型上的平均得分显示明显差异。描述性和反思性评估的得分较高,而技术性评估(SQL编程、健康分类测验)得分显著较低。从V1到V4的进步体现了上下文、架构和评分标准的重要性,但即使最佳版本也未达到这些任务所需的精确度和深度。
跨任务类型的ChatGPT版本比较
ChatGPT在客观任务上表现最好(事实性、基于规则的问题)。反思性任务次之,后期版本推理能力提升。描述性分析任务平均表现居中,但新版本改善停滞。编程任务随时间改进,但仍在准确性和情境理解上遇挑战。表现最差的是复杂场景式健康分类任务,反映了当前在情境和分析推理上的局限。
讨论
概述
本研究旨在试点评估ChatGPT在数字健康与健康信息管理多样化评估任务中的表现,重点关注促进学术诚信。分析不仅揭示了ChatGPT在哪些方面表现出色或不足,还提出了设计评估的更广泛启示,以培养批判性思维、伦理实践和现实应用性。通过将ChatGPT的表现置于研究原始目标内,我们更清晰地了解了生成式AI在学术和专业环境中的潜力与局限。但需注意,本试点仅考察了ChatGPT的最终输出,未评估AI作为形成性学习伙伴的角色(如学生迭代批判、完善或共同开发AI草稿)。
主要发现及与先前文献的比较
数字健康案例研究和解决方案设计评估显示了ChatGPT在处理复杂、具体情境问题上的明显局限。尽管AI生成的提交作业始终能识别基础框架并产生结构良好的输出,但缺乏真实患者解决方案所需的深度和情境化。问题与干预之间的弱匹配反映了保持情境连贯性的普遍挑战。这与先前跨学科报告一致,这些报告发现尽管语言流畅、结构连贯、语法准确,但仍有类似不足。视觉人工制品(如患者旅程图、流程图)的缺失进一步限制了复杂思想的沟通,突出了生成式AI在产生有意义视觉表示方面的局限。这些发现强调了人类专业判断在细化与情境化解决方案中的关键作用。对于数字健康与健康信息管理评估,任务应优先考虑深度情境参与、患者特定场景和动态问题解决。要求整合真实数据、图形可视化以及基于案例的详细论证,可以更好地评估应用能力,同时减少对AI工具的过度依赖。
反思性评估展示了ChatGPT的最强表现,后期版本(特别是GPT-4 V3)得分80%,在结构、连贯性和反思框架遵循上超越了学生提交作业。然而,尽管语言精炼、组织系统,AI生成的反思往往缺乏真正的深度、情境细微差别和个性化见解,而这些是健康信息管理专业发展的核心。这些结果暗示需要重新设计反思性评估以保持真实性。强调个性化见解、独特情境联系以及对真实经历的批判性评估,结合动态场景、同伴互动或实时情境观察,可以减少AI依赖,同时加强学术诚信和专业能力发展。
客观评估(多项选择、判断对错)显示了AI持续的高性能,错误率极低。这反映了AI在结构化、基于规则的任务(事实回忆和逻辑推理)上的已知优势,与先前评估一致。然而,这引发了关于此类任务衡量个体学习有效性的担忧,尤其在线环境中。为维护评估诚信,应通过要求补充理由、解释或推理,以及嵌入真实上下文和多步骤问题解决,来补充客观题。
临床编码场景式评估显示了AI与学生之间的明显差距,尤其在需要细微情境解释和应用编码规则的任务上。AI在客观部分表现尚可,但在复杂场景中表现不佳,得分远低于高绩效学生。这与美国研究一致,表明ChatGPT在处理简单、单诊断编码任务时表现尚可,但处理复杂患者数据时困难。这些发现强调了需要注重情境推理和现实编码应用的评估,巩固了培养独立临床编码能力的重要性。
SQL编程评估进一步凸显了ChatGPT在技术上精确、依赖上下文的任务中的局限。尽管后期版本有渐进改进,但持续存在表名和列名使用错误、过度依赖提示、对健康数据惯例理解不足以及无法执行复杂多步查询等问题。拼写错误和缺乏实时测试与调试能力进一步削弱了输出可靠性。这些发现与先前关于大语言模型在SQL生成方面表现强劲的研究形成对比,表明健康数据库上下文需要更深入的领域知识和情境意识。对于教育者,这突显了评估应超越语法,包括调试、真实应用和健康数据解释分析,从而培养AI无法完全复制的、适应工作的能力。
在沟通、写作和引用任务中,ChatGPT在结构、清晰度和遵循学术惯例方面表现强劲,后期版本尤其明显。然而,在深度、情境相关性、重复和批判性参与方面仍有局限,尤其在较长写作任务中。类似发现已在商业教育中报告,AI生成的学术写作得分在40%至77%之间,原因是尽管语法质量高,但深度和分析不足。编造参考文献和引用格式不一致进一步损害了可信度。这些结果表明,尽管AI可以支持基础学术写作,但在细微论证和原创批判性思考方面存在困难。评估设计应要求学生批判性参与来源、精确引用以及个性化应用概念,以确保真实的学生学习。
链式提示(逐步优化提示)显著改善了AI表现,尤其在描述性和反思性任务中,后期版本得益于评分标准对齐的指导。类似改进已在药学教育中观察到,结构化提示增强了知识回忆任务的表现。这证明了多步提示在优化AI输出方面的有效性。
总体而言,o1 Preview (V4) 在描述性任务中的表现不如V3,而在更简单的客观评估中表现相当或略有改善。这表明较新的AI版本并不一定在复杂、上下文驱动任务中产生更好结果。尽管早期研究报告了GPT-4在医学执照考试和基础科学中的优越性,本研究未一致观察到这种改善。没有明确证据表明o1 Preview在需要批判性思维或反思的任务中提升了表现。这些发现强调了评估设计应优先考虑原创性、情境理解和高级认知,而非可轻易通过AI辅助完成的任务。
优势与局限
本试点研究的发现强调了设计评估与健康信息管理和数字健康不断演变的角色相一致的重要性,同时促进生成式AI的伦理和实际使用。健康信息管理者在健康数据管理、分析和健康信息通信技术中扮演关键角色,随着数字健康日益整合临床护理、数据科学和IT,教育评估必须强化跨学科能力。近期证据表明,高等教育中传统评估方法在生成式AI辅助学习环境中越来越无效,需要重新设计评估以促进批判性思维、创造力和终身学习技能。例如,可以实施“翻转评估”方法,让学生在教育者监督下共同创建并批判性验证AI生成的项目,在保持专家监督的同时提高信心。这种重新设计类型与本研究的建议一致,即鼓励学生批判、完善和情境化AI输出,而非仅仅生成它们。
评估应强调需要情境理解、技术熟练度和决策能力的任务。此外,应将AI作为增强而非替代批判性思维的工具。例如,学生可以完善AI生成的临床编码或SQL输出以符合标准框架,批判性评估AI生成的商业提案的深度和情境相关性,或将视觉工具(如患者旅程图)整合到健康信息报告中。这些方法不仅培养了关键分析、编程和沟通等基本能力,还鼓励学生驾驭AI的局限性并负责任地将其输出融入工作,促进生成式AI的伦理使用,以支持而非替代学生努力。
在数字健康与健康信息管理教育中,应精心构建AI在评估中的使用,以与专业能力保持一致,同时维护学术诚信。某些任务应避免依赖AI,特别是需要个人反思、伦理决策和在复杂数字健康场景中批判性思考的任务。其他任务可以采用AI提高效率,例如协助总结健康政策、生成结构化报告或组织数据驱动见解。最后,AI生成内容可以用于要求学生批判性完善、验证和情境化AI输出的评估,如评估AI生成的临床编码建议、完善用于健康数据库的SQL查询、或评估AI生成的数字健康解决方案在行业框架内的适用性。此外,教育者和学生必须通过不向生成式AI工具提供受版权保护或敏感的健康数据来确保隐私,并应接受关于在数字健康和健康信息管理中负责任和伦理使用AI的培训,以支持专业准备。
综合来看,当前的2024-2025年证据汇聚于双重使命:重新设计评估以培养批判、验证和反思技能,并建立明确的治理机制,包括政策指导、培训计划和披露规范,与生成式AI系统不断变化的能力和风险相称。
这些方法为学生未来在健康信息管理和数字健康角色中应用生成式AI做好准备,在这些角色中,此类工具可用于辅助数据分析、报告生成和战略规划等任务。通过设计既测试又培养这些领域技能,同时促进负责任AI使用的评估,教育者可以有效地装备毕业生,以驾驭现代数字健康护理的跨学科和技术驱动格局。
结论
本试点研究揭示了ChatGPT在健康信息管理和数字健康评估中的潜力与局限。尽管生成式AI在结构化任务和基础内容生成方面表现出色,但在情境化、深度以及在需要独立批判性思考的评估中所需的技术精确性方面存在困难。这些发现强调了需要精心设计评估,以伦理方式整合AI,并优先考虑需要人类判断和情境理解的任务,以确保有意义的学习成果和学术诚信。
【全文结束】

