随着人工智能日益嵌入医疗设备,大多数讨论都集中在算法性能指标上,如准确性和鲁棒性。然而,许多现实世界的安全风险并非源于模型本身,而是来自临床医生如何解读和与AI输出交互。人因因素——包括信任校准、工作流集成和不确定性沟通——在AI医疗设备是改善护理还是引入新风险方面起着关键作用。
Shreya Sridhar是美敦力公司(Medtronic)的首席系统工程师,专攻作为医疗设备的软件(SaMD)和AI赋能医疗技术。她领导复杂的医疗设备软件系统的设计与集成,重点关注系统架构、安全驱动设计,以及将系统工程原理应用于受监管的医疗技术。
准确性只是安全方程的一部分
随着人工智能越来越多地嵌入医疗设备,大部分讨论都围绕算法性能展开——准确性、灵敏度、鲁棒性和验证指标。尽管这些指标很重要,但它们并不能完全决定一个AI系统在临床环境中是否安全或有效。实践中,许多安全挑战并非来自模型本身,而是来自临床医生如何解读和与AI生成的洞察交互。输出的呈现方式、出现的情境,以及它们如何无缝融入现有工作流,都会显著影响临床决策。
因此,专注于人与技术如何交互的人因工程,在AI医疗设备的设计中扮演着关键角色。
影响:当决策支持塑造决策
许多AI系统被设计为决策支持工具,而非决策者。然而,在现实使用中,两者之间的区别往往不那么清晰。
即使临床医生对临床决策拥有完全权威,AI输出仍可能强烈影响这些决策的做出方式。如果结果没有充分背景信息,临床医生可能会对算法建议产生过度自信——这种现象通常被称为自动化偏差。
考虑一个旨在标记影像研究中潜在异常的AI系统。如果界面高亮显示关注区域,但没有清晰传达模型置信度或局限性,临床医生可能会开始围绕AI建议锚定自己的解读。随着时间的推移,该工具可能会无意中引导诊断推理——即使在模型置信度较低的情况下也是如此。
另一方面,解释不清的输出或不一致的行为可能导致临床医生完全怀疑系统并忽略其建议。例如,考虑一个旨在从患者监测数据中检测早期败血症迹象的AI系统。如果系统偶尔发出警报,但没有明确说明哪些临床变量促成了预测,临床医生可能难以判断警报是否有意义。在遇到几个似乎难以解释或与临床评估不一致的警报后,临床医生可能会开始完全忽略警报——即使在AI模型正确识别出病情恶化的患者时也是如此。在这种情况下,算法可能按预期运行,但结果沟通方式缺乏透明度破坏了临床医生的信任。
过度依赖和依赖不足都代表了人因失败。在这些情况下,根本问题不一定是算法性能,而是系统如何向用户传达信息。
沟通不确定性
AI医疗设备中的另一个关键设计挑战是如何沟通不确定性。
医疗决策本身固有不确定性。临床医生经常解读概率信息,如实验室值范围、诊断可能性和风险评分。
然而,AI界面通常以简化或过于确定的方式呈现输出。清晰的视觉化和单一数值预测可能无意中在算法输出周围营造出一种确定感。
当不确定性被隐藏或过度简化时,临床医生可能难以适当校准其信任。他们可能将AI预测视为权威答案,而非临床证据的一部分。
设计能够透明地传达不确定性的界面——通过置信度指标、情境解释或概率范围——可以帮助临床医生更好地将AI输出整合到临床推理中。
工作流集成决定现实世界采用
临床环境通常是快节奏且认知要求高的。在这些环境中,破坏既定工作流的工具不太可能成功,即使它们在技术上表现良好。
要求临床医生切换界面、手动输入数据或解读不熟悉的视觉化的AI系统,可能会增加认知负担而非减少。随着时间的推移,这些摩擦点可能导致变通方法或逐渐放弃该工具。
成功的AI医疗设备往往自然融入现有临床流程。当系统与临床医生收集信息和做出决策的方式一致时,AI洞察可以增强工作流而非中断它。
在许多情况下,系统的可用性和集成度与算法本身的复杂性同样重要。
部署后监测人机交互
临床医生与AI系统之间的关系在设备部署后持续演变。
随着临床医生对工具获得经验,他们对系统的信任可能会根据其在不同场景中的表现而增加或减少。如果不监测这些交互,制造商可能会错过早期预警信号,如误用、过度依赖或使用率下降。
因此,AI医疗设备的上市后监测应超越算法性能指标。了解用户在实际中如何与系统交互,可以提供关于设计是否支持安全有效使用的宝贵洞察。
观察现实世界使用模式可能揭示改进界面设计、澄清系统输出或更好地支持临床工作流的机会。
行业启示
随着AI医疗设备的采用加速,成功将不仅仅取决于越来越先进的算法。
在产品设计早期优先考虑人因因素的制造商,将更有能力构建临床医生信任并有效使用的系统。这包括在开发过程中让临床医生参与,设计清晰传达不确定性的界面,以及监测部署后系统的使用方式。
AI赋能医疗领域的下一阶段创新将不仅仅由更智能的模型定义。它还将由这些模型如何被整合到支持真实临床环境中人类判断的系统中来定义。
【全文结束】

