女性健康人工智能缺乏标准——现在有了Women's Health AI Has No Standards—Until Now

环球医讯 / AI与医疗健康来源:www.forbes.com美国 - 英语2026-08-20 04:07:49 - 阅读时长6分钟 - 2610字
本文探讨了女性健康领域人工智能应用缺乏统一标准的问题,揭示了当前女性健康AI模型高达60%的失败率,特别是在处理紧急医疗情况时表现更差。为解决这一问题,多家企业于2026年5月12日宣布成立"女性健康人工智能联盟",致力于制定行业标准,确保AI系统在女性生育健康、产后恢复等关键领域提供准确、安全的服务,避免技术偏见对女性健康的潜在危害。该联盟虽无监管权,但借鉴B Corp认证和有机食品标签等自愿标准模式,希望通过声誉压力推动行业变革,其六项治理承诺涵盖道德标准、减少偏见、临床质量等多个方面,旨在建立真正为女性设计而非仅针对女性的AI健康服务,而非让女性独自面对产后恢复等关键健康挑战。
女性健康产后恢复盆底恢复产后抑郁女性健康人工智能联盟医疗人工智能AI健康标准临床安全
女性健康人工智能缺乏标准——现在有了

一位女性分娩后,几周内定期看产科医生。出院后,随访转到儿科医生。随后是产后六周的最后一次产科预约,之后就再也没有了。没有针对盆底恢复、可能预示产后抑郁的情绪变化的临床检查,也没有可以询问私密问题的对象。在这种空白中,她打开了一个应用程序。

该应用程序由大型语言模型(LLM)AI平台提供支持。该AI的训练数据并非为她量身定制,验证基准也不适合她的生物学特征,且没有任何监管。2026年5月12日,包括Willow Innovations和Ema EQ在内的一批公司宣布成立"女性健康人工智能联盟"(Women's Health AI Consortium),这是首个致力于改变这一状况的行业组织。它的成立正值AI影响力与责任之间的差距前所未有的时刻。

AI被要求填补的空白

Willow公司首席执行官Sarah O'Leary毫不掩饰地描述了产后现实。分娩后,女性"如果幸运的话,六周后只再看一次产科医生,她必须独自应对这段常常是创伤性且极其强烈的愈合与转变经历。"

使用Willow应用程序(该程序整合了Ema EQ的AI)的女性正在询问盆底恢复、何时可以恢复性生活、为什么她们感觉不像自己等问题。

问题比任何单一产品都更深层。O'Leary用Willow自身的历史作类比。吸奶器已经存在了几十年。它们"技术上可以提取牛奶。在这方面它们做得不错。但它们从未以真正同理心和以使用者为中心来设计,"她说。女性健康AI有风险,可能"以速度、规模和对更重大决策的影响,重复同样的失败"。"我们有重大的系统性差距,只是在上面叠加AI并不能解决这些问题,"O'Leary警告道。

"根本没有标准。一点都没有。"

Ema EQ的首席科学官兼联盟联合创始人Morgan Rose没有淡化治理现状。"根本没有标准。一点都没有。"没有自愿标准,也没有特定于行业的标准。最接近问题的专业机构——美国妇产科医师学会(ACOG)——刚开始与专注于临床医生的AI公司合作。不存在任何框架来规范AI告诉应用程序另一端的女性关于她的产后恢复、生育能力或症状恶化的内容。

性能数据使这一缺失变得具体。研究人员评估了13个领先的AI模型在女性健康任务上的表现,发现所有大型语言模型的失败率约为60%。每个模型在"错过紧急情况"方面表现最差——即女性情况最危险的时刻。2026年的一项后续基准测试发现,没有一个大型语言模型在女性健康临床场景中的准确率超过75%。Rose指出,根本原因是结构性的。"如果你在训练时使用不足的数据或研究不足的数据,那么你将得到糟糕的输出,"他解释道。

失败先于任何模型。Rose将联盟的起点描述为将现有AI失败追溯到其基础设施根源。在她的团队审查的一个案例研究中,一个主要的大型语言模型减少了建议女性寻求护理的内容,而另一个则产生了相对较少偏见的输出——这种差异可以追溯到在测试任何临床场景之前所做的决策。

无强制执行的设计——以及为何这可能足够

联盟没有监管权。公司完全可以忽略其标准。O'Leary和Rose不仅意识到这一点,还仔细思考了这是否重要。

O'Leary将此与B Corp认证和有机食品标签相比较,这两者都是自愿标准,在法规出台前很久就创造了声誉压力。"等待太紧急了,"她认为。目标是建立她所描述的"类似B Corp的品牌",行业最终无法忽视,最终推动立法行动。

Rose提出了一个不同但兼容的模式:环境工作组(Environmental Working Group)的"肮脏 dozen"名单,它在没有通过任何法规的情况下重塑了消费者对农药暴露的行为。她对当前联邦立场的看法很直接:"我们的政府,尤其是现在,对AI相当宽松和友好。"市场必须首先行动。

然而,无论是自愿标准还是社会压力都无法解决AI造成伤害时会发生什么。正如在《当医疗保健AI伤害女性时,美国无人负责》中报道的那样,责任真空是结构性的。开发者指向批准要求;医院真诚地依赖FDA批准的工具;而医生则承担了工具所塑造的决策的法律风险。没有任何AI系统在美国任何法院被追究法律责任。Rose对联盟的目标是产生足够的社会压力,使公司在零散的责任导致灾难性的公共失败之前达到标准。

"我们需要人们以诚信构建,"Rose强调。"在我们拥有标准之前,我们必须大声疾呼设定某种基准,以便至少让人们感到压力,如果他们要进入这个领域,就必须这样做。"

压力可能已经从一个意想不到的方向开始建立。在为本文报道期间,一位二十多岁的物理治疗实习生——未经提示,不知道手头的话题——主动表示她不信任女性健康AI。Rose立即认出了这一信号。"我已经与许多非常怀疑且不使用AI的Z世代进行了交谈。在代际上,将会有什么是可接受的,什么不是的推拉。"

标准尚未达到

联盟的六项治理承诺——道德标准、减少偏见、情感和临床质量、纵向智能、对道德AI构建者的指导以及透明监督——解决了每个记录的失败模式。其治理委员会包括临床医生、技术专家、伦理学家和法律专家。

Ema EQ的首席执行官Amanda Ducach简单地阐述了创始逻辑:"风险太高,不能让标准听天由命。女性值得拥有临床安全、文化意识强且为她们设计而不仅仅是为她们设计的AI。"

Rose明确表示,联盟的雄心超过了任何成员公司已经做的事情。"我们的目标不是仅仅让它成为对我们已经做过的批准徽章。那将是毫无意义的。"联盟正在努力达到的基准应该推动每个成员,包括其创始人。

O'Leary同样直接地表达了更广泛的义务:"女性健康AI的发展速度要求立即、协调的责任。该联盟为行业提供了一个明确、共享的标准,该标准基于证据,反映生活经验,并使每个工具对其服务的女性负责。"

电梯里的实习生不需要基准研究。她已经知道标准尚未达到。联盟的工作——自愿的、无政府的、紧急的——是在她不信任的工具成为她无法避免的基础设施之前,证明她是错的。

【全文结束】

猜你喜欢
  • 哈佛试验显示AI医疗诊断超越医生哈佛试验显示AI医疗诊断超越医生
  • 哈佛研究发现大型语言模型在急诊室诊断准确率上超过人类医生哈佛研究发现大型语言模型在急诊室诊断准确率上超过人类医生
  • 哈佛研究揭示:人工智能在急诊诊断中表现已超越人类医生哈佛研究揭示:人工智能在急诊诊断中表现已超越人类医生
  • 大多数健康AI用户不认为聊天机器人准确性很高:民调大多数健康AI用户不认为聊天机器人准确性很高:民调
  • 塑造人工智能和机器学习(AI/ML)医疗设备市场格局的关键战略发展与新兴变化塑造人工智能和机器学习(AI/ML)医疗设备市场格局的关键战略发展与新兴变化
  • 多组学如何改变科学家对人类免疫系统的认知多组学如何改变科学家对人类免疫系统的认知
  • 增强智能:生物医药创新的下一代引擎增强智能:生物医药创新的下一代引擎
  • 多模态数据与人工智能时代的计算药物重定位多模态数据与人工智能时代的计算药物重定位
  • 天主教领袖支持教皇AI立场,思考具体实施天主教领袖支持教皇AI立场,思考具体实施
  • 多囊卵巢综合征更名为更准确名称,旨在改善诊断与治疗多囊卵巢综合征更名为更准确名称,旨在改善诊断与治疗
热点资讯
全站热点
全站热文