人工智能将彻底改变药物研发的每一步,这样的新闻标题几乎每天都会出现。许多备受瞩目的声明来自试点研究、小规模实施或孤立的点解决方案。大多数声明依赖于技术提供商和赞助商的自我报告数据,而这些机构在结果方面有着重大的经济利益。
严格的评估、独立报告和规模化解决方案较为少见。它们需要更多时间和精力,但提供了更平衡的视角,揭示了AI模型开发和训练中的差距,并突显了实际使用和影响的局限性。最近的一个例子是《数十种AI疾病预测模型基于可疑数据训练》(《自然》,2026年4月15日)。
尽管如此,改进正在积累,证据表明药物研发行业正处于历史性转型的边缘。虽然日常报道提供了可能实现的管窥,但因数据质量差和缺乏AI就绪数据而导致AI项目失败的报道也日益增多。现在或许是时候暂停一下,拨开一些炒作的迷雾。在药物研发的数据领域需要进行哪些变革,才能通过AI实现持续、有意义的进展,从而更快地将新疗法带给患者?
失败的预测
医疗AI中最常被引用的失败预测之一来自Geoffrey Hinton,这位被誉为"AI教父"的著名AI研究员。2016年,Hinton声称医学院应该停止培训放射科医生,因为AI将在五年内取代他们。
十年后,放射科医生不仅仍在就业,而且不可或缺。他们将AI作为一种工具来增强诊断能力,而不是被其取代。美国提供的放射学住院医师职位数量每年持续增长。Hinton的预测忽略了临床实践的细微差别,以及人类专业知识、直觉和对复杂医疗场景的解读,这些是当前任何模型都无法复制的。用于开发放射学模型的训练数据过于有限且范围太窄。因此,这些模型在标准化基准测试中表现优于人类,但在现实条件下却无法匹配这种表现。
IBM Watson的肿瘤学平台提供了另一个警示故事。它被宣传为癌症护理的革命,结果却产生了不安全的治疗建议,并在处理复杂病例时遇到困难。根本原因是什么?数据质量差和缺乏标准化的临床数据。IBM在2022年出售了Watson Health,这清楚地提醒人们,薄弱的数据标准如何会使最雄心勃勃的AI项目脱轨。
AI在临床研究中也遇到了挫折。旨在将参与者与研究方案匹配的患者招募算法,由于电子健康记录(EHR)数据不一致或不完整而失败。缺乏标准化数据导致了有偏差的建议,破坏了招募工作。对50份关于AI模型优化临床试验招募和留存的报告进行的回顾发现,不可靠的结果和有限的泛化能力主要源于用于训练的数据源中的错误和不完整性(《美国医学信息学协会杂志》,2024年9月11日)。
模糊的研究设计也带来了类似的挑战。当方案未明确定义或结构化时,AI难以解释它们,导致偏差和代价高昂的错误。通过定制的临床试验检索增强生成(RAG)解决方案正在取得进展,这些解决方案比仅使用大型语言模型(LLM)的结果有所改进。最近发表的一项研究既展示了进展也揭示了挑战,结论是更深入地与新兴的方案数据标准保持一致,是减少错误的途径,同时保持"在关键检查点嵌入人工审批,以减轻幻觉和AI生成错误的传播"(《生物医学信息学杂志》,2026年7月)。
标准化数据的必要性
认识到准确、可靠的AI输出需要高质量、有代表性、结构良好、标准化的数据输入,并不是什么新观点。这就像"垃圾进,垃圾出"一样简单。
然而,一个反复出现的挑战是,在低质量、本地化数据上训练的AI应用仍能产生令人印象深刻的结果,但当模型扩展到企业级使用时,这些结果容易出现幻觉和错误。这些看起来令人惊叹的结果可能让我们相信开发AI模型的艰苦工作已经完成,而实际上这才刚刚开始。缺陷往往只有在几年后才会显现,当预期的结果在现实世界的使用中无法大规模实现时。
仅靠AI技术无法克服数据质量和标准化方面的系统性缺陷。临床数据标准在解决这些问题中起着至关重要的作用。它们建立了方法论和框架,使数据在机构、研究和系统之间保持统一、一致和可解释。没有标准化的数据,AI系统在解释和泛化信息方面面临重大障碍。
单个组织和AI开发者今天可以展示令人信服的解决方案。但这些努力往往受到获取、清理和将数据转换为高质量训练数据集的高成本的限制。这为行业能够大规模实现的目标设置了低天花板。今天报告的收益表明仍有一些提升空间,但如果没有行业数据标准的广泛采用,我们将只看到渐进式进步,而错过本可以实现的数量级改进。
当今的临床数据标准
好消息是:在过去的10年里,随着AI的兴起,临床数据标准也在并行发展。标准开发组织正在更紧密地合作,采用正在成熟。进展缓慢,但有充分理由保持乐观。
自2016年以来,几个里程碑已经重塑了这一领域:
- CDISC标准成为FDA和PMDA药物提交的强制性标准。
- HL7/FHIR(快速医疗互操作资源)成为医疗保健数据和电子健康记录系统的主要交换标准。
- SNOMED CT、LOINC和ICD-11作为临床术语获得了更广泛的采用。
- OMOP通用数据模型在观察性研究中获得了认可。
最近,新的和新兴的进展指出了一个能够支持临床开发有意义改进的数据基础:
- 数字、机器可读的临床研究方案标准,由TransCelerate数字数据流(DDF)倡议推动,该倡议与CDISC合作(完全披露:自该倡议成立以来,我担任该倡议的负责人)。
- ICH M11通用试验方案技术规范于2025年11月获批,以及与**CDISC统一研究定义模型(USDM)**的持续协调。
- HL7 Vulcan加速器UDP(使用数字方案)倡议,旨在将数字方案连接到电子健康记录系统,并实现基于FHIR API的交换。
- HL7标准与CDISC标准的整合,已证明基于FHIR的API如何简化人工智能驱动的临床研究的真实世界数据收集。
- CDISC的360i倡议,致力于通过称为生物医学概念、分析概念和派生概念的新元数据术语组件,将原本分散的CDISC标准在端到端、从设计到提交的临床研究过程中进行逻辑连接。
从这些进展中出现了四个趋势:
- 文档到数据。从基于纸质和PDF的交换向API驱动、机器可读标准的转变正在进行中。
- 孤岛到生态系统。临床护理、研究和监管领域之间正在实现更大的协调。
- 静态到动态。标准正变得以元数据驱动、自动化并持续更新。
- 本地到全球。通过ICH在FDA、EMA、PMDA等机构之间的国际监管协调,减少了提交的重复。
兰德公司的一项研究报告称,所有行业中超过一半的AI项目因缺乏数据准备而停滞(兰德公司,2024年8月13日)。在临床开发中,这一数字可能更高。这些数据标准趋势代表了改善整体临床数据基础设施所必需的繁重工作。该基础设施反过来又提高了部署稳健、准确、可靠和可解释的AI输出的成功率,并推动朝着有意义的实际应用取得进展。
在这些方面继续取得进展对于提高AI可能实现的天花板至关重要。需要做更多工作,以通用、标准化的方式对AI就绪数据进行资格认证。标准制定组织(SDO)需要紧急更紧密地合作,更新方法,既应用AI加速标准的开发,又协调其方法以产生更好地提供AI就绪数据的标准。这包括捕获机器可读属性的元数据规范,如数据谱系、数据质量和数据集完整性,以及隐私和安全措施的分类和遵守。对数据标准基础设施的投资不应被视为对AI本身投资的次要。
还需要什么?行业范围的治理
这些临床数据标准化的进步对于创建和改善基础数据基础设施是必要的。但仅靠它们还不足以实现AI的全部潜力。
在赞助商、站点、CRO、技术提供商和监管机构之间,标准的采用和实施仍然零散且不一致。每个标准实施计划都会在严格遵守已发布标准和在本地快速提供实际效益所需的灵活性之间达到一个拐点。每个定制在单独看来似乎都合理。然而,总体而言,这些定制破坏了行业范围的互操作性,并破坏了减少质量数据交换和使用摩擦的目标。
标准的主要价值来自于网络效应:采用它们的组织越多,实施成本就越低,整体价值就越高。每个本地变体都会侵蚀这种效应,提高成本并降低临床研究生态系统中的收益。这不是理论上的,而是迄今为止每一次临床数据标准化努力都重复出现的模式。
尽管标准开发日益成熟,但临床开发行业缺乏连贯、全面的治理来决定、承诺和强制执行标准的采用。来自更广泛医疗保健领域的模式可能适用于此。在美国,国家卫生信息技术协调员办公室(ONC)出于公共健康、患者访问和数据二次使用的利益监管数据交换。在欧盟,欧洲健康数据空间(EHDS)倡议扮演着类似的角色。然而,迄今为止,这些模式都尚未有意义地扩展到临床试验流程。
与此同时,药品监管机构一直不愿强加超出提交给他们的数据之外的数据标准要求。他们也一直缓慢地从基于文档的格式转变为标准化的、完全结构化的数据格式。对于临床研究,这使我们主要遵循两个地区的10年前的CDISC提交要求,同时期待即将出现的ICH结构化文档格式,如eCTD v4.0(将在2029年前被大多数地区要求使用),以及最近获批的ICH M11方案格式(其提交要求尚未公布)。
这些强制性标准不足以支持基于AI的临床研究启动、执行、报告或监管审查的改进。关心改善临床试验以造福公众的监管机构需要扩大其影响力,并加速强制性标准的开发和采用。考虑以下可能性:用于审查方案、优化研究设计和基准测试患者和站点负担的基于AI的方法;自动化的站点选择和可行性分析;改进的患者匹配和招募;以及直接从电子健康记录系统获取源数据。所有这些领域的AI模型和代理正在开发和测试中,通过更快的行业范围采用适当的临床数据标准和明确的标准化数据使用政策,可以加速进展。
做得更好
FDA最近宣布了一个名为HALO(数据统一人工智能与生命周期操作)的新平台,该平台整合了FDA所有中心的40多个不同的应用程序、提交数据源、系统和门户(FDA,2026年5月6日)。这种方法可能为FDA内部审查操作带来短期效益。然而,它并未改变来自外部来源的数据输入。先进的算法无法完全修复损坏的数据基础设施。
相反,监管机构可以通过与行业合作,定义强制一致的端到端采用临床数据标准的目标,从而催化真正的变革。这一机会不仅限于更快的审查和批准。它关乎实现经常被提及的"以患者为中心"的愿景,使研究设计更好,启动更快,更快招募患者,消除站点的摩擦,避免许多修正和偏差,更快地交付数据,最终导致加速和更高质量的决策,以及让患者更快获得更多的疗法。
过去关于AI的专家预测之所以失败,是因为它们过于关注产生输出的技术,而对为模型提供输入的数据关注太少。当我们期待下一代AI时,临床数据标准比以往任何时候都更加重要。
自2022年第一个主流生成式AI聊天机器人发布以来,AI发布周期远远超过了标准开发、采用和治理的速度。如果没有连贯的行业治理和有意的行动,这一差距正在扩大。不断扩大的差距只会创造更多障碍,阻碍实现AI的全部潜力,并导致更多失败的预测。
是时候重新平衡关注和投资了。在整个药物开发领域严格、有纪律地采用临床数据标准,是每一个有意义的AI进步将建立的基础。
关于作者:
Bill Illis拥有30多年的药物研发R&D经验,专注于数据获取和使用的可持续和可扩展创新。除了在诺华公司担任技术和科学计算职务外,他还是TransCelerate数字数据流倡议(方案数字化)的工作流负责人,并在CDSIC董事会任职。
【全文结束】

