英矽智能(Insilico Medicine)与Liquid AI之间的一项新合作,诞生了一款轻量级科学基础模型。该模型旨在支持制药研究的多个阶段,同时完全在私有基础设施上运行。
两家公司宣布发布LFM2-2.6B-MMAI(v0.2.1)模型,该模型旨在单个系统内处理广泛范围的药物发现任务,而非依赖多个独立的专用模型。据合作方称,它向着更高效的人工智能工具迈出了一步,这类工具可以部署在制药组织内部,而无需将专有数据发送至外部云平台。
解决AI驱动研究中的数据安全问题
在制药研究中采用先进人工智能系统的主要障碍之一,是保护敏感数据的必要性。药物开发者通常使用无法轻易与第三方基础设施共享的专有分子、分析和生物靶点。
英矽智能与Liquid AI之间的合作旨在解决这一问题,他们将Liquid AI高效的大型基础模型架构与英矽智能的MMAI Gym训练环境相结合。该平台包含超过1000个用于训练和评估药物发现AI系统的制药基准测试。
由此产生的模型可以部署在内部基础设施上,同时仍能提供与大型云模型相当的性能。
一个用于发现管线的单一系统
该模型旨在支持制药研究中的完整发现循环。其能力包括性质预测与ADMET终点分析、多参数分子优化、带蛋白口袋条件的靶点感知评分、官能团推理以及逆合成规划。
训练过程涉及大约1200亿个药物发现数据token,这些数据来源于药物发现过程中两百多个不同的任务。
开发者表示,这种方法避免了对专注于单个问题的零散独立模型的需求,允许一个单一系统在发现的不同阶段运行。
“通过LFM2-2.6B-MMAI,我们证明了高效的架构设计——而不仅仅是规模——才是使基础模型对科学领域实用的关键。一个仅26亿参数的模型现在在药物发现管线上与十倍于其规模的系统匹配甚至超越,而且全部在私有基础设施上运行,”Liquid AI首席执行官兼联合创始人拉明·哈萨尼(Ramin Hasani)表示。“我们与英矽智能的合作证明,你可以在降低智能成本的同时提高质量标准。”
跨多个发现任务的性能
尽管仅有26亿参数,该模型据称达到了与显著更大的系统相当的性能。
在性质预测测试(涵盖药代动力学和毒理学)中,该模型在22项任务中的13项上优于270亿参数的TxGemma模型,并在与针对单个终点设计的专用模型比较时,在三项任务上达到了最先进的结果。
在分子优化基准测试中,该模型在多参数优化任务上实现了高达98.8%的成功率。英矽智能的内部基准测试还显示,与几个前沿AI模型相比,在包含250万个实验测量值和689个蛋白靶点的数据集上,该模型的亲和力预测相关性得分有所提高。
额外测试还展示了在化学推理任务、官能团分析和单步逆合成预测方面的强劲性能。
在制药研发中的潜在应用
合作方表示,该模型可立即用于制药研究的几个领域,包括高频ADMET筛选、药物化学先导优化以及旨在减少浪费性实验工作的逆合成规划。
“我们很高兴与Liquid AI合作,开发下一代轻量级液态基础模型,这些模型能够执行多种科学任务,并在药物发现基准测试中达到最先进的性能,”英矽智能首席执行官亚历克斯·扎沃龙科夫(Alex Zhavoronkov)表示。“高效的液态科学模型将使更多科学家更容易实现他们的目标,从而压缩发现时间线,并最终帮助患者。”
【全文结束】

