AI驱动天然产物筛选:从植物宝库中高效发现DPP-4抑制剂

AI驱动天然产物筛选:从植物宝库中高效发现DPP-4抑制剂 1. 项目概述当AI遇见传统草药作为一名在生物信息学和计算药物发现领域摸爬滚打了十多年的从业者我见证了这个领域从简单的分子对接模拟发展到今天AI深度介入的范式变革。最近我和团队完成了一个让我非常兴奋的项目利用人工智能技术从庞大的植物天然产物库中高效筛选潜在的DPP-4抑制剂。简单来说我们想用计算机和算法在海量的天然化合物里快速找到那些有可能成为新一代糖尿病药物的“潜力股”。DPP-4全称二肽基肽酶-4是当前2型糖尿病治疗的一个重要靶点。市面上常见的西格列汀、维格列汀等“列汀”类药物就是通过抑制DPP-4的活性来提升体内“肠促胰素”的水平从而智能地调节血糖。然而化学合成药物可能存在副作用、成本高等问题。天然产物尤其是来自植物的化合物因其结构多样性、生物相容性高和悠久的民间应用历史一直是新药发现的宝库。但传统方法从植物提取、分离、到活性验证耗时耗力无异于大海捞针。我们这个项目的核心价值就是搭建一座“AI桥梁”一端连接着包含数万种植物化合物结构的虚拟库另一端指向DPP-4这个明确的靶点。我们不再需要盲目地、耗费大量资源去进行实体筛选而是先让AI在数字世界里进行一场高强度的“预选赛”快速锁定最有可能命中靶标的少数几个候选分子再交给湿实验验证。这极大地提升了从“草药”到“候选药”的转化效率和成功率。无论你是对AI制药感兴趣的学生还是从事天然产物研发的科研人员或是想了解前沿交叉技术的爱好者这篇文章将为你拆解我们是如何一步步实现这个过程的。2. 整体技术路线与设计思路2.1 为什么选择“AI筛选天然产物DPP-4”这个组合这个技术路线的确立背后是三个关键需求的交汇。首先临床需求明确2型糖尿病作为全球性慢性病患者需要长期服药对药物的安全性、耐受性和成本有极高要求。现有DPP-4抑制剂虽有效但探索结构新颖、作用机制可能更优、副作用谱更佳的替代物始终是药企和科研机构的追求。其次源头创新需求天然产物是创新药物的重要源泉超过一半的上市小分子药物直接或间接来源于天然产物。植物王国蕴含的化学结构多样性远超人工合成的想象力是发现全新骨架化合物的绝佳起点。最后技术可行性成熟近年来深度学习在分子表征、性质预测和虚拟筛选方面取得突破性进展。图神经网络GNN能够精准学习分子的拓扑结构和电子特征非常适合处理天然产物这类复杂有机分子。因此我们的设计思路是一个清晰的流水线“建库 - 初筛 - 精筛 - 验证”。我们构建一个高质量的植物天然产物3D分子结构数据库然后使用基于AI的快速虚拟筛选模型进行第一轮粗筛过滤掉明显不合理的分子接着对胜出的分子进行更精确的分子对接和结合自由能计算最后对排名最靠前的化合物建议进行体外DPP-4酶抑制活性实验验证。整个流程的核心驱动力是AI模型它负责在最耗时的“大海捞针”环节扮演一个经验丰富的“老渔夫”。2.2 核心工具链选型与考量工欲善其事必先利其器。在工具选择上我们遵循“开源优先、社区活跃、精度可靠”的原则。化合物数据库来源我们选择了TCMSP、NPASS和PubChem的植物子集。TCMSP中药系统药理学数据库提供了大量中药成分的ADMET吸收、分布、代谢、排泄、毒性性质这对于后续的成药性初筛非常有用。NPASS天然产物活性与物种来源数据库则关联了天然产物的生物活性数据。PubChem是最大的公共化学数据库我们通过物种筛选提取植物来源的化合物。注意不同数据库的化合物结构格式、手性信息、质子化状态可能不统一必须进行严格的标准化预处理否则会导致后续计算产生严重偏差。AI快速筛选模型我们采用了DeepDock和分子图卷积网络GCN分类器的组合。DeepDock是一个端到端的深度学习模型可以直接从分子图和蛋白质网格预测结合亲和力速度比传统对接快几个数量级适合万级甚至十万级库的初筛。我们自己训练的GCN分类器则用于判断一个分子是否具有“类药性”以及是否可能具备DPP-4抑制剂的某些关键结构特征如能与催化三联体作用的药效团。精确分子对接与计算初筛后的几百个分子我们会用更精确的方法评估。这里选择了AutoDock Vina和薛定谔公司的Glide。Vina开源免费速度快适合中等精度筛选Glide是商业软件其精度在学术界和工业界认可度很高用于最终TOP10-20分子的精细对接和打分。同时会辅以MM-GBSA方法计算结合自由能从热力学角度提供更可靠的结合强度预测。辅助分析与可视化RDKit是贯穿始终的Python化学信息学工具包用于分子处理、特征化、简单描述符计算。PyMOL和Maestro用于可视化对接结果分析分子与靶点蛋白之间的相互作用力氢键、π-π堆积、盐桥等这是理解作用机制的关键。3. 实操流程详解从数据到候选分子3.1 第一步构建与预处理植物天然产物数据库这一步是基石垃圾进垃圾出。我们从多个数据库下载了约5万个声称来源于植物的化合物SDF或SMILES字符串。标准化操作去重复使用RDKit基于InChI Key对分子进行唯一性识别去重后剩下约3.8万个独特结构。结构标准化统一处理价态、移除溶剂分子、生成优势质子化状态在生理pH7.4下。对于DPP-4这样一个溶解性蛋白酶我们通常考虑分子以中性或优势电离状态存在。3D构象生成使用RDKit的ETKDG方法为每个分子生成初始3D构象。这一步至关重要因为后续的对接需要3D结构。我们为每个分子生成最多50个低能构象以备柔性对接之需。类药性Drug-likeness过滤应用经典的“五规则”Rule of Five进行初步过滤剔除分子量大于500、脂水分配系数LogP5、氢键供体5、氢键受体10的分子。这一步大约过滤了15%的分子。实操心得对于天然产物“五规则”可以适当放宽。许多活性很好的天然产物如某些大环内酯或多酚类是“五规则”的违反者。我们这里采用更宽松的筛选条件如分子量800可旋转键15避免在第一步就误杀“大将”。最终我们得到了一个包含约3.2万个标准化3D植物天然产物的初始数据库。3.2 第二步基于AI模型的快速初筛我们不想把3万多个分子都拿去跑耗时的分子对接一个分子对接可能需要几分钟到几十分钟。因此训练一个快速的AI过滤器是核心。数据准备我们从ChEMBL等数据库中收集了已知的DPP-4抑制剂活性IC50 10 μM作为正样本约2000个同时随机选择一些已知对DPP-4无活性的分子作为负样本。确保正负样本在分子量、LogP等基础性质上分布相似避免模型只学会了区分简单的物理化学性质。模型训练使用PyTorch Geometric构建一个GCN分类模型。输入是分子的图表示原子为节点键为边节点特征包括原子类型、电荷、杂化方式等边特征包括键类型、是否共轭等。模型输出是一个二分类概率是/否可能是DPP-4抑制剂。初筛应用将我们准备好的3.2万个天然产物数据库输入训练好的GCN模型。设置一个相对保守的阈值如概率0.7筛选出约5000个“高风险”候选分子。同时我们并行使用DeepDock使用预训练的DPP-4模型对这3.2万个分子进行快速结合打分取打分排名前3000的分子。结果交集取GCN模型预测结果和DeepDock打分结果的交集约1200个分子。交集策略比并集更严格能有效提高筛选的精确度确保进入下一轮的分子既有“抑制剂样”的结构特征又有理论上较好的结合亲和力预测。3.3 第三步精确分子对接与结合模式分析对筛选出的1200个精英分子我们开启高精度计算模式。靶点蛋白准备从PDB数据库获取DPP-4的高分辨率晶体结构如3W2T分辨率1.8Å。在Maestro中处理蛋白去除水分子保留可能的关键水、加氢、优化氢键网络、处理缺失侧链。最关键的是定义对接口袋。我们选择包含催化活性中心Ser630, Asp708, His740以及附近的S1、S2口袋形成一个约20x20x20 Å的立方体网格盒。刚性对接与柔性对接结合第一轮刚性对接Vina将1200个分子以其生成的多个构象对接到固定蛋白的网格盒中。每个分子输出9个结合构象及打分。根据Vina打分单位kcal/mol越低表示结合越强进行排名选取前200个分子。第二轮柔性对接Glide SP/XP对前200个分子使用精度更高的Glide软件进行对接。Glide可以考虑配体一定程度的柔性并进行更细致的打分。我们采用标准精度SP模式初步对接再对SP打分前50的分子使用额外精度XP模式后者能更精确地处理疏水作用和去溶剂化效应。相互作用分析与视觉审查对接不是简单的看打分排名。我们必须用PyMOL打开每一个高分化合物的对接构象人工审查其结合模式是否合理。关键检查点分子是否与催化三联体Ser630, Asp708, His740形成了合理的相互作用是否占据了关键的S1口袋由Tyr662, Val656, Tyr631等残基构成结合构象是否存在严重的空间冲突或不利的张力我们发现的模式许多打分靠前的天然产物如某些黄酮类、生物碱类其结构中的羰基或羟基能与催化Ser630形成氢键芳香环系统能与Tyr662等残基形成π-π或π-阳离子相互作用这与已知的DPP-4抑制剂作用模式高度相似。3.4 第四步结合自由能计算与最终排序分子对接的打分函数Score主要用于排序其绝对值与真实的结合亲和力ΔG相关但不精确。为了获得更可靠的预测我们对Glide XP对接排名前30的复合物进行了MM-GBSA计算。原理简述MM-GBSA分子力学/广义波恩表面积方法通过分子力学计算结合物、受体和配体在溶剂中的能量然后相减得到结合自由能。公式为ΔG_bind G_complex - (G_protein G_ligand)。其中G E_MM G_solv - TSE_MM是分子力学势能键、角、二面角、范德华、静电G_solv是溶剂化自由能GB模型计算极性部分SA模型计算非极性部分TS是熵贡献通常通过简正模式分析估算计算量极大我们采用近似。我们的操作使用AmberTools的MMPBSA.py模块。对每个对接得到的复合物结构进行简单的能量最小化以消除局部冲突然后在隐式溶剂模型GBOBC2下计算结合自由能。计算耗时但比对接更物理。综合排序我们将Glide XP打分和MM-GBSA计算的ΔG_bind结合起来进行综合排序。通常两者趋势一致但MM-GBSA能纠正一些打分函数的明显偏差。最终我们选取了MM-GBSA ΔG_bind -40 kcal/mol这是一个经验阈值表明结合较强且结合模式合理的15个天然产物作为最高优先级的体外实验验证候选名单。4. 关键挑战、问题排查与实战技巧4.1 数据质量最大的“暗坑”项目初期我们曾因为数据库问题栽过跟头。直接从某些数据库下载的分子存在大量的盐形式、金属配合物、甚至错误的立体化学信息。这些“脏数据”输入模型导致预测结果完全不可信。问题表现AI模型预测准确率在测试集上很高但应用到新数据库时筛选出的分子明显不合理如含有金属原子。排查与解决可视化抽查定期随机抽取原始数据和预处理后的数据用PyMOL或ChemDraw可视化直观检查结构是否正常。描述符分布检查计算预处理前后分子库的分子量、LogP、可旋转键等描述符的分布。如果预处理后分布发生剧烈突变说明清洗过程可能过于激进或引入了错误。设置严格过滤器在标准化流程中增加基于化学规则的过滤器比如移除所有含有非有机元素如Fe, B, Si等除非特别需要的分子移除原子数过多200的分子可能是聚合物或错误记录。实战技巧建立一个可复现的数据预处理Pipeline使用Snakemake或Nextflow等流程管理工具将下载、去重、标准化、过滤、3D生成等步骤串联起来确保每次处理的结果一致。并且保存好每一批处理后的数据版本。4.2 AI模型过拟合与泛化能力我们训练的GCN分类器在测试集上准确率达到了92%但用它初筛植物库时却发现它倾向于选出与训练集分子骨架非常相似的化合物而对结构新颖的天然产物“视而不见”。问题本质模型过拟合了训练集中已知抑制剂的具体结构特征而没有学会更通用的“抑制剂-靶点相互作用”原理。解决方案数据增强对训练集中的分子进行简单的数据增强如随机旋转、添加/删除非关键原子上的氢、生成不同的互变异构体等增加模型的鲁棒性。多任务学习我们修改了模型让它同时预测分子是否抑制DPP-4以及预测一些简单的物理化学性质如LogP, TPSA。这种辅助任务有助于模型学习更本质的分子表示而不是仅仅记忆结构。使用预训练模型后来我们尝试了在大型分子数据集如ZINC上预训练的GNN模型如ChemBERTa或GROVER然后在我们较小的DPP-4数据集上进行微调。这种方法显著提升了模型对新颖结构的识别能力。实操心得不要盲目相信测试集准确率。一定要用外部验证集——一组从未参与任何训练/测试过程的、已知活性的天然产物分子我们从文献中另行收集了约100个来评估模型的真实筛选能力。这是检验模型泛化性的“试金石”。4.3 分子对接的“打分陷阱”与构象分析分子对接软件的打分函数并非绝对真理。我们遇到过Glide打分很高但结合模式非常奇怪的情况比如分子完全暴露在溶剂中仅通过一两个弱相互作用结合。典型问题打分高但模式差配体虽然处在口袋内但关键药效团没有与催化残基对齐。构象簇问题一个分子对接出的9个构象分散在能量漏斗的不同位置没有形成明确的优势构象簇说明结合可能不稳定。排查与应对必须人工视觉检查对于排名前50甚至前100的分子逐一查看其最佳构象的结合模式。这是不可省略的步骤。可以编写脚本自动生成每个分子与蛋白相互作用的2D示意图和3D截图提高审查效率。分析构象聚类使用RMSD均方根偏差对同一个分子对接产生的多个构象进行聚类。如果所有构象都分散RMSD 2.0 Å通常意味着该分子与靶点的结合没有明确的取向预测可靠性低应降低其优先级。关注相互作用细节不仅要看氢键数量更要看质量。与主链原子形成的氢键通常比与侧链形成的更稳定。电荷互补、疏水口袋的填充程度都是重要指标。实战技巧建立一个结合模式评分卡。除了软件打分人工根据几个关键维度如与催化三联体作用、S1口袋占据、疏水作用面积、不利接触等进行半定量评分1-5分。将软件打分与人工评分加权结合得到最终排名能有效避免被单一打分函数误导。4.4 从计算到实验的“死亡之谷”计算预测得再漂亮最终也需要实验验证。如何提高计算候选分子的实验成功率成药性早期评估ADMET预测在最终提交实验名单前我们用基于AI的ADMET预测工具如ADMETlab 2.0或商业软件StarDrop对候选分子进行了全面评估。预测其水溶性、肠渗透性、肝微粒体稳定性、CYP450酶抑制、hERG毒性等。剔除那些预测口服生物利用度极差或存在明显毒性风险的分子。这一步将我们的15人名单进一步缩减到8个。可合成性或可获取性考量优先选择那些在植物中含量相对较高、或已有成熟提取分离方法的化合物。对于结构极其复杂、合成难度巨大的分子即使预测很好其开发价值也会大打折扣。我们查阅了天然产物数据库和文献标注了每个候选分子的常见来源植物及大致含量。与药化学家沟通在最终确定名单前与团队内的合成或天然药物化学家讨论。他们能从合成修饰的角度指出哪些分子骨架更有潜力进行后续的结构优化以改善性质。这种交叉学科的碰撞往往能产生更务实的候选列表。5. 项目成果与未来展望通过上述完整的AI驱动筛选流程我们从3.2万个植物天然产物中最终锁定了8个具有高潜力的DPP-4抑制剂候选分子。我们将这8个分子的预测结果、结合模式分析、ADMET性质以及植物来源信息整理成报告移交给了合作方的药物化学实验室。目前实验室已经完成了其中3个化合物的采购与提取并进行了初步的体外DPP-4酶抑制活性测试。令人振奋的是有一个来源于常见中药植物的黄酮苷类化合物在微摩尔级别IC50 ≈ 5.8 μM显示出了明确的抑制活性这与我们MM-GBSA计算的较强结合自由能预测相符。虽然活性距离已上市药物通常纳摩尔级别还有差距但这验证了我们AI筛选流程的有效性为该先导化合物的后续结构优化提供了坚实的起点。回顾整个项目最大的体会是AI不是魔法而是增强人类专家能力的强大杠杆。它无法替代药物化学家对结构的深刻理解也无法替代生物学家对机理的洞察但它能以前所未有的速度将人类的领域知识靶点信息、药效团模型与海量的化学数据关联起来从概率的海洋中打捞出高价值的“信号”。这个项目也清晰地展示了在药物发现领域“干实验”计算与“湿实验”生物的闭环迭代正变得越来越紧密、越来越高效。对于想进入或正在从事AI制药的朋友我的建议是夯实基础结构生物学、药物化学、编程深入理解至少一个环节如分子对接、机器学习建模同时保持对实验科学的敬畏和沟通的意愿。这个领域的魅力恰恰在于它需要你同时具备计算思维和生物医学直觉在0和1的世界与碳氢氧氮的世界之间架起一座创造的桥梁。我们找到的那个黄酮苷分子或许最终不会成为新药但这个过程本身已经为我们点亮了一条从传统草药宝库中利用现代科技发掘新药的可能路径。