生信宝典
导 语
中山大学药学院巫瑞波教授、万国辉教授团队联合海南大学药学院团队,在期刊《Acta Pharmaceutica Sinica B》(影响因子 14.6)发表了题为 “TeroACT: A terpenoid bioactivity landscape and discovery platform” 的研究论文。团队构建了首个以萜类为中心的综合性知识图谱,并开发了 AI 驱动的药物发现平台 TeroACT,通过 “计算预测 – 实验验证” 的闭环策略,成功筛选出多个具有抗黑色素瘤和抗炎活性的萜类化合物,为萜类药物的高效开发提供了全新工具和重要线索。
摘 要
萜类化合物表现出多样的生物活性,因此具有广泛的药理学应用。在现代药物发现中,数据驱动的深度模型在促进高效的特征表示和知识推理方面发挥着关键作用。为了探索萜类化合物未知的生物活性空间,构建一个多维关系型萜类化合物数据库对于绘制萜类化合物-生物活性图谱至关重要。在本研究中,团队首先通过整合各种数据类型(包括萜类化合物、蛋白质靶点、细胞靶点、基因、疾病及其相互关系)构建了一个大规模的生物知识图谱。随后,团队开发了一个基于网络的疾病预测模型,并优化了多个化合物-蛋白质相互作用预测工具,以扩展活性研究框架。这些资源已部署在一个用户友好的网络平台(TeroACT)上,可通过以下地址访问:http://terokit.qmclab.com/teroact/。使用 TeroACT 平台内的计算机模拟模型,团队筛选了多种萜类分子用于抗黑色素瘤活性。体外和体内动物模型进一步验证了大叶茜草素和毛两面针素在黑色素瘤中的抗迁移和抗增殖作用。此外,综合的计算筛选和实验方法发现了许多具有抗炎特性的萜类化合物。从这个意义上说,TeroACT 通过提供全面的数据资源和 AI 驱动的药物发现工具,填补了萜类化合物生物活性研究的空白。
介 绍
萜类化合物是经甲基重排和功能修饰的萜烯衍生物,以异戊烯基二磷酸(IPP)、二甲基烯丙基二磷酸(DMAPP)等 C5 单元为基础,广泛存在于植物、动物和微生物中,是最大类别的次级代谢产物。自 1884 年首次被分离分析以来,已发现或合成超过 18 万种萜类分子,凭借多样的碳骨架、手性中心和取代基形成庞大化学空间,按 C5 单元数量可分为单萜(C10)、倍半萜(C15)、二萜(C20)、三萜(C30)等,兼具抗癌、抗菌、抗炎、抗氧化等多种生物活性,在重大疾病治疗中具有重要药物开发潜力。
黑色素瘤作为侵袭性皮肤恶性肿瘤,具有进展快、死亡率高、预后差的特点,而萜类化合物可通过调节细胞增殖、凋亡及转移相关信号通路发挥潜在治疗作用,例如桉叶油素、β- 榄香烯等已被证实具有抗黑色素瘤活性,但目前尚无相关专项临床试验,其作用机制与临床转化仍需深入研究。
随着活性数据积累,TeroKit、TCMBank、DrugBank 等数据库已收录大量萜类化合物的结构、靶点及活性信息,数据驱动方法结合知识图谱(KG)、KG 嵌入(KGE)等计算技术,成为挖掘萜类生物活性、预测潜在先导化合物的重要工具。本研究构建了涵盖萜类结构、靶蛋白、基因、细胞系、疾病及其关联的大规模生物活性网络,开发了萜类 – 疾病关联预测模型(TerDA),并部署于 TeroACT 平台,通过该平台成功筛选出多种抗黑色素瘤抑制剂,体外和体内实验均证实了大叶茜草素(mollugin)和毛两面针素(columbianadin)的抗增殖与抗侵袭作用。
实验方法
萜类生物活性知识图谱构建
团队整合了多个数据库的多类型数据,构建了大规模萜类生物活性知识图谱:
1.数据来源:从 TeroKit、TCMBank、DrugBank 收集萜类化合物的结构、活性数据;从 Cellosaurus 获取细胞系与疾病的关联信息;从 CTD、GeneCards、TTD 数据库获取基因、蛋白靶点与疾病的关系数据;补充萜类化合物与蛋白靶点的相互作用(CPI)数据。
2.数据整合与标准化:使用 PostgreSQL 数据库软件构建标准化的 CPI 信息存储库,以基因为桥梁将蛋白靶点按疾病类型分类,最终形成包含 11,653 种独特萜类化合物(含衍生物)、1321 个靶蛋白、975 个细胞系、1178 个基因靶点和多种疾病(含 ICD-11、NCIt、ORDO 三种标识符)的知识图谱,完整呈现 “萜类 – 靶点 – 基因 – 细胞系 – 疾病” 的多维度关系。
图 1. 萜类化合物综合生物活性网络的构建方案与概述
TerDA 预测模型开发
1.分子特征融合模块
1)分子描述符计算:使用 RDKit Python 库计算 10 种分子描述符,包括 Wildman-Crippen 分配系数(logP)、拓扑极性表面积(TPSA)、分子量(MW)、类药性(QED)、摩尔折射率(MR)、氢键受体数(HBA)、氢键供体数(HBD)、芳香环数、可旋转键数(RB)和 FractionCSP3;
2)理化特征提取:对分子描述符进行条件数值转换,生成描述符特征矩阵,经 CNN 层和池化层处理后,输出表征分子理化性质的特征向量;
3)拓扑特征提取:将分子结构建模为图网络,通过邻接矩阵和特征矩阵表示分子,经 GCN 层和读出层处理后,输出表征分子拓扑结构的特征向量;
4)特征融合:采用早期融合策略,将 CNN 提取的理化特征向量与 GCN 提取的拓扑特征向量拼接,通过多层感知器(MLP)投影到联合表示空间,得到统一的分子特征表征。
2.链接预测模块
采用三种经典 KGE 模型作为解码器,建模萜类 – 疾病关联:
1)DistMult 模型:
通过内积建模二阶相关性, scoring 函数为:
其中,t 为萜类分子嵌入向量,d 为疾病嵌入向量,Wr为关系权重矩阵。
2)TransE 模型:
基于平移假设,认为萜类分子嵌入向量经关系向量平移后与疾病嵌入向量接近,采用 L2 范数衡量相似度:
其中,r 为关系嵌入向量。
3)TransH 模型:
将关系平移向量置于关系特定的超平面上,避免 TransE 模型在复杂关系建模中的局限性,scoring 函数为:
其中,wr为超平面法向量,dr为关系平移向量。
3.模型训练与优化
1)样本构建:将已验证的萜类 – 疾病对作为正样本(标签 = 1),未验证的对作为负样本来源(标签 = 0),按 1:1、1:5、1:10 的正负样本比例构建训练集;
2)损失函数:
采用加权交叉熵损失函数解决类别不平衡问题:
其中,Δ为正样本集,Δ’为负样本集;
3)超参数优化:使用 PyTorch 实现模型,采用 Adam 优化器,初始学习率在 {0.01, 0.03, 0.05, 0.07} 中调优,衰减率为 0.97-0.996,实体和关系嵌入维度为 8-512,GCN 和 CNN 层数为 1-3 层。
图 2. TerDA 预测模型的架构
CPI 预测工具整合
团队优化并整合了 7 种主流 CPI 预测方法,包括 SPVec_Tero、DeepCDA、CPI_GNN、MONN、CPI_HGCNc、MolTrans 和 TransformerCPI,这些工具支持萜类化合物与靶蛋白的结合潜力预测,为靶点钓鱼和虚拟筛选提供支持。
体外实验验证
1.细胞培养
1)细胞系:A375、B16-F10(黑色素瘤细胞)、293T、Hacat(角质形成细胞)、NCM460(结肠上皮细胞)、Raw264.7(巨噬细胞);
2)培养条件:DMEM 培养基(含 10% 胎牛血清和 1% 青霉素 / 链霉素),37℃、5% CO₂ humidified 培养箱。
2.关键实验方法
1)细胞活力检测(CCK8 法):将细胞以 8×10³ 个 / 孔接种到 96 孔板,经不同浓度萜类化合物处理 24-48h 后,加入 CCK8 试剂孵育 3h,在 450nm 处检测吸光度,计算 IC50 值;
2)凋亡检测(Annexin V-FITC/PI 双染法):细胞经化合物处理后,收集并洗涤,加入 Annexin V-FITC 和 PI 染色液,室温避光孵育 15min,流式细胞仪分析凋亡率;
3)增殖检测(EdU 标记法):细胞经 30-60μmol/L 化合物处理 36h 后,加入 EdU 标记液孵育 3h,固定、透化后用 Alexa Fluor 555 染色,Hochest 染核,荧光显微镜观察并统计增殖细胞比例;
4)集落形成实验:B16-F10 细胞以 2000 个 / 孔接种到 12 孔板,经化合物处理后培养 1-2 周,甲醛固定、结晶紫染色,计数集落数;
5)迁移与侵袭检测:伤口愈合实验(划痕法)检测水平迁移能力,Transwell 实验(8μm 孔径滤膜)检测垂直侵袭能力;
6)Western blot 与 qRT-PCR:检测 NF-κB、IκBα 等信号通路相关蛋白和基因的表达水平;
7)表面等离子体共振(SPR):使用 Biacore 8K 仪器,通过胺偶联法将 FABP5 蛋白固定在 CM5 芯片上,注射不同浓度的 mollugin,采用 1:1 Langmuir 结合模型计算解离常数(KD)。
体内实验验证
1.动物模型:8 周龄 SPF 级 C57 小鼠,随机分为对照组和给药组(n=5 / 组);
2.肿瘤模型构建:皮下注射 0.1mL 含 1×10⁶个 B16-F10 细胞的悬液,构建黑色素瘤异种移植模型;
3.给药方案:肿瘤可触及后,每隔一天口服给予 mollugin(25mg/kg、75mg/kg)或 columbianadin(20mg/kg、60mg/kg)的生理盐水 / 玉米油混悬液;
4.肿瘤检测:
每日用卡尺测量肿瘤长径和短径,按公式计算肿瘤体积:
实验终点处死后,收集肿瘤组织称重,进行 HE 染色分析。
平台部署
将构建的知识图谱、TerDA 预测模型和 CPI 预测工具部署在 web 平台 TeroACT,提供实体检索、药物重定位、靶点钓鱼、虚拟筛选等功能,支持批量输入和结果可视化。
研究结果
萜类生物活性知识图谱特征
1.萜类结构与活性分布:从 TCMBank 中识别出 2526 种结构丰富的萜类化合物,其中仅 19% 具有已知活性注释,主要集中在抗炎、免疫调节和抗肿瘤领域;DrugBank 中 238 种萜类药物中,111 种小分子药物与特定靶点有明确相互作用,且 60% 的萜类药物可与多个蛋白靶点结合,显示出多靶点治疗潜力;
2.药物 – 靶点网络示例:青蒿素(抗疟药物)作为研究最广泛的萜类药物之一,已被重新定位用于治疗系统性红斑狼疮和 COVID-19,且正在探索用于恶性肿瘤和炎症性疾病治疗;
3.CPI 活性空间可视化:基于分子相似度(Tanimoto 系数≥0.7)构建的 CPI 生物活性化学空间网络显示,相同环骨架的化合物聚集在同一模块中,便于构效关系分析;例如 Component_1516 中的化合物与胆汁酸受体相互作用,存在明显的活性悬崖(如鹅去氧胆酸与其差向异构体熊去氧胆酸的活性差异)。
TerDA 模型性能优势
1.分类性能评估
5 折交叉验证结果显示,TerDA 模型在不同正负样本比例(1:1、1:5、1:10)下均表现出优于 HNet-DNN、REDDA、LHGCE、HDGAT 四种基线模型的分类性能:
1)当正负样本比例为 1:10 时,TerDA(DistMult)的 Accuracy 达 0.978、AUC 达 0.990、AUPR 达 0.943,Precision 和 Recall 分别为 0.905 和 0.881,均显著高于基线模型;
2)DistMult 解码器的性能优于 TransE 和 TransH,其双线性相互作用机制能更有效地捕捉细粒度语义信息,对稀有萜类 – 疾病对的泛化能力更强。
表 1. TerDA 与所有基线模型在分类指标上的性能比较
2.排序性能评估
在推荐系统常用的排序指标上,TerDA 模型同样优于 LHGCE:
1)当正负样本比例为 1:10 时,TerDA 的 MR(平均排名)仅为 9.8,MRR(平均倒数排名)达 0.765,Hit@1、Hit@3、Hit@10 分别为 0.690、0.815、0.899,显著高于 LHGCE 的对应指标,表明其在潜在适应症推荐中具有更强的精准性。
表 2. TerDA 与 LHGCE 在排序指标上的性能比较
3.药物重定位性能
在全局和局部药物重定位任务中,TerDA 模型展现出强大的鲁棒性:
1)全局药物重定位:当知识图谱中已知萜类 – 疾病关联减少 20%-80% 时,TerDA 的 MR 始终低于 LHGCE,MRR 和 Top-k 命中率更高,表明其在数据稀疏情况下仍能有效预测潜在关联;
2)局部药物重定位:对 10 种萜类化合物的 40 种疾病关联进行部分屏蔽后,TerDA 预测的关联排名集中在 40 名以内,平均排名稳定在 50 左右,显著优于 LHGCE,表明其能充分利用知识图谱的拓扑特征补偿局部信息缺失。
图 3. 药物重定位任务中的性能比较
抗黑色素瘤萜类化合物的筛选与验证
1.虚拟筛选结果
通过 TeroACT 平台的多模型集成策略,对知识图谱中的所有萜类 – 疾病对进行评分,筛选出一批具有潜在抗黑色素瘤活性的萜类化合物:
1)排名前 7 的化合物中,6 种(columbianadin、7-epitaxol、periplogenin、mollugin、pseudolaric acid A、arteannuin B)对 A375 黑色素瘤细胞表现出显著的细胞毒性和抗增殖活性,而排名较低的 7 种化合物几乎无抗黑色素瘤活性;
2)基于 ILS@20 指标(衡量结构新颖性),选择与已知活性分子相似度低于 0.7 的 columbianadin 和 mollugin 进行深入验证(二者此前未报道过抗黑色素瘤活性)。
表 3. 13 种萜类化合物(含衍生物)抗黑色素瘤的预测排名和实验活性结果
2.体外验证结果
1)抗增殖活性:CCK8 实验显示,mollugin 对 A375 和 B16-F10 细胞的 IC50 分别为 25μmol/L 和 59μmol/L,columbianadin 的 IC50 分别为 32μmol/L 和 69μmol/L,且二者对正常细胞(293T、Hacat、NCM460)的 IC50 均超过 100μmol/L,显示出良好的肿瘤选择性;
2)集落形成抑制:两种化合物均能显著抑制 B16-F10 细胞的集落形成能力,且呈浓度依赖性(图4B);
3)增殖抑制机制:EdU 标记实验证实,mollugin 和 columbianadin 可显著降低 A375 和 B16-F10 细胞的增殖比例(图4C);
图 4. mollugin 和 columbianadin 在体外对黑色素瘤的抗增殖作用验证
4)抗迁移与侵袭:伤口愈合实验和 Transwell 实验显示,mollugin(30-60μmol/L)和 columbianadin(20-40μmol/L)能显著抑制黑色素瘤细胞的水平迁移和垂直侵袭能力;
图 5. mollugin 和 columbianadin 在体外对黑色素瘤细胞迁移和侵袭的抑制作用
5)诱导凋亡:Annexin V-FITC/PI 双染实验显示,两种化合物可诱导 A375 和 B16-F10 细胞凋亡,且凋亡率随浓度升高而增加;
图 6. mollugin 和 columbianadin 诱导黑色素瘤细胞凋亡
6)靶点验证:SPR 实验证实 mollugin 与 FABP5 蛋白存在直接相互作用,KD 值为 1.03μmol/L;qRT-PCR 和 Western blot 结果显示,mollugin 可下调脂质代谢相关基因(ACC、FASN、CPT1A、SREBPs、PPARγ)的表达,抑制 NF-κB 信号通路激活。
3.体内验证结果
1)肿瘤生长抑制:在 B16-F10 异种移植模型中,mollugin(25mg/kg、75mg/kg)处理组的肿瘤体积和重量显著低于对照组,且无明显体重下降(图7A、B);
2)columbianadin 体内效果:尽管 columbianadin 在体外表现出抗黑色素瘤活性,但体内实验中未显示显著的肿瘤抑制作用,推测其在体内快速代谢为无细胞毒性的 columbianetin(CBT)是主要原因(图7C、D);
图 7. mollugin 和 columbianadin 在黑色素瘤 – CDX 模型中的体内抗肿瘤活性
3)安全性评估:HE 染色显示,mollugin 和 columbianadin 处理组小鼠的心脏、肝脏、脾脏、肺、肾脏等主要器官无明显病理损伤,证实其在治疗剂量下的系统性安全性(图8C)。
图 8. mollugin 和 columbianadin 的体内外毒性评估
抗炎萜类化合物的筛选与验证
为验证模型的泛化性,研究团队通过 TeroACT 平台筛选抗炎萜类化合物:
1.虚拟筛选预测 23 种萜类化合物具有广谱抗炎潜力;
2.体外实验验证:在 LPS 刺激的 Raw264.7 巨噬细胞模型中,这些化合物能不同程度降低促炎细胞因子(IκBα、CXCL2、IL-1β、IL-6)的水平,其中 ethisterone、incensole 和 Euphorbia factor L3 通过抑制 LPS 诱导的 NF-κB 激活发挥抗炎作用;
3.分组比较显示,高排名(rank≤20)和高评分(score≥0.95)组的促炎因子水平显著低于低排名和低评分组(P<0.05),证实了 TerDA 模型的抗炎活性预测能力。
TeroACT 平台功能
1.知识图谱检索:支持萜类化合物、蛋白靶点、基因、细胞系、疾病等实体的精准和模糊检索,展示多维度关联信息;
2.TerDA 预测工具:支持单个或批量分子的药物重定位,生成 Top-k 适应症推荐列表或自定义疾病的预测分数和排名;
3.CPI 预测工具:整合 7 种 CPI 预测方法,支持萜类化合物与靶蛋白的结合潜力预测,为靶点钓鱼和机制研究提供支持;
4.开放性:平台免费向学术用户开放,无需注册,同时提供 TerDA 模型的开源代码,便于研究者二次开发。
图 9. TeroACT web 服务器的整体框架和功能概况
讨论与结论
在本研究中,团队介绍了 TeroACT——一个致力于萜类化合物活性发现的平台,由一个以萜类化合物为中心的知识图谱支持,并配备了用于系统探索萜类化合物生物活性的计算工具。其中,TerDA 模型利用预先提取的分子语义特征和知识推理,准确预测萜类化合物-疾病关联,显示出优于基线方法的推荐性能。此外,TeroACT 集成了优化的机器学习方法,用于专门针对萜类化合物靶点识别的化合物-蛋白质相互作用(CPI)预测。该平台不仅为高效信息检索提供了全面的化学-生物活性数据集,还为基于萜类化合物的治疗发现提供了宝贵的见解。通过将该平台与实验验证相结合,团队进行了一项抗黑色素瘤药物筛选活动,识别出六种具有显著细胞抗肿瘤功效的高优先级萜类化合物。其中,两种结构新颖的化合物——大叶茜草素和毛两面针素,通过一系列体外和体内实验,进一步在黑色素瘤中表现出抗增殖和抗侵袭作用。展望未来,本研究突出了 TeroACT 作为一个可扩展和可预测的框架,在加速萜类化合物药物研究方面的实用性。它为未来萜类化合物药物重定位和新治疗适应症推断的研究铺平了道路。
开源工具链接:
TeroACT web 平台:
http://terokit.qmclab.com/teroact/
TerDA 模型 GitHub 仓库:
TerDA 模型 Zenodo 仓库: