我们的服务符合学术规范和道德
专业 高端让您使用时没有后顾之忧

疾病监测2025年第05期:基于泛基因组特征的机器学习模型预测肺炎克雷伯菌对美罗培南的表型耐药

来源:期刊VIP网 时间:


作者:王瑜昊;赵俊岭;黄佳;吴鑫淼;卢昕;阚飙;李臻鹏;

单位:新疆医科大学公共卫生学院;新疆维吾尔自治区疾病预防控制中心病原生物鉴定所;中国疾病预防控制中心传染病预防控制所,传染病溯源预警与智能决策全国重点实验室;

摘要:目的 建立基于全基因组特征的肺炎克雷伯菌对美罗培南表型耐药的机器学习模型,发现潜在耐药相关基因。方法 从细菌和病毒生物信息学资源中心数据库及美国国家生物技术信息中心的抗菌素耐药性生物体国家数据库数据库收集同时有表型数据和全基因组数据的菌株。使用RGI 6.0.3软件分析菌株基因组携带的耐药基因,使用PanTa 1.0.0软件分析菌株的泛基因组,分别使用耐药基因和附属基因作为纳入特征,构建预测肺炎克雷伯菌对美罗培南耐药表型的LightGBM、随机森林、logistic回归模型,使用分层嵌套交叉验证对模型进行特征筛选、超参数优化及模型评估,得到最优模型,使用Shapley可加性解释算法对特征的贡献进行评估。结果 经质量控制,有5 800株基因组纳入模型,其中对美罗培南耐药和敏感的菌株分别有2 171和3 629株,这些菌株包含泛基因258 333个,耐药基因436个。基于耐药基因分别构建的3种模型中,随机森林的拟合效果最佳。模型筛选到64种耐药基因,其曲线下面积(AUC)值、平衡准确度、召回率、特异度、精确度和阴性预测值分别为0.916、87.84%、81.66%、94.02%、89.09%和89.55%。基于泛基因组构建的3种模型中,拟合效果最好的是了logistic回归。经过筛选得到了156种耐药相关的候选基因,其中包括27个已证实的耐药基因和129个潜在耐药相关基因,该模型优于耐药基因构建的模型,其AUC值、平衡准确度、召回率、特异度、精确度和阴性预测值分别0.943、89.48%、85.16%、93.79%、89.16%和91.36%。进一步使用Shapley可加性解释算法评估了特征基因对模型的贡献。模型发现的前15个贡献最大的基因中有6个为未被证实的潜在耐药相关基因,如yojI、mobA、xerC和ynfE。所建立的预测模型已被封装为命令行软件predMemRes(https://github.com/Wangyuhao66/predMemRes),该软件能够基于肺炎克雷伯菌基因组序列快速预测菌株对美罗培南的耐药表型。结论 机器学习模型可有效用于预测肺炎克雷伯菌对美罗培南表型耐药,并发现潜在耐药相关基因。

关键词:肺炎克雷伯菌;;机器学习;;美罗培南;;耐药

基金资助:国家重点研发项目(No.2022YFC2303900)~~