Integrative machine learning approaches for predicting disease risk using multi-omics data from the UK Biobank.

Integrative machine learning approaches for predicting disease risk using multi-omics data from the UK Biobank.
复制标题

使用英国生物银行的多组学数据预测疾病风险的综合机器学习方法。

DOI:
10.1101/2024.04.16.589819
复制
发表时间:
2024
期刊:
bioRxiv : the preprint server for biology
影响因子:
--
通讯作者:
Rivas,ManuelA
Rivas,ManuelA
中科院分区:
--
文献类型:
--
作者:
Aguilar,Oscar;Chang,Cheng;Bismuth,Elsa;Rivas,ManuelA

文献摘要

相似文献

我们使用多组学数据训练预测和生存模型,用于疾病风险识别和分层。现有的疾病预测工作侧重于使用个体数据类型(代谢组学,基因组学,人口统计学)的数据集进行风险分析,而我们的研究创建了一个用于疾病风险评估的集成模型。我们比较了Lasso Regression、Multi-Layer Perceptron、XG Boost和ADA Boost等机器学习模型来分析多组学数据,并结合了各种疾病和特征组合的ROC-AUC评分比较。此外,我们为每种疾病训练考克斯比例风险模型来进行生存分析。尽管多组学数据的整合显著提高了8种疾病的风险预测,但我们发现,与标准的人口统计学、遗传学和生物标志物特征相比,代谢组学数据的贡献微不足道。尽管如此,我们看到代谢组学是一个有用的替代标准生物标志物面板时,它是不容易获得。
We train prediction and survival models using multi-omics data for disease risk identification and stratification. Existing work on disease prediction focuses on risk analysis using datasets of individual data types (metabolomic, genomics, demographic), while our study creates an integrated model for disease risk assessment. We compare machine learning models such as Lasso Regression, Multi-Layer Perceptron, XG Boost, and ADA Boost to analyze multi-omics data, incorporating ROC-AUC score comparisons for various diseases and feature combinations. Additionally, we train Cox proportional hazard models for each disease to perform survival analysis. Although the integration of multi-omics data significantly improves risk prediction for 8 diseases, we find that the contribution of metabolomic data is marginal when compared to standard demographic, genetic, and biomarker features. Nonetheless, we see that metabolomics is a useful replacement for the standard biomarker panel when it is not readily available.