基于有向学习策略的整合多组学数据的基因组预测统计模型研究
批准号:
32070689
项目类别:
面上项目
资助金额:
58.0 万元
负责人:
胡学海
依托单位:
学科分类:
生物大数据解析
结题年份:
2024
批准年份:
2020
项目状态:
已结题
项目参与者:
胡学海
中文摘要
基因组预测(genomic prediction, GP)联合利用全基因组所有遗传变异,通过构建准确的统计模型来预测生物体表型。它在人类复杂疾病的早期诊断与精准治疗、植物分子辅助育种方面具有重要科学意义和广阔市场前景。当前,仅基于遗传变异的GP模型在刻画位点间的互作信息方面显示出瓶颈劣势;如何有效整合遗传信息传递经过的表观组、转录组、代谢组等中间组学信息,并从生物系统层面反映互作信息被普遍认为是突破瓶颈的关键。本项目拟创新性地提出一种包含多层统计模型的有向学习仿生策略:我们将遗传变异或DNA甲基化视为工具变量,拟在中间组学数据的监督下依次学习到能反映互作信息的中间遗传特征,并以此作为中间纽带进行表型预测。另外,我们拟自洽引入反向传播技术以迭代循环方式进一步提高预测准确性。最后,我们拟将其应用于人类癌症预后预测和杂交水稻全基因组选择两个领域中,期望能为人类精准医疗和植物分子育种提供有力支撑。
英文摘要
Genomic prediction jointly employs genome-wide genetic variants to construct accurate and valid statistical models for predicting phenotypes. It has great scientific significance and broad market prospect on human precision medicine and marker-assisted plant breeding. With the rapid development of advanced biological experiments, intermediate omics including epigenomics, transcriptome and metabolome have been intensively studied. The GP model only based on genetic variants has met a bottleneck on its defect for inadequate characterization of gene interaction information. Then how to integrate intermediate omics to reflect gene interaction information is regarded as the key for breaking through the bottleneck. In this project, we propose an innovative directed learning strategy including multiple layers of statistical models. We will take genetic variants as instrumental variables, and iteratively learn multiple layers of genetic features supervised by observed intermediate omics, and then we will employ these genetic features to predict phenotypes. Additionally, we will introduce back-propagation into the above directed learning strategy to further improve model predictability. Finally, we will apply it on cancer prognosis prediction in human and genome selection in hybrid rice. We hope that it will provide helpful supports to human precision medicine and marker-assisted plant breeding.
基于分子标记物的生物体表型预测无论在人类复杂疾病提前诊断还是在植物分子辅助育种领域都具有重要意义。主要以整合中间分子表型为优势的有向学习框架是表型预测领域的重要策略与方法。本项目重点研究以遗传标记或DNA甲基化为工具变量的有向学习理论与方法,并关注其在TCGA前列腺癌预测与玉米Cubic群体产量预测的实际应用研究。首先,我们构建了基于有向学习框架的全基因预测(omnigenic-based model)模型,并在玉米Cubic群体产量预测获得了成功。而且,借助有向学习有力工具,我们可以开展“外围基因”的研究,有助于挖掘不显著但具有“微效”作用的玉米产量关联基因。其次,我们构建了基于有向学习框架的DMDL模型,并在TCGA前例腺癌数据集上表现优异。而且,借助有向学习回溯策略,我们筛选到了HPV通路富集的基因,揭示了前例腺癌与HPV感染之间的联系。与此同时,本项目还开展了基于深度学习的植物转录因子结合位点预测研究和植物核心启动子活性预测研究,综述了深度学习在调控基因组领域的众多应用。本项目的研究成果不仅极大丰富了表型预测领域的技巧与方法,也开拓了植物调控基因组的深度学习预测模型新的研究方向。
分形与序列复杂度方法在DNA调控元件预测中的应用
-
批准号:11671003
-
项目类别:面上项目
-
资助金额:48.0万元
-
批准年份:2016
-
负责人:胡学海
-
依托单位:
形式级数域上若干丢番图逼近问题的分形性质研究
-
批准号:11001093
-
项目类别:青年科学基金项目
-
资助金额:17.0万元
-
批准年份:2010
-
负责人:胡学海
-
依托单位:
国内基金
海外基金