基于元学习及Lp-Lq正则编码的有监督多组学分析模型及其应用
批准号:
62102261
项目类别:
青年科学基金项目(C类)
资助金额:
30.0 万元
负责人:
黄海辉
依托单位:
学科分类:
生物信息计算与数字健康
结题年份:
2024
批准年份:
2021
项目状态:
已结题
项目参与者:
黄海辉
中文摘要
多组学数据的整合分析为揭示疾病的分子机理提供了全新思路。而生物数据中高噪音、类别严重失衡、高维小样本等特点给现代机器学习框架带来了严重挑战。本课题以有监督多组学分析中样本选择(即样本及组学权重分配)及特征选择技术为研究对象,主要采用元学习和Lp(0<=p<=1)-Lq(1<q<=2)(Lp-Lq)正则编码两种理论,研究可基于数据进行自适应调节的样本及特征选择算法。重点研究如下内容:1)设计能充分挖掘多组学数据同异质性的有监督多组学分析框架,随后研究样本及组学权重与显式加权函数的映射形式。2)推导出Lp-Lq的广义阈值收缩算子和拟合项的梯度算子,随后提出Lp-Lq的梯度迭代算法并研究其收敛性。3)构建基于元学习及Lp-Lq正则编码的有监督多组学分析模型,实现针对不同任务对自身权重函数及模型参数分布进行自适应调节。4)发现类风湿病证诊断的生物标记物,助力建立病证结合诊断类风湿新方案。
英文摘要
The integrated analysis of multi-omics data provides new ideas to reveal the molecular mechanisms of diseases. However, the characteristics of high noise, severe category imbalance, and high-dimensional low-sample-size in biological data pose severe challenges to modern machine learning frameworks. In this study, we focus on sample selection (i.e., sample and omics weights assignment) and feature selection techniques in supervised multi-omics analysis, mainly using two theories of meta-learning and Lp(0<=p<=1)-Lq(1<q<=2) (Lp-Lq) regular coding, to investigate sample and feature selection algorithms that can be adaptively adjusted based on data. The key research is as follows: 1) Designing a supervised multi-omics analysis framework that can fully exploit the homogeneity and heterogeneity of multi-omics data, and subsequently studying the mapping form of sample and view weights to explicit weighting functions. 2) Derive the generalized threshold contraction operator and the gradient operator of the fitted term of Lp-Lq, and subsequently propose the gradient iteration algorithm of Lp-Lq and study its convergence. 3) Construct a supervised multi-omics analysis model based on meta-learning and Lp-Lq regular coding, and realize adaptive adjustment of its own weight function and model parameter distribution for different tasks. 4) Discover biomarkers for the diagnosis of rheumatoid disease and help establish a new scheme for rheumatoid disease diagnosis combined with disease and syndrome.
多组学数据的整合分析为揭示疾病的分子机理提供了全新思路,但生物数据中普遍存在的高噪音、类别严重失衡、高维小样本等特点给现代机器学习框架带来了严峻挑战。本项目围绕有监督多组学分析中的样本选择及特征选择技术开展研究,在理论方法和实际应用两个层面取得了重要进展。在基于元学习的数据自适应样本选择方面,项目提出了多组学元学习算法,通过设计自适应样本权重计算机制,实现了对不同噪声水平样本的动态调整;通过构建多组学交互式正则化策略,有效捕获了不同组学层次间的生物学联系,较好地提升了多组学数据的整合分析效果。该算法在多个实际数据集的验证中展现出优越性能,在分类准确度和生物标志物选择稳定性等方面均优于现有方法。在基于数据可调节的样本及特征选择方面,项目构建了自步学习L1/2绝对网络逻辑回归模型,通过融合自步学习策略和网络正则化方法,较好地提升了基因选择和表型分类的准确性。项目对Lp-Lq非凸结合强凸正则化算子进行了探索,虽暂未能完全推导出可行的显式解,但多轮数值尝试为后续研究奠定了重要基础。这些创新方法成功应用于类风湿关节炎病证结合诊断分子标记物识别研究,通过分析多组学数据揭示了疾病发展的分子机制,为建立病证结合诊断新方案提供了理论依据。同时,研究成果还拓展应用至慢性阻塞性肺疾病的生物标志物识别、肿瘤预后分析、抗TNF治疗响应预测等领域。以第一或通讯作者发表SCI论文9篇(其中1篇入选ESI高被引论文,中科院一区论文3篇、二区论文3篇),发表学术专著1部、授权或申请发明专利2项、技术转化1项,登记软件著作权2项,参与制定国家标准1项。相关研究成果为复杂疾病的分子机理研究和临床诊断提供了系统的方法体系,对推动多组学数据分析方法的发展和促进精准医疗实践具有重要意义。研究成果已被国内外多个研究团队采用,并在实际临床应用中发挥重要作用,展现出良好的社会效益和应用价值。
国内基金
海外基金