课题基金 / 基金详情

面向海量原始多组学数据的序列快速检索方法研究

批准号:
32100511
项目类别:
青年科学基金项目(C类)
资助金额:
30.0 万元
负责人:
王彦青
学科分类:
生物数据资源与分析方法
结题年份:
2024
批准年份:
2021
项目状态:
已结题
项目参与者:
王彦青

项目摘要

结项摘要

相似基金

相关文献

中文摘要
随着下一代基因组测序技术的发展,组学原始测序数据成爆炸式增长。国际上,NCBI的SRA库存储的序列长度已超过50Pb,其中可公开访问的序列超过20Pb。国内,国家基因组科学数据中心的组学原始数据归档库GSA所存储的数据量也超过了7PB。随着基因测序数据的快速增长,传统的基于序列比对的检索算法已经不适用于大规模数据检索。近年来,基于手绘草图(sketch)的算法和技术的研究,在计算生物学领域广泛开展,主要应用于序列聚类、物种分类等研究中。本课题将面向GSA数据库中的海量原始多组学数据,基于手绘草图的算法思想,研发一种基于布隆过滤器(Bloom Filter)的K-mer索引库,并在此基础上实现基因序列快速检索工具。该工具将使用GSA中的公开数据建立索引库,实现面向海量原始多组学测序数据的快速序列查询,进而可以应用于病原微生物溯源、临床微生物学研究以及公共卫生研究中。
英文摘要
Exponentially increasing amounts of raw sequencing data are stored in the global archives. The ability to query these data for sequence search-terms would facilitate both basic research and applications such as for pathogenic microorganism traceability, and clinical microbiology research. Traditional methods, usually based on sequence alignment methods, are not capable of handle these retrievals. In recent years, probabilistic methods such as sketching are introduced to computational biology to solve the problem. In this research, we will develop a new searchable K-mer tool to solve this problem. We will use the Bloom Filter as a sketching structure, then compress the K-mers decomposing from the GSA dataset to a condensed K-mer index database. Fast search of the GSA raw sequence data can be realized based on the index database. The tool will be used in pathogenic microorganism traceability, clinical microbiology researches and public health researches.
随着下一代基因组测序技术的发展,组学原始测序数据呈爆炸式增长。在国内,国家生物信息中心-国家基因组科学数据中心的组学原始数据归档库GSA所存储的数据量已超过了60PB。随着基因测序数据的快速增长,传统的基于序列比对的检索算法已经不适用于大规模数据检索。近年来,基于手绘草图(sketch)的算法和技术的研究,在计算生物学领域广泛开展,主要应用于序列聚类、物种分类等研究中。本课题研发了基于K-mer索引库的短序列快速物种归类工具,并应用于GSA数据库中,实现了对用户汇交数据的快速归类分析;研发了一种基于de Bruijn图(de Bruijn Graph)的K-mer索引库,并在此基础上实现了基因组序列的快速检索。此外,研发了基于K-mer签名的物种分类和聚类方法,初步实现了基于参考基因组序列的多目标索引库序列检索流程。本课题的研究成果为大规模基因组测序数据的存储、分类、检索提供了创新性解决方案,具有显著的科学意义与应用前景,可应用于面向大规模宏基因组原始测序数据的物种检测、序列检索,以及特定物种测序序列污染过滤等研究。
国内基金
海外基金