Incorporating sequence quality data into alignment improves DNA read mapping.

Incorporating sequence quality data into alignment improves DNA read mapping.
复制标题

DOI:
10.1093/nar/gkq010
复制
发表时间:
2010-04
影响因子:
14.9
通讯作者:
Horton P
Horton P
中科院分区:
生物学2区
文献类型:
--
作者:
Frith MC;Wan R;Horton P

文献摘要

参考文献

被引文献

相似文献

新的DNA测序技术在通量上取得了突破,但代价是更高的错误率。解释生物序列的主要方法是通过比对,但标准比对方法假设序列是准确的。在这里,我们描述了如何将测序仪报告的每个碱基的错误概率结合到比对中。与现有的DNA读取映射工具不同,我们的方法对测序仪错误和真实的序列差异进行建模。即使当真实的序列差异率仅为0.2%时,该方法也一致地提高了映射精度。此外,当将果蝇读段映射到果蝇基因组时,它将正确映射的读段的数量从49%增加到66%。这种方法能够更有效地使用来自缺乏参考基因组、灭绝或高度多态的生物体的DNA读数。
New DNA sequencing technologies have achieved breakthroughs in throughput, at the expense of higher error rates. The primary way of interpreting biological sequences is via alignment, but standard alignment methods assume the sequences are accurate. Here, we describe how to incorporate the per-base error probabilities reported by sequencers into alignment. Unlike existing tools for DNA read mapping, our method models both sequencer errors and real sequence differences. This approach consistently improves mapping accuracy, even when the rate of real sequence difference is only 0.2%. Furthermore, when mapping Drosophila melanogaster reads to the Drosophila simulans genome, it increased the amount of correctly mapped reads from 49 to 66%. This approach enables more effective use of DNA reads from organisms that lack reference genomes, are extinct or are highly polymorphic.
DOI: 10.1109/tcbb.2005.12
发表时间: 2005-01-01
影响因子: 4.5
作者:
Kucherov, G;Noé, L;Roytberg, M
通讯作者: Roytberg, M
DOI: 10.1101/gr.078212.108
发表时间: 2008-11-01
期刊: GENOME RESEARCH
影响因子: 7
作者:
Li, Heng;Ruan, Jue;Durbin, Richard
通讯作者: Durbin, Richard
DOI: 10.1073/pnas.1932072100
发表时间: 2003-09-30
影响因子: 11.1
作者:
Kent, WJ;Baertsch, R;Haussler, D
通讯作者: Haussler, D
DOI: 10.1038/nature06745
发表时间: 2008-03-13
期刊: NATURE
影响因子: 64.8
作者:
Cokus, Shawn J.;Feng, Suhua;Jacobsen, Steven E.
通讯作者: Jacobsen, Steven E.
DOI: 10.1073/pnas.87.6.2264
发表时间: 1990-03-01
影响因子: 11.1
作者:
KARLIN, S;ALTSCHUL, SF
通讯作者: ALTSCHUL, SF