Bayesian Unidimensional Scaling for visualizing uncertainty in high dimensional datasets with latent ordering of observations

Bayesian Unidimensional Scaling for visualizing uncertainty in high dimensional datasets with latent ordering of observations
复制标题

DOI:
10.1186/s12859-017-1790-x
复制
发表时间:
2017-01-01
期刊:
影响因子:
3
通讯作者:
Holmes, Susan
Holmes, Susan
中科院分区:
生物学4区
文献类型:
--
作者:
Lan Huong Nguyen;Holmes, Susan

文献摘要

被引文献

相似文献

背景:在高维多变量数据集中检测模式是不平凡的。聚类和降维技术通常有助于辨别固有结构。在微生物群落组成或基因表达数据等生物数据集中,观察结果可以从一个连续的过程中产生,通常是未知的。估计数据点的“自然顺序”和相应的不确定性可以帮助研究人员绘制有关的mechanism.Results的见解:我们介绍了贝叶斯一维标度(BUDS)技术,提取高维数据集的变化的主要来源,并产生其可视化的数据摘要,促进探索一个隐藏的连续体。该方法将多变量数据点映射到潜在的一维坐标沿着其潜在的轨迹,并提供估计的不确定性界限。通过对差异进行统计建模并将DiSTATIS配准方法应用于其后验样本,我们能够使用单个数据点的置信度轮廓将不同区域的估计数据轨迹中的不确定性可视化。我们还通过包括密度云来说明不同区域的估计总体数据密度。BUDS恢复的一维坐标帮助研究人员发现样本属性或协变量,这些属性或协变量是驱动数据集中主要变异性的因素。我们在一组已发表的微生物组16 S和RNA-seq和点名data.Conclusions上证明了BUDS的实用性和准确性:我们的方法有效地恢复和可视化了数据集中存在的自然顺序。用于数据探索和分析的自动可视化工具可在https://nlhuong.shinyapps.io/visTrajectory/上获得。
Background: Detecting patterns in high-dimensional multivariate datasets is non-trivial. Clustering and dimensionality reduction techniques often help in discerning inherent structures. In biological datasets such as microbial community composition or gene expression data, observations can be generated from a continuous process, often unknown. Estimating data points' 'natural ordering' and their corresponding uncertainties can help researchers draw insights about the mechanisms involved.Results: We introduce a Bayesian Unidimensional Scaling (BUDS) technique which extracts dominant sources of variation in high dimensional datasets and produces their visual data summaries, facilitating the exploration of a hidden continuum. The method maps multivariate data points to latent one-dimensional coordinates along their underlying trajectory, and provides estimated uncertainty bounds. By statistically modeling dissimilarities and applying a DiSTATIS registration method to their posterior samples, we are able to incorporate visualizations of uncertainties in the estimated data trajectory across different regions using confidence contours for individual data points. We also illustrate the estimated overall data density across different areas by including density clouds. One-dimensional coordinates recovered by BUDS help researchers discover sample attributes or covariates that are factors driving the main variability in a dataset. We demonstrated usefulness and accuracy of BUDS on a set of published microbiome 16S and RNA-seq and roll call data.Conclusions: Our method effectively recovers and visualizes natural orderings present in datasets. Automatic visualization tools for data exploration and analysis are available at: https://nlhuong.shinyapps.io/visTrajectory/.