ANDES
ANDES analyzes deep sequencing multiple sequence alignments (MSAs) to quantify nucleotide variation, detect polymorphisms, compute base conversion frequencies including transition/transversion rates, generate threshold-driven consensus sequences, and support inter-sample comparisons for applications such as 16S rRNA gene microbial genomics.
Key Features:
- Position Profile Data Structure: Captures nucleotide distributions across each genomic position from an MSA to represent sequence variability and conservation.
- Root Mean Square Deviation (RMSD) Plot: Produces RMSD plots to compare multiple samples on a position-by-position basis and identify deviations.
- Base Conversion Frequencies: Computes base conversion frequencies, including transition/transversion rates, to characterize mutation patterns.
- Variation Analysis (Shannon Entropy): Calculates Shannon entropy per position to quantify nucleotide variability and sequence diversity.
- Inter-Sample Clustering and Visualization: Performs clustering and visualization using dendrograms and multidimensional scaling (MDS) to reveal sample relationships.
- Consensus Sequence Generation and Polymorphism Detection: Generates threshold-driven consensus sequences and detects polymorphisms to identify predominant and variant alleles.
- Sequencing Quality Estimation: Estimates empirically determined sequencing quality values to provide measures of data reliability.
Scientific Applications:
- Microbial Genomics (16S rRNA gene): Analysis of deep sequencing biomarkers such as the 16S rRNA gene to detect subtle genetic variants in microbial studies.
- Detection of Intra- and Inter-Population Variation: Identification of subtle genetic variations within species and in mixed-species samples.
- Biodiversity, Evolution and Ecological Interactions: Supporting studies of biodiversity, evolutionary patterns, and ecological relationships through variant and diversity analysis.
- Comparative Analysis of Homogeneous Sequences: Comparative studies of high-depth homogeneous sequence datasets to assess sequence dynamics and conservation.
Methodology:
Implemented in Perl and R, ANDES constructs position profile data structures from MSAs and computes position-wise RMSD (with RMSD plots), base conversion frequencies including transition/transversion rates, Shannon entropy per position, inter-sample clustering via dendrograms and MDS, threshold-driven consensus sequence generation and polymorphism detection, and estimates empirically determined sequencing quality values.
Topics
Details
- Tool Type:
- command-line tool
- Operating Systems:
- Linux
- Programming Languages:
- R, Perl
- Added:
- 12/18/2017
- Last Updated:
- 11/24/2024
Operations
Data Inputs & Outputs
Sequence alignment
Prediction and recognition
Outputs
Publications
Li K, Venter E, Yooseph S, Stockwell TB, Eckerle LD, Denison MR, Spiro DJ, Methé BA. ANDES: Statistical tools for the ANalyses of DEep Sequencing. BMC Research Notes. 2010;3(1). doi:10.1186/1756-0500-3-199. PMID:20633290. PMCID:PMC2921379.