ANDES

ANDES analyzes deep sequencing multiple sequence alignments (MSAs) to quantify nucleotide variation, detect polymorphisms, compute base conversion frequencies including transition/transversion rates, generate threshold-driven consensus sequences, and support inter-sample comparisons for applications such as 16S rRNA gene microbial genomics.


Key Features:

  • Position Profile Data Structure: Captures nucleotide distributions across each genomic position from an MSA to represent sequence variability and conservation.
  • Root Mean Square Deviation (RMSD) Plot: Produces RMSD plots to compare multiple samples on a position-by-position basis and identify deviations.
  • Base Conversion Frequencies: Computes base conversion frequencies, including transition/transversion rates, to characterize mutation patterns.
  • Variation Analysis (Shannon Entropy): Calculates Shannon entropy per position to quantify nucleotide variability and sequence diversity.
  • Inter-Sample Clustering and Visualization: Performs clustering and visualization using dendrograms and multidimensional scaling (MDS) to reveal sample relationships.
  • Consensus Sequence Generation and Polymorphism Detection: Generates threshold-driven consensus sequences and detects polymorphisms to identify predominant and variant alleles.
  • Sequencing Quality Estimation: Estimates empirically determined sequencing quality values to provide measures of data reliability.

Scientific Applications:

  • Microbial Genomics (16S rRNA gene): Analysis of deep sequencing biomarkers such as the 16S rRNA gene to detect subtle genetic variants in microbial studies.
  • Detection of Intra- and Inter-Population Variation: Identification of subtle genetic variations within species and in mixed-species samples.
  • Biodiversity, Evolution and Ecological Interactions: Supporting studies of biodiversity, evolutionary patterns, and ecological relationships through variant and diversity analysis.
  • Comparative Analysis of Homogeneous Sequences: Comparative studies of high-depth homogeneous sequence datasets to assess sequence dynamics and conservation.

Methodology:

Implemented in Perl and R, ANDES constructs position profile data structures from MSAs and computes position-wise RMSD (with RMSD plots), base conversion frequencies including transition/transversion rates, Shannon entropy per position, inter-sample clustering via dendrograms and MDS, threshold-driven consensus sequence generation and polymorphism detection, and estimates empirically determined sequencing quality values.

Topics

Details

Tool Type:
command-line tool
Operating Systems:
Linux
Programming Languages:
R, Perl
Added:
12/18/2017
Last Updated:
11/24/2024

Operations

Data Inputs & Outputs

Prediction and recognition

Other operations do not define inputs or outputs.

Publications

Li K, Venter E, Yooseph S, Stockwell TB, Eckerle LD, Denison MR, Spiro DJ, Methé BA. ANDES: Statistical tools for the ANalyses of DEep Sequencing. BMC Research Notes. 2010;3(1). doi:10.1186/1756-0500-3-199. PMID:20633290. PMCID:PMC2921379.

Documentation

Links