SimkaMin

SimkaMin estimates genomic similarity between metagenomic read sets from next-generation sequencing (NGS) datasets using shared k-mers and a subsampling scheme to compute Bray-Curtis and Jaccard dissimilarities.


Key Features:

  • Shared k-mer estimation: Uses the fraction of shared k-mers between read sets to estimate genomic similarity.
  • Data subsampling scheme: Applies an efficient subsampling strategy to enable rapid and accurate estimation of Bray-Curtis and Jaccard dissimilarities.
  • Scalability: Capable of processing up to one billion metagenomic reads in less than three minutes.
  • Low resource footprint: Operates with approximately 0.3 GB of disk space and 1.09 GB of memory usage.

Scientific Applications:

  • Comparative metagenomics: Rapidly compares genomic similarities and computes Bray-Curtis and Jaccard dissimilarities between metagenomic read sets.
  • Large-scale metagenomic surveys: Enables similarity estimation across extensive NGS datasets and high-throughput read collections.
  • Microbial ecology and environmental microbiology: Facilitates comparison of community composition and diversity between environmental metagenomic samples.

Methodology:

Estimates genomic similarity from the fraction of shared k-mers and computes Bray-Curtis and Jaccard dissimilarities using an efficient data subsampling scheme.

Topics

Details

License:
AGPL-3.0
Programming Languages:
C++, Python
Added:
11/14/2019
Last Updated:
12/20/2020

Operations

Publications

Benoit G, Mariadassou M, Robin S, Schbath S, Peterlongo P, Lemaitre C. SimkaMin: fast and resource frugal <i>de novo</i> comparative metagenomics. Bioinformatics. 2019;36(4):1275-1276. doi:10.1093/bioinformatics/btz685. PMID:31504187.

PMID: 31504187
Funding: - French: ANR-14-CE23-0001