SimkaMin
SimkaMin estimates genomic similarity between metagenomic read sets from next-generation sequencing (NGS) datasets using shared k-mers and a subsampling scheme to compute Bray-Curtis and Jaccard dissimilarities.
Key Features:
- Shared k-mer estimation: Uses the fraction of shared k-mers between read sets to estimate genomic similarity.
- Data subsampling scheme: Applies an efficient subsampling strategy to enable rapid and accurate estimation of Bray-Curtis and Jaccard dissimilarities.
- Scalability: Capable of processing up to one billion metagenomic reads in less than three minutes.
- Low resource footprint: Operates with approximately 0.3 GB of disk space and 1.09 GB of memory usage.
Scientific Applications:
- Comparative metagenomics: Rapidly compares genomic similarities and computes Bray-Curtis and Jaccard dissimilarities between metagenomic read sets.
- Large-scale metagenomic surveys: Enables similarity estimation across extensive NGS datasets and high-throughput read collections.
- Microbial ecology and environmental microbiology: Facilitates comparison of community composition and diversity between environmental metagenomic samples.
Methodology:
Estimates genomic similarity from the fraction of shared k-mers and computes Bray-Curtis and Jaccard dissimilarities using an efficient data subsampling scheme.
Topics
Details
- License:
- AGPL-3.0
- Programming Languages:
- C++, Python
- Added:
- 11/14/2019
- Last Updated:
- 12/20/2020
Operations
Publications
Benoit G, Mariadassou M, Robin S, Schbath S, Peterlongo P, Lemaitre C. SimkaMin: fast and resource frugal <i>de novo</i> comparative metagenomics. Bioinformatics. 2019;36(4):1275-1276. doi:10.1093/bioinformatics/btz685. PMID:31504187.