Discount

Discount performs k-mer counting and minimizer-ordering analysis to enable scalable, memory-efficient processing of large metagenomic sequencing datasets.


Key Features:

  • Distributed k-mer counting: Implements scalable, out-of-core k-mer counting for large datasets using Apache Spark and distributed computing.
  • Minimizer ordering analysis: Evaluates the impact of different minimizer orderings and addresses uneven bin sizes produced by traditional minimizer-based approaches.
  • Universal Frequency Ordering: Combines frequency-sampled minimizers with universal k-mer hitting sets to produce evenly distributed, smaller bins.
  • Memory efficiency: Demonstrates reduced memory requirements for distributed k-mer counting, with reported reductions in memory usage of up to 87% versus existing methods.

Scientific Applications:

  • Genome size estimation: Provides k-mer frequency counts useful for estimating genome size from sequencing data.
  • Genome assembly: Supplies scalable k-mer counting and balanced binning that support de novo assembly workflows.
  • Taxonomic classification: Enables k-mer–based taxonomic classification analyses in metagenomic studies through efficient counting.
  • Metagenomic community analysis: Facilitates large-scale analysis of microbial communities by improving throughput and memory efficiency of k-mer processing.

Methodology:

Discount uses an Apache Spark-based distributed implementation and empirically evaluates various minimizer orderings on metagenomic datasets, including a universal frequency ordering that combines frequency-sampled minimizers with universal k-mer hitting sets to assess effects on bin distribution and memory usage.

Topics

Details

License:
GPL-3.0
Tool Type:
command-line tool
Programming Languages:
Scala, Java
Added:
9/8/2021
Last Updated:
11/24/2024

Operations

Publications

Nyström-Persson J, Keeble-Gagnère G, Zawad N. Compact and evenly distributed <i>k</i> -mer binning for genomic sequences. Bioinformatics. 2021;37(17):2563-2569. doi:10.1093/bioinformatics/btab156. PMID:33693556. PMCID:PMC8428581.