streammd

streammd performs fast, memory-efficient, single-pass duplicate marking for bulk sequence analysis using a Bloom filter to enable scalable preprocessing for downstream analyses such as variant calling and expression quantification.


Key Features:

  • Speed and Efficiency: Performs rapid duplicate detection with high accuracy.
  • Low Memory Usage: Requires substantially less memory compared to tools like SAMBLASTER, enabling large-scale sequencing analyses.
  • Single-Pass Operation: Processes sequencing data in a single pass, reducing computational overhead.
  • Bloom filter-based Marking: Uses a Bloom filter approach for memory-efficient identification of duplicate templates.
  • Output Fidelity: Closely reproduces outputs from Picard MarkDuplicates.
  • Implementation: Implemented in C++.

Scientific Applications:

  • Duplicate Marking in Preprocessing: Identifies and marks duplicate templates during preprocessing of bulk sequence data.
  • Variant Calling: Facilitates downstream variant calling by removing or flagging duplicate reads that can bias variant detection.
  • Expression Quantification: Supports accurate expression quantification by accounting for duplicate templates in sequencing libraries.
  • Genomic Studies and Personalized Medicine: Scales duplicate marking for large libraries used in genomic studies and personalized medicine research.

Methodology:

Leverages a Bloom filter-based, single-pass duplicate marking approach and closely reproduces outputs from Picard MarkDuplicates.

Topics

Details

License:
MIT
Cost:
Free of charge
Tool Type:
command-line tool
Operating Systems:
Mac, Linux, Windows
Programming Languages:
C++
Added:
10/15/2023
Last Updated:
10/15/2023

Operations

Publications

Leonard C. <i>streammd</i> : fast low-memory duplicate marking using a Bloom filter. Bioinformatics. 2023;39(4). doi:10.1093/bioinformatics/btad181. PMID:37027230. PMCID:PMC10112951.