BWA-PSSM

BWA-PSSM implements probabilistic short-read alignment using position-specific scoring matrices (PSSM) to improve mapping accuracy of short DNA sequencing reads to reference genomes.


Key Features:

  • Position-Specific Scoring Matrices (PSSM): Uses PSSMs to score read-to-reference matches with position-dependent probabilities.
  • Probabilistic mapping framework: Computes alignments within a probabilistic model rather than relying solely on simple mismatch counts.
  • Integration of quality scores: Accounts for sequencing read quality scores in alignment scoring.
  • Prior mismatch probabilities: Incorporates prior mismatch probabilities into alignment and scoring calculations.
  • User-defined evolutionary and bias models: Accepts user-defined models of evolutionary processes and dataset-specific biases for adaptive alignment.
  • Mapping quality computation: Produces mapping qualities derived from the underlying probabilistic model.
  • Compatibility with BWA index: Implemented as an extension of BWA and retains compatibility with the BWA genome index structure.
  • Improved sensitivity and accuracy: Demonstrated higher mapping quality than Bowtie and BWA on simulated and real datasets.
  • Robustness to contaminants and close genomes: Mitigates random matches from short contaminant reads and improves reliability of mapping between closely related genomes.

Scientific Applications:

  • Short-read alignment to reference genomes: Improves mapping accuracy for generic short DNA sequencing datasets.
  • Ancient DNA analysis: Enhances mapping of degraded and low-quality ancient DNA reads.
  • PAR-CLIP read mapping: Applies to mapping PAR-CLIP sequencing reads.
  • AT-rich organism sequencing: Improves alignment for AT-rich genomes such as Plasmodium falciparum.
  • Distinguishing closely related species: Aids mapping and read assignment between closely related genomes (e.g., Drosophila melanogaster vs Drosophila simulans).
  • Low-quality or biased datasets: Suited for datasets with sequencing errors, evolutionary variation, or dataset-specific biases.

Methodology:

Implements probabilistic mapping using position-specific scoring matrices (PSSM), integrates sequencing read quality scores, prior mismatch probabilities, and user-defined evolutionary/bias models, computes mapping qualities, and is implemented as an extension of BWA retaining the BWA genome index structure.

Topics

Collections

Details

Tool Type:
command-line tool
Operating Systems:
Linux, Mac
Programming Languages:
Python
Added:
7/28/2015
Last Updated:
11/25/2024

Operations

Publications

Kerpedjiev P, Frellsen J, Lindgreen S, Krogh A. Adaptable probabilistic mapping of short reads using position specific scoring matrices. BMC Bioinformatics. 2014;15(1). doi:10.1186/1471-2105-15-100. PMID:24717095. PMCID:PMC4021105.

Documentation

Downloads

Links