BWA-PSSM
BWA-PSSM implements probabilistic short-read alignment using position-specific scoring matrices (PSSM) to improve mapping accuracy of short DNA sequencing reads to reference genomes.
Key Features:
- Position-Specific Scoring Matrices (PSSM): Uses PSSMs to score read-to-reference matches with position-dependent probabilities.
- Probabilistic mapping framework: Computes alignments within a probabilistic model rather than relying solely on simple mismatch counts.
- Integration of quality scores: Accounts for sequencing read quality scores in alignment scoring.
- Prior mismatch probabilities: Incorporates prior mismatch probabilities into alignment and scoring calculations.
- User-defined evolutionary and bias models: Accepts user-defined models of evolutionary processes and dataset-specific biases for adaptive alignment.
- Mapping quality computation: Produces mapping qualities derived from the underlying probabilistic model.
- Compatibility with BWA index: Implemented as an extension of BWA and retains compatibility with the BWA genome index structure.
- Improved sensitivity and accuracy: Demonstrated higher mapping quality than Bowtie and BWA on simulated and real datasets.
- Robustness to contaminants and close genomes: Mitigates random matches from short contaminant reads and improves reliability of mapping between closely related genomes.
Scientific Applications:
- Short-read alignment to reference genomes: Improves mapping accuracy for generic short DNA sequencing datasets.
- Ancient DNA analysis: Enhances mapping of degraded and low-quality ancient DNA reads.
- PAR-CLIP read mapping: Applies to mapping PAR-CLIP sequencing reads.
- AT-rich organism sequencing: Improves alignment for AT-rich genomes such as Plasmodium falciparum.
- Distinguishing closely related species: Aids mapping and read assignment between closely related genomes (e.g., Drosophila melanogaster vs Drosophila simulans).
- Low-quality or biased datasets: Suited for datasets with sequencing errors, evolutionary variation, or dataset-specific biases.
Methodology:
Implements probabilistic mapping using position-specific scoring matrices (PSSM), integrates sequencing read quality scores, prior mismatch probabilities, and user-defined evolutionary/bias models, computes mapping qualities, and is implemented as an extension of BWA retaining the BWA genome index structure.
Topics
Collections
Details
- Tool Type:
- command-line tool
- Operating Systems:
- Linux, Mac
- Programming Languages:
- Python
- Added:
- 7/28/2015
- Last Updated:
- 11/25/2024
Operations
Publications
Kerpedjiev P, Frellsen J, Lindgreen S, Krogh A. Adaptable probabilistic mapping of short reads using position specific scoring matrices. BMC Bioinformatics. 2014;15(1). doi:10.1186/1471-2105-15-100. PMID:24717095. PMCID:PMC4021105.