LoQuM
LoQuM recalibrates mapping quality scores for Illumina short-read alignments using a logistic regression model trained on simulated reads to improve the reliability of mapping quality assessments.
Key Features:
- Machine learning calibration: Uses a logistic regression model trained on simulated reads to predict true mapping quality for short-read alignments.
- Feature set: Utilizes features derived from sequencer-reported base quality scores and alignment-specific statistics, including number of matches, mismatches, deletions, mapping quality score from the original aligner, and number of mappings.
- Rescue of zero-quality mappings: Reassigns nonzero calibrated mapping quality to alignments originally assigned zero by alignment tools.
- Improved variant signal: Recalibrated mapping qualities increase the precision of identifying genomic variants such as single nucleotide polymorphisms (SNPs).
Scientific Applications:
- Variant calling accuracy: Provides more reliable mapping quality inputs to variant callers, improving SNP and small variant detection.
- Structural variation analysis: Enhances assessment of mapping reliability in contexts relevant to structural variant discovery.
- Population genetics and evolutionary studies: Improves confidence in mapping-based measures used for genetic diversity and evolutionary inference.
- Disease association studies: Increases fidelity of mapped reads used in analyses linking genomic variants to disease phenotypes.
Methodology:
Logistic regression trained on simulated reads using features from sequencer-reported base quality scores and alignment statistics (matches, mismatches, deletions, original aligner mapping quality, and number of mappings).
Topics
Details
- Tool Type:
- command-line tool
- Operating Systems:
- Linux, Windows, Mac
- Programming Languages:
- R, Python
- Added:
- 8/3/2017
- Last Updated:
- 11/25/2024
Operations
Publications
Ruffalo M, Koyutürk M, Ray S, LaFramboise T. Accurate estimation of short read mapping quality for next-generation genome sequencing. Bioinformatics. 2012;28(18):i349-i355. doi:10.1093/bioinformatics/bts408. PMID:22962451. PMCID:PMC3436835.