Reptile
Reptile: k-mer Spectrum-Based Error Correction for Short-Read NGS Data
Reptile performs error correction of short-read sequencing data from next-generation sequencing (NGS) technologies using k-mer spectrum analysis to identify and correct sequencing errors.
Key Features:
- k-mer Spectrum Analysis: Detects erroneous k-mers by analyzing frequency distributions within input reads.
- Hamming Distance Correction: Identifies and corrects candidate erroneous k-mers based on Hamming distance.
- Contextual Neighbor Evaluation: Examines adjacent k-mers within the same read to ensure sequence context consistency.
- Quality Score Integration: Incorporates sequencing quality scores to refine base correction decisions.
- Memory-Efficient Processing: Processes datasets exceeding available RAM without storing all input reads in main memory.
Scientific Applications:
- Preprocessing of High-Throughput Sequencing Data: Improves base accuracy in large-scale genomic datasets prior to downstream analyses such as genome assembly and variant detection.
Methodology:
Reptile analyzes k-mer frequency spectra from short-read datasets, identifies low-frequency k-mers as potential errors, applies Hamming distance-based correction to candidate bases, and validates corrections using neighboring k-mer context within each read while optionally integrating sequencing quality scores.
Topics
Details
- License:
- GPL-3.0
- Maturity:
- Mature
- Tool Type:
- command-line tool
- Operating Systems:
- Linux
- Programming Languages:
- C++
- Added:
- 1/13/2017
- Last Updated:
- 11/24/2024
Operations
Data Inputs & Outputs
Sequencing quality control
Inputs
Outputs
Publications
Yang X, Dorman KS, Aluru S. Reptile: representative tiling for short read error correction. Bioinformatics. 2010;26(20):2526-2533. doi:10.1093/bioinformatics/btq468. PMID:20834037.