Reptile

Reptile: k-mer Spectrum-Based Error Correction for Short-Read NGS Data

Reptile performs error correction of short-read sequencing data from next-generation sequencing (NGS) technologies using k-mer spectrum analysis to identify and correct sequencing errors.


Key Features:

  • k-mer Spectrum Analysis: Detects erroneous k-mers by analyzing frequency distributions within input reads.
  • Hamming Distance Correction: Identifies and corrects candidate erroneous k-mers based on Hamming distance.
  • Contextual Neighbor Evaluation: Examines adjacent k-mers within the same read to ensure sequence context consistency.
  • Quality Score Integration: Incorporates sequencing quality scores to refine base correction decisions.
  • Memory-Efficient Processing: Processes datasets exceeding available RAM without storing all input reads in main memory.

Scientific Applications:

  • Preprocessing of High-Throughput Sequencing Data: Improves base accuracy in large-scale genomic datasets prior to downstream analyses such as genome assembly and variant detection.

Methodology:

Reptile analyzes k-mer frequency spectra from short-read datasets, identifies low-frequency k-mers as potential errors, applies Hamming distance-based correction to candidate bases, and validates corrections using neighboring k-mer context within each read while optionally integrating sequencing quality scores.

Topics

Details

License:
GPL-3.0
Maturity:
Mature
Tool Type:
command-line tool
Operating Systems:
Linux
Programming Languages:
C++
Added:
1/13/2017
Last Updated:
11/24/2024

Operations

Data Inputs & Outputs

Sequencing quality control

Outputs

    Publications

    Yang X, Dorman KS, Aluru S. Reptile: representative tiling for short read error correction. Bioinformatics. 2010;26(20):2526-2533. doi:10.1093/bioinformatics/btq468. PMID:20834037.