RepeatScout

RepeatScout identifies de novo repeat families in newly sequenced genomes to detect and characterize repetitive DNA sequences.


Key Features:

  • De novo repeat discovery: Identifies repeat families directly from genomic sequence without requiring a priori repeat libraries.
  • Recognition of repetitive substrings: Targets the algorithmic challenge of detecting repetitive substrings in DNA for repeat family identification.
  • Consensus seed extension: Extends consensus seeds to rigorously define repeat boundaries for more precise repeat delineation.
  • Enhanced sensitivity: Reports increased sensitivity for detecting repetitive elements compared with prior methods.
  • Improved speed versus RECON: Achieves significantly faster processing speed compared to the RECON program.
  • Empirical findings: Identified approximately 2% of the human genome and about 4% of mouse and rat genomes as previously unannotated repetitive sequences.

Scientific Applications:

  • Genome annotation: Discovery of repeat families to support annotation of repetitive elements in newly sequenced genomes.
  • Comparative genomics: Detection of previously unrecognized repetitive elements across species such as human, mouse, and rat.
  • Genome structure and function studies: Characterization of repetitive DNA to inform analyses of genome architecture and its functional implications.

Methodology:

Performs de novo identification of repeat families by recognizing repetitive substrings in DNA and extending consensus seeds to define repeat boundaries.

Topics

Details

Added:
12/23/2019
Last Updated:
11/24/2024

Operations

Publications

Price AL, Jones NC, Pevzner PA. De novo identification of repeat families in large genomes. Bioinformatics. 2005;21(Suppl 1):i351-i358. doi:10.1093/bioinformatics/bti1018. PMID:15961478.