SIDR

SIDR uses decision-tree machine learning to identify and remove contaminant sequences from Next Generation Sequencing (NGS) de novo genome assemblies to improve assembly quality, particularly for eukaryotic genomes.


Key Features:

  • Machine Learning Approach: Decision tree algorithm for sequence classification that handles diverse input features without requiring prior identification of significant descriptors.
  • Feature Flexibility: Can incorporate any measured feature as input, enabling classification based on diverse sequence- and assembly-derived characteristics.
  • Contaminant Identification: Distinguishes target-organism sequences from contaminants, addressing cases in eukaryotic assemblies where nucleotide similarity can cause target sequence loss.
  • Comparative Superiority: Decision trees used by SIDR have demonstrated superior performance compared to existing protocols in classifying sequences within eukaryotic de novo assemblies.

Scientific Applications:

  • Decontamination of Eukaryotic Assemblies: Purges contaminant sequences from DNA extracts and NGS datasets containing non-target organism sequences.
  • Enhanced Genome Assembly Quality: Improves the quality and reliability of de novo genome assemblies by filtering contaminant sequences.

Methodology:

SIDR trains decision trees on sequence data using features derived from classifiers such as BLAST to classify sequences as target or contaminant.

Topics

Details

Tool Type:
command-line tool
Operating Systems:
Linux, Mac
Programming Languages:
Python
Added:
7/28/2018
Last Updated:
11/25/2024

Operations

Publications

Fierst JL, Murdock DA. Decontaminating eukaryotic genome assemblies with machine learning. BMC Bioinformatics. 2017;18(1). doi:10.1186/s12859-017-1941-0. PMID:29191179. PMCID:PMC5709863.

PMID: 29191179
PMCID: PMC5709863
Funding: - National Institute of General Medical Sciences: GM102511

Documentation