SIDR
SIDR uses decision-tree machine learning to identify and remove contaminant sequences from Next Generation Sequencing (NGS) de novo genome assemblies to improve assembly quality, particularly for eukaryotic genomes.
Key Features:
- Machine Learning Approach: Decision tree algorithm for sequence classification that handles diverse input features without requiring prior identification of significant descriptors.
- Feature Flexibility: Can incorporate any measured feature as input, enabling classification based on diverse sequence- and assembly-derived characteristics.
- Contaminant Identification: Distinguishes target-organism sequences from contaminants, addressing cases in eukaryotic assemblies where nucleotide similarity can cause target sequence loss.
- Comparative Superiority: Decision trees used by SIDR have demonstrated superior performance compared to existing protocols in classifying sequences within eukaryotic de novo assemblies.
Scientific Applications:
- Decontamination of Eukaryotic Assemblies: Purges contaminant sequences from DNA extracts and NGS datasets containing non-target organism sequences.
- Enhanced Genome Assembly Quality: Improves the quality and reliability of de novo genome assemblies by filtering contaminant sequences.
Methodology:
SIDR trains decision trees on sequence data using features derived from classifiers such as BLAST to classify sequences as target or contaminant.
Topics
Details
- Tool Type:
- command-line tool
- Operating Systems:
- Linux, Mac
- Programming Languages:
- Python
- Added:
- 7/28/2018
- Last Updated:
- 11/25/2024
Operations
Publications
Fierst JL, Murdock DA. Decontaminating eukaryotic genome assemblies with machine learning. BMC Bioinformatics. 2017;18(1). doi:10.1186/s12859-017-1941-0. PMID:29191179. PMCID:PMC5709863.