SALT

SALT classifies short RNA-Seq reads into protein domain families using profile hidden Markov models and a supervised graph construction algorithm to improve sensitivity and accuracy for analyses of NGS data from non-model organisms lacking reference genomes or high-quality annotations.


Key Features:

  • Profile Hidden Markov Models: Uses profile HMMs to capture sequence variability within protein families and identify domains in short read sequences.
  • Supervised Graph Construction Algorithm: Employs a supervised graph construction algorithm to assemble reads originating from domain regions.
  • Read assembly into contigs: Assembles reads into contigs representing domain regions to facilitate accurate classification.
  • Improved sensitivity and accuracy: Demonstrates higher sensitivity and accuracy in domain classification across varying read lengths compared to existing tools when benchmarked against protein domain annotations and reference genomes.
  • Application to non-model organisms: Effective on RNA-Seq data from non-model organisms, identifying a greater number of transcribed protein domain families than other classifiers.
  • Designed for NGS RNA-Seq short reads: Tailored to handle the short read sequences typical of next-generation RNA-Seq experiments.

Scientific Applications:

  • Functional annotation: Assigns protein domains to transcript sequences to support functional annotation of RNA-Seq data.
  • Comparative genomics: Enables comparison of protein domain repertoires across species to investigate evolutionary relationships.
  • Transcriptome analysis in non-model organisms: Identifies transcribed protein domain families in organisms lacking reference genomes or high-quality annotations.

Methodology:

Uses profile hidden Markov models and a supervised graph construction algorithm to assemble reads into contigs originating from domain regions and classify them into protein domain families; performance was benchmarked against available protein domain annotations and reference genomes across varying read lengths.

Topics

Details

Tool Type:
command-line tool
Operating Systems:
Linux
Programming Languages:
Python
Added:
8/3/2017
Last Updated:
11/24/2024

Operations

Publications

Zhang Y, Sun Y, Cole JR. A Sensitive and Accurate protein domain cLassification Tool (SALT) for short reads. Bioinformatics. 2013;29(17):2103-2111. doi:10.1093/bioinformatics/btt357. PMID:23782615.

Documentation

Links