ClaMSA

ClaMSA classifies multiple sequence alignments (MSAs) using phylogenetic models and machine learning to distinguish coding from non-coding codon sequences.


Key Features:

  • Input Requirements: Requires a phylogenetic tree and an MSA as input.
  • Output: Outputs probabilities indicating the likelihood that an input MSA belongs to specific classes.
  • Machine Learning Framework: Incorporates a continuous-time Markov chain (CTMC) machine learning layer trained end-to-end with recurrent neural networks.
  • Discriminative Training: Employs discriminative training optimized for classifying coding versus non-coding regions.

Scientific Applications:

  • Classification of aligned codon sequences: Distinguishes coding and non-coding regions in codon-aligned MSAs.
  • Comparative genomics benchmarking: Applied to vertebrate and fly alignments, reporting six times fewer false positives than existing methods at an equivalent true positive rate.

Methodology:

Integration of a continuous-time Markov chain (CTMC) machine learning layer with recurrent neural networks trained end-to-end using discriminative training optimized for classifying coding versus non-coding regions on phylogenetic-tree-aware MSAs.

Topics

Details

Tool Type:
command-line tool
Programming Languages:
Python
Added:
6/14/2021
Last Updated:
8/20/2021

Operations

Publications

Mertsch D, Stanke M. End-to-end Learning of Evolutionary Models to Find Coding Regions in Genome Alignments. Unknown Journal. 2021. doi:10.1101/2021.03.09.434414.

Links