ClaMSA
ClaMSA classifies multiple sequence alignments (MSAs) using phylogenetic models and machine learning to distinguish coding from non-coding codon sequences.
Key Features:
- Input Requirements: Requires a phylogenetic tree and an MSA as input.
- Output: Outputs probabilities indicating the likelihood that an input MSA belongs to specific classes.
- Machine Learning Framework: Incorporates a continuous-time Markov chain (CTMC) machine learning layer trained end-to-end with recurrent neural networks.
- Discriminative Training: Employs discriminative training optimized for classifying coding versus non-coding regions.
Scientific Applications:
- Classification of aligned codon sequences: Distinguishes coding and non-coding regions in codon-aligned MSAs.
- Comparative genomics benchmarking: Applied to vertebrate and fly alignments, reporting six times fewer false positives than existing methods at an equivalent true positive rate.
Methodology:
Integration of a continuous-time Markov chain (CTMC) machine learning layer with recurrent neural networks trained end-to-end using discriminative training optimized for classifying coding versus non-coding regions on phylogenetic-tree-aware MSAs.
Topics
Details
- Tool Type:
- command-line tool
- Programming Languages:
- Python
- Added:
- 6/14/2021
- Last Updated:
- 8/20/2021
Operations
Publications
Mertsch D, Stanke M. End-to-end Learning of Evolutionary Models to Find Coding Regions in Genome Alignments. Unknown Journal. 2021. doi:10.1101/2021.03.09.434414.
Links
Issue tracker
https://github.com/liemonade/clamsa/issues