RNAmining
RNAmining classifies RNA sequences as coding or non-coding using machine learning models trained on tri-nucleotide composition features.
Key Features:
- XGBoost-Based Classification: Implements an XGBoost model selected via 10-fold cross-validation from seven algorithms (Naive Bayes, Support Vector Machine, K-Nearest Neighbors, Random Forest, XGBoost, Artificial Neural Network, Deep Learning), achieving F1-scores of 97.56%–99.57% across 15 model organisms.
- Tri-Nucleotide Feature Encoding: Uses normalized tri-nucleotide counts from balanced coding and non-coding sequences derived from Ensembl datasets for model training and prediction.
Scientific Applications:
- Coding Potential Prediction: Enables genome-wide discrimination of coding and non-coding RNAs to support studies of regulatory non-coding RNAs across species.
Methodology:
RNAmining constructs and evaluates 180 machine learning models using 10-fold cross-validation on coding and non-coding sequences, selects XGBoost based on performance, and benchmarks predictions against CPAT, CPC2, RNAcon, and Transdecoder.
Topics
Details
- Added:
- 1/18/2021
- Last Updated:
- 2/7/2021
Operations
Publications
Ramos TAR, Galindo NRO, Arias-Carrasco R, da Silva CF, Maracaja-Coutinho V, do Rêgo TG. RNAmining: A machine learning stand-alone and web server tool for RNA coding potential prediction. Unknown Journal. 2020. doi:10.1101/2020.10.26.354357.
Downloads
- Downloads pagehttps://rnamining.integrativebioinformatics.me/download