RNAmining

RNAmining classifies RNA sequences as coding or non-coding using machine learning models trained on tri-nucleotide composition features.


Key Features:

  • XGBoost-Based Classification: Implements an XGBoost model selected via 10-fold cross-validation from seven algorithms (Naive Bayes, Support Vector Machine, K-Nearest Neighbors, Random Forest, XGBoost, Artificial Neural Network, Deep Learning), achieving F1-scores of 97.56%–99.57% across 15 model organisms.
  • Tri-Nucleotide Feature Encoding: Uses normalized tri-nucleotide counts from balanced coding and non-coding sequences derived from Ensembl datasets for model training and prediction.

Scientific Applications:

  • Coding Potential Prediction: Enables genome-wide discrimination of coding and non-coding RNAs to support studies of regulatory non-coding RNAs across species.

Methodology:

RNAmining constructs and evaluates 180 machine learning models using 10-fold cross-validation on coding and non-coding sequences, selects XGBoost based on performance, and benchmarks predictions against CPAT, CPC2, RNAcon, and Transdecoder.

Topics

Details

Added:
1/18/2021
Last Updated:
2/7/2021

Operations

Publications

Ramos TAR, Galindo NRO, Arias-Carrasco R, da Silva CF, Maracaja-Coutinho V, do Rêgo TG. RNAmining: A machine learning stand-alone and web server tool for RNA coding potential prediction. Unknown Journal. 2020. doi:10.1101/2020.10.26.354357.

Downloads

Links