CPC

CPC classifies transcript sequences to evaluate their protein-coding potential using a support vector machine-based classifier.


Key Features:

  • Support Vector Machine (SVM): Uses a support vector machine-based classifier to distinguish coding from noncoding transcripts.
  • Six sequence features: Analyzes six biologically meaningful sequence features that inform coding potential.
  • Coding versus noncoding discrimination: Provides binary classification between protein-coding transcripts and noncoding RNAs (ncRNAs).
  • Validation: Performance was evaluated by tenfold cross-validation on training datasets and tested on several large datasets.
  • High accuracy: Demonstrates high accuracy in distinguishing coding from noncoding transcripts as confirmed by validation tests.
  • Computational speed: Achieves an order-of-magnitude faster processing speed compared with previous state-of-the-art tools.
  • Scalability: Suited for large-scale transcriptomic datasets, including outputs from cDNA and EST sequencing projects.

Scientific Applications:

  • Coding potential assessment: Distinguishing protein-coding transcripts from noncoding RNAs in transcriptome analyses.
  • Transcriptome annotation: Annotation of transcripts derived from large-scale cDNA and EST sequencing projects.
  • Genomics and molecular biology: Supporting identification of coding sequences for genomics and molecular biology studies.
  • Evolutionary analyses: Comparative assessment of coding potential across species for evolutionary studies.

Methodology:

CPC analyzes six biologically meaningful sequence features and applies a support vector machine classifier, with model assessment by tenfold cross-validation on training datasets and testing on several large datasets.

Topics

Collections

Details

License:
GPL-2.0
Tool Type:
web application
Operating Systems:
Linux, Windows, Mac
Programming Languages:
Java
Added:
2/14/2017
Last Updated:
1/29/2019

Operations

Publications

Kong L, Zhang Y, Ye Z, Liu X, Zhao S, Wei L, Gao G. CPC: assess the protein-coding potential of transcripts using sequence features and support vector machine. Nucleic Acids Research. 2007;35(suppl_2):W345-W349. doi:10.1093/nar/gkm391. PMID:17631615. PMCID:PMC1933232.

Documentation