CPC
CPC classifies transcript sequences to evaluate their protein-coding potential using a support vector machine-based classifier.
Key Features:
- Support Vector Machine (SVM): Uses a support vector machine-based classifier to distinguish coding from noncoding transcripts.
- Six sequence features: Analyzes six biologically meaningful sequence features that inform coding potential.
- Coding versus noncoding discrimination: Provides binary classification between protein-coding transcripts and noncoding RNAs (ncRNAs).
- Validation: Performance was evaluated by tenfold cross-validation on training datasets and tested on several large datasets.
- High accuracy: Demonstrates high accuracy in distinguishing coding from noncoding transcripts as confirmed by validation tests.
- Computational speed: Achieves an order-of-magnitude faster processing speed compared with previous state-of-the-art tools.
- Scalability: Suited for large-scale transcriptomic datasets, including outputs from cDNA and EST sequencing projects.
Scientific Applications:
- Coding potential assessment: Distinguishing protein-coding transcripts from noncoding RNAs in transcriptome analyses.
- Transcriptome annotation: Annotation of transcripts derived from large-scale cDNA and EST sequencing projects.
- Genomics and molecular biology: Supporting identification of coding sequences for genomics and molecular biology studies.
- Evolutionary analyses: Comparative assessment of coding potential across species for evolutionary studies.
Methodology:
CPC analyzes six biologically meaningful sequence features and applies a support vector machine classifier, with model assessment by tenfold cross-validation on training datasets and testing on several large datasets.
Topics
Collections
Details
- License:
- GPL-2.0
- Tool Type:
- web application
- Operating Systems:
- Linux, Windows, Mac
- Programming Languages:
- Java
- Added:
- 2/14/2017
- Last Updated:
- 1/29/2019
Operations
Publications
Kong L, Zhang Y, Ye Z, Liu X, Zhao S, Wei L, Gao G. CPC: assess the protein-coding potential of transcripts using sequence features and support vector machine. Nucleic Acids Research. 2007;35(suppl_2):W345-W349. doi:10.1093/nar/gkm391. PMID:17631615. PMCID:PMC1933232.