ApoPred
ApoPred predicts apolipoproteins and their subfamilies from protein sequences to support research into apolipoprotein roles in hyperlipidemia, atherosclerosis, Alzheimer's disease, and diabetes.
Key Features:
- Benchmark dataset: Uses a curated dataset of 270 known apolipoproteins and 535 non-apolipoproteins for model training and evaluation.
- Feature extraction: Represents sequences using pseudo-amino acid composition (PseAAC) and composition of k-spaced amino acid pairs (CKSAAP).
- Feature optimization: Ranks features with analysis of variance (ANOVA) and applies incremental feature selection to identify optimal subsets.
- Classification algorithm: Trains a support vector machine (SVM) classifier for apolipoprotein versus non-apolipoprotein discrimination.
- Performance: Achieves 97.27% accuracy, 96.30% sensitivity, and 97.76% specificity in 10-fold cross-validation for apolipoprotein identification.
- Subfamily prediction: Predicts apolipoprotein subfamilies with reported overall accuracy of 95.93%.
Scientific Applications:
- Disease mechanism investigation: Enables study of apolipoprotein involvement in hyperlipidemia, atherosclerosis, Alzheimer's disease, and diabetes.
- Target identification for drug discovery: Assists in identifying potential apolipoprotein targets for therapeutic development.
Methodology:
Computational steps include using the 270 apolipoprotein / 535 non-apolipoprotein dataset, extracting PseAAC and CKSAAP features, ranking features by ANOVA, applying incremental feature selection, training an SVM classifier, and evaluating performance via 10-fold cross-validation.
Topics
Details
- Tool Type:
- web application
- Added:
- 3/19/2021
- Last Updated:
- 4/11/2021
Operations
Publications
Liu T, Chen J, Zhang D, Zhang Q, Peng B, Xu L, Tang H. ApoPred: Identification of Apolipoproteins and Their Subfamilies With Multifarious Features. Frontiers in Cell and Developmental Biology. 2021;8. doi:10.3389/fcell.2020.621144. PMID:33490085. PMCID:PMC7820372.