HPiP
HPiP predicts host-pathogen protein-protein interactions (PPIs) from amino acid sequences to identify molecular interfaces between pathogens and host proteins.
Key Features:
- Ensemble machine learning: Integrates multiple classifiers to improve prediction accuracy and robustness for PPI inference.
- Amino acid sequence property descriptors: Uses sequence-derived property descriptors as input features for predictive models.
- Validated on viral and bacterial datasets: Trained and evaluated on PPI sets including SARS-CoV-1, SARS-CoV-2 and human proteins, and applied to Mycobacterium tuberculosis.
- Experimental validation: Computational predictions have been experimentally confirmed using human monocyte THP-1 cells.
- Quality control metrics: Incorporates multiple QC metrics to assess prediction accuracy and reliability.
Scientific Applications:
- Systems-level mapping of host-pathogen interactions: Predicts previously unmapped PPIs to support systems biology analyses of infection.
- Identification of therapeutic targets: Helps identify host or pathogen proteins that may serve as targets for intervention.
- Drug repurposing support: Aids efforts to prioritize existing compounds by linking drugs to predicted host–pathogen interfaces.
- Cross-pathogen comparative studies: Enables comparative prediction across pathogens including SARS-CoV-1, SARS-CoV-2, and Mycobacterium tuberculosis.
Methodology:
HPiP extracts amino acid sequence property descriptors as sequence-based features and processes them through an ensemble of machine learning classifiers, integrating diverse feature types and combining multiple models' strengths.
Topics
Details
- License:
- MIT
- Cost:
- Free of charge
- Tool Type:
- library
- Operating Systems:
- Mac, Linux, Windows
- Programming Languages:
- R
- Added:
- 9/14/2022
- Last Updated:
- 11/24/2024
Operations
Publications
Rahmatbakhsh M, Moutaoufik MT, Gagarinova A, Babu M. HPiP: an R/Bioconductor package for predicting host–pathogen protein–protein interactions from protein sequences using ensemble machine learning approach. Bioinformatics Advances. 2022;2(1). doi:10.1093/bioadv/vbac038. PMID:35669347. PMCID:PMC9154073.
PMID: 35669347
PMCID: PMC9154073
Funding: - Natural Sciences and Engineering Research Council of Canada: DG-20234
- Canadian Institutes of Health Research: CIHR, VR2-172717