DLEAMSE
DLEAMSE embeds mass spectra using deep learning to enhance spectral similarity scoring for proteomics, supporting improved protein identification and mass spectra clustering.
Key Features:
- Deep Learning Integration: Employs Siamese Networks trained on high-quality spectra from PRIDE Cluster to learn implicit spectral features for similarity scoring.
- Embedding Representation: Encodes spectra into compact 32-D vectors for downstream similarity calculations.
- Efficiency and Speed: Optimized for computational efficiency and GPU servers, achieving a significant reduction in computation time and performing similarity assessments at roughly one-third of the computation time required by the normalized dot product (NDP).
- Benchmarking and Performance: Demonstrates accuracy comparable to conventional spectral similarity scoring techniques while offering faster throughput.
- Persistent Embedding Storage: Allows storage of 32-D embeddings in a repository to enable rapid future comparisons without reprocessing raw spectra.
- Complementary Tool - mslookup: Includes mslookup for searching previously identified spectra in public repositories and spectral libraries to support in-house database creation.
Scientific Applications:
- Protein Identification: Improves matching of experimental spectra to theoretical or reference spectra to enhance protein identifications.
- Mass Spectra Clustering: Provides reliable similarity scores to improve clustering of related spectra in large-scale proteomics datasets.
Methodology:
The model is trained using Siamese Networks on spectra from PRIDE Cluster, encodes spectra into 32-D vectors, and computes similarity via Euclidean distance, with training and embedding optimized for GPU servers.
Topics
Details
- License:
- Apache-2.0
- Programming Languages:
- Python
- Added:
- 1/18/2021
- Last Updated:
- 11/24/2024
Operations
Publications
Qin C, Luo X, Deng C, Shu K, Zhu W, Griss J, Hermjakob H, Bai M, Perez-Riverol Y. Deep learning embedder method and tool for mass spectra similarity search. Journal of Proteomics. 2021;232:104070. doi:10.1016/j.jprot.2020.104070. PMID:33307250. PMCID:PMC7613299.
PMID: 33307250
PMCID: PMC7613299
Funding: - Wellcome Trust: 208391/Z/17/Z, WT101477MA
- Natural Science Foundation of Chongqing: cstc2018jcyjAX0225
- State Key Laboratory of Robotics: SKLP-K2017,05
- National Key Research and Development Program of China: 2017YFA0505002, 2017YFC0906602