DLEAMSE

DLEAMSE embeds mass spectra using deep learning to enhance spectral similarity scoring for proteomics, supporting improved protein identification and mass spectra clustering.


Key Features:

  • Deep Learning Integration: Employs Siamese Networks trained on high-quality spectra from PRIDE Cluster to learn implicit spectral features for similarity scoring.
  • Embedding Representation: Encodes spectra into compact 32-D vectors for downstream similarity calculations.
  • Efficiency and Speed: Optimized for computational efficiency and GPU servers, achieving a significant reduction in computation time and performing similarity assessments at roughly one-third of the computation time required by the normalized dot product (NDP).
  • Benchmarking and Performance: Demonstrates accuracy comparable to conventional spectral similarity scoring techniques while offering faster throughput.
  • Persistent Embedding Storage: Allows storage of 32-D embeddings in a repository to enable rapid future comparisons without reprocessing raw spectra.
  • Complementary Tool - mslookup: Includes mslookup for searching previously identified spectra in public repositories and spectral libraries to support in-house database creation.

Scientific Applications:

  • Protein Identification: Improves matching of experimental spectra to theoretical or reference spectra to enhance protein identifications.
  • Mass Spectra Clustering: Provides reliable similarity scores to improve clustering of related spectra in large-scale proteomics datasets.

Methodology:

The model is trained using Siamese Networks on spectra from PRIDE Cluster, encodes spectra into 32-D vectors, and computes similarity via Euclidean distance, with training and embedding optimized for GPU servers.

Topics

Details

License:
Apache-2.0
Programming Languages:
Python
Added:
1/18/2021
Last Updated:
11/24/2024

Operations

Publications

Qin C, Luo X, Deng C, Shu K, Zhu W, Griss J, Hermjakob H, Bai M, Perez-Riverol Y. Deep learning embedder method and tool for mass spectra similarity search. Journal of Proteomics. 2021;232:104070. doi:10.1016/j.jprot.2020.104070. PMID:33307250. PMCID:PMC7613299.

PMID: 33307250
PMCID: PMC7613299
Funding: - Wellcome Trust: 208391/Z/17/Z, WT101477MA - Natural Science Foundation of Chongqing: cstc2018jcyjAX0225 - State Key Laboratory of Robotics: SKLP-K2017,05 - National Key Research and Development Program of China: 2017YFA0505002, 2017YFC0906602