TMAP
TMAP represents high-dimensional datasets as minimum spanning trees to visualize and explore intrinsic relationships in large-scale scientific data.
Key Features:
- Locality Sensitive Hashing: Employs locality sensitive hashing to efficiently handle large datasets while preserving local structure.
- Kruskal’s Minimum-Spanning Tree Algorithm: Constructs a minimum spanning tree using Kruskal’s algorithm to represent intrinsic relationships by minimizing total edge weight.
- Multilevel Multipole-Based Graph Layout Algorithm: Applies a multilevel multipole-based graph layout algorithm to organize the tree into a hierarchical, interpretable layout.
Scientific Applications:
- Broad domains: Cheminformatics, genomics, literature mining, cancer biology, and particle physics.
- ChEMBL — 1.16 million drug-like molecules: Visualizes large-scale chemical space to facilitate analysis of chemical properties and potential interactions.
- FDB17 — 10.1 million small molecule fragments: Enables exploration of fragment-based drug discovery data.
- PDB Databank — 131 thousand 3D structures of biomolecules: Assists structural biology research by mapping 3D biomolecular structures.
- GUTENBERG Data Set: Enables exploration of large literary datasets.
- PANSCAN Data Set: Supports cancer genomics studies.
- MiniBooNE Data Set: Facilitates visualization of particle physics data.
Methodology:
TMAP uses locality sensitive hashing to handle large, high-dimensional data while preserving local structure, constructs a minimum spanning tree via Kruskal’s algorithm, and applies a multilevel multipole-based graph layout; this approach reduces memory requirements and computational time compared to t-SNE or UMAP and produces an explorable tree representation.
Topics
Details
- Programming Languages:
- Python
- Added:
- 11/14/2019
- Last Updated:
- 12/28/2020
Operations
Publications
Probst D, Reymond J. Visualization of Very Large High-Dimensional Data Sets as Minimum Spanning Trees. Unknown Journal. 2019. doi:10.26434/chemrxiv.9698861.v1.