CODER
CODER produces cross-lingual, knowledge-infused medical concept embeddings by applying contrastive learning to Unified Medical Language System (UMLS) term similarities and knowledge graph relation triplets.
Key Features:
- Cross-lingual embeddings: Generates embeddings that represent medical concepts across languages.
- UMLS knowledge integration: Integrates structured knowledge from the Unified Medical Language System (UMLS) knowledge graph into the embedding space.
- Contrastive learning objective: Uses contrastive learning to align term-level similarity signals with relational information.
- Relation triplet training: Trains on relation triplets from the UMLS knowledge graph to encode inter-concept relations.
- Term- and relation-level fusion: Combines term-based similarities and KG relational triplets when learning embeddings.
- Pretrained-model compatibility and fine-tuning: Supports fine-tuning analogous to pretrained language models for task adaptation.
- Benchmark evaluation: Evaluated on zero-shot term normalization, semantic similarity, and relation classification benchmarks with superior performance versus biomedical word, concept, and contextual embeddings.
- Feature provision for ML: Produces embeddings intended for use as features in downstream machine-learning models.
Scientific Applications:
- Zero-shot term normalization: Enables mapping of diverse surface forms to standardized UMLS concepts without task-specific supervision.
- Semantic similarity assessment: Supports quantitative evaluation of semantic similarity between medical concepts.
- Relation classification: Encodes relational signals useful for classifying relations among medical concepts.
- Embedding-based terminology mapping: Facilitates embedding-driven mapping of terminologies to UMLS concepts.
- Feature extraction for downstream models: Supplies knowledge-aware embeddings as inputs to machine-learning pipelines.
Methodology:
Applies contrastive learning on UMLS knowledge graph data, training with relation triplets and term-based similarity signals to produce knowledge-infused embeddings and supports fine-tuning similar to pretrained language models.
Topics
Details
- Cost:
- Free of charge
- Tool Type:
- command-line tool
- Operating Systems:
- Mac, Linux, Windows
- Programming Languages:
- Python
- Added:
- 6/10/2022
- Last Updated:
- 6/10/2022
Operations
Publications
Yuan Z, Zhao Z, Sun H, Li J, Wang F, Yu S. CODER: Knowledge-infused cross-lingual medical term embedding for term normalization. Journal of Biomedical Informatics. 2022;126:103983. doi:10.1016/j.jbi.2021.103983. PMID:34990838.
PMID: 34990838
Funding: - Natural Science Foundation of Beijing Municipality: Z190024
- National Key Research and Development Program of China: 2016YFC0901901
- National Natural Science Foundation of China: 11801301