CODER

CODER produces cross-lingual, knowledge-infused medical concept embeddings by applying contrastive learning to Unified Medical Language System (UMLS) term similarities and knowledge graph relation triplets.


Key Features:

  • Cross-lingual embeddings: Generates embeddings that represent medical concepts across languages.
  • UMLS knowledge integration: Integrates structured knowledge from the Unified Medical Language System (UMLS) knowledge graph into the embedding space.
  • Contrastive learning objective: Uses contrastive learning to align term-level similarity signals with relational information.
  • Relation triplet training: Trains on relation triplets from the UMLS knowledge graph to encode inter-concept relations.
  • Term- and relation-level fusion: Combines term-based similarities and KG relational triplets when learning embeddings.
  • Pretrained-model compatibility and fine-tuning: Supports fine-tuning analogous to pretrained language models for task adaptation.
  • Benchmark evaluation: Evaluated on zero-shot term normalization, semantic similarity, and relation classification benchmarks with superior performance versus biomedical word, concept, and contextual embeddings.
  • Feature provision for ML: Produces embeddings intended for use as features in downstream machine-learning models.

Scientific Applications:

  • Zero-shot term normalization: Enables mapping of diverse surface forms to standardized UMLS concepts without task-specific supervision.
  • Semantic similarity assessment: Supports quantitative evaluation of semantic similarity between medical concepts.
  • Relation classification: Encodes relational signals useful for classifying relations among medical concepts.
  • Embedding-based terminology mapping: Facilitates embedding-driven mapping of terminologies to UMLS concepts.
  • Feature extraction for downstream models: Supplies knowledge-aware embeddings as inputs to machine-learning pipelines.

Methodology:

Applies contrastive learning on UMLS knowledge graph data, training with relation triplets and term-based similarity signals to produce knowledge-infused embeddings and supports fine-tuning similar to pretrained language models.

Topics

Details

Cost:
Free of charge
Tool Type:
command-line tool
Operating Systems:
Mac, Linux, Windows
Programming Languages:
Python
Added:
6/10/2022
Last Updated:
6/10/2022

Operations

Publications

Yuan Z, Zhao Z, Sun H, Li J, Wang F, Yu S. CODER: Knowledge-infused cross-lingual medical term embedding for term normalization. Journal of Biomedical Informatics. 2022;126:103983. doi:10.1016/j.jbi.2021.103983. PMID:34990838.

PMID: 34990838
Funding: - Natural Science Foundation of Beijing Municipality: Z190024 - National Key Research and Development Program of China: 2016YFC0901901 - National Natural Science Foundation of China: 11801301