ReCiter

ReCiter predicts scholarly authorship and maintains institutional publication lists by using institutionally-maintained identity data to disambiguate authors and map articles to scholars.


Key Features:

  • Identity-Driven Authorship Prediction: Uses identity data points including department names and years of terminal degrees to assess the likelihood that a scholar authored specific publications.
  • Comprehensive Data Integration: Integrates up to 12 types of identity data, considers accepted or rejected statuses of other members of an article cluster, and incorporates the cluster average score into predictions.
  • Scoring and Evidence Provision: Provides numerical scoring metrics and qualitative evidence for suggested articles to support curator validation.
  • SVM-Optimized Scoring Algorithm: Employs support vector machine (SVM) analysis to refine and optimize the scoring algorithm.
  • Data Sources and Candidate Scoring: Calculates overall scores for candidate articles drawn from PubMed and optionally Scopus by integrating multiple data points and cluster analysis.
  • Architecture and Deployment: Implemented as a Java application with RESTful microservices and uses DynamoDB for data storage.
  • Performance Evaluation: In a test of 500 scholars at an academic private medical center, correctly predicted 98% of their publications in PubMed.

Scientific Applications:

  • Institutional Publication Maintenance: Automates creation and updating of institutional publication lists by mapping articles to scholars using identity data.
  • Author Disambiguation in Bibliographic Databases: Resolves author identity in databases such as PubMed and Scopus using institutionally-maintained identity attributes and cluster analysis.
  • Curation Support and Notification: Supplies scored candidate articles and supporting evidence to enable curator validation and notification of scholars about attributed publications.

Methodology:

Uses institutionally-maintained identity data to predict authorship, calculates overall scores for candidate articles from PubMed (and optionally Scopus) by integrating multiple identity data points and cluster analysis, considers accepted/rejected cluster member statuses and cluster average scores, and applies SVM analysis to optimize the scoring algorithm; implemented as a Java application with RESTful microservices and DynamoDB for storage.

Topics

Details

License:
Apache-2.0
Tool Type:
api
Programming Languages:
Java
Added:
11/29/2021
Last Updated:
11/29/2021

Operations

Publications

Albert PJ, Dutta S, Lin J, Zhu Z, Bales M, Johnson SB, Mansour M, Wright D, Wheeler TR, Cole CL. ReCiter: An open source, identity-driven, authorship prediction algorithm optimized for academic institutions. PLOS ONE. 2021;16(4):e0244641. doi:10.1371/journal.pone.0244641. PMID:33793563. PMCID:PMC8016248.

PMID: 33793563
PMCID: PMC8016248
Funding: - National Center For Advancing Translational Sciences: UL1TR000457

Links