ReCiter
ReCiter predicts scholarly authorship and maintains institutional publication lists by using institutionally-maintained identity data to disambiguate authors and map articles to scholars.
Key Features:
- Identity-Driven Authorship Prediction: Uses identity data points including department names and years of terminal degrees to assess the likelihood that a scholar authored specific publications.
- Comprehensive Data Integration: Integrates up to 12 types of identity data, considers accepted or rejected statuses of other members of an article cluster, and incorporates the cluster average score into predictions.
- Scoring and Evidence Provision: Provides numerical scoring metrics and qualitative evidence for suggested articles to support curator validation.
- SVM-Optimized Scoring Algorithm: Employs support vector machine (SVM) analysis to refine and optimize the scoring algorithm.
- Data Sources and Candidate Scoring: Calculates overall scores for candidate articles drawn from PubMed and optionally Scopus by integrating multiple data points and cluster analysis.
- Architecture and Deployment: Implemented as a Java application with RESTful microservices and uses DynamoDB for data storage.
- Performance Evaluation: In a test of 500 scholars at an academic private medical center, correctly predicted 98% of their publications in PubMed.
Scientific Applications:
- Institutional Publication Maintenance: Automates creation and updating of institutional publication lists by mapping articles to scholars using identity data.
- Author Disambiguation in Bibliographic Databases: Resolves author identity in databases such as PubMed and Scopus using institutionally-maintained identity attributes and cluster analysis.
- Curation Support and Notification: Supplies scored candidate articles and supporting evidence to enable curator validation and notification of scholars about attributed publications.
Methodology:
Uses institutionally-maintained identity data to predict authorship, calculates overall scores for candidate articles from PubMed (and optionally Scopus) by integrating multiple identity data points and cluster analysis, considers accepted/rejected cluster member statuses and cluster average scores, and applies SVM analysis to optimize the scoring algorithm; implemented as a Java application with RESTful microservices and DynamoDB for storage.
Topics
Details
- License:
- Apache-2.0
- Tool Type:
- api
- Programming Languages:
- Java
- Added:
- 11/29/2021
- Last Updated:
- 11/29/2021
Operations
Publications
Albert PJ, Dutta S, Lin J, Zhu Z, Bales M, Johnson SB, Mansour M, Wright D, Wheeler TR, Cole CL. ReCiter: An open source, identity-driven, authorship prediction algorithm optimized for academic institutions. PLOS ONE. 2021;16(4):e0244641. doi:10.1371/journal.pone.0244641. PMID:33793563. PMCID:PMC8016248.