Holden
Holden detects fabrication and falsification in large-scale molecular omics datasets using machine learning analyses to assess data authenticity.
Key Features:
- Raw Data Analysis: Accepts raw omics datasets as input and applies machine learning models to identify fabricated results.
- Digit Frequency Analysis: Uses digit frequency within datasets as input features to identify unnatural patterns associated with fabrication, with reported detection rates of 98%–100%.
- Machine Learning Detection Performance: Machine learning models applied to raw data report 84%–95% success rates in identifying fabricated results.
- Scope: Targets large-scale molecular omics datasets for integrity assessment and validation of data authenticity.
Scientific Applications:
- Fabrication and falsification detection: Identification of fabricated or falsified results within molecular omics datasets.
- Data authenticity validation: Validation of omics data integrity for downstream analyses and reproducibility assessments.
Methodology:
Inputs are raw omics datasets; machine learning models are applied to raw data; digit frequency within datasets is used as input features to machine learning models; reported detection rates are 84%–95% for raw-data models and 98%–100% for digit-frequency-based models.
Topics
Details
- Tool Type:
- command-line tool
- Programming Languages:
- Python
- Added:
- 11/14/2019
- Last Updated:
- 12/10/2020
Operations
Publications
Bradshaw MS, Payne SH. Detecting fabrication in large-scale molecular omics data. Unknown Journal. 2019. doi:10.1101/757070.
DOI: 10.1101/757070