Holden

Holden detects fabrication and falsification in large-scale molecular omics datasets using machine learning analyses to assess data authenticity.


Key Features:

  • Raw Data Analysis: Accepts raw omics datasets as input and applies machine learning models to identify fabricated results.
  • Digit Frequency Analysis: Uses digit frequency within datasets as input features to identify unnatural patterns associated with fabrication, with reported detection rates of 98%–100%.
  • Machine Learning Detection Performance: Machine learning models applied to raw data report 84%–95% success rates in identifying fabricated results.
  • Scope: Targets large-scale molecular omics datasets for integrity assessment and validation of data authenticity.

Scientific Applications:

  • Fabrication and falsification detection: Identification of fabricated or falsified results within molecular omics datasets.
  • Data authenticity validation: Validation of omics data integrity for downstream analyses and reproducibility assessments.

Methodology:

Inputs are raw omics datasets; machine learning models are applied to raw data; digit frequency within datasets is used as input features to machine learning models; reported detection rates are 84%–95% for raw-data models and 98%–100% for digit-frequency-based models.

Topics

Details

Tool Type:
command-line tool
Programming Languages:
Python
Added:
11/14/2019
Last Updated:
12/10/2020

Operations

Publications

Bradshaw MS, Payne SH. Detecting fabrication in large-scale molecular omics data. Unknown Journal. 2019. doi:10.1101/757070.