Conserved Feature Discovery (CFD)

Conserved Feature Discovery (CFD) identifies features that exhibit consistently strong signals across multiple conditions or samples to detect conserved biological signals.


Key Features:

  • Parameter-Free Analysis: CFD operates without predefined parameters, enabling analysis of diverse real-valued datasets.
  • Distribution-Agnostic: The method does not assume specific sample distributions or value ranges.
  • Robustness to Variability: CFD is tolerant to a small percentage of poor-quality samples and is resilient against false positives.
  • High Probability Accuracy: Under assumptions on the median and variance distributions of feature measurements, CFD can identify true positives while avoiding false positives with high probability.

Scientific Applications:

  • RNA-seq analysis: Applied to RNA sequencing data, including the Human Body Map and GTEx, to identify consistently expressed features across tissues.
  • Housekeeping gene identification: Identified housekeeping genes as highly expressed conserved features across tissue types.
  • Quality control and conserved feature discovery: Used in bioinformatics to support dataset quality control and the discovery of conserved biological processes.

Methodology:

CFD employs a parameter-free, distribution-agnostic statistical framework and is implemented in Go.

Topics

Details

Tool Type:
command-line tool
Programming Languages:
Python
Added:
1/14/2020
Last Updated:
12/19/2020

Operations

Publications

Sauerwald N, Kingsford C. A statistical nonparametric method for identifying consistently important features across samples. Unknown Journal. 2019. doi:10.1101/833624.