KNNimpute

KNNimpute imputes missing values in gene expression microarray datasets using a weighted k-nearest neighbors algorithm to enable complete-data analyses such as hierarchical clustering and K-means clustering.


Key Features:

  • Weighted KNN algorithm: Uses a weighted k-nearest neighbors approach to estimate missing entries.
  • Gene/sample similarity: Leverages similarity between genes or samples to predict missing values from nearest neighbors.
  • Microarray focus: Specifically targets missing values in gene expression microarray data matrices.
  • Comparative evaluation: Was evaluated against SVDimpute (Singular Value Decomposition), row average, and zero-filling methods.
  • Robustness across missingness levels: Demonstrated performance across 1% to 20% missing data and various parameter settings.
  • Improves clustering analyses: Enhances applicability of downstream methods such as hierarchical clustering and K-means clustering by providing complete data matrices.

Scientific Applications:

  • Clustering of gene expression data: Enables hierarchical clustering of microarray experiments by supplying imputed values for incomplete matrices.
  • K-means clustering: Facilitates K-means clustering on datasets with missing microarray values.
  • Robust gene expression analysis: Reduces the impact of incomplete data on sensitivity and robustness of downstream analyses.

Methodology:

Imputes missing microarray values using a weighted k-nearest neighbors algorithm that predicts entries from similar genes or samples; validated in a comparative study (PMID: 11395428) against SVDimpute (Singular Value Decomposition), row average, and zero-filling across parameter settings and 1% to 20% missingness on real datasets.

Topics

Details

Tool Type:
command-line tool
Operating Systems:
Linux, Windows
Added:
8/3/2017
Last Updated:
11/25/2024

Operations

Publications

Troyanskaya O, Cantor M, Sherlock G, Brown P, Hastie T, Tibshirani R, Botstein D, Altman RB. Missing value estimation methods for DNA microarrays. Bioinformatics. 2001;17(6):520-525. doi:10.1093/bioinformatics/17.6.520. PMID:11395428.

Documentation

Links