KNNimpute
KNNimpute imputes missing values in gene expression microarray datasets using a weighted k-nearest neighbors algorithm to enable complete-data analyses such as hierarchical clustering and K-means clustering.
Key Features:
- Weighted KNN algorithm: Uses a weighted k-nearest neighbors approach to estimate missing entries.
- Gene/sample similarity: Leverages similarity between genes or samples to predict missing values from nearest neighbors.
- Microarray focus: Specifically targets missing values in gene expression microarray data matrices.
- Comparative evaluation: Was evaluated against SVDimpute (Singular Value Decomposition), row average, and zero-filling methods.
- Robustness across missingness levels: Demonstrated performance across 1% to 20% missing data and various parameter settings.
- Improves clustering analyses: Enhances applicability of downstream methods such as hierarchical clustering and K-means clustering by providing complete data matrices.
Scientific Applications:
- Clustering of gene expression data: Enables hierarchical clustering of microarray experiments by supplying imputed values for incomplete matrices.
- K-means clustering: Facilitates K-means clustering on datasets with missing microarray values.
- Robust gene expression analysis: Reduces the impact of incomplete data on sensitivity and robustness of downstream analyses.
Methodology:
Imputes missing microarray values using a weighted k-nearest neighbors algorithm that predicts entries from similar genes or samples; validated in a comparative study (PMID: 11395428) against SVDimpute (Singular Value Decomposition), row average, and zero-filling across parameter settings and 1% to 20% missingness on real datasets.
Topics
Details
- Tool Type:
- command-line tool
- Operating Systems:
- Linux, Windows
- Added:
- 8/3/2017
- Last Updated:
- 11/25/2024
Operations
Publications
Troyanskaya O, Cantor M, Sherlock G, Brown P, Hastie T, Tibshirani R, Botstein D, Altman RB. Missing value estimation methods for DNA microarrays. Bioinformatics. 2001;17(6):520-525. doi:10.1093/bioinformatics/17.6.520. PMID:11395428.