SVFS

SVFS selects significant features from high-dimensional biological datasets using singular vectors and a dataset-derived signature matrix to reduce dimensionality while preserving informative signals for downstream analysis.


Key Features:

  • Signature Matrix Utilization: SVFS employs a signature matrix derived from the dataset to cluster feature columns based on their correlations.
  • Iterative Clustering and Reduction: SVFS iteratively uses the signature matrix to identify clusters of correlated features and discards features outside these clusters to reduce dimensionality.
  • Cluster-Based Feature Selection: Within each identified cluster, SVFS partitions remaining features and selects the most important features from each cluster.
  • Performance Efficiency: Experiments on synthetic and real-world datasets, including genomic data, report that SVFS outperforms existing state-of-the-art feature selection methods in accuracy, running time, and memory usage.

Scientific Applications:

  • Dimensionality reduction in bioinformatics: SVFS reduces high-dimensional biological datasets while retaining informative features for analysis.
  • Genomic data analysis: SVFS is applied to genomic datasets to identify informative genomic features for downstream study.
  • Preprocessing for machine learning: SVFS provides feature sets that improve pattern recognition and classification performance of machine learning models.

Methodology:

SVFS computes a signature matrix to identify clusters of correlated features and discards features outside those clusters; the reduced dataset is then reprocessed via its signature matrix to partition clusters and select key features from each cluster.

Topics

Details

Tool Type:
command-line tool, library
Programming Languages:
Python
Added:
3/19/2021
Last Updated:
4/10/2021

Operations

Publications

Afshar M, Usefi H. Dimensionality reduction using singular vectors. Scientific Reports. 2021;11(1). doi:10.1038/s41598-021-83150-y. PMID:33589703. PMCID:PMC7884742.