SVFS
SVFS selects significant features from high-dimensional biological datasets using singular vectors and a dataset-derived signature matrix to reduce dimensionality while preserving informative signals for downstream analysis.
Key Features:
- Signature Matrix Utilization: SVFS employs a signature matrix derived from the dataset to cluster feature columns based on their correlations.
- Iterative Clustering and Reduction: SVFS iteratively uses the signature matrix to identify clusters of correlated features and discards features outside these clusters to reduce dimensionality.
- Cluster-Based Feature Selection: Within each identified cluster, SVFS partitions remaining features and selects the most important features from each cluster.
- Performance Efficiency: Experiments on synthetic and real-world datasets, including genomic data, report that SVFS outperforms existing state-of-the-art feature selection methods in accuracy, running time, and memory usage.
Scientific Applications:
- Dimensionality reduction in bioinformatics: SVFS reduces high-dimensional biological datasets while retaining informative features for analysis.
- Genomic data analysis: SVFS is applied to genomic datasets to identify informative genomic features for downstream study.
- Preprocessing for machine learning: SVFS provides feature sets that improve pattern recognition and classification performance of machine learning models.
Methodology:
SVFS computes a signature matrix to identify clusters of correlated features and discards features outside those clusters; the reduced dataset is then reprocessed via its signature matrix to partition clusters and select key features from each cluster.
Topics
Details
- Tool Type:
- command-line tool, library
- Programming Languages:
- Python
- Added:
- 3/19/2021
- Last Updated:
- 4/10/2021
Operations
Publications
Afshar M, Usefi H. Dimensionality reduction using singular vectors. Scientific Reports. 2021;11(1). doi:10.1038/s41598-021-83150-y. PMID:33589703. PMCID:PMC7884742.