Kolmogorov
Kolmogorov implements alignment-free similarity measures based on approximations of Kolmogorov Complexity to quantify sequence and structure similarity for classification and phylogenetic analysis.
Key Features:
- Alignment-Free Similarity Measurement: Uses the Universal Similarity Metric (USM), approximated via data compression principles derived from Kolmogorov Complexity, to measure similarity without sequence alignment.
- USM Approximations: Implements three USM approximations: UCD (Universal Compression Dissimilarity), NCD (Normalized Compression Dissimilarity), and CD (Compression Dissimilarity).
- Comparative Performance of Approximations: Experimental assessments report that UCD and NCD perform comparably across datasets while CD generally underperforms.
- Compression Algorithm Evaluation: Tested using 25 different data compressors across six molecular biology datasets.
- Comparison with Other Methods: Compared against alignment-based and other non-alignment methods, showing competitive results, particularly when using UCD or NCD with the PPMd compression algorithm.
- Scalability and Data Flexibility: Scales with increasing dataset sizes and can be applied to various biological data formats beyond sequences.
- Statistical and Classification Evaluation: Performance is assessed using F-measure and partition distance, ROC analysis, and clustering evaluations with UPGMA and NJ algorithms.
Scientific Applications:
- Classification and Phylogenetic Studies: Measures sequence and structure similarity without alignment to support classification tasks and phylogenetic inference.
- Post-Genomic Large-Scale Analyses: Applied in post-genomic studies where alignment-based methods face scalability limitations.
- Compression-Based Biological Data Analysis: Uses data compression and USM-derived metrics to analyze biological datasets and reveal similarity patterns.
Methodology:
Similarity is quantified by approximating Kolmogorov Complexity via data compression and computing USM approximations (UCD, NCD, CD); experiments used 25 compressors across six molecular biology datasets and evaluation metrics including F-measure, partition distance, ROC analysis, and clustering with UPGMA and NJ.
Topics
Details
- Tool Type:
- command-line tool
- Operating Systems:
- Linux, Windows, Mac
- Programming Languages:
- Perl, C
- Added:
- 8/3/2017
- Last Updated:
- 11/25/2024
Operations
Publications
Ferragina P, Giancarlo R, Greco V, Manzini G, Valiente G. Compression-based classification of biological sequences and structures via the Universal Similarity Metric: experimental assessment. BMC Bioinformatics. 2007;8(1). doi:10.1186/1471-2105-8-252. PMID:17629909. PMCID:PMC1939857.