Kolmogorov

Kolmogorov implements alignment-free similarity measures based on approximations of Kolmogorov Complexity to quantify sequence and structure similarity for classification and phylogenetic analysis.


Key Features:

  • Alignment-Free Similarity Measurement: Uses the Universal Similarity Metric (USM), approximated via data compression principles derived from Kolmogorov Complexity, to measure similarity without sequence alignment.
  • USM Approximations: Implements three USM approximations: UCD (Universal Compression Dissimilarity), NCD (Normalized Compression Dissimilarity), and CD (Compression Dissimilarity).
  • Comparative Performance of Approximations: Experimental assessments report that UCD and NCD perform comparably across datasets while CD generally underperforms.
  • Compression Algorithm Evaluation: Tested using 25 different data compressors across six molecular biology datasets.
  • Comparison with Other Methods: Compared against alignment-based and other non-alignment methods, showing competitive results, particularly when using UCD or NCD with the PPMd compression algorithm.
  • Scalability and Data Flexibility: Scales with increasing dataset sizes and can be applied to various biological data formats beyond sequences.
  • Statistical and Classification Evaluation: Performance is assessed using F-measure and partition distance, ROC analysis, and clustering evaluations with UPGMA and NJ algorithms.

Scientific Applications:

  • Classification and Phylogenetic Studies: Measures sequence and structure similarity without alignment to support classification tasks and phylogenetic inference.
  • Post-Genomic Large-Scale Analyses: Applied in post-genomic studies where alignment-based methods face scalability limitations.
  • Compression-Based Biological Data Analysis: Uses data compression and USM-derived metrics to analyze biological datasets and reveal similarity patterns.

Methodology:

Similarity is quantified by approximating Kolmogorov Complexity via data compression and computing USM approximations (UCD, NCD, CD); experiments used 25 compressors across six molecular biology datasets and evaluation metrics including F-measure, partition distance, ROC analysis, and clustering with UPGMA and NJ.

Topics

Details

Tool Type:
command-line tool
Operating Systems:
Linux, Windows, Mac
Programming Languages:
Perl, C
Added:
8/3/2017
Last Updated:
11/25/2024

Operations

Publications

Ferragina P, Giancarlo R, Greco V, Manzini G, Valiente G. Compression-based classification of biological sequences and structures via the Universal Similarity Metric: experimental assessment. BMC Bioinformatics. 2007;8(1). doi:10.1186/1471-2105-8-252. PMID:17629909. PMCID:PMC1939857.

Documentation

Links