MisMax

MisMax computes sequence similarity matrices using an alignment-free approach that identifies shared maximal words permitting mismatches to assess similarity among sets of sequences.


Key Features:

  • Alignment-Free Approach: Eliminates the need for traditional sequence alignments by using alignment-free similarity measures.
  • Shared Maximal Words with Mismatches: Identifies common maximal substrings (maximal words) between sequences while allowing a predefined number of mismatches.
  • Efficiency: Leverages shared substrings and tolerates mismatches to achieve computational efficiency that can be better than O(n^2) in certain scenarios.

Scientific Applications:

  • Phylogeny: Aids construction of evolutionary trees by identifying sequence similarities that reflect genetic relationships.
  • Classification: Enables classification of sequences based on similarity measures that may reveal relationships overlooked by stricter methods.

Methodology:

Computes similarity matrices by identifying shared maximal words between sequences with allowance for a predefined number of mismatches, leveraging the principle of relative compressibility (shared substrings) and aiming for improved computational efficiency in certain scenarios.

Topics

Details

Tool Type:
command-line tool
Added:
1/22/2015
Last Updated:
12/10/2018

Operations

Publications

Apostolico A, Guerra C, Pizzi C. Alignment Free Sequence Similarity with Bounded Hamming Distance. 2014 Data Compression Conference. 2014. doi:10.1109/dcc.2014.57.