AlignBucket
AlignBucket partitions protein FASTA files into length-constrained subsets optimized for BLAST (Basic Local Alignment Search Tool) all-against-all alignments to improve efficiency of similarity-based annotation.
Key Features:
- Optimized Partitioning: Partitions large protein FASTA datasets into subsets based on sequence length constraints determined by specified minimum and expected alignment coverage values for efficient all-against-all BLAST comparisons.
- Mathematically Optimal Grouping: Applies a mathematically optimal approach to group protein sequences by length to maximize alignment coverage within each subset.
- Constraint-based Partitioning Algorithm: Employs a constraint-based partitioning algorithm that dynamically adjusts to the desired minimum alignment coverage when forming subsets.
- Speed and Efficiency: Reduces redundant computations for all-against-all comparisons and has demonstrated up to a 5-fold reduction in processing time.
Scientific Applications:
- Genomic Research: Facilitates annotation of newly sequenced genomes by enabling efficient similarity searches against existing databases using BLAST.
- Proteomics Studies: Streamlines alignment of proteome datasets to support identification of protein functions and interactions.
- Variant Analysis: Supports identification of sequence variations by ensuring comprehensive coverage in all-against-all comparisons.
Methodology:
AlignBucket's methodology revolves around a constraint-based partitioning algorithm that dynamically adjusts to the desired minimum alignment coverage and groups sequences into length-constrained subsets to minimize redundant computations and focus alignment efforts.
Topics
Details
- Tool Type:
- command-line tool
- Operating Systems:
- Linux
- Programming Languages:
- Shell, C++, Python
- Added:
- 8/3/2017
- Last Updated:
- 11/25/2024
Operations
Publications
Profiti G, Fariselli P, Casadio R. AlignBucket: a tool to speed up ‘all-against-all’ protein sequence alignments optimizing length constraints. Bioinformatics. 2015;31(23):3841-3843. doi:10.1093/bioinformatics/btv451. PMID:26231432.