panseq
panseq identifies and analyzes pan-genomes by defining core and accessory genomic regions and extracting SNP and presence/absence variation among bacterial genomes.
Key Features:
- Core and Accessory Region Identification: Defines core and accessory genomic regions among input genomes using user-defined parameters.
- Unique Region Extraction: Extracts unique genomic regions or groups of regions from genome collections.
- SNP Detection: Identifies single nucleotide polymorphisms (SNPs) within shared core regions and extracts core genome SNPs for comparative analysis.
- Binary Presence/Absence Matrices: Generates binary presence/absence data for accessory genomic elements across strains.
- Genomic Island Detection: Identifies genomic islands, as demonstrated in analyses of Escherichia coli O157:H7 and E. coli K-12.
- PCR Validation Reporting: Reports accessory regions that were confirmed by PCR in experimental studies (e.g., 65 regions in 60 E. coli O157:H7 strains).
- Hierarchical Clustering and Visualization: Provides core SNP and accessory presence/absence data for hierarchical clustering and graphical representation (e.g., Listeria monocytogenes comparisons).
- Phylogenetic Analysis: Constructs maximum parsimony (MP) trees from nucleotide core data and binary accessory data for phylogenetic inference and comparison with MLST-based trees.
- Loci Selector Module: Rapidly identifies the most variable and discriminatory loci among accessory or core gene SNPs, reducing computational time versus exhaustive searches.
- Graphical Output: Produces graphical overviews of comparative and phylogenetic results.
Scientific Applications:
- Genomic Island Discovery: Detection and characterization of genomic islands in Escherichia coli O157:H7 and E. coli K-12.
- Experimental Validation of Accessory Regions: Identification of accessory genomic regions subsequently confirmed by PCR in strain collections (e.g., E. coli O157:H7).
- Comparative Genomics and Clustering: Comparative analyses and hierarchical clustering of strains such as Listeria monocytogenes using core SNPs and accessory presence/absence data.
- Phylogenetic Comparison: Construction and comparison of MP trees from core and accessory data to trees generated by multi-locus sequence typing (MLST).
- Marker Selection for Typing: Selection of highly discriminatory loci for strain differentiation and typing based on SNP variability.
Methodology:
Defines core and accessory regions using user-defined parameters; extracts unique regions and core SNPs; generates binary presence/absence matrices; performs hierarchical clustering; constructs maximum parsimony trees from nucleotide core and binary accessory data; and ranks loci by variability using the Loci Selector module; implemented in Perl.
Topics
Details
- License:
- GPL-3.0
- Cost:
- Free of charge
- Tool Type:
- command-line tool
- Operating Systems:
- Mac, Linux, Windows
- Added:
- 3/23/2022
- Last Updated:
- 3/23/2022
Operations
Publications
Laing C, Buchanan C, Taboada EN, Zhang Y, Kropinski A, Villegas A, Thomas JE, Gannon VP. Pan-genome sequence analysis using Panseq: an online tool for the rapid analysis of core and accessory genomic regions. BMC Bioinformatics. 2010;11(1). doi:10.1186/1471-2105-11-461. PMID:20843356. PMCID:PMC2949892.