panseq

panseq identifies and analyzes pan-genomes by defining core and accessory genomic regions and extracting SNP and presence/absence variation among bacterial genomes.


Key Features:

  • Core and Accessory Region Identification: Defines core and accessory genomic regions among input genomes using user-defined parameters.
  • Unique Region Extraction: Extracts unique genomic regions or groups of regions from genome collections.
  • SNP Detection: Identifies single nucleotide polymorphisms (SNPs) within shared core regions and extracts core genome SNPs for comparative analysis.
  • Binary Presence/Absence Matrices: Generates binary presence/absence data for accessory genomic elements across strains.
  • Genomic Island Detection: Identifies genomic islands, as demonstrated in analyses of Escherichia coli O157:H7 and E. coli K-12.
  • PCR Validation Reporting: Reports accessory regions that were confirmed by PCR in experimental studies (e.g., 65 regions in 60 E. coli O157:H7 strains).
  • Hierarchical Clustering and Visualization: Provides core SNP and accessory presence/absence data for hierarchical clustering and graphical representation (e.g., Listeria monocytogenes comparisons).
  • Phylogenetic Analysis: Constructs maximum parsimony (MP) trees from nucleotide core data and binary accessory data for phylogenetic inference and comparison with MLST-based trees.
  • Loci Selector Module: Rapidly identifies the most variable and discriminatory loci among accessory or core gene SNPs, reducing computational time versus exhaustive searches.
  • Graphical Output: Produces graphical overviews of comparative and phylogenetic results.

Scientific Applications:

  • Genomic Island Discovery: Detection and characterization of genomic islands in Escherichia coli O157:H7 and E. coli K-12.
  • Experimental Validation of Accessory Regions: Identification of accessory genomic regions subsequently confirmed by PCR in strain collections (e.g., E. coli O157:H7).
  • Comparative Genomics and Clustering: Comparative analyses and hierarchical clustering of strains such as Listeria monocytogenes using core SNPs and accessory presence/absence data.
  • Phylogenetic Comparison: Construction and comparison of MP trees from core and accessory data to trees generated by multi-locus sequence typing (MLST).
  • Marker Selection for Typing: Selection of highly discriminatory loci for strain differentiation and typing based on SNP variability.

Methodology:

Defines core and accessory regions using user-defined parameters; extracts unique regions and core SNPs; generates binary presence/absence matrices; performs hierarchical clustering; constructs maximum parsimony trees from nucleotide core and binary accessory data; and ranks loci by variability using the Loci Selector module; implemented in Perl.

Topics

Details

License:
GPL-3.0
Cost:
Free of charge
Tool Type:
command-line tool
Operating Systems:
Mac, Linux, Windows
Added:
3/23/2022
Last Updated:
3/23/2022

Operations

Publications

Laing C, Buchanan C, Taboada EN, Zhang Y, Kropinski A, Villegas A, Thomas JE, Gannon VP. Pan-genome sequence analysis using Panseq: an online tool for the rapid analysis of core and accessory genomic regions. BMC Bioinformatics. 2010;11(1). doi:10.1186/1471-2105-11-461. PMID:20843356. PMCID:PMC2949892.