alignparse

alignparse parses features from long-read sequencing reads (including PacBio circular consensus sequencing reads) and aligns them to user-specified target sequences to extract user-defined sequence features such as mutations, unique molecular identifiers, and cell barcodes for downstream analyses.


Key Features:

  • Alignment of Long Reads: Aligns long sequencing reads, including PacBio circular consensus sequencing reads, to specified target sequences such as PCR amplicons.
  • User-Specified Filtering: Filters alignments based on custom user specifications and thresholds.
  • Parsing Complex Features: Parses user-defined sub-sequence features from aligned reads, including mutations, unique molecular identifiers (UMIs), cell barcodes, and flanking sequences.
  • Flexible Target Specification: Accepts target sequences in GenBank Flat File format containing an arbitrary number of annotated sub-features.
  • Customizable Feature Extraction: Extracts sequences, mutations, and sequence quality (accuracy) with configurable, per-feature thresholds.

Scientific Applications:

  • Influenza Virus Mutation Identification: Identifies mutations in influenza virus sequences, including within single cells.
  • Deep Mutational Scanning: Associates barcodes with gene mutants to support deep mutational scanning experiments.

Methodology:

Aligns long reads to target sequences, filters alignments by user specifications, parses sub-sequence features defined in GenBank Flat Files, and extracts sequences, mutations, and quality (accuracy) metrics with per-feature thresholds.

Topics

Details

Programming Languages:
Python
Added:
1/14/2020
Last Updated:
12/1/2020

Operations

Publications

Crawford K, Bloom J. alignparse: A Python package for parsing complex features from high-throughput long-read sequencing. Journal of Open Source Software. 2019;4(44):1915. doi:10.21105/joss.01915. PMID:31897449. PMCID:PMC6939853.

Links