alignparse
alignparse parses features from long-read sequencing reads (including PacBio circular consensus sequencing reads) and aligns them to user-specified target sequences to extract user-defined sequence features such as mutations, unique molecular identifiers, and cell barcodes for downstream analyses.
Key Features:
- Alignment of Long Reads: Aligns long sequencing reads, including PacBio circular consensus sequencing reads, to specified target sequences such as PCR amplicons.
- User-Specified Filtering: Filters alignments based on custom user specifications and thresholds.
- Parsing Complex Features: Parses user-defined sub-sequence features from aligned reads, including mutations, unique molecular identifiers (UMIs), cell barcodes, and flanking sequences.
- Flexible Target Specification: Accepts target sequences in GenBank Flat File format containing an arbitrary number of annotated sub-features.
- Customizable Feature Extraction: Extracts sequences, mutations, and sequence quality (accuracy) with configurable, per-feature thresholds.
Scientific Applications:
- Influenza Virus Mutation Identification: Identifies mutations in influenza virus sequences, including within single cells.
- Deep Mutational Scanning: Associates barcodes with gene mutants to support deep mutational scanning experiments.
Methodology:
Aligns long reads to target sequences, filters alignments by user specifications, parses sub-sequence features defined in GenBank Flat Files, and extracts sequences, mutations, and quality (accuracy) metrics with per-feature thresholds.
Topics
Details
- Programming Languages:
- Python
- Added:
- 1/14/2020
- Last Updated:
- 12/1/2020
Operations
Publications
Crawford K, Bloom J. alignparse: A Python package for parsing complex features from high-throughput long-read sequencing. Journal of Open Source Software. 2019;4(44):1915. doi:10.21105/joss.01915. PMID:31897449. PMCID:PMC6939853.