NPBSS
NPBSS generates high-fidelity continuous long reads (CLR) that mimic raw PacBio SMRT sequencing data for use in de novo genome assembly and benchmarking.
Key Features:
- Logarithmic Normal Distribution Sampling: Samples read lengths from a logarithmic normal distribution to reflect the natural variability of PacBio CLR read lengths.
- Base Quality Value Assignment: Assigns base quality values with varying proportions across reads to emulate base-level quality variation.
- Empirical Error Modeling: Employs an empirical model to compute an overall error probability for each base within a read.
- Error Probability Calculations: Computes deletion, substitution, and insertion probabilities based on the per-base overall error probability.
Scientific Applications:
- De Novo Genome Assembly: Provides realistic CLR datasets for testing and optimizing assembly algorithms aimed at producing reference-quality genomes.
- Tool Development and Benchmarking: Enables development, testing, and comparison of bioinformatics tools under simulated PacBio SMRT sequencing conditions.
Methodology:
NPBSS samples read lengths from a logarithmic normal distribution, assigns base quality values, employs an empirical model to compute per-base overall error probabilities, calculates deletion/substitution/insertion probabilities from those error probabilities, aligns its error-rate modeling to characteristic features of PacBio SMRT CLR data, and was evaluated against PBSIM and FASTQSim.
Topics
Details
- License:
- GPL-3.0
- Tool Type:
- command-line tool
- Operating Systems:
- Windows
- Programming Languages:
- MATLAB
- Added:
- 7/31/2018
- Last Updated:
- 11/25/2024
Operations
Publications
Wei Z, Zhang S. NPBSS: a new PacBio sequencing simulator for generating the continuous long reads with an empirical model. BMC Bioinformatics. 2018;19(1). doi:10.1186/s12859-018-2208-0. PMID:29788930. PMCID:PMC5964698.