NPBSS

NPBSS generates high-fidelity continuous long reads (CLR) that mimic raw PacBio SMRT sequencing data for use in de novo genome assembly and benchmarking.


Key Features:

  • Logarithmic Normal Distribution Sampling: Samples read lengths from a logarithmic normal distribution to reflect the natural variability of PacBio CLR read lengths.
  • Base Quality Value Assignment: Assigns base quality values with varying proportions across reads to emulate base-level quality variation.
  • Empirical Error Modeling: Employs an empirical model to compute an overall error probability for each base within a read.
  • Error Probability Calculations: Computes deletion, substitution, and insertion probabilities based on the per-base overall error probability.

Scientific Applications:

  • De Novo Genome Assembly: Provides realistic CLR datasets for testing and optimizing assembly algorithms aimed at producing reference-quality genomes.
  • Tool Development and Benchmarking: Enables development, testing, and comparison of bioinformatics tools under simulated PacBio SMRT sequencing conditions.

Methodology:

NPBSS samples read lengths from a logarithmic normal distribution, assigns base quality values, employs an empirical model to compute per-base overall error probabilities, calculates deletion/substitution/insertion probabilities from those error probabilities, aligns its error-rate modeling to characteristic features of PacBio SMRT CLR data, and was evaluated against PBSIM and FASTQSim.

Topics

Details

License:
GPL-3.0
Tool Type:
command-line tool
Operating Systems:
Windows
Programming Languages:
MATLAB
Added:
7/31/2018
Last Updated:
11/25/2024

Operations

Publications

Wei Z, Zhang S. NPBSS: a new PacBio sequencing simulator for generating the continuous long reads with an empirical model. BMC Bioinformatics. 2018;19(1). doi:10.1186/s12859-018-2208-0. PMID:29788930. PMCID:PMC5964698.

PMID: 29788930
PMCID: PMC5964698
Funding: - National Natural Science Foundation of China: 61473232, 91430111

Documentation

Links