CAP3 Sequence Assembly Program

CAP3 Sequence Assembly Program assembles sequence reads into contigs and generates consensus sequences using base-quality integration and forward-reverse constraints to improve assembly accuracy.


Key Features:

  • End clipping: Clips low-quality regions at both the 5' and 3' ends of reads.
  • Quality-aware overlap and alignment: Incorporates base quality values into computation of overlaps and construction of multiple sequence alignments.
  • Consensus generation: Integrates base quality values into generation of consensus sequences.
  • Forward-reverse constraints: Uses forward-reverse (paired-end) constraints to correct assembly errors and link contigs.
  • Scaffold construction: Supports scaffold construction, particularly for low-pass data sets using forward-reverse constraints.
  • Benchmarking: Tested on four bacterial artificial chromosome (BAC) data sets and compared with PHRAP, often producing fewer consensus errors while sometimes yielding shorter contigs.

Scientific Applications:

  • Contig assembly: Assembly of sequence reads into contigs for downstream genomic analyses.
  • High-quality consensus generation: Producing accurate consensus sequences by leveraging base quality values.
  • Paired-end scaffolding and error correction: Linking contigs and correcting assemblies using forward-reverse paired-read constraints.
  • BAC data analysis: Assembly and evaluation of bacterial artificial chromosome (BAC) data sets.
  • Low-pass sequencing projects: Scaffold construction and contig linking for low-coverage data sets.

Methodology:

Clips low-quality 5' and 3' read regions; integrates base quality values into overlap computation, multiple sequence alignment construction, and consensus calling; applies forward-reverse paired-read constraints to correct errors and link contigs.

Topics

Details

Tool Type:
web application
Operating Systems:
Linux, Windows, Mac
Added:
4/21/2017
Last Updated:
11/24/2024

Operations

Publications

Huang X, Madan A. CAP3: A DNA Sequence Assembly Program. Genome Research. 1999;9(9):868-877. doi:10.1101/gr.9.9.868. PMID:10508846. PMCID:PMC310812.

Documentation