ENANO

ENANO compresses nanopore sequencing FASTQ files using a lossless algorithm optimized for quality-score compression to reduce file size while preserving all original sequence and quality information.


Key Features:

  • Lossless compression: Performs lossless compression of FASTQ files preserving sequences and quality scores.
  • Quality-score optimization: Specifically optimizes the compression of quality scores, which are a dominant component of nanopore FASTQ size.
  • Targeted data type: Tailored for nanopore sequencing FASTQ files and long-read datasets.
  • Operational modes: Provides two modes—Maximum Compression and Fast (default)—to trade off compression ratio and processing speed.
  • Performance benchmarks: Achieved average compression gains of >24.7% over pigz and 6.3% over SPRING across tested nanopore datasets.
  • Encoding and decoding speed: Encoding is 2.9 times faster and decoding is 1.7 times faster compared to SPRING in reported comparisons.
  • Memory footprint: Demonstrates a low memory footprint of up to 0.2 GB during operation.

Scientific Applications:

  • Data storage and archiving: Reduces storage requirements for large nanopore sequencing FASTQ datasets.
  • Data transmission: Lowers bandwidth needs for transmitting nanopore sequencing data.
  • Large-scale genomic data management: Facilitates processing and management of high-volume long-read sequencing projects.
  • Comparative benchmarking: Serves as a reference compressor in performance comparisons with pigz and SPRING for nanopore data.

Methodology:

Implements a lossless FASTQ compression algorithm that optimizes quality-score representation, provides two modes (Maximum Compression and Fast), and performs encoding and decoding with reported speed and memory metrics.

Topics

Details

License:
MIT
Programming Languages:
C++, Shell
Added:
1/18/2021
Last Updated:
3/7/2021

Operations

Publications

Dufort y Álvarez G, Seroussi G, Smircich P, Sotelo J, Ochoa I, Martín Á. ENANO: Encoder for NANOpore FASTQ files. Bioinformatics. 2020;36(16):4506-4507. doi:10.1093/bioinformatics/btaa551. PMID:32470109.

PMID: 32470109
Funding: - PEDECIBA: 2018-182799