bedshift

bedshift perturbs genomic region sets in BED files by applying randomized shifts, drops, additions, cuts, and merges to enable controlled benchmarking of region-set similarity metrics.


Key Features:

  • Random perturbations: bedshift applies randomized shifting, dropping, adding, cutting, and merging of regions in BED files.
  • Benchmark dataset generation: It generates perturbed BED files with known degrees of similarity relative to a reference to create controlled evaluation datasets.
  • Similarity-metric evaluation: It enables benchmarking of region-set similarity metrics including Jaccard score, coverage score, Euclidean distance, and cosine similarity.
  • Metric sensitivity insights: Empirical comparisons indicate the Jaccard score is particularly sensitive to added or dropped regions while the coverage score is more sensitive to shifted regions.

Scientific Applications:

  • Benchmarking similarity metrics: Use perturbed datasets as ground truth to evaluate and compare region-set similarity metrics.
  • Pipeline validation: Test and validate genomic analysis pipelines for ChIP-Seq, ATAC-Seq, and other region-based experiments by measuring performance on perturbed data.
  • Algorithm development: Generate controlled evaluation datasets to develop and refine algorithms for comparing genomic region sets.

Methodology:

bedshift generates randomized BED files by applying specified perturbations (shift, drop, add, cut, merge) to a reference BED and systematically assesses the impact of each perturbation on region-set similarity metrics.

Topics

Details

License:
BSD-Source-Code
Tool Type:
command-line tool, library
Programming Languages:
Python
Added:
1/18/2021
Last Updated:
1/31/2021

Operations

Publications

Gu A, Cho HJ, Sheffield NC. Bedshift: perturbation of genomic interval sets. Unknown Journal. 2020. doi:10.1101/2020.11.11.378554.

Links