bedshift
bedshift perturbs genomic region sets in BED files by applying randomized shifts, drops, additions, cuts, and merges to enable controlled benchmarking of region-set similarity metrics.
Key Features:
- Random perturbations: bedshift applies randomized shifting, dropping, adding, cutting, and merging of regions in BED files.
- Benchmark dataset generation: It generates perturbed BED files with known degrees of similarity relative to a reference to create controlled evaluation datasets.
- Similarity-metric evaluation: It enables benchmarking of region-set similarity metrics including Jaccard score, coverage score, Euclidean distance, and cosine similarity.
- Metric sensitivity insights: Empirical comparisons indicate the Jaccard score is particularly sensitive to added or dropped regions while the coverage score is more sensitive to shifted regions.
Scientific Applications:
- Benchmarking similarity metrics: Use perturbed datasets as ground truth to evaluate and compare region-set similarity metrics.
- Pipeline validation: Test and validate genomic analysis pipelines for ChIP-Seq, ATAC-Seq, and other region-based experiments by measuring performance on perturbed data.
- Algorithm development: Generate controlled evaluation datasets to develop and refine algorithms for comparing genomic region sets.
Methodology:
bedshift generates randomized BED files by applying specified perturbations (shift, drop, add, cut, merge) to a reference BED and systematically assesses the impact of each perturbation on region-set similarity metrics.
Topics
Details
- License:
- BSD-Source-Code
- Tool Type:
- command-line tool, library
- Programming Languages:
- Python
- Added:
- 1/18/2021
- Last Updated:
- 1/31/2021
Operations
Publications
Gu A, Cho HJ, Sheffield NC. Bedshift: perturbation of genomic interval sets. Unknown Journal. 2020. doi:10.1101/2020.11.11.378554.
Links
Repository
https://pypi.org/project/bedshift/