RNASeq_similarity_matrix
RNASeq_similarity_matrix generates a sequence similarity matrix from genomic single nucleotide polymorphisms (SNPs) called from RNA-Seq reads to detect sample mix-ups, duplicated samples, and contamination.
Key Features:
- Automated Similarity Matrix Generation: Constructs a sequence similarity matrix from RNA-Seq data representing genetic similarities between samples.
- SNP calling from RNA-Seq reads: Calls genomic single nucleotide polymorphisms (SNPs) directly from RNA-Seq reads for genetic comparison.
- Detection independent of phenotype data: Operates without relying on phenotype metadata such as sex-specific gene checks.
- Applicability across study designs: Applicable to studies with multiple samples per individual or a single sample per individual and detects duplicated samples and contamination.
- Quality-control extension: Extends DNA-based quality-control methods to check for unexpected relatedness between samples in RNA-Seq studies.
- Visual inspection support: Produces a matrix that visually represents genetic relationships to facilitate identification of anomalies.
Scientific Applications:
- Sample mix-up detection: Identifies mismatches between biological samples and phenotype or metadata by comparing genetic similarity.
- Contamination identification: Detects sample contamination through unexpected similarity patterns even when phenotype data are uninformative.
- Quality assurance in large-scale studies: Verifies sample integrity and unexpected relatedness in large genomic or transcriptomic cohorts.
Methodology:
Calls genomic SNPs from RNA-Seq reads and computes a sequence similarity matrix from those SNPs to assess genetic relatedness and flag mix-ups or contamination.
Topics
Details
- License:
- GPL-3.0
- Programming Languages:
- R, Python
- Added:
- 1/14/2020
- Last Updated:
- 12/14/2020
Operations
Publications
Kist NC, Power RA, Skelton A, Seegobin SD, Verbelen M, Bonde B, Malki K. RNASeq_similarity_matrix: visually identify sample mix-ups in RNASeq data using a ‘genomic’ sequence similarity matrix. Bioinformatics. 2019;36(6):1940-1941. doi:10.1093/bioinformatics/btz821. PMID:31769800.
PMID: 31769800