RNASeq_similarity_matrix

RNASeq_similarity_matrix generates a sequence similarity matrix from genomic single nucleotide polymorphisms (SNPs) called from RNA-Seq reads to detect sample mix-ups, duplicated samples, and contamination.


Key Features:

  • Automated Similarity Matrix Generation: Constructs a sequence similarity matrix from RNA-Seq data representing genetic similarities between samples.
  • SNP calling from RNA-Seq reads: Calls genomic single nucleotide polymorphisms (SNPs) directly from RNA-Seq reads for genetic comparison.
  • Detection independent of phenotype data: Operates without relying on phenotype metadata such as sex-specific gene checks.
  • Applicability across study designs: Applicable to studies with multiple samples per individual or a single sample per individual and detects duplicated samples and contamination.
  • Quality-control extension: Extends DNA-based quality-control methods to check for unexpected relatedness between samples in RNA-Seq studies.
  • Visual inspection support: Produces a matrix that visually represents genetic relationships to facilitate identification of anomalies.

Scientific Applications:

  • Sample mix-up detection: Identifies mismatches between biological samples and phenotype or metadata by comparing genetic similarity.
  • Contamination identification: Detects sample contamination through unexpected similarity patterns even when phenotype data are uninformative.
  • Quality assurance in large-scale studies: Verifies sample integrity and unexpected relatedness in large genomic or transcriptomic cohorts.

Methodology:

Calls genomic SNPs from RNA-Seq reads and computes a sequence similarity matrix from those SNPs to assess genetic relatedness and flag mix-ups or contamination.

Topics

Details

License:
GPL-3.0
Programming Languages:
R, Python
Added:
1/14/2020
Last Updated:
12/14/2020

Operations

Publications

Kist NC, Power RA, Skelton A, Seegobin SD, Verbelen M, Bonde B, Malki K. RNASeq_similarity_matrix: visually identify sample mix-ups in RNASeq data using a ‘genomic’ sequence similarity matrix. Bioinformatics. 2019;36(6):1940-1941. doi:10.1093/bioinformatics/btz821. PMID:31769800.