Summix
Summix estimates ancestry proportions from genetic summary statistics and adjusts allele frequencies to correct for population structure and reduce confounding in genetic analyses.
Key Features:
- Ancestry Deconvolution: Estimates ancestry proportions in summary statistics using continental reference ancestries African (AFR), Non-Finnish European (EUR), East Asian (EAS), Indigenous American (IAM), and South Asian (SAS), with reported precision within 0.1% in simulations.
- Ancestry-Adjusted Allele Frequencies: Adjusts allele frequencies for population structure and aligns adjusted frequencies to reference samples, with demonstrated application to gnomAD v2.1 exome and genome groups.
- Efficiency and Speed: Processes dense panels of summary statistics in seconds and supports estimation of confidence intervals via block bootstrap methods.
- Improved Representation: Produces ancestry-adjusted summary data to improve representation and comparability for understudied or admixed populations.
- Implementation: Implemented as an R package supporting analyses such as prioritizing putative causal variants, computing polygenic scores, and leveraging common controls.
Scientific Applications:
- Reducing Confounding: Reduces confounding by population structure to improve identification of true genetic associations.
- Variant Prioritization: Prioritizes putative causal variants by providing population-structure-adjusted allele frequencies.
- Polygenic Scoring: Improves construction and transferability of polygenic risk scores by adjusting allele frequencies for ancestry.
- Common Controls: Enables use of public datasets as common controls by adjusting allele frequencies to match target ancestry compositions.
- Admixed and Understudied Populations: Supports analyses in admixed and understudied populations by estimating ancestry proportions from summary-level data.
Methodology:
Estimates ancestry proportions in summary statistics using continental reference ancestries (AFR, EUR, EAS, IAM, SAS), adjusts allele frequencies to reference compositions, and computes confidence intervals via block bootstrap; methods demonstrated on gnomAD v2.1 exome and genome groups.
Topics
Details
- License:
- MIT
- Tool Type:
- command-line tool, library
- Programming Languages:
- R, Python, SAS
- Added:
- 3/19/2021
- Last Updated:
- 4/10/2021
Operations
Publications
Arriaga-MacKenzie I, Matesi G, Chen S, Ronco A, Marker K, Hall J, Scherenberg R, Khajeh-Sharafabadi M, Wu Y, Gignoux C, Null M, Hendricks A. <i>Summix:</i>A method for detecting and adjusting for population structure in genetic summary data. Unknown Journal. 2021. doi:10.1101/2021.02.03.429446.