常见 GWAS 数据源的数据量
| 数据源 | 单性状数据量 | 全库规模 | 用途 |
|---|---|---|---|
| IEU OpenGWAS | 0.3-1 GB | ~25,000 性状 | MR 暴露/结局 |
| GWAS Catalog | 0.1-2 GB | >6,000 研究 | 文献级结果 |
| FinnGen R10 | 2-3 GB/endpoint | ~2,400 endpoints | 北欧人群复制 |
| UK Biobank GWAS(Neale Lab 等) | 1-4 GB | 数千性状 | 大样本发现 |
| 1000G 参考面板(LD 用) | — | ~10 GB | clumping/LDSC |
预处理环节的资源消耗
- 格式统一:VCF→plink 格式转换 CPU 密集,16 核可显著加速
- QC 与 liftOver:坐标版本转换(hg19↔hg38)需要完整参考链文件,约 2GB 内存
- LD 矩阵计算:1000G 全基因组 LD 计算 32GB 内存起步
存储规划建议
做 MR 的团队建议按 原始数据 × 3 规划存储(原始汇总 + QC 后 + 中间文件)。常用组合:缓存 20-30 个常用性状约需 500GB-1TB;本地镜像 FinnGen + UK BiobAS 常用性状需要 2-4TB。NVMe SSD 可以把 plink 重复读取的等待时间从分钟级降到秒级。
常见问题
一个 GWAS 全基因组汇总统计文件多大?
约 500 万个 SNP × 若干列(SNP/A1/A2/BETA/SE/P/N),文本格式约 1-3GB,压缩后 300-800MB。
plink 做 LD clumping 需要多少内存?
用 1000 Genomes 参考面板(全基因组)约需 16-32GB 内存;只 clump 特定区域可降到 4GB 以内。