MR 分析的算力特点
孟德尔随机化(Mendelian Randomization, MR)是基于 GWAS 汇总数据的统计方法,不需要处理原始测序数据,因此整体算力需求低于组学分析。实际项目中最耗资源的不是 MR 估计本身,而是数据准备环节。
| 研究场景 | 数据规模 | 推荐内存 | 推荐 CPU | 存储 |
|---|---|---|---|---|
| 单次 MR(两样本) | 汇总统计 < 1GB | 16 GB | 4 核 | 100 GB |
| 多暴露/多结局筛查 | 10-50 个性状 | 32-64 GB | 8 核 | 500 GB |
| LD clumping + FinnGen 重分析 | 数十 GB 汇总数据 | 64 GB | 16 核 | 1-2 TB |
| UK Biobank 个体数据 MR | 50 万人基因型 | 128-256 GB | 32 核 | 4 TB+ |
各环节资源消耗拆解
- 工具变量提取:从 IEU OpenGWAS 下载暴露 GWAS,内存占用小,主要是网络 I/O
- LD clumping:plink 以 1000G 参考面板做连锁不平衡修剪,人类全基因组级别需要 16-32GB 内存
- MR 估计 + 敏感性分析:TwoSampleMR/MR-PRESSO 在 R 中运行,通常几分钟到几小时,8-16GB 足够
- 多性状批量 MR:几百个暴露 × 几百个结局的组合矩阵,建议 16 核以上并行
典型踩坑:内存不足的报错
多性状筛查时 R 常报 cannot allocate vector of size 8 GB,原因是把所有性状的汇总数据同时读入内存。解决:逐性状处理后释放(rm(); gc()),或改用 data.table 的 fread 分块读取。
配置建议
只做汇总数据 MR 的团队,16-32GB 内存的工作站即可;需要本地跑 plink 全基因组 clumping、缓存多个 GWAS 数据库的,推荐 64GB 内存 + 2TB NVMe 存储 + 16 核 CPU 的配置,可以把数据准备环节从天级压缩到小时级。
常见问题
孟德尔随机化用自己电脑能跑吗?
样本量在 100 万以内的标准 TwoSampleMR 流程(暴露+结局均为汇总数据)用 32GB 内存的个人电脑可以完成。只有涉及个体级别数据(如 UK Biobank 全量)或大规模多性状筛查时才需要服务器。
孟德尔随机化分析主要卡在哪个环节?
最卡的是 GWAS 汇总数据的下载、格式转换与 LD 计算环节。plink 计算 LD clumping 时对内存和 CPU 要求明显高于 R 里的 MR 估计步骤。