项目背景
某医院感染科,对 100 例 COVID-19 患者(轻症 50 例 + 重症 50 例)外周血进行 RNA-seq,筛选疾病严重程度的转录组生物标志物。
分析流程
| 步骤 | 工具 | 内存峰值 | 100样本耗时 |
|---|---|---|---|
| 质量控制 | fastp | 4 GB | 1 小时 |
| 比对 | HISAT2(-p 48) | 16 GB | ~8 小时 |
| 定量 | featureCounts | 8 GB | 30 分钟 |
| 差异表达 | DESeq2 | 16 GB | 5 分钟 |
| GSEA 富集 | clusterProfiler | 8 GB | 10 分钟 |
| WGCNA 共表达 | WGCNA(R) | 64 GB | 2 小时 |
WGCNA 的内存陷阱
WGCNA 的 blockwiseModules 步骤需要计算所有基因的两两相关性矩阵。5000 个基因的矩阵需要约 100MB,但计算过程中会产生大量中间矩阵。100 个样本 × 5000 基因的 WGCNA 峰值内存约 64GB。
如果内存不足,WGCNA 会自动降低 maxBlockSize 或报错。团队在 32GB 服务器上只能设置 maxBlockSize=2000(远低于推荐的 5000+),导致模块划分不够精细。
配置建议
100 样本 RNA-seq + WGCNA 分析,推荐 48 核 / 128GB 内存 / 3TB 存储。如果后续需要扩展到 500+ 样本或多组学整合,建议 256GB。
产出
鉴定出 3 个重症相关的基因模块(与炎症反应、补体通路相关),筛选出 15 个候选生物标志物,文章发表在 Frontiers in Immunology。