项目背景

某医院感染科,对 100 例 COVID-19 患者(轻症 50 例 + 重症 50 例)外周血进行 RNA-seq,筛选疾病严重程度的转录组生物标志物。

分析流程

步骤工具内存峰值100样本耗时
质量控制fastp4 GB1 小时
比对HISAT2(-p 48)16 GB~8 小时
定量featureCounts8 GB30 分钟
差异表达DESeq216 GB5 分钟
GSEA 富集clusterProfiler8 GB10 分钟
WGCNA 共表达WGCNA(R)64 GB2 小时

WGCNA 的内存陷阱

WGCNA 的 blockwiseModules 步骤需要计算所有基因的两两相关性矩阵。5000 个基因的矩阵需要约 100MB,但计算过程中会产生大量中间矩阵。100 个样本 × 5000 基因的 WGCNA 峰值内存约 64GB

如果内存不足,WGCNA 会自动降低 maxBlockSize 或报错。团队在 32GB 服务器上只能设置 maxBlockSize=2000(远低于推荐的 5000+),导致模块划分不够精细。

配置建议

100 样本 RNA-seq + WGCNA 分析,推荐 48 核 / 128GB 内存 / 3TB 存储。如果后续需要扩展到 500+ 样本或多组学整合,建议 256GB。

产出

鉴定出 3 个重症相关的基因模块(与炎症反应、补体通路相关),筛选出 15 个候选生物标志物,文章发表在 Frontiers in Immunology