宏基因组组装的内存瓶颈
宏基因组 de novo 组装(MEGAHIT / metaSPAdes)是生物信息学中最吃内存的任务之一。内存消耗取决于总数据量和 k-mer 长度。
| 样本数 | 总数据量 | MEGAHIT 峰值内存 | metaSPAdes 峰值内存 | 推荐内存 |
|---|---|---|---|---|
| 5 样本 | ~50 GB | 64 GB | 128 GB | 128 GB |
| 20 样本 | ~200 GB | 128 GB | 256 GB | 256 GB |
| 50 样本 | ~500 GB | 256 GB | 512 GB | 512 GB |
| 100+ 样本 | ~1 TB | 512 GB | 1 TB | 1 TB |
MEGAHIT vs metaSPAdes
- MEGAHIT:内存效率更高,支持 succinct de Bruijn graph,推荐大规模共组装
- metaSPAdes (SPAdes meta mode):组装质量略高,但内存消耗是 MEGAHIT 的 2 倍
组装后的下游分析
组装完成后还需要:基因预测(Prodigal)、物种注释(DIAMOND+NR)、功能注释(eggNOG/KO),NR 库约 500 GB,需要充足的存储空间。