一张表选型
| 维度 | 16S/ITS 扩增子 | 宏基因组(shotgun) |
|---|---|---|
| 科学问题 | 属/种水平组成差异 | 株水平 + 功能通路 + ARG |
| 单样本数据量 | 1-5 GB | 10-15 GB(10-12 Gb) |
| 单价(高通量) | 低 | 约 16S 的 3-5 倍 |
| 分析工具 | QIIME 2 / DADA2 | metaSPAdes/MEGAHIT + MetaPhlAn/HUMAnN |
| 组装内存 | 不需要 | co-assembly 需 256GB-1TB |
| 存储(50 样本) | ~200 GB | 2-4 TB(含中间文件) |
16S 分析配置
- DADA2ASV 生成 + 多样性:16-32GB 内存即流畅
- QIIME 2 官方 Docker 镜像部署方便,团队服务器一人一套环境
- 上百样本批处理:64GB + 16 核,多样化 rarefaction 计算并行加速明显
宏基因组分析配置
- 基于比对分型(MetaPhlAn/Kraken2):不组装,64GB 内存可跑 50 样本队列
- 组装 + binning(MEGAHIT/metaWRAP):co-assembly 是内存大户,几十样本混合组装需 512GB-1TB 内存
- ARG/通路注释:CARD/KEGG 数据库本 cached 一次,之后 CPU 密集
选型口诀:普查用 16S、机制用宏基因组、混装要大内存、分型不必装。配置拿不准时用宏基因组算力计算器按样本数算一遍。
常见问题
经费有限先做 16S 还是直接宏基因组?
只想知道“有哪些菌、组间差异大不大”用 16S;需要功能基因、菌株水平分辨、或做二元预测模型,直接宏基因组更省总预算(避免二次测序)。
16S 分析需要服务器吗?
样本 ≤50、只做-diversity 和 LEfSe,32GB 工作站够用;上百样本或加机器学习建模建议 64GB+ 服务器。