宏基因组测序 · 算力配置工具

组装跑不动?
NR 库装不下?

50 个肠道样本 MEGAHIT 共组装,峰值内存 300—500GB,常规工作站 64GB 内存无法完成。回答五个问题,获取匹配实际数据量的算力配置方案。

0+
合作单位
512GB+
单机内存
3000MB/s
NVMe 读取
数据量 → 算力需求
100GB 内
16核 64G
300GB—1TB
48核 192G
1—3TB
96核 512G
3TB 以上
128核 1T
共组装峰值内存推荐 512GB+
第 1 题 / 共 5 题

原始数据有多少?

全部样本加起来,选最近的

100GB 以内
10—20 个样本,前期探索
100—300GB
30—60 个样本
300GB—1TB常见
50—100 个样本
1—3TB
百级样本共组装
3TB 以上
地球微生物组计划规模
第 2 题 / 共 5 题

分析需求与团队

两个小问题

要做组装吗?
不做组装
仅 Read-based 注释(Kraken2 / HUMAnN),算力需求较低
要做组装多数课题
MEGAHIT / metaSPAdes 组装 + 分箱 + MAGs,内存需求显著增加
几个人用?
1 人
2—3 人
4—10 人
10 人以上
第 3 题 / 共 5 题

使用方式与周期

两个小问题

几个人同时跑任务?
1 人
2—3 人
4 人以上
不确定
用多久?
1 个月
短期突击
3 个月
一个课题
6 个月最多
1 年以上
长期平台
第 4 题 / 共 5 题

偏好与存储

两个小问题

更看重什么?
价格优先
预算有限,够用就行
均衡推荐
性价比最优
速度优先
文章催得急
数据存多久?
临时
跑完就删
半年
1 年常见
长期
持续积累
第 5 题 / 共 5 题

现状与时间

最后两个问题

现在什么情况?
没有服务器
工作站或笔记本运行
有,但配置不足
内存 64GB 以下,共组装无法完成
有,但运维负担重
环境配置、数据库维护、权限管理耗时
什么时候开始用?
1 个月内
1—3 个月
3 个月以后
不确定
分析流程

从 FASTQ 到 MAGs

七步完成宏基因组全流程,各步骤算力需求差异显著

01

质控与去宿主

去除低质量 reads 和宿主污染,I/O 密集型

fastpBowtie2KneadData
低需求
02

序列组装

全流程最吃内存的步骤,50 样本共组装峰值 300—500GB

MEGAHITmetaSPAdes
内存瓶颈⚠ 300-500GB
03

基因预测与非冗余基因集

构建 NR 基因集,内存随样本数线性增长

ProdigalCD-HIT
中需求
04

物种注释

Kraken2 数据库 60GB,DIAMOND 比 NR 耗时最长

Kraken2KaijuDIAMOND
中需求
05

功能注释

四套数据库合计 200GB+,多库并行比对

eggNOG-mapperKEGGCAZyCARD
中需求
06

分箱与 MAGs

恢复单菌基因组,计算密集型

MetaBAT2MaxBin2DAS ToolCheckM
中需求
07

统计与可视化

差异分析、LEfSe、PCoA,中量计算

STAMPLEfSeQIIME2
低需求
产品优势

为什么选我们

针对宏基因组分析的实际算力痛点

数据库预装

NR 300GB、eggNOG 60GB、KEGG 20GB、CAZy 5GB、CARD 3GB,合计约 400GB。全部预装配置完毕,无需自行下载和构建索引。

DIAMOND 比对加速

DIAMOND 比对 NR 库,8 核需 24 小时/百万条基因。96 核并行降至 3 小时,大幅缩短注释周期。

多人协作调度

SLURM 作业调度系统支持多人并发提交,独立账号、独立环境、独立目录,权限隔离互不影响。

NVMe 全闪存架构

读取速度 3000MB/s,大文件比对不受 I/O 限制。支持 2TB 至 64TB 在线扩容,不影响运行中的任务。

200 个环境样本共组装,之前在学校集群排队两周。使用独享服务器后,512GB 内存一次载入,三天完成全部 contigs 组装。

— 四川大学华西医院 · 微生物组研究团队

方案对比

工作站 / 公有云 / 云生信

三种方案的实际差异对比

对比项工作站 / 笔记本公有云按小时云生信
共组装内存上限64—128GB,易 OOM可临时升级,费用较高512GB—1TB,稳定完成
数据库预装需自行配置 2—3 天需自行配置NR + eggNOG + KEGG 全部就绪
DIAMOND 比 NR(百万条)24 小时以上取决于实例规格3 小时(96 核并行)
多人并发资源争抢按实例计费SLURM 调度,互不干扰
费用模式一次性投入,配置固定按月约 5000+ 元独享物理机,长期稳定
运维自行负责自行负责专人运维,全程技术支持
0+
合作科研单位
512GB
单机最大内存
3000MB/s
NVMe 读取速度
60%+
比公有云省钱

工作站配置不够用?

两分钟完成测算,获取匹配您课题数据量的算力配置方案与报价

开始测算
常见问题

你可能想

宏基因组比转录组需要多少算力?

组装步骤(MEGAHIT / metaSPAdes)的内存需求是转录组分析的 5—10 倍。50 个样本共组装峰值内存可达 300—500GB。功能注释阶段 DIAMOND 比对 NR 库的计算量也显著高于转录组定量分析。

共组装和单样本组装有什么区别?

共组装将所有样本 Clean Reads 合并后统一组装,能恢复低丰度物种基因组,但内存需求随样本数线性增长。单样本组装内存固定,但会丢失低丰度信号。多数研究采用共组装方案。

数据库要自己装吗?

无需自行安装。平台预装 Kraken2、DIAMOND NR、eggNOG、KEGG、CAZy、CARD、dbCAN 等全部常用数据库,合计约 400GB,索引已构建完毕。数据库定期更新。

支持哪些分析软件?可以自定义流程吗?

支持 MEGAHIT、metaSPAdes、Kraken2、DIAMOND、eggNOG-mapper、MetaBAT2、MaxBin2、CheckM、STAMP、QIIME2 等主流宏基因组分析工具。支持 Snakemake / Nextflow 构建自定义流程,可通过 conda 创建独立环境。

费用大概是多少?怎么付款?

费用根据配置不同,月付几百至几千元不等,年付性价比更高。支持对公转账、开具发票。完成测算后技术顾问将提供详细报价单,含配置方案、价格及付款方式。

服务器出问题怎么办?有技术支持吗?

专人运维,7×24 小时监控。硬件故障和网络问题由我们负责解决。软件环境和数据库问题可联系技术顾问协助。分析流程层面的问题,生信工程师可提供远程支持。

文章里怎么致谢或标注?

如使用本平台算力资源,建议在文章致谢部分注明。我们可提供致谢模板和技术支持说明文档。

和公有云比有什么优势?

年付付费不限使用时长,较公有云按小时计费降低 60% 以上。预装生信环境和数据库,独享物理机不受其他用户影响,专人运维保障稳定性。