项目背景

某高校研究生,研究方向为肿瘤预后模型。在无测序经费的情况下,利用 GEO 和 TCGA 公共数据库完成了一项 三阴性乳腺癌预后预测模型研究,发表于 Briefings in Bioinformatics(IF 9.5)。

数据来源

数据库数据集样本数用途
GEOGSE103091250训练集
GEOGSE21653266验证集 1
TCGABRCA(TN亚型)180验证集 2
TCGA临床信息180生存分析

分析流程

  1. 数据下载与整理:GEOquery + TCGAbiolinks 下载表达矩阵和临床信息
  2. 批次校正:ComBat 校正 GEO 和 TCGA 的批次效应
  3. 差异分析:limma 筛选差异基因
  4. WGCNA:鉴定与预后相关的基因模块
  5. LASSO 回归:构建预后 signature
  6. 生存分析:Kaplan-Meier + Cox 回归验证
  7. 列线图:rms 包构建临床预测模型

服务器配置需求

该分析主要使用 R 语言,内存需求集中在 WGCNA 和批次校正:

关键经验

零测序费 ≠ 零成本。虽然数据免费,但分析需要一台内存充足的服务器。32GB 内存的个人电脑跑 WGCNA(500+ 样本)会崩溃,64GB 服务器是最低门槛。同时,预装 R/Python 环境和常用包(Seurat/DESeq2/WGCNA/clusterProfiler)可以节省大量环境配置时间。