PCA 图被审稿人圈出来:“The observed separation may be driven by batch effects.” 这时最容易发生的返工,是直接换一种去批次方法,直到两团点混在一起。图可能更好看了,问题却未必解决。
先把样本清单找齐:样本编号、实验分组、采样时间、建库批次、测序批次,以及同一人的配对关系。用分组和批次做一个交叉表。如果所有病例都在第一批,所有对照都在第二批,软件没有足够的信息分开“疾病效应”和“批次效应”。
这三种情况,处理方式不同
| 样本设计 | 优先处理 | 不要这样做 |
|---|---|---|
| 每个批次都有病例与对照 | 核对质量后,在合适的统计设计中纳入批次 | 只在方法里补写“去批次” |
| 各批次有部分重叠,但分布不均 | 检查设计矩阵与估计稳定性,说明不平衡 | 默认加上 batch 就万事大吉 |
| 批次与实验分组完全重合 | 寻求可比补充样本,或收缩可回答的问题 | 删除分组信息来让模型成功运行 |
| 单细胞整合后做差异检验 | 核对用于检验的数据层及样本层级设计 | 把 UMAP 混合视为差异分析已无偏 |
DESeq2 文档解释了设计矩阵不满秩的问题。对适用的 bulk RNA-seq 计数模型,批次可以作为设计中的一个因素;但前提是设计允许估计相应效应。不能把“模型报错”理解成只需随意删除一个变量。
哪些东西必须重跑,哪些不用
先画依赖关系:差异分析 → 富集 → 候选基因筛选 → 正文结论。如果统计模型变了,这条链上的输出都要核对。并不意味着从 FASTQ 开始全部重做;比对和计数没有问题时,可从受影响的统计步骤重算。相反,只改 PCA 图而保留旧的差异结果,也不算完成修订。
作图数据和检验数据要分开说明。用于可视化的转换或整合结果,不应不加判断地喂给原本针对原始计数设计的检验。单细胞项目还要写清整合方法、使用的数据层,以及差异分析是否保留了生物学重复的信息。Seurat 的整合教程可用于核对实现细节,不能据此保证所有下游检验都有效。
回复信里应当出现哪些证据
- 一张分组 × 批次样本分布表,让人看清设计。
- 校正或调整前后的诊断图,使用可比较的标注与尺度。
- 实际统计设计与对比方向,以及核心结果是否改变。
- 更新后的图表编号;若结论变化,明确写变化,不回避。
We examined the distribution of samples across [batch variable] and [study group] (Table [X]). We then [actually completed adjustment or sensitivity analysis], using [model/design]. The revised results are shown in [location]. Compared with the original analysis, [describe the actual changes]. We have updated [affected figures and conclusions] accordingly.
这是可修改的写作框架,不是对你的研究结果的陈述;未完成的工作不得写成已完成。
如果完全混杂,就把模板里的分析步骤换成事实:哪些效应无法区分、还需要什么数据、文章因此删减了什么判断。不要写“批次效应已完全消除”——这句话比展示一张混合良好的图需要强得多的证据。
参考与更新
本文的处理步骤为编辑整理的实践建议,需结合研究设计判断;示例不是客户案例,表格不包含虚构实测数据。
云生信 · 审稿与返修系列 · 内容核对日期 2026-10-06。我们会根据方法文档和使用反馈持续修订;欢迎通过官网反馈不准确或不清楚的地方。
