“每组有3个样本,每个样本再测两次,那是不是相当于每组6个重复?”
不是。
这是 RNA-seq 研究设计中最常见、也最容易在送样前算错的一件事:生物学重复回答‘不同个体是否稳定’,技术重复回答‘同一个样本测得是否一致’。两者都有用途,但不能互相替代。
一句话区分两种重复
生物学重复来自彼此独立的实验单位,例如不同动物、不同受试者,或在合理设计下独立建立的细胞培养批次。
技术重复来自同一个生物学样本,例如同一份 RNA 重复建库、同一个文库分到不同测序通道,或同一批 reads 分多次产生。

为什么技术重复不能补出生物学重复
差异表达分析不仅要比较两组平均值,还要估计同一组样本之间的自然波动。如果只有一个动物或一个患者,把其 RNA 拆成多份重复测序,只能更清楚地看到这个样本,仍然不知道其他个体会不会有相同变化。
可以把它理解成拍照:
- 给同一个人连续拍10张照片,能了解相机和拍摄过程是否稳定;
- 给10个独立个体各拍一张,才能开始了解这一群体有多大差异。
RNA-seq 通常具有较好的技术重复性,但生物学差异仍然需要通过独立样本来估计。技术重复在评估建库、平台或批次稳定性时有价值,却不能把一个独立样本变成多个独立证据。
常见场景到底算几个生物学重复
| 场景 | 通常如何理解 | 容易踩的坑 |
|---|---|---|
| 3只独立动物,每只取同一种组织 | 通常是3个生物学重复 | 若处理、笼位或取材批次完全混杂,仍需重新评估设计 |
| 1只动物的组织分成3管 | 仍是1个生物学样本 | 把分装数量当成独立样本数 |
| 3位独立受试者 | 通常是3个生物学重复 | 忽略年龄、用药、分期等重要协变量 |
| 同一份 RNA 建两次库 | 技术重复 | 在差异分析中把两份文库当成两个独立个体 |
| 同一个文库分两个 lane 测序 | 技术层面的多次测量 | 把两份 FASTQ 直接当成两个样本做统计 |
| 多个个体先混在一起,再建一个库 | 通常只形成1个混合样本 | 混样后失去个体差异信息,却仍按混入个体数计算重复 |
| 同一受试者治疗前后各取一次样 | 一对配对样本 | 按两组完全独立样本处理,丢失配对关系 |
细胞实验也要看“是否真正独立”
细胞实验里的“3个重复”最容易含糊。
同一个培养皿里的细胞分到3个孔,可能更接近同一批材料的技术分装;在不同时间独立复苏、培养、处理和取样的批次,才更有机会反映真实的批次与生物学波动。
但也不能机械地规定“隔一天做就一定独立”。细胞来源、传代、处理和实验目标都会影响实验单位的定义。最稳妥的做法,是在送样表里写清楚:
- 每个样本最初来自哪个个体或哪一批细胞;
- 哪些步骤是独立完成的;
- 哪些只是分装、重复建库或重复上机;
- 样本之间是否存在配对、同窝、同批次等关系。
分析时为什么必须保留这些关系
如果把技术重复错误地当成生物学重复,统计模型会高估样本量,让结果看起来比实际更稳定。反过来,如果本来是配对样本,却按独立样本分析,也可能损失有效信息。
因此,测序文件交付时不仅要有样本名,还应保留样本来源、个体编号、处理组、批次、配对关系和技术重复关系。标准分析可以完成质控、比对、定量和基础差异比较;复杂配对、多因素或批次结构,则更适合提前设计定制分析方案。
送样前,先把“独立样本数”算清楚
如果你不确定手里的样本究竟算几个生物学重复,可以先用 RNA样本数助手查看两组独立样本的初步参考;如果属于配对、多组、多时间点或混样设计,再按页面提示提交研究信息。
请准备样本来源、每个样本对应的独立个体或培养批次、比较方式和研究目标。我们会先确认统计单位,再讨论样本量、测序和后续分析路径。
