先看结论:不能仅凭多个 SRR 编号就增加生物学样本量。Run 表示测序数据运行单位,是否独立重复要回到供体、取材、建库和实验设计。同一文库的分 lane 或补测通常属于技术层面的重复;同一供体的不同时点或组织也有相关性,需要按设计处理。
适用情况
下载 GEO/SRA 数据时发现一个 GSM 或样本关联多个 SRR,或者准备把多次测序结果合并。
建议按这个顺序检查
- 建立供体—生物样本—GSM/BioSample—Experiment—Run—文库的对应表,保留原始记录来源。
- 确认多个 run 是同文库补测、重新建库、不同组织还是不同时点;编号不同本身不能回答独立性。
- 仅在文库、测序策略、配对读段和处理条件兼容时考虑合并技术测序数据,保存每个 run 的质控结果。
- 已经统一计数的技术重复可按适用流程聚合;不要对 TPM 或 log 表达值机械求和。
- 统计模型以真正独立的生物单位为依据;同供体重复测量应采用合适配对、阻断或相关结构。
一个最容易高估样本量的示意例子
以上均为虚构编号。这个例子有 4 个 run、3 个组织样本和 2 个供体;三种数量应分别报告。是否能用于某个组间检验,还需检查分组与独立重复是否足够。
| 供体/生物样本 | 文库 | 测序运行 | 对重复数的含义 |
|---|---|---|---|
| D01 / 肿瘤组织 T01 | L01 | RUN_DEMO_1 + RUN_DEMO_2 | 两次测序仍是同一生物样本 |
| D02 / 肿瘤组织 T02 | L02 | RUN_DEMO_3 | 增加一个独立供体 |
| D01 / 邻近组织 N01 | L03 | RUN_DEMO_4 | 新增配对组织,不是第三个独立供体 |
依据:NCBI SRA:Study、Sample、Experiment 与 Run 元数据结构
不同阶段的合并边界
原始 reads 合并前先核对单双端、read1/read2 对应、文库策略和质量;应保证所有读段的来源仍可追溯。不要把不同组织、时间点或不同测量目标仅因来自同一个人而合并。
计数层面若已确认是同一生物样本的兼容技术重复,可使用适用工具的聚合方法。DESeq2 文档提供技术重复合并说明,但该功能不会替你判断哪些列在生物学上应该合并。
遇到关系不清时怎样继续
先对照论文补充表、GSM 特征和 SRA 文库信息,给每条记录标注“已确认”或“待确认”。若仍不清楚,就暂停涉及重复数的统计推断,寻找作者说明或可替代队列。不能让 AI 按编号相似程度自动推断供体身份。
不能从当前结果直接得出什么
GSM、BioSample 或 SRR 编号都不能自动等同于独立生物学重复。技术测序更深可以提高测量信息,但不能替代更多独立供体。
依据与版本
- NCBI SRA:Study、Sample、Experiment 与 Run 元数据结构SRA 官方说明;2026-10-10 核对
- DESeq2 官方教程:输入、设计矩阵与技术重复release 在线教程;示例应匹配本地版本
最后核验:2026-10-10|资料核验:AI 编写与公开来源核对;未经人工专家审阅
依据公开来源核对概念、输入、证据边界与版本口径;示意数据不代表真实研究结果。仅标明的小型代码示例经过运行检查,不代表完整生物信息流程或原论文已复现。