数据与输入 · 16

一个样本对应多个 run,能不能直接当成多个样本?

回答会区分适用条件、检查步骤和不能直接得出的结论。

先看结论:不能仅凭多个 SRR 编号就增加生物学样本量。Run 表示测序数据运行单位,是否独立重复要回到供体、取材、建库和实验设计。同一文库的分 lane 或补测通常属于技术层面的重复;同一供体的不同时点或组织也有相关性,需要按设计处理。

适用情况

下载 GEO/SRA 数据时发现一个 GSM 或样本关联多个 SRR,或者准备把多次测序结果合并。

建议按这个顺序检查

  1. 建立供体—生物样本—GSM/BioSample—Experiment—Run—文库的对应表,保留原始记录来源。
  2. 确认多个 run 是同文库补测、重新建库、不同组织还是不同时点;编号不同本身不能回答独立性。
  3. 仅在文库、测序策略、配对读段和处理条件兼容时考虑合并技术测序数据,保存每个 run 的质控结果。
  4. 已经统一计数的技术重复可按适用流程聚合;不要对 TPM 或 log 表达值机械求和。
  5. 统计模型以真正独立的生物单位为依据;同供体重复测量应采用合适配对、阻断或相关结构。

一个最容易高估样本量的示意例子

以上均为虚构编号。这个例子有 4 个 run、3 个组织样本和 2 个供体;三种数量应分别报告。是否能用于某个组间检验,还需检查分组与独立重复是否足够。

供体/生物样本 文库 测序运行 对重复数的含义
D01 / 肿瘤组织 T01 L01 RUN_DEMO_1 + RUN_DEMO_2 两次测序仍是同一生物样本
D02 / 肿瘤组织 T02 L02 RUN_DEMO_3 增加一个独立供体
D01 / 邻近组织 N01 L03 RUN_DEMO_4 新增配对组织,不是第三个独立供体

依据:NCBI SRA:Study、Sample、Experiment 与 Run 元数据结构

不同阶段的合并边界

原始 reads 合并前先核对单双端、read1/read2 对应、文库策略和质量;应保证所有读段的来源仍可追溯。不要把不同组织、时间点或不同测量目标仅因来自同一个人而合并。

计数层面若已确认是同一生物样本的兼容技术重复,可使用适用工具的聚合方法。DESeq2 文档提供技术重复合并说明,但该功能不会替你判断哪些列在生物学上应该合并。

依据:DESeq2 官方教程:输入、设计矩阵与技术重复

遇到关系不清时怎样继续

先对照论文补充表、GSM 特征和 SRA 文库信息,给每条记录标注“已确认”或“待确认”。若仍不清楚,就暂停涉及重复数的统计推断,寻找作者说明或可替代队列。不能让 AI 按编号相似程度自动推断供体身份。

不能从当前结果直接得出什么

GSM、BioSample 或 SRR 编号都不能自动等同于独立生物学重复。技术测序更深可以提高测量信息,但不能替代更多独立供体。

依据与版本

最后核验:2026-10-10|资料核验:AI 编写与公开来源核对;未经人工专家审阅

依据公开来源核对概念、输入、证据边界与版本口径;示意数据不代表真实研究结果。仅标明的小型代码示例经过运行检查,不代表完整生物信息流程或原论文已复现。

继续解决相关问题