图里有两万个细胞,审稿人却写:“The analysis does not account for biological replicates.” 这不是在嫌细胞测得少。假设数据来自 3 位患者和 3 位对照——这里是为说明问题构造的例子——研究观察到的是 6 位受试者,不是两万位互不相关的人。
同一供体的细胞共享遗传背景、暴露、取样和实验过程。如果研究要推断患者组与对照组之间的差异,直接把所有细胞当完全独立观测,可能把个体内的相似性误当成很多次独立证据。增加细胞数,不等于增加供体数。
先分清:你在做哪一种比较
| 分析目的 | 必须说明的单位 | 优先核对 |
|---|---|---|
| 寻找 cluster 的描述性标志 | 细胞与 cluster,同时说明样本结构 | 不要把描述性 marker 结果直接升级为组间疾病推断 |
| 同一细胞类型的患者/对照差异 | 独立供体或实验单位 | 供体数、分组、批次和模型设计 |
| 同一受试者治疗前后比较 | 配对受试者 | 配对是否在设计中保留 |
| 比较细胞类型比例 | 每个样本的组成 | 不能把合并后的总细胞数作为独立重复数 |
先从对象里导出最小元数据:cell_id、sample_id、donor_id、condition、cell_type、batch。sample_id 与 donor_id 不一定相同;同一个人的多块组织、多个时间点,需要保留层级关系。若最初只留下 group 标签,把供体信息补回去通常是第一项工作。
pseudobulk 是一条路线,不是一键通关
常见做法是按“供体 × 细胞类型”等与研究问题匹配的单位汇总原始计数,再使用适合计数数据和实验设计的方法比较。不要把所有病例汇成一列、所有对照汇成一列;那样把生物学重复又抹掉了。也不要把不适合计数模型的整合值直接相加后当原始计数。
当存在配对、重复取样或更复杂的层级结构时,需要相应设计;合适的混合模型也是可评估的路线。选择应根据目标、重复数和数据结构决定,而不是因为某个方法给出的差异基因更多。关于单细胞差异表达的研究已专门讨论这类假阳性与伪重复问题。
最难处理的是“某组只有一个供体”
无论从这个供体测出多少细胞,仍不能靠算法补出真实的个体间变异。此时应谨慎限定为描述性或探索性结果,评估能否补独立样本,而不是在回复里写“细胞数量充足,所以统计稳健”。罕见细胞类型在部分样本中缺失,也要明确保留规则和由此改变的样本量。
重算后,差异基因变少并不自动代表新方法更差。把文章最重要的几个结论逐一核对:方向是否一致、估计是否稳定、是否还得到支持。哪些结论不再成立,就删减或降级,而不是同时保留旧 P 值和新方法描述。
We have clarified the biological replicate structure in [table]. For the between-group comparison within [cell type], we used [actually implemented donor-level aggregation/model], with [design and covariates]. The analysis includes [actual independent replicate counts]. We have replaced [figures/tables] and revised [claims] based on the updated results.
这是可修改的写作框架,不是对你的研究结果的陈述;未完成的工作不得写成已完成。
给审稿人的交付物可以很朴素:样本结构表、聚合规则、模型设计、替换后的结果表。把统计单位交代清楚,比再补一幅展示几万个点的图更能回应这条意见。
参考与更新
本文的处理步骤为编辑整理的实践建议,需结合研究设计判断;示例不是客户案例,表格不包含虚构实测数据。
云生信 · 审稿与返修系列 · 内容核对日期 2026-10-06。我们会根据方法文档和使用反馈持续修订;欢迎通过官网反馈不准确或不清楚的地方。
