一张气泡图能挤进几十条通路,却不一定能回答审稿人的三个问题:“背景是什么?”“校正了多少次检验?”“为什么说这条通路被激活?” 这三条意见分别对应输入、统计和解释,不能靠重画图一次解决。
先确定你用的究竟是哪种分析
把一组筛出的基因放进 GO 或通路库,询问某类基因是否出现得过多,常见的是过度代表分析(ORA)。把可用基因按某个统计量排序,再考察基因集是否偏向列表的一端,则是另一类分析思路,例如 GSEA。两者的输入和统计设置不同,不能把同一套“背景基因说明”生搬硬套。
| 项目 | ORA 优先交代 | GSEA 优先交代 |
|---|---|---|
| 输入 | 基因筛选规则、上下调是否分开 | 排序统计量、方向、并列值处理 |
| 基因空间 | 有机会进入筛选的合理背景及依据 | 参与排序的可用基因与过滤规则 |
| ID 对应 | 物种、ID 类型、未映射与重复处理 | 同样需要,尤其注意一对多映射 |
| 基因集 | 数据库版本、日期和集合范围 | 版本、集合、与数据重叠后的大小过滤 |
| 统计 | 检验及多重校正方法、检验集合 | 实现、置换方式或算法、校正与随机设置 |
例如,一个实验平台只测到特定范围的基因,直接把所有已注释基因当背景,未必对应真实的筛选机会。这是需要根据实验和预过滤逻辑判断的问题,不是永远填“全基因组”或者永远填“表达量大于零”就正确。把最终使用的基因列表随代码保存,最容易复核。
看到“FDR”三个字,还要追问是哪一步
差异基因筛选阶段的多重校正,和通路检验阶段的多重校正,是两件事。图上标的是原始 P 值还是调整后的值?检验了哪些基因集?有没有只挑出感兴趣的一小部分后重新解释阈值?这些应在方法和图例里写清楚。
GSEA 的设置也不能只写“默认参数”。官方 FAQ 解释了输入、样本条件、基因集与数据的匹配等问题。使用预排序工具时,应如实记录该实现的输入和统计方式,不要把它描述成已经做了样本标签置换。
通路显著,到底能说到哪一步
富集不是通路活性实验,更不是因果证明。以“该结果提示与某过程相关,值得进一步验证”描述线索,通常比直接写“本研究证实该通路驱动疾病”更符合这类证据的范围。方向性解释还需要核对排序、基因集合定义和主要贡献基因,不能看见通路名称就决定是激活还是抑制。
如果换背景或修正映射后,主要通路不再得到支持,应替换结果并调整叙述。不要只删掉不显著的那一页补充表,让正文仍然围绕旧通路讲故事。
We have clarified the [analysis type], input gene selection/ranking, identifier mapping and gene-set version in [Methods]. We repeated the analysis using [justified settings/background] and reported [adjustment method and tested collection]. The updated results are in [location]. We have revised the wording from [overstated claim] to [association supported by the data].
这是可修改的写作框架,不是对你的研究结果的陈述;未完成的工作不得写成已完成。
返修包里保留三份小文件就很有用:输入基因或排序列表、实际参与分析的基因集版本、包含全部检验结果的表。它们比一张新配色的气泡图更能减少下一轮追问。
参考与更新
本文的处理步骤为编辑整理的实践建议,需结合研究设计判断;示例不是客户案例,表格不包含虚构实测数据。
云生信 · 审稿与返修系列 · 内容核对日期 2026-10-06。我们会根据方法文档和使用反馈持续修订;欢迎通过官网反馈不准确或不清楚的地方。
