研究设计 · 21

怎样从铁死亡基因中选择候选基因,而不是只看交集和 P 值?

回答会区分适用条件、检查步骤和不能直接得出的结论。

先看结论:候选优先级应同时考虑效应、稳定性、证据背景、细胞来源和后续可验证性。P 值最小的基因可能只是表达量高或样本量带来的结果;多个算法共同选中也可能来自同一数据偏差。先规定筛选规则,再保留支持和反对每个候选的证据。

适用情况

已有差异、富集、共表达或机器学习结果,需要选出少量可进一步验证的候选基因。

建议按这个顺序检查

  1. 区分候选用途:机制研究看可干预环节,预测研究看独立泛化,不能用同一排名替代两种目标。
  2. 同时查看效应量、不确定性、表达可检测性和多重检验结果,避免只按 P 值排序。
  3. 检查外部方向、供体层稳定性、细胞类型来源和潜在批次影响。
  4. 回到原始文献核对调控角色、实验体系和证据强度,保留冲突与未知项。
  5. 把检测和干预可行性纳入计划,冻结首轮候选及备选理由后再进入验证。

候选证据表比单一分数更有用

评价维度 应记录的事实 警示信号
统计支持 效应量、区间、校正 P 值 效应极小却只强调显著
稳定性 不同供体与独立队列方向 由个别样本驱动
生物学背景 文献角色、物种、处理条件 只引用数据库标签
细胞来源 目标细胞中的表达与变化 主要信号来自混入细胞
验证可行性 可检测、可干预及预期读数 没有区分机制的实验路径

依据:FerrDb V3 官方帮助:分类、置信等级与数据版本 · DESeq2 官方教程:输入、设计矩阵与技术重复 · TISCH2:肿瘤微环境单细胞数据库

一个候选排序的示意例子

假设候选 A 的 P 值最小,但变化主要来自免疫细胞比例;候选 B 的效应较稳定,在目标细胞内可检测,也有适合的干预手段。若课题目的是研究目标细胞机制,B 可能更值得先试。若目的是预测,两者仍需进入严格的训练验证流程后才能比较。

这个例子没有给出真实基因或结果,说明的是决策逻辑。可以为各维度写明确的最低要求,但不要把主观评分包装成客观已验证的生物学价值。

防止算法共识制造虚假把握

LASSO、随机森林和差异筛选若使用同一批标签,交集依然不是外部证据。用于性能评估的测试集必须与筛选流程隔离;内部重采样时,筛选和调参要放在训练部分内部。

机制候选的后续材料也应包含阴性或不一致证据。若外部数据方向相反,先检查人群和细胞背景,而不是仅保留支持预期的队列。候选卡最后写清“下一步将通过什么结果支持或否定这个假设”。

依据:TRIPOD 官方资源:预测模型开发与验证清单

不能从当前结果直接得出什么

候选优先级是研究决策,不是因果证明。高相关、网络中心性、算法重要度和文献数量均不能单独确定机制核心;预测变量也不必然是干预靶点。

依据与版本

最后核验:2026-10-10|资料核验:AI 编写与公开来源核对;未经人工专家审阅

依据公开来源核对概念、输入、证据边界与版本口径;示意数据不代表真实研究结果。仅标明的小型代码示例经过运行检查,不代表完整生物信息流程或原论文已复现。

继续解决相关问题