先看结论:跨队列比较应先对齐研究问题、方向和特征定义,再比较各自分析的效应与不确定性。不同平台的原始表达和签名分数通常不能直接拼在同一尺度上。跨物种还需显式处理同源映射;批次与组别完全重合时,校正软件无法从数据中识别两者各自的贡献。
适用情况
希望把 GEO、TCGA、不同实验平台或人鼠数据联合起来,验证一个铁死亡相关结论。
建议按这个顺序检查
- 逐队列确认组织、采样时点、治疗背景、对照定义和结局,判断是不是在回答同一问题。
- 统一 ID 与候选定义,分别完成适合平台的预处理和质控,记录各队列签名命中率。
- 先在各队列内部估计同方向比较的效应及不确定性,再决定是否具备汇总条件。
- 跨物种使用注明版本的同源映射,单列一对多、未映射和物种特异基因,并做映射选择的敏感性分析。
- 外部预测验证要冻结训练流程;不能在看到验证标签后重新筛基因或挑选最有利阈值。
先判断能比较到哪一层
| 组合 | 推荐比较对象 | 主要风险 |
|---|---|---|
| 同疾病的两个人群队列 | 各自效应方向、效应量及区间 | 入组标准、治疗、终点不同 |
| 芯片与 RNA-seq | 共同可测特征上的一致性 | 探针映射和尺度不同 |
| 人类组织与小鼠实验 | 保守程序及具体机制的支持 | 同源关系不等于功能相同 |
| 不同单细胞队列 | 匹配细胞类型中的供体层结果 | 细胞组成、注释和深度差异 |
依据:Ensembl:同源基因关系类型 · DESeq2 官方教程:输入、设计矩阵与技术重复
不能靠批次校正救回的设计
示意情境:队列 A 全是疾病样本,队列 B 全是正常样本。此时来源与组别完全重合。即使校正后 PCA 看起来混合,仍不能证明估计出来的是疾病效应;算法无法凭空生成缺失的组内对照信息。
更可解释的办法是寻找每个来源内部都有相应比较的数据,分别分析后评估一致性,或把现有数据用于描述而降低推断范围。不要按“消掉批次后图好看”决定校正是否成功。
跨物种映射的最小记录
表头分成多行仅为阅读示意,实际文件应保持一行完整字段。若只保留一对一同源基因,应报告因此丢失多少候选;若纳入一对多关系,应说明聚合规则,避免重复特征被无意加权。不同队列均值中心化后的分数也只具有对应转换后的含义。
source_species source_id target_species target_id
orthology_type ensembl_release keep_rule
物种A DEMO_A 物种B DEMO_B 待核对 待填写 预先指定
不能从当前结果直接得出什么
标准化或批次校正不能修复不可识别的研究设计。同一签名跨平台绝对分数相同不代表状态相同;观察方向一致也仍不是机制因果证明。
依据与版本
- Ensembl:同源基因关系类型Compara 在线文档;映射需另记 release
- DESeq2 官方教程:输入、设计矩阵与技术重复release 在线教程;示例应匹配本地版本
- TRIPOD 官方资源:预测模型开发与验证清单2015 基础资料与勘误;现行更新另见 TRIPOD+AI
最后核验:2026-10-10|资料核验:AI 编写与公开来源核对;未经人工专家审阅
依据公开来源核对概念、输入、证据边界与版本口径;示意数据不代表真实研究结果。仅标明的小型代码示例经过运行检查,不代表完整生物信息流程或原论文已复现。