先看结论:先判断缺失的是可追补的字段,还是让原问题无法识别的设计信息。分组冲突需回到原始样本记录与论文材料解决;缺失对照不能通过给另一平台随意贴上“正常组”补齐。无法核实的样本应明确标记、按预定规则排除或降低研究结论。
适用情况
表达文件可下载,但对照不足、分组表与论文不一致、供体身份不清,或批次和组别重叠。
建议按这个顺序检查
- 保存文件原样,建立每个样本的编号、分组、来源证据和冲突状态表,避免边猜边修改原表。
- 对照 GSE/GSM、补充材料和作者代码,区分文件命名错误、不同分析子集与真正无法解释的矛盾。
- 缺失关键字段时评估能否从公开材料补齐;推断值与已确认值必须分开记录。
- 检查组别、批次和配对结构是否可识别;完全混杂时寻找更合适的数据或改变问题。
- 按预先写明的纳入排除标准分析,并报告缺失、排除及其对结论的影响。
不同缺口怎样处理
| 发现的问题 | 可执行处理 | 应暂停的结论 |
|---|---|---|
| 个别非核心协变量缺失 | 报告缺失机制,评估适当方法与敏感性分析 | 缺失完全无影响 |
| 病例/对照标签互相矛盾 | 逐样本追溯来源,无法确认则排除相关比较 | 按表达聚类反推真实标签 |
| 没有健康对照 | 改为队列内明确亚组问题或寻找合适对照 | 直接声称疾病特异变化 |
| 一个批次全病例、另一个全对照 | 检查能否获得批次内比较 | 靠批次校正恢复独立疾病效应 |
依据:NCBI GEO:检索与记录入口 · DESeq2 官方教程:输入、设计矩阵与技术重复
可复用的冲突记录表
这是格式示例,不对应真实样本。resolution 应写清最终判断及理由,不能只保留修改后的值。分析脚本读取经确认的分组表,并检查样本集合与表达列名一致。
若找不到足够证据,不应把表达聚类最接近的一组当成“纠正标签”的依据。这样做会把要检验的结果反过来用于定义标签,形成循环论证。
sample_id field record_A record_B resolution evidence
DEMO_S01 group case control unresolved 待核对原始材料
只剩少量样本时还能做什么
可以整理数据可用性、描述表达模式或提出待验证假设,但应评估剩余独立重复是否支持原定推断。删除异常样本的规则要基于质量与记录,不能只因为删除后结果显著。
若外部队列只能提供部分信息,就明确它验证的是方向、细胞定位还是预测性能中的哪一项。并非每个缺口都值得投入更多计算,数据核查往往应先于方法扩展。
不能从当前结果直接得出什么
插补不能补造不存在的研究设计信息。AI 可以整理冲突和查找出处,但不能凭表达形状创造分组、供体身份或临床结局。
依据与版本
- NCBI GEO:检索与记录入口GEO 在线记录;2026-10-10 核对
- NCBI SRA:Study、Sample、Experiment 与 Run 元数据结构SRA 官方说明;2026-10-10 核对
- DESeq2 官方教程:输入、设计矩阵与技术重复release 在线教程;示例应匹配本地版本
最后核验:2026-10-10|资料核验:AI 编写与公开来源核对;未经人工专家审阅
依据公开来源核对概念、输入、证据边界与版本口径;示意数据不代表真实研究结果。仅标明的小型代码示例经过运行检查,不代表完整生物信息流程或原论文已复现。