研究设计 · 12

用铁死亡基因做 WGCNA、机器学习或预后模型,怎样避免过拟合?

回答会区分适用条件、检查步骤和不能直接得出的结论。

先看结论:先把预测目标、候选变量和验证方式写清楚,再建模。特征筛选、调参和性能评估如果都在同一批数据中完成,结果通常过于乐观;外部验证不能被随机拆分的内部测试集替代。

适用情况

准备从铁死亡相关基因中筛选特征,并建立诊断、分型、预后或疗效预测模型。

建议按这个顺序检查

  1. 先定义结局、预测时间点、纳入标准、样本量和候选变量,避免看到结果后改变研究问题。
  2. 把数据清洗、缺失值、特征筛选、标准化和调参全部放在训练流程内部,防止信息泄漏。
  3. 内部验证优先使用重复交叉验证或 bootstrap,并报告校准、区分度和不确定性。
  4. 使用真正独立的外部队列验证;如果平台不同,预先规定映射和标准化策略。
  5. 保留完整模型和失败结果,不以多个算法中表现最高的一个作为无偏估计。

不能从当前结果直接得出什么

WGCNA 模块相关、LASSO 入选或较高 AUC 都不能证明因果机制。样本量不足时,应把模型定位为探索性结果而不是临床工具。

依据与版本

最后核验:2026-10-10|资料核验:公开来源核对