“Please validate the model in an independent cohort.” 看到这条意见,第一反应往往是打开 GEO,再找一个数据集。但多下载一个编号,不等于多了一次可信的验证。真正要补的是:换一批没有参与建模的人,这个模型是否还说得通。
先别急着让分析人员“找个能跑的队列”。把原研究的终点写成一句话,例如“预测接受某治疗的人群两年内是否复发”。如果新队列只有肿瘤与正常的分类标签,就算同一癌种、同一批基因,也回答不了原来的问题。
拿到候选队列,先做这张核对表
| 核对什么 | 可以继续的条件 | 需要停下来说明的情况 |
|---|---|---|
| 研究终点 | 定义、随访起点与预测任务能对齐 | 把生存预测换成肿瘤/正常分类 |
| 入组人群 | 关键临床特征可描述,差异可解释 | 治疗阶段不同,却当成同一使用场景 |
| 测量与变量 | 模型所需变量可得到,转换过程可复现 | 缺失多个核心变量后临时换模型 |
| 数据独立性 | 没有重复患者,未参与特征筛选和调参 | 不同数据库编号实际来自同一批患者 |
特别留意同一研究的派生数据。一个队列可以同时出现在论文附件、数据库和整合资源中。核对患者标识、原论文、机构及入组时间,比单看 accession 更有用。无法完全排除重叠时,把核查过程和不确定性写出来。
找到了队列,也别立刻重新训练
先冻结原模型的变量、系数、预处理方式和判定阈值,再评估验证集。若在验证集重新选基因、调参数,然后只报最好的 AUC,那已经改变了验证问题。确实需要重新校准或更新模型,可以做,但要把“原模型表现”和“更新后表现”分开。
评价指标跟着用途走。对风险预测模型,区分度之外还要关注预测风险与实际结局是否匹配;对二分类任务,阈值、敏感度和特异度的选择也需要解释。不要因为某个指标不漂亮就只展示另一个。TRIPOD+AI 可作为报告完整性的核对入口,不能代替研究设计。
确实没有:补能补的,承认不能替代的
先保存检索记录:检索日期、关键词、候选数据集及排除原因。这比“没有找到合适数据”更容易让审稿人判断你是否认真处理。随后检查现有内部验证是否规范,比如重采样时,特征筛选有没有放在每一个训练折内。
内部验证可以帮助评估模型在现有数据内的稳定性,但不能证明换医院、换人群也有效。若缺口关系到文章的核心临床应用结论,就应考虑补充真正的独立数据,或向编辑申请合理延期;如果暂时做不到,要同步修改摘要、讨论和结论,不只在回复信里加一句局限性。
回复时把“做了什么”与“还缺什么”分开
We agree that independent validation is important for assessing generalizability. We searched [repositories and search date] using [criteria]. The candidate cohorts were unsuitable because [specific reasons]. We have added [actually completed internal evaluation] in [section/table]. This does not replace external validation. We have therefore limited our conclusions to [supported scope] and explicitly described this limitation in [location].
这是可修改的写作框架,不是对你的研究结果的陈述;未完成的工作不得写成已完成。
方括号必须换成真实记录;尚未完成的分析不能写成 have added。如果有了独立队列,回复重点就应改为队列来源、独立性核查、冻结模型的方法、实际指标及正文位置,而不是继续解释为什么难找。
今天就能先做的一件事:把原模型任务和候选队列放进同一张表。对不齐的队列早点排除,比跑完一整套图后再返工省事。
参考与更新
本文的处理步骤为编辑整理的实践建议,需结合研究设计判断;示例不是客户案例,表格不包含虚构实测数据。
云生信 · 审稿与返修系列 · 内容核对日期 2026-10-06。我们会根据方法文档和使用反馈持续修订;欢迎通过官网反馈不准确或不清楚的地方。
