Slurm Detected oom-kill event:作业内存不足
Slurm cgroup 检测到作业超过申请内存后,会终止部分或全部进程;退出码不一定直接写成 OOM。
slurmstepd error Detected oom-kill event这个报错是什么意思?
作业实际峰值内存超过 --mem / --mem-per-cpu 请求,或多线程进程共同突破 cgroup 上限。
先做这三个检查
- 用 sacct 查看 MaxRSS 与申请内存的差距。
- 区分单进程峰值和多 worker 叠加,减少并发或分块。
- 按历史峰值增加安全余量重新申请,避免仅反复重跑。
可直接执行的检查命令
sacct -j JOBID --format=JobID,State,ExitCode,ReqMem,MaxRSS,Elapsed
seff JOBID
scontrol show job JOBID
日志更长,还是定位不准?
把完整报错前后关键行贴进诊断工具,自动区分环境问题、软件问题和真实硬件瓶颈。
人工复核 · 无需注册
命令跑完仍失败?让工程师帮你确认下一步
留下手机号,我们会围绕“slurmstepd error Detected oom-kill event”核对环境与资源条件;需要迁移时,可一并评估 128G 生信服务器 3 天试用。
先判断是否真缺算力不自动开通付费服务本站不保存日志原文