2026-09-25-H3批量生成期间GPU机整机硬挂-记录.md

2026-09-25 H3 批量生成期间 GPU 机整机硬挂(MV 项目,第 4 次同类)

一、时间线(DSH 机侧,CST)

时间事件
06:02:09S01 开跑(1344×768 / 12 步 / 官方图 / 冷却 300s)
06:22:47✅ S01.mp4 出片(20 分钟,1344×768/141 帧,风格保留良好)
06:25:06S02 开跑(等满 5 分钟冷却后)
≈06:45✅ S02.mp4 出片
06:50:52S03 开跑
06:56:48批次报错:ConnectionError ... http://192.168.31.31:8189/upload/image ... [Errno 113] No route to host → 整机失联
07:00–07:15ping 100% 丢包、ssh No route to host;未自愈(kernel.panic=10、hung_task_panic=1 已开,但未触发重启)

二、运行配置(与记录①的 13 小时零挂机配方逐条一致)

项配方①本次
节点图官方 MinimaxH3Director✅ 只有 UNETLoader/CLIPLoader/VAELoader/Director/CreateVideo/SaveVideo
画布1344×768✅
步数12✅
采样res_multistep + simple,cfg 1.0,shift 12/3✅
加速无✅ 无 LoRA / Sage / Sol
段间引导关✅ continuityEnabled=false,segments=1
冷却段间 5 分钟✅ 300s + 温度闸门(≤70℃)
单次满载≤60 分钟✅ 单镜 ~20 分钟

对照结论:本次单镜负载(141 帧 / 20 分钟)明显低于记录①里跑通 13 小时的 260 帧 / 54–76 分钟段, 却仍在第 3 镜挂掉 → 进一步支持 2026-09-18 的结论:该机在 H3 长时满载下会随机整机硬挂,与配置/软件路径无关。

三、现场取证要点(机器恢复后照做)

ssh zyw@192.168.31.31 'uptime; last -x | head -5; dmesg -T | tail -80; \
  nvidia-smi -q | head -40; \
  ls -l ~/comfyui_8189_opt.log*; tail -c 2000 ~/comfyui_8189_opt.log; \
  cat /sys/module/nvidia/parameters/NVreg_DynamicPowerManagement 2>/dev/null; \
  nvidia-smi --query-gpu=power.limit,clocks.sm,temperature.gpu --format=csv'

关注:是否留下 .bak(restart 脚本会备份)、dmesg 是否有 XID/GSP 报错、是否留下 PCIe 降速、power limit 是否被改过。

四、恢复后处置

  1. 确认 ComfyUI 起来(curl --noproxy '*' http://127.0.0.1:8189/system_stats);
  2. DSH 机跑 run_h3_supervisor.sh:自动等待机器+ComfyUI 就绪后断点续跑(已完成镜自动跳过);
  3. 已在批次脚本里做的韧性:断点续跑、失败不中断、逐镜日志(logs/h3_batch.log)。

五、历史同类


六、恢复与续跑(2026-09-25 09:27 CST)

下载此文件