# 2026-09-25 H3 批量生成期间 GPU 机整机硬挂（MV 项目，第 4 次同类）

- **项目**：`dl-hub/54-九九八十一MV`（可爱版 MV，25 镜 H3 动态化）
- **机器**：GPU 机 192.168.31.31（RTX 5060 Ti 16GB，ComfyUI 8189）
- **结论（待机器恢复后取证补全）**：**整机硬挂，与软件路径无关**——官方 MinimaxH3Director 图（无 LoRA / 无 Sage / 无 Sol / 无段间引导）、12 步、单段独立任务、段间 300s 冷却 + 温度闸门，仍然在**第 3 镜采样中**失联。与 `2026-09-17/09-18` 三次硬挂同一类。

## 一、时间线（DSH 机侧，CST）

| 时间 | 事件 |
|---|---|
| 06:02:09 | S01 开跑（1344×768 / 12 步 / 官方图 / 冷却 300s） |
| 06:22:47 | ✅ S01.mp4 出片（**20 分钟**，1344×768/141 帧，风格保留良好） |
| 06:25:06 | S02 开跑（等满 5 分钟冷却后） |
| ≈06:45 | ✅ S02.mp4 出片 |
| 06:50:52 | S03 开跑 |
| **06:56:48** | 批次报错：`ConnectionError ... http://192.168.31.31:8189/upload/image ... [Errno 113] No route to host` → **整机失联** |
| 07:00–07:15 | `ping` 100% 丢包、`ssh` No route to host；**未自愈**（`kernel.panic=10`、`hung_task_panic=1` 已开，但未触发重启） |

## 二、运行配置（与记录①的 13 小时零挂机配方逐条一致）

| 项 | 配方① | 本次 |
|---|---|---|
| 节点图 | 官方 MinimaxH3Director | ✅ 只有 UNETLoader/CLIPLoader/VAELoader/Director/CreateVideo/SaveVideo |
| 画布 | 1344×768 | ✅ |
| 步数 | 12 | ✅ |
| 采样 | res_multistep + simple，cfg 1.0，shift 12/3 | ✅ |
| 加速 | 无 | ✅ 无 LoRA / Sage / Sol |
| 段间引导 | 关 | ✅ `continuityEnabled=false`，segments=1 |
| 冷却 | 段间 5 分钟 | ✅ 300s + 温度闸门(≤70℃) |
| 单次满载 | ≤60 分钟 | ✅ 单镜 ~20 分钟 |

**对照结论**：本次单镜负载（141 帧 / 20 分钟）**明显低于**记录①里跑通 13 小时的 260 帧 / 54–76 分钟段，
却仍在第 3 镜挂掉 → 进一步支持 `2026-09-18` 的结论：**该机在 H3 长时满载下会随机整机硬挂，与配置/软件路径无关**。

## 三、现场取证要点（机器恢复后照做）

```bash
ssh zyw@192.168.31.31 'uptime; last -x | head -5; dmesg -T | tail -80; \
  nvidia-smi -q | head -40; \
  ls -l ~/comfyui_8189_opt.log*; tail -c 2000 ~/comfyui_8189_opt.log; \
  cat /sys/module/nvidia/parameters/NVreg_DynamicPowerManagement 2>/dev/null; \
  nvidia-smi --query-gpu=power.limit,clocks.sm,temperature.gpu --format=csv'
```
关注：是否留下 `.bak`（restart 脚本会备份）、`dmesg` 是否有 XID/GSP 报错、是否留下 PCIe 降速、power limit 是否被改过。

## 四、恢复后处置

1. 确认 ComfyUI 起来（`curl --noproxy '*' http://127.0.0.1:8189/system_stats`）；
2. **DSH 机跑 `run_h3_supervisor.sh`**：自动等待机器+ComfyUI 就绪后**断点续跑**（已完成镜自动跳过）；
3. 已在批次脚本里做的韧性：断点续跑、失败不中断、逐镜日志（`logs/h3_batch.log`）。

## 五、历史同类

- `2026-09-15-连续生成6小时后整机硬挂-取证报告.md`（pinned 内存窒息版，已修）
- `2026-09-17-Director段间引导latent锚定导致整机硬挂-两次复现.md`（含 09-18 补充：与软件路径无关）
- `2026-09-09-ComfyUI启动恢复与停顿分析.md`（离线 18 分钟后人工开机恢复）

---

## 六、恢复与续跑（2026-09-25 09:27 CST）

- 用户**人工断电重启**后机器恢复（`uptime` 显示 01:22 UTC 开机；上一次开机是 09-24 13:27 UTC，即本次连续运行约 12 小时后硬挂）。
- **取证结果（有限）**：
  - `comfyui_8189_opt.log` 尾部停在 **S03（第 3 镜）的 `Model Initializing ...`**，即死亡发生在模型加载/首步采样阶段，与 09-17 两次「段 1 第 1 步刚结束就冻死」的表现一致；
  - 无 `.bak` 轮转（未走 restart_comfy.sh），**dmesg 因内核限制读不到**，未捕获 XID/GSP 记录 —— 这台机器依旧缺少崩溃捕获能力。
- 恢复动作：拉起 ComfyUI（含 `--disable-pinned-memory`、`--fast-disk`）+ 重启 RAM 哨兵（`MemAvailable` 29.6GB 健康），
  然后由 `54-九九八十一MV/run_h3_supervisor.sh` **断点续跑**（已完成 S01/S02 自动跳过，S03 于 09:27:02 重新开跑）。
- 结论不变：**该机 H3 长时满载会随机整机硬挂，与配置无关**；工程上靠「监督脚本 + 断点续跑 + 人工断电」兜住。
