# GPU 机崩溃完整分析（2026-09-03 补充：模块错误根因 + 整机断电确认）

> 接《2026-09-03-GPU机离线根因分析.md》，本次补充两个关键结论：
> ① ComfyUI"模块错误"根因已定位并复现（DaSiWa 缩放节点边界条件）；
> ② 确认死机瞬间 GPU 正满载推理，整机断电特征与用户观察（连 SSH 都不通）吻合。

## 一、时间线（已换算为本地时间 CST = UTC+8）

| 时间 (CST) | 事件 | 证据 |
|---|---|---|
| 14:02:47 | 任务1 提交（REF2VA，736×1280，362帧） | prev.log |
| 14:24:36 | 任务1 完成 → `062424_00001_audio.mp4` | prev.log / 文件 |
| 14:36:08 | 任务2 提交（参考图 grok-image 1792×1008） | prev.log / input/ |
| 14:41:05 | 任务3 提交（参考图 **z-image_04845_.png 896×1200**） | prev.log / input/ |
| 14:42:26 | 任务4 提交（参考图 12.png 896×1600） | prev.log / input/ |
| 14:57:32 | 任务2 完成 → `065721_00001_audio.mp4` | prev.log / 文件 |
| **14:57:49** | **任务3 执行报错 = 你看到的"模块错误"** | prev.log Traceback |
| 14:57:50 | 任务4 开始执行 | prev.log |
| 14:58:37 | 任务4 模型加载完成，**GPU 开始满载推理** | prev.log |
| **15:00:25** | 💀 **整机断电**（推理刚跑 1 分 48 秒） | journal 最后一条 / sar 最后采样 |
| 15:01~ | 你报告断开，我开始探测 → 全不可达 | 会话记录 |
| 15:18:34 | 重新开机（重启或来电，间隔 18 分钟） | last / journal |

> 死机前磁盘写入 30MB/s（sar 07:00:25 采样），与推理写中间数据吻合 → 死机时确实在满载生成。

## 二、"模块错误"根因：参考图宽高比触发 DaSiWa 缩放节点边界

**报错原文**（comfyui_8189.prev.log，06:57:49）：
```
ValueError: Target box is too small to preserve aspect ratio at divisible_by.
  File ".../ComfyUI-DaSiWa-Nodes/nodes/nodes_scaling.py", line 325
  in _fit_aspect_divisible → raise ValueError(...)
```

**已在 GPU 机复现**（直接调用该函数）：

| 参考图 | 尺寸 | →736×1280 div=16 | 结果 |
|---|---|---|---|
| **z-image_04845_.png** | 896×1200 | ❌ **ValueError** | **任务3 报错的图** |
| 12.png | 896×1600 | ✅ (672,1200) | 任务4 通过 |
| grok-image | 1792×1008 | ✅ (512,288) | 任务2 通过 |
| z-image（div=8） | 896×1200 | ✅ (448,600) | div=8 就不报错 |

**结论**：`z-image_04845_.png`（896×1200，宽高比 0.747）在画布 736×1280（0.575）+ divisible_by=16
约束下，无法同时保持宽高比且 16 整除 → 抛异常。**这是输入图片尺寸的边界问题，与显卡/驱动完全无关**；
之前的图（1792×1008、896×1600）都能通过，所以"链路多次跑通"符合事实。

**规避**：换用宽高比接近 0.575（竖屏 9:16 附近）的参考图，或把参考图预裁到 9:16。

## 三、整机断电确认（连 SSH 都不通的原因）

死机瞬间系统状态（sar 07:00:25 采样）：CPU 3.5%、内存空闲 2.9GB、无 OOM —— 排除软件过载。
断电特征（全部吻合）：
1. **journald 下次启动自述**：`corrupted or uncleanly shut down`（非正常关机铁证）；
2. 死机前无任何 panic / OOM / hung task / nvidia Xid / thermal / MCE 记录（journal、syslog、
   kern.log 交叉验证，连被隔离的 25MB journal 都翻过，07:00:25 后零记录）；
3. `last -x` 无 shutdown 记录 → 不是正常关机路径；
4. **WOL 无效** → 完全断电（PSU 无待机供电，网卡收不到魔术包）；
5. RTC 连续 → 主板时钟未断，非 CMOS/BIOS 问题。

**结论**：15:00:25 整机断电（PSU 保护触发 / 市电闪断 / 供电故障），并非 ComfyUI 或系统崩溃。
这也解释了你的观察——**以前 PCIe 掉线系统仍运行、SSH 可连；这次是整机断电，连 SSH 都没电可用**。

## 四、待观察隐患：PCIe 链路降级

- 本次开机枚举：`16.0 GT/s`（Gen4），**运维基线应为 32GT/s（Gen5）**；
- 空闲 LnkSta：`2.5GT/s (downgraded)`；nvidia-smi gen.current=1；
- 无 AER 纠正/不可纠正错误记录。

死机时 GPU 正满载推理 + 链路速率异常 → 不排除显卡供电/接触问题在满载时引发电源保护。
建议重新插拔显卡、检查 12V 供电线。

## 五、建议

1. **参考图**：提交前确认宽高比接近 9:16；报错后换图即可，与硬件无关；
2. **电源**（主因方向）：检查 PSU、插排、同一电路大功率设备；可考虑 UPS；
3. **显卡接触**：重新插拔，确认链路恢复 32GT/s Gen5；
4. **ComfyUI 自启**：配 systemd unit，断电来电自动拉起。
