ComfyUI-H3运维记录.md

ComfyUI + MiniMax H3 远程服务器运维记录

服务器:192.168.31.25(SSH: zyw)| 记录日期:2026-08-24 本文记录 GPU 掉总线问题的完整排查过程、已生效的修复、启动脚本清单与操作要点。


一、环境概况

项目详情
主板尔英 ERYING Polestar Z690 M-ATX D4(MoDT 方案:移动 CPU i5-12600HX + 台式主板)
电源金牌 850W
GPURTX 5060 Ti 16GB(GB206)
驱动610.43.02(open 内核模块,apt 安装 nvidia-driver-610-open)
系统Ubuntu 24.04,内核 6.8.0-138,32GB RAM,NVMe 1.2TB
ComfyUI0.32.0(/home/zyw/ComfyUI,venv,端口 8189)
Dockermumuainovel + postgres(restart=always,随系统自启)

二、软件栈

三、核心问题:GPU 掉总线(已解决 ✅)

症状

ComfyUI 运行中随机出现 CUDA error: unspecified launch failure → 进程崩溃(Fatal Python error: Aborted)→ GPU 从 PCIe 总线消失(nvidia-smi 报 "No devices were found")→ 必须重启/断电才能恢复。

三次崩溃记录(证明与启动参数无关):

运行配置结果
t2v 0.4MP×25步v5(全参数 + disable-pinned)💥 15 分钟崩
rv2v 350帧 + Refine 2MPv5💥 采样中崩
rv2v 350帧 + Refine 1MP(第2次)裸配置(零参数)💥 2/8 步崩

排查过程

  1. 尝试 PCI 重扫(/sys/bus/pci/rescan)、根端口重绑定 → 无效
  2. 驱动 595.84 → 610.43.02(apt 升级)→ 掉卡频率降低(连续跑 3 条重负载才崩,之前 1-2 条),但未根治
  3. 关键发现(lspci -vv):
    LnkCap: Speed 32GT/s (Gen5), Width x16   ← 插槽能力
    LnkSta: Speed 2.5GT/s (Gen1, downgraded) ← 空闲时实际链路

    实测:低负载 Gen1(2.5GT/s)↔ 高负载 Gen5(32GT/s)动态切换,且 BIOS 设 Gen4 无效(被驱动运行时重协商覆盖)

根因

NVIDIA 驱动的动态链路速率管理(Dynamic Power Management)在 MoDT 主板上导致 PCIe 链路 Gen1↔Gen5 反复震荡 → GSP 固件检测到链路不稳定 → 锁死 → GPU 掉总线。 (社区同款实锤:RTX 5060 Ti + nvidia-open 595.x 的 GSP crash 报告、eGPU 论坛 SOLVED 帖)

修复(已生效 ✅)

在 /etc/modprobe.d/nvidia.conf 追加:

options nvidia NVreg_DynamicPowerManagement=0x00

然后 sudo update-initramfs -u + 重启。

验证结果:负载后链路保持 32GT/s 不再掉回 Gen1;连续多轮重负载生成(3 段 508 帧 + Refine)零崩溃,输出 89+ 条视频。

四、启动脚本清单(/home/zyw/)

脚本状态说明
start_comfyui_v2.sh旧档基础优化(--lowvram 等)
start_comfyui_v3.sh旧档含有害参数(--cache-none / --disable-smart-memory),勿用
start_comfyui_v4.sh旧档v2 + --fast-disk
start_comfyui_v5.sh已缴械内含 --disable-pinned-memory,会报错提示用 v6
start_comfyui_v6.sh推荐提速档v5 去掉 --disable-pinned-memory:--force-fp16 --reserve-vram 1.0 --use-sage-attention --fast-disk --cache-lru 20 --preview-method none
start_comfyui_bare.sh当前调试档仅 --listen 0.0.0.0 --port 8189,零优化参数,最保守

备注:--disable-pinned-memory 曾被误判为元凶(v6 跑通 t2v 时),实际裸配置也崩,真凶是链路震荡。

五、操作要点

崩溃恢复流程

  1. GPU 掉卡 → sudo reboot
  2. 若 PCI 枚举消失(lspci 无 Nvidia)→ 需完全断电(sudo shutdown -h now + 手动开机)
  3. 开机后 bash /home/zyw/start_comfyui_bare.sh 启动

监控命令(只读,不干扰运行)

pgrep -f "ComfyUI/venv/bin/python main[.]py" | wc -l        # 进程存活
nvidia-smi --query-gpu=utilization.gpu,memory.used,temperature.gpu --format=csv,noheader
grep -cE "Fatal Python|launch failure" /home/zyw/comfyui_h3.log  # 崩溃签名(应为 0)
lspci -vv -s 01:00.0 | grep LnkSta   # 链路速率(修复后应保持 32GT/s)

显存 OOM 对策(1MP×15s 目标)

rv2v 提示词经验

其他

六、当前状态(2026-08-24 记录时)


2026-09-03 大版本升级(ComfyUI 0.32 → 0.34 + 导演台全家桶)

背景

升级清单(GPU 机 192.168.31.25)

组件旧新说明
ComfyUI repobd34f338 (v0.32.0, 08-12)ec803fc9 (v0.34.0, master 09-02)落后 97 提交 → 已 reset --hard origin/master
comfyui-frontend-package1.48.71.51.9pip 升级
ComfyUI_MiniMaxH3_Directora267324 (08-20)b8f721c (09-02)git reset --hard origin/main(本地 init.py 改动被覆盖回官方:重新注册 MiniMaxH3Director)
ComfyUI-DaSiWa-Nodes08-28 (zip)08-29 zip (main)目录整体替换
comfyui-workflow-templates0.11.400.11.52pip
comfy-aimdo / comfy-kitchen / av0.4.13 / 0.2.30 / ≥160.4.15 / 0.2.31 / 18.0.0pip(torch 未动)

备份/回滚

模型核对(新官方示例工作流引用的文件,本机全部存在 ✓)

新工作流位置

⚠️ 架构变化(重要)

2026-09-14 晚:LLM 全停 → ComfyUI 拉起

2026-09-25 11:00:GPU 机重启后 ComfyUI 自动恢复

下载此文件