# 核实：Sage Attention 加速是否会导致 GPU 掉线？（2026-09-06）

> 结论先行：**「Sage Attention 导致 GPU 掉线」是夸张的说法，但并非空穴来风。**
> SageAttention 早期版本（2.0.0 时代）确有真实崩溃报告（CUDA illegal memory access → 进程/驱动崩，严重者需重启），
> 可以成为"最后一根稻草"；但**你机器历史上三次 GPU 掉总线与启动参数无关（裸配置也崩），根因是 PCIe 链路震荡（已修复），9 月的两次是整机断电**——都不该算到 Sage Attention 头上。
> 实测你 GPU 机当前已装 **SageAttention 2.2.0**（社区修复版，支持 RTX 50 系 Blackwell sm120），**无需回退或禁用**。
>
> **⚠️ 2026-09-06 用户实测 A/B 后，上述"无需禁用"结论已作废**：开启 sage 最快 7 分钟出问题，去掉 `--use-sage-attention` 后连续 100+ 分钟无故障。对本机当前栈，**禁用 sage = 正确选择**。详见文末"实测更新"。

---

## 一、社区证据（真实存在，但多为旧版本 bug）

### 1. Comfy-Org/ComfyUI#6125《--use-sage-attention flag causing CUDA illegal memory access》
- 时间：2024-12 起，2025-08 仍有人反馈（**至今未彻底关闭**）。
- 复现：RTX 4090 + SageAttention **2.0.0** + `--use-sage-attention` 跑 HunyuanVideo → `CUDA error: an illegal memory access` → `Aborted (core dumped)`。
- 关键细节：同环境换 **1.0.6 正常**；多人确认只发生在 sage 2.0；1.0.6 与 2.0 对比 → **早期 2.x 内核 bug**。
- 与"掉线"直接相关的评论：
  - jjguzzardo（2025-04）："crashing **video card drivers that require a reboot**"
  - Ixe1（2025-08，Unraid）："crashes the GPU driver... 不用 sage attention 就正常"
  → 即社区确有"sage 崩驱动、需重启（掉线感）"的报告，但普遍归因于**kernel bug + 环境不稳**，属软件层故障。

### 2. kijai/ComfyUI-KJNodes#721《MiniMaxH3MemoryEfficientSageAttentionPatch fails on RTX 5060 Ti (CC 12.x) with SageAttention 1.0.6》
- 时间：2026-08-06，**和你同款显卡（RTX 5060 Ti，Blackwell CC 12.x）**。
- 症状：H3 工作流里 KJNodes 的省显存 Sage 补丁直接报错
  `sageattention is not new enough version or could not determine CUDA architecture`（**报错失败，不是掉卡**）。
- 作者 kijai 回复："按报错提示，需要更新版 sageattention"；评论区解法 = **升级 SageAttention 2.2.0**（+ triton-windows 预编译轮）。

### 3. RTX 50 系（Blackwell）对 SageAttention 有"版本门槛"（生态共识）
- 1.0.6 / 早期 2.x 在 sm120 上：patch 应用失败或 kernel 非法内存访问（Note.com 有 RTX50xx+cuda13.0+Triton 组合翻车记录）。
- 社区为此专门做 Blackwell 预编译轮：sanjxz（HF sm120a）、ziggyxp、DazzleML installer、mobcat40 等；
- Comfy-Org 讨论 #11583《SageAttention on NVIDIA RTX 50-series (Blackwell) - 30% Faster》：**2.2.0 起 Blackwell 原生支持，官方 ComfyUI 推荐**。
→ 结论：5060 Ti 上 Sage 有效的前提 = **版本 ≥ 2.2.0**。

---

## 二、你机器的实测事实（不被"Sage 背锅"的证据）

| 时间 | 事故 | 结论（运维记录已定位） |
|---|---|---|
| 2026-08-24 前后（三次） | GPU 掉总线（`CUDA error: unspecified launch failure` → \(Fatal\) Abort → `nvidia-smi` 无设备） | **与启动参数无关**：裸配置（零参数）照样崩；根因 = MoDT 主板 + 驱动动态电源管理导致 PCIe Gen1↔Gen5 链路震荡 → GSP 锁死掉卡。已用 `NVreg_DynamicPowerManagement=0x00` 修复（连续多轮重负载零崩溃） |
| 2026-09-03 | 整机断电（连 SSH 都不可达，journald "uncleanly shut down"） | 市电/PSU 掉电，非软件崩溃；同时段"模块错误"是 DaSiWa 缩放节点的边界 bug（896×1200 参考图），与显卡无关 |
| 2026-09-09 | 整机离线（ARP 不通），18 分钟后手动开机恢复 | 断电/网线类，非 ComfyUI/GPU 崩溃，与 Sage 无关 |

**本机 Sage 状态（2026-09-06 实测）**：
- `pip show sageattention` → **Version 2.2.0**（`/home/zyw/SageAttention` 源码安装，兼容 Blackwell）
- ComfyUI 仍在用 `start_comfyui_v6.sh`（含 `--use-sage-attention`），8189 正常服务中

---

## 三、机制：为什么"Sage 掉线"的说法半真半假

两层故障要分开看：

1. **软件层（Sage 可能触发）**：SageAttention 内核若与 torch/驱动/架构不匹配 → `illegal memory access` / `unspecified launch failure` → Python 进程 Abort。最坏情况是驱动需要重置（表现像"掉线"，但**重启驱动/重启 ComfyUI 即可**）。
2. **总线层（GPU 真正从 PCIe 消失）**：`nvidia-smi` 报 "No devices were found"、`lspci` 无 Nvidia → 根因几乎都是**驱动/电源管理/供电/插槽**（你的链路震荡、或 MIO 电源保护、市电闪断）。软件崩溃只有在**底层本来就脆**（链路不稳、供电波动）时才会被"放大"成掉总线。

Sage Attention 在这条链上至多是**压垮骆驼的最后一根稻草**，不是根因；你的根因已修复且在监控中。

---

## 四、建议（针对你的环境）

1. **保持现状**：SageAttention 2.2.0 + `--use-sage-attention` 是正确的组合（Blackwell 官方推荐档），不用回退、不用禁用。
2. **崩溃后再分级**：若再发生，先区分层级——
   - 日志出现 `illegal memory access` / `sageattention` 栈帧 → 软件层：检查 torch/驱动/sage 三件套版本匹配，或临时关闭 sage 对照；
   - 出现 `No devices were found` / Xid / `LnkSta` 降级 → 总线层：检查 `lspci -vv` 链路速率（修复基线应保持 32GT/s）、电源/插槽（9 月以来反复断电，建议优先排查 PSU 与市电）。
3. **升级纪律**：ComfyUI 大版本升级（现 0.34.0）若连带 torch/驱动变化，重新验证 sage 版本；升级后先跑一条 t2v 冒烟。
4. **⚠️ 附带发现（重要）**：**GPU 机 IP 已从 192.168.31.25 变为 192.168.31.31**（DHCP 重分配；.25 已 100% 丢包，ssh_exec.sh 也已指向 .31）。ComfyUI 现址 = `http://192.168.31.31:8189`（HTTP 200 正常）。建议：a) 尽快在路由器给该机 MAC 绑定固定 IP；b) 更新 AGENTS.md / 运维记录 / 各脚本里的 .25 为 .31；c) dsw-v18-generate 等技能里的 ComfyUI 地址同步更新。

---

## 五、实测更新（2026-09-06：用户 A/B 结论，优先级最高）

**用户实测（GPU 机 192.168.31.31，本机当前软件栈）**：
- 启用 `--use-sage-attention`：**最快 7 分钟就出问题**；
- 去掉该参数（其余配置不变）：**连续运行 100+ 分钟无任何故障**。

**→ 本文件开头"无需回退或禁用"的判断作废。对本机当前栈，禁用 sage 是当下正确选择，稳定性优先于那点加速。**

远程核验（2026-09-06，SSH 到 .31）：
| 检查项 | 结果 |
|---|---|
| 当前进程参数 | `main.py ... --lowvram --force-fp16 --reserve-vram 1.0 --fast-disk --cache-lru 20 --preview-method none`——**已无 `--use-sage-attention`** ✓ |
| sageattention 包 | 2.2.0 仍在（**editable 安装于 `~/SageAttention`，2026-08-11 本机源码编译**），但未启用 |
| torch / triton | **torch 2.11.0+cu130 / triton 3.6.0**（注意：社区 Blackwell 轮子多为 "torch2.10.0andhigher" 口径） |
| DPM 修复 | `NVreg_DynamicPowerManagement=0x00` 仍在 ✓ |
| `comfyui_h3.log` 崩溃签名 | `illegal memory / launch failure / Fatal / CUDA error` **零命中** |
| `dmesg` Xid | **无** → 本次故障属**软件层（进程/kernel 崩溃）**，不是总线掉卡 |

**为什么"对本机环境源码编译的 2.2.0"仍会 7 分钟崩（用户提示后，查文档 + 编译产物核验，2026-09-06）**：

① 前置确认：**用户记忆正确**——sage 2.2.0 是 2026-08-11 在本机 `pip install -e .` 源码编译（editable 安装；`build/` 产物时间 08-11 15:37~15:38，晚于同日上午 05:59 安装的 torch 2.11.0+cu130）→ **编译环境与运行环境一致，之前"构建与运行环境不匹配"的猜测作废**。

② 真正的问题在**编译目标架构**：
1. **setup.py 只声明 sm80 / sm89 两个 CUDA 内核目标**（`_qattn_sm80` / `_qattn_sm89` / `_fused` 即全部 .so 产物）；`sageattention/` 目录下也只有 `sm80_compile.py` / `sm89_compile.py` / `sm90_compile.py`，**没有 sm120_compile.py** → 官方 2.2.0 构建**不包含 Blackwell（sm120）CUDA 内核**；
2. 因此 RTX 5060 Ti 上 sage 2.2 **完全走 triton 运行时 JIT 路径**（`sageattention/triton/`）；这条路径在 triton 3.6.0 + sm120 + H3 超长多模态序列下不稳定——**社区专门为 RTX 50 系做 sm120a 定制轮子，正是因为官方构建缺 Blackwell 目标**；
3. 本机 README（2026-01-17 快照）文档原话：安装要求 `torch>=2.3.0 / triton>=3.0.0`，且 **"CUDA >=12.8 for Blackwell or SageAttention2++"**（本机 CUDA 13.0 ✓）；并建议**精度敏感应用仍用 SageAttention2**（H3 视频生成即属精度敏感场景）。

→ 修订后的判断：**不是装错、不是构建错误，而是 sageattention 2.2.0 官方构建在 Blackwell 上"天然没有 CUDA 内核、只能依赖 triton JIT"这个内在短板**，与你的 A/B 实测（禁用即稳定）完全吻合。

**操作建议**：
1. **保持现状（禁用 sage）**；`dsw-v18`/DaSiWa 流程不受影响（sage 只是 attention 加速，不开不损失质量，只损失速度）。
2. 若日后想找回加速：安装带 **sm120a（Blackwell）内核目标**的社区定制构建（如 HF `sanjxz/sageattention-2.2.0-blackwell-sm120a` 一类）或等官方版本补上 sm120 支持，避开"纯 triton JIT"路径；装好先用一条短 H3 任务冒烟（7 分钟对照），没问题再长期开。备注：官方 README 明示精度敏感应用仍推荐 SageAttention2。
3. 复测监控：`grep -aE "illegal memory|Aborted|launch failure" /home/zyw/comfyui_h3.log` 与 `dmesg | grep -i xid` 均为 0 即健康。
4. 之后每次升级 torch/ComfyUI/sage 都值得重跑一次这个 A/B（7 分钟对照即足够判别）。

---

## 六、参考链接

- Comfy-Org/ComfyUI #6125（sage 2.0 illegal memory access）：https://github.com/Comfy-Org/ComfyUI/issues/6125
- kijai/ComfyUI-KJNodes #721（5060 Ti + H3 patch 失败）：https://github.com/kijai/ComfyUI-KJNodes/issues/721
- Comfy-Org 讨论 #11583（Blackwell 支持/推荐版本）：https://github.com/Comfy-Org/ComfyUI/discussions/11583
- Blackwell 预编译轮：https://huggingface.co/sanjxz/sageattention-2.2.0-blackwell-sm120a 、https://github.com/ziggyxp/sageattention-blackwell-pt211-cu130-cp313
- Kaggle/Note 翻车案例（RTX50xx+CUDA13.0+Triton）：https://note.com/mizneko/n/n8b096db7d6d3
- 本机历史记录：`ComfyUI-H3运维记录.md`（2026-08-24 掉总线根因与修复）、`2026-09-03-GPU机离线根因分析.md`、`2026-09-09-GPU机离线诊断.md`