# 核实：社区轮子 sanjxz/sageattention-2.2.0-blackwell-sm120a 评价如何？（2026-09-06）

> 结论：**该仓库几乎无社区热度（HF 0 下载、1 赞、2026-07-25 后未更新），谈不上"口碑好/坏"，而是"太小众、且平台与你不匹配"。**
> 但它代表的那一类 **Blackwell 定制轮子生态**有明确且一致的社区验证结论：**官方 SageAttention 在 RTX 50 系上的 Triton 路径不可靠（黑屏/崩溃），正确用法是用 KJNodes "Patch Sage Attention" 节点的 CUDA 后端**——这点与你的 A/B 实测完全吻合。
> ⚠️ 更正：我上一轮把它列为可选方案不准确——**这是 Windows + Python 3.13 + torch 2.14 nightly 的轮子，你的 Linux + py3.12 + torch 2.11 机器装不了**。

---

## 一、sanjxz 仓库档案（HF API 核实）

| 项 | 值 |
|---|---|
| 内容 | 一个预编译 wheel + 完整构建脚本（build_optimized.bat 等） |
| 目标平台 | **Windows x64 only**（.bat 构建链）；**cp313**；torch **2.14.0.dev20260715+cu132 nightly**；CUDA 13.x；GPU **sm_120a**（5090/5080/5070/5060） |
| 热度 | likes=1，downloads=0，2026-07-25 发布后无更新 |
| 体积 | 7.5MB（一个 wheel） |
| 编译特征 | SASS-only for sm_120a（无 PTX，其他架构不可 JIT）；clang thinLTO + lld-link；`-O3 --use_fast_math` |
| 自测（作者口径，无第三方复核） | RTX 5070 上比 torch SDPA 快 **5.77–5.86×**（B2 H24 L4096 D128 fp16），cosine ≥ 0.9992；三后端精测中 **`sageattn_qk_int8_pv_fp16_cuda` 精度最高**（rel err 0.009–0.011，cosine ≥ 0.99994） |

**与本机的匹配度：完全不匹配**（Windows 轮子 / Python 3.13 vs 你的 3.12 / torch 2.11 vs 2.14 nightly）
→ 即便想试也装不上；作者自己明说"不同 torch nightly 下 DLL load failed 属预期"，C++ ABI 在 nightly 间漂移。

## 二、它的 README 里最有价值的部分（为何这类轮子存在）

作者直言"这个 repo 有趣的不是 wheel，而是四个非显然的构建阻塞点"：
1. torch 2.14 强制 C++20，SageAttention 的 setup.py 传 C++17 → torch 头文件编译失败；
2. CUDA 13.3 的 CCCL 拒绝 MSVC 传统预处理器（需 `/Zc:preprocessor`）；
3. clang thinLTO 产出 LLVM bitcode，MSVC link.exe 读不了 → 换 lld-link；
4. nvcc 在 Windows 上拒绝 clang 作宿主编译器 → clang 只管 pybind 胶水。

→ 这类轮子的价值主要在**给"CUDA 13 + 新 torch 上自编 CUDA 扩展"提供可复现方法**，工程文档质量高；但**不是官方背书，性能数据为作者自测**。

## 三、整个 Blackwell 轮子生态的社区共识（多方互相印证，可信度高）

| 来源 | 要点 |
|---|---|
| mobcat40（Comfy-Org 官方 Discussion #11583，2025-12-31） | RTX 5090 上 ~30–35% 加速（Qwen Image Edit 40 步 14m30s→9m30s）；**"别用 `--use-sage-attention`，Triton 后端会让部分模型（Qwen、Wan）黑屏"**；正确姿势 = KJNodes Patch Sage Attention 节点 + `sageattn_qk_int8_pv_fp16_cuda` |
| ziggyxp/sageattention-blackwell-pt211-cu130-cp313（2026-01-28） | 提供 cu128 与 **cu130** 两套轮子（对 torch 2.11 nightly）；**同样的警告**：全局 flag 的 Triton 后端在 Qwen/Wan 上黑屏，用 KJNodes 节点 + CUDA 后端；轮子必须匹配精确 torch nightly，否则 DLL load failed |
| sanjxz README（2026-07-25） | 同上；并测出 `qk_int8_pv_fp16_cuda` 是**精度最高**的后端；**SageAttention2.2.0 的 `SAGE_ATTENTION_SUPPORTS_MASK=False`** → 带 mask 的 attention 自动回退 PyTorch，并非全流程加速 |
| KJNodes #721 评论区（2026-08） | 5060 Ti 上 H3 的省显存 Sage 补丁失败 → 升级到 2.2.0 系可解 |
| woct0rdho releases | Windows 轮子「groundwork」，KJNodes#721 评论区用它（cu130/torch2.10+ 口径）救活 5060 Ti |

→ **这些"轮子"之间互相独立验证了同一结论：Blackwell 上问题出在 Triton 执行路径本身，而不是某一个轮子**——与你"去掉 `--use-sage-attention` 后 100 分钟无故障"的实测一致。

## 四、附带发现：ComfyUI 里 SageAttention3 目前是"死代码"（回应你上一个问题）

sanjxz README（对 ComfyUI 0.28.0 源码的核实）：
- ComfyUI 的 `comfy/ldm/modules/attention.py` 已注册 `"sage3"` 后端，但 `get_attention_function` **零调用点**、`optimized_attention_override` 无人写入、`--use-sage-attention` **无条件路由到 Sage2**；
- → 即使编译好 `sageattention3_blackwell`（还需要 ~600MB CUTLASS），**stock ComfyUI 也够不到 Sage3**，须第三方节点设置 override。

## 五、对你（Linux + cp312 + torch 2.11.0+cu130 + RTX 5060 Ti）的建议

1. **sanjxz 轮子：不用看**——平台错配；它既不是你的选项，也不代表社区主流。
2. 目前**继续禁用 sage**仍是理性选择（多方共识 + 你的 A/B 双击中"Triton 路径不稳"）。
3. 未来若想找回加速，Linux 路线是：按 ziggyxp 那类构建方法对当前 torch 2.11/cu130 源码编（`TORCH_CUDA_ARCH_LIST` 含 12.0），然后**不用全局 flag**，改在 H3 工作流里用 KJNodes "Patch Sage Attention" 节点指定 **`sageattn_qk_int8_pv_fp16_cuda`**（精度也最高）；装完先跑短 H3 任务 7 分钟对照。
4. Sage3 请继续等待：ComfyUI 侧需要第三方节点接线才可能启用，暂不具备实用条件。

---

## 六、参考链接
- sanjxz HF 仓库：https://huggingface.co/sanjxz/sageattention-2.2.0-blackwell-sm120a
- mobcat40（Comfy-Org Discussion #11583）：https://github.com/Comfy-Org/ComfyUI/discussions/11583
- ziggyxp 构建说明：https://github.com/ziggyxp/sageattention-blackwell-pt211-cu130-cp313
- KJNodes #721：https://github.com/kijai/ComfyUI-KJNodes/issues/721
- 前序记录：`2026-09-06-SageAttention是否导致GPU掉线-核实.md`、`2026-09-06-SageAttention版本3核实.md`（同目录）