结论:该仓库几乎无社区热度(HF 0 下载、1 赞、2026-07-25 后未更新),谈不上"口碑好/坏",而是"太小众、且平台与你不匹配"。 但它代表的那一类 Blackwell 定制轮子生态有明确且一致的社区验证结论:官方 SageAttention 在 RTX 50 系上的 Triton 路径不可靠(黑屏/崩溃),正确用法是用 KJNodes "Patch Sage Attention" 节点的 CUDA 后端——这点与你的 A/B 实测完全吻合。 ⚠️ 更正:我上一轮把它列为可选方案不准确——这是 Windows + Python 3.13 + torch 2.14 nightly 的轮子,你的 Linux + py3.12 + torch 2.11 机器装不了。
| 项 | 值 |
|---|---|
| 内容 | 一个预编译 wheel + 完整构建脚本(build_optimized.bat 等) |
| 目标平台 | Windows x64 only(.bat 构建链);cp313;torch 2.14.0.dev20260715+cu132 nightly;CUDA 13.x;GPU sm_120a(5090/5080/5070/5060) |
| 热度 | likes=1,downloads=0,2026-07-25 发布后无更新 |
| 体积 | 7.5MB(一个 wheel) |
| 编译特征 | SASS-only for sm_120a(无 PTX,其他架构不可 JIT);clang thinLTO + lld-link;-O3 --use_fast_math |
| 自测(作者口径,无第三方复核) | RTX 5070 上比 torch SDPA 快 5.77–5.86×(B2 H24 L4096 D128 fp16),cosine ≥ 0.9992;三后端精测中 sageattn_qk_int8_pv_fp16_cuda 精度最高(rel err 0.009–0.011,cosine ≥ 0.99994) |
与本机的匹配度:完全不匹配(Windows 轮子 / Python 3.13 vs 你的 3.12 / torch 2.11 vs 2.14 nightly) → 即便想试也装不上;作者自己明说"不同 torch nightly 下 DLL load failed 属预期",C++ ABI 在 nightly 间漂移。
作者直言"这个 repo 有趣的不是 wheel,而是四个非显然的构建阻塞点":
/Zc:preprocessor);→ 这类轮子的价值主要在给"CUDA 13 + 新 torch 上自编 CUDA 扩展"提供可复现方法,工程文档质量高;但不是官方背书,性能数据为作者自测。
| 来源 | 要点 |
|---|---|
| mobcat40(Comfy-Org 官方 Discussion #11583,2025-12-31) | RTX 5090 上 ~30–35% 加速(Qwen Image Edit 40 步 14m30s→9m30s);"别用 --use-sage-attention,Triton 后端会让部分模型(Qwen、Wan)黑屏";正确姿势 = KJNodes Patch Sage Attention 节点 + sageattn_qk_int8_pv_fp16_cuda |
| ziggyxp/sageattention-blackwell-pt211-cu130-cp313(2026-01-28) | 提供 cu128 与 cu130 两套轮子(对 torch 2.11 nightly);同样的警告:全局 flag 的 Triton 后端在 Qwen/Wan 上黑屏,用 KJNodes 节点 + CUDA 后端;轮子必须匹配精确 torch nightly,否则 DLL load failed |
| sanjxz README(2026-07-25) | 同上;并测出 qk_int8_pv_fp16_cuda 是精度最高的后端;SageAttention2.2.0 的 SAGE_ATTENTION_SUPPORTS_MASK=False → 带 mask 的 attention 自动回退 PyTorch,并非全流程加速 |
| KJNodes #721 评论区(2026-08) | 5060 Ti 上 H3 的省显存 Sage 补丁失败 → 升级到 2.2.0 系可解 |
| woct0rdho releases | Windows 轮子「groundwork」,KJNodes#721 评论区用它(cu130/torch2.10+ 口径)救活 5060 Ti |
→ 这些"轮子"之间互相独立验证了同一结论:Blackwell 上问题出在 Triton 执行路径本身,而不是某一个轮子——与你"去掉 --use-sage-attention 后 100 分钟无故障"的实测一致。
sanjxz README(对 ComfyUI 0.28.0 源码的核实):
comfy/ldm/modules/attention.py 已注册 "sage3" 后端,但 get_attention_function 零调用点、optimized_attention_override 无人写入、--use-sage-attention 无条件路由到 Sage2;sageattention3_blackwell(还需要 ~600MB CUTLASS),stock ComfyUI 也够不到 Sage3,须第三方节点设置 override。TORCH_CUDA_ARCH_LIST 含 12.0),然后不用全局 flag,改在 H3 工作流里用 KJNodes "Patch Sage Attention" 节点指定 sageattn_qk_int8_pv_fp16_cuda(精度也最高);装完先跑短 H3 任务 7 分钟对照。2026-09-06-SageAttention是否导致GPU掉线-核实.md、2026-09-06-SageAttention版本3核实.md(同目录)