YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
SageAttention — prebuilt Linux wheel
Собрано на поде RunPod, чтобы не ждать компиляцию на каждом новом поде.
| Компонент | Версия |
|---|---|
| SageAttention | 2.2.0 (commit d1a57a5, ветка main) |
| PyTorch | 2.10.0 |
| CUDA | 13.0 |
| Python | cp312 |
| Архитектуры | 8.0;8.6;8.9;9.0 |
| Платформа | linux x86_64 |
Установка
pip install https://huggingface.co/whitmoree530/BC/resolve/main/sageattention-2.2.0+cu130torch2.10.0sm80.86.89.90-cp312-cp312-linux_x86_64.whl
Совместимость
Мажор CUDA обязан совпадать (12 против 13), минор — не важен.
Версия torch должна совпадать до минорной, если колесо собрано с ветки
main; сборка с abi3_stable переживает любой torch >= 2.10.
Колесо содержит ядра только для перечисленных выше архитектур — на других
картах импорт пройдёт, а первый вызов упадёт или даст чёрный кадр.
Проверка после установки
import torch
from sageattention import sageattn
q, k, v = (torch.randn(1, 8, 512, 128, dtype=torch.float16, device="cuda") for _ in range(3))
out = sageattn(q, k, v, tensor_layout="HND", is_causal=False)
ref = torch.nn.functional.scaled_dot_product_attention(q, k, v)
print(torch.isfinite(out).all().item(), (out - ref).abs().max().item())
В ComfyUI
Не флагом --use-sage-attention (он поднимает Triton-бэкенд, на части
моделей даёт чёрный кадр), а нодой Patch Sage Attention KJ из KJNodes,
backend sageattn_qk_int8_pv_fp16_cuda.
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support