krea2-nvfp4-rig
Startfertiges Setup, um Krea 2 Turbo in NVFP4 auf einer gemieteten
Blackwell-Karte (RTX 50xx) zu testen β mit dem ilore-Style-LoRA.
Zweck: messen, wie viel NVFP4 gegenueber FP8 bringt und ob das LoRA die 4-Bit-Quantisierung unbeschadet uebersteht.
Was hier liegt
| Pfad | Inhalt |
|---|---|
lora/ilore_style_krea2_1000.safetensors |
Style-LoRA, Checkpoint 1000 (empfohlen) |
lora/ilore_style_krea2_1250.safetensors |
Checkpoint 1250, zum Gegenvergleich |
scripts/setup.sh |
Installiert ComfyUI + comfy-kitchen, laedt Modelle, startet Server |
scripts/download_models.py |
Parallel-Download aller Komponenten von HF |
scripts/bench.py |
Misst NVFP4 vs FP8, je mit/ohne LoRA |
scripts/onstart.sh |
Einstiegspunkt fuer das vast.ai-Template |
workflows/krea2_nvfp4_ilore.json |
ComfyUI-Workflow mit LoRA-Node |
Die Modelle liegen bewusst nicht hier. Sie kommen direkt von
Comfy-Org/Krea-2 β das ist von der Instanz aus um Groessenordnungen
schneller als ein Upload von zuhause.
| Komponente | Groesse |
|---|---|
krea2_turbo_nvfp4.safetensors |
7,67 GB |
qwen3vl_4b_fp8_scaled.safetensors |
5,24 GB |
qwen_image_vae.safetensors |
0,25 GB |
(Vergleichsvariante krea2_turbo_fp8_scaled) |
13,14 GB |
Der NVFP4-Stack braucht 13,16 GB und passt damit komplett in die 16 GB einer 5080. Der FP8-Stack (18,63 GB) tut das nicht.
Voraussetzungen an die Instanz
- Blackwell-GPU (RTX 50xx / RTX PRO) β NVFP4 laeuft auf nichts anderem
- CUDA 13.0+ β
comfy-kitchensetzt das fuer die NVFP4-Kernel voraus - mind. 60 GB Disk
Token
Dieses Repo ist privat, die Instanz braucht also einen Lesezugriff.
Kein Account-weiter Token β auf HuggingFace unter Settings β Access Tokens
einen fine-grained Token anlegen, der nur Read auf genau dieses
Repository darf. Faellt die Mietinstanz in falsche Haende, ist der Schaden
damit auf ein LoRA begrenzt.
Im vast-Template unter Environment als HF_TOKEN hinterlegen.
Ablauf
Automatisch ueber onstart.sh, oder von Hand:
export HF_TOKEN=hf_...
bash scripts/setup.sh # laeuft bis ComfyUI auf :8188 lauscht
Danach den Web-Port der Instanz oeffnen (vast zeigt ihn unter Open an) und
workflows/krea2_nvfp4_ilore.json in die Oberflaeche ziehen.
Messung:
python scripts/bench.py --runs 5 --size 1024x1024
python scripts/bench.py --runs 5 --size 680x1024 # Portrait-Format
Sampler-Werte
Krea 2 Turbo ist distilliert: 8 Steps, CFG 1,0, er_sde / simple.
Der Negativ-Zweig laeuft ueber ConditioningZeroOut β ein echter
Negativprompt hat hier keine Wirkung.
Was gegengeprueft werden muss
Ob das LoRA in NVFP4 identisch wirkt, ist nicht belegt. Die Quelle bestaetigt nur, dass LoRAs vom Raw-Basismodell gut auf Turbo uebertragen. Also: dieselben Motive mit gleichem Seed in FP8 und NVFP4 erzeugen und nebeneinanderlegen β besonders auf die Pinselstruktur und das Ausfransen des Torsos achten, das sind die Merkmale, die dieses LoRA ausmachen.