FLUX.2-klein-base-9B β€” OpenVINO INT4

OpenVINO IR (INT4) conversion of the FLUX.2-klein 9B base architecture (rectified-flow transformer + Qwen3 text encoder + VAE). Source weights: community full-pipeline mirror (official BFL repo is license-gated); architecture verified standard diffusers layout before conversion.

Why OpenVINO?

  • Runs on any CPU with no CUDA/NVIDIA dependency, plus GPU acceleration where available (AMD, Nvidia, Intel) β€” no vendor-locked passes used
  • Transformer is 4.9GB INT4 β€” the per-inference hot path fits 8GB VRAM cards

Deployment note (8GB cards)

Total repo is 9.1GB because the Qwen3 text encoder (8.5B params) has a ~4.1GB INT4 floor. Standard practice, reflected in the usage below: keep the transformer on GPU, text encoder + VAE on CPU. The text encoder runs once per prompt, so this costs no per-step speed.

Conversion

Parameter Value
Tool optimum-cli export openvino --weight-format int4 --group-size 64 --all-layers (device-neutral)
Precision INT4 transformer + text encoder, FP topologies otherwise
Verified transformer, text_encoder, vae_encoder, vae_decoder all load in ov.Core on Kaggle GPU

Usage (any device)

import openvino as ov
core = ov.Core()
# Hot path on GPU, one-shot modules on CPU:
trafo = core.compile_model(core.read_model("transformer/openvino_model.xml"), "GPU")
te = core.compile_model(core.read_model("text_encoder/openvino_model.xml"), "CPU")
vae = core.compile_model(core.read_model("vae_decoder/openvino_model.xml"), "CPU")
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support