FLUX.2-klein-base-4B โ€” OpenVINO INT8

OpenVINO IR (INT8) conversion of black-forest-labs/FLUX.2-klein-base-4B (4B rectified-flow transformer + text encoder + VAE). Standard diffusers layout verified before conversion.

Why OpenVINO?

  • Runs on any CPU with no CUDA/NVIDIA dependency, plus GPU acceleration where available (AMD, Nvidia, Intel) โ€” no vendor-locked passes used
  • Full pipeline is ~8GB, deployable on 8GB VRAM cards

Deployment note (8GB cards)

Transformer (~3.9GB INT8) runs on GPU; the text encoder runs once per prompt and can sit on CPU via AUTO/explicit device placement, leaving comfortable headroom on 8GB cards.

Conversion

Parameter Value
Tool optimum-cli export openvino --weight-format int8 --all-layers (device-neutral)
Precision INT8
Source black-forest-labs/FLUX.2-klein-base-4B
Verified transformer, text_encoder, vae_encoder, vae_decoder all load in ov.Core on Kaggle GPU

Usage (any device)

import openvino as ov
core = ov.Core()
compiled = core.compile_model(core.read_model("transformer/openvino_model.xml"), "AUTO")
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support