Qwen3-Embedding-0.6B Q8_0

GGUF conversion of Qwen/Qwen3-Embedding-0.6B, quantized to Q8_0. Converted with a current llama.cpp convert_hf_to_gguf.py which correctly sets tokenizer.ggml.add_eos_token = true.

  • Quantization: Q8_0
  • Context length: 32,768 tokens
  • Dimensions: 1024
  • License: Apache 2.0
Downloads last month
118
GGUF
Model size
0.6B params
Architecture
qwen3
Hardware compatibility
Log In to add your hardware

8-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for CablepunkPress/Qwen3-Embedding-0.6B-GGUF

Quantized
(250)
this model