Erk-32B — GGUF

Erk-32B modelinin llama.cpp uyumlu nicemlenmiş sürümleri. Ana model kartındaki bütün ölçümler ve protokol buradaki dosyalar için de geçerlidir; nicemlemenin bedeli aşağıda ölçülmüştür.

Dosya Nicem Boyut NLL, BF16'ya göre Kimlik (6 soru) Önerilen
Erk-32B-Q8_0.gguf Q8_0 34,8 GB +%0,04 6/6 kalite öncelikliyse
Erk-32B-Q4_K_M.gguf Q4_K_M 19,8 GB +%0,85 6/6 24 GB GPU / 32 GB RAM

NLL, 6.132 belirteçlik Türkçe metinde ortalama negatif log-olasılık; BF16 GGUF referansı 1,5185. Kimlik, sohbet şablonundaki varsayılan sistem istemiyle altı soruda (tuzak sorular dahil) ölçüldü.

Kimlik istemi şablonun içinde

Sohbet şablonu, kullanıcı sistem mesajı vermezse varsayılan kimlik istemini ekler; kendi sistem mesajınızı verirseniz varsayılan devreye girmez. İstem, taban modeli (Qwen3-32B) açıkça söyler.

Kullanım

# llama.cpp
llama-cli -m Erk-32B-Q4_K_M.gguf -cnv -p "" \
  --temp 0.6 --top-p 0.95 -c 8192

# Ollama
cat > Modelfile <<EOF
FROM ./Erk-32B-Q4_K_M.gguf
PARAMETER temperature 0.6
EOF
ollama create erk-32b -f Modelfile && ollama run erk-32b

Qwen3 hibrit düşünme modu korunur; kapatmak için mesajın sonuna /no_think ekleyin.

Üretim

convert_hf_to_gguf.py (llama.cpp, sürüm llama_cpp_surum.txt'de) ile birleşik ağırlıktan BF16 GGUF, ardından llama_model_quantize (llama-cpp-python 0.3.35) ile Q8_0 ve Q4_K_M. Betik: ana depoda betikler/gguf_uret.py.

Lisans Apache 2.0. İletişim: info@e-cloud.web.tr

Downloads last month
-
GGUF
Model size
33B params
Architecture
qwen3
Hardware compatibility
Log In to add your hardware

4-bit

8-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ecloudtech/Erk-32B-GGUF

Base model

Qwen/Qwen3-32B
Quantized
(1)
this model