Yedikule 202M Instruct, GGUF sürümü

MarulAI/Yedikule-202M-Instruct modelinin Ollama ve llama.cpp ile doğrudan çalışan GGUF biçimi.

Dosya yedikule-sft-f16.gguf
Boyut 406 MB
Sayı biçimi F16 (norm ağırlıkları F32)
Niceleme yok
Tensör sayısı 266
Bağlam 2048 token
Mimari etiketi qwen3
Lisans Yedikule Model Lisansı 2.0
Son değişiklik tokenizer.ggml.pre alanı default yerine gpt-2; ağırlıklar değişmedi (aşağıya bakın)

Dosya, safetensors sürümüyle neredeyse aynı boyuttadır (404 MB ağırlık, üstüne gömülü sözlük). Q4, Q8 gibi hiçbir niceleme uygulanmamıştır.

Ollama ile kullanım

ollama create yedikule-sft -f Modelfile
ollama run yedikule-sft

Sohbet şablonu, sistem promptu ve örnekleme ayarları Modelfile içinde tanımlıdır.

llama.cpp ile kullanım

llama-cli -m yedikule-sft-f16.gguf -c 2048 --temp 0.3 --top-k 50 --top-p 0.9 --repeat-penalty 1.08

Sohbet şablonu GGUF üstverisine gömülüdür, --jinja ile kullanılabilir.

Sayı biçimi neden F16

Kaynak ağırlıklar bf16. Üç seçenek denendi:

BF16. Bit düzeyinde kayıpsız olurdu ve dosya doğru yazıldı, ancak Ollama'nın llama-server süreci BF16 tensörlü modeli açarken çöküyor (exit 0xc0000409). GPU yerine CPU'ya zorlandığında da aynı hata alındı. Bu sürümde desteklenmiyor.

F32. Bit düzeyinde kayıpsız ve çalışıyor, ama aynı bilgiyi iki katı yer kaplayarak saklıyor (810 MB).

F16. Seçilen biçim. Ağırlıkların yüzde 2.59'u (5.2 milyon değer) F16'nın normal aralığının altında kaldığı için sıfırlanıyor. Bu değerler gürültü seviyesindedir. Ölçmek için ağırlıklar F16'ya yuvarlanıp PyTorch'ta çalıştırıldı: sekiz soruda greedy çıktıların tamamı yuvarlanmamış sürümle birebir aynı çıktı. F16 bir niceleme değil, tam hassasiyetli kayan nokta biçimidir.

Norm ağırlıkları (tek boyutlu tensörler) F32 yazılır. llama.cpp bunları F32 bekler; F16 yazıldığında CUDA tarafındaki hizalama kontrolü başarısız oluyor ve llama-server çöküyor. Bu 40 bin değeri kapsar, dosya boyutuna etkisi yok denecek kadar azdır.

Mimari etiketi neden qwen3

GGUF dosyası hangi hesaplama grafiğiyle çalıştırılacağını general.architecture alanında bildirir. llama.cpp bu ada bakarak grafiği kurar ve tanımadığı bir ad görürse modeli yüklemeyi reddeder.

Yedikule sıfırdan eğitilmiş bağımsız bir modeldir ve başka bir modelden türetilmemiştir. Ancak kullandığı bileşenler (pre-norm RMSNorm, RoPE, SwiGLU, Grouped Query Attention, başlık boyutunda QK-Norm, bağlı gömme, bias yok) bugün yaygın olan bileşenlerdir ve llama.cpp'nin qwen3 hesaplama grafiği bu bileşen kümesiyle birebir uyumludur. Bu yüzden ağırlıklar o grafiğin beklediği tensör adlarına eşlendi ve dosya qwen3 olarak işaretlendi. Hesaplama sırası korundu, hiçbir ağırlık dönüştürülmedi.

Bu yalnızca bir çalıştırma uyumluluğu etiketidir; modelin kökeniyle veya markasıyla ilgisi yoktur. Modelin adı, üreticisi ve açıklaması ayrı üstveri alanlarında Yedikule ve Marul AI olarak kayıtlıdır; ollama list çıktısında ve model kartında Yedikule görünür.

llama.cpp'ye yedikule adında yeni bir mimari eklemek de mümkündü. Bu, C++ kaynağını değiştirip yeniden derlemeyi gerektirir; model yalnızca o özel derlemeyle açılır, standart Ollama kurulumlarında hata verir. Modelin doğrudan indirilip çalıştırılabilmesi daha önemli görüldü.

Ön bölümleyici neden gpt-2

GGUF üstverisindeki tokenizer.ggml.pre alanı, llama.cpp'ye metni BPE birleştirmelerinden önce hangi düzenli ifadeyle parçalara ayıracağını söyler. Bu bir marka ya da köken beyanı değildir; general.architecture gibi, yalnızca bir çalıştırma uyumluluğu seçicisidir. Aynı değeri phi-2, modern-bert ve jina gibi birbiriyle ilgisiz modeller de kullanır.

Yedikule'nin ön bölümleyicisi ByteLevel(add_prefix_space=False, use_regex=True), yani GPT-2 düzenli ifadesidir. llama.cpp'de bunun karşılığı gpt-2 değeridir.

Bu alan ilk sürümde default yazılmıştı ve bu bir hataydı. llama.cpp default değerini uyarı basmadan kabul eder, ancak kendi varsayılan kural kümesini uygular. O küme, gerçek ön bölümleyicide bulunmayan iki ek rakam kuralı içerir; sonuç olarak rakamlar modelin eğitimde gördüğünden farklı bölünür:

metin doğru default ile
2026 2 token 3 token
1 2 3 3 token 5 token
15 Temmuz 2026 tarihinde saat 09.30'da toplantımız var. 15 token 18 token

Etki yalnızca rakamlarla sınırlı değildi. 586 metinlik bir külliyatta token kimliği düzeyinde ölçüldüğünde default sürümü metinlerin yalnızca yüzde 51,7'sini modelin gerçek tokenizer'ıyla aynı şekilde bölüyordu. Model eğitimde hiç görmediği token dizileriyle karşılaştığı için, özellikle sayı içeren isteklerde tekrar eden bozuk çıktı üretiyordu:

Soru: 2026 yılı kaç gün sürer?
default : 202, 2, 6, 6, 2, 6, 2, 6, 2, 6, 2, 6
gpt-2   : 2026 yılı, 365 gün olarak kabul edilir.

gpt-2 ile aynı külliyatta uyum yüzde 100'dür. Düzeltme yalnızca üstveri alanını değiştirir; ağırlıklara dokunulmaz.

Kendi dönüştürmenizi yapacaksanız bu alana dikkat edin: convert_hf_to_gguf.py tokenizer'ın parmak izini tanımadığında sessizce default yazar. Değer tireli gpt-2 olmalıdır; tiresiz gpt2 yazılırsa llama.cpp unknown pre-tokenizer type diyerek modeli hiç açmaz.

Doğrulama

Kontrol Sonuç
Tensör sayısı ve şekilleri 266/266 eşleşti
Ağırlık değerleri beklenen biçimle bit düzeyinde aynı, fark 0.0
Üstveri mimari, boyutlar, RoPE tabanı, RMS epsilon doğru
Sözlük 48.000 token, 47.728 birleştirme, özel token kimlikleri doğru
Tokenizasyon 586 metinlik külliyatta token kimliği düzeyinde 586/586 (yüzde 100) PyTorch ile aynı
İlk üretilen token 15 soruda 14 birebir aynı
Araç çağırma tools.json'daki 15 aracın örnek sorusu, 3 tohum: 45/45 geçerli çağrı

Farklılaşan tek soruda ilk iki adayın logit farkı 0.250 idi. Bu genişlikteki bir marjda, llama.cpp ile PyTorch'un farklı toplama sırasından doğan kayan nokta gürültüsü token seçimini değiştirebiliyor. Logit marjı 1.0 üzerindeki tüm sorularda çıktılar birebir örtüştü.

Uzun üretimlerde metinler bir noktadan sonra ayrışabilir; dar marjlı tek bir adımda seçim değişince sonraki tokenler farklı yola girer. Bu her GGUF dönüşümünde görülen normal bir durumdur, ağırlık hatası değildir.

Örnekleme ayarları

Modelfile içindeki değerler:

Ayar Değer
temperature 0.3
top_k 50
top_p 0.9
min_p 0.05
repeat_penalty 1.08
num_ctx 2048
num_predict 400
stop <|im_end|>

Sohbet şablonu

<|im_start|><|system|>
{sistem}<|im_end|>
<|im_start|><|user|>
{kullanici}<|im_end|>
<|im_start|><|assistant|>

Standart ChatML değildir: rol adı düz metin değil, ayrı bir özel tokendir. Kendi şablonunuzu yazacaksanız bu ayrıntıya dikkat edin ve prompt token sayısını PyTorch tarafıyla karşılaştırarak doğrulayın.

Üretim <|im_end|> (5) tokeninde durur.

Araç çağırma

Model araç çağırmayı biliyor. Eğitimde görülen 15 aracın tamamı, şemaları ve gerçek eğitim örnekleriyle birlikte tools.json dosyasındadır; sistem promptuna nasıl ekleneceği de orada anlatılır.

Model bu 15 araçta belirgin biçimde daha başarılıdır: her araç için eğitimdeki örnek soruyla yapılan 45 denemenin 45'i geçerli çağrı üretti. Görülmemiş şemalarda ürettiği JSON çoğunlukla bozuk çıkar, çünkü şemayı okumak yerine büyük ölçüde isim ile çağrı eşlemesi ezberlemiştir.

Ollama tarafında araç kullanmak için şemaları Modelfile içindeki SYSTEM metninin sonuna tools.json içinde tarif edilen biçimde ekleyin.

Sınırlar

Model 202 milyon parametrelidir. Çok adımlı aritmetik güvenilir değildir, bilgisi 2026 yılına kadardır, internet erişimi yoktur. Güçlü olduğu alan günlük Türkçe sohbet, kısa açıklama, özetleme ve metin düzeltmedir. Ürettiği bilgiyi doğrulamadan kullanmayın.

Eğitim verisi, kaynak lisansları ve ölçüt sonuçları için ana model kartına bakın: MarulAI/Yedikule-202M-Instruct.

Lisans

Yedikule Model Lisansı 2.0. Telif hakkı sahibi Ahmet Karakuş (Marul AI). Bağlayıcı metin LICENSE.md dosyasındadır.

İzin almadan modeli çalıştırabilir, ince ayar yapabilir, niceleyebilir ve sonucu yayımlayabilirsiniz; hepsi ticari olmayan kullanımla sınırlıdır. Atıf yapmanız, türev modelinizin adında Yedikule geçirmeniz ve lisansı birlikte dağıtmanız gerekir.

Türevler de bu lisansa tabidir, kendi lisansınızla yeniden lisanslayamazsınız. Ticari kullanım yazılı izne bağlıdır.

Ticari lisans ve izin talepleri: marulai.resmi@gmail.com (Ahmet Karakuş, Marul AI)

Atıf

Yedikule, 202M parametreli Türkçe dil modeli.
Ahmet Karakuş, Marul AI, 2026.
https://huggingface.co/MarulAI/Yedikule-202M-Instruct-GGUF
Downloads last month
118
GGUF
Model size
0.2B params
Architecture
qwen3
Hardware compatibility
Log In to add your hardware

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for MarulAI/Yedikule-202M-Instruct-GGUF

Quantized
(1)
this model

Collection including MarulAI/Yedikule-202M-Instruct-GGUF