Instructions to use MarulAI/Yedikule-202M-Instruct-GGUF with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use MarulAI/Yedikule-202M-Instruct-GGUF with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf MarulAI/Yedikule-202M-Instruct-GGUF:F16 # Run inference directly in the terminal: llama cli -hf MarulAI/Yedikule-202M-Instruct-GGUF:F16
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf MarulAI/Yedikule-202M-Instruct-GGUF:F16 # Run inference directly in the terminal: llama cli -hf MarulAI/Yedikule-202M-Instruct-GGUF:F16
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf MarulAI/Yedikule-202M-Instruct-GGUF:F16 # Run inference directly in the terminal: ./llama-cli -hf MarulAI/Yedikule-202M-Instruct-GGUF:F16
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf MarulAI/Yedikule-202M-Instruct-GGUF:F16 # Run inference directly in the terminal: ./build/bin/llama-cli -hf MarulAI/Yedikule-202M-Instruct-GGUF:F16
Use Docker
docker model run hf.co/MarulAI/Yedikule-202M-Instruct-GGUF:F16
- LM Studio
- Jan
- vLLM
How to use MarulAI/Yedikule-202M-Instruct-GGUF with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "MarulAI/Yedikule-202M-Instruct-GGUF" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "MarulAI/Yedikule-202M-Instruct-GGUF", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/MarulAI/Yedikule-202M-Instruct-GGUF:F16
- Ollama
How to use MarulAI/Yedikule-202M-Instruct-GGUF with Ollama:
ollama run hf.co/MarulAI/Yedikule-202M-Instruct-GGUF:F16
- Unsloth Desktop
- Docker Model Runner
How to use MarulAI/Yedikule-202M-Instruct-GGUF with Docker Model Runner:
docker model run hf.co/MarulAI/Yedikule-202M-Instruct-GGUF:F16
- Lemonade
How to use MarulAI/Yedikule-202M-Instruct-GGUF with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull MarulAI/Yedikule-202M-Instruct-GGUF:F16
Run and chat with the model
lemonade run user.Yedikule-202M-Instruct-GGUF-F16
List all available models
lemonade list
- Atomic Chat
Yedikule 202M Instruct, GGUF sürümü
MarulAI/Yedikule-202M-Instruct modelinin Ollama ve llama.cpp ile doğrudan çalışan GGUF biçimi.
| Dosya | yedikule-sft-f16.gguf |
| Boyut | 406 MB |
| Sayı biçimi | F16 (norm ağırlıkları F32) |
| Niceleme | yok |
| Tensör sayısı | 266 |
| Bağlam | 2048 token |
| Mimari etiketi | qwen3 |
| Lisans | Yedikule Model Lisansı 2.0 |
| Son değişiklik | tokenizer.ggml.pre alanı default yerine gpt-2; ağırlıklar değişmedi (aşağıya bakın) |
Dosya, safetensors sürümüyle neredeyse aynı boyuttadır (404 MB ağırlık, üstüne gömülü sözlük). Q4, Q8 gibi hiçbir niceleme uygulanmamıştır.
Ollama ile kullanım
ollama create yedikule-sft -f Modelfile
ollama run yedikule-sft
Sohbet şablonu, sistem promptu ve örnekleme ayarları Modelfile içinde tanımlıdır.
llama.cpp ile kullanım
llama-cli -m yedikule-sft-f16.gguf -c 2048 --temp 0.3 --top-k 50 --top-p 0.9 --repeat-penalty 1.08
Sohbet şablonu GGUF üstverisine gömülüdür, --jinja ile kullanılabilir.
Sayı biçimi neden F16
Kaynak ağırlıklar bf16. Üç seçenek denendi:
BF16. Bit düzeyinde kayıpsız olurdu ve dosya doğru yazıldı, ancak Ollama'nın llama-server süreci BF16 tensörlü modeli açarken çöküyor (exit 0xc0000409). GPU yerine CPU'ya zorlandığında da aynı hata alındı. Bu sürümde desteklenmiyor.
F32. Bit düzeyinde kayıpsız ve çalışıyor, ama aynı bilgiyi iki katı yer kaplayarak saklıyor (810 MB).
F16. Seçilen biçim. Ağırlıkların yüzde 2.59'u (5.2 milyon değer) F16'nın normal aralığının altında kaldığı için sıfırlanıyor. Bu değerler gürültü seviyesindedir. Ölçmek için ağırlıklar F16'ya yuvarlanıp PyTorch'ta çalıştırıldı: sekiz soruda greedy çıktıların tamamı yuvarlanmamış sürümle birebir aynı çıktı. F16 bir niceleme değil, tam hassasiyetli kayan nokta biçimidir.
Norm ağırlıkları (tek boyutlu tensörler) F32 yazılır. llama.cpp bunları F32 bekler; F16 yazıldığında CUDA tarafındaki hizalama kontrolü başarısız oluyor ve llama-server çöküyor. Bu 40 bin değeri kapsar, dosya boyutuna etkisi yok denecek kadar azdır.
Mimari etiketi neden qwen3
GGUF dosyası hangi hesaplama grafiğiyle çalıştırılacağını general.architecture alanında bildirir. llama.cpp bu ada bakarak grafiği kurar ve tanımadığı bir ad görürse modeli yüklemeyi reddeder.
Yedikule sıfırdan eğitilmiş bağımsız bir modeldir ve başka bir modelden türetilmemiştir. Ancak kullandığı bileşenler (pre-norm RMSNorm, RoPE, SwiGLU, Grouped Query Attention, başlık boyutunda QK-Norm, bağlı gömme, bias yok) bugün yaygın olan bileşenlerdir ve llama.cpp'nin qwen3 hesaplama grafiği bu bileşen kümesiyle birebir uyumludur. Bu yüzden ağırlıklar o grafiğin beklediği tensör adlarına eşlendi ve dosya qwen3 olarak işaretlendi. Hesaplama sırası korundu, hiçbir ağırlık dönüştürülmedi.
Bu yalnızca bir çalıştırma uyumluluğu etiketidir; modelin kökeniyle veya markasıyla ilgisi yoktur. Modelin adı, üreticisi ve açıklaması ayrı üstveri alanlarında Yedikule ve Marul AI olarak kayıtlıdır; ollama list çıktısında ve model kartında Yedikule görünür.
llama.cpp'ye yedikule adında yeni bir mimari eklemek de mümkündü. Bu, C++ kaynağını değiştirip yeniden derlemeyi gerektirir; model yalnızca o özel derlemeyle açılır, standart Ollama kurulumlarında hata verir. Modelin doğrudan indirilip çalıştırılabilmesi daha önemli görüldü.
Ön bölümleyici neden gpt-2
GGUF üstverisindeki tokenizer.ggml.pre alanı, llama.cpp'ye metni BPE
birleştirmelerinden önce hangi düzenli ifadeyle parçalara ayıracağını söyler.
Bu bir marka ya da köken beyanı değildir; general.architecture gibi, yalnızca
bir çalıştırma uyumluluğu seçicisidir. Aynı değeri phi-2, modern-bert ve jina
gibi birbiriyle ilgisiz modeller de kullanır.
Yedikule'nin ön bölümleyicisi ByteLevel(add_prefix_space=False, use_regex=True),
yani GPT-2 düzenli ifadesidir. llama.cpp'de bunun karşılığı gpt-2 değeridir.
Bu alan ilk sürümde default yazılmıştı ve bu bir hataydı. llama.cpp
default değerini uyarı basmadan kabul eder, ancak kendi varsayılan kural
kümesini uygular. O küme, gerçek ön bölümleyicide bulunmayan iki ek rakam kuralı
içerir; sonuç olarak rakamlar modelin eğitimde gördüğünden farklı bölünür:
| metin | doğru | default ile |
|---|---|---|
2026 |
2 token | 3 token |
1 2 3 |
3 token | 5 token |
15 Temmuz 2026 tarihinde saat 09.30'da toplantımız var. |
15 token | 18 token |
Etki yalnızca rakamlarla sınırlı değildi. 586 metinlik bir külliyatta token
kimliği düzeyinde ölçüldüğünde default sürümü metinlerin yalnızca yüzde
51,7'sini modelin gerçek tokenizer'ıyla aynı şekilde bölüyordu. Model eğitimde
hiç görmediği token dizileriyle karşılaştığı için, özellikle sayı içeren
isteklerde tekrar eden bozuk çıktı üretiyordu:
Soru: 2026 yılı kaç gün sürer?
default : 202, 2, 6, 6, 2, 6, 2, 6, 2, 6, 2, 6
gpt-2 : 2026 yılı, 365 gün olarak kabul edilir.
gpt-2 ile aynı külliyatta uyum yüzde 100'dür. Düzeltme yalnızca üstveri
alanını değiştirir; ağırlıklara dokunulmaz.
Kendi dönüştürmenizi yapacaksanız bu alana dikkat edin: convert_hf_to_gguf.py
tokenizer'ın parmak izini tanımadığında sessizce default yazar. Değer tireli
gpt-2 olmalıdır; tiresiz gpt2 yazılırsa llama.cpp unknown pre-tokenizer type diyerek modeli hiç açmaz.
Doğrulama
| Kontrol | Sonuç |
|---|---|
| Tensör sayısı ve şekilleri | 266/266 eşleşti |
| Ağırlık değerleri | beklenen biçimle bit düzeyinde aynı, fark 0.0 |
| Üstveri | mimari, boyutlar, RoPE tabanı, RMS epsilon doğru |
| Sözlük | 48.000 token, 47.728 birleştirme, özel token kimlikleri doğru |
| Tokenizasyon | 586 metinlik külliyatta token kimliği düzeyinde 586/586 (yüzde 100) PyTorch ile aynı |
| İlk üretilen token | 15 soruda 14 birebir aynı |
| Araç çağırma | tools.json'daki 15 aracın örnek sorusu, 3 tohum: 45/45 geçerli çağrı |
Farklılaşan tek soruda ilk iki adayın logit farkı 0.250 idi. Bu genişlikteki bir marjda, llama.cpp ile PyTorch'un farklı toplama sırasından doğan kayan nokta gürültüsü token seçimini değiştirebiliyor. Logit marjı 1.0 üzerindeki tüm sorularda çıktılar birebir örtüştü.
Uzun üretimlerde metinler bir noktadan sonra ayrışabilir; dar marjlı tek bir adımda seçim değişince sonraki tokenler farklı yola girer. Bu her GGUF dönüşümünde görülen normal bir durumdur, ağırlık hatası değildir.
Örnekleme ayarları
Modelfile içindeki değerler:
| Ayar | Değer |
|---|---|
| temperature | 0.3 |
| top_k | 50 |
| top_p | 0.9 |
| min_p | 0.05 |
| repeat_penalty | 1.08 |
| num_ctx | 2048 |
| num_predict | 400 |
| stop | <|im_end|> |
Sohbet şablonu
<|im_start|><|system|>
{sistem}<|im_end|>
<|im_start|><|user|>
{kullanici}<|im_end|>
<|im_start|><|assistant|>
Standart ChatML değildir: rol adı düz metin değil, ayrı bir özel tokendir. Kendi şablonunuzu yazacaksanız bu ayrıntıya dikkat edin ve prompt token sayısını PyTorch tarafıyla karşılaştırarak doğrulayın.
Üretim <|im_end|> (5) tokeninde durur.
Araç çağırma
Model araç çağırmayı biliyor. Eğitimde görülen 15 aracın tamamı, şemaları ve gerçek eğitim örnekleriyle birlikte tools.json dosyasındadır; sistem promptuna nasıl ekleneceği de orada anlatılır.
Model bu 15 araçta belirgin biçimde daha başarılıdır: her araç için eğitimdeki örnek soruyla yapılan 45 denemenin 45'i geçerli çağrı üretti. Görülmemiş şemalarda ürettiği JSON çoğunlukla bozuk çıkar, çünkü şemayı okumak yerine büyük ölçüde isim ile çağrı eşlemesi ezberlemiştir.
Ollama tarafında araç kullanmak için şemaları Modelfile içindeki SYSTEM metninin sonuna tools.json içinde tarif edilen biçimde ekleyin.
Sınırlar
Model 202 milyon parametrelidir. Çok adımlı aritmetik güvenilir değildir, bilgisi 2026 yılına kadardır, internet erişimi yoktur. Güçlü olduğu alan günlük Türkçe sohbet, kısa açıklama, özetleme ve metin düzeltmedir. Ürettiği bilgiyi doğrulamadan kullanmayın.
Eğitim verisi, kaynak lisansları ve ölçüt sonuçları için ana model kartına bakın: MarulAI/Yedikule-202M-Instruct.
Lisans
Yedikule Model Lisansı 2.0. Telif hakkı sahibi Ahmet Karakuş (Marul AI). Bağlayıcı metin LICENSE.md dosyasındadır.
İzin almadan modeli çalıştırabilir, ince ayar yapabilir, niceleyebilir ve sonucu yayımlayabilirsiniz; hepsi ticari olmayan kullanımla sınırlıdır. Atıf yapmanız, türev modelinizin adında Yedikule geçirmeniz ve lisansı birlikte dağıtmanız gerekir.
Türevler de bu lisansa tabidir, kendi lisansınızla yeniden lisanslayamazsınız. Ticari kullanım yazılı izne bağlıdır.
Ticari lisans ve izin talepleri: marulai.resmi@gmail.com (Ahmet Karakuş, Marul AI)
Atıf
Yedikule, 202M parametreli Türkçe dil modeli.
Ahmet Karakuş, Marul AI, 2026.
https://huggingface.co/MarulAI/Yedikule-202M-Instruct-GGUF
- Downloads last month
- 118
16-bit
Model tree for MarulAI/Yedikule-202M-Instruct-GGUF
Base model
MarulAI/Yedikule-202M-Base