Text Generation
Transformers
Safetensors
Turkish
qwen3_5_text
turkish
qwen3.5
qlora
continued-pretraining
sft
conversational

Beyefendi

Beyefendi, Qwen/Qwen3.5-2B üzerinde küçük bir Türkçe Wikipedia continued pretraining (CPT) aşaması ve temizlenmiş Türkçe Aya instruction verisiyle SFT uygulanmış yaklaşık 2B sınıfı bir Türkçe sohbet modelidir. Bu depo, adaptörlerin birleştirildiği BF16 Transformers artefaktını hedefler.

Bu bir araştırma sürümüdür. Olgusal doğruluk, güvenlik veya yüksek riskli alanlarda uzmanlık garantisi vermez.

Model ayrıntıları

  • Mimari: Qwen3_5ForCausalLM
  • Temel model: Qwen/Qwen3.5-2B
  • Çıktı biçimi: birleştirilmiş BF16 safetensors
  • Yerel config context üst sınırı: 262.144 token
  • Eğitimde kullanılan SFT azami uzunluğu: 512 token
  • Final SFT: 1 epoch / 484 adım
  • QLoRA: rank 16, alpha 32, dropout 0,05, all-linear

Config'in yüksek context değeri bu sürümün 262K bağlamda kalite ve bellek bakımından doğrulandığı anlamına gelmez. Ölçümlü kullanım 2K–4K giriş aralığıyla sınırlıdır.

Veri

Aşama Kaynak Sabit revizyon Eğitim kaydı Kaynak lisans beyanı
CPT wikimedia/wikipedia, 20231101.tr b04c8d1ceb2f5cd4588862100d08de323dccfbaa 512 CC-BY-SA-3.0 / GFDL
SFT CohereLabs/aya_dataset, Türkçe train f9ea04583f02a8f86404ff6c58bf75fe637df8a2 3.877 Apache-2.0
Değerlendirme AlicanKiraz0/seneca-trbench fb56da4150b29464637333e71a73dc88022fb327 0 MIT

Aya'nın 250 satırlık Türkçe test bölümü yalnız parmak izi karantinası olarak kullanıldı; test ile eşleşen 39 train satırı çıkarıldı. Final train verisi custom Türkçe set, Seneca ve Wikipedia holdout'a karşı tarandı; otomatik raporlarda eşleşme bulunmadı. Bu sonuç her olası semantik bulaşmayı dışlamaz.

Makale düzeyi Wikipedia atıfları WIKIPEDIA_TRAINING_ATTRIBUTION.jsonl, tam zincir ve dışlanan kaynaklar PROVENANCE.md içindedir.

Eğitim sonuçları

  • Train loss: 2,2441
  • Validation loss: 2,3403
  • Validation mean token accuracy: 0,5237
  • Torch peak allocated: 4,55 GiB
  • Torch peak reserved: 4,86 GiB
  • Eğitim GPU'su: RTX 3090

Bellek sayıları fiziksel 8 GB kartta ölçülmedi; yalnız raporlanan Torch tepe değerinin 8 GiB altında olduğunu gösterir.

Ayrı bir 1-step QLoRA smoke'u RTX 3090 üzerinde 7,5 GiB CUDA ayırıcı tavanıyla tamamlandı: 4.795.192.832 byte (4,47 GiB) peak allocated ve 4.955.570.176 byte (4,62 GiB) peak reserved. Bu olumlu bir bellek kabul sinyalidir; tam eğitim koşusu veya fiziksel 8 GB kart testi değildir.

Değerlendirme

Koşu Kayıt Temel Beyefendi Not
Custom exact match 15 %6,67 %33,33 Birleştirilmiş model, NF4
Custom token F1 15 %19,61 %48,15 Küçük, proje-içi set
Seneca choice accuracy 553 %54,96 %61,83 Final CPT + SFT adapter bileşimi
Wikipedia holdout perplexity 64 11,6653 10,8680 Daha düşük daha iyi

Custom setteki 15 örnek istatistiksel olarak güçlü bir genel kalite iddiası için yeterli değildir. Tam Seneca final koşusu, yayınlanan birleştirilmiş dosya yerine CPT-merged modele final SFT adaptörünü takarak çalıştırıldı. Makinece okunabilir ölçümler ve kaynak rapor karmaları EVALUATION_SUMMARY.json dosyasındadır.

Aynı sınıf rakip durumu

Qwen/Qwen3-1.7B 70d244cc86ccca08cf5af4e1e306ecf908b1ad5e revizyonu, aynı 1–3B parametre sınıfında bağımsız rakip olarak indirilmiş ve dosya checksum'ları doğrulanmıştır. Eşlenik custom15 koşusunda:

Model Exact match Token F1 Kriter token/s Peak VRAM
Qwen3-1.7B %0,00 %12,43 %40,00 15,35 1.425.819.648 byte
Beyefendi merged %33,33 %48,15 %53,33 14,75 1.783.161.344 byte

Beyefendi bu küçük sette daha yüksek görev metrikleri, rakip ise biraz daha yüksek hız ve daha düşük bellek gösterdi. 15 örnek genel veya istatistiksel üstünlük iddiası için yeterli değildir.

Kullanım

Transformers 5.13 veya Qwen3.5 mimarisini destekleyen daha yeni bir sürüm önerilir.

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "Ibrahimsait/Beyefendi"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    device_map="auto",
    dtype="auto",
)

messages = [{"role": "user", "content": "İstanbul'u iki cümlede tanıt."}]
inputs = tokenizer.apply_chat_template(
    messages,
    add_generation_prompt=True,
    return_tensors="pt",
).to(model.device)
outputs = model.generate(inputs, max_new_tokens=96, do_sample=False)
print(tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True))

Depo herkese açıktır ve dosyalar Hugging Face hesabı olmadan indirilebilir. 8 GB sınıfı kartlarda BF16 yerine bitsandbytes NF4 yükleme yolu önerilir. Ollama tarafında F16, Q4_K_M'ye göre tercih edilir; ancak 24 Temmuz 2026'daki ek deterministik olgu kontrolünde F16 da yanlış yanıt verdiği için iki GGUF sürümü de deneysel kabul edilmelidir.

Sınırlamalar

  • Model yanlış, uydurma, güncelliğini yitirmiş veya önyargılı bilgi üretebilir.
  • Tıp, hukuk, finans, güvenlik ve acil durum kararlarında uzman yerine kullanılmamalıdır.
  • Yalnız 3.877 SFT train örneği kullanıldı; alan ve üslup kapsamı dardır.
  • Uzun bağlam, araç kullanımı, RAG, çok turlu güvenlik ve jailbreak dayanımı kapsamlı biçimde test edilmedi.
  • Eğitim verisindeki otomatik PII/kalite filtreleri manuel içerik incelemesinin yerini tutmaz.
  • Upstream Qwen kullanan config'ler 15852e8c16360a2fea060d615a32b45270f8a8fc revizyonuna sabittir ve yerel cache/tokenizer kaydıyla tutarlıdır. Final eğitim özeti bu SHA'yı ayrıca tekrarlamaz.

Lisans ve atıf durumu

Hub metadata'sındaki license: other, lisans kararının açık olduğunu belirtir; kullanıcıya yeni bir lisans hakkı vermez. Qwen temel modeli Apache-2.0'dır ve ilgili metin LICENSE-APACHE-2.0-BASE.txt olarak eklenir. SFT kaynağı Apache-2.0, Wikipedia CPT kaynağı CC-BY-SA-3.0/GFDL soyundadır. Model ağırlıkları için nihai dağıtım şartları ve Wikipedia atıf/share-alike/GFDL etkisi hâlâ incelenmektedir. Public erişim, kullanıcıya bu ağırlıkları yeniden kullanma veya yeniden dağıtma konusunda ek bir lisans hakkı verildiği anlamına gelmez.

Downloads last month
22
Safetensors
Model size
2B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Ibrahimsait/Beyefendi

Finetuned
Qwen/Qwen3.5-2B
Finetuned
(305)
this model

Datasets used to train Ibrahimsait/Beyefendi