Türkçe BPE Tokenizer
Türkçe Wikipedia'dan (resmi MediaWiki API üzerinden, action=query&generator=random) toplanan bir korpus üzerinde eğitilmiş BPE (Byte-Pair Encoding) tokenizer.
Eğitim Detayları
- Yöntem: BPE (Hugging Face
tokenizerskütüphanesi) - Pre-tokenizer: Whitespace
- Hedef vocab boyutu: 256.000
- Gerçekleşen vocab boyutu: 78.431 (korpus boyutu hedefe göre daha küçük kaldığı için trainer daha düşük bir vocab'da yakınsadı)
- Özel tokenlar:
[UNK],[PAD],[BOS],[EOS] - Korpus kaynağı: tr.wikipedia.org resmi API, rastgele makaleler (
grnnamespace=0, düz metinexplaintext=1)
Kullanım
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("eraycancelik/BPE-tokenizer")
ids = tokenizer("merhaba dünya")
print(ids)
Bilinen Sınırlamalar
- Vocab boyutu, korpusun küçüklüğü nedeniyle hedeflenen 256K'nın oldukça altında kaldı; daha büyük/çeşitli bir korpusla yeniden eğitim, alt-kelime parçalanma kalitesini artırabilir.
Whitespacepre-tokenizer + eksik bir decoder yapılandırması nedeniyle decode edilen metinde kelime-içi ekstra boşluklar görülebilir (örn. "merhaba" → "mer ha ba"); üretim kullanımından önceByteLevelveyaMetaspacetipi bir pre-tokenizer/decoder ile yeniden değerlendirilmesi önerilir.
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support