ModernUzTokenizer πΊπΏ
ModernUzTokenizer β o'zbek tilidagi matnlar korpusi uchun Byte-Level BPE (Byte-Pair Encoding) algoritmi asosida yaratilgan hamda yuqori samaradorlikka ega tokenizer.
π Umumiy ma'lumot (Overview)
Tokenizator so'z bo'laklari (subword) asosidagi yondashuv (Byte-Level BPE) yordamida yaratilgan va o'zbek tilidagi matn korpusi asosida o'qitilgan.
- O'qitish korpusi: Taxminan 15 million gap (β80 million soβz)
- Unikal gaplar: Taxminan 68 000 ta takrorlanmaydigan gaplar
- Lug'at hajmi: 52 000 token
O'zbek tiliga xos xususiyat
Tokenizer maxsus normalizatsiya bosqichidan o'tkazilgan β bu o' va g' harflarini (o'zbek tilidagi alohida fonemalar) bitta, ajralmas birlik sifatida saqlab qoladi, ular oddiy apostrof va harfga bo'linib ketmaydi. Masalan, "O'zbekiston" so'zi bitta ma'noli blok sifatida saqlanadi, "O" + "'" + "zbekiston" kabi uchga bo'linib ketmaydi.
π» Ishlatish (Usage)
Ushbu tokenizerdan transformers kutubxonasi yordamida loyihalaringizda osongina foydalanishingiz mumkin:
from transformers import AutoTokenizer
# Tokenizerni Hugging Face'dan yuklab olish
tokenizer = AutoTokenizer.from_pretrained("Orzumurod/ModernUzTokenizer")
# Matnni tokenizatsiya qilish
text = "O'zbekiston Markaziy Osiyoda joylashgan davlat hisoblanadi."
tokens = tokenizer.tokenize(text)
encoded = tokenizer(text)
print("Tokenlar:", tokens)
print("Input IDs:", encoded['input_ids'])
Maxsus tokenlar
| Token | ID |
|---|---|
[UNK] |
0 |
[CLS] |
1 |
[SEP] |
2 |
[PAD] |
3 |
[MASK] |
4 |
Cheklovlar
- Faqat lotin alifbosidagi o'zbek matni uchun optimallashtirilgan; kirillcha matn samarali tokenlanmaydi.
- Standart statistik BPE ishlatilgan β morfologik segmentatsiya (masalan qo'shimchalarni alohida ajratish) ta'minlanmagan.
Bog'liq loyiha
Ushbu tokenizer Orzumurod/ModernUzBERT modelini pretraining qilish uchun ishlatiladi (ModernBERT arxitekturasi asosida).