ModernUzTokenizer πŸ‡ΊπŸ‡Ώ

ModernUzTokenizer β€” o'zbek tilidagi matnlar korpusi uchun Byte-Level BPE (Byte-Pair Encoding) algoritmi asosida yaratilgan hamda yuqori samaradorlikka ega tokenizer.


πŸ“Œ Umumiy ma'lumot (Overview)

Tokenizator so'z bo'laklari (subword) asosidagi yondashuv (Byte-Level BPE) yordamida yaratilgan va o'zbek tilidagi matn korpusi asosida o'qitilgan.

  • O'qitish korpusi: Taxminan 15 million gap (β‰ˆ80 million soβ€˜z)
  • Unikal gaplar: Taxminan 68 000 ta takrorlanmaydigan gaplar
  • Lug'at hajmi: 52 000 token

O'zbek tiliga xos xususiyat

Tokenizer maxsus normalizatsiya bosqichidan o'tkazilgan β€” bu o' va g' harflarini (o'zbek tilidagi alohida fonemalar) bitta, ajralmas birlik sifatida saqlab qoladi, ular oddiy apostrof va harfga bo'linib ketmaydi. Masalan, "O'zbekiston" so'zi bitta ma'noli blok sifatida saqlanadi, "O" + "'" + "zbekiston" kabi uchga bo'linib ketmaydi.


πŸ’» Ishlatish (Usage)

Ushbu tokenizerdan transformers kutubxonasi yordamida loyihalaringizda osongina foydalanishingiz mumkin:

from transformers import AutoTokenizer

# Tokenizerni Hugging Face'dan yuklab olish
tokenizer = AutoTokenizer.from_pretrained("Orzumurod/ModernUzTokenizer")

# Matnni tokenizatsiya qilish
text = "O'zbekiston Markaziy Osiyoda joylashgan davlat hisoblanadi."
tokens = tokenizer.tokenize(text)
encoded = tokenizer(text)

print("Tokenlar:", tokens)
print("Input IDs:", encoded['input_ids'])

Maxsus tokenlar

Token ID
[UNK] 0
[CLS] 1
[SEP] 2
[PAD] 3
[MASK] 4

Cheklovlar

  • Faqat lotin alifbosidagi o'zbek matni uchun optimallashtirilgan; kirillcha matn samarali tokenlanmaydi.
  • Standart statistik BPE ishlatilgan β€” morfologik segmentatsiya (masalan qo'shimchalarni alohida ajratish) ta'minlanmagan.

Bog'liq loyiha

Ushbu tokenizer Orzumurod/ModernUzBERT modelini pretraining qilish uchun ishlatiladi (ModernBERT arxitekturasi asosida).

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support