turkce-bpe-tokenizer

Bu repo, sifirdan (from-scratch) yazdigim bir byte-level BPE (Byte-Pair Encoding) tokenizer'in ciktisini icerir. Egitim ve kod, Karpathy'nin minbpe reposundaki yaklasimi ve HuggingFace LLM Course Chapter 6.5'teki adim adim egitim algoritmasini temel aliyor.

Ozellikler

  • Vocab boyutu: 512 (256 ogrenilmis merge + 256 temel byte)
  • Yontem: Byte-level BPE (GPT-2/GPT-4 tarzi regex on-isleme + byte tabanli temel vocab)
  • Egitim metni: Istanbul'un tarihi uzerine yazdigim ozgun bir Turkce metin
  • Dosyalar:
    • benim_bpe_tokenizerim.model - ogrenilen merge kurallari
    • benim_bpe_tokenizerim.vocab - insan-okunur vocab dokumu

Kullanim

from huggingface_hub import hf_hub_download

model_path = hf_hub_download(repo_id="nursimakgul/turkce-bpe-tokenizer", filename="benim_bpe_tokenizerim.model")

def load_tokenizer(model_path):
    merges = {}
    vocab = {i: bytes([i]) for i in range(256)}
    with open(model_path, "r", encoding="utf-8") as f:
        header = f.readline()
        assert header.strip() == "bpe v1"
        for line in f:
            a, b, idx = map(int, line.split())
            merges[(a, b)] = idx
            vocab[idx] = vocab[a] + vocab[b]
    return merges, vocab

merges, vocab = load_tokenizer(model_path)
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support