İİK Hukuk BPE Tokenizer

Türk icra ve iflas hukuku metinleri üzerinde sıfırdan eğitilmiş byte-level BPE tokenizer. Hugging Face tokenizers kütüphanesiyle eğitildi.

Bu çalışma, bir ders ödevi kapsamında hazırlanmıştır ve malibayram/single_letter_transformers reposundaki train_hf_tokenizer.py referans alınarak geliştirilmiştir.

Özellikler

Algoritma Byte-level BPE (GPT-2 / RoBERTa tarzı)
Vocab boyutu 8.000
Normalizasyon NFC (Türkçe İ/ı için)
Özel tokenlar <unk>, <pad>, <bos>, <eos>
Dil Türkçe (hukuk alanı)
Eğitim verisi ~41 MB icra-iflas hukuku metni

Byte-level tabanı sayesinde hiçbir karakter [UNK] olmaz; Türkçe karakterler (ş, ğ, ı, ö, ü, ç) ve her türlü sembol temsil edilebilir.

Kullanım

from transformers import AutoTokenizer

tok = AutoTokenizer.from_pretrained("Mustafa2735/iik-bpe-tokenizer")

metin = "İcra ve İflâs Kanunu m.16 uyarınca şikayet yedi gün içinde yapılır."
ids = tok.encode(metin)
print(len(ids), "token")
print(tok.decode(ids))

Örnek tokenizasyonlar

Alan-özel terimler az sayıda token'a bölünür:

Metin Token sayısı
menfi tespit davası ve müruruzaman 9
Alacaklı, borçlu hakkında haciz yoluyla ilamsız takip başlattı. 11

BPE eğitim sırasında alacaklı, taşınmaz, tasarruf, zamanaşımı, müdürlüğü gibi hukuk terimlerini denetimsiz olarak öğrenmiştir.

Eğitim verisi ve telif

Tokenizer, Türk icra-iflas hukuku literatüründen derlenen bir metin korpusu üzerinde eğitilmiştir. Kaynak metin telifli olduğundan paylaşılmamıştır; yalnızca eğitilmiş tokenizer yayınlanmıştır.

Bir BPE tokenizer, kaynak metni değil yalnızca birleştirme kurallarını (merge rules) ve bir kelime dağarcığını saklar. Bu nedenle tokenizer'ın yayınlanması, kaynak eserin çoğaltılması veya dağıtılması anlamına gelmez.

Lisans

MIT (tokenizer artefaktı için).

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support