İİK Hukuk BPE Tokenizer
Türk icra ve iflas hukuku metinleri üzerinde sıfırdan eğitilmiş byte-level
BPE tokenizer. Hugging Face tokenizers kütüphanesiyle eğitildi.
Bu çalışma, bir ders ödevi kapsamında hazırlanmıştır ve
malibayram/single_letter_transformers
reposundaki train_hf_tokenizer.py referans alınarak geliştirilmiştir.
Özellikler
| Algoritma | Byte-level BPE (GPT-2 / RoBERTa tarzı) |
| Vocab boyutu | 8.000 |
| Normalizasyon | NFC (Türkçe İ/ı için) |
| Özel tokenlar | <unk>, <pad>, <bos>, <eos> |
| Dil | Türkçe (hukuk alanı) |
| Eğitim verisi | ~41 MB icra-iflas hukuku metni |
Byte-level tabanı sayesinde hiçbir karakter [UNK] olmaz; Türkçe karakterler
(ş, ğ, ı, ö, ü, ç) ve her türlü sembol temsil edilebilir.
Kullanım
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("Mustafa2735/iik-bpe-tokenizer")
metin = "İcra ve İflâs Kanunu m.16 uyarınca şikayet yedi gün içinde yapılır."
ids = tok.encode(metin)
print(len(ids), "token")
print(tok.decode(ids))
Örnek tokenizasyonlar
Alan-özel terimler az sayıda token'a bölünür:
| Metin | Token sayısı |
|---|---|
menfi tespit davası ve müruruzaman |
9 |
Alacaklı, borçlu hakkında haciz yoluyla ilamsız takip başlattı. |
11 |
BPE eğitim sırasında alacaklı, taşınmaz, tasarruf, zamanaşımı,
müdürlüğü gibi hukuk terimlerini denetimsiz olarak öğrenmiştir.
Eğitim verisi ve telif
Tokenizer, Türk icra-iflas hukuku literatüründen derlenen bir metin korpusu üzerinde eğitilmiştir. Kaynak metin telifli olduğundan paylaşılmamıştır; yalnızca eğitilmiş tokenizer yayınlanmıştır.
Bir BPE tokenizer, kaynak metni değil yalnızca birleştirme kurallarını (merge rules) ve bir kelime dağarcığını saklar. Bu nedenle tokenizer'ın yayınlanması, kaynak eserin çoğaltılması veya dağıtılması anlamına gelmez.
Lisans
MIT (tokenizer artefaktı için).