Biyoloji BPE Tokenizer

Türkçe biyoloji metinleri üzerinde sıfırdan eğitilmiş byte-level BPE tokenizer.

Tokenizer, metni modelin işleyebileceği alt parçalara (token) ayıran bileşendir. Bu tokenizer, HuggingFace tokenizers kütüphanesiyle, biyoloji tanımlarından oluşan bir metin derlemi üzerinde eğitilmiştir.

Özellikler

  • Byte-level BPE
  • Sözlük boyutu: 2000 (256 byte tabanı + ~1740 birleştirme)
  • Eğitim metni: veri setindeki 858 benzersiz tanım
  • Özel tokenlar: <unk>, <pad>, <bos>, <eos>

Sözlük 256'nın üzerinde tutulduğu için model, biyolojide sık geçen ek ve kökleri tek token olarak temsil edebilir.

Kullanım

from transformers import AutoTokenizer

tok = AutoTokenizer.from_pretrained("nyzmemre/biyoloji-bpe-tokenizer")
print(tok.tokenize("fotosentez klorofil sayesinde gerçekleşir"))

Eğitim metni MEB ders kitaplarından derlendiğinden çalışma eğitim/araştırma amaçlıdır.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support