Instructions to use nyzmemre/biyoloji-bpe-tokenizer with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use nyzmemre/biyoloji-bpe-tokenizer with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("nyzmemre/biyoloji-bpe-tokenizer", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Biyoloji BPE Tokenizer
Türkçe biyoloji metinleri üzerinde sıfırdan eğitilmiş byte-level BPE tokenizer.
Tokenizer, metni modelin işleyebileceği alt parçalara (token) ayıran bileşendir. Bu tokenizer, HuggingFace tokenizers kütüphanesiyle, biyoloji tanımlarından oluşan bir metin derlemi üzerinde eğitilmiştir.
Özellikler
- Byte-level BPE
- Sözlük boyutu: 2000 (256 byte tabanı + ~1740 birleştirme)
- Eğitim metni: veri setindeki 858 benzersiz tanım
- Özel tokenlar:
<unk>,<pad>,<bos>,<eos>
Sözlük 256'nın üzerinde tutulduğu için model, biyolojide sık geçen ek ve kökleri tek token olarak temsil edebilir.
Kullanım
from transformers import AutoTokenizer
tok = AutoTokenizer.from_pretrained("nyzmemre/biyoloji-bpe-tokenizer")
print(tok.tokenize("fotosentez klorofil sayesinde gerçekleşir"))
Eğitim metni MEB ders kitaplarından derlendiğinden çalışma eğitim/araştırma amaçlıdır.
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support