Model Özeti
Bu model, büyük dil modellerinin Türkçe metinleri ve özellikle animasyon dünyası (Pixar, DreamWorks, Studio Ghibli vb.) terminolojisini daha verimli okuyabilmesi için eğitilmiş özel bir BPE (Byte-Pair Encoding) Tokenizer modelidir. Magibu Uygulamalı Yapay Zeka Mimarisi eğitimi kapsamında, sıfırdan yapılandırılmış ve spesifik bir alan üzerinde eğitilmiştir.
Model Açıklaması
Standart tokenizer'lar genel verilerle eğitildiği için özel isimlerde ve animasyon terminolojisinde (Örn: "McQueen", "Wall-E", "Hıçkıdık", "Mononoke") gereksiz parçalama hataları yapabilir. Bu BPE Tokenizer, doğrudan animasyon evrenine ait Türkçe detaylı film özetleri ve izleyici yorumları üzerinden eğitilerek bu spesifik terminolojiyi tek parça veya en mantıklı alt-kelime öbekleri halinde tanımak üzere optimize edilmiştir.
- Geliştirici: Melda Kahraman
- Model Türü: Byte-Pair Encoding Tokenizer
- Dil: Türkçe
- Kütüphane: tokenizers, transformers
- Sözlük Boyutu (Vocab Size): 11.557
- Özel Tokenler:
[UNK],[PAD],[CLS],[SEP],[MASK],<|im_start|>,<|im_end|>
Doğrudan Kullanım
Bu tokenizer, meldakahramann/animasyon-domain-dataset veya benzeri Türkçe animasyon/sinema evren veri setleri kullanılarak Unsloth veya Hugging Face Transformers üzerinden fine-tune edilecek temel dil modellerinde metin işleme aracı olarak kullanılmalıdır.
Eğitim Verisi
Tokenizer, tamamen Hugging Face Hub üzerinde bulunan meldakahramann/animasyon-domain-dataset veri seti kaynak alınarak eğitilmiştir. Bu veri setindeki detaylı olay örgüleri, seslendirme kadroları, yapım stüdyoları bilgileri ve organik izleyici/eleştirmen yorumları eğitim derlemi olarak kullanılmıştır.
Eğitim Prosedürü
Model, Hugging Face tokenizers kütüphanesindeki BpeTrainer kullanılarak eğitilmiştir. Eğitim sırasında modele bilinmeyen kelimeler için [UNK] ve doldurma işlemleri için [PAD] gibi özel token'lar ile reasoning modellerinin aradığı sohbet şablonu belirteçleri (<|im_start|>, <|im_end|>) tanımlanmıştır.
Tokenizar'ı kullanmak
Tokenizer'ı projenizde kullanmak için aşağıdaki Python kodunu çalıştırabilirsiniz:
from tokenizers import Tokenizer
from huggingface_hub import hf_hub_download
# Tokenizer dosyasını Hugging Face deposundan otomatik indirme
tokenizer_path = hf_hub_download(repo_id="meldakahramann/animasyon-bpe-tokenizer", filename="tokenizer.json")
# Tokenizer'ı indirdiğimiz dosya üzerinden yükleme
tokenizer = Tokenizer.from_file(tokenizer_path)
# Örnek bir kullanıcı sorusu
ornek_soru = "Buz Devri filminin konusu nedir?"
# Metni token'larına ayırma ve encode etme
output = tokenizer.encode(ornek_soru)
# Çıktıları ekrana yazdırma
print("Tokenlar:", output.tokens)
print("Token ID'leri:", output.ids)