Model Özeti

Bu model, büyük dil modellerinin Türkçe metinleri ve özellikle animasyon dünyası (Pixar, DreamWorks, Studio Ghibli vb.) terminolojisini daha verimli okuyabilmesi için eğitilmiş özel bir BPE (Byte-Pair Encoding) Tokenizer modelidir.   Magibu Uygulamalı Yapay Zeka Mimarisi eğitimi kapsamında, sıfırdan yapılandırılmış ve spesifik bir alan üzerinde eğitilmiştir.

Model Açıklaması

Standart tokenizer'lar genel verilerle eğitildiği için özel isimlerde ve animasyon terminolojisinde (Örn: "McQueen", "Wall-E", "Hıçkıdık", "Mononoke") gereksiz parçalama hataları yapabilir. Bu BPE Tokenizer, doğrudan animasyon evrenine ait Türkçe detaylı film özetleri ve izleyici yorumları üzerinden eğitilerek bu spesifik terminolojiyi tek parça veya en mantıklı alt-kelime öbekleri halinde tanımak üzere optimize edilmiştir.

  • Geliştirici: Melda Kahraman
  • Model Türü: Byte-Pair Encoding Tokenizer
  • Dil: Türkçe
  • Kütüphane: tokenizers, transformers
  • Sözlük Boyutu (Vocab Size): 11.557
  • Özel Tokenler: [UNK], [PAD], [CLS], [SEP], [MASK], <|im_start|>, <|im_end|>

Doğrudan Kullanım

Bu tokenizer, meldakahramann/animasyon-domain-dataset veya benzeri Türkçe animasyon/sinema evren veri setleri kullanılarak Unsloth veya Hugging Face Transformers üzerinden fine-tune edilecek temel dil modellerinde metin işleme aracı olarak kullanılmalıdır.

Eğitim Verisi

Tokenizer, tamamen Hugging Face Hub üzerinde bulunan meldakahramann/animasyon-domain-dataset veri seti kaynak alınarak eğitilmiştir. Bu veri setindeki detaylı olay örgüleri, seslendirme kadroları, yapım stüdyoları bilgileri ve organik izleyici/eleştirmen yorumları eğitim derlemi olarak kullanılmıştır.

Eğitim Prosedürü

Model, Hugging Face tokenizers kütüphanesindeki BpeTrainer kullanılarak eğitilmiştir. Eğitim sırasında modele bilinmeyen kelimeler için [UNK] ve doldurma işlemleri için [PAD] gibi özel token'lar ile reasoning modellerinin aradığı sohbet şablonu belirteçleri (<|im_start|>, <|im_end|>) tanımlanmıştır.

Tokenizar'ı kullanmak

Tokenizer'ı projenizde kullanmak için aşağıdaki Python kodunu çalıştırabilirsiniz:

from tokenizers import Tokenizer
from huggingface_hub import hf_hub_download

# Tokenizer dosyasını Hugging Face deposundan otomatik indirme
tokenizer_path = hf_hub_download(repo_id="meldakahramann/animasyon-bpe-tokenizer", filename="tokenizer.json")

# Tokenizer'ı indirdiğimiz dosya üzerinden yükleme
tokenizer = Tokenizer.from_file(tokenizer_path)

# Örnek bir kullanıcı sorusu
ornek_soru = "Buz Devri filminin konusu nedir?"

# Metni token'larına ayırma ve encode etme
output = tokenizer.encode(ornek_soru)

# Çıktıları ekrana yazdırma
print("Tokenlar:", output.tokens)
print("Token ID'leri:", output.ids)
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support