Arcus — Magibu AI Türkçe Odaklı Tokenizer

Arcus, Magibu AI Research tarafından Türkçe ve diğer düşük kaynaklı dillerde daha verimli çalışacak modellerin eğitiminde kullanılmak üzere hazırlanmış çok modlu bir BPE tokenizer/processor paketidir.

Bu repo model ağırlıkları içermez. Yalnızca tokenizer, processor, sohbet şablonu ve birleştirilmiş token ID'lerini kaynak tokenizer ID'lerine eşleyen dosyaları içerir.

Temel özellikler

  • Magibu AI kimliğiyle markalanmış, varsayılan yanıt dili Türkçe olan sohbet şablonu
  • Metin, görsel, video, düşünme ve ATEM araç çağırma akışlarıyla uyumlu processor yapısı
  • Kaynak tokenizer'ın ByteLevel (Ġ) gösterimine dönüştürülmüş Magibu BPE söz varlığı
  • Eğitim sırasında embedding aktarımı için merged-to-original-token-ids.json

Birleşim ayrıntıları

Alan Değer
Kaynak hedef tokenizer model söz varlığı 200.000
Magibu kaynak model söz varlığı 65.536
Enjekte edilen yeni token 43.305
Sınır nedeniyle kaldırılan hedef token 0
Son model söz varlığı 243.305
Özel/ek tokenlarla toplam söz varlığı 245.353
Kaynak merge kuralı eklemesi 147.769
Korunan hedef merge kuralı 396.080

Birleştirme işlemi toplam söz varlığını 2^18 token ile sınırlar. Teknik sınıf adları ve özel token protokolü Hugging Face Transformers uyumluluğunu korumak için değiştirilmemiştir.

Kullanım

from transformers import AutoProcessor

processor = AutoProcessor.from_pretrained("magibu/Arcus")
messages = [
    {"role": "user", "content": "Türkçe için verimli tokenizasyon neden önemlidir?"}
]

prompt = processor.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True,
)
print(prompt)

Doğrudan tokenizasyon:

from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("magibu/Arcus")
encoded = tokenizer("Türkçe doğal dil işleme")
print(encoded.input_ids)

Token ID eşlemesi

merged-to-original-token-ids.json, birleştirilmiş tokenizer'daki her ID'yi kaynak hedef tokenizer'daki bir veya daha fazla ID ile eşler. Bu dosya, genişletilmiş söz varlığıyla model eğitimine başlarken embedding'leri kaynak modelden başlatmak için kullanılabilir.

Kaynak ve provenans

Arcus, Magibu AI tarafından geliştirilen 65.536 birimlik BPE söz varlığının meta-models/Muse-Glimmer-30B tokenizer altyapısıyla birleştirilmesiyle hazırlanmıştır. Bu paket Magibu AI tarafından değiştirilmiş ve yeniden markalanmış bir tokenizer/processor dağıtımıdır; kaynak model ağırlıklarını içermez.

Kaynak artifact'ler ve bu dağıtım Apache License 2.0 kapsamındadır. Ayrıntılar için LICENSE ve NOTICE dosyalarına bakın.

Magibu AI Research

Magibu AI, Türkçe ve diğer düşük kaynaklı diller için doğal dil işleme ve yapay zekâ teknolojileri geliştiren, Türkiye merkezli disiplinler arası bir araştırma grubudur.

Türkçe ve düşük kaynaklı diller için yapay zekâyı teoriden gerçek dünya uygulamalarına taşıyoruz.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for magibu/Arcus

Finetuned
(31)
this model

Collection including magibu/Arcus