Instructions to use magibu/Nimbus with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use magibu/Nimbus with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("magibu/Nimbus", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Nimbus — Magibu AI Türkçe Odaklı Tokenizer
Nimbus, Magibu AI Research tarafından Türkçe ve diğer düşük kaynaklı dillerde daha verimli çalışacak modellerin eğitiminde kullanılmak üzere hazırlanmış çok modlu bir BPE tokenizer/processor paketidir.
Bu repo model ağırlıkları içermez. Yalnızca tokenizer, processor, sohbet şablonu ve birleştirilmiş token ID'lerini kaynak tokenizer ID'lerine eşleyen dosyaları içerir.
Temel özellikler
- Magibu AI kimliğiyle markalanmış, varsayılan yanıt dili Türkçe olan sohbet şablonu
- Metin, görsel, video, düşünme ve araç çağırma akışlarıyla uyumlu processor yapısı
- Kaynak tokenizer'ın ByteLevel (
Ġ) gösterimine dönüştürülmüş Magibu BPE söz varlığı - Eğitim sırasında embedding aktarımı için
merged-to-original-token-ids.json
Birleşim ayrıntıları
| Alan | Değer |
|---|---|
| Kaynak hedef tokenizer model söz varlığı | 248.044 |
| Magibu kaynak model söz varlığı | 65.536 |
| Enjekte edilen yeni token | 44.670 |
| Sınır nedeniyle kaldırılan hedef token | 30.603 |
| Son model söz varlığı | 262.111 |
| Özel/ek tokenlarla toplam söz varlığı | 262.144 |
| Kaynak merge kuralı eklemesi | 147.768 |
| Korunan hedef merge kuralı | 198.581 |
Birleştirme işlemi toplam söz varlığını 2^18 token ile sınırlar. Teknik sınıf adları ve özel token protokolü Hugging Face Transformers uyumluluğunu korumak için değiştirilmemiştir.
Kullanım
from transformers import AutoProcessor
processor = AutoProcessor.from_pretrained("magibu/Nimbus")
messages = [
{"role": "user", "content": "Türkçe için verimli tokenizasyon neden önemlidir?"}
]
prompt = processor.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True,
)
print(prompt)
Doğrudan tokenizasyon:
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("magibu/Nimbus")
encoded = tokenizer("Türkçe doğal dil işleme")
print(encoded.input_ids)
Token ID eşlemesi
merged-to-original-token-ids.json, birleştirilmiş tokenizer'daki her ID'yi kaynak hedef tokenizer'daki bir veya daha fazla ID ile eşler. Bu dosya, genişletilmiş söz varlığıyla model eğitimine başlarken embedding'leri kaynak modelden başlatmak için kullanılabilir.
Kaynak ve provenans
Nimbus, Magibu AI tarafından geliştirilen 65.536 birimlik BPE söz varlığının Qwen/Qwen3.8-27B tokenizer altyapısıyla birleştirilmesiyle hazırlanmıştır. Bu paket Magibu AI tarafından değiştirilmiş ve yeniden markalanmış bir tokenizer/processor dağıtımıdır; kaynak model ağırlıklarını içermez.
Kaynak artifact'ler ve bu dağıtım Apache License 2.0 kapsamındadır. Ayrıntılar için LICENSE ve NOTICE dosyalarına bakın.
Magibu AI Research
Magibu AI, Türkçe ve diğer düşük kaynaklı diller için doğal dil işleme ve yapay zekâ teknolojileri geliştiren, Türkiye merkezli disiplinler arası bir araştırma grubudur.
- Web: magibu.ai
- Hugging Face: huggingface.co/magibu
- E-posta: info@magibu.ai
Türkçe ve düşük kaynaklı diller için yapay zekâyı teoriden gerçek dünya uygulamalarına taşıyoruz.
Model tree for magibu/Nimbus
Base model
Qwen/Qwen3.8-27B