Ce modèle est un mini-Transformer de 50 Millions de paramètres utilisant une architecture Mixture of Experts (MoE) avec un routage Top-1. Chaque jeton n'active qu'un seul expert parmi 4 à chaque couche, permettant d'avoir la rapidité d'exécution d'un modèle ultra-léger tout en conservant une grande capacité d'apprentissage.

Performances

  • Loss Moyenne Globale : 2.6492
  • Perplexité Finale (PPL) : 14.14
  • Contexte : 256 tokens

Architecture

  • Couches : 5
  • Têtes d'attention : 8
  • Experts par couche : 4
  • Dimension du modèle : 512
  • Taille du vocabulaire : 16 000 (BPE Tokenizer)
Downloads last month
-
Safetensors
Model size
53.2M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Datasets used to train abdi38394/Pyce-MoE-50M-Code