Lyse-336M
Modèle de langage causal (decoder-only) entraîné from scratch.
Architecture
- 24 couches, d_model=1024, 16 têtes d'attention, feed-forward=4096
- Contexte : 512 tokens (positions apprises, non extrapolable)
- ~336M de paramètres, embeddings d'entrée/sortie liés
- Tokenizer : camembert-base (SentencePiece Unigram, 32005 tokens)
Pré-entraînement
- Corpus : Wikipédia FR + EN (texte complet, non tronqué)
- Mixed precision bf16, gradient checkpointing
Contenu de ce dépôt
base/causal_transformer.pt— checkpoint base, tokenizer inclus (vocab=32005)
Utilisation
Ce modèle utilise une architecture custom (model.py), pas une classe
transformers standard. Pour le charger :
import torch
from transformers import AutoTokenizer
from model import CausalTransformerModel
from config import Config
cfg = Config()
tokenizer = AutoTokenizer.from_pretrained("chemin/vers/le/sous-dossier")
state_dict = torch.load("chemin/vers/le/checkpoint.pt", map_location=cfg.device)
cfg.vocab_size = state_dict["token_emb.weight"].shape[0]
model = CausalTransformerModel(cfg)
model.load_state_dict(state_dict, strict=True)
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support