Lyse-336M

Modèle de langage causal (decoder-only) entraîné from scratch.

Architecture

  • 24 couches, d_model=1024, 16 têtes d'attention, feed-forward=4096
  • Contexte : 512 tokens (positions apprises, non extrapolable)
  • ~336M de paramètres, embeddings d'entrée/sortie liés
  • Tokenizer : camembert-base (SentencePiece Unigram, 32005 tokens)

Pré-entraînement

  • Corpus : Wikipédia FR + EN (texte complet, non tronqué)
  • Mixed precision bf16, gradient checkpointing

Contenu de ce dépôt

  • base/causal_transformer.pt — checkpoint base, tokenizer inclus (vocab=32005)

Utilisation

Ce modèle utilise une architecture custom (model.py), pas une classe transformers standard. Pour le charger :

import torch
from transformers import AutoTokenizer
from model import CausalTransformerModel
from config import Config

cfg = Config()
tokenizer = AutoTokenizer.from_pretrained("chemin/vers/le/sous-dossier")
state_dict = torch.load("chemin/vers/le/checkpoint.pt", map_location=cfg.device)
cfg.vocab_size = state_dict["token_emb.weight"].shape[0]

model = CausalTransformerModel(cfg)
model.load_state_dict(state_dict, strict=True)
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support