Milo X1 (fine-tuned)

Modelo de lenguaje Transformer autoregresivo en español, entrenado completamente desde cero (sin pesos preentrenados, arquitectura propia con RoPE + atención causal + SwiGLU + RMSNorm).

  • Parámetros: ~3.56M
  • d_model: 160 | capas: 4 | heads: 4
  • context_length: 320
  • Vocabulario: 6000 tokens (BPE byte-level, librería tokenizers)

Archivos

  • model.safetensors: pesos del modelo
  • config.json: hiperparámetros de arquitectura (para reconstruir MiloX1)
  • tokenizer.json: tokenizer BPE byte-level (formato nativo de la librería tokenizers)
Downloads last month
-
Safetensors
Model size
3.56M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Space using blackdaqlabs/MiloX1 1