Milo X1 (fine-tuned)
Modelo de lenguaje Transformer autoregresivo en español, entrenado completamente desde cero (sin pesos preentrenados, arquitectura propia con RoPE + atención causal + SwiGLU + RMSNorm).
- Parámetros: ~3.56M
- d_model: 160 | capas: 4 | heads: 4
- context_length: 320
- Vocabulario: 6000 tokens (BPE byte-level, librería
tokenizers)
Archivos
model.safetensors: pesos del modeloconfig.json: hiperparámetros de arquitectura (para reconstruirMiloX1)tokenizer.json: tokenizer BPE byte-level (formato nativo de la libreríatokenizers)
- Downloads last month
- -
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support