YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

Test Model v1

Modello linguistico decoder-only (~134M parametri), architettura stile Llama in miniatura: RoPE, SwiGLU, RMSNorm, scritto da zero in PyTorch.

  • Vocab: 32000 token (BPE, italiano + inglese)
  • Context length: 1024 token
  • Layers: 12, d_model: 768, heads: 12

File in questo repo

  • model.safetensors: pesi del modello
  • config.json: iperparametri architettura
  • tokenizer.json: tokenizer BPE (formato HuggingFace tokenizers)

Come usarlo

Richiede il codice di architecture.py (definizione del modello) dal repo GitHub del progetto. Non è compatibile con transformers.AutoModel — è un'architettura custom, non uno dei modelli standard della libreria.

from safetensors.torch import load_file
from architecture import TransformerLM
import json

with open("config.json") as f:
    cfg = json.load(f)

model = TransformerLM(
    vocab_size=cfg["vocab_size"], d_model=cfg["d_model"], n_layers=cfg["n_layers"],
    n_heads=cfg["n_heads"], ffn_hidden=cfg["ffn_hidden"], context_len=cfg["context_len"],
    rope_theta=cfg["rope_theta"], rmsnorm_eps=cfg["rmsnorm_eps"], tie_embeddings=cfg["tie_embeddings"],
)
state_dict = load_file("model.safetensors")
model.load_state_dict(state_dict)

Limiti noti

Modello di piccola scala addestrato su risorse consumer (dataset di pre-training limitato, ~1B token). Non affidabile per fatti specifici/enciclopedici, tende a generalizzare verso i pattern più frequenti visti in fine-tuning invece di rispondere in modo mirato a domande fuori dal dominio del dataset SFT.

Downloads last month
14
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support