YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
Test Model v1
Modello linguistico decoder-only (~134M parametri), architettura stile Llama in miniatura: RoPE, SwiGLU, RMSNorm, scritto da zero in PyTorch.
- Vocab: 32000 token (BPE, italiano + inglese)
- Context length: 1024 token
- Layers: 12, d_model: 768, heads: 12
File in questo repo
model.safetensors: pesi del modelloconfig.json: iperparametri architetturatokenizer.json: tokenizer BPE (formato HuggingFacetokenizers)
Come usarlo
Richiede il codice di architecture.py (definizione del modello) dal repo GitHub del progetto.
Non è compatibile con transformers.AutoModel — è un'architettura custom, non uno dei modelli standard della libreria.
from safetensors.torch import load_file
from architecture import TransformerLM
import json
with open("config.json") as f:
cfg = json.load(f)
model = TransformerLM(
vocab_size=cfg["vocab_size"], d_model=cfg["d_model"], n_layers=cfg["n_layers"],
n_heads=cfg["n_heads"], ffn_hidden=cfg["ffn_hidden"], context_len=cfg["context_len"],
rope_theta=cfg["rope_theta"], rmsnorm_eps=cfg["rmsnorm_eps"], tie_embeddings=cfg["tie_embeddings"],
)
state_dict = load_file("model.safetensors")
model.load_state_dict(state_dict)
Limiti noti
Modello di piccola scala addestrato su risorse consumer (dataset di pre-training limitato, ~1B token). Non affidabile per fatti specifici/enciclopedici, tende a generalizzare verso i pattern più frequenti visti in fine-tuning invece di rispondere in modo mirato a domande fuori dal dominio del dataset SFT.
- Downloads last month
- 14