Pocket-LM 269M — base genérica (generica-v1)

Modelo de linguagem de 269M de parâmetros treinado do zero em português do Brasil, sobre um corpus de 12,3 bi de tokens com licença declarada (ODC-By/CC0). É a base "pura" da família Pocket-LM: não viu nenhum dado de tarefa (nome interno corpus-limpo-v1).

Arquitetura GPT decoder-only: 20 camadas, 16 cabeças, n_embd 1024, contexto 512, vocabulário BPE próprio de 16.384 (treinado no corpus pt-BR). Pesos em bf16 safetensors; código de carga em MaxxArtes/pocket-lm-269m (treino/model.py).

Números medidos

métrica valor
CALAME-PT (geração, n=2.076) 53,13
LAMBADA-PT (n=5.153) 36,85
intenção de ações sem SFT 0,0
F1 de ações após SFT 74,52

Referência: supera o Tucano-1b1 em LAMBADA-PT com ~1/4 dos parâmetros. Tabela completa (3 bases × 4 tratamentos de SFT), receitas e constantes medidas: https://github.com/MaxxArtes/pocket-lm-269m

Uso pretendido

Base para SFT/adapters em pt-BR e para rodar offline no celular via GGUF (Q4_K_M ≈ 177 MB, testado em Android com llama.cpp). Sem alinhamento: não usar como assistente sem etapa própria de SFT/segurança.

Downloads last month
-
Safetensors
Model size
0.3B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Collection including Magurofg/pocket-lm-269m-generica