Pocket-LM 269M — base genérica (generica-v1)
Modelo de linguagem de 269M de parâmetros treinado do zero em português do Brasil,
sobre um corpus de 12,3 bi de tokens com licença declarada (ODC-By/CC0). É a base
"pura" da família Pocket-LM: não viu nenhum dado de tarefa (nome interno corpus-limpo-v1).
Arquitetura GPT decoder-only: 20 camadas, 16 cabeças, n_embd 1024, contexto 512,
vocabulário BPE próprio de 16.384 (treinado no corpus pt-BR). Pesos em bf16 safetensors;
código de carga em MaxxArtes/pocket-lm-269m
(treino/model.py).
Números medidos
| métrica | valor |
|---|---|
| CALAME-PT (geração, n=2.076) | 53,13 |
| LAMBADA-PT (n=5.153) | 36,85 |
| intenção de ações sem SFT | 0,0 |
| F1 de ações após SFT | 74,52 |
Referência: supera o Tucano-1b1 em LAMBADA-PT com ~1/4 dos parâmetros. Tabela completa (3 bases × 4 tratamentos de SFT), receitas e constantes medidas: https://github.com/MaxxArtes/pocket-lm-269m
Uso pretendido
Base para SFT/adapters em pt-BR e para rodar offline no celular via GGUF (Q4_K_M ≈ 177 MB, testado em Android com llama.cpp). Sem alinhamento: não usar como assistente sem etapa própria de SFT/segurança.
- Downloads last month
- -