Pocket-LM 269M — LM brasileiro para rodar no celular

Modelo de linguagem decoder de 269M de parâmetros, treinado do zero em português, feito para rodar offline em celulares de entrada (169 MB em Q4_K_M, ~15 tok/s num Helio G36, 80 tok/s medidos num Dimensity 9500s via llama.cpp).

Nenhum peso de terceiros: outras IAs participaram apenas como professoras (geração e filtragem de dados), nunca como fonte de pesos.

Resultados (05/08/2026)

benchmark Pocket-LM 269M referência
LAMBADA-PT (n=5.153) 36,85 1º entre modelos <1,2B em pt (Tucano-1b1: 34,70 com 250B tokens)
CALAME-PT (n=2.076) 53,13 3º, acima de Bloom-1b1 e GlórIA-1b3 (4× o tamanho)
IFEval-pt (n=308) 39,61 sem nenhum treino de instrução
MultiBLiMP (gramática) 96,3% acaso: 50%

Total de treino: 25,4 bilhões de tokens — 10× menos que o comparável mais próximo. Avaliação pareada por item; detalhes e réguas no repositório do projeto.

Linhagem de dados (transparência)

  • Última fase (12,3B tokens): 100% corpus com licença declarada — finepdfs (ODC-By), FineWeb2-HQ (ODC-By), HPLT 2.0 (CC0) — deduplicado globalmente, com shards de validação segregados.
  • Fases anteriores (13,1B tokens): Common Crawl filtrado (ClassiCC-PT, sem licença explícita no cartão), Wikipédia-PT (CC-BY-SA) e sintético permissivo (Apache-2.0).
  • Ou seja: a última rodada é integralmente licenciada; a linhagem completa dos pesos inclui uma fase anterior de licença indefinida. Um retreino do zero 100% limpo está no roteiro.

Limitações honestas

  • Não é chat. É modelo base: completa texto. Para uso, dê começos de frase ou acople a um fluxo de instrução.
  • Não sabe recusar: medimos que julgamento de respondibilidade não se forma neste porte (três controles independentes; artigo a caminho). Não use para QA factual sem camada de verificação.
  • Conhecimento de mundo limitado pelo porte: erra fatos com confiança.
  • Contexto de 512 tokens.

Uso rápido (llama.cpp)

llama-cli -m pocket-lm-269m-q4_k_m.gguf -p "O Brasil é um país" -n 50 -t 4

Atribuições de dados

finepdfs e FineWeb2-HQ (HuggingFaceFW/epfml, ODC-By 1.0) · HPLT 2.0 (CC0) · Wikipédia-PT (CC-BY-SA 3.0) · gigaverbo-v2-synth (Apache-2.0) · ClassiCC-PT (citado; sem licença declarada) · avaliações: CALAME-PT, LAMBADA-PT (TucanoBR), MASSIVE (CC-BY-4.0).

Downloads last month
-
GGUF
Model size
0.3B params
Architecture
gpt2
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support