Estiva 250M PT-BR Base

Modelo base experimental, pré-treinado do zero para continuação de texto em português brasileiro. Não é um modelo instruct/chat e não deve ser usado como assistente, fonte de fatos ou em decisões de alto impacto.

Resumo

  • Parâmetros: 250.647.552
  • Arquitetura: decoder-only GPT, 18 camadas, dimensão 1024, 16 cabeças de atenção, RoPE, RMSNorm e MLP SwiGLU.
  • Contexto máximo: 2.048 tokens.
  • Tokenizador: byte-level BPE, vocabulário de 32.768 tokens, normalização NFC.
  • Precisão dos pesos publicados: float32. O forward durante o treino usou autocast bfloat16.
  • Dados: Corpus Carolina, lido em streaming do Hugging Face; nenhum documento do corpus é distribuído neste repositório.
  • Treinamento: 1.000.013.824 tokens, micro-batch 1, acumulação de gradiente 32, BF16, AdamW e scheduler cosseno.

Estado do experimento

Este é o checkpoint final (step=15259). O treino começou com taxa de aprendizado de 3e-4 e foi continuado, a partir do checkpoint em torno do step 2750, com 1e-4. Portanto, esta é uma execução híbrida e não uma receita de pré-treinamento já validada. A validação final sobre 2.000 documentos mantidos fora do treino foi loss 6,5841 e perplexidade 723,48. Não há avaliação em benchmark independente.

Em testes qualitativos curtos, o modelo produz português parcialmente fluente, mas também apresenta repetições, alucinações factuais e não segue instruções de perguntas e respostas de forma confiável. Use-o para estudo/reprodução, não para produção ou como assistente final.

Conteúdo do repositório

  • model.safetensors: somente os pesos de inferência, sem estados do otimizador.
  • model_config.json: configuração nativa da arquitetura.
  • training_config.json: configuração do experimento final.
  • tokenizer.json, tokenizer_config.json e special_tokens_map.json: tokenizador congelado.
  • gpt_model.py e generate.py: implementação e exemplo de inferência.
  • training_metrics.jsonl: histórico de métricas do treino.
  • SHA256SUMS: checksums dos artefatos distribuídos.

Uso

git clone https://huggingface.co/wilsonramos/estiva-250m-ptbr-base
cd estiva-250m-ptbr-base
pip install "torch>=2.5" "transformers>=4.45" safetensors
python generate.py --prompt "A capital do Brasil é" --max-new-tokens 64 --device cpu

Para CUDA, troque --device cpu por --device cuda. A geração abaixo é gulosa (sem sampling) para ser reproduzível; qualidade e segurança não foram otimizadas.

Limitações e uso responsável

  • Modelo pequeno e subtreinado para o tamanho da arquitetura (cerca de 4 tokens por parâmetro); não tem a capacidade de um LLM comercial/instruct.
  • Pode repetir texto, inventar fatos, refletir vieses dos dados e gerar conteúdo inadequado.
  • Não houve ajuste de instruções, alinhamento, avaliação de segurança nem avaliação humana.
  • O Corpus Carolina é uma agregação de fontes; consulte a documentação do dataset antes de qualquer redistribuição ou uso comercial.
  • Nenhuma licença aberta é declarada para estes pesos neste lançamento experimental (license: other).

Reprodutibilidade

O projeto de treinamento usa PyTorch, BF16, contexto de 2048 e o tokenizador incluído. O arquivo training_config.json registra os hiperparâmetros; as métricas completas ficam em training_metrics.jsonl. O checkpoint publicado é somente de inferência e não permite retomar o otimizador.

Downloads last month
145
Safetensors
Model size
0.3B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support