Estiva 250M PT-BR Base
Modelo base experimental, pré-treinado do zero para continuação de texto em português brasileiro. Não é um modelo instruct/chat e não deve ser usado como assistente, fonte de fatos ou em decisões de alto impacto.
Resumo
- Parâmetros: 250.647.552
- Arquitetura: decoder-only GPT, 18 camadas, dimensão 1024, 16 cabeças de atenção, RoPE, RMSNorm e MLP SwiGLU.
- Contexto máximo: 2.048 tokens.
- Tokenizador: byte-level BPE, vocabulário de 32.768 tokens, normalização NFC.
- Precisão dos pesos publicados: float32. O forward durante o treino usou autocast bfloat16.
- Dados: Corpus Carolina, lido em streaming do Hugging Face; nenhum documento do corpus é distribuído neste repositório.
- Treinamento: 1.000.013.824 tokens, micro-batch 1, acumulação de gradiente 32, BF16, AdamW e scheduler cosseno.
Estado do experimento
Este é o checkpoint final (step=15259). O treino começou com taxa de aprendizado
de 3e-4 e foi continuado, a partir do checkpoint em torno do step 2750, com 1e-4.
Portanto, esta é uma execução híbrida e não uma receita de pré-treinamento já
validada. A validação final sobre 2.000 documentos mantidos fora do treino foi
loss 6,5841 e perplexidade 723,48. Não há avaliação em benchmark independente.
Em testes qualitativos curtos, o modelo produz português parcialmente fluente, mas também apresenta repetições, alucinações factuais e não segue instruções de perguntas e respostas de forma confiável. Use-o para estudo/reprodução, não para produção ou como assistente final.
Conteúdo do repositório
model.safetensors: somente os pesos de inferência, sem estados do otimizador.model_config.json: configuração nativa da arquitetura.training_config.json: configuração do experimento final.tokenizer.json,tokenizer_config.jsonespecial_tokens_map.json: tokenizador congelado.gpt_model.pyegenerate.py: implementação e exemplo de inferência.training_metrics.jsonl: histórico de métricas do treino.SHA256SUMS: checksums dos artefatos distribuídos.
Uso
git clone https://huggingface.co/wilsonramos/estiva-250m-ptbr-base
cd estiva-250m-ptbr-base
pip install "torch>=2.5" "transformers>=4.45" safetensors
python generate.py --prompt "A capital do Brasil é" --max-new-tokens 64 --device cpu
Para CUDA, troque --device cpu por --device cuda. A geração abaixo é gulosa
(sem sampling) para ser reproduzível; qualidade e segurança não foram otimizadas.
Limitações e uso responsável
- Modelo pequeno e subtreinado para o tamanho da arquitetura (cerca de 4 tokens por parâmetro); não tem a capacidade de um LLM comercial/instruct.
- Pode repetir texto, inventar fatos, refletir vieses dos dados e gerar conteúdo inadequado.
- Não houve ajuste de instruções, alinhamento, avaliação de segurança nem avaliação humana.
- O Corpus Carolina é uma agregação de fontes; consulte a documentação do dataset antes de qualquer redistribuição ou uso comercial.
- Nenhuma licença aberta é declarada para estes pesos neste lançamento
experimental (
license: other).
Reprodutibilidade
O projeto de treinamento usa PyTorch, BF16, contexto de 2048 e o tokenizador
incluído. O arquivo training_config.json registra os hiperparâmetros; as
métricas completas ficam em training_metrics.jsonl. O checkpoint publicado é
somente de inferência e não permite retomar o otimizador.
- Downloads last month
- 145