WARMIND-200M V2

Prévia técnica experimental em português. Este checkpoint ainda pode produzir informações incorretas, respostas incompletas e alucinações. Não use a saída para decisões médicas, jurídicas, financeiras ou de segurança sem revisão humana qualificada.

O WARMIND-200M V2 é um modelo de linguagem causal compacto, desenvolvido pela WAR Enterprise para pesquisa de geração em português e inferência local. A versão publicada é um artefato de pesquisa, não um assistente de produção.

Destaques

  • 203.263.872 parâmetros
  • 1.000.013.824 tokens processados na campanha de pré-treinamento V2
  • 23.751.277 tokens supervisionados processados no ajuste SFT V2
  • contexto operacional de 1.024 tokens
  • vocabulário SentencePiece de 24.576 tokens
  • pesos em safetensors FP32
  • execução local em CPU; CUDA também é aceita pelo script de exemplo
  • idioma principal: português

Arquitetura

Componente Valor
Tipo Transformer decoder causal
Camadas 20
Dimensão do modelo 896
Cabeças de atenção 14
Cabeças KV 2
Atenção Grouped-Query Attention (GQA)
Dimensão da FFN 2.688
Ativação SwiGLU
Normalização RMSNorm
Posicionamento RoPE, theta 10.000
Contexto treinado/operacional 1.024 tokens
Contexto estendido suportado pelo código até 2.048 tokens, não homologado como contexto de treino

Treinamento

O checkpoint foi treinado em uma NVIDIA H100 80 GB HBM3 usando BF16. A campanha V2 registrou 1.000.013.824 tokens de pré-treinamento e o ajuste supervisionado encerrou no passo 1.200. A perda de validação SFT registrada caiu de 2,1085 no passo 100 para 1,8038 no passo 1.200.

Dados e proveniência

O pré-treinamento usou uma amostra em português de epfml/FineWeb2-HQ (por_Latn), sob ODC-By-1.0 e sujeita também aos termos do Common Crawl. A preparação registrou aproximadamente 93,6% de conteúdo geral, 5,0% jurídico e 1,4% técnico.

O SFT combinou conversas em português de HuggingFaceTB/smoltalk2, dados OpenAssistant/oasst2 filtrados e exemplos próprios da WAR Enterprise. Os subconjuntos utilizados e as respectivas atribuições estão resumidos em NOTICE.md.

Essas fontes podem conter erros, vieses, informações pessoais públicas ou conteúdo sintético. O treinamento não transforma o modelo em fonte factual confiável.

Instalação

Requer Python 3.12 e pelo menos 8 GB de RAM para uma experiência local confortável.

python -m venv .venv
python -m pip install -r requirements.txt

No Windows, depois de ativar o ambiente virtual:

python generate_local.py --prompt "Defina fotossíntese em uma frase." --maximum-new-tokens 96

No Linux ou macOS:

python generate_local.py --prompt "Defina fotossíntese em uma frase." --maximum-new-tokens 96

Parâmetros recomendados para geração concisa:

python generate_local.py \
  --prompt "Explique em duas frases o que é inteligência artificial." \
  --temperature 0.2 \
  --top-k 20 \
  --top-p 0.9 \
  --repetition-penalty 1.12 \
  --maximum-new-tokens 160

Chat local experimental

chat_calibrate.py acrescenta memória curta, busca em arquivos locais, calculadora determinística e consulta opcional à Wikipédia/Wikidata. Esse orquestrador não altera os pesos e não representa acesso ao “pensamento interno” do Transformer.

python chat_calibrate.py

A consulta online envia o texto da pergunta às APIs públicas correspondentes quando está ligada. Use /online off para manter a sessão offline.

Avaliação e estado de maturidade

O pacote registra EXPERIMENTAL_NOT_DEMO_READY e AWAITING_HUMAN_REVIEW. Em testes manuais, a V2 demonstrou melhora forte sobre o primeiro checkpoint, mas ainda apresentou:

  • alucinações de fatos, nomes, números e identidades;
  • repetição e deriva de assunto em respostas longas;
  • falhas em seguir limites de extensão;
  • respostas plausíveis, porém incorretas;
  • sensibilidade aos parâmetros de amostragem.

Por isso, a publicação deve ser tratada como prévia técnica para pesquisa, aprendizado e reprodução local, não como benchmark de estado da arte.

Usos pretendidos

  • pesquisa com modelos compactos em português;
  • estudo de inferência local em CPU;
  • experimentos de geração de texto com revisão humana;
  • prototipagem educacional e comparação de técnicas de pós-processamento.

Usos não recomendados

  • decisões automatizadas ou de alto impacto;
  • aconselhamento médico, jurídico ou financeiro;
  • conteúdo factual sem verificação externa;
  • moderação, vigilância ou classificação de pessoas;
  • qualquer aplicação que dependa de segurança, precisão ou disponibilidade garantidas.

Integridade

Os hashes SHA-256 estão em SHA256SUMS. O hash esperado de model.safetensors é:

42218dacd46c7a3d244856e664442822e002312bf871a57181379d9026a61045

Roteiro

A WAR Enterprise pretende investigar uma próxima geração na faixa de 500 milhões de parâmetros e uma campanha de aproximadamente 15 bilhões de tokens. Isso é um objetivo de pesquisa, não uma promessa de lançamento.

Citação

@software{warmind200mv2_2026,
  title        = {WARMIND-200M V2},
  author       = {WAR Enterprise},
  year         = {2026},
  note         = {Prévia técnica experimental de modelo de linguagem em português}
}
Downloads last month
-
Safetensors
Model size
0.2B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support