WARMIND-200M V2
Prévia técnica experimental em português. Este checkpoint ainda pode produzir informações incorretas, respostas incompletas e alucinações. Não use a saída para decisões médicas, jurídicas, financeiras ou de segurança sem revisão humana qualificada.
O WARMIND-200M V2 é um modelo de linguagem causal compacto, desenvolvido pela WAR Enterprise para pesquisa de geração em português e inferência local. A versão publicada é um artefato de pesquisa, não um assistente de produção.
Destaques
- 203.263.872 parâmetros
- 1.000.013.824 tokens processados na campanha de pré-treinamento V2
- 23.751.277 tokens supervisionados processados no ajuste SFT V2
- contexto operacional de 1.024 tokens
- vocabulário SentencePiece de 24.576 tokens
- pesos em
safetensorsFP32 - execução local em CPU; CUDA também é aceita pelo script de exemplo
- idioma principal: português
Arquitetura
| Componente | Valor |
|---|---|
| Tipo | Transformer decoder causal |
| Camadas | 20 |
| Dimensão do modelo | 896 |
| Cabeças de atenção | 14 |
| Cabeças KV | 2 |
| Atenção | Grouped-Query Attention (GQA) |
| Dimensão da FFN | 2.688 |
| Ativação | SwiGLU |
| Normalização | RMSNorm |
| Posicionamento | RoPE, theta 10.000 |
| Contexto treinado/operacional | 1.024 tokens |
| Contexto estendido suportado pelo código | até 2.048 tokens, não homologado como contexto de treino |
Treinamento
O checkpoint foi treinado em uma NVIDIA H100 80 GB HBM3 usando BF16. A campanha V2 registrou 1.000.013.824 tokens de pré-treinamento e o ajuste supervisionado encerrou no passo 1.200. A perda de validação SFT registrada caiu de 2,1085 no passo 100 para 1,8038 no passo 1.200.
Dados e proveniência
O pré-treinamento usou uma amostra em português de epfml/FineWeb2-HQ (por_Latn), sob ODC-By-1.0 e sujeita também aos termos do Common Crawl. A preparação registrou aproximadamente 93,6% de conteúdo geral, 5,0% jurídico e 1,4% técnico.
O SFT combinou conversas em português de HuggingFaceTB/smoltalk2, dados OpenAssistant/oasst2 filtrados e exemplos próprios da WAR Enterprise. Os subconjuntos utilizados e as respectivas atribuições estão resumidos em NOTICE.md.
Essas fontes podem conter erros, vieses, informações pessoais públicas ou conteúdo sintético. O treinamento não transforma o modelo em fonte factual confiável.
Instalação
Requer Python 3.12 e pelo menos 8 GB de RAM para uma experiência local confortável.
python -m venv .venv
python -m pip install -r requirements.txt
No Windows, depois de ativar o ambiente virtual:
python generate_local.py --prompt "Defina fotossíntese em uma frase." --maximum-new-tokens 96
No Linux ou macOS:
python generate_local.py --prompt "Defina fotossíntese em uma frase." --maximum-new-tokens 96
Parâmetros recomendados para geração concisa:
python generate_local.py \
--prompt "Explique em duas frases o que é inteligência artificial." \
--temperature 0.2 \
--top-k 20 \
--top-p 0.9 \
--repetition-penalty 1.12 \
--maximum-new-tokens 160
Chat local experimental
chat_calibrate.py acrescenta memória curta, busca em arquivos locais, calculadora determinística e consulta opcional à Wikipédia/Wikidata. Esse orquestrador não altera os pesos e não representa acesso ao “pensamento interno” do Transformer.
python chat_calibrate.py
A consulta online envia o texto da pergunta às APIs públicas correspondentes quando está ligada. Use /online off para manter a sessão offline.
Avaliação e estado de maturidade
O pacote registra EXPERIMENTAL_NOT_DEMO_READY e AWAITING_HUMAN_REVIEW. Em testes manuais, a V2 demonstrou melhora forte sobre o primeiro checkpoint, mas ainda apresentou:
- alucinações de fatos, nomes, números e identidades;
- repetição e deriva de assunto em respostas longas;
- falhas em seguir limites de extensão;
- respostas plausíveis, porém incorretas;
- sensibilidade aos parâmetros de amostragem.
Por isso, a publicação deve ser tratada como prévia técnica para pesquisa, aprendizado e reprodução local, não como benchmark de estado da arte.
Usos pretendidos
- pesquisa com modelos compactos em português;
- estudo de inferência local em CPU;
- experimentos de geração de texto com revisão humana;
- prototipagem educacional e comparação de técnicas de pós-processamento.
Usos não recomendados
- decisões automatizadas ou de alto impacto;
- aconselhamento médico, jurídico ou financeiro;
- conteúdo factual sem verificação externa;
- moderação, vigilância ou classificação de pessoas;
- qualquer aplicação que dependa de segurança, precisão ou disponibilidade garantidas.
Integridade
Os hashes SHA-256 estão em SHA256SUMS. O hash esperado de model.safetensors é:
42218dacd46c7a3d244856e664442822e002312bf871a57181379d9026a61045
Roteiro
A WAR Enterprise pretende investigar uma próxima geração na faixa de 500 milhões de parâmetros e uma campanha de aproximadamente 15 bilhões de tokens. Isso é um objetivo de pesquisa, não uma promessa de lançamento.
Citação
@software{warmind200mv2_2026,
title = {WARMIND-200M V2},
author = {WAR Enterprise},
year = {2026},
note = {Prévia técnica experimental de modelo de linguagem em português}
}
- Downloads last month
- -