Echoes-1

Echoes-1-Base

LLM de 536M de parâmetros pré-treinado 100% do zero em português brasileiro — tokenizer próprio, corpus próprio, pipeline de treino próprio em JAX, tudo na TPU v5e-8 gratuita do Kaggle. Nenhum peso de terceiros foi usado em momento algum.

Este é o modelo base (não segue instruções). A versão de chat, com o tom de fórum BR anos 2000, já saiu: Echoes-1-Instruct.

Detalhes

Parâmetros 536,5M (embeddings amarrados)
Arquitetura Qwen3 (GQA 10Q/2KV, head_dim 128, QK-norm)
Camadas / hidden 28 / 1280
Vocabulário 32.000 (BPE próprio, treinado no corpus pt-BR)
Contexto 1024 (RoPE θ=1M, posições até 4096)
Tokens de treino 17.187.749.888
Precisão bf16
Hardware TPU v5e-8 (Kaggle), sessões de fim de semana
Framework JAX + optax + orbax, pipeline próprio com ZeRO-1

O corpus é todo em pt-BR e inclui, entre outras coisas, fóruns brasileiros dos anos 2000 (Orkut, Adrenaline, HardMOB) — a alma do modelo. A fase final do treino (14,4B → 17,2B tokens) foi um annealing com LR 1e-5 → 1e-6 e ~1% de dados em formato de conversa.

Tokens especiais

<pad>=0, <unk>=1, <s>=2, </s>=3, <doc>=4

Uso

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

tok = AutoTokenizer.from_pretrained("henriqueimoveis/Echoes-1-Base")
model = AutoModelForCausalLM.from_pretrained("henriqueimoveis/Echoes-1-Base", dtype=torch.bfloat16).cuda()

prompt = "A história dos fóruns brasileiros começou"
ids = tok(prompt, return_tensors="pt").to("cuda")
out = model.generate(**ids, max_new_tokens=200, do_sample=True, temperature=0.7, top_p=0.9)
print(tok.decode(out[0], skip_special_tokens=True))

Limitações

  • É um modelo de 536M com 17B tokens: alucina fatos com confiança total. Não use como fonte de informação.
  • Só viu português. Em outra língua ele vai tentar, e vai ser constrangedor.
  • Modelo base: complete texto com ele; pra conversar, use o Echoes-1-Instruct.

Por quê?

Porque todo mundo dizia pra desistir e fazer QLoRA num modelo pronto. Flame à vontade.

Downloads last month
77
Safetensors
Model size
0.5B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for henriqueimoveis/Echoes-1-Base-PT-BR

Quantizations
1 model