Instructions to use henriqueimoveis/Echoes-1-Base-PT-BR with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use henriqueimoveis/Echoes-1-Base-PT-BR with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="henriqueimoveis/Echoes-1-Base-PT-BR")# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("henriqueimoveis/Echoes-1-Base-PT-BR") model = AutoModelForCausalLM.from_pretrained("henriqueimoveis/Echoes-1-Base-PT-BR", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use henriqueimoveis/Echoes-1-Base-PT-BR with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "henriqueimoveis/Echoes-1-Base-PT-BR" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "henriqueimoveis/Echoes-1-Base-PT-BR", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/henriqueimoveis/Echoes-1-Base-PT-BR
- SGLang
How to use henriqueimoveis/Echoes-1-Base-PT-BR with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "henriqueimoveis/Echoes-1-Base-PT-BR" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "henriqueimoveis/Echoes-1-Base-PT-BR", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "henriqueimoveis/Echoes-1-Base-PT-BR" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "henriqueimoveis/Echoes-1-Base-PT-BR", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use henriqueimoveis/Echoes-1-Base-PT-BR with Docker Model Runner:
docker model run hf.co/henriqueimoveis/Echoes-1-Base-PT-BR
Echoes-1-Base
LLM de 536M de parâmetros pré-treinado 100% do zero em português brasileiro — tokenizer próprio, corpus próprio, pipeline de treino próprio em JAX, tudo na TPU v5e-8 gratuita do Kaggle. Nenhum peso de terceiros foi usado em momento algum.
Este é o modelo base (não segue instruções). A versão de chat, com o tom de fórum BR anos 2000, já saiu: Echoes-1-Instruct.
Detalhes
| Parâmetros | 536,5M (embeddings amarrados) |
| Arquitetura | Qwen3 (GQA 10Q/2KV, head_dim 128, QK-norm) |
| Camadas / hidden | 28 / 1280 |
| Vocabulário | 32.000 (BPE próprio, treinado no corpus pt-BR) |
| Contexto | 1024 (RoPE θ=1M, posições até 4096) |
| Tokens de treino | 17.187.749.888 |
| Precisão | bf16 |
| Hardware | TPU v5e-8 (Kaggle), sessões de fim de semana |
| Framework | JAX + optax + orbax, pipeline próprio com ZeRO-1 |
O corpus é todo em pt-BR e inclui, entre outras coisas, fóruns brasileiros dos anos 2000 (Orkut, Adrenaline, HardMOB) — a alma do modelo. A fase final do treino (14,4B → 17,2B tokens) foi um annealing com LR 1e-5 → 1e-6 e ~1% de dados em formato de conversa.
Tokens especiais
<pad>=0, <unk>=1, <s>=2, </s>=3, <doc>=4
Uso
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
tok = AutoTokenizer.from_pretrained("henriqueimoveis/Echoes-1-Base")
model = AutoModelForCausalLM.from_pretrained("henriqueimoveis/Echoes-1-Base", dtype=torch.bfloat16).cuda()
prompt = "A história dos fóruns brasileiros começou"
ids = tok(prompt, return_tensors="pt").to("cuda")
out = model.generate(**ids, max_new_tokens=200, do_sample=True, temperature=0.7, top_p=0.9)
print(tok.decode(out[0], skip_special_tokens=True))
Limitações
- É um modelo de 536M com 17B tokens: alucina fatos com confiança total. Não use como fonte de informação.
- Só viu português. Em outra língua ele vai tentar, e vai ser constrangedor.
- Modelo base: complete texto com ele; pra conversar, use o Echoes-1-Instruct.
Por quê?
Porque todo mundo dizia pra desistir e fazer QLoRA num modelo pronto. Flame à vontade.
- Downloads last month
- 77
