Instructions to use BrCamp/bee-150m-pt-base with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use BrCamp/bee-150m-pt-base with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="BrCamp/bee-150m-pt-base") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("BrCamp/bee-150m-pt-base") model = AutoModelForCausalLM.from_pretrained("BrCamp/bee-150m-pt-base", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use BrCamp/bee-150m-pt-base with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "BrCamp/bee-150m-pt-base" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "BrCamp/bee-150m-pt-base", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/BrCamp/bee-150m-pt-base
- SGLang
How to use BrCamp/bee-150m-pt-base with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "BrCamp/bee-150m-pt-base" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "BrCamp/bee-150m-pt-base", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "BrCamp/bee-150m-pt-base" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "BrCamp/bee-150m-pt-base", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use BrCamp/bee-150m-pt-base with Docker Model Runner:
docker model run hf.co/BrCamp/bee-150m-pt-base
Bee-150M-PT (base)
Modelo de linguagem de 151,2M parâmetros pré-treinado do zero em português do Brasil: tokenizador próprio, corpus próprio, pesos inicializados aleatoriamente. Sem destilação, sem continuação de pré-treino de outro modelo.
Resultado
bits-por-byte em holdout PT limpo (parquet 40 do fineweb-2 por_Latn, região que nenhuma
coleta do treino tocou). Menor é melhor. bpb é comparável entre tokenizadores diferentes —
perplexidade não seria.
| modelo | tokens de treino | bpb PT | fertilidade (tok/byte) |
|---|---|---|---|
| Bee-150M-PT | 21,7B | 0,844 | 0,2183 |
| Tucano-160m | ~200B | 0,884 | 0,2074 |
| SmolLM2-135M | ~2T (inglês) | 1,551 | 0,3576 |
O Bee supera o Tucano-160m usando 9× menos tokens.
Curva medida (marcos salvos durante o treino, mesmo holdout e procedimento):
| tokens | 1B | 3B | 6B | 10B | 15B | 21B | final |
|---|---|---|---|---|---|---|---|
| bpb | 1,021 | 0,947 | 0,920 | 0,897 | 0,870 | 0,845 | 0,844 |
Arquitetura
LlamaForCausalLM — 30 camadas · d_model 576 · intermediate 2048 (SwiGLU) · 9 cabeças de
atenção com 3 KV heads (GQA) · RoPE (theta 10000) · RMSNorm · seq_len 2048 · vocab 32.000
com embeddings amarrados.
Dados
100% português. HuggingFaceFW/fineweb-2 config por (ODC-By 1.0) + fontes de domínio
público. A procedência foi verificada na origem, nunca pelo rótulo. Nenhum conteúdo com
paywall ou de licença indeterminada entrou no corpus.
Treino
RTX 5090, 96,5 h, ~US$ 97. Batch global 524k tokens/passo, LR 3e-3 cosine, AdamW
(0,9/0,95), weight decay 0,1, clip 1,0, bf16, torch.compile.
⚠️ Limitações — leia antes de usar
Este é um modelo base: ele completa texto, não segue instruções. Para a versão ajustada,
veja bee-150m-pt-sft.
Com 151M parâmetros, ele escreve português muito bem e não sabe fatos. Conhecimento factual é impreciso e varia entre gerações — ele amostra plausibilidade, não consulta memória. Não use para perguntas factuais de mundo aberto. Use onde o conhecimento vem no contexto: extração estruturada, resumo, reescrita, classificação.
Reprodução
Código, corpus e todas as medições: https://github.com/brcampidelli/llm-ptbr.
As lições do projeto — inclusive o bug de uma linha que invalidou duas semanas de treino —
estão em docs/licoes-pretreino.md.
- Downloads last month
- -