Qwen3-0.6B — Revisor gramatical (PT)

Fine-tune do Qwen/Qwen3-0.6B para classificar a qualidade gramatical de sentenças em português em Aceitável / Moderado / Inaceitável, com uma breve descrição do erro. Treinado com Unsloth (LoRA, 16-bit).

Resultado (test set, 500 exemplos)

  • Acurácia: 81.6% (0% de saídas inválidas)
  • Recall por classe: Aceitável 94.4% · Moderado 72.4% · Inaceitável 78.0%

Uso

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "SEU_USUARIO/qwen3-0.6b-revisor-pt"
tok = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(repo, torch_dtype=torch.bfloat16, device_map="auto")

SYSTEM = """Você é um revisor gramatical de textos em português. Avalie a qualidade da sentença considerando concordância (nominal e verbal), pontuação e acentuação, e classifique-a em uma destas categorias:
- "Aceitável": sem erros relevantes.
- "Moderado": um erro pontual.
- "Inaceitável": múltiplos erros ou um erro grave.
Responda APENAS com um JSON válido no formato: {"classificacao": "<categoria>", "descricao": "<breve descrição do(s) erro(s)>"}."""
msgs = [{"role": "system", "content": SYSTEM},
        {"role": "user", "content": 'Sentença: "Os menino jogou bola."'}]
prompt = tok.apply_chat_template(msgs, tokenize=False,
                                 add_generation_prompt=True, enable_thinking=False)
ids = tok(prompt, return_tensors="pt").to(model.device)
out = model.generate(**ids, max_new_tokens=128, do_sample=False)
print(tok.decode(out[0][ids.input_ids.shape[1]:], skip_special_tokens=True))
# -> {"classificacao": "Inaceitável", "descricao": "..."}

Treino

Base Qwen3-0.6B · LoRA r=16 · 3 épocas · ~5000 exemplos. Saída em JSON {"classificacao": ..., "descricao": ...}, com enable_thinking=False.

O adaptador LoRA isolado (~35 MB) está na subpasta adapter/ deste mesmo repositório, caso prefira carregá-lo sobre o Qwen3-0.6B base.

Limitações

Dataset sintético (erros injetados por regra sobre a Wikipedia PT: concordância, pontuação, acentuação). Erros de acentuação sutis podem passar. Uso experimental.

Downloads last month
28
Safetensors
Model size
0.6B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for MoonHawlk/qwen3-0.6b-revisor-pt

Finetuned
Qwen/Qwen3-0.6B
Adapter
(573)
this model