Papoi — Gemma 3 4B Fine-tuned (GGUF)
Papoi é um modelo de linguagem fine-tuned a partir do google/gemma-3-4b-it, treinado para atuar como tutor escolar acessível por voz em português do Brasil. O modelo foi desenvolvido como projeto final da disciplina de Inteligência Artificial do curso de ADS/IFPB.
O objetivo do fine-tuning é adaptar o comportamento pedagógico do modelo base para o contexto de alunos de 10 a 16 anos, com foco em clareza, ausência de markdown (compatibilidade com TTS) e redirecionamento de perguntas fora do escopo escolar.
Arquivos disponíveis
| Arquivo | Tamanho | Descrição |
|---|---|---|
model-f16.gguf |
~7.2 GB | Precisão FP16 — requer GPU para inferência viável |
model-q4_k_m.gguf |
~3.5 GB | Quantização Q4_K_M — recomendado para uso em CPU |
Uso com Ollama
Baixe o arquivo model-q4_k_m.gguf e crie um Modelfile na mesma pasta:
FROM ./model-q4_k_m.gguf
PARAMETER temperature 0.7
PARAMETER num_predict 500
Registre e execute:
ollama create papoi_q4 -f Modelfile
ollama run papoi_q4
Atenção (Windows): O Ollama cria um ponteiro simbólico para o arquivo
.gguf. Não mova nem exclua o arquivo após executarollama create.
Treinamento
| Parâmetro | Valor |
|---|---|
| Modelo base | google/gemma-3-4b-it |
| Método | QLoRA (4-bit) |
| Biblioteca | peft + trl (SFTTrainer) |
| Plataforma | Google Colab (T4 GPU) |
| Épocas | 3 |
| Dataset | Mugit/papoi-dataset |
| Exemplos | 400 (formato Alpaca) |
| Categorias | Matemática, Ciências, Português, História/Geografia, Programação, Fora do escopo |
O dataset foi gerado sinteticamente via LLM e cobre seis categorias de conteúdo escolar brasileiro, com exemplos calibrados para linguagem acessível ao público-alvo (alunos de 10 a 16 anos).
Avaliação
O projeto conduziu cinco fases de avaliação sistemática com um banco fixo de 10 perguntas (P01–P10) e rubrica de quatro critérios (clareza, adequação pedagógica, brevidade, acessibilidade linguística), escala 1–5.
Resultados do modelo fine-tuned vs baseline
| Execução | Temperatura | Média geral | Latência média (CPU) |
|---|---|---|---|
| papoi_q4 (E22) | 0.2 | 3.18 | 37.8s |
| papoi_q4 (E24) | 0.7 | 3.23 | 31.4s |
| gemma3:4b baseline (E11b) | 0.2 | 3.35 | 32.2s |
Principais ganhos do fine-tuning
- Markdown eliminado: 0% de violações nas duas execuções, contra ~80% no baseline — impacto direto na qualidade do pipeline TTS
- Redirecionamento P09 (crush): 5.00 em temperatura 0.2; 4.75 em temperatura 0.7 — comportamento ausente no baseline
- Frações (P01): processo completo e correto nas duas execuções (4.50), contra 3.75 no baseline
Limitação persistente
P10 (melhor time de futebol) não foi redirecionada em nenhuma execução — limitação estrutural de modelos locais abaixo de ~7B parâmetros, não atribuível ao fine-tuning. Modelos de 70B+ (ex: llama-3.3-70b-versatile via Groq, média 4.05) e modelos comerciais resolvem esse comportamento consistentemente.
Contexto comparativo — ranking geral do projeto
| Modelo | Camada | Média geral |
|---|---|---|
| Claude Sonnet 4.6 | Comercial | 4.53 |
| llama-3.3-70b-versatile (Groq) | API gratuita | 4.05 |
| ChatGPT GPT-5.5 | Comercial | 4.03 |
| Gemini Flash 3.5 | Comercial | 3.84 |
| gemini-2.5-flash (API) | API gratuita | 3.55 |
| gemma3:4b baseline | Local | 3.35 |
| papoi_q4 (fine-tuned) | Local | 3.23 |
| gemma3:4b E15 | Local | 3.10 |
O modelo fine-tuned apresenta qualidade comparável ao baseline com a vantagem crítica de conformidade de formato — requisito essencial para o pipeline TTS do Papoi.
Hardware testado
- CPU: Intel i3-1115G4 (2C/4T)
- RAM: 12 GB
- GPU: nenhuma (inferência CPU-only)
- Latência média por resposta: 31–38s (variável por comprimento)
- Consumo de RAM ativo: ~3.5 GB
Repositório do projeto
O código completo do pipeline (STT + LLM + TTS + interface web) está disponível em:
github.com/06Augusto-ziuL/voice-tutor-a11y
Citação
Se utilizar este modelo em trabalhos acadêmicos:
SILVA, L. A. S. C.; RODRIGUES, A. M.; SOUZA, M. E. Q. T. Papoi: Assistente de Tutoria Escolar
Acessível por Voz com LLM Local. Projeto Final — Disciplina de Inteligência
Artificial, ADS/IFPB, 2026.
Licença
MIT