nilo-revisor-08b

O revisor de fala do Nilo Azevedo, o NPC do 10º andar de The Normal Elevator. Roda no navegador, no aparelho do jogador, sem servidor.

O serviço

O pipeline do jogo tem quatro peças e esta é a terceira:

  1. um rascunhador escreve a resposta em inglês;
  2. um juiz de tom marca as frases ruins;
  3. este modelo reescreve cada frase marcada;
  4. o Bergamot traduz para pt-BR.

O trabalho é estreito de propósito: uma frase por vez, na voz de um homem seco, preso num quarto cinza. Não é assistente, não dá conselho, não sabe que é um programa.

Como foi treinado

Destilado de Qwen/Qwen3.8-27B, em duas etapas:

  • off-policy — 423 pares (frase errada → conserto) gerados pelo professor, cada um verificado por uma régua automática: a frase errada tem que quebrar uma regra de cânone de verdade, e o conserto não pode quebrar nenhuma. 344 aberturas distintas.
  • on-policy — o aluno gera com os pesos do passo atual, o professor pontua, e o gradiente vem do KL sobre o vocabulário inteiro, a T=2. Treino completo dos 873M, cabeça de saída incluída — não é LoRA.

Os vocabulários dos dois modelos foram conferidos token a token antes: 248.044 tokens de base com ids idênticos e merges idênticos, que é o que torna o KL de logits legítimo entre eles.

O que ele não é

Um 27B encolhido. 873M contra 27,78B é capacidade, e capacidade não se destila. O que transfere é o jeito: formato, voz e forma de raciocinar, no domínio em que ele foi destilado. Fora desse domínio ele é um 0,8B comum.

Prova

Os 24 casos da bancada do jogo, julgados pela mesma régua que mede todos os candidatos, e nenhum deles aparece no corpus de treino — o portão que garante isso roda em cada montagem do corpus e cortou 50 linhas por colisão.

Downloads last month
28
Safetensors
Model size
0.8B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Felipe0282829273/nilo-revisor-08b

Finetuned
(335)
this model