nilo-revisor-08b
O revisor de fala do Nilo Azevedo, o NPC do 10º andar de The Normal Elevator. Roda no navegador, no aparelho do jogador, sem servidor.
O serviço
O pipeline do jogo tem quatro peças e esta é a terceira:
- um rascunhador escreve a resposta em inglês;
- um juiz de tom marca as frases ruins;
- este modelo reescreve cada frase marcada;
- o Bergamot traduz para pt-BR.
O trabalho é estreito de propósito: uma frase por vez, na voz de um homem seco, preso num quarto cinza. Não é assistente, não dá conselho, não sabe que é um programa.
Como foi treinado
Destilado de Qwen/Qwen3.8-27B, em duas etapas:
- off-policy — 423 pares (frase errada → conserto) gerados pelo professor, cada um verificado por uma régua automática: a frase errada tem que quebrar uma regra de cânone de verdade, e o conserto não pode quebrar nenhuma. 344 aberturas distintas.
- on-policy — o aluno gera com os pesos do passo atual, o professor pontua, e o gradiente vem do KL sobre o vocabulário inteiro, a T=2. Treino completo dos 873M, cabeça de saÃda incluÃda — não é LoRA.
Os vocabulários dos dois modelos foram conferidos token a token antes: 248.044 tokens de base com ids idênticos e merges idênticos, que é o que torna o KL de logits legÃtimo entre eles.
O que ele não é
Um 27B encolhido. 873M contra 27,78B é capacidade, e capacidade não se destila. O que transfere é o jeito: formato, voz e forma de raciocinar, no domÃnio em que ele foi destilado. Fora desse domÃnio ele é um 0,8B comum.
Prova
Os 24 casos da bancada do jogo, julgados pela mesma régua que mede todos os candidatos, e nenhum deles aparece no corpus de treino — o portão que garante isso roda em cada montagem do corpus e cortou 50 linhas por colisão.
- Downloads last month
- 28