- KHTST — modelo multimodal PT-BR (v10: janela PARALELA 256K→128K + classificadores Jev + Cython sem fallback)
- Resultados desta corrida (estado RECARREGADO do disco — Teorema 20.2)
- O que há de novo no v10 (provas em
docs/matematica/21) - O que há de novo no v9 (provas em
docs/matematica/20) - Verificações (tudo verde)
- Treino desta corrida (dentro do teto de 5 h)
- O que há de novo no v8 (itens a–j, com provas em
docs/matematica/19) - Gráficos de desempenho desta corrida (publicados apenas no card)
- Reprodução
- Estrutura
- Licença
- Resultados desta corrida (estado RECARREGADO do disco — Teorema 20.2)
KHTST — modelo multimodal PT-BR (v10: janela PARALELA 256K→128K + classificadores Jev + Cython sem fallback)
KHTST é a evolução do projeto AURORA (renomeação integral AURORA → KHTST,
pedido do projeto) — um modelo multimodal compacto para PT-BR com
roteamento por S-SOM, punição SGDR, punição de novidade restrita a empates
de Voronoi, controle Reward/Punishment/Penalty (RPP), janela de contexto
PARALELA de 256K tokens de ENTRADA e 128K de SAÍDA (doc 21, Teos 21.1–21.5;
comprimento_ctx=256, janela_sliding=192) e classificadores alinhados
auto-calibrados (primitivos escolha/escore/noul com metacalibração térmica
por entropia — versão PRÓPRIA, sem CLIP/GPT2).
14,96M parâmetros · vocab 16384 · 9 tarefas (lm/noticia/pontuacao/ instrucao/tts/vqa/ocr/imagem_caption/asr) · encoders imagem/áudio/vídeo.
✅ GATE DE QUALIDADE: APROVADO (todas as métricas). O estado treinado publicado em
estados/fase-v10/superou o AURORA baseline em ppl_lm (2,58 vs 17,09 — −84,9%) e nas 9 perdas por tarefa, com treino em 4,14 h de segmentos (+DPO/SOM ≈ 4,3 h) dentro do requisito atual (orçamento 4 h + tolerância 1 h — épocas extras executadas ao sobrar orçamento, "sobrando tempo: continuar treinamento") e RAM pico 3.445 MB ≤ 3.580 MB do AURORA. Tabela completa:comparacao_treino_v10.json(evolucao_integral).
Resultados desta corrida (estado RECARREGADO do disco — Teorema 20.2)
| métrica | AURORA (baseline) | KHTST v10 | Δ |
|---|---|---|---|
| ppl_lm | 17,09 | 2,58 | −84,9% |
| perda lm | 2,838 | 0,947 | −66,6% |
| perda noticia | 2,554 | 0,825 | −67,7% |
| perda instrucao | 2,036 | 0,536 | −73,7% |
| perda pontuacao | 2,648 | 1,014 | −61,7% |
| perda imagem_caption | 2,127 | 0,543 | −74,5% |
| perda vqa | 2,177 | 0,728 | −66,6% |
| perda ocr | 1,418 | 0,354 | −75,0% |
| perda asr | 2,122 | 0,491 | −76,9% |
| perda tts | 1,675 | 0,588 | −64,9% |
| tempo de treino | — (orçamento 4 h + tolerância 1 h) | 4,14 h (32 segmentos) | teto ✓ |
| RAM pico | 3.580 MB | 3.445 MB | −3,8% |
| testes pós-treino | — | v2–v7, v9, v10: 301 ✓ / 0 ✗ | — |
| item (b) adhoc | aprovado | APROVADO (teste_item_b_v10.json) |
— |
Todas as perdas por tarefa foram avaliadas no MESMO protocolo do baseline (3.548 registros PT-BR reais, mesmas sementes, mesmo tokenizador BPE 16k).
O que há de novo no v10 (provas em docs/matematica/21)
| inovação | onde | prova |
|---|---|---|
| Janela de contexto PARALELA: entrada 256K, saída 128K; janelas W=192K/E=64K (K=2) com cross-fade de partição de unidade (fusão não-expansiva) | memoria/janela_1m.py |
Teos 21.1–21.4 |
| Inserção PARALELA no índice: resumos em lote único (map puro) + SOM em lote — equivalência com o sequencial testada (Δz = 0) | memoria/janela_1m.py |
Teo 21.3 |
| s_passo AUTO-AJUSTÁVEL: regra multiplicativa sobre o hit-rate coarse ρ (malha negativa, ponto fixo ρ*) | memoria/janela_1m.py |
Teo 21.5 |
| Classificadores alinhados (Jev KHTST): primitivos escolha/escore/noul com alinhador PRÓPRIO (InfoNCE simétrica, identifiável até rotação) — sem CLIP/GPT2 | percepcao/classificadores.py |
Teos 21.6–21.9 |
Metacalibração térmica por entropia: T(H) = clip(T_max − H_norm·(T_max−T_min)); núcleo C temperatura_entropia (1 chamada/decisão) |
acelerado/nucleos.pyx |
Teo 21.7 |
| Inserção só onde VANTAJOSO (Teo 21.11): requisições (após tokens), treino (perda com α neutro), inferência (T dinâmica), ciclo (endosso térmico) — NÃO inserido em decisões triviais (BMU) | servico/adhoc.py, treino/treinador.py, nucleo/modelo.py, raciocinio/ciclo.py |
Teo 21.11 |
| Nascimento NEUTRO: t_min = t_max = 1 ⇒ idêntico ao v9 no passo 0; α = 0 ativado só se a utilidade melhorar | vários | Teo 21.12 |
| SEM FALLBACK (fail-fast): os núcleos Cython/C são OBRIGATÓRIOS (auto-build no import; erro RUIDOSO sem binário) — fonte única de verdade | acelerado/__init__.py, scripts/01 |
Teo 21.13 |
| Contador INCREMENTAL de entropia O(1)/token (identidade ln S − T2/S) — habilita SAÍDA 128K sem custo O(T²) | percepcao/classificadores.py |
Teo 21.4 |
| Bug corrigido: retomada podia escolher tag PÓS-fase reprovada pelo gate em empate de passo (desempate agora prefere pre-/epoca-) | dados/checkpoints.py |
— |
Como a autorregulação atuou NESTA corrida (evidência real):
- Gate DPO: ROLLBACK. A fase DPO (92 passos) regrediu o ppl 2,35 → 14,72;
o gate detectou no estado RECARREGADO e restaurou
pre-dpo(Teo 20.3). - Gate SOM: ROLLBACK. A consolidação SOM regrediu 11,49 → 12,95;
rollback automático. (A fase SOM herdou o tag reprovado por um bug de
desempate na retomada — corrigido; o estado publicado é o
pre-dpogate-aprovado.) - O estado publicado (
estados/fase-v10/) é o estado gate-aprovado, re-serializado com o protocolo integral v9.1 — sonda δ* = 0,0.
O que há de novo no v9 (provas em docs/matematica/20)
| inovação | onde | prova |
|---|---|---|
| Estado integral: snapshot fiel de modelo + roteador S-SOM + orquestrador SOM + extras (Teo 20.1) | treino/estado_integral.py, dados/checkpoints.py |
Teos 20.1–20.2 |
| Sonda de fidelidade: max|Δ logits| = 0 medido em cada fase e no estado final | idem | Cor. 20.2.1 |
| Gate de fase com rollback: avaliação do estado RECARREGADO; regressão > 8% ⇒ rollback (não-expansividade) | scripts/04_treinar.py, treino/treinador.py |
Teo 20.3 |
| CIAR: controlador integral de autorregulação do lr (κ ∈ [0,5; 1,5], PI com vazamento) | treino/treinador.py |
Teos 20.4–20.5 |
Correção do bug crítico do v8: estado fora do state_dict (codebook do roteador, 9 variantes SOM) não era salvo ⇒ reload quebrado (ppl 2542) |
— | — |
Bug de digitação corrigido em scripts/01 (bloco try/except des-indentado — SyntaxError) |
scripts/01_verificar_ambiente.py |
— |
Como a autorregulação atuou NESTA corrida (evidência real, resumo_treino_v9.json):
- Gate DPO: ROLLBACK. A fase DPO (93 passos) regrediu o ppl 3,28 → 10,45;
o gate detectou no estado RECARREGADO e restaurou automaticamente o
snapshot
pre-dpo(Teorema 20.3 — o operador é não-expansivo). - Gate SOM: ROLLBACK. A consolidação SOM regrediu 2,44 → 2,74 (além da
tolerância de 8%); rollback automático para
pre-som. - O estado publicado (
estados/fase-v9/) é o estado gate-aprovado, re-serializado com o protocolo integral v9.1 — sonda δ* = 0,0.
Verificações (tudo verde)
- Suítes v2–v7 + v9 + v10 (nova, 49 ✓): 301 ✓ / 0 ✗ no total — janela paralela (partição de unidade, não-expansão, equivalência de inserção), classificadores Jev (neutro, polarização, escore, rotação), fail-fast Cython/C, captura/restauração bit-exata, sonda, CIAR limitado.
- Item (b) no modelo treinado: APROVADO — 4 requisições recebidas ANTES
da 1ª resposta, processamento serial, stop (cancelamento) e
pause→continue honrados (
teste_item_b_v10.json).
Treino desta corrida (dentro do teto de 5 h)
| métrica | valor |
|---|---|
| passos | 4788 (9 épocas de 532 passos — 8 do orçamento + épocas extras "sobrando tempo" — lote 6, ctx 256) |
| tempo de treino | 4,139 h (32 segmentos FOREGROUND de ~470 s) + DPO/SOM ≈ 0,2 h · orçamento 4 h + tolerância 1 h ✓ |
| RAM | pico 3.445 MB · média 2.623 MB · mín 421 MB (8.398 amostras) |
| corpus | 3.548 registros PT-BR reais (18 fontes HF; multimodais incluídos) |
| núcleos Cython/C | OBRIGATÓRIOS nesta corrida (sem fallback — Teo 21.13); backend cython_c ativo do início ao fim |
| estado publicado | estados/fase-v10/ — modelo + roteador + orquestrador + extras (626 tensores), SHA-256, sonda δ* = 0 |
O que há de novo no v8 (itens a–j, com provas em docs/matematica/19)
| item | melhoria | onde | prova |
|---|---|---|---|
| a | micro buffers anulares em redes recorrentes (0 alocação/passo no decode) | percepcao/microunidades.py |
Teo 19.6 |
| b | canal adhoc I/O + stop/continue durante solicitações ativas | servico/adhoc.py, scripts/09_teste_item_b.py |
Teos 19.14–19.16 |
| c | quantização 8-bit seletiva matematicamente vantajosa (torchao/bnb) | quanta/quantizacao.py §10 |
Teo 19.18 |
| d | anti-vanishing: Leaky ReLU adaptativa + pesos de árvore bidirecionais + skip neutro + BatchNorm | microunidades.py |
Teos 19.7–19.10 |
| e | map-reduce torch.vmap/sum/mean nos experts MoE |
percepcao/moe.py |
Teo 19.11 (diff 0,0) |
| f | atenção árvore bidirecional fora de ordem; raio_janela e kv_max ×4 (128/2048); AtencaoCabecas |
percepcao/atencao.py |
Teos 19.1–19.4 |
| g | MoE 2 encoders + 4 decoders fora de ordem agrupável/desagrupável | percepcao/moe.py |
Teos 19.12–19.13 |
| h | gestão de memória RAM/armazenamento com limiar adaptativo | telemetria/gestor_memoria.py |
Teo 19.17 |
| i | testes em dados reais → bugs latentes corrigidos (v7 e v8) | vários | — |
| j | parâmetros auto-ajustáveis matematicamente + provas conjuntas | treino/treinador.py |
Teos 19.26–19.27 |
ViT (evolução de video.py/blocos.py/microunidades.py): Token
Merging (ToMe) com casamento bipartido único e auto-ajuste da fração de
fusão; LRA-QViT com RB-LRA, WADS e STE — ramificações 1-bit ∥ 4-bit
em paralelo detectando direção vetorial da iluminação (unitária) e
intensidade, mapas 2-D de contorno/área; critério de vantagem da
difusão (vantagem_difusao). Provas: Teos 19.19–19.24, 19.28.
Cython + C/C++: núcleos acelerado/nucleos.pyx (Kohonen sequencial +
entropia/punição + temperatura_entropia v10) com semântica sequencial
exata (Teos 19.25/21.7) — speedup medido 17,89×; SEM fallback desde o
v10 (fail-fast com auto-build, Teo 21.13)
Gráficos de desempenho desta corrida (publicados apenas no card)
Nota honesta: a curva "AURORA (baseline)" refere-se à avaliação do baseline
publicado (avaliacao_v6_anterior.json), corrida com a política de lr que o
diagnóstico v8/v9 corrige; o KHTST v10 usa a política corrigida (SGDR com
cooldown = T_0, guarda de aquecimento nas duas cláusulas, CIAR, gates).
Reprodução
python3 scripts/01_verificar_ambiente.py
python3 scripts/02_coletar_corpus.py # retomável por fonte
python3 scripts/03_treinar_tokenizador.py
python3 scripts/04_treinar.py --orcamento 470 --teto_horas 5.0 \
--continuar_ate_horas 4.0 # v10: sobrando tempo, épocas extras
python3 scripts/05_avaliar.py
python3 scripts/09_teste_item_b.py # item (b) com o modelo real
python3 scripts/08_graficos_card.py # gráficos + gates
python3 scripts/06_publicar_hf.py # commit único (gate bloqueia estados)
Núcleos acelerados (Cython+C — OBRIGATÓRIOS no v10): o repo inclui
nucleos.pyx (fonte), nucleos.c (C gerado) e o binário pré-compilado
nucleos.cpython-312-x86_64-linux-gnu.so. Sem binário compatível, o import
executa AUTO-BUILD; persistindo a falha, o erro é RUIDOSO (sem fallback —
Teo 21.13):
cd src/khtst/acelerado && python3 setup.py build_ext --inplace
python3 -c "from khtst.acelerado import status; print(status())"
# {'backend': 'cython_c', 'cython_disponivel': True}
Estrutura
src/khtst/ — núcleo, percepção (atenção/microunidades/moe/vit_lra),
memória (S-SOM + 8 variantes + janela 256K), treino (4 fases + RPP + SGDR +
estado integral + CIAR + gates), servico (canal adhoc), quanta
(8-bit + STE), telemetria (hub + gestor de memória), qualidade (Agente
Engenheiro), acelerado (Cython+C).
docs/matematica/00–21 — fundamentos, teoremas e provas.
percepcao/classificadores.py — classificadores alinhados Jev (doc 21).
graficos/ — desempenho desta corrida (apenas no card).
Licença
MIT (herdada do projeto).





