KHTST — modelo multimodal PT-BR (v10: janela PARALELA 256K→128K + classificadores Jev + Cython sem fallback)

KHTST é a evolução do projeto AURORA (renomeação integral AURORA → KHTST, pedido do projeto) — um modelo multimodal compacto para PT-BR com roteamento por S-SOM, punição SGDR, punição de novidade restrita a empates de Voronoi, controle Reward/Punishment/Penalty (RPP), janela de contexto PARALELA de 256K tokens de ENTRADA e 128K de SAÍDA (doc 21, Teos 21.1–21.5; comprimento_ctx=256, janela_sliding=192) e classificadores alinhados auto-calibrados (primitivos escolha/escore/noul com metacalibração térmica por entropia — versão PRÓPRIA, sem CLIP/GPT2).

14,96M parâmetros · vocab 16384 · 9 tarefas (lm/noticia/pontuacao/ instrucao/tts/vqa/ocr/imagem_caption/asr) · encoders imagem/áudio/vídeo.

GATE DE QUALIDADE: APROVADO (todas as métricas). O estado treinado publicado em estados/fase-v10/ superou o AURORA baseline em ppl_lm (2,58 vs 17,09 — −84,9%) e nas 9 perdas por tarefa, com treino em 4,14 h de segmentos (+DPO/SOM ≈ 4,3 h) dentro do requisito atual (orçamento 4 h + tolerância 1 h — épocas extras executadas ao sobrar orçamento, "sobrando tempo: continuar treinamento") e RAM pico 3.445 MB ≤ 3.580 MB do AURORA. Tabela completa: comparacao_treino_v10.json (evolucao_integral).

Resultados desta corrida (estado RECARREGADO do disco — Teorema 20.2)

métrica AURORA (baseline) KHTST v10 Δ
ppl_lm 17,09 2,58 −84,9%
perda lm 2,838 0,947 −66,6%
perda noticia 2,554 0,825 −67,7%
perda instrucao 2,036 0,536 −73,7%
perda pontuacao 2,648 1,014 −61,7%
perda imagem_caption 2,127 0,543 −74,5%
perda vqa 2,177 0,728 −66,6%
perda ocr 1,418 0,354 −75,0%
perda asr 2,122 0,491 −76,9%
perda tts 1,675 0,588 −64,9%
tempo de treino — (orçamento 4 h + tolerância 1 h) 4,14 h (32 segmentos) teto ✓
RAM pico 3.580 MB 3.445 MB −3,8%
testes pós-treino v2–v7, v9, v10: 301 ✓ / 0 ✗
item (b) adhoc aprovado APROVADO (teste_item_b_v10.json)

Todas as perdas por tarefa foram avaliadas no MESMO protocolo do baseline (3.548 registros PT-BR reais, mesmas sementes, mesmo tokenizador BPE 16k).

O que há de novo no v10 (provas em docs/matematica/21)

inovação onde prova
Janela de contexto PARALELA: entrada 256K, saída 128K; janelas W=192K/E=64K (K=2) com cross-fade de partição de unidade (fusão não-expansiva) memoria/janela_1m.py Teos 21.1–21.4
Inserção PARALELA no índice: resumos em lote único (map puro) + SOM em lote — equivalência com o sequencial testada (Δz = 0) memoria/janela_1m.py Teo 21.3
s_passo AUTO-AJUSTÁVEL: regra multiplicativa sobre o hit-rate coarse ρ (malha negativa, ponto fixo ρ*) memoria/janela_1m.py Teo 21.5
Classificadores alinhados (Jev KHTST): primitivos escolha/escore/noul com alinhador PRÓPRIO (InfoNCE simétrica, identifiável até rotação) — sem CLIP/GPT2 percepcao/classificadores.py Teos 21.6–21.9
Metacalibração térmica por entropia: T(H) = clip(T_max − H_norm·(T_max−T_min)); núcleo C temperatura_entropia (1 chamada/decisão) acelerado/nucleos.pyx Teo 21.7
Inserção só onde VANTAJOSO (Teo 21.11): requisições (após tokens), treino (perda com α neutro), inferência (T dinâmica), ciclo (endosso térmico) — NÃO inserido em decisões triviais (BMU) servico/adhoc.py, treino/treinador.py, nucleo/modelo.py, raciocinio/ciclo.py Teo 21.11
Nascimento NEUTRO: t_min = t_max = 1 ⇒ idêntico ao v9 no passo 0; α = 0 ativado só se a utilidade melhorar vários Teo 21.12
SEM FALLBACK (fail-fast): os núcleos Cython/C são OBRIGATÓRIOS (auto-build no import; erro RUIDOSO sem binário) — fonte única de verdade acelerado/__init__.py, scripts/01 Teo 21.13
Contador INCREMENTAL de entropia O(1)/token (identidade ln S − T2/S) — habilita SAÍDA 128K sem custo O(T²) percepcao/classificadores.py Teo 21.4
Bug corrigido: retomada podia escolher tag PÓS-fase reprovada pelo gate em empate de passo (desempate agora prefere pre-/epoca-) dados/checkpoints.py

Como a autorregulação atuou NESTA corrida (evidência real):

  1. Gate DPO: ROLLBACK. A fase DPO (92 passos) regrediu o ppl 2,35 → 14,72; o gate detectou no estado RECARREGADO e restaurou pre-dpo (Teo 20.3).
  2. Gate SOM: ROLLBACK. A consolidação SOM regrediu 11,49 → 12,95; rollback automático. (A fase SOM herdou o tag reprovado por um bug de desempate na retomada — corrigido; o estado publicado é o pre-dpo gate-aprovado.)
  3. O estado publicado (estados/fase-v10/) é o estado gate-aprovado, re-serializado com o protocolo integral v9.1 — sonda δ* = 0,0.

O que há de novo no v9 (provas em docs/matematica/20)

inovação onde prova
Estado integral: snapshot fiel de modelo + roteador S-SOM + orquestrador SOM + extras (Teo 20.1) treino/estado_integral.py, dados/checkpoints.py Teos 20.1–20.2
Sonda de fidelidade: max|Δ logits| = 0 medido em cada fase e no estado final idem Cor. 20.2.1
Gate de fase com rollback: avaliação do estado RECARREGADO; regressão > 8% ⇒ rollback (não-expansividade) scripts/04_treinar.py, treino/treinador.py Teo 20.3
CIAR: controlador integral de autorregulação do lr (κ ∈ [0,5; 1,5], PI com vazamento) treino/treinador.py Teos 20.4–20.5
Correção do bug crítico do v8: estado fora do state_dict (codebook do roteador, 9 variantes SOM) não era salvo ⇒ reload quebrado (ppl 2542)
Bug de digitação corrigido em scripts/01 (bloco try/except des-indentado — SyntaxError) scripts/01_verificar_ambiente.py

Como a autorregulação atuou NESTA corrida (evidência real, resumo_treino_v9.json):

  1. Gate DPO: ROLLBACK. A fase DPO (93 passos) regrediu o ppl 3,28 → 10,45; o gate detectou no estado RECARREGADO e restaurou automaticamente o snapshot pre-dpo (Teorema 20.3 — o operador é não-expansivo).
  2. Gate SOM: ROLLBACK. A consolidação SOM regrediu 2,44 → 2,74 (além da tolerância de 8%); rollback automático para pre-som.
  3. O estado publicado (estados/fase-v9/) é o estado gate-aprovado, re-serializado com o protocolo integral v9.1 — sonda δ* = 0,0.

Verificações (tudo verde)

  • Suítes v2–v7 + v9 + v10 (nova, 49 ✓): 301 ✓ / 0 ✗ no total — janela paralela (partição de unidade, não-expansão, equivalência de inserção), classificadores Jev (neutro, polarização, escore, rotação), fail-fast Cython/C, captura/restauração bit-exata, sonda, CIAR limitado.
  • Item (b) no modelo treinado: APROVADO — 4 requisições recebidas ANTES da 1ª resposta, processamento serial, stop (cancelamento) e pause→continue honrados (teste_item_b_v10.json).

Treino desta corrida (dentro do teto de 5 h)

métrica valor
passos 4788 (9 épocas de 532 passos — 8 do orçamento + épocas extras "sobrando tempo" — lote 6, ctx 256)
tempo de treino 4,139 h (32 segmentos FOREGROUND de ~470 s) + DPO/SOM ≈ 0,2 h · orçamento 4 h + tolerância 1 h ✓
RAM pico 3.445 MB · média 2.623 MB · mín 421 MB (8.398 amostras)
corpus 3.548 registros PT-BR reais (18 fontes HF; multimodais incluídos)
núcleos Cython/C OBRIGATÓRIOS nesta corrida (sem fallback — Teo 21.13); backend cython_c ativo do início ao fim
estado publicado estados/fase-v10/ — modelo + roteador + orquestrador + extras (626 tensores), SHA-256, sonda δ* = 0

O que há de novo no v8 (itens a–j, com provas em docs/matematica/19)

item melhoria onde prova
a micro buffers anulares em redes recorrentes (0 alocação/passo no decode) percepcao/microunidades.py Teo 19.6
b canal adhoc I/O + stop/continue durante solicitações ativas servico/adhoc.py, scripts/09_teste_item_b.py Teos 19.14–19.16
c quantização 8-bit seletiva matematicamente vantajosa (torchao/bnb) quanta/quantizacao.py §10 Teo 19.18
d anti-vanishing: Leaky ReLU adaptativa + pesos de árvore bidirecionais + skip neutro + BatchNorm microunidades.py Teos 19.7–19.10
e map-reduce torch.vmap/sum/mean nos experts MoE percepcao/moe.py Teo 19.11 (diff 0,0)
f atenção árvore bidirecional fora de ordem; raio_janela e kv_max ×4 (128/2048); AtencaoCabecas percepcao/atencao.py Teos 19.1–19.4
g MoE 2 encoders + 4 decoders fora de ordem agrupável/desagrupável percepcao/moe.py Teos 19.12–19.13
h gestão de memória RAM/armazenamento com limiar adaptativo telemetria/gestor_memoria.py Teo 19.17
i testes em dados reais → bugs latentes corrigidos (v7 e v8) vários
j parâmetros auto-ajustáveis matematicamente + provas conjuntas treino/treinador.py Teos 19.26–19.27

ViT (evolução de video.py/blocos.py/microunidades.py): Token Merging (ToMe) com casamento bipartido único e auto-ajuste da fração de fusão; LRA-QViT com RB-LRA, WADS e STE — ramificações 1-bit ∥ 4-bit em paralelo detectando direção vetorial da iluminação (unitária) e intensidade, mapas 2-D de contorno/área; critério de vantagem da difusão (vantagem_difusao). Provas: Teos 19.19–19.24, 19.28.

Cython + C/C++: núcleos acelerado/nucleos.pyx (Kohonen sequencial + entropia/punição + temperatura_entropia v10) com semântica sequencial exata (Teos 19.25/21.7) — speedup medido 17,89×; SEM fallback desde o v10 (fail-fast com auto-build, Teo 21.13)

Gráficos de desempenho desta corrida (publicados apenas no card)

curva de perda ppl LM RAM perdas por tarefa SOM e roteador alinhamento

Nota honesta: a curva "AURORA (baseline)" refere-se à avaliação do baseline publicado (avaliacao_v6_anterior.json), corrida com a política de lr que o diagnóstico v8/v9 corrige; o KHTST v10 usa a política corrigida (SGDR com cooldown = T_0, guarda de aquecimento nas duas cláusulas, CIAR, gates).

Reprodução

python3 scripts/01_verificar_ambiente.py
python3 scripts/02_coletar_corpus.py          # retomável por fonte
python3 scripts/03_treinar_tokenizador.py
python3 scripts/04_treinar.py --orcamento 470 --teto_horas 5.0 \
    --continuar_ate_horas 4.0     # v10: sobrando tempo, épocas extras
python3 scripts/05_avaliar.py
python3 scripts/09_teste_item_b.py            # item (b) com o modelo real
python3 scripts/08_graficos_card.py           # gráficos + gates
python3 scripts/06_publicar_hf.py             # commit único (gate bloqueia estados)

Núcleos acelerados (Cython+C — OBRIGATÓRIOS no v10): o repo inclui nucleos.pyx (fonte), nucleos.c (C gerado) e o binário pré-compilado nucleos.cpython-312-x86_64-linux-gnu.so. Sem binário compatível, o import executa AUTO-BUILD; persistindo a falha, o erro é RUIDOSO (sem fallback — Teo 21.13):

cd src/khtst/acelerado && python3 setup.py build_ext --inplace
python3 -c "from khtst.acelerado import status; print(status())"
# {'backend': 'cython_c', 'cython_disponivel': True}

Estrutura

src/khtst/ — núcleo, percepção (atenção/microunidades/moe/vit_lra), memória (S-SOM + 8 variantes + janela 256K), treino (4 fases + RPP + SGDR + estado integral + CIAR + gates), servico (canal adhoc), quanta (8-bit + STE), telemetria (hub + gestor de memória), qualidade (Agente Engenheiro), acelerado (Cython+C). docs/matematica/00–21 — fundamentos, teoremas e provas. percepcao/classificadores.py — classificadores alinhados Jev (doc 21). graficos/ — desempenho desta corrida (apenas no card).

Licença

MIT (herdada do projeto).

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support