GSMDE — centros especialistas

36 centros (16.9 GB) para o GSMDE Studio, uma arquitetura de difusão modular: em vez de um UNet monolítico, uma prateleira de especialistas que um roteador semântico escolhe a partir do prompt e pagina um por vez na VRAM.

Cada centro é um LoRA de rank alto sobre o UNet do SDXL, atacando to_k / to_q / to_v / to_out.0. Como todo checkpoint SDXL compartilha essa arquitetura, eles encaixam mecanicamente em qualquer SDXL — mas foram treinados contra o IDN_Illustrious_V10_B, base treinado pelo proprio autor, e quanto mais distante o seu base, mais eles erram o alvo. O Studio traz uma ferramenta que mede essa divergência antes de você trocar de backbone.

Como usar

Os centros não são LoRAs de uso avulso: eles esperam o roteador e a máscara de território do GSMDE. Aplicados soltos, com peso 1.0 na imagem toda, tendem a inundar a cena — o desenho supõe que cada um pinta só a região dele.

git clone https://github.com/NOTcisLol/gsmde-studio
hf download CairoAOGG4/gsmde-centros --local-dir ./centros

Hierarquia

O nível decide quem sobrevive quando o orçamento de VRAM aperta. Com poucas vagas, o genérico rende mais (person cobre muita tela); com folga, o detalhe é o que agrega (unhas melhora o que o genérico não sabe).

O hash da ideia

Cada centro carrega um hash_ideia, derivado das tags-âncora do treino. Dois centros com o mesmo hash disputam o mesmo território de atenção, ainda que um tenha 2 mil imagens e rank 96 e o outro 100 mil e rank 512. Serve para o orquestrador não carregar os dois juntos e para você comparar um centro seu com um destes sem precisar testar.

Os centros

centro rank tamanho imagens nível hash da ideia
bijuteria 192 0.56 GB 2500 detalhe cb84edcb6d60
maos 128 0.37 GB 2500 detalhe 9d63151f3390
molhado 96 0.28 GB 2500 detalhe 922af22a4121
pedra 64 0.19 GB 2500 detalhe 366bbc116623
pelagem 128 0.37 GB 2500 detalhe 5f572f1992f4
pele 192 0.56 GB 2500 detalhe c5cd434ed5ad
tecido 96 0.28 GB 2500 detalhe 1e3982238cfa
actions 0.74 GB ``
animals 0.19 GB ``
architecture 0.74 GB ``
biomes 0.19 GB ``
brazilian_miku 0.74 GB ``
camera 0.74 GB ``
color_grade 0.09 GB ``
design 0.74 GB ``
expression 0.74 GB ``
handling 0.09 GB ``
illumination 0.19 GB ``
locals 0.19 GB ``
multi_person 0.74 GB ``
nsfw 0.19 GB ``
objects_foreground 0.09 GB ``
outfit_append 0.74 GB ``
outfit_racing 0.74 GB ``
outfit_sakura 0.74 GB ``
outfit_snow 0.74 GB ``
particles 0.09 GB ``
person 0.74 GB ``
plantas 0.74 GB ``
pose 0.74 GB ``
scenary 0.74 GB ``
scene_dynamics 0.09 GB ``
scene_effect 0.09 GB ``
style 0.74 GB ``
time 0.19 GB ``
vehicles 0.74 GB ``

Treino

Um centro por vez, uma imagem por passo, com requeue por loss — sem épocas. Datasets de 2.500 imagens com amostragem estratificada: cada tag do nicho recebe cota igual, ancorada na tag mais rara da imagem. Sem isso a tag dominante engole o conjunto (em bijuteria, hair_ornament tem 108 mil imagens e brooch tem 6 mil — sem estratificar, o centro viraria um especialista em laço de cabelo).

O rank sai da dispersão de assinaturas de tag do próprio nicho, não de um número fixo: escopo pequeno converge com pouco (unhas, rank 64), escopo largo precisa de mais (bijuteria e pele, rank 192).

Protocolo completo em docs/protocolo_treino.md.

Limitações conhecidas

  • Treinados sobre IDN_Illustrious_V10_B (base do proprio autor); em bases distantes (SDXL 1.0 base, Pony) a qualidade cai sem dar erro nenhum — o pior tipo de falha para diagnosticar.
  • Os clusters c6 e c7 rodaram com 1,6 passada pelo dataset, não com o currículo completo de 3 passadas de aquecimento. Ver o protocolo.
  • Alguns centros do c7 (unhas, pes, boca, maquiagem) ainda não foram treinados.
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support