Frozen-expert MoE router
Small MLP gate over five frozen 99M squares64 specialists. Only this router is trained; the experts stay in their own repos.
This file is latest.pt at router step 550 (2026-09-14 19:08 UTC).
Train loss ~0.6869. Val source-cls CE ~0.4296. Val acc ~0.839.
Not a 99M policy. Not the incumbent, puzzle, endgame, opening, or middlegame expert.
Experts
incumbentβavewright/chess-transformer-100m-squares64puzzleβavewright/puzzle-modelendgameβavewright/endgame-modelopeningβavewright/opening-modelmiddlegameβavewright/middlegame-model
Architecture
- Stem: frozen incumbent
global_hidden(736d) - Head: LayerNorm β Linear(736,256) β GELU β Linear(256,256) β GELU β Linear(256,5)
- Params: 257,221
- Vocab: compact 1968
- Dispatch: hard argmax, one specialist forward (incumbent encode is reused if chosen)
Files
latest.ptβ router weights + expert repo liststep_000550.ptrouter_config.jsontrain.log
Inference Providers NEW
This model isn't deployed by any Inference Provider. π Ask for provider support