gdn-120m-fixed-128
120M gated DeltaNet (head_dim 128) language model, 20k steps of Pile pretraining, published so its
recall evaluations can be reproduced.
- trained from experiment config:
mlp_mixer/gdn_paper_120m_hdim128 - checkpoint file:
final.ckpt(weights only; optimizer state stripped) global_step20000
Part of a state-width sweep evaluated on FDA/SWDE/SQuAD, RULER NIAH, and a distance-controlled retention sweep.
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support