gpt2-124m-variants-pre

Research artifacts: GPT-2 (124M, trained from scratch) pretraining variants produced under controlled data-composition differences; per-variant, per-seed subfolders; intended for reproducibility and membership/contamination research. Details and provenance will be documented in a future update.

Subfolders

  • clean_seed20260901
  • clean_seed20260902
  • inj1x_seed20260901
  • inj1x_seed20260902
  • inj16x_seed20260901
  • inj16x_seed20260902

Loading

from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "XUUUUSID/gpt2-124m-variants-pre"
sub = "clean_seed20260901"
tok = AutoTokenizer.from_pretrained(repo, subfolder=sub)
model = AutoModelForCausalLM.from_pretrained(repo, subfolder=sub)
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support