gpt2_small_expandedbabyLM_125M_44

This model is a fine-tuned version of on an unknown dataset. It achieves the following results on the evaluation set:

  • Loss: 2.7322

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 0.0001
  • train_batch_size: 256
  • eval_batch_size: 256
  • seed: 44
  • optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
  • lr_scheduler_type: linear
  • lr_scheduler_warmup_steps: 4000
  • num_epochs: 20

Training results

Training Loss Epoch Step Validation Loss
3.4664 1.0 6353 3.1038
3.2417 2.0 12706 2.9305
3.1393 3.0 19059 2.8642
3.0842 4.0 25412 2.8270
3.0354 5.0 31765 2.8060
2.998 6.0 38118 2.7894
2.9697 7.0 44471 2.7773
2.9433 8.0 50824 2.7678
2.9223 9.0 57177 2.7611
2.9009 10.0 63530 2.7548
2.8859 11.0 69883 2.7512
2.8621 12.0 76236 2.7464
2.8514 13.0 82589 2.7435
2.8427 14.0 88942 2.7416
2.8226 15.0 95295 2.7390
2.8066 16.0 101648 2.7361
2.7959 17.0 108001 2.7351
2.7775 18.0 114354 2.7329
2.7659 19.0 120707 2.7322
2.7542 20.0 127060 2.7324

Framework versions

  • Transformers 4.30.2
  • Pytorch 2.11.0+cu130
  • Datasets 4.1.1
  • Tokenizers 0.13.3
Downloads last month
128
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support