gpt2_small_expandedbabyLM_100k_42

This model is a fine-tuned version of on an unknown dataset. It achieves the following results on the evaluation set:

  • Loss: 7.4001

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 0.0001
  • train_batch_size: 256
  • eval_batch_size: 256
  • seed: 42
  • optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
  • lr_scheduler_type: linear
  • lr_scheduler_warmup_steps: 4000
  • num_epochs: 20

Training results

Training Loss Epoch Step Validation Loss
No log 1.0 6 10.8728
No log 2.0 12 10.7595
No log 3.0 18 10.5743
No log 4.0 24 10.3364
No log 5.0 30 10.0761
No log 6.0 36 9.8185
No log 7.0 42 9.5729
No log 8.0 48 9.3535
No log 9.0 54 9.1574
No log 10.0 60 8.9807
No log 11.0 66 8.8054
No log 12.0 72 8.6149
No log 13.0 78 8.4188
No log 14.0 84 8.2324
No log 15.0 90 8.0558
No log 16.0 96 7.8964
No log 17.0 102 7.7522
No log 18.0 108 7.6229
No log 19.0 114 7.4994
No log 20.0 120 7.4001

Framework versions

  • Transformers 4.30.2
  • Pytorch 2.11.0+cu130
  • Datasets 4.1.1
  • Tokenizers 0.13.3
Downloads last month
142
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support