results

This model is a fine-tuned version of t5-base on the None dataset. It achieves the following results on the evaluation set:

  • Loss: 1.1152

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 1e-05
  • train_batch_size: 1
  • eval_batch_size: 1
  • seed: 42
  • optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
  • lr_scheduler_type: cosine
  • lr_scheduler_warmup_ratio: 0.1
  • num_epochs: 20
  • mixed_precision_training: Native AMP

Training results

Training Loss Epoch Step Validation Loss
14.0328 1.0 586 13.4181
13.513 2.0 1172 10.5642
10.507 3.0 1758 5.6171
5.7516 4.0 2344 3.1528
2.8842 5.0 2930 2.4462
1.8802 6.0 3516 2.0028
1.5495 7.0 4102 1.7180
1.4116 8.0 4688 1.4359
1.3089 9.0 5274 1.3587
1.1416 10.0 5860 1.2989
1.1086 11.0 6446 1.2506
0.9502 12.0 7032 1.1806
0.9889 13.0 7618 1.1599
0.887 14.0 8204 1.1429
0.9452 15.0 8790 1.1311
0.8131 16.0 9376 1.1235
0.8805 17.0 9962 1.1191
0.8354 18.0 10548 1.1163
0.8135 19.0 11134 1.1153
0.8292 20.0 11720 1.1152

Framework versions

  • PEFT 0.17.0
  • Transformers 4.54.1
  • Pytorch 2.6.0+cu124
  • Datasets 4.0.0
  • Tokenizers 0.21.4
Downloads last month
4
Safetensors
Model size
0.2B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Null77/results

Adapter
(85)
this model