A-mlp-linear-21L

This model is a fine-tuned version of on an unknown dataset. It achieves the following results on the evaluation set:

  • Loss: 2.6463

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 0.001
  • train_batch_size: 512
  • eval_batch_size: 512
  • seed: 42
  • optimizer: Use OptimizerNames.ADAMW_TORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
  • lr_scheduler_type: constant
  • training_steps: 1000

Training results

Training Loss Epoch Step Validation Loss
6.0000 0.0270 50 5.5702
4.9394 0.0539 100 4.7847
4.4303 0.0809 150 4.2523
3.9880 0.1078 200 3.9186
3.7869 0.1348 250 3.6822
3.5519 0.1617 300 3.5238
3.4455 0.1887 350 3.4025
3.2958 0.2156 400 3.2791
3.2150 0.2426 450 3.1811
3.1018 0.2695 500 3.1056
3.0467 0.2965 550 3.0225
2.9589 0.3235 600 2.9538
2.9133 0.3504 650 2.9055
2.8518 0.3774 700 2.8684
2.8155 0.4043 750 2.8133
2.7822 0.4313 800 2.7784
2.7390 0.4582 850 2.7363
2.7122 0.4852 900 2.7042
2.6723 0.5121 950 2.6710
2.6482 0.5391 1000 2.6463

Framework versions

  • Transformers 5.15.0.dev0
  • Pytorch 2.6.0+cu124
  • Datasets 5.0.1
  • Tokenizers 0.22.2
Downloads last month
-
Safetensors
Model size
3.97M params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support