finale-mlp-linear-9L

This model is a fine-tuned version of on an unknown dataset. It achieves the following results on the evaluation set:

  • Loss: 3.1081

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 0.0005
  • train_batch_size: 80
  • eval_batch_size: 80
  • seed: 42
  • gradient_accumulation_steps: 16
  • total_train_batch_size: 1280
  • optimizer: Use OptimizerNames.ADAMW_TORCH_FUSED with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
  • lr_scheduler_type: constant
  • training_steps: 750

Training results

Training Loss Epoch Step Validation Loss
102.0503 0.0674 50 5.6659
77.5119 0.1348 100 4.6899
70.3764 0.2022 150 4.2638
63.8118 0.2696 200 3.9344
61.1106 0.3370 250 3.7483
58.3348 0.4044 300 3.6138
56.6996 0.4719 350 3.4927
54.9361 0.5393 400 3.4158
53.8945 0.6067 450 3.3447
52.8687 0.6741 500 3.2968
52.3214 0.7415 550 3.2509
51.4070 0.8089 600 3.2120
50.8616 0.8763 650 3.1778
50.1968 0.9437 700 3.1350
49.7485 1.0108 750 3.1081

Framework versions

  • Transformers 5.15.0.dev0
  • Pytorch 2.6.0+cu124
  • Datasets 5.0.1
  • Tokenizers 0.22.2
Downloads last month
-
Safetensors
Model size
2M params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support