peft-dialogue-summary-training-1767960897

This model is a fine-tuned version of microsoft/phi-2 on an unknown dataset. It achieves the following results on the evaluation set:

  • Loss: 0.2741

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 0.0002
  • train_batch_size: 1
  • eval_batch_size: 8
  • seed: 42
  • gradient_accumulation_steps: 4
  • total_train_batch_size: 4
  • optimizer: Use OptimizerNames.PAGED_ADAMW_8BIT with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
  • lr_scheduler_type: linear
  • lr_scheduler_warmup_steps: 1
  • training_steps: 1000

Training results

Training Loss Epoch Step Validation Loss
1.8756 0.0665 25 0.8069
0.5969 0.1331 50 0.6492
0.7373 0.1996 75 0.5183
0.4293 0.2661 100 0.5101
0.611 0.3327 125 0.4577
0.3935 0.3992 150 0.4664
0.5535 0.4657 175 0.4308
0.3765 0.5323 200 0.4349
0.487 0.5988 225 0.4017
0.3464 0.6653 250 0.4049
0.4799 0.7319 275 0.3849
0.3313 0.7984 300 0.3953
0.4697 0.8649 325 0.3686
0.354 0.9315 350 0.3699
0.3705 0.9980 375 0.3521
0.3968 1.0639 400 0.3441
0.2887 1.1304 425 0.3566
0.3884 1.1969 450 0.3338
0.2879 1.2635 475 0.3366
0.3961 1.3300 500 0.3237
0.3062 1.3965 525 0.3233
0.3572 1.4631 550 0.3145
0.2787 1.5296 575 0.3168
0.3594 1.5961 600 0.3096
0.2788 1.6627 625 0.3116
0.3406 1.7292 650 0.3015
0.2848 1.7957 675 0.3008
0.3488 1.8623 700 0.2946
0.2774 1.9288 725 0.2960
0.3092 1.9953 750 0.2888
0.3158 2.0612 775 0.2855
0.2678 2.1277 800 0.2856
0.2927 2.1943 825 0.2854
0.276 2.2608 850 0.2819
0.3042 2.3273 875 0.2790
0.2351 2.3939 900 0.2770
0.305 2.4604 925 0.2759
0.2599 2.5269 950 0.2753
0.3014 2.5935 975 0.2747
0.2236 2.6600 1000 0.2741

Framework versions

  • PEFT 0.18.0
  • Transformers 4.57.3
  • Pytorch 2.8.0+cu126
  • Datasets 4.4.2
  • Tokenizers 0.22.1
Downloads last month
9
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for predator3769/peft-dialogue-summary-training-1767960897

Base model

microsoft/phi-2
Adapter
(992)
this model