Training in progress, step 50, checkpoint

Browse files

Files changed (5) hide show

last-checkpoint/adapter_model.safetensors +1 -1
last-checkpoint/optimizer.pt +1 -1
last-checkpoint/rng_state.pth +1 -1
last-checkpoint/scheduler.pt +1 -1
last-checkpoint/trainer_state.json +202 -3

last-checkpoint/adapter_model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:c87d608a6002058392b637632a2bd46e6de846f6bde7f1dddc913861cadf935b
 size 167832240

 version https://git-lfs.github.com/spec/v1
+oid sha256:6cf8863cd81a04f9b8f77a944dca1a63f90b3c5ca3eae59bb8183a29cbf035f4
 size 167832240

last-checkpoint/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:6bac2a045e0fabce5e2a67fad53d8e9ca09664815e0fd11302fe2ad8586730ea
 size 335922386

 version https://git-lfs.github.com/spec/v1
+oid sha256:40e8a7178693c447fbded998e3d47173bf595a3157bbecd0abad3e165120743e
 size 335922386

last-checkpoint/rng_state.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:4eb56092cc8ea9ba091dac6b07cb73418ed9d343f5a72342fc3307e5ddd8ec0c
 size 14244

 version https://git-lfs.github.com/spec/v1
+oid sha256:98d841eda044e2a0b4625c1a49f398ba41b30f358c4216b4153690415e794a13
 size 14244

last-checkpoint/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:8c931ece4da598a541d357f6c98f67481603252e193960022d37ddd49c584b1f
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:a89ffc445067fef9d6d02bb3ff9e61d5e3209e6fa67c7259b3b364b90dbaa2cd
 size 1064

last-checkpoint/trainer_state.json CHANGED Viewed

@@ -1,9 +1,9 @@
 {
   "best_metric": null,
   "best_model_checkpoint": null,
-  "epoch": 0.023820867079561697,
   "eval_steps": 9,
-  "global_step": 25,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
@@ -206,6 +206,205 @@
       "learning_rate": 9.330127018922194e-05,
       "loss": 2.2325,
       "step": 25
     }
   ],
   "logging_steps": 1,
@@ -225,7 +424,7 @@
       "attributes": {}
     }
   },
-  "total_flos": 3.70943641780224e+16,
   "train_batch_size": 8,
   "trial_name": null,
   "trial_params": null

 {
   "best_metric": null,
   "best_model_checkpoint": null,
+  "epoch": 0.04764173415912339,
   "eval_steps": 9,
+  "global_step": 50,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
       "learning_rate": 9.330127018922194e-05,
       "loss": 2.2325,
       "step": 25
+    },
+    {
+      "epoch": 0.024773701762744165,
+      "grad_norm": 1.1608455181121826,
+      "learning_rate": 9.24024048078213e-05,
+      "loss": 2.4246,
+      "step": 26
+    },
+    {
+      "epoch": 0.02572653644592663,
+      "grad_norm": 1.520585298538208,
+      "learning_rate": 9.145187862775209e-05,
+      "loss": 2.7656,
+      "step": 27
+    },
+    {
+      "epoch": 0.02572653644592663,
+      "eval_loss": 2.388444423675537,
+      "eval_runtime": 195.2733,
+      "eval_samples_per_second": 4.527,
+      "eval_steps_per_second": 0.568,
+      "step": 27
+    },
+    {
+      "epoch": 0.0266793711291091,
+      "grad_norm": 1.0983319282531738,
+      "learning_rate": 9.045084971874738e-05,
+      "loss": 2.0036,
+      "step": 28
+    },
+    {
+      "epoch": 0.027632205812291567,
+      "grad_norm": 1.2645291090011597,
+      "learning_rate": 8.940053768033609e-05,
+      "loss": 2.3768,
+      "step": 29
+    },
+    {
+      "epoch": 0.028585040495474036,
+      "grad_norm": 1.0958126783370972,
+      "learning_rate": 8.83022221559489e-05,
+      "loss": 2.1706,
+      "step": 30
+    },
+    {
+      "epoch": 0.029537875178656504,
+      "grad_norm": 1.6864413022994995,
+      "learning_rate": 8.715724127386972e-05,
+      "loss": 2.7613,
+      "step": 31
+    },
+    {
+      "epoch": 0.03049070986183897,
+      "grad_norm": 8.486473083496094,
+      "learning_rate": 8.596699001693255e-05,
+      "loss": 2.4582,
+      "step": 32
+    },
+    {
+      "epoch": 0.03144354454502144,
+      "grad_norm": 1.4310030937194824,
+      "learning_rate": 8.473291852294987e-05,
+      "loss": 2.5887,
+      "step": 33
+    },
+    {
+      "epoch": 0.03239637922820391,
+      "grad_norm": 1.9405314922332764,
+      "learning_rate": 8.345653031794292e-05,
+      "loss": 2.3926,
+      "step": 34
+    },
+    {
+      "epoch": 0.03334921391138637,
+      "grad_norm": 1.6728031635284424,
+      "learning_rate": 8.213938048432697e-05,
+      "loss": 2.3928,
+      "step": 35
+    },
+    {
+      "epoch": 0.03430204859456884,
+      "grad_norm": 2.5665833950042725,
+      "learning_rate": 8.07830737662829e-05,
+      "loss": 2.5681,
+      "step": 36
+    },
+    {
+      "epoch": 0.03430204859456884,
+      "eval_loss": 2.3183698654174805,
+      "eval_runtime": 195.29,
+      "eval_samples_per_second": 4.527,
+      "eval_steps_per_second": 0.568,
+      "step": 36
+    },
+    {
+      "epoch": 0.03525488327775131,
+      "grad_norm": 3.006268262863159,
+      "learning_rate": 7.938926261462366e-05,
+      "loss": 2.2294,
+      "step": 37
+    },
+    {
+      "epoch": 0.03620771796093378,
+      "grad_norm": 1.0738325119018555,
+      "learning_rate": 7.795964517353735e-05,
+      "loss": 2.3217,
+      "step": 38
+    },
+    {
+      "epoch": 0.037160552644116246,
+      "grad_norm": 1.1440376043319702,
+      "learning_rate": 7.649596321166024e-05,
+      "loss": 2.1976,
+      "step": 39
+    },
+    {
+      "epoch": 0.038113387327298714,
+      "grad_norm": 1.2780272960662842,
+      "learning_rate": 7.500000000000001e-05,
+      "loss": 2.2665,
+      "step": 40
+    },
+    {
+      "epoch": 0.03906622201048118,
+      "grad_norm": 1.0667051076889038,
+      "learning_rate": 7.347357813929454e-05,
+      "loss": 2.2043,
+      "step": 41
+    },
+    {
+      "epoch": 0.04001905669366365,
+      "grad_norm": 1.230981707572937,
+      "learning_rate": 7.191855733945387e-05,
+      "loss": 1.9738,
+      "step": 42
+    },
+    {
+      "epoch": 0.04097189137684612,
+      "grad_norm": 1.1416908502578735,
+      "learning_rate": 7.033683215379002e-05,
+      "loss": 2.256,
+      "step": 43
+    },
+    {
+      "epoch": 0.04192472606002858,
+      "grad_norm": 1.4842567443847656,
+      "learning_rate": 6.873032967079561e-05,
+      "loss": 2.2914,
+      "step": 44
+    },
+    {
+      "epoch": 0.04287756074321105,
+      "grad_norm": 1.039803147315979,
+      "learning_rate": 6.710100716628344e-05,
+      "loss": 2.1142,
+      "step": 45
+    },
+    {
+      "epoch": 0.04287756074321105,
+      "eval_loss": 2.283740520477295,
+      "eval_runtime": 195.2949,
+      "eval_samples_per_second": 4.526,
+      "eval_steps_per_second": 0.568,
+      "step": 45
+    },
+    {
+      "epoch": 0.04383039542639352,
+      "grad_norm": 2.066823720932007,
+      "learning_rate": 6.545084971874738e-05,
+      "loss": 2.2865,
+      "step": 46
+    },
+    {
+      "epoch": 0.04478323010957599,
+      "grad_norm": 1.3638314008712769,
+      "learning_rate": 6.378186779084995e-05,
+      "loss": 2.1797,
+      "step": 47
+    },
+    {
+      "epoch": 0.045736064792758456,
+      "grad_norm": 1.3101152181625366,
+      "learning_rate": 6.209609477998338e-05,
+      "loss": 2.3253,
+      "step": 48
+    },
+    {
+      "epoch": 0.046688899475940925,
+      "grad_norm": 1.1173464059829712,
+      "learning_rate": 6.0395584540887963e-05,
+      "loss": 2.1469,
+      "step": 49
+    },
+    {
+      "epoch": 0.04764173415912339,
+      "grad_norm": 0.9268816113471985,
+      "learning_rate": 5.868240888334653e-05,
+      "loss": 2.0037,
+      "step": 50
     }
   ],
   "logging_steps": 1,
       "attributes": {}
     }
   },
+  "total_flos": 7.41887283560448e+16,
   "train_batch_size": 8,
   "trial_name": null,
   "trial_params": null