CodeIsAbstract commited on
Commit
1972768
·
verified ·
1 Parent(s): 807ebdf

Training in progress, step 16000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4eda0e89aa4d3d282525d77c55d3bb3bc455baed6788b7932726886a4fec8d9d
3
  size 469337272
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:afdb578d15df2a00bc32ac072285dcbcb069d3c9c5460861f886475efcd85164
3
  size 469337272
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1edb7194df3a9589c4165f828399d05a5b3aae13f4977bb578f5509f2695427b
3
  size 938825803
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:267768100da374098cbc48ba8a341f59f95d2cdcc9d105034ef525f3293cf20d
3
  size 938825803
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2c47bf8207ce24fd1d44b017f106d799e41cb97bfb17f06383eccd30d2f40350
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7cbf49dc033886911a7348f81ce5fce24d65e1323060b1506778655086bd9a64
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:54283825bf988fc504a674e83415482fb216062ac68ed73b527e8f8eb54d9eec
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7cf800c433ec0091a4dde726685b2353c8f62332779c346afea00191f732952f
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.10909090909090909,
6
  "eval_steps": 1000,
7
- "global_step": 12000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -944,6 +944,318 @@
944
  "eval_samples_per_second": 84.026,
945
  "eval_steps_per_second": 21.006,
946
  "step": 12000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
947
  }
948
  ],
949
  "logging_steps": 100,
@@ -963,7 +1275,7 @@
963
  "attributes": {}
964
  }
965
  },
966
- "total_flos": 2.98974971953152e+17,
967
  "train_batch_size": 22,
968
  "trial_name": null,
969
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.14545454545454545,
6
  "eval_steps": 1000,
7
+ "global_step": 16000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
944
  "eval_samples_per_second": 84.026,
945
  "eval_steps_per_second": 21.006,
946
  "step": 12000
947
+ },
948
+ {
949
+ "epoch": 0.11,
950
+ "grad_norm": 0.16330398619174957,
951
+ "learning_rate": 0.0009710883898021361,
952
+ "loss": 2.98108154296875,
953
+ "step": 12100
954
+ },
955
+ {
956
+ "epoch": 0.11090909090909092,
957
+ "grad_norm": 0.16032378375530243,
958
+ "learning_rate": 0.0009706072655731501,
959
+ "loss": 2.975714111328125,
960
+ "step": 12200
961
+ },
962
+ {
963
+ "epoch": 0.11181818181818182,
964
+ "grad_norm": 0.15098635852336884,
965
+ "learning_rate": 0.00097012229225515,
966
+ "loss": 2.967715148925781,
967
+ "step": 12300
968
+ },
969
+ {
970
+ "epoch": 0.11272727272727273,
971
+ "grad_norm": 0.16129878163337708,
972
+ "learning_rate": 0.0009696334738147246,
973
+ "loss": 2.9537789916992185,
974
+ "step": 12400
975
+ },
976
+ {
977
+ "epoch": 0.11363636363636363,
978
+ "grad_norm": 0.1677810102701187,
979
+ "learning_rate": 0.0009691408142499116,
980
+ "loss": 2.9610797119140626,
981
+ "step": 12500
982
+ },
983
+ {
984
+ "epoch": 0.11454545454545455,
985
+ "grad_norm": 0.176312655210495,
986
+ "learning_rate": 0.0009686443175901656,
987
+ "loss": 3.0001925659179687,
988
+ "step": 12600
989
+ },
990
+ {
991
+ "epoch": 0.11545454545454545,
992
+ "grad_norm": 0.16458939015865326,
993
+ "learning_rate": 0.0009681439878963245,
994
+ "loss": 2.932486572265625,
995
+ "step": 12700
996
+ },
997
+ {
998
+ "epoch": 0.11636363636363636,
999
+ "grad_norm": 0.1687006801366806,
1000
+ "learning_rate": 0.0009676398292605766,
1001
+ "loss": 2.96806396484375,
1002
+ "step": 12800
1003
+ },
1004
+ {
1005
+ "epoch": 0.11727272727272728,
1006
+ "grad_norm": 0.15523017942905426,
1007
+ "learning_rate": 0.0009671318458064269,
1008
+ "loss": 2.977980651855469,
1009
+ "step": 12900
1010
+ },
1011
+ {
1012
+ "epoch": 0.11818181818181818,
1013
+ "grad_norm": 0.15686143934726715,
1014
+ "learning_rate": 0.0009666200416886638,
1015
+ "loss": 2.9614358520507813,
1016
+ "step": 13000
1017
+ },
1018
+ {
1019
+ "epoch": 0.11818181818181818,
1020
+ "eval_loss": 3.310213565826416,
1021
+ "eval_runtime": 6.7958,
1022
+ "eval_samples_per_second": 84.758,
1023
+ "eval_steps_per_second": 21.19,
1024
+ "step": 13000
1025
+ },
1026
+ {
1027
+ "epoch": 0.1190909090909091,
1028
+ "grad_norm": 0.15569010376930237,
1029
+ "learning_rate": 0.0009661044210933246,
1030
+ "loss": 2.950162658691406,
1031
+ "step": 13100
1032
+ },
1033
+ {
1034
+ "epoch": 0.12,
1035
+ "grad_norm": 0.15551169216632843,
1036
+ "learning_rate": 0.0009655849882376615,
1037
+ "loss": 2.9463400268554687,
1038
+ "step": 13200
1039
+ },
1040
+ {
1041
+ "epoch": 0.12090909090909091,
1042
+ "grad_norm": 0.1576288491487503,
1043
+ "learning_rate": 0.0009650617473701073,
1044
+ "loss": 2.9366680908203127,
1045
+ "step": 13300
1046
+ },
1047
+ {
1048
+ "epoch": 0.12181818181818181,
1049
+ "grad_norm": 0.16019435226917267,
1050
+ "learning_rate": 0.0009645347027702405,
1051
+ "loss": 2.9609390258789063,
1052
+ "step": 13400
1053
+ },
1054
+ {
1055
+ "epoch": 0.12272727272727273,
1056
+ "grad_norm": 0.19406898319721222,
1057
+ "learning_rate": 0.0009640038587487499,
1058
+ "loss": 2.9381414794921876,
1059
+ "step": 13500
1060
+ },
1061
+ {
1062
+ "epoch": 0.12363636363636364,
1063
+ "grad_norm": 0.14867821335792542,
1064
+ "learning_rate": 0.0009634692196474001,
1065
+ "loss": 2.943419189453125,
1066
+ "step": 13600
1067
+ },
1068
+ {
1069
+ "epoch": 0.12454545454545454,
1070
+ "grad_norm": 0.14702503383159637,
1071
+ "learning_rate": 0.0009629307898389953,
1072
+ "loss": 2.923211669921875,
1073
+ "step": 13700
1074
+ },
1075
+ {
1076
+ "epoch": 0.12545454545454546,
1077
+ "grad_norm": 0.19858944416046143,
1078
+ "learning_rate": 0.0009623885737273442,
1079
+ "loss": 2.9624624633789063,
1080
+ "step": 13800
1081
+ },
1082
+ {
1083
+ "epoch": 0.12636363636363637,
1084
+ "grad_norm": 0.15279068052768707,
1085
+ "learning_rate": 0.0009618425757472229,
1086
+ "loss": 2.9194540405273437,
1087
+ "step": 13900
1088
+ },
1089
+ {
1090
+ "epoch": 0.12727272727272726,
1091
+ "grad_norm": 0.16745012998580933,
1092
+ "learning_rate": 0.0009612928003643404,
1093
+ "loss": 2.950616760253906,
1094
+ "step": 14000
1095
+ },
1096
+ {
1097
+ "epoch": 0.12727272727272726,
1098
+ "eval_loss": 3.294524669647217,
1099
+ "eval_runtime": 6.7865,
1100
+ "eval_samples_per_second": 84.874,
1101
+ "eval_steps_per_second": 21.218,
1102
+ "step": 14000
1103
+ },
1104
+ {
1105
+ "epoch": 0.12818181818181817,
1106
+ "grad_norm": 0.15464717149734497,
1107
+ "learning_rate": 0.0009607392520753,
1108
+ "loss": 2.936573791503906,
1109
+ "step": 14100
1110
+ },
1111
+ {
1112
+ "epoch": 0.1290909090909091,
1113
+ "grad_norm": 0.17451342940330505,
1114
+ "learning_rate": 0.0009601819354075643,
1115
+ "loss": 2.9196566772460937,
1116
+ "step": 14200
1117
+ },
1118
+ {
1119
+ "epoch": 0.13,
1120
+ "grad_norm": 0.15395045280456543,
1121
+ "learning_rate": 0.0009596208549194167,
1122
+ "loss": 2.9657086181640624,
1123
+ "step": 14300
1124
+ },
1125
+ {
1126
+ "epoch": 0.13090909090909092,
1127
+ "grad_norm": 0.16990916430950165,
1128
+ "learning_rate": 0.0009590560151999256,
1129
+ "loss": 2.9283480834960938,
1130
+ "step": 14400
1131
+ },
1132
+ {
1133
+ "epoch": 0.1318181818181818,
1134
+ "grad_norm": 0.14847813546657562,
1135
+ "learning_rate": 0.0009584874208689055,
1136
+ "loss": 2.9426678466796874,
1137
+ "step": 14500
1138
+ },
1139
+ {
1140
+ "epoch": 0.13272727272727272,
1141
+ "grad_norm": 0.21499793231487274,
1142
+ "learning_rate": 0.00095791507657688,
1143
+ "loss": 2.9166836547851562,
1144
+ "step": 14600
1145
+ },
1146
+ {
1147
+ "epoch": 0.13363636363636364,
1148
+ "grad_norm": 0.14092333614826202,
1149
+ "learning_rate": 0.0009573389870050435,
1150
+ "loss": 2.9289419555664065,
1151
+ "step": 14700
1152
+ },
1153
+ {
1154
+ "epoch": 0.13454545454545455,
1155
+ "grad_norm": 0.15405072271823883,
1156
+ "learning_rate": 0.0009567591568652231,
1157
+ "loss": 2.9462161254882813,
1158
+ "step": 14800
1159
+ },
1160
+ {
1161
+ "epoch": 0.13545454545454547,
1162
+ "grad_norm": 0.15389932692050934,
1163
+ "learning_rate": 0.00095617559089984,
1164
+ "loss": 2.9510357666015623,
1165
+ "step": 14900
1166
+ },
1167
+ {
1168
+ "epoch": 0.13636363636363635,
1169
+ "grad_norm": 0.157777339220047,
1170
+ "learning_rate": 0.0009555882938818703,
1171
+ "loss": 2.9332815551757814,
1172
+ "step": 15000
1173
+ },
1174
+ {
1175
+ "epoch": 0.13636363636363635,
1176
+ "eval_loss": 3.2715365886688232,
1177
+ "eval_runtime": 6.8421,
1178
+ "eval_samples_per_second": 84.184,
1179
+ "eval_steps_per_second": 21.046,
1180
+ "step": 15000
1181
+ },
1182
+ {
1183
+ "epoch": 0.13727272727272727,
1184
+ "grad_norm": 0.15498115122318268,
1185
+ "learning_rate": 0.0009549972706148067,
1186
+ "loss": 2.9289910888671873,
1187
+ "step": 15100
1188
+ },
1189
+ {
1190
+ "epoch": 0.13818181818181818,
1191
+ "grad_norm": 0.17162440717220306,
1192
+ "learning_rate": 0.0009544025259326188,
1193
+ "loss": 2.9223281860351564,
1194
+ "step": 15200
1195
+ },
1196
+ {
1197
+ "epoch": 0.1390909090909091,
1198
+ "grad_norm": 0.16399726271629333,
1199
+ "learning_rate": 0.0009538040646997133,
1200
+ "loss": 2.910879821777344,
1201
+ "step": 15300
1202
+ },
1203
+ {
1204
+ "epoch": 0.14,
1205
+ "grad_norm": 0.20758388936519623,
1206
+ "learning_rate": 0.0009532018918108949,
1207
+ "loss": 2.9101876831054687,
1208
+ "step": 15400
1209
+ },
1210
+ {
1211
+ "epoch": 0.1409090909090909,
1212
+ "grad_norm": 0.15389910340309143,
1213
+ "learning_rate": 0.0009525960121913253,
1214
+ "loss": 2.9736376953125,
1215
+ "step": 15500
1216
+ },
1217
+ {
1218
+ "epoch": 0.14181818181818182,
1219
+ "grad_norm": 0.14939367771148682,
1220
+ "learning_rate": 0.0009519864307964842,
1221
+ "loss": 2.9354534912109376,
1222
+ "step": 15600
1223
+ },
1224
+ {
1225
+ "epoch": 0.14272727272727273,
1226
+ "grad_norm": 0.18233561515808105,
1227
+ "learning_rate": 0.0009513731526121277,
1228
+ "loss": 2.9248681640625,
1229
+ "step": 15700
1230
+ },
1231
+ {
1232
+ "epoch": 0.14363636363636365,
1233
+ "grad_norm": 0.16295863687992096,
1234
+ "learning_rate": 0.0009507561826542477,
1235
+ "loss": 2.92017578125,
1236
+ "step": 15800
1237
+ },
1238
+ {
1239
+ "epoch": 0.14454545454545453,
1240
+ "grad_norm": 0.15371564030647278,
1241
+ "learning_rate": 0.0009501355259690314,
1242
+ "loss": 2.910662841796875,
1243
+ "step": 15900
1244
+ },
1245
+ {
1246
+ "epoch": 0.14545454545454545,
1247
+ "grad_norm": 0.15596537292003632,
1248
+ "learning_rate": 0.0009495111876328195,
1249
+ "loss": 2.898775939941406,
1250
+ "step": 16000
1251
+ },
1252
+ {
1253
+ "epoch": 0.14545454545454545,
1254
+ "eval_loss": 3.2674407958984375,
1255
+ "eval_runtime": 6.8454,
1256
+ "eval_samples_per_second": 84.143,
1257
+ "eval_steps_per_second": 21.036,
1258
+ "step": 16000
1259
  }
1260
  ],
1261
  "logging_steps": 100,
 
1275
  "attributes": {}
1276
  }
1277
  },
1278
+ "total_flos": 3.98633295937536e+17,
1279
  "train_batch_size": 22,
1280
  "trial_name": null,
1281
  "trial_params": null