Olmo / trainer_state.json
Codemaster67's picture
Upload folder using huggingface_hub
d444625 verified
Raw
History Blame Contribute Delete
28.4 kB
{
"best_global_step": 1200,
"best_metric": 1.0421009063720703,
"best_model_checkpoint": "./olmo_chem_lora_cpt_QLoRA_r64_alpha128/checkpoint-1200",
"epoch": 0.4819277108433735,
"eval_steps": 50,
"global_step": 1200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00040160642570281126,
"grad_norm": 36.74913787841797,
"learning_rate": 0.0,
"loss": 2.976954936981201,
"step": 1
},
{
"epoch": 0.004016064257028112,
"grad_norm": 40.237674713134766,
"learning_rate": 3.614457831325301e-07,
"loss": 3.035895029703776,
"step": 10
},
{
"epoch": 0.008032128514056224,
"grad_norm": 17.999801635742188,
"learning_rate": 7.630522088353415e-07,
"loss": 2.75059814453125,
"step": 20
},
{
"epoch": 0.012048192771084338,
"grad_norm": 13.56201171875,
"learning_rate": 1.1646586345381528e-06,
"loss": 2.38979434967041,
"step": 30
},
{
"epoch": 0.01606425702811245,
"grad_norm": 10.360796928405762,
"learning_rate": 1.566265060240964e-06,
"loss": 2.0525840759277343,
"step": 40
},
{
"epoch": 0.020080321285140562,
"grad_norm": 16.763572692871094,
"learning_rate": 1.967871485943775e-06,
"loss": 1.8794815063476562,
"step": 50
},
{
"epoch": 0.020080321285140562,
"eval_loss": 1.8244566917419434,
"eval_runtime": 224.0827,
"eval_samples_per_second": 17.087,
"eval_steps_per_second": 0.536,
"step": 50
},
{
"epoch": 0.024096385542168676,
"grad_norm": 10.257641792297363,
"learning_rate": 2.3694779116465868e-06,
"loss": 1.7737924575805664,
"step": 60
},
{
"epoch": 0.028112449799196786,
"grad_norm": 20.079599380493164,
"learning_rate": 2.771084337349398e-06,
"loss": 1.6911544799804688,
"step": 70
},
{
"epoch": 0.0321285140562249,
"grad_norm": 10.683834075927734,
"learning_rate": 3.172690763052209e-06,
"loss": 1.623727798461914,
"step": 80
},
{
"epoch": 0.03614457831325301,
"grad_norm": 11.064703941345215,
"learning_rate": 3.5742971887550204e-06,
"loss": 1.5919998168945313,
"step": 90
},
{
"epoch": 0.040160642570281124,
"grad_norm": 9.582036972045898,
"learning_rate": 3.975903614457832e-06,
"loss": 1.5387580871582032,
"step": 100
},
{
"epoch": 0.040160642570281124,
"eval_loss": 1.5256246328353882,
"eval_runtime": 224.0546,
"eval_samples_per_second": 17.09,
"eval_steps_per_second": 0.536,
"step": 100
},
{
"epoch": 0.04417670682730924,
"grad_norm": 9.940044403076172,
"learning_rate": 4.377510040160643e-06,
"loss": 1.49784574508667,
"step": 110
},
{
"epoch": 0.04819277108433735,
"grad_norm": 11.362184524536133,
"learning_rate": 4.779116465863454e-06,
"loss": 1.5389199256896973,
"step": 120
},
{
"epoch": 0.05220883534136546,
"grad_norm": 9.787059783935547,
"learning_rate": 5.180722891566266e-06,
"loss": 1.4939092636108398,
"step": 130
},
{
"epoch": 0.05622489959839357,
"grad_norm": 9.76535701751709,
"learning_rate": 5.582329317269076e-06,
"loss": 1.4706912994384767,
"step": 140
},
{
"epoch": 0.060240963855421686,
"grad_norm": 9.557772636413574,
"learning_rate": 5.983935742971888e-06,
"loss": 1.4295058250427246,
"step": 150
},
{
"epoch": 0.060240963855421686,
"eval_loss": 1.4075552225112915,
"eval_runtime": 224.3397,
"eval_samples_per_second": 17.068,
"eval_steps_per_second": 0.535,
"step": 150
},
{
"epoch": 0.0642570281124498,
"grad_norm": 8.256240844726562,
"learning_rate": 6.385542168674699e-06,
"loss": 1.3934820175170899,
"step": 160
},
{
"epoch": 0.06827309236947791,
"grad_norm": 10.668194770812988,
"learning_rate": 6.78714859437751e-06,
"loss": 1.3897838592529297,
"step": 170
},
{
"epoch": 0.07228915662650602,
"grad_norm": 8.989994049072266,
"learning_rate": 7.188755020080321e-06,
"loss": 1.3797410011291504,
"step": 180
},
{
"epoch": 0.07630522088353414,
"grad_norm": 7.747810363769531,
"learning_rate": 7.590361445783133e-06,
"loss": 1.3742728233337402,
"step": 190
},
{
"epoch": 0.08032128514056225,
"grad_norm": 7.7544074058532715,
"learning_rate": 7.991967871485944e-06,
"loss": 1.3565238952636718,
"step": 200
},
{
"epoch": 0.08032128514056225,
"eval_loss": 1.3342411518096924,
"eval_runtime": 224.1047,
"eval_samples_per_second": 17.086,
"eval_steps_per_second": 0.535,
"step": 200
},
{
"epoch": 0.08433734939759036,
"grad_norm": 7.9385085105896,
"learning_rate": 8.393574297188756e-06,
"loss": 1.3680735588073731,
"step": 210
},
{
"epoch": 0.08835341365461848,
"grad_norm": 7.368689060211182,
"learning_rate": 8.795180722891567e-06,
"loss": 1.3239299774169921,
"step": 220
},
{
"epoch": 0.09236947791164658,
"grad_norm": 8.16849422454834,
"learning_rate": 9.196787148594378e-06,
"loss": 1.330996036529541,
"step": 230
},
{
"epoch": 0.0963855421686747,
"grad_norm": 9.847034454345703,
"learning_rate": 9.598393574297188e-06,
"loss": 1.3019088745117187,
"step": 240
},
{
"epoch": 0.10040160642570281,
"grad_norm": 6.754732131958008,
"learning_rate": 1e-05,
"loss": 1.283926010131836,
"step": 250
},
{
"epoch": 0.10040160642570281,
"eval_loss": 1.2852883338928223,
"eval_runtime": 224.1824,
"eval_samples_per_second": 17.08,
"eval_steps_per_second": 0.535,
"step": 250
},
{
"epoch": 0.10441767068273092,
"grad_norm": 6.626065254211426,
"learning_rate": 9.999508697551502e-06,
"loss": 1.2729861259460449,
"step": 260
},
{
"epoch": 0.10843373493975904,
"grad_norm": 6.478898525238037,
"learning_rate": 9.998034886757237e-06,
"loss": 1.2489843368530273,
"step": 270
},
{
"epoch": 0.11244979919678715,
"grad_norm": 6.022712230682373,
"learning_rate": 9.99557885725195e-06,
"loss": 1.2988578796386718,
"step": 280
},
{
"epoch": 0.11646586345381527,
"grad_norm": 6.245314598083496,
"learning_rate": 9.992141091696967e-06,
"loss": 1.2607011795043945,
"step": 290
},
{
"epoch": 0.12048192771084337,
"grad_norm": 6.8380889892578125,
"learning_rate": 9.987722265685338e-06,
"loss": 1.2081457138061524,
"step": 300
},
{
"epoch": 0.12048192771084337,
"eval_loss": 1.2430709600448608,
"eval_runtime": 224.0772,
"eval_samples_per_second": 17.088,
"eval_steps_per_second": 0.536,
"step": 300
},
{
"epoch": 0.12449799196787148,
"grad_norm": 5.553050518035889,
"learning_rate": 9.98232324760908e-06,
"loss": 1.2201088905334472,
"step": 310
},
{
"epoch": 0.1285140562248996,
"grad_norm": 5.528981685638428,
"learning_rate": 9.975945098488514e-06,
"loss": 1.2170144081115724,
"step": 320
},
{
"epoch": 0.13253012048192772,
"grad_norm": 6.345343589782715,
"learning_rate": 9.96858907176375e-06,
"loss": 1.2358662605285644,
"step": 330
},
{
"epoch": 0.13654618473895583,
"grad_norm": 5.249575138092041,
"learning_rate": 9.960256613048367e-06,
"loss": 1.2119761466979981,
"step": 340
},
{
"epoch": 0.14056224899598393,
"grad_norm": 4.9837646484375,
"learning_rate": 9.950949359845309e-06,
"loss": 1.2059650421142578,
"step": 350
},
{
"epoch": 0.14056224899598393,
"eval_loss": 1.2071032524108887,
"eval_runtime": 224.1972,
"eval_samples_per_second": 17.079,
"eval_steps_per_second": 0.535,
"step": 350
},
{
"epoch": 0.14457831325301204,
"grad_norm": 5.1654791831970215,
"learning_rate": 9.940669141225097e-06,
"loss": 1.1992589950561523,
"step": 360
},
{
"epoch": 0.14859437751004015,
"grad_norm": 6.3491950035095215,
"learning_rate": 9.929417977466356e-06,
"loss": 1.1967281341552733,
"step": 370
},
{
"epoch": 0.15261044176706828,
"grad_norm": 6.096224308013916,
"learning_rate": 9.91719807965881e-06,
"loss": 1.184930419921875,
"step": 380
},
{
"epoch": 0.1566265060240964,
"grad_norm": 4.983779430389404,
"learning_rate": 9.904011849268744e-06,
"loss": 1.195562744140625,
"step": 390
},
{
"epoch": 0.1606425702811245,
"grad_norm": 5.229851722717285,
"learning_rate": 9.889861877667071e-06,
"loss": 1.1917385101318358,
"step": 400
},
{
"epoch": 0.1606425702811245,
"eval_loss": 1.1810219287872314,
"eval_runtime": 224.2238,
"eval_samples_per_second": 17.077,
"eval_steps_per_second": 0.535,
"step": 400
},
{
"epoch": 0.1646586345381526,
"grad_norm": 4.667690277099609,
"learning_rate": 9.874750945620066e-06,
"loss": 1.2232494354248047,
"step": 410
},
{
"epoch": 0.1686746987951807,
"grad_norm": 4.562730312347412,
"learning_rate": 9.858682022742896e-06,
"loss": 1.1690594673156738,
"step": 420
},
{
"epoch": 0.17269076305220885,
"grad_norm": 4.388287544250488,
"learning_rate": 9.84165826691602e-06,
"loss": 1.1833030700683593,
"step": 430
},
{
"epoch": 0.17670682730923695,
"grad_norm": 4.246683120727539,
"learning_rate": 9.82368302366461e-06,
"loss": 1.180044174194336,
"step": 440
},
{
"epoch": 0.18072289156626506,
"grad_norm": 6.267792224884033,
"learning_rate": 9.804759825501074e-06,
"loss": 1.1597715377807618,
"step": 450
},
{
"epoch": 0.18072289156626506,
"eval_loss": 1.1618536710739136,
"eval_runtime": 224.0476,
"eval_samples_per_second": 17.09,
"eval_steps_per_second": 0.536,
"step": 450
},
{
"epoch": 0.18473895582329317,
"grad_norm": 5.484806537628174,
"learning_rate": 9.784892391230847e-06,
"loss": 1.161270809173584,
"step": 460
},
{
"epoch": 0.18875502008032127,
"grad_norm": 6.800451278686523,
"learning_rate": 9.76408462522157e-06,
"loss": 1.1662689208984376,
"step": 470
},
{
"epoch": 0.1927710843373494,
"grad_norm": 4.338923931121826,
"learning_rate": 9.742340616635799e-06,
"loss": 1.1915185928344727,
"step": 480
},
{
"epoch": 0.19678714859437751,
"grad_norm": 4.900355815887451,
"learning_rate": 9.719664638627395e-06,
"loss": 1.179362964630127,
"step": 490
},
{
"epoch": 0.20080321285140562,
"grad_norm": 13.36780071258545,
"learning_rate": 9.69606114750177e-06,
"loss": 1.136868953704834,
"step": 500
},
{
"epoch": 0.20080321285140562,
"eval_loss": 1.167843222618103,
"eval_runtime": 224.0503,
"eval_samples_per_second": 17.09,
"eval_steps_per_second": 0.536,
"step": 500
},
{
"epoch": 0.20481927710843373,
"grad_norm": 5.8057098388671875,
"learning_rate": 9.671534781840113e-06,
"loss": 1.1644049644470216,
"step": 510
},
{
"epoch": 0.20883534136546184,
"grad_norm": 4.812023639678955,
"learning_rate": 9.646090361587828e-06,
"loss": 1.1246587753295898,
"step": 520
},
{
"epoch": 0.21285140562248997,
"grad_norm": 4.429294109344482,
"learning_rate": 9.619732887107299e-06,
"loss": 1.1263324737548828,
"step": 530
},
{
"epoch": 0.21686746987951808,
"grad_norm": 4.260849952697754,
"learning_rate": 9.592467538195229e-06,
"loss": 1.118002223968506,
"step": 540
},
{
"epoch": 0.22088353413654618,
"grad_norm": 4.285832405090332,
"learning_rate": 9.56429967306469e-06,
"loss": 1.1537700653076173,
"step": 550
},
{
"epoch": 0.22088353413654618,
"eval_loss": 1.1320561170578003,
"eval_runtime": 224.168,
"eval_samples_per_second": 17.081,
"eval_steps_per_second": 0.535,
"step": 550
},
{
"epoch": 0.2248995983935743,
"grad_norm": 5.736870288848877,
"learning_rate": 9.535234827292124e-06,
"loss": 1.1374141693115234,
"step": 560
},
{
"epoch": 0.2289156626506024,
"grad_norm": 4.176708221435547,
"learning_rate": 9.505278712729489e-06,
"loss": 1.1468097686767578,
"step": 570
},
{
"epoch": 0.23293172690763053,
"grad_norm": 4.040938854217529,
"learning_rate": 9.474437216381756e-06,
"loss": 1.132613754272461,
"step": 580
},
{
"epoch": 0.23694779116465864,
"grad_norm": 4.140848159790039,
"learning_rate": 9.442716399249995e-06,
"loss": 1.1381197929382325,
"step": 590
},
{
"epoch": 0.24096385542168675,
"grad_norm": 3.8142037391662598,
"learning_rate": 9.410122495140257e-06,
"loss": 1.1367318153381347,
"step": 600
},
{
"epoch": 0.24096385542168675,
"eval_loss": 1.1217604875564575,
"eval_runtime": 224.0839,
"eval_samples_per_second": 17.087,
"eval_steps_per_second": 0.536,
"step": 600
},
{
"epoch": 0.24497991967871485,
"grad_norm": 3.871077299118042,
"learning_rate": 9.376661909438496e-06,
"loss": 1.1195713043212892,
"step": 610
},
{
"epoch": 0.24899598393574296,
"grad_norm": 5.430377960205078,
"learning_rate": 9.342341217851791e-06,
"loss": 1.1373143196105957,
"step": 620
},
{
"epoch": 0.25301204819277107,
"grad_norm": 6.021585464477539,
"learning_rate": 9.307167165116062e-06,
"loss": 1.1249177932739258,
"step": 630
},
{
"epoch": 0.2570281124497992,
"grad_norm": 4.557471752166748,
"learning_rate": 9.271146663670605e-06,
"loss": 1.1521922111511231,
"step": 640
},
{
"epoch": 0.26104417670682734,
"grad_norm": 3.8892979621887207,
"learning_rate": 9.23428679229964e-06,
"loss": 1.138702964782715,
"step": 650
},
{
"epoch": 0.26104417670682734,
"eval_loss": 1.1032555103302002,
"eval_runtime": 224.1346,
"eval_samples_per_second": 17.083,
"eval_steps_per_second": 0.535,
"step": 650
},
{
"epoch": 0.26506024096385544,
"grad_norm": 4.048600673675537,
"learning_rate": 9.196594794741193e-06,
"loss": 1.1215006828308105,
"step": 660
},
{
"epoch": 0.26907630522088355,
"grad_norm": 4.088984966278076,
"learning_rate": 9.158078078263536e-06,
"loss": 1.1247024536132812,
"step": 670
},
{
"epoch": 0.27309236947791166,
"grad_norm": 6.832698822021484,
"learning_rate": 9.118744212209516e-06,
"loss": 1.1253211975097657,
"step": 680
},
{
"epoch": 0.27710843373493976,
"grad_norm": 4.244821071624756,
"learning_rate": 9.078600926509013e-06,
"loss": 1.1232710838317872,
"step": 690
},
{
"epoch": 0.28112449799196787,
"grad_norm": 4.204834938049316,
"learning_rate": 9.03765611015985e-06,
"loss": 1.1257820129394531,
"step": 700
},
{
"epoch": 0.28112449799196787,
"eval_loss": 1.099267840385437,
"eval_runtime": 224.1775,
"eval_samples_per_second": 17.08,
"eval_steps_per_second": 0.535,
"step": 700
},
{
"epoch": 0.285140562248996,
"grad_norm": 13.570015907287598,
"learning_rate": 8.995917809677437e-06,
"loss": 1.120689582824707,
"step": 710
},
{
"epoch": 0.2891566265060241,
"grad_norm": 4.013745307922363,
"learning_rate": 8.953394227513463e-06,
"loss": 1.0989994049072265,
"step": 720
},
{
"epoch": 0.2931726907630522,
"grad_norm": 4.636791229248047,
"learning_rate": 8.910093720443945e-06,
"loss": 1.0785343170166015,
"step": 730
},
{
"epoch": 0.2971887550200803,
"grad_norm": 5.258622169494629,
"learning_rate": 8.866024797926936e-06,
"loss": 1.1059405326843261,
"step": 740
},
{
"epoch": 0.30120481927710846,
"grad_norm": 4.196040630340576,
"learning_rate": 8.821196120430252e-06,
"loss": 1.1153934478759766,
"step": 750
},
{
"epoch": 0.30120481927710846,
"eval_loss": 1.0958428382873535,
"eval_runtime": 224.2589,
"eval_samples_per_second": 17.074,
"eval_steps_per_second": 0.535,
"step": 750
},
{
"epoch": 0.30522088353413657,
"grad_norm": 4.448573589324951,
"learning_rate": 8.775616497729502e-06,
"loss": 1.1181120872497559,
"step": 760
},
{
"epoch": 0.3092369477911647,
"grad_norm": 5.079808712005615,
"learning_rate": 8.729294887176778e-06,
"loss": 1.0942277908325195,
"step": 770
},
{
"epoch": 0.3132530120481928,
"grad_norm": 3.968134641647339,
"learning_rate": 8.682240391940355e-06,
"loss": 1.0744555473327637,
"step": 780
},
{
"epoch": 0.3172690763052209,
"grad_norm": 4.138976573944092,
"learning_rate": 8.634462259215719e-06,
"loss": 1.1014032363891602,
"step": 790
},
{
"epoch": 0.321285140562249,
"grad_norm": 3.7669668197631836,
"learning_rate": 8.58596987840831e-06,
"loss": 1.1038568496704102,
"step": 800
},
{
"epoch": 0.321285140562249,
"eval_loss": 1.0854790210723877,
"eval_runtime": 224.3132,
"eval_samples_per_second": 17.07,
"eval_steps_per_second": 0.535,
"step": 800
},
{
"epoch": 0.3253012048192771,
"grad_norm": 3.8699982166290283,
"learning_rate": 8.536772779288297e-06,
"loss": 1.1016878128051757,
"step": 810
},
{
"epoch": 0.3293172690763052,
"grad_norm": 4.875065326690674,
"learning_rate": 8.48688063011778e-06,
"loss": 1.0864307403564453,
"step": 820
},
{
"epoch": 0.3333333333333333,
"grad_norm": 3.7264904975891113,
"learning_rate": 8.43630323575078e-06,
"loss": 1.084289836883545,
"step": 830
},
{
"epoch": 0.3373493975903614,
"grad_norm": 3.7510852813720703,
"learning_rate": 8.385050535706376e-06,
"loss": 1.1047092437744142,
"step": 840
},
{
"epoch": 0.3413654618473896,
"grad_norm": 3.7756431102752686,
"learning_rate": 8.333132602215374e-06,
"loss": 1.0681782722473145,
"step": 850
},
{
"epoch": 0.3413654618473896,
"eval_loss": 1.0816028118133545,
"eval_runtime": 224.2437,
"eval_samples_per_second": 17.075,
"eval_steps_per_second": 0.535,
"step": 850
},
{
"epoch": 0.3453815261044177,
"grad_norm": 4.321180820465088,
"learning_rate": 8.280559638240914e-06,
"loss": 1.076450252532959,
"step": 860
},
{
"epoch": 0.3493975903614458,
"grad_norm": 5.125402927398682,
"learning_rate": 8.227341975473368e-06,
"loss": 1.1018122673034667,
"step": 870
},
{
"epoch": 0.3534136546184739,
"grad_norm": 4.057586193084717,
"learning_rate": 8.17349007229994e-06,
"loss": 1.0766830444335938,
"step": 880
},
{
"epoch": 0.357429718875502,
"grad_norm": 3.9465365409851074,
"learning_rate": 8.119014511749388e-06,
"loss": 1.0568387985229493,
"step": 890
},
{
"epoch": 0.3614457831325301,
"grad_norm": 5.671834468841553,
"learning_rate": 8.063925999412224e-06,
"loss": 1.064396286010742,
"step": 900
},
{
"epoch": 0.3614457831325301,
"eval_loss": 1.0756299495697021,
"eval_runtime": 224.2054,
"eval_samples_per_second": 17.078,
"eval_steps_per_second": 0.535,
"step": 900
},
{
"epoch": 0.3654618473895582,
"grad_norm": 3.911022901535034,
"learning_rate": 8.008235361336845e-06,
"loss": 1.1032384872436523,
"step": 910
},
{
"epoch": 0.36947791164658633,
"grad_norm": 3.855924129486084,
"learning_rate": 7.951953541901989e-06,
"loss": 1.0686886787414551,
"step": 920
},
{
"epoch": 0.37349397590361444,
"grad_norm": 4.947168827056885,
"learning_rate": 7.895091601665934e-06,
"loss": 1.0647593498229981,
"step": 930
},
{
"epoch": 0.37751004016064255,
"grad_norm": 4.119925022125244,
"learning_rate": 7.837660715192867e-06,
"loss": 1.0522316932678222,
"step": 940
},
{
"epoch": 0.3815261044176707,
"grad_norm": 3.602022647857666,
"learning_rate": 7.779672168856844e-06,
"loss": 1.0513050079345703,
"step": 950
},
{
"epoch": 0.3815261044176707,
"eval_loss": 1.0680068731307983,
"eval_runtime": 224.3211,
"eval_samples_per_second": 17.069,
"eval_steps_per_second": 0.535,
"step": 950
},
{
"epoch": 0.3855421686746988,
"grad_norm": 4.18943452835083,
"learning_rate": 7.721137358623786e-06,
"loss": 1.0850586891174316,
"step": 960
},
{
"epoch": 0.3895582329317269,
"grad_norm": 6.430990219116211,
"learning_rate": 7.66206778781193e-06,
"loss": 1.0583345413208007,
"step": 970
},
{
"epoch": 0.39357429718875503,
"grad_norm": 4.619312286376953,
"learning_rate": 7.6024750648311805e-06,
"loss": 1.091839599609375,
"step": 980
},
{
"epoch": 0.39759036144578314,
"grad_norm": 3.8781845569610596,
"learning_rate": 7.542370900901827e-06,
"loss": 1.0620054244995116,
"step": 990
},
{
"epoch": 0.40160642570281124,
"grad_norm": 3.7595436573028564,
"learning_rate": 7.4817671077530295e-06,
"loss": 1.0398008346557617,
"step": 1000
},
{
"epoch": 0.40160642570281124,
"eval_loss": 1.0621941089630127,
"eval_runtime": 224.1744,
"eval_samples_per_second": 17.08,
"eval_steps_per_second": 0.535,
"step": 1000
},
{
"epoch": 0.40562248995983935,
"grad_norm": 3.890206813812256,
"learning_rate": 7.420675595301574e-06,
"loss": 1.067855453491211,
"step": 1010
},
{
"epoch": 0.40963855421686746,
"grad_norm": 3.8331494331359863,
"learning_rate": 7.359108369311318e-06,
"loss": 1.0873468399047852,
"step": 1020
},
{
"epoch": 0.41365461847389556,
"grad_norm": 3.785521984100342,
"learning_rate": 7.297077529033814e-06,
"loss": 1.0355330467224122,
"step": 1030
},
{
"epoch": 0.41767068273092367,
"grad_norm": 6.754027843475342,
"learning_rate": 7.234595264830546e-06,
"loss": 1.0717147827148437,
"step": 1040
},
{
"epoch": 0.42168674698795183,
"grad_norm": 3.619626045227051,
"learning_rate": 7.171673855777271e-06,
"loss": 1.0628927230834961,
"step": 1050
},
{
"epoch": 0.42168674698795183,
"eval_loss": 1.0565131902694702,
"eval_runtime": 224.3026,
"eval_samples_per_second": 17.071,
"eval_steps_per_second": 0.535,
"step": 1050
},
{
"epoch": 0.42570281124497994,
"grad_norm": 3.654301404953003,
"learning_rate": 7.10832566725092e-06,
"loss": 1.028466033935547,
"step": 1060
},
{
"epoch": 0.42971887550200805,
"grad_norm": 4.81827449798584,
"learning_rate": 7.044563148499547e-06,
"loss": 1.0777903556823731,
"step": 1070
},
{
"epoch": 0.43373493975903615,
"grad_norm": 4.028594493865967,
"learning_rate": 6.980398830195785e-06,
"loss": 1.1094385147094727,
"step": 1080
},
{
"epoch": 0.43775100401606426,
"grad_norm": 3.782311201095581,
"learning_rate": 6.915845321974309e-06,
"loss": 1.0568254470825196,
"step": 1090
},
{
"epoch": 0.44176706827309237,
"grad_norm": 4.213383197784424,
"learning_rate": 6.85091530995378e-06,
"loss": 1.0806368827819823,
"step": 1100
},
{
"epoch": 0.44176706827309237,
"eval_loss": 1.0501891374588013,
"eval_runtime": 224.1605,
"eval_samples_per_second": 17.082,
"eval_steps_per_second": 0.535,
"step": 1100
},
{
"epoch": 0.4457831325301205,
"grad_norm": 3.598494529724121,
"learning_rate": 6.785621554243752e-06,
"loss": 1.0479291915893554,
"step": 1110
},
{
"epoch": 0.4497991967871486,
"grad_norm": 3.8993070125579834,
"learning_rate": 6.7199768864370455e-06,
"loss": 1.066202163696289,
"step": 1120
},
{
"epoch": 0.4538152610441767,
"grad_norm": 4.1509833335876465,
"learning_rate": 6.65399420708807e-06,
"loss": 1.0448795318603517,
"step": 1130
},
{
"epoch": 0.4578313253012048,
"grad_norm": 3.5259952545166016,
"learning_rate": 6.587686483177596e-06,
"loss": 1.049018383026123,
"step": 1140
},
{
"epoch": 0.46184738955823296,
"grad_norm": 3.395838975906372,
"learning_rate": 6.521066745564467e-06,
"loss": 1.0418387413024903,
"step": 1150
},
{
"epoch": 0.46184738955823296,
"eval_loss": 1.0448716878890991,
"eval_runtime": 224.2692,
"eval_samples_per_second": 17.073,
"eval_steps_per_second": 0.535,
"step": 1150
},
{
"epoch": 0.46586345381526106,
"grad_norm": 5.678968906402588,
"learning_rate": 6.454148086424767e-06,
"loss": 1.0376011848449707,
"step": 1160
},
{
"epoch": 0.46987951807228917,
"grad_norm": 4.015078067779541,
"learning_rate": 6.38694365667893e-06,
"loss": 1.0441588401794433,
"step": 1170
},
{
"epoch": 0.4738955823293173,
"grad_norm": 4.168111324310303,
"learning_rate": 6.319466663407309e-06,
"loss": 1.0368056297302246,
"step": 1180
},
{
"epoch": 0.4779116465863454,
"grad_norm": 5.260632038116455,
"learning_rate": 6.251730367254708e-06,
"loss": 1.0322036743164062,
"step": 1190
},
{
"epoch": 0.4819277108433735,
"grad_norm": 3.426922082901001,
"learning_rate": 6.1837480798243894e-06,
"loss": 1.0827327728271485,
"step": 1200
},
{
"epoch": 0.4819277108433735,
"eval_loss": 1.0421009063720703,
"eval_runtime": 224.3064,
"eval_samples_per_second": 17.07,
"eval_steps_per_second": 0.535,
"step": 1200
}
],
"logging_steps": 10,
"max_steps": 2490,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 8.318144766541824e+17,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}