{ "best_global_step": 1200, "best_metric": 1.0421009063720703, "best_model_checkpoint": "./olmo_chem_lora_cpt_QLoRA_r64_alpha128/checkpoint-1200", "epoch": 0.4819277108433735, "eval_steps": 50, "global_step": 1200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00040160642570281126, "grad_norm": 36.74913787841797, "learning_rate": 0.0, "loss": 2.976954936981201, "step": 1 }, { "epoch": 0.004016064257028112, "grad_norm": 40.237674713134766, "learning_rate": 3.614457831325301e-07, "loss": 3.035895029703776, "step": 10 }, { "epoch": 0.008032128514056224, "grad_norm": 17.999801635742188, "learning_rate": 7.630522088353415e-07, "loss": 2.75059814453125, "step": 20 }, { "epoch": 0.012048192771084338, "grad_norm": 13.56201171875, "learning_rate": 1.1646586345381528e-06, "loss": 2.38979434967041, "step": 30 }, { "epoch": 0.01606425702811245, "grad_norm": 10.360796928405762, "learning_rate": 1.566265060240964e-06, "loss": 2.0525840759277343, "step": 40 }, { "epoch": 0.020080321285140562, "grad_norm": 16.763572692871094, "learning_rate": 1.967871485943775e-06, "loss": 1.8794815063476562, "step": 50 }, { "epoch": 0.020080321285140562, "eval_loss": 1.8244566917419434, "eval_runtime": 224.0827, "eval_samples_per_second": 17.087, "eval_steps_per_second": 0.536, "step": 50 }, { "epoch": 0.024096385542168676, "grad_norm": 10.257641792297363, "learning_rate": 2.3694779116465868e-06, "loss": 1.7737924575805664, "step": 60 }, { "epoch": 0.028112449799196786, "grad_norm": 20.079599380493164, "learning_rate": 2.771084337349398e-06, "loss": 1.6911544799804688, "step": 70 }, { "epoch": 0.0321285140562249, "grad_norm": 10.683834075927734, "learning_rate": 3.172690763052209e-06, "loss": 1.623727798461914, "step": 80 }, { "epoch": 0.03614457831325301, "grad_norm": 11.064703941345215, "learning_rate": 3.5742971887550204e-06, "loss": 1.5919998168945313, "step": 90 }, { "epoch": 0.040160642570281124, "grad_norm": 9.582036972045898, "learning_rate": 3.975903614457832e-06, "loss": 1.5387580871582032, "step": 100 }, { "epoch": 0.040160642570281124, "eval_loss": 1.5256246328353882, "eval_runtime": 224.0546, "eval_samples_per_second": 17.09, "eval_steps_per_second": 0.536, "step": 100 }, { "epoch": 0.04417670682730924, "grad_norm": 9.940044403076172, "learning_rate": 4.377510040160643e-06, "loss": 1.49784574508667, "step": 110 }, { "epoch": 0.04819277108433735, "grad_norm": 11.362184524536133, "learning_rate": 4.779116465863454e-06, "loss": 1.5389199256896973, "step": 120 }, { "epoch": 0.05220883534136546, "grad_norm": 9.787059783935547, "learning_rate": 5.180722891566266e-06, "loss": 1.4939092636108398, "step": 130 }, { "epoch": 0.05622489959839357, "grad_norm": 9.76535701751709, "learning_rate": 5.582329317269076e-06, "loss": 1.4706912994384767, "step": 140 }, { "epoch": 0.060240963855421686, "grad_norm": 9.557772636413574, "learning_rate": 5.983935742971888e-06, "loss": 1.4295058250427246, "step": 150 }, { "epoch": 0.060240963855421686, "eval_loss": 1.4075552225112915, "eval_runtime": 224.3397, "eval_samples_per_second": 17.068, "eval_steps_per_second": 0.535, "step": 150 }, { "epoch": 0.0642570281124498, "grad_norm": 8.256240844726562, "learning_rate": 6.385542168674699e-06, "loss": 1.3934820175170899, "step": 160 }, { "epoch": 0.06827309236947791, "grad_norm": 10.668194770812988, "learning_rate": 6.78714859437751e-06, "loss": 1.3897838592529297, "step": 170 }, { "epoch": 0.07228915662650602, "grad_norm": 8.989994049072266, "learning_rate": 7.188755020080321e-06, "loss": 1.3797410011291504, "step": 180 }, { "epoch": 0.07630522088353414, "grad_norm": 7.747810363769531, "learning_rate": 7.590361445783133e-06, "loss": 1.3742728233337402, "step": 190 }, { "epoch": 0.08032128514056225, "grad_norm": 7.7544074058532715, "learning_rate": 7.991967871485944e-06, "loss": 1.3565238952636718, "step": 200 }, { "epoch": 0.08032128514056225, "eval_loss": 1.3342411518096924, "eval_runtime": 224.1047, "eval_samples_per_second": 17.086, "eval_steps_per_second": 0.535, "step": 200 }, { "epoch": 0.08433734939759036, "grad_norm": 7.9385085105896, "learning_rate": 8.393574297188756e-06, "loss": 1.3680735588073731, "step": 210 }, { "epoch": 0.08835341365461848, "grad_norm": 7.368689060211182, "learning_rate": 8.795180722891567e-06, "loss": 1.3239299774169921, "step": 220 }, { "epoch": 0.09236947791164658, "grad_norm": 8.16849422454834, "learning_rate": 9.196787148594378e-06, "loss": 1.330996036529541, "step": 230 }, { "epoch": 0.0963855421686747, "grad_norm": 9.847034454345703, "learning_rate": 9.598393574297188e-06, "loss": 1.3019088745117187, "step": 240 }, { "epoch": 0.10040160642570281, "grad_norm": 6.754732131958008, "learning_rate": 1e-05, "loss": 1.283926010131836, "step": 250 }, { "epoch": 0.10040160642570281, "eval_loss": 1.2852883338928223, "eval_runtime": 224.1824, "eval_samples_per_second": 17.08, "eval_steps_per_second": 0.535, "step": 250 }, { "epoch": 0.10441767068273092, "grad_norm": 6.626065254211426, "learning_rate": 9.999508697551502e-06, "loss": 1.2729861259460449, "step": 260 }, { "epoch": 0.10843373493975904, "grad_norm": 6.478898525238037, "learning_rate": 9.998034886757237e-06, "loss": 1.2489843368530273, "step": 270 }, { "epoch": 0.11244979919678715, "grad_norm": 6.022712230682373, "learning_rate": 9.99557885725195e-06, "loss": 1.2988578796386718, "step": 280 }, { "epoch": 0.11646586345381527, "grad_norm": 6.245314598083496, "learning_rate": 9.992141091696967e-06, "loss": 1.2607011795043945, "step": 290 }, { "epoch": 0.12048192771084337, "grad_norm": 6.8380889892578125, "learning_rate": 9.987722265685338e-06, "loss": 1.2081457138061524, "step": 300 }, { "epoch": 0.12048192771084337, "eval_loss": 1.2430709600448608, "eval_runtime": 224.0772, "eval_samples_per_second": 17.088, "eval_steps_per_second": 0.536, "step": 300 }, { "epoch": 0.12449799196787148, "grad_norm": 5.553050518035889, "learning_rate": 9.98232324760908e-06, "loss": 1.2201088905334472, "step": 310 }, { "epoch": 0.1285140562248996, "grad_norm": 5.528981685638428, "learning_rate": 9.975945098488514e-06, "loss": 1.2170144081115724, "step": 320 }, { "epoch": 0.13253012048192772, "grad_norm": 6.345343589782715, "learning_rate": 9.96858907176375e-06, "loss": 1.2358662605285644, "step": 330 }, { "epoch": 0.13654618473895583, "grad_norm": 5.249575138092041, "learning_rate": 9.960256613048367e-06, "loss": 1.2119761466979981, "step": 340 }, { "epoch": 0.14056224899598393, "grad_norm": 4.9837646484375, "learning_rate": 9.950949359845309e-06, "loss": 1.2059650421142578, "step": 350 }, { "epoch": 0.14056224899598393, "eval_loss": 1.2071032524108887, "eval_runtime": 224.1972, "eval_samples_per_second": 17.079, "eval_steps_per_second": 0.535, "step": 350 }, { "epoch": 0.14457831325301204, "grad_norm": 5.1654791831970215, "learning_rate": 9.940669141225097e-06, "loss": 1.1992589950561523, "step": 360 }, { "epoch": 0.14859437751004015, "grad_norm": 6.3491950035095215, "learning_rate": 9.929417977466356e-06, "loss": 1.1967281341552733, "step": 370 }, { "epoch": 0.15261044176706828, "grad_norm": 6.096224308013916, "learning_rate": 9.91719807965881e-06, "loss": 1.184930419921875, "step": 380 }, { "epoch": 0.1566265060240964, "grad_norm": 4.983779430389404, "learning_rate": 9.904011849268744e-06, "loss": 1.195562744140625, "step": 390 }, { "epoch": 0.1606425702811245, "grad_norm": 5.229851722717285, "learning_rate": 9.889861877667071e-06, "loss": 1.1917385101318358, "step": 400 }, { "epoch": 0.1606425702811245, "eval_loss": 1.1810219287872314, "eval_runtime": 224.2238, "eval_samples_per_second": 17.077, "eval_steps_per_second": 0.535, "step": 400 }, { "epoch": 0.1646586345381526, "grad_norm": 4.667690277099609, "learning_rate": 9.874750945620066e-06, "loss": 1.2232494354248047, "step": 410 }, { "epoch": 0.1686746987951807, "grad_norm": 4.562730312347412, "learning_rate": 9.858682022742896e-06, "loss": 1.1690594673156738, "step": 420 }, { "epoch": 0.17269076305220885, "grad_norm": 4.388287544250488, "learning_rate": 9.84165826691602e-06, "loss": 1.1833030700683593, "step": 430 }, { "epoch": 0.17670682730923695, "grad_norm": 4.246683120727539, "learning_rate": 9.82368302366461e-06, "loss": 1.180044174194336, "step": 440 }, { "epoch": 0.18072289156626506, "grad_norm": 6.267792224884033, "learning_rate": 9.804759825501074e-06, "loss": 1.1597715377807618, "step": 450 }, { "epoch": 0.18072289156626506, "eval_loss": 1.1618536710739136, "eval_runtime": 224.0476, "eval_samples_per_second": 17.09, "eval_steps_per_second": 0.536, "step": 450 }, { "epoch": 0.18473895582329317, "grad_norm": 5.484806537628174, "learning_rate": 9.784892391230847e-06, "loss": 1.161270809173584, "step": 460 }, { "epoch": 0.18875502008032127, "grad_norm": 6.800451278686523, "learning_rate": 9.76408462522157e-06, "loss": 1.1662689208984376, "step": 470 }, { "epoch": 0.1927710843373494, "grad_norm": 4.338923931121826, "learning_rate": 9.742340616635799e-06, "loss": 1.1915185928344727, "step": 480 }, { "epoch": 0.19678714859437751, "grad_norm": 4.900355815887451, "learning_rate": 9.719664638627395e-06, "loss": 1.179362964630127, "step": 490 }, { "epoch": 0.20080321285140562, "grad_norm": 13.36780071258545, "learning_rate": 9.69606114750177e-06, "loss": 1.136868953704834, "step": 500 }, { "epoch": 0.20080321285140562, "eval_loss": 1.167843222618103, "eval_runtime": 224.0503, "eval_samples_per_second": 17.09, "eval_steps_per_second": 0.536, "step": 500 }, { "epoch": 0.20481927710843373, "grad_norm": 5.8057098388671875, "learning_rate": 9.671534781840113e-06, "loss": 1.1644049644470216, "step": 510 }, { "epoch": 0.20883534136546184, "grad_norm": 4.812023639678955, "learning_rate": 9.646090361587828e-06, "loss": 1.1246587753295898, "step": 520 }, { "epoch": 0.21285140562248997, "grad_norm": 4.429294109344482, "learning_rate": 9.619732887107299e-06, "loss": 1.1263324737548828, "step": 530 }, { "epoch": 0.21686746987951808, "grad_norm": 4.260849952697754, "learning_rate": 9.592467538195229e-06, "loss": 1.118002223968506, "step": 540 }, { "epoch": 0.22088353413654618, "grad_norm": 4.285832405090332, "learning_rate": 9.56429967306469e-06, "loss": 1.1537700653076173, "step": 550 }, { "epoch": 0.22088353413654618, "eval_loss": 1.1320561170578003, "eval_runtime": 224.168, "eval_samples_per_second": 17.081, "eval_steps_per_second": 0.535, "step": 550 }, { "epoch": 0.2248995983935743, "grad_norm": 5.736870288848877, "learning_rate": 9.535234827292124e-06, "loss": 1.1374141693115234, "step": 560 }, { "epoch": 0.2289156626506024, "grad_norm": 4.176708221435547, "learning_rate": 9.505278712729489e-06, "loss": 1.1468097686767578, "step": 570 }, { "epoch": 0.23293172690763053, "grad_norm": 4.040938854217529, "learning_rate": 9.474437216381756e-06, "loss": 1.132613754272461, "step": 580 }, { "epoch": 0.23694779116465864, "grad_norm": 4.140848159790039, "learning_rate": 9.442716399249995e-06, "loss": 1.1381197929382325, "step": 590 }, { "epoch": 0.24096385542168675, "grad_norm": 3.8142037391662598, "learning_rate": 9.410122495140257e-06, "loss": 1.1367318153381347, "step": 600 }, { "epoch": 0.24096385542168675, "eval_loss": 1.1217604875564575, "eval_runtime": 224.0839, "eval_samples_per_second": 17.087, "eval_steps_per_second": 0.536, "step": 600 }, { "epoch": 0.24497991967871485, "grad_norm": 3.871077299118042, "learning_rate": 9.376661909438496e-06, "loss": 1.1195713043212892, "step": 610 }, { "epoch": 0.24899598393574296, "grad_norm": 5.430377960205078, "learning_rate": 9.342341217851791e-06, "loss": 1.1373143196105957, "step": 620 }, { "epoch": 0.25301204819277107, "grad_norm": 6.021585464477539, "learning_rate": 9.307167165116062e-06, "loss": 1.1249177932739258, "step": 630 }, { "epoch": 0.2570281124497992, "grad_norm": 4.557471752166748, "learning_rate": 9.271146663670605e-06, "loss": 1.1521922111511231, "step": 640 }, { "epoch": 0.26104417670682734, "grad_norm": 3.8892979621887207, "learning_rate": 9.23428679229964e-06, "loss": 1.138702964782715, "step": 650 }, { "epoch": 0.26104417670682734, "eval_loss": 1.1032555103302002, "eval_runtime": 224.1346, "eval_samples_per_second": 17.083, "eval_steps_per_second": 0.535, "step": 650 }, { "epoch": 0.26506024096385544, "grad_norm": 4.048600673675537, "learning_rate": 9.196594794741193e-06, "loss": 1.1215006828308105, "step": 660 }, { "epoch": 0.26907630522088355, "grad_norm": 4.088984966278076, "learning_rate": 9.158078078263536e-06, "loss": 1.1247024536132812, "step": 670 }, { "epoch": 0.27309236947791166, "grad_norm": 6.832698822021484, "learning_rate": 9.118744212209516e-06, "loss": 1.1253211975097657, "step": 680 }, { "epoch": 0.27710843373493976, "grad_norm": 4.244821071624756, "learning_rate": 9.078600926509013e-06, "loss": 1.1232710838317872, "step": 690 }, { "epoch": 0.28112449799196787, "grad_norm": 4.204834938049316, "learning_rate": 9.03765611015985e-06, "loss": 1.1257820129394531, "step": 700 }, { "epoch": 0.28112449799196787, "eval_loss": 1.099267840385437, "eval_runtime": 224.1775, "eval_samples_per_second": 17.08, "eval_steps_per_second": 0.535, "step": 700 }, { "epoch": 0.285140562248996, "grad_norm": 13.570015907287598, "learning_rate": 8.995917809677437e-06, "loss": 1.120689582824707, "step": 710 }, { "epoch": 0.2891566265060241, "grad_norm": 4.013745307922363, "learning_rate": 8.953394227513463e-06, "loss": 1.0989994049072265, "step": 720 }, { "epoch": 0.2931726907630522, "grad_norm": 4.636791229248047, "learning_rate": 8.910093720443945e-06, "loss": 1.0785343170166015, "step": 730 }, { "epoch": 0.2971887550200803, "grad_norm": 5.258622169494629, "learning_rate": 8.866024797926936e-06, "loss": 1.1059405326843261, "step": 740 }, { "epoch": 0.30120481927710846, "grad_norm": 4.196040630340576, "learning_rate": 8.821196120430252e-06, "loss": 1.1153934478759766, "step": 750 }, { "epoch": 0.30120481927710846, "eval_loss": 1.0958428382873535, "eval_runtime": 224.2589, "eval_samples_per_second": 17.074, "eval_steps_per_second": 0.535, "step": 750 }, { "epoch": 0.30522088353413657, "grad_norm": 4.448573589324951, "learning_rate": 8.775616497729502e-06, "loss": 1.1181120872497559, "step": 760 }, { "epoch": 0.3092369477911647, "grad_norm": 5.079808712005615, "learning_rate": 8.729294887176778e-06, "loss": 1.0942277908325195, "step": 770 }, { "epoch": 0.3132530120481928, "grad_norm": 3.968134641647339, "learning_rate": 8.682240391940355e-06, "loss": 1.0744555473327637, "step": 780 }, { "epoch": 0.3172690763052209, "grad_norm": 4.138976573944092, "learning_rate": 8.634462259215719e-06, "loss": 1.1014032363891602, "step": 790 }, { "epoch": 0.321285140562249, "grad_norm": 3.7669668197631836, "learning_rate": 8.58596987840831e-06, "loss": 1.1038568496704102, "step": 800 }, { "epoch": 0.321285140562249, "eval_loss": 1.0854790210723877, "eval_runtime": 224.3132, "eval_samples_per_second": 17.07, "eval_steps_per_second": 0.535, "step": 800 }, { "epoch": 0.3253012048192771, "grad_norm": 3.8699982166290283, "learning_rate": 8.536772779288297e-06, "loss": 1.1016878128051757, "step": 810 }, { "epoch": 0.3293172690763052, "grad_norm": 4.875065326690674, "learning_rate": 8.48688063011778e-06, "loss": 1.0864307403564453, "step": 820 }, { "epoch": 0.3333333333333333, "grad_norm": 3.7264904975891113, "learning_rate": 8.43630323575078e-06, "loss": 1.084289836883545, "step": 830 }, { "epoch": 0.3373493975903614, "grad_norm": 3.7510852813720703, "learning_rate": 8.385050535706376e-06, "loss": 1.1047092437744142, "step": 840 }, { "epoch": 0.3413654618473896, "grad_norm": 3.7756431102752686, "learning_rate": 8.333132602215374e-06, "loss": 1.0681782722473145, "step": 850 }, { "epoch": 0.3413654618473896, "eval_loss": 1.0816028118133545, "eval_runtime": 224.2437, "eval_samples_per_second": 17.075, "eval_steps_per_second": 0.535, "step": 850 }, { "epoch": 0.3453815261044177, "grad_norm": 4.321180820465088, "learning_rate": 8.280559638240914e-06, "loss": 1.076450252532959, "step": 860 }, { "epoch": 0.3493975903614458, "grad_norm": 5.125402927398682, "learning_rate": 8.227341975473368e-06, "loss": 1.1018122673034667, "step": 870 }, { "epoch": 0.3534136546184739, "grad_norm": 4.057586193084717, "learning_rate": 8.17349007229994e-06, "loss": 1.0766830444335938, "step": 880 }, { "epoch": 0.357429718875502, "grad_norm": 3.9465365409851074, "learning_rate": 8.119014511749388e-06, "loss": 1.0568387985229493, "step": 890 }, { "epoch": 0.3614457831325301, "grad_norm": 5.671834468841553, "learning_rate": 8.063925999412224e-06, "loss": 1.064396286010742, "step": 900 }, { "epoch": 0.3614457831325301, "eval_loss": 1.0756299495697021, "eval_runtime": 224.2054, "eval_samples_per_second": 17.078, "eval_steps_per_second": 0.535, "step": 900 }, { "epoch": 0.3654618473895582, "grad_norm": 3.911022901535034, "learning_rate": 8.008235361336845e-06, "loss": 1.1032384872436523, "step": 910 }, { "epoch": 0.36947791164658633, "grad_norm": 3.855924129486084, "learning_rate": 7.951953541901989e-06, "loss": 1.0686886787414551, "step": 920 }, { "epoch": 0.37349397590361444, "grad_norm": 4.947168827056885, "learning_rate": 7.895091601665934e-06, "loss": 1.0647593498229981, "step": 930 }, { "epoch": 0.37751004016064255, "grad_norm": 4.119925022125244, "learning_rate": 7.837660715192867e-06, "loss": 1.0522316932678222, "step": 940 }, { "epoch": 0.3815261044176707, "grad_norm": 3.602022647857666, "learning_rate": 7.779672168856844e-06, "loss": 1.0513050079345703, "step": 950 }, { "epoch": 0.3815261044176707, "eval_loss": 1.0680068731307983, "eval_runtime": 224.3211, "eval_samples_per_second": 17.069, "eval_steps_per_second": 0.535, "step": 950 }, { "epoch": 0.3855421686746988, "grad_norm": 4.18943452835083, "learning_rate": 7.721137358623786e-06, "loss": 1.0850586891174316, "step": 960 }, { "epoch": 0.3895582329317269, "grad_norm": 6.430990219116211, "learning_rate": 7.66206778781193e-06, "loss": 1.0583345413208007, "step": 970 }, { "epoch": 0.39357429718875503, "grad_norm": 4.619312286376953, "learning_rate": 7.6024750648311805e-06, "loss": 1.091839599609375, "step": 980 }, { "epoch": 0.39759036144578314, "grad_norm": 3.8781845569610596, "learning_rate": 7.542370900901827e-06, "loss": 1.0620054244995116, "step": 990 }, { "epoch": 0.40160642570281124, "grad_norm": 3.7595436573028564, "learning_rate": 7.4817671077530295e-06, "loss": 1.0398008346557617, "step": 1000 }, { "epoch": 0.40160642570281124, "eval_loss": 1.0621941089630127, "eval_runtime": 224.1744, "eval_samples_per_second": 17.08, "eval_steps_per_second": 0.535, "step": 1000 }, { "epoch": 0.40562248995983935, "grad_norm": 3.890206813812256, "learning_rate": 7.420675595301574e-06, "loss": 1.067855453491211, "step": 1010 }, { "epoch": 0.40963855421686746, "grad_norm": 3.8331494331359863, "learning_rate": 7.359108369311318e-06, "loss": 1.0873468399047852, "step": 1020 }, { "epoch": 0.41365461847389556, "grad_norm": 3.785521984100342, "learning_rate": 7.297077529033814e-06, "loss": 1.0355330467224122, "step": 1030 }, { "epoch": 0.41767068273092367, "grad_norm": 6.754027843475342, "learning_rate": 7.234595264830546e-06, "loss": 1.0717147827148437, "step": 1040 }, { "epoch": 0.42168674698795183, "grad_norm": 3.619626045227051, "learning_rate": 7.171673855777271e-06, "loss": 1.0628927230834961, "step": 1050 }, { "epoch": 0.42168674698795183, "eval_loss": 1.0565131902694702, "eval_runtime": 224.3026, "eval_samples_per_second": 17.071, "eval_steps_per_second": 0.535, "step": 1050 }, { "epoch": 0.42570281124497994, "grad_norm": 3.654301404953003, "learning_rate": 7.10832566725092e-06, "loss": 1.028466033935547, "step": 1060 }, { "epoch": 0.42971887550200805, "grad_norm": 4.81827449798584, "learning_rate": 7.044563148499547e-06, "loss": 1.0777903556823731, "step": 1070 }, { "epoch": 0.43373493975903615, "grad_norm": 4.028594493865967, "learning_rate": 6.980398830195785e-06, "loss": 1.1094385147094727, "step": 1080 }, { "epoch": 0.43775100401606426, "grad_norm": 3.782311201095581, "learning_rate": 6.915845321974309e-06, "loss": 1.0568254470825196, "step": 1090 }, { "epoch": 0.44176706827309237, "grad_norm": 4.213383197784424, "learning_rate": 6.85091530995378e-06, "loss": 1.0806368827819823, "step": 1100 }, { "epoch": 0.44176706827309237, "eval_loss": 1.0501891374588013, "eval_runtime": 224.1605, "eval_samples_per_second": 17.082, "eval_steps_per_second": 0.535, "step": 1100 }, { "epoch": 0.4457831325301205, "grad_norm": 3.598494529724121, "learning_rate": 6.785621554243752e-06, "loss": 1.0479291915893554, "step": 1110 }, { "epoch": 0.4497991967871486, "grad_norm": 3.8993070125579834, "learning_rate": 6.7199768864370455e-06, "loss": 1.066202163696289, "step": 1120 }, { "epoch": 0.4538152610441767, "grad_norm": 4.1509833335876465, "learning_rate": 6.65399420708807e-06, "loss": 1.0448795318603517, "step": 1130 }, { "epoch": 0.4578313253012048, "grad_norm": 3.5259952545166016, "learning_rate": 6.587686483177596e-06, "loss": 1.049018383026123, "step": 1140 }, { "epoch": 0.46184738955823296, "grad_norm": 3.395838975906372, "learning_rate": 6.521066745564467e-06, "loss": 1.0418387413024903, "step": 1150 }, { "epoch": 0.46184738955823296, "eval_loss": 1.0448716878890991, "eval_runtime": 224.2692, "eval_samples_per_second": 17.073, "eval_steps_per_second": 0.535, "step": 1150 }, { "epoch": 0.46586345381526106, "grad_norm": 5.678968906402588, "learning_rate": 6.454148086424767e-06, "loss": 1.0376011848449707, "step": 1160 }, { "epoch": 0.46987951807228917, "grad_norm": 4.015078067779541, "learning_rate": 6.38694365667893e-06, "loss": 1.0441588401794433, "step": 1170 }, { "epoch": 0.4738955823293173, "grad_norm": 4.168111324310303, "learning_rate": 6.319466663407309e-06, "loss": 1.0368056297302246, "step": 1180 }, { "epoch": 0.4779116465863454, "grad_norm": 5.260632038116455, "learning_rate": 6.251730367254708e-06, "loss": 1.0322036743164062, "step": 1190 }, { "epoch": 0.4819277108433735, "grad_norm": 3.426922082901001, "learning_rate": 6.1837480798243894e-06, "loss": 1.0827327728271485, "step": 1200 }, { "epoch": 0.4819277108433735, "eval_loss": 1.0421009063720703, "eval_runtime": 224.3064, "eval_samples_per_second": 17.07, "eval_steps_per_second": 0.535, "step": 1200 } ], "logging_steps": 10, "max_steps": 2490, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8.318144766541824e+17, "train_batch_size": 32, "trial_name": null, "trial_params": null }