{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.99867197875166, "eval_steps": 1000, "global_step": 376, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0026560424966799467, "grad_norm": 1402.69921875, "learning_rate": 0.0, "loss": 52.5156, "step": 1 }, { "epoch": 0.013280212483399735, "grad_norm": 636.0113525390625, "learning_rate": 3.1578947368421045e-05, "loss": 32.8066, "step": 5 }, { "epoch": 0.02656042496679947, "grad_norm": 475.96771240234375, "learning_rate": 7.105263157894735e-05, "loss": 8.907, "step": 10 }, { "epoch": 0.0398406374501992, "grad_norm": 109.1396713256836, "learning_rate": 0.00011052631578947366, "loss": 6.3063, "step": 15 }, { "epoch": 0.05312084993359894, "grad_norm": 12.496488571166992, "learning_rate": 0.00015, "loss": 4.4115, "step": 20 }, { "epoch": 0.06640106241699867, "grad_norm": 88.81600952148438, "learning_rate": 0.0001894736842105263, "loss": 3.3893, "step": 25 }, { "epoch": 0.0796812749003984, "grad_norm": 107.62394714355469, "learning_rate": 0.00022894736842105263, "loss": 9.3801, "step": 30 }, { "epoch": 0.09296148738379814, "grad_norm": 7.125447750091553, "learning_rate": 0.0002684210526315789, "loss": 4.3988, "step": 35 }, { "epoch": 0.10624169986719788, "grad_norm": 15.962409973144531, "learning_rate": 0.0002999935207538156, "loss": 4.009, "step": 40 }, { "epoch": 0.11952191235059761, "grad_norm": 11.288817405700684, "learning_rate": 0.00029976680590482896, "loss": 3.0982, "step": 45 }, { "epoch": 0.13280212483399734, "grad_norm": 9.365798950195312, "learning_rate": 0.0002992166882710483, "loss": 5.2771, "step": 50 }, { "epoch": 0.1460823373173971, "grad_norm": 52.74184036254883, "learning_rate": 0.0002983443557630634, "loss": 6.7707, "step": 55 }, { "epoch": 0.1593625498007968, "grad_norm": 5.0402116775512695, "learning_rate": 0.00029715169207439795, "loss": 4.2547, "step": 60 }, { "epoch": 0.17264276228419656, "grad_norm": 5.552392482757568, "learning_rate": 0.00029564127261390776, "loss": 2.7717, "step": 65 }, { "epoch": 0.18592297476759628, "grad_norm": 3.872722864151001, "learning_rate": 0.0002938163589445058, "loss": 2.6939, "step": 70 }, { "epoch": 0.199203187250996, "grad_norm": 5.162952899932861, "learning_rate": 0.0002916808917402228, "loss": 2.6598, "step": 75 }, { "epoch": 0.21248339973439576, "grad_norm": 4.01698637008667, "learning_rate": 0.0002892394822768119, "loss": 2.6768, "step": 80 }, { "epoch": 0.22576361221779548, "grad_norm": 3.66325306892395, "learning_rate": 0.0002864974024742725, "loss": 2.6551, "step": 85 }, { "epoch": 0.23904382470119523, "grad_norm": 3.5804343223571777, "learning_rate": 0.00028346057351279474, "loss": 2.6633, "step": 90 }, { "epoch": 0.25232403718459495, "grad_norm": 3.087800979614258, "learning_rate": 0.00028013555304670765, "loss": 2.632, "step": 95 }, { "epoch": 0.2656042496679947, "grad_norm": 3.0033605098724365, "learning_rate": 0.00027652952104404045, "loss": 2.5992, "step": 100 }, { "epoch": 0.2788844621513944, "grad_norm": 2.973752021789551, "learning_rate": 0.0002726502642822747, "loss": 2.552, "step": 105 }, { "epoch": 0.2921646746347942, "grad_norm": 2.6142959594726562, "learning_rate": 0.00026850615953376744, "loss": 2.582, "step": 110 }, { "epoch": 0.3054448871181939, "grad_norm": 2.8691508769989014, "learning_rate": 0.00026410615547715297, "loss": 2.5102, "step": 115 }, { "epoch": 0.3187250996015936, "grad_norm": 3.016436815261841, "learning_rate": 0.00025945975337378515, "loss": 2.5391, "step": 120 }, { "epoch": 0.33200531208499334, "grad_norm": 2.747736930847168, "learning_rate": 0.00025457698655094495, "loss": 2.5082, "step": 125 }, { "epoch": 0.3452855245683931, "grad_norm": 2.5107271671295166, "learning_rate": 0.00024946839873611924, "loss": 2.5054, "step": 130 }, { "epoch": 0.35856573705179284, "grad_norm": 2.436136484146118, "learning_rate": 0.00024414502128913227, "loss": 2.4813, "step": 135 }, { "epoch": 0.37184594953519257, "grad_norm": 2.58207631111145, "learning_rate": 0.00023861834938129696, "loss": 2.4547, "step": 140 }, { "epoch": 0.3851261620185923, "grad_norm": 2.4167120456695557, "learning_rate": 0.00023290031717302254, "loss": 2.4403, "step": 145 }, { "epoch": 0.398406374501992, "grad_norm": 2.3588924407958984, "learning_rate": 0.00022700327204347966, "loss": 2.4169, "step": 150 }, { "epoch": 0.4116865869853918, "grad_norm": 2.468594789505005, "learning_rate": 0.00022093994792797152, "loss": 2.3924, "step": 155 }, { "epoch": 0.4249667994687915, "grad_norm": 2.52724552154541, "learning_rate": 0.00021472343782058458, "loss": 2.3804, "step": 160 }, { "epoch": 0.43824701195219123, "grad_norm": 2.2549281120300293, "learning_rate": 0.00020836716550149683, "loss": 2.3681, "step": 165 }, { "epoch": 0.45152722443559096, "grad_norm": 2.3330459594726562, "learning_rate": 0.00020188485654999466, "loss": 2.3404, "step": 170 }, { "epoch": 0.4648074369189907, "grad_norm": 2.2739274501800537, "learning_rate": 0.0001952905087057917, "loss": 2.2986, "step": 175 }, { "epoch": 0.47808764940239046, "grad_norm": 2.257761001586914, "learning_rate": 0.00018859836164265164, "loss": 2.328, "step": 180 }, { "epoch": 0.4913678618857902, "grad_norm": 2.2927610874176025, "learning_rate": 0.00018182286621958436, "loss": 2.2641, "step": 185 }, { "epoch": 0.5046480743691899, "grad_norm": 2.1379075050354004, "learning_rate": 0.00017497865327601326, "loss": 2.2607, "step": 190 }, { "epoch": 0.5179282868525896, "grad_norm": 2.1380867958068848, "learning_rate": 0.00016808050203829842, "loss": 2.2726, "step": 195 }, { "epoch": 0.5312084993359893, "grad_norm": 2.1610195636749268, "learning_rate": 0.00016114330820583557, "loss": 2.2329, "step": 200 }, { "epoch": 0.5444887118193891, "grad_norm": 2.081423044204712, "learning_rate": 0.00015418205178564621, "loss": 2.2403, "step": 205 }, { "epoch": 0.5577689243027888, "grad_norm": 2.0720622539520264, "learning_rate": 0.0001472117647449168, "loss": 2.2263, "step": 210 }, { "epoch": 0.5710491367861886, "grad_norm": 2.028615713119507, "learning_rate": 0.0001402474985513351, "loss": 2.1766, "step": 215 }, { "epoch": 0.5843293492695883, "grad_norm": 2.022357702255249, "learning_rate": 0.00013330429167131863, "loss": 2.1622, "step": 220 }, { "epoch": 0.5976095617529881, "grad_norm": 1.9566619396209717, "learning_rate": 0.00012639713709631706, "loss": 2.141, "step": 225 }, { "epoch": 0.6108897742363878, "grad_norm": 2.0382509231567383, "learning_rate": 0.000119540949967313, "loss": 2.1133, "step": 230 }, { "epoch": 0.6241699867197875, "grad_norm": 2.006354570388794, "learning_rate": 0.00011275053536743006, "loss": 2.0986, "step": 235 }, { "epoch": 0.6374501992031872, "grad_norm": 1.9956600666046143, "learning_rate": 0.00010604055635219803, "loss": 2.0761, "step": 240 }, { "epoch": 0.650730411686587, "grad_norm": 1.9418437480926514, "learning_rate": 9.942550228650876e-05, "loss": 2.0824, "step": 245 }, { "epoch": 0.6640106241699867, "grad_norm": 1.95418381690979, "learning_rate": 9.291965755663522e-05, "loss": 2.1084, "step": 250 }, { "epoch": 0.6772908366533864, "grad_norm": 1.961089849472046, "learning_rate": 8.653707072487629e-05, "loss": 2.053, "step": 255 }, { "epoch": 0.6905710491367862, "grad_norm": 1.9297434091567993, "learning_rate": 8.02915241934347e-05, "loss": 2.0788, "step": 260 }, { "epoch": 0.703851261620186, "grad_norm": 1.9308726787567139, "learning_rate": 7.419650444303376e-05, "loss": 2.0137, "step": 265 }, { "epoch": 0.7171314741035857, "grad_norm": 1.8884217739105225, "learning_rate": 6.82651729105402e-05, "loss": 2.025, "step": 270 }, { "epoch": 0.7304116865869854, "grad_norm": 1.9265509843826294, "learning_rate": 6.251033756847875e-05, "loss": 1.9988, "step": 275 }, { "epoch": 0.7436918990703851, "grad_norm": 1.8479654788970947, "learning_rate": 5.694442526780891e-05, "loss": 2.0355, "step": 280 }, { "epoch": 0.7569721115537849, "grad_norm": 1.915022850036621, "learning_rate": 5.157945490368621e-05, "loss": 1.9948, "step": 285 }, { "epoch": 0.7702523240371846, "grad_norm": 1.9624898433685303, "learning_rate": 4.6427011462153554e-05, "loss": 1.9742, "step": 290 }, { "epoch": 0.7835325365205843, "grad_norm": 1.8428194522857666, "learning_rate": 4.149822100380507e-05, "loss": 1.9431, "step": 295 }, { "epoch": 0.796812749003984, "grad_norm": 1.8078436851501465, "learning_rate": 3.680372663844246e-05, "loss": 1.9428, "step": 300 }, { "epoch": 0.8100929614873837, "grad_norm": 1.8866031169891357, "learning_rate": 3.235366554260351e-05, "loss": 1.9581, "step": 305 }, { "epoch": 0.8233731739707836, "grad_norm": 1.9002296924591064, "learning_rate": 2.8157647069590534e-05, "loss": 1.9669, "step": 310 }, { "epoch": 0.8366533864541833, "grad_norm": 1.8117656707763672, "learning_rate": 2.422473199926742e-05, "loss": 1.9113, "step": 315 }, { "epoch": 0.849933598937583, "grad_norm": 1.7977352142333984, "learning_rate": 2.056341297243272e-05, "loss": 1.9298, "step": 320 }, { "epoch": 0.8632138114209827, "grad_norm": 1.824103593826294, "learning_rate": 1.718159615201853e-05, "loss": 1.8986, "step": 325 }, { "epoch": 0.8764940239043825, "grad_norm": 1.8645001649856567, "learning_rate": 1.4086584150715103e-05, "loss": 1.9055, "step": 330 }, { "epoch": 0.8897742363877822, "grad_norm": 1.8154819011688232, "learning_rate": 1.1285060261887419e-05, "loss": 1.9125, "step": 335 }, { "epoch": 0.9030544488711819, "grad_norm": 1.8848274946212769, "learning_rate": 8.783074027834514e-06, "loss": 1.9312, "step": 340 }, { "epoch": 0.9163346613545816, "grad_norm": 1.8445605039596558, "learning_rate": 6.586028176555536e-06, "loss": 1.9288, "step": 345 }, { "epoch": 0.9296148738379814, "grad_norm": 1.8792498111724854, "learning_rate": 4.698666955230862e-06, "loss": 1.8988, "step": 350 }, { "epoch": 0.9428950863213812, "grad_norm": 1.8407002687454224, "learning_rate": 3.125065885610456e-06, "loss": 1.8648, "step": 355 }, { "epoch": 0.9561752988047809, "grad_norm": 1.7950658798217773, "learning_rate": 1.8686229634317206e-06, "loss": 1.9352, "step": 360 }, { "epoch": 0.9694555112881806, "grad_norm": 1.8157298564910889, "learning_rate": 9.320513208704638e-07, "loss": 1.8703, "step": 365 }, { "epoch": 0.9827357237715804, "grad_norm": 1.839713454246521, "learning_rate": 3.173733678694834e-07, "loss": 1.8878, "step": 370 }, { "epoch": 0.9960159362549801, "grad_norm": 1.858101487159729, "learning_rate": 2.5916424995919837e-08, "loss": 1.9159, "step": 375 } ], "logging_steps": 5, "max_steps": 376, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.656989204616577e+18, "train_batch_size": 128, "trial_name": null, "trial_params": null }