{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.859598853868195, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.05730659025787966, "grad_norm": 10.106540722187765, "learning_rate": 5.142857142857143e-07, "loss": 1.5746, "step": 10 }, { "epoch": 0.11461318051575932, "grad_norm": 6.586136263761276, "learning_rate": 1.0857142857142858e-06, "loss": 1.4523, "step": 20 }, { "epoch": 0.17191977077363896, "grad_norm": 3.0707962293997366, "learning_rate": 1.657142857142857e-06, "loss": 1.146, "step": 30 }, { "epoch": 0.22922636103151864, "grad_norm": 2.3548379062361624, "learning_rate": 2.228571428571429e-06, "loss": 0.952, "step": 40 }, { "epoch": 0.28653295128939826, "grad_norm": 1.9627642658101132, "learning_rate": 2.8000000000000003e-06, "loss": 0.8935, "step": 50 }, { "epoch": 0.3438395415472779, "grad_norm": 2.0814135363278248, "learning_rate": 3.3714285714285716e-06, "loss": 0.8779, "step": 60 }, { "epoch": 0.40114613180515757, "grad_norm": 1.88380326807941, "learning_rate": 3.942857142857143e-06, "loss": 0.8562, "step": 70 }, { "epoch": 0.4584527220630373, "grad_norm": 1.6116668676175776, "learning_rate": 4.514285714285714e-06, "loss": 0.8523, "step": 80 }, { "epoch": 0.5157593123209169, "grad_norm": 1.6683198279460352, "learning_rate": 5.085714285714286e-06, "loss": 0.8436, "step": 90 }, { "epoch": 0.5730659025787965, "grad_norm": 1.7566538916367258, "learning_rate": 5.6571428571428576e-06, "loss": 0.8488, "step": 100 }, { "epoch": 0.6303724928366762, "grad_norm": 2.125615333677828, "learning_rate": 6.22857142857143e-06, "loss": 0.8498, "step": 110 }, { "epoch": 0.6876790830945558, "grad_norm": 1.8303892904929213, "learning_rate": 6.800000000000001e-06, "loss": 0.8405, "step": 120 }, { "epoch": 0.7449856733524355, "grad_norm": 1.9619910074521034, "learning_rate": 7.371428571428571e-06, "loss": 0.8441, "step": 130 }, { "epoch": 0.8022922636103151, "grad_norm": 2.2442912448835397, "learning_rate": 7.942857142857144e-06, "loss": 0.8422, "step": 140 }, { "epoch": 0.8595988538681948, "grad_norm": 1.7858895568365396, "learning_rate": 8.514285714285715e-06, "loss": 0.8454, "step": 150 }, { "epoch": 0.9169054441260746, "grad_norm": 1.9619084977160475, "learning_rate": 9.085714285714286e-06, "loss": 0.8417, "step": 160 }, { "epoch": 0.9742120343839542, "grad_norm": 2.669334620274088, "learning_rate": 9.657142857142859e-06, "loss": 0.8385, "step": 170 }, { "epoch": 1.0286532951289398, "grad_norm": 1.6909504353944882, "learning_rate": 9.999840853784125e-06, "loss": 0.7796, "step": 180 }, { "epoch": 1.0859598853868195, "grad_norm": 1.8668973254520025, "learning_rate": 9.998050575201772e-06, "loss": 0.7748, "step": 190 }, { "epoch": 1.143266475644699, "grad_norm": 1.8883027368057261, "learning_rate": 9.994271799912004e-06, "loss": 0.7796, "step": 200 }, { "epoch": 1.2005730659025788, "grad_norm": 1.5699435632265302, "learning_rate": 9.988506031317416e-06, "loss": 0.7741, "step": 210 }, { "epoch": 1.2578796561604584, "grad_norm": 1.9834006089125242, "learning_rate": 9.980755563354755e-06, "loss": 0.7705, "step": 220 }, { "epoch": 1.3151862464183381, "grad_norm": 1.8829423034816772, "learning_rate": 9.971023479582258e-06, "loss": 0.7797, "step": 230 }, { "epoch": 1.3724928366762177, "grad_norm": 2.2032493897453884, "learning_rate": 9.95931365195285e-06, "loss": 0.7809, "step": 240 }, { "epoch": 1.4297994269340975, "grad_norm": 1.7197069451450147, "learning_rate": 9.945630739273665e-06, "loss": 0.7863, "step": 250 }, { "epoch": 1.487106017191977, "grad_norm": 1.8502133094152093, "learning_rate": 9.929980185352525e-06, "loss": 0.7809, "step": 260 }, { "epoch": 1.5444126074498568, "grad_norm": 1.8675068788636697, "learning_rate": 9.912368216832094e-06, "loss": 0.7872, "step": 270 }, { "epoch": 1.6017191977077365, "grad_norm": 1.8956782839664204, "learning_rate": 9.892801840712576e-06, "loss": 0.7829, "step": 280 }, { "epoch": 1.659025787965616, "grad_norm": 1.7611480413309337, "learning_rate": 9.871288841563956e-06, "loss": 0.7791, "step": 290 }, { "epoch": 1.7163323782234956, "grad_norm": 1.8503576125588526, "learning_rate": 9.847837778428873e-06, "loss": 0.7831, "step": 300 }, { "epoch": 1.7736389684813754, "grad_norm": 1.7418957645569824, "learning_rate": 9.822457981417362e-06, "loss": 0.7816, "step": 310 }, { "epoch": 1.8309455587392551, "grad_norm": 1.5527795499202368, "learning_rate": 9.79515954799483e-06, "loss": 0.7886, "step": 320 }, { "epoch": 1.8882521489971347, "grad_norm": 1.6373526820097914, "learning_rate": 9.765953338964736e-06, "loss": 0.7817, "step": 330 }, { "epoch": 1.9455587392550142, "grad_norm": 1.6298673659139973, "learning_rate": 9.734850974147573e-06, "loss": 0.7816, "step": 340 }, { "epoch": 2.0, "grad_norm": 1.6034876035879577, "learning_rate": 9.701864827757868e-06, "loss": 0.7558, "step": 350 }, { "epoch": 2.0573065902578795, "grad_norm": 1.550929714181552, "learning_rate": 9.667008023481045e-06, "loss": 0.5813, "step": 360 }, { "epoch": 2.1146131805157595, "grad_norm": 1.6888908937399765, "learning_rate": 9.630294429252112e-06, "loss": 0.5526, "step": 370 }, { "epoch": 2.171919770773639, "grad_norm": 1.5855707234018377, "learning_rate": 9.591738651738235e-06, "loss": 0.5575, "step": 380 }, { "epoch": 2.2292263610315186, "grad_norm": 1.6064410424084354, "learning_rate": 9.551356030527417e-06, "loss": 0.5609, "step": 390 }, { "epoch": 2.286532951289398, "grad_norm": 1.4496809814777507, "learning_rate": 9.50916263202557e-06, "loss": 0.5548, "step": 400 }, { "epoch": 2.343839541547278, "grad_norm": 1.5401653091904366, "learning_rate": 9.465175243064428e-06, "loss": 0.5636, "step": 410 }, { "epoch": 2.4011461318051577, "grad_norm": 1.582349105341671, "learning_rate": 9.419411364222826e-06, "loss": 0.5648, "step": 420 }, { "epoch": 2.458452722063037, "grad_norm": 1.5842844192259247, "learning_rate": 9.37188920286402e-06, "loss": 0.5679, "step": 430 }, { "epoch": 2.5157593123209168, "grad_norm": 1.6807187813727524, "learning_rate": 9.322627665891807e-06, "loss": 0.5681, "step": 440 }, { "epoch": 2.5730659025787963, "grad_norm": 1.6284486737168171, "learning_rate": 9.271646352228324e-06, "loss": 0.5711, "step": 450 }, { "epoch": 2.6303724928366763, "grad_norm": 1.6028282865624421, "learning_rate": 9.218965545016538e-06, "loss": 0.5742, "step": 460 }, { "epoch": 2.687679083094556, "grad_norm": 1.7636115949396163, "learning_rate": 9.164606203550498e-06, "loss": 0.5721, "step": 470 }, { "epoch": 2.7449856733524354, "grad_norm": 1.594464961248534, "learning_rate": 9.108589954936592e-06, "loss": 0.5758, "step": 480 }, { "epoch": 2.8022922636103154, "grad_norm": 1.7158796247386685, "learning_rate": 9.050939085489104e-06, "loss": 0.569, "step": 490 }, { "epoch": 2.859598853868195, "grad_norm": 1.6082086064967192, "learning_rate": 8.991676531863507e-06, "loss": 0.575, "step": 500 }, { "epoch": 2.859598853868195, "eval_loss": 0.9605590105056763, "eval_runtime": 655.0431, "eval_samples_per_second": 7.574, "eval_steps_per_second": 1.895, "step": 500 } ], "logging_steps": 10, "max_steps": 1750, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 466778166657024.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }