{'loss': 2.4072, 'learning_rate': 5.9999999999999995e-05, 'epoch': 0.17}
{'loss': 1.9372, 'learning_rate': 0.00011399999999999999, 'epoch': 0.34}
{'loss': 1.4099, 'learning_rate': 0.00017399999999999997, 'epoch': 0.51}
{'loss': 1.2822, 'learning_rate': 0.000234, 'epoch': 0.68}
{'loss': 1.2445, 'learning_rate': 0.000294, 'epoch': 0.85}
{'loss': 1.2077, 'learning_rate': 0.00027848605577689237, 'epoch': 1.02}
{'loss': 1.1843, 'learning_rate': 0.0002545816733067729, 'epoch': 1.19}
{'loss': 1.18, 'learning_rate': 0.00023067729083665336, 'epoch': 1.37}
{'loss': 1.1533, 'learning_rate': 0.00020677290836653385, 'epoch': 1.54}
{'loss': 1.1383, 'learning_rate': 0.00018286852589641432, 'epoch': 1.71}
{'loss': 1.1389, 'learning_rate': 0.0001589641434262948, 'epoch': 1.88}
{'loss': 1.1331, 'learning_rate': 0.00013505976095617528, 'epoch': 2.05}
{'loss': 1.1001, 'learning_rate': 0.00011115537848605577, 'epoch': 2.22}
{'loss': 1.1082, 'learning_rate': 8.725099601593625e-05, 'epoch': 2.39}
{'loss': 1.0986, 'learning_rate': 6.334661354581673e-05, 'epoch': 2.56}
{'loss': 1.0954, 'learning_rate': 3.9442231075697205e-05, 'epoch': 2.73}
{'loss': 1.1076, 'learning_rate': 1.5537848605577688e-05, 'epoch': 2.9}
{'train_runtime': 9669.9054, 'train_samples_per_second': 4.654, 'train_steps_per_second': 0.036, 'train_loss': 1.283483600344753, 'epoch': 3.0}