{ "baseline": { "learning_rate": 0.0003, "batch_size": 32 }, "large-lr": { "learning_rate": 0.001, "batch_size": 32 }, "cosine-sched": { "learning_rate": 0.0005, "batch_size": 64 }, "warmup-long": { "learning_rate": 0.0005, "batch_size": 128 }, "dropout-0.2": { "learning_rate": 0.0003, "batch_size": 64 } }