codet5-java-to-python / training_evidence.json
thrishagowda25's picture
Upload fine-tuned CodeT5 checkpoint
8515787 verified
Raw
History Blame Contribute Delete
5.53 kB
{
"configuration": {
"train_jsonl": "data\\enhanced\\train.jsonl",
"output_dir": "models\\codet5-java-to-python",
"val_jsonl": "data\\enhanced\\validation.jsonl",
"model_name": "Salesforce/codet5-small",
"direction": "java_to_python",
"eval_ratio": 0.1,
"max_input_length": 512,
"max_target_length": 512,
"batch_size": 4,
"epochs": 8,
"lr": 2e-05,
"gradient_accumulation_steps": 2,
"seed": 42,
"early_stopping_patience": 2
},
"base_model": "Salesforce/codet5-small",
"device": "cpu",
"cuda_available": false,
"mixed_precision_fp16": false,
"pytorch_version": "2.13.0+cpu",
"training_examples": 1000,
"validation_examples": 140,
"token_length_statistics": {
"train": {
"inputs": {
"minimum": 73,
"median": 107,
"p95": 149,
"maximum": 161,
"limit": 512,
"truncated_examples": 0
},
"targets": {
"minimum": 23,
"median": 49,
"p95": 87,
"maximum": 97,
"limit": 512,
"truncated_examples": 0
}
},
"validation": {
"inputs": {
"minimum": 73,
"median": 107,
"p95": 149,
"maximum": 149,
"limit": 512,
"truncated_examples": 0
},
"targets": {
"minimum": 23,
"median": 49,
"p95": 87,
"maximum": 87,
"limit": 512,
"truncated_examples": 0
}
}
},
"duration_seconds": 4517.891,
"best_checkpoint": "models\\codet5-java-to-python\\checkpoint-1000",
"best_metric": 0.0002744992380030453,
"train_metrics": {
"train_runtime": 4509.2089,
"train_samples_per_second": 1.774,
"train_steps_per_second": 0.222,
"total_flos": 268101535137792.0,
"train_loss": 0.11644796460866928,
"epoch": 8.0
},
"validation_metrics": {
"eval_loss": 0.0002744992380030453,
"eval_runtime": 8.4931,
"eval_samples_per_second": 16.484,
"eval_steps_per_second": 4.121,
"epoch": 8.0
},
"log_history": [
{
"loss": 0.8178,
"grad_norm": 1.9174737930297852,
"learning_rate": 1.752e-05,
"epoch": 1.0,
"step": 125
},
{
"eval_loss": 0.027854034677147865,
"eval_runtime": 9.3606,
"eval_samples_per_second": 14.956,
"eval_steps_per_second": 3.739,
"epoch": 1.0,
"step": 125
},
{
"loss": 0.0566,
"grad_norm": 1.2266449928283691,
"learning_rate": 1.5020000000000002e-05,
"epoch": 2.0,
"step": 250
},
{
"eval_loss": 0.0061431629583239555,
"eval_runtime": 12.3133,
"eval_samples_per_second": 11.37,
"eval_steps_per_second": 2.842,
"epoch": 2.0,
"step": 250
},
{
"loss": 0.0202,
"grad_norm": 0.3443121016025543,
"learning_rate": 1.252e-05,
"epoch": 3.0,
"step": 375
},
{
"eval_loss": 0.0017448368016630411,
"eval_runtime": 12.4117,
"eval_samples_per_second": 11.28,
"eval_steps_per_second": 2.82,
"epoch": 3.0,
"step": 375
},
{
"loss": 0.0117,
"grad_norm": 0.22224248945713043,
"learning_rate": 1.002e-05,
"epoch": 4.0,
"step": 500
},
{
"eval_loss": 0.0007071287254802883,
"eval_runtime": 16.8838,
"eval_samples_per_second": 8.292,
"eval_steps_per_second": 2.073,
"epoch": 4.0,
"step": 500
},
{
"loss": 0.0082,
"grad_norm": 0.07997278869152069,
"learning_rate": 7.520000000000001e-06,
"epoch": 5.0,
"step": 625
},
{
"eval_loss": 0.00043417332926765084,
"eval_runtime": 11.6114,
"eval_samples_per_second": 12.057,
"eval_steps_per_second": 3.014,
"epoch": 5.0,
"step": 625
},
{
"loss": 0.0064,
"grad_norm": 0.06534432619810104,
"learning_rate": 5.02e-06,
"epoch": 6.0,
"step": 750
},
{
"eval_loss": 0.0003266753919888288,
"eval_runtime": 7.8595,
"eval_samples_per_second": 17.813,
"eval_steps_per_second": 4.453,
"epoch": 6.0,
"step": 750
},
{
"loss": 0.0053,
"grad_norm": 0.22041985392570496,
"learning_rate": 2.52e-06,
"epoch": 7.0,
"step": 875
},
{
"eval_loss": 0.0002930415503215045,
"eval_runtime": 8.6639,
"eval_samples_per_second": 16.159,
"eval_steps_per_second": 4.04,
"epoch": 7.0,
"step": 875
},
{
"loss": 0.0053,
"grad_norm": 0.8123140931129456,
"learning_rate": 2e-08,
"epoch": 8.0,
"step": 1000
},
{
"eval_loss": 0.0002744992380030453,
"eval_runtime": 7.9757,
"eval_samples_per_second": 17.553,
"eval_steps_per_second": 4.388,
"epoch": 8.0,
"step": 1000
},
{
"train_runtime": 4509.2089,
"train_samples_per_second": 1.774,
"train_steps_per_second": 0.222,
"total_flos": 268101535137792.0,
"train_loss": 0.11644796460866928,
"epoch": 8.0,
"step": 1000
},
{
"eval_loss": 0.0002744992380030453,
"eval_runtime": 8.4931,
"eval_samples_per_second": 16.484,
"eval_steps_per_second": 4.121,
"epoch": 8.0,
"step": 1000
}
]
}