{ "configuration": { "train_jsonl": "data\\enhanced\\train.jsonl", "output_dir": "models\\codet5-java-to-python", "val_jsonl": "data\\enhanced\\validation.jsonl", "model_name": "Salesforce/codet5-small", "direction": "java_to_python", "eval_ratio": 0.1, "max_input_length": 512, "max_target_length": 512, "batch_size": 4, "epochs": 8, "lr": 2e-05, "gradient_accumulation_steps": 2, "seed": 42, "early_stopping_patience": 2 }, "base_model": "Salesforce/codet5-small", "device": "cpu", "cuda_available": false, "mixed_precision_fp16": false, "pytorch_version": "2.13.0+cpu", "training_examples": 1000, "validation_examples": 140, "token_length_statistics": { "train": { "inputs": { "minimum": 73, "median": 107, "p95": 149, "maximum": 161, "limit": 512, "truncated_examples": 0 }, "targets": { "minimum": 23, "median": 49, "p95": 87, "maximum": 97, "limit": 512, "truncated_examples": 0 } }, "validation": { "inputs": { "minimum": 73, "median": 107, "p95": 149, "maximum": 149, "limit": 512, "truncated_examples": 0 }, "targets": { "minimum": 23, "median": 49, "p95": 87, "maximum": 87, "limit": 512, "truncated_examples": 0 } } }, "duration_seconds": 4517.891, "best_checkpoint": "models\\codet5-java-to-python\\checkpoint-1000", "best_metric": 0.0002744992380030453, "train_metrics": { "train_runtime": 4509.2089, "train_samples_per_second": 1.774, "train_steps_per_second": 0.222, "total_flos": 268101535137792.0, "train_loss": 0.11644796460866928, "epoch": 8.0 }, "validation_metrics": { "eval_loss": 0.0002744992380030453, "eval_runtime": 8.4931, "eval_samples_per_second": 16.484, "eval_steps_per_second": 4.121, "epoch": 8.0 }, "log_history": [ { "loss": 0.8178, "grad_norm": 1.9174737930297852, "learning_rate": 1.752e-05, "epoch": 1.0, "step": 125 }, { "eval_loss": 0.027854034677147865, "eval_runtime": 9.3606, "eval_samples_per_second": 14.956, "eval_steps_per_second": 3.739, "epoch": 1.0, "step": 125 }, { "loss": 0.0566, "grad_norm": 1.2266449928283691, "learning_rate": 1.5020000000000002e-05, "epoch": 2.0, "step": 250 }, { "eval_loss": 0.0061431629583239555, "eval_runtime": 12.3133, "eval_samples_per_second": 11.37, "eval_steps_per_second": 2.842, "epoch": 2.0, "step": 250 }, { "loss": 0.0202, "grad_norm": 0.3443121016025543, "learning_rate": 1.252e-05, "epoch": 3.0, "step": 375 }, { "eval_loss": 0.0017448368016630411, "eval_runtime": 12.4117, "eval_samples_per_second": 11.28, "eval_steps_per_second": 2.82, "epoch": 3.0, "step": 375 }, { "loss": 0.0117, "grad_norm": 0.22224248945713043, "learning_rate": 1.002e-05, "epoch": 4.0, "step": 500 }, { "eval_loss": 0.0007071287254802883, "eval_runtime": 16.8838, "eval_samples_per_second": 8.292, "eval_steps_per_second": 2.073, "epoch": 4.0, "step": 500 }, { "loss": 0.0082, "grad_norm": 0.07997278869152069, "learning_rate": 7.520000000000001e-06, "epoch": 5.0, "step": 625 }, { "eval_loss": 0.00043417332926765084, "eval_runtime": 11.6114, "eval_samples_per_second": 12.057, "eval_steps_per_second": 3.014, "epoch": 5.0, "step": 625 }, { "loss": 0.0064, "grad_norm": 0.06534432619810104, "learning_rate": 5.02e-06, "epoch": 6.0, "step": 750 }, { "eval_loss": 0.0003266753919888288, "eval_runtime": 7.8595, "eval_samples_per_second": 17.813, "eval_steps_per_second": 4.453, "epoch": 6.0, "step": 750 }, { "loss": 0.0053, "grad_norm": 0.22041985392570496, "learning_rate": 2.52e-06, "epoch": 7.0, "step": 875 }, { "eval_loss": 0.0002930415503215045, "eval_runtime": 8.6639, "eval_samples_per_second": 16.159, "eval_steps_per_second": 4.04, "epoch": 7.0, "step": 875 }, { "loss": 0.0053, "grad_norm": 0.8123140931129456, "learning_rate": 2e-08, "epoch": 8.0, "step": 1000 }, { "eval_loss": 0.0002744992380030453, "eval_runtime": 7.9757, "eval_samples_per_second": 17.553, "eval_steps_per_second": 4.388, "epoch": 8.0, "step": 1000 }, { "train_runtime": 4509.2089, "train_samples_per_second": 1.774, "train_steps_per_second": 0.222, "total_flos": 268101535137792.0, "train_loss": 0.11644796460866928, "epoch": 8.0, "step": 1000 }, { "eval_loss": 0.0002744992380030453, "eval_runtime": 8.4931, "eval_samples_per_second": 16.484, "eval_steps_per_second": 4.121, "epoch": 8.0, "step": 1000 } ] }