| { | |
| "configuration": { | |
| "train_jsonl": "data\\enhanced\\train.jsonl", | |
| "output_dir": "models\\codet5-java-to-python", | |
| "val_jsonl": "data\\enhanced\\validation.jsonl", | |
| "model_name": "Salesforce/codet5-small", | |
| "direction": "java_to_python", | |
| "eval_ratio": 0.1, | |
| "max_input_length": 512, | |
| "max_target_length": 512, | |
| "batch_size": 4, | |
| "epochs": 8, | |
| "lr": 2e-05, | |
| "gradient_accumulation_steps": 2, | |
| "seed": 42, | |
| "early_stopping_patience": 2 | |
| }, | |
| "base_model": "Salesforce/codet5-small", | |
| "device": "cpu", | |
| "cuda_available": false, | |
| "mixed_precision_fp16": false, | |
| "pytorch_version": "2.13.0+cpu", | |
| "training_examples": 1000, | |
| "validation_examples": 140, | |
| "token_length_statistics": { | |
| "train": { | |
| "inputs": { | |
| "minimum": 73, | |
| "median": 107, | |
| "p95": 149, | |
| "maximum": 161, | |
| "limit": 512, | |
| "truncated_examples": 0 | |
| }, | |
| "targets": { | |
| "minimum": 23, | |
| "median": 49, | |
| "p95": 87, | |
| "maximum": 97, | |
| "limit": 512, | |
| "truncated_examples": 0 | |
| } | |
| }, | |
| "validation": { | |
| "inputs": { | |
| "minimum": 73, | |
| "median": 107, | |
| "p95": 149, | |
| "maximum": 149, | |
| "limit": 512, | |
| "truncated_examples": 0 | |
| }, | |
| "targets": { | |
| "minimum": 23, | |
| "median": 49, | |
| "p95": 87, | |
| "maximum": 87, | |
| "limit": 512, | |
| "truncated_examples": 0 | |
| } | |
| } | |
| }, | |
| "duration_seconds": 4517.891, | |
| "best_checkpoint": "models\\codet5-java-to-python\\checkpoint-1000", | |
| "best_metric": 0.0002744992380030453, | |
| "train_metrics": { | |
| "train_runtime": 4509.2089, | |
| "train_samples_per_second": 1.774, | |
| "train_steps_per_second": 0.222, | |
| "total_flos": 268101535137792.0, | |
| "train_loss": 0.11644796460866928, | |
| "epoch": 8.0 | |
| }, | |
| "validation_metrics": { | |
| "eval_loss": 0.0002744992380030453, | |
| "eval_runtime": 8.4931, | |
| "eval_samples_per_second": 16.484, | |
| "eval_steps_per_second": 4.121, | |
| "epoch": 8.0 | |
| }, | |
| "log_history": [ | |
| { | |
| "loss": 0.8178, | |
| "grad_norm": 1.9174737930297852, | |
| "learning_rate": 1.752e-05, | |
| "epoch": 1.0, | |
| "step": 125 | |
| }, | |
| { | |
| "eval_loss": 0.027854034677147865, | |
| "eval_runtime": 9.3606, | |
| "eval_samples_per_second": 14.956, | |
| "eval_steps_per_second": 3.739, | |
| "epoch": 1.0, | |
| "step": 125 | |
| }, | |
| { | |
| "loss": 0.0566, | |
| "grad_norm": 1.2266449928283691, | |
| "learning_rate": 1.5020000000000002e-05, | |
| "epoch": 2.0, | |
| "step": 250 | |
| }, | |
| { | |
| "eval_loss": 0.0061431629583239555, | |
| "eval_runtime": 12.3133, | |
| "eval_samples_per_second": 11.37, | |
| "eval_steps_per_second": 2.842, | |
| "epoch": 2.0, | |
| "step": 250 | |
| }, | |
| { | |
| "loss": 0.0202, | |
| "grad_norm": 0.3443121016025543, | |
| "learning_rate": 1.252e-05, | |
| "epoch": 3.0, | |
| "step": 375 | |
| }, | |
| { | |
| "eval_loss": 0.0017448368016630411, | |
| "eval_runtime": 12.4117, | |
| "eval_samples_per_second": 11.28, | |
| "eval_steps_per_second": 2.82, | |
| "epoch": 3.0, | |
| "step": 375 | |
| }, | |
| { | |
| "loss": 0.0117, | |
| "grad_norm": 0.22224248945713043, | |
| "learning_rate": 1.002e-05, | |
| "epoch": 4.0, | |
| "step": 500 | |
| }, | |
| { | |
| "eval_loss": 0.0007071287254802883, | |
| "eval_runtime": 16.8838, | |
| "eval_samples_per_second": 8.292, | |
| "eval_steps_per_second": 2.073, | |
| "epoch": 4.0, | |
| "step": 500 | |
| }, | |
| { | |
| "loss": 0.0082, | |
| "grad_norm": 0.07997278869152069, | |
| "learning_rate": 7.520000000000001e-06, | |
| "epoch": 5.0, | |
| "step": 625 | |
| }, | |
| { | |
| "eval_loss": 0.00043417332926765084, | |
| "eval_runtime": 11.6114, | |
| "eval_samples_per_second": 12.057, | |
| "eval_steps_per_second": 3.014, | |
| "epoch": 5.0, | |
| "step": 625 | |
| }, | |
| { | |
| "loss": 0.0064, | |
| "grad_norm": 0.06534432619810104, | |
| "learning_rate": 5.02e-06, | |
| "epoch": 6.0, | |
| "step": 750 | |
| }, | |
| { | |
| "eval_loss": 0.0003266753919888288, | |
| "eval_runtime": 7.8595, | |
| "eval_samples_per_second": 17.813, | |
| "eval_steps_per_second": 4.453, | |
| "epoch": 6.0, | |
| "step": 750 | |
| }, | |
| { | |
| "loss": 0.0053, | |
| "grad_norm": 0.22041985392570496, | |
| "learning_rate": 2.52e-06, | |
| "epoch": 7.0, | |
| "step": 875 | |
| }, | |
| { | |
| "eval_loss": 0.0002930415503215045, | |
| "eval_runtime": 8.6639, | |
| "eval_samples_per_second": 16.159, | |
| "eval_steps_per_second": 4.04, | |
| "epoch": 7.0, | |
| "step": 875 | |
| }, | |
| { | |
| "loss": 0.0053, | |
| "grad_norm": 0.8123140931129456, | |
| "learning_rate": 2e-08, | |
| "epoch": 8.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "eval_loss": 0.0002744992380030453, | |
| "eval_runtime": 7.9757, | |
| "eval_samples_per_second": 17.553, | |
| "eval_steps_per_second": 4.388, | |
| "epoch": 8.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "train_runtime": 4509.2089, | |
| "train_samples_per_second": 1.774, | |
| "train_steps_per_second": 0.222, | |
| "total_flos": 268101535137792.0, | |
| "train_loss": 0.11644796460866928, | |
| "epoch": 8.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "eval_loss": 0.0002744992380030453, | |
| "eval_runtime": 8.4931, | |
| "eval_samples_per_second": 16.484, | |
| "eval_steps_per_second": 4.121, | |
| "epoch": 8.0, | |
| "step": 1000 | |
| } | |
| ] | |
| } | |