File size: 5,526 Bytes
8515787
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
{
  "configuration": {
    "train_jsonl": "data\\enhanced\\train.jsonl",
    "output_dir": "models\\codet5-java-to-python",
    "val_jsonl": "data\\enhanced\\validation.jsonl",
    "model_name": "Salesforce/codet5-small",
    "direction": "java_to_python",
    "eval_ratio": 0.1,
    "max_input_length": 512,
    "max_target_length": 512,
    "batch_size": 4,
    "epochs": 8,
    "lr": 2e-05,
    "gradient_accumulation_steps": 2,
    "seed": 42,
    "early_stopping_patience": 2
  },
  "base_model": "Salesforce/codet5-small",
  "device": "cpu",
  "cuda_available": false,
  "mixed_precision_fp16": false,
  "pytorch_version": "2.13.0+cpu",
  "training_examples": 1000,
  "validation_examples": 140,
  "token_length_statistics": {
    "train": {
      "inputs": {
        "minimum": 73,
        "median": 107,
        "p95": 149,
        "maximum": 161,
        "limit": 512,
        "truncated_examples": 0
      },
      "targets": {
        "minimum": 23,
        "median": 49,
        "p95": 87,
        "maximum": 97,
        "limit": 512,
        "truncated_examples": 0
      }
    },
    "validation": {
      "inputs": {
        "minimum": 73,
        "median": 107,
        "p95": 149,
        "maximum": 149,
        "limit": 512,
        "truncated_examples": 0
      },
      "targets": {
        "minimum": 23,
        "median": 49,
        "p95": 87,
        "maximum": 87,
        "limit": 512,
        "truncated_examples": 0
      }
    }
  },
  "duration_seconds": 4517.891,
  "best_checkpoint": "models\\codet5-java-to-python\\checkpoint-1000",
  "best_metric": 0.0002744992380030453,
  "train_metrics": {
    "train_runtime": 4509.2089,
    "train_samples_per_second": 1.774,
    "train_steps_per_second": 0.222,
    "total_flos": 268101535137792.0,
    "train_loss": 0.11644796460866928,
    "epoch": 8.0
  },
  "validation_metrics": {
    "eval_loss": 0.0002744992380030453,
    "eval_runtime": 8.4931,
    "eval_samples_per_second": 16.484,
    "eval_steps_per_second": 4.121,
    "epoch": 8.0
  },
  "log_history": [
    {
      "loss": 0.8178,
      "grad_norm": 1.9174737930297852,
      "learning_rate": 1.752e-05,
      "epoch": 1.0,
      "step": 125
    },
    {
      "eval_loss": 0.027854034677147865,
      "eval_runtime": 9.3606,
      "eval_samples_per_second": 14.956,
      "eval_steps_per_second": 3.739,
      "epoch": 1.0,
      "step": 125
    },
    {
      "loss": 0.0566,
      "grad_norm": 1.2266449928283691,
      "learning_rate": 1.5020000000000002e-05,
      "epoch": 2.0,
      "step": 250
    },
    {
      "eval_loss": 0.0061431629583239555,
      "eval_runtime": 12.3133,
      "eval_samples_per_second": 11.37,
      "eval_steps_per_second": 2.842,
      "epoch": 2.0,
      "step": 250
    },
    {
      "loss": 0.0202,
      "grad_norm": 0.3443121016025543,
      "learning_rate": 1.252e-05,
      "epoch": 3.0,
      "step": 375
    },
    {
      "eval_loss": 0.0017448368016630411,
      "eval_runtime": 12.4117,
      "eval_samples_per_second": 11.28,
      "eval_steps_per_second": 2.82,
      "epoch": 3.0,
      "step": 375
    },
    {
      "loss": 0.0117,
      "grad_norm": 0.22224248945713043,
      "learning_rate": 1.002e-05,
      "epoch": 4.0,
      "step": 500
    },
    {
      "eval_loss": 0.0007071287254802883,
      "eval_runtime": 16.8838,
      "eval_samples_per_second": 8.292,
      "eval_steps_per_second": 2.073,
      "epoch": 4.0,
      "step": 500
    },
    {
      "loss": 0.0082,
      "grad_norm": 0.07997278869152069,
      "learning_rate": 7.520000000000001e-06,
      "epoch": 5.0,
      "step": 625
    },
    {
      "eval_loss": 0.00043417332926765084,
      "eval_runtime": 11.6114,
      "eval_samples_per_second": 12.057,
      "eval_steps_per_second": 3.014,
      "epoch": 5.0,
      "step": 625
    },
    {
      "loss": 0.0064,
      "grad_norm": 0.06534432619810104,
      "learning_rate": 5.02e-06,
      "epoch": 6.0,
      "step": 750
    },
    {
      "eval_loss": 0.0003266753919888288,
      "eval_runtime": 7.8595,
      "eval_samples_per_second": 17.813,
      "eval_steps_per_second": 4.453,
      "epoch": 6.0,
      "step": 750
    },
    {
      "loss": 0.0053,
      "grad_norm": 0.22041985392570496,
      "learning_rate": 2.52e-06,
      "epoch": 7.0,
      "step": 875
    },
    {
      "eval_loss": 0.0002930415503215045,
      "eval_runtime": 8.6639,
      "eval_samples_per_second": 16.159,
      "eval_steps_per_second": 4.04,
      "epoch": 7.0,
      "step": 875
    },
    {
      "loss": 0.0053,
      "grad_norm": 0.8123140931129456,
      "learning_rate": 2e-08,
      "epoch": 8.0,
      "step": 1000
    },
    {
      "eval_loss": 0.0002744992380030453,
      "eval_runtime": 7.9757,
      "eval_samples_per_second": 17.553,
      "eval_steps_per_second": 4.388,
      "epoch": 8.0,
      "step": 1000
    },
    {
      "train_runtime": 4509.2089,
      "train_samples_per_second": 1.774,
      "train_steps_per_second": 0.222,
      "total_flos": 268101535137792.0,
      "train_loss": 0.11644796460866928,
      "epoch": 8.0,
      "step": 1000
    },
    {
      "eval_loss": 0.0002744992380030453,
      "eval_runtime": 8.4931,
      "eval_samples_per_second": 16.484,
      "eval_steps_per_second": 4.121,
      "epoch": 8.0,
      "step": 1000
    }
  ]
}