CodeIsAbstract commited on
Commit
c6e8ef0
·
verified ·
1 Parent(s): 62a7535

Training in progress, step 200, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cad8695f9611fd72a1cb7da7c2dc7722ffd94491b413b08931297f19a10ee048
3
  size 234681136
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e5742327392312dd1a7e23ca028cd9e6187add4ba8fb99e3a28ce17d8dbe3b26
3
  size 234681136
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0f17b41e804bbacf24053241af7cfe65159104d0213019d3237630b978e42eda
3
  size 469516363
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d2a1a873a10876a3541cbda1bda6ef5a52202b10618859918417990065cc8b5c
3
  size 469516363
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:76cd281a3ce995fc434ac757f1094066d955dd6b7188cf148f0dd1523cb9cd80
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:78f00cbf2a3a4305cbfbe0a453688d1bb898224da36be2f067d77db0d73462c1
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e63258c783b6bbb756d9067a003d6c6c729901571b495c03dd6472af6b5a7f7b
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4dcd0fcafdf0cac56c6781c9554680e5d2ba9bfee0d823975791d1d648a00172
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,409 +2,331 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.07142857142857142,
6
- "eval_steps": 100,
7
- "global_step": 500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.0014285714285714286,
14
- "grad_norm": 0.060791015625,
15
- "learning_rate": 8.571428571428572e-07,
16
- "loss": 2.637472915649414,
17
- "step": 10
18
  },
19
  {
20
- "epoch": 0.002857142857142857,
21
- "grad_norm": 0.053955078125,
22
- "learning_rate": 1.8095238095238097e-06,
23
- "loss": 2.6134210586547852,
24
- "step": 20
25
- },
26
- {
27
- "epoch": 0.004285714285714286,
28
- "grad_norm": 0.05126953125,
29
- "learning_rate": 2.7619047619047625e-06,
30
- "loss": 2.617936134338379,
31
- "step": 30
32
  },
33
  {
34
- "epoch": 0.005714285714285714,
35
- "grad_norm": 0.052978515625,
36
- "learning_rate": 3.7142857142857146e-06,
37
- "loss": 2.6247318267822264,
38
- "step": 40
39
  },
40
  {
41
- "epoch": 0.007142857142857143,
42
- "grad_norm": 0.049560546875,
43
- "learning_rate": 4.666666666666667e-06,
44
- "loss": 2.6199132919311525,
45
- "step": 50
46
  },
47
  {
48
- "epoch": 0.008571428571428572,
49
- "grad_norm": 0.049560546875,
50
- "learning_rate": 5.619047619047619e-06,
51
- "loss": 2.6097543716430662,
52
- "step": 60
53
  },
54
  {
55
  "epoch": 0.01,
56
- "grad_norm": 0.10986328125,
57
- "learning_rate": 6.571428571428572e-06,
58
- "loss": 2.6390161514282227,
59
- "step": 70
60
  },
61
  {
62
- "epoch": 0.011428571428571429,
63
- "grad_norm": 0.3671875,
64
- "learning_rate": 7.523809523809524e-06,
65
- "loss": 2.6347326278686523,
66
- "step": 80
67
  },
68
  {
69
- "epoch": 0.012857142857142857,
70
- "grad_norm": 0.796875,
71
- "learning_rate": 8.476190476190477e-06,
72
- "loss": 2.6170269012451173,
73
- "step": 90
74
- },
75
- {
76
- "epoch": 0.014285714285714285,
77
- "grad_norm": 5.34375,
78
- "learning_rate": 9.42857142857143e-06,
79
- "loss": 2.62125186920166,
80
- "step": 100
81
  },
82
  {
83
- "epoch": 0.014285714285714285,
84
- "eval_loss": 3.02799129486084,
85
- "eval_runtime": 4.4776,
86
- "eval_samples_per_second": 66.554,
87
- "eval_steps_per_second": 3.797,
88
- "step": 100
89
  },
90
  {
91
- "epoch": 0.015714285714285715,
92
- "grad_norm": 0.4140625,
93
- "learning_rate": 1.0380952380952383e-05,
94
- "loss": 2.6266862869262697,
95
- "step": 110
96
  },
97
  {
98
- "epoch": 0.017142857142857144,
99
- "grad_norm": 0.0634765625,
100
- "learning_rate": 1.1333333333333334e-05,
101
- "loss": 2.646818161010742,
102
- "step": 120
 
103
  },
104
  {
105
- "epoch": 0.018571428571428572,
106
- "grad_norm": 0.3671875,
107
- "learning_rate": 1.2285714285714288e-05,
108
- "loss": 2.616552543640137,
109
- "step": 130
110
  },
111
  {
112
  "epoch": 0.02,
113
- "grad_norm": 0.04638671875,
114
- "learning_rate": 1.3238095238095238e-05,
115
- "loss": 2.619216728210449,
116
- "step": 140
117
- },
118
- {
119
- "epoch": 0.02142857142857143,
120
- "grad_norm": 0.0498046875,
121
- "learning_rate": 1.4190476190476192e-05,
122
- "loss": 2.652239990234375,
123
- "step": 150
124
- },
125
- {
126
- "epoch": 0.022857142857142857,
127
- "grad_norm": 0.057373046875,
128
- "learning_rate": 1.5142857142857144e-05,
129
- "loss": 2.5990116119384767,
130
- "step": 160
131
  },
132
  {
133
- "epoch": 0.024285714285714285,
134
- "grad_norm": 0.4140625,
135
- "learning_rate": 1.6095238095238096e-05,
136
- "loss": 2.635771369934082,
137
- "step": 170
138
  },
139
  {
140
- "epoch": 0.025714285714285714,
141
- "grad_norm": 0.0517578125,
142
- "learning_rate": 1.704761904761905e-05,
143
- "loss": 2.617422103881836,
144
- "step": 180
145
  },
146
  {
147
- "epoch": 0.027142857142857142,
148
- "grad_norm": 0.064453125,
149
- "learning_rate": 1.8e-05,
150
- "loss": 2.64025764465332,
151
- "step": 190
152
  },
153
  {
154
- "epoch": 0.02857142857142857,
155
- "grad_norm": 0.046875,
156
- "learning_rate": 1.8952380952380953e-05,
157
- "loss": 2.6089372634887695,
158
- "step": 200
159
  },
160
  {
161
- "epoch": 0.02857142857142857,
162
- "eval_loss": 3.0282089710235596,
163
- "eval_runtime": 4.3641,
164
- "eval_samples_per_second": 68.284,
165
- "eval_steps_per_second": 3.895,
166
- "step": 200
167
  },
168
  {
169
  "epoch": 0.03,
170
- "grad_norm": 0.0537109375,
171
- "learning_rate": 1.9904761904761908e-05,
172
- "loss": 2.6311504364013674,
173
- "step": 210
174
  },
175
  {
176
- "epoch": 0.03142857142857143,
177
- "grad_norm": 0.05078125,
178
- "learning_rate": 2e-05,
179
- "loss": 2.6472368240356445,
180
- "step": 220
181
  },
182
  {
183
- "epoch": 0.032857142857142856,
184
- "grad_norm": 0.05322265625,
185
- "learning_rate": 2e-05,
186
- "loss": 2.6085578918457033,
187
- "step": 230
188
  },
189
  {
190
- "epoch": 0.03428571428571429,
191
- "grad_norm": 0.046630859375,
192
- "learning_rate": 2e-05,
193
- "loss": 2.6177978515625,
194
- "step": 240
 
195
  },
196
  {
197
- "epoch": 0.03571428571428571,
198
- "grad_norm": 0.06298828125,
199
- "learning_rate": 2e-05,
200
- "loss": 2.6038957595825196,
201
- "step": 250
202
  },
203
  {
204
- "epoch": 0.037142857142857144,
205
- "grad_norm": 0.048095703125,
206
- "learning_rate": 2e-05,
207
- "loss": 2.6111982345581053,
208
- "step": 260
209
  },
210
  {
211
- "epoch": 0.03857142857142857,
212
- "grad_norm": 0.04833984375,
213
- "learning_rate": 2e-05,
214
- "loss": 2.600232696533203,
215
- "step": 270
216
  },
217
  {
218
  "epoch": 0.04,
219
- "grad_norm": 0.046630859375,
220
- "learning_rate": 2e-05,
221
- "loss": 2.591439056396484,
222
- "step": 280
223
- },
224
- {
225
- "epoch": 0.041428571428571426,
226
- "grad_norm": 0.04833984375,
227
- "learning_rate": 2e-05,
228
- "loss": 2.6285400390625,
229
- "step": 290
230
- },
231
- {
232
- "epoch": 0.04285714285714286,
233
- "grad_norm": 40.0,
234
- "learning_rate": 2e-05,
235
- "loss": 2.6076997756958007,
236
- "step": 300
237
  },
238
  {
239
- "epoch": 0.04285714285714286,
240
- "eval_loss": 3.02835750579834,
241
- "eval_runtime": 4.3773,
242
- "eval_samples_per_second": 68.079,
243
- "eval_steps_per_second": 3.884,
244
- "step": 300
245
  },
246
  {
247
- "epoch": 0.04428571428571428,
248
- "grad_norm": 0.049072265625,
249
- "learning_rate": 2e-05,
250
- "loss": 2.618265914916992,
251
- "step": 310
252
  },
253
  {
254
- "epoch": 0.045714285714285714,
255
- "grad_norm": 0.044677734375,
256
- "learning_rate": 2e-05,
257
- "loss": 2.6028215408325197,
258
- "step": 320
259
  },
260
  {
261
- "epoch": 0.047142857142857146,
262
- "grad_norm": 0.048828125,
263
- "learning_rate": 2e-05,
264
- "loss": 2.6143060684204102,
265
- "step": 330
266
  },
267
  {
268
- "epoch": 0.04857142857142857,
269
- "grad_norm": 0.0498046875,
270
- "learning_rate": 2e-05,
271
- "loss": 2.602345275878906,
272
- "step": 340
273
  },
274
  {
275
  "epoch": 0.05,
276
- "grad_norm": 0.06494140625,
277
- "learning_rate": 2e-05,
278
- "loss": 2.597218704223633,
279
- "step": 350
280
- },
281
- {
282
- "epoch": 0.05142857142857143,
283
- "grad_norm": 0.07568359375,
284
- "learning_rate": 2e-05,
285
- "loss": 2.6153676986694334,
286
- "step": 360
287
  },
288
  {
289
- "epoch": 0.05285714285714286,
290
- "grad_norm": 0.06787109375,
291
- "learning_rate": 2e-05,
292
- "loss": 2.610495948791504,
293
- "step": 370
 
294
  },
295
  {
296
- "epoch": 0.054285714285714284,
297
- "grad_norm": 0.05224609375,
298
- "learning_rate": 2e-05,
299
- "loss": 2.6116031646728515,
300
- "step": 380
301
  },
302
  {
303
- "epoch": 0.055714285714285716,
304
- "grad_norm": 0.08837890625,
305
- "learning_rate": 2e-05,
306
- "loss": 2.6053627014160154,
307
- "step": 390
308
  },
309
  {
310
- "epoch": 0.05714285714285714,
311
- "grad_norm": 0.08447265625,
312
- "learning_rate": 2e-05,
313
- "loss": 2.599230194091797,
314
- "step": 400
315
  },
316
  {
317
- "epoch": 0.05714285714285714,
318
- "eval_loss": 3.0280556678771973,
319
- "eval_runtime": 4.3932,
320
- "eval_samples_per_second": 67.831,
321
- "eval_steps_per_second": 3.87,
322
- "step": 400
323
  },
324
  {
325
- "epoch": 0.05857142857142857,
326
- "grad_norm": 0.0712890625,
327
- "learning_rate": 2e-05,
328
- "loss": 2.6664922714233397,
329
- "step": 410
330
  },
331
  {
332
  "epoch": 0.06,
333
- "grad_norm": 0.07373046875,
334
- "learning_rate": 2e-05,
335
- "loss": 2.6177946090698243,
336
- "step": 420
337
- },
338
- {
339
- "epoch": 0.06142857142857143,
340
- "grad_norm": 0.064453125,
341
- "learning_rate": 2e-05,
342
- "loss": 2.6283496856689452,
343
- "step": 430
344
- },
345
- {
346
- "epoch": 0.06285714285714286,
347
- "grad_norm": 0.04736328125,
348
- "learning_rate": 2e-05,
349
- "loss": 2.6089170455932615,
350
- "step": 440
351
- },
352
- {
353
- "epoch": 0.06428571428571428,
354
- "grad_norm": 0.06298828125,
355
- "learning_rate": 2e-05,
356
- "loss": 2.625172233581543,
357
- "step": 450
358
- },
359
- {
360
- "epoch": 0.06571428571428571,
361
- "grad_norm": 0.109375,
362
- "learning_rate": 2e-05,
363
- "loss": 2.6342344284057617,
364
- "step": 460
365
  },
366
  {
367
- "epoch": 0.06714285714285714,
368
- "grad_norm": 0.048583984375,
369
- "learning_rate": 2e-05,
370
- "loss": 2.6153539657592773,
371
- "step": 470
372
  },
373
  {
374
- "epoch": 0.06857142857142857,
375
- "grad_norm": 0.087890625,
376
- "learning_rate": 2e-05,
377
- "loss": 2.5881879806518553,
378
- "step": 480
379
  },
380
  {
381
- "epoch": 0.07,
382
- "grad_norm": 0.047607421875,
383
- "learning_rate": 2e-05,
384
- "loss": 2.6207881927490235,
385
- "step": 490
386
  },
387
  {
388
- "epoch": 0.07142857142857142,
389
- "grad_norm": 0.054931640625,
390
- "learning_rate": 2e-05,
391
- "loss": 2.632369041442871,
392
- "step": 500
393
  },
394
  {
395
- "epoch": 0.07142857142857142,
396
- "eval_loss": 3.028033494949341,
397
- "eval_runtime": 4.349,
398
- "eval_samples_per_second": 68.521,
399
- "eval_steps_per_second": 3.909,
400
- "step": 500
401
  }
402
  ],
403
- "logging_steps": 10,
404
- "max_steps": 7000,
405
  "num_input_tokens_seen": 0,
406
  "num_train_epochs": 9223372036854775807,
407
- "save_steps": 500,
408
  "stateful_callbacks": {
409
  "TrainerControl": {
410
  "args": {
@@ -417,7 +339,7 @@
417
  "attributes": {}
418
  }
419
  },
420
- "total_flos": 1.63077257428992e+17,
421
  "train_batch_size": 18,
422
  "trial_name": null,
423
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.06666666666666667,
6
+ "eval_steps": 50,
7
+ "global_step": 200,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.0016666666666666668,
14
+ "grad_norm": 0.140625,
15
+ "learning_rate": 1.6000000000000003e-05,
16
+ "loss": 2.6374650955200196,
17
+ "step": 5
18
  },
19
  {
20
+ "epoch": 0.0033333333333333335,
21
+ "grad_norm": 0.050537109375,
22
+ "learning_rate": 3.6e-05,
23
+ "loss": 2.6133955001831053,
24
+ "step": 10
 
 
 
 
 
 
 
25
  },
26
  {
27
+ "epoch": 0.005,
28
+ "grad_norm": 0.03466796875,
29
+ "learning_rate": 5.6000000000000006e-05,
30
+ "loss": 2.6178274154663086,
31
+ "step": 15
32
  },
33
  {
34
+ "epoch": 0.006666666666666667,
35
+ "grad_norm": 0.037109375,
36
+ "learning_rate": 7.6e-05,
37
+ "loss": 2.624565315246582,
38
+ "step": 20
39
  },
40
  {
41
+ "epoch": 0.008333333333333333,
42
+ "grad_norm": 0.6328125,
43
+ "learning_rate": 9.6e-05,
44
+ "loss": 2.619654655456543,
45
+ "step": 25
46
  },
47
  {
48
  "epoch": 0.01,
49
+ "grad_norm": 0.036376953125,
50
+ "learning_rate": 0.0001,
51
+ "loss": 2.609416389465332,
52
+ "step": 30
53
  },
54
  {
55
+ "epoch": 0.011666666666666667,
56
+ "grad_norm": 0.06591796875,
57
+ "learning_rate": 0.0001,
58
+ "loss": 2.6385807037353515,
59
+ "step": 35
60
  },
61
  {
62
+ "epoch": 0.013333333333333334,
63
+ "grad_norm": 0.041748046875,
64
+ "learning_rate": 0.0001,
65
+ "loss": 2.6341808319091795,
66
+ "step": 40
 
 
 
 
 
 
 
67
  },
68
  {
69
+ "epoch": 0.015,
70
+ "grad_norm": 0.03662109375,
71
+ "learning_rate": 0.0001,
72
+ "loss": 2.6163944244384765,
73
+ "step": 45
 
74
  },
75
  {
76
+ "epoch": 0.016666666666666666,
77
+ "grad_norm": 0.50390625,
78
+ "learning_rate": 0.0001,
79
+ "loss": 2.620637893676758,
80
+ "step": 50
81
  },
82
  {
83
+ "epoch": 0.016666666666666666,
84
+ "eval_loss": 3.0298774242401123,
85
+ "eval_runtime": 4.5343,
86
+ "eval_samples_per_second": 65.722,
87
+ "eval_steps_per_second": 3.749,
88
+ "step": 50
89
  },
90
  {
91
+ "epoch": 0.018333333333333333,
92
+ "grad_norm": 0.1689453125,
93
+ "learning_rate": 0.0001,
94
+ "loss": 2.6260648727416993,
95
+ "step": 55
96
  },
97
  {
98
  "epoch": 0.02,
99
+ "grad_norm": 0.047607421875,
100
+ "learning_rate": 0.0001,
101
+ "loss": 2.6460687637329103,
102
+ "step": 60
 
 
 
 
 
 
 
 
 
 
 
 
 
 
103
  },
104
  {
105
+ "epoch": 0.021666666666666667,
106
+ "grad_norm": 0.0380859375,
107
+ "learning_rate": 0.0001,
108
+ "loss": 2.6157953262329103,
109
+ "step": 65
110
  },
111
  {
112
+ "epoch": 0.023333333333333334,
113
+ "grad_norm": 0.0986328125,
114
+ "learning_rate": 0.0001,
115
+ "loss": 2.61843318939209,
116
+ "step": 70
117
  },
118
  {
119
+ "epoch": 0.025,
120
+ "grad_norm": 0.04931640625,
121
+ "learning_rate": 0.0001,
122
+ "loss": 2.651448059082031,
123
+ "step": 75
124
  },
125
  {
126
+ "epoch": 0.02666666666666667,
127
+ "grad_norm": 0.038330078125,
128
+ "learning_rate": 0.0001,
129
+ "loss": 2.59826545715332,
130
+ "step": 80
131
  },
132
  {
133
+ "epoch": 0.028333333333333332,
134
+ "grad_norm": 0.042724609375,
135
+ "learning_rate": 0.0001,
136
+ "loss": 2.6349016189575196,
137
+ "step": 85
 
138
  },
139
  {
140
  "epoch": 0.03,
141
+ "grad_norm": 0.036376953125,
142
+ "learning_rate": 0.0001,
143
+ "loss": 2.6166595458984374,
144
+ "step": 90
145
  },
146
  {
147
+ "epoch": 0.03166666666666667,
148
+ "grad_norm": 0.74609375,
149
+ "learning_rate": 0.0001,
150
+ "loss": 2.6394269943237303,
151
+ "step": 95
152
  },
153
  {
154
+ "epoch": 0.03333333333333333,
155
+ "grad_norm": 0.032958984375,
156
+ "learning_rate": 0.0001,
157
+ "loss": 2.6080867767333986,
158
+ "step": 100
159
  },
160
  {
161
+ "epoch": 0.03333333333333333,
162
+ "eval_loss": 3.0300662517547607,
163
+ "eval_runtime": 4.4357,
164
+ "eval_samples_per_second": 67.181,
165
+ "eval_steps_per_second": 3.832,
166
+ "step": 100
167
  },
168
  {
169
+ "epoch": 0.035,
170
+ "grad_norm": 0.036376953125,
171
+ "learning_rate": 0.0001,
172
+ "loss": 2.6302499771118164,
173
+ "step": 105
174
  },
175
  {
176
+ "epoch": 0.03666666666666667,
177
+ "grad_norm": 0.042724609375,
178
+ "learning_rate": 0.0001,
179
+ "loss": 2.646461296081543,
180
+ "step": 110
181
  },
182
  {
183
+ "epoch": 0.03833333333333333,
184
+ "grad_norm": 0.05517578125,
185
+ "learning_rate": 0.0001,
186
+ "loss": 2.6076818466186524,
187
+ "step": 115
188
  },
189
  {
190
  "epoch": 0.04,
191
+ "grad_norm": 0.032470703125,
192
+ "learning_rate": 0.0001,
193
+ "loss": 2.616958236694336,
194
+ "step": 120
 
 
 
 
 
 
 
 
 
 
 
 
 
 
195
  },
196
  {
197
+ "epoch": 0.041666666666666664,
198
+ "grad_norm": 0.12353515625,
199
+ "learning_rate": 0.0001,
200
+ "loss": 2.603002166748047,
201
+ "step": 125
 
202
  },
203
  {
204
+ "epoch": 0.043333333333333335,
205
+ "grad_norm": 0.034912109375,
206
+ "learning_rate": 0.0001,
207
+ "loss": 2.6103355407714846,
208
+ "step": 130
209
  },
210
  {
211
+ "epoch": 0.045,
212
+ "grad_norm": 1.1484375,
213
+ "learning_rate": 0.0001,
214
+ "loss": 2.599276542663574,
215
+ "step": 135
216
  },
217
  {
218
+ "epoch": 0.04666666666666667,
219
+ "grad_norm": 0.034912109375,
220
+ "learning_rate": 0.0001,
221
+ "loss": 2.590505599975586,
222
+ "step": 140
223
  },
224
  {
225
+ "epoch": 0.04833333333333333,
226
+ "grad_norm": 0.03857421875,
227
+ "learning_rate": 0.0001,
228
+ "loss": 2.627636528015137,
229
+ "step": 145
230
  },
231
  {
232
  "epoch": 0.05,
233
+ "grad_norm": 262.0,
234
+ "learning_rate": 0.0001,
235
+ "loss": 2.6068201065063477,
236
+ "step": 150
 
 
 
 
 
 
 
237
  },
238
  {
239
+ "epoch": 0.05,
240
+ "eval_loss": 3.0302553176879883,
241
+ "eval_runtime": 4.3841,
242
+ "eval_samples_per_second": 67.972,
243
+ "eval_steps_per_second": 3.878,
244
+ "step": 150
245
  },
246
  {
247
+ "epoch": 0.051666666666666666,
248
+ "grad_norm": 0.359375,
249
+ "learning_rate": 0.0001,
250
+ "loss": 2.617295265197754,
251
+ "step": 155
252
  },
253
  {
254
+ "epoch": 0.05333333333333334,
255
+ "grad_norm": 0.078125,
256
+ "learning_rate": 0.0001,
257
+ "loss": 2.601869010925293,
258
+ "step": 160
259
  },
260
  {
261
+ "epoch": 0.055,
262
+ "grad_norm": 0.06494140625,
263
+ "learning_rate": 0.0001,
264
+ "loss": 2.613315391540527,
265
+ "step": 165
266
  },
267
  {
268
+ "epoch": 0.056666666666666664,
269
+ "grad_norm": 0.039794921875,
270
+ "learning_rate": 0.0001,
271
+ "loss": 2.601426124572754,
272
+ "step": 170
 
273
  },
274
  {
275
+ "epoch": 0.058333333333333334,
276
+ "grad_norm": 0.035888671875,
277
+ "learning_rate": 0.0001,
278
+ "loss": 2.5963130950927735,
279
+ "step": 175
280
  },
281
  {
282
  "epoch": 0.06,
283
+ "grad_norm": 0.036376953125,
284
+ "learning_rate": 0.0001,
285
+ "loss": 2.614262008666992,
286
+ "step": 180
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
287
  },
288
  {
289
+ "epoch": 0.06166666666666667,
290
+ "grad_norm": 0.0380859375,
291
+ "learning_rate": 0.0001,
292
+ "loss": 2.6094554901123046,
293
+ "step": 185
294
  },
295
  {
296
+ "epoch": 0.06333333333333334,
297
+ "grad_norm": 0.064453125,
298
+ "learning_rate": 0.0001,
299
+ "loss": 2.6106592178344727,
300
+ "step": 190
301
  },
302
  {
303
+ "epoch": 0.065,
304
+ "grad_norm": 0.037353515625,
305
+ "learning_rate": 0.0001,
306
+ "loss": 2.604322814941406,
307
+ "step": 195
308
  },
309
  {
310
+ "epoch": 0.06666666666666667,
311
+ "grad_norm": 0.03955078125,
312
+ "learning_rate": 0.0001,
313
+ "loss": 2.5981882095336912,
314
+ "step": 200
315
  },
316
  {
317
+ "epoch": 0.06666666666666667,
318
+ "eval_loss": 3.0292723178863525,
319
+ "eval_runtime": 4.3967,
320
+ "eval_samples_per_second": 67.777,
321
+ "eval_steps_per_second": 3.866,
322
+ "step": 200
323
  }
324
  ],
325
+ "logging_steps": 5,
326
+ "max_steps": 3000,
327
  "num_input_tokens_seen": 0,
328
  "num_train_epochs": 9223372036854775807,
329
+ "save_steps": 200,
330
  "stateful_callbacks": {
331
  "TrainerControl": {
332
  "args": {
 
339
  "attributes": {}
340
  }
341
  },
342
+ "total_flos": 1.304618059431936e+17,
343
  "train_batch_size": 18,
344
  "trial_name": null,
345
  "trial_params": null
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b1ff39bd552f28407a4692ecdd5eb017e018aa993cdeeb1b9fe03f5f01952f94
3
  size 5265
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2fa13de9d6de96ae7af42b5d8ce1dda570123e506d560d8d7900c3522fff7dfe
3
  size 5265