CodeIsAbstract commited on
Commit
16dee4d
·
verified ·
1 Parent(s): 83e229c

Training in progress, step 50, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bbe6fe1babb0e8d8c27837f99199a1442757cd3c7e7a0ca8acb25c6876e86e6e
3
  size 1738460416
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e219b25b7e3609e604ef05ade6d200dabd377e65247e60e3e2ff5ed1c7e25fe1
3
  size 1738460416
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a68596138663ffb41516fc6f90b803f499772e83b55e196c5e91745524db2517
3
  size 3477327340
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cb5c19a9e3e14de1d661eba59716d3a9e1a9a87a5be68b944fb729f292c5937b
3
  size 3477327340
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:81d5f83aeb4b3f559bd28377336d47659b320e7f6ef2e5a723d284716278a151
3
  size 15429
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9892a41432d4e48929c5376b8225d5373bb9afe9f14665fbcb3934dc45cb330a
3
  size 15429
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2626437dcb133ffcf003ac89603f8cce07459b93a98d760cd9419e0d6a994067
3
  size 15429
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b6f3949e2b25ad05905da16bc2d58aeadc9a9f1db0b0e97a04ceb63467acff1d
3
  size 15429
last-checkpoint/rng_state_2.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ae777e24d50cb7159634e1245f0697ba0fc64d5b26d535f2c80e411371a90b1c
3
  size 15429
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5c3812c5e7f13c9d32f97d83cd625428061b1c9486e869caffd453d83ac07ceb
3
  size 15429
last-checkpoint/rng_state_3.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:afc5a67564eebcfc961e8f1406a7418cc73497c2935a39af0232ef59f8153a6a
3
  size 15429
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6eda756b33768639c1e1932ae00c5d43269de5705c09162bc09acdf71d3533c0
3
  size 15429
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:51eb67b845fb6f64dece598e11e09c3b72500e12b8629f58f93cab1700a7a3de
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ac56030360eaf7d09a44b289120bcd685e39fa9a366361e9c512debf4fa01791
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,611 +2,129 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.26666666666666666,
6
- "eval_steps": 100,
7
- "global_step": 400,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.0033333333333333335,
14
- "grad_norm": 27.25,
15
- "learning_rate": 8.000000000000001e-06,
16
- "loss": 48.7359,
17
  "step": 5
18
  },
19
  {
20
- "epoch": 0.006666666666666667,
21
- "grad_norm": 20.75,
22
- "learning_rate": 1.8e-05,
23
- "loss": 47.3893,
24
  "step": 10
25
  },
26
- {
27
- "epoch": 0.01,
28
- "grad_norm": 12.9375,
29
- "learning_rate": 2e-05,
30
- "loss": 44.1295,
31
- "step": 15
32
- },
33
- {
34
- "epoch": 0.013333333333333334,
35
- "grad_norm": 9.6875,
36
- "learning_rate": 2e-05,
37
- "loss": 41.9134,
38
- "step": 20
39
- },
40
- {
41
- "epoch": 0.016666666666666666,
42
- "grad_norm": 8.25,
43
- "learning_rate": 2e-05,
44
- "loss": 40.9631,
45
- "step": 25
46
- },
47
- {
48
- "epoch": 0.02,
49
- "grad_norm": 7.53125,
50
- "learning_rate": 2e-05,
51
- "loss": 40.2396,
52
- "step": 30
53
- },
54
- {
55
- "epoch": 0.023333333333333334,
56
- "grad_norm": 7.65625,
57
- "learning_rate": 2e-05,
58
- "loss": 39.7111,
59
- "step": 35
60
- },
61
- {
62
- "epoch": 0.02666666666666667,
63
- "grad_norm": 7.375,
64
- "learning_rate": 2e-05,
65
- "loss": 39.2189,
66
- "step": 40
67
- },
68
- {
69
- "epoch": 0.03,
70
- "grad_norm": 6.96875,
71
- "learning_rate": 2e-05,
72
- "loss": 38.8553,
73
- "step": 45
74
- },
75
- {
76
- "epoch": 0.03333333333333333,
77
- "grad_norm": 6.78125,
78
- "learning_rate": 2e-05,
79
- "loss": 38.5259,
80
- "step": 50
81
- },
82
- {
83
- "epoch": 0.03666666666666667,
84
- "grad_norm": 6.53125,
85
- "learning_rate": 2e-05,
86
- "loss": 38.059,
87
- "step": 55
88
- },
89
- {
90
- "epoch": 0.04,
91
- "grad_norm": 6.78125,
92
- "learning_rate": 2e-05,
93
- "loss": 37.7568,
94
- "step": 60
95
- },
96
- {
97
- "epoch": 0.043333333333333335,
98
- "grad_norm": 6.375,
99
- "learning_rate": 2e-05,
100
- "loss": 37.3479,
101
- "step": 65
102
- },
103
- {
104
- "epoch": 0.04666666666666667,
105
- "grad_norm": 6.4375,
106
- "learning_rate": 2e-05,
107
- "loss": 37.0288,
108
- "step": 70
109
- },
110
  {
111
  "epoch": 0.05,
112
- "grad_norm": 6.125,
113
- "learning_rate": 2e-05,
114
- "loss": 36.7166,
115
- "step": 75
116
- },
117
- {
118
- "epoch": 0.05333333333333334,
119
- "grad_norm": 6.0625,
120
- "learning_rate": 2e-05,
121
- "loss": 36.362,
122
- "step": 80
123
- },
124
- {
125
- "epoch": 0.056666666666666664,
126
- "grad_norm": 5.875,
127
- "learning_rate": 2e-05,
128
- "loss": 36.1666,
129
- "step": 85
130
- },
131
- {
132
- "epoch": 0.06,
133
- "grad_norm": 5.9375,
134
- "learning_rate": 2e-05,
135
- "loss": 35.8911,
136
- "step": 90
137
- },
138
- {
139
- "epoch": 0.06333333333333334,
140
- "grad_norm": 5.4375,
141
- "learning_rate": 2e-05,
142
- "loss": 35.6416,
143
- "step": 95
144
- },
145
- {
146
- "epoch": 0.06666666666666667,
147
- "grad_norm": 5.71875,
148
- "learning_rate": 2e-05,
149
- "loss": 35.3982,
150
- "step": 100
151
- },
152
- {
153
- "epoch": 0.06666666666666667,
154
- "eval_loss": 8.794044494628906,
155
- "eval_runtime": 6.9551,
156
- "eval_samples_per_second": 38.676,
157
  "eval_steps_per_second": 1.006,
158
- "step": 100
159
- },
160
- {
161
- "epoch": 0.07,
162
- "grad_norm": 5.5,
163
- "learning_rate": 2e-05,
164
- "loss": 35.1707,
165
- "step": 105
166
- },
167
- {
168
- "epoch": 0.07333333333333333,
169
- "grad_norm": 5.875,
170
- "learning_rate": 2e-05,
171
- "loss": 34.8065,
172
- "step": 110
173
- },
174
- {
175
- "epoch": 0.07666666666666666,
176
- "grad_norm": 5.09375,
177
- "learning_rate": 2e-05,
178
- "loss": 34.5524,
179
- "step": 115
180
- },
181
- {
182
- "epoch": 0.08,
183
- "grad_norm": 5.9375,
184
- "learning_rate": 2e-05,
185
- "loss": 34.5738,
186
- "step": 120
187
- },
188
- {
189
- "epoch": 0.08333333333333333,
190
- "grad_norm": 4.96875,
191
- "learning_rate": 2e-05,
192
- "loss": 34.1881,
193
- "step": 125
194
- },
195
- {
196
- "epoch": 0.08666666666666667,
197
- "grad_norm": 4.9375,
198
- "learning_rate": 2e-05,
199
- "loss": 34.0342,
200
- "step": 130
201
- },
202
- {
203
- "epoch": 0.09,
204
- "grad_norm": 4.9375,
205
- "learning_rate": 2e-05,
206
- "loss": 33.7996,
207
- "step": 135
208
- },
209
- {
210
- "epoch": 0.09333333333333334,
211
- "grad_norm": 4.8125,
212
- "learning_rate": 2e-05,
213
- "loss": 33.5324,
214
- "step": 140
215
  },
216
  {
217
- "epoch": 0.09666666666666666,
218
- "grad_norm": 4.90625,
219
- "learning_rate": 2e-05,
220
- "loss": 33.3612,
221
- "step": 145
222
  },
223
  {
224
  "epoch": 0.1,
225
- "grad_norm": 5.03125,
226
- "learning_rate": 2e-05,
227
- "loss": 33.1498,
228
- "step": 150
229
- },
230
- {
231
- "epoch": 0.10333333333333333,
232
- "grad_norm": 4.78125,
233
- "learning_rate": 2e-05,
234
- "loss": 33.0172,
235
- "step": 155
236
- },
237
- {
238
- "epoch": 0.10666666666666667,
239
- "grad_norm": 4.53125,
240
- "learning_rate": 2e-05,
241
- "loss": 32.9073,
242
- "step": 160
243
- },
244
- {
245
- "epoch": 0.11,
246
- "grad_norm": 4.53125,
247
- "learning_rate": 2e-05,
248
- "loss": 32.5479,
249
- "step": 165
250
- },
251
- {
252
- "epoch": 0.11333333333333333,
253
- "grad_norm": 4.46875,
254
- "learning_rate": 2e-05,
255
- "loss": 32.4669,
256
- "step": 170
257
- },
258
- {
259
- "epoch": 0.11666666666666667,
260
- "grad_norm": 5.8125,
261
- "learning_rate": 2e-05,
262
- "loss": 32.4108,
263
- "step": 175
264
- },
265
- {
266
- "epoch": 0.12,
267
- "grad_norm": 4.5625,
268
- "learning_rate": 2e-05,
269
- "loss": 32.0156,
270
- "step": 180
271
- },
272
- {
273
- "epoch": 0.12333333333333334,
274
- "grad_norm": 4.34375,
275
- "learning_rate": 2e-05,
276
- "loss": 32.0051,
277
- "step": 185
278
- },
279
- {
280
- "epoch": 0.12666666666666668,
281
- "grad_norm": 4.34375,
282
- "learning_rate": 2e-05,
283
- "loss": 31.8771,
284
- "step": 190
285
- },
286
- {
287
- "epoch": 0.13,
288
- "grad_norm": 4.6875,
289
- "learning_rate": 2e-05,
290
- "loss": 31.6117,
291
- "step": 195
292
- },
293
- {
294
- "epoch": 0.13333333333333333,
295
- "grad_norm": 4.3125,
296
- "learning_rate": 2e-05,
297
- "loss": 31.5273,
298
- "step": 200
299
- },
300
- {
301
- "epoch": 0.13333333333333333,
302
- "eval_loss": 7.888162612915039,
303
- "eval_runtime": 6.8793,
304
- "eval_samples_per_second": 39.103,
305
- "eval_steps_per_second": 1.018,
306
- "step": 200
307
- },
308
- {
309
- "epoch": 0.13666666666666666,
310
- "grad_norm": 4.0625,
311
- "learning_rate": 2e-05,
312
- "loss": 31.3537,
313
- "step": 205
314
- },
315
- {
316
- "epoch": 0.14,
317
- "grad_norm": 4.34375,
318
- "learning_rate": 2e-05,
319
- "loss": 31.1251,
320
- "step": 210
321
  },
322
  {
323
- "epoch": 0.14333333333333334,
324
- "grad_norm": 3.90625,
325
- "learning_rate": 2e-05,
326
- "loss": 31.0599,
327
- "step": 215
 
328
  },
329
  {
330
- "epoch": 0.14666666666666667,
331
- "grad_norm": 3.96875,
332
- "learning_rate": 2e-05,
333
- "loss": 30.9825,
334
- "step": 220
335
  },
336
  {
337
  "epoch": 0.15,
338
- "grad_norm": 3.78125,
339
- "learning_rate": 2e-05,
340
- "loss": 30.7881,
341
- "step": 225
342
- },
343
- {
344
- "epoch": 0.15333333333333332,
345
- "grad_norm": 3.953125,
346
- "learning_rate": 2e-05,
347
- "loss": 30.6811,
348
- "step": 230
349
- },
350
- {
351
- "epoch": 0.15666666666666668,
352
- "grad_norm": 3.609375,
353
- "learning_rate": 2e-05,
354
- "loss": 30.6916,
355
- "step": 235
356
- },
357
- {
358
- "epoch": 0.16,
359
- "grad_norm": 4.1875,
360
- "learning_rate": 2e-05,
361
- "loss": 30.3585,
362
- "step": 240
363
- },
364
- {
365
- "epoch": 0.16333333333333333,
366
- "grad_norm": 5.90625,
367
- "learning_rate": 2e-05,
368
- "loss": 30.4089,
369
- "step": 245
370
- },
371
- {
372
- "epoch": 0.16666666666666666,
373
- "grad_norm": 15.3125,
374
- "learning_rate": 2e-05,
375
- "loss": 30.3882,
376
- "step": 250
377
- },
378
- {
379
- "epoch": 0.17,
380
- "grad_norm": 8.25,
381
- "learning_rate": 2e-05,
382
- "loss": 30.2357,
383
- "step": 255
384
- },
385
- {
386
- "epoch": 0.17333333333333334,
387
- "grad_norm": 8.875,
388
- "learning_rate": 2e-05,
389
- "loss": 30.2875,
390
- "step": 260
391
- },
392
- {
393
- "epoch": 0.17666666666666667,
394
- "grad_norm": 21.375,
395
- "learning_rate": 2e-05,
396
- "loss": 30.1799,
397
- "step": 265
398
- },
399
- {
400
- "epoch": 0.18,
401
- "grad_norm": 33.25,
402
- "learning_rate": 2e-05,
403
- "loss": 30.3195,
404
- "step": 270
405
- },
406
- {
407
- "epoch": 0.18333333333333332,
408
- "grad_norm": 14.0625,
409
- "learning_rate": 2e-05,
410
- "loss": 30.3163,
411
- "step": 275
412
- },
413
- {
414
- "epoch": 0.18666666666666668,
415
- "grad_norm": 5.25,
416
- "learning_rate": 2e-05,
417
- "loss": 30.2876,
418
- "step": 280
419
- },
420
- {
421
- "epoch": 0.19,
422
- "grad_norm": 3.78125,
423
- "learning_rate": 2e-05,
424
- "loss": 30.3209,
425
- "step": 285
426
  },
427
  {
428
- "epoch": 0.19333333333333333,
429
- "grad_norm": 3.078125,
430
- "learning_rate": 2e-05,
431
- "loss": 30.1198,
432
- "step": 290
 
433
  },
434
  {
435
- "epoch": 0.19666666666666666,
436
- "grad_norm": 4.5625,
437
- "learning_rate": 2e-05,
438
- "loss": 30.0731,
439
- "step": 295
440
  },
441
  {
442
  "epoch": 0.2,
443
- "grad_norm": 25.5,
444
- "learning_rate": 2e-05,
445
- "loss": 29.9634,
446
- "step": 300
447
  },
448
  {
449
  "epoch": 0.2,
450
- "eval_loss": 7.543545246124268,
451
- "eval_runtime": 6.7597,
452
- "eval_samples_per_second": 39.794,
453
- "eval_steps_per_second": 1.036,
454
- "step": 300
455
- },
456
- {
457
- "epoch": 0.20333333333333334,
458
- "grad_norm": 17.375,
459
- "learning_rate": 2e-05,
460
- "loss": 29.8938,
461
- "step": 305
462
- },
463
- {
464
- "epoch": 0.20666666666666667,
465
- "grad_norm": 24.375,
466
- "learning_rate": 2e-05,
467
- "loss": 29.8926,
468
- "step": 310
469
- },
470
- {
471
- "epoch": 0.21,
472
- "grad_norm": 36.5,
473
- "learning_rate": 2e-05,
474
- "loss": 29.9906,
475
- "step": 315
476
- },
477
- {
478
- "epoch": 0.21333333333333335,
479
- "grad_norm": 23.0,
480
- "learning_rate": 2e-05,
481
- "loss": 29.9687,
482
- "step": 320
483
- },
484
- {
485
- "epoch": 0.21666666666666667,
486
- "grad_norm": 30.625,
487
- "learning_rate": 2e-05,
488
- "loss": 30.0537,
489
- "step": 325
490
- },
491
- {
492
- "epoch": 0.22,
493
- "grad_norm": 26.0,
494
- "learning_rate": 2e-05,
495
- "loss": 30.3012,
496
- "step": 330
497
- },
498
- {
499
- "epoch": 0.22333333333333333,
500
- "grad_norm": 24.0,
501
- "learning_rate": 2e-05,
502
- "loss": 29.9831,
503
- "step": 335
504
- },
505
- {
506
- "epoch": 0.22666666666666666,
507
- "grad_norm": 5.53125,
508
- "learning_rate": 2e-05,
509
- "loss": 30.1414,
510
- "step": 340
511
- },
512
- {
513
- "epoch": 0.23,
514
- "grad_norm": 8.5625,
515
- "learning_rate": 2e-05,
516
- "loss": 29.8688,
517
- "step": 345
518
- },
519
- {
520
- "epoch": 0.23333333333333334,
521
- "grad_norm": 15.375,
522
- "learning_rate": 2e-05,
523
- "loss": 29.9341,
524
- "step": 350
525
- },
526
- {
527
- "epoch": 0.23666666666666666,
528
- "grad_norm": 4.625,
529
- "learning_rate": 2e-05,
530
- "loss": 29.8085,
531
- "step": 355
532
- },
533
- {
534
- "epoch": 0.24,
535
- "grad_norm": 5.0625,
536
- "learning_rate": 2e-05,
537
- "loss": 29.7093,
538
- "step": 360
539
- },
540
- {
541
- "epoch": 0.24333333333333335,
542
- "grad_norm": 6.8125,
543
- "learning_rate": 2e-05,
544
- "loss": 29.6956,
545
- "step": 365
546
  },
547
  {
548
- "epoch": 0.24666666666666667,
549
- "grad_norm": 5.09375,
550
- "learning_rate": 2e-05,
551
- "loss": 29.7583,
552
- "step": 370
553
  },
554
  {
555
  "epoch": 0.25,
556
- "grad_norm": 12.625,
557
- "learning_rate": 2e-05,
558
- "loss": 29.6723,
559
- "step": 375
560
- },
561
- {
562
- "epoch": 0.25333333333333335,
563
- "grad_norm": 9.5,
564
- "learning_rate": 2e-05,
565
- "loss": 29.6157,
566
- "step": 380
567
- },
568
- {
569
- "epoch": 0.25666666666666665,
570
- "grad_norm": 23.5,
571
- "learning_rate": 2e-05,
572
- "loss": 29.6261,
573
- "step": 385
574
- },
575
- {
576
- "epoch": 0.26,
577
- "grad_norm": 21.75,
578
- "learning_rate": 2e-05,
579
- "loss": 29.6411,
580
- "step": 390
581
- },
582
- {
583
- "epoch": 0.2633333333333333,
584
- "grad_norm": 30.25,
585
- "learning_rate": 2e-05,
586
- "loss": 29.7162,
587
- "step": 395
588
- },
589
- {
590
- "epoch": 0.26666666666666666,
591
- "grad_norm": 8.3125,
592
- "learning_rate": 2e-05,
593
- "loss": 29.6952,
594
- "step": 400
595
  },
596
  {
597
- "epoch": 0.26666666666666666,
598
- "eval_loss": 7.468276023864746,
599
- "eval_runtime": 6.838,
600
- "eval_samples_per_second": 39.339,
601
- "eval_steps_per_second": 1.024,
602
- "step": 400
603
  }
604
  ],
605
  "logging_steps": 5,
606
- "max_steps": 1500,
607
  "num_input_tokens_seen": 0,
608
  "num_train_epochs": 9223372036854775807,
609
- "save_steps": 200,
610
  "stateful_callbacks": {
611
  "TrainerControl": {
612
  "args": {
@@ -619,8 +137,8 @@
619
  "attributes": {}
620
  }
621
  },
622
- "total_flos": 2.6162939312472064e+17,
623
- "train_batch_size": 10,
624
  "trial_name": null,
625
  "trial_params": null
626
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.25,
6
+ "eval_steps": 10,
7
+ "global_step": 50,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.025,
14
+ "grad_norm": 67.5,
15
+ "learning_rate": 0.0004,
16
+ "loss": 271.8493,
17
  "step": 5
18
  },
19
  {
20
+ "epoch": 0.05,
21
+ "grad_norm": 68.5,
22
+ "learning_rate": 0.0009000000000000001,
23
+ "loss": 208.6483,
24
  "step": 10
25
  },
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
26
  {
27
  "epoch": 0.05,
28
+ "eval_loss": 7.974327087402344,
29
+ "eval_runtime": 6.9602,
30
+ "eval_samples_per_second": 19.252,
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
31
  "eval_steps_per_second": 1.006,
32
+ "step": 10
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
33
  },
34
  {
35
+ "epoch": 0.075,
36
+ "grad_norm": 114.5,
37
+ "learning_rate": 0.0009989068136093873,
38
+ "loss": 190.7281,
39
+ "step": 15
40
  },
41
  {
42
  "epoch": 0.1,
43
+ "grad_norm": 26.25,
44
+ "learning_rate": 0.0009944739353007343,
45
+ "loss": 188.7951,
46
+ "step": 20
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
47
  },
48
  {
49
+ "epoch": 0.1,
50
+ "eval_loss": 7.880503177642822,
51
+ "eval_runtime": 6.6198,
52
+ "eval_samples_per_second": 20.242,
53
+ "eval_steps_per_second": 1.057,
54
+ "step": 20
55
  },
56
  {
57
+ "epoch": 0.125,
58
+ "grad_norm": 23.75,
59
+ "learning_rate": 0.000986663298624003,
60
+ "loss": 186.3658,
61
+ "step": 25
62
  },
63
  {
64
  "epoch": 0.15,
65
+ "grad_norm": 14.5,
66
+ "learning_rate": 0.0009755282581475768,
67
+ "loss": 185.2524,
68
+ "step": 30
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
69
  },
70
  {
71
+ "epoch": 0.15,
72
+ "eval_loss": 7.70925760269165,
73
+ "eval_runtime": 6.8441,
74
+ "eval_samples_per_second": 19.579,
75
+ "eval_steps_per_second": 1.023,
76
+ "step": 30
77
  },
78
  {
79
+ "epoch": 0.175,
80
+ "grad_norm": 20.75,
81
+ "learning_rate": 0.0009611448774886924,
82
+ "loss": 182.743,
83
+ "step": 35
84
  },
85
  {
86
  "epoch": 0.2,
87
+ "grad_norm": 146.0,
88
+ "learning_rate": 0.000943611409721806,
89
+ "loss": 181.0595,
90
+ "step": 40
91
  },
92
  {
93
  "epoch": 0.2,
94
+ "eval_loss": 7.680881023406982,
95
+ "eval_runtime": 6.8778,
96
+ "eval_samples_per_second": 19.483,
97
+ "eval_steps_per_second": 1.018,
98
+ "step": 40
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
99
  },
100
  {
101
+ "epoch": 0.225,
102
+ "grad_norm": 14336.0,
103
+ "learning_rate": 0.0009230476262104677,
104
+ "loss": 183.6445,
105
+ "step": 45
106
  },
107
  {
108
  "epoch": 0.25,
109
+ "grad_norm": 10176.0,
110
+ "learning_rate": 0.0008995939984474624,
111
+ "loss": 192.1855,
112
+ "step": 50
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
113
  },
114
  {
115
+ "epoch": 0.25,
116
+ "eval_loss": 8.385082244873047,
117
+ "eval_runtime": 6.7705,
118
+ "eval_samples_per_second": 19.792,
119
+ "eval_steps_per_second": 1.034,
120
+ "step": 50
121
  }
122
  ],
123
  "logging_steps": 5,
124
+ "max_steps": 200,
125
  "num_input_tokens_seen": 0,
126
  "num_train_epochs": 9223372036854775807,
127
+ "save_steps": 50,
128
  "stateful_callbacks": {
129
  "TrainerControl": {
130
  "args": {
 
137
  "attributes": {}
138
  }
139
  },
140
+ "total_flos": 1.9622204484354048e+17,
141
+ "train_batch_size": 5,
142
  "trial_name": null,
143
  "trial_params": null
144
  }
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:312a0ac7d3d7dd02c5699f77d48121d29f2b0b83c1a40f2d885f5e5598f0a3af
3
  size 5841
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:855e4e426c5eafaf63f7a009322eb06b70910e4a4bee1286781bd91f0ef7fc5c
3
  size 5841