ChiefTheLord commited on
Commit
7ae63ea
·
verified ·
1 Parent(s): a635994

Delete checkpoint-v2.0a-o-discrete-conditional

Browse files
checkpoint-v2.0a-o-discrete-conditional/checkpoint-2048/eval_state.json DELETED
The diff for this file is too large to render. See raw diff
 
checkpoint-v2.0a-o-discrete-conditional/checkpoint-2048/model.safetensors DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:3ac77a1b34a00219f2941325e39db51e9af3764e1cda97026f63d89d9bc9c22b
3
- size 15277472
 
 
 
 
checkpoint-v2.0a-o-discrete-conditional/checkpoint-2048/optimizer.pt DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:efb42aca8a24f33181d1d4487457c8fa9caa1619df479c2a0032e7b4ed93f938
3
- size 13820091
 
 
 
 
checkpoint-v2.0a-o-discrete-conditional/checkpoint-2048/rng_state.pth DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:f2c2d484f771e659bef2d8981d72c8f9967eb5a8999b2e590052563a415996ac
3
- size 14645
 
 
 
 
checkpoint-v2.0a-o-discrete-conditional/checkpoint-2048/scaler.pt DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:12618c8ab208a7959c31d41d88aa9332181b0bd796209e3996b198705d02de7e
3
- size 1383
 
 
 
 
checkpoint-v2.0a-o-discrete-conditional/checkpoint-2048/scheduler.pt DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:97c95ccf96168112b15bef5a867a0320af9b38c712db8ce53a3900f61a37b6ea
3
- size 1465
 
 
 
 
checkpoint-v2.0a-o-discrete-conditional/checkpoint-2048/trainer_state.json DELETED
@@ -1,1538 +0,0 @@
1
- {
2
- "best_global_step": null,
3
- "best_metric": null,
4
- "best_model_checkpoint": null,
5
- "epoch": 2048.0,
6
- "eval_steps": 64,
7
- "global_step": 2048,
8
- "is_hyper_param_search": false,
9
- "is_local_process_zero": true,
10
- "is_world_process_zero": true,
11
- "log_history": [
12
- {
13
- "epoch": 16.0,
14
- "grad_norm": 3.148576259613037,
15
- "learning_rate": 0.000234375,
16
- "loss": 0.23784185945987701,
17
- "step": 16
18
- },
19
- {
20
- "epoch": 32.0,
21
- "grad_norm": 5.380302906036377,
22
- "learning_rate": 0.000484375,
23
- "loss": 0.25058040022850037,
24
- "step": 32
25
- },
26
- {
27
- "epoch": 48.0,
28
- "grad_norm": 4.840417385101318,
29
- "learning_rate": 0.000734375,
30
- "loss": 0.2624973952770233,
31
- "step": 48
32
- },
33
- {
34
- "epoch": 64.0,
35
- "grad_norm": 7.160272598266602,
36
- "learning_rate": 0.000984375,
37
- "loss": 0.2839544117450714,
38
- "step": 64
39
- },
40
- {
41
- "epoch": 64.0,
42
- "eval_bleu": 0.577453197312378,
43
- "eval_cos_loss": 0.06502640619874,
44
- "eval_loss": 0.27716290950775146,
45
- "eval_mse_loss": 0.27716290950775146,
46
- "step": 64
47
- },
48
- {
49
- "epoch": 64.0,
50
- "eval_bleu": 0.577453197312378,
51
- "eval_cos_loss": 0.06502640619874,
52
- "eval_loss": 0.27716290950775146,
53
- "eval_mse_loss": 0.27716290950775146,
54
- "eval_runtime": 1.1951,
55
- "eval_samples_per_second": 107.107,
56
- "eval_steps_per_second": 1.674,
57
- "step": 64
58
- },
59
- {
60
- "epoch": 80.0,
61
- "grad_norm": 6.120606422424316,
62
- "learning_rate": 0.0009998589677226062,
63
- "loss": 0.28671935200691223,
64
- "step": 80
65
- },
66
- {
67
- "epoch": 96.0,
68
- "grad_norm": 7.4773030281066895,
69
- "learning_rate": 0.0009993977281025862,
70
- "loss": 0.2957626283168793,
71
- "step": 96
72
- },
73
- {
74
- "epoch": 112.0,
75
- "grad_norm": 5.387135982513428,
76
- "learning_rate": 0.000998615950346857,
77
- "loss": 0.31511762738227844,
78
- "step": 112
79
- },
80
- {
81
- "epoch": 128.0,
82
- "grad_norm": 5.680504322052002,
83
- "learning_rate": 0.0009975141362390078,
84
- "loss": 0.2962453067302704,
85
- "step": 128
86
- },
87
- {
88
- "epoch": 128.0,
89
- "eval_bleu": 0.48555007255420557,
90
- "eval_cos_loss": 0.07183961942791939,
91
- "eval_loss": 0.3057769536972046,
92
- "eval_mse_loss": 0.3057769536972046,
93
- "step": 128
94
- },
95
- {
96
- "epoch": 128.0,
97
- "eval_bleu": 0.48555007255420557,
98
- "eval_cos_loss": 0.07183961942791939,
99
- "eval_loss": 0.3057769536972046,
100
- "eval_mse_loss": 0.3057769536972046,
101
- "eval_runtime": 0.8745,
102
- "eval_samples_per_second": 146.366,
103
- "eval_steps_per_second": 2.287,
104
- "step": 128
105
- },
106
- {
107
- "epoch": 144.0,
108
- "grad_norm": 4.385462284088135,
109
- "learning_rate": 0.0009960929929777704,
110
- "loss": 0.29686614871025085,
111
- "step": 144
112
- },
113
- {
114
- "epoch": 160.0,
115
- "grad_norm": 7.011136531829834,
116
- "learning_rate": 0.0009943534327231042,
117
- "loss": 0.2880735695362091,
118
- "step": 160
119
- },
120
- {
121
- "epoch": 176.0,
122
- "grad_norm": 4.367685317993164,
123
- "learning_rate": 0.0009922965720107278,
124
- "loss": 0.2833232879638672,
125
- "step": 176
126
- },
127
- {
128
- "epoch": 192.0,
129
- "grad_norm": 6.261765003204346,
130
- "learning_rate": 0.0009899237310354695,
131
- "loss": 0.29143810272216797,
132
- "step": 192
133
- },
134
- {
135
- "epoch": 192.0,
136
- "eval_bleu": 0.5524037807785399,
137
- "eval_cos_loss": 0.06608359143137932,
138
- "eval_loss": 0.2805209159851074,
139
- "eval_mse_loss": 0.2805209159851074,
140
- "step": 192
141
- },
142
- {
143
- "epoch": 192.0,
144
- "eval_bleu": 0.5524037807785399,
145
- "eval_cos_loss": 0.06608359143137932,
146
- "eval_loss": 0.2805209159851074,
147
- "eval_mse_loss": 0.2805209159851074,
148
- "eval_runtime": 1.1374,
149
- "eval_samples_per_second": 112.536,
150
- "eval_steps_per_second": 1.758,
151
- "step": 192
152
- },
153
- {
154
- "epoch": 208.0,
155
- "grad_norm": 6.616072654724121,
156
- "learning_rate": 0.000987236432803903,
157
- "loss": 0.27807363867759705,
158
- "step": 208
159
- },
160
- {
161
- "epoch": 224.0,
162
- "grad_norm": 5.070626258850098,
163
- "learning_rate": 0.0009842364021568047,
164
- "loss": 0.28033965826034546,
165
- "step": 224
166
- },
167
- {
168
- "epoch": 240.0,
169
- "grad_norm": 4.556347846984863,
170
- "learning_rate": 0.000980925564662067,
171
- "loss": 0.2816319465637207,
172
- "step": 240
173
- },
174
- {
175
- "epoch": 256.0,
176
- "grad_norm": 5.806378364562988,
177
- "learning_rate": 0.000977306045378773,
178
- "loss": 0.27801281213760376,
179
- "step": 256
180
- },
181
- {
182
- "epoch": 256.0,
183
- "eval_bleu": 0.5841216106014171,
184
- "eval_cos_loss": 0.06353012472391129,
185
- "eval_loss": 0.2689193934202194,
186
- "eval_mse_loss": 0.2689193934202194,
187
- "step": 256
188
- },
189
- {
190
- "epoch": 256.0,
191
- "eval_bleu": 0.5841216106014171,
192
- "eval_cos_loss": 0.06353012472391129,
193
- "eval_loss": 0.2689193934202194,
194
- "eval_mse_loss": 0.2689193934202194,
195
- "eval_runtime": 0.8786,
196
- "eval_samples_per_second": 145.682,
197
- "eval_steps_per_second": 2.276,
198
- "step": 256
199
- },
200
- {
201
- "epoch": 272.0,
202
- "grad_norm": 6.300445079803467,
203
- "learning_rate": 0.0009733801674932287,
204
- "loss": 0.2830119729042053,
205
- "step": 272
206
- },
207
- {
208
- "epoch": 288.0,
209
- "grad_norm": 5.797390937805176,
210
- "learning_rate": 0.0009691504508278278,
211
- "loss": 0.2906477153301239,
212
- "step": 288
213
- },
214
- {
215
- "epoch": 304.0,
216
- "grad_norm": 3.824460744857788,
217
- "learning_rate": 0.0009646196102237037,
218
- "loss": 0.2848377227783203,
219
- "step": 304
220
- },
221
- {
222
- "epoch": 320.0,
223
- "grad_norm": 4.844005584716797,
224
- "learning_rate": 0.0009597905537982126,
225
- "loss": 0.3038112223148346,
226
- "step": 320
227
- },
228
- {
229
- "epoch": 320.0,
230
- "eval_bleu": 0.50877170912826,
231
- "eval_cos_loss": 0.06883906945586205,
232
- "eval_loss": 0.29213041067123413,
233
- "eval_mse_loss": 0.29213041067123413,
234
- "step": 320
235
- },
236
- {
237
- "epoch": 320.0,
238
- "eval_bleu": 0.50877170912826,
239
- "eval_cos_loss": 0.06883906945586205,
240
- "eval_loss": 0.29213041067123413,
241
- "eval_mse_loss": 0.29213041067123413,
242
- "eval_runtime": 1.0869,
243
- "eval_samples_per_second": 117.762,
244
- "eval_steps_per_second": 1.84,
245
- "step": 320
246
- },
247
- {
248
- "epoch": 336.0,
249
- "grad_norm": 4.888055801391602,
250
- "learning_rate": 0.0009546663810783581,
251
- "loss": 0.28091496229171753,
252
- "step": 336
253
- },
254
- {
255
- "epoch": 352.0,
256
- "grad_norm": 4.821228504180908,
257
- "learning_rate": 0.0009492503810113622,
258
- "loss": 0.28097987174987793,
259
- "step": 352
260
- },
261
- {
262
- "epoch": 368.0,
263
- "grad_norm": 4.503347873687744,
264
- "learning_rate": 0.0009435460298536574,
265
- "loss": 0.27521052956581116,
266
- "step": 368
267
- },
268
- {
269
- "epoch": 384.0,
270
- "grad_norm": 3.8951001167297363,
271
- "learning_rate": 0.000937556988939652,
272
- "loss": 0.2731606066226959,
273
- "step": 384
274
- },
275
- {
276
- "epoch": 384.0,
277
- "eval_bleu": 0.5467535012310109,
278
- "eval_cos_loss": 0.06577872112393379,
279
- "eval_loss": 0.2795831710100174,
280
- "eval_mse_loss": 0.2795831710100174,
281
- "step": 384
282
- },
283
- {
284
- "epoch": 384.0,
285
- "eval_bleu": 0.5467535012310109,
286
- "eval_cos_loss": 0.06577872112393379,
287
- "eval_loss": 0.2795831710100174,
288
- "eval_mse_loss": 0.2795831710100174,
289
- "eval_runtime": 0.8707,
290
- "eval_samples_per_second": 147.005,
291
- "eval_steps_per_second": 2.297,
292
- "step": 384
293
- },
294
- {
295
- "epoch": 400.0,
296
- "grad_norm": 4.886165618896484,
297
- "learning_rate": 0.0009312871023317064,
298
- "loss": 0.27139905095100403,
299
- "step": 400
300
- },
301
- {
302
- "epoch": 416.0,
303
- "grad_norm": 4.521392822265625,
304
- "learning_rate": 0.0009247403943528224,
305
- "loss": 0.2826443910598755,
306
- "step": 416
307
- },
308
- {
309
- "epoch": 432.0,
310
- "grad_norm": 4.5247931480407715,
311
- "learning_rate": 0.0009179210670036351,
312
- "loss": 0.2796178162097931,
313
- "step": 432
314
- },
315
- {
316
- "epoch": 448.0,
317
- "grad_norm": 6.002585411071777,
318
- "learning_rate": 0.0009108334972653607,
319
- "loss": 0.2687041163444519,
320
- "step": 448
321
- },
322
- {
323
- "epoch": 448.0,
324
- "eval_bleu": 0.6011129343982055,
325
- "eval_cos_loss": 0.06211286224424839,
326
- "eval_loss": 0.26566024124622345,
327
- "eval_mse_loss": 0.26566024124622345,
328
- "step": 448
329
- },
330
- {
331
- "epoch": 448.0,
332
- "eval_bleu": 0.6011129343982055,
333
- "eval_cos_loss": 0.06211286224424839,
334
- "eval_loss": 0.26566024124622345,
335
- "eval_mse_loss": 0.26566024124622345,
336
- "eval_runtime": 0.8986,
337
- "eval_samples_per_second": 142.45,
338
- "eval_steps_per_second": 2.226,
339
- "step": 448
340
- },
341
- {
342
- "epoch": 464.0,
343
- "grad_norm": 3.798197031021118,
344
- "learning_rate": 0.0009034822342904337,
345
- "loss": 0.2710013687610626,
346
- "step": 464
347
- },
348
- {
349
- "epoch": 480.0,
350
- "grad_norm": 5.265723705291748,
351
- "learning_rate": 0.0008958719964826361,
352
- "loss": 0.28253716230392456,
353
- "step": 480
354
- },
355
- {
356
- "epoch": 496.0,
357
- "grad_norm": 4.383965492248535,
358
- "learning_rate": 0.0008880076684685934,
359
- "loss": 0.2749737501144409,
360
- "step": 496
361
- },
362
- {
363
- "epoch": 512.0,
364
- "grad_norm": 3.641213893890381,
365
- "learning_rate": 0.0008798942979625785,
366
- "loss": 0.2674626111984253,
367
- "step": 512
368
- },
369
- {
370
- "epoch": 512.0,
371
- "eval_bleu": 0.580950657997831,
372
- "eval_cos_loss": 0.06297661177814007,
373
- "eval_loss": 0.2675176411867142,
374
- "eval_mse_loss": 0.2675176411867142,
375
- "step": 512
376
- },
377
- {
378
- "epoch": 512.0,
379
- "eval_bleu": 0.580950657997831,
380
- "eval_cos_loss": 0.06297661177814007,
381
- "eval_loss": 0.2675176411867142,
382
- "eval_mse_loss": 0.2675176411867142,
383
- "eval_runtime": 0.9024,
384
- "eval_samples_per_second": 141.838,
385
- "eval_steps_per_second": 2.216,
386
- "step": 512
387
- },
388
- {
389
- "epoch": 528.0,
390
- "grad_norm": 4.270537376403809,
391
- "learning_rate": 0.0008715370925266411,
392
- "loss": 0.2660686671733856,
393
- "step": 528
394
- },
395
- {
396
- "epoch": 544.0,
397
- "grad_norm": 4.056329727172852,
398
- "learning_rate": 0.0008629414162281353,
399
- "loss": 0.26294267177581787,
400
- "step": 544
401
- },
402
- {
403
- "epoch": 560.0,
404
- "grad_norm": 5.651641368865967,
405
- "learning_rate": 0.0008541127861967972,
406
- "loss": 0.260432630777359,
407
- "step": 560
408
- },
409
- {
410
- "epoch": 576.0,
411
- "grad_norm": 7.250360488891602,
412
- "learning_rate": 0.0008450568690835785,
413
- "loss": 0.27461671829223633,
414
- "step": 576
415
- },
416
- {
417
- "epoch": 576.0,
418
- "eval_bleu": 0.5774127981545529,
419
- "eval_cos_loss": 0.06340659596025944,
420
- "eval_loss": 0.26926228404045105,
421
- "eval_mse_loss": 0.26926228404045105,
422
- "step": 576
423
- },
424
- {
425
- "epoch": 576.0,
426
- "eval_bleu": 0.5774127981545529,
427
- "eval_cos_loss": 0.06340659596025944,
428
- "eval_loss": 0.26926228404045105,
429
- "eval_mse_loss": 0.26926228404045105,
430
- "eval_runtime": 0.8733,
431
- "eval_samples_per_second": 146.571,
432
- "eval_steps_per_second": 2.29,
433
- "step": 576
434
- },
435
- {
436
- "epoch": 592.0,
437
- "grad_norm": 3.2957684993743896,
438
- "learning_rate": 0.0008357794774235093,
439
- "loss": 0.2616701126098633,
440
- "step": 592
441
- },
442
- {
443
- "epoch": 608.0,
444
- "grad_norm": 3.3370862007141113,
445
- "learning_rate": 0.0008262865659049262,
446
- "loss": 0.2559007406234741,
447
- "step": 608
448
- },
449
- {
450
- "epoch": 624.0,
451
- "grad_norm": 4.537160396575928,
452
- "learning_rate": 0.0008165842275474598,
453
- "loss": 0.25834769010543823,
454
- "step": 624
455
- },
456
- {
457
- "epoch": 640.0,
458
- "grad_norm": 6.2513580322265625,
459
- "learning_rate": 0.0008066786897912324,
460
- "loss": 0.2518532872200012,
461
- "step": 640
462
- },
463
- {
464
- "epoch": 640.0,
465
- "eval_bleu": 0.6343472675167803,
466
- "eval_cos_loss": 0.059439605101943016,
467
- "eval_loss": 0.25308310985565186,
468
- "eval_mse_loss": 0.25308310985565186,
469
- "step": 640
470
- },
471
- {
472
- "epoch": 640.0,
473
- "eval_bleu": 0.6343472675167803,
474
- "eval_cos_loss": 0.059439605101943016,
475
- "eval_loss": 0.25308310985565186,
476
- "eval_mse_loss": 0.25308310985565186,
477
- "eval_runtime": 0.8725,
478
- "eval_samples_per_second": 146.698,
479
- "eval_steps_per_second": 2.292,
480
- "step": 640
481
- },
482
- {
483
- "epoch": 656.0,
484
- "grad_norm": 4.446962833404541,
485
- "learning_rate": 0.0007965763104997804,
486
- "loss": 0.25539430975914,
487
- "step": 656
488
- },
489
- {
490
- "epoch": 672.0,
491
- "grad_norm": 5.684469699859619,
492
- "learning_rate": 0.0007862835738792626,
493
- "loss": 0.2542829215526581,
494
- "step": 672
495
- },
496
- {
497
- "epoch": 688.0,
498
- "grad_norm": 4.0447468757629395,
499
- "learning_rate": 0.0007758070863165769,
500
- "loss": 0.2549206018447876,
501
- "step": 688
502
- },
503
- {
504
- "epoch": 704.0,
505
- "grad_norm": 5.396855354309082,
506
- "learning_rate": 0.0007651535721390541,
507
- "loss": 0.2627556622028351,
508
- "step": 704
509
- },
510
- {
511
- "epoch": 704.0,
512
- "eval_bleu": 0.5813120020271406,
513
- "eval_cos_loss": 0.06533811613917351,
514
- "eval_loss": 0.27893321216106415,
515
- "eval_mse_loss": 0.27893321216106415,
516
- "step": 704
517
- },
518
- {
519
- "epoch": 704.0,
520
- "eval_bleu": 0.5813120020271406,
521
- "eval_cos_loss": 0.06533811613917351,
522
- "eval_loss": 0.27893321216106415,
523
- "eval_mse_loss": 0.27893321216106415,
524
- "eval_runtime": 0.8693,
525
- "eval_samples_per_second": 147.241,
526
- "eval_steps_per_second": 2.301,
527
- "step": 704
528
- },
529
- {
530
- "epoch": 720.0,
531
- "grad_norm": 4.269003391265869,
532
- "learning_rate": 0.0007543298692984531,
533
- "loss": 0.2587549090385437,
534
- "step": 720
535
- },
536
- {
537
- "epoch": 736.0,
538
- "grad_norm": 3.9153501987457275,
539
- "learning_rate": 0.0007433429249820251,
540
- "loss": 0.2565257251262665,
541
- "step": 736
542
- },
543
- {
544
- "epoch": 752.0,
545
- "grad_norm": 5.764571666717529,
546
- "learning_rate": 0.0007321997911534659,
547
- "loss": 0.2554490566253662,
548
- "step": 752
549
- },
550
- {
551
- "epoch": 768.0,
552
- "grad_norm": 4.181169509887695,
553
- "learning_rate": 0.0007209076200266171,
554
- "loss": 0.26280924677848816,
555
- "step": 768
556
- },
557
- {
558
- "epoch": 768.0,
559
- "eval_bleu": 0.661364608412488,
560
- "eval_cos_loss": 0.057915227487683296,
561
- "eval_loss": 0.2471897453069687,
562
- "eval_mse_loss": 0.2471897453069687,
563
- "step": 768
564
- },
565
- {
566
- "epoch": 768.0,
567
- "eval_bleu": 0.661364608412488,
568
- "eval_cos_loss": 0.057915227487683296,
569
- "eval_loss": 0.2471897453069687,
570
- "eval_mse_loss": 0.2471897453069687,
571
- "eval_runtime": 0.9255,
572
- "eval_samples_per_second": 138.3,
573
- "eval_steps_per_second": 2.161,
574
- "step": 768
575
- },
576
- {
577
- "epoch": 784.0,
578
- "grad_norm": 3.2729103565216064,
579
- "learning_rate": 0.0007094736594748218,
580
- "loss": 0.24987968802452087,
581
- "step": 784
582
- },
583
- {
584
- "epoch": 800.0,
585
- "grad_norm": 3.1368510723114014,
586
- "learning_rate": 0.0006979052483788812,
587
- "loss": 0.24448727071285248,
588
- "step": 800
589
- },
590
- {
591
- "epoch": 816.0,
592
- "grad_norm": 4.103678226470947,
593
- "learning_rate": 0.0006862098119165992,
594
- "loss": 0.2484358549118042,
595
- "step": 816
596
- },
597
- {
598
- "epoch": 832.0,
599
- "grad_norm": 3.3490488529205322,
600
- "learning_rate": 0.0006743948567969348,
601
- "loss": 0.2439013123512268,
602
- "step": 832
603
- },
604
- {
605
- "epoch": 832.0,
606
- "eval_bleu": 0.670957871478861,
607
- "eval_cos_loss": 0.056928446516394615,
608
- "eval_loss": 0.2426728531718254,
609
- "eval_mse_loss": 0.2426728531718254,
610
- "step": 832
611
- },
612
- {
613
- "epoch": 832.0,
614
- "eval_bleu": 0.670957871478861,
615
- "eval_cos_loss": 0.056928446516394615,
616
- "eval_loss": 0.2426728531718254,
617
- "eval_mse_loss": 0.2426728531718254,
618
- "eval_runtime": 0.8912,
619
- "eval_samples_per_second": 143.626,
620
- "eval_steps_per_second": 2.244,
621
- "step": 832
622
- },
623
- {
624
- "epoch": 848.0,
625
- "grad_norm": 4.892444133758545,
626
- "learning_rate": 0.0006624679664418274,
627
- "loss": 0.2417246252298355,
628
- "step": 848
629
- },
630
- {
631
- "epoch": 864.0,
632
- "grad_norm": 5.472821235656738,
633
- "learning_rate": 0.0006504367961187803,
634
- "loss": 0.24449890851974487,
635
- "step": 864
636
- },
637
- {
638
- "epoch": 880.0,
639
- "grad_norm": 6.239707946777344,
640
- "learning_rate": 0.0006383090680273322,
641
- "loss": 0.2528042495250702,
642
- "step": 880
643
- },
644
- {
645
- "epoch": 896.0,
646
- "grad_norm": 3.964495897293091,
647
- "learning_rate": 0.000626092566342569,
648
- "loss": 0.2635759711265564,
649
- "step": 896
650
- },
651
- {
652
- "epoch": 896.0,
653
- "eval_bleu": 0.6793754732736595,
654
- "eval_cos_loss": 0.05773136951029301,
655
- "eval_loss": 0.24844638258218765,
656
- "eval_mse_loss": 0.24844638258218765,
657
- "step": 896
658
- },
659
- {
660
- "epoch": 896.0,
661
- "eval_bleu": 0.6793754732736595,
662
- "eval_cos_loss": 0.05773136951029301,
663
- "eval_loss": 0.24844638258218765,
664
- "eval_mse_loss": 0.24844638258218765,
665
- "eval_runtime": 1.1311,
666
- "eval_samples_per_second": 113.16,
667
- "eval_steps_per_second": 1.768,
668
- "step": 896
669
- },
670
- {
671
- "epoch": 912.0,
672
- "grad_norm": 3.434793472290039,
673
- "learning_rate": 0.0006137951322188541,
674
- "loss": 0.2414565533399582,
675
- "step": 912
676
- },
677
- {
678
- "epoch": 928.0,
679
- "grad_norm": 3.8701789379119873,
680
- "learning_rate": 0.0006014246587569892,
681
- "loss": 0.24117989838123322,
682
- "step": 928
683
- },
684
- {
685
- "epoch": 944.0,
686
- "grad_norm": 4.297995567321777,
687
- "learning_rate": 0.000588989085938032,
688
- "loss": 0.2399703860282898,
689
- "step": 944
690
- },
691
- {
692
- "epoch": 960.0,
693
- "grad_norm": 3.6679482460021973,
694
- "learning_rate": 0.0005764963955270235,
695
- "loss": 0.233713760972023,
696
- "step": 960
697
- },
698
- {
699
- "epoch": 960.0,
700
- "eval_bleu": 0.696953364230658,
701
- "eval_cos_loss": 0.054812436923384666,
702
- "eval_loss": 0.23471949249505997,
703
- "eval_mse_loss": 0.23471949249505997,
704
- "step": 960
705
- },
706
- {
707
- "epoch": 960.0,
708
- "eval_bleu": 0.696953364230658,
709
- "eval_cos_loss": 0.054812436923384666,
710
- "eval_loss": 0.23471949249505997,
711
- "eval_mse_loss": 0.23471949249505997,
712
- "eval_runtime": 0.8756,
713
- "eval_samples_per_second": 146.184,
714
- "eval_steps_per_second": 2.284,
715
- "step": 960
716
- },
717
- {
718
- "epoch": 976.0,
719
- "grad_norm": 4.1816887855529785,
720
- "learning_rate": 0.0005639546059498979,
721
- "loss": 0.2341586947441101,
722
- "step": 976
723
- },
724
- {
725
- "epoch": 992.0,
726
- "grad_norm": 4.410841464996338,
727
- "learning_rate": 0.0005513717671468594,
728
- "loss": 0.23269318044185638,
729
- "step": 992
730
- },
731
- {
732
- "epoch": 1008.0,
733
- "grad_norm": 3.832925796508789,
734
- "learning_rate": 0.000538755955405534,
735
- "loss": 0.2395596206188202,
736
- "step": 1008
737
- },
738
- {
739
- "epoch": 1024.0,
740
- "grad_norm": 4.132075786590576,
741
- "learning_rate": 0.0005261152681772086,
742
- "loss": 0.23560243844985962,
743
- "step": 1024
744
- },
745
- {
746
- "epoch": 1024.0,
747
- "eval_bleu": 0.7079378653405652,
748
- "eval_cos_loss": 0.054174987599253654,
749
- "eval_loss": 0.2315773442387581,
750
- "eval_mse_loss": 0.2315773442387581,
751
- "step": 1024
752
- },
753
- {
754
- "epoch": 1024.0,
755
- "eval_bleu": 0.7079378653405652,
756
- "eval_cos_loss": 0.054174987599253654,
757
- "eval_loss": 0.2315773442387581,
758
- "eval_mse_loss": 0.2315773442387581,
759
- "eval_runtime": 1.1438,
760
- "eval_samples_per_second": 111.912,
761
- "eval_steps_per_second": 1.749,
762
- "step": 1024
763
- },
764
- {
765
- "epoch": 1040.0,
766
- "grad_norm": 4.8190460205078125,
767
- "learning_rate": 0.0005134578188794861,
768
- "loss": 0.22934700548648834,
769
- "step": 1040
770
- },
771
- {
772
- "epoch": 1056.0,
773
- "grad_norm": 5.013860702514648,
774
- "learning_rate": 0.0005007917316886947,
775
- "loss": 0.23661410808563232,
776
- "step": 1056
777
- },
778
- {
779
- "epoch": 1072.0,
780
- "grad_norm": 3.288074254989624,
781
- "learning_rate": 0.00048812513632538816,
782
- "loss": 0.22888951003551483,
783
- "step": 1072
784
- },
785
- {
786
- "epoch": 1088.0,
787
- "grad_norm": 3.181110143661499,
788
- "learning_rate": 0.000475466162836291,
789
- "loss": 0.22868837416172028,
790
- "step": 1088
791
- },
792
- {
793
- "epoch": 1088.0,
794
- "eval_bleu": 0.7288450225502836,
795
- "eval_cos_loss": 0.053315335884690285,
796
- "eval_loss": 0.2283542901277542,
797
- "eval_mse_loss": 0.2283542901277542,
798
- "step": 1088
799
- },
800
- {
801
- "epoch": 1088.0,
802
- "eval_bleu": 0.7288450225502836,
803
- "eval_cos_loss": 0.053315335884690285,
804
- "eval_loss": 0.2283542901277542,
805
- "eval_mse_loss": 0.2283542901277542,
806
- "eval_runtime": 0.8923,
807
- "eval_samples_per_second": 143.456,
808
- "eval_steps_per_second": 2.241,
809
- "step": 1088
810
- },
811
- {
812
- "epoch": 1104.0,
813
- "grad_norm": 4.1082048416137695,
814
- "learning_rate": 0.00046282293637603237,
815
- "loss": 0.22575391829013824,
816
- "step": 1104
817
- },
818
- {
819
- "epoch": 1120.0,
820
- "grad_norm": 2.8534390926361084,
821
- "learning_rate": 0.00045020357199201976,
822
- "loss": 0.22352606058120728,
823
- "step": 1120
824
- },
825
- {
826
- "epoch": 1136.0,
827
- "grad_norm": 3.7242393493652344,
828
- "learning_rate": 0.00043761616941580185,
829
- "loss": 0.22356313467025757,
830
- "step": 1136
831
- },
832
- {
833
- "epoch": 1152.0,
834
- "grad_norm": 3.8674352169036865,
835
- "learning_rate": 0.0004250688078642595,
836
- "loss": 0.22347410023212433,
837
- "step": 1152
838
- },
839
- {
840
- "epoch": 1152.0,
841
- "eval_bleu": 0.7490331059842212,
842
- "eval_cos_loss": 0.051677852869033813,
843
- "eval_loss": 0.22193267196416855,
844
- "eval_mse_loss": 0.22193267196416855,
845
- "step": 1152
846
- },
847
- {
848
- "epoch": 1152.0,
849
- "eval_bleu": 0.7490331059842212,
850
- "eval_cos_loss": 0.051677852869033813,
851
- "eval_loss": 0.22193267196416855,
852
- "eval_mse_loss": 0.22193267196416855,
853
- "eval_runtime": 1.0773,
854
- "eval_samples_per_second": 118.814,
855
- "eval_steps_per_second": 1.856,
856
- "step": 1152
857
- },
858
- {
859
- "epoch": 1168.0,
860
- "grad_norm": 4.9404144287109375,
861
- "learning_rate": 0.0004125695408539655,
862
- "loss": 0.22273239493370056,
863
- "step": 1168
864
- },
865
- {
866
- "epoch": 1184.0,
867
- "grad_norm": 2.8793396949768066,
868
- "learning_rate": 0.00040012639103204046,
869
- "loss": 0.22370247542858124,
870
- "step": 1184
871
- },
872
- {
873
- "epoch": 1200.0,
874
- "grad_norm": 3.381091356277466,
875
- "learning_rate": 0.0003877473450268202,
876
- "loss": 0.2196229100227356,
877
- "step": 1200
878
- },
879
- {
880
- "epoch": 1216.0,
881
- "grad_norm": 3.1946024894714355,
882
- "learning_rate": 0.0003754403483216441,
883
- "loss": 0.2189682424068451,
884
- "step": 1216
885
- },
886
- {
887
- "epoch": 1216.0,
888
- "eval_bleu": 0.7228057743017877,
889
- "eval_cos_loss": 0.05280923470854759,
890
- "eval_loss": 0.22687970846891403,
891
- "eval_mse_loss": 0.22687970846891403,
892
- "step": 1216
893
- },
894
- {
895
- "epoch": 1216.0,
896
- "eval_bleu": 0.7228057743017877,
897
- "eval_cos_loss": 0.05280923470854759,
898
- "eval_loss": 0.22687970846891403,
899
- "eval_mse_loss": 0.22687970846891403,
900
- "eval_runtime": 0.8713,
901
- "eval_samples_per_second": 146.907,
902
- "eval_steps_per_second": 2.295,
903
- "step": 1216
904
- },
905
- {
906
- "epoch": 1232.0,
907
- "grad_norm": 2.8960962295532227,
908
- "learning_rate": 0.0003632133001550515,
909
- "loss": 0.21955418586730957,
910
- "step": 1232
911
- },
912
- {
913
- "epoch": 1248.0,
914
- "grad_norm": 4.168556213378906,
915
- "learning_rate": 0.0003510740484506588,
916
- "loss": 0.21865320205688477,
917
- "step": 1248
918
- },
919
- {
920
- "epoch": 1264.0,
921
- "grad_norm": 4.716127395629883,
922
- "learning_rate": 0.0003390303847799755,
923
- "loss": 0.22268880903720856,
924
- "step": 1264
925
- },
926
- {
927
- "epoch": 1280.0,
928
- "grad_norm": 3.4384660720825195,
929
- "learning_rate": 0.00032709003936138876,
930
- "loss": 0.21789687871932983,
931
- "step": 1280
932
- },
933
- {
934
- "epoch": 1280.0,
935
- "eval_bleu": 0.7668112675703869,
936
- "eval_cos_loss": 0.05025000870227814,
937
- "eval_loss": 0.21647433191537857,
938
- "eval_mse_loss": 0.21647433191537857,
939
- "step": 1280
940
- },
941
- {
942
- "epoch": 1280.0,
943
- "eval_bleu": 0.7668112675703869,
944
- "eval_cos_loss": 0.05025000870227814,
945
- "eval_loss": 0.21647433191537857,
946
- "eval_mse_loss": 0.21647433191537857,
947
- "eval_runtime": 0.8694,
948
- "eval_samples_per_second": 147.223,
949
- "eval_steps_per_second": 2.3,
950
- "step": 1280
951
- },
952
- {
953
- "epoch": 1296.0,
954
- "grad_norm": 3.1409592628479004,
955
- "learning_rate": 0.00031526067609852616,
956
- "loss": 0.2181306630373001,
957
- "step": 1296
958
- },
959
- {
960
- "epoch": 1312.0,
961
- "grad_norm": 2.3424947261810303,
962
- "learning_rate": 0.00030354988766118513,
963
- "loss": 0.21611051261425018,
964
- "step": 1312
965
- },
966
- {
967
- "epoch": 1328.0,
968
- "grad_norm": 3.1680362224578857,
969
- "learning_rate": 0.000291965190611981,
970
- "loss": 0.2149377018213272,
971
- "step": 1328
972
- },
973
- {
974
- "epoch": 1344.0,
975
- "grad_norm": 3.9129462242126465,
976
- "learning_rate": 0.00028051402058184704,
977
- "loss": 0.2180047184228897,
978
- "step": 1344
979
- },
980
- {
981
- "epoch": 1344.0,
982
- "eval_bleu": 0.7675157336477649,
983
- "eval_cos_loss": 0.050463948398828506,
984
- "eval_loss": 0.21725857257843018,
985
- "eval_mse_loss": 0.21725857257843018,
986
- "step": 1344
987
- },
988
- {
989
- "epoch": 1344.0,
990
- "eval_bleu": 0.7675157336477649,
991
- "eval_cos_loss": 0.050463948398828506,
992
- "eval_loss": 0.21725857257843018,
993
- "eval_mse_loss": 0.21725857257843018,
994
- "eval_runtime": 0.8788,
995
- "eval_samples_per_second": 145.656,
996
- "eval_steps_per_second": 2.276,
997
- "step": 1344
998
- },
999
- {
1000
- "epoch": 1360.0,
1001
- "grad_norm": 2.6250803470611572,
1002
- "learning_rate": 0.00026920372749747766,
1003
- "loss": 0.2142384946346283,
1004
- "step": 1360
1005
- },
1006
- {
1007
- "epoch": 1376.0,
1008
- "grad_norm": 2.543652057647705,
1009
- "learning_rate": 0.0002580415708637841,
1010
- "loss": 0.2133433222770691,
1011
- "step": 1376
1012
- },
1013
- {
1014
- "epoch": 1392.0,
1015
- "grad_norm": 3.0058720111846924,
1016
- "learning_rate": 0.0002470347151043839,
1017
- "loss": 0.21205700933933258,
1018
- "step": 1392
1019
- },
1020
- {
1021
- "epoch": 1408.0,
1022
- "grad_norm": 3.2701632976531982,
1023
- "learning_rate": 0.0002361902249631207,
1024
- "loss": 0.21385891735553741,
1025
- "step": 1408
1026
- },
1027
- {
1028
- "epoch": 1408.0,
1029
- "eval_bleu": 0.7880750098541518,
1030
- "eval_cos_loss": 0.049234725534915924,
1031
- "eval_loss": 0.21210666000843048,
1032
- "eval_mse_loss": 0.21210666000843048,
1033
- "step": 1408
1034
- },
1035
- {
1036
- "epoch": 1408.0,
1037
- "eval_bleu": 0.7880750098541518,
1038
- "eval_cos_loss": 0.049234725534915924,
1039
- "eval_loss": 0.21210666000843048,
1040
- "eval_mse_loss": 0.21210666000843048,
1041
- "eval_runtime": 0.8893,
1042
- "eval_samples_per_second": 143.935,
1043
- "eval_steps_per_second": 2.249,
1044
- "step": 1408
1045
- },
1046
- {
1047
- "epoch": 1424.0,
1048
- "grad_norm": 3.444427967071533,
1049
- "learning_rate": 0.00022551506096956222,
1050
- "loss": 0.211622416973114,
1051
- "step": 1424
1052
- },
1053
- {
1054
- "epoch": 1440.0,
1055
- "grad_norm": 2.470618963241577,
1056
- "learning_rate": 0.0002150160749713891,
1057
- "loss": 0.20997348427772522,
1058
- "step": 1440
1059
- },
1060
- {
1061
- "epoch": 1456.0,
1062
- "grad_norm": 1.7038332223892212,
1063
- "learning_rate": 0.00020470000573653973,
1064
- "loss": 0.20952679216861725,
1065
- "step": 1456
1066
- },
1067
- {
1068
- "epoch": 1472.0,
1069
- "grad_norm": 2.426316976547241,
1070
- "learning_rate": 0.0001945734746279364,
1071
- "loss": 0.21008668839931488,
1072
- "step": 1472
1073
- },
1074
- {
1075
- "epoch": 1472.0,
1076
- "eval_bleu": 0.7873788127854696,
1077
- "eval_cos_loss": 0.04861448146402836,
1078
- "eval_loss": 0.2095613032579422,
1079
- "eval_mse_loss": 0.2095613032579422,
1080
- "step": 1472
1081
- },
1082
- {
1083
- "epoch": 1472.0,
1084
- "eval_bleu": 0.7873788127854696,
1085
- "eval_cos_loss": 0.04861448146402836,
1086
- "eval_loss": 0.2095613032579422,
1087
- "eval_mse_loss": 0.2095613032579422,
1088
- "eval_runtime": 0.877,
1089
- "eval_samples_per_second": 145.953,
1090
- "eval_steps_per_second": 2.281,
1091
- "step": 1472
1092
- },
1093
- {
1094
- "epoch": 1488.0,
1095
- "grad_norm": 2.561044216156006,
1096
- "learning_rate": 0.00018464298135356777,
1097
- "loss": 0.2087576985359192,
1098
- "step": 1488
1099
- },
1100
- {
1101
- "epoch": 1504.0,
1102
- "grad_norm": 2.8240408897399902,
1103
- "learning_rate": 0.00017491489979465447,
1104
- "loss": 0.2086133509874344,
1105
- "step": 1504
1106
- },
1107
- {
1108
- "epoch": 1520.0,
1109
- "grad_norm": 2.6217775344848633,
1110
- "learning_rate": 0.0001653954739145775,
1111
- "loss": 0.20786544680595398,
1112
- "step": 1520
1113
- },
1114
- {
1115
- "epoch": 1536.0,
1116
- "grad_norm": 2.312251091003418,
1117
- "learning_rate": 0.00015609081375119466,
1118
- "loss": 0.20743107795715332,
1119
- "step": 1536
1120
- },
1121
- {
1122
- "epoch": 1536.0,
1123
- "eval_bleu": 0.8002604686170025,
1124
- "eval_cos_loss": 0.047877587378025055,
1125
- "eval_loss": 0.2066633701324463,
1126
- "eval_mse_loss": 0.2066633701324463,
1127
- "step": 1536
1128
- },
1129
- {
1130
- "epoch": 1536.0,
1131
- "eval_bleu": 0.8002604686170025,
1132
- "eval_cos_loss": 0.047877587378025055,
1133
- "eval_loss": 0.2066633701324463,
1134
- "eval_mse_loss": 0.2066633701324463,
1135
- "eval_runtime": 0.892,
1136
- "eval_samples_per_second": 143.493,
1137
- "eval_steps_per_second": 2.242,
1138
- "step": 1536
1139
- },
1140
- {
1141
- "epoch": 1552.0,
1142
- "grad_norm": 2.6982738971710205,
1143
- "learning_rate": 0.0001470068914951152,
1144
- "loss": 0.2065943479537964,
1145
- "step": 1552
1146
- },
1147
- {
1148
- "epoch": 1568.0,
1149
- "grad_norm": 2.9958996772766113,
1150
- "learning_rate": 0.00013814953765645382,
1151
- "loss": 0.20652760565280914,
1152
- "step": 1568
1153
- },
1154
- {
1155
- "epoch": 1584.0,
1156
- "grad_norm": 1.8058233261108398,
1157
- "learning_rate": 0.00012952443732252057,
1158
- "loss": 0.20597848296165466,
1159
- "step": 1584
1160
- },
1161
- {
1162
- "epoch": 1600.0,
1163
- "grad_norm": 1.8224921226501465,
1164
- "learning_rate": 0.00012113712650885117,
1165
- "loss": 0.20530889928340912,
1166
- "step": 1600
1167
- },
1168
- {
1169
- "epoch": 1600.0,
1170
- "eval_bleu": 0.8031781855221607,
1171
- "eval_cos_loss": 0.04770847223699093,
1172
- "eval_loss": 0.20582260191440582,
1173
- "eval_mse_loss": 0.20582260191440582,
1174
- "step": 1600
1175
- },
1176
- {
1177
- "epoch": 1600.0,
1178
- "eval_bleu": 0.8031781855221607,
1179
- "eval_cos_loss": 0.04770847223699093,
1180
- "eval_loss": 0.20582260191440582,
1181
- "eval_mse_loss": 0.20582260191440582,
1182
- "eval_runtime": 0.9548,
1183
- "eval_samples_per_second": 134.057,
1184
- "eval_steps_per_second": 2.095,
1185
- "step": 1600
1186
- },
1187
- {
1188
- "epoch": 1616.0,
1189
- "grad_norm": 2.6983439922332764,
1190
- "learning_rate": 0.00011299298860591917,
1191
- "loss": 0.20517539978027344,
1192
- "step": 1616
1193
- },
1194
- {
1195
- "epoch": 1632.0,
1196
- "grad_norm": 2.2038075923919678,
1197
- "learning_rate": 0.00010509725092380906,
1198
- "loss": 0.2047526240348816,
1199
- "step": 1632
1200
- },
1201
- {
1202
- "epoch": 1648.0,
1203
- "grad_norm": 1.9047884941101074,
1204
- "learning_rate": 9.745498133707109e-05,
1205
- "loss": 0.20422129333019257,
1206
- "step": 1648
1207
- },
1208
- {
1209
- "epoch": 1664.0,
1210
- "grad_norm": 1.9464013576507568,
1211
- "learning_rate": 9.007108503190864e-05,
1212
- "loss": 0.20397356152534485,
1213
- "step": 1664
1214
- },
1215
- {
1216
- "epoch": 1664.0,
1217
- "eval_bleu": 0.8100469239619555,
1218
- "eval_cos_loss": 0.04725760594010353,
1219
- "eval_loss": 0.2041708454489708,
1220
- "eval_mse_loss": 0.2041708454489708,
1221
- "step": 1664
1222
- },
1223
- {
1224
- "epoch": 1664.0,
1225
- "eval_bleu": 0.8100469239619555,
1226
- "eval_cos_loss": 0.04725760594010353,
1227
- "eval_loss": 0.2041708454489708,
1228
- "eval_mse_loss": 0.2041708454489708,
1229
- "eval_runtime": 0.8953,
1230
- "eval_samples_per_second": 142.964,
1231
- "eval_steps_per_second": 2.234,
1232
- "step": 1664
1233
- },
1234
- {
1235
- "epoch": 1680.0,
1236
- "grad_norm": 1.9454442262649536,
1237
- "learning_rate": 8.295030135778742e-05,
1238
- "loss": 0.20367543399333954,
1239
- "step": 1680
1240
- },
1241
- {
1242
- "epoch": 1696.0,
1243
- "grad_norm": 2.6915903091430664,
1244
- "learning_rate": 7.609720078548737e-05,
1245
- "loss": 0.2033531665802002,
1246
- "step": 1696
1247
- },
1248
- {
1249
- "epoch": 1712.0,
1250
- "grad_norm": 1.5794174671173096,
1251
- "learning_rate": 6.951618197354753e-05,
1252
- "loss": 0.20306910574436188,
1253
- "step": 1712
1254
- },
1255
- {
1256
- "epoch": 1728.0,
1257
- "grad_norm": 2.828120470046997,
1258
- "learning_rate": 6.321146894499102e-05,
1259
- "loss": 0.2030172348022461,
1260
- "step": 1728
1261
- },
1262
- {
1263
- "epoch": 1728.0,
1264
- "eval_bleu": 0.8147237401837912,
1265
- "eval_cos_loss": 0.046787988394498825,
1266
- "eval_loss": 0.20282745361328125,
1267
- "eval_mse_loss": 0.20282745361328125,
1268
- "step": 1728
1269
- },
1270
- {
1271
- "epoch": 1728.0,
1272
- "eval_bleu": 0.8147237401837912,
1273
- "eval_cos_loss": 0.046787988394498825,
1274
- "eval_loss": 0.20282745361328125,
1275
- "eval_mse_loss": 0.20282745361328125,
1276
- "eval_runtime": 1.1261,
1277
- "eval_samples_per_second": 113.666,
1278
- "eval_steps_per_second": 1.776,
1279
- "step": 1728
1280
- },
1281
- {
1282
- "epoch": 1744.0,
1283
- "grad_norm": 1.4509916305541992,
1284
- "learning_rate": 5.7187108376137274e-05,
1285
- "loss": 0.2027032971382141,
1286
- "step": 1744
1287
- },
1288
- {
1289
- "epoch": 1760.0,
1290
- "grad_norm": 2.41015887260437,
1291
- "learning_rate": 5.144696699924578e-05,
1292
- "loss": 0.2023259550333023,
1293
- "step": 1760
1294
- },
1295
- {
1296
- "epoch": 1776.0,
1297
- "grad_norm": 2.604257822036743,
1298
- "learning_rate": 4.599472912065611e-05,
1299
- "loss": 0.2021774798631668,
1300
- "step": 1776
1301
- },
1302
- {
1303
- "epoch": 1792.0,
1304
- "grad_norm": 2.3466601371765137,
1305
- "learning_rate": 4.083389425601836e-05,
1306
- "loss": 0.20197318494319916,
1307
- "step": 1792
1308
- },
1309
- {
1310
- "epoch": 1792.0,
1311
- "eval_bleu": 0.8147862350993915,
1312
- "eval_cos_loss": 0.04671955108642578,
1313
- "eval_loss": 0.20188624411821365,
1314
- "eval_mse_loss": 0.20188624411821365,
1315
- "step": 1792
1316
- },
1317
- {
1318
- "epoch": 1792.0,
1319
- "eval_bleu": 0.8147862350993915,
1320
- "eval_cos_loss": 0.04671955108642578,
1321
- "eval_loss": 0.20188624411821365,
1322
- "eval_mse_loss": 0.20188624411821365,
1323
- "eval_runtime": 0.878,
1324
- "eval_samples_per_second": 145.79,
1325
- "eval_steps_per_second": 2.278,
1326
- "step": 1792
1327
- },
1328
- {
1329
- "epoch": 1808.0,
1330
- "grad_norm": 2.410977840423584,
1331
- "learning_rate": 3.596777488413072e-05,
1332
- "loss": 0.20183902978897095,
1333
- "step": 1808
1334
- },
1335
- {
1336
- "epoch": 1824.0,
1337
- "grad_norm": 1.510903239250183,
1338
- "learning_rate": 3.139949432082712e-05,
1339
- "loss": 0.20134302973747253,
1340
- "step": 1824
1341
- },
1342
- {
1343
- "epoch": 1840.0,
1344
- "grad_norm": 1.8241870403289795,
1345
- "learning_rate": 2.7131984714278636e-05,
1346
- "loss": 0.20113661885261536,
1347
- "step": 1840
1348
- },
1349
- {
1350
- "epoch": 1856.0,
1351
- "grad_norm": 1.8893063068389893,
1352
- "learning_rate": 2.316798516299623e-05,
1353
- "loss": 0.2010827660560608,
1354
- "step": 1856
1355
- },
1356
- {
1357
- "epoch": 1856.0,
1358
- "eval_bleu": 0.8230810373941457,
1359
- "eval_cos_loss": 0.04663713276386261,
1360
- "eval_loss": 0.2013688012957573,
1361
- "eval_mse_loss": 0.2013688012957573,
1362
- "step": 1856
1363
- },
1364
- {
1365
- "epoch": 1856.0,
1366
- "eval_bleu": 0.8230810373941457,
1367
- "eval_cos_loss": 0.04663713276386261,
1368
- "eval_loss": 0.2013688012957573,
1369
- "eval_mse_loss": 0.2013688012957573,
1370
- "eval_runtime": 1.1304,
1371
- "eval_samples_per_second": 113.233,
1372
- "eval_steps_per_second": 1.769,
1373
- "step": 1856
1374
- },
1375
- {
1376
- "epoch": 1872.0,
1377
- "grad_norm": 1.3174251317977905,
1378
- "learning_rate": 1.9510039957741866e-05,
1379
- "loss": 0.20096558332443237,
1380
- "step": 1872
1381
- },
1382
- {
1383
- "epoch": 1888.0,
1384
- "grad_norm": 2.0146000385284424,
1385
- "learning_rate": 1.6160496948476877e-05,
1386
- "loss": 0.20089873671531677,
1387
- "step": 1888
1388
- },
1389
- {
1390
- "epoch": 1904.0,
1391
- "grad_norm": 1.5292428731918335,
1392
- "learning_rate": 1.3121506037395925e-05,
1393
- "loss": 0.20046915113925934,
1394
- "step": 1904
1395
- },
1396
- {
1397
- "epoch": 1920.0,
1398
- "grad_norm": 1.2913480997085571,
1399
- "learning_rate": 1.0395017799013529e-05,
1400
- "loss": 0.2005997598171234,
1401
- "step": 1920
1402
- },
1403
- {
1404
- "epoch": 1920.0,
1405
- "eval_bleu": 0.8245367073756386,
1406
- "eval_cos_loss": 0.046230655163526535,
1407
- "eval_loss": 0.19999407976865768,
1408
- "eval_mse_loss": 0.19999407976865768,
1409
- "step": 1920
1410
- },
1411
- {
1412
- "epoch": 1920.0,
1413
- "eval_bleu": 0.8245367073756386,
1414
- "eval_cos_loss": 0.046230655163526535,
1415
- "eval_loss": 0.19999407976865768,
1416
- "eval_mse_loss": 0.19999407976865768,
1417
- "eval_runtime": 0.8695,
1418
- "eval_samples_per_second": 147.203,
1419
- "eval_steps_per_second": 2.3,
1420
- "step": 1920
1421
- },
1422
- {
1423
- "epoch": 1936.0,
1424
- "grad_norm": 1.2993054389953613,
1425
- "learning_rate": 7.982782228189156e-06,
1426
- "loss": 0.20030871033668518,
1427
- "step": 1936
1428
- },
1429
- {
1430
- "epoch": 1952.0,
1431
- "grad_norm": 1.5305612087249756,
1432
- "learning_rate": 5.886347616893772e-06,
1433
- "loss": 0.2002657800912857,
1434
- "step": 1952
1435
- },
1436
- {
1437
- "epoch": 1968.0,
1438
- "grad_norm": 1.21235990524292,
1439
- "learning_rate": 4.107059560439718e-06,
1440
- "loss": 0.2001296430826187,
1441
- "step": 1968
1442
- },
1443
- {
1444
- "epoch": 1984.0,
1445
- "grad_norm": 1.1770583391189575,
1446
- "learning_rate": 2.646060093811187e-06,
1447
- "loss": 0.20003925263881683,
1448
- "step": 1984
1449
- },
1450
- {
1451
- "epoch": 1984.0,
1452
- "eval_bleu": 0.8271353650064853,
1453
- "eval_cos_loss": 0.046304671093821526,
1454
- "eval_loss": 0.19988874346017838,
1455
- "eval_mse_loss": 0.19988874346017838,
1456
- "step": 1984
1457
- },
1458
- {
1459
- "epoch": 1984.0,
1460
- "eval_bleu": 0.8271353650064853,
1461
- "eval_cos_loss": 0.046304671093821526,
1462
- "eval_loss": 0.19988874346017838,
1463
- "eval_mse_loss": 0.19988874346017838,
1464
- "eval_runtime": 1.0168,
1465
- "eval_samples_per_second": 125.883,
1466
- "eval_steps_per_second": 1.967,
1467
- "step": 1984
1468
- },
1469
- {
1470
- "epoch": 2000.0,
1471
- "grad_norm": 1.1745353937149048,
1472
- "learning_rate": 1.5042869586496811e-06,
1473
- "loss": 0.19980217516422272,
1474
- "step": 2000
1475
- },
1476
- {
1477
- "epoch": 2016.0,
1478
- "grad_norm": 1.0710855722427368,
1479
- "learning_rate": 6.824730013650915e-07,
1480
- "loss": 0.19994820654392242,
1481
- "step": 2016
1482
- },
1483
- {
1484
- "epoch": 2032.0,
1485
- "grad_norm": 0.8578296303749084,
1486
- "learning_rate": 1.8114570275867826e-07,
1487
- "loss": 0.1998877078294754,
1488
- "step": 2032
1489
- },
1490
- {
1491
- "epoch": 2048.0,
1492
- "grad_norm": 0.7908188700675964,
1493
- "learning_rate": 6.268394598385463e-10,
1494
- "loss": 0.19961218535900116,
1495
- "step": 2048
1496
- },
1497
- {
1498
- "epoch": 2048.0,
1499
- "eval_bleu": 0.826127241114683,
1500
- "eval_cos_loss": 0.04609876126050949,
1501
- "eval_loss": 0.19921576976776123,
1502
- "eval_mse_loss": 0.19921576976776123,
1503
- "step": 2048
1504
- },
1505
- {
1506
- "epoch": 2048.0,
1507
- "eval_bleu": 0.826127241114683,
1508
- "eval_cos_loss": 0.04609876126050949,
1509
- "eval_loss": 0.19921576976776123,
1510
- "eval_mse_loss": 0.19921576976776123,
1511
- "eval_runtime": 0.8731,
1512
- "eval_samples_per_second": 146.603,
1513
- "eval_steps_per_second": 2.291,
1514
- "step": 2048
1515
- }
1516
- ],
1517
- "logging_steps": 16,
1518
- "max_steps": 2048,
1519
- "num_input_tokens_seen": 0,
1520
- "num_train_epochs": 2048,
1521
- "save_steps": 256,
1522
- "stateful_callbacks": {
1523
- "TrainerControl": {
1524
- "args": {
1525
- "should_epoch_stop": false,
1526
- "should_evaluate": false,
1527
- "should_log": false,
1528
- "should_save": true,
1529
- "should_training_stop": true
1530
- },
1531
- "attributes": {}
1532
- }
1533
- },
1534
- "total_flos": 0.0,
1535
- "train_batch_size": 64,
1536
- "trial_name": null,
1537
- "trial_params": null
1538
- }
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
checkpoint-v2.0a-o-discrete-conditional/checkpoint-2048/training_args.bin DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:5937d08ef509a4ce944d3b2258b2f532be998f7a8e828dbfa14fe040f2d8bf93
3
- size 5201