File size: 20,068 Bytes
57ded2c
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 1.0,
  "eval_steps": 500,
  "global_step": 315,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.01591723040191007,
      "grad_norm": 0.5680273771286011,
      "learning_rate": 4.998010925565448e-05,
      "loss": 0.722562837600708,
      "num_input_tokens_seen": 18800,
      "step": 5,
      "train_runtime": 39.8867,
      "train_tokens_per_second": 471.335
    },
    {
      "epoch": 0.03183446080382014,
      "grad_norm": 0.5171770453453064,
      "learning_rate": 4.989935734988098e-05,
      "loss": 0.2945201873779297,
      "num_input_tokens_seen": 37088,
      "step": 10,
      "train_runtime": 77.9226,
      "train_tokens_per_second": 475.959
    },
    {
      "epoch": 0.0477516912057302,
      "grad_norm": 0.26242855191230774,
      "learning_rate": 4.975670171853926e-05,
      "loss": 0.17604056596755982,
      "num_input_tokens_seen": 55072,
      "step": 15,
      "train_runtime": 115.5379,
      "train_tokens_per_second": 476.657
    },
    {
      "epoch": 0.06366892160764027,
      "grad_norm": 0.31670883297920227,
      "learning_rate": 4.9552497026005974e-05,
      "loss": 0.11049227714538574,
      "num_input_tokens_seen": 73632,
      "step": 20,
      "train_runtime": 153.8933,
      "train_tokens_per_second": 478.461
    },
    {
      "epoch": 0.07958615200955034,
      "grad_norm": 0.34576132893562317,
      "learning_rate": 4.928725095732169e-05,
      "loss": 0.09105676412582397,
      "num_input_tokens_seen": 92480,
      "step": 25,
      "train_runtime": 191.9367,
      "train_tokens_per_second": 481.825
    },
    {
      "epoch": 0.0955033824114604,
      "grad_norm": 0.3635248839855194,
      "learning_rate": 4.896162295600589e-05,
      "loss": 0.10165604352951049,
      "num_input_tokens_seen": 112464,
      "step": 30,
      "train_runtime": 230.1162,
      "train_tokens_per_second": 488.727
    },
    {
      "epoch": 0.11142061281337047,
      "grad_norm": 0.1722227931022644,
      "learning_rate": 4.8576422584576514e-05,
      "loss": 0.06480070948600769,
      "num_input_tokens_seen": 130432,
      "step": 35,
      "train_runtime": 267.8665,
      "train_tokens_per_second": 486.929
    },
    {
      "epoch": 0.12733784321528055,
      "grad_norm": 1.0766868591308594,
      "learning_rate": 4.813260751184992e-05,
      "loss": 0.0799346923828125,
      "num_input_tokens_seen": 147776,
      "step": 40,
      "train_runtime": 305.7922,
      "train_tokens_per_second": 483.256
    },
    {
      "epoch": 0.14325507361719061,
      "grad_norm": 0.37821757793426514,
      "learning_rate": 4.763128113202537e-05,
      "loss": 0.11464616060256957,
      "num_input_tokens_seen": 166960,
      "step": 45,
      "train_runtime": 343.7831,
      "train_tokens_per_second": 485.655
    },
    {
      "epoch": 0.15917230401910068,
      "grad_norm": 0.19431939721107483,
      "learning_rate": 4.707368982147318e-05,
      "loss": 0.036882424354553224,
      "num_input_tokens_seen": 184656,
      "step": 50,
      "train_runtime": 381.8072,
      "train_tokens_per_second": 483.637
    },
    {
      "epoch": 0.17508953442101075,
      "grad_norm": 0.21434476971626282,
      "learning_rate": 4.6461219840046654e-05,
      "loss": 0.05201725363731384,
      "num_input_tokens_seen": 201600,
      "step": 55,
      "train_runtime": 419.5866,
      "train_tokens_per_second": 480.473
    },
    {
      "epoch": 0.1910067648229208,
      "grad_norm": 0.18612508475780487,
      "learning_rate": 4.579539388462173e-05,
      "loss": 0.02669697403907776,
      "num_input_tokens_seen": 219424,
      "step": 60,
      "train_runtime": 457.3463,
      "train_tokens_per_second": 479.776
    },
    {
      "epoch": 0.20692399522483088,
      "grad_norm": 0.24218444526195526,
      "learning_rate": 4.5077867303432546e-05,
      "loss": 0.04229282438755035,
      "num_input_tokens_seen": 237328,
      "step": 65,
      "train_runtime": 495.2157,
      "train_tokens_per_second": 479.242
    },
    {
      "epoch": 0.22284122562674094,
      "grad_norm": 0.17901809513568878,
      "learning_rate": 4.431042398061499e-05,
      "loss": 0.07041661143302917,
      "num_input_tokens_seen": 256384,
      "step": 70,
      "train_runtime": 533.4026,
      "train_tokens_per_second": 480.658
    },
    {
      "epoch": 0.238758456028651,
      "grad_norm": 0.14054907858371735,
      "learning_rate": 4.34949719011896e-05,
      "loss": 0.07058953046798706,
      "num_input_tokens_seen": 275760,
      "step": 75,
      "train_runtime": 571.426,
      "train_tokens_per_second": 482.582
    },
    {
      "epoch": 0.2546756864305611,
      "grad_norm": 0.3583498001098633,
      "learning_rate": 4.263353840751022e-05,
      "loss": 0.04999509751796723,
      "num_input_tokens_seen": 294912,
      "step": 80,
      "train_runtime": 609.9469,
      "train_tokens_per_second": 483.504
    },
    {
      "epoch": 0.27059291683247116,
      "grad_norm": 0.1266777068376541,
      "learning_rate": 4.172826515897146e-05,
      "loss": 0.023084172606468202,
      "num_input_tokens_seen": 312864,
      "step": 85,
      "train_runtime": 647.7469,
      "train_tokens_per_second": 483.004
    },
    {
      "epoch": 0.28651014723438123,
      "grad_norm": 0.19594649970531464,
      "learning_rate": 4.078140280750597e-05,
      "loss": 0.027250510454177857,
      "num_input_tokens_seen": 331824,
      "step": 90,
      "train_runtime": 685.5215,
      "train_tokens_per_second": 484.046
    },
    {
      "epoch": 0.3024273776362913,
      "grad_norm": 0.13930079340934753,
      "learning_rate": 3.9795305402109195e-05,
      "loss": 0.021656049787998198,
      "num_input_tokens_seen": 349248,
      "step": 95,
      "train_runtime": 723.3163,
      "train_tokens_per_second": 482.843
    },
    {
      "epoch": 0.31834460803820136,
      "grad_norm": 0.09126997739076614,
      "learning_rate": 3.8772424536302564e-05,
      "loss": 0.01830628514289856,
      "num_input_tokens_seen": 368960,
      "step": 100,
      "train_runtime": 761.4003,
      "train_tokens_per_second": 484.581
    },
    {
      "epoch": 0.3342618384401114,
      "grad_norm": 0.182926744222641,
      "learning_rate": 3.771530325308579e-05,
      "loss": 0.02595718502998352,
      "num_input_tokens_seen": 387312,
      "step": 105,
      "train_runtime": 799.8123,
      "train_tokens_per_second": 484.254
    },
    {
      "epoch": 0.3501790688420215,
      "grad_norm": 0.36613690853118896,
      "learning_rate": 3.662656972253127e-05,
      "loss": 0.03506172299385071,
      "num_input_tokens_seen": 405344,
      "step": 110,
      "train_runtime": 837.7863,
      "train_tokens_per_second": 483.827
    },
    {
      "epoch": 0.36609629924393156,
      "grad_norm": 0.09526461362838745,
      "learning_rate": 3.550893070773914e-05,
      "loss": 0.02651476263999939,
      "num_input_tokens_seen": 423760,
      "step": 115,
      "train_runtime": 876.0853,
      "train_tokens_per_second": 483.697
    },
    {
      "epoch": 0.3820135296458416,
      "grad_norm": 0.11225307732820511,
      "learning_rate": 3.436516483539781e-05,
      "loss": 0.019444951415061952,
      "num_input_tokens_seen": 442656,
      "step": 120,
      "train_runtime": 914.1546,
      "train_tokens_per_second": 484.224
    },
    {
      "epoch": 0.3979307600477517,
      "grad_norm": 0.2590346932411194,
      "learning_rate": 3.3198115687680115e-05,
      "loss": 0.03442502021789551,
      "num_input_tokens_seen": 460592,
      "step": 125,
      "train_runtime": 952.2049,
      "train_tokens_per_second": 483.711
    },
    {
      "epoch": 0.41384799044966175,
      "grad_norm": 0.2646162211894989,
      "learning_rate": 3.201068473265007e-05,
      "loss": 0.01847824454307556,
      "num_input_tokens_seen": 478992,
      "step": 130,
      "train_runtime": 990.3961,
      "train_tokens_per_second": 483.637
    },
    {
      "epoch": 0.4297652208515718,
      "grad_norm": 0.07014801353216171,
      "learning_rate": 3.0805824110756064e-05,
      "loss": 0.019786083698272706,
      "num_input_tokens_seen": 498912,
      "step": 135,
      "train_runtime": 1028.6211,
      "train_tokens_per_second": 485.03
    },
    {
      "epoch": 0.4456824512534819,
      "grad_norm": 0.07959283143281937,
      "learning_rate": 2.958652929534456e-05,
      "loss": 0.018977819383144377,
      "num_input_tokens_seen": 519280,
      "step": 140,
      "train_runtime": 1067.2867,
      "train_tokens_per_second": 486.542
    },
    {
      "epoch": 0.46159968165539195,
      "grad_norm": 0.06549182534217834,
      "learning_rate": 2.8355831645441388e-05,
      "loss": 0.013403435051441193,
      "num_input_tokens_seen": 537680,
      "step": 145,
      "train_runtime": 1105.3776,
      "train_tokens_per_second": 486.422
    },
    {
      "epoch": 0.477516912057302,
      "grad_norm": 0.1639358103275299,
      "learning_rate": 2.7116790869315582e-05,
      "loss": 0.016910630464553832,
      "num_input_tokens_seen": 556736,
      "step": 150,
      "train_runtime": 1143.7746,
      "train_tokens_per_second": 486.753
    },
    {
      "epoch": 0.4934341424592121,
      "grad_norm": 0.08243564516305923,
      "learning_rate": 2.587248741756253e-05,
      "loss": 0.026160690188407897,
      "num_input_tokens_seen": 574848,
      "step": 155,
      "train_runtime": 1181.63,
      "train_tokens_per_second": 486.487
    },
    {
      "epoch": 0.5093513728611222,
      "grad_norm": 0.03133539482951164,
      "learning_rate": 2.4626014824618415e-05,
      "loss": 0.014300110936164855,
      "num_input_tokens_seen": 595184,
      "step": 160,
      "train_runtime": 1220.1612,
      "train_tokens_per_second": 487.791
    },
    {
      "epoch": 0.5252686032630323,
      "grad_norm": 0.18265235424041748,
      "learning_rate": 2.3380472017746202e-05,
      "loss": 0.01761966049671173,
      "num_input_tokens_seen": 614240,
      "step": 165,
      "train_runtime": 1258.4126,
      "train_tokens_per_second": 488.107
    },
    {
      "epoch": 0.5411858336649423,
      "grad_norm": 0.3756831884384155,
      "learning_rate": 2.2138955612614207e-05,
      "loss": 0.02411275953054428,
      "num_input_tokens_seen": 634816,
      "step": 170,
      "train_runtime": 1297.0269,
      "train_tokens_per_second": 489.439
    },
    {
      "epoch": 0.5571030640668524,
      "grad_norm": 0.07078292965888977,
      "learning_rate": 2.090455221462156e-05,
      "loss": 0.02472930997610092,
      "num_input_tokens_seen": 653200,
      "step": 175,
      "train_runtime": 1334.905,
      "train_tokens_per_second": 489.323
    },
    {
      "epoch": 0.5730202944687625,
      "grad_norm": 0.08629941940307617,
      "learning_rate": 1.9680330745110954e-05,
      "loss": 0.0432051956653595,
      "num_input_tokens_seen": 671184,
      "step": 180,
      "train_runtime": 1372.8961,
      "train_tokens_per_second": 488.882
    },
    {
      "epoch": 0.5889375248706725,
      "grad_norm": 0.07341516762971878,
      "learning_rate": 1.8469334811546542e-05,
      "loss": 0.015968725085258484,
      "num_input_tokens_seen": 689328,
      "step": 185,
      "train_runtime": 1411.3785,
      "train_tokens_per_second": 488.408
    },
    {
      "epoch": 0.6048547552725826,
      "grad_norm": 0.042029932141304016,
      "learning_rate": 1.7274575140626318e-05,
      "loss": 0.020535998046398163,
      "num_input_tokens_seen": 707312,
      "step": 190,
      "train_runtime": 1449.4543,
      "train_tokens_per_second": 487.985
    },
    {
      "epoch": 0.6207719856744927,
      "grad_norm": 0.09814783930778503,
      "learning_rate": 1.609902209314108e-05,
      "loss": 0.017926733195781707,
      "num_input_tokens_seen": 726832,
      "step": 195,
      "train_runtime": 1487.8712,
      "train_tokens_per_second": 488.505
    },
    {
      "epoch": 0.6366892160764027,
      "grad_norm": 0.06525809317827225,
      "learning_rate": 1.4945598279189565e-05,
      "loss": 0.020335957407951355,
      "num_input_tokens_seen": 745184,
      "step": 200,
      "train_runtime": 1526.3493,
      "train_tokens_per_second": 488.213
    },
    {
      "epoch": 0.6526064464783128,
      "grad_norm": 0.11451390385627747,
      "learning_rate": 1.3817171292109183e-05,
      "loss": 0.012867054343223572,
      "num_input_tokens_seen": 764064,
      "step": 205,
      "train_runtime": 1565.3137,
      "train_tokens_per_second": 488.122
    },
    {
      "epoch": 0.6685236768802229,
      "grad_norm": 0.06963406503200531,
      "learning_rate": 1.271654657918722e-05,
      "loss": 0.012676186859607697,
      "num_input_tokens_seen": 783216,
      "step": 210,
      "train_runtime": 1603.6122,
      "train_tokens_per_second": 488.407
    },
    {
      "epoch": 0.6844409072821329,
      "grad_norm": 0.03970273584127426,
      "learning_rate": 1.1646460466876783e-05,
      "loss": 0.013275411725044251,
      "num_input_tokens_seen": 803760,
      "step": 215,
      "train_runtime": 1643.1241,
      "train_tokens_per_second": 489.166
    },
    {
      "epoch": 0.700358137684043,
      "grad_norm": 0.0629667267203331,
      "learning_rate": 1.0609573357858166e-05,
      "loss": 0.015906769037246703,
      "num_input_tokens_seen": 822352,
      "step": 220,
      "train_runtime": 1681.4489,
      "train_tokens_per_second": 489.073
    },
    {
      "epoch": 0.716275368085953,
      "grad_norm": 0.46428775787353516,
      "learning_rate": 9.608463116858542e-06,
      "loss": 0.06054983139038086,
      "num_input_tokens_seen": 839776,
      "step": 225,
      "train_runtime": 1719.5754,
      "train_tokens_per_second": 488.362
    },
    {
      "epoch": 0.7321925984878631,
      "grad_norm": 0.04607592523097992,
      "learning_rate": 8.645618661674142e-06,
      "loss": 0.0126905158162117,
      "num_input_tokens_seen": 857904,
      "step": 230,
      "train_runtime": 1758.1484,
      "train_tokens_per_second": 487.959
    },
    {
      "epoch": 0.7481098288897732,
      "grad_norm": 0.05666354298591614,
      "learning_rate": 7.723433775328384e-06,
      "loss": 0.018532435595989227,
      "num_input_tokens_seen": 875536,
      "step": 235,
      "train_runtime": 1796.0767,
      "train_tokens_per_second": 487.471
    },
    {
      "epoch": 0.7640270592916832,
      "grad_norm": 0.2170793116092682,
      "learning_rate": 6.844201154750177e-06,
      "loss": 0.017641636729240417,
      "num_input_tokens_seen": 893952,
      "step": 240,
      "train_runtime": 1834.3144,
      "train_tokens_per_second": 487.349
    },
    {
      "epoch": 0.7799442896935933,
      "grad_norm": 0.0820794478058815,
      "learning_rate": 6.010106710768052e-06,
      "loss": 0.014852634072303772,
      "num_input_tokens_seen": 911888,
      "step": 245,
      "train_runtime": 1872.6499,
      "train_tokens_per_second": 486.951
    },
    {
      "epoch": 0.7958615200955034,
      "grad_norm": 0.07925046235322952,
      "learning_rate": 5.223224133591476e-06,
      "loss": 0.013549965620040894,
      "num_input_tokens_seen": 931552,
      "step": 250,
      "train_runtime": 1911.0896,
      "train_tokens_per_second": 487.445
    },
    {
      "epoch": 0.8117787504974134,
      "grad_norm": 0.04383081570267677,
      "learning_rate": 4.4855097372902135e-06,
      "loss": 0.016868625581264497,
      "num_input_tokens_seen": 951232,
      "step": 255,
      "train_runtime": 1949.3262,
      "train_tokens_per_second": 487.98
    },
    {
      "epoch": 0.8276959808993235,
      "grad_norm": 0.04657934233546257,
      "learning_rate": 3.798797596089351e-06,
      "loss": 0.02409391403198242,
      "num_input_tokens_seen": 971248,
      "step": 260,
      "train_runtime": 1988.2601,
      "train_tokens_per_second": 488.491
    },
    {
      "epoch": 0.8436132113012336,
      "grad_norm": 0.04718421772122383,
      "learning_rate": 3.164794984571759e-06,
      "loss": 0.014366105198860168,
      "num_input_tokens_seen": 989568,
      "step": 265,
      "train_runtime": 2026.3445,
      "train_tokens_per_second": 488.351
    },
    {
      "epoch": 0.8595304417031436,
      "grad_norm": 0.056470856070518494,
      "learning_rate": 2.58507813312448e-06,
      "loss": 0.019769111275672914,
      "num_input_tokens_seen": 1008400,
      "step": 270,
      "train_runtime": 2064.7275,
      "train_tokens_per_second": 488.394
    },
    {
      "epoch": 0.8754476721050537,
      "grad_norm": 0.05699534714221954,
      "learning_rate": 2.0610883091816525e-06,
      "loss": 0.012975563108921052,
      "num_input_tokens_seen": 1026832,
      "step": 275,
      "train_runtime": 2103.4641,
      "train_tokens_per_second": 488.162
    },
    {
      "epoch": 0.8913649025069638,
      "grad_norm": 0.05100962892174721,
      "learning_rate": 1.59412823400657e-06,
      "loss": 0.02301923781633377,
      "num_input_tokens_seen": 1045568,
      "step": 280,
      "train_runtime": 2141.531,
      "train_tokens_per_second": 488.234
    },
    {
      "epoch": 0.9072821329088738,
      "grad_norm": 0.056496769189834595,
      "learning_rate": 1.1853588439213442e-06,
      "loss": 0.013730129599571228,
      "num_input_tokens_seen": 1064448,
      "step": 285,
      "train_runtime": 2180.0384,
      "train_tokens_per_second": 488.27
    },
    {
      "epoch": 0.9231993633107839,
      "grad_norm": 0.05061493441462517,
      "learning_rate": 8.357964040363209e-07,
      "loss": 0.01429380029439926,
      "num_input_tokens_seen": 1082240,
      "step": 290,
      "train_runtime": 2218.224,
      "train_tokens_per_second": 487.886
    },
    {
      "epoch": 0.939116593712694,
      "grad_norm": 0.06360100954771042,
      "learning_rate": 5.463099816548579e-07,
      "loss": 0.01451290100812912,
      "num_input_tokens_seen": 1100608,
      "step": 295,
      "train_runtime": 2256.2766,
      "train_tokens_per_second": 487.798
    },
    {
      "epoch": 0.955033824114604,
      "grad_norm": 0.09003032743930817,
      "learning_rate": 3.1761928563510955e-07,
      "loss": 0.015449412167072296,
      "num_input_tokens_seen": 1119264,
      "step": 300,
      "train_runtime": 2294.4496,
      "train_tokens_per_second": 487.814
    },
    {
      "epoch": 0.9709510545165141,
      "grad_norm": 0.06692849099636078,
      "learning_rate": 1.5029287708036854e-07,
      "loss": 0.01347261518239975,
      "num_input_tokens_seen": 1137216,
      "step": 305,
      "train_runtime": 2333.19,
      "train_tokens_per_second": 487.408
    },
    {
      "epoch": 0.9868682849184242,
      "grad_norm": 0.07066839933395386,
      "learning_rate": 4.474675580662113e-08,
      "loss": 0.020735736191272735,
      "num_input_tokens_seen": 1155552,
      "step": 310,
      "train_runtime": 2371.0827,
      "train_tokens_per_second": 487.352
    },
    {
      "epoch": 1.0,
      "grad_norm": 0.26579365134239197,
      "learning_rate": 1.2433261014244136e-09,
      "loss": 0.01795462816953659,
      "num_input_tokens_seen": 1170680,
      "step": 315,
      "train_runtime": 2402.7005,
      "train_tokens_per_second": 487.235
    },
    {
      "epoch": 1.0,
      "num_input_tokens_seen": 1170680,
      "step": 315,
      "total_flos": 2.751640835887104e+16,
      "train_loss": 0.04861170140996812,
      "train_runtime": 2403.2583,
      "train_samples_per_second": 2.091,
      "train_steps_per_second": 0.131
    }
  ],
  "logging_steps": 5,
  "max_steps": 315,
  "num_input_tokens_seen": 1170680,
  "num_train_epochs": 1,
  "save_steps": 100,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": true
      },
      "attributes": {}
    }
  },
  "total_flos": 2.751640835887104e+16,
  "train_batch_size": 2,
  "trial_name": null,
  "trial_params": null
}