CodeIsAbstract's picture
Training in progress, step 10000, checkpoint
5730e8e verified
Raw
History Blame Contribute Delete
205 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9090909090909091,
"eval_steps": 100,
"global_step": 10000,
"is_hyper_param_search": false,
"is_local_process_zero": false,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0009090909090909091,
"grad_norm": 73365171732480.0,
"learning_rate": 9.999983482695944e-07,
"loss": 26.594210815429687,
"step": 10
},
{
"epoch": 0.0018181818181818182,
"grad_norm": 51667001147392.0,
"learning_rate": 9.999926385982519e-07,
"loss": 26.803173828125,
"step": 20
},
{
"epoch": 0.0027272727272727275,
"grad_norm": 144119808655360.0,
"learning_rate": 9.999828506408003e-07,
"loss": 26.6311767578125,
"step": 30
},
{
"epoch": 0.0036363636363636364,
"grad_norm": 288443594702848.0,
"learning_rate": 9.999689844770766e-07,
"loss": 26.79853210449219,
"step": 40
},
{
"epoch": 0.004545454545454545,
"grad_norm": 178193478713344.0,
"learning_rate": 9.999510402201835e-07,
"loss": 26.80711669921875,
"step": 50
},
{
"epoch": 0.005454545454545455,
"grad_norm": 104469937258496.0,
"learning_rate": 9.99929018016486e-07,
"loss": 26.85858154296875,
"step": 60
},
{
"epoch": 0.006363636363636364,
"grad_norm": 212630258057216.0,
"learning_rate": 9.999029180456129e-07,
"loss": 26.61113586425781,
"step": 70
},
{
"epoch": 0.007272727272727273,
"grad_norm": 82712153030656.0,
"learning_rate": 9.998727405204534e-07,
"loss": 26.967510986328126,
"step": 80
},
{
"epoch": 0.008181818181818182,
"grad_norm": 113997894385664.0,
"learning_rate": 9.998384856871564e-07,
"loss": 26.79218444824219,
"step": 90
},
{
"epoch": 0.00909090909090909,
"grad_norm": 32432866721792.0,
"learning_rate": 9.998001538251282e-07,
"loss": 26.760104370117187,
"step": 100
},
{
"epoch": 0.00909090909090909,
"eval_loss": 26.33808708190918,
"eval_runtime": 15.3766,
"eval_samples_per_second": 2.341,
"eval_steps_per_second": 0.13,
"step": 100
},
{
"epoch": 0.01,
"grad_norm": 86142355505152.0,
"learning_rate": 9.997577452470298e-07,
"loss": 26.885391235351562,
"step": 110
},
{
"epoch": 0.01090909090909091,
"grad_norm": 42407483670528.0,
"learning_rate": 9.99711260298775e-07,
"loss": 26.781631469726562,
"step": 120
},
{
"epoch": 0.011818181818181818,
"grad_norm": 87900112814080.0,
"learning_rate": 9.99660699359527e-07,
"loss": 26.478997802734376,
"step": 130
},
{
"epoch": 0.012727272727272728,
"grad_norm": 109777954799616.0,
"learning_rate": 9.996060628416963e-07,
"loss": 26.806842041015624,
"step": 140
},
{
"epoch": 0.013636363636363636,
"grad_norm": 49805468368896.0,
"learning_rate": 9.995473511909357e-07,
"loss": 27.047796630859374,
"step": 150
},
{
"epoch": 0.014545454545454545,
"grad_norm": 216601408307200.0,
"learning_rate": 9.994845648861382e-07,
"loss": 26.913211059570312,
"step": 160
},
{
"epoch": 0.015454545454545455,
"grad_norm": 207064097882112.0,
"learning_rate": 9.994177044394322e-07,
"loss": 26.413333129882812,
"step": 170
},
{
"epoch": 0.016363636363636365,
"grad_norm": 82221604012032.0,
"learning_rate": 9.993467703961784e-07,
"loss": 26.159014892578124,
"step": 180
},
{
"epoch": 0.017272727272727273,
"grad_norm": 54769984995328.0,
"learning_rate": 9.992717633349635e-07,
"loss": 26.39976806640625,
"step": 190
},
{
"epoch": 0.01818181818181818,
"grad_norm": 91138409103360.0,
"learning_rate": 9.99192683867597e-07,
"loss": 26.521871948242186,
"step": 200
},
{
"epoch": 0.01818181818181818,
"eval_loss": 26.33262825012207,
"eval_runtime": 2.2052,
"eval_samples_per_second": 16.325,
"eval_steps_per_second": 0.907,
"step": 200
},
{
"epoch": 0.019090909090909092,
"grad_norm": 226673442160640.0,
"learning_rate": 9.99109532639106e-07,
"loss": 26.42662353515625,
"step": 210
},
{
"epoch": 0.02,
"grad_norm": 178545447927808.0,
"learning_rate": 9.99022310327729e-07,
"loss": 27.001919555664063,
"step": 220
},
{
"epoch": 0.02090909090909091,
"grad_norm": 37310276042752.0,
"learning_rate": 9.98931017644912e-07,
"loss": 26.3681884765625,
"step": 230
},
{
"epoch": 0.02181818181818182,
"grad_norm": 169656073584640.0,
"learning_rate": 9.988356553353017e-07,
"loss": 26.52265625,
"step": 240
},
{
"epoch": 0.022727272727272728,
"grad_norm": 119822314635264.0,
"learning_rate": 9.987362241767383e-07,
"loss": 26.739306640625,
"step": 250
},
{
"epoch": 0.023636363636363636,
"grad_norm": 135106542960640.0,
"learning_rate": 9.986327249802515e-07,
"loss": 26.929629516601562,
"step": 260
},
{
"epoch": 0.024545454545454544,
"grad_norm": 141070599979008.0,
"learning_rate": 9.985251585900525e-07,
"loss": 26.869723510742187,
"step": 270
},
{
"epoch": 0.025454545454545455,
"grad_norm": 168756110163968.0,
"learning_rate": 9.984135258835272e-07,
"loss": 26.432122802734376,
"step": 280
},
{
"epoch": 0.026363636363636363,
"grad_norm": 51225978470400.0,
"learning_rate": 9.98297827771229e-07,
"loss": 26.779403686523438,
"step": 290
},
{
"epoch": 0.02727272727272727,
"grad_norm": 203997088579584.0,
"learning_rate": 9.981780651968722e-07,
"loss": 26.73297119140625,
"step": 300
},
{
"epoch": 0.02727272727272727,
"eval_loss": 26.32358741760254,
"eval_runtime": 2.1675,
"eval_samples_per_second": 16.609,
"eval_steps_per_second": 0.923,
"step": 300
},
{
"epoch": 0.028181818181818183,
"grad_norm": 211993462046720.0,
"learning_rate": 9.980542391373232e-07,
"loss": 26.3818603515625,
"step": 310
},
{
"epoch": 0.02909090909090909,
"grad_norm": 67605180186624.0,
"learning_rate": 9.979263506025929e-07,
"loss": 26.753466796875,
"step": 320
},
{
"epoch": 0.03,
"grad_norm": 83690625433600.0,
"learning_rate": 9.977944006358285e-07,
"loss": 26.70177001953125,
"step": 330
},
{
"epoch": 0.03090909090909091,
"grad_norm": 234856529264640.0,
"learning_rate": 9.976583903133059e-07,
"loss": 26.383956909179688,
"step": 340
},
{
"epoch": 0.031818181818181815,
"grad_norm": 74805898379264.0,
"learning_rate": 9.975183207444189e-07,
"loss": 26.859848022460938,
"step": 350
},
{
"epoch": 0.03272727272727273,
"grad_norm": 216309870624768.0,
"learning_rate": 9.97374193071672e-07,
"loss": 26.3761474609375,
"step": 360
},
{
"epoch": 0.03363636363636364,
"grad_norm": 132342337241088.0,
"learning_rate": 9.972260084706704e-07,
"loss": 26.71666564941406,
"step": 370
},
{
"epoch": 0.034545454545454546,
"grad_norm": 131501941325824.0,
"learning_rate": 9.970737681501104e-07,
"loss": 26.52633056640625,
"step": 380
},
{
"epoch": 0.035454545454545454,
"grad_norm": 262768951296000.0,
"learning_rate": 9.969174733517693e-07,
"loss": 26.515576171875,
"step": 390
},
{
"epoch": 0.03636363636363636,
"grad_norm": 47626049290240.0,
"learning_rate": 9.967571253504956e-07,
"loss": 26.491845703125,
"step": 400
},
{
"epoch": 0.03636363636363636,
"eval_loss": 26.31351089477539,
"eval_runtime": 2.1949,
"eval_samples_per_second": 16.402,
"eval_steps_per_second": 0.911,
"step": 400
},
{
"epoch": 0.03727272727272727,
"grad_norm": 82015571410944.0,
"learning_rate": 9.965927254541986e-07,
"loss": 26.79627380371094,
"step": 410
},
{
"epoch": 0.038181818181818185,
"grad_norm": 48217920110592.0,
"learning_rate": 9.964242750038379e-07,
"loss": 26.478103637695312,
"step": 420
},
{
"epoch": 0.03909090909090909,
"grad_norm": 240027619557376.0,
"learning_rate": 9.96251775373412e-07,
"loss": 27.031826782226563,
"step": 430
},
{
"epoch": 0.04,
"grad_norm": 85748241924096.0,
"learning_rate": 9.960752279699469e-07,
"loss": 26.60472412109375,
"step": 440
},
{
"epoch": 0.04090909090909091,
"grad_norm": 149027999973376.0,
"learning_rate": 9.958946342334858e-07,
"loss": 26.631716918945312,
"step": 450
},
{
"epoch": 0.04181818181818182,
"grad_norm": 145542986334208.0,
"learning_rate": 9.957099956370761e-07,
"loss": 26.688156127929688,
"step": 460
},
{
"epoch": 0.042727272727272725,
"grad_norm": 119765381152768.0,
"learning_rate": 9.95521313686758e-07,
"loss": 26.73491516113281,
"step": 470
},
{
"epoch": 0.04363636363636364,
"grad_norm": 42115639803904.0,
"learning_rate": 9.953285899215524e-07,
"loss": 26.4789306640625,
"step": 480
},
{
"epoch": 0.04454545454545455,
"grad_norm": 174389194653696.0,
"learning_rate": 9.951318259134473e-07,
"loss": 26.395907592773437,
"step": 490
},
{
"epoch": 0.045454545454545456,
"grad_norm": 126755364929536.0,
"learning_rate": 9.949310232673867e-07,
"loss": 26.444671630859375,
"step": 500
},
{
"epoch": 0.045454545454545456,
"eval_loss": 26.300777435302734,
"eval_runtime": 2.1863,
"eval_samples_per_second": 16.466,
"eval_steps_per_second": 0.915,
"step": 500
},
{
"epoch": 0.046363636363636364,
"grad_norm": 89457617272832.0,
"learning_rate": 9.947261836212555e-07,
"loss": 26.633724975585938,
"step": 510
},
{
"epoch": 0.04727272727272727,
"grad_norm": 357854594727936.0,
"learning_rate": 9.94517308645868e-07,
"loss": 26.50592956542969,
"step": 520
},
{
"epoch": 0.04818181818181818,
"grad_norm": 145786406961152.0,
"learning_rate": 9.94304400044953e-07,
"loss": 26.608950805664062,
"step": 530
},
{
"epoch": 0.04909090909090909,
"grad_norm": 63449291816960.0,
"learning_rate": 9.940874595551404e-07,
"loss": 26.23621826171875,
"step": 540
},
{
"epoch": 0.05,
"grad_norm": 35186595069952.0,
"learning_rate": 9.938664889459468e-07,
"loss": 26.354998779296874,
"step": 550
},
{
"epoch": 0.05090909090909091,
"grad_norm": 171478263791616.0,
"learning_rate": 9.936414900197618e-07,
"loss": 26.57105712890625,
"step": 560
},
{
"epoch": 0.05181818181818182,
"grad_norm": 424193384513536.0,
"learning_rate": 9.934124646118324e-07,
"loss": 26.597015380859375,
"step": 570
},
{
"epoch": 0.05272727272727273,
"grad_norm": 69734649298944.0,
"learning_rate": 9.931794145902485e-07,
"loss": 26.793948364257812,
"step": 580
},
{
"epoch": 0.053636363636363635,
"grad_norm": 71048951234560.0,
"learning_rate": 9.92942341855927e-07,
"loss": 26.852621459960936,
"step": 590
},
{
"epoch": 0.05454545454545454,
"grad_norm": 265954290302976.0,
"learning_rate": 9.927012483425976e-07,
"loss": 26.4174072265625,
"step": 600
},
{
"epoch": 0.05454545454545454,
"eval_loss": 26.291404724121094,
"eval_runtime": 2.1954,
"eval_samples_per_second": 16.398,
"eval_steps_per_second": 0.911,
"step": 600
},
{
"epoch": 0.05545454545454546,
"grad_norm": 172292495638528.0,
"learning_rate": 9.924561360167858e-07,
"loss": 27.017904663085936,
"step": 610
},
{
"epoch": 0.056363636363636366,
"grad_norm": 146552655970304.0,
"learning_rate": 9.922070068777972e-07,
"loss": 26.3694091796875,
"step": 620
},
{
"epoch": 0.057272727272727274,
"grad_norm": 238492990832640.0,
"learning_rate": 9.91953862957702e-07,
"loss": 26.68968505859375,
"step": 630
},
{
"epoch": 0.05818181818181818,
"grad_norm": 277039399567360.0,
"learning_rate": 9.91696706321317e-07,
"loss": 26.37095947265625,
"step": 640
},
{
"epoch": 0.05909090909090909,
"grad_norm": 185654575104000.0,
"learning_rate": 9.914355390661895e-07,
"loss": 26.30018005371094,
"step": 650
},
{
"epoch": 0.06,
"grad_norm": 310576869801984.0,
"learning_rate": 9.91170363322581e-07,
"loss": 26.79898681640625,
"step": 660
},
{
"epoch": 0.060909090909090906,
"grad_norm": 67033240698880.0,
"learning_rate": 9.90901181253448e-07,
"loss": 26.819778442382812,
"step": 670
},
{
"epoch": 0.06181818181818182,
"grad_norm": 56443759755264.0,
"learning_rate": 9.906279950544258e-07,
"loss": 26.365707397460938,
"step": 680
},
{
"epoch": 0.06272727272727273,
"grad_norm": 60853546123264.0,
"learning_rate": 9.903508069538107e-07,
"loss": 26.7015869140625,
"step": 690
},
{
"epoch": 0.06363636363636363,
"grad_norm": 54322498895872.0,
"learning_rate": 9.900696192125401e-07,
"loss": 26.60201416015625,
"step": 700
},
{
"epoch": 0.06363636363636363,
"eval_loss": 26.27959442138672,
"eval_runtime": 2.1871,
"eval_samples_per_second": 16.46,
"eval_steps_per_second": 0.914,
"step": 700
},
{
"epoch": 0.06454545454545454,
"grad_norm": 86583118135296.0,
"learning_rate": 9.897844341241764e-07,
"loss": 26.674392700195312,
"step": 710
},
{
"epoch": 0.06545454545454546,
"grad_norm": 117483361009664.0,
"learning_rate": 9.894952540148861e-07,
"loss": 26.57917175292969,
"step": 720
},
{
"epoch": 0.06636363636363636,
"grad_norm": 156891263008768.0,
"learning_rate": 9.892020812434227e-07,
"loss": 26.749630737304688,
"step": 730
},
{
"epoch": 0.06727272727272728,
"grad_norm": 161708622479360.0,
"learning_rate": 9.889049182011064e-07,
"loss": 26.950381469726562,
"step": 740
},
{
"epoch": 0.06818181818181818,
"grad_norm": 132854914744320.0,
"learning_rate": 9.886037673118046e-07,
"loss": 26.209268188476564,
"step": 750
},
{
"epoch": 0.06909090909090909,
"grad_norm": 230637545979904.0,
"learning_rate": 9.882986310319123e-07,
"loss": 26.622137451171874,
"step": 760
},
{
"epoch": 0.07,
"grad_norm": 44996547837952.0,
"learning_rate": 9.879895118503322e-07,
"loss": 26.396820068359375,
"step": 770
},
{
"epoch": 0.07090909090909091,
"grad_norm": 105779734511616.0,
"learning_rate": 9.876764122884546e-07,
"loss": 26.439730834960937,
"step": 780
},
{
"epoch": 0.07181818181818182,
"grad_norm": 142746727743488.0,
"learning_rate": 9.873593349001363e-07,
"loss": 26.420101928710938,
"step": 790
},
{
"epoch": 0.07272727272727272,
"grad_norm": 217378294071296.0,
"learning_rate": 9.870382822716797e-07,
"loss": 26.5166015625,
"step": 800
},
{
"epoch": 0.07272727272727272,
"eval_loss": 26.271564483642578,
"eval_runtime": 2.1575,
"eval_samples_per_second": 16.686,
"eval_steps_per_second": 0.927,
"step": 800
},
{
"epoch": 0.07363636363636364,
"grad_norm": 108654393032704.0,
"learning_rate": 9.867132570218127e-07,
"loss": 26.610940551757814,
"step": 810
},
{
"epoch": 0.07454545454545454,
"grad_norm": 160897595080704.0,
"learning_rate": 9.863842618016658e-07,
"loss": 26.722555541992186,
"step": 820
},
{
"epoch": 0.07545454545454545,
"grad_norm": 207793755783168.0,
"learning_rate": 9.86051299294752e-07,
"loss": 26.355166625976562,
"step": 830
},
{
"epoch": 0.07636363636363637,
"grad_norm": 73539973545984.0,
"learning_rate": 9.857143722169442e-07,
"loss": 26.54212341308594,
"step": 840
},
{
"epoch": 0.07727272727272727,
"grad_norm": 117208164335616.0,
"learning_rate": 9.853734833164525e-07,
"loss": 26.74329528808594,
"step": 850
},
{
"epoch": 0.07818181818181819,
"grad_norm": 65454479507456.0,
"learning_rate": 9.850286353738032e-07,
"loss": 26.864334106445312,
"step": 860
},
{
"epoch": 0.07909090909090909,
"grad_norm": 302659668017152.0,
"learning_rate": 9.846798312018146e-07,
"loss": 26.766177368164062,
"step": 870
},
{
"epoch": 0.08,
"grad_norm": 64990744674304.0,
"learning_rate": 9.843270736455752e-07,
"loss": 26.492599487304688,
"step": 880
},
{
"epoch": 0.0809090909090909,
"grad_norm": 143555456663552.0,
"learning_rate": 9.839703655824194e-07,
"loss": 26.37163391113281,
"step": 890
},
{
"epoch": 0.08181818181818182,
"grad_norm": 120043572559872.0,
"learning_rate": 9.836097099219057e-07,
"loss": 26.424105834960937,
"step": 900
},
{
"epoch": 0.08181818181818182,
"eval_loss": 26.26393699645996,
"eval_runtime": 2.1589,
"eval_samples_per_second": 16.675,
"eval_steps_per_second": 0.926,
"step": 900
},
{
"epoch": 0.08272727272727273,
"grad_norm": 129510234128384.0,
"learning_rate": 9.832451096057912e-07,
"loss": 26.673666381835936,
"step": 910
},
{
"epoch": 0.08363636363636363,
"grad_norm": 89579042373632.0,
"learning_rate": 9.82876567608008e-07,
"loss": 26.665896606445312,
"step": 920
},
{
"epoch": 0.08454545454545455,
"grad_norm": 78381492207616.0,
"learning_rate": 9.825040869346404e-07,
"loss": 26.850192260742187,
"step": 930
},
{
"epoch": 0.08545454545454545,
"grad_norm": 88285191864320.0,
"learning_rate": 9.821276706238985e-07,
"loss": 26.515313720703126,
"step": 940
},
{
"epoch": 0.08636363636363636,
"grad_norm": 152401596121088.0,
"learning_rate": 9.81747321746094e-07,
"loss": 26.679132080078126,
"step": 950
},
{
"epoch": 0.08727272727272728,
"grad_norm": 154951682621440.0,
"learning_rate": 9.81363043403616e-07,
"loss": 26.68135986328125,
"step": 960
},
{
"epoch": 0.08818181818181818,
"grad_norm": 241076212334592.0,
"learning_rate": 9.809748387309047e-07,
"loss": 26.675436401367186,
"step": 970
},
{
"epoch": 0.0890909090909091,
"grad_norm": 109151057346560.0,
"learning_rate": 9.805827108944259e-07,
"loss": 26.623699951171876,
"step": 980
},
{
"epoch": 0.09,
"grad_norm": 133532965928960.0,
"learning_rate": 9.801866630926459e-07,
"loss": 26.52110595703125,
"step": 990
},
{
"epoch": 0.09090909090909091,
"grad_norm": 96509039214592.0,
"learning_rate": 9.797866985560049e-07,
"loss": 26.782925415039063,
"step": 1000
},
{
"epoch": 0.09090909090909091,
"eval_loss": 26.261463165283203,
"eval_runtime": 2.183,
"eval_samples_per_second": 16.491,
"eval_steps_per_second": 0.916,
"step": 1000
},
{
"epoch": 0.09181818181818181,
"grad_norm": 187900356460544.0,
"learning_rate": 9.793828205468902e-07,
"loss": 26.365805053710936,
"step": 1010
},
{
"epoch": 0.09272727272727273,
"grad_norm": 28923125563392.0,
"learning_rate": 9.789750323596107e-07,
"loss": 26.50677490234375,
"step": 1020
},
{
"epoch": 0.09363636363636364,
"grad_norm": 68414097850368.0,
"learning_rate": 9.78563337320369e-07,
"loss": 26.546441650390626,
"step": 1030
},
{
"epoch": 0.09454545454545454,
"grad_norm": 90978555789312.0,
"learning_rate": 9.781477387872351e-07,
"loss": 26.585183715820314,
"step": 1040
},
{
"epoch": 0.09545454545454546,
"grad_norm": 53660109242368.0,
"learning_rate": 9.77728240150118e-07,
"loss": 26.682867431640624,
"step": 1050
},
{
"epoch": 0.09636363636363636,
"grad_norm": 27466840145920.0,
"learning_rate": 9.773048448307396e-07,
"loss": 26.987350463867188,
"step": 1060
},
{
"epoch": 0.09727272727272727,
"grad_norm": 147959761076224.0,
"learning_rate": 9.768775562826047e-07,
"loss": 26.73785400390625,
"step": 1070
},
{
"epoch": 0.09818181818181818,
"grad_norm": 169358798094336.0,
"learning_rate": 9.764463779909748e-07,
"loss": 26.500772094726564,
"step": 1080
},
{
"epoch": 0.09909090909090909,
"grad_norm": 115589129437184.0,
"learning_rate": 9.760113134728383e-07,
"loss": 26.610415649414062,
"step": 1090
},
{
"epoch": 0.1,
"grad_norm": 360445969956864.0,
"learning_rate": 9.755723662768827e-07,
"loss": 26.56005859375,
"step": 1100
},
{
"epoch": 0.1,
"eval_loss": 26.256052017211914,
"eval_runtime": 2.1588,
"eval_samples_per_second": 16.676,
"eval_steps_per_second": 0.926,
"step": 1100
},
{
"epoch": 0.1009090909090909,
"grad_norm": 99185625923584.0,
"learning_rate": 9.751295399834653e-07,
"loss": 26.6890869140625,
"step": 1110
},
{
"epoch": 0.10181818181818182,
"grad_norm": 183202215886848.0,
"learning_rate": 9.746828382045843e-07,
"loss": 26.630459594726563,
"step": 1120
},
{
"epoch": 0.10272727272727272,
"grad_norm": 140842698276864.0,
"learning_rate": 9.742322645838476e-07,
"loss": 26.70002136230469,
"step": 1130
},
{
"epoch": 0.10363636363636364,
"grad_norm": 131215461974016.0,
"learning_rate": 9.737778227964468e-07,
"loss": 26.78693542480469,
"step": 1140
},
{
"epoch": 0.10454545454545454,
"grad_norm": 71228257730560.0,
"learning_rate": 9.73319516549123e-07,
"loss": 26.13782958984375,
"step": 1150
},
{
"epoch": 0.10545454545454545,
"grad_norm": 261910243049472.0,
"learning_rate": 9.728573495801392e-07,
"loss": 26.35780029296875,
"step": 1160
},
{
"epoch": 0.10636363636363637,
"grad_norm": 169149602988032.0,
"learning_rate": 9.723913256592495e-07,
"loss": 26.219625854492186,
"step": 1170
},
{
"epoch": 0.10727272727272727,
"grad_norm": 115012219699200.0,
"learning_rate": 9.719214485876675e-07,
"loss": 26.5546142578125,
"step": 1180
},
{
"epoch": 0.10818181818181818,
"grad_norm": 145118489214976.0,
"learning_rate": 9.71447722198036e-07,
"loss": 26.627142333984374,
"step": 1190
},
{
"epoch": 0.10909090909090909,
"grad_norm": 80806982713344.0,
"learning_rate": 9.709701503543952e-07,
"loss": 27.058038330078126,
"step": 1200
},
{
"epoch": 0.10909090909090909,
"eval_loss": 26.251787185668945,
"eval_runtime": 2.1351,
"eval_samples_per_second": 16.861,
"eval_steps_per_second": 0.937,
"step": 1200
},
{
"epoch": 0.11,
"grad_norm": 268123030683648.0,
"learning_rate": 9.70488736952152e-07,
"loss": 26.308306884765624,
"step": 1210
},
{
"epoch": 0.11090909090909092,
"grad_norm": 69903797190656.0,
"learning_rate": 9.70003485918047e-07,
"loss": 27.026678466796874,
"step": 1220
},
{
"epoch": 0.11181818181818182,
"grad_norm": 84639771262976.0,
"learning_rate": 9.695144012101237e-07,
"loss": 26.755975341796876,
"step": 1230
},
{
"epoch": 0.11272727272727273,
"grad_norm": 221591623434240.0,
"learning_rate": 9.690214868176957e-07,
"loss": 26.59709777832031,
"step": 1240
},
{
"epoch": 0.11363636363636363,
"grad_norm": 56191258460160.0,
"learning_rate": 9.68524746761314e-07,
"loss": 26.63099060058594,
"step": 1250
},
{
"epoch": 0.11454545454545455,
"grad_norm": 52356536336384.0,
"learning_rate": 9.680241850927343e-07,
"loss": 26.4882568359375,
"step": 1260
},
{
"epoch": 0.11545454545454545,
"grad_norm": 70396200091648.0,
"learning_rate": 9.675198058948842e-07,
"loss": 26.889132690429687,
"step": 1270
},
{
"epoch": 0.11636363636363636,
"grad_norm": 110760671838208.0,
"learning_rate": 9.670116132818296e-07,
"loss": 26.55718994140625,
"step": 1280
},
{
"epoch": 0.11727272727272728,
"grad_norm": 39112727855104.0,
"learning_rate": 9.664996113987413e-07,
"loss": 26.293862915039064,
"step": 1290
},
{
"epoch": 0.11818181818181818,
"grad_norm": 226333435101184.0,
"learning_rate": 9.659838044218612e-07,
"loss": 26.5077392578125,
"step": 1300
},
{
"epoch": 0.11818181818181818,
"eval_loss": 26.251121520996094,
"eval_runtime": 2.1418,
"eval_samples_per_second": 16.808,
"eval_steps_per_second": 0.934,
"step": 1300
},
{
"epoch": 0.1190909090909091,
"grad_norm": 246090066558976.0,
"learning_rate": 9.654641965584677e-07,
"loss": 26.334173583984374,
"step": 1310
},
{
"epoch": 0.12,
"grad_norm": 33603889135616.0,
"learning_rate": 9.649407920468429e-07,
"loss": 26.703265380859374,
"step": 1320
},
{
"epoch": 0.12090909090909091,
"grad_norm": 181444366303232.0,
"learning_rate": 9.644135951562358e-07,
"loss": 26.410659790039062,
"step": 1330
},
{
"epoch": 0.12181818181818181,
"grad_norm": 269644237635584.0,
"learning_rate": 9.638826101868297e-07,
"loss": 26.293899536132812,
"step": 1340
},
{
"epoch": 0.12272727272727273,
"grad_norm": 79681583841280.0,
"learning_rate": 9.63347841469705e-07,
"loss": 26.449856567382813,
"step": 1350
},
{
"epoch": 0.12363636363636364,
"grad_norm": 86067386515456.0,
"learning_rate": 9.62809293366806e-07,
"loss": 26.557858276367188,
"step": 1360
},
{
"epoch": 0.12454545454545454,
"grad_norm": 321075816693760.0,
"learning_rate": 9.62266970270904e-07,
"loss": 26.580886840820312,
"step": 1370
},
{
"epoch": 0.12545454545454546,
"grad_norm": 111324067528704.0,
"learning_rate": 9.617208766055612e-07,
"loss": 26.325762939453124,
"step": 1380
},
{
"epoch": 0.12636363636363637,
"grad_norm": 194993075519488.0,
"learning_rate": 9.61171016825096e-07,
"loss": 26.300454711914064,
"step": 1390
},
{
"epoch": 0.12727272727272726,
"grad_norm": 288133786632192.0,
"learning_rate": 9.606173954145452e-07,
"loss": 26.546014404296876,
"step": 1400
},
{
"epoch": 0.12727272727272726,
"eval_loss": 26.244295120239258,
"eval_runtime": 2.2,
"eval_samples_per_second": 16.363,
"eval_steps_per_second": 0.909,
"step": 1400
},
{
"epoch": 0.12818181818181817,
"grad_norm": 177530057261056.0,
"learning_rate": 9.600600168896283e-07,
"loss": 26.664501953125,
"step": 1410
},
{
"epoch": 0.1290909090909091,
"grad_norm": 82094986362880.0,
"learning_rate": 9.594988857967105e-07,
"loss": 26.34851989746094,
"step": 1420
},
{
"epoch": 0.13,
"grad_norm": 69806082490368.0,
"learning_rate": 9.589340067127657e-07,
"loss": 26.633663940429688,
"step": 1430
},
{
"epoch": 0.13090909090909092,
"grad_norm": 141491255115776.0,
"learning_rate": 9.583653842453382e-07,
"loss": 26.581817626953125,
"step": 1440
},
{
"epoch": 0.1318181818181818,
"grad_norm": 255033698418688.0,
"learning_rate": 9.577930230325072e-07,
"loss": 26.456216430664064,
"step": 1450
},
{
"epoch": 0.13272727272727272,
"grad_norm": 91050555211776.0,
"learning_rate": 9.572169277428464e-07,
"loss": 26.306192016601564,
"step": 1460
},
{
"epoch": 0.13363636363636364,
"grad_norm": 96132306829312.0,
"learning_rate": 9.566371030753882e-07,
"loss": 26.70736083984375,
"step": 1470
},
{
"epoch": 0.13454545454545455,
"grad_norm": 237691039907840.0,
"learning_rate": 9.560535537595838e-07,
"loss": 26.573016357421874,
"step": 1480
},
{
"epoch": 0.13545454545454547,
"grad_norm": 146975156600832.0,
"learning_rate": 9.554662845552656e-07,
"loss": 26.510528564453125,
"step": 1490
},
{
"epoch": 0.13636363636363635,
"grad_norm": 112128560201728.0,
"learning_rate": 9.548753002526076e-07,
"loss": 26.415969848632812,
"step": 1500
},
{
"epoch": 0.13636363636363635,
"eval_loss": 26.23933219909668,
"eval_runtime": 2.1836,
"eval_samples_per_second": 16.487,
"eval_steps_per_second": 0.916,
"step": 1500
},
{
"epoch": 0.13727272727272727,
"grad_norm": 121713308205056.0,
"learning_rate": 9.54280605672087e-07,
"loss": 26.36516418457031,
"step": 1510
},
{
"epoch": 0.13818181818181818,
"grad_norm": 51024886759424.0,
"learning_rate": 9.536822056644444e-07,
"loss": 26.526980590820312,
"step": 1520
},
{
"epoch": 0.1390909090909091,
"grad_norm": 207734800646144.0,
"learning_rate": 9.530801051106448e-07,
"loss": 26.514581298828126,
"step": 1530
},
{
"epoch": 0.14,
"grad_norm": 98977915600896.0,
"learning_rate": 9.52474308921837e-07,
"loss": 26.307882690429686,
"step": 1540
},
{
"epoch": 0.1409090909090909,
"grad_norm": 242286856241152.0,
"learning_rate": 9.518648220393142e-07,
"loss": 26.856787109375,
"step": 1550
},
{
"epoch": 0.14181818181818182,
"grad_norm": 111858983895040.0,
"learning_rate": 9.512516494344732e-07,
"loss": 26.754888916015624,
"step": 1560
},
{
"epoch": 0.14272727272727273,
"grad_norm": 59879578402816.0,
"learning_rate": 9.506347961087743e-07,
"loss": 26.536907958984376,
"step": 1570
},
{
"epoch": 0.14363636363636365,
"grad_norm": 91932332130304.0,
"learning_rate": 9.500142670937006e-07,
"loss": 26.195672607421876,
"step": 1580
},
{
"epoch": 0.14454545454545453,
"grad_norm": 144882249236480.0,
"learning_rate": 9.493900674507158e-07,
"loss": 26.5342041015625,
"step": 1590
},
{
"epoch": 0.14545454545454545,
"grad_norm": 120707262447616.0,
"learning_rate": 9.487622022712247e-07,
"loss": 26.463259887695312,
"step": 1600
},
{
"epoch": 0.14545454545454545,
"eval_loss": 26.236154556274414,
"eval_runtime": 2.2004,
"eval_samples_per_second": 16.361,
"eval_steps_per_second": 0.909,
"step": 1600
},
{
"epoch": 0.14636363636363636,
"grad_norm": 212541254926336.0,
"learning_rate": 9.481306766765304e-07,
"loss": 26.547100830078126,
"step": 1610
},
{
"epoch": 0.14727272727272728,
"grad_norm": 230553676677120.0,
"learning_rate": 9.474954958177925e-07,
"loss": 26.70894775390625,
"step": 1620
},
{
"epoch": 0.1481818181818182,
"grad_norm": 122293414002688.0,
"learning_rate": 9.468566648759864e-07,
"loss": 26.606753540039062,
"step": 1630
},
{
"epoch": 0.14909090909090908,
"grad_norm": 352308181336064.0,
"learning_rate": 9.462141890618589e-07,
"loss": 26.879544067382813,
"step": 1640
},
{
"epoch": 0.15,
"grad_norm": 311560215986176.0,
"learning_rate": 9.455680736158879e-07,
"loss": 26.504266357421876,
"step": 1650
},
{
"epoch": 0.1509090909090909,
"grad_norm": 120461434290176.0,
"learning_rate": 9.449183238082383e-07,
"loss": 26.359844970703126,
"step": 1660
},
{
"epoch": 0.15181818181818182,
"grad_norm": 383121350459392.0,
"learning_rate": 9.442649449387193e-07,
"loss": 26.710943603515624,
"step": 1670
},
{
"epoch": 0.15272727272727274,
"grad_norm": 231313768448000.0,
"learning_rate": 9.436079423367412e-07,
"loss": 26.845486450195313,
"step": 1680
},
{
"epoch": 0.15363636363636363,
"grad_norm": 96833351188480.0,
"learning_rate": 9.429473213612722e-07,
"loss": 26.756405639648438,
"step": 1690
},
{
"epoch": 0.15454545454545454,
"grad_norm": 101140926562304.0,
"learning_rate": 9.422830874007943e-07,
"loss": 26.388482666015626,
"step": 1700
},
{
"epoch": 0.15454545454545454,
"eval_loss": 26.243850708007812,
"eval_runtime": 2.2051,
"eval_samples_per_second": 16.326,
"eval_steps_per_second": 0.907,
"step": 1700
},
{
"epoch": 0.15545454545454546,
"grad_norm": 226440809283584.0,
"learning_rate": 9.416152458732595e-07,
"loss": 26.8792236328125,
"step": 1710
},
{
"epoch": 0.15636363636363637,
"grad_norm": 165783606919168.0,
"learning_rate": 9.409438022260456e-07,
"loss": 26.233120727539063,
"step": 1720
},
{
"epoch": 0.1572727272727273,
"grad_norm": 294015777898496.0,
"learning_rate": 9.40268761935912e-07,
"loss": 26.462741088867187,
"step": 1730
},
{
"epoch": 0.15818181818181817,
"grad_norm": 238918276481024.0,
"learning_rate": 9.395901305089544e-07,
"loss": 26.7887451171875,
"step": 1740
},
{
"epoch": 0.1590909090909091,
"grad_norm": 263223345414144.0,
"learning_rate": 9.389079134805609e-07,
"loss": 26.040914916992186,
"step": 1750
},
{
"epoch": 0.16,
"grad_norm": 95431019200512.0,
"learning_rate": 9.382221164153654e-07,
"loss": 26.33796081542969,
"step": 1760
},
{
"epoch": 0.16090909090909092,
"grad_norm": 140467635224576.0,
"learning_rate": 9.37532744907204e-07,
"loss": 26.717620849609375,
"step": 1770
},
{
"epoch": 0.1618181818181818,
"grad_norm": 480899032416256.0,
"learning_rate": 9.368398045790678e-07,
"loss": 26.35028991699219,
"step": 1780
},
{
"epoch": 0.16272727272727272,
"grad_norm": 81174705733632.0,
"learning_rate": 9.361433010830577e-07,
"loss": 26.753839111328126,
"step": 1790
},
{
"epoch": 0.16363636363636364,
"grad_norm": 47794656116736.0,
"learning_rate": 9.354432401003386e-07,
"loss": 26.356951904296874,
"step": 1800
},
{
"epoch": 0.16363636363636364,
"eval_loss": 26.24485206604004,
"eval_runtime": 2.1577,
"eval_samples_per_second": 16.684,
"eval_steps_per_second": 0.927,
"step": 1800
},
{
"epoch": 0.16454545454545455,
"grad_norm": 698963984384000.0,
"learning_rate": 9.347396273410924e-07,
"loss": 26.833526611328125,
"step": 1810
},
{
"epoch": 0.16545454545454547,
"grad_norm": 86179810639872.0,
"learning_rate": 9.34032468544472e-07,
"loss": 27.016268920898437,
"step": 1820
},
{
"epoch": 0.16636363636363635,
"grad_norm": 96867945807872.0,
"learning_rate": 9.333217694785542e-07,
"loss": 26.19615478515625,
"step": 1830
},
{
"epoch": 0.16727272727272727,
"grad_norm": 63991061676032.0,
"learning_rate": 9.326075359402924e-07,
"loss": 26.851419067382814,
"step": 1840
},
{
"epoch": 0.16818181818181818,
"grad_norm": 41423357345792.0,
"learning_rate": 9.318897737554698e-07,
"loss": 26.44781494140625,
"step": 1850
},
{
"epoch": 0.1690909090909091,
"grad_norm": 268588648759296.0,
"learning_rate": 9.31168488778652e-07,
"loss": 26.81973876953125,
"step": 1860
},
{
"epoch": 0.17,
"grad_norm": 273547809259520.0,
"learning_rate": 9.304436868931382e-07,
"loss": 26.573934936523436,
"step": 1870
},
{
"epoch": 0.1709090909090909,
"grad_norm": 231542844555264.0,
"learning_rate": 9.297153740109147e-07,
"loss": 26.421356201171875,
"step": 1880
},
{
"epoch": 0.17181818181818181,
"grad_norm": 74917072601088.0,
"learning_rate": 9.289835560726052e-07,
"loss": 26.465472412109374,
"step": 1890
},
{
"epoch": 0.17272727272727273,
"grad_norm": 83814885883904.0,
"learning_rate": 9.28248239047424e-07,
"loss": 26.291180419921876,
"step": 1900
},
{
"epoch": 0.17272727272727273,
"eval_loss": 26.247751235961914,
"eval_runtime": 2.1622,
"eval_samples_per_second": 16.65,
"eval_steps_per_second": 0.925,
"step": 1900
},
{
"epoch": 0.17363636363636364,
"grad_norm": 158092041912320.0,
"learning_rate": 9.275094289331253e-07,
"loss": 26.18585205078125,
"step": 1910
},
{
"epoch": 0.17454545454545456,
"grad_norm": 63487564840960.0,
"learning_rate": 9.267671317559562e-07,
"loss": 26.44158935546875,
"step": 1920
},
{
"epoch": 0.17545454545454545,
"grad_norm": 525191251755008.0,
"learning_rate": 9.260213535706062e-07,
"loss": 26.632656860351563,
"step": 1930
},
{
"epoch": 0.17636363636363636,
"grad_norm": 84435751927808.0,
"learning_rate": 9.252721004601587e-07,
"loss": 26.772848510742186,
"step": 1940
},
{
"epoch": 0.17727272727272728,
"grad_norm": 281165470629888.0,
"learning_rate": 9.245193785360406e-07,
"loss": 26.424920654296876,
"step": 1950
},
{
"epoch": 0.1781818181818182,
"grad_norm": 50149321605120.0,
"learning_rate": 9.23763193937973e-07,
"loss": 26.598171997070313,
"step": 1960
},
{
"epoch": 0.17909090909090908,
"grad_norm": 139234526625792.0,
"learning_rate": 9.23003552833921e-07,
"loss": 26.436553955078125,
"step": 1970
},
{
"epoch": 0.18,
"grad_norm": 245148092989440.0,
"learning_rate": 9.222404614200436e-07,
"loss": 26.634979248046875,
"step": 1980
},
{
"epoch": 0.1809090909090909,
"grad_norm": 350021413240832.0,
"learning_rate": 9.214739259206423e-07,
"loss": 26.701983642578124,
"step": 1990
},
{
"epoch": 0.18181818181818182,
"grad_norm": 183938400124928.0,
"learning_rate": 9.207039525881117e-07,
"loss": 26.423245239257813,
"step": 2000
},
{
"epoch": 0.18181818181818182,
"eval_loss": 26.24828338623047,
"eval_runtime": 2.1786,
"eval_samples_per_second": 16.525,
"eval_steps_per_second": 0.918,
"step": 2000
},
{
"epoch": 0.18272727272727274,
"grad_norm": 112341303689216.0,
"learning_rate": 9.199305477028869e-07,
"loss": 26.8008544921875,
"step": 2010
},
{
"epoch": 0.18363636363636363,
"grad_norm": 637360597368832.0,
"learning_rate": 9.19153717573394e-07,
"loss": 26.559991455078126,
"step": 2020
},
{
"epoch": 0.18454545454545454,
"grad_norm": 223046627491840.0,
"learning_rate": 9.183734685359972e-07,
"loss": 27.215188598632814,
"step": 2030
},
{
"epoch": 0.18545454545454546,
"grad_norm": 328656333307904.0,
"learning_rate": 9.175898069549476e-07,
"loss": 26.71053466796875,
"step": 2040
},
{
"epoch": 0.18636363636363637,
"grad_norm": 33982888542208.0,
"learning_rate": 9.168027392223319e-07,
"loss": 26.33394775390625,
"step": 2050
},
{
"epoch": 0.18727272727272729,
"grad_norm": 331992918917120.0,
"learning_rate": 9.160122717580194e-07,
"loss": 26.599868774414062,
"step": 2060
},
{
"epoch": 0.18818181818181817,
"grad_norm": 421506446262272.0,
"learning_rate": 9.152184110096097e-07,
"loss": 26.47528991699219,
"step": 2070
},
{
"epoch": 0.1890909090909091,
"grad_norm": 62027108188160.0,
"learning_rate": 9.144211634523808e-07,
"loss": 26.586676025390624,
"step": 2080
},
{
"epoch": 0.19,
"grad_norm": 217145141100544.0,
"learning_rate": 9.13620535589236e-07,
"loss": 26.263406372070314,
"step": 2090
},
{
"epoch": 0.19090909090909092,
"grad_norm": 198046679826432.0,
"learning_rate": 9.128165339506502e-07,
"loss": 26.48536071777344,
"step": 2100
},
{
"epoch": 0.19090909090909092,
"eval_loss": 26.25433921813965,
"eval_runtime": 2.1826,
"eval_samples_per_second": 16.494,
"eval_steps_per_second": 0.916,
"step": 2100
},
{
"epoch": 0.1918181818181818,
"grad_norm": 250411474747392.0,
"learning_rate": 9.120091650946171e-07,
"loss": 26.85694580078125,
"step": 2110
},
{
"epoch": 0.19272727272727272,
"grad_norm": 233058666020864.0,
"learning_rate": 9.111984356065966e-07,
"loss": 26.57982482910156,
"step": 2120
},
{
"epoch": 0.19363636363636363,
"grad_norm": 434236226011136.0,
"learning_rate": 9.103843520994592e-07,
"loss": 26.723846435546875,
"step": 2130
},
{
"epoch": 0.19454545454545455,
"grad_norm": 255379644612608.0,
"learning_rate": 9.095669212134339e-07,
"loss": 26.313885498046876,
"step": 2140
},
{
"epoch": 0.19545454545454546,
"grad_norm": 256500161314816.0,
"learning_rate": 9.087461496160528e-07,
"loss": 26.731137084960938,
"step": 2150
},
{
"epoch": 0.19636363636363635,
"grad_norm": 75034982875136.0,
"learning_rate": 9.079220440020972e-07,
"loss": 26.968045043945313,
"step": 2160
},
{
"epoch": 0.19727272727272727,
"grad_norm": 214327659331584.0,
"learning_rate": 9.070946110935431e-07,
"loss": 26.61375732421875,
"step": 2170
},
{
"epoch": 0.19818181818181818,
"grad_norm": 298347621515264.0,
"learning_rate": 9.062638576395061e-07,
"loss": 26.472616577148436,
"step": 2180
},
{
"epoch": 0.1990909090909091,
"grad_norm": 269609089368064.0,
"learning_rate": 9.054297904161867e-07,
"loss": 26.377481079101564,
"step": 2190
},
{
"epoch": 0.2,
"grad_norm": 162536846524416.0,
"learning_rate": 9.045924162268144e-07,
"loss": 26.407989501953125,
"step": 2200
},
{
"epoch": 0.2,
"eval_loss": 26.259925842285156,
"eval_runtime": 2.1531,
"eval_samples_per_second": 16.72,
"eval_steps_per_second": 0.929,
"step": 2200
},
{
"epoch": 0.2009090909090909,
"grad_norm": 115766942760960.0,
"learning_rate": 9.037517419015928e-07,
"loss": 26.59142150878906,
"step": 2210
},
{
"epoch": 0.2018181818181818,
"grad_norm": 171738931396608.0,
"learning_rate": 9.029077742976437e-07,
"loss": 26.167340087890626,
"step": 2220
},
{
"epoch": 0.20272727272727273,
"grad_norm": 177394665127936.0,
"learning_rate": 9.020605202989513e-07,
"loss": 26.530194091796876,
"step": 2230
},
{
"epoch": 0.20363636363636364,
"grad_norm": 194902461775872.0,
"learning_rate": 9.012099868163056e-07,
"loss": 26.333233642578126,
"step": 2240
},
{
"epoch": 0.20454545454545456,
"grad_norm": 117599643893760.0,
"learning_rate": 9.003561807872469e-07,
"loss": 26.445736694335938,
"step": 2250
},
{
"epoch": 0.20545454545454545,
"grad_norm": 357074051530752.0,
"learning_rate": 8.994991091760076e-07,
"loss": 26.198593139648438,
"step": 2260
},
{
"epoch": 0.20636363636363636,
"grad_norm": 181432488034304.0,
"learning_rate": 8.986387789734576e-07,
"loss": 26.502377319335938,
"step": 2270
},
{
"epoch": 0.20727272727272728,
"grad_norm": 121382704775168.0,
"learning_rate": 8.977751971970456e-07,
"loss": 26.578610229492188,
"step": 2280
},
{
"epoch": 0.2081818181818182,
"grad_norm": 163190151315456.0,
"learning_rate": 8.969083708907424e-07,
"loss": 26.57227783203125,
"step": 2290
},
{
"epoch": 0.20909090909090908,
"grad_norm": 231256457478144.0,
"learning_rate": 8.960383071249835e-07,
"loss": 26.235324096679687,
"step": 2300
},
{
"epoch": 0.20909090909090908,
"eval_loss": 26.264249801635742,
"eval_runtime": 2.1434,
"eval_samples_per_second": 16.795,
"eval_steps_per_second": 0.933,
"step": 2300
},
{
"epoch": 0.21,
"grad_norm": 78548240957440.0,
"learning_rate": 8.951650129966112e-07,
"loss": 26.32378234863281,
"step": 2310
},
{
"epoch": 0.2109090909090909,
"grad_norm": 134709585641472.0,
"learning_rate": 8.942884956288171e-07,
"loss": 26.452862548828126,
"step": 2320
},
{
"epoch": 0.21181818181818182,
"grad_norm": 159890257477632.0,
"learning_rate": 8.934087621710835e-07,
"loss": 26.528851318359376,
"step": 2330
},
{
"epoch": 0.21272727272727274,
"grad_norm": 226478155366400.0,
"learning_rate": 8.925258197991258e-07,
"loss": 26.547454833984375,
"step": 2340
},
{
"epoch": 0.21363636363636362,
"grad_norm": 149927023869952.0,
"learning_rate": 8.91639675714833e-07,
"loss": 26.65885009765625,
"step": 2350
},
{
"epoch": 0.21454545454545454,
"grad_norm": 175921508122624.0,
"learning_rate": 8.907503371462099e-07,
"loss": 26.4728759765625,
"step": 2360
},
{
"epoch": 0.21545454545454545,
"grad_norm": 496517009899520.0,
"learning_rate": 8.898578113473176e-07,
"loss": 26.380712890625,
"step": 2370
},
{
"epoch": 0.21636363636363637,
"grad_norm": 200518936821760.0,
"learning_rate": 8.889621055982144e-07,
"loss": 26.421420288085937,
"step": 2380
},
{
"epoch": 0.21727272727272728,
"grad_norm": 296245033697280.0,
"learning_rate": 8.880632272048962e-07,
"loss": 26.7625,
"step": 2390
},
{
"epoch": 0.21818181818181817,
"grad_norm": 208807686832128.0,
"learning_rate": 8.871611834992379e-07,
"loss": 26.544375610351562,
"step": 2400
},
{
"epoch": 0.21818181818181817,
"eval_loss": 26.264915466308594,
"eval_runtime": 2.1775,
"eval_samples_per_second": 16.533,
"eval_steps_per_second": 0.919,
"step": 2400
},
{
"epoch": 0.2190909090909091,
"grad_norm": 97186075377664.0,
"learning_rate": 8.862559818389321e-07,
"loss": 26.632290649414063,
"step": 2410
},
{
"epoch": 0.22,
"grad_norm": 95127074766848.0,
"learning_rate": 8.853476296074305e-07,
"loss": 26.469677734375,
"step": 2420
},
{
"epoch": 0.22090909090909092,
"grad_norm": 169245870653440.0,
"learning_rate": 8.844361342138827e-07,
"loss": 26.505831909179687,
"step": 2430
},
{
"epoch": 0.22181818181818183,
"grad_norm": 80585565405184.0,
"learning_rate": 8.835215030930761e-07,
"loss": 26.473162841796874,
"step": 2440
},
{
"epoch": 0.22272727272727272,
"grad_norm": 153268575535104.0,
"learning_rate": 8.82603743705375e-07,
"loss": 26.681747436523438,
"step": 2450
},
{
"epoch": 0.22363636363636363,
"grad_norm": 302406063620096.0,
"learning_rate": 8.81682863536661e-07,
"loss": 26.393963623046876,
"step": 2460
},
{
"epoch": 0.22454545454545455,
"grad_norm": 378542881767424.0,
"learning_rate": 8.807588700982699e-07,
"loss": 26.446267700195314,
"step": 2470
},
{
"epoch": 0.22545454545454546,
"grad_norm": 74014231887872.0,
"learning_rate": 8.798317709269318e-07,
"loss": 26.500537109375,
"step": 2480
},
{
"epoch": 0.22636363636363635,
"grad_norm": 137670193840128.0,
"learning_rate": 8.789015735847098e-07,
"loss": 26.38458251953125,
"step": 2490
},
{
"epoch": 0.22727272727272727,
"grad_norm": 73747843252224.0,
"learning_rate": 8.779682856589367e-07,
"loss": 26.658016967773438,
"step": 2500
},
{
"epoch": 0.22727272727272727,
"eval_loss": 26.27655601501465,
"eval_runtime": 2.1255,
"eval_samples_per_second": 16.937,
"eval_steps_per_second": 0.941,
"step": 2500
},
{
"epoch": 0.22818181818181818,
"grad_norm": 169870687731712.0,
"learning_rate": 8.770319147621557e-07,
"loss": 26.00334777832031,
"step": 2510
},
{
"epoch": 0.2290909090909091,
"grad_norm": 220424013086720.0,
"learning_rate": 8.760924685320557e-07,
"loss": 26.501443481445314,
"step": 2520
},
{
"epoch": 0.23,
"grad_norm": 249421635780608.0,
"learning_rate": 8.751499546314105e-07,
"loss": 27.010458374023436,
"step": 2530
},
{
"epoch": 0.2309090909090909,
"grad_norm": 613644459048960.0,
"learning_rate": 8.742043807480162e-07,
"loss": 26.20653381347656,
"step": 2540
},
{
"epoch": 0.2318181818181818,
"grad_norm": 122649023873024.0,
"learning_rate": 8.732557545946278e-07,
"loss": 26.27606201171875,
"step": 2550
},
{
"epoch": 0.23272727272727273,
"grad_norm": 194680549539840.0,
"learning_rate": 8.723040839088969e-07,
"loss": 26.106411743164063,
"step": 2560
},
{
"epoch": 0.23363636363636364,
"grad_norm": 162525438017536.0,
"learning_rate": 8.713493764533088e-07,
"loss": 26.558633422851564,
"step": 2570
},
{
"epoch": 0.23454545454545456,
"grad_norm": 340285393469440.0,
"learning_rate": 8.703916400151183e-07,
"loss": 26.410125732421875,
"step": 2580
},
{
"epoch": 0.23545454545454544,
"grad_norm": 283816975400960.0,
"learning_rate": 8.694308824062867e-07,
"loss": 26.62397155761719,
"step": 2590
},
{
"epoch": 0.23636363636363636,
"grad_norm": 173412811014144.0,
"learning_rate": 8.684671114634183e-07,
"loss": 26.37889404296875,
"step": 2600
},
{
"epoch": 0.23636363636363636,
"eval_loss": 26.274354934692383,
"eval_runtime": 2.1979,
"eval_samples_per_second": 16.379,
"eval_steps_per_second": 0.91,
"step": 2600
},
{
"epoch": 0.23727272727272727,
"grad_norm": 403591802126336.0,
"learning_rate": 8.675003350476961e-07,
"loss": 26.8667724609375,
"step": 2610
},
{
"epoch": 0.2381818181818182,
"grad_norm": 410402512961536.0,
"learning_rate": 8.66530561044818e-07,
"loss": 26.452142333984376,
"step": 2620
},
{
"epoch": 0.2390909090909091,
"grad_norm": 256499339231232.0,
"learning_rate": 8.655577973649321e-07,
"loss": 26.704440307617187,
"step": 2630
},
{
"epoch": 0.24,
"grad_norm": 154109130833920.0,
"learning_rate": 8.645820519425722e-07,
"loss": 26.33248291015625,
"step": 2640
},
{
"epoch": 0.2409090909090909,
"grad_norm": 151869708042240.0,
"learning_rate": 8.636033327365937e-07,
"loss": 26.74834289550781,
"step": 2650
},
{
"epoch": 0.24181818181818182,
"grad_norm": 178563550543872.0,
"learning_rate": 8.626216477301081e-07,
"loss": 26.612823486328125,
"step": 2660
},
{
"epoch": 0.24272727272727274,
"grad_norm": 589687735451648.0,
"learning_rate": 8.616370049304175e-07,
"loss": 26.485858154296874,
"step": 2670
},
{
"epoch": 0.24363636363636362,
"grad_norm": 126366955601920.0,
"learning_rate": 8.606494123689508e-07,
"loss": 26.799853515625,
"step": 2680
},
{
"epoch": 0.24454545454545454,
"grad_norm": 293970680741888.0,
"learning_rate": 8.596588781011963e-07,
"loss": 26.99022216796875,
"step": 2690
},
{
"epoch": 0.24545454545454545,
"grad_norm": 325949295951872.0,
"learning_rate": 8.586654102066374e-07,
"loss": 26.54841003417969,
"step": 2700
},
{
"epoch": 0.24545454545454545,
"eval_loss": 26.278873443603516,
"eval_runtime": 2.1755,
"eval_samples_per_second": 16.548,
"eval_steps_per_second": 0.919,
"step": 2700
},
{
"epoch": 0.24636363636363637,
"grad_norm": 201556976730112.0,
"learning_rate": 8.576690167886859e-07,
"loss": 27.091287231445314,
"step": 2710
},
{
"epoch": 0.24727272727272728,
"grad_norm": 215123755008000.0,
"learning_rate": 8.566697059746166e-07,
"loss": 26.405868530273438,
"step": 2720
},
{
"epoch": 0.24818181818181817,
"grad_norm": 61814981263360.0,
"learning_rate": 8.556674859155e-07,
"loss": 26.49742431640625,
"step": 2730
},
{
"epoch": 0.24909090909090909,
"grad_norm": 541660068970496.0,
"learning_rate": 8.546623647861369e-07,
"loss": 26.604754638671874,
"step": 2740
},
{
"epoch": 0.25,
"grad_norm": 245383997423616.0,
"learning_rate": 8.536543507849911e-07,
"loss": 26.275985717773438,
"step": 2750
},
{
"epoch": 0.2509090909090909,
"grad_norm": 257058859384832.0,
"learning_rate": 8.526434521341226e-07,
"loss": 26.059185791015626,
"step": 2760
},
{
"epoch": 0.25181818181818183,
"grad_norm": 105797333811200.0,
"learning_rate": 8.516296770791207e-07,
"loss": 26.59859619140625,
"step": 2770
},
{
"epoch": 0.25272727272727274,
"grad_norm": 389504846266368.0,
"learning_rate": 8.506130338890365e-07,
"loss": 26.815679931640624,
"step": 2780
},
{
"epoch": 0.25363636363636366,
"grad_norm": 743835453882368.0,
"learning_rate": 8.495935308563158e-07,
"loss": 26.77921142578125,
"step": 2790
},
{
"epoch": 0.2545454545454545,
"grad_norm": 407944348827648.0,
"learning_rate": 8.485711762967312e-07,
"loss": 26.425018310546875,
"step": 2800
},
{
"epoch": 0.2545454545454545,
"eval_loss": 26.285329818725586,
"eval_runtime": 2.1772,
"eval_samples_per_second": 16.535,
"eval_steps_per_second": 0.919,
"step": 2800
},
{
"epoch": 0.25545454545454543,
"grad_norm": 130364764848128.0,
"learning_rate": 8.47545978549314e-07,
"loss": 26.41048583984375,
"step": 2810
},
{
"epoch": 0.25636363636363635,
"grad_norm": 298329401458688.0,
"learning_rate": 8.46517945976287e-07,
"loss": 26.619390869140624,
"step": 2820
},
{
"epoch": 0.25727272727272726,
"grad_norm": 339704666914816.0,
"learning_rate": 8.454870869629955e-07,
"loss": 26.60906982421875,
"step": 2830
},
{
"epoch": 0.2581818181818182,
"grad_norm": 271155025936384.0,
"learning_rate": 8.444534099178393e-07,
"loss": 26.500982666015624,
"step": 2840
},
{
"epoch": 0.2590909090909091,
"grad_norm": 186096268869632.0,
"learning_rate": 8.434169232722041e-07,
"loss": 26.400274658203124,
"step": 2850
},
{
"epoch": 0.26,
"grad_norm": 317373085122560.0,
"learning_rate": 8.423776354803925e-07,
"loss": 26.17232666015625,
"step": 2860
},
{
"epoch": 0.2609090909090909,
"grad_norm": 180556801245184.0,
"learning_rate": 8.41335555019555e-07,
"loss": 26.4723388671875,
"step": 2870
},
{
"epoch": 0.26181818181818184,
"grad_norm": 422898518982656.0,
"learning_rate": 8.402906903896216e-07,
"loss": 26.127191162109376,
"step": 2880
},
{
"epoch": 0.26272727272727275,
"grad_norm": 120484511350784.0,
"learning_rate": 8.392430501132316e-07,
"loss": 26.270956420898436,
"step": 2890
},
{
"epoch": 0.2636363636363636,
"grad_norm": 377708114608128.0,
"learning_rate": 8.381926427356642e-07,
"loss": 26.302716064453126,
"step": 2900
},
{
"epoch": 0.2636363636363636,
"eval_loss": 26.290285110473633,
"eval_runtime": 2.1968,
"eval_samples_per_second": 16.387,
"eval_steps_per_second": 0.91,
"step": 2900
},
{
"epoch": 0.26454545454545453,
"grad_norm": 66593149157376.0,
"learning_rate": 8.37139476824769e-07,
"loss": 26.445266723632812,
"step": 2910
},
{
"epoch": 0.26545454545454544,
"grad_norm": 244639290359808.0,
"learning_rate": 8.360835609708967e-07,
"loss": 26.76466064453125,
"step": 2920
},
{
"epoch": 0.26636363636363636,
"grad_norm": 69483725062144.0,
"learning_rate": 8.35024903786828e-07,
"loss": 26.618536376953124,
"step": 2930
},
{
"epoch": 0.2672727272727273,
"grad_norm": 64039967260672.0,
"learning_rate": 8.339635139077035e-07,
"loss": 26.7822509765625,
"step": 2940
},
{
"epoch": 0.2681818181818182,
"grad_norm": 50360261541888.0,
"learning_rate": 8.32899399990954e-07,
"loss": 26.592672729492186,
"step": 2950
},
{
"epoch": 0.2690909090909091,
"grad_norm": 132060790390784.0,
"learning_rate": 8.318325707162293e-07,
"loss": 26.633670043945312,
"step": 2960
},
{
"epoch": 0.27,
"grad_norm": 218504011710464.0,
"learning_rate": 8.307630347853273e-07,
"loss": 26.65269775390625,
"step": 2970
},
{
"epoch": 0.27090909090909093,
"grad_norm": 507351366893568.0,
"learning_rate": 8.296908009221242e-07,
"loss": 26.866940307617188,
"step": 2980
},
{
"epoch": 0.2718181818181818,
"grad_norm": 135992195416064.0,
"learning_rate": 8.286158778725011e-07,
"loss": 26.601791381835938,
"step": 2990
},
{
"epoch": 0.2727272727272727,
"grad_norm": 107224361861120.0,
"learning_rate": 8.275382744042747e-07,
"loss": 26.53394775390625,
"step": 3000
},
{
"epoch": 0.2727272727272727,
"eval_loss": 26.28925895690918,
"eval_runtime": 2.1694,
"eval_samples_per_second": 16.594,
"eval_steps_per_second": 0.922,
"step": 3000
},
{
"epoch": 0.2736363636363636,
"grad_norm": 250829109985280.0,
"learning_rate": 8.26457999307125e-07,
"loss": 26.413397216796874,
"step": 3010
},
{
"epoch": 0.27454545454545454,
"grad_norm": 200123464286208.0,
"learning_rate": 8.253750613925234e-07,
"loss": 26.551190185546876,
"step": 3020
},
{
"epoch": 0.27545454545454545,
"grad_norm": 155917513392128.0,
"learning_rate": 8.242894694936614e-07,
"loss": 26.570632934570312,
"step": 3030
},
{
"epoch": 0.27636363636363637,
"grad_norm": 310338935324672.0,
"learning_rate": 8.23201232465378e-07,
"loss": 26.380291748046876,
"step": 3040
},
{
"epoch": 0.2772727272727273,
"grad_norm": 451766000812032.0,
"learning_rate": 8.221103591840881e-07,
"loss": 26.767218017578124,
"step": 3050
},
{
"epoch": 0.2781818181818182,
"grad_norm": 670432516636672.0,
"learning_rate": 8.210168585477091e-07,
"loss": 26.689630126953126,
"step": 3060
},
{
"epoch": 0.2790909090909091,
"grad_norm": 780793781682176.0,
"learning_rate": 8.199207394755891e-07,
"loss": 26.209368896484374,
"step": 3070
},
{
"epoch": 0.28,
"grad_norm": 277071863480320.0,
"learning_rate": 8.188220109084346e-07,
"loss": 26.90129699707031,
"step": 3080
},
{
"epoch": 0.2809090909090909,
"grad_norm": 155063083335680.0,
"learning_rate": 8.17720681808236e-07,
"loss": 26.374737548828126,
"step": 3090
},
{
"epoch": 0.2818181818181818,
"grad_norm": 81363449413632.0,
"learning_rate": 8.16616761158196e-07,
"loss": 26.9926025390625,
"step": 3100
},
{
"epoch": 0.2818181818181818,
"eval_loss": 26.293399810791016,
"eval_runtime": 2.1716,
"eval_samples_per_second": 16.578,
"eval_steps_per_second": 0.921,
"step": 3100
},
{
"epoch": 0.2827272727272727,
"grad_norm": 400066036629504.0,
"learning_rate": 8.155102579626558e-07,
"loss": 26.3140869140625,
"step": 3110
},
{
"epoch": 0.28363636363636363,
"grad_norm": 601325620428800.0,
"learning_rate": 8.144011812470215e-07,
"loss": 26.391494750976562,
"step": 3120
},
{
"epoch": 0.28454545454545455,
"grad_norm": 109938688917504.0,
"learning_rate": 8.132895400576904e-07,
"loss": 26.92082824707031,
"step": 3130
},
{
"epoch": 0.28545454545454546,
"grad_norm": 266716630220800.0,
"learning_rate": 8.121753434619778e-07,
"loss": 26.403421020507814,
"step": 3140
},
{
"epoch": 0.2863636363636364,
"grad_norm": 200120947703808.0,
"learning_rate": 8.110586005480426e-07,
"loss": 26.437249755859376,
"step": 3150
},
{
"epoch": 0.2872727272727273,
"grad_norm": 313903590408192.0,
"learning_rate": 8.09939320424813e-07,
"loss": 26.701492309570312,
"step": 3160
},
{
"epoch": 0.2881818181818182,
"grad_norm": 274488625201152.0,
"learning_rate": 8.088175122219127e-07,
"loss": 26.449929809570314,
"step": 3170
},
{
"epoch": 0.28909090909090907,
"grad_norm": 311552834011136.0,
"learning_rate": 8.076931850895858e-07,
"loss": 26.431442260742188,
"step": 3180
},
{
"epoch": 0.29,
"grad_norm": 113313451081728.0,
"learning_rate": 8.065663481986229e-07,
"loss": 26.6109375,
"step": 3190
},
{
"epoch": 0.2909090909090909,
"grad_norm": 60781395705856.0,
"learning_rate": 8.054370107402858e-07,
"loss": 26.43651123046875,
"step": 3200
},
{
"epoch": 0.2909090909090909,
"eval_loss": 26.294445037841797,
"eval_runtime": 2.1783,
"eval_samples_per_second": 16.527,
"eval_steps_per_second": 0.918,
"step": 3200
},
{
"epoch": 0.2918181818181818,
"grad_norm": 314161556881408.0,
"learning_rate": 8.043051819262327e-07,
"loss": 26.8575927734375,
"step": 3210
},
{
"epoch": 0.2927272727272727,
"grad_norm": 182461468246016.0,
"learning_rate": 8.031708709884429e-07,
"loss": 26.727423095703124,
"step": 3220
},
{
"epoch": 0.29363636363636364,
"grad_norm": 379359831523328.0,
"learning_rate": 8.020340871791417e-07,
"loss": 26.894467163085938,
"step": 3230
},
{
"epoch": 0.29454545454545455,
"grad_norm": 188435230883840.0,
"learning_rate": 8.008948397707252e-07,
"loss": 26.7364501953125,
"step": 3240
},
{
"epoch": 0.29545454545454547,
"grad_norm": 217839180972032.0,
"learning_rate": 7.997531380556833e-07,
"loss": 27.044821166992186,
"step": 3250
},
{
"epoch": 0.2963636363636364,
"grad_norm": 439279960457216.0,
"learning_rate": 7.986089913465261e-07,
"loss": 27.168972778320313,
"step": 3260
},
{
"epoch": 0.2972727272727273,
"grad_norm": 511028429324288.0,
"learning_rate": 7.974624089757064e-07,
"loss": 26.454971313476562,
"step": 3270
},
{
"epoch": 0.29818181818181816,
"grad_norm": 207939264577536.0,
"learning_rate": 7.963134002955431e-07,
"loss": 26.525775146484374,
"step": 3280
},
{
"epoch": 0.2990909090909091,
"grad_norm": 208529084383232.0,
"learning_rate": 7.951619746781472e-07,
"loss": 26.71766052246094,
"step": 3290
},
{
"epoch": 0.3,
"grad_norm": 206016511737856.0,
"learning_rate": 7.940081415153428e-07,
"loss": 26.513632202148436,
"step": 3300
},
{
"epoch": 0.3,
"eval_loss": 26.295894622802734,
"eval_runtime": 2.1954,
"eval_samples_per_second": 16.398,
"eval_steps_per_second": 0.911,
"step": 3300
},
{
"epoch": 0.3009090909090909,
"grad_norm": 332793997426688.0,
"learning_rate": 7.928519102185922e-07,
"loss": 26.628378295898436,
"step": 3310
},
{
"epoch": 0.3018181818181818,
"grad_norm": 154984314306560.0,
"learning_rate": 7.91693290218918e-07,
"loss": 26.92239990234375,
"step": 3320
},
{
"epoch": 0.30272727272727273,
"grad_norm": 476788446724096.0,
"learning_rate": 7.905322909668272e-07,
"loss": 26.61595458984375,
"step": 3330
},
{
"epoch": 0.30363636363636365,
"grad_norm": 133899782979584.0,
"learning_rate": 7.893689219322336e-07,
"loss": 26.795391845703126,
"step": 3340
},
{
"epoch": 0.30454545454545456,
"grad_norm": 344084459814912.0,
"learning_rate": 7.882031926043803e-07,
"loss": 26.53829345703125,
"step": 3350
},
{
"epoch": 0.3054545454545455,
"grad_norm": 311329596375040.0,
"learning_rate": 7.870351124917629e-07,
"loss": 26.523876953125,
"step": 3360
},
{
"epoch": 0.30636363636363634,
"grad_norm": 250105961644032.0,
"learning_rate": 7.858646911220512e-07,
"loss": 26.561294555664062,
"step": 3370
},
{
"epoch": 0.30727272727272725,
"grad_norm": 437876244348928.0,
"learning_rate": 7.846919380420125e-07,
"loss": 26.296853637695314,
"step": 3380
},
{
"epoch": 0.30818181818181817,
"grad_norm": 95527110705152.0,
"learning_rate": 7.835168628174325e-07,
"loss": 26.440118408203126,
"step": 3390
},
{
"epoch": 0.3090909090909091,
"grad_norm": 430297875218432.0,
"learning_rate": 7.823394750330386e-07,
"loss": 26.513848876953126,
"step": 3400
},
{
"epoch": 0.3090909090909091,
"eval_loss": 26.305095672607422,
"eval_runtime": 2.2077,
"eval_samples_per_second": 16.306,
"eval_steps_per_second": 0.906,
"step": 3400
},
{
"epoch": 0.31,
"grad_norm": 275231235112960.0,
"learning_rate": 7.811597842924203e-07,
"loss": 26.568258666992186,
"step": 3410
},
{
"epoch": 0.3109090909090909,
"grad_norm": 61766851624960.0,
"learning_rate": 7.799778002179523e-07,
"loss": 26.591436767578124,
"step": 3420
},
{
"epoch": 0.3118181818181818,
"grad_norm": 171613068722176.0,
"learning_rate": 7.787935324507149e-07,
"loss": 26.577957153320312,
"step": 3430
},
{
"epoch": 0.31272727272727274,
"grad_norm": 98493926473728.0,
"learning_rate": 7.776069906504159e-07,
"loss": 26.6580810546875,
"step": 3440
},
{
"epoch": 0.31363636363636366,
"grad_norm": 210570502471680.0,
"learning_rate": 7.764181844953116e-07,
"loss": 26.625430297851562,
"step": 3450
},
{
"epoch": 0.3145454545454546,
"grad_norm": 607846186090496.0,
"learning_rate": 7.752271236821282e-07,
"loss": 26.528323364257812,
"step": 3460
},
{
"epoch": 0.31545454545454543,
"grad_norm": 99906945548288.0,
"learning_rate": 7.74033817925982e-07,
"loss": 26.469485473632812,
"step": 3470
},
{
"epoch": 0.31636363636363635,
"grad_norm": 427087051620352.0,
"learning_rate": 7.728382769603011e-07,
"loss": 26.360140991210937,
"step": 3480
},
{
"epoch": 0.31727272727272726,
"grad_norm": 381776925032448.0,
"learning_rate": 7.716405105367452e-07,
"loss": 26.503359985351562,
"step": 3490
},
{
"epoch": 0.3181818181818182,
"grad_norm": 182264772165632.0,
"learning_rate": 7.704405284251267e-07,
"loss": 26.577252197265626,
"step": 3500
},
{
"epoch": 0.3181818181818182,
"eval_loss": 26.30978012084961,
"eval_runtime": 2.1792,
"eval_samples_per_second": 16.52,
"eval_steps_per_second": 0.918,
"step": 3500
},
{
"epoch": 0.3190909090909091,
"grad_norm": 670108246605824.0,
"learning_rate": 7.6923834041333e-07,
"loss": 26.706155395507814,
"step": 3510
},
{
"epoch": 0.32,
"grad_norm": 238060792971264.0,
"learning_rate": 7.680339563072333e-07,
"loss": 26.262576293945312,
"step": 3520
},
{
"epoch": 0.3209090909090909,
"grad_norm": 155890619514880.0,
"learning_rate": 7.668273859306269e-07,
"loss": 26.701010131835936,
"step": 3530
},
{
"epoch": 0.32181818181818184,
"grad_norm": 474780650176512.0,
"learning_rate": 7.656186391251341e-07,
"loss": 26.277096557617188,
"step": 3540
},
{
"epoch": 0.32272727272727275,
"grad_norm": 259750327484416.0,
"learning_rate": 7.644077257501308e-07,
"loss": 26.416009521484376,
"step": 3550
},
{
"epoch": 0.3236363636363636,
"grad_norm": 122697400975360.0,
"learning_rate": 7.631946556826647e-07,
"loss": 26.900396728515624,
"step": 3560
},
{
"epoch": 0.3245454545454545,
"grad_norm": 161570713763840.0,
"learning_rate": 7.619794388173751e-07,
"loss": 26.507833862304686,
"step": 3570
},
{
"epoch": 0.32545454545454544,
"grad_norm": 156743237632000.0,
"learning_rate": 7.60762085066412e-07,
"loss": 26.481048583984375,
"step": 3580
},
{
"epoch": 0.32636363636363636,
"grad_norm": 90183047315456.0,
"learning_rate": 7.595426043593556e-07,
"loss": 26.5598388671875,
"step": 3590
},
{
"epoch": 0.32727272727272727,
"grad_norm": 211007414730752.0,
"learning_rate": 7.583210066431346e-07,
"loss": 26.310043334960938,
"step": 3600
},
{
"epoch": 0.32727272727272727,
"eval_loss": 26.316513061523438,
"eval_runtime": 2.2093,
"eval_samples_per_second": 16.295,
"eval_steps_per_second": 0.905,
"step": 3600
},
{
"epoch": 0.3281818181818182,
"grad_norm": 259587185836032.0,
"learning_rate": 7.570973018819458e-07,
"loss": 26.695498657226562,
"step": 3610
},
{
"epoch": 0.3290909090909091,
"grad_norm": 301688703418368.0,
"learning_rate": 7.558715000571725e-07,
"loss": 26.712783813476562,
"step": 3620
},
{
"epoch": 0.33,
"grad_norm": 193671836205056.0,
"learning_rate": 7.546436111673027e-07,
"loss": 26.51964111328125,
"step": 3630
},
{
"epoch": 0.33090909090909093,
"grad_norm": 293623694360576.0,
"learning_rate": 7.534136452278486e-07,
"loss": 26.735067749023436,
"step": 3640
},
{
"epoch": 0.33181818181818185,
"grad_norm": 455305724952576.0,
"learning_rate": 7.521816122712637e-07,
"loss": 26.550863647460936,
"step": 3650
},
{
"epoch": 0.3327272727272727,
"grad_norm": 272623686647808.0,
"learning_rate": 7.509475223468618e-07,
"loss": 26.944656372070312,
"step": 3660
},
{
"epoch": 0.3336363636363636,
"grad_norm": 197809852645376.0,
"learning_rate": 7.497113855207347e-07,
"loss": 26.390576171875,
"step": 3670
},
{
"epoch": 0.33454545454545453,
"grad_norm": 267426960769024.0,
"learning_rate": 7.4847321187567e-07,
"loss": 26.596539306640626,
"step": 3680
},
{
"epoch": 0.33545454545454545,
"grad_norm": 161433207701504.0,
"learning_rate": 7.472330115110696e-07,
"loss": 26.451763916015626,
"step": 3690
},
{
"epoch": 0.33636363636363636,
"grad_norm": 261230598029312.0,
"learning_rate": 7.459907945428657e-07,
"loss": 26.3410888671875,
"step": 3700
},
{
"epoch": 0.33636363636363636,
"eval_loss": 26.321983337402344,
"eval_runtime": 2.1793,
"eval_samples_per_second": 16.519,
"eval_steps_per_second": 0.918,
"step": 3700
},
{
"epoch": 0.3372727272727273,
"grad_norm": 670896171778048.0,
"learning_rate": 7.447465711034404e-07,
"loss": 26.800509643554687,
"step": 3710
},
{
"epoch": 0.3381818181818182,
"grad_norm": 534435933978624.0,
"learning_rate": 7.43500351341541e-07,
"loss": 27.05330810546875,
"step": 3720
},
{
"epoch": 0.3390909090909091,
"grad_norm": 334111713525760.0,
"learning_rate": 7.422521454221989e-07,
"loss": 26.48377685546875,
"step": 3730
},
{
"epoch": 0.34,
"grad_norm": 135815548108800.0,
"learning_rate": 7.410019635266459e-07,
"loss": 26.750677490234374,
"step": 3740
},
{
"epoch": 0.3409090909090909,
"grad_norm": 267236254154752.0,
"learning_rate": 7.397498158522306e-07,
"loss": 26.758636474609375,
"step": 3750
},
{
"epoch": 0.3418181818181818,
"grad_norm": 117738072702976.0,
"learning_rate": 7.384957126123365e-07,
"loss": 26.67991943359375,
"step": 3760
},
{
"epoch": 0.3427272727272727,
"grad_norm": 269764748378112.0,
"learning_rate": 7.37239664036298e-07,
"loss": 26.426092529296874,
"step": 3770
},
{
"epoch": 0.34363636363636363,
"grad_norm": 178870993027072.0,
"learning_rate": 7.359816803693166e-07,
"loss": 26.689065551757814,
"step": 3780
},
{
"epoch": 0.34454545454545454,
"grad_norm": 296793145344000.0,
"learning_rate": 7.347217718723783e-07,
"loss": 27.017453002929688,
"step": 3790
},
{
"epoch": 0.34545454545454546,
"grad_norm": 47316811644928.0,
"learning_rate": 7.334599488221689e-07,
"loss": 26.36324462890625,
"step": 3800
},
{
"epoch": 0.34545454545454546,
"eval_loss": 26.32639503479004,
"eval_runtime": 2.1885,
"eval_samples_per_second": 16.45,
"eval_steps_per_second": 0.914,
"step": 3800
},
{
"epoch": 0.3463636363636364,
"grad_norm": 320067808002048.0,
"learning_rate": 7.321962215109906e-07,
"loss": 26.5622314453125,
"step": 3810
},
{
"epoch": 0.3472727272727273,
"grad_norm": 124497076158464.0,
"learning_rate": 7.309306002466787e-07,
"loss": 26.740374755859374,
"step": 3820
},
{
"epoch": 0.3481818181818182,
"grad_norm": 295600755048448.0,
"learning_rate": 7.296630953525158e-07,
"loss": 26.549679565429688,
"step": 3830
},
{
"epoch": 0.3490909090909091,
"grad_norm": 140551093485568.0,
"learning_rate": 7.283937171671497e-07,
"loss": 26.60428466796875,
"step": 3840
},
{
"epoch": 0.35,
"grad_norm": 353319142817792.0,
"learning_rate": 7.271224760445079e-07,
"loss": 26.61092529296875,
"step": 3850
},
{
"epoch": 0.3509090909090909,
"grad_norm": 179919887794176.0,
"learning_rate": 7.258493823537124e-07,
"loss": 26.701296997070312,
"step": 3860
},
{
"epoch": 0.3518181818181818,
"grad_norm": 352014110294016.0,
"learning_rate": 7.245744464789973e-07,
"loss": 26.517135620117188,
"step": 3870
},
{
"epoch": 0.3527272727272727,
"grad_norm": 165838216757248.0,
"learning_rate": 7.232976788196221e-07,
"loss": 26.3676025390625,
"step": 3880
},
{
"epoch": 0.35363636363636364,
"grad_norm": 353833901359104.0,
"learning_rate": 7.220190897897877e-07,
"loss": 26.502365112304688,
"step": 3890
},
{
"epoch": 0.35454545454545455,
"grad_norm": 536120299356160.0,
"learning_rate": 7.207386898185515e-07,
"loss": 26.706195068359374,
"step": 3900
},
{
"epoch": 0.35454545454545455,
"eval_loss": 26.32856559753418,
"eval_runtime": 2.1679,
"eval_samples_per_second": 16.606,
"eval_steps_per_second": 0.923,
"step": 3900
},
{
"epoch": 0.35545454545454547,
"grad_norm": 86270919311360.0,
"learning_rate": 7.194564893497419e-07,
"loss": 26.648440551757812,
"step": 3910
},
{
"epoch": 0.3563636363636364,
"grad_norm": 95417899417600.0,
"learning_rate": 7.181724988418737e-07,
"loss": 26.289288330078126,
"step": 3920
},
{
"epoch": 0.3572727272727273,
"grad_norm": 209623965499392.0,
"learning_rate": 7.168867287680627e-07,
"loss": 26.40039978027344,
"step": 3930
},
{
"epoch": 0.35818181818181816,
"grad_norm": 221736897347584.0,
"learning_rate": 7.155991896159392e-07,
"loss": 26.791720581054687,
"step": 3940
},
{
"epoch": 0.35909090909090907,
"grad_norm": 303391758614528.0,
"learning_rate": 7.143098918875642e-07,
"loss": 26.92314758300781,
"step": 3950
},
{
"epoch": 0.36,
"grad_norm": 181569910210560.0,
"learning_rate": 7.130188460993426e-07,
"loss": 26.176397705078124,
"step": 3960
},
{
"epoch": 0.3609090909090909,
"grad_norm": 147941339693056.0,
"learning_rate": 7.117260627819376e-07,
"loss": 26.48076477050781,
"step": 3970
},
{
"epoch": 0.3618181818181818,
"grad_norm": 773203702054912.0,
"learning_rate": 7.104315524801848e-07,
"loss": 26.423046875,
"step": 3980
},
{
"epoch": 0.36272727272727273,
"grad_norm": 417831061553152.0,
"learning_rate": 7.091353257530068e-07,
"loss": 26.589743041992186,
"step": 3990
},
{
"epoch": 0.36363636363636365,
"grad_norm": 86275667263488.0,
"learning_rate": 7.078373931733258e-07,
"loss": 26.447421264648437,
"step": 4000
},
{
"epoch": 0.36363636363636365,
"eval_loss": 26.32493782043457,
"eval_runtime": 2.1966,
"eval_samples_per_second": 16.389,
"eval_steps_per_second": 0.911,
"step": 4000
},
{
"epoch": 0.36454545454545456,
"grad_norm": 526528664305664.0,
"learning_rate": 7.065377653279787e-07,
"loss": 26.51700439453125,
"step": 4010
},
{
"epoch": 0.3654545454545455,
"grad_norm": 177814212968448.0,
"learning_rate": 7.052364528176298e-07,
"loss": 26.30553283691406,
"step": 4020
},
{
"epoch": 0.3663636363636364,
"grad_norm": 95500158107648.0,
"learning_rate": 7.03933466256685e-07,
"loss": 26.378070068359374,
"step": 4030
},
{
"epoch": 0.36727272727272725,
"grad_norm": 316484127555584.0,
"learning_rate": 7.026288162732046e-07,
"loss": 26.92432556152344,
"step": 4040
},
{
"epoch": 0.36818181818181817,
"grad_norm": 296097897512960.0,
"learning_rate": 7.013225135088171e-07,
"loss": 26.409463500976564,
"step": 4050
},
{
"epoch": 0.3690909090909091,
"grad_norm": 146435114795008.0,
"learning_rate": 7.000145686186323e-07,
"loss": 26.875320434570312,
"step": 4060
},
{
"epoch": 0.37,
"grad_norm": 90155608178688.0,
"learning_rate": 6.987049922711543e-07,
"loss": 26.703628540039062,
"step": 4070
},
{
"epoch": 0.3709090909090909,
"grad_norm": 169079994318848.0,
"learning_rate": 6.973937951481943e-07,
"loss": 26.59369812011719,
"step": 4080
},
{
"epoch": 0.3718181818181818,
"grad_norm": 224013699776512.0,
"learning_rate": 6.960809879447838e-07,
"loss": 26.508026123046875,
"step": 4090
},
{
"epoch": 0.37272727272727274,
"grad_norm": 368716332138496.0,
"learning_rate": 6.947665813690871e-07,
"loss": 26.604330444335936,
"step": 4100
},
{
"epoch": 0.37272727272727274,
"eval_loss": 26.31926727294922,
"eval_runtime": 2.1723,
"eval_samples_per_second": 16.572,
"eval_steps_per_second": 0.921,
"step": 4100
},
{
"epoch": 0.37363636363636366,
"grad_norm": 416285577969664.0,
"learning_rate": 6.934505861423144e-07,
"loss": 26.69903564453125,
"step": 4110
},
{
"epoch": 0.37454545454545457,
"grad_norm": 192259412721664.0,
"learning_rate": 6.921330129986338e-07,
"loss": 26.503787231445312,
"step": 4120
},
{
"epoch": 0.37545454545454543,
"grad_norm": 605233705123840.0,
"learning_rate": 6.90813872685084e-07,
"loss": 26.778439331054688,
"step": 4130
},
{
"epoch": 0.37636363636363634,
"grad_norm": 265230370209792.0,
"learning_rate": 6.894931759614865e-07,
"loss": 27.23222961425781,
"step": 4140
},
{
"epoch": 0.37727272727272726,
"grad_norm": 423306272440320.0,
"learning_rate": 6.881709336003584e-07,
"loss": 26.96778564453125,
"step": 4150
},
{
"epoch": 0.3781818181818182,
"grad_norm": 343047359430656.0,
"learning_rate": 6.868471563868235e-07,
"loss": 26.680606079101562,
"step": 4160
},
{
"epoch": 0.3790909090909091,
"grad_norm": 266783386763264.0,
"learning_rate": 6.855218551185254e-07,
"loss": 26.349310302734374,
"step": 4170
},
{
"epoch": 0.38,
"grad_norm": 207645310976000.0,
"learning_rate": 6.841950406055389e-07,
"loss": 26.872479248046876,
"step": 4180
},
{
"epoch": 0.3809090909090909,
"grad_norm": 227184543268864.0,
"learning_rate": 6.828667236702815e-07,
"loss": 26.167431640625,
"step": 4190
},
{
"epoch": 0.38181818181818183,
"grad_norm": 332900432084992.0,
"learning_rate": 6.815369151474256e-07,
"loss": 26.787005615234374,
"step": 4200
},
{
"epoch": 0.38181818181818183,
"eval_loss": 26.321739196777344,
"eval_runtime": 2.1695,
"eval_samples_per_second": 16.594,
"eval_steps_per_second": 0.922,
"step": 4200
},
{
"epoch": 0.38272727272727275,
"grad_norm": 98059253972992.0,
"learning_rate": 6.802056258838104e-07,
"loss": 26.625421142578126,
"step": 4210
},
{
"epoch": 0.3836363636363636,
"grad_norm": 241705676701696.0,
"learning_rate": 6.788728667383528e-07,
"loss": 26.678131103515625,
"step": 4220
},
{
"epoch": 0.3845454545454545,
"grad_norm": 150195207667712.0,
"learning_rate": 6.775386485819589e-07,
"loss": 26.601348876953125,
"step": 4230
},
{
"epoch": 0.38545454545454544,
"grad_norm": 184757732245504.0,
"learning_rate": 6.762029822974359e-07,
"loss": 26.485671997070312,
"step": 4240
},
{
"epoch": 0.38636363636363635,
"grad_norm": 161859432873984.0,
"learning_rate": 6.748658787794025e-07,
"loss": 26.345684814453126,
"step": 4250
},
{
"epoch": 0.38727272727272727,
"grad_norm": 142884854562816.0,
"learning_rate": 6.735273489342008e-07,
"loss": 26.75887451171875,
"step": 4260
},
{
"epoch": 0.3881818181818182,
"grad_norm": 439033939361792.0,
"learning_rate": 6.721874036798068e-07,
"loss": 26.148809814453124,
"step": 4270
},
{
"epoch": 0.3890909090909091,
"grad_norm": 309939335593984.0,
"learning_rate": 6.708460539457417e-07,
"loss": 26.634625244140626,
"step": 4280
},
{
"epoch": 0.39,
"grad_norm": 120628896071680.0,
"learning_rate": 6.695033106729824e-07,
"loss": 26.592654418945312,
"step": 4290
},
{
"epoch": 0.39090909090909093,
"grad_norm": 194318715322368.0,
"learning_rate": 6.681591848138731e-07,
"loss": 26.4625732421875,
"step": 4300
},
{
"epoch": 0.39090909090909093,
"eval_loss": 26.325037002563477,
"eval_runtime": 2.1684,
"eval_samples_per_second": 16.602,
"eval_steps_per_second": 0.922,
"step": 4300
},
{
"epoch": 0.39181818181818184,
"grad_norm": 399684388519936.0,
"learning_rate": 6.668136873320344e-07,
"loss": 26.953164672851564,
"step": 4310
},
{
"epoch": 0.3927272727272727,
"grad_norm": 109830022889472.0,
"learning_rate": 6.654668292022754e-07,
"loss": 26.49449768066406,
"step": 4320
},
{
"epoch": 0.3936363636363636,
"grad_norm": 92155989196800.0,
"learning_rate": 6.641186214105033e-07,
"loss": 26.64600524902344,
"step": 4330
},
{
"epoch": 0.39454545454545453,
"grad_norm": 276388091265024.0,
"learning_rate": 6.627690749536346e-07,
"loss": 26.74027099609375,
"step": 4340
},
{
"epoch": 0.39545454545454545,
"grad_norm": 151451183611904.0,
"learning_rate": 6.614182008395042e-07,
"loss": 26.55115661621094,
"step": 4350
},
{
"epoch": 0.39636363636363636,
"grad_norm": 375987342671872.0,
"learning_rate": 6.600660100867765e-07,
"loss": 26.10811767578125,
"step": 4360
},
{
"epoch": 0.3972727272727273,
"grad_norm": 559519281184768.0,
"learning_rate": 6.587125137248558e-07,
"loss": 26.605978393554686,
"step": 4370
},
{
"epoch": 0.3981818181818182,
"grad_norm": 363120157523968.0,
"learning_rate": 6.573577227937951e-07,
"loss": 26.561282348632812,
"step": 4380
},
{
"epoch": 0.3990909090909091,
"grad_norm": 394054760136704.0,
"learning_rate": 6.560016483442075e-07,
"loss": 26.416183471679688,
"step": 4390
},
{
"epoch": 0.4,
"grad_norm": 291861650472960.0,
"learning_rate": 6.546443014371745e-07,
"loss": 26.458407592773437,
"step": 4400
},
{
"epoch": 0.4,
"eval_loss": 26.32141876220703,
"eval_runtime": 2.1831,
"eval_samples_per_second": 16.49,
"eval_steps_per_second": 0.916,
"step": 4400
},
{
"epoch": 0.4009090909090909,
"grad_norm": 84496426729472.0,
"learning_rate": 6.53285693144158e-07,
"loss": 26.468145751953124,
"step": 4410
},
{
"epoch": 0.4018181818181818,
"grad_norm": 190245425381376.0,
"learning_rate": 6.51925834546907e-07,
"loss": 26.321368408203124,
"step": 4420
},
{
"epoch": 0.4027272727272727,
"grad_norm": 88420181344256.0,
"learning_rate": 6.5056473673737e-07,
"loss": 26.454937744140626,
"step": 4430
},
{
"epoch": 0.4036363636363636,
"grad_norm": 332825404375040.0,
"learning_rate": 6.49202410817603e-07,
"loss": 26.5259521484375,
"step": 4440
},
{
"epoch": 0.40454545454545454,
"grad_norm": 497012105543680.0,
"learning_rate": 6.478388678996796e-07,
"loss": 26.6334228515625,
"step": 4450
},
{
"epoch": 0.40545454545454546,
"grad_norm": 96112023175168.0,
"learning_rate": 6.464741191055994e-07,
"loss": 26.60364990234375,
"step": 4460
},
{
"epoch": 0.40636363636363637,
"grad_norm": 149687059349504.0,
"learning_rate": 6.451081755671985e-07,
"loss": 26.84015808105469,
"step": 4470
},
{
"epoch": 0.4072727272727273,
"grad_norm": 78247802961920.0,
"learning_rate": 6.437410484260583e-07,
"loss": 26.285125732421875,
"step": 4480
},
{
"epoch": 0.4081818181818182,
"grad_norm": 593727554846720.0,
"learning_rate": 6.42372748833414e-07,
"loss": 26.160516357421876,
"step": 4490
},
{
"epoch": 0.4090909090909091,
"grad_norm": 153949931831296.0,
"learning_rate": 6.410032879500646e-07,
"loss": 26.74964294433594,
"step": 4500
},
{
"epoch": 0.4090909090909091,
"eval_loss": 26.31894874572754,
"eval_runtime": 2.1406,
"eval_samples_per_second": 16.818,
"eval_steps_per_second": 0.934,
"step": 4500
},
{
"epoch": 0.41,
"grad_norm": 232447153274880.0,
"learning_rate": 6.396326769462811e-07,
"loss": 26.883270263671875,
"step": 4510
},
{
"epoch": 0.4109090909090909,
"grad_norm": 298445030031360.0,
"learning_rate": 6.382609270017154e-07,
"loss": 26.760006713867188,
"step": 4520
},
{
"epoch": 0.4118181818181818,
"grad_norm": 72679117815808.0,
"learning_rate": 6.3688804930531e-07,
"loss": 26.37138671875,
"step": 4530
},
{
"epoch": 0.4127272727272727,
"grad_norm": 141969456103424.0,
"learning_rate": 6.355140550552058e-07,
"loss": 26.522723388671874,
"step": 4540
},
{
"epoch": 0.41363636363636364,
"grad_norm": 160081098309632.0,
"learning_rate": 6.341389554586511e-07,
"loss": 26.483316040039064,
"step": 4550
},
{
"epoch": 0.41454545454545455,
"grad_norm": 324477833445376.0,
"learning_rate": 6.327627617319103e-07,
"loss": 26.508364868164062,
"step": 4560
},
{
"epoch": 0.41545454545454547,
"grad_norm": 276562825969664.0,
"learning_rate": 6.313854851001721e-07,
"loss": 26.42707214355469,
"step": 4570
},
{
"epoch": 0.4163636363636364,
"grad_norm": 307064727404544.0,
"learning_rate": 6.300071367974582e-07,
"loss": 26.318887329101564,
"step": 4580
},
{
"epoch": 0.4172727272727273,
"grad_norm": 178794975461376.0,
"learning_rate": 6.286277280665315e-07,
"loss": 26.655364990234375,
"step": 4590
},
{
"epoch": 0.41818181818181815,
"grad_norm": 468974525480960.0,
"learning_rate": 6.27247270158805e-07,
"loss": 26.251632690429688,
"step": 4600
},
{
"epoch": 0.41818181818181815,
"eval_loss": 26.31459617614746,
"eval_runtime": 2.1711,
"eval_samples_per_second": 16.581,
"eval_steps_per_second": 0.921,
"step": 4600
},
{
"epoch": 0.41909090909090907,
"grad_norm": 406509628424192.0,
"learning_rate": 6.258657743342486e-07,
"loss": 26.561279296875,
"step": 4610
},
{
"epoch": 0.42,
"grad_norm": 152516016734208.0,
"learning_rate": 6.244832518612989e-07,
"loss": 26.661614990234376,
"step": 4620
},
{
"epoch": 0.4209090909090909,
"grad_norm": 334286095908864.0,
"learning_rate": 6.230997140167662e-07,
"loss": 26.73835144042969,
"step": 4630
},
{
"epoch": 0.4218181818181818,
"grad_norm": 109297497276416.0,
"learning_rate": 6.217151720857432e-07,
"loss": 26.554644775390624,
"step": 4640
},
{
"epoch": 0.42272727272727273,
"grad_norm": 251784824094720.0,
"learning_rate": 6.203296373615122e-07,
"loss": 26.43360290527344,
"step": 4650
},
{
"epoch": 0.42363636363636364,
"grad_norm": 213711767732224.0,
"learning_rate": 6.189431211454538e-07,
"loss": 26.469012451171874,
"step": 4660
},
{
"epoch": 0.42454545454545456,
"grad_norm": 119396852826112.0,
"learning_rate": 6.175556347469541e-07,
"loss": 26.383865356445312,
"step": 4670
},
{
"epoch": 0.4254545454545455,
"grad_norm": 115268542005248.0,
"learning_rate": 6.161671894833127e-07,
"loss": 26.740725708007812,
"step": 4680
},
{
"epoch": 0.4263636363636364,
"grad_norm": 311501025968128.0,
"learning_rate": 6.147777966796505e-07,
"loss": 26.425564575195313,
"step": 4690
},
{
"epoch": 0.42727272727272725,
"grad_norm": 115545743556608.0,
"learning_rate": 6.13387467668817e-07,
"loss": 26.428509521484376,
"step": 4700
},
{
"epoch": 0.42727272727272725,
"eval_loss": 26.31597137451172,
"eval_runtime": 2.1641,
"eval_samples_per_second": 16.635,
"eval_steps_per_second": 0.924,
"step": 4700
},
{
"epoch": 0.42818181818181816,
"grad_norm": 189478069075968.0,
"learning_rate": 6.119962137912979e-07,
"loss": 26.67225341796875,
"step": 4710
},
{
"epoch": 0.4290909090909091,
"grad_norm": 335568076537856.0,
"learning_rate": 6.106040463951236e-07,
"loss": 26.434231567382813,
"step": 4720
},
{
"epoch": 0.43,
"grad_norm": 208644343857152.0,
"learning_rate": 6.092109768357747e-07,
"loss": 26.637188720703126,
"step": 4730
},
{
"epoch": 0.4309090909090909,
"grad_norm": 264374128214016.0,
"learning_rate": 6.078170164760911e-07,
"loss": 26.46937255859375,
"step": 4740
},
{
"epoch": 0.4318181818181818,
"grad_norm": 281521348935680.0,
"learning_rate": 6.064221766861785e-07,
"loss": 26.524288940429688,
"step": 4750
},
{
"epoch": 0.43272727272727274,
"grad_norm": 224812597248000.0,
"learning_rate": 6.050264688433161e-07,
"loss": 26.77779541015625,
"step": 4760
},
{
"epoch": 0.43363636363636365,
"grad_norm": 225832148664320.0,
"learning_rate": 6.036299043318631e-07,
"loss": 26.691378784179687,
"step": 4770
},
{
"epoch": 0.43454545454545457,
"grad_norm": 72125075423232.0,
"learning_rate": 6.022324945431665e-07,
"loss": 26.35833740234375,
"step": 4780
},
{
"epoch": 0.4354545454545454,
"grad_norm": 279958349938688.0,
"learning_rate": 6.008342508754682e-07,
"loss": 26.597698974609376,
"step": 4790
},
{
"epoch": 0.43636363636363634,
"grad_norm": 307064257642496.0,
"learning_rate": 5.994351847338113e-07,
"loss": 26.659085083007813,
"step": 4800
},
{
"epoch": 0.43636363636363634,
"eval_loss": 26.316986083984375,
"eval_runtime": 2.1561,
"eval_samples_per_second": 16.696,
"eval_steps_per_second": 0.928,
"step": 4800
},
{
"epoch": 0.43727272727272726,
"grad_norm": 171293076881408.0,
"learning_rate": 5.980353075299481e-07,
"loss": 26.330426025390626,
"step": 4810
},
{
"epoch": 0.4381818181818182,
"grad_norm": 248409114017792.0,
"learning_rate": 5.966346306822458e-07,
"loss": 26.47012939453125,
"step": 4820
},
{
"epoch": 0.4390909090909091,
"grad_norm": 204697034031104.0,
"learning_rate": 5.95233165615595e-07,
"loss": 26.68152770996094,
"step": 4830
},
{
"epoch": 0.44,
"grad_norm": 130607472443392.0,
"learning_rate": 5.938309237613146e-07,
"loss": 26.43096923828125,
"step": 4840
},
{
"epoch": 0.4409090909090909,
"grad_norm": 296476022407168.0,
"learning_rate": 5.924279165570602e-07,
"loss": 26.51325378417969,
"step": 4850
},
{
"epoch": 0.44181818181818183,
"grad_norm": 46552391352320.0,
"learning_rate": 5.910241554467298e-07,
"loss": 26.71526184082031,
"step": 4860
},
{
"epoch": 0.44272727272727275,
"grad_norm": 97249417756672.0,
"learning_rate": 5.896196518803707e-07,
"loss": 26.19861755371094,
"step": 4870
},
{
"epoch": 0.44363636363636366,
"grad_norm": 90017338753024.0,
"learning_rate": 5.882144173140867e-07,
"loss": 26.474087524414063,
"step": 4880
},
{
"epoch": 0.4445454545454545,
"grad_norm": 518103079321600.0,
"learning_rate": 5.868084632099435e-07,
"loss": 26.318057250976562,
"step": 4890
},
{
"epoch": 0.44545454545454544,
"grad_norm": 329086534680576.0,
"learning_rate": 5.854018010358761e-07,
"loss": 26.530551147460937,
"step": 4900
},
{
"epoch": 0.44545454545454544,
"eval_loss": 26.317190170288086,
"eval_runtime": 2.1808,
"eval_samples_per_second": 16.508,
"eval_steps_per_second": 0.917,
"step": 4900
},
{
"epoch": 0.44636363636363635,
"grad_norm": 272803269967872.0,
"learning_rate": 5.839944422655952e-07,
"loss": 26.631591796875,
"step": 4910
},
{
"epoch": 0.44727272727272727,
"grad_norm": 622259425247232.0,
"learning_rate": 5.825863983784931e-07,
"loss": 26.726950073242186,
"step": 4920
},
{
"epoch": 0.4481818181818182,
"grad_norm": 186363479588864.0,
"learning_rate": 5.811776808595506e-07,
"loss": 26.2813720703125,
"step": 4930
},
{
"epoch": 0.4490909090909091,
"grad_norm": 155909409996800.0,
"learning_rate": 5.797683011992432e-07,
"loss": 26.543890380859374,
"step": 4940
},
{
"epoch": 0.45,
"grad_norm": 232914314854400.0,
"learning_rate": 5.783582708934468e-07,
"loss": 26.611404418945312,
"step": 4950
},
{
"epoch": 0.4509090909090909,
"grad_norm": 231428809818112.0,
"learning_rate": 5.769476014433451e-07,
"loss": 26.66617431640625,
"step": 4960
},
{
"epoch": 0.45181818181818184,
"grad_norm": 342491630927872.0,
"learning_rate": 5.755363043553346e-07,
"loss": 26.529336547851564,
"step": 4970
},
{
"epoch": 0.4527272727272727,
"grad_norm": 133048012111872.0,
"learning_rate": 5.741243911409314e-07,
"loss": 26.72532958984375,
"step": 4980
},
{
"epoch": 0.4536363636363636,
"grad_norm": 286773523513344.0,
"learning_rate": 5.72711873316677e-07,
"loss": 26.638458251953125,
"step": 4990
},
{
"epoch": 0.45454545454545453,
"grad_norm": 273551349252096.0,
"learning_rate": 5.712987624040451e-07,
"loss": 26.445010375976562,
"step": 5000
},
{
"epoch": 0.45454545454545453,
"eval_loss": 26.315853118896484,
"eval_runtime": 2.1781,
"eval_samples_per_second": 16.528,
"eval_steps_per_second": 0.918,
"step": 5000
},
{
"epoch": 0.45545454545454545,
"grad_norm": 80346641072128.0,
"learning_rate": 5.69885069929346e-07,
"loss": 26.32060546875,
"step": 5010
},
{
"epoch": 0.45636363636363636,
"grad_norm": 422829933723648.0,
"learning_rate": 5.684708074236349e-07,
"loss": 26.738665771484374,
"step": 5020
},
{
"epoch": 0.4572727272727273,
"grad_norm": 424351761432576.0,
"learning_rate": 5.670559864226153e-07,
"loss": 26.33757629394531,
"step": 5030
},
{
"epoch": 0.4581818181818182,
"grad_norm": 121131155587072.0,
"learning_rate": 5.656406184665472e-07,
"loss": 26.6727783203125,
"step": 5040
},
{
"epoch": 0.4590909090909091,
"grad_norm": 118593920434176.0,
"learning_rate": 5.642247151001515e-07,
"loss": 26.53905029296875,
"step": 5050
},
{
"epoch": 0.46,
"grad_norm": 74622355636224.0,
"learning_rate": 5.628082878725159e-07,
"loss": 26.59415283203125,
"step": 5060
},
{
"epoch": 0.46090909090909093,
"grad_norm": 131786524852224.0,
"learning_rate": 5.61391348337002e-07,
"loss": 26.788510131835938,
"step": 5070
},
{
"epoch": 0.4618181818181818,
"grad_norm": 196731346092032.0,
"learning_rate": 5.599739080511492e-07,
"loss": 26.669586181640625,
"step": 5080
},
{
"epoch": 0.4627272727272727,
"grad_norm": 182333021880320.0,
"learning_rate": 5.585559785765819e-07,
"loss": 26.678341674804688,
"step": 5090
},
{
"epoch": 0.4636363636363636,
"grad_norm": 352578864939008.0,
"learning_rate": 5.571375714789147e-07,
"loss": 26.814114379882813,
"step": 5100
},
{
"epoch": 0.4636363636363636,
"eval_loss": 26.3111515045166,
"eval_runtime": 2.2022,
"eval_samples_per_second": 16.348,
"eval_steps_per_second": 0.908,
"step": 5100
},
{
"epoch": 0.46454545454545454,
"grad_norm": 518492847603712.0,
"learning_rate": 5.557186983276576e-07,
"loss": 26.460382080078126,
"step": 5110
},
{
"epoch": 0.46545454545454545,
"grad_norm": 190987498422272.0,
"learning_rate": 5.542993706961225e-07,
"loss": 26.442779541015625,
"step": 5120
},
{
"epoch": 0.46636363636363637,
"grad_norm": 172608712605696.0,
"learning_rate": 5.528796001613282e-07,
"loss": 26.353005981445314,
"step": 5130
},
{
"epoch": 0.4672727272727273,
"grad_norm": 422501872041984.0,
"learning_rate": 5.514593983039058e-07,
"loss": 26.381781005859374,
"step": 5140
},
{
"epoch": 0.4681818181818182,
"grad_norm": 560177182932992.0,
"learning_rate": 5.500387767080053e-07,
"loss": 26.472189331054686,
"step": 5150
},
{
"epoch": 0.4690909090909091,
"grad_norm": 265595475984384.0,
"learning_rate": 5.486177469611998e-07,
"loss": 26.500082397460936,
"step": 5160
},
{
"epoch": 0.47,
"grad_norm": 230636791005184.0,
"learning_rate": 5.471963206543913e-07,
"loss": 26.208493041992188,
"step": 5170
},
{
"epoch": 0.4709090909090909,
"grad_norm": 236991077679104.0,
"learning_rate": 5.457745093817174e-07,
"loss": 26.544073486328124,
"step": 5180
},
{
"epoch": 0.4718181818181818,
"grad_norm": 428384232407040.0,
"learning_rate": 5.44352324740455e-07,
"loss": 26.5481201171875,
"step": 5190
},
{
"epoch": 0.4727272727272727,
"grad_norm": 211124435812352.0,
"learning_rate": 5.429297783309264e-07,
"loss": 26.475244140625,
"step": 5200
},
{
"epoch": 0.4727272727272727,
"eval_loss": 26.310951232910156,
"eval_runtime": 2.153,
"eval_samples_per_second": 16.721,
"eval_steps_per_second": 0.929,
"step": 5200
},
{
"epoch": 0.47363636363636363,
"grad_norm": 181685639446528.0,
"learning_rate": 5.415068817564053e-07,
"loss": 26.813641357421876,
"step": 5210
},
{
"epoch": 0.47454545454545455,
"grad_norm": 324085380808704.0,
"learning_rate": 5.400836466230208e-07,
"loss": 26.601318359375,
"step": 5220
},
{
"epoch": 0.47545454545454546,
"grad_norm": 476272278896640.0,
"learning_rate": 5.386600845396642e-07,
"loss": 26.603497314453126,
"step": 5230
},
{
"epoch": 0.4763636363636364,
"grad_norm": 261529517686784.0,
"learning_rate": 5.372362071178936e-07,
"loss": 26.458706665039063,
"step": 5240
},
{
"epoch": 0.4772727272727273,
"grad_norm": 607072420888576.0,
"learning_rate": 5.358120259718388e-07,
"loss": 26.715435791015626,
"step": 5250
},
{
"epoch": 0.4781818181818182,
"grad_norm": 98573517586432.0,
"learning_rate": 5.343875527181072e-07,
"loss": 26.47364501953125,
"step": 5260
},
{
"epoch": 0.47909090909090907,
"grad_norm": 135659385782272.0,
"learning_rate": 5.32962798975689e-07,
"loss": 26.717742919921875,
"step": 5270
},
{
"epoch": 0.48,
"grad_norm": 387802562822144.0,
"learning_rate": 5.315377763658617e-07,
"loss": 26.490786743164062,
"step": 5280
},
{
"epoch": 0.4809090909090909,
"grad_norm": 418252572327936.0,
"learning_rate": 5.301124965120968e-07,
"loss": 26.737353515625,
"step": 5290
},
{
"epoch": 0.4818181818181818,
"grad_norm": 214300849340416.0,
"learning_rate": 5.28686971039963e-07,
"loss": 26.633428955078124,
"step": 5300
},
{
"epoch": 0.4818181818181818,
"eval_loss": 26.304325103759766,
"eval_runtime": 2.1933,
"eval_samples_per_second": 16.414,
"eval_steps_per_second": 0.912,
"step": 5300
},
{
"epoch": 0.4827272727272727,
"grad_norm": 477280589578240.0,
"learning_rate": 5.272612115770332e-07,
"loss": 26.399496459960936,
"step": 5310
},
{
"epoch": 0.48363636363636364,
"grad_norm": 231165105537024.0,
"learning_rate": 5.258352297527887e-07,
"loss": 26.705911254882814,
"step": 5320
},
{
"epoch": 0.48454545454545456,
"grad_norm": 193821488971776.0,
"learning_rate": 5.244090371985243e-07,
"loss": 27.068051147460938,
"step": 5330
},
{
"epoch": 0.48545454545454547,
"grad_norm": 370139140718592.0,
"learning_rate": 5.229826455472541e-07,
"loss": 26.2793212890625,
"step": 5340
},
{
"epoch": 0.4863636363636364,
"grad_norm": 66449884315648.0,
"learning_rate": 5.215560664336157e-07,
"loss": 26.93189392089844,
"step": 5350
},
{
"epoch": 0.48727272727272725,
"grad_norm": 114903520116736.0,
"learning_rate": 5.201293114937759e-07,
"loss": 26.350509643554688,
"step": 5360
},
{
"epoch": 0.48818181818181816,
"grad_norm": 163418724106240.0,
"learning_rate": 5.18702392365336e-07,
"loss": 26.36776123046875,
"step": 5370
},
{
"epoch": 0.4890909090909091,
"grad_norm": 386242080407552.0,
"learning_rate": 5.172753206872362e-07,
"loss": 26.549008178710938,
"step": 5380
},
{
"epoch": 0.49,
"grad_norm": 84084361527296.0,
"learning_rate": 5.158481080996609e-07,
"loss": 26.612332153320313,
"step": 5390
},
{
"epoch": 0.4909090909090909,
"grad_norm": 408571950923776.0,
"learning_rate": 5.144207662439443e-07,
"loss": 26.4984619140625,
"step": 5400
},
{
"epoch": 0.4909090909090909,
"eval_loss": 26.30891990661621,
"eval_runtime": 2.2008,
"eval_samples_per_second": 16.358,
"eval_steps_per_second": 0.909,
"step": 5400
},
{
"epoch": 0.4918181818181818,
"grad_norm": 392391265615872.0,
"learning_rate": 5.129933067624745e-07,
"loss": 26.757540893554687,
"step": 5410
},
{
"epoch": 0.49272727272727274,
"grad_norm": 343983997845504.0,
"learning_rate": 5.115657412985993e-07,
"loss": 26.5795654296875,
"step": 5420
},
{
"epoch": 0.49363636363636365,
"grad_norm": 276295011270656.0,
"learning_rate": 5.101380814965313e-07,
"loss": 26.277252197265625,
"step": 5430
},
{
"epoch": 0.49454545454545457,
"grad_norm": 225630402641920.0,
"learning_rate": 5.087103390012517e-07,
"loss": 26.9617919921875,
"step": 5440
},
{
"epoch": 0.4954545454545455,
"grad_norm": 110936799051776.0,
"learning_rate": 5.072825254584171e-07,
"loss": 26.697900390625,
"step": 5450
},
{
"epoch": 0.49636363636363634,
"grad_norm": 429198766243840.0,
"learning_rate": 5.058546525142631e-07,
"loss": 26.221038818359375,
"step": 5460
},
{
"epoch": 0.49727272727272726,
"grad_norm": 307539992379392.0,
"learning_rate": 5.044267318155098e-07,
"loss": 26.596530151367187,
"step": 5470
},
{
"epoch": 0.49818181818181817,
"grad_norm": 377537322549248.0,
"learning_rate": 5.029987750092675e-07,
"loss": 26.367523193359375,
"step": 5480
},
{
"epoch": 0.4990909090909091,
"grad_norm": 248897851097088.0,
"learning_rate": 5.015707937429397e-07,
"loss": 26.702847290039063,
"step": 5490
},
{
"epoch": 0.5,
"grad_norm": 572252919693312.0,
"learning_rate": 5.00142799664131e-07,
"loss": 26.316940307617188,
"step": 5500
},
{
"epoch": 0.5,
"eval_loss": 26.30450439453125,
"eval_runtime": 2.1679,
"eval_samples_per_second": 16.606,
"eval_steps_per_second": 0.923,
"step": 5500
},
{
"epoch": 0.5009090909090909,
"grad_norm": 194077274406912.0,
"learning_rate": 4.987148044205492e-07,
"loss": 26.6015625,
"step": 5510
},
{
"epoch": 0.5018181818181818,
"grad_norm": 262825356296192.0,
"learning_rate": 4.972868196599125e-07,
"loss": 26.622930908203124,
"step": 5520
},
{
"epoch": 0.5027272727272727,
"grad_norm": 173687571480576.0,
"learning_rate": 4.958588570298526e-07,
"loss": 26.34784851074219,
"step": 5530
},
{
"epoch": 0.5036363636363637,
"grad_norm": 280642273148928.0,
"learning_rate": 4.944309281778223e-07,
"loss": 26.642620849609376,
"step": 5540
},
{
"epoch": 0.5045454545454545,
"grad_norm": 293827940188160.0,
"learning_rate": 4.930030447509968e-07,
"loss": 26.564447021484376,
"step": 5550
},
{
"epoch": 0.5054545454545455,
"grad_norm": 277824522944512.0,
"learning_rate": 4.915752183961826e-07,
"loss": 26.670132446289063,
"step": 5560
},
{
"epoch": 0.5063636363636363,
"grad_norm": 107426208546816.0,
"learning_rate": 4.901474607597196e-07,
"loss": 26.282070922851563,
"step": 5570
},
{
"epoch": 0.5072727272727273,
"grad_norm": 258411438538752.0,
"learning_rate": 4.887197834873877e-07,
"loss": 26.355166625976562,
"step": 5580
},
{
"epoch": 0.5081818181818182,
"grad_norm": 140088537251840.0,
"learning_rate": 4.872921982243111e-07,
"loss": 26.558563232421875,
"step": 5590
},
{
"epoch": 0.509090909090909,
"grad_norm": 138965688516608.0,
"learning_rate": 4.858647166148634e-07,
"loss": 26.477615356445312,
"step": 5600
},
{
"epoch": 0.509090909090909,
"eval_loss": 26.29946517944336,
"eval_runtime": 2.216,
"eval_samples_per_second": 16.245,
"eval_steps_per_second": 0.903,
"step": 5600
},
{
"epoch": 0.51,
"grad_norm": 627078646988800.0,
"learning_rate": 4.84437350302573e-07,
"loss": 26.314041137695312,
"step": 5610
},
{
"epoch": 0.5109090909090909,
"grad_norm": 376094112874496.0,
"learning_rate": 4.830101109300277e-07,
"loss": 26.738397216796876,
"step": 5620
},
{
"epoch": 0.5118181818181818,
"grad_norm": 111444955758592.0,
"learning_rate": 4.815830101387799e-07,
"loss": 26.68155517578125,
"step": 5630
},
{
"epoch": 0.5127272727272727,
"grad_norm": 182908782379008.0,
"learning_rate": 4.801560595692515e-07,
"loss": 26.290713500976562,
"step": 5640
},
{
"epoch": 0.5136363636363637,
"grad_norm": 321908033716224.0,
"learning_rate": 4.787292708606394e-07,
"loss": 26.5162353515625,
"step": 5650
},
{
"epoch": 0.5145454545454545,
"grad_norm": 203153714708480.0,
"learning_rate": 4.773026556508201e-07,
"loss": 26.120401000976564,
"step": 5660
},
{
"epoch": 0.5154545454545455,
"grad_norm": 395124106330112.0,
"learning_rate": 4.7587622557625485e-07,
"loss": 26.68848876953125,
"step": 5670
},
{
"epoch": 0.5163636363636364,
"grad_norm": 515408322887680.0,
"learning_rate": 4.744499922718948e-07,
"loss": 26.975100708007812,
"step": 5680
},
{
"epoch": 0.5172727272727272,
"grad_norm": 415264516603904.0,
"learning_rate": 4.7302396737108643e-07,
"loss": 26.722061157226562,
"step": 5690
},
{
"epoch": 0.5181818181818182,
"grad_norm": 198320131670016.0,
"learning_rate": 4.7159816250547593e-07,
"loss": 27.05069580078125,
"step": 5700
},
{
"epoch": 0.5181818181818182,
"eval_loss": 26.303539276123047,
"eval_runtime": 2.1678,
"eval_samples_per_second": 16.607,
"eval_steps_per_second": 0.923,
"step": 5700
},
{
"epoch": 0.519090909090909,
"grad_norm": 350612004798464.0,
"learning_rate": 4.7017258930491466e-07,
"loss": 26.506210327148438,
"step": 5710
},
{
"epoch": 0.52,
"grad_norm": 353382929793024.0,
"learning_rate": 4.687472593973649e-07,
"loss": 26.487466430664064,
"step": 5720
},
{
"epoch": 0.5209090909090909,
"grad_norm": 128485766987776.0,
"learning_rate": 4.673221844088039e-07,
"loss": 26.61768798828125,
"step": 5730
},
{
"epoch": 0.5218181818181818,
"grad_norm": 176263411007488.0,
"learning_rate": 4.6589737596313005e-07,
"loss": 26.494561767578126,
"step": 5740
},
{
"epoch": 0.5227272727272727,
"grad_norm": 490709543026688.0,
"learning_rate": 4.6447284568206727e-07,
"loss": 26.74195556640625,
"step": 5750
},
{
"epoch": 0.5236363636363637,
"grad_norm": 439582084562944.0,
"learning_rate": 4.63048605185071e-07,
"loss": 26.69200744628906,
"step": 5760
},
{
"epoch": 0.5245454545454545,
"grad_norm": 155888790798336.0,
"learning_rate": 4.616246660892323e-07,
"loss": 26.530010986328126,
"step": 5770
},
{
"epoch": 0.5254545454545455,
"grad_norm": 313929695756288.0,
"learning_rate": 4.6020104000918487e-07,
"loss": 26.343841552734375,
"step": 5780
},
{
"epoch": 0.5263636363636364,
"grad_norm": 59153334665216.0,
"learning_rate": 4.587777385570081e-07,
"loss": 26.92261962890625,
"step": 5790
},
{
"epoch": 0.5272727272727272,
"grad_norm": 321196008669184.0,
"learning_rate": 4.5735477334213403e-07,
"loss": 26.5276123046875,
"step": 5800
},
{
"epoch": 0.5272727272727272,
"eval_loss": 26.29823112487793,
"eval_runtime": 2.1826,
"eval_samples_per_second": 16.494,
"eval_steps_per_second": 0.916,
"step": 5800
},
{
"epoch": 0.5281818181818182,
"grad_norm": 115456698482688.0,
"learning_rate": 4.5593215597125246e-07,
"loss": 26.302325439453124,
"step": 5810
},
{
"epoch": 0.5290909090909091,
"grad_norm": 54434067382272.0,
"learning_rate": 4.54509898048215e-07,
"loss": 26.550509643554687,
"step": 5820
},
{
"epoch": 0.53,
"grad_norm": 117245166485504.0,
"learning_rate": 4.530880111739424e-07,
"loss": 26.198770141601564,
"step": 5830
},
{
"epoch": 0.5309090909090909,
"grad_norm": 174198236381184.0,
"learning_rate": 4.5166650694632813e-07,
"loss": 26.7167236328125,
"step": 5840
},
{
"epoch": 0.5318181818181819,
"grad_norm": 202826961649664.0,
"learning_rate": 4.5024539696014496e-07,
"loss": 26.728240966796875,
"step": 5850
},
{
"epoch": 0.5327272727272727,
"grad_norm": 183662431698944.0,
"learning_rate": 4.488246928069496e-07,
"loss": 26.686666870117186,
"step": 5860
},
{
"epoch": 0.5336363636363637,
"grad_norm": 132447521996800.0,
"learning_rate": 4.474044060749889e-07,
"loss": 26.561785888671874,
"step": 5870
},
{
"epoch": 0.5345454545454545,
"grad_norm": 294536173584384.0,
"learning_rate": 4.459845483491045e-07,
"loss": 26.386618041992186,
"step": 5880
},
{
"epoch": 0.5354545454545454,
"grad_norm": 566112055984128.0,
"learning_rate": 4.44565131210639e-07,
"loss": 26.43914794921875,
"step": 5890
},
{
"epoch": 0.5363636363636364,
"grad_norm": 379239069122560.0,
"learning_rate": 4.431461662373415e-07,
"loss": 26.517977905273437,
"step": 5900
},
{
"epoch": 0.5363636363636364,
"eval_loss": 26.296443939208984,
"eval_runtime": 2.1745,
"eval_samples_per_second": 16.555,
"eval_steps_per_second": 0.92,
"step": 5900
},
{
"epoch": 0.5372727272727272,
"grad_norm": 146172048048128.0,
"learning_rate": 4.4172766500327227e-07,
"loss": 26.98131103515625,
"step": 5910
},
{
"epoch": 0.5381818181818182,
"grad_norm": 280093792403456.0,
"learning_rate": 4.4030963907871e-07,
"loss": 26.6470703125,
"step": 5920
},
{
"epoch": 0.5390909090909091,
"grad_norm": 200643255992320.0,
"learning_rate": 4.3889210003005525e-07,
"loss": 26.51512451171875,
"step": 5930
},
{
"epoch": 0.54,
"grad_norm": 298077273456640.0,
"learning_rate": 4.374750594197383e-07,
"loss": 26.81731262207031,
"step": 5940
},
{
"epoch": 0.5409090909090909,
"grad_norm": 105089628897280.0,
"learning_rate": 4.36058528806123e-07,
"loss": 26.3632568359375,
"step": 5950
},
{
"epoch": 0.5418181818181819,
"grad_norm": 243687518896128.0,
"learning_rate": 4.346425197434142e-07,
"loss": 26.923687744140626,
"step": 5960
},
{
"epoch": 0.5427272727272727,
"grad_norm": 667943180435456.0,
"learning_rate": 4.3322704378156184e-07,
"loss": 26.333908081054688,
"step": 5970
},
{
"epoch": 0.5436363636363636,
"grad_norm": 232555886411776.0,
"learning_rate": 4.3181211246616774e-07,
"loss": 26.753402709960938,
"step": 5980
},
{
"epoch": 0.5445454545454546,
"grad_norm": 504201209708544.0,
"learning_rate": 4.3039773733839145e-07,
"loss": 26.233575439453126,
"step": 5990
},
{
"epoch": 0.5454545454545454,
"grad_norm": 184770180939776.0,
"learning_rate": 4.2898392993485547e-07,
"loss": 26.377456665039062,
"step": 6000
},
{
"epoch": 0.5454545454545454,
"eval_loss": 26.29542350769043,
"eval_runtime": 2.1707,
"eval_samples_per_second": 16.585,
"eval_steps_per_second": 0.921,
"step": 6000
},
{
"epoch": 0.5463636363636364,
"grad_norm": 306690058616832.0,
"learning_rate": 4.2757070178755213e-07,
"loss": 26.351678466796876,
"step": 6010
},
{
"epoch": 0.5472727272727272,
"grad_norm": 103466861068288.0,
"learning_rate": 4.261580644237481e-07,
"loss": 26.860089111328126,
"step": 6020
},
{
"epoch": 0.5481818181818182,
"grad_norm": 358580880408576.0,
"learning_rate": 4.2474602936589233e-07,
"loss": 26.571078491210937,
"step": 6030
},
{
"epoch": 0.5490909090909091,
"grad_norm": 270877916659712.0,
"learning_rate": 4.233346081315196e-07,
"loss": 26.6639404296875,
"step": 6040
},
{
"epoch": 0.55,
"grad_norm": 409891646734336.0,
"learning_rate": 4.219238122331593e-07,
"loss": 26.780926513671876,
"step": 6050
},
{
"epoch": 0.5509090909090909,
"grad_norm": 182963593543680.0,
"learning_rate": 4.2051365317823893e-07,
"loss": 26.43211975097656,
"step": 6060
},
{
"epoch": 0.5518181818181818,
"grad_norm": 94839890771968.0,
"learning_rate": 4.191041424689925e-07,
"loss": 27.00631103515625,
"step": 6070
},
{
"epoch": 0.5527272727272727,
"grad_norm": 415413498281984.0,
"learning_rate": 4.176952916023649e-07,
"loss": 26.388510131835936,
"step": 6080
},
{
"epoch": 0.5536363636363636,
"grad_norm": 247516348022784.0,
"learning_rate": 4.1628711206991906e-07,
"loss": 26.635281372070313,
"step": 6090
},
{
"epoch": 0.5545454545454546,
"grad_norm": 941664063455232.0,
"learning_rate": 4.1487961535774235e-07,
"loss": 26.43724365234375,
"step": 6100
},
{
"epoch": 0.5545454545454546,
"eval_loss": 26.28836441040039,
"eval_runtime": 2.1519,
"eval_samples_per_second": 16.73,
"eval_steps_per_second": 0.929,
"step": 6100
},
{
"epoch": 0.5554545454545454,
"grad_norm": 295934218993664.0,
"learning_rate": 4.134728129463522e-07,
"loss": 26.27704772949219,
"step": 6110
},
{
"epoch": 0.5563636363636364,
"grad_norm": 269193249292288.0,
"learning_rate": 4.1206671631060323e-07,
"loss": 26.7314697265625,
"step": 6120
},
{
"epoch": 0.5572727272727273,
"grad_norm": 125726451826688.0,
"learning_rate": 4.1066133691959284e-07,
"loss": 26.241030883789062,
"step": 6130
},
{
"epoch": 0.5581818181818182,
"grad_norm": 672323979968512.0,
"learning_rate": 4.0925668623656846e-07,
"loss": 26.6068115234375,
"step": 6140
},
{
"epoch": 0.5590909090909091,
"grad_norm": 247083109974016.0,
"learning_rate": 4.0785277571883324e-07,
"loss": 26.240081787109375,
"step": 6150
},
{
"epoch": 0.56,
"grad_norm": 347755381784576.0,
"learning_rate": 4.0644961681765385e-07,
"loss": 26.687600708007814,
"step": 6160
},
{
"epoch": 0.5609090909090909,
"grad_norm": 193356390989824.0,
"learning_rate": 4.0504722097816526e-07,
"loss": 26.66230163574219,
"step": 6170
},
{
"epoch": 0.5618181818181818,
"grad_norm": 264473046679552.0,
"learning_rate": 4.0364559963927865e-07,
"loss": 26.944580078125,
"step": 6180
},
{
"epoch": 0.5627272727272727,
"grad_norm": 176868397416448.0,
"learning_rate": 4.022447642335885e-07,
"loss": 26.1925048828125,
"step": 6190
},
{
"epoch": 0.5636363636363636,
"grad_norm": 357407649693696.0,
"learning_rate": 4.0084472618727795e-07,
"loss": 26.477133178710936,
"step": 6200
},
{
"epoch": 0.5636363636363636,
"eval_loss": 26.29114532470703,
"eval_runtime": 2.1728,
"eval_samples_per_second": 16.569,
"eval_steps_per_second": 0.92,
"step": 6200
},
{
"epoch": 0.5645454545454546,
"grad_norm": 188899942989824.0,
"learning_rate": 3.994454969200266e-07,
"loss": 26.23280029296875,
"step": 6210
},
{
"epoch": 0.5654545454545454,
"grad_norm": 174719772917760.0,
"learning_rate": 3.9804708784491697e-07,
"loss": 26.93548583984375,
"step": 6220
},
{
"epoch": 0.5663636363636364,
"grad_norm": 168751630647296.0,
"learning_rate": 3.966495103683418e-07,
"loss": 26.4197509765625,
"step": 6230
},
{
"epoch": 0.5672727272727273,
"grad_norm": 353826150285312.0,
"learning_rate": 3.952527758899103e-07,
"loss": 26.3079345703125,
"step": 6240
},
{
"epoch": 0.5681818181818182,
"grad_norm": 91272224178176.0,
"learning_rate": 3.938568958023561e-07,
"loss": 26.32183837890625,
"step": 6250
},
{
"epoch": 0.5690909090909091,
"grad_norm": 188810235215872.0,
"learning_rate": 3.9246188149144344e-07,
"loss": 26.427536010742188,
"step": 6260
},
{
"epoch": 0.57,
"grad_norm": 413852076343296.0,
"learning_rate": 3.9106774433587465e-07,
"loss": 26.245895385742188,
"step": 6270
},
{
"epoch": 0.5709090909090909,
"grad_norm": 75952646258688.0,
"learning_rate": 3.8967449570719783e-07,
"loss": 26.672445678710936,
"step": 6280
},
{
"epoch": 0.5718181818181818,
"grad_norm": 149835806146560.0,
"learning_rate": 3.8828214696971305e-07,
"loss": 26.373684692382813,
"step": 6290
},
{
"epoch": 0.5727272727272728,
"grad_norm": 84309335605248.0,
"learning_rate": 3.8689070948038105e-07,
"loss": 26.33724365234375,
"step": 6300
},
{
"epoch": 0.5727272727272728,
"eval_loss": 26.28530502319336,
"eval_runtime": 2.1736,
"eval_samples_per_second": 16.562,
"eval_steps_per_second": 0.92,
"step": 6300
},
{
"epoch": 0.5736363636363636,
"grad_norm": 184767328813056.0,
"learning_rate": 3.8550019458872863e-07,
"loss": 26.87149658203125,
"step": 6310
},
{
"epoch": 0.5745454545454546,
"grad_norm": 166437347917824.0,
"learning_rate": 3.841106136367585e-07,
"loss": 26.697918701171876,
"step": 6320
},
{
"epoch": 0.5754545454545454,
"grad_norm": 375701593128960.0,
"learning_rate": 3.827219779588546e-07,
"loss": 26.319839477539062,
"step": 6330
},
{
"epoch": 0.5763636363636364,
"grad_norm": 123003073462272.0,
"learning_rate": 3.81334298881691e-07,
"loss": 26.770510864257812,
"step": 6340
},
{
"epoch": 0.5772727272727273,
"grad_norm": 429775868919808.0,
"learning_rate": 3.7994758772413894e-07,
"loss": 26.409426879882812,
"step": 6350
},
{
"epoch": 0.5781818181818181,
"grad_norm": 180347572584448.0,
"learning_rate": 3.7856185579717455e-07,
"loss": 26.36715087890625,
"step": 6360
},
{
"epoch": 0.5790909090909091,
"grad_norm": 1096010222796800.0,
"learning_rate": 3.771771144037869e-07,
"loss": 26.516082763671875,
"step": 6370
},
{
"epoch": 0.58,
"grad_norm": 108321600176128.0,
"learning_rate": 3.7579337483888535e-07,
"loss": 26.694012451171876,
"step": 6380
},
{
"epoch": 0.5809090909090909,
"grad_norm": 196052774813696.0,
"learning_rate": 3.7441064838920793e-07,
"loss": 26.63226318359375,
"step": 6390
},
{
"epoch": 0.5818181818181818,
"grad_norm": 136146621300736.0,
"learning_rate": 3.7302894633322857e-07,
"loss": 26.535342407226562,
"step": 6400
},
{
"epoch": 0.5818181818181818,
"eval_loss": 26.28375244140625,
"eval_runtime": 2.1824,
"eval_samples_per_second": 16.495,
"eval_steps_per_second": 0.916,
"step": 6400
},
{
"epoch": 0.5827272727272728,
"grad_norm": 359597948796928.0,
"learning_rate": 3.7164827994106623e-07,
"loss": 26.610174560546874,
"step": 6410
},
{
"epoch": 0.5836363636363636,
"grad_norm": 358815996313600.0,
"learning_rate": 3.7026866047439134e-07,
"loss": 26.601348876953125,
"step": 6420
},
{
"epoch": 0.5845454545454546,
"grad_norm": 232237672955904.0,
"learning_rate": 3.688900991863357e-07,
"loss": 26.58094177246094,
"step": 6430
},
{
"epoch": 0.5854545454545454,
"grad_norm": 224937939828736.0,
"learning_rate": 3.675126073213998e-07,
"loss": 26.3585693359375,
"step": 6440
},
{
"epoch": 0.5863636363636363,
"grad_norm": 170370447441920.0,
"learning_rate": 3.661361961153602e-07,
"loss": 26.818353271484376,
"step": 6450
},
{
"epoch": 0.5872727272727273,
"grad_norm": 241997600260096.0,
"learning_rate": 3.647608767951803e-07,
"loss": 26.691299438476562,
"step": 6460
},
{
"epoch": 0.5881818181818181,
"grad_norm": 359189289369600.0,
"learning_rate": 3.633866605789163e-07,
"loss": 26.187884521484374,
"step": 6470
},
{
"epoch": 0.5890909090909091,
"grad_norm": 318397501931520.0,
"learning_rate": 3.6201355867562724e-07,
"loss": 26.471282958984375,
"step": 6480
},
{
"epoch": 0.59,
"grad_norm": 151627210162176.0,
"learning_rate": 3.606415822852825e-07,
"loss": 26.56259765625,
"step": 6490
},
{
"epoch": 0.5909090909090909,
"grad_norm": 304659646382080.0,
"learning_rate": 3.592707425986717e-07,
"loss": 26.369317626953126,
"step": 6500
},
{
"epoch": 0.5909090909090909,
"eval_loss": 26.286823272705078,
"eval_runtime": 2.1707,
"eval_samples_per_second": 16.584,
"eval_steps_per_second": 0.921,
"step": 6500
},
{
"epoch": 0.5918181818181818,
"grad_norm": 280783252094976.0,
"learning_rate": 3.5790105079731216e-07,
"loss": 26.206988525390624,
"step": 6510
},
{
"epoch": 0.5927272727272728,
"grad_norm": 196329196224512.0,
"learning_rate": 3.565325180533586e-07,
"loss": 26.52789306640625,
"step": 6520
},
{
"epoch": 0.5936363636363636,
"grad_norm": 136604035317760.0,
"learning_rate": 3.5516515552951124e-07,
"loss": 26.288201904296876,
"step": 6530
},
{
"epoch": 0.5945454545454546,
"grad_norm": 92855758487552.0,
"learning_rate": 3.537989743789259e-07,
"loss": 26.704229736328124,
"step": 6540
},
{
"epoch": 0.5954545454545455,
"grad_norm": 160173054230528.0,
"learning_rate": 3.5243398574512185e-07,
"loss": 26.398892211914063,
"step": 6550
},
{
"epoch": 0.5963636363636363,
"grad_norm": 205201441030144.0,
"learning_rate": 3.5107020076189075e-07,
"loss": 26.12825927734375,
"step": 6560
},
{
"epoch": 0.5972727272727273,
"grad_norm": 381060437245952.0,
"learning_rate": 3.4970763055320776e-07,
"loss": 26.28996887207031,
"step": 6570
},
{
"epoch": 0.5981818181818181,
"grad_norm": 101203681738752.0,
"learning_rate": 3.4834628623313835e-07,
"loss": 26.50263671875,
"step": 6580
},
{
"epoch": 0.5990909090909091,
"grad_norm": 190785299415040.0,
"learning_rate": 3.4698617890574966e-07,
"loss": 26.34183349609375,
"step": 6590
},
{
"epoch": 0.6,
"grad_norm": 127154729779200.0,
"learning_rate": 3.4562731966501835e-07,
"loss": 26.541549682617188,
"step": 6600
},
{
"epoch": 0.6,
"eval_loss": 26.287540435791016,
"eval_runtime": 2.151,
"eval_samples_per_second": 16.737,
"eval_steps_per_second": 0.93,
"step": 6600
},
{
"epoch": 0.600909090909091,
"grad_norm": 294955067113472.0,
"learning_rate": 3.442697195947414e-07,
"loss": 26.36138000488281,
"step": 6610
},
{
"epoch": 0.6018181818181818,
"grad_norm": 587266313420800.0,
"learning_rate": 3.4291338976844465e-07,
"loss": 26.64934387207031,
"step": 6620
},
{
"epoch": 0.6027272727272728,
"grad_norm": 137201656528896.0,
"learning_rate": 3.415583412492933e-07,
"loss": 26.626654052734374,
"step": 6630
},
{
"epoch": 0.6036363636363636,
"grad_norm": 370320368205824.0,
"learning_rate": 3.4020458509000117e-07,
"loss": 26.581622314453124,
"step": 6640
},
{
"epoch": 0.6045454545454545,
"grad_norm": 129610041786368.0,
"learning_rate": 3.3885213233274053e-07,
"loss": 26.582095336914062,
"step": 6650
},
{
"epoch": 0.6054545454545455,
"grad_norm": 590885427347456.0,
"learning_rate": 3.3750099400905256e-07,
"loss": 26.447711181640624,
"step": 6660
},
{
"epoch": 0.6063636363636363,
"grad_norm": 323296281231360.0,
"learning_rate": 3.361511811397567e-07,
"loss": 26.482095336914064,
"step": 6670
},
{
"epoch": 0.6072727272727273,
"grad_norm": 210331276148736.0,
"learning_rate": 3.348027047348615e-07,
"loss": 26.46201171875,
"step": 6680
},
{
"epoch": 0.6081818181818182,
"grad_norm": 769363464421376.0,
"learning_rate": 3.3345557579347353e-07,
"loss": 26.45103759765625,
"step": 6690
},
{
"epoch": 0.6090909090909091,
"grad_norm": 661023115706368.0,
"learning_rate": 3.321098053037097e-07,
"loss": 26.44871826171875,
"step": 6700
},
{
"epoch": 0.6090909090909091,
"eval_loss": 26.283708572387695,
"eval_runtime": 2.1672,
"eval_samples_per_second": 16.611,
"eval_steps_per_second": 0.923,
"step": 6700
},
{
"epoch": 0.61,
"grad_norm": 199447761911808.0,
"learning_rate": 3.3076540424260537e-07,
"loss": 26.60747375488281,
"step": 6710
},
{
"epoch": 0.610909090909091,
"grad_norm": 391525628379136.0,
"learning_rate": 3.2942238357602657e-07,
"loss": 26.542547607421874,
"step": 6720
},
{
"epoch": 0.6118181818181818,
"grad_norm": 64306838241280.0,
"learning_rate": 3.280807542585795e-07,
"loss": 26.613406372070312,
"step": 6730
},
{
"epoch": 0.6127272727272727,
"grad_norm": 70327136681984.0,
"learning_rate": 3.2674052723352167e-07,
"loss": 26.60184326171875,
"step": 6740
},
{
"epoch": 0.6136363636363636,
"grad_norm": 62553828884480.0,
"learning_rate": 3.2540171343267275e-07,
"loss": 26.298440551757814,
"step": 6750
},
{
"epoch": 0.6145454545454545,
"grad_norm": 251477431943168.0,
"learning_rate": 3.240643237763247e-07,
"loss": 26.87586669921875,
"step": 6760
},
{
"epoch": 0.6154545454545455,
"grad_norm": 283658397155328.0,
"learning_rate": 3.227283691731537e-07,
"loss": 26.486978149414064,
"step": 6770
},
{
"epoch": 0.6163636363636363,
"grad_norm": 64015141175296.0,
"learning_rate": 3.2139386052013e-07,
"loss": 26.21527099609375,
"step": 6780
},
{
"epoch": 0.6172727272727273,
"grad_norm": 412106407018496.0,
"learning_rate": 3.200608087024307e-07,
"loss": 26.61980285644531,
"step": 6790
},
{
"epoch": 0.6181818181818182,
"grad_norm": 402233720045568.0,
"learning_rate": 3.1872922459334863e-07,
"loss": 26.505010986328124,
"step": 6800
},
{
"epoch": 0.6181818181818182,
"eval_loss": 26.28169059753418,
"eval_runtime": 2.1742,
"eval_samples_per_second": 16.558,
"eval_steps_per_second": 0.92,
"step": 6800
},
{
"epoch": 0.6190909090909091,
"grad_norm": 501143427874816.0,
"learning_rate": 3.1739911905420614e-07,
"loss": 26.6177734375,
"step": 6810
},
{
"epoch": 0.62,
"grad_norm": 320495861891072.0,
"learning_rate": 3.1607050293426476e-07,
"loss": 26.375076293945312,
"step": 6820
},
{
"epoch": 0.6209090909090909,
"grad_norm": 578750198579200.0,
"learning_rate": 3.147433870706369e-07,
"loss": 26.377716064453125,
"step": 6830
},
{
"epoch": 0.6218181818181818,
"grad_norm": 264358508625920.0,
"learning_rate": 3.13417782288199e-07,
"loss": 26.565155029296875,
"step": 6840
},
{
"epoch": 0.6227272727272727,
"grad_norm": 258190952366080.0,
"learning_rate": 3.1209369939950093e-07,
"loss": 26.477603149414062,
"step": 6850
},
{
"epoch": 0.6236363636363637,
"grad_norm": 281976514805760.0,
"learning_rate": 3.1077114920467975e-07,
"loss": 26.77740478515625,
"step": 6860
},
{
"epoch": 0.6245454545454545,
"grad_norm": 114142262329344.0,
"learning_rate": 3.0945014249137e-07,
"loss": 26.84779052734375,
"step": 6870
},
{
"epoch": 0.6254545454545455,
"grad_norm": 101205963440128.0,
"learning_rate": 3.081306900346175e-07,
"loss": 26.630465698242187,
"step": 6880
},
{
"epoch": 0.6263636363636363,
"grad_norm": 598499464839168.0,
"learning_rate": 3.0681280259678943e-07,
"loss": 26.645831298828124,
"step": 6890
},
{
"epoch": 0.6272727272727273,
"grad_norm": 204581657116672.0,
"learning_rate": 3.0549649092748874e-07,
"loss": 26.660739135742187,
"step": 6900
},
{
"epoch": 0.6272727272727273,
"eval_loss": 26.27537727355957,
"eval_runtime": 2.1767,
"eval_samples_per_second": 16.539,
"eval_steps_per_second": 0.919,
"step": 6900
},
{
"epoch": 0.6281818181818182,
"grad_norm": 235361171144704.0,
"learning_rate": 3.0418176576346405e-07,
"loss": 26.733432006835937,
"step": 6910
},
{
"epoch": 0.6290909090909091,
"grad_norm": 122989131595776.0,
"learning_rate": 3.028686378285245e-07,
"loss": 26.12663879394531,
"step": 6920
},
{
"epoch": 0.63,
"grad_norm": 654737095524352.0,
"learning_rate": 3.0155711783345044e-07,
"loss": 26.359912109375,
"step": 6930
},
{
"epoch": 0.6309090909090909,
"grad_norm": 146589414850560.0,
"learning_rate": 3.002472164759067e-07,
"loss": 26.213088989257812,
"step": 6940
},
{
"epoch": 0.6318181818181818,
"grad_norm": 253996732252160.0,
"learning_rate": 2.9893894444035584e-07,
"loss": 26.507452392578124,
"step": 6950
},
{
"epoch": 0.6327272727272727,
"grad_norm": 260389656854528.0,
"learning_rate": 2.9763231239797025e-07,
"loss": 26.148370361328126,
"step": 6960
},
{
"epoch": 0.6336363636363637,
"grad_norm": 540127503843328.0,
"learning_rate": 2.963273310065456e-07,
"loss": 26.83206787109375,
"step": 6970
},
{
"epoch": 0.6345454545454545,
"grad_norm": 71601550786560.0,
"learning_rate": 2.9502401091041334e-07,
"loss": 26.635586547851563,
"step": 6980
},
{
"epoch": 0.6354545454545455,
"grad_norm": 550072433508352.0,
"learning_rate": 2.9372236274035466e-07,
"loss": 26.5653564453125,
"step": 6990
},
{
"epoch": 0.6363636363636364,
"grad_norm": 277867640389632.0,
"learning_rate": 2.9242239711351304e-07,
"loss": 26.53182373046875,
"step": 7000
},
{
"epoch": 0.6363636363636364,
"eval_loss": 26.28166961669922,
"eval_runtime": 2.1741,
"eval_samples_per_second": 16.559,
"eval_steps_per_second": 0.92,
"step": 7000
},
{
"epoch": 0.6372727272727273,
"grad_norm": 208354400010240.0,
"learning_rate": 2.9112412463330807e-07,
"loss": 26.38590087890625,
"step": 7010
},
{
"epoch": 0.6381818181818182,
"grad_norm": 615660476432384.0,
"learning_rate": 2.8982755588934925e-07,
"loss": 26.374246215820314,
"step": 7020
},
{
"epoch": 0.639090909090909,
"grad_norm": 227794512510976.0,
"learning_rate": 2.885327014573484e-07,
"loss": 26.50068359375,
"step": 7030
},
{
"epoch": 0.64,
"grad_norm": 649978070433792.0,
"learning_rate": 2.8723957189903495e-07,
"loss": 26.3570556640625,
"step": 7040
},
{
"epoch": 0.6409090909090909,
"grad_norm": 92747755159552.0,
"learning_rate": 2.859481777620688e-07,
"loss": 26.351593017578125,
"step": 7050
},
{
"epoch": 0.6418181818181818,
"grad_norm": 547461831589888.0,
"learning_rate": 2.8465852957995485e-07,
"loss": 26.504672241210937,
"step": 7060
},
{
"epoch": 0.6427272727272727,
"grad_norm": 256846124285952.0,
"learning_rate": 2.833706378719559e-07,
"loss": 27.03226318359375,
"step": 7070
},
{
"epoch": 0.6436363636363637,
"grad_norm": 146097339105280.0,
"learning_rate": 2.8208451314300876e-07,
"loss": 26.550949096679688,
"step": 7080
},
{
"epoch": 0.6445454545454545,
"grad_norm": 463059382435840.0,
"learning_rate": 2.80800165883637e-07,
"loss": 26.586752319335936,
"step": 7090
},
{
"epoch": 0.6454545454545455,
"grad_norm": 184904549662720.0,
"learning_rate": 2.7951760656986625e-07,
"loss": 26.651223754882814,
"step": 7100
},
{
"epoch": 0.6454545454545455,
"eval_loss": 26.276838302612305,
"eval_runtime": 2.1813,
"eval_samples_per_second": 16.504,
"eval_steps_per_second": 0.917,
"step": 7100
},
{
"epoch": 0.6463636363636364,
"grad_norm": 497082469187584.0,
"learning_rate": 2.782368456631378e-07,
"loss": 26.286236572265626,
"step": 7110
},
{
"epoch": 0.6472727272727272,
"grad_norm": 164335598960640.0,
"learning_rate": 2.769578936102245e-07,
"loss": 26.465399169921874,
"step": 7120
},
{
"epoch": 0.6481818181818182,
"grad_norm": 223688372781056.0,
"learning_rate": 2.756807608431447e-07,
"loss": 26.540838623046874,
"step": 7130
},
{
"epoch": 0.649090909090909,
"grad_norm": 362925608927232.0,
"learning_rate": 2.744054577790774e-07,
"loss": 26.485153198242188,
"step": 7140
},
{
"epoch": 0.65,
"grad_norm": 118669761839104.0,
"learning_rate": 2.731319948202776e-07,
"loss": 26.7018798828125,
"step": 7150
},
{
"epoch": 0.6509090909090909,
"grad_norm": 440564222787584.0,
"learning_rate": 2.7186038235399027e-07,
"loss": 26.294155883789063,
"step": 7160
},
{
"epoch": 0.6518181818181819,
"grad_norm": 391212498419712.0,
"learning_rate": 2.705906307523673e-07,
"loss": 26.423309326171875,
"step": 7170
},
{
"epoch": 0.6527272727272727,
"grad_norm": 291606871670784.0,
"learning_rate": 2.693227503723819e-07,
"loss": 26.983016967773438,
"step": 7180
},
{
"epoch": 0.6536363636363637,
"grad_norm": 239193305382912.0,
"learning_rate": 2.6805675155574425e-07,
"loss": 26.53931884765625,
"step": 7190
},
{
"epoch": 0.6545454545454545,
"grad_norm": 95832472813568.0,
"learning_rate": 2.667926446288169e-07,
"loss": 26.326837158203126,
"step": 7200
},
{
"epoch": 0.6545454545454545,
"eval_loss": 26.273149490356445,
"eval_runtime": 2.1822,
"eval_samples_per_second": 16.497,
"eval_steps_per_second": 0.916,
"step": 7200
},
{
"epoch": 0.6554545454545454,
"grad_norm": 246679919919104.0,
"learning_rate": 2.655304399025312e-07,
"loss": 26.533935546875,
"step": 7210
},
{
"epoch": 0.6563636363636364,
"grad_norm": 521899461312512.0,
"learning_rate": 2.6427014767230294e-07,
"loss": 26.514251708984375,
"step": 7220
},
{
"epoch": 0.6572727272727272,
"grad_norm": 228885098659840.0,
"learning_rate": 2.630117782179475e-07,
"loss": 26.712460327148438,
"step": 7230
},
{
"epoch": 0.6581818181818182,
"grad_norm": 271884381847552.0,
"learning_rate": 2.6175534180359813e-07,
"loss": 26.149929809570313,
"step": 7240
},
{
"epoch": 0.6590909090909091,
"grad_norm": 474217908797440.0,
"learning_rate": 2.605008486776195e-07,
"loss": 26.453692626953124,
"step": 7250
},
{
"epoch": 0.66,
"grad_norm": 357043785433088.0,
"learning_rate": 2.5924830907252614e-07,
"loss": 26.58966064453125,
"step": 7260
},
{
"epoch": 0.6609090909090909,
"grad_norm": 641387800297472.0,
"learning_rate": 2.5799773320489827e-07,
"loss": 26.886062622070312,
"step": 7270
},
{
"epoch": 0.6618181818181819,
"grad_norm": 117462062333952.0,
"learning_rate": 2.5674913127529867e-07,
"loss": 26.308395385742188,
"step": 7280
},
{
"epoch": 0.6627272727272727,
"grad_norm": 351057137893376.0,
"learning_rate": 2.555025134681886e-07,
"loss": 26.34556884765625,
"step": 7290
},
{
"epoch": 0.6636363636363637,
"grad_norm": 148489820438528.0,
"learning_rate": 2.542578899518463e-07,
"loss": 26.660372924804687,
"step": 7300
},
{
"epoch": 0.6636363636363637,
"eval_loss": 26.275470733642578,
"eval_runtime": 2.1726,
"eval_samples_per_second": 16.57,
"eval_steps_per_second": 0.921,
"step": 7300
},
{
"epoch": 0.6645454545454546,
"grad_norm": 291709548232704.0,
"learning_rate": 2.5301527087828287e-07,
"loss": 26.54521789550781,
"step": 7310
},
{
"epoch": 0.6654545454545454,
"grad_norm": 360566128377856.0,
"learning_rate": 2.5177466638315945e-07,
"loss": 26.633468627929688,
"step": 7320
},
{
"epoch": 0.6663636363636364,
"grad_norm": 262026844700672.0,
"learning_rate": 2.505360865857054e-07,
"loss": 26.330783081054687,
"step": 7330
},
{
"epoch": 0.6672727272727272,
"grad_norm": 365513158950912.0,
"learning_rate": 2.492995415886349e-07,
"loss": 26.3236572265625,
"step": 7340
},
{
"epoch": 0.6681818181818182,
"grad_norm": 80057695469568.0,
"learning_rate": 2.480650414780653e-07,
"loss": 26.489703369140624,
"step": 7350
},
{
"epoch": 0.6690909090909091,
"grad_norm": 269574847070208.0,
"learning_rate": 2.4683259632343364e-07,
"loss": 26.589083862304687,
"step": 7360
},
{
"epoch": 0.67,
"grad_norm": 106464077152256.0,
"learning_rate": 2.456022161774164e-07,
"loss": 26.390362548828126,
"step": 7370
},
{
"epoch": 0.6709090909090909,
"grad_norm": 200526067138560.0,
"learning_rate": 2.4437391107584556e-07,
"loss": 26.3364990234375,
"step": 7380
},
{
"epoch": 0.6718181818181819,
"grad_norm": 174280209858560.0,
"learning_rate": 2.4314769103762784e-07,
"loss": 26.455654907226563,
"step": 7390
},
{
"epoch": 0.6727272727272727,
"grad_norm": 114393173983232.0,
"learning_rate": 2.4192356606466303e-07,
"loss": 26.521585083007814,
"step": 7400
},
{
"epoch": 0.6727272727272727,
"eval_loss": 26.27696418762207,
"eval_runtime": 2.1578,
"eval_samples_per_second": 16.684,
"eval_steps_per_second": 0.927,
"step": 7400
},
{
"epoch": 0.6736363636363636,
"grad_norm": 203887600467968.0,
"learning_rate": 2.407015461417616e-07,
"loss": 26.397149658203126,
"step": 7410
},
{
"epoch": 0.6745454545454546,
"grad_norm": 152426476732416.0,
"learning_rate": 2.394816412365642e-07,
"loss": 26.610260009765625,
"step": 7420
},
{
"epoch": 0.6754545454545454,
"grad_norm": 281785892077568.0,
"learning_rate": 2.3826386129945976e-07,
"loss": 26.886895751953126,
"step": 7430
},
{
"epoch": 0.6763636363636364,
"grad_norm": 123647452774400.0,
"learning_rate": 2.3704821626350468e-07,
"loss": 26.532232666015624,
"step": 7440
},
{
"epoch": 0.6772727272727272,
"grad_norm": 195468189499392.0,
"learning_rate": 2.358347160443412e-07,
"loss": 26.519247436523436,
"step": 7450
},
{
"epoch": 0.6781818181818182,
"grad_norm": 55197703340032.0,
"learning_rate": 2.3462337054011732e-07,
"loss": 26.758151245117187,
"step": 7460
},
{
"epoch": 0.6790909090909091,
"grad_norm": 67209904783360.0,
"learning_rate": 2.334141896314057e-07,
"loss": 26.347998046875,
"step": 7470
},
{
"epoch": 0.68,
"grad_norm": 134699796135936.0,
"learning_rate": 2.3220718318112281e-07,
"loss": 26.302090454101563,
"step": 7480
},
{
"epoch": 0.6809090909090909,
"grad_norm": 224456467283968.0,
"learning_rate": 2.310023610344492e-07,
"loss": 26.276641845703125,
"step": 7490
},
{
"epoch": 0.6818181818181818,
"grad_norm": 669328441606144.0,
"learning_rate": 2.2979973301874795e-07,
"loss": 26.991085815429688,
"step": 7500
},
{
"epoch": 0.6818181818181818,
"eval_loss": 26.273746490478516,
"eval_runtime": 2.155,
"eval_samples_per_second": 16.705,
"eval_steps_per_second": 0.928,
"step": 7500
},
{
"epoch": 0.6827272727272727,
"grad_norm": 246346388865024.0,
"learning_rate": 2.2859930894348594e-07,
"loss": 26.169650268554687,
"step": 7510
},
{
"epoch": 0.6836363636363636,
"grad_norm": 117372857876480.0,
"learning_rate": 2.2740109860015304e-07,
"loss": 26.467178344726562,
"step": 7520
},
{
"epoch": 0.6845454545454546,
"grad_norm": 186215957528576.0,
"learning_rate": 2.2620511176218255e-07,
"loss": 26.1698486328125,
"step": 7530
},
{
"epoch": 0.6854545454545454,
"grad_norm": 167226934034432.0,
"learning_rate": 2.250113581848706e-07,
"loss": 26.436212158203126,
"step": 7540
},
{
"epoch": 0.6863636363636364,
"grad_norm": 54176792969216.0,
"learning_rate": 2.2381984760529816e-07,
"loss": 26.699081420898438,
"step": 7550
},
{
"epoch": 0.6872727272727273,
"grad_norm": 131126349791232.0,
"learning_rate": 2.2263058974225023e-07,
"loss": 26.650469970703124,
"step": 7560
},
{
"epoch": 0.6881818181818182,
"grad_norm": 190212038721536.0,
"learning_rate": 2.214435942961377e-07,
"loss": 26.493695068359376,
"step": 7570
},
{
"epoch": 0.6890909090909091,
"grad_norm": 263704901844992.0,
"learning_rate": 2.2025887094891655e-07,
"loss": 26.46141662597656,
"step": 7580
},
{
"epoch": 0.69,
"grad_norm": 391329167179776.0,
"learning_rate": 2.19076429364011e-07,
"loss": 26.3736083984375,
"step": 7590
},
{
"epoch": 0.6909090909090909,
"grad_norm": 119184780427264.0,
"learning_rate": 2.178962791862333e-07,
"loss": 26.546969604492187,
"step": 7600
},
{
"epoch": 0.6909090909090909,
"eval_loss": 26.27129364013672,
"eval_runtime": 2.1527,
"eval_samples_per_second": 16.723,
"eval_steps_per_second": 0.929,
"step": 7600
},
{
"epoch": 0.6918181818181818,
"grad_norm": 177234845368320.0,
"learning_rate": 2.1671843004170483e-07,
"loss": 26.3050048828125,
"step": 7610
},
{
"epoch": 0.6927272727272727,
"grad_norm": 323850130685952.0,
"learning_rate": 2.1554289153777933e-07,
"loss": 26.890570068359374,
"step": 7620
},
{
"epoch": 0.6936363636363636,
"grad_norm": 153877135491072.0,
"learning_rate": 2.1436967326296213e-07,
"loss": 26.495651245117188,
"step": 7630
},
{
"epoch": 0.6945454545454546,
"grad_norm": 196137852076032.0,
"learning_rate": 2.1319878478683396e-07,
"loss": 26.359036254882813,
"step": 7640
},
{
"epoch": 0.6954545454545454,
"grad_norm": 99828335902720.0,
"learning_rate": 2.1203023565997173e-07,
"loss": 26.25531005859375,
"step": 7650
},
{
"epoch": 0.6963636363636364,
"grad_norm": 566579267895296.0,
"learning_rate": 2.1086403541387144e-07,
"loss": 26.096768188476563,
"step": 7660
},
{
"epoch": 0.6972727272727273,
"grad_norm": 206705417781248.0,
"learning_rate": 2.097001935608692e-07,
"loss": 26.354949951171875,
"step": 7670
},
{
"epoch": 0.6981818181818182,
"grad_norm": 88147518029824.0,
"learning_rate": 2.085387195940651e-07,
"loss": 26.522039794921874,
"step": 7680
},
{
"epoch": 0.6990909090909091,
"grad_norm": 223890320130048.0,
"learning_rate": 2.073796229872451e-07,
"loss": 26.2290283203125,
"step": 7690
},
{
"epoch": 0.7,
"grad_norm": 142860158500864.0,
"learning_rate": 2.0622291319480316e-07,
"loss": 26.3935791015625,
"step": 7700
},
{
"epoch": 0.7,
"eval_loss": 26.27055549621582,
"eval_runtime": 2.1622,
"eval_samples_per_second": 16.649,
"eval_steps_per_second": 0.925,
"step": 7700
},
{
"epoch": 0.7009090909090909,
"grad_norm": 76660552499200.0,
"learning_rate": 2.0506859965166546e-07,
"loss": 26.559854125976564,
"step": 7710
},
{
"epoch": 0.7018181818181818,
"grad_norm": 165078661857280.0,
"learning_rate": 2.039166917732123e-07,
"loss": 26.336550903320312,
"step": 7720
},
{
"epoch": 0.7027272727272728,
"grad_norm": 131228850192384.0,
"learning_rate": 2.02767198955202e-07,
"loss": 26.307232666015626,
"step": 7730
},
{
"epoch": 0.7036363636363636,
"grad_norm": 158765814906880.0,
"learning_rate": 2.0162013057369327e-07,
"loss": 26.472689819335937,
"step": 7740
},
{
"epoch": 0.7045454545454546,
"grad_norm": 415826083577856.0,
"learning_rate": 2.0047549598497064e-07,
"loss": 26.57115478515625,
"step": 7750
},
{
"epoch": 0.7054545454545454,
"grad_norm": 340710863667200.0,
"learning_rate": 1.9933330452546575e-07,
"loss": 26.334005737304686,
"step": 7760
},
{
"epoch": 0.7063636363636364,
"grad_norm": 200871073808384.0,
"learning_rate": 1.9819356551168304e-07,
"loss": 26.425982666015624,
"step": 7770
},
{
"epoch": 0.7072727272727273,
"grad_norm": 326121094643712.0,
"learning_rate": 1.9705628824012315e-07,
"loss": 26.586672973632812,
"step": 7780
},
{
"epoch": 0.7081818181818181,
"grad_norm": 311439185149952.0,
"learning_rate": 1.9592148198720655e-07,
"loss": 26.54600830078125,
"step": 7790
},
{
"epoch": 0.7090909090909091,
"grad_norm": 154627949461504.0,
"learning_rate": 1.9478915600919877e-07,
"loss": 26.687026977539062,
"step": 7800
},
{
"epoch": 0.7090909090909091,
"eval_loss": 26.266042709350586,
"eval_runtime": 2.1833,
"eval_samples_per_second": 16.489,
"eval_steps_per_second": 0.916,
"step": 7800
},
{
"epoch": 0.71,
"grad_norm": 325412290822144.0,
"learning_rate": 1.9365931954213443e-07,
"loss": 26.345108032226562,
"step": 7810
},
{
"epoch": 0.7109090909090909,
"grad_norm": 103427434610688.0,
"learning_rate": 1.9253198180174213e-07,
"loss": 26.439935302734376,
"step": 7820
},
{
"epoch": 0.7118181818181818,
"grad_norm": 491774460035072.0,
"learning_rate": 1.9140715198336844e-07,
"loss": 26.82066650390625,
"step": 7830
},
{
"epoch": 0.7127272727272728,
"grad_norm": 210541125566464.0,
"learning_rate": 1.9028483926190474e-07,
"loss": 26.39219970703125,
"step": 7840
},
{
"epoch": 0.7136363636363636,
"grad_norm": 856512243171328.0,
"learning_rate": 1.8916505279171007e-07,
"loss": 26.36131591796875,
"step": 7850
},
{
"epoch": 0.7145454545454546,
"grad_norm": 417027902668800.0,
"learning_rate": 1.8804780170653833e-07,
"loss": 26.504092407226562,
"step": 7860
},
{
"epoch": 0.7154545454545455,
"grad_norm": 292983341580288.0,
"learning_rate": 1.8693309511946304e-07,
"loss": 26.41829833984375,
"step": 7870
},
{
"epoch": 0.7163636363636363,
"grad_norm": 327994371473408.0,
"learning_rate": 1.8582094212280237e-07,
"loss": 26.64545593261719,
"step": 7880
},
{
"epoch": 0.7172727272727273,
"grad_norm": 218186469343232.0,
"learning_rate": 1.8471135178804641e-07,
"loss": 26.180670166015624,
"step": 7890
},
{
"epoch": 0.7181818181818181,
"grad_norm": 82476139544576.0,
"learning_rate": 1.8360433316578205e-07,
"loss": 26.653558349609376,
"step": 7900
},
{
"epoch": 0.7181818181818181,
"eval_loss": 26.26190948486328,
"eval_runtime": 2.1559,
"eval_samples_per_second": 16.698,
"eval_steps_per_second": 0.928,
"step": 7900
},
{
"epoch": 0.7190909090909091,
"grad_norm": 118652909125632.0,
"learning_rate": 1.8249989528561976e-07,
"loss": 26.234396362304686,
"step": 7910
},
{
"epoch": 0.72,
"grad_norm": 125824606928896.0,
"learning_rate": 1.8139804715611916e-07,
"loss": 26.377532958984375,
"step": 7920
},
{
"epoch": 0.7209090909090909,
"grad_norm": 130430497980416.0,
"learning_rate": 1.8029879776471661e-07,
"loss": 26.323135375976562,
"step": 7930
},
{
"epoch": 0.7218181818181818,
"grad_norm": 189826951282688.0,
"learning_rate": 1.792021560776511e-07,
"loss": 26.728903198242186,
"step": 7940
},
{
"epoch": 0.7227272727272728,
"grad_norm": 148400968302592.0,
"learning_rate": 1.781081310398917e-07,
"loss": 26.242092895507813,
"step": 7950
},
{
"epoch": 0.7236363636363636,
"grad_norm": 134777038438400.0,
"learning_rate": 1.770167315750636e-07,
"loss": 26.503350830078126,
"step": 7960
},
{
"epoch": 0.7245454545454545,
"grad_norm": 511105268973568.0,
"learning_rate": 1.7592796658537658e-07,
"loss": 26.567254638671876,
"step": 7970
},
{
"epoch": 0.7254545454545455,
"grad_norm": 110472221163520.0,
"learning_rate": 1.748418449515519e-07,
"loss": 26.81078186035156,
"step": 7980
},
{
"epoch": 0.7263636363636363,
"grad_norm": 329754871857152.0,
"learning_rate": 1.7375837553274897e-07,
"loss": 26.368780517578124,
"step": 7990
},
{
"epoch": 0.7272727272727273,
"grad_norm": 74490444775424.0,
"learning_rate": 1.7267756716649523e-07,
"loss": 26.744158935546874,
"step": 8000
},
{
"epoch": 0.7272727272727273,
"eval_loss": 26.262548446655273,
"eval_runtime": 2.1821,
"eval_samples_per_second": 16.498,
"eval_steps_per_second": 0.917,
"step": 8000
},
{
"epoch": 0.7281818181818182,
"grad_norm": 204158569283584.0,
"learning_rate": 1.7159942866861132e-07,
"loss": 26.29222412109375,
"step": 8010
},
{
"epoch": 0.7290909090909091,
"grad_norm": 145085589094400.0,
"learning_rate": 1.7052396883314152e-07,
"loss": 26.959561157226563,
"step": 8020
},
{
"epoch": 0.73,
"grad_norm": 110825029238784.0,
"learning_rate": 1.6945119643228072e-07,
"loss": 26.370242309570312,
"step": 8030
},
{
"epoch": 0.730909090909091,
"grad_norm": 252334294695936.0,
"learning_rate": 1.6838112021630356e-07,
"loss": 26.4259765625,
"step": 8040
},
{
"epoch": 0.7318181818181818,
"grad_norm": 193456450306048.0,
"learning_rate": 1.673137489134921e-07,
"loss": 26.351275634765624,
"step": 8050
},
{
"epoch": 0.7327272727272728,
"grad_norm": 61600425836544.0,
"learning_rate": 1.6624909123006575e-07,
"loss": 26.925289916992188,
"step": 8060
},
{
"epoch": 0.7336363636363636,
"grad_norm": 259621981782016.0,
"learning_rate": 1.651871558501099e-07,
"loss": 26.745242309570312,
"step": 8070
},
{
"epoch": 0.7345454545454545,
"grad_norm": 150932784414720.0,
"learning_rate": 1.6412795143550427e-07,
"loss": 26.458816528320312,
"step": 8080
},
{
"epoch": 0.7354545454545455,
"grad_norm": 522992664707072.0,
"learning_rate": 1.6307148662585362e-07,
"loss": 26.513919067382812,
"step": 8090
},
{
"epoch": 0.7363636363636363,
"grad_norm": 129581780566016.0,
"learning_rate": 1.6201777003841633e-07,
"loss": 26.6354248046875,
"step": 8100
},
{
"epoch": 0.7363636363636363,
"eval_loss": 26.260547637939453,
"eval_runtime": 2.1543,
"eval_samples_per_second": 16.711,
"eval_steps_per_second": 0.928,
"step": 8100
},
{
"epoch": 0.7372727272727273,
"grad_norm": 220818277662720.0,
"learning_rate": 1.6096681026803443e-07,
"loss": 26.771890258789064,
"step": 8110
},
{
"epoch": 0.7381818181818182,
"grad_norm": 389124204789760.0,
"learning_rate": 1.5991861588706306e-07,
"loss": 26.528866577148438,
"step": 8120
},
{
"epoch": 0.7390909090909091,
"grad_norm": 421828568809472.0,
"learning_rate": 1.588731954453018e-07,
"loss": 26.294219970703125,
"step": 8130
},
{
"epoch": 0.74,
"grad_norm": 186962057101312.0,
"learning_rate": 1.5783055746992312e-07,
"loss": 26.486737060546876,
"step": 8140
},
{
"epoch": 0.740909090909091,
"grad_norm": 320954349649920.0,
"learning_rate": 1.5679071046540432e-07,
"loss": 26.416116333007814,
"step": 8150
},
{
"epoch": 0.7418181818181818,
"grad_norm": 448088032411648.0,
"learning_rate": 1.5575366291345759e-07,
"loss": 26.369647216796874,
"step": 8160
},
{
"epoch": 0.7427272727272727,
"grad_norm": 405070747271168.0,
"learning_rate": 1.547194232729604e-07,
"loss": 26.7183837890625,
"step": 8170
},
{
"epoch": 0.7436363636363637,
"grad_norm": 392587995250688.0,
"learning_rate": 1.536879999798874e-07,
"loss": 26.57523193359375,
"step": 8180
},
{
"epoch": 0.7445454545454545,
"grad_norm": 414031860989952.0,
"learning_rate": 1.5265940144724114e-07,
"loss": 26.745343017578126,
"step": 8190
},
{
"epoch": 0.7454545454545455,
"grad_norm": 151567047065600.0,
"learning_rate": 1.516336360649834e-07,
"loss": 26.580767822265624,
"step": 8200
},
{
"epoch": 0.7454545454545455,
"eval_loss": 26.26454734802246,
"eval_runtime": 2.1459,
"eval_samples_per_second": 16.776,
"eval_steps_per_second": 0.932,
"step": 8200
},
{
"epoch": 0.7463636363636363,
"grad_norm": 140819075956736.0,
"learning_rate": 1.506107121999664e-07,
"loss": 26.278732299804688,
"step": 8210
},
{
"epoch": 0.7472727272727273,
"grad_norm": 66263875321856.0,
"learning_rate": 1.4959063819586593e-07,
"loss": 26.610507202148437,
"step": 8220
},
{
"epoch": 0.7481818181818182,
"grad_norm": 438402814050304.0,
"learning_rate": 1.4857342237311138e-07,
"loss": 26.609988403320312,
"step": 8230
},
{
"epoch": 0.7490909090909091,
"grad_norm": 509375739330560.0,
"learning_rate": 1.4755907302881927e-07,
"loss": 26.591030883789063,
"step": 8240
},
{
"epoch": 0.75,
"grad_norm": 469766544293888.0,
"learning_rate": 1.465475984367253e-07,
"loss": 26.608944702148438,
"step": 8250
},
{
"epoch": 0.7509090909090909,
"grad_norm": 205435751628800.0,
"learning_rate": 1.4553900684711623e-07,
"loss": 26.571286010742188,
"step": 8260
},
{
"epoch": 0.7518181818181818,
"grad_norm": 146254860386304.0,
"learning_rate": 1.4453330648676338e-07,
"loss": 26.6401611328125,
"step": 8270
},
{
"epoch": 0.7527272727272727,
"grad_norm": 406260688093184.0,
"learning_rate": 1.435305055588552e-07,
"loss": 26.502618408203126,
"step": 8280
},
{
"epoch": 0.7536363636363637,
"grad_norm": 163714019885056.0,
"learning_rate": 1.425306122429305e-07,
"loss": 26.30799560546875,
"step": 8290
},
{
"epoch": 0.7545454545454545,
"grad_norm": 265974758506496.0,
"learning_rate": 1.4153363469481107e-07,
"loss": 26.497518920898436,
"step": 8300
},
{
"epoch": 0.7545454545454545,
"eval_loss": 26.25794792175293,
"eval_runtime": 2.1488,
"eval_samples_per_second": 16.753,
"eval_steps_per_second": 0.931,
"step": 8300
},
{
"epoch": 0.7554545454545455,
"grad_norm": 144185525010432.0,
"learning_rate": 1.4053958104653612e-07,
"loss": 26.401416015625,
"step": 8310
},
{
"epoch": 0.7563636363636363,
"grad_norm": 80316861513728.0,
"learning_rate": 1.395484594062954e-07,
"loss": 26.3766357421875,
"step": 8320
},
{
"epoch": 0.7572727272727273,
"grad_norm": 405346531147776.0,
"learning_rate": 1.3856027785836333e-07,
"loss": 26.344137573242186,
"step": 8330
},
{
"epoch": 0.7581818181818182,
"grad_norm": 155818091610112.0,
"learning_rate": 1.3757504446303248e-07,
"loss": 26.66131591796875,
"step": 8340
},
{
"epoch": 0.759090909090909,
"grad_norm": 264115809419264.0,
"learning_rate": 1.365927672565486e-07,
"loss": 26.72258605957031,
"step": 8350
},
{
"epoch": 0.76,
"grad_norm": 289586693537792.0,
"learning_rate": 1.356134542510448e-07,
"loss": 26.394635009765626,
"step": 8360
},
{
"epoch": 0.7609090909090909,
"grad_norm": 74874424918016.0,
"learning_rate": 1.3463711343447547e-07,
"loss": 26.273269653320312,
"step": 8370
},
{
"epoch": 0.7618181818181818,
"grad_norm": 576587481219072.0,
"learning_rate": 1.336637527705529e-07,
"loss": 26.7587890625,
"step": 8380
},
{
"epoch": 0.7627272727272727,
"grad_norm": 132786539200512.0,
"learning_rate": 1.3269338019868003e-07,
"loss": 26.890203857421874,
"step": 8390
},
{
"epoch": 0.7636363636363637,
"grad_norm": 113306773749760.0,
"learning_rate": 1.3172600363388752e-07,
"loss": 26.88782958984375,
"step": 8400
},
{
"epoch": 0.7636363636363637,
"eval_loss": 26.261314392089844,
"eval_runtime": 2.1523,
"eval_samples_per_second": 16.726,
"eval_steps_per_second": 0.929,
"step": 8400
},
{
"epoch": 0.7645454545454545,
"grad_norm": 287690733912064.0,
"learning_rate": 1.3076163096676828e-07,
"loss": 25.92532958984375,
"step": 8410
},
{
"epoch": 0.7654545454545455,
"grad_norm": 170665340567552.0,
"learning_rate": 1.2980027006341371e-07,
"loss": 26.285894775390624,
"step": 8420
},
{
"epoch": 0.7663636363636364,
"grad_norm": 293886157127680.0,
"learning_rate": 1.288419287653485e-07,
"loss": 26.6665771484375,
"step": 8430
},
{
"epoch": 0.7672727272727272,
"grad_norm": 211919927508992.0,
"learning_rate": 1.2788661488946788e-07,
"loss": 26.39056396484375,
"step": 8440
},
{
"epoch": 0.7681818181818182,
"grad_norm": 160566647717888.0,
"learning_rate": 1.2693433622797346e-07,
"loss": 26.330914306640626,
"step": 8450
},
{
"epoch": 0.769090909090909,
"grad_norm": 168821155430400.0,
"learning_rate": 1.2598510054830885e-07,
"loss": 26.57433166503906,
"step": 8460
},
{
"epoch": 0.77,
"grad_norm": 341319708835840.0,
"learning_rate": 1.250389155930976e-07,
"loss": 26.557040405273437,
"step": 8470
},
{
"epoch": 0.7709090909090909,
"grad_norm": 291579591917568.0,
"learning_rate": 1.240957890800793e-07,
"loss": 26.230010986328125,
"step": 8480
},
{
"epoch": 0.7718181818181818,
"grad_norm": 246938574258176.0,
"learning_rate": 1.2315572870204665e-07,
"loss": 26.432733154296876,
"step": 8490
},
{
"epoch": 0.7727272727272727,
"grad_norm": 275942924615680.0,
"learning_rate": 1.2221874212678295e-07,
"loss": 26.655825805664062,
"step": 8500
},
{
"epoch": 0.7727272727272727,
"eval_loss": 26.262447357177734,
"eval_runtime": 2.1593,
"eval_samples_per_second": 16.672,
"eval_steps_per_second": 0.926,
"step": 8500
},
{
"epoch": 0.7736363636363637,
"grad_norm": 252627107446784.0,
"learning_rate": 1.212848369969996e-07,
"loss": 26.5862548828125,
"step": 8510
},
{
"epoch": 0.7745454545454545,
"grad_norm": 349064071741440.0,
"learning_rate": 1.2035402093027298e-07,
"loss": 26.767044067382812,
"step": 8520
},
{
"epoch": 0.7754545454545455,
"grad_norm": 215884400427008.0,
"learning_rate": 1.1942630151898353e-07,
"loss": 26.34154357910156,
"step": 8530
},
{
"epoch": 0.7763636363636364,
"grad_norm": 109126453559296.0,
"learning_rate": 1.1850168633025321e-07,
"loss": 26.6445556640625,
"step": 8540
},
{
"epoch": 0.7772727272727272,
"grad_norm": 59685176606720.0,
"learning_rate": 1.1758018290588328e-07,
"loss": 26.464410400390626,
"step": 8550
},
{
"epoch": 0.7781818181818182,
"grad_norm": 336345364955136.0,
"learning_rate": 1.1666179876229382e-07,
"loss": 26.180218505859376,
"step": 8560
},
{
"epoch": 0.7790909090909091,
"grad_norm": 258242475196416.0,
"learning_rate": 1.1574654139046169e-07,
"loss": 26.63001708984375,
"step": 8570
},
{
"epoch": 0.78,
"grad_norm": 308295034208256.0,
"learning_rate": 1.1483441825585982e-07,
"loss": 26.5321044921875,
"step": 8580
},
{
"epoch": 0.7809090909090909,
"grad_norm": 256095578750976.0,
"learning_rate": 1.139254367983955e-07,
"loss": 26.616192626953126,
"step": 8590
},
{
"epoch": 0.7818181818181819,
"grad_norm": 433377970749440.0,
"learning_rate": 1.1301960443235137e-07,
"loss": 26.703271484375,
"step": 8600
},
{
"epoch": 0.7818181818181819,
"eval_loss": 26.259233474731445,
"eval_runtime": 2.1684,
"eval_samples_per_second": 16.602,
"eval_steps_per_second": 0.922,
"step": 8600
},
{
"epoch": 0.7827272727272727,
"grad_norm": 91433688104960.0,
"learning_rate": 1.1211692854632292e-07,
"loss": 26.381759643554688,
"step": 8610
},
{
"epoch": 0.7836363636363637,
"grad_norm": 323897308217344.0,
"learning_rate": 1.1121741650315975e-07,
"loss": 26.4834228515625,
"step": 8620
},
{
"epoch": 0.7845454545454545,
"grad_norm": 615513239584768.0,
"learning_rate": 1.1032107563990489e-07,
"loss": 26.638949584960937,
"step": 8630
},
{
"epoch": 0.7854545454545454,
"grad_norm": 144044713836544.0,
"learning_rate": 1.0942791326773481e-07,
"loss": 26.390069580078126,
"step": 8640
},
{
"epoch": 0.7863636363636364,
"grad_norm": 226855877607424.0,
"learning_rate": 1.085379366719002e-07,
"loss": 26.581057739257812,
"step": 8650
},
{
"epoch": 0.7872727272727272,
"grad_norm": 750627542007808.0,
"learning_rate": 1.0765115311166634e-07,
"loss": 26.551568603515626,
"step": 8660
},
{
"epoch": 0.7881818181818182,
"grad_norm": 386196177944576.0,
"learning_rate": 1.0676756982025403e-07,
"loss": 26.428280639648438,
"step": 8670
},
{
"epoch": 0.7890909090909091,
"grad_norm": 159711546572800.0,
"learning_rate": 1.0588719400478002e-07,
"loss": 26.626437377929687,
"step": 8680
},
{
"epoch": 0.79,
"grad_norm": 170563821633536.0,
"learning_rate": 1.0501003284619908e-07,
"loss": 26.475860595703125,
"step": 8690
},
{
"epoch": 0.7909090909090909,
"grad_norm": 134558968184832.0,
"learning_rate": 1.041360934992449e-07,
"loss": 26.157559204101563,
"step": 8700
},
{
"epoch": 0.7909090909090909,
"eval_loss": 26.25774574279785,
"eval_runtime": 2.1872,
"eval_samples_per_second": 16.46,
"eval_steps_per_second": 0.914,
"step": 8700
},
{
"epoch": 0.7918181818181819,
"grad_norm": 72320622264320.0,
"learning_rate": 1.0326538309237198e-07,
"loss": 26.85352478027344,
"step": 8710
},
{
"epoch": 0.7927272727272727,
"grad_norm": 481769501491200.0,
"learning_rate": 1.0239790872769688e-07,
"loss": 26.115414428710938,
"step": 8720
},
{
"epoch": 0.7936363636363636,
"grad_norm": 342039317184512.0,
"learning_rate": 1.0153367748094126e-07,
"loss": 26.53397216796875,
"step": 8730
},
{
"epoch": 0.7945454545454546,
"grad_norm": 404055557931008.0,
"learning_rate": 1.006726964013736e-07,
"loss": 26.39664306640625,
"step": 8740
},
{
"epoch": 0.7954545454545454,
"grad_norm": 81613387988992.0,
"learning_rate": 9.98149725117512e-08,
"loss": 26.064663696289063,
"step": 8750
},
{
"epoch": 0.7963636363636364,
"grad_norm": 350235490516992.0,
"learning_rate": 9.896051280826451e-08,
"loss": 26.903762817382812,
"step": 8760
},
{
"epoch": 0.7972727272727272,
"grad_norm": 459837653647360.0,
"learning_rate": 9.810932426047802e-08,
"loss": 26.57601318359375,
"step": 8770
},
{
"epoch": 0.7981818181818182,
"grad_norm": 147279679848448.0,
"learning_rate": 9.72614138112749e-08,
"loss": 26.590640258789062,
"step": 8780
},
{
"epoch": 0.7990909090909091,
"grad_norm": 417567155945472.0,
"learning_rate": 9.641678837679983e-08,
"loss": 26.296502685546876,
"step": 8790
},
{
"epoch": 0.8,
"grad_norm": 84892301918208.0,
"learning_rate": 9.557545484640273e-08,
"loss": 26.586184692382812,
"step": 8800
},
{
"epoch": 0.8,
"eval_loss": 26.26275634765625,
"eval_runtime": 2.1775,
"eval_samples_per_second": 16.532,
"eval_steps_per_second": 0.918,
"step": 8800
},
{
"epoch": 0.8009090909090909,
"grad_norm": 709094000295936.0,
"learning_rate": 9.4737420082582e-08,
"loss": 26.503372192382812,
"step": 8810
},
{
"epoch": 0.8018181818181818,
"grad_norm": 214880770588672.0,
"learning_rate": 9.390269092092956e-08,
"loss": 26.727926635742186,
"step": 8820
},
{
"epoch": 0.8027272727272727,
"grad_norm": 206503084556288.0,
"learning_rate": 9.307127417007444e-08,
"loss": 26.764566040039064,
"step": 8830
},
{
"epoch": 0.8036363636363636,
"grad_norm": 105237830434816.0,
"learning_rate": 9.224317661162684e-08,
"loss": 26.60999755859375,
"step": 8840
},
{
"epoch": 0.8045454545454546,
"grad_norm": 101385144107008.0,
"learning_rate": 9.141840500012437e-08,
"loss": 26.486932373046876,
"step": 8850
},
{
"epoch": 0.8054545454545454,
"grad_norm": 195066056409088.0,
"learning_rate": 9.059696606297479e-08,
"loss": 26.113775634765624,
"step": 8860
},
{
"epoch": 0.8063636363636364,
"grad_norm": 116232594391040.0,
"learning_rate": 8.977886650040289e-08,
"loss": 26.361734008789064,
"step": 8870
},
{
"epoch": 0.8072727272727273,
"grad_norm": 459080464334848.0,
"learning_rate": 8.89641129853952e-08,
"loss": 26.5644287109375,
"step": 8880
},
{
"epoch": 0.8081818181818182,
"grad_norm": 279257364299776.0,
"learning_rate": 8.81527121636454e-08,
"loss": 26.242138671875,
"step": 8890
},
{
"epoch": 0.8090909090909091,
"grad_norm": 177674492313600.0,
"learning_rate": 8.734467065350021e-08,
"loss": 26.649420166015624,
"step": 8900
},
{
"epoch": 0.8090909090909091,
"eval_loss": 26.255714416503906,
"eval_runtime": 2.1572,
"eval_samples_per_second": 16.689,
"eval_steps_per_second": 0.927,
"step": 8900
},
{
"epoch": 0.81,
"grad_norm": 408893402382336.0,
"learning_rate": 8.65399950459057e-08,
"loss": 26.4176025390625,
"step": 8910
},
{
"epoch": 0.8109090909090909,
"grad_norm": 166783998754816.0,
"learning_rate": 8.573869190435335e-08,
"loss": 26.493902587890624,
"step": 8920
},
{
"epoch": 0.8118181818181818,
"grad_norm": 176515757113344.0,
"learning_rate": 8.4940767764826e-08,
"loss": 26.102850341796874,
"step": 8930
},
{
"epoch": 0.8127272727272727,
"grad_norm": 542467724148736.0,
"learning_rate": 8.414622913574549e-08,
"loss": 26.501849365234374,
"step": 8940
},
{
"epoch": 0.8136363636363636,
"grad_norm": 216477290463232.0,
"learning_rate": 8.3355082497919e-08,
"loss": 26.50646057128906,
"step": 8950
},
{
"epoch": 0.8145454545454546,
"grad_norm": 122593944272896.0,
"learning_rate": 8.256733430448637e-08,
"loss": 26.44368896484375,
"step": 8960
},
{
"epoch": 0.8154545454545454,
"grad_norm": 182341729255424.0,
"learning_rate": 8.178299098086678e-08,
"loss": 26.42027893066406,
"step": 8970
},
{
"epoch": 0.8163636363636364,
"grad_norm": 612390999687168.0,
"learning_rate": 8.100205892470785e-08,
"loss": 27.214886474609376,
"step": 8980
},
{
"epoch": 0.8172727272727273,
"grad_norm": 336913676369920.0,
"learning_rate": 8.022454450583183e-08,
"loss": 26.410107421875,
"step": 8990
},
{
"epoch": 0.8181818181818182,
"grad_norm": 358478572945408.0,
"learning_rate": 7.945045406618462e-08,
"loss": 26.294644165039063,
"step": 9000
},
{
"epoch": 0.8181818181818182,
"eval_loss": 26.25908088684082,
"eval_runtime": 2.195,
"eval_samples_per_second": 16.401,
"eval_steps_per_second": 0.911,
"step": 9000
},
{
"epoch": 0.8190909090909091,
"grad_norm": 216634107101184.0,
"learning_rate": 7.867979391978396e-08,
"loss": 26.5111083984375,
"step": 9010
},
{
"epoch": 0.82,
"grad_norm": 460943641280512.0,
"learning_rate": 7.791257035266719e-08,
"loss": 26.373800659179686,
"step": 9020
},
{
"epoch": 0.8209090909090909,
"grad_norm": 207550905581568.0,
"learning_rate": 7.71487896228411e-08,
"loss": 26.439486694335937,
"step": 9030
},
{
"epoch": 0.8218181818181818,
"grad_norm": 164937984901120.0,
"learning_rate": 7.638845796023002e-08,
"loss": 26.551513671875,
"step": 9040
},
{
"epoch": 0.8227272727272728,
"grad_norm": 467092792934400.0,
"learning_rate": 7.563158156662552e-08,
"loss": 26.31507568359375,
"step": 9050
},
{
"epoch": 0.8236363636363636,
"grad_norm": 270167032463360.0,
"learning_rate": 7.487816661563523e-08,
"loss": 26.83199462890625,
"step": 9060
},
{
"epoch": 0.8245454545454546,
"grad_norm": 329480295940096.0,
"learning_rate": 7.412821925263324e-08,
"loss": 26.249203491210938,
"step": 9070
},
{
"epoch": 0.8254545454545454,
"grad_norm": 176404423507968.0,
"learning_rate": 7.338174559470933e-08,
"loss": 26.442239379882814,
"step": 9080
},
{
"epoch": 0.8263636363636364,
"grad_norm": 232708089315328.0,
"learning_rate": 7.263875173061968e-08,
"loss": 26.62685546875,
"step": 9090
},
{
"epoch": 0.8272727272727273,
"grad_norm": 264557184417792.0,
"learning_rate": 7.189924372073631e-08,
"loss": 26.332183837890625,
"step": 9100
},
{
"epoch": 0.8272727272727273,
"eval_loss": 26.257953643798828,
"eval_runtime": 2.2005,
"eval_samples_per_second": 16.36,
"eval_steps_per_second": 0.909,
"step": 9100
},
{
"epoch": 0.8281818181818181,
"grad_norm": 170234988199936.0,
"learning_rate": 7.116322759699867e-08,
"loss": 26.33367919921875,
"step": 9110
},
{
"epoch": 0.8290909090909091,
"grad_norm": 260837423972352.0,
"learning_rate": 7.043070936286393e-08,
"loss": 26.51810302734375,
"step": 9120
},
{
"epoch": 0.83,
"grad_norm": 208293901369344.0,
"learning_rate": 6.970169499325757e-08,
"loss": 26.384710693359374,
"step": 9130
},
{
"epoch": 0.8309090909090909,
"grad_norm": 140174285602816.0,
"learning_rate": 6.89761904345259e-08,
"loss": 26.527005004882813,
"step": 9140
},
{
"epoch": 0.8318181818181818,
"grad_norm": 260585463742464.0,
"learning_rate": 6.825420160438617e-08,
"loss": 26.76141357421875,
"step": 9150
},
{
"epoch": 0.8327272727272728,
"grad_norm": 127458984591360.0,
"learning_rate": 6.753573439187915e-08,
"loss": 26.833413696289064,
"step": 9160
},
{
"epoch": 0.8336363636363636,
"grad_norm": 94211844079616.0,
"learning_rate": 6.682079465732076e-08,
"loss": 26.543435668945314,
"step": 9170
},
{
"epoch": 0.8345454545454546,
"grad_norm": 84640207470592.0,
"learning_rate": 6.61093882322547e-08,
"loss": 25.99791564941406,
"step": 9180
},
{
"epoch": 0.8354545454545454,
"grad_norm": 375480100323328.0,
"learning_rate": 6.540152091940393e-08,
"loss": 26.548089599609376,
"step": 9190
},
{
"epoch": 0.8363636363636363,
"grad_norm": 322556707995648.0,
"learning_rate": 6.469719849262445e-08,
"loss": 26.38921203613281,
"step": 9200
},
{
"epoch": 0.8363636363636363,
"eval_loss": 26.251873016357422,
"eval_runtime": 2.1916,
"eval_samples_per_second": 16.426,
"eval_steps_per_second": 0.913,
"step": 9200
},
{
"epoch": 0.8372727272727273,
"grad_norm": 52027614822400.0,
"learning_rate": 6.399642669685773e-08,
"loss": 27.601669311523438,
"step": 9210
},
{
"epoch": 0.8381818181818181,
"grad_norm": 116149614280704.0,
"learning_rate": 6.329921124808335e-08,
"loss": 26.614300537109376,
"step": 9220
},
{
"epoch": 0.8390909090909091,
"grad_norm": 124626520768512.0,
"learning_rate": 6.260555783327364e-08,
"loss": 26.363275146484376,
"step": 9230
},
{
"epoch": 0.84,
"grad_norm": 194277174935552.0,
"learning_rate": 6.19154721103457e-08,
"loss": 26.312432861328126,
"step": 9240
},
{
"epoch": 0.8409090909090909,
"grad_norm": 203244177457152.0,
"learning_rate": 6.122895970811659e-08,
"loss": 26.483282470703124,
"step": 9250
},
{
"epoch": 0.8418181818181818,
"grad_norm": 96889949126656.0,
"learning_rate": 6.054602622625676e-08,
"loss": 26.408782958984375,
"step": 9260
},
{
"epoch": 0.8427272727272728,
"grad_norm": 228295429849088.0,
"learning_rate": 5.986667723524452e-08,
"loss": 26.440960693359376,
"step": 9270
},
{
"epoch": 0.8436363636363636,
"grad_norm": 259944691531776.0,
"learning_rate": 5.919091827632039e-08,
"loss": 26.412326049804687,
"step": 9280
},
{
"epoch": 0.8445454545454546,
"grad_norm": 123276919570432.0,
"learning_rate": 5.8518754861442424e-08,
"loss": 26.436785888671874,
"step": 9290
},
{
"epoch": 0.8454545454545455,
"grad_norm": 175674060963840.0,
"learning_rate": 5.78501924732408e-08,
"loss": 26.9662353515625,
"step": 9300
},
{
"epoch": 0.8454545454545455,
"eval_loss": 26.25527000427246,
"eval_runtime": 2.1682,
"eval_samples_per_second": 16.604,
"eval_steps_per_second": 0.922,
"step": 9300
},
{
"epoch": 0.8463636363636363,
"grad_norm": 107211535679488.0,
"learning_rate": 5.7185236564973035e-08,
"loss": 26.846856689453126,
"step": 9310
},
{
"epoch": 0.8472727272727273,
"grad_norm": 466499886120960.0,
"learning_rate": 5.6523892560479957e-08,
"loss": 26.620623779296874,
"step": 9320
},
{
"epoch": 0.8481818181818181,
"grad_norm": 94389649014784.0,
"learning_rate": 5.586616585414117e-08,
"loss": 26.862652587890626,
"step": 9330
},
{
"epoch": 0.8490909090909091,
"grad_norm": 437626666483712.0,
"learning_rate": 5.52120618108311e-08,
"loss": 26.546505737304688,
"step": 9340
},
{
"epoch": 0.85,
"grad_norm": 238070909632512.0,
"learning_rate": 5.456158576587488e-08,
"loss": 26.345050048828124,
"step": 9350
},
{
"epoch": 0.850909090909091,
"grad_norm": 214509339803648.0,
"learning_rate": 5.391474302500581e-08,
"loss": 26.43468322753906,
"step": 9360
},
{
"epoch": 0.8518181818181818,
"grad_norm": 208559971237888.0,
"learning_rate": 5.32715388643209e-08,
"loss": 26.35069885253906,
"step": 9370
},
{
"epoch": 0.8527272727272728,
"grad_norm": 621268160217088.0,
"learning_rate": 5.26319785302386e-08,
"loss": 26.375735473632812,
"step": 9380
},
{
"epoch": 0.8536363636363636,
"grad_norm": 419072072220672.0,
"learning_rate": 5.199606723945593e-08,
"loss": 26.826263427734375,
"step": 9390
},
{
"epoch": 0.8545454545454545,
"grad_norm": 682285284196352.0,
"learning_rate": 5.1363810178905344e-08,
"loss": 26.34708251953125,
"step": 9400
},
{
"epoch": 0.8545454545454545,
"eval_loss": 26.255863189697266,
"eval_runtime": 2.1871,
"eval_samples_per_second": 16.46,
"eval_steps_per_second": 0.914,
"step": 9400
},
{
"epoch": 0.8554545454545455,
"grad_norm": 89044629323776.0,
"learning_rate": 5.073521250571328e-08,
"loss": 26.50580749511719,
"step": 9410
},
{
"epoch": 0.8563636363636363,
"grad_norm": 216007075430400.0,
"learning_rate": 5.0110279347157555e-08,
"loss": 26.41748046875,
"step": 9420
},
{
"epoch": 0.8572727272727273,
"grad_norm": 474563418783744.0,
"learning_rate": 4.9489015800625755e-08,
"loss": 26.493084716796876,
"step": 9430
},
{
"epoch": 0.8581818181818182,
"grad_norm": 379049620799488.0,
"learning_rate": 4.887142693357332e-08,
"loss": 26.464553833007812,
"step": 9440
},
{
"epoch": 0.8590909090909091,
"grad_norm": 80948934737920.0,
"learning_rate": 4.825751778348258e-08,
"loss": 26.62518310546875,
"step": 9450
},
{
"epoch": 0.86,
"grad_norm": 145902236860416.0,
"learning_rate": 4.76472933578217e-08,
"loss": 26.272061157226563,
"step": 9460
},
{
"epoch": 0.860909090909091,
"grad_norm": 443239853195264.0,
"learning_rate": 4.7040758634003585e-08,
"loss": 26.57243957519531,
"step": 9470
},
{
"epoch": 0.8618181818181818,
"grad_norm": 133928698511360.0,
"learning_rate": 4.6437918559345257e-08,
"loss": 26.390667724609376,
"step": 9480
},
{
"epoch": 0.8627272727272727,
"grad_norm": 188859761557504.0,
"learning_rate": 4.583877805102765e-08,
"loss": 26.467236328125,
"step": 9490
},
{
"epoch": 0.8636363636363636,
"grad_norm": 305761909473280.0,
"learning_rate": 4.5243341996055785e-08,
"loss": 26.252215576171874,
"step": 9500
},
{
"epoch": 0.8636363636363636,
"eval_loss": 26.259260177612305,
"eval_runtime": 2.1624,
"eval_samples_per_second": 16.648,
"eval_steps_per_second": 0.925,
"step": 9500
},
{
"epoch": 0.8645454545454545,
"grad_norm": 203417435766784.0,
"learning_rate": 4.465161525121797e-08,
"loss": 26.584759521484376,
"step": 9510
},
{
"epoch": 0.8654545454545455,
"grad_norm": 80916454047744.0,
"learning_rate": 4.406360264304759e-08,
"loss": 26.7392333984375,
"step": 9520
},
{
"epoch": 0.8663636363636363,
"grad_norm": 93687598022656.0,
"learning_rate": 4.3479308967782345e-08,
"loss": 26.5811767578125,
"step": 9530
},
{
"epoch": 0.8672727272727273,
"grad_norm": 391817216393216.0,
"learning_rate": 4.289873899132601e-08,
"loss": 26.5900146484375,
"step": 9540
},
{
"epoch": 0.8681818181818182,
"grad_norm": 220526203109376.0,
"learning_rate": 4.232189744920922e-08,
"loss": 26.462973022460936,
"step": 9550
},
{
"epoch": 0.8690909090909091,
"grad_norm": 294352429514752.0,
"learning_rate": 4.1748789046551046e-08,
"loss": 26.616650390625,
"step": 9560
},
{
"epoch": 0.87,
"grad_norm": 173306795786240.0,
"learning_rate": 4.117941845802026e-08,
"loss": 26.646002197265624,
"step": 9570
},
{
"epoch": 0.8709090909090909,
"grad_norm": 351010866331648.0,
"learning_rate": 4.06137903277976e-08,
"loss": 26.28143310546875,
"step": 9580
},
{
"epoch": 0.8718181818181818,
"grad_norm": 102902408413184.0,
"learning_rate": 4.0051909269537776e-08,
"loss": 26.641571044921875,
"step": 9590
},
{
"epoch": 0.8727272727272727,
"grad_norm": 173646198865920.0,
"learning_rate": 3.9493779866331457e-08,
"loss": 26.6406982421875,
"step": 9600
},
{
"epoch": 0.8727272727272727,
"eval_loss": 26.25297737121582,
"eval_runtime": 2.2018,
"eval_samples_per_second": 16.35,
"eval_steps_per_second": 0.908,
"step": 9600
},
{
"epoch": 0.8736363636363637,
"grad_norm": 186953400057856.0,
"learning_rate": 3.893940667066875e-08,
"loss": 26.639181518554686,
"step": 9610
},
{
"epoch": 0.8745454545454545,
"grad_norm": 119041461059584.0,
"learning_rate": 3.8388794204401055e-08,
"loss": 26.684365844726564,
"step": 9620
},
{
"epoch": 0.8754545454545455,
"grad_norm": 393604358995968.0,
"learning_rate": 3.784194695870485e-08,
"loss": 26.53135986328125,
"step": 9630
},
{
"epoch": 0.8763636363636363,
"grad_norm": 265332392460288.0,
"learning_rate": 3.7298869394044865e-08,
"loss": 26.410488891601563,
"step": 9640
},
{
"epoch": 0.8772727272727273,
"grad_norm": 469139042861056.0,
"learning_rate": 3.6759565940137846e-08,
"loss": 26.624411010742186,
"step": 9650
},
{
"epoch": 0.8781818181818182,
"grad_norm": 233339919269888.0,
"learning_rate": 3.6224040995915915e-08,
"loss": 26.61990966796875,
"step": 9660
},
{
"epoch": 0.8790909090909091,
"grad_norm": 160247746396160.0,
"learning_rate": 3.569229892949133e-08,
"loss": 26.281167602539064,
"step": 9670
},
{
"epoch": 0.88,
"grad_norm": 231272144175104.0,
"learning_rate": 3.516434407812063e-08,
"loss": 26.265048217773437,
"step": 9680
},
{
"epoch": 0.8809090909090909,
"grad_norm": 162941127098368.0,
"learning_rate": 3.464018074816893e-08,
"loss": 26.53309326171875,
"step": 9690
},
{
"epoch": 0.8818181818181818,
"grad_norm": 235812629250048.0,
"learning_rate": 3.411981321507523e-08,
"loss": 26.598037719726562,
"step": 9700
},
{
"epoch": 0.8818181818181818,
"eval_loss": 26.255329132080078,
"eval_runtime": 2.1559,
"eval_samples_per_second": 16.698,
"eval_steps_per_second": 0.928,
"step": 9700
},
{
"epoch": 0.8827272727272727,
"grad_norm": 529596579577856.0,
"learning_rate": 3.360324572331752e-08,
"loss": 26.505670166015626,
"step": 9710
},
{
"epoch": 0.8836363636363637,
"grad_norm": 209934092337152.0,
"learning_rate": 3.3090482486377854e-08,
"loss": 26.292486572265624,
"step": 9720
},
{
"epoch": 0.8845454545454545,
"grad_norm": 68720860856320.0,
"learning_rate": 3.258152768670802e-08,
"loss": 26.464907836914062,
"step": 9730
},
{
"epoch": 0.8854545454545455,
"grad_norm": 120226192556032.0,
"learning_rate": 3.207638547569597e-08,
"loss": 26.43253173828125,
"step": 9740
},
{
"epoch": 0.8863636363636364,
"grad_norm": 203593093218304.0,
"learning_rate": 3.157505997363108e-08,
"loss": 26.225360107421874,
"step": 9750
},
{
"epoch": 0.8872727272727273,
"grad_norm": 110963525156864.0,
"learning_rate": 3.107755526967132e-08,
"loss": 26.272589111328124,
"step": 9760
},
{
"epoch": 0.8881818181818182,
"grad_norm": 228354837970944.0,
"learning_rate": 3.058387542180951e-08,
"loss": 26.39100341796875,
"step": 9770
},
{
"epoch": 0.889090909090909,
"grad_norm": 211785055469568.0,
"learning_rate": 3.009402445684017e-08,
"loss": 26.599038696289064,
"step": 9780
},
{
"epoch": 0.89,
"grad_norm": 439669493858304.0,
"learning_rate": 2.9608006370326955e-08,
"loss": 26.343658447265625,
"step": 9790
},
{
"epoch": 0.8909090909090909,
"grad_norm": 124145425711104.0,
"learning_rate": 2.912582512656986e-08,
"loss": 26.353958129882812,
"step": 9800
},
{
"epoch": 0.8909090909090909,
"eval_loss": 26.251920700073242,
"eval_runtime": 2.1837,
"eval_samples_per_second": 16.485,
"eval_steps_per_second": 0.916,
"step": 9800
},
{
"epoch": 0.8918181818181818,
"grad_norm": 218182426034176.0,
"learning_rate": 2.8647484658572918e-08,
"loss": 26.384439086914064,
"step": 9810
},
{
"epoch": 0.8927272727272727,
"grad_norm": 458707439714304.0,
"learning_rate": 2.8172988868012117e-08,
"loss": 26.731353759765625,
"step": 9820
},
{
"epoch": 0.8936363636363637,
"grad_norm": 363114386161664.0,
"learning_rate": 2.770234162520363e-08,
"loss": 26.34778747558594,
"step": 9830
},
{
"epoch": 0.8945454545454545,
"grad_norm": 473513165062144.0,
"learning_rate": 2.7235546769072247e-08,
"loss": 25.989871215820312,
"step": 9840
},
{
"epoch": 0.8954545454545455,
"grad_norm": 453134988083200.0,
"learning_rate": 2.6772608107119954e-08,
"loss": 26.36603698730469,
"step": 9850
},
{
"epoch": 0.8963636363636364,
"grad_norm": 246036849229824.0,
"learning_rate": 2.6313529415394942e-08,
"loss": 26.3845703125,
"step": 9860
},
{
"epoch": 0.8972727272727272,
"grad_norm": 72789880995840.0,
"learning_rate": 2.585831443846087e-08,
"loss": 26.44983825683594,
"step": 9870
},
{
"epoch": 0.8981818181818182,
"grad_norm": 548986779860992.0,
"learning_rate": 2.540696688936622e-08,
"loss": 26.52098388671875,
"step": 9880
},
{
"epoch": 0.899090909090909,
"grad_norm": 388335675637760.0,
"learning_rate": 2.4959490449614094e-08,
"loss": 26.495932006835936,
"step": 9890
},
{
"epoch": 0.9,
"grad_norm": 53976842108928.0,
"learning_rate": 2.4515888769132244e-08,
"loss": 26.7628173828125,
"step": 9900
},
{
"epoch": 0.9,
"eval_loss": 26.25650978088379,
"eval_runtime": 2.1722,
"eval_samples_per_second": 16.573,
"eval_steps_per_second": 0.921,
"step": 9900
},
{
"epoch": 0.9009090909090909,
"grad_norm": 222135859544064.0,
"learning_rate": 2.407616546624286e-08,
"loss": 26.65426025390625,
"step": 9910
},
{
"epoch": 0.9018181818181819,
"grad_norm": 156349862248448.0,
"learning_rate": 2.3640324127633726e-08,
"loss": 26.53638610839844,
"step": 9920
},
{
"epoch": 0.9027272727272727,
"grad_norm": 406163145359360.0,
"learning_rate": 2.3208368308328562e-08,
"loss": 26.672116088867188,
"step": 9930
},
{
"epoch": 0.9036363636363637,
"grad_norm": 290215168049152.0,
"learning_rate": 2.278030153165811e-08,
"loss": 26.395840454101563,
"step": 9940
},
{
"epoch": 0.9045454545454545,
"grad_norm": 323777854439424.0,
"learning_rate": 2.2356127289231198e-08,
"loss": 26.753033447265626,
"step": 9950
},
{
"epoch": 0.9054545454545454,
"grad_norm": 353928558411776.0,
"learning_rate": 2.1935849040906785e-08,
"loss": 26.23077392578125,
"step": 9960
},
{
"epoch": 0.9063636363636364,
"grad_norm": 323219877789696.0,
"learning_rate": 2.1519470214765134e-08,
"loss": 26.30245361328125,
"step": 9970
},
{
"epoch": 0.9072727272727272,
"grad_norm": 102580596244480.0,
"learning_rate": 2.1106994207080176e-08,
"loss": 26.48880615234375,
"step": 9980
},
{
"epoch": 0.9081818181818182,
"grad_norm": 560100477501440.0,
"learning_rate": 2.0698424382291913e-08,
"loss": 26.237164306640626,
"step": 9990
},
{
"epoch": 0.9090909090909091,
"grad_norm": 500201991176192.0,
"learning_rate": 2.0293764072978616e-08,
"loss": 26.076568603515625,
"step": 10000
},
{
"epoch": 0.9090909090909091,
"eval_loss": 26.25713348388672,
"eval_runtime": 2.2039,
"eval_samples_per_second": 16.335,
"eval_steps_per_second": 0.907,
"step": 10000
}
],
"logging_steps": 10,
"max_steps": 11000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.059847634944e+16,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}