CodeIsAbstract's picture
Training in progress, step 5000, checkpoint
18a5474 verified
Raw
History Blame Contribute Delete
103 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.45454545454545453,
"eval_steps": 100,
"global_step": 5000,
"is_hyper_param_search": false,
"is_local_process_zero": false,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0009090909090909091,
"grad_norm": 24835585474560.0,
"learning_rate": 9.999983482695944e-07,
"loss": 31.50365295410156,
"step": 10
},
{
"epoch": 0.0018181818181818182,
"grad_norm": 15793144201216.0,
"learning_rate": 9.999926385982519e-07,
"loss": 31.015130615234376,
"step": 20
},
{
"epoch": 0.0027272727272727275,
"grad_norm": 20612445634560.0,
"learning_rate": 9.999828506408003e-07,
"loss": 31.242529296875,
"step": 30
},
{
"epoch": 0.0036363636363636364,
"grad_norm": 34239179390976.0,
"learning_rate": 9.999689844770766e-07,
"loss": 31.6640625,
"step": 40
},
{
"epoch": 0.004545454545454545,
"grad_norm": 51216444817408.0,
"learning_rate": 9.999510402201835e-07,
"loss": 31.64912109375,
"step": 50
},
{
"epoch": 0.005454545454545455,
"grad_norm": 20637055713280.0,
"learning_rate": 9.99929018016486e-07,
"loss": 31.355593872070312,
"step": 60
},
{
"epoch": 0.006363636363636364,
"grad_norm": 32561835278336.0,
"learning_rate": 9.999029180456129e-07,
"loss": 31.931137084960938,
"step": 70
},
{
"epoch": 0.007272727272727273,
"grad_norm": 68632881135616.0,
"learning_rate": 9.998727405204534e-07,
"loss": 31.378302001953124,
"step": 80
},
{
"epoch": 0.008181818181818182,
"grad_norm": 42669824802816.0,
"learning_rate": 9.998384856871564e-07,
"loss": 31.455963134765625,
"step": 90
},
{
"epoch": 0.00909090909090909,
"grad_norm": 16400540237824.0,
"learning_rate": 9.998001538251282e-07,
"loss": 31.83574523925781,
"step": 100
},
{
"epoch": 0.00909090909090909,
"eval_loss": 31.256309509277344,
"eval_runtime": 22.3946,
"eval_samples_per_second": 0.179,
"eval_steps_per_second": 0.045,
"step": 100
},
{
"epoch": 0.01,
"grad_norm": 29021217751040.0,
"learning_rate": 9.997577452470298e-07,
"loss": 31.68128662109375,
"step": 110
},
{
"epoch": 0.01090909090909091,
"grad_norm": 43289218646016.0,
"learning_rate": 9.99711260298775e-07,
"loss": 31.50353088378906,
"step": 120
},
{
"epoch": 0.011818181818181818,
"grad_norm": 128646291390464.0,
"learning_rate": 9.99660699359527e-07,
"loss": 31.131292724609374,
"step": 130
},
{
"epoch": 0.012727272727272728,
"grad_norm": 37279833784320.0,
"learning_rate": 9.996060628416963e-07,
"loss": 31.5599853515625,
"step": 140
},
{
"epoch": 0.013636363636363636,
"grad_norm": 43879491436544.0,
"learning_rate": 9.995473511909357e-07,
"loss": 31.862338256835937,
"step": 150
},
{
"epoch": 0.014545454545454545,
"grad_norm": 25585361354752.0,
"learning_rate": 9.994845648861382e-07,
"loss": 31.210086059570312,
"step": 160
},
{
"epoch": 0.015454545454545455,
"grad_norm": 90612418215936.0,
"learning_rate": 9.994177044394322e-07,
"loss": 31.158685302734376,
"step": 170
},
{
"epoch": 0.016363636363636365,
"grad_norm": 92622169309184.0,
"learning_rate": 9.993467703961784e-07,
"loss": 31.556906127929686,
"step": 180
},
{
"epoch": 0.017272727272727273,
"grad_norm": 83515236417536.0,
"learning_rate": 9.992717633349635e-07,
"loss": 31.514627075195314,
"step": 190
},
{
"epoch": 0.01818181818181818,
"grad_norm": 42516023869440.0,
"learning_rate": 9.99192683867597e-07,
"loss": 31.424298095703126,
"step": 200
},
{
"epoch": 0.01818181818181818,
"eval_loss": 31.22693634033203,
"eval_runtime": 2.254,
"eval_samples_per_second": 1.775,
"eval_steps_per_second": 0.444,
"step": 200
},
{
"epoch": 0.019090909090909092,
"grad_norm": 74708263370752.0,
"learning_rate": 9.99109532639106e-07,
"loss": 31.736981201171876,
"step": 210
},
{
"epoch": 0.02,
"grad_norm": 137343843434496.0,
"learning_rate": 9.99022310327729e-07,
"loss": 31.506015014648437,
"step": 220
},
{
"epoch": 0.02090909090909091,
"grad_norm": 48417904525312.0,
"learning_rate": 9.98931017644912e-07,
"loss": 31.584011840820313,
"step": 230
},
{
"epoch": 0.02181818181818182,
"grad_norm": 58472024506368.0,
"learning_rate": 9.988356553353017e-07,
"loss": 31.47820129394531,
"step": 240
},
{
"epoch": 0.022727272727272728,
"grad_norm": 19866878738432.0,
"learning_rate": 9.987362241767383e-07,
"loss": 31.335162353515624,
"step": 250
},
{
"epoch": 0.023636363636363636,
"grad_norm": 31799931568128.0,
"learning_rate": 9.986327249802515e-07,
"loss": 30.963482666015626,
"step": 260
},
{
"epoch": 0.024545454545454544,
"grad_norm": 85499729412096.0,
"learning_rate": 9.985251585900525e-07,
"loss": 31.298876953125,
"step": 270
},
{
"epoch": 0.025454545454545455,
"grad_norm": 48352565657600.0,
"learning_rate": 9.984135258835272e-07,
"loss": 31.747039794921875,
"step": 280
},
{
"epoch": 0.026363636363636363,
"grad_norm": 31058988892160.0,
"learning_rate": 9.98297827771229e-07,
"loss": 32.078277587890625,
"step": 290
},
{
"epoch": 0.02727272727272727,
"grad_norm": 77612550455296.0,
"learning_rate": 9.981780651968722e-07,
"loss": 31.41339111328125,
"step": 300
},
{
"epoch": 0.02727272727272727,
"eval_loss": 31.19794273376465,
"eval_runtime": 2.2652,
"eval_samples_per_second": 1.766,
"eval_steps_per_second": 0.441,
"step": 300
},
{
"epoch": 0.028181818181818183,
"grad_norm": 49784861753344.0,
"learning_rate": 9.980542391373232e-07,
"loss": 31.86634521484375,
"step": 310
},
{
"epoch": 0.02909090909090909,
"grad_norm": 97983580340224.0,
"learning_rate": 9.979263506025929e-07,
"loss": 31.366073608398438,
"step": 320
},
{
"epoch": 0.03,
"grad_norm": 40498060328960.0,
"learning_rate": 9.977944006358285e-07,
"loss": 31.210226440429686,
"step": 330
},
{
"epoch": 0.03090909090909091,
"grad_norm": 92092479045632.0,
"learning_rate": 9.976583903133059e-07,
"loss": 30.927703857421875,
"step": 340
},
{
"epoch": 0.031818181818181815,
"grad_norm": 72197787877376.0,
"learning_rate": 9.975183207444189e-07,
"loss": 30.43183288574219,
"step": 350
},
{
"epoch": 0.03272727272727273,
"grad_norm": 46449144365056.0,
"learning_rate": 9.97374193071672e-07,
"loss": 31.0708740234375,
"step": 360
},
{
"epoch": 0.03363636363636364,
"grad_norm": 16542873944064.0,
"learning_rate": 9.972260084706704e-07,
"loss": 31.289712524414064,
"step": 370
},
{
"epoch": 0.034545454545454546,
"grad_norm": 76645293621248.0,
"learning_rate": 9.970737681501104e-07,
"loss": 31.326876831054687,
"step": 380
},
{
"epoch": 0.035454545454545454,
"grad_norm": 24548648943616.0,
"learning_rate": 9.969174733517693e-07,
"loss": 31.130474853515626,
"step": 390
},
{
"epoch": 0.03636363636363636,
"grad_norm": 57560858099712.0,
"learning_rate": 9.967571253504956e-07,
"loss": 31.06658020019531,
"step": 400
},
{
"epoch": 0.03636363636363636,
"eval_loss": 31.173606872558594,
"eval_runtime": 2.2635,
"eval_samples_per_second": 1.767,
"eval_steps_per_second": 0.442,
"step": 400
},
{
"epoch": 0.03727272727272727,
"grad_norm": 40138956603392.0,
"learning_rate": 9.965927254541986e-07,
"loss": 31.133847045898438,
"step": 410
},
{
"epoch": 0.038181818181818185,
"grad_norm": 33342583996416.0,
"learning_rate": 9.964242750038379e-07,
"loss": 31.538308715820314,
"step": 420
},
{
"epoch": 0.03909090909090909,
"grad_norm": 38552683413504.0,
"learning_rate": 9.96251775373412e-07,
"loss": 31.598001098632814,
"step": 430
},
{
"epoch": 0.04,
"grad_norm": 43073170046976.0,
"learning_rate": 9.960752279699469e-07,
"loss": 31.713970947265626,
"step": 440
},
{
"epoch": 0.04090909090909091,
"grad_norm": 63941845712896.0,
"learning_rate": 9.958946342334858e-07,
"loss": 31.403384399414062,
"step": 450
},
{
"epoch": 0.04181818181818182,
"grad_norm": 81496106860544.0,
"learning_rate": 9.957099956370761e-07,
"loss": 31.192584228515624,
"step": 460
},
{
"epoch": 0.042727272727272725,
"grad_norm": 85547368316928.0,
"learning_rate": 9.95521313686758e-07,
"loss": 31.35161437988281,
"step": 470
},
{
"epoch": 0.04363636363636364,
"grad_norm": 33979606499328.0,
"learning_rate": 9.953285899215524e-07,
"loss": 31.211724853515626,
"step": 480
},
{
"epoch": 0.04454545454545455,
"grad_norm": 78801216208896.0,
"learning_rate": 9.951318259134473e-07,
"loss": 31.460574340820312,
"step": 490
},
{
"epoch": 0.045454545454545456,
"grad_norm": 17078298869760.0,
"learning_rate": 9.949310232673867e-07,
"loss": 31.416909790039064,
"step": 500
},
{
"epoch": 0.045454545454545456,
"eval_loss": 31.15839385986328,
"eval_runtime": 2.2493,
"eval_samples_per_second": 1.778,
"eval_steps_per_second": 0.445,
"step": 500
},
{
"epoch": 0.046363636363636364,
"grad_norm": 25643221778432.0,
"learning_rate": 9.947261836212555e-07,
"loss": 31.366104125976562,
"step": 510
},
{
"epoch": 0.04727272727272727,
"grad_norm": 68086552068096.0,
"learning_rate": 9.94517308645868e-07,
"loss": 31.929010009765626,
"step": 520
},
{
"epoch": 0.04818181818181818,
"grad_norm": 85420834553856.0,
"learning_rate": 9.94304400044953e-07,
"loss": 31.22962646484375,
"step": 530
},
{
"epoch": 0.04909090909090909,
"grad_norm": 34801671208960.0,
"learning_rate": 9.940874595551404e-07,
"loss": 31.47492370605469,
"step": 540
},
{
"epoch": 0.05,
"grad_norm": 50617645006848.0,
"learning_rate": 9.938664889459468e-07,
"loss": 31.026275634765625,
"step": 550
},
{
"epoch": 0.05090909090909091,
"grad_norm": 49960867332096.0,
"learning_rate": 9.936414900197618e-07,
"loss": 31.542160034179688,
"step": 560
},
{
"epoch": 0.05181818181818182,
"grad_norm": 32654523105280.0,
"learning_rate": 9.934124646118324e-07,
"loss": 31.71721496582031,
"step": 570
},
{
"epoch": 0.05272727272727273,
"grad_norm": 44004343283712.0,
"learning_rate": 9.931794145902485e-07,
"loss": 31.2598876953125,
"step": 580
},
{
"epoch": 0.053636363636363635,
"grad_norm": 66710199599104.0,
"learning_rate": 9.92942341855927e-07,
"loss": 31.227630615234375,
"step": 590
},
{
"epoch": 0.05454545454545454,
"grad_norm": 75621816336384.0,
"learning_rate": 9.927012483425976e-07,
"loss": 31.72113037109375,
"step": 600
},
{
"epoch": 0.05454545454545454,
"eval_loss": 31.14929962158203,
"eval_runtime": 2.2862,
"eval_samples_per_second": 1.75,
"eval_steps_per_second": 0.437,
"step": 600
},
{
"epoch": 0.05545454545454546,
"grad_norm": 60767218958336.0,
"learning_rate": 9.924561360167858e-07,
"loss": 30.905987548828126,
"step": 610
},
{
"epoch": 0.056363636363636366,
"grad_norm": 28232556478464.0,
"learning_rate": 9.922070068777972e-07,
"loss": 31.27515869140625,
"step": 620
},
{
"epoch": 0.057272727272727274,
"grad_norm": 57858754347008.0,
"learning_rate": 9.91953862957702e-07,
"loss": 31.28424072265625,
"step": 630
},
{
"epoch": 0.05818181818181818,
"grad_norm": 60663598678016.0,
"learning_rate": 9.91696706321317e-07,
"loss": 31.702291870117186,
"step": 640
},
{
"epoch": 0.05909090909090909,
"grad_norm": 64403231735808.0,
"learning_rate": 9.914355390661895e-07,
"loss": 31.74828186035156,
"step": 650
},
{
"epoch": 0.06,
"grad_norm": 49898036658176.0,
"learning_rate": 9.91170363322581e-07,
"loss": 30.9451904296875,
"step": 660
},
{
"epoch": 0.060909090909090906,
"grad_norm": 22820329357312.0,
"learning_rate": 9.90901181253448e-07,
"loss": 31.49604187011719,
"step": 670
},
{
"epoch": 0.06181818181818182,
"grad_norm": 170618632798208.0,
"learning_rate": 9.906279950544258e-07,
"loss": 30.988015747070314,
"step": 680
},
{
"epoch": 0.06272727272727273,
"grad_norm": 66990144225280.0,
"learning_rate": 9.903508069538107e-07,
"loss": 31.130947875976563,
"step": 690
},
{
"epoch": 0.06363636363636363,
"grad_norm": 39199952601088.0,
"learning_rate": 9.900696192125401e-07,
"loss": 31.55877685546875,
"step": 700
},
{
"epoch": 0.06363636363636363,
"eval_loss": 31.127349853515625,
"eval_runtime": 2.2839,
"eval_samples_per_second": 1.751,
"eval_steps_per_second": 0.438,
"step": 700
},
{
"epoch": 0.06454545454545454,
"grad_norm": 53508833280000.0,
"learning_rate": 9.897844341241764e-07,
"loss": 30.89222106933594,
"step": 710
},
{
"epoch": 0.06545454545454546,
"grad_norm": 76796364062720.0,
"learning_rate": 9.894952540148861e-07,
"loss": 31.557272338867186,
"step": 720
},
{
"epoch": 0.06636363636363636,
"grad_norm": 53238585884672.0,
"learning_rate": 9.892020812434227e-07,
"loss": 31.102691650390625,
"step": 730
},
{
"epoch": 0.06727272727272728,
"grad_norm": 72308743995392.0,
"learning_rate": 9.889049182011064e-07,
"loss": 31.06553955078125,
"step": 740
},
{
"epoch": 0.06818181818181818,
"grad_norm": 85104164601856.0,
"learning_rate": 9.886037673118046e-07,
"loss": 31.310086059570313,
"step": 750
},
{
"epoch": 0.06909090909090909,
"grad_norm": 75288956370944.0,
"learning_rate": 9.882986310319123e-07,
"loss": 30.976141357421874,
"step": 760
},
{
"epoch": 0.07,
"grad_norm": 39805987586048.0,
"learning_rate": 9.879895118503322e-07,
"loss": 31.357177734375,
"step": 770
},
{
"epoch": 0.07090909090909091,
"grad_norm": 13191673282560.0,
"learning_rate": 9.876764122884546e-07,
"loss": 31.26226806640625,
"step": 780
},
{
"epoch": 0.07181818181818182,
"grad_norm": 98536062451712.0,
"learning_rate": 9.873593349001363e-07,
"loss": 31.190093994140625,
"step": 790
},
{
"epoch": 0.07272727272727272,
"grad_norm": 86483419529216.0,
"learning_rate": 9.870382822716797e-07,
"loss": 31.130612182617188,
"step": 800
},
{
"epoch": 0.07272727272727272,
"eval_loss": 31.110492706298828,
"eval_runtime": 2.2472,
"eval_samples_per_second": 1.78,
"eval_steps_per_second": 0.445,
"step": 800
},
{
"epoch": 0.07363636363636364,
"grad_norm": 50370197848064.0,
"learning_rate": 9.867132570218127e-07,
"loss": 31.63127746582031,
"step": 810
},
{
"epoch": 0.07454545454545454,
"grad_norm": 66007850811392.0,
"learning_rate": 9.863842618016658e-07,
"loss": 31.623040771484376,
"step": 820
},
{
"epoch": 0.07545454545454545,
"grad_norm": 109455253438464.0,
"learning_rate": 9.86051299294752e-07,
"loss": 31.264794921875,
"step": 830
},
{
"epoch": 0.07636363636363637,
"grad_norm": 35646429200384.0,
"learning_rate": 9.857143722169442e-07,
"loss": 30.843011474609376,
"step": 840
},
{
"epoch": 0.07727272727272727,
"grad_norm": 35847839678464.0,
"learning_rate": 9.853734833164525e-07,
"loss": 31.70771484375,
"step": 850
},
{
"epoch": 0.07818181818181819,
"grad_norm": 169087560843264.0,
"learning_rate": 9.850286353738032e-07,
"loss": 31.51513671875,
"step": 860
},
{
"epoch": 0.07909090909090909,
"grad_norm": 35594008788992.0,
"learning_rate": 9.846798312018146e-07,
"loss": 31.227005004882812,
"step": 870
},
{
"epoch": 0.08,
"grad_norm": 34218442752000.0,
"learning_rate": 9.843270736455752e-07,
"loss": 31.844467163085938,
"step": 880
},
{
"epoch": 0.0809090909090909,
"grad_norm": 76758078455808.0,
"learning_rate": 9.839703655824194e-07,
"loss": 31.2140380859375,
"step": 890
},
{
"epoch": 0.08181818181818182,
"grad_norm": 25330528026624.0,
"learning_rate": 9.836097099219057e-07,
"loss": 30.997073364257812,
"step": 900
},
{
"epoch": 0.08181818181818182,
"eval_loss": 31.093814849853516,
"eval_runtime": 2.2539,
"eval_samples_per_second": 1.775,
"eval_steps_per_second": 0.444,
"step": 900
},
{
"epoch": 0.08272727272727273,
"grad_norm": 111150716944384.0,
"learning_rate": 9.832451096057912e-07,
"loss": 31.376983642578125,
"step": 910
},
{
"epoch": 0.08363636363636363,
"grad_norm": 90311955054592.0,
"learning_rate": 9.82876567608008e-07,
"loss": 31.437393188476562,
"step": 920
},
{
"epoch": 0.08454545454545455,
"grad_norm": 51954126422016.0,
"learning_rate": 9.825040869346404e-07,
"loss": 31.078985595703124,
"step": 930
},
{
"epoch": 0.08545454545454545,
"grad_norm": 53884227682304.0,
"learning_rate": 9.821276706238985e-07,
"loss": 31.514266967773438,
"step": 940
},
{
"epoch": 0.08636363636363636,
"grad_norm": 25048345739264.0,
"learning_rate": 9.81747321746094e-07,
"loss": 31.2593505859375,
"step": 950
},
{
"epoch": 0.08727272727272728,
"grad_norm": 77616040116224.0,
"learning_rate": 9.81363043403616e-07,
"loss": 31.06065673828125,
"step": 960
},
{
"epoch": 0.08818181818181818,
"grad_norm": 62835941965824.0,
"learning_rate": 9.809748387309047e-07,
"loss": 31.265579223632812,
"step": 970
},
{
"epoch": 0.0890909090909091,
"grad_norm": 36371255263232.0,
"learning_rate": 9.805827108944259e-07,
"loss": 31.292767333984376,
"step": 980
},
{
"epoch": 0.09,
"grad_norm": 43744346767360.0,
"learning_rate": 9.801866630926459e-07,
"loss": 31.146585083007814,
"step": 990
},
{
"epoch": 0.09090909090909091,
"grad_norm": 104874788257792.0,
"learning_rate": 9.797866985560049e-07,
"loss": 31.14124755859375,
"step": 1000
},
{
"epoch": 0.09090909090909091,
"eval_loss": 31.08183479309082,
"eval_runtime": 2.2692,
"eval_samples_per_second": 1.763,
"eval_steps_per_second": 0.441,
"step": 1000
},
{
"epoch": 0.09181818181818181,
"grad_norm": 27701710684160.0,
"learning_rate": 9.793828205468902e-07,
"loss": 31.335833740234374,
"step": 1010
},
{
"epoch": 0.09272727272727273,
"grad_norm": 39849474129920.0,
"learning_rate": 9.789750323596107e-07,
"loss": 31.116259765625,
"step": 1020
},
{
"epoch": 0.09363636363636364,
"grad_norm": 102589924376576.0,
"learning_rate": 9.78563337320369e-07,
"loss": 31.5702880859375,
"step": 1030
},
{
"epoch": 0.09454545454545454,
"grad_norm": 36681726033920.0,
"learning_rate": 9.781477387872351e-07,
"loss": 31.245220947265626,
"step": 1040
},
{
"epoch": 0.09545454545454546,
"grad_norm": 72225545781248.0,
"learning_rate": 9.77728240150118e-07,
"loss": 31.252020263671874,
"step": 1050
},
{
"epoch": 0.09636363636363636,
"grad_norm": 50460786425856.0,
"learning_rate": 9.773048448307396e-07,
"loss": 31.183920288085936,
"step": 1060
},
{
"epoch": 0.09727272727272727,
"grad_norm": 132099931635712.0,
"learning_rate": 9.768775562826047e-07,
"loss": 31.01998291015625,
"step": 1070
},
{
"epoch": 0.09818181818181818,
"grad_norm": 78991218180096.0,
"learning_rate": 9.764463779909748e-07,
"loss": 30.735391235351564,
"step": 1080
},
{
"epoch": 0.09909090909090909,
"grad_norm": 73166386888704.0,
"learning_rate": 9.760113134728383e-07,
"loss": 30.96459045410156,
"step": 1090
},
{
"epoch": 0.1,
"grad_norm": 34503961608192.0,
"learning_rate": 9.755723662768827e-07,
"loss": 31.42650451660156,
"step": 1100
},
{
"epoch": 0.1,
"eval_loss": 31.072101593017578,
"eval_runtime": 2.2794,
"eval_samples_per_second": 1.755,
"eval_steps_per_second": 0.439,
"step": 1100
},
{
"epoch": 0.1009090909090909,
"grad_norm": 77892193091584.0,
"learning_rate": 9.751295399834653e-07,
"loss": 31.181564331054688,
"step": 1110
},
{
"epoch": 0.10181818181818182,
"grad_norm": 71087312338944.0,
"learning_rate": 9.746828382045843e-07,
"loss": 31.1749755859375,
"step": 1120
},
{
"epoch": 0.10272727272727272,
"grad_norm": 25741035044864.0,
"learning_rate": 9.742322645838476e-07,
"loss": 31.249942016601562,
"step": 1130
},
{
"epoch": 0.10363636363636364,
"grad_norm": 21756377038848.0,
"learning_rate": 9.737778227964468e-07,
"loss": 31.41895446777344,
"step": 1140
},
{
"epoch": 0.10454545454545454,
"grad_norm": 79144410939392.0,
"learning_rate": 9.73319516549123e-07,
"loss": 31.132781982421875,
"step": 1150
},
{
"epoch": 0.10545454545454545,
"grad_norm": 80644025614336.0,
"learning_rate": 9.728573495801392e-07,
"loss": 31.506884765625,
"step": 1160
},
{
"epoch": 0.10636363636363637,
"grad_norm": 81667788111872.0,
"learning_rate": 9.723913256592495e-07,
"loss": 31.320529174804687,
"step": 1170
},
{
"epoch": 0.10727272727272727,
"grad_norm": 88748838617088.0,
"learning_rate": 9.719214485876675e-07,
"loss": 31.806332397460938,
"step": 1180
},
{
"epoch": 0.10818181818181818,
"grad_norm": 85104365928448.0,
"learning_rate": 9.71447722198036e-07,
"loss": 31.29075927734375,
"step": 1190
},
{
"epoch": 0.10909090909090909,
"grad_norm": 114349712605184.0,
"learning_rate": 9.709701503543952e-07,
"loss": 31.4369140625,
"step": 1200
},
{
"epoch": 0.10909090909090909,
"eval_loss": 31.056861877441406,
"eval_runtime": 2.2389,
"eval_samples_per_second": 1.787,
"eval_steps_per_second": 0.447,
"step": 1200
},
{
"epoch": 0.11,
"grad_norm": 55083916066816.0,
"learning_rate": 9.70488736952152e-07,
"loss": 31.772137451171876,
"step": 1210
},
{
"epoch": 0.11090909090909092,
"grad_norm": 79216167092224.0,
"learning_rate": 9.70003485918047e-07,
"loss": 31.12777099609375,
"step": 1220
},
{
"epoch": 0.11181818181818182,
"grad_norm": 79771996258304.0,
"learning_rate": 9.695144012101237e-07,
"loss": 31.1830078125,
"step": 1230
},
{
"epoch": 0.11272727272727273,
"grad_norm": 56465817600000.0,
"learning_rate": 9.690214868176957e-07,
"loss": 31.160888671875,
"step": 1240
},
{
"epoch": 0.11363636363636363,
"grad_norm": 21445293899776.0,
"learning_rate": 9.68524746761314e-07,
"loss": 31.626931762695314,
"step": 1250
},
{
"epoch": 0.11454545454545455,
"grad_norm": 13377668644864.0,
"learning_rate": 9.680241850927343e-07,
"loss": 31.01793212890625,
"step": 1260
},
{
"epoch": 0.11545454545454545,
"grad_norm": 45122188214272.0,
"learning_rate": 9.675198058948842e-07,
"loss": 31.344110107421876,
"step": 1270
},
{
"epoch": 0.11636363636363636,
"grad_norm": 45118371397632.0,
"learning_rate": 9.670116132818296e-07,
"loss": 30.963018798828124,
"step": 1280
},
{
"epoch": 0.11727272727272728,
"grad_norm": 79956101038080.0,
"learning_rate": 9.664996113987413e-07,
"loss": 31.142779541015624,
"step": 1290
},
{
"epoch": 0.11818181818181818,
"grad_norm": 81212462858240.0,
"learning_rate": 9.659838044218612e-07,
"loss": 31.084671020507812,
"step": 1300
},
{
"epoch": 0.11818181818181818,
"eval_loss": 31.046554565429688,
"eval_runtime": 2.2298,
"eval_samples_per_second": 1.794,
"eval_steps_per_second": 0.448,
"step": 1300
},
{
"epoch": 0.1190909090909091,
"grad_norm": 61813605531648.0,
"learning_rate": 9.654641965584677e-07,
"loss": 31.6784423828125,
"step": 1310
},
{
"epoch": 0.12,
"grad_norm": 93534480760832.0,
"learning_rate": 9.649407920468429e-07,
"loss": 31.229824829101563,
"step": 1320
},
{
"epoch": 0.12090909090909091,
"grad_norm": 49400923553792.0,
"learning_rate": 9.644135951562358e-07,
"loss": 31.641665649414062,
"step": 1330
},
{
"epoch": 0.12181818181818181,
"grad_norm": 28665326862336.0,
"learning_rate": 9.638826101868297e-07,
"loss": 31.051693725585938,
"step": 1340
},
{
"epoch": 0.12272727272727273,
"grad_norm": 92450051850240.0,
"learning_rate": 9.63347841469705e-07,
"loss": 31.478741455078126,
"step": 1350
},
{
"epoch": 0.12363636363636364,
"grad_norm": 15963996028928.0,
"learning_rate": 9.62809293366806e-07,
"loss": 31.277313232421875,
"step": 1360
},
{
"epoch": 0.12454545454545454,
"grad_norm": 142693862735872.0,
"learning_rate": 9.62266970270904e-07,
"loss": 31.675,
"step": 1370
},
{
"epoch": 0.12545454545454546,
"grad_norm": 93112651218944.0,
"learning_rate": 9.617208766055612e-07,
"loss": 31.52940673828125,
"step": 1380
},
{
"epoch": 0.12636363636363637,
"grad_norm": 55887968337920.0,
"learning_rate": 9.61171016825096e-07,
"loss": 30.970913696289063,
"step": 1390
},
{
"epoch": 0.12727272727272726,
"grad_norm": 98350414168064.0,
"learning_rate": 9.606173954145452e-07,
"loss": 31.27143249511719,
"step": 1400
},
{
"epoch": 0.12727272727272726,
"eval_loss": 31.040485382080078,
"eval_runtime": 2.2618,
"eval_samples_per_second": 1.768,
"eval_steps_per_second": 0.442,
"step": 1400
},
{
"epoch": 0.12818181818181817,
"grad_norm": 37604883955712.0,
"learning_rate": 9.600600168896283e-07,
"loss": 31.471597290039064,
"step": 1410
},
{
"epoch": 0.1290909090909091,
"grad_norm": 95629921484800.0,
"learning_rate": 9.594988857967105e-07,
"loss": 31.04731140136719,
"step": 1420
},
{
"epoch": 0.13,
"grad_norm": 60152812142592.0,
"learning_rate": 9.589340067127657e-07,
"loss": 31.429867553710938,
"step": 1430
},
{
"epoch": 0.13090909090909092,
"grad_norm": 22072585617408.0,
"learning_rate": 9.583653842453382e-07,
"loss": 31.041015625,
"step": 1440
},
{
"epoch": 0.1318181818181818,
"grad_norm": 74209325744128.0,
"learning_rate": 9.577930230325072e-07,
"loss": 31.526290893554688,
"step": 1450
},
{
"epoch": 0.13272727272727272,
"grad_norm": 42760136556544.0,
"learning_rate": 9.572169277428464e-07,
"loss": 31.404434204101562,
"step": 1460
},
{
"epoch": 0.13363636363636364,
"grad_norm": 63998871470080.0,
"learning_rate": 9.566371030753882e-07,
"loss": 31.185369873046874,
"step": 1470
},
{
"epoch": 0.13454545454545455,
"grad_norm": 48346186121216.0,
"learning_rate": 9.560535537595838e-07,
"loss": 31.842657470703124,
"step": 1480
},
{
"epoch": 0.13545454545454547,
"grad_norm": 122013318381568.0,
"learning_rate": 9.554662845552656e-07,
"loss": 30.405438232421876,
"step": 1490
},
{
"epoch": 0.13636363636363635,
"grad_norm": 98829219135488.0,
"learning_rate": 9.548753002526076e-07,
"loss": 31.2637939453125,
"step": 1500
},
{
"epoch": 0.13636363636363635,
"eval_loss": 31.038190841674805,
"eval_runtime": 2.235,
"eval_samples_per_second": 1.79,
"eval_steps_per_second": 0.447,
"step": 1500
},
{
"epoch": 0.13727272727272727,
"grad_norm": 50074495221760.0,
"learning_rate": 9.54280605672087e-07,
"loss": 31.2703125,
"step": 1510
},
{
"epoch": 0.13818181818181818,
"grad_norm": 76787170148352.0,
"learning_rate": 9.536822056644444e-07,
"loss": 31.316009521484375,
"step": 1520
},
{
"epoch": 0.1390909090909091,
"grad_norm": 93312878903296.0,
"learning_rate": 9.530801051106448e-07,
"loss": 30.861151123046874,
"step": 1530
},
{
"epoch": 0.14,
"grad_norm": 98425945194496.0,
"learning_rate": 9.52474308921837e-07,
"loss": 31.445208740234374,
"step": 1540
},
{
"epoch": 0.1409090909090909,
"grad_norm": 47585565868032.0,
"learning_rate": 9.518648220393142e-07,
"loss": 31.213671875,
"step": 1550
},
{
"epoch": 0.14181818181818182,
"grad_norm": 111074724544512.0,
"learning_rate": 9.512516494344732e-07,
"loss": 30.983367919921875,
"step": 1560
},
{
"epoch": 0.14272727272727273,
"grad_norm": 56672831668224.0,
"learning_rate": 9.506347961087743e-07,
"loss": 31.3043212890625,
"step": 1570
},
{
"epoch": 0.14363636363636365,
"grad_norm": 40252332834816.0,
"learning_rate": 9.500142670937006e-07,
"loss": 31.179425048828126,
"step": 1580
},
{
"epoch": 0.14454545454545453,
"grad_norm": 64463541633024.0,
"learning_rate": 9.493900674507158e-07,
"loss": 31.174810791015624,
"step": 1590
},
{
"epoch": 0.14545454545454545,
"grad_norm": 61891795746816.0,
"learning_rate": 9.487622022712247e-07,
"loss": 31.512142944335938,
"step": 1600
},
{
"epoch": 0.14545454545454545,
"eval_loss": 31.032541275024414,
"eval_runtime": 2.2531,
"eval_samples_per_second": 1.775,
"eval_steps_per_second": 0.444,
"step": 1600
},
{
"epoch": 0.14636363636363636,
"grad_norm": 29199326773248.0,
"learning_rate": 9.481306766765304e-07,
"loss": 31.413177490234375,
"step": 1610
},
{
"epoch": 0.14727272727272728,
"grad_norm": 50657696415744.0,
"learning_rate": 9.474954958177925e-07,
"loss": 31.364990234375,
"step": 1620
},
{
"epoch": 0.1481818181818182,
"grad_norm": 47557384339456.0,
"learning_rate": 9.468566648759864e-07,
"loss": 31.14423828125,
"step": 1630
},
{
"epoch": 0.14909090909090908,
"grad_norm": 36248345378816.0,
"learning_rate": 9.462141890618589e-07,
"loss": 31.51732177734375,
"step": 1640
},
{
"epoch": 0.15,
"grad_norm": 140802114191360.0,
"learning_rate": 9.455680736158879e-07,
"loss": 31.270425415039064,
"step": 1650
},
{
"epoch": 0.1509090909090909,
"grad_norm": 47592100593664.0,
"learning_rate": 9.449183238082383e-07,
"loss": 30.924615478515626,
"step": 1660
},
{
"epoch": 0.15181818181818182,
"grad_norm": 30858362748928.0,
"learning_rate": 9.442649449387193e-07,
"loss": 31.3542236328125,
"step": 1670
},
{
"epoch": 0.15272727272727274,
"grad_norm": 60036483121152.0,
"learning_rate": 9.436079423367412e-07,
"loss": 31.09422607421875,
"step": 1680
},
{
"epoch": 0.15363636363636363,
"grad_norm": 67431661830144.0,
"learning_rate": 9.429473213612722e-07,
"loss": 31.331436157226562,
"step": 1690
},
{
"epoch": 0.15454545454545454,
"grad_norm": 64809768845312.0,
"learning_rate": 9.422830874007943e-07,
"loss": 31.278558349609376,
"step": 1700
},
{
"epoch": 0.15454545454545454,
"eval_loss": 31.038570404052734,
"eval_runtime": 2.2734,
"eval_samples_per_second": 1.76,
"eval_steps_per_second": 0.44,
"step": 1700
},
{
"epoch": 0.15545454545454546,
"grad_norm": 49376714031104.0,
"learning_rate": 9.416152458732595e-07,
"loss": 31.333743286132812,
"step": 1710
},
{
"epoch": 0.15636363636363637,
"grad_norm": 61799214874624.0,
"learning_rate": 9.409438022260456e-07,
"loss": 31.713766479492186,
"step": 1720
},
{
"epoch": 0.1572727272727273,
"grad_norm": 61596088926208.0,
"learning_rate": 9.40268761935912e-07,
"loss": 31.544638061523436,
"step": 1730
},
{
"epoch": 0.15818181818181817,
"grad_norm": 76064298631168.0,
"learning_rate": 9.395901305089544e-07,
"loss": 31.320480346679688,
"step": 1740
},
{
"epoch": 0.1590909090909091,
"grad_norm": 111245189447680.0,
"learning_rate": 9.389079134805609e-07,
"loss": 31.028314208984376,
"step": 1750
},
{
"epoch": 0.16,
"grad_norm": 138737686151168.0,
"learning_rate": 9.382221164153654e-07,
"loss": 30.5677490234375,
"step": 1760
},
{
"epoch": 0.16090909090909092,
"grad_norm": 72981451636736.0,
"learning_rate": 9.37532744907204e-07,
"loss": 31.30030517578125,
"step": 1770
},
{
"epoch": 0.1618181818181818,
"grad_norm": 48867127066624.0,
"learning_rate": 9.368398045790678e-07,
"loss": 31.112982177734374,
"step": 1780
},
{
"epoch": 0.16272727272727272,
"grad_norm": 69228463915008.0,
"learning_rate": 9.361433010830577e-07,
"loss": 31.17928466796875,
"step": 1790
},
{
"epoch": 0.16363636363636364,
"grad_norm": 53068834013184.0,
"learning_rate": 9.354432401003386e-07,
"loss": 31.5040283203125,
"step": 1800
},
{
"epoch": 0.16363636363636364,
"eval_loss": 31.034194946289062,
"eval_runtime": 2.2471,
"eval_samples_per_second": 1.78,
"eval_steps_per_second": 0.445,
"step": 1800
},
{
"epoch": 0.16454545454545455,
"grad_norm": 30403937173504.0,
"learning_rate": 9.347396273410924e-07,
"loss": 31.249359130859375,
"step": 1810
},
{
"epoch": 0.16545454545454547,
"grad_norm": 75192705482752.0,
"learning_rate": 9.34032468544472e-07,
"loss": 31.34810791015625,
"step": 1820
},
{
"epoch": 0.16636363636363635,
"grad_norm": 27673988431872.0,
"learning_rate": 9.333217694785542e-07,
"loss": 31.128109741210938,
"step": 1830
},
{
"epoch": 0.16727272727272727,
"grad_norm": 145739866963968.0,
"learning_rate": 9.326075359402924e-07,
"loss": 31.515496826171876,
"step": 1840
},
{
"epoch": 0.16818181818181818,
"grad_norm": 36780787105792.0,
"learning_rate": 9.318897737554698e-07,
"loss": 31.476416015625,
"step": 1850
},
{
"epoch": 0.1690909090909091,
"grad_norm": 111188616675328.0,
"learning_rate": 9.31168488778652e-07,
"loss": 31.116790771484375,
"step": 1860
},
{
"epoch": 0.17,
"grad_norm": 51388486778880.0,
"learning_rate": 9.304436868931382e-07,
"loss": 31.242062377929688,
"step": 1870
},
{
"epoch": 0.1709090909090909,
"grad_norm": 76586497867776.0,
"learning_rate": 9.297153740109147e-07,
"loss": 31.552081298828124,
"step": 1880
},
{
"epoch": 0.17181818181818181,
"grad_norm": 38178404696064.0,
"learning_rate": 9.289835560726052e-07,
"loss": 31.006793212890624,
"step": 1890
},
{
"epoch": 0.17272727272727273,
"grad_norm": 32226674737152.0,
"learning_rate": 9.28248239047424e-07,
"loss": 31.428573608398438,
"step": 1900
},
{
"epoch": 0.17272727272727273,
"eval_loss": 31.032257080078125,
"eval_runtime": 2.2569,
"eval_samples_per_second": 1.772,
"eval_steps_per_second": 0.443,
"step": 1900
},
{
"epoch": 0.17363636363636364,
"grad_norm": 257651480985600.0,
"learning_rate": 9.275094289331253e-07,
"loss": 31.105364990234374,
"step": 1910
},
{
"epoch": 0.17454545454545456,
"grad_norm": 65725515431936.0,
"learning_rate": 9.267671317559562e-07,
"loss": 31.4971923828125,
"step": 1920
},
{
"epoch": 0.17545454545454545,
"grad_norm": 209329206591488.0,
"learning_rate": 9.260213535706062e-07,
"loss": 31.248983764648436,
"step": 1930
},
{
"epoch": 0.17636363636363636,
"grad_norm": 69413545967616.0,
"learning_rate": 9.252721004601587e-07,
"loss": 31.496029663085938,
"step": 1940
},
{
"epoch": 0.17727272727272728,
"grad_norm": 85867242717184.0,
"learning_rate": 9.245193785360406e-07,
"loss": 31.328424072265626,
"step": 1950
},
{
"epoch": 0.1781818181818182,
"grad_norm": 167211398332416.0,
"learning_rate": 9.23763193937973e-07,
"loss": 31.482049560546876,
"step": 1960
},
{
"epoch": 0.17909090909090908,
"grad_norm": 36981182562304.0,
"learning_rate": 9.23003552833921e-07,
"loss": 30.472119140625,
"step": 1970
},
{
"epoch": 0.18,
"grad_norm": 123917532397568.0,
"learning_rate": 9.222404614200436e-07,
"loss": 31.717819213867188,
"step": 1980
},
{
"epoch": 0.1809090909090909,
"grad_norm": 88264178401280.0,
"learning_rate": 9.214739259206423e-07,
"loss": 31.45789794921875,
"step": 1990
},
{
"epoch": 0.18181818181818182,
"grad_norm": 65296064839680.0,
"learning_rate": 9.207039525881117e-07,
"loss": 31.12996826171875,
"step": 2000
},
{
"epoch": 0.18181818181818182,
"eval_loss": 31.029281616210938,
"eval_runtime": 2.2535,
"eval_samples_per_second": 1.775,
"eval_steps_per_second": 0.444,
"step": 2000
},
{
"epoch": 0.18272727272727274,
"grad_norm": 71538795610112.0,
"learning_rate": 9.199305477028869e-07,
"loss": 31.124655151367186,
"step": 2010
},
{
"epoch": 0.18363636363636363,
"grad_norm": 117176044355584.0,
"learning_rate": 9.19153717573394e-07,
"loss": 31.152999877929688,
"step": 2020
},
{
"epoch": 0.18454545454545454,
"grad_norm": 88894632624128.0,
"learning_rate": 9.183734685359972e-07,
"loss": 31.35181884765625,
"step": 2030
},
{
"epoch": 0.18545454545454546,
"grad_norm": 56644360732672.0,
"learning_rate": 9.175898069549476e-07,
"loss": 31.333255004882812,
"step": 2040
},
{
"epoch": 0.18636363636363637,
"grad_norm": 104232355102720.0,
"learning_rate": 9.168027392223319e-07,
"loss": 31.229754638671874,
"step": 2050
},
{
"epoch": 0.18727272727272729,
"grad_norm": 93866015326208.0,
"learning_rate": 9.160122717580194e-07,
"loss": 31.03287353515625,
"step": 2060
},
{
"epoch": 0.18818181818181817,
"grad_norm": 45236478803968.0,
"learning_rate": 9.152184110096097e-07,
"loss": 31.709677124023436,
"step": 2070
},
{
"epoch": 0.1890909090909091,
"grad_norm": 46076950216704.0,
"learning_rate": 9.144211634523808e-07,
"loss": 31.2308837890625,
"step": 2080
},
{
"epoch": 0.19,
"grad_norm": 72614668140544.0,
"learning_rate": 9.13620535589236e-07,
"loss": 31.108331298828126,
"step": 2090
},
{
"epoch": 0.19090909090909092,
"grad_norm": 42438555074560.0,
"learning_rate": 9.128165339506502e-07,
"loss": 31.92352294921875,
"step": 2100
},
{
"epoch": 0.19090909090909092,
"eval_loss": 31.03235626220703,
"eval_runtime": 2.2586,
"eval_samples_per_second": 1.771,
"eval_steps_per_second": 0.443,
"step": 2100
},
{
"epoch": 0.1918181818181818,
"grad_norm": 63270400557056.0,
"learning_rate": 9.120091650946171e-07,
"loss": 31.78459777832031,
"step": 2110
},
{
"epoch": 0.19272727272727272,
"grad_norm": 79119404498944.0,
"learning_rate": 9.111984356065966e-07,
"loss": 31.268167114257814,
"step": 2120
},
{
"epoch": 0.19363636363636363,
"grad_norm": 29490430345216.0,
"learning_rate": 9.103843520994592e-07,
"loss": 31.48218994140625,
"step": 2130
},
{
"epoch": 0.19454545454545455,
"grad_norm": 34231048732672.0,
"learning_rate": 9.095669212134339e-07,
"loss": 30.843756103515624,
"step": 2140
},
{
"epoch": 0.19545454545454546,
"grad_norm": 78581879275520.0,
"learning_rate": 9.087461496160528e-07,
"loss": 30.995782470703126,
"step": 2150
},
{
"epoch": 0.19636363636363635,
"grad_norm": 44611347152896.0,
"learning_rate": 9.079220440020972e-07,
"loss": 31.502972412109376,
"step": 2160
},
{
"epoch": 0.19727272727272727,
"grad_norm": 37552992026624.0,
"learning_rate": 9.070946110935431e-07,
"loss": 31.0704833984375,
"step": 2170
},
{
"epoch": 0.19818181818181818,
"grad_norm": 47458872721408.0,
"learning_rate": 9.062638576395061e-07,
"loss": 31.406292724609376,
"step": 2180
},
{
"epoch": 0.1990909090909091,
"grad_norm": 92816332029952.0,
"learning_rate": 9.054297904161867e-07,
"loss": 31.4571044921875,
"step": 2190
},
{
"epoch": 0.2,
"grad_norm": 29963092754432.0,
"learning_rate": 9.045924162268144e-07,
"loss": 31.258853149414062,
"step": 2200
},
{
"epoch": 0.2,
"eval_loss": 31.03536605834961,
"eval_runtime": 2.2498,
"eval_samples_per_second": 1.778,
"eval_steps_per_second": 0.444,
"step": 2200
},
{
"epoch": 0.2009090909090909,
"grad_norm": 259804182347776.0,
"learning_rate": 9.037517419015928e-07,
"loss": 31.453973388671876,
"step": 2210
},
{
"epoch": 0.2018181818181818,
"grad_norm": 98955845173248.0,
"learning_rate": 9.029077742976437e-07,
"loss": 30.824130249023437,
"step": 2220
},
{
"epoch": 0.20272727272727273,
"grad_norm": 35170289713152.0,
"learning_rate": 9.020605202989513e-07,
"loss": 31.691207885742188,
"step": 2230
},
{
"epoch": 0.20363636363636364,
"grad_norm": 25527377199104.0,
"learning_rate": 9.012099868163056e-07,
"loss": 31.00306091308594,
"step": 2240
},
{
"epoch": 0.20454545454545456,
"grad_norm": 136539543699456.0,
"learning_rate": 9.003561807872469e-07,
"loss": 31.796575927734374,
"step": 2250
},
{
"epoch": 0.20545454545454545,
"grad_norm": 46742410100736.0,
"learning_rate": 8.994991091760076e-07,
"loss": 31.3921142578125,
"step": 2260
},
{
"epoch": 0.20636363636363636,
"grad_norm": 30860340363264.0,
"learning_rate": 8.986387789734576e-07,
"loss": 31.278704833984374,
"step": 2270
},
{
"epoch": 0.20727272727272728,
"grad_norm": 31539043762176.0,
"learning_rate": 8.977751971970456e-07,
"loss": 30.982208251953125,
"step": 2280
},
{
"epoch": 0.2081818181818182,
"grad_norm": 134957301235712.0,
"learning_rate": 8.969083708907424e-07,
"loss": 31.08028564453125,
"step": 2290
},
{
"epoch": 0.20909090909090908,
"grad_norm": 86353354162176.0,
"learning_rate": 8.960383071249835e-07,
"loss": 31.018426513671876,
"step": 2300
},
{
"epoch": 0.20909090909090908,
"eval_loss": 31.035140991210938,
"eval_runtime": 2.2639,
"eval_samples_per_second": 1.767,
"eval_steps_per_second": 0.442,
"step": 2300
},
{
"epoch": 0.21,
"grad_norm": 155203122757632.0,
"learning_rate": 8.951650129966112e-07,
"loss": 31.086285400390626,
"step": 2310
},
{
"epoch": 0.2109090909090909,
"grad_norm": 109969449943040.0,
"learning_rate": 8.942884956288171e-07,
"loss": 30.969015502929686,
"step": 2320
},
{
"epoch": 0.21181818181818182,
"grad_norm": 101191014940672.0,
"learning_rate": 8.934087621710835e-07,
"loss": 30.67431640625,
"step": 2330
},
{
"epoch": 0.21272727272727274,
"grad_norm": 146619093745664.0,
"learning_rate": 8.925258197991258e-07,
"loss": 31.378811645507813,
"step": 2340
},
{
"epoch": 0.21363636363636362,
"grad_norm": 91310996324352.0,
"learning_rate": 8.91639675714833e-07,
"loss": 31.404779052734376,
"step": 2350
},
{
"epoch": 0.21454545454545454,
"grad_norm": 62529711636480.0,
"learning_rate": 8.907503371462099e-07,
"loss": 30.654598999023438,
"step": 2360
},
{
"epoch": 0.21545454545454545,
"grad_norm": 70472276377600.0,
"learning_rate": 8.898578113473176e-07,
"loss": 31.602188110351562,
"step": 2370
},
{
"epoch": 0.21636363636363637,
"grad_norm": 158925886324736.0,
"learning_rate": 8.889621055982144e-07,
"loss": 31.739437866210938,
"step": 2380
},
{
"epoch": 0.21727272727272728,
"grad_norm": 70523740487680.0,
"learning_rate": 8.880632272048962e-07,
"loss": 31.94945373535156,
"step": 2390
},
{
"epoch": 0.21818181818181817,
"grad_norm": 60489816080384.0,
"learning_rate": 8.871611834992379e-07,
"loss": 31.090286254882812,
"step": 2400
},
{
"epoch": 0.21818181818181817,
"eval_loss": 31.047500610351562,
"eval_runtime": 2.2365,
"eval_samples_per_second": 1.788,
"eval_steps_per_second": 0.447,
"step": 2400
},
{
"epoch": 0.2190909090909091,
"grad_norm": 146665382084608.0,
"learning_rate": 8.862559818389321e-07,
"loss": 31.17398681640625,
"step": 2410
},
{
"epoch": 0.22,
"grad_norm": 56466086035456.0,
"learning_rate": 8.853476296074305e-07,
"loss": 31.538543701171875,
"step": 2420
},
{
"epoch": 0.22090909090909092,
"grad_norm": 205152065683456.0,
"learning_rate": 8.844361342138827e-07,
"loss": 31.731301879882814,
"step": 2430
},
{
"epoch": 0.22181818181818183,
"grad_norm": 65588269416448.0,
"learning_rate": 8.835215030930761e-07,
"loss": 30.90111083984375,
"step": 2440
},
{
"epoch": 0.22272727272727272,
"grad_norm": 34737408180224.0,
"learning_rate": 8.82603743705375e-07,
"loss": 31.98955078125,
"step": 2450
},
{
"epoch": 0.22363636363636363,
"grad_norm": 154878517182464.0,
"learning_rate": 8.81682863536661e-07,
"loss": 31.334310913085936,
"step": 2460
},
{
"epoch": 0.22454545454545455,
"grad_norm": 166664142323712.0,
"learning_rate": 8.807588700982699e-07,
"loss": 31.236883544921874,
"step": 2470
},
{
"epoch": 0.22545454545454546,
"grad_norm": 145991323877376.0,
"learning_rate": 8.798317709269318e-07,
"loss": 31.298379516601564,
"step": 2480
},
{
"epoch": 0.22636363636363635,
"grad_norm": 70725335515136.0,
"learning_rate": 8.789015735847098e-07,
"loss": 31.637060546875,
"step": 2490
},
{
"epoch": 0.22727272727272727,
"grad_norm": 164278623535104.0,
"learning_rate": 8.779682856589367e-07,
"loss": 31.241668701171875,
"step": 2500
},
{
"epoch": 0.22727272727272727,
"eval_loss": 31.05630111694336,
"eval_runtime": 2.28,
"eval_samples_per_second": 1.754,
"eval_steps_per_second": 0.439,
"step": 2500
},
{
"epoch": 0.22818181818181818,
"grad_norm": 65195573510144.0,
"learning_rate": 8.770319147621557e-07,
"loss": 31.208535766601564,
"step": 2510
},
{
"epoch": 0.2290909090909091,
"grad_norm": 38720564625408.0,
"learning_rate": 8.760924685320557e-07,
"loss": 31.412356567382812,
"step": 2520
},
{
"epoch": 0.23,
"grad_norm": 20436991606784.0,
"learning_rate": 8.751499546314105e-07,
"loss": 31.454071044921875,
"step": 2530
},
{
"epoch": 0.2309090909090909,
"grad_norm": 135642474348544.0,
"learning_rate": 8.742043807480162e-07,
"loss": 31.459384155273437,
"step": 2540
},
{
"epoch": 0.2318181818181818,
"grad_norm": 44671283757056.0,
"learning_rate": 8.732557545946278e-07,
"loss": 31.1458251953125,
"step": 2550
},
{
"epoch": 0.23272727272727273,
"grad_norm": 86082586673152.0,
"learning_rate": 8.723040839088969e-07,
"loss": 30.845843505859374,
"step": 2560
},
{
"epoch": 0.23363636363636364,
"grad_norm": 158711691608064.0,
"learning_rate": 8.713493764533088e-07,
"loss": 31.084823608398438,
"step": 2570
},
{
"epoch": 0.23454545454545456,
"grad_norm": 57405924704256.0,
"learning_rate": 8.703916400151183e-07,
"loss": 30.91130676269531,
"step": 2580
},
{
"epoch": 0.23545454545454544,
"grad_norm": 82000975233024.0,
"learning_rate": 8.694308824062867e-07,
"loss": 31.061813354492188,
"step": 2590
},
{
"epoch": 0.23636363636363636,
"grad_norm": 79047270858752.0,
"learning_rate": 8.684671114634183e-07,
"loss": 31.08419189453125,
"step": 2600
},
{
"epoch": 0.23636363636363636,
"eval_loss": 31.05272102355957,
"eval_runtime": 2.2261,
"eval_samples_per_second": 1.797,
"eval_steps_per_second": 0.449,
"step": 2600
},
{
"epoch": 0.23727272727272727,
"grad_norm": 49400906776576.0,
"learning_rate": 8.675003350476961e-07,
"loss": 30.686038208007812,
"step": 2610
},
{
"epoch": 0.2381818181818182,
"grad_norm": 94167459954688.0,
"learning_rate": 8.66530561044818e-07,
"loss": 31.08385314941406,
"step": 2620
},
{
"epoch": 0.2390909090909091,
"grad_norm": 40438371188736.0,
"learning_rate": 8.655577973649321e-07,
"loss": 31.391049194335938,
"step": 2630
},
{
"epoch": 0.24,
"grad_norm": 67886441824256.0,
"learning_rate": 8.645820519425722e-07,
"loss": 30.860980224609374,
"step": 2640
},
{
"epoch": 0.2409090909090909,
"grad_norm": 156507970732032.0,
"learning_rate": 8.636033327365937e-07,
"loss": 31.027520751953126,
"step": 2650
},
{
"epoch": 0.24181818181818182,
"grad_norm": 33284687921152.0,
"learning_rate": 8.626216477301081e-07,
"loss": 31.069308471679687,
"step": 2660
},
{
"epoch": 0.24272727272727274,
"grad_norm": 202165503131648.0,
"learning_rate": 8.616370049304175e-07,
"loss": 31.114059448242188,
"step": 2670
},
{
"epoch": 0.24363636363636362,
"grad_norm": 32541889265664.0,
"learning_rate": 8.606494123689508e-07,
"loss": 30.974282836914064,
"step": 2680
},
{
"epoch": 0.24454545454545454,
"grad_norm": 133315969417216.0,
"learning_rate": 8.596588781011963e-07,
"loss": 31.376223754882812,
"step": 2690
},
{
"epoch": 0.24545454545454545,
"grad_norm": 120080675373056.0,
"learning_rate": 8.586654102066374e-07,
"loss": 31.123995971679687,
"step": 2700
},
{
"epoch": 0.24545454545454545,
"eval_loss": 31.06121826171875,
"eval_runtime": 2.263,
"eval_samples_per_second": 1.768,
"eval_steps_per_second": 0.442,
"step": 2700
},
{
"epoch": 0.24636363636363637,
"grad_norm": 203449278922752.0,
"learning_rate": 8.576690167886859e-07,
"loss": 31.33082275390625,
"step": 2710
},
{
"epoch": 0.24727272727272728,
"grad_norm": 63677252239360.0,
"learning_rate": 8.566697059746166e-07,
"loss": 31.389141845703126,
"step": 2720
},
{
"epoch": 0.24818181818181817,
"grad_norm": 112063229722624.0,
"learning_rate": 8.556674859155e-07,
"loss": 31.25843200683594,
"step": 2730
},
{
"epoch": 0.24909090909090909,
"grad_norm": 153532078489600.0,
"learning_rate": 8.546623647861369e-07,
"loss": 31.412567138671875,
"step": 2740
},
{
"epoch": 0.25,
"grad_norm": 196838988709888.0,
"learning_rate": 8.536543507849911e-07,
"loss": 31.105191040039063,
"step": 2750
},
{
"epoch": 0.2509090909090909,
"grad_norm": 92189401022464.0,
"learning_rate": 8.526434521341226e-07,
"loss": 30.956512451171875,
"step": 2760
},
{
"epoch": 0.25181818181818183,
"grad_norm": 127660478955520.0,
"learning_rate": 8.516296770791207e-07,
"loss": 31.13167724609375,
"step": 2770
},
{
"epoch": 0.25272727272727274,
"grad_norm": 103122206720000.0,
"learning_rate": 8.506130338890365e-07,
"loss": 31.019964599609374,
"step": 2780
},
{
"epoch": 0.25363636363636366,
"grad_norm": 238406386843648.0,
"learning_rate": 8.495935308563158e-07,
"loss": 31.423956298828124,
"step": 2790
},
{
"epoch": 0.2545454545454545,
"grad_norm": 134973164093440.0,
"learning_rate": 8.485711762967312e-07,
"loss": 30.945632934570312,
"step": 2800
},
{
"epoch": 0.2545454545454545,
"eval_loss": 31.074186325073242,
"eval_runtime": 2.2625,
"eval_samples_per_second": 1.768,
"eval_steps_per_second": 0.442,
"step": 2800
},
{
"epoch": 0.25545454545454543,
"grad_norm": 50747676819456.0,
"learning_rate": 8.47545978549314e-07,
"loss": 31.677044677734376,
"step": 2810
},
{
"epoch": 0.25636363636363635,
"grad_norm": 138435553656832.0,
"learning_rate": 8.46517945976287e-07,
"loss": 31.338131713867188,
"step": 2820
},
{
"epoch": 0.25727272727272726,
"grad_norm": 152003741220864.0,
"learning_rate": 8.454870869629955e-07,
"loss": 30.898031616210936,
"step": 2830
},
{
"epoch": 0.2581818181818182,
"grad_norm": 159471129067520.0,
"learning_rate": 8.444534099178393e-07,
"loss": 30.950164794921875,
"step": 2840
},
{
"epoch": 0.2590909090909091,
"grad_norm": 141189164564480.0,
"learning_rate": 8.434169232722041e-07,
"loss": 31.282101440429688,
"step": 2850
},
{
"epoch": 0.26,
"grad_norm": 130600384069632.0,
"learning_rate": 8.423776354803925e-07,
"loss": 31.540997314453126,
"step": 2860
},
{
"epoch": 0.2609090909090909,
"grad_norm": 199170954625024.0,
"learning_rate": 8.41335555019555e-07,
"loss": 31.349322509765624,
"step": 2870
},
{
"epoch": 0.26181818181818184,
"grad_norm": 208188993437696.0,
"learning_rate": 8.402906903896216e-07,
"loss": 30.875155639648437,
"step": 2880
},
{
"epoch": 0.26272727272727275,
"grad_norm": 125149995073536.0,
"learning_rate": 8.392430501132316e-07,
"loss": 31.10132751464844,
"step": 2890
},
{
"epoch": 0.2636363636363636,
"grad_norm": 47845277171712.0,
"learning_rate": 8.381926427356642e-07,
"loss": 31.629965209960936,
"step": 2900
},
{
"epoch": 0.2636363636363636,
"eval_loss": 31.083770751953125,
"eval_runtime": 2.258,
"eval_samples_per_second": 1.771,
"eval_steps_per_second": 0.443,
"step": 2900
},
{
"epoch": 0.26454545454545453,
"grad_norm": 114591514230784.0,
"learning_rate": 8.37139476824769e-07,
"loss": 30.9484130859375,
"step": 2910
},
{
"epoch": 0.26545454545454544,
"grad_norm": 76647743094784.0,
"learning_rate": 8.360835609708967e-07,
"loss": 31.01370849609375,
"step": 2920
},
{
"epoch": 0.26636363636363636,
"grad_norm": 190012658286592.0,
"learning_rate": 8.35024903786828e-07,
"loss": 31.296466064453124,
"step": 2930
},
{
"epoch": 0.2672727272727273,
"grad_norm": 152463738929152.0,
"learning_rate": 8.339635139077035e-07,
"loss": 31.273577880859374,
"step": 2940
},
{
"epoch": 0.2681818181818182,
"grad_norm": 216430482030592.0,
"learning_rate": 8.32899399990954e-07,
"loss": 31.327499389648438,
"step": 2950
},
{
"epoch": 0.2690909090909091,
"grad_norm": 48228892409856.0,
"learning_rate": 8.318325707162293e-07,
"loss": 31.284075927734374,
"step": 2960
},
{
"epoch": 0.27,
"grad_norm": 109718655729664.0,
"learning_rate": 8.307630347853273e-07,
"loss": 31.343002319335938,
"step": 2970
},
{
"epoch": 0.27090909090909093,
"grad_norm": 102808120459264.0,
"learning_rate": 8.296908009221242e-07,
"loss": 31.049209594726562,
"step": 2980
},
{
"epoch": 0.2718181818181818,
"grad_norm": 69456642441216.0,
"learning_rate": 8.286158778725011e-07,
"loss": 31.43966064453125,
"step": 2990
},
{
"epoch": 0.2727272727272727,
"grad_norm": 92835936206848.0,
"learning_rate": 8.275382744042747e-07,
"loss": 30.909332275390625,
"step": 3000
},
{
"epoch": 0.2727272727272727,
"eval_loss": 31.07646369934082,
"eval_runtime": 2.242,
"eval_samples_per_second": 1.784,
"eval_steps_per_second": 0.446,
"step": 3000
},
{
"epoch": 0.2736363636363636,
"grad_norm": 44478215749632.0,
"learning_rate": 8.26457999307125e-07,
"loss": 30.9502685546875,
"step": 3010
},
{
"epoch": 0.27454545454545454,
"grad_norm": 75005027155968.0,
"learning_rate": 8.253750613925234e-07,
"loss": 31.542059326171874,
"step": 3020
},
{
"epoch": 0.27545454545454545,
"grad_norm": 47266672934912.0,
"learning_rate": 8.242894694936614e-07,
"loss": 30.897921752929687,
"step": 3030
},
{
"epoch": 0.27636363636363637,
"grad_norm": 45886398791680.0,
"learning_rate": 8.23201232465378e-07,
"loss": 31.505227661132814,
"step": 3040
},
{
"epoch": 0.2772727272727273,
"grad_norm": 127583672860672.0,
"learning_rate": 8.221103591840881e-07,
"loss": 31.139892578125,
"step": 3050
},
{
"epoch": 0.2781818181818182,
"grad_norm": 174062391263232.0,
"learning_rate": 8.210168585477091e-07,
"loss": 31.437637329101562,
"step": 3060
},
{
"epoch": 0.2790909090909091,
"grad_norm": 210010848100352.0,
"learning_rate": 8.199207394755891e-07,
"loss": 30.945309448242188,
"step": 3070
},
{
"epoch": 0.28,
"grad_norm": 141527191912448.0,
"learning_rate": 8.188220109084346e-07,
"loss": 31.963729858398438,
"step": 3080
},
{
"epoch": 0.2809090909090909,
"grad_norm": 269273947701248.0,
"learning_rate": 8.17720681808236e-07,
"loss": 31.625100708007814,
"step": 3090
},
{
"epoch": 0.2818181818181818,
"grad_norm": 90777153699840.0,
"learning_rate": 8.16616761158196e-07,
"loss": 31.37896728515625,
"step": 3100
},
{
"epoch": 0.2818181818181818,
"eval_loss": 31.08748435974121,
"eval_runtime": 2.2472,
"eval_samples_per_second": 1.78,
"eval_steps_per_second": 0.445,
"step": 3100
},
{
"epoch": 0.2827272727272727,
"grad_norm": 85872594649088.0,
"learning_rate": 8.155102579626558e-07,
"loss": 31.415878295898438,
"step": 3110
},
{
"epoch": 0.28363636363636363,
"grad_norm": 128033721679872.0,
"learning_rate": 8.144011812470215e-07,
"loss": 31.359136962890624,
"step": 3120
},
{
"epoch": 0.28454545454545455,
"grad_norm": 58961826938880.0,
"learning_rate": 8.132895400576904e-07,
"loss": 31.53883056640625,
"step": 3130
},
{
"epoch": 0.28545454545454546,
"grad_norm": 130452350304256.0,
"learning_rate": 8.121753434619778e-07,
"loss": 31.31527099609375,
"step": 3140
},
{
"epoch": 0.2863636363636364,
"grad_norm": 39132558524416.0,
"learning_rate": 8.110586005480426e-07,
"loss": 30.843875122070312,
"step": 3150
},
{
"epoch": 0.2872727272727273,
"grad_norm": 162498661580800.0,
"learning_rate": 8.09939320424813e-07,
"loss": 30.928125,
"step": 3160
},
{
"epoch": 0.2881818181818182,
"grad_norm": 30503648362496.0,
"learning_rate": 8.088175122219127e-07,
"loss": 31.2546142578125,
"step": 3170
},
{
"epoch": 0.28909090909090907,
"grad_norm": 264652227346432.0,
"learning_rate": 8.076931850895858e-07,
"loss": 31.682107543945314,
"step": 3180
},
{
"epoch": 0.29,
"grad_norm": 43181974487040.0,
"learning_rate": 8.065663481986229e-07,
"loss": 31.056671142578125,
"step": 3190
},
{
"epoch": 0.2909090909090909,
"grad_norm": 81322110353408.0,
"learning_rate": 8.054370107402858e-07,
"loss": 31.157467651367188,
"step": 3200
},
{
"epoch": 0.2909090909090909,
"eval_loss": 31.095945358276367,
"eval_runtime": 2.2422,
"eval_samples_per_second": 1.784,
"eval_steps_per_second": 0.446,
"step": 3200
},
{
"epoch": 0.2918181818181818,
"grad_norm": 82796911525888.0,
"learning_rate": 8.043051819262327e-07,
"loss": 31.241659545898436,
"step": 3210
},
{
"epoch": 0.2927272727272727,
"grad_norm": 66819532521472.0,
"learning_rate": 8.031708709884429e-07,
"loss": 31.24657287597656,
"step": 3220
},
{
"epoch": 0.29363636363636364,
"grad_norm": 151652912857088.0,
"learning_rate": 8.020340871791417e-07,
"loss": 31.857916259765624,
"step": 3230
},
{
"epoch": 0.29454545454545455,
"grad_norm": 33395514015744.0,
"learning_rate": 8.008948397707252e-07,
"loss": 31.493441772460937,
"step": 3240
},
{
"epoch": 0.29545454545454547,
"grad_norm": 186848542457856.0,
"learning_rate": 7.997531380556833e-07,
"loss": 31.500466918945314,
"step": 3250
},
{
"epoch": 0.2963636363636364,
"grad_norm": 87677269442560.0,
"learning_rate": 7.986089913465261e-07,
"loss": 30.997119140625,
"step": 3260
},
{
"epoch": 0.2972727272727273,
"grad_norm": 73329570480128.0,
"learning_rate": 7.974624089757064e-07,
"loss": 31.911077880859374,
"step": 3270
},
{
"epoch": 0.29818181818181816,
"grad_norm": 134268890120192.0,
"learning_rate": 7.963134002955431e-07,
"loss": 31.09755859375,
"step": 3280
},
{
"epoch": 0.2990909090909091,
"grad_norm": 57569158627328.0,
"learning_rate": 7.951619746781472e-07,
"loss": 31.29901123046875,
"step": 3290
},
{
"epoch": 0.3,
"grad_norm": 58610235211776.0,
"learning_rate": 7.940081415153428e-07,
"loss": 31.30848388671875,
"step": 3300
},
{
"epoch": 0.3,
"eval_loss": 31.100173950195312,
"eval_runtime": 2.2403,
"eval_samples_per_second": 1.785,
"eval_steps_per_second": 0.446,
"step": 3300
},
{
"epoch": 0.3009090909090909,
"grad_norm": 386970849116160.0,
"learning_rate": 7.928519102185922e-07,
"loss": 31.135516357421874,
"step": 3310
},
{
"epoch": 0.3018181818181818,
"grad_norm": 288033458880512.0,
"learning_rate": 7.91693290218918e-07,
"loss": 31.321795654296874,
"step": 3320
},
{
"epoch": 0.30272727272727273,
"grad_norm": 83541618589696.0,
"learning_rate": 7.905322909668272e-07,
"loss": 30.953836059570314,
"step": 3330
},
{
"epoch": 0.30363636363636365,
"grad_norm": 77461295464448.0,
"learning_rate": 7.893689219322336e-07,
"loss": 31.53773193359375,
"step": 3340
},
{
"epoch": 0.30454545454545456,
"grad_norm": 75457584168960.0,
"learning_rate": 7.882031926043803e-07,
"loss": 31.441778564453124,
"step": 3350
},
{
"epoch": 0.3054545454545455,
"grad_norm": 52945127211008.0,
"learning_rate": 7.870351124917629e-07,
"loss": 31.60285339355469,
"step": 3360
},
{
"epoch": 0.30636363636363634,
"grad_norm": 81810528665600.0,
"learning_rate": 7.858646911220512e-07,
"loss": 31.419757080078124,
"step": 3370
},
{
"epoch": 0.30727272727272725,
"grad_norm": 103102694817792.0,
"learning_rate": 7.846919380420125e-07,
"loss": 31.411013793945312,
"step": 3380
},
{
"epoch": 0.30818181818181817,
"grad_norm": 181314292547584.0,
"learning_rate": 7.835168628174325e-07,
"loss": 30.9938232421875,
"step": 3390
},
{
"epoch": 0.3090909090909091,
"grad_norm": 64268049317888.0,
"learning_rate": 7.823394750330386e-07,
"loss": 31.72479248046875,
"step": 3400
},
{
"epoch": 0.3090909090909091,
"eval_loss": 31.11138153076172,
"eval_runtime": 2.2524,
"eval_samples_per_second": 1.776,
"eval_steps_per_second": 0.444,
"step": 3400
},
{
"epoch": 0.31,
"grad_norm": 223006160846848.0,
"learning_rate": 7.811597842924203e-07,
"loss": 31.49818115234375,
"step": 3410
},
{
"epoch": 0.3109090909090909,
"grad_norm": 152988916121600.0,
"learning_rate": 7.799778002179523e-07,
"loss": 31.330535888671875,
"step": 3420
},
{
"epoch": 0.3118181818181818,
"grad_norm": 115639947624448.0,
"learning_rate": 7.787935324507149e-07,
"loss": 31.248580932617188,
"step": 3430
},
{
"epoch": 0.31272727272727274,
"grad_norm": 52082308546560.0,
"learning_rate": 7.776069906504159e-07,
"loss": 30.949420166015624,
"step": 3440
},
{
"epoch": 0.31363636363636366,
"grad_norm": 70850158002176.0,
"learning_rate": 7.764181844953116e-07,
"loss": 31.362625122070312,
"step": 3450
},
{
"epoch": 0.3145454545454546,
"grad_norm": 78591157075968.0,
"learning_rate": 7.752271236821282e-07,
"loss": 31.381210327148438,
"step": 3460
},
{
"epoch": 0.31545454545454543,
"grad_norm": 153667252518912.0,
"learning_rate": 7.74033817925982e-07,
"loss": 31.4740478515625,
"step": 3470
},
{
"epoch": 0.31636363636363635,
"grad_norm": 52006664273920.0,
"learning_rate": 7.728382769603011e-07,
"loss": 31.210354614257813,
"step": 3480
},
{
"epoch": 0.31727272727272726,
"grad_norm": 186123246632960.0,
"learning_rate": 7.716405105367452e-07,
"loss": 30.999267578125,
"step": 3490
},
{
"epoch": 0.3181818181818182,
"grad_norm": 232983285989376.0,
"learning_rate": 7.704405284251267e-07,
"loss": 30.719741821289062,
"step": 3500
},
{
"epoch": 0.3181818181818182,
"eval_loss": 31.12489891052246,
"eval_runtime": 2.2583,
"eval_samples_per_second": 1.771,
"eval_steps_per_second": 0.443,
"step": 3500
},
{
"epoch": 0.3190909090909091,
"grad_norm": 142378786619392.0,
"learning_rate": 7.6923834041333e-07,
"loss": 31.163070678710938,
"step": 3510
},
{
"epoch": 0.32,
"grad_norm": 373457472716800.0,
"learning_rate": 7.680339563072333e-07,
"loss": 30.965121459960937,
"step": 3520
},
{
"epoch": 0.3209090909090909,
"grad_norm": 59119444688896.0,
"learning_rate": 7.668273859306269e-07,
"loss": 31.44709167480469,
"step": 3530
},
{
"epoch": 0.32181818181818184,
"grad_norm": 96141030981632.0,
"learning_rate": 7.656186391251341e-07,
"loss": 31.224566650390624,
"step": 3540
},
{
"epoch": 0.32272727272727275,
"grad_norm": 277230374617088.0,
"learning_rate": 7.644077257501308e-07,
"loss": 31.22548828125,
"step": 3550
},
{
"epoch": 0.3236363636363636,
"grad_norm": 238855160594432.0,
"learning_rate": 7.631946556826647e-07,
"loss": 31.30469665527344,
"step": 3560
},
{
"epoch": 0.3245454545454545,
"grad_norm": 65425522032640.0,
"learning_rate": 7.619794388173751e-07,
"loss": 31.599795532226562,
"step": 3570
},
{
"epoch": 0.32545454545454544,
"grad_norm": 51770529153024.0,
"learning_rate": 7.60762085066412e-07,
"loss": 30.914794921875,
"step": 3580
},
{
"epoch": 0.32636363636363636,
"grad_norm": 100869840306176.0,
"learning_rate": 7.595426043593556e-07,
"loss": 31.482501220703124,
"step": 3590
},
{
"epoch": 0.32727272727272727,
"grad_norm": 71489554481152.0,
"learning_rate": 7.583210066431346e-07,
"loss": 31.595437622070314,
"step": 3600
},
{
"epoch": 0.32727272727272727,
"eval_loss": 31.137432098388672,
"eval_runtime": 2.2584,
"eval_samples_per_second": 1.771,
"eval_steps_per_second": 0.443,
"step": 3600
},
{
"epoch": 0.3281818181818182,
"grad_norm": 128388249419776.0,
"learning_rate": 7.570973018819458e-07,
"loss": 31.67999267578125,
"step": 3610
},
{
"epoch": 0.3290909090909091,
"grad_norm": 48917999779840.0,
"learning_rate": 7.558715000571725e-07,
"loss": 31.7310791015625,
"step": 3620
},
{
"epoch": 0.33,
"grad_norm": 81801485746176.0,
"learning_rate": 7.546436111673027e-07,
"loss": 31.565594482421876,
"step": 3630
},
{
"epoch": 0.33090909090909093,
"grad_norm": 70281771089920.0,
"learning_rate": 7.534136452278486e-07,
"loss": 31.4003173828125,
"step": 3640
},
{
"epoch": 0.33181818181818185,
"grad_norm": 268885236383744.0,
"learning_rate": 7.521816122712637e-07,
"loss": 30.847274780273438,
"step": 3650
},
{
"epoch": 0.3327272727272727,
"grad_norm": 188701753737216.0,
"learning_rate": 7.509475223468618e-07,
"loss": 31.30968017578125,
"step": 3660
},
{
"epoch": 0.3336363636363636,
"grad_norm": 203268269539328.0,
"learning_rate": 7.497113855207347e-07,
"loss": 31.730929565429687,
"step": 3670
},
{
"epoch": 0.33454545454545453,
"grad_norm": 40551332184064.0,
"learning_rate": 7.4847321187567e-07,
"loss": 31.19182434082031,
"step": 3680
},
{
"epoch": 0.33545454545454545,
"grad_norm": 120100707368960.0,
"learning_rate": 7.472330115110696e-07,
"loss": 31.216766357421875,
"step": 3690
},
{
"epoch": 0.33636363636363636,
"grad_norm": 123142987055104.0,
"learning_rate": 7.459907945428657e-07,
"loss": 31.759628295898438,
"step": 3700
},
{
"epoch": 0.33636363636363636,
"eval_loss": 31.1546630859375,
"eval_runtime": 2.2729,
"eval_samples_per_second": 1.76,
"eval_steps_per_second": 0.44,
"step": 3700
},
{
"epoch": 0.3372727272727273,
"grad_norm": 65411789881344.0,
"learning_rate": 7.447465711034404e-07,
"loss": 31.438787841796874,
"step": 3710
},
{
"epoch": 0.3381818181818182,
"grad_norm": 179227156545536.0,
"learning_rate": 7.43500351341541e-07,
"loss": 31.2360595703125,
"step": 3720
},
{
"epoch": 0.3390909090909091,
"grad_norm": 259052831506432.0,
"learning_rate": 7.422521454221989e-07,
"loss": 31.520187377929688,
"step": 3730
},
{
"epoch": 0.34,
"grad_norm": 102227595231232.0,
"learning_rate": 7.410019635266459e-07,
"loss": 31.39177551269531,
"step": 3740
},
{
"epoch": 0.3409090909090909,
"grad_norm": 68988482617344.0,
"learning_rate": 7.397498158522306e-07,
"loss": 31.17947998046875,
"step": 3750
},
{
"epoch": 0.3418181818181818,
"grad_norm": 46946144223232.0,
"learning_rate": 7.384957126123365e-07,
"loss": 30.96776428222656,
"step": 3760
},
{
"epoch": 0.3427272727272727,
"grad_norm": 178196901265408.0,
"learning_rate": 7.37239664036298e-07,
"loss": 31.246176147460936,
"step": 3770
},
{
"epoch": 0.34363636363636363,
"grad_norm": 77915882520576.0,
"learning_rate": 7.359816803693166e-07,
"loss": 30.79324951171875,
"step": 3780
},
{
"epoch": 0.34454545454545454,
"grad_norm": 78789707038720.0,
"learning_rate": 7.347217718723783e-07,
"loss": 31.38133850097656,
"step": 3790
},
{
"epoch": 0.34545454545454546,
"grad_norm": 26140632678400.0,
"learning_rate": 7.334599488221689e-07,
"loss": 31.2718505859375,
"step": 3800
},
{
"epoch": 0.34545454545454546,
"eval_loss": 31.167020797729492,
"eval_runtime": 2.2566,
"eval_samples_per_second": 1.773,
"eval_steps_per_second": 0.443,
"step": 3800
},
{
"epoch": 0.3463636363636364,
"grad_norm": 154810032586752.0,
"learning_rate": 7.321962215109906e-07,
"loss": 30.819577026367188,
"step": 3810
},
{
"epoch": 0.3472727272727273,
"grad_norm": 118487854874624.0,
"learning_rate": 7.309306002466787e-07,
"loss": 31.2808837890625,
"step": 3820
},
{
"epoch": 0.3481818181818182,
"grad_norm": 108455390085120.0,
"learning_rate": 7.296630953525158e-07,
"loss": 31.507012939453126,
"step": 3830
},
{
"epoch": 0.3490909090909091,
"grad_norm": 174323612516352.0,
"learning_rate": 7.283937171671497e-07,
"loss": 31.171493530273438,
"step": 3840
},
{
"epoch": 0.35,
"grad_norm": 52621549240320.0,
"learning_rate": 7.271224760445079e-07,
"loss": 31.58785400390625,
"step": 3850
},
{
"epoch": 0.3509090909090909,
"grad_norm": 245216510476288.0,
"learning_rate": 7.258493823537124e-07,
"loss": 31.41130676269531,
"step": 3860
},
{
"epoch": 0.3518181818181818,
"grad_norm": 40472269553664.0,
"learning_rate": 7.245744464789973e-07,
"loss": 31.25943603515625,
"step": 3870
},
{
"epoch": 0.3527272727272727,
"grad_norm": 152244192280576.0,
"learning_rate": 7.232976788196221e-07,
"loss": 31.55677490234375,
"step": 3880
},
{
"epoch": 0.35363636363636364,
"grad_norm": 163018369400832.0,
"learning_rate": 7.220190897897877e-07,
"loss": 31.163226318359374,
"step": 3890
},
{
"epoch": 0.35454545454545455,
"grad_norm": 31649326694400.0,
"learning_rate": 7.207386898185515e-07,
"loss": 31.222012329101563,
"step": 3900
},
{
"epoch": 0.35454545454545455,
"eval_loss": 31.183151245117188,
"eval_runtime": 2.2888,
"eval_samples_per_second": 1.748,
"eval_steps_per_second": 0.437,
"step": 3900
},
{
"epoch": 0.35545454545454547,
"grad_norm": 120699922415616.0,
"learning_rate": 7.194564893497419e-07,
"loss": 31.556930541992188,
"step": 3910
},
{
"epoch": 0.3563636363636364,
"grad_norm": 143552671645696.0,
"learning_rate": 7.181724988418737e-07,
"loss": 31.260910034179688,
"step": 3920
},
{
"epoch": 0.3572727272727273,
"grad_norm": 66354916884480.0,
"learning_rate": 7.168867287680627e-07,
"loss": 31.252059936523438,
"step": 3930
},
{
"epoch": 0.35818181818181816,
"grad_norm": 142235978956800.0,
"learning_rate": 7.155991896159392e-07,
"loss": 31.511947631835938,
"step": 3940
},
{
"epoch": 0.35909090909090907,
"grad_norm": 331125603958784.0,
"learning_rate": 7.143098918875642e-07,
"loss": 31.4046630859375,
"step": 3950
},
{
"epoch": 0.36,
"grad_norm": 163280043638784.0,
"learning_rate": 7.130188460993426e-07,
"loss": 31.372503662109374,
"step": 3960
},
{
"epoch": 0.3609090909090909,
"grad_norm": 78036493926400.0,
"learning_rate": 7.117260627819376e-07,
"loss": 31.743682861328125,
"step": 3970
},
{
"epoch": 0.3618181818181818,
"grad_norm": 141398275784704.0,
"learning_rate": 7.104315524801848e-07,
"loss": 31.348150634765624,
"step": 3980
},
{
"epoch": 0.36272727272727273,
"grad_norm": 34922429415424.0,
"learning_rate": 7.091353257530068e-07,
"loss": 31.071649169921876,
"step": 3990
},
{
"epoch": 0.36363636363636365,
"grad_norm": 114211183132672.0,
"learning_rate": 7.078373931733258e-07,
"loss": 31.188916015625,
"step": 4000
},
{
"epoch": 0.36363636363636365,
"eval_loss": 31.198307037353516,
"eval_runtime": 2.261,
"eval_samples_per_second": 1.769,
"eval_steps_per_second": 0.442,
"step": 4000
},
{
"epoch": 0.36454545454545456,
"grad_norm": 331842360180736.0,
"learning_rate": 7.065377653279787e-07,
"loss": 31.492498779296874,
"step": 4010
},
{
"epoch": 0.3654545454545455,
"grad_norm": 349987120611328.0,
"learning_rate": 7.052364528176298e-07,
"loss": 31.934201049804688,
"step": 4020
},
{
"epoch": 0.3663636363636364,
"grad_norm": 60965357879296.0,
"learning_rate": 7.03933466256685e-07,
"loss": 31.326864624023436,
"step": 4030
},
{
"epoch": 0.36727272727272725,
"grad_norm": 48224626802688.0,
"learning_rate": 7.026288162732046e-07,
"loss": 31.994424438476564,
"step": 4040
},
{
"epoch": 0.36818181818181817,
"grad_norm": 141879077240832.0,
"learning_rate": 7.013225135088171e-07,
"loss": 31.8456298828125,
"step": 4050
},
{
"epoch": 0.3690909090909091,
"grad_norm": 160698214645760.0,
"learning_rate": 7.000145686186323e-07,
"loss": 31.545791625976562,
"step": 4060
},
{
"epoch": 0.37,
"grad_norm": 148393821208576.0,
"learning_rate": 6.987049922711543e-07,
"loss": 31.230282592773438,
"step": 4070
},
{
"epoch": 0.3709090909090909,
"grad_norm": 45071789457408.0,
"learning_rate": 6.973937951481943e-07,
"loss": 31.038577270507812,
"step": 4080
},
{
"epoch": 0.3718181818181818,
"grad_norm": 251187320324096.0,
"learning_rate": 6.960809879447838e-07,
"loss": 31.384237670898436,
"step": 4090
},
{
"epoch": 0.37272727272727274,
"grad_norm": 80505772965888.0,
"learning_rate": 6.947665813690871e-07,
"loss": 31.199725341796874,
"step": 4100
},
{
"epoch": 0.37272727272727274,
"eval_loss": 31.208812713623047,
"eval_runtime": 2.2469,
"eval_samples_per_second": 1.78,
"eval_steps_per_second": 0.445,
"step": 4100
},
{
"epoch": 0.37363636363636366,
"grad_norm": 292126529159168.0,
"learning_rate": 6.934505861423144e-07,
"loss": 31.544012451171874,
"step": 4110
},
{
"epoch": 0.37454545454545457,
"grad_norm": 129792653393920.0,
"learning_rate": 6.921330129986338e-07,
"loss": 31.441571044921876,
"step": 4120
},
{
"epoch": 0.37545454545454543,
"grad_norm": 225189916835840.0,
"learning_rate": 6.90813872685084e-07,
"loss": 31.419064331054688,
"step": 4130
},
{
"epoch": 0.37636363636363634,
"grad_norm": 210190464974848.0,
"learning_rate": 6.894931759614865e-07,
"loss": 31.52581787109375,
"step": 4140
},
{
"epoch": 0.37727272727272726,
"grad_norm": 70698005430272.0,
"learning_rate": 6.881709336003584e-07,
"loss": 31.436795043945313,
"step": 4150
},
{
"epoch": 0.3781818181818182,
"grad_norm": 212850693898240.0,
"learning_rate": 6.868471563868235e-07,
"loss": 31.254794311523437,
"step": 4160
},
{
"epoch": 0.3790909090909091,
"grad_norm": 62373582864384.0,
"learning_rate": 6.855218551185254e-07,
"loss": 30.771942138671875,
"step": 4170
},
{
"epoch": 0.38,
"grad_norm": 208657379753984.0,
"learning_rate": 6.841950406055389e-07,
"loss": 31.365264892578125,
"step": 4180
},
{
"epoch": 0.3809090909090909,
"grad_norm": 309057994883072.0,
"learning_rate": 6.828667236702815e-07,
"loss": 31.405780029296874,
"step": 4190
},
{
"epoch": 0.38181818181818183,
"grad_norm": 67258516766720.0,
"learning_rate": 6.815369151474256e-07,
"loss": 31.415036010742188,
"step": 4200
},
{
"epoch": 0.38181818181818183,
"eval_loss": 31.2274169921875,
"eval_runtime": 2.2563,
"eval_samples_per_second": 1.773,
"eval_steps_per_second": 0.443,
"step": 4200
},
{
"epoch": 0.38272727272727275,
"grad_norm": 254599168524288.0,
"learning_rate": 6.802056258838104e-07,
"loss": 31.626663208007812,
"step": 4210
},
{
"epoch": 0.3836363636363636,
"grad_norm": 246138183614464.0,
"learning_rate": 6.788728667383528e-07,
"loss": 31.129254150390626,
"step": 4220
},
{
"epoch": 0.3845454545454545,
"grad_norm": 116115715915776.0,
"learning_rate": 6.775386485819589e-07,
"loss": 31.354595947265626,
"step": 4230
},
{
"epoch": 0.38545454545454544,
"grad_norm": 37121943404544.0,
"learning_rate": 6.762029822974359e-07,
"loss": 31.336276245117187,
"step": 4240
},
{
"epoch": 0.38636363636363635,
"grad_norm": 53457247535104.0,
"learning_rate": 6.748658787794025e-07,
"loss": 31.495358276367188,
"step": 4250
},
{
"epoch": 0.38727272727272727,
"grad_norm": 218983068336128.0,
"learning_rate": 6.735273489342008e-07,
"loss": 31.227752685546875,
"step": 4260
},
{
"epoch": 0.3881818181818182,
"grad_norm": 164807726596096.0,
"learning_rate": 6.721874036798068e-07,
"loss": 31.28994140625,
"step": 4270
},
{
"epoch": 0.3890909090909091,
"grad_norm": 65006854995968.0,
"learning_rate": 6.708460539457417e-07,
"loss": 31.27008056640625,
"step": 4280
},
{
"epoch": 0.39,
"grad_norm": 257791369412608.0,
"learning_rate": 6.695033106729824e-07,
"loss": 31.422894287109376,
"step": 4290
},
{
"epoch": 0.39090909090909093,
"grad_norm": 200739271999488.0,
"learning_rate": 6.681591848138731e-07,
"loss": 31.794927978515624,
"step": 4300
},
{
"epoch": 0.39090909090909093,
"eval_loss": 31.233016967773438,
"eval_runtime": 2.2393,
"eval_samples_per_second": 1.786,
"eval_steps_per_second": 0.447,
"step": 4300
},
{
"epoch": 0.39181818181818184,
"grad_norm": 236140539936768.0,
"learning_rate": 6.668136873320344e-07,
"loss": 31.521975708007812,
"step": 4310
},
{
"epoch": 0.3927272727272727,
"grad_norm": 261026301870080.0,
"learning_rate": 6.654668292022754e-07,
"loss": 31.655804443359376,
"step": 4320
},
{
"epoch": 0.3936363636363636,
"grad_norm": 148370215665664.0,
"learning_rate": 6.641186214105033e-07,
"loss": 31.52177734375,
"step": 4330
},
{
"epoch": 0.39454545454545453,
"grad_norm": 356924298100736.0,
"learning_rate": 6.627690749536346e-07,
"loss": 31.177362060546876,
"step": 4340
},
{
"epoch": 0.39545454545454545,
"grad_norm": 349417802563584.0,
"learning_rate": 6.614182008395042e-07,
"loss": 31.20628662109375,
"step": 4350
},
{
"epoch": 0.39636363636363636,
"grad_norm": 114095118352384.0,
"learning_rate": 6.600660100867765e-07,
"loss": 31.61373291015625,
"step": 4360
},
{
"epoch": 0.3972727272727273,
"grad_norm": 156622810775552.0,
"learning_rate": 6.587125137248558e-07,
"loss": 31.190673828125,
"step": 4370
},
{
"epoch": 0.3981818181818182,
"grad_norm": 238024789065728.0,
"learning_rate": 6.573577227937951e-07,
"loss": 31.272283935546874,
"step": 4380
},
{
"epoch": 0.3990909090909091,
"grad_norm": 113410725380096.0,
"learning_rate": 6.560016483442075e-07,
"loss": 31.559075927734376,
"step": 4390
},
{
"epoch": 0.4,
"grad_norm": 58008813961216.0,
"learning_rate": 6.546443014371745e-07,
"loss": 31.474777221679688,
"step": 4400
},
{
"epoch": 0.4,
"eval_loss": 31.23973846435547,
"eval_runtime": 2.2483,
"eval_samples_per_second": 1.779,
"eval_steps_per_second": 0.445,
"step": 4400
},
{
"epoch": 0.4009090909090909,
"grad_norm": 143956264353792.0,
"learning_rate": 6.53285693144158e-07,
"loss": 31.266354370117188,
"step": 4410
},
{
"epoch": 0.4018181818181818,
"grad_norm": 72287755698176.0,
"learning_rate": 6.51925834546907e-07,
"loss": 31.40149841308594,
"step": 4420
},
{
"epoch": 0.4027272727272727,
"grad_norm": 191065126600704.0,
"learning_rate": 6.5056473673737e-07,
"loss": 30.717300415039062,
"step": 4430
},
{
"epoch": 0.4036363636363636,
"grad_norm": 268216597217280.0,
"learning_rate": 6.49202410817603e-07,
"loss": 31.23114929199219,
"step": 4440
},
{
"epoch": 0.40454545454545454,
"grad_norm": 178938940751872.0,
"learning_rate": 6.478388678996796e-07,
"loss": 31.212506103515626,
"step": 4450
},
{
"epoch": 0.40545454545454546,
"grad_norm": 342899149504512.0,
"learning_rate": 6.464741191055994e-07,
"loss": 31.681393432617188,
"step": 4460
},
{
"epoch": 0.40636363636363637,
"grad_norm": 184348150071296.0,
"learning_rate": 6.451081755671985e-07,
"loss": 31.174737548828126,
"step": 4470
},
{
"epoch": 0.4072727272727273,
"grad_norm": 103112006172672.0,
"learning_rate": 6.437410484260583e-07,
"loss": 31.140850830078126,
"step": 4480
},
{
"epoch": 0.4081818181818182,
"grad_norm": 327214902018048.0,
"learning_rate": 6.42372748833414e-07,
"loss": 31.637176513671875,
"step": 4490
},
{
"epoch": 0.4090909090909091,
"grad_norm": 162547080626176.0,
"learning_rate": 6.410032879500646e-07,
"loss": 31.360162353515626,
"step": 4500
},
{
"epoch": 0.4090909090909091,
"eval_loss": 31.26785659790039,
"eval_runtime": 2.2743,
"eval_samples_per_second": 1.759,
"eval_steps_per_second": 0.44,
"step": 4500
},
{
"epoch": 0.41,
"grad_norm": 101430937518080.0,
"learning_rate": 6.396326769462811e-07,
"loss": 30.955780029296875,
"step": 4510
},
{
"epoch": 0.4109090909090909,
"grad_norm": 411952325066752.0,
"learning_rate": 6.382609270017154e-07,
"loss": 31.721075439453124,
"step": 4520
},
{
"epoch": 0.4118181818181818,
"grad_norm": 289259034509312.0,
"learning_rate": 6.3688804930531e-07,
"loss": 31.32822265625,
"step": 4530
},
{
"epoch": 0.4127272727272727,
"grad_norm": 55133039755264.0,
"learning_rate": 6.355140550552058e-07,
"loss": 31.106060791015626,
"step": 4540
},
{
"epoch": 0.41363636363636364,
"grad_norm": 85135311503360.0,
"learning_rate": 6.341389554586511e-07,
"loss": 31.692236328125,
"step": 4550
},
{
"epoch": 0.41454545454545455,
"grad_norm": 67352506925056.0,
"learning_rate": 6.327627617319103e-07,
"loss": 31.49931640625,
"step": 4560
},
{
"epoch": 0.41545454545454547,
"grad_norm": 230468012212224.0,
"learning_rate": 6.313854851001721e-07,
"loss": 31.419146728515624,
"step": 4570
},
{
"epoch": 0.4163636363636364,
"grad_norm": 191184244834304.0,
"learning_rate": 6.300071367974582e-07,
"loss": 31.2831298828125,
"step": 4580
},
{
"epoch": 0.4172727272727273,
"grad_norm": 196244437729280.0,
"learning_rate": 6.286277280665315e-07,
"loss": 31.070465087890625,
"step": 4590
},
{
"epoch": 0.41818181818181815,
"grad_norm": 432272285106176.0,
"learning_rate": 6.27247270158805e-07,
"loss": 31.196286010742188,
"step": 4600
},
{
"epoch": 0.41818181818181815,
"eval_loss": 31.265504837036133,
"eval_runtime": 2.2536,
"eval_samples_per_second": 1.775,
"eval_steps_per_second": 0.444,
"step": 4600
},
{
"epoch": 0.41909090909090907,
"grad_norm": 132382501896192.0,
"learning_rate": 6.258657743342486e-07,
"loss": 31.409124755859374,
"step": 4610
},
{
"epoch": 0.42,
"grad_norm": 123047918960640.0,
"learning_rate": 6.244832518612989e-07,
"loss": 31.174249267578126,
"step": 4620
},
{
"epoch": 0.4209090909090909,
"grad_norm": 101801286172672.0,
"learning_rate": 6.230997140167662e-07,
"loss": 31.151278686523437,
"step": 4630
},
{
"epoch": 0.4218181818181818,
"grad_norm": 110819392094208.0,
"learning_rate": 6.217151720857432e-07,
"loss": 31.5635498046875,
"step": 4640
},
{
"epoch": 0.42272727272727273,
"grad_norm": 162855865286656.0,
"learning_rate": 6.203296373615122e-07,
"loss": 31.27996826171875,
"step": 4650
},
{
"epoch": 0.42363636363636364,
"grad_norm": 113649129619456.0,
"learning_rate": 6.189431211454538e-07,
"loss": 31.386068725585936,
"step": 4660
},
{
"epoch": 0.42454545454545456,
"grad_norm": 296968836349952.0,
"learning_rate": 6.175556347469541e-07,
"loss": 31.396221923828126,
"step": 4670
},
{
"epoch": 0.4254545454545455,
"grad_norm": 382460730802176.0,
"learning_rate": 6.161671894833127e-07,
"loss": 31.629803466796876,
"step": 4680
},
{
"epoch": 0.4263636363636364,
"grad_norm": 50031491022848.0,
"learning_rate": 6.147777966796505e-07,
"loss": 31.4884765625,
"step": 4690
},
{
"epoch": 0.42727272727272725,
"grad_norm": 160202313695232.0,
"learning_rate": 6.13387467668817e-07,
"loss": 31.25142822265625,
"step": 4700
},
{
"epoch": 0.42727272727272725,
"eval_loss": 31.27532196044922,
"eval_runtime": 2.2762,
"eval_samples_per_second": 1.757,
"eval_steps_per_second": 0.439,
"step": 4700
},
{
"epoch": 0.42818181818181816,
"grad_norm": 130051811049472.0,
"learning_rate": 6.119962137912979e-07,
"loss": 31.30537109375,
"step": 4710
},
{
"epoch": 0.4290909090909091,
"grad_norm": 118681648496640.0,
"learning_rate": 6.106040463951236e-07,
"loss": 31.411505126953124,
"step": 4720
},
{
"epoch": 0.43,
"grad_norm": 68806344966144.0,
"learning_rate": 6.092109768357747e-07,
"loss": 30.8322998046875,
"step": 4730
},
{
"epoch": 0.4309090909090909,
"grad_norm": 80994853978112.0,
"learning_rate": 6.078170164760911e-07,
"loss": 31.552935791015624,
"step": 4740
},
{
"epoch": 0.4318181818181818,
"grad_norm": 192088553553920.0,
"learning_rate": 6.064221766861785e-07,
"loss": 31.02978515625,
"step": 4750
},
{
"epoch": 0.43272727272727274,
"grad_norm": 156923173273600.0,
"learning_rate": 6.050264688433161e-07,
"loss": 31.151821899414063,
"step": 4760
},
{
"epoch": 0.43363636363636365,
"grad_norm": 306010447151104.0,
"learning_rate": 6.036299043318631e-07,
"loss": 31.844577026367187,
"step": 4770
},
{
"epoch": 0.43454545454545457,
"grad_norm": 163939203678208.0,
"learning_rate": 6.022324945431665e-07,
"loss": 31.494683837890626,
"step": 4780
},
{
"epoch": 0.4354545454545454,
"grad_norm": 307883992416256.0,
"learning_rate": 6.008342508754682e-07,
"loss": 31.625247192382812,
"step": 4790
},
{
"epoch": 0.43636363636363634,
"grad_norm": 161946305298432.0,
"learning_rate": 5.994351847338113e-07,
"loss": 31.29015197753906,
"step": 4800
},
{
"epoch": 0.43636363636363634,
"eval_loss": 31.277931213378906,
"eval_runtime": 2.2639,
"eval_samples_per_second": 1.767,
"eval_steps_per_second": 0.442,
"step": 4800
},
{
"epoch": 0.43727272727272726,
"grad_norm": 106276080058368.0,
"learning_rate": 5.980353075299481e-07,
"loss": 31.702081298828126,
"step": 4810
},
{
"epoch": 0.4381818181818182,
"grad_norm": 137356761890816.0,
"learning_rate": 5.966346306822458e-07,
"loss": 31.010269165039062,
"step": 4820
},
{
"epoch": 0.4390909090909091,
"grad_norm": 303051114020864.0,
"learning_rate": 5.95233165615595e-07,
"loss": 31.519564819335937,
"step": 4830
},
{
"epoch": 0.44,
"grad_norm": 43947078451200.0,
"learning_rate": 5.938309237613146e-07,
"loss": 31.17099609375,
"step": 4840
},
{
"epoch": 0.4409090909090909,
"grad_norm": 200443087028224.0,
"learning_rate": 5.924279165570602e-07,
"loss": 31.536282348632813,
"step": 4850
},
{
"epoch": 0.44181818181818183,
"grad_norm": 255512100732928.0,
"learning_rate": 5.910241554467298e-07,
"loss": 31.622979736328126,
"step": 4860
},
{
"epoch": 0.44272727272727275,
"grad_norm": 122165680668672.0,
"learning_rate": 5.896196518803707e-07,
"loss": 31.318588256835938,
"step": 4870
},
{
"epoch": 0.44363636363636366,
"grad_norm": 59236595793920.0,
"learning_rate": 5.882144173140867e-07,
"loss": 31.511083984375,
"step": 4880
},
{
"epoch": 0.4445454545454545,
"grad_norm": 160883888095232.0,
"learning_rate": 5.868084632099435e-07,
"loss": 31.54732666015625,
"step": 4890
},
{
"epoch": 0.44545454545454544,
"grad_norm": 257228040830976.0,
"learning_rate": 5.854018010358761e-07,
"loss": 31.00733337402344,
"step": 4900
},
{
"epoch": 0.44545454545454544,
"eval_loss": 31.296031951904297,
"eval_runtime": 2.2374,
"eval_samples_per_second": 1.788,
"eval_steps_per_second": 0.447,
"step": 4900
},
{
"epoch": 0.44636363636363635,
"grad_norm": 92250444922880.0,
"learning_rate": 5.839944422655952e-07,
"loss": 31.35645446777344,
"step": 4910
},
{
"epoch": 0.44727272727272727,
"grad_norm": 118262083878912.0,
"learning_rate": 5.825863983784931e-07,
"loss": 31.456143188476563,
"step": 4920
},
{
"epoch": 0.4481818181818182,
"grad_norm": 55267186180096.0,
"learning_rate": 5.811776808595506e-07,
"loss": 31.58196105957031,
"step": 4930
},
{
"epoch": 0.4490909090909091,
"grad_norm": 242786548842496.0,
"learning_rate": 5.797683011992432e-07,
"loss": 31.34881591796875,
"step": 4940
},
{
"epoch": 0.45,
"grad_norm": 193380936056832.0,
"learning_rate": 5.783582708934468e-07,
"loss": 31.296319580078126,
"step": 4950
},
{
"epoch": 0.4509090909090909,
"grad_norm": 106026896457728.0,
"learning_rate": 5.769476014433451e-07,
"loss": 30.779248046875,
"step": 4960
},
{
"epoch": 0.45181818181818184,
"grad_norm": 87636718911488.0,
"learning_rate": 5.755363043553346e-07,
"loss": 31.5363037109375,
"step": 4970
},
{
"epoch": 0.4527272727272727,
"grad_norm": 73219755212800.0,
"learning_rate": 5.741243911409314e-07,
"loss": 31.977978515625,
"step": 4980
},
{
"epoch": 0.4536363636363636,
"grad_norm": 236564936392704.0,
"learning_rate": 5.72711873316677e-07,
"loss": 31.291098022460936,
"step": 4990
},
{
"epoch": 0.45454545454545453,
"grad_norm": 141793949646848.0,
"learning_rate": 5.712987624040451e-07,
"loss": 30.713864135742188,
"step": 5000
},
{
"epoch": 0.45454545454545453,
"eval_loss": 31.29385757446289,
"eval_runtime": 2.2444,
"eval_samples_per_second": 1.782,
"eval_steps_per_second": 0.446,
"step": 5000
}
],
"logging_steps": 10,
"max_steps": 11000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.264961908736e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}