| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 0.45454545454545453, |
| "eval_steps": 100, |
| "global_step": 5000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": false, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.0009090909090909091, |
| "grad_norm": 24835585474560.0, |
| "learning_rate": 9.999983482695944e-07, |
| "loss": 31.50365295410156, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.0018181818181818182, |
| "grad_norm": 15793144201216.0, |
| "learning_rate": 9.999926385982519e-07, |
| "loss": 31.015130615234376, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.0027272727272727275, |
| "grad_norm": 20612445634560.0, |
| "learning_rate": 9.999828506408003e-07, |
| "loss": 31.242529296875, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.0036363636363636364, |
| "grad_norm": 34239179390976.0, |
| "learning_rate": 9.999689844770766e-07, |
| "loss": 31.6640625, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.004545454545454545, |
| "grad_norm": 51216444817408.0, |
| "learning_rate": 9.999510402201835e-07, |
| "loss": 31.64912109375, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.005454545454545455, |
| "grad_norm": 20637055713280.0, |
| "learning_rate": 9.99929018016486e-07, |
| "loss": 31.355593872070312, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.006363636363636364, |
| "grad_norm": 32561835278336.0, |
| "learning_rate": 9.999029180456129e-07, |
| "loss": 31.931137084960938, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.007272727272727273, |
| "grad_norm": 68632881135616.0, |
| "learning_rate": 9.998727405204534e-07, |
| "loss": 31.378302001953124, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.008181818181818182, |
| "grad_norm": 42669824802816.0, |
| "learning_rate": 9.998384856871564e-07, |
| "loss": 31.455963134765625, |
| "step": 90 |
| }, |
| { |
| "epoch": 0.00909090909090909, |
| "grad_norm": 16400540237824.0, |
| "learning_rate": 9.998001538251282e-07, |
| "loss": 31.83574523925781, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.00909090909090909, |
| "eval_loss": 31.256309509277344, |
| "eval_runtime": 22.3946, |
| "eval_samples_per_second": 0.179, |
| "eval_steps_per_second": 0.045, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.01, |
| "grad_norm": 29021217751040.0, |
| "learning_rate": 9.997577452470298e-07, |
| "loss": 31.68128662109375, |
| "step": 110 |
| }, |
| { |
| "epoch": 0.01090909090909091, |
| "grad_norm": 43289218646016.0, |
| "learning_rate": 9.99711260298775e-07, |
| "loss": 31.50353088378906, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.011818181818181818, |
| "grad_norm": 128646291390464.0, |
| "learning_rate": 9.99660699359527e-07, |
| "loss": 31.131292724609374, |
| "step": 130 |
| }, |
| { |
| "epoch": 0.012727272727272728, |
| "grad_norm": 37279833784320.0, |
| "learning_rate": 9.996060628416963e-07, |
| "loss": 31.5599853515625, |
| "step": 140 |
| }, |
| { |
| "epoch": 0.013636363636363636, |
| "grad_norm": 43879491436544.0, |
| "learning_rate": 9.995473511909357e-07, |
| "loss": 31.862338256835937, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.014545454545454545, |
| "grad_norm": 25585361354752.0, |
| "learning_rate": 9.994845648861382e-07, |
| "loss": 31.210086059570312, |
| "step": 160 |
| }, |
| { |
| "epoch": 0.015454545454545455, |
| "grad_norm": 90612418215936.0, |
| "learning_rate": 9.994177044394322e-07, |
| "loss": 31.158685302734376, |
| "step": 170 |
| }, |
| { |
| "epoch": 0.016363636363636365, |
| "grad_norm": 92622169309184.0, |
| "learning_rate": 9.993467703961784e-07, |
| "loss": 31.556906127929686, |
| "step": 180 |
| }, |
| { |
| "epoch": 0.017272727272727273, |
| "grad_norm": 83515236417536.0, |
| "learning_rate": 9.992717633349635e-07, |
| "loss": 31.514627075195314, |
| "step": 190 |
| }, |
| { |
| "epoch": 0.01818181818181818, |
| "grad_norm": 42516023869440.0, |
| "learning_rate": 9.99192683867597e-07, |
| "loss": 31.424298095703126, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.01818181818181818, |
| "eval_loss": 31.22693634033203, |
| "eval_runtime": 2.254, |
| "eval_samples_per_second": 1.775, |
| "eval_steps_per_second": 0.444, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.019090909090909092, |
| "grad_norm": 74708263370752.0, |
| "learning_rate": 9.99109532639106e-07, |
| "loss": 31.736981201171876, |
| "step": 210 |
| }, |
| { |
| "epoch": 0.02, |
| "grad_norm": 137343843434496.0, |
| "learning_rate": 9.99022310327729e-07, |
| "loss": 31.506015014648437, |
| "step": 220 |
| }, |
| { |
| "epoch": 0.02090909090909091, |
| "grad_norm": 48417904525312.0, |
| "learning_rate": 9.98931017644912e-07, |
| "loss": 31.584011840820313, |
| "step": 230 |
| }, |
| { |
| "epoch": 0.02181818181818182, |
| "grad_norm": 58472024506368.0, |
| "learning_rate": 9.988356553353017e-07, |
| "loss": 31.47820129394531, |
| "step": 240 |
| }, |
| { |
| "epoch": 0.022727272727272728, |
| "grad_norm": 19866878738432.0, |
| "learning_rate": 9.987362241767383e-07, |
| "loss": 31.335162353515624, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.023636363636363636, |
| "grad_norm": 31799931568128.0, |
| "learning_rate": 9.986327249802515e-07, |
| "loss": 30.963482666015626, |
| "step": 260 |
| }, |
| { |
| "epoch": 0.024545454545454544, |
| "grad_norm": 85499729412096.0, |
| "learning_rate": 9.985251585900525e-07, |
| "loss": 31.298876953125, |
| "step": 270 |
| }, |
| { |
| "epoch": 0.025454545454545455, |
| "grad_norm": 48352565657600.0, |
| "learning_rate": 9.984135258835272e-07, |
| "loss": 31.747039794921875, |
| "step": 280 |
| }, |
| { |
| "epoch": 0.026363636363636363, |
| "grad_norm": 31058988892160.0, |
| "learning_rate": 9.98297827771229e-07, |
| "loss": 32.078277587890625, |
| "step": 290 |
| }, |
| { |
| "epoch": 0.02727272727272727, |
| "grad_norm": 77612550455296.0, |
| "learning_rate": 9.981780651968722e-07, |
| "loss": 31.41339111328125, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.02727272727272727, |
| "eval_loss": 31.19794273376465, |
| "eval_runtime": 2.2652, |
| "eval_samples_per_second": 1.766, |
| "eval_steps_per_second": 0.441, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.028181818181818183, |
| "grad_norm": 49784861753344.0, |
| "learning_rate": 9.980542391373232e-07, |
| "loss": 31.86634521484375, |
| "step": 310 |
| }, |
| { |
| "epoch": 0.02909090909090909, |
| "grad_norm": 97983580340224.0, |
| "learning_rate": 9.979263506025929e-07, |
| "loss": 31.366073608398438, |
| "step": 320 |
| }, |
| { |
| "epoch": 0.03, |
| "grad_norm": 40498060328960.0, |
| "learning_rate": 9.977944006358285e-07, |
| "loss": 31.210226440429686, |
| "step": 330 |
| }, |
| { |
| "epoch": 0.03090909090909091, |
| "grad_norm": 92092479045632.0, |
| "learning_rate": 9.976583903133059e-07, |
| "loss": 30.927703857421875, |
| "step": 340 |
| }, |
| { |
| "epoch": 0.031818181818181815, |
| "grad_norm": 72197787877376.0, |
| "learning_rate": 9.975183207444189e-07, |
| "loss": 30.43183288574219, |
| "step": 350 |
| }, |
| { |
| "epoch": 0.03272727272727273, |
| "grad_norm": 46449144365056.0, |
| "learning_rate": 9.97374193071672e-07, |
| "loss": 31.0708740234375, |
| "step": 360 |
| }, |
| { |
| "epoch": 0.03363636363636364, |
| "grad_norm": 16542873944064.0, |
| "learning_rate": 9.972260084706704e-07, |
| "loss": 31.289712524414064, |
| "step": 370 |
| }, |
| { |
| "epoch": 0.034545454545454546, |
| "grad_norm": 76645293621248.0, |
| "learning_rate": 9.970737681501104e-07, |
| "loss": 31.326876831054687, |
| "step": 380 |
| }, |
| { |
| "epoch": 0.035454545454545454, |
| "grad_norm": 24548648943616.0, |
| "learning_rate": 9.969174733517693e-07, |
| "loss": 31.130474853515626, |
| "step": 390 |
| }, |
| { |
| "epoch": 0.03636363636363636, |
| "grad_norm": 57560858099712.0, |
| "learning_rate": 9.967571253504956e-07, |
| "loss": 31.06658020019531, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.03636363636363636, |
| "eval_loss": 31.173606872558594, |
| "eval_runtime": 2.2635, |
| "eval_samples_per_second": 1.767, |
| "eval_steps_per_second": 0.442, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.03727272727272727, |
| "grad_norm": 40138956603392.0, |
| "learning_rate": 9.965927254541986e-07, |
| "loss": 31.133847045898438, |
| "step": 410 |
| }, |
| { |
| "epoch": 0.038181818181818185, |
| "grad_norm": 33342583996416.0, |
| "learning_rate": 9.964242750038379e-07, |
| "loss": 31.538308715820314, |
| "step": 420 |
| }, |
| { |
| "epoch": 0.03909090909090909, |
| "grad_norm": 38552683413504.0, |
| "learning_rate": 9.96251775373412e-07, |
| "loss": 31.598001098632814, |
| "step": 430 |
| }, |
| { |
| "epoch": 0.04, |
| "grad_norm": 43073170046976.0, |
| "learning_rate": 9.960752279699469e-07, |
| "loss": 31.713970947265626, |
| "step": 440 |
| }, |
| { |
| "epoch": 0.04090909090909091, |
| "grad_norm": 63941845712896.0, |
| "learning_rate": 9.958946342334858e-07, |
| "loss": 31.403384399414062, |
| "step": 450 |
| }, |
| { |
| "epoch": 0.04181818181818182, |
| "grad_norm": 81496106860544.0, |
| "learning_rate": 9.957099956370761e-07, |
| "loss": 31.192584228515624, |
| "step": 460 |
| }, |
| { |
| "epoch": 0.042727272727272725, |
| "grad_norm": 85547368316928.0, |
| "learning_rate": 9.95521313686758e-07, |
| "loss": 31.35161437988281, |
| "step": 470 |
| }, |
| { |
| "epoch": 0.04363636363636364, |
| "grad_norm": 33979606499328.0, |
| "learning_rate": 9.953285899215524e-07, |
| "loss": 31.211724853515626, |
| "step": 480 |
| }, |
| { |
| "epoch": 0.04454545454545455, |
| "grad_norm": 78801216208896.0, |
| "learning_rate": 9.951318259134473e-07, |
| "loss": 31.460574340820312, |
| "step": 490 |
| }, |
| { |
| "epoch": 0.045454545454545456, |
| "grad_norm": 17078298869760.0, |
| "learning_rate": 9.949310232673867e-07, |
| "loss": 31.416909790039064, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.045454545454545456, |
| "eval_loss": 31.15839385986328, |
| "eval_runtime": 2.2493, |
| "eval_samples_per_second": 1.778, |
| "eval_steps_per_second": 0.445, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.046363636363636364, |
| "grad_norm": 25643221778432.0, |
| "learning_rate": 9.947261836212555e-07, |
| "loss": 31.366104125976562, |
| "step": 510 |
| }, |
| { |
| "epoch": 0.04727272727272727, |
| "grad_norm": 68086552068096.0, |
| "learning_rate": 9.94517308645868e-07, |
| "loss": 31.929010009765626, |
| "step": 520 |
| }, |
| { |
| "epoch": 0.04818181818181818, |
| "grad_norm": 85420834553856.0, |
| "learning_rate": 9.94304400044953e-07, |
| "loss": 31.22962646484375, |
| "step": 530 |
| }, |
| { |
| "epoch": 0.04909090909090909, |
| "grad_norm": 34801671208960.0, |
| "learning_rate": 9.940874595551404e-07, |
| "loss": 31.47492370605469, |
| "step": 540 |
| }, |
| { |
| "epoch": 0.05, |
| "grad_norm": 50617645006848.0, |
| "learning_rate": 9.938664889459468e-07, |
| "loss": 31.026275634765625, |
| "step": 550 |
| }, |
| { |
| "epoch": 0.05090909090909091, |
| "grad_norm": 49960867332096.0, |
| "learning_rate": 9.936414900197618e-07, |
| "loss": 31.542160034179688, |
| "step": 560 |
| }, |
| { |
| "epoch": 0.05181818181818182, |
| "grad_norm": 32654523105280.0, |
| "learning_rate": 9.934124646118324e-07, |
| "loss": 31.71721496582031, |
| "step": 570 |
| }, |
| { |
| "epoch": 0.05272727272727273, |
| "grad_norm": 44004343283712.0, |
| "learning_rate": 9.931794145902485e-07, |
| "loss": 31.2598876953125, |
| "step": 580 |
| }, |
| { |
| "epoch": 0.053636363636363635, |
| "grad_norm": 66710199599104.0, |
| "learning_rate": 9.92942341855927e-07, |
| "loss": 31.227630615234375, |
| "step": 590 |
| }, |
| { |
| "epoch": 0.05454545454545454, |
| "grad_norm": 75621816336384.0, |
| "learning_rate": 9.927012483425976e-07, |
| "loss": 31.72113037109375, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.05454545454545454, |
| "eval_loss": 31.14929962158203, |
| "eval_runtime": 2.2862, |
| "eval_samples_per_second": 1.75, |
| "eval_steps_per_second": 0.437, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.05545454545454546, |
| "grad_norm": 60767218958336.0, |
| "learning_rate": 9.924561360167858e-07, |
| "loss": 30.905987548828126, |
| "step": 610 |
| }, |
| { |
| "epoch": 0.056363636363636366, |
| "grad_norm": 28232556478464.0, |
| "learning_rate": 9.922070068777972e-07, |
| "loss": 31.27515869140625, |
| "step": 620 |
| }, |
| { |
| "epoch": 0.057272727272727274, |
| "grad_norm": 57858754347008.0, |
| "learning_rate": 9.91953862957702e-07, |
| "loss": 31.28424072265625, |
| "step": 630 |
| }, |
| { |
| "epoch": 0.05818181818181818, |
| "grad_norm": 60663598678016.0, |
| "learning_rate": 9.91696706321317e-07, |
| "loss": 31.702291870117186, |
| "step": 640 |
| }, |
| { |
| "epoch": 0.05909090909090909, |
| "grad_norm": 64403231735808.0, |
| "learning_rate": 9.914355390661895e-07, |
| "loss": 31.74828186035156, |
| "step": 650 |
| }, |
| { |
| "epoch": 0.06, |
| "grad_norm": 49898036658176.0, |
| "learning_rate": 9.91170363322581e-07, |
| "loss": 30.9451904296875, |
| "step": 660 |
| }, |
| { |
| "epoch": 0.060909090909090906, |
| "grad_norm": 22820329357312.0, |
| "learning_rate": 9.90901181253448e-07, |
| "loss": 31.49604187011719, |
| "step": 670 |
| }, |
| { |
| "epoch": 0.06181818181818182, |
| "grad_norm": 170618632798208.0, |
| "learning_rate": 9.906279950544258e-07, |
| "loss": 30.988015747070314, |
| "step": 680 |
| }, |
| { |
| "epoch": 0.06272727272727273, |
| "grad_norm": 66990144225280.0, |
| "learning_rate": 9.903508069538107e-07, |
| "loss": 31.130947875976563, |
| "step": 690 |
| }, |
| { |
| "epoch": 0.06363636363636363, |
| "grad_norm": 39199952601088.0, |
| "learning_rate": 9.900696192125401e-07, |
| "loss": 31.55877685546875, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.06363636363636363, |
| "eval_loss": 31.127349853515625, |
| "eval_runtime": 2.2839, |
| "eval_samples_per_second": 1.751, |
| "eval_steps_per_second": 0.438, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.06454545454545454, |
| "grad_norm": 53508833280000.0, |
| "learning_rate": 9.897844341241764e-07, |
| "loss": 30.89222106933594, |
| "step": 710 |
| }, |
| { |
| "epoch": 0.06545454545454546, |
| "grad_norm": 76796364062720.0, |
| "learning_rate": 9.894952540148861e-07, |
| "loss": 31.557272338867186, |
| "step": 720 |
| }, |
| { |
| "epoch": 0.06636363636363636, |
| "grad_norm": 53238585884672.0, |
| "learning_rate": 9.892020812434227e-07, |
| "loss": 31.102691650390625, |
| "step": 730 |
| }, |
| { |
| "epoch": 0.06727272727272728, |
| "grad_norm": 72308743995392.0, |
| "learning_rate": 9.889049182011064e-07, |
| "loss": 31.06553955078125, |
| "step": 740 |
| }, |
| { |
| "epoch": 0.06818181818181818, |
| "grad_norm": 85104164601856.0, |
| "learning_rate": 9.886037673118046e-07, |
| "loss": 31.310086059570313, |
| "step": 750 |
| }, |
| { |
| "epoch": 0.06909090909090909, |
| "grad_norm": 75288956370944.0, |
| "learning_rate": 9.882986310319123e-07, |
| "loss": 30.976141357421874, |
| "step": 760 |
| }, |
| { |
| "epoch": 0.07, |
| "grad_norm": 39805987586048.0, |
| "learning_rate": 9.879895118503322e-07, |
| "loss": 31.357177734375, |
| "step": 770 |
| }, |
| { |
| "epoch": 0.07090909090909091, |
| "grad_norm": 13191673282560.0, |
| "learning_rate": 9.876764122884546e-07, |
| "loss": 31.26226806640625, |
| "step": 780 |
| }, |
| { |
| "epoch": 0.07181818181818182, |
| "grad_norm": 98536062451712.0, |
| "learning_rate": 9.873593349001363e-07, |
| "loss": 31.190093994140625, |
| "step": 790 |
| }, |
| { |
| "epoch": 0.07272727272727272, |
| "grad_norm": 86483419529216.0, |
| "learning_rate": 9.870382822716797e-07, |
| "loss": 31.130612182617188, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.07272727272727272, |
| "eval_loss": 31.110492706298828, |
| "eval_runtime": 2.2472, |
| "eval_samples_per_second": 1.78, |
| "eval_steps_per_second": 0.445, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.07363636363636364, |
| "grad_norm": 50370197848064.0, |
| "learning_rate": 9.867132570218127e-07, |
| "loss": 31.63127746582031, |
| "step": 810 |
| }, |
| { |
| "epoch": 0.07454545454545454, |
| "grad_norm": 66007850811392.0, |
| "learning_rate": 9.863842618016658e-07, |
| "loss": 31.623040771484376, |
| "step": 820 |
| }, |
| { |
| "epoch": 0.07545454545454545, |
| "grad_norm": 109455253438464.0, |
| "learning_rate": 9.86051299294752e-07, |
| "loss": 31.264794921875, |
| "step": 830 |
| }, |
| { |
| "epoch": 0.07636363636363637, |
| "grad_norm": 35646429200384.0, |
| "learning_rate": 9.857143722169442e-07, |
| "loss": 30.843011474609376, |
| "step": 840 |
| }, |
| { |
| "epoch": 0.07727272727272727, |
| "grad_norm": 35847839678464.0, |
| "learning_rate": 9.853734833164525e-07, |
| "loss": 31.70771484375, |
| "step": 850 |
| }, |
| { |
| "epoch": 0.07818181818181819, |
| "grad_norm": 169087560843264.0, |
| "learning_rate": 9.850286353738032e-07, |
| "loss": 31.51513671875, |
| "step": 860 |
| }, |
| { |
| "epoch": 0.07909090909090909, |
| "grad_norm": 35594008788992.0, |
| "learning_rate": 9.846798312018146e-07, |
| "loss": 31.227005004882812, |
| "step": 870 |
| }, |
| { |
| "epoch": 0.08, |
| "grad_norm": 34218442752000.0, |
| "learning_rate": 9.843270736455752e-07, |
| "loss": 31.844467163085938, |
| "step": 880 |
| }, |
| { |
| "epoch": 0.0809090909090909, |
| "grad_norm": 76758078455808.0, |
| "learning_rate": 9.839703655824194e-07, |
| "loss": 31.2140380859375, |
| "step": 890 |
| }, |
| { |
| "epoch": 0.08181818181818182, |
| "grad_norm": 25330528026624.0, |
| "learning_rate": 9.836097099219057e-07, |
| "loss": 30.997073364257812, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.08181818181818182, |
| "eval_loss": 31.093814849853516, |
| "eval_runtime": 2.2539, |
| "eval_samples_per_second": 1.775, |
| "eval_steps_per_second": 0.444, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.08272727272727273, |
| "grad_norm": 111150716944384.0, |
| "learning_rate": 9.832451096057912e-07, |
| "loss": 31.376983642578125, |
| "step": 910 |
| }, |
| { |
| "epoch": 0.08363636363636363, |
| "grad_norm": 90311955054592.0, |
| "learning_rate": 9.82876567608008e-07, |
| "loss": 31.437393188476562, |
| "step": 920 |
| }, |
| { |
| "epoch": 0.08454545454545455, |
| "grad_norm": 51954126422016.0, |
| "learning_rate": 9.825040869346404e-07, |
| "loss": 31.078985595703124, |
| "step": 930 |
| }, |
| { |
| "epoch": 0.08545454545454545, |
| "grad_norm": 53884227682304.0, |
| "learning_rate": 9.821276706238985e-07, |
| "loss": 31.514266967773438, |
| "step": 940 |
| }, |
| { |
| "epoch": 0.08636363636363636, |
| "grad_norm": 25048345739264.0, |
| "learning_rate": 9.81747321746094e-07, |
| "loss": 31.2593505859375, |
| "step": 950 |
| }, |
| { |
| "epoch": 0.08727272727272728, |
| "grad_norm": 77616040116224.0, |
| "learning_rate": 9.81363043403616e-07, |
| "loss": 31.06065673828125, |
| "step": 960 |
| }, |
| { |
| "epoch": 0.08818181818181818, |
| "grad_norm": 62835941965824.0, |
| "learning_rate": 9.809748387309047e-07, |
| "loss": 31.265579223632812, |
| "step": 970 |
| }, |
| { |
| "epoch": 0.0890909090909091, |
| "grad_norm": 36371255263232.0, |
| "learning_rate": 9.805827108944259e-07, |
| "loss": 31.292767333984376, |
| "step": 980 |
| }, |
| { |
| "epoch": 0.09, |
| "grad_norm": 43744346767360.0, |
| "learning_rate": 9.801866630926459e-07, |
| "loss": 31.146585083007814, |
| "step": 990 |
| }, |
| { |
| "epoch": 0.09090909090909091, |
| "grad_norm": 104874788257792.0, |
| "learning_rate": 9.797866985560049e-07, |
| "loss": 31.14124755859375, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.09090909090909091, |
| "eval_loss": 31.08183479309082, |
| "eval_runtime": 2.2692, |
| "eval_samples_per_second": 1.763, |
| "eval_steps_per_second": 0.441, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.09181818181818181, |
| "grad_norm": 27701710684160.0, |
| "learning_rate": 9.793828205468902e-07, |
| "loss": 31.335833740234374, |
| "step": 1010 |
| }, |
| { |
| "epoch": 0.09272727272727273, |
| "grad_norm": 39849474129920.0, |
| "learning_rate": 9.789750323596107e-07, |
| "loss": 31.116259765625, |
| "step": 1020 |
| }, |
| { |
| "epoch": 0.09363636363636364, |
| "grad_norm": 102589924376576.0, |
| "learning_rate": 9.78563337320369e-07, |
| "loss": 31.5702880859375, |
| "step": 1030 |
| }, |
| { |
| "epoch": 0.09454545454545454, |
| "grad_norm": 36681726033920.0, |
| "learning_rate": 9.781477387872351e-07, |
| "loss": 31.245220947265626, |
| "step": 1040 |
| }, |
| { |
| "epoch": 0.09545454545454546, |
| "grad_norm": 72225545781248.0, |
| "learning_rate": 9.77728240150118e-07, |
| "loss": 31.252020263671874, |
| "step": 1050 |
| }, |
| { |
| "epoch": 0.09636363636363636, |
| "grad_norm": 50460786425856.0, |
| "learning_rate": 9.773048448307396e-07, |
| "loss": 31.183920288085936, |
| "step": 1060 |
| }, |
| { |
| "epoch": 0.09727272727272727, |
| "grad_norm": 132099931635712.0, |
| "learning_rate": 9.768775562826047e-07, |
| "loss": 31.01998291015625, |
| "step": 1070 |
| }, |
| { |
| "epoch": 0.09818181818181818, |
| "grad_norm": 78991218180096.0, |
| "learning_rate": 9.764463779909748e-07, |
| "loss": 30.735391235351564, |
| "step": 1080 |
| }, |
| { |
| "epoch": 0.09909090909090909, |
| "grad_norm": 73166386888704.0, |
| "learning_rate": 9.760113134728383e-07, |
| "loss": 30.96459045410156, |
| "step": 1090 |
| }, |
| { |
| "epoch": 0.1, |
| "grad_norm": 34503961608192.0, |
| "learning_rate": 9.755723662768827e-07, |
| "loss": 31.42650451660156, |
| "step": 1100 |
| }, |
| { |
| "epoch": 0.1, |
| "eval_loss": 31.072101593017578, |
| "eval_runtime": 2.2794, |
| "eval_samples_per_second": 1.755, |
| "eval_steps_per_second": 0.439, |
| "step": 1100 |
| }, |
| { |
| "epoch": 0.1009090909090909, |
| "grad_norm": 77892193091584.0, |
| "learning_rate": 9.751295399834653e-07, |
| "loss": 31.181564331054688, |
| "step": 1110 |
| }, |
| { |
| "epoch": 0.10181818181818182, |
| "grad_norm": 71087312338944.0, |
| "learning_rate": 9.746828382045843e-07, |
| "loss": 31.1749755859375, |
| "step": 1120 |
| }, |
| { |
| "epoch": 0.10272727272727272, |
| "grad_norm": 25741035044864.0, |
| "learning_rate": 9.742322645838476e-07, |
| "loss": 31.249942016601562, |
| "step": 1130 |
| }, |
| { |
| "epoch": 0.10363636363636364, |
| "grad_norm": 21756377038848.0, |
| "learning_rate": 9.737778227964468e-07, |
| "loss": 31.41895446777344, |
| "step": 1140 |
| }, |
| { |
| "epoch": 0.10454545454545454, |
| "grad_norm": 79144410939392.0, |
| "learning_rate": 9.73319516549123e-07, |
| "loss": 31.132781982421875, |
| "step": 1150 |
| }, |
| { |
| "epoch": 0.10545454545454545, |
| "grad_norm": 80644025614336.0, |
| "learning_rate": 9.728573495801392e-07, |
| "loss": 31.506884765625, |
| "step": 1160 |
| }, |
| { |
| "epoch": 0.10636363636363637, |
| "grad_norm": 81667788111872.0, |
| "learning_rate": 9.723913256592495e-07, |
| "loss": 31.320529174804687, |
| "step": 1170 |
| }, |
| { |
| "epoch": 0.10727272727272727, |
| "grad_norm": 88748838617088.0, |
| "learning_rate": 9.719214485876675e-07, |
| "loss": 31.806332397460938, |
| "step": 1180 |
| }, |
| { |
| "epoch": 0.10818181818181818, |
| "grad_norm": 85104365928448.0, |
| "learning_rate": 9.71447722198036e-07, |
| "loss": 31.29075927734375, |
| "step": 1190 |
| }, |
| { |
| "epoch": 0.10909090909090909, |
| "grad_norm": 114349712605184.0, |
| "learning_rate": 9.709701503543952e-07, |
| "loss": 31.4369140625, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.10909090909090909, |
| "eval_loss": 31.056861877441406, |
| "eval_runtime": 2.2389, |
| "eval_samples_per_second": 1.787, |
| "eval_steps_per_second": 0.447, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.11, |
| "grad_norm": 55083916066816.0, |
| "learning_rate": 9.70488736952152e-07, |
| "loss": 31.772137451171876, |
| "step": 1210 |
| }, |
| { |
| "epoch": 0.11090909090909092, |
| "grad_norm": 79216167092224.0, |
| "learning_rate": 9.70003485918047e-07, |
| "loss": 31.12777099609375, |
| "step": 1220 |
| }, |
| { |
| "epoch": 0.11181818181818182, |
| "grad_norm": 79771996258304.0, |
| "learning_rate": 9.695144012101237e-07, |
| "loss": 31.1830078125, |
| "step": 1230 |
| }, |
| { |
| "epoch": 0.11272727272727273, |
| "grad_norm": 56465817600000.0, |
| "learning_rate": 9.690214868176957e-07, |
| "loss": 31.160888671875, |
| "step": 1240 |
| }, |
| { |
| "epoch": 0.11363636363636363, |
| "grad_norm": 21445293899776.0, |
| "learning_rate": 9.68524746761314e-07, |
| "loss": 31.626931762695314, |
| "step": 1250 |
| }, |
| { |
| "epoch": 0.11454545454545455, |
| "grad_norm": 13377668644864.0, |
| "learning_rate": 9.680241850927343e-07, |
| "loss": 31.01793212890625, |
| "step": 1260 |
| }, |
| { |
| "epoch": 0.11545454545454545, |
| "grad_norm": 45122188214272.0, |
| "learning_rate": 9.675198058948842e-07, |
| "loss": 31.344110107421876, |
| "step": 1270 |
| }, |
| { |
| "epoch": 0.11636363636363636, |
| "grad_norm": 45118371397632.0, |
| "learning_rate": 9.670116132818296e-07, |
| "loss": 30.963018798828124, |
| "step": 1280 |
| }, |
| { |
| "epoch": 0.11727272727272728, |
| "grad_norm": 79956101038080.0, |
| "learning_rate": 9.664996113987413e-07, |
| "loss": 31.142779541015624, |
| "step": 1290 |
| }, |
| { |
| "epoch": 0.11818181818181818, |
| "grad_norm": 81212462858240.0, |
| "learning_rate": 9.659838044218612e-07, |
| "loss": 31.084671020507812, |
| "step": 1300 |
| }, |
| { |
| "epoch": 0.11818181818181818, |
| "eval_loss": 31.046554565429688, |
| "eval_runtime": 2.2298, |
| "eval_samples_per_second": 1.794, |
| "eval_steps_per_second": 0.448, |
| "step": 1300 |
| }, |
| { |
| "epoch": 0.1190909090909091, |
| "grad_norm": 61813605531648.0, |
| "learning_rate": 9.654641965584677e-07, |
| "loss": 31.6784423828125, |
| "step": 1310 |
| }, |
| { |
| "epoch": 0.12, |
| "grad_norm": 93534480760832.0, |
| "learning_rate": 9.649407920468429e-07, |
| "loss": 31.229824829101563, |
| "step": 1320 |
| }, |
| { |
| "epoch": 0.12090909090909091, |
| "grad_norm": 49400923553792.0, |
| "learning_rate": 9.644135951562358e-07, |
| "loss": 31.641665649414062, |
| "step": 1330 |
| }, |
| { |
| "epoch": 0.12181818181818181, |
| "grad_norm": 28665326862336.0, |
| "learning_rate": 9.638826101868297e-07, |
| "loss": 31.051693725585938, |
| "step": 1340 |
| }, |
| { |
| "epoch": 0.12272727272727273, |
| "grad_norm": 92450051850240.0, |
| "learning_rate": 9.63347841469705e-07, |
| "loss": 31.478741455078126, |
| "step": 1350 |
| }, |
| { |
| "epoch": 0.12363636363636364, |
| "grad_norm": 15963996028928.0, |
| "learning_rate": 9.62809293366806e-07, |
| "loss": 31.277313232421875, |
| "step": 1360 |
| }, |
| { |
| "epoch": 0.12454545454545454, |
| "grad_norm": 142693862735872.0, |
| "learning_rate": 9.62266970270904e-07, |
| "loss": 31.675, |
| "step": 1370 |
| }, |
| { |
| "epoch": 0.12545454545454546, |
| "grad_norm": 93112651218944.0, |
| "learning_rate": 9.617208766055612e-07, |
| "loss": 31.52940673828125, |
| "step": 1380 |
| }, |
| { |
| "epoch": 0.12636363636363637, |
| "grad_norm": 55887968337920.0, |
| "learning_rate": 9.61171016825096e-07, |
| "loss": 30.970913696289063, |
| "step": 1390 |
| }, |
| { |
| "epoch": 0.12727272727272726, |
| "grad_norm": 98350414168064.0, |
| "learning_rate": 9.606173954145452e-07, |
| "loss": 31.27143249511719, |
| "step": 1400 |
| }, |
| { |
| "epoch": 0.12727272727272726, |
| "eval_loss": 31.040485382080078, |
| "eval_runtime": 2.2618, |
| "eval_samples_per_second": 1.768, |
| "eval_steps_per_second": 0.442, |
| "step": 1400 |
| }, |
| { |
| "epoch": 0.12818181818181817, |
| "grad_norm": 37604883955712.0, |
| "learning_rate": 9.600600168896283e-07, |
| "loss": 31.471597290039064, |
| "step": 1410 |
| }, |
| { |
| "epoch": 0.1290909090909091, |
| "grad_norm": 95629921484800.0, |
| "learning_rate": 9.594988857967105e-07, |
| "loss": 31.04731140136719, |
| "step": 1420 |
| }, |
| { |
| "epoch": 0.13, |
| "grad_norm": 60152812142592.0, |
| "learning_rate": 9.589340067127657e-07, |
| "loss": 31.429867553710938, |
| "step": 1430 |
| }, |
| { |
| "epoch": 0.13090909090909092, |
| "grad_norm": 22072585617408.0, |
| "learning_rate": 9.583653842453382e-07, |
| "loss": 31.041015625, |
| "step": 1440 |
| }, |
| { |
| "epoch": 0.1318181818181818, |
| "grad_norm": 74209325744128.0, |
| "learning_rate": 9.577930230325072e-07, |
| "loss": 31.526290893554688, |
| "step": 1450 |
| }, |
| { |
| "epoch": 0.13272727272727272, |
| "grad_norm": 42760136556544.0, |
| "learning_rate": 9.572169277428464e-07, |
| "loss": 31.404434204101562, |
| "step": 1460 |
| }, |
| { |
| "epoch": 0.13363636363636364, |
| "grad_norm": 63998871470080.0, |
| "learning_rate": 9.566371030753882e-07, |
| "loss": 31.185369873046874, |
| "step": 1470 |
| }, |
| { |
| "epoch": 0.13454545454545455, |
| "grad_norm": 48346186121216.0, |
| "learning_rate": 9.560535537595838e-07, |
| "loss": 31.842657470703124, |
| "step": 1480 |
| }, |
| { |
| "epoch": 0.13545454545454547, |
| "grad_norm": 122013318381568.0, |
| "learning_rate": 9.554662845552656e-07, |
| "loss": 30.405438232421876, |
| "step": 1490 |
| }, |
| { |
| "epoch": 0.13636363636363635, |
| "grad_norm": 98829219135488.0, |
| "learning_rate": 9.548753002526076e-07, |
| "loss": 31.2637939453125, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.13636363636363635, |
| "eval_loss": 31.038190841674805, |
| "eval_runtime": 2.235, |
| "eval_samples_per_second": 1.79, |
| "eval_steps_per_second": 0.447, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.13727272727272727, |
| "grad_norm": 50074495221760.0, |
| "learning_rate": 9.54280605672087e-07, |
| "loss": 31.2703125, |
| "step": 1510 |
| }, |
| { |
| "epoch": 0.13818181818181818, |
| "grad_norm": 76787170148352.0, |
| "learning_rate": 9.536822056644444e-07, |
| "loss": 31.316009521484375, |
| "step": 1520 |
| }, |
| { |
| "epoch": 0.1390909090909091, |
| "grad_norm": 93312878903296.0, |
| "learning_rate": 9.530801051106448e-07, |
| "loss": 30.861151123046874, |
| "step": 1530 |
| }, |
| { |
| "epoch": 0.14, |
| "grad_norm": 98425945194496.0, |
| "learning_rate": 9.52474308921837e-07, |
| "loss": 31.445208740234374, |
| "step": 1540 |
| }, |
| { |
| "epoch": 0.1409090909090909, |
| "grad_norm": 47585565868032.0, |
| "learning_rate": 9.518648220393142e-07, |
| "loss": 31.213671875, |
| "step": 1550 |
| }, |
| { |
| "epoch": 0.14181818181818182, |
| "grad_norm": 111074724544512.0, |
| "learning_rate": 9.512516494344732e-07, |
| "loss": 30.983367919921875, |
| "step": 1560 |
| }, |
| { |
| "epoch": 0.14272727272727273, |
| "grad_norm": 56672831668224.0, |
| "learning_rate": 9.506347961087743e-07, |
| "loss": 31.3043212890625, |
| "step": 1570 |
| }, |
| { |
| "epoch": 0.14363636363636365, |
| "grad_norm": 40252332834816.0, |
| "learning_rate": 9.500142670937006e-07, |
| "loss": 31.179425048828126, |
| "step": 1580 |
| }, |
| { |
| "epoch": 0.14454545454545453, |
| "grad_norm": 64463541633024.0, |
| "learning_rate": 9.493900674507158e-07, |
| "loss": 31.174810791015624, |
| "step": 1590 |
| }, |
| { |
| "epoch": 0.14545454545454545, |
| "grad_norm": 61891795746816.0, |
| "learning_rate": 9.487622022712247e-07, |
| "loss": 31.512142944335938, |
| "step": 1600 |
| }, |
| { |
| "epoch": 0.14545454545454545, |
| "eval_loss": 31.032541275024414, |
| "eval_runtime": 2.2531, |
| "eval_samples_per_second": 1.775, |
| "eval_steps_per_second": 0.444, |
| "step": 1600 |
| }, |
| { |
| "epoch": 0.14636363636363636, |
| "grad_norm": 29199326773248.0, |
| "learning_rate": 9.481306766765304e-07, |
| "loss": 31.413177490234375, |
| "step": 1610 |
| }, |
| { |
| "epoch": 0.14727272727272728, |
| "grad_norm": 50657696415744.0, |
| "learning_rate": 9.474954958177925e-07, |
| "loss": 31.364990234375, |
| "step": 1620 |
| }, |
| { |
| "epoch": 0.1481818181818182, |
| "grad_norm": 47557384339456.0, |
| "learning_rate": 9.468566648759864e-07, |
| "loss": 31.14423828125, |
| "step": 1630 |
| }, |
| { |
| "epoch": 0.14909090909090908, |
| "grad_norm": 36248345378816.0, |
| "learning_rate": 9.462141890618589e-07, |
| "loss": 31.51732177734375, |
| "step": 1640 |
| }, |
| { |
| "epoch": 0.15, |
| "grad_norm": 140802114191360.0, |
| "learning_rate": 9.455680736158879e-07, |
| "loss": 31.270425415039064, |
| "step": 1650 |
| }, |
| { |
| "epoch": 0.1509090909090909, |
| "grad_norm": 47592100593664.0, |
| "learning_rate": 9.449183238082383e-07, |
| "loss": 30.924615478515626, |
| "step": 1660 |
| }, |
| { |
| "epoch": 0.15181818181818182, |
| "grad_norm": 30858362748928.0, |
| "learning_rate": 9.442649449387193e-07, |
| "loss": 31.3542236328125, |
| "step": 1670 |
| }, |
| { |
| "epoch": 0.15272727272727274, |
| "grad_norm": 60036483121152.0, |
| "learning_rate": 9.436079423367412e-07, |
| "loss": 31.09422607421875, |
| "step": 1680 |
| }, |
| { |
| "epoch": 0.15363636363636363, |
| "grad_norm": 67431661830144.0, |
| "learning_rate": 9.429473213612722e-07, |
| "loss": 31.331436157226562, |
| "step": 1690 |
| }, |
| { |
| "epoch": 0.15454545454545454, |
| "grad_norm": 64809768845312.0, |
| "learning_rate": 9.422830874007943e-07, |
| "loss": 31.278558349609376, |
| "step": 1700 |
| }, |
| { |
| "epoch": 0.15454545454545454, |
| "eval_loss": 31.038570404052734, |
| "eval_runtime": 2.2734, |
| "eval_samples_per_second": 1.76, |
| "eval_steps_per_second": 0.44, |
| "step": 1700 |
| }, |
| { |
| "epoch": 0.15545454545454546, |
| "grad_norm": 49376714031104.0, |
| "learning_rate": 9.416152458732595e-07, |
| "loss": 31.333743286132812, |
| "step": 1710 |
| }, |
| { |
| "epoch": 0.15636363636363637, |
| "grad_norm": 61799214874624.0, |
| "learning_rate": 9.409438022260456e-07, |
| "loss": 31.713766479492186, |
| "step": 1720 |
| }, |
| { |
| "epoch": 0.1572727272727273, |
| "grad_norm": 61596088926208.0, |
| "learning_rate": 9.40268761935912e-07, |
| "loss": 31.544638061523436, |
| "step": 1730 |
| }, |
| { |
| "epoch": 0.15818181818181817, |
| "grad_norm": 76064298631168.0, |
| "learning_rate": 9.395901305089544e-07, |
| "loss": 31.320480346679688, |
| "step": 1740 |
| }, |
| { |
| "epoch": 0.1590909090909091, |
| "grad_norm": 111245189447680.0, |
| "learning_rate": 9.389079134805609e-07, |
| "loss": 31.028314208984376, |
| "step": 1750 |
| }, |
| { |
| "epoch": 0.16, |
| "grad_norm": 138737686151168.0, |
| "learning_rate": 9.382221164153654e-07, |
| "loss": 30.5677490234375, |
| "step": 1760 |
| }, |
| { |
| "epoch": 0.16090909090909092, |
| "grad_norm": 72981451636736.0, |
| "learning_rate": 9.37532744907204e-07, |
| "loss": 31.30030517578125, |
| "step": 1770 |
| }, |
| { |
| "epoch": 0.1618181818181818, |
| "grad_norm": 48867127066624.0, |
| "learning_rate": 9.368398045790678e-07, |
| "loss": 31.112982177734374, |
| "step": 1780 |
| }, |
| { |
| "epoch": 0.16272727272727272, |
| "grad_norm": 69228463915008.0, |
| "learning_rate": 9.361433010830577e-07, |
| "loss": 31.17928466796875, |
| "step": 1790 |
| }, |
| { |
| "epoch": 0.16363636363636364, |
| "grad_norm": 53068834013184.0, |
| "learning_rate": 9.354432401003386e-07, |
| "loss": 31.5040283203125, |
| "step": 1800 |
| }, |
| { |
| "epoch": 0.16363636363636364, |
| "eval_loss": 31.034194946289062, |
| "eval_runtime": 2.2471, |
| "eval_samples_per_second": 1.78, |
| "eval_steps_per_second": 0.445, |
| "step": 1800 |
| }, |
| { |
| "epoch": 0.16454545454545455, |
| "grad_norm": 30403937173504.0, |
| "learning_rate": 9.347396273410924e-07, |
| "loss": 31.249359130859375, |
| "step": 1810 |
| }, |
| { |
| "epoch": 0.16545454545454547, |
| "grad_norm": 75192705482752.0, |
| "learning_rate": 9.34032468544472e-07, |
| "loss": 31.34810791015625, |
| "step": 1820 |
| }, |
| { |
| "epoch": 0.16636363636363635, |
| "grad_norm": 27673988431872.0, |
| "learning_rate": 9.333217694785542e-07, |
| "loss": 31.128109741210938, |
| "step": 1830 |
| }, |
| { |
| "epoch": 0.16727272727272727, |
| "grad_norm": 145739866963968.0, |
| "learning_rate": 9.326075359402924e-07, |
| "loss": 31.515496826171876, |
| "step": 1840 |
| }, |
| { |
| "epoch": 0.16818181818181818, |
| "grad_norm": 36780787105792.0, |
| "learning_rate": 9.318897737554698e-07, |
| "loss": 31.476416015625, |
| "step": 1850 |
| }, |
| { |
| "epoch": 0.1690909090909091, |
| "grad_norm": 111188616675328.0, |
| "learning_rate": 9.31168488778652e-07, |
| "loss": 31.116790771484375, |
| "step": 1860 |
| }, |
| { |
| "epoch": 0.17, |
| "grad_norm": 51388486778880.0, |
| "learning_rate": 9.304436868931382e-07, |
| "loss": 31.242062377929688, |
| "step": 1870 |
| }, |
| { |
| "epoch": 0.1709090909090909, |
| "grad_norm": 76586497867776.0, |
| "learning_rate": 9.297153740109147e-07, |
| "loss": 31.552081298828124, |
| "step": 1880 |
| }, |
| { |
| "epoch": 0.17181818181818181, |
| "grad_norm": 38178404696064.0, |
| "learning_rate": 9.289835560726052e-07, |
| "loss": 31.006793212890624, |
| "step": 1890 |
| }, |
| { |
| "epoch": 0.17272727272727273, |
| "grad_norm": 32226674737152.0, |
| "learning_rate": 9.28248239047424e-07, |
| "loss": 31.428573608398438, |
| "step": 1900 |
| }, |
| { |
| "epoch": 0.17272727272727273, |
| "eval_loss": 31.032257080078125, |
| "eval_runtime": 2.2569, |
| "eval_samples_per_second": 1.772, |
| "eval_steps_per_second": 0.443, |
| "step": 1900 |
| }, |
| { |
| "epoch": 0.17363636363636364, |
| "grad_norm": 257651480985600.0, |
| "learning_rate": 9.275094289331253e-07, |
| "loss": 31.105364990234374, |
| "step": 1910 |
| }, |
| { |
| "epoch": 0.17454545454545456, |
| "grad_norm": 65725515431936.0, |
| "learning_rate": 9.267671317559562e-07, |
| "loss": 31.4971923828125, |
| "step": 1920 |
| }, |
| { |
| "epoch": 0.17545454545454545, |
| "grad_norm": 209329206591488.0, |
| "learning_rate": 9.260213535706062e-07, |
| "loss": 31.248983764648436, |
| "step": 1930 |
| }, |
| { |
| "epoch": 0.17636363636363636, |
| "grad_norm": 69413545967616.0, |
| "learning_rate": 9.252721004601587e-07, |
| "loss": 31.496029663085938, |
| "step": 1940 |
| }, |
| { |
| "epoch": 0.17727272727272728, |
| "grad_norm": 85867242717184.0, |
| "learning_rate": 9.245193785360406e-07, |
| "loss": 31.328424072265626, |
| "step": 1950 |
| }, |
| { |
| "epoch": 0.1781818181818182, |
| "grad_norm": 167211398332416.0, |
| "learning_rate": 9.23763193937973e-07, |
| "loss": 31.482049560546876, |
| "step": 1960 |
| }, |
| { |
| "epoch": 0.17909090909090908, |
| "grad_norm": 36981182562304.0, |
| "learning_rate": 9.23003552833921e-07, |
| "loss": 30.472119140625, |
| "step": 1970 |
| }, |
| { |
| "epoch": 0.18, |
| "grad_norm": 123917532397568.0, |
| "learning_rate": 9.222404614200436e-07, |
| "loss": 31.717819213867188, |
| "step": 1980 |
| }, |
| { |
| "epoch": 0.1809090909090909, |
| "grad_norm": 88264178401280.0, |
| "learning_rate": 9.214739259206423e-07, |
| "loss": 31.45789794921875, |
| "step": 1990 |
| }, |
| { |
| "epoch": 0.18181818181818182, |
| "grad_norm": 65296064839680.0, |
| "learning_rate": 9.207039525881117e-07, |
| "loss": 31.12996826171875, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.18181818181818182, |
| "eval_loss": 31.029281616210938, |
| "eval_runtime": 2.2535, |
| "eval_samples_per_second": 1.775, |
| "eval_steps_per_second": 0.444, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.18272727272727274, |
| "grad_norm": 71538795610112.0, |
| "learning_rate": 9.199305477028869e-07, |
| "loss": 31.124655151367186, |
| "step": 2010 |
| }, |
| { |
| "epoch": 0.18363636363636363, |
| "grad_norm": 117176044355584.0, |
| "learning_rate": 9.19153717573394e-07, |
| "loss": 31.152999877929688, |
| "step": 2020 |
| }, |
| { |
| "epoch": 0.18454545454545454, |
| "grad_norm": 88894632624128.0, |
| "learning_rate": 9.183734685359972e-07, |
| "loss": 31.35181884765625, |
| "step": 2030 |
| }, |
| { |
| "epoch": 0.18545454545454546, |
| "grad_norm": 56644360732672.0, |
| "learning_rate": 9.175898069549476e-07, |
| "loss": 31.333255004882812, |
| "step": 2040 |
| }, |
| { |
| "epoch": 0.18636363636363637, |
| "grad_norm": 104232355102720.0, |
| "learning_rate": 9.168027392223319e-07, |
| "loss": 31.229754638671874, |
| "step": 2050 |
| }, |
| { |
| "epoch": 0.18727272727272729, |
| "grad_norm": 93866015326208.0, |
| "learning_rate": 9.160122717580194e-07, |
| "loss": 31.03287353515625, |
| "step": 2060 |
| }, |
| { |
| "epoch": 0.18818181818181817, |
| "grad_norm": 45236478803968.0, |
| "learning_rate": 9.152184110096097e-07, |
| "loss": 31.709677124023436, |
| "step": 2070 |
| }, |
| { |
| "epoch": 0.1890909090909091, |
| "grad_norm": 46076950216704.0, |
| "learning_rate": 9.144211634523808e-07, |
| "loss": 31.2308837890625, |
| "step": 2080 |
| }, |
| { |
| "epoch": 0.19, |
| "grad_norm": 72614668140544.0, |
| "learning_rate": 9.13620535589236e-07, |
| "loss": 31.108331298828126, |
| "step": 2090 |
| }, |
| { |
| "epoch": 0.19090909090909092, |
| "grad_norm": 42438555074560.0, |
| "learning_rate": 9.128165339506502e-07, |
| "loss": 31.92352294921875, |
| "step": 2100 |
| }, |
| { |
| "epoch": 0.19090909090909092, |
| "eval_loss": 31.03235626220703, |
| "eval_runtime": 2.2586, |
| "eval_samples_per_second": 1.771, |
| "eval_steps_per_second": 0.443, |
| "step": 2100 |
| }, |
| { |
| "epoch": 0.1918181818181818, |
| "grad_norm": 63270400557056.0, |
| "learning_rate": 9.120091650946171e-07, |
| "loss": 31.78459777832031, |
| "step": 2110 |
| }, |
| { |
| "epoch": 0.19272727272727272, |
| "grad_norm": 79119404498944.0, |
| "learning_rate": 9.111984356065966e-07, |
| "loss": 31.268167114257814, |
| "step": 2120 |
| }, |
| { |
| "epoch": 0.19363636363636363, |
| "grad_norm": 29490430345216.0, |
| "learning_rate": 9.103843520994592e-07, |
| "loss": 31.48218994140625, |
| "step": 2130 |
| }, |
| { |
| "epoch": 0.19454545454545455, |
| "grad_norm": 34231048732672.0, |
| "learning_rate": 9.095669212134339e-07, |
| "loss": 30.843756103515624, |
| "step": 2140 |
| }, |
| { |
| "epoch": 0.19545454545454546, |
| "grad_norm": 78581879275520.0, |
| "learning_rate": 9.087461496160528e-07, |
| "loss": 30.995782470703126, |
| "step": 2150 |
| }, |
| { |
| "epoch": 0.19636363636363635, |
| "grad_norm": 44611347152896.0, |
| "learning_rate": 9.079220440020972e-07, |
| "loss": 31.502972412109376, |
| "step": 2160 |
| }, |
| { |
| "epoch": 0.19727272727272727, |
| "grad_norm": 37552992026624.0, |
| "learning_rate": 9.070946110935431e-07, |
| "loss": 31.0704833984375, |
| "step": 2170 |
| }, |
| { |
| "epoch": 0.19818181818181818, |
| "grad_norm": 47458872721408.0, |
| "learning_rate": 9.062638576395061e-07, |
| "loss": 31.406292724609376, |
| "step": 2180 |
| }, |
| { |
| "epoch": 0.1990909090909091, |
| "grad_norm": 92816332029952.0, |
| "learning_rate": 9.054297904161867e-07, |
| "loss": 31.4571044921875, |
| "step": 2190 |
| }, |
| { |
| "epoch": 0.2, |
| "grad_norm": 29963092754432.0, |
| "learning_rate": 9.045924162268144e-07, |
| "loss": 31.258853149414062, |
| "step": 2200 |
| }, |
| { |
| "epoch": 0.2, |
| "eval_loss": 31.03536605834961, |
| "eval_runtime": 2.2498, |
| "eval_samples_per_second": 1.778, |
| "eval_steps_per_second": 0.444, |
| "step": 2200 |
| }, |
| { |
| "epoch": 0.2009090909090909, |
| "grad_norm": 259804182347776.0, |
| "learning_rate": 9.037517419015928e-07, |
| "loss": 31.453973388671876, |
| "step": 2210 |
| }, |
| { |
| "epoch": 0.2018181818181818, |
| "grad_norm": 98955845173248.0, |
| "learning_rate": 9.029077742976437e-07, |
| "loss": 30.824130249023437, |
| "step": 2220 |
| }, |
| { |
| "epoch": 0.20272727272727273, |
| "grad_norm": 35170289713152.0, |
| "learning_rate": 9.020605202989513e-07, |
| "loss": 31.691207885742188, |
| "step": 2230 |
| }, |
| { |
| "epoch": 0.20363636363636364, |
| "grad_norm": 25527377199104.0, |
| "learning_rate": 9.012099868163056e-07, |
| "loss": 31.00306091308594, |
| "step": 2240 |
| }, |
| { |
| "epoch": 0.20454545454545456, |
| "grad_norm": 136539543699456.0, |
| "learning_rate": 9.003561807872469e-07, |
| "loss": 31.796575927734374, |
| "step": 2250 |
| }, |
| { |
| "epoch": 0.20545454545454545, |
| "grad_norm": 46742410100736.0, |
| "learning_rate": 8.994991091760076e-07, |
| "loss": 31.3921142578125, |
| "step": 2260 |
| }, |
| { |
| "epoch": 0.20636363636363636, |
| "grad_norm": 30860340363264.0, |
| "learning_rate": 8.986387789734576e-07, |
| "loss": 31.278704833984374, |
| "step": 2270 |
| }, |
| { |
| "epoch": 0.20727272727272728, |
| "grad_norm": 31539043762176.0, |
| "learning_rate": 8.977751971970456e-07, |
| "loss": 30.982208251953125, |
| "step": 2280 |
| }, |
| { |
| "epoch": 0.2081818181818182, |
| "grad_norm": 134957301235712.0, |
| "learning_rate": 8.969083708907424e-07, |
| "loss": 31.08028564453125, |
| "step": 2290 |
| }, |
| { |
| "epoch": 0.20909090909090908, |
| "grad_norm": 86353354162176.0, |
| "learning_rate": 8.960383071249835e-07, |
| "loss": 31.018426513671876, |
| "step": 2300 |
| }, |
| { |
| "epoch": 0.20909090909090908, |
| "eval_loss": 31.035140991210938, |
| "eval_runtime": 2.2639, |
| "eval_samples_per_second": 1.767, |
| "eval_steps_per_second": 0.442, |
| "step": 2300 |
| }, |
| { |
| "epoch": 0.21, |
| "grad_norm": 155203122757632.0, |
| "learning_rate": 8.951650129966112e-07, |
| "loss": 31.086285400390626, |
| "step": 2310 |
| }, |
| { |
| "epoch": 0.2109090909090909, |
| "grad_norm": 109969449943040.0, |
| "learning_rate": 8.942884956288171e-07, |
| "loss": 30.969015502929686, |
| "step": 2320 |
| }, |
| { |
| "epoch": 0.21181818181818182, |
| "grad_norm": 101191014940672.0, |
| "learning_rate": 8.934087621710835e-07, |
| "loss": 30.67431640625, |
| "step": 2330 |
| }, |
| { |
| "epoch": 0.21272727272727274, |
| "grad_norm": 146619093745664.0, |
| "learning_rate": 8.925258197991258e-07, |
| "loss": 31.378811645507813, |
| "step": 2340 |
| }, |
| { |
| "epoch": 0.21363636363636362, |
| "grad_norm": 91310996324352.0, |
| "learning_rate": 8.91639675714833e-07, |
| "loss": 31.404779052734376, |
| "step": 2350 |
| }, |
| { |
| "epoch": 0.21454545454545454, |
| "grad_norm": 62529711636480.0, |
| "learning_rate": 8.907503371462099e-07, |
| "loss": 30.654598999023438, |
| "step": 2360 |
| }, |
| { |
| "epoch": 0.21545454545454545, |
| "grad_norm": 70472276377600.0, |
| "learning_rate": 8.898578113473176e-07, |
| "loss": 31.602188110351562, |
| "step": 2370 |
| }, |
| { |
| "epoch": 0.21636363636363637, |
| "grad_norm": 158925886324736.0, |
| "learning_rate": 8.889621055982144e-07, |
| "loss": 31.739437866210938, |
| "step": 2380 |
| }, |
| { |
| "epoch": 0.21727272727272728, |
| "grad_norm": 70523740487680.0, |
| "learning_rate": 8.880632272048962e-07, |
| "loss": 31.94945373535156, |
| "step": 2390 |
| }, |
| { |
| "epoch": 0.21818181818181817, |
| "grad_norm": 60489816080384.0, |
| "learning_rate": 8.871611834992379e-07, |
| "loss": 31.090286254882812, |
| "step": 2400 |
| }, |
| { |
| "epoch": 0.21818181818181817, |
| "eval_loss": 31.047500610351562, |
| "eval_runtime": 2.2365, |
| "eval_samples_per_second": 1.788, |
| "eval_steps_per_second": 0.447, |
| "step": 2400 |
| }, |
| { |
| "epoch": 0.2190909090909091, |
| "grad_norm": 146665382084608.0, |
| "learning_rate": 8.862559818389321e-07, |
| "loss": 31.17398681640625, |
| "step": 2410 |
| }, |
| { |
| "epoch": 0.22, |
| "grad_norm": 56466086035456.0, |
| "learning_rate": 8.853476296074305e-07, |
| "loss": 31.538543701171875, |
| "step": 2420 |
| }, |
| { |
| "epoch": 0.22090909090909092, |
| "grad_norm": 205152065683456.0, |
| "learning_rate": 8.844361342138827e-07, |
| "loss": 31.731301879882814, |
| "step": 2430 |
| }, |
| { |
| "epoch": 0.22181818181818183, |
| "grad_norm": 65588269416448.0, |
| "learning_rate": 8.835215030930761e-07, |
| "loss": 30.90111083984375, |
| "step": 2440 |
| }, |
| { |
| "epoch": 0.22272727272727272, |
| "grad_norm": 34737408180224.0, |
| "learning_rate": 8.82603743705375e-07, |
| "loss": 31.98955078125, |
| "step": 2450 |
| }, |
| { |
| "epoch": 0.22363636363636363, |
| "grad_norm": 154878517182464.0, |
| "learning_rate": 8.81682863536661e-07, |
| "loss": 31.334310913085936, |
| "step": 2460 |
| }, |
| { |
| "epoch": 0.22454545454545455, |
| "grad_norm": 166664142323712.0, |
| "learning_rate": 8.807588700982699e-07, |
| "loss": 31.236883544921874, |
| "step": 2470 |
| }, |
| { |
| "epoch": 0.22545454545454546, |
| "grad_norm": 145991323877376.0, |
| "learning_rate": 8.798317709269318e-07, |
| "loss": 31.298379516601564, |
| "step": 2480 |
| }, |
| { |
| "epoch": 0.22636363636363635, |
| "grad_norm": 70725335515136.0, |
| "learning_rate": 8.789015735847098e-07, |
| "loss": 31.637060546875, |
| "step": 2490 |
| }, |
| { |
| "epoch": 0.22727272727272727, |
| "grad_norm": 164278623535104.0, |
| "learning_rate": 8.779682856589367e-07, |
| "loss": 31.241668701171875, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.22727272727272727, |
| "eval_loss": 31.05630111694336, |
| "eval_runtime": 2.28, |
| "eval_samples_per_second": 1.754, |
| "eval_steps_per_second": 0.439, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.22818181818181818, |
| "grad_norm": 65195573510144.0, |
| "learning_rate": 8.770319147621557e-07, |
| "loss": 31.208535766601564, |
| "step": 2510 |
| }, |
| { |
| "epoch": 0.2290909090909091, |
| "grad_norm": 38720564625408.0, |
| "learning_rate": 8.760924685320557e-07, |
| "loss": 31.412356567382812, |
| "step": 2520 |
| }, |
| { |
| "epoch": 0.23, |
| "grad_norm": 20436991606784.0, |
| "learning_rate": 8.751499546314105e-07, |
| "loss": 31.454071044921875, |
| "step": 2530 |
| }, |
| { |
| "epoch": 0.2309090909090909, |
| "grad_norm": 135642474348544.0, |
| "learning_rate": 8.742043807480162e-07, |
| "loss": 31.459384155273437, |
| "step": 2540 |
| }, |
| { |
| "epoch": 0.2318181818181818, |
| "grad_norm": 44671283757056.0, |
| "learning_rate": 8.732557545946278e-07, |
| "loss": 31.1458251953125, |
| "step": 2550 |
| }, |
| { |
| "epoch": 0.23272727272727273, |
| "grad_norm": 86082586673152.0, |
| "learning_rate": 8.723040839088969e-07, |
| "loss": 30.845843505859374, |
| "step": 2560 |
| }, |
| { |
| "epoch": 0.23363636363636364, |
| "grad_norm": 158711691608064.0, |
| "learning_rate": 8.713493764533088e-07, |
| "loss": 31.084823608398438, |
| "step": 2570 |
| }, |
| { |
| "epoch": 0.23454545454545456, |
| "grad_norm": 57405924704256.0, |
| "learning_rate": 8.703916400151183e-07, |
| "loss": 30.91130676269531, |
| "step": 2580 |
| }, |
| { |
| "epoch": 0.23545454545454544, |
| "grad_norm": 82000975233024.0, |
| "learning_rate": 8.694308824062867e-07, |
| "loss": 31.061813354492188, |
| "step": 2590 |
| }, |
| { |
| "epoch": 0.23636363636363636, |
| "grad_norm": 79047270858752.0, |
| "learning_rate": 8.684671114634183e-07, |
| "loss": 31.08419189453125, |
| "step": 2600 |
| }, |
| { |
| "epoch": 0.23636363636363636, |
| "eval_loss": 31.05272102355957, |
| "eval_runtime": 2.2261, |
| "eval_samples_per_second": 1.797, |
| "eval_steps_per_second": 0.449, |
| "step": 2600 |
| }, |
| { |
| "epoch": 0.23727272727272727, |
| "grad_norm": 49400906776576.0, |
| "learning_rate": 8.675003350476961e-07, |
| "loss": 30.686038208007812, |
| "step": 2610 |
| }, |
| { |
| "epoch": 0.2381818181818182, |
| "grad_norm": 94167459954688.0, |
| "learning_rate": 8.66530561044818e-07, |
| "loss": 31.08385314941406, |
| "step": 2620 |
| }, |
| { |
| "epoch": 0.2390909090909091, |
| "grad_norm": 40438371188736.0, |
| "learning_rate": 8.655577973649321e-07, |
| "loss": 31.391049194335938, |
| "step": 2630 |
| }, |
| { |
| "epoch": 0.24, |
| "grad_norm": 67886441824256.0, |
| "learning_rate": 8.645820519425722e-07, |
| "loss": 30.860980224609374, |
| "step": 2640 |
| }, |
| { |
| "epoch": 0.2409090909090909, |
| "grad_norm": 156507970732032.0, |
| "learning_rate": 8.636033327365937e-07, |
| "loss": 31.027520751953126, |
| "step": 2650 |
| }, |
| { |
| "epoch": 0.24181818181818182, |
| "grad_norm": 33284687921152.0, |
| "learning_rate": 8.626216477301081e-07, |
| "loss": 31.069308471679687, |
| "step": 2660 |
| }, |
| { |
| "epoch": 0.24272727272727274, |
| "grad_norm": 202165503131648.0, |
| "learning_rate": 8.616370049304175e-07, |
| "loss": 31.114059448242188, |
| "step": 2670 |
| }, |
| { |
| "epoch": 0.24363636363636362, |
| "grad_norm": 32541889265664.0, |
| "learning_rate": 8.606494123689508e-07, |
| "loss": 30.974282836914064, |
| "step": 2680 |
| }, |
| { |
| "epoch": 0.24454545454545454, |
| "grad_norm": 133315969417216.0, |
| "learning_rate": 8.596588781011963e-07, |
| "loss": 31.376223754882812, |
| "step": 2690 |
| }, |
| { |
| "epoch": 0.24545454545454545, |
| "grad_norm": 120080675373056.0, |
| "learning_rate": 8.586654102066374e-07, |
| "loss": 31.123995971679687, |
| "step": 2700 |
| }, |
| { |
| "epoch": 0.24545454545454545, |
| "eval_loss": 31.06121826171875, |
| "eval_runtime": 2.263, |
| "eval_samples_per_second": 1.768, |
| "eval_steps_per_second": 0.442, |
| "step": 2700 |
| }, |
| { |
| "epoch": 0.24636363636363637, |
| "grad_norm": 203449278922752.0, |
| "learning_rate": 8.576690167886859e-07, |
| "loss": 31.33082275390625, |
| "step": 2710 |
| }, |
| { |
| "epoch": 0.24727272727272728, |
| "grad_norm": 63677252239360.0, |
| "learning_rate": 8.566697059746166e-07, |
| "loss": 31.389141845703126, |
| "step": 2720 |
| }, |
| { |
| "epoch": 0.24818181818181817, |
| "grad_norm": 112063229722624.0, |
| "learning_rate": 8.556674859155e-07, |
| "loss": 31.25843200683594, |
| "step": 2730 |
| }, |
| { |
| "epoch": 0.24909090909090909, |
| "grad_norm": 153532078489600.0, |
| "learning_rate": 8.546623647861369e-07, |
| "loss": 31.412567138671875, |
| "step": 2740 |
| }, |
| { |
| "epoch": 0.25, |
| "grad_norm": 196838988709888.0, |
| "learning_rate": 8.536543507849911e-07, |
| "loss": 31.105191040039063, |
| "step": 2750 |
| }, |
| { |
| "epoch": 0.2509090909090909, |
| "grad_norm": 92189401022464.0, |
| "learning_rate": 8.526434521341226e-07, |
| "loss": 30.956512451171875, |
| "step": 2760 |
| }, |
| { |
| "epoch": 0.25181818181818183, |
| "grad_norm": 127660478955520.0, |
| "learning_rate": 8.516296770791207e-07, |
| "loss": 31.13167724609375, |
| "step": 2770 |
| }, |
| { |
| "epoch": 0.25272727272727274, |
| "grad_norm": 103122206720000.0, |
| "learning_rate": 8.506130338890365e-07, |
| "loss": 31.019964599609374, |
| "step": 2780 |
| }, |
| { |
| "epoch": 0.25363636363636366, |
| "grad_norm": 238406386843648.0, |
| "learning_rate": 8.495935308563158e-07, |
| "loss": 31.423956298828124, |
| "step": 2790 |
| }, |
| { |
| "epoch": 0.2545454545454545, |
| "grad_norm": 134973164093440.0, |
| "learning_rate": 8.485711762967312e-07, |
| "loss": 30.945632934570312, |
| "step": 2800 |
| }, |
| { |
| "epoch": 0.2545454545454545, |
| "eval_loss": 31.074186325073242, |
| "eval_runtime": 2.2625, |
| "eval_samples_per_second": 1.768, |
| "eval_steps_per_second": 0.442, |
| "step": 2800 |
| }, |
| { |
| "epoch": 0.25545454545454543, |
| "grad_norm": 50747676819456.0, |
| "learning_rate": 8.47545978549314e-07, |
| "loss": 31.677044677734376, |
| "step": 2810 |
| }, |
| { |
| "epoch": 0.25636363636363635, |
| "grad_norm": 138435553656832.0, |
| "learning_rate": 8.46517945976287e-07, |
| "loss": 31.338131713867188, |
| "step": 2820 |
| }, |
| { |
| "epoch": 0.25727272727272726, |
| "grad_norm": 152003741220864.0, |
| "learning_rate": 8.454870869629955e-07, |
| "loss": 30.898031616210936, |
| "step": 2830 |
| }, |
| { |
| "epoch": 0.2581818181818182, |
| "grad_norm": 159471129067520.0, |
| "learning_rate": 8.444534099178393e-07, |
| "loss": 30.950164794921875, |
| "step": 2840 |
| }, |
| { |
| "epoch": 0.2590909090909091, |
| "grad_norm": 141189164564480.0, |
| "learning_rate": 8.434169232722041e-07, |
| "loss": 31.282101440429688, |
| "step": 2850 |
| }, |
| { |
| "epoch": 0.26, |
| "grad_norm": 130600384069632.0, |
| "learning_rate": 8.423776354803925e-07, |
| "loss": 31.540997314453126, |
| "step": 2860 |
| }, |
| { |
| "epoch": 0.2609090909090909, |
| "grad_norm": 199170954625024.0, |
| "learning_rate": 8.41335555019555e-07, |
| "loss": 31.349322509765624, |
| "step": 2870 |
| }, |
| { |
| "epoch": 0.26181818181818184, |
| "grad_norm": 208188993437696.0, |
| "learning_rate": 8.402906903896216e-07, |
| "loss": 30.875155639648437, |
| "step": 2880 |
| }, |
| { |
| "epoch": 0.26272727272727275, |
| "grad_norm": 125149995073536.0, |
| "learning_rate": 8.392430501132316e-07, |
| "loss": 31.10132751464844, |
| "step": 2890 |
| }, |
| { |
| "epoch": 0.2636363636363636, |
| "grad_norm": 47845277171712.0, |
| "learning_rate": 8.381926427356642e-07, |
| "loss": 31.629965209960936, |
| "step": 2900 |
| }, |
| { |
| "epoch": 0.2636363636363636, |
| "eval_loss": 31.083770751953125, |
| "eval_runtime": 2.258, |
| "eval_samples_per_second": 1.771, |
| "eval_steps_per_second": 0.443, |
| "step": 2900 |
| }, |
| { |
| "epoch": 0.26454545454545453, |
| "grad_norm": 114591514230784.0, |
| "learning_rate": 8.37139476824769e-07, |
| "loss": 30.9484130859375, |
| "step": 2910 |
| }, |
| { |
| "epoch": 0.26545454545454544, |
| "grad_norm": 76647743094784.0, |
| "learning_rate": 8.360835609708967e-07, |
| "loss": 31.01370849609375, |
| "step": 2920 |
| }, |
| { |
| "epoch": 0.26636363636363636, |
| "grad_norm": 190012658286592.0, |
| "learning_rate": 8.35024903786828e-07, |
| "loss": 31.296466064453124, |
| "step": 2930 |
| }, |
| { |
| "epoch": 0.2672727272727273, |
| "grad_norm": 152463738929152.0, |
| "learning_rate": 8.339635139077035e-07, |
| "loss": 31.273577880859374, |
| "step": 2940 |
| }, |
| { |
| "epoch": 0.2681818181818182, |
| "grad_norm": 216430482030592.0, |
| "learning_rate": 8.32899399990954e-07, |
| "loss": 31.327499389648438, |
| "step": 2950 |
| }, |
| { |
| "epoch": 0.2690909090909091, |
| "grad_norm": 48228892409856.0, |
| "learning_rate": 8.318325707162293e-07, |
| "loss": 31.284075927734374, |
| "step": 2960 |
| }, |
| { |
| "epoch": 0.27, |
| "grad_norm": 109718655729664.0, |
| "learning_rate": 8.307630347853273e-07, |
| "loss": 31.343002319335938, |
| "step": 2970 |
| }, |
| { |
| "epoch": 0.27090909090909093, |
| "grad_norm": 102808120459264.0, |
| "learning_rate": 8.296908009221242e-07, |
| "loss": 31.049209594726562, |
| "step": 2980 |
| }, |
| { |
| "epoch": 0.2718181818181818, |
| "grad_norm": 69456642441216.0, |
| "learning_rate": 8.286158778725011e-07, |
| "loss": 31.43966064453125, |
| "step": 2990 |
| }, |
| { |
| "epoch": 0.2727272727272727, |
| "grad_norm": 92835936206848.0, |
| "learning_rate": 8.275382744042747e-07, |
| "loss": 30.909332275390625, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.2727272727272727, |
| "eval_loss": 31.07646369934082, |
| "eval_runtime": 2.242, |
| "eval_samples_per_second": 1.784, |
| "eval_steps_per_second": 0.446, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.2736363636363636, |
| "grad_norm": 44478215749632.0, |
| "learning_rate": 8.26457999307125e-07, |
| "loss": 30.9502685546875, |
| "step": 3010 |
| }, |
| { |
| "epoch": 0.27454545454545454, |
| "grad_norm": 75005027155968.0, |
| "learning_rate": 8.253750613925234e-07, |
| "loss": 31.542059326171874, |
| "step": 3020 |
| }, |
| { |
| "epoch": 0.27545454545454545, |
| "grad_norm": 47266672934912.0, |
| "learning_rate": 8.242894694936614e-07, |
| "loss": 30.897921752929687, |
| "step": 3030 |
| }, |
| { |
| "epoch": 0.27636363636363637, |
| "grad_norm": 45886398791680.0, |
| "learning_rate": 8.23201232465378e-07, |
| "loss": 31.505227661132814, |
| "step": 3040 |
| }, |
| { |
| "epoch": 0.2772727272727273, |
| "grad_norm": 127583672860672.0, |
| "learning_rate": 8.221103591840881e-07, |
| "loss": 31.139892578125, |
| "step": 3050 |
| }, |
| { |
| "epoch": 0.2781818181818182, |
| "grad_norm": 174062391263232.0, |
| "learning_rate": 8.210168585477091e-07, |
| "loss": 31.437637329101562, |
| "step": 3060 |
| }, |
| { |
| "epoch": 0.2790909090909091, |
| "grad_norm": 210010848100352.0, |
| "learning_rate": 8.199207394755891e-07, |
| "loss": 30.945309448242188, |
| "step": 3070 |
| }, |
| { |
| "epoch": 0.28, |
| "grad_norm": 141527191912448.0, |
| "learning_rate": 8.188220109084346e-07, |
| "loss": 31.963729858398438, |
| "step": 3080 |
| }, |
| { |
| "epoch": 0.2809090909090909, |
| "grad_norm": 269273947701248.0, |
| "learning_rate": 8.17720681808236e-07, |
| "loss": 31.625100708007814, |
| "step": 3090 |
| }, |
| { |
| "epoch": 0.2818181818181818, |
| "grad_norm": 90777153699840.0, |
| "learning_rate": 8.16616761158196e-07, |
| "loss": 31.37896728515625, |
| "step": 3100 |
| }, |
| { |
| "epoch": 0.2818181818181818, |
| "eval_loss": 31.08748435974121, |
| "eval_runtime": 2.2472, |
| "eval_samples_per_second": 1.78, |
| "eval_steps_per_second": 0.445, |
| "step": 3100 |
| }, |
| { |
| "epoch": 0.2827272727272727, |
| "grad_norm": 85872594649088.0, |
| "learning_rate": 8.155102579626558e-07, |
| "loss": 31.415878295898438, |
| "step": 3110 |
| }, |
| { |
| "epoch": 0.28363636363636363, |
| "grad_norm": 128033721679872.0, |
| "learning_rate": 8.144011812470215e-07, |
| "loss": 31.359136962890624, |
| "step": 3120 |
| }, |
| { |
| "epoch": 0.28454545454545455, |
| "grad_norm": 58961826938880.0, |
| "learning_rate": 8.132895400576904e-07, |
| "loss": 31.53883056640625, |
| "step": 3130 |
| }, |
| { |
| "epoch": 0.28545454545454546, |
| "grad_norm": 130452350304256.0, |
| "learning_rate": 8.121753434619778e-07, |
| "loss": 31.31527099609375, |
| "step": 3140 |
| }, |
| { |
| "epoch": 0.2863636363636364, |
| "grad_norm": 39132558524416.0, |
| "learning_rate": 8.110586005480426e-07, |
| "loss": 30.843875122070312, |
| "step": 3150 |
| }, |
| { |
| "epoch": 0.2872727272727273, |
| "grad_norm": 162498661580800.0, |
| "learning_rate": 8.09939320424813e-07, |
| "loss": 30.928125, |
| "step": 3160 |
| }, |
| { |
| "epoch": 0.2881818181818182, |
| "grad_norm": 30503648362496.0, |
| "learning_rate": 8.088175122219127e-07, |
| "loss": 31.2546142578125, |
| "step": 3170 |
| }, |
| { |
| "epoch": 0.28909090909090907, |
| "grad_norm": 264652227346432.0, |
| "learning_rate": 8.076931850895858e-07, |
| "loss": 31.682107543945314, |
| "step": 3180 |
| }, |
| { |
| "epoch": 0.29, |
| "grad_norm": 43181974487040.0, |
| "learning_rate": 8.065663481986229e-07, |
| "loss": 31.056671142578125, |
| "step": 3190 |
| }, |
| { |
| "epoch": 0.2909090909090909, |
| "grad_norm": 81322110353408.0, |
| "learning_rate": 8.054370107402858e-07, |
| "loss": 31.157467651367188, |
| "step": 3200 |
| }, |
| { |
| "epoch": 0.2909090909090909, |
| "eval_loss": 31.095945358276367, |
| "eval_runtime": 2.2422, |
| "eval_samples_per_second": 1.784, |
| "eval_steps_per_second": 0.446, |
| "step": 3200 |
| }, |
| { |
| "epoch": 0.2918181818181818, |
| "grad_norm": 82796911525888.0, |
| "learning_rate": 8.043051819262327e-07, |
| "loss": 31.241659545898436, |
| "step": 3210 |
| }, |
| { |
| "epoch": 0.2927272727272727, |
| "grad_norm": 66819532521472.0, |
| "learning_rate": 8.031708709884429e-07, |
| "loss": 31.24657287597656, |
| "step": 3220 |
| }, |
| { |
| "epoch": 0.29363636363636364, |
| "grad_norm": 151652912857088.0, |
| "learning_rate": 8.020340871791417e-07, |
| "loss": 31.857916259765624, |
| "step": 3230 |
| }, |
| { |
| "epoch": 0.29454545454545455, |
| "grad_norm": 33395514015744.0, |
| "learning_rate": 8.008948397707252e-07, |
| "loss": 31.493441772460937, |
| "step": 3240 |
| }, |
| { |
| "epoch": 0.29545454545454547, |
| "grad_norm": 186848542457856.0, |
| "learning_rate": 7.997531380556833e-07, |
| "loss": 31.500466918945314, |
| "step": 3250 |
| }, |
| { |
| "epoch": 0.2963636363636364, |
| "grad_norm": 87677269442560.0, |
| "learning_rate": 7.986089913465261e-07, |
| "loss": 30.997119140625, |
| "step": 3260 |
| }, |
| { |
| "epoch": 0.2972727272727273, |
| "grad_norm": 73329570480128.0, |
| "learning_rate": 7.974624089757064e-07, |
| "loss": 31.911077880859374, |
| "step": 3270 |
| }, |
| { |
| "epoch": 0.29818181818181816, |
| "grad_norm": 134268890120192.0, |
| "learning_rate": 7.963134002955431e-07, |
| "loss": 31.09755859375, |
| "step": 3280 |
| }, |
| { |
| "epoch": 0.2990909090909091, |
| "grad_norm": 57569158627328.0, |
| "learning_rate": 7.951619746781472e-07, |
| "loss": 31.29901123046875, |
| "step": 3290 |
| }, |
| { |
| "epoch": 0.3, |
| "grad_norm": 58610235211776.0, |
| "learning_rate": 7.940081415153428e-07, |
| "loss": 31.30848388671875, |
| "step": 3300 |
| }, |
| { |
| "epoch": 0.3, |
| "eval_loss": 31.100173950195312, |
| "eval_runtime": 2.2403, |
| "eval_samples_per_second": 1.785, |
| "eval_steps_per_second": 0.446, |
| "step": 3300 |
| }, |
| { |
| "epoch": 0.3009090909090909, |
| "grad_norm": 386970849116160.0, |
| "learning_rate": 7.928519102185922e-07, |
| "loss": 31.135516357421874, |
| "step": 3310 |
| }, |
| { |
| "epoch": 0.3018181818181818, |
| "grad_norm": 288033458880512.0, |
| "learning_rate": 7.91693290218918e-07, |
| "loss": 31.321795654296874, |
| "step": 3320 |
| }, |
| { |
| "epoch": 0.30272727272727273, |
| "grad_norm": 83541618589696.0, |
| "learning_rate": 7.905322909668272e-07, |
| "loss": 30.953836059570314, |
| "step": 3330 |
| }, |
| { |
| "epoch": 0.30363636363636365, |
| "grad_norm": 77461295464448.0, |
| "learning_rate": 7.893689219322336e-07, |
| "loss": 31.53773193359375, |
| "step": 3340 |
| }, |
| { |
| "epoch": 0.30454545454545456, |
| "grad_norm": 75457584168960.0, |
| "learning_rate": 7.882031926043803e-07, |
| "loss": 31.441778564453124, |
| "step": 3350 |
| }, |
| { |
| "epoch": 0.3054545454545455, |
| "grad_norm": 52945127211008.0, |
| "learning_rate": 7.870351124917629e-07, |
| "loss": 31.60285339355469, |
| "step": 3360 |
| }, |
| { |
| "epoch": 0.30636363636363634, |
| "grad_norm": 81810528665600.0, |
| "learning_rate": 7.858646911220512e-07, |
| "loss": 31.419757080078124, |
| "step": 3370 |
| }, |
| { |
| "epoch": 0.30727272727272725, |
| "grad_norm": 103102694817792.0, |
| "learning_rate": 7.846919380420125e-07, |
| "loss": 31.411013793945312, |
| "step": 3380 |
| }, |
| { |
| "epoch": 0.30818181818181817, |
| "grad_norm": 181314292547584.0, |
| "learning_rate": 7.835168628174325e-07, |
| "loss": 30.9938232421875, |
| "step": 3390 |
| }, |
| { |
| "epoch": 0.3090909090909091, |
| "grad_norm": 64268049317888.0, |
| "learning_rate": 7.823394750330386e-07, |
| "loss": 31.72479248046875, |
| "step": 3400 |
| }, |
| { |
| "epoch": 0.3090909090909091, |
| "eval_loss": 31.11138153076172, |
| "eval_runtime": 2.2524, |
| "eval_samples_per_second": 1.776, |
| "eval_steps_per_second": 0.444, |
| "step": 3400 |
| }, |
| { |
| "epoch": 0.31, |
| "grad_norm": 223006160846848.0, |
| "learning_rate": 7.811597842924203e-07, |
| "loss": 31.49818115234375, |
| "step": 3410 |
| }, |
| { |
| "epoch": 0.3109090909090909, |
| "grad_norm": 152988916121600.0, |
| "learning_rate": 7.799778002179523e-07, |
| "loss": 31.330535888671875, |
| "step": 3420 |
| }, |
| { |
| "epoch": 0.3118181818181818, |
| "grad_norm": 115639947624448.0, |
| "learning_rate": 7.787935324507149e-07, |
| "loss": 31.248580932617188, |
| "step": 3430 |
| }, |
| { |
| "epoch": 0.31272727272727274, |
| "grad_norm": 52082308546560.0, |
| "learning_rate": 7.776069906504159e-07, |
| "loss": 30.949420166015624, |
| "step": 3440 |
| }, |
| { |
| "epoch": 0.31363636363636366, |
| "grad_norm": 70850158002176.0, |
| "learning_rate": 7.764181844953116e-07, |
| "loss": 31.362625122070312, |
| "step": 3450 |
| }, |
| { |
| "epoch": 0.3145454545454546, |
| "grad_norm": 78591157075968.0, |
| "learning_rate": 7.752271236821282e-07, |
| "loss": 31.381210327148438, |
| "step": 3460 |
| }, |
| { |
| "epoch": 0.31545454545454543, |
| "grad_norm": 153667252518912.0, |
| "learning_rate": 7.74033817925982e-07, |
| "loss": 31.4740478515625, |
| "step": 3470 |
| }, |
| { |
| "epoch": 0.31636363636363635, |
| "grad_norm": 52006664273920.0, |
| "learning_rate": 7.728382769603011e-07, |
| "loss": 31.210354614257813, |
| "step": 3480 |
| }, |
| { |
| "epoch": 0.31727272727272726, |
| "grad_norm": 186123246632960.0, |
| "learning_rate": 7.716405105367452e-07, |
| "loss": 30.999267578125, |
| "step": 3490 |
| }, |
| { |
| "epoch": 0.3181818181818182, |
| "grad_norm": 232983285989376.0, |
| "learning_rate": 7.704405284251267e-07, |
| "loss": 30.719741821289062, |
| "step": 3500 |
| }, |
| { |
| "epoch": 0.3181818181818182, |
| "eval_loss": 31.12489891052246, |
| "eval_runtime": 2.2583, |
| "eval_samples_per_second": 1.771, |
| "eval_steps_per_second": 0.443, |
| "step": 3500 |
| }, |
| { |
| "epoch": 0.3190909090909091, |
| "grad_norm": 142378786619392.0, |
| "learning_rate": 7.6923834041333e-07, |
| "loss": 31.163070678710938, |
| "step": 3510 |
| }, |
| { |
| "epoch": 0.32, |
| "grad_norm": 373457472716800.0, |
| "learning_rate": 7.680339563072333e-07, |
| "loss": 30.965121459960937, |
| "step": 3520 |
| }, |
| { |
| "epoch": 0.3209090909090909, |
| "grad_norm": 59119444688896.0, |
| "learning_rate": 7.668273859306269e-07, |
| "loss": 31.44709167480469, |
| "step": 3530 |
| }, |
| { |
| "epoch": 0.32181818181818184, |
| "grad_norm": 96141030981632.0, |
| "learning_rate": 7.656186391251341e-07, |
| "loss": 31.224566650390624, |
| "step": 3540 |
| }, |
| { |
| "epoch": 0.32272727272727275, |
| "grad_norm": 277230374617088.0, |
| "learning_rate": 7.644077257501308e-07, |
| "loss": 31.22548828125, |
| "step": 3550 |
| }, |
| { |
| "epoch": 0.3236363636363636, |
| "grad_norm": 238855160594432.0, |
| "learning_rate": 7.631946556826647e-07, |
| "loss": 31.30469665527344, |
| "step": 3560 |
| }, |
| { |
| "epoch": 0.3245454545454545, |
| "grad_norm": 65425522032640.0, |
| "learning_rate": 7.619794388173751e-07, |
| "loss": 31.599795532226562, |
| "step": 3570 |
| }, |
| { |
| "epoch": 0.32545454545454544, |
| "grad_norm": 51770529153024.0, |
| "learning_rate": 7.60762085066412e-07, |
| "loss": 30.914794921875, |
| "step": 3580 |
| }, |
| { |
| "epoch": 0.32636363636363636, |
| "grad_norm": 100869840306176.0, |
| "learning_rate": 7.595426043593556e-07, |
| "loss": 31.482501220703124, |
| "step": 3590 |
| }, |
| { |
| "epoch": 0.32727272727272727, |
| "grad_norm": 71489554481152.0, |
| "learning_rate": 7.583210066431346e-07, |
| "loss": 31.595437622070314, |
| "step": 3600 |
| }, |
| { |
| "epoch": 0.32727272727272727, |
| "eval_loss": 31.137432098388672, |
| "eval_runtime": 2.2584, |
| "eval_samples_per_second": 1.771, |
| "eval_steps_per_second": 0.443, |
| "step": 3600 |
| }, |
| { |
| "epoch": 0.3281818181818182, |
| "grad_norm": 128388249419776.0, |
| "learning_rate": 7.570973018819458e-07, |
| "loss": 31.67999267578125, |
| "step": 3610 |
| }, |
| { |
| "epoch": 0.3290909090909091, |
| "grad_norm": 48917999779840.0, |
| "learning_rate": 7.558715000571725e-07, |
| "loss": 31.7310791015625, |
| "step": 3620 |
| }, |
| { |
| "epoch": 0.33, |
| "grad_norm": 81801485746176.0, |
| "learning_rate": 7.546436111673027e-07, |
| "loss": 31.565594482421876, |
| "step": 3630 |
| }, |
| { |
| "epoch": 0.33090909090909093, |
| "grad_norm": 70281771089920.0, |
| "learning_rate": 7.534136452278486e-07, |
| "loss": 31.4003173828125, |
| "step": 3640 |
| }, |
| { |
| "epoch": 0.33181818181818185, |
| "grad_norm": 268885236383744.0, |
| "learning_rate": 7.521816122712637e-07, |
| "loss": 30.847274780273438, |
| "step": 3650 |
| }, |
| { |
| "epoch": 0.3327272727272727, |
| "grad_norm": 188701753737216.0, |
| "learning_rate": 7.509475223468618e-07, |
| "loss": 31.30968017578125, |
| "step": 3660 |
| }, |
| { |
| "epoch": 0.3336363636363636, |
| "grad_norm": 203268269539328.0, |
| "learning_rate": 7.497113855207347e-07, |
| "loss": 31.730929565429687, |
| "step": 3670 |
| }, |
| { |
| "epoch": 0.33454545454545453, |
| "grad_norm": 40551332184064.0, |
| "learning_rate": 7.4847321187567e-07, |
| "loss": 31.19182434082031, |
| "step": 3680 |
| }, |
| { |
| "epoch": 0.33545454545454545, |
| "grad_norm": 120100707368960.0, |
| "learning_rate": 7.472330115110696e-07, |
| "loss": 31.216766357421875, |
| "step": 3690 |
| }, |
| { |
| "epoch": 0.33636363636363636, |
| "grad_norm": 123142987055104.0, |
| "learning_rate": 7.459907945428657e-07, |
| "loss": 31.759628295898438, |
| "step": 3700 |
| }, |
| { |
| "epoch": 0.33636363636363636, |
| "eval_loss": 31.1546630859375, |
| "eval_runtime": 2.2729, |
| "eval_samples_per_second": 1.76, |
| "eval_steps_per_second": 0.44, |
| "step": 3700 |
| }, |
| { |
| "epoch": 0.3372727272727273, |
| "grad_norm": 65411789881344.0, |
| "learning_rate": 7.447465711034404e-07, |
| "loss": 31.438787841796874, |
| "step": 3710 |
| }, |
| { |
| "epoch": 0.3381818181818182, |
| "grad_norm": 179227156545536.0, |
| "learning_rate": 7.43500351341541e-07, |
| "loss": 31.2360595703125, |
| "step": 3720 |
| }, |
| { |
| "epoch": 0.3390909090909091, |
| "grad_norm": 259052831506432.0, |
| "learning_rate": 7.422521454221989e-07, |
| "loss": 31.520187377929688, |
| "step": 3730 |
| }, |
| { |
| "epoch": 0.34, |
| "grad_norm": 102227595231232.0, |
| "learning_rate": 7.410019635266459e-07, |
| "loss": 31.39177551269531, |
| "step": 3740 |
| }, |
| { |
| "epoch": 0.3409090909090909, |
| "grad_norm": 68988482617344.0, |
| "learning_rate": 7.397498158522306e-07, |
| "loss": 31.17947998046875, |
| "step": 3750 |
| }, |
| { |
| "epoch": 0.3418181818181818, |
| "grad_norm": 46946144223232.0, |
| "learning_rate": 7.384957126123365e-07, |
| "loss": 30.96776428222656, |
| "step": 3760 |
| }, |
| { |
| "epoch": 0.3427272727272727, |
| "grad_norm": 178196901265408.0, |
| "learning_rate": 7.37239664036298e-07, |
| "loss": 31.246176147460936, |
| "step": 3770 |
| }, |
| { |
| "epoch": 0.34363636363636363, |
| "grad_norm": 77915882520576.0, |
| "learning_rate": 7.359816803693166e-07, |
| "loss": 30.79324951171875, |
| "step": 3780 |
| }, |
| { |
| "epoch": 0.34454545454545454, |
| "grad_norm": 78789707038720.0, |
| "learning_rate": 7.347217718723783e-07, |
| "loss": 31.38133850097656, |
| "step": 3790 |
| }, |
| { |
| "epoch": 0.34545454545454546, |
| "grad_norm": 26140632678400.0, |
| "learning_rate": 7.334599488221689e-07, |
| "loss": 31.2718505859375, |
| "step": 3800 |
| }, |
| { |
| "epoch": 0.34545454545454546, |
| "eval_loss": 31.167020797729492, |
| "eval_runtime": 2.2566, |
| "eval_samples_per_second": 1.773, |
| "eval_steps_per_second": 0.443, |
| "step": 3800 |
| }, |
| { |
| "epoch": 0.3463636363636364, |
| "grad_norm": 154810032586752.0, |
| "learning_rate": 7.321962215109906e-07, |
| "loss": 30.819577026367188, |
| "step": 3810 |
| }, |
| { |
| "epoch": 0.3472727272727273, |
| "grad_norm": 118487854874624.0, |
| "learning_rate": 7.309306002466787e-07, |
| "loss": 31.2808837890625, |
| "step": 3820 |
| }, |
| { |
| "epoch": 0.3481818181818182, |
| "grad_norm": 108455390085120.0, |
| "learning_rate": 7.296630953525158e-07, |
| "loss": 31.507012939453126, |
| "step": 3830 |
| }, |
| { |
| "epoch": 0.3490909090909091, |
| "grad_norm": 174323612516352.0, |
| "learning_rate": 7.283937171671497e-07, |
| "loss": 31.171493530273438, |
| "step": 3840 |
| }, |
| { |
| "epoch": 0.35, |
| "grad_norm": 52621549240320.0, |
| "learning_rate": 7.271224760445079e-07, |
| "loss": 31.58785400390625, |
| "step": 3850 |
| }, |
| { |
| "epoch": 0.3509090909090909, |
| "grad_norm": 245216510476288.0, |
| "learning_rate": 7.258493823537124e-07, |
| "loss": 31.41130676269531, |
| "step": 3860 |
| }, |
| { |
| "epoch": 0.3518181818181818, |
| "grad_norm": 40472269553664.0, |
| "learning_rate": 7.245744464789973e-07, |
| "loss": 31.25943603515625, |
| "step": 3870 |
| }, |
| { |
| "epoch": 0.3527272727272727, |
| "grad_norm": 152244192280576.0, |
| "learning_rate": 7.232976788196221e-07, |
| "loss": 31.55677490234375, |
| "step": 3880 |
| }, |
| { |
| "epoch": 0.35363636363636364, |
| "grad_norm": 163018369400832.0, |
| "learning_rate": 7.220190897897877e-07, |
| "loss": 31.163226318359374, |
| "step": 3890 |
| }, |
| { |
| "epoch": 0.35454545454545455, |
| "grad_norm": 31649326694400.0, |
| "learning_rate": 7.207386898185515e-07, |
| "loss": 31.222012329101563, |
| "step": 3900 |
| }, |
| { |
| "epoch": 0.35454545454545455, |
| "eval_loss": 31.183151245117188, |
| "eval_runtime": 2.2888, |
| "eval_samples_per_second": 1.748, |
| "eval_steps_per_second": 0.437, |
| "step": 3900 |
| }, |
| { |
| "epoch": 0.35545454545454547, |
| "grad_norm": 120699922415616.0, |
| "learning_rate": 7.194564893497419e-07, |
| "loss": 31.556930541992188, |
| "step": 3910 |
| }, |
| { |
| "epoch": 0.3563636363636364, |
| "grad_norm": 143552671645696.0, |
| "learning_rate": 7.181724988418737e-07, |
| "loss": 31.260910034179688, |
| "step": 3920 |
| }, |
| { |
| "epoch": 0.3572727272727273, |
| "grad_norm": 66354916884480.0, |
| "learning_rate": 7.168867287680627e-07, |
| "loss": 31.252059936523438, |
| "step": 3930 |
| }, |
| { |
| "epoch": 0.35818181818181816, |
| "grad_norm": 142235978956800.0, |
| "learning_rate": 7.155991896159392e-07, |
| "loss": 31.511947631835938, |
| "step": 3940 |
| }, |
| { |
| "epoch": 0.35909090909090907, |
| "grad_norm": 331125603958784.0, |
| "learning_rate": 7.143098918875642e-07, |
| "loss": 31.4046630859375, |
| "step": 3950 |
| }, |
| { |
| "epoch": 0.36, |
| "grad_norm": 163280043638784.0, |
| "learning_rate": 7.130188460993426e-07, |
| "loss": 31.372503662109374, |
| "step": 3960 |
| }, |
| { |
| "epoch": 0.3609090909090909, |
| "grad_norm": 78036493926400.0, |
| "learning_rate": 7.117260627819376e-07, |
| "loss": 31.743682861328125, |
| "step": 3970 |
| }, |
| { |
| "epoch": 0.3618181818181818, |
| "grad_norm": 141398275784704.0, |
| "learning_rate": 7.104315524801848e-07, |
| "loss": 31.348150634765624, |
| "step": 3980 |
| }, |
| { |
| "epoch": 0.36272727272727273, |
| "grad_norm": 34922429415424.0, |
| "learning_rate": 7.091353257530068e-07, |
| "loss": 31.071649169921876, |
| "step": 3990 |
| }, |
| { |
| "epoch": 0.36363636363636365, |
| "grad_norm": 114211183132672.0, |
| "learning_rate": 7.078373931733258e-07, |
| "loss": 31.188916015625, |
| "step": 4000 |
| }, |
| { |
| "epoch": 0.36363636363636365, |
| "eval_loss": 31.198307037353516, |
| "eval_runtime": 2.261, |
| "eval_samples_per_second": 1.769, |
| "eval_steps_per_second": 0.442, |
| "step": 4000 |
| }, |
| { |
| "epoch": 0.36454545454545456, |
| "grad_norm": 331842360180736.0, |
| "learning_rate": 7.065377653279787e-07, |
| "loss": 31.492498779296874, |
| "step": 4010 |
| }, |
| { |
| "epoch": 0.3654545454545455, |
| "grad_norm": 349987120611328.0, |
| "learning_rate": 7.052364528176298e-07, |
| "loss": 31.934201049804688, |
| "step": 4020 |
| }, |
| { |
| "epoch": 0.3663636363636364, |
| "grad_norm": 60965357879296.0, |
| "learning_rate": 7.03933466256685e-07, |
| "loss": 31.326864624023436, |
| "step": 4030 |
| }, |
| { |
| "epoch": 0.36727272727272725, |
| "grad_norm": 48224626802688.0, |
| "learning_rate": 7.026288162732046e-07, |
| "loss": 31.994424438476564, |
| "step": 4040 |
| }, |
| { |
| "epoch": 0.36818181818181817, |
| "grad_norm": 141879077240832.0, |
| "learning_rate": 7.013225135088171e-07, |
| "loss": 31.8456298828125, |
| "step": 4050 |
| }, |
| { |
| "epoch": 0.3690909090909091, |
| "grad_norm": 160698214645760.0, |
| "learning_rate": 7.000145686186323e-07, |
| "loss": 31.545791625976562, |
| "step": 4060 |
| }, |
| { |
| "epoch": 0.37, |
| "grad_norm": 148393821208576.0, |
| "learning_rate": 6.987049922711543e-07, |
| "loss": 31.230282592773438, |
| "step": 4070 |
| }, |
| { |
| "epoch": 0.3709090909090909, |
| "grad_norm": 45071789457408.0, |
| "learning_rate": 6.973937951481943e-07, |
| "loss": 31.038577270507812, |
| "step": 4080 |
| }, |
| { |
| "epoch": 0.3718181818181818, |
| "grad_norm": 251187320324096.0, |
| "learning_rate": 6.960809879447838e-07, |
| "loss": 31.384237670898436, |
| "step": 4090 |
| }, |
| { |
| "epoch": 0.37272727272727274, |
| "grad_norm": 80505772965888.0, |
| "learning_rate": 6.947665813690871e-07, |
| "loss": 31.199725341796874, |
| "step": 4100 |
| }, |
| { |
| "epoch": 0.37272727272727274, |
| "eval_loss": 31.208812713623047, |
| "eval_runtime": 2.2469, |
| "eval_samples_per_second": 1.78, |
| "eval_steps_per_second": 0.445, |
| "step": 4100 |
| }, |
| { |
| "epoch": 0.37363636363636366, |
| "grad_norm": 292126529159168.0, |
| "learning_rate": 6.934505861423144e-07, |
| "loss": 31.544012451171874, |
| "step": 4110 |
| }, |
| { |
| "epoch": 0.37454545454545457, |
| "grad_norm": 129792653393920.0, |
| "learning_rate": 6.921330129986338e-07, |
| "loss": 31.441571044921876, |
| "step": 4120 |
| }, |
| { |
| "epoch": 0.37545454545454543, |
| "grad_norm": 225189916835840.0, |
| "learning_rate": 6.90813872685084e-07, |
| "loss": 31.419064331054688, |
| "step": 4130 |
| }, |
| { |
| "epoch": 0.37636363636363634, |
| "grad_norm": 210190464974848.0, |
| "learning_rate": 6.894931759614865e-07, |
| "loss": 31.52581787109375, |
| "step": 4140 |
| }, |
| { |
| "epoch": 0.37727272727272726, |
| "grad_norm": 70698005430272.0, |
| "learning_rate": 6.881709336003584e-07, |
| "loss": 31.436795043945313, |
| "step": 4150 |
| }, |
| { |
| "epoch": 0.3781818181818182, |
| "grad_norm": 212850693898240.0, |
| "learning_rate": 6.868471563868235e-07, |
| "loss": 31.254794311523437, |
| "step": 4160 |
| }, |
| { |
| "epoch": 0.3790909090909091, |
| "grad_norm": 62373582864384.0, |
| "learning_rate": 6.855218551185254e-07, |
| "loss": 30.771942138671875, |
| "step": 4170 |
| }, |
| { |
| "epoch": 0.38, |
| "grad_norm": 208657379753984.0, |
| "learning_rate": 6.841950406055389e-07, |
| "loss": 31.365264892578125, |
| "step": 4180 |
| }, |
| { |
| "epoch": 0.3809090909090909, |
| "grad_norm": 309057994883072.0, |
| "learning_rate": 6.828667236702815e-07, |
| "loss": 31.405780029296874, |
| "step": 4190 |
| }, |
| { |
| "epoch": 0.38181818181818183, |
| "grad_norm": 67258516766720.0, |
| "learning_rate": 6.815369151474256e-07, |
| "loss": 31.415036010742188, |
| "step": 4200 |
| }, |
| { |
| "epoch": 0.38181818181818183, |
| "eval_loss": 31.2274169921875, |
| "eval_runtime": 2.2563, |
| "eval_samples_per_second": 1.773, |
| "eval_steps_per_second": 0.443, |
| "step": 4200 |
| }, |
| { |
| "epoch": 0.38272727272727275, |
| "grad_norm": 254599168524288.0, |
| "learning_rate": 6.802056258838104e-07, |
| "loss": 31.626663208007812, |
| "step": 4210 |
| }, |
| { |
| "epoch": 0.3836363636363636, |
| "grad_norm": 246138183614464.0, |
| "learning_rate": 6.788728667383528e-07, |
| "loss": 31.129254150390626, |
| "step": 4220 |
| }, |
| { |
| "epoch": 0.3845454545454545, |
| "grad_norm": 116115715915776.0, |
| "learning_rate": 6.775386485819589e-07, |
| "loss": 31.354595947265626, |
| "step": 4230 |
| }, |
| { |
| "epoch": 0.38545454545454544, |
| "grad_norm": 37121943404544.0, |
| "learning_rate": 6.762029822974359e-07, |
| "loss": 31.336276245117187, |
| "step": 4240 |
| }, |
| { |
| "epoch": 0.38636363636363635, |
| "grad_norm": 53457247535104.0, |
| "learning_rate": 6.748658787794025e-07, |
| "loss": 31.495358276367188, |
| "step": 4250 |
| }, |
| { |
| "epoch": 0.38727272727272727, |
| "grad_norm": 218983068336128.0, |
| "learning_rate": 6.735273489342008e-07, |
| "loss": 31.227752685546875, |
| "step": 4260 |
| }, |
| { |
| "epoch": 0.3881818181818182, |
| "grad_norm": 164807726596096.0, |
| "learning_rate": 6.721874036798068e-07, |
| "loss": 31.28994140625, |
| "step": 4270 |
| }, |
| { |
| "epoch": 0.3890909090909091, |
| "grad_norm": 65006854995968.0, |
| "learning_rate": 6.708460539457417e-07, |
| "loss": 31.27008056640625, |
| "step": 4280 |
| }, |
| { |
| "epoch": 0.39, |
| "grad_norm": 257791369412608.0, |
| "learning_rate": 6.695033106729824e-07, |
| "loss": 31.422894287109376, |
| "step": 4290 |
| }, |
| { |
| "epoch": 0.39090909090909093, |
| "grad_norm": 200739271999488.0, |
| "learning_rate": 6.681591848138731e-07, |
| "loss": 31.794927978515624, |
| "step": 4300 |
| }, |
| { |
| "epoch": 0.39090909090909093, |
| "eval_loss": 31.233016967773438, |
| "eval_runtime": 2.2393, |
| "eval_samples_per_second": 1.786, |
| "eval_steps_per_second": 0.447, |
| "step": 4300 |
| }, |
| { |
| "epoch": 0.39181818181818184, |
| "grad_norm": 236140539936768.0, |
| "learning_rate": 6.668136873320344e-07, |
| "loss": 31.521975708007812, |
| "step": 4310 |
| }, |
| { |
| "epoch": 0.3927272727272727, |
| "grad_norm": 261026301870080.0, |
| "learning_rate": 6.654668292022754e-07, |
| "loss": 31.655804443359376, |
| "step": 4320 |
| }, |
| { |
| "epoch": 0.3936363636363636, |
| "grad_norm": 148370215665664.0, |
| "learning_rate": 6.641186214105033e-07, |
| "loss": 31.52177734375, |
| "step": 4330 |
| }, |
| { |
| "epoch": 0.39454545454545453, |
| "grad_norm": 356924298100736.0, |
| "learning_rate": 6.627690749536346e-07, |
| "loss": 31.177362060546876, |
| "step": 4340 |
| }, |
| { |
| "epoch": 0.39545454545454545, |
| "grad_norm": 349417802563584.0, |
| "learning_rate": 6.614182008395042e-07, |
| "loss": 31.20628662109375, |
| "step": 4350 |
| }, |
| { |
| "epoch": 0.39636363636363636, |
| "grad_norm": 114095118352384.0, |
| "learning_rate": 6.600660100867765e-07, |
| "loss": 31.61373291015625, |
| "step": 4360 |
| }, |
| { |
| "epoch": 0.3972727272727273, |
| "grad_norm": 156622810775552.0, |
| "learning_rate": 6.587125137248558e-07, |
| "loss": 31.190673828125, |
| "step": 4370 |
| }, |
| { |
| "epoch": 0.3981818181818182, |
| "grad_norm": 238024789065728.0, |
| "learning_rate": 6.573577227937951e-07, |
| "loss": 31.272283935546874, |
| "step": 4380 |
| }, |
| { |
| "epoch": 0.3990909090909091, |
| "grad_norm": 113410725380096.0, |
| "learning_rate": 6.560016483442075e-07, |
| "loss": 31.559075927734376, |
| "step": 4390 |
| }, |
| { |
| "epoch": 0.4, |
| "grad_norm": 58008813961216.0, |
| "learning_rate": 6.546443014371745e-07, |
| "loss": 31.474777221679688, |
| "step": 4400 |
| }, |
| { |
| "epoch": 0.4, |
| "eval_loss": 31.23973846435547, |
| "eval_runtime": 2.2483, |
| "eval_samples_per_second": 1.779, |
| "eval_steps_per_second": 0.445, |
| "step": 4400 |
| }, |
| { |
| "epoch": 0.4009090909090909, |
| "grad_norm": 143956264353792.0, |
| "learning_rate": 6.53285693144158e-07, |
| "loss": 31.266354370117188, |
| "step": 4410 |
| }, |
| { |
| "epoch": 0.4018181818181818, |
| "grad_norm": 72287755698176.0, |
| "learning_rate": 6.51925834546907e-07, |
| "loss": 31.40149841308594, |
| "step": 4420 |
| }, |
| { |
| "epoch": 0.4027272727272727, |
| "grad_norm": 191065126600704.0, |
| "learning_rate": 6.5056473673737e-07, |
| "loss": 30.717300415039062, |
| "step": 4430 |
| }, |
| { |
| "epoch": 0.4036363636363636, |
| "grad_norm": 268216597217280.0, |
| "learning_rate": 6.49202410817603e-07, |
| "loss": 31.23114929199219, |
| "step": 4440 |
| }, |
| { |
| "epoch": 0.40454545454545454, |
| "grad_norm": 178938940751872.0, |
| "learning_rate": 6.478388678996796e-07, |
| "loss": 31.212506103515626, |
| "step": 4450 |
| }, |
| { |
| "epoch": 0.40545454545454546, |
| "grad_norm": 342899149504512.0, |
| "learning_rate": 6.464741191055994e-07, |
| "loss": 31.681393432617188, |
| "step": 4460 |
| }, |
| { |
| "epoch": 0.40636363636363637, |
| "grad_norm": 184348150071296.0, |
| "learning_rate": 6.451081755671985e-07, |
| "loss": 31.174737548828126, |
| "step": 4470 |
| }, |
| { |
| "epoch": 0.4072727272727273, |
| "grad_norm": 103112006172672.0, |
| "learning_rate": 6.437410484260583e-07, |
| "loss": 31.140850830078126, |
| "step": 4480 |
| }, |
| { |
| "epoch": 0.4081818181818182, |
| "grad_norm": 327214902018048.0, |
| "learning_rate": 6.42372748833414e-07, |
| "loss": 31.637176513671875, |
| "step": 4490 |
| }, |
| { |
| "epoch": 0.4090909090909091, |
| "grad_norm": 162547080626176.0, |
| "learning_rate": 6.410032879500646e-07, |
| "loss": 31.360162353515626, |
| "step": 4500 |
| }, |
| { |
| "epoch": 0.4090909090909091, |
| "eval_loss": 31.26785659790039, |
| "eval_runtime": 2.2743, |
| "eval_samples_per_second": 1.759, |
| "eval_steps_per_second": 0.44, |
| "step": 4500 |
| }, |
| { |
| "epoch": 0.41, |
| "grad_norm": 101430937518080.0, |
| "learning_rate": 6.396326769462811e-07, |
| "loss": 30.955780029296875, |
| "step": 4510 |
| }, |
| { |
| "epoch": 0.4109090909090909, |
| "grad_norm": 411952325066752.0, |
| "learning_rate": 6.382609270017154e-07, |
| "loss": 31.721075439453124, |
| "step": 4520 |
| }, |
| { |
| "epoch": 0.4118181818181818, |
| "grad_norm": 289259034509312.0, |
| "learning_rate": 6.3688804930531e-07, |
| "loss": 31.32822265625, |
| "step": 4530 |
| }, |
| { |
| "epoch": 0.4127272727272727, |
| "grad_norm": 55133039755264.0, |
| "learning_rate": 6.355140550552058e-07, |
| "loss": 31.106060791015626, |
| "step": 4540 |
| }, |
| { |
| "epoch": 0.41363636363636364, |
| "grad_norm": 85135311503360.0, |
| "learning_rate": 6.341389554586511e-07, |
| "loss": 31.692236328125, |
| "step": 4550 |
| }, |
| { |
| "epoch": 0.41454545454545455, |
| "grad_norm": 67352506925056.0, |
| "learning_rate": 6.327627617319103e-07, |
| "loss": 31.49931640625, |
| "step": 4560 |
| }, |
| { |
| "epoch": 0.41545454545454547, |
| "grad_norm": 230468012212224.0, |
| "learning_rate": 6.313854851001721e-07, |
| "loss": 31.419146728515624, |
| "step": 4570 |
| }, |
| { |
| "epoch": 0.4163636363636364, |
| "grad_norm": 191184244834304.0, |
| "learning_rate": 6.300071367974582e-07, |
| "loss": 31.2831298828125, |
| "step": 4580 |
| }, |
| { |
| "epoch": 0.4172727272727273, |
| "grad_norm": 196244437729280.0, |
| "learning_rate": 6.286277280665315e-07, |
| "loss": 31.070465087890625, |
| "step": 4590 |
| }, |
| { |
| "epoch": 0.41818181818181815, |
| "grad_norm": 432272285106176.0, |
| "learning_rate": 6.27247270158805e-07, |
| "loss": 31.196286010742188, |
| "step": 4600 |
| }, |
| { |
| "epoch": 0.41818181818181815, |
| "eval_loss": 31.265504837036133, |
| "eval_runtime": 2.2536, |
| "eval_samples_per_second": 1.775, |
| "eval_steps_per_second": 0.444, |
| "step": 4600 |
| }, |
| { |
| "epoch": 0.41909090909090907, |
| "grad_norm": 132382501896192.0, |
| "learning_rate": 6.258657743342486e-07, |
| "loss": 31.409124755859374, |
| "step": 4610 |
| }, |
| { |
| "epoch": 0.42, |
| "grad_norm": 123047918960640.0, |
| "learning_rate": 6.244832518612989e-07, |
| "loss": 31.174249267578126, |
| "step": 4620 |
| }, |
| { |
| "epoch": 0.4209090909090909, |
| "grad_norm": 101801286172672.0, |
| "learning_rate": 6.230997140167662e-07, |
| "loss": 31.151278686523437, |
| "step": 4630 |
| }, |
| { |
| "epoch": 0.4218181818181818, |
| "grad_norm": 110819392094208.0, |
| "learning_rate": 6.217151720857432e-07, |
| "loss": 31.5635498046875, |
| "step": 4640 |
| }, |
| { |
| "epoch": 0.42272727272727273, |
| "grad_norm": 162855865286656.0, |
| "learning_rate": 6.203296373615122e-07, |
| "loss": 31.27996826171875, |
| "step": 4650 |
| }, |
| { |
| "epoch": 0.42363636363636364, |
| "grad_norm": 113649129619456.0, |
| "learning_rate": 6.189431211454538e-07, |
| "loss": 31.386068725585936, |
| "step": 4660 |
| }, |
| { |
| "epoch": 0.42454545454545456, |
| "grad_norm": 296968836349952.0, |
| "learning_rate": 6.175556347469541e-07, |
| "loss": 31.396221923828126, |
| "step": 4670 |
| }, |
| { |
| "epoch": 0.4254545454545455, |
| "grad_norm": 382460730802176.0, |
| "learning_rate": 6.161671894833127e-07, |
| "loss": 31.629803466796876, |
| "step": 4680 |
| }, |
| { |
| "epoch": 0.4263636363636364, |
| "grad_norm": 50031491022848.0, |
| "learning_rate": 6.147777966796505e-07, |
| "loss": 31.4884765625, |
| "step": 4690 |
| }, |
| { |
| "epoch": 0.42727272727272725, |
| "grad_norm": 160202313695232.0, |
| "learning_rate": 6.13387467668817e-07, |
| "loss": 31.25142822265625, |
| "step": 4700 |
| }, |
| { |
| "epoch": 0.42727272727272725, |
| "eval_loss": 31.27532196044922, |
| "eval_runtime": 2.2762, |
| "eval_samples_per_second": 1.757, |
| "eval_steps_per_second": 0.439, |
| "step": 4700 |
| }, |
| { |
| "epoch": 0.42818181818181816, |
| "grad_norm": 130051811049472.0, |
| "learning_rate": 6.119962137912979e-07, |
| "loss": 31.30537109375, |
| "step": 4710 |
| }, |
| { |
| "epoch": 0.4290909090909091, |
| "grad_norm": 118681648496640.0, |
| "learning_rate": 6.106040463951236e-07, |
| "loss": 31.411505126953124, |
| "step": 4720 |
| }, |
| { |
| "epoch": 0.43, |
| "grad_norm": 68806344966144.0, |
| "learning_rate": 6.092109768357747e-07, |
| "loss": 30.8322998046875, |
| "step": 4730 |
| }, |
| { |
| "epoch": 0.4309090909090909, |
| "grad_norm": 80994853978112.0, |
| "learning_rate": 6.078170164760911e-07, |
| "loss": 31.552935791015624, |
| "step": 4740 |
| }, |
| { |
| "epoch": 0.4318181818181818, |
| "grad_norm": 192088553553920.0, |
| "learning_rate": 6.064221766861785e-07, |
| "loss": 31.02978515625, |
| "step": 4750 |
| }, |
| { |
| "epoch": 0.43272727272727274, |
| "grad_norm": 156923173273600.0, |
| "learning_rate": 6.050264688433161e-07, |
| "loss": 31.151821899414063, |
| "step": 4760 |
| }, |
| { |
| "epoch": 0.43363636363636365, |
| "grad_norm": 306010447151104.0, |
| "learning_rate": 6.036299043318631e-07, |
| "loss": 31.844577026367187, |
| "step": 4770 |
| }, |
| { |
| "epoch": 0.43454545454545457, |
| "grad_norm": 163939203678208.0, |
| "learning_rate": 6.022324945431665e-07, |
| "loss": 31.494683837890626, |
| "step": 4780 |
| }, |
| { |
| "epoch": 0.4354545454545454, |
| "grad_norm": 307883992416256.0, |
| "learning_rate": 6.008342508754682e-07, |
| "loss": 31.625247192382812, |
| "step": 4790 |
| }, |
| { |
| "epoch": 0.43636363636363634, |
| "grad_norm": 161946305298432.0, |
| "learning_rate": 5.994351847338113e-07, |
| "loss": 31.29015197753906, |
| "step": 4800 |
| }, |
| { |
| "epoch": 0.43636363636363634, |
| "eval_loss": 31.277931213378906, |
| "eval_runtime": 2.2639, |
| "eval_samples_per_second": 1.767, |
| "eval_steps_per_second": 0.442, |
| "step": 4800 |
| }, |
| { |
| "epoch": 0.43727272727272726, |
| "grad_norm": 106276080058368.0, |
| "learning_rate": 5.980353075299481e-07, |
| "loss": 31.702081298828126, |
| "step": 4810 |
| }, |
| { |
| "epoch": 0.4381818181818182, |
| "grad_norm": 137356761890816.0, |
| "learning_rate": 5.966346306822458e-07, |
| "loss": 31.010269165039062, |
| "step": 4820 |
| }, |
| { |
| "epoch": 0.4390909090909091, |
| "grad_norm": 303051114020864.0, |
| "learning_rate": 5.95233165615595e-07, |
| "loss": 31.519564819335937, |
| "step": 4830 |
| }, |
| { |
| "epoch": 0.44, |
| "grad_norm": 43947078451200.0, |
| "learning_rate": 5.938309237613146e-07, |
| "loss": 31.17099609375, |
| "step": 4840 |
| }, |
| { |
| "epoch": 0.4409090909090909, |
| "grad_norm": 200443087028224.0, |
| "learning_rate": 5.924279165570602e-07, |
| "loss": 31.536282348632813, |
| "step": 4850 |
| }, |
| { |
| "epoch": 0.44181818181818183, |
| "grad_norm": 255512100732928.0, |
| "learning_rate": 5.910241554467298e-07, |
| "loss": 31.622979736328126, |
| "step": 4860 |
| }, |
| { |
| "epoch": 0.44272727272727275, |
| "grad_norm": 122165680668672.0, |
| "learning_rate": 5.896196518803707e-07, |
| "loss": 31.318588256835938, |
| "step": 4870 |
| }, |
| { |
| "epoch": 0.44363636363636366, |
| "grad_norm": 59236595793920.0, |
| "learning_rate": 5.882144173140867e-07, |
| "loss": 31.511083984375, |
| "step": 4880 |
| }, |
| { |
| "epoch": 0.4445454545454545, |
| "grad_norm": 160883888095232.0, |
| "learning_rate": 5.868084632099435e-07, |
| "loss": 31.54732666015625, |
| "step": 4890 |
| }, |
| { |
| "epoch": 0.44545454545454544, |
| "grad_norm": 257228040830976.0, |
| "learning_rate": 5.854018010358761e-07, |
| "loss": 31.00733337402344, |
| "step": 4900 |
| }, |
| { |
| "epoch": 0.44545454545454544, |
| "eval_loss": 31.296031951904297, |
| "eval_runtime": 2.2374, |
| "eval_samples_per_second": 1.788, |
| "eval_steps_per_second": 0.447, |
| "step": 4900 |
| }, |
| { |
| "epoch": 0.44636363636363635, |
| "grad_norm": 92250444922880.0, |
| "learning_rate": 5.839944422655952e-07, |
| "loss": 31.35645446777344, |
| "step": 4910 |
| }, |
| { |
| "epoch": 0.44727272727272727, |
| "grad_norm": 118262083878912.0, |
| "learning_rate": 5.825863983784931e-07, |
| "loss": 31.456143188476563, |
| "step": 4920 |
| }, |
| { |
| "epoch": 0.4481818181818182, |
| "grad_norm": 55267186180096.0, |
| "learning_rate": 5.811776808595506e-07, |
| "loss": 31.58196105957031, |
| "step": 4930 |
| }, |
| { |
| "epoch": 0.4490909090909091, |
| "grad_norm": 242786548842496.0, |
| "learning_rate": 5.797683011992432e-07, |
| "loss": 31.34881591796875, |
| "step": 4940 |
| }, |
| { |
| "epoch": 0.45, |
| "grad_norm": 193380936056832.0, |
| "learning_rate": 5.783582708934468e-07, |
| "loss": 31.296319580078126, |
| "step": 4950 |
| }, |
| { |
| "epoch": 0.4509090909090909, |
| "grad_norm": 106026896457728.0, |
| "learning_rate": 5.769476014433451e-07, |
| "loss": 30.779248046875, |
| "step": 4960 |
| }, |
| { |
| "epoch": 0.45181818181818184, |
| "grad_norm": 87636718911488.0, |
| "learning_rate": 5.755363043553346e-07, |
| "loss": 31.5363037109375, |
| "step": 4970 |
| }, |
| { |
| "epoch": 0.4527272727272727, |
| "grad_norm": 73219755212800.0, |
| "learning_rate": 5.741243911409314e-07, |
| "loss": 31.977978515625, |
| "step": 4980 |
| }, |
| { |
| "epoch": 0.4536363636363636, |
| "grad_norm": 236564936392704.0, |
| "learning_rate": 5.72711873316677e-07, |
| "loss": 31.291098022460936, |
| "step": 4990 |
| }, |
| { |
| "epoch": 0.45454545454545453, |
| "grad_norm": 141793949646848.0, |
| "learning_rate": 5.712987624040451e-07, |
| "loss": 30.713864135742188, |
| "step": 5000 |
| }, |
| { |
| "epoch": 0.45454545454545453, |
| "eval_loss": 31.29385757446289, |
| "eval_runtime": 2.2444, |
| "eval_samples_per_second": 1.782, |
| "eval_steps_per_second": 0.446, |
| "step": 5000 |
| } |
| ], |
| "logging_steps": 10, |
| "max_steps": 11000, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 9223372036854775807, |
| "save_steps": 1000, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2.264961908736e+16, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|