| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 0.9090909090909091, |
| "eval_steps": 100, |
| "global_step": 10000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": false, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.0009090909090909091, |
| "grad_norm": 73365171732480.0, |
| "learning_rate": 9.999983482695944e-07, |
| "loss": 26.594210815429687, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.0018181818181818182, |
| "grad_norm": 51667001147392.0, |
| "learning_rate": 9.999926385982519e-07, |
| "loss": 26.803173828125, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.0027272727272727275, |
| "grad_norm": 144119808655360.0, |
| "learning_rate": 9.999828506408003e-07, |
| "loss": 26.6311767578125, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.0036363636363636364, |
| "grad_norm": 288443594702848.0, |
| "learning_rate": 9.999689844770766e-07, |
| "loss": 26.79853210449219, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.004545454545454545, |
| "grad_norm": 178193478713344.0, |
| "learning_rate": 9.999510402201835e-07, |
| "loss": 26.80711669921875, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.005454545454545455, |
| "grad_norm": 104469937258496.0, |
| "learning_rate": 9.99929018016486e-07, |
| "loss": 26.85858154296875, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.006363636363636364, |
| "grad_norm": 212630258057216.0, |
| "learning_rate": 9.999029180456129e-07, |
| "loss": 26.61113586425781, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.007272727272727273, |
| "grad_norm": 82712153030656.0, |
| "learning_rate": 9.998727405204534e-07, |
| "loss": 26.967510986328126, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.008181818181818182, |
| "grad_norm": 113997894385664.0, |
| "learning_rate": 9.998384856871564e-07, |
| "loss": 26.79218444824219, |
| "step": 90 |
| }, |
| { |
| "epoch": 0.00909090909090909, |
| "grad_norm": 32432866721792.0, |
| "learning_rate": 9.998001538251282e-07, |
| "loss": 26.760104370117187, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.00909090909090909, |
| "eval_loss": 26.33808708190918, |
| "eval_runtime": 15.3766, |
| "eval_samples_per_second": 2.341, |
| "eval_steps_per_second": 0.13, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.01, |
| "grad_norm": 86142355505152.0, |
| "learning_rate": 9.997577452470298e-07, |
| "loss": 26.885391235351562, |
| "step": 110 |
| }, |
| { |
| "epoch": 0.01090909090909091, |
| "grad_norm": 42407483670528.0, |
| "learning_rate": 9.99711260298775e-07, |
| "loss": 26.781631469726562, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.011818181818181818, |
| "grad_norm": 87900112814080.0, |
| "learning_rate": 9.99660699359527e-07, |
| "loss": 26.478997802734376, |
| "step": 130 |
| }, |
| { |
| "epoch": 0.012727272727272728, |
| "grad_norm": 109777954799616.0, |
| "learning_rate": 9.996060628416963e-07, |
| "loss": 26.806842041015624, |
| "step": 140 |
| }, |
| { |
| "epoch": 0.013636363636363636, |
| "grad_norm": 49805468368896.0, |
| "learning_rate": 9.995473511909357e-07, |
| "loss": 27.047796630859374, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.014545454545454545, |
| "grad_norm": 216601408307200.0, |
| "learning_rate": 9.994845648861382e-07, |
| "loss": 26.913211059570312, |
| "step": 160 |
| }, |
| { |
| "epoch": 0.015454545454545455, |
| "grad_norm": 207064097882112.0, |
| "learning_rate": 9.994177044394322e-07, |
| "loss": 26.413333129882812, |
| "step": 170 |
| }, |
| { |
| "epoch": 0.016363636363636365, |
| "grad_norm": 82221604012032.0, |
| "learning_rate": 9.993467703961784e-07, |
| "loss": 26.159014892578124, |
| "step": 180 |
| }, |
| { |
| "epoch": 0.017272727272727273, |
| "grad_norm": 54769984995328.0, |
| "learning_rate": 9.992717633349635e-07, |
| "loss": 26.39976806640625, |
| "step": 190 |
| }, |
| { |
| "epoch": 0.01818181818181818, |
| "grad_norm": 91138409103360.0, |
| "learning_rate": 9.99192683867597e-07, |
| "loss": 26.521871948242186, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.01818181818181818, |
| "eval_loss": 26.33262825012207, |
| "eval_runtime": 2.2052, |
| "eval_samples_per_second": 16.325, |
| "eval_steps_per_second": 0.907, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.019090909090909092, |
| "grad_norm": 226673442160640.0, |
| "learning_rate": 9.99109532639106e-07, |
| "loss": 26.42662353515625, |
| "step": 210 |
| }, |
| { |
| "epoch": 0.02, |
| "grad_norm": 178545447927808.0, |
| "learning_rate": 9.99022310327729e-07, |
| "loss": 27.001919555664063, |
| "step": 220 |
| }, |
| { |
| "epoch": 0.02090909090909091, |
| "grad_norm": 37310276042752.0, |
| "learning_rate": 9.98931017644912e-07, |
| "loss": 26.3681884765625, |
| "step": 230 |
| }, |
| { |
| "epoch": 0.02181818181818182, |
| "grad_norm": 169656073584640.0, |
| "learning_rate": 9.988356553353017e-07, |
| "loss": 26.52265625, |
| "step": 240 |
| }, |
| { |
| "epoch": 0.022727272727272728, |
| "grad_norm": 119822314635264.0, |
| "learning_rate": 9.987362241767383e-07, |
| "loss": 26.739306640625, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.023636363636363636, |
| "grad_norm": 135106542960640.0, |
| "learning_rate": 9.986327249802515e-07, |
| "loss": 26.929629516601562, |
| "step": 260 |
| }, |
| { |
| "epoch": 0.024545454545454544, |
| "grad_norm": 141070599979008.0, |
| "learning_rate": 9.985251585900525e-07, |
| "loss": 26.869723510742187, |
| "step": 270 |
| }, |
| { |
| "epoch": 0.025454545454545455, |
| "grad_norm": 168756110163968.0, |
| "learning_rate": 9.984135258835272e-07, |
| "loss": 26.432122802734376, |
| "step": 280 |
| }, |
| { |
| "epoch": 0.026363636363636363, |
| "grad_norm": 51225978470400.0, |
| "learning_rate": 9.98297827771229e-07, |
| "loss": 26.779403686523438, |
| "step": 290 |
| }, |
| { |
| "epoch": 0.02727272727272727, |
| "grad_norm": 203997088579584.0, |
| "learning_rate": 9.981780651968722e-07, |
| "loss": 26.73297119140625, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.02727272727272727, |
| "eval_loss": 26.32358741760254, |
| "eval_runtime": 2.1675, |
| "eval_samples_per_second": 16.609, |
| "eval_steps_per_second": 0.923, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.028181818181818183, |
| "grad_norm": 211993462046720.0, |
| "learning_rate": 9.980542391373232e-07, |
| "loss": 26.3818603515625, |
| "step": 310 |
| }, |
| { |
| "epoch": 0.02909090909090909, |
| "grad_norm": 67605180186624.0, |
| "learning_rate": 9.979263506025929e-07, |
| "loss": 26.753466796875, |
| "step": 320 |
| }, |
| { |
| "epoch": 0.03, |
| "grad_norm": 83690625433600.0, |
| "learning_rate": 9.977944006358285e-07, |
| "loss": 26.70177001953125, |
| "step": 330 |
| }, |
| { |
| "epoch": 0.03090909090909091, |
| "grad_norm": 234856529264640.0, |
| "learning_rate": 9.976583903133059e-07, |
| "loss": 26.383956909179688, |
| "step": 340 |
| }, |
| { |
| "epoch": 0.031818181818181815, |
| "grad_norm": 74805898379264.0, |
| "learning_rate": 9.975183207444189e-07, |
| "loss": 26.859848022460938, |
| "step": 350 |
| }, |
| { |
| "epoch": 0.03272727272727273, |
| "grad_norm": 216309870624768.0, |
| "learning_rate": 9.97374193071672e-07, |
| "loss": 26.3761474609375, |
| "step": 360 |
| }, |
| { |
| "epoch": 0.03363636363636364, |
| "grad_norm": 132342337241088.0, |
| "learning_rate": 9.972260084706704e-07, |
| "loss": 26.71666564941406, |
| "step": 370 |
| }, |
| { |
| "epoch": 0.034545454545454546, |
| "grad_norm": 131501941325824.0, |
| "learning_rate": 9.970737681501104e-07, |
| "loss": 26.52633056640625, |
| "step": 380 |
| }, |
| { |
| "epoch": 0.035454545454545454, |
| "grad_norm": 262768951296000.0, |
| "learning_rate": 9.969174733517693e-07, |
| "loss": 26.515576171875, |
| "step": 390 |
| }, |
| { |
| "epoch": 0.03636363636363636, |
| "grad_norm": 47626049290240.0, |
| "learning_rate": 9.967571253504956e-07, |
| "loss": 26.491845703125, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.03636363636363636, |
| "eval_loss": 26.31351089477539, |
| "eval_runtime": 2.1949, |
| "eval_samples_per_second": 16.402, |
| "eval_steps_per_second": 0.911, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.03727272727272727, |
| "grad_norm": 82015571410944.0, |
| "learning_rate": 9.965927254541986e-07, |
| "loss": 26.79627380371094, |
| "step": 410 |
| }, |
| { |
| "epoch": 0.038181818181818185, |
| "grad_norm": 48217920110592.0, |
| "learning_rate": 9.964242750038379e-07, |
| "loss": 26.478103637695312, |
| "step": 420 |
| }, |
| { |
| "epoch": 0.03909090909090909, |
| "grad_norm": 240027619557376.0, |
| "learning_rate": 9.96251775373412e-07, |
| "loss": 27.031826782226563, |
| "step": 430 |
| }, |
| { |
| "epoch": 0.04, |
| "grad_norm": 85748241924096.0, |
| "learning_rate": 9.960752279699469e-07, |
| "loss": 26.60472412109375, |
| "step": 440 |
| }, |
| { |
| "epoch": 0.04090909090909091, |
| "grad_norm": 149027999973376.0, |
| "learning_rate": 9.958946342334858e-07, |
| "loss": 26.631716918945312, |
| "step": 450 |
| }, |
| { |
| "epoch": 0.04181818181818182, |
| "grad_norm": 145542986334208.0, |
| "learning_rate": 9.957099956370761e-07, |
| "loss": 26.688156127929688, |
| "step": 460 |
| }, |
| { |
| "epoch": 0.042727272727272725, |
| "grad_norm": 119765381152768.0, |
| "learning_rate": 9.95521313686758e-07, |
| "loss": 26.73491516113281, |
| "step": 470 |
| }, |
| { |
| "epoch": 0.04363636363636364, |
| "grad_norm": 42115639803904.0, |
| "learning_rate": 9.953285899215524e-07, |
| "loss": 26.4789306640625, |
| "step": 480 |
| }, |
| { |
| "epoch": 0.04454545454545455, |
| "grad_norm": 174389194653696.0, |
| "learning_rate": 9.951318259134473e-07, |
| "loss": 26.395907592773437, |
| "step": 490 |
| }, |
| { |
| "epoch": 0.045454545454545456, |
| "grad_norm": 126755364929536.0, |
| "learning_rate": 9.949310232673867e-07, |
| "loss": 26.444671630859375, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.045454545454545456, |
| "eval_loss": 26.300777435302734, |
| "eval_runtime": 2.1863, |
| "eval_samples_per_second": 16.466, |
| "eval_steps_per_second": 0.915, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.046363636363636364, |
| "grad_norm": 89457617272832.0, |
| "learning_rate": 9.947261836212555e-07, |
| "loss": 26.633724975585938, |
| "step": 510 |
| }, |
| { |
| "epoch": 0.04727272727272727, |
| "grad_norm": 357854594727936.0, |
| "learning_rate": 9.94517308645868e-07, |
| "loss": 26.50592956542969, |
| "step": 520 |
| }, |
| { |
| "epoch": 0.04818181818181818, |
| "grad_norm": 145786406961152.0, |
| "learning_rate": 9.94304400044953e-07, |
| "loss": 26.608950805664062, |
| "step": 530 |
| }, |
| { |
| "epoch": 0.04909090909090909, |
| "grad_norm": 63449291816960.0, |
| "learning_rate": 9.940874595551404e-07, |
| "loss": 26.23621826171875, |
| "step": 540 |
| }, |
| { |
| "epoch": 0.05, |
| "grad_norm": 35186595069952.0, |
| "learning_rate": 9.938664889459468e-07, |
| "loss": 26.354998779296874, |
| "step": 550 |
| }, |
| { |
| "epoch": 0.05090909090909091, |
| "grad_norm": 171478263791616.0, |
| "learning_rate": 9.936414900197618e-07, |
| "loss": 26.57105712890625, |
| "step": 560 |
| }, |
| { |
| "epoch": 0.05181818181818182, |
| "grad_norm": 424193384513536.0, |
| "learning_rate": 9.934124646118324e-07, |
| "loss": 26.597015380859375, |
| "step": 570 |
| }, |
| { |
| "epoch": 0.05272727272727273, |
| "grad_norm": 69734649298944.0, |
| "learning_rate": 9.931794145902485e-07, |
| "loss": 26.793948364257812, |
| "step": 580 |
| }, |
| { |
| "epoch": 0.053636363636363635, |
| "grad_norm": 71048951234560.0, |
| "learning_rate": 9.92942341855927e-07, |
| "loss": 26.852621459960936, |
| "step": 590 |
| }, |
| { |
| "epoch": 0.05454545454545454, |
| "grad_norm": 265954290302976.0, |
| "learning_rate": 9.927012483425976e-07, |
| "loss": 26.4174072265625, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.05454545454545454, |
| "eval_loss": 26.291404724121094, |
| "eval_runtime": 2.1954, |
| "eval_samples_per_second": 16.398, |
| "eval_steps_per_second": 0.911, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.05545454545454546, |
| "grad_norm": 172292495638528.0, |
| "learning_rate": 9.924561360167858e-07, |
| "loss": 27.017904663085936, |
| "step": 610 |
| }, |
| { |
| "epoch": 0.056363636363636366, |
| "grad_norm": 146552655970304.0, |
| "learning_rate": 9.922070068777972e-07, |
| "loss": 26.3694091796875, |
| "step": 620 |
| }, |
| { |
| "epoch": 0.057272727272727274, |
| "grad_norm": 238492990832640.0, |
| "learning_rate": 9.91953862957702e-07, |
| "loss": 26.68968505859375, |
| "step": 630 |
| }, |
| { |
| "epoch": 0.05818181818181818, |
| "grad_norm": 277039399567360.0, |
| "learning_rate": 9.91696706321317e-07, |
| "loss": 26.37095947265625, |
| "step": 640 |
| }, |
| { |
| "epoch": 0.05909090909090909, |
| "grad_norm": 185654575104000.0, |
| "learning_rate": 9.914355390661895e-07, |
| "loss": 26.30018005371094, |
| "step": 650 |
| }, |
| { |
| "epoch": 0.06, |
| "grad_norm": 310576869801984.0, |
| "learning_rate": 9.91170363322581e-07, |
| "loss": 26.79898681640625, |
| "step": 660 |
| }, |
| { |
| "epoch": 0.060909090909090906, |
| "grad_norm": 67033240698880.0, |
| "learning_rate": 9.90901181253448e-07, |
| "loss": 26.819778442382812, |
| "step": 670 |
| }, |
| { |
| "epoch": 0.06181818181818182, |
| "grad_norm": 56443759755264.0, |
| "learning_rate": 9.906279950544258e-07, |
| "loss": 26.365707397460938, |
| "step": 680 |
| }, |
| { |
| "epoch": 0.06272727272727273, |
| "grad_norm": 60853546123264.0, |
| "learning_rate": 9.903508069538107e-07, |
| "loss": 26.7015869140625, |
| "step": 690 |
| }, |
| { |
| "epoch": 0.06363636363636363, |
| "grad_norm": 54322498895872.0, |
| "learning_rate": 9.900696192125401e-07, |
| "loss": 26.60201416015625, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.06363636363636363, |
| "eval_loss": 26.27959442138672, |
| "eval_runtime": 2.1871, |
| "eval_samples_per_second": 16.46, |
| "eval_steps_per_second": 0.914, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.06454545454545454, |
| "grad_norm": 86583118135296.0, |
| "learning_rate": 9.897844341241764e-07, |
| "loss": 26.674392700195312, |
| "step": 710 |
| }, |
| { |
| "epoch": 0.06545454545454546, |
| "grad_norm": 117483361009664.0, |
| "learning_rate": 9.894952540148861e-07, |
| "loss": 26.57917175292969, |
| "step": 720 |
| }, |
| { |
| "epoch": 0.06636363636363636, |
| "grad_norm": 156891263008768.0, |
| "learning_rate": 9.892020812434227e-07, |
| "loss": 26.749630737304688, |
| "step": 730 |
| }, |
| { |
| "epoch": 0.06727272727272728, |
| "grad_norm": 161708622479360.0, |
| "learning_rate": 9.889049182011064e-07, |
| "loss": 26.950381469726562, |
| "step": 740 |
| }, |
| { |
| "epoch": 0.06818181818181818, |
| "grad_norm": 132854914744320.0, |
| "learning_rate": 9.886037673118046e-07, |
| "loss": 26.209268188476564, |
| "step": 750 |
| }, |
| { |
| "epoch": 0.06909090909090909, |
| "grad_norm": 230637545979904.0, |
| "learning_rate": 9.882986310319123e-07, |
| "loss": 26.622137451171874, |
| "step": 760 |
| }, |
| { |
| "epoch": 0.07, |
| "grad_norm": 44996547837952.0, |
| "learning_rate": 9.879895118503322e-07, |
| "loss": 26.396820068359375, |
| "step": 770 |
| }, |
| { |
| "epoch": 0.07090909090909091, |
| "grad_norm": 105779734511616.0, |
| "learning_rate": 9.876764122884546e-07, |
| "loss": 26.439730834960937, |
| "step": 780 |
| }, |
| { |
| "epoch": 0.07181818181818182, |
| "grad_norm": 142746727743488.0, |
| "learning_rate": 9.873593349001363e-07, |
| "loss": 26.420101928710938, |
| "step": 790 |
| }, |
| { |
| "epoch": 0.07272727272727272, |
| "grad_norm": 217378294071296.0, |
| "learning_rate": 9.870382822716797e-07, |
| "loss": 26.5166015625, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.07272727272727272, |
| "eval_loss": 26.271564483642578, |
| "eval_runtime": 2.1575, |
| "eval_samples_per_second": 16.686, |
| "eval_steps_per_second": 0.927, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.07363636363636364, |
| "grad_norm": 108654393032704.0, |
| "learning_rate": 9.867132570218127e-07, |
| "loss": 26.610940551757814, |
| "step": 810 |
| }, |
| { |
| "epoch": 0.07454545454545454, |
| "grad_norm": 160897595080704.0, |
| "learning_rate": 9.863842618016658e-07, |
| "loss": 26.722555541992186, |
| "step": 820 |
| }, |
| { |
| "epoch": 0.07545454545454545, |
| "grad_norm": 207793755783168.0, |
| "learning_rate": 9.86051299294752e-07, |
| "loss": 26.355166625976562, |
| "step": 830 |
| }, |
| { |
| "epoch": 0.07636363636363637, |
| "grad_norm": 73539973545984.0, |
| "learning_rate": 9.857143722169442e-07, |
| "loss": 26.54212341308594, |
| "step": 840 |
| }, |
| { |
| "epoch": 0.07727272727272727, |
| "grad_norm": 117208164335616.0, |
| "learning_rate": 9.853734833164525e-07, |
| "loss": 26.74329528808594, |
| "step": 850 |
| }, |
| { |
| "epoch": 0.07818181818181819, |
| "grad_norm": 65454479507456.0, |
| "learning_rate": 9.850286353738032e-07, |
| "loss": 26.864334106445312, |
| "step": 860 |
| }, |
| { |
| "epoch": 0.07909090909090909, |
| "grad_norm": 302659668017152.0, |
| "learning_rate": 9.846798312018146e-07, |
| "loss": 26.766177368164062, |
| "step": 870 |
| }, |
| { |
| "epoch": 0.08, |
| "grad_norm": 64990744674304.0, |
| "learning_rate": 9.843270736455752e-07, |
| "loss": 26.492599487304688, |
| "step": 880 |
| }, |
| { |
| "epoch": 0.0809090909090909, |
| "grad_norm": 143555456663552.0, |
| "learning_rate": 9.839703655824194e-07, |
| "loss": 26.37163391113281, |
| "step": 890 |
| }, |
| { |
| "epoch": 0.08181818181818182, |
| "grad_norm": 120043572559872.0, |
| "learning_rate": 9.836097099219057e-07, |
| "loss": 26.424105834960937, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.08181818181818182, |
| "eval_loss": 26.26393699645996, |
| "eval_runtime": 2.1589, |
| "eval_samples_per_second": 16.675, |
| "eval_steps_per_second": 0.926, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.08272727272727273, |
| "grad_norm": 129510234128384.0, |
| "learning_rate": 9.832451096057912e-07, |
| "loss": 26.673666381835936, |
| "step": 910 |
| }, |
| { |
| "epoch": 0.08363636363636363, |
| "grad_norm": 89579042373632.0, |
| "learning_rate": 9.82876567608008e-07, |
| "loss": 26.665896606445312, |
| "step": 920 |
| }, |
| { |
| "epoch": 0.08454545454545455, |
| "grad_norm": 78381492207616.0, |
| "learning_rate": 9.825040869346404e-07, |
| "loss": 26.850192260742187, |
| "step": 930 |
| }, |
| { |
| "epoch": 0.08545454545454545, |
| "grad_norm": 88285191864320.0, |
| "learning_rate": 9.821276706238985e-07, |
| "loss": 26.515313720703126, |
| "step": 940 |
| }, |
| { |
| "epoch": 0.08636363636363636, |
| "grad_norm": 152401596121088.0, |
| "learning_rate": 9.81747321746094e-07, |
| "loss": 26.679132080078126, |
| "step": 950 |
| }, |
| { |
| "epoch": 0.08727272727272728, |
| "grad_norm": 154951682621440.0, |
| "learning_rate": 9.81363043403616e-07, |
| "loss": 26.68135986328125, |
| "step": 960 |
| }, |
| { |
| "epoch": 0.08818181818181818, |
| "grad_norm": 241076212334592.0, |
| "learning_rate": 9.809748387309047e-07, |
| "loss": 26.675436401367186, |
| "step": 970 |
| }, |
| { |
| "epoch": 0.0890909090909091, |
| "grad_norm": 109151057346560.0, |
| "learning_rate": 9.805827108944259e-07, |
| "loss": 26.623699951171876, |
| "step": 980 |
| }, |
| { |
| "epoch": 0.09, |
| "grad_norm": 133532965928960.0, |
| "learning_rate": 9.801866630926459e-07, |
| "loss": 26.52110595703125, |
| "step": 990 |
| }, |
| { |
| "epoch": 0.09090909090909091, |
| "grad_norm": 96509039214592.0, |
| "learning_rate": 9.797866985560049e-07, |
| "loss": 26.782925415039063, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.09090909090909091, |
| "eval_loss": 26.261463165283203, |
| "eval_runtime": 2.183, |
| "eval_samples_per_second": 16.491, |
| "eval_steps_per_second": 0.916, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.09181818181818181, |
| "grad_norm": 187900356460544.0, |
| "learning_rate": 9.793828205468902e-07, |
| "loss": 26.365805053710936, |
| "step": 1010 |
| }, |
| { |
| "epoch": 0.09272727272727273, |
| "grad_norm": 28923125563392.0, |
| "learning_rate": 9.789750323596107e-07, |
| "loss": 26.50677490234375, |
| "step": 1020 |
| }, |
| { |
| "epoch": 0.09363636363636364, |
| "grad_norm": 68414097850368.0, |
| "learning_rate": 9.78563337320369e-07, |
| "loss": 26.546441650390626, |
| "step": 1030 |
| }, |
| { |
| "epoch": 0.09454545454545454, |
| "grad_norm": 90978555789312.0, |
| "learning_rate": 9.781477387872351e-07, |
| "loss": 26.585183715820314, |
| "step": 1040 |
| }, |
| { |
| "epoch": 0.09545454545454546, |
| "grad_norm": 53660109242368.0, |
| "learning_rate": 9.77728240150118e-07, |
| "loss": 26.682867431640624, |
| "step": 1050 |
| }, |
| { |
| "epoch": 0.09636363636363636, |
| "grad_norm": 27466840145920.0, |
| "learning_rate": 9.773048448307396e-07, |
| "loss": 26.987350463867188, |
| "step": 1060 |
| }, |
| { |
| "epoch": 0.09727272727272727, |
| "grad_norm": 147959761076224.0, |
| "learning_rate": 9.768775562826047e-07, |
| "loss": 26.73785400390625, |
| "step": 1070 |
| }, |
| { |
| "epoch": 0.09818181818181818, |
| "grad_norm": 169358798094336.0, |
| "learning_rate": 9.764463779909748e-07, |
| "loss": 26.500772094726564, |
| "step": 1080 |
| }, |
| { |
| "epoch": 0.09909090909090909, |
| "grad_norm": 115589129437184.0, |
| "learning_rate": 9.760113134728383e-07, |
| "loss": 26.610415649414062, |
| "step": 1090 |
| }, |
| { |
| "epoch": 0.1, |
| "grad_norm": 360445969956864.0, |
| "learning_rate": 9.755723662768827e-07, |
| "loss": 26.56005859375, |
| "step": 1100 |
| }, |
| { |
| "epoch": 0.1, |
| "eval_loss": 26.256052017211914, |
| "eval_runtime": 2.1588, |
| "eval_samples_per_second": 16.676, |
| "eval_steps_per_second": 0.926, |
| "step": 1100 |
| }, |
| { |
| "epoch": 0.1009090909090909, |
| "grad_norm": 99185625923584.0, |
| "learning_rate": 9.751295399834653e-07, |
| "loss": 26.6890869140625, |
| "step": 1110 |
| }, |
| { |
| "epoch": 0.10181818181818182, |
| "grad_norm": 183202215886848.0, |
| "learning_rate": 9.746828382045843e-07, |
| "loss": 26.630459594726563, |
| "step": 1120 |
| }, |
| { |
| "epoch": 0.10272727272727272, |
| "grad_norm": 140842698276864.0, |
| "learning_rate": 9.742322645838476e-07, |
| "loss": 26.70002136230469, |
| "step": 1130 |
| }, |
| { |
| "epoch": 0.10363636363636364, |
| "grad_norm": 131215461974016.0, |
| "learning_rate": 9.737778227964468e-07, |
| "loss": 26.78693542480469, |
| "step": 1140 |
| }, |
| { |
| "epoch": 0.10454545454545454, |
| "grad_norm": 71228257730560.0, |
| "learning_rate": 9.73319516549123e-07, |
| "loss": 26.13782958984375, |
| "step": 1150 |
| }, |
| { |
| "epoch": 0.10545454545454545, |
| "grad_norm": 261910243049472.0, |
| "learning_rate": 9.728573495801392e-07, |
| "loss": 26.35780029296875, |
| "step": 1160 |
| }, |
| { |
| "epoch": 0.10636363636363637, |
| "grad_norm": 169149602988032.0, |
| "learning_rate": 9.723913256592495e-07, |
| "loss": 26.219625854492186, |
| "step": 1170 |
| }, |
| { |
| "epoch": 0.10727272727272727, |
| "grad_norm": 115012219699200.0, |
| "learning_rate": 9.719214485876675e-07, |
| "loss": 26.5546142578125, |
| "step": 1180 |
| }, |
| { |
| "epoch": 0.10818181818181818, |
| "grad_norm": 145118489214976.0, |
| "learning_rate": 9.71447722198036e-07, |
| "loss": 26.627142333984374, |
| "step": 1190 |
| }, |
| { |
| "epoch": 0.10909090909090909, |
| "grad_norm": 80806982713344.0, |
| "learning_rate": 9.709701503543952e-07, |
| "loss": 27.058038330078126, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.10909090909090909, |
| "eval_loss": 26.251787185668945, |
| "eval_runtime": 2.1351, |
| "eval_samples_per_second": 16.861, |
| "eval_steps_per_second": 0.937, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.11, |
| "grad_norm": 268123030683648.0, |
| "learning_rate": 9.70488736952152e-07, |
| "loss": 26.308306884765624, |
| "step": 1210 |
| }, |
| { |
| "epoch": 0.11090909090909092, |
| "grad_norm": 69903797190656.0, |
| "learning_rate": 9.70003485918047e-07, |
| "loss": 27.026678466796874, |
| "step": 1220 |
| }, |
| { |
| "epoch": 0.11181818181818182, |
| "grad_norm": 84639771262976.0, |
| "learning_rate": 9.695144012101237e-07, |
| "loss": 26.755975341796876, |
| "step": 1230 |
| }, |
| { |
| "epoch": 0.11272727272727273, |
| "grad_norm": 221591623434240.0, |
| "learning_rate": 9.690214868176957e-07, |
| "loss": 26.59709777832031, |
| "step": 1240 |
| }, |
| { |
| "epoch": 0.11363636363636363, |
| "grad_norm": 56191258460160.0, |
| "learning_rate": 9.68524746761314e-07, |
| "loss": 26.63099060058594, |
| "step": 1250 |
| }, |
| { |
| "epoch": 0.11454545454545455, |
| "grad_norm": 52356536336384.0, |
| "learning_rate": 9.680241850927343e-07, |
| "loss": 26.4882568359375, |
| "step": 1260 |
| }, |
| { |
| "epoch": 0.11545454545454545, |
| "grad_norm": 70396200091648.0, |
| "learning_rate": 9.675198058948842e-07, |
| "loss": 26.889132690429687, |
| "step": 1270 |
| }, |
| { |
| "epoch": 0.11636363636363636, |
| "grad_norm": 110760671838208.0, |
| "learning_rate": 9.670116132818296e-07, |
| "loss": 26.55718994140625, |
| "step": 1280 |
| }, |
| { |
| "epoch": 0.11727272727272728, |
| "grad_norm": 39112727855104.0, |
| "learning_rate": 9.664996113987413e-07, |
| "loss": 26.293862915039064, |
| "step": 1290 |
| }, |
| { |
| "epoch": 0.11818181818181818, |
| "grad_norm": 226333435101184.0, |
| "learning_rate": 9.659838044218612e-07, |
| "loss": 26.5077392578125, |
| "step": 1300 |
| }, |
| { |
| "epoch": 0.11818181818181818, |
| "eval_loss": 26.251121520996094, |
| "eval_runtime": 2.1418, |
| "eval_samples_per_second": 16.808, |
| "eval_steps_per_second": 0.934, |
| "step": 1300 |
| }, |
| { |
| "epoch": 0.1190909090909091, |
| "grad_norm": 246090066558976.0, |
| "learning_rate": 9.654641965584677e-07, |
| "loss": 26.334173583984374, |
| "step": 1310 |
| }, |
| { |
| "epoch": 0.12, |
| "grad_norm": 33603889135616.0, |
| "learning_rate": 9.649407920468429e-07, |
| "loss": 26.703265380859374, |
| "step": 1320 |
| }, |
| { |
| "epoch": 0.12090909090909091, |
| "grad_norm": 181444366303232.0, |
| "learning_rate": 9.644135951562358e-07, |
| "loss": 26.410659790039062, |
| "step": 1330 |
| }, |
| { |
| "epoch": 0.12181818181818181, |
| "grad_norm": 269644237635584.0, |
| "learning_rate": 9.638826101868297e-07, |
| "loss": 26.293899536132812, |
| "step": 1340 |
| }, |
| { |
| "epoch": 0.12272727272727273, |
| "grad_norm": 79681583841280.0, |
| "learning_rate": 9.63347841469705e-07, |
| "loss": 26.449856567382813, |
| "step": 1350 |
| }, |
| { |
| "epoch": 0.12363636363636364, |
| "grad_norm": 86067386515456.0, |
| "learning_rate": 9.62809293366806e-07, |
| "loss": 26.557858276367188, |
| "step": 1360 |
| }, |
| { |
| "epoch": 0.12454545454545454, |
| "grad_norm": 321075816693760.0, |
| "learning_rate": 9.62266970270904e-07, |
| "loss": 26.580886840820312, |
| "step": 1370 |
| }, |
| { |
| "epoch": 0.12545454545454546, |
| "grad_norm": 111324067528704.0, |
| "learning_rate": 9.617208766055612e-07, |
| "loss": 26.325762939453124, |
| "step": 1380 |
| }, |
| { |
| "epoch": 0.12636363636363637, |
| "grad_norm": 194993075519488.0, |
| "learning_rate": 9.61171016825096e-07, |
| "loss": 26.300454711914064, |
| "step": 1390 |
| }, |
| { |
| "epoch": 0.12727272727272726, |
| "grad_norm": 288133786632192.0, |
| "learning_rate": 9.606173954145452e-07, |
| "loss": 26.546014404296876, |
| "step": 1400 |
| }, |
| { |
| "epoch": 0.12727272727272726, |
| "eval_loss": 26.244295120239258, |
| "eval_runtime": 2.2, |
| "eval_samples_per_second": 16.363, |
| "eval_steps_per_second": 0.909, |
| "step": 1400 |
| }, |
| { |
| "epoch": 0.12818181818181817, |
| "grad_norm": 177530057261056.0, |
| "learning_rate": 9.600600168896283e-07, |
| "loss": 26.664501953125, |
| "step": 1410 |
| }, |
| { |
| "epoch": 0.1290909090909091, |
| "grad_norm": 82094986362880.0, |
| "learning_rate": 9.594988857967105e-07, |
| "loss": 26.34851989746094, |
| "step": 1420 |
| }, |
| { |
| "epoch": 0.13, |
| "grad_norm": 69806082490368.0, |
| "learning_rate": 9.589340067127657e-07, |
| "loss": 26.633663940429688, |
| "step": 1430 |
| }, |
| { |
| "epoch": 0.13090909090909092, |
| "grad_norm": 141491255115776.0, |
| "learning_rate": 9.583653842453382e-07, |
| "loss": 26.581817626953125, |
| "step": 1440 |
| }, |
| { |
| "epoch": 0.1318181818181818, |
| "grad_norm": 255033698418688.0, |
| "learning_rate": 9.577930230325072e-07, |
| "loss": 26.456216430664064, |
| "step": 1450 |
| }, |
| { |
| "epoch": 0.13272727272727272, |
| "grad_norm": 91050555211776.0, |
| "learning_rate": 9.572169277428464e-07, |
| "loss": 26.306192016601564, |
| "step": 1460 |
| }, |
| { |
| "epoch": 0.13363636363636364, |
| "grad_norm": 96132306829312.0, |
| "learning_rate": 9.566371030753882e-07, |
| "loss": 26.70736083984375, |
| "step": 1470 |
| }, |
| { |
| "epoch": 0.13454545454545455, |
| "grad_norm": 237691039907840.0, |
| "learning_rate": 9.560535537595838e-07, |
| "loss": 26.573016357421874, |
| "step": 1480 |
| }, |
| { |
| "epoch": 0.13545454545454547, |
| "grad_norm": 146975156600832.0, |
| "learning_rate": 9.554662845552656e-07, |
| "loss": 26.510528564453125, |
| "step": 1490 |
| }, |
| { |
| "epoch": 0.13636363636363635, |
| "grad_norm": 112128560201728.0, |
| "learning_rate": 9.548753002526076e-07, |
| "loss": 26.415969848632812, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.13636363636363635, |
| "eval_loss": 26.23933219909668, |
| "eval_runtime": 2.1836, |
| "eval_samples_per_second": 16.487, |
| "eval_steps_per_second": 0.916, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.13727272727272727, |
| "grad_norm": 121713308205056.0, |
| "learning_rate": 9.54280605672087e-07, |
| "loss": 26.36516418457031, |
| "step": 1510 |
| }, |
| { |
| "epoch": 0.13818181818181818, |
| "grad_norm": 51024886759424.0, |
| "learning_rate": 9.536822056644444e-07, |
| "loss": 26.526980590820312, |
| "step": 1520 |
| }, |
| { |
| "epoch": 0.1390909090909091, |
| "grad_norm": 207734800646144.0, |
| "learning_rate": 9.530801051106448e-07, |
| "loss": 26.514581298828126, |
| "step": 1530 |
| }, |
| { |
| "epoch": 0.14, |
| "grad_norm": 98977915600896.0, |
| "learning_rate": 9.52474308921837e-07, |
| "loss": 26.307882690429686, |
| "step": 1540 |
| }, |
| { |
| "epoch": 0.1409090909090909, |
| "grad_norm": 242286856241152.0, |
| "learning_rate": 9.518648220393142e-07, |
| "loss": 26.856787109375, |
| "step": 1550 |
| }, |
| { |
| "epoch": 0.14181818181818182, |
| "grad_norm": 111858983895040.0, |
| "learning_rate": 9.512516494344732e-07, |
| "loss": 26.754888916015624, |
| "step": 1560 |
| }, |
| { |
| "epoch": 0.14272727272727273, |
| "grad_norm": 59879578402816.0, |
| "learning_rate": 9.506347961087743e-07, |
| "loss": 26.536907958984376, |
| "step": 1570 |
| }, |
| { |
| "epoch": 0.14363636363636365, |
| "grad_norm": 91932332130304.0, |
| "learning_rate": 9.500142670937006e-07, |
| "loss": 26.195672607421876, |
| "step": 1580 |
| }, |
| { |
| "epoch": 0.14454545454545453, |
| "grad_norm": 144882249236480.0, |
| "learning_rate": 9.493900674507158e-07, |
| "loss": 26.5342041015625, |
| "step": 1590 |
| }, |
| { |
| "epoch": 0.14545454545454545, |
| "grad_norm": 120707262447616.0, |
| "learning_rate": 9.487622022712247e-07, |
| "loss": 26.463259887695312, |
| "step": 1600 |
| }, |
| { |
| "epoch": 0.14545454545454545, |
| "eval_loss": 26.236154556274414, |
| "eval_runtime": 2.2004, |
| "eval_samples_per_second": 16.361, |
| "eval_steps_per_second": 0.909, |
| "step": 1600 |
| }, |
| { |
| "epoch": 0.14636363636363636, |
| "grad_norm": 212541254926336.0, |
| "learning_rate": 9.481306766765304e-07, |
| "loss": 26.547100830078126, |
| "step": 1610 |
| }, |
| { |
| "epoch": 0.14727272727272728, |
| "grad_norm": 230553676677120.0, |
| "learning_rate": 9.474954958177925e-07, |
| "loss": 26.70894775390625, |
| "step": 1620 |
| }, |
| { |
| "epoch": 0.1481818181818182, |
| "grad_norm": 122293414002688.0, |
| "learning_rate": 9.468566648759864e-07, |
| "loss": 26.606753540039062, |
| "step": 1630 |
| }, |
| { |
| "epoch": 0.14909090909090908, |
| "grad_norm": 352308181336064.0, |
| "learning_rate": 9.462141890618589e-07, |
| "loss": 26.879544067382813, |
| "step": 1640 |
| }, |
| { |
| "epoch": 0.15, |
| "grad_norm": 311560215986176.0, |
| "learning_rate": 9.455680736158879e-07, |
| "loss": 26.504266357421876, |
| "step": 1650 |
| }, |
| { |
| "epoch": 0.1509090909090909, |
| "grad_norm": 120461434290176.0, |
| "learning_rate": 9.449183238082383e-07, |
| "loss": 26.359844970703126, |
| "step": 1660 |
| }, |
| { |
| "epoch": 0.15181818181818182, |
| "grad_norm": 383121350459392.0, |
| "learning_rate": 9.442649449387193e-07, |
| "loss": 26.710943603515624, |
| "step": 1670 |
| }, |
| { |
| "epoch": 0.15272727272727274, |
| "grad_norm": 231313768448000.0, |
| "learning_rate": 9.436079423367412e-07, |
| "loss": 26.845486450195313, |
| "step": 1680 |
| }, |
| { |
| "epoch": 0.15363636363636363, |
| "grad_norm": 96833351188480.0, |
| "learning_rate": 9.429473213612722e-07, |
| "loss": 26.756405639648438, |
| "step": 1690 |
| }, |
| { |
| "epoch": 0.15454545454545454, |
| "grad_norm": 101140926562304.0, |
| "learning_rate": 9.422830874007943e-07, |
| "loss": 26.388482666015626, |
| "step": 1700 |
| }, |
| { |
| "epoch": 0.15454545454545454, |
| "eval_loss": 26.243850708007812, |
| "eval_runtime": 2.2051, |
| "eval_samples_per_second": 16.326, |
| "eval_steps_per_second": 0.907, |
| "step": 1700 |
| }, |
| { |
| "epoch": 0.15545454545454546, |
| "grad_norm": 226440809283584.0, |
| "learning_rate": 9.416152458732595e-07, |
| "loss": 26.8792236328125, |
| "step": 1710 |
| }, |
| { |
| "epoch": 0.15636363636363637, |
| "grad_norm": 165783606919168.0, |
| "learning_rate": 9.409438022260456e-07, |
| "loss": 26.233120727539063, |
| "step": 1720 |
| }, |
| { |
| "epoch": 0.1572727272727273, |
| "grad_norm": 294015777898496.0, |
| "learning_rate": 9.40268761935912e-07, |
| "loss": 26.462741088867187, |
| "step": 1730 |
| }, |
| { |
| "epoch": 0.15818181818181817, |
| "grad_norm": 238918276481024.0, |
| "learning_rate": 9.395901305089544e-07, |
| "loss": 26.7887451171875, |
| "step": 1740 |
| }, |
| { |
| "epoch": 0.1590909090909091, |
| "grad_norm": 263223345414144.0, |
| "learning_rate": 9.389079134805609e-07, |
| "loss": 26.040914916992186, |
| "step": 1750 |
| }, |
| { |
| "epoch": 0.16, |
| "grad_norm": 95431019200512.0, |
| "learning_rate": 9.382221164153654e-07, |
| "loss": 26.33796081542969, |
| "step": 1760 |
| }, |
| { |
| "epoch": 0.16090909090909092, |
| "grad_norm": 140467635224576.0, |
| "learning_rate": 9.37532744907204e-07, |
| "loss": 26.717620849609375, |
| "step": 1770 |
| }, |
| { |
| "epoch": 0.1618181818181818, |
| "grad_norm": 480899032416256.0, |
| "learning_rate": 9.368398045790678e-07, |
| "loss": 26.35028991699219, |
| "step": 1780 |
| }, |
| { |
| "epoch": 0.16272727272727272, |
| "grad_norm": 81174705733632.0, |
| "learning_rate": 9.361433010830577e-07, |
| "loss": 26.753839111328126, |
| "step": 1790 |
| }, |
| { |
| "epoch": 0.16363636363636364, |
| "grad_norm": 47794656116736.0, |
| "learning_rate": 9.354432401003386e-07, |
| "loss": 26.356951904296874, |
| "step": 1800 |
| }, |
| { |
| "epoch": 0.16363636363636364, |
| "eval_loss": 26.24485206604004, |
| "eval_runtime": 2.1577, |
| "eval_samples_per_second": 16.684, |
| "eval_steps_per_second": 0.927, |
| "step": 1800 |
| }, |
| { |
| "epoch": 0.16454545454545455, |
| "grad_norm": 698963984384000.0, |
| "learning_rate": 9.347396273410924e-07, |
| "loss": 26.833526611328125, |
| "step": 1810 |
| }, |
| { |
| "epoch": 0.16545454545454547, |
| "grad_norm": 86179810639872.0, |
| "learning_rate": 9.34032468544472e-07, |
| "loss": 27.016268920898437, |
| "step": 1820 |
| }, |
| { |
| "epoch": 0.16636363636363635, |
| "grad_norm": 96867945807872.0, |
| "learning_rate": 9.333217694785542e-07, |
| "loss": 26.19615478515625, |
| "step": 1830 |
| }, |
| { |
| "epoch": 0.16727272727272727, |
| "grad_norm": 63991061676032.0, |
| "learning_rate": 9.326075359402924e-07, |
| "loss": 26.851419067382814, |
| "step": 1840 |
| }, |
| { |
| "epoch": 0.16818181818181818, |
| "grad_norm": 41423357345792.0, |
| "learning_rate": 9.318897737554698e-07, |
| "loss": 26.44781494140625, |
| "step": 1850 |
| }, |
| { |
| "epoch": 0.1690909090909091, |
| "grad_norm": 268588648759296.0, |
| "learning_rate": 9.31168488778652e-07, |
| "loss": 26.81973876953125, |
| "step": 1860 |
| }, |
| { |
| "epoch": 0.17, |
| "grad_norm": 273547809259520.0, |
| "learning_rate": 9.304436868931382e-07, |
| "loss": 26.573934936523436, |
| "step": 1870 |
| }, |
| { |
| "epoch": 0.1709090909090909, |
| "grad_norm": 231542844555264.0, |
| "learning_rate": 9.297153740109147e-07, |
| "loss": 26.421356201171875, |
| "step": 1880 |
| }, |
| { |
| "epoch": 0.17181818181818181, |
| "grad_norm": 74917072601088.0, |
| "learning_rate": 9.289835560726052e-07, |
| "loss": 26.465472412109374, |
| "step": 1890 |
| }, |
| { |
| "epoch": 0.17272727272727273, |
| "grad_norm": 83814885883904.0, |
| "learning_rate": 9.28248239047424e-07, |
| "loss": 26.291180419921876, |
| "step": 1900 |
| }, |
| { |
| "epoch": 0.17272727272727273, |
| "eval_loss": 26.247751235961914, |
| "eval_runtime": 2.1622, |
| "eval_samples_per_second": 16.65, |
| "eval_steps_per_second": 0.925, |
| "step": 1900 |
| }, |
| { |
| "epoch": 0.17363636363636364, |
| "grad_norm": 158092041912320.0, |
| "learning_rate": 9.275094289331253e-07, |
| "loss": 26.18585205078125, |
| "step": 1910 |
| }, |
| { |
| "epoch": 0.17454545454545456, |
| "grad_norm": 63487564840960.0, |
| "learning_rate": 9.267671317559562e-07, |
| "loss": 26.44158935546875, |
| "step": 1920 |
| }, |
| { |
| "epoch": 0.17545454545454545, |
| "grad_norm": 525191251755008.0, |
| "learning_rate": 9.260213535706062e-07, |
| "loss": 26.632656860351563, |
| "step": 1930 |
| }, |
| { |
| "epoch": 0.17636363636363636, |
| "grad_norm": 84435751927808.0, |
| "learning_rate": 9.252721004601587e-07, |
| "loss": 26.772848510742186, |
| "step": 1940 |
| }, |
| { |
| "epoch": 0.17727272727272728, |
| "grad_norm": 281165470629888.0, |
| "learning_rate": 9.245193785360406e-07, |
| "loss": 26.424920654296876, |
| "step": 1950 |
| }, |
| { |
| "epoch": 0.1781818181818182, |
| "grad_norm": 50149321605120.0, |
| "learning_rate": 9.23763193937973e-07, |
| "loss": 26.598171997070313, |
| "step": 1960 |
| }, |
| { |
| "epoch": 0.17909090909090908, |
| "grad_norm": 139234526625792.0, |
| "learning_rate": 9.23003552833921e-07, |
| "loss": 26.436553955078125, |
| "step": 1970 |
| }, |
| { |
| "epoch": 0.18, |
| "grad_norm": 245148092989440.0, |
| "learning_rate": 9.222404614200436e-07, |
| "loss": 26.634979248046875, |
| "step": 1980 |
| }, |
| { |
| "epoch": 0.1809090909090909, |
| "grad_norm": 350021413240832.0, |
| "learning_rate": 9.214739259206423e-07, |
| "loss": 26.701983642578124, |
| "step": 1990 |
| }, |
| { |
| "epoch": 0.18181818181818182, |
| "grad_norm": 183938400124928.0, |
| "learning_rate": 9.207039525881117e-07, |
| "loss": 26.423245239257813, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.18181818181818182, |
| "eval_loss": 26.24828338623047, |
| "eval_runtime": 2.1786, |
| "eval_samples_per_second": 16.525, |
| "eval_steps_per_second": 0.918, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.18272727272727274, |
| "grad_norm": 112341303689216.0, |
| "learning_rate": 9.199305477028869e-07, |
| "loss": 26.8008544921875, |
| "step": 2010 |
| }, |
| { |
| "epoch": 0.18363636363636363, |
| "grad_norm": 637360597368832.0, |
| "learning_rate": 9.19153717573394e-07, |
| "loss": 26.559991455078126, |
| "step": 2020 |
| }, |
| { |
| "epoch": 0.18454545454545454, |
| "grad_norm": 223046627491840.0, |
| "learning_rate": 9.183734685359972e-07, |
| "loss": 27.215188598632814, |
| "step": 2030 |
| }, |
| { |
| "epoch": 0.18545454545454546, |
| "grad_norm": 328656333307904.0, |
| "learning_rate": 9.175898069549476e-07, |
| "loss": 26.71053466796875, |
| "step": 2040 |
| }, |
| { |
| "epoch": 0.18636363636363637, |
| "grad_norm": 33982888542208.0, |
| "learning_rate": 9.168027392223319e-07, |
| "loss": 26.33394775390625, |
| "step": 2050 |
| }, |
| { |
| "epoch": 0.18727272727272729, |
| "grad_norm": 331992918917120.0, |
| "learning_rate": 9.160122717580194e-07, |
| "loss": 26.599868774414062, |
| "step": 2060 |
| }, |
| { |
| "epoch": 0.18818181818181817, |
| "grad_norm": 421506446262272.0, |
| "learning_rate": 9.152184110096097e-07, |
| "loss": 26.47528991699219, |
| "step": 2070 |
| }, |
| { |
| "epoch": 0.1890909090909091, |
| "grad_norm": 62027108188160.0, |
| "learning_rate": 9.144211634523808e-07, |
| "loss": 26.586676025390624, |
| "step": 2080 |
| }, |
| { |
| "epoch": 0.19, |
| "grad_norm": 217145141100544.0, |
| "learning_rate": 9.13620535589236e-07, |
| "loss": 26.263406372070314, |
| "step": 2090 |
| }, |
| { |
| "epoch": 0.19090909090909092, |
| "grad_norm": 198046679826432.0, |
| "learning_rate": 9.128165339506502e-07, |
| "loss": 26.48536071777344, |
| "step": 2100 |
| }, |
| { |
| "epoch": 0.19090909090909092, |
| "eval_loss": 26.25433921813965, |
| "eval_runtime": 2.1826, |
| "eval_samples_per_second": 16.494, |
| "eval_steps_per_second": 0.916, |
| "step": 2100 |
| }, |
| { |
| "epoch": 0.1918181818181818, |
| "grad_norm": 250411474747392.0, |
| "learning_rate": 9.120091650946171e-07, |
| "loss": 26.85694580078125, |
| "step": 2110 |
| }, |
| { |
| "epoch": 0.19272727272727272, |
| "grad_norm": 233058666020864.0, |
| "learning_rate": 9.111984356065966e-07, |
| "loss": 26.57982482910156, |
| "step": 2120 |
| }, |
| { |
| "epoch": 0.19363636363636363, |
| "grad_norm": 434236226011136.0, |
| "learning_rate": 9.103843520994592e-07, |
| "loss": 26.723846435546875, |
| "step": 2130 |
| }, |
| { |
| "epoch": 0.19454545454545455, |
| "grad_norm": 255379644612608.0, |
| "learning_rate": 9.095669212134339e-07, |
| "loss": 26.313885498046876, |
| "step": 2140 |
| }, |
| { |
| "epoch": 0.19545454545454546, |
| "grad_norm": 256500161314816.0, |
| "learning_rate": 9.087461496160528e-07, |
| "loss": 26.731137084960938, |
| "step": 2150 |
| }, |
| { |
| "epoch": 0.19636363636363635, |
| "grad_norm": 75034982875136.0, |
| "learning_rate": 9.079220440020972e-07, |
| "loss": 26.968045043945313, |
| "step": 2160 |
| }, |
| { |
| "epoch": 0.19727272727272727, |
| "grad_norm": 214327659331584.0, |
| "learning_rate": 9.070946110935431e-07, |
| "loss": 26.61375732421875, |
| "step": 2170 |
| }, |
| { |
| "epoch": 0.19818181818181818, |
| "grad_norm": 298347621515264.0, |
| "learning_rate": 9.062638576395061e-07, |
| "loss": 26.472616577148436, |
| "step": 2180 |
| }, |
| { |
| "epoch": 0.1990909090909091, |
| "grad_norm": 269609089368064.0, |
| "learning_rate": 9.054297904161867e-07, |
| "loss": 26.377481079101564, |
| "step": 2190 |
| }, |
| { |
| "epoch": 0.2, |
| "grad_norm": 162536846524416.0, |
| "learning_rate": 9.045924162268144e-07, |
| "loss": 26.407989501953125, |
| "step": 2200 |
| }, |
| { |
| "epoch": 0.2, |
| "eval_loss": 26.259925842285156, |
| "eval_runtime": 2.1531, |
| "eval_samples_per_second": 16.72, |
| "eval_steps_per_second": 0.929, |
| "step": 2200 |
| }, |
| { |
| "epoch": 0.2009090909090909, |
| "grad_norm": 115766942760960.0, |
| "learning_rate": 9.037517419015928e-07, |
| "loss": 26.59142150878906, |
| "step": 2210 |
| }, |
| { |
| "epoch": 0.2018181818181818, |
| "grad_norm": 171738931396608.0, |
| "learning_rate": 9.029077742976437e-07, |
| "loss": 26.167340087890626, |
| "step": 2220 |
| }, |
| { |
| "epoch": 0.20272727272727273, |
| "grad_norm": 177394665127936.0, |
| "learning_rate": 9.020605202989513e-07, |
| "loss": 26.530194091796876, |
| "step": 2230 |
| }, |
| { |
| "epoch": 0.20363636363636364, |
| "grad_norm": 194902461775872.0, |
| "learning_rate": 9.012099868163056e-07, |
| "loss": 26.333233642578126, |
| "step": 2240 |
| }, |
| { |
| "epoch": 0.20454545454545456, |
| "grad_norm": 117599643893760.0, |
| "learning_rate": 9.003561807872469e-07, |
| "loss": 26.445736694335938, |
| "step": 2250 |
| }, |
| { |
| "epoch": 0.20545454545454545, |
| "grad_norm": 357074051530752.0, |
| "learning_rate": 8.994991091760076e-07, |
| "loss": 26.198593139648438, |
| "step": 2260 |
| }, |
| { |
| "epoch": 0.20636363636363636, |
| "grad_norm": 181432488034304.0, |
| "learning_rate": 8.986387789734576e-07, |
| "loss": 26.502377319335938, |
| "step": 2270 |
| }, |
| { |
| "epoch": 0.20727272727272728, |
| "grad_norm": 121382704775168.0, |
| "learning_rate": 8.977751971970456e-07, |
| "loss": 26.578610229492188, |
| "step": 2280 |
| }, |
| { |
| "epoch": 0.2081818181818182, |
| "grad_norm": 163190151315456.0, |
| "learning_rate": 8.969083708907424e-07, |
| "loss": 26.57227783203125, |
| "step": 2290 |
| }, |
| { |
| "epoch": 0.20909090909090908, |
| "grad_norm": 231256457478144.0, |
| "learning_rate": 8.960383071249835e-07, |
| "loss": 26.235324096679687, |
| "step": 2300 |
| }, |
| { |
| "epoch": 0.20909090909090908, |
| "eval_loss": 26.264249801635742, |
| "eval_runtime": 2.1434, |
| "eval_samples_per_second": 16.795, |
| "eval_steps_per_second": 0.933, |
| "step": 2300 |
| }, |
| { |
| "epoch": 0.21, |
| "grad_norm": 78548240957440.0, |
| "learning_rate": 8.951650129966112e-07, |
| "loss": 26.32378234863281, |
| "step": 2310 |
| }, |
| { |
| "epoch": 0.2109090909090909, |
| "grad_norm": 134709585641472.0, |
| "learning_rate": 8.942884956288171e-07, |
| "loss": 26.452862548828126, |
| "step": 2320 |
| }, |
| { |
| "epoch": 0.21181818181818182, |
| "grad_norm": 159890257477632.0, |
| "learning_rate": 8.934087621710835e-07, |
| "loss": 26.528851318359376, |
| "step": 2330 |
| }, |
| { |
| "epoch": 0.21272727272727274, |
| "grad_norm": 226478155366400.0, |
| "learning_rate": 8.925258197991258e-07, |
| "loss": 26.547454833984375, |
| "step": 2340 |
| }, |
| { |
| "epoch": 0.21363636363636362, |
| "grad_norm": 149927023869952.0, |
| "learning_rate": 8.91639675714833e-07, |
| "loss": 26.65885009765625, |
| "step": 2350 |
| }, |
| { |
| "epoch": 0.21454545454545454, |
| "grad_norm": 175921508122624.0, |
| "learning_rate": 8.907503371462099e-07, |
| "loss": 26.4728759765625, |
| "step": 2360 |
| }, |
| { |
| "epoch": 0.21545454545454545, |
| "grad_norm": 496517009899520.0, |
| "learning_rate": 8.898578113473176e-07, |
| "loss": 26.380712890625, |
| "step": 2370 |
| }, |
| { |
| "epoch": 0.21636363636363637, |
| "grad_norm": 200518936821760.0, |
| "learning_rate": 8.889621055982144e-07, |
| "loss": 26.421420288085937, |
| "step": 2380 |
| }, |
| { |
| "epoch": 0.21727272727272728, |
| "grad_norm": 296245033697280.0, |
| "learning_rate": 8.880632272048962e-07, |
| "loss": 26.7625, |
| "step": 2390 |
| }, |
| { |
| "epoch": 0.21818181818181817, |
| "grad_norm": 208807686832128.0, |
| "learning_rate": 8.871611834992379e-07, |
| "loss": 26.544375610351562, |
| "step": 2400 |
| }, |
| { |
| "epoch": 0.21818181818181817, |
| "eval_loss": 26.264915466308594, |
| "eval_runtime": 2.1775, |
| "eval_samples_per_second": 16.533, |
| "eval_steps_per_second": 0.919, |
| "step": 2400 |
| }, |
| { |
| "epoch": 0.2190909090909091, |
| "grad_norm": 97186075377664.0, |
| "learning_rate": 8.862559818389321e-07, |
| "loss": 26.632290649414063, |
| "step": 2410 |
| }, |
| { |
| "epoch": 0.22, |
| "grad_norm": 95127074766848.0, |
| "learning_rate": 8.853476296074305e-07, |
| "loss": 26.469677734375, |
| "step": 2420 |
| }, |
| { |
| "epoch": 0.22090909090909092, |
| "grad_norm": 169245870653440.0, |
| "learning_rate": 8.844361342138827e-07, |
| "loss": 26.505831909179687, |
| "step": 2430 |
| }, |
| { |
| "epoch": 0.22181818181818183, |
| "grad_norm": 80585565405184.0, |
| "learning_rate": 8.835215030930761e-07, |
| "loss": 26.473162841796874, |
| "step": 2440 |
| }, |
| { |
| "epoch": 0.22272727272727272, |
| "grad_norm": 153268575535104.0, |
| "learning_rate": 8.82603743705375e-07, |
| "loss": 26.681747436523438, |
| "step": 2450 |
| }, |
| { |
| "epoch": 0.22363636363636363, |
| "grad_norm": 302406063620096.0, |
| "learning_rate": 8.81682863536661e-07, |
| "loss": 26.393963623046876, |
| "step": 2460 |
| }, |
| { |
| "epoch": 0.22454545454545455, |
| "grad_norm": 378542881767424.0, |
| "learning_rate": 8.807588700982699e-07, |
| "loss": 26.446267700195314, |
| "step": 2470 |
| }, |
| { |
| "epoch": 0.22545454545454546, |
| "grad_norm": 74014231887872.0, |
| "learning_rate": 8.798317709269318e-07, |
| "loss": 26.500537109375, |
| "step": 2480 |
| }, |
| { |
| "epoch": 0.22636363636363635, |
| "grad_norm": 137670193840128.0, |
| "learning_rate": 8.789015735847098e-07, |
| "loss": 26.38458251953125, |
| "step": 2490 |
| }, |
| { |
| "epoch": 0.22727272727272727, |
| "grad_norm": 73747843252224.0, |
| "learning_rate": 8.779682856589367e-07, |
| "loss": 26.658016967773438, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.22727272727272727, |
| "eval_loss": 26.27655601501465, |
| "eval_runtime": 2.1255, |
| "eval_samples_per_second": 16.937, |
| "eval_steps_per_second": 0.941, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.22818181818181818, |
| "grad_norm": 169870687731712.0, |
| "learning_rate": 8.770319147621557e-07, |
| "loss": 26.00334777832031, |
| "step": 2510 |
| }, |
| { |
| "epoch": 0.2290909090909091, |
| "grad_norm": 220424013086720.0, |
| "learning_rate": 8.760924685320557e-07, |
| "loss": 26.501443481445314, |
| "step": 2520 |
| }, |
| { |
| "epoch": 0.23, |
| "grad_norm": 249421635780608.0, |
| "learning_rate": 8.751499546314105e-07, |
| "loss": 27.010458374023436, |
| "step": 2530 |
| }, |
| { |
| "epoch": 0.2309090909090909, |
| "grad_norm": 613644459048960.0, |
| "learning_rate": 8.742043807480162e-07, |
| "loss": 26.20653381347656, |
| "step": 2540 |
| }, |
| { |
| "epoch": 0.2318181818181818, |
| "grad_norm": 122649023873024.0, |
| "learning_rate": 8.732557545946278e-07, |
| "loss": 26.27606201171875, |
| "step": 2550 |
| }, |
| { |
| "epoch": 0.23272727272727273, |
| "grad_norm": 194680549539840.0, |
| "learning_rate": 8.723040839088969e-07, |
| "loss": 26.106411743164063, |
| "step": 2560 |
| }, |
| { |
| "epoch": 0.23363636363636364, |
| "grad_norm": 162525438017536.0, |
| "learning_rate": 8.713493764533088e-07, |
| "loss": 26.558633422851564, |
| "step": 2570 |
| }, |
| { |
| "epoch": 0.23454545454545456, |
| "grad_norm": 340285393469440.0, |
| "learning_rate": 8.703916400151183e-07, |
| "loss": 26.410125732421875, |
| "step": 2580 |
| }, |
| { |
| "epoch": 0.23545454545454544, |
| "grad_norm": 283816975400960.0, |
| "learning_rate": 8.694308824062867e-07, |
| "loss": 26.62397155761719, |
| "step": 2590 |
| }, |
| { |
| "epoch": 0.23636363636363636, |
| "grad_norm": 173412811014144.0, |
| "learning_rate": 8.684671114634183e-07, |
| "loss": 26.37889404296875, |
| "step": 2600 |
| }, |
| { |
| "epoch": 0.23636363636363636, |
| "eval_loss": 26.274354934692383, |
| "eval_runtime": 2.1979, |
| "eval_samples_per_second": 16.379, |
| "eval_steps_per_second": 0.91, |
| "step": 2600 |
| }, |
| { |
| "epoch": 0.23727272727272727, |
| "grad_norm": 403591802126336.0, |
| "learning_rate": 8.675003350476961e-07, |
| "loss": 26.8667724609375, |
| "step": 2610 |
| }, |
| { |
| "epoch": 0.2381818181818182, |
| "grad_norm": 410402512961536.0, |
| "learning_rate": 8.66530561044818e-07, |
| "loss": 26.452142333984376, |
| "step": 2620 |
| }, |
| { |
| "epoch": 0.2390909090909091, |
| "grad_norm": 256499339231232.0, |
| "learning_rate": 8.655577973649321e-07, |
| "loss": 26.704440307617187, |
| "step": 2630 |
| }, |
| { |
| "epoch": 0.24, |
| "grad_norm": 154109130833920.0, |
| "learning_rate": 8.645820519425722e-07, |
| "loss": 26.33248291015625, |
| "step": 2640 |
| }, |
| { |
| "epoch": 0.2409090909090909, |
| "grad_norm": 151869708042240.0, |
| "learning_rate": 8.636033327365937e-07, |
| "loss": 26.74834289550781, |
| "step": 2650 |
| }, |
| { |
| "epoch": 0.24181818181818182, |
| "grad_norm": 178563550543872.0, |
| "learning_rate": 8.626216477301081e-07, |
| "loss": 26.612823486328125, |
| "step": 2660 |
| }, |
| { |
| "epoch": 0.24272727272727274, |
| "grad_norm": 589687735451648.0, |
| "learning_rate": 8.616370049304175e-07, |
| "loss": 26.485858154296874, |
| "step": 2670 |
| }, |
| { |
| "epoch": 0.24363636363636362, |
| "grad_norm": 126366955601920.0, |
| "learning_rate": 8.606494123689508e-07, |
| "loss": 26.799853515625, |
| "step": 2680 |
| }, |
| { |
| "epoch": 0.24454545454545454, |
| "grad_norm": 293970680741888.0, |
| "learning_rate": 8.596588781011963e-07, |
| "loss": 26.99022216796875, |
| "step": 2690 |
| }, |
| { |
| "epoch": 0.24545454545454545, |
| "grad_norm": 325949295951872.0, |
| "learning_rate": 8.586654102066374e-07, |
| "loss": 26.54841003417969, |
| "step": 2700 |
| }, |
| { |
| "epoch": 0.24545454545454545, |
| "eval_loss": 26.278873443603516, |
| "eval_runtime": 2.1755, |
| "eval_samples_per_second": 16.548, |
| "eval_steps_per_second": 0.919, |
| "step": 2700 |
| }, |
| { |
| "epoch": 0.24636363636363637, |
| "grad_norm": 201556976730112.0, |
| "learning_rate": 8.576690167886859e-07, |
| "loss": 27.091287231445314, |
| "step": 2710 |
| }, |
| { |
| "epoch": 0.24727272727272728, |
| "grad_norm": 215123755008000.0, |
| "learning_rate": 8.566697059746166e-07, |
| "loss": 26.405868530273438, |
| "step": 2720 |
| }, |
| { |
| "epoch": 0.24818181818181817, |
| "grad_norm": 61814981263360.0, |
| "learning_rate": 8.556674859155e-07, |
| "loss": 26.49742431640625, |
| "step": 2730 |
| }, |
| { |
| "epoch": 0.24909090909090909, |
| "grad_norm": 541660068970496.0, |
| "learning_rate": 8.546623647861369e-07, |
| "loss": 26.604754638671874, |
| "step": 2740 |
| }, |
| { |
| "epoch": 0.25, |
| "grad_norm": 245383997423616.0, |
| "learning_rate": 8.536543507849911e-07, |
| "loss": 26.275985717773438, |
| "step": 2750 |
| }, |
| { |
| "epoch": 0.2509090909090909, |
| "grad_norm": 257058859384832.0, |
| "learning_rate": 8.526434521341226e-07, |
| "loss": 26.059185791015626, |
| "step": 2760 |
| }, |
| { |
| "epoch": 0.25181818181818183, |
| "grad_norm": 105797333811200.0, |
| "learning_rate": 8.516296770791207e-07, |
| "loss": 26.59859619140625, |
| "step": 2770 |
| }, |
| { |
| "epoch": 0.25272727272727274, |
| "grad_norm": 389504846266368.0, |
| "learning_rate": 8.506130338890365e-07, |
| "loss": 26.815679931640624, |
| "step": 2780 |
| }, |
| { |
| "epoch": 0.25363636363636366, |
| "grad_norm": 743835453882368.0, |
| "learning_rate": 8.495935308563158e-07, |
| "loss": 26.77921142578125, |
| "step": 2790 |
| }, |
| { |
| "epoch": 0.2545454545454545, |
| "grad_norm": 407944348827648.0, |
| "learning_rate": 8.485711762967312e-07, |
| "loss": 26.425018310546875, |
| "step": 2800 |
| }, |
| { |
| "epoch": 0.2545454545454545, |
| "eval_loss": 26.285329818725586, |
| "eval_runtime": 2.1772, |
| "eval_samples_per_second": 16.535, |
| "eval_steps_per_second": 0.919, |
| "step": 2800 |
| }, |
| { |
| "epoch": 0.25545454545454543, |
| "grad_norm": 130364764848128.0, |
| "learning_rate": 8.47545978549314e-07, |
| "loss": 26.41048583984375, |
| "step": 2810 |
| }, |
| { |
| "epoch": 0.25636363636363635, |
| "grad_norm": 298329401458688.0, |
| "learning_rate": 8.46517945976287e-07, |
| "loss": 26.619390869140624, |
| "step": 2820 |
| }, |
| { |
| "epoch": 0.25727272727272726, |
| "grad_norm": 339704666914816.0, |
| "learning_rate": 8.454870869629955e-07, |
| "loss": 26.60906982421875, |
| "step": 2830 |
| }, |
| { |
| "epoch": 0.2581818181818182, |
| "grad_norm": 271155025936384.0, |
| "learning_rate": 8.444534099178393e-07, |
| "loss": 26.500982666015624, |
| "step": 2840 |
| }, |
| { |
| "epoch": 0.2590909090909091, |
| "grad_norm": 186096268869632.0, |
| "learning_rate": 8.434169232722041e-07, |
| "loss": 26.400274658203124, |
| "step": 2850 |
| }, |
| { |
| "epoch": 0.26, |
| "grad_norm": 317373085122560.0, |
| "learning_rate": 8.423776354803925e-07, |
| "loss": 26.17232666015625, |
| "step": 2860 |
| }, |
| { |
| "epoch": 0.2609090909090909, |
| "grad_norm": 180556801245184.0, |
| "learning_rate": 8.41335555019555e-07, |
| "loss": 26.4723388671875, |
| "step": 2870 |
| }, |
| { |
| "epoch": 0.26181818181818184, |
| "grad_norm": 422898518982656.0, |
| "learning_rate": 8.402906903896216e-07, |
| "loss": 26.127191162109376, |
| "step": 2880 |
| }, |
| { |
| "epoch": 0.26272727272727275, |
| "grad_norm": 120484511350784.0, |
| "learning_rate": 8.392430501132316e-07, |
| "loss": 26.270956420898436, |
| "step": 2890 |
| }, |
| { |
| "epoch": 0.2636363636363636, |
| "grad_norm": 377708114608128.0, |
| "learning_rate": 8.381926427356642e-07, |
| "loss": 26.302716064453126, |
| "step": 2900 |
| }, |
| { |
| "epoch": 0.2636363636363636, |
| "eval_loss": 26.290285110473633, |
| "eval_runtime": 2.1968, |
| "eval_samples_per_second": 16.387, |
| "eval_steps_per_second": 0.91, |
| "step": 2900 |
| }, |
| { |
| "epoch": 0.26454545454545453, |
| "grad_norm": 66593149157376.0, |
| "learning_rate": 8.37139476824769e-07, |
| "loss": 26.445266723632812, |
| "step": 2910 |
| }, |
| { |
| "epoch": 0.26545454545454544, |
| "grad_norm": 244639290359808.0, |
| "learning_rate": 8.360835609708967e-07, |
| "loss": 26.76466064453125, |
| "step": 2920 |
| }, |
| { |
| "epoch": 0.26636363636363636, |
| "grad_norm": 69483725062144.0, |
| "learning_rate": 8.35024903786828e-07, |
| "loss": 26.618536376953124, |
| "step": 2930 |
| }, |
| { |
| "epoch": 0.2672727272727273, |
| "grad_norm": 64039967260672.0, |
| "learning_rate": 8.339635139077035e-07, |
| "loss": 26.7822509765625, |
| "step": 2940 |
| }, |
| { |
| "epoch": 0.2681818181818182, |
| "grad_norm": 50360261541888.0, |
| "learning_rate": 8.32899399990954e-07, |
| "loss": 26.592672729492186, |
| "step": 2950 |
| }, |
| { |
| "epoch": 0.2690909090909091, |
| "grad_norm": 132060790390784.0, |
| "learning_rate": 8.318325707162293e-07, |
| "loss": 26.633670043945312, |
| "step": 2960 |
| }, |
| { |
| "epoch": 0.27, |
| "grad_norm": 218504011710464.0, |
| "learning_rate": 8.307630347853273e-07, |
| "loss": 26.65269775390625, |
| "step": 2970 |
| }, |
| { |
| "epoch": 0.27090909090909093, |
| "grad_norm": 507351366893568.0, |
| "learning_rate": 8.296908009221242e-07, |
| "loss": 26.866940307617188, |
| "step": 2980 |
| }, |
| { |
| "epoch": 0.2718181818181818, |
| "grad_norm": 135992195416064.0, |
| "learning_rate": 8.286158778725011e-07, |
| "loss": 26.601791381835938, |
| "step": 2990 |
| }, |
| { |
| "epoch": 0.2727272727272727, |
| "grad_norm": 107224361861120.0, |
| "learning_rate": 8.275382744042747e-07, |
| "loss": 26.53394775390625, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.2727272727272727, |
| "eval_loss": 26.28925895690918, |
| "eval_runtime": 2.1694, |
| "eval_samples_per_second": 16.594, |
| "eval_steps_per_second": 0.922, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.2736363636363636, |
| "grad_norm": 250829109985280.0, |
| "learning_rate": 8.26457999307125e-07, |
| "loss": 26.413397216796874, |
| "step": 3010 |
| }, |
| { |
| "epoch": 0.27454545454545454, |
| "grad_norm": 200123464286208.0, |
| "learning_rate": 8.253750613925234e-07, |
| "loss": 26.551190185546876, |
| "step": 3020 |
| }, |
| { |
| "epoch": 0.27545454545454545, |
| "grad_norm": 155917513392128.0, |
| "learning_rate": 8.242894694936614e-07, |
| "loss": 26.570632934570312, |
| "step": 3030 |
| }, |
| { |
| "epoch": 0.27636363636363637, |
| "grad_norm": 310338935324672.0, |
| "learning_rate": 8.23201232465378e-07, |
| "loss": 26.380291748046876, |
| "step": 3040 |
| }, |
| { |
| "epoch": 0.2772727272727273, |
| "grad_norm": 451766000812032.0, |
| "learning_rate": 8.221103591840881e-07, |
| "loss": 26.767218017578124, |
| "step": 3050 |
| }, |
| { |
| "epoch": 0.2781818181818182, |
| "grad_norm": 670432516636672.0, |
| "learning_rate": 8.210168585477091e-07, |
| "loss": 26.689630126953126, |
| "step": 3060 |
| }, |
| { |
| "epoch": 0.2790909090909091, |
| "grad_norm": 780793781682176.0, |
| "learning_rate": 8.199207394755891e-07, |
| "loss": 26.209368896484374, |
| "step": 3070 |
| }, |
| { |
| "epoch": 0.28, |
| "grad_norm": 277071863480320.0, |
| "learning_rate": 8.188220109084346e-07, |
| "loss": 26.90129699707031, |
| "step": 3080 |
| }, |
| { |
| "epoch": 0.2809090909090909, |
| "grad_norm": 155063083335680.0, |
| "learning_rate": 8.17720681808236e-07, |
| "loss": 26.374737548828126, |
| "step": 3090 |
| }, |
| { |
| "epoch": 0.2818181818181818, |
| "grad_norm": 81363449413632.0, |
| "learning_rate": 8.16616761158196e-07, |
| "loss": 26.9926025390625, |
| "step": 3100 |
| }, |
| { |
| "epoch": 0.2818181818181818, |
| "eval_loss": 26.293399810791016, |
| "eval_runtime": 2.1716, |
| "eval_samples_per_second": 16.578, |
| "eval_steps_per_second": 0.921, |
| "step": 3100 |
| }, |
| { |
| "epoch": 0.2827272727272727, |
| "grad_norm": 400066036629504.0, |
| "learning_rate": 8.155102579626558e-07, |
| "loss": 26.3140869140625, |
| "step": 3110 |
| }, |
| { |
| "epoch": 0.28363636363636363, |
| "grad_norm": 601325620428800.0, |
| "learning_rate": 8.144011812470215e-07, |
| "loss": 26.391494750976562, |
| "step": 3120 |
| }, |
| { |
| "epoch": 0.28454545454545455, |
| "grad_norm": 109938688917504.0, |
| "learning_rate": 8.132895400576904e-07, |
| "loss": 26.92082824707031, |
| "step": 3130 |
| }, |
| { |
| "epoch": 0.28545454545454546, |
| "grad_norm": 266716630220800.0, |
| "learning_rate": 8.121753434619778e-07, |
| "loss": 26.403421020507814, |
| "step": 3140 |
| }, |
| { |
| "epoch": 0.2863636363636364, |
| "grad_norm": 200120947703808.0, |
| "learning_rate": 8.110586005480426e-07, |
| "loss": 26.437249755859376, |
| "step": 3150 |
| }, |
| { |
| "epoch": 0.2872727272727273, |
| "grad_norm": 313903590408192.0, |
| "learning_rate": 8.09939320424813e-07, |
| "loss": 26.701492309570312, |
| "step": 3160 |
| }, |
| { |
| "epoch": 0.2881818181818182, |
| "grad_norm": 274488625201152.0, |
| "learning_rate": 8.088175122219127e-07, |
| "loss": 26.449929809570314, |
| "step": 3170 |
| }, |
| { |
| "epoch": 0.28909090909090907, |
| "grad_norm": 311552834011136.0, |
| "learning_rate": 8.076931850895858e-07, |
| "loss": 26.431442260742188, |
| "step": 3180 |
| }, |
| { |
| "epoch": 0.29, |
| "grad_norm": 113313451081728.0, |
| "learning_rate": 8.065663481986229e-07, |
| "loss": 26.6109375, |
| "step": 3190 |
| }, |
| { |
| "epoch": 0.2909090909090909, |
| "grad_norm": 60781395705856.0, |
| "learning_rate": 8.054370107402858e-07, |
| "loss": 26.43651123046875, |
| "step": 3200 |
| }, |
| { |
| "epoch": 0.2909090909090909, |
| "eval_loss": 26.294445037841797, |
| "eval_runtime": 2.1783, |
| "eval_samples_per_second": 16.527, |
| "eval_steps_per_second": 0.918, |
| "step": 3200 |
| }, |
| { |
| "epoch": 0.2918181818181818, |
| "grad_norm": 314161556881408.0, |
| "learning_rate": 8.043051819262327e-07, |
| "loss": 26.8575927734375, |
| "step": 3210 |
| }, |
| { |
| "epoch": 0.2927272727272727, |
| "grad_norm": 182461468246016.0, |
| "learning_rate": 8.031708709884429e-07, |
| "loss": 26.727423095703124, |
| "step": 3220 |
| }, |
| { |
| "epoch": 0.29363636363636364, |
| "grad_norm": 379359831523328.0, |
| "learning_rate": 8.020340871791417e-07, |
| "loss": 26.894467163085938, |
| "step": 3230 |
| }, |
| { |
| "epoch": 0.29454545454545455, |
| "grad_norm": 188435230883840.0, |
| "learning_rate": 8.008948397707252e-07, |
| "loss": 26.7364501953125, |
| "step": 3240 |
| }, |
| { |
| "epoch": 0.29545454545454547, |
| "grad_norm": 217839180972032.0, |
| "learning_rate": 7.997531380556833e-07, |
| "loss": 27.044821166992186, |
| "step": 3250 |
| }, |
| { |
| "epoch": 0.2963636363636364, |
| "grad_norm": 439279960457216.0, |
| "learning_rate": 7.986089913465261e-07, |
| "loss": 27.168972778320313, |
| "step": 3260 |
| }, |
| { |
| "epoch": 0.2972727272727273, |
| "grad_norm": 511028429324288.0, |
| "learning_rate": 7.974624089757064e-07, |
| "loss": 26.454971313476562, |
| "step": 3270 |
| }, |
| { |
| "epoch": 0.29818181818181816, |
| "grad_norm": 207939264577536.0, |
| "learning_rate": 7.963134002955431e-07, |
| "loss": 26.525775146484374, |
| "step": 3280 |
| }, |
| { |
| "epoch": 0.2990909090909091, |
| "grad_norm": 208529084383232.0, |
| "learning_rate": 7.951619746781472e-07, |
| "loss": 26.71766052246094, |
| "step": 3290 |
| }, |
| { |
| "epoch": 0.3, |
| "grad_norm": 206016511737856.0, |
| "learning_rate": 7.940081415153428e-07, |
| "loss": 26.513632202148436, |
| "step": 3300 |
| }, |
| { |
| "epoch": 0.3, |
| "eval_loss": 26.295894622802734, |
| "eval_runtime": 2.1954, |
| "eval_samples_per_second": 16.398, |
| "eval_steps_per_second": 0.911, |
| "step": 3300 |
| }, |
| { |
| "epoch": 0.3009090909090909, |
| "grad_norm": 332793997426688.0, |
| "learning_rate": 7.928519102185922e-07, |
| "loss": 26.628378295898436, |
| "step": 3310 |
| }, |
| { |
| "epoch": 0.3018181818181818, |
| "grad_norm": 154984314306560.0, |
| "learning_rate": 7.91693290218918e-07, |
| "loss": 26.92239990234375, |
| "step": 3320 |
| }, |
| { |
| "epoch": 0.30272727272727273, |
| "grad_norm": 476788446724096.0, |
| "learning_rate": 7.905322909668272e-07, |
| "loss": 26.61595458984375, |
| "step": 3330 |
| }, |
| { |
| "epoch": 0.30363636363636365, |
| "grad_norm": 133899782979584.0, |
| "learning_rate": 7.893689219322336e-07, |
| "loss": 26.795391845703126, |
| "step": 3340 |
| }, |
| { |
| "epoch": 0.30454545454545456, |
| "grad_norm": 344084459814912.0, |
| "learning_rate": 7.882031926043803e-07, |
| "loss": 26.53829345703125, |
| "step": 3350 |
| }, |
| { |
| "epoch": 0.3054545454545455, |
| "grad_norm": 311329596375040.0, |
| "learning_rate": 7.870351124917629e-07, |
| "loss": 26.523876953125, |
| "step": 3360 |
| }, |
| { |
| "epoch": 0.30636363636363634, |
| "grad_norm": 250105961644032.0, |
| "learning_rate": 7.858646911220512e-07, |
| "loss": 26.561294555664062, |
| "step": 3370 |
| }, |
| { |
| "epoch": 0.30727272727272725, |
| "grad_norm": 437876244348928.0, |
| "learning_rate": 7.846919380420125e-07, |
| "loss": 26.296853637695314, |
| "step": 3380 |
| }, |
| { |
| "epoch": 0.30818181818181817, |
| "grad_norm": 95527110705152.0, |
| "learning_rate": 7.835168628174325e-07, |
| "loss": 26.440118408203126, |
| "step": 3390 |
| }, |
| { |
| "epoch": 0.3090909090909091, |
| "grad_norm": 430297875218432.0, |
| "learning_rate": 7.823394750330386e-07, |
| "loss": 26.513848876953126, |
| "step": 3400 |
| }, |
| { |
| "epoch": 0.3090909090909091, |
| "eval_loss": 26.305095672607422, |
| "eval_runtime": 2.2077, |
| "eval_samples_per_second": 16.306, |
| "eval_steps_per_second": 0.906, |
| "step": 3400 |
| }, |
| { |
| "epoch": 0.31, |
| "grad_norm": 275231235112960.0, |
| "learning_rate": 7.811597842924203e-07, |
| "loss": 26.568258666992186, |
| "step": 3410 |
| }, |
| { |
| "epoch": 0.3109090909090909, |
| "grad_norm": 61766851624960.0, |
| "learning_rate": 7.799778002179523e-07, |
| "loss": 26.591436767578124, |
| "step": 3420 |
| }, |
| { |
| "epoch": 0.3118181818181818, |
| "grad_norm": 171613068722176.0, |
| "learning_rate": 7.787935324507149e-07, |
| "loss": 26.577957153320312, |
| "step": 3430 |
| }, |
| { |
| "epoch": 0.31272727272727274, |
| "grad_norm": 98493926473728.0, |
| "learning_rate": 7.776069906504159e-07, |
| "loss": 26.6580810546875, |
| "step": 3440 |
| }, |
| { |
| "epoch": 0.31363636363636366, |
| "grad_norm": 210570502471680.0, |
| "learning_rate": 7.764181844953116e-07, |
| "loss": 26.625430297851562, |
| "step": 3450 |
| }, |
| { |
| "epoch": 0.3145454545454546, |
| "grad_norm": 607846186090496.0, |
| "learning_rate": 7.752271236821282e-07, |
| "loss": 26.528323364257812, |
| "step": 3460 |
| }, |
| { |
| "epoch": 0.31545454545454543, |
| "grad_norm": 99906945548288.0, |
| "learning_rate": 7.74033817925982e-07, |
| "loss": 26.469485473632812, |
| "step": 3470 |
| }, |
| { |
| "epoch": 0.31636363636363635, |
| "grad_norm": 427087051620352.0, |
| "learning_rate": 7.728382769603011e-07, |
| "loss": 26.360140991210937, |
| "step": 3480 |
| }, |
| { |
| "epoch": 0.31727272727272726, |
| "grad_norm": 381776925032448.0, |
| "learning_rate": 7.716405105367452e-07, |
| "loss": 26.503359985351562, |
| "step": 3490 |
| }, |
| { |
| "epoch": 0.3181818181818182, |
| "grad_norm": 182264772165632.0, |
| "learning_rate": 7.704405284251267e-07, |
| "loss": 26.577252197265626, |
| "step": 3500 |
| }, |
| { |
| "epoch": 0.3181818181818182, |
| "eval_loss": 26.30978012084961, |
| "eval_runtime": 2.1792, |
| "eval_samples_per_second": 16.52, |
| "eval_steps_per_second": 0.918, |
| "step": 3500 |
| }, |
| { |
| "epoch": 0.3190909090909091, |
| "grad_norm": 670108246605824.0, |
| "learning_rate": 7.6923834041333e-07, |
| "loss": 26.706155395507814, |
| "step": 3510 |
| }, |
| { |
| "epoch": 0.32, |
| "grad_norm": 238060792971264.0, |
| "learning_rate": 7.680339563072333e-07, |
| "loss": 26.262576293945312, |
| "step": 3520 |
| }, |
| { |
| "epoch": 0.3209090909090909, |
| "grad_norm": 155890619514880.0, |
| "learning_rate": 7.668273859306269e-07, |
| "loss": 26.701010131835936, |
| "step": 3530 |
| }, |
| { |
| "epoch": 0.32181818181818184, |
| "grad_norm": 474780650176512.0, |
| "learning_rate": 7.656186391251341e-07, |
| "loss": 26.277096557617188, |
| "step": 3540 |
| }, |
| { |
| "epoch": 0.32272727272727275, |
| "grad_norm": 259750327484416.0, |
| "learning_rate": 7.644077257501308e-07, |
| "loss": 26.416009521484376, |
| "step": 3550 |
| }, |
| { |
| "epoch": 0.3236363636363636, |
| "grad_norm": 122697400975360.0, |
| "learning_rate": 7.631946556826647e-07, |
| "loss": 26.900396728515624, |
| "step": 3560 |
| }, |
| { |
| "epoch": 0.3245454545454545, |
| "grad_norm": 161570713763840.0, |
| "learning_rate": 7.619794388173751e-07, |
| "loss": 26.507833862304686, |
| "step": 3570 |
| }, |
| { |
| "epoch": 0.32545454545454544, |
| "grad_norm": 156743237632000.0, |
| "learning_rate": 7.60762085066412e-07, |
| "loss": 26.481048583984375, |
| "step": 3580 |
| }, |
| { |
| "epoch": 0.32636363636363636, |
| "grad_norm": 90183047315456.0, |
| "learning_rate": 7.595426043593556e-07, |
| "loss": 26.5598388671875, |
| "step": 3590 |
| }, |
| { |
| "epoch": 0.32727272727272727, |
| "grad_norm": 211007414730752.0, |
| "learning_rate": 7.583210066431346e-07, |
| "loss": 26.310043334960938, |
| "step": 3600 |
| }, |
| { |
| "epoch": 0.32727272727272727, |
| "eval_loss": 26.316513061523438, |
| "eval_runtime": 2.2093, |
| "eval_samples_per_second": 16.295, |
| "eval_steps_per_second": 0.905, |
| "step": 3600 |
| }, |
| { |
| "epoch": 0.3281818181818182, |
| "grad_norm": 259587185836032.0, |
| "learning_rate": 7.570973018819458e-07, |
| "loss": 26.695498657226562, |
| "step": 3610 |
| }, |
| { |
| "epoch": 0.3290909090909091, |
| "grad_norm": 301688703418368.0, |
| "learning_rate": 7.558715000571725e-07, |
| "loss": 26.712783813476562, |
| "step": 3620 |
| }, |
| { |
| "epoch": 0.33, |
| "grad_norm": 193671836205056.0, |
| "learning_rate": 7.546436111673027e-07, |
| "loss": 26.51964111328125, |
| "step": 3630 |
| }, |
| { |
| "epoch": 0.33090909090909093, |
| "grad_norm": 293623694360576.0, |
| "learning_rate": 7.534136452278486e-07, |
| "loss": 26.735067749023436, |
| "step": 3640 |
| }, |
| { |
| "epoch": 0.33181818181818185, |
| "grad_norm": 455305724952576.0, |
| "learning_rate": 7.521816122712637e-07, |
| "loss": 26.550863647460936, |
| "step": 3650 |
| }, |
| { |
| "epoch": 0.3327272727272727, |
| "grad_norm": 272623686647808.0, |
| "learning_rate": 7.509475223468618e-07, |
| "loss": 26.944656372070312, |
| "step": 3660 |
| }, |
| { |
| "epoch": 0.3336363636363636, |
| "grad_norm": 197809852645376.0, |
| "learning_rate": 7.497113855207347e-07, |
| "loss": 26.390576171875, |
| "step": 3670 |
| }, |
| { |
| "epoch": 0.33454545454545453, |
| "grad_norm": 267426960769024.0, |
| "learning_rate": 7.4847321187567e-07, |
| "loss": 26.596539306640626, |
| "step": 3680 |
| }, |
| { |
| "epoch": 0.33545454545454545, |
| "grad_norm": 161433207701504.0, |
| "learning_rate": 7.472330115110696e-07, |
| "loss": 26.451763916015626, |
| "step": 3690 |
| }, |
| { |
| "epoch": 0.33636363636363636, |
| "grad_norm": 261230598029312.0, |
| "learning_rate": 7.459907945428657e-07, |
| "loss": 26.3410888671875, |
| "step": 3700 |
| }, |
| { |
| "epoch": 0.33636363636363636, |
| "eval_loss": 26.321983337402344, |
| "eval_runtime": 2.1793, |
| "eval_samples_per_second": 16.519, |
| "eval_steps_per_second": 0.918, |
| "step": 3700 |
| }, |
| { |
| "epoch": 0.3372727272727273, |
| "grad_norm": 670896171778048.0, |
| "learning_rate": 7.447465711034404e-07, |
| "loss": 26.800509643554687, |
| "step": 3710 |
| }, |
| { |
| "epoch": 0.3381818181818182, |
| "grad_norm": 534435933978624.0, |
| "learning_rate": 7.43500351341541e-07, |
| "loss": 27.05330810546875, |
| "step": 3720 |
| }, |
| { |
| "epoch": 0.3390909090909091, |
| "grad_norm": 334111713525760.0, |
| "learning_rate": 7.422521454221989e-07, |
| "loss": 26.48377685546875, |
| "step": 3730 |
| }, |
| { |
| "epoch": 0.34, |
| "grad_norm": 135815548108800.0, |
| "learning_rate": 7.410019635266459e-07, |
| "loss": 26.750677490234374, |
| "step": 3740 |
| }, |
| { |
| "epoch": 0.3409090909090909, |
| "grad_norm": 267236254154752.0, |
| "learning_rate": 7.397498158522306e-07, |
| "loss": 26.758636474609375, |
| "step": 3750 |
| }, |
| { |
| "epoch": 0.3418181818181818, |
| "grad_norm": 117738072702976.0, |
| "learning_rate": 7.384957126123365e-07, |
| "loss": 26.67991943359375, |
| "step": 3760 |
| }, |
| { |
| "epoch": 0.3427272727272727, |
| "grad_norm": 269764748378112.0, |
| "learning_rate": 7.37239664036298e-07, |
| "loss": 26.426092529296874, |
| "step": 3770 |
| }, |
| { |
| "epoch": 0.34363636363636363, |
| "grad_norm": 178870993027072.0, |
| "learning_rate": 7.359816803693166e-07, |
| "loss": 26.689065551757814, |
| "step": 3780 |
| }, |
| { |
| "epoch": 0.34454545454545454, |
| "grad_norm": 296793145344000.0, |
| "learning_rate": 7.347217718723783e-07, |
| "loss": 27.017453002929688, |
| "step": 3790 |
| }, |
| { |
| "epoch": 0.34545454545454546, |
| "grad_norm": 47316811644928.0, |
| "learning_rate": 7.334599488221689e-07, |
| "loss": 26.36324462890625, |
| "step": 3800 |
| }, |
| { |
| "epoch": 0.34545454545454546, |
| "eval_loss": 26.32639503479004, |
| "eval_runtime": 2.1885, |
| "eval_samples_per_second": 16.45, |
| "eval_steps_per_second": 0.914, |
| "step": 3800 |
| }, |
| { |
| "epoch": 0.3463636363636364, |
| "grad_norm": 320067808002048.0, |
| "learning_rate": 7.321962215109906e-07, |
| "loss": 26.5622314453125, |
| "step": 3810 |
| }, |
| { |
| "epoch": 0.3472727272727273, |
| "grad_norm": 124497076158464.0, |
| "learning_rate": 7.309306002466787e-07, |
| "loss": 26.740374755859374, |
| "step": 3820 |
| }, |
| { |
| "epoch": 0.3481818181818182, |
| "grad_norm": 295600755048448.0, |
| "learning_rate": 7.296630953525158e-07, |
| "loss": 26.549679565429688, |
| "step": 3830 |
| }, |
| { |
| "epoch": 0.3490909090909091, |
| "grad_norm": 140551093485568.0, |
| "learning_rate": 7.283937171671497e-07, |
| "loss": 26.60428466796875, |
| "step": 3840 |
| }, |
| { |
| "epoch": 0.35, |
| "grad_norm": 353319142817792.0, |
| "learning_rate": 7.271224760445079e-07, |
| "loss": 26.61092529296875, |
| "step": 3850 |
| }, |
| { |
| "epoch": 0.3509090909090909, |
| "grad_norm": 179919887794176.0, |
| "learning_rate": 7.258493823537124e-07, |
| "loss": 26.701296997070312, |
| "step": 3860 |
| }, |
| { |
| "epoch": 0.3518181818181818, |
| "grad_norm": 352014110294016.0, |
| "learning_rate": 7.245744464789973e-07, |
| "loss": 26.517135620117188, |
| "step": 3870 |
| }, |
| { |
| "epoch": 0.3527272727272727, |
| "grad_norm": 165838216757248.0, |
| "learning_rate": 7.232976788196221e-07, |
| "loss": 26.3676025390625, |
| "step": 3880 |
| }, |
| { |
| "epoch": 0.35363636363636364, |
| "grad_norm": 353833901359104.0, |
| "learning_rate": 7.220190897897877e-07, |
| "loss": 26.502365112304688, |
| "step": 3890 |
| }, |
| { |
| "epoch": 0.35454545454545455, |
| "grad_norm": 536120299356160.0, |
| "learning_rate": 7.207386898185515e-07, |
| "loss": 26.706195068359374, |
| "step": 3900 |
| }, |
| { |
| "epoch": 0.35454545454545455, |
| "eval_loss": 26.32856559753418, |
| "eval_runtime": 2.1679, |
| "eval_samples_per_second": 16.606, |
| "eval_steps_per_second": 0.923, |
| "step": 3900 |
| }, |
| { |
| "epoch": 0.35545454545454547, |
| "grad_norm": 86270919311360.0, |
| "learning_rate": 7.194564893497419e-07, |
| "loss": 26.648440551757812, |
| "step": 3910 |
| }, |
| { |
| "epoch": 0.3563636363636364, |
| "grad_norm": 95417899417600.0, |
| "learning_rate": 7.181724988418737e-07, |
| "loss": 26.289288330078126, |
| "step": 3920 |
| }, |
| { |
| "epoch": 0.3572727272727273, |
| "grad_norm": 209623965499392.0, |
| "learning_rate": 7.168867287680627e-07, |
| "loss": 26.40039978027344, |
| "step": 3930 |
| }, |
| { |
| "epoch": 0.35818181818181816, |
| "grad_norm": 221736897347584.0, |
| "learning_rate": 7.155991896159392e-07, |
| "loss": 26.791720581054687, |
| "step": 3940 |
| }, |
| { |
| "epoch": 0.35909090909090907, |
| "grad_norm": 303391758614528.0, |
| "learning_rate": 7.143098918875642e-07, |
| "loss": 26.92314758300781, |
| "step": 3950 |
| }, |
| { |
| "epoch": 0.36, |
| "grad_norm": 181569910210560.0, |
| "learning_rate": 7.130188460993426e-07, |
| "loss": 26.176397705078124, |
| "step": 3960 |
| }, |
| { |
| "epoch": 0.3609090909090909, |
| "grad_norm": 147941339693056.0, |
| "learning_rate": 7.117260627819376e-07, |
| "loss": 26.48076477050781, |
| "step": 3970 |
| }, |
| { |
| "epoch": 0.3618181818181818, |
| "grad_norm": 773203702054912.0, |
| "learning_rate": 7.104315524801848e-07, |
| "loss": 26.423046875, |
| "step": 3980 |
| }, |
| { |
| "epoch": 0.36272727272727273, |
| "grad_norm": 417831061553152.0, |
| "learning_rate": 7.091353257530068e-07, |
| "loss": 26.589743041992186, |
| "step": 3990 |
| }, |
| { |
| "epoch": 0.36363636363636365, |
| "grad_norm": 86275667263488.0, |
| "learning_rate": 7.078373931733258e-07, |
| "loss": 26.447421264648437, |
| "step": 4000 |
| }, |
| { |
| "epoch": 0.36363636363636365, |
| "eval_loss": 26.32493782043457, |
| "eval_runtime": 2.1966, |
| "eval_samples_per_second": 16.389, |
| "eval_steps_per_second": 0.911, |
| "step": 4000 |
| }, |
| { |
| "epoch": 0.36454545454545456, |
| "grad_norm": 526528664305664.0, |
| "learning_rate": 7.065377653279787e-07, |
| "loss": 26.51700439453125, |
| "step": 4010 |
| }, |
| { |
| "epoch": 0.3654545454545455, |
| "grad_norm": 177814212968448.0, |
| "learning_rate": 7.052364528176298e-07, |
| "loss": 26.30553283691406, |
| "step": 4020 |
| }, |
| { |
| "epoch": 0.3663636363636364, |
| "grad_norm": 95500158107648.0, |
| "learning_rate": 7.03933466256685e-07, |
| "loss": 26.378070068359374, |
| "step": 4030 |
| }, |
| { |
| "epoch": 0.36727272727272725, |
| "grad_norm": 316484127555584.0, |
| "learning_rate": 7.026288162732046e-07, |
| "loss": 26.92432556152344, |
| "step": 4040 |
| }, |
| { |
| "epoch": 0.36818181818181817, |
| "grad_norm": 296097897512960.0, |
| "learning_rate": 7.013225135088171e-07, |
| "loss": 26.409463500976564, |
| "step": 4050 |
| }, |
| { |
| "epoch": 0.3690909090909091, |
| "grad_norm": 146435114795008.0, |
| "learning_rate": 7.000145686186323e-07, |
| "loss": 26.875320434570312, |
| "step": 4060 |
| }, |
| { |
| "epoch": 0.37, |
| "grad_norm": 90155608178688.0, |
| "learning_rate": 6.987049922711543e-07, |
| "loss": 26.703628540039062, |
| "step": 4070 |
| }, |
| { |
| "epoch": 0.3709090909090909, |
| "grad_norm": 169079994318848.0, |
| "learning_rate": 6.973937951481943e-07, |
| "loss": 26.59369812011719, |
| "step": 4080 |
| }, |
| { |
| "epoch": 0.3718181818181818, |
| "grad_norm": 224013699776512.0, |
| "learning_rate": 6.960809879447838e-07, |
| "loss": 26.508026123046875, |
| "step": 4090 |
| }, |
| { |
| "epoch": 0.37272727272727274, |
| "grad_norm": 368716332138496.0, |
| "learning_rate": 6.947665813690871e-07, |
| "loss": 26.604330444335936, |
| "step": 4100 |
| }, |
| { |
| "epoch": 0.37272727272727274, |
| "eval_loss": 26.31926727294922, |
| "eval_runtime": 2.1723, |
| "eval_samples_per_second": 16.572, |
| "eval_steps_per_second": 0.921, |
| "step": 4100 |
| }, |
| { |
| "epoch": 0.37363636363636366, |
| "grad_norm": 416285577969664.0, |
| "learning_rate": 6.934505861423144e-07, |
| "loss": 26.69903564453125, |
| "step": 4110 |
| }, |
| { |
| "epoch": 0.37454545454545457, |
| "grad_norm": 192259412721664.0, |
| "learning_rate": 6.921330129986338e-07, |
| "loss": 26.503787231445312, |
| "step": 4120 |
| }, |
| { |
| "epoch": 0.37545454545454543, |
| "grad_norm": 605233705123840.0, |
| "learning_rate": 6.90813872685084e-07, |
| "loss": 26.778439331054688, |
| "step": 4130 |
| }, |
| { |
| "epoch": 0.37636363636363634, |
| "grad_norm": 265230370209792.0, |
| "learning_rate": 6.894931759614865e-07, |
| "loss": 27.23222961425781, |
| "step": 4140 |
| }, |
| { |
| "epoch": 0.37727272727272726, |
| "grad_norm": 423306272440320.0, |
| "learning_rate": 6.881709336003584e-07, |
| "loss": 26.96778564453125, |
| "step": 4150 |
| }, |
| { |
| "epoch": 0.3781818181818182, |
| "grad_norm": 343047359430656.0, |
| "learning_rate": 6.868471563868235e-07, |
| "loss": 26.680606079101562, |
| "step": 4160 |
| }, |
| { |
| "epoch": 0.3790909090909091, |
| "grad_norm": 266783386763264.0, |
| "learning_rate": 6.855218551185254e-07, |
| "loss": 26.349310302734374, |
| "step": 4170 |
| }, |
| { |
| "epoch": 0.38, |
| "grad_norm": 207645310976000.0, |
| "learning_rate": 6.841950406055389e-07, |
| "loss": 26.872479248046876, |
| "step": 4180 |
| }, |
| { |
| "epoch": 0.3809090909090909, |
| "grad_norm": 227184543268864.0, |
| "learning_rate": 6.828667236702815e-07, |
| "loss": 26.167431640625, |
| "step": 4190 |
| }, |
| { |
| "epoch": 0.38181818181818183, |
| "grad_norm": 332900432084992.0, |
| "learning_rate": 6.815369151474256e-07, |
| "loss": 26.787005615234374, |
| "step": 4200 |
| }, |
| { |
| "epoch": 0.38181818181818183, |
| "eval_loss": 26.321739196777344, |
| "eval_runtime": 2.1695, |
| "eval_samples_per_second": 16.594, |
| "eval_steps_per_second": 0.922, |
| "step": 4200 |
| }, |
| { |
| "epoch": 0.38272727272727275, |
| "grad_norm": 98059253972992.0, |
| "learning_rate": 6.802056258838104e-07, |
| "loss": 26.625421142578126, |
| "step": 4210 |
| }, |
| { |
| "epoch": 0.3836363636363636, |
| "grad_norm": 241705676701696.0, |
| "learning_rate": 6.788728667383528e-07, |
| "loss": 26.678131103515625, |
| "step": 4220 |
| }, |
| { |
| "epoch": 0.3845454545454545, |
| "grad_norm": 150195207667712.0, |
| "learning_rate": 6.775386485819589e-07, |
| "loss": 26.601348876953125, |
| "step": 4230 |
| }, |
| { |
| "epoch": 0.38545454545454544, |
| "grad_norm": 184757732245504.0, |
| "learning_rate": 6.762029822974359e-07, |
| "loss": 26.485671997070312, |
| "step": 4240 |
| }, |
| { |
| "epoch": 0.38636363636363635, |
| "grad_norm": 161859432873984.0, |
| "learning_rate": 6.748658787794025e-07, |
| "loss": 26.345684814453126, |
| "step": 4250 |
| }, |
| { |
| "epoch": 0.38727272727272727, |
| "grad_norm": 142884854562816.0, |
| "learning_rate": 6.735273489342008e-07, |
| "loss": 26.75887451171875, |
| "step": 4260 |
| }, |
| { |
| "epoch": 0.3881818181818182, |
| "grad_norm": 439033939361792.0, |
| "learning_rate": 6.721874036798068e-07, |
| "loss": 26.148809814453124, |
| "step": 4270 |
| }, |
| { |
| "epoch": 0.3890909090909091, |
| "grad_norm": 309939335593984.0, |
| "learning_rate": 6.708460539457417e-07, |
| "loss": 26.634625244140626, |
| "step": 4280 |
| }, |
| { |
| "epoch": 0.39, |
| "grad_norm": 120628896071680.0, |
| "learning_rate": 6.695033106729824e-07, |
| "loss": 26.592654418945312, |
| "step": 4290 |
| }, |
| { |
| "epoch": 0.39090909090909093, |
| "grad_norm": 194318715322368.0, |
| "learning_rate": 6.681591848138731e-07, |
| "loss": 26.4625732421875, |
| "step": 4300 |
| }, |
| { |
| "epoch": 0.39090909090909093, |
| "eval_loss": 26.325037002563477, |
| "eval_runtime": 2.1684, |
| "eval_samples_per_second": 16.602, |
| "eval_steps_per_second": 0.922, |
| "step": 4300 |
| }, |
| { |
| "epoch": 0.39181818181818184, |
| "grad_norm": 399684388519936.0, |
| "learning_rate": 6.668136873320344e-07, |
| "loss": 26.953164672851564, |
| "step": 4310 |
| }, |
| { |
| "epoch": 0.3927272727272727, |
| "grad_norm": 109830022889472.0, |
| "learning_rate": 6.654668292022754e-07, |
| "loss": 26.49449768066406, |
| "step": 4320 |
| }, |
| { |
| "epoch": 0.3936363636363636, |
| "grad_norm": 92155989196800.0, |
| "learning_rate": 6.641186214105033e-07, |
| "loss": 26.64600524902344, |
| "step": 4330 |
| }, |
| { |
| "epoch": 0.39454545454545453, |
| "grad_norm": 276388091265024.0, |
| "learning_rate": 6.627690749536346e-07, |
| "loss": 26.74027099609375, |
| "step": 4340 |
| }, |
| { |
| "epoch": 0.39545454545454545, |
| "grad_norm": 151451183611904.0, |
| "learning_rate": 6.614182008395042e-07, |
| "loss": 26.55115661621094, |
| "step": 4350 |
| }, |
| { |
| "epoch": 0.39636363636363636, |
| "grad_norm": 375987342671872.0, |
| "learning_rate": 6.600660100867765e-07, |
| "loss": 26.10811767578125, |
| "step": 4360 |
| }, |
| { |
| "epoch": 0.3972727272727273, |
| "grad_norm": 559519281184768.0, |
| "learning_rate": 6.587125137248558e-07, |
| "loss": 26.605978393554686, |
| "step": 4370 |
| }, |
| { |
| "epoch": 0.3981818181818182, |
| "grad_norm": 363120157523968.0, |
| "learning_rate": 6.573577227937951e-07, |
| "loss": 26.561282348632812, |
| "step": 4380 |
| }, |
| { |
| "epoch": 0.3990909090909091, |
| "grad_norm": 394054760136704.0, |
| "learning_rate": 6.560016483442075e-07, |
| "loss": 26.416183471679688, |
| "step": 4390 |
| }, |
| { |
| "epoch": 0.4, |
| "grad_norm": 291861650472960.0, |
| "learning_rate": 6.546443014371745e-07, |
| "loss": 26.458407592773437, |
| "step": 4400 |
| }, |
| { |
| "epoch": 0.4, |
| "eval_loss": 26.32141876220703, |
| "eval_runtime": 2.1831, |
| "eval_samples_per_second": 16.49, |
| "eval_steps_per_second": 0.916, |
| "step": 4400 |
| }, |
| { |
| "epoch": 0.4009090909090909, |
| "grad_norm": 84496426729472.0, |
| "learning_rate": 6.53285693144158e-07, |
| "loss": 26.468145751953124, |
| "step": 4410 |
| }, |
| { |
| "epoch": 0.4018181818181818, |
| "grad_norm": 190245425381376.0, |
| "learning_rate": 6.51925834546907e-07, |
| "loss": 26.321368408203124, |
| "step": 4420 |
| }, |
| { |
| "epoch": 0.4027272727272727, |
| "grad_norm": 88420181344256.0, |
| "learning_rate": 6.5056473673737e-07, |
| "loss": 26.454937744140626, |
| "step": 4430 |
| }, |
| { |
| "epoch": 0.4036363636363636, |
| "grad_norm": 332825404375040.0, |
| "learning_rate": 6.49202410817603e-07, |
| "loss": 26.5259521484375, |
| "step": 4440 |
| }, |
| { |
| "epoch": 0.40454545454545454, |
| "grad_norm": 497012105543680.0, |
| "learning_rate": 6.478388678996796e-07, |
| "loss": 26.6334228515625, |
| "step": 4450 |
| }, |
| { |
| "epoch": 0.40545454545454546, |
| "grad_norm": 96112023175168.0, |
| "learning_rate": 6.464741191055994e-07, |
| "loss": 26.60364990234375, |
| "step": 4460 |
| }, |
| { |
| "epoch": 0.40636363636363637, |
| "grad_norm": 149687059349504.0, |
| "learning_rate": 6.451081755671985e-07, |
| "loss": 26.84015808105469, |
| "step": 4470 |
| }, |
| { |
| "epoch": 0.4072727272727273, |
| "grad_norm": 78247802961920.0, |
| "learning_rate": 6.437410484260583e-07, |
| "loss": 26.285125732421875, |
| "step": 4480 |
| }, |
| { |
| "epoch": 0.4081818181818182, |
| "grad_norm": 593727554846720.0, |
| "learning_rate": 6.42372748833414e-07, |
| "loss": 26.160516357421876, |
| "step": 4490 |
| }, |
| { |
| "epoch": 0.4090909090909091, |
| "grad_norm": 153949931831296.0, |
| "learning_rate": 6.410032879500646e-07, |
| "loss": 26.74964294433594, |
| "step": 4500 |
| }, |
| { |
| "epoch": 0.4090909090909091, |
| "eval_loss": 26.31894874572754, |
| "eval_runtime": 2.1406, |
| "eval_samples_per_second": 16.818, |
| "eval_steps_per_second": 0.934, |
| "step": 4500 |
| }, |
| { |
| "epoch": 0.41, |
| "grad_norm": 232447153274880.0, |
| "learning_rate": 6.396326769462811e-07, |
| "loss": 26.883270263671875, |
| "step": 4510 |
| }, |
| { |
| "epoch": 0.4109090909090909, |
| "grad_norm": 298445030031360.0, |
| "learning_rate": 6.382609270017154e-07, |
| "loss": 26.760006713867188, |
| "step": 4520 |
| }, |
| { |
| "epoch": 0.4118181818181818, |
| "grad_norm": 72679117815808.0, |
| "learning_rate": 6.3688804930531e-07, |
| "loss": 26.37138671875, |
| "step": 4530 |
| }, |
| { |
| "epoch": 0.4127272727272727, |
| "grad_norm": 141969456103424.0, |
| "learning_rate": 6.355140550552058e-07, |
| "loss": 26.522723388671874, |
| "step": 4540 |
| }, |
| { |
| "epoch": 0.41363636363636364, |
| "grad_norm": 160081098309632.0, |
| "learning_rate": 6.341389554586511e-07, |
| "loss": 26.483316040039064, |
| "step": 4550 |
| }, |
| { |
| "epoch": 0.41454545454545455, |
| "grad_norm": 324477833445376.0, |
| "learning_rate": 6.327627617319103e-07, |
| "loss": 26.508364868164062, |
| "step": 4560 |
| }, |
| { |
| "epoch": 0.41545454545454547, |
| "grad_norm": 276562825969664.0, |
| "learning_rate": 6.313854851001721e-07, |
| "loss": 26.42707214355469, |
| "step": 4570 |
| }, |
| { |
| "epoch": 0.4163636363636364, |
| "grad_norm": 307064727404544.0, |
| "learning_rate": 6.300071367974582e-07, |
| "loss": 26.318887329101564, |
| "step": 4580 |
| }, |
| { |
| "epoch": 0.4172727272727273, |
| "grad_norm": 178794975461376.0, |
| "learning_rate": 6.286277280665315e-07, |
| "loss": 26.655364990234375, |
| "step": 4590 |
| }, |
| { |
| "epoch": 0.41818181818181815, |
| "grad_norm": 468974525480960.0, |
| "learning_rate": 6.27247270158805e-07, |
| "loss": 26.251632690429688, |
| "step": 4600 |
| }, |
| { |
| "epoch": 0.41818181818181815, |
| "eval_loss": 26.31459617614746, |
| "eval_runtime": 2.1711, |
| "eval_samples_per_second": 16.581, |
| "eval_steps_per_second": 0.921, |
| "step": 4600 |
| }, |
| { |
| "epoch": 0.41909090909090907, |
| "grad_norm": 406509628424192.0, |
| "learning_rate": 6.258657743342486e-07, |
| "loss": 26.561279296875, |
| "step": 4610 |
| }, |
| { |
| "epoch": 0.42, |
| "grad_norm": 152516016734208.0, |
| "learning_rate": 6.244832518612989e-07, |
| "loss": 26.661614990234376, |
| "step": 4620 |
| }, |
| { |
| "epoch": 0.4209090909090909, |
| "grad_norm": 334286095908864.0, |
| "learning_rate": 6.230997140167662e-07, |
| "loss": 26.73835144042969, |
| "step": 4630 |
| }, |
| { |
| "epoch": 0.4218181818181818, |
| "grad_norm": 109297497276416.0, |
| "learning_rate": 6.217151720857432e-07, |
| "loss": 26.554644775390624, |
| "step": 4640 |
| }, |
| { |
| "epoch": 0.42272727272727273, |
| "grad_norm": 251784824094720.0, |
| "learning_rate": 6.203296373615122e-07, |
| "loss": 26.43360290527344, |
| "step": 4650 |
| }, |
| { |
| "epoch": 0.42363636363636364, |
| "grad_norm": 213711767732224.0, |
| "learning_rate": 6.189431211454538e-07, |
| "loss": 26.469012451171874, |
| "step": 4660 |
| }, |
| { |
| "epoch": 0.42454545454545456, |
| "grad_norm": 119396852826112.0, |
| "learning_rate": 6.175556347469541e-07, |
| "loss": 26.383865356445312, |
| "step": 4670 |
| }, |
| { |
| "epoch": 0.4254545454545455, |
| "grad_norm": 115268542005248.0, |
| "learning_rate": 6.161671894833127e-07, |
| "loss": 26.740725708007812, |
| "step": 4680 |
| }, |
| { |
| "epoch": 0.4263636363636364, |
| "grad_norm": 311501025968128.0, |
| "learning_rate": 6.147777966796505e-07, |
| "loss": 26.425564575195313, |
| "step": 4690 |
| }, |
| { |
| "epoch": 0.42727272727272725, |
| "grad_norm": 115545743556608.0, |
| "learning_rate": 6.13387467668817e-07, |
| "loss": 26.428509521484376, |
| "step": 4700 |
| }, |
| { |
| "epoch": 0.42727272727272725, |
| "eval_loss": 26.31597137451172, |
| "eval_runtime": 2.1641, |
| "eval_samples_per_second": 16.635, |
| "eval_steps_per_second": 0.924, |
| "step": 4700 |
| }, |
| { |
| "epoch": 0.42818181818181816, |
| "grad_norm": 189478069075968.0, |
| "learning_rate": 6.119962137912979e-07, |
| "loss": 26.67225341796875, |
| "step": 4710 |
| }, |
| { |
| "epoch": 0.4290909090909091, |
| "grad_norm": 335568076537856.0, |
| "learning_rate": 6.106040463951236e-07, |
| "loss": 26.434231567382813, |
| "step": 4720 |
| }, |
| { |
| "epoch": 0.43, |
| "grad_norm": 208644343857152.0, |
| "learning_rate": 6.092109768357747e-07, |
| "loss": 26.637188720703126, |
| "step": 4730 |
| }, |
| { |
| "epoch": 0.4309090909090909, |
| "grad_norm": 264374128214016.0, |
| "learning_rate": 6.078170164760911e-07, |
| "loss": 26.46937255859375, |
| "step": 4740 |
| }, |
| { |
| "epoch": 0.4318181818181818, |
| "grad_norm": 281521348935680.0, |
| "learning_rate": 6.064221766861785e-07, |
| "loss": 26.524288940429688, |
| "step": 4750 |
| }, |
| { |
| "epoch": 0.43272727272727274, |
| "grad_norm": 224812597248000.0, |
| "learning_rate": 6.050264688433161e-07, |
| "loss": 26.77779541015625, |
| "step": 4760 |
| }, |
| { |
| "epoch": 0.43363636363636365, |
| "grad_norm": 225832148664320.0, |
| "learning_rate": 6.036299043318631e-07, |
| "loss": 26.691378784179687, |
| "step": 4770 |
| }, |
| { |
| "epoch": 0.43454545454545457, |
| "grad_norm": 72125075423232.0, |
| "learning_rate": 6.022324945431665e-07, |
| "loss": 26.35833740234375, |
| "step": 4780 |
| }, |
| { |
| "epoch": 0.4354545454545454, |
| "grad_norm": 279958349938688.0, |
| "learning_rate": 6.008342508754682e-07, |
| "loss": 26.597698974609376, |
| "step": 4790 |
| }, |
| { |
| "epoch": 0.43636363636363634, |
| "grad_norm": 307064257642496.0, |
| "learning_rate": 5.994351847338113e-07, |
| "loss": 26.659085083007813, |
| "step": 4800 |
| }, |
| { |
| "epoch": 0.43636363636363634, |
| "eval_loss": 26.316986083984375, |
| "eval_runtime": 2.1561, |
| "eval_samples_per_second": 16.696, |
| "eval_steps_per_second": 0.928, |
| "step": 4800 |
| }, |
| { |
| "epoch": 0.43727272727272726, |
| "grad_norm": 171293076881408.0, |
| "learning_rate": 5.980353075299481e-07, |
| "loss": 26.330426025390626, |
| "step": 4810 |
| }, |
| { |
| "epoch": 0.4381818181818182, |
| "grad_norm": 248409114017792.0, |
| "learning_rate": 5.966346306822458e-07, |
| "loss": 26.47012939453125, |
| "step": 4820 |
| }, |
| { |
| "epoch": 0.4390909090909091, |
| "grad_norm": 204697034031104.0, |
| "learning_rate": 5.95233165615595e-07, |
| "loss": 26.68152770996094, |
| "step": 4830 |
| }, |
| { |
| "epoch": 0.44, |
| "grad_norm": 130607472443392.0, |
| "learning_rate": 5.938309237613146e-07, |
| "loss": 26.43096923828125, |
| "step": 4840 |
| }, |
| { |
| "epoch": 0.4409090909090909, |
| "grad_norm": 296476022407168.0, |
| "learning_rate": 5.924279165570602e-07, |
| "loss": 26.51325378417969, |
| "step": 4850 |
| }, |
| { |
| "epoch": 0.44181818181818183, |
| "grad_norm": 46552391352320.0, |
| "learning_rate": 5.910241554467298e-07, |
| "loss": 26.71526184082031, |
| "step": 4860 |
| }, |
| { |
| "epoch": 0.44272727272727275, |
| "grad_norm": 97249417756672.0, |
| "learning_rate": 5.896196518803707e-07, |
| "loss": 26.19861755371094, |
| "step": 4870 |
| }, |
| { |
| "epoch": 0.44363636363636366, |
| "grad_norm": 90017338753024.0, |
| "learning_rate": 5.882144173140867e-07, |
| "loss": 26.474087524414063, |
| "step": 4880 |
| }, |
| { |
| "epoch": 0.4445454545454545, |
| "grad_norm": 518103079321600.0, |
| "learning_rate": 5.868084632099435e-07, |
| "loss": 26.318057250976562, |
| "step": 4890 |
| }, |
| { |
| "epoch": 0.44545454545454544, |
| "grad_norm": 329086534680576.0, |
| "learning_rate": 5.854018010358761e-07, |
| "loss": 26.530551147460937, |
| "step": 4900 |
| }, |
| { |
| "epoch": 0.44545454545454544, |
| "eval_loss": 26.317190170288086, |
| "eval_runtime": 2.1808, |
| "eval_samples_per_second": 16.508, |
| "eval_steps_per_second": 0.917, |
| "step": 4900 |
| }, |
| { |
| "epoch": 0.44636363636363635, |
| "grad_norm": 272803269967872.0, |
| "learning_rate": 5.839944422655952e-07, |
| "loss": 26.631591796875, |
| "step": 4910 |
| }, |
| { |
| "epoch": 0.44727272727272727, |
| "grad_norm": 622259425247232.0, |
| "learning_rate": 5.825863983784931e-07, |
| "loss": 26.726950073242186, |
| "step": 4920 |
| }, |
| { |
| "epoch": 0.4481818181818182, |
| "grad_norm": 186363479588864.0, |
| "learning_rate": 5.811776808595506e-07, |
| "loss": 26.2813720703125, |
| "step": 4930 |
| }, |
| { |
| "epoch": 0.4490909090909091, |
| "grad_norm": 155909409996800.0, |
| "learning_rate": 5.797683011992432e-07, |
| "loss": 26.543890380859374, |
| "step": 4940 |
| }, |
| { |
| "epoch": 0.45, |
| "grad_norm": 232914314854400.0, |
| "learning_rate": 5.783582708934468e-07, |
| "loss": 26.611404418945312, |
| "step": 4950 |
| }, |
| { |
| "epoch": 0.4509090909090909, |
| "grad_norm": 231428809818112.0, |
| "learning_rate": 5.769476014433451e-07, |
| "loss": 26.66617431640625, |
| "step": 4960 |
| }, |
| { |
| "epoch": 0.45181818181818184, |
| "grad_norm": 342491630927872.0, |
| "learning_rate": 5.755363043553346e-07, |
| "loss": 26.529336547851564, |
| "step": 4970 |
| }, |
| { |
| "epoch": 0.4527272727272727, |
| "grad_norm": 133048012111872.0, |
| "learning_rate": 5.741243911409314e-07, |
| "loss": 26.72532958984375, |
| "step": 4980 |
| }, |
| { |
| "epoch": 0.4536363636363636, |
| "grad_norm": 286773523513344.0, |
| "learning_rate": 5.72711873316677e-07, |
| "loss": 26.638458251953125, |
| "step": 4990 |
| }, |
| { |
| "epoch": 0.45454545454545453, |
| "grad_norm": 273551349252096.0, |
| "learning_rate": 5.712987624040451e-07, |
| "loss": 26.445010375976562, |
| "step": 5000 |
| }, |
| { |
| "epoch": 0.45454545454545453, |
| "eval_loss": 26.315853118896484, |
| "eval_runtime": 2.1781, |
| "eval_samples_per_second": 16.528, |
| "eval_steps_per_second": 0.918, |
| "step": 5000 |
| }, |
| { |
| "epoch": 0.45545454545454545, |
| "grad_norm": 80346641072128.0, |
| "learning_rate": 5.69885069929346e-07, |
| "loss": 26.32060546875, |
| "step": 5010 |
| }, |
| { |
| "epoch": 0.45636363636363636, |
| "grad_norm": 422829933723648.0, |
| "learning_rate": 5.684708074236349e-07, |
| "loss": 26.738665771484374, |
| "step": 5020 |
| }, |
| { |
| "epoch": 0.4572727272727273, |
| "grad_norm": 424351761432576.0, |
| "learning_rate": 5.670559864226153e-07, |
| "loss": 26.33757629394531, |
| "step": 5030 |
| }, |
| { |
| "epoch": 0.4581818181818182, |
| "grad_norm": 121131155587072.0, |
| "learning_rate": 5.656406184665472e-07, |
| "loss": 26.6727783203125, |
| "step": 5040 |
| }, |
| { |
| "epoch": 0.4590909090909091, |
| "grad_norm": 118593920434176.0, |
| "learning_rate": 5.642247151001515e-07, |
| "loss": 26.53905029296875, |
| "step": 5050 |
| }, |
| { |
| "epoch": 0.46, |
| "grad_norm": 74622355636224.0, |
| "learning_rate": 5.628082878725159e-07, |
| "loss": 26.59415283203125, |
| "step": 5060 |
| }, |
| { |
| "epoch": 0.46090909090909093, |
| "grad_norm": 131786524852224.0, |
| "learning_rate": 5.61391348337002e-07, |
| "loss": 26.788510131835938, |
| "step": 5070 |
| }, |
| { |
| "epoch": 0.4618181818181818, |
| "grad_norm": 196731346092032.0, |
| "learning_rate": 5.599739080511492e-07, |
| "loss": 26.669586181640625, |
| "step": 5080 |
| }, |
| { |
| "epoch": 0.4627272727272727, |
| "grad_norm": 182333021880320.0, |
| "learning_rate": 5.585559785765819e-07, |
| "loss": 26.678341674804688, |
| "step": 5090 |
| }, |
| { |
| "epoch": 0.4636363636363636, |
| "grad_norm": 352578864939008.0, |
| "learning_rate": 5.571375714789147e-07, |
| "loss": 26.814114379882813, |
| "step": 5100 |
| }, |
| { |
| "epoch": 0.4636363636363636, |
| "eval_loss": 26.3111515045166, |
| "eval_runtime": 2.2022, |
| "eval_samples_per_second": 16.348, |
| "eval_steps_per_second": 0.908, |
| "step": 5100 |
| }, |
| { |
| "epoch": 0.46454545454545454, |
| "grad_norm": 518492847603712.0, |
| "learning_rate": 5.557186983276576e-07, |
| "loss": 26.460382080078126, |
| "step": 5110 |
| }, |
| { |
| "epoch": 0.46545454545454545, |
| "grad_norm": 190987498422272.0, |
| "learning_rate": 5.542993706961225e-07, |
| "loss": 26.442779541015625, |
| "step": 5120 |
| }, |
| { |
| "epoch": 0.46636363636363637, |
| "grad_norm": 172608712605696.0, |
| "learning_rate": 5.528796001613282e-07, |
| "loss": 26.353005981445314, |
| "step": 5130 |
| }, |
| { |
| "epoch": 0.4672727272727273, |
| "grad_norm": 422501872041984.0, |
| "learning_rate": 5.514593983039058e-07, |
| "loss": 26.381781005859374, |
| "step": 5140 |
| }, |
| { |
| "epoch": 0.4681818181818182, |
| "grad_norm": 560177182932992.0, |
| "learning_rate": 5.500387767080053e-07, |
| "loss": 26.472189331054686, |
| "step": 5150 |
| }, |
| { |
| "epoch": 0.4690909090909091, |
| "grad_norm": 265595475984384.0, |
| "learning_rate": 5.486177469611998e-07, |
| "loss": 26.500082397460936, |
| "step": 5160 |
| }, |
| { |
| "epoch": 0.47, |
| "grad_norm": 230636791005184.0, |
| "learning_rate": 5.471963206543913e-07, |
| "loss": 26.208493041992188, |
| "step": 5170 |
| }, |
| { |
| "epoch": 0.4709090909090909, |
| "grad_norm": 236991077679104.0, |
| "learning_rate": 5.457745093817174e-07, |
| "loss": 26.544073486328124, |
| "step": 5180 |
| }, |
| { |
| "epoch": 0.4718181818181818, |
| "grad_norm": 428384232407040.0, |
| "learning_rate": 5.44352324740455e-07, |
| "loss": 26.5481201171875, |
| "step": 5190 |
| }, |
| { |
| "epoch": 0.4727272727272727, |
| "grad_norm": 211124435812352.0, |
| "learning_rate": 5.429297783309264e-07, |
| "loss": 26.475244140625, |
| "step": 5200 |
| }, |
| { |
| "epoch": 0.4727272727272727, |
| "eval_loss": 26.310951232910156, |
| "eval_runtime": 2.153, |
| "eval_samples_per_second": 16.721, |
| "eval_steps_per_second": 0.929, |
| "step": 5200 |
| }, |
| { |
| "epoch": 0.47363636363636363, |
| "grad_norm": 181685639446528.0, |
| "learning_rate": 5.415068817564053e-07, |
| "loss": 26.813641357421876, |
| "step": 5210 |
| }, |
| { |
| "epoch": 0.47454545454545455, |
| "grad_norm": 324085380808704.0, |
| "learning_rate": 5.400836466230208e-07, |
| "loss": 26.601318359375, |
| "step": 5220 |
| }, |
| { |
| "epoch": 0.47545454545454546, |
| "grad_norm": 476272278896640.0, |
| "learning_rate": 5.386600845396642e-07, |
| "loss": 26.603497314453126, |
| "step": 5230 |
| }, |
| { |
| "epoch": 0.4763636363636364, |
| "grad_norm": 261529517686784.0, |
| "learning_rate": 5.372362071178936e-07, |
| "loss": 26.458706665039063, |
| "step": 5240 |
| }, |
| { |
| "epoch": 0.4772727272727273, |
| "grad_norm": 607072420888576.0, |
| "learning_rate": 5.358120259718388e-07, |
| "loss": 26.715435791015626, |
| "step": 5250 |
| }, |
| { |
| "epoch": 0.4781818181818182, |
| "grad_norm": 98573517586432.0, |
| "learning_rate": 5.343875527181072e-07, |
| "loss": 26.47364501953125, |
| "step": 5260 |
| }, |
| { |
| "epoch": 0.47909090909090907, |
| "grad_norm": 135659385782272.0, |
| "learning_rate": 5.32962798975689e-07, |
| "loss": 26.717742919921875, |
| "step": 5270 |
| }, |
| { |
| "epoch": 0.48, |
| "grad_norm": 387802562822144.0, |
| "learning_rate": 5.315377763658617e-07, |
| "loss": 26.490786743164062, |
| "step": 5280 |
| }, |
| { |
| "epoch": 0.4809090909090909, |
| "grad_norm": 418252572327936.0, |
| "learning_rate": 5.301124965120968e-07, |
| "loss": 26.737353515625, |
| "step": 5290 |
| }, |
| { |
| "epoch": 0.4818181818181818, |
| "grad_norm": 214300849340416.0, |
| "learning_rate": 5.28686971039963e-07, |
| "loss": 26.633428955078124, |
| "step": 5300 |
| }, |
| { |
| "epoch": 0.4818181818181818, |
| "eval_loss": 26.304325103759766, |
| "eval_runtime": 2.1933, |
| "eval_samples_per_second": 16.414, |
| "eval_steps_per_second": 0.912, |
| "step": 5300 |
| }, |
| { |
| "epoch": 0.4827272727272727, |
| "grad_norm": 477280589578240.0, |
| "learning_rate": 5.272612115770332e-07, |
| "loss": 26.399496459960936, |
| "step": 5310 |
| }, |
| { |
| "epoch": 0.48363636363636364, |
| "grad_norm": 231165105537024.0, |
| "learning_rate": 5.258352297527887e-07, |
| "loss": 26.705911254882814, |
| "step": 5320 |
| }, |
| { |
| "epoch": 0.48454545454545456, |
| "grad_norm": 193821488971776.0, |
| "learning_rate": 5.244090371985243e-07, |
| "loss": 27.068051147460938, |
| "step": 5330 |
| }, |
| { |
| "epoch": 0.48545454545454547, |
| "grad_norm": 370139140718592.0, |
| "learning_rate": 5.229826455472541e-07, |
| "loss": 26.2793212890625, |
| "step": 5340 |
| }, |
| { |
| "epoch": 0.4863636363636364, |
| "grad_norm": 66449884315648.0, |
| "learning_rate": 5.215560664336157e-07, |
| "loss": 26.93189392089844, |
| "step": 5350 |
| }, |
| { |
| "epoch": 0.48727272727272725, |
| "grad_norm": 114903520116736.0, |
| "learning_rate": 5.201293114937759e-07, |
| "loss": 26.350509643554688, |
| "step": 5360 |
| }, |
| { |
| "epoch": 0.48818181818181816, |
| "grad_norm": 163418724106240.0, |
| "learning_rate": 5.18702392365336e-07, |
| "loss": 26.36776123046875, |
| "step": 5370 |
| }, |
| { |
| "epoch": 0.4890909090909091, |
| "grad_norm": 386242080407552.0, |
| "learning_rate": 5.172753206872362e-07, |
| "loss": 26.549008178710938, |
| "step": 5380 |
| }, |
| { |
| "epoch": 0.49, |
| "grad_norm": 84084361527296.0, |
| "learning_rate": 5.158481080996609e-07, |
| "loss": 26.612332153320313, |
| "step": 5390 |
| }, |
| { |
| "epoch": 0.4909090909090909, |
| "grad_norm": 408571950923776.0, |
| "learning_rate": 5.144207662439443e-07, |
| "loss": 26.4984619140625, |
| "step": 5400 |
| }, |
| { |
| "epoch": 0.4909090909090909, |
| "eval_loss": 26.30891990661621, |
| "eval_runtime": 2.2008, |
| "eval_samples_per_second": 16.358, |
| "eval_steps_per_second": 0.909, |
| "step": 5400 |
| }, |
| { |
| "epoch": 0.4918181818181818, |
| "grad_norm": 392391265615872.0, |
| "learning_rate": 5.129933067624745e-07, |
| "loss": 26.757540893554687, |
| "step": 5410 |
| }, |
| { |
| "epoch": 0.49272727272727274, |
| "grad_norm": 343983997845504.0, |
| "learning_rate": 5.115657412985993e-07, |
| "loss": 26.5795654296875, |
| "step": 5420 |
| }, |
| { |
| "epoch": 0.49363636363636365, |
| "grad_norm": 276295011270656.0, |
| "learning_rate": 5.101380814965313e-07, |
| "loss": 26.277252197265625, |
| "step": 5430 |
| }, |
| { |
| "epoch": 0.49454545454545457, |
| "grad_norm": 225630402641920.0, |
| "learning_rate": 5.087103390012517e-07, |
| "loss": 26.9617919921875, |
| "step": 5440 |
| }, |
| { |
| "epoch": 0.4954545454545455, |
| "grad_norm": 110936799051776.0, |
| "learning_rate": 5.072825254584171e-07, |
| "loss": 26.697900390625, |
| "step": 5450 |
| }, |
| { |
| "epoch": 0.49636363636363634, |
| "grad_norm": 429198766243840.0, |
| "learning_rate": 5.058546525142631e-07, |
| "loss": 26.221038818359375, |
| "step": 5460 |
| }, |
| { |
| "epoch": 0.49727272727272726, |
| "grad_norm": 307539992379392.0, |
| "learning_rate": 5.044267318155098e-07, |
| "loss": 26.596530151367187, |
| "step": 5470 |
| }, |
| { |
| "epoch": 0.49818181818181817, |
| "grad_norm": 377537322549248.0, |
| "learning_rate": 5.029987750092675e-07, |
| "loss": 26.367523193359375, |
| "step": 5480 |
| }, |
| { |
| "epoch": 0.4990909090909091, |
| "grad_norm": 248897851097088.0, |
| "learning_rate": 5.015707937429397e-07, |
| "loss": 26.702847290039063, |
| "step": 5490 |
| }, |
| { |
| "epoch": 0.5, |
| "grad_norm": 572252919693312.0, |
| "learning_rate": 5.00142799664131e-07, |
| "loss": 26.316940307617188, |
| "step": 5500 |
| }, |
| { |
| "epoch": 0.5, |
| "eval_loss": 26.30450439453125, |
| "eval_runtime": 2.1679, |
| "eval_samples_per_second": 16.606, |
| "eval_steps_per_second": 0.923, |
| "step": 5500 |
| }, |
| { |
| "epoch": 0.5009090909090909, |
| "grad_norm": 194077274406912.0, |
| "learning_rate": 4.987148044205492e-07, |
| "loss": 26.6015625, |
| "step": 5510 |
| }, |
| { |
| "epoch": 0.5018181818181818, |
| "grad_norm": 262825356296192.0, |
| "learning_rate": 4.972868196599125e-07, |
| "loss": 26.622930908203124, |
| "step": 5520 |
| }, |
| { |
| "epoch": 0.5027272727272727, |
| "grad_norm": 173687571480576.0, |
| "learning_rate": 4.958588570298526e-07, |
| "loss": 26.34784851074219, |
| "step": 5530 |
| }, |
| { |
| "epoch": 0.5036363636363637, |
| "grad_norm": 280642273148928.0, |
| "learning_rate": 4.944309281778223e-07, |
| "loss": 26.642620849609376, |
| "step": 5540 |
| }, |
| { |
| "epoch": 0.5045454545454545, |
| "grad_norm": 293827940188160.0, |
| "learning_rate": 4.930030447509968e-07, |
| "loss": 26.564447021484376, |
| "step": 5550 |
| }, |
| { |
| "epoch": 0.5054545454545455, |
| "grad_norm": 277824522944512.0, |
| "learning_rate": 4.915752183961826e-07, |
| "loss": 26.670132446289063, |
| "step": 5560 |
| }, |
| { |
| "epoch": 0.5063636363636363, |
| "grad_norm": 107426208546816.0, |
| "learning_rate": 4.901474607597196e-07, |
| "loss": 26.282070922851563, |
| "step": 5570 |
| }, |
| { |
| "epoch": 0.5072727272727273, |
| "grad_norm": 258411438538752.0, |
| "learning_rate": 4.887197834873877e-07, |
| "loss": 26.355166625976562, |
| "step": 5580 |
| }, |
| { |
| "epoch": 0.5081818181818182, |
| "grad_norm": 140088537251840.0, |
| "learning_rate": 4.872921982243111e-07, |
| "loss": 26.558563232421875, |
| "step": 5590 |
| }, |
| { |
| "epoch": 0.509090909090909, |
| "grad_norm": 138965688516608.0, |
| "learning_rate": 4.858647166148634e-07, |
| "loss": 26.477615356445312, |
| "step": 5600 |
| }, |
| { |
| "epoch": 0.509090909090909, |
| "eval_loss": 26.29946517944336, |
| "eval_runtime": 2.216, |
| "eval_samples_per_second": 16.245, |
| "eval_steps_per_second": 0.903, |
| "step": 5600 |
| }, |
| { |
| "epoch": 0.51, |
| "grad_norm": 627078646988800.0, |
| "learning_rate": 4.84437350302573e-07, |
| "loss": 26.314041137695312, |
| "step": 5610 |
| }, |
| { |
| "epoch": 0.5109090909090909, |
| "grad_norm": 376094112874496.0, |
| "learning_rate": 4.830101109300277e-07, |
| "loss": 26.738397216796876, |
| "step": 5620 |
| }, |
| { |
| "epoch": 0.5118181818181818, |
| "grad_norm": 111444955758592.0, |
| "learning_rate": 4.815830101387799e-07, |
| "loss": 26.68155517578125, |
| "step": 5630 |
| }, |
| { |
| "epoch": 0.5127272727272727, |
| "grad_norm": 182908782379008.0, |
| "learning_rate": 4.801560595692515e-07, |
| "loss": 26.290713500976562, |
| "step": 5640 |
| }, |
| { |
| "epoch": 0.5136363636363637, |
| "grad_norm": 321908033716224.0, |
| "learning_rate": 4.787292708606394e-07, |
| "loss": 26.5162353515625, |
| "step": 5650 |
| }, |
| { |
| "epoch": 0.5145454545454545, |
| "grad_norm": 203153714708480.0, |
| "learning_rate": 4.773026556508201e-07, |
| "loss": 26.120401000976564, |
| "step": 5660 |
| }, |
| { |
| "epoch": 0.5154545454545455, |
| "grad_norm": 395124106330112.0, |
| "learning_rate": 4.7587622557625485e-07, |
| "loss": 26.68848876953125, |
| "step": 5670 |
| }, |
| { |
| "epoch": 0.5163636363636364, |
| "grad_norm": 515408322887680.0, |
| "learning_rate": 4.744499922718948e-07, |
| "loss": 26.975100708007812, |
| "step": 5680 |
| }, |
| { |
| "epoch": 0.5172727272727272, |
| "grad_norm": 415264516603904.0, |
| "learning_rate": 4.7302396737108643e-07, |
| "loss": 26.722061157226562, |
| "step": 5690 |
| }, |
| { |
| "epoch": 0.5181818181818182, |
| "grad_norm": 198320131670016.0, |
| "learning_rate": 4.7159816250547593e-07, |
| "loss": 27.05069580078125, |
| "step": 5700 |
| }, |
| { |
| "epoch": 0.5181818181818182, |
| "eval_loss": 26.303539276123047, |
| "eval_runtime": 2.1678, |
| "eval_samples_per_second": 16.607, |
| "eval_steps_per_second": 0.923, |
| "step": 5700 |
| }, |
| { |
| "epoch": 0.519090909090909, |
| "grad_norm": 350612004798464.0, |
| "learning_rate": 4.7017258930491466e-07, |
| "loss": 26.506210327148438, |
| "step": 5710 |
| }, |
| { |
| "epoch": 0.52, |
| "grad_norm": 353382929793024.0, |
| "learning_rate": 4.687472593973649e-07, |
| "loss": 26.487466430664064, |
| "step": 5720 |
| }, |
| { |
| "epoch": 0.5209090909090909, |
| "grad_norm": 128485766987776.0, |
| "learning_rate": 4.673221844088039e-07, |
| "loss": 26.61768798828125, |
| "step": 5730 |
| }, |
| { |
| "epoch": 0.5218181818181818, |
| "grad_norm": 176263411007488.0, |
| "learning_rate": 4.6589737596313005e-07, |
| "loss": 26.494561767578126, |
| "step": 5740 |
| }, |
| { |
| "epoch": 0.5227272727272727, |
| "grad_norm": 490709543026688.0, |
| "learning_rate": 4.6447284568206727e-07, |
| "loss": 26.74195556640625, |
| "step": 5750 |
| }, |
| { |
| "epoch": 0.5236363636363637, |
| "grad_norm": 439582084562944.0, |
| "learning_rate": 4.63048605185071e-07, |
| "loss": 26.69200744628906, |
| "step": 5760 |
| }, |
| { |
| "epoch": 0.5245454545454545, |
| "grad_norm": 155888790798336.0, |
| "learning_rate": 4.616246660892323e-07, |
| "loss": 26.530010986328126, |
| "step": 5770 |
| }, |
| { |
| "epoch": 0.5254545454545455, |
| "grad_norm": 313929695756288.0, |
| "learning_rate": 4.6020104000918487e-07, |
| "loss": 26.343841552734375, |
| "step": 5780 |
| }, |
| { |
| "epoch": 0.5263636363636364, |
| "grad_norm": 59153334665216.0, |
| "learning_rate": 4.587777385570081e-07, |
| "loss": 26.92261962890625, |
| "step": 5790 |
| }, |
| { |
| "epoch": 0.5272727272727272, |
| "grad_norm": 321196008669184.0, |
| "learning_rate": 4.5735477334213403e-07, |
| "loss": 26.5276123046875, |
| "step": 5800 |
| }, |
| { |
| "epoch": 0.5272727272727272, |
| "eval_loss": 26.29823112487793, |
| "eval_runtime": 2.1826, |
| "eval_samples_per_second": 16.494, |
| "eval_steps_per_second": 0.916, |
| "step": 5800 |
| }, |
| { |
| "epoch": 0.5281818181818182, |
| "grad_norm": 115456698482688.0, |
| "learning_rate": 4.5593215597125246e-07, |
| "loss": 26.302325439453124, |
| "step": 5810 |
| }, |
| { |
| "epoch": 0.5290909090909091, |
| "grad_norm": 54434067382272.0, |
| "learning_rate": 4.54509898048215e-07, |
| "loss": 26.550509643554687, |
| "step": 5820 |
| }, |
| { |
| "epoch": 0.53, |
| "grad_norm": 117245166485504.0, |
| "learning_rate": 4.530880111739424e-07, |
| "loss": 26.198770141601564, |
| "step": 5830 |
| }, |
| { |
| "epoch": 0.5309090909090909, |
| "grad_norm": 174198236381184.0, |
| "learning_rate": 4.5166650694632813e-07, |
| "loss": 26.7167236328125, |
| "step": 5840 |
| }, |
| { |
| "epoch": 0.5318181818181819, |
| "grad_norm": 202826961649664.0, |
| "learning_rate": 4.5024539696014496e-07, |
| "loss": 26.728240966796875, |
| "step": 5850 |
| }, |
| { |
| "epoch": 0.5327272727272727, |
| "grad_norm": 183662431698944.0, |
| "learning_rate": 4.488246928069496e-07, |
| "loss": 26.686666870117186, |
| "step": 5860 |
| }, |
| { |
| "epoch": 0.5336363636363637, |
| "grad_norm": 132447521996800.0, |
| "learning_rate": 4.474044060749889e-07, |
| "loss": 26.561785888671874, |
| "step": 5870 |
| }, |
| { |
| "epoch": 0.5345454545454545, |
| "grad_norm": 294536173584384.0, |
| "learning_rate": 4.459845483491045e-07, |
| "loss": 26.386618041992186, |
| "step": 5880 |
| }, |
| { |
| "epoch": 0.5354545454545454, |
| "grad_norm": 566112055984128.0, |
| "learning_rate": 4.44565131210639e-07, |
| "loss": 26.43914794921875, |
| "step": 5890 |
| }, |
| { |
| "epoch": 0.5363636363636364, |
| "grad_norm": 379239069122560.0, |
| "learning_rate": 4.431461662373415e-07, |
| "loss": 26.517977905273437, |
| "step": 5900 |
| }, |
| { |
| "epoch": 0.5363636363636364, |
| "eval_loss": 26.296443939208984, |
| "eval_runtime": 2.1745, |
| "eval_samples_per_second": 16.555, |
| "eval_steps_per_second": 0.92, |
| "step": 5900 |
| }, |
| { |
| "epoch": 0.5372727272727272, |
| "grad_norm": 146172048048128.0, |
| "learning_rate": 4.4172766500327227e-07, |
| "loss": 26.98131103515625, |
| "step": 5910 |
| }, |
| { |
| "epoch": 0.5381818181818182, |
| "grad_norm": 280093792403456.0, |
| "learning_rate": 4.4030963907871e-07, |
| "loss": 26.6470703125, |
| "step": 5920 |
| }, |
| { |
| "epoch": 0.5390909090909091, |
| "grad_norm": 200643255992320.0, |
| "learning_rate": 4.3889210003005525e-07, |
| "loss": 26.51512451171875, |
| "step": 5930 |
| }, |
| { |
| "epoch": 0.54, |
| "grad_norm": 298077273456640.0, |
| "learning_rate": 4.374750594197383e-07, |
| "loss": 26.81731262207031, |
| "step": 5940 |
| }, |
| { |
| "epoch": 0.5409090909090909, |
| "grad_norm": 105089628897280.0, |
| "learning_rate": 4.36058528806123e-07, |
| "loss": 26.3632568359375, |
| "step": 5950 |
| }, |
| { |
| "epoch": 0.5418181818181819, |
| "grad_norm": 243687518896128.0, |
| "learning_rate": 4.346425197434142e-07, |
| "loss": 26.923687744140626, |
| "step": 5960 |
| }, |
| { |
| "epoch": 0.5427272727272727, |
| "grad_norm": 667943180435456.0, |
| "learning_rate": 4.3322704378156184e-07, |
| "loss": 26.333908081054688, |
| "step": 5970 |
| }, |
| { |
| "epoch": 0.5436363636363636, |
| "grad_norm": 232555886411776.0, |
| "learning_rate": 4.3181211246616774e-07, |
| "loss": 26.753402709960938, |
| "step": 5980 |
| }, |
| { |
| "epoch": 0.5445454545454546, |
| "grad_norm": 504201209708544.0, |
| "learning_rate": 4.3039773733839145e-07, |
| "loss": 26.233575439453126, |
| "step": 5990 |
| }, |
| { |
| "epoch": 0.5454545454545454, |
| "grad_norm": 184770180939776.0, |
| "learning_rate": 4.2898392993485547e-07, |
| "loss": 26.377456665039062, |
| "step": 6000 |
| }, |
| { |
| "epoch": 0.5454545454545454, |
| "eval_loss": 26.29542350769043, |
| "eval_runtime": 2.1707, |
| "eval_samples_per_second": 16.585, |
| "eval_steps_per_second": 0.921, |
| "step": 6000 |
| }, |
| { |
| "epoch": 0.5463636363636364, |
| "grad_norm": 306690058616832.0, |
| "learning_rate": 4.2757070178755213e-07, |
| "loss": 26.351678466796876, |
| "step": 6010 |
| }, |
| { |
| "epoch": 0.5472727272727272, |
| "grad_norm": 103466861068288.0, |
| "learning_rate": 4.261580644237481e-07, |
| "loss": 26.860089111328126, |
| "step": 6020 |
| }, |
| { |
| "epoch": 0.5481818181818182, |
| "grad_norm": 358580880408576.0, |
| "learning_rate": 4.2474602936589233e-07, |
| "loss": 26.571078491210937, |
| "step": 6030 |
| }, |
| { |
| "epoch": 0.5490909090909091, |
| "grad_norm": 270877916659712.0, |
| "learning_rate": 4.233346081315196e-07, |
| "loss": 26.6639404296875, |
| "step": 6040 |
| }, |
| { |
| "epoch": 0.55, |
| "grad_norm": 409891646734336.0, |
| "learning_rate": 4.219238122331593e-07, |
| "loss": 26.780926513671876, |
| "step": 6050 |
| }, |
| { |
| "epoch": 0.5509090909090909, |
| "grad_norm": 182963593543680.0, |
| "learning_rate": 4.2051365317823893e-07, |
| "loss": 26.43211975097656, |
| "step": 6060 |
| }, |
| { |
| "epoch": 0.5518181818181818, |
| "grad_norm": 94839890771968.0, |
| "learning_rate": 4.191041424689925e-07, |
| "loss": 27.00631103515625, |
| "step": 6070 |
| }, |
| { |
| "epoch": 0.5527272727272727, |
| "grad_norm": 415413498281984.0, |
| "learning_rate": 4.176952916023649e-07, |
| "loss": 26.388510131835936, |
| "step": 6080 |
| }, |
| { |
| "epoch": 0.5536363636363636, |
| "grad_norm": 247516348022784.0, |
| "learning_rate": 4.1628711206991906e-07, |
| "loss": 26.635281372070313, |
| "step": 6090 |
| }, |
| { |
| "epoch": 0.5545454545454546, |
| "grad_norm": 941664063455232.0, |
| "learning_rate": 4.1487961535774235e-07, |
| "loss": 26.43724365234375, |
| "step": 6100 |
| }, |
| { |
| "epoch": 0.5545454545454546, |
| "eval_loss": 26.28836441040039, |
| "eval_runtime": 2.1519, |
| "eval_samples_per_second": 16.73, |
| "eval_steps_per_second": 0.929, |
| "step": 6100 |
| }, |
| { |
| "epoch": 0.5554545454545454, |
| "grad_norm": 295934218993664.0, |
| "learning_rate": 4.134728129463522e-07, |
| "loss": 26.27704772949219, |
| "step": 6110 |
| }, |
| { |
| "epoch": 0.5563636363636364, |
| "grad_norm": 269193249292288.0, |
| "learning_rate": 4.1206671631060323e-07, |
| "loss": 26.7314697265625, |
| "step": 6120 |
| }, |
| { |
| "epoch": 0.5572727272727273, |
| "grad_norm": 125726451826688.0, |
| "learning_rate": 4.1066133691959284e-07, |
| "loss": 26.241030883789062, |
| "step": 6130 |
| }, |
| { |
| "epoch": 0.5581818181818182, |
| "grad_norm": 672323979968512.0, |
| "learning_rate": 4.0925668623656846e-07, |
| "loss": 26.6068115234375, |
| "step": 6140 |
| }, |
| { |
| "epoch": 0.5590909090909091, |
| "grad_norm": 247083109974016.0, |
| "learning_rate": 4.0785277571883324e-07, |
| "loss": 26.240081787109375, |
| "step": 6150 |
| }, |
| { |
| "epoch": 0.56, |
| "grad_norm": 347755381784576.0, |
| "learning_rate": 4.0644961681765385e-07, |
| "loss": 26.687600708007814, |
| "step": 6160 |
| }, |
| { |
| "epoch": 0.5609090909090909, |
| "grad_norm": 193356390989824.0, |
| "learning_rate": 4.0504722097816526e-07, |
| "loss": 26.66230163574219, |
| "step": 6170 |
| }, |
| { |
| "epoch": 0.5618181818181818, |
| "grad_norm": 264473046679552.0, |
| "learning_rate": 4.0364559963927865e-07, |
| "loss": 26.944580078125, |
| "step": 6180 |
| }, |
| { |
| "epoch": 0.5627272727272727, |
| "grad_norm": 176868397416448.0, |
| "learning_rate": 4.022447642335885e-07, |
| "loss": 26.1925048828125, |
| "step": 6190 |
| }, |
| { |
| "epoch": 0.5636363636363636, |
| "grad_norm": 357407649693696.0, |
| "learning_rate": 4.0084472618727795e-07, |
| "loss": 26.477133178710936, |
| "step": 6200 |
| }, |
| { |
| "epoch": 0.5636363636363636, |
| "eval_loss": 26.29114532470703, |
| "eval_runtime": 2.1728, |
| "eval_samples_per_second": 16.569, |
| "eval_steps_per_second": 0.92, |
| "step": 6200 |
| }, |
| { |
| "epoch": 0.5645454545454546, |
| "grad_norm": 188899942989824.0, |
| "learning_rate": 3.994454969200266e-07, |
| "loss": 26.23280029296875, |
| "step": 6210 |
| }, |
| { |
| "epoch": 0.5654545454545454, |
| "grad_norm": 174719772917760.0, |
| "learning_rate": 3.9804708784491697e-07, |
| "loss": 26.93548583984375, |
| "step": 6220 |
| }, |
| { |
| "epoch": 0.5663636363636364, |
| "grad_norm": 168751630647296.0, |
| "learning_rate": 3.966495103683418e-07, |
| "loss": 26.4197509765625, |
| "step": 6230 |
| }, |
| { |
| "epoch": 0.5672727272727273, |
| "grad_norm": 353826150285312.0, |
| "learning_rate": 3.952527758899103e-07, |
| "loss": 26.3079345703125, |
| "step": 6240 |
| }, |
| { |
| "epoch": 0.5681818181818182, |
| "grad_norm": 91272224178176.0, |
| "learning_rate": 3.938568958023561e-07, |
| "loss": 26.32183837890625, |
| "step": 6250 |
| }, |
| { |
| "epoch": 0.5690909090909091, |
| "grad_norm": 188810235215872.0, |
| "learning_rate": 3.9246188149144344e-07, |
| "loss": 26.427536010742188, |
| "step": 6260 |
| }, |
| { |
| "epoch": 0.57, |
| "grad_norm": 413852076343296.0, |
| "learning_rate": 3.9106774433587465e-07, |
| "loss": 26.245895385742188, |
| "step": 6270 |
| }, |
| { |
| "epoch": 0.5709090909090909, |
| "grad_norm": 75952646258688.0, |
| "learning_rate": 3.8967449570719783e-07, |
| "loss": 26.672445678710936, |
| "step": 6280 |
| }, |
| { |
| "epoch": 0.5718181818181818, |
| "grad_norm": 149835806146560.0, |
| "learning_rate": 3.8828214696971305e-07, |
| "loss": 26.373684692382813, |
| "step": 6290 |
| }, |
| { |
| "epoch": 0.5727272727272728, |
| "grad_norm": 84309335605248.0, |
| "learning_rate": 3.8689070948038105e-07, |
| "loss": 26.33724365234375, |
| "step": 6300 |
| }, |
| { |
| "epoch": 0.5727272727272728, |
| "eval_loss": 26.28530502319336, |
| "eval_runtime": 2.1736, |
| "eval_samples_per_second": 16.562, |
| "eval_steps_per_second": 0.92, |
| "step": 6300 |
| }, |
| { |
| "epoch": 0.5736363636363636, |
| "grad_norm": 184767328813056.0, |
| "learning_rate": 3.8550019458872863e-07, |
| "loss": 26.87149658203125, |
| "step": 6310 |
| }, |
| { |
| "epoch": 0.5745454545454546, |
| "grad_norm": 166437347917824.0, |
| "learning_rate": 3.841106136367585e-07, |
| "loss": 26.697918701171876, |
| "step": 6320 |
| }, |
| { |
| "epoch": 0.5754545454545454, |
| "grad_norm": 375701593128960.0, |
| "learning_rate": 3.827219779588546e-07, |
| "loss": 26.319839477539062, |
| "step": 6330 |
| }, |
| { |
| "epoch": 0.5763636363636364, |
| "grad_norm": 123003073462272.0, |
| "learning_rate": 3.81334298881691e-07, |
| "loss": 26.770510864257812, |
| "step": 6340 |
| }, |
| { |
| "epoch": 0.5772727272727273, |
| "grad_norm": 429775868919808.0, |
| "learning_rate": 3.7994758772413894e-07, |
| "loss": 26.409426879882812, |
| "step": 6350 |
| }, |
| { |
| "epoch": 0.5781818181818181, |
| "grad_norm": 180347572584448.0, |
| "learning_rate": 3.7856185579717455e-07, |
| "loss": 26.36715087890625, |
| "step": 6360 |
| }, |
| { |
| "epoch": 0.5790909090909091, |
| "grad_norm": 1096010222796800.0, |
| "learning_rate": 3.771771144037869e-07, |
| "loss": 26.516082763671875, |
| "step": 6370 |
| }, |
| { |
| "epoch": 0.58, |
| "grad_norm": 108321600176128.0, |
| "learning_rate": 3.7579337483888535e-07, |
| "loss": 26.694012451171876, |
| "step": 6380 |
| }, |
| { |
| "epoch": 0.5809090909090909, |
| "grad_norm": 196052774813696.0, |
| "learning_rate": 3.7441064838920793e-07, |
| "loss": 26.63226318359375, |
| "step": 6390 |
| }, |
| { |
| "epoch": 0.5818181818181818, |
| "grad_norm": 136146621300736.0, |
| "learning_rate": 3.7302894633322857e-07, |
| "loss": 26.535342407226562, |
| "step": 6400 |
| }, |
| { |
| "epoch": 0.5818181818181818, |
| "eval_loss": 26.28375244140625, |
| "eval_runtime": 2.1824, |
| "eval_samples_per_second": 16.495, |
| "eval_steps_per_second": 0.916, |
| "step": 6400 |
| }, |
| { |
| "epoch": 0.5827272727272728, |
| "grad_norm": 359597948796928.0, |
| "learning_rate": 3.7164827994106623e-07, |
| "loss": 26.610174560546874, |
| "step": 6410 |
| }, |
| { |
| "epoch": 0.5836363636363636, |
| "grad_norm": 358815996313600.0, |
| "learning_rate": 3.7026866047439134e-07, |
| "loss": 26.601348876953125, |
| "step": 6420 |
| }, |
| { |
| "epoch": 0.5845454545454546, |
| "grad_norm": 232237672955904.0, |
| "learning_rate": 3.688900991863357e-07, |
| "loss": 26.58094177246094, |
| "step": 6430 |
| }, |
| { |
| "epoch": 0.5854545454545454, |
| "grad_norm": 224937939828736.0, |
| "learning_rate": 3.675126073213998e-07, |
| "loss": 26.3585693359375, |
| "step": 6440 |
| }, |
| { |
| "epoch": 0.5863636363636363, |
| "grad_norm": 170370447441920.0, |
| "learning_rate": 3.661361961153602e-07, |
| "loss": 26.818353271484376, |
| "step": 6450 |
| }, |
| { |
| "epoch": 0.5872727272727273, |
| "grad_norm": 241997600260096.0, |
| "learning_rate": 3.647608767951803e-07, |
| "loss": 26.691299438476562, |
| "step": 6460 |
| }, |
| { |
| "epoch": 0.5881818181818181, |
| "grad_norm": 359189289369600.0, |
| "learning_rate": 3.633866605789163e-07, |
| "loss": 26.187884521484374, |
| "step": 6470 |
| }, |
| { |
| "epoch": 0.5890909090909091, |
| "grad_norm": 318397501931520.0, |
| "learning_rate": 3.6201355867562724e-07, |
| "loss": 26.471282958984375, |
| "step": 6480 |
| }, |
| { |
| "epoch": 0.59, |
| "grad_norm": 151627210162176.0, |
| "learning_rate": 3.606415822852825e-07, |
| "loss": 26.56259765625, |
| "step": 6490 |
| }, |
| { |
| "epoch": 0.5909090909090909, |
| "grad_norm": 304659646382080.0, |
| "learning_rate": 3.592707425986717e-07, |
| "loss": 26.369317626953126, |
| "step": 6500 |
| }, |
| { |
| "epoch": 0.5909090909090909, |
| "eval_loss": 26.286823272705078, |
| "eval_runtime": 2.1707, |
| "eval_samples_per_second": 16.584, |
| "eval_steps_per_second": 0.921, |
| "step": 6500 |
| }, |
| { |
| "epoch": 0.5918181818181818, |
| "grad_norm": 280783252094976.0, |
| "learning_rate": 3.5790105079731216e-07, |
| "loss": 26.206988525390624, |
| "step": 6510 |
| }, |
| { |
| "epoch": 0.5927272727272728, |
| "grad_norm": 196329196224512.0, |
| "learning_rate": 3.565325180533586e-07, |
| "loss": 26.52789306640625, |
| "step": 6520 |
| }, |
| { |
| "epoch": 0.5936363636363636, |
| "grad_norm": 136604035317760.0, |
| "learning_rate": 3.5516515552951124e-07, |
| "loss": 26.288201904296876, |
| "step": 6530 |
| }, |
| { |
| "epoch": 0.5945454545454546, |
| "grad_norm": 92855758487552.0, |
| "learning_rate": 3.537989743789259e-07, |
| "loss": 26.704229736328124, |
| "step": 6540 |
| }, |
| { |
| "epoch": 0.5954545454545455, |
| "grad_norm": 160173054230528.0, |
| "learning_rate": 3.5243398574512185e-07, |
| "loss": 26.398892211914063, |
| "step": 6550 |
| }, |
| { |
| "epoch": 0.5963636363636363, |
| "grad_norm": 205201441030144.0, |
| "learning_rate": 3.5107020076189075e-07, |
| "loss": 26.12825927734375, |
| "step": 6560 |
| }, |
| { |
| "epoch": 0.5972727272727273, |
| "grad_norm": 381060437245952.0, |
| "learning_rate": 3.4970763055320776e-07, |
| "loss": 26.28996887207031, |
| "step": 6570 |
| }, |
| { |
| "epoch": 0.5981818181818181, |
| "grad_norm": 101203681738752.0, |
| "learning_rate": 3.4834628623313835e-07, |
| "loss": 26.50263671875, |
| "step": 6580 |
| }, |
| { |
| "epoch": 0.5990909090909091, |
| "grad_norm": 190785299415040.0, |
| "learning_rate": 3.4698617890574966e-07, |
| "loss": 26.34183349609375, |
| "step": 6590 |
| }, |
| { |
| "epoch": 0.6, |
| "grad_norm": 127154729779200.0, |
| "learning_rate": 3.4562731966501835e-07, |
| "loss": 26.541549682617188, |
| "step": 6600 |
| }, |
| { |
| "epoch": 0.6, |
| "eval_loss": 26.287540435791016, |
| "eval_runtime": 2.151, |
| "eval_samples_per_second": 16.737, |
| "eval_steps_per_second": 0.93, |
| "step": 6600 |
| }, |
| { |
| "epoch": 0.600909090909091, |
| "grad_norm": 294955067113472.0, |
| "learning_rate": 3.442697195947414e-07, |
| "loss": 26.36138000488281, |
| "step": 6610 |
| }, |
| { |
| "epoch": 0.6018181818181818, |
| "grad_norm": 587266313420800.0, |
| "learning_rate": 3.4291338976844465e-07, |
| "loss": 26.64934387207031, |
| "step": 6620 |
| }, |
| { |
| "epoch": 0.6027272727272728, |
| "grad_norm": 137201656528896.0, |
| "learning_rate": 3.415583412492933e-07, |
| "loss": 26.626654052734374, |
| "step": 6630 |
| }, |
| { |
| "epoch": 0.6036363636363636, |
| "grad_norm": 370320368205824.0, |
| "learning_rate": 3.4020458509000117e-07, |
| "loss": 26.581622314453124, |
| "step": 6640 |
| }, |
| { |
| "epoch": 0.6045454545454545, |
| "grad_norm": 129610041786368.0, |
| "learning_rate": 3.3885213233274053e-07, |
| "loss": 26.582095336914062, |
| "step": 6650 |
| }, |
| { |
| "epoch": 0.6054545454545455, |
| "grad_norm": 590885427347456.0, |
| "learning_rate": 3.3750099400905256e-07, |
| "loss": 26.447711181640624, |
| "step": 6660 |
| }, |
| { |
| "epoch": 0.6063636363636363, |
| "grad_norm": 323296281231360.0, |
| "learning_rate": 3.361511811397567e-07, |
| "loss": 26.482095336914064, |
| "step": 6670 |
| }, |
| { |
| "epoch": 0.6072727272727273, |
| "grad_norm": 210331276148736.0, |
| "learning_rate": 3.348027047348615e-07, |
| "loss": 26.46201171875, |
| "step": 6680 |
| }, |
| { |
| "epoch": 0.6081818181818182, |
| "grad_norm": 769363464421376.0, |
| "learning_rate": 3.3345557579347353e-07, |
| "loss": 26.45103759765625, |
| "step": 6690 |
| }, |
| { |
| "epoch": 0.6090909090909091, |
| "grad_norm": 661023115706368.0, |
| "learning_rate": 3.321098053037097e-07, |
| "loss": 26.44871826171875, |
| "step": 6700 |
| }, |
| { |
| "epoch": 0.6090909090909091, |
| "eval_loss": 26.283708572387695, |
| "eval_runtime": 2.1672, |
| "eval_samples_per_second": 16.611, |
| "eval_steps_per_second": 0.923, |
| "step": 6700 |
| }, |
| { |
| "epoch": 0.61, |
| "grad_norm": 199447761911808.0, |
| "learning_rate": 3.3076540424260537e-07, |
| "loss": 26.60747375488281, |
| "step": 6710 |
| }, |
| { |
| "epoch": 0.610909090909091, |
| "grad_norm": 391525628379136.0, |
| "learning_rate": 3.2942238357602657e-07, |
| "loss": 26.542547607421874, |
| "step": 6720 |
| }, |
| { |
| "epoch": 0.6118181818181818, |
| "grad_norm": 64306838241280.0, |
| "learning_rate": 3.280807542585795e-07, |
| "loss": 26.613406372070312, |
| "step": 6730 |
| }, |
| { |
| "epoch": 0.6127272727272727, |
| "grad_norm": 70327136681984.0, |
| "learning_rate": 3.2674052723352167e-07, |
| "loss": 26.60184326171875, |
| "step": 6740 |
| }, |
| { |
| "epoch": 0.6136363636363636, |
| "grad_norm": 62553828884480.0, |
| "learning_rate": 3.2540171343267275e-07, |
| "loss": 26.298440551757814, |
| "step": 6750 |
| }, |
| { |
| "epoch": 0.6145454545454545, |
| "grad_norm": 251477431943168.0, |
| "learning_rate": 3.240643237763247e-07, |
| "loss": 26.87586669921875, |
| "step": 6760 |
| }, |
| { |
| "epoch": 0.6154545454545455, |
| "grad_norm": 283658397155328.0, |
| "learning_rate": 3.227283691731537e-07, |
| "loss": 26.486978149414064, |
| "step": 6770 |
| }, |
| { |
| "epoch": 0.6163636363636363, |
| "grad_norm": 64015141175296.0, |
| "learning_rate": 3.2139386052013e-07, |
| "loss": 26.21527099609375, |
| "step": 6780 |
| }, |
| { |
| "epoch": 0.6172727272727273, |
| "grad_norm": 412106407018496.0, |
| "learning_rate": 3.200608087024307e-07, |
| "loss": 26.61980285644531, |
| "step": 6790 |
| }, |
| { |
| "epoch": 0.6181818181818182, |
| "grad_norm": 402233720045568.0, |
| "learning_rate": 3.1872922459334863e-07, |
| "loss": 26.505010986328124, |
| "step": 6800 |
| }, |
| { |
| "epoch": 0.6181818181818182, |
| "eval_loss": 26.28169059753418, |
| "eval_runtime": 2.1742, |
| "eval_samples_per_second": 16.558, |
| "eval_steps_per_second": 0.92, |
| "step": 6800 |
| }, |
| { |
| "epoch": 0.6190909090909091, |
| "grad_norm": 501143427874816.0, |
| "learning_rate": 3.1739911905420614e-07, |
| "loss": 26.6177734375, |
| "step": 6810 |
| }, |
| { |
| "epoch": 0.62, |
| "grad_norm": 320495861891072.0, |
| "learning_rate": 3.1607050293426476e-07, |
| "loss": 26.375076293945312, |
| "step": 6820 |
| }, |
| { |
| "epoch": 0.6209090909090909, |
| "grad_norm": 578750198579200.0, |
| "learning_rate": 3.147433870706369e-07, |
| "loss": 26.377716064453125, |
| "step": 6830 |
| }, |
| { |
| "epoch": 0.6218181818181818, |
| "grad_norm": 264358508625920.0, |
| "learning_rate": 3.13417782288199e-07, |
| "loss": 26.565155029296875, |
| "step": 6840 |
| }, |
| { |
| "epoch": 0.6227272727272727, |
| "grad_norm": 258190952366080.0, |
| "learning_rate": 3.1209369939950093e-07, |
| "loss": 26.477603149414062, |
| "step": 6850 |
| }, |
| { |
| "epoch": 0.6236363636363637, |
| "grad_norm": 281976514805760.0, |
| "learning_rate": 3.1077114920467975e-07, |
| "loss": 26.77740478515625, |
| "step": 6860 |
| }, |
| { |
| "epoch": 0.6245454545454545, |
| "grad_norm": 114142262329344.0, |
| "learning_rate": 3.0945014249137e-07, |
| "loss": 26.84779052734375, |
| "step": 6870 |
| }, |
| { |
| "epoch": 0.6254545454545455, |
| "grad_norm": 101205963440128.0, |
| "learning_rate": 3.081306900346175e-07, |
| "loss": 26.630465698242187, |
| "step": 6880 |
| }, |
| { |
| "epoch": 0.6263636363636363, |
| "grad_norm": 598499464839168.0, |
| "learning_rate": 3.0681280259678943e-07, |
| "loss": 26.645831298828124, |
| "step": 6890 |
| }, |
| { |
| "epoch": 0.6272727272727273, |
| "grad_norm": 204581657116672.0, |
| "learning_rate": 3.0549649092748874e-07, |
| "loss": 26.660739135742187, |
| "step": 6900 |
| }, |
| { |
| "epoch": 0.6272727272727273, |
| "eval_loss": 26.27537727355957, |
| "eval_runtime": 2.1767, |
| "eval_samples_per_second": 16.539, |
| "eval_steps_per_second": 0.919, |
| "step": 6900 |
| }, |
| { |
| "epoch": 0.6281818181818182, |
| "grad_norm": 235361171144704.0, |
| "learning_rate": 3.0418176576346405e-07, |
| "loss": 26.733432006835937, |
| "step": 6910 |
| }, |
| { |
| "epoch": 0.6290909090909091, |
| "grad_norm": 122989131595776.0, |
| "learning_rate": 3.028686378285245e-07, |
| "loss": 26.12663879394531, |
| "step": 6920 |
| }, |
| { |
| "epoch": 0.63, |
| "grad_norm": 654737095524352.0, |
| "learning_rate": 3.0155711783345044e-07, |
| "loss": 26.359912109375, |
| "step": 6930 |
| }, |
| { |
| "epoch": 0.6309090909090909, |
| "grad_norm": 146589414850560.0, |
| "learning_rate": 3.002472164759067e-07, |
| "loss": 26.213088989257812, |
| "step": 6940 |
| }, |
| { |
| "epoch": 0.6318181818181818, |
| "grad_norm": 253996732252160.0, |
| "learning_rate": 2.9893894444035584e-07, |
| "loss": 26.507452392578124, |
| "step": 6950 |
| }, |
| { |
| "epoch": 0.6327272727272727, |
| "grad_norm": 260389656854528.0, |
| "learning_rate": 2.9763231239797025e-07, |
| "loss": 26.148370361328126, |
| "step": 6960 |
| }, |
| { |
| "epoch": 0.6336363636363637, |
| "grad_norm": 540127503843328.0, |
| "learning_rate": 2.963273310065456e-07, |
| "loss": 26.83206787109375, |
| "step": 6970 |
| }, |
| { |
| "epoch": 0.6345454545454545, |
| "grad_norm": 71601550786560.0, |
| "learning_rate": 2.9502401091041334e-07, |
| "loss": 26.635586547851563, |
| "step": 6980 |
| }, |
| { |
| "epoch": 0.6354545454545455, |
| "grad_norm": 550072433508352.0, |
| "learning_rate": 2.9372236274035466e-07, |
| "loss": 26.5653564453125, |
| "step": 6990 |
| }, |
| { |
| "epoch": 0.6363636363636364, |
| "grad_norm": 277867640389632.0, |
| "learning_rate": 2.9242239711351304e-07, |
| "loss": 26.53182373046875, |
| "step": 7000 |
| }, |
| { |
| "epoch": 0.6363636363636364, |
| "eval_loss": 26.28166961669922, |
| "eval_runtime": 2.1741, |
| "eval_samples_per_second": 16.559, |
| "eval_steps_per_second": 0.92, |
| "step": 7000 |
| }, |
| { |
| "epoch": 0.6372727272727273, |
| "grad_norm": 208354400010240.0, |
| "learning_rate": 2.9112412463330807e-07, |
| "loss": 26.38590087890625, |
| "step": 7010 |
| }, |
| { |
| "epoch": 0.6381818181818182, |
| "grad_norm": 615660476432384.0, |
| "learning_rate": 2.8982755588934925e-07, |
| "loss": 26.374246215820314, |
| "step": 7020 |
| }, |
| { |
| "epoch": 0.639090909090909, |
| "grad_norm": 227794512510976.0, |
| "learning_rate": 2.885327014573484e-07, |
| "loss": 26.50068359375, |
| "step": 7030 |
| }, |
| { |
| "epoch": 0.64, |
| "grad_norm": 649978070433792.0, |
| "learning_rate": 2.8723957189903495e-07, |
| "loss": 26.3570556640625, |
| "step": 7040 |
| }, |
| { |
| "epoch": 0.6409090909090909, |
| "grad_norm": 92747755159552.0, |
| "learning_rate": 2.859481777620688e-07, |
| "loss": 26.351593017578125, |
| "step": 7050 |
| }, |
| { |
| "epoch": 0.6418181818181818, |
| "grad_norm": 547461831589888.0, |
| "learning_rate": 2.8465852957995485e-07, |
| "loss": 26.504672241210937, |
| "step": 7060 |
| }, |
| { |
| "epoch": 0.6427272727272727, |
| "grad_norm": 256846124285952.0, |
| "learning_rate": 2.833706378719559e-07, |
| "loss": 27.03226318359375, |
| "step": 7070 |
| }, |
| { |
| "epoch": 0.6436363636363637, |
| "grad_norm": 146097339105280.0, |
| "learning_rate": 2.8208451314300876e-07, |
| "loss": 26.550949096679688, |
| "step": 7080 |
| }, |
| { |
| "epoch": 0.6445454545454545, |
| "grad_norm": 463059382435840.0, |
| "learning_rate": 2.80800165883637e-07, |
| "loss": 26.586752319335936, |
| "step": 7090 |
| }, |
| { |
| "epoch": 0.6454545454545455, |
| "grad_norm": 184904549662720.0, |
| "learning_rate": 2.7951760656986625e-07, |
| "loss": 26.651223754882814, |
| "step": 7100 |
| }, |
| { |
| "epoch": 0.6454545454545455, |
| "eval_loss": 26.276838302612305, |
| "eval_runtime": 2.1813, |
| "eval_samples_per_second": 16.504, |
| "eval_steps_per_second": 0.917, |
| "step": 7100 |
| }, |
| { |
| "epoch": 0.6463636363636364, |
| "grad_norm": 497082469187584.0, |
| "learning_rate": 2.782368456631378e-07, |
| "loss": 26.286236572265626, |
| "step": 7110 |
| }, |
| { |
| "epoch": 0.6472727272727272, |
| "grad_norm": 164335598960640.0, |
| "learning_rate": 2.769578936102245e-07, |
| "loss": 26.465399169921874, |
| "step": 7120 |
| }, |
| { |
| "epoch": 0.6481818181818182, |
| "grad_norm": 223688372781056.0, |
| "learning_rate": 2.756807608431447e-07, |
| "loss": 26.540838623046874, |
| "step": 7130 |
| }, |
| { |
| "epoch": 0.649090909090909, |
| "grad_norm": 362925608927232.0, |
| "learning_rate": 2.744054577790774e-07, |
| "loss": 26.485153198242188, |
| "step": 7140 |
| }, |
| { |
| "epoch": 0.65, |
| "grad_norm": 118669761839104.0, |
| "learning_rate": 2.731319948202776e-07, |
| "loss": 26.7018798828125, |
| "step": 7150 |
| }, |
| { |
| "epoch": 0.6509090909090909, |
| "grad_norm": 440564222787584.0, |
| "learning_rate": 2.7186038235399027e-07, |
| "loss": 26.294155883789063, |
| "step": 7160 |
| }, |
| { |
| "epoch": 0.6518181818181819, |
| "grad_norm": 391212498419712.0, |
| "learning_rate": 2.705906307523673e-07, |
| "loss": 26.423309326171875, |
| "step": 7170 |
| }, |
| { |
| "epoch": 0.6527272727272727, |
| "grad_norm": 291606871670784.0, |
| "learning_rate": 2.693227503723819e-07, |
| "loss": 26.983016967773438, |
| "step": 7180 |
| }, |
| { |
| "epoch": 0.6536363636363637, |
| "grad_norm": 239193305382912.0, |
| "learning_rate": 2.6805675155574425e-07, |
| "loss": 26.53931884765625, |
| "step": 7190 |
| }, |
| { |
| "epoch": 0.6545454545454545, |
| "grad_norm": 95832472813568.0, |
| "learning_rate": 2.667926446288169e-07, |
| "loss": 26.326837158203126, |
| "step": 7200 |
| }, |
| { |
| "epoch": 0.6545454545454545, |
| "eval_loss": 26.273149490356445, |
| "eval_runtime": 2.1822, |
| "eval_samples_per_second": 16.497, |
| "eval_steps_per_second": 0.916, |
| "step": 7200 |
| }, |
| { |
| "epoch": 0.6554545454545454, |
| "grad_norm": 246679919919104.0, |
| "learning_rate": 2.655304399025312e-07, |
| "loss": 26.533935546875, |
| "step": 7210 |
| }, |
| { |
| "epoch": 0.6563636363636364, |
| "grad_norm": 521899461312512.0, |
| "learning_rate": 2.6427014767230294e-07, |
| "loss": 26.514251708984375, |
| "step": 7220 |
| }, |
| { |
| "epoch": 0.6572727272727272, |
| "grad_norm": 228885098659840.0, |
| "learning_rate": 2.630117782179475e-07, |
| "loss": 26.712460327148438, |
| "step": 7230 |
| }, |
| { |
| "epoch": 0.6581818181818182, |
| "grad_norm": 271884381847552.0, |
| "learning_rate": 2.6175534180359813e-07, |
| "loss": 26.149929809570313, |
| "step": 7240 |
| }, |
| { |
| "epoch": 0.6590909090909091, |
| "grad_norm": 474217908797440.0, |
| "learning_rate": 2.605008486776195e-07, |
| "loss": 26.453692626953124, |
| "step": 7250 |
| }, |
| { |
| "epoch": 0.66, |
| "grad_norm": 357043785433088.0, |
| "learning_rate": 2.5924830907252614e-07, |
| "loss": 26.58966064453125, |
| "step": 7260 |
| }, |
| { |
| "epoch": 0.6609090909090909, |
| "grad_norm": 641387800297472.0, |
| "learning_rate": 2.5799773320489827e-07, |
| "loss": 26.886062622070312, |
| "step": 7270 |
| }, |
| { |
| "epoch": 0.6618181818181819, |
| "grad_norm": 117462062333952.0, |
| "learning_rate": 2.5674913127529867e-07, |
| "loss": 26.308395385742188, |
| "step": 7280 |
| }, |
| { |
| "epoch": 0.6627272727272727, |
| "grad_norm": 351057137893376.0, |
| "learning_rate": 2.555025134681886e-07, |
| "loss": 26.34556884765625, |
| "step": 7290 |
| }, |
| { |
| "epoch": 0.6636363636363637, |
| "grad_norm": 148489820438528.0, |
| "learning_rate": 2.542578899518463e-07, |
| "loss": 26.660372924804687, |
| "step": 7300 |
| }, |
| { |
| "epoch": 0.6636363636363637, |
| "eval_loss": 26.275470733642578, |
| "eval_runtime": 2.1726, |
| "eval_samples_per_second": 16.57, |
| "eval_steps_per_second": 0.921, |
| "step": 7300 |
| }, |
| { |
| "epoch": 0.6645454545454546, |
| "grad_norm": 291709548232704.0, |
| "learning_rate": 2.5301527087828287e-07, |
| "loss": 26.54521789550781, |
| "step": 7310 |
| }, |
| { |
| "epoch": 0.6654545454545454, |
| "grad_norm": 360566128377856.0, |
| "learning_rate": 2.5177466638315945e-07, |
| "loss": 26.633468627929688, |
| "step": 7320 |
| }, |
| { |
| "epoch": 0.6663636363636364, |
| "grad_norm": 262026844700672.0, |
| "learning_rate": 2.505360865857054e-07, |
| "loss": 26.330783081054687, |
| "step": 7330 |
| }, |
| { |
| "epoch": 0.6672727272727272, |
| "grad_norm": 365513158950912.0, |
| "learning_rate": 2.492995415886349e-07, |
| "loss": 26.3236572265625, |
| "step": 7340 |
| }, |
| { |
| "epoch": 0.6681818181818182, |
| "grad_norm": 80057695469568.0, |
| "learning_rate": 2.480650414780653e-07, |
| "loss": 26.489703369140624, |
| "step": 7350 |
| }, |
| { |
| "epoch": 0.6690909090909091, |
| "grad_norm": 269574847070208.0, |
| "learning_rate": 2.4683259632343364e-07, |
| "loss": 26.589083862304687, |
| "step": 7360 |
| }, |
| { |
| "epoch": 0.67, |
| "grad_norm": 106464077152256.0, |
| "learning_rate": 2.456022161774164e-07, |
| "loss": 26.390362548828126, |
| "step": 7370 |
| }, |
| { |
| "epoch": 0.6709090909090909, |
| "grad_norm": 200526067138560.0, |
| "learning_rate": 2.4437391107584556e-07, |
| "loss": 26.3364990234375, |
| "step": 7380 |
| }, |
| { |
| "epoch": 0.6718181818181819, |
| "grad_norm": 174280209858560.0, |
| "learning_rate": 2.4314769103762784e-07, |
| "loss": 26.455654907226563, |
| "step": 7390 |
| }, |
| { |
| "epoch": 0.6727272727272727, |
| "grad_norm": 114393173983232.0, |
| "learning_rate": 2.4192356606466303e-07, |
| "loss": 26.521585083007814, |
| "step": 7400 |
| }, |
| { |
| "epoch": 0.6727272727272727, |
| "eval_loss": 26.27696418762207, |
| "eval_runtime": 2.1578, |
| "eval_samples_per_second": 16.684, |
| "eval_steps_per_second": 0.927, |
| "step": 7400 |
| }, |
| { |
| "epoch": 0.6736363636363636, |
| "grad_norm": 203887600467968.0, |
| "learning_rate": 2.407015461417616e-07, |
| "loss": 26.397149658203126, |
| "step": 7410 |
| }, |
| { |
| "epoch": 0.6745454545454546, |
| "grad_norm": 152426476732416.0, |
| "learning_rate": 2.394816412365642e-07, |
| "loss": 26.610260009765625, |
| "step": 7420 |
| }, |
| { |
| "epoch": 0.6754545454545454, |
| "grad_norm": 281785892077568.0, |
| "learning_rate": 2.3826386129945976e-07, |
| "loss": 26.886895751953126, |
| "step": 7430 |
| }, |
| { |
| "epoch": 0.6763636363636364, |
| "grad_norm": 123647452774400.0, |
| "learning_rate": 2.3704821626350468e-07, |
| "loss": 26.532232666015624, |
| "step": 7440 |
| }, |
| { |
| "epoch": 0.6772727272727272, |
| "grad_norm": 195468189499392.0, |
| "learning_rate": 2.358347160443412e-07, |
| "loss": 26.519247436523436, |
| "step": 7450 |
| }, |
| { |
| "epoch": 0.6781818181818182, |
| "grad_norm": 55197703340032.0, |
| "learning_rate": 2.3462337054011732e-07, |
| "loss": 26.758151245117187, |
| "step": 7460 |
| }, |
| { |
| "epoch": 0.6790909090909091, |
| "grad_norm": 67209904783360.0, |
| "learning_rate": 2.334141896314057e-07, |
| "loss": 26.347998046875, |
| "step": 7470 |
| }, |
| { |
| "epoch": 0.68, |
| "grad_norm": 134699796135936.0, |
| "learning_rate": 2.3220718318112281e-07, |
| "loss": 26.302090454101563, |
| "step": 7480 |
| }, |
| { |
| "epoch": 0.6809090909090909, |
| "grad_norm": 224456467283968.0, |
| "learning_rate": 2.310023610344492e-07, |
| "loss": 26.276641845703125, |
| "step": 7490 |
| }, |
| { |
| "epoch": 0.6818181818181818, |
| "grad_norm": 669328441606144.0, |
| "learning_rate": 2.2979973301874795e-07, |
| "loss": 26.991085815429688, |
| "step": 7500 |
| }, |
| { |
| "epoch": 0.6818181818181818, |
| "eval_loss": 26.273746490478516, |
| "eval_runtime": 2.155, |
| "eval_samples_per_second": 16.705, |
| "eval_steps_per_second": 0.928, |
| "step": 7500 |
| }, |
| { |
| "epoch": 0.6827272727272727, |
| "grad_norm": 246346388865024.0, |
| "learning_rate": 2.2859930894348594e-07, |
| "loss": 26.169650268554687, |
| "step": 7510 |
| }, |
| { |
| "epoch": 0.6836363636363636, |
| "grad_norm": 117372857876480.0, |
| "learning_rate": 2.2740109860015304e-07, |
| "loss": 26.467178344726562, |
| "step": 7520 |
| }, |
| { |
| "epoch": 0.6845454545454546, |
| "grad_norm": 186215957528576.0, |
| "learning_rate": 2.2620511176218255e-07, |
| "loss": 26.1698486328125, |
| "step": 7530 |
| }, |
| { |
| "epoch": 0.6854545454545454, |
| "grad_norm": 167226934034432.0, |
| "learning_rate": 2.250113581848706e-07, |
| "loss": 26.436212158203126, |
| "step": 7540 |
| }, |
| { |
| "epoch": 0.6863636363636364, |
| "grad_norm": 54176792969216.0, |
| "learning_rate": 2.2381984760529816e-07, |
| "loss": 26.699081420898438, |
| "step": 7550 |
| }, |
| { |
| "epoch": 0.6872727272727273, |
| "grad_norm": 131126349791232.0, |
| "learning_rate": 2.2263058974225023e-07, |
| "loss": 26.650469970703124, |
| "step": 7560 |
| }, |
| { |
| "epoch": 0.6881818181818182, |
| "grad_norm": 190212038721536.0, |
| "learning_rate": 2.214435942961377e-07, |
| "loss": 26.493695068359376, |
| "step": 7570 |
| }, |
| { |
| "epoch": 0.6890909090909091, |
| "grad_norm": 263704901844992.0, |
| "learning_rate": 2.2025887094891655e-07, |
| "loss": 26.46141662597656, |
| "step": 7580 |
| }, |
| { |
| "epoch": 0.69, |
| "grad_norm": 391329167179776.0, |
| "learning_rate": 2.19076429364011e-07, |
| "loss": 26.3736083984375, |
| "step": 7590 |
| }, |
| { |
| "epoch": 0.6909090909090909, |
| "grad_norm": 119184780427264.0, |
| "learning_rate": 2.178962791862333e-07, |
| "loss": 26.546969604492187, |
| "step": 7600 |
| }, |
| { |
| "epoch": 0.6909090909090909, |
| "eval_loss": 26.27129364013672, |
| "eval_runtime": 2.1527, |
| "eval_samples_per_second": 16.723, |
| "eval_steps_per_second": 0.929, |
| "step": 7600 |
| }, |
| { |
| "epoch": 0.6918181818181818, |
| "grad_norm": 177234845368320.0, |
| "learning_rate": 2.1671843004170483e-07, |
| "loss": 26.3050048828125, |
| "step": 7610 |
| }, |
| { |
| "epoch": 0.6927272727272727, |
| "grad_norm": 323850130685952.0, |
| "learning_rate": 2.1554289153777933e-07, |
| "loss": 26.890570068359374, |
| "step": 7620 |
| }, |
| { |
| "epoch": 0.6936363636363636, |
| "grad_norm": 153877135491072.0, |
| "learning_rate": 2.1436967326296213e-07, |
| "loss": 26.495651245117188, |
| "step": 7630 |
| }, |
| { |
| "epoch": 0.6945454545454546, |
| "grad_norm": 196137852076032.0, |
| "learning_rate": 2.1319878478683396e-07, |
| "loss": 26.359036254882813, |
| "step": 7640 |
| }, |
| { |
| "epoch": 0.6954545454545454, |
| "grad_norm": 99828335902720.0, |
| "learning_rate": 2.1203023565997173e-07, |
| "loss": 26.25531005859375, |
| "step": 7650 |
| }, |
| { |
| "epoch": 0.6963636363636364, |
| "grad_norm": 566579267895296.0, |
| "learning_rate": 2.1086403541387144e-07, |
| "loss": 26.096768188476563, |
| "step": 7660 |
| }, |
| { |
| "epoch": 0.6972727272727273, |
| "grad_norm": 206705417781248.0, |
| "learning_rate": 2.097001935608692e-07, |
| "loss": 26.354949951171875, |
| "step": 7670 |
| }, |
| { |
| "epoch": 0.6981818181818182, |
| "grad_norm": 88147518029824.0, |
| "learning_rate": 2.085387195940651e-07, |
| "loss": 26.522039794921874, |
| "step": 7680 |
| }, |
| { |
| "epoch": 0.6990909090909091, |
| "grad_norm": 223890320130048.0, |
| "learning_rate": 2.073796229872451e-07, |
| "loss": 26.2290283203125, |
| "step": 7690 |
| }, |
| { |
| "epoch": 0.7, |
| "grad_norm": 142860158500864.0, |
| "learning_rate": 2.0622291319480316e-07, |
| "loss": 26.3935791015625, |
| "step": 7700 |
| }, |
| { |
| "epoch": 0.7, |
| "eval_loss": 26.27055549621582, |
| "eval_runtime": 2.1622, |
| "eval_samples_per_second": 16.649, |
| "eval_steps_per_second": 0.925, |
| "step": 7700 |
| }, |
| { |
| "epoch": 0.7009090909090909, |
| "grad_norm": 76660552499200.0, |
| "learning_rate": 2.0506859965166546e-07, |
| "loss": 26.559854125976564, |
| "step": 7710 |
| }, |
| { |
| "epoch": 0.7018181818181818, |
| "grad_norm": 165078661857280.0, |
| "learning_rate": 2.039166917732123e-07, |
| "loss": 26.336550903320312, |
| "step": 7720 |
| }, |
| { |
| "epoch": 0.7027272727272728, |
| "grad_norm": 131228850192384.0, |
| "learning_rate": 2.02767198955202e-07, |
| "loss": 26.307232666015626, |
| "step": 7730 |
| }, |
| { |
| "epoch": 0.7036363636363636, |
| "grad_norm": 158765814906880.0, |
| "learning_rate": 2.0162013057369327e-07, |
| "loss": 26.472689819335937, |
| "step": 7740 |
| }, |
| { |
| "epoch": 0.7045454545454546, |
| "grad_norm": 415826083577856.0, |
| "learning_rate": 2.0047549598497064e-07, |
| "loss": 26.57115478515625, |
| "step": 7750 |
| }, |
| { |
| "epoch": 0.7054545454545454, |
| "grad_norm": 340710863667200.0, |
| "learning_rate": 1.9933330452546575e-07, |
| "loss": 26.334005737304686, |
| "step": 7760 |
| }, |
| { |
| "epoch": 0.7063636363636364, |
| "grad_norm": 200871073808384.0, |
| "learning_rate": 1.9819356551168304e-07, |
| "loss": 26.425982666015624, |
| "step": 7770 |
| }, |
| { |
| "epoch": 0.7072727272727273, |
| "grad_norm": 326121094643712.0, |
| "learning_rate": 1.9705628824012315e-07, |
| "loss": 26.586672973632812, |
| "step": 7780 |
| }, |
| { |
| "epoch": 0.7081818181818181, |
| "grad_norm": 311439185149952.0, |
| "learning_rate": 1.9592148198720655e-07, |
| "loss": 26.54600830078125, |
| "step": 7790 |
| }, |
| { |
| "epoch": 0.7090909090909091, |
| "grad_norm": 154627949461504.0, |
| "learning_rate": 1.9478915600919877e-07, |
| "loss": 26.687026977539062, |
| "step": 7800 |
| }, |
| { |
| "epoch": 0.7090909090909091, |
| "eval_loss": 26.266042709350586, |
| "eval_runtime": 2.1833, |
| "eval_samples_per_second": 16.489, |
| "eval_steps_per_second": 0.916, |
| "step": 7800 |
| }, |
| { |
| "epoch": 0.71, |
| "grad_norm": 325412290822144.0, |
| "learning_rate": 1.9365931954213443e-07, |
| "loss": 26.345108032226562, |
| "step": 7810 |
| }, |
| { |
| "epoch": 0.7109090909090909, |
| "grad_norm": 103427434610688.0, |
| "learning_rate": 1.9253198180174213e-07, |
| "loss": 26.439935302734376, |
| "step": 7820 |
| }, |
| { |
| "epoch": 0.7118181818181818, |
| "grad_norm": 491774460035072.0, |
| "learning_rate": 1.9140715198336844e-07, |
| "loss": 26.82066650390625, |
| "step": 7830 |
| }, |
| { |
| "epoch": 0.7127272727272728, |
| "grad_norm": 210541125566464.0, |
| "learning_rate": 1.9028483926190474e-07, |
| "loss": 26.39219970703125, |
| "step": 7840 |
| }, |
| { |
| "epoch": 0.7136363636363636, |
| "grad_norm": 856512243171328.0, |
| "learning_rate": 1.8916505279171007e-07, |
| "loss": 26.36131591796875, |
| "step": 7850 |
| }, |
| { |
| "epoch": 0.7145454545454546, |
| "grad_norm": 417027902668800.0, |
| "learning_rate": 1.8804780170653833e-07, |
| "loss": 26.504092407226562, |
| "step": 7860 |
| }, |
| { |
| "epoch": 0.7154545454545455, |
| "grad_norm": 292983341580288.0, |
| "learning_rate": 1.8693309511946304e-07, |
| "loss": 26.41829833984375, |
| "step": 7870 |
| }, |
| { |
| "epoch": 0.7163636363636363, |
| "grad_norm": 327994371473408.0, |
| "learning_rate": 1.8582094212280237e-07, |
| "loss": 26.64545593261719, |
| "step": 7880 |
| }, |
| { |
| "epoch": 0.7172727272727273, |
| "grad_norm": 218186469343232.0, |
| "learning_rate": 1.8471135178804641e-07, |
| "loss": 26.180670166015624, |
| "step": 7890 |
| }, |
| { |
| "epoch": 0.7181818181818181, |
| "grad_norm": 82476139544576.0, |
| "learning_rate": 1.8360433316578205e-07, |
| "loss": 26.653558349609376, |
| "step": 7900 |
| }, |
| { |
| "epoch": 0.7181818181818181, |
| "eval_loss": 26.26190948486328, |
| "eval_runtime": 2.1559, |
| "eval_samples_per_second": 16.698, |
| "eval_steps_per_second": 0.928, |
| "step": 7900 |
| }, |
| { |
| "epoch": 0.7190909090909091, |
| "grad_norm": 118652909125632.0, |
| "learning_rate": 1.8249989528561976e-07, |
| "loss": 26.234396362304686, |
| "step": 7910 |
| }, |
| { |
| "epoch": 0.72, |
| "grad_norm": 125824606928896.0, |
| "learning_rate": 1.8139804715611916e-07, |
| "loss": 26.377532958984375, |
| "step": 7920 |
| }, |
| { |
| "epoch": 0.7209090909090909, |
| "grad_norm": 130430497980416.0, |
| "learning_rate": 1.8029879776471661e-07, |
| "loss": 26.323135375976562, |
| "step": 7930 |
| }, |
| { |
| "epoch": 0.7218181818181818, |
| "grad_norm": 189826951282688.0, |
| "learning_rate": 1.792021560776511e-07, |
| "loss": 26.728903198242186, |
| "step": 7940 |
| }, |
| { |
| "epoch": 0.7227272727272728, |
| "grad_norm": 148400968302592.0, |
| "learning_rate": 1.781081310398917e-07, |
| "loss": 26.242092895507813, |
| "step": 7950 |
| }, |
| { |
| "epoch": 0.7236363636363636, |
| "grad_norm": 134777038438400.0, |
| "learning_rate": 1.770167315750636e-07, |
| "loss": 26.503350830078126, |
| "step": 7960 |
| }, |
| { |
| "epoch": 0.7245454545454545, |
| "grad_norm": 511105268973568.0, |
| "learning_rate": 1.7592796658537658e-07, |
| "loss": 26.567254638671876, |
| "step": 7970 |
| }, |
| { |
| "epoch": 0.7254545454545455, |
| "grad_norm": 110472221163520.0, |
| "learning_rate": 1.748418449515519e-07, |
| "loss": 26.81078186035156, |
| "step": 7980 |
| }, |
| { |
| "epoch": 0.7263636363636363, |
| "grad_norm": 329754871857152.0, |
| "learning_rate": 1.7375837553274897e-07, |
| "loss": 26.368780517578124, |
| "step": 7990 |
| }, |
| { |
| "epoch": 0.7272727272727273, |
| "grad_norm": 74490444775424.0, |
| "learning_rate": 1.7267756716649523e-07, |
| "loss": 26.744158935546874, |
| "step": 8000 |
| }, |
| { |
| "epoch": 0.7272727272727273, |
| "eval_loss": 26.262548446655273, |
| "eval_runtime": 2.1821, |
| "eval_samples_per_second": 16.498, |
| "eval_steps_per_second": 0.917, |
| "step": 8000 |
| }, |
| { |
| "epoch": 0.7281818181818182, |
| "grad_norm": 204158569283584.0, |
| "learning_rate": 1.7159942866861132e-07, |
| "loss": 26.29222412109375, |
| "step": 8010 |
| }, |
| { |
| "epoch": 0.7290909090909091, |
| "grad_norm": 145085589094400.0, |
| "learning_rate": 1.7052396883314152e-07, |
| "loss": 26.959561157226563, |
| "step": 8020 |
| }, |
| { |
| "epoch": 0.73, |
| "grad_norm": 110825029238784.0, |
| "learning_rate": 1.6945119643228072e-07, |
| "loss": 26.370242309570312, |
| "step": 8030 |
| }, |
| { |
| "epoch": 0.730909090909091, |
| "grad_norm": 252334294695936.0, |
| "learning_rate": 1.6838112021630356e-07, |
| "loss": 26.4259765625, |
| "step": 8040 |
| }, |
| { |
| "epoch": 0.7318181818181818, |
| "grad_norm": 193456450306048.0, |
| "learning_rate": 1.673137489134921e-07, |
| "loss": 26.351275634765624, |
| "step": 8050 |
| }, |
| { |
| "epoch": 0.7327272727272728, |
| "grad_norm": 61600425836544.0, |
| "learning_rate": 1.6624909123006575e-07, |
| "loss": 26.925289916992188, |
| "step": 8060 |
| }, |
| { |
| "epoch": 0.7336363636363636, |
| "grad_norm": 259621981782016.0, |
| "learning_rate": 1.651871558501099e-07, |
| "loss": 26.745242309570312, |
| "step": 8070 |
| }, |
| { |
| "epoch": 0.7345454545454545, |
| "grad_norm": 150932784414720.0, |
| "learning_rate": 1.6412795143550427e-07, |
| "loss": 26.458816528320312, |
| "step": 8080 |
| }, |
| { |
| "epoch": 0.7354545454545455, |
| "grad_norm": 522992664707072.0, |
| "learning_rate": 1.6307148662585362e-07, |
| "loss": 26.513919067382812, |
| "step": 8090 |
| }, |
| { |
| "epoch": 0.7363636363636363, |
| "grad_norm": 129581780566016.0, |
| "learning_rate": 1.6201777003841633e-07, |
| "loss": 26.6354248046875, |
| "step": 8100 |
| }, |
| { |
| "epoch": 0.7363636363636363, |
| "eval_loss": 26.260547637939453, |
| "eval_runtime": 2.1543, |
| "eval_samples_per_second": 16.711, |
| "eval_steps_per_second": 0.928, |
| "step": 8100 |
| }, |
| { |
| "epoch": 0.7372727272727273, |
| "grad_norm": 220818277662720.0, |
| "learning_rate": 1.6096681026803443e-07, |
| "loss": 26.771890258789064, |
| "step": 8110 |
| }, |
| { |
| "epoch": 0.7381818181818182, |
| "grad_norm": 389124204789760.0, |
| "learning_rate": 1.5991861588706306e-07, |
| "loss": 26.528866577148438, |
| "step": 8120 |
| }, |
| { |
| "epoch": 0.7390909090909091, |
| "grad_norm": 421828568809472.0, |
| "learning_rate": 1.588731954453018e-07, |
| "loss": 26.294219970703125, |
| "step": 8130 |
| }, |
| { |
| "epoch": 0.74, |
| "grad_norm": 186962057101312.0, |
| "learning_rate": 1.5783055746992312e-07, |
| "loss": 26.486737060546876, |
| "step": 8140 |
| }, |
| { |
| "epoch": 0.740909090909091, |
| "grad_norm": 320954349649920.0, |
| "learning_rate": 1.5679071046540432e-07, |
| "loss": 26.416116333007814, |
| "step": 8150 |
| }, |
| { |
| "epoch": 0.7418181818181818, |
| "grad_norm": 448088032411648.0, |
| "learning_rate": 1.5575366291345759e-07, |
| "loss": 26.369647216796874, |
| "step": 8160 |
| }, |
| { |
| "epoch": 0.7427272727272727, |
| "grad_norm": 405070747271168.0, |
| "learning_rate": 1.547194232729604e-07, |
| "loss": 26.7183837890625, |
| "step": 8170 |
| }, |
| { |
| "epoch": 0.7436363636363637, |
| "grad_norm": 392587995250688.0, |
| "learning_rate": 1.536879999798874e-07, |
| "loss": 26.57523193359375, |
| "step": 8180 |
| }, |
| { |
| "epoch": 0.7445454545454545, |
| "grad_norm": 414031860989952.0, |
| "learning_rate": 1.5265940144724114e-07, |
| "loss": 26.745343017578126, |
| "step": 8190 |
| }, |
| { |
| "epoch": 0.7454545454545455, |
| "grad_norm": 151567047065600.0, |
| "learning_rate": 1.516336360649834e-07, |
| "loss": 26.580767822265624, |
| "step": 8200 |
| }, |
| { |
| "epoch": 0.7454545454545455, |
| "eval_loss": 26.26454734802246, |
| "eval_runtime": 2.1459, |
| "eval_samples_per_second": 16.776, |
| "eval_steps_per_second": 0.932, |
| "step": 8200 |
| }, |
| { |
| "epoch": 0.7463636363636363, |
| "grad_norm": 140819075956736.0, |
| "learning_rate": 1.506107121999664e-07, |
| "loss": 26.278732299804688, |
| "step": 8210 |
| }, |
| { |
| "epoch": 0.7472727272727273, |
| "grad_norm": 66263875321856.0, |
| "learning_rate": 1.4959063819586593e-07, |
| "loss": 26.610507202148437, |
| "step": 8220 |
| }, |
| { |
| "epoch": 0.7481818181818182, |
| "grad_norm": 438402814050304.0, |
| "learning_rate": 1.4857342237311138e-07, |
| "loss": 26.609988403320312, |
| "step": 8230 |
| }, |
| { |
| "epoch": 0.7490909090909091, |
| "grad_norm": 509375739330560.0, |
| "learning_rate": 1.4755907302881927e-07, |
| "loss": 26.591030883789063, |
| "step": 8240 |
| }, |
| { |
| "epoch": 0.75, |
| "grad_norm": 469766544293888.0, |
| "learning_rate": 1.465475984367253e-07, |
| "loss": 26.608944702148438, |
| "step": 8250 |
| }, |
| { |
| "epoch": 0.7509090909090909, |
| "grad_norm": 205435751628800.0, |
| "learning_rate": 1.4553900684711623e-07, |
| "loss": 26.571286010742188, |
| "step": 8260 |
| }, |
| { |
| "epoch": 0.7518181818181818, |
| "grad_norm": 146254860386304.0, |
| "learning_rate": 1.4453330648676338e-07, |
| "loss": 26.6401611328125, |
| "step": 8270 |
| }, |
| { |
| "epoch": 0.7527272727272727, |
| "grad_norm": 406260688093184.0, |
| "learning_rate": 1.435305055588552e-07, |
| "loss": 26.502618408203126, |
| "step": 8280 |
| }, |
| { |
| "epoch": 0.7536363636363637, |
| "grad_norm": 163714019885056.0, |
| "learning_rate": 1.425306122429305e-07, |
| "loss": 26.30799560546875, |
| "step": 8290 |
| }, |
| { |
| "epoch": 0.7545454545454545, |
| "grad_norm": 265974758506496.0, |
| "learning_rate": 1.4153363469481107e-07, |
| "loss": 26.497518920898436, |
| "step": 8300 |
| }, |
| { |
| "epoch": 0.7545454545454545, |
| "eval_loss": 26.25794792175293, |
| "eval_runtime": 2.1488, |
| "eval_samples_per_second": 16.753, |
| "eval_steps_per_second": 0.931, |
| "step": 8300 |
| }, |
| { |
| "epoch": 0.7554545454545455, |
| "grad_norm": 144185525010432.0, |
| "learning_rate": 1.4053958104653612e-07, |
| "loss": 26.401416015625, |
| "step": 8310 |
| }, |
| { |
| "epoch": 0.7563636363636363, |
| "grad_norm": 80316861513728.0, |
| "learning_rate": 1.395484594062954e-07, |
| "loss": 26.3766357421875, |
| "step": 8320 |
| }, |
| { |
| "epoch": 0.7572727272727273, |
| "grad_norm": 405346531147776.0, |
| "learning_rate": 1.3856027785836333e-07, |
| "loss": 26.344137573242186, |
| "step": 8330 |
| }, |
| { |
| "epoch": 0.7581818181818182, |
| "grad_norm": 155818091610112.0, |
| "learning_rate": 1.3757504446303248e-07, |
| "loss": 26.66131591796875, |
| "step": 8340 |
| }, |
| { |
| "epoch": 0.759090909090909, |
| "grad_norm": 264115809419264.0, |
| "learning_rate": 1.365927672565486e-07, |
| "loss": 26.72258605957031, |
| "step": 8350 |
| }, |
| { |
| "epoch": 0.76, |
| "grad_norm": 289586693537792.0, |
| "learning_rate": 1.356134542510448e-07, |
| "loss": 26.394635009765626, |
| "step": 8360 |
| }, |
| { |
| "epoch": 0.7609090909090909, |
| "grad_norm": 74874424918016.0, |
| "learning_rate": 1.3463711343447547e-07, |
| "loss": 26.273269653320312, |
| "step": 8370 |
| }, |
| { |
| "epoch": 0.7618181818181818, |
| "grad_norm": 576587481219072.0, |
| "learning_rate": 1.336637527705529e-07, |
| "loss": 26.7587890625, |
| "step": 8380 |
| }, |
| { |
| "epoch": 0.7627272727272727, |
| "grad_norm": 132786539200512.0, |
| "learning_rate": 1.3269338019868003e-07, |
| "loss": 26.890203857421874, |
| "step": 8390 |
| }, |
| { |
| "epoch": 0.7636363636363637, |
| "grad_norm": 113306773749760.0, |
| "learning_rate": 1.3172600363388752e-07, |
| "loss": 26.88782958984375, |
| "step": 8400 |
| }, |
| { |
| "epoch": 0.7636363636363637, |
| "eval_loss": 26.261314392089844, |
| "eval_runtime": 2.1523, |
| "eval_samples_per_second": 16.726, |
| "eval_steps_per_second": 0.929, |
| "step": 8400 |
| }, |
| { |
| "epoch": 0.7645454545454545, |
| "grad_norm": 287690733912064.0, |
| "learning_rate": 1.3076163096676828e-07, |
| "loss": 25.92532958984375, |
| "step": 8410 |
| }, |
| { |
| "epoch": 0.7654545454545455, |
| "grad_norm": 170665340567552.0, |
| "learning_rate": 1.2980027006341371e-07, |
| "loss": 26.285894775390624, |
| "step": 8420 |
| }, |
| { |
| "epoch": 0.7663636363636364, |
| "grad_norm": 293886157127680.0, |
| "learning_rate": 1.288419287653485e-07, |
| "loss": 26.6665771484375, |
| "step": 8430 |
| }, |
| { |
| "epoch": 0.7672727272727272, |
| "grad_norm": 211919927508992.0, |
| "learning_rate": 1.2788661488946788e-07, |
| "loss": 26.39056396484375, |
| "step": 8440 |
| }, |
| { |
| "epoch": 0.7681818181818182, |
| "grad_norm": 160566647717888.0, |
| "learning_rate": 1.2693433622797346e-07, |
| "loss": 26.330914306640626, |
| "step": 8450 |
| }, |
| { |
| "epoch": 0.769090909090909, |
| "grad_norm": 168821155430400.0, |
| "learning_rate": 1.2598510054830885e-07, |
| "loss": 26.57433166503906, |
| "step": 8460 |
| }, |
| { |
| "epoch": 0.77, |
| "grad_norm": 341319708835840.0, |
| "learning_rate": 1.250389155930976e-07, |
| "loss": 26.557040405273437, |
| "step": 8470 |
| }, |
| { |
| "epoch": 0.7709090909090909, |
| "grad_norm": 291579591917568.0, |
| "learning_rate": 1.240957890800793e-07, |
| "loss": 26.230010986328125, |
| "step": 8480 |
| }, |
| { |
| "epoch": 0.7718181818181818, |
| "grad_norm": 246938574258176.0, |
| "learning_rate": 1.2315572870204665e-07, |
| "loss": 26.432733154296876, |
| "step": 8490 |
| }, |
| { |
| "epoch": 0.7727272727272727, |
| "grad_norm": 275942924615680.0, |
| "learning_rate": 1.2221874212678295e-07, |
| "loss": 26.655825805664062, |
| "step": 8500 |
| }, |
| { |
| "epoch": 0.7727272727272727, |
| "eval_loss": 26.262447357177734, |
| "eval_runtime": 2.1593, |
| "eval_samples_per_second": 16.672, |
| "eval_steps_per_second": 0.926, |
| "step": 8500 |
| }, |
| { |
| "epoch": 0.7736363636363637, |
| "grad_norm": 252627107446784.0, |
| "learning_rate": 1.212848369969996e-07, |
| "loss": 26.5862548828125, |
| "step": 8510 |
| }, |
| { |
| "epoch": 0.7745454545454545, |
| "grad_norm": 349064071741440.0, |
| "learning_rate": 1.2035402093027298e-07, |
| "loss": 26.767044067382812, |
| "step": 8520 |
| }, |
| { |
| "epoch": 0.7754545454545455, |
| "grad_norm": 215884400427008.0, |
| "learning_rate": 1.1942630151898353e-07, |
| "loss": 26.34154357910156, |
| "step": 8530 |
| }, |
| { |
| "epoch": 0.7763636363636364, |
| "grad_norm": 109126453559296.0, |
| "learning_rate": 1.1850168633025321e-07, |
| "loss": 26.6445556640625, |
| "step": 8540 |
| }, |
| { |
| "epoch": 0.7772727272727272, |
| "grad_norm": 59685176606720.0, |
| "learning_rate": 1.1758018290588328e-07, |
| "loss": 26.464410400390626, |
| "step": 8550 |
| }, |
| { |
| "epoch": 0.7781818181818182, |
| "grad_norm": 336345364955136.0, |
| "learning_rate": 1.1666179876229382e-07, |
| "loss": 26.180218505859376, |
| "step": 8560 |
| }, |
| { |
| "epoch": 0.7790909090909091, |
| "grad_norm": 258242475196416.0, |
| "learning_rate": 1.1574654139046169e-07, |
| "loss": 26.63001708984375, |
| "step": 8570 |
| }, |
| { |
| "epoch": 0.78, |
| "grad_norm": 308295034208256.0, |
| "learning_rate": 1.1483441825585982e-07, |
| "loss": 26.5321044921875, |
| "step": 8580 |
| }, |
| { |
| "epoch": 0.7809090909090909, |
| "grad_norm": 256095578750976.0, |
| "learning_rate": 1.139254367983955e-07, |
| "loss": 26.616192626953126, |
| "step": 8590 |
| }, |
| { |
| "epoch": 0.7818181818181819, |
| "grad_norm": 433377970749440.0, |
| "learning_rate": 1.1301960443235137e-07, |
| "loss": 26.703271484375, |
| "step": 8600 |
| }, |
| { |
| "epoch": 0.7818181818181819, |
| "eval_loss": 26.259233474731445, |
| "eval_runtime": 2.1684, |
| "eval_samples_per_second": 16.602, |
| "eval_steps_per_second": 0.922, |
| "step": 8600 |
| }, |
| { |
| "epoch": 0.7827272727272727, |
| "grad_norm": 91433688104960.0, |
| "learning_rate": 1.1211692854632292e-07, |
| "loss": 26.381759643554688, |
| "step": 8610 |
| }, |
| { |
| "epoch": 0.7836363636363637, |
| "grad_norm": 323897308217344.0, |
| "learning_rate": 1.1121741650315975e-07, |
| "loss": 26.4834228515625, |
| "step": 8620 |
| }, |
| { |
| "epoch": 0.7845454545454545, |
| "grad_norm": 615513239584768.0, |
| "learning_rate": 1.1032107563990489e-07, |
| "loss": 26.638949584960937, |
| "step": 8630 |
| }, |
| { |
| "epoch": 0.7854545454545454, |
| "grad_norm": 144044713836544.0, |
| "learning_rate": 1.0942791326773481e-07, |
| "loss": 26.390069580078126, |
| "step": 8640 |
| }, |
| { |
| "epoch": 0.7863636363636364, |
| "grad_norm": 226855877607424.0, |
| "learning_rate": 1.085379366719002e-07, |
| "loss": 26.581057739257812, |
| "step": 8650 |
| }, |
| { |
| "epoch": 0.7872727272727272, |
| "grad_norm": 750627542007808.0, |
| "learning_rate": 1.0765115311166634e-07, |
| "loss": 26.551568603515626, |
| "step": 8660 |
| }, |
| { |
| "epoch": 0.7881818181818182, |
| "grad_norm": 386196177944576.0, |
| "learning_rate": 1.0676756982025403e-07, |
| "loss": 26.428280639648438, |
| "step": 8670 |
| }, |
| { |
| "epoch": 0.7890909090909091, |
| "grad_norm": 159711546572800.0, |
| "learning_rate": 1.0588719400478002e-07, |
| "loss": 26.626437377929687, |
| "step": 8680 |
| }, |
| { |
| "epoch": 0.79, |
| "grad_norm": 170563821633536.0, |
| "learning_rate": 1.0501003284619908e-07, |
| "loss": 26.475860595703125, |
| "step": 8690 |
| }, |
| { |
| "epoch": 0.7909090909090909, |
| "grad_norm": 134558968184832.0, |
| "learning_rate": 1.041360934992449e-07, |
| "loss": 26.157559204101563, |
| "step": 8700 |
| }, |
| { |
| "epoch": 0.7909090909090909, |
| "eval_loss": 26.25774574279785, |
| "eval_runtime": 2.1872, |
| "eval_samples_per_second": 16.46, |
| "eval_steps_per_second": 0.914, |
| "step": 8700 |
| }, |
| { |
| "epoch": 0.7918181818181819, |
| "grad_norm": 72320622264320.0, |
| "learning_rate": 1.0326538309237198e-07, |
| "loss": 26.85352478027344, |
| "step": 8710 |
| }, |
| { |
| "epoch": 0.7927272727272727, |
| "grad_norm": 481769501491200.0, |
| "learning_rate": 1.0239790872769688e-07, |
| "loss": 26.115414428710938, |
| "step": 8720 |
| }, |
| { |
| "epoch": 0.7936363636363636, |
| "grad_norm": 342039317184512.0, |
| "learning_rate": 1.0153367748094126e-07, |
| "loss": 26.53397216796875, |
| "step": 8730 |
| }, |
| { |
| "epoch": 0.7945454545454546, |
| "grad_norm": 404055557931008.0, |
| "learning_rate": 1.006726964013736e-07, |
| "loss": 26.39664306640625, |
| "step": 8740 |
| }, |
| { |
| "epoch": 0.7954545454545454, |
| "grad_norm": 81613387988992.0, |
| "learning_rate": 9.98149725117512e-08, |
| "loss": 26.064663696289063, |
| "step": 8750 |
| }, |
| { |
| "epoch": 0.7963636363636364, |
| "grad_norm": 350235490516992.0, |
| "learning_rate": 9.896051280826451e-08, |
| "loss": 26.903762817382812, |
| "step": 8760 |
| }, |
| { |
| "epoch": 0.7972727272727272, |
| "grad_norm": 459837653647360.0, |
| "learning_rate": 9.810932426047802e-08, |
| "loss": 26.57601318359375, |
| "step": 8770 |
| }, |
| { |
| "epoch": 0.7981818181818182, |
| "grad_norm": 147279679848448.0, |
| "learning_rate": 9.72614138112749e-08, |
| "loss": 26.590640258789062, |
| "step": 8780 |
| }, |
| { |
| "epoch": 0.7990909090909091, |
| "grad_norm": 417567155945472.0, |
| "learning_rate": 9.641678837679983e-08, |
| "loss": 26.296502685546876, |
| "step": 8790 |
| }, |
| { |
| "epoch": 0.8, |
| "grad_norm": 84892301918208.0, |
| "learning_rate": 9.557545484640273e-08, |
| "loss": 26.586184692382812, |
| "step": 8800 |
| }, |
| { |
| "epoch": 0.8, |
| "eval_loss": 26.26275634765625, |
| "eval_runtime": 2.1775, |
| "eval_samples_per_second": 16.532, |
| "eval_steps_per_second": 0.918, |
| "step": 8800 |
| }, |
| { |
| "epoch": 0.8009090909090909, |
| "grad_norm": 709094000295936.0, |
| "learning_rate": 9.4737420082582e-08, |
| "loss": 26.503372192382812, |
| "step": 8810 |
| }, |
| { |
| "epoch": 0.8018181818181818, |
| "grad_norm": 214880770588672.0, |
| "learning_rate": 9.390269092092956e-08, |
| "loss": 26.727926635742186, |
| "step": 8820 |
| }, |
| { |
| "epoch": 0.8027272727272727, |
| "grad_norm": 206503084556288.0, |
| "learning_rate": 9.307127417007444e-08, |
| "loss": 26.764566040039064, |
| "step": 8830 |
| }, |
| { |
| "epoch": 0.8036363636363636, |
| "grad_norm": 105237830434816.0, |
| "learning_rate": 9.224317661162684e-08, |
| "loss": 26.60999755859375, |
| "step": 8840 |
| }, |
| { |
| "epoch": 0.8045454545454546, |
| "grad_norm": 101385144107008.0, |
| "learning_rate": 9.141840500012437e-08, |
| "loss": 26.486932373046876, |
| "step": 8850 |
| }, |
| { |
| "epoch": 0.8054545454545454, |
| "grad_norm": 195066056409088.0, |
| "learning_rate": 9.059696606297479e-08, |
| "loss": 26.113775634765624, |
| "step": 8860 |
| }, |
| { |
| "epoch": 0.8063636363636364, |
| "grad_norm": 116232594391040.0, |
| "learning_rate": 8.977886650040289e-08, |
| "loss": 26.361734008789064, |
| "step": 8870 |
| }, |
| { |
| "epoch": 0.8072727272727273, |
| "grad_norm": 459080464334848.0, |
| "learning_rate": 8.89641129853952e-08, |
| "loss": 26.5644287109375, |
| "step": 8880 |
| }, |
| { |
| "epoch": 0.8081818181818182, |
| "grad_norm": 279257364299776.0, |
| "learning_rate": 8.81527121636454e-08, |
| "loss": 26.242138671875, |
| "step": 8890 |
| }, |
| { |
| "epoch": 0.8090909090909091, |
| "grad_norm": 177674492313600.0, |
| "learning_rate": 8.734467065350021e-08, |
| "loss": 26.649420166015624, |
| "step": 8900 |
| }, |
| { |
| "epoch": 0.8090909090909091, |
| "eval_loss": 26.255714416503906, |
| "eval_runtime": 2.1572, |
| "eval_samples_per_second": 16.689, |
| "eval_steps_per_second": 0.927, |
| "step": 8900 |
| }, |
| { |
| "epoch": 0.81, |
| "grad_norm": 408893402382336.0, |
| "learning_rate": 8.65399950459057e-08, |
| "loss": 26.4176025390625, |
| "step": 8910 |
| }, |
| { |
| "epoch": 0.8109090909090909, |
| "grad_norm": 166783998754816.0, |
| "learning_rate": 8.573869190435335e-08, |
| "loss": 26.493902587890624, |
| "step": 8920 |
| }, |
| { |
| "epoch": 0.8118181818181818, |
| "grad_norm": 176515757113344.0, |
| "learning_rate": 8.4940767764826e-08, |
| "loss": 26.102850341796874, |
| "step": 8930 |
| }, |
| { |
| "epoch": 0.8127272727272727, |
| "grad_norm": 542467724148736.0, |
| "learning_rate": 8.414622913574549e-08, |
| "loss": 26.501849365234374, |
| "step": 8940 |
| }, |
| { |
| "epoch": 0.8136363636363636, |
| "grad_norm": 216477290463232.0, |
| "learning_rate": 8.3355082497919e-08, |
| "loss": 26.50646057128906, |
| "step": 8950 |
| }, |
| { |
| "epoch": 0.8145454545454546, |
| "grad_norm": 122593944272896.0, |
| "learning_rate": 8.256733430448637e-08, |
| "loss": 26.44368896484375, |
| "step": 8960 |
| }, |
| { |
| "epoch": 0.8154545454545454, |
| "grad_norm": 182341729255424.0, |
| "learning_rate": 8.178299098086678e-08, |
| "loss": 26.42027893066406, |
| "step": 8970 |
| }, |
| { |
| "epoch": 0.8163636363636364, |
| "grad_norm": 612390999687168.0, |
| "learning_rate": 8.100205892470785e-08, |
| "loss": 27.214886474609376, |
| "step": 8980 |
| }, |
| { |
| "epoch": 0.8172727272727273, |
| "grad_norm": 336913676369920.0, |
| "learning_rate": 8.022454450583183e-08, |
| "loss": 26.410107421875, |
| "step": 8990 |
| }, |
| { |
| "epoch": 0.8181818181818182, |
| "grad_norm": 358478572945408.0, |
| "learning_rate": 7.945045406618462e-08, |
| "loss": 26.294644165039063, |
| "step": 9000 |
| }, |
| { |
| "epoch": 0.8181818181818182, |
| "eval_loss": 26.25908088684082, |
| "eval_runtime": 2.195, |
| "eval_samples_per_second": 16.401, |
| "eval_steps_per_second": 0.911, |
| "step": 9000 |
| }, |
| { |
| "epoch": 0.8190909090909091, |
| "grad_norm": 216634107101184.0, |
| "learning_rate": 7.867979391978396e-08, |
| "loss": 26.5111083984375, |
| "step": 9010 |
| }, |
| { |
| "epoch": 0.82, |
| "grad_norm": 460943641280512.0, |
| "learning_rate": 7.791257035266719e-08, |
| "loss": 26.373800659179686, |
| "step": 9020 |
| }, |
| { |
| "epoch": 0.8209090909090909, |
| "grad_norm": 207550905581568.0, |
| "learning_rate": 7.71487896228411e-08, |
| "loss": 26.439486694335937, |
| "step": 9030 |
| }, |
| { |
| "epoch": 0.8218181818181818, |
| "grad_norm": 164937984901120.0, |
| "learning_rate": 7.638845796023002e-08, |
| "loss": 26.551513671875, |
| "step": 9040 |
| }, |
| { |
| "epoch": 0.8227272727272728, |
| "grad_norm": 467092792934400.0, |
| "learning_rate": 7.563158156662552e-08, |
| "loss": 26.31507568359375, |
| "step": 9050 |
| }, |
| { |
| "epoch": 0.8236363636363636, |
| "grad_norm": 270167032463360.0, |
| "learning_rate": 7.487816661563523e-08, |
| "loss": 26.83199462890625, |
| "step": 9060 |
| }, |
| { |
| "epoch": 0.8245454545454546, |
| "grad_norm": 329480295940096.0, |
| "learning_rate": 7.412821925263324e-08, |
| "loss": 26.249203491210938, |
| "step": 9070 |
| }, |
| { |
| "epoch": 0.8254545454545454, |
| "grad_norm": 176404423507968.0, |
| "learning_rate": 7.338174559470933e-08, |
| "loss": 26.442239379882814, |
| "step": 9080 |
| }, |
| { |
| "epoch": 0.8263636363636364, |
| "grad_norm": 232708089315328.0, |
| "learning_rate": 7.263875173061968e-08, |
| "loss": 26.62685546875, |
| "step": 9090 |
| }, |
| { |
| "epoch": 0.8272727272727273, |
| "grad_norm": 264557184417792.0, |
| "learning_rate": 7.189924372073631e-08, |
| "loss": 26.332183837890625, |
| "step": 9100 |
| }, |
| { |
| "epoch": 0.8272727272727273, |
| "eval_loss": 26.257953643798828, |
| "eval_runtime": 2.2005, |
| "eval_samples_per_second": 16.36, |
| "eval_steps_per_second": 0.909, |
| "step": 9100 |
| }, |
| { |
| "epoch": 0.8281818181818181, |
| "grad_norm": 170234988199936.0, |
| "learning_rate": 7.116322759699867e-08, |
| "loss": 26.33367919921875, |
| "step": 9110 |
| }, |
| { |
| "epoch": 0.8290909090909091, |
| "grad_norm": 260837423972352.0, |
| "learning_rate": 7.043070936286393e-08, |
| "loss": 26.51810302734375, |
| "step": 9120 |
| }, |
| { |
| "epoch": 0.83, |
| "grad_norm": 208293901369344.0, |
| "learning_rate": 6.970169499325757e-08, |
| "loss": 26.384710693359374, |
| "step": 9130 |
| }, |
| { |
| "epoch": 0.8309090909090909, |
| "grad_norm": 140174285602816.0, |
| "learning_rate": 6.89761904345259e-08, |
| "loss": 26.527005004882813, |
| "step": 9140 |
| }, |
| { |
| "epoch": 0.8318181818181818, |
| "grad_norm": 260585463742464.0, |
| "learning_rate": 6.825420160438617e-08, |
| "loss": 26.76141357421875, |
| "step": 9150 |
| }, |
| { |
| "epoch": 0.8327272727272728, |
| "grad_norm": 127458984591360.0, |
| "learning_rate": 6.753573439187915e-08, |
| "loss": 26.833413696289064, |
| "step": 9160 |
| }, |
| { |
| "epoch": 0.8336363636363636, |
| "grad_norm": 94211844079616.0, |
| "learning_rate": 6.682079465732076e-08, |
| "loss": 26.543435668945314, |
| "step": 9170 |
| }, |
| { |
| "epoch": 0.8345454545454546, |
| "grad_norm": 84640207470592.0, |
| "learning_rate": 6.61093882322547e-08, |
| "loss": 25.99791564941406, |
| "step": 9180 |
| }, |
| { |
| "epoch": 0.8354545454545454, |
| "grad_norm": 375480100323328.0, |
| "learning_rate": 6.540152091940393e-08, |
| "loss": 26.548089599609376, |
| "step": 9190 |
| }, |
| { |
| "epoch": 0.8363636363636363, |
| "grad_norm": 322556707995648.0, |
| "learning_rate": 6.469719849262445e-08, |
| "loss": 26.38921203613281, |
| "step": 9200 |
| }, |
| { |
| "epoch": 0.8363636363636363, |
| "eval_loss": 26.251873016357422, |
| "eval_runtime": 2.1916, |
| "eval_samples_per_second": 16.426, |
| "eval_steps_per_second": 0.913, |
| "step": 9200 |
| }, |
| { |
| "epoch": 0.8372727272727273, |
| "grad_norm": 52027614822400.0, |
| "learning_rate": 6.399642669685773e-08, |
| "loss": 27.601669311523438, |
| "step": 9210 |
| }, |
| { |
| "epoch": 0.8381818181818181, |
| "grad_norm": 116149614280704.0, |
| "learning_rate": 6.329921124808335e-08, |
| "loss": 26.614300537109376, |
| "step": 9220 |
| }, |
| { |
| "epoch": 0.8390909090909091, |
| "grad_norm": 124626520768512.0, |
| "learning_rate": 6.260555783327364e-08, |
| "loss": 26.363275146484376, |
| "step": 9230 |
| }, |
| { |
| "epoch": 0.84, |
| "grad_norm": 194277174935552.0, |
| "learning_rate": 6.19154721103457e-08, |
| "loss": 26.312432861328126, |
| "step": 9240 |
| }, |
| { |
| "epoch": 0.8409090909090909, |
| "grad_norm": 203244177457152.0, |
| "learning_rate": 6.122895970811659e-08, |
| "loss": 26.483282470703124, |
| "step": 9250 |
| }, |
| { |
| "epoch": 0.8418181818181818, |
| "grad_norm": 96889949126656.0, |
| "learning_rate": 6.054602622625676e-08, |
| "loss": 26.408782958984375, |
| "step": 9260 |
| }, |
| { |
| "epoch": 0.8427272727272728, |
| "grad_norm": 228295429849088.0, |
| "learning_rate": 5.986667723524452e-08, |
| "loss": 26.440960693359376, |
| "step": 9270 |
| }, |
| { |
| "epoch": 0.8436363636363636, |
| "grad_norm": 259944691531776.0, |
| "learning_rate": 5.919091827632039e-08, |
| "loss": 26.412326049804687, |
| "step": 9280 |
| }, |
| { |
| "epoch": 0.8445454545454546, |
| "grad_norm": 123276919570432.0, |
| "learning_rate": 5.8518754861442424e-08, |
| "loss": 26.436785888671874, |
| "step": 9290 |
| }, |
| { |
| "epoch": 0.8454545454545455, |
| "grad_norm": 175674060963840.0, |
| "learning_rate": 5.78501924732408e-08, |
| "loss": 26.9662353515625, |
| "step": 9300 |
| }, |
| { |
| "epoch": 0.8454545454545455, |
| "eval_loss": 26.25527000427246, |
| "eval_runtime": 2.1682, |
| "eval_samples_per_second": 16.604, |
| "eval_steps_per_second": 0.922, |
| "step": 9300 |
| }, |
| { |
| "epoch": 0.8463636363636363, |
| "grad_norm": 107211535679488.0, |
| "learning_rate": 5.7185236564973035e-08, |
| "loss": 26.846856689453126, |
| "step": 9310 |
| }, |
| { |
| "epoch": 0.8472727272727273, |
| "grad_norm": 466499886120960.0, |
| "learning_rate": 5.6523892560479957e-08, |
| "loss": 26.620623779296874, |
| "step": 9320 |
| }, |
| { |
| "epoch": 0.8481818181818181, |
| "grad_norm": 94389649014784.0, |
| "learning_rate": 5.586616585414117e-08, |
| "loss": 26.862652587890626, |
| "step": 9330 |
| }, |
| { |
| "epoch": 0.8490909090909091, |
| "grad_norm": 437626666483712.0, |
| "learning_rate": 5.52120618108311e-08, |
| "loss": 26.546505737304688, |
| "step": 9340 |
| }, |
| { |
| "epoch": 0.85, |
| "grad_norm": 238070909632512.0, |
| "learning_rate": 5.456158576587488e-08, |
| "loss": 26.345050048828124, |
| "step": 9350 |
| }, |
| { |
| "epoch": 0.850909090909091, |
| "grad_norm": 214509339803648.0, |
| "learning_rate": 5.391474302500581e-08, |
| "loss": 26.43468322753906, |
| "step": 9360 |
| }, |
| { |
| "epoch": 0.8518181818181818, |
| "grad_norm": 208559971237888.0, |
| "learning_rate": 5.32715388643209e-08, |
| "loss": 26.35069885253906, |
| "step": 9370 |
| }, |
| { |
| "epoch": 0.8527272727272728, |
| "grad_norm": 621268160217088.0, |
| "learning_rate": 5.26319785302386e-08, |
| "loss": 26.375735473632812, |
| "step": 9380 |
| }, |
| { |
| "epoch": 0.8536363636363636, |
| "grad_norm": 419072072220672.0, |
| "learning_rate": 5.199606723945593e-08, |
| "loss": 26.826263427734375, |
| "step": 9390 |
| }, |
| { |
| "epoch": 0.8545454545454545, |
| "grad_norm": 682285284196352.0, |
| "learning_rate": 5.1363810178905344e-08, |
| "loss": 26.34708251953125, |
| "step": 9400 |
| }, |
| { |
| "epoch": 0.8545454545454545, |
| "eval_loss": 26.255863189697266, |
| "eval_runtime": 2.1871, |
| "eval_samples_per_second": 16.46, |
| "eval_steps_per_second": 0.914, |
| "step": 9400 |
| }, |
| { |
| "epoch": 0.8554545454545455, |
| "grad_norm": 89044629323776.0, |
| "learning_rate": 5.073521250571328e-08, |
| "loss": 26.50580749511719, |
| "step": 9410 |
| }, |
| { |
| "epoch": 0.8563636363636363, |
| "grad_norm": 216007075430400.0, |
| "learning_rate": 5.0110279347157555e-08, |
| "loss": 26.41748046875, |
| "step": 9420 |
| }, |
| { |
| "epoch": 0.8572727272727273, |
| "grad_norm": 474563418783744.0, |
| "learning_rate": 4.9489015800625755e-08, |
| "loss": 26.493084716796876, |
| "step": 9430 |
| }, |
| { |
| "epoch": 0.8581818181818182, |
| "grad_norm": 379049620799488.0, |
| "learning_rate": 4.887142693357332e-08, |
| "loss": 26.464553833007812, |
| "step": 9440 |
| }, |
| { |
| "epoch": 0.8590909090909091, |
| "grad_norm": 80948934737920.0, |
| "learning_rate": 4.825751778348258e-08, |
| "loss": 26.62518310546875, |
| "step": 9450 |
| }, |
| { |
| "epoch": 0.86, |
| "grad_norm": 145902236860416.0, |
| "learning_rate": 4.76472933578217e-08, |
| "loss": 26.272061157226563, |
| "step": 9460 |
| }, |
| { |
| "epoch": 0.860909090909091, |
| "grad_norm": 443239853195264.0, |
| "learning_rate": 4.7040758634003585e-08, |
| "loss": 26.57243957519531, |
| "step": 9470 |
| }, |
| { |
| "epoch": 0.8618181818181818, |
| "grad_norm": 133928698511360.0, |
| "learning_rate": 4.6437918559345257e-08, |
| "loss": 26.390667724609376, |
| "step": 9480 |
| }, |
| { |
| "epoch": 0.8627272727272727, |
| "grad_norm": 188859761557504.0, |
| "learning_rate": 4.583877805102765e-08, |
| "loss": 26.467236328125, |
| "step": 9490 |
| }, |
| { |
| "epoch": 0.8636363636363636, |
| "grad_norm": 305761909473280.0, |
| "learning_rate": 4.5243341996055785e-08, |
| "loss": 26.252215576171874, |
| "step": 9500 |
| }, |
| { |
| "epoch": 0.8636363636363636, |
| "eval_loss": 26.259260177612305, |
| "eval_runtime": 2.1624, |
| "eval_samples_per_second": 16.648, |
| "eval_steps_per_second": 0.925, |
| "step": 9500 |
| }, |
| { |
| "epoch": 0.8645454545454545, |
| "grad_norm": 203417435766784.0, |
| "learning_rate": 4.465161525121797e-08, |
| "loss": 26.584759521484376, |
| "step": 9510 |
| }, |
| { |
| "epoch": 0.8654545454545455, |
| "grad_norm": 80916454047744.0, |
| "learning_rate": 4.406360264304759e-08, |
| "loss": 26.7392333984375, |
| "step": 9520 |
| }, |
| { |
| "epoch": 0.8663636363636363, |
| "grad_norm": 93687598022656.0, |
| "learning_rate": 4.3479308967782345e-08, |
| "loss": 26.5811767578125, |
| "step": 9530 |
| }, |
| { |
| "epoch": 0.8672727272727273, |
| "grad_norm": 391817216393216.0, |
| "learning_rate": 4.289873899132601e-08, |
| "loss": 26.5900146484375, |
| "step": 9540 |
| }, |
| { |
| "epoch": 0.8681818181818182, |
| "grad_norm": 220526203109376.0, |
| "learning_rate": 4.232189744920922e-08, |
| "loss": 26.462973022460936, |
| "step": 9550 |
| }, |
| { |
| "epoch": 0.8690909090909091, |
| "grad_norm": 294352429514752.0, |
| "learning_rate": 4.1748789046551046e-08, |
| "loss": 26.616650390625, |
| "step": 9560 |
| }, |
| { |
| "epoch": 0.87, |
| "grad_norm": 173306795786240.0, |
| "learning_rate": 4.117941845802026e-08, |
| "loss": 26.646002197265624, |
| "step": 9570 |
| }, |
| { |
| "epoch": 0.8709090909090909, |
| "grad_norm": 351010866331648.0, |
| "learning_rate": 4.06137903277976e-08, |
| "loss": 26.28143310546875, |
| "step": 9580 |
| }, |
| { |
| "epoch": 0.8718181818181818, |
| "grad_norm": 102902408413184.0, |
| "learning_rate": 4.0051909269537776e-08, |
| "loss": 26.641571044921875, |
| "step": 9590 |
| }, |
| { |
| "epoch": 0.8727272727272727, |
| "grad_norm": 173646198865920.0, |
| "learning_rate": 3.9493779866331457e-08, |
| "loss": 26.6406982421875, |
| "step": 9600 |
| }, |
| { |
| "epoch": 0.8727272727272727, |
| "eval_loss": 26.25297737121582, |
| "eval_runtime": 2.2018, |
| "eval_samples_per_second": 16.35, |
| "eval_steps_per_second": 0.908, |
| "step": 9600 |
| }, |
| { |
| "epoch": 0.8736363636363637, |
| "grad_norm": 186953400057856.0, |
| "learning_rate": 3.893940667066875e-08, |
| "loss": 26.639181518554686, |
| "step": 9610 |
| }, |
| { |
| "epoch": 0.8745454545454545, |
| "grad_norm": 119041461059584.0, |
| "learning_rate": 3.8388794204401055e-08, |
| "loss": 26.684365844726564, |
| "step": 9620 |
| }, |
| { |
| "epoch": 0.8754545454545455, |
| "grad_norm": 393604358995968.0, |
| "learning_rate": 3.784194695870485e-08, |
| "loss": 26.53135986328125, |
| "step": 9630 |
| }, |
| { |
| "epoch": 0.8763636363636363, |
| "grad_norm": 265332392460288.0, |
| "learning_rate": 3.7298869394044865e-08, |
| "loss": 26.410488891601563, |
| "step": 9640 |
| }, |
| { |
| "epoch": 0.8772727272727273, |
| "grad_norm": 469139042861056.0, |
| "learning_rate": 3.6759565940137846e-08, |
| "loss": 26.624411010742186, |
| "step": 9650 |
| }, |
| { |
| "epoch": 0.8781818181818182, |
| "grad_norm": 233339919269888.0, |
| "learning_rate": 3.6224040995915915e-08, |
| "loss": 26.61990966796875, |
| "step": 9660 |
| }, |
| { |
| "epoch": 0.8790909090909091, |
| "grad_norm": 160247746396160.0, |
| "learning_rate": 3.569229892949133e-08, |
| "loss": 26.281167602539064, |
| "step": 9670 |
| }, |
| { |
| "epoch": 0.88, |
| "grad_norm": 231272144175104.0, |
| "learning_rate": 3.516434407812063e-08, |
| "loss": 26.265048217773437, |
| "step": 9680 |
| }, |
| { |
| "epoch": 0.8809090909090909, |
| "grad_norm": 162941127098368.0, |
| "learning_rate": 3.464018074816893e-08, |
| "loss": 26.53309326171875, |
| "step": 9690 |
| }, |
| { |
| "epoch": 0.8818181818181818, |
| "grad_norm": 235812629250048.0, |
| "learning_rate": 3.411981321507523e-08, |
| "loss": 26.598037719726562, |
| "step": 9700 |
| }, |
| { |
| "epoch": 0.8818181818181818, |
| "eval_loss": 26.255329132080078, |
| "eval_runtime": 2.1559, |
| "eval_samples_per_second": 16.698, |
| "eval_steps_per_second": 0.928, |
| "step": 9700 |
| }, |
| { |
| "epoch": 0.8827272727272727, |
| "grad_norm": 529596579577856.0, |
| "learning_rate": 3.360324572331752e-08, |
| "loss": 26.505670166015626, |
| "step": 9710 |
| }, |
| { |
| "epoch": 0.8836363636363637, |
| "grad_norm": 209934092337152.0, |
| "learning_rate": 3.3090482486377854e-08, |
| "loss": 26.292486572265624, |
| "step": 9720 |
| }, |
| { |
| "epoch": 0.8845454545454545, |
| "grad_norm": 68720860856320.0, |
| "learning_rate": 3.258152768670802e-08, |
| "loss": 26.464907836914062, |
| "step": 9730 |
| }, |
| { |
| "epoch": 0.8854545454545455, |
| "grad_norm": 120226192556032.0, |
| "learning_rate": 3.207638547569597e-08, |
| "loss": 26.43253173828125, |
| "step": 9740 |
| }, |
| { |
| "epoch": 0.8863636363636364, |
| "grad_norm": 203593093218304.0, |
| "learning_rate": 3.157505997363108e-08, |
| "loss": 26.225360107421874, |
| "step": 9750 |
| }, |
| { |
| "epoch": 0.8872727272727273, |
| "grad_norm": 110963525156864.0, |
| "learning_rate": 3.107755526967132e-08, |
| "loss": 26.272589111328124, |
| "step": 9760 |
| }, |
| { |
| "epoch": 0.8881818181818182, |
| "grad_norm": 228354837970944.0, |
| "learning_rate": 3.058387542180951e-08, |
| "loss": 26.39100341796875, |
| "step": 9770 |
| }, |
| { |
| "epoch": 0.889090909090909, |
| "grad_norm": 211785055469568.0, |
| "learning_rate": 3.009402445684017e-08, |
| "loss": 26.599038696289064, |
| "step": 9780 |
| }, |
| { |
| "epoch": 0.89, |
| "grad_norm": 439669493858304.0, |
| "learning_rate": 2.9608006370326955e-08, |
| "loss": 26.343658447265625, |
| "step": 9790 |
| }, |
| { |
| "epoch": 0.8909090909090909, |
| "grad_norm": 124145425711104.0, |
| "learning_rate": 2.912582512656986e-08, |
| "loss": 26.353958129882812, |
| "step": 9800 |
| }, |
| { |
| "epoch": 0.8909090909090909, |
| "eval_loss": 26.251920700073242, |
| "eval_runtime": 2.1837, |
| "eval_samples_per_second": 16.485, |
| "eval_steps_per_second": 0.916, |
| "step": 9800 |
| }, |
| { |
| "epoch": 0.8918181818181818, |
| "grad_norm": 218182426034176.0, |
| "learning_rate": 2.8647484658572918e-08, |
| "loss": 26.384439086914064, |
| "step": 9810 |
| }, |
| { |
| "epoch": 0.8927272727272727, |
| "grad_norm": 458707439714304.0, |
| "learning_rate": 2.8172988868012117e-08, |
| "loss": 26.731353759765625, |
| "step": 9820 |
| }, |
| { |
| "epoch": 0.8936363636363637, |
| "grad_norm": 363114386161664.0, |
| "learning_rate": 2.770234162520363e-08, |
| "loss": 26.34778747558594, |
| "step": 9830 |
| }, |
| { |
| "epoch": 0.8945454545454545, |
| "grad_norm": 473513165062144.0, |
| "learning_rate": 2.7235546769072247e-08, |
| "loss": 25.989871215820312, |
| "step": 9840 |
| }, |
| { |
| "epoch": 0.8954545454545455, |
| "grad_norm": 453134988083200.0, |
| "learning_rate": 2.6772608107119954e-08, |
| "loss": 26.36603698730469, |
| "step": 9850 |
| }, |
| { |
| "epoch": 0.8963636363636364, |
| "grad_norm": 246036849229824.0, |
| "learning_rate": 2.6313529415394942e-08, |
| "loss": 26.3845703125, |
| "step": 9860 |
| }, |
| { |
| "epoch": 0.8972727272727272, |
| "grad_norm": 72789880995840.0, |
| "learning_rate": 2.585831443846087e-08, |
| "loss": 26.44983825683594, |
| "step": 9870 |
| }, |
| { |
| "epoch": 0.8981818181818182, |
| "grad_norm": 548986779860992.0, |
| "learning_rate": 2.540696688936622e-08, |
| "loss": 26.52098388671875, |
| "step": 9880 |
| }, |
| { |
| "epoch": 0.899090909090909, |
| "grad_norm": 388335675637760.0, |
| "learning_rate": 2.4959490449614094e-08, |
| "loss": 26.495932006835936, |
| "step": 9890 |
| }, |
| { |
| "epoch": 0.9, |
| "grad_norm": 53976842108928.0, |
| "learning_rate": 2.4515888769132244e-08, |
| "loss": 26.7628173828125, |
| "step": 9900 |
| }, |
| { |
| "epoch": 0.9, |
| "eval_loss": 26.25650978088379, |
| "eval_runtime": 2.1722, |
| "eval_samples_per_second": 16.573, |
| "eval_steps_per_second": 0.921, |
| "step": 9900 |
| }, |
| { |
| "epoch": 0.9009090909090909, |
| "grad_norm": 222135859544064.0, |
| "learning_rate": 2.407616546624286e-08, |
| "loss": 26.65426025390625, |
| "step": 9910 |
| }, |
| { |
| "epoch": 0.9018181818181819, |
| "grad_norm": 156349862248448.0, |
| "learning_rate": 2.3640324127633726e-08, |
| "loss": 26.53638610839844, |
| "step": 9920 |
| }, |
| { |
| "epoch": 0.9027272727272727, |
| "grad_norm": 406163145359360.0, |
| "learning_rate": 2.3208368308328562e-08, |
| "loss": 26.672116088867188, |
| "step": 9930 |
| }, |
| { |
| "epoch": 0.9036363636363637, |
| "grad_norm": 290215168049152.0, |
| "learning_rate": 2.278030153165811e-08, |
| "loss": 26.395840454101563, |
| "step": 9940 |
| }, |
| { |
| "epoch": 0.9045454545454545, |
| "grad_norm": 323777854439424.0, |
| "learning_rate": 2.2356127289231198e-08, |
| "loss": 26.753033447265626, |
| "step": 9950 |
| }, |
| { |
| "epoch": 0.9054545454545454, |
| "grad_norm": 353928558411776.0, |
| "learning_rate": 2.1935849040906785e-08, |
| "loss": 26.23077392578125, |
| "step": 9960 |
| }, |
| { |
| "epoch": 0.9063636363636364, |
| "grad_norm": 323219877789696.0, |
| "learning_rate": 2.1519470214765134e-08, |
| "loss": 26.30245361328125, |
| "step": 9970 |
| }, |
| { |
| "epoch": 0.9072727272727272, |
| "grad_norm": 102580596244480.0, |
| "learning_rate": 2.1106994207080176e-08, |
| "loss": 26.48880615234375, |
| "step": 9980 |
| }, |
| { |
| "epoch": 0.9081818181818182, |
| "grad_norm": 560100477501440.0, |
| "learning_rate": 2.0698424382291913e-08, |
| "loss": 26.237164306640626, |
| "step": 9990 |
| }, |
| { |
| "epoch": 0.9090909090909091, |
| "grad_norm": 500201991176192.0, |
| "learning_rate": 2.0293764072978616e-08, |
| "loss": 26.076568603515625, |
| "step": 10000 |
| }, |
| { |
| "epoch": 0.9090909090909091, |
| "eval_loss": 26.25713348388672, |
| "eval_runtime": 2.2039, |
| "eval_samples_per_second": 16.335, |
| "eval_steps_per_second": 0.907, |
| "step": 10000 |
| } |
| ], |
| "logging_steps": 10, |
| "max_steps": 11000, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 9223372036854775807, |
| "save_steps": 1000, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 9.059847634944e+16, |
| "train_batch_size": 4, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|