{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.393593739637907, "eval_steps": 500, "global_step": 5935, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0006631739505272233, "grad_norm": 1.1596795320510864, "learning_rate": 2.910112359550562e-06, "loss": 0.9517, "step": 10 }, { "epoch": 0.0013263479010544466, "grad_norm": 1.0129684209823608, "learning_rate": 3.921348314606742e-06, "loss": 0.9185, "step": 20 }, { "epoch": 0.00198952185158167, "grad_norm": 1.0162608623504639, "learning_rate": 4.932584269662922e-06, "loss": 0.8679, "step": 30 }, { "epoch": 0.0026526958021088932, "grad_norm": 0.8911998271942139, "learning_rate": 5.943820224719102e-06, "loss": 0.8628, "step": 40 }, { "epoch": 0.0033158697526361166, "grad_norm": 0.8088529706001282, "learning_rate": 6.955056179775282e-06, "loss": 0.8746, "step": 50 }, { "epoch": 0.00397904370316334, "grad_norm": 0.8642328977584839, "learning_rate": 7.966292134831462e-06, "loss": 0.8327, "step": 60 }, { "epoch": 0.004642217653690563, "grad_norm": 0.8503588438034058, "learning_rate": 8.977528089887641e-06, "loss": 0.8412, "step": 70 }, { "epoch": 0.0053053916042177865, "grad_norm": 0.8862006664276123, "learning_rate": 9.988764044943822e-06, "loss": 0.8231, "step": 80 }, { "epoch": 0.00596856555474501, "grad_norm": 0.9262124300003052, "learning_rate": 1.1000000000000001e-05, "loss": 0.8087, "step": 90 }, { "epoch": 0.006631739505272233, "grad_norm": 0.9693242907524109, "learning_rate": 1.2011235955056182e-05, "loss": 0.8197, "step": 100 }, { "epoch": 0.007294913455799456, "grad_norm": 0.8964329361915588, "learning_rate": 1.3022471910112362e-05, "loss": 0.7927, "step": 110 }, { "epoch": 0.00795808740632668, "grad_norm": 0.8408939838409424, "learning_rate": 1.403370786516854e-05, "loss": 0.8229, "step": 120 }, { "epoch": 0.008621261356853902, "grad_norm": 0.8564504981040955, "learning_rate": 1.504494382022472e-05, "loss": 0.7813, "step": 130 }, { "epoch": 0.009284435307381126, "grad_norm": 0.9394861459732056, "learning_rate": 1.60561797752809e-05, "loss": 0.8178, "step": 140 }, { "epoch": 0.009947609257908349, "grad_norm": 0.8412289023399353, "learning_rate": 1.706741573033708e-05, "loss": 0.7863, "step": 150 }, { "epoch": 0.010610783208435573, "grad_norm": 0.8816506266593933, "learning_rate": 1.8078651685393256e-05, "loss": 0.7883, "step": 160 }, { "epoch": 0.011273957158962795, "grad_norm": 0.8023780584335327, "learning_rate": 1.908988764044944e-05, "loss": 0.7992, "step": 170 }, { "epoch": 0.01193713110949002, "grad_norm": 0.9203169941902161, "learning_rate": 2e-05, "loss": 0.8106, "step": 180 }, { "epoch": 0.012600305060017242, "grad_norm": 0.8466951251029968, "learning_rate": 2e-05, "loss": 0.7944, "step": 190 }, { "epoch": 0.013263479010544466, "grad_norm": 0.807468593120575, "learning_rate": 2e-05, "loss": 0.7964, "step": 200 }, { "epoch": 0.013926652961071689, "grad_norm": 0.74900221824646, "learning_rate": 2e-05, "loss": 0.7963, "step": 210 }, { "epoch": 0.014589826911598913, "grad_norm": 0.8038553595542908, "learning_rate": 2e-05, "loss": 0.7799, "step": 220 }, { "epoch": 0.015253000862126135, "grad_norm": 0.6701945662498474, "learning_rate": 2e-05, "loss": 0.8199, "step": 230 }, { "epoch": 0.01591617481265336, "grad_norm": 0.649372398853302, "learning_rate": 2e-05, "loss": 0.7925, "step": 240 }, { "epoch": 0.016579348763180582, "grad_norm": 0.6375704407691956, "learning_rate": 2e-05, "loss": 0.8243, "step": 250 }, { "epoch": 0.017242522713707804, "grad_norm": 0.660631537437439, "learning_rate": 2e-05, "loss": 0.7956, "step": 260 }, { "epoch": 0.01790569666423503, "grad_norm": 0.620918869972229, "learning_rate": 2e-05, "loss": 0.7858, "step": 270 }, { "epoch": 0.018568870614762253, "grad_norm": 0.5827407240867615, "learning_rate": 2e-05, "loss": 0.7998, "step": 280 }, { "epoch": 0.019232044565289475, "grad_norm": 0.578879177570343, "learning_rate": 2e-05, "loss": 0.7597, "step": 290 }, { "epoch": 0.019895218515816698, "grad_norm": 0.5654085874557495, "learning_rate": 2e-05, "loss": 0.7533, "step": 300 }, { "epoch": 0.020558392466343924, "grad_norm": 0.5633082985877991, "learning_rate": 2e-05, "loss": 0.7592, "step": 310 }, { "epoch": 0.021221566416871146, "grad_norm": 0.6228300333023071, "learning_rate": 2e-05, "loss": 0.7857, "step": 320 }, { "epoch": 0.02188474036739837, "grad_norm": 0.5642741918563843, "learning_rate": 2e-05, "loss": 0.7652, "step": 330 }, { "epoch": 0.02254791431792559, "grad_norm": 0.5845516920089722, "learning_rate": 2e-05, "loss": 0.7792, "step": 340 }, { "epoch": 0.023211088268452817, "grad_norm": 0.5533984899520874, "learning_rate": 2e-05, "loss": 0.7662, "step": 350 }, { "epoch": 0.02387426221898004, "grad_norm": 1.1515164375305176, "learning_rate": 2e-05, "loss": 0.7853, "step": 360 }, { "epoch": 0.02453743616950726, "grad_norm": 0.5596652030944824, "learning_rate": 2e-05, "loss": 0.7939, "step": 370 }, { "epoch": 0.025200610120034484, "grad_norm": 0.5617090463638306, "learning_rate": 2e-05, "loss": 0.7896, "step": 380 }, { "epoch": 0.02586378407056171, "grad_norm": 0.80217444896698, "learning_rate": 2e-05, "loss": 0.7616, "step": 390 }, { "epoch": 0.026526958021088932, "grad_norm": 0.8099656701087952, "learning_rate": 2e-05, "loss": 0.7716, "step": 400 }, { "epoch": 0.027190131971616155, "grad_norm": 0.5415481925010681, "learning_rate": 2e-05, "loss": 0.7764, "step": 410 }, { "epoch": 0.027853305922143377, "grad_norm": 0.7534944415092468, "learning_rate": 2e-05, "loss": 0.7879, "step": 420 }, { "epoch": 0.0285164798726706, "grad_norm": 0.602469801902771, "learning_rate": 2e-05, "loss": 0.771, "step": 430 }, { "epoch": 0.029179653823197826, "grad_norm": 0.5386860370635986, "learning_rate": 2e-05, "loss": 0.791, "step": 440 }, { "epoch": 0.029842827773725048, "grad_norm": 0.5772424936294556, "learning_rate": 2e-05, "loss": 0.7806, "step": 450 }, { "epoch": 0.03050600172425227, "grad_norm": 0.5686757564544678, "learning_rate": 2e-05, "loss": 0.7729, "step": 460 }, { "epoch": 0.031169175674779493, "grad_norm": 0.5157404541969299, "learning_rate": 2e-05, "loss": 0.7387, "step": 470 }, { "epoch": 0.03183234962530672, "grad_norm": 0.5490089654922485, "learning_rate": 2e-05, "loss": 0.7653, "step": 480 }, { "epoch": 0.03249552357583394, "grad_norm": 0.5582148432731628, "learning_rate": 2e-05, "loss": 0.7827, "step": 490 }, { "epoch": 0.033158697526361164, "grad_norm": 0.5726275444030762, "learning_rate": 2e-05, "loss": 0.7942, "step": 500 }, { "epoch": 0.033821871476888386, "grad_norm": 1.6204034090042114, "learning_rate": 2e-05, "loss": 0.7893, "step": 510 }, { "epoch": 0.03448504542741561, "grad_norm": 0.5208715796470642, "learning_rate": 2e-05, "loss": 0.7714, "step": 520 }, { "epoch": 0.03514821937794283, "grad_norm": 0.5310713052749634, "learning_rate": 2e-05, "loss": 0.7802, "step": 530 }, { "epoch": 0.03581139332847006, "grad_norm": 0.5323279500007629, "learning_rate": 2e-05, "loss": 0.7548, "step": 540 }, { "epoch": 0.03647456727899728, "grad_norm": 0.48549482226371765, "learning_rate": 2e-05, "loss": 0.7649, "step": 550 }, { "epoch": 0.037137741229524505, "grad_norm": 0.5288492441177368, "learning_rate": 2e-05, "loss": 0.7777, "step": 560 }, { "epoch": 0.03780091518005173, "grad_norm": 0.4877089560031891, "learning_rate": 2e-05, "loss": 0.7802, "step": 570 }, { "epoch": 0.03846408913057895, "grad_norm": 0.5317091345787048, "learning_rate": 2e-05, "loss": 0.7833, "step": 580 }, { "epoch": 0.03912726308110617, "grad_norm": 0.5533668994903564, "learning_rate": 2e-05, "loss": 0.7702, "step": 590 }, { "epoch": 0.039790437031633395, "grad_norm": 0.5711390972137451, "learning_rate": 2e-05, "loss": 0.7801, "step": 600 }, { "epoch": 0.04045361098216062, "grad_norm": 0.5276714563369751, "learning_rate": 2e-05, "loss": 0.7846, "step": 610 }, { "epoch": 0.04111678493268785, "grad_norm": 0.5505608320236206, "learning_rate": 2e-05, "loss": 0.7575, "step": 620 }, { "epoch": 0.04177995888321507, "grad_norm": 0.49005311727523804, "learning_rate": 2e-05, "loss": 0.7698, "step": 630 }, { "epoch": 0.04244313283374229, "grad_norm": 0.4874991178512573, "learning_rate": 2e-05, "loss": 0.7716, "step": 640 }, { "epoch": 0.043106306784269514, "grad_norm": 0.5269560217857361, "learning_rate": 2e-05, "loss": 0.7607, "step": 650 }, { "epoch": 0.04376948073479674, "grad_norm": 0.50971519947052, "learning_rate": 2e-05, "loss": 0.7473, "step": 660 }, { "epoch": 0.04443265468532396, "grad_norm": 0.6813302636146545, "learning_rate": 2e-05, "loss": 0.7437, "step": 670 }, { "epoch": 0.04509582863585118, "grad_norm": 0.4699794352054596, "learning_rate": 2e-05, "loss": 0.7794, "step": 680 }, { "epoch": 0.045759002586378404, "grad_norm": 0.4931847155094147, "learning_rate": 2e-05, "loss": 0.7788, "step": 690 }, { "epoch": 0.046422176536905634, "grad_norm": 0.527800977230072, "learning_rate": 2e-05, "loss": 0.788, "step": 700 }, { "epoch": 0.047085350487432856, "grad_norm": 0.48107194900512695, "learning_rate": 2e-05, "loss": 0.763, "step": 710 }, { "epoch": 0.04774852443796008, "grad_norm": 0.48204314708709717, "learning_rate": 2e-05, "loss": 0.7595, "step": 720 }, { "epoch": 0.0484116983884873, "grad_norm": 0.48960623145103455, "learning_rate": 2e-05, "loss": 0.7647, "step": 730 }, { "epoch": 0.04907487233901452, "grad_norm": 0.4727330505847931, "learning_rate": 2e-05, "loss": 0.7618, "step": 740 }, { "epoch": 0.049738046289541746, "grad_norm": 0.48611021041870117, "learning_rate": 2e-05, "loss": 0.7773, "step": 750 }, { "epoch": 0.05040122024006897, "grad_norm": 0.481209397315979, "learning_rate": 2e-05, "loss": 0.7909, "step": 760 }, { "epoch": 0.05106439419059619, "grad_norm": 0.5047401785850525, "learning_rate": 2e-05, "loss": 0.7613, "step": 770 }, { "epoch": 0.05172756814112342, "grad_norm": 0.5307384729385376, "learning_rate": 2e-05, "loss": 0.7672, "step": 780 }, { "epoch": 0.05239074209165064, "grad_norm": 0.5360110402107239, "learning_rate": 2e-05, "loss": 0.7441, "step": 790 }, { "epoch": 0.053053916042177865, "grad_norm": 0.4864613711833954, "learning_rate": 2e-05, "loss": 0.7748, "step": 800 }, { "epoch": 0.05371708999270509, "grad_norm": 0.4954187572002411, "learning_rate": 2e-05, "loss": 0.7528, "step": 810 }, { "epoch": 0.05438026394323231, "grad_norm": 0.504557192325592, "learning_rate": 2e-05, "loss": 0.7494, "step": 820 }, { "epoch": 0.05504343789375953, "grad_norm": 0.48328864574432373, "learning_rate": 2e-05, "loss": 0.7764, "step": 830 }, { "epoch": 0.055706611844286755, "grad_norm": 0.47445255517959595, "learning_rate": 2e-05, "loss": 0.754, "step": 840 }, { "epoch": 0.05636978579481398, "grad_norm": 0.5029422044754028, "learning_rate": 2e-05, "loss": 0.77, "step": 850 }, { "epoch": 0.0570329597453412, "grad_norm": 0.5073195695877075, "learning_rate": 2e-05, "loss": 0.7597, "step": 860 }, { "epoch": 0.05769613369586843, "grad_norm": 0.4880322813987732, "learning_rate": 2e-05, "loss": 0.7595, "step": 870 }, { "epoch": 0.05835930764639565, "grad_norm": 0.513581395149231, "learning_rate": 2e-05, "loss": 0.7818, "step": 880 }, { "epoch": 0.059022481596922874, "grad_norm": 0.4951395094394684, "learning_rate": 2e-05, "loss": 0.7881, "step": 890 }, { "epoch": 0.059685655547450096, "grad_norm": 0.45365604758262634, "learning_rate": 2e-05, "loss": 0.7577, "step": 900 }, { "epoch": 0.06034882949797732, "grad_norm": 0.4641544818878174, "learning_rate": 2e-05, "loss": 0.7685, "step": 910 }, { "epoch": 0.06101200344850454, "grad_norm": 0.48189839720726013, "learning_rate": 2e-05, "loss": 0.7767, "step": 920 }, { "epoch": 0.061675177399031764, "grad_norm": 0.4569750428199768, "learning_rate": 2e-05, "loss": 0.7469, "step": 930 }, { "epoch": 0.062338351349558986, "grad_norm": 0.4633541703224182, "learning_rate": 2e-05, "loss": 0.76, "step": 940 }, { "epoch": 0.06300152530008621, "grad_norm": 0.4753730595111847, "learning_rate": 2e-05, "loss": 0.7528, "step": 950 }, { "epoch": 0.06366469925061344, "grad_norm": 0.4677918553352356, "learning_rate": 2e-05, "loss": 0.7569, "step": 960 }, { "epoch": 0.06432787320114065, "grad_norm": 0.4754522442817688, "learning_rate": 2e-05, "loss": 0.7659, "step": 970 }, { "epoch": 0.06499104715166788, "grad_norm": 0.5752569437026978, "learning_rate": 2e-05, "loss": 0.7599, "step": 980 }, { "epoch": 0.06565422110219511, "grad_norm": 0.5086958408355713, "learning_rate": 2e-05, "loss": 0.7631, "step": 990 }, { "epoch": 0.06631739505272233, "grad_norm": 0.5891866087913513, "learning_rate": 2e-05, "loss": 0.7597, "step": 1000 }, { "epoch": 0.06698056900324956, "grad_norm": 0.46219590306282043, "learning_rate": 2e-05, "loss": 0.7579, "step": 1010 }, { "epoch": 0.06764374295377677, "grad_norm": 0.4759126305580139, "learning_rate": 2e-05, "loss": 0.7554, "step": 1020 }, { "epoch": 0.068306916904304, "grad_norm": 0.5318647027015686, "learning_rate": 2e-05, "loss": 0.7481, "step": 1030 }, { "epoch": 0.06897009085483122, "grad_norm": 0.4814603924751282, "learning_rate": 2e-05, "loss": 0.7729, "step": 1040 }, { "epoch": 0.06963326480535845, "grad_norm": 0.5173375010490417, "learning_rate": 2e-05, "loss": 0.7589, "step": 1050 }, { "epoch": 0.07029643875588566, "grad_norm": 0.5993748903274536, "learning_rate": 2e-05, "loss": 0.7736, "step": 1060 }, { "epoch": 0.07095961270641289, "grad_norm": 0.5081777572631836, "learning_rate": 2e-05, "loss": 0.7522, "step": 1070 }, { "epoch": 0.07162278665694012, "grad_norm": 0.45993325114250183, "learning_rate": 2e-05, "loss": 0.7801, "step": 1080 }, { "epoch": 0.07228596060746734, "grad_norm": 0.4642050564289093, "learning_rate": 2e-05, "loss": 0.7594, "step": 1090 }, { "epoch": 0.07294913455799457, "grad_norm": 0.45918765664100647, "learning_rate": 2e-05, "loss": 0.7292, "step": 1100 }, { "epoch": 0.07361230850852178, "grad_norm": 0.4907342493534088, "learning_rate": 2e-05, "loss": 0.768, "step": 1110 }, { "epoch": 0.07427548245904901, "grad_norm": 0.46477046608924866, "learning_rate": 2e-05, "loss": 0.7546, "step": 1120 }, { "epoch": 0.07493865640957623, "grad_norm": 0.5048196911811829, "learning_rate": 2e-05, "loss": 0.7762, "step": 1130 }, { "epoch": 0.07560183036010346, "grad_norm": 0.48439109325408936, "learning_rate": 2e-05, "loss": 0.7385, "step": 1140 }, { "epoch": 0.07626500431063069, "grad_norm": 0.47210803627967834, "learning_rate": 2e-05, "loss": 0.7694, "step": 1150 }, { "epoch": 0.0769281782611579, "grad_norm": 0.4778144359588623, "learning_rate": 2e-05, "loss": 0.7382, "step": 1160 }, { "epoch": 0.07759135221168513, "grad_norm": 0.5094350576400757, "learning_rate": 2e-05, "loss": 0.7488, "step": 1170 }, { "epoch": 0.07825452616221235, "grad_norm": 0.5327107310295105, "learning_rate": 2e-05, "loss": 0.7457, "step": 1180 }, { "epoch": 0.07891770011273957, "grad_norm": 0.4854157567024231, "learning_rate": 2e-05, "loss": 0.7531, "step": 1190 }, { "epoch": 0.07958087406326679, "grad_norm": 0.8898469805717468, "learning_rate": 2e-05, "loss": 0.7552, "step": 1200 }, { "epoch": 0.08024404801379402, "grad_norm": 0.4582747519016266, "learning_rate": 2e-05, "loss": 0.7346, "step": 1210 }, { "epoch": 0.08090722196432124, "grad_norm": 0.4968053102493286, "learning_rate": 2e-05, "loss": 0.7464, "step": 1220 }, { "epoch": 0.08157039591484846, "grad_norm": 0.5363363027572632, "learning_rate": 2e-05, "loss": 0.7607, "step": 1230 }, { "epoch": 0.0822335698653757, "grad_norm": 0.5088996887207031, "learning_rate": 2e-05, "loss": 0.7482, "step": 1240 }, { "epoch": 0.08289674381590291, "grad_norm": 0.4793884754180908, "learning_rate": 2e-05, "loss": 0.7469, "step": 1250 }, { "epoch": 0.08355991776643014, "grad_norm": 1.361615538597107, "learning_rate": 2e-05, "loss": 0.7451, "step": 1260 }, { "epoch": 0.08422309171695735, "grad_norm": 0.47477322816848755, "learning_rate": 2e-05, "loss": 0.7631, "step": 1270 }, { "epoch": 0.08488626566748458, "grad_norm": 0.49219903349876404, "learning_rate": 2e-05, "loss": 0.7709, "step": 1280 }, { "epoch": 0.0855494396180118, "grad_norm": 0.46074602007865906, "learning_rate": 2e-05, "loss": 0.75, "step": 1290 }, { "epoch": 0.08621261356853903, "grad_norm": 0.4657946228981018, "learning_rate": 2e-05, "loss": 0.7494, "step": 1300 }, { "epoch": 0.08687578751906624, "grad_norm": 1.8625658750534058, "learning_rate": 2e-05, "loss": 0.7213, "step": 1310 }, { "epoch": 0.08753896146959347, "grad_norm": 0.4719648063182831, "learning_rate": 2e-05, "loss": 0.7651, "step": 1320 }, { "epoch": 0.0882021354201207, "grad_norm": 0.45125117897987366, "learning_rate": 2e-05, "loss": 0.7575, "step": 1330 }, { "epoch": 0.08886530937064792, "grad_norm": 0.4656333029270172, "learning_rate": 2e-05, "loss": 0.7473, "step": 1340 }, { "epoch": 0.08952848332117515, "grad_norm": 0.4801299273967743, "learning_rate": 2e-05, "loss": 0.7496, "step": 1350 }, { "epoch": 0.09019165727170236, "grad_norm": 0.4366644620895386, "learning_rate": 2e-05, "loss": 0.7361, "step": 1360 }, { "epoch": 0.09085483122222959, "grad_norm": 0.43298009037971497, "learning_rate": 2e-05, "loss": 0.7358, "step": 1370 }, { "epoch": 0.09151800517275681, "grad_norm": 0.45950010418891907, "learning_rate": 2e-05, "loss": 0.7431, "step": 1380 }, { "epoch": 0.09218117912328404, "grad_norm": 0.4419451057910919, "learning_rate": 2e-05, "loss": 0.7559, "step": 1390 }, { "epoch": 0.09284435307381127, "grad_norm": 0.5011473894119263, "learning_rate": 2e-05, "loss": 0.747, "step": 1400 }, { "epoch": 0.09350752702433848, "grad_norm": 0.4722769260406494, "learning_rate": 2e-05, "loss": 0.7598, "step": 1410 }, { "epoch": 0.09417070097486571, "grad_norm": 0.4498542547225952, "learning_rate": 2e-05, "loss": 0.7429, "step": 1420 }, { "epoch": 0.09483387492539293, "grad_norm": 0.464199960231781, "learning_rate": 2e-05, "loss": 0.7684, "step": 1430 }, { "epoch": 0.09549704887592016, "grad_norm": 0.5018302202224731, "learning_rate": 2e-05, "loss": 0.7698, "step": 1440 }, { "epoch": 0.09616022282644737, "grad_norm": 0.4524178206920624, "learning_rate": 2e-05, "loss": 0.7644, "step": 1450 }, { "epoch": 0.0968233967769746, "grad_norm": 0.46702370047569275, "learning_rate": 2e-05, "loss": 0.7526, "step": 1460 }, { "epoch": 0.09748657072750182, "grad_norm": 0.4664076864719391, "learning_rate": 2e-05, "loss": 0.7638, "step": 1470 }, { "epoch": 0.09814974467802905, "grad_norm": 0.48490601778030396, "learning_rate": 2e-05, "loss": 0.7535, "step": 1480 }, { "epoch": 0.09881291862855628, "grad_norm": 0.5127236247062683, "learning_rate": 2e-05, "loss": 0.7365, "step": 1490 }, { "epoch": 0.09947609257908349, "grad_norm": 0.46068698167800903, "learning_rate": 2e-05, "loss": 0.735, "step": 1500 }, { "epoch": 0.10013926652961072, "grad_norm": 0.44757401943206787, "learning_rate": 2e-05, "loss": 0.7587, "step": 1510 }, { "epoch": 0.10080244048013794, "grad_norm": 0.475946843624115, "learning_rate": 2e-05, "loss": 0.7474, "step": 1520 }, { "epoch": 0.10146561443066517, "grad_norm": 0.4839072823524475, "learning_rate": 2e-05, "loss": 0.75, "step": 1530 }, { "epoch": 0.10212878838119238, "grad_norm": 0.477365106344223, "learning_rate": 2e-05, "loss": 0.7487, "step": 1540 }, { "epoch": 0.10279196233171961, "grad_norm": 0.48756539821624756, "learning_rate": 2e-05, "loss": 0.7446, "step": 1550 }, { "epoch": 0.10345513628224684, "grad_norm": 0.46172550320625305, "learning_rate": 2e-05, "loss": 0.7336, "step": 1560 }, { "epoch": 0.10411831023277406, "grad_norm": 0.4753364026546478, "learning_rate": 2e-05, "loss": 0.7267, "step": 1570 }, { "epoch": 0.10478148418330128, "grad_norm": 0.4389295279979706, "learning_rate": 2e-05, "loss": 0.7494, "step": 1580 }, { "epoch": 0.1054446581338285, "grad_norm": 0.44949832558631897, "learning_rate": 2e-05, "loss": 0.7334, "step": 1590 }, { "epoch": 0.10610783208435573, "grad_norm": 0.46615809202194214, "learning_rate": 2e-05, "loss": 0.7669, "step": 1600 }, { "epoch": 0.10677100603488295, "grad_norm": 0.4528898000717163, "learning_rate": 2e-05, "loss": 0.7503, "step": 1610 }, { "epoch": 0.10743417998541017, "grad_norm": 0.571483314037323, "learning_rate": 2e-05, "loss": 0.7383, "step": 1620 }, { "epoch": 0.10809735393593739, "grad_norm": 0.4646868109703064, "learning_rate": 2e-05, "loss": 0.7512, "step": 1630 }, { "epoch": 0.10876052788646462, "grad_norm": 0.4529063105583191, "learning_rate": 2e-05, "loss": 0.7255, "step": 1640 }, { "epoch": 0.10942370183699185, "grad_norm": 0.5024081468582153, "learning_rate": 2e-05, "loss": 0.739, "step": 1650 }, { "epoch": 0.11008687578751906, "grad_norm": 0.4648872911930084, "learning_rate": 2e-05, "loss": 0.746, "step": 1660 }, { "epoch": 0.1107500497380463, "grad_norm": 0.488041490316391, "learning_rate": 2e-05, "loss": 0.738, "step": 1670 }, { "epoch": 0.11141322368857351, "grad_norm": 0.4653259515762329, "learning_rate": 2e-05, "loss": 0.7256, "step": 1680 }, { "epoch": 0.11207639763910074, "grad_norm": 0.48732203245162964, "learning_rate": 2e-05, "loss": 0.7429, "step": 1690 }, { "epoch": 0.11273957158962795, "grad_norm": 0.572994589805603, "learning_rate": 2e-05, "loss": 0.7573, "step": 1700 }, { "epoch": 0.11340274554015518, "grad_norm": 0.4531424045562744, "learning_rate": 2e-05, "loss": 0.7422, "step": 1710 }, { "epoch": 0.1140659194906824, "grad_norm": 0.512623131275177, "learning_rate": 2e-05, "loss": 0.7292, "step": 1720 }, { "epoch": 0.11472909344120963, "grad_norm": 0.4822714328765869, "learning_rate": 2e-05, "loss": 0.7415, "step": 1730 }, { "epoch": 0.11539226739173686, "grad_norm": 0.4871460497379303, "learning_rate": 2e-05, "loss": 0.7417, "step": 1740 }, { "epoch": 0.11605544134226407, "grad_norm": 1.012222409248352, "learning_rate": 2e-05, "loss": 0.736, "step": 1750 }, { "epoch": 0.1167186152927913, "grad_norm": 0.530349612236023, "learning_rate": 2e-05, "loss": 0.728, "step": 1760 }, { "epoch": 0.11738178924331852, "grad_norm": 0.46132221817970276, "learning_rate": 2e-05, "loss": 0.7216, "step": 1770 }, { "epoch": 0.11804496319384575, "grad_norm": 0.4651985168457031, "learning_rate": 2e-05, "loss": 0.7562, "step": 1780 }, { "epoch": 0.11870813714437296, "grad_norm": 0.44336026906967163, "learning_rate": 2e-05, "loss": 0.7441, "step": 1790 }, { "epoch": 0.11937131109490019, "grad_norm": 0.4634976089000702, "learning_rate": 2e-05, "loss": 0.7746, "step": 1800 }, { "epoch": 0.12003448504542742, "grad_norm": 0.6048588752746582, "learning_rate": 2e-05, "loss": 0.7485, "step": 1810 }, { "epoch": 0.12069765899595464, "grad_norm": 0.47721830010414124, "learning_rate": 2e-05, "loss": 0.7484, "step": 1820 }, { "epoch": 0.12136083294648187, "grad_norm": 0.464031457901001, "learning_rate": 2e-05, "loss": 0.7176, "step": 1830 }, { "epoch": 0.12202400689700908, "grad_norm": 0.4706140458583832, "learning_rate": 2e-05, "loss": 0.7097, "step": 1840 }, { "epoch": 0.12268718084753631, "grad_norm": 0.4383341670036316, "learning_rate": 2e-05, "loss": 0.7444, "step": 1850 }, { "epoch": 0.12335035479806353, "grad_norm": 0.4670451581478119, "learning_rate": 2e-05, "loss": 0.7596, "step": 1860 }, { "epoch": 0.12401352874859076, "grad_norm": 0.4673280417919159, "learning_rate": 2e-05, "loss": 0.7292, "step": 1870 }, { "epoch": 0.12467670269911797, "grad_norm": 0.49208033084869385, "learning_rate": 2e-05, "loss": 0.7655, "step": 1880 }, { "epoch": 0.12533987664964522, "grad_norm": 0.44742557406425476, "learning_rate": 2e-05, "loss": 0.7431, "step": 1890 }, { "epoch": 0.12600305060017242, "grad_norm": 0.47594326734542847, "learning_rate": 2e-05, "loss": 0.7524, "step": 1900 }, { "epoch": 0.12666622455069965, "grad_norm": 0.49186161160469055, "learning_rate": 2e-05, "loss": 0.7371, "step": 1910 }, { "epoch": 0.12732939850122688, "grad_norm": 0.455226331949234, "learning_rate": 2e-05, "loss": 0.7535, "step": 1920 }, { "epoch": 0.1279925724517541, "grad_norm": 0.49632561206817627, "learning_rate": 2e-05, "loss": 0.7362, "step": 1930 }, { "epoch": 0.1286557464022813, "grad_norm": 0.4459867477416992, "learning_rate": 2e-05, "loss": 0.7312, "step": 1940 }, { "epoch": 0.12931892035280854, "grad_norm": 0.48936307430267334, "learning_rate": 2e-05, "loss": 0.7296, "step": 1950 }, { "epoch": 0.12998209430333577, "grad_norm": 0.46001771092414856, "learning_rate": 2e-05, "loss": 0.7452, "step": 1960 }, { "epoch": 0.130645268253863, "grad_norm": 0.4681333601474762, "learning_rate": 2e-05, "loss": 0.73, "step": 1970 }, { "epoch": 0.13130844220439022, "grad_norm": 0.476224422454834, "learning_rate": 2e-05, "loss": 0.7481, "step": 1980 }, { "epoch": 0.13197161615491743, "grad_norm": 0.45250940322875977, "learning_rate": 2e-05, "loss": 0.7424, "step": 1990 }, { "epoch": 0.13263479010544466, "grad_norm": 0.49830418825149536, "learning_rate": 2e-05, "loss": 0.7553, "step": 2000 }, { "epoch": 0.13329796405597188, "grad_norm": 0.4795004725456238, "learning_rate": 2e-05, "loss": 0.7209, "step": 2010 }, { "epoch": 0.13396113800649911, "grad_norm": 0.805539608001709, "learning_rate": 2e-05, "loss": 0.7467, "step": 2020 }, { "epoch": 0.13462431195702632, "grad_norm": 0.6310796737670898, "learning_rate": 2e-05, "loss": 0.7566, "step": 2030 }, { "epoch": 0.13528748590755355, "grad_norm": 0.43787965178489685, "learning_rate": 2e-05, "loss": 0.7198, "step": 2040 }, { "epoch": 0.13595065985808077, "grad_norm": 0.6050550937652588, "learning_rate": 2e-05, "loss": 0.7439, "step": 2050 }, { "epoch": 0.136613833808608, "grad_norm": 0.4821194112300873, "learning_rate": 2e-05, "loss": 0.7681, "step": 2060 }, { "epoch": 0.13727700775913523, "grad_norm": 0.46896836161613464, "learning_rate": 2e-05, "loss": 0.7288, "step": 2070 }, { "epoch": 0.13794018170966243, "grad_norm": 0.4994990825653076, "learning_rate": 2e-05, "loss": 0.7446, "step": 2080 }, { "epoch": 0.13860335566018966, "grad_norm": 0.4725533127784729, "learning_rate": 2e-05, "loss": 0.7301, "step": 2090 }, { "epoch": 0.1392665296107169, "grad_norm": 0.4225281774997711, "learning_rate": 2e-05, "loss": 0.7342, "step": 2100 }, { "epoch": 0.13992970356124412, "grad_norm": 0.4997630715370178, "learning_rate": 2e-05, "loss": 0.7455, "step": 2110 }, { "epoch": 0.14059287751177132, "grad_norm": 0.4552975594997406, "learning_rate": 2e-05, "loss": 0.75, "step": 2120 }, { "epoch": 0.14125605146229855, "grad_norm": 0.4498264491558075, "learning_rate": 2e-05, "loss": 0.7462, "step": 2130 }, { "epoch": 0.14191922541282578, "grad_norm": 0.49117112159729004, "learning_rate": 2e-05, "loss": 0.7541, "step": 2140 }, { "epoch": 0.142582399363353, "grad_norm": 0.49303096532821655, "learning_rate": 2e-05, "loss": 0.7301, "step": 2150 }, { "epoch": 0.14324557331388024, "grad_norm": 0.45166993141174316, "learning_rate": 2e-05, "loss": 0.7597, "step": 2160 }, { "epoch": 0.14390874726440744, "grad_norm": 0.468921035528183, "learning_rate": 2e-05, "loss": 0.7409, "step": 2170 }, { "epoch": 0.14457192121493467, "grad_norm": 0.46468544006347656, "learning_rate": 2e-05, "loss": 0.731, "step": 2180 }, { "epoch": 0.1452350951654619, "grad_norm": 0.4980156719684601, "learning_rate": 2e-05, "loss": 0.7343, "step": 2190 }, { "epoch": 0.14589826911598913, "grad_norm": 0.4513563811779022, "learning_rate": 2e-05, "loss": 0.7248, "step": 2200 }, { "epoch": 0.14656144306651633, "grad_norm": 0.43859392404556274, "learning_rate": 2e-05, "loss": 0.7293, "step": 2210 }, { "epoch": 0.14722461701704356, "grad_norm": 0.4643859565258026, "learning_rate": 2e-05, "loss": 0.7475, "step": 2220 }, { "epoch": 0.1478877909675708, "grad_norm": 0.5044799447059631, "learning_rate": 2e-05, "loss": 0.7288, "step": 2230 }, { "epoch": 0.14855096491809802, "grad_norm": 0.5265306234359741, "learning_rate": 2e-05, "loss": 0.718, "step": 2240 }, { "epoch": 0.14921413886862525, "grad_norm": 0.4421214461326599, "learning_rate": 2e-05, "loss": 0.7334, "step": 2250 }, { "epoch": 0.14987731281915245, "grad_norm": 0.46880438923835754, "learning_rate": 2e-05, "loss": 0.7198, "step": 2260 }, { "epoch": 0.15054048676967968, "grad_norm": 0.5459731817245483, "learning_rate": 2e-05, "loss": 0.7662, "step": 2270 }, { "epoch": 0.1512036607202069, "grad_norm": 0.47586730122566223, "learning_rate": 2e-05, "loss": 0.7404, "step": 2280 }, { "epoch": 0.15186683467073414, "grad_norm": 0.4461500346660614, "learning_rate": 2e-05, "loss": 0.7448, "step": 2290 }, { "epoch": 0.15253000862126137, "grad_norm": 0.4607698917388916, "learning_rate": 2e-05, "loss": 0.7544, "step": 2300 }, { "epoch": 0.15319318257178857, "grad_norm": 0.44479936361312866, "learning_rate": 2e-05, "loss": 0.7432, "step": 2310 }, { "epoch": 0.1538563565223158, "grad_norm": 0.4355045557022095, "learning_rate": 2e-05, "loss": 0.7222, "step": 2320 }, { "epoch": 0.15451953047284303, "grad_norm": 0.43298035860061646, "learning_rate": 2e-05, "loss": 0.7492, "step": 2330 }, { "epoch": 0.15518270442337026, "grad_norm": 0.42725154757499695, "learning_rate": 2e-05, "loss": 0.7576, "step": 2340 }, { "epoch": 0.15584587837389746, "grad_norm": 0.4170139729976654, "learning_rate": 2e-05, "loss": 0.7321, "step": 2350 }, { "epoch": 0.1565090523244247, "grad_norm": 0.48317450284957886, "learning_rate": 2e-05, "loss": 0.7337, "step": 2360 }, { "epoch": 0.15717222627495192, "grad_norm": 0.47873780131340027, "learning_rate": 2e-05, "loss": 0.7572, "step": 2370 }, { "epoch": 0.15783540022547915, "grad_norm": 0.47494009137153625, "learning_rate": 2e-05, "loss": 0.7197, "step": 2380 }, { "epoch": 0.15849857417600638, "grad_norm": 0.45792391896247864, "learning_rate": 2e-05, "loss": 0.7682, "step": 2390 }, { "epoch": 0.15916174812653358, "grad_norm": 0.4486759603023529, "learning_rate": 2e-05, "loss": 0.7336, "step": 2400 }, { "epoch": 0.1598249220770608, "grad_norm": 0.47603151202201843, "learning_rate": 2e-05, "loss": 0.737, "step": 2410 }, { "epoch": 0.16048809602758804, "grad_norm": 0.45742881298065186, "learning_rate": 2e-05, "loss": 0.7217, "step": 2420 }, { "epoch": 0.16115126997811527, "grad_norm": 0.4568350911140442, "learning_rate": 2e-05, "loss": 0.7698, "step": 2430 }, { "epoch": 0.16181444392864247, "grad_norm": 0.4493866562843323, "learning_rate": 2e-05, "loss": 0.7422, "step": 2440 }, { "epoch": 0.1624776178791697, "grad_norm": 0.6067711114883423, "learning_rate": 2e-05, "loss": 0.7471, "step": 2450 }, { "epoch": 0.16314079182969693, "grad_norm": 0.4765845239162445, "learning_rate": 2e-05, "loss": 0.7413, "step": 2460 }, { "epoch": 0.16380396578022416, "grad_norm": 1.5535005331039429, "learning_rate": 2e-05, "loss": 0.7536, "step": 2470 }, { "epoch": 0.1644671397307514, "grad_norm": 0.47922787070274353, "learning_rate": 2e-05, "loss": 0.7366, "step": 2480 }, { "epoch": 0.1651303136812786, "grad_norm": 0.4495774805545807, "learning_rate": 2e-05, "loss": 0.7182, "step": 2490 }, { "epoch": 0.16579348763180582, "grad_norm": 0.556162416934967, "learning_rate": 2e-05, "loss": 0.7367, "step": 2500 }, { "epoch": 0.16645666158233305, "grad_norm": 0.4780755043029785, "learning_rate": 2e-05, "loss": 0.7219, "step": 2510 }, { "epoch": 0.16711983553286028, "grad_norm": 0.4964953660964966, "learning_rate": 2e-05, "loss": 0.7197, "step": 2520 }, { "epoch": 0.16778300948338748, "grad_norm": 0.44503602385520935, "learning_rate": 2e-05, "loss": 0.7241, "step": 2530 }, { "epoch": 0.1684461834339147, "grad_norm": 0.4624878168106079, "learning_rate": 2e-05, "loss": 0.7477, "step": 2540 }, { "epoch": 0.16910935738444194, "grad_norm": 0.49463391304016113, "learning_rate": 2e-05, "loss": 0.732, "step": 2550 }, { "epoch": 0.16977253133496917, "grad_norm": 0.4355657696723938, "learning_rate": 2e-05, "loss": 0.7229, "step": 2560 }, { "epoch": 0.1704357052854964, "grad_norm": 0.43896934390068054, "learning_rate": 2e-05, "loss": 0.7187, "step": 2570 }, { "epoch": 0.1710988792360236, "grad_norm": 0.4886817932128906, "learning_rate": 2e-05, "loss": 0.7052, "step": 2580 }, { "epoch": 0.17176205318655083, "grad_norm": 0.41980621218681335, "learning_rate": 2e-05, "loss": 0.7442, "step": 2590 }, { "epoch": 0.17242522713707806, "grad_norm": 0.4909554719924927, "learning_rate": 2e-05, "loss": 0.7359, "step": 2600 }, { "epoch": 0.1730884010876053, "grad_norm": 0.4882756173610687, "learning_rate": 2e-05, "loss": 0.722, "step": 2610 }, { "epoch": 0.1737515750381325, "grad_norm": 0.6686330437660217, "learning_rate": 2e-05, "loss": 0.7238, "step": 2620 }, { "epoch": 0.17441474898865972, "grad_norm": 0.5391948819160461, "learning_rate": 2e-05, "loss": 0.7068, "step": 2630 }, { "epoch": 0.17507792293918695, "grad_norm": 0.48737525939941406, "learning_rate": 2e-05, "loss": 0.73, "step": 2640 }, { "epoch": 0.17574109688971418, "grad_norm": 0.45221763849258423, "learning_rate": 2e-05, "loss": 0.7374, "step": 2650 }, { "epoch": 0.1764042708402414, "grad_norm": 0.5481429696083069, "learning_rate": 2e-05, "loss": 0.749, "step": 2660 }, { "epoch": 0.1770674447907686, "grad_norm": 0.4444698691368103, "learning_rate": 2e-05, "loss": 0.722, "step": 2670 }, { "epoch": 0.17773061874129584, "grad_norm": 0.4412497580051422, "learning_rate": 2e-05, "loss": 0.7407, "step": 2680 }, { "epoch": 0.17839379269182307, "grad_norm": 0.47715237736701965, "learning_rate": 2e-05, "loss": 0.7104, "step": 2690 }, { "epoch": 0.1790569666423503, "grad_norm": 0.45212236046791077, "learning_rate": 2e-05, "loss": 0.7091, "step": 2700 }, { "epoch": 0.17972014059287753, "grad_norm": 0.4850757420063019, "learning_rate": 2e-05, "loss": 0.7348, "step": 2710 }, { "epoch": 0.18038331454340473, "grad_norm": 0.4519940912723541, "learning_rate": 2e-05, "loss": 0.7019, "step": 2720 }, { "epoch": 0.18104648849393196, "grad_norm": 0.46579867601394653, "learning_rate": 2e-05, "loss": 0.7382, "step": 2730 }, { "epoch": 0.18170966244445919, "grad_norm": 0.46576786041259766, "learning_rate": 2e-05, "loss": 0.7478, "step": 2740 }, { "epoch": 0.18237283639498642, "grad_norm": 0.47330838441848755, "learning_rate": 2e-05, "loss": 0.7189, "step": 2750 }, { "epoch": 0.18303601034551362, "grad_norm": 0.4114646315574646, "learning_rate": 2e-05, "loss": 0.7129, "step": 2760 }, { "epoch": 0.18369918429604085, "grad_norm": 0.43425285816192627, "learning_rate": 2e-05, "loss": 0.7216, "step": 2770 }, { "epoch": 0.18436235824656808, "grad_norm": 0.43742886185646057, "learning_rate": 2e-05, "loss": 0.7447, "step": 2780 }, { "epoch": 0.1850255321970953, "grad_norm": 0.4592493176460266, "learning_rate": 2e-05, "loss": 0.7266, "step": 2790 }, { "epoch": 0.18568870614762253, "grad_norm": 0.4362889528274536, "learning_rate": 2e-05, "loss": 0.7243, "step": 2800 }, { "epoch": 0.18635188009814974, "grad_norm": 0.4235585629940033, "learning_rate": 2e-05, "loss": 0.7247, "step": 2810 }, { "epoch": 0.18701505404867697, "grad_norm": 0.41314443945884705, "learning_rate": 2e-05, "loss": 0.7169, "step": 2820 }, { "epoch": 0.1876782279992042, "grad_norm": 0.43876609206199646, "learning_rate": 2e-05, "loss": 0.7344, "step": 2830 }, { "epoch": 0.18834140194973142, "grad_norm": 0.4480982720851898, "learning_rate": 2e-05, "loss": 0.7357, "step": 2840 }, { "epoch": 0.18900457590025863, "grad_norm": 0.5882231593132019, "learning_rate": 2e-05, "loss": 0.7164, "step": 2850 }, { "epoch": 0.18966774985078586, "grad_norm": 0.4759451746940613, "learning_rate": 2e-05, "loss": 0.7087, "step": 2860 }, { "epoch": 0.19033092380131308, "grad_norm": 0.5012674331665039, "learning_rate": 2e-05, "loss": 0.723, "step": 2870 }, { "epoch": 0.1909940977518403, "grad_norm": 0.4789334833621979, "learning_rate": 2e-05, "loss": 0.7324, "step": 2880 }, { "epoch": 0.19165727170236754, "grad_norm": 0.45085087418556213, "learning_rate": 2e-05, "loss": 0.7121, "step": 2890 }, { "epoch": 0.19232044565289474, "grad_norm": 0.5018136501312256, "learning_rate": 2e-05, "loss": 0.7415, "step": 2900 }, { "epoch": 0.19298361960342197, "grad_norm": 0.4381272494792938, "learning_rate": 2e-05, "loss": 0.7324, "step": 2910 }, { "epoch": 0.1936467935539492, "grad_norm": 0.49085962772369385, "learning_rate": 2e-05, "loss": 0.728, "step": 2920 }, { "epoch": 0.19430996750447643, "grad_norm": 0.46983602643013, "learning_rate": 2e-05, "loss": 0.7255, "step": 2930 }, { "epoch": 0.19497314145500363, "grad_norm": 0.4413234293460846, "learning_rate": 2e-05, "loss": 0.7295, "step": 2940 }, { "epoch": 0.19563631540553086, "grad_norm": 0.4224623441696167, "learning_rate": 2e-05, "loss": 0.7185, "step": 2950 }, { "epoch": 0.1962994893560581, "grad_norm": 0.44557204842567444, "learning_rate": 2e-05, "loss": 0.7498, "step": 2960 }, { "epoch": 0.19696266330658532, "grad_norm": 0.4442812502384186, "learning_rate": 2e-05, "loss": 0.7385, "step": 2970 }, { "epoch": 0.19762583725711255, "grad_norm": 0.45735692977905273, "learning_rate": 2e-05, "loss": 0.7358, "step": 2980 }, { "epoch": 0.19828901120763975, "grad_norm": 0.4599263072013855, "learning_rate": 2e-05, "loss": 0.7343, "step": 2990 }, { "epoch": 0.19895218515816698, "grad_norm": 0.4946780502796173, "learning_rate": 2e-05, "loss": 0.7208, "step": 3000 }, { "epoch": 0.1996153591086942, "grad_norm": 0.44876787066459656, "learning_rate": 2e-05, "loss": 0.7484, "step": 3010 }, { "epoch": 0.20027853305922144, "grad_norm": 0.4538794755935669, "learning_rate": 2e-05, "loss": 0.7071, "step": 3020 }, { "epoch": 0.20094170700974864, "grad_norm": 0.4586864709854126, "learning_rate": 2e-05, "loss": 0.7235, "step": 3030 }, { "epoch": 0.20160488096027587, "grad_norm": 1.1874250173568726, "learning_rate": 2e-05, "loss": 0.7386, "step": 3040 }, { "epoch": 0.2022680549108031, "grad_norm": 0.43232521414756775, "learning_rate": 2e-05, "loss": 0.7197, "step": 3050 }, { "epoch": 0.20293122886133033, "grad_norm": 0.4386948347091675, "learning_rate": 2e-05, "loss": 0.7427, "step": 3060 }, { "epoch": 0.20359440281185756, "grad_norm": 0.4672735333442688, "learning_rate": 2e-05, "loss": 0.7359, "step": 3070 }, { "epoch": 0.20425757676238476, "grad_norm": 0.4516846835613251, "learning_rate": 2e-05, "loss": 0.7044, "step": 3080 }, { "epoch": 0.204920750712912, "grad_norm": 0.4240630567073822, "learning_rate": 2e-05, "loss": 0.7136, "step": 3090 }, { "epoch": 0.20558392466343922, "grad_norm": 0.4282251298427582, "learning_rate": 2e-05, "loss": 0.7328, "step": 3100 }, { "epoch": 0.20624709861396645, "grad_norm": 0.40108299255371094, "learning_rate": 2e-05, "loss": 0.7519, "step": 3110 }, { "epoch": 0.20691027256449368, "grad_norm": 0.4190857708454132, "learning_rate": 2e-05, "loss": 0.7169, "step": 3120 }, { "epoch": 0.20757344651502088, "grad_norm": 0.44728732109069824, "learning_rate": 2e-05, "loss": 0.7496, "step": 3130 }, { "epoch": 0.2082366204655481, "grad_norm": 0.41856780648231506, "learning_rate": 2e-05, "loss": 0.7089, "step": 3140 }, { "epoch": 0.20889979441607534, "grad_norm": 0.49630051851272583, "learning_rate": 2e-05, "loss": 0.7568, "step": 3150 }, { "epoch": 0.20956296836660257, "grad_norm": 0.44060710072517395, "learning_rate": 2e-05, "loss": 0.6966, "step": 3160 }, { "epoch": 0.21022614231712977, "grad_norm": 0.45406848192214966, "learning_rate": 2e-05, "loss": 0.7144, "step": 3170 }, { "epoch": 0.210889316267657, "grad_norm": 0.42265212535858154, "learning_rate": 2e-05, "loss": 0.7275, "step": 3180 }, { "epoch": 0.21155249021818423, "grad_norm": 0.44354790449142456, "learning_rate": 2e-05, "loss": 0.7276, "step": 3190 }, { "epoch": 0.21221566416871146, "grad_norm": 0.44552451372146606, "learning_rate": 2e-05, "loss": 0.7052, "step": 3200 }, { "epoch": 0.2128788381192387, "grad_norm": 0.4217117428779602, "learning_rate": 2e-05, "loss": 0.7117, "step": 3210 }, { "epoch": 0.2135420120697659, "grad_norm": 0.42038828134536743, "learning_rate": 2e-05, "loss": 0.7047, "step": 3220 }, { "epoch": 0.21420518602029312, "grad_norm": 0.42352569103240967, "learning_rate": 2e-05, "loss": 0.7033, "step": 3230 }, { "epoch": 0.21486835997082035, "grad_norm": 0.483313649892807, "learning_rate": 2e-05, "loss": 0.7326, "step": 3240 }, { "epoch": 0.21553153392134758, "grad_norm": 0.45873650908470154, "learning_rate": 2e-05, "loss": 0.7421, "step": 3250 }, { "epoch": 0.21619470787187478, "grad_norm": 0.45367300510406494, "learning_rate": 2e-05, "loss": 0.7123, "step": 3260 }, { "epoch": 0.216857881822402, "grad_norm": 0.4540068805217743, "learning_rate": 2e-05, "loss": 0.7194, "step": 3270 }, { "epoch": 0.21752105577292924, "grad_norm": 0.4581505358219147, "learning_rate": 2e-05, "loss": 0.7064, "step": 3280 }, { "epoch": 0.21818422972345647, "grad_norm": 0.4296276569366455, "learning_rate": 2e-05, "loss": 0.7394, "step": 3290 }, { "epoch": 0.2188474036739837, "grad_norm": 0.4123869240283966, "learning_rate": 2e-05, "loss": 0.736, "step": 3300 }, { "epoch": 0.2195105776245109, "grad_norm": 0.44229796528816223, "learning_rate": 2e-05, "loss": 0.7202, "step": 3310 }, { "epoch": 0.22017375157503813, "grad_norm": 0.4266810715198517, "learning_rate": 2e-05, "loss": 0.7189, "step": 3320 }, { "epoch": 0.22083692552556536, "grad_norm": 0.4784625470638275, "learning_rate": 2e-05, "loss": 0.726, "step": 3330 }, { "epoch": 0.2215000994760926, "grad_norm": 0.422902911901474, "learning_rate": 2e-05, "loss": 0.7193, "step": 3340 }, { "epoch": 0.2221632734266198, "grad_norm": 0.4550988972187042, "learning_rate": 2e-05, "loss": 0.7174, "step": 3350 }, { "epoch": 0.22282644737714702, "grad_norm": 0.44610080122947693, "learning_rate": 2e-05, "loss": 0.7273, "step": 3360 }, { "epoch": 0.22348962132767425, "grad_norm": 0.43774133920669556, "learning_rate": 2e-05, "loss": 0.7213, "step": 3370 }, { "epoch": 0.22415279527820148, "grad_norm": 0.4690759778022766, "learning_rate": 2e-05, "loss": 0.7181, "step": 3380 }, { "epoch": 0.2248159692287287, "grad_norm": 0.42695504426956177, "learning_rate": 2e-05, "loss": 0.7526, "step": 3390 }, { "epoch": 0.2254791431792559, "grad_norm": 0.4128272831439972, "learning_rate": 2e-05, "loss": 0.7179, "step": 3400 }, { "epoch": 0.22614231712978314, "grad_norm": 0.4729095697402954, "learning_rate": 2e-05, "loss": 0.7162, "step": 3410 }, { "epoch": 0.22680549108031037, "grad_norm": 0.5577989220619202, "learning_rate": 2e-05, "loss": 0.7287, "step": 3420 }, { "epoch": 0.2274686650308376, "grad_norm": 0.445027232170105, "learning_rate": 2e-05, "loss": 0.7147, "step": 3430 }, { "epoch": 0.2281318389813648, "grad_norm": 0.42570748925209045, "learning_rate": 2e-05, "loss": 0.7271, "step": 3440 }, { "epoch": 0.22879501293189203, "grad_norm": 0.46589401364326477, "learning_rate": 2e-05, "loss": 0.6928, "step": 3450 }, { "epoch": 0.22945818688241926, "grad_norm": 0.4657121002674103, "learning_rate": 2e-05, "loss": 0.7428, "step": 3460 }, { "epoch": 0.2301213608329465, "grad_norm": 0.4366071820259094, "learning_rate": 2e-05, "loss": 0.7061, "step": 3470 }, { "epoch": 0.23078453478347372, "grad_norm": 0.4379141628742218, "learning_rate": 2e-05, "loss": 0.7312, "step": 3480 }, { "epoch": 0.23144770873400092, "grad_norm": 0.4345671832561493, "learning_rate": 2e-05, "loss": 0.7337, "step": 3490 }, { "epoch": 0.23211088268452815, "grad_norm": 0.4744890630245209, "learning_rate": 2e-05, "loss": 0.6989, "step": 3500 }, { "epoch": 0.23277405663505538, "grad_norm": 0.4590144455432892, "learning_rate": 2e-05, "loss": 0.7419, "step": 3510 }, { "epoch": 0.2334372305855826, "grad_norm": 0.43060076236724854, "learning_rate": 2e-05, "loss": 0.75, "step": 3520 }, { "epoch": 0.23410040453610984, "grad_norm": 0.443794846534729, "learning_rate": 2e-05, "loss": 0.7265, "step": 3530 }, { "epoch": 0.23476357848663704, "grad_norm": 0.41293781995773315, "learning_rate": 2e-05, "loss": 0.6978, "step": 3540 }, { "epoch": 0.23542675243716427, "grad_norm": 0.4318286180496216, "learning_rate": 2e-05, "loss": 0.7027, "step": 3550 }, { "epoch": 0.2360899263876915, "grad_norm": 0.44508758187294006, "learning_rate": 2e-05, "loss": 0.7116, "step": 3560 }, { "epoch": 0.23675310033821872, "grad_norm": 0.44815289974212646, "learning_rate": 2e-05, "loss": 0.7196, "step": 3570 }, { "epoch": 0.23741627428874593, "grad_norm": 0.44028452038764954, "learning_rate": 2e-05, "loss": 0.7062, "step": 3580 }, { "epoch": 0.23807944823927316, "grad_norm": 0.4268244802951813, "learning_rate": 2e-05, "loss": 0.7231, "step": 3590 }, { "epoch": 0.23874262218980039, "grad_norm": 0.43976491689682007, "learning_rate": 2e-05, "loss": 0.7083, "step": 3600 }, { "epoch": 0.23940579614032761, "grad_norm": 0.45280003547668457, "learning_rate": 2e-05, "loss": 0.7081, "step": 3610 }, { "epoch": 0.24006897009085484, "grad_norm": 0.5611624717712402, "learning_rate": 2e-05, "loss": 0.7373, "step": 3620 }, { "epoch": 0.24073214404138205, "grad_norm": 0.45173415541648865, "learning_rate": 2e-05, "loss": 0.7446, "step": 3630 }, { "epoch": 0.24139531799190928, "grad_norm": 0.4839193820953369, "learning_rate": 2e-05, "loss": 0.7108, "step": 3640 }, { "epoch": 0.2420584919424365, "grad_norm": 0.48864683508872986, "learning_rate": 2e-05, "loss": 0.7502, "step": 3650 }, { "epoch": 0.24272166589296373, "grad_norm": 6.257961273193359, "learning_rate": 2e-05, "loss": 0.7874, "step": 3660 }, { "epoch": 0.24338483984349094, "grad_norm": 0.42597684264183044, "learning_rate": 2e-05, "loss": 0.7081, "step": 3670 }, { "epoch": 0.24404801379401816, "grad_norm": 0.4785451889038086, "learning_rate": 2e-05, "loss": 0.7285, "step": 3680 }, { "epoch": 0.2447111877445454, "grad_norm": 0.4379217028617859, "learning_rate": 2e-05, "loss": 0.7114, "step": 3690 }, { "epoch": 0.24537436169507262, "grad_norm": 0.47318464517593384, "learning_rate": 2e-05, "loss": 0.7031, "step": 3700 }, { "epoch": 0.24603753564559985, "grad_norm": 0.43900227546691895, "learning_rate": 2e-05, "loss": 0.7165, "step": 3710 }, { "epoch": 0.24670070959612705, "grad_norm": 0.435876727104187, "learning_rate": 2e-05, "loss": 0.7227, "step": 3720 }, { "epoch": 0.24736388354665428, "grad_norm": 0.43884292244911194, "learning_rate": 2e-05, "loss": 0.7259, "step": 3730 }, { "epoch": 0.2480270574971815, "grad_norm": 0.44448748230934143, "learning_rate": 2e-05, "loss": 0.7317, "step": 3740 }, { "epoch": 0.24869023144770874, "grad_norm": 0.5201537609100342, "learning_rate": 2e-05, "loss": 0.7032, "step": 3750 }, { "epoch": 0.24935340539823594, "grad_norm": 0.40599125623703003, "learning_rate": 2e-05, "loss": 0.7267, "step": 3760 }, { "epoch": 0.2500165793487632, "grad_norm": 0.4755355715751648, "learning_rate": 2e-05, "loss": 0.7407, "step": 3770 }, { "epoch": 0.25067975329929043, "grad_norm": 0.44619736075401306, "learning_rate": 2e-05, "loss": 0.7305, "step": 3780 }, { "epoch": 0.2513429272498176, "grad_norm": 0.43437689542770386, "learning_rate": 2e-05, "loss": 0.7043, "step": 3790 }, { "epoch": 0.25200610120034483, "grad_norm": 0.4214416742324829, "learning_rate": 2e-05, "loss": 0.738, "step": 3800 }, { "epoch": 0.25266927515087206, "grad_norm": 0.4558330178260803, "learning_rate": 2e-05, "loss": 0.6979, "step": 3810 }, { "epoch": 0.2533324491013993, "grad_norm": 0.43614012002944946, "learning_rate": 2e-05, "loss": 0.7248, "step": 3820 }, { "epoch": 0.2539956230519265, "grad_norm": 0.4879645109176636, "learning_rate": 2e-05, "loss": 0.7049, "step": 3830 }, { "epoch": 0.25465879700245375, "grad_norm": 0.40824270248413086, "learning_rate": 2e-05, "loss": 0.7119, "step": 3840 }, { "epoch": 0.255321970952981, "grad_norm": 0.44525161385536194, "learning_rate": 2e-05, "loss": 0.7238, "step": 3850 }, { "epoch": 0.2559851449035082, "grad_norm": 0.4895830452442169, "learning_rate": 2e-05, "loss": 0.7061, "step": 3860 }, { "epoch": 0.25664831885403544, "grad_norm": 0.4618409276008606, "learning_rate": 2e-05, "loss": 0.7099, "step": 3870 }, { "epoch": 0.2573114928045626, "grad_norm": 0.40779945254325867, "learning_rate": 2e-05, "loss": 0.7273, "step": 3880 }, { "epoch": 0.25797466675508984, "grad_norm": 0.44511210918426514, "learning_rate": 2e-05, "loss": 0.702, "step": 3890 }, { "epoch": 0.2586378407056171, "grad_norm": 0.45794036984443665, "learning_rate": 2e-05, "loss": 0.7281, "step": 3900 }, { "epoch": 0.2593010146561443, "grad_norm": 0.4685095548629761, "learning_rate": 2e-05, "loss": 0.7446, "step": 3910 }, { "epoch": 0.25996418860667153, "grad_norm": 0.4546467959880829, "learning_rate": 2e-05, "loss": 0.728, "step": 3920 }, { "epoch": 0.26062736255719876, "grad_norm": 0.43525663018226624, "learning_rate": 2e-05, "loss": 0.7127, "step": 3930 }, { "epoch": 0.261290536507726, "grad_norm": 0.49840015172958374, "learning_rate": 2e-05, "loss": 0.7344, "step": 3940 }, { "epoch": 0.2619537104582532, "grad_norm": 0.44585609436035156, "learning_rate": 2e-05, "loss": 0.7385, "step": 3950 }, { "epoch": 0.26261688440878045, "grad_norm": 0.44912222027778625, "learning_rate": 2e-05, "loss": 0.7332, "step": 3960 }, { "epoch": 0.2632800583593076, "grad_norm": 0.4206899106502533, "learning_rate": 2e-05, "loss": 0.7133, "step": 3970 }, { "epoch": 0.26394323230983485, "grad_norm": 0.4299122393131256, "learning_rate": 2e-05, "loss": 0.7172, "step": 3980 }, { "epoch": 0.2646064062603621, "grad_norm": 0.41612157225608826, "learning_rate": 2e-05, "loss": 0.7169, "step": 3990 }, { "epoch": 0.2652695802108893, "grad_norm": 0.4067608416080475, "learning_rate": 2e-05, "loss": 0.7051, "step": 4000 }, { "epoch": 0.26593275416141654, "grad_norm": 0.46370911598205566, "learning_rate": 2e-05, "loss": 0.7152, "step": 4010 }, { "epoch": 0.26659592811194377, "grad_norm": 0.45039990544319153, "learning_rate": 2e-05, "loss": 0.7003, "step": 4020 }, { "epoch": 0.267259102062471, "grad_norm": 0.4659903347492218, "learning_rate": 2e-05, "loss": 0.7071, "step": 4030 }, { "epoch": 0.26792227601299823, "grad_norm": 0.45298582315444946, "learning_rate": 2e-05, "loss": 0.7462, "step": 4040 }, { "epoch": 0.26858544996352546, "grad_norm": 0.4633753299713135, "learning_rate": 2e-05, "loss": 0.7148, "step": 4050 }, { "epoch": 0.26924862391405263, "grad_norm": 0.4284294545650482, "learning_rate": 2e-05, "loss": 0.7063, "step": 4060 }, { "epoch": 0.26991179786457986, "grad_norm": 0.440674751996994, "learning_rate": 2e-05, "loss": 0.7159, "step": 4070 }, { "epoch": 0.2705749718151071, "grad_norm": 0.45898178219795227, "learning_rate": 2e-05, "loss": 0.7172, "step": 4080 }, { "epoch": 0.2712381457656343, "grad_norm": 0.42899852991104126, "learning_rate": 2e-05, "loss": 0.7107, "step": 4090 }, { "epoch": 0.27190131971616155, "grad_norm": 0.4513186812400818, "learning_rate": 2e-05, "loss": 0.7014, "step": 4100 }, { "epoch": 0.2725644936666888, "grad_norm": 0.4538447856903076, "learning_rate": 2e-05, "loss": 0.7412, "step": 4110 }, { "epoch": 0.273227667617216, "grad_norm": 0.40217098593711853, "learning_rate": 2e-05, "loss": 0.7188, "step": 4120 }, { "epoch": 0.27389084156774324, "grad_norm": 0.4167708456516266, "learning_rate": 2e-05, "loss": 0.7247, "step": 4130 }, { "epoch": 0.27455401551827047, "grad_norm": 0.40658578276634216, "learning_rate": 2e-05, "loss": 0.7214, "step": 4140 }, { "epoch": 0.27521718946879764, "grad_norm": 0.43742382526397705, "learning_rate": 2e-05, "loss": 0.733, "step": 4150 }, { "epoch": 0.27588036341932487, "grad_norm": 0.41422826051712036, "learning_rate": 2e-05, "loss": 0.715, "step": 4160 }, { "epoch": 0.2765435373698521, "grad_norm": 0.41707736253738403, "learning_rate": 2e-05, "loss": 0.7095, "step": 4170 }, { "epoch": 0.27720671132037933, "grad_norm": 0.40865060687065125, "learning_rate": 2e-05, "loss": 0.7164, "step": 4180 }, { "epoch": 0.27786988527090656, "grad_norm": 0.4409600496292114, "learning_rate": 2e-05, "loss": 0.7287, "step": 4190 }, { "epoch": 0.2785330592214338, "grad_norm": 0.47225630283355713, "learning_rate": 2e-05, "loss": 0.7136, "step": 4200 }, { "epoch": 0.279196233171961, "grad_norm": 0.4420481324195862, "learning_rate": 2e-05, "loss": 0.7319, "step": 4210 }, { "epoch": 0.27985940712248825, "grad_norm": 0.422795832157135, "learning_rate": 2e-05, "loss": 0.7214, "step": 4220 }, { "epoch": 0.2805225810730155, "grad_norm": 0.4085385501384735, "learning_rate": 2e-05, "loss": 0.7193, "step": 4230 }, { "epoch": 0.28118575502354265, "grad_norm": 0.44029298424720764, "learning_rate": 2e-05, "loss": 0.7279, "step": 4240 }, { "epoch": 0.2818489289740699, "grad_norm": 0.4251239597797394, "learning_rate": 2e-05, "loss": 0.744, "step": 4250 }, { "epoch": 0.2825121029245971, "grad_norm": 0.4440610706806183, "learning_rate": 2e-05, "loss": 0.7224, "step": 4260 }, { "epoch": 0.28317527687512434, "grad_norm": 0.6336266994476318, "learning_rate": 2e-05, "loss": 0.7077, "step": 4270 }, { "epoch": 0.28383845082565157, "grad_norm": 0.40553924441337585, "learning_rate": 2e-05, "loss": 0.7134, "step": 4280 }, { "epoch": 0.2845016247761788, "grad_norm": 0.4212879538536072, "learning_rate": 2e-05, "loss": 0.7126, "step": 4290 }, { "epoch": 0.285164798726706, "grad_norm": 0.4236951470375061, "learning_rate": 2e-05, "loss": 0.7055, "step": 4300 }, { "epoch": 0.28582797267723326, "grad_norm": 0.4220391809940338, "learning_rate": 2e-05, "loss": 0.7137, "step": 4310 }, { "epoch": 0.2864911466277605, "grad_norm": 0.4318537712097168, "learning_rate": 2e-05, "loss": 0.727, "step": 4320 }, { "epoch": 0.28715432057828766, "grad_norm": 0.5137214064598083, "learning_rate": 2e-05, "loss": 0.7071, "step": 4330 }, { "epoch": 0.2878174945288149, "grad_norm": 0.41365182399749756, "learning_rate": 2e-05, "loss": 0.7075, "step": 4340 }, { "epoch": 0.2884806684793421, "grad_norm": 0.4234631359577179, "learning_rate": 2e-05, "loss": 0.7134, "step": 4350 }, { "epoch": 0.28914384242986935, "grad_norm": 0.44713494181632996, "learning_rate": 2e-05, "loss": 0.7075, "step": 4360 }, { "epoch": 0.2898070163803966, "grad_norm": 0.454023152589798, "learning_rate": 2e-05, "loss": 0.6971, "step": 4370 }, { "epoch": 0.2904701903309238, "grad_norm": 0.5051842927932739, "learning_rate": 2e-05, "loss": 0.7326, "step": 4380 }, { "epoch": 0.29113336428145103, "grad_norm": 0.5243337750434875, "learning_rate": 2e-05, "loss": 0.7078, "step": 4390 }, { "epoch": 0.29179653823197826, "grad_norm": 0.42526450753211975, "learning_rate": 2e-05, "loss": 0.7035, "step": 4400 }, { "epoch": 0.2924597121825055, "grad_norm": 0.4312632381916046, "learning_rate": 2e-05, "loss": 0.7195, "step": 4410 }, { "epoch": 0.29312288613303267, "grad_norm": 0.4477943181991577, "learning_rate": 2e-05, "loss": 0.7168, "step": 4420 }, { "epoch": 0.2937860600835599, "grad_norm": 0.4300823211669922, "learning_rate": 2e-05, "loss": 0.7174, "step": 4430 }, { "epoch": 0.2944492340340871, "grad_norm": 0.4278593361377716, "learning_rate": 2e-05, "loss": 0.7012, "step": 4440 }, { "epoch": 0.29511240798461436, "grad_norm": 0.473036527633667, "learning_rate": 2e-05, "loss": 0.7072, "step": 4450 }, { "epoch": 0.2957755819351416, "grad_norm": 0.5350799560546875, "learning_rate": 2e-05, "loss": 0.724, "step": 4460 }, { "epoch": 0.2964387558856688, "grad_norm": 0.40777650475502014, "learning_rate": 2e-05, "loss": 0.6892, "step": 4470 }, { "epoch": 0.29710192983619604, "grad_norm": 0.4430738091468811, "learning_rate": 2e-05, "loss": 0.7112, "step": 4480 }, { "epoch": 0.2977651037867233, "grad_norm": 0.5116422772407532, "learning_rate": 2e-05, "loss": 0.7102, "step": 4490 }, { "epoch": 0.2984282777372505, "grad_norm": 0.4413306713104248, "learning_rate": 2e-05, "loss": 0.703, "step": 4500 }, { "epoch": 0.29909145168777773, "grad_norm": 0.44744178652763367, "learning_rate": 2e-05, "loss": 0.7224, "step": 4510 }, { "epoch": 0.2997546256383049, "grad_norm": 0.4297047257423401, "learning_rate": 2e-05, "loss": 0.7257, "step": 4520 }, { "epoch": 0.30041779958883214, "grad_norm": 0.4384410083293915, "learning_rate": 2e-05, "loss": 0.6988, "step": 4530 }, { "epoch": 0.30108097353935936, "grad_norm": 0.4327126145362854, "learning_rate": 2e-05, "loss": 0.7354, "step": 4540 }, { "epoch": 0.3017441474898866, "grad_norm": 0.4421708285808563, "learning_rate": 2e-05, "loss": 0.7248, "step": 4550 }, { "epoch": 0.3024073214404138, "grad_norm": 0.4230192303657532, "learning_rate": 2e-05, "loss": 0.7068, "step": 4560 }, { "epoch": 0.30307049539094105, "grad_norm": 0.4164934456348419, "learning_rate": 2e-05, "loss": 0.7064, "step": 4570 }, { "epoch": 0.3037336693414683, "grad_norm": 0.42152565717697144, "learning_rate": 2e-05, "loss": 0.7301, "step": 4580 }, { "epoch": 0.3043968432919955, "grad_norm": 0.4739789068698883, "learning_rate": 2e-05, "loss": 0.6957, "step": 4590 }, { "epoch": 0.30506001724252274, "grad_norm": 0.42717763781547546, "learning_rate": 2e-05, "loss": 0.7124, "step": 4600 }, { "epoch": 0.3057231911930499, "grad_norm": 0.5130007266998291, "learning_rate": 2e-05, "loss": 0.7385, "step": 4610 }, { "epoch": 0.30638636514357714, "grad_norm": 0.4164990186691284, "learning_rate": 2e-05, "loss": 0.7122, "step": 4620 }, { "epoch": 0.3070495390941044, "grad_norm": 0.4283609986305237, "learning_rate": 2e-05, "loss": 0.6891, "step": 4630 }, { "epoch": 0.3077127130446316, "grad_norm": 0.41688019037246704, "learning_rate": 2e-05, "loss": 0.7143, "step": 4640 }, { "epoch": 0.30837588699515883, "grad_norm": 0.4387054443359375, "learning_rate": 2e-05, "loss": 0.7008, "step": 4650 }, { "epoch": 0.30903906094568606, "grad_norm": 0.4529563784599304, "learning_rate": 2e-05, "loss": 0.6975, "step": 4660 }, { "epoch": 0.3097022348962133, "grad_norm": 0.45100653171539307, "learning_rate": 2e-05, "loss": 0.7173, "step": 4670 }, { "epoch": 0.3103654088467405, "grad_norm": 0.43708083033561707, "learning_rate": 2e-05, "loss": 0.7306, "step": 4680 }, { "epoch": 0.31102858279726775, "grad_norm": 0.44238895177841187, "learning_rate": 2e-05, "loss": 0.7065, "step": 4690 }, { "epoch": 0.3116917567477949, "grad_norm": 0.41368401050567627, "learning_rate": 2e-05, "loss": 0.6941, "step": 4700 }, { "epoch": 0.31235493069832215, "grad_norm": 0.4319513738155365, "learning_rate": 2e-05, "loss": 0.6883, "step": 4710 }, { "epoch": 0.3130181046488494, "grad_norm": 0.44077882170677185, "learning_rate": 2e-05, "loss": 0.7037, "step": 4720 }, { "epoch": 0.3136812785993766, "grad_norm": 0.4406428337097168, "learning_rate": 2e-05, "loss": 0.7042, "step": 4730 }, { "epoch": 0.31434445254990384, "grad_norm": 0.4604378044605255, "learning_rate": 2e-05, "loss": 0.6969, "step": 4740 }, { "epoch": 0.31500762650043107, "grad_norm": 0.4481877088546753, "learning_rate": 2e-05, "loss": 0.6937, "step": 4750 }, { "epoch": 0.3156708004509583, "grad_norm": 0.4246469736099243, "learning_rate": 2e-05, "loss": 0.7249, "step": 4760 }, { "epoch": 0.31633397440148553, "grad_norm": 0.399565190076828, "learning_rate": 2e-05, "loss": 0.7022, "step": 4770 }, { "epoch": 0.31699714835201276, "grad_norm": 0.4086315929889679, "learning_rate": 2e-05, "loss": 0.7241, "step": 4780 }, { "epoch": 0.31766032230253993, "grad_norm": 0.4032701253890991, "learning_rate": 2e-05, "loss": 0.7258, "step": 4790 }, { "epoch": 0.31832349625306716, "grad_norm": 0.39910489320755005, "learning_rate": 2e-05, "loss": 0.7256, "step": 4800 }, { "epoch": 0.3189866702035944, "grad_norm": 0.4245343506336212, "learning_rate": 2e-05, "loss": 0.7212, "step": 4810 }, { "epoch": 0.3196498441541216, "grad_norm": 0.42083439230918884, "learning_rate": 2e-05, "loss": 0.725, "step": 4820 }, { "epoch": 0.32031301810464885, "grad_norm": 0.8856384754180908, "learning_rate": 2e-05, "loss": 0.7128, "step": 4830 }, { "epoch": 0.3209761920551761, "grad_norm": 0.42265793681144714, "learning_rate": 2e-05, "loss": 0.7149, "step": 4840 }, { "epoch": 0.3216393660057033, "grad_norm": 0.418274849653244, "learning_rate": 2e-05, "loss": 0.7008, "step": 4850 }, { "epoch": 0.32230253995623054, "grad_norm": 0.44719722867012024, "learning_rate": 2e-05, "loss": 0.7169, "step": 4860 }, { "epoch": 0.32296571390675777, "grad_norm": 0.4416983127593994, "learning_rate": 2e-05, "loss": 0.693, "step": 4870 }, { "epoch": 0.32362888785728494, "grad_norm": 0.42274999618530273, "learning_rate": 2e-05, "loss": 0.7383, "step": 4880 }, { "epoch": 0.32429206180781217, "grad_norm": 0.49183934926986694, "learning_rate": 2e-05, "loss": 0.721, "step": 4890 }, { "epoch": 0.3249552357583394, "grad_norm": 0.4221515953540802, "learning_rate": 2e-05, "loss": 0.7014, "step": 4900 }, { "epoch": 0.32561840970886663, "grad_norm": 0.4345867335796356, "learning_rate": 2e-05, "loss": 0.6958, "step": 4910 }, { "epoch": 0.32628158365939386, "grad_norm": 0.4104120135307312, "learning_rate": 2e-05, "loss": 0.707, "step": 4920 }, { "epoch": 0.3269447576099211, "grad_norm": 0.480258584022522, "learning_rate": 2e-05, "loss": 0.6942, "step": 4930 }, { "epoch": 0.3276079315604483, "grad_norm": 0.5035107135772705, "learning_rate": 2e-05, "loss": 0.7108, "step": 4940 }, { "epoch": 0.32827110551097555, "grad_norm": 0.4675476551055908, "learning_rate": 2e-05, "loss": 0.7051, "step": 4950 }, { "epoch": 0.3289342794615028, "grad_norm": 0.4497123956680298, "learning_rate": 2e-05, "loss": 0.7192, "step": 4960 }, { "epoch": 0.32959745341202995, "grad_norm": 0.4247696101665497, "learning_rate": 2e-05, "loss": 0.718, "step": 4970 }, { "epoch": 0.3302606273625572, "grad_norm": 0.4365120530128479, "learning_rate": 2e-05, "loss": 0.7034, "step": 4980 }, { "epoch": 0.3309238013130844, "grad_norm": 0.4657589793205261, "learning_rate": 2e-05, "loss": 0.7221, "step": 4990 }, { "epoch": 0.33158697526361164, "grad_norm": 0.4138410985469818, "learning_rate": 2e-05, "loss": 0.6798, "step": 5000 }, { "epoch": 0.33225014921413887, "grad_norm": 0.4804857671260834, "learning_rate": 2e-05, "loss": 0.7127, "step": 5010 }, { "epoch": 0.3329133231646661, "grad_norm": 0.43275633454322815, "learning_rate": 2e-05, "loss": 0.7141, "step": 5020 }, { "epoch": 0.3335764971151933, "grad_norm": 0.4018505811691284, "learning_rate": 2e-05, "loss": 0.7067, "step": 5030 }, { "epoch": 0.33423967106572056, "grad_norm": 0.4772813320159912, "learning_rate": 2e-05, "loss": 0.6925, "step": 5040 }, { "epoch": 0.3349028450162478, "grad_norm": 0.4661034345626831, "learning_rate": 2e-05, "loss": 0.693, "step": 5050 }, { "epoch": 0.33556601896677496, "grad_norm": 0.3940356969833374, "learning_rate": 2e-05, "loss": 0.7052, "step": 5060 }, { "epoch": 0.3362291929173022, "grad_norm": 0.40755006670951843, "learning_rate": 2e-05, "loss": 0.6905, "step": 5070 }, { "epoch": 0.3368923668678294, "grad_norm": 0.4546791911125183, "learning_rate": 2e-05, "loss": 0.7117, "step": 5080 }, { "epoch": 0.33755554081835665, "grad_norm": 0.4277106821537018, "learning_rate": 2e-05, "loss": 0.7144, "step": 5090 }, { "epoch": 0.3382187147688839, "grad_norm": 0.4051600992679596, "learning_rate": 2e-05, "loss": 0.6937, "step": 5100 }, { "epoch": 0.3388818887194111, "grad_norm": 0.43261224031448364, "learning_rate": 2e-05, "loss": 0.6999, "step": 5110 }, { "epoch": 0.33954506266993834, "grad_norm": 0.42372557520866394, "learning_rate": 2e-05, "loss": 0.7105, "step": 5120 }, { "epoch": 0.34020823662046557, "grad_norm": 0.49420851469039917, "learning_rate": 2e-05, "loss": 0.7107, "step": 5130 }, { "epoch": 0.3408714105709928, "grad_norm": 0.4319324493408203, "learning_rate": 2e-05, "loss": 0.6903, "step": 5140 }, { "epoch": 0.34153458452151997, "grad_norm": 0.4231835901737213, "learning_rate": 2e-05, "loss": 0.7101, "step": 5150 }, { "epoch": 0.3421977584720472, "grad_norm": 0.41818317770957947, "learning_rate": 2e-05, "loss": 0.719, "step": 5160 }, { "epoch": 0.3428609324225744, "grad_norm": 0.4805700480937958, "learning_rate": 2e-05, "loss": 0.7006, "step": 5170 }, { "epoch": 0.34352410637310166, "grad_norm": 0.4527558982372284, "learning_rate": 2e-05, "loss": 0.7188, "step": 5180 }, { "epoch": 0.3441872803236289, "grad_norm": 0.5771711468696594, "learning_rate": 2e-05, "loss": 0.7117, "step": 5190 }, { "epoch": 0.3448504542741561, "grad_norm": 0.43666353821754456, "learning_rate": 2e-05, "loss": 0.7206, "step": 5200 }, { "epoch": 0.34551362822468334, "grad_norm": 0.42155739665031433, "learning_rate": 2e-05, "loss": 0.71, "step": 5210 }, { "epoch": 0.3461768021752106, "grad_norm": 0.40986326336860657, "learning_rate": 2e-05, "loss": 0.6981, "step": 5220 }, { "epoch": 0.3468399761257378, "grad_norm": 0.4199829399585724, "learning_rate": 2e-05, "loss": 0.7053, "step": 5230 }, { "epoch": 0.347503150076265, "grad_norm": 0.41298285126686096, "learning_rate": 2e-05, "loss": 0.6849, "step": 5240 }, { "epoch": 0.3481663240267922, "grad_norm": 0.42672210931777954, "learning_rate": 2e-05, "loss": 0.691, "step": 5250 }, { "epoch": 0.34882949797731944, "grad_norm": 0.43835774064064026, "learning_rate": 2e-05, "loss": 0.6876, "step": 5260 }, { "epoch": 0.34949267192784667, "grad_norm": 0.40993231534957886, "learning_rate": 2e-05, "loss": 0.7297, "step": 5270 }, { "epoch": 0.3501558458783739, "grad_norm": 0.45235201716423035, "learning_rate": 2e-05, "loss": 0.699, "step": 5280 }, { "epoch": 0.3508190198289011, "grad_norm": 0.4141416549682617, "learning_rate": 2e-05, "loss": 0.7048, "step": 5290 }, { "epoch": 0.35148219377942835, "grad_norm": 0.4252654016017914, "learning_rate": 2e-05, "loss": 0.7101, "step": 5300 }, { "epoch": 0.3521453677299556, "grad_norm": 0.43203818798065186, "learning_rate": 2e-05, "loss": 0.6998, "step": 5310 }, { "epoch": 0.3528085416804828, "grad_norm": 0.40562939643859863, "learning_rate": 2e-05, "loss": 0.6865, "step": 5320 }, { "epoch": 0.35347171563101004, "grad_norm": 0.4484749734401703, "learning_rate": 2e-05, "loss": 0.7036, "step": 5330 }, { "epoch": 0.3541348895815372, "grad_norm": 0.5492318868637085, "learning_rate": 2e-05, "loss": 0.7002, "step": 5340 }, { "epoch": 0.35479806353206444, "grad_norm": 0.5349329113960266, "learning_rate": 1.999194520388485e-05, "loss": 0.6855, "step": 5350 }, { "epoch": 0.3554612374825917, "grad_norm": 0.470889151096344, "learning_rate": 1.9959247303157763e-05, "loss": 0.7176, "step": 5360 }, { "epoch": 0.3561244114331189, "grad_norm": 0.41299134492874146, "learning_rate": 1.990149424459817e-05, "loss": 0.7035, "step": 5370 }, { "epoch": 0.35678758538364613, "grad_norm": 0.450900137424469, "learning_rate": 1.9818847538648688e-05, "loss": 0.693, "step": 5380 }, { "epoch": 0.35745075933417336, "grad_norm": 0.42808613181114197, "learning_rate": 1.971153831256721e-05, "loss": 0.6777, "step": 5390 }, { "epoch": 0.3581139332847006, "grad_norm": 0.43397775292396545, "learning_rate": 1.9579866664063435e-05, "loss": 0.7049, "step": 5400 }, { "epoch": 0.3587771072352278, "grad_norm": 0.4414255619049072, "learning_rate": 1.9424200822054782e-05, "loss": 0.7204, "step": 5410 }, { "epoch": 0.35944028118575505, "grad_norm": 0.4406629204750061, "learning_rate": 1.9244976116888626e-05, "loss": 0.7162, "step": 5420 }, { "epoch": 0.3601034551362822, "grad_norm": 0.43205147981643677, "learning_rate": 1.904269376291071e-05, "loss": 0.7101, "step": 5430 }, { "epoch": 0.36076662908680945, "grad_norm": 0.4646110236644745, "learning_rate": 1.88179194567844e-05, "loss": 0.7074, "step": 5440 }, { "epoch": 0.3614298030373367, "grad_norm": 0.4257560968399048, "learning_rate": 1.8571281795480632e-05, "loss": 0.7213, "step": 5450 }, { "epoch": 0.3620929769878639, "grad_norm": 0.4763351082801819, "learning_rate": 1.8303470518362808e-05, "loss": 0.6993, "step": 5460 }, { "epoch": 0.36275615093839114, "grad_norm": 0.4287746846675873, "learning_rate": 1.801523457828271e-05, "loss": 0.6837, "step": 5470 }, { "epoch": 0.36341932488891837, "grad_norm": 0.41130346059799194, "learning_rate": 1.7707380047081796e-05, "loss": 0.6783, "step": 5480 }, { "epoch": 0.3640824988394456, "grad_norm": 0.42945313453674316, "learning_rate": 1.7380767861355252e-05, "loss": 0.6811, "step": 5490 }, { "epoch": 0.36474567278997283, "grad_norm": 0.4491105377674103, "learning_rate": 1.703631141478299e-05, "loss": 0.718, "step": 5500 }, { "epoch": 0.36540884674050006, "grad_norm": 0.44828975200653076, "learning_rate": 1.6674974003760705e-05, "loss": 0.6942, "step": 5510 }, { "epoch": 0.36607202069102723, "grad_norm": 0.4078657925128937, "learning_rate": 1.6297766133474556e-05, "loss": 0.7016, "step": 5520 }, { "epoch": 0.36673519464155446, "grad_norm": 0.479805588722229, "learning_rate": 1.5905742691953186e-05, "loss": 0.6724, "step": 5530 }, { "epoch": 0.3673983685920817, "grad_norm": 0.4268275797367096, "learning_rate": 1.55e-05, "loss": 0.7033, "step": 5540 }, { "epoch": 0.3680615425426089, "grad_norm": 0.4907868504524231, "learning_rate": 1.5081672745255862e-05, "loss": 0.7065, "step": 5550 }, { "epoch": 0.36872471649313615, "grad_norm": 0.4120388329029083, "learning_rate": 1.4651930808966206e-05, "loss": 0.672, "step": 5560 }, { "epoch": 0.3693878904436634, "grad_norm": 0.4049204885959625, "learning_rate": 1.4211975994326848e-05, "loss": 0.681, "step": 5570 }, { "epoch": 0.3700510643941906, "grad_norm": 0.39874541759490967, "learning_rate": 1.376303866555779e-05, "loss": 0.7047, "step": 5580 }, { "epoch": 0.37071423834471784, "grad_norm": 0.44057223200798035, "learning_rate": 1.3306374307104164e-05, "loss": 0.6986, "step": 5590 }, { "epoch": 0.37137741229524507, "grad_norm": 0.46499621868133545, "learning_rate": 1.2843260012586718e-05, "loss": 0.7048, "step": 5600 }, { "epoch": 0.37204058624577224, "grad_norm": 0.39177006483078003, "learning_rate": 1.2374990913320726e-05, "loss": 0.705, "step": 5610 }, { "epoch": 0.37270376019629947, "grad_norm": 0.4431237578392029, "learning_rate": 1.1902876556391247e-05, "loss": 0.6792, "step": 5620 }, { "epoch": 0.3733669341468267, "grad_norm": 0.47281622886657715, "learning_rate": 1.1428237242413685e-05, "loss": 0.6847, "step": 5630 }, { "epoch": 0.37403010809735393, "grad_norm": 0.43715614080429077, "learning_rate": 1.095240033322132e-05, "loss": 0.6952, "step": 5640 }, { "epoch": 0.37469328204788116, "grad_norm": 0.6536780595779419, "learning_rate": 1.047669653980572e-05, "loss": 0.6789, "step": 5650 }, { "epoch": 0.3753564559984084, "grad_norm": 0.42568010091781616, "learning_rate": 1.0002456200890902e-05, "loss": 0.6734, "step": 5660 }, { "epoch": 0.3760196299489356, "grad_norm": 0.4551185071468353, "learning_rate": 9.531005562548668e-06, "loss": 0.691, "step": 5670 }, { "epoch": 0.37668280389946285, "grad_norm": 0.4053123891353607, "learning_rate": 9.06366306925925e-06, "loss": 0.6905, "step": 5680 }, { "epoch": 0.3773459778499901, "grad_norm": 0.44013091921806335, "learning_rate": 8.601735676789686e-06, "loss": 0.7033, "step": 5690 }, { "epoch": 0.37800915180051725, "grad_norm": 0.4361964762210846, "learning_rate": 8.14651519720118e-06, "loss": 0.7004, "step": 5700 }, { "epoch": 0.3786723257510445, "grad_norm": 0.4564845561981201, "learning_rate": 7.699274686206866e-06, "loss": 0.6906, "step": 5710 }, { "epoch": 0.3793354997015717, "grad_norm": 0.4334389865398407, "learning_rate": 7.261264882983024e-06, "loss": 0.6925, "step": 5720 }, { "epoch": 0.37999867365209894, "grad_norm": 0.596119225025177, "learning_rate": 6.8337107123900386e-06, "loss": 0.7364, "step": 5730 }, { "epoch": 0.38066184760262617, "grad_norm": 0.3939472734928131, "learning_rate": 6.417807859384881e-06, "loss": 0.6926, "step": 5740 }, { "epoch": 0.3813250215531534, "grad_norm": 0.4060012698173523, "learning_rate": 6.014719425205009e-06, "loss": 0.6877, "step": 5750 }, { "epoch": 0.3819881955036806, "grad_norm": 0.40652188658714294, "learning_rate": 5.6255726746749275e-06, "loss": 0.6857, "step": 5760 }, { "epoch": 0.38265136945420786, "grad_norm": 0.40667375922203064, "learning_rate": 5.251455883731728e-06, "loss": 0.6827, "step": 5770 }, { "epoch": 0.3833145434047351, "grad_norm": 0.4259006083011627, "learning_rate": 4.893415295985812e-06, "loss": 0.6984, "step": 5780 }, { "epoch": 0.38397771735526226, "grad_norm": 0.4109838306903839, "learning_rate": 4.552452196827885e-06, "loss": 0.6843, "step": 5790 }, { "epoch": 0.3846408913057895, "grad_norm": 0.4440414607524872, "learning_rate": 4.229520113264785e-06, "loss": 0.6688, "step": 5800 }, { "epoch": 0.3853040652563167, "grad_norm": 0.43259701132774353, "learning_rate": 3.925522147314915e-06, "loss": 0.6997, "step": 5810 }, { "epoch": 0.38596723920684395, "grad_norm": 0.4748006761074066, "learning_rate": 3.641308450420675e-06, "loss": 0.683, "step": 5820 }, { "epoch": 0.3866304131573712, "grad_norm": 0.4007572531700134, "learning_rate": 3.37767384594087e-06, "loss": 0.7087, "step": 5830 }, { "epoch": 0.3872935871078984, "grad_norm": 0.39761948585510254, "learning_rate": 3.1353556063719357e-06, "loss": 0.6765, "step": 5840 }, { "epoch": 0.38795676105842564, "grad_norm": 0.4246253967285156, "learning_rate": 2.9150313915141474e-06, "loss": 0.6728, "step": 5850 }, { "epoch": 0.38861993500895287, "grad_norm": 0.45218634605407715, "learning_rate": 2.717317353348891e-06, "loss": 0.7055, "step": 5860 }, { "epoch": 0.3892831089594801, "grad_norm": 0.4528957009315491, "learning_rate": 2.5427664129268253e-06, "loss": 0.6893, "step": 5870 }, { "epoch": 0.38994628291000727, "grad_norm": 0.4231392741203308, "learning_rate": 2.391866714085717e-06, "loss": 0.6885, "step": 5880 }, { "epoch": 0.3906094568605345, "grad_norm": 0.5117971301078796, "learning_rate": 2.2650402583222753e-06, "loss": 0.6926, "step": 5890 }, { "epoch": 0.39127263081106173, "grad_norm": 0.4415339529514313, "learning_rate": 2.1626417246356398e-06, "loss": 0.6778, "step": 5900 }, { "epoch": 0.39193580476158896, "grad_norm": 0.4275270700454712, "learning_rate": 2.084957477642894e-06, "loss": 0.7156, "step": 5910 }, { "epoch": 0.3925989787121162, "grad_norm": 0.4181906282901764, "learning_rate": 2.0322047667405147e-06, "loss": 0.6977, "step": 5920 }, { "epoch": 0.3932621526626434, "grad_norm": 0.43344050645828247, "learning_rate": 2.0045311185513342e-06, "loss": 0.6995, "step": 5930 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.6494000762504348e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }