{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.36817617866004965, "eval_steps": 500, "global_step": 5935, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0006203473945409429, "grad_norm": 1.103378415107727, "learning_rate": 2.910112359550562e-06, "loss": 0.8492, "step": 10 }, { "epoch": 0.0012406947890818859, "grad_norm": 0.9267538189888, "learning_rate": 3.921348314606742e-06, "loss": 0.7944, "step": 20 }, { "epoch": 0.0018610421836228288, "grad_norm": 0.8842476606369019, "learning_rate": 4.932584269662922e-06, "loss": 0.7628, "step": 30 }, { "epoch": 0.0024813895781637717, "grad_norm": 0.8289238810539246, "learning_rate": 5.943820224719102e-06, "loss": 0.7342, "step": 40 }, { "epoch": 0.003101736972704715, "grad_norm": 0.9065801501274109, "learning_rate": 6.955056179775282e-06, "loss": 0.7217, "step": 50 }, { "epoch": 0.0037220843672456576, "grad_norm": 0.8170527815818787, "learning_rate": 7.966292134831462e-06, "loss": 0.73, "step": 60 }, { "epoch": 0.004342431761786601, "grad_norm": 0.8123277425765991, "learning_rate": 8.977528089887641e-06, "loss": 0.7154, "step": 70 }, { "epoch": 0.004962779156327543, "grad_norm": 0.7789028882980347, "learning_rate": 9.988764044943822e-06, "loss": 0.7083, "step": 80 }, { "epoch": 0.005583126550868486, "grad_norm": 0.7920109033584595, "learning_rate": 1.1000000000000001e-05, "loss": 0.7252, "step": 90 }, { "epoch": 0.00620347394540943, "grad_norm": 0.9307668209075928, "learning_rate": 1.2011235955056182e-05, "loss": 0.6857, "step": 100 }, { "epoch": 0.006823821339950372, "grad_norm": 0.8309650421142578, "learning_rate": 1.3022471910112362e-05, "loss": 0.7, "step": 110 }, { "epoch": 0.007444168734491315, "grad_norm": 0.907129168510437, "learning_rate": 1.403370786516854e-05, "loss": 0.7132, "step": 120 }, { "epoch": 0.008064516129032258, "grad_norm": 0.8221721649169922, "learning_rate": 1.504494382022472e-05, "loss": 0.7001, "step": 130 }, { "epoch": 0.008684863523573201, "grad_norm": 0.701308012008667, "learning_rate": 1.60561797752809e-05, "loss": 0.699, "step": 140 }, { "epoch": 0.009305210918114143, "grad_norm": 0.7170705199241638, "learning_rate": 1.706741573033708e-05, "loss": 0.6725, "step": 150 }, { "epoch": 0.009925558312655087, "grad_norm": 0.8029273152351379, "learning_rate": 1.8078651685393256e-05, "loss": 0.6839, "step": 160 }, { "epoch": 0.01054590570719603, "grad_norm": 0.7059943079948425, "learning_rate": 1.908988764044944e-05, "loss": 0.6963, "step": 170 }, { "epoch": 0.011166253101736972, "grad_norm": 0.7652074694633484, "learning_rate": 2e-05, "loss": 0.6906, "step": 180 }, { "epoch": 0.011786600496277916, "grad_norm": 0.777823269367218, "learning_rate": 2e-05, "loss": 0.6697, "step": 190 }, { "epoch": 0.01240694789081886, "grad_norm": 0.7011638879776001, "learning_rate": 2e-05, "loss": 0.6886, "step": 200 }, { "epoch": 0.013027295285359801, "grad_norm": 0.7449702024459839, "learning_rate": 2e-05, "loss": 0.6957, "step": 210 }, { "epoch": 0.013647642679900745, "grad_norm": 0.7148544192314148, "learning_rate": 2e-05, "loss": 0.6679, "step": 220 }, { "epoch": 0.014267990074441687, "grad_norm": 0.6491106748580933, "learning_rate": 2e-05, "loss": 0.6916, "step": 230 }, { "epoch": 0.01488833746898263, "grad_norm": 0.5647692084312439, "learning_rate": 2e-05, "loss": 0.6986, "step": 240 }, { "epoch": 0.015508684863523574, "grad_norm": 0.5894495844841003, "learning_rate": 2e-05, "loss": 0.7308, "step": 250 }, { "epoch": 0.016129032258064516, "grad_norm": 0.5743111371994019, "learning_rate": 2e-05, "loss": 0.6988, "step": 260 }, { "epoch": 0.016749379652605458, "grad_norm": 0.5293608903884888, "learning_rate": 2e-05, "loss": 0.6821, "step": 270 }, { "epoch": 0.017369727047146403, "grad_norm": 0.5631842613220215, "learning_rate": 2e-05, "loss": 0.6701, "step": 280 }, { "epoch": 0.017990074441687345, "grad_norm": 0.5677319765090942, "learning_rate": 2e-05, "loss": 0.7191, "step": 290 }, { "epoch": 0.018610421836228287, "grad_norm": 0.5547688603401184, "learning_rate": 2e-05, "loss": 0.7094, "step": 300 }, { "epoch": 0.019230769230769232, "grad_norm": 0.5547721982002258, "learning_rate": 2e-05, "loss": 0.6783, "step": 310 }, { "epoch": 0.019851116625310174, "grad_norm": 0.5873662829399109, "learning_rate": 2e-05, "loss": 0.707, "step": 320 }, { "epoch": 0.020471464019851116, "grad_norm": 0.5058910846710205, "learning_rate": 2e-05, "loss": 0.663, "step": 330 }, { "epoch": 0.02109181141439206, "grad_norm": 0.4962847828865051, "learning_rate": 2e-05, "loss": 0.6727, "step": 340 }, { "epoch": 0.021712158808933003, "grad_norm": 0.49221107363700867, "learning_rate": 2e-05, "loss": 0.666, "step": 350 }, { "epoch": 0.022332506203473945, "grad_norm": 0.4796120822429657, "learning_rate": 2e-05, "loss": 0.6665, "step": 360 }, { "epoch": 0.02295285359801489, "grad_norm": 0.5007806420326233, "learning_rate": 2e-05, "loss": 0.6865, "step": 370 }, { "epoch": 0.02357320099255583, "grad_norm": 0.5052497386932373, "learning_rate": 2e-05, "loss": 0.67, "step": 380 }, { "epoch": 0.024193548387096774, "grad_norm": 0.4976111948490143, "learning_rate": 2e-05, "loss": 0.6971, "step": 390 }, { "epoch": 0.02481389578163772, "grad_norm": 0.489734947681427, "learning_rate": 2e-05, "loss": 0.7244, "step": 400 }, { "epoch": 0.02543424317617866, "grad_norm": 0.504808783531189, "learning_rate": 2e-05, "loss": 0.6574, "step": 410 }, { "epoch": 0.026054590570719603, "grad_norm": 0.5242099761962891, "learning_rate": 2e-05, "loss": 0.6793, "step": 420 }, { "epoch": 0.026674937965260544, "grad_norm": 0.48700666427612305, "learning_rate": 2e-05, "loss": 0.6733, "step": 430 }, { "epoch": 0.02729528535980149, "grad_norm": 0.5279196500778198, "learning_rate": 2e-05, "loss": 0.6807, "step": 440 }, { "epoch": 0.02791563275434243, "grad_norm": 1.6781505346298218, "learning_rate": 2e-05, "loss": 0.7033, "step": 450 }, { "epoch": 0.028535980148883373, "grad_norm": 0.589901328086853, "learning_rate": 2e-05, "loss": 0.7007, "step": 460 }, { "epoch": 0.02915632754342432, "grad_norm": 0.9268983006477356, "learning_rate": 2e-05, "loss": 0.6832, "step": 470 }, { "epoch": 0.02977667493796526, "grad_norm": 0.47625434398651123, "learning_rate": 2e-05, "loss": 0.6953, "step": 480 }, { "epoch": 0.030397022332506202, "grad_norm": 0.5042843818664551, "learning_rate": 2e-05, "loss": 0.6592, "step": 490 }, { "epoch": 0.031017369727047148, "grad_norm": 0.44941166043281555, "learning_rate": 2e-05, "loss": 0.695, "step": 500 }, { "epoch": 0.03163771712158809, "grad_norm": 0.477464497089386, "learning_rate": 2e-05, "loss": 0.6707, "step": 510 }, { "epoch": 0.03225806451612903, "grad_norm": 0.4819585680961609, "learning_rate": 2e-05, "loss": 0.6708, "step": 520 }, { "epoch": 0.03287841191066997, "grad_norm": 0.4723353981971741, "learning_rate": 2e-05, "loss": 0.6615, "step": 530 }, { "epoch": 0.033498759305210915, "grad_norm": 0.4481304883956909, "learning_rate": 2e-05, "loss": 0.6716, "step": 540 }, { "epoch": 0.034119106699751864, "grad_norm": 0.4634115993976593, "learning_rate": 2e-05, "loss": 0.6564, "step": 550 }, { "epoch": 0.034739454094292806, "grad_norm": 0.4898909628391266, "learning_rate": 2e-05, "loss": 0.6783, "step": 560 }, { "epoch": 0.03535980148883375, "grad_norm": 0.49201110005378723, "learning_rate": 2e-05, "loss": 0.6679, "step": 570 }, { "epoch": 0.03598014888337469, "grad_norm": 0.4393959045410156, "learning_rate": 2e-05, "loss": 0.6984, "step": 580 }, { "epoch": 0.03660049627791563, "grad_norm": 0.4818369746208191, "learning_rate": 2e-05, "loss": 0.6841, "step": 590 }, { "epoch": 0.03722084367245657, "grad_norm": 0.4339914917945862, "learning_rate": 2e-05, "loss": 0.6787, "step": 600 }, { "epoch": 0.03784119106699752, "grad_norm": 0.43327295780181885, "learning_rate": 2e-05, "loss": 0.6796, "step": 610 }, { "epoch": 0.038461538461538464, "grad_norm": 0.4560607969760895, "learning_rate": 2e-05, "loss": 0.6468, "step": 620 }, { "epoch": 0.039081885856079406, "grad_norm": 0.47957178950309753, "learning_rate": 2e-05, "loss": 0.6495, "step": 630 }, { "epoch": 0.03970223325062035, "grad_norm": 0.4618580639362335, "learning_rate": 2e-05, "loss": 0.669, "step": 640 }, { "epoch": 0.04032258064516129, "grad_norm": 0.505342423915863, "learning_rate": 2e-05, "loss": 0.6767, "step": 650 }, { "epoch": 0.04094292803970223, "grad_norm": 0.48456406593322754, "learning_rate": 2e-05, "loss": 0.6804, "step": 660 }, { "epoch": 0.04156327543424317, "grad_norm": 0.44942647218704224, "learning_rate": 2e-05, "loss": 0.6661, "step": 670 }, { "epoch": 0.04218362282878412, "grad_norm": 0.4639962315559387, "learning_rate": 2e-05, "loss": 0.6796, "step": 680 }, { "epoch": 0.042803970223325064, "grad_norm": 0.46533408761024475, "learning_rate": 2e-05, "loss": 0.6875, "step": 690 }, { "epoch": 0.043424317617866005, "grad_norm": 0.42894449830055237, "learning_rate": 2e-05, "loss": 0.6436, "step": 700 }, { "epoch": 0.04404466501240695, "grad_norm": 0.5065799951553345, "learning_rate": 2e-05, "loss": 0.6714, "step": 710 }, { "epoch": 0.04466501240694789, "grad_norm": 0.4446672797203064, "learning_rate": 2e-05, "loss": 0.6871, "step": 720 }, { "epoch": 0.04528535980148883, "grad_norm": 0.4434851109981537, "learning_rate": 2e-05, "loss": 0.6584, "step": 730 }, { "epoch": 0.04590570719602978, "grad_norm": 0.5027102828025818, "learning_rate": 2e-05, "loss": 0.6791, "step": 740 }, { "epoch": 0.04652605459057072, "grad_norm": 0.4595511853694916, "learning_rate": 2e-05, "loss": 0.6911, "step": 750 }, { "epoch": 0.04714640198511166, "grad_norm": 0.4787590801715851, "learning_rate": 2e-05, "loss": 0.6868, "step": 760 }, { "epoch": 0.047766749379652605, "grad_norm": 0.4960077106952667, "learning_rate": 2e-05, "loss": 0.6664, "step": 770 }, { "epoch": 0.04838709677419355, "grad_norm": 0.4341469705104828, "learning_rate": 2e-05, "loss": 0.6501, "step": 780 }, { "epoch": 0.04900744416873449, "grad_norm": 0.4147971272468567, "learning_rate": 2e-05, "loss": 0.6439, "step": 790 }, { "epoch": 0.04962779156327544, "grad_norm": 0.4606212377548218, "learning_rate": 2e-05, "loss": 0.6964, "step": 800 }, { "epoch": 0.05024813895781638, "grad_norm": 0.4221757650375366, "learning_rate": 2e-05, "loss": 0.6598, "step": 810 }, { "epoch": 0.05086848635235732, "grad_norm": 0.46451857686042786, "learning_rate": 2e-05, "loss": 0.6503, "step": 820 }, { "epoch": 0.05148883374689826, "grad_norm": 0.4234520196914673, "learning_rate": 2e-05, "loss": 0.6702, "step": 830 }, { "epoch": 0.052109181141439205, "grad_norm": 0.5181183218955994, "learning_rate": 2e-05, "loss": 0.703, "step": 840 }, { "epoch": 0.05272952853598015, "grad_norm": 0.43921777606010437, "learning_rate": 2e-05, "loss": 0.6777, "step": 850 }, { "epoch": 0.05334987593052109, "grad_norm": 0.4488343894481659, "learning_rate": 2e-05, "loss": 0.6661, "step": 860 }, { "epoch": 0.05397022332506204, "grad_norm": 0.45838460326194763, "learning_rate": 2e-05, "loss": 0.6438, "step": 870 }, { "epoch": 0.05459057071960298, "grad_norm": 0.42543938755989075, "learning_rate": 2e-05, "loss": 0.6781, "step": 880 }, { "epoch": 0.05521091811414392, "grad_norm": 0.44000378251075745, "learning_rate": 2e-05, "loss": 0.656, "step": 890 }, { "epoch": 0.05583126550868486, "grad_norm": 0.4415980279445648, "learning_rate": 2e-05, "loss": 0.66, "step": 900 }, { "epoch": 0.056451612903225805, "grad_norm": 0.4455133378505707, "learning_rate": 2e-05, "loss": 0.6633, "step": 910 }, { "epoch": 0.05707196029776675, "grad_norm": 0.44925546646118164, "learning_rate": 2e-05, "loss": 0.6833, "step": 920 }, { "epoch": 0.057692307692307696, "grad_norm": 0.7831513285636902, "learning_rate": 2e-05, "loss": 0.6649, "step": 930 }, { "epoch": 0.05831265508684864, "grad_norm": 0.5281955003738403, "learning_rate": 2e-05, "loss": 0.66, "step": 940 }, { "epoch": 0.05893300248138958, "grad_norm": 0.43578600883483887, "learning_rate": 2e-05, "loss": 0.6886, "step": 950 }, { "epoch": 0.05955334987593052, "grad_norm": 0.43332430720329285, "learning_rate": 2e-05, "loss": 0.6617, "step": 960 }, { "epoch": 0.06017369727047146, "grad_norm": 0.46484294533729553, "learning_rate": 2e-05, "loss": 0.6435, "step": 970 }, { "epoch": 0.060794044665012405, "grad_norm": 0.41882455348968506, "learning_rate": 2e-05, "loss": 0.6602, "step": 980 }, { "epoch": 0.06141439205955335, "grad_norm": 0.4295177757740021, "learning_rate": 2e-05, "loss": 0.6784, "step": 990 }, { "epoch": 0.062034739454094295, "grad_norm": 0.4727322459220886, "learning_rate": 2e-05, "loss": 0.6818, "step": 1000 }, { "epoch": 0.06265508684863523, "grad_norm": 0.430388480424881, "learning_rate": 2e-05, "loss": 0.6579, "step": 1010 }, { "epoch": 0.06327543424317618, "grad_norm": 0.3914746642112732, "learning_rate": 2e-05, "loss": 0.6793, "step": 1020 }, { "epoch": 0.06389578163771713, "grad_norm": 0.4640097916126251, "learning_rate": 2e-05, "loss": 0.6454, "step": 1030 }, { "epoch": 0.06451612903225806, "grad_norm": 0.43572962284088135, "learning_rate": 2e-05, "loss": 0.6644, "step": 1040 }, { "epoch": 0.06513647642679901, "grad_norm": 0.42249470949172974, "learning_rate": 2e-05, "loss": 0.659, "step": 1050 }, { "epoch": 0.06575682382133995, "grad_norm": 0.45737001299858093, "learning_rate": 2e-05, "loss": 0.6563, "step": 1060 }, { "epoch": 0.0663771712158809, "grad_norm": 0.39258211851119995, "learning_rate": 2e-05, "loss": 0.67, "step": 1070 }, { "epoch": 0.06699751861042183, "grad_norm": 0.4379409849643707, "learning_rate": 2e-05, "loss": 0.6729, "step": 1080 }, { "epoch": 0.06761786600496278, "grad_norm": 0.3982328474521637, "learning_rate": 2e-05, "loss": 0.659, "step": 1090 }, { "epoch": 0.06823821339950373, "grad_norm": 0.42903372645378113, "learning_rate": 2e-05, "loss": 0.6594, "step": 1100 }, { "epoch": 0.06885856079404466, "grad_norm": 0.4348221719264984, "learning_rate": 2e-05, "loss": 0.6313, "step": 1110 }, { "epoch": 0.06947890818858561, "grad_norm": 0.43977659940719604, "learning_rate": 2e-05, "loss": 0.7013, "step": 1120 }, { "epoch": 0.07009925558312655, "grad_norm": 0.41244375705718994, "learning_rate": 2e-05, "loss": 0.6474, "step": 1130 }, { "epoch": 0.0707196029776675, "grad_norm": 0.4200294613838196, "learning_rate": 2e-05, "loss": 0.6853, "step": 1140 }, { "epoch": 0.07133995037220843, "grad_norm": 0.4071672856807709, "learning_rate": 2e-05, "loss": 0.6773, "step": 1150 }, { "epoch": 0.07196029776674938, "grad_norm": 0.4591241776943207, "learning_rate": 2e-05, "loss": 0.6901, "step": 1160 }, { "epoch": 0.07258064516129033, "grad_norm": 0.4510512948036194, "learning_rate": 2e-05, "loss": 0.6751, "step": 1170 }, { "epoch": 0.07320099255583126, "grad_norm": 0.4550836980342865, "learning_rate": 2e-05, "loss": 0.6745, "step": 1180 }, { "epoch": 0.07382133995037221, "grad_norm": 0.42455634474754333, "learning_rate": 2e-05, "loss": 0.6852, "step": 1190 }, { "epoch": 0.07444168734491315, "grad_norm": 0.4288151264190674, "learning_rate": 2e-05, "loss": 0.6362, "step": 1200 }, { "epoch": 0.0750620347394541, "grad_norm": 0.41488656401634216, "learning_rate": 2e-05, "loss": 0.6555, "step": 1210 }, { "epoch": 0.07568238213399504, "grad_norm": 0.41888904571533203, "learning_rate": 2e-05, "loss": 0.6405, "step": 1220 }, { "epoch": 0.07630272952853598, "grad_norm": 0.42407098412513733, "learning_rate": 2e-05, "loss": 0.6869, "step": 1230 }, { "epoch": 0.07692307692307693, "grad_norm": 0.43882668018341064, "learning_rate": 2e-05, "loss": 0.6697, "step": 1240 }, { "epoch": 0.07754342431761786, "grad_norm": 0.463724285364151, "learning_rate": 2e-05, "loss": 0.6606, "step": 1250 }, { "epoch": 0.07816377171215881, "grad_norm": 0.4122724235057831, "learning_rate": 2e-05, "loss": 0.683, "step": 1260 }, { "epoch": 0.07878411910669975, "grad_norm": 0.4170853793621063, "learning_rate": 2e-05, "loss": 0.6469, "step": 1270 }, { "epoch": 0.0794044665012407, "grad_norm": 0.41887524724006653, "learning_rate": 2e-05, "loss": 0.6613, "step": 1280 }, { "epoch": 0.08002481389578164, "grad_norm": 0.5110520720481873, "learning_rate": 2e-05, "loss": 0.6481, "step": 1290 }, { "epoch": 0.08064516129032258, "grad_norm": 0.5727337002754211, "learning_rate": 2e-05, "loss": 0.6602, "step": 1300 }, { "epoch": 0.08126550868486353, "grad_norm": 0.45020315051078796, "learning_rate": 2e-05, "loss": 0.6905, "step": 1310 }, { "epoch": 0.08188585607940446, "grad_norm": 0.41866007447242737, "learning_rate": 2e-05, "loss": 0.6458, "step": 1320 }, { "epoch": 0.08250620347394541, "grad_norm": 0.4124995768070221, "learning_rate": 2e-05, "loss": 0.6476, "step": 1330 }, { "epoch": 0.08312655086848635, "grad_norm": 0.45238474011421204, "learning_rate": 2e-05, "loss": 0.6722, "step": 1340 }, { "epoch": 0.0837468982630273, "grad_norm": 0.44636914134025574, "learning_rate": 2e-05, "loss": 0.6828, "step": 1350 }, { "epoch": 0.08436724565756824, "grad_norm": 0.42632195353507996, "learning_rate": 2e-05, "loss": 0.6974, "step": 1360 }, { "epoch": 0.08498759305210918, "grad_norm": 0.4126355051994324, "learning_rate": 2e-05, "loss": 0.6542, "step": 1370 }, { "epoch": 0.08560794044665013, "grad_norm": 0.4650143086910248, "learning_rate": 2e-05, "loss": 0.6402, "step": 1380 }, { "epoch": 0.08622828784119106, "grad_norm": 0.4254385530948639, "learning_rate": 2e-05, "loss": 0.6196, "step": 1390 }, { "epoch": 0.08684863523573201, "grad_norm": 0.5174993872642517, "learning_rate": 2e-05, "loss": 0.6566, "step": 1400 }, { "epoch": 0.08746898263027296, "grad_norm": 0.4466327428817749, "learning_rate": 2e-05, "loss": 0.6777, "step": 1410 }, { "epoch": 0.0880893300248139, "grad_norm": 0.4639355540275574, "learning_rate": 2e-05, "loss": 0.6518, "step": 1420 }, { "epoch": 0.08870967741935484, "grad_norm": 0.49918368458747864, "learning_rate": 2e-05, "loss": 0.666, "step": 1430 }, { "epoch": 0.08933002481389578, "grad_norm": 0.45220839977264404, "learning_rate": 2e-05, "loss": 0.6626, "step": 1440 }, { "epoch": 0.08995037220843673, "grad_norm": 0.40696123242378235, "learning_rate": 2e-05, "loss": 0.6591, "step": 1450 }, { "epoch": 0.09057071960297766, "grad_norm": 0.42498070001602173, "learning_rate": 2e-05, "loss": 0.6532, "step": 1460 }, { "epoch": 0.09119106699751861, "grad_norm": 0.4117129147052765, "learning_rate": 2e-05, "loss": 0.6272, "step": 1470 }, { "epoch": 0.09181141439205956, "grad_norm": 0.4506339132785797, "learning_rate": 2e-05, "loss": 0.6609, "step": 1480 }, { "epoch": 0.0924317617866005, "grad_norm": 0.40215933322906494, "learning_rate": 2e-05, "loss": 0.6653, "step": 1490 }, { "epoch": 0.09305210918114144, "grad_norm": 0.4949316382408142, "learning_rate": 2e-05, "loss": 0.6583, "step": 1500 }, { "epoch": 0.09367245657568238, "grad_norm": 0.45883846282958984, "learning_rate": 2e-05, "loss": 0.6553, "step": 1510 }, { "epoch": 0.09429280397022333, "grad_norm": 0.41736656427383423, "learning_rate": 2e-05, "loss": 0.6727, "step": 1520 }, { "epoch": 0.09491315136476426, "grad_norm": 0.45958396792411804, "learning_rate": 2e-05, "loss": 0.6402, "step": 1530 }, { "epoch": 0.09553349875930521, "grad_norm": 0.41696447134017944, "learning_rate": 2e-05, "loss": 0.669, "step": 1540 }, { "epoch": 0.09615384615384616, "grad_norm": 0.45699238777160645, "learning_rate": 2e-05, "loss": 0.6421, "step": 1550 }, { "epoch": 0.0967741935483871, "grad_norm": 0.46844539046287537, "learning_rate": 2e-05, "loss": 0.6628, "step": 1560 }, { "epoch": 0.09739454094292804, "grad_norm": 0.4296782612800598, "learning_rate": 2e-05, "loss": 0.6468, "step": 1570 }, { "epoch": 0.09801488833746898, "grad_norm": 0.43794864416122437, "learning_rate": 2e-05, "loss": 0.6708, "step": 1580 }, { "epoch": 0.09863523573200993, "grad_norm": 0.4485463500022888, "learning_rate": 2e-05, "loss": 0.6537, "step": 1590 }, { "epoch": 0.09925558312655088, "grad_norm": 0.44051381945610046, "learning_rate": 2e-05, "loss": 0.6378, "step": 1600 }, { "epoch": 0.09987593052109181, "grad_norm": 0.44119101762771606, "learning_rate": 2e-05, "loss": 0.6503, "step": 1610 }, { "epoch": 0.10049627791563276, "grad_norm": 0.4515126049518585, "learning_rate": 2e-05, "loss": 0.6647, "step": 1620 }, { "epoch": 0.1011166253101737, "grad_norm": 0.4214085042476654, "learning_rate": 2e-05, "loss": 0.6483, "step": 1630 }, { "epoch": 0.10173697270471464, "grad_norm": 0.4193068742752075, "learning_rate": 2e-05, "loss": 0.6685, "step": 1640 }, { "epoch": 0.10235732009925558, "grad_norm": 0.4890860319137573, "learning_rate": 2e-05, "loss": 0.6529, "step": 1650 }, { "epoch": 0.10297766749379653, "grad_norm": 0.5013541579246521, "learning_rate": 2e-05, "loss": 0.7078, "step": 1660 }, { "epoch": 0.10359801488833748, "grad_norm": 0.4772087335586548, "learning_rate": 2e-05, "loss": 0.6574, "step": 1670 }, { "epoch": 0.10421836228287841, "grad_norm": 0.5918506979942322, "learning_rate": 2e-05, "loss": 0.6668, "step": 1680 }, { "epoch": 0.10483870967741936, "grad_norm": 0.42867156863212585, "learning_rate": 2e-05, "loss": 0.6556, "step": 1690 }, { "epoch": 0.1054590570719603, "grad_norm": 0.4230250418186188, "learning_rate": 2e-05, "loss": 0.6564, "step": 1700 }, { "epoch": 0.10607940446650124, "grad_norm": 0.4046623110771179, "learning_rate": 2e-05, "loss": 0.6691, "step": 1710 }, { "epoch": 0.10669975186104218, "grad_norm": 0.4210417568683624, "learning_rate": 2e-05, "loss": 0.6675, "step": 1720 }, { "epoch": 0.10732009925558313, "grad_norm": 0.4010581970214844, "learning_rate": 2e-05, "loss": 0.6402, "step": 1730 }, { "epoch": 0.10794044665012408, "grad_norm": 0.4336850643157959, "learning_rate": 2e-05, "loss": 0.6568, "step": 1740 }, { "epoch": 0.10856079404466501, "grad_norm": 0.43575379252433777, "learning_rate": 2e-05, "loss": 0.6493, "step": 1750 }, { "epoch": 0.10918114143920596, "grad_norm": 0.42740049958229065, "learning_rate": 2e-05, "loss": 0.6571, "step": 1760 }, { "epoch": 0.1098014888337469, "grad_norm": 0.4169295132160187, "learning_rate": 2e-05, "loss": 0.6611, "step": 1770 }, { "epoch": 0.11042183622828784, "grad_norm": 0.5564378499984741, "learning_rate": 2e-05, "loss": 0.6532, "step": 1780 }, { "epoch": 0.11104218362282878, "grad_norm": 0.45990580320358276, "learning_rate": 2e-05, "loss": 0.6262, "step": 1790 }, { "epoch": 0.11166253101736973, "grad_norm": 0.4232894778251648, "learning_rate": 2e-05, "loss": 0.6729, "step": 1800 }, { "epoch": 0.11228287841191067, "grad_norm": 0.49535107612609863, "learning_rate": 2e-05, "loss": 0.6808, "step": 1810 }, { "epoch": 0.11290322580645161, "grad_norm": 0.4231373965740204, "learning_rate": 2e-05, "loss": 0.6731, "step": 1820 }, { "epoch": 0.11352357320099256, "grad_norm": 0.42381367087364197, "learning_rate": 2e-05, "loss": 0.6672, "step": 1830 }, { "epoch": 0.1141439205955335, "grad_norm": 0.40873488783836365, "learning_rate": 2e-05, "loss": 0.6471, "step": 1840 }, { "epoch": 0.11476426799007444, "grad_norm": 0.4330880641937256, "learning_rate": 2e-05, "loss": 0.6653, "step": 1850 }, { "epoch": 0.11538461538461539, "grad_norm": 0.47087201476097107, "learning_rate": 2e-05, "loss": 0.6865, "step": 1860 }, { "epoch": 0.11600496277915633, "grad_norm": 0.49161598086357117, "learning_rate": 2e-05, "loss": 0.6625, "step": 1870 }, { "epoch": 0.11662531017369727, "grad_norm": 0.40995311737060547, "learning_rate": 2e-05, "loss": 0.6421, "step": 1880 }, { "epoch": 0.11724565756823821, "grad_norm": 0.40415555238723755, "learning_rate": 2e-05, "loss": 0.6407, "step": 1890 }, { "epoch": 0.11786600496277916, "grad_norm": 0.42309048771858215, "learning_rate": 2e-05, "loss": 0.6524, "step": 1900 }, { "epoch": 0.1184863523573201, "grad_norm": 0.428654283285141, "learning_rate": 2e-05, "loss": 0.6473, "step": 1910 }, { "epoch": 0.11910669975186104, "grad_norm": 0.46681228280067444, "learning_rate": 2e-05, "loss": 0.665, "step": 1920 }, { "epoch": 0.11972704714640199, "grad_norm": 0.5378752946853638, "learning_rate": 2e-05, "loss": 0.6888, "step": 1930 }, { "epoch": 0.12034739454094293, "grad_norm": 0.3942810297012329, "learning_rate": 2e-05, "loss": 0.6693, "step": 1940 }, { "epoch": 0.12096774193548387, "grad_norm": 0.40872716903686523, "learning_rate": 2e-05, "loss": 0.6564, "step": 1950 }, { "epoch": 0.12158808933002481, "grad_norm": 0.4505879580974579, "learning_rate": 2e-05, "loss": 0.6651, "step": 1960 }, { "epoch": 0.12220843672456576, "grad_norm": 0.46347737312316895, "learning_rate": 2e-05, "loss": 0.6682, "step": 1970 }, { "epoch": 0.1228287841191067, "grad_norm": 0.4220800995826721, "learning_rate": 2e-05, "loss": 0.6633, "step": 1980 }, { "epoch": 0.12344913151364764, "grad_norm": 0.39984744787216187, "learning_rate": 2e-05, "loss": 0.6379, "step": 1990 }, { "epoch": 0.12406947890818859, "grad_norm": 0.42455461621284485, "learning_rate": 2e-05, "loss": 0.6442, "step": 2000 }, { "epoch": 0.12468982630272953, "grad_norm": 0.4262460768222809, "learning_rate": 2e-05, "loss": 0.6385, "step": 2010 }, { "epoch": 0.12531017369727046, "grad_norm": 0.42343422770500183, "learning_rate": 2e-05, "loss": 0.6541, "step": 2020 }, { "epoch": 0.1259305210918114, "grad_norm": 0.4029340147972107, "learning_rate": 2e-05, "loss": 0.6776, "step": 2030 }, { "epoch": 0.12655086848635236, "grad_norm": 0.44888031482696533, "learning_rate": 2e-05, "loss": 0.6232, "step": 2040 }, { "epoch": 0.1271712158808933, "grad_norm": 0.4395098388195038, "learning_rate": 2e-05, "loss": 0.6447, "step": 2050 }, { "epoch": 0.12779156327543426, "grad_norm": 0.40587204694747925, "learning_rate": 2e-05, "loss": 0.6616, "step": 2060 }, { "epoch": 0.12841191066997518, "grad_norm": 0.4486628472805023, "learning_rate": 2e-05, "loss": 0.6639, "step": 2070 }, { "epoch": 0.12903225806451613, "grad_norm": 0.4576110243797302, "learning_rate": 2e-05, "loss": 0.6597, "step": 2080 }, { "epoch": 0.12965260545905707, "grad_norm": 0.4019532799720764, "learning_rate": 2e-05, "loss": 0.6469, "step": 2090 }, { "epoch": 0.13027295285359802, "grad_norm": 0.43723776936531067, "learning_rate": 2e-05, "loss": 0.6332, "step": 2100 }, { "epoch": 0.13089330024813894, "grad_norm": 0.40787678956985474, "learning_rate": 2e-05, "loss": 0.6356, "step": 2110 }, { "epoch": 0.1315136476426799, "grad_norm": 0.4124930799007416, "learning_rate": 2e-05, "loss": 0.6523, "step": 2120 }, { "epoch": 0.13213399503722084, "grad_norm": 0.4150378108024597, "learning_rate": 2e-05, "loss": 0.6694, "step": 2130 }, { "epoch": 0.1327543424317618, "grad_norm": 0.41935351490974426, "learning_rate": 2e-05, "loss": 0.6745, "step": 2140 }, { "epoch": 0.13337468982630274, "grad_norm": 0.6122373938560486, "learning_rate": 2e-05, "loss": 0.6566, "step": 2150 }, { "epoch": 0.13399503722084366, "grad_norm": 0.518964409828186, "learning_rate": 2e-05, "loss": 0.6281, "step": 2160 }, { "epoch": 0.1346153846153846, "grad_norm": 0.45327648520469666, "learning_rate": 2e-05, "loss": 0.6431, "step": 2170 }, { "epoch": 0.13523573200992556, "grad_norm": 0.41766470670700073, "learning_rate": 2e-05, "loss": 0.6707, "step": 2180 }, { "epoch": 0.1358560794044665, "grad_norm": 0.43843910098075867, "learning_rate": 2e-05, "loss": 0.6698, "step": 2190 }, { "epoch": 0.13647642679900746, "grad_norm": 0.5084978342056274, "learning_rate": 2e-05, "loss": 0.6347, "step": 2200 }, { "epoch": 0.13709677419354838, "grad_norm": 0.4238511919975281, "learning_rate": 2e-05, "loss": 0.6459, "step": 2210 }, { "epoch": 0.13771712158808933, "grad_norm": 0.4075576961040497, "learning_rate": 2e-05, "loss": 0.6248, "step": 2220 }, { "epoch": 0.13833746898263027, "grad_norm": 0.4354841411113739, "learning_rate": 2e-05, "loss": 0.6718, "step": 2230 }, { "epoch": 0.13895781637717122, "grad_norm": 0.5108729004859924, "learning_rate": 2e-05, "loss": 0.6477, "step": 2240 }, { "epoch": 0.13957816377171217, "grad_norm": 0.4199222922325134, "learning_rate": 2e-05, "loss": 0.6543, "step": 2250 }, { "epoch": 0.1401985111662531, "grad_norm": 0.4035865068435669, "learning_rate": 2e-05, "loss": 0.6269, "step": 2260 }, { "epoch": 0.14081885856079404, "grad_norm": 0.4430849254131317, "learning_rate": 2e-05, "loss": 0.626, "step": 2270 }, { "epoch": 0.141439205955335, "grad_norm": 0.4501071274280548, "learning_rate": 2e-05, "loss": 0.6373, "step": 2280 }, { "epoch": 0.14205955334987594, "grad_norm": 0.47260135412216187, "learning_rate": 2e-05, "loss": 0.6503, "step": 2290 }, { "epoch": 0.14267990074441686, "grad_norm": 0.3968529999256134, "learning_rate": 2e-05, "loss": 0.6401, "step": 2300 }, { "epoch": 0.1433002481389578, "grad_norm": 0.41558271646499634, "learning_rate": 2e-05, "loss": 0.6624, "step": 2310 }, { "epoch": 0.14392059553349876, "grad_norm": 0.46250858902931213, "learning_rate": 2e-05, "loss": 0.6678, "step": 2320 }, { "epoch": 0.1445409429280397, "grad_norm": 0.40959519147872925, "learning_rate": 2e-05, "loss": 0.6381, "step": 2330 }, { "epoch": 0.14516129032258066, "grad_norm": 0.431772917509079, "learning_rate": 2e-05, "loss": 0.6485, "step": 2340 }, { "epoch": 0.14578163771712158, "grad_norm": 0.42857933044433594, "learning_rate": 2e-05, "loss": 0.6469, "step": 2350 }, { "epoch": 0.14640198511166252, "grad_norm": 0.4006024897098541, "learning_rate": 2e-05, "loss": 0.6752, "step": 2360 }, { "epoch": 0.14702233250620347, "grad_norm": 0.4340827763080597, "learning_rate": 2e-05, "loss": 0.6407, "step": 2370 }, { "epoch": 0.14764267990074442, "grad_norm": 0.43578338623046875, "learning_rate": 2e-05, "loss": 0.6463, "step": 2380 }, { "epoch": 0.14826302729528537, "grad_norm": 0.4057551920413971, "learning_rate": 2e-05, "loss": 0.6295, "step": 2390 }, { "epoch": 0.1488833746898263, "grad_norm": 0.405994713306427, "learning_rate": 2e-05, "loss": 0.6639, "step": 2400 }, { "epoch": 0.14950372208436724, "grad_norm": 0.4021854102611542, "learning_rate": 2e-05, "loss": 0.6542, "step": 2410 }, { "epoch": 0.1501240694789082, "grad_norm": 0.4120284914970398, "learning_rate": 2e-05, "loss": 0.6456, "step": 2420 }, { "epoch": 0.15074441687344914, "grad_norm": 0.4367629289627075, "learning_rate": 2e-05, "loss": 0.6334, "step": 2430 }, { "epoch": 0.1513647642679901, "grad_norm": 0.39025968313217163, "learning_rate": 2e-05, "loss": 0.634, "step": 2440 }, { "epoch": 0.151985111662531, "grad_norm": 0.44010090827941895, "learning_rate": 2e-05, "loss": 0.6346, "step": 2450 }, { "epoch": 0.15260545905707196, "grad_norm": 0.4358943998813629, "learning_rate": 2e-05, "loss": 0.6556, "step": 2460 }, { "epoch": 0.1532258064516129, "grad_norm": 0.40464046597480774, "learning_rate": 2e-05, "loss": 0.6405, "step": 2470 }, { "epoch": 0.15384615384615385, "grad_norm": 0.43297019600868225, "learning_rate": 2e-05, "loss": 0.6618, "step": 2480 }, { "epoch": 0.15446650124069478, "grad_norm": 0.37946197390556335, "learning_rate": 2e-05, "loss": 0.6338, "step": 2490 }, { "epoch": 0.15508684863523572, "grad_norm": 0.44986578822135925, "learning_rate": 2e-05, "loss": 0.6654, "step": 2500 }, { "epoch": 0.15570719602977667, "grad_norm": 0.40377217531204224, "learning_rate": 2e-05, "loss": 0.6261, "step": 2510 }, { "epoch": 0.15632754342431762, "grad_norm": 0.4069921374320984, "learning_rate": 2e-05, "loss": 0.6543, "step": 2520 }, { "epoch": 0.15694789081885857, "grad_norm": 0.3909223675727844, "learning_rate": 2e-05, "loss": 0.6449, "step": 2530 }, { "epoch": 0.1575682382133995, "grad_norm": 0.37389710545539856, "learning_rate": 2e-05, "loss": 0.6352, "step": 2540 }, { "epoch": 0.15818858560794044, "grad_norm": 0.4050366282463074, "learning_rate": 2e-05, "loss": 0.6554, "step": 2550 }, { "epoch": 0.1588089330024814, "grad_norm": 0.41864311695098877, "learning_rate": 2e-05, "loss": 0.6403, "step": 2560 }, { "epoch": 0.15942928039702234, "grad_norm": 0.404889315366745, "learning_rate": 2e-05, "loss": 0.6523, "step": 2570 }, { "epoch": 0.1600496277915633, "grad_norm": 0.480149507522583, "learning_rate": 2e-05, "loss": 0.6254, "step": 2580 }, { "epoch": 0.1606699751861042, "grad_norm": 0.41777101159095764, "learning_rate": 2e-05, "loss": 0.6392, "step": 2590 }, { "epoch": 0.16129032258064516, "grad_norm": 0.41992273926734924, "learning_rate": 2e-05, "loss": 0.6283, "step": 2600 }, { "epoch": 0.1619106699751861, "grad_norm": 0.3978483974933624, "learning_rate": 2e-05, "loss": 0.6415, "step": 2610 }, { "epoch": 0.16253101736972705, "grad_norm": 0.4051460027694702, "learning_rate": 2e-05, "loss": 0.6325, "step": 2620 }, { "epoch": 0.163151364764268, "grad_norm": 0.38797181844711304, "learning_rate": 2e-05, "loss": 0.6538, "step": 2630 }, { "epoch": 0.16377171215880892, "grad_norm": 0.4264223575592041, "learning_rate": 2e-05, "loss": 0.6079, "step": 2640 }, { "epoch": 0.16439205955334987, "grad_norm": 0.6309807300567627, "learning_rate": 2e-05, "loss": 0.6443, "step": 2650 }, { "epoch": 0.16501240694789082, "grad_norm": 0.4043954610824585, "learning_rate": 2e-05, "loss": 0.6587, "step": 2660 }, { "epoch": 0.16563275434243177, "grad_norm": 0.433071106672287, "learning_rate": 2e-05, "loss": 0.6458, "step": 2670 }, { "epoch": 0.1662531017369727, "grad_norm": 0.43372464179992676, "learning_rate": 2e-05, "loss": 0.6228, "step": 2680 }, { "epoch": 0.16687344913151364, "grad_norm": 0.4626196324825287, "learning_rate": 2e-05, "loss": 0.6406, "step": 2690 }, { "epoch": 0.1674937965260546, "grad_norm": 0.379689484834671, "learning_rate": 2e-05, "loss": 0.6368, "step": 2700 }, { "epoch": 0.16811414392059554, "grad_norm": 0.43384963274002075, "learning_rate": 2e-05, "loss": 0.6421, "step": 2710 }, { "epoch": 0.1687344913151365, "grad_norm": 0.5025782585144043, "learning_rate": 2e-05, "loss": 0.6644, "step": 2720 }, { "epoch": 0.1693548387096774, "grad_norm": 0.398337185382843, "learning_rate": 2e-05, "loss": 0.6242, "step": 2730 }, { "epoch": 0.16997518610421836, "grad_norm": 0.4152053892612457, "learning_rate": 2e-05, "loss": 0.674, "step": 2740 }, { "epoch": 0.1705955334987593, "grad_norm": 0.40534213185310364, "learning_rate": 2e-05, "loss": 0.6372, "step": 2750 }, { "epoch": 0.17121588089330025, "grad_norm": 0.44497600197792053, "learning_rate": 2e-05, "loss": 0.6453, "step": 2760 }, { "epoch": 0.1718362282878412, "grad_norm": 0.4441177546977997, "learning_rate": 2e-05, "loss": 0.6467, "step": 2770 }, { "epoch": 0.17245657568238212, "grad_norm": 0.39838549494743347, "learning_rate": 2e-05, "loss": 0.6359, "step": 2780 }, { "epoch": 0.17307692307692307, "grad_norm": 0.6976585984230042, "learning_rate": 2e-05, "loss": 0.6335, "step": 2790 }, { "epoch": 0.17369727047146402, "grad_norm": 0.48044341802597046, "learning_rate": 2e-05, "loss": 0.6604, "step": 2800 }, { "epoch": 0.17431761786600497, "grad_norm": 0.3987114131450653, "learning_rate": 2e-05, "loss": 0.6348, "step": 2810 }, { "epoch": 0.17493796526054592, "grad_norm": 0.37417376041412354, "learning_rate": 2e-05, "loss": 0.6302, "step": 2820 }, { "epoch": 0.17555831265508684, "grad_norm": 0.4066050946712494, "learning_rate": 2e-05, "loss": 0.6319, "step": 2830 }, { "epoch": 0.1761786600496278, "grad_norm": 0.45394909381866455, "learning_rate": 2e-05, "loss": 0.6278, "step": 2840 }, { "epoch": 0.17679900744416874, "grad_norm": 0.414578378200531, "learning_rate": 2e-05, "loss": 0.6317, "step": 2850 }, { "epoch": 0.1774193548387097, "grad_norm": 0.4722119867801666, "learning_rate": 2e-05, "loss": 0.622, "step": 2860 }, { "epoch": 0.1780397022332506, "grad_norm": 0.42602238059043884, "learning_rate": 2e-05, "loss": 0.6631, "step": 2870 }, { "epoch": 0.17866004962779156, "grad_norm": 0.43522897362709045, "learning_rate": 2e-05, "loss": 0.6288, "step": 2880 }, { "epoch": 0.1792803970223325, "grad_norm": 0.4144858121871948, "learning_rate": 2e-05, "loss": 0.6401, "step": 2890 }, { "epoch": 0.17990074441687345, "grad_norm": 0.4240042567253113, "learning_rate": 2e-05, "loss": 0.6183, "step": 2900 }, { "epoch": 0.1805210918114144, "grad_norm": 0.4313690662384033, "learning_rate": 2e-05, "loss": 0.6233, "step": 2910 }, { "epoch": 0.18114143920595532, "grad_norm": 0.40647462010383606, "learning_rate": 2e-05, "loss": 0.6423, "step": 2920 }, { "epoch": 0.18176178660049627, "grad_norm": 0.40608322620391846, "learning_rate": 2e-05, "loss": 0.6345, "step": 2930 }, { "epoch": 0.18238213399503722, "grad_norm": 0.5110368132591248, "learning_rate": 2e-05, "loss": 0.6505, "step": 2940 }, { "epoch": 0.18300248138957817, "grad_norm": 1.3996773958206177, "learning_rate": 2e-05, "loss": 0.6334, "step": 2950 }, { "epoch": 0.18362282878411912, "grad_norm": 0.4118184745311737, "learning_rate": 2e-05, "loss": 0.6325, "step": 2960 }, { "epoch": 0.18424317617866004, "grad_norm": 0.4443102777004242, "learning_rate": 2e-05, "loss": 0.6667, "step": 2970 }, { "epoch": 0.184863523573201, "grad_norm": 0.39859694242477417, "learning_rate": 2e-05, "loss": 0.6389, "step": 2980 }, { "epoch": 0.18548387096774194, "grad_norm": 0.42832204699516296, "learning_rate": 2e-05, "loss": 0.6789, "step": 2990 }, { "epoch": 0.18610421836228289, "grad_norm": 0.43463531136512756, "learning_rate": 2e-05, "loss": 0.6296, "step": 3000 }, { "epoch": 0.18672456575682383, "grad_norm": 0.441102534532547, "learning_rate": 2e-05, "loss": 0.6127, "step": 3010 }, { "epoch": 0.18734491315136476, "grad_norm": 0.419390469789505, "learning_rate": 2e-05, "loss": 0.6483, "step": 3020 }, { "epoch": 0.1879652605459057, "grad_norm": 0.41196301579475403, "learning_rate": 2e-05, "loss": 0.6404, "step": 3030 }, { "epoch": 0.18858560794044665, "grad_norm": 0.3819664418697357, "learning_rate": 2e-05, "loss": 0.6516, "step": 3040 }, { "epoch": 0.1892059553349876, "grad_norm": 0.40153929591178894, "learning_rate": 2e-05, "loss": 0.6237, "step": 3050 }, { "epoch": 0.18982630272952852, "grad_norm": 0.4139013886451721, "learning_rate": 2e-05, "loss": 0.6392, "step": 3060 }, { "epoch": 0.19044665012406947, "grad_norm": 0.40049391984939575, "learning_rate": 2e-05, "loss": 0.6432, "step": 3070 }, { "epoch": 0.19106699751861042, "grad_norm": 0.4137687385082245, "learning_rate": 2e-05, "loss": 0.6211, "step": 3080 }, { "epoch": 0.19168734491315137, "grad_norm": 0.43249863386154175, "learning_rate": 2e-05, "loss": 0.6478, "step": 3090 }, { "epoch": 0.19230769230769232, "grad_norm": 0.4651578664779663, "learning_rate": 2e-05, "loss": 0.643, "step": 3100 }, { "epoch": 0.19292803970223324, "grad_norm": 0.44925519824028015, "learning_rate": 2e-05, "loss": 0.6378, "step": 3110 }, { "epoch": 0.1935483870967742, "grad_norm": 0.38708093762397766, "learning_rate": 2e-05, "loss": 0.6335, "step": 3120 }, { "epoch": 0.19416873449131514, "grad_norm": 0.42161768674850464, "learning_rate": 2e-05, "loss": 0.6569, "step": 3130 }, { "epoch": 0.19478908188585609, "grad_norm": 0.6364923119544983, "learning_rate": 2e-05, "loss": 0.617, "step": 3140 }, { "epoch": 0.19540942928039703, "grad_norm": 0.43241891264915466, "learning_rate": 2e-05, "loss": 0.6428, "step": 3150 }, { "epoch": 0.19602977667493796, "grad_norm": 0.41662028431892395, "learning_rate": 2e-05, "loss": 0.6495, "step": 3160 }, { "epoch": 0.1966501240694789, "grad_norm": 0.4269491732120514, "learning_rate": 2e-05, "loss": 0.6473, "step": 3170 }, { "epoch": 0.19727047146401985, "grad_norm": 0.412458211183548, "learning_rate": 2e-05, "loss": 0.6477, "step": 3180 }, { "epoch": 0.1978908188585608, "grad_norm": 0.43503549695014954, "learning_rate": 2e-05, "loss": 0.6629, "step": 3190 }, { "epoch": 0.19851116625310175, "grad_norm": 0.41298508644104004, "learning_rate": 2e-05, "loss": 0.6117, "step": 3200 }, { "epoch": 0.19913151364764267, "grad_norm": 0.3883150815963745, "learning_rate": 2e-05, "loss": 0.628, "step": 3210 }, { "epoch": 0.19975186104218362, "grad_norm": 0.4110269248485565, "learning_rate": 2e-05, "loss": 0.6373, "step": 3220 }, { "epoch": 0.20037220843672457, "grad_norm": 0.4852235019207001, "learning_rate": 2e-05, "loss": 0.6269, "step": 3230 }, { "epoch": 0.20099255583126552, "grad_norm": 0.3968954384326935, "learning_rate": 2e-05, "loss": 0.6461, "step": 3240 }, { "epoch": 0.20161290322580644, "grad_norm": 0.45685458183288574, "learning_rate": 2e-05, "loss": 0.648, "step": 3250 }, { "epoch": 0.2022332506203474, "grad_norm": 0.40747106075286865, "learning_rate": 2e-05, "loss": 0.6546, "step": 3260 }, { "epoch": 0.20285359801488834, "grad_norm": 0.3848201632499695, "learning_rate": 2e-05, "loss": 0.6281, "step": 3270 }, { "epoch": 0.20347394540942929, "grad_norm": 0.38959604501724243, "learning_rate": 2e-05, "loss": 0.6208, "step": 3280 }, { "epoch": 0.20409429280397023, "grad_norm": 0.4149569571018219, "learning_rate": 2e-05, "loss": 0.6293, "step": 3290 }, { "epoch": 0.20471464019851116, "grad_norm": 0.46731993556022644, "learning_rate": 2e-05, "loss": 0.6641, "step": 3300 }, { "epoch": 0.2053349875930521, "grad_norm": 0.4299260675907135, "learning_rate": 2e-05, "loss": 0.6057, "step": 3310 }, { "epoch": 0.20595533498759305, "grad_norm": 0.4170496463775635, "learning_rate": 2e-05, "loss": 0.6457, "step": 3320 }, { "epoch": 0.206575682382134, "grad_norm": 0.43017125129699707, "learning_rate": 2e-05, "loss": 0.6224, "step": 3330 }, { "epoch": 0.20719602977667495, "grad_norm": 0.39833810925483704, "learning_rate": 2e-05, "loss": 0.6397, "step": 3340 }, { "epoch": 0.20781637717121587, "grad_norm": 0.4055391848087311, "learning_rate": 2e-05, "loss": 0.6209, "step": 3350 }, { "epoch": 0.20843672456575682, "grad_norm": 0.4533246159553528, "learning_rate": 2e-05, "loss": 0.6224, "step": 3360 }, { "epoch": 0.20905707196029777, "grad_norm": 0.3952649235725403, "learning_rate": 2e-05, "loss": 0.6493, "step": 3370 }, { "epoch": 0.20967741935483872, "grad_norm": 0.4192732870578766, "learning_rate": 2e-05, "loss": 0.6293, "step": 3380 }, { "epoch": 0.21029776674937964, "grad_norm": 0.40987828373908997, "learning_rate": 2e-05, "loss": 0.6222, "step": 3390 }, { "epoch": 0.2109181141439206, "grad_norm": 0.41994917392730713, "learning_rate": 2e-05, "loss": 0.6556, "step": 3400 }, { "epoch": 0.21153846153846154, "grad_norm": 0.42132651805877686, "learning_rate": 2e-05, "loss": 0.6443, "step": 3410 }, { "epoch": 0.21215880893300249, "grad_norm": 0.4320928156375885, "learning_rate": 2e-05, "loss": 0.6461, "step": 3420 }, { "epoch": 0.21277915632754343, "grad_norm": 0.435435950756073, "learning_rate": 2e-05, "loss": 0.6255, "step": 3430 }, { "epoch": 0.21339950372208435, "grad_norm": 0.41047704219818115, "learning_rate": 2e-05, "loss": 0.6422, "step": 3440 }, { "epoch": 0.2140198511166253, "grad_norm": 0.3944700062274933, "learning_rate": 2e-05, "loss": 0.621, "step": 3450 }, { "epoch": 0.21464019851116625, "grad_norm": 0.42940741777420044, "learning_rate": 2e-05, "loss": 0.6196, "step": 3460 }, { "epoch": 0.2152605459057072, "grad_norm": 0.3980760872364044, "learning_rate": 2e-05, "loss": 0.6412, "step": 3470 }, { "epoch": 0.21588089330024815, "grad_norm": 0.39118990302085876, "learning_rate": 2e-05, "loss": 0.6249, "step": 3480 }, { "epoch": 0.21650124069478907, "grad_norm": 0.44674456119537354, "learning_rate": 2e-05, "loss": 0.6394, "step": 3490 }, { "epoch": 0.21712158808933002, "grad_norm": 0.42848122119903564, "learning_rate": 2e-05, "loss": 0.6354, "step": 3500 }, { "epoch": 0.21774193548387097, "grad_norm": 0.44583410024642944, "learning_rate": 2e-05, "loss": 0.6453, "step": 3510 }, { "epoch": 0.21836228287841192, "grad_norm": 0.44389545917510986, "learning_rate": 2e-05, "loss": 0.6652, "step": 3520 }, { "epoch": 0.21898263027295287, "grad_norm": 0.38134288787841797, "learning_rate": 2e-05, "loss": 0.6203, "step": 3530 }, { "epoch": 0.2196029776674938, "grad_norm": 0.4165913462638855, "learning_rate": 2e-05, "loss": 0.643, "step": 3540 }, { "epoch": 0.22022332506203474, "grad_norm": 0.4155155420303345, "learning_rate": 2e-05, "loss": 0.6491, "step": 3550 }, { "epoch": 0.22084367245657568, "grad_norm": 0.390639066696167, "learning_rate": 2e-05, "loss": 0.6182, "step": 3560 }, { "epoch": 0.22146401985111663, "grad_norm": 0.43849295377731323, "learning_rate": 2e-05, "loss": 0.6379, "step": 3570 }, { "epoch": 0.22208436724565755, "grad_norm": 0.3993423283100128, "learning_rate": 2e-05, "loss": 0.6588, "step": 3580 }, { "epoch": 0.2227047146401985, "grad_norm": 0.4390069246292114, "learning_rate": 2e-05, "loss": 0.6071, "step": 3590 }, { "epoch": 0.22332506203473945, "grad_norm": 0.37074384093284607, "learning_rate": 2e-05, "loss": 0.6336, "step": 3600 }, { "epoch": 0.2239454094292804, "grad_norm": 0.4541170597076416, "learning_rate": 2e-05, "loss": 0.65, "step": 3610 }, { "epoch": 0.22456575682382135, "grad_norm": 0.41161370277404785, "learning_rate": 2e-05, "loss": 0.6127, "step": 3620 }, { "epoch": 0.22518610421836227, "grad_norm": 0.39428696036338806, "learning_rate": 2e-05, "loss": 0.6452, "step": 3630 }, { "epoch": 0.22580645161290322, "grad_norm": 0.3822895586490631, "learning_rate": 2e-05, "loss": 0.625, "step": 3640 }, { "epoch": 0.22642679900744417, "grad_norm": 0.5086479783058167, "learning_rate": 2e-05, "loss": 0.6069, "step": 3650 }, { "epoch": 0.22704714640198512, "grad_norm": 0.43685758113861084, "learning_rate": 2e-05, "loss": 0.6357, "step": 3660 }, { "epoch": 0.22766749379652607, "grad_norm": 0.44833698868751526, "learning_rate": 2e-05, "loss": 0.6288, "step": 3670 }, { "epoch": 0.228287841191067, "grad_norm": 0.695853590965271, "learning_rate": 2e-05, "loss": 0.631, "step": 3680 }, { "epoch": 0.22890818858560794, "grad_norm": 0.403007835149765, "learning_rate": 2e-05, "loss": 0.6306, "step": 3690 }, { "epoch": 0.22952853598014888, "grad_norm": 0.45625439286231995, "learning_rate": 2e-05, "loss": 0.6404, "step": 3700 }, { "epoch": 0.23014888337468983, "grad_norm": 0.4494592249393463, "learning_rate": 2e-05, "loss": 0.6482, "step": 3710 }, { "epoch": 0.23076923076923078, "grad_norm": 0.39842021465301514, "learning_rate": 2e-05, "loss": 0.6518, "step": 3720 }, { "epoch": 0.2313895781637717, "grad_norm": 0.45455050468444824, "learning_rate": 2e-05, "loss": 0.6392, "step": 3730 }, { "epoch": 0.23200992555831265, "grad_norm": 0.40073955059051514, "learning_rate": 2e-05, "loss": 0.6239, "step": 3740 }, { "epoch": 0.2326302729528536, "grad_norm": 0.40425387024879456, "learning_rate": 2e-05, "loss": 0.6233, "step": 3750 }, { "epoch": 0.23325062034739455, "grad_norm": 0.38586944341659546, "learning_rate": 2e-05, "loss": 0.6236, "step": 3760 }, { "epoch": 0.23387096774193547, "grad_norm": 0.4220291078090668, "learning_rate": 2e-05, "loss": 0.6245, "step": 3770 }, { "epoch": 0.23449131513647642, "grad_norm": 0.39111921191215515, "learning_rate": 2e-05, "loss": 0.6206, "step": 3780 }, { "epoch": 0.23511166253101737, "grad_norm": 0.4438347816467285, "learning_rate": 2e-05, "loss": 0.626, "step": 3790 }, { "epoch": 0.23573200992555832, "grad_norm": 0.4105881154537201, "learning_rate": 2e-05, "loss": 0.6152, "step": 3800 }, { "epoch": 0.23635235732009927, "grad_norm": 0.5986375212669373, "learning_rate": 2e-05, "loss": 0.6332, "step": 3810 }, { "epoch": 0.2369727047146402, "grad_norm": 0.42196112871170044, "learning_rate": 2e-05, "loss": 0.6344, "step": 3820 }, { "epoch": 0.23759305210918114, "grad_norm": 0.4690241813659668, "learning_rate": 2e-05, "loss": 0.6326, "step": 3830 }, { "epoch": 0.23821339950372208, "grad_norm": 0.39249280095100403, "learning_rate": 2e-05, "loss": 0.644, "step": 3840 }, { "epoch": 0.23883374689826303, "grad_norm": 0.3836807310581207, "learning_rate": 2e-05, "loss": 0.643, "step": 3850 }, { "epoch": 0.23945409429280398, "grad_norm": 0.39411523938179016, "learning_rate": 2e-05, "loss": 0.6168, "step": 3860 }, { "epoch": 0.2400744416873449, "grad_norm": 0.39570122957229614, "learning_rate": 2e-05, "loss": 0.6458, "step": 3870 }, { "epoch": 0.24069478908188585, "grad_norm": 0.4410209059715271, "learning_rate": 2e-05, "loss": 0.6357, "step": 3880 }, { "epoch": 0.2413151364764268, "grad_norm": 0.41891351342201233, "learning_rate": 2e-05, "loss": 0.645, "step": 3890 }, { "epoch": 0.24193548387096775, "grad_norm": 0.3815721273422241, "learning_rate": 2e-05, "loss": 0.6197, "step": 3900 }, { "epoch": 0.2425558312655087, "grad_norm": 0.42668625712394714, "learning_rate": 2e-05, "loss": 0.6512, "step": 3910 }, { "epoch": 0.24317617866004962, "grad_norm": 0.44440335035324097, "learning_rate": 2e-05, "loss": 0.6286, "step": 3920 }, { "epoch": 0.24379652605459057, "grad_norm": 0.4490135908126831, "learning_rate": 2e-05, "loss": 0.6429, "step": 3930 }, { "epoch": 0.24441687344913152, "grad_norm": 0.3730720281600952, "learning_rate": 2e-05, "loss": 0.6178, "step": 3940 }, { "epoch": 0.24503722084367247, "grad_norm": 0.4244785010814667, "learning_rate": 2e-05, "loss": 0.667, "step": 3950 }, { "epoch": 0.2456575682382134, "grad_norm": 0.38650715351104736, "learning_rate": 2e-05, "loss": 0.6116, "step": 3960 }, { "epoch": 0.24627791563275434, "grad_norm": 0.38137051463127136, "learning_rate": 2e-05, "loss": 0.6411, "step": 3970 }, { "epoch": 0.24689826302729528, "grad_norm": 0.4392582178115845, "learning_rate": 2e-05, "loss": 0.6296, "step": 3980 }, { "epoch": 0.24751861042183623, "grad_norm": 0.40702107548713684, "learning_rate": 2e-05, "loss": 0.6369, "step": 3990 }, { "epoch": 0.24813895781637718, "grad_norm": 0.3724535405635834, "learning_rate": 2e-05, "loss": 0.6209, "step": 4000 }, { "epoch": 0.2487593052109181, "grad_norm": 0.38708439469337463, "learning_rate": 2e-05, "loss": 0.6208, "step": 4010 }, { "epoch": 0.24937965260545905, "grad_norm": 0.46000051498413086, "learning_rate": 2e-05, "loss": 0.6162, "step": 4020 }, { "epoch": 0.25, "grad_norm": 0.41148972511291504, "learning_rate": 2e-05, "loss": 0.589, "step": 4030 }, { "epoch": 0.2506203473945409, "grad_norm": 0.40816742181777954, "learning_rate": 2e-05, "loss": 0.6286, "step": 4040 }, { "epoch": 0.2512406947890819, "grad_norm": 0.3669893741607666, "learning_rate": 2e-05, "loss": 0.6382, "step": 4050 }, { "epoch": 0.2518610421836228, "grad_norm": 0.4152558743953705, "learning_rate": 2e-05, "loss": 0.6367, "step": 4060 }, { "epoch": 0.2524813895781638, "grad_norm": 0.4094124734401703, "learning_rate": 2e-05, "loss": 0.6322, "step": 4070 }, { "epoch": 0.2531017369727047, "grad_norm": 0.41180694103240967, "learning_rate": 2e-05, "loss": 0.6333, "step": 4080 }, { "epoch": 0.25372208436724564, "grad_norm": 0.4234905540943146, "learning_rate": 2e-05, "loss": 0.6476, "step": 4090 }, { "epoch": 0.2543424317617866, "grad_norm": 0.38307809829711914, "learning_rate": 2e-05, "loss": 0.6131, "step": 4100 }, { "epoch": 0.25496277915632753, "grad_norm": 0.4049178659915924, "learning_rate": 2e-05, "loss": 0.6191, "step": 4110 }, { "epoch": 0.2555831265508685, "grad_norm": 0.394460529088974, "learning_rate": 2e-05, "loss": 0.6176, "step": 4120 }, { "epoch": 0.25620347394540943, "grad_norm": 0.4222032129764557, "learning_rate": 2e-05, "loss": 0.6068, "step": 4130 }, { "epoch": 0.25682382133995035, "grad_norm": 0.4654654860496521, "learning_rate": 2e-05, "loss": 0.6678, "step": 4140 }, { "epoch": 0.25744416873449133, "grad_norm": 0.4325982630252838, "learning_rate": 2e-05, "loss": 0.6626, "step": 4150 }, { "epoch": 0.25806451612903225, "grad_norm": 0.4552193284034729, "learning_rate": 2e-05, "loss": 0.633, "step": 4160 }, { "epoch": 0.2586848635235732, "grad_norm": 0.4053272008895874, "learning_rate": 2e-05, "loss": 0.6277, "step": 4170 }, { "epoch": 0.25930521091811415, "grad_norm": 0.45454907417297363, "learning_rate": 2e-05, "loss": 0.6199, "step": 4180 }, { "epoch": 0.25992555831265507, "grad_norm": 0.3934236168861389, "learning_rate": 2e-05, "loss": 0.6199, "step": 4190 }, { "epoch": 0.26054590570719605, "grad_norm": 0.40129271149635315, "learning_rate": 2e-05, "loss": 0.6, "step": 4200 }, { "epoch": 0.26116625310173697, "grad_norm": 0.4153764545917511, "learning_rate": 2e-05, "loss": 0.6212, "step": 4210 }, { "epoch": 0.2617866004962779, "grad_norm": 0.5232107043266296, "learning_rate": 2e-05, "loss": 0.6111, "step": 4220 }, { "epoch": 0.26240694789081886, "grad_norm": 0.4320084750652313, "learning_rate": 2e-05, "loss": 0.6364, "step": 4230 }, { "epoch": 0.2630272952853598, "grad_norm": 0.3956528306007385, "learning_rate": 2e-05, "loss": 0.6134, "step": 4240 }, { "epoch": 0.26364764267990076, "grad_norm": 0.40311774611473083, "learning_rate": 2e-05, "loss": 0.6136, "step": 4250 }, { "epoch": 0.2642679900744417, "grad_norm": 0.46076831221580505, "learning_rate": 2e-05, "loss": 0.6345, "step": 4260 }, { "epoch": 0.2648883374689826, "grad_norm": 0.45006024837493896, "learning_rate": 2e-05, "loss": 0.6301, "step": 4270 }, { "epoch": 0.2655086848635236, "grad_norm": 0.4164365530014038, "learning_rate": 2e-05, "loss": 0.6086, "step": 4280 }, { "epoch": 0.2661290322580645, "grad_norm": 0.4264712333679199, "learning_rate": 2e-05, "loss": 0.6238, "step": 4290 }, { "epoch": 0.2667493796526055, "grad_norm": 0.4533208906650543, "learning_rate": 2e-05, "loss": 0.6352, "step": 4300 }, { "epoch": 0.2673697270471464, "grad_norm": 0.4834296405315399, "learning_rate": 2e-05, "loss": 0.6485, "step": 4310 }, { "epoch": 0.2679900744416873, "grad_norm": 0.3921014070510864, "learning_rate": 2e-05, "loss": 0.6284, "step": 4320 }, { "epoch": 0.2686104218362283, "grad_norm": 0.4126746952533722, "learning_rate": 2e-05, "loss": 0.6441, "step": 4330 }, { "epoch": 0.2692307692307692, "grad_norm": 0.3946863114833832, "learning_rate": 2e-05, "loss": 0.6335, "step": 4340 }, { "epoch": 0.2698511166253102, "grad_norm": 0.46257439255714417, "learning_rate": 2e-05, "loss": 0.64, "step": 4350 }, { "epoch": 0.2704714640198511, "grad_norm": 0.38399389386177063, "learning_rate": 2e-05, "loss": 0.6368, "step": 4360 }, { "epoch": 0.27109181141439204, "grad_norm": 0.3903031647205353, "learning_rate": 2e-05, "loss": 0.6519, "step": 4370 }, { "epoch": 0.271712158808933, "grad_norm": 0.3797507584095001, "learning_rate": 2e-05, "loss": 0.6242, "step": 4380 }, { "epoch": 0.27233250620347393, "grad_norm": 0.5243149399757385, "learning_rate": 2e-05, "loss": 0.6223, "step": 4390 }, { "epoch": 0.2729528535980149, "grad_norm": 0.41803818941116333, "learning_rate": 2e-05, "loss": 0.6141, "step": 4400 }, { "epoch": 0.27357320099255583, "grad_norm": 0.40149328112602234, "learning_rate": 2e-05, "loss": 0.6224, "step": 4410 }, { "epoch": 0.27419354838709675, "grad_norm": 0.4747233986854553, "learning_rate": 2e-05, "loss": 0.608, "step": 4420 }, { "epoch": 0.27481389578163773, "grad_norm": 0.43973299860954285, "learning_rate": 2e-05, "loss": 0.6342, "step": 4430 }, { "epoch": 0.27543424317617865, "grad_norm": 0.405673086643219, "learning_rate": 2e-05, "loss": 0.618, "step": 4440 }, { "epoch": 0.2760545905707196, "grad_norm": 0.40612080693244934, "learning_rate": 2e-05, "loss": 0.607, "step": 4450 }, { "epoch": 0.27667493796526055, "grad_norm": 0.40265241265296936, "learning_rate": 2e-05, "loss": 0.6337, "step": 4460 }, { "epoch": 0.27729528535980147, "grad_norm": 0.3912622332572937, "learning_rate": 2e-05, "loss": 0.6345, "step": 4470 }, { "epoch": 0.27791563275434245, "grad_norm": 0.3609847128391266, "learning_rate": 2e-05, "loss": 0.6015, "step": 4480 }, { "epoch": 0.27853598014888337, "grad_norm": 0.45990270376205444, "learning_rate": 2e-05, "loss": 0.621, "step": 4490 }, { "epoch": 0.27915632754342434, "grad_norm": 0.42322906851768494, "learning_rate": 2e-05, "loss": 0.6106, "step": 4500 }, { "epoch": 0.27977667493796526, "grad_norm": 0.46909046173095703, "learning_rate": 2e-05, "loss": 0.6254, "step": 4510 }, { "epoch": 0.2803970223325062, "grad_norm": 0.4232948124408722, "learning_rate": 2e-05, "loss": 0.6515, "step": 4520 }, { "epoch": 0.28101736972704716, "grad_norm": 0.48028555512428284, "learning_rate": 2e-05, "loss": 0.6258, "step": 4530 }, { "epoch": 0.2816377171215881, "grad_norm": 0.40003713965415955, "learning_rate": 2e-05, "loss": 0.6346, "step": 4540 }, { "epoch": 0.28225806451612906, "grad_norm": 0.38865897059440613, "learning_rate": 2e-05, "loss": 0.613, "step": 4550 }, { "epoch": 0.28287841191067, "grad_norm": 0.4300529956817627, "learning_rate": 2e-05, "loss": 0.6181, "step": 4560 }, { "epoch": 0.2834987593052109, "grad_norm": 0.4340721368789673, "learning_rate": 2e-05, "loss": 0.6124, "step": 4570 }, { "epoch": 0.2841191066997519, "grad_norm": 0.3983030617237091, "learning_rate": 2e-05, "loss": 0.6263, "step": 4580 }, { "epoch": 0.2847394540942928, "grad_norm": 0.45210182666778564, "learning_rate": 2e-05, "loss": 0.6389, "step": 4590 }, { "epoch": 0.2853598014888337, "grad_norm": 0.4101727604866028, "learning_rate": 2e-05, "loss": 0.6184, "step": 4600 }, { "epoch": 0.2859801488833747, "grad_norm": 0.41406387090682983, "learning_rate": 2e-05, "loss": 0.6354, "step": 4610 }, { "epoch": 0.2866004962779156, "grad_norm": 0.4032994508743286, "learning_rate": 2e-05, "loss": 0.6276, "step": 4620 }, { "epoch": 0.2872208436724566, "grad_norm": 0.3888227939605713, "learning_rate": 2e-05, "loss": 0.6333, "step": 4630 }, { "epoch": 0.2878411910669975, "grad_norm": 0.39158758521080017, "learning_rate": 2e-05, "loss": 0.5872, "step": 4640 }, { "epoch": 0.28846153846153844, "grad_norm": 0.4994513988494873, "learning_rate": 2e-05, "loss": 0.6173, "step": 4650 }, { "epoch": 0.2890818858560794, "grad_norm": 0.4489558935165405, "learning_rate": 2e-05, "loss": 0.6418, "step": 4660 }, { "epoch": 0.28970223325062033, "grad_norm": 0.3933773338794708, "learning_rate": 2e-05, "loss": 0.606, "step": 4670 }, { "epoch": 0.2903225806451613, "grad_norm": 0.4205200672149658, "learning_rate": 2e-05, "loss": 0.6235, "step": 4680 }, { "epoch": 0.29094292803970223, "grad_norm": 0.4780215620994568, "learning_rate": 2e-05, "loss": 0.5984, "step": 4690 }, { "epoch": 0.29156327543424315, "grad_norm": 0.4221072196960449, "learning_rate": 2e-05, "loss": 0.6048, "step": 4700 }, { "epoch": 0.29218362282878413, "grad_norm": 0.4139895439147949, "learning_rate": 2e-05, "loss": 0.6656, "step": 4710 }, { "epoch": 0.29280397022332505, "grad_norm": 0.4461250603199005, "learning_rate": 2e-05, "loss": 0.598, "step": 4720 }, { "epoch": 0.293424317617866, "grad_norm": 0.43874838948249817, "learning_rate": 2e-05, "loss": 0.652, "step": 4730 }, { "epoch": 0.29404466501240695, "grad_norm": 0.41878360509872437, "learning_rate": 2e-05, "loss": 0.6351, "step": 4740 }, { "epoch": 0.29466501240694787, "grad_norm": 0.39284858107566833, "learning_rate": 2e-05, "loss": 0.5925, "step": 4750 }, { "epoch": 0.29528535980148884, "grad_norm": 0.39719724655151367, "learning_rate": 2e-05, "loss": 0.6274, "step": 4760 }, { "epoch": 0.29590570719602977, "grad_norm": 0.4270191490650177, "learning_rate": 2e-05, "loss": 0.6213, "step": 4770 }, { "epoch": 0.29652605459057074, "grad_norm": 0.5198231339454651, "learning_rate": 2e-05, "loss": 0.6232, "step": 4780 }, { "epoch": 0.29714640198511166, "grad_norm": 0.37311476469039917, "learning_rate": 2e-05, "loss": 0.6305, "step": 4790 }, { "epoch": 0.2977667493796526, "grad_norm": 0.519521951675415, "learning_rate": 2e-05, "loss": 0.6333, "step": 4800 }, { "epoch": 0.29838709677419356, "grad_norm": 0.4141654074192047, "learning_rate": 2e-05, "loss": 0.6534, "step": 4810 }, { "epoch": 0.2990074441687345, "grad_norm": 0.42340201139450073, "learning_rate": 2e-05, "loss": 0.6364, "step": 4820 }, { "epoch": 0.29962779156327546, "grad_norm": 0.4127744734287262, "learning_rate": 2e-05, "loss": 0.6357, "step": 4830 }, { "epoch": 0.3002481389578164, "grad_norm": 0.4145190417766571, "learning_rate": 2e-05, "loss": 0.6055, "step": 4840 }, { "epoch": 0.3008684863523573, "grad_norm": 0.4001079797744751, "learning_rate": 2e-05, "loss": 0.6096, "step": 4850 }, { "epoch": 0.3014888337468983, "grad_norm": 0.4246225357055664, "learning_rate": 2e-05, "loss": 0.6123, "step": 4860 }, { "epoch": 0.3021091811414392, "grad_norm": 0.3705722689628601, "learning_rate": 2e-05, "loss": 0.6148, "step": 4870 }, { "epoch": 0.3027295285359802, "grad_norm": 0.5260827541351318, "learning_rate": 2e-05, "loss": 0.6374, "step": 4880 }, { "epoch": 0.3033498759305211, "grad_norm": 0.43668943643569946, "learning_rate": 2e-05, "loss": 0.6138, "step": 4890 }, { "epoch": 0.303970223325062, "grad_norm": 0.41160139441490173, "learning_rate": 2e-05, "loss": 0.6346, "step": 4900 }, { "epoch": 0.304590570719603, "grad_norm": 0.4053614139556885, "learning_rate": 2e-05, "loss": 0.6543, "step": 4910 }, { "epoch": 0.3052109181141439, "grad_norm": 0.4161207675933838, "learning_rate": 2e-05, "loss": 0.6036, "step": 4920 }, { "epoch": 0.3058312655086849, "grad_norm": 0.3976508677005768, "learning_rate": 2e-05, "loss": 0.6281, "step": 4930 }, { "epoch": 0.3064516129032258, "grad_norm": 0.4404948055744171, "learning_rate": 2e-05, "loss": 0.6259, "step": 4940 }, { "epoch": 0.30707196029776673, "grad_norm": 0.37375855445861816, "learning_rate": 2e-05, "loss": 0.6128, "step": 4950 }, { "epoch": 0.3076923076923077, "grad_norm": 0.38013672828674316, "learning_rate": 2e-05, "loss": 0.6739, "step": 4960 }, { "epoch": 0.30831265508684863, "grad_norm": 0.49222898483276367, "learning_rate": 2e-05, "loss": 0.6183, "step": 4970 }, { "epoch": 0.30893300248138955, "grad_norm": 0.4374001622200012, "learning_rate": 2e-05, "loss": 0.6244, "step": 4980 }, { "epoch": 0.30955334987593053, "grad_norm": 0.42256903648376465, "learning_rate": 2e-05, "loss": 0.6171, "step": 4990 }, { "epoch": 0.31017369727047145, "grad_norm": 0.41887253522872925, "learning_rate": 2e-05, "loss": 0.6026, "step": 5000 }, { "epoch": 0.3107940446650124, "grad_norm": 0.40787267684936523, "learning_rate": 2e-05, "loss": 0.6568, "step": 5010 }, { "epoch": 0.31141439205955335, "grad_norm": 0.4040360748767853, "learning_rate": 2e-05, "loss": 0.6289, "step": 5020 }, { "epoch": 0.31203473945409427, "grad_norm": 0.3854551911354065, "learning_rate": 2e-05, "loss": 0.6202, "step": 5030 }, { "epoch": 0.31265508684863524, "grad_norm": 0.38839107751846313, "learning_rate": 2e-05, "loss": 0.6114, "step": 5040 }, { "epoch": 0.31327543424317617, "grad_norm": 0.3909808099269867, "learning_rate": 2e-05, "loss": 0.5849, "step": 5050 }, { "epoch": 0.31389578163771714, "grad_norm": 0.43128839135169983, "learning_rate": 2e-05, "loss": 0.6384, "step": 5060 }, { "epoch": 0.31451612903225806, "grad_norm": 0.3931979835033417, "learning_rate": 2e-05, "loss": 0.6385, "step": 5070 }, { "epoch": 0.315136476426799, "grad_norm": 0.43830570578575134, "learning_rate": 2e-05, "loss": 0.6258, "step": 5080 }, { "epoch": 0.31575682382133996, "grad_norm": 0.4176919758319855, "learning_rate": 2e-05, "loss": 0.6206, "step": 5090 }, { "epoch": 0.3163771712158809, "grad_norm": 0.6715347170829773, "learning_rate": 2e-05, "loss": 0.6193, "step": 5100 }, { "epoch": 0.31699751861042186, "grad_norm": 0.41754648089408875, "learning_rate": 2e-05, "loss": 0.6403, "step": 5110 }, { "epoch": 0.3176178660049628, "grad_norm": 0.3816433250904083, "learning_rate": 2e-05, "loss": 0.6088, "step": 5120 }, { "epoch": 0.3182382133995037, "grad_norm": 0.49699413776397705, "learning_rate": 2e-05, "loss": 0.6436, "step": 5130 }, { "epoch": 0.3188585607940447, "grad_norm": 0.35754022002220154, "learning_rate": 2e-05, "loss": 0.6336, "step": 5140 }, { "epoch": 0.3194789081885856, "grad_norm": 0.4537948966026306, "learning_rate": 2e-05, "loss": 0.6341, "step": 5150 }, { "epoch": 0.3200992555831266, "grad_norm": 0.3842616081237793, "learning_rate": 2e-05, "loss": 0.6148, "step": 5160 }, { "epoch": 0.3207196029776675, "grad_norm": 0.433755487203598, "learning_rate": 2e-05, "loss": 0.6256, "step": 5170 }, { "epoch": 0.3213399503722084, "grad_norm": 1.4658693075180054, "learning_rate": 2e-05, "loss": 0.61, "step": 5180 }, { "epoch": 0.3219602977667494, "grad_norm": 0.4627196490764618, "learning_rate": 2e-05, "loss": 0.6011, "step": 5190 }, { "epoch": 0.3225806451612903, "grad_norm": 0.42894798517227173, "learning_rate": 2e-05, "loss": 0.6148, "step": 5200 }, { "epoch": 0.3232009925558313, "grad_norm": 0.3998261094093323, "learning_rate": 2e-05, "loss": 0.6116, "step": 5210 }, { "epoch": 0.3238213399503722, "grad_norm": 0.3782484233379364, "learning_rate": 2e-05, "loss": 0.623, "step": 5220 }, { "epoch": 0.32444168734491313, "grad_norm": 0.39523306488990784, "learning_rate": 2e-05, "loss": 0.6474, "step": 5230 }, { "epoch": 0.3250620347394541, "grad_norm": 0.386526495218277, "learning_rate": 2e-05, "loss": 0.6176, "step": 5240 }, { "epoch": 0.32568238213399503, "grad_norm": 0.39016562700271606, "learning_rate": 2e-05, "loss": 0.603, "step": 5250 }, { "epoch": 0.326302729528536, "grad_norm": 0.41461068391799927, "learning_rate": 2e-05, "loss": 0.6156, "step": 5260 }, { "epoch": 0.3269230769230769, "grad_norm": 0.5494696497917175, "learning_rate": 2e-05, "loss": 0.6447, "step": 5270 }, { "epoch": 0.32754342431761785, "grad_norm": 0.4124053418636322, "learning_rate": 2e-05, "loss": 0.6199, "step": 5280 }, { "epoch": 0.3281637717121588, "grad_norm": 0.3782106339931488, "learning_rate": 2e-05, "loss": 0.6265, "step": 5290 }, { "epoch": 0.32878411910669975, "grad_norm": 0.4879048466682434, "learning_rate": 2e-05, "loss": 0.6132, "step": 5300 }, { "epoch": 0.3294044665012407, "grad_norm": 0.5877473950386047, "learning_rate": 2e-05, "loss": 0.6315, "step": 5310 }, { "epoch": 0.33002481389578164, "grad_norm": 0.46910569071769714, "learning_rate": 2e-05, "loss": 0.6269, "step": 5320 }, { "epoch": 0.33064516129032256, "grad_norm": 0.38834384083747864, "learning_rate": 2e-05, "loss": 0.5943, "step": 5330 }, { "epoch": 0.33126550868486354, "grad_norm": 0.44579243659973145, "learning_rate": 2e-05, "loss": 0.6585, "step": 5340 }, { "epoch": 0.33188585607940446, "grad_norm": 0.3884667754173279, "learning_rate": 1.999194520388485e-05, "loss": 0.602, "step": 5350 }, { "epoch": 0.3325062034739454, "grad_norm": 0.44833290576934814, "learning_rate": 1.9959247303157763e-05, "loss": 0.6035, "step": 5360 }, { "epoch": 0.33312655086848636, "grad_norm": 0.3995696008205414, "learning_rate": 1.990149424459817e-05, "loss": 0.5963, "step": 5370 }, { "epoch": 0.3337468982630273, "grad_norm": 0.4103012681007385, "learning_rate": 1.9818847538648688e-05, "loss": 0.6076, "step": 5380 }, { "epoch": 0.33436724565756826, "grad_norm": 0.3939712345600128, "learning_rate": 1.971153831256721e-05, "loss": 0.6182, "step": 5390 }, { "epoch": 0.3349875930521092, "grad_norm": 0.42833831906318665, "learning_rate": 1.9579866664063435e-05, "loss": 0.6145, "step": 5400 }, { "epoch": 0.3356079404466501, "grad_norm": 0.3929766118526459, "learning_rate": 1.9424200822054782e-05, "loss": 0.612, "step": 5410 }, { "epoch": 0.3362282878411911, "grad_norm": 0.3988458514213562, "learning_rate": 1.9244976116888626e-05, "loss": 0.5885, "step": 5420 }, { "epoch": 0.336848635235732, "grad_norm": 0.36740994453430176, "learning_rate": 1.904269376291071e-05, "loss": 0.6039, "step": 5430 }, { "epoch": 0.337468982630273, "grad_norm": 0.421723872423172, "learning_rate": 1.88179194567844e-05, "loss": 0.6253, "step": 5440 }, { "epoch": 0.3380893300248139, "grad_norm": 0.4609566628932953, "learning_rate": 1.8571281795480632e-05, "loss": 0.643, "step": 5450 }, { "epoch": 0.3387096774193548, "grad_norm": 0.41990435123443604, "learning_rate": 1.8303470518362808e-05, "loss": 0.6258, "step": 5460 }, { "epoch": 0.3393300248138958, "grad_norm": 0.3890247046947479, "learning_rate": 1.801523457828271e-05, "loss": 0.6164, "step": 5470 }, { "epoch": 0.3399503722084367, "grad_norm": 0.404147744178772, "learning_rate": 1.7707380047081796e-05, "loss": 0.6342, "step": 5480 }, { "epoch": 0.3405707196029777, "grad_norm": 0.38197287917137146, "learning_rate": 1.7380767861355252e-05, "loss": 0.6112, "step": 5490 }, { "epoch": 0.3411910669975186, "grad_norm": 0.4186520576477051, "learning_rate": 1.703631141478299e-05, "loss": 0.6156, "step": 5500 }, { "epoch": 0.34181141439205953, "grad_norm": 0.42119473218917847, "learning_rate": 1.6674974003760705e-05, "loss": 0.6376, "step": 5510 }, { "epoch": 0.3424317617866005, "grad_norm": 0.4046884775161743, "learning_rate": 1.6297766133474556e-05, "loss": 0.6153, "step": 5520 }, { "epoch": 0.34305210918114143, "grad_norm": 0.40655776858329773, "learning_rate": 1.5905742691953186e-05, "loss": 0.6173, "step": 5530 }, { "epoch": 0.3436724565756824, "grad_norm": 0.39052268862724304, "learning_rate": 1.55e-05, "loss": 0.6231, "step": 5540 }, { "epoch": 0.3442928039702233, "grad_norm": 0.44089069962501526, "learning_rate": 1.5081672745255862e-05, "loss": 0.6069, "step": 5550 }, { "epoch": 0.34491315136476425, "grad_norm": 0.4063626527786255, "learning_rate": 1.4651930808966206e-05, "loss": 0.6105, "step": 5560 }, { "epoch": 0.3455334987593052, "grad_norm": 0.4064791202545166, "learning_rate": 1.4211975994326848e-05, "loss": 0.6189, "step": 5570 }, { "epoch": 0.34615384615384615, "grad_norm": 0.43501579761505127, "learning_rate": 1.376303866555779e-05, "loss": 0.5771, "step": 5580 }, { "epoch": 0.3467741935483871, "grad_norm": 0.3871893882751465, "learning_rate": 1.3306374307104164e-05, "loss": 0.6292, "step": 5590 }, { "epoch": 0.34739454094292804, "grad_norm": 0.4056432843208313, "learning_rate": 1.2843260012586718e-05, "loss": 0.6117, "step": 5600 }, { "epoch": 0.34801488833746896, "grad_norm": 0.36421141028404236, "learning_rate": 1.2374990913320726e-05, "loss": 0.6078, "step": 5610 }, { "epoch": 0.34863523573200994, "grad_norm": 0.39328113198280334, "learning_rate": 1.1902876556391247e-05, "loss": 0.6272, "step": 5620 }, { "epoch": 0.34925558312655086, "grad_norm": 0.3795672357082367, "learning_rate": 1.1428237242413685e-05, "loss": 0.6054, "step": 5630 }, { "epoch": 0.34987593052109184, "grad_norm": 0.42268675565719604, "learning_rate": 1.095240033322132e-05, "loss": 0.6053, "step": 5640 }, { "epoch": 0.35049627791563276, "grad_norm": 0.4097190797328949, "learning_rate": 1.047669653980572e-05, "loss": 0.6096, "step": 5650 }, { "epoch": 0.3511166253101737, "grad_norm": 0.40436145663261414, "learning_rate": 1.0002456200890902e-05, "loss": 0.6222, "step": 5660 }, { "epoch": 0.35173697270471466, "grad_norm": 0.4477991759777069, "learning_rate": 9.531005562548668e-06, "loss": 0.6016, "step": 5670 }, { "epoch": 0.3523573200992556, "grad_norm": 0.4098536968231201, "learning_rate": 9.06366306925925e-06, "loss": 0.6141, "step": 5680 }, { "epoch": 0.3529776674937965, "grad_norm": 0.42281678318977356, "learning_rate": 8.601735676789686e-06, "loss": 0.6092, "step": 5690 }, { "epoch": 0.3535980148883375, "grad_norm": 0.3869405686855316, "learning_rate": 8.14651519720118e-06, "loss": 0.6116, "step": 5700 }, { "epoch": 0.3542183622828784, "grad_norm": 0.4319595992565155, "learning_rate": 7.699274686206866e-06, "loss": 0.6215, "step": 5710 }, { "epoch": 0.3548387096774194, "grad_norm": 0.41679537296295166, "learning_rate": 7.261264882983024e-06, "loss": 0.6044, "step": 5720 }, { "epoch": 0.3554590570719603, "grad_norm": 0.3781132102012634, "learning_rate": 6.8337107123900386e-06, "loss": 0.5862, "step": 5730 }, { "epoch": 0.3560794044665012, "grad_norm": 0.3828170895576477, "learning_rate": 6.417807859384881e-06, "loss": 0.6112, "step": 5740 }, { "epoch": 0.3566997518610422, "grad_norm": 0.41343799233436584, "learning_rate": 6.014719425205009e-06, "loss": 0.6069, "step": 5750 }, { "epoch": 0.3573200992555831, "grad_norm": 0.39178237318992615, "learning_rate": 5.6255726746749275e-06, "loss": 0.5954, "step": 5760 }, { "epoch": 0.3579404466501241, "grad_norm": 0.376936674118042, "learning_rate": 5.251455883731728e-06, "loss": 0.6039, "step": 5770 }, { "epoch": 0.358560794044665, "grad_norm": 0.37772035598754883, "learning_rate": 4.893415295985812e-06, "loss": 0.6115, "step": 5780 }, { "epoch": 0.35918114143920593, "grad_norm": 0.38948723673820496, "learning_rate": 4.552452196827885e-06, "loss": 0.6249, "step": 5790 }, { "epoch": 0.3598014888337469, "grad_norm": 0.38746488094329834, "learning_rate": 4.229520113264785e-06, "loss": 0.6483, "step": 5800 }, { "epoch": 0.36042183622828783, "grad_norm": 0.40317073464393616, "learning_rate": 3.925522147314915e-06, "loss": 0.6215, "step": 5810 }, { "epoch": 0.3610421836228288, "grad_norm": 0.3863352835178375, "learning_rate": 3.641308450420675e-06, "loss": 0.6004, "step": 5820 }, { "epoch": 0.3616625310173697, "grad_norm": 0.8454812169075012, "learning_rate": 3.37767384594087e-06, "loss": 0.6323, "step": 5830 }, { "epoch": 0.36228287841191065, "grad_norm": 0.4042379856109619, "learning_rate": 3.1353556063719357e-06, "loss": 0.604, "step": 5840 }, { "epoch": 0.3629032258064516, "grad_norm": 0.41203248500823975, "learning_rate": 2.9150313915141474e-06, "loss": 0.6155, "step": 5850 }, { "epoch": 0.36352357320099254, "grad_norm": 0.37770602107048035, "learning_rate": 2.717317353348891e-06, "loss": 0.599, "step": 5860 }, { "epoch": 0.3641439205955335, "grad_norm": 0.41650286316871643, "learning_rate": 2.5427664129268253e-06, "loss": 0.6023, "step": 5870 }, { "epoch": 0.36476426799007444, "grad_norm": 0.372446745634079, "learning_rate": 2.391866714085717e-06, "loss": 0.5876, "step": 5880 }, { "epoch": 0.36538461538461536, "grad_norm": 0.4286235272884369, "learning_rate": 2.2650402583222753e-06, "loss": 0.6048, "step": 5890 }, { "epoch": 0.36600496277915634, "grad_norm": 0.4152184724807739, "learning_rate": 2.1626417246356398e-06, "loss": 0.5921, "step": 5900 }, { "epoch": 0.36662531017369726, "grad_norm": 0.3740425109863281, "learning_rate": 2.084957477642894e-06, "loss": 0.5844, "step": 5910 }, { "epoch": 0.36724565756823824, "grad_norm": 0.385947585105896, "learning_rate": 2.0322047667405147e-06, "loss": 0.5826, "step": 5920 }, { "epoch": 0.36786600496277916, "grad_norm": 0.5033133029937744, "learning_rate": 2.0045311185513342e-06, "loss": 0.5989, "step": 5930 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.6494000762504348e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }