{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.2524813895781638, "eval_steps": 500, "global_step": 4070, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0006203473945409429, "grad_norm": 1.103378415107727, "learning_rate": 2.910112359550562e-06, "loss": 0.8492, "step": 10 }, { "epoch": 0.0012406947890818859, "grad_norm": 0.9267538189888, "learning_rate": 3.921348314606742e-06, "loss": 0.7944, "step": 20 }, { "epoch": 0.0018610421836228288, "grad_norm": 0.8842476606369019, "learning_rate": 4.932584269662922e-06, "loss": 0.7628, "step": 30 }, { "epoch": 0.0024813895781637717, "grad_norm": 0.8289238810539246, "learning_rate": 5.943820224719102e-06, "loss": 0.7342, "step": 40 }, { "epoch": 0.003101736972704715, "grad_norm": 0.9065801501274109, "learning_rate": 6.955056179775282e-06, "loss": 0.7217, "step": 50 }, { "epoch": 0.0037220843672456576, "grad_norm": 0.8170527815818787, "learning_rate": 7.966292134831462e-06, "loss": 0.73, "step": 60 }, { "epoch": 0.004342431761786601, "grad_norm": 0.8123277425765991, "learning_rate": 8.977528089887641e-06, "loss": 0.7154, "step": 70 }, { "epoch": 0.004962779156327543, "grad_norm": 0.7789028882980347, "learning_rate": 9.988764044943822e-06, "loss": 0.7083, "step": 80 }, { "epoch": 0.005583126550868486, "grad_norm": 0.7920109033584595, "learning_rate": 1.1000000000000001e-05, "loss": 0.7252, "step": 90 }, { "epoch": 0.00620347394540943, "grad_norm": 0.9307668209075928, "learning_rate": 1.2011235955056182e-05, "loss": 0.6857, "step": 100 }, { "epoch": 0.006823821339950372, "grad_norm": 0.8309650421142578, "learning_rate": 1.3022471910112362e-05, "loss": 0.7, "step": 110 }, { "epoch": 0.007444168734491315, "grad_norm": 0.907129168510437, "learning_rate": 1.403370786516854e-05, "loss": 0.7132, "step": 120 }, { "epoch": 0.008064516129032258, "grad_norm": 0.8221721649169922, "learning_rate": 1.504494382022472e-05, "loss": 0.7001, "step": 130 }, { "epoch": 0.008684863523573201, "grad_norm": 0.701308012008667, "learning_rate": 1.60561797752809e-05, "loss": 0.699, "step": 140 }, { "epoch": 0.009305210918114143, "grad_norm": 0.7170705199241638, "learning_rate": 1.706741573033708e-05, "loss": 0.6725, "step": 150 }, { "epoch": 0.009925558312655087, "grad_norm": 0.8029273152351379, "learning_rate": 1.8078651685393256e-05, "loss": 0.6839, "step": 160 }, { "epoch": 0.01054590570719603, "grad_norm": 0.7059943079948425, "learning_rate": 1.908988764044944e-05, "loss": 0.6963, "step": 170 }, { "epoch": 0.011166253101736972, "grad_norm": 0.7652074694633484, "learning_rate": 2e-05, "loss": 0.6906, "step": 180 }, { "epoch": 0.011786600496277916, "grad_norm": 0.777823269367218, "learning_rate": 2e-05, "loss": 0.6697, "step": 190 }, { "epoch": 0.01240694789081886, "grad_norm": 0.7011638879776001, "learning_rate": 2e-05, "loss": 0.6886, "step": 200 }, { "epoch": 0.013027295285359801, "grad_norm": 0.7449702024459839, "learning_rate": 2e-05, "loss": 0.6957, "step": 210 }, { "epoch": 0.013647642679900745, "grad_norm": 0.7148544192314148, "learning_rate": 2e-05, "loss": 0.6679, "step": 220 }, { "epoch": 0.014267990074441687, "grad_norm": 0.6491106748580933, "learning_rate": 2e-05, "loss": 0.6916, "step": 230 }, { "epoch": 0.01488833746898263, "grad_norm": 0.5647692084312439, "learning_rate": 2e-05, "loss": 0.6986, "step": 240 }, { "epoch": 0.015508684863523574, "grad_norm": 0.5894495844841003, "learning_rate": 2e-05, "loss": 0.7308, "step": 250 }, { "epoch": 0.016129032258064516, "grad_norm": 0.5743111371994019, "learning_rate": 2e-05, "loss": 0.6988, "step": 260 }, { "epoch": 0.016749379652605458, "grad_norm": 0.5293608903884888, "learning_rate": 2e-05, "loss": 0.6821, "step": 270 }, { "epoch": 0.017369727047146403, "grad_norm": 0.5631842613220215, "learning_rate": 2e-05, "loss": 0.6701, "step": 280 }, { "epoch": 0.017990074441687345, "grad_norm": 0.5677319765090942, "learning_rate": 2e-05, "loss": 0.7191, "step": 290 }, { "epoch": 0.018610421836228287, "grad_norm": 0.5547688603401184, "learning_rate": 2e-05, "loss": 0.7094, "step": 300 }, { "epoch": 0.019230769230769232, "grad_norm": 0.5547721982002258, "learning_rate": 2e-05, "loss": 0.6783, "step": 310 }, { "epoch": 0.019851116625310174, "grad_norm": 0.5873662829399109, "learning_rate": 2e-05, "loss": 0.707, "step": 320 }, { "epoch": 0.020471464019851116, "grad_norm": 0.5058910846710205, "learning_rate": 2e-05, "loss": 0.663, "step": 330 }, { "epoch": 0.02109181141439206, "grad_norm": 0.4962847828865051, "learning_rate": 2e-05, "loss": 0.6727, "step": 340 }, { "epoch": 0.021712158808933003, "grad_norm": 0.49221107363700867, "learning_rate": 2e-05, "loss": 0.666, "step": 350 }, { "epoch": 0.022332506203473945, "grad_norm": 0.4796120822429657, "learning_rate": 2e-05, "loss": 0.6665, "step": 360 }, { "epoch": 0.02295285359801489, "grad_norm": 0.5007806420326233, "learning_rate": 2e-05, "loss": 0.6865, "step": 370 }, { "epoch": 0.02357320099255583, "grad_norm": 0.5052497386932373, "learning_rate": 2e-05, "loss": 0.67, "step": 380 }, { "epoch": 0.024193548387096774, "grad_norm": 0.4976111948490143, "learning_rate": 2e-05, "loss": 0.6971, "step": 390 }, { "epoch": 0.02481389578163772, "grad_norm": 0.489734947681427, "learning_rate": 2e-05, "loss": 0.7244, "step": 400 }, { "epoch": 0.02543424317617866, "grad_norm": 0.504808783531189, "learning_rate": 2e-05, "loss": 0.6574, "step": 410 }, { "epoch": 0.026054590570719603, "grad_norm": 0.5242099761962891, "learning_rate": 2e-05, "loss": 0.6793, "step": 420 }, { "epoch": 0.026674937965260544, "grad_norm": 0.48700666427612305, "learning_rate": 2e-05, "loss": 0.6733, "step": 430 }, { "epoch": 0.02729528535980149, "grad_norm": 0.5279196500778198, "learning_rate": 2e-05, "loss": 0.6807, "step": 440 }, { "epoch": 0.02791563275434243, "grad_norm": 1.6781505346298218, "learning_rate": 2e-05, "loss": 0.7033, "step": 450 }, { "epoch": 0.028535980148883373, "grad_norm": 0.589901328086853, "learning_rate": 2e-05, "loss": 0.7007, "step": 460 }, { "epoch": 0.02915632754342432, "grad_norm": 0.9268983006477356, "learning_rate": 2e-05, "loss": 0.6832, "step": 470 }, { "epoch": 0.02977667493796526, "grad_norm": 0.47625434398651123, "learning_rate": 2e-05, "loss": 0.6953, "step": 480 }, { "epoch": 0.030397022332506202, "grad_norm": 0.5042843818664551, "learning_rate": 2e-05, "loss": 0.6592, "step": 490 }, { "epoch": 0.031017369727047148, "grad_norm": 0.44941166043281555, "learning_rate": 2e-05, "loss": 0.695, "step": 500 }, { "epoch": 0.03163771712158809, "grad_norm": 0.477464497089386, "learning_rate": 2e-05, "loss": 0.6707, "step": 510 }, { "epoch": 0.03225806451612903, "grad_norm": 0.4819585680961609, "learning_rate": 2e-05, "loss": 0.6708, "step": 520 }, { "epoch": 0.03287841191066997, "grad_norm": 0.4723353981971741, "learning_rate": 2e-05, "loss": 0.6615, "step": 530 }, { "epoch": 0.033498759305210915, "grad_norm": 0.4481304883956909, "learning_rate": 2e-05, "loss": 0.6716, "step": 540 }, { "epoch": 0.034119106699751864, "grad_norm": 0.4634115993976593, "learning_rate": 2e-05, "loss": 0.6564, "step": 550 }, { "epoch": 0.034739454094292806, "grad_norm": 0.4898909628391266, "learning_rate": 2e-05, "loss": 0.6783, "step": 560 }, { "epoch": 0.03535980148883375, "grad_norm": 0.49201110005378723, "learning_rate": 2e-05, "loss": 0.6679, "step": 570 }, { "epoch": 0.03598014888337469, "grad_norm": 0.4393959045410156, "learning_rate": 2e-05, "loss": 0.6984, "step": 580 }, { "epoch": 0.03660049627791563, "grad_norm": 0.4818369746208191, "learning_rate": 2e-05, "loss": 0.6841, "step": 590 }, { "epoch": 0.03722084367245657, "grad_norm": 0.4339914917945862, "learning_rate": 2e-05, "loss": 0.6787, "step": 600 }, { "epoch": 0.03784119106699752, "grad_norm": 0.43327295780181885, "learning_rate": 2e-05, "loss": 0.6796, "step": 610 }, { "epoch": 0.038461538461538464, "grad_norm": 0.4560607969760895, "learning_rate": 2e-05, "loss": 0.6468, "step": 620 }, { "epoch": 0.039081885856079406, "grad_norm": 0.47957178950309753, "learning_rate": 2e-05, "loss": 0.6495, "step": 630 }, { "epoch": 0.03970223325062035, "grad_norm": 0.4618580639362335, "learning_rate": 2e-05, "loss": 0.669, "step": 640 }, { "epoch": 0.04032258064516129, "grad_norm": 0.505342423915863, "learning_rate": 2e-05, "loss": 0.6767, "step": 650 }, { "epoch": 0.04094292803970223, "grad_norm": 0.48456406593322754, "learning_rate": 2e-05, "loss": 0.6804, "step": 660 }, { "epoch": 0.04156327543424317, "grad_norm": 0.44942647218704224, "learning_rate": 2e-05, "loss": 0.6661, "step": 670 }, { "epoch": 0.04218362282878412, "grad_norm": 0.4639962315559387, "learning_rate": 2e-05, "loss": 0.6796, "step": 680 }, { "epoch": 0.042803970223325064, "grad_norm": 0.46533408761024475, "learning_rate": 2e-05, "loss": 0.6875, "step": 690 }, { "epoch": 0.043424317617866005, "grad_norm": 0.42894449830055237, "learning_rate": 2e-05, "loss": 0.6436, "step": 700 }, { "epoch": 0.04404466501240695, "grad_norm": 0.5065799951553345, "learning_rate": 2e-05, "loss": 0.6714, "step": 710 }, { "epoch": 0.04466501240694789, "grad_norm": 0.4446672797203064, "learning_rate": 2e-05, "loss": 0.6871, "step": 720 }, { "epoch": 0.04528535980148883, "grad_norm": 0.4434851109981537, "learning_rate": 2e-05, "loss": 0.6584, "step": 730 }, { "epoch": 0.04590570719602978, "grad_norm": 0.5027102828025818, "learning_rate": 2e-05, "loss": 0.6791, "step": 740 }, { "epoch": 0.04652605459057072, "grad_norm": 0.4595511853694916, "learning_rate": 2e-05, "loss": 0.6911, "step": 750 }, { "epoch": 0.04714640198511166, "grad_norm": 0.4787590801715851, "learning_rate": 2e-05, "loss": 0.6868, "step": 760 }, { "epoch": 0.047766749379652605, "grad_norm": 0.4960077106952667, "learning_rate": 2e-05, "loss": 0.6664, "step": 770 }, { "epoch": 0.04838709677419355, "grad_norm": 0.4341469705104828, "learning_rate": 2e-05, "loss": 0.6501, "step": 780 }, { "epoch": 0.04900744416873449, "grad_norm": 0.4147971272468567, "learning_rate": 2e-05, "loss": 0.6439, "step": 790 }, { "epoch": 0.04962779156327544, "grad_norm": 0.4606212377548218, "learning_rate": 2e-05, "loss": 0.6964, "step": 800 }, { "epoch": 0.05024813895781638, "grad_norm": 0.4221757650375366, "learning_rate": 2e-05, "loss": 0.6598, "step": 810 }, { "epoch": 0.05086848635235732, "grad_norm": 0.46451857686042786, "learning_rate": 2e-05, "loss": 0.6503, "step": 820 }, { "epoch": 0.05148883374689826, "grad_norm": 0.4234520196914673, "learning_rate": 2e-05, "loss": 0.6702, "step": 830 }, { "epoch": 0.052109181141439205, "grad_norm": 0.5181183218955994, "learning_rate": 2e-05, "loss": 0.703, "step": 840 }, { "epoch": 0.05272952853598015, "grad_norm": 0.43921777606010437, "learning_rate": 2e-05, "loss": 0.6777, "step": 850 }, { "epoch": 0.05334987593052109, "grad_norm": 0.4488343894481659, "learning_rate": 2e-05, "loss": 0.6661, "step": 860 }, { "epoch": 0.05397022332506204, "grad_norm": 0.45838460326194763, "learning_rate": 2e-05, "loss": 0.6438, "step": 870 }, { "epoch": 0.05459057071960298, "grad_norm": 0.42543938755989075, "learning_rate": 2e-05, "loss": 0.6781, "step": 880 }, { "epoch": 0.05521091811414392, "grad_norm": 0.44000378251075745, "learning_rate": 2e-05, "loss": 0.656, "step": 890 }, { "epoch": 0.05583126550868486, "grad_norm": 0.4415980279445648, "learning_rate": 2e-05, "loss": 0.66, "step": 900 }, { "epoch": 0.056451612903225805, "grad_norm": 0.4455133378505707, "learning_rate": 2e-05, "loss": 0.6633, "step": 910 }, { "epoch": 0.05707196029776675, "grad_norm": 0.44925546646118164, "learning_rate": 2e-05, "loss": 0.6833, "step": 920 }, { "epoch": 0.057692307692307696, "grad_norm": 0.7831513285636902, "learning_rate": 2e-05, "loss": 0.6649, "step": 930 }, { "epoch": 0.05831265508684864, "grad_norm": 0.5281955003738403, "learning_rate": 2e-05, "loss": 0.66, "step": 940 }, { "epoch": 0.05893300248138958, "grad_norm": 0.43578600883483887, "learning_rate": 2e-05, "loss": 0.6886, "step": 950 }, { "epoch": 0.05955334987593052, "grad_norm": 0.43332430720329285, "learning_rate": 2e-05, "loss": 0.6617, "step": 960 }, { "epoch": 0.06017369727047146, "grad_norm": 0.46484294533729553, "learning_rate": 2e-05, "loss": 0.6435, "step": 970 }, { "epoch": 0.060794044665012405, "grad_norm": 0.41882455348968506, "learning_rate": 2e-05, "loss": 0.6602, "step": 980 }, { "epoch": 0.06141439205955335, "grad_norm": 0.4295177757740021, "learning_rate": 2e-05, "loss": 0.6784, "step": 990 }, { "epoch": 0.062034739454094295, "grad_norm": 0.4727322459220886, "learning_rate": 2e-05, "loss": 0.6818, "step": 1000 }, { "epoch": 0.06265508684863523, "grad_norm": 0.430388480424881, "learning_rate": 2e-05, "loss": 0.6579, "step": 1010 }, { "epoch": 0.06327543424317618, "grad_norm": 0.3914746642112732, "learning_rate": 2e-05, "loss": 0.6793, "step": 1020 }, { "epoch": 0.06389578163771713, "grad_norm": 0.4640097916126251, "learning_rate": 2e-05, "loss": 0.6454, "step": 1030 }, { "epoch": 0.06451612903225806, "grad_norm": 0.43572962284088135, "learning_rate": 2e-05, "loss": 0.6644, "step": 1040 }, { "epoch": 0.06513647642679901, "grad_norm": 0.42249470949172974, "learning_rate": 2e-05, "loss": 0.659, "step": 1050 }, { "epoch": 0.06575682382133995, "grad_norm": 0.45737001299858093, "learning_rate": 2e-05, "loss": 0.6563, "step": 1060 }, { "epoch": 0.0663771712158809, "grad_norm": 0.39258211851119995, "learning_rate": 2e-05, "loss": 0.67, "step": 1070 }, { "epoch": 0.06699751861042183, "grad_norm": 0.4379409849643707, "learning_rate": 2e-05, "loss": 0.6729, "step": 1080 }, { "epoch": 0.06761786600496278, "grad_norm": 0.3982328474521637, "learning_rate": 2e-05, "loss": 0.659, "step": 1090 }, { "epoch": 0.06823821339950373, "grad_norm": 0.42903372645378113, "learning_rate": 2e-05, "loss": 0.6594, "step": 1100 }, { "epoch": 0.06885856079404466, "grad_norm": 0.4348221719264984, "learning_rate": 2e-05, "loss": 0.6313, "step": 1110 }, { "epoch": 0.06947890818858561, "grad_norm": 0.43977659940719604, "learning_rate": 2e-05, "loss": 0.7013, "step": 1120 }, { "epoch": 0.07009925558312655, "grad_norm": 0.41244375705718994, "learning_rate": 2e-05, "loss": 0.6474, "step": 1130 }, { "epoch": 0.0707196029776675, "grad_norm": 0.4200294613838196, "learning_rate": 2e-05, "loss": 0.6853, "step": 1140 }, { "epoch": 0.07133995037220843, "grad_norm": 0.4071672856807709, "learning_rate": 2e-05, "loss": 0.6773, "step": 1150 }, { "epoch": 0.07196029776674938, "grad_norm": 0.4591241776943207, "learning_rate": 2e-05, "loss": 0.6901, "step": 1160 }, { "epoch": 0.07258064516129033, "grad_norm": 0.4510512948036194, "learning_rate": 2e-05, "loss": 0.6751, "step": 1170 }, { "epoch": 0.07320099255583126, "grad_norm": 0.4550836980342865, "learning_rate": 2e-05, "loss": 0.6745, "step": 1180 }, { "epoch": 0.07382133995037221, "grad_norm": 0.42455634474754333, "learning_rate": 2e-05, "loss": 0.6852, "step": 1190 }, { "epoch": 0.07444168734491315, "grad_norm": 0.4288151264190674, "learning_rate": 2e-05, "loss": 0.6362, "step": 1200 }, { "epoch": 0.0750620347394541, "grad_norm": 0.41488656401634216, "learning_rate": 2e-05, "loss": 0.6555, "step": 1210 }, { "epoch": 0.07568238213399504, "grad_norm": 0.41888904571533203, "learning_rate": 2e-05, "loss": 0.6405, "step": 1220 }, { "epoch": 0.07630272952853598, "grad_norm": 0.42407098412513733, "learning_rate": 2e-05, "loss": 0.6869, "step": 1230 }, { "epoch": 0.07692307692307693, "grad_norm": 0.43882668018341064, "learning_rate": 2e-05, "loss": 0.6697, "step": 1240 }, { "epoch": 0.07754342431761786, "grad_norm": 0.463724285364151, "learning_rate": 2e-05, "loss": 0.6606, "step": 1250 }, { "epoch": 0.07816377171215881, "grad_norm": 0.4122724235057831, "learning_rate": 2e-05, "loss": 0.683, "step": 1260 }, { "epoch": 0.07878411910669975, "grad_norm": 0.4170853793621063, "learning_rate": 2e-05, "loss": 0.6469, "step": 1270 }, { "epoch": 0.0794044665012407, "grad_norm": 0.41887524724006653, "learning_rate": 2e-05, "loss": 0.6613, "step": 1280 }, { "epoch": 0.08002481389578164, "grad_norm": 0.5110520720481873, "learning_rate": 2e-05, "loss": 0.6481, "step": 1290 }, { "epoch": 0.08064516129032258, "grad_norm": 0.5727337002754211, "learning_rate": 2e-05, "loss": 0.6602, "step": 1300 }, { "epoch": 0.08126550868486353, "grad_norm": 0.45020315051078796, "learning_rate": 2e-05, "loss": 0.6905, "step": 1310 }, { "epoch": 0.08188585607940446, "grad_norm": 0.41866007447242737, "learning_rate": 2e-05, "loss": 0.6458, "step": 1320 }, { "epoch": 0.08250620347394541, "grad_norm": 0.4124995768070221, "learning_rate": 2e-05, "loss": 0.6476, "step": 1330 }, { "epoch": 0.08312655086848635, "grad_norm": 0.45238474011421204, "learning_rate": 2e-05, "loss": 0.6722, "step": 1340 }, { "epoch": 0.0837468982630273, "grad_norm": 0.44636914134025574, "learning_rate": 2e-05, "loss": 0.6828, "step": 1350 }, { "epoch": 0.08436724565756824, "grad_norm": 0.42632195353507996, "learning_rate": 2e-05, "loss": 0.6974, "step": 1360 }, { "epoch": 0.08498759305210918, "grad_norm": 0.4126355051994324, "learning_rate": 2e-05, "loss": 0.6542, "step": 1370 }, { "epoch": 0.08560794044665013, "grad_norm": 0.4650143086910248, "learning_rate": 2e-05, "loss": 0.6402, "step": 1380 }, { "epoch": 0.08622828784119106, "grad_norm": 0.4254385530948639, "learning_rate": 2e-05, "loss": 0.6196, "step": 1390 }, { "epoch": 0.08684863523573201, "grad_norm": 0.5174993872642517, "learning_rate": 2e-05, "loss": 0.6566, "step": 1400 }, { "epoch": 0.08746898263027296, "grad_norm": 0.4466327428817749, "learning_rate": 2e-05, "loss": 0.6777, "step": 1410 }, { "epoch": 0.0880893300248139, "grad_norm": 0.4639355540275574, "learning_rate": 2e-05, "loss": 0.6518, "step": 1420 }, { "epoch": 0.08870967741935484, "grad_norm": 0.49918368458747864, "learning_rate": 2e-05, "loss": 0.666, "step": 1430 }, { "epoch": 0.08933002481389578, "grad_norm": 0.45220839977264404, "learning_rate": 2e-05, "loss": 0.6626, "step": 1440 }, { "epoch": 0.08995037220843673, "grad_norm": 0.40696123242378235, "learning_rate": 2e-05, "loss": 0.6591, "step": 1450 }, { "epoch": 0.09057071960297766, "grad_norm": 0.42498070001602173, "learning_rate": 2e-05, "loss": 0.6532, "step": 1460 }, { "epoch": 0.09119106699751861, "grad_norm": 0.4117129147052765, "learning_rate": 2e-05, "loss": 0.6272, "step": 1470 }, { "epoch": 0.09181141439205956, "grad_norm": 0.4506339132785797, "learning_rate": 2e-05, "loss": 0.6609, "step": 1480 }, { "epoch": 0.0924317617866005, "grad_norm": 0.40215933322906494, "learning_rate": 2e-05, "loss": 0.6653, "step": 1490 }, { "epoch": 0.09305210918114144, "grad_norm": 0.4949316382408142, "learning_rate": 2e-05, "loss": 0.6583, "step": 1500 }, { "epoch": 0.09367245657568238, "grad_norm": 0.45883846282958984, "learning_rate": 2e-05, "loss": 0.6553, "step": 1510 }, { "epoch": 0.09429280397022333, "grad_norm": 0.41736656427383423, "learning_rate": 2e-05, "loss": 0.6727, "step": 1520 }, { "epoch": 0.09491315136476426, "grad_norm": 0.45958396792411804, "learning_rate": 2e-05, "loss": 0.6402, "step": 1530 }, { "epoch": 0.09553349875930521, "grad_norm": 0.41696447134017944, "learning_rate": 2e-05, "loss": 0.669, "step": 1540 }, { "epoch": 0.09615384615384616, "grad_norm": 0.45699238777160645, "learning_rate": 2e-05, "loss": 0.6421, "step": 1550 }, { "epoch": 0.0967741935483871, "grad_norm": 0.46844539046287537, "learning_rate": 2e-05, "loss": 0.6628, "step": 1560 }, { "epoch": 0.09739454094292804, "grad_norm": 0.4296782612800598, "learning_rate": 2e-05, "loss": 0.6468, "step": 1570 }, { "epoch": 0.09801488833746898, "grad_norm": 0.43794864416122437, "learning_rate": 2e-05, "loss": 0.6708, "step": 1580 }, { "epoch": 0.09863523573200993, "grad_norm": 0.4485463500022888, "learning_rate": 2e-05, "loss": 0.6537, "step": 1590 }, { "epoch": 0.09925558312655088, "grad_norm": 0.44051381945610046, "learning_rate": 2e-05, "loss": 0.6378, "step": 1600 }, { "epoch": 0.09987593052109181, "grad_norm": 0.44119101762771606, "learning_rate": 2e-05, "loss": 0.6503, "step": 1610 }, { "epoch": 0.10049627791563276, "grad_norm": 0.4515126049518585, "learning_rate": 2e-05, "loss": 0.6647, "step": 1620 }, { "epoch": 0.1011166253101737, "grad_norm": 0.4214085042476654, "learning_rate": 2e-05, "loss": 0.6483, "step": 1630 }, { "epoch": 0.10173697270471464, "grad_norm": 0.4193068742752075, "learning_rate": 2e-05, "loss": 0.6685, "step": 1640 }, { "epoch": 0.10235732009925558, "grad_norm": 0.4890860319137573, "learning_rate": 2e-05, "loss": 0.6529, "step": 1650 }, { "epoch": 0.10297766749379653, "grad_norm": 0.5013541579246521, "learning_rate": 2e-05, "loss": 0.7078, "step": 1660 }, { "epoch": 0.10359801488833748, "grad_norm": 0.4772087335586548, "learning_rate": 2e-05, "loss": 0.6574, "step": 1670 }, { "epoch": 0.10421836228287841, "grad_norm": 0.5918506979942322, "learning_rate": 2e-05, "loss": 0.6668, "step": 1680 }, { "epoch": 0.10483870967741936, "grad_norm": 0.42867156863212585, "learning_rate": 2e-05, "loss": 0.6556, "step": 1690 }, { "epoch": 0.1054590570719603, "grad_norm": 0.4230250418186188, "learning_rate": 2e-05, "loss": 0.6564, "step": 1700 }, { "epoch": 0.10607940446650124, "grad_norm": 0.4046623110771179, "learning_rate": 2e-05, "loss": 0.6691, "step": 1710 }, { "epoch": 0.10669975186104218, "grad_norm": 0.4210417568683624, "learning_rate": 2e-05, "loss": 0.6675, "step": 1720 }, { "epoch": 0.10732009925558313, "grad_norm": 0.4010581970214844, "learning_rate": 2e-05, "loss": 0.6402, "step": 1730 }, { "epoch": 0.10794044665012408, "grad_norm": 0.4336850643157959, "learning_rate": 2e-05, "loss": 0.6568, "step": 1740 }, { "epoch": 0.10856079404466501, "grad_norm": 0.43575379252433777, "learning_rate": 2e-05, "loss": 0.6493, "step": 1750 }, { "epoch": 0.10918114143920596, "grad_norm": 0.42740049958229065, "learning_rate": 2e-05, "loss": 0.6571, "step": 1760 }, { "epoch": 0.1098014888337469, "grad_norm": 0.4169295132160187, "learning_rate": 2e-05, "loss": 0.6611, "step": 1770 }, { "epoch": 0.11042183622828784, "grad_norm": 0.5564378499984741, "learning_rate": 2e-05, "loss": 0.6532, "step": 1780 }, { "epoch": 0.11104218362282878, "grad_norm": 0.45990580320358276, "learning_rate": 2e-05, "loss": 0.6262, "step": 1790 }, { "epoch": 0.11166253101736973, "grad_norm": 0.4232894778251648, "learning_rate": 2e-05, "loss": 0.6729, "step": 1800 }, { "epoch": 0.11228287841191067, "grad_norm": 0.49535107612609863, "learning_rate": 2e-05, "loss": 0.6808, "step": 1810 }, { "epoch": 0.11290322580645161, "grad_norm": 0.4231373965740204, "learning_rate": 2e-05, "loss": 0.6731, "step": 1820 }, { "epoch": 0.11352357320099256, "grad_norm": 0.42381367087364197, "learning_rate": 2e-05, "loss": 0.6672, "step": 1830 }, { "epoch": 0.1141439205955335, "grad_norm": 0.40873488783836365, "learning_rate": 2e-05, "loss": 0.6471, "step": 1840 }, { "epoch": 0.11476426799007444, "grad_norm": 0.4330880641937256, "learning_rate": 2e-05, "loss": 0.6653, "step": 1850 }, { "epoch": 0.11538461538461539, "grad_norm": 0.47087201476097107, "learning_rate": 2e-05, "loss": 0.6865, "step": 1860 }, { "epoch": 0.11600496277915633, "grad_norm": 0.49161598086357117, "learning_rate": 2e-05, "loss": 0.6625, "step": 1870 }, { "epoch": 0.11662531017369727, "grad_norm": 0.40995311737060547, "learning_rate": 2e-05, "loss": 0.6421, "step": 1880 }, { "epoch": 0.11724565756823821, "grad_norm": 0.40415555238723755, "learning_rate": 2e-05, "loss": 0.6407, "step": 1890 }, { "epoch": 0.11786600496277916, "grad_norm": 0.42309048771858215, "learning_rate": 2e-05, "loss": 0.6524, "step": 1900 }, { "epoch": 0.1184863523573201, "grad_norm": 0.428654283285141, "learning_rate": 2e-05, "loss": 0.6473, "step": 1910 }, { "epoch": 0.11910669975186104, "grad_norm": 0.46681228280067444, "learning_rate": 2e-05, "loss": 0.665, "step": 1920 }, { "epoch": 0.11972704714640199, "grad_norm": 0.5378752946853638, "learning_rate": 2e-05, "loss": 0.6888, "step": 1930 }, { "epoch": 0.12034739454094293, "grad_norm": 0.3942810297012329, "learning_rate": 2e-05, "loss": 0.6693, "step": 1940 }, { "epoch": 0.12096774193548387, "grad_norm": 0.40872716903686523, "learning_rate": 2e-05, "loss": 0.6564, "step": 1950 }, { "epoch": 0.12158808933002481, "grad_norm": 0.4505879580974579, "learning_rate": 2e-05, "loss": 0.6651, "step": 1960 }, { "epoch": 0.12220843672456576, "grad_norm": 0.46347737312316895, "learning_rate": 2e-05, "loss": 0.6682, "step": 1970 }, { "epoch": 0.1228287841191067, "grad_norm": 0.4220800995826721, "learning_rate": 2e-05, "loss": 0.6633, "step": 1980 }, { "epoch": 0.12344913151364764, "grad_norm": 0.39984744787216187, "learning_rate": 2e-05, "loss": 0.6379, "step": 1990 }, { "epoch": 0.12406947890818859, "grad_norm": 0.42455461621284485, "learning_rate": 2e-05, "loss": 0.6442, "step": 2000 }, { "epoch": 0.12468982630272953, "grad_norm": 0.4262460768222809, "learning_rate": 2e-05, "loss": 0.6385, "step": 2010 }, { "epoch": 0.12531017369727046, "grad_norm": 0.42343422770500183, "learning_rate": 2e-05, "loss": 0.6541, "step": 2020 }, { "epoch": 0.1259305210918114, "grad_norm": 0.4029340147972107, "learning_rate": 2e-05, "loss": 0.6776, "step": 2030 }, { "epoch": 0.12655086848635236, "grad_norm": 0.44888031482696533, "learning_rate": 2e-05, "loss": 0.6232, "step": 2040 }, { "epoch": 0.1271712158808933, "grad_norm": 0.4395098388195038, "learning_rate": 2e-05, "loss": 0.6447, "step": 2050 }, { "epoch": 0.12779156327543426, "grad_norm": 0.40587204694747925, "learning_rate": 2e-05, "loss": 0.6616, "step": 2060 }, { "epoch": 0.12841191066997518, "grad_norm": 0.4486628472805023, "learning_rate": 2e-05, "loss": 0.6639, "step": 2070 }, { "epoch": 0.12903225806451613, "grad_norm": 0.4576110243797302, "learning_rate": 2e-05, "loss": 0.6597, "step": 2080 }, { "epoch": 0.12965260545905707, "grad_norm": 0.4019532799720764, "learning_rate": 2e-05, "loss": 0.6469, "step": 2090 }, { "epoch": 0.13027295285359802, "grad_norm": 0.43723776936531067, "learning_rate": 2e-05, "loss": 0.6332, "step": 2100 }, { "epoch": 0.13089330024813894, "grad_norm": 0.40787678956985474, "learning_rate": 2e-05, "loss": 0.6356, "step": 2110 }, { "epoch": 0.1315136476426799, "grad_norm": 0.4124930799007416, "learning_rate": 2e-05, "loss": 0.6523, "step": 2120 }, { "epoch": 0.13213399503722084, "grad_norm": 0.4150378108024597, "learning_rate": 2e-05, "loss": 0.6694, "step": 2130 }, { "epoch": 0.1327543424317618, "grad_norm": 0.41935351490974426, "learning_rate": 2e-05, "loss": 0.6745, "step": 2140 }, { "epoch": 0.13337468982630274, "grad_norm": 0.6122373938560486, "learning_rate": 2e-05, "loss": 0.6566, "step": 2150 }, { "epoch": 0.13399503722084366, "grad_norm": 0.518964409828186, "learning_rate": 2e-05, "loss": 0.6281, "step": 2160 }, { "epoch": 0.1346153846153846, "grad_norm": 0.45327648520469666, "learning_rate": 2e-05, "loss": 0.6431, "step": 2170 }, { "epoch": 0.13523573200992556, "grad_norm": 0.41766470670700073, "learning_rate": 2e-05, "loss": 0.6707, "step": 2180 }, { "epoch": 0.1358560794044665, "grad_norm": 0.43843910098075867, "learning_rate": 2e-05, "loss": 0.6698, "step": 2190 }, { "epoch": 0.13647642679900746, "grad_norm": 0.5084978342056274, "learning_rate": 2e-05, "loss": 0.6347, "step": 2200 }, { "epoch": 0.13709677419354838, "grad_norm": 0.4238511919975281, "learning_rate": 2e-05, "loss": 0.6459, "step": 2210 }, { "epoch": 0.13771712158808933, "grad_norm": 0.4075576961040497, "learning_rate": 2e-05, "loss": 0.6248, "step": 2220 }, { "epoch": 0.13833746898263027, "grad_norm": 0.4354841411113739, "learning_rate": 2e-05, "loss": 0.6718, "step": 2230 }, { "epoch": 0.13895781637717122, "grad_norm": 0.5108729004859924, "learning_rate": 2e-05, "loss": 0.6477, "step": 2240 }, { "epoch": 0.13957816377171217, "grad_norm": 0.4199222922325134, "learning_rate": 2e-05, "loss": 0.6543, "step": 2250 }, { "epoch": 0.1401985111662531, "grad_norm": 0.4035865068435669, "learning_rate": 2e-05, "loss": 0.6269, "step": 2260 }, { "epoch": 0.14081885856079404, "grad_norm": 0.4430849254131317, "learning_rate": 2e-05, "loss": 0.626, "step": 2270 }, { "epoch": 0.141439205955335, "grad_norm": 0.4501071274280548, "learning_rate": 2e-05, "loss": 0.6373, "step": 2280 }, { "epoch": 0.14205955334987594, "grad_norm": 0.47260135412216187, "learning_rate": 2e-05, "loss": 0.6503, "step": 2290 }, { "epoch": 0.14267990074441686, "grad_norm": 0.3968529999256134, "learning_rate": 2e-05, "loss": 0.6401, "step": 2300 }, { "epoch": 0.1433002481389578, "grad_norm": 0.41558271646499634, "learning_rate": 2e-05, "loss": 0.6624, "step": 2310 }, { "epoch": 0.14392059553349876, "grad_norm": 0.46250858902931213, "learning_rate": 2e-05, "loss": 0.6678, "step": 2320 }, { "epoch": 0.1445409429280397, "grad_norm": 0.40959519147872925, "learning_rate": 2e-05, "loss": 0.6381, "step": 2330 }, { "epoch": 0.14516129032258066, "grad_norm": 0.431772917509079, "learning_rate": 2e-05, "loss": 0.6485, "step": 2340 }, { "epoch": 0.14578163771712158, "grad_norm": 0.42857933044433594, "learning_rate": 2e-05, "loss": 0.6469, "step": 2350 }, { "epoch": 0.14640198511166252, "grad_norm": 0.4006024897098541, "learning_rate": 2e-05, "loss": 0.6752, "step": 2360 }, { "epoch": 0.14702233250620347, "grad_norm": 0.4340827763080597, "learning_rate": 2e-05, "loss": 0.6407, "step": 2370 }, { "epoch": 0.14764267990074442, "grad_norm": 0.43578338623046875, "learning_rate": 2e-05, "loss": 0.6463, "step": 2380 }, { "epoch": 0.14826302729528537, "grad_norm": 0.4057551920413971, "learning_rate": 2e-05, "loss": 0.6295, "step": 2390 }, { "epoch": 0.1488833746898263, "grad_norm": 0.405994713306427, "learning_rate": 2e-05, "loss": 0.6639, "step": 2400 }, { "epoch": 0.14950372208436724, "grad_norm": 0.4021854102611542, "learning_rate": 2e-05, "loss": 0.6542, "step": 2410 }, { "epoch": 0.1501240694789082, "grad_norm": 0.4120284914970398, "learning_rate": 2e-05, "loss": 0.6456, "step": 2420 }, { "epoch": 0.15074441687344914, "grad_norm": 0.4367629289627075, "learning_rate": 2e-05, "loss": 0.6334, "step": 2430 }, { "epoch": 0.1513647642679901, "grad_norm": 0.39025968313217163, "learning_rate": 2e-05, "loss": 0.634, "step": 2440 }, { "epoch": 0.151985111662531, "grad_norm": 0.44010090827941895, "learning_rate": 2e-05, "loss": 0.6346, "step": 2450 }, { "epoch": 0.15260545905707196, "grad_norm": 0.4358943998813629, "learning_rate": 2e-05, "loss": 0.6556, "step": 2460 }, { "epoch": 0.1532258064516129, "grad_norm": 0.40464046597480774, "learning_rate": 2e-05, "loss": 0.6405, "step": 2470 }, { "epoch": 0.15384615384615385, "grad_norm": 0.43297019600868225, "learning_rate": 2e-05, "loss": 0.6618, "step": 2480 }, { "epoch": 0.15446650124069478, "grad_norm": 0.37946197390556335, "learning_rate": 2e-05, "loss": 0.6338, "step": 2490 }, { "epoch": 0.15508684863523572, "grad_norm": 0.44986578822135925, "learning_rate": 2e-05, "loss": 0.6654, "step": 2500 }, { "epoch": 0.15570719602977667, "grad_norm": 0.40377217531204224, "learning_rate": 2e-05, "loss": 0.6261, "step": 2510 }, { "epoch": 0.15632754342431762, "grad_norm": 0.4069921374320984, "learning_rate": 2e-05, "loss": 0.6543, "step": 2520 }, { "epoch": 0.15694789081885857, "grad_norm": 0.3909223675727844, "learning_rate": 2e-05, "loss": 0.6449, "step": 2530 }, { "epoch": 0.1575682382133995, "grad_norm": 0.37389710545539856, "learning_rate": 2e-05, "loss": 0.6352, "step": 2540 }, { "epoch": 0.15818858560794044, "grad_norm": 0.4050366282463074, "learning_rate": 2e-05, "loss": 0.6554, "step": 2550 }, { "epoch": 0.1588089330024814, "grad_norm": 0.41864311695098877, "learning_rate": 2e-05, "loss": 0.6403, "step": 2560 }, { "epoch": 0.15942928039702234, "grad_norm": 0.404889315366745, "learning_rate": 2e-05, "loss": 0.6523, "step": 2570 }, { "epoch": 0.1600496277915633, "grad_norm": 0.480149507522583, "learning_rate": 2e-05, "loss": 0.6254, "step": 2580 }, { "epoch": 0.1606699751861042, "grad_norm": 0.41777101159095764, "learning_rate": 2e-05, "loss": 0.6392, "step": 2590 }, { "epoch": 0.16129032258064516, "grad_norm": 0.41992273926734924, "learning_rate": 2e-05, "loss": 0.6283, "step": 2600 }, { "epoch": 0.1619106699751861, "grad_norm": 0.3978483974933624, "learning_rate": 2e-05, "loss": 0.6415, "step": 2610 }, { "epoch": 0.16253101736972705, "grad_norm": 0.4051460027694702, "learning_rate": 2e-05, "loss": 0.6325, "step": 2620 }, { "epoch": 0.163151364764268, "grad_norm": 0.38797181844711304, "learning_rate": 2e-05, "loss": 0.6538, "step": 2630 }, { "epoch": 0.16377171215880892, "grad_norm": 0.4264223575592041, "learning_rate": 2e-05, "loss": 0.6079, "step": 2640 }, { "epoch": 0.16439205955334987, "grad_norm": 0.6309807300567627, "learning_rate": 2e-05, "loss": 0.6443, "step": 2650 }, { "epoch": 0.16501240694789082, "grad_norm": 0.4043954610824585, "learning_rate": 2e-05, "loss": 0.6587, "step": 2660 }, { "epoch": 0.16563275434243177, "grad_norm": 0.433071106672287, "learning_rate": 2e-05, "loss": 0.6458, "step": 2670 }, { "epoch": 0.1662531017369727, "grad_norm": 0.43372464179992676, "learning_rate": 2e-05, "loss": 0.6228, "step": 2680 }, { "epoch": 0.16687344913151364, "grad_norm": 0.4626196324825287, "learning_rate": 2e-05, "loss": 0.6406, "step": 2690 }, { "epoch": 0.1674937965260546, "grad_norm": 0.379689484834671, "learning_rate": 2e-05, "loss": 0.6368, "step": 2700 }, { "epoch": 0.16811414392059554, "grad_norm": 0.43384963274002075, "learning_rate": 2e-05, "loss": 0.6421, "step": 2710 }, { "epoch": 0.1687344913151365, "grad_norm": 0.5025782585144043, "learning_rate": 2e-05, "loss": 0.6644, "step": 2720 }, { "epoch": 0.1693548387096774, "grad_norm": 0.398337185382843, "learning_rate": 2e-05, "loss": 0.6242, "step": 2730 }, { "epoch": 0.16997518610421836, "grad_norm": 0.4152053892612457, "learning_rate": 2e-05, "loss": 0.674, "step": 2740 }, { "epoch": 0.1705955334987593, "grad_norm": 0.40534213185310364, "learning_rate": 2e-05, "loss": 0.6372, "step": 2750 }, { "epoch": 0.17121588089330025, "grad_norm": 0.44497600197792053, "learning_rate": 2e-05, "loss": 0.6453, "step": 2760 }, { "epoch": 0.1718362282878412, "grad_norm": 0.4441177546977997, "learning_rate": 2e-05, "loss": 0.6467, "step": 2770 }, { "epoch": 0.17245657568238212, "grad_norm": 0.39838549494743347, "learning_rate": 2e-05, "loss": 0.6359, "step": 2780 }, { "epoch": 0.17307692307692307, "grad_norm": 0.6976585984230042, "learning_rate": 2e-05, "loss": 0.6335, "step": 2790 }, { "epoch": 0.17369727047146402, "grad_norm": 0.48044341802597046, "learning_rate": 2e-05, "loss": 0.6604, "step": 2800 }, { "epoch": 0.17431761786600497, "grad_norm": 0.3987114131450653, "learning_rate": 2e-05, "loss": 0.6348, "step": 2810 }, { "epoch": 0.17493796526054592, "grad_norm": 0.37417376041412354, "learning_rate": 2e-05, "loss": 0.6302, "step": 2820 }, { "epoch": 0.17555831265508684, "grad_norm": 0.4066050946712494, "learning_rate": 2e-05, "loss": 0.6319, "step": 2830 }, { "epoch": 0.1761786600496278, "grad_norm": 0.45394909381866455, "learning_rate": 2e-05, "loss": 0.6278, "step": 2840 }, { "epoch": 0.17679900744416874, "grad_norm": 0.414578378200531, "learning_rate": 2e-05, "loss": 0.6317, "step": 2850 }, { "epoch": 0.1774193548387097, "grad_norm": 0.4722119867801666, "learning_rate": 2e-05, "loss": 0.622, "step": 2860 }, { "epoch": 0.1780397022332506, "grad_norm": 0.42602238059043884, "learning_rate": 2e-05, "loss": 0.6631, "step": 2870 }, { "epoch": 0.17866004962779156, "grad_norm": 0.43522897362709045, "learning_rate": 2e-05, "loss": 0.6288, "step": 2880 }, { "epoch": 0.1792803970223325, "grad_norm": 0.4144858121871948, "learning_rate": 2e-05, "loss": 0.6401, "step": 2890 }, { "epoch": 0.17990074441687345, "grad_norm": 0.4240042567253113, "learning_rate": 2e-05, "loss": 0.6183, "step": 2900 }, { "epoch": 0.1805210918114144, "grad_norm": 0.4313690662384033, "learning_rate": 2e-05, "loss": 0.6233, "step": 2910 }, { "epoch": 0.18114143920595532, "grad_norm": 0.40647462010383606, "learning_rate": 2e-05, "loss": 0.6423, "step": 2920 }, { "epoch": 0.18176178660049627, "grad_norm": 0.40608322620391846, "learning_rate": 2e-05, "loss": 0.6345, "step": 2930 }, { "epoch": 0.18238213399503722, "grad_norm": 0.5110368132591248, "learning_rate": 2e-05, "loss": 0.6505, "step": 2940 }, { "epoch": 0.18300248138957817, "grad_norm": 1.3996773958206177, "learning_rate": 2e-05, "loss": 0.6334, "step": 2950 }, { "epoch": 0.18362282878411912, "grad_norm": 0.4118184745311737, "learning_rate": 2e-05, "loss": 0.6325, "step": 2960 }, { "epoch": 0.18424317617866004, "grad_norm": 0.4443102777004242, "learning_rate": 2e-05, "loss": 0.6667, "step": 2970 }, { "epoch": 0.184863523573201, "grad_norm": 0.39859694242477417, "learning_rate": 2e-05, "loss": 0.6389, "step": 2980 }, { "epoch": 0.18548387096774194, "grad_norm": 0.42832204699516296, "learning_rate": 2e-05, "loss": 0.6789, "step": 2990 }, { "epoch": 0.18610421836228289, "grad_norm": 0.43463531136512756, "learning_rate": 2e-05, "loss": 0.6296, "step": 3000 }, { "epoch": 0.18672456575682383, "grad_norm": 0.441102534532547, "learning_rate": 2e-05, "loss": 0.6127, "step": 3010 }, { "epoch": 0.18734491315136476, "grad_norm": 0.419390469789505, "learning_rate": 2e-05, "loss": 0.6483, "step": 3020 }, { "epoch": 0.1879652605459057, "grad_norm": 0.41196301579475403, "learning_rate": 2e-05, "loss": 0.6404, "step": 3030 }, { "epoch": 0.18858560794044665, "grad_norm": 0.3819664418697357, "learning_rate": 2e-05, "loss": 0.6516, "step": 3040 }, { "epoch": 0.1892059553349876, "grad_norm": 0.40153929591178894, "learning_rate": 2e-05, "loss": 0.6237, "step": 3050 }, { "epoch": 0.18982630272952852, "grad_norm": 0.4139013886451721, "learning_rate": 2e-05, "loss": 0.6392, "step": 3060 }, { "epoch": 0.19044665012406947, "grad_norm": 0.40049391984939575, "learning_rate": 2e-05, "loss": 0.6432, "step": 3070 }, { "epoch": 0.19106699751861042, "grad_norm": 0.4137687385082245, "learning_rate": 2e-05, "loss": 0.6211, "step": 3080 }, { "epoch": 0.19168734491315137, "grad_norm": 0.43249863386154175, "learning_rate": 2e-05, "loss": 0.6478, "step": 3090 }, { "epoch": 0.19230769230769232, "grad_norm": 0.4651578664779663, "learning_rate": 2e-05, "loss": 0.643, "step": 3100 }, { "epoch": 0.19292803970223324, "grad_norm": 0.44925519824028015, "learning_rate": 2e-05, "loss": 0.6378, "step": 3110 }, { "epoch": 0.1935483870967742, "grad_norm": 0.38708093762397766, "learning_rate": 2e-05, "loss": 0.6335, "step": 3120 }, { "epoch": 0.19416873449131514, "grad_norm": 0.42161768674850464, "learning_rate": 2e-05, "loss": 0.6569, "step": 3130 }, { "epoch": 0.19478908188585609, "grad_norm": 0.6364923119544983, "learning_rate": 2e-05, "loss": 0.617, "step": 3140 }, { "epoch": 0.19540942928039703, "grad_norm": 0.43241891264915466, "learning_rate": 2e-05, "loss": 0.6428, "step": 3150 }, { "epoch": 0.19602977667493796, "grad_norm": 0.41662028431892395, "learning_rate": 2e-05, "loss": 0.6495, "step": 3160 }, { "epoch": 0.1966501240694789, "grad_norm": 0.4269491732120514, "learning_rate": 2e-05, "loss": 0.6473, "step": 3170 }, { "epoch": 0.19727047146401985, "grad_norm": 0.412458211183548, "learning_rate": 2e-05, "loss": 0.6477, "step": 3180 }, { "epoch": 0.1978908188585608, "grad_norm": 0.43503549695014954, "learning_rate": 2e-05, "loss": 0.6629, "step": 3190 }, { "epoch": 0.19851116625310175, "grad_norm": 0.41298508644104004, "learning_rate": 2e-05, "loss": 0.6117, "step": 3200 }, { "epoch": 0.19913151364764267, "grad_norm": 0.3883150815963745, "learning_rate": 2e-05, "loss": 0.628, "step": 3210 }, { "epoch": 0.19975186104218362, "grad_norm": 0.4110269248485565, "learning_rate": 2e-05, "loss": 0.6373, "step": 3220 }, { "epoch": 0.20037220843672457, "grad_norm": 0.4852235019207001, "learning_rate": 2e-05, "loss": 0.6269, "step": 3230 }, { "epoch": 0.20099255583126552, "grad_norm": 0.3968954384326935, "learning_rate": 2e-05, "loss": 0.6461, "step": 3240 }, { "epoch": 0.20161290322580644, "grad_norm": 0.45685458183288574, "learning_rate": 2e-05, "loss": 0.648, "step": 3250 }, { "epoch": 0.2022332506203474, "grad_norm": 0.40747106075286865, "learning_rate": 2e-05, "loss": 0.6546, "step": 3260 }, { "epoch": 0.20285359801488834, "grad_norm": 0.3848201632499695, "learning_rate": 2e-05, "loss": 0.6281, "step": 3270 }, { "epoch": 0.20347394540942929, "grad_norm": 0.38959604501724243, "learning_rate": 2e-05, "loss": 0.6208, "step": 3280 }, { "epoch": 0.20409429280397023, "grad_norm": 0.4149569571018219, "learning_rate": 2e-05, "loss": 0.6293, "step": 3290 }, { "epoch": 0.20471464019851116, "grad_norm": 0.46731993556022644, "learning_rate": 2e-05, "loss": 0.6641, "step": 3300 }, { "epoch": 0.2053349875930521, "grad_norm": 0.4299260675907135, "learning_rate": 2e-05, "loss": 0.6057, "step": 3310 }, { "epoch": 0.20595533498759305, "grad_norm": 0.4170496463775635, "learning_rate": 2e-05, "loss": 0.6457, "step": 3320 }, { "epoch": 0.206575682382134, "grad_norm": 0.43017125129699707, "learning_rate": 2e-05, "loss": 0.6224, "step": 3330 }, { "epoch": 0.20719602977667495, "grad_norm": 0.39833810925483704, "learning_rate": 2e-05, "loss": 0.6397, "step": 3340 }, { "epoch": 0.20781637717121587, "grad_norm": 0.4055391848087311, "learning_rate": 2e-05, "loss": 0.6209, "step": 3350 }, { "epoch": 0.20843672456575682, "grad_norm": 0.4533246159553528, "learning_rate": 2e-05, "loss": 0.6224, "step": 3360 }, { "epoch": 0.20905707196029777, "grad_norm": 0.3952649235725403, "learning_rate": 2e-05, "loss": 0.6493, "step": 3370 }, { "epoch": 0.20967741935483872, "grad_norm": 0.4192732870578766, "learning_rate": 2e-05, "loss": 0.6293, "step": 3380 }, { "epoch": 0.21029776674937964, "grad_norm": 0.40987828373908997, "learning_rate": 2e-05, "loss": 0.6222, "step": 3390 }, { "epoch": 0.2109181141439206, "grad_norm": 0.41994917392730713, "learning_rate": 2e-05, "loss": 0.6556, "step": 3400 }, { "epoch": 0.21153846153846154, "grad_norm": 0.42132651805877686, "learning_rate": 2e-05, "loss": 0.6443, "step": 3410 }, { "epoch": 0.21215880893300249, "grad_norm": 0.4320928156375885, "learning_rate": 2e-05, "loss": 0.6461, "step": 3420 }, { "epoch": 0.21277915632754343, "grad_norm": 0.435435950756073, "learning_rate": 2e-05, "loss": 0.6255, "step": 3430 }, { "epoch": 0.21339950372208435, "grad_norm": 0.41047704219818115, "learning_rate": 2e-05, "loss": 0.6422, "step": 3440 }, { "epoch": 0.2140198511166253, "grad_norm": 0.3944700062274933, "learning_rate": 2e-05, "loss": 0.621, "step": 3450 }, { "epoch": 0.21464019851116625, "grad_norm": 0.42940741777420044, "learning_rate": 2e-05, "loss": 0.6196, "step": 3460 }, { "epoch": 0.2152605459057072, "grad_norm": 0.3980760872364044, "learning_rate": 2e-05, "loss": 0.6412, "step": 3470 }, { "epoch": 0.21588089330024815, "grad_norm": 0.39118990302085876, "learning_rate": 2e-05, "loss": 0.6249, "step": 3480 }, { "epoch": 0.21650124069478907, "grad_norm": 0.44674456119537354, "learning_rate": 2e-05, "loss": 0.6394, "step": 3490 }, { "epoch": 0.21712158808933002, "grad_norm": 0.42848122119903564, "learning_rate": 2e-05, "loss": 0.6354, "step": 3500 }, { "epoch": 0.21774193548387097, "grad_norm": 0.44583410024642944, "learning_rate": 2e-05, "loss": 0.6453, "step": 3510 }, { "epoch": 0.21836228287841192, "grad_norm": 0.44389545917510986, "learning_rate": 2e-05, "loss": 0.6652, "step": 3520 }, { "epoch": 0.21898263027295287, "grad_norm": 0.38134288787841797, "learning_rate": 2e-05, "loss": 0.6203, "step": 3530 }, { "epoch": 0.2196029776674938, "grad_norm": 0.4165913462638855, "learning_rate": 2e-05, "loss": 0.643, "step": 3540 }, { "epoch": 0.22022332506203474, "grad_norm": 0.4155155420303345, "learning_rate": 2e-05, "loss": 0.6491, "step": 3550 }, { "epoch": 0.22084367245657568, "grad_norm": 0.390639066696167, "learning_rate": 2e-05, "loss": 0.6182, "step": 3560 }, { "epoch": 0.22146401985111663, "grad_norm": 0.43849295377731323, "learning_rate": 2e-05, "loss": 0.6379, "step": 3570 }, { "epoch": 0.22208436724565755, "grad_norm": 0.3993423283100128, "learning_rate": 2e-05, "loss": 0.6588, "step": 3580 }, { "epoch": 0.2227047146401985, "grad_norm": 0.4390069246292114, "learning_rate": 2e-05, "loss": 0.6071, "step": 3590 }, { "epoch": 0.22332506203473945, "grad_norm": 0.37074384093284607, "learning_rate": 2e-05, "loss": 0.6336, "step": 3600 }, { "epoch": 0.2239454094292804, "grad_norm": 0.4541170597076416, "learning_rate": 2e-05, "loss": 0.65, "step": 3610 }, { "epoch": 0.22456575682382135, "grad_norm": 0.41161370277404785, "learning_rate": 2e-05, "loss": 0.6127, "step": 3620 }, { "epoch": 0.22518610421836227, "grad_norm": 0.39428696036338806, "learning_rate": 2e-05, "loss": 0.6452, "step": 3630 }, { "epoch": 0.22580645161290322, "grad_norm": 0.3822895586490631, "learning_rate": 2e-05, "loss": 0.625, "step": 3640 }, { "epoch": 0.22642679900744417, "grad_norm": 0.5086479783058167, "learning_rate": 2e-05, "loss": 0.6069, "step": 3650 }, { "epoch": 0.22704714640198512, "grad_norm": 0.43685758113861084, "learning_rate": 2e-05, "loss": 0.6357, "step": 3660 }, { "epoch": 0.22766749379652607, "grad_norm": 0.44833698868751526, "learning_rate": 2e-05, "loss": 0.6288, "step": 3670 }, { "epoch": 0.228287841191067, "grad_norm": 0.695853590965271, "learning_rate": 2e-05, "loss": 0.631, "step": 3680 }, { "epoch": 0.22890818858560794, "grad_norm": 0.403007835149765, "learning_rate": 2e-05, "loss": 0.6306, "step": 3690 }, { "epoch": 0.22952853598014888, "grad_norm": 0.45625439286231995, "learning_rate": 2e-05, "loss": 0.6404, "step": 3700 }, { "epoch": 0.23014888337468983, "grad_norm": 0.4494592249393463, "learning_rate": 2e-05, "loss": 0.6482, "step": 3710 }, { "epoch": 0.23076923076923078, "grad_norm": 0.39842021465301514, "learning_rate": 2e-05, "loss": 0.6518, "step": 3720 }, { "epoch": 0.2313895781637717, "grad_norm": 0.45455050468444824, "learning_rate": 2e-05, "loss": 0.6392, "step": 3730 }, { "epoch": 0.23200992555831265, "grad_norm": 0.40073955059051514, "learning_rate": 2e-05, "loss": 0.6239, "step": 3740 }, { "epoch": 0.2326302729528536, "grad_norm": 0.40425387024879456, "learning_rate": 2e-05, "loss": 0.6233, "step": 3750 }, { "epoch": 0.23325062034739455, "grad_norm": 0.38586944341659546, "learning_rate": 2e-05, "loss": 0.6236, "step": 3760 }, { "epoch": 0.23387096774193547, "grad_norm": 0.4220291078090668, "learning_rate": 2e-05, "loss": 0.6245, "step": 3770 }, { "epoch": 0.23449131513647642, "grad_norm": 0.39111921191215515, "learning_rate": 2e-05, "loss": 0.6206, "step": 3780 }, { "epoch": 0.23511166253101737, "grad_norm": 0.4438347816467285, "learning_rate": 2e-05, "loss": 0.626, "step": 3790 }, { "epoch": 0.23573200992555832, "grad_norm": 0.4105881154537201, "learning_rate": 2e-05, "loss": 0.6152, "step": 3800 }, { "epoch": 0.23635235732009927, "grad_norm": 0.5986375212669373, "learning_rate": 2e-05, "loss": 0.6332, "step": 3810 }, { "epoch": 0.2369727047146402, "grad_norm": 0.42196112871170044, "learning_rate": 2e-05, "loss": 0.6344, "step": 3820 }, { "epoch": 0.23759305210918114, "grad_norm": 0.4690241813659668, "learning_rate": 2e-05, "loss": 0.6326, "step": 3830 }, { "epoch": 0.23821339950372208, "grad_norm": 0.39249280095100403, "learning_rate": 2e-05, "loss": 0.644, "step": 3840 }, { "epoch": 0.23883374689826303, "grad_norm": 0.3836807310581207, "learning_rate": 2e-05, "loss": 0.643, "step": 3850 }, { "epoch": 0.23945409429280398, "grad_norm": 0.39411523938179016, "learning_rate": 2e-05, "loss": 0.6168, "step": 3860 }, { "epoch": 0.2400744416873449, "grad_norm": 0.39570122957229614, "learning_rate": 2e-05, "loss": 0.6458, "step": 3870 }, { "epoch": 0.24069478908188585, "grad_norm": 0.4410209059715271, "learning_rate": 2e-05, "loss": 0.6357, "step": 3880 }, { "epoch": 0.2413151364764268, "grad_norm": 0.41891351342201233, "learning_rate": 2e-05, "loss": 0.645, "step": 3890 }, { "epoch": 0.24193548387096775, "grad_norm": 0.3815721273422241, "learning_rate": 2e-05, "loss": 0.6197, "step": 3900 }, { "epoch": 0.2425558312655087, "grad_norm": 0.42668625712394714, "learning_rate": 2e-05, "loss": 0.6512, "step": 3910 }, { "epoch": 0.24317617866004962, "grad_norm": 0.44440335035324097, "learning_rate": 2e-05, "loss": 0.6286, "step": 3920 }, { "epoch": 0.24379652605459057, "grad_norm": 0.4490135908126831, "learning_rate": 2e-05, "loss": 0.6429, "step": 3930 }, { "epoch": 0.24441687344913152, "grad_norm": 0.3730720281600952, "learning_rate": 2e-05, "loss": 0.6178, "step": 3940 }, { "epoch": 0.24503722084367247, "grad_norm": 0.4244785010814667, "learning_rate": 2e-05, "loss": 0.667, "step": 3950 }, { "epoch": 0.2456575682382134, "grad_norm": 0.38650715351104736, "learning_rate": 2e-05, "loss": 0.6116, "step": 3960 }, { "epoch": 0.24627791563275434, "grad_norm": 0.38137051463127136, "learning_rate": 2e-05, "loss": 0.6411, "step": 3970 }, { "epoch": 0.24689826302729528, "grad_norm": 0.4392582178115845, "learning_rate": 2e-05, "loss": 0.6296, "step": 3980 }, { "epoch": 0.24751861042183623, "grad_norm": 0.40702107548713684, "learning_rate": 2e-05, "loss": 0.6369, "step": 3990 }, { "epoch": 0.24813895781637718, "grad_norm": 0.3724535405635834, "learning_rate": 2e-05, "loss": 0.6209, "step": 4000 }, { "epoch": 0.2487593052109181, "grad_norm": 0.38708439469337463, "learning_rate": 2e-05, "loss": 0.6208, "step": 4010 }, { "epoch": 0.24937965260545905, "grad_norm": 0.46000051498413086, "learning_rate": 2e-05, "loss": 0.6162, "step": 4020 }, { "epoch": 0.25, "grad_norm": 0.41148972511291504, "learning_rate": 2e-05, "loss": 0.589, "step": 4030 }, { "epoch": 0.2506203473945409, "grad_norm": 0.40816742181777954, "learning_rate": 2e-05, "loss": 0.6286, "step": 4040 }, { "epoch": 0.2512406947890819, "grad_norm": 0.3669893741607666, "learning_rate": 2e-05, "loss": 0.6382, "step": 4050 }, { "epoch": 0.2518610421836228, "grad_norm": 0.4152558743953705, "learning_rate": 2e-05, "loss": 0.6367, "step": 4060 }, { "epoch": 0.2524813895781638, "grad_norm": 0.4094124734401703, "learning_rate": 2e-05, "loss": 0.6322, "step": 4070 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.8168590244885037e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }