{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.1262406947890819, "eval_steps": 500, "global_step": 2035, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0006203473945409429, "grad_norm": 1.103378415107727, "learning_rate": 2.910112359550562e-06, "loss": 0.8492, "step": 10 }, { "epoch": 0.0012406947890818859, "grad_norm": 0.9267538189888, "learning_rate": 3.921348314606742e-06, "loss": 0.7944, "step": 20 }, { "epoch": 0.0018610421836228288, "grad_norm": 0.8842476606369019, "learning_rate": 4.932584269662922e-06, "loss": 0.7628, "step": 30 }, { "epoch": 0.0024813895781637717, "grad_norm": 0.8289238810539246, "learning_rate": 5.943820224719102e-06, "loss": 0.7342, "step": 40 }, { "epoch": 0.003101736972704715, "grad_norm": 0.9065801501274109, "learning_rate": 6.955056179775282e-06, "loss": 0.7217, "step": 50 }, { "epoch": 0.0037220843672456576, "grad_norm": 0.8170527815818787, "learning_rate": 7.966292134831462e-06, "loss": 0.73, "step": 60 }, { "epoch": 0.004342431761786601, "grad_norm": 0.8123277425765991, "learning_rate": 8.977528089887641e-06, "loss": 0.7154, "step": 70 }, { "epoch": 0.004962779156327543, "grad_norm": 0.7789028882980347, "learning_rate": 9.988764044943822e-06, "loss": 0.7083, "step": 80 }, { "epoch": 0.005583126550868486, "grad_norm": 0.7920109033584595, "learning_rate": 1.1000000000000001e-05, "loss": 0.7252, "step": 90 }, { "epoch": 0.00620347394540943, "grad_norm": 0.9307668209075928, "learning_rate": 1.2011235955056182e-05, "loss": 0.6857, "step": 100 }, { "epoch": 0.006823821339950372, "grad_norm": 0.8309650421142578, "learning_rate": 1.3022471910112362e-05, "loss": 0.7, "step": 110 }, { "epoch": 0.007444168734491315, "grad_norm": 0.907129168510437, "learning_rate": 1.403370786516854e-05, "loss": 0.7132, "step": 120 }, { "epoch": 0.008064516129032258, "grad_norm": 0.8221721649169922, "learning_rate": 1.504494382022472e-05, "loss": 0.7001, "step": 130 }, { "epoch": 0.008684863523573201, "grad_norm": 0.701308012008667, "learning_rate": 1.60561797752809e-05, "loss": 0.699, "step": 140 }, { "epoch": 0.009305210918114143, "grad_norm": 0.7170705199241638, "learning_rate": 1.706741573033708e-05, "loss": 0.6725, "step": 150 }, { "epoch": 0.009925558312655087, "grad_norm": 0.8029273152351379, "learning_rate": 1.8078651685393256e-05, "loss": 0.6839, "step": 160 }, { "epoch": 0.01054590570719603, "grad_norm": 0.7059943079948425, "learning_rate": 1.908988764044944e-05, "loss": 0.6963, "step": 170 }, { "epoch": 0.011166253101736972, "grad_norm": 0.7652074694633484, "learning_rate": 2e-05, "loss": 0.6906, "step": 180 }, { "epoch": 0.011786600496277916, "grad_norm": 0.777823269367218, "learning_rate": 2e-05, "loss": 0.6697, "step": 190 }, { "epoch": 0.01240694789081886, "grad_norm": 0.7011638879776001, "learning_rate": 2e-05, "loss": 0.6886, "step": 200 }, { "epoch": 0.013027295285359801, "grad_norm": 0.7449702024459839, "learning_rate": 2e-05, "loss": 0.6957, "step": 210 }, { "epoch": 0.013647642679900745, "grad_norm": 0.7148544192314148, "learning_rate": 2e-05, "loss": 0.6679, "step": 220 }, { "epoch": 0.014267990074441687, "grad_norm": 0.6491106748580933, "learning_rate": 2e-05, "loss": 0.6916, "step": 230 }, { "epoch": 0.01488833746898263, "grad_norm": 0.5647692084312439, "learning_rate": 2e-05, "loss": 0.6986, "step": 240 }, { "epoch": 0.015508684863523574, "grad_norm": 0.5894495844841003, "learning_rate": 2e-05, "loss": 0.7308, "step": 250 }, { "epoch": 0.016129032258064516, "grad_norm": 0.5743111371994019, "learning_rate": 2e-05, "loss": 0.6988, "step": 260 }, { "epoch": 0.016749379652605458, "grad_norm": 0.5293608903884888, "learning_rate": 2e-05, "loss": 0.6821, "step": 270 }, { "epoch": 0.017369727047146403, "grad_norm": 0.5631842613220215, "learning_rate": 2e-05, "loss": 0.6701, "step": 280 }, { "epoch": 0.017990074441687345, "grad_norm": 0.5677319765090942, "learning_rate": 2e-05, "loss": 0.7191, "step": 290 }, { "epoch": 0.018610421836228287, "grad_norm": 0.5547688603401184, "learning_rate": 2e-05, "loss": 0.7094, "step": 300 }, { "epoch": 0.019230769230769232, "grad_norm": 0.5547721982002258, "learning_rate": 2e-05, "loss": 0.6783, "step": 310 }, { "epoch": 0.019851116625310174, "grad_norm": 0.5873662829399109, "learning_rate": 2e-05, "loss": 0.707, "step": 320 }, { "epoch": 0.020471464019851116, "grad_norm": 0.5058910846710205, "learning_rate": 2e-05, "loss": 0.663, "step": 330 }, { "epoch": 0.02109181141439206, "grad_norm": 0.4962847828865051, "learning_rate": 2e-05, "loss": 0.6727, "step": 340 }, { "epoch": 0.021712158808933003, "grad_norm": 0.49221107363700867, "learning_rate": 2e-05, "loss": 0.666, "step": 350 }, { "epoch": 0.022332506203473945, "grad_norm": 0.4796120822429657, "learning_rate": 2e-05, "loss": 0.6665, "step": 360 }, { "epoch": 0.02295285359801489, "grad_norm": 0.5007806420326233, "learning_rate": 2e-05, "loss": 0.6865, "step": 370 }, { "epoch": 0.02357320099255583, "grad_norm": 0.5052497386932373, "learning_rate": 2e-05, "loss": 0.67, "step": 380 }, { "epoch": 0.024193548387096774, "grad_norm": 0.4976111948490143, "learning_rate": 2e-05, "loss": 0.6971, "step": 390 }, { "epoch": 0.02481389578163772, "grad_norm": 0.489734947681427, "learning_rate": 2e-05, "loss": 0.7244, "step": 400 }, { "epoch": 0.02543424317617866, "grad_norm": 0.504808783531189, "learning_rate": 2e-05, "loss": 0.6574, "step": 410 }, { "epoch": 0.026054590570719603, "grad_norm": 0.5242099761962891, "learning_rate": 2e-05, "loss": 0.6793, "step": 420 }, { "epoch": 0.026674937965260544, "grad_norm": 0.48700666427612305, "learning_rate": 2e-05, "loss": 0.6733, "step": 430 }, { "epoch": 0.02729528535980149, "grad_norm": 0.5279196500778198, "learning_rate": 2e-05, "loss": 0.6807, "step": 440 }, { "epoch": 0.02791563275434243, "grad_norm": 1.6781505346298218, "learning_rate": 2e-05, "loss": 0.7033, "step": 450 }, { "epoch": 0.028535980148883373, "grad_norm": 0.589901328086853, "learning_rate": 2e-05, "loss": 0.7007, "step": 460 }, { "epoch": 0.02915632754342432, "grad_norm": 0.9268983006477356, "learning_rate": 2e-05, "loss": 0.6832, "step": 470 }, { "epoch": 0.02977667493796526, "grad_norm": 0.47625434398651123, "learning_rate": 2e-05, "loss": 0.6953, "step": 480 }, { "epoch": 0.030397022332506202, "grad_norm": 0.5042843818664551, "learning_rate": 2e-05, "loss": 0.6592, "step": 490 }, { "epoch": 0.031017369727047148, "grad_norm": 0.44941166043281555, "learning_rate": 2e-05, "loss": 0.695, "step": 500 }, { "epoch": 0.03163771712158809, "grad_norm": 0.477464497089386, "learning_rate": 2e-05, "loss": 0.6707, "step": 510 }, { "epoch": 0.03225806451612903, "grad_norm": 0.4819585680961609, "learning_rate": 2e-05, "loss": 0.6708, "step": 520 }, { "epoch": 0.03287841191066997, "grad_norm": 0.4723353981971741, "learning_rate": 2e-05, "loss": 0.6615, "step": 530 }, { "epoch": 0.033498759305210915, "grad_norm": 0.4481304883956909, "learning_rate": 2e-05, "loss": 0.6716, "step": 540 }, { "epoch": 0.034119106699751864, "grad_norm": 0.4634115993976593, "learning_rate": 2e-05, "loss": 0.6564, "step": 550 }, { "epoch": 0.034739454094292806, "grad_norm": 0.4898909628391266, "learning_rate": 2e-05, "loss": 0.6783, "step": 560 }, { "epoch": 0.03535980148883375, "grad_norm": 0.49201110005378723, "learning_rate": 2e-05, "loss": 0.6679, "step": 570 }, { "epoch": 0.03598014888337469, "grad_norm": 0.4393959045410156, "learning_rate": 2e-05, "loss": 0.6984, "step": 580 }, { "epoch": 0.03660049627791563, "grad_norm": 0.4818369746208191, "learning_rate": 2e-05, "loss": 0.6841, "step": 590 }, { "epoch": 0.03722084367245657, "grad_norm": 0.4339914917945862, "learning_rate": 2e-05, "loss": 0.6787, "step": 600 }, { "epoch": 0.03784119106699752, "grad_norm": 0.43327295780181885, "learning_rate": 2e-05, "loss": 0.6796, "step": 610 }, { "epoch": 0.038461538461538464, "grad_norm": 0.4560607969760895, "learning_rate": 2e-05, "loss": 0.6468, "step": 620 }, { "epoch": 0.039081885856079406, "grad_norm": 0.47957178950309753, "learning_rate": 2e-05, "loss": 0.6495, "step": 630 }, { "epoch": 0.03970223325062035, "grad_norm": 0.4618580639362335, "learning_rate": 2e-05, "loss": 0.669, "step": 640 }, { "epoch": 0.04032258064516129, "grad_norm": 0.505342423915863, "learning_rate": 2e-05, "loss": 0.6767, "step": 650 }, { "epoch": 0.04094292803970223, "grad_norm": 0.48456406593322754, "learning_rate": 2e-05, "loss": 0.6804, "step": 660 }, { "epoch": 0.04156327543424317, "grad_norm": 0.44942647218704224, "learning_rate": 2e-05, "loss": 0.6661, "step": 670 }, { "epoch": 0.04218362282878412, "grad_norm": 0.4639962315559387, "learning_rate": 2e-05, "loss": 0.6796, "step": 680 }, { "epoch": 0.042803970223325064, "grad_norm": 0.46533408761024475, "learning_rate": 2e-05, "loss": 0.6875, "step": 690 }, { "epoch": 0.043424317617866005, "grad_norm": 0.42894449830055237, "learning_rate": 2e-05, "loss": 0.6436, "step": 700 }, { "epoch": 0.04404466501240695, "grad_norm": 0.5065799951553345, "learning_rate": 2e-05, "loss": 0.6714, "step": 710 }, { "epoch": 0.04466501240694789, "grad_norm": 0.4446672797203064, "learning_rate": 2e-05, "loss": 0.6871, "step": 720 }, { "epoch": 0.04528535980148883, "grad_norm": 0.4434851109981537, "learning_rate": 2e-05, "loss": 0.6584, "step": 730 }, { "epoch": 0.04590570719602978, "grad_norm": 0.5027102828025818, "learning_rate": 2e-05, "loss": 0.6791, "step": 740 }, { "epoch": 0.04652605459057072, "grad_norm": 0.4595511853694916, "learning_rate": 2e-05, "loss": 0.6911, "step": 750 }, { "epoch": 0.04714640198511166, "grad_norm": 0.4787590801715851, "learning_rate": 2e-05, "loss": 0.6868, "step": 760 }, { "epoch": 0.047766749379652605, "grad_norm": 0.4960077106952667, "learning_rate": 2e-05, "loss": 0.6664, "step": 770 }, { "epoch": 0.04838709677419355, "grad_norm": 0.4341469705104828, "learning_rate": 2e-05, "loss": 0.6501, "step": 780 }, { "epoch": 0.04900744416873449, "grad_norm": 0.4147971272468567, "learning_rate": 2e-05, "loss": 0.6439, "step": 790 }, { "epoch": 0.04962779156327544, "grad_norm": 0.4606212377548218, "learning_rate": 2e-05, "loss": 0.6964, "step": 800 }, { "epoch": 0.05024813895781638, "grad_norm": 0.4221757650375366, "learning_rate": 2e-05, "loss": 0.6598, "step": 810 }, { "epoch": 0.05086848635235732, "grad_norm": 0.46451857686042786, "learning_rate": 2e-05, "loss": 0.6503, "step": 820 }, { "epoch": 0.05148883374689826, "grad_norm": 0.4234520196914673, "learning_rate": 2e-05, "loss": 0.6702, "step": 830 }, { "epoch": 0.052109181141439205, "grad_norm": 0.5181183218955994, "learning_rate": 2e-05, "loss": 0.703, "step": 840 }, { "epoch": 0.05272952853598015, "grad_norm": 0.43921777606010437, "learning_rate": 2e-05, "loss": 0.6777, "step": 850 }, { "epoch": 0.05334987593052109, "grad_norm": 0.4488343894481659, "learning_rate": 2e-05, "loss": 0.6661, "step": 860 }, { "epoch": 0.05397022332506204, "grad_norm": 0.45838460326194763, "learning_rate": 2e-05, "loss": 0.6438, "step": 870 }, { "epoch": 0.05459057071960298, "grad_norm": 0.42543938755989075, "learning_rate": 2e-05, "loss": 0.6781, "step": 880 }, { "epoch": 0.05521091811414392, "grad_norm": 0.44000378251075745, "learning_rate": 2e-05, "loss": 0.656, "step": 890 }, { "epoch": 0.05583126550868486, "grad_norm": 0.4415980279445648, "learning_rate": 2e-05, "loss": 0.66, "step": 900 }, { "epoch": 0.056451612903225805, "grad_norm": 0.4455133378505707, "learning_rate": 2e-05, "loss": 0.6633, "step": 910 }, { "epoch": 0.05707196029776675, "grad_norm": 0.44925546646118164, "learning_rate": 2e-05, "loss": 0.6833, "step": 920 }, { "epoch": 0.057692307692307696, "grad_norm": 0.7831513285636902, "learning_rate": 2e-05, "loss": 0.6649, "step": 930 }, { "epoch": 0.05831265508684864, "grad_norm": 0.5281955003738403, "learning_rate": 2e-05, "loss": 0.66, "step": 940 }, { "epoch": 0.05893300248138958, "grad_norm": 0.43578600883483887, "learning_rate": 2e-05, "loss": 0.6886, "step": 950 }, { "epoch": 0.05955334987593052, "grad_norm": 0.43332430720329285, "learning_rate": 2e-05, "loss": 0.6617, "step": 960 }, { "epoch": 0.06017369727047146, "grad_norm": 0.46484294533729553, "learning_rate": 2e-05, "loss": 0.6435, "step": 970 }, { "epoch": 0.060794044665012405, "grad_norm": 0.41882455348968506, "learning_rate": 2e-05, "loss": 0.6602, "step": 980 }, { "epoch": 0.06141439205955335, "grad_norm": 0.4295177757740021, "learning_rate": 2e-05, "loss": 0.6784, "step": 990 }, { "epoch": 0.062034739454094295, "grad_norm": 0.4727322459220886, "learning_rate": 2e-05, "loss": 0.6818, "step": 1000 }, { "epoch": 0.06265508684863523, "grad_norm": 0.430388480424881, "learning_rate": 2e-05, "loss": 0.6579, "step": 1010 }, { "epoch": 0.06327543424317618, "grad_norm": 0.3914746642112732, "learning_rate": 2e-05, "loss": 0.6793, "step": 1020 }, { "epoch": 0.06389578163771713, "grad_norm": 0.4640097916126251, "learning_rate": 2e-05, "loss": 0.6454, "step": 1030 }, { "epoch": 0.06451612903225806, "grad_norm": 0.43572962284088135, "learning_rate": 2e-05, "loss": 0.6644, "step": 1040 }, { "epoch": 0.06513647642679901, "grad_norm": 0.42249470949172974, "learning_rate": 2e-05, "loss": 0.659, "step": 1050 }, { "epoch": 0.06575682382133995, "grad_norm": 0.45737001299858093, "learning_rate": 2e-05, "loss": 0.6563, "step": 1060 }, { "epoch": 0.0663771712158809, "grad_norm": 0.39258211851119995, "learning_rate": 2e-05, "loss": 0.67, "step": 1070 }, { "epoch": 0.06699751861042183, "grad_norm": 0.4379409849643707, "learning_rate": 2e-05, "loss": 0.6729, "step": 1080 }, { "epoch": 0.06761786600496278, "grad_norm": 0.3982328474521637, "learning_rate": 2e-05, "loss": 0.659, "step": 1090 }, { "epoch": 0.06823821339950373, "grad_norm": 0.42903372645378113, "learning_rate": 2e-05, "loss": 0.6594, "step": 1100 }, { "epoch": 0.06885856079404466, "grad_norm": 0.4348221719264984, "learning_rate": 2e-05, "loss": 0.6313, "step": 1110 }, { "epoch": 0.06947890818858561, "grad_norm": 0.43977659940719604, "learning_rate": 2e-05, "loss": 0.7013, "step": 1120 }, { "epoch": 0.07009925558312655, "grad_norm": 0.41244375705718994, "learning_rate": 2e-05, "loss": 0.6474, "step": 1130 }, { "epoch": 0.0707196029776675, "grad_norm": 0.4200294613838196, "learning_rate": 2e-05, "loss": 0.6853, "step": 1140 }, { "epoch": 0.07133995037220843, "grad_norm": 0.4071672856807709, "learning_rate": 2e-05, "loss": 0.6773, "step": 1150 }, { "epoch": 0.07196029776674938, "grad_norm": 0.4591241776943207, "learning_rate": 2e-05, "loss": 0.6901, "step": 1160 }, { "epoch": 0.07258064516129033, "grad_norm": 0.4510512948036194, "learning_rate": 2e-05, "loss": 0.6751, "step": 1170 }, { "epoch": 0.07320099255583126, "grad_norm": 0.4550836980342865, "learning_rate": 2e-05, "loss": 0.6745, "step": 1180 }, { "epoch": 0.07382133995037221, "grad_norm": 0.42455634474754333, "learning_rate": 2e-05, "loss": 0.6852, "step": 1190 }, { "epoch": 0.07444168734491315, "grad_norm": 0.4288151264190674, "learning_rate": 2e-05, "loss": 0.6362, "step": 1200 }, { "epoch": 0.0750620347394541, "grad_norm": 0.41488656401634216, "learning_rate": 2e-05, "loss": 0.6555, "step": 1210 }, { "epoch": 0.07568238213399504, "grad_norm": 0.41888904571533203, "learning_rate": 2e-05, "loss": 0.6405, "step": 1220 }, { "epoch": 0.07630272952853598, "grad_norm": 0.42407098412513733, "learning_rate": 2e-05, "loss": 0.6869, "step": 1230 }, { "epoch": 0.07692307692307693, "grad_norm": 0.43882668018341064, "learning_rate": 2e-05, "loss": 0.6697, "step": 1240 }, { "epoch": 0.07754342431761786, "grad_norm": 0.463724285364151, "learning_rate": 2e-05, "loss": 0.6606, "step": 1250 }, { "epoch": 0.07816377171215881, "grad_norm": 0.4122724235057831, "learning_rate": 2e-05, "loss": 0.683, "step": 1260 }, { "epoch": 0.07878411910669975, "grad_norm": 0.4170853793621063, "learning_rate": 2e-05, "loss": 0.6469, "step": 1270 }, { "epoch": 0.0794044665012407, "grad_norm": 0.41887524724006653, "learning_rate": 2e-05, "loss": 0.6613, "step": 1280 }, { "epoch": 0.08002481389578164, "grad_norm": 0.5110520720481873, "learning_rate": 2e-05, "loss": 0.6481, "step": 1290 }, { "epoch": 0.08064516129032258, "grad_norm": 0.5727337002754211, "learning_rate": 2e-05, "loss": 0.6602, "step": 1300 }, { "epoch": 0.08126550868486353, "grad_norm": 0.45020315051078796, "learning_rate": 2e-05, "loss": 0.6905, "step": 1310 }, { "epoch": 0.08188585607940446, "grad_norm": 0.41866007447242737, "learning_rate": 2e-05, "loss": 0.6458, "step": 1320 }, { "epoch": 0.08250620347394541, "grad_norm": 0.4124995768070221, "learning_rate": 2e-05, "loss": 0.6476, "step": 1330 }, { "epoch": 0.08312655086848635, "grad_norm": 0.45238474011421204, "learning_rate": 2e-05, "loss": 0.6722, "step": 1340 }, { "epoch": 0.0837468982630273, "grad_norm": 0.44636914134025574, "learning_rate": 2e-05, "loss": 0.6828, "step": 1350 }, { "epoch": 0.08436724565756824, "grad_norm": 0.42632195353507996, "learning_rate": 2e-05, "loss": 0.6974, "step": 1360 }, { "epoch": 0.08498759305210918, "grad_norm": 0.4126355051994324, "learning_rate": 2e-05, "loss": 0.6542, "step": 1370 }, { "epoch": 0.08560794044665013, "grad_norm": 0.4650143086910248, "learning_rate": 2e-05, "loss": 0.6402, "step": 1380 }, { "epoch": 0.08622828784119106, "grad_norm": 0.4254385530948639, "learning_rate": 2e-05, "loss": 0.6196, "step": 1390 }, { "epoch": 0.08684863523573201, "grad_norm": 0.5174993872642517, "learning_rate": 2e-05, "loss": 0.6566, "step": 1400 }, { "epoch": 0.08746898263027296, "grad_norm": 0.4466327428817749, "learning_rate": 2e-05, "loss": 0.6777, "step": 1410 }, { "epoch": 0.0880893300248139, "grad_norm": 0.4639355540275574, "learning_rate": 2e-05, "loss": 0.6518, "step": 1420 }, { "epoch": 0.08870967741935484, "grad_norm": 0.49918368458747864, "learning_rate": 2e-05, "loss": 0.666, "step": 1430 }, { "epoch": 0.08933002481389578, "grad_norm": 0.45220839977264404, "learning_rate": 2e-05, "loss": 0.6626, "step": 1440 }, { "epoch": 0.08995037220843673, "grad_norm": 0.40696123242378235, "learning_rate": 2e-05, "loss": 0.6591, "step": 1450 }, { "epoch": 0.09057071960297766, "grad_norm": 0.42498070001602173, "learning_rate": 2e-05, "loss": 0.6532, "step": 1460 }, { "epoch": 0.09119106699751861, "grad_norm": 0.4117129147052765, "learning_rate": 2e-05, "loss": 0.6272, "step": 1470 }, { "epoch": 0.09181141439205956, "grad_norm": 0.4506339132785797, "learning_rate": 2e-05, "loss": 0.6609, "step": 1480 }, { "epoch": 0.0924317617866005, "grad_norm": 0.40215933322906494, "learning_rate": 2e-05, "loss": 0.6653, "step": 1490 }, { "epoch": 0.09305210918114144, "grad_norm": 0.4949316382408142, "learning_rate": 2e-05, "loss": 0.6583, "step": 1500 }, { "epoch": 0.09367245657568238, "grad_norm": 0.45883846282958984, "learning_rate": 2e-05, "loss": 0.6553, "step": 1510 }, { "epoch": 0.09429280397022333, "grad_norm": 0.41736656427383423, "learning_rate": 2e-05, "loss": 0.6727, "step": 1520 }, { "epoch": 0.09491315136476426, "grad_norm": 0.45958396792411804, "learning_rate": 2e-05, "loss": 0.6402, "step": 1530 }, { "epoch": 0.09553349875930521, "grad_norm": 0.41696447134017944, "learning_rate": 2e-05, "loss": 0.669, "step": 1540 }, { "epoch": 0.09615384615384616, "grad_norm": 0.45699238777160645, "learning_rate": 2e-05, "loss": 0.6421, "step": 1550 }, { "epoch": 0.0967741935483871, "grad_norm": 0.46844539046287537, "learning_rate": 2e-05, "loss": 0.6628, "step": 1560 }, { "epoch": 0.09739454094292804, "grad_norm": 0.4296782612800598, "learning_rate": 2e-05, "loss": 0.6468, "step": 1570 }, { "epoch": 0.09801488833746898, "grad_norm": 0.43794864416122437, "learning_rate": 2e-05, "loss": 0.6708, "step": 1580 }, { "epoch": 0.09863523573200993, "grad_norm": 0.4485463500022888, "learning_rate": 2e-05, "loss": 0.6537, "step": 1590 }, { "epoch": 0.09925558312655088, "grad_norm": 0.44051381945610046, "learning_rate": 2e-05, "loss": 0.6378, "step": 1600 }, { "epoch": 0.09987593052109181, "grad_norm": 0.44119101762771606, "learning_rate": 2e-05, "loss": 0.6503, "step": 1610 }, { "epoch": 0.10049627791563276, "grad_norm": 0.4515126049518585, "learning_rate": 2e-05, "loss": 0.6647, "step": 1620 }, { "epoch": 0.1011166253101737, "grad_norm": 0.4214085042476654, "learning_rate": 2e-05, "loss": 0.6483, "step": 1630 }, { "epoch": 0.10173697270471464, "grad_norm": 0.4193068742752075, "learning_rate": 2e-05, "loss": 0.6685, "step": 1640 }, { "epoch": 0.10235732009925558, "grad_norm": 0.4890860319137573, "learning_rate": 2e-05, "loss": 0.6529, "step": 1650 }, { "epoch": 0.10297766749379653, "grad_norm": 0.5013541579246521, "learning_rate": 2e-05, "loss": 0.7078, "step": 1660 }, { "epoch": 0.10359801488833748, "grad_norm": 0.4772087335586548, "learning_rate": 2e-05, "loss": 0.6574, "step": 1670 }, { "epoch": 0.10421836228287841, "grad_norm": 0.5918506979942322, "learning_rate": 2e-05, "loss": 0.6668, "step": 1680 }, { "epoch": 0.10483870967741936, "grad_norm": 0.42867156863212585, "learning_rate": 2e-05, "loss": 0.6556, "step": 1690 }, { "epoch": 0.1054590570719603, "grad_norm": 0.4230250418186188, "learning_rate": 2e-05, "loss": 0.6564, "step": 1700 }, { "epoch": 0.10607940446650124, "grad_norm": 0.4046623110771179, "learning_rate": 2e-05, "loss": 0.6691, "step": 1710 }, { "epoch": 0.10669975186104218, "grad_norm": 0.4210417568683624, "learning_rate": 2e-05, "loss": 0.6675, "step": 1720 }, { "epoch": 0.10732009925558313, "grad_norm": 0.4010581970214844, "learning_rate": 2e-05, "loss": 0.6402, "step": 1730 }, { "epoch": 0.10794044665012408, "grad_norm": 0.4336850643157959, "learning_rate": 2e-05, "loss": 0.6568, "step": 1740 }, { "epoch": 0.10856079404466501, "grad_norm": 0.43575379252433777, "learning_rate": 2e-05, "loss": 0.6493, "step": 1750 }, { "epoch": 0.10918114143920596, "grad_norm": 0.42740049958229065, "learning_rate": 2e-05, "loss": 0.6571, "step": 1760 }, { "epoch": 0.1098014888337469, "grad_norm": 0.4169295132160187, "learning_rate": 2e-05, "loss": 0.6611, "step": 1770 }, { "epoch": 0.11042183622828784, "grad_norm": 0.5564378499984741, "learning_rate": 2e-05, "loss": 0.6532, "step": 1780 }, { "epoch": 0.11104218362282878, "grad_norm": 0.45990580320358276, "learning_rate": 2e-05, "loss": 0.6262, "step": 1790 }, { "epoch": 0.11166253101736973, "grad_norm": 0.4232894778251648, "learning_rate": 2e-05, "loss": 0.6729, "step": 1800 }, { "epoch": 0.11228287841191067, "grad_norm": 0.49535107612609863, "learning_rate": 2e-05, "loss": 0.6808, "step": 1810 }, { "epoch": 0.11290322580645161, "grad_norm": 0.4231373965740204, "learning_rate": 2e-05, "loss": 0.6731, "step": 1820 }, { "epoch": 0.11352357320099256, "grad_norm": 0.42381367087364197, "learning_rate": 2e-05, "loss": 0.6672, "step": 1830 }, { "epoch": 0.1141439205955335, "grad_norm": 0.40873488783836365, "learning_rate": 2e-05, "loss": 0.6471, "step": 1840 }, { "epoch": 0.11476426799007444, "grad_norm": 0.4330880641937256, "learning_rate": 2e-05, "loss": 0.6653, "step": 1850 }, { "epoch": 0.11538461538461539, "grad_norm": 0.47087201476097107, "learning_rate": 2e-05, "loss": 0.6865, "step": 1860 }, { "epoch": 0.11600496277915633, "grad_norm": 0.49161598086357117, "learning_rate": 2e-05, "loss": 0.6625, "step": 1870 }, { "epoch": 0.11662531017369727, "grad_norm": 0.40995311737060547, "learning_rate": 2e-05, "loss": 0.6421, "step": 1880 }, { "epoch": 0.11724565756823821, "grad_norm": 0.40415555238723755, "learning_rate": 2e-05, "loss": 0.6407, "step": 1890 }, { "epoch": 0.11786600496277916, "grad_norm": 0.42309048771858215, "learning_rate": 2e-05, "loss": 0.6524, "step": 1900 }, { "epoch": 0.1184863523573201, "grad_norm": 0.428654283285141, "learning_rate": 2e-05, "loss": 0.6473, "step": 1910 }, { "epoch": 0.11910669975186104, "grad_norm": 0.46681228280067444, "learning_rate": 2e-05, "loss": 0.665, "step": 1920 }, { "epoch": 0.11972704714640199, "grad_norm": 0.5378752946853638, "learning_rate": 2e-05, "loss": 0.6888, "step": 1930 }, { "epoch": 0.12034739454094293, "grad_norm": 0.3942810297012329, "learning_rate": 2e-05, "loss": 0.6693, "step": 1940 }, { "epoch": 0.12096774193548387, "grad_norm": 0.40872716903686523, "learning_rate": 2e-05, "loss": 0.6564, "step": 1950 }, { "epoch": 0.12158808933002481, "grad_norm": 0.4505879580974579, "learning_rate": 2e-05, "loss": 0.6651, "step": 1960 }, { "epoch": 0.12220843672456576, "grad_norm": 0.46347737312316895, "learning_rate": 2e-05, "loss": 0.6682, "step": 1970 }, { "epoch": 0.1228287841191067, "grad_norm": 0.4220800995826721, "learning_rate": 2e-05, "loss": 0.6633, "step": 1980 }, { "epoch": 0.12344913151364764, "grad_norm": 0.39984744787216187, "learning_rate": 2e-05, "loss": 0.6379, "step": 1990 }, { "epoch": 0.12406947890818859, "grad_norm": 0.42455461621284485, "learning_rate": 2e-05, "loss": 0.6442, "step": 2000 }, { "epoch": 0.12468982630272953, "grad_norm": 0.4262460768222809, "learning_rate": 2e-05, "loss": 0.6385, "step": 2010 }, { "epoch": 0.12531017369727046, "grad_norm": 0.42343422770500183, "learning_rate": 2e-05, "loss": 0.6541, "step": 2020 }, { "epoch": 0.1259305210918114, "grad_norm": 0.4029340147972107, "learning_rate": 2e-05, "loss": 0.6776, "step": 2030 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9.084295122442519e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }