{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 1500, "global_step": 50224, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.3379378823935986, "epoch": 0.001991079961771265, "grad_norm": 2.79451847076416, "learning_rate": 6.5029860650298604e-06, "loss": 1.7820364379882812, "mean_token_accuracy": 0.7173230850696564, "num_tokens": 3818304.0, "step": 50 }, { "entropy": 0.6726230216026307, "epoch": 0.00398215992354253, "grad_norm": 1.2477459907531738, "learning_rate": 1.3138686131386862e-05, "loss": 0.666585693359375, "mean_token_accuracy": 0.828263390660286, "num_tokens": 7722811.0, "step": 100 }, { "entropy": 0.3462180678546429, "epoch": 0.0059732398853137945, "grad_norm": 1.1506513357162476, "learning_rate": 1.9774386197743863e-05, "loss": 0.3362165069580078, "mean_token_accuracy": 0.8953030824661254, "num_tokens": 11445148.0, "step": 150 }, { "entropy": 0.2893742734193802, "epoch": 0.00796431984708506, "grad_norm": 0.8775256872177124, "learning_rate": 2.6410086264100863e-05, "loss": 0.2852581214904785, "mean_token_accuracy": 0.9090695399045944, "num_tokens": 15380668.0, "step": 200 }, { "entropy": 0.26955254435539244, "epoch": 0.009955399808856324, "grad_norm": 0.57791668176651, "learning_rate": 3.3045786330457866e-05, "loss": 0.26207345962524414, "mean_token_accuracy": 0.9136792892217636, "num_tokens": 19181789.0, "step": 250 }, { "entropy": 0.25845475763082504, "epoch": 0.011946479770627589, "grad_norm": 0.5533633232116699, "learning_rate": 3.968148639681486e-05, "loss": 0.2490983200073242, "mean_token_accuracy": 0.9160848289728165, "num_tokens": 22992039.0, "step": 300 }, { "entropy": 0.2542937259376049, "epoch": 0.013937559732398854, "grad_norm": 0.5990102291107178, "learning_rate": 4.631718646317187e-05, "loss": 0.25011444091796875, "mean_token_accuracy": 0.9170939832925796, "num_tokens": 27108018.0, "step": 350 }, { "entropy": 0.2444898281991482, "epoch": 0.01592863969417012, "grad_norm": 0.43611571192741394, "learning_rate": 5.295288652952887e-05, "loss": 0.23930130004882813, "mean_token_accuracy": 0.9197874891757966, "num_tokens": 31057058.0, "step": 400 }, { "entropy": 0.24174359649419785, "epoch": 0.01791971965594138, "grad_norm": 2.912916898727417, "learning_rate": 5.9588586595885865e-05, "loss": 0.2378847885131836, "mean_token_accuracy": 0.9206177514791488, "num_tokens": 34886145.0, "step": 450 }, { "entropy": 0.23314271196722985, "epoch": 0.019910799617712648, "grad_norm": 0.5054332613945007, "learning_rate": 6.622428666224287e-05, "loss": 0.2341362190246582, "mean_token_accuracy": 0.9219391363859176, "num_tokens": 38822339.0, "step": 500 }, { "entropy": 0.24051452845335006, "epoch": 0.02190187957948391, "grad_norm": 0.5167355537414551, "learning_rate": 7.285998672859987e-05, "loss": 0.24161724090576173, "mean_token_accuracy": 0.9203771650791168, "num_tokens": 42957563.0, "step": 550 }, { "entropy": 0.2295207805931568, "epoch": 0.023892959541255178, "grad_norm": 0.9762596487998962, "learning_rate": 7.949568679495687e-05, "loss": 0.2272401809692383, "mean_token_accuracy": 0.9232405090332031, "num_tokens": 46768583.0, "step": 600 }, { "entropy": 0.23686898455023767, "epoch": 0.02588403950302644, "grad_norm": 0.466611385345459, "learning_rate": 8.613138686131386e-05, "loss": 0.23224437713623047, "mean_token_accuracy": 0.9218472588062286, "num_tokens": 50645803.0, "step": 650 }, { "entropy": 0.23130884274840355, "epoch": 0.027875119464797708, "grad_norm": 0.38592949509620667, "learning_rate": 9.276708692767087e-05, "loss": 0.23153045654296875, "mean_token_accuracy": 0.9227015018463135, "num_tokens": 54572014.0, "step": 700 }, { "entropy": 0.23954722553491592, "epoch": 0.02986619942656897, "grad_norm": 0.3463596999645233, "learning_rate": 9.940278699402787e-05, "loss": 0.24017810821533203, "mean_token_accuracy": 0.9208958899974823, "num_tokens": 58564303.0, "step": 750 }, { "entropy": 0.23351749897003174, "epoch": 0.03185727938834024, "grad_norm": 0.44391459226608276, "learning_rate": 0.00010603848706038488, "loss": 0.23203353881835936, "mean_token_accuracy": 0.9222453135251999, "num_tokens": 62457510.0, "step": 800 }, { "entropy": 0.2437037083506584, "epoch": 0.033848359350111504, "grad_norm": 0.5019763112068176, "learning_rate": 0.00011267418712674188, "loss": 0.24389320373535156, "mean_token_accuracy": 0.9196780633926391, "num_tokens": 66530019.0, "step": 850 }, { "entropy": 0.22831465810537338, "epoch": 0.03583943931188276, "grad_norm": 0.33829352259635925, "learning_rate": 0.00011930988719309889, "loss": 0.2317771339416504, "mean_token_accuracy": 0.9224331545829773, "num_tokens": 70424005.0, "step": 900 }, { "entropy": 0.22766645520925521, "epoch": 0.03783051927365403, "grad_norm": 0.5179854035377502, "learning_rate": 0.00012594558725945588, "loss": 0.22764064788818358, "mean_token_accuracy": 0.923973958492279, "num_tokens": 74253770.0, "step": 950 }, { "entropy": 0.23552999064326285, "epoch": 0.039821599235425297, "grad_norm": 0.44404569268226624, "learning_rate": 0.00013258128732581288, "loss": 0.23626502990722656, "mean_token_accuracy": 0.9216047769784927, "num_tokens": 78182200.0, "step": 1000 }, { "entropy": 0.22930314570665358, "epoch": 0.041812679197196556, "grad_norm": 0.448462575674057, "learning_rate": 0.00013921698739216987, "loss": 0.23278812408447266, "mean_token_accuracy": 0.9230523258447647, "num_tokens": 81937838.0, "step": 1050 }, { "entropy": 0.23650458663702012, "epoch": 0.04380375915896782, "grad_norm": 0.3995441794395447, "learning_rate": 0.00014585268745852687, "loss": 0.23656768798828126, "mean_token_accuracy": 0.9211232715845108, "num_tokens": 85927588.0, "step": 1100 }, { "entropy": 0.23935676783323287, "epoch": 0.04579483912073909, "grad_norm": 0.39098668098449707, "learning_rate": 0.00015248838752488387, "loss": 0.2379437255859375, "mean_token_accuracy": 0.921039087176323, "num_tokens": 89882949.0, "step": 1150 }, { "entropy": 0.24524856984615326, "epoch": 0.047785919082510356, "grad_norm": 0.4632549583911896, "learning_rate": 0.0001591240875912409, "loss": 0.24808704376220703, "mean_token_accuracy": 0.9186844676733017, "num_tokens": 93855605.0, "step": 1200 }, { "entropy": 0.23450494036078454, "epoch": 0.049776999044281615, "grad_norm": 0.4616311490535736, "learning_rate": 0.0001657597876575979, "loss": 0.23671966552734375, "mean_token_accuracy": 0.9223334664106368, "num_tokens": 97726256.0, "step": 1250 }, { "entropy": 0.23849584758281708, "epoch": 0.05176807900605288, "grad_norm": 0.5183118581771851, "learning_rate": 0.00017239548772395488, "loss": 0.2390594482421875, "mean_token_accuracy": 0.9210267335176467, "num_tokens": 101712424.0, "step": 1300 }, { "entropy": 0.24750934526324272, "epoch": 0.05375915896782415, "grad_norm": 0.6962779760360718, "learning_rate": 0.0001790311877903119, "loss": 0.2504555702209473, "mean_token_accuracy": 0.9193422102928162, "num_tokens": 105526982.0, "step": 1350 }, { "entropy": 0.25117891386151314, "epoch": 0.055750238929595415, "grad_norm": 1.4407775402069092, "learning_rate": 0.00018566688785666888, "loss": 0.2523708534240723, "mean_token_accuracy": 0.9178527224063874, "num_tokens": 109426865.0, "step": 1400 }, { "entropy": 0.247833551466465, "epoch": 0.057741318891366675, "grad_norm": 1.0299957990646362, "learning_rate": 0.0001923025879230259, "loss": 0.2527511787414551, "mean_token_accuracy": 0.918297466635704, "num_tokens": 113259105.0, "step": 1450 }, { "entropy": 0.2641977226734161, "epoch": 0.05973239885313794, "grad_norm": 0.5299701690673828, "learning_rate": 0.0001989382879893829, "loss": 0.2680278015136719, "mean_token_accuracy": 0.9148374336957932, "num_tokens": 117180907.0, "step": 1500 }, { "epoch": 0.05973239885313794, "eval_entropy": 0.238698192295574, "eval_loss": 0.25736984610557556, "eval_mean_token_accuracy": 0.9147308885105072, "eval_num_tokens": 117180907.0, "eval_runtime": 97.8199, "eval_samples_per_second": 10.223, "eval_steps_per_second": 0.644, "step": 1500 }, { "entropy": 0.26027600586414334, "epoch": 0.06172347881490921, "grad_norm": 0.49680882692337036, "learning_rate": 0.00019999963321886343, "loss": 0.2606443786621094, "mean_token_accuracy": 0.9150975352525711, "num_tokens": 121066461.0, "step": 1550 }, { "entropy": 0.2638482017815113, "epoch": 0.06371455877668047, "grad_norm": 0.4531654119491577, "learning_rate": 0.00019999824011999318, "loss": 0.26884456634521486, "mean_token_accuracy": 0.9154274082183838, "num_tokens": 124953674.0, "step": 1600 }, { "entropy": 0.26387491196393964, "epoch": 0.06570563873845174, "grad_norm": 0.5205627083778381, "learning_rate": 0.0001999958074106123, "loss": 0.26874935150146484, "mean_token_accuracy": 0.9152652221918106, "num_tokens": 128863995.0, "step": 1650 }, { "entropy": 0.2617137129604816, "epoch": 0.06769671870022301, "grad_norm": 0.5326299071311951, "learning_rate": 0.00019999233511601205, "loss": 0.26520500183105467, "mean_token_accuracy": 0.9143794012069703, "num_tokens": 132781419.0, "step": 1700 }, { "entropy": 0.2951073496043682, "epoch": 0.06968779866199426, "grad_norm": 1.5515563488006592, "learning_rate": 0.00019998782327229132, "loss": 0.2992689514160156, "mean_token_accuracy": 0.9068609338998794, "num_tokens": 136746142.0, "step": 1750 }, { "entropy": 0.2911060942709446, "epoch": 0.07167887862376553, "grad_norm": 0.9882198572158813, "learning_rate": 0.00019998227192635662, "loss": 0.2912177658081055, "mean_token_accuracy": 0.9083128577470779, "num_tokens": 140635934.0, "step": 1800 }, { "entropy": 0.30583499386906626, "epoch": 0.0736699585855368, "grad_norm": 0.9490135312080383, "learning_rate": 0.00019997568113592123, "loss": 0.30314250946044924, "mean_token_accuracy": 0.9060158902406692, "num_tokens": 144351764.0, "step": 1850 }, { "entropy": 0.29104826986789706, "epoch": 0.07566103854730806, "grad_norm": 0.5743433833122253, "learning_rate": 0.00019996805096950495, "loss": 0.2896587562561035, "mean_token_accuracy": 0.9093901348114014, "num_tokens": 148317341.0, "step": 1900 }, { "entropy": 0.2791394780576229, "epoch": 0.07765211850907933, "grad_norm": 0.6630957722663879, "learning_rate": 0.00019995938150643323, "loss": 0.27749942779541015, "mean_token_accuracy": 0.9116008925437927, "num_tokens": 152115011.0, "step": 1950 }, { "entropy": 0.2864747692644596, "epoch": 0.07964319847085059, "grad_norm": 0.5167714357376099, "learning_rate": 0.0001999496728368363, "loss": 0.2892703628540039, "mean_token_accuracy": 0.9101212161779404, "num_tokens": 155955543.0, "step": 2000 }, { "entropy": 0.29486714631319044, "epoch": 0.08163427843262186, "grad_norm": 0.6764300465583801, "learning_rate": 0.00019993892506164817, "loss": 0.2938148880004883, "mean_token_accuracy": 0.907455735206604, "num_tokens": 159950282.0, "step": 2050 }, { "entropy": 0.289661710858345, "epoch": 0.08362535839439311, "grad_norm": 1.3380991220474243, "learning_rate": 0.00019992713829260596, "loss": 0.29367408752441404, "mean_token_accuracy": 0.9090178072452545, "num_tokens": 163946195.0, "step": 2100 }, { "entropy": 0.2813515478372574, "epoch": 0.08561643835616438, "grad_norm": 0.5605268478393555, "learning_rate": 0.00019991431265224826, "loss": 0.28127031326293944, "mean_token_accuracy": 0.9111650967597962, "num_tokens": 167803895.0, "step": 2150 }, { "entropy": 0.2813937878608704, "epoch": 0.08760751831793565, "grad_norm": 0.545811653137207, "learning_rate": 0.0001999004482739141, "loss": 0.2833607864379883, "mean_token_accuracy": 0.9109566658735275, "num_tokens": 171609856.0, "step": 2200 }, { "entropy": 0.27727267012000084, "epoch": 0.08959859827970691, "grad_norm": 7.048864364624023, "learning_rate": 0.00019988554530174155, "loss": 0.27622432708740235, "mean_token_accuracy": 0.912345079779625, "num_tokens": 175465546.0, "step": 2250 }, { "entropy": 0.28270753011107447, "epoch": 0.09158967824147818, "grad_norm": 0.6423642635345459, "learning_rate": 0.00019986960389066624, "loss": 0.27773189544677734, "mean_token_accuracy": 0.9109648811817169, "num_tokens": 179431473.0, "step": 2300 }, { "entropy": 0.2899395690858364, "epoch": 0.09358075820324945, "grad_norm": 0.675128161907196, "learning_rate": 0.00019985262420641964, "loss": 0.29255908966064453, "mean_token_accuracy": 0.9083035236597061, "num_tokens": 183254030.0, "step": 2350 }, { "entropy": 0.2949830622971058, "epoch": 0.09557183816502071, "grad_norm": 0.7517677545547485, "learning_rate": 0.00019983460642552747, "loss": 0.2965231704711914, "mean_token_accuracy": 0.9082889229059219, "num_tokens": 187001777.0, "step": 2400 }, { "entropy": 0.2832724647223949, "epoch": 0.09756291812679198, "grad_norm": 5.088311195373535, "learning_rate": 0.00019981555073530772, "loss": 0.2839857864379883, "mean_token_accuracy": 0.9105693870782852, "num_tokens": 190883577.0, "step": 2450 }, { "entropy": 0.291139078438282, "epoch": 0.09955399808856323, "grad_norm": 0.8445279598236084, "learning_rate": 0.0001997954573338689, "loss": 0.2915267562866211, "mean_token_accuracy": 0.9080010551214218, "num_tokens": 194770386.0, "step": 2500 }, { "entropy": 0.28031437411904336, "epoch": 0.1015450780503345, "grad_norm": 0.6642708778381348, "learning_rate": 0.00019977432643010775, "loss": 0.28441873550415037, "mean_token_accuracy": 0.9110708701610565, "num_tokens": 198620457.0, "step": 2550 }, { "entropy": 0.27880264043807984, "epoch": 0.10353615801210576, "grad_norm": 0.8699315786361694, "learning_rate": 0.0001997521582437072, "loss": 0.27945274353027344, "mean_token_accuracy": 0.911846690773964, "num_tokens": 202386820.0, "step": 2600 }, { "entropy": 0.2867648507654667, "epoch": 0.10552723797387703, "grad_norm": 1.2071722745895386, "learning_rate": 0.00019972895300513418, "loss": 0.2882248497009277, "mean_token_accuracy": 0.9101024943590165, "num_tokens": 206364615.0, "step": 2650 }, { "entropy": 0.304570385068655, "epoch": 0.1075183179356483, "grad_norm": 4.0775251388549805, "learning_rate": 0.000199704710955637, "loss": 0.3016018295288086, "mean_token_accuracy": 0.9069358545541764, "num_tokens": 210183973.0, "step": 2700 }, { "entropy": 0.3049754598736763, "epoch": 0.10950939789741956, "grad_norm": 1.0843818187713623, "learning_rate": 0.00019967943234724302, "loss": 0.3067584419250488, "mean_token_accuracy": 0.9062304347753525, "num_tokens": 214136281.0, "step": 2750 }, { "entropy": 0.29823502883315084, "epoch": 0.11150047785919083, "grad_norm": 0.6775873899459839, "learning_rate": 0.00019965311744275587, "loss": 0.29334327697753904, "mean_token_accuracy": 0.9081481236219406, "num_tokens": 217930544.0, "step": 2800 }, { "entropy": 0.3078458538651466, "epoch": 0.1134915578209621, "grad_norm": 0.7490587830543518, "learning_rate": 0.00019962576651575296, "loss": 0.3025942230224609, "mean_token_accuracy": 0.905663657784462, "num_tokens": 221877887.0, "step": 2850 }, { "entropy": 0.30110266715288164, "epoch": 0.11548263778273335, "grad_norm": 0.6697282791137695, "learning_rate": 0.00019959737985058234, "loss": 0.3010330581665039, "mean_token_accuracy": 0.9064904636144638, "num_tokens": 225627001.0, "step": 2900 }, { "entropy": 0.2984598980844021, "epoch": 0.11747371774450462, "grad_norm": 0.8348047733306885, "learning_rate": 0.00019956795774235997, "loss": 0.29577600479125976, "mean_token_accuracy": 0.9069764482975006, "num_tokens": 229611801.0, "step": 2950 }, { "entropy": 0.29838990807533267, "epoch": 0.11946479770627588, "grad_norm": 1.1875905990600586, "learning_rate": 0.00019953750049696658, "loss": 0.2987412643432617, "mean_token_accuracy": 0.9088970798254014, "num_tokens": 233561259.0, "step": 3000 }, { "epoch": 0.11946479770627588, "eval_entropy": 0.3022507036489154, "eval_loss": 0.30308812856674194, "eval_mean_token_accuracy": 0.9028340615923443, "eval_num_tokens": 233561259.0, "eval_runtime": 97.5155, "eval_samples_per_second": 10.255, "eval_steps_per_second": 0.646, "step": 3000 }, { "entropy": 0.29537968412041665, "epoch": 0.12145587766804715, "grad_norm": 0.8750671744346619, "learning_rate": 0.00019950600843104445, "loss": 0.29412849426269533, "mean_token_accuracy": 0.9083840191364289, "num_tokens": 237437091.0, "step": 3050 }, { "entropy": 0.30670097917318345, "epoch": 0.12344695762981842, "grad_norm": 2.4987075328826904, "learning_rate": 0.0001994734818719942, "loss": 0.30259759902954103, "mean_token_accuracy": 0.9058998501300812, "num_tokens": 241436828.0, "step": 3100 }, { "entropy": 0.29469338595867156, "epoch": 0.12543803759158967, "grad_norm": 1.7380224466323853, "learning_rate": 0.00019943992115797126, "loss": 0.2931842803955078, "mean_token_accuracy": 0.9096289926767349, "num_tokens": 245351552.0, "step": 3150 }, { "entropy": 0.29411437809467317, "epoch": 0.12742911755336095, "grad_norm": 0.7798497676849365, "learning_rate": 0.0001994053266378825, "loss": 0.2951908874511719, "mean_token_accuracy": 0.9085562580823898, "num_tokens": 249301096.0, "step": 3200 }, { "entropy": 0.2993234470486641, "epoch": 0.1294201975151322, "grad_norm": 0.8817734718322754, "learning_rate": 0.00019936969867138254, "loss": 0.30352956771850587, "mean_token_accuracy": 0.9072857981920243, "num_tokens": 253277622.0, "step": 3250 }, { "entropy": 0.29699300721287725, "epoch": 0.13141127747690348, "grad_norm": 1.2130342721939087, "learning_rate": 0.00019933303762886996, "loss": 0.29787822723388674, "mean_token_accuracy": 0.9083835577964783, "num_tokens": 257227304.0, "step": 3300 }, { "entropy": 0.29587675660848617, "epoch": 0.13340235743867473, "grad_norm": 0.5530600547790527, "learning_rate": 0.00019929534389148354, "loss": 0.29798791885375975, "mean_token_accuracy": 0.908504787683487, "num_tokens": 261108205.0, "step": 3350 }, { "entropy": 0.29003412410616874, "epoch": 0.13539343740044602, "grad_norm": 0.8571836948394775, "learning_rate": 0.00019925661785109822, "loss": 0.2917255973815918, "mean_token_accuracy": 0.9100581562519073, "num_tokens": 265017318.0, "step": 3400 }, { "entropy": 0.30487392365932464, "epoch": 0.13738451736221727, "grad_norm": 0.8164399862289429, "learning_rate": 0.00019921685991032106, "loss": 0.30083534240722654, "mean_token_accuracy": 0.9061442995071411, "num_tokens": 268861028.0, "step": 3450 }, { "entropy": 0.2943995995819569, "epoch": 0.13937559732398852, "grad_norm": 0.7428765296936035, "learning_rate": 0.00019917607048248708, "loss": 0.29643802642822265, "mean_token_accuracy": 0.9087468749284744, "num_tokens": 272883824.0, "step": 3500 }, { "entropy": 0.2999743050336838, "epoch": 0.1413666772857598, "grad_norm": 0.6750977039337158, "learning_rate": 0.0001991342499916549, "loss": 0.29727874755859374, "mean_token_accuracy": 0.9070488250255585, "num_tokens": 276710051.0, "step": 3550 }, { "entropy": 0.2862047958374023, "epoch": 0.14335775724753105, "grad_norm": 0.891075074672699, "learning_rate": 0.0001990913988726024, "loss": 0.2836902618408203, "mean_token_accuracy": 0.9103441405296325, "num_tokens": 280668466.0, "step": 3600 }, { "entropy": 0.2909073846042156, "epoch": 0.14534883720930233, "grad_norm": 0.6584152579307556, "learning_rate": 0.00019904751757082219, "loss": 0.2913536262512207, "mean_token_accuracy": 0.9092260366678238, "num_tokens": 284596662.0, "step": 3650 }, { "entropy": 0.295346038043499, "epoch": 0.1473399171710736, "grad_norm": 1.0523701906204224, "learning_rate": 0.00019900260654251689, "loss": 0.297835636138916, "mean_token_accuracy": 0.907945249080658, "num_tokens": 288479589.0, "step": 3700 }, { "entropy": 0.2844700115919113, "epoch": 0.14933099713284487, "grad_norm": 0.5819393992424011, "learning_rate": 0.0001989566662545945, "loss": 0.2872531509399414, "mean_token_accuracy": 0.9114671903848648, "num_tokens": 292311632.0, "step": 3750 }, { "entropy": 0.28947981700301173, "epoch": 0.15132207709461612, "grad_norm": 0.5562146306037903, "learning_rate": 0.00019890969718466345, "loss": 0.28745689392089846, "mean_token_accuracy": 0.9094958698749542, "num_tokens": 296097039.0, "step": 3800 }, { "entropy": 0.29930747270584107, "epoch": 0.15331315705638737, "grad_norm": 0.6150246262550354, "learning_rate": 0.0001988616998210278, "loss": 0.29687225341796875, "mean_token_accuracy": 0.9068776845932007, "num_tokens": 299857385.0, "step": 3850 }, { "entropy": 0.28908350199460986, "epoch": 0.15530423701815865, "grad_norm": 0.5917616486549377, "learning_rate": 0.0001988126746626819, "loss": 0.2879753112792969, "mean_token_accuracy": 0.9093427962064743, "num_tokens": 303701551.0, "step": 3900 }, { "entropy": 0.28460383400321004, "epoch": 0.1572953169799299, "grad_norm": 0.6134833693504333, "learning_rate": 0.00019876262221930544, "loss": 0.2821200752258301, "mean_token_accuracy": 0.9112467098236084, "num_tokens": 307464728.0, "step": 3950 }, { "entropy": 0.2812545415759087, "epoch": 0.15928639694170119, "grad_norm": 0.741555392742157, "learning_rate": 0.00019871154301125802, "loss": 0.28286741256713865, "mean_token_accuracy": 0.9115043008327484, "num_tokens": 311352582.0, "step": 4000 }, { "entropy": 0.29000384598970413, "epoch": 0.16127747690347244, "grad_norm": 0.5392553210258484, "learning_rate": 0.00019865943756957385, "loss": 0.2881851005554199, "mean_token_accuracy": 0.9097525632381439, "num_tokens": 315178809.0, "step": 4050 }, { "entropy": 0.2849612885713577, "epoch": 0.16326855686524372, "grad_norm": 0.6325093507766724, "learning_rate": 0.0001986063064359561, "loss": 0.28987804412841794, "mean_token_accuracy": 0.9114274823665619, "num_tokens": 319128941.0, "step": 4100 }, { "entropy": 0.28891856864094734, "epoch": 0.16525963682701497, "grad_norm": 0.6090471744537354, "learning_rate": 0.0001985521501627713, "loss": 0.2873344421386719, "mean_token_accuracy": 0.9105158835649491, "num_tokens": 323051101.0, "step": 4150 }, { "entropy": 0.27601037934422495, "epoch": 0.16725071678878622, "grad_norm": 0.5414860844612122, "learning_rate": 0.0001984969693130437, "loss": 0.2741785430908203, "mean_token_accuracy": 0.9122807896137237, "num_tokens": 327024528.0, "step": 4200 }, { "entropy": 0.2906373116374016, "epoch": 0.1692417967505575, "grad_norm": 1.431944727897644, "learning_rate": 0.0001984407644604493, "loss": 0.29466737747192384, "mean_token_accuracy": 0.9092401885986328, "num_tokens": 331009920.0, "step": 4250 }, { "entropy": 0.2901481683552265, "epoch": 0.17123287671232876, "grad_norm": 0.6499968767166138, "learning_rate": 0.0001983835361893099, "loss": 0.2953326416015625, "mean_token_accuracy": 0.9093990051746368, "num_tokens": 334868780.0, "step": 4300 }, { "entropy": 0.28857042759656903, "epoch": 0.17322395667410004, "grad_norm": 0.7128919363021851, "learning_rate": 0.0001983252850945872, "loss": 0.28462093353271484, "mean_token_accuracy": 0.9101207864284515, "num_tokens": 338781001.0, "step": 4350 }, { "entropy": 0.2894445453584194, "epoch": 0.1752150366358713, "grad_norm": 0.6674997806549072, "learning_rate": 0.00019826601178187626, "loss": 0.2883860015869141, "mean_token_accuracy": 0.9103347849845886, "num_tokens": 342625321.0, "step": 4400 }, { "entropy": 0.29015815258026123, "epoch": 0.17720611659764257, "grad_norm": 1.1805739402770996, "learning_rate": 0.00019820571686739955, "loss": 0.2924055099487305, "mean_token_accuracy": 0.9087706804275513, "num_tokens": 346524954.0, "step": 4450 }, { "entropy": 0.29237871393561365, "epoch": 0.17919719655941382, "grad_norm": 0.8005287051200867, "learning_rate": 0.00019814440097800035, "loss": 0.2911919403076172, "mean_token_accuracy": 0.9096369504928589, "num_tokens": 350433271.0, "step": 4500 }, { "epoch": 0.17919719655941382, "eval_entropy": 0.28920668079739525, "eval_loss": 0.27546826004981995, "eval_mean_token_accuracy": 0.909925399318574, "eval_num_tokens": 350433271.0, "eval_runtime": 97.8322, "eval_samples_per_second": 10.222, "eval_steps_per_second": 0.644, "step": 4500 }, { "entropy": 0.292726431787014, "epoch": 0.1811882765211851, "grad_norm": 0.6807382702827454, "learning_rate": 0.00019808206475113634, "loss": 0.2953124809265137, "mean_token_accuracy": 0.9097322398424148, "num_tokens": 354258375.0, "step": 4550 }, { "entropy": 0.29881048142910005, "epoch": 0.18317935648295636, "grad_norm": 0.6803342700004578, "learning_rate": 0.00019801870883487288, "loss": 0.3002021408081055, "mean_token_accuracy": 0.9072781252861023, "num_tokens": 358243758.0, "step": 4600 }, { "entropy": 0.2855297502875328, "epoch": 0.1851704364447276, "grad_norm": 0.7521423101425171, "learning_rate": 0.00019795433388787633, "loss": 0.2812104034423828, "mean_token_accuracy": 0.9116834425926208, "num_tokens": 362027461.0, "step": 4650 }, { "entropy": 0.28612853690981865, "epoch": 0.1871615164064989, "grad_norm": 0.751583993434906, "learning_rate": 0.00019788894057940715, "loss": 0.2890420913696289, "mean_token_accuracy": 0.9100965994596482, "num_tokens": 365914009.0, "step": 4700 }, { "entropy": 0.291155586540699, "epoch": 0.18915259636827014, "grad_norm": 0.6980162858963013, "learning_rate": 0.00019782252958931305, "loss": 0.29225175857543945, "mean_token_accuracy": 0.9092732155323029, "num_tokens": 369831495.0, "step": 4750 }, { "entropy": 0.3040496847033501, "epoch": 0.19114367633004142, "grad_norm": 2.299229145050049, "learning_rate": 0.0001977551016080218, "loss": 0.3051426887512207, "mean_token_accuracy": 0.9069945514202118, "num_tokens": 373643390.0, "step": 4800 }, { "entropy": 0.30234193950891497, "epoch": 0.19313475629181268, "grad_norm": 12.250136375427246, "learning_rate": 0.00019768665733653414, "loss": 0.2970439910888672, "mean_token_accuracy": 0.907816288471222, "num_tokens": 377532130.0, "step": 4850 }, { "entropy": 0.3253930774331093, "epoch": 0.19512583625358396, "grad_norm": 602.9488525390625, "learning_rate": 0.0001976171974864164, "loss": 0.3245069122314453, "mean_token_accuracy": 0.9026554811000824, "num_tokens": 381481906.0, "step": 4900 }, { "entropy": 0.43629378005862235, "epoch": 0.1971169162153552, "grad_norm": 9.55897045135498, "learning_rate": 0.00019754672277979323, "loss": 0.503008041381836, "mean_token_accuracy": 0.8766559469699859, "num_tokens": 385427117.0, "step": 4950 }, { "entropy": 1.2075729909539223, "epoch": 0.19910799617712646, "grad_norm": 10.384903907775879, "learning_rate": 0.00019747523394933992, "loss": 1.4099630737304687, "mean_token_accuracy": 0.760298758149147, "num_tokens": 389336381.0, "step": 5000 }, { "entropy": 4.1178853380680085, "epoch": 0.20109907613889774, "grad_norm": 13.629193305969238, "learning_rate": 0.00019740273173827499, "loss": 5.369188232421875, "mean_token_accuracy": 0.2704500517481938, "num_tokens": 393303618.0, "step": 5050 }, { "entropy": 2.060445339679718, "epoch": 0.203090156100669, "grad_norm": 16.477094650268555, "learning_rate": 0.0001973292169003523, "loss": 2.518390808105469, "mean_token_accuracy": 0.6017715675383806, "num_tokens": 397093081.0, "step": 5100 }, { "entropy": 0.7607585701346398, "epoch": 0.20508123606244028, "grad_norm": 153.88894653320312, "learning_rate": 0.00019725469019985333, "loss": 0.813140869140625, "mean_token_accuracy": 0.8155078822374344, "num_tokens": 400936352.0, "step": 5150 }, { "entropy": 0.9180069261789322, "epoch": 0.20707231602421153, "grad_norm": 2.9457428455352783, "learning_rate": 0.00019717915241157903, "loss": 0.9284542846679688, "mean_token_accuracy": 0.7885740977525711, "num_tokens": 404917718.0, "step": 5200 }, { "entropy": 0.3624985629320145, "epoch": 0.2090633959859828, "grad_norm": 0.9943515658378601, "learning_rate": 0.00019710260432084206, "loss": 0.35674095153808594, "mean_token_accuracy": 0.896698716878891, "num_tokens": 408859179.0, "step": 5250 }, { "entropy": 0.9530950874090195, "epoch": 0.21105447594775406, "grad_norm": 1371642.5, "learning_rate": 0.00019702504672345844, "loss": 0.9454847717285156, "mean_token_accuracy": 0.7871760299801827, "num_tokens": 412673154.0, "step": 5300 }, { "entropy": 1.998653382062912, "epoch": 0.2130455559095253, "grad_norm": 31218.666015625, "learning_rate": 0.0001969464804257393, "loss": 2.0618492126464845, "mean_token_accuracy": 0.6287000980228186, "num_tokens": 416647839.0, "step": 5350 }, { "entropy": 0.7908964619040489, "epoch": 0.2150366358712966, "grad_norm": 274.27215576171875, "learning_rate": 0.00019686690624448242, "loss": 0.7396269226074219, "mean_token_accuracy": 0.8199971842765809, "num_tokens": 420594394.0, "step": 5400 }, { "entropy": 0.49078064411878586, "epoch": 0.21702771583306785, "grad_norm": 937.0590209960938, "learning_rate": 0.000196786325006964, "loss": 0.48082077026367187, "mean_token_accuracy": 0.8696271818876267, "num_tokens": 424562376.0, "step": 5450 }, { "entropy": 0.5351789909601211, "epoch": 0.21901879579483913, "grad_norm": 2242.97705078125, "learning_rate": 0.0001967047375509298, "loss": 0.5486760711669922, "mean_token_accuracy": 0.857095856666565, "num_tokens": 428515673.0, "step": 5500 }, { "entropy": 0.426470011472702, "epoch": 0.22100987575661038, "grad_norm": 659.4993896484375, "learning_rate": 0.00019662214472458646, "loss": 0.4073149490356445, "mean_token_accuracy": 0.8857790929079056, "num_tokens": 432280329.0, "step": 5550 }, { "entropy": 0.7251139760017395, "epoch": 0.22300095571838166, "grad_norm": 282.25775146484375, "learning_rate": 0.00019653854738659282, "loss": 0.7429944610595703, "mean_token_accuracy": 0.8232876443862915, "num_tokens": 436242118.0, "step": 5600 }, { "entropy": 0.3698262667655945, "epoch": 0.2249920356801529, "grad_norm": 12.503119468688965, "learning_rate": 0.00019645394640605086, "loss": 0.3565479278564453, "mean_token_accuracy": 0.8944947463274002, "num_tokens": 440146433.0, "step": 5650 }, { "entropy": 0.40973065614700316, "epoch": 0.2269831156419242, "grad_norm": 1084.4339599609375, "learning_rate": 0.0001963683426624968, "loss": 0.3894519805908203, "mean_token_accuracy": 0.8877280789613724, "num_tokens": 443964090.0, "step": 5700 }, { "entropy": 0.35581542521715165, "epoch": 0.22897419560369545, "grad_norm": 16.15648651123047, "learning_rate": 0.0001962817370458918, "loss": 0.33966888427734376, "mean_token_accuracy": 0.8968688982725144, "num_tokens": 448011349.0, "step": 5750 }, { "entropy": 0.3509592401981354, "epoch": 0.2309652755654667, "grad_norm": 6.693056106567383, "learning_rate": 0.00019619413045661276, "loss": 0.34591773986816404, "mean_token_accuracy": 0.8965184450149536, "num_tokens": 451928063.0, "step": 5800 }, { "entropy": 0.36452227845788004, "epoch": 0.23295635552723798, "grad_norm": 5.892772674560547, "learning_rate": 0.00019610552380544305, "loss": 0.36557510375976565, "mean_token_accuracy": 0.8949929642677307, "num_tokens": 455889435.0, "step": 5850 }, { "entropy": 0.4062237656116486, "epoch": 0.23494743548900923, "grad_norm": 381.70843505859375, "learning_rate": 0.00019601591801356297, "loss": 0.39245895385742186, "mean_token_accuracy": 0.8865513950586319, "num_tokens": 459661149.0, "step": 5900 }, { "entropy": 1.057219158411026, "epoch": 0.2369385154507805, "grad_norm": 11522.1162109375, "learning_rate": 0.00019592531401254007, "loss": 1.5552653503417968, "mean_token_accuracy": 0.7360941077768802, "num_tokens": 463672650.0, "step": 5950 }, { "entropy": 0.666157491505146, "epoch": 0.23892959541255177, "grad_norm": 200332.671875, "learning_rate": 0.00019583371274431972, "loss": 0.6437340545654296, "mean_token_accuracy": 0.8398592573404312, "num_tokens": 467497899.0, "step": 6000 }, { "epoch": 0.23892959541255177, "eval_entropy": 0.9302403725801952, "eval_loss": 0.9569904804229736, "eval_mean_token_accuracy": 0.7763322539745815, "eval_num_tokens": 467497899.0, "eval_runtime": 97.7568, "eval_samples_per_second": 10.229, "eval_steps_per_second": 0.644, "step": 6000 }, { "entropy": 2.966293410360813, "epoch": 0.24092067537432305, "grad_norm": 501369.0, "learning_rate": 0.00019574111516121502, "loss": 6.155978393554688, "mean_token_accuracy": 0.2130392006225884, "num_tokens": 471444277.0, "step": 6050 }, { "entropy": 5.9350907564163204, "epoch": 0.2429117553360943, "grad_norm": 6855.62939453125, "learning_rate": 0.0001956475222258972, "loss": 5.958920288085937, "mean_token_accuracy": 0.11675349000841378, "num_tokens": 475364729.0, "step": 6100 }, { "entropy": 5.5845241355896, "epoch": 0.24490283529786555, "grad_norm": 44784.75, "learning_rate": 0.00019555293491138527, "loss": 5.494525146484375, "mean_token_accuracy": 0.16664834439754486, "num_tokens": 479140786.0, "step": 6150 }, { "entropy": 5.335302751064301, "epoch": 0.24689391525963683, "grad_norm": 52592.01953125, "learning_rate": 0.00019545735420103632, "loss": 5.037943725585937, "mean_token_accuracy": 0.20628853604197503, "num_tokens": 483031362.0, "step": 6200 }, { "entropy": 4.4165141177177425, "epoch": 0.24888499522140808, "grad_norm": 310.85443115234375, "learning_rate": 0.0001953607810885349, "loss": 4.302553100585937, "mean_token_accuracy": 0.3041644987463951, "num_tokens": 486844277.0, "step": 6250 }, { "entropy": 2.018350040316582, "epoch": 0.25087607518317934, "grad_norm": 35.01002883911133, "learning_rate": 0.00019526321657788284, "loss": 1.953983612060547, "mean_token_accuracy": 0.6572630336880684, "num_tokens": 490907642.0, "step": 6300 }, { "entropy": 0.8694989970326423, "epoch": 0.2528671551449506, "grad_norm": 5267.51171875, "learning_rate": 0.000195164661683389, "loss": 0.8423341369628906, "mean_token_accuracy": 0.8066436392068863, "num_tokens": 494826463.0, "step": 6350 }, { "entropy": 1.5338060796260833, "epoch": 0.2548582351067219, "grad_norm": 48.75986099243164, "learning_rate": 0.0001950651174296584, "loss": 1.5342300415039063, "mean_token_accuracy": 0.7021114355325699, "num_tokens": 498718456.0, "step": 6400 }, { "entropy": 0.481953441798687, "epoch": 0.2568493150684932, "grad_norm": 11.493451118469238, "learning_rate": 0.0001949645848515818, "loss": 0.4798401641845703, "mean_token_accuracy": 0.8721405351161957, "num_tokens": 502656552.0, "step": 6450 }, { "entropy": 0.3813651466369629, "epoch": 0.2588403950302644, "grad_norm": 3.466660499572754, "learning_rate": 0.00019486306499432482, "loss": 0.3856293487548828, "mean_token_accuracy": 0.890442590713501, "num_tokens": 506485211.0, "step": 6500 }, { "entropy": 0.40147233694791795, "epoch": 0.2608314749920357, "grad_norm": 40.556732177734375, "learning_rate": 0.00019476055891331714, "loss": 0.41530418395996094, "mean_token_accuracy": 0.8841481399536133, "num_tokens": 510331860.0, "step": 6550 }, { "entropy": 0.362121434956789, "epoch": 0.26282255495380696, "grad_norm": 2307.35986328125, "learning_rate": 0.0001946570676742415, "loss": 0.3579364013671875, "mean_token_accuracy": 0.8953806155920029, "num_tokens": 514145400.0, "step": 6600 }, { "entropy": 0.37644080132246016, "epoch": 0.2648136349155782, "grad_norm": 9.581275939941406, "learning_rate": 0.0001945525923530227, "loss": 0.36162376403808594, "mean_token_accuracy": 0.8937028670310974, "num_tokens": 517942120.0, "step": 6650 }, { "entropy": 0.35380700886249544, "epoch": 0.26680471487734947, "grad_norm": 1.5564302206039429, "learning_rate": 0.00019444713403581618, "loss": 0.35733158111572266, "mean_token_accuracy": 0.8964051580429078, "num_tokens": 521893159.0, "step": 6700 }, { "entropy": 0.37363972336053847, "epoch": 0.26879579483912075, "grad_norm": 1.5304275751113892, "learning_rate": 0.00019434069381899706, "loss": 0.37166786193847656, "mean_token_accuracy": 0.8930052673816681, "num_tokens": 525839647.0, "step": 6750 }, { "entropy": 0.38540501803159716, "epoch": 0.27078687480089203, "grad_norm": 2.896862745285034, "learning_rate": 0.00019423327280914844, "loss": 0.3824498748779297, "mean_token_accuracy": 0.8903352475166321, "num_tokens": 529639037.0, "step": 6800 }, { "entropy": 0.36461210548877715, "epoch": 0.27277795476266326, "grad_norm": 1.4935225248336792, "learning_rate": 0.00019412487212305013, "loss": 0.36563232421875, "mean_token_accuracy": 0.8926044535636902, "num_tokens": 533576552.0, "step": 6850 }, { "entropy": 0.36362177550792696, "epoch": 0.27476903472443454, "grad_norm": 17.895999908447266, "learning_rate": 0.00019401549288766687, "loss": 0.3659773635864258, "mean_token_accuracy": 0.8953115308284759, "num_tokens": 537490959.0, "step": 6900 }, { "entropy": 0.3655336833000183, "epoch": 0.2767601146862058, "grad_norm": 5.626742839813232, "learning_rate": 0.00019390513624013668, "loss": 0.36942741394042966, "mean_token_accuracy": 0.894575121998787, "num_tokens": 541390561.0, "step": 6950 }, { "entropy": 0.35650448843836785, "epoch": 0.27875119464797704, "grad_norm": 96.78727722167969, "learning_rate": 0.0001937938033277591, "loss": 0.3513477325439453, "mean_token_accuracy": 0.8967016339302063, "num_tokens": 545281049.0, "step": 7000 }, { "entropy": 0.35293409407138826, "epoch": 0.2807422746097483, "grad_norm": 2.599032402038574, "learning_rate": 0.00019368149530798312, "loss": 0.3563782501220703, "mean_token_accuracy": 0.8972502571344375, "num_tokens": 549276429.0, "step": 7050 }, { "entropy": 0.35024922251701357, "epoch": 0.2827333545715196, "grad_norm": 0.8024204969406128, "learning_rate": 0.0001935682133483953, "loss": 0.34738357543945314, "mean_token_accuracy": 0.8967534548044205, "num_tokens": 553205921.0, "step": 7100 }, { "entropy": 0.3569410502910614, "epoch": 0.2847244345332909, "grad_norm": 1.7590816020965576, "learning_rate": 0.0001934539586267075, "loss": 0.3522836685180664, "mean_token_accuracy": 0.8969353812932969, "num_tokens": 557069513.0, "step": 7150 }, { "entropy": 0.3849373859167099, "epoch": 0.2867155144950621, "grad_norm": 46.36662292480469, "learning_rate": 0.00019333873233074472, "loss": 0.39945281982421876, "mean_token_accuracy": 0.8912153190374374, "num_tokens": 560866827.0, "step": 7200 }, { "entropy": 0.40855299681425095, "epoch": 0.2887065944568334, "grad_norm": 9.179975509643555, "learning_rate": 0.0001932225356584327, "loss": 0.42264102935791015, "mean_token_accuracy": 0.8837257975339889, "num_tokens": 564787263.0, "step": 7250 }, { "entropy": 0.37339140236377716, "epoch": 0.29069767441860467, "grad_norm": 1.1612548828125, "learning_rate": 0.0001931053698177856, "loss": 0.3683134841918945, "mean_token_accuracy": 0.8944310307502746, "num_tokens": 568512960.0, "step": 7300 }, { "entropy": 0.3807790431380272, "epoch": 0.2926887543803759, "grad_norm": 1.9693306684494019, "learning_rate": 0.00019298723602689317, "loss": 0.3835409545898438, "mean_token_accuracy": 0.8914188152551651, "num_tokens": 572379891.0, "step": 7350 }, { "entropy": 0.37928400114178656, "epoch": 0.2946798343421472, "grad_norm": 1.244362235069275, "learning_rate": 0.00019286813551390837, "loss": 0.380733757019043, "mean_token_accuracy": 0.8911453211307525, "num_tokens": 576081528.0, "step": 7400 }, { "entropy": 0.3649085074663162, "epoch": 0.29667091430391845, "grad_norm": 0.8187659978866577, "learning_rate": 0.00019274806951703445, "loss": 0.3639445495605469, "mean_token_accuracy": 0.894467893242836, "num_tokens": 579946103.0, "step": 7450 }, { "entropy": 0.36849416941404345, "epoch": 0.29866199426568973, "grad_norm": 1.0430868864059448, "learning_rate": 0.00019262703928451207, "loss": 0.3664413833618164, "mean_token_accuracy": 0.8947416061162948, "num_tokens": 583781528.0, "step": 7500 }, { "epoch": 0.29866199426568973, "eval_entropy": 0.34230647933861563, "eval_loss": 0.3402383327484131, "eval_mean_token_accuracy": 0.8959205642579093, "eval_num_tokens": 583781528.0, "eval_runtime": 97.7872, "eval_samples_per_second": 10.226, "eval_steps_per_second": 0.644, "step": 7500 }, { "entropy": 0.37259786248207094, "epoch": 0.30065307422746096, "grad_norm": 0.8896583914756775, "learning_rate": 0.0001925050460746064, "loss": 0.3731904602050781, "mean_token_accuracy": 0.8927891421318054, "num_tokens": 587722557.0, "step": 7550 }, { "entropy": 0.37399895280599593, "epoch": 0.30264415418923224, "grad_norm": 1.1005648374557495, "learning_rate": 0.000192382091155594, "loss": 0.37042266845703126, "mean_token_accuracy": 0.8932842481136322, "num_tokens": 591520045.0, "step": 7600 }, { "entropy": 0.3673844130337238, "epoch": 0.3046352341510035, "grad_norm": 1.466604232788086, "learning_rate": 0.00019225817580574965, "loss": 0.3599439239501953, "mean_token_accuracy": 0.8947141844034195, "num_tokens": 595316335.0, "step": 7650 }, { "entropy": 0.36627118915319445, "epoch": 0.30662631411277474, "grad_norm": 1.2781370878219604, "learning_rate": 0.000192133301313333, "loss": 0.3659734344482422, "mean_token_accuracy": 0.8943902653455734, "num_tokens": 599157999.0, "step": 7700 }, { "entropy": 0.35352533668279645, "epoch": 0.308617394074546, "grad_norm": 1.158922791481018, "learning_rate": 0.0001920074689765752, "loss": 0.3468752670288086, "mean_token_accuracy": 0.8980030977725982, "num_tokens": 603082301.0, "step": 7750 }, { "entropy": 0.34789875760674477, "epoch": 0.3106084740363173, "grad_norm": 0.880212128162384, "learning_rate": 0.00019188068010366554, "loss": 0.34264190673828127, "mean_token_accuracy": 0.8996097964048385, "num_tokens": 607008342.0, "step": 7800 }, { "entropy": 0.34500489801168444, "epoch": 0.3125995539980886, "grad_norm": 14.691442489624023, "learning_rate": 0.00019175293601273764, "loss": 0.34683135986328123, "mean_token_accuracy": 0.8989066386222839, "num_tokens": 610911357.0, "step": 7850 }, { "entropy": 0.35687451854348184, "epoch": 0.3145906339598598, "grad_norm": 1.848387360572815, "learning_rate": 0.00019162423803185588, "loss": 0.35826019287109373, "mean_token_accuracy": 0.8975167566537857, "num_tokens": 614717230.0, "step": 7900 }, { "entropy": 0.35088829398155214, "epoch": 0.3165817139216311, "grad_norm": 0.8692337274551392, "learning_rate": 0.00019149458749900152, "loss": 0.34867095947265625, "mean_token_accuracy": 0.8979580408334732, "num_tokens": 618525149.0, "step": 7950 }, { "entropy": 0.3300197960436344, "epoch": 0.31857279388340237, "grad_norm": 2.092395782470703, "learning_rate": 0.00019136398576205887, "loss": 0.3315239334106445, "mean_token_accuracy": 0.9027900397777557, "num_tokens": 622547718.0, "step": 8000 }, { "entropy": 0.3332029429078102, "epoch": 0.3205638738451736, "grad_norm": 1.8703268766403198, "learning_rate": 0.0001912324341788012, "loss": 0.3339826202392578, "mean_token_accuracy": 0.9025326895713807, "num_tokens": 626427568.0, "step": 8050 }, { "entropy": 0.33984847337007523, "epoch": 0.3225549538069449, "grad_norm": 1.5212745666503906, "learning_rate": 0.00019109993411687664, "loss": 0.33795059204101563, "mean_token_accuracy": 0.9009978342056274, "num_tokens": 630210962.0, "step": 8100 }, { "entropy": 0.3363041001558304, "epoch": 0.32454603376871616, "grad_norm": 1.234013319015503, "learning_rate": 0.0001909664869537941, "loss": 0.3278226470947266, "mean_token_accuracy": 0.9014317804574966, "num_tokens": 634125543.0, "step": 8150 }, { "entropy": 0.3360677129030228, "epoch": 0.32653711373048744, "grad_norm": 1.0590438842773438, "learning_rate": 0.0001908320940769086, "loss": 0.3332764434814453, "mean_token_accuracy": 0.9014078599214553, "num_tokens": 637941773.0, "step": 8200 }, { "entropy": 0.34391440004110335, "epoch": 0.32852819369225866, "grad_norm": 0.9203246235847473, "learning_rate": 0.00019069675688340726, "loss": 0.340236701965332, "mean_token_accuracy": 0.898968591094017, "num_tokens": 641798240.0, "step": 8250 }, { "entropy": 0.34178978830575946, "epoch": 0.33051927365402994, "grad_norm": 0.9042324423789978, "learning_rate": 0.00019056047678029457, "loss": 0.33527900695800783, "mean_token_accuracy": 0.9003325819969177, "num_tokens": 645536522.0, "step": 8300 }, { "entropy": 0.3407294301688671, "epoch": 0.3325103536158012, "grad_norm": 1.2946654558181763, "learning_rate": 0.00019042325518437767, "loss": 0.33740230560302736, "mean_token_accuracy": 0.8995247167348862, "num_tokens": 649471189.0, "step": 8350 }, { "entropy": 0.34715739250183103, "epoch": 0.33450143357757245, "grad_norm": 2.5181047916412354, "learning_rate": 0.00019028509352225184, "loss": 0.34464599609375, "mean_token_accuracy": 0.8989213883876801, "num_tokens": 653419486.0, "step": 8400 }, { "entropy": 0.34275659039616585, "epoch": 0.33649251353934373, "grad_norm": 2.0157740116119385, "learning_rate": 0.0001901459932302855, "loss": 0.3392407989501953, "mean_token_accuracy": 0.8996652096509934, "num_tokens": 657395348.0, "step": 8450 }, { "entropy": 0.3413443921506405, "epoch": 0.338483593501115, "grad_norm": 1.2651079893112183, "learning_rate": 0.00019000595575460538, "loss": 0.3354787826538086, "mean_token_accuracy": 0.8999969434738159, "num_tokens": 661309063.0, "step": 8500 }, { "entropy": 0.3259673485159874, "epoch": 0.3404746734628863, "grad_norm": 3.185722827911377, "learning_rate": 0.0001898649825510814, "loss": 0.32872161865234373, "mean_token_accuracy": 0.9023973035812378, "num_tokens": 665351968.0, "step": 8550 }, { "entropy": 0.32777484819293023, "epoch": 0.3424657534246575, "grad_norm": 1.12962806224823, "learning_rate": 0.00018972307508531157, "loss": 0.32322891235351564, "mean_token_accuracy": 0.9025442850589752, "num_tokens": 669185049.0, "step": 8600 }, { "entropy": 0.3300194789469242, "epoch": 0.3444568333864288, "grad_norm": 1.0274972915649414, "learning_rate": 0.00018958023483260685, "loss": 0.3235230255126953, "mean_token_accuracy": 0.9018253254890441, "num_tokens": 673207624.0, "step": 8650 }, { "entropy": 0.32774477630853655, "epoch": 0.3464479133482001, "grad_norm": 7.125645160675049, "learning_rate": 0.00018943646327797563, "loss": 0.32126655578613283, "mean_token_accuracy": 0.9035478168725968, "num_tokens": 677078148.0, "step": 8700 }, { "entropy": 0.32380919888615606, "epoch": 0.3484389933099713, "grad_norm": 3.365225076675415, "learning_rate": 0.00018929176191610834, "loss": 0.327957763671875, "mean_token_accuracy": 0.9035161393880844, "num_tokens": 681086478.0, "step": 8750 }, { "entropy": 0.33227564081549643, "epoch": 0.3504300732717426, "grad_norm": 1.3480267524719238, "learning_rate": 0.00018914613225136208, "loss": 0.32949310302734375, "mean_token_accuracy": 0.9014780944585801, "num_tokens": 684932957.0, "step": 8800 }, { "entropy": 0.3357052344083786, "epoch": 0.35242115323351386, "grad_norm": 1.2543643712997437, "learning_rate": 0.00018899957579774482, "loss": 0.3339249038696289, "mean_token_accuracy": 0.90175577044487, "num_tokens": 688754691.0, "step": 8850 }, { "entropy": 0.32843308195471765, "epoch": 0.35441223319528514, "grad_norm": 1.2409096956253052, "learning_rate": 0.00018885209407889963, "loss": 0.32397491455078126, "mean_token_accuracy": 0.9031638616323471, "num_tokens": 692624575.0, "step": 8900 }, { "entropy": 0.33613822489976886, "epoch": 0.35640331315705637, "grad_norm": 0.8692443370819092, "learning_rate": 0.00018870368862808893, "loss": 0.3323232650756836, "mean_token_accuracy": 0.9011309146881104, "num_tokens": 696555101.0, "step": 8950 }, { "entropy": 0.3358862918615341, "epoch": 0.35839439311882765, "grad_norm": 0.9862300753593445, "learning_rate": 0.0001885543609881786, "loss": 0.3345521926879883, "mean_token_accuracy": 0.9014543277025223, "num_tokens": 700464446.0, "step": 9000 }, { "epoch": 0.35839439311882765, "eval_entropy": 0.3540645409671087, "eval_loss": 0.3069337010383606, "eval_mean_token_accuracy": 0.9003797656013852, "eval_num_tokens": 700464446.0, "eval_runtime": 97.6772, "eval_samples_per_second": 10.238, "eval_steps_per_second": 0.645, "step": 9000 }, { "entropy": 0.3317222049832344, "epoch": 0.36038547308059893, "grad_norm": 1.0164847373962402, "learning_rate": 0.00018840411271162175, "loss": 0.32544532775878904, "mean_token_accuracy": 0.9019567215442658, "num_tokens": 704486622.0, "step": 9050 }, { "entropy": 0.3411662185192108, "epoch": 0.3623765530423702, "grad_norm": 2.0326812267303467, "learning_rate": 0.00018825294536044279, "loss": 0.3403163909912109, "mean_token_accuracy": 0.900407105088234, "num_tokens": 708521341.0, "step": 9100 }, { "entropy": 0.34867027416825297, "epoch": 0.36436763300414143, "grad_norm": 5.65775203704834, "learning_rate": 0.00018810086050622096, "loss": 0.3441625213623047, "mean_token_accuracy": 0.898092051744461, "num_tokens": 712486951.0, "step": 9150 }, { "entropy": 0.3382836529612541, "epoch": 0.3663587129659127, "grad_norm": 3.062307119369507, "learning_rate": 0.0001879478597300743, "loss": 0.33507949829101563, "mean_token_accuracy": 0.900296345949173, "num_tokens": 716374950.0, "step": 9200 }, { "entropy": 0.34634460166096687, "epoch": 0.368349792927684, "grad_norm": 0.9268959760665894, "learning_rate": 0.00018779394462264292, "loss": 0.3423932647705078, "mean_token_accuracy": 0.9000798559188843, "num_tokens": 720399611.0, "step": 9250 }, { "entropy": 0.3209140484035015, "epoch": 0.3703408728894552, "grad_norm": 2.2739686965942383, "learning_rate": 0.00018763911678407262, "loss": 0.31782310485839843, "mean_token_accuracy": 0.9058271765708923, "num_tokens": 724451159.0, "step": 9300 }, { "entropy": 0.3298003524541855, "epoch": 0.3723319528512265, "grad_norm": 1.6039739847183228, "learning_rate": 0.0001874833778239982, "loss": 0.3229019546508789, "mean_token_accuracy": 0.9025483858585358, "num_tokens": 728314361.0, "step": 9350 }, { "entropy": 0.32751597940921784, "epoch": 0.3743230328129978, "grad_norm": 1.0868877172470093, "learning_rate": 0.0001873267293615268, "loss": 0.3307640838623047, "mean_token_accuracy": 0.9025738561153411, "num_tokens": 732403704.0, "step": 9400 }, { "entropy": 0.33524883300065994, "epoch": 0.37631411277476906, "grad_norm": 1.4577653408050537, "learning_rate": 0.00018716917302522088, "loss": 0.3307836151123047, "mean_token_accuracy": 0.9017768156528473, "num_tokens": 736441982.0, "step": 9450 }, { "entropy": 0.3285181725025177, "epoch": 0.3783051927365403, "grad_norm": 2.9845902919769287, "learning_rate": 0.00018701071045308158, "loss": 0.33323326110839846, "mean_token_accuracy": 0.9035674440860748, "num_tokens": 740646337.0, "step": 9500 }, { "entropy": 0.3377829885482788, "epoch": 0.38029627269831157, "grad_norm": 9.927241325378418, "learning_rate": 0.0001868513432925314, "loss": 0.32894989013671877, "mean_token_accuracy": 0.9022834372520446, "num_tokens": 744420398.0, "step": 9550 }, { "entropy": 0.32720001712441443, "epoch": 0.38228735266008285, "grad_norm": 13.3615140914917, "learning_rate": 0.00018669107320039725, "loss": 0.3185526657104492, "mean_token_accuracy": 0.9035963034629821, "num_tokens": 748222636.0, "step": 9600 }, { "entropy": 0.32563656270504, "epoch": 0.38427843262185407, "grad_norm": 1.9300962686538696, "learning_rate": 0.0001865299018428932, "loss": 0.32204307556152345, "mean_token_accuracy": 0.9047492408752441, "num_tokens": 752252628.0, "step": 9650 }, { "entropy": 0.3329929667711258, "epoch": 0.38626951258362535, "grad_norm": 1.4427231550216675, "learning_rate": 0.00018636783089560313, "loss": 0.32571704864501955, "mean_token_accuracy": 0.903377760052681, "num_tokens": 756155491.0, "step": 9700 }, { "entropy": 0.31390463262796403, "epoch": 0.38826059254539663, "grad_norm": 2.628187894821167, "learning_rate": 0.0001862048620434632, "loss": 0.31584739685058594, "mean_token_accuracy": 0.9056806528568268, "num_tokens": 759986563.0, "step": 9750 }, { "entropy": 0.3302036462724209, "epoch": 0.3902516725071679, "grad_norm": 0.9627712965011597, "learning_rate": 0.00018604099698074465, "loss": 0.32947277069091796, "mean_token_accuracy": 0.9025924801826477, "num_tokens": 763977260.0, "step": 9800 }, { "entropy": 0.3402106484770775, "epoch": 0.39224275246893914, "grad_norm": 1.7044585943222046, "learning_rate": 0.00018587623741103584, "loss": 0.33517219543457033, "mean_token_accuracy": 0.8997596955299377, "num_tokens": 767863446.0, "step": 9850 }, { "entropy": 0.3359699550271034, "epoch": 0.3942338324307104, "grad_norm": 3.5311906337738037, "learning_rate": 0.00018571058504722468, "loss": 0.33161392211914065, "mean_token_accuracy": 0.9013146412372589, "num_tokens": 771818608.0, "step": 9900 }, { "entropy": 0.3312606856226921, "epoch": 0.3962249123924817, "grad_norm": 2.716005563735962, "learning_rate": 0.00018554404161148091, "loss": 0.3253916549682617, "mean_token_accuracy": 0.9028956240415573, "num_tokens": 775679110.0, "step": 9950 }, { "entropy": 0.3289224162697792, "epoch": 0.3982159923542529, "grad_norm": 1.4217242002487183, "learning_rate": 0.00018537660883523807, "loss": 0.3240834808349609, "mean_token_accuracy": 0.9021329081058502, "num_tokens": 779749036.0, "step": 10000 }, { "entropy": 0.33332769259810446, "epoch": 0.4002070723160242, "grad_norm": 6.87371826171875, "learning_rate": 0.00018520828845917548, "loss": 0.32686050415039064, "mean_token_accuracy": 0.9011375176906585, "num_tokens": 783452539.0, "step": 10050 }, { "entropy": 1.0259594152867795, "epoch": 0.4021981522777955, "grad_norm": 3533.30126953125, "learning_rate": 0.0001850390822332003, "loss": 0.9963255310058594, "mean_token_accuracy": 0.8286776062846184, "num_tokens": 787264679.0, "step": 10100 }, { "entropy": 0.503859292268753, "epoch": 0.40418923223956676, "grad_norm": 16.601173400878906, "learning_rate": 0.0001848689919164292, "loss": 0.527906494140625, "mean_token_accuracy": 0.8762823796272278, "num_tokens": 791204711.0, "step": 10150 }, { "entropy": 0.33264376640319826, "epoch": 0.406180312201338, "grad_norm": 2.0443027019500732, "learning_rate": 0.00018469801927717012, "loss": 0.3257022476196289, "mean_token_accuracy": 0.9036731535196304, "num_tokens": 795039803.0, "step": 10200 }, { "entropy": 0.34522681057453153, "epoch": 0.40817139216310927, "grad_norm": 1.7004640102386475, "learning_rate": 0.0001845261660929038, "loss": 0.3389078521728516, "mean_token_accuracy": 0.900550023317337, "num_tokens": 798967618.0, "step": 10250 }, { "entropy": 0.3206296694278717, "epoch": 0.41016247212488055, "grad_norm": 1.374759316444397, "learning_rate": 0.00018435343415026554, "loss": 0.31887237548828123, "mean_token_accuracy": 0.9031812793016434, "num_tokens": 802807489.0, "step": 10300 }, { "entropy": 0.3326367573440075, "epoch": 0.4121535520866518, "grad_norm": 2.7548818588256836, "learning_rate": 0.00018417982524502634, "loss": 0.3289806365966797, "mean_token_accuracy": 0.9024446880817414, "num_tokens": 806748487.0, "step": 10350 }, { "entropy": 0.35558821737766266, "epoch": 0.41414463204842306, "grad_norm": 1.5409172773361206, "learning_rate": 0.00018400534118207434, "loss": 0.35315872192382813, "mean_token_accuracy": 0.8966484147310257, "num_tokens": 810571481.0, "step": 10400 }, { "entropy": 0.3421195350587368, "epoch": 0.41613571201019434, "grad_norm": 1.0726041793823242, "learning_rate": 0.0001838299837753962, "loss": 0.3423193359375, "mean_token_accuracy": 0.9004592525959015, "num_tokens": 814548459.0, "step": 10450 }, { "entropy": 0.346246090978384, "epoch": 0.4181267919719656, "grad_norm": 6.47501277923584, "learning_rate": 0.00018365375484805796, "loss": 0.3463835906982422, "mean_token_accuracy": 0.8999297505617142, "num_tokens": 818554549.0, "step": 10500 }, { "epoch": 0.4181267919719656, "eval_entropy": 0.34332345946440623, "eval_loss": 0.32466962933540344, "eval_mean_token_accuracy": 0.897943411554609, "eval_num_tokens": 818554549.0, "eval_runtime": 97.8264, "eval_samples_per_second": 10.222, "eval_steps_per_second": 0.644, "step": 10500 }, { "entropy": 0.3290373648703098, "epoch": 0.42011787193373684, "grad_norm": 2.2451601028442383, "learning_rate": 0.0001834766562321864, "loss": 0.3220062255859375, "mean_token_accuracy": 0.9034412264823913, "num_tokens": 822366765.0, "step": 10550 }, { "entropy": 0.3280380629003048, "epoch": 0.4221089518955081, "grad_norm": 0.9720843434333801, "learning_rate": 0.00018329868976894967, "loss": 0.31923383712768555, "mean_token_accuracy": 0.9032741272449494, "num_tokens": 826285549.0, "step": 10600 }, { "entropy": 0.33660112977027895, "epoch": 0.4241000318572794, "grad_norm": 0.8592673540115356, "learning_rate": 0.00018311985730853843, "loss": 0.3342922210693359, "mean_token_accuracy": 0.9008872789144516, "num_tokens": 830046916.0, "step": 10650 }, { "entropy": 0.3543057516217232, "epoch": 0.4260911118190506, "grad_norm": 1.0152907371520996, "learning_rate": 0.00018294016071014642, "loss": 0.34568778991699217, "mean_token_accuracy": 0.896729109287262, "num_tokens": 833982631.0, "step": 10700 }, { "entropy": 0.3369723661243916, "epoch": 0.4280821917808219, "grad_norm": 0.7823643684387207, "learning_rate": 0.00018275960184195128, "loss": 0.33126594543457033, "mean_token_accuracy": 0.9012682574987412, "num_tokens": 837812830.0, "step": 10750 }, { "entropy": 0.3429368932545185, "epoch": 0.4300732717425932, "grad_norm": 1.8691685199737549, "learning_rate": 0.000182578182581095, "loss": 0.3399934768676758, "mean_token_accuracy": 0.8995037811994553, "num_tokens": 841603806.0, "step": 10800 }, { "entropy": 0.33411232218146325, "epoch": 0.43206435170436447, "grad_norm": 3.0383706092834473, "learning_rate": 0.0001823959048136645, "loss": 0.32936439514160154, "mean_token_accuracy": 0.9018221443891525, "num_tokens": 845494879.0, "step": 10850 }, { "entropy": 0.3343386217951775, "epoch": 0.4340554316661357, "grad_norm": 1.645346999168396, "learning_rate": 0.0001822127704346719, "loss": 0.3314424133300781, "mean_token_accuracy": 0.9026519441604615, "num_tokens": 849314636.0, "step": 10900 }, { "entropy": 0.3347695617377758, "epoch": 0.436046511627907, "grad_norm": 5.8606743812561035, "learning_rate": 0.00018202878134803503, "loss": 0.32734596252441406, "mean_token_accuracy": 0.9020316791534424, "num_tokens": 853257617.0, "step": 10950 }, { "entropy": 0.3335135568678379, "epoch": 0.43803759158967825, "grad_norm": 1.44121515750885, "learning_rate": 0.0001818439394665574, "loss": 0.3274779510498047, "mean_token_accuracy": 0.902123721241951, "num_tokens": 857031141.0, "step": 11000 }, { "entropy": 0.3393210792541504, "epoch": 0.4400286715514495, "grad_norm": 5.344813346862793, "learning_rate": 0.00018165824671190843, "loss": 0.3328717803955078, "mean_token_accuracy": 0.9012005394697189, "num_tokens": 860887023.0, "step": 11050 }, { "entropy": 0.3307928714156151, "epoch": 0.44201975151322076, "grad_norm": 0.6774300932884216, "learning_rate": 0.00018147170501460353, "loss": 0.32967548370361327, "mean_token_accuracy": 0.9018965286016464, "num_tokens": 864790027.0, "step": 11100 }, { "entropy": 0.32985477536916735, "epoch": 0.44401083147499204, "grad_norm": 0.8618547916412354, "learning_rate": 0.00018128431631398394, "loss": 0.32960365295410154, "mean_token_accuracy": 0.9027633172273636, "num_tokens": 868592333.0, "step": 11150 }, { "entropy": 0.33718678772449495, "epoch": 0.4460019114367633, "grad_norm": 3.609206199645996, "learning_rate": 0.00018109608255819653, "loss": 0.3314109420776367, "mean_token_accuracy": 0.9008357304334641, "num_tokens": 872508470.0, "step": 11200 }, { "entropy": 0.34362460523843763, "epoch": 0.44799299139853455, "grad_norm": 1.003614068031311, "learning_rate": 0.00018090700570417366, "loss": 0.3378079223632813, "mean_token_accuracy": 0.8999038857221603, "num_tokens": 876363185.0, "step": 11250 }, { "entropy": 0.3392866799235344, "epoch": 0.4499840713603058, "grad_norm": 0.7893933653831482, "learning_rate": 0.00018071708771761277, "loss": 0.3362896728515625, "mean_token_accuracy": 0.9011469954252243, "num_tokens": 880303922.0, "step": 11300 }, { "entropy": 0.33675415202975273, "epoch": 0.4519751513220771, "grad_norm": 1.591785192489624, "learning_rate": 0.00018052633057295592, "loss": 0.33205352783203124, "mean_token_accuracy": 0.9002311301231384, "num_tokens": 884081854.0, "step": 11350 }, { "entropy": 0.33132238522171975, "epoch": 0.4539662312838484, "grad_norm": 0.8481300473213196, "learning_rate": 0.00018033473625336943, "loss": 0.3324263000488281, "mean_token_accuracy": 0.9015952390432358, "num_tokens": 887979780.0, "step": 11400 }, { "entropy": 0.32730998218059537, "epoch": 0.4559573112456196, "grad_norm": 0.9017524719238281, "learning_rate": 0.00018014230675072296, "loss": 0.33089866638183596, "mean_token_accuracy": 0.9035227233171463, "num_tokens": 892030186.0, "step": 11450 }, { "entropy": 0.3259911689162254, "epoch": 0.4579483912073909, "grad_norm": 0.8241736888885498, "learning_rate": 0.0001799490440655691, "loss": 0.32311305999755857, "mean_token_accuracy": 0.9039623945951462, "num_tokens": 895947945.0, "step": 11500 }, { "entropy": 0.32894982740283013, "epoch": 0.4599394711691622, "grad_norm": 0.6679379940032959, "learning_rate": 0.00017975495020712236, "loss": 0.32866409301757815, "mean_token_accuracy": 0.9023572719097137, "num_tokens": 899931286.0, "step": 11550 }, { "entropy": 0.3283787477016449, "epoch": 0.4619305511309334, "grad_norm": 0.7148107290267944, "learning_rate": 0.00017956002719323846, "loss": 0.3312802505493164, "mean_token_accuracy": 0.9040138351917267, "num_tokens": 903816597.0, "step": 11600 }, { "entropy": 0.34928158164024353, "epoch": 0.4639216310927047, "grad_norm": 0.7012563347816467, "learning_rate": 0.00017936427705039312, "loss": 0.34329158782958985, "mean_token_accuracy": 0.8994199293851852, "num_tokens": 907643305.0, "step": 11650 }, { "entropy": 0.3263499431312084, "epoch": 0.46591271105447596, "grad_norm": 3.0909736156463623, "learning_rate": 0.00017916770181366126, "loss": 0.3217006301879883, "mean_token_accuracy": 0.9037967169284821, "num_tokens": 911644445.0, "step": 11700 }, { "entropy": 0.3224152271449566, "epoch": 0.46790379101624724, "grad_norm": 3.0938165187835693, "learning_rate": 0.00017897030352669567, "loss": 0.30827510833740235, "mean_token_accuracy": 0.9065712589025497, "num_tokens": 915520505.0, "step": 11750 }, { "entropy": 0.3168146115541458, "epoch": 0.46989487097801846, "grad_norm": 13.391618728637695, "learning_rate": 0.00017877208424170582, "loss": 0.31009477615356446, "mean_token_accuracy": 0.9047369199991226, "num_tokens": 919202508.0, "step": 11800 }, { "entropy": 0.3283210161328316, "epoch": 0.47188595093978974, "grad_norm": 5.35004997253418, "learning_rate": 0.00017857304601943648, "loss": 0.3183258056640625, "mean_token_accuracy": 0.9028832757472992, "num_tokens": 922999097.0, "step": 11850 }, { "entropy": 0.3331063890457153, "epoch": 0.473877030901561, "grad_norm": 1.4924137592315674, "learning_rate": 0.00017837319092914636, "loss": 0.3294242858886719, "mean_token_accuracy": 0.9027070623636245, "num_tokens": 926760951.0, "step": 11900 }, { "entropy": 0.3223375345766544, "epoch": 0.47586811086333225, "grad_norm": 2.2390682697296143, "learning_rate": 0.00017817252104858648, "loss": 0.31913780212402343, "mean_token_accuracy": 0.904842980504036, "num_tokens": 930682949.0, "step": 11950 }, { "entropy": 0.33492707505822183, "epoch": 0.47785919082510353, "grad_norm": 1.0135114192962646, "learning_rate": 0.00017797103846397882, "loss": 0.32693416595458985, "mean_token_accuracy": 0.9027973359823227, "num_tokens": 934629003.0, "step": 12000 }, { "epoch": 0.47785919082510353, "eval_entropy": 0.3142273492283291, "eval_loss": 0.2967698872089386, "eval_mean_token_accuracy": 0.9049411766112797, "eval_num_tokens": 934629003.0, "eval_runtime": 98.1038, "eval_samples_per_second": 10.193, "eval_steps_per_second": 0.642, "step": 12000 }, { "entropy": 0.3153399461507797, "epoch": 0.4798502707868748, "grad_norm": 1.6073180437088013, "learning_rate": 0.00017776874526999431, "loss": 0.3167377471923828, "mean_token_accuracy": 0.9059252417087555, "num_tokens": 938589514.0, "step": 12050 }, { "entropy": 0.3352287206053734, "epoch": 0.4818413507486461, "grad_norm": 1.6080002784729004, "learning_rate": 0.0001775656435697313, "loss": 0.32828590393066404, "mean_token_accuracy": 0.9015354603528977, "num_tokens": 942478665.0, "step": 12100 }, { "entropy": 0.32980587109923365, "epoch": 0.4838324307104173, "grad_norm": 1.054014801979065, "learning_rate": 0.00017736173547469358, "loss": 0.32828296661376954, "mean_token_accuracy": 0.9027411657571792, "num_tokens": 946330112.0, "step": 12150 }, { "entropy": 0.31484507247805593, "epoch": 0.4858235106721886, "grad_norm": 1.0270887613296509, "learning_rate": 0.00017715702310476842, "loss": 0.3141517639160156, "mean_token_accuracy": 0.9055408567190171, "num_tokens": 950227059.0, "step": 12200 }, { "entropy": 0.3244850052893162, "epoch": 0.4878145906339599, "grad_norm": 2.9883229732513428, "learning_rate": 0.0001769515085882046, "loss": 0.32130313873291017, "mean_token_accuracy": 0.9037606674432754, "num_tokens": 954308948.0, "step": 12250 }, { "entropy": 0.3182083103060722, "epoch": 0.4898056705957311, "grad_norm": 1.0146301984786987, "learning_rate": 0.00017674519406159022, "loss": 0.3161518287658691, "mean_token_accuracy": 0.9044882690906525, "num_tokens": 958083284.0, "step": 12300 }, { "entropy": 0.3185697332024574, "epoch": 0.4917967505575024, "grad_norm": 1.2245451211929321, "learning_rate": 0.00017653808166983055, "loss": 0.3119895553588867, "mean_token_accuracy": 0.9051649940013885, "num_tokens": 961909213.0, "step": 12350 }, { "entropy": 0.32179706066846847, "epoch": 0.49378783051927366, "grad_norm": 4.297907829284668, "learning_rate": 0.00017633017356612568, "loss": 0.32323280334472654, "mean_token_accuracy": 0.9024811029434204, "num_tokens": 965715395.0, "step": 12400 }, { "entropy": 0.3084810623526573, "epoch": 0.49577891048104494, "grad_norm": 0.6699567437171936, "learning_rate": 0.00017612147191194813, "loss": 0.30496238708496093, "mean_token_accuracy": 0.9064372587203979, "num_tokens": 969651097.0, "step": 12450 }, { "entropy": 0.3179575477540493, "epoch": 0.49776999044281617, "grad_norm": 1.3979785442352295, "learning_rate": 0.00017591197887702043, "loss": 0.31622880935668946, "mean_token_accuracy": 0.9055276393890381, "num_tokens": 973561253.0, "step": 12500 }, { "entropy": 0.31216868028044703, "epoch": 0.49976107040458745, "grad_norm": 0.7845538854598999, "learning_rate": 0.0001757016966392925, "loss": 0.31015949249267577, "mean_token_accuracy": 0.906750670671463, "num_tokens": 977586836.0, "step": 12550 }, { "entropy": 0.3053250414133072, "epoch": 0.5017521503663587, "grad_norm": 3.190662145614624, "learning_rate": 0.0001754906273849191, "loss": 0.30805967330932615, "mean_token_accuracy": 0.9076743638515472, "num_tokens": 981492525.0, "step": 12600 }, { "entropy": 0.30219964385032655, "epoch": 0.50374323032813, "grad_norm": 2.1294660568237305, "learning_rate": 0.00017527877330823696, "loss": 0.3018102264404297, "mean_token_accuracy": 0.9099226385354996, "num_tokens": 985505201.0, "step": 12650 }, { "entropy": 0.3099065946042538, "epoch": 0.5057343102899012, "grad_norm": 0.6970147490501404, "learning_rate": 0.00017506613661174208, "loss": 0.3070409393310547, "mean_token_accuracy": 0.9077232587337494, "num_tokens": 989354252.0, "step": 12700 }, { "entropy": 0.31281920209527014, "epoch": 0.5077253902516725, "grad_norm": 2.2930996417999268, "learning_rate": 0.00017485271950606687, "loss": 0.3116877555847168, "mean_token_accuracy": 0.9060627329349518, "num_tokens": 993286554.0, "step": 12750 }, { "entropy": 0.30280036211013794, "epoch": 0.5097164702134438, "grad_norm": 0.7827371954917908, "learning_rate": 0.000174638524209957, "loss": 0.30319522857666015, "mean_token_accuracy": 0.9087213289737701, "num_tokens": 997343233.0, "step": 12800 }, { "entropy": 0.31477322295308113, "epoch": 0.5117075501752151, "grad_norm": 0.7464041113853455, "learning_rate": 0.0001744235529502485, "loss": 0.3129489135742187, "mean_token_accuracy": 0.9058337074518203, "num_tokens": 1001334843.0, "step": 12850 }, { "entropy": 0.30997680947184564, "epoch": 0.5136986301369864, "grad_norm": 0.6095921993255615, "learning_rate": 0.00017420780796184446, "loss": 0.30621599197387694, "mean_token_accuracy": 0.9058770096302032, "num_tokens": 1005310855.0, "step": 12900 }, { "entropy": 0.3065580949187279, "epoch": 0.5156897100987575, "grad_norm": 2.350802421569824, "learning_rate": 0.00017399129148769194, "loss": 0.3066014862060547, "mean_token_accuracy": 0.908355308175087, "num_tokens": 1009346212.0, "step": 12950 }, { "entropy": 0.31059773072600366, "epoch": 0.5176807900605288, "grad_norm": 0.8811128735542297, "learning_rate": 0.00017377400577875862, "loss": 0.3058795928955078, "mean_token_accuracy": 0.9066431885957718, "num_tokens": 1013288916.0, "step": 13000 }, { "entropy": 0.3080012533068657, "epoch": 0.5196718700223001, "grad_norm": 0.7292214632034302, "learning_rate": 0.0001735559530940093, "loss": 0.30621482849121096, "mean_token_accuracy": 0.9068697249889374, "num_tokens": 1017269907.0, "step": 13050 }, { "entropy": 0.29841029316186907, "epoch": 0.5216629499840714, "grad_norm": 0.8363134860992432, "learning_rate": 0.0001733371357003825, "loss": 0.2961251640319824, "mean_token_accuracy": 0.909942420721054, "num_tokens": 1021232491.0, "step": 13100 }, { "entropy": 0.3209612062573433, "epoch": 0.5236540299458426, "grad_norm": 0.6443411707878113, "learning_rate": 0.00017311755587276685, "loss": 0.32036983489990234, "mean_token_accuracy": 0.9041855382919312, "num_tokens": 1025059216.0, "step": 13150 }, { "entropy": 0.3188166154921055, "epoch": 0.5256451099076139, "grad_norm": 0.7593351006507874, "learning_rate": 0.00017289721589397756, "loss": 0.31142175674438477, "mean_token_accuracy": 0.9049467498064041, "num_tokens": 1028841409.0, "step": 13200 }, { "entropy": 0.30779171898961066, "epoch": 0.5276361898693852, "grad_norm": 0.720933735370636, "learning_rate": 0.00017267611805473246, "loss": 0.30698768615722655, "mean_token_accuracy": 0.9066478383541107, "num_tokens": 1032855591.0, "step": 13250 }, { "entropy": 0.3156025929749012, "epoch": 0.5296272698311564, "grad_norm": 0.8520675897598267, "learning_rate": 0.0001724542646536284, "loss": 0.31248844146728516, "mean_token_accuracy": 0.9060261619091033, "num_tokens": 1036858782.0, "step": 13300 }, { "entropy": 0.30919904172420504, "epoch": 0.5316183497929277, "grad_norm": 0.7996109127998352, "learning_rate": 0.00017223165799711728, "loss": 0.3059793853759766, "mean_token_accuracy": 0.9064883595705032, "num_tokens": 1040726732.0, "step": 13350 }, { "entropy": 0.31799424409866334, "epoch": 0.5336094297546989, "grad_norm": 0.8917890191078186, "learning_rate": 0.00017200830039948198, "loss": 0.3163420486450195, "mean_token_accuracy": 0.9045793133974075, "num_tokens": 1044542496.0, "step": 13400 }, { "entropy": 0.3092480516433716, "epoch": 0.5356005097164702, "grad_norm": 1.9236994981765747, "learning_rate": 0.00017178419418281243, "loss": 0.3074158096313477, "mean_token_accuracy": 0.9063370931148529, "num_tokens": 1048428916.0, "step": 13450 }, { "entropy": 0.3134460225701332, "epoch": 0.5375915896782415, "grad_norm": 1.0063883066177368, "learning_rate": 0.00017155934167698144, "loss": 0.30935720443725584, "mean_token_accuracy": 0.9052882140874863, "num_tokens": 1052237764.0, "step": 13500 }, { "epoch": 0.5375915896782415, "eval_entropy": 0.29078047734404366, "eval_loss": 0.29036185145378113, "eval_mean_token_accuracy": 0.9072613971573966, "eval_num_tokens": 1052237764.0, "eval_runtime": 97.9425, "eval_samples_per_second": 10.21, "eval_steps_per_second": 0.643, "step": 13500 }, { "entropy": 0.3147663879394531, "epoch": 0.5395826696400128, "grad_norm": 0.8451830148696899, "learning_rate": 0.00017133374521962044, "loss": 0.3125171279907227, "mean_token_accuracy": 0.9064455604553223, "num_tokens": 1056119070.0, "step": 13550 }, { "entropy": 0.3062629546225071, "epoch": 0.5415737496017841, "grad_norm": 0.7669914364814758, "learning_rate": 0.00017110740715609515, "loss": 0.30674230575561523, "mean_token_accuracy": 0.9074991244077683, "num_tokens": 1059949704.0, "step": 13600 }, { "entropy": 0.3162059251964092, "epoch": 0.5435648295635552, "grad_norm": 0.7038897275924683, "learning_rate": 0.0001708803298394813, "loss": 0.31566192626953127, "mean_token_accuracy": 0.9061574387550354, "num_tokens": 1063824943.0, "step": 13650 }, { "entropy": 0.29972497284412386, "epoch": 0.5455559095253265, "grad_norm": 0.7049840092658997, "learning_rate": 0.0001706525156305401, "loss": 0.2954620933532715, "mean_token_accuracy": 0.908453021645546, "num_tokens": 1067693856.0, "step": 13700 }, { "entropy": 0.30088669553399083, "epoch": 0.5475469894870978, "grad_norm": 0.803152322769165, "learning_rate": 0.00017042396689769364, "loss": 0.29926998138427735, "mean_token_accuracy": 0.9087596547603607, "num_tokens": 1071601421.0, "step": 13750 }, { "entropy": 0.30597650140523913, "epoch": 0.5495380694488691, "grad_norm": 0.6174252033233643, "learning_rate": 0.00017019468601700045, "loss": 0.30020965576171876, "mean_token_accuracy": 0.9079719346761703, "num_tokens": 1075507557.0, "step": 13800 }, { "entropy": 0.3030544947087765, "epoch": 0.5515291494106404, "grad_norm": 0.7198078632354736, "learning_rate": 0.00016996467537213058, "loss": 0.3055330467224121, "mean_token_accuracy": 0.9072394198179246, "num_tokens": 1079464929.0, "step": 13850 }, { "entropy": 0.30408748909831046, "epoch": 0.5535202293724116, "grad_norm": 0.6543081402778625, "learning_rate": 0.000169733937354341, "loss": 0.2971897315979004, "mean_token_accuracy": 0.9081903666257858, "num_tokens": 1083442664.0, "step": 13900 }, { "entropy": 0.3111391983926296, "epoch": 0.5555113093341829, "grad_norm": 0.6148940920829773, "learning_rate": 0.00016950247436245053, "loss": 0.306310863494873, "mean_token_accuracy": 0.907039784193039, "num_tokens": 1087353509.0, "step": 13950 }, { "entropy": 0.29428019240498543, "epoch": 0.5575023892959541, "grad_norm": 0.6194506287574768, "learning_rate": 0.00016927028880281514, "loss": 0.29547828674316406, "mean_token_accuracy": 0.9099029290676117, "num_tokens": 1091242469.0, "step": 14000 }, { "entropy": 0.3118854616582394, "epoch": 0.5594934692577254, "grad_norm": 0.6568689942359924, "learning_rate": 0.00016903738308930285, "loss": 0.3083318138122559, "mean_token_accuracy": 0.9061790078878402, "num_tokens": 1095156664.0, "step": 14050 }, { "entropy": 0.3039117956161499, "epoch": 0.5614845492194966, "grad_norm": 0.5354903340339661, "learning_rate": 0.00016880375964326846, "loss": 0.2998150634765625, "mean_token_accuracy": 0.9083393847942353, "num_tokens": 1099149736.0, "step": 14100 }, { "entropy": 0.3004564446210861, "epoch": 0.5634756291812679, "grad_norm": 0.8700271844863892, "learning_rate": 0.00016856942089352872, "loss": 0.29739187240600584, "mean_token_accuracy": 0.9088945603370666, "num_tokens": 1103166304.0, "step": 14150 }, { "entropy": 0.3004854147136211, "epoch": 0.5654667091430392, "grad_norm": 0.637499988079071, "learning_rate": 0.00016833436927633666, "loss": 0.2929790687561035, "mean_token_accuracy": 0.9093893361091614, "num_tokens": 1106876529.0, "step": 14200 }, { "entropy": 0.3055184032022953, "epoch": 0.5674577891048105, "grad_norm": 0.8712766766548157, "learning_rate": 0.00016809860723535669, "loss": 0.2989055252075195, "mean_token_accuracy": 0.9075117868185043, "num_tokens": 1110762872.0, "step": 14250 }, { "entropy": 0.30708494916558265, "epoch": 0.5694488690665818, "grad_norm": 1.903483271598816, "learning_rate": 0.00016786213722163885, "loss": 0.3001683807373047, "mean_token_accuracy": 0.9074388015270233, "num_tokens": 1114612687.0, "step": 14300 }, { "entropy": 0.3030554646253586, "epoch": 0.5714399490283529, "grad_norm": 0.7355078458786011, "learning_rate": 0.00016762496169359358, "loss": 0.29985538482666013, "mean_token_accuracy": 0.9085291236639023, "num_tokens": 1118477075.0, "step": 14350 }, { "entropy": 0.30076363891363145, "epoch": 0.5734310289901242, "grad_norm": 0.8253635168075562, "learning_rate": 0.00016738708311696593, "loss": 0.3000423240661621, "mean_token_accuracy": 0.9090260636806488, "num_tokens": 1122308979.0, "step": 14400 }, { "entropy": 0.30372032582759856, "epoch": 0.5754221089518955, "grad_norm": 0.6847742199897766, "learning_rate": 0.00016714850396481017, "loss": 0.2999353790283203, "mean_token_accuracy": 0.907860655784607, "num_tokens": 1126179144.0, "step": 14450 }, { "entropy": 0.3549429287016392, "epoch": 0.5774131889136668, "grad_norm": 35.38624572753906, "learning_rate": 0.00016690922671746386, "loss": 0.3448126220703125, "mean_token_accuracy": 0.8990497767925263, "num_tokens": 1130075144.0, "step": 14500 }, { "entropy": 0.6645228517055511, "epoch": 0.579404268875438, "grad_norm": 1.238425850868225, "learning_rate": 0.00016666925386252214, "loss": 0.6474810791015625, "mean_token_accuracy": 0.8487717002630234, "num_tokens": 1134094101.0, "step": 14550 }, { "entropy": 0.31654783099889755, "epoch": 0.5813953488372093, "grad_norm": 15.627394676208496, "learning_rate": 0.00016642858789481203, "loss": 0.3142976760864258, "mean_token_accuracy": 0.9052912598848343, "num_tokens": 1137971828.0, "step": 14600 }, { "entropy": 0.32167117565870285, "epoch": 0.5833864287989806, "grad_norm": 0.7982883453369141, "learning_rate": 0.0001661872313163662, "loss": 0.31979732513427733, "mean_token_accuracy": 0.9049945157766343, "num_tokens": 1141842535.0, "step": 14650 }, { "entropy": 0.3142679385840893, "epoch": 0.5853775087607518, "grad_norm": 0.6818510890007019, "learning_rate": 0.0001659451866363972, "loss": 0.30938182830810546, "mean_token_accuracy": 0.9058419001102448, "num_tokens": 1145759897.0, "step": 14700 }, { "entropy": 0.2997730879485607, "epoch": 0.5873685887225231, "grad_norm": 0.6930510997772217, "learning_rate": 0.00016570245637127122, "loss": 0.29986000061035156, "mean_token_accuracy": 0.9088831174373627, "num_tokens": 1149589724.0, "step": 14750 }, { "entropy": 0.312316772788763, "epoch": 0.5893596686842943, "grad_norm": 0.6712312698364258, "learning_rate": 0.00016545904304448203, "loss": 0.3064308166503906, "mean_token_accuracy": 0.9068194925785065, "num_tokens": 1153496283.0, "step": 14800 }, { "entropy": 0.3025803528726101, "epoch": 0.5913507486460656, "grad_norm": 0.6911669373512268, "learning_rate": 0.0001652149491866247, "loss": 0.2982275390625, "mean_token_accuracy": 0.907840421795845, "num_tokens": 1157421693.0, "step": 14850 }, { "entropy": 0.29524740323424337, "epoch": 0.5933418286078369, "grad_norm": 0.7912169098854065, "learning_rate": 0.0001649701773353693, "loss": 0.29299890518188476, "mean_token_accuracy": 0.9105656880140305, "num_tokens": 1161399402.0, "step": 14900 }, { "entropy": 0.3046035374701023, "epoch": 0.5953329085696082, "grad_norm": 0.9637547135353088, "learning_rate": 0.0001647247300354345, "loss": 0.3020786666870117, "mean_token_accuracy": 0.908284249305725, "num_tokens": 1165069341.0, "step": 14950 }, { "entropy": 0.30247773334383965, "epoch": 0.5973239885313795, "grad_norm": 0.9919803142547607, "learning_rate": 0.00016447860983856113, "loss": 0.30090438842773437, "mean_token_accuracy": 0.9087945199012757, "num_tokens": 1169068940.0, "step": 15000 }, { "epoch": 0.5973239885313795, "eval_entropy": 0.2821128155503954, "eval_loss": 0.28751349449157715, "eval_mean_token_accuracy": 0.9066080706460136, "eval_num_tokens": 1169068940.0, "eval_runtime": 97.6893, "eval_samples_per_second": 10.237, "eval_steps_per_second": 0.645, "step": 15000 }, { "entropy": 0.31097124218940736, "epoch": 0.5993150684931506, "grad_norm": 0.8885817527770996, "learning_rate": 0.0001642318193034856, "loss": 0.30851236343383787, "mean_token_accuracy": 0.9082132822275162, "num_tokens": 1172972451.0, "step": 15050 }, { "entropy": 0.31379259154200556, "epoch": 0.6013061484549219, "grad_norm": 1.2566955089569092, "learning_rate": 0.00016398436099591352, "loss": 0.3080220603942871, "mean_token_accuracy": 0.9050265049934387, "num_tokens": 1176806828.0, "step": 15100 }, { "entropy": 0.2992862512171268, "epoch": 0.6032972284166932, "grad_norm": 0.8937509059906006, "learning_rate": 0.0001637362374884927, "loss": 0.2970610237121582, "mean_token_accuracy": 0.9087365788221359, "num_tokens": 1180674932.0, "step": 15150 }, { "entropy": 0.3095300954580307, "epoch": 0.6052883083784645, "grad_norm": 1.584878921508789, "learning_rate": 0.00016348745136078653, "loss": 0.30665403366088867, "mean_token_accuracy": 0.9072186440229416, "num_tokens": 1184537147.0, "step": 15200 }, { "entropy": 0.29855361983180045, "epoch": 0.6072793883402358, "grad_norm": 1.3048124313354492, "learning_rate": 0.00016323800519924735, "loss": 0.29641626358032225, "mean_token_accuracy": 0.9099707293510437, "num_tokens": 1188428000.0, "step": 15250 }, { "entropy": 0.2976492203772068, "epoch": 0.609270468302007, "grad_norm": 0.6167215704917908, "learning_rate": 0.00016298790159718926, "loss": 0.297906379699707, "mean_token_accuracy": 0.9093478834629058, "num_tokens": 1192267569.0, "step": 15300 }, { "entropy": 0.30622323855757716, "epoch": 0.6112615482637783, "grad_norm": 0.7061218023300171, "learning_rate": 0.00016273714315476136, "loss": 0.304271354675293, "mean_token_accuracy": 0.907381860613823, "num_tokens": 1196019611.0, "step": 15350 }, { "entropy": 0.3076668280363083, "epoch": 0.6132526282255495, "grad_norm": 240.22381591796875, "learning_rate": 0.00016248573247892067, "loss": 0.30590225219726563, "mean_token_accuracy": 0.9069288223981857, "num_tokens": 1199742259.0, "step": 15400 }, { "entropy": 0.31544667705893514, "epoch": 0.6152437081873208, "grad_norm": 1.87211012840271, "learning_rate": 0.000162233672183405, "loss": 0.3146724319458008, "mean_token_accuracy": 0.9056917190551758, "num_tokens": 1203572364.0, "step": 15450 }, { "entropy": 0.3039634561538696, "epoch": 0.617234788149092, "grad_norm": 1.5390677452087402, "learning_rate": 0.0001619809648887058, "loss": 0.30161951065063475, "mean_token_accuracy": 0.9080253195762634, "num_tokens": 1207520141.0, "step": 15500 }, { "entropy": 0.31154225423932075, "epoch": 0.6192258681108633, "grad_norm": 0.857286810874939, "learning_rate": 0.00016172761322204085, "loss": 0.31182092666625977, "mean_token_accuracy": 0.9067489957809448, "num_tokens": 1211333212.0, "step": 15550 }, { "entropy": 0.31209865912795065, "epoch": 0.6212169480726346, "grad_norm": 0.7612581849098206, "learning_rate": 0.0001614736198173271, "loss": 0.3040530776977539, "mean_token_accuracy": 0.90670563519001, "num_tokens": 1215160534.0, "step": 15600 }, { "entropy": 0.29721666797995566, "epoch": 0.6232080280344059, "grad_norm": 0.7850686311721802, "learning_rate": 0.00016121898731515316, "loss": 0.291649169921875, "mean_token_accuracy": 0.9091300505399704, "num_tokens": 1219130947.0, "step": 15650 }, { "entropy": 0.30366104453802106, "epoch": 0.6251991079961772, "grad_norm": 1.0647870302200317, "learning_rate": 0.00016096371836275188, "loss": 0.302098388671875, "mean_token_accuracy": 0.9079624992609024, "num_tokens": 1223022715.0, "step": 15700 }, { "entropy": 0.3063186949491501, "epoch": 0.6271901879579483, "grad_norm": 0.8293745517730713, "learning_rate": 0.0001607078156139728, "loss": 0.3030096435546875, "mean_token_accuracy": 0.9075041776895523, "num_tokens": 1226895035.0, "step": 15750 }, { "entropy": 0.3002316528558731, "epoch": 0.6291812679197196, "grad_norm": 1.4709408283233643, "learning_rate": 0.00016045128172925458, "loss": 0.2943367767333984, "mean_token_accuracy": 0.9096330875158309, "num_tokens": 1230708015.0, "step": 15800 }, { "entropy": 0.29358057424426076, "epoch": 0.6311723478814909, "grad_norm": 0.8506943583488464, "learning_rate": 0.00016019411937559747, "loss": 0.2879058074951172, "mean_token_accuracy": 0.9099520862102508, "num_tokens": 1234614905.0, "step": 15850 }, { "entropy": 0.2941122964024544, "epoch": 0.6331634278432622, "grad_norm": 0.559323787689209, "learning_rate": 0.00015993633122653533, "loss": 0.29281805038452147, "mean_token_accuracy": 0.9098799300193786, "num_tokens": 1238339678.0, "step": 15900 }, { "entropy": 0.303873111307621, "epoch": 0.6351545078050335, "grad_norm": 0.6046428084373474, "learning_rate": 0.00015967791996210798, "loss": 0.2978951835632324, "mean_token_accuracy": 0.9086865013837815, "num_tokens": 1242266921.0, "step": 15950 }, { "entropy": 0.30071055710315703, "epoch": 0.6371455877668047, "grad_norm": 0.7457103133201599, "learning_rate": 0.0001594188882688335, "loss": 0.2999392318725586, "mean_token_accuracy": 0.9086949378252029, "num_tokens": 1246168678.0, "step": 16000 }, { "entropy": 0.29887919217348097, "epoch": 0.639136667728576, "grad_norm": 0.5880980491638184, "learning_rate": 0.00015915923883967983, "loss": 0.2973442459106445, "mean_token_accuracy": 0.9098987239599228, "num_tokens": 1250086915.0, "step": 16050 }, { "entropy": 0.29837347254157065, "epoch": 0.6411277476903472, "grad_norm": 0.9620305895805359, "learning_rate": 0.0001588989743740373, "loss": 0.2971031188964844, "mean_token_accuracy": 0.9090900254249573, "num_tokens": 1254079336.0, "step": 16100 }, { "entropy": 0.299031962454319, "epoch": 0.6431188276521185, "grad_norm": 0.7873280644416809, "learning_rate": 0.0001586380975776903, "loss": 0.29656692504882814, "mean_token_accuracy": 0.9089064407348633, "num_tokens": 1257957112.0, "step": 16150 }, { "entropy": 0.29284371227025985, "epoch": 0.6451099076138898, "grad_norm": 0.6219205856323242, "learning_rate": 0.0001583766111627891, "loss": 0.2923365020751953, "mean_token_accuracy": 0.9103443801403046, "num_tokens": 1261754811.0, "step": 16200 }, { "entropy": 0.29972797065973283, "epoch": 0.647100987575661, "grad_norm": 0.539088249206543, "learning_rate": 0.00015811451784782183, "loss": 0.2995792961120605, "mean_token_accuracy": 0.9090916502475739, "num_tokens": 1265832992.0, "step": 16250 }, { "entropy": 0.294071561396122, "epoch": 0.6490920675374323, "grad_norm": 0.5955763459205627, "learning_rate": 0.0001578518203575861, "loss": 0.2936357879638672, "mean_token_accuracy": 0.9097523200511932, "num_tokens": 1269767119.0, "step": 16300 }, { "entropy": 0.29488854959607125, "epoch": 0.6510831474992036, "grad_norm": 0.7521705031394958, "learning_rate": 0.00015758852142316063, "loss": 0.28754150390625, "mean_token_accuracy": 0.9101364457607269, "num_tokens": 1273614979.0, "step": 16350 }, { "entropy": 0.2972512972354889, "epoch": 0.6530742274609749, "grad_norm": 0.6611602306365967, "learning_rate": 0.00015732462378187706, "loss": 0.2997426986694336, "mean_token_accuracy": 0.9092181521654129, "num_tokens": 1277572176.0, "step": 16400 }, { "entropy": 0.29382382974028587, "epoch": 0.655065307422746, "grad_norm": 0.590353786945343, "learning_rate": 0.0001570601301772913, "loss": 0.29196489334106446, "mean_token_accuracy": 0.9105822455883026, "num_tokens": 1281466782.0, "step": 16450 }, { "entropy": 0.29887585699558256, "epoch": 0.6570563873845173, "grad_norm": 0.8136062622070312, "learning_rate": 0.000156795043359155, "loss": 0.2935719680786133, "mean_token_accuracy": 0.9095307844877243, "num_tokens": 1285329315.0, "step": 16500 }, { "epoch": 0.6570563873845173, "eval_entropy": 0.2827215705599104, "eval_loss": 0.2723085582256317, "eval_mean_token_accuracy": 0.9104196637395828, "eval_num_tokens": 1285329315.0, "eval_runtime": 97.6475, "eval_samples_per_second": 10.241, "eval_steps_per_second": 0.645, "step": 16500 }, { "entropy": 0.29116875618696214, "epoch": 0.6590474673462886, "grad_norm": 0.6756787896156311, "learning_rate": 0.00015652936608338708, "loss": 0.292112979888916, "mean_token_accuracy": 0.9107584869861602, "num_tokens": 1289158324.0, "step": 16550 }, { "entropy": 0.3033373598754406, "epoch": 0.6610385473080599, "grad_norm": 0.5568836331367493, "learning_rate": 0.0001562631011120451, "loss": 0.300805835723877, "mean_token_accuracy": 0.9088966238498688, "num_tokens": 1293138088.0, "step": 16600 }, { "entropy": 0.29870939210057257, "epoch": 0.6630296272698312, "grad_norm": 0.4821166396141052, "learning_rate": 0.00015599625121329633, "loss": 0.29582101821899415, "mean_token_accuracy": 0.9083776873350143, "num_tokens": 1296974595.0, "step": 16650 }, { "entropy": 0.3019963566958904, "epoch": 0.6650207072316024, "grad_norm": 0.6496310234069824, "learning_rate": 0.00015572881916138922, "loss": 0.2965621566772461, "mean_token_accuracy": 0.9087733340263366, "num_tokens": 1300854839.0, "step": 16700 }, { "entropy": 0.3023223000764847, "epoch": 0.6670117871933737, "grad_norm": 0.5332936644554138, "learning_rate": 0.00015546080773662445, "loss": 0.30265289306640625, "mean_token_accuracy": 0.9071105599403382, "num_tokens": 1304789155.0, "step": 16750 }, { "entropy": 0.29066399201750753, "epoch": 0.6690028671551449, "grad_norm": 0.7210190296173096, "learning_rate": 0.00015519221972532595, "loss": 0.2885586166381836, "mean_token_accuracy": 0.9106798976659775, "num_tokens": 1308687388.0, "step": 16800 }, { "entropy": 0.29611540913581846, "epoch": 0.6709939471169162, "grad_norm": 0.6555887460708618, "learning_rate": 0.00015492305791981207, "loss": 0.2925202751159668, "mean_token_accuracy": 0.9097654807567597, "num_tokens": 1312619729.0, "step": 16850 }, { "entropy": 0.29771857395768164, "epoch": 0.6729850270786875, "grad_norm": 0.7073614597320557, "learning_rate": 0.00015465332511836649, "loss": 0.2960833740234375, "mean_token_accuracy": 0.9092891854047775, "num_tokens": 1316556214.0, "step": 16900 }, { "entropy": 0.3011424207687378, "epoch": 0.6749761070404587, "grad_norm": 0.6379684209823608, "learning_rate": 0.00015438302412520912, "loss": 0.2977731513977051, "mean_token_accuracy": 0.9088351279497147, "num_tokens": 1320381264.0, "step": 16950 }, { "entropy": 0.2937157228589058, "epoch": 0.67696718700223, "grad_norm": 0.7161999940872192, "learning_rate": 0.00015411215775046694, "loss": 0.2912364196777344, "mean_token_accuracy": 0.9099707108736038, "num_tokens": 1324178055.0, "step": 17000 }, { "entropy": 0.3029134801030159, "epoch": 0.6789582669640013, "grad_norm": 0.6558506488800049, "learning_rate": 0.0001538407288101448, "loss": 0.3023427200317383, "mean_token_accuracy": 0.9085495692491531, "num_tokens": 1328003856.0, "step": 17050 }, { "entropy": 0.29839008167386055, "epoch": 0.6809493469257726, "grad_norm": 0.6463945508003235, "learning_rate": 0.00015356874012609616, "loss": 0.29343448638916014, "mean_token_accuracy": 0.9084646880626679, "num_tokens": 1331838767.0, "step": 17100 }, { "entropy": 0.2972496284544468, "epoch": 0.6829404268875438, "grad_norm": 0.5411743521690369, "learning_rate": 0.00015329619452599368, "loss": 0.2923093032836914, "mean_token_accuracy": 0.9086371755599976, "num_tokens": 1335556122.0, "step": 17150 }, { "entropy": 0.30380251407623293, "epoch": 0.684931506849315, "grad_norm": 0.8152517080307007, "learning_rate": 0.00015302309484330003, "loss": 0.30057912826538086, "mean_token_accuracy": 0.9079786992073059, "num_tokens": 1339554013.0, "step": 17200 }, { "entropy": 0.2984812180697918, "epoch": 0.6869225868110863, "grad_norm": 0.5806976556777954, "learning_rate": 0.00015274944391723816, "loss": 0.29322574615478514, "mean_token_accuracy": 0.9091445273160934, "num_tokens": 1343281511.0, "step": 17250 }, { "entropy": 0.29485598862171175, "epoch": 0.6889136667728576, "grad_norm": 0.7114775776863098, "learning_rate": 0.00015247524459276185, "loss": 0.2939446830749512, "mean_token_accuracy": 0.9100499159097671, "num_tokens": 1347097878.0, "step": 17300 }, { "entropy": 0.2901600030064583, "epoch": 0.6909047467346289, "grad_norm": 0.68736332654953, "learning_rate": 0.00015220049972052637, "loss": 0.283979606628418, "mean_token_accuracy": 0.9118931919336319, "num_tokens": 1350909068.0, "step": 17350 }, { "entropy": 0.29703174635767937, "epoch": 0.6928958266964002, "grad_norm": 0.6926178336143494, "learning_rate": 0.00015192521215685845, "loss": 0.2921230697631836, "mean_token_accuracy": 0.9102600651979447, "num_tokens": 1354886686.0, "step": 17400 }, { "entropy": 0.29716769069433213, "epoch": 0.6948869066581714, "grad_norm": 0.9371346831321716, "learning_rate": 0.00015164938476372702, "loss": 0.29703765869140625, "mean_token_accuracy": 0.9095548176765442, "num_tokens": 1358830404.0, "step": 17450 }, { "entropy": 0.28911288678646085, "epoch": 0.6968779866199426, "grad_norm": 0.6537544131278992, "learning_rate": 0.00015137302040871297, "loss": 0.28646724700927734, "mean_token_accuracy": 0.9115975719690322, "num_tokens": 1362857525.0, "step": 17500 }, { "entropy": 0.29342864006757735, "epoch": 0.6988690665817139, "grad_norm": 0.7813704609870911, "learning_rate": 0.0001510961219649799, "loss": 0.2936690902709961, "mean_token_accuracy": 0.9103942143917084, "num_tokens": 1366849276.0, "step": 17550 }, { "entropy": 0.2983704087138176, "epoch": 0.7008601465434852, "grad_norm": 1.6893558502197266, "learning_rate": 0.0001508186923112437, "loss": 0.29162357330322264, "mean_token_accuracy": 0.9090755820274353, "num_tokens": 1370662227.0, "step": 17600 }, { "entropy": 0.29516899332404134, "epoch": 0.7028512265052564, "grad_norm": 0.8770793080329895, "learning_rate": 0.00015054073433174302, "loss": 0.29333614349365233, "mean_token_accuracy": 0.9101587522029877, "num_tokens": 1374576458.0, "step": 17650 }, { "entropy": 0.2941126237809658, "epoch": 0.7048423064670277, "grad_norm": 0.9740257263183594, "learning_rate": 0.00015026225091620903, "loss": 0.28899494171142576, "mean_token_accuracy": 0.9100642812252044, "num_tokens": 1378537578.0, "step": 17700 }, { "entropy": 0.2944283872842789, "epoch": 0.706833386428799, "grad_norm": 0.6625619530677795, "learning_rate": 0.0001499832449598356, "loss": 0.29200618743896484, "mean_token_accuracy": 0.9104565042257309, "num_tokens": 1382448767.0, "step": 17750 }, { "entropy": 0.2947066053748131, "epoch": 0.7088244663905703, "grad_norm": 2.771057605743408, "learning_rate": 0.00014970371936324895, "loss": 0.2908017158508301, "mean_token_accuracy": 0.9104269522428513, "num_tokens": 1386405902.0, "step": 17800 }, { "entropy": 0.29732597529888155, "epoch": 0.7108155463523416, "grad_norm": 0.5472576022148132, "learning_rate": 0.0001494236770324778, "loss": 0.29684444427490236, "mean_token_accuracy": 0.910416322350502, "num_tokens": 1390358474.0, "step": 17850 }, { "entropy": 0.29257937729358674, "epoch": 0.7128066263141127, "grad_norm": 1.0813127756118774, "learning_rate": 0.0001491431208789228, "loss": 0.2898148727416992, "mean_token_accuracy": 0.9104039406776429, "num_tokens": 1394304161.0, "step": 17900 }, { "entropy": 0.310485008507967, "epoch": 0.714797706275884, "grad_norm": 1.656209945678711, "learning_rate": 0.00014886205381932664, "loss": 0.30217992782592773, "mean_token_accuracy": 0.9074555486440659, "num_tokens": 1398216238.0, "step": 17950 }, { "entropy": 0.2969197675585747, "epoch": 0.7167887862376553, "grad_norm": 1.2976051568984985, "learning_rate": 0.00014858047877574333, "loss": 0.29079368591308596, "mean_token_accuracy": 0.9102236968278885, "num_tokens": 1402161098.0, "step": 18000 }, { "epoch": 0.7167887862376553, "eval_entropy": 0.2776823304002247, "eval_loss": 0.27006426453590393, "eval_mean_token_accuracy": 0.9105973158563886, "eval_num_tokens": 1402161098.0, "eval_runtime": 97.7364, "eval_samples_per_second": 10.232, "eval_steps_per_second": 0.645, "step": 18000 }, { "entropy": 0.3027782902121544, "epoch": 0.7187798661994266, "grad_norm": 0.7084875106811523, "learning_rate": 0.0001482983986755082, "loss": 0.3031645965576172, "mean_token_accuracy": 0.9077838987112046, "num_tokens": 1406155433.0, "step": 18050 }, { "entropy": 0.2902723887562752, "epoch": 0.7207709461611979, "grad_norm": 0.6873666644096375, "learning_rate": 0.00014801581645120724, "loss": 0.28865398406982423, "mean_token_accuracy": 0.9106548523902893, "num_tokens": 1410067965.0, "step": 18100 }, { "entropy": 0.3013344857096672, "epoch": 0.7227620261229691, "grad_norm": 1.7805606126785278, "learning_rate": 0.0001477327350406466, "loss": 0.30110008239746094, "mean_token_accuracy": 0.9085298550128936, "num_tokens": 1414072722.0, "step": 18150 }, { "entropy": 0.28914564475417137, "epoch": 0.7247531060847404, "grad_norm": 0.7139489054679871, "learning_rate": 0.00014744915738682223, "loss": 0.2870366668701172, "mean_token_accuracy": 0.9122559130191803, "num_tokens": 1418102886.0, "step": 18200 }, { "entropy": 0.28566819444298747, "epoch": 0.7267441860465116, "grad_norm": 1.1385061740875244, "learning_rate": 0.00014716508643788906, "loss": 0.2867041015625, "mean_token_accuracy": 0.9124609512090683, "num_tokens": 1422071589.0, "step": 18250 }, { "entropy": 0.29601184636354444, "epoch": 0.7287352660082829, "grad_norm": 2.188579559326172, "learning_rate": 0.00014688052514713056, "loss": 0.2922092628479004, "mean_token_accuracy": 0.9099663990736008, "num_tokens": 1425915264.0, "step": 18300 }, { "entropy": 0.29879319921135905, "epoch": 0.7307263459700541, "grad_norm": 0.7400273680686951, "learning_rate": 0.00014659547647292786, "loss": 0.29849246978759764, "mean_token_accuracy": 0.9087599730491638, "num_tokens": 1429792362.0, "step": 18350 }, { "entropy": 0.29069077476859095, "epoch": 0.7327174259318254, "grad_norm": 0.7535748481750488, "learning_rate": 0.00014630994337872907, "loss": 0.28666929244995115, "mean_token_accuracy": 0.9114148426055908, "num_tokens": 1433808948.0, "step": 18400 }, { "entropy": 0.28963286653161047, "epoch": 0.7347085058935967, "grad_norm": 0.6362102031707764, "learning_rate": 0.0001460239288330185, "loss": 0.2875527572631836, "mean_token_accuracy": 0.9118727374076844, "num_tokens": 1437675494.0, "step": 18450 }, { "entropy": 0.293488028049469, "epoch": 0.736699585855368, "grad_norm": 0.7438880801200867, "learning_rate": 0.00014573743580928577, "loss": 0.28785888671875, "mean_token_accuracy": 0.910496751666069, "num_tokens": 1441521509.0, "step": 18500 }, { "entropy": 0.30329610586166383, "epoch": 0.7386906658171393, "grad_norm": 1.0525658130645752, "learning_rate": 0.00014545046728599488, "loss": 0.30172367095947267, "mean_token_accuracy": 0.9077435076236725, "num_tokens": 1445204302.0, "step": 18550 }, { "entropy": 0.2981826615333557, "epoch": 0.7406817457789104, "grad_norm": 1.3919222354888916, "learning_rate": 0.00014516302624655326, "loss": 0.29980438232421874, "mean_token_accuracy": 0.9100686204433441, "num_tokens": 1449194930.0, "step": 18600 }, { "entropy": 0.2883556368947029, "epoch": 0.7426728257406817, "grad_norm": 1.6801507472991943, "learning_rate": 0.00014487511567928073, "loss": 0.2883398818969727, "mean_token_accuracy": 0.9120700871944427, "num_tokens": 1453217275.0, "step": 18650 }, { "entropy": 0.2880104921758175, "epoch": 0.744663905702453, "grad_norm": 0.7567607760429382, "learning_rate": 0.00014458673857737858, "loss": 0.2865783882141113, "mean_token_accuracy": 0.9125986665487289, "num_tokens": 1457091456.0, "step": 18700 }, { "entropy": 0.30921834856271746, "epoch": 0.7466549856642243, "grad_norm": 2.5473389625549316, "learning_rate": 0.00014429789793889811, "loss": 0.30196685791015626, "mean_token_accuracy": 0.9076807588338852, "num_tokens": 1461061681.0, "step": 18750 }, { "entropy": 0.3230498093366623, "epoch": 0.7486460656259956, "grad_norm": 2.3257391452789307, "learning_rate": 0.0001440085967667099, "loss": 0.31749179840087893, "mean_token_accuracy": 0.9054018408060074, "num_tokens": 1464864891.0, "step": 18800 }, { "entropy": 0.2896036101877689, "epoch": 0.7506371455877668, "grad_norm": 3.0310580730438232, "learning_rate": 0.00014371883806847219, "loss": 0.29054962158203124, "mean_token_accuracy": 0.9120853686332703, "num_tokens": 1468777272.0, "step": 18850 }, { "entropy": 0.2924629697203636, "epoch": 0.7526282255495381, "grad_norm": 4.587695121765137, "learning_rate": 0.00014342862485659997, "loss": 0.28793231964111327, "mean_token_accuracy": 0.9110544735193252, "num_tokens": 1472695008.0, "step": 18900 }, { "entropy": 0.2869010743498802, "epoch": 0.7546193055113093, "grad_norm": 1.2988804578781128, "learning_rate": 0.0001431379601482333, "loss": 0.28417259216308594, "mean_token_accuracy": 0.9118612110614777, "num_tokens": 1476515856.0, "step": 18950 }, { "entropy": 0.2902405472099781, "epoch": 0.7566103854730806, "grad_norm": 1.1833847761154175, "learning_rate": 0.00014284684696520632, "loss": 0.28866044998168944, "mean_token_accuracy": 0.911122555732727, "num_tokens": 1480466260.0, "step": 19000 }, { "entropy": 0.30060096830129623, "epoch": 0.7586014654348519, "grad_norm": 0.6701699495315552, "learning_rate": 0.00014255528833401546, "loss": 0.2944635009765625, "mean_token_accuracy": 0.9087423354387283, "num_tokens": 1484335907.0, "step": 19050 }, { "entropy": 0.2922394719719887, "epoch": 0.7605925453966231, "grad_norm": 0.6822696328163147, "learning_rate": 0.00014226328728578823, "loss": 0.28974374771118167, "mean_token_accuracy": 0.9104707038402557, "num_tokens": 1488384107.0, "step": 19100 }, { "entropy": 0.29056561514735224, "epoch": 0.7625836253583944, "grad_norm": 0.663240373134613, "learning_rate": 0.00014197084685625173, "loss": 0.28836177825927733, "mean_token_accuracy": 0.9108587235212326, "num_tokens": 1492303395.0, "step": 19150 }, { "entropy": 0.29222132071852686, "epoch": 0.7645747053201657, "grad_norm": 0.961523711681366, "learning_rate": 0.00014167797008570086, "loss": 0.2904374313354492, "mean_token_accuracy": 0.9102330458164215, "num_tokens": 1496159763.0, "step": 19200 }, { "entropy": 0.29562861084938047, "epoch": 0.766565785281937, "grad_norm": 1.7865084409713745, "learning_rate": 0.00014138466001896685, "loss": 0.29582069396972654, "mean_token_accuracy": 0.9101934987306595, "num_tokens": 1499926969.0, "step": 19250 }, { "entropy": 0.28988956794142723, "epoch": 0.7685568652437081, "grad_norm": 0.6116553544998169, "learning_rate": 0.0001410909197053857, "loss": 0.2851591110229492, "mean_token_accuracy": 0.9100542116165161, "num_tokens": 1503862695.0, "step": 19300 }, { "entropy": 0.29101185873150826, "epoch": 0.7705479452054794, "grad_norm": 1.3416796922683716, "learning_rate": 0.00014079675219876633, "loss": 0.2863225173950195, "mean_token_accuracy": 0.9115383142232895, "num_tokens": 1507760784.0, "step": 19350 }, { "entropy": 0.2864786148071289, "epoch": 0.7725390251672507, "grad_norm": 0.9288985729217529, "learning_rate": 0.00014050216055735883, "loss": 0.28394302368164065, "mean_token_accuracy": 0.9118870466947555, "num_tokens": 1511621148.0, "step": 19400 }, { "entropy": 0.28903682947158815, "epoch": 0.774530105129022, "grad_norm": 0.806553065776825, "learning_rate": 0.00014020714784382284, "loss": 0.28795175552368163, "mean_token_accuracy": 0.9115160834789277, "num_tokens": 1515475336.0, "step": 19450 }, { "entropy": 0.2937713272869587, "epoch": 0.7765211850907933, "grad_norm": 0.7800868153572083, "learning_rate": 0.00013991171712519549, "loss": 0.2913181304931641, "mean_token_accuracy": 0.9106004512310029, "num_tokens": 1519341000.0, "step": 19500 }, { "epoch": 0.7765211850907933, "eval_entropy": 0.2831347535053889, "eval_loss": 0.2765350937843323, "eval_mean_token_accuracy": 0.9100822115701342, "eval_num_tokens": 1519341000.0, "eval_runtime": 97.9023, "eval_samples_per_second": 10.214, "eval_steps_per_second": 0.643, "step": 19500 }, { "entropy": 0.3002046720683575, "epoch": 0.7785122650525645, "grad_norm": 0.9976291656494141, "learning_rate": 0.00013961587147285959, "loss": 0.2960696029663086, "mean_token_accuracy": 0.9085316699743271, "num_tokens": 1523229141.0, "step": 19550 }, { "entropy": 0.2912782900035381, "epoch": 0.7805033450143358, "grad_norm": 0.733523428440094, "learning_rate": 0.0001393196139625118, "loss": 0.2924472618103027, "mean_token_accuracy": 0.9113868337869644, "num_tokens": 1527144650.0, "step": 19600 }, { "entropy": 0.29683601841330526, "epoch": 0.782494424976107, "grad_norm": 3.6049697399139404, "learning_rate": 0.00013902294767413053, "loss": 0.29792266845703125, "mean_token_accuracy": 0.9101977044343948, "num_tokens": 1531082847.0, "step": 19650 }, { "entropy": 0.3064700323343277, "epoch": 0.7844855049378783, "grad_norm": 1.5944907665252686, "learning_rate": 0.00013872587569194398, "loss": 0.3019302558898926, "mean_token_accuracy": 0.9075633251667022, "num_tokens": 1534948012.0, "step": 19700 }, { "entropy": 0.29351558551192286, "epoch": 0.7864765848996496, "grad_norm": 1.3509517908096313, "learning_rate": 0.00013842840110439808, "loss": 0.28674448013305665, "mean_token_accuracy": 0.9099786525964737, "num_tokens": 1538734393.0, "step": 19750 }, { "entropy": 0.3015498013794422, "epoch": 0.7884676648614208, "grad_norm": 1.0253088474273682, "learning_rate": 0.00013813052700412427, "loss": 0.2966987419128418, "mean_token_accuracy": 0.9085263866186142, "num_tokens": 1542526844.0, "step": 19800 }, { "entropy": 0.28495381683111193, "epoch": 0.7904587448231921, "grad_norm": 0.5539796352386475, "learning_rate": 0.00013783225648790755, "loss": 0.2807819175720215, "mean_token_accuracy": 0.9120886480808258, "num_tokens": 1546491227.0, "step": 19850 }, { "entropy": 0.29954033985733985, "epoch": 0.7924498247849634, "grad_norm": 0.7651054859161377, "learning_rate": 0.0001375335926566541, "loss": 0.29225250244140627, "mean_token_accuracy": 0.9085421603918076, "num_tokens": 1550363335.0, "step": 19900 }, { "entropy": 0.30176965445280074, "epoch": 0.7944409047467347, "grad_norm": 0.857192873954773, "learning_rate": 0.0001372345386153592, "loss": 0.2950387954711914, "mean_token_accuracy": 0.9084928894042968, "num_tokens": 1554358423.0, "step": 19950 }, { "entropy": 0.2943139246106148, "epoch": 0.7964319847085058, "grad_norm": 1.0411840677261353, "learning_rate": 0.00013693509747307475, "loss": 0.2914638137817383, "mean_token_accuracy": 0.9101592683792115, "num_tokens": 1558255298.0, "step": 20000 }, { "entropy": 0.2895458571612835, "epoch": 0.7984230646702771, "grad_norm": 0.6626200079917908, "learning_rate": 0.0001366352723428772, "loss": 0.28636066436767577, "mean_token_accuracy": 0.9115378284454345, "num_tokens": 1562020206.0, "step": 20050 }, { "entropy": 0.29198448449373243, "epoch": 0.8004141446320484, "grad_norm": 0.5825337171554565, "learning_rate": 0.0001363350663418349, "loss": 0.28708467483520506, "mean_token_accuracy": 0.9096462821960449, "num_tokens": 1565841289.0, "step": 20100 }, { "entropy": 0.29816041797399523, "epoch": 0.8024052245938197, "grad_norm": 1.3403664827346802, "learning_rate": 0.00013603448259097594, "loss": 0.2884747314453125, "mean_token_accuracy": 0.9092539829015732, "num_tokens": 1569616432.0, "step": 20150 }, { "entropy": 0.28857394456863406, "epoch": 0.804396304555591, "grad_norm": 0.6245424151420593, "learning_rate": 0.0001357335242152556, "loss": 0.2860875701904297, "mean_token_accuracy": 0.9124082696437835, "num_tokens": 1573553700.0, "step": 20200 }, { "entropy": 0.28813895463943484, "epoch": 0.8063873845173622, "grad_norm": 1.2858823537826538, "learning_rate": 0.00013543219434352378, "loss": 0.28842620849609374, "mean_token_accuracy": 0.9118660360574722, "num_tokens": 1577421693.0, "step": 20250 }, { "entropy": 0.2930313354730606, "epoch": 0.8083784644791335, "grad_norm": 0.7111997008323669, "learning_rate": 0.00013513049610849276, "loss": 0.29174827575683593, "mean_token_accuracy": 0.909861397743225, "num_tokens": 1581253990.0, "step": 20300 }, { "entropy": 0.29792274728417395, "epoch": 0.8103695444409047, "grad_norm": 0.805564284324646, "learning_rate": 0.00013482843264670417, "loss": 0.29509361267089845, "mean_token_accuracy": 0.9099700027704238, "num_tokens": 1585185270.0, "step": 20350 }, { "entropy": 0.2874870964884758, "epoch": 0.812360624402676, "grad_norm": 1.422304391860962, "learning_rate": 0.00013452600709849683, "loss": 0.2821670913696289, "mean_token_accuracy": 0.9122043216228485, "num_tokens": 1588938656.0, "step": 20400 }, { "entropy": 0.2863489907979965, "epoch": 0.8143517043644473, "grad_norm": 0.6061295866966248, "learning_rate": 0.00013422322260797388, "loss": 0.2792085266113281, "mean_token_accuracy": 0.9122142070531845, "num_tokens": 1592889695.0, "step": 20450 }, { "entropy": 0.2885513660311699, "epoch": 0.8163427843262185, "grad_norm": 0.8144425749778748, "learning_rate": 0.00013392008232297007, "loss": 0.2867462158203125, "mean_token_accuracy": 0.9113090354204177, "num_tokens": 1596752777.0, "step": 20500 }, { "entropy": 0.29169064000248907, "epoch": 0.8183338642879898, "grad_norm": 0.6729059219360352, "learning_rate": 0.00013361658939501918, "loss": 0.28905179977416995, "mean_token_accuracy": 0.9103005719184876, "num_tokens": 1600576446.0, "step": 20550 }, { "entropy": 0.2888325278460979, "epoch": 0.8203249442497611, "grad_norm": 0.6104068756103516, "learning_rate": 0.00013331274697932102, "loss": 0.2853478813171387, "mean_token_accuracy": 0.9112936478853225, "num_tokens": 1604457022.0, "step": 20600 }, { "entropy": 0.2846215434372425, "epoch": 0.8223160242115324, "grad_norm": 0.7673185467720032, "learning_rate": 0.00013300855823470897, "loss": 0.27966604232788084, "mean_token_accuracy": 0.9125616484880448, "num_tokens": 1608292991.0, "step": 20650 }, { "entropy": 0.29237379983067513, "epoch": 0.8243071041733036, "grad_norm": 0.6417551040649414, "learning_rate": 0.0001327040263236168, "loss": 0.2925300216674805, "mean_token_accuracy": 0.9110818821191787, "num_tokens": 1612190418.0, "step": 20700 }, { "entropy": 0.2841272747516632, "epoch": 0.8262981841350748, "grad_norm": 0.7522392868995667, "learning_rate": 0.00013239915441204595, "loss": 0.2833536529541016, "mean_token_accuracy": 0.9123351633548736, "num_tokens": 1616165303.0, "step": 20750 }, { "entropy": 0.2900773739814758, "epoch": 0.8282892640968461, "grad_norm": 0.7694281339645386, "learning_rate": 0.00013209394566953274, "loss": 0.28611156463623044, "mean_token_accuracy": 0.9110399371385575, "num_tokens": 1620119842.0, "step": 20800 }, { "entropy": 0.2869560627639294, "epoch": 0.8302803440586174, "grad_norm": 0.612058162689209, "learning_rate": 0.00013178840326911505, "loss": 0.28881828308105467, "mean_token_accuracy": 0.9115813100337982, "num_tokens": 1624074063.0, "step": 20850 }, { "entropy": 0.28707610845565795, "epoch": 0.8322714240203887, "grad_norm": 4.706964015960693, "learning_rate": 0.0001314825303872998, "loss": 0.28341548919677734, "mean_token_accuracy": 0.9111490190029145, "num_tokens": 1627862759.0, "step": 20900 }, { "entropy": 0.29098447114229203, "epoch": 0.83426250398216, "grad_norm": 83.11225891113281, "learning_rate": 0.00013117633020402948, "loss": 0.29449493408203126, "mean_token_accuracy": 0.9103209149837493, "num_tokens": 1631880304.0, "step": 20950 }, { "entropy": 0.28104673102498057, "epoch": 0.8362535839439312, "grad_norm": 0.9187382459640503, "learning_rate": 0.0001308698059026495, "loss": 0.2771605110168457, "mean_token_accuracy": 0.9139135485887527, "num_tokens": 1635803010.0, "step": 21000 }, { "epoch": 0.8362535839439312, "eval_entropy": 0.272681377709858, "eval_loss": 0.2638475000858307, "eval_mean_token_accuracy": 0.9123603133928209, "eval_num_tokens": 1635803010.0, "eval_runtime": 98.3478, "eval_samples_per_second": 10.168, "eval_steps_per_second": 0.641, "step": 21000 }, { "entropy": 0.27485424920916557, "epoch": 0.8382446639057024, "grad_norm": 0.7038730382919312, "learning_rate": 0.00013056296066987473, "loss": 0.27148242950439455, "mean_token_accuracy": 0.9148015469312668, "num_tokens": 1639495679.0, "step": 21050 }, { "entropy": 0.28288276672363283, "epoch": 0.8402357438674737, "grad_norm": 0.577369213104248, "learning_rate": 0.00013025579769575666, "loss": 0.28407854080200196, "mean_token_accuracy": 0.913193479180336, "num_tokens": 1643444580.0, "step": 21100 }, { "entropy": 0.2863396653532982, "epoch": 0.842226823829245, "grad_norm": 0.675909161567688, "learning_rate": 0.00012994832017365, "loss": 0.28254219055175783, "mean_token_accuracy": 0.9116067427396775, "num_tokens": 1647401591.0, "step": 21150 }, { "entropy": 0.2777939510345459, "epoch": 0.8442179037910162, "grad_norm": 0.6068330407142639, "learning_rate": 0.00012964053130017965, "loss": 0.2754404067993164, "mean_token_accuracy": 0.9133421510457993, "num_tokens": 1651250447.0, "step": 21200 }, { "entropy": 0.27697601169347763, "epoch": 0.8462089837527875, "grad_norm": 0.6943087577819824, "learning_rate": 0.00012933243427520744, "loss": 0.2733424949645996, "mean_token_accuracy": 0.9146704155206681, "num_tokens": 1655031979.0, "step": 21250 }, { "entropy": 0.28300220489501954, "epoch": 0.8482000637145588, "grad_norm": 0.6098906993865967, "learning_rate": 0.00012902403230179876, "loss": 0.27838035583496096, "mean_token_accuracy": 0.9125377869606018, "num_tokens": 1658919160.0, "step": 21300 }, { "entropy": 0.28187712758779526, "epoch": 0.8501911436763301, "grad_norm": 0.6931467652320862, "learning_rate": 0.00012871532858618938, "loss": 0.27799694061279295, "mean_token_accuracy": 0.9131047081947327, "num_tokens": 1662939793.0, "step": 21350 }, { "entropy": 0.277739409506321, "epoch": 0.8521822236381013, "grad_norm": 1.1240650415420532, "learning_rate": 0.00012840632633775206, "loss": 0.2785769462585449, "mean_token_accuracy": 0.9145133805274963, "num_tokens": 1666887365.0, "step": 21400 }, { "entropy": 0.284853600114584, "epoch": 0.8541733035998725, "grad_norm": 0.633203387260437, "learning_rate": 0.00012809702876896318, "loss": 0.283808536529541, "mean_token_accuracy": 0.9126669526100158, "num_tokens": 1670758104.0, "step": 21450 }, { "entropy": 0.2907887764275074, "epoch": 0.8561643835616438, "grad_norm": 0.6257302761077881, "learning_rate": 0.00012778743909536933, "loss": 0.28514747619628905, "mean_token_accuracy": 0.9115799862146378, "num_tokens": 1674580664.0, "step": 21500 }, { "entropy": 0.2757272598147392, "epoch": 0.8581554635234151, "grad_norm": 0.8768251538276672, "learning_rate": 0.000127477560535554, "loss": 0.2793731117248535, "mean_token_accuracy": 0.9143383550643921, "num_tokens": 1678625665.0, "step": 21550 }, { "entropy": 0.283792520314455, "epoch": 0.8601465434851864, "grad_norm": 0.7027562856674194, "learning_rate": 0.0001271673963111039, "loss": 0.2817673110961914, "mean_token_accuracy": 0.9126435059309006, "num_tokens": 1682588441.0, "step": 21600 }, { "entropy": 0.28072837233543396, "epoch": 0.8621376234469577, "grad_norm": 0.6573081612586975, "learning_rate": 0.00012685694964657577, "loss": 0.27910221099853516, "mean_token_accuracy": 0.9130741447210312, "num_tokens": 1686440667.0, "step": 21650 }, { "entropy": 0.29020294785499573, "epoch": 0.8641287034087289, "grad_norm": 0.8147639036178589, "learning_rate": 0.00012654622376946244, "loss": 0.28830547332763673, "mean_token_accuracy": 0.9110956585407257, "num_tokens": 1690334875.0, "step": 21700 }, { "entropy": 0.2864123769104481, "epoch": 0.8661197833705001, "grad_norm": 0.6632215976715088, "learning_rate": 0.0001262352219101597, "loss": 0.284028205871582, "mean_token_accuracy": 0.9122103857994079, "num_tokens": 1694351164.0, "step": 21750 }, { "entropy": 0.27724299728870394, "epoch": 0.8681108633322714, "grad_norm": 0.6660967469215393, "learning_rate": 0.00012592394730193243, "loss": 0.27416006088256833, "mean_token_accuracy": 0.9146931290626525, "num_tokens": 1698319175.0, "step": 21800 }, { "entropy": 0.2856806117296219, "epoch": 0.8701019432940427, "grad_norm": 0.6249071955680847, "learning_rate": 0.00012561240318088117, "loss": 0.2827252197265625, "mean_token_accuracy": 0.9123916620016098, "num_tokens": 1702324421.0, "step": 21850 }, { "entropy": 0.27884934067726136, "epoch": 0.872093023255814, "grad_norm": 0.6073641180992126, "learning_rate": 0.00012530059278590834, "loss": 0.2758992767333984, "mean_token_accuracy": 0.9137480568885803, "num_tokens": 1706271279.0, "step": 21900 }, { "entropy": 0.27764024019241335, "epoch": 0.8740841032175852, "grad_norm": 0.678048849105835, "learning_rate": 0.00012498851935868462, "loss": 0.2740013885498047, "mean_token_accuracy": 0.9140461575984955, "num_tokens": 1710144015.0, "step": 21950 }, { "entropy": 0.2866260698437691, "epoch": 0.8760751831793565, "grad_norm": 0.552971363067627, "learning_rate": 0.00012467618614361522, "loss": 0.2822286796569824, "mean_token_accuracy": 0.9123277628421783, "num_tokens": 1714077414.0, "step": 22000 }, { "entropy": 0.28236930549144745, "epoch": 0.8780662631411278, "grad_norm": 0.794441819190979, "learning_rate": 0.00012436359638780625, "loss": 0.2772479248046875, "mean_token_accuracy": 0.9128434807062149, "num_tokens": 1717927801.0, "step": 22050 }, { "entropy": 0.281161185503006, "epoch": 0.880057343102899, "grad_norm": 0.6617610454559326, "learning_rate": 0.0001240507533410309, "loss": 0.2774828910827637, "mean_token_accuracy": 0.9129059422016144, "num_tokens": 1721773313.0, "step": 22100 }, { "entropy": 0.2819554080069065, "epoch": 0.8820484230646702, "grad_norm": 0.6973550915718079, "learning_rate": 0.00012373766025569553, "loss": 0.28294713973999025, "mean_token_accuracy": 0.912370182275772, "num_tokens": 1725624454.0, "step": 22150 }, { "entropy": 0.27646703749895096, "epoch": 0.8840395030264415, "grad_norm": 0.6695847511291504, "learning_rate": 0.00012342432038680613, "loss": 0.2731535530090332, "mean_token_accuracy": 0.9140887254476547, "num_tokens": 1729506204.0, "step": 22200 }, { "entropy": 0.2871167133748531, "epoch": 0.8860305829882128, "grad_norm": 0.6398441791534424, "learning_rate": 0.00012311073699193417, "loss": 0.2833348655700684, "mean_token_accuracy": 0.9114724487066269, "num_tokens": 1733325644.0, "step": 22250 }, { "entropy": 0.2782342202961445, "epoch": 0.8880216629499841, "grad_norm": 0.7357836961746216, "learning_rate": 0.00012279691333118295, "loss": 0.27574146270751954, "mean_token_accuracy": 0.9140692150592804, "num_tokens": 1737060975.0, "step": 22300 }, { "entropy": 0.2777273601293564, "epoch": 0.8900127429117554, "grad_norm": 0.9853019118309021, "learning_rate": 0.00012248285266715372, "loss": 0.2757154083251953, "mean_token_accuracy": 0.9137124174833298, "num_tokens": 1740993084.0, "step": 22350 }, { "entropy": 0.28363671705126764, "epoch": 0.8920038228735266, "grad_norm": 1.481124997138977, "learning_rate": 0.00012216855826491157, "loss": 0.27882377624511717, "mean_token_accuracy": 0.9136800271272659, "num_tokens": 1744954440.0, "step": 22400 }, { "entropy": 0.294609692543745, "epoch": 0.8939949028352978, "grad_norm": 1.5501596927642822, "learning_rate": 0.0001218540333919516, "loss": 0.28765769958496096, "mean_token_accuracy": 0.909398307800293, "num_tokens": 1748996368.0, "step": 22450 }, { "entropy": 0.28076896131038664, "epoch": 0.8959859827970691, "grad_norm": 0.7389530539512634, "learning_rate": 0.00012153928131816508, "loss": 0.2751160621643066, "mean_token_accuracy": 0.9133437407016755, "num_tokens": 1752755641.0, "step": 22500 }, { "epoch": 0.8959859827970691, "eval_entropy": 0.2637722234404276, "eval_loss": 0.26361361145973206, "eval_mean_token_accuracy": 0.9137998251687913, "eval_num_tokens": 1752755641.0, "eval_runtime": 97.9442, "eval_samples_per_second": 10.21, "eval_steps_per_second": 0.643, "step": 22500 }, { "entropy": 0.28221323758363726, "epoch": 0.8979770627588404, "grad_norm": 1.2229335308074951, "learning_rate": 0.00012122430531580518, "loss": 0.2809852981567383, "mean_token_accuracy": 0.9124694418907165, "num_tokens": 1756678555.0, "step": 22550 }, { "entropy": 0.27395280748605727, "epoch": 0.8999681427206117, "grad_norm": 0.9872536659240723, "learning_rate": 0.0001209091086594532, "loss": 0.2725690841674805, "mean_token_accuracy": 0.9150059783458709, "num_tokens": 1760475624.0, "step": 22600 }, { "entropy": 0.2766468720138073, "epoch": 0.9019592226823829, "grad_norm": 0.7842338681221008, "learning_rate": 0.00012059369462598434, "loss": 0.2731148147583008, "mean_token_accuracy": 0.9147698014974595, "num_tokens": 1764358750.0, "step": 22650 }, { "entropy": 0.2784818311035633, "epoch": 0.9039503026441542, "grad_norm": 1.282228946685791, "learning_rate": 0.00012027806649453375, "loss": 0.271495475769043, "mean_token_accuracy": 0.9144920819997787, "num_tokens": 1768380630.0, "step": 22700 }, { "entropy": 0.2735689042508602, "epoch": 0.9059413826059255, "grad_norm": 0.7193032503128052, "learning_rate": 0.00011996222754646243, "loss": 0.2712744140625, "mean_token_accuracy": 0.9150397133827209, "num_tokens": 1772361438.0, "step": 22750 }, { "entropy": 0.2756591281294823, "epoch": 0.9079324625676968, "grad_norm": 1.0555336475372314, "learning_rate": 0.00011964618106532305, "loss": 0.2744468688964844, "mean_token_accuracy": 0.9148192751407623, "num_tokens": 1776341205.0, "step": 22800 }, { "entropy": 0.27616533294320106, "epoch": 0.9099235425294679, "grad_norm": 1.0314396619796753, "learning_rate": 0.00011932993033682594, "loss": 0.27454004287719724, "mean_token_accuracy": 0.9143799149990082, "num_tokens": 1780235661.0, "step": 22850 }, { "entropy": 0.26893782630562785, "epoch": 0.9119146224912392, "grad_norm": 1.0618172883987427, "learning_rate": 0.00011901347864880465, "loss": 0.2655687141418457, "mean_token_accuracy": 0.9161686682701111, "num_tokens": 1784043451.0, "step": 22900 }, { "entropy": 0.27906202867627145, "epoch": 0.9139057024530105, "grad_norm": 2.1218345165252686, "learning_rate": 0.00011869682929118218, "loss": 0.2727456474304199, "mean_token_accuracy": 0.9137376379966736, "num_tokens": 1787896121.0, "step": 22950 }, { "entropy": 0.27811609491705896, "epoch": 0.9158967824147818, "grad_norm": 3.4673054218292236, "learning_rate": 0.00011837998555593641, "loss": 0.2778665542602539, "mean_token_accuracy": 0.9137892138957977, "num_tokens": 1791848628.0, "step": 23000 }, { "entropy": 0.2751833336055279, "epoch": 0.9178878623765531, "grad_norm": 1.046271800994873, "learning_rate": 0.00011806295073706616, "loss": 0.2735797691345215, "mean_token_accuracy": 0.9143856483697891, "num_tokens": 1795804119.0, "step": 23050 }, { "entropy": 0.2802681289613247, "epoch": 0.9198789423383243, "grad_norm": 0.8259762525558472, "learning_rate": 0.00011774572813055664, "loss": 0.2742568016052246, "mean_token_accuracy": 0.9139988601207734, "num_tokens": 1799488591.0, "step": 23100 }, { "entropy": 0.278084037899971, "epoch": 0.9218700223000956, "grad_norm": 0.6955431699752808, "learning_rate": 0.00011742832103434554, "loss": 0.2744667434692383, "mean_token_accuracy": 0.914206195473671, "num_tokens": 1803610334.0, "step": 23150 }, { "entropy": 0.2704257676005363, "epoch": 0.9238611022618668, "grad_norm": 0.672705352306366, "learning_rate": 0.0001171107327482884, "loss": 0.2704540061950684, "mean_token_accuracy": 0.9158248662948608, "num_tokens": 1807570820.0, "step": 23200 }, { "entropy": 0.2817454455792904, "epoch": 0.9258521822236381, "grad_norm": 0.9053704738616943, "learning_rate": 0.00011679296657412457, "loss": 0.2776220703125, "mean_token_accuracy": 0.9126688486337662, "num_tokens": 1811374443.0, "step": 23250 }, { "entropy": 0.2809554924070835, "epoch": 0.9278432621854094, "grad_norm": 0.7101280689239502, "learning_rate": 0.00011647502581544272, "loss": 0.2807320022583008, "mean_token_accuracy": 0.9124188989400863, "num_tokens": 1815335476.0, "step": 23300 }, { "entropy": 0.2801722341775894, "epoch": 0.9298343421471806, "grad_norm": 0.9088023900985718, "learning_rate": 0.0001161569137776466, "loss": 0.2738960838317871, "mean_token_accuracy": 0.9143745040893555, "num_tokens": 1819119258.0, "step": 23350 }, { "entropy": 0.279843023866415, "epoch": 0.9318254221089519, "grad_norm": 0.7811700105667114, "learning_rate": 0.0001158386337679205, "loss": 0.27740699768066407, "mean_token_accuracy": 0.9128563135862351, "num_tokens": 1822965082.0, "step": 23400 }, { "entropy": 0.2781392467021942, "epoch": 0.9338165020707232, "grad_norm": 0.5838942527770996, "learning_rate": 0.00011552018909519516, "loss": 0.2734776496887207, "mean_token_accuracy": 0.9132671678066253, "num_tokens": 1826899316.0, "step": 23450 }, { "entropy": 0.28047511413693427, "epoch": 0.9358075820324945, "grad_norm": 3.2033631801605225, "learning_rate": 0.00011520158307011313, "loss": 0.27559213638305663, "mean_token_accuracy": 0.9144525969028473, "num_tokens": 1830712474.0, "step": 23500 }, { "entropy": 0.2832055461406708, "epoch": 0.9377986619942656, "grad_norm": 28.602519989013672, "learning_rate": 0.00011488281900499443, "loss": 0.2764240074157715, "mean_token_accuracy": 0.9124950170516968, "num_tokens": 1834596753.0, "step": 23550 }, { "entropy": 0.3014590518176556, "epoch": 0.9397897419560369, "grad_norm": 17.5722599029541, "learning_rate": 0.00011456390021380206, "loss": 0.29091754913330076, "mean_token_accuracy": 0.9100847208499908, "num_tokens": 1838467819.0, "step": 23600 }, { "entropy": 0.29293319925665856, "epoch": 0.9417808219178082, "grad_norm": 10.521018028259277, "learning_rate": 0.00011424483001210768, "loss": 0.28235774993896484, "mean_token_accuracy": 0.9123268640041351, "num_tokens": 1842299724.0, "step": 23650 }, { "entropy": 0.27152210757136347, "epoch": 0.9437719018795795, "grad_norm": 16.392244338989258, "learning_rate": 0.000113925611717057, "loss": 0.27001758575439455, "mean_token_accuracy": 0.9153967237472534, "num_tokens": 1846207939.0, "step": 23700 }, { "entropy": 0.27423043057322505, "epoch": 0.9457629818413508, "grad_norm": 161.79493713378906, "learning_rate": 0.00011360624864733542, "loss": 0.2701198959350586, "mean_token_accuracy": 0.9150199323892594, "num_tokens": 1850200783.0, "step": 23750 }, { "entropy": 0.2868032360076904, "epoch": 0.947754061803122, "grad_norm": 34.27143478393555, "learning_rate": 0.00011328674412313338, "loss": 0.2828762435913086, "mean_token_accuracy": 0.910566845536232, "num_tokens": 1853983913.0, "step": 23800 }, { "entropy": 0.28378346920013425, "epoch": 0.9497451417648933, "grad_norm": 19.305675506591797, "learning_rate": 0.00011296710146611191, "loss": 0.27950349807739255, "mean_token_accuracy": 0.9141000217199325, "num_tokens": 1858015165.0, "step": 23850 }, { "entropy": 0.2722449879348278, "epoch": 0.9517362217266645, "grad_norm": 5.517458915710449, "learning_rate": 0.00011264732399936821, "loss": 0.27257476806640624, "mean_token_accuracy": 0.915144516825676, "num_tokens": 1862150874.0, "step": 23900 }, { "entropy": 0.28292769208550456, "epoch": 0.9537273016884358, "grad_norm": 4.40126371383667, "learning_rate": 0.00011232741504740095, "loss": 0.2809117317199707, "mean_token_accuracy": 0.912839834690094, "num_tokens": 1865854098.0, "step": 23950 }, { "entropy": 0.27857477843761447, "epoch": 0.9557183816502071, "grad_norm": 5.774588584899902, "learning_rate": 0.00011200737793607572, "loss": 0.2793265914916992, "mean_token_accuracy": 0.9136429125070572, "num_tokens": 1869802187.0, "step": 24000 }, { "epoch": 0.9557183816502071, "eval_entropy": 0.2723109987046983, "eval_loss": 0.25965479016304016, "eval_mean_token_accuracy": 0.9130434602025955, "eval_num_tokens": 1869802187.0, "eval_runtime": 97.8102, "eval_samples_per_second": 10.224, "eval_steps_per_second": 0.644, "step": 24000 }, { "entropy": 0.6563278517127037, "epoch": 0.9577094616119783, "grad_norm": 39.699913024902344, "learning_rate": 0.00011168721599259049, "loss": 0.6549944305419921, "mean_token_accuracy": 0.8380170410871506, "num_tokens": 1873744084.0, "step": 24050 }, { "entropy": 0.4795880228281021, "epoch": 0.9597005415737496, "grad_norm": 1335.2706298828125, "learning_rate": 0.0001113669325454411, "loss": 0.45922279357910156, "mean_token_accuracy": 0.8766013658046723, "num_tokens": 1877664337.0, "step": 24100 }, { "entropy": 0.36844881772995, "epoch": 0.9616916215355209, "grad_norm": 125.4538803100586, "learning_rate": 0.00011104653092438652, "loss": 0.357088623046875, "mean_token_accuracy": 0.899301546216011, "num_tokens": 1881595432.0, "step": 24150 }, { "entropy": 0.37986351013183595, "epoch": 0.9636827014972922, "grad_norm": 41.903934478759766, "learning_rate": 0.00011072601446041435, "loss": 0.3584012222290039, "mean_token_accuracy": 0.8966500133275985, "num_tokens": 1885438520.0, "step": 24200 }, { "entropy": 0.39044318586587906, "epoch": 0.9656737814590634, "grad_norm": 44.811279296875, "learning_rate": 0.00011040538648570596, "loss": 0.36628631591796873, "mean_token_accuracy": 0.8948707044124603, "num_tokens": 1889295407.0, "step": 24250 }, { "entropy": 0.33998255178332326, "epoch": 0.9676648614208346, "grad_norm": 57.77637481689453, "learning_rate": 0.00011008465033360225, "loss": 0.32590660095214846, "mean_token_accuracy": 0.9039149129390717, "num_tokens": 1893118198.0, "step": 24300 }, { "entropy": 0.32903214752674104, "epoch": 0.9696559413826059, "grad_norm": 51.61495590209961, "learning_rate": 0.00010976380933856858, "loss": 0.32896270751953127, "mean_token_accuracy": 0.9040062379837036, "num_tokens": 1897060288.0, "step": 24350 }, { "entropy": 0.3667915537953377, "epoch": 0.9716470213443772, "grad_norm": 47.6137580871582, "learning_rate": 0.0001094428668361604, "loss": 0.35173583984375, "mean_token_accuracy": 0.8967252117395401, "num_tokens": 1900824780.0, "step": 24400 }, { "entropy": 0.349236313700676, "epoch": 0.9736381013061485, "grad_norm": 64.8992919921875, "learning_rate": 0.00010912182616298838, "loss": 0.33668148040771484, "mean_token_accuracy": 0.903141537308693, "num_tokens": 1904750342.0, "step": 24450 }, { "entropy": 0.35872448712587357, "epoch": 0.9756291812679198, "grad_norm": 11.008445739746094, "learning_rate": 0.0001088006906566839, "loss": 0.34439208984375, "mean_token_accuracy": 0.8992702323198318, "num_tokens": 1908808184.0, "step": 24500 }, { "entropy": 0.33843471750617027, "epoch": 0.977620261229691, "grad_norm": 15.063654899597168, "learning_rate": 0.00010847946365586413, "loss": 0.3207670974731445, "mean_token_accuracy": 0.9043490439653397, "num_tokens": 1912630065.0, "step": 24550 }, { "entropy": 0.4166515836119652, "epoch": 0.9796113411914622, "grad_norm": 665.3616333007812, "learning_rate": 0.00010815814850009753, "loss": 0.39070816040039064, "mean_token_accuracy": 0.8894343000650405, "num_tokens": 1916567398.0, "step": 24600 }, { "entropy": 0.3832103142142296, "epoch": 0.9816024211532335, "grad_norm": 145.4870147705078, "learning_rate": 0.00010783674852986903, "loss": 0.363221435546875, "mean_token_accuracy": 0.895402774810791, "num_tokens": 1920587404.0, "step": 24650 }, { "entropy": 0.35218898981809615, "epoch": 0.9835935011150048, "grad_norm": 288.9332580566406, "learning_rate": 0.00010751526708654531, "loss": 0.3388285827636719, "mean_token_accuracy": 0.9000647193193436, "num_tokens": 1924451590.0, "step": 24700 }, { "entropy": 0.363860125541687, "epoch": 0.985584581076776, "grad_norm": 128.26956176757812, "learning_rate": 0.00010719370751234003, "loss": 0.34467056274414065, "mean_token_accuracy": 0.8984408980607986, "num_tokens": 1928295240.0, "step": 24750 }, { "entropy": 0.332768639922142, "epoch": 0.9875756610385473, "grad_norm": 9.291278839111328, "learning_rate": 0.00010687207315027919, "loss": 0.3231398773193359, "mean_token_accuracy": 0.9035398948192597, "num_tokens": 1932020575.0, "step": 24800 }, { "entropy": 0.32511512815952304, "epoch": 0.9895667410003186, "grad_norm": 12.312918663024902, "learning_rate": 0.00010655036734416624, "loss": 0.3185703086853027, "mean_token_accuracy": 0.9060599678754806, "num_tokens": 1936014439.0, "step": 24850 }, { "entropy": 0.3694388023018837, "epoch": 0.9915578209620899, "grad_norm": 1.855156421661377, "learning_rate": 0.00010622859343854743, "loss": 0.357412223815918, "mean_token_accuracy": 0.8961717420816422, "num_tokens": 1939922696.0, "step": 24900 }, { "entropy": 0.35190608859062195, "epoch": 0.9935489009238611, "grad_norm": 79.05413818359375, "learning_rate": 0.000105906754778677, "loss": 0.3574227523803711, "mean_token_accuracy": 0.8979073971509933, "num_tokens": 1944061420.0, "step": 24950 }, { "entropy": 0.3361901544034481, "epoch": 0.9955399808856323, "grad_norm": 14.088053703308105, "learning_rate": 0.00010558485471048232, "loss": 0.3378467559814453, "mean_token_accuracy": 0.9023239356279373, "num_tokens": 1948190479.0, "step": 25000 }, { "entropy": 0.3119985489547253, "epoch": 0.9975310608474036, "grad_norm": 35.4752082824707, "learning_rate": 0.00010526289658052926, "loss": 0.30782127380371094, "mean_token_accuracy": 0.9068952518701553, "num_tokens": 1952114636.0, "step": 25050 }, { "entropy": 0.2962914815545082, "epoch": 0.9995221408091749, "grad_norm": 27.441314697265625, "learning_rate": 0.00010494088373598727, "loss": 0.2854899215698242, "mean_token_accuracy": 0.9109463971853257, "num_tokens": 1955930483.0, "step": 25100 }, { "entropy": 0.28696138501167295, "epoch": 1.001513220770946, "grad_norm": 3.6715400218963623, "learning_rate": 0.00010461881952459469, "loss": 0.28212398529052735, "mean_token_accuracy": 0.9123009568452836, "num_tokens": 1959705137.0, "step": 25150 }, { "entropy": 0.26907322466373446, "epoch": 1.0035043007327173, "grad_norm": 28.90825843811035, "learning_rate": 0.00010429670729462373, "loss": 0.2622692680358887, "mean_token_accuracy": 0.9167272865772247, "num_tokens": 1963657615.0, "step": 25200 }, { "entropy": 0.2590576921403408, "epoch": 1.0054953806944886, "grad_norm": 4.9817585945129395, "learning_rate": 0.00010397455039484605, "loss": 0.2512243843078613, "mean_token_accuracy": 0.9190041106939316, "num_tokens": 1967587403.0, "step": 25250 }, { "entropy": 0.25928459629416467, "epoch": 1.00748646065626, "grad_norm": 3.129709482192993, "learning_rate": 0.0001036523521744975, "loss": 0.25957672119140623, "mean_token_accuracy": 0.9176103568077087, "num_tokens": 1971448796.0, "step": 25300 }, { "entropy": 0.26116902694106103, "epoch": 1.0094775406180312, "grad_norm": 10.038873672485352, "learning_rate": 0.00010333011598324363, "loss": 0.25494049072265623, "mean_token_accuracy": 0.9185484343767166, "num_tokens": 1975297418.0, "step": 25350 }, { "entropy": 0.27020337790250776, "epoch": 1.0114686205798025, "grad_norm": 5.4823174476623535, "learning_rate": 0.00010300784517114466, "loss": 0.26545324325561526, "mean_token_accuracy": 0.9158938974142075, "num_tokens": 1979155438.0, "step": 25400 }, { "entropy": 0.26256797939538956, "epoch": 1.0134597005415737, "grad_norm": 36.92467498779297, "learning_rate": 0.00010268554308862088, "loss": 0.2575288009643555, "mean_token_accuracy": 0.9181166028976441, "num_tokens": 1983024409.0, "step": 25450 }, { "entropy": 0.29766422316432, "epoch": 1.015450780503345, "grad_norm": 26.67340660095215, "learning_rate": 0.0001023632130864175, "loss": 0.2937025451660156, "mean_token_accuracy": 0.9106646543741226, "num_tokens": 1986958622.0, "step": 25500 }, { "epoch": 1.015450780503345, "eval_entropy": 0.2694250995677615, "eval_loss": 0.2797989845275879, "eval_mean_token_accuracy": 0.9101072105150374, "eval_num_tokens": 1986958622.0, "eval_runtime": 97.8746, "eval_samples_per_second": 10.217, "eval_steps_per_second": 0.644, "step": 25500 }, { "entropy": 0.28613715797662737, "epoch": 1.0174418604651163, "grad_norm": 9088.736328125, "learning_rate": 0.00010204085851557011, "loss": 0.27716789245605467, "mean_token_accuracy": 0.9129116219282151, "num_tokens": 1990813233.0, "step": 25550 }, { "entropy": 0.27504936650395395, "epoch": 1.0194329404268876, "grad_norm": 38.234413146972656, "learning_rate": 0.00010171848272736968, "loss": 0.26801122665405275, "mean_token_accuracy": 0.9150198262929916, "num_tokens": 1994731019.0, "step": 25600 }, { "entropy": 0.25914262115955355, "epoch": 1.0214240203886589, "grad_norm": 27.66782569885254, "learning_rate": 0.0001013960890733278, "loss": 0.25058454513549805, "mean_token_accuracy": 0.9187197256088256, "num_tokens": 1998645827.0, "step": 25650 }, { "entropy": 0.2702752210199833, "epoch": 1.0234151003504302, "grad_norm": 86.97796630859375, "learning_rate": 0.00010107368090514173, "loss": 0.2650441551208496, "mean_token_accuracy": 0.9166213870048523, "num_tokens": 2002590388.0, "step": 25700 }, { "entropy": 0.26510491490364074, "epoch": 1.0254061803122014, "grad_norm": 2.416658878326416, "learning_rate": 0.00010075126157465969, "loss": 0.26374332427978514, "mean_token_accuracy": 0.9164919888973236, "num_tokens": 2006390464.0, "step": 25750 }, { "entropy": 0.2767194920778275, "epoch": 1.0273972602739727, "grad_norm": 121.55948638916016, "learning_rate": 0.00010042883443384588, "loss": 0.2746761322021484, "mean_token_accuracy": 0.9133573430776596, "num_tokens": 2010376074.0, "step": 25800 }, { "entropy": 0.2857384331524372, "epoch": 1.0293883402357438, "grad_norm": 8.534170150756836, "learning_rate": 0.00010010640283474577, "loss": 0.27749507904052734, "mean_token_accuracy": 0.9122277122735977, "num_tokens": 2014314880.0, "step": 25850 }, { "entropy": 0.2771646900475025, "epoch": 1.031379420197515, "grad_norm": 14.0018949508667, "learning_rate": 9.978397012945118e-05, "loss": 0.27255733489990236, "mean_token_accuracy": 0.9154339116811753, "num_tokens": 2018153993.0, "step": 25900 }, { "entropy": 0.2549267649650574, "epoch": 1.0333705001592863, "grad_norm": 141.65396118164062, "learning_rate": 9.946153967006528e-05, "loss": 0.25027942657470703, "mean_token_accuracy": 0.9198796671628952, "num_tokens": 2021908727.0, "step": 25950 }, { "entropy": 0.2677805428206921, "epoch": 1.0353615801210576, "grad_norm": 19253.08984375, "learning_rate": 9.913911480866817e-05, "loss": 0.2630371856689453, "mean_token_accuracy": 0.916558683514595, "num_tokens": 2025550628.0, "step": 26000 }, { "entropy": 0.2855284099280834, "epoch": 1.037352660082829, "grad_norm": 127.2653579711914, "learning_rate": 9.881669889728144e-05, "loss": 0.28463106155395507, "mean_token_accuracy": 0.9130609530210495, "num_tokens": 2029278311.0, "step": 26050 }, { "entropy": 0.29474446415901184, "epoch": 1.0393437400446002, "grad_norm": 43.862098693847656, "learning_rate": 9.849429528783385e-05, "loss": 0.28278093338012694, "mean_token_accuracy": 0.9114625084400177, "num_tokens": 2033259136.0, "step": 26100 }, { "entropy": 0.30185434013605117, "epoch": 1.0413348200063715, "grad_norm": 5.1499857902526855, "learning_rate": 9.817190733212623e-05, "loss": 0.2916604995727539, "mean_token_accuracy": 0.9096384018659591, "num_tokens": 2037052103.0, "step": 26150 }, { "entropy": 0.29071212783455846, "epoch": 1.0433258999681427, "grad_norm": 364.8683776855469, "learning_rate": 9.784953838179657e-05, "loss": 0.28531660079956056, "mean_token_accuracy": 0.9106332343816758, "num_tokens": 2040924159.0, "step": 26200 }, { "entropy": 0.27380838453769685, "epoch": 1.045316979929914, "grad_norm": 8.768333435058594, "learning_rate": 9.752719178828534e-05, "loss": 0.2673329734802246, "mean_token_accuracy": 0.9157132452726364, "num_tokens": 2044692885.0, "step": 26250 }, { "entropy": 0.2756735447049141, "epoch": 1.0473080598916853, "grad_norm": 107.49151611328125, "learning_rate": 9.72048709028007e-05, "loss": 0.2699962425231934, "mean_token_accuracy": 0.9157623893022537, "num_tokens": 2048454708.0, "step": 26300 }, { "entropy": 0.29151566803455353, "epoch": 1.0492991398534566, "grad_norm": 85.45984649658203, "learning_rate": 9.688257907628326e-05, "loss": 0.2861785888671875, "mean_token_accuracy": 0.9122406727075577, "num_tokens": 2052418372.0, "step": 26350 }, { "entropy": 0.27055223628878594, "epoch": 1.0512902198152279, "grad_norm": 3.6944844722747803, "learning_rate": 9.656031965937183e-05, "loss": 0.2670576858520508, "mean_token_accuracy": 0.9155509883165359, "num_tokens": 2056406304.0, "step": 26400 }, { "entropy": 0.2726173362135887, "epoch": 1.0532812997769991, "grad_norm": 71.38996887207031, "learning_rate": 9.623809600236805e-05, "loss": 0.2644667625427246, "mean_token_accuracy": 0.9153118109703064, "num_tokens": 2060233499.0, "step": 26450 }, { "entropy": 0.27969068244099615, "epoch": 1.0552723797387704, "grad_norm": 320.3172607421875, "learning_rate": 9.591591145520193e-05, "loss": 0.2756903457641602, "mean_token_accuracy": 0.9137703001499176, "num_tokens": 2064138841.0, "step": 26500 }, { "entropy": 0.2718262220919132, "epoch": 1.0572634597005415, "grad_norm": 8.090370178222656, "learning_rate": 9.559376936739682e-05, "loss": 0.2698848342895508, "mean_token_accuracy": 0.9147110247611999, "num_tokens": 2067856174.0, "step": 26550 }, { "entropy": 0.2986389592289925, "epoch": 1.0592545396623128, "grad_norm": 11.137097358703613, "learning_rate": 9.527167308803465e-05, "loss": 0.3257150650024414, "mean_token_accuracy": 0.910808190703392, "num_tokens": 2071739841.0, "step": 26600 }, { "entropy": 0.3147141246497631, "epoch": 1.061245619624084, "grad_norm": 7.234685897827148, "learning_rate": 9.494962596572111e-05, "loss": 0.3103673553466797, "mean_token_accuracy": 0.9063691395521164, "num_tokens": 2075735990.0, "step": 26650 }, { "entropy": 0.31178212597966193, "epoch": 1.0632366995858553, "grad_norm": 8.27217960357666, "learning_rate": 9.462763134855093e-05, "loss": 0.3050539016723633, "mean_token_accuracy": 0.9069130408763886, "num_tokens": 2079589023.0, "step": 26700 }, { "entropy": 0.3006526806950569, "epoch": 1.0652277795476266, "grad_norm": 11.008944511413574, "learning_rate": 9.430569258407283e-05, "loss": 0.29765275955200193, "mean_token_accuracy": 0.9091472399234771, "num_tokens": 2083622258.0, "step": 26750 }, { "entropy": 0.29270223453640937, "epoch": 1.0672188595093979, "grad_norm": 3.3960471153259277, "learning_rate": 9.398381301925499e-05, "loss": 0.2888037872314453, "mean_token_accuracy": 0.9113785433769226, "num_tokens": 2087604238.0, "step": 26800 }, { "entropy": 0.28832288086414337, "epoch": 1.0692099394711692, "grad_norm": 19.040067672729492, "learning_rate": 9.366199600045005e-05, "loss": 0.28535903930664064, "mean_token_accuracy": 0.9119643104076386, "num_tokens": 2091472329.0, "step": 26850 }, { "entropy": 0.2806944952905178, "epoch": 1.0712010194329404, "grad_norm": 15.679569244384766, "learning_rate": 9.334024487336048e-05, "loss": 0.2734016227722168, "mean_token_accuracy": 0.9133606183528901, "num_tokens": 2095395642.0, "step": 26900 }, { "entropy": 0.28680155262351037, "epoch": 1.0731920993947117, "grad_norm": 1.7365965843200684, "learning_rate": 9.301856298300369e-05, "loss": 0.27998071670532226, "mean_token_accuracy": 0.9116964995861053, "num_tokens": 2099217252.0, "step": 26950 }, { "entropy": 0.29625475078821184, "epoch": 1.075183179356483, "grad_norm": 6.737451076507568, "learning_rate": 9.26969536736772e-05, "loss": 0.28877586364746094, "mean_token_accuracy": 0.9105580598115921, "num_tokens": 2103184387.0, "step": 27000 }, { "epoch": 1.075183179356483, "eval_entropy": 0.29035906659232247, "eval_loss": 0.2825865149497986, "eval_mean_token_accuracy": 0.9076645118849618, "eval_num_tokens": 2103184387.0, "eval_runtime": 98.213, "eval_samples_per_second": 10.182, "eval_steps_per_second": 0.641, "step": 27000 }, { "entropy": 0.2876469852030277, "epoch": 1.0771742593182543, "grad_norm": 1.4166911840438843, "learning_rate": 9.237542028892412e-05, "loss": 0.28487411499023435, "mean_token_accuracy": 0.911678535938263, "num_tokens": 2107077111.0, "step": 27050 }, { "entropy": 0.29179634869098664, "epoch": 1.0791653392800256, "grad_norm": 3.1514477729797363, "learning_rate": 9.205396617149813e-05, "loss": 0.2909921836853027, "mean_token_accuracy": 0.910441267490387, "num_tokens": 2110962261.0, "step": 27100 }, { "entropy": 0.29678445786237717, "epoch": 1.0811564192417968, "grad_norm": 40.26863098144531, "learning_rate": 9.173259466332881e-05, "loss": 0.29503396987915037, "mean_token_accuracy": 0.9089562743902206, "num_tokens": 2114690971.0, "step": 27150 }, { "entropy": 0.27730693414807317, "epoch": 1.0831474992035681, "grad_norm": 14.38628101348877, "learning_rate": 9.14113091054869e-05, "loss": 0.2759782028198242, "mean_token_accuracy": 0.9139302664995194, "num_tokens": 2118761603.0, "step": 27200 }, { "entropy": 0.27558964386582374, "epoch": 1.0851385791653392, "grad_norm": 7.265783309936523, "learning_rate": 9.109011283814975e-05, "loss": 0.273838005065918, "mean_token_accuracy": 0.9154215580224991, "num_tokens": 2122603326.0, "step": 27250 }, { "entropy": 0.27117940336465834, "epoch": 1.0871296591271105, "grad_norm": 67.00965881347656, "learning_rate": 9.07690092005661e-05, "loss": 0.2704639434814453, "mean_token_accuracy": 0.9143139374256134, "num_tokens": 2126467523.0, "step": 27300 }, { "entropy": 0.27915058851242064, "epoch": 1.0891207390888817, "grad_norm": 15.945594787597656, "learning_rate": 9.044800153102201e-05, "loss": 0.27274932861328127, "mean_token_accuracy": 0.9147227293252945, "num_tokens": 2130549596.0, "step": 27350 }, { "entropy": 0.28577979490160943, "epoch": 1.091111819050653, "grad_norm": 20.842540740966797, "learning_rate": 9.01270931668056e-05, "loss": 0.2831624984741211, "mean_token_accuracy": 0.9122427719831466, "num_tokens": 2134470609.0, "step": 27400 }, { "entropy": 0.279740676432848, "epoch": 1.0931028990124243, "grad_norm": 26.93157958984375, "learning_rate": 8.98062874441727e-05, "loss": 0.27642791748046874, "mean_token_accuracy": 0.9142916613817215, "num_tokens": 2138309187.0, "step": 27450 }, { "entropy": 0.2770803037285805, "epoch": 1.0950939789741956, "grad_norm": 35.35862350463867, "learning_rate": 8.948558769831204e-05, "loss": 0.2779220390319824, "mean_token_accuracy": 0.9131919813156127, "num_tokens": 2142245103.0, "step": 27500 }, { "entropy": 0.2848608887195587, "epoch": 1.0970850589359669, "grad_norm": 11.261760711669922, "learning_rate": 8.91649972633105e-05, "loss": 0.28272476196289065, "mean_token_accuracy": 0.9128847599029541, "num_tokens": 2146150563.0, "step": 27550 }, { "entropy": 0.2844234037399292, "epoch": 1.0990761388977381, "grad_norm": 22.945674896240234, "learning_rate": 8.88445194721186e-05, "loss": 0.27900018692016604, "mean_token_accuracy": 0.9139061546325684, "num_tokens": 2150074053.0, "step": 27600 }, { "entropy": 0.2817272536456585, "epoch": 1.1010672188595094, "grad_norm": 9.653203964233398, "learning_rate": 8.852415765651586e-05, "loss": 0.274036750793457, "mean_token_accuracy": 0.9139328610897064, "num_tokens": 2153979617.0, "step": 27650 }, { "entropy": 0.28654327005147934, "epoch": 1.1030582988212807, "grad_norm": 3.253051280975342, "learning_rate": 8.820391514707593e-05, "loss": 0.285811767578125, "mean_token_accuracy": 0.9110492730140686, "num_tokens": 2157862641.0, "step": 27700 }, { "entropy": 0.27920183435082435, "epoch": 1.105049378783052, "grad_norm": 3.2318739891052246, "learning_rate": 8.788379527313222e-05, "loss": 0.27893768310546874, "mean_token_accuracy": 0.913199360370636, "num_tokens": 2161581604.0, "step": 27750 }, { "entropy": 0.2770452558994293, "epoch": 1.1070404587448233, "grad_norm": 2.511895179748535, "learning_rate": 8.756380136274312e-05, "loss": 0.2762653160095215, "mean_token_accuracy": 0.9135860896110535, "num_tokens": 2165453934.0, "step": 27800 }, { "entropy": 0.277307867705822, "epoch": 1.1090315387065945, "grad_norm": 2.83260440826416, "learning_rate": 8.724393674265751e-05, "loss": 0.27308944702148436, "mean_token_accuracy": 0.913974158167839, "num_tokens": 2169354403.0, "step": 27850 }, { "entropy": 0.28175134643912314, "epoch": 1.1110226186683658, "grad_norm": 3.690707206726074, "learning_rate": 8.692420473828017e-05, "loss": 0.27765316009521485, "mean_token_accuracy": 0.9128604310750962, "num_tokens": 2173255846.0, "step": 27900 }, { "entropy": 0.2807075062394142, "epoch": 1.1130136986301369, "grad_norm": 47.7031135559082, "learning_rate": 8.660460867363705e-05, "loss": 0.27419795989990237, "mean_token_accuracy": 0.912740181684494, "num_tokens": 2177173636.0, "step": 27950 }, { "entropy": 0.26901765435934066, "epoch": 1.1150047785919082, "grad_norm": 39.53254318237305, "learning_rate": 8.628515187134095e-05, "loss": 0.267020149230957, "mean_token_accuracy": 0.9155882316827774, "num_tokens": 2181073758.0, "step": 28000 }, { "entropy": 0.27070899575948715, "epoch": 1.1169958585536794, "grad_norm": 95.63186645507812, "learning_rate": 8.596583765255684e-05, "loss": 0.2706641387939453, "mean_token_accuracy": 0.9151144373416901, "num_tokens": 2185055281.0, "step": 28050 }, { "entropy": 0.2648503905534744, "epoch": 1.1189869385154507, "grad_norm": 5.548442840576172, "learning_rate": 8.564666933696725e-05, "loss": 0.2619986152648926, "mean_token_accuracy": 0.9176148587465286, "num_tokens": 2188982724.0, "step": 28100 }, { "entropy": 0.26699685767292974, "epoch": 1.120978018477222, "grad_norm": 111.70710754394531, "learning_rate": 8.5327650242738e-05, "loss": 0.2617582702636719, "mean_token_accuracy": 0.9162463837862015, "num_tokens": 2192938733.0, "step": 28150 }, { "entropy": 0.262488604336977, "epoch": 1.1229690984389933, "grad_norm": 430.6045227050781, "learning_rate": 8.500878368648343e-05, "loss": 0.2608696746826172, "mean_token_accuracy": 0.9173845279216767, "num_tokens": 2196846764.0, "step": 28200 }, { "entropy": 0.25803896233439444, "epoch": 1.1249601784007646, "grad_norm": 3.5406253337860107, "learning_rate": 8.469007298323213e-05, "loss": 0.2512600326538086, "mean_token_accuracy": 0.9178572076559067, "num_tokens": 2200645521.0, "step": 28250 }, { "entropy": 0.26972849801182747, "epoch": 1.1269512583625358, "grad_norm": 92.98139190673828, "learning_rate": 8.437152144639246e-05, "loss": 0.26785884857177733, "mean_token_accuracy": 0.9155970722436905, "num_tokens": 2204445686.0, "step": 28300 }, { "entropy": 0.26320109009742737, "epoch": 1.1289423383243071, "grad_norm": 9.081830024719238, "learning_rate": 8.405313238771784e-05, "loss": 0.25778596878051757, "mean_token_accuracy": 0.9171466076374054, "num_tokens": 2208115754.0, "step": 28350 }, { "entropy": 0.26801792293787, "epoch": 1.1309334182860784, "grad_norm": 8.996872901916504, "learning_rate": 8.373490911727271e-05, "loss": 0.26728742599487304, "mean_token_accuracy": 0.914549406170845, "num_tokens": 2212015806.0, "step": 28400 }, { "entropy": 0.26803364634513854, "epoch": 1.1329244982478497, "grad_norm": 5.314253807067871, "learning_rate": 8.341685494339786e-05, "loss": 0.26380897521972657, "mean_token_accuracy": 0.915499085187912, "num_tokens": 2215916150.0, "step": 28450 }, { "entropy": 0.2681669166684151, "epoch": 1.134915578209621, "grad_norm": 2.105147361755371, "learning_rate": 8.309897317267608e-05, "loss": 0.2656439208984375, "mean_token_accuracy": 0.9164936941862106, "num_tokens": 2219835264.0, "step": 28500 }, { "epoch": 1.134915578209621, "eval_entropy": 0.26389308983371373, "eval_loss": 0.26379474997520447, "eval_mean_token_accuracy": 0.9127354971946232, "eval_num_tokens": 2219835264.0, "eval_runtime": 97.959, "eval_samples_per_second": 10.208, "eval_steps_per_second": 0.643, "step": 28500 }, { "entropy": 0.27185188308358194, "epoch": 1.1369066581713922, "grad_norm": 18.015384674072266, "learning_rate": 8.278126710989782e-05, "loss": 0.2707905960083008, "mean_token_accuracy": 0.9136988991498947, "num_tokens": 2223642742.0, "step": 28550 }, { "entropy": 0.2693157321214676, "epoch": 1.1388977381331635, "grad_norm": 2.083514451980591, "learning_rate": 8.24637400580269e-05, "loss": 0.26923891067504885, "mean_token_accuracy": 0.9148537760972977, "num_tokens": 2227448481.0, "step": 28600 }, { "entropy": 0.2842481462657452, "epoch": 1.1408888180949348, "grad_norm": 5.290956974029541, "learning_rate": 8.214639531816595e-05, "loss": 0.2816263198852539, "mean_token_accuracy": 0.9124980694055558, "num_tokens": 2231471576.0, "step": 28650 }, { "entropy": 0.2704421180486679, "epoch": 1.1428798980567059, "grad_norm": 8.295283317565918, "learning_rate": 8.182923618952235e-05, "loss": 0.27311107635498044, "mean_token_accuracy": 0.914927179813385, "num_tokens": 2235399047.0, "step": 28700 }, { "entropy": 0.27379641339182853, "epoch": 1.1448709780184771, "grad_norm": 1.0736641883850098, "learning_rate": 8.15122659693737e-05, "loss": 0.2708183479309082, "mean_token_accuracy": 0.9151065689325333, "num_tokens": 2239234964.0, "step": 28750 }, { "entropy": 0.2751020123064518, "epoch": 1.1468620579802484, "grad_norm": 1.4961488246917725, "learning_rate": 8.119548795303376e-05, "loss": 0.27098175048828127, "mean_token_accuracy": 0.9147888046503067, "num_tokens": 2243217403.0, "step": 28800 }, { "entropy": 0.2790540789067745, "epoch": 1.1488531379420197, "grad_norm": 2.4600632190704346, "learning_rate": 8.087890543381806e-05, "loss": 0.2748415184020996, "mean_token_accuracy": 0.913057005405426, "num_tokens": 2247087511.0, "step": 28850 }, { "entropy": 0.27438779309391975, "epoch": 1.150844217903791, "grad_norm": 1.100923776626587, "learning_rate": 8.05625217030096e-05, "loss": 0.273856143951416, "mean_token_accuracy": 0.9144889223575592, "num_tokens": 2251015377.0, "step": 28900 }, { "entropy": 0.2724647945165634, "epoch": 1.1528352978655623, "grad_norm": 1.0084789991378784, "learning_rate": 8.024634004982485e-05, "loss": 0.26770015716552736, "mean_token_accuracy": 0.9148356276750564, "num_tokens": 2254827896.0, "step": 28950 }, { "entropy": 0.2752744263410568, "epoch": 1.1548263778273336, "grad_norm": 1.1662410497665405, "learning_rate": 7.993036376137936e-05, "loss": 0.2729286956787109, "mean_token_accuracy": 0.9148583126068115, "num_tokens": 2258661646.0, "step": 29000 }, { "entropy": 0.26966445341706274, "epoch": 1.1568174577891048, "grad_norm": 0.924314558506012, "learning_rate": 7.961459612265361e-05, "loss": 0.2723007392883301, "mean_token_accuracy": 0.9145607137680054, "num_tokens": 2262646618.0, "step": 29050 }, { "entropy": 0.26575383394956587, "epoch": 1.158808537750876, "grad_norm": 0.7235977649688721, "learning_rate": 7.929904041645899e-05, "loss": 0.25847774505615234, "mean_token_accuracy": 0.9171443176269531, "num_tokens": 2266428868.0, "step": 29100 }, { "entropy": 0.2669110006093979, "epoch": 1.1607996177126474, "grad_norm": 1.0300394296646118, "learning_rate": 7.898369992340343e-05, "loss": 0.2586103057861328, "mean_token_accuracy": 0.9165506374835968, "num_tokens": 2270328111.0, "step": 29150 }, { "entropy": 0.2686790293455124, "epoch": 1.1627906976744187, "grad_norm": 1.061711311340332, "learning_rate": 7.866857792185757e-05, "loss": 0.2652849006652832, "mean_token_accuracy": 0.9159308975934982, "num_tokens": 2274115543.0, "step": 29200 }, { "entropy": 0.2602678190171719, "epoch": 1.16478177763619, "grad_norm": 0.9144725203514099, "learning_rate": 7.835367768792062e-05, "loss": 0.2613193130493164, "mean_token_accuracy": 0.9169529223442078, "num_tokens": 2278001125.0, "step": 29250 }, { "entropy": 0.26131615310907363, "epoch": 1.166772857597961, "grad_norm": 2.1445415019989014, "learning_rate": 7.803900249538595e-05, "loss": 0.25913362503051757, "mean_token_accuracy": 0.9180044931173325, "num_tokens": 2281717812.0, "step": 29300 }, { "entropy": 0.2564562624692917, "epoch": 1.1687639375597323, "grad_norm": 2.700810670852661, "learning_rate": 7.772455561570765e-05, "loss": 0.260410213470459, "mean_token_accuracy": 0.9175380313396454, "num_tokens": 2285608129.0, "step": 29350 }, { "entropy": 0.25623603761196134, "epoch": 1.1707550175215036, "grad_norm": 26.131128311157227, "learning_rate": 7.7410340317966e-05, "loss": 0.2592426300048828, "mean_token_accuracy": 0.9185863476991654, "num_tokens": 2289552213.0, "step": 29400 }, { "entropy": 0.25995843529701235, "epoch": 1.1727460974832749, "grad_norm": 11.526826858520508, "learning_rate": 7.709635986883377e-05, "loss": 0.2492630386352539, "mean_token_accuracy": 0.9200164544582367, "num_tokens": 2293527997.0, "step": 29450 }, { "entropy": 0.2562264314293861, "epoch": 1.1747371774450461, "grad_norm": 5.011427879333496, "learning_rate": 7.678261753254215e-05, "loss": 0.2549386405944824, "mean_token_accuracy": 0.9187822026014328, "num_tokens": 2297456343.0, "step": 29500 }, { "entropy": 0.2528035534918308, "epoch": 1.1767282574068174, "grad_norm": 7.7611517906188965, "learning_rate": 7.646911657084681e-05, "loss": 0.24742359161376953, "mean_token_accuracy": 0.9208133661746979, "num_tokens": 2301308339.0, "step": 29550 }, { "entropy": 0.2551653176546097, "epoch": 1.1787193373685887, "grad_norm": 0.9861001372337341, "learning_rate": 7.61558602429941e-05, "loss": 0.25268321990966797, "mean_token_accuracy": 0.9187040156126023, "num_tokens": 2305141997.0, "step": 29600 }, { "entropy": 0.26116091802716257, "epoch": 1.18071041733036, "grad_norm": 5.062619209289551, "learning_rate": 7.584285180568707e-05, "loss": 0.25951030731201175, "mean_token_accuracy": 0.9177165216207505, "num_tokens": 2308988046.0, "step": 29650 }, { "entropy": 0.2451816527545452, "epoch": 1.1827014972921313, "grad_norm": 9.454245567321777, "learning_rate": 7.553009451305155e-05, "loss": 0.24350931167602538, "mean_token_accuracy": 0.9213841730356216, "num_tokens": 2312985492.0, "step": 29700 }, { "entropy": 0.25349168688058854, "epoch": 1.1846925772539025, "grad_norm": 7.0926618576049805, "learning_rate": 7.521759161660246e-05, "loss": 0.2522360038757324, "mean_token_accuracy": 0.9197132277488709, "num_tokens": 2316998826.0, "step": 29750 }, { "entropy": 0.2608468522131443, "epoch": 1.1866836572156738, "grad_norm": 0.7596117854118347, "learning_rate": 7.490534636520997e-05, "loss": 0.26308231353759765, "mean_token_accuracy": 0.9175483292341232, "num_tokens": 2321019054.0, "step": 29800 }, { "entropy": 0.25581578224897383, "epoch": 1.188674737177445, "grad_norm": 0.8175065517425537, "learning_rate": 7.45933620050656e-05, "loss": 0.2528280830383301, "mean_token_accuracy": 0.9190493965148926, "num_tokens": 2324919096.0, "step": 29850 }, { "entropy": 0.25523352801799776, "epoch": 1.1906658171392164, "grad_norm": 0.8316560983657837, "learning_rate": 7.428164177964867e-05, "loss": 0.25129295349121095, "mean_token_accuracy": 0.9194622355699539, "num_tokens": 2328750442.0, "step": 29900 }, { "entropy": 0.25839961007237433, "epoch": 1.1926568971009877, "grad_norm": 6.435125827789307, "learning_rate": 7.397018892969245e-05, "loss": 0.25191268920898435, "mean_token_accuracy": 0.9188542717695236, "num_tokens": 2332618559.0, "step": 29950 }, { "entropy": 0.2525199219584465, "epoch": 1.194647977062759, "grad_norm": 0.6968880295753479, "learning_rate": 7.365900669315046e-05, "loss": 0.2460643768310547, "mean_token_accuracy": 0.9193591141700744, "num_tokens": 2336422417.0, "step": 30000 }, { "epoch": 1.194647977062759, "eval_entropy": 0.24912547024469528, "eval_loss": 0.2590893507003784, "eval_mean_token_accuracy": 0.9145408395736937, "eval_num_tokens": 2336422417.0, "eval_runtime": 97.5931, "eval_samples_per_second": 10.247, "eval_steps_per_second": 0.646, "step": 30000 }, { "entropy": 0.26732305482029917, "epoch": 1.1966390570245302, "grad_norm": 0.8476821780204773, "learning_rate": 7.33480983051629e-05, "loss": 0.2643488693237305, "mean_token_accuracy": 0.9154199087619781, "num_tokens": 2340302827.0, "step": 30050 }, { "entropy": 0.25488393008708954, "epoch": 1.1986301369863013, "grad_norm": 0.6083821654319763, "learning_rate": 7.303746699802289e-05, "loss": 0.2518123435974121, "mean_token_accuracy": 0.9191535788774491, "num_tokens": 2344164776.0, "step": 30100 }, { "entropy": 0.2546880353987217, "epoch": 1.2006212169480726, "grad_norm": 1.4273827075958252, "learning_rate": 7.272711600114301e-05, "loss": 0.25110788345336915, "mean_token_accuracy": 0.9193621718883515, "num_tokens": 2347949626.0, "step": 30150 }, { "entropy": 0.2577556924521923, "epoch": 1.2026122969098438, "grad_norm": 0.8106961250305176, "learning_rate": 7.241704854102167e-05, "loss": 0.25635360717773437, "mean_token_accuracy": 0.9184073209762573, "num_tokens": 2351900229.0, "step": 30200 }, { "entropy": 0.25620258957147596, "epoch": 1.2046033768716151, "grad_norm": 0.8120598793029785, "learning_rate": 7.210726784120941e-05, "loss": 0.25334203720092774, "mean_token_accuracy": 0.9191883337497712, "num_tokens": 2355735339.0, "step": 30250 }, { "entropy": 0.25752839639782904, "epoch": 1.2065944568333864, "grad_norm": 3.0607850551605225, "learning_rate": 7.179777712227569e-05, "loss": 0.25776454925537107, "mean_token_accuracy": 0.9180021786689758, "num_tokens": 2359574343.0, "step": 30300 }, { "entropy": 0.2576423817873001, "epoch": 1.2085855367951577, "grad_norm": 3.523740768432617, "learning_rate": 7.14885796017752e-05, "loss": 0.25613277435302734, "mean_token_accuracy": 0.9186793148517609, "num_tokens": 2363536733.0, "step": 30350 }, { "entropy": 0.2511074875295162, "epoch": 1.210576616756929, "grad_norm": 1.0753810405731201, "learning_rate": 7.117967849421436e-05, "loss": 0.24952831268310546, "mean_token_accuracy": 0.9197322314977646, "num_tokens": 2367519596.0, "step": 30400 }, { "entropy": 0.25169111222028734, "epoch": 1.2125676967187002, "grad_norm": 2.098910331726074, "learning_rate": 7.087107701101813e-05, "loss": 0.24964860916137696, "mean_token_accuracy": 0.9197195601463318, "num_tokens": 2371517180.0, "step": 30450 }, { "entropy": 0.2529001899808645, "epoch": 1.2145587766804715, "grad_norm": 1.0066713094711304, "learning_rate": 7.056277836049636e-05, "loss": 0.24566022872924806, "mean_token_accuracy": 0.9205902856588364, "num_tokens": 2375391104.0, "step": 30500 }, { "entropy": 0.25578666806221007, "epoch": 1.2165498566422428, "grad_norm": 1.1897060871124268, "learning_rate": 7.02547857478107e-05, "loss": 0.25263437271118167, "mean_token_accuracy": 0.9195209097862244, "num_tokens": 2379348591.0, "step": 30550 }, { "entropy": 0.2526996345818043, "epoch": 1.218540936604014, "grad_norm": 1.1875773668289185, "learning_rate": 6.994710237494107e-05, "loss": 0.2487725067138672, "mean_token_accuracy": 0.9197922104597092, "num_tokens": 2383260952.0, "step": 30600 }, { "entropy": 0.2540097612142563, "epoch": 1.2205320165657854, "grad_norm": 0.6080695390701294, "learning_rate": 6.963973144065239e-05, "loss": 0.2553993225097656, "mean_token_accuracy": 0.919166492819786, "num_tokens": 2387348809.0, "step": 30650 }, { "entropy": 0.2552763396501541, "epoch": 1.2225230965275566, "grad_norm": 0.8603153824806213, "learning_rate": 6.933267614046148e-05, "loss": 0.25409666061401365, "mean_token_accuracy": 0.9181348937749862, "num_tokens": 2391236010.0, "step": 30700 }, { "entropy": 0.2569490122795105, "epoch": 1.2245141764893277, "grad_norm": 0.9919761419296265, "learning_rate": 6.902593966660371e-05, "loss": 0.252379093170166, "mean_token_accuracy": 0.9187397682666778, "num_tokens": 2395300445.0, "step": 30750 }, { "entropy": 0.2513756537437439, "epoch": 1.226505256451099, "grad_norm": 1.3306828737258911, "learning_rate": 6.871952520799978e-05, "loss": 0.250519905090332, "mean_token_accuracy": 0.91956602871418, "num_tokens": 2399168189.0, "step": 30800 }, { "entropy": 0.2564035221934319, "epoch": 1.2284963364128703, "grad_norm": 7.042972564697266, "learning_rate": 6.841343595022272e-05, "loss": 0.2522756576538086, "mean_token_accuracy": 0.9194320529699326, "num_tokens": 2402898724.0, "step": 30850 }, { "entropy": 0.24428572967648507, "epoch": 1.2304874163746415, "grad_norm": 4.51497745513916, "learning_rate": 6.810767507546457e-05, "loss": 0.24056669235229491, "mean_token_accuracy": 0.9221302163600922, "num_tokens": 2406820462.0, "step": 30900 }, { "entropy": 0.24979312285780908, "epoch": 1.2324784963364128, "grad_norm": 1.6140036582946777, "learning_rate": 6.780224576250347e-05, "loss": 0.2473303985595703, "mean_token_accuracy": 0.9202413827180862, "num_tokens": 2410783096.0, "step": 30950 }, { "entropy": 0.24745888367295266, "epoch": 1.234469576298184, "grad_norm": 1.5148733854293823, "learning_rate": 6.749715118667061e-05, "loss": 0.24445684432983397, "mean_token_accuracy": 0.9212743645906448, "num_tokens": 2414615195.0, "step": 31000 }, { "entropy": 0.24440625712275504, "epoch": 1.2364606562599554, "grad_norm": 166.31959533691406, "learning_rate": 6.719239451981702e-05, "loss": 0.24271812438964843, "mean_token_accuracy": 0.9218738675117493, "num_tokens": 2418498880.0, "step": 31050 }, { "entropy": 0.24401699602603913, "epoch": 1.2384517362217267, "grad_norm": 8.616495132446289, "learning_rate": 6.68879789302808e-05, "loss": 0.2441313934326172, "mean_token_accuracy": 0.9215966653823853, "num_tokens": 2422507271.0, "step": 31100 }, { "entropy": 0.24902054503560067, "epoch": 1.240442816183498, "grad_norm": 2.768110990524292, "learning_rate": 6.65839075828542e-05, "loss": 0.24927122116088868, "mean_token_accuracy": 0.9191774350404739, "num_tokens": 2426513554.0, "step": 31150 }, { "entropy": 0.24414533570408822, "epoch": 1.2424338961452692, "grad_norm": 12.899252891540527, "learning_rate": 6.628018363875041e-05, "loss": 0.23875503540039061, "mean_token_accuracy": 0.9229415136575699, "num_tokens": 2430368231.0, "step": 31200 }, { "entropy": 0.24678532421588897, "epoch": 1.2444249761070405, "grad_norm": 1.429768681526184, "learning_rate": 6.597681025557113e-05, "loss": 0.24450605392456054, "mean_token_accuracy": 0.9218378084897995, "num_tokens": 2434271946.0, "step": 31250 }, { "entropy": 0.2424020729959011, "epoch": 1.2464160560688118, "grad_norm": 29.401817321777344, "learning_rate": 6.567379058727346e-05, "loss": 0.24003870010375977, "mean_token_accuracy": 0.9231269294023514, "num_tokens": 2438249891.0, "step": 31300 }, { "entropy": 0.24916338324546813, "epoch": 1.248407136030583, "grad_norm": 2.3196229934692383, "learning_rate": 6.537112778413708e-05, "loss": 0.24266057968139648, "mean_token_accuracy": 0.9209426647424698, "num_tokens": 2442158811.0, "step": 31350 }, { "entropy": 0.2501223590970039, "epoch": 1.2503982159923543, "grad_norm": 1.933199405670166, "learning_rate": 6.506882499273174e-05, "loss": 0.25150131225585937, "mean_token_accuracy": 0.9188826751708984, "num_tokens": 2446164868.0, "step": 31400 }, { "entropy": 0.2436576010286808, "epoch": 1.2523892959541256, "grad_norm": 5.695888519287109, "learning_rate": 6.476688535588433e-05, "loss": 0.24076358795166017, "mean_token_accuracy": 0.9218398368358612, "num_tokens": 2449972536.0, "step": 31450 }, { "entropy": 0.2507163964211941, "epoch": 1.254380375915897, "grad_norm": 3.518038749694824, "learning_rate": 6.446531201264626e-05, "loss": 0.24629838943481444, "mean_token_accuracy": 0.9203240805864334, "num_tokens": 2453851011.0, "step": 31500 }, { "epoch": 1.254380375915897, "eval_entropy": 0.24153777602173032, "eval_loss": 0.2523416578769684, "eval_mean_token_accuracy": 0.9161454656767467, "eval_num_tokens": 2453851011.0, "eval_runtime": 97.9272, "eval_samples_per_second": 10.212, "eval_steps_per_second": 0.643, "step": 31500 }, { "entropy": 0.24645958006381988, "epoch": 1.256371455877668, "grad_norm": 34.6347770690918, "learning_rate": 6.416410809826095e-05, "loss": 0.2486136817932129, "mean_token_accuracy": 0.9206688398122788, "num_tokens": 2457709584.0, "step": 31550 }, { "entropy": 0.24550958037376402, "epoch": 1.2583625358394392, "grad_norm": 2.1734249591827393, "learning_rate": 6.386327674413102e-05, "loss": 0.24396198272705077, "mean_token_accuracy": 0.9210328465700149, "num_tokens": 2461565590.0, "step": 31600 }, { "entropy": 0.24458111330866814, "epoch": 1.2603536158012105, "grad_norm": 2.1308200359344482, "learning_rate": 6.356282107778587e-05, "loss": 0.244349365234375, "mean_token_accuracy": 0.9208364903926849, "num_tokens": 2465397732.0, "step": 31650 }, { "entropy": 0.24412568658590317, "epoch": 1.2623446957629818, "grad_norm": 5.350144386291504, "learning_rate": 6.326274422284922e-05, "loss": 0.2402265739440918, "mean_token_accuracy": 0.9222062975168228, "num_tokens": 2469225379.0, "step": 31700 }, { "entropy": 0.2523250526189804, "epoch": 1.264335775724753, "grad_norm": 1.7639020681381226, "learning_rate": 6.296304929900638e-05, "loss": 0.25054126739501953, "mean_token_accuracy": 0.9195391660928727, "num_tokens": 2473175319.0, "step": 31750 }, { "entropy": 0.2518117180466652, "epoch": 1.2663268556865244, "grad_norm": 8.069989204406738, "learning_rate": 6.266373942197228e-05, "loss": 0.2470506477355957, "mean_token_accuracy": 0.9194836449623108, "num_tokens": 2476989249.0, "step": 31800 }, { "entropy": 0.24566985920071602, "epoch": 1.2683179356482956, "grad_norm": 40.28060531616211, "learning_rate": 6.236481770345845e-05, "loss": 0.24796669006347657, "mean_token_accuracy": 0.9207878285646438, "num_tokens": 2480876708.0, "step": 31850 }, { "entropy": 0.25329444035887716, "epoch": 1.270309015610067, "grad_norm": 1.2897652387619019, "learning_rate": 6.20662872511413e-05, "loss": 0.24721664428710938, "mean_token_accuracy": 0.9197079193592071, "num_tokens": 2484637032.0, "step": 31900 }, { "entropy": 0.25620452091097834, "epoch": 1.2723000955718382, "grad_norm": 3.7153172492980957, "learning_rate": 6.176815116862938e-05, "loss": 0.25328746795654294, "mean_token_accuracy": 0.918477959036827, "num_tokens": 2488241591.0, "step": 31950 }, { "entropy": 0.259455299526453, "epoch": 1.2742911755336095, "grad_norm": 0.9825824499130249, "learning_rate": 6.147041255543127e-05, "loss": 0.2515993499755859, "mean_token_accuracy": 0.9188154804706573, "num_tokens": 2491967910.0, "step": 32000 }, { "entropy": 0.2545319566130638, "epoch": 1.2762822554953808, "grad_norm": 1.2730064392089844, "learning_rate": 6.117307450692335e-05, "loss": 0.2528094482421875, "mean_token_accuracy": 0.9184557616710662, "num_tokens": 2495775884.0, "step": 32050 }, { "entropy": 0.24805585592985152, "epoch": 1.2782733354571518, "grad_norm": 0.7051454186439514, "learning_rate": 6.0876140114317716e-05, "loss": 0.2452733612060547, "mean_token_accuracy": 0.921332939863205, "num_tokens": 2499673582.0, "step": 32100 }, { "entropy": 0.25301434338092804, "epoch": 1.280264415418923, "grad_norm": 0.8264440894126892, "learning_rate": 6.057961246462971e-05, "loss": 0.24915611267089843, "mean_token_accuracy": 0.9208215099573135, "num_tokens": 2503798886.0, "step": 32150 }, { "entropy": 0.25116061940789225, "epoch": 1.2822554953806944, "grad_norm": 0.850557267665863, "learning_rate": 6.028349464064633e-05, "loss": 0.24718658447265626, "mean_token_accuracy": 0.9197705388069153, "num_tokens": 2507890066.0, "step": 32200 }, { "entropy": 0.26222523510456086, "epoch": 1.2842465753424657, "grad_norm": 0.7549040913581848, "learning_rate": 5.998778972089368e-05, "loss": 0.2575231552124023, "mean_token_accuracy": 0.9183403277397155, "num_tokens": 2511708723.0, "step": 32250 }, { "entropy": 0.2572297029197216, "epoch": 1.286237655304237, "grad_norm": 0.859230637550354, "learning_rate": 5.969250077960534e-05, "loss": 0.2545322799682617, "mean_token_accuracy": 0.9189767295122147, "num_tokens": 2515749413.0, "step": 32300 }, { "entropy": 0.2539103680849075, "epoch": 1.2882287352660082, "grad_norm": 0.6217833757400513, "learning_rate": 5.9397630886690214e-05, "loss": 0.2517101287841797, "mean_token_accuracy": 0.9185271793603897, "num_tokens": 2519642278.0, "step": 32350 }, { "entropy": 0.2602769346535206, "epoch": 1.2902198152277795, "grad_norm": 0.7290419340133667, "learning_rate": 5.91031831077006e-05, "loss": 0.25576301574707033, "mean_token_accuracy": 0.9181579911708831, "num_tokens": 2523561621.0, "step": 32400 }, { "entropy": 0.25307921051979065, "epoch": 1.2922108951895508, "grad_norm": 45.058815002441406, "learning_rate": 5.8809160503800455e-05, "loss": 0.24822502136230468, "mean_token_accuracy": 0.9194051826000214, "num_tokens": 2527427498.0, "step": 32450 }, { "entropy": 0.2419722370803356, "epoch": 1.294201975151322, "grad_norm": 1.0116926431655884, "learning_rate": 5.8515566131733504e-05, "loss": 0.23900753021240234, "mean_token_accuracy": 0.9218295383453369, "num_tokens": 2531296733.0, "step": 32500 }, { "entropy": 0.24807915300130845, "epoch": 1.2961930551130934, "grad_norm": 0.7379711270332336, "learning_rate": 5.822240304379134e-05, "loss": 0.2472970199584961, "mean_token_accuracy": 0.9201249468326569, "num_tokens": 2535154807.0, "step": 32550 }, { "entropy": 0.23525363981723785, "epoch": 1.2981841350748646, "grad_norm": 0.8442062139511108, "learning_rate": 5.7929674287781955e-05, "loss": 0.22923601150512696, "mean_token_accuracy": 0.9241575568914413, "num_tokens": 2538967544.0, "step": 32600 }, { "entropy": 0.25001087591052057, "epoch": 1.300175215036636, "grad_norm": 3.9452688694000244, "learning_rate": 5.7637382906997814e-05, "loss": 0.24733707427978516, "mean_token_accuracy": 0.9203029495477676, "num_tokens": 2542898400.0, "step": 32650 }, { "entropy": 0.24979558914899827, "epoch": 1.3021662949984072, "grad_norm": 0.7694733142852783, "learning_rate": 5.734553194018425e-05, "loss": 0.24733903884887695, "mean_token_accuracy": 0.9204252606630325, "num_tokens": 2546816900.0, "step": 32700 }, { "entropy": 0.25051434099674225, "epoch": 1.3041573749601785, "grad_norm": 0.617893636226654, "learning_rate": 5.7054124421508015e-05, "loss": 0.2471194839477539, "mean_token_accuracy": 0.9202513420581817, "num_tokens": 2550760619.0, "step": 32750 }, { "entropy": 0.2535126593708992, "epoch": 1.3061484549219498, "grad_norm": 0.5893092155456543, "learning_rate": 5.676316338052563e-05, "loss": 0.24661418914794922, "mean_token_accuracy": 0.9190385782718659, "num_tokens": 2554805633.0, "step": 32800 }, { "entropy": 0.24486387819051741, "epoch": 1.308139534883721, "grad_norm": 0.6626051664352417, "learning_rate": 5.6472651842151894e-05, "loss": 0.24294389724731447, "mean_token_accuracy": 0.9217797529697418, "num_tokens": 2558688969.0, "step": 32850 }, { "entropy": 0.24416929215192795, "epoch": 1.3101306148454923, "grad_norm": 0.6610086560249329, "learning_rate": 5.618259282662848e-05, "loss": 0.24305530548095702, "mean_token_accuracy": 0.9212112122774124, "num_tokens": 2562599912.0, "step": 32900 }, { "entropy": 0.2474717128276825, "epoch": 1.3121216948072636, "grad_norm": 0.5333130359649658, "learning_rate": 5.5892989349492345e-05, "loss": 0.23954826354980469, "mean_token_accuracy": 0.9213361912965774, "num_tokens": 2566367287.0, "step": 32950 }, { "entropy": 0.24256782814860345, "epoch": 1.3141127747690347, "grad_norm": 0.7705857753753662, "learning_rate": 5.560384442154478e-05, "loss": 0.24114227294921875, "mean_token_accuracy": 0.9220344460010529, "num_tokens": 2570302308.0, "step": 33000 }, { "epoch": 1.3141127747690347, "eval_entropy": 0.23286663776352293, "eval_loss": 0.2405821532011032, "eval_mean_token_accuracy": 0.9191571152399457, "eval_num_tokens": 2570302308.0, "eval_runtime": 97.7772, "eval_samples_per_second": 10.227, "eval_steps_per_second": 0.644, "step": 33000 }, { "entropy": 0.24588322430849074, "epoch": 1.316103854730806, "grad_norm": 29.474529266357422, "learning_rate": 5.5315161048819776e-05, "loss": 0.24144397735595702, "mean_token_accuracy": 0.9207844561338425, "num_tokens": 2574129327.0, "step": 33050 }, { "entropy": 0.2438132531940937, "epoch": 1.3180949346925772, "grad_norm": 0.6323732137680054, "learning_rate": 5.5026942232552735e-05, "loss": 0.23987579345703125, "mean_token_accuracy": 0.9224971890449524, "num_tokens": 2578112074.0, "step": 33100 }, { "entropy": 0.2441749645769596, "epoch": 1.3200860146543485, "grad_norm": 0.8209773898124695, "learning_rate": 5.473919096914954e-05, "loss": 0.24236057281494142, "mean_token_accuracy": 0.9216016113758088, "num_tokens": 2582025585.0, "step": 33150 }, { "entropy": 0.23785219475626945, "epoch": 1.3220770946161198, "grad_norm": 2.8132340908050537, "learning_rate": 5.4451910250155216e-05, "loss": 0.23749332427978515, "mean_token_accuracy": 0.923515859246254, "num_tokens": 2585956896.0, "step": 33200 }, { "entropy": 0.2299913875758648, "epoch": 1.324068174577891, "grad_norm": 0.7741996049880981, "learning_rate": 5.4165103062222867e-05, "loss": 0.22954608917236327, "mean_token_accuracy": 0.9249764865636826, "num_tokens": 2589937310.0, "step": 33250 }, { "entropy": 0.2423437401652336, "epoch": 1.3260592545396623, "grad_norm": 0.7221020460128784, "learning_rate": 5.387877238708265e-05, "loss": 0.24239322662353516, "mean_token_accuracy": 0.9219006705284118, "num_tokens": 2593689295.0, "step": 33300 }, { "entropy": 0.24256222799420357, "epoch": 1.3280503345014336, "grad_norm": 0.7761672735214233, "learning_rate": 5.359292120151076e-05, "loss": 0.2391761589050293, "mean_token_accuracy": 0.9220723509788513, "num_tokens": 2597558264.0, "step": 33350 }, { "entropy": 0.23777956932783126, "epoch": 1.330041414463205, "grad_norm": 2.2677993774414062, "learning_rate": 5.330755247729844e-05, "loss": 0.23516349792480468, "mean_token_accuracy": 0.9231782990694046, "num_tokens": 2601329828.0, "step": 33400 }, { "entropy": 0.2337485946714878, "epoch": 1.3320324944249762, "grad_norm": 1.0745105743408203, "learning_rate": 5.3022669181221207e-05, "loss": 0.2339678382873535, "mean_token_accuracy": 0.9244587421417236, "num_tokens": 2605206875.0, "step": 33450 }, { "entropy": 0.23775503277778626, "epoch": 1.3340235743867472, "grad_norm": 36.53923416137695, "learning_rate": 5.273827427500779e-05, "loss": 0.2353268814086914, "mean_token_accuracy": 0.9228319334983826, "num_tokens": 2609060555.0, "step": 33500 }, { "entropy": 0.2393827061355114, "epoch": 1.3360146543485185, "grad_norm": 78.85201263427734, "learning_rate": 5.245437071530961e-05, "loss": 0.2345823860168457, "mean_token_accuracy": 0.9233963018655778, "num_tokens": 2612925433.0, "step": 33550 }, { "entropy": 0.23465632140636444, "epoch": 1.3380057343102898, "grad_norm": 1.3723814487457275, "learning_rate": 5.217096145366983e-05, "loss": 0.23387849807739258, "mean_token_accuracy": 0.9243163061141968, "num_tokens": 2616759404.0, "step": 33600 }, { "entropy": 0.23068988770246507, "epoch": 1.339996814272061, "grad_norm": 3.5395326614379883, "learning_rate": 5.188804943649279e-05, "loss": 0.22669374465942382, "mean_token_accuracy": 0.9251353144645691, "num_tokens": 2620628454.0, "step": 33650 }, { "entropy": 0.23261408492922783, "epoch": 1.3419878942338324, "grad_norm": 15.65046501159668, "learning_rate": 5.1605637605013334e-05, "loss": 0.22891586303710937, "mean_token_accuracy": 0.9242624086141586, "num_tokens": 2624539152.0, "step": 33700 }, { "entropy": 0.23109879538416864, "epoch": 1.3439789741956036, "grad_norm": 4.173908710479736, "learning_rate": 5.1323728895266196e-05, "loss": 0.22842176437377928, "mean_token_accuracy": 0.9252660167217255, "num_tokens": 2628689353.0, "step": 33750 }, { "entropy": 0.23846592292189597, "epoch": 1.345970054157375, "grad_norm": 5.710038185119629, "learning_rate": 5.1042326238055535e-05, "loss": 0.23568607330322267, "mean_token_accuracy": 0.9234002131223679, "num_tokens": 2632732563.0, "step": 33800 }, { "entropy": 0.23529886215925216, "epoch": 1.3479611341191462, "grad_norm": 0.7667160034179688, "learning_rate": 5.0761432558924474e-05, "loss": 0.2357318115234375, "mean_token_accuracy": 0.923137486577034, "num_tokens": 2636584074.0, "step": 33850 }, { "entropy": 0.23543915316462516, "epoch": 1.3499522140809175, "grad_norm": 0.8430137634277344, "learning_rate": 5.04810507781245e-05, "loss": 0.2351871681213379, "mean_token_accuracy": 0.9230859690904617, "num_tokens": 2640542951.0, "step": 33900 }, { "entropy": 0.2279362289607525, "epoch": 1.3519432940426888, "grad_norm": 1.9170082807540894, "learning_rate": 5.0201183810585516e-05, "loss": 0.22495718002319337, "mean_token_accuracy": 0.9254985123872757, "num_tokens": 2644430887.0, "step": 33950 }, { "entropy": 0.23527911379933358, "epoch": 1.35393437400446, "grad_norm": 4.333722114562988, "learning_rate": 4.9921834565885114e-05, "loss": 0.23201578140258788, "mean_token_accuracy": 0.9242059302330017, "num_tokens": 2648158641.0, "step": 34000 }, { "entropy": 0.23212642058730126, "epoch": 1.3559254539662313, "grad_norm": 0.9224748611450195, "learning_rate": 4.9643005948218445e-05, "loss": 0.2337823486328125, "mean_token_accuracy": 0.924061541557312, "num_tokens": 2652005779.0, "step": 34050 }, { "entropy": 0.2346086983382702, "epoch": 1.3579165339280026, "grad_norm": 3.9253106117248535, "learning_rate": 4.9364700856368164e-05, "loss": 0.23258901596069337, "mean_token_accuracy": 0.9240314346551896, "num_tokens": 2656030308.0, "step": 34100 }, { "entropy": 0.23181153550744057, "epoch": 1.3599076138897739, "grad_norm": 0.8032912015914917, "learning_rate": 4.908692218367419e-05, "loss": 0.2263050079345703, "mean_token_accuracy": 0.9245618444681167, "num_tokens": 2660035042.0, "step": 34150 }, { "entropy": 0.23851815313100816, "epoch": 1.3618986938515452, "grad_norm": 0.6259279847145081, "learning_rate": 4.880967281800363e-05, "loss": 0.23707332611083984, "mean_token_accuracy": 0.9224560678005218, "num_tokens": 2663994099.0, "step": 34200 }, { "entropy": 0.23847059220075606, "epoch": 1.3638897738133164, "grad_norm": 3.1073203086853027, "learning_rate": 4.8532955641720734e-05, "loss": 0.23576877593994142, "mean_token_accuracy": 0.9226966214179992, "num_tokens": 2667859794.0, "step": 34250 }, { "entropy": 0.23225814297795297, "epoch": 1.3658808537750877, "grad_norm": 3.2821524143218994, "learning_rate": 4.8256773531656995e-05, "loss": 0.2301523780822754, "mean_token_accuracy": 0.9242325490713119, "num_tokens": 2671725053.0, "step": 34300 }, { "entropy": 0.23081228151917457, "epoch": 1.367871933736859, "grad_norm": 0.706429660320282, "learning_rate": 4.7981129359081186e-05, "loss": 0.22877843856811522, "mean_token_accuracy": 0.9250713670253754, "num_tokens": 2675721071.0, "step": 34350 }, { "entropy": 0.2314528863132, "epoch": 1.36986301369863, "grad_norm": 4.0343756675720215, "learning_rate": 4.770602598966958e-05, "loss": 0.23183086395263672, "mean_token_accuracy": 0.9241064774990082, "num_tokens": 2679745102.0, "step": 34400 }, { "entropy": 0.23779025599360465, "epoch": 1.3718540936604013, "grad_norm": 0.8716291189193726, "learning_rate": 4.7431466283475956e-05, "loss": 0.23494630813598633, "mean_token_accuracy": 0.9234051322937011, "num_tokens": 2683798504.0, "step": 34450 }, { "entropy": 0.23259786665439605, "epoch": 1.3738451736221726, "grad_norm": 0.7196080684661865, "learning_rate": 4.715745309490216e-05, "loss": 0.2321007537841797, "mean_token_accuracy": 0.925023084282875, "num_tokens": 2687619200.0, "step": 34500 }, { "epoch": 1.3738451736221726, "eval_entropy": 0.22921637552125113, "eval_loss": 0.23520071804523468, "eval_mean_token_accuracy": 0.9218012671622019, "eval_num_tokens": 2687619200.0, "eval_runtime": 97.7538, "eval_samples_per_second": 10.23, "eval_steps_per_second": 0.644, "step": 34500 }, { "entropy": 0.2326103214919567, "epoch": 1.375836253583944, "grad_norm": 2.9911444187164307, "learning_rate": 4.688398927266824e-05, "loss": 0.2314113426208496, "mean_token_accuracy": 0.9237373173236847, "num_tokens": 2691437944.0, "step": 34550 }, { "entropy": 0.2364209407567978, "epoch": 1.3778273335457152, "grad_norm": 1.710113286972046, "learning_rate": 4.661107765978285e-05, "loss": 0.2364255142211914, "mean_token_accuracy": 0.9232726913690567, "num_tokens": 2695267662.0, "step": 34600 }, { "entropy": 0.22886888533830643, "epoch": 1.3798184135074865, "grad_norm": 0.5442627668380737, "learning_rate": 4.633872109351376e-05, "loss": 0.22827606201171874, "mean_token_accuracy": 0.9248815947771072, "num_tokens": 2699192303.0, "step": 34650 }, { "entropy": 0.2333889891207218, "epoch": 1.3818094934692577, "grad_norm": 15.227090835571289, "learning_rate": 4.606692240535826e-05, "loss": 0.23413402557373048, "mean_token_accuracy": 0.9247659987211228, "num_tokens": 2703104258.0, "step": 34700 }, { "entropy": 0.22734193563461302, "epoch": 1.383800573431029, "grad_norm": 0.7748773694038391, "learning_rate": 4.579568442101384e-05, "loss": 0.22380889892578126, "mean_token_accuracy": 0.9268061184883117, "num_tokens": 2707095473.0, "step": 34750 }, { "entropy": 0.23382432997226715, "epoch": 1.3857916533928003, "grad_norm": 0.8901104927062988, "learning_rate": 4.5525009960348744e-05, "loss": 0.23436962127685546, "mean_token_accuracy": 0.9240539067983627, "num_tokens": 2711056973.0, "step": 34800 }, { "entropy": 0.22885996341705322, "epoch": 1.3877827333545716, "grad_norm": 1.1532673835754395, "learning_rate": 4.525490183737251e-05, "loss": 0.22763313293457033, "mean_token_accuracy": 0.9247712236642838, "num_tokens": 2714954312.0, "step": 34850 }, { "entropy": 0.2330388432741165, "epoch": 1.3897738133163429, "grad_norm": 0.6920197010040283, "learning_rate": 4.498536286020717e-05, "loss": 0.2267754364013672, "mean_token_accuracy": 0.9240225440263748, "num_tokens": 2718758819.0, "step": 34900 }, { "entropy": 0.23108075708150863, "epoch": 1.391764893278114, "grad_norm": 4.368566513061523, "learning_rate": 4.471639583105744e-05, "loss": 0.23003168106079103, "mean_token_accuracy": 0.9252905690670014, "num_tokens": 2722720972.0, "step": 34950 }, { "entropy": 0.23428089499473573, "epoch": 1.3937559732398852, "grad_norm": 0.8221115469932556, "learning_rate": 4.4448003546182105e-05, "loss": 0.23146120071411133, "mean_token_accuracy": 0.9236508792638779, "num_tokens": 2726644445.0, "step": 35000 }, { "entropy": 0.22516697466373445, "epoch": 1.3957470532016565, "grad_norm": 1.4155395030975342, "learning_rate": 4.4180188795864644e-05, "loss": 0.2231873893737793, "mean_token_accuracy": 0.926362236738205, "num_tokens": 2730496965.0, "step": 35050 }, { "entropy": 0.2283501335978508, "epoch": 1.3977381331634278, "grad_norm": 0.9996873140335083, "learning_rate": 4.391295436438435e-05, "loss": 0.2270090675354004, "mean_token_accuracy": 0.9249064707756043, "num_tokens": 2734456737.0, "step": 35100 }, { "entropy": 0.22467306211590768, "epoch": 1.399729213125199, "grad_norm": 0.8343448042869568, "learning_rate": 4.3646303029987376e-05, "loss": 0.22622060775756836, "mean_token_accuracy": 0.9265091502666474, "num_tokens": 2738380451.0, "step": 35150 }, { "entropy": 0.2316141229867935, "epoch": 1.4017202930869703, "grad_norm": 2.3793368339538574, "learning_rate": 4.3380237564857795e-05, "loss": 0.23149314880371094, "mean_token_accuracy": 0.9249173974990845, "num_tokens": 2742380657.0, "step": 35200 }, { "entropy": 0.2239141072332859, "epoch": 1.4037113730487416, "grad_norm": 3.4736902713775635, "learning_rate": 4.3114760735088836e-05, "loss": 0.22573705673217773, "mean_token_accuracy": 0.9256602203845978, "num_tokens": 2746460877.0, "step": 35250 }, { "entropy": 0.229984879642725, "epoch": 1.4057024530105129, "grad_norm": 1.3222185373306274, "learning_rate": 4.2849875300654076e-05, "loss": 0.2258452606201172, "mean_token_accuracy": 0.9248714512586593, "num_tokens": 2750412271.0, "step": 35300 }, { "entropy": 0.23881920039653778, "epoch": 1.4076935329722842, "grad_norm": 1.6275558471679688, "learning_rate": 4.2585584015378856e-05, "loss": 0.23602088928222656, "mean_token_accuracy": 0.9232524186372757, "num_tokens": 2754252714.0, "step": 35350 }, { "entropy": 0.22928894877433778, "epoch": 1.4096846129340554, "grad_norm": 0.6506333947181702, "learning_rate": 4.2321889626911414e-05, "loss": 0.22902776718139647, "mean_token_accuracy": 0.925293561220169, "num_tokens": 2758297379.0, "step": 35400 }, { "entropy": 0.2295927706360817, "epoch": 1.4116756928958267, "grad_norm": 0.7610980272293091, "learning_rate": 4.205879487669464e-05, "loss": 0.2256919288635254, "mean_token_accuracy": 0.9253293204307557, "num_tokens": 2762180568.0, "step": 35450 }, { "entropy": 0.23466120764613152, "epoch": 1.413666772857598, "grad_norm": 0.9445284008979797, "learning_rate": 4.1796302499937335e-05, "loss": 0.23389270782470703, "mean_token_accuracy": 0.923297768831253, "num_tokens": 2766024401.0, "step": 35500 }, { "entropy": 0.22722692921757698, "epoch": 1.4156578528193693, "grad_norm": 1.244280457496643, "learning_rate": 4.1534415225585854e-05, "loss": 0.22508651733398438, "mean_token_accuracy": 0.9255350995063781, "num_tokens": 2769745794.0, "step": 35550 }, { "entropy": 0.227867431640625, "epoch": 1.4176489327811406, "grad_norm": 0.7465041875839233, "learning_rate": 4.127313577629575e-05, "loss": 0.23069664001464843, "mean_token_accuracy": 0.9248278605937957, "num_tokens": 2773587205.0, "step": 35600 }, { "entropy": 0.22520581975579262, "epoch": 1.4196400127429118, "grad_norm": 0.605065643787384, "learning_rate": 4.101246686840344e-05, "loss": 0.22308128356933593, "mean_token_accuracy": 0.9263810759782791, "num_tokens": 2777527560.0, "step": 35650 }, { "entropy": 0.22442895591259002, "epoch": 1.4216310927046831, "grad_norm": 0.6026067733764648, "learning_rate": 4.075241121189799e-05, "loss": 0.22064193725585937, "mean_token_accuracy": 0.9266389012336731, "num_tokens": 2781333287.0, "step": 35700 }, { "entropy": 0.22473806738853455, "epoch": 1.4236221726664544, "grad_norm": 0.5562543272972107, "learning_rate": 4.049297151039295e-05, "loss": 0.22368572235107423, "mean_token_accuracy": 0.926014997959137, "num_tokens": 2785247144.0, "step": 35750 }, { "entropy": 0.23306748121976853, "epoch": 1.4256132526282255, "grad_norm": 14.433042526245117, "learning_rate": 4.0234150461098084e-05, "loss": 0.2335945701599121, "mean_token_accuracy": 0.9244680607318878, "num_tokens": 2789231231.0, "step": 35800 }, { "entropy": 0.22841948732733727, "epoch": 1.4276043325899967, "grad_norm": 9.771605491638184, "learning_rate": 3.997595075479171e-05, "loss": 0.2260110855102539, "mean_token_accuracy": 0.9248299193382263, "num_tokens": 2793086574.0, "step": 35850 }, { "entropy": 0.2289821219444275, "epoch": 1.429595412551768, "grad_norm": 1.2308059930801392, "learning_rate": 3.971837507579228e-05, "loss": 0.22705148696899413, "mean_token_accuracy": 0.9248201483488083, "num_tokens": 2797062663.0, "step": 35900 }, { "entropy": 0.22674365878105163, "epoch": 1.4315864925135393, "grad_norm": 0.6203780770301819, "learning_rate": 3.946142610193075e-05, "loss": 0.22311054229736327, "mean_token_accuracy": 0.9253755122423172, "num_tokens": 2801003084.0, "step": 35950 }, { "entropy": 0.2285499520599842, "epoch": 1.4335775724753106, "grad_norm": 0.6966903805732727, "learning_rate": 3.920510650452269e-05, "loss": 0.22486160278320313, "mean_token_accuracy": 0.9250599068403244, "num_tokens": 2804929445.0, "step": 36000 }, { "epoch": 1.4335775724753106, "eval_entropy": 0.22345993916193643, "eval_loss": 0.2309042513370514, "eval_mean_token_accuracy": 0.9215882713832553, "eval_num_tokens": 2804929445.0, "eval_runtime": 97.9244, "eval_samples_per_second": 10.212, "eval_steps_per_second": 0.643, "step": 36000 }, { "entropy": 0.22846704930067063, "epoch": 1.4355686524370819, "grad_norm": 18.896896362304688, "learning_rate": 3.894941894834048e-05, "loss": 0.22570266723632812, "mean_token_accuracy": 0.9257201546430588, "num_tokens": 2808763772.0, "step": 36050 }, { "entropy": 0.22670045271515846, "epoch": 1.4375597323988532, "grad_norm": 2.932440996170044, "learning_rate": 3.869436609158559e-05, "loss": 0.22269927978515625, "mean_token_accuracy": 0.9260558187961578, "num_tokens": 2812551635.0, "step": 36100 }, { "entropy": 0.2322857917845249, "epoch": 1.4395508123606244, "grad_norm": 2.4364428520202637, "learning_rate": 3.8439950585861e-05, "loss": 0.22790021896362306, "mean_token_accuracy": 0.9243459624052047, "num_tokens": 2816505564.0, "step": 36150 }, { "entropy": 0.23179278627038002, "epoch": 1.4415418923223957, "grad_norm": 0.8245556950569153, "learning_rate": 3.81861750761436e-05, "loss": 0.22998580932617188, "mean_token_accuracy": 0.9245978146791458, "num_tokens": 2820466604.0, "step": 36200 }, { "entropy": 0.23288773104548455, "epoch": 1.443532972284167, "grad_norm": 1.0259772539138794, "learning_rate": 3.793304220075672e-05, "loss": 0.23358001708984374, "mean_token_accuracy": 0.9243580067157745, "num_tokens": 2824397515.0, "step": 36250 }, { "entropy": 0.22789985239505767, "epoch": 1.4455240522459383, "grad_norm": 9.18964672088623, "learning_rate": 3.7680554591342595e-05, "loss": 0.224021053314209, "mean_token_accuracy": 0.9257315665483474, "num_tokens": 2828322125.0, "step": 36300 }, { "entropy": 0.22588057518005372, "epoch": 1.4475151322077093, "grad_norm": 1.5855872631072998, "learning_rate": 3.742871487283517e-05, "loss": 0.2249225616455078, "mean_token_accuracy": 0.9258129727840424, "num_tokens": 2832064808.0, "step": 36350 }, { "entropy": 0.22681081116199495, "epoch": 1.4495062121694806, "grad_norm": 0.9966343641281128, "learning_rate": 3.717752566343271e-05, "loss": 0.22803802490234376, "mean_token_accuracy": 0.9256650274991989, "num_tokens": 2836024488.0, "step": 36400 }, { "entropy": 0.23106618836522103, "epoch": 1.451497292131252, "grad_norm": 4.7284464836120605, "learning_rate": 3.69269895745706e-05, "loss": 0.22984613418579103, "mean_token_accuracy": 0.9237276768684387, "num_tokens": 2839943059.0, "step": 36450 }, { "entropy": 0.22288828268647193, "epoch": 1.4534883720930232, "grad_norm": 0.7623031139373779, "learning_rate": 3.667710921089418e-05, "loss": 0.22018928527832032, "mean_token_accuracy": 0.9268843108415603, "num_tokens": 2843833836.0, "step": 36500 }, { "entropy": 0.23100583925843238, "epoch": 1.4554794520547945, "grad_norm": 0.8289280533790588, "learning_rate": 3.64278871702317e-05, "loss": 0.22793426513671874, "mean_token_accuracy": 0.9247871005535125, "num_tokens": 2847710648.0, "step": 36550 }, { "entropy": 0.2282957051694393, "epoch": 1.4574705320165657, "grad_norm": 0.7811777591705322, "learning_rate": 3.617932604356729e-05, "loss": 0.22422840118408202, "mean_token_accuracy": 0.9262890052795411, "num_tokens": 2851604514.0, "step": 36600 }, { "entropy": 0.22520012721419336, "epoch": 1.459461611978337, "grad_norm": 0.8696520328521729, "learning_rate": 3.5931428415014014e-05, "loss": 0.22324569702148436, "mean_token_accuracy": 0.9258240640163422, "num_tokens": 2855664391.0, "step": 36650 }, { "entropy": 0.22581250563263894, "epoch": 1.4614526919401083, "grad_norm": 0.744315505027771, "learning_rate": 3.568419686178708e-05, "loss": 0.22559711456298828, "mean_token_accuracy": 0.9261856961250305, "num_tokens": 2859509766.0, "step": 36700 }, { "entropy": 0.2275920917093754, "epoch": 1.4634437719018796, "grad_norm": 1.2164433002471924, "learning_rate": 3.543763395417682e-05, "loss": 0.2258456802368164, "mean_token_accuracy": 0.9255189836025238, "num_tokens": 2863404259.0, "step": 36750 }, { "entropy": 0.22345173820853234, "epoch": 1.4654348518636509, "grad_norm": 0.6867997646331787, "learning_rate": 3.5191742255522395e-05, "loss": 0.22099639892578124, "mean_token_accuracy": 0.9270286786556244, "num_tokens": 2867284843.0, "step": 36800 }, { "entropy": 0.21736916065216064, "epoch": 1.4674259318254221, "grad_norm": 0.7665778994560242, "learning_rate": 3.494652432218463e-05, "loss": 0.2197450065612793, "mean_token_accuracy": 0.9281142580509186, "num_tokens": 2871146245.0, "step": 36850 }, { "entropy": 0.2261849372088909, "epoch": 1.4694170117871934, "grad_norm": 1.0307066440582275, "learning_rate": 3.470198270351983e-05, "loss": 0.2237540054321289, "mean_token_accuracy": 0.9261994022130966, "num_tokens": 2874929172.0, "step": 36900 }, { "entropy": 0.22291465908288954, "epoch": 1.4714080917489647, "grad_norm": 111.51166534423828, "learning_rate": 3.445811994185311e-05, "loss": 0.21993278503417968, "mean_token_accuracy": 0.9265702044963837, "num_tokens": 2878907889.0, "step": 36950 }, { "entropy": 0.22984845981001853, "epoch": 1.473399171710736, "grad_norm": 0.6987447738647461, "learning_rate": 3.421493857245199e-05, "loss": 0.23014335632324218, "mean_token_accuracy": 0.9256218951940537, "num_tokens": 2882673971.0, "step": 37000 }, { "entropy": 0.22242909878492356, "epoch": 1.4753902516725073, "grad_norm": 2.1599528789520264, "learning_rate": 3.3972441123500045e-05, "loss": 0.22177177429199219, "mean_token_accuracy": 0.9269962483644485, "num_tokens": 2886614337.0, "step": 37050 }, { "entropy": 0.22314247265458106, "epoch": 1.4773813316342785, "grad_norm": 0.648526132106781, "learning_rate": 3.373063011607059e-05, "loss": 0.22280792236328126, "mean_token_accuracy": 0.9268735468387603, "num_tokens": 2890594824.0, "step": 37100 }, { "entropy": 0.22995008423924446, "epoch": 1.4793724115960498, "grad_norm": 0.9100789427757263, "learning_rate": 3.348950806410054e-05, "loss": 0.22757783889770508, "mean_token_accuracy": 0.9252729284763336, "num_tokens": 2894438864.0, "step": 37150 }, { "entropy": 0.22689683616161346, "epoch": 1.481363491557821, "grad_norm": 121.19415283203125, "learning_rate": 3.324907747436423e-05, "loss": 0.2277880859375, "mean_token_accuracy": 0.9258731609582901, "num_tokens": 2898300182.0, "step": 37200 }, { "entropy": 0.22294052615761756, "epoch": 1.4833545715195922, "grad_norm": 30.978212356567383, "learning_rate": 3.300934084644727e-05, "loss": 0.21728097915649414, "mean_token_accuracy": 0.9270085525512696, "num_tokens": 2902221223.0, "step": 37250 }, { "entropy": 0.23212106972932817, "epoch": 1.4853456514813634, "grad_norm": 0.8279492259025574, "learning_rate": 3.277030067272072e-05, "loss": 0.23210474014282226, "mean_token_accuracy": 0.9236459809541703, "num_tokens": 2905980634.0, "step": 37300 }, { "entropy": 0.22908665359020233, "epoch": 1.4873367314431347, "grad_norm": 2.934983015060425, "learning_rate": 3.253195943831511e-05, "loss": 0.22299076080322267, "mean_token_accuracy": 0.925340690612793, "num_tokens": 2909868699.0, "step": 37350 }, { "entropy": 0.22319218948483466, "epoch": 1.489327811404906, "grad_norm": 11.222670555114746, "learning_rate": 3.229431962109455e-05, "loss": 0.22189111709594728, "mean_token_accuracy": 0.9269910353422165, "num_tokens": 2913868017.0, "step": 37400 }, { "entropy": 0.2243164885044098, "epoch": 1.4913188913666773, "grad_norm": 25.52601432800293, "learning_rate": 3.205738369163105e-05, "loss": 0.22555835723876952, "mean_token_accuracy": 0.9249966585636139, "num_tokens": 2917728385.0, "step": 37450 }, { "entropy": 0.2241789762675762, "epoch": 1.4933099713284486, "grad_norm": 9572.515625, "learning_rate": 3.182115411317879e-05, "loss": 0.22412548065185547, "mean_token_accuracy": 0.9268283969163895, "num_tokens": 2921629087.0, "step": 37500 }, { "epoch": 1.4933099713284486, "eval_entropy": 0.22155299451616076, "eval_loss": 0.226557195186615, "eval_mean_token_accuracy": 0.9227044922964913, "eval_num_tokens": 2921629087.0, "eval_runtime": 97.8985, "eval_samples_per_second": 10.215, "eval_steps_per_second": 0.644, "step": 37500 }, { "entropy": 0.2184179201722145, "epoch": 1.4953010512902198, "grad_norm": 1.632070541381836, "learning_rate": 3.1585633341648505e-05, "loss": 0.21661128997802734, "mean_token_accuracy": 0.927964398264885, "num_tokens": 2925570451.0, "step": 37550 }, { "entropy": 0.2241984224319458, "epoch": 1.4972921312519911, "grad_norm": 2.975705862045288, "learning_rate": 3.135082382558202e-05, "loss": 0.22081336975097657, "mean_token_accuracy": 0.9267278093099595, "num_tokens": 2929558328.0, "step": 37600 }, { "entropy": 0.2238903446495533, "epoch": 1.4992832112137624, "grad_norm": 1.1821390390396118, "learning_rate": 3.111672800612664e-05, "loss": 0.2203415298461914, "mean_token_accuracy": 0.9268561029434204, "num_tokens": 2933576475.0, "step": 37650 }, { "entropy": 0.21960934937000276, "epoch": 1.5012742911755335, "grad_norm": 4.258495330810547, "learning_rate": 3.088334831700993e-05, "loss": 0.21440572738647462, "mean_token_accuracy": 0.9271126753091812, "num_tokens": 2937500631.0, "step": 37700 }, { "entropy": 0.22476192206144333, "epoch": 1.5032653711373047, "grad_norm": 3.1449878215789795, "learning_rate": 3.0650687184514485e-05, "loss": 0.2259622573852539, "mean_token_accuracy": 0.925874103307724, "num_tokens": 2941343777.0, "step": 37750 }, { "entropy": 0.22604495018720627, "epoch": 1.505256451099076, "grad_norm": 8.281270980834961, "learning_rate": 3.0418747027452344e-05, "loss": 0.2268206787109375, "mean_token_accuracy": 0.9257059663534164, "num_tokens": 2945269139.0, "step": 37800 }, { "entropy": 0.2256699912250042, "epoch": 1.5072475310608473, "grad_norm": 1.3491407632827759, "learning_rate": 3.018753025714024e-05, "loss": 0.2271018409729004, "mean_token_accuracy": 0.92496422290802, "num_tokens": 2949257027.0, "step": 37850 }, { "entropy": 0.2192372766137123, "epoch": 1.5092386110226186, "grad_norm": 8.2188720703125, "learning_rate": 2.9957039277374323e-05, "loss": 0.2174224090576172, "mean_token_accuracy": 0.9276827430725098, "num_tokens": 2953283440.0, "step": 37900 }, { "entropy": 0.22263924196362495, "epoch": 1.5112296909843899, "grad_norm": 4.670276165008545, "learning_rate": 2.972727648440521e-05, "loss": 0.21921150207519532, "mean_token_accuracy": 0.9276534301042557, "num_tokens": 2956989210.0, "step": 37950 }, { "entropy": 0.21206003218889236, "epoch": 1.5132207709461611, "grad_norm": 2.4002881050109863, "learning_rate": 2.9498244266913077e-05, "loss": 0.2130445671081543, "mean_token_accuracy": 0.9293075942993164, "num_tokens": 2960990017.0, "step": 38000 }, { "entropy": 0.22117702782154083, "epoch": 1.5152118509079324, "grad_norm": 6.803835391998291, "learning_rate": 2.926994500598288e-05, "loss": 0.22471899032592774, "mean_token_accuracy": 0.9264506107568741, "num_tokens": 2964919811.0, "step": 38050 }, { "entropy": 0.22678003415465356, "epoch": 1.5172029308697037, "grad_norm": 1.0673514604568481, "learning_rate": 2.9042381075079394e-05, "loss": 0.2256137275695801, "mean_token_accuracy": 0.9257134348154068, "num_tokens": 2968978045.0, "step": 38100 }, { "entropy": 0.22859185308218002, "epoch": 1.519194010831475, "grad_norm": 1.2845282554626465, "learning_rate": 2.881555484002293e-05, "loss": 0.22426969528198243, "mean_token_accuracy": 0.9252816712856293, "num_tokens": 2972980896.0, "step": 38150 }, { "entropy": 0.22109326124191284, "epoch": 1.5211850907932463, "grad_norm": 5.438140392303467, "learning_rate": 2.858946865896428e-05, "loss": 0.21824604034423828, "mean_token_accuracy": 0.9274251675605774, "num_tokens": 2976722951.0, "step": 38200 }, { "entropy": 0.22596635431051254, "epoch": 1.5231761707550175, "grad_norm": 14.905731201171875, "learning_rate": 2.8364124882360544e-05, "loss": 0.22388429641723634, "mean_token_accuracy": 0.9256227517127991, "num_tokens": 2980714087.0, "step": 38250 }, { "entropy": 0.2224484533071518, "epoch": 1.5251672507167888, "grad_norm": 3.0896732807159424, "learning_rate": 2.813952585295052e-05, "loss": 0.22124006271362304, "mean_token_accuracy": 0.9260759902000427, "num_tokens": 2984690559.0, "step": 38300 }, { "entropy": 0.2202881780266762, "epoch": 1.52715833067856, "grad_norm": 5.143960475921631, "learning_rate": 2.7915673905730434e-05, "loss": 0.21950557708740234, "mean_token_accuracy": 0.9270938616991043, "num_tokens": 2988553760.0, "step": 38350 }, { "entropy": 0.22221544161438941, "epoch": 1.5291494106403314, "grad_norm": 4.49341344833374, "learning_rate": 2.7692571367929608e-05, "loss": 0.22334598541259765, "mean_token_accuracy": 0.9261446082592011, "num_tokens": 2992421474.0, "step": 38400 }, { "entropy": 0.22259217351675034, "epoch": 1.5311404906021027, "grad_norm": 22.436153411865234, "learning_rate": 2.7470220558986293e-05, "loss": 0.2211014747619629, "mean_token_accuracy": 0.927097294330597, "num_tokens": 2996393136.0, "step": 38450 }, { "entropy": 0.2215883442759514, "epoch": 1.533131570563874, "grad_norm": 12.471090316772461, "learning_rate": 2.7248623790523552e-05, "loss": 0.21897666931152343, "mean_token_accuracy": 0.9272121900320053, "num_tokens": 3000399931.0, "step": 38500 }, { "entropy": 0.2189611642062664, "epoch": 1.5351226505256452, "grad_norm": 2.521131753921509, "learning_rate": 2.7027783366325255e-05, "loss": 0.22009151458740234, "mean_token_accuracy": 0.9275297212600708, "num_tokens": 3004351373.0, "step": 38550 }, { "entropy": 0.21605175256729126, "epoch": 1.5371137304874165, "grad_norm": 0.8228936195373535, "learning_rate": 2.6807701582312007e-05, "loss": 0.21643526077270508, "mean_token_accuracy": 0.9290778201818466, "num_tokens": 3008120830.0, "step": 38600 }, { "entropy": 0.21972268596291541, "epoch": 1.5391048104491878, "grad_norm": 4.456844329833984, "learning_rate": 2.6588380726517438e-05, "loss": 0.21687641143798828, "mean_token_accuracy": 0.927766455411911, "num_tokens": 3011862850.0, "step": 38650 }, { "entropy": 0.21665039166808128, "epoch": 1.541095890410959, "grad_norm": 13.769525527954102, "learning_rate": 2.6369823079064426e-05, "loss": 0.21669651031494142, "mean_token_accuracy": 0.9281174397468567, "num_tokens": 3015844338.0, "step": 38700 }, { "entropy": 0.21486522629857063, "epoch": 1.5430869703727301, "grad_norm": 2.328981637954712, "learning_rate": 2.6152030912141156e-05, "loss": 0.213769588470459, "mean_token_accuracy": 0.9283159101009368, "num_tokens": 3019795586.0, "step": 38750 }, { "entropy": 0.2236236061155796, "epoch": 1.5450780503345014, "grad_norm": 1.409731388092041, "learning_rate": 2.5935006489977753e-05, "loss": 0.22388771057128906, "mean_token_accuracy": 0.9261727368831635, "num_tokens": 3023785071.0, "step": 38800 }, { "entropy": 0.22205795854330063, "epoch": 1.5470691302962727, "grad_norm": 0.8017808794975281, "learning_rate": 2.5718752068822637e-05, "loss": 0.21935756683349608, "mean_token_accuracy": 0.9270194679498672, "num_tokens": 3027649742.0, "step": 38850 }, { "entropy": 0.21731107220053672, "epoch": 1.549060210258044, "grad_norm": 1.1843457221984863, "learning_rate": 2.5503269896919056e-05, "loss": 0.21343338012695312, "mean_token_accuracy": 0.9281834596395493, "num_tokens": 3031508387.0, "step": 38900 }, { "entropy": 0.2247211866080761, "epoch": 1.5510512902198152, "grad_norm": 2.625734567642212, "learning_rate": 2.5288562214481783e-05, "loss": 0.21889663696289063, "mean_token_accuracy": 0.9264307451248169, "num_tokens": 3035507408.0, "step": 38950 }, { "entropy": 0.21469190895557402, "epoch": 1.5530423701815865, "grad_norm": 1.0048292875289917, "learning_rate": 2.5074631253673662e-05, "loss": 0.21466026306152344, "mean_token_accuracy": 0.928369175195694, "num_tokens": 3039388849.0, "step": 39000 }, { "epoch": 1.5530423701815865, "eval_entropy": 0.21342357555552136, "eval_loss": 0.22486525774002075, "eval_mean_token_accuracy": 0.9228534215972537, "eval_num_tokens": 3039388849.0, "eval_runtime": 98.35, "eval_samples_per_second": 10.168, "eval_steps_per_second": 0.641, "step": 39000 }, { "entropy": 0.22176682874560355, "epoch": 1.5550334501433578, "grad_norm": 3.4707674980163574, "learning_rate": 2.4861479238582596e-05, "loss": 0.22119997024536134, "mean_token_accuracy": 0.9259116953611374, "num_tokens": 3043265800.0, "step": 39050 }, { "entropy": 0.21799086198210715, "epoch": 1.5570245301051289, "grad_norm": 2.8396286964416504, "learning_rate": 2.4649108385198427e-05, "loss": 0.2187785530090332, "mean_token_accuracy": 0.9272249537706375, "num_tokens": 3047277743.0, "step": 39100 }, { "entropy": 0.21569239243865013, "epoch": 1.5590156100669001, "grad_norm": 1.3464019298553467, "learning_rate": 2.4437520901389632e-05, "loss": 0.2122294807434082, "mean_token_accuracy": 0.9286917650699615, "num_tokens": 3051165918.0, "step": 39150 }, { "entropy": 0.22129391238093377, "epoch": 1.5610066900286714, "grad_norm": 50.253761291503906, "learning_rate": 2.422671898688068e-05, "loss": 0.2180173873901367, "mean_token_accuracy": 0.9284462577104569, "num_tokens": 3055024433.0, "step": 39200 }, { "entropy": 0.22183120295405387, "epoch": 1.5629977699904427, "grad_norm": 2.614213705062866, "learning_rate": 2.4016704833228998e-05, "loss": 0.21925174713134765, "mean_token_accuracy": 0.9262894040346146, "num_tokens": 3058925272.0, "step": 39250 }, { "entropy": 0.21707088455557824, "epoch": 1.564988849952214, "grad_norm": 2.362391710281372, "learning_rate": 2.3807480623802216e-05, "loss": 0.21744693756103517, "mean_token_accuracy": 0.9284393548965454, "num_tokens": 3062926466.0, "step": 39300 }, { "entropy": 0.2231329759955406, "epoch": 1.5669799299139853, "grad_norm": 2.7910847663879395, "learning_rate": 2.3599048533755484e-05, "loss": 0.2215903091430664, "mean_token_accuracy": 0.92674241065979, "num_tokens": 3066774481.0, "step": 39350 }, { "entropy": 0.218631292283535, "epoch": 1.5689710098757566, "grad_norm": 2.050013780593872, "learning_rate": 2.339141073000888e-05, "loss": 0.2163446044921875, "mean_token_accuracy": 0.9279627180099488, "num_tokens": 3070759669.0, "step": 39400 }, { "entropy": 0.22251748919487, "epoch": 1.5709620898375278, "grad_norm": 1.1582326889038086, "learning_rate": 2.3184569371224796e-05, "loss": 0.22154170989990235, "mean_token_accuracy": 0.9265431314706802, "num_tokens": 3074745933.0, "step": 39450 }, { "entropy": 0.21645621821284294, "epoch": 1.5729531697992991, "grad_norm": 1.1507421731948853, "learning_rate": 2.297852660778561e-05, "loss": 0.2131570053100586, "mean_token_accuracy": 0.9290761828422547, "num_tokens": 3078609666.0, "step": 39500 }, { "entropy": 0.21492433786392212, "epoch": 1.5749442497610704, "grad_norm": 4.330776691436768, "learning_rate": 2.2773284581771214e-05, "loss": 0.2180664825439453, "mean_token_accuracy": 0.9282948035001755, "num_tokens": 3082354144.0, "step": 39550 }, { "entropy": 0.21522749200463295, "epoch": 1.5769353297228417, "grad_norm": 1.0180329084396362, "learning_rate": 2.2568845426936823e-05, "loss": 0.2134151840209961, "mean_token_accuracy": 0.9284723418951034, "num_tokens": 3086179781.0, "step": 39600 }, { "entropy": 0.21389096170663835, "epoch": 1.578926409684613, "grad_norm": 2.2567880153656006, "learning_rate": 2.2365211268690856e-05, "loss": 0.21490795135498048, "mean_token_accuracy": 0.9287674587965011, "num_tokens": 3090053115.0, "step": 39650 }, { "entropy": 0.21932182297110558, "epoch": 1.5809174896463842, "grad_norm": 20.473278045654297, "learning_rate": 2.2162384224072608e-05, "loss": 0.21317176818847655, "mean_token_accuracy": 0.9280319666862488, "num_tokens": 3093969332.0, "step": 39700 }, { "entropy": 0.21719238206744193, "epoch": 1.5829085696081555, "grad_norm": 1.1855759620666504, "learning_rate": 2.1960366401730492e-05, "loss": 0.21747058868408203, "mean_token_accuracy": 0.9273398566246033, "num_tokens": 3097928473.0, "step": 39750 }, { "entropy": 0.22151433676481247, "epoch": 1.5848996495699268, "grad_norm": 12.52309513092041, "learning_rate": 2.1759159901899972e-05, "loss": 0.21812362670898439, "mean_token_accuracy": 0.927079439163208, "num_tokens": 3101781883.0, "step": 39800 }, { "entropy": 0.21495074391365052, "epoch": 1.586890729531698, "grad_norm": 0.7089627981185913, "learning_rate": 2.1558766816381804e-05, "loss": 0.2153666114807129, "mean_token_accuracy": 0.9288167887926102, "num_tokens": 3105821084.0, "step": 39850 }, { "entropy": 0.22185655996203424, "epoch": 1.5888818094934694, "grad_norm": 20.341962814331055, "learning_rate": 2.1359189228520237e-05, "loss": 0.22094457626342773, "mean_token_accuracy": 0.9260220712423325, "num_tokens": 3109657086.0, "step": 39900 }, { "entropy": 0.22154104918241502, "epoch": 1.5908728894552406, "grad_norm": 1.856255054473877, "learning_rate": 2.116042921318133e-05, "loss": 0.22122642517089844, "mean_token_accuracy": 0.9261481338739395, "num_tokens": 3113612059.0, "step": 39950 }, { "entropy": 0.21654552415013315, "epoch": 1.592863969417012, "grad_norm": 2.5476434230804443, "learning_rate": 2.0962488836731443e-05, "loss": 0.21597785949707032, "mean_token_accuracy": 0.9289438962936402, "num_tokens": 3117625330.0, "step": 40000 }, { "entropy": 0.21598056226968765, "epoch": 1.5948550493787832, "grad_norm": 26.293344497680664, "learning_rate": 2.076537015701584e-05, "loss": 0.21633754730224608, "mean_token_accuracy": 0.9281029665470123, "num_tokens": 3121425433.0, "step": 40050 }, { "entropy": 0.21721562683582307, "epoch": 1.5968461293405545, "grad_norm": 2.0095717906951904, "learning_rate": 2.056907522333701e-05, "loss": 0.2188913917541504, "mean_token_accuracy": 0.9278429085016251, "num_tokens": 3125303976.0, "step": 40100 }, { "entropy": 0.21628726929426192, "epoch": 1.5988372093023255, "grad_norm": 12.751546859741211, "learning_rate": 2.0373606076433672e-05, "loss": 0.21001420974731444, "mean_token_accuracy": 0.9288813596963883, "num_tokens": 3129189259.0, "step": 40150 }, { "entropy": 0.21064794391393662, "epoch": 1.6008282892640968, "grad_norm": 0.977423906326294, "learning_rate": 2.0178964748459362e-05, "loss": 0.20974472045898437, "mean_token_accuracy": 0.9297809761762619, "num_tokens": 3133051181.0, "step": 40200 }, { "entropy": 0.22305100120604038, "epoch": 1.602819369225868, "grad_norm": 0.8115474581718445, "learning_rate": 1.998515326296142e-05, "loss": 0.2161123847961426, "mean_token_accuracy": 0.9274122947454453, "num_tokens": 3136743350.0, "step": 40250 }, { "entropy": 0.21686189234256745, "epoch": 1.6048104491876394, "grad_norm": 1.618212342262268, "learning_rate": 1.979217363485989e-05, "loss": 0.2156623649597168, "mean_token_accuracy": 0.9281445103883743, "num_tokens": 3140659012.0, "step": 40300 }, { "entropy": 0.21185349941253662, "epoch": 1.6068015291494107, "grad_norm": 0.9155282974243164, "learning_rate": 1.9600027870426506e-05, "loss": 0.20886346817016602, "mean_token_accuracy": 0.9293528980016709, "num_tokens": 3144567867.0, "step": 40350 }, { "entropy": 0.21675873085856437, "epoch": 1.608792609111182, "grad_norm": 21.752269744873047, "learning_rate": 1.9408717967264066e-05, "loss": 0.2155482864379883, "mean_token_accuracy": 0.9282829076051712, "num_tokens": 3148409926.0, "step": 40400 }, { "entropy": 0.2160284450650215, "epoch": 1.6107836890729532, "grad_norm": 11.025493621826172, "learning_rate": 1.9218245914285437e-05, "loss": 0.2147054672241211, "mean_token_accuracy": 0.9282228392362595, "num_tokens": 3152435454.0, "step": 40450 }, { "entropy": 0.21994507059454918, "epoch": 1.6127747690347243, "grad_norm": 31.000930786132812, "learning_rate": 1.9028613691692887e-05, "loss": 0.2158209800720215, "mean_token_accuracy": 0.9269871145486832, "num_tokens": 3156288599.0, "step": 40500 }, { "epoch": 1.6127747690347243, "eval_entropy": 0.21402156861528518, "eval_loss": 0.22149111330509186, "eval_mean_token_accuracy": 0.9242527182140048, "eval_num_tokens": 3156288599.0, "eval_runtime": 98.1435, "eval_samples_per_second": 10.189, "eval_steps_per_second": 0.642, "step": 40500 }, { "entropy": 0.2200436171889305, "epoch": 1.6147658489964956, "grad_norm": 7.249177932739258, "learning_rate": 1.8839823270957625e-05, "loss": 0.2148914909362793, "mean_token_accuracy": 0.9276934152841568, "num_tokens": 3160109492.0, "step": 40550 }, { "entropy": 0.21039872646331786, "epoch": 1.6167569289582668, "grad_norm": 3.97442626953125, "learning_rate": 1.8651876614799347e-05, "loss": 0.20821548461914063, "mean_token_accuracy": 0.92963711977005, "num_tokens": 3163948586.0, "step": 40600 }, { "entropy": 0.2125879742205143, "epoch": 1.6187480089200381, "grad_norm": 4.380746841430664, "learning_rate": 1.8464775677165536e-05, "loss": 0.21132637023925782, "mean_token_accuracy": 0.9289473402500152, "num_tokens": 3167768217.0, "step": 40650 }, { "entropy": 0.2152009476721287, "epoch": 1.6207390888818094, "grad_norm": 2.1306657791137695, "learning_rate": 1.8278522403211472e-05, "loss": 0.21508853912353515, "mean_token_accuracy": 0.9290641701221466, "num_tokens": 3171738971.0, "step": 40700 }, { "entropy": 0.2135643979907036, "epoch": 1.6227301688435807, "grad_norm": 6.235568046569824, "learning_rate": 1.8093118729279847e-05, "loss": 0.21154956817626952, "mean_token_accuracy": 0.9292153662443161, "num_tokens": 3175414893.0, "step": 40750 }, { "entropy": 0.21976500377058983, "epoch": 1.624721248805352, "grad_norm": 1.4987317323684692, "learning_rate": 1.7908566582880658e-05, "loss": 0.2205881118774414, "mean_token_accuracy": 0.9276097309589386, "num_tokens": 3179363316.0, "step": 40800 }, { "entropy": 0.2242605820298195, "epoch": 1.6267123287671232, "grad_norm": 1.8390077352523804, "learning_rate": 1.7724867882671205e-05, "loss": 0.22253013610839845, "mean_token_accuracy": 0.9263802176713943, "num_tokens": 3183142991.0, "step": 40850 }, { "entropy": 0.21403965666890146, "epoch": 1.6287034087288945, "grad_norm": 0.9712594747543335, "learning_rate": 1.7542024538436054e-05, "loss": 0.20888723373413087, "mean_token_accuracy": 0.9288804924488068, "num_tokens": 3187113070.0, "step": 40900 }, { "entropy": 0.2297496658563614, "epoch": 1.6306944886906658, "grad_norm": 2.2136800289154053, "learning_rate": 1.7360038451067274e-05, "loss": 0.22716428756713866, "mean_token_accuracy": 0.9243395751714707, "num_tokens": 3190985017.0, "step": 40950 }, { "entropy": 0.21799209505319594, "epoch": 1.632685568652437, "grad_norm": 1.661545991897583, "learning_rate": 1.7178911512544738e-05, "loss": 0.2154435920715332, "mean_token_accuracy": 0.9278116518259049, "num_tokens": 3194821627.0, "step": 41000 }, { "entropy": 0.21571315512061118, "epoch": 1.6346766486142084, "grad_norm": 1.2771720886230469, "learning_rate": 1.6998645605916186e-05, "loss": 0.21327953338623046, "mean_token_accuracy": 0.9287315171957016, "num_tokens": 3198747711.0, "step": 41050 }, { "entropy": 0.21436791002750397, "epoch": 1.6366677285759796, "grad_norm": 0.8762326836585999, "learning_rate": 1.681924260527795e-05, "loss": 0.21281551361083983, "mean_token_accuracy": 0.9294509363174438, "num_tokens": 3202530074.0, "step": 41100 }, { "entropy": 0.2123296819627285, "epoch": 1.638658808537751, "grad_norm": 0.7044285535812378, "learning_rate": 1.66407043757553e-05, "loss": 0.21069869995117188, "mean_token_accuracy": 0.9294757169485092, "num_tokens": 3206534011.0, "step": 41150 }, { "entropy": 0.21492626041173934, "epoch": 1.6406498884995222, "grad_norm": 9.144807815551758, "learning_rate": 1.64630327734831e-05, "loss": 0.2130570602416992, "mean_token_accuracy": 0.9289986944198608, "num_tokens": 3210440419.0, "step": 41200 }, { "entropy": 0.21355638578534125, "epoch": 1.6426409684612935, "grad_norm": 8.384472846984863, "learning_rate": 1.6286229645586536e-05, "loss": 0.2130125045776367, "mean_token_accuracy": 0.9284316200017929, "num_tokens": 3214291090.0, "step": 41250 }, { "entropy": 0.2188258746266365, "epoch": 1.6446320484230648, "grad_norm": 1.3508156538009644, "learning_rate": 1.6110296830161785e-05, "loss": 0.21920238494873046, "mean_token_accuracy": 0.9268940687179565, "num_tokens": 3218226397.0, "step": 41300 }, { "entropy": 0.2143702931702137, "epoch": 1.646623128384836, "grad_norm": 2.916459560394287, "learning_rate": 1.593523615625714e-05, "loss": 0.2127183723449707, "mean_token_accuracy": 0.9287808537483215, "num_tokens": 3222172225.0, "step": 41350 }, { "entropy": 0.21112210765480996, "epoch": 1.6486142083466073, "grad_norm": 0.9712974429130554, "learning_rate": 1.5761049443853804e-05, "loss": 0.21317562103271484, "mean_token_accuracy": 0.9286684322357178, "num_tokens": 3225972480.0, "step": 41400 }, { "entropy": 0.20567390725016593, "epoch": 1.6506052883083786, "grad_norm": 0.9209238886833191, "learning_rate": 1.558773850384697e-05, "loss": 0.205433349609375, "mean_token_accuracy": 0.9311077183485031, "num_tokens": 3229892438.0, "step": 41450 }, { "entropy": 0.21239387080073358, "epoch": 1.6525963682701499, "grad_norm": 1.4846440553665161, "learning_rate": 1.5415305138027104e-05, "loss": 0.21052703857421876, "mean_token_accuracy": 0.9296367019414902, "num_tokens": 3233832878.0, "step": 41500 }, { "entropy": 0.21011498600244521, "epoch": 1.654587448231921, "grad_norm": 2.049940824508667, "learning_rate": 1.5243751139061203e-05, "loss": 0.21002595901489257, "mean_token_accuracy": 0.9301602828502655, "num_tokens": 3237785637.0, "step": 41550 }, { "entropy": 0.2112150290608406, "epoch": 1.6565785281936922, "grad_norm": 55.68623352050781, "learning_rate": 1.5073078290473996e-05, "loss": 0.20992542266845704, "mean_token_accuracy": 0.9297233396768569, "num_tokens": 3241741524.0, "step": 41600 }, { "entropy": 0.21753552749753, "epoch": 1.6585696081554635, "grad_norm": 2.9803659915924072, "learning_rate": 1.4903288366629598e-05, "loss": 0.21804637908935548, "mean_token_accuracy": 0.9274892538785935, "num_tokens": 3245552506.0, "step": 41650 }, { "entropy": 0.21577703446149826, "epoch": 1.6605606881172348, "grad_norm": 7.269993305206299, "learning_rate": 1.4734383132712993e-05, "loss": 0.21403234481811523, "mean_token_accuracy": 0.9283736723661423, "num_tokens": 3249441151.0, "step": 41700 }, { "entropy": 0.2176537710428238, "epoch": 1.662551768079006, "grad_norm": 6.361774444580078, "learning_rate": 1.4566364344711615e-05, "loss": 0.21713001251220704, "mean_token_accuracy": 0.927847085595131, "num_tokens": 3253343053.0, "step": 41750 }, { "entropy": 0.21354290679097176, "epoch": 1.6645428480407773, "grad_norm": 106.82672882080078, "learning_rate": 1.4399233749397234e-05, "loss": 0.21209760665893554, "mean_token_accuracy": 0.9293800675868988, "num_tokens": 3257267667.0, "step": 41800 }, { "entropy": 0.21319517716765404, "epoch": 1.6665339280025486, "grad_norm": 1.91234290599823, "learning_rate": 1.4232993084307612e-05, "loss": 0.2100328254699707, "mean_token_accuracy": 0.9298084115982056, "num_tokens": 3261167140.0, "step": 41850 }, { "entropy": 0.2159775422513485, "epoch": 1.6685250079643197, "grad_norm": 1.951257586479187, "learning_rate": 1.406764407772858e-05, "loss": 0.21279817581176758, "mean_token_accuracy": 0.9280615490674973, "num_tokens": 3265013887.0, "step": 41900 }, { "entropy": 0.21692703947424888, "epoch": 1.670516087926091, "grad_norm": 1.1800713539123535, "learning_rate": 1.390318844867613e-05, "loss": 0.21641178131103517, "mean_token_accuracy": 0.9281920313835144, "num_tokens": 3268863519.0, "step": 41950 }, { "entropy": 0.21288384214043618, "epoch": 1.6725071678878622, "grad_norm": 4.761718273162842, "learning_rate": 1.3739627906878271e-05, "loss": 0.21155868530273436, "mean_token_accuracy": 0.9296810233592987, "num_tokens": 3272665262.0, "step": 42000 }, { "epoch": 1.6725071678878622, "eval_entropy": 0.20912929730755941, "eval_loss": 0.22023142874240875, "eval_mean_token_accuracy": 0.9255002112615676, "eval_num_tokens": 3272665262.0, "eval_runtime": 98.2674, "eval_samples_per_second": 10.176, "eval_steps_per_second": 0.641, "step": 42000 }, { "entropy": 0.2097879809141159, "epoch": 1.6744982478496335, "grad_norm": 2.2647664546966553, "learning_rate": 1.3576964152757542e-05, "loss": 0.211810359954834, "mean_token_accuracy": 0.929447072148323, "num_tokens": 3276463801.0, "step": 42050 }, { "entropy": 0.21398061096668244, "epoch": 1.6764893278114048, "grad_norm": 1.7430264949798584, "learning_rate": 1.3415198877413193e-05, "loss": 0.21089591979980468, "mean_token_accuracy": 0.9287590628862381, "num_tokens": 3280413045.0, "step": 42100 }, { "entropy": 0.2118249951303005, "epoch": 1.678480407773176, "grad_norm": 0.7513388991355896, "learning_rate": 1.3254333762603622e-05, "loss": 0.211072998046875, "mean_token_accuracy": 0.9304378354549407, "num_tokens": 3284422179.0, "step": 42150 }, { "entropy": 0.2193823230266571, "epoch": 1.6804714877349474, "grad_norm": 1.4407684803009033, "learning_rate": 1.3094370480728912e-05, "loss": 0.21676433563232422, "mean_token_accuracy": 0.9272742563486099, "num_tokens": 3288271873.0, "step": 42200 }, { "entropy": 0.21136553287506105, "epoch": 1.6824625676967186, "grad_norm": 2.6618618965148926, "learning_rate": 1.2935310694813373e-05, "loss": 0.21298866271972655, "mean_token_accuracy": 0.9293400466442108, "num_tokens": 3292167154.0, "step": 42250 }, { "entropy": 0.20674633592367173, "epoch": 1.68445364765849, "grad_norm": 4.363306999206543, "learning_rate": 1.2777156058488426e-05, "loss": 0.20549545288085938, "mean_token_accuracy": 0.9310127758979797, "num_tokens": 3296150069.0, "step": 42300 }, { "entropy": 0.20810180857777597, "epoch": 1.6864447276202612, "grad_norm": 12.78535270690918, "learning_rate": 1.2619908215975219e-05, "loss": 0.20621026992797853, "mean_token_accuracy": 0.9300779277086257, "num_tokens": 3299908223.0, "step": 42350 }, { "entropy": 0.21136780738830566, "epoch": 1.6884358075820325, "grad_norm": 2.215325355529785, "learning_rate": 1.2463568802067583e-05, "loss": 0.21058544158935547, "mean_token_accuracy": 0.929671134352684, "num_tokens": 3303818694.0, "step": 42400 }, { "entropy": 0.21534586906433106, "epoch": 1.6904268875438038, "grad_norm": 4.338953495025635, "learning_rate": 1.2308139442115096e-05, "loss": 0.2148575973510742, "mean_token_accuracy": 0.9283660215139389, "num_tokens": 3307853357.0, "step": 42450 }, { "entropy": 0.21038600355386733, "epoch": 1.692417967505575, "grad_norm": 0.9631744027137756, "learning_rate": 1.2153621752006228e-05, "loss": 0.21024368286132813, "mean_token_accuracy": 0.9297681283950806, "num_tokens": 3311773443.0, "step": 42500 }, { "entropy": 0.2123473997414112, "epoch": 1.6944090474673463, "grad_norm": 1.845744013786316, "learning_rate": 1.2000017338151336e-05, "loss": 0.21207157135009766, "mean_token_accuracy": 0.9293401914834977, "num_tokens": 3315703478.0, "step": 42550 }, { "entropy": 0.20351918905973435, "epoch": 1.6964001274291176, "grad_norm": 3.7353572845458984, "learning_rate": 1.184732779746619e-05, "loss": 0.20555198669433594, "mean_token_accuracy": 0.9311838829517365, "num_tokens": 3319556817.0, "step": 42600 }, { "entropy": 0.21710732728242874, "epoch": 1.698391207390889, "grad_norm": 2.4422550201416016, "learning_rate": 1.1695554717355172e-05, "loss": 0.21829830169677733, "mean_token_accuracy": 0.9286286699771881, "num_tokens": 3323630231.0, "step": 42650 }, { "entropy": 0.20919491305947305, "epoch": 1.7003822873526602, "grad_norm": 6.628872871398926, "learning_rate": 1.1544699675695025e-05, "loss": 0.20743906021118164, "mean_token_accuracy": 0.9308319443464279, "num_tokens": 3327433458.0, "step": 42700 }, { "entropy": 0.2133838464319706, "epoch": 1.7023733673144315, "grad_norm": 2.618858814239502, "learning_rate": 1.13947642408182e-05, "loss": 0.21412492752075196, "mean_token_accuracy": 0.9283889561891556, "num_tokens": 3331158681.0, "step": 42750 }, { "entropy": 0.20949604049324988, "epoch": 1.7043644472762027, "grad_norm": 0.9396565556526184, "learning_rate": 1.1245749971496645e-05, "loss": 0.21225997924804688, "mean_token_accuracy": 0.9299770307540893, "num_tokens": 3335081969.0, "step": 42800 }, { "entropy": 0.21171203643083572, "epoch": 1.706355527237974, "grad_norm": 1.2607985734939575, "learning_rate": 1.1097658416925616e-05, "loss": 0.20964282989501953, "mean_token_accuracy": 0.929639783501625, "num_tokens": 3338842508.0, "step": 42850 }, { "entropy": 0.21066647991538048, "epoch": 1.7083466071997453, "grad_norm": 1.8953777551651, "learning_rate": 1.095049111670764e-05, "loss": 0.2089408493041992, "mean_token_accuracy": 0.9304516243934632, "num_tokens": 3342667327.0, "step": 42900 }, { "entropy": 0.20289117962121964, "epoch": 1.7103376871615164, "grad_norm": 1.4316964149475098, "learning_rate": 1.0804249600836302e-05, "loss": 0.20412372589111327, "mean_token_accuracy": 0.9313151943683624, "num_tokens": 3346511164.0, "step": 42950 }, { "entropy": 0.21303703948855401, "epoch": 1.7123287671232876, "grad_norm": 3.427518844604492, "learning_rate": 1.0658935389680558e-05, "loss": 0.20701854705810546, "mean_token_accuracy": 0.9287211322784423, "num_tokens": 3350321196.0, "step": 43000 }, { "entropy": 0.21614415727555752, "epoch": 1.714319847085059, "grad_norm": 1.8059314489364624, "learning_rate": 1.0514549993968793e-05, "loss": 0.2118132972717285, "mean_token_accuracy": 0.9284475427865982, "num_tokens": 3354110443.0, "step": 43050 }, { "entropy": 0.21574504926800728, "epoch": 1.7163109270468302, "grad_norm": 1.618677020072937, "learning_rate": 1.0371094914773194e-05, "loss": 0.21516273498535157, "mean_token_accuracy": 0.928774631023407, "num_tokens": 3358010083.0, "step": 43100 }, { "entropy": 0.20823818922042847, "epoch": 1.7183020070086015, "grad_norm": 1.8982270956039429, "learning_rate": 1.0228571643494089e-05, "loss": 0.20659427642822265, "mean_token_accuracy": 0.9304153192043304, "num_tokens": 3361793567.0, "step": 43150 }, { "entropy": 0.20770151138305665, "epoch": 1.7202930869703728, "grad_norm": 23.347454071044922, "learning_rate": 1.0086981661844408e-05, "loss": 0.20477155685424805, "mean_token_accuracy": 0.9307419693470002, "num_tokens": 3365725960.0, "step": 43200 }, { "entropy": 0.21326481088995933, "epoch": 1.722284166932144, "grad_norm": 17.471525192260742, "learning_rate": 9.946326441834453e-06, "loss": 0.20951253890991212, "mean_token_accuracy": 0.9291504013538361, "num_tokens": 3369568841.0, "step": 43250 }, { "entropy": 0.21126571625471116, "epoch": 1.7242752468939153, "grad_norm": 1.2022254467010498, "learning_rate": 9.806607445756399e-06, "loss": 0.21334413528442384, "mean_token_accuracy": 0.9292098581790924, "num_tokens": 3373491379.0, "step": 43300 }, { "entropy": 0.2141697633266449, "epoch": 1.7262663268556864, "grad_norm": 2.5144846439361572, "learning_rate": 9.667826126169154e-06, "loss": 0.2119060516357422, "mean_token_accuracy": 0.9293478113412857, "num_tokens": 3377378314.0, "step": 43350 }, { "entropy": 0.20566872745752335, "epoch": 1.7282574068174577, "grad_norm": 11.5548677444458, "learning_rate": 9.52998392588329e-06, "loss": 0.20603267669677736, "mean_token_accuracy": 0.9311341369152069, "num_tokens": 3381359306.0, "step": 43400 }, { "entropy": 0.20955051869153976, "epoch": 1.730248486779229, "grad_norm": 0.9183319211006165, "learning_rate": 9.393082277946075e-06, "loss": 0.2130196762084961, "mean_token_accuracy": 0.9288085114955902, "num_tokens": 3385082710.0, "step": 43450 }, { "entropy": 0.2085769698023796, "epoch": 1.7322395667410002, "grad_norm": 73.6777572631836, "learning_rate": 9.257122605626433e-06, "loss": 0.2063262367248535, "mean_token_accuracy": 0.930268183350563, "num_tokens": 3389013368.0, "step": 43500 }, { "epoch": 1.7322395667410002, "eval_entropy": 0.20851521726165498, "eval_loss": 0.21822857856750488, "eval_mean_token_accuracy": 0.9255683289633857, "eval_num_tokens": 3389013368.0, "eval_runtime": 98.7957, "eval_samples_per_second": 10.122, "eval_steps_per_second": 0.638, "step": 43500 }, { "entropy": 0.2073688104748726, "epoch": 1.7342306467027715, "grad_norm": 0.8740753531455994, "learning_rate": 9.122106322400315e-06, "loss": 0.20818450927734375, "mean_token_accuracy": 0.9306763833761216, "num_tokens": 3392916416.0, "step": 43550 }, { "entropy": 0.20800496503710747, "epoch": 1.7362217266645428, "grad_norm": 3.2264981269836426, "learning_rate": 8.988034831935843e-06, "loss": 0.20605121612548827, "mean_token_accuracy": 0.9305061846971512, "num_tokens": 3396765916.0, "step": 43600 }, { "entropy": 0.21000043153762818, "epoch": 1.738212806626314, "grad_norm": 1.0980819463729858, "learning_rate": 8.854909528078903e-06, "loss": 0.2113180923461914, "mean_token_accuracy": 0.9291634374856949, "num_tokens": 3400647162.0, "step": 43650 }, { "entropy": 0.20911528274416924, "epoch": 1.7402038865880853, "grad_norm": 6.803044319152832, "learning_rate": 8.722731794838513e-06, "loss": 0.2107940673828125, "mean_token_accuracy": 0.9301030486822128, "num_tokens": 3404614062.0, "step": 43700 }, { "entropy": 0.20988879695534707, "epoch": 1.7421949665498566, "grad_norm": 1.7961214780807495, "learning_rate": 8.591503006372426e-06, "loss": 0.20849388122558593, "mean_token_accuracy": 0.9299481153488159, "num_tokens": 3408435982.0, "step": 43750 }, { "entropy": 0.2071615570783615, "epoch": 1.744186046511628, "grad_norm": 3.4115519523620605, "learning_rate": 8.46122452697291e-06, "loss": 0.20572685241699218, "mean_token_accuracy": 0.9306599938869476, "num_tokens": 3412386645.0, "step": 43800 }, { "entropy": 0.20959770992398263, "epoch": 1.7461771264733992, "grad_norm": 0.7829149961471558, "learning_rate": 8.33189771105265e-06, "loss": 0.20827945709228515, "mean_token_accuracy": 0.9304309511184692, "num_tokens": 3416238232.0, "step": 43850 }, { "entropy": 0.2114715176820755, "epoch": 1.7481682064351705, "grad_norm": 1.1714812517166138, "learning_rate": 8.203523903130406e-06, "loss": 0.21069385528564452, "mean_token_accuracy": 0.9288992536067963, "num_tokens": 3420152151.0, "step": 43900 }, { "entropy": 0.20665415987372399, "epoch": 1.7501592863969417, "grad_norm": 5.990740776062012, "learning_rate": 8.07610443781729e-06, "loss": 0.2081171989440918, "mean_token_accuracy": 0.930669231414795, "num_tokens": 3424216197.0, "step": 43950 }, { "entropy": 0.209456440359354, "epoch": 1.752150366358713, "grad_norm": 20.553333282470703, "learning_rate": 7.949640639802757e-06, "loss": 0.20741764068603516, "mean_token_accuracy": 0.9296394234895706, "num_tokens": 3428132649.0, "step": 44000 }, { "entropy": 0.2040299132466316, "epoch": 1.7541414463204843, "grad_norm": 6.445930480957031, "learning_rate": 7.824133823840906e-06, "loss": 0.20229070663452148, "mean_token_accuracy": 0.9324067449569702, "num_tokens": 3431970957.0, "step": 44050 }, { "entropy": 0.21209723398089408, "epoch": 1.7561325262822556, "grad_norm": 1.6934711933135986, "learning_rate": 7.699585294736744e-06, "loss": 0.21100982666015625, "mean_token_accuracy": 0.9297117662429809, "num_tokens": 3435914647.0, "step": 44100 }, { "entropy": 0.21320962592959403, "epoch": 1.7581236062440269, "grad_norm": 1.044862985610962, "learning_rate": 7.575996347332626e-06, "loss": 0.21576282501220703, "mean_token_accuracy": 0.9285241341590882, "num_tokens": 3439805283.0, "step": 44150 }, { "entropy": 0.2151702319085598, "epoch": 1.7601146862057981, "grad_norm": 15.684170722961426, "learning_rate": 7.453368266494876e-06, "loss": 0.2126181411743164, "mean_token_accuracy": 0.9285902082920074, "num_tokens": 3443870181.0, "step": 44200 }, { "entropy": 0.2085086138546467, "epoch": 1.7621057661675694, "grad_norm": 0.8928887844085693, "learning_rate": 7.331702327100376e-06, "loss": 0.20794538497924805, "mean_token_accuracy": 0.9304049378633499, "num_tokens": 3447760675.0, "step": 44250 }, { "entropy": 0.21238367155194282, "epoch": 1.7640968461293407, "grad_norm": 0.8010930418968201, "learning_rate": 7.210999794023232e-06, "loss": 0.2140846633911133, "mean_token_accuracy": 0.9294155049324035, "num_tokens": 3451731264.0, "step": 44300 }, { "entropy": 0.20554652333259582, "epoch": 1.766087926091112, "grad_norm": 53.679508209228516, "learning_rate": 7.091261922121761e-06, "loss": 0.20279741287231445, "mean_token_accuracy": 0.9304215121269226, "num_tokens": 3455753973.0, "step": 44350 }, { "entropy": 0.2106124371290207, "epoch": 1.768079006052883, "grad_norm": 6.591165542602539, "learning_rate": 6.972489956225381e-06, "loss": 0.2088141632080078, "mean_token_accuracy": 0.9303308349847793, "num_tokens": 3459535337.0, "step": 44400 }, { "entropy": 0.20883979350328447, "epoch": 1.7700700860146543, "grad_norm": 18.591882705688477, "learning_rate": 6.854685131121663e-06, "loss": 0.20666999816894532, "mean_token_accuracy": 0.9313195276260376, "num_tokens": 3463470882.0, "step": 44450 }, { "entropy": 0.20805159598588943, "epoch": 1.7720611659764256, "grad_norm": 8.411771774291992, "learning_rate": 6.7378486715435226e-06, "loss": 0.20834875106811523, "mean_token_accuracy": 0.9310674071311951, "num_tokens": 3467382434.0, "step": 44500 }, { "entropy": 0.20722934901714324, "epoch": 1.7740522459381969, "grad_norm": 2.585312604904175, "learning_rate": 6.621981792156385e-06, "loss": 0.20870906829833985, "mean_token_accuracy": 0.9306829625368118, "num_tokens": 3471390056.0, "step": 44550 }, { "entropy": 0.20751627907156944, "epoch": 1.7760433258999682, "grad_norm": 3.3848342895507812, "learning_rate": 6.507085697545778e-06, "loss": 0.20677597045898438, "mean_token_accuracy": 0.9305989545583725, "num_tokens": 3475472414.0, "step": 44600 }, { "entropy": 0.21149674832820892, "epoch": 1.7780344058617394, "grad_norm": 2.8175301551818848, "learning_rate": 6.393161582204588e-06, "loss": 0.21632415771484376, "mean_token_accuracy": 0.9287760710716247, "num_tokens": 3479447899.0, "step": 44650 }, { "entropy": 0.20839301392436027, "epoch": 1.7800254858235107, "grad_norm": 0.7601056098937988, "learning_rate": 6.2802106305207e-06, "loss": 0.2067262077331543, "mean_token_accuracy": 0.9304411447048188, "num_tokens": 3483376906.0, "step": 44700 }, { "entropy": 0.21109894961118697, "epoch": 1.7820165657852818, "grad_norm": 0.9799630641937256, "learning_rate": 6.1682340167647516e-06, "loss": 0.21058021545410155, "mean_token_accuracy": 0.9301919043064117, "num_tokens": 3487224795.0, "step": 44750 }, { "entropy": 0.20875480249524117, "epoch": 1.784007645747053, "grad_norm": 96.13130187988281, "learning_rate": 6.057232905077914e-06, "loss": 0.20701271057128906, "mean_token_accuracy": 0.9302035439014434, "num_tokens": 3490949200.0, "step": 44800 }, { "entropy": 0.20825668588280677, "epoch": 1.7859987257088243, "grad_norm": 2.4636387825012207, "learning_rate": 5.947208449459685e-06, "loss": 0.20573083877563478, "mean_token_accuracy": 0.9306117433309555, "num_tokens": 3495007448.0, "step": 44850 }, { "entropy": 0.21141499862074853, "epoch": 1.7879898056705956, "grad_norm": 0.6885759234428406, "learning_rate": 5.838161793756014e-06, "loss": 0.2095553207397461, "mean_token_accuracy": 0.9298090773820877, "num_tokens": 3498907935.0, "step": 44900 }, { "entropy": 0.2129495669901371, "epoch": 1.789980885632367, "grad_norm": 0.7798480987548828, "learning_rate": 5.7300940716473405e-06, "loss": 0.21014495849609374, "mean_token_accuracy": 0.9300975173711776, "num_tokens": 3502670704.0, "step": 44950 }, { "entropy": 0.21165331333875656, "epoch": 1.7919719655941382, "grad_norm": 1.102869987487793, "learning_rate": 5.623006406636843e-06, "loss": 0.2064545440673828, "mean_token_accuracy": 0.9297413504123688, "num_tokens": 3506472079.0, "step": 45000 }, { "epoch": 1.7919719655941382, "eval_entropy": 0.20767719807132842, "eval_loss": 0.21640749275684357, "eval_mean_token_accuracy": 0.9258228899940611, "eval_num_tokens": 3506472079.0, "eval_runtime": 98.1901, "eval_samples_per_second": 10.184, "eval_steps_per_second": 0.642, "step": 45000 }, { "entropy": 0.20470431208610534, "epoch": 1.7939630455559095, "grad_norm": 59.79706954956055, "learning_rate": 5.516899912038742e-06, "loss": 0.20203092575073242, "mean_token_accuracy": 0.9314306324720383, "num_tokens": 3510430565.0, "step": 45050 }, { "entropy": 0.21255202189087868, "epoch": 1.7959541255176807, "grad_norm": 2.5185296535491943, "learning_rate": 5.41177569096667e-06, "loss": 0.21200386047363282, "mean_token_accuracy": 0.9287832349538803, "num_tokens": 3514394913.0, "step": 45100 }, { "entropy": 0.2104589892923832, "epoch": 1.797945205479452, "grad_norm": 0.7058978080749512, "learning_rate": 5.307634836322384e-06, "loss": 0.2101261329650879, "mean_token_accuracy": 0.9302563655376435, "num_tokens": 3518315848.0, "step": 45150 }, { "entropy": 0.20902628675103188, "epoch": 1.7999362854412233, "grad_norm": 3.984861135482788, "learning_rate": 5.204478430784176e-06, "loss": 0.20765369415283202, "mean_token_accuracy": 0.9305371862649917, "num_tokens": 3522202111.0, "step": 45200 }, { "entropy": 0.2147587051987648, "epoch": 1.8019273654029946, "grad_norm": 0.5527628660202026, "learning_rate": 5.102307546795737e-06, "loss": 0.21070705413818358, "mean_token_accuracy": 0.9285232800245286, "num_tokens": 3526104312.0, "step": 45250 }, { "entropy": 0.21127821996808052, "epoch": 1.8039184453647659, "grad_norm": 0.8246101140975952, "learning_rate": 5.00112324655504e-06, "loss": 0.20989871978759767, "mean_token_accuracy": 0.929241014122963, "num_tokens": 3529962044.0, "step": 45300 }, { "entropy": 0.20899385526776315, "epoch": 1.8059095253265371, "grad_norm": 0.49908512830734253, "learning_rate": 4.900926582003196e-06, "loss": 0.2079372787475586, "mean_token_accuracy": 0.9290895968675613, "num_tokens": 3533872881.0, "step": 45350 }, { "entropy": 0.2041157440841198, "epoch": 1.8079006052883084, "grad_norm": 58.90666198730469, "learning_rate": 4.801718594813598e-06, "loss": 0.20337408065795898, "mean_token_accuracy": 0.9310873591899872, "num_tokens": 3537766572.0, "step": 45400 }, { "entropy": 0.2129148316383362, "epoch": 1.8098916852500797, "grad_norm": 3.738131046295166, "learning_rate": 4.703500316381082e-06, "loss": 0.2082274627685547, "mean_token_accuracy": 0.9294615036249161, "num_tokens": 3541632871.0, "step": 45450 }, { "entropy": 0.20847861975431442, "epoch": 1.811882765211851, "grad_norm": 1.109789490699768, "learning_rate": 4.606272767811115e-06, "loss": 0.20543277740478516, "mean_token_accuracy": 0.9305390655994416, "num_tokens": 3545534405.0, "step": 45500 }, { "entropy": 0.2059105433523655, "epoch": 1.8138738451736223, "grad_norm": 0.9735215902328491, "learning_rate": 4.510036959909347e-06, "loss": 0.20821889877319336, "mean_token_accuracy": 0.9318612819910049, "num_tokens": 3549408355.0, "step": 45550 }, { "entropy": 0.20953644335269928, "epoch": 1.8158649251353935, "grad_norm": 13.94512939453125, "learning_rate": 4.414793893170943e-06, "loss": 0.21036842346191406, "mean_token_accuracy": 0.9298856401443482, "num_tokens": 3553166674.0, "step": 45600 }, { "entropy": 0.2068518304824829, "epoch": 1.8178560050971648, "grad_norm": 4.7155632972717285, "learning_rate": 4.320544557770267e-06, "loss": 0.2043770408630371, "mean_token_accuracy": 0.9310851716995239, "num_tokens": 3557126079.0, "step": 45650 }, { "entropy": 0.21182461187243462, "epoch": 1.819847085058936, "grad_norm": 2.7940444946289062, "learning_rate": 4.2272899335505265e-06, "loss": 0.210545654296875, "mean_token_accuracy": 0.9293639028072357, "num_tokens": 3561059632.0, "step": 45700 }, { "entropy": 0.20587970972061156, "epoch": 1.8218381650207074, "grad_norm": 0.5957472324371338, "learning_rate": 4.135030990013711e-06, "loss": 0.20679553985595703, "mean_token_accuracy": 0.9308193498849868, "num_tokens": 3564821358.0, "step": 45750 }, { "entropy": 0.20069470301270484, "epoch": 1.8238292449824784, "grad_norm": 1.8275463581085205, "learning_rate": 4.0437686863103455e-06, "loss": 0.198288516998291, "mean_token_accuracy": 0.9327347731590271, "num_tokens": 3568773612.0, "step": 45800 }, { "entropy": 0.207653941065073, "epoch": 1.8258203249442497, "grad_norm": 16.50977897644043, "learning_rate": 3.953503971229622e-06, "loss": 0.2065102005004883, "mean_token_accuracy": 0.9299451869726181, "num_tokens": 3572667298.0, "step": 45850 }, { "entropy": 0.20317922204732894, "epoch": 1.827811404906021, "grad_norm": 0.9150100350379944, "learning_rate": 3.8642377831895394e-06, "loss": 0.20408899307250977, "mean_token_accuracy": 0.9323972845077515, "num_tokens": 3576632810.0, "step": 45900 }, { "entropy": 0.20271479919552804, "epoch": 1.8298024848677923, "grad_norm": 0.8775530457496643, "learning_rate": 3.7759710502271007e-06, "loss": 0.20193222045898437, "mean_token_accuracy": 0.932313597202301, "num_tokens": 3580570503.0, "step": 45950 }, { "entropy": 0.20898037731647492, "epoch": 1.8317935648295636, "grad_norm": 1.5123686790466309, "learning_rate": 3.688704689988687e-06, "loss": 0.20746551513671874, "mean_token_accuracy": 0.9301503264904022, "num_tokens": 3584290381.0, "step": 46000 }, { "entropy": 0.20438008531928062, "epoch": 1.8337846447913349, "grad_norm": 1.9140816926956177, "learning_rate": 3.602439609720487e-06, "loss": 0.20290145874023438, "mean_token_accuracy": 0.9307840871810913, "num_tokens": 3588239293.0, "step": 46050 }, { "entropy": 0.20243030577898025, "epoch": 1.8357757247531061, "grad_norm": 1.6704521179199219, "learning_rate": 3.517176706259173e-06, "loss": 0.20418481826782225, "mean_token_accuracy": 0.9315272670984268, "num_tokens": 3592083917.0, "step": 46100 }, { "entropy": 0.21051367938518525, "epoch": 1.8377668047148772, "grad_norm": 10.357985496520996, "learning_rate": 3.4329168660224288e-06, "loss": 0.21083585739135743, "mean_token_accuracy": 0.9296258103847503, "num_tokens": 3595926812.0, "step": 46150 }, { "entropy": 0.2138805329799652, "epoch": 1.8397578846766485, "grad_norm": 49.06830596923828, "learning_rate": 3.3496609649998345e-06, "loss": 0.21048126220703126, "mean_token_accuracy": 0.9295951730012894, "num_tokens": 3599861416.0, "step": 46200 }, { "entropy": 0.21018945664167404, "epoch": 1.8417489646384197, "grad_norm": 1.570406436920166, "learning_rate": 3.2674098687436984e-06, "loss": 0.2073902130126953, "mean_token_accuracy": 0.9296689444780349, "num_tokens": 3603701996.0, "step": 46250 }, { "entropy": 0.21012910723686218, "epoch": 1.843740044600191, "grad_norm": 2.4205453395843506, "learning_rate": 3.186164432360128e-06, "loss": 0.2063848876953125, "mean_token_accuracy": 0.9299239891767502, "num_tokens": 3607681405.0, "step": 46300 }, { "entropy": 0.20703335404396056, "epoch": 1.8457311245619623, "grad_norm": 1.4932438135147095, "learning_rate": 3.1059255005000954e-06, "loss": 0.20379390716552734, "mean_token_accuracy": 0.9307261490821839, "num_tokens": 3611673251.0, "step": 46350 }, { "entropy": 0.21025602117180825, "epoch": 1.8477222045237336, "grad_norm": 13.070518493652344, "learning_rate": 3.0266939073506418e-06, "loss": 0.21065128326416016, "mean_token_accuracy": 0.9293994671106338, "num_tokens": 3615446363.0, "step": 46400 }, { "entropy": 0.21034426152706145, "epoch": 1.8497132844855049, "grad_norm": 1.4634066820144653, "learning_rate": 2.9484704766261973e-06, "loss": 0.2110739517211914, "mean_token_accuracy": 0.930075461268425, "num_tokens": 3619263825.0, "step": 46450 }, { "entropy": 0.21479475244879723, "epoch": 1.8517043644472762, "grad_norm": 1.4576468467712402, "learning_rate": 2.8712560215601314e-06, "loss": 0.21280271530151368, "mean_token_accuracy": 0.928877608180046, "num_tokens": 3623131519.0, "step": 46500 }, { "epoch": 1.8517043644472762, "eval_entropy": 0.20671257494934023, "eval_loss": 0.21556128561496735, "eval_mean_token_accuracy": 0.9257090545835949, "eval_num_tokens": 3623131519.0, "eval_runtime": 98.1917, "eval_samples_per_second": 10.184, "eval_steps_per_second": 0.642, "step": 46500 }, { "entropy": 0.2045709379017353, "epoch": 1.8536954444090474, "grad_norm": 0.93439120054245, "learning_rate": 2.7950513448961603e-06, "loss": 0.2093747329711914, "mean_token_accuracy": 0.9314322662353516, "num_tokens": 3626926506.0, "step": 46550 }, { "entropy": 0.20439017698168754, "epoch": 1.8556865243708187, "grad_norm": 1.1999908685684204, "learning_rate": 2.7198572388800305e-06, "loss": 0.20209259033203125, "mean_token_accuracy": 0.9320348417758941, "num_tokens": 3630707819.0, "step": 46600 }, { "entropy": 0.21055062592029572, "epoch": 1.85767760433259, "grad_norm": 2.1831114292144775, "learning_rate": 2.645674485251326e-06, "loss": 0.20812604904174806, "mean_token_accuracy": 0.9298756116628647, "num_tokens": 3634652608.0, "step": 46650 }, { "entropy": 0.20818702280521392, "epoch": 1.8596686842943613, "grad_norm": 4.211587429046631, "learning_rate": 2.572503855235342e-06, "loss": 0.21088375091552736, "mean_token_accuracy": 0.9295736873149871, "num_tokens": 3638476600.0, "step": 46700 }, { "entropy": 0.20586246758699417, "epoch": 1.8616597642561326, "grad_norm": 2.066452980041504, "learning_rate": 2.500346109535012e-06, "loss": 0.2036473846435547, "mean_token_accuracy": 0.9310190284252167, "num_tokens": 3642389549.0, "step": 46750 }, { "entropy": 0.21279745489358903, "epoch": 1.8636508442179038, "grad_norm": 3.4920811653137207, "learning_rate": 2.4292019983230607e-06, "loss": 0.2081696319580078, "mean_token_accuracy": 0.9292943155765534, "num_tokens": 3646393721.0, "step": 46800 }, { "entropy": 0.21361444383859635, "epoch": 1.8656419241796751, "grad_norm": 18.080303192138672, "learning_rate": 2.359072261234152e-06, "loss": 0.21170433044433593, "mean_token_accuracy": 0.9282393491268158, "num_tokens": 3650136601.0, "step": 46850 }, { "entropy": 0.20671701848506926, "epoch": 1.8676330041414464, "grad_norm": 2.1680543422698975, "learning_rate": 2.289957627357231e-06, "loss": 0.20514652252197266, "mean_token_accuracy": 0.9300593328475952, "num_tokens": 3654008883.0, "step": 46900 }, { "entropy": 0.20612944304943084, "epoch": 1.8696240841032177, "grad_norm": 3.544213056564331, "learning_rate": 2.221858815227973e-06, "loss": 0.20879905700683593, "mean_token_accuracy": 0.9298162144422532, "num_tokens": 3657878785.0, "step": 46950 }, { "entropy": 0.20561033993959427, "epoch": 1.871615164064989, "grad_norm": 17.90035629272461, "learning_rate": 2.15477653282119e-06, "loss": 0.20452678680419922, "mean_token_accuracy": 0.9309412103891372, "num_tokens": 3661838269.0, "step": 47000 }, { "entropy": 0.20409692838788032, "epoch": 1.8736062440267602, "grad_norm": 63.73369598388672, "learning_rate": 2.088711477543659e-06, "loss": 0.2018229103088379, "mean_token_accuracy": 0.9308506631851197, "num_tokens": 3665698438.0, "step": 47050 }, { "entropy": 0.2098672604560852, "epoch": 1.8755973239885315, "grad_norm": 1.7252836227416992, "learning_rate": 2.023664336226716e-06, "loss": 0.20646530151367187, "mean_token_accuracy": 0.9303743714094161, "num_tokens": 3669603184.0, "step": 47100 }, { "entropy": 0.21036667585372926, "epoch": 1.8775884039503028, "grad_norm": 0.7469420433044434, "learning_rate": 1.9596357851191737e-06, "loss": 0.2089185333251953, "mean_token_accuracy": 0.9294323736429214, "num_tokens": 3673458486.0, "step": 47150 }, { "entropy": 0.2143134069442749, "epoch": 1.8795794839120739, "grad_norm": 4.1622467041015625, "learning_rate": 1.8966264898802932e-06, "loss": 0.2129537582397461, "mean_token_accuracy": 0.9273243010044098, "num_tokens": 3677379228.0, "step": 47200 }, { "entropy": 0.20456415072083473, "epoch": 1.8815705638738451, "grad_norm": 0.871599018573761, "learning_rate": 1.8346371055728672e-06, "loss": 0.2008742332458496, "mean_token_accuracy": 0.9321694928407669, "num_tokens": 3681325572.0, "step": 47250 }, { "entropy": 0.20833082988858223, "epoch": 1.8835616438356164, "grad_norm": 1.9216362237930298, "learning_rate": 1.7736682766563817e-06, "loss": 0.2087716865539551, "mean_token_accuracy": 0.9310186111927032, "num_tokens": 3685280505.0, "step": 47300 }, { "entropy": 0.20786230847239495, "epoch": 1.8855527237973877, "grad_norm": 0.5801077485084534, "learning_rate": 1.713720636980365e-06, "loss": 0.20443031311035156, "mean_token_accuracy": 0.9308688986301422, "num_tokens": 3689082889.0, "step": 47350 }, { "entropy": 0.21038655385375024, "epoch": 1.887543803759159, "grad_norm": 25.913808822631836, "learning_rate": 1.6547948097777155e-06, "loss": 0.20781410217285157, "mean_token_accuracy": 0.929584339261055, "num_tokens": 3693020179.0, "step": 47400 }, { "entropy": 0.20780225247144699, "epoch": 1.8895348837209303, "grad_norm": 1.085632085800171, "learning_rate": 1.5968914076583296e-06, "loss": 0.20219169616699217, "mean_token_accuracy": 0.9305776798725128, "num_tokens": 3696782672.0, "step": 47450 }, { "entropy": 0.2080184116959572, "epoch": 1.8915259636827015, "grad_norm": 2.220388650894165, "learning_rate": 1.5400110326026617e-06, "loss": 0.20734561920166017, "mean_token_accuracy": 0.9301981914043427, "num_tokens": 3700838688.0, "step": 47500 }, { "entropy": 0.21338329300284387, "epoch": 1.8935170436444726, "grad_norm": 4.149438381195068, "learning_rate": 1.4841542759554626e-06, "loss": 0.21353832244873047, "mean_token_accuracy": 0.9283533388376236, "num_tokens": 3704590951.0, "step": 47550 }, { "entropy": 0.21080107524991035, "epoch": 1.8955081236062439, "grad_norm": 23.682764053344727, "learning_rate": 1.429321718419674e-06, "loss": 0.2076173782348633, "mean_token_accuracy": 0.9303930050134659, "num_tokens": 3708629326.0, "step": 47600 }, { "entropy": 0.20033822111785413, "epoch": 1.8974992035680152, "grad_norm": 2.2728614807128906, "learning_rate": 1.3755139300503427e-06, "loss": 0.20009140014648438, "mean_token_accuracy": 0.9331355339288712, "num_tokens": 3712486088.0, "step": 47650 }, { "entropy": 0.20737343326210975, "epoch": 1.8994902835297864, "grad_norm": 5.053152561187744, "learning_rate": 1.3227314702487504e-06, "loss": 0.20637876510620118, "mean_token_accuracy": 0.9308607363700867, "num_tokens": 3716283064.0, "step": 47700 }, { "entropy": 0.2088836833834648, "epoch": 1.9014813634915577, "grad_norm": 0.7800954580307007, "learning_rate": 1.2709748877565597e-06, "loss": 0.20897350311279297, "mean_token_accuracy": 0.9295745211839676, "num_tokens": 3720089023.0, "step": 47750 }, { "entropy": 0.20781102195382117, "epoch": 1.903472443453329, "grad_norm": 6.860362529754639, "learning_rate": 1.2202447206500988e-06, "loss": 0.20449775695800781, "mean_token_accuracy": 0.9301507288217544, "num_tokens": 3723806031.0, "step": 47800 }, { "entropy": 0.21246332317590713, "epoch": 1.9054635234151003, "grad_norm": 0.762394368648529, "learning_rate": 1.1705414963348093e-06, "loss": 0.21171236038208008, "mean_token_accuracy": 0.9293036895990372, "num_tokens": 3727598397.0, "step": 47850 }, { "entropy": 0.20728234931826592, "epoch": 1.9074546033768716, "grad_norm": 0.8638309240341187, "learning_rate": 1.1218657315397284e-06, "loss": 0.2101401710510254, "mean_token_accuracy": 0.9301428550481796, "num_tokens": 3731653061.0, "step": 47900 }, { "entropy": 0.20614495024085044, "epoch": 1.9094456833386428, "grad_norm": 37.10430908203125, "learning_rate": 1.0742179323121048e-06, "loss": 0.20347900390625, "mean_token_accuracy": 0.9306625306606293, "num_tokens": 3735395635.0, "step": 47950 }, { "entropy": 0.20366091713309287, "epoch": 1.9114367633004141, "grad_norm": 1.1358367204666138, "learning_rate": 1.0275985940122245e-06, "loss": 0.20321054458618165, "mean_token_accuracy": 0.9320428788661956, "num_tokens": 3739487498.0, "step": 48000 }, { "epoch": 1.9114367633004141, "eval_entropy": 0.20564406140456123, "eval_loss": 0.21469460427761078, "eval_mean_token_accuracy": 0.9262936096342783, "eval_num_tokens": 3739487498.0, "eval_runtime": 97.8916, "eval_samples_per_second": 10.215, "eval_steps_per_second": 0.644, "step": 48000 }, { "entropy": 0.2046898439526558, "epoch": 1.9134278432621854, "grad_norm": 2.3159406185150146, "learning_rate": 9.820082013081267e-07, "loss": 0.20289798736572265, "mean_token_accuracy": 0.9317283999919891, "num_tokens": 3743289077.0, "step": 48050 }, { "entropy": 0.2038572260737419, "epoch": 1.9154189232239567, "grad_norm": 34.183570861816406, "learning_rate": 9.374472281706848e-07, "loss": 0.2002842330932617, "mean_token_accuracy": 0.9313328862190247, "num_tokens": 3747227416.0, "step": 48100 }, { "entropy": 0.20457203462719917, "epoch": 1.917410003185728, "grad_norm": 0.7753530740737915, "learning_rate": 8.939161378686001e-07, "loss": 0.20426761627197265, "mean_token_accuracy": 0.9307034468650818, "num_tokens": 3751042675.0, "step": 48150 }, { "entropy": 0.21071830078959464, "epoch": 1.9194010831474992, "grad_norm": 3.788648843765259, "learning_rate": 8.514153829636385e-07, "loss": 0.21027889251708984, "mean_token_accuracy": 0.9291975992918015, "num_tokens": 3755042100.0, "step": 48200 }, { "entropy": 0.2066432397067547, "epoch": 1.9213921631092705, "grad_norm": 1.2828806638717651, "learning_rate": 8.099454053058786e-07, "loss": 0.20229366302490234, "mean_token_accuracy": 0.9315379053354264, "num_tokens": 3758965564.0, "step": 48250 }, { "entropy": 0.20838844984769822, "epoch": 1.9233832430710418, "grad_norm": 1.511154294013977, "learning_rate": 7.695066360291824e-07, "loss": 0.20771406173706056, "mean_token_accuracy": 0.9306799596548081, "num_tokens": 3762804386.0, "step": 48300 }, { "entropy": 0.20677204117178916, "epoch": 1.925374323032813, "grad_norm": 2331.79150390625, "learning_rate": 7.300994955465989e-07, "loss": 0.20275856018066407, "mean_token_accuracy": 0.9303908598423004, "num_tokens": 3766566420.0, "step": 48350 }, { "entropy": 0.20770261108875274, "epoch": 1.9273654029945844, "grad_norm": 1.7849552631378174, "learning_rate": 6.917243935461448e-07, "loss": 0.20769720077514647, "mean_token_accuracy": 0.9299451416730881, "num_tokens": 3770266452.0, "step": 48400 }, { "entropy": 0.20397947937250138, "epoch": 1.9293564829563556, "grad_norm": 2.3596925735473633, "learning_rate": 6.543817289864307e-07, "loss": 0.20101829528808593, "mean_token_accuracy": 0.9313901931047439, "num_tokens": 3774158287.0, "step": 48450 }, { "entropy": 0.2011245361715555, "epoch": 1.931347562918127, "grad_norm": 4.982568740844727, "learning_rate": 6.18071890092553e-07, "loss": 0.1985802459716797, "mean_token_accuracy": 0.9325529444217682, "num_tokens": 3778191840.0, "step": 48500 }, { "entropy": 0.20900342330336572, "epoch": 1.9333386428798982, "grad_norm": 32.73358917236328, "learning_rate": 5.827952543520531e-07, "loss": 0.20671030044555663, "mean_token_accuracy": 0.9303619009256363, "num_tokens": 3782038440.0, "step": 48550 }, { "entropy": 0.20034867897629738, "epoch": 1.9353297228416695, "grad_norm": 0.882574737071991, "learning_rate": 5.485521885109978e-07, "loss": 0.19909774780273437, "mean_token_accuracy": 0.9321212899684906, "num_tokens": 3786002509.0, "step": 48600 }, { "entropy": 0.2031031160056591, "epoch": 1.9373208028034405, "grad_norm": 0.915739119052887, "learning_rate": 5.153430485701605e-07, "loss": 0.20162731170654297, "mean_token_accuracy": 0.9324739265441895, "num_tokens": 3790093261.0, "step": 48650 }, { "entropy": 0.2046504382789135, "epoch": 1.9393118827652118, "grad_norm": 0.8648226857185364, "learning_rate": 4.831681797813348e-07, "loss": 0.2067060089111328, "mean_token_accuracy": 0.9310611593723297, "num_tokens": 3793937975.0, "step": 48700 }, { "entropy": 0.20531852021813393, "epoch": 1.941302962726983, "grad_norm": 7.1985297203063965, "learning_rate": 4.520279166437269e-07, "loss": 0.2054092025756836, "mean_token_accuracy": 0.9317763692140579, "num_tokens": 3797910387.0, "step": 48750 }, { "entropy": 0.20719680860638617, "epoch": 1.9432940426887544, "grad_norm": 22.304264068603516, "learning_rate": 4.2192258290048025e-07, "loss": 0.20710372924804688, "mean_token_accuracy": 0.9299324482679368, "num_tokens": 3801898227.0, "step": 48800 }, { "entropy": 0.20797187641263007, "epoch": 1.9452851226505257, "grad_norm": 18.511686325073242, "learning_rate": 3.9285249153531155e-07, "loss": 0.20651954650878906, "mean_token_accuracy": 0.9307465720176696, "num_tokens": 3805909141.0, "step": 48850 }, { "entropy": 0.20582071751356124, "epoch": 1.947276202612297, "grad_norm": 1.2667385339736938, "learning_rate": 3.64817944769269e-07, "loss": 0.20809062957763672, "mean_token_accuracy": 0.9303789657354354, "num_tokens": 3809760421.0, "step": 48900 }, { "entropy": 0.20571558341383933, "epoch": 1.9492672825740682, "grad_norm": 3.226757049560547, "learning_rate": 3.378192340575792e-07, "loss": 0.2017552947998047, "mean_token_accuracy": 0.9309007340669632, "num_tokens": 3813550255.0, "step": 48950 }, { "entropy": 0.20174807600677014, "epoch": 1.9512583625358393, "grad_norm": 25.680898666381836, "learning_rate": 3.118566400866052e-07, "loss": 0.202763614654541, "mean_token_accuracy": 0.93158675968647, "num_tokens": 3817405098.0, "step": 49000 }, { "entropy": 0.20707564577460288, "epoch": 1.9532494424976106, "grad_norm": 3.1009507179260254, "learning_rate": 2.86930432770971e-07, "loss": 0.2066007995605469, "mean_token_accuracy": 0.9312508022785186, "num_tokens": 3821383869.0, "step": 49050 }, { "entropy": 0.2084057731926441, "epoch": 1.9552405224593818, "grad_norm": 0.6516017913818359, "learning_rate": 2.63040871250686e-07, "loss": 0.2070516586303711, "mean_token_accuracy": 0.9299625343084336, "num_tokens": 3825143915.0, "step": 49100 }, { "entropy": 0.21188082933425903, "epoch": 1.9572316024211531, "grad_norm": 1.871128797531128, "learning_rate": 2.4018820388853616e-07, "loss": 0.2084772491455078, "mean_token_accuracy": 0.9292748957872391, "num_tokens": 3829132016.0, "step": 49150 }, { "entropy": 0.21081951320171355, "epoch": 1.9592226823829244, "grad_norm": 1.8061888217926025, "learning_rate": 2.183726682674192e-07, "loss": 0.21075002670288087, "mean_token_accuracy": 0.9300468742847443, "num_tokens": 3833181633.0, "step": 49200 }, { "entropy": 0.20759766191244125, "epoch": 1.9612137623446957, "grad_norm": 1.1670663356781006, "learning_rate": 1.9759449118793572e-07, "loss": 0.207088623046875, "mean_token_accuracy": 0.930818041563034, "num_tokens": 3837176299.0, "step": 49250 }, { "entropy": 0.20684496089816093, "epoch": 1.963204842306467, "grad_norm": 0.7471051216125488, "learning_rate": 1.7785388866599084e-07, "loss": 0.20402929306030274, "mean_token_accuracy": 0.9307003366947174, "num_tokens": 3841191395.0, "step": 49300 }, { "entropy": 0.21133894830942154, "epoch": 1.9651959222682382, "grad_norm": 13.016488075256348, "learning_rate": 1.5915106593058504e-07, "loss": 0.2060970115661621, "mean_token_accuracy": 0.9299823653697967, "num_tokens": 3844941023.0, "step": 49350 }, { "entropy": 0.21003282114863395, "epoch": 1.9671870022300095, "grad_norm": 0.6203821301460266, "learning_rate": 1.4148621742163804e-07, "loss": 0.20873613357543946, "mean_token_accuracy": 0.9288827109336854, "num_tokens": 3848840082.0, "step": 49400 }, { "entropy": 0.20687765166163444, "epoch": 1.9691780821917808, "grad_norm": 5.534557819366455, "learning_rate": 1.248595267880237e-07, "loss": 0.20545137405395508, "mean_token_accuracy": 0.9310005211830139, "num_tokens": 3852805539.0, "step": 49450 }, { "entropy": 0.20607408091425897, "epoch": 1.971169162153552, "grad_norm": 26.854223251342773, "learning_rate": 1.0927116688559392e-07, "loss": 0.20466529846191406, "mean_token_accuracy": 0.9308301746845246, "num_tokens": 3856699416.0, "step": 49500 }, { "epoch": 1.971169162153552, "eval_entropy": 0.20582637699350478, "eval_loss": 0.2147466093301773, "eval_mean_token_accuracy": 0.9266640799386161, "eval_num_tokens": 3856699416.0, "eval_runtime": 98.3223, "eval_samples_per_second": 10.171, "eval_steps_per_second": 0.641, "step": 49500 }, { "entropy": 0.20653628379106523, "epoch": 1.9731602421153234, "grad_norm": 1.1142542362213135, "learning_rate": 9.472129977542432e-08, "loss": 0.2072589111328125, "mean_token_accuracy": 0.9303338515758515, "num_tokens": 3860596992.0, "step": 49550 }, { "entropy": 0.20690153531730174, "epoch": 1.9751513220770947, "grad_norm": 7.65147066116333, "learning_rate": 8.121007672213799e-08, "loss": 0.2086052703857422, "mean_token_accuracy": 0.9305313348770141, "num_tokens": 3864521466.0, "step": 49600 }, { "entropy": 0.20702269583940505, "epoch": 1.977142402038866, "grad_norm": 32.16565704345703, "learning_rate": 6.873763819229551e-08, "loss": 0.2078022003173828, "mean_token_accuracy": 0.93008549451828, "num_tokens": 3868526158.0, "step": 49650 }, { "entropy": 0.21008945062756537, "epoch": 1.9791334820006372, "grad_norm": 9.32603931427002, "learning_rate": 5.730411385296286e-08, "loss": 0.21051559448242188, "mean_token_accuracy": 0.9299064064025879, "num_tokens": 3872432069.0, "step": 49700 }, { "entropy": 0.20985413163900377, "epoch": 1.9811245619624085, "grad_norm": 5.055283069610596, "learning_rate": 4.690962257034581e-08, "loss": 0.2076975631713867, "mean_token_accuracy": 0.929867318868637, "num_tokens": 3876470872.0, "step": 49750 }, { "entropy": 0.20643711417913438, "epoch": 1.9831156419241798, "grad_norm": 26.450632095336914, "learning_rate": 3.755427240857978e-08, "loss": 0.2061263656616211, "mean_token_accuracy": 0.9302699691057206, "num_tokens": 3880458553.0, "step": 49800 }, { "entropy": 0.2079177989065647, "epoch": 1.985106721885951, "grad_norm": 1.292538046836853, "learning_rate": 2.9238160628575207e-08, "loss": 0.2060544204711914, "mean_token_accuracy": 0.9301692873239518, "num_tokens": 3884124520.0, "step": 49850 }, { "entropy": 0.21075452208518983, "epoch": 1.9870978018477223, "grad_norm": 0.7453241944313049, "learning_rate": 2.196137368702944e-08, "loss": 0.2081309127807617, "mean_token_accuracy": 0.930830671787262, "num_tokens": 3888180011.0, "step": 49900 }, { "entropy": 0.21127940952777863, "epoch": 1.9890888818094936, "grad_norm": 1.3387459516525269, "learning_rate": 1.5723987235505277e-08, "loss": 0.21070463180541993, "mean_token_accuracy": 0.9282910376787186, "num_tokens": 3892182274.0, "step": 49950 }, { "entropy": 0.20441270008683204, "epoch": 1.991079961771265, "grad_norm": 4.187839031219482, "learning_rate": 1.0526066119675992e-08, "loss": 0.2010428237915039, "mean_token_accuracy": 0.9325181847810745, "num_tokens": 3896204467.0, "step": 50000 }, { "entropy": 0.20435837164521217, "epoch": 1.993071041733036, "grad_norm": 1.1942611932754517, "learning_rate": 6.367664378625904e-09, "loss": 0.2057977294921875, "mean_token_accuracy": 0.931745657324791, "num_tokens": 3900102828.0, "step": 50050 }, { "entropy": 0.2092647895216942, "epoch": 1.9950621216948072, "grad_norm": 0.8024593591690063, "learning_rate": 3.2488252443063636e-09, "loss": 0.20857706069946289, "mean_token_accuracy": 0.9304239410161972, "num_tokens": 3904170822.0, "step": 50100 }, { "entropy": 0.21017679318785668, "epoch": 1.9970532016565785, "grad_norm": 43.912872314453125, "learning_rate": 1.1695811410472602e-09, "loss": 0.20722965240478516, "mean_token_accuracy": 0.929292955994606, "num_tokens": 3908122364.0, "step": 50150 }, { "entropy": 0.20791637182235717, "epoch": 1.9990442816183498, "grad_norm": 2.973179817199707, "learning_rate": 1.2995368529056252e-10, "loss": 0.20523807525634766, "mean_token_accuracy": 0.9306921732425689, "num_tokens": 3911893024.0, "step": 50200 }, { "epoch": 2.0, "eval_entropy": 0.20587446363199324, "eval_loss": 0.21491390466690063, "eval_mean_token_accuracy": 0.9264521419055878, "eval_num_tokens": 3913614351.0, "eval_runtime": 97.9895, "eval_samples_per_second": 10.205, "eval_steps_per_second": 0.643, "step": 50224 } ], "logging_steps": 50, "max_steps": 50224, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 2500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.1421745685818801e+21, "train_batch_size": 4, "trial_name": null, "trial_params": null }