refqa / trainer_state.json
taejoon89's picture
RefQA Gemma-3-27B LoRA adapter (v0.7) — clean release
cdac5f8 verified
Raw History Blame Contribute Delete
321 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 1500,
"global_step": 50224,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.3379378823935986,
"epoch": 0.001991079961771265,
"grad_norm": 2.79451847076416,
"learning_rate": 6.5029860650298604e-06,
"loss": 1.7820364379882812,
"mean_token_accuracy": 0.7173230850696564,
"num_tokens": 3818304.0,
"step": 50
},
{
"entropy": 0.6726230216026307,
"epoch": 0.00398215992354253,
"grad_norm": 1.2477459907531738,
"learning_rate": 1.3138686131386862e-05,
"loss": 0.666585693359375,
"mean_token_accuracy": 0.828263390660286,
"num_tokens": 7722811.0,
"step": 100
},
{
"entropy": 0.3462180678546429,
"epoch": 0.0059732398853137945,
"grad_norm": 1.1506513357162476,
"learning_rate": 1.9774386197743863e-05,
"loss": 0.3362165069580078,
"mean_token_accuracy": 0.8953030824661254,
"num_tokens": 11445148.0,
"step": 150
},
{
"entropy": 0.2893742734193802,
"epoch": 0.00796431984708506,
"grad_norm": 0.8775256872177124,
"learning_rate": 2.6410086264100863e-05,
"loss": 0.2852581214904785,
"mean_token_accuracy": 0.9090695399045944,
"num_tokens": 15380668.0,
"step": 200
},
{
"entropy": 0.26955254435539244,
"epoch": 0.009955399808856324,
"grad_norm": 0.57791668176651,
"learning_rate": 3.3045786330457866e-05,
"loss": 0.26207345962524414,
"mean_token_accuracy": 0.9136792892217636,
"num_tokens": 19181789.0,
"step": 250
},
{
"entropy": 0.25845475763082504,
"epoch": 0.011946479770627589,
"grad_norm": 0.5533633232116699,
"learning_rate": 3.968148639681486e-05,
"loss": 0.2490983200073242,
"mean_token_accuracy": 0.9160848289728165,
"num_tokens": 22992039.0,
"step": 300
},
{
"entropy": 0.2542937259376049,
"epoch": 0.013937559732398854,
"grad_norm": 0.5990102291107178,
"learning_rate": 4.631718646317187e-05,
"loss": 0.25011444091796875,
"mean_token_accuracy": 0.9170939832925796,
"num_tokens": 27108018.0,
"step": 350
},
{
"entropy": 0.2444898281991482,
"epoch": 0.01592863969417012,
"grad_norm": 0.43611571192741394,
"learning_rate": 5.295288652952887e-05,
"loss": 0.23930130004882813,
"mean_token_accuracy": 0.9197874891757966,
"num_tokens": 31057058.0,
"step": 400
},
{
"entropy": 0.24174359649419785,
"epoch": 0.01791971965594138,
"grad_norm": 2.912916898727417,
"learning_rate": 5.9588586595885865e-05,
"loss": 0.2378847885131836,
"mean_token_accuracy": 0.9206177514791488,
"num_tokens": 34886145.0,
"step": 450
},
{
"entropy": 0.23314271196722985,
"epoch": 0.019910799617712648,
"grad_norm": 0.5054332613945007,
"learning_rate": 6.622428666224287e-05,
"loss": 0.2341362190246582,
"mean_token_accuracy": 0.9219391363859176,
"num_tokens": 38822339.0,
"step": 500
},
{
"entropy": 0.24051452845335006,
"epoch": 0.02190187957948391,
"grad_norm": 0.5167355537414551,
"learning_rate": 7.285998672859987e-05,
"loss": 0.24161724090576173,
"mean_token_accuracy": 0.9203771650791168,
"num_tokens": 42957563.0,
"step": 550
},
{
"entropy": 0.2295207805931568,
"epoch": 0.023892959541255178,
"grad_norm": 0.9762596487998962,
"learning_rate": 7.949568679495687e-05,
"loss": 0.2272401809692383,
"mean_token_accuracy": 0.9232405090332031,
"num_tokens": 46768583.0,
"step": 600
},
{
"entropy": 0.23686898455023767,
"epoch": 0.02588403950302644,
"grad_norm": 0.466611385345459,
"learning_rate": 8.613138686131386e-05,
"loss": 0.23224437713623047,
"mean_token_accuracy": 0.9218472588062286,
"num_tokens": 50645803.0,
"step": 650
},
{
"entropy": 0.23130884274840355,
"epoch": 0.027875119464797708,
"grad_norm": 0.38592949509620667,
"learning_rate": 9.276708692767087e-05,
"loss": 0.23153045654296875,
"mean_token_accuracy": 0.9227015018463135,
"num_tokens": 54572014.0,
"step": 700
},
{
"entropy": 0.23954722553491592,
"epoch": 0.02986619942656897,
"grad_norm": 0.3463596999645233,
"learning_rate": 9.940278699402787e-05,
"loss": 0.24017810821533203,
"mean_token_accuracy": 0.9208958899974823,
"num_tokens": 58564303.0,
"step": 750
},
{
"entropy": 0.23351749897003174,
"epoch": 0.03185727938834024,
"grad_norm": 0.44391459226608276,
"learning_rate": 0.00010603848706038488,
"loss": 0.23203353881835936,
"mean_token_accuracy": 0.9222453135251999,
"num_tokens": 62457510.0,
"step": 800
},
{
"entropy": 0.2437037083506584,
"epoch": 0.033848359350111504,
"grad_norm": 0.5019763112068176,
"learning_rate": 0.00011267418712674188,
"loss": 0.24389320373535156,
"mean_token_accuracy": 0.9196780633926391,
"num_tokens": 66530019.0,
"step": 850
},
{
"entropy": 0.22831465810537338,
"epoch": 0.03583943931188276,
"grad_norm": 0.33829352259635925,
"learning_rate": 0.00011930988719309889,
"loss": 0.2317771339416504,
"mean_token_accuracy": 0.9224331545829773,
"num_tokens": 70424005.0,
"step": 900
},
{
"entropy": 0.22766645520925521,
"epoch": 0.03783051927365403,
"grad_norm": 0.5179854035377502,
"learning_rate": 0.00012594558725945588,
"loss": 0.22764064788818358,
"mean_token_accuracy": 0.923973958492279,
"num_tokens": 74253770.0,
"step": 950
},
{
"entropy": 0.23552999064326285,
"epoch": 0.039821599235425297,
"grad_norm": 0.44404569268226624,
"learning_rate": 0.00013258128732581288,
"loss": 0.23626502990722656,
"mean_token_accuracy": 0.9216047769784927,
"num_tokens": 78182200.0,
"step": 1000
},
{
"entropy": 0.22930314570665358,
"epoch": 0.041812679197196556,
"grad_norm": 0.448462575674057,
"learning_rate": 0.00013921698739216987,
"loss": 0.23278812408447266,
"mean_token_accuracy": 0.9230523258447647,
"num_tokens": 81937838.0,
"step": 1050
},
{
"entropy": 0.23650458663702012,
"epoch": 0.04380375915896782,
"grad_norm": 0.3995441794395447,
"learning_rate": 0.00014585268745852687,
"loss": 0.23656768798828126,
"mean_token_accuracy": 0.9211232715845108,
"num_tokens": 85927588.0,
"step": 1100
},
{
"entropy": 0.23935676783323287,
"epoch": 0.04579483912073909,
"grad_norm": 0.39098668098449707,
"learning_rate": 0.00015248838752488387,
"loss": 0.2379437255859375,
"mean_token_accuracy": 0.921039087176323,
"num_tokens": 89882949.0,
"step": 1150
},
{
"entropy": 0.24524856984615326,
"epoch": 0.047785919082510356,
"grad_norm": 0.4632549583911896,
"learning_rate": 0.0001591240875912409,
"loss": 0.24808704376220703,
"mean_token_accuracy": 0.9186844676733017,
"num_tokens": 93855605.0,
"step": 1200
},
{
"entropy": 0.23450494036078454,
"epoch": 0.049776999044281615,
"grad_norm": 0.4616311490535736,
"learning_rate": 0.0001657597876575979,
"loss": 0.23671966552734375,
"mean_token_accuracy": 0.9223334664106368,
"num_tokens": 97726256.0,
"step": 1250
},
{
"entropy": 0.23849584758281708,
"epoch": 0.05176807900605288,
"grad_norm": 0.5183118581771851,
"learning_rate": 0.00017239548772395488,
"loss": 0.2390594482421875,
"mean_token_accuracy": 0.9210267335176467,
"num_tokens": 101712424.0,
"step": 1300
},
{
"entropy": 0.24750934526324272,
"epoch": 0.05375915896782415,
"grad_norm": 0.6962779760360718,
"learning_rate": 0.0001790311877903119,
"loss": 0.2504555702209473,
"mean_token_accuracy": 0.9193422102928162,
"num_tokens": 105526982.0,
"step": 1350
},
{
"entropy": 0.25117891386151314,
"epoch": 0.055750238929595415,
"grad_norm": 1.4407775402069092,
"learning_rate": 0.00018566688785666888,
"loss": 0.2523708534240723,
"mean_token_accuracy": 0.9178527224063874,
"num_tokens": 109426865.0,
"step": 1400
},
{
"entropy": 0.247833551466465,
"epoch": 0.057741318891366675,
"grad_norm": 1.0299957990646362,
"learning_rate": 0.0001923025879230259,
"loss": 0.2527511787414551,
"mean_token_accuracy": 0.918297466635704,
"num_tokens": 113259105.0,
"step": 1450
},
{
"entropy": 0.2641977226734161,
"epoch": 0.05973239885313794,
"grad_norm": 0.5299701690673828,
"learning_rate": 0.0001989382879893829,
"loss": 0.2680278015136719,
"mean_token_accuracy": 0.9148374336957932,
"num_tokens": 117180907.0,
"step": 1500
},
{
"epoch": 0.05973239885313794,
"eval_entropy": 0.238698192295574,
"eval_loss": 0.25736984610557556,
"eval_mean_token_accuracy": 0.9147308885105072,
"eval_num_tokens": 117180907.0,
"eval_runtime": 97.8199,
"eval_samples_per_second": 10.223,
"eval_steps_per_second": 0.644,
"step": 1500
},
{
"entropy": 0.26027600586414334,
"epoch": 0.06172347881490921,
"grad_norm": 0.49680882692337036,
"learning_rate": 0.00019999963321886343,
"loss": 0.2606443786621094,
"mean_token_accuracy": 0.9150975352525711,
"num_tokens": 121066461.0,
"step": 1550
},
{
"entropy": 0.2638482017815113,
"epoch": 0.06371455877668047,
"grad_norm": 0.4531654119491577,
"learning_rate": 0.00019999824011999318,
"loss": 0.26884456634521486,
"mean_token_accuracy": 0.9154274082183838,
"num_tokens": 124953674.0,
"step": 1600
},
{
"entropy": 0.26387491196393964,
"epoch": 0.06570563873845174,
"grad_norm": 0.5205627083778381,
"learning_rate": 0.0001999958074106123,
"loss": 0.26874935150146484,
"mean_token_accuracy": 0.9152652221918106,
"num_tokens": 128863995.0,
"step": 1650
},
{
"entropy": 0.2617137129604816,
"epoch": 0.06769671870022301,
"grad_norm": 0.5326299071311951,
"learning_rate": 0.00019999233511601205,
"loss": 0.26520500183105467,
"mean_token_accuracy": 0.9143794012069703,
"num_tokens": 132781419.0,
"step": 1700
},
{
"entropy": 0.2951073496043682,
"epoch": 0.06968779866199426,
"grad_norm": 1.5515563488006592,
"learning_rate": 0.00019998782327229132,
"loss": 0.2992689514160156,
"mean_token_accuracy": 0.9068609338998794,
"num_tokens": 136746142.0,
"step": 1750
},
{
"entropy": 0.2911060942709446,
"epoch": 0.07167887862376553,
"grad_norm": 0.9882198572158813,
"learning_rate": 0.00019998227192635662,
"loss": 0.2912177658081055,
"mean_token_accuracy": 0.9083128577470779,
"num_tokens": 140635934.0,
"step": 1800
},
{
"entropy": 0.30583499386906626,
"epoch": 0.0736699585855368,
"grad_norm": 0.9490135312080383,
"learning_rate": 0.00019997568113592123,
"loss": 0.30314250946044924,
"mean_token_accuracy": 0.9060158902406692,
"num_tokens": 144351764.0,
"step": 1850
},
{
"entropy": 0.29104826986789706,
"epoch": 0.07566103854730806,
"grad_norm": 0.5743433833122253,
"learning_rate": 0.00019996805096950495,
"loss": 0.2896587562561035,
"mean_token_accuracy": 0.9093901348114014,
"num_tokens": 148317341.0,
"step": 1900
},
{
"entropy": 0.2791394780576229,
"epoch": 0.07765211850907933,
"grad_norm": 0.6630957722663879,
"learning_rate": 0.00019995938150643323,
"loss": 0.27749942779541015,
"mean_token_accuracy": 0.9116008925437927,
"num_tokens": 152115011.0,
"step": 1950
},
{
"entropy": 0.2864747692644596,
"epoch": 0.07964319847085059,
"grad_norm": 0.5167714357376099,
"learning_rate": 0.0001999496728368363,
"loss": 0.2892703628540039,
"mean_token_accuracy": 0.9101212161779404,
"num_tokens": 155955543.0,
"step": 2000
},
{
"entropy": 0.29486714631319044,
"epoch": 0.08163427843262186,
"grad_norm": 0.6764300465583801,
"learning_rate": 0.00019993892506164817,
"loss": 0.2938148880004883,
"mean_token_accuracy": 0.907455735206604,
"num_tokens": 159950282.0,
"step": 2050
},
{
"entropy": 0.289661710858345,
"epoch": 0.08362535839439311,
"grad_norm": 1.3380991220474243,
"learning_rate": 0.00019992713829260596,
"loss": 0.29367408752441404,
"mean_token_accuracy": 0.9090178072452545,
"num_tokens": 163946195.0,
"step": 2100
},
{
"entropy": 0.2813515478372574,
"epoch": 0.08561643835616438,
"grad_norm": 0.5605268478393555,
"learning_rate": 0.00019991431265224826,
"loss": 0.28127031326293944,
"mean_token_accuracy": 0.9111650967597962,
"num_tokens": 167803895.0,
"step": 2150
},
{
"entropy": 0.2813937878608704,
"epoch": 0.08760751831793565,
"grad_norm": 0.545811653137207,
"learning_rate": 0.0001999004482739141,
"loss": 0.2833607864379883,
"mean_token_accuracy": 0.9109566658735275,
"num_tokens": 171609856.0,
"step": 2200
},
{
"entropy": 0.27727267012000084,
"epoch": 0.08959859827970691,
"grad_norm": 7.048864364624023,
"learning_rate": 0.00019988554530174155,
"loss": 0.27622432708740235,
"mean_token_accuracy": 0.912345079779625,
"num_tokens": 175465546.0,
"step": 2250
},
{
"entropy": 0.28270753011107447,
"epoch": 0.09158967824147818,
"grad_norm": 0.6423642635345459,
"learning_rate": 0.00019986960389066624,
"loss": 0.27773189544677734,
"mean_token_accuracy": 0.9109648811817169,
"num_tokens": 179431473.0,
"step": 2300
},
{
"entropy": 0.2899395690858364,
"epoch": 0.09358075820324945,
"grad_norm": 0.675128161907196,
"learning_rate": 0.00019985262420641964,
"loss": 0.29255908966064453,
"mean_token_accuracy": 0.9083035236597061,
"num_tokens": 183254030.0,
"step": 2350
},
{
"entropy": 0.2949830622971058,
"epoch": 0.09557183816502071,
"grad_norm": 0.7517677545547485,
"learning_rate": 0.00019983460642552747,
"loss": 0.2965231704711914,
"mean_token_accuracy": 0.9082889229059219,
"num_tokens": 187001777.0,
"step": 2400
},
{
"entropy": 0.2832724647223949,
"epoch": 0.09756291812679198,
"grad_norm": 5.088311195373535,
"learning_rate": 0.00019981555073530772,
"loss": 0.2839857864379883,
"mean_token_accuracy": 0.9105693870782852,
"num_tokens": 190883577.0,
"step": 2450
},
{
"entropy": 0.291139078438282,
"epoch": 0.09955399808856323,
"grad_norm": 0.8445279598236084,
"learning_rate": 0.0001997954573338689,
"loss": 0.2915267562866211,
"mean_token_accuracy": 0.9080010551214218,
"num_tokens": 194770386.0,
"step": 2500
},
{
"entropy": 0.28031437411904336,
"epoch": 0.1015450780503345,
"grad_norm": 0.6642708778381348,
"learning_rate": 0.00019977432643010775,
"loss": 0.28441873550415037,
"mean_token_accuracy": 0.9110708701610565,
"num_tokens": 198620457.0,
"step": 2550
},
{
"entropy": 0.27880264043807984,
"epoch": 0.10353615801210576,
"grad_norm": 0.8699315786361694,
"learning_rate": 0.0001997521582437072,
"loss": 0.27945274353027344,
"mean_token_accuracy": 0.911846690773964,
"num_tokens": 202386820.0,
"step": 2600
},
{
"entropy": 0.2867648507654667,
"epoch": 0.10552723797387703,
"grad_norm": 1.2071722745895386,
"learning_rate": 0.00019972895300513418,
"loss": 0.2882248497009277,
"mean_token_accuracy": 0.9101024943590165,
"num_tokens": 206364615.0,
"step": 2650
},
{
"entropy": 0.304570385068655,
"epoch": 0.1075183179356483,
"grad_norm": 4.0775251388549805,
"learning_rate": 0.000199704710955637,
"loss": 0.3016018295288086,
"mean_token_accuracy": 0.9069358545541764,
"num_tokens": 210183973.0,
"step": 2700
},
{
"entropy": 0.3049754598736763,
"epoch": 0.10950939789741956,
"grad_norm": 1.0843818187713623,
"learning_rate": 0.00019967943234724302,
"loss": 0.3067584419250488,
"mean_token_accuracy": 0.9062304347753525,
"num_tokens": 214136281.0,
"step": 2750
},
{
"entropy": 0.29823502883315084,
"epoch": 0.11150047785919083,
"grad_norm": 0.6775873899459839,
"learning_rate": 0.00019965311744275587,
"loss": 0.29334327697753904,
"mean_token_accuracy": 0.9081481236219406,
"num_tokens": 217930544.0,
"step": 2800
},
{
"entropy": 0.3078458538651466,
"epoch": 0.1134915578209621,
"grad_norm": 0.7490587830543518,
"learning_rate": 0.00019962576651575296,
"loss": 0.3025942230224609,
"mean_token_accuracy": 0.905663657784462,
"num_tokens": 221877887.0,
"step": 2850
},
{
"entropy": 0.30110266715288164,
"epoch": 0.11548263778273335,
"grad_norm": 0.6697282791137695,
"learning_rate": 0.00019959737985058234,
"loss": 0.3010330581665039,
"mean_token_accuracy": 0.9064904636144638,
"num_tokens": 225627001.0,
"step": 2900
},
{
"entropy": 0.2984598980844021,
"epoch": 0.11747371774450462,
"grad_norm": 0.8348047733306885,
"learning_rate": 0.00019956795774235997,
"loss": 0.29577600479125976,
"mean_token_accuracy": 0.9069764482975006,
"num_tokens": 229611801.0,
"step": 2950
},
{
"entropy": 0.29838990807533267,
"epoch": 0.11946479770627588,
"grad_norm": 1.1875905990600586,
"learning_rate": 0.00019953750049696658,
"loss": 0.2987412643432617,
"mean_token_accuracy": 0.9088970798254014,
"num_tokens": 233561259.0,
"step": 3000
},
{
"epoch": 0.11946479770627588,
"eval_entropy": 0.3022507036489154,
"eval_loss": 0.30308812856674194,
"eval_mean_token_accuracy": 0.9028340615923443,
"eval_num_tokens": 233561259.0,
"eval_runtime": 97.5155,
"eval_samples_per_second": 10.255,
"eval_steps_per_second": 0.646,
"step": 3000
},
{
"entropy": 0.29537968412041665,
"epoch": 0.12145587766804715,
"grad_norm": 0.8750671744346619,
"learning_rate": 0.00019950600843104445,
"loss": 0.29412849426269533,
"mean_token_accuracy": 0.9083840191364289,
"num_tokens": 237437091.0,
"step": 3050
},
{
"entropy": 0.30670097917318345,
"epoch": 0.12344695762981842,
"grad_norm": 2.4987075328826904,
"learning_rate": 0.0001994734818719942,
"loss": 0.30259759902954103,
"mean_token_accuracy": 0.9058998501300812,
"num_tokens": 241436828.0,
"step": 3100
},
{
"entropy": 0.29469338595867156,
"epoch": 0.12543803759158967,
"grad_norm": 1.7380224466323853,
"learning_rate": 0.00019943992115797126,
"loss": 0.2931842803955078,
"mean_token_accuracy": 0.9096289926767349,
"num_tokens": 245351552.0,
"step": 3150
},
{
"entropy": 0.29411437809467317,
"epoch": 0.12742911755336095,
"grad_norm": 0.7798497676849365,
"learning_rate": 0.0001994053266378825,
"loss": 0.2951908874511719,
"mean_token_accuracy": 0.9085562580823898,
"num_tokens": 249301096.0,
"step": 3200
},
{
"entropy": 0.2993234470486641,
"epoch": 0.1294201975151322,
"grad_norm": 0.8817734718322754,
"learning_rate": 0.00019936969867138254,
"loss": 0.30352956771850587,
"mean_token_accuracy": 0.9072857981920243,
"num_tokens": 253277622.0,
"step": 3250
},
{
"entropy": 0.29699300721287725,
"epoch": 0.13141127747690348,
"grad_norm": 1.2130342721939087,
"learning_rate": 0.00019933303762886996,
"loss": 0.29787822723388674,
"mean_token_accuracy": 0.9083835577964783,
"num_tokens": 257227304.0,
"step": 3300
},
{
"entropy": 0.29587675660848617,
"epoch": 0.13340235743867473,
"grad_norm": 0.5530600547790527,
"learning_rate": 0.00019929534389148354,
"loss": 0.29798791885375975,
"mean_token_accuracy": 0.908504787683487,
"num_tokens": 261108205.0,
"step": 3350
},
{
"entropy": 0.29003412410616874,
"epoch": 0.13539343740044602,
"grad_norm": 0.8571836948394775,
"learning_rate": 0.00019925661785109822,
"loss": 0.2917255973815918,
"mean_token_accuracy": 0.9100581562519073,
"num_tokens": 265017318.0,
"step": 3400
},
{
"entropy": 0.30487392365932464,
"epoch": 0.13738451736221727,
"grad_norm": 0.8164399862289429,
"learning_rate": 0.00019921685991032106,
"loss": 0.30083534240722654,
"mean_token_accuracy": 0.9061442995071411,
"num_tokens": 268861028.0,
"step": 3450
},
{
"entropy": 0.2943995995819569,
"epoch": 0.13937559732398852,
"grad_norm": 0.7428765296936035,
"learning_rate": 0.00019917607048248708,
"loss": 0.29643802642822265,
"mean_token_accuracy": 0.9087468749284744,
"num_tokens": 272883824.0,
"step": 3500
},
{
"entropy": 0.2999743050336838,
"epoch": 0.1413666772857598,
"grad_norm": 0.6750977039337158,
"learning_rate": 0.0001991342499916549,
"loss": 0.29727874755859374,
"mean_token_accuracy": 0.9070488250255585,
"num_tokens": 276710051.0,
"step": 3550
},
{
"entropy": 0.2862047958374023,
"epoch": 0.14335775724753105,
"grad_norm": 0.891075074672699,
"learning_rate": 0.0001990913988726024,
"loss": 0.2836902618408203,
"mean_token_accuracy": 0.9103441405296325,
"num_tokens": 280668466.0,
"step": 3600
},
{
"entropy": 0.2909073846042156,
"epoch": 0.14534883720930233,
"grad_norm": 0.6584152579307556,
"learning_rate": 0.00019904751757082219,
"loss": 0.2913536262512207,
"mean_token_accuracy": 0.9092260366678238,
"num_tokens": 284596662.0,
"step": 3650
},
{
"entropy": 0.295346038043499,
"epoch": 0.1473399171710736,
"grad_norm": 1.0523701906204224,
"learning_rate": 0.00019900260654251689,
"loss": 0.297835636138916,
"mean_token_accuracy": 0.907945249080658,
"num_tokens": 288479589.0,
"step": 3700
},
{
"entropy": 0.2844700115919113,
"epoch": 0.14933099713284487,
"grad_norm": 0.5819393992424011,
"learning_rate": 0.0001989566662545945,
"loss": 0.2872531509399414,
"mean_token_accuracy": 0.9114671903848648,
"num_tokens": 292311632.0,
"step": 3750
},
{
"entropy": 0.28947981700301173,
"epoch": 0.15132207709461612,
"grad_norm": 0.5562146306037903,
"learning_rate": 0.00019890969718466345,
"loss": 0.28745689392089846,
"mean_token_accuracy": 0.9094958698749542,
"num_tokens": 296097039.0,
"step": 3800
},
{
"entropy": 0.29930747270584107,
"epoch": 0.15331315705638737,
"grad_norm": 0.6150246262550354,
"learning_rate": 0.0001988616998210278,
"loss": 0.29687225341796875,
"mean_token_accuracy": 0.9068776845932007,
"num_tokens": 299857385.0,
"step": 3850
},
{
"entropy": 0.28908350199460986,
"epoch": 0.15530423701815865,
"grad_norm": 0.5917616486549377,
"learning_rate": 0.0001988126746626819,
"loss": 0.2879753112792969,
"mean_token_accuracy": 0.9093427962064743,
"num_tokens": 303701551.0,
"step": 3900
},
{
"entropy": 0.28460383400321004,
"epoch": 0.1572953169799299,
"grad_norm": 0.6134833693504333,
"learning_rate": 0.00019876262221930544,
"loss": 0.2821200752258301,
"mean_token_accuracy": 0.9112467098236084,
"num_tokens": 307464728.0,
"step": 3950
},
{
"entropy": 0.2812545415759087,
"epoch": 0.15928639694170119,
"grad_norm": 0.741555392742157,
"learning_rate": 0.00019871154301125802,
"loss": 0.28286741256713865,
"mean_token_accuracy": 0.9115043008327484,
"num_tokens": 311352582.0,
"step": 4000
},
{
"entropy": 0.29000384598970413,
"epoch": 0.16127747690347244,
"grad_norm": 0.5392553210258484,
"learning_rate": 0.00019865943756957385,
"loss": 0.2881851005554199,
"mean_token_accuracy": 0.9097525632381439,
"num_tokens": 315178809.0,
"step": 4050
},
{
"entropy": 0.2849612885713577,
"epoch": 0.16326855686524372,
"grad_norm": 0.6325093507766724,
"learning_rate": 0.0001986063064359561,
"loss": 0.28987804412841794,
"mean_token_accuracy": 0.9114274823665619,
"num_tokens": 319128941.0,
"step": 4100
},
{
"entropy": 0.28891856864094734,
"epoch": 0.16525963682701497,
"grad_norm": 0.6090471744537354,
"learning_rate": 0.0001985521501627713,
"loss": 0.2873344421386719,
"mean_token_accuracy": 0.9105158835649491,
"num_tokens": 323051101.0,
"step": 4150
},
{
"entropy": 0.27601037934422495,
"epoch": 0.16725071678878622,
"grad_norm": 0.5414860844612122,
"learning_rate": 0.0001984969693130437,
"loss": 0.2741785430908203,
"mean_token_accuracy": 0.9122807896137237,
"num_tokens": 327024528.0,
"step": 4200
},
{
"entropy": 0.2906373116374016,
"epoch": 0.1692417967505575,
"grad_norm": 1.431944727897644,
"learning_rate": 0.0001984407644604493,
"loss": 0.29466737747192384,
"mean_token_accuracy": 0.9092401885986328,
"num_tokens": 331009920.0,
"step": 4250
},
{
"entropy": 0.2901481683552265,
"epoch": 0.17123287671232876,
"grad_norm": 0.6499968767166138,
"learning_rate": 0.0001983835361893099,
"loss": 0.2953326416015625,
"mean_token_accuracy": 0.9093990051746368,
"num_tokens": 334868780.0,
"step": 4300
},
{
"entropy": 0.28857042759656903,
"epoch": 0.17322395667410004,
"grad_norm": 0.7128919363021851,
"learning_rate": 0.0001983252850945872,
"loss": 0.28462093353271484,
"mean_token_accuracy": 0.9101207864284515,
"num_tokens": 338781001.0,
"step": 4350
},
{
"entropy": 0.2894445453584194,
"epoch": 0.1752150366358713,
"grad_norm": 0.6674997806549072,
"learning_rate": 0.00019826601178187626,
"loss": 0.2883860015869141,
"mean_token_accuracy": 0.9103347849845886,
"num_tokens": 342625321.0,
"step": 4400
},
{
"entropy": 0.29015815258026123,
"epoch": 0.17720611659764257,
"grad_norm": 1.1805739402770996,
"learning_rate": 0.00019820571686739955,
"loss": 0.2924055099487305,
"mean_token_accuracy": 0.9087706804275513,
"num_tokens": 346524954.0,
"step": 4450
},
{
"entropy": 0.29237871393561365,
"epoch": 0.17919719655941382,
"grad_norm": 0.8005287051200867,
"learning_rate": 0.00019814440097800035,
"loss": 0.2911919403076172,
"mean_token_accuracy": 0.9096369504928589,
"num_tokens": 350433271.0,
"step": 4500
},
{
"epoch": 0.17919719655941382,
"eval_entropy": 0.28920668079739525,
"eval_loss": 0.27546826004981995,
"eval_mean_token_accuracy": 0.909925399318574,
"eval_num_tokens": 350433271.0,
"eval_runtime": 97.8322,
"eval_samples_per_second": 10.222,
"eval_steps_per_second": 0.644,
"step": 4500
},
{
"entropy": 0.292726431787014,
"epoch": 0.1811882765211851,
"grad_norm": 0.6807382702827454,
"learning_rate": 0.00019808206475113634,
"loss": 0.2953124809265137,
"mean_token_accuracy": 0.9097322398424148,
"num_tokens": 354258375.0,
"step": 4550
},
{
"entropy": 0.29881048142910005,
"epoch": 0.18317935648295636,
"grad_norm": 0.6803342700004578,
"learning_rate": 0.00019801870883487288,
"loss": 0.3002021408081055,
"mean_token_accuracy": 0.9072781252861023,
"num_tokens": 358243758.0,
"step": 4600
},
{
"entropy": 0.2855297502875328,
"epoch": 0.1851704364447276,
"grad_norm": 0.7521423101425171,
"learning_rate": 0.00019795433388787633,
"loss": 0.2812104034423828,
"mean_token_accuracy": 0.9116834425926208,
"num_tokens": 362027461.0,
"step": 4650
},
{
"entropy": 0.28612853690981865,
"epoch": 0.1871615164064989,
"grad_norm": 0.751583993434906,
"learning_rate": 0.00019788894057940715,
"loss": 0.2890420913696289,
"mean_token_accuracy": 0.9100965994596482,
"num_tokens": 365914009.0,
"step": 4700
},
{
"entropy": 0.291155586540699,
"epoch": 0.18915259636827014,
"grad_norm": 0.6980162858963013,
"learning_rate": 0.00019782252958931305,
"loss": 0.29225175857543945,
"mean_token_accuracy": 0.9092732155323029,
"num_tokens": 369831495.0,
"step": 4750
},
{
"entropy": 0.3040496847033501,
"epoch": 0.19114367633004142,
"grad_norm": 2.299229145050049,
"learning_rate": 0.0001977551016080218,
"loss": 0.3051426887512207,
"mean_token_accuracy": 0.9069945514202118,
"num_tokens": 373643390.0,
"step": 4800
},
{
"entropy": 0.30234193950891497,
"epoch": 0.19313475629181268,
"grad_norm": 12.250136375427246,
"learning_rate": 0.00019768665733653414,
"loss": 0.2970439910888672,
"mean_token_accuracy": 0.907816288471222,
"num_tokens": 377532130.0,
"step": 4850
},
{
"entropy": 0.3253930774331093,
"epoch": 0.19512583625358396,
"grad_norm": 602.9488525390625,
"learning_rate": 0.0001976171974864164,
"loss": 0.3245069122314453,
"mean_token_accuracy": 0.9026554811000824,
"num_tokens": 381481906.0,
"step": 4900
},
{
"entropy": 0.43629378005862235,
"epoch": 0.1971169162153552,
"grad_norm": 9.55897045135498,
"learning_rate": 0.00019754672277979323,
"loss": 0.503008041381836,
"mean_token_accuracy": 0.8766559469699859,
"num_tokens": 385427117.0,
"step": 4950
},
{
"entropy": 1.2075729909539223,
"epoch": 0.19910799617712646,
"grad_norm": 10.384903907775879,
"learning_rate": 0.00019747523394933992,
"loss": 1.4099630737304687,
"mean_token_accuracy": 0.760298758149147,
"num_tokens": 389336381.0,
"step": 5000
},
{
"entropy": 4.1178853380680085,
"epoch": 0.20109907613889774,
"grad_norm": 13.629193305969238,
"learning_rate": 0.00019740273173827499,
"loss": 5.369188232421875,
"mean_token_accuracy": 0.2704500517481938,
"num_tokens": 393303618.0,
"step": 5050
},
{
"entropy": 2.060445339679718,
"epoch": 0.203090156100669,
"grad_norm": 16.477094650268555,
"learning_rate": 0.0001973292169003523,
"loss": 2.518390808105469,
"mean_token_accuracy": 0.6017715675383806,
"num_tokens": 397093081.0,
"step": 5100
},
{
"entropy": 0.7607585701346398,
"epoch": 0.20508123606244028,
"grad_norm": 153.88894653320312,
"learning_rate": 0.00019725469019985333,
"loss": 0.813140869140625,
"mean_token_accuracy": 0.8155078822374344,
"num_tokens": 400936352.0,
"step": 5150
},
{
"entropy": 0.9180069261789322,
"epoch": 0.20707231602421153,
"grad_norm": 2.9457428455352783,
"learning_rate": 0.00019717915241157903,
"loss": 0.9284542846679688,
"mean_token_accuracy": 0.7885740977525711,
"num_tokens": 404917718.0,
"step": 5200
},
{
"entropy": 0.3624985629320145,
"epoch": 0.2090633959859828,
"grad_norm": 0.9943515658378601,
"learning_rate": 0.00019710260432084206,
"loss": 0.35674095153808594,
"mean_token_accuracy": 0.896698716878891,
"num_tokens": 408859179.0,
"step": 5250
},
{
"entropy": 0.9530950874090195,
"epoch": 0.21105447594775406,
"grad_norm": 1371642.5,
"learning_rate": 0.00019702504672345844,
"loss": 0.9454847717285156,
"mean_token_accuracy": 0.7871760299801827,
"num_tokens": 412673154.0,
"step": 5300
},
{
"entropy": 1.998653382062912,
"epoch": 0.2130455559095253,
"grad_norm": 31218.666015625,
"learning_rate": 0.0001969464804257393,
"loss": 2.0618492126464845,
"mean_token_accuracy": 0.6287000980228186,
"num_tokens": 416647839.0,
"step": 5350
},
{
"entropy": 0.7908964619040489,
"epoch": 0.2150366358712966,
"grad_norm": 274.27215576171875,
"learning_rate": 0.00019686690624448242,
"loss": 0.7396269226074219,
"mean_token_accuracy": 0.8199971842765809,
"num_tokens": 420594394.0,
"step": 5400
},
{
"entropy": 0.49078064411878586,
"epoch": 0.21702771583306785,
"grad_norm": 937.0590209960938,
"learning_rate": 0.000196786325006964,
"loss": 0.48082077026367187,
"mean_token_accuracy": 0.8696271818876267,
"num_tokens": 424562376.0,
"step": 5450
},
{
"entropy": 0.5351789909601211,
"epoch": 0.21901879579483913,
"grad_norm": 2242.97705078125,
"learning_rate": 0.0001967047375509298,
"loss": 0.5486760711669922,
"mean_token_accuracy": 0.857095856666565,
"num_tokens": 428515673.0,
"step": 5500
},
{
"entropy": 0.426470011472702,
"epoch": 0.22100987575661038,
"grad_norm": 659.4993896484375,
"learning_rate": 0.00019662214472458646,
"loss": 0.4073149490356445,
"mean_token_accuracy": 0.8857790929079056,
"num_tokens": 432280329.0,
"step": 5550
},
{
"entropy": 0.7251139760017395,
"epoch": 0.22300095571838166,
"grad_norm": 282.25775146484375,
"learning_rate": 0.00019653854738659282,
"loss": 0.7429944610595703,
"mean_token_accuracy": 0.8232876443862915,
"num_tokens": 436242118.0,
"step": 5600
},
{
"entropy": 0.3698262667655945,
"epoch": 0.2249920356801529,
"grad_norm": 12.503119468688965,
"learning_rate": 0.00019645394640605086,
"loss": 0.3565479278564453,
"mean_token_accuracy": 0.8944947463274002,
"num_tokens": 440146433.0,
"step": 5650
},
{
"entropy": 0.40973065614700316,
"epoch": 0.2269831156419242,
"grad_norm": 1084.4339599609375,
"learning_rate": 0.0001963683426624968,
"loss": 0.3894519805908203,
"mean_token_accuracy": 0.8877280789613724,
"num_tokens": 443964090.0,
"step": 5700
},
{
"entropy": 0.35581542521715165,
"epoch": 0.22897419560369545,
"grad_norm": 16.15648651123047,
"learning_rate": 0.0001962817370458918,
"loss": 0.33966888427734376,
"mean_token_accuracy": 0.8968688982725144,
"num_tokens": 448011349.0,
"step": 5750
},
{
"entropy": 0.3509592401981354,
"epoch": 0.2309652755654667,
"grad_norm": 6.693056106567383,
"learning_rate": 0.00019619413045661276,
"loss": 0.34591773986816404,
"mean_token_accuracy": 0.8965184450149536,
"num_tokens": 451928063.0,
"step": 5800
},
{
"entropy": 0.36452227845788004,
"epoch": 0.23295635552723798,
"grad_norm": 5.892772674560547,
"learning_rate": 0.00019610552380544305,
"loss": 0.36557510375976565,
"mean_token_accuracy": 0.8949929642677307,
"num_tokens": 455889435.0,
"step": 5850
},
{
"entropy": 0.4062237656116486,
"epoch": 0.23494743548900923,
"grad_norm": 381.70843505859375,
"learning_rate": 0.00019601591801356297,
"loss": 0.39245895385742186,
"mean_token_accuracy": 0.8865513950586319,
"num_tokens": 459661149.0,
"step": 5900
},
{
"entropy": 1.057219158411026,
"epoch": 0.2369385154507805,
"grad_norm": 11522.1162109375,
"learning_rate": 0.00019592531401254007,
"loss": 1.5552653503417968,
"mean_token_accuracy": 0.7360941077768802,
"num_tokens": 463672650.0,
"step": 5950
},
{
"entropy": 0.666157491505146,
"epoch": 0.23892959541255177,
"grad_norm": 200332.671875,
"learning_rate": 0.00019583371274431972,
"loss": 0.6437340545654296,
"mean_token_accuracy": 0.8398592573404312,
"num_tokens": 467497899.0,
"step": 6000
},
{
"epoch": 0.23892959541255177,
"eval_entropy": 0.9302403725801952,
"eval_loss": 0.9569904804229736,
"eval_mean_token_accuracy": 0.7763322539745815,
"eval_num_tokens": 467497899.0,
"eval_runtime": 97.7568,
"eval_samples_per_second": 10.229,
"eval_steps_per_second": 0.644,
"step": 6000
},
{
"entropy": 2.966293410360813,
"epoch": 0.24092067537432305,
"grad_norm": 501369.0,
"learning_rate": 0.00019574111516121502,
"loss": 6.155978393554688,
"mean_token_accuracy": 0.2130392006225884,
"num_tokens": 471444277.0,
"step": 6050
},
{
"entropy": 5.9350907564163204,
"epoch": 0.2429117553360943,
"grad_norm": 6855.62939453125,
"learning_rate": 0.0001956475222258972,
"loss": 5.958920288085937,
"mean_token_accuracy": 0.11675349000841378,
"num_tokens": 475364729.0,
"step": 6100
},
{
"entropy": 5.5845241355896,
"epoch": 0.24490283529786555,
"grad_norm": 44784.75,
"learning_rate": 0.00019555293491138527,
"loss": 5.494525146484375,
"mean_token_accuracy": 0.16664834439754486,
"num_tokens": 479140786.0,
"step": 6150
},
{
"entropy": 5.335302751064301,
"epoch": 0.24689391525963683,
"grad_norm": 52592.01953125,
"learning_rate": 0.00019545735420103632,
"loss": 5.037943725585937,
"mean_token_accuracy": 0.20628853604197503,
"num_tokens": 483031362.0,
"step": 6200
},
{
"entropy": 4.4165141177177425,
"epoch": 0.24888499522140808,
"grad_norm": 310.85443115234375,
"learning_rate": 0.0001953607810885349,
"loss": 4.302553100585937,
"mean_token_accuracy": 0.3041644987463951,
"num_tokens": 486844277.0,
"step": 6250
},
{
"entropy": 2.018350040316582,
"epoch": 0.25087607518317934,
"grad_norm": 35.01002883911133,
"learning_rate": 0.00019526321657788284,
"loss": 1.953983612060547,
"mean_token_accuracy": 0.6572630336880684,
"num_tokens": 490907642.0,
"step": 6300
},
{
"entropy": 0.8694989970326423,
"epoch": 0.2528671551449506,
"grad_norm": 5267.51171875,
"learning_rate": 0.000195164661683389,
"loss": 0.8423341369628906,
"mean_token_accuracy": 0.8066436392068863,
"num_tokens": 494826463.0,
"step": 6350
},
{
"entropy": 1.5338060796260833,
"epoch": 0.2548582351067219,
"grad_norm": 48.75986099243164,
"learning_rate": 0.0001950651174296584,
"loss": 1.5342300415039063,
"mean_token_accuracy": 0.7021114355325699,
"num_tokens": 498718456.0,
"step": 6400
},
{
"entropy": 0.481953441798687,
"epoch": 0.2568493150684932,
"grad_norm": 11.493451118469238,
"learning_rate": 0.0001949645848515818,
"loss": 0.4798401641845703,
"mean_token_accuracy": 0.8721405351161957,
"num_tokens": 502656552.0,
"step": 6450
},
{
"entropy": 0.3813651466369629,
"epoch": 0.2588403950302644,
"grad_norm": 3.466660499572754,
"learning_rate": 0.00019486306499432482,
"loss": 0.3856293487548828,
"mean_token_accuracy": 0.890442590713501,
"num_tokens": 506485211.0,
"step": 6500
},
{
"entropy": 0.40147233694791795,
"epoch": 0.2608314749920357,
"grad_norm": 40.556732177734375,
"learning_rate": 0.00019476055891331714,
"loss": 0.41530418395996094,
"mean_token_accuracy": 0.8841481399536133,
"num_tokens": 510331860.0,
"step": 6550
},
{
"entropy": 0.362121434956789,
"epoch": 0.26282255495380696,
"grad_norm": 2307.35986328125,
"learning_rate": 0.0001946570676742415,
"loss": 0.3579364013671875,
"mean_token_accuracy": 0.8953806155920029,
"num_tokens": 514145400.0,
"step": 6600
},
{
"entropy": 0.37644080132246016,
"epoch": 0.2648136349155782,
"grad_norm": 9.581275939941406,
"learning_rate": 0.0001945525923530227,
"loss": 0.36162376403808594,
"mean_token_accuracy": 0.8937028670310974,
"num_tokens": 517942120.0,
"step": 6650
},
{
"entropy": 0.35380700886249544,
"epoch": 0.26680471487734947,
"grad_norm": 1.5564302206039429,
"learning_rate": 0.00019444713403581618,
"loss": 0.35733158111572266,
"mean_token_accuracy": 0.8964051580429078,
"num_tokens": 521893159.0,
"step": 6700
},
{
"entropy": 0.37363972336053847,
"epoch": 0.26879579483912075,
"grad_norm": 1.5304275751113892,
"learning_rate": 0.00019434069381899706,
"loss": 0.37166786193847656,
"mean_token_accuracy": 0.8930052673816681,
"num_tokens": 525839647.0,
"step": 6750
},
{
"entropy": 0.38540501803159716,
"epoch": 0.27078687480089203,
"grad_norm": 2.896862745285034,
"learning_rate": 0.00019423327280914844,
"loss": 0.3824498748779297,
"mean_token_accuracy": 0.8903352475166321,
"num_tokens": 529639037.0,
"step": 6800
},
{
"entropy": 0.36461210548877715,
"epoch": 0.27277795476266326,
"grad_norm": 1.4935225248336792,
"learning_rate": 0.00019412487212305013,
"loss": 0.36563232421875,
"mean_token_accuracy": 0.8926044535636902,
"num_tokens": 533576552.0,
"step": 6850
},
{
"entropy": 0.36362177550792696,
"epoch": 0.27476903472443454,
"grad_norm": 17.895999908447266,
"learning_rate": 0.00019401549288766687,
"loss": 0.3659773635864258,
"mean_token_accuracy": 0.8953115308284759,
"num_tokens": 537490959.0,
"step": 6900
},
{
"entropy": 0.3655336833000183,
"epoch": 0.2767601146862058,
"grad_norm": 5.626742839813232,
"learning_rate": 0.00019390513624013668,
"loss": 0.36942741394042966,
"mean_token_accuracy": 0.894575121998787,
"num_tokens": 541390561.0,
"step": 6950
},
{
"entropy": 0.35650448843836785,
"epoch": 0.27875119464797704,
"grad_norm": 96.78727722167969,
"learning_rate": 0.0001937938033277591,
"loss": 0.3513477325439453,
"mean_token_accuracy": 0.8967016339302063,
"num_tokens": 545281049.0,
"step": 7000
},
{
"entropy": 0.35293409407138826,
"epoch": 0.2807422746097483,
"grad_norm": 2.599032402038574,
"learning_rate": 0.00019368149530798312,
"loss": 0.3563782501220703,
"mean_token_accuracy": 0.8972502571344375,
"num_tokens": 549276429.0,
"step": 7050
},
{
"entropy": 0.35024922251701357,
"epoch": 0.2827333545715196,
"grad_norm": 0.8024204969406128,
"learning_rate": 0.0001935682133483953,
"loss": 0.34738357543945314,
"mean_token_accuracy": 0.8967534548044205,
"num_tokens": 553205921.0,
"step": 7100
},
{
"entropy": 0.3569410502910614,
"epoch": 0.2847244345332909,
"grad_norm": 1.7590816020965576,
"learning_rate": 0.0001934539586267075,
"loss": 0.3522836685180664,
"mean_token_accuracy": 0.8969353812932969,
"num_tokens": 557069513.0,
"step": 7150
},
{
"entropy": 0.3849373859167099,
"epoch": 0.2867155144950621,
"grad_norm": 46.36662292480469,
"learning_rate": 0.00019333873233074472,
"loss": 0.39945281982421876,
"mean_token_accuracy": 0.8912153190374374,
"num_tokens": 560866827.0,
"step": 7200
},
{
"entropy": 0.40855299681425095,
"epoch": 0.2887065944568334,
"grad_norm": 9.179975509643555,
"learning_rate": 0.0001932225356584327,
"loss": 0.42264102935791015,
"mean_token_accuracy": 0.8837257975339889,
"num_tokens": 564787263.0,
"step": 7250
},
{
"entropy": 0.37339140236377716,
"epoch": 0.29069767441860467,
"grad_norm": 1.1612548828125,
"learning_rate": 0.0001931053698177856,
"loss": 0.3683134841918945,
"mean_token_accuracy": 0.8944310307502746,
"num_tokens": 568512960.0,
"step": 7300
},
{
"entropy": 0.3807790431380272,
"epoch": 0.2926887543803759,
"grad_norm": 1.9693306684494019,
"learning_rate": 0.00019298723602689317,
"loss": 0.3835409545898438,
"mean_token_accuracy": 0.8914188152551651,
"num_tokens": 572379891.0,
"step": 7350
},
{
"entropy": 0.37928400114178656,
"epoch": 0.2946798343421472,
"grad_norm": 1.244362235069275,
"learning_rate": 0.00019286813551390837,
"loss": 0.380733757019043,
"mean_token_accuracy": 0.8911453211307525,
"num_tokens": 576081528.0,
"step": 7400
},
{
"entropy": 0.3649085074663162,
"epoch": 0.29667091430391845,
"grad_norm": 0.8187659978866577,
"learning_rate": 0.00019274806951703445,
"loss": 0.3639445495605469,
"mean_token_accuracy": 0.894467893242836,
"num_tokens": 579946103.0,
"step": 7450
},
{
"entropy": 0.36849416941404345,
"epoch": 0.29866199426568973,
"grad_norm": 1.0430868864059448,
"learning_rate": 0.00019262703928451207,
"loss": 0.3664413833618164,
"mean_token_accuracy": 0.8947416061162948,
"num_tokens": 583781528.0,
"step": 7500
},
{
"epoch": 0.29866199426568973,
"eval_entropy": 0.34230647933861563,
"eval_loss": 0.3402383327484131,
"eval_mean_token_accuracy": 0.8959205642579093,
"eval_num_tokens": 583781528.0,
"eval_runtime": 97.7872,
"eval_samples_per_second": 10.226,
"eval_steps_per_second": 0.644,
"step": 7500
},
{
"entropy": 0.37259786248207094,
"epoch": 0.30065307422746096,
"grad_norm": 0.8896583914756775,
"learning_rate": 0.0001925050460746064,
"loss": 0.3731904602050781,
"mean_token_accuracy": 0.8927891421318054,
"num_tokens": 587722557.0,
"step": 7550
},
{
"entropy": 0.37399895280599593,
"epoch": 0.30264415418923224,
"grad_norm": 1.1005648374557495,
"learning_rate": 0.000192382091155594,
"loss": 0.37042266845703126,
"mean_token_accuracy": 0.8932842481136322,
"num_tokens": 591520045.0,
"step": 7600
},
{
"entropy": 0.3673844130337238,
"epoch": 0.3046352341510035,
"grad_norm": 1.466604232788086,
"learning_rate": 0.00019225817580574965,
"loss": 0.3599439239501953,
"mean_token_accuracy": 0.8947141844034195,
"num_tokens": 595316335.0,
"step": 7650
},
{
"entropy": 0.36627118915319445,
"epoch": 0.30662631411277474,
"grad_norm": 1.2781370878219604,
"learning_rate": 0.000192133301313333,
"loss": 0.3659734344482422,
"mean_token_accuracy": 0.8943902653455734,
"num_tokens": 599157999.0,
"step": 7700
},
{
"entropy": 0.35352533668279645,
"epoch": 0.308617394074546,
"grad_norm": 1.158922791481018,
"learning_rate": 0.0001920074689765752,
"loss": 0.3468752670288086,
"mean_token_accuracy": 0.8980030977725982,
"num_tokens": 603082301.0,
"step": 7750
},
{
"entropy": 0.34789875760674477,
"epoch": 0.3106084740363173,
"grad_norm": 0.880212128162384,
"learning_rate": 0.00019188068010366554,
"loss": 0.34264190673828127,
"mean_token_accuracy": 0.8996097964048385,
"num_tokens": 607008342.0,
"step": 7800
},
{
"entropy": 0.34500489801168444,
"epoch": 0.3125995539980886,
"grad_norm": 14.691442489624023,
"learning_rate": 0.00019175293601273764,
"loss": 0.34683135986328123,
"mean_token_accuracy": 0.8989066386222839,
"num_tokens": 610911357.0,
"step": 7850
},
{
"entropy": 0.35687451854348184,
"epoch": 0.3145906339598598,
"grad_norm": 1.848387360572815,
"learning_rate": 0.00019162423803185588,
"loss": 0.35826019287109373,
"mean_token_accuracy": 0.8975167566537857,
"num_tokens": 614717230.0,
"step": 7900
},
{
"entropy": 0.35088829398155214,
"epoch": 0.3165817139216311,
"grad_norm": 0.8692337274551392,
"learning_rate": 0.00019149458749900152,
"loss": 0.34867095947265625,
"mean_token_accuracy": 0.8979580408334732,
"num_tokens": 618525149.0,
"step": 7950
},
{
"entropy": 0.3300197960436344,
"epoch": 0.31857279388340237,
"grad_norm": 2.092395782470703,
"learning_rate": 0.00019136398576205887,
"loss": 0.3315239334106445,
"mean_token_accuracy": 0.9027900397777557,
"num_tokens": 622547718.0,
"step": 8000
},
{
"entropy": 0.3332029429078102,
"epoch": 0.3205638738451736,
"grad_norm": 1.8703268766403198,
"learning_rate": 0.0001912324341788012,
"loss": 0.3339826202392578,
"mean_token_accuracy": 0.9025326895713807,
"num_tokens": 626427568.0,
"step": 8050
},
{
"entropy": 0.33984847337007523,
"epoch": 0.3225549538069449,
"grad_norm": 1.5212745666503906,
"learning_rate": 0.00019109993411687664,
"loss": 0.33795059204101563,
"mean_token_accuracy": 0.9009978342056274,
"num_tokens": 630210962.0,
"step": 8100
},
{
"entropy": 0.3363041001558304,
"epoch": 0.32454603376871616,
"grad_norm": 1.234013319015503,
"learning_rate": 0.0001909664869537941,
"loss": 0.3278226470947266,
"mean_token_accuracy": 0.9014317804574966,
"num_tokens": 634125543.0,
"step": 8150
},
{
"entropy": 0.3360677129030228,
"epoch": 0.32653711373048744,
"grad_norm": 1.0590438842773438,
"learning_rate": 0.0001908320940769086,
"loss": 0.3332764434814453,
"mean_token_accuracy": 0.9014078599214553,
"num_tokens": 637941773.0,
"step": 8200
},
{
"entropy": 0.34391440004110335,
"epoch": 0.32852819369225866,
"grad_norm": 0.9203246235847473,
"learning_rate": 0.00019069675688340726,
"loss": 0.340236701965332,
"mean_token_accuracy": 0.898968591094017,
"num_tokens": 641798240.0,
"step": 8250
},
{
"entropy": 0.34178978830575946,
"epoch": 0.33051927365402994,
"grad_norm": 0.9042324423789978,
"learning_rate": 0.00019056047678029457,
"loss": 0.33527900695800783,
"mean_token_accuracy": 0.9003325819969177,
"num_tokens": 645536522.0,
"step": 8300
},
{
"entropy": 0.3407294301688671,
"epoch": 0.3325103536158012,
"grad_norm": 1.2946654558181763,
"learning_rate": 0.00019042325518437767,
"loss": 0.33740230560302736,
"mean_token_accuracy": 0.8995247167348862,
"num_tokens": 649471189.0,
"step": 8350
},
{
"entropy": 0.34715739250183103,
"epoch": 0.33450143357757245,
"grad_norm": 2.5181047916412354,
"learning_rate": 0.00019028509352225184,
"loss": 0.34464599609375,
"mean_token_accuracy": 0.8989213883876801,
"num_tokens": 653419486.0,
"step": 8400
},
{
"entropy": 0.34275659039616585,
"epoch": 0.33649251353934373,
"grad_norm": 2.0157740116119385,
"learning_rate": 0.0001901459932302855,
"loss": 0.3392407989501953,
"mean_token_accuracy": 0.8996652096509934,
"num_tokens": 657395348.0,
"step": 8450
},
{
"entropy": 0.3413443921506405,
"epoch": 0.338483593501115,
"grad_norm": 1.2651079893112183,
"learning_rate": 0.00019000595575460538,
"loss": 0.3354787826538086,
"mean_token_accuracy": 0.8999969434738159,
"num_tokens": 661309063.0,
"step": 8500
},
{
"entropy": 0.3259673485159874,
"epoch": 0.3404746734628863,
"grad_norm": 3.185722827911377,
"learning_rate": 0.0001898649825510814,
"loss": 0.32872161865234373,
"mean_token_accuracy": 0.9023973035812378,
"num_tokens": 665351968.0,
"step": 8550
},
{
"entropy": 0.32777484819293023,
"epoch": 0.3424657534246575,
"grad_norm": 1.12962806224823,
"learning_rate": 0.00018972307508531157,
"loss": 0.32322891235351564,
"mean_token_accuracy": 0.9025442850589752,
"num_tokens": 669185049.0,
"step": 8600
},
{
"entropy": 0.3300194789469242,
"epoch": 0.3444568333864288,
"grad_norm": 1.0274972915649414,
"learning_rate": 0.00018958023483260685,
"loss": 0.3235230255126953,
"mean_token_accuracy": 0.9018253254890441,
"num_tokens": 673207624.0,
"step": 8650
},
{
"entropy": 0.32774477630853655,
"epoch": 0.3464479133482001,
"grad_norm": 7.125645160675049,
"learning_rate": 0.00018943646327797563,
"loss": 0.32126655578613283,
"mean_token_accuracy": 0.9035478168725968,
"num_tokens": 677078148.0,
"step": 8700
},
{
"entropy": 0.32380919888615606,
"epoch": 0.3484389933099713,
"grad_norm": 3.365225076675415,
"learning_rate": 0.00018929176191610834,
"loss": 0.327957763671875,
"mean_token_accuracy": 0.9035161393880844,
"num_tokens": 681086478.0,
"step": 8750
},
{
"entropy": 0.33227564081549643,
"epoch": 0.3504300732717426,
"grad_norm": 1.3480267524719238,
"learning_rate": 0.00018914613225136208,
"loss": 0.32949310302734375,
"mean_token_accuracy": 0.9014780944585801,
"num_tokens": 684932957.0,
"step": 8800
},
{
"entropy": 0.3357052344083786,
"epoch": 0.35242115323351386,
"grad_norm": 1.2543643712997437,
"learning_rate": 0.00018899957579774482,
"loss": 0.3339249038696289,
"mean_token_accuracy": 0.90175577044487,
"num_tokens": 688754691.0,
"step": 8850
},
{
"entropy": 0.32843308195471765,
"epoch": 0.35441223319528514,
"grad_norm": 1.2409096956253052,
"learning_rate": 0.00018885209407889963,
"loss": 0.32397491455078126,
"mean_token_accuracy": 0.9031638616323471,
"num_tokens": 692624575.0,
"step": 8900
},
{
"entropy": 0.33613822489976886,
"epoch": 0.35640331315705637,
"grad_norm": 0.8692443370819092,
"learning_rate": 0.00018870368862808893,
"loss": 0.3323232650756836,
"mean_token_accuracy": 0.9011309146881104,
"num_tokens": 696555101.0,
"step": 8950
},
{
"entropy": 0.3358862918615341,
"epoch": 0.35839439311882765,
"grad_norm": 0.9862300753593445,
"learning_rate": 0.0001885543609881786,
"loss": 0.3345521926879883,
"mean_token_accuracy": 0.9014543277025223,
"num_tokens": 700464446.0,
"step": 9000
},
{
"epoch": 0.35839439311882765,
"eval_entropy": 0.3540645409671087,
"eval_loss": 0.3069337010383606,
"eval_mean_token_accuracy": 0.9003797656013852,
"eval_num_tokens": 700464446.0,
"eval_runtime": 97.6772,
"eval_samples_per_second": 10.238,
"eval_steps_per_second": 0.645,
"step": 9000
},
{
"entropy": 0.3317222049832344,
"epoch": 0.36038547308059893,
"grad_norm": 1.0164847373962402,
"learning_rate": 0.00018840411271162175,
"loss": 0.32544532775878904,
"mean_token_accuracy": 0.9019567215442658,
"num_tokens": 704486622.0,
"step": 9050
},
{
"entropy": 0.3411662185192108,
"epoch": 0.3623765530423702,
"grad_norm": 2.0326812267303467,
"learning_rate": 0.00018825294536044279,
"loss": 0.3403163909912109,
"mean_token_accuracy": 0.900407105088234,
"num_tokens": 708521341.0,
"step": 9100
},
{
"entropy": 0.34867027416825297,
"epoch": 0.36436763300414143,
"grad_norm": 5.65775203704834,
"learning_rate": 0.00018810086050622096,
"loss": 0.3441625213623047,
"mean_token_accuracy": 0.898092051744461,
"num_tokens": 712486951.0,
"step": 9150
},
{
"entropy": 0.3382836529612541,
"epoch": 0.3663587129659127,
"grad_norm": 3.062307119369507,
"learning_rate": 0.0001879478597300743,
"loss": 0.33507949829101563,
"mean_token_accuracy": 0.900296345949173,
"num_tokens": 716374950.0,
"step": 9200
},
{
"entropy": 0.34634460166096687,
"epoch": 0.368349792927684,
"grad_norm": 0.9268959760665894,
"learning_rate": 0.00018779394462264292,
"loss": 0.3423932647705078,
"mean_token_accuracy": 0.9000798559188843,
"num_tokens": 720399611.0,
"step": 9250
},
{
"entropy": 0.3209140484035015,
"epoch": 0.3703408728894552,
"grad_norm": 2.2739686965942383,
"learning_rate": 0.00018763911678407262,
"loss": 0.31782310485839843,
"mean_token_accuracy": 0.9058271765708923,
"num_tokens": 724451159.0,
"step": 9300
},
{
"entropy": 0.3298003524541855,
"epoch": 0.3723319528512265,
"grad_norm": 1.6039739847183228,
"learning_rate": 0.0001874833778239982,
"loss": 0.3229019546508789,
"mean_token_accuracy": 0.9025483858585358,
"num_tokens": 728314361.0,
"step": 9350
},
{
"entropy": 0.32751597940921784,
"epoch": 0.3743230328129978,
"grad_norm": 1.0868877172470093,
"learning_rate": 0.0001873267293615268,
"loss": 0.3307640838623047,
"mean_token_accuracy": 0.9025738561153411,
"num_tokens": 732403704.0,
"step": 9400
},
{
"entropy": 0.33524883300065994,
"epoch": 0.37631411277476906,
"grad_norm": 1.4577653408050537,
"learning_rate": 0.00018716917302522088,
"loss": 0.3307836151123047,
"mean_token_accuracy": 0.9017768156528473,
"num_tokens": 736441982.0,
"step": 9450
},
{
"entropy": 0.3285181725025177,
"epoch": 0.3783051927365403,
"grad_norm": 2.9845902919769287,
"learning_rate": 0.00018701071045308158,
"loss": 0.33323326110839846,
"mean_token_accuracy": 0.9035674440860748,
"num_tokens": 740646337.0,
"step": 9500
},
{
"entropy": 0.3377829885482788,
"epoch": 0.38029627269831157,
"grad_norm": 9.927241325378418,
"learning_rate": 0.0001868513432925314,
"loss": 0.32894989013671877,
"mean_token_accuracy": 0.9022834372520446,
"num_tokens": 744420398.0,
"step": 9550
},
{
"entropy": 0.32720001712441443,
"epoch": 0.38228735266008285,
"grad_norm": 13.3615140914917,
"learning_rate": 0.00018669107320039725,
"loss": 0.3185526657104492,
"mean_token_accuracy": 0.9035963034629821,
"num_tokens": 748222636.0,
"step": 9600
},
{
"entropy": 0.32563656270504,
"epoch": 0.38427843262185407,
"grad_norm": 1.9300962686538696,
"learning_rate": 0.0001865299018428932,
"loss": 0.32204307556152345,
"mean_token_accuracy": 0.9047492408752441,
"num_tokens": 752252628.0,
"step": 9650
},
{
"entropy": 0.3329929667711258,
"epoch": 0.38626951258362535,
"grad_norm": 1.4427231550216675,
"learning_rate": 0.00018636783089560313,
"loss": 0.32571704864501955,
"mean_token_accuracy": 0.903377760052681,
"num_tokens": 756155491.0,
"step": 9700
},
{
"entropy": 0.31390463262796403,
"epoch": 0.38826059254539663,
"grad_norm": 2.628187894821167,
"learning_rate": 0.0001862048620434632,
"loss": 0.31584739685058594,
"mean_token_accuracy": 0.9056806528568268,
"num_tokens": 759986563.0,
"step": 9750
},
{
"entropy": 0.3302036462724209,
"epoch": 0.3902516725071679,
"grad_norm": 0.9627712965011597,
"learning_rate": 0.00018604099698074465,
"loss": 0.32947277069091796,
"mean_token_accuracy": 0.9025924801826477,
"num_tokens": 763977260.0,
"step": 9800
},
{
"entropy": 0.3402106484770775,
"epoch": 0.39224275246893914,
"grad_norm": 1.7044585943222046,
"learning_rate": 0.00018587623741103584,
"loss": 0.33517219543457033,
"mean_token_accuracy": 0.8997596955299377,
"num_tokens": 767863446.0,
"step": 9850
},
{
"entropy": 0.3359699550271034,
"epoch": 0.3942338324307104,
"grad_norm": 3.5311906337738037,
"learning_rate": 0.00018571058504722468,
"loss": 0.33161392211914065,
"mean_token_accuracy": 0.9013146412372589,
"num_tokens": 771818608.0,
"step": 9900
},
{
"entropy": 0.3312606856226921,
"epoch": 0.3962249123924817,
"grad_norm": 2.716005563735962,
"learning_rate": 0.00018554404161148091,
"loss": 0.3253916549682617,
"mean_token_accuracy": 0.9028956240415573,
"num_tokens": 775679110.0,
"step": 9950
},
{
"entropy": 0.3289224162697792,
"epoch": 0.3982159923542529,
"grad_norm": 1.4217242002487183,
"learning_rate": 0.00018537660883523807,
"loss": 0.3240834808349609,
"mean_token_accuracy": 0.9021329081058502,
"num_tokens": 779749036.0,
"step": 10000
},
{
"entropy": 0.33332769259810446,
"epoch": 0.4002070723160242,
"grad_norm": 6.87371826171875,
"learning_rate": 0.00018520828845917548,
"loss": 0.32686050415039064,
"mean_token_accuracy": 0.9011375176906585,
"num_tokens": 783452539.0,
"step": 10050
},
{
"entropy": 1.0259594152867795,
"epoch": 0.4021981522777955,
"grad_norm": 3533.30126953125,
"learning_rate": 0.0001850390822332003,
"loss": 0.9963255310058594,
"mean_token_accuracy": 0.8286776062846184,
"num_tokens": 787264679.0,
"step": 10100
},
{
"entropy": 0.503859292268753,
"epoch": 0.40418923223956676,
"grad_norm": 16.601173400878906,
"learning_rate": 0.0001848689919164292,
"loss": 0.527906494140625,
"mean_token_accuracy": 0.8762823796272278,
"num_tokens": 791204711.0,
"step": 10150
},
{
"entropy": 0.33264376640319826,
"epoch": 0.406180312201338,
"grad_norm": 2.0443027019500732,
"learning_rate": 0.00018469801927717012,
"loss": 0.3257022476196289,
"mean_token_accuracy": 0.9036731535196304,
"num_tokens": 795039803.0,
"step": 10200
},
{
"entropy": 0.34522681057453153,
"epoch": 0.40817139216310927,
"grad_norm": 1.7004640102386475,
"learning_rate": 0.0001845261660929038,
"loss": 0.3389078521728516,
"mean_token_accuracy": 0.900550023317337,
"num_tokens": 798967618.0,
"step": 10250
},
{
"entropy": 0.3206296694278717,
"epoch": 0.41016247212488055,
"grad_norm": 1.374759316444397,
"learning_rate": 0.00018435343415026554,
"loss": 0.31887237548828123,
"mean_token_accuracy": 0.9031812793016434,
"num_tokens": 802807489.0,
"step": 10300
},
{
"entropy": 0.3326367573440075,
"epoch": 0.4121535520866518,
"grad_norm": 2.7548818588256836,
"learning_rate": 0.00018417982524502634,
"loss": 0.3289806365966797,
"mean_token_accuracy": 0.9024446880817414,
"num_tokens": 806748487.0,
"step": 10350
},
{
"entropy": 0.35558821737766266,
"epoch": 0.41414463204842306,
"grad_norm": 1.5409172773361206,
"learning_rate": 0.00018400534118207434,
"loss": 0.35315872192382813,
"mean_token_accuracy": 0.8966484147310257,
"num_tokens": 810571481.0,
"step": 10400
},
{
"entropy": 0.3421195350587368,
"epoch": 0.41613571201019434,
"grad_norm": 1.0726041793823242,
"learning_rate": 0.0001838299837753962,
"loss": 0.3423193359375,
"mean_token_accuracy": 0.9004592525959015,
"num_tokens": 814548459.0,
"step": 10450
},
{
"entropy": 0.346246090978384,
"epoch": 0.4181267919719656,
"grad_norm": 6.47501277923584,
"learning_rate": 0.00018365375484805796,
"loss": 0.3463835906982422,
"mean_token_accuracy": 0.8999297505617142,
"num_tokens": 818554549.0,
"step": 10500
},
{
"epoch": 0.4181267919719656,
"eval_entropy": 0.34332345946440623,
"eval_loss": 0.32466962933540344,
"eval_mean_token_accuracy": 0.897943411554609,
"eval_num_tokens": 818554549.0,
"eval_runtime": 97.8264,
"eval_samples_per_second": 10.222,
"eval_steps_per_second": 0.644,
"step": 10500
},
{
"entropy": 0.3290373648703098,
"epoch": 0.42011787193373684,
"grad_norm": 2.2451601028442383,
"learning_rate": 0.0001834766562321864,
"loss": 0.3220062255859375,
"mean_token_accuracy": 0.9034412264823913,
"num_tokens": 822366765.0,
"step": 10550
},
{
"entropy": 0.3280380629003048,
"epoch": 0.4221089518955081,
"grad_norm": 0.9720843434333801,
"learning_rate": 0.00018329868976894967,
"loss": 0.31923383712768555,
"mean_token_accuracy": 0.9032741272449494,
"num_tokens": 826285549.0,
"step": 10600
},
{
"entropy": 0.33660112977027895,
"epoch": 0.4241000318572794,
"grad_norm": 0.8592673540115356,
"learning_rate": 0.00018311985730853843,
"loss": 0.3342922210693359,
"mean_token_accuracy": 0.9008872789144516,
"num_tokens": 830046916.0,
"step": 10650
},
{
"entropy": 0.3543057516217232,
"epoch": 0.4260911118190506,
"grad_norm": 1.0152907371520996,
"learning_rate": 0.00018294016071014642,
"loss": 0.34568778991699217,
"mean_token_accuracy": 0.896729109287262,
"num_tokens": 833982631.0,
"step": 10700
},
{
"entropy": 0.3369723661243916,
"epoch": 0.4280821917808219,
"grad_norm": 0.7823643684387207,
"learning_rate": 0.00018275960184195128,
"loss": 0.33126594543457033,
"mean_token_accuracy": 0.9012682574987412,
"num_tokens": 837812830.0,
"step": 10750
},
{
"entropy": 0.3429368932545185,
"epoch": 0.4300732717425932,
"grad_norm": 1.8691685199737549,
"learning_rate": 0.000182578182581095,
"loss": 0.3399934768676758,
"mean_token_accuracy": 0.8995037811994553,
"num_tokens": 841603806.0,
"step": 10800
},
{
"entropy": 0.33411232218146325,
"epoch": 0.43206435170436447,
"grad_norm": 3.0383706092834473,
"learning_rate": 0.0001823959048136645,
"loss": 0.32936439514160154,
"mean_token_accuracy": 0.9018221443891525,
"num_tokens": 845494879.0,
"step": 10850
},
{
"entropy": 0.3343386217951775,
"epoch": 0.4340554316661357,
"grad_norm": 1.645346999168396,
"learning_rate": 0.0001822127704346719,
"loss": 0.3314424133300781,
"mean_token_accuracy": 0.9026519441604615,
"num_tokens": 849314636.0,
"step": 10900
},
{
"entropy": 0.3347695617377758,
"epoch": 0.436046511627907,
"grad_norm": 5.8606743812561035,
"learning_rate": 0.00018202878134803503,
"loss": 0.32734596252441406,
"mean_token_accuracy": 0.9020316791534424,
"num_tokens": 853257617.0,
"step": 10950
},
{
"entropy": 0.3335135568678379,
"epoch": 0.43803759158967825,
"grad_norm": 1.44121515750885,
"learning_rate": 0.0001818439394665574,
"loss": 0.3274779510498047,
"mean_token_accuracy": 0.902123721241951,
"num_tokens": 857031141.0,
"step": 11000
},
{
"entropy": 0.3393210792541504,
"epoch": 0.4400286715514495,
"grad_norm": 5.344813346862793,
"learning_rate": 0.00018165824671190843,
"loss": 0.3328717803955078,
"mean_token_accuracy": 0.9012005394697189,
"num_tokens": 860887023.0,
"step": 11050
},
{
"entropy": 0.3307928714156151,
"epoch": 0.44201975151322076,
"grad_norm": 0.6774300932884216,
"learning_rate": 0.00018147170501460353,
"loss": 0.32967548370361327,
"mean_token_accuracy": 0.9018965286016464,
"num_tokens": 864790027.0,
"step": 11100
},
{
"entropy": 0.32985477536916735,
"epoch": 0.44401083147499204,
"grad_norm": 0.8618547916412354,
"learning_rate": 0.00018128431631398394,
"loss": 0.32960365295410154,
"mean_token_accuracy": 0.9027633172273636,
"num_tokens": 868592333.0,
"step": 11150
},
{
"entropy": 0.33718678772449495,
"epoch": 0.4460019114367633,
"grad_norm": 3.609206199645996,
"learning_rate": 0.00018109608255819653,
"loss": 0.3314109420776367,
"mean_token_accuracy": 0.9008357304334641,
"num_tokens": 872508470.0,
"step": 11200
},
{
"entropy": 0.34362460523843763,
"epoch": 0.44799299139853455,
"grad_norm": 1.003614068031311,
"learning_rate": 0.00018090700570417366,
"loss": 0.3378079223632813,
"mean_token_accuracy": 0.8999038857221603,
"num_tokens": 876363185.0,
"step": 11250
},
{
"entropy": 0.3392866799235344,
"epoch": 0.4499840713603058,
"grad_norm": 0.7893933653831482,
"learning_rate": 0.00018071708771761277,
"loss": 0.3362896728515625,
"mean_token_accuracy": 0.9011469954252243,
"num_tokens": 880303922.0,
"step": 11300
},
{
"entropy": 0.33675415202975273,
"epoch": 0.4519751513220771,
"grad_norm": 1.591785192489624,
"learning_rate": 0.00018052633057295592,
"loss": 0.33205352783203124,
"mean_token_accuracy": 0.9002311301231384,
"num_tokens": 884081854.0,
"step": 11350
},
{
"entropy": 0.33132238522171975,
"epoch": 0.4539662312838484,
"grad_norm": 0.8481300473213196,
"learning_rate": 0.00018033473625336943,
"loss": 0.3324263000488281,
"mean_token_accuracy": 0.9015952390432358,
"num_tokens": 887979780.0,
"step": 11400
},
{
"entropy": 0.32730998218059537,
"epoch": 0.4559573112456196,
"grad_norm": 0.9017524719238281,
"learning_rate": 0.00018014230675072296,
"loss": 0.33089866638183596,
"mean_token_accuracy": 0.9035227233171463,
"num_tokens": 892030186.0,
"step": 11450
},
{
"entropy": 0.3259911689162254,
"epoch": 0.4579483912073909,
"grad_norm": 0.8241736888885498,
"learning_rate": 0.0001799490440655691,
"loss": 0.32311305999755857,
"mean_token_accuracy": 0.9039623945951462,
"num_tokens": 895947945.0,
"step": 11500
},
{
"entropy": 0.32894982740283013,
"epoch": 0.4599394711691622,
"grad_norm": 0.6679379940032959,
"learning_rate": 0.00017975495020712236,
"loss": 0.32866409301757815,
"mean_token_accuracy": 0.9023572719097137,
"num_tokens": 899931286.0,
"step": 11550
},
{
"entropy": 0.3283787477016449,
"epoch": 0.4619305511309334,
"grad_norm": 0.7148107290267944,
"learning_rate": 0.00017956002719323846,
"loss": 0.3312802505493164,
"mean_token_accuracy": 0.9040138351917267,
"num_tokens": 903816597.0,
"step": 11600
},
{
"entropy": 0.34928158164024353,
"epoch": 0.4639216310927047,
"grad_norm": 0.7012563347816467,
"learning_rate": 0.00017936427705039312,
"loss": 0.34329158782958985,
"mean_token_accuracy": 0.8994199293851852,
"num_tokens": 907643305.0,
"step": 11650
},
{
"entropy": 0.3263499431312084,
"epoch": 0.46591271105447596,
"grad_norm": 3.0909736156463623,
"learning_rate": 0.00017916770181366126,
"loss": 0.3217006301879883,
"mean_token_accuracy": 0.9037967169284821,
"num_tokens": 911644445.0,
"step": 11700
},
{
"entropy": 0.3224152271449566,
"epoch": 0.46790379101624724,
"grad_norm": 3.0938165187835693,
"learning_rate": 0.00017897030352669567,
"loss": 0.30827510833740235,
"mean_token_accuracy": 0.9065712589025497,
"num_tokens": 915520505.0,
"step": 11750
},
{
"entropy": 0.3168146115541458,
"epoch": 0.46989487097801846,
"grad_norm": 13.391618728637695,
"learning_rate": 0.00017877208424170582,
"loss": 0.31009477615356446,
"mean_token_accuracy": 0.9047369199991226,
"num_tokens": 919202508.0,
"step": 11800
},
{
"entropy": 0.3283210161328316,
"epoch": 0.47188595093978974,
"grad_norm": 5.35004997253418,
"learning_rate": 0.00017857304601943648,
"loss": 0.3183258056640625,
"mean_token_accuracy": 0.9028832757472992,
"num_tokens": 922999097.0,
"step": 11850
},
{
"entropy": 0.3331063890457153,
"epoch": 0.473877030901561,
"grad_norm": 1.4924137592315674,
"learning_rate": 0.00017837319092914636,
"loss": 0.3294242858886719,
"mean_token_accuracy": 0.9027070623636245,
"num_tokens": 926760951.0,
"step": 11900
},
{
"entropy": 0.3223375345766544,
"epoch": 0.47586811086333225,
"grad_norm": 2.2390682697296143,
"learning_rate": 0.00017817252104858648,
"loss": 0.31913780212402343,
"mean_token_accuracy": 0.904842980504036,
"num_tokens": 930682949.0,
"step": 11950
},
{
"entropy": 0.33492707505822183,
"epoch": 0.47785919082510353,
"grad_norm": 1.0135114192962646,
"learning_rate": 0.00017797103846397882,
"loss": 0.32693416595458985,
"mean_token_accuracy": 0.9027973359823227,
"num_tokens": 934629003.0,
"step": 12000
},
{
"epoch": 0.47785919082510353,
"eval_entropy": 0.3142273492283291,
"eval_loss": 0.2967698872089386,
"eval_mean_token_accuracy": 0.9049411766112797,
"eval_num_tokens": 934629003.0,
"eval_runtime": 98.1038,
"eval_samples_per_second": 10.193,
"eval_steps_per_second": 0.642,
"step": 12000
},
{
"entropy": 0.3153399461507797,
"epoch": 0.4798502707868748,
"grad_norm": 1.6073180437088013,
"learning_rate": 0.00017776874526999431,
"loss": 0.3167377471923828,
"mean_token_accuracy": 0.9059252417087555,
"num_tokens": 938589514.0,
"step": 12050
},
{
"entropy": 0.3352287206053734,
"epoch": 0.4818413507486461,
"grad_norm": 1.6080002784729004,
"learning_rate": 0.0001775656435697313,
"loss": 0.32828590393066404,
"mean_token_accuracy": 0.9015354603528977,
"num_tokens": 942478665.0,
"step": 12100
},
{
"entropy": 0.32980587109923365,
"epoch": 0.4838324307104173,
"grad_norm": 1.054014801979065,
"learning_rate": 0.00017736173547469358,
"loss": 0.32828296661376954,
"mean_token_accuracy": 0.9027411657571792,
"num_tokens": 946330112.0,
"step": 12150
},
{
"entropy": 0.31484507247805593,
"epoch": 0.4858235106721886,
"grad_norm": 1.0270887613296509,
"learning_rate": 0.00017715702310476842,
"loss": 0.3141517639160156,
"mean_token_accuracy": 0.9055408567190171,
"num_tokens": 950227059.0,
"step": 12200
},
{
"entropy": 0.3244850052893162,
"epoch": 0.4878145906339599,
"grad_norm": 2.9883229732513428,
"learning_rate": 0.0001769515085882046,
"loss": 0.32130313873291017,
"mean_token_accuracy": 0.9037606674432754,
"num_tokens": 954308948.0,
"step": 12250
},
{
"entropy": 0.3182083103060722,
"epoch": 0.4898056705957311,
"grad_norm": 1.0146301984786987,
"learning_rate": 0.00017674519406159022,
"loss": 0.3161518287658691,
"mean_token_accuracy": 0.9044882690906525,
"num_tokens": 958083284.0,
"step": 12300
},
{
"entropy": 0.3185697332024574,
"epoch": 0.4917967505575024,
"grad_norm": 1.2245451211929321,
"learning_rate": 0.00017653808166983055,
"loss": 0.3119895553588867,
"mean_token_accuracy": 0.9051649940013885,
"num_tokens": 961909213.0,
"step": 12350
},
{
"entropy": 0.32179706066846847,
"epoch": 0.49378783051927366,
"grad_norm": 4.297907829284668,
"learning_rate": 0.00017633017356612568,
"loss": 0.32323280334472654,
"mean_token_accuracy": 0.9024811029434204,
"num_tokens": 965715395.0,
"step": 12400
},
{
"entropy": 0.3084810623526573,
"epoch": 0.49577891048104494,
"grad_norm": 0.6699567437171936,
"learning_rate": 0.00017612147191194813,
"loss": 0.30496238708496093,
"mean_token_accuracy": 0.9064372587203979,
"num_tokens": 969651097.0,
"step": 12450
},
{
"entropy": 0.3179575477540493,
"epoch": 0.49776999044281617,
"grad_norm": 1.3979785442352295,
"learning_rate": 0.00017591197887702043,
"loss": 0.31622880935668946,
"mean_token_accuracy": 0.9055276393890381,
"num_tokens": 973561253.0,
"step": 12500
},
{
"entropy": 0.31216868028044703,
"epoch": 0.49976107040458745,
"grad_norm": 0.7845538854598999,
"learning_rate": 0.0001757016966392925,
"loss": 0.31015949249267577,
"mean_token_accuracy": 0.906750670671463,
"num_tokens": 977586836.0,
"step": 12550
},
{
"entropy": 0.3053250414133072,
"epoch": 0.5017521503663587,
"grad_norm": 3.190662145614624,
"learning_rate": 0.0001754906273849191,
"loss": 0.30805967330932615,
"mean_token_accuracy": 0.9076743638515472,
"num_tokens": 981492525.0,
"step": 12600
},
{
"entropy": 0.30219964385032655,
"epoch": 0.50374323032813,
"grad_norm": 2.1294660568237305,
"learning_rate": 0.00017527877330823696,
"loss": 0.3018102264404297,
"mean_token_accuracy": 0.9099226385354996,
"num_tokens": 985505201.0,
"step": 12650
},
{
"entropy": 0.3099065946042538,
"epoch": 0.5057343102899012,
"grad_norm": 0.6970147490501404,
"learning_rate": 0.00017506613661174208,
"loss": 0.3070409393310547,
"mean_token_accuracy": 0.9077232587337494,
"num_tokens": 989354252.0,
"step": 12700
},
{
"entropy": 0.31281920209527014,
"epoch": 0.5077253902516725,
"grad_norm": 2.2930996417999268,
"learning_rate": 0.00017485271950606687,
"loss": 0.3116877555847168,
"mean_token_accuracy": 0.9060627329349518,
"num_tokens": 993286554.0,
"step": 12750
},
{
"entropy": 0.30280036211013794,
"epoch": 0.5097164702134438,
"grad_norm": 0.7827371954917908,
"learning_rate": 0.000174638524209957,
"loss": 0.30319522857666015,
"mean_token_accuracy": 0.9087213289737701,
"num_tokens": 997343233.0,
"step": 12800
},
{
"entropy": 0.31477322295308113,
"epoch": 0.5117075501752151,
"grad_norm": 0.7464041113853455,
"learning_rate": 0.0001744235529502485,
"loss": 0.3129489135742187,
"mean_token_accuracy": 0.9058337074518203,
"num_tokens": 1001334843.0,
"step": 12850
},
{
"entropy": 0.30997680947184564,
"epoch": 0.5136986301369864,
"grad_norm": 0.6095921993255615,
"learning_rate": 0.00017420780796184446,
"loss": 0.30621599197387694,
"mean_token_accuracy": 0.9058770096302032,
"num_tokens": 1005310855.0,
"step": 12900
},
{
"entropy": 0.3065580949187279,
"epoch": 0.5156897100987575,
"grad_norm": 2.350802421569824,
"learning_rate": 0.00017399129148769194,
"loss": 0.3066014862060547,
"mean_token_accuracy": 0.908355308175087,
"num_tokens": 1009346212.0,
"step": 12950
},
{
"entropy": 0.31059773072600366,
"epoch": 0.5176807900605288,
"grad_norm": 0.8811128735542297,
"learning_rate": 0.00017377400577875862,
"loss": 0.3058795928955078,
"mean_token_accuracy": 0.9066431885957718,
"num_tokens": 1013288916.0,
"step": 13000
},
{
"entropy": 0.3080012533068657,
"epoch": 0.5196718700223001,
"grad_norm": 0.7292214632034302,
"learning_rate": 0.0001735559530940093,
"loss": 0.30621482849121096,
"mean_token_accuracy": 0.9068697249889374,
"num_tokens": 1017269907.0,
"step": 13050
},
{
"entropy": 0.29841029316186907,
"epoch": 0.5216629499840714,
"grad_norm": 0.8363134860992432,
"learning_rate": 0.0001733371357003825,
"loss": 0.2961251640319824,
"mean_token_accuracy": 0.909942420721054,
"num_tokens": 1021232491.0,
"step": 13100
},
{
"entropy": 0.3209612062573433,
"epoch": 0.5236540299458426,
"grad_norm": 0.6443411707878113,
"learning_rate": 0.00017311755587276685,
"loss": 0.32036983489990234,
"mean_token_accuracy": 0.9041855382919312,
"num_tokens": 1025059216.0,
"step": 13150
},
{
"entropy": 0.3188166154921055,
"epoch": 0.5256451099076139,
"grad_norm": 0.7593351006507874,
"learning_rate": 0.00017289721589397756,
"loss": 0.31142175674438477,
"mean_token_accuracy": 0.9049467498064041,
"num_tokens": 1028841409.0,
"step": 13200
},
{
"entropy": 0.30779171898961066,
"epoch": 0.5276361898693852,
"grad_norm": 0.720933735370636,
"learning_rate": 0.00017267611805473246,
"loss": 0.30698768615722655,
"mean_token_accuracy": 0.9066478383541107,
"num_tokens": 1032855591.0,
"step": 13250
},
{
"entropy": 0.3156025929749012,
"epoch": 0.5296272698311564,
"grad_norm": 0.8520675897598267,
"learning_rate": 0.0001724542646536284,
"loss": 0.31248844146728516,
"mean_token_accuracy": 0.9060261619091033,
"num_tokens": 1036858782.0,
"step": 13300
},
{
"entropy": 0.30919904172420504,
"epoch": 0.5316183497929277,
"grad_norm": 0.7996109127998352,
"learning_rate": 0.00017223165799711728,
"loss": 0.3059793853759766,
"mean_token_accuracy": 0.9064883595705032,
"num_tokens": 1040726732.0,
"step": 13350
},
{
"entropy": 0.31799424409866334,
"epoch": 0.5336094297546989,
"grad_norm": 0.8917890191078186,
"learning_rate": 0.00017200830039948198,
"loss": 0.3163420486450195,
"mean_token_accuracy": 0.9045793133974075,
"num_tokens": 1044542496.0,
"step": 13400
},
{
"entropy": 0.3092480516433716,
"epoch": 0.5356005097164702,
"grad_norm": 1.9236994981765747,
"learning_rate": 0.00017178419418281243,
"loss": 0.3074158096313477,
"mean_token_accuracy": 0.9063370931148529,
"num_tokens": 1048428916.0,
"step": 13450
},
{
"entropy": 0.3134460225701332,
"epoch": 0.5375915896782415,
"grad_norm": 1.0063883066177368,
"learning_rate": 0.00017155934167698144,
"loss": 0.30935720443725584,
"mean_token_accuracy": 0.9052882140874863,
"num_tokens": 1052237764.0,
"step": 13500
},
{
"epoch": 0.5375915896782415,
"eval_entropy": 0.29078047734404366,
"eval_loss": 0.29036185145378113,
"eval_mean_token_accuracy": 0.9072613971573966,
"eval_num_tokens": 1052237764.0,
"eval_runtime": 97.9425,
"eval_samples_per_second": 10.21,
"eval_steps_per_second": 0.643,
"step": 13500
},
{
"entropy": 0.3147663879394531,
"epoch": 0.5395826696400128,
"grad_norm": 0.8451830148696899,
"learning_rate": 0.00017133374521962044,
"loss": 0.3125171279907227,
"mean_token_accuracy": 0.9064455604553223,
"num_tokens": 1056119070.0,
"step": 13550
},
{
"entropy": 0.3062629546225071,
"epoch": 0.5415737496017841,
"grad_norm": 0.7669914364814758,
"learning_rate": 0.00017110740715609515,
"loss": 0.30674230575561523,
"mean_token_accuracy": 0.9074991244077683,
"num_tokens": 1059949704.0,
"step": 13600
},
{
"entropy": 0.3162059251964092,
"epoch": 0.5435648295635552,
"grad_norm": 0.7038897275924683,
"learning_rate": 0.0001708803298394813,
"loss": 0.31566192626953127,
"mean_token_accuracy": 0.9061574387550354,
"num_tokens": 1063824943.0,
"step": 13650
},
{
"entropy": 0.29972497284412386,
"epoch": 0.5455559095253265,
"grad_norm": 0.7049840092658997,
"learning_rate": 0.0001706525156305401,
"loss": 0.2954620933532715,
"mean_token_accuracy": 0.908453021645546,
"num_tokens": 1067693856.0,
"step": 13700
},
{
"entropy": 0.30088669553399083,
"epoch": 0.5475469894870978,
"grad_norm": 0.803152322769165,
"learning_rate": 0.00017042396689769364,
"loss": 0.29926998138427735,
"mean_token_accuracy": 0.9087596547603607,
"num_tokens": 1071601421.0,
"step": 13750
},
{
"entropy": 0.30597650140523913,
"epoch": 0.5495380694488691,
"grad_norm": 0.6174252033233643,
"learning_rate": 0.00017019468601700045,
"loss": 0.30020965576171876,
"mean_token_accuracy": 0.9079719346761703,
"num_tokens": 1075507557.0,
"step": 13800
},
{
"entropy": 0.3030544947087765,
"epoch": 0.5515291494106404,
"grad_norm": 0.7198078632354736,
"learning_rate": 0.00016996467537213058,
"loss": 0.3055330467224121,
"mean_token_accuracy": 0.9072394198179246,
"num_tokens": 1079464929.0,
"step": 13850
},
{
"entropy": 0.30408748909831046,
"epoch": 0.5535202293724116,
"grad_norm": 0.6543081402778625,
"learning_rate": 0.000169733937354341,
"loss": 0.2971897315979004,
"mean_token_accuracy": 0.9081903666257858,
"num_tokens": 1083442664.0,
"step": 13900
},
{
"entropy": 0.3111391983926296,
"epoch": 0.5555113093341829,
"grad_norm": 0.6148940920829773,
"learning_rate": 0.00016950247436245053,
"loss": 0.306310863494873,
"mean_token_accuracy": 0.907039784193039,
"num_tokens": 1087353509.0,
"step": 13950
},
{
"entropy": 0.29428019240498543,
"epoch": 0.5575023892959541,
"grad_norm": 0.6194506287574768,
"learning_rate": 0.00016927028880281514,
"loss": 0.29547828674316406,
"mean_token_accuracy": 0.9099029290676117,
"num_tokens": 1091242469.0,
"step": 14000
},
{
"entropy": 0.3118854616582394,
"epoch": 0.5594934692577254,
"grad_norm": 0.6568689942359924,
"learning_rate": 0.00016903738308930285,
"loss": 0.3083318138122559,
"mean_token_accuracy": 0.9061790078878402,
"num_tokens": 1095156664.0,
"step": 14050
},
{
"entropy": 0.3039117956161499,
"epoch": 0.5614845492194966,
"grad_norm": 0.5354903340339661,
"learning_rate": 0.00016880375964326846,
"loss": 0.2998150634765625,
"mean_token_accuracy": 0.9083393847942353,
"num_tokens": 1099149736.0,
"step": 14100
},
{
"entropy": 0.3004564446210861,
"epoch": 0.5634756291812679,
"grad_norm": 0.8700271844863892,
"learning_rate": 0.00016856942089352872,
"loss": 0.29739187240600584,
"mean_token_accuracy": 0.9088945603370666,
"num_tokens": 1103166304.0,
"step": 14150
},
{
"entropy": 0.3004854147136211,
"epoch": 0.5654667091430392,
"grad_norm": 0.637499988079071,
"learning_rate": 0.00016833436927633666,
"loss": 0.2929790687561035,
"mean_token_accuracy": 0.9093893361091614,
"num_tokens": 1106876529.0,
"step": 14200
},
{
"entropy": 0.3055184032022953,
"epoch": 0.5674577891048105,
"grad_norm": 0.8712766766548157,
"learning_rate": 0.00016809860723535669,
"loss": 0.2989055252075195,
"mean_token_accuracy": 0.9075117868185043,
"num_tokens": 1110762872.0,
"step": 14250
},
{
"entropy": 0.30708494916558265,
"epoch": 0.5694488690665818,
"grad_norm": 1.903483271598816,
"learning_rate": 0.00016786213722163885,
"loss": 0.3001683807373047,
"mean_token_accuracy": 0.9074388015270233,
"num_tokens": 1114612687.0,
"step": 14300
},
{
"entropy": 0.3030554646253586,
"epoch": 0.5714399490283529,
"grad_norm": 0.7355078458786011,
"learning_rate": 0.00016762496169359358,
"loss": 0.29985538482666013,
"mean_token_accuracy": 0.9085291236639023,
"num_tokens": 1118477075.0,
"step": 14350
},
{
"entropy": 0.30076363891363145,
"epoch": 0.5734310289901242,
"grad_norm": 0.8253635168075562,
"learning_rate": 0.00016738708311696593,
"loss": 0.3000423240661621,
"mean_token_accuracy": 0.9090260636806488,
"num_tokens": 1122308979.0,
"step": 14400
},
{
"entropy": 0.30372032582759856,
"epoch": 0.5754221089518955,
"grad_norm": 0.6847742199897766,
"learning_rate": 0.00016714850396481017,
"loss": 0.2999353790283203,
"mean_token_accuracy": 0.907860655784607,
"num_tokens": 1126179144.0,
"step": 14450
},
{
"entropy": 0.3549429287016392,
"epoch": 0.5774131889136668,
"grad_norm": 35.38624572753906,
"learning_rate": 0.00016690922671746386,
"loss": 0.3448126220703125,
"mean_token_accuracy": 0.8990497767925263,
"num_tokens": 1130075144.0,
"step": 14500
},
{
"entropy": 0.6645228517055511,
"epoch": 0.579404268875438,
"grad_norm": 1.238425850868225,
"learning_rate": 0.00016666925386252214,
"loss": 0.6474810791015625,
"mean_token_accuracy": 0.8487717002630234,
"num_tokens": 1134094101.0,
"step": 14550
},
{
"entropy": 0.31654783099889755,
"epoch": 0.5813953488372093,
"grad_norm": 15.627394676208496,
"learning_rate": 0.00016642858789481203,
"loss": 0.3142976760864258,
"mean_token_accuracy": 0.9052912598848343,
"num_tokens": 1137971828.0,
"step": 14600
},
{
"entropy": 0.32167117565870285,
"epoch": 0.5833864287989806,
"grad_norm": 0.7982883453369141,
"learning_rate": 0.0001661872313163662,
"loss": 0.31979732513427733,
"mean_token_accuracy": 0.9049945157766343,
"num_tokens": 1141842535.0,
"step": 14650
},
{
"entropy": 0.3142679385840893,
"epoch": 0.5853775087607518,
"grad_norm": 0.6818510890007019,
"learning_rate": 0.0001659451866363972,
"loss": 0.30938182830810546,
"mean_token_accuracy": 0.9058419001102448,
"num_tokens": 1145759897.0,
"step": 14700
},
{
"entropy": 0.2997730879485607,
"epoch": 0.5873685887225231,
"grad_norm": 0.6930510997772217,
"learning_rate": 0.00016570245637127122,
"loss": 0.29986000061035156,
"mean_token_accuracy": 0.9088831174373627,
"num_tokens": 1149589724.0,
"step": 14750
},
{
"entropy": 0.312316772788763,
"epoch": 0.5893596686842943,
"grad_norm": 0.6712312698364258,
"learning_rate": 0.00016545904304448203,
"loss": 0.3064308166503906,
"mean_token_accuracy": 0.9068194925785065,
"num_tokens": 1153496283.0,
"step": 14800
},
{
"entropy": 0.3025803528726101,
"epoch": 0.5913507486460656,
"grad_norm": 0.6911669373512268,
"learning_rate": 0.0001652149491866247,
"loss": 0.2982275390625,
"mean_token_accuracy": 0.907840421795845,
"num_tokens": 1157421693.0,
"step": 14850
},
{
"entropy": 0.29524740323424337,
"epoch": 0.5933418286078369,
"grad_norm": 0.7912169098854065,
"learning_rate": 0.0001649701773353693,
"loss": 0.29299890518188476,
"mean_token_accuracy": 0.9105656880140305,
"num_tokens": 1161399402.0,
"step": 14900
},
{
"entropy": 0.3046035374701023,
"epoch": 0.5953329085696082,
"grad_norm": 0.9637547135353088,
"learning_rate": 0.0001647247300354345,
"loss": 0.3020786666870117,
"mean_token_accuracy": 0.908284249305725,
"num_tokens": 1165069341.0,
"step": 14950
},
{
"entropy": 0.30247773334383965,
"epoch": 0.5973239885313795,
"grad_norm": 0.9919803142547607,
"learning_rate": 0.00016447860983856113,
"loss": 0.30090438842773437,
"mean_token_accuracy": 0.9087945199012757,
"num_tokens": 1169068940.0,
"step": 15000
},
{
"epoch": 0.5973239885313795,
"eval_entropy": 0.2821128155503954,
"eval_loss": 0.28751349449157715,
"eval_mean_token_accuracy": 0.9066080706460136,
"eval_num_tokens": 1169068940.0,
"eval_runtime": 97.6893,
"eval_samples_per_second": 10.237,
"eval_steps_per_second": 0.645,
"step": 15000
},
{
"entropy": 0.31097124218940736,
"epoch": 0.5993150684931506,
"grad_norm": 0.8885817527770996,
"learning_rate": 0.0001642318193034856,
"loss": 0.30851236343383787,
"mean_token_accuracy": 0.9082132822275162,
"num_tokens": 1172972451.0,
"step": 15050
},
{
"entropy": 0.31379259154200556,
"epoch": 0.6013061484549219,
"grad_norm": 1.2566955089569092,
"learning_rate": 0.00016398436099591352,
"loss": 0.3080220603942871,
"mean_token_accuracy": 0.9050265049934387,
"num_tokens": 1176806828.0,
"step": 15100
},
{
"entropy": 0.2992862512171268,
"epoch": 0.6032972284166932,
"grad_norm": 0.8937509059906006,
"learning_rate": 0.0001637362374884927,
"loss": 0.2970610237121582,
"mean_token_accuracy": 0.9087365788221359,
"num_tokens": 1180674932.0,
"step": 15150
},
{
"entropy": 0.3095300954580307,
"epoch": 0.6052883083784645,
"grad_norm": 1.584878921508789,
"learning_rate": 0.00016348745136078653,
"loss": 0.30665403366088867,
"mean_token_accuracy": 0.9072186440229416,
"num_tokens": 1184537147.0,
"step": 15200
},
{
"entropy": 0.29855361983180045,
"epoch": 0.6072793883402358,
"grad_norm": 1.3048124313354492,
"learning_rate": 0.00016323800519924735,
"loss": 0.29641626358032225,
"mean_token_accuracy": 0.9099707293510437,
"num_tokens": 1188428000.0,
"step": 15250
},
{
"entropy": 0.2976492203772068,
"epoch": 0.609270468302007,
"grad_norm": 0.6167215704917908,
"learning_rate": 0.00016298790159718926,
"loss": 0.297906379699707,
"mean_token_accuracy": 0.9093478834629058,
"num_tokens": 1192267569.0,
"step": 15300
},
{
"entropy": 0.30622323855757716,
"epoch": 0.6112615482637783,
"grad_norm": 0.7061218023300171,
"learning_rate": 0.00016273714315476136,
"loss": 0.304271354675293,
"mean_token_accuracy": 0.907381860613823,
"num_tokens": 1196019611.0,
"step": 15350
},
{
"entropy": 0.3076668280363083,
"epoch": 0.6132526282255495,
"grad_norm": 240.22381591796875,
"learning_rate": 0.00016248573247892067,
"loss": 0.30590225219726563,
"mean_token_accuracy": 0.9069288223981857,
"num_tokens": 1199742259.0,
"step": 15400
},
{
"entropy": 0.31544667705893514,
"epoch": 0.6152437081873208,
"grad_norm": 1.87211012840271,
"learning_rate": 0.000162233672183405,
"loss": 0.3146724319458008,
"mean_token_accuracy": 0.9056917190551758,
"num_tokens": 1203572364.0,
"step": 15450
},
{
"entropy": 0.3039634561538696,
"epoch": 0.617234788149092,
"grad_norm": 1.5390677452087402,
"learning_rate": 0.0001619809648887058,
"loss": 0.30161951065063475,
"mean_token_accuracy": 0.9080253195762634,
"num_tokens": 1207520141.0,
"step": 15500
},
{
"entropy": 0.31154225423932075,
"epoch": 0.6192258681108633,
"grad_norm": 0.857286810874939,
"learning_rate": 0.00016172761322204085,
"loss": 0.31182092666625977,
"mean_token_accuracy": 0.9067489957809448,
"num_tokens": 1211333212.0,
"step": 15550
},
{
"entropy": 0.31209865912795065,
"epoch": 0.6212169480726346,
"grad_norm": 0.7612581849098206,
"learning_rate": 0.0001614736198173271,
"loss": 0.3040530776977539,
"mean_token_accuracy": 0.90670563519001,
"num_tokens": 1215160534.0,
"step": 15600
},
{
"entropy": 0.29721666797995566,
"epoch": 0.6232080280344059,
"grad_norm": 0.7850686311721802,
"learning_rate": 0.00016121898731515316,
"loss": 0.291649169921875,
"mean_token_accuracy": 0.9091300505399704,
"num_tokens": 1219130947.0,
"step": 15650
},
{
"entropy": 0.30366104453802106,
"epoch": 0.6251991079961772,
"grad_norm": 1.0647870302200317,
"learning_rate": 0.00016096371836275188,
"loss": 0.302098388671875,
"mean_token_accuracy": 0.9079624992609024,
"num_tokens": 1223022715.0,
"step": 15700
},
{
"entropy": 0.3063186949491501,
"epoch": 0.6271901879579483,
"grad_norm": 0.8293745517730713,
"learning_rate": 0.0001607078156139728,
"loss": 0.3030096435546875,
"mean_token_accuracy": 0.9075041776895523,
"num_tokens": 1226895035.0,
"step": 15750
},
{
"entropy": 0.3002316528558731,
"epoch": 0.6291812679197196,
"grad_norm": 1.4709408283233643,
"learning_rate": 0.00016045128172925458,
"loss": 0.2943367767333984,
"mean_token_accuracy": 0.9096330875158309,
"num_tokens": 1230708015.0,
"step": 15800
},
{
"entropy": 0.29358057424426076,
"epoch": 0.6311723478814909,
"grad_norm": 0.8506943583488464,
"learning_rate": 0.00016019411937559747,
"loss": 0.2879058074951172,
"mean_token_accuracy": 0.9099520862102508,
"num_tokens": 1234614905.0,
"step": 15850
},
{
"entropy": 0.2941122964024544,
"epoch": 0.6331634278432622,
"grad_norm": 0.559323787689209,
"learning_rate": 0.00015993633122653533,
"loss": 0.29281805038452147,
"mean_token_accuracy": 0.9098799300193786,
"num_tokens": 1238339678.0,
"step": 15900
},
{
"entropy": 0.303873111307621,
"epoch": 0.6351545078050335,
"grad_norm": 0.6046428084373474,
"learning_rate": 0.00015967791996210798,
"loss": 0.2978951835632324,
"mean_token_accuracy": 0.9086865013837815,
"num_tokens": 1242266921.0,
"step": 15950
},
{
"entropy": 0.30071055710315703,
"epoch": 0.6371455877668047,
"grad_norm": 0.7457103133201599,
"learning_rate": 0.0001594188882688335,
"loss": 0.2999392318725586,
"mean_token_accuracy": 0.9086949378252029,
"num_tokens": 1246168678.0,
"step": 16000
},
{
"entropy": 0.29887919217348097,
"epoch": 0.639136667728576,
"grad_norm": 0.5880980491638184,
"learning_rate": 0.00015915923883967983,
"loss": 0.2973442459106445,
"mean_token_accuracy": 0.9098987239599228,
"num_tokens": 1250086915.0,
"step": 16050
},
{
"entropy": 0.29837347254157065,
"epoch": 0.6411277476903472,
"grad_norm": 0.9620305895805359,
"learning_rate": 0.0001588989743740373,
"loss": 0.2971031188964844,
"mean_token_accuracy": 0.9090900254249573,
"num_tokens": 1254079336.0,
"step": 16100
},
{
"entropy": 0.299031962454319,
"epoch": 0.6431188276521185,
"grad_norm": 0.7873280644416809,
"learning_rate": 0.0001586380975776903,
"loss": 0.29656692504882814,
"mean_token_accuracy": 0.9089064407348633,
"num_tokens": 1257957112.0,
"step": 16150
},
{
"entropy": 0.29284371227025985,
"epoch": 0.6451099076138898,
"grad_norm": 0.6219205856323242,
"learning_rate": 0.0001583766111627891,
"loss": 0.2923365020751953,
"mean_token_accuracy": 0.9103443801403046,
"num_tokens": 1261754811.0,
"step": 16200
},
{
"entropy": 0.29972797065973283,
"epoch": 0.647100987575661,
"grad_norm": 0.539088249206543,
"learning_rate": 0.00015811451784782183,
"loss": 0.2995792961120605,
"mean_token_accuracy": 0.9090916502475739,
"num_tokens": 1265832992.0,
"step": 16250
},
{
"entropy": 0.294071561396122,
"epoch": 0.6490920675374323,
"grad_norm": 0.5955763459205627,
"learning_rate": 0.0001578518203575861,
"loss": 0.2936357879638672,
"mean_token_accuracy": 0.9097523200511932,
"num_tokens": 1269767119.0,
"step": 16300
},
{
"entropy": 0.29488854959607125,
"epoch": 0.6510831474992036,
"grad_norm": 0.7521705031394958,
"learning_rate": 0.00015758852142316063,
"loss": 0.28754150390625,
"mean_token_accuracy": 0.9101364457607269,
"num_tokens": 1273614979.0,
"step": 16350
},
{
"entropy": 0.2972512972354889,
"epoch": 0.6530742274609749,
"grad_norm": 0.6611602306365967,
"learning_rate": 0.00015732462378187706,
"loss": 0.2997426986694336,
"mean_token_accuracy": 0.9092181521654129,
"num_tokens": 1277572176.0,
"step": 16400
},
{
"entropy": 0.29382382974028587,
"epoch": 0.655065307422746,
"grad_norm": 0.590353786945343,
"learning_rate": 0.0001570601301772913,
"loss": 0.29196489334106446,
"mean_token_accuracy": 0.9105822455883026,
"num_tokens": 1281466782.0,
"step": 16450
},
{
"entropy": 0.29887585699558256,
"epoch": 0.6570563873845173,
"grad_norm": 0.8136062622070312,
"learning_rate": 0.000156795043359155,
"loss": 0.2935719680786133,
"mean_token_accuracy": 0.9095307844877243,
"num_tokens": 1285329315.0,
"step": 16500
},
{
"epoch": 0.6570563873845173,
"eval_entropy": 0.2827215705599104,
"eval_loss": 0.2723085582256317,
"eval_mean_token_accuracy": 0.9104196637395828,
"eval_num_tokens": 1285329315.0,
"eval_runtime": 97.6475,
"eval_samples_per_second": 10.241,
"eval_steps_per_second": 0.645,
"step": 16500
},
{
"entropy": 0.29116875618696214,
"epoch": 0.6590474673462886,
"grad_norm": 0.6756787896156311,
"learning_rate": 0.00015652936608338708,
"loss": 0.292112979888916,
"mean_token_accuracy": 0.9107584869861602,
"num_tokens": 1289158324.0,
"step": 16550
},
{
"entropy": 0.3033373598754406,
"epoch": 0.6610385473080599,
"grad_norm": 0.5568836331367493,
"learning_rate": 0.0001562631011120451,
"loss": 0.300805835723877,
"mean_token_accuracy": 0.9088966238498688,
"num_tokens": 1293138088.0,
"step": 16600
},
{
"entropy": 0.29870939210057257,
"epoch": 0.6630296272698312,
"grad_norm": 0.4821166396141052,
"learning_rate": 0.00015599625121329633,
"loss": 0.29582101821899415,
"mean_token_accuracy": 0.9083776873350143,
"num_tokens": 1296974595.0,
"step": 16650
},
{
"entropy": 0.3019963566958904,
"epoch": 0.6650207072316024,
"grad_norm": 0.6496310234069824,
"learning_rate": 0.00015572881916138922,
"loss": 0.2965621566772461,
"mean_token_accuracy": 0.9087733340263366,
"num_tokens": 1300854839.0,
"step": 16700
},
{
"entropy": 0.3023223000764847,
"epoch": 0.6670117871933737,
"grad_norm": 0.5332936644554138,
"learning_rate": 0.00015546080773662445,
"loss": 0.30265289306640625,
"mean_token_accuracy": 0.9071105599403382,
"num_tokens": 1304789155.0,
"step": 16750
},
{
"entropy": 0.29066399201750753,
"epoch": 0.6690028671551449,
"grad_norm": 0.7210190296173096,
"learning_rate": 0.00015519221972532595,
"loss": 0.2885586166381836,
"mean_token_accuracy": 0.9106798976659775,
"num_tokens": 1308687388.0,
"step": 16800
},
{
"entropy": 0.29611540913581846,
"epoch": 0.6709939471169162,
"grad_norm": 0.6555887460708618,
"learning_rate": 0.00015492305791981207,
"loss": 0.2925202751159668,
"mean_token_accuracy": 0.9097654807567597,
"num_tokens": 1312619729.0,
"step": 16850
},
{
"entropy": 0.29771857395768164,
"epoch": 0.6729850270786875,
"grad_norm": 0.7073614597320557,
"learning_rate": 0.00015465332511836649,
"loss": 0.2960833740234375,
"mean_token_accuracy": 0.9092891854047775,
"num_tokens": 1316556214.0,
"step": 16900
},
{
"entropy": 0.3011424207687378,
"epoch": 0.6749761070404587,
"grad_norm": 0.6379684209823608,
"learning_rate": 0.00015438302412520912,
"loss": 0.2977731513977051,
"mean_token_accuracy": 0.9088351279497147,
"num_tokens": 1320381264.0,
"step": 16950
},
{
"entropy": 0.2937157228589058,
"epoch": 0.67696718700223,
"grad_norm": 0.7161999940872192,
"learning_rate": 0.00015411215775046694,
"loss": 0.2912364196777344,
"mean_token_accuracy": 0.9099707108736038,
"num_tokens": 1324178055.0,
"step": 17000
},
{
"entropy": 0.3029134801030159,
"epoch": 0.6789582669640013,
"grad_norm": 0.6558506488800049,
"learning_rate": 0.0001538407288101448,
"loss": 0.3023427200317383,
"mean_token_accuracy": 0.9085495692491531,
"num_tokens": 1328003856.0,
"step": 17050
},
{
"entropy": 0.29839008167386055,
"epoch": 0.6809493469257726,
"grad_norm": 0.6463945508003235,
"learning_rate": 0.00015356874012609616,
"loss": 0.29343448638916014,
"mean_token_accuracy": 0.9084646880626679,
"num_tokens": 1331838767.0,
"step": 17100
},
{
"entropy": 0.2972496284544468,
"epoch": 0.6829404268875438,
"grad_norm": 0.5411743521690369,
"learning_rate": 0.00015329619452599368,
"loss": 0.2923093032836914,
"mean_token_accuracy": 0.9086371755599976,
"num_tokens": 1335556122.0,
"step": 17150
},
{
"entropy": 0.30380251407623293,
"epoch": 0.684931506849315,
"grad_norm": 0.8152517080307007,
"learning_rate": 0.00015302309484330003,
"loss": 0.30057912826538086,
"mean_token_accuracy": 0.9079786992073059,
"num_tokens": 1339554013.0,
"step": 17200
},
{
"entropy": 0.2984812180697918,
"epoch": 0.6869225868110863,
"grad_norm": 0.5806976556777954,
"learning_rate": 0.00015274944391723816,
"loss": 0.29322574615478514,
"mean_token_accuracy": 0.9091445273160934,
"num_tokens": 1343281511.0,
"step": 17250
},
{
"entropy": 0.29485598862171175,
"epoch": 0.6889136667728576,
"grad_norm": 0.7114775776863098,
"learning_rate": 0.00015247524459276185,
"loss": 0.2939446830749512,
"mean_token_accuracy": 0.9100499159097671,
"num_tokens": 1347097878.0,
"step": 17300
},
{
"entropy": 0.2901600030064583,
"epoch": 0.6909047467346289,
"grad_norm": 0.68736332654953,
"learning_rate": 0.00015220049972052637,
"loss": 0.283979606628418,
"mean_token_accuracy": 0.9118931919336319,
"num_tokens": 1350909068.0,
"step": 17350
},
{
"entropy": 0.29703174635767937,
"epoch": 0.6928958266964002,
"grad_norm": 0.6926178336143494,
"learning_rate": 0.00015192521215685845,
"loss": 0.2921230697631836,
"mean_token_accuracy": 0.9102600651979447,
"num_tokens": 1354886686.0,
"step": 17400
},
{
"entropy": 0.29716769069433213,
"epoch": 0.6948869066581714,
"grad_norm": 0.9371346831321716,
"learning_rate": 0.00015164938476372702,
"loss": 0.29703765869140625,
"mean_token_accuracy": 0.9095548176765442,
"num_tokens": 1358830404.0,
"step": 17450
},
{
"entropy": 0.28911288678646085,
"epoch": 0.6968779866199426,
"grad_norm": 0.6537544131278992,
"learning_rate": 0.00015137302040871297,
"loss": 0.28646724700927734,
"mean_token_accuracy": 0.9115975719690322,
"num_tokens": 1362857525.0,
"step": 17500
},
{
"entropy": 0.29342864006757735,
"epoch": 0.6988690665817139,
"grad_norm": 0.7813704609870911,
"learning_rate": 0.0001510961219649799,
"loss": 0.2936690902709961,
"mean_token_accuracy": 0.9103942143917084,
"num_tokens": 1366849276.0,
"step": 17550
},
{
"entropy": 0.2983704087138176,
"epoch": 0.7008601465434852,
"grad_norm": 1.6893558502197266,
"learning_rate": 0.0001508186923112437,
"loss": 0.29162357330322264,
"mean_token_accuracy": 0.9090755820274353,
"num_tokens": 1370662227.0,
"step": 17600
},
{
"entropy": 0.29516899332404134,
"epoch": 0.7028512265052564,
"grad_norm": 0.8770793080329895,
"learning_rate": 0.00015054073433174302,
"loss": 0.29333614349365233,
"mean_token_accuracy": 0.9101587522029877,
"num_tokens": 1374576458.0,
"step": 17650
},
{
"entropy": 0.2941126237809658,
"epoch": 0.7048423064670277,
"grad_norm": 0.9740257263183594,
"learning_rate": 0.00015026225091620903,
"loss": 0.28899494171142576,
"mean_token_accuracy": 0.9100642812252044,
"num_tokens": 1378537578.0,
"step": 17700
},
{
"entropy": 0.2944283872842789,
"epoch": 0.706833386428799,
"grad_norm": 0.6625619530677795,
"learning_rate": 0.0001499832449598356,
"loss": 0.29200618743896484,
"mean_token_accuracy": 0.9104565042257309,
"num_tokens": 1382448767.0,
"step": 17750
},
{
"entropy": 0.2947066053748131,
"epoch": 0.7088244663905703,
"grad_norm": 2.771057605743408,
"learning_rate": 0.00014970371936324895,
"loss": 0.2908017158508301,
"mean_token_accuracy": 0.9104269522428513,
"num_tokens": 1386405902.0,
"step": 17800
},
{
"entropy": 0.29732597529888155,
"epoch": 0.7108155463523416,
"grad_norm": 0.5472576022148132,
"learning_rate": 0.0001494236770324778,
"loss": 0.29684444427490236,
"mean_token_accuracy": 0.910416322350502,
"num_tokens": 1390358474.0,
"step": 17850
},
{
"entropy": 0.29257937729358674,
"epoch": 0.7128066263141127,
"grad_norm": 1.0813127756118774,
"learning_rate": 0.0001491431208789228,
"loss": 0.2898148727416992,
"mean_token_accuracy": 0.9104039406776429,
"num_tokens": 1394304161.0,
"step": 17900
},
{
"entropy": 0.310485008507967,
"epoch": 0.714797706275884,
"grad_norm": 1.656209945678711,
"learning_rate": 0.00014886205381932664,
"loss": 0.30217992782592773,
"mean_token_accuracy": 0.9074555486440659,
"num_tokens": 1398216238.0,
"step": 17950
},
{
"entropy": 0.2969197675585747,
"epoch": 0.7167887862376553,
"grad_norm": 1.2976051568984985,
"learning_rate": 0.00014858047877574333,
"loss": 0.29079368591308596,
"mean_token_accuracy": 0.9102236968278885,
"num_tokens": 1402161098.0,
"step": 18000
},
{
"epoch": 0.7167887862376553,
"eval_entropy": 0.2776823304002247,
"eval_loss": 0.27006426453590393,
"eval_mean_token_accuracy": 0.9105973158563886,
"eval_num_tokens": 1402161098.0,
"eval_runtime": 97.7364,
"eval_samples_per_second": 10.232,
"eval_steps_per_second": 0.645,
"step": 18000
},
{
"entropy": 0.3027782902121544,
"epoch": 0.7187798661994266,
"grad_norm": 0.7084875106811523,
"learning_rate": 0.0001482983986755082,
"loss": 0.3031645965576172,
"mean_token_accuracy": 0.9077838987112046,
"num_tokens": 1406155433.0,
"step": 18050
},
{
"entropy": 0.2902723887562752,
"epoch": 0.7207709461611979,
"grad_norm": 0.6873666644096375,
"learning_rate": 0.00014801581645120724,
"loss": 0.28865398406982423,
"mean_token_accuracy": 0.9106548523902893,
"num_tokens": 1410067965.0,
"step": 18100
},
{
"entropy": 0.3013344857096672,
"epoch": 0.7227620261229691,
"grad_norm": 1.7805606126785278,
"learning_rate": 0.0001477327350406466,
"loss": 0.30110008239746094,
"mean_token_accuracy": 0.9085298550128936,
"num_tokens": 1414072722.0,
"step": 18150
},
{
"entropy": 0.28914564475417137,
"epoch": 0.7247531060847404,
"grad_norm": 0.7139489054679871,
"learning_rate": 0.00014744915738682223,
"loss": 0.2870366668701172,
"mean_token_accuracy": 0.9122559130191803,
"num_tokens": 1418102886.0,
"step": 18200
},
{
"entropy": 0.28566819444298747,
"epoch": 0.7267441860465116,
"grad_norm": 1.1385061740875244,
"learning_rate": 0.00014716508643788906,
"loss": 0.2867041015625,
"mean_token_accuracy": 0.9124609512090683,
"num_tokens": 1422071589.0,
"step": 18250
},
{
"entropy": 0.29601184636354444,
"epoch": 0.7287352660082829,
"grad_norm": 2.188579559326172,
"learning_rate": 0.00014688052514713056,
"loss": 0.2922092628479004,
"mean_token_accuracy": 0.9099663990736008,
"num_tokens": 1425915264.0,
"step": 18300
},
{
"entropy": 0.29879319921135905,
"epoch": 0.7307263459700541,
"grad_norm": 0.7400273680686951,
"learning_rate": 0.00014659547647292786,
"loss": 0.29849246978759764,
"mean_token_accuracy": 0.9087599730491638,
"num_tokens": 1429792362.0,
"step": 18350
},
{
"entropy": 0.29069077476859095,
"epoch": 0.7327174259318254,
"grad_norm": 0.7535748481750488,
"learning_rate": 0.00014630994337872907,
"loss": 0.28666929244995115,
"mean_token_accuracy": 0.9114148426055908,
"num_tokens": 1433808948.0,
"step": 18400
},
{
"entropy": 0.28963286653161047,
"epoch": 0.7347085058935967,
"grad_norm": 0.6362102031707764,
"learning_rate": 0.0001460239288330185,
"loss": 0.2875527572631836,
"mean_token_accuracy": 0.9118727374076844,
"num_tokens": 1437675494.0,
"step": 18450
},
{
"entropy": 0.293488028049469,
"epoch": 0.736699585855368,
"grad_norm": 0.7438880801200867,
"learning_rate": 0.00014573743580928577,
"loss": 0.28785888671875,
"mean_token_accuracy": 0.910496751666069,
"num_tokens": 1441521509.0,
"step": 18500
},
{
"entropy": 0.30329610586166383,
"epoch": 0.7386906658171393,
"grad_norm": 1.0525658130645752,
"learning_rate": 0.00014545046728599488,
"loss": 0.30172367095947267,
"mean_token_accuracy": 0.9077435076236725,
"num_tokens": 1445204302.0,
"step": 18550
},
{
"entropy": 0.2981826615333557,
"epoch": 0.7406817457789104,
"grad_norm": 1.3919222354888916,
"learning_rate": 0.00014516302624655326,
"loss": 0.29980438232421874,
"mean_token_accuracy": 0.9100686204433441,
"num_tokens": 1449194930.0,
"step": 18600
},
{
"entropy": 0.2883556368947029,
"epoch": 0.7426728257406817,
"grad_norm": 1.6801507472991943,
"learning_rate": 0.00014487511567928073,
"loss": 0.2883398818969727,
"mean_token_accuracy": 0.9120700871944427,
"num_tokens": 1453217275.0,
"step": 18650
},
{
"entropy": 0.2880104921758175,
"epoch": 0.744663905702453,
"grad_norm": 0.7567607760429382,
"learning_rate": 0.00014458673857737858,
"loss": 0.2865783882141113,
"mean_token_accuracy": 0.9125986665487289,
"num_tokens": 1457091456.0,
"step": 18700
},
{
"entropy": 0.30921834856271746,
"epoch": 0.7466549856642243,
"grad_norm": 2.5473389625549316,
"learning_rate": 0.00014429789793889811,
"loss": 0.30196685791015626,
"mean_token_accuracy": 0.9076807588338852,
"num_tokens": 1461061681.0,
"step": 18750
},
{
"entropy": 0.3230498093366623,
"epoch": 0.7486460656259956,
"grad_norm": 2.3257391452789307,
"learning_rate": 0.0001440085967667099,
"loss": 0.31749179840087893,
"mean_token_accuracy": 0.9054018408060074,
"num_tokens": 1464864891.0,
"step": 18800
},
{
"entropy": 0.2896036101877689,
"epoch": 0.7506371455877668,
"grad_norm": 3.0310580730438232,
"learning_rate": 0.00014371883806847219,
"loss": 0.29054962158203124,
"mean_token_accuracy": 0.9120853686332703,
"num_tokens": 1468777272.0,
"step": 18850
},
{
"entropy": 0.2924629697203636,
"epoch": 0.7526282255495381,
"grad_norm": 4.587695121765137,
"learning_rate": 0.00014342862485659997,
"loss": 0.28793231964111327,
"mean_token_accuracy": 0.9110544735193252,
"num_tokens": 1472695008.0,
"step": 18900
},
{
"entropy": 0.2869010743498802,
"epoch": 0.7546193055113093,
"grad_norm": 1.2988804578781128,
"learning_rate": 0.0001431379601482333,
"loss": 0.28417259216308594,
"mean_token_accuracy": 0.9118612110614777,
"num_tokens": 1476515856.0,
"step": 18950
},
{
"entropy": 0.2902405472099781,
"epoch": 0.7566103854730806,
"grad_norm": 1.1833847761154175,
"learning_rate": 0.00014284684696520632,
"loss": 0.28866044998168944,
"mean_token_accuracy": 0.911122555732727,
"num_tokens": 1480466260.0,
"step": 19000
},
{
"entropy": 0.30060096830129623,
"epoch": 0.7586014654348519,
"grad_norm": 0.6701699495315552,
"learning_rate": 0.00014255528833401546,
"loss": 0.2944635009765625,
"mean_token_accuracy": 0.9087423354387283,
"num_tokens": 1484335907.0,
"step": 19050
},
{
"entropy": 0.2922394719719887,
"epoch": 0.7605925453966231,
"grad_norm": 0.6822696328163147,
"learning_rate": 0.00014226328728578823,
"loss": 0.28974374771118167,
"mean_token_accuracy": 0.9104707038402557,
"num_tokens": 1488384107.0,
"step": 19100
},
{
"entropy": 0.29056561514735224,
"epoch": 0.7625836253583944,
"grad_norm": 0.663240373134613,
"learning_rate": 0.00014197084685625173,
"loss": 0.28836177825927733,
"mean_token_accuracy": 0.9108587235212326,
"num_tokens": 1492303395.0,
"step": 19150
},
{
"entropy": 0.29222132071852686,
"epoch": 0.7645747053201657,
"grad_norm": 0.961523711681366,
"learning_rate": 0.00014167797008570086,
"loss": 0.2904374313354492,
"mean_token_accuracy": 0.9102330458164215,
"num_tokens": 1496159763.0,
"step": 19200
},
{
"entropy": 0.29562861084938047,
"epoch": 0.766565785281937,
"grad_norm": 1.7865084409713745,
"learning_rate": 0.00014138466001896685,
"loss": 0.29582069396972654,
"mean_token_accuracy": 0.9101934987306595,
"num_tokens": 1499926969.0,
"step": 19250
},
{
"entropy": 0.28988956794142723,
"epoch": 0.7685568652437081,
"grad_norm": 0.6116553544998169,
"learning_rate": 0.0001410909197053857,
"loss": 0.2851591110229492,
"mean_token_accuracy": 0.9100542116165161,
"num_tokens": 1503862695.0,
"step": 19300
},
{
"entropy": 0.29101185873150826,
"epoch": 0.7705479452054794,
"grad_norm": 1.3416796922683716,
"learning_rate": 0.00014079675219876633,
"loss": 0.2863225173950195,
"mean_token_accuracy": 0.9115383142232895,
"num_tokens": 1507760784.0,
"step": 19350
},
{
"entropy": 0.2864786148071289,
"epoch": 0.7725390251672507,
"grad_norm": 0.9288985729217529,
"learning_rate": 0.00014050216055735883,
"loss": 0.28394302368164065,
"mean_token_accuracy": 0.9118870466947555,
"num_tokens": 1511621148.0,
"step": 19400
},
{
"entropy": 0.28903682947158815,
"epoch": 0.774530105129022,
"grad_norm": 0.806553065776825,
"learning_rate": 0.00014020714784382284,
"loss": 0.28795175552368163,
"mean_token_accuracy": 0.9115160834789277,
"num_tokens": 1515475336.0,
"step": 19450
},
{
"entropy": 0.2937713272869587,
"epoch": 0.7765211850907933,
"grad_norm": 0.7800868153572083,
"learning_rate": 0.00013991171712519549,
"loss": 0.2913181304931641,
"mean_token_accuracy": 0.9106004512310029,
"num_tokens": 1519341000.0,
"step": 19500
},
{
"epoch": 0.7765211850907933,
"eval_entropy": 0.2831347535053889,
"eval_loss": 0.2765350937843323,
"eval_mean_token_accuracy": 0.9100822115701342,
"eval_num_tokens": 1519341000.0,
"eval_runtime": 97.9023,
"eval_samples_per_second": 10.214,
"eval_steps_per_second": 0.643,
"step": 19500
},
{
"entropy": 0.3002046720683575,
"epoch": 0.7785122650525645,
"grad_norm": 0.9976291656494141,
"learning_rate": 0.00013961587147285959,
"loss": 0.2960696029663086,
"mean_token_accuracy": 0.9085316699743271,
"num_tokens": 1523229141.0,
"step": 19550
},
{
"entropy": 0.2912782900035381,
"epoch": 0.7805033450143358,
"grad_norm": 0.733523428440094,
"learning_rate": 0.0001393196139625118,
"loss": 0.2924472618103027,
"mean_token_accuracy": 0.9113868337869644,
"num_tokens": 1527144650.0,
"step": 19600
},
{
"entropy": 0.29683601841330526,
"epoch": 0.782494424976107,
"grad_norm": 3.6049697399139404,
"learning_rate": 0.00013902294767413053,
"loss": 0.29792266845703125,
"mean_token_accuracy": 0.9101977044343948,
"num_tokens": 1531082847.0,
"step": 19650
},
{
"entropy": 0.3064700323343277,
"epoch": 0.7844855049378783,
"grad_norm": 1.5944907665252686,
"learning_rate": 0.00013872587569194398,
"loss": 0.3019302558898926,
"mean_token_accuracy": 0.9075633251667022,
"num_tokens": 1534948012.0,
"step": 19700
},
{
"entropy": 0.29351558551192286,
"epoch": 0.7864765848996496,
"grad_norm": 1.3509517908096313,
"learning_rate": 0.00013842840110439808,
"loss": 0.28674448013305665,
"mean_token_accuracy": 0.9099786525964737,
"num_tokens": 1538734393.0,
"step": 19750
},
{
"entropy": 0.3015498013794422,
"epoch": 0.7884676648614208,
"grad_norm": 1.0253088474273682,
"learning_rate": 0.00013813052700412427,
"loss": 0.2966987419128418,
"mean_token_accuracy": 0.9085263866186142,
"num_tokens": 1542526844.0,
"step": 19800
},
{
"entropy": 0.28495381683111193,
"epoch": 0.7904587448231921,
"grad_norm": 0.5539796352386475,
"learning_rate": 0.00013783225648790755,
"loss": 0.2807819175720215,
"mean_token_accuracy": 0.9120886480808258,
"num_tokens": 1546491227.0,
"step": 19850
},
{
"entropy": 0.29954033985733985,
"epoch": 0.7924498247849634,
"grad_norm": 0.7651054859161377,
"learning_rate": 0.0001375335926566541,
"loss": 0.29225250244140627,
"mean_token_accuracy": 0.9085421603918076,
"num_tokens": 1550363335.0,
"step": 19900
},
{
"entropy": 0.30176965445280074,
"epoch": 0.7944409047467347,
"grad_norm": 0.857192873954773,
"learning_rate": 0.0001372345386153592,
"loss": 0.2950387954711914,
"mean_token_accuracy": 0.9084928894042968,
"num_tokens": 1554358423.0,
"step": 19950
},
{
"entropy": 0.2943139246106148,
"epoch": 0.7964319847085058,
"grad_norm": 1.0411840677261353,
"learning_rate": 0.00013693509747307475,
"loss": 0.2914638137817383,
"mean_token_accuracy": 0.9101592683792115,
"num_tokens": 1558255298.0,
"step": 20000
},
{
"entropy": 0.2895458571612835,
"epoch": 0.7984230646702771,
"grad_norm": 0.6626200079917908,
"learning_rate": 0.0001366352723428772,
"loss": 0.28636066436767577,
"mean_token_accuracy": 0.9115378284454345,
"num_tokens": 1562020206.0,
"step": 20050
},
{
"entropy": 0.29198448449373243,
"epoch": 0.8004141446320484,
"grad_norm": 0.5825337171554565,
"learning_rate": 0.0001363350663418349,
"loss": 0.28708467483520506,
"mean_token_accuracy": 0.9096462821960449,
"num_tokens": 1565841289.0,
"step": 20100
},
{
"entropy": 0.29816041797399523,
"epoch": 0.8024052245938197,
"grad_norm": 1.3403664827346802,
"learning_rate": 0.00013603448259097594,
"loss": 0.2884747314453125,
"mean_token_accuracy": 0.9092539829015732,
"num_tokens": 1569616432.0,
"step": 20150
},
{
"entropy": 0.28857394456863406,
"epoch": 0.804396304555591,
"grad_norm": 0.6245424151420593,
"learning_rate": 0.0001357335242152556,
"loss": 0.2860875701904297,
"mean_token_accuracy": 0.9124082696437835,
"num_tokens": 1573553700.0,
"step": 20200
},
{
"entropy": 0.28813895463943484,
"epoch": 0.8063873845173622,
"grad_norm": 1.2858823537826538,
"learning_rate": 0.00013543219434352378,
"loss": 0.28842620849609374,
"mean_token_accuracy": 0.9118660360574722,
"num_tokens": 1577421693.0,
"step": 20250
},
{
"entropy": 0.2930313354730606,
"epoch": 0.8083784644791335,
"grad_norm": 0.7111997008323669,
"learning_rate": 0.00013513049610849276,
"loss": 0.29174827575683593,
"mean_token_accuracy": 0.909861397743225,
"num_tokens": 1581253990.0,
"step": 20300
},
{
"entropy": 0.29792274728417395,
"epoch": 0.8103695444409047,
"grad_norm": 0.805564284324646,
"learning_rate": 0.00013482843264670417,
"loss": 0.29509361267089845,
"mean_token_accuracy": 0.9099700027704238,
"num_tokens": 1585185270.0,
"step": 20350
},
{
"entropy": 0.2874870964884758,
"epoch": 0.812360624402676,
"grad_norm": 1.422304391860962,
"learning_rate": 0.00013452600709849683,
"loss": 0.2821670913696289,
"mean_token_accuracy": 0.9122043216228485,
"num_tokens": 1588938656.0,
"step": 20400
},
{
"entropy": 0.2863489907979965,
"epoch": 0.8143517043644473,
"grad_norm": 0.6061295866966248,
"learning_rate": 0.00013422322260797388,
"loss": 0.2792085266113281,
"mean_token_accuracy": 0.9122142070531845,
"num_tokens": 1592889695.0,
"step": 20450
},
{
"entropy": 0.2885513660311699,
"epoch": 0.8163427843262185,
"grad_norm": 0.8144425749778748,
"learning_rate": 0.00013392008232297007,
"loss": 0.2867462158203125,
"mean_token_accuracy": 0.9113090354204177,
"num_tokens": 1596752777.0,
"step": 20500
},
{
"entropy": 0.29169064000248907,
"epoch": 0.8183338642879898,
"grad_norm": 0.6729059219360352,
"learning_rate": 0.00013361658939501918,
"loss": 0.28905179977416995,
"mean_token_accuracy": 0.9103005719184876,
"num_tokens": 1600576446.0,
"step": 20550
},
{
"entropy": 0.2888325278460979,
"epoch": 0.8203249442497611,
"grad_norm": 0.6104068756103516,
"learning_rate": 0.00013331274697932102,
"loss": 0.2853478813171387,
"mean_token_accuracy": 0.9112936478853225,
"num_tokens": 1604457022.0,
"step": 20600
},
{
"entropy": 0.2846215434372425,
"epoch": 0.8223160242115324,
"grad_norm": 0.7673185467720032,
"learning_rate": 0.00013300855823470897,
"loss": 0.27966604232788084,
"mean_token_accuracy": 0.9125616484880448,
"num_tokens": 1608292991.0,
"step": 20650
},
{
"entropy": 0.29237379983067513,
"epoch": 0.8243071041733036,
"grad_norm": 0.6417551040649414,
"learning_rate": 0.0001327040263236168,
"loss": 0.2925300216674805,
"mean_token_accuracy": 0.9110818821191787,
"num_tokens": 1612190418.0,
"step": 20700
},
{
"entropy": 0.2841272747516632,
"epoch": 0.8262981841350748,
"grad_norm": 0.7522392868995667,
"learning_rate": 0.00013239915441204595,
"loss": 0.2833536529541016,
"mean_token_accuracy": 0.9123351633548736,
"num_tokens": 1616165303.0,
"step": 20750
},
{
"entropy": 0.2900773739814758,
"epoch": 0.8282892640968461,
"grad_norm": 0.7694281339645386,
"learning_rate": 0.00013209394566953274,
"loss": 0.28611156463623044,
"mean_token_accuracy": 0.9110399371385575,
"num_tokens": 1620119842.0,
"step": 20800
},
{
"entropy": 0.2869560627639294,
"epoch": 0.8302803440586174,
"grad_norm": 0.612058162689209,
"learning_rate": 0.00013178840326911505,
"loss": 0.28881828308105467,
"mean_token_accuracy": 0.9115813100337982,
"num_tokens": 1624074063.0,
"step": 20850
},
{
"entropy": 0.28707610845565795,
"epoch": 0.8322714240203887,
"grad_norm": 4.706964015960693,
"learning_rate": 0.0001314825303872998,
"loss": 0.28341548919677734,
"mean_token_accuracy": 0.9111490190029145,
"num_tokens": 1627862759.0,
"step": 20900
},
{
"entropy": 0.29098447114229203,
"epoch": 0.83426250398216,
"grad_norm": 83.11225891113281,
"learning_rate": 0.00013117633020402948,
"loss": 0.29449493408203126,
"mean_token_accuracy": 0.9103209149837493,
"num_tokens": 1631880304.0,
"step": 20950
},
{
"entropy": 0.28104673102498057,
"epoch": 0.8362535839439312,
"grad_norm": 0.9187382459640503,
"learning_rate": 0.0001308698059026495,
"loss": 0.2771605110168457,
"mean_token_accuracy": 0.9139135485887527,
"num_tokens": 1635803010.0,
"step": 21000
},
{
"epoch": 0.8362535839439312,
"eval_entropy": 0.272681377709858,
"eval_loss": 0.2638475000858307,
"eval_mean_token_accuracy": 0.9123603133928209,
"eval_num_tokens": 1635803010.0,
"eval_runtime": 98.3478,
"eval_samples_per_second": 10.168,
"eval_steps_per_second": 0.641,
"step": 21000
},
{
"entropy": 0.27485424920916557,
"epoch": 0.8382446639057024,
"grad_norm": 0.7038730382919312,
"learning_rate": 0.00013056296066987473,
"loss": 0.27148242950439455,
"mean_token_accuracy": 0.9148015469312668,
"num_tokens": 1639495679.0,
"step": 21050
},
{
"entropy": 0.28288276672363283,
"epoch": 0.8402357438674737,
"grad_norm": 0.577369213104248,
"learning_rate": 0.00013025579769575666,
"loss": 0.28407854080200196,
"mean_token_accuracy": 0.913193479180336,
"num_tokens": 1643444580.0,
"step": 21100
},
{
"entropy": 0.2863396653532982,
"epoch": 0.842226823829245,
"grad_norm": 0.675909161567688,
"learning_rate": 0.00012994832017365,
"loss": 0.28254219055175783,
"mean_token_accuracy": 0.9116067427396775,
"num_tokens": 1647401591.0,
"step": 21150
},
{
"entropy": 0.2777939510345459,
"epoch": 0.8442179037910162,
"grad_norm": 0.6068330407142639,
"learning_rate": 0.00012964053130017965,
"loss": 0.2754404067993164,
"mean_token_accuracy": 0.9133421510457993,
"num_tokens": 1651250447.0,
"step": 21200
},
{
"entropy": 0.27697601169347763,
"epoch": 0.8462089837527875,
"grad_norm": 0.6943087577819824,
"learning_rate": 0.00012933243427520744,
"loss": 0.2733424949645996,
"mean_token_accuracy": 0.9146704155206681,
"num_tokens": 1655031979.0,
"step": 21250
},
{
"entropy": 0.28300220489501954,
"epoch": 0.8482000637145588,
"grad_norm": 0.6098906993865967,
"learning_rate": 0.00012902403230179876,
"loss": 0.27838035583496096,
"mean_token_accuracy": 0.9125377869606018,
"num_tokens": 1658919160.0,
"step": 21300
},
{
"entropy": 0.28187712758779526,
"epoch": 0.8501911436763301,
"grad_norm": 0.6931467652320862,
"learning_rate": 0.00012871532858618938,
"loss": 0.27799694061279295,
"mean_token_accuracy": 0.9131047081947327,
"num_tokens": 1662939793.0,
"step": 21350
},
{
"entropy": 0.277739409506321,
"epoch": 0.8521822236381013,
"grad_norm": 1.1240650415420532,
"learning_rate": 0.00012840632633775206,
"loss": 0.2785769462585449,
"mean_token_accuracy": 0.9145133805274963,
"num_tokens": 1666887365.0,
"step": 21400
},
{
"entropy": 0.284853600114584,
"epoch": 0.8541733035998725,
"grad_norm": 0.633203387260437,
"learning_rate": 0.00012809702876896318,
"loss": 0.283808536529541,
"mean_token_accuracy": 0.9126669526100158,
"num_tokens": 1670758104.0,
"step": 21450
},
{
"entropy": 0.2907887764275074,
"epoch": 0.8561643835616438,
"grad_norm": 0.6257302761077881,
"learning_rate": 0.00012778743909536933,
"loss": 0.28514747619628905,
"mean_token_accuracy": 0.9115799862146378,
"num_tokens": 1674580664.0,
"step": 21500
},
{
"entropy": 0.2757272598147392,
"epoch": 0.8581554635234151,
"grad_norm": 0.8768251538276672,
"learning_rate": 0.000127477560535554,
"loss": 0.2793731117248535,
"mean_token_accuracy": 0.9143383550643921,
"num_tokens": 1678625665.0,
"step": 21550
},
{
"entropy": 0.283792520314455,
"epoch": 0.8601465434851864,
"grad_norm": 0.7027562856674194,
"learning_rate": 0.0001271673963111039,
"loss": 0.2817673110961914,
"mean_token_accuracy": 0.9126435059309006,
"num_tokens": 1682588441.0,
"step": 21600
},
{
"entropy": 0.28072837233543396,
"epoch": 0.8621376234469577,
"grad_norm": 0.6573081612586975,
"learning_rate": 0.00012685694964657577,
"loss": 0.27910221099853516,
"mean_token_accuracy": 0.9130741447210312,
"num_tokens": 1686440667.0,
"step": 21650
},
{
"entropy": 0.29020294785499573,
"epoch": 0.8641287034087289,
"grad_norm": 0.8147639036178589,
"learning_rate": 0.00012654622376946244,
"loss": 0.28830547332763673,
"mean_token_accuracy": 0.9110956585407257,
"num_tokens": 1690334875.0,
"step": 21700
},
{
"entropy": 0.2864123769104481,
"epoch": 0.8661197833705001,
"grad_norm": 0.6632215976715088,
"learning_rate": 0.0001262352219101597,
"loss": 0.284028205871582,
"mean_token_accuracy": 0.9122103857994079,
"num_tokens": 1694351164.0,
"step": 21750
},
{
"entropy": 0.27724299728870394,
"epoch": 0.8681108633322714,
"grad_norm": 0.6660967469215393,
"learning_rate": 0.00012592394730193243,
"loss": 0.27416006088256833,
"mean_token_accuracy": 0.9146931290626525,
"num_tokens": 1698319175.0,
"step": 21800
},
{
"entropy": 0.2856806117296219,
"epoch": 0.8701019432940427,
"grad_norm": 0.6249071955680847,
"learning_rate": 0.00012561240318088117,
"loss": 0.2827252197265625,
"mean_token_accuracy": 0.9123916620016098,
"num_tokens": 1702324421.0,
"step": 21850
},
{
"entropy": 0.27884934067726136,
"epoch": 0.872093023255814,
"grad_norm": 0.6073641180992126,
"learning_rate": 0.00012530059278590834,
"loss": 0.2758992767333984,
"mean_token_accuracy": 0.9137480568885803,
"num_tokens": 1706271279.0,
"step": 21900
},
{
"entropy": 0.27764024019241335,
"epoch": 0.8740841032175852,
"grad_norm": 0.678048849105835,
"learning_rate": 0.00012498851935868462,
"loss": 0.2740013885498047,
"mean_token_accuracy": 0.9140461575984955,
"num_tokens": 1710144015.0,
"step": 21950
},
{
"entropy": 0.2866260698437691,
"epoch": 0.8760751831793565,
"grad_norm": 0.552971363067627,
"learning_rate": 0.00012467618614361522,
"loss": 0.2822286796569824,
"mean_token_accuracy": 0.9123277628421783,
"num_tokens": 1714077414.0,
"step": 22000
},
{
"entropy": 0.28236930549144745,
"epoch": 0.8780662631411278,
"grad_norm": 0.794441819190979,
"learning_rate": 0.00012436359638780625,
"loss": 0.2772479248046875,
"mean_token_accuracy": 0.9128434807062149,
"num_tokens": 1717927801.0,
"step": 22050
},
{
"entropy": 0.281161185503006,
"epoch": 0.880057343102899,
"grad_norm": 0.6617610454559326,
"learning_rate": 0.0001240507533410309,
"loss": 0.2774828910827637,
"mean_token_accuracy": 0.9129059422016144,
"num_tokens": 1721773313.0,
"step": 22100
},
{
"entropy": 0.2819554080069065,
"epoch": 0.8820484230646702,
"grad_norm": 0.6973550915718079,
"learning_rate": 0.00012373766025569553,
"loss": 0.28294713973999025,
"mean_token_accuracy": 0.912370182275772,
"num_tokens": 1725624454.0,
"step": 22150
},
{
"entropy": 0.27646703749895096,
"epoch": 0.8840395030264415,
"grad_norm": 0.6695847511291504,
"learning_rate": 0.00012342432038680613,
"loss": 0.2731535530090332,
"mean_token_accuracy": 0.9140887254476547,
"num_tokens": 1729506204.0,
"step": 22200
},
{
"entropy": 0.2871167133748531,
"epoch": 0.8860305829882128,
"grad_norm": 0.6398441791534424,
"learning_rate": 0.00012311073699193417,
"loss": 0.2833348655700684,
"mean_token_accuracy": 0.9114724487066269,
"num_tokens": 1733325644.0,
"step": 22250
},
{
"entropy": 0.2782342202961445,
"epoch": 0.8880216629499841,
"grad_norm": 0.7357836961746216,
"learning_rate": 0.00012279691333118295,
"loss": 0.27574146270751954,
"mean_token_accuracy": 0.9140692150592804,
"num_tokens": 1737060975.0,
"step": 22300
},
{
"entropy": 0.2777273601293564,
"epoch": 0.8900127429117554,
"grad_norm": 0.9853019118309021,
"learning_rate": 0.00012248285266715372,
"loss": 0.2757154083251953,
"mean_token_accuracy": 0.9137124174833298,
"num_tokens": 1740993084.0,
"step": 22350
},
{
"entropy": 0.28363671705126764,
"epoch": 0.8920038228735266,
"grad_norm": 1.481124997138977,
"learning_rate": 0.00012216855826491157,
"loss": 0.27882377624511717,
"mean_token_accuracy": 0.9136800271272659,
"num_tokens": 1744954440.0,
"step": 22400
},
{
"entropy": 0.294609692543745,
"epoch": 0.8939949028352978,
"grad_norm": 1.5501596927642822,
"learning_rate": 0.0001218540333919516,
"loss": 0.28765769958496096,
"mean_token_accuracy": 0.909398307800293,
"num_tokens": 1748996368.0,
"step": 22450
},
{
"entropy": 0.28076896131038664,
"epoch": 0.8959859827970691,
"grad_norm": 0.7389530539512634,
"learning_rate": 0.00012153928131816508,
"loss": 0.2751160621643066,
"mean_token_accuracy": 0.9133437407016755,
"num_tokens": 1752755641.0,
"step": 22500
},
{
"epoch": 0.8959859827970691,
"eval_entropy": 0.2637722234404276,
"eval_loss": 0.26361361145973206,
"eval_mean_token_accuracy": 0.9137998251687913,
"eval_num_tokens": 1752755641.0,
"eval_runtime": 97.9442,
"eval_samples_per_second": 10.21,
"eval_steps_per_second": 0.643,
"step": 22500
},
{
"entropy": 0.28221323758363726,
"epoch": 0.8979770627588404,
"grad_norm": 1.2229335308074951,
"learning_rate": 0.00012122430531580518,
"loss": 0.2809852981567383,
"mean_token_accuracy": 0.9124694418907165,
"num_tokens": 1756678555.0,
"step": 22550
},
{
"entropy": 0.27395280748605727,
"epoch": 0.8999681427206117,
"grad_norm": 0.9872536659240723,
"learning_rate": 0.0001209091086594532,
"loss": 0.2725690841674805,
"mean_token_accuracy": 0.9150059783458709,
"num_tokens": 1760475624.0,
"step": 22600
},
{
"entropy": 0.2766468720138073,
"epoch": 0.9019592226823829,
"grad_norm": 0.7842338681221008,
"learning_rate": 0.00012059369462598434,
"loss": 0.2731148147583008,
"mean_token_accuracy": 0.9147698014974595,
"num_tokens": 1764358750.0,
"step": 22650
},
{
"entropy": 0.2784818311035633,
"epoch": 0.9039503026441542,
"grad_norm": 1.282228946685791,
"learning_rate": 0.00012027806649453375,
"loss": 0.271495475769043,
"mean_token_accuracy": 0.9144920819997787,
"num_tokens": 1768380630.0,
"step": 22700
},
{
"entropy": 0.2735689042508602,
"epoch": 0.9059413826059255,
"grad_norm": 0.7193032503128052,
"learning_rate": 0.00011996222754646243,
"loss": 0.2712744140625,
"mean_token_accuracy": 0.9150397133827209,
"num_tokens": 1772361438.0,
"step": 22750
},
{
"entropy": 0.2756591281294823,
"epoch": 0.9079324625676968,
"grad_norm": 1.0555336475372314,
"learning_rate": 0.00011964618106532305,
"loss": 0.2744468688964844,
"mean_token_accuracy": 0.9148192751407623,
"num_tokens": 1776341205.0,
"step": 22800
},
{
"entropy": 0.27616533294320106,
"epoch": 0.9099235425294679,
"grad_norm": 1.0314396619796753,
"learning_rate": 0.00011932993033682594,
"loss": 0.27454004287719724,
"mean_token_accuracy": 0.9143799149990082,
"num_tokens": 1780235661.0,
"step": 22850
},
{
"entropy": 0.26893782630562785,
"epoch": 0.9119146224912392,
"grad_norm": 1.0618172883987427,
"learning_rate": 0.00011901347864880465,
"loss": 0.2655687141418457,
"mean_token_accuracy": 0.9161686682701111,
"num_tokens": 1784043451.0,
"step": 22900
},
{
"entropy": 0.27906202867627145,
"epoch": 0.9139057024530105,
"grad_norm": 2.1218345165252686,
"learning_rate": 0.00011869682929118218,
"loss": 0.2727456474304199,
"mean_token_accuracy": 0.9137376379966736,
"num_tokens": 1787896121.0,
"step": 22950
},
{
"entropy": 0.27811609491705896,
"epoch": 0.9158967824147818,
"grad_norm": 3.4673054218292236,
"learning_rate": 0.00011837998555593641,
"loss": 0.2778665542602539,
"mean_token_accuracy": 0.9137892138957977,
"num_tokens": 1791848628.0,
"step": 23000
},
{
"entropy": 0.2751833336055279,
"epoch": 0.9178878623765531,
"grad_norm": 1.046271800994873,
"learning_rate": 0.00011806295073706616,
"loss": 0.2735797691345215,
"mean_token_accuracy": 0.9143856483697891,
"num_tokens": 1795804119.0,
"step": 23050
},
{
"entropy": 0.2802681289613247,
"epoch": 0.9198789423383243,
"grad_norm": 0.8259762525558472,
"learning_rate": 0.00011774572813055664,
"loss": 0.2742568016052246,
"mean_token_accuracy": 0.9139988601207734,
"num_tokens": 1799488591.0,
"step": 23100
},
{
"entropy": 0.278084037899971,
"epoch": 0.9218700223000956,
"grad_norm": 0.6955431699752808,
"learning_rate": 0.00011742832103434554,
"loss": 0.2744667434692383,
"mean_token_accuracy": 0.914206195473671,
"num_tokens": 1803610334.0,
"step": 23150
},
{
"entropy": 0.2704257676005363,
"epoch": 0.9238611022618668,
"grad_norm": 0.672705352306366,
"learning_rate": 0.0001171107327482884,
"loss": 0.2704540061950684,
"mean_token_accuracy": 0.9158248662948608,
"num_tokens": 1807570820.0,
"step": 23200
},
{
"entropy": 0.2817454455792904,
"epoch": 0.9258521822236381,
"grad_norm": 0.9053704738616943,
"learning_rate": 0.00011679296657412457,
"loss": 0.2776220703125,
"mean_token_accuracy": 0.9126688486337662,
"num_tokens": 1811374443.0,
"step": 23250
},
{
"entropy": 0.2809554924070835,
"epoch": 0.9278432621854094,
"grad_norm": 0.7101280689239502,
"learning_rate": 0.00011647502581544272,
"loss": 0.2807320022583008,
"mean_token_accuracy": 0.9124188989400863,
"num_tokens": 1815335476.0,
"step": 23300
},
{
"entropy": 0.2801722341775894,
"epoch": 0.9298343421471806,
"grad_norm": 0.9088023900985718,
"learning_rate": 0.0001161569137776466,
"loss": 0.2738960838317871,
"mean_token_accuracy": 0.9143745040893555,
"num_tokens": 1819119258.0,
"step": 23350
},
{
"entropy": 0.279843023866415,
"epoch": 0.9318254221089519,
"grad_norm": 0.7811700105667114,
"learning_rate": 0.0001158386337679205,
"loss": 0.27740699768066407,
"mean_token_accuracy": 0.9128563135862351,
"num_tokens": 1822965082.0,
"step": 23400
},
{
"entropy": 0.2781392467021942,
"epoch": 0.9338165020707232,
"grad_norm": 0.5838942527770996,
"learning_rate": 0.00011552018909519516,
"loss": 0.2734776496887207,
"mean_token_accuracy": 0.9132671678066253,
"num_tokens": 1826899316.0,
"step": 23450
},
{
"entropy": 0.28047511413693427,
"epoch": 0.9358075820324945,
"grad_norm": 3.2033631801605225,
"learning_rate": 0.00011520158307011313,
"loss": 0.27559213638305663,
"mean_token_accuracy": 0.9144525969028473,
"num_tokens": 1830712474.0,
"step": 23500
},
{
"entropy": 0.2832055461406708,
"epoch": 0.9377986619942656,
"grad_norm": 28.602519989013672,
"learning_rate": 0.00011488281900499443,
"loss": 0.2764240074157715,
"mean_token_accuracy": 0.9124950170516968,
"num_tokens": 1834596753.0,
"step": 23550
},
{
"entropy": 0.3014590518176556,
"epoch": 0.9397897419560369,
"grad_norm": 17.5722599029541,
"learning_rate": 0.00011456390021380206,
"loss": 0.29091754913330076,
"mean_token_accuracy": 0.9100847208499908,
"num_tokens": 1838467819.0,
"step": 23600
},
{
"entropy": 0.29293319925665856,
"epoch": 0.9417808219178082,
"grad_norm": 10.521018028259277,
"learning_rate": 0.00011424483001210768,
"loss": 0.28235774993896484,
"mean_token_accuracy": 0.9123268640041351,
"num_tokens": 1842299724.0,
"step": 23650
},
{
"entropy": 0.27152210757136347,
"epoch": 0.9437719018795795,
"grad_norm": 16.392244338989258,
"learning_rate": 0.000113925611717057,
"loss": 0.27001758575439455,
"mean_token_accuracy": 0.9153967237472534,
"num_tokens": 1846207939.0,
"step": 23700
},
{
"entropy": 0.27423043057322505,
"epoch": 0.9457629818413508,
"grad_norm": 161.79493713378906,
"learning_rate": 0.00011360624864733542,
"loss": 0.2701198959350586,
"mean_token_accuracy": 0.9150199323892594,
"num_tokens": 1850200783.0,
"step": 23750
},
{
"entropy": 0.2868032360076904,
"epoch": 0.947754061803122,
"grad_norm": 34.27143478393555,
"learning_rate": 0.00011328674412313338,
"loss": 0.2828762435913086,
"mean_token_accuracy": 0.910566845536232,
"num_tokens": 1853983913.0,
"step": 23800
},
{
"entropy": 0.28378346920013425,
"epoch": 0.9497451417648933,
"grad_norm": 19.305675506591797,
"learning_rate": 0.00011296710146611191,
"loss": 0.27950349807739255,
"mean_token_accuracy": 0.9141000217199325,
"num_tokens": 1858015165.0,
"step": 23850
},
{
"entropy": 0.2722449879348278,
"epoch": 0.9517362217266645,
"grad_norm": 5.517458915710449,
"learning_rate": 0.00011264732399936821,
"loss": 0.27257476806640624,
"mean_token_accuracy": 0.915144516825676,
"num_tokens": 1862150874.0,
"step": 23900
},
{
"entropy": 0.28292769208550456,
"epoch": 0.9537273016884358,
"grad_norm": 4.40126371383667,
"learning_rate": 0.00011232741504740095,
"loss": 0.2809117317199707,
"mean_token_accuracy": 0.912839834690094,
"num_tokens": 1865854098.0,
"step": 23950
},
{
"entropy": 0.27857477843761447,
"epoch": 0.9557183816502071,
"grad_norm": 5.774588584899902,
"learning_rate": 0.00011200737793607572,
"loss": 0.2793265914916992,
"mean_token_accuracy": 0.9136429125070572,
"num_tokens": 1869802187.0,
"step": 24000
},
{
"epoch": 0.9557183816502071,
"eval_entropy": 0.2723109987046983,
"eval_loss": 0.25965479016304016,
"eval_mean_token_accuracy": 0.9130434602025955,
"eval_num_tokens": 1869802187.0,
"eval_runtime": 97.8102,
"eval_samples_per_second": 10.224,
"eval_steps_per_second": 0.644,
"step": 24000
},
{
"entropy": 0.6563278517127037,
"epoch": 0.9577094616119783,
"grad_norm": 39.699913024902344,
"learning_rate": 0.00011168721599259049,
"loss": 0.6549944305419921,
"mean_token_accuracy": 0.8380170410871506,
"num_tokens": 1873744084.0,
"step": 24050
},
{
"entropy": 0.4795880228281021,
"epoch": 0.9597005415737496,
"grad_norm": 1335.2706298828125,
"learning_rate": 0.0001113669325454411,
"loss": 0.45922279357910156,
"mean_token_accuracy": 0.8766013658046723,
"num_tokens": 1877664337.0,
"step": 24100
},
{
"entropy": 0.36844881772995,
"epoch": 0.9616916215355209,
"grad_norm": 125.4538803100586,
"learning_rate": 0.00011104653092438652,
"loss": 0.357088623046875,
"mean_token_accuracy": 0.899301546216011,
"num_tokens": 1881595432.0,
"step": 24150
},
{
"entropy": 0.37986351013183595,
"epoch": 0.9636827014972922,
"grad_norm": 41.903934478759766,
"learning_rate": 0.00011072601446041435,
"loss": 0.3584012222290039,
"mean_token_accuracy": 0.8966500133275985,
"num_tokens": 1885438520.0,
"step": 24200
},
{
"entropy": 0.39044318586587906,
"epoch": 0.9656737814590634,
"grad_norm": 44.811279296875,
"learning_rate": 0.00011040538648570596,
"loss": 0.36628631591796873,
"mean_token_accuracy": 0.8948707044124603,
"num_tokens": 1889295407.0,
"step": 24250
},
{
"entropy": 0.33998255178332326,
"epoch": 0.9676648614208346,
"grad_norm": 57.77637481689453,
"learning_rate": 0.00011008465033360225,
"loss": 0.32590660095214846,
"mean_token_accuracy": 0.9039149129390717,
"num_tokens": 1893118198.0,
"step": 24300
},
{
"entropy": 0.32903214752674104,
"epoch": 0.9696559413826059,
"grad_norm": 51.61495590209961,
"learning_rate": 0.00010976380933856858,
"loss": 0.32896270751953127,
"mean_token_accuracy": 0.9040062379837036,
"num_tokens": 1897060288.0,
"step": 24350
},
{
"entropy": 0.3667915537953377,
"epoch": 0.9716470213443772,
"grad_norm": 47.6137580871582,
"learning_rate": 0.0001094428668361604,
"loss": 0.35173583984375,
"mean_token_accuracy": 0.8967252117395401,
"num_tokens": 1900824780.0,
"step": 24400
},
{
"entropy": 0.349236313700676,
"epoch": 0.9736381013061485,
"grad_norm": 64.8992919921875,
"learning_rate": 0.00010912182616298838,
"loss": 0.33668148040771484,
"mean_token_accuracy": 0.903141537308693,
"num_tokens": 1904750342.0,
"step": 24450
},
{
"entropy": 0.35872448712587357,
"epoch": 0.9756291812679198,
"grad_norm": 11.008445739746094,
"learning_rate": 0.0001088006906566839,
"loss": 0.34439208984375,
"mean_token_accuracy": 0.8992702323198318,
"num_tokens": 1908808184.0,
"step": 24500
},
{
"entropy": 0.33843471750617027,
"epoch": 0.977620261229691,
"grad_norm": 15.063654899597168,
"learning_rate": 0.00010847946365586413,
"loss": 0.3207670974731445,
"mean_token_accuracy": 0.9043490439653397,
"num_tokens": 1912630065.0,
"step": 24550
},
{
"entropy": 0.4166515836119652,
"epoch": 0.9796113411914622,
"grad_norm": 665.3616333007812,
"learning_rate": 0.00010815814850009753,
"loss": 0.39070816040039064,
"mean_token_accuracy": 0.8894343000650405,
"num_tokens": 1916567398.0,
"step": 24600
},
{
"entropy": 0.3832103142142296,
"epoch": 0.9816024211532335,
"grad_norm": 145.4870147705078,
"learning_rate": 0.00010783674852986903,
"loss": 0.363221435546875,
"mean_token_accuracy": 0.895402774810791,
"num_tokens": 1920587404.0,
"step": 24650
},
{
"entropy": 0.35218898981809615,
"epoch": 0.9835935011150048,
"grad_norm": 288.9332580566406,
"learning_rate": 0.00010751526708654531,
"loss": 0.3388285827636719,
"mean_token_accuracy": 0.9000647193193436,
"num_tokens": 1924451590.0,
"step": 24700
},
{
"entropy": 0.363860125541687,
"epoch": 0.985584581076776,
"grad_norm": 128.26956176757812,
"learning_rate": 0.00010719370751234003,
"loss": 0.34467056274414065,
"mean_token_accuracy": 0.8984408980607986,
"num_tokens": 1928295240.0,
"step": 24750
},
{
"entropy": 0.332768639922142,
"epoch": 0.9875756610385473,
"grad_norm": 9.291278839111328,
"learning_rate": 0.00010687207315027919,
"loss": 0.3231398773193359,
"mean_token_accuracy": 0.9035398948192597,
"num_tokens": 1932020575.0,
"step": 24800
},
{
"entropy": 0.32511512815952304,
"epoch": 0.9895667410003186,
"grad_norm": 12.312918663024902,
"learning_rate": 0.00010655036734416624,
"loss": 0.3185703086853027,
"mean_token_accuracy": 0.9060599678754806,
"num_tokens": 1936014439.0,
"step": 24850
},
{
"entropy": 0.3694388023018837,
"epoch": 0.9915578209620899,
"grad_norm": 1.855156421661377,
"learning_rate": 0.00010622859343854743,
"loss": 0.357412223815918,
"mean_token_accuracy": 0.8961717420816422,
"num_tokens": 1939922696.0,
"step": 24900
},
{
"entropy": 0.35190608859062195,
"epoch": 0.9935489009238611,
"grad_norm": 79.05413818359375,
"learning_rate": 0.000105906754778677,
"loss": 0.3574227523803711,
"mean_token_accuracy": 0.8979073971509933,
"num_tokens": 1944061420.0,
"step": 24950
},
{
"entropy": 0.3361901544034481,
"epoch": 0.9955399808856323,
"grad_norm": 14.088053703308105,
"learning_rate": 0.00010558485471048232,
"loss": 0.3378467559814453,
"mean_token_accuracy": 0.9023239356279373,
"num_tokens": 1948190479.0,
"step": 25000
},
{
"entropy": 0.3119985489547253,
"epoch": 0.9975310608474036,
"grad_norm": 35.4752082824707,
"learning_rate": 0.00010526289658052926,
"loss": 0.30782127380371094,
"mean_token_accuracy": 0.9068952518701553,
"num_tokens": 1952114636.0,
"step": 25050
},
{
"entropy": 0.2962914815545082,
"epoch": 0.9995221408091749,
"grad_norm": 27.441314697265625,
"learning_rate": 0.00010494088373598727,
"loss": 0.2854899215698242,
"mean_token_accuracy": 0.9109463971853257,
"num_tokens": 1955930483.0,
"step": 25100
},
{
"entropy": 0.28696138501167295,
"epoch": 1.001513220770946,
"grad_norm": 3.6715400218963623,
"learning_rate": 0.00010461881952459469,
"loss": 0.28212398529052735,
"mean_token_accuracy": 0.9123009568452836,
"num_tokens": 1959705137.0,
"step": 25150
},
{
"entropy": 0.26907322466373446,
"epoch": 1.0035043007327173,
"grad_norm": 28.90825843811035,
"learning_rate": 0.00010429670729462373,
"loss": 0.2622692680358887,
"mean_token_accuracy": 0.9167272865772247,
"num_tokens": 1963657615.0,
"step": 25200
},
{
"entropy": 0.2590576921403408,
"epoch": 1.0054953806944886,
"grad_norm": 4.9817585945129395,
"learning_rate": 0.00010397455039484605,
"loss": 0.2512243843078613,
"mean_token_accuracy": 0.9190041106939316,
"num_tokens": 1967587403.0,
"step": 25250
},
{
"entropy": 0.25928459629416467,
"epoch": 1.00748646065626,
"grad_norm": 3.129709482192993,
"learning_rate": 0.0001036523521744975,
"loss": 0.25957672119140623,
"mean_token_accuracy": 0.9176103568077087,
"num_tokens": 1971448796.0,
"step": 25300
},
{
"entropy": 0.26116902694106103,
"epoch": 1.0094775406180312,
"grad_norm": 10.038873672485352,
"learning_rate": 0.00010333011598324363,
"loss": 0.25494049072265623,
"mean_token_accuracy": 0.9185484343767166,
"num_tokens": 1975297418.0,
"step": 25350
},
{
"entropy": 0.27020337790250776,
"epoch": 1.0114686205798025,
"grad_norm": 5.4823174476623535,
"learning_rate": 0.00010300784517114466,
"loss": 0.26545324325561526,
"mean_token_accuracy": 0.9158938974142075,
"num_tokens": 1979155438.0,
"step": 25400
},
{
"entropy": 0.26256797939538956,
"epoch": 1.0134597005415737,
"grad_norm": 36.92467498779297,
"learning_rate": 0.00010268554308862088,
"loss": 0.2575288009643555,
"mean_token_accuracy": 0.9181166028976441,
"num_tokens": 1983024409.0,
"step": 25450
},
{
"entropy": 0.29766422316432,
"epoch": 1.015450780503345,
"grad_norm": 26.67340660095215,
"learning_rate": 0.0001023632130864175,
"loss": 0.2937025451660156,
"mean_token_accuracy": 0.9106646543741226,
"num_tokens": 1986958622.0,
"step": 25500
},
{
"epoch": 1.015450780503345,
"eval_entropy": 0.2694250995677615,
"eval_loss": 0.2797989845275879,
"eval_mean_token_accuracy": 0.9101072105150374,
"eval_num_tokens": 1986958622.0,
"eval_runtime": 97.8746,
"eval_samples_per_second": 10.217,
"eval_steps_per_second": 0.644,
"step": 25500
},
{
"entropy": 0.28613715797662737,
"epoch": 1.0174418604651163,
"grad_norm": 9088.736328125,
"learning_rate": 0.00010204085851557011,
"loss": 0.27716789245605467,
"mean_token_accuracy": 0.9129116219282151,
"num_tokens": 1990813233.0,
"step": 25550
},
{
"entropy": 0.27504936650395395,
"epoch": 1.0194329404268876,
"grad_norm": 38.234413146972656,
"learning_rate": 0.00010171848272736968,
"loss": 0.26801122665405275,
"mean_token_accuracy": 0.9150198262929916,
"num_tokens": 1994731019.0,
"step": 25600
},
{
"entropy": 0.25914262115955355,
"epoch": 1.0214240203886589,
"grad_norm": 27.66782569885254,
"learning_rate": 0.0001013960890733278,
"loss": 0.25058454513549805,
"mean_token_accuracy": 0.9187197256088256,
"num_tokens": 1998645827.0,
"step": 25650
},
{
"entropy": 0.2702752210199833,
"epoch": 1.0234151003504302,
"grad_norm": 86.97796630859375,
"learning_rate": 0.00010107368090514173,
"loss": 0.2650441551208496,
"mean_token_accuracy": 0.9166213870048523,
"num_tokens": 2002590388.0,
"step": 25700
},
{
"entropy": 0.26510491490364074,
"epoch": 1.0254061803122014,
"grad_norm": 2.416658878326416,
"learning_rate": 0.00010075126157465969,
"loss": 0.26374332427978514,
"mean_token_accuracy": 0.9164919888973236,
"num_tokens": 2006390464.0,
"step": 25750
},
{
"entropy": 0.2767194920778275,
"epoch": 1.0273972602739727,
"grad_norm": 121.55948638916016,
"learning_rate": 0.00010042883443384588,
"loss": 0.2746761322021484,
"mean_token_accuracy": 0.9133573430776596,
"num_tokens": 2010376074.0,
"step": 25800
},
{
"entropy": 0.2857384331524372,
"epoch": 1.0293883402357438,
"grad_norm": 8.534170150756836,
"learning_rate": 0.00010010640283474577,
"loss": 0.27749507904052734,
"mean_token_accuracy": 0.9122277122735977,
"num_tokens": 2014314880.0,
"step": 25850
},
{
"entropy": 0.2771646900475025,
"epoch": 1.031379420197515,
"grad_norm": 14.0018949508667,
"learning_rate": 9.978397012945118e-05,
"loss": 0.27255733489990236,
"mean_token_accuracy": 0.9154339116811753,
"num_tokens": 2018153993.0,
"step": 25900
},
{
"entropy": 0.2549267649650574,
"epoch": 1.0333705001592863,
"grad_norm": 141.65396118164062,
"learning_rate": 9.946153967006528e-05,
"loss": 0.25027942657470703,
"mean_token_accuracy": 0.9198796671628952,
"num_tokens": 2021908727.0,
"step": 25950
},
{
"entropy": 0.2677805428206921,
"epoch": 1.0353615801210576,
"grad_norm": 19253.08984375,
"learning_rate": 9.913911480866817e-05,
"loss": 0.2630371856689453,
"mean_token_accuracy": 0.916558683514595,
"num_tokens": 2025550628.0,
"step": 26000
},
{
"entropy": 0.2855284099280834,
"epoch": 1.037352660082829,
"grad_norm": 127.2653579711914,
"learning_rate": 9.881669889728144e-05,
"loss": 0.28463106155395507,
"mean_token_accuracy": 0.9130609530210495,
"num_tokens": 2029278311.0,
"step": 26050
},
{
"entropy": 0.29474446415901184,
"epoch": 1.0393437400446002,
"grad_norm": 43.862098693847656,
"learning_rate": 9.849429528783385e-05,
"loss": 0.28278093338012694,
"mean_token_accuracy": 0.9114625084400177,
"num_tokens": 2033259136.0,
"step": 26100
},
{
"entropy": 0.30185434013605117,
"epoch": 1.0413348200063715,
"grad_norm": 5.1499857902526855,
"learning_rate": 9.817190733212623e-05,
"loss": 0.2916604995727539,
"mean_token_accuracy": 0.9096384018659591,
"num_tokens": 2037052103.0,
"step": 26150
},
{
"entropy": 0.29071212783455846,
"epoch": 1.0433258999681427,
"grad_norm": 364.8683776855469,
"learning_rate": 9.784953838179657e-05,
"loss": 0.28531660079956056,
"mean_token_accuracy": 0.9106332343816758,
"num_tokens": 2040924159.0,
"step": 26200
},
{
"entropy": 0.27380838453769685,
"epoch": 1.045316979929914,
"grad_norm": 8.768333435058594,
"learning_rate": 9.752719178828534e-05,
"loss": 0.2673329734802246,
"mean_token_accuracy": 0.9157132452726364,
"num_tokens": 2044692885.0,
"step": 26250
},
{
"entropy": 0.2756735447049141,
"epoch": 1.0473080598916853,
"grad_norm": 107.49151611328125,
"learning_rate": 9.72048709028007e-05,
"loss": 0.2699962425231934,
"mean_token_accuracy": 0.9157623893022537,
"num_tokens": 2048454708.0,
"step": 26300
},
{
"entropy": 0.29151566803455353,
"epoch": 1.0492991398534566,
"grad_norm": 85.45984649658203,
"learning_rate": 9.688257907628326e-05,
"loss": 0.2861785888671875,
"mean_token_accuracy": 0.9122406727075577,
"num_tokens": 2052418372.0,
"step": 26350
},
{
"entropy": 0.27055223628878594,
"epoch": 1.0512902198152279,
"grad_norm": 3.6944844722747803,
"learning_rate": 9.656031965937183e-05,
"loss": 0.2670576858520508,
"mean_token_accuracy": 0.9155509883165359,
"num_tokens": 2056406304.0,
"step": 26400
},
{
"entropy": 0.2726173362135887,
"epoch": 1.0532812997769991,
"grad_norm": 71.38996887207031,
"learning_rate": 9.623809600236805e-05,
"loss": 0.2644667625427246,
"mean_token_accuracy": 0.9153118109703064,
"num_tokens": 2060233499.0,
"step": 26450
},
{
"entropy": 0.27969068244099615,
"epoch": 1.0552723797387704,
"grad_norm": 320.3172607421875,
"learning_rate": 9.591591145520193e-05,
"loss": 0.2756903457641602,
"mean_token_accuracy": 0.9137703001499176,
"num_tokens": 2064138841.0,
"step": 26500
},
{
"entropy": 0.2718262220919132,
"epoch": 1.0572634597005415,
"grad_norm": 8.090370178222656,
"learning_rate": 9.559376936739682e-05,
"loss": 0.2698848342895508,
"mean_token_accuracy": 0.9147110247611999,
"num_tokens": 2067856174.0,
"step": 26550
},
{
"entropy": 0.2986389592289925,
"epoch": 1.0592545396623128,
"grad_norm": 11.137097358703613,
"learning_rate": 9.527167308803465e-05,
"loss": 0.3257150650024414,
"mean_token_accuracy": 0.910808190703392,
"num_tokens": 2071739841.0,
"step": 26600
},
{
"entropy": 0.3147141246497631,
"epoch": 1.061245619624084,
"grad_norm": 7.234685897827148,
"learning_rate": 9.494962596572111e-05,
"loss": 0.3103673553466797,
"mean_token_accuracy": 0.9063691395521164,
"num_tokens": 2075735990.0,
"step": 26650
},
{
"entropy": 0.31178212597966193,
"epoch": 1.0632366995858553,
"grad_norm": 8.27217960357666,
"learning_rate": 9.462763134855093e-05,
"loss": 0.3050539016723633,
"mean_token_accuracy": 0.9069130408763886,
"num_tokens": 2079589023.0,
"step": 26700
},
{
"entropy": 0.3006526806950569,
"epoch": 1.0652277795476266,
"grad_norm": 11.008944511413574,
"learning_rate": 9.430569258407283e-05,
"loss": 0.29765275955200193,
"mean_token_accuracy": 0.9091472399234771,
"num_tokens": 2083622258.0,
"step": 26750
},
{
"entropy": 0.29270223453640937,
"epoch": 1.0672188595093979,
"grad_norm": 3.3960471153259277,
"learning_rate": 9.398381301925499e-05,
"loss": 0.2888037872314453,
"mean_token_accuracy": 0.9113785433769226,
"num_tokens": 2087604238.0,
"step": 26800
},
{
"entropy": 0.28832288086414337,
"epoch": 1.0692099394711692,
"grad_norm": 19.040067672729492,
"learning_rate": 9.366199600045005e-05,
"loss": 0.28535903930664064,
"mean_token_accuracy": 0.9119643104076386,
"num_tokens": 2091472329.0,
"step": 26850
},
{
"entropy": 0.2806944952905178,
"epoch": 1.0712010194329404,
"grad_norm": 15.679569244384766,
"learning_rate": 9.334024487336048e-05,
"loss": 0.2734016227722168,
"mean_token_accuracy": 0.9133606183528901,
"num_tokens": 2095395642.0,
"step": 26900
},
{
"entropy": 0.28680155262351037,
"epoch": 1.0731920993947117,
"grad_norm": 1.7365965843200684,
"learning_rate": 9.301856298300369e-05,
"loss": 0.27998071670532226,
"mean_token_accuracy": 0.9116964995861053,
"num_tokens": 2099217252.0,
"step": 26950
},
{
"entropy": 0.29625475078821184,
"epoch": 1.075183179356483,
"grad_norm": 6.737451076507568,
"learning_rate": 9.26969536736772e-05,
"loss": 0.28877586364746094,
"mean_token_accuracy": 0.9105580598115921,
"num_tokens": 2103184387.0,
"step": 27000
},
{
"epoch": 1.075183179356483,
"eval_entropy": 0.29035906659232247,
"eval_loss": 0.2825865149497986,
"eval_mean_token_accuracy": 0.9076645118849618,
"eval_num_tokens": 2103184387.0,
"eval_runtime": 98.213,
"eval_samples_per_second": 10.182,
"eval_steps_per_second": 0.641,
"step": 27000
},
{
"entropy": 0.2876469852030277,
"epoch": 1.0771742593182543,
"grad_norm": 1.4166911840438843,
"learning_rate": 9.237542028892412e-05,
"loss": 0.28487411499023435,
"mean_token_accuracy": 0.911678535938263,
"num_tokens": 2107077111.0,
"step": 27050
},
{
"entropy": 0.29179634869098664,
"epoch": 1.0791653392800256,
"grad_norm": 3.1514477729797363,
"learning_rate": 9.205396617149813e-05,
"loss": 0.2909921836853027,
"mean_token_accuracy": 0.910441267490387,
"num_tokens": 2110962261.0,
"step": 27100
},
{
"entropy": 0.29678445786237717,
"epoch": 1.0811564192417968,
"grad_norm": 40.26863098144531,
"learning_rate": 9.173259466332881e-05,
"loss": 0.29503396987915037,
"mean_token_accuracy": 0.9089562743902206,
"num_tokens": 2114690971.0,
"step": 27150
},
{
"entropy": 0.27730693414807317,
"epoch": 1.0831474992035681,
"grad_norm": 14.38628101348877,
"learning_rate": 9.14113091054869e-05,
"loss": 0.2759782028198242,
"mean_token_accuracy": 0.9139302664995194,
"num_tokens": 2118761603.0,
"step": 27200
},
{
"entropy": 0.27558964386582374,
"epoch": 1.0851385791653392,
"grad_norm": 7.265783309936523,
"learning_rate": 9.109011283814975e-05,
"loss": 0.273838005065918,
"mean_token_accuracy": 0.9154215580224991,
"num_tokens": 2122603326.0,
"step": 27250
},
{
"entropy": 0.27117940336465834,
"epoch": 1.0871296591271105,
"grad_norm": 67.00965881347656,
"learning_rate": 9.07690092005661e-05,
"loss": 0.2704639434814453,
"mean_token_accuracy": 0.9143139374256134,
"num_tokens": 2126467523.0,
"step": 27300
},
{
"entropy": 0.27915058851242064,
"epoch": 1.0891207390888817,
"grad_norm": 15.945594787597656,
"learning_rate": 9.044800153102201e-05,
"loss": 0.27274932861328127,
"mean_token_accuracy": 0.9147227293252945,
"num_tokens": 2130549596.0,
"step": 27350
},
{
"entropy": 0.28577979490160943,
"epoch": 1.091111819050653,
"grad_norm": 20.842540740966797,
"learning_rate": 9.01270931668056e-05,
"loss": 0.2831624984741211,
"mean_token_accuracy": 0.9122427719831466,
"num_tokens": 2134470609.0,
"step": 27400
},
{
"entropy": 0.279740676432848,
"epoch": 1.0931028990124243,
"grad_norm": 26.93157958984375,
"learning_rate": 8.98062874441727e-05,
"loss": 0.27642791748046874,
"mean_token_accuracy": 0.9142916613817215,
"num_tokens": 2138309187.0,
"step": 27450
},
{
"entropy": 0.2770803037285805,
"epoch": 1.0950939789741956,
"grad_norm": 35.35862350463867,
"learning_rate": 8.948558769831204e-05,
"loss": 0.2779220390319824,
"mean_token_accuracy": 0.9131919813156127,
"num_tokens": 2142245103.0,
"step": 27500
},
{
"entropy": 0.2848608887195587,
"epoch": 1.0970850589359669,
"grad_norm": 11.261760711669922,
"learning_rate": 8.91649972633105e-05,
"loss": 0.28272476196289065,
"mean_token_accuracy": 0.9128847599029541,
"num_tokens": 2146150563.0,
"step": 27550
},
{
"entropy": 0.2844234037399292,
"epoch": 1.0990761388977381,
"grad_norm": 22.945674896240234,
"learning_rate": 8.88445194721186e-05,
"loss": 0.27900018692016604,
"mean_token_accuracy": 0.9139061546325684,
"num_tokens": 2150074053.0,
"step": 27600
},
{
"entropy": 0.2817272536456585,
"epoch": 1.1010672188595094,
"grad_norm": 9.653203964233398,
"learning_rate": 8.852415765651586e-05,
"loss": 0.274036750793457,
"mean_token_accuracy": 0.9139328610897064,
"num_tokens": 2153979617.0,
"step": 27650
},
{
"entropy": 0.28654327005147934,
"epoch": 1.1030582988212807,
"grad_norm": 3.253051280975342,
"learning_rate": 8.820391514707593e-05,
"loss": 0.285811767578125,
"mean_token_accuracy": 0.9110492730140686,
"num_tokens": 2157862641.0,
"step": 27700
},
{
"entropy": 0.27920183435082435,
"epoch": 1.105049378783052,
"grad_norm": 3.2318739891052246,
"learning_rate": 8.788379527313222e-05,
"loss": 0.27893768310546874,
"mean_token_accuracy": 0.913199360370636,
"num_tokens": 2161581604.0,
"step": 27750
},
{
"entropy": 0.2770452558994293,
"epoch": 1.1070404587448233,
"grad_norm": 2.511895179748535,
"learning_rate": 8.756380136274312e-05,
"loss": 0.2762653160095215,
"mean_token_accuracy": 0.9135860896110535,
"num_tokens": 2165453934.0,
"step": 27800
},
{
"entropy": 0.277307867705822,
"epoch": 1.1090315387065945,
"grad_norm": 2.83260440826416,
"learning_rate": 8.724393674265751e-05,
"loss": 0.27308944702148436,
"mean_token_accuracy": 0.913974158167839,
"num_tokens": 2169354403.0,
"step": 27850
},
{
"entropy": 0.28175134643912314,
"epoch": 1.1110226186683658,
"grad_norm": 3.690707206726074,
"learning_rate": 8.692420473828017e-05,
"loss": 0.27765316009521485,
"mean_token_accuracy": 0.9128604310750962,
"num_tokens": 2173255846.0,
"step": 27900
},
{
"entropy": 0.2807075062394142,
"epoch": 1.1130136986301369,
"grad_norm": 47.7031135559082,
"learning_rate": 8.660460867363705e-05,
"loss": 0.27419795989990237,
"mean_token_accuracy": 0.912740181684494,
"num_tokens": 2177173636.0,
"step": 27950
},
{
"entropy": 0.26901765435934066,
"epoch": 1.1150047785919082,
"grad_norm": 39.53254318237305,
"learning_rate": 8.628515187134095e-05,
"loss": 0.267020149230957,
"mean_token_accuracy": 0.9155882316827774,
"num_tokens": 2181073758.0,
"step": 28000
},
{
"entropy": 0.27070899575948715,
"epoch": 1.1169958585536794,
"grad_norm": 95.63186645507812,
"learning_rate": 8.596583765255684e-05,
"loss": 0.2706641387939453,
"mean_token_accuracy": 0.9151144373416901,
"num_tokens": 2185055281.0,
"step": 28050
},
{
"entropy": 0.2648503905534744,
"epoch": 1.1189869385154507,
"grad_norm": 5.548442840576172,
"learning_rate": 8.564666933696725e-05,
"loss": 0.2619986152648926,
"mean_token_accuracy": 0.9176148587465286,
"num_tokens": 2188982724.0,
"step": 28100
},
{
"entropy": 0.26699685767292974,
"epoch": 1.120978018477222,
"grad_norm": 111.70710754394531,
"learning_rate": 8.5327650242738e-05,
"loss": 0.2617582702636719,
"mean_token_accuracy": 0.9162463837862015,
"num_tokens": 2192938733.0,
"step": 28150
},
{
"entropy": 0.262488604336977,
"epoch": 1.1229690984389933,
"grad_norm": 430.6045227050781,
"learning_rate": 8.500878368648343e-05,
"loss": 0.2608696746826172,
"mean_token_accuracy": 0.9173845279216767,
"num_tokens": 2196846764.0,
"step": 28200
},
{
"entropy": 0.25803896233439444,
"epoch": 1.1249601784007646,
"grad_norm": 3.5406253337860107,
"learning_rate": 8.469007298323213e-05,
"loss": 0.2512600326538086,
"mean_token_accuracy": 0.9178572076559067,
"num_tokens": 2200645521.0,
"step": 28250
},
{
"entropy": 0.26972849801182747,
"epoch": 1.1269512583625358,
"grad_norm": 92.98139190673828,
"learning_rate": 8.437152144639246e-05,
"loss": 0.26785884857177733,
"mean_token_accuracy": 0.9155970722436905,
"num_tokens": 2204445686.0,
"step": 28300
},
{
"entropy": 0.26320109009742737,
"epoch": 1.1289423383243071,
"grad_norm": 9.081830024719238,
"learning_rate": 8.405313238771784e-05,
"loss": 0.25778596878051757,
"mean_token_accuracy": 0.9171466076374054,
"num_tokens": 2208115754.0,
"step": 28350
},
{
"entropy": 0.26801792293787,
"epoch": 1.1309334182860784,
"grad_norm": 8.996872901916504,
"learning_rate": 8.373490911727271e-05,
"loss": 0.26728742599487304,
"mean_token_accuracy": 0.914549406170845,
"num_tokens": 2212015806.0,
"step": 28400
},
{
"entropy": 0.26803364634513854,
"epoch": 1.1329244982478497,
"grad_norm": 5.314253807067871,
"learning_rate": 8.341685494339786e-05,
"loss": 0.26380897521972657,
"mean_token_accuracy": 0.915499085187912,
"num_tokens": 2215916150.0,
"step": 28450
},
{
"entropy": 0.2681669166684151,
"epoch": 1.134915578209621,
"grad_norm": 2.105147361755371,
"learning_rate": 8.309897317267608e-05,
"loss": 0.2656439208984375,
"mean_token_accuracy": 0.9164936941862106,
"num_tokens": 2219835264.0,
"step": 28500
},
{
"epoch": 1.134915578209621,
"eval_entropy": 0.26389308983371373,
"eval_loss": 0.26379474997520447,
"eval_mean_token_accuracy": 0.9127354971946232,
"eval_num_tokens": 2219835264.0,
"eval_runtime": 97.959,
"eval_samples_per_second": 10.208,
"eval_steps_per_second": 0.643,
"step": 28500
},
{
"entropy": 0.27185188308358194,
"epoch": 1.1369066581713922,
"grad_norm": 18.015384674072266,
"learning_rate": 8.278126710989782e-05,
"loss": 0.2707905960083008,
"mean_token_accuracy": 0.9136988991498947,
"num_tokens": 2223642742.0,
"step": 28550
},
{
"entropy": 0.2693157321214676,
"epoch": 1.1388977381331635,
"grad_norm": 2.083514451980591,
"learning_rate": 8.24637400580269e-05,
"loss": 0.26923891067504885,
"mean_token_accuracy": 0.9148537760972977,
"num_tokens": 2227448481.0,
"step": 28600
},
{
"entropy": 0.2842481462657452,
"epoch": 1.1408888180949348,
"grad_norm": 5.290956974029541,
"learning_rate": 8.214639531816595e-05,
"loss": 0.2816263198852539,
"mean_token_accuracy": 0.9124980694055558,
"num_tokens": 2231471576.0,
"step": 28650
},
{
"entropy": 0.2704421180486679,
"epoch": 1.1428798980567059,
"grad_norm": 8.295283317565918,
"learning_rate": 8.182923618952235e-05,
"loss": 0.27311107635498044,
"mean_token_accuracy": 0.914927179813385,
"num_tokens": 2235399047.0,
"step": 28700
},
{
"entropy": 0.27379641339182853,
"epoch": 1.1448709780184771,
"grad_norm": 1.0736641883850098,
"learning_rate": 8.15122659693737e-05,
"loss": 0.2708183479309082,
"mean_token_accuracy": 0.9151065689325333,
"num_tokens": 2239234964.0,
"step": 28750
},
{
"entropy": 0.2751020123064518,
"epoch": 1.1468620579802484,
"grad_norm": 1.4961488246917725,
"learning_rate": 8.119548795303376e-05,
"loss": 0.27098175048828127,
"mean_token_accuracy": 0.9147888046503067,
"num_tokens": 2243217403.0,
"step": 28800
},
{
"entropy": 0.2790540789067745,
"epoch": 1.1488531379420197,
"grad_norm": 2.4600632190704346,
"learning_rate": 8.087890543381806e-05,
"loss": 0.2748415184020996,
"mean_token_accuracy": 0.913057005405426,
"num_tokens": 2247087511.0,
"step": 28850
},
{
"entropy": 0.27438779309391975,
"epoch": 1.150844217903791,
"grad_norm": 1.100923776626587,
"learning_rate": 8.05625217030096e-05,
"loss": 0.273856143951416,
"mean_token_accuracy": 0.9144889223575592,
"num_tokens": 2251015377.0,
"step": 28900
},
{
"entropy": 0.2724647945165634,
"epoch": 1.1528352978655623,
"grad_norm": 1.0084789991378784,
"learning_rate": 8.024634004982485e-05,
"loss": 0.26770015716552736,
"mean_token_accuracy": 0.9148356276750564,
"num_tokens": 2254827896.0,
"step": 28950
},
{
"entropy": 0.2752744263410568,
"epoch": 1.1548263778273336,
"grad_norm": 1.1662410497665405,
"learning_rate": 7.993036376137936e-05,
"loss": 0.2729286956787109,
"mean_token_accuracy": 0.9148583126068115,
"num_tokens": 2258661646.0,
"step": 29000
},
{
"entropy": 0.26966445341706274,
"epoch": 1.1568174577891048,
"grad_norm": 0.924314558506012,
"learning_rate": 7.961459612265361e-05,
"loss": 0.2723007392883301,
"mean_token_accuracy": 0.9145607137680054,
"num_tokens": 2262646618.0,
"step": 29050
},
{
"entropy": 0.26575383394956587,
"epoch": 1.158808537750876,
"grad_norm": 0.7235977649688721,
"learning_rate": 7.929904041645899e-05,
"loss": 0.25847774505615234,
"mean_token_accuracy": 0.9171443176269531,
"num_tokens": 2266428868.0,
"step": 29100
},
{
"entropy": 0.2669110006093979,
"epoch": 1.1607996177126474,
"grad_norm": 1.0300394296646118,
"learning_rate": 7.898369992340343e-05,
"loss": 0.2586103057861328,
"mean_token_accuracy": 0.9165506374835968,
"num_tokens": 2270328111.0,
"step": 29150
},
{
"entropy": 0.2686790293455124,
"epoch": 1.1627906976744187,
"grad_norm": 1.061711311340332,
"learning_rate": 7.866857792185757e-05,
"loss": 0.2652849006652832,
"mean_token_accuracy": 0.9159308975934982,
"num_tokens": 2274115543.0,
"step": 29200
},
{
"entropy": 0.2602678190171719,
"epoch": 1.16478177763619,
"grad_norm": 0.9144725203514099,
"learning_rate": 7.835367768792062e-05,
"loss": 0.2613193130493164,
"mean_token_accuracy": 0.9169529223442078,
"num_tokens": 2278001125.0,
"step": 29250
},
{
"entropy": 0.26131615310907363,
"epoch": 1.166772857597961,
"grad_norm": 2.1445415019989014,
"learning_rate": 7.803900249538595e-05,
"loss": 0.25913362503051757,
"mean_token_accuracy": 0.9180044931173325,
"num_tokens": 2281717812.0,
"step": 29300
},
{
"entropy": 0.2564562624692917,
"epoch": 1.1687639375597323,
"grad_norm": 2.700810670852661,
"learning_rate": 7.772455561570765e-05,
"loss": 0.260410213470459,
"mean_token_accuracy": 0.9175380313396454,
"num_tokens": 2285608129.0,
"step": 29350
},
{
"entropy": 0.25623603761196134,
"epoch": 1.1707550175215036,
"grad_norm": 26.131128311157227,
"learning_rate": 7.7410340317966e-05,
"loss": 0.2592426300048828,
"mean_token_accuracy": 0.9185863476991654,
"num_tokens": 2289552213.0,
"step": 29400
},
{
"entropy": 0.25995843529701235,
"epoch": 1.1727460974832749,
"grad_norm": 11.526826858520508,
"learning_rate": 7.709635986883377e-05,
"loss": 0.2492630386352539,
"mean_token_accuracy": 0.9200164544582367,
"num_tokens": 2293527997.0,
"step": 29450
},
{
"entropy": 0.2562264314293861,
"epoch": 1.1747371774450461,
"grad_norm": 5.011427879333496,
"learning_rate": 7.678261753254215e-05,
"loss": 0.2549386405944824,
"mean_token_accuracy": 0.9187822026014328,
"num_tokens": 2297456343.0,
"step": 29500
},
{
"entropy": 0.2528035534918308,
"epoch": 1.1767282574068174,
"grad_norm": 7.7611517906188965,
"learning_rate": 7.646911657084681e-05,
"loss": 0.24742359161376953,
"mean_token_accuracy": 0.9208133661746979,
"num_tokens": 2301308339.0,
"step": 29550
},
{
"entropy": 0.2551653176546097,
"epoch": 1.1787193373685887,
"grad_norm": 0.9861001372337341,
"learning_rate": 7.61558602429941e-05,
"loss": 0.25268321990966797,
"mean_token_accuracy": 0.9187040156126023,
"num_tokens": 2305141997.0,
"step": 29600
},
{
"entropy": 0.26116091802716257,
"epoch": 1.18071041733036,
"grad_norm": 5.062619209289551,
"learning_rate": 7.584285180568707e-05,
"loss": 0.25951030731201175,
"mean_token_accuracy": 0.9177165216207505,
"num_tokens": 2308988046.0,
"step": 29650
},
{
"entropy": 0.2451816527545452,
"epoch": 1.1827014972921313,
"grad_norm": 9.454245567321777,
"learning_rate": 7.553009451305155e-05,
"loss": 0.24350931167602538,
"mean_token_accuracy": 0.9213841730356216,
"num_tokens": 2312985492.0,
"step": 29700
},
{
"entropy": 0.25349168688058854,
"epoch": 1.1846925772539025,
"grad_norm": 7.0926618576049805,
"learning_rate": 7.521759161660246e-05,
"loss": 0.2522360038757324,
"mean_token_accuracy": 0.9197132277488709,
"num_tokens": 2316998826.0,
"step": 29750
},
{
"entropy": 0.2608468522131443,
"epoch": 1.1866836572156738,
"grad_norm": 0.7596117854118347,
"learning_rate": 7.490534636520997e-05,
"loss": 0.26308231353759765,
"mean_token_accuracy": 0.9175483292341232,
"num_tokens": 2321019054.0,
"step": 29800
},
{
"entropy": 0.25581578224897383,
"epoch": 1.188674737177445,
"grad_norm": 0.8175065517425537,
"learning_rate": 7.45933620050656e-05,
"loss": 0.2528280830383301,
"mean_token_accuracy": 0.9190493965148926,
"num_tokens": 2324919096.0,
"step": 29850
},
{
"entropy": 0.25523352801799776,
"epoch": 1.1906658171392164,
"grad_norm": 0.8316560983657837,
"learning_rate": 7.428164177964867e-05,
"loss": 0.25129295349121095,
"mean_token_accuracy": 0.9194622355699539,
"num_tokens": 2328750442.0,
"step": 29900
},
{
"entropy": 0.25839961007237433,
"epoch": 1.1926568971009877,
"grad_norm": 6.435125827789307,
"learning_rate": 7.397018892969245e-05,
"loss": 0.25191268920898435,
"mean_token_accuracy": 0.9188542717695236,
"num_tokens": 2332618559.0,
"step": 29950
},
{
"entropy": 0.2525199219584465,
"epoch": 1.194647977062759,
"grad_norm": 0.6968880295753479,
"learning_rate": 7.365900669315046e-05,
"loss": 0.2460643768310547,
"mean_token_accuracy": 0.9193591141700744,
"num_tokens": 2336422417.0,
"step": 30000
},
{
"epoch": 1.194647977062759,
"eval_entropy": 0.24912547024469528,
"eval_loss": 0.2590893507003784,
"eval_mean_token_accuracy": 0.9145408395736937,
"eval_num_tokens": 2336422417.0,
"eval_runtime": 97.5931,
"eval_samples_per_second": 10.247,
"eval_steps_per_second": 0.646,
"step": 30000
},
{
"entropy": 0.26732305482029917,
"epoch": 1.1966390570245302,
"grad_norm": 0.8476821780204773,
"learning_rate": 7.33480983051629e-05,
"loss": 0.2643488693237305,
"mean_token_accuracy": 0.9154199087619781,
"num_tokens": 2340302827.0,
"step": 30050
},
{
"entropy": 0.25488393008708954,
"epoch": 1.1986301369863013,
"grad_norm": 0.6083821654319763,
"learning_rate": 7.303746699802289e-05,
"loss": 0.2518123435974121,
"mean_token_accuracy": 0.9191535788774491,
"num_tokens": 2344164776.0,
"step": 30100
},
{
"entropy": 0.2546880353987217,
"epoch": 1.2006212169480726,
"grad_norm": 1.4273827075958252,
"learning_rate": 7.272711600114301e-05,
"loss": 0.25110788345336915,
"mean_token_accuracy": 0.9193621718883515,
"num_tokens": 2347949626.0,
"step": 30150
},
{
"entropy": 0.2577556924521923,
"epoch": 1.2026122969098438,
"grad_norm": 0.8106961250305176,
"learning_rate": 7.241704854102167e-05,
"loss": 0.25635360717773437,
"mean_token_accuracy": 0.9184073209762573,
"num_tokens": 2351900229.0,
"step": 30200
},
{
"entropy": 0.25620258957147596,
"epoch": 1.2046033768716151,
"grad_norm": 0.8120598793029785,
"learning_rate": 7.210726784120941e-05,
"loss": 0.25334203720092774,
"mean_token_accuracy": 0.9191883337497712,
"num_tokens": 2355735339.0,
"step": 30250
},
{
"entropy": 0.25752839639782904,
"epoch": 1.2065944568333864,
"grad_norm": 3.0607850551605225,
"learning_rate": 7.179777712227569e-05,
"loss": 0.25776454925537107,
"mean_token_accuracy": 0.9180021786689758,
"num_tokens": 2359574343.0,
"step": 30300
},
{
"entropy": 0.2576423817873001,
"epoch": 1.2085855367951577,
"grad_norm": 3.523740768432617,
"learning_rate": 7.14885796017752e-05,
"loss": 0.25613277435302734,
"mean_token_accuracy": 0.9186793148517609,
"num_tokens": 2363536733.0,
"step": 30350
},
{
"entropy": 0.2511074875295162,
"epoch": 1.210576616756929,
"grad_norm": 1.0753810405731201,
"learning_rate": 7.117967849421436e-05,
"loss": 0.24952831268310546,
"mean_token_accuracy": 0.9197322314977646,
"num_tokens": 2367519596.0,
"step": 30400
},
{
"entropy": 0.25169111222028734,
"epoch": 1.2125676967187002,
"grad_norm": 2.098910331726074,
"learning_rate": 7.087107701101813e-05,
"loss": 0.24964860916137696,
"mean_token_accuracy": 0.9197195601463318,
"num_tokens": 2371517180.0,
"step": 30450
},
{
"entropy": 0.2529001899808645,
"epoch": 1.2145587766804715,
"grad_norm": 1.0066713094711304,
"learning_rate": 7.056277836049636e-05,
"loss": 0.24566022872924806,
"mean_token_accuracy": 0.9205902856588364,
"num_tokens": 2375391104.0,
"step": 30500
},
{
"entropy": 0.25578666806221007,
"epoch": 1.2165498566422428,
"grad_norm": 1.1897060871124268,
"learning_rate": 7.02547857478107e-05,
"loss": 0.25263437271118167,
"mean_token_accuracy": 0.9195209097862244,
"num_tokens": 2379348591.0,
"step": 30550
},
{
"entropy": 0.2526996345818043,
"epoch": 1.218540936604014,
"grad_norm": 1.1875773668289185,
"learning_rate": 6.994710237494107e-05,
"loss": 0.2487725067138672,
"mean_token_accuracy": 0.9197922104597092,
"num_tokens": 2383260952.0,
"step": 30600
},
{
"entropy": 0.2540097612142563,
"epoch": 1.2205320165657854,
"grad_norm": 0.6080695390701294,
"learning_rate": 6.963973144065239e-05,
"loss": 0.2553993225097656,
"mean_token_accuracy": 0.919166492819786,
"num_tokens": 2387348809.0,
"step": 30650
},
{
"entropy": 0.2552763396501541,
"epoch": 1.2225230965275566,
"grad_norm": 0.8603153824806213,
"learning_rate": 6.933267614046148e-05,
"loss": 0.25409666061401365,
"mean_token_accuracy": 0.9181348937749862,
"num_tokens": 2391236010.0,
"step": 30700
},
{
"entropy": 0.2569490122795105,
"epoch": 1.2245141764893277,
"grad_norm": 0.9919761419296265,
"learning_rate": 6.902593966660371e-05,
"loss": 0.252379093170166,
"mean_token_accuracy": 0.9187397682666778,
"num_tokens": 2395300445.0,
"step": 30750
},
{
"entropy": 0.2513756537437439,
"epoch": 1.226505256451099,
"grad_norm": 1.3306828737258911,
"learning_rate": 6.871952520799978e-05,
"loss": 0.250519905090332,
"mean_token_accuracy": 0.91956602871418,
"num_tokens": 2399168189.0,
"step": 30800
},
{
"entropy": 0.2564035221934319,
"epoch": 1.2284963364128703,
"grad_norm": 7.042972564697266,
"learning_rate": 6.841343595022272e-05,
"loss": 0.2522756576538086,
"mean_token_accuracy": 0.9194320529699326,
"num_tokens": 2402898724.0,
"step": 30850
},
{
"entropy": 0.24428572967648507,
"epoch": 1.2304874163746415,
"grad_norm": 4.51497745513916,
"learning_rate": 6.810767507546457e-05,
"loss": 0.24056669235229491,
"mean_token_accuracy": 0.9221302163600922,
"num_tokens": 2406820462.0,
"step": 30900
},
{
"entropy": 0.24979312285780908,
"epoch": 1.2324784963364128,
"grad_norm": 1.6140036582946777,
"learning_rate": 6.780224576250347e-05,
"loss": 0.2473303985595703,
"mean_token_accuracy": 0.9202413827180862,
"num_tokens": 2410783096.0,
"step": 30950
},
{
"entropy": 0.24745888367295266,
"epoch": 1.234469576298184,
"grad_norm": 1.5148733854293823,
"learning_rate": 6.749715118667061e-05,
"loss": 0.24445684432983397,
"mean_token_accuracy": 0.9212743645906448,
"num_tokens": 2414615195.0,
"step": 31000
},
{
"entropy": 0.24440625712275504,
"epoch": 1.2364606562599554,
"grad_norm": 166.31959533691406,
"learning_rate": 6.719239451981702e-05,
"loss": 0.24271812438964843,
"mean_token_accuracy": 0.9218738675117493,
"num_tokens": 2418498880.0,
"step": 31050
},
{
"entropy": 0.24401699602603913,
"epoch": 1.2384517362217267,
"grad_norm": 8.616495132446289,
"learning_rate": 6.68879789302808e-05,
"loss": 0.2441313934326172,
"mean_token_accuracy": 0.9215966653823853,
"num_tokens": 2422507271.0,
"step": 31100
},
{
"entropy": 0.24902054503560067,
"epoch": 1.240442816183498,
"grad_norm": 2.768110990524292,
"learning_rate": 6.65839075828542e-05,
"loss": 0.24927122116088868,
"mean_token_accuracy": 0.9191774350404739,
"num_tokens": 2426513554.0,
"step": 31150
},
{
"entropy": 0.24414533570408822,
"epoch": 1.2424338961452692,
"grad_norm": 12.899252891540527,
"learning_rate": 6.628018363875041e-05,
"loss": 0.23875503540039061,
"mean_token_accuracy": 0.9229415136575699,
"num_tokens": 2430368231.0,
"step": 31200
},
{
"entropy": 0.24678532421588897,
"epoch": 1.2444249761070405,
"grad_norm": 1.429768681526184,
"learning_rate": 6.597681025557113e-05,
"loss": 0.24450605392456054,
"mean_token_accuracy": 0.9218378084897995,
"num_tokens": 2434271946.0,
"step": 31250
},
{
"entropy": 0.2424020729959011,
"epoch": 1.2464160560688118,
"grad_norm": 29.401817321777344,
"learning_rate": 6.567379058727346e-05,
"loss": 0.24003870010375977,
"mean_token_accuracy": 0.9231269294023514,
"num_tokens": 2438249891.0,
"step": 31300
},
{
"entropy": 0.24916338324546813,
"epoch": 1.248407136030583,
"grad_norm": 2.3196229934692383,
"learning_rate": 6.537112778413708e-05,
"loss": 0.24266057968139648,
"mean_token_accuracy": 0.9209426647424698,
"num_tokens": 2442158811.0,
"step": 31350
},
{
"entropy": 0.2501223590970039,
"epoch": 1.2503982159923543,
"grad_norm": 1.933199405670166,
"learning_rate": 6.506882499273174e-05,
"loss": 0.25150131225585937,
"mean_token_accuracy": 0.9188826751708984,
"num_tokens": 2446164868.0,
"step": 31400
},
{
"entropy": 0.2436576010286808,
"epoch": 1.2523892959541256,
"grad_norm": 5.695888519287109,
"learning_rate": 6.476688535588433e-05,
"loss": 0.24076358795166017,
"mean_token_accuracy": 0.9218398368358612,
"num_tokens": 2449972536.0,
"step": 31450
},
{
"entropy": 0.2507163964211941,
"epoch": 1.254380375915897,
"grad_norm": 3.518038749694824,
"learning_rate": 6.446531201264626e-05,
"loss": 0.24629838943481444,
"mean_token_accuracy": 0.9203240805864334,
"num_tokens": 2453851011.0,
"step": 31500
},
{
"epoch": 1.254380375915897,
"eval_entropy": 0.24153777602173032,
"eval_loss": 0.2523416578769684,
"eval_mean_token_accuracy": 0.9161454656767467,
"eval_num_tokens": 2453851011.0,
"eval_runtime": 97.9272,
"eval_samples_per_second": 10.212,
"eval_steps_per_second": 0.643,
"step": 31500
},
{
"entropy": 0.24645958006381988,
"epoch": 1.256371455877668,
"grad_norm": 34.6347770690918,
"learning_rate": 6.416410809826095e-05,
"loss": 0.2486136817932129,
"mean_token_accuracy": 0.9206688398122788,
"num_tokens": 2457709584.0,
"step": 31550
},
{
"entropy": 0.24550958037376402,
"epoch": 1.2583625358394392,
"grad_norm": 2.1734249591827393,
"learning_rate": 6.386327674413102e-05,
"loss": 0.24396198272705077,
"mean_token_accuracy": 0.9210328465700149,
"num_tokens": 2461565590.0,
"step": 31600
},
{
"entropy": 0.24458111330866814,
"epoch": 1.2603536158012105,
"grad_norm": 2.1308200359344482,
"learning_rate": 6.356282107778587e-05,
"loss": 0.244349365234375,
"mean_token_accuracy": 0.9208364903926849,
"num_tokens": 2465397732.0,
"step": 31650
},
{
"entropy": 0.24412568658590317,
"epoch": 1.2623446957629818,
"grad_norm": 5.350144386291504,
"learning_rate": 6.326274422284922e-05,
"loss": 0.2402265739440918,
"mean_token_accuracy": 0.9222062975168228,
"num_tokens": 2469225379.0,
"step": 31700
},
{
"entropy": 0.2523250526189804,
"epoch": 1.264335775724753,
"grad_norm": 1.7639020681381226,
"learning_rate": 6.296304929900638e-05,
"loss": 0.25054126739501953,
"mean_token_accuracy": 0.9195391660928727,
"num_tokens": 2473175319.0,
"step": 31750
},
{
"entropy": 0.2518117180466652,
"epoch": 1.2663268556865244,
"grad_norm": 8.069989204406738,
"learning_rate": 6.266373942197228e-05,
"loss": 0.2470506477355957,
"mean_token_accuracy": 0.9194836449623108,
"num_tokens": 2476989249.0,
"step": 31800
},
{
"entropy": 0.24566985920071602,
"epoch": 1.2683179356482956,
"grad_norm": 40.28060531616211,
"learning_rate": 6.236481770345845e-05,
"loss": 0.24796669006347657,
"mean_token_accuracy": 0.9207878285646438,
"num_tokens": 2480876708.0,
"step": 31850
},
{
"entropy": 0.25329444035887716,
"epoch": 1.270309015610067,
"grad_norm": 1.2897652387619019,
"learning_rate": 6.20662872511413e-05,
"loss": 0.24721664428710938,
"mean_token_accuracy": 0.9197079193592071,
"num_tokens": 2484637032.0,
"step": 31900
},
{
"entropy": 0.25620452091097834,
"epoch": 1.2723000955718382,
"grad_norm": 3.7153172492980957,
"learning_rate": 6.176815116862938e-05,
"loss": 0.25328746795654294,
"mean_token_accuracy": 0.918477959036827,
"num_tokens": 2488241591.0,
"step": 31950
},
{
"entropy": 0.259455299526453,
"epoch": 1.2742911755336095,
"grad_norm": 0.9825824499130249,
"learning_rate": 6.147041255543127e-05,
"loss": 0.2515993499755859,
"mean_token_accuracy": 0.9188154804706573,
"num_tokens": 2491967910.0,
"step": 32000
},
{
"entropy": 0.2545319566130638,
"epoch": 1.2762822554953808,
"grad_norm": 1.2730064392089844,
"learning_rate": 6.117307450692335e-05,
"loss": 0.2528094482421875,
"mean_token_accuracy": 0.9184557616710662,
"num_tokens": 2495775884.0,
"step": 32050
},
{
"entropy": 0.24805585592985152,
"epoch": 1.2782733354571518,
"grad_norm": 0.7051454186439514,
"learning_rate": 6.0876140114317716e-05,
"loss": 0.2452733612060547,
"mean_token_accuracy": 0.921332939863205,
"num_tokens": 2499673582.0,
"step": 32100
},
{
"entropy": 0.25301434338092804,
"epoch": 1.280264415418923,
"grad_norm": 0.8264440894126892,
"learning_rate": 6.057961246462971e-05,
"loss": 0.24915611267089843,
"mean_token_accuracy": 0.9208215099573135,
"num_tokens": 2503798886.0,
"step": 32150
},
{
"entropy": 0.25116061940789225,
"epoch": 1.2822554953806944,
"grad_norm": 0.850557267665863,
"learning_rate": 6.028349464064633e-05,
"loss": 0.24718658447265626,
"mean_token_accuracy": 0.9197705388069153,
"num_tokens": 2507890066.0,
"step": 32200
},
{
"entropy": 0.26222523510456086,
"epoch": 1.2842465753424657,
"grad_norm": 0.7549040913581848,
"learning_rate": 5.998778972089368e-05,
"loss": 0.2575231552124023,
"mean_token_accuracy": 0.9183403277397155,
"num_tokens": 2511708723.0,
"step": 32250
},
{
"entropy": 0.2572297029197216,
"epoch": 1.286237655304237,
"grad_norm": 0.859230637550354,
"learning_rate": 5.969250077960534e-05,
"loss": 0.2545322799682617,
"mean_token_accuracy": 0.9189767295122147,
"num_tokens": 2515749413.0,
"step": 32300
},
{
"entropy": 0.2539103680849075,
"epoch": 1.2882287352660082,
"grad_norm": 0.6217833757400513,
"learning_rate": 5.9397630886690214e-05,
"loss": 0.2517101287841797,
"mean_token_accuracy": 0.9185271793603897,
"num_tokens": 2519642278.0,
"step": 32350
},
{
"entropy": 0.2602769346535206,
"epoch": 1.2902198152277795,
"grad_norm": 0.7290419340133667,
"learning_rate": 5.91031831077006e-05,
"loss": 0.25576301574707033,
"mean_token_accuracy": 0.9181579911708831,
"num_tokens": 2523561621.0,
"step": 32400
},
{
"entropy": 0.25307921051979065,
"epoch": 1.2922108951895508,
"grad_norm": 45.058815002441406,
"learning_rate": 5.8809160503800455e-05,
"loss": 0.24822502136230468,
"mean_token_accuracy": 0.9194051826000214,
"num_tokens": 2527427498.0,
"step": 32450
},
{
"entropy": 0.2419722370803356,
"epoch": 1.294201975151322,
"grad_norm": 1.0116926431655884,
"learning_rate": 5.8515566131733504e-05,
"loss": 0.23900753021240234,
"mean_token_accuracy": 0.9218295383453369,
"num_tokens": 2531296733.0,
"step": 32500
},
{
"entropy": 0.24807915300130845,
"epoch": 1.2961930551130934,
"grad_norm": 0.7379711270332336,
"learning_rate": 5.822240304379134e-05,
"loss": 0.2472970199584961,
"mean_token_accuracy": 0.9201249468326569,
"num_tokens": 2535154807.0,
"step": 32550
},
{
"entropy": 0.23525363981723785,
"epoch": 1.2981841350748646,
"grad_norm": 0.8442062139511108,
"learning_rate": 5.7929674287781955e-05,
"loss": 0.22923601150512696,
"mean_token_accuracy": 0.9241575568914413,
"num_tokens": 2538967544.0,
"step": 32600
},
{
"entropy": 0.25001087591052057,
"epoch": 1.300175215036636,
"grad_norm": 3.9452688694000244,
"learning_rate": 5.7637382906997814e-05,
"loss": 0.24733707427978516,
"mean_token_accuracy": 0.9203029495477676,
"num_tokens": 2542898400.0,
"step": 32650
},
{
"entropy": 0.24979558914899827,
"epoch": 1.3021662949984072,
"grad_norm": 0.7694733142852783,
"learning_rate": 5.734553194018425e-05,
"loss": 0.24733903884887695,
"mean_token_accuracy": 0.9204252606630325,
"num_tokens": 2546816900.0,
"step": 32700
},
{
"entropy": 0.25051434099674225,
"epoch": 1.3041573749601785,
"grad_norm": 0.617893636226654,
"learning_rate": 5.7054124421508015e-05,
"loss": 0.2471194839477539,
"mean_token_accuracy": 0.9202513420581817,
"num_tokens": 2550760619.0,
"step": 32750
},
{
"entropy": 0.2535126593708992,
"epoch": 1.3061484549219498,
"grad_norm": 0.5893092155456543,
"learning_rate": 5.676316338052563e-05,
"loss": 0.24661418914794922,
"mean_token_accuracy": 0.9190385782718659,
"num_tokens": 2554805633.0,
"step": 32800
},
{
"entropy": 0.24486387819051741,
"epoch": 1.308139534883721,
"grad_norm": 0.6626051664352417,
"learning_rate": 5.6472651842151894e-05,
"loss": 0.24294389724731447,
"mean_token_accuracy": 0.9217797529697418,
"num_tokens": 2558688969.0,
"step": 32850
},
{
"entropy": 0.24416929215192795,
"epoch": 1.3101306148454923,
"grad_norm": 0.6610086560249329,
"learning_rate": 5.618259282662848e-05,
"loss": 0.24305530548095702,
"mean_token_accuracy": 0.9212112122774124,
"num_tokens": 2562599912.0,
"step": 32900
},
{
"entropy": 0.2474717128276825,
"epoch": 1.3121216948072636,
"grad_norm": 0.5333130359649658,
"learning_rate": 5.5892989349492345e-05,
"loss": 0.23954826354980469,
"mean_token_accuracy": 0.9213361912965774,
"num_tokens": 2566367287.0,
"step": 32950
},
{
"entropy": 0.24256782814860345,
"epoch": 1.3141127747690347,
"grad_norm": 0.7705857753753662,
"learning_rate": 5.560384442154478e-05,
"loss": 0.24114227294921875,
"mean_token_accuracy": 0.9220344460010529,
"num_tokens": 2570302308.0,
"step": 33000
},
{
"epoch": 1.3141127747690347,
"eval_entropy": 0.23286663776352293,
"eval_loss": 0.2405821532011032,
"eval_mean_token_accuracy": 0.9191571152399457,
"eval_num_tokens": 2570302308.0,
"eval_runtime": 97.7772,
"eval_samples_per_second": 10.227,
"eval_steps_per_second": 0.644,
"step": 33000
},
{
"entropy": 0.24588322430849074,
"epoch": 1.316103854730806,
"grad_norm": 29.474529266357422,
"learning_rate": 5.5315161048819776e-05,
"loss": 0.24144397735595702,
"mean_token_accuracy": 0.9207844561338425,
"num_tokens": 2574129327.0,
"step": 33050
},
{
"entropy": 0.2438132531940937,
"epoch": 1.3180949346925772,
"grad_norm": 0.6323732137680054,
"learning_rate": 5.5026942232552735e-05,
"loss": 0.23987579345703125,
"mean_token_accuracy": 0.9224971890449524,
"num_tokens": 2578112074.0,
"step": 33100
},
{
"entropy": 0.2441749645769596,
"epoch": 1.3200860146543485,
"grad_norm": 0.8209773898124695,
"learning_rate": 5.473919096914954e-05,
"loss": 0.24236057281494142,
"mean_token_accuracy": 0.9216016113758088,
"num_tokens": 2582025585.0,
"step": 33150
},
{
"entropy": 0.23785219475626945,
"epoch": 1.3220770946161198,
"grad_norm": 2.8132340908050537,
"learning_rate": 5.4451910250155216e-05,
"loss": 0.23749332427978515,
"mean_token_accuracy": 0.923515859246254,
"num_tokens": 2585956896.0,
"step": 33200
},
{
"entropy": 0.2299913875758648,
"epoch": 1.324068174577891,
"grad_norm": 0.7741996049880981,
"learning_rate": 5.4165103062222867e-05,
"loss": 0.22954608917236327,
"mean_token_accuracy": 0.9249764865636826,
"num_tokens": 2589937310.0,
"step": 33250
},
{
"entropy": 0.2423437401652336,
"epoch": 1.3260592545396623,
"grad_norm": 0.7221020460128784,
"learning_rate": 5.387877238708265e-05,
"loss": 0.24239322662353516,
"mean_token_accuracy": 0.9219006705284118,
"num_tokens": 2593689295.0,
"step": 33300
},
{
"entropy": 0.24256222799420357,
"epoch": 1.3280503345014336,
"grad_norm": 0.7761672735214233,
"learning_rate": 5.359292120151076e-05,
"loss": 0.2391761589050293,
"mean_token_accuracy": 0.9220723509788513,
"num_tokens": 2597558264.0,
"step": 33350
},
{
"entropy": 0.23777956932783126,
"epoch": 1.330041414463205,
"grad_norm": 2.2677993774414062,
"learning_rate": 5.330755247729844e-05,
"loss": 0.23516349792480468,
"mean_token_accuracy": 0.9231782990694046,
"num_tokens": 2601329828.0,
"step": 33400
},
{
"entropy": 0.2337485946714878,
"epoch": 1.3320324944249762,
"grad_norm": 1.0745105743408203,
"learning_rate": 5.3022669181221207e-05,
"loss": 0.2339678382873535,
"mean_token_accuracy": 0.9244587421417236,
"num_tokens": 2605206875.0,
"step": 33450
},
{
"entropy": 0.23775503277778626,
"epoch": 1.3340235743867472,
"grad_norm": 36.53923416137695,
"learning_rate": 5.273827427500779e-05,
"loss": 0.2353268814086914,
"mean_token_accuracy": 0.9228319334983826,
"num_tokens": 2609060555.0,
"step": 33500
},
{
"entropy": 0.2393827061355114,
"epoch": 1.3360146543485185,
"grad_norm": 78.85201263427734,
"learning_rate": 5.245437071530961e-05,
"loss": 0.2345823860168457,
"mean_token_accuracy": 0.9233963018655778,
"num_tokens": 2612925433.0,
"step": 33550
},
{
"entropy": 0.23465632140636444,
"epoch": 1.3380057343102898,
"grad_norm": 1.3723814487457275,
"learning_rate": 5.217096145366983e-05,
"loss": 0.23387849807739258,
"mean_token_accuracy": 0.9243163061141968,
"num_tokens": 2616759404.0,
"step": 33600
},
{
"entropy": 0.23068988770246507,
"epoch": 1.339996814272061,
"grad_norm": 3.5395326614379883,
"learning_rate": 5.188804943649279e-05,
"loss": 0.22669374465942382,
"mean_token_accuracy": 0.9251353144645691,
"num_tokens": 2620628454.0,
"step": 33650
},
{
"entropy": 0.23261408492922783,
"epoch": 1.3419878942338324,
"grad_norm": 15.65046501159668,
"learning_rate": 5.1605637605013334e-05,
"loss": 0.22891586303710937,
"mean_token_accuracy": 0.9242624086141586,
"num_tokens": 2624539152.0,
"step": 33700
},
{
"entropy": 0.23109879538416864,
"epoch": 1.3439789741956036,
"grad_norm": 4.173908710479736,
"learning_rate": 5.1323728895266196e-05,
"loss": 0.22842176437377928,
"mean_token_accuracy": 0.9252660167217255,
"num_tokens": 2628689353.0,
"step": 33750
},
{
"entropy": 0.23846592292189597,
"epoch": 1.345970054157375,
"grad_norm": 5.710038185119629,
"learning_rate": 5.1042326238055535e-05,
"loss": 0.23568607330322267,
"mean_token_accuracy": 0.9234002131223679,
"num_tokens": 2632732563.0,
"step": 33800
},
{
"entropy": 0.23529886215925216,
"epoch": 1.3479611341191462,
"grad_norm": 0.7667160034179688,
"learning_rate": 5.0761432558924474e-05,
"loss": 0.2357318115234375,
"mean_token_accuracy": 0.923137486577034,
"num_tokens": 2636584074.0,
"step": 33850
},
{
"entropy": 0.23543915316462516,
"epoch": 1.3499522140809175,
"grad_norm": 0.8430137634277344,
"learning_rate": 5.04810507781245e-05,
"loss": 0.2351871681213379,
"mean_token_accuracy": 0.9230859690904617,
"num_tokens": 2640542951.0,
"step": 33900
},
{
"entropy": 0.2279362289607525,
"epoch": 1.3519432940426888,
"grad_norm": 1.9170082807540894,
"learning_rate": 5.0201183810585516e-05,
"loss": 0.22495718002319337,
"mean_token_accuracy": 0.9254985123872757,
"num_tokens": 2644430887.0,
"step": 33950
},
{
"entropy": 0.23527911379933358,
"epoch": 1.35393437400446,
"grad_norm": 4.333722114562988,
"learning_rate": 4.9921834565885114e-05,
"loss": 0.23201578140258788,
"mean_token_accuracy": 0.9242059302330017,
"num_tokens": 2648158641.0,
"step": 34000
},
{
"entropy": 0.23212642058730126,
"epoch": 1.3559254539662313,
"grad_norm": 0.9224748611450195,
"learning_rate": 4.9643005948218445e-05,
"loss": 0.2337823486328125,
"mean_token_accuracy": 0.924061541557312,
"num_tokens": 2652005779.0,
"step": 34050
},
{
"entropy": 0.2346086983382702,
"epoch": 1.3579165339280026,
"grad_norm": 3.9253106117248535,
"learning_rate": 4.9364700856368164e-05,
"loss": 0.23258901596069337,
"mean_token_accuracy": 0.9240314346551896,
"num_tokens": 2656030308.0,
"step": 34100
},
{
"entropy": 0.23181153550744057,
"epoch": 1.3599076138897739,
"grad_norm": 0.8032912015914917,
"learning_rate": 4.908692218367419e-05,
"loss": 0.2263050079345703,
"mean_token_accuracy": 0.9245618444681167,
"num_tokens": 2660035042.0,
"step": 34150
},
{
"entropy": 0.23851815313100816,
"epoch": 1.3618986938515452,
"grad_norm": 0.6259279847145081,
"learning_rate": 4.880967281800363e-05,
"loss": 0.23707332611083984,
"mean_token_accuracy": 0.9224560678005218,
"num_tokens": 2663994099.0,
"step": 34200
},
{
"entropy": 0.23847059220075606,
"epoch": 1.3638897738133164,
"grad_norm": 3.1073203086853027,
"learning_rate": 4.8532955641720734e-05,
"loss": 0.23576877593994142,
"mean_token_accuracy": 0.9226966214179992,
"num_tokens": 2667859794.0,
"step": 34250
},
{
"entropy": 0.23225814297795297,
"epoch": 1.3658808537750877,
"grad_norm": 3.2821524143218994,
"learning_rate": 4.8256773531656995e-05,
"loss": 0.2301523780822754,
"mean_token_accuracy": 0.9242325490713119,
"num_tokens": 2671725053.0,
"step": 34300
},
{
"entropy": 0.23081228151917457,
"epoch": 1.367871933736859,
"grad_norm": 0.706429660320282,
"learning_rate": 4.7981129359081186e-05,
"loss": 0.22877843856811522,
"mean_token_accuracy": 0.9250713670253754,
"num_tokens": 2675721071.0,
"step": 34350
},
{
"entropy": 0.2314528863132,
"epoch": 1.36986301369863,
"grad_norm": 4.0343756675720215,
"learning_rate": 4.770602598966958e-05,
"loss": 0.23183086395263672,
"mean_token_accuracy": 0.9241064774990082,
"num_tokens": 2679745102.0,
"step": 34400
},
{
"entropy": 0.23779025599360465,
"epoch": 1.3718540936604013,
"grad_norm": 0.8716291189193726,
"learning_rate": 4.7431466283475956e-05,
"loss": 0.23494630813598633,
"mean_token_accuracy": 0.9234051322937011,
"num_tokens": 2683798504.0,
"step": 34450
},
{
"entropy": 0.23259786665439605,
"epoch": 1.3738451736221726,
"grad_norm": 0.7196080684661865,
"learning_rate": 4.715745309490216e-05,
"loss": 0.2321007537841797,
"mean_token_accuracy": 0.925023084282875,
"num_tokens": 2687619200.0,
"step": 34500
},
{
"epoch": 1.3738451736221726,
"eval_entropy": 0.22921637552125113,
"eval_loss": 0.23520071804523468,
"eval_mean_token_accuracy": 0.9218012671622019,
"eval_num_tokens": 2687619200.0,
"eval_runtime": 97.7538,
"eval_samples_per_second": 10.23,
"eval_steps_per_second": 0.644,
"step": 34500
},
{
"entropy": 0.2326103214919567,
"epoch": 1.375836253583944,
"grad_norm": 2.9911444187164307,
"learning_rate": 4.688398927266824e-05,
"loss": 0.2314113426208496,
"mean_token_accuracy": 0.9237373173236847,
"num_tokens": 2691437944.0,
"step": 34550
},
{
"entropy": 0.2364209407567978,
"epoch": 1.3778273335457152,
"grad_norm": 1.710113286972046,
"learning_rate": 4.661107765978285e-05,
"loss": 0.2364255142211914,
"mean_token_accuracy": 0.9232726913690567,
"num_tokens": 2695267662.0,
"step": 34600
},
{
"entropy": 0.22886888533830643,
"epoch": 1.3798184135074865,
"grad_norm": 0.5442627668380737,
"learning_rate": 4.633872109351376e-05,
"loss": 0.22827606201171874,
"mean_token_accuracy": 0.9248815947771072,
"num_tokens": 2699192303.0,
"step": 34650
},
{
"entropy": 0.2333889891207218,
"epoch": 1.3818094934692577,
"grad_norm": 15.227090835571289,
"learning_rate": 4.606692240535826e-05,
"loss": 0.23413402557373048,
"mean_token_accuracy": 0.9247659987211228,
"num_tokens": 2703104258.0,
"step": 34700
},
{
"entropy": 0.22734193563461302,
"epoch": 1.383800573431029,
"grad_norm": 0.7748773694038391,
"learning_rate": 4.579568442101384e-05,
"loss": 0.22380889892578126,
"mean_token_accuracy": 0.9268061184883117,
"num_tokens": 2707095473.0,
"step": 34750
},
{
"entropy": 0.23382432997226715,
"epoch": 1.3857916533928003,
"grad_norm": 0.8901104927062988,
"learning_rate": 4.5525009960348744e-05,
"loss": 0.23436962127685546,
"mean_token_accuracy": 0.9240539067983627,
"num_tokens": 2711056973.0,
"step": 34800
},
{
"entropy": 0.22885996341705322,
"epoch": 1.3877827333545716,
"grad_norm": 1.1532673835754395,
"learning_rate": 4.525490183737251e-05,
"loss": 0.22763313293457033,
"mean_token_accuracy": 0.9247712236642838,
"num_tokens": 2714954312.0,
"step": 34850
},
{
"entropy": 0.2330388432741165,
"epoch": 1.3897738133163429,
"grad_norm": 0.6920197010040283,
"learning_rate": 4.498536286020717e-05,
"loss": 0.2267754364013672,
"mean_token_accuracy": 0.9240225440263748,
"num_tokens": 2718758819.0,
"step": 34900
},
{
"entropy": 0.23108075708150863,
"epoch": 1.391764893278114,
"grad_norm": 4.368566513061523,
"learning_rate": 4.471639583105744e-05,
"loss": 0.23003168106079103,
"mean_token_accuracy": 0.9252905690670014,
"num_tokens": 2722720972.0,
"step": 34950
},
{
"entropy": 0.23428089499473573,
"epoch": 1.3937559732398852,
"grad_norm": 0.8221115469932556,
"learning_rate": 4.4448003546182105e-05,
"loss": 0.23146120071411133,
"mean_token_accuracy": 0.9236508792638779,
"num_tokens": 2726644445.0,
"step": 35000
},
{
"entropy": 0.22516697466373445,
"epoch": 1.3957470532016565,
"grad_norm": 1.4155395030975342,
"learning_rate": 4.4180188795864644e-05,
"loss": 0.2231873893737793,
"mean_token_accuracy": 0.926362236738205,
"num_tokens": 2730496965.0,
"step": 35050
},
{
"entropy": 0.2283501335978508,
"epoch": 1.3977381331634278,
"grad_norm": 0.9996873140335083,
"learning_rate": 4.391295436438435e-05,
"loss": 0.2270090675354004,
"mean_token_accuracy": 0.9249064707756043,
"num_tokens": 2734456737.0,
"step": 35100
},
{
"entropy": 0.22467306211590768,
"epoch": 1.399729213125199,
"grad_norm": 0.8343448042869568,
"learning_rate": 4.3646303029987376e-05,
"loss": 0.22622060775756836,
"mean_token_accuracy": 0.9265091502666474,
"num_tokens": 2738380451.0,
"step": 35150
},
{
"entropy": 0.2316141229867935,
"epoch": 1.4017202930869703,
"grad_norm": 2.3793368339538574,
"learning_rate": 4.3380237564857795e-05,
"loss": 0.23149314880371094,
"mean_token_accuracy": 0.9249173974990845,
"num_tokens": 2742380657.0,
"step": 35200
},
{
"entropy": 0.2239141072332859,
"epoch": 1.4037113730487416,
"grad_norm": 3.4736902713775635,
"learning_rate": 4.3114760735088836e-05,
"loss": 0.22573705673217773,
"mean_token_accuracy": 0.9256602203845978,
"num_tokens": 2746460877.0,
"step": 35250
},
{
"entropy": 0.229984879642725,
"epoch": 1.4057024530105129,
"grad_norm": 1.3222185373306274,
"learning_rate": 4.2849875300654076e-05,
"loss": 0.2258452606201172,
"mean_token_accuracy": 0.9248714512586593,
"num_tokens": 2750412271.0,
"step": 35300
},
{
"entropy": 0.23881920039653778,
"epoch": 1.4076935329722842,
"grad_norm": 1.6275558471679688,
"learning_rate": 4.2585584015378856e-05,
"loss": 0.23602088928222656,
"mean_token_accuracy": 0.9232524186372757,
"num_tokens": 2754252714.0,
"step": 35350
},
{
"entropy": 0.22928894877433778,
"epoch": 1.4096846129340554,
"grad_norm": 0.6506333947181702,
"learning_rate": 4.2321889626911414e-05,
"loss": 0.22902776718139647,
"mean_token_accuracy": 0.925293561220169,
"num_tokens": 2758297379.0,
"step": 35400
},
{
"entropy": 0.2295927706360817,
"epoch": 1.4116756928958267,
"grad_norm": 0.7610980272293091,
"learning_rate": 4.205879487669464e-05,
"loss": 0.2256919288635254,
"mean_token_accuracy": 0.9253293204307557,
"num_tokens": 2762180568.0,
"step": 35450
},
{
"entropy": 0.23466120764613152,
"epoch": 1.413666772857598,
"grad_norm": 0.9445284008979797,
"learning_rate": 4.1796302499937335e-05,
"loss": 0.23389270782470703,
"mean_token_accuracy": 0.923297768831253,
"num_tokens": 2766024401.0,
"step": 35500
},
{
"entropy": 0.22722692921757698,
"epoch": 1.4156578528193693,
"grad_norm": 1.244280457496643,
"learning_rate": 4.1534415225585854e-05,
"loss": 0.22508651733398438,
"mean_token_accuracy": 0.9255350995063781,
"num_tokens": 2769745794.0,
"step": 35550
},
{
"entropy": 0.227867431640625,
"epoch": 1.4176489327811406,
"grad_norm": 0.7465041875839233,
"learning_rate": 4.127313577629575e-05,
"loss": 0.23069664001464843,
"mean_token_accuracy": 0.9248278605937957,
"num_tokens": 2773587205.0,
"step": 35600
},
{
"entropy": 0.22520581975579262,
"epoch": 1.4196400127429118,
"grad_norm": 0.605065643787384,
"learning_rate": 4.101246686840344e-05,
"loss": 0.22308128356933593,
"mean_token_accuracy": 0.9263810759782791,
"num_tokens": 2777527560.0,
"step": 35650
},
{
"entropy": 0.22442895591259002,
"epoch": 1.4216310927046831,
"grad_norm": 0.6026067733764648,
"learning_rate": 4.075241121189799e-05,
"loss": 0.22064193725585937,
"mean_token_accuracy": 0.9266389012336731,
"num_tokens": 2781333287.0,
"step": 35700
},
{
"entropy": 0.22473806738853455,
"epoch": 1.4236221726664544,
"grad_norm": 0.5562543272972107,
"learning_rate": 4.049297151039295e-05,
"loss": 0.22368572235107423,
"mean_token_accuracy": 0.926014997959137,
"num_tokens": 2785247144.0,
"step": 35750
},
{
"entropy": 0.23306748121976853,
"epoch": 1.4256132526282255,
"grad_norm": 14.433042526245117,
"learning_rate": 4.0234150461098084e-05,
"loss": 0.2335945701599121,
"mean_token_accuracy": 0.9244680607318878,
"num_tokens": 2789231231.0,
"step": 35800
},
{
"entropy": 0.22841948732733727,
"epoch": 1.4276043325899967,
"grad_norm": 9.771605491638184,
"learning_rate": 3.997595075479171e-05,
"loss": 0.2260110855102539,
"mean_token_accuracy": 0.9248299193382263,
"num_tokens": 2793086574.0,
"step": 35850
},
{
"entropy": 0.2289821219444275,
"epoch": 1.429595412551768,
"grad_norm": 1.2308059930801392,
"learning_rate": 3.971837507579228e-05,
"loss": 0.22705148696899413,
"mean_token_accuracy": 0.9248201483488083,
"num_tokens": 2797062663.0,
"step": 35900
},
{
"entropy": 0.22674365878105163,
"epoch": 1.4315864925135393,
"grad_norm": 0.6203780770301819,
"learning_rate": 3.946142610193075e-05,
"loss": 0.22311054229736327,
"mean_token_accuracy": 0.9253755122423172,
"num_tokens": 2801003084.0,
"step": 35950
},
{
"entropy": 0.2285499520599842,
"epoch": 1.4335775724753106,
"grad_norm": 0.6966903805732727,
"learning_rate": 3.920510650452269e-05,
"loss": 0.22486160278320313,
"mean_token_accuracy": 0.9250599068403244,
"num_tokens": 2804929445.0,
"step": 36000
},
{
"epoch": 1.4335775724753106,
"eval_entropy": 0.22345993916193643,
"eval_loss": 0.2309042513370514,
"eval_mean_token_accuracy": 0.9215882713832553,
"eval_num_tokens": 2804929445.0,
"eval_runtime": 97.9244,
"eval_samples_per_second": 10.212,
"eval_steps_per_second": 0.643,
"step": 36000
},
{
"entropy": 0.22846704930067063,
"epoch": 1.4355686524370819,
"grad_norm": 18.896896362304688,
"learning_rate": 3.894941894834048e-05,
"loss": 0.22570266723632812,
"mean_token_accuracy": 0.9257201546430588,
"num_tokens": 2808763772.0,
"step": 36050
},
{
"entropy": 0.22670045271515846,
"epoch": 1.4375597323988532,
"grad_norm": 2.932440996170044,
"learning_rate": 3.869436609158559e-05,
"loss": 0.22269927978515625,
"mean_token_accuracy": 0.9260558187961578,
"num_tokens": 2812551635.0,
"step": 36100
},
{
"entropy": 0.2322857917845249,
"epoch": 1.4395508123606244,
"grad_norm": 2.4364428520202637,
"learning_rate": 3.8439950585861e-05,
"loss": 0.22790021896362306,
"mean_token_accuracy": 0.9243459624052047,
"num_tokens": 2816505564.0,
"step": 36150
},
{
"entropy": 0.23179278627038002,
"epoch": 1.4415418923223957,
"grad_norm": 0.8245556950569153,
"learning_rate": 3.81861750761436e-05,
"loss": 0.22998580932617188,
"mean_token_accuracy": 0.9245978146791458,
"num_tokens": 2820466604.0,
"step": 36200
},
{
"entropy": 0.23288773104548455,
"epoch": 1.443532972284167,
"grad_norm": 1.0259772539138794,
"learning_rate": 3.793304220075672e-05,
"loss": 0.23358001708984374,
"mean_token_accuracy": 0.9243580067157745,
"num_tokens": 2824397515.0,
"step": 36250
},
{
"entropy": 0.22789985239505767,
"epoch": 1.4455240522459383,
"grad_norm": 9.18964672088623,
"learning_rate": 3.7680554591342595e-05,
"loss": 0.224021053314209,
"mean_token_accuracy": 0.9257315665483474,
"num_tokens": 2828322125.0,
"step": 36300
},
{
"entropy": 0.22588057518005372,
"epoch": 1.4475151322077093,
"grad_norm": 1.5855872631072998,
"learning_rate": 3.742871487283517e-05,
"loss": 0.2249225616455078,
"mean_token_accuracy": 0.9258129727840424,
"num_tokens": 2832064808.0,
"step": 36350
},
{
"entropy": 0.22681081116199495,
"epoch": 1.4495062121694806,
"grad_norm": 0.9966343641281128,
"learning_rate": 3.717752566343271e-05,
"loss": 0.22803802490234376,
"mean_token_accuracy": 0.9256650274991989,
"num_tokens": 2836024488.0,
"step": 36400
},
{
"entropy": 0.23106618836522103,
"epoch": 1.451497292131252,
"grad_norm": 4.7284464836120605,
"learning_rate": 3.69269895745706e-05,
"loss": 0.22984613418579103,
"mean_token_accuracy": 0.9237276768684387,
"num_tokens": 2839943059.0,
"step": 36450
},
{
"entropy": 0.22288828268647193,
"epoch": 1.4534883720930232,
"grad_norm": 0.7623031139373779,
"learning_rate": 3.667710921089418e-05,
"loss": 0.22018928527832032,
"mean_token_accuracy": 0.9268843108415603,
"num_tokens": 2843833836.0,
"step": 36500
},
{
"entropy": 0.23100583925843238,
"epoch": 1.4554794520547945,
"grad_norm": 0.8289280533790588,
"learning_rate": 3.64278871702317e-05,
"loss": 0.22793426513671874,
"mean_token_accuracy": 0.9247871005535125,
"num_tokens": 2847710648.0,
"step": 36550
},
{
"entropy": 0.2282957051694393,
"epoch": 1.4574705320165657,
"grad_norm": 0.7811777591705322,
"learning_rate": 3.617932604356729e-05,
"loss": 0.22422840118408202,
"mean_token_accuracy": 0.9262890052795411,
"num_tokens": 2851604514.0,
"step": 36600
},
{
"entropy": 0.22520012721419336,
"epoch": 1.459461611978337,
"grad_norm": 0.8696520328521729,
"learning_rate": 3.5931428415014014e-05,
"loss": 0.22324569702148436,
"mean_token_accuracy": 0.9258240640163422,
"num_tokens": 2855664391.0,
"step": 36650
},
{
"entropy": 0.22581250563263894,
"epoch": 1.4614526919401083,
"grad_norm": 0.744315505027771,
"learning_rate": 3.568419686178708e-05,
"loss": 0.22559711456298828,
"mean_token_accuracy": 0.9261856961250305,
"num_tokens": 2859509766.0,
"step": 36700
},
{
"entropy": 0.2275920917093754,
"epoch": 1.4634437719018796,
"grad_norm": 1.2164433002471924,
"learning_rate": 3.543763395417682e-05,
"loss": 0.2258456802368164,
"mean_token_accuracy": 0.9255189836025238,
"num_tokens": 2863404259.0,
"step": 36750
},
{
"entropy": 0.22345173820853234,
"epoch": 1.4654348518636509,
"grad_norm": 0.6867997646331787,
"learning_rate": 3.5191742255522395e-05,
"loss": 0.22099639892578124,
"mean_token_accuracy": 0.9270286786556244,
"num_tokens": 2867284843.0,
"step": 36800
},
{
"entropy": 0.21736916065216064,
"epoch": 1.4674259318254221,
"grad_norm": 0.7665778994560242,
"learning_rate": 3.494652432218463e-05,
"loss": 0.2197450065612793,
"mean_token_accuracy": 0.9281142580509186,
"num_tokens": 2871146245.0,
"step": 36850
},
{
"entropy": 0.2261849372088909,
"epoch": 1.4694170117871934,
"grad_norm": 1.0307066440582275,
"learning_rate": 3.470198270351983e-05,
"loss": 0.2237540054321289,
"mean_token_accuracy": 0.9261994022130966,
"num_tokens": 2874929172.0,
"step": 36900
},
{
"entropy": 0.22291465908288954,
"epoch": 1.4714080917489647,
"grad_norm": 111.51166534423828,
"learning_rate": 3.445811994185311e-05,
"loss": 0.21993278503417968,
"mean_token_accuracy": 0.9265702044963837,
"num_tokens": 2878907889.0,
"step": 36950
},
{
"entropy": 0.22984845981001853,
"epoch": 1.473399171710736,
"grad_norm": 0.6987447738647461,
"learning_rate": 3.421493857245199e-05,
"loss": 0.23014335632324218,
"mean_token_accuracy": 0.9256218951940537,
"num_tokens": 2882673971.0,
"step": 37000
},
{
"entropy": 0.22242909878492356,
"epoch": 1.4753902516725073,
"grad_norm": 2.1599528789520264,
"learning_rate": 3.3972441123500045e-05,
"loss": 0.22177177429199219,
"mean_token_accuracy": 0.9269962483644485,
"num_tokens": 2886614337.0,
"step": 37050
},
{
"entropy": 0.22314247265458106,
"epoch": 1.4773813316342785,
"grad_norm": 0.648526132106781,
"learning_rate": 3.373063011607059e-05,
"loss": 0.22280792236328126,
"mean_token_accuracy": 0.9268735468387603,
"num_tokens": 2890594824.0,
"step": 37100
},
{
"entropy": 0.22995008423924446,
"epoch": 1.4793724115960498,
"grad_norm": 0.9100789427757263,
"learning_rate": 3.348950806410054e-05,
"loss": 0.22757783889770508,
"mean_token_accuracy": 0.9252729284763336,
"num_tokens": 2894438864.0,
"step": 37150
},
{
"entropy": 0.22689683616161346,
"epoch": 1.481363491557821,
"grad_norm": 121.19415283203125,
"learning_rate": 3.324907747436423e-05,
"loss": 0.2277880859375,
"mean_token_accuracy": 0.9258731609582901,
"num_tokens": 2898300182.0,
"step": 37200
},
{
"entropy": 0.22294052615761756,
"epoch": 1.4833545715195922,
"grad_norm": 30.978212356567383,
"learning_rate": 3.300934084644727e-05,
"loss": 0.21728097915649414,
"mean_token_accuracy": 0.9270085525512696,
"num_tokens": 2902221223.0,
"step": 37250
},
{
"entropy": 0.23212106972932817,
"epoch": 1.4853456514813634,
"grad_norm": 0.8279492259025574,
"learning_rate": 3.277030067272072e-05,
"loss": 0.23210474014282226,
"mean_token_accuracy": 0.9236459809541703,
"num_tokens": 2905980634.0,
"step": 37300
},
{
"entropy": 0.22908665359020233,
"epoch": 1.4873367314431347,
"grad_norm": 2.934983015060425,
"learning_rate": 3.253195943831511e-05,
"loss": 0.22299076080322267,
"mean_token_accuracy": 0.925340690612793,
"num_tokens": 2909868699.0,
"step": 37350
},
{
"entropy": 0.22319218948483466,
"epoch": 1.489327811404906,
"grad_norm": 11.222670555114746,
"learning_rate": 3.229431962109455e-05,
"loss": 0.22189111709594728,
"mean_token_accuracy": 0.9269910353422165,
"num_tokens": 2913868017.0,
"step": 37400
},
{
"entropy": 0.2243164885044098,
"epoch": 1.4913188913666773,
"grad_norm": 25.52601432800293,
"learning_rate": 3.205738369163105e-05,
"loss": 0.22555835723876952,
"mean_token_accuracy": 0.9249966585636139,
"num_tokens": 2917728385.0,
"step": 37450
},
{
"entropy": 0.2241789762675762,
"epoch": 1.4933099713284486,
"grad_norm": 9572.515625,
"learning_rate": 3.182115411317879e-05,
"loss": 0.22412548065185547,
"mean_token_accuracy": 0.9268283969163895,
"num_tokens": 2921629087.0,
"step": 37500
},
{
"epoch": 1.4933099713284486,
"eval_entropy": 0.22155299451616076,
"eval_loss": 0.226557195186615,
"eval_mean_token_accuracy": 0.9227044922964913,
"eval_num_tokens": 2921629087.0,
"eval_runtime": 97.8985,
"eval_samples_per_second": 10.215,
"eval_steps_per_second": 0.644,
"step": 37500
},
{
"entropy": 0.2184179201722145,
"epoch": 1.4953010512902198,
"grad_norm": 1.632070541381836,
"learning_rate": 3.1585633341648505e-05,
"loss": 0.21661128997802734,
"mean_token_accuracy": 0.927964398264885,
"num_tokens": 2925570451.0,
"step": 37550
},
{
"entropy": 0.2241984224319458,
"epoch": 1.4972921312519911,
"grad_norm": 2.975705862045288,
"learning_rate": 3.135082382558202e-05,
"loss": 0.22081336975097657,
"mean_token_accuracy": 0.9267278093099595,
"num_tokens": 2929558328.0,
"step": 37600
},
{
"entropy": 0.2238903446495533,
"epoch": 1.4992832112137624,
"grad_norm": 1.1821390390396118,
"learning_rate": 3.111672800612664e-05,
"loss": 0.2203415298461914,
"mean_token_accuracy": 0.9268561029434204,
"num_tokens": 2933576475.0,
"step": 37650
},
{
"entropy": 0.21960934937000276,
"epoch": 1.5012742911755335,
"grad_norm": 4.258495330810547,
"learning_rate": 3.088334831700993e-05,
"loss": 0.21440572738647462,
"mean_token_accuracy": 0.9271126753091812,
"num_tokens": 2937500631.0,
"step": 37700
},
{
"entropy": 0.22476192206144333,
"epoch": 1.5032653711373047,
"grad_norm": 3.1449878215789795,
"learning_rate": 3.0650687184514485e-05,
"loss": 0.2259622573852539,
"mean_token_accuracy": 0.925874103307724,
"num_tokens": 2941343777.0,
"step": 37750
},
{
"entropy": 0.22604495018720627,
"epoch": 1.505256451099076,
"grad_norm": 8.281270980834961,
"learning_rate": 3.0418747027452344e-05,
"loss": 0.2268206787109375,
"mean_token_accuracy": 0.9257059663534164,
"num_tokens": 2945269139.0,
"step": 37800
},
{
"entropy": 0.2256699912250042,
"epoch": 1.5072475310608473,
"grad_norm": 1.3491407632827759,
"learning_rate": 3.018753025714024e-05,
"loss": 0.2271018409729004,
"mean_token_accuracy": 0.92496422290802,
"num_tokens": 2949257027.0,
"step": 37850
},
{
"entropy": 0.2192372766137123,
"epoch": 1.5092386110226186,
"grad_norm": 8.2188720703125,
"learning_rate": 2.9957039277374323e-05,
"loss": 0.2174224090576172,
"mean_token_accuracy": 0.9276827430725098,
"num_tokens": 2953283440.0,
"step": 37900
},
{
"entropy": 0.22263924196362495,
"epoch": 1.5112296909843899,
"grad_norm": 4.670276165008545,
"learning_rate": 2.972727648440521e-05,
"loss": 0.21921150207519532,
"mean_token_accuracy": 0.9276534301042557,
"num_tokens": 2956989210.0,
"step": 37950
},
{
"entropy": 0.21206003218889236,
"epoch": 1.5132207709461611,
"grad_norm": 2.4002881050109863,
"learning_rate": 2.9498244266913077e-05,
"loss": 0.2130445671081543,
"mean_token_accuracy": 0.9293075942993164,
"num_tokens": 2960990017.0,
"step": 38000
},
{
"entropy": 0.22117702782154083,
"epoch": 1.5152118509079324,
"grad_norm": 6.803835391998291,
"learning_rate": 2.926994500598288e-05,
"loss": 0.22471899032592774,
"mean_token_accuracy": 0.9264506107568741,
"num_tokens": 2964919811.0,
"step": 38050
},
{
"entropy": 0.22678003415465356,
"epoch": 1.5172029308697037,
"grad_norm": 1.0673514604568481,
"learning_rate": 2.9042381075079394e-05,
"loss": 0.2256137275695801,
"mean_token_accuracy": 0.9257134348154068,
"num_tokens": 2968978045.0,
"step": 38100
},
{
"entropy": 0.22859185308218002,
"epoch": 1.519194010831475,
"grad_norm": 1.2845282554626465,
"learning_rate": 2.881555484002293e-05,
"loss": 0.22426969528198243,
"mean_token_accuracy": 0.9252816712856293,
"num_tokens": 2972980896.0,
"step": 38150
},
{
"entropy": 0.22109326124191284,
"epoch": 1.5211850907932463,
"grad_norm": 5.438140392303467,
"learning_rate": 2.858946865896428e-05,
"loss": 0.21824604034423828,
"mean_token_accuracy": 0.9274251675605774,
"num_tokens": 2976722951.0,
"step": 38200
},
{
"entropy": 0.22596635431051254,
"epoch": 1.5231761707550175,
"grad_norm": 14.905731201171875,
"learning_rate": 2.8364124882360544e-05,
"loss": 0.22388429641723634,
"mean_token_accuracy": 0.9256227517127991,
"num_tokens": 2980714087.0,
"step": 38250
},
{
"entropy": 0.2224484533071518,
"epoch": 1.5251672507167888,
"grad_norm": 3.0896732807159424,
"learning_rate": 2.813952585295052e-05,
"loss": 0.22124006271362304,
"mean_token_accuracy": 0.9260759902000427,
"num_tokens": 2984690559.0,
"step": 38300
},
{
"entropy": 0.2202881780266762,
"epoch": 1.52715833067856,
"grad_norm": 5.143960475921631,
"learning_rate": 2.7915673905730434e-05,
"loss": 0.21950557708740234,
"mean_token_accuracy": 0.9270938616991043,
"num_tokens": 2988553760.0,
"step": 38350
},
{
"entropy": 0.22221544161438941,
"epoch": 1.5291494106403314,
"grad_norm": 4.49341344833374,
"learning_rate": 2.7692571367929608e-05,
"loss": 0.22334598541259765,
"mean_token_accuracy": 0.9261446082592011,
"num_tokens": 2992421474.0,
"step": 38400
},
{
"entropy": 0.22259217351675034,
"epoch": 1.5311404906021027,
"grad_norm": 22.436153411865234,
"learning_rate": 2.7470220558986293e-05,
"loss": 0.2211014747619629,
"mean_token_accuracy": 0.927097294330597,
"num_tokens": 2996393136.0,
"step": 38450
},
{
"entropy": 0.2215883442759514,
"epoch": 1.533131570563874,
"grad_norm": 12.471090316772461,
"learning_rate": 2.7248623790523552e-05,
"loss": 0.21897666931152343,
"mean_token_accuracy": 0.9272121900320053,
"num_tokens": 3000399931.0,
"step": 38500
},
{
"entropy": 0.2189611642062664,
"epoch": 1.5351226505256452,
"grad_norm": 2.521131753921509,
"learning_rate": 2.7027783366325255e-05,
"loss": 0.22009151458740234,
"mean_token_accuracy": 0.9275297212600708,
"num_tokens": 3004351373.0,
"step": 38550
},
{
"entropy": 0.21605175256729126,
"epoch": 1.5371137304874165,
"grad_norm": 0.8228936195373535,
"learning_rate": 2.6807701582312007e-05,
"loss": 0.21643526077270508,
"mean_token_accuracy": 0.9290778201818466,
"num_tokens": 3008120830.0,
"step": 38600
},
{
"entropy": 0.21972268596291541,
"epoch": 1.5391048104491878,
"grad_norm": 4.456844329833984,
"learning_rate": 2.6588380726517438e-05,
"loss": 0.21687641143798828,
"mean_token_accuracy": 0.927766455411911,
"num_tokens": 3011862850.0,
"step": 38650
},
{
"entropy": 0.21665039166808128,
"epoch": 1.541095890410959,
"grad_norm": 13.769525527954102,
"learning_rate": 2.6369823079064426e-05,
"loss": 0.21669651031494142,
"mean_token_accuracy": 0.9281174397468567,
"num_tokens": 3015844338.0,
"step": 38700
},
{
"entropy": 0.21486522629857063,
"epoch": 1.5430869703727301,
"grad_norm": 2.328981637954712,
"learning_rate": 2.6152030912141156e-05,
"loss": 0.213769588470459,
"mean_token_accuracy": 0.9283159101009368,
"num_tokens": 3019795586.0,
"step": 38750
},
{
"entropy": 0.2236236061155796,
"epoch": 1.5450780503345014,
"grad_norm": 1.409731388092041,
"learning_rate": 2.5935006489977753e-05,
"loss": 0.22388771057128906,
"mean_token_accuracy": 0.9261727368831635,
"num_tokens": 3023785071.0,
"step": 38800
},
{
"entropy": 0.22205795854330063,
"epoch": 1.5470691302962727,
"grad_norm": 0.8017808794975281,
"learning_rate": 2.5718752068822637e-05,
"loss": 0.21935756683349608,
"mean_token_accuracy": 0.9270194679498672,
"num_tokens": 3027649742.0,
"step": 38850
},
{
"entropy": 0.21731107220053672,
"epoch": 1.549060210258044,
"grad_norm": 1.1843457221984863,
"learning_rate": 2.5503269896919056e-05,
"loss": 0.21343338012695312,
"mean_token_accuracy": 0.9281834596395493,
"num_tokens": 3031508387.0,
"step": 38900
},
{
"entropy": 0.2247211866080761,
"epoch": 1.5510512902198152,
"grad_norm": 2.625734567642212,
"learning_rate": 2.5288562214481783e-05,
"loss": 0.21889663696289063,
"mean_token_accuracy": 0.9264307451248169,
"num_tokens": 3035507408.0,
"step": 38950
},
{
"entropy": 0.21469190895557402,
"epoch": 1.5530423701815865,
"grad_norm": 1.0048292875289917,
"learning_rate": 2.5074631253673662e-05,
"loss": 0.21466026306152344,
"mean_token_accuracy": 0.928369175195694,
"num_tokens": 3039388849.0,
"step": 39000
},
{
"epoch": 1.5530423701815865,
"eval_entropy": 0.21342357555552136,
"eval_loss": 0.22486525774002075,
"eval_mean_token_accuracy": 0.9228534215972537,
"eval_num_tokens": 3039388849.0,
"eval_runtime": 98.35,
"eval_samples_per_second": 10.168,
"eval_steps_per_second": 0.641,
"step": 39000
},
{
"entropy": 0.22176682874560355,
"epoch": 1.5550334501433578,
"grad_norm": 3.4707674980163574,
"learning_rate": 2.4861479238582596e-05,
"loss": 0.22119997024536134,
"mean_token_accuracy": 0.9259116953611374,
"num_tokens": 3043265800.0,
"step": 39050
},
{
"entropy": 0.21799086198210715,
"epoch": 1.5570245301051289,
"grad_norm": 2.8396286964416504,
"learning_rate": 2.4649108385198427e-05,
"loss": 0.2187785530090332,
"mean_token_accuracy": 0.9272249537706375,
"num_tokens": 3047277743.0,
"step": 39100
},
{
"entropy": 0.21569239243865013,
"epoch": 1.5590156100669001,
"grad_norm": 1.3464019298553467,
"learning_rate": 2.4437520901389632e-05,
"loss": 0.2122294807434082,
"mean_token_accuracy": 0.9286917650699615,
"num_tokens": 3051165918.0,
"step": 39150
},
{
"entropy": 0.22129391238093377,
"epoch": 1.5610066900286714,
"grad_norm": 50.253761291503906,
"learning_rate": 2.422671898688068e-05,
"loss": 0.2180173873901367,
"mean_token_accuracy": 0.9284462577104569,
"num_tokens": 3055024433.0,
"step": 39200
},
{
"entropy": 0.22183120295405387,
"epoch": 1.5629977699904427,
"grad_norm": 2.614213705062866,
"learning_rate": 2.4016704833228998e-05,
"loss": 0.21925174713134765,
"mean_token_accuracy": 0.9262894040346146,
"num_tokens": 3058925272.0,
"step": 39250
},
{
"entropy": 0.21707088455557824,
"epoch": 1.564988849952214,
"grad_norm": 2.362391710281372,
"learning_rate": 2.3807480623802216e-05,
"loss": 0.21744693756103517,
"mean_token_accuracy": 0.9284393548965454,
"num_tokens": 3062926466.0,
"step": 39300
},
{
"entropy": 0.2231329759955406,
"epoch": 1.5669799299139853,
"grad_norm": 2.7910847663879395,
"learning_rate": 2.3599048533755484e-05,
"loss": 0.2215903091430664,
"mean_token_accuracy": 0.92674241065979,
"num_tokens": 3066774481.0,
"step": 39350
},
{
"entropy": 0.218631292283535,
"epoch": 1.5689710098757566,
"grad_norm": 2.050013780593872,
"learning_rate": 2.339141073000888e-05,
"loss": 0.2163446044921875,
"mean_token_accuracy": 0.9279627180099488,
"num_tokens": 3070759669.0,
"step": 39400
},
{
"entropy": 0.22251748919487,
"epoch": 1.5709620898375278,
"grad_norm": 1.1582326889038086,
"learning_rate": 2.3184569371224796e-05,
"loss": 0.22154170989990235,
"mean_token_accuracy": 0.9265431314706802,
"num_tokens": 3074745933.0,
"step": 39450
},
{
"entropy": 0.21645621821284294,
"epoch": 1.5729531697992991,
"grad_norm": 1.1507421731948853,
"learning_rate": 2.297852660778561e-05,
"loss": 0.2131570053100586,
"mean_token_accuracy": 0.9290761828422547,
"num_tokens": 3078609666.0,
"step": 39500
},
{
"entropy": 0.21492433786392212,
"epoch": 1.5749442497610704,
"grad_norm": 4.330776691436768,
"learning_rate": 2.2773284581771214e-05,
"loss": 0.2180664825439453,
"mean_token_accuracy": 0.9282948035001755,
"num_tokens": 3082354144.0,
"step": 39550
},
{
"entropy": 0.21522749200463295,
"epoch": 1.5769353297228417,
"grad_norm": 1.0180329084396362,
"learning_rate": 2.2568845426936823e-05,
"loss": 0.2134151840209961,
"mean_token_accuracy": 0.9284723418951034,
"num_tokens": 3086179781.0,
"step": 39600
},
{
"entropy": 0.21389096170663835,
"epoch": 1.578926409684613,
"grad_norm": 2.2567880153656006,
"learning_rate": 2.2365211268690856e-05,
"loss": 0.21490795135498048,
"mean_token_accuracy": 0.9287674587965011,
"num_tokens": 3090053115.0,
"step": 39650
},
{
"entropy": 0.21932182297110558,
"epoch": 1.5809174896463842,
"grad_norm": 20.473278045654297,
"learning_rate": 2.2162384224072608e-05,
"loss": 0.21317176818847655,
"mean_token_accuracy": 0.9280319666862488,
"num_tokens": 3093969332.0,
"step": 39700
},
{
"entropy": 0.21719238206744193,
"epoch": 1.5829085696081555,
"grad_norm": 1.1855759620666504,
"learning_rate": 2.1960366401730492e-05,
"loss": 0.21747058868408203,
"mean_token_accuracy": 0.9273398566246033,
"num_tokens": 3097928473.0,
"step": 39750
},
{
"entropy": 0.22151433676481247,
"epoch": 1.5848996495699268,
"grad_norm": 12.52309513092041,
"learning_rate": 2.1759159901899972e-05,
"loss": 0.21812362670898439,
"mean_token_accuracy": 0.927079439163208,
"num_tokens": 3101781883.0,
"step": 39800
},
{
"entropy": 0.21495074391365052,
"epoch": 1.586890729531698,
"grad_norm": 0.7089627981185913,
"learning_rate": 2.1558766816381804e-05,
"loss": 0.2153666114807129,
"mean_token_accuracy": 0.9288167887926102,
"num_tokens": 3105821084.0,
"step": 39850
},
{
"entropy": 0.22185655996203424,
"epoch": 1.5888818094934694,
"grad_norm": 20.341962814331055,
"learning_rate": 2.1359189228520237e-05,
"loss": 0.22094457626342773,
"mean_token_accuracy": 0.9260220712423325,
"num_tokens": 3109657086.0,
"step": 39900
},
{
"entropy": 0.22154104918241502,
"epoch": 1.5908728894552406,
"grad_norm": 1.856255054473877,
"learning_rate": 2.116042921318133e-05,
"loss": 0.22122642517089844,
"mean_token_accuracy": 0.9261481338739395,
"num_tokens": 3113612059.0,
"step": 39950
},
{
"entropy": 0.21654552415013315,
"epoch": 1.592863969417012,
"grad_norm": 2.5476434230804443,
"learning_rate": 2.0962488836731443e-05,
"loss": 0.21597785949707032,
"mean_token_accuracy": 0.9289438962936402,
"num_tokens": 3117625330.0,
"step": 40000
},
{
"entropy": 0.21598056226968765,
"epoch": 1.5948550493787832,
"grad_norm": 26.293344497680664,
"learning_rate": 2.076537015701584e-05,
"loss": 0.21633754730224608,
"mean_token_accuracy": 0.9281029665470123,
"num_tokens": 3121425433.0,
"step": 40050
},
{
"entropy": 0.21721562683582307,
"epoch": 1.5968461293405545,
"grad_norm": 2.0095717906951904,
"learning_rate": 2.056907522333701e-05,
"loss": 0.2188913917541504,
"mean_token_accuracy": 0.9278429085016251,
"num_tokens": 3125303976.0,
"step": 40100
},
{
"entropy": 0.21628726929426192,
"epoch": 1.5988372093023255,
"grad_norm": 12.751546859741211,
"learning_rate": 2.0373606076433672e-05,
"loss": 0.21001420974731444,
"mean_token_accuracy": 0.9288813596963883,
"num_tokens": 3129189259.0,
"step": 40150
},
{
"entropy": 0.21064794391393662,
"epoch": 1.6008282892640968,
"grad_norm": 0.977423906326294,
"learning_rate": 2.0178964748459362e-05,
"loss": 0.20974472045898437,
"mean_token_accuracy": 0.9297809761762619,
"num_tokens": 3133051181.0,
"step": 40200
},
{
"entropy": 0.22305100120604038,
"epoch": 1.602819369225868,
"grad_norm": 0.8115474581718445,
"learning_rate": 1.998515326296142e-05,
"loss": 0.2161123847961426,
"mean_token_accuracy": 0.9274122947454453,
"num_tokens": 3136743350.0,
"step": 40250
},
{
"entropy": 0.21686189234256745,
"epoch": 1.6048104491876394,
"grad_norm": 1.618212342262268,
"learning_rate": 1.979217363485989e-05,
"loss": 0.2156623649597168,
"mean_token_accuracy": 0.9281445103883743,
"num_tokens": 3140659012.0,
"step": 40300
},
{
"entropy": 0.21185349941253662,
"epoch": 1.6068015291494107,
"grad_norm": 0.9155282974243164,
"learning_rate": 1.9600027870426506e-05,
"loss": 0.20886346817016602,
"mean_token_accuracy": 0.9293528980016709,
"num_tokens": 3144567867.0,
"step": 40350
},
{
"entropy": 0.21675873085856437,
"epoch": 1.608792609111182,
"grad_norm": 21.752269744873047,
"learning_rate": 1.9408717967264066e-05,
"loss": 0.2155482864379883,
"mean_token_accuracy": 0.9282829076051712,
"num_tokens": 3148409926.0,
"step": 40400
},
{
"entropy": 0.2160284450650215,
"epoch": 1.6107836890729532,
"grad_norm": 11.025493621826172,
"learning_rate": 1.9218245914285437e-05,
"loss": 0.2147054672241211,
"mean_token_accuracy": 0.9282228392362595,
"num_tokens": 3152435454.0,
"step": 40450
},
{
"entropy": 0.21994507059454918,
"epoch": 1.6127747690347243,
"grad_norm": 31.000930786132812,
"learning_rate": 1.9028613691692887e-05,
"loss": 0.2158209800720215,
"mean_token_accuracy": 0.9269871145486832,
"num_tokens": 3156288599.0,
"step": 40500
},
{
"epoch": 1.6127747690347243,
"eval_entropy": 0.21402156861528518,
"eval_loss": 0.22149111330509186,
"eval_mean_token_accuracy": 0.9242527182140048,
"eval_num_tokens": 3156288599.0,
"eval_runtime": 98.1435,
"eval_samples_per_second": 10.189,
"eval_steps_per_second": 0.642,
"step": 40500
},
{
"entropy": 0.2200436171889305,
"epoch": 1.6147658489964956,
"grad_norm": 7.249177932739258,
"learning_rate": 1.8839823270957625e-05,
"loss": 0.2148914909362793,
"mean_token_accuracy": 0.9276934152841568,
"num_tokens": 3160109492.0,
"step": 40550
},
{
"entropy": 0.21039872646331786,
"epoch": 1.6167569289582668,
"grad_norm": 3.97442626953125,
"learning_rate": 1.8651876614799347e-05,
"loss": 0.20821548461914063,
"mean_token_accuracy": 0.92963711977005,
"num_tokens": 3163948586.0,
"step": 40600
},
{
"entropy": 0.2125879742205143,
"epoch": 1.6187480089200381,
"grad_norm": 4.380746841430664,
"learning_rate": 1.8464775677165536e-05,
"loss": 0.21132637023925782,
"mean_token_accuracy": 0.9289473402500152,
"num_tokens": 3167768217.0,
"step": 40650
},
{
"entropy": 0.2152009476721287,
"epoch": 1.6207390888818094,
"grad_norm": 2.1306657791137695,
"learning_rate": 1.8278522403211472e-05,
"loss": 0.21508853912353515,
"mean_token_accuracy": 0.9290641701221466,
"num_tokens": 3171738971.0,
"step": 40700
},
{
"entropy": 0.2135643979907036,
"epoch": 1.6227301688435807,
"grad_norm": 6.235568046569824,
"learning_rate": 1.8093118729279847e-05,
"loss": 0.21154956817626952,
"mean_token_accuracy": 0.9292153662443161,
"num_tokens": 3175414893.0,
"step": 40750
},
{
"entropy": 0.21976500377058983,
"epoch": 1.624721248805352,
"grad_norm": 1.4987317323684692,
"learning_rate": 1.7908566582880658e-05,
"loss": 0.2205881118774414,
"mean_token_accuracy": 0.9276097309589386,
"num_tokens": 3179363316.0,
"step": 40800
},
{
"entropy": 0.2242605820298195,
"epoch": 1.6267123287671232,
"grad_norm": 1.8390077352523804,
"learning_rate": 1.7724867882671205e-05,
"loss": 0.22253013610839845,
"mean_token_accuracy": 0.9263802176713943,
"num_tokens": 3183142991.0,
"step": 40850
},
{
"entropy": 0.21403965666890146,
"epoch": 1.6287034087288945,
"grad_norm": 0.9712594747543335,
"learning_rate": 1.7542024538436054e-05,
"loss": 0.20888723373413087,
"mean_token_accuracy": 0.9288804924488068,
"num_tokens": 3187113070.0,
"step": 40900
},
{
"entropy": 0.2297496658563614,
"epoch": 1.6306944886906658,
"grad_norm": 2.2136800289154053,
"learning_rate": 1.7360038451067274e-05,
"loss": 0.22716428756713866,
"mean_token_accuracy": 0.9243395751714707,
"num_tokens": 3190985017.0,
"step": 40950
},
{
"entropy": 0.21799209505319594,
"epoch": 1.632685568652437,
"grad_norm": 1.661545991897583,
"learning_rate": 1.7178911512544738e-05,
"loss": 0.2154435920715332,
"mean_token_accuracy": 0.9278116518259049,
"num_tokens": 3194821627.0,
"step": 41000
},
{
"entropy": 0.21571315512061118,
"epoch": 1.6346766486142084,
"grad_norm": 1.2771720886230469,
"learning_rate": 1.6998645605916186e-05,
"loss": 0.21327953338623046,
"mean_token_accuracy": 0.9287315171957016,
"num_tokens": 3198747711.0,
"step": 41050
},
{
"entropy": 0.21436791002750397,
"epoch": 1.6366677285759796,
"grad_norm": 0.8762326836585999,
"learning_rate": 1.681924260527795e-05,
"loss": 0.21281551361083983,
"mean_token_accuracy": 0.9294509363174438,
"num_tokens": 3202530074.0,
"step": 41100
},
{
"entropy": 0.2123296819627285,
"epoch": 1.638658808537751,
"grad_norm": 0.7044285535812378,
"learning_rate": 1.66407043757553e-05,
"loss": 0.21069869995117188,
"mean_token_accuracy": 0.9294757169485092,
"num_tokens": 3206534011.0,
"step": 41150
},
{
"entropy": 0.21492626041173934,
"epoch": 1.6406498884995222,
"grad_norm": 9.144807815551758,
"learning_rate": 1.64630327734831e-05,
"loss": 0.2130570602416992,
"mean_token_accuracy": 0.9289986944198608,
"num_tokens": 3210440419.0,
"step": 41200
},
{
"entropy": 0.21355638578534125,
"epoch": 1.6426409684612935,
"grad_norm": 8.384472846984863,
"learning_rate": 1.6286229645586536e-05,
"loss": 0.2130125045776367,
"mean_token_accuracy": 0.9284316200017929,
"num_tokens": 3214291090.0,
"step": 41250
},
{
"entropy": 0.2188258746266365,
"epoch": 1.6446320484230648,
"grad_norm": 1.3508156538009644,
"learning_rate": 1.6110296830161785e-05,
"loss": 0.21920238494873046,
"mean_token_accuracy": 0.9268940687179565,
"num_tokens": 3218226397.0,
"step": 41300
},
{
"entropy": 0.2143702931702137,
"epoch": 1.646623128384836,
"grad_norm": 2.916459560394287,
"learning_rate": 1.593523615625714e-05,
"loss": 0.2127183723449707,
"mean_token_accuracy": 0.9287808537483215,
"num_tokens": 3222172225.0,
"step": 41350
},
{
"entropy": 0.21112210765480996,
"epoch": 1.6486142083466073,
"grad_norm": 0.9712974429130554,
"learning_rate": 1.5761049443853804e-05,
"loss": 0.21317562103271484,
"mean_token_accuracy": 0.9286684322357178,
"num_tokens": 3225972480.0,
"step": 41400
},
{
"entropy": 0.20567390725016593,
"epoch": 1.6506052883083786,
"grad_norm": 0.9209238886833191,
"learning_rate": 1.558773850384697e-05,
"loss": 0.205433349609375,
"mean_token_accuracy": 0.9311077183485031,
"num_tokens": 3229892438.0,
"step": 41450
},
{
"entropy": 0.21239387080073358,
"epoch": 1.6525963682701499,
"grad_norm": 1.4846440553665161,
"learning_rate": 1.5415305138027104e-05,
"loss": 0.21052703857421876,
"mean_token_accuracy": 0.9296367019414902,
"num_tokens": 3233832878.0,
"step": 41500
},
{
"entropy": 0.21011498600244521,
"epoch": 1.654587448231921,
"grad_norm": 2.049940824508667,
"learning_rate": 1.5243751139061203e-05,
"loss": 0.21002595901489257,
"mean_token_accuracy": 0.9301602828502655,
"num_tokens": 3237785637.0,
"step": 41550
},
{
"entropy": 0.2112150290608406,
"epoch": 1.6565785281936922,
"grad_norm": 55.68623352050781,
"learning_rate": 1.5073078290473996e-05,
"loss": 0.20992542266845704,
"mean_token_accuracy": 0.9297233396768569,
"num_tokens": 3241741524.0,
"step": 41600
},
{
"entropy": 0.21753552749753,
"epoch": 1.6585696081554635,
"grad_norm": 2.9803659915924072,
"learning_rate": 1.4903288366629598e-05,
"loss": 0.21804637908935548,
"mean_token_accuracy": 0.9274892538785935,
"num_tokens": 3245552506.0,
"step": 41650
},
{
"entropy": 0.21577703446149826,
"epoch": 1.6605606881172348,
"grad_norm": 7.269993305206299,
"learning_rate": 1.4734383132712993e-05,
"loss": 0.21403234481811523,
"mean_token_accuracy": 0.9283736723661423,
"num_tokens": 3249441151.0,
"step": 41700
},
{
"entropy": 0.2176537710428238,
"epoch": 1.662551768079006,
"grad_norm": 6.361774444580078,
"learning_rate": 1.4566364344711615e-05,
"loss": 0.21713001251220704,
"mean_token_accuracy": 0.927847085595131,
"num_tokens": 3253343053.0,
"step": 41750
},
{
"entropy": 0.21354290679097176,
"epoch": 1.6645428480407773,
"grad_norm": 106.82672882080078,
"learning_rate": 1.4399233749397234e-05,
"loss": 0.21209760665893554,
"mean_token_accuracy": 0.9293800675868988,
"num_tokens": 3257267667.0,
"step": 41800
},
{
"entropy": 0.21319517716765404,
"epoch": 1.6665339280025486,
"grad_norm": 1.91234290599823,
"learning_rate": 1.4232993084307612e-05,
"loss": 0.2100328254699707,
"mean_token_accuracy": 0.9298084115982056,
"num_tokens": 3261167140.0,
"step": 41850
},
{
"entropy": 0.2159775422513485,
"epoch": 1.6685250079643197,
"grad_norm": 1.951257586479187,
"learning_rate": 1.406764407772858e-05,
"loss": 0.21279817581176758,
"mean_token_accuracy": 0.9280615490674973,
"num_tokens": 3265013887.0,
"step": 41900
},
{
"entropy": 0.21692703947424888,
"epoch": 1.670516087926091,
"grad_norm": 1.1800713539123535,
"learning_rate": 1.390318844867613e-05,
"loss": 0.21641178131103517,
"mean_token_accuracy": 0.9281920313835144,
"num_tokens": 3268863519.0,
"step": 41950
},
{
"entropy": 0.21288384214043618,
"epoch": 1.6725071678878622,
"grad_norm": 4.761718273162842,
"learning_rate": 1.3739627906878271e-05,
"loss": 0.21155868530273436,
"mean_token_accuracy": 0.9296810233592987,
"num_tokens": 3272665262.0,
"step": 42000
},
{
"epoch": 1.6725071678878622,
"eval_entropy": 0.20912929730755941,
"eval_loss": 0.22023142874240875,
"eval_mean_token_accuracy": 0.9255002112615676,
"eval_num_tokens": 3272665262.0,
"eval_runtime": 98.2674,
"eval_samples_per_second": 10.176,
"eval_steps_per_second": 0.641,
"step": 42000
},
{
"entropy": 0.2097879809141159,
"epoch": 1.6744982478496335,
"grad_norm": 2.2647664546966553,
"learning_rate": 1.3576964152757542e-05,
"loss": 0.211810359954834,
"mean_token_accuracy": 0.929447072148323,
"num_tokens": 3276463801.0,
"step": 42050
},
{
"entropy": 0.21398061096668244,
"epoch": 1.6764893278114048,
"grad_norm": 1.7430264949798584,
"learning_rate": 1.3415198877413193e-05,
"loss": 0.21089591979980468,
"mean_token_accuracy": 0.9287590628862381,
"num_tokens": 3280413045.0,
"step": 42100
},
{
"entropy": 0.2118249951303005,
"epoch": 1.678480407773176,
"grad_norm": 0.7513388991355896,
"learning_rate": 1.3254333762603622e-05,
"loss": 0.211072998046875,
"mean_token_accuracy": 0.9304378354549407,
"num_tokens": 3284422179.0,
"step": 42150
},
{
"entropy": 0.2193823230266571,
"epoch": 1.6804714877349474,
"grad_norm": 1.4407684803009033,
"learning_rate": 1.3094370480728912e-05,
"loss": 0.21676433563232422,
"mean_token_accuracy": 0.9272742563486099,
"num_tokens": 3288271873.0,
"step": 42200
},
{
"entropy": 0.21136553287506105,
"epoch": 1.6824625676967186,
"grad_norm": 2.6618618965148926,
"learning_rate": 1.2935310694813373e-05,
"loss": 0.21298866271972655,
"mean_token_accuracy": 0.9293400466442108,
"num_tokens": 3292167154.0,
"step": 42250
},
{
"entropy": 0.20674633592367173,
"epoch": 1.68445364765849,
"grad_norm": 4.363306999206543,
"learning_rate": 1.2777156058488426e-05,
"loss": 0.20549545288085938,
"mean_token_accuracy": 0.9310127758979797,
"num_tokens": 3296150069.0,
"step": 42300
},
{
"entropy": 0.20810180857777597,
"epoch": 1.6864447276202612,
"grad_norm": 12.78535270690918,
"learning_rate": 1.2619908215975219e-05,
"loss": 0.20621026992797853,
"mean_token_accuracy": 0.9300779277086257,
"num_tokens": 3299908223.0,
"step": 42350
},
{
"entropy": 0.21136780738830566,
"epoch": 1.6884358075820325,
"grad_norm": 2.215325355529785,
"learning_rate": 1.2463568802067583e-05,
"loss": 0.21058544158935547,
"mean_token_accuracy": 0.929671134352684,
"num_tokens": 3303818694.0,
"step": 42400
},
{
"entropy": 0.21534586906433106,
"epoch": 1.6904268875438038,
"grad_norm": 4.338953495025635,
"learning_rate": 1.2308139442115096e-05,
"loss": 0.2148575973510742,
"mean_token_accuracy": 0.9283660215139389,
"num_tokens": 3307853357.0,
"step": 42450
},
{
"entropy": 0.21038600355386733,
"epoch": 1.692417967505575,
"grad_norm": 0.9631744027137756,
"learning_rate": 1.2153621752006228e-05,
"loss": 0.21024368286132813,
"mean_token_accuracy": 0.9297681283950806,
"num_tokens": 3311773443.0,
"step": 42500
},
{
"entropy": 0.2123473997414112,
"epoch": 1.6944090474673463,
"grad_norm": 1.845744013786316,
"learning_rate": 1.2000017338151336e-05,
"loss": 0.21207157135009766,
"mean_token_accuracy": 0.9293401914834977,
"num_tokens": 3315703478.0,
"step": 42550
},
{
"entropy": 0.20351918905973435,
"epoch": 1.6964001274291176,
"grad_norm": 3.7353572845458984,
"learning_rate": 1.184732779746619e-05,
"loss": 0.20555198669433594,
"mean_token_accuracy": 0.9311838829517365,
"num_tokens": 3319556817.0,
"step": 42600
},
{
"entropy": 0.21710732728242874,
"epoch": 1.698391207390889,
"grad_norm": 2.4422550201416016,
"learning_rate": 1.1695554717355172e-05,
"loss": 0.21829830169677733,
"mean_token_accuracy": 0.9286286699771881,
"num_tokens": 3323630231.0,
"step": 42650
},
{
"entropy": 0.20919491305947305,
"epoch": 1.7003822873526602,
"grad_norm": 6.628872871398926,
"learning_rate": 1.1544699675695025e-05,
"loss": 0.20743906021118164,
"mean_token_accuracy": 0.9308319443464279,
"num_tokens": 3327433458.0,
"step": 42700
},
{
"entropy": 0.2133838464319706,
"epoch": 1.7023733673144315,
"grad_norm": 2.618858814239502,
"learning_rate": 1.13947642408182e-05,
"loss": 0.21412492752075196,
"mean_token_accuracy": 0.9283889561891556,
"num_tokens": 3331158681.0,
"step": 42750
},
{
"entropy": 0.20949604049324988,
"epoch": 1.7043644472762027,
"grad_norm": 0.9396565556526184,
"learning_rate": 1.1245749971496645e-05,
"loss": 0.21225997924804688,
"mean_token_accuracy": 0.9299770307540893,
"num_tokens": 3335081969.0,
"step": 42800
},
{
"entropy": 0.21171203643083572,
"epoch": 1.706355527237974,
"grad_norm": 1.2607985734939575,
"learning_rate": 1.1097658416925616e-05,
"loss": 0.20964282989501953,
"mean_token_accuracy": 0.929639783501625,
"num_tokens": 3338842508.0,
"step": 42850
},
{
"entropy": 0.21066647991538048,
"epoch": 1.7083466071997453,
"grad_norm": 1.8953777551651,
"learning_rate": 1.095049111670764e-05,
"loss": 0.2089408493041992,
"mean_token_accuracy": 0.9304516243934632,
"num_tokens": 3342667327.0,
"step": 42900
},
{
"entropy": 0.20289117962121964,
"epoch": 1.7103376871615164,
"grad_norm": 1.4316964149475098,
"learning_rate": 1.0804249600836302e-05,
"loss": 0.20412372589111327,
"mean_token_accuracy": 0.9313151943683624,
"num_tokens": 3346511164.0,
"step": 42950
},
{
"entropy": 0.21303703948855401,
"epoch": 1.7123287671232876,
"grad_norm": 3.427518844604492,
"learning_rate": 1.0658935389680558e-05,
"loss": 0.20701854705810546,
"mean_token_accuracy": 0.9287211322784423,
"num_tokens": 3350321196.0,
"step": 43000
},
{
"entropy": 0.21614415727555752,
"epoch": 1.714319847085059,
"grad_norm": 1.8059314489364624,
"learning_rate": 1.0514549993968793e-05,
"loss": 0.2118132972717285,
"mean_token_accuracy": 0.9284475427865982,
"num_tokens": 3354110443.0,
"step": 43050
},
{
"entropy": 0.21574504926800728,
"epoch": 1.7163109270468302,
"grad_norm": 1.618677020072937,
"learning_rate": 1.0371094914773194e-05,
"loss": 0.21516273498535157,
"mean_token_accuracy": 0.928774631023407,
"num_tokens": 3358010083.0,
"step": 43100
},
{
"entropy": 0.20823818922042847,
"epoch": 1.7183020070086015,
"grad_norm": 1.8982270956039429,
"learning_rate": 1.0228571643494089e-05,
"loss": 0.20659427642822265,
"mean_token_accuracy": 0.9304153192043304,
"num_tokens": 3361793567.0,
"step": 43150
},
{
"entropy": 0.20770151138305665,
"epoch": 1.7202930869703728,
"grad_norm": 23.347454071044922,
"learning_rate": 1.0086981661844408e-05,
"loss": 0.20477155685424805,
"mean_token_accuracy": 0.9307419693470002,
"num_tokens": 3365725960.0,
"step": 43200
},
{
"entropy": 0.21326481088995933,
"epoch": 1.722284166932144,
"grad_norm": 17.471525192260742,
"learning_rate": 9.946326441834453e-06,
"loss": 0.20951253890991212,
"mean_token_accuracy": 0.9291504013538361,
"num_tokens": 3369568841.0,
"step": 43250
},
{
"entropy": 0.21126571625471116,
"epoch": 1.7242752468939153,
"grad_norm": 1.2022254467010498,
"learning_rate": 9.806607445756399e-06,
"loss": 0.21334413528442384,
"mean_token_accuracy": 0.9292098581790924,
"num_tokens": 3373491379.0,
"step": 43300
},
{
"entropy": 0.2141697633266449,
"epoch": 1.7262663268556864,
"grad_norm": 2.5144846439361572,
"learning_rate": 9.667826126169154e-06,
"loss": 0.2119060516357422,
"mean_token_accuracy": 0.9293478113412857,
"num_tokens": 3377378314.0,
"step": 43350
},
{
"entropy": 0.20566872745752335,
"epoch": 1.7282574068174577,
"grad_norm": 11.5548677444458,
"learning_rate": 9.52998392588329e-06,
"loss": 0.20603267669677736,
"mean_token_accuracy": 0.9311341369152069,
"num_tokens": 3381359306.0,
"step": 43400
},
{
"entropy": 0.20955051869153976,
"epoch": 1.730248486779229,
"grad_norm": 0.9183319211006165,
"learning_rate": 9.393082277946075e-06,
"loss": 0.2130196762084961,
"mean_token_accuracy": 0.9288085114955902,
"num_tokens": 3385082710.0,
"step": 43450
},
{
"entropy": 0.2085769698023796,
"epoch": 1.7322395667410002,
"grad_norm": 73.6777572631836,
"learning_rate": 9.257122605626433e-06,
"loss": 0.2063262367248535,
"mean_token_accuracy": 0.930268183350563,
"num_tokens": 3389013368.0,
"step": 43500
},
{
"epoch": 1.7322395667410002,
"eval_entropy": 0.20851521726165498,
"eval_loss": 0.21822857856750488,
"eval_mean_token_accuracy": 0.9255683289633857,
"eval_num_tokens": 3389013368.0,
"eval_runtime": 98.7957,
"eval_samples_per_second": 10.122,
"eval_steps_per_second": 0.638,
"step": 43500
},
{
"entropy": 0.2073688104748726,
"epoch": 1.7342306467027715,
"grad_norm": 0.8740753531455994,
"learning_rate": 9.122106322400315e-06,
"loss": 0.20818450927734375,
"mean_token_accuracy": 0.9306763833761216,
"num_tokens": 3392916416.0,
"step": 43550
},
{
"entropy": 0.20800496503710747,
"epoch": 1.7362217266645428,
"grad_norm": 3.2264981269836426,
"learning_rate": 8.988034831935843e-06,
"loss": 0.20605121612548827,
"mean_token_accuracy": 0.9305061846971512,
"num_tokens": 3396765916.0,
"step": 43600
},
{
"entropy": 0.21000043153762818,
"epoch": 1.738212806626314,
"grad_norm": 1.0980819463729858,
"learning_rate": 8.854909528078903e-06,
"loss": 0.2113180923461914,
"mean_token_accuracy": 0.9291634374856949,
"num_tokens": 3400647162.0,
"step": 43650
},
{
"entropy": 0.20911528274416924,
"epoch": 1.7402038865880853,
"grad_norm": 6.803044319152832,
"learning_rate": 8.722731794838513e-06,
"loss": 0.2107940673828125,
"mean_token_accuracy": 0.9301030486822128,
"num_tokens": 3404614062.0,
"step": 43700
},
{
"entropy": 0.20988879695534707,
"epoch": 1.7421949665498566,
"grad_norm": 1.7961214780807495,
"learning_rate": 8.591503006372426e-06,
"loss": 0.20849388122558593,
"mean_token_accuracy": 0.9299481153488159,
"num_tokens": 3408435982.0,
"step": 43750
},
{
"entropy": 0.2071615570783615,
"epoch": 1.744186046511628,
"grad_norm": 3.4115519523620605,
"learning_rate": 8.46122452697291e-06,
"loss": 0.20572685241699218,
"mean_token_accuracy": 0.9306599938869476,
"num_tokens": 3412386645.0,
"step": 43800
},
{
"entropy": 0.20959770992398263,
"epoch": 1.7461771264733992,
"grad_norm": 0.7829149961471558,
"learning_rate": 8.33189771105265e-06,
"loss": 0.20827945709228515,
"mean_token_accuracy": 0.9304309511184692,
"num_tokens": 3416238232.0,
"step": 43850
},
{
"entropy": 0.2114715176820755,
"epoch": 1.7481682064351705,
"grad_norm": 1.1714812517166138,
"learning_rate": 8.203523903130406e-06,
"loss": 0.21069385528564452,
"mean_token_accuracy": 0.9288992536067963,
"num_tokens": 3420152151.0,
"step": 43900
},
{
"entropy": 0.20665415987372399,
"epoch": 1.7501592863969417,
"grad_norm": 5.990740776062012,
"learning_rate": 8.07610443781729e-06,
"loss": 0.2081171989440918,
"mean_token_accuracy": 0.930669231414795,
"num_tokens": 3424216197.0,
"step": 43950
},
{
"entropy": 0.209456440359354,
"epoch": 1.752150366358713,
"grad_norm": 20.553333282470703,
"learning_rate": 7.949640639802757e-06,
"loss": 0.20741764068603516,
"mean_token_accuracy": 0.9296394234895706,
"num_tokens": 3428132649.0,
"step": 44000
},
{
"entropy": 0.2040299132466316,
"epoch": 1.7541414463204843,
"grad_norm": 6.445930480957031,
"learning_rate": 7.824133823840906e-06,
"loss": 0.20229070663452148,
"mean_token_accuracy": 0.9324067449569702,
"num_tokens": 3431970957.0,
"step": 44050
},
{
"entropy": 0.21209723398089408,
"epoch": 1.7561325262822556,
"grad_norm": 1.6934711933135986,
"learning_rate": 7.699585294736744e-06,
"loss": 0.21100982666015625,
"mean_token_accuracy": 0.9297117662429809,
"num_tokens": 3435914647.0,
"step": 44100
},
{
"entropy": 0.21320962592959403,
"epoch": 1.7581236062440269,
"grad_norm": 1.044862985610962,
"learning_rate": 7.575996347332626e-06,
"loss": 0.21576282501220703,
"mean_token_accuracy": 0.9285241341590882,
"num_tokens": 3439805283.0,
"step": 44150
},
{
"entropy": 0.2151702319085598,
"epoch": 1.7601146862057981,
"grad_norm": 15.684170722961426,
"learning_rate": 7.453368266494876e-06,
"loss": 0.2126181411743164,
"mean_token_accuracy": 0.9285902082920074,
"num_tokens": 3443870181.0,
"step": 44200
},
{
"entropy": 0.2085086138546467,
"epoch": 1.7621057661675694,
"grad_norm": 0.8928887844085693,
"learning_rate": 7.331702327100376e-06,
"loss": 0.20794538497924805,
"mean_token_accuracy": 0.9304049378633499,
"num_tokens": 3447760675.0,
"step": 44250
},
{
"entropy": 0.21238367155194282,
"epoch": 1.7640968461293407,
"grad_norm": 0.8010930418968201,
"learning_rate": 7.210999794023232e-06,
"loss": 0.2140846633911133,
"mean_token_accuracy": 0.9294155049324035,
"num_tokens": 3451731264.0,
"step": 44300
},
{
"entropy": 0.20554652333259582,
"epoch": 1.766087926091112,
"grad_norm": 53.679508209228516,
"learning_rate": 7.091261922121761e-06,
"loss": 0.20279741287231445,
"mean_token_accuracy": 0.9304215121269226,
"num_tokens": 3455753973.0,
"step": 44350
},
{
"entropy": 0.2106124371290207,
"epoch": 1.768079006052883,
"grad_norm": 6.591165542602539,
"learning_rate": 6.972489956225381e-06,
"loss": 0.2088141632080078,
"mean_token_accuracy": 0.9303308349847793,
"num_tokens": 3459535337.0,
"step": 44400
},
{
"entropy": 0.20883979350328447,
"epoch": 1.7700700860146543,
"grad_norm": 18.591882705688477,
"learning_rate": 6.854685131121663e-06,
"loss": 0.20666999816894532,
"mean_token_accuracy": 0.9313195276260376,
"num_tokens": 3463470882.0,
"step": 44450
},
{
"entropy": 0.20805159598588943,
"epoch": 1.7720611659764256,
"grad_norm": 8.411771774291992,
"learning_rate": 6.7378486715435226e-06,
"loss": 0.20834875106811523,
"mean_token_accuracy": 0.9310674071311951,
"num_tokens": 3467382434.0,
"step": 44500
},
{
"entropy": 0.20722934901714324,
"epoch": 1.7740522459381969,
"grad_norm": 2.585312604904175,
"learning_rate": 6.621981792156385e-06,
"loss": 0.20870906829833985,
"mean_token_accuracy": 0.9306829625368118,
"num_tokens": 3471390056.0,
"step": 44550
},
{
"entropy": 0.20751627907156944,
"epoch": 1.7760433258999682,
"grad_norm": 3.3848342895507812,
"learning_rate": 6.507085697545778e-06,
"loss": 0.20677597045898438,
"mean_token_accuracy": 0.9305989545583725,
"num_tokens": 3475472414.0,
"step": 44600
},
{
"entropy": 0.21149674832820892,
"epoch": 1.7780344058617394,
"grad_norm": 2.8175301551818848,
"learning_rate": 6.393161582204588e-06,
"loss": 0.21632415771484376,
"mean_token_accuracy": 0.9287760710716247,
"num_tokens": 3479447899.0,
"step": 44650
},
{
"entropy": 0.20839301392436027,
"epoch": 1.7800254858235107,
"grad_norm": 0.7601056098937988,
"learning_rate": 6.2802106305207e-06,
"loss": 0.2067262077331543,
"mean_token_accuracy": 0.9304411447048188,
"num_tokens": 3483376906.0,
"step": 44700
},
{
"entropy": 0.21109894961118697,
"epoch": 1.7820165657852818,
"grad_norm": 0.9799630641937256,
"learning_rate": 6.1682340167647516e-06,
"loss": 0.21058021545410155,
"mean_token_accuracy": 0.9301919043064117,
"num_tokens": 3487224795.0,
"step": 44750
},
{
"entropy": 0.20875480249524117,
"epoch": 1.784007645747053,
"grad_norm": 96.13130187988281,
"learning_rate": 6.057232905077914e-06,
"loss": 0.20701271057128906,
"mean_token_accuracy": 0.9302035439014434,
"num_tokens": 3490949200.0,
"step": 44800
},
{
"entropy": 0.20825668588280677,
"epoch": 1.7859987257088243,
"grad_norm": 2.4636387825012207,
"learning_rate": 5.947208449459685e-06,
"loss": 0.20573083877563478,
"mean_token_accuracy": 0.9306117433309555,
"num_tokens": 3495007448.0,
"step": 44850
},
{
"entropy": 0.21141499862074853,
"epoch": 1.7879898056705956,
"grad_norm": 0.6885759234428406,
"learning_rate": 5.838161793756014e-06,
"loss": 0.2095553207397461,
"mean_token_accuracy": 0.9298090773820877,
"num_tokens": 3498907935.0,
"step": 44900
},
{
"entropy": 0.2129495669901371,
"epoch": 1.789980885632367,
"grad_norm": 0.7798480987548828,
"learning_rate": 5.7300940716473405e-06,
"loss": 0.21014495849609374,
"mean_token_accuracy": 0.9300975173711776,
"num_tokens": 3502670704.0,
"step": 44950
},
{
"entropy": 0.21165331333875656,
"epoch": 1.7919719655941382,
"grad_norm": 1.102869987487793,
"learning_rate": 5.623006406636843e-06,
"loss": 0.2064545440673828,
"mean_token_accuracy": 0.9297413504123688,
"num_tokens": 3506472079.0,
"step": 45000
},
{
"epoch": 1.7919719655941382,
"eval_entropy": 0.20767719807132842,
"eval_loss": 0.21640749275684357,
"eval_mean_token_accuracy": 0.9258228899940611,
"eval_num_tokens": 3506472079.0,
"eval_runtime": 98.1901,
"eval_samples_per_second": 10.184,
"eval_steps_per_second": 0.642,
"step": 45000
},
{
"entropy": 0.20470431208610534,
"epoch": 1.7939630455559095,
"grad_norm": 59.79706954956055,
"learning_rate": 5.516899912038742e-06,
"loss": 0.20203092575073242,
"mean_token_accuracy": 0.9314306324720383,
"num_tokens": 3510430565.0,
"step": 45050
},
{
"entropy": 0.21255202189087868,
"epoch": 1.7959541255176807,
"grad_norm": 2.5185296535491943,
"learning_rate": 5.41177569096667e-06,
"loss": 0.21200386047363282,
"mean_token_accuracy": 0.9287832349538803,
"num_tokens": 3514394913.0,
"step": 45100
},
{
"entropy": 0.2104589892923832,
"epoch": 1.797945205479452,
"grad_norm": 0.7058978080749512,
"learning_rate": 5.307634836322384e-06,
"loss": 0.2101261329650879,
"mean_token_accuracy": 0.9302563655376435,
"num_tokens": 3518315848.0,
"step": 45150
},
{
"entropy": 0.20902628675103188,
"epoch": 1.7999362854412233,
"grad_norm": 3.984861135482788,
"learning_rate": 5.204478430784176e-06,
"loss": 0.20765369415283202,
"mean_token_accuracy": 0.9305371862649917,
"num_tokens": 3522202111.0,
"step": 45200
},
{
"entropy": 0.2147587051987648,
"epoch": 1.8019273654029946,
"grad_norm": 0.5527628660202026,
"learning_rate": 5.102307546795737e-06,
"loss": 0.21070705413818358,
"mean_token_accuracy": 0.9285232800245286,
"num_tokens": 3526104312.0,
"step": 45250
},
{
"entropy": 0.21127821996808052,
"epoch": 1.8039184453647659,
"grad_norm": 0.8246101140975952,
"learning_rate": 5.00112324655504e-06,
"loss": 0.20989871978759767,
"mean_token_accuracy": 0.929241014122963,
"num_tokens": 3529962044.0,
"step": 45300
},
{
"entropy": 0.20899385526776315,
"epoch": 1.8059095253265371,
"grad_norm": 0.49908512830734253,
"learning_rate": 4.900926582003196e-06,
"loss": 0.2079372787475586,
"mean_token_accuracy": 0.9290895968675613,
"num_tokens": 3533872881.0,
"step": 45350
},
{
"entropy": 0.2041157440841198,
"epoch": 1.8079006052883084,
"grad_norm": 58.90666198730469,
"learning_rate": 4.801718594813598e-06,
"loss": 0.20337408065795898,
"mean_token_accuracy": 0.9310873591899872,
"num_tokens": 3537766572.0,
"step": 45400
},
{
"entropy": 0.2129148316383362,
"epoch": 1.8098916852500797,
"grad_norm": 3.738131046295166,
"learning_rate": 4.703500316381082e-06,
"loss": 0.2082274627685547,
"mean_token_accuracy": 0.9294615036249161,
"num_tokens": 3541632871.0,
"step": 45450
},
{
"entropy": 0.20847861975431442,
"epoch": 1.811882765211851,
"grad_norm": 1.109789490699768,
"learning_rate": 4.606272767811115e-06,
"loss": 0.20543277740478516,
"mean_token_accuracy": 0.9305390655994416,
"num_tokens": 3545534405.0,
"step": 45500
},
{
"entropy": 0.2059105433523655,
"epoch": 1.8138738451736223,
"grad_norm": 0.9735215902328491,
"learning_rate": 4.510036959909347e-06,
"loss": 0.20821889877319336,
"mean_token_accuracy": 0.9318612819910049,
"num_tokens": 3549408355.0,
"step": 45550
},
{
"entropy": 0.20953644335269928,
"epoch": 1.8158649251353935,
"grad_norm": 13.94512939453125,
"learning_rate": 4.414793893170943e-06,
"loss": 0.21036842346191406,
"mean_token_accuracy": 0.9298856401443482,
"num_tokens": 3553166674.0,
"step": 45600
},
{
"entropy": 0.2068518304824829,
"epoch": 1.8178560050971648,
"grad_norm": 4.7155632972717285,
"learning_rate": 4.320544557770267e-06,
"loss": 0.2043770408630371,
"mean_token_accuracy": 0.9310851716995239,
"num_tokens": 3557126079.0,
"step": 45650
},
{
"entropy": 0.21182461187243462,
"epoch": 1.819847085058936,
"grad_norm": 2.7940444946289062,
"learning_rate": 4.2272899335505265e-06,
"loss": 0.210545654296875,
"mean_token_accuracy": 0.9293639028072357,
"num_tokens": 3561059632.0,
"step": 45700
},
{
"entropy": 0.20587970972061156,
"epoch": 1.8218381650207074,
"grad_norm": 0.5957472324371338,
"learning_rate": 4.135030990013711e-06,
"loss": 0.20679553985595703,
"mean_token_accuracy": 0.9308193498849868,
"num_tokens": 3564821358.0,
"step": 45750
},
{
"entropy": 0.20069470301270484,
"epoch": 1.8238292449824784,
"grad_norm": 1.8275463581085205,
"learning_rate": 4.0437686863103455e-06,
"loss": 0.198288516998291,
"mean_token_accuracy": 0.9327347731590271,
"num_tokens": 3568773612.0,
"step": 45800
},
{
"entropy": 0.207653941065073,
"epoch": 1.8258203249442497,
"grad_norm": 16.50977897644043,
"learning_rate": 3.953503971229622e-06,
"loss": 0.2065102005004883,
"mean_token_accuracy": 0.9299451869726181,
"num_tokens": 3572667298.0,
"step": 45850
},
{
"entropy": 0.20317922204732894,
"epoch": 1.827811404906021,
"grad_norm": 0.9150100350379944,
"learning_rate": 3.8642377831895394e-06,
"loss": 0.20408899307250977,
"mean_token_accuracy": 0.9323972845077515,
"num_tokens": 3576632810.0,
"step": 45900
},
{
"entropy": 0.20271479919552804,
"epoch": 1.8298024848677923,
"grad_norm": 0.8775530457496643,
"learning_rate": 3.7759710502271007e-06,
"loss": 0.20193222045898437,
"mean_token_accuracy": 0.932313597202301,
"num_tokens": 3580570503.0,
"step": 45950
},
{
"entropy": 0.20898037731647492,
"epoch": 1.8317935648295636,
"grad_norm": 1.5123686790466309,
"learning_rate": 3.688704689988687e-06,
"loss": 0.20746551513671874,
"mean_token_accuracy": 0.9301503264904022,
"num_tokens": 3584290381.0,
"step": 46000
},
{
"entropy": 0.20438008531928062,
"epoch": 1.8337846447913349,
"grad_norm": 1.9140816926956177,
"learning_rate": 3.602439609720487e-06,
"loss": 0.20290145874023438,
"mean_token_accuracy": 0.9307840871810913,
"num_tokens": 3588239293.0,
"step": 46050
},
{
"entropy": 0.20243030577898025,
"epoch": 1.8357757247531061,
"grad_norm": 1.6704521179199219,
"learning_rate": 3.517176706259173e-06,
"loss": 0.20418481826782225,
"mean_token_accuracy": 0.9315272670984268,
"num_tokens": 3592083917.0,
"step": 46100
},
{
"entropy": 0.21051367938518525,
"epoch": 1.8377668047148772,
"grad_norm": 10.357985496520996,
"learning_rate": 3.4329168660224288e-06,
"loss": 0.21083585739135743,
"mean_token_accuracy": 0.9296258103847503,
"num_tokens": 3595926812.0,
"step": 46150
},
{
"entropy": 0.2138805329799652,
"epoch": 1.8397578846766485,
"grad_norm": 49.06830596923828,
"learning_rate": 3.3496609649998345e-06,
"loss": 0.21048126220703126,
"mean_token_accuracy": 0.9295951730012894,
"num_tokens": 3599861416.0,
"step": 46200
},
{
"entropy": 0.21018945664167404,
"epoch": 1.8417489646384197,
"grad_norm": 1.570406436920166,
"learning_rate": 3.2674098687436984e-06,
"loss": 0.2073902130126953,
"mean_token_accuracy": 0.9296689444780349,
"num_tokens": 3603701996.0,
"step": 46250
},
{
"entropy": 0.21012910723686218,
"epoch": 1.843740044600191,
"grad_norm": 2.4205453395843506,
"learning_rate": 3.186164432360128e-06,
"loss": 0.2063848876953125,
"mean_token_accuracy": 0.9299239891767502,
"num_tokens": 3607681405.0,
"step": 46300
},
{
"entropy": 0.20703335404396056,
"epoch": 1.8457311245619623,
"grad_norm": 1.4932438135147095,
"learning_rate": 3.1059255005000954e-06,
"loss": 0.20379390716552734,
"mean_token_accuracy": 0.9307261490821839,
"num_tokens": 3611673251.0,
"step": 46350
},
{
"entropy": 0.21025602117180825,
"epoch": 1.8477222045237336,
"grad_norm": 13.070518493652344,
"learning_rate": 3.0266939073506418e-06,
"loss": 0.21065128326416016,
"mean_token_accuracy": 0.9293994671106338,
"num_tokens": 3615446363.0,
"step": 46400
},
{
"entropy": 0.21034426152706145,
"epoch": 1.8497132844855049,
"grad_norm": 1.4634066820144653,
"learning_rate": 2.9484704766261973e-06,
"loss": 0.2110739517211914,
"mean_token_accuracy": 0.930075461268425,
"num_tokens": 3619263825.0,
"step": 46450
},
{
"entropy": 0.21479475244879723,
"epoch": 1.8517043644472762,
"grad_norm": 1.4576468467712402,
"learning_rate": 2.8712560215601314e-06,
"loss": 0.21280271530151368,
"mean_token_accuracy": 0.928877608180046,
"num_tokens": 3623131519.0,
"step": 46500
},
{
"epoch": 1.8517043644472762,
"eval_entropy": 0.20671257494934023,
"eval_loss": 0.21556128561496735,
"eval_mean_token_accuracy": 0.9257090545835949,
"eval_num_tokens": 3623131519.0,
"eval_runtime": 98.1917,
"eval_samples_per_second": 10.184,
"eval_steps_per_second": 0.642,
"step": 46500
},
{
"entropy": 0.2045709379017353,
"epoch": 1.8536954444090474,
"grad_norm": 0.93439120054245,
"learning_rate": 2.7950513448961603e-06,
"loss": 0.2093747329711914,
"mean_token_accuracy": 0.9314322662353516,
"num_tokens": 3626926506.0,
"step": 46550
},
{
"entropy": 0.20439017698168754,
"epoch": 1.8556865243708187,
"grad_norm": 1.1999908685684204,
"learning_rate": 2.7198572388800305e-06,
"loss": 0.20209259033203125,
"mean_token_accuracy": 0.9320348417758941,
"num_tokens": 3630707819.0,
"step": 46600
},
{
"entropy": 0.21055062592029572,
"epoch": 1.85767760433259,
"grad_norm": 2.1831114292144775,
"learning_rate": 2.645674485251326e-06,
"loss": 0.20812604904174806,
"mean_token_accuracy": 0.9298756116628647,
"num_tokens": 3634652608.0,
"step": 46650
},
{
"entropy": 0.20818702280521392,
"epoch": 1.8596686842943613,
"grad_norm": 4.211587429046631,
"learning_rate": 2.572503855235342e-06,
"loss": 0.21088375091552736,
"mean_token_accuracy": 0.9295736873149871,
"num_tokens": 3638476600.0,
"step": 46700
},
{
"entropy": 0.20586246758699417,
"epoch": 1.8616597642561326,
"grad_norm": 2.066452980041504,
"learning_rate": 2.500346109535012e-06,
"loss": 0.2036473846435547,
"mean_token_accuracy": 0.9310190284252167,
"num_tokens": 3642389549.0,
"step": 46750
},
{
"entropy": 0.21279745489358903,
"epoch": 1.8636508442179038,
"grad_norm": 3.4920811653137207,
"learning_rate": 2.4292019983230607e-06,
"loss": 0.2081696319580078,
"mean_token_accuracy": 0.9292943155765534,
"num_tokens": 3646393721.0,
"step": 46800
},
{
"entropy": 0.21361444383859635,
"epoch": 1.8656419241796751,
"grad_norm": 18.080303192138672,
"learning_rate": 2.359072261234152e-06,
"loss": 0.21170433044433593,
"mean_token_accuracy": 0.9282393491268158,
"num_tokens": 3650136601.0,
"step": 46850
},
{
"entropy": 0.20671701848506926,
"epoch": 1.8676330041414464,
"grad_norm": 2.1680543422698975,
"learning_rate": 2.289957627357231e-06,
"loss": 0.20514652252197266,
"mean_token_accuracy": 0.9300593328475952,
"num_tokens": 3654008883.0,
"step": 46900
},
{
"entropy": 0.20612944304943084,
"epoch": 1.8696240841032177,
"grad_norm": 3.544213056564331,
"learning_rate": 2.221858815227973e-06,
"loss": 0.20879905700683593,
"mean_token_accuracy": 0.9298162144422532,
"num_tokens": 3657878785.0,
"step": 46950
},
{
"entropy": 0.20561033993959427,
"epoch": 1.871615164064989,
"grad_norm": 17.90035629272461,
"learning_rate": 2.15477653282119e-06,
"loss": 0.20452678680419922,
"mean_token_accuracy": 0.9309412103891372,
"num_tokens": 3661838269.0,
"step": 47000
},
{
"entropy": 0.20409692838788032,
"epoch": 1.8736062440267602,
"grad_norm": 63.73369598388672,
"learning_rate": 2.088711477543659e-06,
"loss": 0.2018229103088379,
"mean_token_accuracy": 0.9308506631851197,
"num_tokens": 3665698438.0,
"step": 47050
},
{
"entropy": 0.2098672604560852,
"epoch": 1.8755973239885315,
"grad_norm": 1.7252836227416992,
"learning_rate": 2.023664336226716e-06,
"loss": 0.20646530151367187,
"mean_token_accuracy": 0.9303743714094161,
"num_tokens": 3669603184.0,
"step": 47100
},
{
"entropy": 0.21036667585372926,
"epoch": 1.8775884039503028,
"grad_norm": 0.7469420433044434,
"learning_rate": 1.9596357851191737e-06,
"loss": 0.2089185333251953,
"mean_token_accuracy": 0.9294323736429214,
"num_tokens": 3673458486.0,
"step": 47150
},
{
"entropy": 0.2143134069442749,
"epoch": 1.8795794839120739,
"grad_norm": 4.1622467041015625,
"learning_rate": 1.8966264898802932e-06,
"loss": 0.2129537582397461,
"mean_token_accuracy": 0.9273243010044098,
"num_tokens": 3677379228.0,
"step": 47200
},
{
"entropy": 0.20456415072083473,
"epoch": 1.8815705638738451,
"grad_norm": 0.871599018573761,
"learning_rate": 1.8346371055728672e-06,
"loss": 0.2008742332458496,
"mean_token_accuracy": 0.9321694928407669,
"num_tokens": 3681325572.0,
"step": 47250
},
{
"entropy": 0.20833082988858223,
"epoch": 1.8835616438356164,
"grad_norm": 1.9216362237930298,
"learning_rate": 1.7736682766563817e-06,
"loss": 0.2087716865539551,
"mean_token_accuracy": 0.9310186111927032,
"num_tokens": 3685280505.0,
"step": 47300
},
{
"entropy": 0.20786230847239495,
"epoch": 1.8855527237973877,
"grad_norm": 0.5801077485084534,
"learning_rate": 1.713720636980365e-06,
"loss": 0.20443031311035156,
"mean_token_accuracy": 0.9308688986301422,
"num_tokens": 3689082889.0,
"step": 47350
},
{
"entropy": 0.21038655385375024,
"epoch": 1.887543803759159,
"grad_norm": 25.913808822631836,
"learning_rate": 1.6547948097777155e-06,
"loss": 0.20781410217285157,
"mean_token_accuracy": 0.929584339261055,
"num_tokens": 3693020179.0,
"step": 47400
},
{
"entropy": 0.20780225247144699,
"epoch": 1.8895348837209303,
"grad_norm": 1.085632085800171,
"learning_rate": 1.5968914076583296e-06,
"loss": 0.20219169616699217,
"mean_token_accuracy": 0.9305776798725128,
"num_tokens": 3696782672.0,
"step": 47450
},
{
"entropy": 0.2080184116959572,
"epoch": 1.8915259636827015,
"grad_norm": 2.220388650894165,
"learning_rate": 1.5400110326026617e-06,
"loss": 0.20734561920166017,
"mean_token_accuracy": 0.9301981914043427,
"num_tokens": 3700838688.0,
"step": 47500
},
{
"entropy": 0.21338329300284387,
"epoch": 1.8935170436444726,
"grad_norm": 4.149438381195068,
"learning_rate": 1.4841542759554626e-06,
"loss": 0.21353832244873047,
"mean_token_accuracy": 0.9283533388376236,
"num_tokens": 3704590951.0,
"step": 47550
},
{
"entropy": 0.21080107524991035,
"epoch": 1.8955081236062439,
"grad_norm": 23.682764053344727,
"learning_rate": 1.429321718419674e-06,
"loss": 0.2076173782348633,
"mean_token_accuracy": 0.9303930050134659,
"num_tokens": 3708629326.0,
"step": 47600
},
{
"entropy": 0.20033822111785413,
"epoch": 1.8974992035680152,
"grad_norm": 2.2728614807128906,
"learning_rate": 1.3755139300503427e-06,
"loss": 0.20009140014648438,
"mean_token_accuracy": 0.9331355339288712,
"num_tokens": 3712486088.0,
"step": 47650
},
{
"entropy": 0.20737343326210975,
"epoch": 1.8994902835297864,
"grad_norm": 5.053152561187744,
"learning_rate": 1.3227314702487504e-06,
"loss": 0.20637876510620118,
"mean_token_accuracy": 0.9308607363700867,
"num_tokens": 3716283064.0,
"step": 47700
},
{
"entropy": 0.2088836833834648,
"epoch": 1.9014813634915577,
"grad_norm": 0.7800954580307007,
"learning_rate": 1.2709748877565597e-06,
"loss": 0.20897350311279297,
"mean_token_accuracy": 0.9295745211839676,
"num_tokens": 3720089023.0,
"step": 47750
},
{
"entropy": 0.20781102195382117,
"epoch": 1.903472443453329,
"grad_norm": 6.860362529754639,
"learning_rate": 1.2202447206500988e-06,
"loss": 0.20449775695800781,
"mean_token_accuracy": 0.9301507288217544,
"num_tokens": 3723806031.0,
"step": 47800
},
{
"entropy": 0.21246332317590713,
"epoch": 1.9054635234151003,
"grad_norm": 0.762394368648529,
"learning_rate": 1.1705414963348093e-06,
"loss": 0.21171236038208008,
"mean_token_accuracy": 0.9293036895990372,
"num_tokens": 3727598397.0,
"step": 47850
},
{
"entropy": 0.20728234931826592,
"epoch": 1.9074546033768716,
"grad_norm": 0.8638309240341187,
"learning_rate": 1.1218657315397284e-06,
"loss": 0.2101401710510254,
"mean_token_accuracy": 0.9301428550481796,
"num_tokens": 3731653061.0,
"step": 47900
},
{
"entropy": 0.20614495024085044,
"epoch": 1.9094456833386428,
"grad_norm": 37.10430908203125,
"learning_rate": 1.0742179323121048e-06,
"loss": 0.20347900390625,
"mean_token_accuracy": 0.9306625306606293,
"num_tokens": 3735395635.0,
"step": 47950
},
{
"entropy": 0.20366091713309287,
"epoch": 1.9114367633004141,
"grad_norm": 1.1358367204666138,
"learning_rate": 1.0275985940122245e-06,
"loss": 0.20321054458618165,
"mean_token_accuracy": 0.9320428788661956,
"num_tokens": 3739487498.0,
"step": 48000
},
{
"epoch": 1.9114367633004141,
"eval_entropy": 0.20564406140456123,
"eval_loss": 0.21469460427761078,
"eval_mean_token_accuracy": 0.9262936096342783,
"eval_num_tokens": 3739487498.0,
"eval_runtime": 97.8916,
"eval_samples_per_second": 10.215,
"eval_steps_per_second": 0.644,
"step": 48000
},
{
"entropy": 0.2046898439526558,
"epoch": 1.9134278432621854,
"grad_norm": 2.3159406185150146,
"learning_rate": 9.820082013081267e-07,
"loss": 0.20289798736572265,
"mean_token_accuracy": 0.9317283999919891,
"num_tokens": 3743289077.0,
"step": 48050
},
{
"entropy": 0.2038572260737419,
"epoch": 1.9154189232239567,
"grad_norm": 34.183570861816406,
"learning_rate": 9.374472281706848e-07,
"loss": 0.2002842330932617,
"mean_token_accuracy": 0.9313328862190247,
"num_tokens": 3747227416.0,
"step": 48100
},
{
"entropy": 0.20457203462719917,
"epoch": 1.917410003185728,
"grad_norm": 0.7753530740737915,
"learning_rate": 8.939161378686001e-07,
"loss": 0.20426761627197265,
"mean_token_accuracy": 0.9307034468650818,
"num_tokens": 3751042675.0,
"step": 48150
},
{
"entropy": 0.21071830078959464,
"epoch": 1.9194010831474992,
"grad_norm": 3.788648843765259,
"learning_rate": 8.514153829636385e-07,
"loss": 0.21027889251708984,
"mean_token_accuracy": 0.9291975992918015,
"num_tokens": 3755042100.0,
"step": 48200
},
{
"entropy": 0.2066432397067547,
"epoch": 1.9213921631092705,
"grad_norm": 1.2828806638717651,
"learning_rate": 8.099454053058786e-07,
"loss": 0.20229366302490234,
"mean_token_accuracy": 0.9315379053354264,
"num_tokens": 3758965564.0,
"step": 48250
},
{
"entropy": 0.20838844984769822,
"epoch": 1.9233832430710418,
"grad_norm": 1.511154294013977,
"learning_rate": 7.695066360291824e-07,
"loss": 0.20771406173706056,
"mean_token_accuracy": 0.9306799596548081,
"num_tokens": 3762804386.0,
"step": 48300
},
{
"entropy": 0.20677204117178916,
"epoch": 1.925374323032813,
"grad_norm": 2331.79150390625,
"learning_rate": 7.300994955465989e-07,
"loss": 0.20275856018066407,
"mean_token_accuracy": 0.9303908598423004,
"num_tokens": 3766566420.0,
"step": 48350
},
{
"entropy": 0.20770261108875274,
"epoch": 1.9273654029945844,
"grad_norm": 1.7849552631378174,
"learning_rate": 6.917243935461448e-07,
"loss": 0.20769720077514647,
"mean_token_accuracy": 0.9299451416730881,
"num_tokens": 3770266452.0,
"step": 48400
},
{
"entropy": 0.20397947937250138,
"epoch": 1.9293564829563556,
"grad_norm": 2.3596925735473633,
"learning_rate": 6.543817289864307e-07,
"loss": 0.20101829528808593,
"mean_token_accuracy": 0.9313901931047439,
"num_tokens": 3774158287.0,
"step": 48450
},
{
"entropy": 0.2011245361715555,
"epoch": 1.931347562918127,
"grad_norm": 4.982568740844727,
"learning_rate": 6.18071890092553e-07,
"loss": 0.1985802459716797,
"mean_token_accuracy": 0.9325529444217682,
"num_tokens": 3778191840.0,
"step": 48500
},
{
"entropy": 0.20900342330336572,
"epoch": 1.9333386428798982,
"grad_norm": 32.73358917236328,
"learning_rate": 5.827952543520531e-07,
"loss": 0.20671030044555663,
"mean_token_accuracy": 0.9303619009256363,
"num_tokens": 3782038440.0,
"step": 48550
},
{
"entropy": 0.20034867897629738,
"epoch": 1.9353297228416695,
"grad_norm": 0.882574737071991,
"learning_rate": 5.485521885109978e-07,
"loss": 0.19909774780273437,
"mean_token_accuracy": 0.9321212899684906,
"num_tokens": 3786002509.0,
"step": 48600
},
{
"entropy": 0.2031031160056591,
"epoch": 1.9373208028034405,
"grad_norm": 0.915739119052887,
"learning_rate": 5.153430485701605e-07,
"loss": 0.20162731170654297,
"mean_token_accuracy": 0.9324739265441895,
"num_tokens": 3790093261.0,
"step": 48650
},
{
"entropy": 0.2046504382789135,
"epoch": 1.9393118827652118,
"grad_norm": 0.8648226857185364,
"learning_rate": 4.831681797813348e-07,
"loss": 0.2067060089111328,
"mean_token_accuracy": 0.9310611593723297,
"num_tokens": 3793937975.0,
"step": 48700
},
{
"entropy": 0.20531852021813393,
"epoch": 1.941302962726983,
"grad_norm": 7.1985297203063965,
"learning_rate": 4.520279166437269e-07,
"loss": 0.2054092025756836,
"mean_token_accuracy": 0.9317763692140579,
"num_tokens": 3797910387.0,
"step": 48750
},
{
"entropy": 0.20719680860638617,
"epoch": 1.9432940426887544,
"grad_norm": 22.304264068603516,
"learning_rate": 4.2192258290048025e-07,
"loss": 0.20710372924804688,
"mean_token_accuracy": 0.9299324482679368,
"num_tokens": 3801898227.0,
"step": 48800
},
{
"entropy": 0.20797187641263007,
"epoch": 1.9452851226505257,
"grad_norm": 18.511686325073242,
"learning_rate": 3.9285249153531155e-07,
"loss": 0.20651954650878906,
"mean_token_accuracy": 0.9307465720176696,
"num_tokens": 3805909141.0,
"step": 48850
},
{
"entropy": 0.20582071751356124,
"epoch": 1.947276202612297,
"grad_norm": 1.2667385339736938,
"learning_rate": 3.64817944769269e-07,
"loss": 0.20809062957763672,
"mean_token_accuracy": 0.9303789657354354,
"num_tokens": 3809760421.0,
"step": 48900
},
{
"entropy": 0.20571558341383933,
"epoch": 1.9492672825740682,
"grad_norm": 3.226757049560547,
"learning_rate": 3.378192340575792e-07,
"loss": 0.2017552947998047,
"mean_token_accuracy": 0.9309007340669632,
"num_tokens": 3813550255.0,
"step": 48950
},
{
"entropy": 0.20174807600677014,
"epoch": 1.9512583625358393,
"grad_norm": 25.680898666381836,
"learning_rate": 3.118566400866052e-07,
"loss": 0.202763614654541,
"mean_token_accuracy": 0.93158675968647,
"num_tokens": 3817405098.0,
"step": 49000
},
{
"entropy": 0.20707564577460288,
"epoch": 1.9532494424976106,
"grad_norm": 3.1009507179260254,
"learning_rate": 2.86930432770971e-07,
"loss": 0.2066007995605469,
"mean_token_accuracy": 0.9312508022785186,
"num_tokens": 3821383869.0,
"step": 49050
},
{
"entropy": 0.2084057731926441,
"epoch": 1.9552405224593818,
"grad_norm": 0.6516017913818359,
"learning_rate": 2.63040871250686e-07,
"loss": 0.2070516586303711,
"mean_token_accuracy": 0.9299625343084336,
"num_tokens": 3825143915.0,
"step": 49100
},
{
"entropy": 0.21188082933425903,
"epoch": 1.9572316024211531,
"grad_norm": 1.871128797531128,
"learning_rate": 2.4018820388853616e-07,
"loss": 0.2084772491455078,
"mean_token_accuracy": 0.9292748957872391,
"num_tokens": 3829132016.0,
"step": 49150
},
{
"entropy": 0.21081951320171355,
"epoch": 1.9592226823829244,
"grad_norm": 1.8061888217926025,
"learning_rate": 2.183726682674192e-07,
"loss": 0.21075002670288087,
"mean_token_accuracy": 0.9300468742847443,
"num_tokens": 3833181633.0,
"step": 49200
},
{
"entropy": 0.20759766191244125,
"epoch": 1.9612137623446957,
"grad_norm": 1.1670663356781006,
"learning_rate": 1.9759449118793572e-07,
"loss": 0.207088623046875,
"mean_token_accuracy": 0.930818041563034,
"num_tokens": 3837176299.0,
"step": 49250
},
{
"entropy": 0.20684496089816093,
"epoch": 1.963204842306467,
"grad_norm": 0.7471051216125488,
"learning_rate": 1.7785388866599084e-07,
"loss": 0.20402929306030274,
"mean_token_accuracy": 0.9307003366947174,
"num_tokens": 3841191395.0,
"step": 49300
},
{
"entropy": 0.21133894830942154,
"epoch": 1.9651959222682382,
"grad_norm": 13.016488075256348,
"learning_rate": 1.5915106593058504e-07,
"loss": 0.2060970115661621,
"mean_token_accuracy": 0.9299823653697967,
"num_tokens": 3844941023.0,
"step": 49350
},
{
"entropy": 0.21003282114863395,
"epoch": 1.9671870022300095,
"grad_norm": 0.6203821301460266,
"learning_rate": 1.4148621742163804e-07,
"loss": 0.20873613357543946,
"mean_token_accuracy": 0.9288827109336854,
"num_tokens": 3848840082.0,
"step": 49400
},
{
"entropy": 0.20687765166163444,
"epoch": 1.9691780821917808,
"grad_norm": 5.534557819366455,
"learning_rate": 1.248595267880237e-07,
"loss": 0.20545137405395508,
"mean_token_accuracy": 0.9310005211830139,
"num_tokens": 3852805539.0,
"step": 49450
},
{
"entropy": 0.20607408091425897,
"epoch": 1.971169162153552,
"grad_norm": 26.854223251342773,
"learning_rate": 1.0927116688559392e-07,
"loss": 0.20466529846191406,
"mean_token_accuracy": 0.9308301746845246,
"num_tokens": 3856699416.0,
"step": 49500
},
{
"epoch": 1.971169162153552,
"eval_entropy": 0.20582637699350478,
"eval_loss": 0.2147466093301773,
"eval_mean_token_accuracy": 0.9266640799386161,
"eval_num_tokens": 3856699416.0,
"eval_runtime": 98.3223,
"eval_samples_per_second": 10.171,
"eval_steps_per_second": 0.641,
"step": 49500
},
{
"entropy": 0.20653628379106523,
"epoch": 1.9731602421153234,
"grad_norm": 1.1142542362213135,
"learning_rate": 9.472129977542432e-08,
"loss": 0.2072589111328125,
"mean_token_accuracy": 0.9303338515758515,
"num_tokens": 3860596992.0,
"step": 49550
},
{
"entropy": 0.20690153531730174,
"epoch": 1.9751513220770947,
"grad_norm": 7.65147066116333,
"learning_rate": 8.121007672213799e-08,
"loss": 0.2086052703857422,
"mean_token_accuracy": 0.9305313348770141,
"num_tokens": 3864521466.0,
"step": 49600
},
{
"entropy": 0.20702269583940505,
"epoch": 1.977142402038866,
"grad_norm": 32.16565704345703,
"learning_rate": 6.873763819229551e-08,
"loss": 0.2078022003173828,
"mean_token_accuracy": 0.93008549451828,
"num_tokens": 3868526158.0,
"step": 49650
},
{
"entropy": 0.21008945062756537,
"epoch": 1.9791334820006372,
"grad_norm": 9.32603931427002,
"learning_rate": 5.730411385296286e-08,
"loss": 0.21051559448242188,
"mean_token_accuracy": 0.9299064064025879,
"num_tokens": 3872432069.0,
"step": 49700
},
{
"entropy": 0.20985413163900377,
"epoch": 1.9811245619624085,
"grad_norm": 5.055283069610596,
"learning_rate": 4.690962257034581e-08,
"loss": 0.2076975631713867,
"mean_token_accuracy": 0.929867318868637,
"num_tokens": 3876470872.0,
"step": 49750
},
{
"entropy": 0.20643711417913438,
"epoch": 1.9831156419241798,
"grad_norm": 26.450632095336914,
"learning_rate": 3.755427240857978e-08,
"loss": 0.2061263656616211,
"mean_token_accuracy": 0.9302699691057206,
"num_tokens": 3880458553.0,
"step": 49800
},
{
"entropy": 0.2079177989065647,
"epoch": 1.985106721885951,
"grad_norm": 1.292538046836853,
"learning_rate": 2.9238160628575207e-08,
"loss": 0.2060544204711914,
"mean_token_accuracy": 0.9301692873239518,
"num_tokens": 3884124520.0,
"step": 49850
},
{
"entropy": 0.21075452208518983,
"epoch": 1.9870978018477223,
"grad_norm": 0.7453241944313049,
"learning_rate": 2.196137368702944e-08,
"loss": 0.2081309127807617,
"mean_token_accuracy": 0.930830671787262,
"num_tokens": 3888180011.0,
"step": 49900
},
{
"entropy": 0.21127940952777863,
"epoch": 1.9890888818094936,
"grad_norm": 1.3387459516525269,
"learning_rate": 1.5723987235505277e-08,
"loss": 0.21070463180541993,
"mean_token_accuracy": 0.9282910376787186,
"num_tokens": 3892182274.0,
"step": 49950
},
{
"entropy": 0.20441270008683204,
"epoch": 1.991079961771265,
"grad_norm": 4.187839031219482,
"learning_rate": 1.0526066119675992e-08,
"loss": 0.2010428237915039,
"mean_token_accuracy": 0.9325181847810745,
"num_tokens": 3896204467.0,
"step": 50000
},
{
"entropy": 0.20435837164521217,
"epoch": 1.993071041733036,
"grad_norm": 1.1942611932754517,
"learning_rate": 6.367664378625904e-09,
"loss": 0.2057977294921875,
"mean_token_accuracy": 0.931745657324791,
"num_tokens": 3900102828.0,
"step": 50050
},
{
"entropy": 0.2092647895216942,
"epoch": 1.9950621216948072,
"grad_norm": 0.8024593591690063,
"learning_rate": 3.2488252443063636e-09,
"loss": 0.20857706069946289,
"mean_token_accuracy": 0.9304239410161972,
"num_tokens": 3904170822.0,
"step": 50100
},
{
"entropy": 0.21017679318785668,
"epoch": 1.9970532016565785,
"grad_norm": 43.912872314453125,
"learning_rate": 1.1695811410472602e-09,
"loss": 0.20722965240478516,
"mean_token_accuracy": 0.929292955994606,
"num_tokens": 3908122364.0,
"step": 50150
},
{
"entropy": 0.20791637182235717,
"epoch": 1.9990442816183498,
"grad_norm": 2.973179817199707,
"learning_rate": 1.2995368529056252e-10,
"loss": 0.20523807525634766,
"mean_token_accuracy": 0.9306921732425689,
"num_tokens": 3911893024.0,
"step": 50200
},
{
"epoch": 2.0,
"eval_entropy": 0.20587446363199324,
"eval_loss": 0.21491390466690063,
"eval_mean_token_accuracy": 0.9264521419055878,
"eval_num_tokens": 3913614351.0,
"eval_runtime": 97.9895,
"eval_samples_per_second": 10.205,
"eval_steps_per_second": 0.643,
"step": 50224
}
],
"logging_steps": 50,
"max_steps": 50224,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 2500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.1421745685818801e+21,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}