{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9166034114833221, "eval_steps": 4000, "global_step": 32000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.3528062401339412, "epoch": 0.00028643856608853816, "grad_norm": 478.0, "learning_rate": 4.5e-07, "loss": 7.217581939697266, "mean_token_accuracy": 0.4640563763678074, "num_tokens": 19473.0, "step": 10 }, { "entropy": 0.461815438978374, "epoch": 0.0005728771321770763, "grad_norm": 318.0, "learning_rate": 9.5e-07, "loss": 6.147866058349609, "mean_token_accuracy": 0.46377463489770887, "num_tokens": 40258.0, "step": 20 }, { "entropy": 0.5792016623541713, "epoch": 0.0008593156982656145, "grad_norm": 125.5, "learning_rate": 1.45e-06, "loss": 4.201408767700196, "mean_token_accuracy": 0.5143063102848828, "num_tokens": 60493.0, "step": 30 }, { "entropy": 0.8141000302508473, "epoch": 0.0011457542643541526, "grad_norm": 72.0, "learning_rate": 1.95e-06, "loss": 2.4521657943725588, "mean_token_accuracy": 0.6026567563414573, "num_tokens": 78942.0, "step": 40 }, { "entropy": 1.61114833727479, "epoch": 0.0014321928304426908, "grad_norm": 33.25, "learning_rate": 2.4500000000000003e-06, "loss": 2.2294458389282226, "mean_token_accuracy": 0.5755564626306295, "num_tokens": 97239.0, "step": 50 }, { "entropy": 1.7803453914821148, "epoch": 0.001718631396531229, "grad_norm": 34.0, "learning_rate": 2.95e-06, "loss": 1.895331573486328, "mean_token_accuracy": 0.6102932810783386, "num_tokens": 116874.0, "step": 60 }, { "entropy": 1.7013822786509991, "epoch": 0.0020050699626197673, "grad_norm": 39.75, "learning_rate": 3.4500000000000004e-06, "loss": 1.7933462142944336, "mean_token_accuracy": 0.6113637214526534, "num_tokens": 137643.0, "step": 70 }, { "entropy": 1.8509704992175102, "epoch": 0.0022915085287083053, "grad_norm": 32.0, "learning_rate": 3.95e-06, "loss": 1.9163200378417968, "mean_token_accuracy": 0.6079998154193162, "num_tokens": 158951.0, "step": 80 }, { "entropy": 1.765385853126645, "epoch": 0.0025779470947968433, "grad_norm": 36.5, "learning_rate": 4.45e-06, "loss": 1.8505186080932616, "mean_token_accuracy": 0.6070508841425181, "num_tokens": 179801.0, "step": 90 }, { "entropy": 1.7926170282065867, "epoch": 0.0028643856608853817, "grad_norm": 42.75, "learning_rate": 4.950000000000001e-06, "loss": 1.8546482086181642, "mean_token_accuracy": 0.597331989184022, "num_tokens": 198667.0, "step": 100 }, { "entropy": 1.8906881004571914, "epoch": 0.0031508242269739197, "grad_norm": 31.0, "learning_rate": 5.45e-06, "loss": 1.9200061798095702, "mean_token_accuracy": 0.6018830932676792, "num_tokens": 217502.0, "step": 110 }, { "entropy": 1.6857450231909752, "epoch": 0.003437262793062458, "grad_norm": 38.75, "learning_rate": 5.95e-06, "loss": 1.8439041137695313, "mean_token_accuracy": 0.6112990219146013, "num_tokens": 237612.0, "step": 120 }, { "entropy": 1.7538917355239392, "epoch": 0.003723701359150996, "grad_norm": 68.5, "learning_rate": 6.45e-06, "loss": 1.7615484237670898, "mean_token_accuracy": 0.6213274173438549, "num_tokens": 257818.0, "step": 130 }, { "entropy": 1.6896496571600437, "epoch": 0.0040101399252395345, "grad_norm": 42.25, "learning_rate": 6.950000000000001e-06, "loss": 1.7217609405517578, "mean_token_accuracy": 0.6107563082128763, "num_tokens": 276933.0, "step": 140 }, { "entropy": 1.7307493343949318, "epoch": 0.0042965784913280725, "grad_norm": 35.25, "learning_rate": 7.45e-06, "loss": 1.7894071578979491, "mean_token_accuracy": 0.626866776496172, "num_tokens": 295470.0, "step": 150 }, { "entropy": 1.7178809575736522, "epoch": 0.0045830170574166105, "grad_norm": 38.5, "learning_rate": 7.95e-06, "loss": 1.7587535858154297, "mean_token_accuracy": 0.6143172055482864, "num_tokens": 315763.0, "step": 160 }, { "entropy": 1.5212275303900242, "epoch": 0.0048694556235051485, "grad_norm": 29.0, "learning_rate": 8.45e-06, "loss": 1.5423474311828613, "mean_token_accuracy": 0.654015052691102, "num_tokens": 336144.0, "step": 170 }, { "entropy": 1.5958088483661412, "epoch": 0.0051558941895936865, "grad_norm": 28.0, "learning_rate": 8.95e-06, "loss": 1.5740506172180175, "mean_token_accuracy": 0.6468525096774101, "num_tokens": 355322.0, "step": 180 }, { "entropy": 1.6313762225210666, "epoch": 0.005442332755682225, "grad_norm": 45.0, "learning_rate": 9.450000000000001e-06, "loss": 1.6890562057495118, "mean_token_accuracy": 0.6329364471137524, "num_tokens": 374375.0, "step": 190 }, { "entropy": 1.6774629056453705, "epoch": 0.005728771321770763, "grad_norm": 25.875, "learning_rate": 9.950000000000001e-06, "loss": 1.7464597702026368, "mean_token_accuracy": 0.6420648951083422, "num_tokens": 395145.0, "step": 200 }, { "entropy": 1.6366954684257506, "epoch": 0.006015209887859301, "grad_norm": 29.125, "learning_rate": 1.045e-05, "loss": 1.7245145797729493, "mean_token_accuracy": 0.6189848899841308, "num_tokens": 414805.0, "step": 210 }, { "entropy": 1.6353202268481255, "epoch": 0.006301648453947839, "grad_norm": 33.5, "learning_rate": 1.095e-05, "loss": 1.5854035377502442, "mean_token_accuracy": 0.646422104537487, "num_tokens": 434175.0, "step": 220 }, { "entropy": 1.531673163920641, "epoch": 0.006588087020036377, "grad_norm": 29.875, "learning_rate": 1.145e-05, "loss": 1.7045608520507813, "mean_token_accuracy": 0.6308731701225042, "num_tokens": 454765.0, "step": 230 }, { "entropy": 1.7325628489255904, "epoch": 0.006874525586124916, "grad_norm": 29.5, "learning_rate": 1.195e-05, "loss": 1.7049570083618164, "mean_token_accuracy": 0.639626245573163, "num_tokens": 474803.0, "step": 240 }, { "entropy": 1.7215023070573807, "epoch": 0.007160964152213454, "grad_norm": 21.5, "learning_rate": 1.2450000000000001e-05, "loss": 1.6847394943237304, "mean_token_accuracy": 0.6271909900009632, "num_tokens": 494924.0, "step": 250 }, { "entropy": 1.4796019680798054, "epoch": 0.007447402718301992, "grad_norm": 30.0, "learning_rate": 1.2950000000000001e-05, "loss": 1.612894630432129, "mean_token_accuracy": 0.6432699490338564, "num_tokens": 514534.0, "step": 260 }, { "entropy": 1.5921406548470258, "epoch": 0.00773384128439053, "grad_norm": 28.25, "learning_rate": 1.3450000000000002e-05, "loss": 1.6738925933837892, "mean_token_accuracy": 0.6368084598332644, "num_tokens": 533648.0, "step": 270 }, { "entropy": 1.6388971492648126, "epoch": 0.008020279850479069, "grad_norm": 23.125, "learning_rate": 1.3950000000000002e-05, "loss": 1.5522817611694335, "mean_token_accuracy": 0.6521936945617199, "num_tokens": 553984.0, "step": 280 }, { "entropy": 1.6042158961296082, "epoch": 0.008306718416567606, "grad_norm": 34.5, "learning_rate": 1.4449999999999999e-05, "loss": 1.730119514465332, "mean_token_accuracy": 0.636293425410986, "num_tokens": 573549.0, "step": 290 }, { "entropy": 1.6883071303367614, "epoch": 0.008593156982656145, "grad_norm": 30.25, "learning_rate": 1.4950000000000001e-05, "loss": 1.6591917037963868, "mean_token_accuracy": 0.647525903955102, "num_tokens": 593360.0, "step": 300 }, { "entropy": 1.481922762095928, "epoch": 0.008879595548744682, "grad_norm": 21.75, "learning_rate": 1.545e-05, "loss": 1.528256893157959, "mean_token_accuracy": 0.6495554637163877, "num_tokens": 614270.0, "step": 310 }, { "entropy": 1.6406896494328975, "epoch": 0.009166034114833221, "grad_norm": 32.5, "learning_rate": 1.595e-05, "loss": 1.7234817504882813, "mean_token_accuracy": 0.6251039749011398, "num_tokens": 634148.0, "step": 320 }, { "entropy": 1.7205604828894139, "epoch": 0.00945247268092176, "grad_norm": 30.25, "learning_rate": 1.645e-05, "loss": 1.7638006210327148, "mean_token_accuracy": 0.6161015894263983, "num_tokens": 654277.0, "step": 330 }, { "entropy": 1.543334063142538, "epoch": 0.009738911247010297, "grad_norm": 33.0, "learning_rate": 1.6950000000000002e-05, "loss": 1.5728675842285156, "mean_token_accuracy": 0.6445532537996769, "num_tokens": 672940.0, "step": 340 }, { "entropy": 1.674956924468279, "epoch": 0.010025349813098836, "grad_norm": 25.125, "learning_rate": 1.745e-05, "loss": 1.7410369873046876, "mean_token_accuracy": 0.6321388445794582, "num_tokens": 693369.0, "step": 350 }, { "entropy": 1.6595345363020897, "epoch": 0.010311788379187373, "grad_norm": 39.5, "learning_rate": 1.795e-05, "loss": 1.6917007446289063, "mean_token_accuracy": 0.6355412002652884, "num_tokens": 713621.0, "step": 360 }, { "entropy": 1.5632868006825447, "epoch": 0.010598226945275912, "grad_norm": 26.625, "learning_rate": 1.845e-05, "loss": 1.5559974670410157, "mean_token_accuracy": 0.6593380380421877, "num_tokens": 733037.0, "step": 370 }, { "entropy": 1.6144609708338975, "epoch": 0.01088466551136445, "grad_norm": 29.875, "learning_rate": 1.895e-05, "loss": 1.6511468887329102, "mean_token_accuracy": 0.6317056931555272, "num_tokens": 752153.0, "step": 380 }, { "entropy": 1.5421662211418152, "epoch": 0.011171104077452988, "grad_norm": 24.625, "learning_rate": 1.9450000000000002e-05, "loss": 1.6255882263183594, "mean_token_accuracy": 0.6627073056995869, "num_tokens": 773098.0, "step": 390 }, { "entropy": 1.7122172061353922, "epoch": 0.011457542643541527, "grad_norm": 21.75, "learning_rate": 1.995e-05, "loss": 1.7527050018310546, "mean_token_accuracy": 0.6149721326306462, "num_tokens": 791765.0, "step": 400 }, { "entropy": 1.7726871855556965, "epoch": 0.011743981209630064, "grad_norm": 26.0, "learning_rate": 2.045e-05, "loss": 1.7686229705810548, "mean_token_accuracy": 0.6190072495490313, "num_tokens": 811401.0, "step": 410 }, { "entropy": 1.5961021460592746, "epoch": 0.012030419775718603, "grad_norm": 25.875, "learning_rate": 2.095e-05, "loss": 1.7156158447265626, "mean_token_accuracy": 0.6386278152465821, "num_tokens": 830948.0, "step": 420 }, { "entropy": 1.6144308768212796, "epoch": 0.012316858341807142, "grad_norm": 27.875, "learning_rate": 2.145e-05, "loss": 1.6228755950927733, "mean_token_accuracy": 0.634922893717885, "num_tokens": 849629.0, "step": 430 }, { "entropy": 1.683132666349411, "epoch": 0.012603296907895679, "grad_norm": 29.0, "learning_rate": 2.195e-05, "loss": 1.7449392318725585, "mean_token_accuracy": 0.6308464124798775, "num_tokens": 868191.0, "step": 440 }, { "entropy": 1.625600465387106, "epoch": 0.012889735473984218, "grad_norm": 25.25, "learning_rate": 2.245e-05, "loss": 1.6958326339721679, "mean_token_accuracy": 0.6358420550823212, "num_tokens": 887523.0, "step": 450 }, { "entropy": 1.7978037655353547, "epoch": 0.013176174040072755, "grad_norm": 27.0, "learning_rate": 2.2950000000000002e-05, "loss": 1.83199462890625, "mean_token_accuracy": 0.6068651460111141, "num_tokens": 908979.0, "step": 460 }, { "entropy": 1.6116399303078652, "epoch": 0.013462612606161294, "grad_norm": 18.25, "learning_rate": 2.345e-05, "loss": 1.6807987213134765, "mean_token_accuracy": 0.6298470726236701, "num_tokens": 929167.0, "step": 470 }, { "entropy": 1.694230755418539, "epoch": 0.013749051172249832, "grad_norm": 29.125, "learning_rate": 2.395e-05, "loss": 1.7597953796386718, "mean_token_accuracy": 0.6239655200392008, "num_tokens": 948118.0, "step": 480 }, { "entropy": 1.6106532506644726, "epoch": 0.01403548973833837, "grad_norm": 21.0, "learning_rate": 2.445e-05, "loss": 1.7235946655273438, "mean_token_accuracy": 0.6164496175944805, "num_tokens": 968805.0, "step": 490 }, { "entropy": 1.8479979574680327, "epoch": 0.014321928304426908, "grad_norm": 20.625, "learning_rate": 2.495e-05, "loss": 1.8998939514160156, "mean_token_accuracy": 0.6054852087050676, "num_tokens": 988060.0, "step": 500 }, { "entropy": 1.8584213972091674, "epoch": 0.014608366870515446, "grad_norm": 20.375, "learning_rate": 2.5450000000000002e-05, "loss": 1.8704095840454102, "mean_token_accuracy": 0.6105503164231777, "num_tokens": 1007701.0, "step": 510 }, { "entropy": 1.6088180273771286, "epoch": 0.014894805436603984, "grad_norm": 31.0, "learning_rate": 2.595e-05, "loss": 1.7482704162597655, "mean_token_accuracy": 0.6043568558990955, "num_tokens": 1026950.0, "step": 520 }, { "entropy": 1.6710659384727478, "epoch": 0.015181244002692523, "grad_norm": 35.75, "learning_rate": 2.6450000000000003e-05, "loss": 1.7560743331909179, "mean_token_accuracy": 0.6205087993294001, "num_tokens": 1048349.0, "step": 530 }, { "entropy": 1.841731084138155, "epoch": 0.01546768256878106, "grad_norm": 21.25, "learning_rate": 2.6950000000000005e-05, "loss": 1.9027681350708008, "mean_token_accuracy": 0.602517394348979, "num_tokens": 1068676.0, "step": 540 }, { "entropy": 1.8934282220900058, "epoch": 0.015754121134869598, "grad_norm": 36.25, "learning_rate": 2.7450000000000003e-05, "loss": 1.918873405456543, "mean_token_accuracy": 0.5876505618914962, "num_tokens": 1090010.0, "step": 550 }, { "entropy": 1.8826362006366253, "epoch": 0.016040559700958138, "grad_norm": 17.875, "learning_rate": 2.7950000000000005e-05, "loss": 1.9828632354736329, "mean_token_accuracy": 0.5951655959710479, "num_tokens": 1109984.0, "step": 560 }, { "entropy": 1.849650678038597, "epoch": 0.016326998267046675, "grad_norm": 18.5, "learning_rate": 2.845e-05, "loss": 1.897369384765625, "mean_token_accuracy": 0.5904229883104563, "num_tokens": 1128870.0, "step": 570 }, { "entropy": 1.6490569829940795, "epoch": 0.016613436833135212, "grad_norm": 19.5, "learning_rate": 2.895e-05, "loss": 1.7149398803710938, "mean_token_accuracy": 0.6223928950726986, "num_tokens": 1149013.0, "step": 580 }, { "entropy": 1.7709774278104304, "epoch": 0.016899875399223753, "grad_norm": 22.875, "learning_rate": 2.945e-05, "loss": 1.8379535675048828, "mean_token_accuracy": 0.5926799420267344, "num_tokens": 1169525.0, "step": 590 }, { "entropy": 1.7111972540616989, "epoch": 0.01718631396531229, "grad_norm": 24.5, "learning_rate": 2.995e-05, "loss": 1.7761560440063477, "mean_token_accuracy": 0.6236701173707843, "num_tokens": 1188120.0, "step": 600 }, { "entropy": 1.823415072262287, "epoch": 0.017472752531400827, "grad_norm": 24.0, "learning_rate": 3.045e-05, "loss": 1.8971757888793945, "mean_token_accuracy": 0.6017429701983928, "num_tokens": 1209105.0, "step": 610 }, { "entropy": 1.7498523406684399, "epoch": 0.017759191097489364, "grad_norm": 26.75, "learning_rate": 3.095e-05, "loss": 1.817325973510742, "mean_token_accuracy": 0.608129658550024, "num_tokens": 1228466.0, "step": 620 }, { "entropy": 1.8355644896626473, "epoch": 0.018045629663577905, "grad_norm": 27.375, "learning_rate": 3.145e-05, "loss": 1.9128643035888673, "mean_token_accuracy": 0.5950730726122856, "num_tokens": 1247797.0, "step": 630 }, { "entropy": 1.8622040383517742, "epoch": 0.018332068229666442, "grad_norm": 24.875, "learning_rate": 3.1950000000000004e-05, "loss": 1.9076318740844727, "mean_token_accuracy": 0.5939670577645302, "num_tokens": 1267311.0, "step": 640 }, { "entropy": 1.9695768848061561, "epoch": 0.01861850679575498, "grad_norm": 18.125, "learning_rate": 3.245e-05, "loss": 2.0158262252807617, "mean_token_accuracy": 0.5735625583678484, "num_tokens": 1287020.0, "step": 650 }, { "entropy": 1.8041729524731636, "epoch": 0.01890494536184352, "grad_norm": 20.125, "learning_rate": 3.295e-05, "loss": 1.9124000549316407, "mean_token_accuracy": 0.5887357614934444, "num_tokens": 1306669.0, "step": 660 }, { "entropy": 1.679208005964756, "epoch": 0.019191383927932057, "grad_norm": 23.75, "learning_rate": 3.345000000000001e-05, "loss": 1.755006980895996, "mean_token_accuracy": 0.6205299673601985, "num_tokens": 1325991.0, "step": 670 }, { "entropy": 1.9598253771662713, "epoch": 0.019477822494020594, "grad_norm": 29.0, "learning_rate": 3.3950000000000005e-05, "loss": 2.0003707885742186, "mean_token_accuracy": 0.5839478272944689, "num_tokens": 1345046.0, "step": 680 }, { "entropy": 1.7889393791556358, "epoch": 0.019764261060109135, "grad_norm": 24.125, "learning_rate": 3.445e-05, "loss": 1.8787141799926759, "mean_token_accuracy": 0.6056120421737432, "num_tokens": 1364092.0, "step": 690 }, { "entropy": 1.8079691872000694, "epoch": 0.020050699626197672, "grad_norm": 16.625, "learning_rate": 3.495e-05, "loss": 1.8646484375, "mean_token_accuracy": 0.6014414165169001, "num_tokens": 1384087.0, "step": 700 }, { "entropy": 1.8085278443992139, "epoch": 0.02033713819228621, "grad_norm": 18.75, "learning_rate": 3.545e-05, "loss": 1.9149509429931642, "mean_token_accuracy": 0.5895494751632213, "num_tokens": 1404794.0, "step": 710 }, { "entropy": 1.9263403855264187, "epoch": 0.020623576758374746, "grad_norm": 19.625, "learning_rate": 3.595e-05, "loss": 1.984172248840332, "mean_token_accuracy": 0.5828634317964315, "num_tokens": 1425881.0, "step": 720 }, { "entropy": 2.035868939012289, "epoch": 0.020910015324463287, "grad_norm": 22.75, "learning_rate": 3.645e-05, "loss": 2.1743022918701174, "mean_token_accuracy": 0.5523974321782589, "num_tokens": 1445642.0, "step": 730 }, { "entropy": 1.9566943377256394, "epoch": 0.021196453890551824, "grad_norm": 15.1875, "learning_rate": 3.6950000000000004e-05, "loss": 1.9452693939208985, "mean_token_accuracy": 0.59082987960428, "num_tokens": 1465223.0, "step": 740 }, { "entropy": 1.7797305561602115, "epoch": 0.02148289245664036, "grad_norm": 42.25, "learning_rate": 3.745e-05, "loss": 2.0244304656982424, "mean_token_accuracy": 0.5785138387233019, "num_tokens": 1485173.0, "step": 750 }, { "entropy": 2.1499163672327994, "epoch": 0.0217693310227289, "grad_norm": 25.125, "learning_rate": 3.795e-05, "loss": 2.1835763931274412, "mean_token_accuracy": 0.5378579221665859, "num_tokens": 1505269.0, "step": 760 }, { "entropy": 1.9885080248117446, "epoch": 0.02205576958881744, "grad_norm": 23.25, "learning_rate": 3.845e-05, "loss": 2.0707183837890626, "mean_token_accuracy": 0.5810061223804951, "num_tokens": 1525423.0, "step": 770 }, { "entropy": 1.8684268310666083, "epoch": 0.022342208154905976, "grad_norm": 20.0, "learning_rate": 3.8950000000000005e-05, "loss": 1.964059066772461, "mean_token_accuracy": 0.5858997877687215, "num_tokens": 1546158.0, "step": 780 }, { "entropy": 1.8782096415758134, "epoch": 0.022628646720994516, "grad_norm": 17.75, "learning_rate": 3.9450000000000003e-05, "loss": 1.9113346099853517, "mean_token_accuracy": 0.5886166680604219, "num_tokens": 1566144.0, "step": 790 }, { "entropy": 1.9770341627299786, "epoch": 0.022915085287083053, "grad_norm": 17.875, "learning_rate": 3.995e-05, "loss": 2.07691650390625, "mean_token_accuracy": 0.5895924907177686, "num_tokens": 1585496.0, "step": 800 }, { "entropy": 1.9110678054392338, "epoch": 0.02320152385317159, "grad_norm": 20.25, "learning_rate": 4.045000000000001e-05, "loss": 2.1008880615234373, "mean_token_accuracy": 0.572381529957056, "num_tokens": 1604848.0, "step": 810 }, { "entropy": 1.9095255173742771, "epoch": 0.023487962419260128, "grad_norm": 29.0, "learning_rate": 4.095e-05, "loss": 1.9740182876586914, "mean_token_accuracy": 0.5741673868149519, "num_tokens": 1624503.0, "step": 820 }, { "entropy": 2.0804278537631036, "epoch": 0.02377440098534867, "grad_norm": 21.125, "learning_rate": 4.145e-05, "loss": 2.1728065490722654, "mean_token_accuracy": 0.5477346788160503, "num_tokens": 1645145.0, "step": 830 }, { "entropy": 1.9922449916601181, "epoch": 0.024060839551437205, "grad_norm": 18.375, "learning_rate": 4.195e-05, "loss": 1.9790054321289063, "mean_token_accuracy": 0.5938107941299677, "num_tokens": 1663819.0, "step": 840 }, { "entropy": 2.0197327487170695, "epoch": 0.024347278117525743, "grad_norm": 20.375, "learning_rate": 4.245e-05, "loss": 2.2007863998413084, "mean_token_accuracy": 0.5380131371319294, "num_tokens": 1683563.0, "step": 850 }, { "entropy": 1.8699860960245132, "epoch": 0.024633716683614283, "grad_norm": 26.375, "learning_rate": 4.295e-05, "loss": 1.9295654296875, "mean_token_accuracy": 0.58940952681005, "num_tokens": 1703387.0, "step": 860 }, { "entropy": 1.9832911752164364, "epoch": 0.02492015524970282, "grad_norm": 17.25, "learning_rate": 4.345e-05, "loss": 2.159903717041016, "mean_token_accuracy": 0.5491482594981789, "num_tokens": 1723297.0, "step": 870 }, { "entropy": 2.1792681008577346, "epoch": 0.025206593815791357, "grad_norm": 17.625, "learning_rate": 4.3950000000000004e-05, "loss": 2.219806671142578, "mean_token_accuracy": 0.5384906796738506, "num_tokens": 1742641.0, "step": 880 }, { "entropy": 1.8695313930511475, "epoch": 0.025493032381879898, "grad_norm": 18.625, "learning_rate": 4.445e-05, "loss": 1.9873180389404297, "mean_token_accuracy": 0.5735095415264369, "num_tokens": 1762901.0, "step": 890 }, { "entropy": 1.8507504656910896, "epoch": 0.025779470947968435, "grad_norm": 17.25, "learning_rate": 4.495e-05, "loss": 1.971590805053711, "mean_token_accuracy": 0.5827929314225913, "num_tokens": 1781407.0, "step": 900 }, { "entropy": 2.032640960812569, "epoch": 0.026065909514056972, "grad_norm": 26.125, "learning_rate": 4.545000000000001e-05, "loss": 2.178053855895996, "mean_token_accuracy": 0.5478040888905525, "num_tokens": 1799836.0, "step": 910 }, { "entropy": 2.1317695669829844, "epoch": 0.02635234808014551, "grad_norm": 24.75, "learning_rate": 4.5950000000000006e-05, "loss": 2.202964019775391, "mean_token_accuracy": 0.5512260548770428, "num_tokens": 1819871.0, "step": 920 }, { "entropy": 2.1580834552645682, "epoch": 0.02663878664623405, "grad_norm": 25.875, "learning_rate": 4.6450000000000004e-05, "loss": 2.2967807769775392, "mean_token_accuracy": 0.5261422438547015, "num_tokens": 1839653.0, "step": 930 }, { "entropy": 1.8693755000829697, "epoch": 0.026925225212322587, "grad_norm": 26.625, "learning_rate": 4.695e-05, "loss": 1.920684242248535, "mean_token_accuracy": 0.5878301737830043, "num_tokens": 1858425.0, "step": 940 }, { "entropy": 1.9177309423685074, "epoch": 0.027211663778411124, "grad_norm": 25.0, "learning_rate": 4.745e-05, "loss": 2.0325536727905273, "mean_token_accuracy": 0.5708646427839994, "num_tokens": 1877432.0, "step": 950 }, { "entropy": 2.0536071196198464, "epoch": 0.027498102344499665, "grad_norm": 19.75, "learning_rate": 4.795e-05, "loss": 2.230321502685547, "mean_token_accuracy": 0.5467239493504167, "num_tokens": 1896411.0, "step": 960 }, { "entropy": 2.0146598778665066, "epoch": 0.027784540910588202, "grad_norm": 19.25, "learning_rate": 4.845e-05, "loss": 2.0646324157714844, "mean_token_accuracy": 0.5636048406362534, "num_tokens": 1916224.0, "step": 970 }, { "entropy": 1.8649965476244688, "epoch": 0.02807097947667674, "grad_norm": 19.5, "learning_rate": 4.8950000000000004e-05, "loss": 2.0268020629882812, "mean_token_accuracy": 0.5778200808912516, "num_tokens": 1935380.0, "step": 980 }, { "entropy": 2.224521817266941, "epoch": 0.028357418042765276, "grad_norm": 20.25, "learning_rate": 4.945e-05, "loss": 2.29847412109375, "mean_token_accuracy": 0.5251183599233628, "num_tokens": 1954696.0, "step": 990 }, { "entropy": 1.9635957852005959, "epoch": 0.028643856608853817, "grad_norm": 24.125, "learning_rate": 4.995e-05, "loss": 2.1004880905151366, "mean_token_accuracy": 0.5523587435483932, "num_tokens": 1975488.0, "step": 1000 }, { "entropy": 2.1570306584239005, "epoch": 0.028930295174942354, "grad_norm": 21.0, "learning_rate": 4.9999997890327946e-05, "loss": 2.2056819915771486, "mean_token_accuracy": 0.5517607279121876, "num_tokens": 1995757.0, "step": 1010 }, { "entropy": 2.2149836353957655, "epoch": 0.02921673374103089, "grad_norm": 16.25, "learning_rate": 4.999999059763485e-05, "loss": 2.3002399444580077, "mean_token_accuracy": 0.5277919966727496, "num_tokens": 2014782.0, "step": 1020 }, { "entropy": 1.9475185506045818, "epoch": 0.02950317230711943, "grad_norm": 14.5, "learning_rate": 4.999997809587693e-05, "loss": 2.101923942565918, "mean_token_accuracy": 0.562053806334734, "num_tokens": 2035343.0, "step": 1030 }, { "entropy": 2.0823429681360723, "epoch": 0.02978961087320797, "grad_norm": 19.625, "learning_rate": 4.9999960385056766e-05, "loss": 2.2225202560424804, "mean_token_accuracy": 0.5534175606444478, "num_tokens": 2055608.0, "step": 1040 }, { "entropy": 2.007365348935127, "epoch": 0.030076049439296506, "grad_norm": 18.625, "learning_rate": 4.999993746517806e-05, "loss": 2.1226667404174804, "mean_token_accuracy": 0.5498795179650188, "num_tokens": 2075593.0, "step": 1050 }, { "entropy": 2.0506470412015916, "epoch": 0.030362488005385047, "grad_norm": 20.625, "learning_rate": 4.9999909336245585e-05, "loss": 2.2072338104248046, "mean_token_accuracy": 0.5508825996890664, "num_tokens": 2095591.0, "step": 1060 }, { "entropy": 2.03544892296195, "epoch": 0.030648926571473584, "grad_norm": 13.0, "learning_rate": 4.999987599826519e-05, "loss": 2.0811920166015625, "mean_token_accuracy": 0.5673403698951006, "num_tokens": 2114586.0, "step": 1070 }, { "entropy": 2.065407223254442, "epoch": 0.03093536513756212, "grad_norm": 15.8125, "learning_rate": 4.999983745124385e-05, "loss": 2.3352025985717773, "mean_token_accuracy": 0.5290726596489549, "num_tokens": 2134892.0, "step": 1080 }, { "entropy": 2.168225467950106, "epoch": 0.031221803703650658, "grad_norm": 15.3125, "learning_rate": 4.999979369518957e-05, "loss": 2.169589042663574, "mean_token_accuracy": 0.5483372673392296, "num_tokens": 2155329.0, "step": 1090 }, { "entropy": 1.9775354914367198, "epoch": 0.031508242269739195, "grad_norm": 15.1875, "learning_rate": 4.9999744730111476e-05, "loss": 2.2050197601318358, "mean_token_accuracy": 0.5570029642432928, "num_tokens": 2174335.0, "step": 1100 }, { "entropy": 2.0876759525388477, "epoch": 0.03179468083582774, "grad_norm": 16.5, "learning_rate": 4.999969055601978e-05, "loss": 2.1351606369018556, "mean_token_accuracy": 0.5560093311592936, "num_tokens": 2193061.0, "step": 1110 }, { "entropy": 1.8840322092175483, "epoch": 0.032081119401916276, "grad_norm": 21.25, "learning_rate": 4.999963117292575e-05, "loss": 2.1137130737304686, "mean_token_accuracy": 0.5579068209975958, "num_tokens": 2211784.0, "step": 1120 }, { "entropy": 2.118617121130228, "epoch": 0.03236755796800481, "grad_norm": 22.375, "learning_rate": 4.999956658084177e-05, "loss": 2.180125427246094, "mean_token_accuracy": 0.5428189273923636, "num_tokens": 2230788.0, "step": 1130 }, { "entropy": 2.233527162671089, "epoch": 0.03265399653409335, "grad_norm": 15.125, "learning_rate": 4.9999496779781306e-05, "loss": 2.3609376907348634, "mean_token_accuracy": 0.5256578113883734, "num_tokens": 2250811.0, "step": 1140 }, { "entropy": 2.031604032218456, "epoch": 0.03294043510018189, "grad_norm": 15.0625, "learning_rate": 4.999942176975889e-05, "loss": 2.085622024536133, "mean_token_accuracy": 0.5635854002088309, "num_tokens": 2269129.0, "step": 1150 }, { "entropy": 2.046806565672159, "epoch": 0.033226873666270425, "grad_norm": 13.0, "learning_rate": 4.999934155079016e-05, "loss": 2.2095598220825194, "mean_token_accuracy": 0.5431034330278635, "num_tokens": 2288066.0, "step": 1160 }, { "entropy": 2.033204253017902, "epoch": 0.03351331223235896, "grad_norm": 17.875, "learning_rate": 4.999925612289182e-05, "loss": 2.186530113220215, "mean_token_accuracy": 0.5451825274154544, "num_tokens": 2309079.0, "step": 1170 }, { "entropy": 2.0099747076630594, "epoch": 0.033799750798447506, "grad_norm": 12.875, "learning_rate": 4.9999165486081686e-05, "loss": 2.1805286407470703, "mean_token_accuracy": 0.5489942122250795, "num_tokens": 2328780.0, "step": 1180 }, { "entropy": 1.8404223743826151, "epoch": 0.03408618936453604, "grad_norm": 14.125, "learning_rate": 4.9999069640378635e-05, "loss": 1.974308395385742, "mean_token_accuracy": 0.5997153293341398, "num_tokens": 2348426.0, "step": 1190 }, { "entropy": 2.000691217184067, "epoch": 0.03437262793062458, "grad_norm": 22.75, "learning_rate": 4.999896858580263e-05, "loss": 2.0610605239868165, "mean_token_accuracy": 0.5601603195071221, "num_tokens": 2368349.0, "step": 1200 }, { "entropy": 2.043005222082138, "epoch": 0.03465906649671312, "grad_norm": 26.0, "learning_rate": 4.999886232237473e-05, "loss": 2.1969589233398437, "mean_token_accuracy": 0.5667722446843981, "num_tokens": 2387562.0, "step": 1210 }, { "entropy": 1.9800917744636535, "epoch": 0.034945505062801654, "grad_norm": 17.0, "learning_rate": 4.9998750850117085e-05, "loss": 2.084916687011719, "mean_token_accuracy": 0.5710238970816135, "num_tokens": 2408208.0, "step": 1220 }, { "entropy": 2.0688542298972608, "epoch": 0.03523194362889019, "grad_norm": 15.0625, "learning_rate": 4.9998634169052915e-05, "loss": 2.211404228210449, "mean_token_accuracy": 0.5368290698155761, "num_tokens": 2428408.0, "step": 1230 }, { "entropy": 2.039776177704334, "epoch": 0.03551838219497873, "grad_norm": 11.75, "learning_rate": 4.999851227920654e-05, "loss": 2.1168548583984377, "mean_token_accuracy": 0.5706047866493463, "num_tokens": 2449498.0, "step": 1240 }, { "entropy": 2.042325101047754, "epoch": 0.03580482076106727, "grad_norm": 13.0, "learning_rate": 4.9998385180603346e-05, "loss": 2.1548297882080076, "mean_token_accuracy": 0.5527641370892524, "num_tokens": 2468777.0, "step": 1250 }, { "entropy": 1.9143792726099491, "epoch": 0.03609125932715581, "grad_norm": 13.9375, "learning_rate": 4.999825287326982e-05, "loss": 2.079159736633301, "mean_token_accuracy": 0.5709832672029733, "num_tokens": 2488258.0, "step": 1260 }, { "entropy": 2.112581159174442, "epoch": 0.03637769789324435, "grad_norm": 15.8125, "learning_rate": 4.9998115357233536e-05, "loss": 2.211891746520996, "mean_token_accuracy": 0.54996342882514, "num_tokens": 2507098.0, "step": 1270 }, { "entropy": 2.0279450356960296, "epoch": 0.036664136459332884, "grad_norm": 15.625, "learning_rate": 4.9997972632523136e-05, "loss": 2.1490793228149414, "mean_token_accuracy": 0.5442783921957016, "num_tokens": 2527918.0, "step": 1280 }, { "entropy": 2.1258341267704965, "epoch": 0.03695057502542142, "grad_norm": 18.25, "learning_rate": 4.999782469916836e-05, "loss": 2.2387834548950196, "mean_token_accuracy": 0.5409025836735963, "num_tokens": 2547346.0, "step": 1290 }, { "entropy": 2.055143154412508, "epoch": 0.03723701359150996, "grad_norm": 13.625, "learning_rate": 4.999767155720004e-05, "loss": 2.177887535095215, "mean_token_accuracy": 0.5544646181166172, "num_tokens": 2566815.0, "step": 1300 }, { "entropy": 1.906372955441475, "epoch": 0.0375234521575985, "grad_norm": 17.25, "learning_rate": 4.999751320665008e-05, "loss": 1.993330955505371, "mean_token_accuracy": 0.5768570452928543, "num_tokens": 2586328.0, "step": 1310 }, { "entropy": 1.9420357584953307, "epoch": 0.03780989072368704, "grad_norm": 13.0, "learning_rate": 4.999734964755148e-05, "loss": 2.1593313217163086, "mean_token_accuracy": 0.5613118495792151, "num_tokens": 2606494.0, "step": 1320 }, { "entropy": 2.064364905655384, "epoch": 0.03809632928977558, "grad_norm": 12.5, "learning_rate": 4.999718087993831e-05, "loss": 2.0964239120483397, "mean_token_accuracy": 0.564254280552268, "num_tokens": 2625743.0, "step": 1330 }, { "entropy": 2.044856058806181, "epoch": 0.038382767855864114, "grad_norm": 14.75, "learning_rate": 4.999700690384574e-05, "loss": 2.1857213973999023, "mean_token_accuracy": 0.5576331483200192, "num_tokens": 2644531.0, "step": 1340 }, { "entropy": 1.991876221448183, "epoch": 0.03866920642195265, "grad_norm": 13.25, "learning_rate": 4.9996827719310024e-05, "loss": 2.1038537979125977, "mean_token_accuracy": 0.5588052786886692, "num_tokens": 2664797.0, "step": 1350 }, { "entropy": 2.0421272471547125, "epoch": 0.03895564498804119, "grad_norm": 14.1875, "learning_rate": 4.9996643326368496e-05, "loss": 2.1337377548217775, "mean_token_accuracy": 0.5599613673985004, "num_tokens": 2685813.0, "step": 1360 }, { "entropy": 2.064424628019333, "epoch": 0.039242083554129725, "grad_norm": 17.0, "learning_rate": 4.9996453725059565e-05, "loss": 2.1573770523071287, "mean_token_accuracy": 0.5383721258491277, "num_tokens": 2705953.0, "step": 1370 }, { "entropy": 1.9960372231900692, "epoch": 0.03952852212021827, "grad_norm": 18.125, "learning_rate": 4.999625891542275e-05, "loss": 2.139292335510254, "mean_token_accuracy": 0.5599675431847573, "num_tokens": 2725694.0, "step": 1380 }, { "entropy": 1.9672050677239894, "epoch": 0.039814960686306806, "grad_norm": 20.625, "learning_rate": 4.999605889749864e-05, "loss": 2.080162239074707, "mean_token_accuracy": 0.5670911554247141, "num_tokens": 2745756.0, "step": 1390 }, { "entropy": 1.8259234957396984, "epoch": 0.040101399252395344, "grad_norm": 15.0625, "learning_rate": 4.999585367132891e-05, "loss": 1.9446260452270507, "mean_token_accuracy": 0.6032669235020875, "num_tokens": 2765605.0, "step": 1400 }, { "entropy": 2.067405442893505, "epoch": 0.04038783781848388, "grad_norm": 17.5, "learning_rate": 4.999564323695631e-05, "loss": 2.2064241409301757, "mean_token_accuracy": 0.556842989474535, "num_tokens": 2784802.0, "step": 1410 }, { "entropy": 2.0353706762194634, "epoch": 0.04067427638457242, "grad_norm": 12.5, "learning_rate": 4.999542759442471e-05, "loss": 2.1227603912353517, "mean_token_accuracy": 0.5624410983175039, "num_tokens": 2804798.0, "step": 1420 }, { "entropy": 1.9824700266122819, "epoch": 0.040960714950660955, "grad_norm": 14.5625, "learning_rate": 4.999520674377902e-05, "loss": 2.142858695983887, "mean_token_accuracy": 0.5562454015016556, "num_tokens": 2824349.0, "step": 1430 }, { "entropy": 1.9648552320897579, "epoch": 0.04124715351674949, "grad_norm": 13.3125, "learning_rate": 4.9994980685065276e-05, "loss": 2.0884014129638673, "mean_token_accuracy": 0.5572406148537994, "num_tokens": 2843817.0, "step": 1440 }, { "entropy": 2.073359905928373, "epoch": 0.041533592082838036, "grad_norm": 14.5, "learning_rate": 4.9994749418330563e-05, "loss": 2.236592674255371, "mean_token_accuracy": 0.5480291146785021, "num_tokens": 2864555.0, "step": 1450 }, { "entropy": 2.026448929309845, "epoch": 0.04182003064892657, "grad_norm": 12.875, "learning_rate": 4.999451294362307e-05, "loss": 2.030807685852051, "mean_token_accuracy": 0.5731288217008114, "num_tokens": 2883361.0, "step": 1460 }, { "entropy": 2.094747570902109, "epoch": 0.04210646921501511, "grad_norm": 14.0625, "learning_rate": 4.9994271260992085e-05, "loss": 2.154788017272949, "mean_token_accuracy": 0.554672435671091, "num_tokens": 2903559.0, "step": 1470 }, { "entropy": 1.834746278077364, "epoch": 0.04239290778110365, "grad_norm": 15.0, "learning_rate": 4.999402437048796e-05, "loss": 1.9966672897338866, "mean_token_accuracy": 0.5871462974697351, "num_tokens": 2922528.0, "step": 1480 }, { "entropy": 1.852889922261238, "epoch": 0.042679346347192185, "grad_norm": 12.375, "learning_rate": 4.999377227216212e-05, "loss": 1.992462158203125, "mean_token_accuracy": 0.5888149295002222, "num_tokens": 2942994.0, "step": 1490 }, { "entropy": 1.9615300245583058, "epoch": 0.04296578491328072, "grad_norm": 10.125, "learning_rate": 4.999351496606711e-05, "loss": 2.046071243286133, "mean_token_accuracy": 0.5736448410898447, "num_tokens": 2963415.0, "step": 1500 }, { "entropy": 2.1007414549589156, "epoch": 0.04325222347936926, "grad_norm": 15.9375, "learning_rate": 4.999325245225654e-05, "loss": 2.2497447967529296, "mean_token_accuracy": 0.5430479362607002, "num_tokens": 2982219.0, "step": 1510 }, { "entropy": 1.9808135472238064, "epoch": 0.0435386620454578, "grad_norm": 17.375, "learning_rate": 4.999298473078512e-05, "loss": 2.061616134643555, "mean_token_accuracy": 0.5665172085165977, "num_tokens": 3002660.0, "step": 1520 }, { "entropy": 2.00408933237195, "epoch": 0.04382510061154634, "grad_norm": 9.9375, "learning_rate": 4.999271180170861e-05, "loss": 2.195215034484863, "mean_token_accuracy": 0.5668820874765516, "num_tokens": 3021865.0, "step": 1530 }, { "entropy": 1.9539212465286255, "epoch": 0.04411153917763488, "grad_norm": 13.75, "learning_rate": 4.999243366508389e-05, "loss": 1.9769552230834961, "mean_token_accuracy": 0.5828819796442986, "num_tokens": 3041788.0, "step": 1540 }, { "entropy": 1.8997029036283493, "epoch": 0.044397977743723414, "grad_norm": 12.25, "learning_rate": 4.9992150320968914e-05, "loss": 2.0064029693603516, "mean_token_accuracy": 0.5830189131200314, "num_tokens": 3061327.0, "step": 1550 }, { "entropy": 1.9043468147516251, "epoch": 0.04468441630981195, "grad_norm": 11.9375, "learning_rate": 4.999186176942271e-05, "loss": 2.016738510131836, "mean_token_accuracy": 0.5949485957622528, "num_tokens": 3080448.0, "step": 1560 }, { "entropy": 2.0285617001354694, "epoch": 0.04497085487590049, "grad_norm": 14.375, "learning_rate": 4.999156801050542e-05, "loss": 2.1571699142456056, "mean_token_accuracy": 0.5611587069928646, "num_tokens": 3099464.0, "step": 1570 }, { "entropy": 2.032850581407547, "epoch": 0.04525729344198903, "grad_norm": 11.8125, "learning_rate": 4.999126904427823e-05, "loss": 2.142729568481445, "mean_token_accuracy": 0.5683363012969493, "num_tokens": 3119445.0, "step": 1580 }, { "entropy": 1.9459272086620332, "epoch": 0.04554373200807757, "grad_norm": 17.625, "learning_rate": 4.999096487080346e-05, "loss": 2.0355464935302736, "mean_token_accuracy": 0.5715726802125574, "num_tokens": 3139277.0, "step": 1590 }, { "entropy": 1.9185783863067627, "epoch": 0.04583017057416611, "grad_norm": 12.8125, "learning_rate": 4.9990655490144464e-05, "loss": 2.042800712585449, "mean_token_accuracy": 0.5798308115452528, "num_tokens": 3158123.0, "step": 1600 }, { "entropy": 2.0223012883216143, "epoch": 0.046116609140254644, "grad_norm": 12.625, "learning_rate": 4.9990340902365724e-05, "loss": 2.1582475662231446, "mean_token_accuracy": 0.5669877097010613, "num_tokens": 3178764.0, "step": 1610 }, { "entropy": 1.984189174324274, "epoch": 0.04640304770634318, "grad_norm": 15.4375, "learning_rate": 4.9990021107532776e-05, "loss": 2.1012454986572267, "mean_token_accuracy": 0.5656917076557875, "num_tokens": 3197906.0, "step": 1620 }, { "entropy": 1.9899665638804436, "epoch": 0.04668948627243172, "grad_norm": 10.625, "learning_rate": 4.9989696105712255e-05, "loss": 2.054644966125488, "mean_token_accuracy": 0.565249053388834, "num_tokens": 3217491.0, "step": 1630 }, { "entropy": 2.173365142196417, "epoch": 0.046975924838520255, "grad_norm": 28.875, "learning_rate": 4.9989365896971886e-05, "loss": 2.27383975982666, "mean_token_accuracy": 0.5297906056046486, "num_tokens": 3237429.0, "step": 1640 }, { "entropy": 2.0662153884768486, "epoch": 0.0472623634046088, "grad_norm": 20.375, "learning_rate": 4.998903048138046e-05, "loss": 2.1620344161987304, "mean_token_accuracy": 0.5489458622410893, "num_tokens": 3256776.0, "step": 1650 }, { "entropy": 1.9505906507372857, "epoch": 0.04754880197069734, "grad_norm": 13.1875, "learning_rate": 4.998868985900788e-05, "loss": 2.0178153991699217, "mean_token_accuracy": 0.5674532245844602, "num_tokens": 3275791.0, "step": 1660 }, { "entropy": 1.966233441978693, "epoch": 0.047835240536785874, "grad_norm": 10.75, "learning_rate": 4.998834402992511e-05, "loss": 2.088430404663086, "mean_token_accuracy": 0.5653650652617216, "num_tokens": 3294501.0, "step": 1670 }, { "entropy": 1.8438799947500228, "epoch": 0.04812167910287441, "grad_norm": 13.8125, "learning_rate": 4.9987992994204205e-05, "loss": 1.9424402236938476, "mean_token_accuracy": 0.5878816403448581, "num_tokens": 3314620.0, "step": 1680 }, { "entropy": 1.8855835229158402, "epoch": 0.04840811766896295, "grad_norm": 12.25, "learning_rate": 4.9987636751918324e-05, "loss": 2.058888053894043, "mean_token_accuracy": 0.5803608868271113, "num_tokens": 3334977.0, "step": 1690 }, { "entropy": 1.9706033617258072, "epoch": 0.048694556235051485, "grad_norm": 10.4375, "learning_rate": 4.998727530314167e-05, "loss": 1.9991622924804688, "mean_token_accuracy": 0.5765298075973988, "num_tokens": 3358046.0, "step": 1700 }, { "entropy": 2.046942899376154, "epoch": 0.04898099480114002, "grad_norm": 11.5, "learning_rate": 4.998690864794957e-05, "loss": 2.2661470413208007, "mean_token_accuracy": 0.5470717648044229, "num_tokens": 3379088.0, "step": 1710 }, { "entropy": 2.120621448010206, "epoch": 0.049267433367228566, "grad_norm": 11.1875, "learning_rate": 4.998653678641843e-05, "loss": 2.117679405212402, "mean_token_accuracy": 0.5618710162118077, "num_tokens": 3398602.0, "step": 1720 }, { "entropy": 1.8022576607763767, "epoch": 0.049553871933317103, "grad_norm": 11.6875, "learning_rate": 4.998615971862571e-05, "loss": 1.9418848037719727, "mean_token_accuracy": 0.5938253000378608, "num_tokens": 3417782.0, "step": 1730 }, { "entropy": 1.7548723980784415, "epoch": 0.04984031049940564, "grad_norm": 16.125, "learning_rate": 4.9985777444649995e-05, "loss": 1.989464569091797, "mean_token_accuracy": 0.5836741965264082, "num_tokens": 3437040.0, "step": 1740 }, { "entropy": 1.889078352600336, "epoch": 0.05012674906549418, "grad_norm": 12.5625, "learning_rate": 4.9985389964570926e-05, "loss": 1.8748939514160157, "mean_token_accuracy": 0.6075956784188747, "num_tokens": 3455855.0, "step": 1750 }, { "entropy": 1.8022679753601551, "epoch": 0.050413187631582715, "grad_norm": 14.375, "learning_rate": 4.998499727846924e-05, "loss": 1.9469636917114257, "mean_token_accuracy": 0.5890525598078966, "num_tokens": 3475979.0, "step": 1760 }, { "entropy": 1.825092475116253, "epoch": 0.05069962619767125, "grad_norm": 14.875, "learning_rate": 4.9984599386426764e-05, "loss": 1.9489648818969727, "mean_token_accuracy": 0.5951741103082895, "num_tokens": 3494650.0, "step": 1770 }, { "entropy": 2.0946372151374817, "epoch": 0.050986064763759796, "grad_norm": 14.125, "learning_rate": 4.998419628852641e-05, "loss": 2.222842979431152, "mean_token_accuracy": 0.5530176166445017, "num_tokens": 3512392.0, "step": 1780 }, { "entropy": 1.986116524785757, "epoch": 0.05127250332984833, "grad_norm": 16.5, "learning_rate": 4.998378798485215e-05, "loss": 2.031750297546387, "mean_token_accuracy": 0.5753281008452177, "num_tokens": 3531841.0, "step": 1790 }, { "entropy": 1.8011541001498699, "epoch": 0.05155894189593687, "grad_norm": 12.4375, "learning_rate": 4.9983374475489076e-05, "loss": 1.9964473724365235, "mean_token_accuracy": 0.5887253880500793, "num_tokens": 3551425.0, "step": 1800 }, { "entropy": 1.83894300237298, "epoch": 0.05184538046202541, "grad_norm": 12.0625, "learning_rate": 4.998295576052334e-05, "loss": 1.9472723007202148, "mean_token_accuracy": 0.5949041478335857, "num_tokens": 3572169.0, "step": 1810 }, { "entropy": 1.820378828048706, "epoch": 0.052131819028113945, "grad_norm": 12.25, "learning_rate": 4.998253184004219e-05, "loss": 1.8152381896972656, "mean_token_accuracy": 0.6049352586269379, "num_tokens": 3591954.0, "step": 1820 }, { "entropy": 1.6917552098631858, "epoch": 0.05241825759420248, "grad_norm": 13.8125, "learning_rate": 4.998210271413395e-05, "loss": 1.8625791549682618, "mean_token_accuracy": 0.6033434379845858, "num_tokens": 3612784.0, "step": 1830 }, { "entropy": 1.9794663526117802, "epoch": 0.05270469616029102, "grad_norm": 13.25, "learning_rate": 4.998166838288803e-05, "loss": 2.1264877319335938, "mean_token_accuracy": 0.5757445959374309, "num_tokens": 3631909.0, "step": 1840 }, { "entropy": 2.042566266655922, "epoch": 0.05299113472637956, "grad_norm": 14.375, "learning_rate": 4.998122884639495e-05, "loss": 2.0641660690307617, "mean_token_accuracy": 0.5762186653912067, "num_tokens": 3651541.0, "step": 1850 }, { "entropy": 1.9482962124049663, "epoch": 0.0532775732924681, "grad_norm": 9.6875, "learning_rate": 4.998078410474626e-05, "loss": 2.0754838943481446, "mean_token_accuracy": 0.5959542846307159, "num_tokens": 3671637.0, "step": 1860 }, { "entropy": 1.772421895712614, "epoch": 0.05356401185855664, "grad_norm": 10.4375, "learning_rate": 4.998033415803466e-05, "loss": 1.9321874618530273, "mean_token_accuracy": 0.5985866695642471, "num_tokens": 3691393.0, "step": 1870 }, { "entropy": 1.9630630321800708, "epoch": 0.053850450424645174, "grad_norm": 11.3125, "learning_rate": 4.997987900635388e-05, "loss": 2.095884323120117, "mean_token_accuracy": 0.5736457588151097, "num_tokens": 3711294.0, "step": 1880 }, { "entropy": 2.044461357593536, "epoch": 0.05413688899073371, "grad_norm": 13.8125, "learning_rate": 4.997941864979877e-05, "loss": 2.099529838562012, "mean_token_accuracy": 0.5731991751119494, "num_tokens": 3731939.0, "step": 1890 }, { "entropy": 1.8967493332922458, "epoch": 0.05442332755682225, "grad_norm": 21.75, "learning_rate": 4.997895308846524e-05, "loss": 2.038409614562988, "mean_token_accuracy": 0.5800403725355864, "num_tokens": 3750220.0, "step": 1900 }, { "entropy": 1.9163446389138699, "epoch": 0.054709766122910786, "grad_norm": 9.9375, "learning_rate": 4.9978482322450305e-05, "loss": 1.9895086288452148, "mean_token_accuracy": 0.5872535329312086, "num_tokens": 3769972.0, "step": 1910 }, { "entropy": 1.8457116827368736, "epoch": 0.05499620468899933, "grad_norm": 12.3125, "learning_rate": 4.997800635185205e-05, "loss": 1.910600471496582, "mean_token_accuracy": 0.6011968698352576, "num_tokens": 3789479.0, "step": 1920 }, { "entropy": 1.8551744908094405, "epoch": 0.05528264325508787, "grad_norm": 15.0, "learning_rate": 4.997752517676965e-05, "loss": 1.999060821533203, "mean_token_accuracy": 0.5846864935010672, "num_tokens": 3808632.0, "step": 1930 }, { "entropy": 1.9533005893230437, "epoch": 0.055569081821176404, "grad_norm": 11.1875, "learning_rate": 4.997703879730337e-05, "loss": 1.9968469619750977, "mean_token_accuracy": 0.58026770260185, "num_tokens": 3827910.0, "step": 1940 }, { "entropy": 1.9085161589086055, "epoch": 0.05585552038726494, "grad_norm": 8.8125, "learning_rate": 4.9976547213554536e-05, "loss": 2.019079399108887, "mean_token_accuracy": 0.5866671945899725, "num_tokens": 3848051.0, "step": 1950 }, { "entropy": 1.8469381153583526, "epoch": 0.05614195895335348, "grad_norm": 11.625, "learning_rate": 4.99760504256256e-05, "loss": 1.9547319412231445, "mean_token_accuracy": 0.5960608791559935, "num_tokens": 3867006.0, "step": 1960 }, { "entropy": 1.9383334703743458, "epoch": 0.056428397519442015, "grad_norm": 18.5, "learning_rate": 4.997554843362006e-05, "loss": 2.133906936645508, "mean_token_accuracy": 0.5758546967059374, "num_tokens": 3886840.0, "step": 1970 }, { "entropy": 1.9013036232441665, "epoch": 0.05671483608553055, "grad_norm": 10.875, "learning_rate": 4.997504123764251e-05, "loss": 1.9568716049194337, "mean_token_accuracy": 0.5916589047759772, "num_tokens": 3907260.0, "step": 1980 }, { "entropy": 1.8071703672409059, "epoch": 0.0570012746516191, "grad_norm": 8.75, "learning_rate": 4.997452883779863e-05, "loss": 1.8723196029663085, "mean_token_accuracy": 0.6036541979759932, "num_tokens": 3926810.0, "step": 1990 }, { "entropy": 1.8475841164588929, "epoch": 0.057287713217707634, "grad_norm": 12.0625, "learning_rate": 4.99740112341952e-05, "loss": 2.0067562103271483, "mean_token_accuracy": 0.5976184494793415, "num_tokens": 3945623.0, "step": 2000 }, { "entropy": 1.7979756787419319, "epoch": 0.05757415178379617, "grad_norm": 12.4375, "learning_rate": 4.997348842694005e-05, "loss": 1.8895217895507812, "mean_token_accuracy": 0.5975389555096626, "num_tokens": 3966359.0, "step": 2010 }, { "entropy": 1.889492254704237, "epoch": 0.05786059034988471, "grad_norm": 11.875, "learning_rate": 4.997296041614213e-05, "loss": 1.9238414764404297, "mean_token_accuracy": 0.5961540397256613, "num_tokens": 3985098.0, "step": 2020 }, { "entropy": 1.7875510536134243, "epoch": 0.058147028915973245, "grad_norm": 11.0625, "learning_rate": 4.9972427201911455e-05, "loss": 1.9333005905151368, "mean_token_accuracy": 0.5928152399137616, "num_tokens": 4004811.0, "step": 2030 }, { "entropy": 1.7978779956698419, "epoch": 0.05843346748206178, "grad_norm": 10.8125, "learning_rate": 4.997188878435911e-05, "loss": 1.9755786895751952, "mean_token_accuracy": 0.5879885520786047, "num_tokens": 4023985.0, "step": 2040 }, { "entropy": 1.8877509631216527, "epoch": 0.058719906048150326, "grad_norm": 9.6875, "learning_rate": 4.99713451635973e-05, "loss": 1.9203781127929687, "mean_token_accuracy": 0.5888435672968626, "num_tokens": 4043964.0, "step": 2050 }, { "entropy": 1.9123047180473804, "epoch": 0.05900634461423886, "grad_norm": 12.8125, "learning_rate": 4.997079633973929e-05, "loss": 1.9715444564819335, "mean_token_accuracy": 0.5856408469378949, "num_tokens": 4063465.0, "step": 2060 }, { "entropy": 1.829633817076683, "epoch": 0.0592927831803274, "grad_norm": 10.4375, "learning_rate": 4.997024231289943e-05, "loss": 1.9249038696289062, "mean_token_accuracy": 0.5929070865735412, "num_tokens": 4082738.0, "step": 2070 }, { "entropy": 2.029878391325474, "epoch": 0.05957922174641594, "grad_norm": 10.5625, "learning_rate": 4.996968308319316e-05, "loss": 2.1039791107177734, "mean_token_accuracy": 0.5622795660048723, "num_tokens": 4101747.0, "step": 2080 }, { "entropy": 1.8725275248289108, "epoch": 0.059865660312504475, "grad_norm": 11.75, "learning_rate": 4.9969118650737004e-05, "loss": 1.906928253173828, "mean_token_accuracy": 0.6090848710387945, "num_tokens": 4121976.0, "step": 2090 }, { "entropy": 1.9075307242572308, "epoch": 0.06015209887859301, "grad_norm": 11.875, "learning_rate": 4.9968549015648576e-05, "loss": 2.0786325454711916, "mean_token_accuracy": 0.5623055983334779, "num_tokens": 4140873.0, "step": 2100 }, { "entropy": 1.7441140189766884, "epoch": 0.06043853744468155, "grad_norm": 11.625, "learning_rate": 4.996797417804656e-05, "loss": 1.8118831634521484, "mean_token_accuracy": 0.6088214486837387, "num_tokens": 4159590.0, "step": 2110 }, { "entropy": 1.8769513357430696, "epoch": 0.06072497601077009, "grad_norm": 11.25, "learning_rate": 4.996739413805072e-05, "loss": 1.9912311553955078, "mean_token_accuracy": 0.5811572030186654, "num_tokens": 4180937.0, "step": 2120 }, { "entropy": 1.9944736510515213, "epoch": 0.06101141457685863, "grad_norm": 18.625, "learning_rate": 4.996680889578193e-05, "loss": 2.0236806869506836, "mean_token_accuracy": 0.5700880959630013, "num_tokens": 4200933.0, "step": 2130 }, { "entropy": 1.6624108001589775, "epoch": 0.06129785314294717, "grad_norm": 12.875, "learning_rate": 4.996621845136213e-05, "loss": 1.8008182525634766, "mean_token_accuracy": 0.6165046537294984, "num_tokens": 4220649.0, "step": 2140 }, { "entropy": 1.9939217180013658, "epoch": 0.061584291709035704, "grad_norm": 13.75, "learning_rate": 4.9965622804914344e-05, "loss": 2.1022857666015624, "mean_token_accuracy": 0.5655762797221542, "num_tokens": 4240827.0, "step": 2150 }, { "entropy": 1.881871872395277, "epoch": 0.06187073027512424, "grad_norm": 9.375, "learning_rate": 4.9965021956562674e-05, "loss": 1.9296346664428712, "mean_token_accuracy": 0.6011112701147795, "num_tokens": 4262156.0, "step": 2160 }, { "entropy": 1.8640183731913567, "epoch": 0.06215716884121278, "grad_norm": 11.4375, "learning_rate": 4.996441590643233e-05, "loss": 2.024766540527344, "mean_token_accuracy": 0.5818479772657156, "num_tokens": 4281067.0, "step": 2170 }, { "entropy": 1.877857768535614, "epoch": 0.062443607407301316, "grad_norm": 9.3125, "learning_rate": 4.996380465464959e-05, "loss": 1.973579216003418, "mean_token_accuracy": 0.6007902212440968, "num_tokens": 4302265.0, "step": 2180 }, { "entropy": 1.8153230141848327, "epoch": 0.06273004597338985, "grad_norm": 13.1875, "learning_rate": 4.9963188201341795e-05, "loss": 1.9394966125488282, "mean_token_accuracy": 0.6073149384930729, "num_tokens": 4320549.0, "step": 2190 }, { "entropy": 1.947351810336113, "epoch": 0.06301648453947839, "grad_norm": 12.375, "learning_rate": 4.996256654663742e-05, "loss": 1.9659574508666993, "mean_token_accuracy": 0.5926310716196894, "num_tokens": 4341293.0, "step": 2200 }, { "entropy": 1.815236010402441, "epoch": 0.06330292310556693, "grad_norm": 7.96875, "learning_rate": 4.996193969066597e-05, "loss": 1.9169052124023438, "mean_token_accuracy": 0.5960832234472037, "num_tokens": 4362117.0, "step": 2210 }, { "entropy": 1.8823579348623753, "epoch": 0.06358936167165548, "grad_norm": 16.5, "learning_rate": 4.996130763355808e-05, "loss": 1.961000633239746, "mean_token_accuracy": 0.5924124475568533, "num_tokens": 4382054.0, "step": 2220 }, { "entropy": 1.7910111367702484, "epoch": 0.06387580023774402, "grad_norm": 12.8125, "learning_rate": 4.996067037544542e-05, "loss": 1.8757230758666992, "mean_token_accuracy": 0.597107907012105, "num_tokens": 4400596.0, "step": 2230 }, { "entropy": 1.8231641046702862, "epoch": 0.06416223880383255, "grad_norm": 11.6875, "learning_rate": 4.9960027916460785e-05, "loss": 1.9751651763916016, "mean_token_accuracy": 0.601635891199112, "num_tokens": 4419627.0, "step": 2240 }, { "entropy": 1.837186548113823, "epoch": 0.06444867736992109, "grad_norm": 10.5625, "learning_rate": 4.995938025673805e-05, "loss": 1.8203306198120117, "mean_token_accuracy": 0.6274783156812191, "num_tokens": 4439004.0, "step": 2250 }, { "entropy": 1.7538263626396655, "epoch": 0.06473511593600963, "grad_norm": 9.3125, "learning_rate": 4.995872739641215e-05, "loss": 1.9434621810913086, "mean_token_accuracy": 0.5958845272660256, "num_tokens": 4460721.0, "step": 2260 }, { "entropy": 1.823099322617054, "epoch": 0.06502155450209816, "grad_norm": 9.75, "learning_rate": 4.995806933561912e-05, "loss": 1.834269905090332, "mean_token_accuracy": 0.6187158718705177, "num_tokens": 4480791.0, "step": 2270 }, { "entropy": 1.8298480186611414, "epoch": 0.0653079930681867, "grad_norm": 11.375, "learning_rate": 4.995740607449608e-05, "loss": 1.912055206298828, "mean_token_accuracy": 0.5971175793558359, "num_tokens": 4500673.0, "step": 2280 }, { "entropy": 1.8175236236304044, "epoch": 0.06559443163427524, "grad_norm": 10.25, "learning_rate": 4.995673761318123e-05, "loss": 1.8878864288330077, "mean_token_accuracy": 0.6076633669435978, "num_tokens": 4519884.0, "step": 2290 }, { "entropy": 1.757424382865429, "epoch": 0.06588087020036378, "grad_norm": 14.5625, "learning_rate": 4.9956063951813836e-05, "loss": 1.8500144958496094, "mean_token_accuracy": 0.6129124265164136, "num_tokens": 4539975.0, "step": 2300 }, { "entropy": 1.7447815477848052, "epoch": 0.06616730876645231, "grad_norm": 12.6875, "learning_rate": 4.995538509053428e-05, "loss": 1.9476245880126952, "mean_token_accuracy": 0.5854702297598123, "num_tokens": 4559907.0, "step": 2310 }, { "entropy": 1.7929293140769005, "epoch": 0.06645374733254085, "grad_norm": 16.375, "learning_rate": 4.9954701029484e-05, "loss": 1.8017602920532227, "mean_token_accuracy": 0.6247454103082418, "num_tokens": 4579395.0, "step": 2320 }, { "entropy": 1.840090711414814, "epoch": 0.06674018589862939, "grad_norm": 8.6875, "learning_rate": 4.9954011768805545e-05, "loss": 1.9241155624389648, "mean_token_accuracy": 0.5975760428234935, "num_tokens": 4598245.0, "step": 2330 }, { "entropy": 1.8547099135816096, "epoch": 0.06702662446471792, "grad_norm": 8.3125, "learning_rate": 4.995331730864251e-05, "loss": 2.01320858001709, "mean_token_accuracy": 0.5943611957132816, "num_tokens": 4618823.0, "step": 2340 }, { "entropy": 2.012850197404623, "epoch": 0.06731306303080646, "grad_norm": 9.4375, "learning_rate": 4.995261764913961e-05, "loss": 1.9893373489379882, "mean_token_accuracy": 0.5957473564893008, "num_tokens": 4637793.0, "step": 2350 }, { "entropy": 1.76784438341856, "epoch": 0.06759950159689501, "grad_norm": 10.1875, "learning_rate": 4.995191279044262e-05, "loss": 1.9172800064086915, "mean_token_accuracy": 0.5817941173911094, "num_tokens": 4657814.0, "step": 2360 }, { "entropy": 1.7323622293770313, "epoch": 0.06788594016298355, "grad_norm": 14.625, "learning_rate": 4.995120273269842e-05, "loss": 1.8140583038330078, "mean_token_accuracy": 0.6260790122672916, "num_tokens": 4676346.0, "step": 2370 }, { "entropy": 1.83290024548769, "epoch": 0.06817237872907209, "grad_norm": 11.375, "learning_rate": 4.995048747605494e-05, "loss": 1.9392313003540038, "mean_token_accuracy": 0.588176003843546, "num_tokens": 4694953.0, "step": 2380 }, { "entropy": 1.8222525171935557, "epoch": 0.06845881729516062, "grad_norm": 10.9375, "learning_rate": 4.994976702066123e-05, "loss": 1.8721160888671875, "mean_token_accuracy": 0.5986452177166939, "num_tokens": 4714501.0, "step": 2390 }, { "entropy": 1.7743729643523694, "epoch": 0.06874525586124916, "grad_norm": 9.5625, "learning_rate": 4.9949041366667394e-05, "loss": 1.8765153884887695, "mean_token_accuracy": 0.6184959661215543, "num_tokens": 4734392.0, "step": 2400 }, { "entropy": 1.8153611175715922, "epoch": 0.0690316944273377, "grad_norm": 15.125, "learning_rate": 4.994831051422464e-05, "loss": 1.9120668411254882, "mean_token_accuracy": 0.5987484376877547, "num_tokens": 4754689.0, "step": 2410 }, { "entropy": 1.846549166738987, "epoch": 0.06931813299342623, "grad_norm": 12.5, "learning_rate": 4.994757446348524e-05, "loss": 1.9954065322875976, "mean_token_accuracy": 0.5823904737830162, "num_tokens": 4774115.0, "step": 2420 }, { "entropy": 1.7396523296833037, "epoch": 0.06960457155951477, "grad_norm": 8.9375, "learning_rate": 4.9946833214602565e-05, "loss": 1.7574817657470703, "mean_token_accuracy": 0.6228158086538315, "num_tokens": 4795914.0, "step": 2430 }, { "entropy": 1.7804276674985886, "epoch": 0.06989101012560331, "grad_norm": 12.9375, "learning_rate": 4.994608676773107e-05, "loss": 1.8207117080688477, "mean_token_accuracy": 0.617691895738244, "num_tokens": 4815550.0, "step": 2440 }, { "entropy": 1.762260028719902, "epoch": 0.07017744869169185, "grad_norm": 10.875, "learning_rate": 4.994533512302627e-05, "loss": 1.8566402435302733, "mean_token_accuracy": 0.5982673525810241, "num_tokens": 4834642.0, "step": 2450 }, { "entropy": 1.671261265128851, "epoch": 0.07046388725778038, "grad_norm": 10.5, "learning_rate": 4.99445782806448e-05, "loss": 1.8638725280761719, "mean_token_accuracy": 0.6134916298091412, "num_tokens": 4854008.0, "step": 2460 }, { "entropy": 1.8840367905795574, "epoch": 0.07075032582386892, "grad_norm": 9.8125, "learning_rate": 4.9943816240744346e-05, "loss": 1.9149871826171876, "mean_token_accuracy": 0.5981070324778557, "num_tokens": 4873434.0, "step": 2470 }, { "entropy": 1.8419511586427688, "epoch": 0.07103676438995746, "grad_norm": 9.625, "learning_rate": 4.994304900348369e-05, "loss": 1.837874412536621, "mean_token_accuracy": 0.6224506478756666, "num_tokens": 4893087.0, "step": 2480 }, { "entropy": 1.7017809920012952, "epoch": 0.07132320295604601, "grad_norm": 10.4375, "learning_rate": 4.994227656902269e-05, "loss": 1.838263702392578, "mean_token_accuracy": 0.6109026603400707, "num_tokens": 4912363.0, "step": 2490 }, { "entropy": 1.828787763416767, "epoch": 0.07160964152213455, "grad_norm": 9.25, "learning_rate": 4.994149893752231e-05, "loss": 2.001331329345703, "mean_token_accuracy": 0.5902357619255781, "num_tokens": 4931432.0, "step": 2500 }, { "entropy": 1.7498065806925296, "epoch": 0.07189608008822308, "grad_norm": 9.5625, "learning_rate": 4.994071610914456e-05, "loss": 1.685750389099121, "mean_token_accuracy": 0.6296104624867439, "num_tokens": 4950916.0, "step": 2510 }, { "entropy": 1.7557595752179622, "epoch": 0.07218251865431162, "grad_norm": 13.8125, "learning_rate": 4.993992808405256e-05, "loss": 1.9015703201293945, "mean_token_accuracy": 0.6091135945171118, "num_tokens": 4970433.0, "step": 2520 }, { "entropy": 1.7408047266304494, "epoch": 0.07246895722040016, "grad_norm": 11.0, "learning_rate": 4.993913486241051e-05, "loss": 1.8769393920898438, "mean_token_accuracy": 0.6036487333476543, "num_tokens": 4990769.0, "step": 2530 }, { "entropy": 1.8650392189621925, "epoch": 0.0727553957864887, "grad_norm": 12.5, "learning_rate": 4.993833644438368e-05, "loss": 1.8982149124145509, "mean_token_accuracy": 0.6078139618039131, "num_tokens": 5011191.0, "step": 2540 }, { "entropy": 1.6541506234556436, "epoch": 0.07304183435257723, "grad_norm": 10.1875, "learning_rate": 4.9937532830138436e-05, "loss": 1.6678089141845702, "mean_token_accuracy": 0.6447409730404615, "num_tokens": 5032349.0, "step": 2550 }, { "entropy": 1.681502054259181, "epoch": 0.07332827291866577, "grad_norm": 14.625, "learning_rate": 4.993672401984222e-05, "loss": 1.8666999816894532, "mean_token_accuracy": 0.6053219188004733, "num_tokens": 5053087.0, "step": 2560 }, { "entropy": 1.5955466687679292, "epoch": 0.0736147114847543, "grad_norm": 13.125, "learning_rate": 4.9935910013663554e-05, "loss": 1.631696891784668, "mean_token_accuracy": 0.6485393714159727, "num_tokens": 5072577.0, "step": 2570 }, { "entropy": 1.7683854140341282, "epoch": 0.07390115005084284, "grad_norm": 11.75, "learning_rate": 4.993509081177205e-05, "loss": 1.8348590850830078, "mean_token_accuracy": 0.6120606031268835, "num_tokens": 5091809.0, "step": 2580 }, { "entropy": 1.64336349517107, "epoch": 0.07418758861693138, "grad_norm": 11.75, "learning_rate": 4.99342664143384e-05, "loss": 1.7510248184204102, "mean_token_accuracy": 0.6331697985529899, "num_tokens": 5111043.0, "step": 2590 }, { "entropy": 1.8232658706605434, "epoch": 0.07447402718301992, "grad_norm": 8.9375, "learning_rate": 4.993343682153437e-05, "loss": 1.8883161544799805, "mean_token_accuracy": 0.6126664072275162, "num_tokens": 5130766.0, "step": 2600 }, { "entropy": 1.713892677426338, "epoch": 0.07476046574910845, "grad_norm": 17.75, "learning_rate": 4.9932602033532824e-05, "loss": 1.7505222320556642, "mean_token_accuracy": 0.6276527978479862, "num_tokens": 5150625.0, "step": 2610 }, { "entropy": 1.637095182389021, "epoch": 0.075046904315197, "grad_norm": 11.3125, "learning_rate": 4.9931762050507705e-05, "loss": 1.7237468719482423, "mean_token_accuracy": 0.6427792329341173, "num_tokens": 5169898.0, "step": 2620 }, { "entropy": 1.7508811518549918, "epoch": 0.07533334288128554, "grad_norm": 9.3125, "learning_rate": 4.993091687263403e-05, "loss": 1.907511329650879, "mean_token_accuracy": 0.6170182578265667, "num_tokens": 5190039.0, "step": 2630 }, { "entropy": 1.8437795139849187, "epoch": 0.07561978144737408, "grad_norm": 12.3125, "learning_rate": 4.993006650008789e-05, "loss": 1.8318609237670898, "mean_token_accuracy": 0.6023694450035691, "num_tokens": 5210247.0, "step": 2640 }, { "entropy": 1.6756767228245735, "epoch": 0.07590622001346262, "grad_norm": 10.5625, "learning_rate": 4.992921093304649e-05, "loss": 1.814997100830078, "mean_token_accuracy": 0.6139365989714861, "num_tokens": 5229421.0, "step": 2650 }, { "entropy": 1.7465621680021286, "epoch": 0.07619265857955115, "grad_norm": 14.1875, "learning_rate": 4.992835017168809e-05, "loss": 1.7556392669677734, "mean_token_accuracy": 0.6323899663984776, "num_tokens": 5248920.0, "step": 2660 }, { "entropy": 1.6148886807262897, "epoch": 0.07647909714563969, "grad_norm": 12.3125, "learning_rate": 4.9927484216192036e-05, "loss": 1.7459449768066406, "mean_token_accuracy": 0.6273711193352938, "num_tokens": 5268690.0, "step": 2670 }, { "entropy": 1.7831590503454209, "epoch": 0.07676553571172823, "grad_norm": 11.8125, "learning_rate": 4.9926613066738755e-05, "loss": 1.8846384048461915, "mean_token_accuracy": 0.594828499853611, "num_tokens": 5288176.0, "step": 2680 }, { "entropy": 1.7635230794548988, "epoch": 0.07705197427781676, "grad_norm": 12.875, "learning_rate": 4.992573672350979e-05, "loss": 1.8495376586914063, "mean_token_accuracy": 0.6183344263583421, "num_tokens": 5308317.0, "step": 2690 }, { "entropy": 1.746929007023573, "epoch": 0.0773384128439053, "grad_norm": 8.25, "learning_rate": 4.9924855186687705e-05, "loss": 1.816206169128418, "mean_token_accuracy": 0.6279907550662756, "num_tokens": 5327759.0, "step": 2700 }, { "entropy": 1.8997233137488365, "epoch": 0.07762485140999384, "grad_norm": 14.625, "learning_rate": 4.992396845645621e-05, "loss": 2.018978309631348, "mean_token_accuracy": 0.5832574477419257, "num_tokens": 5346568.0, "step": 2710 }, { "entropy": 1.7992750965058804, "epoch": 0.07791128997608238, "grad_norm": 11.3125, "learning_rate": 4.992307653300003e-05, "loss": 1.8099502563476562, "mean_token_accuracy": 0.6049119036644697, "num_tokens": 5365573.0, "step": 2720 }, { "entropy": 1.7343350291252135, "epoch": 0.07819772854217091, "grad_norm": 11.5625, "learning_rate": 4.9922179416505044e-05, "loss": 1.86175479888916, "mean_token_accuracy": 0.6017268471419811, "num_tokens": 5385460.0, "step": 2730 }, { "entropy": 1.8600797936320306, "epoch": 0.07848416710825945, "grad_norm": 10.0625, "learning_rate": 4.992127710715817e-05, "loss": 1.8717761993408204, "mean_token_accuracy": 0.604049276560545, "num_tokens": 5406548.0, "step": 2740 }, { "entropy": 1.6443809218704701, "epoch": 0.07877060567434799, "grad_norm": 9.0625, "learning_rate": 4.9920369605147394e-05, "loss": 1.7614917755126953, "mean_token_accuracy": 0.616263660043478, "num_tokens": 5426253.0, "step": 2750 }, { "entropy": 1.617201566696167, "epoch": 0.07905704424043654, "grad_norm": 9.0, "learning_rate": 4.991945691066183e-05, "loss": 1.7047906875610352, "mean_token_accuracy": 0.632831609621644, "num_tokens": 5445019.0, "step": 2760 }, { "entropy": 1.8553661078214645, "epoch": 0.07934348280652508, "grad_norm": 7.0625, "learning_rate": 4.991853902389163e-05, "loss": 1.940587043762207, "mean_token_accuracy": 0.6004931338131427, "num_tokens": 5466361.0, "step": 2770 }, { "entropy": 1.9773833863437176, "epoch": 0.07962992137261361, "grad_norm": 9.125, "learning_rate": 4.9917615945028065e-05, "loss": 2.0119298934936523, "mean_token_accuracy": 0.5790961310267448, "num_tokens": 5486732.0, "step": 2780 }, { "entropy": 1.6732374832034111, "epoch": 0.07991635993870215, "grad_norm": 11.375, "learning_rate": 4.991668767426346e-05, "loss": 1.7327560424804687, "mean_token_accuracy": 0.6331372715532779, "num_tokens": 5505057.0, "step": 2790 }, { "entropy": 1.6872285589575768, "epoch": 0.08020279850479069, "grad_norm": 9.3125, "learning_rate": 4.991575421179123e-05, "loss": 1.7661176681518556, "mean_token_accuracy": 0.6337466925382614, "num_tokens": 5524765.0, "step": 2800 }, { "entropy": 1.7016744412481786, "epoch": 0.08048923707087922, "grad_norm": 9.1875, "learning_rate": 4.991481555780589e-05, "loss": 1.7514514923095703, "mean_token_accuracy": 0.6232207585126162, "num_tokens": 5544812.0, "step": 2810 }, { "entropy": 1.7252783011645079, "epoch": 0.08077567563696776, "grad_norm": 7.34375, "learning_rate": 4.9913871712503004e-05, "loss": 1.8788469314575196, "mean_token_accuracy": 0.6168043747544288, "num_tokens": 5564982.0, "step": 2820 }, { "entropy": 1.627824354916811, "epoch": 0.0810621142030563, "grad_norm": 12.4375, "learning_rate": 4.991292267607923e-05, "loss": 1.6839054107666016, "mean_token_accuracy": 0.63603176176548, "num_tokens": 5584267.0, "step": 2830 }, { "entropy": 1.6540647119283676, "epoch": 0.08134855276914484, "grad_norm": 11.375, "learning_rate": 4.9911968448732324e-05, "loss": 1.6764236450195313, "mean_token_accuracy": 0.6303022615611553, "num_tokens": 5604387.0, "step": 2840 }, { "entropy": 1.6972127817571163, "epoch": 0.08163499133523337, "grad_norm": 16.375, "learning_rate": 4.991100903066112e-05, "loss": 1.7772232055664063, "mean_token_accuracy": 0.6358709968626499, "num_tokens": 5623185.0, "step": 2850 }, { "entropy": 1.7593320779502393, "epoch": 0.08192142990132191, "grad_norm": 12.75, "learning_rate": 4.9910044422065495e-05, "loss": 1.807419204711914, "mean_token_accuracy": 0.6225467007607222, "num_tokens": 5641660.0, "step": 2860 }, { "entropy": 1.6534669509157538, "epoch": 0.08220786846741045, "grad_norm": 8.8125, "learning_rate": 4.9909074623146454e-05, "loss": 1.7458194732666015, "mean_token_accuracy": 0.6239213116467, "num_tokens": 5660939.0, "step": 2870 }, { "entropy": 1.7411190815269948, "epoch": 0.08249430703349898, "grad_norm": 9.0, "learning_rate": 4.9908099634106084e-05, "loss": 1.8914546966552734, "mean_token_accuracy": 0.6045034378767014, "num_tokens": 5680371.0, "step": 2880 }, { "entropy": 1.8807879753410817, "epoch": 0.08278074559958754, "grad_norm": 13.5, "learning_rate": 4.990711945514751e-05, "loss": 1.9603790283203124, "mean_token_accuracy": 0.59328673183918, "num_tokens": 5700817.0, "step": 2890 }, { "entropy": 1.7275540959089994, "epoch": 0.08306718416567607, "grad_norm": 10.25, "learning_rate": 4.9906134086474975e-05, "loss": 1.8055536270141601, "mean_token_accuracy": 0.6184068739414215, "num_tokens": 5722036.0, "step": 2900 }, { "entropy": 1.7929349288344383, "epoch": 0.08335362273176461, "grad_norm": 8.625, "learning_rate": 4.9905143528293794e-05, "loss": 1.8911727905273437, "mean_token_accuracy": 0.6066431190818549, "num_tokens": 5743145.0, "step": 2910 }, { "entropy": 1.6432476229965687, "epoch": 0.08364006129785315, "grad_norm": 13.5625, "learning_rate": 4.990414778081037e-05, "loss": 1.5889147758483886, "mean_token_accuracy": 0.6647788506001234, "num_tokens": 5762275.0, "step": 2920 }, { "entropy": 1.7077577784657478, "epoch": 0.08392649986394168, "grad_norm": 9.0, "learning_rate": 4.990314684423216e-05, "loss": 1.9012144088745118, "mean_token_accuracy": 0.6113692533224822, "num_tokens": 5781647.0, "step": 2930 }, { "entropy": 1.8442125141620636, "epoch": 0.08421293843003022, "grad_norm": 10.25, "learning_rate": 4.990214071876774e-05, "loss": 1.9046855926513673, "mean_token_accuracy": 0.6001397427171469, "num_tokens": 5801299.0, "step": 2940 }, { "entropy": 1.8405231080949307, "epoch": 0.08449937699611876, "grad_norm": 12.625, "learning_rate": 4.990112940462673e-05, "loss": 1.8744390487670899, "mean_token_accuracy": 0.6011014070361853, "num_tokens": 5821261.0, "step": 2950 }, { "entropy": 1.7371204309165478, "epoch": 0.0847858155622073, "grad_norm": 10.5625, "learning_rate": 4.990011290201987e-05, "loss": 1.8446439743041991, "mean_token_accuracy": 0.6221200305968523, "num_tokens": 5839076.0, "step": 2960 }, { "entropy": 1.7352172512561084, "epoch": 0.08507225412829583, "grad_norm": 13.0625, "learning_rate": 4.989909121115896e-05, "loss": 1.8494783401489259, "mean_token_accuracy": 0.609843698143959, "num_tokens": 5859082.0, "step": 2970 }, { "entropy": 1.8165854930877685, "epoch": 0.08535869269438437, "grad_norm": 9.25, "learning_rate": 4.9898064332256863e-05, "loss": 1.932807159423828, "mean_token_accuracy": 0.5868445619940758, "num_tokens": 5879881.0, "step": 2980 }, { "entropy": 1.8055683925747872, "epoch": 0.0856451312604729, "grad_norm": 10.125, "learning_rate": 4.9897032265527564e-05, "loss": 1.8408864974975585, "mean_token_accuracy": 0.6175807427614928, "num_tokens": 5899454.0, "step": 2990 }, { "entropy": 1.8551389299333096, "epoch": 0.08593156982656144, "grad_norm": 10.9375, "learning_rate": 4.989599501118609e-05, "loss": 1.9585966110229491, "mean_token_accuracy": 0.6069829035550356, "num_tokens": 5918680.0, "step": 3000 }, { "entropy": 1.8998742889612914, "epoch": 0.08621800839264998, "grad_norm": 11.8125, "learning_rate": 4.9894952569448586e-05, "loss": 1.9223085403442384, "mean_token_accuracy": 0.6017805133014917, "num_tokens": 5938586.0, "step": 3010 }, { "entropy": 1.7115729860961437, "epoch": 0.08650444695873852, "grad_norm": 10.125, "learning_rate": 4.989390494053223e-05, "loss": 1.7946624755859375, "mean_token_accuracy": 0.6222159150987864, "num_tokens": 5958385.0, "step": 3020 }, { "entropy": 1.7438877299427986, "epoch": 0.08679088552482707, "grad_norm": 10.9375, "learning_rate": 4.989285212465533e-05, "loss": 1.8417003631591797, "mean_token_accuracy": 0.6071909379214049, "num_tokens": 5979957.0, "step": 3030 }, { "entropy": 1.7134101435542106, "epoch": 0.0870773240909156, "grad_norm": 10.75, "learning_rate": 4.989179412203725e-05, "loss": 1.8356204986572267, "mean_token_accuracy": 0.6159730419516564, "num_tokens": 5999711.0, "step": 3040 }, { "entropy": 1.8474023260176182, "epoch": 0.08736376265700414, "grad_norm": 9.6875, "learning_rate": 4.989073093289844e-05, "loss": 1.8112276077270508, "mean_token_accuracy": 0.6077834688127041, "num_tokens": 6020635.0, "step": 3050 }, { "entropy": 1.8343049257993698, "epoch": 0.08765020122309268, "grad_norm": 10.25, "learning_rate": 4.988966255746042e-05, "loss": 1.9215509414672851, "mean_token_accuracy": 0.599896739795804, "num_tokens": 6039040.0, "step": 3060 }, { "entropy": 1.7826895229518414, "epoch": 0.08793663978918122, "grad_norm": 12.9375, "learning_rate": 4.988858899594581e-05, "loss": 1.8142948150634766, "mean_token_accuracy": 0.6235730387270451, "num_tokens": 6057807.0, "step": 3070 }, { "entropy": 1.6476876836270093, "epoch": 0.08822307835526975, "grad_norm": 8.125, "learning_rate": 4.988751024857829e-05, "loss": 1.789759635925293, "mean_token_accuracy": 0.6290214776992797, "num_tokens": 6076905.0, "step": 3080 }, { "entropy": 1.6936001196503638, "epoch": 0.08850951692135829, "grad_norm": 8.4375, "learning_rate": 4.988642631558264e-05, "loss": 1.7730207443237305, "mean_token_accuracy": 0.6257806573063135, "num_tokens": 6095746.0, "step": 3090 }, { "entropy": 1.7270611174404622, "epoch": 0.08879595548744683, "grad_norm": 9.0, "learning_rate": 4.98853371971847e-05, "loss": 1.819589614868164, "mean_token_accuracy": 0.6188563484698534, "num_tokens": 6116052.0, "step": 3100 }, { "entropy": 1.8175524927675724, "epoch": 0.08908239405353537, "grad_norm": 9.25, "learning_rate": 4.988424289361141e-05, "loss": 1.8551971435546875, "mean_token_accuracy": 0.6094944890588522, "num_tokens": 6135285.0, "step": 3110 }, { "entropy": 1.7288947857916355, "epoch": 0.0893688326196239, "grad_norm": 9.8125, "learning_rate": 4.9883143405090784e-05, "loss": 1.7936229705810547, "mean_token_accuracy": 0.6098865497857332, "num_tokens": 6154259.0, "step": 3120 }, { "entropy": 1.611307594552636, "epoch": 0.08965527118571244, "grad_norm": 11.8125, "learning_rate": 4.988203873185191e-05, "loss": 1.7600465774536134, "mean_token_accuracy": 0.6320841744542122, "num_tokens": 6174081.0, "step": 3130 }, { "entropy": 1.6638292074203491, "epoch": 0.08994170975180098, "grad_norm": 10.5, "learning_rate": 4.988092887412495e-05, "loss": 1.6762691497802735, "mean_token_accuracy": 0.6358845584094525, "num_tokens": 6193541.0, "step": 3140 }, { "entropy": 1.5803929798305034, "epoch": 0.09022814831788951, "grad_norm": 8.5, "learning_rate": 4.9879813832141185e-05, "loss": 1.674459457397461, "mean_token_accuracy": 0.6354668751358986, "num_tokens": 6213759.0, "step": 3150 }, { "entropy": 1.7594450511038304, "epoch": 0.09051458688397807, "grad_norm": 10.1875, "learning_rate": 4.987869360613293e-05, "loss": 1.871511459350586, "mean_token_accuracy": 0.6030887488275767, "num_tokens": 6232815.0, "step": 3160 }, { "entropy": 1.6973014652729035, "epoch": 0.0908010254500666, "grad_norm": 8.3125, "learning_rate": 4.987756819633359e-05, "loss": 1.7109146118164062, "mean_token_accuracy": 0.6301996454596519, "num_tokens": 6251993.0, "step": 3170 }, { "entropy": 1.6076964747160674, "epoch": 0.09108746401615514, "grad_norm": 11.375, "learning_rate": 4.987643760297768e-05, "loss": 1.641105842590332, "mean_token_accuracy": 0.6567545875906944, "num_tokens": 6272072.0, "step": 3180 }, { "entropy": 1.595090302079916, "epoch": 0.09137390258224368, "grad_norm": 14.5, "learning_rate": 4.9875301826300755e-05, "loss": 1.7908584594726562, "mean_token_accuracy": 0.6292324867099524, "num_tokens": 6291189.0, "step": 3190 }, { "entropy": 1.8106674984097482, "epoch": 0.09166034114833221, "grad_norm": 9.5625, "learning_rate": 4.9874160866539474e-05, "loss": 1.8661542892456056, "mean_token_accuracy": 0.6143469832837581, "num_tokens": 6310702.0, "step": 3200 }, { "entropy": 1.6575596556067467, "epoch": 0.09194677971442075, "grad_norm": 9.4375, "learning_rate": 4.987301472393157e-05, "loss": 1.7238683700561523, "mean_token_accuracy": 0.6423762965947389, "num_tokens": 6330808.0, "step": 3210 }, { "entropy": 1.6653618112206459, "epoch": 0.09223321828050929, "grad_norm": 13.3125, "learning_rate": 4.987186339871586e-05, "loss": 1.7727434158325195, "mean_token_accuracy": 0.635314765572548, "num_tokens": 6351021.0, "step": 3220 }, { "entropy": 1.610061589628458, "epoch": 0.09251965684659783, "grad_norm": 9.1875, "learning_rate": 4.9870706891132233e-05, "loss": 1.670724105834961, "mean_token_accuracy": 0.6369951967149973, "num_tokens": 6371075.0, "step": 3230 }, { "entropy": 1.7065989926457406, "epoch": 0.09280609541268636, "grad_norm": 11.375, "learning_rate": 4.9869545201421674e-05, "loss": 1.7772294998168945, "mean_token_accuracy": 0.6219883508980274, "num_tokens": 6390917.0, "step": 3240 }, { "entropy": 1.673648745007813, "epoch": 0.0930925339787749, "grad_norm": 8.9375, "learning_rate": 4.986837832982622e-05, "loss": 1.7278858184814454, "mean_token_accuracy": 0.623109820112586, "num_tokens": 6411001.0, "step": 3250 }, { "entropy": 1.7488887436687945, "epoch": 0.09337897254486344, "grad_norm": 11.9375, "learning_rate": 4.9867206276589006e-05, "loss": 1.89287109375, "mean_token_accuracy": 0.6046258065849542, "num_tokens": 6429414.0, "step": 3260 }, { "entropy": 1.7951447792351245, "epoch": 0.09366541111095197, "grad_norm": 11.875, "learning_rate": 4.9866029041954246e-05, "loss": 1.825006103515625, "mean_token_accuracy": 0.6126693487167358, "num_tokens": 6449990.0, "step": 3270 }, { "entropy": 1.7055876299738884, "epoch": 0.09395184967704051, "grad_norm": 11.3125, "learning_rate": 4.986484662616724e-05, "loss": 1.7274944305419921, "mean_token_accuracy": 0.6351925080642105, "num_tokens": 6470278.0, "step": 3280 }, { "entropy": 1.698704645037651, "epoch": 0.09423828824312905, "grad_norm": 14.0625, "learning_rate": 4.9863659029474344e-05, "loss": 1.854669952392578, "mean_token_accuracy": 0.6096575729548931, "num_tokens": 6489941.0, "step": 3290 }, { "entropy": 1.6474793441593647, "epoch": 0.0945247268092176, "grad_norm": 10.25, "learning_rate": 4.986246625212303e-05, "loss": 1.720954704284668, "mean_token_accuracy": 0.6335517570376397, "num_tokens": 6508114.0, "step": 3300 }, { "entropy": 1.6180988121777773, "epoch": 0.09481116537530614, "grad_norm": 9.0625, "learning_rate": 4.986126829436181e-05, "loss": 1.6974006652832032, "mean_token_accuracy": 0.6366110194474459, "num_tokens": 6527533.0, "step": 3310 }, { "entropy": 1.6719712637364865, "epoch": 0.09509760394139467, "grad_norm": 13.0, "learning_rate": 4.9860065156440295e-05, "loss": 1.7705236434936524, "mean_token_accuracy": 0.6281975015997887, "num_tokens": 6546758.0, "step": 3320 }, { "entropy": 1.6859460651874543, "epoch": 0.09538404250748321, "grad_norm": 9.625, "learning_rate": 4.985885683860918e-05, "loss": 1.7235284805297852, "mean_token_accuracy": 0.6323164828121662, "num_tokens": 6566701.0, "step": 3330 }, { "entropy": 1.8225383676588536, "epoch": 0.09567048107357175, "grad_norm": 10.375, "learning_rate": 4.985764334112023e-05, "loss": 1.8835548400878905, "mean_token_accuracy": 0.6049425881356001, "num_tokens": 6586244.0, "step": 3340 }, { "entropy": 1.6037709221243859, "epoch": 0.09595691963966028, "grad_norm": 10.9375, "learning_rate": 4.9856424664226295e-05, "loss": 1.6635082244873047, "mean_token_accuracy": 0.6288101118057966, "num_tokens": 6604512.0, "step": 3350 }, { "entropy": 1.664628365263343, "epoch": 0.09624335820574882, "grad_norm": 10.5625, "learning_rate": 4.9855200808181304e-05, "loss": 1.711388397216797, "mean_token_accuracy": 0.6356975879520178, "num_tokens": 6625014.0, "step": 3360 }, { "entropy": 1.7029705427587032, "epoch": 0.09652979677183736, "grad_norm": 11.75, "learning_rate": 4.985397177324026e-05, "loss": 1.8706041336059571, "mean_token_accuracy": 0.6043540142476559, "num_tokens": 6645301.0, "step": 3370 }, { "entropy": 1.7533822063356639, "epoch": 0.0968162353379259, "grad_norm": 7.71875, "learning_rate": 4.9852737559659245e-05, "loss": 1.7002222061157226, "mean_token_accuracy": 0.6346283335238695, "num_tokens": 6666406.0, "step": 3380 }, { "entropy": 1.5919454231858254, "epoch": 0.09710267390401443, "grad_norm": 12.0625, "learning_rate": 4.985149816769543e-05, "loss": 1.713643455505371, "mean_token_accuracy": 0.6311788672581315, "num_tokens": 6686285.0, "step": 3390 }, { "entropy": 1.5006841901689767, "epoch": 0.09738911247010297, "grad_norm": 12.1875, "learning_rate": 4.985025359760706e-05, "loss": 1.5002299308776856, "mean_token_accuracy": 0.6706645965576172, "num_tokens": 6705878.0, "step": 3400 }, { "entropy": 1.5395627930760383, "epoch": 0.09767555103619151, "grad_norm": 7.25, "learning_rate": 4.9849003849653435e-05, "loss": 1.6199533462524414, "mean_token_accuracy": 0.650242630019784, "num_tokens": 6726940.0, "step": 3410 }, { "entropy": 1.5471817657351494, "epoch": 0.09796198960228004, "grad_norm": 10.1875, "learning_rate": 4.984774892409499e-05, "loss": 1.6290157318115235, "mean_token_accuracy": 0.6466945555061102, "num_tokens": 6745927.0, "step": 3420 }, { "entropy": 1.6916074492037296, "epoch": 0.0982484281683686, "grad_norm": 10.1875, "learning_rate": 4.984648882119317e-05, "loss": 1.8082305908203125, "mean_token_accuracy": 0.6197715051472187, "num_tokens": 6765877.0, "step": 3430 }, { "entropy": 1.7348431102931499, "epoch": 0.09853486673445713, "grad_norm": 13.4375, "learning_rate": 4.984522354121055e-05, "loss": 1.7304534912109375, "mean_token_accuracy": 0.6302803590893745, "num_tokens": 6785495.0, "step": 3440 }, { "entropy": 1.644375092536211, "epoch": 0.09882130530054567, "grad_norm": 12.6875, "learning_rate": 4.9843953084410774e-05, "loss": 1.7694244384765625, "mean_token_accuracy": 0.6218827169388532, "num_tokens": 6804680.0, "step": 3450 }, { "entropy": 1.7094856541603805, "epoch": 0.09910774386663421, "grad_norm": 12.3125, "learning_rate": 4.984267745105855e-05, "loss": 1.7599742889404297, "mean_token_accuracy": 0.6293886683881282, "num_tokens": 6823407.0, "step": 3460 }, { "entropy": 1.5646884053945542, "epoch": 0.09939418243272274, "grad_norm": 10.5, "learning_rate": 4.984139664141967e-05, "loss": 1.5917807579040528, "mean_token_accuracy": 0.651865516602993, "num_tokens": 6843403.0, "step": 3470 }, { "entropy": 1.5828524824231862, "epoch": 0.09968062099881128, "grad_norm": 8.125, "learning_rate": 4.984011065576102e-05, "loss": 1.7056592941284179, "mean_token_accuracy": 0.6319200482219458, "num_tokens": 6863996.0, "step": 3480 }, { "entropy": 1.5854770459234715, "epoch": 0.09996705956489982, "grad_norm": 10.875, "learning_rate": 4.983881949435053e-05, "loss": 1.687114143371582, "mean_token_accuracy": 0.6348020933568478, "num_tokens": 6884193.0, "step": 3490 }, { "entropy": 1.6993172325193882, "epoch": 0.10025349813098836, "grad_norm": 7.0625, "learning_rate": 4.9837523157457246e-05, "loss": 1.7156557083129882, "mean_token_accuracy": 0.6427715122699738, "num_tokens": 6905445.0, "step": 3500 }, { "entropy": 1.6515631839632987, "epoch": 0.10053993669707689, "grad_norm": 10.0625, "learning_rate": 4.983622164535127e-05, "loss": 1.6537338256835938, "mean_token_accuracy": 0.6338998597115278, "num_tokens": 6925008.0, "step": 3510 }, { "entropy": 1.6213870584964751, "epoch": 0.10082637526316543, "grad_norm": 10.125, "learning_rate": 4.9834914958303794e-05, "loss": 1.828173828125, "mean_token_accuracy": 0.6133347254246473, "num_tokens": 6944815.0, "step": 3520 }, { "entropy": 1.7784586071968078, "epoch": 0.10111281382925397, "grad_norm": 15.5, "learning_rate": 4.983360309658708e-05, "loss": 1.8722478866577148, "mean_token_accuracy": 0.6086947064846754, "num_tokens": 6965037.0, "step": 3530 }, { "entropy": 1.8203211426734924, "epoch": 0.1013992523953425, "grad_norm": 7.90625, "learning_rate": 4.983228606047446e-05, "loss": 1.8089092254638672, "mean_token_accuracy": 0.6207359131425619, "num_tokens": 6985131.0, "step": 3540 }, { "entropy": 1.6216672886162997, "epoch": 0.10168569096143104, "grad_norm": 13.25, "learning_rate": 4.983096385024037e-05, "loss": 1.6625095367431642, "mean_token_accuracy": 0.6502947527915239, "num_tokens": 7004418.0, "step": 3550 }, { "entropy": 1.60721864849329, "epoch": 0.10197212952751959, "grad_norm": 15.75, "learning_rate": 4.9829636466160307e-05, "loss": 1.688064193725586, "mean_token_accuracy": 0.6488478925079108, "num_tokens": 7024109.0, "step": 3560 }, { "entropy": 1.5623432353138924, "epoch": 0.10225856809360813, "grad_norm": 9.375, "learning_rate": 4.982830390851084e-05, "loss": 1.7058576583862304, "mean_token_accuracy": 0.6410759892314672, "num_tokens": 7042737.0, "step": 3570 }, { "entropy": 1.7128427192568778, "epoch": 0.10254500665969667, "grad_norm": 10.75, "learning_rate": 4.982696617756963e-05, "loss": 1.7900766372680663, "mean_token_accuracy": 0.6258037876337766, "num_tokens": 7062429.0, "step": 3580 }, { "entropy": 1.745885034650564, "epoch": 0.1028314452257852, "grad_norm": 11.0, "learning_rate": 4.9825623273615416e-05, "loss": 1.81469669342041, "mean_token_accuracy": 0.6134201630949974, "num_tokens": 7081262.0, "step": 3590 }, { "entropy": 1.8495959386229515, "epoch": 0.10311788379187374, "grad_norm": 9.25, "learning_rate": 4.9824275196928006e-05, "loss": 1.8182167053222655, "mean_token_accuracy": 0.6066920112818479, "num_tokens": 7101046.0, "step": 3600 }, { "entropy": 1.5995587468147279, "epoch": 0.10340432235796228, "grad_norm": 13.625, "learning_rate": 4.982292194778828e-05, "loss": 1.7035053253173829, "mean_token_accuracy": 0.625184166803956, "num_tokens": 7121598.0, "step": 3610 }, { "entropy": 1.5674044363200665, "epoch": 0.10369076092405081, "grad_norm": 13.3125, "learning_rate": 4.982156352647821e-05, "loss": 1.6441669464111328, "mean_token_accuracy": 0.6342104159295558, "num_tokens": 7140583.0, "step": 3620 }, { "entropy": 1.7234221808612347, "epoch": 0.10397719949013935, "grad_norm": 10.25, "learning_rate": 4.982019993328084e-05, "loss": 1.8390151977539062, "mean_token_accuracy": 0.6153890393674374, "num_tokens": 7160170.0, "step": 3630 }, { "entropy": 1.7872201681137085, "epoch": 0.10426363805622789, "grad_norm": 9.1875, "learning_rate": 4.98188311684803e-05, "loss": 1.74482421875, "mean_token_accuracy": 0.6153182607144118, "num_tokens": 7180095.0, "step": 3640 }, { "entropy": 1.5389251604676246, "epoch": 0.10455007662231643, "grad_norm": 10.4375, "learning_rate": 4.9817457232361776e-05, "loss": 1.6207878112792968, "mean_token_accuracy": 0.647048769891262, "num_tokens": 7200375.0, "step": 3650 }, { "entropy": 1.5512934401631355, "epoch": 0.10483651518840496, "grad_norm": 12.5625, "learning_rate": 4.981607812521155e-05, "loss": 1.6449550628662108, "mean_token_accuracy": 0.6466568242758512, "num_tokens": 7219626.0, "step": 3660 }, { "entropy": 1.6129456333816052, "epoch": 0.1051229537544935, "grad_norm": 10.375, "learning_rate": 4.981469384731698e-05, "loss": 1.7151153564453125, "mean_token_accuracy": 0.6369513172656298, "num_tokens": 7240379.0, "step": 3670 }, { "entropy": 1.6685446359217166, "epoch": 0.10540939232058204, "grad_norm": 12.5625, "learning_rate": 4.98133043989665e-05, "loss": 1.687558937072754, "mean_token_accuracy": 0.6465672057121992, "num_tokens": 7260083.0, "step": 3680 }, { "entropy": 1.568697489053011, "epoch": 0.10569583088667057, "grad_norm": 17.375, "learning_rate": 4.9811909780449606e-05, "loss": 1.6286209106445313, "mean_token_accuracy": 0.6435823444277048, "num_tokens": 7279720.0, "step": 3690 }, { "entropy": 1.7579448983073234, "epoch": 0.10598226945275913, "grad_norm": 9.6875, "learning_rate": 4.98105099920569e-05, "loss": 1.8242202758789063, "mean_token_accuracy": 0.622202886082232, "num_tokens": 7299830.0, "step": 3700 }, { "entropy": 1.5484590135514735, "epoch": 0.10626870801884766, "grad_norm": 9.25, "learning_rate": 4.980910503408003e-05, "loss": 1.5815845489501954, "mean_token_accuracy": 0.6635242309421301, "num_tokens": 7318924.0, "step": 3710 }, { "entropy": 1.6158774755895138, "epoch": 0.1065551465849362, "grad_norm": 9.4375, "learning_rate": 4.980769490681175e-05, "loss": 1.6784629821777344, "mean_token_accuracy": 0.6403291534632445, "num_tokens": 7339038.0, "step": 3720 }, { "entropy": 1.7512457430362702, "epoch": 0.10684158515102474, "grad_norm": 8.6875, "learning_rate": 4.980627961054588e-05, "loss": 1.7499198913574219, "mean_token_accuracy": 0.6350882723927498, "num_tokens": 7358680.0, "step": 3730 }, { "entropy": 1.6030123636126519, "epoch": 0.10712802371711327, "grad_norm": 12.6875, "learning_rate": 4.9804859145577306e-05, "loss": 1.6888309478759767, "mean_token_accuracy": 0.64278660453856, "num_tokens": 7376809.0, "step": 3740 }, { "entropy": 1.599424796551466, "epoch": 0.10741446228320181, "grad_norm": 8.5, "learning_rate": 4.9803433512202e-05, "loss": 1.647484016418457, "mean_token_accuracy": 0.654452845454216, "num_tokens": 7396027.0, "step": 3750 }, { "entropy": 1.4993393868207932, "epoch": 0.10770090084929035, "grad_norm": 8.6875, "learning_rate": 4.980200271071701e-05, "loss": 1.6149499893188477, "mean_token_accuracy": 0.6482477340847254, "num_tokens": 7415794.0, "step": 3760 }, { "entropy": 1.6712707415223123, "epoch": 0.10798733941537889, "grad_norm": 8.5625, "learning_rate": 4.980056674142047e-05, "loss": 1.7163467407226562, "mean_token_accuracy": 0.6339017499238253, "num_tokens": 7437207.0, "step": 3770 }, { "entropy": 1.6393704406917096, "epoch": 0.10827377798146742, "grad_norm": 13.625, "learning_rate": 4.979912560461157e-05, "loss": 1.7169496536254882, "mean_token_accuracy": 0.6368111822754144, "num_tokens": 7455892.0, "step": 3780 }, { "entropy": 1.7394482620060443, "epoch": 0.10856021654755596, "grad_norm": 9.25, "learning_rate": 4.97976793005906e-05, "loss": 1.8061094284057617, "mean_token_accuracy": 0.6174036616459488, "num_tokens": 7475186.0, "step": 3790 }, { "entropy": 1.552655541524291, "epoch": 0.1088466551136445, "grad_norm": 9.1875, "learning_rate": 4.9796227829658916e-05, "loss": 1.611650276184082, "mean_token_accuracy": 0.6506694372743368, "num_tokens": 7495326.0, "step": 3800 }, { "entropy": 1.6132732205092908, "epoch": 0.10913309367973303, "grad_norm": 7.5, "learning_rate": 4.9794771192118945e-05, "loss": 1.6967041015625, "mean_token_accuracy": 0.6432500820606947, "num_tokens": 7515063.0, "step": 3810 }, { "entropy": 1.7228643730282784, "epoch": 0.10941953224582157, "grad_norm": 9.625, "learning_rate": 4.97933093882742e-05, "loss": 1.7208276748657227, "mean_token_accuracy": 0.6368235297501087, "num_tokens": 7535102.0, "step": 3820 }, { "entropy": 1.5207892529666425, "epoch": 0.10970597081191012, "grad_norm": 12.625, "learning_rate": 4.9791842418429256e-05, "loss": 1.5424155235290526, "mean_token_accuracy": 0.6668250478804112, "num_tokens": 7554024.0, "step": 3830 }, { "entropy": 1.4753357917070389, "epoch": 0.10999240937799866, "grad_norm": 11.0, "learning_rate": 4.979037028288979e-05, "loss": 1.5886699676513671, "mean_token_accuracy": 0.6615104977041483, "num_tokens": 7573906.0, "step": 3840 }, { "entropy": 1.6845372278243302, "epoch": 0.1102788479440872, "grad_norm": 10.0, "learning_rate": 4.978889298196252e-05, "loss": 1.769597625732422, "mean_token_accuracy": 0.6292838361114264, "num_tokens": 7593541.0, "step": 3850 }, { "entropy": 1.5769455425441266, "epoch": 0.11056528651017573, "grad_norm": 9.125, "learning_rate": 4.978741051595528e-05, "loss": 1.5808780670166016, "mean_token_accuracy": 0.6541871156543493, "num_tokens": 7612674.0, "step": 3860 }, { "entropy": 1.6566674526780845, "epoch": 0.11085172507626427, "grad_norm": 9.25, "learning_rate": 4.9785922885176956e-05, "loss": 1.7226404190063476, "mean_token_accuracy": 0.625541852042079, "num_tokens": 7632543.0, "step": 3870 }, { "entropy": 1.6096037060022355, "epoch": 0.11113816364235281, "grad_norm": 8.6875, "learning_rate": 4.9784430089937504e-05, "loss": 1.708632469177246, "mean_token_accuracy": 0.6383926354348659, "num_tokens": 7651652.0, "step": 3880 }, { "entropy": 1.723529090732336, "epoch": 0.11142460220844135, "grad_norm": 9.75, "learning_rate": 4.9782932130547986e-05, "loss": 1.759688949584961, "mean_token_accuracy": 0.618687403947115, "num_tokens": 7671203.0, "step": 3890 }, { "entropy": 1.557471706904471, "epoch": 0.11171104077452988, "grad_norm": 9.75, "learning_rate": 4.978142900732051e-05, "loss": 1.5875686645507812, "mean_token_accuracy": 0.6499525845050812, "num_tokens": 7690516.0, "step": 3900 }, { "entropy": 1.551585179939866, "epoch": 0.11199747934061842, "grad_norm": 8.8125, "learning_rate": 4.977992072056826e-05, "loss": 1.650254249572754, "mean_token_accuracy": 0.6560598902404309, "num_tokens": 7709298.0, "step": 3910 }, { "entropy": 1.5815889041870832, "epoch": 0.11228391790670696, "grad_norm": 9.5625, "learning_rate": 4.977840727060552e-05, "loss": 1.593684482574463, "mean_token_accuracy": 0.6460284203290939, "num_tokens": 7729071.0, "step": 3920 }, { "entropy": 1.5101389355957509, "epoch": 0.1125703564727955, "grad_norm": 9.6875, "learning_rate": 4.977688865774764e-05, "loss": 1.6238428115844727, "mean_token_accuracy": 0.6475252192467451, "num_tokens": 7750776.0, "step": 3930 }, { "entropy": 1.6004488527774812, "epoch": 0.11285679503888403, "grad_norm": 8.8125, "learning_rate": 4.977536488231103e-05, "loss": 1.6589231491088867, "mean_token_accuracy": 0.6409353025257587, "num_tokens": 7771076.0, "step": 3940 }, { "entropy": 1.6314193956553935, "epoch": 0.11314323360497257, "grad_norm": 9.1875, "learning_rate": 4.97738359446132e-05, "loss": 1.6660181045532227, "mean_token_accuracy": 0.6412204388529062, "num_tokens": 7791504.0, "step": 3950 }, { "entropy": 1.6633416850119829, "epoch": 0.1134296721710611, "grad_norm": 11.25, "learning_rate": 4.977230184497271e-05, "loss": 1.7595705032348632, "mean_token_accuracy": 0.6309101179242134, "num_tokens": 7810987.0, "step": 3960 }, { "entropy": 1.5157507963478565, "epoch": 0.11371611073714966, "grad_norm": 9.8125, "learning_rate": 4.977076258370922e-05, "loss": 1.607263946533203, "mean_token_accuracy": 0.6623361337929964, "num_tokens": 7831549.0, "step": 3970 }, { "entropy": 1.6064405851066113, "epoch": 0.1140025493032382, "grad_norm": 9.0625, "learning_rate": 4.976921816114345e-05, "loss": 1.6695703506469726, "mean_token_accuracy": 0.6595016360282898, "num_tokens": 7851226.0, "step": 3980 }, { "entropy": 1.6939660400152206, "epoch": 0.11428898786932673, "grad_norm": 10.375, "learning_rate": 4.97676685775972e-05, "loss": 1.7704540252685548, "mean_token_accuracy": 0.6205462880432606, "num_tokens": 7872015.0, "step": 3990 }, { "epoch": 0.11457542643541527, "eval_entropy": 1.6098786599636077, "eval_loss": 1.6650747060775757, "eval_mean_token_accuracy": 0.6405204639434815, "eval_num_tokens": 7891042.0, "eval_runtime": 43.7294, "eval_samples_per_second": 45.736, "eval_steps_per_second": 5.717, "step": 4000 }, { "entropy": 1.6005963683128357, "epoch": 0.1148618650015038, "grad_norm": 9.625, "learning_rate": 4.976455392885585e-05, "loss": 1.6549604415893555, "mean_token_accuracy": 0.6485565780662, "num_tokens": 7911920.0, "step": 4010 }, { "entropy": 1.491986843943596, "epoch": 0.11514830356759234, "grad_norm": 10.75, "learning_rate": 4.9762988864309714e-05, "loss": 1.5747516632080079, "mean_token_accuracy": 0.6672815855592489, "num_tokens": 7932491.0, "step": 4020 }, { "entropy": 1.5924518678337336, "epoch": 0.11543474213368088, "grad_norm": 9.75, "learning_rate": 4.976141864008106e-05, "loss": 1.6315956115722656, "mean_token_accuracy": 0.6538907889276743, "num_tokens": 7952550.0, "step": 4030 }, { "entropy": 1.7031397961080075, "epoch": 0.11572118069976942, "grad_norm": 10.875, "learning_rate": 4.975984325649705e-05, "loss": 1.752387237548828, "mean_token_accuracy": 0.6324999265372753, "num_tokens": 7972914.0, "step": 4040 }, { "entropy": 1.595766806602478, "epoch": 0.11600761926585795, "grad_norm": 9.3125, "learning_rate": 4.975826271388594e-05, "loss": 1.5881695747375488, "mean_token_accuracy": 0.6493427228182554, "num_tokens": 7992312.0, "step": 4050 }, { "entropy": 1.5366006754338741, "epoch": 0.11629405783194649, "grad_norm": 9.875, "learning_rate": 4.975667701257706e-05, "loss": 1.6710201263427735, "mean_token_accuracy": 0.640213792771101, "num_tokens": 8012711.0, "step": 4060 }, { "entropy": 1.5428064178675414, "epoch": 0.11658049639803503, "grad_norm": 7.90625, "learning_rate": 4.9755086152900806e-05, "loss": 1.6362485885620117, "mean_token_accuracy": 0.6502720098942518, "num_tokens": 8033643.0, "step": 4070 }, { "entropy": 1.5757974475622176, "epoch": 0.11686693496412356, "grad_norm": 11.0625, "learning_rate": 4.9753490135188664e-05, "loss": 1.5432090759277344, "mean_token_accuracy": 0.663056916743517, "num_tokens": 8053901.0, "step": 4080 }, { "entropy": 1.5034592628479004, "epoch": 0.1171533735302121, "grad_norm": 8.5625, "learning_rate": 4.9751888959773176e-05, "loss": 1.6036109924316406, "mean_token_accuracy": 0.6504288144409657, "num_tokens": 8074275.0, "step": 4090 }, { "entropy": 1.5517423652112483, "epoch": 0.11743981209630065, "grad_norm": 11.9375, "learning_rate": 4.975028262698795e-05, "loss": 1.5871983528137208, "mean_token_accuracy": 0.6494060952216387, "num_tokens": 8094046.0, "step": 4100 }, { "entropy": 1.5514112140983343, "epoch": 0.11772625066238919, "grad_norm": 7.5625, "learning_rate": 4.9748671137167724e-05, "loss": 1.6497369766235352, "mean_token_accuracy": 0.6371284432709217, "num_tokens": 8114035.0, "step": 4110 }, { "entropy": 1.6656693324446679, "epoch": 0.11801268922847773, "grad_norm": 11.125, "learning_rate": 4.974705449064825e-05, "loss": 1.732563591003418, "mean_token_accuracy": 0.6293914947658777, "num_tokens": 8133291.0, "step": 4120 }, { "entropy": 1.4772680297493934, "epoch": 0.11829912779456626, "grad_norm": 7.46875, "learning_rate": 4.9745432687766366e-05, "loss": 1.5282196044921874, "mean_token_accuracy": 0.669588616490364, "num_tokens": 8152873.0, "step": 4130 }, { "entropy": 1.650682621449232, "epoch": 0.1185855663606548, "grad_norm": 7.25, "learning_rate": 4.9743805728860016e-05, "loss": 1.6047649383544922, "mean_token_accuracy": 0.6563232995569706, "num_tokens": 8172371.0, "step": 4140 }, { "entropy": 1.4914087392389774, "epoch": 0.11887200492674334, "grad_norm": 9.1875, "learning_rate": 4.974217361426819e-05, "loss": 1.6290849685668944, "mean_token_accuracy": 0.6563458885997534, "num_tokens": 8193182.0, "step": 4150 }, { "entropy": 1.53787529990077, "epoch": 0.11915844349283188, "grad_norm": 10.875, "learning_rate": 4.9740536344330956e-05, "loss": 1.609867477416992, "mean_token_accuracy": 0.6524941785261035, "num_tokens": 8213488.0, "step": 4160 }, { "entropy": 1.4693402014672756, "epoch": 0.11944488205892041, "grad_norm": 9.5, "learning_rate": 4.973889391938946e-05, "loss": 1.5584410667419433, "mean_token_accuracy": 0.6637550175189972, "num_tokens": 8233104.0, "step": 4170 }, { "entropy": 1.5683077815920115, "epoch": 0.11973132062500895, "grad_norm": 8.0, "learning_rate": 4.973724633978594e-05, "loss": 1.589338207244873, "mean_token_accuracy": 0.6586020454764366, "num_tokens": 8252390.0, "step": 4180 }, { "entropy": 1.6479635879397392, "epoch": 0.12001775919109749, "grad_norm": 8.9375, "learning_rate": 4.973559360586366e-05, "loss": 1.7119781494140625, "mean_token_accuracy": 0.63336865529418, "num_tokens": 8273234.0, "step": 4190 }, { "entropy": 1.5484042853116988, "epoch": 0.12030419775718602, "grad_norm": 9.8125, "learning_rate": 4.9733935717967004e-05, "loss": 1.5573399543762207, "mean_token_accuracy": 0.660521986335516, "num_tokens": 8292078.0, "step": 4200 }, { "entropy": 1.5313296984881162, "epoch": 0.12059063632327456, "grad_norm": 7.65625, "learning_rate": 4.973227267644142e-05, "loss": 1.6131240844726562, "mean_token_accuracy": 0.6444024810567498, "num_tokens": 8312346.0, "step": 4210 }, { "entropy": 1.5710236757993699, "epoch": 0.1208770748893631, "grad_norm": 10.75, "learning_rate": 4.9730604481633415e-05, "loss": 1.6453704833984375, "mean_token_accuracy": 0.6383862376213074, "num_tokens": 8332138.0, "step": 4220 }, { "entropy": 1.5641222171485425, "epoch": 0.12116351345545164, "grad_norm": 9.5625, "learning_rate": 4.9728931133890575e-05, "loss": 1.588129997253418, "mean_token_accuracy": 0.6567653119564056, "num_tokens": 8350284.0, "step": 4230 }, { "entropy": 1.6658044099807738, "epoch": 0.12144995202154019, "grad_norm": 8.5, "learning_rate": 4.972725263356158e-05, "loss": 1.755426025390625, "mean_token_accuracy": 0.6316048409789801, "num_tokens": 8369770.0, "step": 4240 }, { "entropy": 1.6496659649536014, "epoch": 0.12173639058762872, "grad_norm": 9.5, "learning_rate": 4.9725568980996144e-05, "loss": 1.7039173126220704, "mean_token_accuracy": 0.6400847017765046, "num_tokens": 8388523.0, "step": 4250 }, { "entropy": 1.5752143502235412, "epoch": 0.12202282915371726, "grad_norm": 9.0625, "learning_rate": 4.97238801765451e-05, "loss": 1.633380126953125, "mean_token_accuracy": 0.6485164921730757, "num_tokens": 8407657.0, "step": 4260 }, { "entropy": 1.593596202880144, "epoch": 0.1223092677198058, "grad_norm": 9.1875, "learning_rate": 4.972218622056031e-05, "loss": 1.6573898315429687, "mean_token_accuracy": 0.6489590808749199, "num_tokens": 8426029.0, "step": 4270 }, { "entropy": 1.610462510213256, "epoch": 0.12259570628589433, "grad_norm": 9.5, "learning_rate": 4.9720487113394744e-05, "loss": 1.7680988311767578, "mean_token_accuracy": 0.6347607377916574, "num_tokens": 8446995.0, "step": 4280 }, { "entropy": 1.661719637736678, "epoch": 0.12288214485198287, "grad_norm": 7.375, "learning_rate": 4.971878285540243e-05, "loss": 1.6369525909423828, "mean_token_accuracy": 0.6406619127839803, "num_tokens": 8466787.0, "step": 4290 }, { "entropy": 1.583110580407083, "epoch": 0.12316858341807141, "grad_norm": 8.8125, "learning_rate": 4.971707344693848e-05, "loss": 1.6308673858642577, "mean_token_accuracy": 0.6463008146733046, "num_tokens": 8487763.0, "step": 4300 }, { "entropy": 1.49612433090806, "epoch": 0.12345502198415995, "grad_norm": 9.0625, "learning_rate": 4.9715358888359055e-05, "loss": 1.6682989120483398, "mean_token_accuracy": 0.6445597290992737, "num_tokens": 8507128.0, "step": 4310 }, { "entropy": 1.5271134339272976, "epoch": 0.12374146055024848, "grad_norm": 10.5, "learning_rate": 4.971363918002142e-05, "loss": 1.585581398010254, "mean_token_accuracy": 0.6652600765228271, "num_tokens": 8526072.0, "step": 4320 }, { "entropy": 1.6250931091606617, "epoch": 0.12402789911633702, "grad_norm": 8.3125, "learning_rate": 4.971191432228388e-05, "loss": 1.6668222427368165, "mean_token_accuracy": 0.6372327048331499, "num_tokens": 8546952.0, "step": 4330 }, { "entropy": 1.5376979611814021, "epoch": 0.12431433768242556, "grad_norm": 9.3125, "learning_rate": 4.971018431550585e-05, "loss": 1.5736823081970215, "mean_token_accuracy": 0.6680327545851469, "num_tokens": 8566795.0, "step": 4340 }, { "entropy": 1.5797248736023903, "epoch": 0.1246007762485141, "grad_norm": 9.6875, "learning_rate": 4.970844916004779e-05, "loss": 1.5739888191223144, "mean_token_accuracy": 0.6595445297658443, "num_tokens": 8586617.0, "step": 4350 }, { "entropy": 1.5412679776549338, "epoch": 0.12488721481460263, "grad_norm": 8.625, "learning_rate": 4.970670885627124e-05, "loss": 1.6226394653320313, "mean_token_accuracy": 0.6362952403724194, "num_tokens": 8607139.0, "step": 4360 }, { "entropy": 1.3484292313456536, "epoch": 0.12517365338069117, "grad_norm": 8.5625, "learning_rate": 4.970496340453882e-05, "loss": 1.4472694396972656, "mean_token_accuracy": 0.6806314267218113, "num_tokens": 8627414.0, "step": 4370 }, { "entropy": 1.6275325849652291, "epoch": 0.1254600919467797, "grad_norm": 9.75, "learning_rate": 4.9703212805214214e-05, "loss": 1.6965776443481446, "mean_token_accuracy": 0.6306652009487153, "num_tokens": 8647004.0, "step": 4380 }, { "entropy": 1.5334886122494935, "epoch": 0.12574653051286824, "grad_norm": 7.375, "learning_rate": 4.970145705866218e-05, "loss": 1.5669997215270997, "mean_token_accuracy": 0.6734387289732695, "num_tokens": 8665559.0, "step": 4390 }, { "entropy": 1.6214932195842267, "epoch": 0.12603296907895678, "grad_norm": 7.4375, "learning_rate": 4.9699696165248556e-05, "loss": 1.6898490905761718, "mean_token_accuracy": 0.6344234116375447, "num_tokens": 8685046.0, "step": 4400 }, { "entropy": 1.5889239586889743, "epoch": 0.12631940764504532, "grad_norm": 6.78125, "learning_rate": 4.969793012534023e-05, "loss": 1.662093162536621, "mean_token_accuracy": 0.6500432893633843, "num_tokens": 8703776.0, "step": 4410 }, { "entropy": 1.6307801317423583, "epoch": 0.12660584621113385, "grad_norm": 12.25, "learning_rate": 4.9696158939305205e-05, "loss": 1.7354646682739259, "mean_token_accuracy": 0.6317333064973354, "num_tokens": 8722912.0, "step": 4420 }, { "entropy": 1.5595045857131482, "epoch": 0.1268922847772224, "grad_norm": 9.25, "learning_rate": 4.96943826075125e-05, "loss": 1.5597323417663573, "mean_token_accuracy": 0.662355512753129, "num_tokens": 8741744.0, "step": 4430 }, { "entropy": 1.5082399692386388, "epoch": 0.12717872334331096, "grad_norm": 9.5, "learning_rate": 4.9692601130332264e-05, "loss": 1.5893750190734863, "mean_token_accuracy": 0.6521870832890272, "num_tokens": 8760396.0, "step": 4440 }, { "entropy": 1.6613531835377215, "epoch": 0.1274651619093995, "grad_norm": 11.1875, "learning_rate": 4.9690814508135675e-05, "loss": 1.7102399826049806, "mean_token_accuracy": 0.6397761654108762, "num_tokens": 8778825.0, "step": 4450 }, { "entropy": 1.4875497985631227, "epoch": 0.12775160047548803, "grad_norm": 9.25, "learning_rate": 4.9689022741295e-05, "loss": 1.5682934761047362, "mean_token_accuracy": 0.6590356089174747, "num_tokens": 8797802.0, "step": 4460 }, { "entropy": 1.5024794034659863, "epoch": 0.12803803904157657, "grad_norm": 9.6875, "learning_rate": 4.968722583018358e-05, "loss": 1.5422343254089355, "mean_token_accuracy": 0.6661927476525307, "num_tokens": 8815979.0, "step": 4470 }, { "entropy": 1.6546546783298255, "epoch": 0.1283244776076651, "grad_norm": 9.4375, "learning_rate": 4.968542377517582e-05, "loss": 1.6528236389160156, "mean_token_accuracy": 0.6444402404129506, "num_tokens": 8836753.0, "step": 4480 }, { "entropy": 1.5071230851113797, "epoch": 0.12861091617375364, "grad_norm": 10.875, "learning_rate": 4.968361657664721e-05, "loss": 1.4883986473083497, "mean_token_accuracy": 0.6741204392164946, "num_tokens": 8855993.0, "step": 4490 }, { "entropy": 1.3650911824777723, "epoch": 0.12889735473984218, "grad_norm": 8.4375, "learning_rate": 4.9681804234974285e-05, "loss": 1.5139545440673827, "mean_token_accuracy": 0.6692131817340851, "num_tokens": 8875847.0, "step": 4500 }, { "entropy": 1.5094955375418067, "epoch": 0.12918379330593072, "grad_norm": 8.5, "learning_rate": 4.967998675053469e-05, "loss": 1.6065097808837892, "mean_token_accuracy": 0.654398288205266, "num_tokens": 8895189.0, "step": 4510 }, { "entropy": 1.5785987384617328, "epoch": 0.12947023187201925, "grad_norm": 8.625, "learning_rate": 4.9678164123707105e-05, "loss": 1.6469533920288086, "mean_token_accuracy": 0.6441236600279808, "num_tokens": 8915552.0, "step": 4520 }, { "entropy": 1.5994109526276588, "epoch": 0.1297566704381078, "grad_norm": 8.4375, "learning_rate": 4.9676336354871313e-05, "loss": 1.646183967590332, "mean_token_accuracy": 0.6489069607108832, "num_tokens": 8935329.0, "step": 4530 }, { "entropy": 1.6266275960952044, "epoch": 0.13004310900419633, "grad_norm": 10.25, "learning_rate": 4.967450344440813e-05, "loss": 1.6045013427734376, "mean_token_accuracy": 0.6422398079186677, "num_tokens": 8955819.0, "step": 4540 }, { "entropy": 1.4819649696350097, "epoch": 0.13032954757028486, "grad_norm": 8.0625, "learning_rate": 4.9672665392699484e-05, "loss": 1.5252309799194337, "mean_token_accuracy": 0.663091566041112, "num_tokens": 8975896.0, "step": 4550 }, { "entropy": 1.678335817158222, "epoch": 0.1306159861363734, "grad_norm": 10.125, "learning_rate": 4.967082220012835e-05, "loss": 1.7590364456176757, "mean_token_accuracy": 0.6407991398125887, "num_tokens": 8995151.0, "step": 4560 }, { "entropy": 1.4536094807088376, "epoch": 0.13090242470246194, "grad_norm": 10.8125, "learning_rate": 4.9668973867078796e-05, "loss": 1.5351222991943358, "mean_token_accuracy": 0.6603596534579992, "num_tokens": 9014246.0, "step": 4570 }, { "entropy": 1.5587512321770192, "epoch": 0.13118886326855048, "grad_norm": 7.34375, "learning_rate": 4.966712039393592e-05, "loss": 1.5743330001831055, "mean_token_accuracy": 0.6638579566031695, "num_tokens": 9033312.0, "step": 4580 }, { "entropy": 1.422217233479023, "epoch": 0.131475301834639, "grad_norm": 8.75, "learning_rate": 4.9665261781085924e-05, "loss": 1.4170184135437012, "mean_token_accuracy": 0.6837819341570139, "num_tokens": 9052197.0, "step": 4590 }, { "entropy": 1.4408176511526107, "epoch": 0.13176174040072755, "grad_norm": 10.4375, "learning_rate": 4.966339802891609e-05, "loss": 1.5235408782958983, "mean_token_accuracy": 0.6589519329369068, "num_tokens": 9072361.0, "step": 4600 }, { "entropy": 1.5640794448554516, "epoch": 0.1320481789668161, "grad_norm": 10.625, "learning_rate": 4.966152913781473e-05, "loss": 1.6959920883178712, "mean_token_accuracy": 0.6450260996818542, "num_tokens": 9092265.0, "step": 4610 }, { "entropy": 1.6374080155044795, "epoch": 0.13233461753290462, "grad_norm": 10.0625, "learning_rate": 4.9659655108171276e-05, "loss": 1.6527341842651366, "mean_token_accuracy": 0.646100414916873, "num_tokens": 9111538.0, "step": 4620 }, { "entropy": 1.6406228937208653, "epoch": 0.13262105609899316, "grad_norm": 8.8125, "learning_rate": 4.965777594037619e-05, "loss": 1.6782005310058594, "mean_token_accuracy": 0.6437648221850395, "num_tokens": 9131157.0, "step": 4630 }, { "entropy": 1.5327306509017944, "epoch": 0.1329074946650817, "grad_norm": 10.375, "learning_rate": 4.965589163482102e-05, "loss": 1.5165156364440917, "mean_token_accuracy": 0.6648626908659935, "num_tokens": 9150635.0, "step": 4640 }, { "entropy": 1.4707805193960666, "epoch": 0.13319393323117024, "grad_norm": 8.4375, "learning_rate": 4.96540021918984e-05, "loss": 1.5626633644104004, "mean_token_accuracy": 0.6587305165827274, "num_tokens": 9171534.0, "step": 4650 }, { "entropy": 1.4669506411999464, "epoch": 0.13348037179725877, "grad_norm": 14.0, "learning_rate": 4.965210761200199e-05, "loss": 1.6072134017944335, "mean_token_accuracy": 0.6649957228451967, "num_tokens": 9191107.0, "step": 4660 }, { "entropy": 1.5567944549024104, "epoch": 0.1337668103633473, "grad_norm": 9.4375, "learning_rate": 4.965020789552658e-05, "loss": 1.606149673461914, "mean_token_accuracy": 0.6558465506881476, "num_tokens": 9210231.0, "step": 4670 }, { "entropy": 1.4961183398962021, "epoch": 0.13405324892943585, "grad_norm": 8.6875, "learning_rate": 4.9648303042867984e-05, "loss": 1.506659984588623, "mean_token_accuracy": 0.6736569181084633, "num_tokens": 9229021.0, "step": 4680 }, { "entropy": 1.641214369982481, "epoch": 0.13433968749552438, "grad_norm": 8.125, "learning_rate": 4.9646393054423114e-05, "loss": 1.721603775024414, "mean_token_accuracy": 0.639400390535593, "num_tokens": 9248239.0, "step": 4690 }, { "entropy": 1.6699512496590614, "epoch": 0.13462612606161292, "grad_norm": 9.6875, "learning_rate": 4.9644477930589914e-05, "loss": 1.6996458053588868, "mean_token_accuracy": 0.6440739132463932, "num_tokens": 9266813.0, "step": 4700 }, { "entropy": 1.5381789475679397, "epoch": 0.1349125646277015, "grad_norm": 9.3125, "learning_rate": 4.9642557671767465e-05, "loss": 1.5855304718017578, "mean_token_accuracy": 0.6539187822490931, "num_tokens": 9286202.0, "step": 4710 }, { "entropy": 1.4064394481480123, "epoch": 0.13519900319379002, "grad_norm": 8.1875, "learning_rate": 4.9640632278355844e-05, "loss": 1.4934977531433105, "mean_token_accuracy": 0.6751538056880235, "num_tokens": 9305778.0, "step": 4720 }, { "entropy": 1.5691715724766255, "epoch": 0.13548544175987856, "grad_norm": 8.875, "learning_rate": 4.963870175075624e-05, "loss": 1.6240917205810548, "mean_token_accuracy": 0.6488645177334547, "num_tokens": 9325210.0, "step": 4730 }, { "entropy": 1.497089508920908, "epoch": 0.1357718803259671, "grad_norm": 9.9375, "learning_rate": 4.963676608937091e-05, "loss": 1.581840419769287, "mean_token_accuracy": 0.6479581639170646, "num_tokens": 9345284.0, "step": 4740 }, { "entropy": 1.4659678988158702, "epoch": 0.13605831889205564, "grad_norm": 10.25, "learning_rate": 4.9634825294603165e-05, "loss": 1.485072422027588, "mean_token_accuracy": 0.6772671807557344, "num_tokens": 9366584.0, "step": 4750 }, { "entropy": 1.5600997146219016, "epoch": 0.13634475745814417, "grad_norm": 11.375, "learning_rate": 4.9632879366857396e-05, "loss": 1.6657369613647461, "mean_token_accuracy": 0.6452657295390963, "num_tokens": 9387572.0, "step": 4760 }, { "entropy": 1.5218887124210596, "epoch": 0.1366311960242327, "grad_norm": 8.0625, "learning_rate": 4.963092830653907e-05, "loss": 1.5555039405822755, "mean_token_accuracy": 0.6518874477595091, "num_tokens": 9407440.0, "step": 4770 }, { "entropy": 1.5266014069318772, "epoch": 0.13691763459032125, "grad_norm": 9.5625, "learning_rate": 4.9628972114054706e-05, "loss": 1.5886033058166504, "mean_token_accuracy": 0.6657060205936431, "num_tokens": 9427120.0, "step": 4780 }, { "entropy": 1.504212035238743, "epoch": 0.13720407315640978, "grad_norm": 8.125, "learning_rate": 4.96270107898119e-05, "loss": 1.584134578704834, "mean_token_accuracy": 0.6573188021779061, "num_tokens": 9446852.0, "step": 4790 }, { "entropy": 1.7013119705021382, "epoch": 0.13749051172249832, "grad_norm": 8.8125, "learning_rate": 4.962504433421933e-05, "loss": 1.7435585021972657, "mean_token_accuracy": 0.6280934553593397, "num_tokens": 9466739.0, "step": 4800 }, { "entropy": 1.4621875803917646, "epoch": 0.13777695028858686, "grad_norm": 8.25, "learning_rate": 4.962307274768672e-05, "loss": 1.492708969116211, "mean_token_accuracy": 0.6729666709899902, "num_tokens": 9485680.0, "step": 4810 }, { "entropy": 1.4921036452054977, "epoch": 0.1380633888546754, "grad_norm": 10.625, "learning_rate": 4.9621096030624883e-05, "loss": 1.5334936141967774, "mean_token_accuracy": 0.6603573184460402, "num_tokens": 9506293.0, "step": 4820 }, { "entropy": 1.4879472389817239, "epoch": 0.13834982742076393, "grad_norm": 13.6875, "learning_rate": 4.961911418344569e-05, "loss": 1.7079967498779296, "mean_token_accuracy": 0.6462376203387976, "num_tokens": 9526251.0, "step": 4830 }, { "entropy": 1.5331168532371522, "epoch": 0.13863626598685247, "grad_norm": 11.75, "learning_rate": 4.961712720656208e-05, "loss": 1.544976806640625, "mean_token_accuracy": 0.6682040221989155, "num_tokens": 9545654.0, "step": 4840 }, { "entropy": 1.5735587041825057, "epoch": 0.138922704552941, "grad_norm": 8.75, "learning_rate": 4.961513510038807e-05, "loss": 1.6300994873046875, "mean_token_accuracy": 0.6456163562834263, "num_tokens": 9565414.0, "step": 4850 }, { "entropy": 1.403120832145214, "epoch": 0.13920914311902954, "grad_norm": 8.25, "learning_rate": 4.961313786533874e-05, "loss": 1.4635492324829102, "mean_token_accuracy": 0.6760737411677837, "num_tokens": 9584757.0, "step": 4860 }, { "entropy": 1.519579280912876, "epoch": 0.13949558168511808, "grad_norm": 9.75, "learning_rate": 4.961113550183024e-05, "loss": 1.5451878547668456, "mean_token_accuracy": 0.6640205007046461, "num_tokens": 9604619.0, "step": 4870 }, { "entropy": 1.5056984916329383, "epoch": 0.13978202025120662, "grad_norm": 8.0625, "learning_rate": 4.9609128010279784e-05, "loss": 1.5595246315002442, "mean_token_accuracy": 0.6584958035498858, "num_tokens": 9623688.0, "step": 4880 }, { "entropy": 1.622643904015422, "epoch": 0.14006845881729516, "grad_norm": 8.6875, "learning_rate": 4.960711539110566e-05, "loss": 1.6314786911010741, "mean_token_accuracy": 0.64293511249125, "num_tokens": 9645016.0, "step": 4890 }, { "entropy": 1.4993349730968475, "epoch": 0.1403548973833837, "grad_norm": 10.0625, "learning_rate": 4.960509764472723e-05, "loss": 1.5718796730041504, "mean_token_accuracy": 0.6560567699372768, "num_tokens": 9664646.0, "step": 4900 }, { "entropy": 1.5645937040448188, "epoch": 0.14064133594947223, "grad_norm": 12.875, "learning_rate": 4.960307477156491e-05, "loss": 1.5769742012023926, "mean_token_accuracy": 0.6528674773871899, "num_tokens": 9685110.0, "step": 4910 }, { "entropy": 1.3918135400861502, "epoch": 0.14092777451556077, "grad_norm": 8.3125, "learning_rate": 4.960104677204018e-05, "loss": 1.4424909591674804, "mean_token_accuracy": 0.6750841304659844, "num_tokens": 9704859.0, "step": 4920 }, { "entropy": 1.5218386985361576, "epoch": 0.1412142130816493, "grad_norm": 6.09375, "learning_rate": 4.959901364657562e-05, "loss": 1.5807250022888184, "mean_token_accuracy": 0.6635899852961302, "num_tokens": 9724561.0, "step": 4930 }, { "entropy": 1.5914435897022485, "epoch": 0.14150065164773784, "grad_norm": 8.3125, "learning_rate": 4.9596975395594844e-05, "loss": 1.603508186340332, "mean_token_accuracy": 0.6510025925934315, "num_tokens": 9744644.0, "step": 4940 }, { "entropy": 1.4987780340015888, "epoch": 0.14178709021382638, "grad_norm": 12.0, "learning_rate": 4.9594932019522554e-05, "loss": 1.564766025543213, "mean_token_accuracy": 0.6559693459421396, "num_tokens": 9763835.0, "step": 4950 }, { "entropy": 1.5716330505907536, "epoch": 0.14207352877991491, "grad_norm": 8.0625, "learning_rate": 4.9592883518784517e-05, "loss": 1.6398065567016602, "mean_token_accuracy": 0.6363564360886812, "num_tokens": 9783953.0, "step": 4960 }, { "entropy": 1.5598301596939563, "epoch": 0.14235996734600345, "grad_norm": 11.4375, "learning_rate": 4.959082989380754e-05, "loss": 1.623297882080078, "mean_token_accuracy": 0.6506641361862421, "num_tokens": 9804743.0, "step": 4970 }, { "entropy": 1.4122194364666938, "epoch": 0.14264640591209202, "grad_norm": 8.25, "learning_rate": 4.9588771145019565e-05, "loss": 1.4657936096191406, "mean_token_accuracy": 0.6727658096700907, "num_tokens": 9823929.0, "step": 4980 }, { "entropy": 1.5104284398257732, "epoch": 0.14293284447818055, "grad_norm": 8.5, "learning_rate": 4.958670727284952e-05, "loss": 1.5763837814331054, "mean_token_accuracy": 0.6548960711807013, "num_tokens": 9843241.0, "step": 4990 }, { "entropy": 1.4615675970911979, "epoch": 0.1432192830442691, "grad_norm": 7.90625, "learning_rate": 4.958463827772745e-05, "loss": 1.4633464813232422, "mean_token_accuracy": 0.6726066563278437, "num_tokens": 9864370.0, "step": 5000 }, { "entropy": 1.3798364020884037, "epoch": 0.14350572161035763, "grad_norm": 10.9375, "learning_rate": 4.958256416008447e-05, "loss": 1.399475383758545, "mean_token_accuracy": 0.6874329604208469, "num_tokens": 9885744.0, "step": 5010 }, { "entropy": 1.4340853445231914, "epoch": 0.14379216017644617, "grad_norm": 8.9375, "learning_rate": 4.958048492035272e-05, "loss": 1.59286470413208, "mean_token_accuracy": 0.6604187369346619, "num_tokens": 9906496.0, "step": 5020 }, { "entropy": 1.463975927233696, "epoch": 0.1440785987425347, "grad_norm": 10.125, "learning_rate": 4.9578400558965464e-05, "loss": 1.516213607788086, "mean_token_accuracy": 0.6712160520255566, "num_tokens": 9926960.0, "step": 5030 }, { "entropy": 1.480278616771102, "epoch": 0.14436503730862324, "grad_norm": 8.875, "learning_rate": 4.9576311076356996e-05, "loss": 1.5378478050231934, "mean_token_accuracy": 0.6715181965380908, "num_tokens": 9945994.0, "step": 5040 }, { "entropy": 1.4886713460087777, "epoch": 0.14465147587471178, "grad_norm": 7.375, "learning_rate": 4.957421647296269e-05, "loss": 1.5202993392944335, "mean_token_accuracy": 0.6785048861056566, "num_tokens": 9966115.0, "step": 5050 }, { "entropy": 1.5940536327660084, "epoch": 0.14493791444080031, "grad_norm": 9.125, "learning_rate": 4.957211674921897e-05, "loss": 1.6539093017578126, "mean_token_accuracy": 0.6506012924015522, "num_tokens": 9987080.0, "step": 5060 }, { "entropy": 1.4804301261901855, "epoch": 0.14522435300688885, "grad_norm": 10.0625, "learning_rate": 4.957001190556334e-05, "loss": 1.5193848609924316, "mean_token_accuracy": 0.6621853016316891, "num_tokens": 10007396.0, "step": 5070 }, { "entropy": 1.4721652269363403, "epoch": 0.1455107915729774, "grad_norm": 11.1875, "learning_rate": 4.956790194243439e-05, "loss": 1.5131440162658691, "mean_token_accuracy": 0.6650624644011259, "num_tokens": 10026695.0, "step": 5080 }, { "entropy": 1.45464109107852, "epoch": 0.14579723013906593, "grad_norm": 10.9375, "learning_rate": 4.956578686027175e-05, "loss": 1.5026907920837402, "mean_token_accuracy": 0.6650346931070089, "num_tokens": 10047006.0, "step": 5090 }, { "entropy": 1.491887776553631, "epoch": 0.14608366870515446, "grad_norm": 8.1875, "learning_rate": 4.9563666659516104e-05, "loss": 1.6299636840820313, "mean_token_accuracy": 0.6577295735478401, "num_tokens": 10067044.0, "step": 5100 }, { "entropy": 1.6270928215235472, "epoch": 0.146370107271243, "grad_norm": 11.6875, "learning_rate": 4.956154134060925e-05, "loss": 1.6715662002563476, "mean_token_accuracy": 0.639185581356287, "num_tokens": 10086407.0, "step": 5110 }, { "entropy": 1.532237235084176, "epoch": 0.14665654583733154, "grad_norm": 9.875, "learning_rate": 4.9559410903994015e-05, "loss": 1.6115522384643555, "mean_token_accuracy": 0.6538224563002586, "num_tokens": 10105594.0, "step": 5120 }, { "entropy": 1.469840183854103, "epoch": 0.14694298440342007, "grad_norm": 7.6875, "learning_rate": 4.95572753501143e-05, "loss": 1.3854816436767579, "mean_token_accuracy": 0.6991850856691599, "num_tokens": 10125298.0, "step": 5130 }, { "entropy": 1.4622601751238107, "epoch": 0.1472294229695086, "grad_norm": 8.25, "learning_rate": 4.955513467941507e-05, "loss": 1.5373471260070801, "mean_token_accuracy": 0.6776952587068081, "num_tokens": 10145891.0, "step": 5140 }, { "entropy": 1.3798430625349283, "epoch": 0.14751586153559715, "grad_norm": 8.0625, "learning_rate": 4.955298889234238e-05, "loss": 1.4437210083007812, "mean_token_accuracy": 0.6797787621617317, "num_tokens": 10167404.0, "step": 5150 }, { "entropy": 1.611018529906869, "epoch": 0.14780230010168569, "grad_norm": 9.8125, "learning_rate": 4.955083798934331e-05, "loss": 1.7299531936645507, "mean_token_accuracy": 0.6256252124905586, "num_tokens": 10186809.0, "step": 5160 }, { "entropy": 1.586063664406538, "epoch": 0.14808873866777422, "grad_norm": 6.9375, "learning_rate": 4.954868197086604e-05, "loss": 1.6296968460083008, "mean_token_accuracy": 0.6475865747779608, "num_tokens": 10208143.0, "step": 5170 }, { "entropy": 1.4521633706986905, "epoch": 0.14837517723386276, "grad_norm": 6.15625, "learning_rate": 4.95465208373598e-05, "loss": 1.4644355773925781, "mean_token_accuracy": 0.6826090008020401, "num_tokens": 10227213.0, "step": 5180 }, { "entropy": 1.4087909482419492, "epoch": 0.1486616157999513, "grad_norm": 8.5, "learning_rate": 4.954435458927489e-05, "loss": 1.4978672981262207, "mean_token_accuracy": 0.682854725793004, "num_tokens": 10245827.0, "step": 5190 }, { "entropy": 1.5200366478413343, "epoch": 0.14894805436603983, "grad_norm": 8.9375, "learning_rate": 4.954218322706268e-05, "loss": 1.6043817520141601, "mean_token_accuracy": 0.6415193796157836, "num_tokens": 10266167.0, "step": 5200 }, { "entropy": 1.4410448588430882, "epoch": 0.14923449293212837, "grad_norm": 7.125, "learning_rate": 4.95400067511756e-05, "loss": 1.4061705589294433, "mean_token_accuracy": 0.6966239595785737, "num_tokens": 10284596.0, "step": 5210 }, { "entropy": 1.4189201422035693, "epoch": 0.1495209314982169, "grad_norm": 8.8125, "learning_rate": 4.953782516206713e-05, "loss": 1.4706315040588378, "mean_token_accuracy": 0.6728576749563218, "num_tokens": 10304052.0, "step": 5220 }, { "entropy": 1.474114514142275, "epoch": 0.14980737006430545, "grad_norm": 10.6875, "learning_rate": 4.953563846019185e-05, "loss": 1.505852508544922, "mean_token_accuracy": 0.6601380426436663, "num_tokens": 10323963.0, "step": 5230 }, { "entropy": 1.4801891282200814, "epoch": 0.150093808630394, "grad_norm": 11.375, "learning_rate": 4.953344664600538e-05, "loss": 1.5376943588256835, "mean_token_accuracy": 0.6654257832095027, "num_tokens": 10342977.0, "step": 5240 }, { "entropy": 1.4171194434165955, "epoch": 0.15038024719648255, "grad_norm": 7.75, "learning_rate": 4.9531249719964424e-05, "loss": 1.4434309005737305, "mean_token_accuracy": 0.688833561912179, "num_tokens": 10362549.0, "step": 5250 }, { "entropy": 1.3564347431063652, "epoch": 0.15066668576257108, "grad_norm": 7.375, "learning_rate": 4.9529047682526716e-05, "loss": 1.4937264442443847, "mean_token_accuracy": 0.6793396513909101, "num_tokens": 10380442.0, "step": 5260 }, { "entropy": 1.4401488423347473, "epoch": 0.15095312432865962, "grad_norm": 7.15625, "learning_rate": 4.95268405341511e-05, "loss": 1.5216401100158692, "mean_token_accuracy": 0.6716520003974438, "num_tokens": 10400570.0, "step": 5270 }, { "entropy": 1.449067098274827, "epoch": 0.15123956289474816, "grad_norm": 8.3125, "learning_rate": 4.952462827529745e-05, "loss": 1.4734996795654296, "mean_token_accuracy": 0.685632624477148, "num_tokens": 10419978.0, "step": 5280 }, { "entropy": 1.5881035834550858, "epoch": 0.1515260014608367, "grad_norm": 8.0, "learning_rate": 4.952241090642673e-05, "loss": 1.5667628288269042, "mean_token_accuracy": 0.6578472722321749, "num_tokens": 10439581.0, "step": 5290 }, { "entropy": 1.3544663984328509, "epoch": 0.15181244002692523, "grad_norm": 8.3125, "learning_rate": 4.9520188428000945e-05, "loss": 1.4386282920837403, "mean_token_accuracy": 0.6912245389074088, "num_tokens": 10458254.0, "step": 5300 }, { "entropy": 1.4365281619131565, "epoch": 0.15209887859301377, "grad_norm": 7.53125, "learning_rate": 4.951796084048318e-05, "loss": 1.466072940826416, "mean_token_accuracy": 0.6794659815728664, "num_tokens": 10477263.0, "step": 5310 }, { "entropy": 1.5558462772518395, "epoch": 0.1523853171591023, "grad_norm": 8.125, "learning_rate": 4.9515728144337586e-05, "loss": 1.5894271850585937, "mean_token_accuracy": 0.6573893807828426, "num_tokens": 10498470.0, "step": 5320 }, { "entropy": 1.4525925662368535, "epoch": 0.15267175572519084, "grad_norm": 10.875, "learning_rate": 4.951349034002937e-05, "loss": 1.5502291679382325, "mean_token_accuracy": 0.665329060703516, "num_tokens": 10517680.0, "step": 5330 }, { "entropy": 1.513069298863411, "epoch": 0.15295819429127938, "grad_norm": 7.59375, "learning_rate": 4.9511247428024806e-05, "loss": 1.5275460243225099, "mean_token_accuracy": 0.6618064153939486, "num_tokens": 10537379.0, "step": 5340 }, { "entropy": 1.4216542765498161, "epoch": 0.15324463285736792, "grad_norm": 11.375, "learning_rate": 4.950899940879123e-05, "loss": 1.4662826538085938, "mean_token_accuracy": 0.6781281795352697, "num_tokens": 10556156.0, "step": 5350 }, { "entropy": 1.5469950869679452, "epoch": 0.15353107142345646, "grad_norm": 10.125, "learning_rate": 4.950674628279706e-05, "loss": 1.6273674011230468, "mean_token_accuracy": 0.6543409667909146, "num_tokens": 10576813.0, "step": 5360 }, { "entropy": 1.4365376845002173, "epoch": 0.153817509989545, "grad_norm": 8.5, "learning_rate": 4.9504488050511747e-05, "loss": 1.449380588531494, "mean_token_accuracy": 0.6771000474691391, "num_tokens": 10596672.0, "step": 5370 }, { "entropy": 1.4803869400173426, "epoch": 0.15410394855563353, "grad_norm": 10.5, "learning_rate": 4.950222471240583e-05, "loss": 1.6092044830322265, "mean_token_accuracy": 0.6441299144178629, "num_tokens": 10615364.0, "step": 5380 }, { "entropy": 1.577774827182293, "epoch": 0.15439038712172207, "grad_norm": 8.8125, "learning_rate": 4.94999562689509e-05, "loss": 1.5489473342895508, "mean_token_accuracy": 0.670935046672821, "num_tokens": 10636236.0, "step": 5390 }, { "entropy": 1.5271467573940753, "epoch": 0.1546768256878106, "grad_norm": 9.125, "learning_rate": 4.949768272061962e-05, "loss": 1.5601237297058106, "mean_token_accuracy": 0.6636587370187044, "num_tokens": 10656497.0, "step": 5400 }, { "entropy": 1.4755383789539338, "epoch": 0.15496326425389914, "grad_norm": 12.375, "learning_rate": 4.949540406788571e-05, "loss": 1.617512321472168, "mean_token_accuracy": 0.6448015566915274, "num_tokens": 10676827.0, "step": 5410 }, { "entropy": 1.5340559579432012, "epoch": 0.15524970281998768, "grad_norm": 10.375, "learning_rate": 4.9493120311223964e-05, "loss": 1.5395313262939454, "mean_token_accuracy": 0.6689881380647421, "num_tokens": 10696596.0, "step": 5420 }, { "entropy": 1.4465421587228775, "epoch": 0.15553614138607622, "grad_norm": 8.3125, "learning_rate": 4.949083145111021e-05, "loss": 1.4482954025268555, "mean_token_accuracy": 0.6931252546608448, "num_tokens": 10716557.0, "step": 5430 }, { "entropy": 1.4735890928655864, "epoch": 0.15582257995216475, "grad_norm": 7.6875, "learning_rate": 4.948853748802139e-05, "loss": 1.6091737747192383, "mean_token_accuracy": 0.6571174290031194, "num_tokens": 10736652.0, "step": 5440 }, { "entropy": 1.4969568315893411, "epoch": 0.1561090185182533, "grad_norm": 10.3125, "learning_rate": 4.948623842243546e-05, "loss": 1.5009947776794434, "mean_token_accuracy": 0.6735967800021172, "num_tokens": 10756238.0, "step": 5450 }, { "entropy": 1.3353195700794458, "epoch": 0.15639545708434183, "grad_norm": 17.0, "learning_rate": 4.9483934254831463e-05, "loss": 1.3614046096801757, "mean_token_accuracy": 0.6964558508247137, "num_tokens": 10775753.0, "step": 5460 }, { "entropy": 1.316618399694562, "epoch": 0.15668189565043036, "grad_norm": 8.5, "learning_rate": 4.9481624985689506e-05, "loss": 1.4229409217834472, "mean_token_accuracy": 0.6905061881989241, "num_tokens": 10794651.0, "step": 5470 }, { "entropy": 1.445284367352724, "epoch": 0.1569683342165189, "grad_norm": 11.5625, "learning_rate": 4.947931061549075e-05, "loss": 1.5132107734680176, "mean_token_accuracy": 0.6724000908434391, "num_tokens": 10814677.0, "step": 5480 }, { "entropy": 1.4952793795615436, "epoch": 0.15725477278260744, "grad_norm": 8.5625, "learning_rate": 4.947699114471743e-05, "loss": 1.4845052719116212, "mean_token_accuracy": 0.6772314850240946, "num_tokens": 10833035.0, "step": 5490 }, { "entropy": 1.4620481140911579, "epoch": 0.15754121134869598, "grad_norm": 10.6875, "learning_rate": 4.947466657385284e-05, "loss": 1.439906406402588, "mean_token_accuracy": 0.679519497230649, "num_tokens": 10852990.0, "step": 5500 }, { "entropy": 1.3291530303657055, "epoch": 0.15782764991478454, "grad_norm": 9.25, "learning_rate": 4.947233690338131e-05, "loss": 1.3231815338134765, "mean_token_accuracy": 0.6966482844203711, "num_tokens": 10872874.0, "step": 5510 }, { "entropy": 1.4696352612227201, "epoch": 0.15811408848087308, "grad_norm": 7.9375, "learning_rate": 4.947000213378828e-05, "loss": 1.5467846870422364, "mean_token_accuracy": 0.6598045524209738, "num_tokens": 10892742.0, "step": 5520 }, { "entropy": 1.4622251082211732, "epoch": 0.15840052704696161, "grad_norm": 9.4375, "learning_rate": 4.9467662265560235e-05, "loss": 1.5740177154541015, "mean_token_accuracy": 0.6724891006946564, "num_tokens": 10910712.0, "step": 5530 }, { "entropy": 1.5368123035877943, "epoch": 0.15868696561305015, "grad_norm": 8.9375, "learning_rate": 4.946531729918469e-05, "loss": 1.6157594680786134, "mean_token_accuracy": 0.6584647875279188, "num_tokens": 10930699.0, "step": 5540 }, { "entropy": 1.471268993616104, "epoch": 0.1589734041791387, "grad_norm": 7.0, "learning_rate": 4.946296723515026e-05, "loss": 1.5040043830871581, "mean_token_accuracy": 0.6715310331434011, "num_tokens": 10951002.0, "step": 5550 }, { "entropy": 1.498399916291237, "epoch": 0.15925984274522723, "grad_norm": 11.5625, "learning_rate": 4.946061207394662e-05, "loss": 1.5332067489624024, "mean_token_accuracy": 0.6573239173740149, "num_tokens": 10971945.0, "step": 5560 }, { "entropy": 1.562719462811947, "epoch": 0.15954628131131576, "grad_norm": 8.9375, "learning_rate": 4.945825181606448e-05, "loss": 1.6053812026977539, "mean_token_accuracy": 0.6590887267142534, "num_tokens": 10992197.0, "step": 5570 }, { "entropy": 1.4622655007988214, "epoch": 0.1598327198774043, "grad_norm": 9.1875, "learning_rate": 4.9455886461995646e-05, "loss": 1.471405029296875, "mean_token_accuracy": 0.6774644616991281, "num_tokens": 11012688.0, "step": 5580 }, { "entropy": 1.4587391506880523, "epoch": 0.16011915844349284, "grad_norm": 8.6875, "learning_rate": 4.9453516012232966e-05, "loss": 1.51792573928833, "mean_token_accuracy": 0.6790623251348734, "num_tokens": 11032883.0, "step": 5590 }, { "entropy": 1.3946425825357438, "epoch": 0.16040559700958137, "grad_norm": 12.75, "learning_rate": 4.945114046727035e-05, "loss": 1.4670876502990722, "mean_token_accuracy": 0.6826338931918144, "num_tokens": 11052108.0, "step": 5600 }, { "entropy": 1.4580876618623733, "epoch": 0.1606920355756699, "grad_norm": 8.3125, "learning_rate": 4.9448759827602765e-05, "loss": 1.5252602577209473, "mean_token_accuracy": 0.675988496094942, "num_tokens": 11071728.0, "step": 5610 }, { "entropy": 1.6357592076063157, "epoch": 0.16097847414175845, "grad_norm": 8.875, "learning_rate": 4.9446374093726266e-05, "loss": 1.7047426223754882, "mean_token_accuracy": 0.633384408429265, "num_tokens": 11092369.0, "step": 5620 }, { "entropy": 1.4805690959095954, "epoch": 0.16126491270784699, "grad_norm": 10.5, "learning_rate": 4.944398326613793e-05, "loss": 1.5725739479064942, "mean_token_accuracy": 0.6648765787482261, "num_tokens": 11112188.0, "step": 5630 }, { "entropy": 1.5275758005678655, "epoch": 0.16155135127393552, "grad_norm": 9.125, "learning_rate": 4.944158734533594e-05, "loss": 1.470158004760742, "mean_token_accuracy": 0.6798445299267769, "num_tokens": 11131086.0, "step": 5640 }, { "entropy": 1.3688059270381927, "epoch": 0.16183778984002406, "grad_norm": 7.15625, "learning_rate": 4.9439186331819486e-05, "loss": 1.3968552589416503, "mean_token_accuracy": 0.6856072615832091, "num_tokens": 11151279.0, "step": 5650 }, { "entropy": 1.3473737981170415, "epoch": 0.1621242284061126, "grad_norm": 9.0, "learning_rate": 4.943678022608888e-05, "loss": 1.4398218154907227, "mean_token_accuracy": 0.6887608714401722, "num_tokens": 11171788.0, "step": 5660 }, { "entropy": 1.4796992752701044, "epoch": 0.16241066697220113, "grad_norm": 10.125, "learning_rate": 4.943436902864545e-05, "loss": 1.5150390625, "mean_token_accuracy": 0.6665746040642262, "num_tokens": 11190690.0, "step": 5670 }, { "entropy": 1.4906470637768507, "epoch": 0.16269710553828967, "grad_norm": 8.25, "learning_rate": 4.94319527399916e-05, "loss": 1.5597380638122558, "mean_token_accuracy": 0.6585033319890499, "num_tokens": 11210066.0, "step": 5680 }, { "entropy": 1.445562968403101, "epoch": 0.1629835441043782, "grad_norm": 6.75, "learning_rate": 4.942953136063079e-05, "loss": 1.4560264587402343, "mean_token_accuracy": 0.6677102066576481, "num_tokens": 11229810.0, "step": 5690 }, { "entropy": 1.48755826279521, "epoch": 0.16326998267046675, "grad_norm": 7.28125, "learning_rate": 4.942710489106755e-05, "loss": 1.5455761909484864, "mean_token_accuracy": 0.6614343244582415, "num_tokens": 11251400.0, "step": 5700 }, { "entropy": 1.4296566624194385, "epoch": 0.16355642123655528, "grad_norm": 8.9375, "learning_rate": 4.942467333180748e-05, "loss": 1.5093473434448241, "mean_token_accuracy": 0.6593443274497985, "num_tokens": 11271813.0, "step": 5710 }, { "entropy": 1.5249940477311612, "epoch": 0.16384285980264382, "grad_norm": 9.6875, "learning_rate": 4.94222366833572e-05, "loss": 1.5830157279968262, "mean_token_accuracy": 0.6588814780116081, "num_tokens": 11292623.0, "step": 5720 }, { "entropy": 1.4762375630438327, "epoch": 0.16412929836873236, "grad_norm": 9.4375, "learning_rate": 4.941979494622443e-05, "loss": 1.4806387901306153, "mean_token_accuracy": 0.6740219008177519, "num_tokens": 11313530.0, "step": 5730 }, { "entropy": 1.5683625414967537, "epoch": 0.1644157369348209, "grad_norm": 8.875, "learning_rate": 4.941734812091794e-05, "loss": 1.6385662078857421, "mean_token_accuracy": 0.6370994074270129, "num_tokens": 11332156.0, "step": 5740 }, { "entropy": 1.4443510707467795, "epoch": 0.16470217550090943, "grad_norm": 8.1875, "learning_rate": 4.9414896207947547e-05, "loss": 1.4884693145751953, "mean_token_accuracy": 0.6757148705422878, "num_tokens": 11351052.0, "step": 5750 }, { "entropy": 1.4852353297173977, "epoch": 0.16498861406699797, "grad_norm": 10.25, "learning_rate": 4.941243920782415e-05, "loss": 1.5405843734741211, "mean_token_accuracy": 0.6612853478640318, "num_tokens": 11370918.0, "step": 5760 }, { "entropy": 1.495937005057931, "epoch": 0.1652750526330865, "grad_norm": 9.75, "learning_rate": 4.940997712105969e-05, "loss": 1.5172706604003907, "mean_token_accuracy": 0.6814956789836287, "num_tokens": 11390959.0, "step": 5770 }, { "entropy": 1.4493368919938803, "epoch": 0.16556149119917507, "grad_norm": 9.3125, "learning_rate": 4.940750994816717e-05, "loss": 1.5447139739990234, "mean_token_accuracy": 0.671611413732171, "num_tokens": 11410801.0, "step": 5780 }, { "entropy": 1.4292007364332675, "epoch": 0.1658479297652636, "grad_norm": 10.625, "learning_rate": 4.940503768966066e-05, "loss": 1.4733223915100098, "mean_token_accuracy": 0.6725025560706854, "num_tokens": 11430375.0, "step": 5790 }, { "entropy": 1.5424027353525163, "epoch": 0.16613436833135214, "grad_norm": 9.1875, "learning_rate": 4.9402560346055295e-05, "loss": 1.5172248840332032, "mean_token_accuracy": 0.6698197159916163, "num_tokens": 11450377.0, "step": 5800 }, { "entropy": 1.461921089887619, "epoch": 0.16642080689744068, "grad_norm": 7.25, "learning_rate": 4.940007791786724e-05, "loss": 1.5484451293945312, "mean_token_accuracy": 0.6609391871839762, "num_tokens": 11470439.0, "step": 5810 }, { "entropy": 1.510815527662635, "epoch": 0.16670724546352922, "grad_norm": 7.9375, "learning_rate": 4.939759040561377e-05, "loss": 1.5555777549743652, "mean_token_accuracy": 0.6504639558494091, "num_tokens": 11491305.0, "step": 5820 }, { "entropy": 1.4381535571068524, "epoch": 0.16699368402961776, "grad_norm": 6.21875, "learning_rate": 4.9395097809813163e-05, "loss": 1.456609344482422, "mean_token_accuracy": 0.6757194273173809, "num_tokens": 11511334.0, "step": 5830 }, { "entropy": 1.4057760030031203, "epoch": 0.1672801225957063, "grad_norm": 7.53125, "learning_rate": 4.939260013098479e-05, "loss": 1.5399243354797363, "mean_token_accuracy": 0.6671665336936712, "num_tokens": 11531986.0, "step": 5840 }, { "entropy": 1.4422939270734787, "epoch": 0.16756656116179483, "grad_norm": 7.34375, "learning_rate": 4.939009736964908e-05, "loss": 1.3935338973999023, "mean_token_accuracy": 0.6853090669959784, "num_tokens": 11551264.0, "step": 5850 }, { "entropy": 1.3780545085668563, "epoch": 0.16785299972788337, "grad_norm": 10.625, "learning_rate": 4.9387589526327515e-05, "loss": 1.4793409347534179, "mean_token_accuracy": 0.6712892156094312, "num_tokens": 11571522.0, "step": 5860 }, { "entropy": 1.3406000778079032, "epoch": 0.1681394382939719, "grad_norm": 7.9375, "learning_rate": 4.9385076601542637e-05, "loss": 1.394017219543457, "mean_token_accuracy": 0.6953121948987245, "num_tokens": 11592141.0, "step": 5870 }, { "entropy": 1.3953971412032842, "epoch": 0.16842587686006044, "grad_norm": 10.1875, "learning_rate": 4.938255859581803e-05, "loss": 1.4208333015441894, "mean_token_accuracy": 0.6905218441039324, "num_tokens": 11611976.0, "step": 5880 }, { "entropy": 1.3557428650557994, "epoch": 0.16871231542614898, "grad_norm": 11.25, "learning_rate": 4.938003550967837e-05, "loss": 1.417108154296875, "mean_token_accuracy": 0.6836075335741043, "num_tokens": 11630785.0, "step": 5890 }, { "entropy": 1.3994893398135901, "epoch": 0.16899875399223752, "grad_norm": 7.0625, "learning_rate": 4.937750734364937e-05, "loss": 1.4636310577392577, "mean_token_accuracy": 0.6778811745345592, "num_tokens": 11649442.0, "step": 5900 }, { "entropy": 1.4923362039029597, "epoch": 0.16928519255832605, "grad_norm": 8.375, "learning_rate": 4.9374974098257804e-05, "loss": 1.5292404174804688, "mean_token_accuracy": 0.6646040573716163, "num_tokens": 11670628.0, "step": 5910 }, { "entropy": 1.4678036846220492, "epoch": 0.1695716311244146, "grad_norm": 10.375, "learning_rate": 4.93724357740315e-05, "loss": 1.5391175270080566, "mean_token_accuracy": 0.6676683530211449, "num_tokens": 11690935.0, "step": 5920 }, { "entropy": 1.4951945878565311, "epoch": 0.16985806969050313, "grad_norm": 9.1875, "learning_rate": 4.936989237149936e-05, "loss": 1.5292593002319337, "mean_token_accuracy": 0.6699582532048225, "num_tokens": 11711860.0, "step": 5930 }, { "entropy": 1.5030835304409265, "epoch": 0.17014450825659166, "grad_norm": 8.8125, "learning_rate": 4.936734389119133e-05, "loss": 1.6066200256347656, "mean_token_accuracy": 0.6637712214142084, "num_tokens": 11731687.0, "step": 5940 }, { "entropy": 1.5041240505874156, "epoch": 0.1704309468226802, "grad_norm": 12.1875, "learning_rate": 4.936479033363842e-05, "loss": 1.521602725982666, "mean_token_accuracy": 0.6634639570489526, "num_tokens": 11750091.0, "step": 5950 }, { "entropy": 1.5377890944480896, "epoch": 0.17071738538876874, "grad_norm": 8.4375, "learning_rate": 4.9362231699372687e-05, "loss": 1.5145090103149415, "mean_token_accuracy": 0.6646853685379028, "num_tokens": 11770172.0, "step": 5960 }, { "entropy": 1.4608060277998447, "epoch": 0.17100382395485728, "grad_norm": 10.125, "learning_rate": 4.935966798892727e-05, "loss": 1.556221103668213, "mean_token_accuracy": 0.6546224039047956, "num_tokens": 11788765.0, "step": 5970 }, { "entropy": 1.4546675749123097, "epoch": 0.1712902625209458, "grad_norm": 7.40625, "learning_rate": 4.935709920283633e-05, "loss": 1.5009776115417481, "mean_token_accuracy": 0.6849946957081556, "num_tokens": 11808432.0, "step": 5980 }, { "entropy": 1.4300529669970274, "epoch": 0.17157670108703435, "grad_norm": 9.25, "learning_rate": 4.9354525341635125e-05, "loss": 1.4588123321533204, "mean_token_accuracy": 0.6799989931285382, "num_tokens": 11826682.0, "step": 5990 }, { "entropy": 1.4362173832952976, "epoch": 0.1718631396531229, "grad_norm": 10.8125, "learning_rate": 4.935194640585995e-05, "loss": 1.4461870193481445, "mean_token_accuracy": 0.6857102800160646, "num_tokens": 11846458.0, "step": 6000 }, { "entropy": 1.3662438299506903, "epoch": 0.17214957821921142, "grad_norm": 8.6875, "learning_rate": 4.934936239604815e-05, "loss": 1.4425847053527832, "mean_token_accuracy": 0.679301156103611, "num_tokens": 11866440.0, "step": 6010 }, { "entropy": 1.4570660717785358, "epoch": 0.17243601678529996, "grad_norm": 8.625, "learning_rate": 4.9346773312738136e-05, "loss": 1.6374954223632812, "mean_token_accuracy": 0.6570733428001404, "num_tokens": 11885770.0, "step": 6020 }, { "entropy": 1.4791229892522098, "epoch": 0.1727224553513885, "grad_norm": 9.6875, "learning_rate": 4.934417915646939e-05, "loss": 1.3939291954040527, "mean_token_accuracy": 0.6806836210191249, "num_tokens": 11907690.0, "step": 6030 }, { "entropy": 1.478437875583768, "epoch": 0.17300889391747704, "grad_norm": 10.875, "learning_rate": 4.934157992778242e-05, "loss": 1.5354734420776368, "mean_token_accuracy": 0.6639037605375051, "num_tokens": 11927047.0, "step": 6040 }, { "entropy": 1.3138850256800652, "epoch": 0.1732953324835656, "grad_norm": 9.875, "learning_rate": 4.933897562721882e-05, "loss": 1.3663606643676758, "mean_token_accuracy": 0.6979944676160812, "num_tokens": 11947227.0, "step": 6050 }, { "entropy": 1.3479141156189143, "epoch": 0.17358177104965414, "grad_norm": 6.96875, "learning_rate": 4.933636625532122e-05, "loss": 1.4165874481201173, "mean_token_accuracy": 0.6908961161971092, "num_tokens": 11966928.0, "step": 6060 }, { "entropy": 1.3815735965967177, "epoch": 0.17386820961574267, "grad_norm": 9.625, "learning_rate": 4.9333751812633324e-05, "loss": 1.4103723526000977, "mean_token_accuracy": 0.6743574034422636, "num_tokens": 11985932.0, "step": 6070 }, { "entropy": 1.4296928144991399, "epoch": 0.1741546481818312, "grad_norm": 10.3125, "learning_rate": 4.933113229969988e-05, "loss": 1.4588019371032714, "mean_token_accuracy": 0.6884045783430338, "num_tokens": 12005519.0, "step": 6080 }, { "entropy": 1.405590706691146, "epoch": 0.17444108674791975, "grad_norm": 7.5, "learning_rate": 4.93285077170667e-05, "loss": 1.496517276763916, "mean_token_accuracy": 0.6813424073159695, "num_tokens": 12025617.0, "step": 6090 }, { "entropy": 1.3568504810333253, "epoch": 0.1747275253140083, "grad_norm": 7.75, "learning_rate": 4.932587806528064e-05, "loss": 1.3935050010681151, "mean_token_accuracy": 0.6781116556376219, "num_tokens": 12045534.0, "step": 6100 }, { "entropy": 1.4660755727440118, "epoch": 0.17501396388009682, "grad_norm": 8.0, "learning_rate": 4.932324334488964e-05, "loss": 1.5551608085632325, "mean_token_accuracy": 0.6606322910636664, "num_tokens": 12064832.0, "step": 6110 }, { "entropy": 1.3736946443095803, "epoch": 0.17530040244618536, "grad_norm": 5.8125, "learning_rate": 4.932060355644266e-05, "loss": 1.3521848678588868, "mean_token_accuracy": 0.705763791501522, "num_tokens": 12085203.0, "step": 6120 }, { "entropy": 1.4741830304265022, "epoch": 0.1755868410122739, "grad_norm": 6.90625, "learning_rate": 4.931795870048973e-05, "loss": 1.5091776847839355, "mean_token_accuracy": 0.6733026508241892, "num_tokens": 12103873.0, "step": 6130 }, { "entropy": 1.3984277080744505, "epoch": 0.17587327957836243, "grad_norm": 7.8125, "learning_rate": 4.931530877758196e-05, "loss": 1.522230339050293, "mean_token_accuracy": 0.6791554145514965, "num_tokens": 12124552.0, "step": 6140 }, { "entropy": 1.460199267603457, "epoch": 0.17615971814445097, "grad_norm": 8.875, "learning_rate": 4.931265378827147e-05, "loss": 1.515638828277588, "mean_token_accuracy": 0.6675545807927847, "num_tokens": 12143673.0, "step": 6150 }, { "entropy": 1.4435635447502135, "epoch": 0.1764461567105395, "grad_norm": 10.75, "learning_rate": 4.930999373311149e-05, "loss": 1.468454360961914, "mean_token_accuracy": 0.67950121127069, "num_tokens": 12162407.0, "step": 6160 }, { "entropy": 1.3270676020532846, "epoch": 0.17673259527662805, "grad_norm": 7.8125, "learning_rate": 4.9307328612656245e-05, "loss": 1.2954941749572755, "mean_token_accuracy": 0.70622633472085, "num_tokens": 12181587.0, "step": 6170 }, { "entropy": 1.37058818154037, "epoch": 0.17701903384271658, "grad_norm": 6.90625, "learning_rate": 4.930465842746107e-05, "loss": 1.4363130569458007, "mean_token_accuracy": 0.6902893602848053, "num_tokens": 12201885.0, "step": 6180 }, { "entropy": 1.3929596975445748, "epoch": 0.17730547240880512, "grad_norm": 8.1875, "learning_rate": 4.9301983178082325e-05, "loss": 1.4469818115234374, "mean_token_accuracy": 0.6855168022215367, "num_tokens": 12223135.0, "step": 6190 }, { "entropy": 1.364348041638732, "epoch": 0.17759191097489366, "grad_norm": 10.9375, "learning_rate": 4.929930286507742e-05, "loss": 1.437267017364502, "mean_token_accuracy": 0.6770233936607838, "num_tokens": 12243979.0, "step": 6200 }, { "entropy": 1.31310056373477, "epoch": 0.1778783495409822, "grad_norm": 8.9375, "learning_rate": 4.929661748900485e-05, "loss": 1.4153963088989259, "mean_token_accuracy": 0.6900998506695032, "num_tokens": 12263315.0, "step": 6210 }, { "entropy": 1.4167314041405916, "epoch": 0.17816478810707073, "grad_norm": 9.0625, "learning_rate": 4.929392705042414e-05, "loss": 1.394523811340332, "mean_token_accuracy": 0.684620825573802, "num_tokens": 12285429.0, "step": 6220 }, { "entropy": 1.4154333420097829, "epoch": 0.17845122667315927, "grad_norm": 8.8125, "learning_rate": 4.9291231549895875e-05, "loss": 1.4673789978027343, "mean_token_accuracy": 0.6823446007445455, "num_tokens": 12304339.0, "step": 6230 }, { "entropy": 1.4152748204767704, "epoch": 0.1787376652392478, "grad_norm": 9.1875, "learning_rate": 4.9288530987981706e-05, "loss": 1.479453182220459, "mean_token_accuracy": 0.6812618706375361, "num_tokens": 12324831.0, "step": 6240 }, { "entropy": 1.5209394287317992, "epoch": 0.17902410380533634, "grad_norm": 8.4375, "learning_rate": 4.928582536524432e-05, "loss": 1.6179141998291016, "mean_token_accuracy": 0.6539077125489712, "num_tokens": 12343718.0, "step": 6250 }, { "entropy": 1.4698548503220081, "epoch": 0.17931054237142488, "grad_norm": 8.75, "learning_rate": 4.928311468224746e-05, "loss": 1.53178071975708, "mean_token_accuracy": 0.6720730647444725, "num_tokens": 12363617.0, "step": 6260 }, { "entropy": 1.397044263407588, "epoch": 0.17959698093751342, "grad_norm": 8.5625, "learning_rate": 4.9280398939555946e-05, "loss": 1.3592684745788575, "mean_token_accuracy": 0.7023213289678096, "num_tokens": 12383165.0, "step": 6270 }, { "entropy": 1.4452381137758494, "epoch": 0.17988341950360195, "grad_norm": 9.5625, "learning_rate": 4.927767813773563e-05, "loss": 1.466906452178955, "mean_token_accuracy": 0.6895480569452047, "num_tokens": 12401246.0, "step": 6280 }, { "entropy": 1.5307133223861455, "epoch": 0.1801698580696905, "grad_norm": 8.5625, "learning_rate": 4.927495227735344e-05, "loss": 1.5598388671875, "mean_token_accuracy": 0.6604364186525344, "num_tokens": 12420404.0, "step": 6290 }, { "entropy": 1.348336521908641, "epoch": 0.18045629663577903, "grad_norm": 8.0, "learning_rate": 4.9272221358977316e-05, "loss": 1.4303204536437988, "mean_token_accuracy": 0.6852028977125884, "num_tokens": 12440555.0, "step": 6300 }, { "entropy": 1.5626192063093185, "epoch": 0.18074273520186757, "grad_norm": 6.65625, "learning_rate": 4.92694853831763e-05, "loss": 1.6378677368164063, "mean_token_accuracy": 0.6500140890479088, "num_tokens": 12460358.0, "step": 6310 }, { "entropy": 1.4973537605255842, "epoch": 0.18102917376795613, "grad_norm": 8.5625, "learning_rate": 4.926674435052047e-05, "loss": 1.4961321830749512, "mean_token_accuracy": 0.6632638920098544, "num_tokens": 12479034.0, "step": 6320 }, { "entropy": 1.4329667635262013, "epoch": 0.18131561233404467, "grad_norm": 9.125, "learning_rate": 4.9263998261580934e-05, "loss": 1.476184368133545, "mean_token_accuracy": 0.6747637540102005, "num_tokens": 12498030.0, "step": 6330 }, { "entropy": 1.3940817721188068, "epoch": 0.1816020509001332, "grad_norm": 10.3125, "learning_rate": 4.926124711692989e-05, "loss": 1.4757598876953124, "mean_token_accuracy": 0.6866230014711618, "num_tokens": 12519029.0, "step": 6340 }, { "entropy": 1.5069569904357194, "epoch": 0.18188848946622174, "grad_norm": 9.3125, "learning_rate": 4.925849091714058e-05, "loss": 1.5763851165771485, "mean_token_accuracy": 0.6652629725635052, "num_tokens": 12539227.0, "step": 6350 }, { "entropy": 1.5136225722730159, "epoch": 0.18217492803231028, "grad_norm": 7.15625, "learning_rate": 4.925572966278727e-05, "loss": 1.4926812171936035, "mean_token_accuracy": 0.6646001763641834, "num_tokens": 12558725.0, "step": 6360 }, { "entropy": 1.4106845064088702, "epoch": 0.18246136659839882, "grad_norm": 7.21875, "learning_rate": 4.9252963354445324e-05, "loss": 1.405810260772705, "mean_token_accuracy": 0.6982049446552991, "num_tokens": 12578659.0, "step": 6370 }, { "entropy": 1.4251727391034366, "epoch": 0.18274780516448735, "grad_norm": 8.8125, "learning_rate": 4.925019199269113e-05, "loss": 1.4651846885681152, "mean_token_accuracy": 0.6776089437305928, "num_tokens": 12598023.0, "step": 6380 }, { "entropy": 1.292552138119936, "epoch": 0.1830342437305759, "grad_norm": 8.5, "learning_rate": 4.924741557810214e-05, "loss": 1.4057302474975586, "mean_token_accuracy": 0.6797358829528093, "num_tokens": 12618866.0, "step": 6390 }, { "entropy": 1.5226835690438747, "epoch": 0.18332068229666443, "grad_norm": 10.1875, "learning_rate": 4.924463411125685e-05, "loss": 1.57452449798584, "mean_token_accuracy": 0.6664018632844091, "num_tokens": 12638459.0, "step": 6400 }, { "entropy": 1.393143067136407, "epoch": 0.18360712086275296, "grad_norm": 8.8125, "learning_rate": 4.924184759273481e-05, "loss": 1.3292108535766602, "mean_token_accuracy": 0.7019755341112613, "num_tokens": 12658292.0, "step": 6410 }, { "entropy": 1.367004668340087, "epoch": 0.1838935594288415, "grad_norm": 7.53125, "learning_rate": 4.9239056023116634e-05, "loss": 1.4254454612731933, "mean_token_accuracy": 0.6795507505536079, "num_tokens": 12678574.0, "step": 6420 }, { "entropy": 1.2903104435652495, "epoch": 0.18417999799493004, "grad_norm": 8.25, "learning_rate": 4.923625940298398e-05, "loss": 1.36850004196167, "mean_token_accuracy": 0.704938055574894, "num_tokens": 12697885.0, "step": 6430 }, { "entropy": 1.3884007036685944, "epoch": 0.18446643656101858, "grad_norm": 8.5, "learning_rate": 4.9233457732919555e-05, "loss": 1.4910995483398437, "mean_token_accuracy": 0.680659681558609, "num_tokens": 12717722.0, "step": 6440 }, { "entropy": 1.490414746105671, "epoch": 0.1847528751271071, "grad_norm": 6.65625, "learning_rate": 4.923065101350713e-05, "loss": 1.522986888885498, "mean_token_accuracy": 0.6765483394265175, "num_tokens": 12736489.0, "step": 6450 }, { "entropy": 1.4720280453562737, "epoch": 0.18503931369319565, "grad_norm": 7.71875, "learning_rate": 4.9227839245331516e-05, "loss": 1.5006288528442382, "mean_token_accuracy": 0.6681873235851526, "num_tokens": 12755222.0, "step": 6460 }, { "entropy": 1.4506388876587153, "epoch": 0.1853257522592842, "grad_norm": 7.9375, "learning_rate": 4.922502242897857e-05, "loss": 1.413188362121582, "mean_token_accuracy": 0.6782549951225519, "num_tokens": 12775091.0, "step": 6470 }, { "entropy": 1.366637199744582, "epoch": 0.18561219082537272, "grad_norm": 8.875, "learning_rate": 4.922220056503524e-05, "loss": 1.4039117813110351, "mean_token_accuracy": 0.6915828939527273, "num_tokens": 12795057.0, "step": 6480 }, { "entropy": 1.352109369635582, "epoch": 0.18589862939146126, "grad_norm": 9.8125, "learning_rate": 4.9219373654089465e-05, "loss": 1.4554457664489746, "mean_token_accuracy": 0.6753610597923398, "num_tokens": 12814623.0, "step": 6490 }, { "entropy": 1.3736751217395067, "epoch": 0.1861850679575498, "grad_norm": 11.0625, "learning_rate": 4.921654169673029e-05, "loss": 1.454780387878418, "mean_token_accuracy": 0.6877236545085907, "num_tokens": 12832878.0, "step": 6500 }, { "entropy": 1.4073275100439786, "epoch": 0.18647150652363834, "grad_norm": 7.125, "learning_rate": 4.9213704693547776e-05, "loss": 1.3822728157043458, "mean_token_accuracy": 0.6995428606867791, "num_tokens": 12852910.0, "step": 6510 }, { "entropy": 1.4386454924941063, "epoch": 0.18675794508972687, "grad_norm": 8.0, "learning_rate": 4.921086264513305e-05, "loss": 1.5043425559997559, "mean_token_accuracy": 0.6692972086369992, "num_tokens": 12872515.0, "step": 6520 }, { "entropy": 1.285991306602955, "epoch": 0.1870443836558154, "grad_norm": 9.375, "learning_rate": 4.92080155520783e-05, "loss": 1.3467216491699219, "mean_token_accuracy": 0.7070346478372812, "num_tokens": 12891505.0, "step": 6530 }, { "entropy": 1.432631329074502, "epoch": 0.18733082222190395, "grad_norm": 9.25, "learning_rate": 4.920516341497674e-05, "loss": 1.479216957092285, "mean_token_accuracy": 0.6747622333467007, "num_tokens": 12912536.0, "step": 6540 }, { "entropy": 1.4515864118933677, "epoch": 0.18761726078799248, "grad_norm": 8.875, "learning_rate": 4.9202306234422654e-05, "loss": 1.5022727966308593, "mean_token_accuracy": 0.6815267663449049, "num_tokens": 12933252.0, "step": 6550 }, { "entropy": 1.5399513229727746, "epoch": 0.18790369935408102, "grad_norm": 7.125, "learning_rate": 4.919944401101138e-05, "loss": 1.5815183639526367, "mean_token_accuracy": 0.6569502755999566, "num_tokens": 12952633.0, "step": 6560 }, { "entropy": 1.4467506915330888, "epoch": 0.18819013792016956, "grad_norm": 8.0625, "learning_rate": 4.919657674533929e-05, "loss": 1.4737659454345704, "mean_token_accuracy": 0.6849691689014434, "num_tokens": 12972760.0, "step": 6570 }, { "entropy": 1.3586736030876636, "epoch": 0.1884765764862581, "grad_norm": 9.9375, "learning_rate": 4.919370443800382e-05, "loss": 1.406723403930664, "mean_token_accuracy": 0.6837186042219401, "num_tokens": 12993164.0, "step": 6580 }, { "entropy": 1.3812097579240799, "epoch": 0.18876301505234666, "grad_norm": 8.25, "learning_rate": 4.919082708960344e-05, "loss": 1.4273009300231934, "mean_token_accuracy": 0.6931082312017679, "num_tokens": 13013159.0, "step": 6590 }, { "entropy": 1.2081229861825704, "epoch": 0.1890494536184352, "grad_norm": 7.65625, "learning_rate": 4.918794470073769e-05, "loss": 1.1818126678466796, "mean_token_accuracy": 0.7259028639644385, "num_tokens": 13032257.0, "step": 6600 }, { "entropy": 1.318201196938753, "epoch": 0.18933589218452374, "grad_norm": 8.3125, "learning_rate": 4.9185057272007155e-05, "loss": 1.3800811767578125, "mean_token_accuracy": 0.6960328120738268, "num_tokens": 13052868.0, "step": 6610 }, { "entropy": 1.3484413038939238, "epoch": 0.18962233075061227, "grad_norm": 6.96875, "learning_rate": 4.9182164804013465e-05, "loss": 1.353172779083252, "mean_token_accuracy": 0.702847919613123, "num_tokens": 13074459.0, "step": 6620 }, { "entropy": 1.3870065543800592, "epoch": 0.1899087693167008, "grad_norm": 8.4375, "learning_rate": 4.917926729735931e-05, "loss": 1.4827387809753418, "mean_token_accuracy": 0.6740652158856392, "num_tokens": 13095271.0, "step": 6630 }, { "entropy": 1.4729616351425647, "epoch": 0.19019520788278935, "grad_norm": 10.125, "learning_rate": 4.91763647526484e-05, "loss": 1.5072721481323241, "mean_token_accuracy": 0.6807315915822982, "num_tokens": 13114929.0, "step": 6640 }, { "entropy": 1.4896713271737099, "epoch": 0.19048164644887788, "grad_norm": 8.25, "learning_rate": 4.9173457170485535e-05, "loss": 1.5076394081115723, "mean_token_accuracy": 0.6796420034021139, "num_tokens": 13136852.0, "step": 6650 }, { "entropy": 1.3522751234471797, "epoch": 0.19076808501496642, "grad_norm": 6.96875, "learning_rate": 4.917054455147655e-05, "loss": 1.4371529579162599, "mean_token_accuracy": 0.6883786235004663, "num_tokens": 13157567.0, "step": 6660 }, { "entropy": 1.5284927532076835, "epoch": 0.19105452358105496, "grad_norm": 9.75, "learning_rate": 4.9167626896228314e-05, "loss": 1.5774428367614746, "mean_token_accuracy": 0.6616813138127327, "num_tokens": 13177655.0, "step": 6670 }, { "entropy": 1.4974663585424424, "epoch": 0.1913409621471435, "grad_norm": 10.0625, "learning_rate": 4.9164704205348764e-05, "loss": 1.496504783630371, "mean_token_accuracy": 0.675908538326621, "num_tokens": 13198202.0, "step": 6680 }, { "entropy": 1.5301301073282958, "epoch": 0.19162740071323203, "grad_norm": 9.4375, "learning_rate": 4.9161776479446874e-05, "loss": 1.5955947875976562, "mean_token_accuracy": 0.6482728697359562, "num_tokens": 13218510.0, "step": 6690 }, { "entropy": 1.295935932546854, "epoch": 0.19191383927932057, "grad_norm": 8.9375, "learning_rate": 4.9158843719132685e-05, "loss": 1.2973398208618163, "mean_token_accuracy": 0.7062223497778177, "num_tokens": 13237165.0, "step": 6700 }, { "entropy": 1.4205248415470124, "epoch": 0.1922002778454091, "grad_norm": 8.25, "learning_rate": 4.915590592501727e-05, "loss": 1.4779239654541017, "mean_token_accuracy": 0.6763545289635658, "num_tokens": 13258616.0, "step": 6710 }, { "entropy": 1.3705434907227754, "epoch": 0.19248671641149764, "grad_norm": 8.125, "learning_rate": 4.915296309771273e-05, "loss": 1.3864919662475585, "mean_token_accuracy": 0.6900668147951364, "num_tokens": 13278025.0, "step": 6720 }, { "entropy": 1.3562137771397829, "epoch": 0.19277315497758618, "grad_norm": 8.75, "learning_rate": 4.915001523783228e-05, "loss": 1.4141832351684571, "mean_token_accuracy": 0.6804671116173268, "num_tokens": 13298283.0, "step": 6730 }, { "entropy": 1.4325556550174952, "epoch": 0.19305959354367472, "grad_norm": 7.0, "learning_rate": 4.914706234599012e-05, "loss": 1.4590951919555664, "mean_token_accuracy": 0.6808883346617222, "num_tokens": 13319915.0, "step": 6740 }, { "entropy": 1.3633572649210692, "epoch": 0.19334603210976326, "grad_norm": 8.375, "learning_rate": 4.914410442280154e-05, "loss": 1.3709599494934082, "mean_token_accuracy": 0.6933745093643665, "num_tokens": 13341115.0, "step": 6750 }, { "entropy": 1.436106476932764, "epoch": 0.1936324706758518, "grad_norm": 10.125, "learning_rate": 4.914114146888285e-05, "loss": 1.5386438369750977, "mean_token_accuracy": 0.6873976532369852, "num_tokens": 13361569.0, "step": 6760 }, { "entropy": 1.424841780588031, "epoch": 0.19391890924194033, "grad_norm": 7.96875, "learning_rate": 4.91381734848514e-05, "loss": 1.4642927169799804, "mean_token_accuracy": 0.68417604342103, "num_tokens": 13380885.0, "step": 6770 }, { "entropy": 1.3430028449743987, "epoch": 0.19420534780802887, "grad_norm": 9.0, "learning_rate": 4.913520047132564e-05, "loss": 1.372169589996338, "mean_token_accuracy": 0.6975071728229523, "num_tokens": 13399980.0, "step": 6780 }, { "entropy": 1.371938407421112, "epoch": 0.1944917863741174, "grad_norm": 9.0625, "learning_rate": 4.913222242892502e-05, "loss": 1.4246555328369142, "mean_token_accuracy": 0.6813033115118742, "num_tokens": 13421436.0, "step": 6790 }, { "entropy": 1.340294734016061, "epoch": 0.19477822494020594, "grad_norm": 7.71875, "learning_rate": 4.912923935827005e-05, "loss": 1.4265383720397948, "mean_token_accuracy": 0.6882929772138595, "num_tokens": 13443417.0, "step": 6800 }, { "entropy": 1.2730397436767817, "epoch": 0.19506466350629448, "grad_norm": 8.625, "learning_rate": 4.91262512599823e-05, "loss": 1.3082396507263183, "mean_token_accuracy": 0.7184704177081584, "num_tokens": 13462387.0, "step": 6810 }, { "entropy": 1.3208717335015536, "epoch": 0.19535110207238301, "grad_norm": 9.125, "learning_rate": 4.912325813468437e-05, "loss": 1.3207721710205078, "mean_token_accuracy": 0.7100768335163593, "num_tokens": 13482042.0, "step": 6820 }, { "entropy": 1.4038551222532987, "epoch": 0.19563754063847155, "grad_norm": 9.0, "learning_rate": 4.9120259982999915e-05, "loss": 1.5005281448364258, "mean_token_accuracy": 0.6722738459706307, "num_tokens": 13499911.0, "step": 6830 }, { "entropy": 1.4464069247245788, "epoch": 0.1959239792045601, "grad_norm": 10.6875, "learning_rate": 4.911725680555365e-05, "loss": 1.4625755310058595, "mean_token_accuracy": 0.6852853037416935, "num_tokens": 13518378.0, "step": 6840 }, { "entropy": 1.4794189643114806, "epoch": 0.19621041777064863, "grad_norm": 7.65625, "learning_rate": 4.91142486029713e-05, "loss": 1.6115404129028321, "mean_token_accuracy": 0.6563941441476345, "num_tokens": 13536499.0, "step": 6850 }, { "entropy": 1.4786843556910754, "epoch": 0.1964968563367372, "grad_norm": 8.125, "learning_rate": 4.9111235375879694e-05, "loss": 1.4864763259887694, "mean_token_accuracy": 0.6904301289469004, "num_tokens": 13556247.0, "step": 6860 }, { "entropy": 1.3732381880283355, "epoch": 0.19678329490282573, "grad_norm": 6.75, "learning_rate": 4.9108217124906655e-05, "loss": 1.3509425163269042, "mean_token_accuracy": 0.7018975906074048, "num_tokens": 13576284.0, "step": 6870 }, { "entropy": 1.242267757281661, "epoch": 0.19706973346891427, "grad_norm": 6.21875, "learning_rate": 4.910519385068108e-05, "loss": 1.2808285713195802, "mean_token_accuracy": 0.7185536555945873, "num_tokens": 13597002.0, "step": 6880 }, { "entropy": 1.2604170765727758, "epoch": 0.1973561720350028, "grad_norm": 7.375, "learning_rate": 4.91021655538329e-05, "loss": 1.3630292892456055, "mean_token_accuracy": 0.6981576796621084, "num_tokens": 13616383.0, "step": 6890 }, { "entropy": 1.3864607878029347, "epoch": 0.19764261060109134, "grad_norm": 8.25, "learning_rate": 4.909913223499311e-05, "loss": 1.363734245300293, "mean_token_accuracy": 0.6959175381809473, "num_tokens": 13635954.0, "step": 6900 }, { "entropy": 1.4197487790137528, "epoch": 0.19792904916717988, "grad_norm": 6.6875, "learning_rate": 4.909609389479373e-05, "loss": 1.5080803871154784, "mean_token_accuracy": 0.6763486627489328, "num_tokens": 13656450.0, "step": 6910 }, { "entropy": 1.3377501212060452, "epoch": 0.19821548773326841, "grad_norm": 8.5, "learning_rate": 4.909305053386785e-05, "loss": 1.4160242080688477, "mean_token_accuracy": 0.7016677893698215, "num_tokens": 13675328.0, "step": 6920 }, { "entropy": 1.4381409658119082, "epoch": 0.19850192629935695, "grad_norm": 8.8125, "learning_rate": 4.9090002152849573e-05, "loss": 1.3976792335510253, "mean_token_accuracy": 0.6895610600709915, "num_tokens": 13694442.0, "step": 6930 }, { "entropy": 1.456747367233038, "epoch": 0.1987883648654455, "grad_norm": 8.875, "learning_rate": 4.9086948752374085e-05, "loss": 1.504695510864258, "mean_token_accuracy": 0.6786894287914038, "num_tokens": 13713982.0, "step": 6940 }, { "entropy": 1.2406657040119171, "epoch": 0.19907480343153403, "grad_norm": 9.5, "learning_rate": 4.90838903330776e-05, "loss": 1.2401039123535156, "mean_token_accuracy": 0.7146953620016575, "num_tokens": 13732757.0, "step": 6950 }, { "entropy": 1.3115747354924678, "epoch": 0.19936124199762256, "grad_norm": 8.875, "learning_rate": 4.908082689559736e-05, "loss": 1.3519312858581543, "mean_token_accuracy": 0.7041184697300196, "num_tokens": 13752722.0, "step": 6960 }, { "entropy": 1.3855868946760892, "epoch": 0.1996476805637111, "grad_norm": 8.75, "learning_rate": 4.9077758440571704e-05, "loss": 1.5695975303649903, "mean_token_accuracy": 0.6662397995591164, "num_tokens": 13771213.0, "step": 6970 }, { "entropy": 1.3965993613004684, "epoch": 0.19993411912979964, "grad_norm": 7.625, "learning_rate": 4.907468496863995e-05, "loss": 1.3573946952819824, "mean_token_accuracy": 0.7015636142343282, "num_tokens": 13791964.0, "step": 6980 }, { "entropy": 1.3800709258764983, "epoch": 0.20022055769588817, "grad_norm": 8.0625, "learning_rate": 4.907160648044252e-05, "loss": 1.3914112091064452, "mean_token_accuracy": 0.7016227278858423, "num_tokens": 13812377.0, "step": 6990 }, { "entropy": 1.426254230365157, "epoch": 0.2005069962619767, "grad_norm": 8.0625, "learning_rate": 4.9068522976620836e-05, "loss": 1.4344714164733887, "mean_token_accuracy": 0.6788370661437512, "num_tokens": 13831345.0, "step": 7000 }, { "entropy": 1.3388535548001528, "epoch": 0.20079343482806525, "grad_norm": 8.75, "learning_rate": 4.90654344578174e-05, "loss": 1.4119460105895996, "mean_token_accuracy": 0.6951319318264723, "num_tokens": 13852178.0, "step": 7010 }, { "entropy": 1.445525447279215, "epoch": 0.20107987339415379, "grad_norm": 6.875, "learning_rate": 4.906234092467573e-05, "loss": 1.475074577331543, "mean_token_accuracy": 0.6768249820917844, "num_tokens": 13873038.0, "step": 7020 }, { "entropy": 1.3823361240327359, "epoch": 0.20136631196024232, "grad_norm": 8.125, "learning_rate": 4.9059242377840406e-05, "loss": 1.409123706817627, "mean_token_accuracy": 0.7008399046957493, "num_tokens": 13892299.0, "step": 7030 }, { "entropy": 1.4108676839619876, "epoch": 0.20165275052633086, "grad_norm": 6.65625, "learning_rate": 4.905613881795707e-05, "loss": 1.4193554878234864, "mean_token_accuracy": 0.6782151397317648, "num_tokens": 13913212.0, "step": 7040 }, { "entropy": 1.4194565132260322, "epoch": 0.2019391890924194, "grad_norm": 12.9375, "learning_rate": 4.905303024567236e-05, "loss": 1.433009719848633, "mean_token_accuracy": 0.6871834032237529, "num_tokens": 13932901.0, "step": 7050 }, { "entropy": 1.4155337657779454, "epoch": 0.20222562765850793, "grad_norm": 9.875, "learning_rate": 4.904991666163401e-05, "loss": 1.5671911239624023, "mean_token_accuracy": 0.6667166270315648, "num_tokens": 13951193.0, "step": 7060 }, { "entropy": 1.3376609589904547, "epoch": 0.20251206622459647, "grad_norm": 9.1875, "learning_rate": 4.904679806649075e-05, "loss": 1.4647872924804688, "mean_token_accuracy": 0.6834654208272696, "num_tokens": 13970898.0, "step": 7070 }, { "entropy": 1.346419683471322, "epoch": 0.202798504790685, "grad_norm": 8.8125, "learning_rate": 4.904367446089241e-05, "loss": 1.314305591583252, "mean_token_accuracy": 0.7175991624593735, "num_tokens": 13989894.0, "step": 7080 }, { "entropy": 1.5014225922524929, "epoch": 0.20308494335677355, "grad_norm": 8.75, "learning_rate": 4.90405458454898e-05, "loss": 1.5338292121887207, "mean_token_accuracy": 0.6804172363132238, "num_tokens": 14009862.0, "step": 7090 }, { "entropy": 1.3830394230782985, "epoch": 0.20337138192286208, "grad_norm": 7.78125, "learning_rate": 4.903741222093483e-05, "loss": 1.4008390426635742, "mean_token_accuracy": 0.6850058656185866, "num_tokens": 14030262.0, "step": 7100 }, { "entropy": 1.3387300118803978, "epoch": 0.20365782048895062, "grad_norm": 5.9375, "learning_rate": 4.903427358788042e-05, "loss": 1.335759735107422, "mean_token_accuracy": 0.6982653558254241, "num_tokens": 14049399.0, "step": 7110 }, { "entropy": 1.3435183446854353, "epoch": 0.20394425905503918, "grad_norm": 8.0, "learning_rate": 4.9031129946980536e-05, "loss": 1.4409222602844238, "mean_token_accuracy": 0.68685202896595, "num_tokens": 14068805.0, "step": 7120 }, { "entropy": 1.3806550037115812, "epoch": 0.20423069762112772, "grad_norm": 7.4375, "learning_rate": 4.902798129889021e-05, "loss": 1.4160164833068847, "mean_token_accuracy": 0.6921298008412122, "num_tokens": 14089415.0, "step": 7130 }, { "entropy": 1.3908397756516933, "epoch": 0.20451713618721626, "grad_norm": 7.75, "learning_rate": 4.902482764426551e-05, "loss": 1.4265143394470214, "mean_token_accuracy": 0.6955434899777174, "num_tokens": 14107972.0, "step": 7140 }, { "entropy": 1.4211399715393782, "epoch": 0.2048035747533048, "grad_norm": 7.875, "learning_rate": 4.902166898376352e-05, "loss": 1.4096290588378906, "mean_token_accuracy": 0.6945870824158191, "num_tokens": 14127833.0, "step": 7150 }, { "entropy": 1.4306800190359354, "epoch": 0.20509001331939333, "grad_norm": 10.3125, "learning_rate": 4.90185053180424e-05, "loss": 1.5266257286071778, "mean_token_accuracy": 0.6688980113714933, "num_tokens": 14146431.0, "step": 7160 }, { "entropy": 1.3444069474935532, "epoch": 0.20537645188548187, "grad_norm": 9.8125, "learning_rate": 4.901533664776132e-05, "loss": 1.3018610000610351, "mean_token_accuracy": 0.7133057370781899, "num_tokens": 14166679.0, "step": 7170 }, { "entropy": 1.2997824288904667, "epoch": 0.2056628904515704, "grad_norm": 8.6875, "learning_rate": 4.9012162973580545e-05, "loss": 1.3112760543823243, "mean_token_accuracy": 0.7090633921325207, "num_tokens": 14186681.0, "step": 7180 }, { "entropy": 1.2961572241038084, "epoch": 0.20594932901765894, "grad_norm": 8.8125, "learning_rate": 4.9008984296161324e-05, "loss": 1.4168990135192872, "mean_token_accuracy": 0.6773347610607743, "num_tokens": 14206505.0, "step": 7190 }, { "entropy": 1.3758924208581447, "epoch": 0.20623576758374748, "grad_norm": 7.9375, "learning_rate": 4.9005800616165984e-05, "loss": 1.412449264526367, "mean_token_accuracy": 0.6859348244965077, "num_tokens": 14226510.0, "step": 7200 }, { "entropy": 1.4393426783382892, "epoch": 0.20652220614983602, "grad_norm": 6.71875, "learning_rate": 4.900261193425789e-05, "loss": 1.488466739654541, "mean_token_accuracy": 0.6797539934515953, "num_tokens": 14247291.0, "step": 7210 }, { "entropy": 1.3632361229509116, "epoch": 0.20680864471592456, "grad_norm": 9.1875, "learning_rate": 4.899941825110143e-05, "loss": 1.3862874031066894, "mean_token_accuracy": 0.6870345346629619, "num_tokens": 14267696.0, "step": 7220 }, { "entropy": 1.4363153230398893, "epoch": 0.2070950832820131, "grad_norm": 8.5, "learning_rate": 4.8996219567362064e-05, "loss": 1.5279389381408692, "mean_token_accuracy": 0.6698644058778882, "num_tokens": 14287939.0, "step": 7230 }, { "entropy": 1.447751097753644, "epoch": 0.20738152184810163, "grad_norm": 7.5, "learning_rate": 4.8993015883706266e-05, "loss": 1.430112075805664, "mean_token_accuracy": 0.688009075075388, "num_tokens": 14308839.0, "step": 7240 }, { "entropy": 1.394721020013094, "epoch": 0.20766796041419017, "grad_norm": 9.1875, "learning_rate": 4.8989807200801577e-05, "loss": 1.4593260765075684, "mean_token_accuracy": 0.6800164137035608, "num_tokens": 14328880.0, "step": 7250 }, { "entropy": 1.3601030830293894, "epoch": 0.2079543989802787, "grad_norm": 7.15625, "learning_rate": 4.8986593519316554e-05, "loss": 1.3623176574707032, "mean_token_accuracy": 0.6869924131780862, "num_tokens": 14349528.0, "step": 7260 }, { "entropy": 1.2904255852103232, "epoch": 0.20824083754636724, "grad_norm": 8.8125, "learning_rate": 4.8983374839920816e-05, "loss": 1.375534725189209, "mean_token_accuracy": 0.7001637656241655, "num_tokens": 14369653.0, "step": 7270 }, { "entropy": 1.3482805021107196, "epoch": 0.20852727611245578, "grad_norm": 10.4375, "learning_rate": 4.898015116328501e-05, "loss": 1.377899169921875, "mean_token_accuracy": 0.6938121780753136, "num_tokens": 14388892.0, "step": 7280 }, { "entropy": 1.2915750324726105, "epoch": 0.20881371467854432, "grad_norm": 6.125, "learning_rate": 4.897692249008083e-05, "loss": 1.3763263702392579, "mean_token_accuracy": 0.6970436487346887, "num_tokens": 14408096.0, "step": 7290 }, { "entropy": 1.3968203097581864, "epoch": 0.20910015324463285, "grad_norm": 11.3125, "learning_rate": 4.897368882098102e-05, "loss": 1.4194849014282227, "mean_token_accuracy": 0.6799007184803486, "num_tokens": 14428527.0, "step": 7300 }, { "entropy": 1.390107601508498, "epoch": 0.2093865918107214, "grad_norm": 8.375, "learning_rate": 4.897045015665935e-05, "loss": 1.4392899513244628, "mean_token_accuracy": 0.6902316275984048, "num_tokens": 14447593.0, "step": 7310 }, { "entropy": 1.3729560181498528, "epoch": 0.20967303037680993, "grad_norm": 9.3125, "learning_rate": 4.896720649779064e-05, "loss": 1.4080945014953614, "mean_token_accuracy": 0.700541740655899, "num_tokens": 14467102.0, "step": 7320 }, { "entropy": 1.3027869775891303, "epoch": 0.20995946894289846, "grad_norm": 6.90625, "learning_rate": 4.896395784505074e-05, "loss": 1.2823558807373048, "mean_token_accuracy": 0.7202371619641781, "num_tokens": 14486703.0, "step": 7330 }, { "entropy": 1.3749649554491044, "epoch": 0.210245907508987, "grad_norm": 8.875, "learning_rate": 4.8960704199116546e-05, "loss": 1.4123984336853028, "mean_token_accuracy": 0.6816035013645887, "num_tokens": 14505717.0, "step": 7340 }, { "entropy": 1.356557783856988, "epoch": 0.21053234607507554, "grad_norm": 11.625, "learning_rate": 4.895744556066602e-05, "loss": 1.3466686248779296, "mean_token_accuracy": 0.7100013606250286, "num_tokens": 14524426.0, "step": 7350 }, { "entropy": 1.2298651825636626, "epoch": 0.21081878464116408, "grad_norm": 8.3125, "learning_rate": 4.8954181930378104e-05, "loss": 1.3651920318603517, "mean_token_accuracy": 0.697707237303257, "num_tokens": 14543200.0, "step": 7360 }, { "entropy": 1.3208369448781014, "epoch": 0.2111052232072526, "grad_norm": 9.5625, "learning_rate": 4.8950913308932846e-05, "loss": 1.4476146697998047, "mean_token_accuracy": 0.6957259006798268, "num_tokens": 14562438.0, "step": 7370 }, { "entropy": 1.4516440346837043, "epoch": 0.21139166177334115, "grad_norm": 9.0, "learning_rate": 4.894763969701129e-05, "loss": 1.4808592796325684, "mean_token_accuracy": 0.6746780332177877, "num_tokens": 14581554.0, "step": 7380 }, { "entropy": 1.388659530133009, "epoch": 0.21167810033942971, "grad_norm": 8.9375, "learning_rate": 4.894436109529554e-05, "loss": 1.3562264442443848, "mean_token_accuracy": 0.7026739425957202, "num_tokens": 14601704.0, "step": 7390 }, { "entropy": 1.3755133386701346, "epoch": 0.21196453890551825, "grad_norm": 7.625, "learning_rate": 4.8941077504468736e-05, "loss": 1.4169318199157714, "mean_token_accuracy": 0.6904120303690433, "num_tokens": 14621916.0, "step": 7400 }, { "entropy": 1.293072261661291, "epoch": 0.2122509774716068, "grad_norm": 9.9375, "learning_rate": 4.893778892521505e-05, "loss": 1.3679720878601074, "mean_token_accuracy": 0.699483815766871, "num_tokens": 14641785.0, "step": 7410 }, { "entropy": 1.3480365861207246, "epoch": 0.21253741603769533, "grad_norm": 8.25, "learning_rate": 4.89344953582197e-05, "loss": 1.3521265983581543, "mean_token_accuracy": 0.689704316854477, "num_tokens": 14660100.0, "step": 7420 }, { "entropy": 1.2821091564372182, "epoch": 0.21282385460378386, "grad_norm": 7.375, "learning_rate": 4.893119680416895e-05, "loss": 1.2913886070251466, "mean_token_accuracy": 0.7034950695931912, "num_tokens": 14679788.0, "step": 7430 }, { "entropy": 1.384116856008768, "epoch": 0.2131102931698724, "grad_norm": 8.5, "learning_rate": 4.892789326375009e-05, "loss": 1.4870211601257324, "mean_token_accuracy": 0.6735535811632871, "num_tokens": 14700230.0, "step": 7440 }, { "entropy": 1.4824466433376073, "epoch": 0.21339673173596094, "grad_norm": 8.4375, "learning_rate": 4.8924584737651455e-05, "loss": 1.446213436126709, "mean_token_accuracy": 0.6871388126164675, "num_tokens": 14719768.0, "step": 7450 }, { "entropy": 1.4576281111687421, "epoch": 0.21368317030204947, "grad_norm": 8.875, "learning_rate": 4.892127122656242e-05, "loss": 1.4400272369384766, "mean_token_accuracy": 0.6881834391504527, "num_tokens": 14740810.0, "step": 7460 }, { "entropy": 1.2752697099000216, "epoch": 0.213969608868138, "grad_norm": 8.375, "learning_rate": 4.8917952731173386e-05, "loss": 1.3433378219604493, "mean_token_accuracy": 0.7034235220402479, "num_tokens": 14760696.0, "step": 7470 }, { "entropy": 1.3483004350215197, "epoch": 0.21425604743422655, "grad_norm": 10.4375, "learning_rate": 4.891462925217582e-05, "loss": 1.3901077270507813, "mean_token_accuracy": 0.682411277294159, "num_tokens": 14780311.0, "step": 7480 }, { "entropy": 1.2790289748460055, "epoch": 0.21454248600031509, "grad_norm": 7.875, "learning_rate": 4.89113007902622e-05, "loss": 1.3366446495056152, "mean_token_accuracy": 0.6983015596866607, "num_tokens": 14799917.0, "step": 7490 }, { "entropy": 1.2884593315422534, "epoch": 0.21482892456640362, "grad_norm": 13.6875, "learning_rate": 4.890796734612606e-05, "loss": 1.275720977783203, "mean_token_accuracy": 0.714143181592226, "num_tokens": 14819632.0, "step": 7500 }, { "entropy": 1.3287858117371798, "epoch": 0.21511536313249216, "grad_norm": 8.4375, "learning_rate": 4.890462892046196e-05, "loss": 1.3351828575134277, "mean_token_accuracy": 0.6934810530394315, "num_tokens": 14838534.0, "step": 7510 }, { "entropy": 1.2789661645889283, "epoch": 0.2154018016985807, "grad_norm": 7.78125, "learning_rate": 4.89012855139655e-05, "loss": 1.3055315017700195, "mean_token_accuracy": 0.7132577586919069, "num_tokens": 14857170.0, "step": 7520 }, { "entropy": 1.293819534033537, "epoch": 0.21568824026466923, "grad_norm": 8.3125, "learning_rate": 4.889793712733334e-05, "loss": 1.3343281745910645, "mean_token_accuracy": 0.7063073042780161, "num_tokens": 14877160.0, "step": 7530 }, { "entropy": 1.3489057872444392, "epoch": 0.21597467883075777, "grad_norm": 10.5625, "learning_rate": 4.889458376126313e-05, "loss": 1.4079439163208007, "mean_token_accuracy": 0.6894423123449087, "num_tokens": 14897003.0, "step": 7540 }, { "entropy": 1.4150805279612542, "epoch": 0.2162611173968463, "grad_norm": 7.375, "learning_rate": 4.8891225416453614e-05, "loss": 1.4901124954223632, "mean_token_accuracy": 0.6762777179479599, "num_tokens": 14916059.0, "step": 7550 }, { "entropy": 1.5745364610105752, "epoch": 0.21654755596293485, "grad_norm": 7.0625, "learning_rate": 4.8887862093604526e-05, "loss": 1.5903640747070313, "mean_token_accuracy": 0.6673523098230362, "num_tokens": 14936136.0, "step": 7560 }, { "entropy": 1.2758759081363678, "epoch": 0.21683399452902338, "grad_norm": 7.90625, "learning_rate": 4.8884493793416666e-05, "loss": 1.2784101486206054, "mean_token_accuracy": 0.7163826014846564, "num_tokens": 14954604.0, "step": 7570 }, { "entropy": 1.2785285800695418, "epoch": 0.21712043309511192, "grad_norm": 10.8125, "learning_rate": 4.888112051659186e-05, "loss": 1.28880615234375, "mean_token_accuracy": 0.6964160978794098, "num_tokens": 14974011.0, "step": 7580 }, { "entropy": 1.3938613448292017, "epoch": 0.21740687166120046, "grad_norm": 7.4375, "learning_rate": 4.887774226383297e-05, "loss": 1.436103916168213, "mean_token_accuracy": 0.6869353208690882, "num_tokens": 14994637.0, "step": 7590 }, { "entropy": 1.3140036601573228, "epoch": 0.217693310227289, "grad_norm": 9.8125, "learning_rate": 4.887435903584391e-05, "loss": 1.374654483795166, "mean_token_accuracy": 0.7032893341034651, "num_tokens": 15013632.0, "step": 7600 }, { "entropy": 1.2737130880355836, "epoch": 0.21797974879337753, "grad_norm": 6.25, "learning_rate": 4.88709708333296e-05, "loss": 1.4103833198547364, "mean_token_accuracy": 0.6863091744482517, "num_tokens": 15033378.0, "step": 7610 }, { "entropy": 1.4612667422741652, "epoch": 0.21826618735946607, "grad_norm": 8.125, "learning_rate": 4.8867577656996033e-05, "loss": 1.492978286743164, "mean_token_accuracy": 0.6864451989531517, "num_tokens": 15054848.0, "step": 7620 }, { "entropy": 1.286347733065486, "epoch": 0.2185526259255546, "grad_norm": 7.1875, "learning_rate": 4.886417950755021e-05, "loss": 1.2393387794494628, "mean_token_accuracy": 0.7158916004002094, "num_tokens": 15074781.0, "step": 7630 }, { "entropy": 1.2510924391448497, "epoch": 0.21883906449164314, "grad_norm": 8.5, "learning_rate": 4.886077638570017e-05, "loss": 1.2491999626159669, "mean_token_accuracy": 0.7227519113570452, "num_tokens": 15095337.0, "step": 7640 }, { "entropy": 1.1821011263877153, "epoch": 0.21912550305773168, "grad_norm": 7.5, "learning_rate": 4.8857368292155016e-05, "loss": 1.2771282196044922, "mean_token_accuracy": 0.7172872584313155, "num_tokens": 15114995.0, "step": 7650 }, { "entropy": 1.280007117241621, "epoch": 0.21941194162382024, "grad_norm": 9.0, "learning_rate": 4.885395522762486e-05, "loss": 1.4100286483764648, "mean_token_accuracy": 0.6866801362484694, "num_tokens": 15135519.0, "step": 7660 }, { "entropy": 1.3868811391294003, "epoch": 0.21969838018990878, "grad_norm": 8.6875, "learning_rate": 4.885053719282085e-05, "loss": 1.4283332824707031, "mean_token_accuracy": 0.6930511899292469, "num_tokens": 15156922.0, "step": 7670 }, { "entropy": 1.401895508542657, "epoch": 0.21998481875599732, "grad_norm": 8.375, "learning_rate": 4.884711418845518e-05, "loss": 1.3743435859680175, "mean_token_accuracy": 0.687605693563819, "num_tokens": 15178124.0, "step": 7680 }, { "entropy": 1.271172220259905, "epoch": 0.22027125732208586, "grad_norm": 5.96875, "learning_rate": 4.8843686215241083e-05, "loss": 1.2306385040283203, "mean_token_accuracy": 0.7218283236026763, "num_tokens": 15197504.0, "step": 7690 }, { "entropy": 1.2563523545861244, "epoch": 0.2205576958881744, "grad_norm": 6.65625, "learning_rate": 4.8840253273892825e-05, "loss": 1.2723988533020019, "mean_token_accuracy": 0.708989767357707, "num_tokens": 15216692.0, "step": 7700 }, { "entropy": 1.2661789491772653, "epoch": 0.22084413445426293, "grad_norm": 7.03125, "learning_rate": 4.8836815365125675e-05, "loss": 1.3291427612304687, "mean_token_accuracy": 0.7063781902194023, "num_tokens": 15237696.0, "step": 7710 }, { "entropy": 1.2801757603883743, "epoch": 0.22113057302035147, "grad_norm": 8.375, "learning_rate": 4.8833372489656e-05, "loss": 1.3109075546264648, "mean_token_accuracy": 0.704571132734418, "num_tokens": 15258504.0, "step": 7720 }, { "entropy": 1.284193018451333, "epoch": 0.22141701158644, "grad_norm": 9.8125, "learning_rate": 4.882992464820114e-05, "loss": 1.3723615646362304, "mean_token_accuracy": 0.7046990979462862, "num_tokens": 15277709.0, "step": 7730 }, { "entropy": 1.3690773416310549, "epoch": 0.22170345015252854, "grad_norm": 9.625, "learning_rate": 4.882647184147951e-05, "loss": 1.4337735176086426, "mean_token_accuracy": 0.6841593950986862, "num_tokens": 15296201.0, "step": 7740 }, { "entropy": 1.3079580947756768, "epoch": 0.22198988871861708, "grad_norm": 9.0625, "learning_rate": 4.882301407021055e-05, "loss": 1.3392826080322267, "mean_token_accuracy": 0.700236376747489, "num_tokens": 15316008.0, "step": 7750 }, { "entropy": 1.415876792371273, "epoch": 0.22227632728470562, "grad_norm": 7.90625, "learning_rate": 4.881955133511472e-05, "loss": 1.4688376426696776, "mean_token_accuracy": 0.6904159473255277, "num_tokens": 15335827.0, "step": 7760 }, { "entropy": 1.4446927666664124, "epoch": 0.22256276585079415, "grad_norm": 7.5625, "learning_rate": 4.8816083636913525e-05, "loss": 1.538266944885254, "mean_token_accuracy": 0.6795007001608611, "num_tokens": 15354988.0, "step": 7770 }, { "entropy": 1.4225209131836891, "epoch": 0.2228492044168827, "grad_norm": 5.78125, "learning_rate": 4.8812610976329506e-05, "loss": 1.3882936477661132, "mean_token_accuracy": 0.6982832193374634, "num_tokens": 15375536.0, "step": 7780 }, { "entropy": 1.3170425936579704, "epoch": 0.22313564298297123, "grad_norm": 8.25, "learning_rate": 4.8809133354086244e-05, "loss": 1.3739373207092285, "mean_token_accuracy": 0.6934373334050179, "num_tokens": 15394707.0, "step": 7790 }, { "entropy": 1.2687998063862325, "epoch": 0.22342208154905976, "grad_norm": 8.375, "learning_rate": 4.880565077090834e-05, "loss": 1.300158977508545, "mean_token_accuracy": 0.7184651874005794, "num_tokens": 15414114.0, "step": 7800 }, { "entropy": 1.4427742466330529, "epoch": 0.2237085201151483, "grad_norm": 8.8125, "learning_rate": 4.880216322752142e-05, "loss": 1.469937801361084, "mean_token_accuracy": 0.6808895222842694, "num_tokens": 15434131.0, "step": 7810 }, { "entropy": 1.2740275532007217, "epoch": 0.22399495868123684, "grad_norm": 7.09375, "learning_rate": 4.8798670724652186e-05, "loss": 1.317356491088867, "mean_token_accuracy": 0.7080950126051903, "num_tokens": 15454536.0, "step": 7820 }, { "entropy": 1.3545406349003315, "epoch": 0.22428139724732538, "grad_norm": 8.875, "learning_rate": 4.8795173263028324e-05, "loss": 1.4382153511047364, "mean_token_accuracy": 0.6884837828576564, "num_tokens": 15473937.0, "step": 7830 }, { "entropy": 1.4733360931277275, "epoch": 0.2245678358134139, "grad_norm": 7.3125, "learning_rate": 4.8791670843378576e-05, "loss": 1.525193691253662, "mean_token_accuracy": 0.6759477905929089, "num_tokens": 15493145.0, "step": 7840 }, { "entropy": 1.4691454891115427, "epoch": 0.22485427437950245, "grad_norm": 9.6875, "learning_rate": 4.8788163466432726e-05, "loss": 1.5178655624389648, "mean_token_accuracy": 0.6732699435204268, "num_tokens": 15511641.0, "step": 7850 }, { "entropy": 1.4671073205769063, "epoch": 0.225140712945591, "grad_norm": 10.0625, "learning_rate": 4.878465113292158e-05, "loss": 1.5719306945800782, "mean_token_accuracy": 0.6798214539885521, "num_tokens": 15530670.0, "step": 7860 }, { "entropy": 1.3936611466109752, "epoch": 0.22542715151167952, "grad_norm": 7.71875, "learning_rate": 4.878113384357696e-05, "loss": 1.3768365859985352, "mean_token_accuracy": 0.7045553438365459, "num_tokens": 15549928.0, "step": 7870 }, { "entropy": 1.3084229059517383, "epoch": 0.22571359007776806, "grad_norm": 9.125, "learning_rate": 4.8777611599131756e-05, "loss": 1.2989063262939453, "mean_token_accuracy": 0.7167639885097742, "num_tokens": 15569940.0, "step": 7880 }, { "entropy": 1.3241024676710367, "epoch": 0.2260000286438566, "grad_norm": 10.9375, "learning_rate": 4.877408440031987e-05, "loss": 1.3705173492431642, "mean_token_accuracy": 0.6987843196839094, "num_tokens": 15589786.0, "step": 7890 }, { "entropy": 1.3425384059548378, "epoch": 0.22628646720994514, "grad_norm": 9.75, "learning_rate": 4.877055224787622e-05, "loss": 1.3403461456298829, "mean_token_accuracy": 0.6985780414193868, "num_tokens": 15611059.0, "step": 7900 }, { "entropy": 1.2052909169346093, "epoch": 0.22657290577603367, "grad_norm": 9.3125, "learning_rate": 4.87670151425368e-05, "loss": 1.2613117218017578, "mean_token_accuracy": 0.7153838749974966, "num_tokens": 15630064.0, "step": 7910 }, { "entropy": 1.2749242829158902, "epoch": 0.2268593443421222, "grad_norm": 6.78125, "learning_rate": 4.87634730850386e-05, "loss": 1.3177407264709473, "mean_token_accuracy": 0.7087857540696859, "num_tokens": 15648755.0, "step": 7920 }, { "entropy": 1.356166660040617, "epoch": 0.22714578290821077, "grad_norm": 8.5625, "learning_rate": 4.8759926076119644e-05, "loss": 1.3944215774536133, "mean_token_accuracy": 0.6909115295857191, "num_tokens": 15670035.0, "step": 7930 }, { "entropy": 1.349524899572134, "epoch": 0.2274322214742993, "grad_norm": 11.0625, "learning_rate": 4.875637411651901e-05, "loss": 1.3656500816345214, "mean_token_accuracy": 0.6972495723515749, "num_tokens": 15688307.0, "step": 7940 }, { "entropy": 1.315654394030571, "epoch": 0.22771866004038785, "grad_norm": 6.71875, "learning_rate": 4.8752817206976795e-05, "loss": 1.238535213470459, "mean_token_accuracy": 0.7184632230550051, "num_tokens": 15707217.0, "step": 7950 }, { "entropy": 1.2872909754514694, "epoch": 0.2280050986064764, "grad_norm": 8.25, "learning_rate": 4.874925534823411e-05, "loss": 1.372249698638916, "mean_token_accuracy": 0.6899086125195026, "num_tokens": 15727044.0, "step": 7960 }, { "entropy": 1.32220651358366, "epoch": 0.22829153717256492, "grad_norm": 7.40625, "learning_rate": 4.874568854103313e-05, "loss": 1.3752135276794433, "mean_token_accuracy": 0.6870768733322621, "num_tokens": 15747482.0, "step": 7970 }, { "entropy": 1.2956975664943458, "epoch": 0.22857797573865346, "grad_norm": 8.375, "learning_rate": 4.8742116786117034e-05, "loss": 1.3387102127075194, "mean_token_accuracy": 0.7106714308261871, "num_tokens": 15767769.0, "step": 7980 }, { "entropy": 1.3806438844650983, "epoch": 0.228864414304742, "grad_norm": 7.46875, "learning_rate": 4.8738540084230044e-05, "loss": 1.4194136619567872, "mean_token_accuracy": 0.6867449875921011, "num_tokens": 15787725.0, "step": 7990 }, { "epoch": 0.22915085287083053, "eval_entropy": 1.3525832796096802, "eval_loss": 1.3715550899505615, "eval_mean_token_accuracy": 0.6933415282964707, "eval_num_tokens": 15807238.0, "eval_runtime": 43.1178, "eval_samples_per_second": 46.385, "eval_steps_per_second": 5.798, "step": 8000 }, { "entropy": 1.3368042374029756, "epoch": 0.22943729143691907, "grad_norm": 9.0625, "learning_rate": 4.873137184252543e-05, "loss": 1.3546357154846191, "mean_token_accuracy": 0.6971236057579517, "num_tokens": 15827525.0, "step": 8010 }, { "entropy": 1.3948000933974982, "epoch": 0.2297237300030076, "grad_norm": 6.78125, "learning_rate": 4.8727780304201397e-05, "loss": 1.4288634300231933, "mean_token_accuracy": 0.6948393099009991, "num_tokens": 15848229.0, "step": 8020 }, { "entropy": 1.4148659810423851, "epoch": 0.23001016856909615, "grad_norm": 9.75, "learning_rate": 4.872418382189366e-05, "loss": 1.4647943496704101, "mean_token_accuracy": 0.6829231698065996, "num_tokens": 15868056.0, "step": 8030 }, { "entropy": 1.4107302393764258, "epoch": 0.23029660713518468, "grad_norm": 8.75, "learning_rate": 4.872058239635159e-05, "loss": 1.4398988723754882, "mean_token_accuracy": 0.6907641410827636, "num_tokens": 15887526.0, "step": 8040 }, { "entropy": 1.3166353072971106, "epoch": 0.23058304570127322, "grad_norm": 10.75, "learning_rate": 4.871697602832559e-05, "loss": 1.274904441833496, "mean_token_accuracy": 0.7086723688989878, "num_tokens": 15908020.0, "step": 8050 }, { "entropy": 1.215018856152892, "epoch": 0.23086948426736176, "grad_norm": 7.3125, "learning_rate": 4.871336471856709e-05, "loss": 1.2969029426574707, "mean_token_accuracy": 0.7075026195496321, "num_tokens": 15927642.0, "step": 8060 }, { "entropy": 1.245218475162983, "epoch": 0.2311559228334503, "grad_norm": 9.4375, "learning_rate": 4.870974846782856e-05, "loss": 1.3223005294799806, "mean_token_accuracy": 0.6976545203477145, "num_tokens": 15947904.0, "step": 8070 }, { "entropy": 1.314133294299245, "epoch": 0.23144236139953883, "grad_norm": 8.0625, "learning_rate": 4.8706127276863485e-05, "loss": 1.379852867126465, "mean_token_accuracy": 0.703938664495945, "num_tokens": 15968290.0, "step": 8080 }, { "entropy": 1.3094776287674903, "epoch": 0.23172879996562737, "grad_norm": 10.3125, "learning_rate": 4.870250114642639e-05, "loss": 1.3534197807312012, "mean_token_accuracy": 0.7027083735913038, "num_tokens": 15987461.0, "step": 8090 }, { "entropy": 1.3287329260259866, "epoch": 0.2320152385317159, "grad_norm": 8.1875, "learning_rate": 4.8698870077272824e-05, "loss": 1.3490395545959473, "mean_token_accuracy": 0.7040076270699501, "num_tokens": 16007054.0, "step": 8100 }, { "entropy": 1.2291704252362252, "epoch": 0.23230167709780444, "grad_norm": 8.3125, "learning_rate": 4.869523407015936e-05, "loss": 1.2816612243652343, "mean_token_accuracy": 0.7215011950582266, "num_tokens": 16026469.0, "step": 8110 }, { "entropy": 1.305432095564902, "epoch": 0.23258811566389298, "grad_norm": 12.9375, "learning_rate": 4.869159312584362e-05, "loss": 1.2637593269348144, "mean_token_accuracy": 0.7156236406415701, "num_tokens": 16046728.0, "step": 8120 }, { "entropy": 1.3024291686713696, "epoch": 0.23287455422998152, "grad_norm": 8.3125, "learning_rate": 4.8687947245084234e-05, "loss": 1.3540659904479981, "mean_token_accuracy": 0.6981031056493521, "num_tokens": 16065946.0, "step": 8130 }, { "entropy": 1.2802363142371178, "epoch": 0.23316099279607005, "grad_norm": 6.5, "learning_rate": 4.868429642864086e-05, "loss": 1.2869328498840331, "mean_token_accuracy": 0.7198633503168821, "num_tokens": 16085449.0, "step": 8140 }, { "entropy": 1.4078667741268873, "epoch": 0.2334474313621586, "grad_norm": 7.5, "learning_rate": 4.8680640677274194e-05, "loss": 1.4981518745422364, "mean_token_accuracy": 0.6752590913325548, "num_tokens": 16106012.0, "step": 8150 }, { "entropy": 1.3809628207236528, "epoch": 0.23373386992824713, "grad_norm": 12.6875, "learning_rate": 4.8676979991745976e-05, "loss": 1.4528388977050781, "mean_token_accuracy": 0.6850547280162573, "num_tokens": 16126173.0, "step": 8160 }, { "entropy": 1.3444415017962457, "epoch": 0.23402030849433567, "grad_norm": 8.0625, "learning_rate": 4.8673314372818935e-05, "loss": 1.4166419982910157, "mean_token_accuracy": 0.6987987965345382, "num_tokens": 16145614.0, "step": 8170 }, { "entropy": 1.3124527130275965, "epoch": 0.2343067470604242, "grad_norm": 9.0, "learning_rate": 4.866964382125685e-05, "loss": 1.336414909362793, "mean_token_accuracy": 0.7011750034987927, "num_tokens": 16164909.0, "step": 8180 }, { "entropy": 1.4348484814167022, "epoch": 0.23459318562651274, "grad_norm": 9.25, "learning_rate": 4.866596833782454e-05, "loss": 1.529961109161377, "mean_token_accuracy": 0.6687340304255486, "num_tokens": 16185489.0, "step": 8190 }, { "entropy": 1.2911674588918687, "epoch": 0.2348796241926013, "grad_norm": 6.59375, "learning_rate": 4.866228792328783e-05, "loss": 1.219797706604004, "mean_token_accuracy": 0.7309391036629677, "num_tokens": 16204328.0, "step": 8200 }, { "entropy": 1.2788859456777573, "epoch": 0.23516606275868984, "grad_norm": 11.3125, "learning_rate": 4.865860257841359e-05, "loss": 1.3128036499023437, "mean_token_accuracy": 0.7154462095350027, "num_tokens": 16224336.0, "step": 8210 }, { "entropy": 1.2730165421962738, "epoch": 0.23545250132477838, "grad_norm": 8.0625, "learning_rate": 4.86549123039697e-05, "loss": 1.354213047027588, "mean_token_accuracy": 0.7013130847364664, "num_tokens": 16244243.0, "step": 8220 }, { "entropy": 1.3116079408675432, "epoch": 0.23573893989086692, "grad_norm": 8.625, "learning_rate": 4.8651217100725064e-05, "loss": 1.4273070335388183, "mean_token_accuracy": 0.6908482234925032, "num_tokens": 16263926.0, "step": 8230 }, { "entropy": 1.373075483366847, "epoch": 0.23602537845695545, "grad_norm": 8.875, "learning_rate": 4.864751696944965e-05, "loss": 1.3720784187316895, "mean_token_accuracy": 0.694175549224019, "num_tokens": 16284817.0, "step": 8240 }, { "entropy": 1.3922888569533824, "epoch": 0.236311817023044, "grad_norm": 8.4375, "learning_rate": 4.864381191091441e-05, "loss": 1.3658974647521973, "mean_token_accuracy": 0.6961234033107757, "num_tokens": 16304164.0, "step": 8250 }, { "entropy": 1.3457724403589963, "epoch": 0.23659825558913253, "grad_norm": 5.65625, "learning_rate": 4.864010192589135e-05, "loss": 1.3793910026550293, "mean_token_accuracy": 0.6869689714163542, "num_tokens": 16325521.0, "step": 8260 }, { "entropy": 1.3429566673934459, "epoch": 0.23688469415522106, "grad_norm": 8.9375, "learning_rate": 4.863638701515348e-05, "loss": 1.3903090476989746, "mean_token_accuracy": 0.6891145247966051, "num_tokens": 16343427.0, "step": 8270 }, { "entropy": 1.5069112539291383, "epoch": 0.2371711327213096, "grad_norm": 10.25, "learning_rate": 4.863266717947485e-05, "loss": 1.5753619194030761, "mean_token_accuracy": 0.666107964515686, "num_tokens": 16363095.0, "step": 8280 }, { "entropy": 1.3348246820271015, "epoch": 0.23745757128739814, "grad_norm": 9.625, "learning_rate": 4.862894241963055e-05, "loss": 1.3638680458068848, "mean_token_accuracy": 0.7002866119146347, "num_tokens": 16383050.0, "step": 8290 }, { "entropy": 1.3352429240942, "epoch": 0.23774400985348668, "grad_norm": 6.78125, "learning_rate": 4.862521273639668e-05, "loss": 1.3364219665527344, "mean_token_accuracy": 0.6988799657672644, "num_tokens": 16402884.0, "step": 8300 }, { "entropy": 1.3143289241939784, "epoch": 0.2380304484195752, "grad_norm": 10.5625, "learning_rate": 4.8621478130550344e-05, "loss": 1.3329084396362305, "mean_token_accuracy": 0.7065146721899509, "num_tokens": 16422536.0, "step": 8310 }, { "entropy": 1.288917900249362, "epoch": 0.23831688698566375, "grad_norm": 6.53125, "learning_rate": 4.8617738602869714e-05, "loss": 1.2743046760559082, "mean_token_accuracy": 0.7156042341142893, "num_tokens": 16443747.0, "step": 8320 }, { "entropy": 1.311733551695943, "epoch": 0.2386033255517523, "grad_norm": 11.0, "learning_rate": 4.861399415413396e-05, "loss": 1.405808162689209, "mean_token_accuracy": 0.6953676007688046, "num_tokens": 16462398.0, "step": 8330 }, { "entropy": 1.3846714984625579, "epoch": 0.23888976411784082, "grad_norm": 7.6875, "learning_rate": 4.861024478512328e-05, "loss": 1.4922773361206054, "mean_token_accuracy": 0.6691900324076414, "num_tokens": 16481527.0, "step": 8340 }, { "entropy": 1.2748234923928976, "epoch": 0.23917620268392936, "grad_norm": 9.25, "learning_rate": 4.860649049661893e-05, "loss": 1.1929106712341309, "mean_token_accuracy": 0.7362593207508326, "num_tokens": 16501675.0, "step": 8350 }, { "entropy": 1.3361931089311838, "epoch": 0.2394626412500179, "grad_norm": 7.03125, "learning_rate": 4.8602731289403124e-05, "loss": 1.3322365760803223, "mean_token_accuracy": 0.7035299580544233, "num_tokens": 16522516.0, "step": 8360 }, { "entropy": 1.2914295453578233, "epoch": 0.23974907981610644, "grad_norm": 13.25, "learning_rate": 4.8598967164259173e-05, "loss": 1.3713109016418457, "mean_token_accuracy": 0.6943941611796618, "num_tokens": 16542628.0, "step": 8370 }, { "entropy": 1.368678654357791, "epoch": 0.24003551838219497, "grad_norm": 8.6875, "learning_rate": 4.859519812197136e-05, "loss": 1.4172140121459962, "mean_token_accuracy": 0.6869722083210945, "num_tokens": 16561729.0, "step": 8380 }, { "entropy": 1.2999014116823673, "epoch": 0.2403219569482835, "grad_norm": 8.375, "learning_rate": 4.859142416332503e-05, "loss": 1.354226016998291, "mean_token_accuracy": 0.6968124371021986, "num_tokens": 16581204.0, "step": 8390 }, { "entropy": 1.3914289385080338, "epoch": 0.24060839551437205, "grad_norm": 7.40625, "learning_rate": 4.858764528910652e-05, "loss": 1.3810704231262207, "mean_token_accuracy": 0.6944346055388451, "num_tokens": 16600026.0, "step": 8400 }, { "entropy": 1.2593204272910952, "epoch": 0.24089483408046058, "grad_norm": 7.1875, "learning_rate": 4.8583861500103215e-05, "loss": 1.2960443496704102, "mean_token_accuracy": 0.7045311786234378, "num_tokens": 16619606.0, "step": 8410 }, { "entropy": 1.3147992327809335, "epoch": 0.24118127264654912, "grad_norm": 7.3125, "learning_rate": 4.85800727971035e-05, "loss": 1.3279443740844727, "mean_token_accuracy": 0.7149071618914604, "num_tokens": 16638912.0, "step": 8420 }, { "entropy": 1.3592380195856095, "epoch": 0.24146771121263766, "grad_norm": 10.0, "learning_rate": 4.857627918089682e-05, "loss": 1.4101136207580567, "mean_token_accuracy": 0.6875106453895569, "num_tokens": 16660287.0, "step": 8430 }, { "entropy": 1.3409567870199681, "epoch": 0.2417541497787262, "grad_norm": 6.78125, "learning_rate": 4.857248065227362e-05, "loss": 1.4069478034973144, "mean_token_accuracy": 0.6943238092586398, "num_tokens": 16679656.0, "step": 8440 }, { "entropy": 1.3505582470446824, "epoch": 0.24204058834481473, "grad_norm": 6.09375, "learning_rate": 4.856867721202536e-05, "loss": 1.396233367919922, "mean_token_accuracy": 0.6943115558475256, "num_tokens": 16700423.0, "step": 8450 }, { "entropy": 1.2833540592342616, "epoch": 0.24232702691090327, "grad_norm": 9.6875, "learning_rate": 4.856486886094455e-05, "loss": 1.2806329727172852, "mean_token_accuracy": 0.7195678774267436, "num_tokens": 16719942.0, "step": 8460 }, { "entropy": 1.27919750995934, "epoch": 0.24261346547699184, "grad_norm": 11.625, "learning_rate": 4.856105559982468e-05, "loss": 1.2620330810546876, "mean_token_accuracy": 0.7119680348783731, "num_tokens": 16739113.0, "step": 8470 }, { "entropy": 1.2528194408863782, "epoch": 0.24289990404308037, "grad_norm": 8.0, "learning_rate": 4.8557237429460325e-05, "loss": 1.3730833053588867, "mean_token_accuracy": 0.7003060482442379, "num_tokens": 16759328.0, "step": 8480 }, { "entropy": 1.3498518448323011, "epoch": 0.2431863426091689, "grad_norm": 8.25, "learning_rate": 4.855341435064703e-05, "loss": 1.426292896270752, "mean_token_accuracy": 0.6925671607255935, "num_tokens": 16780547.0, "step": 8490 }, { "entropy": 1.3656618740409612, "epoch": 0.24347278117525745, "grad_norm": 8.4375, "learning_rate": 4.854958636418139e-05, "loss": 1.3180909156799316, "mean_token_accuracy": 0.7094634931534529, "num_tokens": 16800575.0, "step": 8500 }, { "entropy": 1.2510054435580968, "epoch": 0.24375921974134598, "grad_norm": 8.5625, "learning_rate": 4.854575347086101e-05, "loss": 1.3178614616394042, "mean_token_accuracy": 0.7092883057892323, "num_tokens": 16820322.0, "step": 8510 }, { "entropy": 1.3439761586487293, "epoch": 0.24404565830743452, "grad_norm": 8.5, "learning_rate": 4.854191567148452e-05, "loss": 1.4390742301940918, "mean_token_accuracy": 0.6914662979543209, "num_tokens": 16841302.0, "step": 8520 }, { "entropy": 1.2478022906929254, "epoch": 0.24433209687352306, "grad_norm": 7.4375, "learning_rate": 4.853807296685158e-05, "loss": 1.2608952522277832, "mean_token_accuracy": 0.7045908909291029, "num_tokens": 16860106.0, "step": 8530 }, { "entropy": 1.2601082272827626, "epoch": 0.2446185354396116, "grad_norm": 8.1875, "learning_rate": 4.8534225357762866e-05, "loss": 1.2476003646850586, "mean_token_accuracy": 0.723358640819788, "num_tokens": 16879829.0, "step": 8540 }, { "entropy": 1.3123316571116448, "epoch": 0.24490497400570013, "grad_norm": 8.5, "learning_rate": 4.853037284502007e-05, "loss": 1.3461403846740723, "mean_token_accuracy": 0.7071382343769074, "num_tokens": 16898616.0, "step": 8550 }, { "entropy": 1.1433360937982797, "epoch": 0.24519141257178867, "grad_norm": 7.875, "learning_rate": 4.852651542942591e-05, "loss": 1.1783739089965821, "mean_token_accuracy": 0.7301077082753181, "num_tokens": 16917587.0, "step": 8560 }, { "entropy": 1.2611917808651925, "epoch": 0.2454778511378772, "grad_norm": 5.53125, "learning_rate": 4.852265311178414e-05, "loss": 1.2958187103271483, "mean_token_accuracy": 0.7096046347171068, "num_tokens": 16936842.0, "step": 8570 }, { "entropy": 1.2707879062741996, "epoch": 0.24576428970396574, "grad_norm": 7.84375, "learning_rate": 4.851878589289951e-05, "loss": 1.279293918609619, "mean_token_accuracy": 0.7184138230979442, "num_tokens": 16956866.0, "step": 8580 }, { "entropy": 1.2512096384540201, "epoch": 0.24605072827005428, "grad_norm": 6.84375, "learning_rate": 4.851491377357781e-05, "loss": 1.3372897148132323, "mean_token_accuracy": 0.702974797040224, "num_tokens": 16975397.0, "step": 8590 }, { "entropy": 1.278340177051723, "epoch": 0.24633716683614282, "grad_norm": 8.4375, "learning_rate": 4.851103675462585e-05, "loss": 1.2980100631713867, "mean_token_accuracy": 0.7158501110970974, "num_tokens": 16996166.0, "step": 8600 }, { "entropy": 1.3300394169986247, "epoch": 0.24662360540223136, "grad_norm": 6.84375, "learning_rate": 4.850715483685145e-05, "loss": 1.3693733215332031, "mean_token_accuracy": 0.7026569206267596, "num_tokens": 17015100.0, "step": 8610 }, { "entropy": 1.4044758338481187, "epoch": 0.2469100439683199, "grad_norm": 7.34375, "learning_rate": 4.850326802106345e-05, "loss": 1.4302474021911622, "mean_token_accuracy": 0.6916542194783688, "num_tokens": 17034058.0, "step": 8620 }, { "entropy": 1.3206113751977682, "epoch": 0.24719648253440843, "grad_norm": 10.1875, "learning_rate": 4.849937630807174e-05, "loss": 1.39181489944458, "mean_token_accuracy": 0.6876004215329885, "num_tokens": 17053089.0, "step": 8630 }, { "entropy": 1.1952310550957919, "epoch": 0.24748292110049697, "grad_norm": 7.25, "learning_rate": 4.849547969868718e-05, "loss": 1.2122062683105468, "mean_token_accuracy": 0.7337113194167614, "num_tokens": 17071991.0, "step": 8640 }, { "entropy": 1.312955129146576, "epoch": 0.2477693596665855, "grad_norm": 8.125, "learning_rate": 4.8491578193721695e-05, "loss": 1.3263768196105956, "mean_token_accuracy": 0.7012049920856953, "num_tokens": 17091919.0, "step": 8650 }, { "entropy": 1.25547207146883, "epoch": 0.24805579823267404, "grad_norm": 7.8125, "learning_rate": 4.848767179398821e-05, "loss": 1.2492012977600098, "mean_token_accuracy": 0.7070884669199586, "num_tokens": 17113562.0, "step": 8660 }, { "entropy": 1.1096773331984877, "epoch": 0.24834223679876258, "grad_norm": 9.875, "learning_rate": 4.848376050030067e-05, "loss": 1.1990671157836914, "mean_token_accuracy": 0.721477260440588, "num_tokens": 17133012.0, "step": 8670 }, { "entropy": 1.2394254699349403, "epoch": 0.24862867536485111, "grad_norm": 7.4375, "learning_rate": 4.847984431347403e-05, "loss": 1.3469114303588867, "mean_token_accuracy": 0.7041354414075613, "num_tokens": 17152334.0, "step": 8680 }, { "entropy": 1.3852784413844348, "epoch": 0.24891511393093965, "grad_norm": 6.71875, "learning_rate": 4.847592323432431e-05, "loss": 1.3782036781311036, "mean_token_accuracy": 0.6852422401309013, "num_tokens": 17171465.0, "step": 8690 }, { "entropy": 1.2349199458956719, "epoch": 0.2492015524970282, "grad_norm": 7.5625, "learning_rate": 4.8471997263668486e-05, "loss": 1.226328468322754, "mean_token_accuracy": 0.7154191877692938, "num_tokens": 17190801.0, "step": 8700 }, { "entropy": 1.251618079841137, "epoch": 0.24948799106311673, "grad_norm": 7.40625, "learning_rate": 4.846806640232461e-05, "loss": 1.2519200325012207, "mean_token_accuracy": 0.7186239931732417, "num_tokens": 17210461.0, "step": 8710 }, { "entropy": 1.2829885203391314, "epoch": 0.24977442962920526, "grad_norm": 11.375, "learning_rate": 4.84641306511117e-05, "loss": 1.3736440658569335, "mean_token_accuracy": 0.6862790618091822, "num_tokens": 17232481.0, "step": 8720 }, { "entropy": 1.2550558131188154, "epoch": 0.25006086819529383, "grad_norm": 10.0625, "learning_rate": 4.8460190010849835e-05, "loss": 1.275850486755371, "mean_token_accuracy": 0.7059022095054388, "num_tokens": 17250556.0, "step": 8730 }, { "entropy": 1.300730186700821, "epoch": 0.25034730676138234, "grad_norm": 8.6875, "learning_rate": 4.845624448236009e-05, "loss": 1.3349772453308106, "mean_token_accuracy": 0.6941989261657, "num_tokens": 17269507.0, "step": 8740 }, { "entropy": 1.2250392898917197, "epoch": 0.2506337453274709, "grad_norm": 8.875, "learning_rate": 4.8452294066464575e-05, "loss": 1.2364221572875977, "mean_token_accuracy": 0.7252295173704624, "num_tokens": 17287983.0, "step": 8750 }, { "entropy": 1.3068331524729728, "epoch": 0.2509201838935594, "grad_norm": 6.875, "learning_rate": 4.84483387639864e-05, "loss": 1.4161869049072267, "mean_token_accuracy": 0.6999049104750157, "num_tokens": 17307814.0, "step": 8760 }, { "entropy": 1.3700547605752944, "epoch": 0.251206622459648, "grad_norm": 9.75, "learning_rate": 4.8444378575749714e-05, "loss": 1.4014565467834472, "mean_token_accuracy": 0.6874885011464358, "num_tokens": 17327057.0, "step": 8770 }, { "entropy": 1.264924530312419, "epoch": 0.2514930610257365, "grad_norm": 8.9375, "learning_rate": 4.844041350257966e-05, "loss": 1.2689948081970215, "mean_token_accuracy": 0.7169880189001561, "num_tokens": 17346271.0, "step": 8780 }, { "entropy": 1.3334347050637008, "epoch": 0.25177949959182505, "grad_norm": 9.4375, "learning_rate": 4.843644354530241e-05, "loss": 1.3798280715942384, "mean_token_accuracy": 0.6919111352413893, "num_tokens": 17366520.0, "step": 8790 }, { "entropy": 1.2361187532544136, "epoch": 0.25206593815791356, "grad_norm": 7.4375, "learning_rate": 4.843246870474517e-05, "loss": 1.2816729545593262, "mean_token_accuracy": 0.7087344095110893, "num_tokens": 17386584.0, "step": 8800 }, { "entropy": 1.2250650390982627, "epoch": 0.2523523767240021, "grad_norm": 11.25, "learning_rate": 4.842848898173614e-05, "loss": 1.2804014205932617, "mean_token_accuracy": 0.7141382545232773, "num_tokens": 17406097.0, "step": 8810 }, { "entropy": 1.2992166604846715, "epoch": 0.25263881529009063, "grad_norm": 10.25, "learning_rate": 4.842450437710454e-05, "loss": 1.2975056648254395, "mean_token_accuracy": 0.7111137416213751, "num_tokens": 17426727.0, "step": 8820 }, { "entropy": 1.318169329687953, "epoch": 0.2529252538561792, "grad_norm": 7.5625, "learning_rate": 4.842051489168062e-05, "loss": 1.3865495681762696, "mean_token_accuracy": 0.6926764242351056, "num_tokens": 17446015.0, "step": 8830 }, { "entropy": 1.274455401301384, "epoch": 0.2532116924222677, "grad_norm": 7.1875, "learning_rate": 4.841652052629564e-05, "loss": 1.3350720405578613, "mean_token_accuracy": 0.7090015534311533, "num_tokens": 17465660.0, "step": 8840 }, { "entropy": 1.3543043985962868, "epoch": 0.2534981309883563, "grad_norm": 7.8125, "learning_rate": 4.8412521281781876e-05, "loss": 1.3698068618774415, "mean_token_accuracy": 0.6999831791967154, "num_tokens": 17485122.0, "step": 8850 }, { "entropy": 1.233489517867565, "epoch": 0.2537845695544448, "grad_norm": 7.125, "learning_rate": 4.840851715897262e-05, "loss": 1.2474135398864745, "mean_token_accuracy": 0.7246371265500784, "num_tokens": 17503707.0, "step": 8860 }, { "entropy": 1.196946768090129, "epoch": 0.25407100812053335, "grad_norm": 9.0625, "learning_rate": 4.8404508158702176e-05, "loss": 1.2503541946411132, "mean_token_accuracy": 0.7292619161307812, "num_tokens": 17522983.0, "step": 8870 }, { "entropy": 1.3353007577359677, "epoch": 0.2543574466866219, "grad_norm": 10.875, "learning_rate": 4.840049428180588e-05, "loss": 1.3440793037414551, "mean_token_accuracy": 0.7034892737865448, "num_tokens": 17541596.0, "step": 8880 }, { "entropy": 1.244178694114089, "epoch": 0.2546438852527104, "grad_norm": 7.78125, "learning_rate": 4.8396475529120064e-05, "loss": 1.2328694343566895, "mean_token_accuracy": 0.717902934923768, "num_tokens": 17562108.0, "step": 8890 }, { "entropy": 1.1850521273910999, "epoch": 0.254930323818799, "grad_norm": 10.5625, "learning_rate": 4.83924519014821e-05, "loss": 1.2897089958190917, "mean_token_accuracy": 0.7144745960831642, "num_tokens": 17581987.0, "step": 8900 }, { "entropy": 1.1607084844261408, "epoch": 0.2552167623848875, "grad_norm": 8.1875, "learning_rate": 4.8388423399730354e-05, "loss": 1.1564496040344239, "mean_token_accuracy": 0.7309151075780391, "num_tokens": 17600491.0, "step": 8910 }, { "entropy": 1.2427813615649939, "epoch": 0.25550320095097606, "grad_norm": 10.1875, "learning_rate": 4.838439002470421e-05, "loss": 1.316445255279541, "mean_token_accuracy": 0.714518991112709, "num_tokens": 17620332.0, "step": 8920 }, { "entropy": 1.3517073668539523, "epoch": 0.25578963951706457, "grad_norm": 7.125, "learning_rate": 4.8380351777244074e-05, "loss": 1.3991028785705566, "mean_token_accuracy": 0.691733792796731, "num_tokens": 17640142.0, "step": 8930 }, { "entropy": 1.3683735538274049, "epoch": 0.25607607808315314, "grad_norm": 8.625, "learning_rate": 4.837630865819137e-05, "loss": 1.3935741424560546, "mean_token_accuracy": 0.6869533844292164, "num_tokens": 17660323.0, "step": 8940 }, { "entropy": 1.2362545177340507, "epoch": 0.25636251664924165, "grad_norm": 9.6875, "learning_rate": 4.8372260668388544e-05, "loss": 1.2276459693908692, "mean_token_accuracy": 0.7174127500504255, "num_tokens": 17679087.0, "step": 8950 }, { "entropy": 1.3572645898908378, "epoch": 0.2566489552153302, "grad_norm": 6.78125, "learning_rate": 4.8368207808679026e-05, "loss": 1.4539985656738281, "mean_token_accuracy": 0.6940882369875908, "num_tokens": 17698229.0, "step": 8960 }, { "entropy": 1.3479806134477257, "epoch": 0.2569353937814187, "grad_norm": 7.09375, "learning_rate": 4.836415007990729e-05, "loss": 1.2825389862060548, "mean_token_accuracy": 0.7158281572163105, "num_tokens": 17717948.0, "step": 8970 }, { "entropy": 1.260199136659503, "epoch": 0.2572218323475073, "grad_norm": 7.875, "learning_rate": 4.8360087482918815e-05, "loss": 1.3139952659606933, "mean_token_accuracy": 0.7144561346620322, "num_tokens": 17737324.0, "step": 8980 }, { "entropy": 1.358280747383833, "epoch": 0.2575082709135958, "grad_norm": 10.1875, "learning_rate": 4.83560200185601e-05, "loss": 1.468091106414795, "mean_token_accuracy": 0.6907810769975186, "num_tokens": 17756566.0, "step": 8990 }, { "entropy": 1.430641485005617, "epoch": 0.25779470947968436, "grad_norm": 9.5625, "learning_rate": 4.835194768767864e-05, "loss": 1.5613553047180175, "mean_token_accuracy": 0.6674827165901661, "num_tokens": 17776048.0, "step": 9000 }, { "entropy": 1.3074854500591755, "epoch": 0.25808114804577287, "grad_norm": 7.34375, "learning_rate": 4.8347870491122974e-05, "loss": 1.268750286102295, "mean_token_accuracy": 0.7098786775022745, "num_tokens": 17795703.0, "step": 9010 }, { "entropy": 1.3482228700071572, "epoch": 0.25836758661186143, "grad_norm": 8.5, "learning_rate": 4.8343788429742616e-05, "loss": 1.3972908973693847, "mean_token_accuracy": 0.6933056764304638, "num_tokens": 17816523.0, "step": 9020 }, { "entropy": 1.2695806331932544, "epoch": 0.25865402517794994, "grad_norm": 6.90625, "learning_rate": 4.833970150438813e-05, "loss": 1.2388599395751954, "mean_token_accuracy": 0.7200279366225004, "num_tokens": 17835831.0, "step": 9030 }, { "entropy": 1.3064831744879484, "epoch": 0.2589404637440385, "grad_norm": 8.0625, "learning_rate": 4.833560971591107e-05, "loss": 1.3616947174072265, "mean_token_accuracy": 0.6906574167311191, "num_tokens": 17854300.0, "step": 9040 }, { "entropy": 1.242756339535117, "epoch": 0.259226902310127, "grad_norm": 7.5625, "learning_rate": 4.8331513065164025e-05, "loss": 1.2443609237670898, "mean_token_accuracy": 0.721508489176631, "num_tokens": 17873915.0, "step": 9050 }, { "entropy": 1.2797224348410965, "epoch": 0.2595133408762156, "grad_norm": 8.5, "learning_rate": 4.832741155300058e-05, "loss": 1.3430242538452148, "mean_token_accuracy": 0.7018827233463526, "num_tokens": 17893109.0, "step": 9060 }, { "entropy": 1.2939703285694122, "epoch": 0.2597997794423041, "grad_norm": 9.375, "learning_rate": 4.832330518027532e-05, "loss": 1.3360145568847657, "mean_token_accuracy": 0.7011235821992159, "num_tokens": 17912712.0, "step": 9070 }, { "entropy": 1.2067293141037225, "epoch": 0.26008621800839266, "grad_norm": 20.875, "learning_rate": 4.8319193947843885e-05, "loss": 1.255198860168457, "mean_token_accuracy": 0.7131258200854063, "num_tokens": 17932165.0, "step": 9080 }, { "entropy": 1.2123133920133113, "epoch": 0.26037265657448116, "grad_norm": 8.0, "learning_rate": 4.8315077856562886e-05, "loss": 1.2235565185546875, "mean_token_accuracy": 0.7290280099958182, "num_tokens": 17952088.0, "step": 9090 }, { "entropy": 1.2446948152035475, "epoch": 0.26065909514056973, "grad_norm": 10.9375, "learning_rate": 4.8310956907289975e-05, "loss": 1.2665054321289062, "mean_token_accuracy": 0.7128050982952118, "num_tokens": 17972537.0, "step": 9100 }, { "entropy": 1.3901444882154466, "epoch": 0.26094553370665824, "grad_norm": 7.46875, "learning_rate": 4.830683110088379e-05, "loss": 1.4608612060546875, "mean_token_accuracy": 0.678036005795002, "num_tokens": 17994472.0, "step": 9110 }, { "entropy": 1.3316185031086207, "epoch": 0.2612319722727468, "grad_norm": 8.75, "learning_rate": 4.8302700438204e-05, "loss": 1.3409854888916015, "mean_token_accuracy": 0.7039120152592659, "num_tokens": 18014318.0, "step": 9120 }, { "entropy": 1.1473009951412678, "epoch": 0.2615184108388353, "grad_norm": 5.84375, "learning_rate": 4.829856492011128e-05, "loss": 1.15621976852417, "mean_token_accuracy": 0.7365556918084621, "num_tokens": 18033977.0, "step": 9130 }, { "entropy": 1.3351036570966244, "epoch": 0.2618048494049239, "grad_norm": 7.46875, "learning_rate": 4.829442454746732e-05, "loss": 1.3299053192138672, "mean_token_accuracy": 0.7117034964263439, "num_tokens": 18053596.0, "step": 9140 }, { "entropy": 1.2761389184743166, "epoch": 0.26209128797101244, "grad_norm": 6.53125, "learning_rate": 4.8290279321134825e-05, "loss": 1.3119136810302734, "mean_token_accuracy": 0.7001638438552618, "num_tokens": 18074125.0, "step": 9150 }, { "entropy": 1.3045391861349345, "epoch": 0.26237772653710095, "grad_norm": 7.1875, "learning_rate": 4.82861292419775e-05, "loss": 1.341162872314453, "mean_token_accuracy": 0.696571696922183, "num_tokens": 18093734.0, "step": 9160 }, { "entropy": 1.225440262258053, "epoch": 0.2626641651031895, "grad_norm": 8.75, "learning_rate": 4.828197431086005e-05, "loss": 1.2435415267944336, "mean_token_accuracy": 0.7088596798479557, "num_tokens": 18113254.0, "step": 9170 }, { "entropy": 1.3132943410426379, "epoch": 0.262950603669278, "grad_norm": 9.5625, "learning_rate": 4.8277814528648243e-05, "loss": 1.3694846153259277, "mean_token_accuracy": 0.697538585960865, "num_tokens": 18132818.0, "step": 9180 }, { "entropy": 1.2257746003568173, "epoch": 0.2632370422353666, "grad_norm": 8.5625, "learning_rate": 4.827364989620879e-05, "loss": 1.2318166732788085, "mean_token_accuracy": 0.723556337505579, "num_tokens": 18153417.0, "step": 9190 }, { "entropy": 1.1300859481096268, "epoch": 0.2635234808014551, "grad_norm": 8.125, "learning_rate": 4.826948041440946e-05, "loss": 1.1399371147155761, "mean_token_accuracy": 0.7450911700725555, "num_tokens": 18172555.0, "step": 9200 }, { "entropy": 1.2252363990992308, "epoch": 0.26380991936754367, "grad_norm": 9.0, "learning_rate": 4.826530608411902e-05, "loss": 1.3349379539489745, "mean_token_accuracy": 0.7047261077910661, "num_tokens": 18190827.0, "step": 9210 }, { "entropy": 1.1883025977760553, "epoch": 0.2640963579336322, "grad_norm": 7.8125, "learning_rate": 4.826112690620724e-05, "loss": 1.2126608848571778, "mean_token_accuracy": 0.7291012145578861, "num_tokens": 18210140.0, "step": 9220 }, { "entropy": 1.2685103014111518, "epoch": 0.26438279649972074, "grad_norm": 10.8125, "learning_rate": 4.825694288154491e-05, "loss": 1.2821360588073731, "mean_token_accuracy": 0.7151098676025868, "num_tokens": 18229663.0, "step": 9230 }, { "entropy": 1.2720585726201534, "epoch": 0.26466923506580925, "grad_norm": 10.75, "learning_rate": 4.8252754011003806e-05, "loss": 1.3949750900268554, "mean_token_accuracy": 0.6948246248066425, "num_tokens": 18249630.0, "step": 9240 }, { "entropy": 1.3435747668147087, "epoch": 0.2649556736318978, "grad_norm": 10.0, "learning_rate": 4.8248560295456755e-05, "loss": 1.3088791847229004, "mean_token_accuracy": 0.7048242457211018, "num_tokens": 18270253.0, "step": 9250 }, { "entropy": 1.307034932821989, "epoch": 0.2652421121979863, "grad_norm": 6.90625, "learning_rate": 4.824436173577756e-05, "loss": 1.367745304107666, "mean_token_accuracy": 0.6957523223012686, "num_tokens": 18290322.0, "step": 9260 }, { "entropy": 1.286383710242808, "epoch": 0.2655285507640749, "grad_norm": 10.4375, "learning_rate": 4.824015833284104e-05, "loss": 1.3017475128173828, "mean_token_accuracy": 0.7115768007934093, "num_tokens": 18310389.0, "step": 9270 }, { "entropy": 1.228379225730896, "epoch": 0.2658149893301634, "grad_norm": 10.1875, "learning_rate": 4.8235950087523034e-05, "loss": 1.238663673400879, "mean_token_accuracy": 0.7153057418763638, "num_tokens": 18329483.0, "step": 9280 }, { "entropy": 1.284581445157528, "epoch": 0.26610142789625196, "grad_norm": 6.28125, "learning_rate": 4.823173700070038e-05, "loss": 1.327126407623291, "mean_token_accuracy": 0.7110133722424508, "num_tokens": 18349027.0, "step": 9290 }, { "entropy": 1.338231517933309, "epoch": 0.2663878664623405, "grad_norm": 6.34375, "learning_rate": 4.822751907325094e-05, "loss": 1.3528115272521972, "mean_token_accuracy": 0.6897929109632969, "num_tokens": 18369125.0, "step": 9300 }, { "entropy": 1.1946829522028566, "epoch": 0.26667430502842904, "grad_norm": 8.8125, "learning_rate": 4.8223296306053555e-05, "loss": 1.2565718650817872, "mean_token_accuracy": 0.7138553358614445, "num_tokens": 18389297.0, "step": 9310 }, { "entropy": 1.2185409259051085, "epoch": 0.26696074359451755, "grad_norm": 7.78125, "learning_rate": 4.82190686999881e-05, "loss": 1.2864867210388184, "mean_token_accuracy": 0.7176742620766163, "num_tokens": 18408737.0, "step": 9320 }, { "entropy": 1.1369651939719916, "epoch": 0.2672471821606061, "grad_norm": 9.625, "learning_rate": 4.8214836255935447e-05, "loss": 1.2205231666564942, "mean_token_accuracy": 0.7372077208012342, "num_tokens": 18428730.0, "step": 9330 }, { "entropy": 1.2750138990581035, "epoch": 0.2675336207266946, "grad_norm": 7.21875, "learning_rate": 4.8210598974777486e-05, "loss": 1.2297069549560546, "mean_token_accuracy": 0.7142499633133411, "num_tokens": 18448023.0, "step": 9340 }, { "entropy": 1.324444257467985, "epoch": 0.2678200592927832, "grad_norm": 8.3125, "learning_rate": 4.82063568573971e-05, "loss": 1.433567428588867, "mean_token_accuracy": 0.6768547410145402, "num_tokens": 18467874.0, "step": 9350 }, { "entropy": 1.2551036842167378, "epoch": 0.2681064978588717, "grad_norm": 10.625, "learning_rate": 4.8202109904678196e-05, "loss": 1.227750301361084, "mean_token_accuracy": 0.7244132608175278, "num_tokens": 18487269.0, "step": 9360 }, { "entropy": 1.225942300632596, "epoch": 0.26839293642496026, "grad_norm": 10.5, "learning_rate": 4.8197858117505675e-05, "loss": 1.2767447471618651, "mean_token_accuracy": 0.7188018415123224, "num_tokens": 18505982.0, "step": 9370 }, { "entropy": 1.2126261051744223, "epoch": 0.26867937499104877, "grad_norm": 7.625, "learning_rate": 4.819360149676545e-05, "loss": 1.2597173690795898, "mean_token_accuracy": 0.7160643842071295, "num_tokens": 18525644.0, "step": 9380 }, { "entropy": 1.225095884874463, "epoch": 0.26896581355713733, "grad_norm": 9.4375, "learning_rate": 4.818934004334445e-05, "loss": 1.2749581336975098, "mean_token_accuracy": 0.7233197525143623, "num_tokens": 18546222.0, "step": 9390 }, { "entropy": 1.3505785837769508, "epoch": 0.26925225212322584, "grad_norm": 10.0625, "learning_rate": 4.818507375813059e-05, "loss": 1.3217741966247558, "mean_token_accuracy": 0.6942776661366225, "num_tokens": 18567731.0, "step": 9400 }, { "entropy": 1.436489612981677, "epoch": 0.2695386906893144, "grad_norm": 7.96875, "learning_rate": 4.818080264201282e-05, "loss": 1.451855754852295, "mean_token_accuracy": 0.6768117170780897, "num_tokens": 18588342.0, "step": 9410 }, { "entropy": 1.245344403758645, "epoch": 0.269825129255403, "grad_norm": 10.375, "learning_rate": 4.817652669588107e-05, "loss": 1.3660114288330079, "mean_token_accuracy": 0.7104274649173021, "num_tokens": 18607445.0, "step": 9420 }, { "entropy": 1.3693070027977228, "epoch": 0.2701115678214915, "grad_norm": 7.90625, "learning_rate": 4.817224592062629e-05, "loss": 1.398356056213379, "mean_token_accuracy": 0.7086417347192764, "num_tokens": 18627526.0, "step": 9430 }, { "entropy": 1.4342213924974203, "epoch": 0.27039800638758005, "grad_norm": 6.9375, "learning_rate": 4.816796031714043e-05, "loss": 1.4222000122070313, "mean_token_accuracy": 0.6907794957980513, "num_tokens": 18647290.0, "step": 9440 }, { "entropy": 1.3352411851286887, "epoch": 0.27068444495366856, "grad_norm": 11.9375, "learning_rate": 4.816366988631646e-05, "loss": 1.3825608253479005, "mean_token_accuracy": 0.7000203546136617, "num_tokens": 18664747.0, "step": 9450 }, { "entropy": 1.3079643428325654, "epoch": 0.2709708835197571, "grad_norm": 8.5, "learning_rate": 4.8159374629048334e-05, "loss": 1.2621251106262208, "mean_token_accuracy": 0.7136755257844924, "num_tokens": 18684534.0, "step": 9460 }, { "entropy": 1.2533658739179372, "epoch": 0.27125732208584563, "grad_norm": 6.4375, "learning_rate": 4.8155074546231034e-05, "loss": 1.2466175079345703, "mean_token_accuracy": 0.7103608205914498, "num_tokens": 18704073.0, "step": 9470 }, { "entropy": 1.2291026808321477, "epoch": 0.2715437606519342, "grad_norm": 9.0625, "learning_rate": 4.815076963876053e-05, "loss": 1.2841590881347655, "mean_token_accuracy": 0.7114346351474523, "num_tokens": 18724562.0, "step": 9480 }, { "entropy": 1.1566391289234161, "epoch": 0.2718301992180227, "grad_norm": 8.25, "learning_rate": 4.8146459907533805e-05, "loss": 1.2178935050964355, "mean_token_accuracy": 0.7282591745257377, "num_tokens": 18743686.0, "step": 9490 }, { "entropy": 1.21599200963974, "epoch": 0.27211663778411127, "grad_norm": 7.09375, "learning_rate": 4.814214535344884e-05, "loss": 1.2984207153320313, "mean_token_accuracy": 0.713078685849905, "num_tokens": 18764538.0, "step": 9500 }, { "entropy": 1.238351733610034, "epoch": 0.2724030763501998, "grad_norm": 6.75, "learning_rate": 4.813782597740465e-05, "loss": 1.2873254776000977, "mean_token_accuracy": 0.7136316448450089, "num_tokens": 18785455.0, "step": 9510 }, { "entropy": 1.3914471410214901, "epoch": 0.27268951491628834, "grad_norm": 8.125, "learning_rate": 4.81335017803012e-05, "loss": 1.3496410369873046, "mean_token_accuracy": 0.7046843189746141, "num_tokens": 18804885.0, "step": 9520 }, { "entropy": 1.22066420763731, "epoch": 0.27297595348237685, "grad_norm": 5.59375, "learning_rate": 4.812917276303952e-05, "loss": 1.266666793823242, "mean_token_accuracy": 0.7137233637273311, "num_tokens": 18824488.0, "step": 9530 }, { "entropy": 1.3131001925095915, "epoch": 0.2732623920484654, "grad_norm": 9.0625, "learning_rate": 4.812483892652159e-05, "loss": 1.3390828132629395, "mean_token_accuracy": 0.7044373240321875, "num_tokens": 18842866.0, "step": 9540 }, { "entropy": 1.1892004791647195, "epoch": 0.27354883061455393, "grad_norm": 10.5625, "learning_rate": 4.812050027165044e-05, "loss": 1.2279635429382325, "mean_token_accuracy": 0.7233818676322699, "num_tokens": 18863108.0, "step": 9550 }, { "entropy": 1.2994504366070032, "epoch": 0.2738352691806425, "grad_norm": 8.8125, "learning_rate": 4.811615679933007e-05, "loss": 1.3659720420837402, "mean_token_accuracy": 0.7011908940970898, "num_tokens": 18883222.0, "step": 9560 }, { "entropy": 1.3316714242100716, "epoch": 0.274121707746731, "grad_norm": 7.375, "learning_rate": 4.811180851046551e-05, "loss": 1.3249066352844239, "mean_token_accuracy": 0.6979438884183764, "num_tokens": 18902895.0, "step": 9570 }, { "entropy": 1.373481733724475, "epoch": 0.27440814631281957, "grad_norm": 5.78125, "learning_rate": 4.810745540596276e-05, "loss": 1.434743595123291, "mean_token_accuracy": 0.6876088410615921, "num_tokens": 18923925.0, "step": 9580 }, { "entropy": 1.281962576508522, "epoch": 0.2746945848789081, "grad_norm": 9.9375, "learning_rate": 4.810309748672888e-05, "loss": 1.2731183052062989, "mean_token_accuracy": 0.710417527705431, "num_tokens": 18943165.0, "step": 9590 }, { "entropy": 1.2833354998379947, "epoch": 0.27498102344499664, "grad_norm": 8.4375, "learning_rate": 4.809873475367186e-05, "loss": 1.3538728713989259, "mean_token_accuracy": 0.7047929227352142, "num_tokens": 18963454.0, "step": 9600 }, { "entropy": 1.2634608965367078, "epoch": 0.27526746201108515, "grad_norm": 8.0625, "learning_rate": 4.8094367207700754e-05, "loss": 1.3354544639587402, "mean_token_accuracy": 0.7013860233128071, "num_tokens": 18983623.0, "step": 9610 }, { "entropy": 1.2145154062658547, "epoch": 0.2755539005771737, "grad_norm": 9.25, "learning_rate": 4.8089994849725596e-05, "loss": 1.2072470664978028, "mean_token_accuracy": 0.7160839352756738, "num_tokens": 19002971.0, "step": 9620 }, { "entropy": 1.3010970495641232, "epoch": 0.2758403391432622, "grad_norm": 10.625, "learning_rate": 4.80856176806574e-05, "loss": 1.268671703338623, "mean_token_accuracy": 0.7222683660686016, "num_tokens": 19021723.0, "step": 9630 }, { "entropy": 1.2018229987472295, "epoch": 0.2761267777093508, "grad_norm": 7.28125, "learning_rate": 4.808123570140823e-05, "loss": 1.2600168228149413, "mean_token_accuracy": 0.7058022413402796, "num_tokens": 19041071.0, "step": 9640 }, { "entropy": 1.252623599767685, "epoch": 0.2764132162754393, "grad_norm": 7.40625, "learning_rate": 4.807684891289111e-05, "loss": 1.3150317192077636, "mean_token_accuracy": 0.7052531097084284, "num_tokens": 19060496.0, "step": 9650 }, { "entropy": 1.3609641756862403, "epoch": 0.27669965484152786, "grad_norm": 8.125, "learning_rate": 4.807245731602009e-05, "loss": 1.2961626052856445, "mean_token_accuracy": 0.7096053510904312, "num_tokens": 19079857.0, "step": 9660 }, { "entropy": 1.1585993632674216, "epoch": 0.2769860934076164, "grad_norm": 8.0, "learning_rate": 4.806806091171022e-05, "loss": 1.1728649139404297, "mean_token_accuracy": 0.7339285384863615, "num_tokens": 19099319.0, "step": 9670 }, { "entropy": 1.1269067496061325, "epoch": 0.27727253197370494, "grad_norm": 6.28125, "learning_rate": 4.806365970087754e-05, "loss": 1.1625200271606446, "mean_token_accuracy": 0.7388526450842618, "num_tokens": 19119539.0, "step": 9680 }, { "entropy": 1.213476287573576, "epoch": 0.2775589705397935, "grad_norm": 7.46875, "learning_rate": 4.80592536844391e-05, "loss": 1.238703155517578, "mean_token_accuracy": 0.7205547297373414, "num_tokens": 19139271.0, "step": 9690 }, { "entropy": 1.1873043950647115, "epoch": 0.277845409105882, "grad_norm": 8.3125, "learning_rate": 4.805484286331294e-05, "loss": 1.2164966583251953, "mean_token_accuracy": 0.7208237007260323, "num_tokens": 19160395.0, "step": 9700 }, { "entropy": 1.1731833301484584, "epoch": 0.2781318476719706, "grad_norm": 7.90625, "learning_rate": 4.805042723841813e-05, "loss": 1.187636661529541, "mean_token_accuracy": 0.7279136903584004, "num_tokens": 19180462.0, "step": 9710 }, { "entropy": 1.1782655270770193, "epoch": 0.2784182862380591, "grad_norm": 9.375, "learning_rate": 4.8046006810674705e-05, "loss": 1.2543769836425782, "mean_token_accuracy": 0.7170453231781722, "num_tokens": 19199875.0, "step": 9720 }, { "entropy": 1.2035142604261637, "epoch": 0.27870472480414765, "grad_norm": 6.4375, "learning_rate": 4.804158158100372e-05, "loss": 1.2652222633361816, "mean_token_accuracy": 0.7143611006438733, "num_tokens": 19220080.0, "step": 9730 }, { "entropy": 1.2720818102359772, "epoch": 0.27899116337023616, "grad_norm": 7.03125, "learning_rate": 4.8037151550327234e-05, "loss": 1.2831024169921874, "mean_token_accuracy": 0.7145038194954395, "num_tokens": 19239545.0, "step": 9740 }, { "entropy": 1.2525265368632972, "epoch": 0.2792776019363247, "grad_norm": 9.375, "learning_rate": 4.80327167195683e-05, "loss": 1.2966771125793457, "mean_token_accuracy": 0.7163520272821188, "num_tokens": 19258693.0, "step": 9750 }, { "entropy": 1.2273115681484341, "epoch": 0.27956404050241324, "grad_norm": 9.1875, "learning_rate": 4.802827708965096e-05, "loss": 1.2193683624267577, "mean_token_accuracy": 0.7216869089752436, "num_tokens": 19279707.0, "step": 9760 }, { "entropy": 1.1521436281502246, "epoch": 0.2798504790685018, "grad_norm": 6.03125, "learning_rate": 4.802383266150028e-05, "loss": 1.1548256874084473, "mean_token_accuracy": 0.7361404214054346, "num_tokens": 19299758.0, "step": 9770 }, { "entropy": 1.2253732860088349, "epoch": 0.2801369176345903, "grad_norm": 10.0, "learning_rate": 4.80193834360423e-05, "loss": 1.259799861907959, "mean_token_accuracy": 0.717500614747405, "num_tokens": 19319031.0, "step": 9780 }, { "entropy": 1.3701102506369351, "epoch": 0.2804233562006789, "grad_norm": 7.125, "learning_rate": 4.8014929414204084e-05, "loss": 1.3844647407531738, "mean_token_accuracy": 0.6849213771522045, "num_tokens": 19339202.0, "step": 9790 }, { "entropy": 1.1747784547507762, "epoch": 0.2807097947667674, "grad_norm": 10.4375, "learning_rate": 4.801047059691368e-05, "loss": 1.195345973968506, "mean_token_accuracy": 0.7189787935465575, "num_tokens": 19358633.0, "step": 9800 }, { "entropy": 1.1420799817889928, "epoch": 0.28099623333285595, "grad_norm": 7.125, "learning_rate": 4.800600698510014e-05, "loss": 1.1610635757446288, "mean_token_accuracy": 0.7388739325106144, "num_tokens": 19378085.0, "step": 9810 }, { "entropy": 1.1826870456337928, "epoch": 0.28128267189894446, "grad_norm": 5.8125, "learning_rate": 4.800153857969351e-05, "loss": 1.251106071472168, "mean_token_accuracy": 0.718170203641057, "num_tokens": 19397525.0, "step": 9820 }, { "entropy": 1.2163832444697618, "epoch": 0.281569110465033, "grad_norm": 6.125, "learning_rate": 4.7997065381624846e-05, "loss": 1.2410301208496093, "mean_token_accuracy": 0.7348678473383188, "num_tokens": 19419740.0, "step": 9830 }, { "entropy": 1.3619404435157776, "epoch": 0.28185554903112153, "grad_norm": 7.0625, "learning_rate": 4.799258739182619e-05, "loss": 1.433720874786377, "mean_token_accuracy": 0.6913000743836164, "num_tokens": 19439721.0, "step": 9840 }, { "entropy": 1.2456842597573996, "epoch": 0.2821419875972101, "grad_norm": 8.0, "learning_rate": 4.798810461123059e-05, "loss": 1.2306564331054688, "mean_token_accuracy": 0.7235556855797768, "num_tokens": 19457940.0, "step": 9850 }, { "entropy": 1.3578756723552943, "epoch": 0.2824284261632986, "grad_norm": 8.375, "learning_rate": 4.7983617040772086e-05, "loss": 1.4068643569946289, "mean_token_accuracy": 0.6960411306470633, "num_tokens": 19477065.0, "step": 9860 }, { "entropy": 1.2337223421782255, "epoch": 0.28271486472938717, "grad_norm": 8.5625, "learning_rate": 4.797912468138572e-05, "loss": 1.2814136505126954, "mean_token_accuracy": 0.7116973515599966, "num_tokens": 19496370.0, "step": 9870 }, { "entropy": 1.158883135765791, "epoch": 0.2830013032954757, "grad_norm": 5.59375, "learning_rate": 4.7974627534007544e-05, "loss": 1.1135085105895997, "mean_token_accuracy": 0.7410048365592956, "num_tokens": 19517537.0, "step": 9880 }, { "entropy": 1.236505088582635, "epoch": 0.28328774186156425, "grad_norm": 7.46875, "learning_rate": 4.797012559957458e-05, "loss": 1.3544401168823241, "mean_token_accuracy": 0.7023403074592351, "num_tokens": 19537138.0, "step": 9890 }, { "entropy": 1.3292220380157231, "epoch": 0.28357418042765276, "grad_norm": 10.5625, "learning_rate": 4.7965618879024876e-05, "loss": 1.3328524589538575, "mean_token_accuracy": 0.7065465740859509, "num_tokens": 19556009.0, "step": 9900 }, { "entropy": 1.284081007540226, "epoch": 0.2838606189937413, "grad_norm": 9.5625, "learning_rate": 4.796110737329745e-05, "loss": 1.2665791511535645, "mean_token_accuracy": 0.7108983382582664, "num_tokens": 19576505.0, "step": 9910 }, { "entropy": 1.2333140067756176, "epoch": 0.28414705755982983, "grad_norm": 7.5625, "learning_rate": 4.795659108333236e-05, "loss": 1.1999363899230957, "mean_token_accuracy": 0.7268323682248592, "num_tokens": 19596879.0, "step": 9920 }, { "entropy": 1.2496559236198663, "epoch": 0.2844334961259184, "grad_norm": 7.6875, "learning_rate": 4.7952070010070594e-05, "loss": 1.3359495162963868, "mean_token_accuracy": 0.7083397228270769, "num_tokens": 19616634.0, "step": 9930 }, { "entropy": 1.237235459499061, "epoch": 0.2847199346920069, "grad_norm": 9.4375, "learning_rate": 4.7947544154454196e-05, "loss": 1.234358787536621, "mean_token_accuracy": 0.7246622666716576, "num_tokens": 19637092.0, "step": 9940 }, { "entropy": 1.1274428755044936, "epoch": 0.28500637325809547, "grad_norm": 9.9375, "learning_rate": 4.7943013517426183e-05, "loss": 1.0833609580993653, "mean_token_accuracy": 0.747896709293127, "num_tokens": 19656900.0, "step": 9950 }, { "entropy": 1.2382439866662025, "epoch": 0.28529281182418403, "grad_norm": 7.4375, "learning_rate": 4.793847809993057e-05, "loss": 1.3295849800109862, "mean_token_accuracy": 0.7127545036375522, "num_tokens": 19675323.0, "step": 9960 }, { "entropy": 1.2497281353920697, "epoch": 0.28557925039027254, "grad_norm": 8.625, "learning_rate": 4.7933937902912375e-05, "loss": 1.2507732391357422, "mean_token_accuracy": 0.7235575128346682, "num_tokens": 19695182.0, "step": 9970 }, { "entropy": 1.1741746734827756, "epoch": 0.2858656889563611, "grad_norm": 6.90625, "learning_rate": 4.79293929273176e-05, "loss": 1.233245277404785, "mean_token_accuracy": 0.7213643684983253, "num_tokens": 19713855.0, "step": 9980 }, { "entropy": 1.2821607805788517, "epoch": 0.2861521275224496, "grad_norm": 8.375, "learning_rate": 4.792484317409324e-05, "loss": 1.3093585968017578, "mean_token_accuracy": 0.6996051449328661, "num_tokens": 19733770.0, "step": 9990 }, { "entropy": 1.2294521793723105, "epoch": 0.2864385660885382, "grad_norm": 9.875, "learning_rate": 4.79202886441873e-05, "loss": 1.2560036659240723, "mean_token_accuracy": 0.7066733181476593, "num_tokens": 19753166.0, "step": 10000 }, { "entropy": 1.28849596939981, "epoch": 0.2867250046546267, "grad_norm": 10.4375, "learning_rate": 4.791572933854879e-05, "loss": 1.3138832092285155, "mean_token_accuracy": 0.6822977267205715, "num_tokens": 19773167.0, "step": 10010 }, { "entropy": 1.2579356957226993, "epoch": 0.28701144322071526, "grad_norm": 7.15625, "learning_rate": 4.791116525812767e-05, "loss": 1.328775119781494, "mean_token_accuracy": 0.6985458929091692, "num_tokens": 19793810.0, "step": 10020 }, { "entropy": 1.2042025054804981, "epoch": 0.28729788178680377, "grad_norm": 6.0, "learning_rate": 4.790659640387494e-05, "loss": 1.2034329414367675, "mean_token_accuracy": 0.7252053562551737, "num_tokens": 19812874.0, "step": 10030 }, { "entropy": 1.27395105548203, "epoch": 0.28758432035289233, "grad_norm": 7.78125, "learning_rate": 4.7902022776742586e-05, "loss": 1.304868221282959, "mean_token_accuracy": 0.7137073144316674, "num_tokens": 19832721.0, "step": 10040 }, { "entropy": 1.158857085183263, "epoch": 0.28787075891898084, "grad_norm": 7.875, "learning_rate": 4.789744437768356e-05, "loss": 1.1979079246520996, "mean_token_accuracy": 0.7325722940266133, "num_tokens": 19853344.0, "step": 10050 }, { "entropy": 1.2469136916100978, "epoch": 0.2881571974850694, "grad_norm": 7.25, "learning_rate": 4.789286120765185e-05, "loss": 1.2818082809448241, "mean_token_accuracy": 0.7125504605472088, "num_tokens": 19874109.0, "step": 10060 }, { "entropy": 1.1972002856433392, "epoch": 0.2884436360511579, "grad_norm": 8.375, "learning_rate": 4.7888273267602414e-05, "loss": 1.247776699066162, "mean_token_accuracy": 0.720183490216732, "num_tokens": 19893140.0, "step": 10070 }, { "entropy": 1.1542341858148575, "epoch": 0.2887300746172465, "grad_norm": 8.375, "learning_rate": 4.7883680558491196e-05, "loss": 1.202667808532715, "mean_token_accuracy": 0.724473912641406, "num_tokens": 19913180.0, "step": 10080 }, { "entropy": 1.2531606178730725, "epoch": 0.289016513183335, "grad_norm": 8.8125, "learning_rate": 4.7879083081275156e-05, "loss": 1.212215518951416, "mean_token_accuracy": 0.7197392519563437, "num_tokens": 19933746.0, "step": 10090 }, { "entropy": 1.2108169622719287, "epoch": 0.28930295174942355, "grad_norm": 7.4375, "learning_rate": 4.787448083691223e-05, "loss": 1.2483904838562012, "mean_token_accuracy": 0.7140415642410517, "num_tokens": 19953380.0, "step": 10100 }, { "entropy": 1.2383288452401757, "epoch": 0.28958939031551206, "grad_norm": 10.9375, "learning_rate": 4.786987382636136e-05, "loss": 1.2708030700683595, "mean_token_accuracy": 0.7138889364898204, "num_tokens": 19973049.0, "step": 10110 }, { "entropy": 1.2284024387598038, "epoch": 0.28987582888160063, "grad_norm": 8.5625, "learning_rate": 4.786526205058246e-05, "loss": 1.2730886459350585, "mean_token_accuracy": 0.722532881423831, "num_tokens": 19992357.0, "step": 10120 }, { "entropy": 1.2366085767745971, "epoch": 0.29016226744768914, "grad_norm": 9.9375, "learning_rate": 4.7860645510536475e-05, "loss": 1.2555581092834474, "mean_token_accuracy": 0.7109288562089204, "num_tokens": 20012033.0, "step": 10130 }, { "entropy": 1.259175629541278, "epoch": 0.2904487060137777, "grad_norm": 7.15625, "learning_rate": 4.78560242071853e-05, "loss": 1.2749428749084473, "mean_token_accuracy": 0.7174477286636829, "num_tokens": 20031070.0, "step": 10140 }, { "entropy": 1.3015303812921046, "epoch": 0.2907351445798662, "grad_norm": 8.3125, "learning_rate": 4.7851398141491855e-05, "loss": 1.3474379539489747, "mean_token_accuracy": 0.699538454040885, "num_tokens": 20050478.0, "step": 10150 }, { "entropy": 1.1652599275112152, "epoch": 0.2910215831459548, "grad_norm": 8.625, "learning_rate": 4.784676731442004e-05, "loss": 1.1608721733093261, "mean_token_accuracy": 0.7359152492135763, "num_tokens": 20070056.0, "step": 10160 }, { "entropy": 1.1339007444679736, "epoch": 0.2913080217120433, "grad_norm": 9.6875, "learning_rate": 4.784213172693473e-05, "loss": 1.156212615966797, "mean_token_accuracy": 0.7336442414671183, "num_tokens": 20088606.0, "step": 10170 }, { "entropy": 1.1140047937631607, "epoch": 0.29159446027813185, "grad_norm": 8.625, "learning_rate": 4.783749138000183e-05, "loss": 1.1142316818237306, "mean_token_accuracy": 0.7451892249286175, "num_tokens": 20107961.0, "step": 10180 }, { "entropy": 1.2975910264998674, "epoch": 0.29188089884422036, "grad_norm": 7.25, "learning_rate": 4.78328462745882e-05, "loss": 1.4363594055175781, "mean_token_accuracy": 0.694925444573164, "num_tokens": 20127462.0, "step": 10190 }, { "entropy": 1.2322942119091749, "epoch": 0.2921673374103089, "grad_norm": 7.625, "learning_rate": 4.7828196411661705e-05, "loss": 1.2529497146606445, "mean_token_accuracy": 0.7259122528135776, "num_tokens": 20146253.0, "step": 10200 }, { "entropy": 1.239514384791255, "epoch": 0.2924537759763975, "grad_norm": 12.1875, "learning_rate": 4.782354179219122e-05, "loss": 1.2916205406188965, "mean_token_accuracy": 0.6989834289997816, "num_tokens": 20165620.0, "step": 10210 }, { "entropy": 1.2953903215005993, "epoch": 0.292740214542486, "grad_norm": 8.75, "learning_rate": 4.7818882417146584e-05, "loss": 1.3701395034790038, "mean_token_accuracy": 0.7016857746988535, "num_tokens": 20185628.0, "step": 10220 }, { "entropy": 1.2485311467200517, "epoch": 0.29302665310857456, "grad_norm": 7.40625, "learning_rate": 4.781421828749863e-05, "loss": 1.196932888031006, "mean_token_accuracy": 0.7228483323007822, "num_tokens": 20204149.0, "step": 10230 }, { "entropy": 1.2259568341076374, "epoch": 0.2933130916746631, "grad_norm": 9.0625, "learning_rate": 4.78095494042192e-05, "loss": 1.2339511871337892, "mean_token_accuracy": 0.7088088352233172, "num_tokens": 20223293.0, "step": 10240 }, { "entropy": 1.2301707200706005, "epoch": 0.29359953024075164, "grad_norm": 7.46875, "learning_rate": 4.78048757682811e-05, "loss": 1.263758659362793, "mean_token_accuracy": 0.7220470685511827, "num_tokens": 20241746.0, "step": 10250 }, { "entropy": 1.1846627168357373, "epoch": 0.29388596880684015, "grad_norm": 11.8125, "learning_rate": 4.7800197380658153e-05, "loss": 1.1950181007385254, "mean_token_accuracy": 0.728680620715022, "num_tokens": 20263134.0, "step": 10260 }, { "entropy": 1.22404460683465, "epoch": 0.2941724073729287, "grad_norm": 9.0625, "learning_rate": 4.779551424232516e-05, "loss": 1.3358233451843262, "mean_token_accuracy": 0.7044001743197441, "num_tokens": 20283085.0, "step": 10270 }, { "entropy": 1.3748682785779238, "epoch": 0.2944588459390172, "grad_norm": 7.125, "learning_rate": 4.779082635425791e-05, "loss": 1.3425874710083008, "mean_token_accuracy": 0.7075872421264648, "num_tokens": 20302780.0, "step": 10280 }, { "entropy": 1.3219470448791981, "epoch": 0.2947452845051058, "grad_norm": 10.0625, "learning_rate": 4.778613371743319e-05, "loss": 1.3717927932739258, "mean_token_accuracy": 0.6967399388551712, "num_tokens": 20322288.0, "step": 10290 }, { "entropy": 1.2808030743151904, "epoch": 0.2950317230711943, "grad_norm": 8.875, "learning_rate": 4.778143633282876e-05, "loss": 1.3541928291320802, "mean_token_accuracy": 0.6995458628982305, "num_tokens": 20342336.0, "step": 10300 }, { "entropy": 1.2334368931129576, "epoch": 0.29531816163728286, "grad_norm": 8.8125, "learning_rate": 4.777673420142338e-05, "loss": 1.2389339447021483, "mean_token_accuracy": 0.7194286450743675, "num_tokens": 20362570.0, "step": 10310 }, { "entropy": 1.3115269932895899, "epoch": 0.29560460020337137, "grad_norm": 6.625, "learning_rate": 4.777202732419681e-05, "loss": 1.383128833770752, "mean_token_accuracy": 0.6994543489068746, "num_tokens": 20383321.0, "step": 10320 }, { "entropy": 1.2894154995679856, "epoch": 0.29589103876945994, "grad_norm": 8.0625, "learning_rate": 4.7767315702129774e-05, "loss": 1.2736214637756347, "mean_token_accuracy": 0.7091438576579094, "num_tokens": 20402286.0, "step": 10330 }, { "entropy": 1.278226450830698, "epoch": 0.29617747733554844, "grad_norm": 10.6875, "learning_rate": 4.7762599336204005e-05, "loss": 1.281544303894043, "mean_token_accuracy": 0.7182073879987001, "num_tokens": 20421520.0, "step": 10340 }, { "entropy": 1.1996090399101376, "epoch": 0.296463915901637, "grad_norm": 6.53125, "learning_rate": 4.775787822740222e-05, "loss": 1.2525644302368164, "mean_token_accuracy": 0.731365493312478, "num_tokens": 20442233.0, "step": 10350 }, { "entropy": 1.1005093213170767, "epoch": 0.2967503544677255, "grad_norm": 6.90625, "learning_rate": 4.775315237670812e-05, "loss": 1.1033694267272949, "mean_token_accuracy": 0.7439654916524887, "num_tokens": 20461079.0, "step": 10360 }, { "entropy": 1.181967235542834, "epoch": 0.2970367930338141, "grad_norm": 8.375, "learning_rate": 4.774842178510639e-05, "loss": 1.2287528038024902, "mean_token_accuracy": 0.7279417492449284, "num_tokens": 20479607.0, "step": 10370 }, { "entropy": 1.2588371988385916, "epoch": 0.2973232315999026, "grad_norm": 9.5625, "learning_rate": 4.774368645358271e-05, "loss": 1.2836091995239258, "mean_token_accuracy": 0.7170934330672025, "num_tokens": 20498614.0, "step": 10380 }, { "entropy": 1.266011572163552, "epoch": 0.29760967016599116, "grad_norm": 9.3125, "learning_rate": 4.773894638312376e-05, "loss": 1.3395215034484864, "mean_token_accuracy": 0.7086238369345665, "num_tokens": 20518950.0, "step": 10390 }, { "entropy": 1.3530218362808228, "epoch": 0.29789610873207967, "grad_norm": 9.875, "learning_rate": 4.7734201574717185e-05, "loss": 1.4200379371643066, "mean_token_accuracy": 0.6952762430533767, "num_tokens": 20538880.0, "step": 10400 }, { "entropy": 1.2130294106900692, "epoch": 0.29818254729816823, "grad_norm": 7.375, "learning_rate": 4.7729452029351616e-05, "loss": 1.2266550064086914, "mean_token_accuracy": 0.720143285766244, "num_tokens": 20559866.0, "step": 10410 }, { "entropy": 1.1608878757804633, "epoch": 0.29846898586425674, "grad_norm": 5.9375, "learning_rate": 4.772469774801669e-05, "loss": 1.120636558532715, "mean_token_accuracy": 0.7369175810366869, "num_tokens": 20579174.0, "step": 10420 }, { "entropy": 1.1649308599531651, "epoch": 0.2987554244303453, "grad_norm": 7.9375, "learning_rate": 4.771993873170303e-05, "loss": 1.1998584747314454, "mean_token_accuracy": 0.7233378186821937, "num_tokens": 20599116.0, "step": 10430 }, { "entropy": 1.206273192167282, "epoch": 0.2990418629964338, "grad_norm": 6.78125, "learning_rate": 4.7715174981402225e-05, "loss": 1.258732795715332, "mean_token_accuracy": 0.7155660688877106, "num_tokens": 20618958.0, "step": 10440 }, { "entropy": 1.209686228260398, "epoch": 0.2993283015625224, "grad_norm": 9.25, "learning_rate": 4.771040649810686e-05, "loss": 1.2455236434936523, "mean_token_accuracy": 0.7279234286397696, "num_tokens": 20639688.0, "step": 10450 }, { "entropy": 1.2300740577280522, "epoch": 0.2996147401286109, "grad_norm": 12.0, "learning_rate": 4.770563328281052e-05, "loss": 1.2667814254760743, "mean_token_accuracy": 0.714299051836133, "num_tokens": 20659168.0, "step": 10460 }, { "entropy": 1.151146410405636, "epoch": 0.29990117869469946, "grad_norm": 7.25, "learning_rate": 4.770085533650776e-05, "loss": 1.1962030410766602, "mean_token_accuracy": 0.7382386907935142, "num_tokens": 20677516.0, "step": 10470 }, { "entropy": 1.2397548377513885, "epoch": 0.300187617260788, "grad_norm": 8.625, "learning_rate": 4.7696072660194124e-05, "loss": 1.2270134925842284, "mean_token_accuracy": 0.7233962573111057, "num_tokens": 20698074.0, "step": 10480 }, { "entropy": 1.241117611527443, "epoch": 0.30047405582687653, "grad_norm": 8.875, "learning_rate": 4.769128525486615e-05, "loss": 1.2556010246276856, "mean_token_accuracy": 0.7220278877764941, "num_tokens": 20717765.0, "step": 10490 }, { "entropy": 1.2247598566114903, "epoch": 0.3007604943929651, "grad_norm": 7.5, "learning_rate": 4.7686493121521336e-05, "loss": 1.2303947448730468, "mean_token_accuracy": 0.7157254960387945, "num_tokens": 20737590.0, "step": 10500 }, { "entropy": 1.1269052591174842, "epoch": 0.3010469329590536, "grad_norm": 9.0625, "learning_rate": 4.768169626115821e-05, "loss": 1.1731462478637695, "mean_token_accuracy": 0.7308567386120558, "num_tokens": 20756224.0, "step": 10510 }, { "entropy": 1.339089971035719, "epoch": 0.30133337152514217, "grad_norm": 6.65625, "learning_rate": 4.767689467477624e-05, "loss": 1.3878726959228516, "mean_token_accuracy": 0.6907770108431578, "num_tokens": 20775368.0, "step": 10520 }, { "entropy": 1.2001933190971612, "epoch": 0.3016198100912307, "grad_norm": 7.1875, "learning_rate": 4.767208836337591e-05, "loss": 1.2366168022155761, "mean_token_accuracy": 0.7184179678559304, "num_tokens": 20795163.0, "step": 10530 }, { "entropy": 1.2310813583433629, "epoch": 0.30190624865731924, "grad_norm": 9.375, "learning_rate": 4.766727732795866e-05, "loss": 1.2524584770202636, "mean_token_accuracy": 0.7192334160208702, "num_tokens": 20814193.0, "step": 10540 }, { "entropy": 1.3205643955618143, "epoch": 0.30219268722340775, "grad_norm": 7.34375, "learning_rate": 4.766246156952695e-05, "loss": 1.3525377273559571, "mean_token_accuracy": 0.6964046154171228, "num_tokens": 20835207.0, "step": 10550 }, { "entropy": 1.3620137978345155, "epoch": 0.3024791257894963, "grad_norm": 7.125, "learning_rate": 4.7657641089084184e-05, "loss": 1.3694384574890137, "mean_token_accuracy": 0.6839216224849224, "num_tokens": 20855984.0, "step": 10560 }, { "entropy": 1.2748428869992494, "epoch": 0.3027655643555848, "grad_norm": 10.1875, "learning_rate": 4.765281588763479e-05, "loss": 1.3202522277832032, "mean_token_accuracy": 0.7001968938857317, "num_tokens": 20876272.0, "step": 10570 }, { "entropy": 1.2867596458643675, "epoch": 0.3030520029216734, "grad_norm": 8.1875, "learning_rate": 4.764798596618414e-05, "loss": 1.2923958778381348, "mean_token_accuracy": 0.7128220777958632, "num_tokens": 20897178.0, "step": 10580 }, { "entropy": 1.2885660350322723, "epoch": 0.3033384414877619, "grad_norm": 5.84375, "learning_rate": 4.764315132573862e-05, "loss": 1.3065492630004882, "mean_token_accuracy": 0.7092504814267159, "num_tokens": 20917917.0, "step": 10590 }, { "entropy": 1.1919785939157008, "epoch": 0.30362488005385047, "grad_norm": 6.9375, "learning_rate": 4.763831196730559e-05, "loss": 1.2493278503417968, "mean_token_accuracy": 0.7136258292943239, "num_tokens": 20936362.0, "step": 10600 }, { "entropy": 1.2055115677416324, "epoch": 0.303911318619939, "grad_norm": 6.8125, "learning_rate": 4.76334678918934e-05, "loss": 1.2522308349609375, "mean_token_accuracy": 0.7191043566912413, "num_tokens": 20954995.0, "step": 10610 }, { "entropy": 1.2108305536210537, "epoch": 0.30419775718602754, "grad_norm": 11.5, "learning_rate": 4.7628619100511354e-05, "loss": 1.210112953186035, "mean_token_accuracy": 0.722658408433199, "num_tokens": 20974260.0, "step": 10620 }, { "entropy": 1.2318328015506268, "epoch": 0.30448419575211605, "grad_norm": 8.25, "learning_rate": 4.762376559416977e-05, "loss": 1.285456943511963, "mean_token_accuracy": 0.7226238247007132, "num_tokens": 20995089.0, "step": 10630 }, { "entropy": 1.2235995415598153, "epoch": 0.3047706343182046, "grad_norm": 7.9375, "learning_rate": 4.761890737387993e-05, "loss": 1.2320636749267577, "mean_token_accuracy": 0.7227725703269243, "num_tokens": 21015865.0, "step": 10640 }, { "entropy": 1.1759483505040407, "epoch": 0.3050570728842931, "grad_norm": 8.0, "learning_rate": 4.7614044440654114e-05, "loss": 1.1156691551208495, "mean_token_accuracy": 0.7398465003818273, "num_tokens": 21035144.0, "step": 10650 }, { "entropy": 1.2341271406039596, "epoch": 0.3053435114503817, "grad_norm": 7.75, "learning_rate": 4.760917679550558e-05, "loss": 1.2832679748535156, "mean_token_accuracy": 0.7126728795468807, "num_tokens": 21055609.0, "step": 10660 }, { "entropy": 1.1682598849758505, "epoch": 0.3056299500164702, "grad_norm": 9.5625, "learning_rate": 4.760430443944855e-05, "loss": 1.2545390129089355, "mean_token_accuracy": 0.7225143812596798, "num_tokens": 21076196.0, "step": 10670 }, { "entropy": 1.2379481434822082, "epoch": 0.30591638858255876, "grad_norm": 10.1875, "learning_rate": 4.759942737349826e-05, "loss": 1.236661148071289, "mean_token_accuracy": 0.7308149643242359, "num_tokens": 21095646.0, "step": 10680 }, { "entropy": 1.2307790230959654, "epoch": 0.30620282714864727, "grad_norm": 9.1875, "learning_rate": 4.759454559867089e-05, "loss": 1.2750882148742675, "mean_token_accuracy": 0.7240445971488952, "num_tokens": 21115304.0, "step": 10690 }, { "entropy": 1.2248421527445317, "epoch": 0.30648926571473584, "grad_norm": 6.46875, "learning_rate": 4.758965911598363e-05, "loss": 1.2623680114746094, "mean_token_accuracy": 0.7138577774167061, "num_tokens": 21135556.0, "step": 10700 }, { "entropy": 1.104908700659871, "epoch": 0.30677570428082435, "grad_norm": 10.25, "learning_rate": 4.7584767926454634e-05, "loss": 1.1125308990478515, "mean_token_accuracy": 0.751459326967597, "num_tokens": 21155140.0, "step": 10710 }, { "entropy": 1.3171832229942084, "epoch": 0.3070621428469129, "grad_norm": 8.75, "learning_rate": 4.757987203110305e-05, "loss": 1.400719451904297, "mean_token_accuracy": 0.6878932595252991, "num_tokens": 21174682.0, "step": 10720 }, { "entropy": 1.3011864509433508, "epoch": 0.3073485814130014, "grad_norm": 6.84375, "learning_rate": 4.7574971430948996e-05, "loss": 1.3636573791503905, "mean_token_accuracy": 0.6920033153146505, "num_tokens": 21194177.0, "step": 10730 }, { "entropy": 1.1832345899194479, "epoch": 0.30763501997909, "grad_norm": 9.125, "learning_rate": 4.757006612701357e-05, "loss": 1.1613354682922363, "mean_token_accuracy": 0.7329035576432943, "num_tokens": 21215496.0, "step": 10740 }, { "entropy": 1.187335892394185, "epoch": 0.30792145854517855, "grad_norm": 10.3125, "learning_rate": 4.7565156120318865e-05, "loss": 1.1941236495971679, "mean_token_accuracy": 0.7316756926476955, "num_tokens": 21235595.0, "step": 10750 }, { "entropy": 1.2101334569975735, "epoch": 0.30820789711126706, "grad_norm": 9.3125, "learning_rate": 4.756024141188793e-05, "loss": 1.241830062866211, "mean_token_accuracy": 0.7255348522216082, "num_tokens": 21255781.0, "step": 10760 }, { "entropy": 1.146967126056552, "epoch": 0.3084943356773556, "grad_norm": 7.1875, "learning_rate": 4.7555322002744816e-05, "loss": 1.1321705818176269, "mean_token_accuracy": 0.7449606519192458, "num_tokens": 21275148.0, "step": 10770 }, { "entropy": 1.1244464922696351, "epoch": 0.30878077424344413, "grad_norm": 8.0625, "learning_rate": 4.755039789391455e-05, "loss": 1.1305888175964356, "mean_token_accuracy": 0.7334440983831882, "num_tokens": 21296414.0, "step": 10780 }, { "entropy": 1.1792588256299497, "epoch": 0.3090672128095327, "grad_norm": 6.34375, "learning_rate": 4.754546908642312e-05, "loss": 1.2269912719726563, "mean_token_accuracy": 0.7150686468929053, "num_tokens": 21315274.0, "step": 10790 }, { "entropy": 1.3087532704696059, "epoch": 0.3093536513756212, "grad_norm": 8.0625, "learning_rate": 4.754053558129751e-05, "loss": 1.3459348678588867, "mean_token_accuracy": 0.711145069077611, "num_tokens": 21334939.0, "step": 10800 }, { "entropy": 1.1619780700653792, "epoch": 0.3096400899417098, "grad_norm": 9.0, "learning_rate": 4.753559737956568e-05, "loss": 1.235908317565918, "mean_token_accuracy": 0.7183175131678581, "num_tokens": 21354540.0, "step": 10810 }, { "entropy": 1.2855201866477728, "epoch": 0.3099265285077983, "grad_norm": 8.125, "learning_rate": 4.753065448225655e-05, "loss": 1.3649744033813476, "mean_token_accuracy": 0.7008419420570136, "num_tokens": 21374023.0, "step": 10820 }, { "entropy": 1.2370940748602153, "epoch": 0.31021296707388685, "grad_norm": 7.0, "learning_rate": 4.7525706890400066e-05, "loss": 1.1645638465881347, "mean_token_accuracy": 0.7422706112265587, "num_tokens": 21394317.0, "step": 10830 }, { "entropy": 1.1378230929374695, "epoch": 0.31049940563997536, "grad_norm": 8.3125, "learning_rate": 4.7520754605027105e-05, "loss": 1.1674391746520996, "mean_token_accuracy": 0.7362886283546686, "num_tokens": 21413188.0, "step": 10840 }, { "entropy": 1.2479592271149158, "epoch": 0.3107858442060639, "grad_norm": 9.5, "learning_rate": 4.751579762716954e-05, "loss": 1.2581291198730469, "mean_token_accuracy": 0.7095990601927042, "num_tokens": 21432740.0, "step": 10850 }, { "entropy": 1.1462712477892638, "epoch": 0.31107228277215243, "grad_norm": 7.28125, "learning_rate": 4.751083595786022e-05, "loss": 1.1932430267333984, "mean_token_accuracy": 0.7273823566734791, "num_tokens": 21452016.0, "step": 10860 }, { "entropy": 1.1188606400042773, "epoch": 0.311358721338241, "grad_norm": 7.6875, "learning_rate": 4.750586959813297e-05, "loss": 1.1153950691223145, "mean_token_accuracy": 0.7426442261785269, "num_tokens": 21470936.0, "step": 10870 }, { "entropy": 1.1895586505532265, "epoch": 0.3116451599043295, "grad_norm": 8.875, "learning_rate": 4.7500898549022585e-05, "loss": 1.2804391860961915, "mean_token_accuracy": 0.723309475183487, "num_tokens": 21491062.0, "step": 10880 }, { "entropy": 1.1611870124936103, "epoch": 0.31193159847041807, "grad_norm": 9.3125, "learning_rate": 4.749592281156487e-05, "loss": 1.1890996932983398, "mean_token_accuracy": 0.7258432779461146, "num_tokens": 21509588.0, "step": 10890 }, { "entropy": 1.1895610868930817, "epoch": 0.3122180370365066, "grad_norm": 7.4375, "learning_rate": 4.749094238679656e-05, "loss": 1.249438762664795, "mean_token_accuracy": 0.7212285254150629, "num_tokens": 21529465.0, "step": 10900 }, { "entropy": 1.1919631615281105, "epoch": 0.31250447560259514, "grad_norm": 8.1875, "learning_rate": 4.748595727575541e-05, "loss": 1.1756156921386718, "mean_token_accuracy": 0.7407011017203331, "num_tokens": 21549110.0, "step": 10910 }, { "entropy": 1.1960717402398586, "epoch": 0.31279091416868365, "grad_norm": 8.6875, "learning_rate": 4.748096747948011e-05, "loss": 1.1394862174987792, "mean_token_accuracy": 0.7422023169696331, "num_tokens": 21569379.0, "step": 10920 }, { "entropy": 1.0542187761515378, "epoch": 0.3130773527347722, "grad_norm": 6.9375, "learning_rate": 4.7475972999010364e-05, "loss": 1.1041646957397462, "mean_token_accuracy": 0.7483351707458497, "num_tokens": 21588808.0, "step": 10930 }, { "entropy": 1.0867573030292987, "epoch": 0.31336379130086073, "grad_norm": 7.28125, "learning_rate": 4.747097383538682e-05, "loss": 1.1180338859558105, "mean_token_accuracy": 0.7418781992048025, "num_tokens": 21608399.0, "step": 10940 }, { "entropy": 1.23358127232641, "epoch": 0.3136502298669493, "grad_norm": 8.3125, "learning_rate": 4.7465969989651135e-05, "loss": 1.3244894027709961, "mean_token_accuracy": 0.7115334682166576, "num_tokens": 21627233.0, "step": 10950 }, { "entropy": 1.2483941223472357, "epoch": 0.3139366684330378, "grad_norm": 7.84375, "learning_rate": 4.746096146284591e-05, "loss": 1.3419307708740233, "mean_token_accuracy": 0.7024520382285118, "num_tokens": 21647844.0, "step": 10960 }, { "entropy": 1.1981158410198987, "epoch": 0.31422310699912637, "grad_norm": 6.65625, "learning_rate": 4.745594825601474e-05, "loss": 1.2303057670593263, "mean_token_accuracy": 0.7272470030933619, "num_tokens": 21667743.0, "step": 10970 }, { "entropy": 1.2136971287429332, "epoch": 0.3145095455652149, "grad_norm": 7.5, "learning_rate": 4.7450930370202186e-05, "loss": 1.2649925231933594, "mean_token_accuracy": 0.7197300598025322, "num_tokens": 21687535.0, "step": 10980 }, { "entropy": 1.3185116354376079, "epoch": 0.31479598413130344, "grad_norm": 8.5625, "learning_rate": 4.744590780645379e-05, "loss": 1.2711140632629394, "mean_token_accuracy": 0.7174013394862413, "num_tokens": 21706072.0, "step": 10990 }, { "entropy": 1.1728610198944807, "epoch": 0.31508242269739195, "grad_norm": 9.5625, "learning_rate": 4.7440880565816085e-05, "loss": 1.2049323081970216, "mean_token_accuracy": 0.7259841859340668, "num_tokens": 21724910.0, "step": 11000 }, { "entropy": 1.1665601275861264, "epoch": 0.3153688612634805, "grad_norm": 7.84375, "learning_rate": 4.743584864933652e-05, "loss": 1.2178359031677246, "mean_token_accuracy": 0.735757676139474, "num_tokens": 21743481.0, "step": 11010 }, { "entropy": 1.2199096255004407, "epoch": 0.3156552998295691, "grad_norm": 8.125, "learning_rate": 4.74308120580636e-05, "loss": 1.3107985496520995, "mean_token_accuracy": 0.7149065248668194, "num_tokens": 21763759.0, "step": 11020 }, { "entropy": 1.205187126994133, "epoch": 0.3159417383956576, "grad_norm": 9.125, "learning_rate": 4.7425770793046734e-05, "loss": 1.2412653923034669, "mean_token_accuracy": 0.7323855470865965, "num_tokens": 21783707.0, "step": 11030 }, { "entropy": 1.1945237398147583, "epoch": 0.31622817696174615, "grad_norm": 8.25, "learning_rate": 4.7420724855336354e-05, "loss": 1.1271297454833984, "mean_token_accuracy": 0.744668971374631, "num_tokens": 21803623.0, "step": 11040 }, { "entropy": 1.118756825476885, "epoch": 0.31651461552783466, "grad_norm": 6.90625, "learning_rate": 4.7415674245983826e-05, "loss": 1.1883705139160157, "mean_token_accuracy": 0.7386421013623476, "num_tokens": 21822695.0, "step": 11050 }, { "entropy": 1.1413742423057556, "epoch": 0.31680105409392323, "grad_norm": 6.875, "learning_rate": 4.741061896604152e-05, "loss": 1.0950676918029785, "mean_token_accuracy": 0.745844928920269, "num_tokens": 21843807.0, "step": 11060 }, { "entropy": 1.048705903813243, "epoch": 0.31708749266001174, "grad_norm": 6.1875, "learning_rate": 4.7405559016562774e-05, "loss": 1.0317532539367675, "mean_token_accuracy": 0.7623295079916715, "num_tokens": 21863669.0, "step": 11070 }, { "entropy": 1.1278911229223012, "epoch": 0.3173739312261003, "grad_norm": 9.3125, "learning_rate": 4.740049439860187e-05, "loss": 1.135157871246338, "mean_token_accuracy": 0.7335341315716505, "num_tokens": 21884077.0, "step": 11080 }, { "entropy": 1.0938856963068246, "epoch": 0.3176603697921888, "grad_norm": 8.0, "learning_rate": 4.739542511321411e-05, "loss": 1.146687889099121, "mean_token_accuracy": 0.7279066048562527, "num_tokens": 21903088.0, "step": 11090 }, { "entropy": 1.0932465061545371, "epoch": 0.3179468083582774, "grad_norm": 8.5625, "learning_rate": 4.7390351161455734e-05, "loss": 1.1544628143310547, "mean_token_accuracy": 0.7280469022691249, "num_tokens": 21921842.0, "step": 11100 }, { "entropy": 1.1031063478440046, "epoch": 0.3182332469243659, "grad_norm": 7.125, "learning_rate": 4.738527254438396e-05, "loss": 1.1028409004211426, "mean_token_accuracy": 0.7358500190079212, "num_tokens": 21941431.0, "step": 11110 }, { "entropy": 1.286591763421893, "epoch": 0.31851968549045445, "grad_norm": 7.8125, "learning_rate": 4.7380189263056986e-05, "loss": 1.3475188255310058, "mean_token_accuracy": 0.6986013013869524, "num_tokens": 21962291.0, "step": 11120 }, { "entropy": 1.13895827755332, "epoch": 0.31880612405654296, "grad_norm": 7.6875, "learning_rate": 4.737510131853398e-05, "loss": 1.1346517562866212, "mean_token_accuracy": 0.7307674538344144, "num_tokens": 21982771.0, "step": 11130 }, { "entropy": 1.1660083957016467, "epoch": 0.3190925626226315, "grad_norm": 8.9375, "learning_rate": 4.737000871187507e-05, "loss": 1.2231541633605958, "mean_token_accuracy": 0.7201999597251415, "num_tokens": 22001315.0, "step": 11140 }, { "entropy": 1.1360034223645925, "epoch": 0.31937900118872004, "grad_norm": 6.9375, "learning_rate": 4.7364911444141375e-05, "loss": 1.1206212997436524, "mean_token_accuracy": 0.7419365961104631, "num_tokens": 22021319.0, "step": 11150 }, { "entropy": 1.2473677471280098, "epoch": 0.3196654397548086, "grad_norm": 7.21875, "learning_rate": 4.735980951639497e-05, "loss": 1.3122434616088867, "mean_token_accuracy": 0.7226801976561547, "num_tokens": 22040644.0, "step": 11160 }, { "entropy": 1.133636212348938, "epoch": 0.3199518783208971, "grad_norm": 6.78125, "learning_rate": 4.735470292969892e-05, "loss": 1.1689264297485351, "mean_token_accuracy": 0.7301033060997725, "num_tokens": 22060516.0, "step": 11170 }, { "entropy": 1.1562007825821639, "epoch": 0.3202383168869857, "grad_norm": 10.625, "learning_rate": 4.7349591685117226e-05, "loss": 1.1458330154418945, "mean_token_accuracy": 0.742704413831234, "num_tokens": 22079717.0, "step": 11180 }, { "entropy": 1.1761312440037728, "epoch": 0.3205247554530742, "grad_norm": 6.75, "learning_rate": 4.7344475783714895e-05, "loss": 1.2600318908691406, "mean_token_accuracy": 0.7188513174653053, "num_tokens": 22100974.0, "step": 11190 }, { "entropy": 1.2415122747421266, "epoch": 0.32081119401916275, "grad_norm": 11.0, "learning_rate": 4.733935522655789e-05, "loss": 1.257845401763916, "mean_token_accuracy": 0.7230556247755885, "num_tokens": 22119661.0, "step": 11200 }, { "entropy": 1.1471884217113257, "epoch": 0.32109763258525126, "grad_norm": 6.1875, "learning_rate": 4.733423001471313e-05, "loss": 1.147789192199707, "mean_token_accuracy": 0.7372707635164261, "num_tokens": 22138558.0, "step": 11210 }, { "entropy": 1.2086162056773901, "epoch": 0.3213840711513398, "grad_norm": 7.96875, "learning_rate": 4.7329100149248534e-05, "loss": 1.2477478981018066, "mean_token_accuracy": 0.7153390884399414, "num_tokens": 22158525.0, "step": 11220 }, { "entropy": 1.2628332007676364, "epoch": 0.32167050971742833, "grad_norm": 10.9375, "learning_rate": 4.732396563123297e-05, "loss": 1.2975424766540526, "mean_token_accuracy": 0.7086935788393021, "num_tokens": 22178480.0, "step": 11230 }, { "entropy": 1.2490848362445832, "epoch": 0.3219569482835169, "grad_norm": 6.46875, "learning_rate": 4.731882646173627e-05, "loss": 1.3228703498840333, "mean_token_accuracy": 0.7056458298116922, "num_tokens": 22199545.0, "step": 11240 }, { "entropy": 1.228704982623458, "epoch": 0.3222433868496054, "grad_norm": 8.0, "learning_rate": 4.731368264182926e-05, "loss": 1.1814695358276368, "mean_token_accuracy": 0.7292388524860144, "num_tokens": 22218935.0, "step": 11250 }, { "entropy": 1.1486282328143715, "epoch": 0.32252982541569397, "grad_norm": 8.25, "learning_rate": 4.7308534172583704e-05, "loss": 1.2046530723571778, "mean_token_accuracy": 0.7276582639664412, "num_tokens": 22239019.0, "step": 11260 }, { "entropy": 1.1681117948144675, "epoch": 0.3228162639817825, "grad_norm": 9.1875, "learning_rate": 4.7303381055072374e-05, "loss": 1.189686107635498, "mean_token_accuracy": 0.7220390990376473, "num_tokens": 22257389.0, "step": 11270 }, { "entropy": 1.1321909628808497, "epoch": 0.32310270254787105, "grad_norm": 8.75, "learning_rate": 4.729822329036896e-05, "loss": 1.179995346069336, "mean_token_accuracy": 0.7421342566609382, "num_tokens": 22277656.0, "step": 11280 }, { "entropy": 1.1787487041205167, "epoch": 0.3233891411139596, "grad_norm": 6.5625, "learning_rate": 4.729306087954817e-05, "loss": 1.192238998413086, "mean_token_accuracy": 0.7372886165976524, "num_tokens": 22296737.0, "step": 11290 }, { "entropy": 1.200702952221036, "epoch": 0.3236755796800481, "grad_norm": 9.25, "learning_rate": 4.728789382368564e-05, "loss": 1.206761074066162, "mean_token_accuracy": 0.7243234682828188, "num_tokens": 22315072.0, "step": 11300 }, { "entropy": 1.150430616736412, "epoch": 0.3239620182461367, "grad_norm": 6.4375, "learning_rate": 4.7282722123858e-05, "loss": 1.1563529968261719, "mean_token_accuracy": 0.7395915940403939, "num_tokens": 22335739.0, "step": 11310 }, { "entropy": 1.1855383176356553, "epoch": 0.3242484568122252, "grad_norm": 6.78125, "learning_rate": 4.727754578114285e-05, "loss": 1.2027335166931152, "mean_token_accuracy": 0.7233661249279976, "num_tokens": 22355845.0, "step": 11320 }, { "entropy": 1.1097164317965507, "epoch": 0.32453489537831376, "grad_norm": 6.125, "learning_rate": 4.727236479661873e-05, "loss": 1.1780168533325195, "mean_token_accuracy": 0.7526135090738535, "num_tokens": 22374465.0, "step": 11330 }, { "entropy": 1.247841464728117, "epoch": 0.32482133394440227, "grad_norm": 7.03125, "learning_rate": 4.726717917136517e-05, "loss": 1.2450525283813476, "mean_token_accuracy": 0.7134382147341967, "num_tokens": 22394949.0, "step": 11340 }, { "entropy": 1.2632878109812737, "epoch": 0.32510777251049083, "grad_norm": 7.71875, "learning_rate": 4.726198890646266e-05, "loss": 1.2831339836120605, "mean_token_accuracy": 0.7021247051656246, "num_tokens": 22415600.0, "step": 11350 }, { "entropy": 1.2132082648575306, "epoch": 0.32539421107657934, "grad_norm": 8.125, "learning_rate": 4.725679400299266e-05, "loss": 1.2478737831115723, "mean_token_accuracy": 0.7308540228754282, "num_tokens": 22435548.0, "step": 11360 }, { "entropy": 1.264779619500041, "epoch": 0.3256806496426679, "grad_norm": 11.5625, "learning_rate": 4.7251594462037584e-05, "loss": 1.3077947616577148, "mean_token_accuracy": 0.7187631480395794, "num_tokens": 22456907.0, "step": 11370 }, { "entropy": 1.156732125580311, "epoch": 0.3259670882087564, "grad_norm": 14.125, "learning_rate": 4.724639028468083e-05, "loss": 1.1519679069519042, "mean_token_accuracy": 0.7447134781628847, "num_tokens": 22476256.0, "step": 11380 }, { "entropy": 1.214553551003337, "epoch": 0.326253526774845, "grad_norm": 9.8125, "learning_rate": 4.724118147200677e-05, "loss": 1.241359806060791, "mean_token_accuracy": 0.7144936062395573, "num_tokens": 22496723.0, "step": 11390 }, { "entropy": 1.1805000428110362, "epoch": 0.3265399653409335, "grad_norm": 8.25, "learning_rate": 4.7235968025100695e-05, "loss": 1.1674490928649903, "mean_token_accuracy": 0.7388947810977697, "num_tokens": 22516967.0, "step": 11400 }, { "entropy": 1.072376536205411, "epoch": 0.32682640390702206, "grad_norm": 7.5, "learning_rate": 4.723074994504891e-05, "loss": 1.1109947204589843, "mean_token_accuracy": 0.7554388120770454, "num_tokens": 22535756.0, "step": 11410 }, { "entropy": 1.1708686981350183, "epoch": 0.32711284247311057, "grad_norm": 7.1875, "learning_rate": 4.722552723293867e-05, "loss": 1.2544927597045898, "mean_token_accuracy": 0.7224156752228736, "num_tokens": 22555473.0, "step": 11420 }, { "entropy": 1.2066254845820368, "epoch": 0.32739928103919913, "grad_norm": 6.34375, "learning_rate": 4.722029988985819e-05, "loss": 1.2252647399902343, "mean_token_accuracy": 0.7247946180403233, "num_tokens": 22576908.0, "step": 11430 }, { "entropy": 1.293650460243225, "epoch": 0.32768571960528764, "grad_norm": 8.3125, "learning_rate": 4.721506791689665e-05, "loss": 1.33160343170166, "mean_token_accuracy": 0.705178790539503, "num_tokens": 22597456.0, "step": 11440 }, { "entropy": 1.3517684258520604, "epoch": 0.3279721581713762, "grad_norm": 8.1875, "learning_rate": 4.7209831315144207e-05, "loss": 1.400987434387207, "mean_token_accuracy": 0.7010006219148636, "num_tokens": 22617341.0, "step": 11450 }, { "entropy": 1.2323766369372606, "epoch": 0.3282585967374647, "grad_norm": 7.46875, "learning_rate": 4.7204590085691956e-05, "loss": 1.263054656982422, "mean_token_accuracy": 0.7114313792437315, "num_tokens": 22637087.0, "step": 11460 }, { "entropy": 1.1799864664673805, "epoch": 0.3285450353035533, "grad_norm": 7.5, "learning_rate": 4.7199344229631995e-05, "loss": 1.145082378387451, "mean_token_accuracy": 0.7348103608936072, "num_tokens": 22657351.0, "step": 11470 }, { "entropy": 1.1265316696837544, "epoch": 0.3288314738696418, "grad_norm": 5.34375, "learning_rate": 4.719409374805735e-05, "loss": 1.1641122817993164, "mean_token_accuracy": 0.7305260673165321, "num_tokens": 22677412.0, "step": 11480 }, { "entropy": 1.124467265419662, "epoch": 0.32911791243573035, "grad_norm": 6.0625, "learning_rate": 4.718883864206203e-05, "loss": 1.159708595275879, "mean_token_accuracy": 0.7350906219333411, "num_tokens": 22697220.0, "step": 11490 }, { "entropy": 1.0693022284656764, "epoch": 0.32940435100181886, "grad_norm": 7.75, "learning_rate": 4.7183578912741e-05, "loss": 1.1036873817443849, "mean_token_accuracy": 0.7535626616328954, "num_tokens": 22717261.0, "step": 11500 }, { "entropy": 1.192902198061347, "epoch": 0.3296907895679074, "grad_norm": 10.375, "learning_rate": 4.7178314561190194e-05, "loss": 1.2284892082214356, "mean_token_accuracy": 0.7234285466372967, "num_tokens": 22735967.0, "step": 11510 }, { "entropy": 1.1275312550365926, "epoch": 0.32997722813399594, "grad_norm": 7.78125, "learning_rate": 4.7173045588506505e-05, "loss": 1.129185676574707, "mean_token_accuracy": 0.7411923322826623, "num_tokens": 22755874.0, "step": 11520 }, { "entropy": 1.1632478546351195, "epoch": 0.3302636667000845, "grad_norm": 6.0625, "learning_rate": 4.7167771995787796e-05, "loss": 1.1407917022705079, "mean_token_accuracy": 0.7309483349323272, "num_tokens": 22775091.0, "step": 11530 }, { "entropy": 1.1731928531080484, "epoch": 0.330550105266173, "grad_norm": 6.625, "learning_rate": 4.716249378413288e-05, "loss": 1.1625186920166015, "mean_token_accuracy": 0.7388781841844321, "num_tokens": 22794778.0, "step": 11540 }, { "entropy": 1.2525504898279904, "epoch": 0.3308365438322616, "grad_norm": 8.375, "learning_rate": 4.715721095464154e-05, "loss": 1.323142147064209, "mean_token_accuracy": 0.7031543012708426, "num_tokens": 22814128.0, "step": 11550 }, { "entropy": 1.2086209027096628, "epoch": 0.33112298239835014, "grad_norm": 9.4375, "learning_rate": 4.715192350841452e-05, "loss": 1.3088679313659668, "mean_token_accuracy": 0.7132860606536269, "num_tokens": 22834576.0, "step": 11560 }, { "entropy": 1.2420202609151603, "epoch": 0.33140942096443865, "grad_norm": 7.34375, "learning_rate": 4.714663144655353e-05, "loss": 1.3523476600646973, "mean_token_accuracy": 0.7066051442176103, "num_tokens": 22854788.0, "step": 11570 }, { "entropy": 1.2554360300302505, "epoch": 0.3316958595305272, "grad_norm": 9.0, "learning_rate": 4.714133477016124e-05, "loss": 1.2440761566162108, "mean_token_accuracy": 0.7174391876906157, "num_tokens": 22872750.0, "step": 11580 }, { "entropy": 1.234518339857459, "epoch": 0.3319822980966157, "grad_norm": 7.375, "learning_rate": 4.7136033480341265e-05, "loss": 1.1752326965332032, "mean_token_accuracy": 0.7297517832368612, "num_tokens": 22893007.0, "step": 11590 }, { "entropy": 1.2630619576200843, "epoch": 0.3322687366627043, "grad_norm": 8.9375, "learning_rate": 4.713072757819822e-05, "loss": 1.2878996849060058, "mean_token_accuracy": 0.7143452558666468, "num_tokens": 22912446.0, "step": 11600 }, { "entropy": 1.1564901519566775, "epoch": 0.3325551752287928, "grad_norm": 7.59375, "learning_rate": 4.712541706483764e-05, "loss": 1.1643918037414551, "mean_token_accuracy": 0.7464081030339003, "num_tokens": 22933465.0, "step": 11610 }, { "entropy": 1.0927067503333092, "epoch": 0.33284161379488136, "grad_norm": 7.84375, "learning_rate": 4.7120101941366043e-05, "loss": 1.083414649963379, "mean_token_accuracy": 0.7488886006176472, "num_tokens": 22952832.0, "step": 11620 }, { "entropy": 1.214715925976634, "epoch": 0.3331280523609699, "grad_norm": 8.4375, "learning_rate": 4.71147822088909e-05, "loss": 1.3036578178405762, "mean_token_accuracy": 0.7219994474202395, "num_tokens": 22973286.0, "step": 11630 }, { "entropy": 1.0849368203431369, "epoch": 0.33341449092705844, "grad_norm": 6.90625, "learning_rate": 4.710945786852064e-05, "loss": 1.062319564819336, "mean_token_accuracy": 0.7487390957772732, "num_tokens": 22992508.0, "step": 11640 }, { "entropy": 1.065082783997059, "epoch": 0.33370092949314695, "grad_norm": 7.625, "learning_rate": 4.710412892136467e-05, "loss": 1.1180828094482422, "mean_token_accuracy": 0.7427695158869028, "num_tokens": 23011084.0, "step": 11650 }, { "entropy": 1.1031024660915136, "epoch": 0.3339873680592355, "grad_norm": 9.1875, "learning_rate": 4.709879536853333e-05, "loss": 1.108950710296631, "mean_token_accuracy": 0.7525781478732825, "num_tokens": 23032469.0, "step": 11660 }, { "entropy": 1.1460798531770706, "epoch": 0.334273806625324, "grad_norm": 8.875, "learning_rate": 4.709345721113794e-05, "loss": 1.1499256134033202, "mean_token_accuracy": 0.7332233686000109, "num_tokens": 23051665.0, "step": 11670 }, { "entropy": 1.1252974119037389, "epoch": 0.3345602451914126, "grad_norm": 6.6875, "learning_rate": 4.708811445029078e-05, "loss": 1.1918341636657714, "mean_token_accuracy": 0.7303916115313769, "num_tokens": 23069938.0, "step": 11680 }, { "entropy": 1.274068509787321, "epoch": 0.3348466837575011, "grad_norm": 11.4375, "learning_rate": 4.708276708710506e-05, "loss": 1.3522369384765625, "mean_token_accuracy": 0.7006101924926043, "num_tokens": 23088053.0, "step": 11690 }, { "entropy": 1.2095244040712714, "epoch": 0.33513312232358966, "grad_norm": 7.375, "learning_rate": 4.7077415122695e-05, "loss": 1.2322667121887207, "mean_token_accuracy": 0.7209963157773018, "num_tokens": 23106406.0, "step": 11700 }, { "entropy": 1.1527428291738033, "epoch": 0.33541956088967817, "grad_norm": 8.3125, "learning_rate": 4.707205855817572e-05, "loss": 1.129507064819336, "mean_token_accuracy": 0.7344038028270006, "num_tokens": 23125319.0, "step": 11710 }, { "entropy": 1.1516671530902385, "epoch": 0.33570599945576673, "grad_norm": 6.96875, "learning_rate": 4.706669739466335e-05, "loss": 1.2391933441162108, "mean_token_accuracy": 0.7254343092441559, "num_tokens": 23145410.0, "step": 11720 }, { "entropy": 1.261005749925971, "epoch": 0.33599243802185524, "grad_norm": 8.625, "learning_rate": 4.7061331633274955e-05, "loss": 1.3115338325500487, "mean_token_accuracy": 0.7017195284366607, "num_tokens": 23164450.0, "step": 11730 }, { "entropy": 1.1775232704356313, "epoch": 0.3362788765879438, "grad_norm": 6.90625, "learning_rate": 4.7055961275128544e-05, "loss": 1.1274161338806152, "mean_token_accuracy": 0.7441752128303051, "num_tokens": 23186475.0, "step": 11740 }, { "entropy": 1.1429383732378482, "epoch": 0.3365653151540323, "grad_norm": 7.03125, "learning_rate": 4.705058632134311e-05, "loss": 1.2184623718261718, "mean_token_accuracy": 0.7309894770383835, "num_tokens": 23207066.0, "step": 11750 }, { "entropy": 1.2083202466368674, "epoch": 0.3368517537201209, "grad_norm": 10.25, "learning_rate": 4.70452067730386e-05, "loss": 1.260502243041992, "mean_token_accuracy": 0.7165480781346559, "num_tokens": 23226649.0, "step": 11760 }, { "entropy": 1.2827447853982448, "epoch": 0.3371381922862094, "grad_norm": 7.96875, "learning_rate": 4.7039822631335895e-05, "loss": 1.301980209350586, "mean_token_accuracy": 0.7162534985691309, "num_tokens": 23245872.0, "step": 11770 }, { "entropy": 1.1434971237555147, "epoch": 0.33742463085229796, "grad_norm": 6.78125, "learning_rate": 4.7034433897356864e-05, "loss": 1.178339958190918, "mean_token_accuracy": 0.7308500051498413, "num_tokens": 23265253.0, "step": 11780 }, { "entropy": 1.2729852348566055, "epoch": 0.33771106941838647, "grad_norm": 7.53125, "learning_rate": 4.7029040572224305e-05, "loss": 1.2637948989868164, "mean_token_accuracy": 0.7183017022907734, "num_tokens": 23286647.0, "step": 11790 }, { "entropy": 1.1382151689380406, "epoch": 0.33799750798447503, "grad_norm": 7.65625, "learning_rate": 4.702364265706199e-05, "loss": 1.1338038444519043, "mean_token_accuracy": 0.7474264606833458, "num_tokens": 23305792.0, "step": 11800 }, { "entropy": 1.2622137024998665, "epoch": 0.33828394655056354, "grad_norm": 8.375, "learning_rate": 4.701824015299464e-05, "loss": 1.2841017723083497, "mean_token_accuracy": 0.722211503982544, "num_tokens": 23325916.0, "step": 11810 }, { "entropy": 1.2117103721946478, "epoch": 0.3385703851166521, "grad_norm": 7.5625, "learning_rate": 4.701283306114795e-05, "loss": 1.2188192367553712, "mean_token_accuracy": 0.7275662157684565, "num_tokens": 23345447.0, "step": 11820 }, { "entropy": 1.1250001799315215, "epoch": 0.33885682368274067, "grad_norm": 8.625, "learning_rate": 4.7007421382648534e-05, "loss": 1.144778347015381, "mean_token_accuracy": 0.7350890174508095, "num_tokens": 23365352.0, "step": 11830 }, { "entropy": 1.0864742234349252, "epoch": 0.3391432622488292, "grad_norm": 6.9375, "learning_rate": 4.7002005118624005e-05, "loss": 1.1144563674926757, "mean_token_accuracy": 0.7423195265233516, "num_tokens": 23385674.0, "step": 11840 }, { "entropy": 1.0908971633762121, "epoch": 0.33942970081491775, "grad_norm": 7.46875, "learning_rate": 4.699658427020289e-05, "loss": 1.0974401473999023, "mean_token_accuracy": 0.7543679516762495, "num_tokens": 23404581.0, "step": 11850 }, { "entropy": 1.1848457358777522, "epoch": 0.33971613938100625, "grad_norm": 7.9375, "learning_rate": 4.699115883851471e-05, "loss": 1.2022927284240723, "mean_token_accuracy": 0.7327800579369068, "num_tokens": 23424920.0, "step": 11860 }, { "entropy": 1.161220794916153, "epoch": 0.3400025779470948, "grad_norm": 9.375, "learning_rate": 4.6985728824689915e-05, "loss": 1.2107144355773927, "mean_token_accuracy": 0.7207223646342754, "num_tokens": 23444101.0, "step": 11870 }, { "entropy": 1.1067387491464615, "epoch": 0.34028901651318333, "grad_norm": 5.96875, "learning_rate": 4.698029422985991e-05, "loss": 1.1030991554260254, "mean_token_accuracy": 0.7373673833906651, "num_tokens": 23463963.0, "step": 11880 }, { "entropy": 1.1548112120479346, "epoch": 0.3405754550792719, "grad_norm": 7.96875, "learning_rate": 4.697485505515707e-05, "loss": 1.2031975746154786, "mean_token_accuracy": 0.7296447124332189, "num_tokens": 23483210.0, "step": 11890 }, { "entropy": 1.12001075707376, "epoch": 0.3408618936453604, "grad_norm": 10.125, "learning_rate": 4.696941130171473e-05, "loss": 1.1540513992309571, "mean_token_accuracy": 0.7319434903562069, "num_tokens": 23502413.0, "step": 11900 }, { "entropy": 1.1788815069943666, "epoch": 0.34114833221144897, "grad_norm": 7.625, "learning_rate": 4.696396297066713e-05, "loss": 1.2136086463928222, "mean_token_accuracy": 0.7291082628071308, "num_tokens": 23522531.0, "step": 11910 }, { "entropy": 1.260196452215314, "epoch": 0.3414347707775375, "grad_norm": 7.375, "learning_rate": 4.695851006314953e-05, "loss": 1.2704562187194823, "mean_token_accuracy": 0.71053973659873, "num_tokens": 23540992.0, "step": 11920 }, { "entropy": 1.2255538059398532, "epoch": 0.34172120934362604, "grad_norm": 9.0, "learning_rate": 4.6953052580298096e-05, "loss": 1.2748222351074219, "mean_token_accuracy": 0.7164468251168727, "num_tokens": 23561046.0, "step": 11930 }, { "entropy": 1.1561801934614777, "epoch": 0.34200764790971455, "grad_norm": 8.8125, "learning_rate": 4.6947590523249965e-05, "loss": 1.1780438423156738, "mean_token_accuracy": 0.7307541415095329, "num_tokens": 23581109.0, "step": 11940 }, { "entropy": 1.2238935600966214, "epoch": 0.3422940864758031, "grad_norm": 9.875, "learning_rate": 4.694212389314323e-05, "loss": 1.2320446968078613, "mean_token_accuracy": 0.7204213123768568, "num_tokens": 23602952.0, "step": 11950 }, { "entropy": 1.1128317618742585, "epoch": 0.3425805250418916, "grad_norm": 6.375, "learning_rate": 4.693665269111693e-05, "loss": 1.1011093139648438, "mean_token_accuracy": 0.7491160191595554, "num_tokens": 23622836.0, "step": 11960 }, { "entropy": 1.1253233417868613, "epoch": 0.3428669636079802, "grad_norm": 9.5625, "learning_rate": 4.6931176918311064e-05, "loss": 1.1716981887817384, "mean_token_accuracy": 0.7309842467308044, "num_tokens": 23642229.0, "step": 11970 }, { "entropy": 1.2138034660369157, "epoch": 0.3431534021740687, "grad_norm": 7.59375, "learning_rate": 4.692569657586657e-05, "loss": 1.2460014343261718, "mean_token_accuracy": 0.7129536826163531, "num_tokens": 23660734.0, "step": 11980 }, { "entropy": 1.1330853898078204, "epoch": 0.34343984074015727, "grad_norm": 7.5, "learning_rate": 4.6920211664925365e-05, "loss": 1.1663831710815429, "mean_token_accuracy": 0.7308716084808111, "num_tokens": 23681258.0, "step": 11990 }, { "epoch": 0.3437262793062458, "eval_entropy": 1.2111419036388398, "eval_loss": 1.2187772989273071, "eval_mean_token_accuracy": 0.7236575634479523, "eval_num_tokens": 23701035.0, "eval_runtime": 43.1323, "eval_samples_per_second": 46.369, "eval_steps_per_second": 5.796, "step": 12000 }, { "entropy": 1.1612286842428148, "epoch": 0.34401271787233434, "grad_norm": 8.5, "learning_rate": 4.690922814212512e-05, "loss": 1.163602352142334, "mean_token_accuracy": 0.7336456025019288, "num_tokens": 23720511.0, "step": 12010 }, { "entropy": 1.1802667088806629, "epoch": 0.34429915643842285, "grad_norm": 7.75, "learning_rate": 4.6903729532554654e-05, "loss": 1.1653948783874513, "mean_token_accuracy": 0.7312414187937974, "num_tokens": 23739738.0, "step": 12020 }, { "entropy": 1.1538407292217017, "epoch": 0.3445855950045114, "grad_norm": 7.53125, "learning_rate": 4.6898226359064567e-05, "loss": 1.2091781616210937, "mean_token_accuracy": 0.7253286480903626, "num_tokens": 23759424.0, "step": 12030 }, { "entropy": 1.0579552758485078, "epoch": 0.3448720335705999, "grad_norm": 8.9375, "learning_rate": 4.689271862280152e-05, "loss": 1.0912225723266602, "mean_token_accuracy": 0.7456759825348854, "num_tokens": 23780082.0, "step": 12040 }, { "entropy": 1.0745447628200053, "epoch": 0.3451584721366885, "grad_norm": 6.28125, "learning_rate": 4.6887206324913135e-05, "loss": 1.0282931327819824, "mean_token_accuracy": 0.7541920978575944, "num_tokens": 23799880.0, "step": 12050 }, { "entropy": 1.1610807899385691, "epoch": 0.345444910702777, "grad_norm": 7.59375, "learning_rate": 4.6881689466547955e-05, "loss": 1.2484560012817383, "mean_token_accuracy": 0.714300836622715, "num_tokens": 23818351.0, "step": 12060 }, { "entropy": 1.2199388794600963, "epoch": 0.34573134926886556, "grad_norm": 7.59375, "learning_rate": 4.687616804885549e-05, "loss": 1.2164305686950683, "mean_token_accuracy": 0.7274310253560543, "num_tokens": 23838253.0, "step": 12070 }, { "entropy": 1.2003101717680693, "epoch": 0.34601778783495407, "grad_norm": 8.1875, "learning_rate": 4.687064207298619e-05, "loss": 1.2673505783081054, "mean_token_accuracy": 0.7238612420856952, "num_tokens": 23857884.0, "step": 12080 }, { "entropy": 1.0899714313447475, "epoch": 0.34630422640104264, "grad_norm": 6.84375, "learning_rate": 4.686511154009148e-05, "loss": 1.0469305038452148, "mean_token_accuracy": 0.7557990480214357, "num_tokens": 23877746.0, "step": 12090 }, { "entropy": 1.1794720616191625, "epoch": 0.3465906649671312, "grad_norm": 6.75, "learning_rate": 4.685957645132371e-05, "loss": 1.2009960174560548, "mean_token_accuracy": 0.7408746611326933, "num_tokens": 23897390.0, "step": 12100 }, { "entropy": 1.0683152735233308, "epoch": 0.3468771035332197, "grad_norm": 10.5625, "learning_rate": 4.6854036807836166e-05, "loss": 1.0982565879821777, "mean_token_accuracy": 0.7555297255516052, "num_tokens": 23916665.0, "step": 12110 }, { "entropy": 1.1548657290637494, "epoch": 0.3471635420993083, "grad_norm": 7.59375, "learning_rate": 4.6848492610783134e-05, "loss": 1.2286520957946778, "mean_token_accuracy": 0.7238879334181547, "num_tokens": 23936141.0, "step": 12120 }, { "entropy": 1.194304696470499, "epoch": 0.3474499806653968, "grad_norm": 8.1875, "learning_rate": 4.68429438613198e-05, "loss": 1.2142595291137694, "mean_token_accuracy": 0.7304021198302507, "num_tokens": 23956756.0, "step": 12130 }, { "entropy": 1.1930865988135337, "epoch": 0.34773641923148535, "grad_norm": 6.71875, "learning_rate": 4.683739056060231e-05, "loss": 1.1942502975463867, "mean_token_accuracy": 0.7369113426655531, "num_tokens": 23976231.0, "step": 12140 }, { "entropy": 1.0730652177706361, "epoch": 0.34802285779757386, "grad_norm": 8.0625, "learning_rate": 4.683183270978778e-05, "loss": 1.0902474403381348, "mean_token_accuracy": 0.7452852111309767, "num_tokens": 23996499.0, "step": 12150 }, { "entropy": 1.2924365883693099, "epoch": 0.3483092963636624, "grad_norm": 8.5625, "learning_rate": 4.6826270310034246e-05, "loss": 1.3115803718566894, "mean_token_accuracy": 0.7057915881276131, "num_tokens": 24017347.0, "step": 12160 }, { "entropy": 1.0572031695395707, "epoch": 0.34859573492975093, "grad_norm": 8.625, "learning_rate": 4.6820703362500725e-05, "loss": 1.0731576919555663, "mean_token_accuracy": 0.7637318138033151, "num_tokens": 24036541.0, "step": 12170 }, { "entropy": 1.2365605905652046, "epoch": 0.3488821734958395, "grad_norm": 6.53125, "learning_rate": 4.681513186834714e-05, "loss": 1.2278698921203612, "mean_token_accuracy": 0.7226788450032473, "num_tokens": 24056782.0, "step": 12180 }, { "entropy": 1.1317774463444947, "epoch": 0.349168612061928, "grad_norm": 8.0625, "learning_rate": 4.680955582873438e-05, "loss": 1.1577448844909668, "mean_token_accuracy": 0.7462615061551332, "num_tokens": 24077354.0, "step": 12190 }, { "entropy": 1.0215800609439611, "epoch": 0.3494550506280166, "grad_norm": 7.3125, "learning_rate": 4.68039752448243e-05, "loss": 1.0143744468688964, "mean_token_accuracy": 0.7628859091550112, "num_tokens": 24098397.0, "step": 12200 }, { "entropy": 1.211158404313028, "epoch": 0.3497414891941051, "grad_norm": 8.5, "learning_rate": 4.679839011777968e-05, "loss": 1.3002041816711425, "mean_token_accuracy": 0.7087782345712185, "num_tokens": 24118472.0, "step": 12210 }, { "entropy": 1.0564627762883902, "epoch": 0.35002792776019365, "grad_norm": 6.875, "learning_rate": 4.679280044876425e-05, "loss": 1.0647855758666993, "mean_token_accuracy": 0.7530502326786518, "num_tokens": 24138183.0, "step": 12220 }, { "entropy": 1.1522968597710133, "epoch": 0.35031436632628216, "grad_norm": 6.75, "learning_rate": 4.678720623894269e-05, "loss": 1.2218456268310547, "mean_token_accuracy": 0.7277620542794466, "num_tokens": 24157648.0, "step": 12230 }, { "entropy": 1.1053988685831428, "epoch": 0.3506008048923707, "grad_norm": 6.71875, "learning_rate": 4.678160748948062e-05, "loss": 1.1578386306762696, "mean_token_accuracy": 0.7310198895633221, "num_tokens": 24178043.0, "step": 12240 }, { "entropy": 1.167086797580123, "epoch": 0.35088724345845923, "grad_norm": 7.53125, "learning_rate": 4.677600420154461e-05, "loss": 1.1752772331237793, "mean_token_accuracy": 0.7255244225263595, "num_tokens": 24197375.0, "step": 12250 }, { "entropy": 1.2581705693155527, "epoch": 0.3511736820245478, "grad_norm": 7.59375, "learning_rate": 4.6770396376302184e-05, "loss": 1.2895773887634276, "mean_token_accuracy": 0.7143769770860672, "num_tokens": 24217719.0, "step": 12260 }, { "entropy": 1.1056284755468369, "epoch": 0.3514601205906363, "grad_norm": 8.375, "learning_rate": 4.6764784014921806e-05, "loss": 1.1673913955688477, "mean_token_accuracy": 0.7443995978683233, "num_tokens": 24237291.0, "step": 12270 }, { "entropy": 1.1574806613847612, "epoch": 0.35174655915672487, "grad_norm": 7.40625, "learning_rate": 4.6759167118572863e-05, "loss": 1.1845383644104004, "mean_token_accuracy": 0.7294176701456309, "num_tokens": 24257995.0, "step": 12280 }, { "entropy": 1.0985305689275264, "epoch": 0.3520329977228134, "grad_norm": 9.0, "learning_rate": 4.6753545688425725e-05, "loss": 1.138932704925537, "mean_token_accuracy": 0.7533436857163907, "num_tokens": 24276915.0, "step": 12290 }, { "entropy": 1.1947484020143748, "epoch": 0.35231943628890194, "grad_norm": 7.375, "learning_rate": 4.674791972565168e-05, "loss": 1.2274359703063964, "mean_token_accuracy": 0.7243363671004772, "num_tokens": 24297453.0, "step": 12300 }, { "entropy": 1.1885976530611515, "epoch": 0.35260587485499045, "grad_norm": 9.3125, "learning_rate": 4.674228923142297e-05, "loss": 1.2606486320495605, "mean_token_accuracy": 0.7255305778235197, "num_tokens": 24316690.0, "step": 12310 }, { "entropy": 1.3291325971484185, "epoch": 0.352892313421079, "grad_norm": 11.5, "learning_rate": 4.6736654206912785e-05, "loss": 1.3377924919128419, "mean_token_accuracy": 0.710524632781744, "num_tokens": 24336587.0, "step": 12320 }, { "entropy": 1.1792631223797798, "epoch": 0.3531787519871675, "grad_norm": 7.59375, "learning_rate": 4.6731014653295244e-05, "loss": 1.208043384552002, "mean_token_accuracy": 0.7287311658263207, "num_tokens": 24357904.0, "step": 12330 }, { "entropy": 1.1591805048286914, "epoch": 0.3534651905532561, "grad_norm": 6.34375, "learning_rate": 4.672537057174543e-05, "loss": 1.1509671211242676, "mean_token_accuracy": 0.7389872211962938, "num_tokens": 24378113.0, "step": 12340 }, { "entropy": 1.2786912132054566, "epoch": 0.3537516291193446, "grad_norm": 7.78125, "learning_rate": 4.6719721963439354e-05, "loss": 1.3041322708129883, "mean_token_accuracy": 0.7151679765433073, "num_tokens": 24398619.0, "step": 12350 }, { "entropy": 1.1455071780830621, "epoch": 0.35403806768543317, "grad_norm": 9.25, "learning_rate": 4.671406882955397e-05, "loss": 1.1349172592163086, "mean_token_accuracy": 0.7472321063280105, "num_tokens": 24417762.0, "step": 12360 }, { "entropy": 1.3051155537366868, "epoch": 0.35432450625152173, "grad_norm": 8.375, "learning_rate": 4.670841117126719e-05, "loss": 1.3622515678405762, "mean_token_accuracy": 0.6951520700007677, "num_tokens": 24438024.0, "step": 12370 }, { "entropy": 1.0951440989971162, "epoch": 0.35461094481761024, "grad_norm": 7.4375, "learning_rate": 4.670274898975785e-05, "loss": 1.0845849990844727, "mean_token_accuracy": 0.7515030659735202, "num_tokens": 24456723.0, "step": 12380 }, { "entropy": 1.083009223267436, "epoch": 0.3548973833836988, "grad_norm": 7.28125, "learning_rate": 4.6697082286205746e-05, "loss": 1.0777643203735352, "mean_token_accuracy": 0.7477686557918787, "num_tokens": 24475421.0, "step": 12390 }, { "entropy": 1.1794935889542102, "epoch": 0.3551838219497873, "grad_norm": 8.125, "learning_rate": 4.6691411061791604e-05, "loss": 1.2202360153198242, "mean_token_accuracy": 0.7202108513563872, "num_tokens": 24495907.0, "step": 12400 }, { "entropy": 1.154681123420596, "epoch": 0.3554702605158759, "grad_norm": 7.34375, "learning_rate": 4.668573531769709e-05, "loss": 1.1510541915893555, "mean_token_accuracy": 0.7336853880435228, "num_tokens": 24516539.0, "step": 12410 }, { "entropy": 1.1614432524889708, "epoch": 0.3557566990819644, "grad_norm": 6.84375, "learning_rate": 4.668005505510482e-05, "loss": 1.1538786888122559, "mean_token_accuracy": 0.7410368528217077, "num_tokens": 24536548.0, "step": 12420 }, { "entropy": 1.1056133069097995, "epoch": 0.35604313764805295, "grad_norm": 7.53125, "learning_rate": 4.667437027519835e-05, "loss": 1.100418472290039, "mean_token_accuracy": 0.7426928225904703, "num_tokens": 24556188.0, "step": 12430 }, { "entropy": 1.1577647674828768, "epoch": 0.35632957621414146, "grad_norm": 8.4375, "learning_rate": 4.6668680979162174e-05, "loss": 1.2466042518615723, "mean_token_accuracy": 0.7233197886496783, "num_tokens": 24574767.0, "step": 12440 }, { "entropy": 1.200463857129216, "epoch": 0.35661601478023003, "grad_norm": 6.28125, "learning_rate": 4.6662987168181734e-05, "loss": 1.217890167236328, "mean_token_accuracy": 0.7174221593886614, "num_tokens": 24593741.0, "step": 12450 }, { "entropy": 1.1855518642812968, "epoch": 0.35690245334631854, "grad_norm": 7.4375, "learning_rate": 4.66572888434434e-05, "loss": 1.1821393966674805, "mean_token_accuracy": 0.7281763609498739, "num_tokens": 24614762.0, "step": 12460 }, { "entropy": 1.1904833726584911, "epoch": 0.3571888919124071, "grad_norm": 7.8125, "learning_rate": 4.6651586006134505e-05, "loss": 1.1578195571899415, "mean_token_accuracy": 0.7455261457711458, "num_tokens": 24634841.0, "step": 12470 }, { "entropy": 1.1210447106510402, "epoch": 0.3574753304784956, "grad_norm": 7.96875, "learning_rate": 4.6645878657443284e-05, "loss": 1.1873265266418458, "mean_token_accuracy": 0.7319249577820301, "num_tokens": 24653218.0, "step": 12480 }, { "entropy": 1.1087748092599212, "epoch": 0.3577617690445842, "grad_norm": 7.5, "learning_rate": 4.664016679855896e-05, "loss": 1.1220198631286622, "mean_token_accuracy": 0.7515978630632162, "num_tokens": 24673515.0, "step": 12490 }, { "entropy": 1.1439260589890181, "epoch": 0.3580482076106727, "grad_norm": 8.625, "learning_rate": 4.663445043067166e-05, "loss": 1.1369548797607423, "mean_token_accuracy": 0.7413583099842072, "num_tokens": 24693054.0, "step": 12500 }, { "entropy": 1.142331263795495, "epoch": 0.35833464617676125, "grad_norm": 9.4375, "learning_rate": 4.662872955497245e-05, "loss": 1.2061081886291505, "mean_token_accuracy": 0.739474031701684, "num_tokens": 24713101.0, "step": 12510 }, { "entropy": 1.1761005107313394, "epoch": 0.35862108474284976, "grad_norm": 5.78125, "learning_rate": 4.662300417265337e-05, "loss": 1.1623221397399903, "mean_token_accuracy": 0.7403987973928452, "num_tokens": 24734197.0, "step": 12520 }, { "entropy": 1.164141470566392, "epoch": 0.3589075233089383, "grad_norm": 8.4375, "learning_rate": 4.661727428490736e-05, "loss": 1.1945881843566895, "mean_token_accuracy": 0.7339757930487394, "num_tokens": 24754402.0, "step": 12530 }, { "entropy": 1.2093694768846035, "epoch": 0.35919396187502683, "grad_norm": 7.25, "learning_rate": 4.6611539892928315e-05, "loss": 1.2294402122497559, "mean_token_accuracy": 0.7220250643789768, "num_tokens": 24774423.0, "step": 12540 }, { "entropy": 1.1841968726366758, "epoch": 0.3594804004411154, "grad_norm": 8.4375, "learning_rate": 4.660580099791108e-05, "loss": 1.1973770141601563, "mean_token_accuracy": 0.7244217835366726, "num_tokens": 24794520.0, "step": 12550 }, { "entropy": 1.0361510679125785, "epoch": 0.3597668390072039, "grad_norm": 7.0625, "learning_rate": 4.660005760105141e-05, "loss": 1.0199840545654297, "mean_token_accuracy": 0.767999405413866, "num_tokens": 24812627.0, "step": 12560 }, { "entropy": 1.199740276671946, "epoch": 0.3600532775732925, "grad_norm": 6.875, "learning_rate": 4.659430970354603e-05, "loss": 1.182297420501709, "mean_token_accuracy": 0.7283029284328222, "num_tokens": 24833291.0, "step": 12570 }, { "entropy": 1.1801016733050347, "epoch": 0.360339716139381, "grad_norm": 5.4375, "learning_rate": 4.6588557306592587e-05, "loss": 1.3230598449707032, "mean_token_accuracy": 0.7075336508452892, "num_tokens": 24854305.0, "step": 12580 }, { "entropy": 1.1881453284993768, "epoch": 0.36062615470546955, "grad_norm": 8.9375, "learning_rate": 4.658280041138964e-05, "loss": 1.2157601356506347, "mean_token_accuracy": 0.7086739990860224, "num_tokens": 24873142.0, "step": 12590 }, { "entropy": 1.1658820813521742, "epoch": 0.36091259327155806, "grad_norm": 9.6875, "learning_rate": 4.657703901913675e-05, "loss": 1.1919174194335938, "mean_token_accuracy": 0.7389684028923511, "num_tokens": 24894882.0, "step": 12600 }, { "entropy": 1.197008427977562, "epoch": 0.3611990318376466, "grad_norm": 5.84375, "learning_rate": 4.657127313103434e-05, "loss": 1.2174315452575684, "mean_token_accuracy": 0.72830794416368, "num_tokens": 24914791.0, "step": 12610 }, { "entropy": 1.1865931533277034, "epoch": 0.36148547040373513, "grad_norm": 7.75, "learning_rate": 4.656550274828383e-05, "loss": 1.1610807418823241, "mean_token_accuracy": 0.7274734944105148, "num_tokens": 24934601.0, "step": 12620 }, { "entropy": 1.145196046680212, "epoch": 0.3617719089698237, "grad_norm": 6.625, "learning_rate": 4.6559727872087546e-05, "loss": 1.2269505500793456, "mean_token_accuracy": 0.7322268161922694, "num_tokens": 24955211.0, "step": 12630 }, { "entropy": 1.249273194745183, "epoch": 0.36205834753591226, "grad_norm": 7.34375, "learning_rate": 4.655394850364876e-05, "loss": 1.2770082473754882, "mean_token_accuracy": 0.7197588823735714, "num_tokens": 24973947.0, "step": 12640 }, { "entropy": 1.1048865262418985, "epoch": 0.36234478610200077, "grad_norm": 6.59375, "learning_rate": 4.654816464417166e-05, "loss": 1.1112689971923828, "mean_token_accuracy": 0.7476239636540413, "num_tokens": 24993049.0, "step": 12650 }, { "entropy": 1.182585509121418, "epoch": 0.36263122466808934, "grad_norm": 9.0, "learning_rate": 4.654237629486141e-05, "loss": 1.2341876029968262, "mean_token_accuracy": 0.7128869269043208, "num_tokens": 25012210.0, "step": 12660 }, { "entropy": 1.1946954686194657, "epoch": 0.36291766323417785, "grad_norm": 9.1875, "learning_rate": 4.653658345692407e-05, "loss": 1.225621509552002, "mean_token_accuracy": 0.7311183448880911, "num_tokens": 25030998.0, "step": 12670 }, { "entropy": 1.2007832787930965, "epoch": 0.3632041018002664, "grad_norm": 10.5625, "learning_rate": 4.653078613156665e-05, "loss": 1.2481486320495605, "mean_token_accuracy": 0.713291997089982, "num_tokens": 25051569.0, "step": 12680 }, { "entropy": 1.1712095331400634, "epoch": 0.3634905403663549, "grad_norm": 8.5, "learning_rate": 4.65249843199971e-05, "loss": 1.203207302093506, "mean_token_accuracy": 0.7292301647365094, "num_tokens": 25070888.0, "step": 12690 }, { "entropy": 1.2710014339536428, "epoch": 0.3637769789324435, "grad_norm": 9.6875, "learning_rate": 4.6519178023424317e-05, "loss": 1.2887212753295898, "mean_token_accuracy": 0.7167570725083351, "num_tokens": 25090122.0, "step": 12700 }, { "entropy": 1.2152038557454943, "epoch": 0.364063417498532, "grad_norm": 7.59375, "learning_rate": 4.6513367243058094e-05, "loss": 1.1899870872497558, "mean_token_accuracy": 0.7301798451691865, "num_tokens": 25110748.0, "step": 12710 }, { "entropy": 1.1407973047345876, "epoch": 0.36434985606462056, "grad_norm": 8.0, "learning_rate": 4.650755198010919e-05, "loss": 1.1604823112487792, "mean_token_accuracy": 0.742802207544446, "num_tokens": 25131176.0, "step": 12720 }, { "entropy": 1.1766152661293745, "epoch": 0.36463629463070907, "grad_norm": 9.1875, "learning_rate": 4.650173223578928e-05, "loss": 1.195823860168457, "mean_token_accuracy": 0.7396425627171993, "num_tokens": 25149281.0, "step": 12730 }, { "entropy": 1.0965004667639733, "epoch": 0.36492273319679763, "grad_norm": 6.84375, "learning_rate": 4.6495908011311e-05, "loss": 1.1518229484558105, "mean_token_accuracy": 0.7351251032203436, "num_tokens": 25169373.0, "step": 12740 }, { "entropy": 1.1608255438506603, "epoch": 0.36520917176288614, "grad_norm": 8.5, "learning_rate": 4.6490079307887884e-05, "loss": 1.143186092376709, "mean_token_accuracy": 0.7366735283285379, "num_tokens": 25188956.0, "step": 12750 }, { "entropy": 1.1373560000211, "epoch": 0.3654956103289747, "grad_norm": 9.875, "learning_rate": 4.648424612673443e-05, "loss": 1.1254226684570312, "mean_token_accuracy": 0.7469326909631491, "num_tokens": 25208548.0, "step": 12760 }, { "entropy": 1.20901506729424, "epoch": 0.3657820488950632, "grad_norm": 8.5, "learning_rate": 4.647840846906604e-05, "loss": 1.2731991767883302, "mean_token_accuracy": 0.7283838141709567, "num_tokens": 25230110.0, "step": 12770 }, { "entropy": 1.0768377557396889, "epoch": 0.3660684874611518, "grad_norm": 10.0625, "learning_rate": 4.647256633609907e-05, "loss": 1.117074680328369, "mean_token_accuracy": 0.7471107337623835, "num_tokens": 25249868.0, "step": 12780 }, { "entropy": 1.2449981797486545, "epoch": 0.3663549260272403, "grad_norm": 8.625, "learning_rate": 4.6466719729050804e-05, "loss": 1.2835883140563964, "mean_token_accuracy": 0.7075161915272474, "num_tokens": 25270276.0, "step": 12790 }, { "entropy": 1.1636112209409475, "epoch": 0.36664136459332886, "grad_norm": 7.875, "learning_rate": 4.646086864913947e-05, "loss": 1.177051830291748, "mean_token_accuracy": 0.7265634182840586, "num_tokens": 25289737.0, "step": 12800 }, { "entropy": 1.226197324693203, "epoch": 0.36692780315941737, "grad_norm": 6.5, "learning_rate": 4.645501309758419e-05, "loss": 1.2565295219421386, "mean_token_accuracy": 0.7182535119354725, "num_tokens": 25307889.0, "step": 12810 }, { "entropy": 1.1554649438709022, "epoch": 0.36721424172550593, "grad_norm": 9.375, "learning_rate": 4.644915307560504e-05, "loss": 1.112023162841797, "mean_token_accuracy": 0.7399850897490978, "num_tokens": 25327381.0, "step": 12820 }, { "entropy": 1.178750059939921, "epoch": 0.36750068029159444, "grad_norm": 7.65625, "learning_rate": 4.6443288584423064e-05, "loss": 1.1486433029174805, "mean_token_accuracy": 0.7444168295711279, "num_tokens": 25347214.0, "step": 12830 }, { "entropy": 1.086121116578579, "epoch": 0.367787118857683, "grad_norm": 9.5625, "learning_rate": 4.643741962526018e-05, "loss": 1.100342082977295, "mean_token_accuracy": 0.7494371876120567, "num_tokens": 25367486.0, "step": 12840 }, { "entropy": 1.1032545395195483, "epoch": 0.3680735574237715, "grad_norm": 8.4375, "learning_rate": 4.643154619933926e-05, "loss": 1.1286057472229003, "mean_token_accuracy": 0.728075797110796, "num_tokens": 25388450.0, "step": 12850 }, { "entropy": 1.177094199322164, "epoch": 0.3683599959898601, "grad_norm": 7.15625, "learning_rate": 4.642566830788411e-05, "loss": 1.2549120903015136, "mean_token_accuracy": 0.7249290011823177, "num_tokens": 25409061.0, "step": 12860 }, { "entropy": 1.132564228028059, "epoch": 0.3686464345559486, "grad_norm": 9.4375, "learning_rate": 4.641978595211946e-05, "loss": 1.118637466430664, "mean_token_accuracy": 0.7513731565326452, "num_tokens": 25428750.0, "step": 12870 }, { "entropy": 1.1223754335194827, "epoch": 0.36893287312203715, "grad_norm": 7.6875, "learning_rate": 4.6413899133270975e-05, "loss": 1.0885736465454101, "mean_token_accuracy": 0.7486430887132883, "num_tokens": 25448136.0, "step": 12880 }, { "entropy": 1.0789169408380985, "epoch": 0.36921931168812566, "grad_norm": 7.0, "learning_rate": 4.640800785256525e-05, "loss": 1.1167041778564453, "mean_token_accuracy": 0.7479406505823135, "num_tokens": 25468131.0, "step": 12890 }, { "entropy": 1.137805850803852, "epoch": 0.3695057502542142, "grad_norm": 8.125, "learning_rate": 4.64021121112298e-05, "loss": 1.2548883438110352, "mean_token_accuracy": 0.7210646469146014, "num_tokens": 25487271.0, "step": 12900 }, { "entropy": 1.0110106192529202, "epoch": 0.3697921888203028, "grad_norm": 8.25, "learning_rate": 4.63962119104931e-05, "loss": 0.9812099456787109, "mean_token_accuracy": 0.7751163944602013, "num_tokens": 25506762.0, "step": 12910 }, { "entropy": 1.1466988310217858, "epoch": 0.3700786273863913, "grad_norm": 8.0625, "learning_rate": 4.639030725158451e-05, "loss": 1.1649755477905273, "mean_token_accuracy": 0.7391448896378279, "num_tokens": 25526581.0, "step": 12920 }, { "entropy": 1.2701556280255317, "epoch": 0.37036506595247987, "grad_norm": 8.5, "learning_rate": 4.6384398135734343e-05, "loss": 1.2245131492614747, "mean_token_accuracy": 0.723613515868783, "num_tokens": 25545665.0, "step": 12930 }, { "entropy": 1.1207250935956836, "epoch": 0.3706515045185684, "grad_norm": 7.71875, "learning_rate": 4.637848456417384e-05, "loss": 1.1522951126098633, "mean_token_accuracy": 0.7404493417590856, "num_tokens": 25565966.0, "step": 12940 }, { "entropy": 1.1384451944380998, "epoch": 0.37093794308465694, "grad_norm": 9.3125, "learning_rate": 4.6372566538135174e-05, "loss": 1.1789511680603026, "mean_token_accuracy": 0.7320579085499048, "num_tokens": 25586110.0, "step": 12950 }, { "entropy": 1.2000788673758507, "epoch": 0.37122438165074545, "grad_norm": 7.59375, "learning_rate": 4.6366644058851434e-05, "loss": 1.2353042602539062, "mean_token_accuracy": 0.7218313202261925, "num_tokens": 25605054.0, "step": 12960 }, { "entropy": 1.1470486987382174, "epoch": 0.371510820216834, "grad_norm": 8.4375, "learning_rate": 4.6360717127556655e-05, "loss": 1.1547849655151368, "mean_token_accuracy": 0.7341628767549991, "num_tokens": 25625184.0, "step": 12970 }, { "entropy": 1.1803495505824686, "epoch": 0.3717972587829225, "grad_norm": 7.0, "learning_rate": 4.635478574548577e-05, "loss": 1.2092257499694825, "mean_token_accuracy": 0.729374673962593, "num_tokens": 25647260.0, "step": 12980 }, { "entropy": 1.2424621149897574, "epoch": 0.3720836973490111, "grad_norm": 7.65625, "learning_rate": 4.634884991387467e-05, "loss": 1.3212327003479003, "mean_token_accuracy": 0.7062042485922575, "num_tokens": 25667509.0, "step": 12990 }, { "entropy": 1.148267563059926, "epoch": 0.3723701359150996, "grad_norm": 9.625, "learning_rate": 4.634290963396016e-05, "loss": 1.1369263648986816, "mean_token_accuracy": 0.7378683008253575, "num_tokens": 25686826.0, "step": 13000 }, { "entropy": 1.2015334542840719, "epoch": 0.37265657448118816, "grad_norm": 8.5625, "learning_rate": 4.633696490697997e-05, "loss": 1.2385712623596192, "mean_token_accuracy": 0.7222250301390887, "num_tokens": 25707342.0, "step": 13010 }, { "entropy": 1.2658307656645775, "epoch": 0.3729430130472767, "grad_norm": 9.0, "learning_rate": 4.6331015734172755e-05, "loss": 1.3023976325988769, "mean_token_accuracy": 0.7146957296878099, "num_tokens": 25727302.0, "step": 13020 }, { "entropy": 1.258390760421753, "epoch": 0.37322945161336524, "grad_norm": 8.5, "learning_rate": 4.632506211677812e-05, "loss": 1.2614652633666992, "mean_token_accuracy": 0.7186996635049582, "num_tokens": 25750127.0, "step": 13030 }, { "entropy": 1.1118933875113726, "epoch": 0.37351589017945375, "grad_norm": 6.375, "learning_rate": 4.631910405603654e-05, "loss": 1.1046648025512695, "mean_token_accuracy": 0.7437384359538555, "num_tokens": 25769351.0, "step": 13040 }, { "entropy": 1.0717617638409138, "epoch": 0.3738023287455423, "grad_norm": 9.6875, "learning_rate": 4.6313141553189494e-05, "loss": 1.0836981773376464, "mean_token_accuracy": 0.750560249760747, "num_tokens": 25788352.0, "step": 13050 }, { "entropy": 1.086102511174977, "epoch": 0.3740887673116308, "grad_norm": 8.3125, "learning_rate": 4.630717460947932e-05, "loss": 1.1510765075683593, "mean_token_accuracy": 0.7447220861911774, "num_tokens": 25808519.0, "step": 13060 }, { "entropy": 1.2643359094858169, "epoch": 0.3743752058777194, "grad_norm": 8.5625, "learning_rate": 4.630120322614931e-05, "loss": 1.3303447723388673, "mean_token_accuracy": 0.710831318795681, "num_tokens": 25829264.0, "step": 13070 }, { "entropy": 1.3563353499397635, "epoch": 0.3746616444438079, "grad_norm": 8.125, "learning_rate": 4.629522740444368e-05, "loss": 1.344771671295166, "mean_token_accuracy": 0.7004264548420907, "num_tokens": 25848769.0, "step": 13080 }, { "entropy": 1.1492317229509355, "epoch": 0.37494808300989646, "grad_norm": 7.3125, "learning_rate": 4.6289247145607565e-05, "loss": 1.159813404083252, "mean_token_accuracy": 0.731747355684638, "num_tokens": 25867738.0, "step": 13090 }, { "entropy": 1.0995746402069926, "epoch": 0.37523452157598497, "grad_norm": 8.125, "learning_rate": 4.6283262450887036e-05, "loss": 1.0462042808532714, "mean_token_accuracy": 0.7593157414346934, "num_tokens": 25888821.0, "step": 13100 }, { "entropy": 1.0386188369244338, "epoch": 0.37552096014207353, "grad_norm": 7.40625, "learning_rate": 4.627727332152907e-05, "loss": 1.0563633918762207, "mean_token_accuracy": 0.747785908356309, "num_tokens": 25906907.0, "step": 13110 }, { "entropy": 1.150918895751238, "epoch": 0.37580739870816204, "grad_norm": 8.0625, "learning_rate": 4.627127975878158e-05, "loss": 1.1532745361328125, "mean_token_accuracy": 0.7451213531196117, "num_tokens": 25926223.0, "step": 13120 }, { "entropy": 1.1642468746751546, "epoch": 0.3760938372742506, "grad_norm": 8.125, "learning_rate": 4.626528176389341e-05, "loss": 1.1743946075439453, "mean_token_accuracy": 0.7289228297770023, "num_tokens": 25945788.0, "step": 13130 }, { "entropy": 1.1000314101576805, "epoch": 0.3763802758403391, "grad_norm": 10.1875, "learning_rate": 4.625927933811431e-05, "loss": 1.1201741218566894, "mean_token_accuracy": 0.7501476533710957, "num_tokens": 25965700.0, "step": 13140 }, { "entropy": 1.1132942715659737, "epoch": 0.3766667144064277, "grad_norm": 9.875, "learning_rate": 4.625327248269496e-05, "loss": 1.1445460319519043, "mean_token_accuracy": 0.7341828580945731, "num_tokens": 25984973.0, "step": 13150 }, { "entropy": 1.1168049293570221, "epoch": 0.3769531529725162, "grad_norm": 8.625, "learning_rate": 4.624726119888697e-05, "loss": 1.1976551055908202, "mean_token_accuracy": 0.734917625784874, "num_tokens": 26006644.0, "step": 13160 }, { "entropy": 1.1321493003517389, "epoch": 0.37723959153860476, "grad_norm": 9.0, "learning_rate": 4.624124548794286e-05, "loss": 1.162496852874756, "mean_token_accuracy": 0.7441964868456126, "num_tokens": 26026331.0, "step": 13170 }, { "entropy": 1.1288546834141016, "epoch": 0.3775260301046933, "grad_norm": 8.1875, "learning_rate": 4.6235225351116084e-05, "loss": 1.1391674041748048, "mean_token_accuracy": 0.7361530654132367, "num_tokens": 26046424.0, "step": 13180 }, { "entropy": 1.0502203691750764, "epoch": 0.37781246867078183, "grad_norm": 6.3125, "learning_rate": 4.622920078966102e-05, "loss": 1.035305118560791, "mean_token_accuracy": 0.7607167676091194, "num_tokens": 26066629.0, "step": 13190 }, { "entropy": 1.2320741161704063, "epoch": 0.3780989072368704, "grad_norm": 7.875, "learning_rate": 4.622317180483295e-05, "loss": 1.2428441047668457, "mean_token_accuracy": 0.7151221863925457, "num_tokens": 26087182.0, "step": 13200 }, { "entropy": 1.0963316362351179, "epoch": 0.3783853458029589, "grad_norm": 12.6875, "learning_rate": 4.6217138397888095e-05, "loss": 1.1709476470947267, "mean_token_accuracy": 0.7431160639971495, "num_tokens": 26105706.0, "step": 13210 }, { "entropy": 1.1012681659311057, "epoch": 0.37867178436904747, "grad_norm": 6.21875, "learning_rate": 4.6211100570083594e-05, "loss": 1.1351963996887207, "mean_token_accuracy": 0.7485731072723866, "num_tokens": 26124785.0, "step": 13220 }, { "entropy": 1.1518997572362424, "epoch": 0.378958222935136, "grad_norm": 6.65625, "learning_rate": 4.6205058322677494e-05, "loss": 1.1630259513854981, "mean_token_accuracy": 0.7407668605446815, "num_tokens": 26143407.0, "step": 13230 }, { "entropy": 1.2425869055092336, "epoch": 0.37924466150122454, "grad_norm": 7.28125, "learning_rate": 4.6199011656928795e-05, "loss": 1.1965776443481446, "mean_token_accuracy": 0.7309584684669972, "num_tokens": 26163423.0, "step": 13240 }, { "entropy": 1.1070094164460897, "epoch": 0.37953110006731305, "grad_norm": 6.71875, "learning_rate": 4.619296057409738e-05, "loss": 1.1301518440246583, "mean_token_accuracy": 0.7570125795900822, "num_tokens": 26182911.0, "step": 13250 }, { "entropy": 1.1243059342727064, "epoch": 0.3798175386334016, "grad_norm": 7.125, "learning_rate": 4.618690507544407e-05, "loss": 1.1588628768920899, "mean_token_accuracy": 0.7309739802032709, "num_tokens": 26202205.0, "step": 13260 }, { "entropy": 1.0504294570535422, "epoch": 0.38010397719949013, "grad_norm": 6.5625, "learning_rate": 4.618084516223061e-05, "loss": 1.0572033882141114, "mean_token_accuracy": 0.760616147890687, "num_tokens": 26221281.0, "step": 13270 }, { "entropy": 1.123620861582458, "epoch": 0.3803904157655787, "grad_norm": 7.28125, "learning_rate": 4.617478083571965e-05, "loss": 1.1137992858886718, "mean_token_accuracy": 0.7539139159023762, "num_tokens": 26240713.0, "step": 13280 }, { "entropy": 1.1734141055494547, "epoch": 0.3806768543316672, "grad_norm": 6.25, "learning_rate": 4.616871209717478e-05, "loss": 1.1763044357299806, "mean_token_accuracy": 0.7280381541699171, "num_tokens": 26261462.0, "step": 13290 }, { "entropy": 1.129241468757391, "epoch": 0.38096329289775577, "grad_norm": 7.78125, "learning_rate": 4.6162638947860505e-05, "loss": 1.1214021682739257, "mean_token_accuracy": 0.7374898888170719, "num_tokens": 26281460.0, "step": 13300 }, { "entropy": 1.187988194450736, "epoch": 0.3812497314638443, "grad_norm": 8.3125, "learning_rate": 4.615656138904222e-05, "loss": 1.2414039611816405, "mean_token_accuracy": 0.7270261164754629, "num_tokens": 26301046.0, "step": 13310 }, { "entropy": 1.0679695375263691, "epoch": 0.38153617002993284, "grad_norm": 8.375, "learning_rate": 4.615047942198628e-05, "loss": 1.1079164505004884, "mean_token_accuracy": 0.7502503082156181, "num_tokens": 26320569.0, "step": 13320 }, { "entropy": 1.2352590780705213, "epoch": 0.38182260859602135, "grad_norm": 8.875, "learning_rate": 4.614439304795993e-05, "loss": 1.2464200019836427, "mean_token_accuracy": 0.7296668808907271, "num_tokens": 26340804.0, "step": 13330 }, { "entropy": 1.03939205147326, "epoch": 0.3821090471621099, "grad_norm": 7.59375, "learning_rate": 4.613830226823135e-05, "loss": 1.0378402709960937, "mean_token_accuracy": 0.7564418643712998, "num_tokens": 26360007.0, "step": 13340 }, { "entropy": 1.075854821316898, "epoch": 0.3823954857281984, "grad_norm": 6.875, "learning_rate": 4.6132207084069624e-05, "loss": 1.085224437713623, "mean_token_accuracy": 0.7537115588784218, "num_tokens": 26379789.0, "step": 13350 }, { "entropy": 1.0285083524882794, "epoch": 0.382681924294287, "grad_norm": 6.125, "learning_rate": 4.6126107496744774e-05, "loss": 1.0187339782714844, "mean_token_accuracy": 0.7502297695726157, "num_tokens": 26399546.0, "step": 13360 }, { "entropy": 1.194828474894166, "epoch": 0.3829683628603755, "grad_norm": 9.0625, "learning_rate": 4.612000350752771e-05, "loss": 1.1697881698608399, "mean_token_accuracy": 0.7338401980698108, "num_tokens": 26420157.0, "step": 13370 }, { "entropy": 1.0615633236244322, "epoch": 0.38325480142646406, "grad_norm": 6.40625, "learning_rate": 4.611389511769029e-05, "loss": 1.1142437934875489, "mean_token_accuracy": 0.7461676564067602, "num_tokens": 26440124.0, "step": 13380 }, { "entropy": 1.107361724972725, "epoch": 0.3835412399925526, "grad_norm": 7.28125, "learning_rate": 4.610778232850526e-05, "loss": 1.1600430488586426, "mean_token_accuracy": 0.7285270459949971, "num_tokens": 26459771.0, "step": 13390 }, { "entropy": 1.1385216504335403, "epoch": 0.38382767855864114, "grad_norm": 7.96875, "learning_rate": 4.6101665141246305e-05, "loss": 1.2003435134887694, "mean_token_accuracy": 0.73530408218503, "num_tokens": 26480427.0, "step": 13400 }, { "entropy": 1.0924631152302027, "epoch": 0.38411411712472965, "grad_norm": 7.90625, "learning_rate": 4.609554355718802e-05, "loss": 1.080215835571289, "mean_token_accuracy": 0.7462619181722403, "num_tokens": 26499946.0, "step": 13410 }, { "entropy": 1.1041222266852855, "epoch": 0.3844005556908182, "grad_norm": 6.46875, "learning_rate": 4.608941757760591e-05, "loss": 1.091941738128662, "mean_token_accuracy": 0.7547808472067118, "num_tokens": 26519068.0, "step": 13420 }, { "entropy": 1.111957136541605, "epoch": 0.3846869942569067, "grad_norm": 6.5625, "learning_rate": 4.6083287203776406e-05, "loss": 1.1839715957641601, "mean_token_accuracy": 0.7361309833824634, "num_tokens": 26539661.0, "step": 13430 }, { "entropy": 1.0606804117560387, "epoch": 0.3849734328229953, "grad_norm": 7.84375, "learning_rate": 4.6077152436976846e-05, "loss": 1.0993440628051758, "mean_token_accuracy": 0.7447210818529129, "num_tokens": 26559390.0, "step": 13440 }, { "entropy": 1.140701805986464, "epoch": 0.38525987138908385, "grad_norm": 7.8125, "learning_rate": 4.607101327848549e-05, "loss": 1.1306324005126953, "mean_token_accuracy": 0.74290308393538, "num_tokens": 26578947.0, "step": 13450 }, { "entropy": 1.1164259765297175, "epoch": 0.38554630995517236, "grad_norm": 9.125, "learning_rate": 4.60648697295815e-05, "loss": 1.149711799621582, "mean_token_accuracy": 0.732585322111845, "num_tokens": 26598764.0, "step": 13460 }, { "entropy": 1.1421908893622459, "epoch": 0.3858327485212609, "grad_norm": 8.1875, "learning_rate": 4.605872179154497e-05, "loss": 1.1769161224365234, "mean_token_accuracy": 0.7379289224743844, "num_tokens": 26619657.0, "step": 13470 }, { "entropy": 1.0156867552548647, "epoch": 0.38611918708734944, "grad_norm": 5.84375, "learning_rate": 4.605256946565689e-05, "loss": 1.0399087905883788, "mean_token_accuracy": 0.7505837459117174, "num_tokens": 26638556.0, "step": 13480 }, { "entropy": 1.1651575971394776, "epoch": 0.386405625653438, "grad_norm": 9.0, "learning_rate": 4.60464127531992e-05, "loss": 1.1997819900512696, "mean_token_accuracy": 0.7357849251478911, "num_tokens": 26658281.0, "step": 13490 }, { "entropy": 1.0296811982989311, "epoch": 0.3866920642195265, "grad_norm": 6.71875, "learning_rate": 4.60402516554547e-05, "loss": 1.0078508377075195, "mean_token_accuracy": 0.7690814465284348, "num_tokens": 26678149.0, "step": 13500 }, { "entropy": 1.0274323631078004, "epoch": 0.3869785027856151, "grad_norm": 7.59375, "learning_rate": 4.603408617370716e-05, "loss": 1.1229555130004882, "mean_token_accuracy": 0.7420459054410458, "num_tokens": 26696905.0, "step": 13510 }, { "entropy": 1.0575699789449573, "epoch": 0.3872649413517036, "grad_norm": 7.0625, "learning_rate": 4.6027916309241216e-05, "loss": 1.0626741409301759, "mean_token_accuracy": 0.7535108409821987, "num_tokens": 26716428.0, "step": 13520 }, { "entropy": 1.1197260327637195, "epoch": 0.38755137991779215, "grad_norm": 7.4375, "learning_rate": 4.602174206334243e-05, "loss": 1.1604159355163575, "mean_token_accuracy": 0.7372713837772608, "num_tokens": 26737015.0, "step": 13530 }, { "entropy": 1.11889802031219, "epoch": 0.38783781848388066, "grad_norm": 8.3125, "learning_rate": 4.601556343729731e-05, "loss": 1.1389630317687989, "mean_token_accuracy": 0.7445575714111328, "num_tokens": 26756002.0, "step": 13540 }, { "entropy": 1.1310115091502666, "epoch": 0.3881242570499692, "grad_norm": 5.875, "learning_rate": 4.600938043239324e-05, "loss": 1.1146280288696289, "mean_token_accuracy": 0.7398996811360121, "num_tokens": 26775592.0, "step": 13550 }, { "entropy": 1.2144757624715568, "epoch": 0.38841069561605773, "grad_norm": 6.25, "learning_rate": 4.600319304991853e-05, "loss": 1.1686527252197265, "mean_token_accuracy": 0.736454214528203, "num_tokens": 26796755.0, "step": 13560 }, { "entropy": 1.0207943353801965, "epoch": 0.3886971341821463, "grad_norm": 9.3125, "learning_rate": 4.599700129116239e-05, "loss": 1.0400163650512695, "mean_token_accuracy": 0.7630011141300201, "num_tokens": 26816165.0, "step": 13570 }, { "entropy": 1.1259653121232986, "epoch": 0.3889835727482348, "grad_norm": 6.625, "learning_rate": 4.5990805157414955e-05, "loss": 1.2171916961669922, "mean_token_accuracy": 0.7357124220579863, "num_tokens": 26835292.0, "step": 13580 }, { "entropy": 1.1280373729765416, "epoch": 0.38927001131432337, "grad_norm": 7.28125, "learning_rate": 4.598460464996728e-05, "loss": 1.1450432777404784, "mean_token_accuracy": 0.7380849156528712, "num_tokens": 26855594.0, "step": 13590 }, { "entropy": 1.1650241162627935, "epoch": 0.3895564498804119, "grad_norm": 8.1875, "learning_rate": 4.59783997701113e-05, "loss": 1.2044533729553222, "mean_token_accuracy": 0.7284088488668203, "num_tokens": 26876116.0, "step": 13600 }, { "entropy": 1.207856471836567, "epoch": 0.38984288844650045, "grad_norm": 12.0625, "learning_rate": 4.597219051913989e-05, "loss": 1.1620019912719726, "mean_token_accuracy": 0.7413180183619261, "num_tokens": 26894617.0, "step": 13610 }, { "entropy": 1.1125625487416984, "epoch": 0.39012932701258896, "grad_norm": 6.40625, "learning_rate": 4.596597689834683e-05, "loss": 1.1935505867004395, "mean_token_accuracy": 0.7307192720472813, "num_tokens": 26914385.0, "step": 13620 }, { "entropy": 1.2422377105802298, "epoch": 0.3904157655786775, "grad_norm": 6.875, "learning_rate": 4.5959758909026806e-05, "loss": 1.2270179748535157, "mean_token_accuracy": 0.717282223328948, "num_tokens": 26933008.0, "step": 13630 }, { "entropy": 1.198270209133625, "epoch": 0.39070220414476603, "grad_norm": 8.9375, "learning_rate": 4.595353655247541e-05, "loss": 1.234036922454834, "mean_token_accuracy": 0.7191448159515857, "num_tokens": 26955294.0, "step": 13640 }, { "entropy": 1.0853005960583686, "epoch": 0.3909886427108546, "grad_norm": 8.125, "learning_rate": 4.594730982998915e-05, "loss": 1.079219913482666, "mean_token_accuracy": 0.7601745601743459, "num_tokens": 26974872.0, "step": 13650 }, { "entropy": 1.0133636560291053, "epoch": 0.3912750812769431, "grad_norm": 9.9375, "learning_rate": 4.594107874286543e-05, "loss": 1.0367952346801759, "mean_token_accuracy": 0.759344007074833, "num_tokens": 26994629.0, "step": 13660 }, { "entropy": 0.9951158080250024, "epoch": 0.39156151984303167, "grad_norm": 7.6875, "learning_rate": 4.593484329240261e-05, "loss": 0.9945546150207519, "mean_token_accuracy": 0.7635503523051739, "num_tokens": 27013383.0, "step": 13670 }, { "entropy": 1.1127688560634852, "epoch": 0.3918479584091202, "grad_norm": 6.25, "learning_rate": 4.592860347989989e-05, "loss": 1.1570622444152832, "mean_token_accuracy": 0.7394256714731455, "num_tokens": 27033476.0, "step": 13680 }, { "entropy": 1.1161638729274272, "epoch": 0.39213439697520874, "grad_norm": 8.375, "learning_rate": 4.592235930665743e-05, "loss": 1.1405423164367676, "mean_token_accuracy": 0.736626398190856, "num_tokens": 27053446.0, "step": 13690 }, { "entropy": 1.1689563043415547, "epoch": 0.39242083554129725, "grad_norm": 7.84375, "learning_rate": 4.591611077397629e-05, "loss": 1.150797462463379, "mean_token_accuracy": 0.7299564730376005, "num_tokens": 27073627.0, "step": 13700 }, { "entropy": 1.0925851561129094, "epoch": 0.3927072741073858, "grad_norm": 7.34375, "learning_rate": 4.5909857883158416e-05, "loss": 1.131083869934082, "mean_token_accuracy": 0.7346471883356571, "num_tokens": 27092831.0, "step": 13710 }, { "entropy": 1.2008197639137506, "epoch": 0.3929937126734744, "grad_norm": 6.4375, "learning_rate": 4.5903600635506674e-05, "loss": 1.2517218589782715, "mean_token_accuracy": 0.7185905132442713, "num_tokens": 27112691.0, "step": 13720 }, { "entropy": 1.1140727333724498, "epoch": 0.3932801512395629, "grad_norm": 11.25, "learning_rate": 4.589733903232486e-05, "loss": 1.1450485229492187, "mean_token_accuracy": 0.7405670329928398, "num_tokens": 27132482.0, "step": 13730 }, { "entropy": 1.1029028035700321, "epoch": 0.39356658980565146, "grad_norm": 7.8125, "learning_rate": 4.589107307491764e-05, "loss": 1.0774626731872559, "mean_token_accuracy": 0.7490176014602185, "num_tokens": 27152238.0, "step": 13740 }, { "entropy": 1.0316357742995024, "epoch": 0.39385302837173997, "grad_norm": 7.46875, "learning_rate": 4.588480276459062e-05, "loss": 1.0456353187561036, "mean_token_accuracy": 0.7569695197045803, "num_tokens": 27171086.0, "step": 13750 }, { "entropy": 1.1382686126977206, "epoch": 0.39413946693782853, "grad_norm": 7.0, "learning_rate": 4.587852810265029e-05, "loss": 1.183835792541504, "mean_token_accuracy": 0.7485539294779301, "num_tokens": 27190998.0, "step": 13760 }, { "entropy": 1.101496298611164, "epoch": 0.39442590550391704, "grad_norm": 9.8125, "learning_rate": 4.587224909040406e-05, "loss": 1.1658875465393066, "mean_token_accuracy": 0.733449823781848, "num_tokens": 27209943.0, "step": 13770 }, { "entropy": 1.148446923494339, "epoch": 0.3947123440700056, "grad_norm": 10.375, "learning_rate": 4.586596572916024e-05, "loss": 1.1994535446166992, "mean_token_accuracy": 0.7350861433893442, "num_tokens": 27230491.0, "step": 13780 }, { "entropy": 1.1955406554043293, "epoch": 0.3949987826360941, "grad_norm": 6.71875, "learning_rate": 4.5859678020228045e-05, "loss": 1.2236618041992187, "mean_token_accuracy": 0.7276370611041785, "num_tokens": 27250554.0, "step": 13790 }, { "entropy": 1.1935501739382743, "epoch": 0.3952852212021827, "grad_norm": 7.75, "learning_rate": 4.5853385964917595e-05, "loss": 1.166623020172119, "mean_token_accuracy": 0.7335661627352238, "num_tokens": 27269624.0, "step": 13800 }, { "entropy": 1.1109854746609926, "epoch": 0.3955716597682712, "grad_norm": 8.0, "learning_rate": 4.584708956453994e-05, "loss": 1.1576685905456543, "mean_token_accuracy": 0.7441776257008315, "num_tokens": 27290394.0, "step": 13810 }, { "entropy": 1.1573342241346836, "epoch": 0.39585809833435975, "grad_norm": 8.625, "learning_rate": 4.5840788820406985e-05, "loss": 1.212014102935791, "mean_token_accuracy": 0.7288065761327743, "num_tokens": 27310858.0, "step": 13820 }, { "entropy": 1.0697692852467298, "epoch": 0.39614453690044826, "grad_norm": 8.375, "learning_rate": 4.583448373383159e-05, "loss": 1.0947504043579102, "mean_token_accuracy": 0.7464196585118771, "num_tokens": 27329474.0, "step": 13830 }, { "entropy": 1.0837575756013393, "epoch": 0.39643097546653683, "grad_norm": 7.5, "learning_rate": 4.58281743061275e-05, "loss": 1.0747143745422363, "mean_token_accuracy": 0.763117165863514, "num_tokens": 27347850.0, "step": 13840 }, { "entropy": 1.0639418363571167, "epoch": 0.39671741403262534, "grad_norm": 8.5, "learning_rate": 4.582186053860935e-05, "loss": 1.0765370368957519, "mean_token_accuracy": 0.7533428136259317, "num_tokens": 27366838.0, "step": 13850 }, { "entropy": 1.1670151762664318, "epoch": 0.3970038525987139, "grad_norm": 11.5, "learning_rate": 4.5815542432592706e-05, "loss": 1.2374978065490723, "mean_token_accuracy": 0.725564244389534, "num_tokens": 27385997.0, "step": 13860 }, { "entropy": 1.1199742000550033, "epoch": 0.3972902911648024, "grad_norm": 8.5625, "learning_rate": 4.5809219989394026e-05, "loss": 1.1063859939575196, "mean_token_accuracy": 0.7471762392669916, "num_tokens": 27405043.0, "step": 13870 }, { "entropy": 1.150625254958868, "epoch": 0.397576729730891, "grad_norm": 8.9375, "learning_rate": 4.5802893210330663e-05, "loss": 1.1999119758605956, "mean_token_accuracy": 0.728228648006916, "num_tokens": 27424573.0, "step": 13880 }, { "entropy": 1.1585307117551564, "epoch": 0.3978631682969795, "grad_norm": 12.5, "learning_rate": 4.5796562096720894e-05, "loss": 1.1606752395629882, "mean_token_accuracy": 0.7357274513691664, "num_tokens": 27444115.0, "step": 13890 }, { "entropy": 1.1166127640753984, "epoch": 0.39814960686306805, "grad_norm": 7.25, "learning_rate": 4.579022664988387e-05, "loss": 1.1174097061157227, "mean_token_accuracy": 0.7531223516911268, "num_tokens": 27463671.0, "step": 13900 }, { "entropy": 1.1190488960593938, "epoch": 0.39843604542915656, "grad_norm": 8.0625, "learning_rate": 4.578388687113967e-05, "loss": 1.1178046226501466, "mean_token_accuracy": 0.7439228083938361, "num_tokens": 27483135.0, "step": 13910 }, { "entropy": 1.1120413860306144, "epoch": 0.3987224839952451, "grad_norm": 11.25, "learning_rate": 4.5777542761809264e-05, "loss": 1.1160276412963868, "mean_token_accuracy": 0.7362407274544239, "num_tokens": 27504051.0, "step": 13920 }, { "entropy": 1.1687403585761786, "epoch": 0.39900892256133363, "grad_norm": 11.3125, "learning_rate": 4.577119432321454e-05, "loss": 1.2560688972473144, "mean_token_accuracy": 0.7249983888119459, "num_tokens": 27523505.0, "step": 13930 }, { "entropy": 1.1077825777232646, "epoch": 0.3992953611274222, "grad_norm": 8.625, "learning_rate": 4.5764841556678264e-05, "loss": 1.1104825019836426, "mean_token_accuracy": 0.7425674747675657, "num_tokens": 27543022.0, "step": 13940 }, { "entropy": 1.0267994746565818, "epoch": 0.3995817996935107, "grad_norm": 6.21875, "learning_rate": 4.575848446352412e-05, "loss": 1.0367024421691895, "mean_token_accuracy": 0.7526102483272552, "num_tokens": 27564097.0, "step": 13950 }, { "entropy": 1.0943633997812867, "epoch": 0.3998682382595993, "grad_norm": 7.15625, "learning_rate": 4.5752123045076676e-05, "loss": 1.142641830444336, "mean_token_accuracy": 0.7388008993119002, "num_tokens": 27583009.0, "step": 13960 }, { "entropy": 1.1412461327388883, "epoch": 0.40015467682568784, "grad_norm": 7.46875, "learning_rate": 4.574575730266144e-05, "loss": 1.1726662635803222, "mean_token_accuracy": 0.7380145356059075, "num_tokens": 27602412.0, "step": 13970 }, { "entropy": 1.0107852390035987, "epoch": 0.40044111539177635, "grad_norm": 7.375, "learning_rate": 4.573938723760477e-05, "loss": 1.0369004249572753, "mean_token_accuracy": 0.7429001055657863, "num_tokens": 27623039.0, "step": 13980 }, { "entropy": 1.0852725083008408, "epoch": 0.4007275539578649, "grad_norm": 9.1875, "learning_rate": 4.573301285123397e-05, "loss": 1.1279693603515626, "mean_token_accuracy": 0.7422417225316167, "num_tokens": 27641362.0, "step": 13990 }, { "entropy": 1.1904946736991406, "epoch": 0.4010139925239534, "grad_norm": 8.8125, "learning_rate": 4.57266341448772e-05, "loss": 1.1861407279968261, "mean_token_accuracy": 0.7369790241122246, "num_tokens": 27660854.0, "step": 14000 }, { "entropy": 1.0397769512608648, "epoch": 0.401300431090042, "grad_norm": 6.8125, "learning_rate": 4.572025111986357e-05, "loss": 1.0618779182434082, "mean_token_accuracy": 0.7596565578132868, "num_tokens": 27679227.0, "step": 14010 }, { "entropy": 1.1395037800073624, "epoch": 0.4015868696561305, "grad_norm": 9.9375, "learning_rate": 4.571386377752305e-05, "loss": 1.1624042510986328, "mean_token_accuracy": 0.7376817010343075, "num_tokens": 27698204.0, "step": 14020 }, { "entropy": 1.286335051059723, "epoch": 0.40187330822221906, "grad_norm": 7.53125, "learning_rate": 4.570747211918652e-05, "loss": 1.2868769645690918, "mean_token_accuracy": 0.7188835613429546, "num_tokens": 27718723.0, "step": 14030 }, { "entropy": 1.2616499349474908, "epoch": 0.40215974678830757, "grad_norm": 8.125, "learning_rate": 4.5701076146185774e-05, "loss": 1.2330806732177735, "mean_token_accuracy": 0.7266953002661467, "num_tokens": 27737772.0, "step": 14040 }, { "entropy": 1.1240324717015029, "epoch": 0.40244618535439614, "grad_norm": 7.15625, "learning_rate": 4.569467585985349e-05, "loss": 1.1368300437927246, "mean_token_accuracy": 0.7383144348859787, "num_tokens": 27757844.0, "step": 14050 }, { "entropy": 1.1414099846035242, "epoch": 0.40273262392048464, "grad_norm": 8.0, "learning_rate": 4.568827126152325e-05, "loss": 1.1943794250488282, "mean_token_accuracy": 0.7240987431257964, "num_tokens": 27776796.0, "step": 14060 }, { "entropy": 1.1706598352640867, "epoch": 0.4030190624865732, "grad_norm": 7.5, "learning_rate": 4.5681862352529525e-05, "loss": 1.143519973754883, "mean_token_accuracy": 0.7322823226451873, "num_tokens": 27797353.0, "step": 14070 }, { "entropy": 1.1464680768549442, "epoch": 0.4033055010526617, "grad_norm": 7.15625, "learning_rate": 4.5675449134207695e-05, "loss": 1.1763397216796876, "mean_token_accuracy": 0.742257084324956, "num_tokens": 27816978.0, "step": 14080 }, { "entropy": 1.0622295454144477, "epoch": 0.4035919396187503, "grad_norm": 6.875, "learning_rate": 4.5669031607894056e-05, "loss": 0.9949763298034668, "mean_token_accuracy": 0.7683422062546015, "num_tokens": 27835500.0, "step": 14090 }, { "entropy": 1.1340995959937572, "epoch": 0.4038783781848388, "grad_norm": 9.5625, "learning_rate": 4.566260977492575e-05, "loss": 1.1948657989501954, "mean_token_accuracy": 0.7219095807522535, "num_tokens": 27854983.0, "step": 14100 }, { "entropy": 1.084837320074439, "epoch": 0.40416481675092736, "grad_norm": 7.25, "learning_rate": 4.565618363664086e-05, "loss": 1.1277252197265626, "mean_token_accuracy": 0.7484170131385326, "num_tokens": 27875123.0, "step": 14110 }, { "entropy": 1.1732332149520517, "epoch": 0.40445125531701587, "grad_norm": 5.84375, "learning_rate": 4.5649753194378364e-05, "loss": 1.261639404296875, "mean_token_accuracy": 0.7230697566643357, "num_tokens": 27895586.0, "step": 14120 }, { "entropy": 1.152813283726573, "epoch": 0.40473769388310443, "grad_norm": 7.40625, "learning_rate": 4.5643318449478115e-05, "loss": 1.092837429046631, "mean_token_accuracy": 0.7515673194080591, "num_tokens": 27915034.0, "step": 14130 }, { "entropy": 1.0599627276882528, "epoch": 0.40502413244919294, "grad_norm": 10.4375, "learning_rate": 4.563687940328086e-05, "loss": 1.0886774063110352, "mean_token_accuracy": 0.752121340110898, "num_tokens": 27935056.0, "step": 14140 }, { "entropy": 1.1309829125180841, "epoch": 0.4053105710152815, "grad_norm": 11.4375, "learning_rate": 4.563043605712829e-05, "loss": 1.2338820457458497, "mean_token_accuracy": 0.7276365384459496, "num_tokens": 27956574.0, "step": 14150 }, { "entropy": 1.2226856648921967, "epoch": 0.40559700958137, "grad_norm": 8.1875, "learning_rate": 4.5623988412362936e-05, "loss": 1.245493507385254, "mean_token_accuracy": 0.7202244870364666, "num_tokens": 27977445.0, "step": 14160 }, { "entropy": 1.1402819616720081, "epoch": 0.4058834481474586, "grad_norm": 7.34375, "learning_rate": 4.561753647032824e-05, "loss": 1.109068012237549, "mean_token_accuracy": 0.756523833796382, "num_tokens": 27998152.0, "step": 14170 }, { "entropy": 1.1912747511640192, "epoch": 0.4061698867135471, "grad_norm": 7.59375, "learning_rate": 4.561108023236856e-05, "loss": 1.1988101959228517, "mean_token_accuracy": 0.7290570970624686, "num_tokens": 28018364.0, "step": 14180 }, { "entropy": 1.0169376848265528, "epoch": 0.40645632527963566, "grad_norm": 7.9375, "learning_rate": 4.560461969982913e-05, "loss": 0.9945815086364747, "mean_token_accuracy": 0.7714498296380043, "num_tokens": 28038473.0, "step": 14190 }, { "entropy": 1.1061491932719947, "epoch": 0.40674276384572416, "grad_norm": 6.0625, "learning_rate": 4.5598154874056084e-05, "loss": 1.1170211791992188, "mean_token_accuracy": 0.7447976555675269, "num_tokens": 28058098.0, "step": 14200 }, { "entropy": 1.1419741604477167, "epoch": 0.40702920241181273, "grad_norm": 8.0, "learning_rate": 4.5591685756396456e-05, "loss": 1.2156185150146483, "mean_token_accuracy": 0.7268393352627754, "num_tokens": 28078274.0, "step": 14210 }, { "entropy": 1.153952433448285, "epoch": 0.40731564097790124, "grad_norm": 10.125, "learning_rate": 4.558521234819816e-05, "loss": 1.2208589553833007, "mean_token_accuracy": 0.7354421325027942, "num_tokens": 28097495.0, "step": 14220 }, { "entropy": 1.192527426034212, "epoch": 0.4076020795439898, "grad_norm": 8.0625, "learning_rate": 4.557873465081002e-05, "loss": 1.1827711105346679, "mean_token_accuracy": 0.7380841430276632, "num_tokens": 28116364.0, "step": 14230 }, { "entropy": 1.193804333731532, "epoch": 0.40788851811007837, "grad_norm": 8.9375, "learning_rate": 4.557225266558174e-05, "loss": 1.2354117393493653, "mean_token_accuracy": 0.7287968829274177, "num_tokens": 28135319.0, "step": 14240 }, { "entropy": 1.2366693869233132, "epoch": 0.4081749566761669, "grad_norm": 8.5, "learning_rate": 4.556576639386392e-05, "loss": 1.257970428466797, "mean_token_accuracy": 0.714319970086217, "num_tokens": 28154903.0, "step": 14250 }, { "entropy": 1.1617317341268063, "epoch": 0.40846139524225544, "grad_norm": 7.5, "learning_rate": 4.555927583700806e-05, "loss": 1.1627843856811524, "mean_token_accuracy": 0.7274182572960853, "num_tokens": 28175655.0, "step": 14260 }, { "entropy": 1.1495460934937, "epoch": 0.40874783380834395, "grad_norm": 7.9375, "learning_rate": 4.5552780996366564e-05, "loss": 1.1367864608764648, "mean_token_accuracy": 0.739438646286726, "num_tokens": 28195921.0, "step": 14270 }, { "entropy": 1.0487476052716374, "epoch": 0.4090342723744325, "grad_norm": 6.34375, "learning_rate": 4.554628187329269e-05, "loss": 1.050082015991211, "mean_token_accuracy": 0.7519128456711769, "num_tokens": 28215324.0, "step": 14280 }, { "entropy": 1.2471446372568606, "epoch": 0.409320710940521, "grad_norm": 10.375, "learning_rate": 4.5539778469140637e-05, "loss": 1.2902836799621582, "mean_token_accuracy": 0.7069186266511679, "num_tokens": 28235538.0, "step": 14290 }, { "entropy": 1.0372010607272386, "epoch": 0.4096071495066096, "grad_norm": 9.0625, "learning_rate": 4.553327078526546e-05, "loss": 1.0384214401245118, "mean_token_accuracy": 0.7600736010819673, "num_tokens": 28255648.0, "step": 14300 }, { "entropy": 1.1140098690986633, "epoch": 0.4098935880726981, "grad_norm": 7.875, "learning_rate": 4.5526758823023105e-05, "loss": 1.1720968246459962, "mean_token_accuracy": 0.739414731413126, "num_tokens": 28275709.0, "step": 14310 }, { "entropy": 1.1347706506028772, "epoch": 0.41018002663878667, "grad_norm": 7.59375, "learning_rate": 4.552024258377045e-05, "loss": 1.1680035591125488, "mean_token_accuracy": 0.7396666649729013, "num_tokens": 28295672.0, "step": 14320 }, { "entropy": 1.1031608134508133, "epoch": 0.4104664652048752, "grad_norm": 6.03125, "learning_rate": 4.551372206886522e-05, "loss": 1.0621084213256835, "mean_token_accuracy": 0.7565102431923151, "num_tokens": 28315465.0, "step": 14330 }, { "entropy": 1.1116163678467275, "epoch": 0.41075290377096374, "grad_norm": 6.625, "learning_rate": 4.5507197279666036e-05, "loss": 1.1380571365356444, "mean_token_accuracy": 0.7422281928360462, "num_tokens": 28336517.0, "step": 14340 }, { "entropy": 0.9999041834846139, "epoch": 0.41103934233705225, "grad_norm": 6.65625, "learning_rate": 4.5500668217532435e-05, "loss": 1.0338714599609375, "mean_token_accuracy": 0.7558140780776739, "num_tokens": 28356259.0, "step": 14350 }, { "entropy": 1.2080080317333342, "epoch": 0.4113257809031408, "grad_norm": 7.71875, "learning_rate": 4.5494134883824835e-05, "loss": 1.2259339332580566, "mean_token_accuracy": 0.7317264955490828, "num_tokens": 28376921.0, "step": 14360 }, { "entropy": 1.059236565604806, "epoch": 0.4116122194692293, "grad_norm": 7.53125, "learning_rate": 4.548759727990452e-05, "loss": 1.1544683456420899, "mean_token_accuracy": 0.7349529288709163, "num_tokens": 28395866.0, "step": 14370 }, { "entropy": 1.1545110568404198, "epoch": 0.4118986580353179, "grad_norm": 7.28125, "learning_rate": 4.54810554071337e-05, "loss": 1.17848482131958, "mean_token_accuracy": 0.7229414105415344, "num_tokens": 28416782.0, "step": 14380 }, { "entropy": 1.1624818492680788, "epoch": 0.4121850966014064, "grad_norm": 9.5, "learning_rate": 4.547450926687545e-05, "loss": 1.1792043685913085, "mean_token_accuracy": 0.7322552625089884, "num_tokens": 28436386.0, "step": 14390 }, { "entropy": 1.1268555503338575, "epoch": 0.41247153516749496, "grad_norm": 8.25, "learning_rate": 4.546795886049374e-05, "loss": 1.153772735595703, "mean_token_accuracy": 0.7431964311748743, "num_tokens": 28457064.0, "step": 14400 }, { "entropy": 1.1511641431599855, "epoch": 0.41275797373358347, "grad_norm": 7.09375, "learning_rate": 4.546140418935343e-05, "loss": 1.1944644927978516, "mean_token_accuracy": 0.734812755137682, "num_tokens": 28476986.0, "step": 14410 }, { "entropy": 1.0386159885674715, "epoch": 0.41304441229967204, "grad_norm": 8.25, "learning_rate": 4.5454845254820274e-05, "loss": 1.0399702072143555, "mean_token_accuracy": 0.7606531362980604, "num_tokens": 28495480.0, "step": 14420 }, { "entropy": 1.1865351803600788, "epoch": 0.41333085086576055, "grad_norm": 9.5, "learning_rate": 4.5448282058260905e-05, "loss": 1.2295003890991212, "mean_token_accuracy": 0.729651914536953, "num_tokens": 28514597.0, "step": 14430 }, { "entropy": 1.1568078488111495, "epoch": 0.4136172894318491, "grad_norm": 6.46875, "learning_rate": 4.544171460104285e-05, "loss": 1.1574083328247071, "mean_token_accuracy": 0.7387333076447249, "num_tokens": 28535351.0, "step": 14440 }, { "entropy": 1.1269728902727365, "epoch": 0.4139037279979376, "grad_norm": 10.3125, "learning_rate": 4.5435142884534514e-05, "loss": 1.1483331680297852, "mean_token_accuracy": 0.7452408958226442, "num_tokens": 28554127.0, "step": 14450 }, { "entropy": 1.158478662930429, "epoch": 0.4141901665640262, "grad_norm": 8.5, "learning_rate": 4.542856691010521e-05, "loss": 1.132677173614502, "mean_token_accuracy": 0.7491106316447258, "num_tokens": 28573103.0, "step": 14460 }, { "entropy": 1.161947951465845, "epoch": 0.4144766051301147, "grad_norm": 8.625, "learning_rate": 4.542198667912512e-05, "loss": 1.1607860565185546, "mean_token_accuracy": 0.7345645684748888, "num_tokens": 28592670.0, "step": 14470 }, { "entropy": 1.0801840119063855, "epoch": 0.41476304369620326, "grad_norm": 6.96875, "learning_rate": 4.541540219296532e-05, "loss": 1.1090431213378906, "mean_token_accuracy": 0.7519734490662813, "num_tokens": 28612173.0, "step": 14480 }, { "entropy": 1.1233488850295543, "epoch": 0.41504948226229177, "grad_norm": 8.0625, "learning_rate": 4.540881345299777e-05, "loss": 1.1793914794921876, "mean_token_accuracy": 0.7267956435680389, "num_tokens": 28633160.0, "step": 14490 }, { "entropy": 1.0784925904124976, "epoch": 0.41533592082838033, "grad_norm": 5.875, "learning_rate": 4.5402220460595305e-05, "loss": 1.0103962898254395, "mean_token_accuracy": 0.7657408118247986, "num_tokens": 28652844.0, "step": 14500 }, { "entropy": 1.1368246782571076, "epoch": 0.4156223593944689, "grad_norm": 8.625, "learning_rate": 4.5395623217131684e-05, "loss": 1.1693191528320312, "mean_token_accuracy": 0.7241356905549765, "num_tokens": 28673500.0, "step": 14510 }, { "entropy": 1.0825424958020449, "epoch": 0.4159087979605574, "grad_norm": 8.4375, "learning_rate": 4.538902172398151e-05, "loss": 1.0991718292236328, "mean_token_accuracy": 0.7465787436813116, "num_tokens": 28692481.0, "step": 14520 }, { "entropy": 1.0715698301792145, "epoch": 0.416195236526646, "grad_norm": 5.375, "learning_rate": 4.538241598252029e-05, "loss": 1.060258674621582, "mean_token_accuracy": 0.7531248986721039, "num_tokens": 28713363.0, "step": 14530 }, { "entropy": 1.0631365917623044, "epoch": 0.4164816750927345, "grad_norm": 7.84375, "learning_rate": 4.537580599412441e-05, "loss": 1.1247137069702149, "mean_token_accuracy": 0.7426707837730646, "num_tokens": 28732264.0, "step": 14540 }, { "entropy": 1.0246806401759385, "epoch": 0.41676811365882305, "grad_norm": 8.4375, "learning_rate": 4.536919176017115e-05, "loss": 1.046319580078125, "mean_token_accuracy": 0.7603113379329443, "num_tokens": 28751063.0, "step": 14550 }, { "entropy": 1.1103365659713744, "epoch": 0.41705455222491156, "grad_norm": 6.875, "learning_rate": 4.5362573282038666e-05, "loss": 1.1239331245422364, "mean_token_accuracy": 0.7415032241493463, "num_tokens": 28770650.0, "step": 14560 }, { "entropy": 1.1654425658285619, "epoch": 0.4173409907910001, "grad_norm": 8.6875, "learning_rate": 4.535595056110601e-05, "loss": 1.1932677268981933, "mean_token_accuracy": 0.7326556798070669, "num_tokens": 28790165.0, "step": 14570 }, { "entropy": 1.1261321596801281, "epoch": 0.41762742935708863, "grad_norm": 8.1875, "learning_rate": 4.5349323598753116e-05, "loss": 1.155137825012207, "mean_token_accuracy": 0.738577152043581, "num_tokens": 28809333.0, "step": 14580 }, { "entropy": 1.156882111914456, "epoch": 0.4179138679231772, "grad_norm": 10.3125, "learning_rate": 4.534269239636077e-05, "loss": 1.1214960098266602, "mean_token_accuracy": 0.7352047309279441, "num_tokens": 28829810.0, "step": 14590 }, { "entropy": 1.0867130406200887, "epoch": 0.4182003064892657, "grad_norm": 6.03125, "learning_rate": 4.533605695531068e-05, "loss": 1.0952013969421386, "mean_token_accuracy": 0.754645861312747, "num_tokens": 28851254.0, "step": 14600 }, { "entropy": 1.153727318532765, "epoch": 0.41848674505535427, "grad_norm": 6.5625, "learning_rate": 4.5329417276985425e-05, "loss": 1.1840717315673828, "mean_token_accuracy": 0.7343263901770115, "num_tokens": 28872435.0, "step": 14610 }, { "entropy": 1.0724379697814583, "epoch": 0.4187731836214428, "grad_norm": 6.625, "learning_rate": 4.532277336276847e-05, "loss": 1.0653427124023438, "mean_token_accuracy": 0.7640966504812241, "num_tokens": 28891695.0, "step": 14620 }, { "entropy": 1.0752145254984498, "epoch": 0.41905962218753134, "grad_norm": 9.3125, "learning_rate": 4.531612521404416e-05, "loss": 1.0956077575683594, "mean_token_accuracy": 0.7625106770545245, "num_tokens": 28911596.0, "step": 14630 }, { "entropy": 1.0497026551514863, "epoch": 0.41934606075361985, "grad_norm": 8.75, "learning_rate": 4.530947283219771e-05, "loss": 1.1588489532470703, "mean_token_accuracy": 0.7413894068449736, "num_tokens": 28931752.0, "step": 14640 }, { "entropy": 1.0290535770356655, "epoch": 0.4196324993197084, "grad_norm": 8.875, "learning_rate": 4.530281621861523e-05, "loss": 0.9952278137207031, "mean_token_accuracy": 0.7689693726599216, "num_tokens": 28951601.0, "step": 14650 }, { "entropy": 1.0079265439882874, "epoch": 0.41991893788579693, "grad_norm": 11.5625, "learning_rate": 4.529615537468372e-05, "loss": 1.0446131706237793, "mean_token_accuracy": 0.766046853736043, "num_tokens": 28971185.0, "step": 14660 }, { "entropy": 1.1571363281458615, "epoch": 0.4202053764518855, "grad_norm": 8.3125, "learning_rate": 4.528949030179104e-05, "loss": 1.199844741821289, "mean_token_accuracy": 0.7387040574103594, "num_tokens": 28991216.0, "step": 14670 }, { "entropy": 1.0469587890431284, "epoch": 0.420491815017974, "grad_norm": 6.28125, "learning_rate": 4.5282821001325956e-05, "loss": 1.019493579864502, "mean_token_accuracy": 0.7620637316256762, "num_tokens": 29011357.0, "step": 14680 }, { "entropy": 1.1374478321522474, "epoch": 0.42077825358406257, "grad_norm": 9.0, "learning_rate": 4.527614747467809e-05, "loss": 1.1911021232604981, "mean_token_accuracy": 0.7331470765173436, "num_tokens": 29031085.0, "step": 14690 }, { "entropy": 1.058006624877453, "epoch": 0.4210646921501511, "grad_norm": 9.625, "learning_rate": 4.526946972323795e-05, "loss": 1.0812391281127929, "mean_token_accuracy": 0.7519583836197853, "num_tokens": 29049813.0, "step": 14700 }, { "entropy": 1.1337369695305823, "epoch": 0.42135113071623964, "grad_norm": 8.6875, "learning_rate": 4.5262787748396944e-05, "loss": 1.1544131278991698, "mean_token_accuracy": 0.7348576031625271, "num_tokens": 29069480.0, "step": 14710 }, { "entropy": 1.0956200117245316, "epoch": 0.42163756928232815, "grad_norm": 7.84375, "learning_rate": 4.5256101551547345e-05, "loss": 1.134230899810791, "mean_token_accuracy": 0.7455510355532169, "num_tokens": 29088220.0, "step": 14720 }, { "entropy": 1.2028059044852852, "epoch": 0.4219240078484167, "grad_norm": 8.25, "learning_rate": 4.52494111340823e-05, "loss": 1.2144407272338866, "mean_token_accuracy": 0.7308700537309051, "num_tokens": 29109869.0, "step": 14730 }, { "entropy": 1.1542120784521104, "epoch": 0.4222104464145052, "grad_norm": 10.6875, "learning_rate": 4.524271649739584e-05, "loss": 1.1372940063476562, "mean_token_accuracy": 0.7420404098927975, "num_tokens": 29130188.0, "step": 14740 }, { "entropy": 1.0530661925673486, "epoch": 0.4224968849805938, "grad_norm": 6.90625, "learning_rate": 4.5236017642882894e-05, "loss": 1.1334427833557128, "mean_token_accuracy": 0.7515544116497039, "num_tokens": 29150008.0, "step": 14750 }, { "entropy": 1.1175051979720592, "epoch": 0.4227833235466823, "grad_norm": 8.375, "learning_rate": 4.5229314571939234e-05, "loss": 1.108592414855957, "mean_token_accuracy": 0.7463943000882864, "num_tokens": 29169963.0, "step": 14760 }, { "entropy": 1.0148131728172303, "epoch": 0.42306976211277086, "grad_norm": 7.09375, "learning_rate": 4.522260728596154e-05, "loss": 1.062319850921631, "mean_token_accuracy": 0.7511447213590146, "num_tokens": 29189251.0, "step": 14770 }, { "entropy": 1.0246519651263952, "epoch": 0.42335620067885943, "grad_norm": 9.375, "learning_rate": 4.5215895786347355e-05, "loss": 0.9900642395019531, "mean_token_accuracy": 0.775403105840087, "num_tokens": 29208395.0, "step": 14780 }, { "entropy": 1.0646299868822098, "epoch": 0.42364263924494794, "grad_norm": 6.59375, "learning_rate": 4.520918007449511e-05, "loss": 1.092627716064453, "mean_token_accuracy": 0.7510326709598303, "num_tokens": 29228376.0, "step": 14790 }, { "entropy": 0.9802539642900229, "epoch": 0.4239290778110365, "grad_norm": 9.3125, "learning_rate": 4.52024601518041e-05, "loss": 1.0645797729492188, "mean_token_accuracy": 0.7547138769179582, "num_tokens": 29247899.0, "step": 14800 }, { "entropy": 1.0694452792406082, "epoch": 0.424215516377125, "grad_norm": 8.9375, "learning_rate": 4.5195736019674526e-05, "loss": 1.1007006645202637, "mean_token_accuracy": 0.7442386582493782, "num_tokens": 29267602.0, "step": 14810 }, { "entropy": 1.0794659662991761, "epoch": 0.4245019549432136, "grad_norm": 7.53125, "learning_rate": 4.5189007679507425e-05, "loss": 1.1236899375915528, "mean_token_accuracy": 0.7348720226436853, "num_tokens": 29287942.0, "step": 14820 }, { "entropy": 1.0388847889378667, "epoch": 0.4247883935093021, "grad_norm": 6.65625, "learning_rate": 4.5182275132704734e-05, "loss": 1.0027976989746095, "mean_token_accuracy": 0.7654800366610288, "num_tokens": 29308119.0, "step": 14830 }, { "entropy": 1.0781768810003995, "epoch": 0.42507483207539065, "grad_norm": 5.9375, "learning_rate": 4.517553838066927e-05, "loss": 1.086453914642334, "mean_token_accuracy": 0.7575242344290019, "num_tokens": 29328206.0, "step": 14840 }, { "entropy": 1.143109680339694, "epoch": 0.42536127064147916, "grad_norm": 7.0, "learning_rate": 4.516879742480472e-05, "loss": 1.132544994354248, "mean_token_accuracy": 0.7425146870315075, "num_tokens": 29347227.0, "step": 14850 }, { "entropy": 1.07180531360209, "epoch": 0.4256477092075677, "grad_norm": 6.96875, "learning_rate": 4.516205226651565e-05, "loss": 1.074058723449707, "mean_token_accuracy": 0.7563571959733963, "num_tokens": 29367095.0, "step": 14860 }, { "entropy": 1.032476819679141, "epoch": 0.42593414777365624, "grad_norm": 7.59375, "learning_rate": 4.5155302907207506e-05, "loss": 1.0436034202575684, "mean_token_accuracy": 0.7617127224802971, "num_tokens": 29386991.0, "step": 14870 }, { "entropy": 1.0833059215918184, "epoch": 0.4262205863397448, "grad_norm": 8.875, "learning_rate": 4.514854934828658e-05, "loss": 1.1080145835876465, "mean_token_accuracy": 0.73960369117558, "num_tokens": 29407421.0, "step": 14880 }, { "entropy": 1.1081771060824395, "epoch": 0.4265070249058333, "grad_norm": 7.25, "learning_rate": 4.514179159116009e-05, "loss": 1.1386964797973633, "mean_token_accuracy": 0.7572002671658993, "num_tokens": 29426083.0, "step": 14890 }, { "entropy": 1.1161217886954546, "epoch": 0.4267934634719219, "grad_norm": 6.40625, "learning_rate": 4.513502963723607e-05, "loss": 1.1227438926696778, "mean_token_accuracy": 0.7454619942232966, "num_tokens": 29446027.0, "step": 14900 }, { "entropy": 0.9543903714045883, "epoch": 0.4270799020380104, "grad_norm": 6.15625, "learning_rate": 4.512826348792348e-05, "loss": 0.9860871315002442, "mean_token_accuracy": 0.769321646168828, "num_tokens": 29466195.0, "step": 14910 }, { "entropy": 1.0968077659606934, "epoch": 0.42736634060409895, "grad_norm": 8.0, "learning_rate": 4.5121493144632135e-05, "loss": 1.1625382423400878, "mean_token_accuracy": 0.73244525231421, "num_tokens": 29486788.0, "step": 14920 }, { "entropy": 1.1832200549542904, "epoch": 0.42765277917018746, "grad_norm": 7.03125, "learning_rate": 4.51147186087727e-05, "loss": 1.1919404983520507, "mean_token_accuracy": 0.728359953686595, "num_tokens": 29507523.0, "step": 14930 }, { "entropy": 1.0534551033750177, "epoch": 0.427939217736276, "grad_norm": 10.3125, "learning_rate": 4.510793988175677e-05, "loss": 1.0887598991394043, "mean_token_accuracy": 0.743910102546215, "num_tokens": 29525157.0, "step": 14940 }, { "entropy": 1.0579757260158658, "epoch": 0.42822565630236453, "grad_norm": 7.875, "learning_rate": 4.510115696499674e-05, "loss": 1.0850719451904296, "mean_token_accuracy": 0.747008890658617, "num_tokens": 29546302.0, "step": 14950 }, { "entropy": 1.1311715003103018, "epoch": 0.4285120948684531, "grad_norm": 10.3125, "learning_rate": 4.509436985990594e-05, "loss": 1.0996333122253419, "mean_token_accuracy": 0.7537644896656275, "num_tokens": 29567035.0, "step": 14960 }, { "entropy": 1.215819674730301, "epoch": 0.4287985334345416, "grad_norm": 7.4375, "learning_rate": 4.508757856789855e-05, "loss": 1.2629762649536134, "mean_token_accuracy": 0.7203603371977806, "num_tokens": 29586620.0, "step": 14970 }, { "entropy": 1.1624621389433742, "epoch": 0.42908497200063017, "grad_norm": 7.40625, "learning_rate": 4.508078309038961e-05, "loss": 1.1572059631347655, "mean_token_accuracy": 0.7274450678378344, "num_tokens": 29607864.0, "step": 14980 }, { "entropy": 1.1626730516552926, "epoch": 0.4293714105667187, "grad_norm": 6.75, "learning_rate": 4.507398342879504e-05, "loss": 1.2038818359375, "mean_token_accuracy": 0.7258980434387923, "num_tokens": 29628504.0, "step": 14990 }, { "entropy": 1.0758032567799092, "epoch": 0.42965784913280725, "grad_norm": 9.8125, "learning_rate": 4.506717958453166e-05, "loss": 1.1038790702819825, "mean_token_accuracy": 0.7464543301612139, "num_tokens": 29647000.0, "step": 15000 }, { "entropy": 1.1332037437707185, "epoch": 0.42994428769889576, "grad_norm": 9.125, "learning_rate": 4.5060371559017114e-05, "loss": 1.1060691833496095, "mean_token_accuracy": 0.7363989561796188, "num_tokens": 29667260.0, "step": 15010 }, { "entropy": 1.10912319496274, "epoch": 0.4302307262649843, "grad_norm": 6.53125, "learning_rate": 4.505355935366996e-05, "loss": 1.0906852722167968, "mean_token_accuracy": 0.7517189957201481, "num_tokens": 29686707.0, "step": 15020 }, { "entropy": 1.2027821194380521, "epoch": 0.43051716483107283, "grad_norm": 9.0, "learning_rate": 4.504674296990958e-05, "loss": 1.2429282188415527, "mean_token_accuracy": 0.7236607603728771, "num_tokens": 29707171.0, "step": 15030 }, { "entropy": 1.0220236087217927, "epoch": 0.4308036033971614, "grad_norm": 9.0, "learning_rate": 4.5039922409156286e-05, "loss": 1.06076021194458, "mean_token_accuracy": 0.7550806157290936, "num_tokens": 29726276.0, "step": 15040 }, { "entropy": 1.2244989149272443, "epoch": 0.43109004196324996, "grad_norm": 9.375, "learning_rate": 4.50330976728312e-05, "loss": 1.2870461463928222, "mean_token_accuracy": 0.7204246643930674, "num_tokens": 29744871.0, "step": 15050 }, { "entropy": 1.2958453392609954, "epoch": 0.43137648052933847, "grad_norm": 7.125, "learning_rate": 4.502626876235637e-05, "loss": 1.2524999618530273, "mean_token_accuracy": 0.7216910842806101, "num_tokens": 29764048.0, "step": 15060 }, { "entropy": 1.0974758636206388, "epoch": 0.43166291909542703, "grad_norm": 7.8125, "learning_rate": 4.5019435679154656e-05, "loss": 1.1077496528625488, "mean_token_accuracy": 0.7481275469064712, "num_tokens": 29782919.0, "step": 15070 }, { "entropy": 1.121358971297741, "epoch": 0.43194935766151554, "grad_norm": 7.65625, "learning_rate": 4.501259842464984e-05, "loss": 1.1013365745544434, "mean_token_accuracy": 0.7497428376227617, "num_tokens": 29802801.0, "step": 15080 }, { "entropy": 0.9602189633995295, "epoch": 0.4322357962276041, "grad_norm": 5.96875, "learning_rate": 4.500575700026655e-05, "loss": 0.9573726654052734, "mean_token_accuracy": 0.7794460028409957, "num_tokens": 29822127.0, "step": 15090 }, { "entropy": 1.0065461289137603, "epoch": 0.4325222347936926, "grad_norm": 10.625, "learning_rate": 4.499891140743026e-05, "loss": 1.0011902809143067, "mean_token_accuracy": 0.7781655717641115, "num_tokens": 29841381.0, "step": 15100 }, { "entropy": 1.0659026734530925, "epoch": 0.4328086733597812, "grad_norm": 7.90625, "learning_rate": 4.499206164756736e-05, "loss": 1.1443984031677246, "mean_token_accuracy": 0.747183459252119, "num_tokens": 29861798.0, "step": 15110 }, { "entropy": 1.0250905063003302, "epoch": 0.4330951119258697, "grad_norm": 7.21875, "learning_rate": 4.4985207722105084e-05, "loss": 1.0135614395141601, "mean_token_accuracy": 0.7757460709661246, "num_tokens": 29881747.0, "step": 15120 }, { "entropy": 1.1286430770531297, "epoch": 0.43338155049195826, "grad_norm": 7.71875, "learning_rate": 4.4978349632471516e-05, "loss": 1.2127219200134278, "mean_token_accuracy": 0.7387678675353527, "num_tokens": 29901623.0, "step": 15130 }, { "entropy": 1.1300976606085897, "epoch": 0.43366798905804677, "grad_norm": 6.34375, "learning_rate": 4.497148738009563e-05, "loss": 1.188997459411621, "mean_token_accuracy": 0.7400190435349941, "num_tokens": 29921964.0, "step": 15140 }, { "entropy": 1.1537324644625186, "epoch": 0.43395442762413533, "grad_norm": 6.15625, "learning_rate": 4.496462096640729e-05, "loss": 1.1386261940002442, "mean_token_accuracy": 0.7381569374352693, "num_tokens": 29942664.0, "step": 15150 }, { "entropy": 1.0698983315378428, "epoch": 0.43424086619022384, "grad_norm": 8.125, "learning_rate": 4.495775039283717e-05, "loss": 1.1350852012634278, "mean_token_accuracy": 0.7508077036589385, "num_tokens": 29960934.0, "step": 15160 }, { "entropy": 1.1243393931537866, "epoch": 0.4345273047563124, "grad_norm": 7.4375, "learning_rate": 4.495087566081685e-05, "loss": 1.1545008659362792, "mean_token_accuracy": 0.7400742474943399, "num_tokens": 29980295.0, "step": 15170 }, { "entropy": 1.2673492718487978, "epoch": 0.4348137433224009, "grad_norm": 8.25, "learning_rate": 4.494399677177877e-05, "loss": 1.2707715034484863, "mean_token_accuracy": 0.7222472470253706, "num_tokens": 30000091.0, "step": 15180 }, { "entropy": 1.1011733392253518, "epoch": 0.4351001818884895, "grad_norm": 8.875, "learning_rate": 4.493711372715624e-05, "loss": 1.0820725440979004, "mean_token_accuracy": 0.7496522646397352, "num_tokens": 30019945.0, "step": 15190 }, { "entropy": 1.157320410385728, "epoch": 0.435386620454578, "grad_norm": 7.5, "learning_rate": 4.493022652838341e-05, "loss": 1.1891460418701172, "mean_token_accuracy": 0.7327429216355086, "num_tokens": 30039359.0, "step": 15200 }, { "entropy": 1.1234152719378472, "epoch": 0.43567305902066655, "grad_norm": 9.3125, "learning_rate": 4.492333517689533e-05, "loss": 1.1460776329040527, "mean_token_accuracy": 0.7314617995172739, "num_tokens": 30059358.0, "step": 15210 }, { "entropy": 1.1859248410910368, "epoch": 0.43595949758675506, "grad_norm": 8.625, "learning_rate": 4.491643967412791e-05, "loss": 1.2042438507080078, "mean_token_accuracy": 0.7284146931022406, "num_tokens": 30079940.0, "step": 15220 }, { "entropy": 1.0426985777914524, "epoch": 0.4362459361528436, "grad_norm": 7.90625, "learning_rate": 4.490954002151789e-05, "loss": 1.0594447135925293, "mean_token_accuracy": 0.7542109236121177, "num_tokens": 30100145.0, "step": 15230 }, { "entropy": 1.0687475807964801, "epoch": 0.43653237471893214, "grad_norm": 10.125, "learning_rate": 4.490263622050292e-05, "loss": 1.07454252243042, "mean_token_accuracy": 0.7627817682921887, "num_tokens": 30120956.0, "step": 15240 }, { "entropy": 1.0825959891080856, "epoch": 0.4368188132850207, "grad_norm": 7.78125, "learning_rate": 4.489572827252148e-05, "loss": 1.1304000854492187, "mean_token_accuracy": 0.744031447917223, "num_tokens": 30140803.0, "step": 15250 }, { "entropy": 1.0698766924440861, "epoch": 0.4371052518511092, "grad_norm": 7.71875, "learning_rate": 4.4888816179012946e-05, "loss": 1.0154847145080566, "mean_token_accuracy": 0.7579271428287029, "num_tokens": 30159934.0, "step": 15260 }, { "entropy": 1.0817425351589918, "epoch": 0.4373916904171978, "grad_norm": 10.625, "learning_rate": 4.488189994141753e-05, "loss": 1.1247989654541015, "mean_token_accuracy": 0.7458157822489738, "num_tokens": 30179717.0, "step": 15270 }, { "entropy": 1.1579272992908956, "epoch": 0.4376781289832863, "grad_norm": 8.75, "learning_rate": 4.487497956117631e-05, "loss": 1.2569382667541504, "mean_token_accuracy": 0.7285999849438667, "num_tokens": 30199214.0, "step": 15280 }, { "entropy": 1.2142420245334506, "epoch": 0.43796456754937485, "grad_norm": 8.9375, "learning_rate": 4.486805503973124e-05, "loss": 1.3142725944519043, "mean_token_accuracy": 0.722496236115694, "num_tokens": 30217613.0, "step": 15290 }, { "entropy": 1.1038442328572273, "epoch": 0.43825100611546336, "grad_norm": 6.75, "learning_rate": 4.486112637852514e-05, "loss": 1.0534855842590332, "mean_token_accuracy": 0.7518042106181383, "num_tokens": 30237475.0, "step": 15300 }, { "entropy": 1.0870592888444661, "epoch": 0.4385374446815519, "grad_norm": 8.5625, "learning_rate": 4.4854193579001686e-05, "loss": 1.0699615478515625, "mean_token_accuracy": 0.7499058477580547, "num_tokens": 30258049.0, "step": 15310 }, { "entropy": 1.048794506303966, "epoch": 0.4388238832476405, "grad_norm": 10.125, "learning_rate": 4.48472566426054e-05, "loss": 1.0799086570739747, "mean_token_accuracy": 0.75180993527174, "num_tokens": 30277921.0, "step": 15320 }, { "entropy": 1.0912634551525116, "epoch": 0.439110321813729, "grad_norm": 7.3125, "learning_rate": 4.4840315570781696e-05, "loss": 1.1454171180725097, "mean_token_accuracy": 0.7444148104637861, "num_tokens": 30297088.0, "step": 15330 }, { "entropy": 1.0637216202914714, "epoch": 0.43939676037981756, "grad_norm": 6.9375, "learning_rate": 4.4833370364976815e-05, "loss": 1.0256340980529786, "mean_token_accuracy": 0.7631965607404709, "num_tokens": 30316902.0, "step": 15340 }, { "entropy": 1.0344652894884347, "epoch": 0.4396831989459061, "grad_norm": 8.0625, "learning_rate": 4.48264210266379e-05, "loss": 1.055041790008545, "mean_token_accuracy": 0.7633745796978474, "num_tokens": 30336131.0, "step": 15350 }, { "entropy": 1.0186852632090448, "epoch": 0.43996963751199464, "grad_norm": 8.4375, "learning_rate": 4.481946755721292e-05, "loss": 0.9774246215820312, "mean_token_accuracy": 0.7767384380102158, "num_tokens": 30355607.0, "step": 15360 }, { "entropy": 1.1015155369415879, "epoch": 0.44025607607808315, "grad_norm": 9.5625, "learning_rate": 4.481250995815073e-05, "loss": 1.1176934242248535, "mean_token_accuracy": 0.7486156545579433, "num_tokens": 30375645.0, "step": 15370 }, { "entropy": 1.0753528747707606, "epoch": 0.4405425146441717, "grad_norm": 7.53125, "learning_rate": 4.480554823090102e-05, "loss": 1.0784658432006835, "mean_token_accuracy": 0.7505337476730347, "num_tokens": 30395226.0, "step": 15380 }, { "entropy": 1.0957379538565875, "epoch": 0.4408289532102602, "grad_norm": 8.625, "learning_rate": 4.479858237691435e-05, "loss": 1.15682373046875, "mean_token_accuracy": 0.7315940871834755, "num_tokens": 30414779.0, "step": 15390 }, { "entropy": 1.0562709361314773, "epoch": 0.4411153917763488, "grad_norm": 7.78125, "learning_rate": 4.479161239764217e-05, "loss": 1.0142365455627442, "mean_token_accuracy": 0.762904430180788, "num_tokens": 30433302.0, "step": 15400 }, { "entropy": 1.1158408207818866, "epoch": 0.4414018303424373, "grad_norm": 7.4375, "learning_rate": 4.478463829453674e-05, "loss": 1.133906078338623, "mean_token_accuracy": 0.7498819269239902, "num_tokens": 30452800.0, "step": 15410 }, { "entropy": 1.0397257771342994, "epoch": 0.44168826890852586, "grad_norm": 7.0, "learning_rate": 4.477766006905122e-05, "loss": 1.065294075012207, "mean_token_accuracy": 0.757225688174367, "num_tokens": 30473094.0, "step": 15420 }, { "entropy": 1.1724238276481629, "epoch": 0.44197470747461437, "grad_norm": 8.0625, "learning_rate": 4.47706777226396e-05, "loss": 1.1826380729675292, "mean_token_accuracy": 0.7338803302496671, "num_tokens": 30491937.0, "step": 15430 }, { "entropy": 1.1097569966688752, "epoch": 0.44226114604070293, "grad_norm": 7.90625, "learning_rate": 4.4763691256756735e-05, "loss": 1.1232279777526855, "mean_token_accuracy": 0.7510500632226467, "num_tokens": 30511667.0, "step": 15440 }, { "entropy": 1.0903748935088515, "epoch": 0.44254758460679144, "grad_norm": 9.125, "learning_rate": 4.475670067285835e-05, "loss": 1.0526710510253907, "mean_token_accuracy": 0.7502595346421004, "num_tokens": 30533632.0, "step": 15450 }, { "entropy": 1.0366231199353932, "epoch": 0.44283402317288, "grad_norm": 8.625, "learning_rate": 4.474970597240104e-05, "loss": 1.1116233825683595, "mean_token_accuracy": 0.7352092389017344, "num_tokens": 30552860.0, "step": 15460 }, { "entropy": 0.9916391972452402, "epoch": 0.4431204617389685, "grad_norm": 8.25, "learning_rate": 4.47427071568422e-05, "loss": 0.9432309150695801, "mean_token_accuracy": 0.7816601600497961, "num_tokens": 30572287.0, "step": 15470 }, { "entropy": 1.0725778579711913, "epoch": 0.4434069003050571, "grad_norm": 7.21875, "learning_rate": 4.473570422764016e-05, "loss": 1.200136947631836, "mean_token_accuracy": 0.7336394723504782, "num_tokens": 30590746.0, "step": 15480 }, { "entropy": 1.1194538097828626, "epoch": 0.4436933388711456, "grad_norm": 7.625, "learning_rate": 4.472869718625405e-05, "loss": 1.1669986724853516, "mean_token_accuracy": 0.7356421247124671, "num_tokens": 30611022.0, "step": 15490 }, { "entropy": 1.2160000964999198, "epoch": 0.44397977743723416, "grad_norm": 8.1875, "learning_rate": 4.4721686034143875e-05, "loss": 1.2622747421264648, "mean_token_accuracy": 0.7339814633131028, "num_tokens": 30631123.0, "step": 15500 }, { "entropy": 1.0182258801534771, "epoch": 0.44426621600332267, "grad_norm": 6.96875, "learning_rate": 4.471467077277051e-05, "loss": 1.0076227188110352, "mean_token_accuracy": 0.7585625186562538, "num_tokens": 30650365.0, "step": 15510 }, { "entropy": 1.0845182720571755, "epoch": 0.44455265456941123, "grad_norm": 7.875, "learning_rate": 4.470765140359566e-05, "loss": 1.0863000869750976, "mean_token_accuracy": 0.7452656861394644, "num_tokens": 30670054.0, "step": 15520 }, { "entropy": 1.1078708942979574, "epoch": 0.44483909313549974, "grad_norm": 7.8125, "learning_rate": 4.470062792808191e-05, "loss": 1.081822395324707, "mean_token_accuracy": 0.7502869699150324, "num_tokens": 30689560.0, "step": 15530 }, { "entropy": 1.0245083846151828, "epoch": 0.4451255317015883, "grad_norm": 9.4375, "learning_rate": 4.4693600347692675e-05, "loss": 1.0078306198120117, "mean_token_accuracy": 0.7596205219626426, "num_tokens": 30709145.0, "step": 15540 }, { "entropy": 1.0145925169810652, "epoch": 0.4454119702676768, "grad_norm": 8.75, "learning_rate": 4.468656866389226e-05, "loss": 1.0326231002807618, "mean_token_accuracy": 0.7633627243340015, "num_tokens": 30727833.0, "step": 15550 }, { "entropy": 1.0818233244121074, "epoch": 0.4456984088337654, "grad_norm": 8.25, "learning_rate": 4.4679532878145794e-05, "loss": 1.1350409507751464, "mean_token_accuracy": 0.7313998382538557, "num_tokens": 30749073.0, "step": 15560 }, { "entropy": 1.0278082424774766, "epoch": 0.4459848473998539, "grad_norm": 9.0, "learning_rate": 4.467249299191928e-05, "loss": 1.0461588859558106, "mean_token_accuracy": 0.7661760602146387, "num_tokens": 30769654.0, "step": 15570 }, { "entropy": 1.1154366530478002, "epoch": 0.44627128596594245, "grad_norm": 6.375, "learning_rate": 4.466544900667955e-05, "loss": 1.1709959030151367, "mean_token_accuracy": 0.7346567582339049, "num_tokens": 30789471.0, "step": 15580 }, { "entropy": 0.9800055850297212, "epoch": 0.446557724532031, "grad_norm": 8.375, "learning_rate": 4.465840092389433e-05, "loss": 0.9925732612609863, "mean_token_accuracy": 0.762231070175767, "num_tokens": 30808159.0, "step": 15590 }, { "entropy": 1.1259382989257574, "epoch": 0.44684416309811953, "grad_norm": 7.71875, "learning_rate": 4.4651348745032164e-05, "loss": 1.2082551956176757, "mean_token_accuracy": 0.7326127052307129, "num_tokens": 30827978.0, "step": 15600 }, { "entropy": 1.0815007980912923, "epoch": 0.4471306016642081, "grad_norm": 7.875, "learning_rate": 4.464429247156245e-05, "loss": 1.103219985961914, "mean_token_accuracy": 0.7470836568623781, "num_tokens": 30846309.0, "step": 15610 }, { "entropy": 1.1303607407957315, "epoch": 0.4474170402302966, "grad_norm": 7.34375, "learning_rate": 4.463723210495549e-05, "loss": 1.0471221923828125, "mean_token_accuracy": 0.7606925543397665, "num_tokens": 30866289.0, "step": 15620 }, { "entropy": 1.1047875422984361, "epoch": 0.44770347879638517, "grad_norm": 7.3125, "learning_rate": 4.463016764668236e-05, "loss": 1.1855402946472169, "mean_token_accuracy": 0.7292618233710527, "num_tokens": 30886494.0, "step": 15630 }, { "entropy": 0.9306949958205223, "epoch": 0.4479899173624737, "grad_norm": 6.625, "learning_rate": 4.462309909821506e-05, "loss": 0.910073184967041, "mean_token_accuracy": 0.7794380374252796, "num_tokens": 30905209.0, "step": 15640 }, { "entropy": 1.0533215487375855, "epoch": 0.44827635592856224, "grad_norm": 9.0, "learning_rate": 4.461602646102639e-05, "loss": 1.0918192863464355, "mean_token_accuracy": 0.7565400037914515, "num_tokens": 30925848.0, "step": 15650 }, { "entropy": 1.1468591360375284, "epoch": 0.44856279449465075, "grad_norm": 6.15625, "learning_rate": 4.460894973659004e-05, "loss": 1.176361083984375, "mean_token_accuracy": 0.728950684517622, "num_tokens": 30946468.0, "step": 15660 }, { "entropy": 1.0342023156583309, "epoch": 0.4488492330607393, "grad_norm": 9.125, "learning_rate": 4.460186892638053e-05, "loss": 1.0815458297729492, "mean_token_accuracy": 0.7629012949764729, "num_tokens": 30964684.0, "step": 15670 }, { "entropy": 1.10842342749238, "epoch": 0.4491356716268278, "grad_norm": 9.9375, "learning_rate": 4.459478403187323e-05, "loss": 1.0877862930297852, "mean_token_accuracy": 0.7531939174979925, "num_tokens": 30984101.0, "step": 15680 }, { "entropy": 1.1106369998306036, "epoch": 0.4494221101929164, "grad_norm": 12.6875, "learning_rate": 4.4587695054544375e-05, "loss": 1.1306655883789063, "mean_token_accuracy": 0.7482433594763279, "num_tokens": 31004893.0, "step": 15690 }, { "entropy": 1.1490726996213199, "epoch": 0.4497085487590049, "grad_norm": 6.625, "learning_rate": 4.458060199587104e-05, "loss": 1.174320888519287, "mean_token_accuracy": 0.730491679534316, "num_tokens": 31025858.0, "step": 15700 }, { "entropy": 1.1322781743481756, "epoch": 0.44999498732509347, "grad_norm": 7.125, "learning_rate": 4.4573504857331154e-05, "loss": 1.1925125122070312, "mean_token_accuracy": 0.7250677168369293, "num_tokens": 31045091.0, "step": 15710 }, { "entropy": 1.1189708166755736, "epoch": 0.450281425891182, "grad_norm": 8.3125, "learning_rate": 4.45664036404035e-05, "loss": 1.1621577262878418, "mean_token_accuracy": 0.7379273366183042, "num_tokens": 31065992.0, "step": 15720 }, { "entropy": 1.1584448412060737, "epoch": 0.45056786445727054, "grad_norm": 7.5625, "learning_rate": 4.455929834656769e-05, "loss": 1.1830493927001953, "mean_token_accuracy": 0.7414366465061903, "num_tokens": 31085747.0, "step": 15730 }, { "entropy": 0.9814271181821823, "epoch": 0.45085430302335905, "grad_norm": 8.5, "learning_rate": 4.455218897730422e-05, "loss": 0.9263852119445801, "mean_token_accuracy": 0.776156510040164, "num_tokens": 31104876.0, "step": 15740 }, { "entropy": 1.1353449657559396, "epoch": 0.4511407415894476, "grad_norm": 8.4375, "learning_rate": 4.4545075534094416e-05, "loss": 1.1473031044006348, "mean_token_accuracy": 0.7438568361103535, "num_tokens": 31125953.0, "step": 15750 }, { "entropy": 0.9814729139208793, "epoch": 0.4514271801555361, "grad_norm": 7.84375, "learning_rate": 4.4537958018420444e-05, "loss": 1.0090397834777831, "mean_token_accuracy": 0.7663807831704617, "num_tokens": 31145675.0, "step": 15760 }, { "entropy": 1.1864433780312538, "epoch": 0.4517136187216247, "grad_norm": 8.375, "learning_rate": 4.4530836431765344e-05, "loss": 1.1939178466796876, "mean_token_accuracy": 0.7385008133947849, "num_tokens": 31166114.0, "step": 15770 }, { "entropy": 1.1284055178985, "epoch": 0.4520000572877132, "grad_norm": 6.9375, "learning_rate": 4.452371077561297e-05, "loss": 1.1470273017883301, "mean_token_accuracy": 0.7356167893856764, "num_tokens": 31186158.0, "step": 15780 }, { "entropy": 1.109770084451884, "epoch": 0.45228649585380176, "grad_norm": 7.8125, "learning_rate": 4.451658105144805e-05, "loss": 1.1252546310424805, "mean_token_accuracy": 0.7287276841700077, "num_tokens": 31206809.0, "step": 15790 }, { "entropy": 1.016530017927289, "epoch": 0.45257293441989027, "grad_norm": 6.78125, "learning_rate": 4.450944726075616e-05, "loss": 0.9956744194030762, "mean_token_accuracy": 0.7646635144948959, "num_tokens": 31226739.0, "step": 15800 }, { "entropy": 1.155272276699543, "epoch": 0.45285937298597884, "grad_norm": 13.125, "learning_rate": 4.450230940502371e-05, "loss": 1.173872184753418, "mean_token_accuracy": 0.7407504335045815, "num_tokens": 31247238.0, "step": 15810 }, { "entropy": 1.123815843835473, "epoch": 0.45314581155206735, "grad_norm": 7.84375, "learning_rate": 4.449516748573796e-05, "loss": 1.1115382194519043, "mean_token_accuracy": 0.7464274741709233, "num_tokens": 31268326.0, "step": 15820 }, { "entropy": 1.0370233446359634, "epoch": 0.4534322501181559, "grad_norm": 8.25, "learning_rate": 4.448802150438702e-05, "loss": 1.0724099159240723, "mean_token_accuracy": 0.7524797070771456, "num_tokens": 31288438.0, "step": 15830 }, { "entropy": 1.1587765246629715, "epoch": 0.4537186886842444, "grad_norm": 9.375, "learning_rate": 4.448087146245985e-05, "loss": 1.202589225769043, "mean_token_accuracy": 0.7304346699267625, "num_tokens": 31308882.0, "step": 15840 }, { "entropy": 1.0659090556204318, "epoch": 0.454005127250333, "grad_norm": 8.25, "learning_rate": 4.447371736144625e-05, "loss": 1.0883872985839844, "mean_token_accuracy": 0.7527126614004374, "num_tokens": 31328256.0, "step": 15850 }, { "entropy": 1.036961019784212, "epoch": 0.45429156581642155, "grad_norm": 7.96875, "learning_rate": 4.4466559202836866e-05, "loss": 0.9919363021850586, "mean_token_accuracy": 0.7785925008356571, "num_tokens": 31346630.0, "step": 15860 }, { "entropy": 1.1220204528421163, "epoch": 0.45457800438251006, "grad_norm": 8.8125, "learning_rate": 4.44593969881232e-05, "loss": 1.16156005859375, "mean_token_accuracy": 0.7372601218521595, "num_tokens": 31368320.0, "step": 15870 }, { "entropy": 1.1004175113514065, "epoch": 0.4548644429485986, "grad_norm": 7.40625, "learning_rate": 4.445223071879757e-05, "loss": 1.2071547508239746, "mean_token_accuracy": 0.7314198646694422, "num_tokens": 31389337.0, "step": 15880 }, { "entropy": 1.0097388913854957, "epoch": 0.45515088151468713, "grad_norm": 6.125, "learning_rate": 4.444506039635318e-05, "loss": 0.9778777122497558, "mean_token_accuracy": 0.7644600432366133, "num_tokens": 31409687.0, "step": 15890 }, { "entropy": 1.1191555349156261, "epoch": 0.4554373200807757, "grad_norm": 10.5, "learning_rate": 4.4437886022284046e-05, "loss": 1.1028203010559081, "mean_token_accuracy": 0.7389698110520839, "num_tokens": 31428518.0, "step": 15900 }, { "entropy": 1.1299670485779643, "epoch": 0.4557237586468642, "grad_norm": 7.9375, "learning_rate": 4.4430707598085045e-05, "loss": 1.1646889686584472, "mean_token_accuracy": 0.7385070286691189, "num_tokens": 31447881.0, "step": 15910 }, { "entropy": 1.084318339638412, "epoch": 0.4560101972129528, "grad_norm": 9.4375, "learning_rate": 4.442352512525189e-05, "loss": 1.128535556793213, "mean_token_accuracy": 0.7514117076992989, "num_tokens": 31467296.0, "step": 15920 }, { "entropy": 1.0100587390363216, "epoch": 0.4562966357790413, "grad_norm": 8.6875, "learning_rate": 4.4416338605281126e-05, "loss": 1.0301907539367676, "mean_token_accuracy": 0.7658644881099462, "num_tokens": 31487179.0, "step": 15930 }, { "entropy": 1.0156860490329565, "epoch": 0.45658307434512985, "grad_norm": 6.21875, "learning_rate": 4.440914803967019e-05, "loss": 1.0398475646972656, "mean_token_accuracy": 0.7669496171176433, "num_tokens": 31506289.0, "step": 15940 }, { "entropy": 1.02811189442873, "epoch": 0.45686951291121836, "grad_norm": 6.21875, "learning_rate": 4.4401953429917296e-05, "loss": 1.0573338508605956, "mean_token_accuracy": 0.7537104487419128, "num_tokens": 31525665.0, "step": 15950 }, { "entropy": 1.1318390472792088, "epoch": 0.4571559514773069, "grad_norm": 8.875, "learning_rate": 4.439475477752155e-05, "loss": 1.1844322204589843, "mean_token_accuracy": 0.7344266023486853, "num_tokens": 31544162.0, "step": 15960 }, { "entropy": 1.0630007477477192, "epoch": 0.45744239004339543, "grad_norm": 8.375, "learning_rate": 4.438755208398287e-05, "loss": 1.1088850021362304, "mean_token_accuracy": 0.753275141865015, "num_tokens": 31563714.0, "step": 15970 }, { "entropy": 1.0772043531760573, "epoch": 0.457728828609484, "grad_norm": 7.65625, "learning_rate": 4.4380345350802045e-05, "loss": 1.0706336975097657, "mean_token_accuracy": 0.7685126382857561, "num_tokens": 31582692.0, "step": 15980 }, { "entropy": 1.0212453888729214, "epoch": 0.4580152671755725, "grad_norm": 7.34375, "learning_rate": 4.437313457948067e-05, "loss": 1.028015422821045, "mean_token_accuracy": 0.76559530608356, "num_tokens": 31602040.0, "step": 15990 }, { "epoch": 0.45830170574166107, "eval_entropy": 1.095625594496727, "eval_loss": 1.1043692827224731, "eval_mean_token_accuracy": 0.7455817241668701, "eval_num_tokens": 31621760.0, "eval_runtime": 43.2042, "eval_samples_per_second": 46.292, "eval_steps_per_second": 5.786, "step": 16000 }, { "entropy": 0.9860195256769657, "epoch": 0.4585881443077496, "grad_norm": 8.0, "learning_rate": 4.4358700928426965e-05, "loss": 0.9887205123901367, "mean_token_accuracy": 0.7684080444276333, "num_tokens": 31641232.0, "step": 16010 }, { "entropy": 1.155025776475668, "epoch": 0.45887458287383814, "grad_norm": 7.75, "learning_rate": 4.435147805170207e-05, "loss": 1.189784622192383, "mean_token_accuracy": 0.7314405463635921, "num_tokens": 31661901.0, "step": 16020 }, { "entropy": 1.1773955814540387, "epoch": 0.45916102143992665, "grad_norm": 7.3125, "learning_rate": 4.434425114285149e-05, "loss": 1.2892212867736816, "mean_token_accuracy": 0.712294165790081, "num_tokens": 31682431.0, "step": 16030 }, { "entropy": 1.0590716701000928, "epoch": 0.4594474600060152, "grad_norm": 8.6875, "learning_rate": 4.433702020338106e-05, "loss": 0.9952661514282226, "mean_token_accuracy": 0.773939310759306, "num_tokens": 31701945.0, "step": 16040 }, { "entropy": 1.0923929389566183, "epoch": 0.4597338985721037, "grad_norm": 5.25, "learning_rate": 4.432978523479744e-05, "loss": 1.0685754776000977, "mean_token_accuracy": 0.7541909072548151, "num_tokens": 31722788.0, "step": 16050 }, { "entropy": 1.1169374611228704, "epoch": 0.4600203371381923, "grad_norm": 10.875, "learning_rate": 4.432254623860811e-05, "loss": 1.1634275436401367, "mean_token_accuracy": 0.7388406038284302, "num_tokens": 31743735.0, "step": 16060 }, { "entropy": 1.042324186861515, "epoch": 0.4603067757042808, "grad_norm": 7.625, "learning_rate": 4.431530321632143e-05, "loss": 1.0316386222839355, "mean_token_accuracy": 0.7618239607661963, "num_tokens": 31763012.0, "step": 16070 }, { "entropy": 1.0105106366798282, "epoch": 0.46059321427036937, "grad_norm": 9.3125, "learning_rate": 4.4308056169446546e-05, "loss": 1.0378657341003419, "mean_token_accuracy": 0.759275808185339, "num_tokens": 31783147.0, "step": 16080 }, { "entropy": 1.0123815651983024, "epoch": 0.4608796528364579, "grad_norm": 10.3125, "learning_rate": 4.4300805099493494e-05, "loss": 1.0375326156616211, "mean_token_accuracy": 0.7635608714073896, "num_tokens": 31803969.0, "step": 16090 }, { "entropy": 1.0700342457741499, "epoch": 0.46116609140254644, "grad_norm": 6.6875, "learning_rate": 4.4293550007973117e-05, "loss": 1.154991626739502, "mean_token_accuracy": 0.7375030998140574, "num_tokens": 31823862.0, "step": 16100 }, { "entropy": 1.1746778898872434, "epoch": 0.46145252996863495, "grad_norm": 8.125, "learning_rate": 4.428629089639711e-05, "loss": 1.2552621841430665, "mean_token_accuracy": 0.7300440713763237, "num_tokens": 31844345.0, "step": 16110 }, { "entropy": 1.063766848295927, "epoch": 0.4617389685347235, "grad_norm": 6.3125, "learning_rate": 4.4279027766278e-05, "loss": 0.9663609504699707, "mean_token_accuracy": 0.7593142136931419, "num_tokens": 31863625.0, "step": 16120 }, { "entropy": 0.9916869774460793, "epoch": 0.4620254071008121, "grad_norm": 9.6875, "learning_rate": 4.4271760619129154e-05, "loss": 1.0022812843322755, "mean_token_accuracy": 0.7718964867293835, "num_tokens": 31884866.0, "step": 16130 }, { "entropy": 1.1031945832073689, "epoch": 0.4623118456669006, "grad_norm": 8.75, "learning_rate": 4.426448945646477e-05, "loss": 1.1073156356811524, "mean_token_accuracy": 0.7422095578163862, "num_tokens": 31904002.0, "step": 16140 }, { "entropy": 1.060465625859797, "epoch": 0.46259828423298915, "grad_norm": 13.4375, "learning_rate": 4.4257214279799884e-05, "loss": 1.0905183792114257, "mean_token_accuracy": 0.7510077152401209, "num_tokens": 31922522.0, "step": 16150 }, { "entropy": 1.032481526583433, "epoch": 0.46288472279907766, "grad_norm": 7.78125, "learning_rate": 4.424993509065038e-05, "loss": 1.056278896331787, "mean_token_accuracy": 0.760082607343793, "num_tokens": 31944020.0, "step": 16160 }, { "entropy": 1.0038289047777653, "epoch": 0.46317116136516623, "grad_norm": 7.5625, "learning_rate": 4.424265189053296e-05, "loss": 0.9994734764099121, "mean_token_accuracy": 0.7648904416710138, "num_tokens": 31963617.0, "step": 16170 }, { "entropy": 1.1390948429703713, "epoch": 0.46345759993125474, "grad_norm": 9.0, "learning_rate": 4.423536468096519e-05, "loss": 1.1763582229614258, "mean_token_accuracy": 0.7386130318045616, "num_tokens": 31983962.0, "step": 16180 }, { "entropy": 1.1356624189764262, "epoch": 0.4637440384973433, "grad_norm": 8.75, "learning_rate": 4.4228073463465424e-05, "loss": 1.138768482208252, "mean_token_accuracy": 0.7386961799114943, "num_tokens": 32002915.0, "step": 16190 }, { "entropy": 1.1501975405961276, "epoch": 0.4640304770634318, "grad_norm": 7.5625, "learning_rate": 4.422077823955289e-05, "loss": 1.1882719039916991, "mean_token_accuracy": 0.7252085719257593, "num_tokens": 32022696.0, "step": 16200 }, { "entropy": 1.1720309544354677, "epoch": 0.4643169156295204, "grad_norm": 7.21875, "learning_rate": 4.421347901074766e-05, "loss": 1.2030263900756837, "mean_token_accuracy": 0.7324550963938237, "num_tokens": 32042819.0, "step": 16210 }, { "entropy": 1.065559115819633, "epoch": 0.4646033541956089, "grad_norm": 7.71875, "learning_rate": 4.42061757785706e-05, "loss": 1.059134578704834, "mean_token_accuracy": 0.769792552664876, "num_tokens": 32062401.0, "step": 16220 }, { "entropy": 1.0284819804131984, "epoch": 0.46488979276169745, "grad_norm": 5.875, "learning_rate": 4.419886854454343e-05, "loss": 0.993977165222168, "mean_token_accuracy": 0.7713834125548601, "num_tokens": 32080732.0, "step": 16230 }, { "entropy": 1.0163395173847676, "epoch": 0.46517623132778596, "grad_norm": 8.3125, "learning_rate": 4.419155731018872e-05, "loss": 1.0098822593688965, "mean_token_accuracy": 0.7723608791828156, "num_tokens": 32100183.0, "step": 16240 }, { "entropy": 1.016899237036705, "epoch": 0.4654626698938745, "grad_norm": 9.25, "learning_rate": 4.4184242077029845e-05, "loss": 1.0311381340026855, "mean_token_accuracy": 0.7663547594100237, "num_tokens": 32121051.0, "step": 16250 }, { "entropy": 1.0529224690049888, "epoch": 0.46574910845996303, "grad_norm": 9.5625, "learning_rate": 4.417692284659103e-05, "loss": 1.10111665725708, "mean_token_accuracy": 0.7448539096862078, "num_tokens": 32141259.0, "step": 16260 }, { "entropy": 1.0870555348694324, "epoch": 0.4660355470260516, "grad_norm": 6.4375, "learning_rate": 4.416959962039733e-05, "loss": 1.112355613708496, "mean_token_accuracy": 0.7580804407596589, "num_tokens": 32160886.0, "step": 16270 }, { "entropy": 0.9704219080507756, "epoch": 0.4663219855921401, "grad_norm": 5.90625, "learning_rate": 4.4162272399974635e-05, "loss": 0.9465706825256348, "mean_token_accuracy": 0.7803370431065559, "num_tokens": 32181809.0, "step": 16280 }, { "entropy": 1.1362971387803555, "epoch": 0.4666084241582287, "grad_norm": 8.9375, "learning_rate": 4.4154941186849666e-05, "loss": 1.2174898147583009, "mean_token_accuracy": 0.7339811652898789, "num_tokens": 32202112.0, "step": 16290 }, { "entropy": 1.0286120142787696, "epoch": 0.4668948627243172, "grad_norm": 8.1875, "learning_rate": 4.4147605982549956e-05, "loss": 1.0287651062011718, "mean_token_accuracy": 0.7628949638456106, "num_tokens": 32223532.0, "step": 16300 }, { "entropy": 1.048190675675869, "epoch": 0.46718130129040575, "grad_norm": 9.0625, "learning_rate": 4.414026678860391e-05, "loss": 1.0524218559265137, "mean_token_accuracy": 0.7560220587998628, "num_tokens": 32243045.0, "step": 16310 }, { "entropy": 1.019164897315204, "epoch": 0.46746773985649426, "grad_norm": 8.5625, "learning_rate": 4.413292360654073e-05, "loss": 1.0262968063354492, "mean_token_accuracy": 0.7623854793608189, "num_tokens": 32261927.0, "step": 16320 }, { "entropy": 1.037765220925212, "epoch": 0.4677541784225828, "grad_norm": 6.09375, "learning_rate": 4.412557643789047e-05, "loss": 1.0248547554016114, "mean_token_accuracy": 0.7714346315711736, "num_tokens": 32281805.0, "step": 16330 }, { "entropy": 1.1185858346521855, "epoch": 0.46804061698867133, "grad_norm": 8.8125, "learning_rate": 4.4118225284184e-05, "loss": 1.1060708999633788, "mean_token_accuracy": 0.740351352468133, "num_tokens": 32302197.0, "step": 16340 }, { "entropy": 1.0791988208889962, "epoch": 0.4683270555547599, "grad_norm": 6.65625, "learning_rate": 4.411087014695302e-05, "loss": 1.1324837684631348, "mean_token_accuracy": 0.7491525683552027, "num_tokens": 32320842.0, "step": 16350 }, { "entropy": 1.0408789537847043, "epoch": 0.4686134941208484, "grad_norm": 6.625, "learning_rate": 4.410351102773008e-05, "loss": 1.0241211891174316, "mean_token_accuracy": 0.7648175466805697, "num_tokens": 32341103.0, "step": 16360 }, { "entropy": 0.961898205243051, "epoch": 0.46889993268693697, "grad_norm": 8.875, "learning_rate": 4.409614792804853e-05, "loss": 1.009656047821045, "mean_token_accuracy": 0.7711260125041008, "num_tokens": 32360083.0, "step": 16370 }, { "entropy": 0.9625785581767559, "epoch": 0.4691863712530255, "grad_norm": 5.9375, "learning_rate": 4.408878084944258e-05, "loss": 0.936217212677002, "mean_token_accuracy": 0.7729920975863933, "num_tokens": 32380350.0, "step": 16380 }, { "entropy": 0.9434476662427187, "epoch": 0.46947280981911405, "grad_norm": 8.875, "learning_rate": 4.408140979344724e-05, "loss": 0.984708023071289, "mean_token_accuracy": 0.7744307465851307, "num_tokens": 32400028.0, "step": 16390 }, { "entropy": 1.211448898538947, "epoch": 0.4697592483852026, "grad_norm": 7.375, "learning_rate": 4.407403476159838e-05, "loss": 1.2483889579772949, "mean_token_accuracy": 0.7246389653533697, "num_tokens": 32421388.0, "step": 16400 }, { "entropy": 1.0420224644243716, "epoch": 0.4700456869512911, "grad_norm": 7.59375, "learning_rate": 4.406665575543266e-05, "loss": 1.0778291702270508, "mean_token_accuracy": 0.7510162197053433, "num_tokens": 32439293.0, "step": 16410 }, { "entropy": 1.0927003175020218, "epoch": 0.4703321255173797, "grad_norm": 8.5, "learning_rate": 4.4059272776487615e-05, "loss": 1.1152701377868652, "mean_token_accuracy": 0.7570673380047083, "num_tokens": 32458437.0, "step": 16420 }, { "entropy": 1.1206925608217717, "epoch": 0.4706185640834682, "grad_norm": 7.90625, "learning_rate": 4.4051885826301555e-05, "loss": 1.083002758026123, "mean_token_accuracy": 0.7551890447735786, "num_tokens": 32477903.0, "step": 16430 }, { "entropy": 0.9830199084244668, "epoch": 0.47090500264955676, "grad_norm": 7.6875, "learning_rate": 4.404449490641367e-05, "loss": 1.006961727142334, "mean_token_accuracy": 0.7652568735182286, "num_tokens": 32496927.0, "step": 16440 }, { "entropy": 1.0167738554999233, "epoch": 0.47119144121564527, "grad_norm": 6.46875, "learning_rate": 4.403710001836393e-05, "loss": 1.0323945999145507, "mean_token_accuracy": 0.7582252528518438, "num_tokens": 32517507.0, "step": 16450 }, { "entropy": 1.0693297531455754, "epoch": 0.47147787978173383, "grad_norm": 7.25, "learning_rate": 4.402970116369317e-05, "loss": 1.0309248924255372, "mean_token_accuracy": 0.7591683093458415, "num_tokens": 32537100.0, "step": 16460 }, { "entropy": 1.100159036554396, "epoch": 0.47176431834782234, "grad_norm": 9.8125, "learning_rate": 4.402229834394302e-05, "loss": 1.0949154853820802, "mean_token_accuracy": 0.7535491392016411, "num_tokens": 32556238.0, "step": 16470 }, { "entropy": 0.9910267256200314, "epoch": 0.4720507569139109, "grad_norm": 5.5625, "learning_rate": 4.4014891560655966e-05, "loss": 1.0019682884216308, "mean_token_accuracy": 0.7625079181045293, "num_tokens": 32576767.0, "step": 16480 }, { "entropy": 1.0701827768236398, "epoch": 0.4723371954799994, "grad_norm": 12.875, "learning_rate": 4.4007480815375294e-05, "loss": 1.0903682708740234, "mean_token_accuracy": 0.7553587462753057, "num_tokens": 32595311.0, "step": 16490 }, { "entropy": 1.0541426962241531, "epoch": 0.472623634046088, "grad_norm": 6.0, "learning_rate": 4.400006610964514e-05, "loss": 1.0682659149169922, "mean_token_accuracy": 0.7575784578919411, "num_tokens": 32615959.0, "step": 16500 }, { "entropy": 1.0715593788772821, "epoch": 0.4729100726121765, "grad_norm": 9.6875, "learning_rate": 4.3992647445010434e-05, "loss": 0.9990396499633789, "mean_token_accuracy": 0.7640746839344501, "num_tokens": 32636768.0, "step": 16510 }, { "entropy": 0.9712622296065092, "epoch": 0.47319651117826506, "grad_norm": 5.15625, "learning_rate": 4.398522482301697e-05, "loss": 0.9884244918823242, "mean_token_accuracy": 0.7592273127287626, "num_tokens": 32655691.0, "step": 16520 }, { "entropy": 0.9805742347612977, "epoch": 0.47348294974435357, "grad_norm": 9.25, "learning_rate": 4.397779824521132e-05, "loss": 1.0709027290344237, "mean_token_accuracy": 0.7572538528591395, "num_tokens": 32673670.0, "step": 16530 }, { "entropy": 1.035470288991928, "epoch": 0.47376938831044213, "grad_norm": 8.4375, "learning_rate": 4.397036771314092e-05, "loss": 1.047757625579834, "mean_token_accuracy": 0.7669108416885138, "num_tokens": 32695630.0, "step": 16540 }, { "entropy": 0.9915830597281456, "epoch": 0.47405582687653064, "grad_norm": 9.6875, "learning_rate": 4.3962933228354034e-05, "loss": 1.0023653030395507, "mean_token_accuracy": 0.7671206422150135, "num_tokens": 32715304.0, "step": 16550 }, { "entropy": 0.9150912884622813, "epoch": 0.4743422654426192, "grad_norm": 9.625, "learning_rate": 4.39554947923997e-05, "loss": 0.8819180488586426, "mean_token_accuracy": 0.7916360713541508, "num_tokens": 32734383.0, "step": 16560 }, { "entropy": 0.9643123431131244, "epoch": 0.4746287040087077, "grad_norm": 6.71875, "learning_rate": 4.394805240682782e-05, "loss": 0.9794898986816406, "mean_token_accuracy": 0.7702979065477848, "num_tokens": 32753341.0, "step": 16570 }, { "entropy": 1.0536919809877872, "epoch": 0.4749151425747963, "grad_norm": 6.5625, "learning_rate": 4.394060607318911e-05, "loss": 1.0409936904907227, "mean_token_accuracy": 0.757367143779993, "num_tokens": 32773065.0, "step": 16580 }, { "entropy": 1.0067381033673883, "epoch": 0.4752015811408848, "grad_norm": 8.75, "learning_rate": 4.393315579303511e-05, "loss": 1.0525212287902832, "mean_token_accuracy": 0.7602097991853952, "num_tokens": 32793785.0, "step": 16590 }, { "entropy": 1.0108564496040344, "epoch": 0.47548801970697335, "grad_norm": 7.71875, "learning_rate": 4.3925701567918184e-05, "loss": 1.0344018936157227, "mean_token_accuracy": 0.7682503521442413, "num_tokens": 32813155.0, "step": 16600 }, { "entropy": 0.9619921205565334, "epoch": 0.47577445827306186, "grad_norm": 9.125, "learning_rate": 4.391824339939151e-05, "loss": 1.00352201461792, "mean_token_accuracy": 0.7671362828463316, "num_tokens": 32833528.0, "step": 16610 }, { "entropy": 1.0515707001090049, "epoch": 0.4760608968391504, "grad_norm": 7.6875, "learning_rate": 4.391078128900909e-05, "loss": 1.0090611457824707, "mean_token_accuracy": 0.7649975664913654, "num_tokens": 32855153.0, "step": 16620 }, { "entropy": 0.9998664915561676, "epoch": 0.47634733540523894, "grad_norm": 8.375, "learning_rate": 4.3903315238325755e-05, "loss": 1.0471282005310059, "mean_token_accuracy": 0.770268089696765, "num_tokens": 32875204.0, "step": 16630 }, { "entropy": 1.080232111737132, "epoch": 0.4766337739713275, "grad_norm": 7.65625, "learning_rate": 4.3895845248897146e-05, "loss": 1.1180587768554688, "mean_token_accuracy": 0.7468327790498733, "num_tokens": 32893853.0, "step": 16640 }, { "entropy": 1.0761520275846124, "epoch": 0.476920212537416, "grad_norm": 7.34375, "learning_rate": 4.388837132227973e-05, "loss": 1.0993581771850587, "mean_token_accuracy": 0.7479993399232626, "num_tokens": 32913272.0, "step": 16650 }, { "entropy": 0.9716217651963234, "epoch": 0.4772066511035046, "grad_norm": 9.0625, "learning_rate": 4.388089346003079e-05, "loss": 0.9898581504821777, "mean_token_accuracy": 0.7654787879437208, "num_tokens": 32933194.0, "step": 16660 }, { "entropy": 1.0171740382909775, "epoch": 0.47749308966959314, "grad_norm": 8.5625, "learning_rate": 4.387341166370845e-05, "loss": 1.0169093132019043, "mean_token_accuracy": 0.7633578985929489, "num_tokens": 32952794.0, "step": 16670 }, { "entropy": 1.002915321663022, "epoch": 0.47777952823568165, "grad_norm": 8.25, "learning_rate": 4.3865925934871624e-05, "loss": 1.0122275352478027, "mean_token_accuracy": 0.755439879372716, "num_tokens": 32972208.0, "step": 16680 }, { "entropy": 1.0085969856008887, "epoch": 0.4780659668017702, "grad_norm": 7.875, "learning_rate": 4.3858436275080054e-05, "loss": 1.041721248626709, "mean_token_accuracy": 0.7611064448952675, "num_tokens": 32992165.0, "step": 16690 }, { "entropy": 0.9909197997301817, "epoch": 0.4783524053678587, "grad_norm": 8.25, "learning_rate": 4.3850942685894326e-05, "loss": 0.9252277374267578, "mean_token_accuracy": 0.768148074671626, "num_tokens": 33012145.0, "step": 16700 }, { "entropy": 0.9755357466638088, "epoch": 0.4786388439339473, "grad_norm": 7.375, "learning_rate": 4.3843445168875795e-05, "loss": 0.9919824600219727, "mean_token_accuracy": 0.7660184435546398, "num_tokens": 33031648.0, "step": 16710 }, { "entropy": 1.0443235857412219, "epoch": 0.4789252825000358, "grad_norm": 8.625, "learning_rate": 4.383594372558669e-05, "loss": 1.0170072555541991, "mean_token_accuracy": 0.7575950171798468, "num_tokens": 33052487.0, "step": 16720 }, { "entropy": 1.0474604623392225, "epoch": 0.47921172106612436, "grad_norm": 9.3125, "learning_rate": 4.3828438357590015e-05, "loss": 1.1549976348876954, "mean_token_accuracy": 0.7388071183115243, "num_tokens": 33071151.0, "step": 16730 }, { "entropy": 0.9586014881730079, "epoch": 0.4794981596322129, "grad_norm": 7.84375, "learning_rate": 4.382092906644961e-05, "loss": 0.988189697265625, "mean_token_accuracy": 0.7776207908987999, "num_tokens": 33090915.0, "step": 16740 }, { "entropy": 1.1069232895970345, "epoch": 0.47978459819830144, "grad_norm": 9.0, "learning_rate": 4.381341585373014e-05, "loss": 1.0873683929443358, "mean_token_accuracy": 0.7427266146987677, "num_tokens": 33110927.0, "step": 16750 }, { "entropy": 1.1065772384405137, "epoch": 0.48007103676438995, "grad_norm": 9.5, "learning_rate": 4.380589872099708e-05, "loss": 1.1303060531616211, "mean_token_accuracy": 0.7345760636031627, "num_tokens": 33130558.0, "step": 16760 }, { "entropy": 0.9561706442385912, "epoch": 0.4803574753304785, "grad_norm": 9.25, "learning_rate": 4.3798377669816715e-05, "loss": 0.9489264488220215, "mean_token_accuracy": 0.7789783325046301, "num_tokens": 33149793.0, "step": 16770 }, { "entropy": 0.9976607786491514, "epoch": 0.480643913896567, "grad_norm": 5.53125, "learning_rate": 4.379085270175614e-05, "loss": 1.0097550392150878, "mean_token_accuracy": 0.7661747455596923, "num_tokens": 33170110.0, "step": 16780 }, { "entropy": 1.0032922867685556, "epoch": 0.4809303524626556, "grad_norm": 8.3125, "learning_rate": 4.378332381838329e-05, "loss": 1.0375161170959473, "mean_token_accuracy": 0.7576687451452017, "num_tokens": 33189818.0, "step": 16790 }, { "entropy": 1.0627506069839001, "epoch": 0.4812167910287441, "grad_norm": 8.25, "learning_rate": 4.377579102126691e-05, "loss": 1.1434754371643066, "mean_token_accuracy": 0.7500649422407151, "num_tokens": 33209724.0, "step": 16800 }, { "entropy": 0.985107010602951, "epoch": 0.48150322959483266, "grad_norm": 8.9375, "learning_rate": 4.376825431197653e-05, "loss": 0.9973355293273926, "mean_token_accuracy": 0.7671806927770376, "num_tokens": 33229700.0, "step": 16810 }, { "entropy": 0.993674466572702, "epoch": 0.48178966816092117, "grad_norm": 9.5, "learning_rate": 4.376071369208253e-05, "loss": 1.018948745727539, "mean_token_accuracy": 0.7718550018966198, "num_tokens": 33248992.0, "step": 16820 }, { "entropy": 1.0256044575944543, "epoch": 0.48207610672700973, "grad_norm": 6.59375, "learning_rate": 4.375316916315612e-05, "loss": 0.980533504486084, "mean_token_accuracy": 0.7829587046056986, "num_tokens": 33270149.0, "step": 16830 }, { "entropy": 1.1083214286714793, "epoch": 0.48236254529309824, "grad_norm": 7.25, "learning_rate": 4.3745620726769256e-05, "loss": 1.1307127952575684, "mean_token_accuracy": 0.7472021080553531, "num_tokens": 33290780.0, "step": 16840 }, { "entropy": 0.9201938167214394, "epoch": 0.4826489838591868, "grad_norm": 8.3125, "learning_rate": 4.373806838449478e-05, "loss": 0.8909637451171875, "mean_token_accuracy": 0.785581337660551, "num_tokens": 33310849.0, "step": 16850 }, { "entropy": 1.0885490491054952, "epoch": 0.4829354224252753, "grad_norm": 7.9375, "learning_rate": 4.373051213790629e-05, "loss": 1.1084395408630372, "mean_token_accuracy": 0.7535569231957198, "num_tokens": 33330989.0, "step": 16860 }, { "entropy": 1.071072907745838, "epoch": 0.4832218609913639, "grad_norm": 7.71875, "learning_rate": 4.372295198857826e-05, "loss": 1.1154266357421876, "mean_token_accuracy": 0.7369588062167167, "num_tokens": 33352445.0, "step": 16870 }, { "entropy": 1.103079878166318, "epoch": 0.4835082995574524, "grad_norm": 9.5625, "learning_rate": 4.371538793808592e-05, "loss": 1.1553272247314452, "mean_token_accuracy": 0.7345395524054765, "num_tokens": 33372442.0, "step": 16880 }, { "entropy": 0.9715333161875606, "epoch": 0.48379473812354096, "grad_norm": 8.75, "learning_rate": 4.3707819988005346e-05, "loss": 0.9788935661315918, "mean_token_accuracy": 0.7683930456638336, "num_tokens": 33390521.0, "step": 16890 }, { "entropy": 0.9345890924334526, "epoch": 0.48408117668962947, "grad_norm": 7.71875, "learning_rate": 4.370024813991341e-05, "loss": 0.926908016204834, "mean_token_accuracy": 0.7792803592979908, "num_tokens": 33409438.0, "step": 16900 }, { "entropy": 1.0284394092857838, "epoch": 0.48436761525571803, "grad_norm": 6.78125, "learning_rate": 4.36926723953878e-05, "loss": 1.0752223014831543, "mean_token_accuracy": 0.751723089069128, "num_tokens": 33428484.0, "step": 16910 }, { "entropy": 1.0472633289173245, "epoch": 0.48465405382180654, "grad_norm": 7.5, "learning_rate": 4.368509275600703e-05, "loss": 1.052652931213379, "mean_token_accuracy": 0.7590388901531696, "num_tokens": 33448426.0, "step": 16920 }, { "entropy": 1.072967306524515, "epoch": 0.4849404923878951, "grad_norm": 7.34375, "learning_rate": 4.3677509223350406e-05, "loss": 1.0929318428039552, "mean_token_accuracy": 0.7458045918494463, "num_tokens": 33468472.0, "step": 16930 }, { "entropy": 1.0414020497351886, "epoch": 0.48522693095398367, "grad_norm": 7.46875, "learning_rate": 4.366992179899805e-05, "loss": 1.0008486747741698, "mean_token_accuracy": 0.767263027280569, "num_tokens": 33488239.0, "step": 16940 }, { "entropy": 1.0647817399352788, "epoch": 0.4855133695200722, "grad_norm": 7.75, "learning_rate": 4.366233048453091e-05, "loss": 1.0782719612121583, "mean_token_accuracy": 0.758022814244032, "num_tokens": 33508509.0, "step": 16950 }, { "entropy": 0.9815584300085902, "epoch": 0.48579980808616074, "grad_norm": 7.0, "learning_rate": 4.365473528153072e-05, "loss": 1.015487003326416, "mean_token_accuracy": 0.7724594675004482, "num_tokens": 33528425.0, "step": 16960 }, { "entropy": 1.0222778972238302, "epoch": 0.48608624665224925, "grad_norm": 8.5625, "learning_rate": 4.364713619158004e-05, "loss": 1.0497114181518554, "mean_token_accuracy": 0.7550367487594485, "num_tokens": 33549355.0, "step": 16970 }, { "entropy": 1.0406492583453655, "epoch": 0.4863726852183378, "grad_norm": 6.8125, "learning_rate": 4.363953321626224e-05, "loss": 1.1019960403442384, "mean_token_accuracy": 0.7563046537339687, "num_tokens": 33569055.0, "step": 16980 }, { "entropy": 1.0000797294080257, "epoch": 0.48665912378442633, "grad_norm": 9.0, "learning_rate": 4.3631926357161494e-05, "loss": 0.9749500274658203, "mean_token_accuracy": 0.7699035588651896, "num_tokens": 33589169.0, "step": 16990 }, { "entropy": 1.194348792731762, "epoch": 0.4869455623505149, "grad_norm": 8.875, "learning_rate": 4.362431561586279e-05, "loss": 1.2443226814270019, "mean_token_accuracy": 0.7174331754446029, "num_tokens": 33610259.0, "step": 17000 }, { "entropy": 0.924548857472837, "epoch": 0.4872320009166034, "grad_norm": 6.75, "learning_rate": 4.361670099395192e-05, "loss": 0.9259262084960938, "mean_token_accuracy": 0.7841747581958771, "num_tokens": 33629443.0, "step": 17010 }, { "entropy": 1.1185907673090696, "epoch": 0.48751843948269197, "grad_norm": 10.5, "learning_rate": 4.3609082493015486e-05, "loss": 1.1625787734985351, "mean_token_accuracy": 0.7360367476940155, "num_tokens": 33648652.0, "step": 17020 }, { "entropy": 1.0880159426480531, "epoch": 0.4878048780487805, "grad_norm": 5.65625, "learning_rate": 4.3601460114640905e-05, "loss": 1.0699710845947266, "mean_token_accuracy": 0.7604692164808512, "num_tokens": 33667495.0, "step": 17030 }, { "entropy": 1.0287564408034087, "epoch": 0.48809131661486904, "grad_norm": 6.8125, "learning_rate": 4.3593833860416386e-05, "loss": 1.0119543075561523, "mean_token_accuracy": 0.7653553612530232, "num_tokens": 33686875.0, "step": 17040 }, { "entropy": 0.9676519716158509, "epoch": 0.48837775518095755, "grad_norm": 7.75, "learning_rate": 4.358620373193096e-05, "loss": 1.002499485015869, "mean_token_accuracy": 0.7622711818665266, "num_tokens": 33707062.0, "step": 17050 }, { "entropy": 0.9931231487542391, "epoch": 0.4886641937470461, "grad_norm": 7.25, "learning_rate": 4.357856973077447e-05, "loss": 1.031269645690918, "mean_token_accuracy": 0.7662841275334358, "num_tokens": 33727415.0, "step": 17060 }, { "entropy": 0.99451689645648, "epoch": 0.4889506323131346, "grad_norm": 7.28125, "learning_rate": 4.357093185853754e-05, "loss": 0.998592472076416, "mean_token_accuracy": 0.7713192895054817, "num_tokens": 33746744.0, "step": 17070 }, { "entropy": 0.9768349003046751, "epoch": 0.4892370708792232, "grad_norm": 5.9375, "learning_rate": 4.356329011681164e-05, "loss": 1.0129617691040038, "mean_token_accuracy": 0.7762565024197101, "num_tokens": 33766178.0, "step": 17080 }, { "entropy": 1.0487086234614253, "epoch": 0.4895235094453117, "grad_norm": 8.5625, "learning_rate": 4.3555644507189e-05, "loss": 1.0835046768188477, "mean_token_accuracy": 0.7636639304459095, "num_tokens": 33786407.0, "step": 17090 }, { "entropy": 1.1217915868386625, "epoch": 0.48980994801140026, "grad_norm": 8.625, "learning_rate": 4.354799503126269e-05, "loss": 1.148108959197998, "mean_token_accuracy": 0.7458061631768942, "num_tokens": 33806162.0, "step": 17100 }, { "entropy": 0.9219942964613438, "epoch": 0.4900963865774888, "grad_norm": 7.0, "learning_rate": 4.354034169062658e-05, "loss": 0.9051288604736328, "mean_token_accuracy": 0.788603700697422, "num_tokens": 33825708.0, "step": 17110 }, { "entropy": 1.132470526173711, "epoch": 0.49038282514357734, "grad_norm": 9.1875, "learning_rate": 4.353268448687534e-05, "loss": 1.1624566078186036, "mean_token_accuracy": 0.7464070305228233, "num_tokens": 33845744.0, "step": 17120 }, { "entropy": 1.0601427786052227, "epoch": 0.49066926370966585, "grad_norm": 6.8125, "learning_rate": 4.3525023421604426e-05, "loss": 1.0351591110229492, "mean_token_accuracy": 0.7563232768326997, "num_tokens": 33864856.0, "step": 17130 }, { "entropy": 1.0103509912267328, "epoch": 0.4909557022757544, "grad_norm": 6.59375, "learning_rate": 4.3517358496410147e-05, "loss": 1.0299256324768067, "mean_token_accuracy": 0.7625603768974543, "num_tokens": 33884640.0, "step": 17140 }, { "entropy": 1.1366069884970784, "epoch": 0.4912421408418429, "grad_norm": 7.875, "learning_rate": 4.350968971288957e-05, "loss": 1.0999591827392579, "mean_token_accuracy": 0.7496421072632075, "num_tokens": 33904084.0, "step": 17150 }, { "entropy": 1.040277023985982, "epoch": 0.4915285794079315, "grad_norm": 9.75, "learning_rate": 4.350201707264058e-05, "loss": 1.0827797889709472, "mean_token_accuracy": 0.7595674704760313, "num_tokens": 33922737.0, "step": 17160 }, { "entropy": 0.9458992199972271, "epoch": 0.49181501797402, "grad_norm": 6.96875, "learning_rate": 4.349434057726188e-05, "loss": 0.9751693725585937, "mean_token_accuracy": 0.7761420492082834, "num_tokens": 33941159.0, "step": 17170 }, { "entropy": 1.0709429727867246, "epoch": 0.49210145654010856, "grad_norm": 10.8125, "learning_rate": 4.348666022835297e-05, "loss": 1.0812703132629395, "mean_token_accuracy": 0.7573617920279503, "num_tokens": 33960162.0, "step": 17180 }, { "entropy": 1.1367273677140475, "epoch": 0.49238789510619707, "grad_norm": 10.9375, "learning_rate": 4.3478976027514126e-05, "loss": 1.1629722595214844, "mean_token_accuracy": 0.7320704910904169, "num_tokens": 33981917.0, "step": 17190 }, { "entropy": 1.0175492121838032, "epoch": 0.49267433367228564, "grad_norm": 9.75, "learning_rate": 4.3471287976346475e-05, "loss": 1.0513174057006835, "mean_token_accuracy": 0.7539138633757829, "num_tokens": 34000439.0, "step": 17200 }, { "entropy": 1.0400999519973992, "epoch": 0.4929607722383742, "grad_norm": 8.75, "learning_rate": 4.34635960764519e-05, "loss": 1.0125757217407227, "mean_token_accuracy": 0.7581253346055746, "num_tokens": 34020019.0, "step": 17210 }, { "entropy": 1.1167758348397911, "epoch": 0.4932472108044627, "grad_norm": 7.59375, "learning_rate": 4.34559003294331e-05, "loss": 1.1307131767272949, "mean_token_accuracy": 0.7458459671586752, "num_tokens": 34039914.0, "step": 17220 }, { "entropy": 1.0591639783233404, "epoch": 0.4935336493705513, "grad_norm": 7.6875, "learning_rate": 4.344820073689361e-05, "loss": 1.1296196937561036, "mean_token_accuracy": 0.7466318164020777, "num_tokens": 34060611.0, "step": 17230 }, { "entropy": 1.0027164427563549, "epoch": 0.4938200879366398, "grad_norm": 6.3125, "learning_rate": 4.344049730043771e-05, "loss": 0.9870219230651855, "mean_token_accuracy": 0.7641301296651364, "num_tokens": 34079949.0, "step": 17240 }, { "entropy": 1.1063085883855819, "epoch": 0.49410652650272835, "grad_norm": 10.1875, "learning_rate": 4.3432790021670526e-05, "loss": 1.0862249374389648, "mean_token_accuracy": 0.747665136307478, "num_tokens": 34098360.0, "step": 17250 }, { "entropy": 0.9360519904643297, "epoch": 0.49439296506881686, "grad_norm": 8.5625, "learning_rate": 4.342507890219796e-05, "loss": 0.9213293075561524, "mean_token_accuracy": 0.7864279914647341, "num_tokens": 34116974.0, "step": 17260 }, { "entropy": 0.9939828582108021, "epoch": 0.4946794036349054, "grad_norm": 9.0, "learning_rate": 4.341736394362672e-05, "loss": 1.0747446060180663, "mean_token_accuracy": 0.7556054197251797, "num_tokens": 34136181.0, "step": 17270 }, { "entropy": 1.0795869410037995, "epoch": 0.49496584220099393, "grad_norm": 9.8125, "learning_rate": 4.340964514756433e-05, "loss": 1.1161347389221192, "mean_token_accuracy": 0.7463672518730163, "num_tokens": 34155948.0, "step": 17280 }, { "entropy": 0.9304128894582391, "epoch": 0.4952522807670825, "grad_norm": 6.125, "learning_rate": 4.340192251561907e-05, "loss": 0.9230742454528809, "mean_token_accuracy": 0.7848080396652222, "num_tokens": 34175331.0, "step": 17290 }, { "entropy": 0.9416028181090951, "epoch": 0.495538719333171, "grad_norm": 11.1875, "learning_rate": 4.3394196049400074e-05, "loss": 0.954836654663086, "mean_token_accuracy": 0.7780571576207876, "num_tokens": 34195328.0, "step": 17300 }, { "entropy": 1.0265587870031596, "epoch": 0.49582515789925957, "grad_norm": 7.25, "learning_rate": 4.3386465750517236e-05, "loss": 0.9978179931640625, "mean_token_accuracy": 0.7697482436895371, "num_tokens": 34215761.0, "step": 17310 }, { "entropy": 1.0152923617511989, "epoch": 0.4961115964653481, "grad_norm": 8.125, "learning_rate": 4.337873162058127e-05, "loss": 1.0142152786254883, "mean_token_accuracy": 0.7607778094708919, "num_tokens": 34235850.0, "step": 17320 }, { "entropy": 1.0235864974558353, "epoch": 0.49639803503143665, "grad_norm": 8.375, "learning_rate": 4.337099366120367e-05, "loss": 1.0215274810791015, "mean_token_accuracy": 0.7588078200817108, "num_tokens": 34255831.0, "step": 17330 }, { "entropy": 0.9520710717886687, "epoch": 0.49668447359752516, "grad_norm": 5.6875, "learning_rate": 4.336325187399675e-05, "loss": 0.9275893211364746, "mean_token_accuracy": 0.7845791764557362, "num_tokens": 34275446.0, "step": 17340 }, { "entropy": 0.9020056877285242, "epoch": 0.4969709121636137, "grad_norm": 6.5, "learning_rate": 4.33555062605736e-05, "loss": 0.9286996841430664, "mean_token_accuracy": 0.7855431295931339, "num_tokens": 34294828.0, "step": 17350 }, { "entropy": 0.9784899307414889, "epoch": 0.49725735072970223, "grad_norm": 8.0625, "learning_rate": 4.3347756822548116e-05, "loss": 1.0615654945373536, "mean_token_accuracy": 0.7579973589628934, "num_tokens": 34314617.0, "step": 17360 }, { "entropy": 1.0217004781588912, "epoch": 0.4975437892957908, "grad_norm": 8.0625, "learning_rate": 4.3340003561535e-05, "loss": 1.105919361114502, "mean_token_accuracy": 0.7594532150775194, "num_tokens": 34334508.0, "step": 17370 }, { "entropy": 1.0695177033543586, "epoch": 0.4978302278618793, "grad_norm": 8.375, "learning_rate": 4.333224647914974e-05, "loss": 1.0597644805908204, "mean_token_accuracy": 0.7598655015230179, "num_tokens": 34354657.0, "step": 17380 }, { "entropy": 1.0236263621598483, "epoch": 0.49811666642796787, "grad_norm": 8.8125, "learning_rate": 4.332448557700862e-05, "loss": 1.0609212875366212, "mean_token_accuracy": 0.7695693500339985, "num_tokens": 34373246.0, "step": 17390 }, { "entropy": 1.1627912618219853, "epoch": 0.4984031049940564, "grad_norm": 8.9375, "learning_rate": 4.331672085672872e-05, "loss": 1.1688899993896484, "mean_token_accuracy": 0.7327989466488362, "num_tokens": 34393682.0, "step": 17400 }, { "entropy": 1.046683468669653, "epoch": 0.49868954356014494, "grad_norm": 7.25, "learning_rate": 4.330895231992792e-05, "loss": 1.0652215957641602, "mean_token_accuracy": 0.7527300979942083, "num_tokens": 34413753.0, "step": 17410 }, { "entropy": 1.0162945104762913, "epoch": 0.49897598212623345, "grad_norm": 7.40625, "learning_rate": 4.33011799682249e-05, "loss": 1.0226430892944336, "mean_token_accuracy": 0.7654198616743088, "num_tokens": 34434791.0, "step": 17420 }, { "entropy": 0.9305351061746479, "epoch": 0.499262420692322, "grad_norm": 6.09375, "learning_rate": 4.329340380323912e-05, "loss": 0.919261360168457, "mean_token_accuracy": 0.7803567554801702, "num_tokens": 34454707.0, "step": 17430 }, { "entropy": 1.0351398844271897, "epoch": 0.4995488592584105, "grad_norm": 5.90625, "learning_rate": 4.328562382659084e-05, "loss": 1.0107476234436035, "mean_token_accuracy": 0.7676677696406842, "num_tokens": 34474284.0, "step": 17440 }, { "entropy": 0.9402934342622757, "epoch": 0.4998352978244991, "grad_norm": 6.34375, "learning_rate": 4.327784003990111e-05, "loss": 0.9410077095031738, "mean_token_accuracy": 0.7842558763921261, "num_tokens": 34494972.0, "step": 17450 }, { "entropy": 1.0047647509723903, "epoch": 0.5001217363905877, "grad_norm": 10.4375, "learning_rate": 4.3270052444791806e-05, "loss": 1.041771411895752, "mean_token_accuracy": 0.7594370882958174, "num_tokens": 34513960.0, "step": 17460 }, { "entropy": 1.0515913940966128, "epoch": 0.5004081749566762, "grad_norm": 7.21875, "learning_rate": 4.326226104288556e-05, "loss": 1.095116424560547, "mean_token_accuracy": 0.7581000730395318, "num_tokens": 34533912.0, "step": 17470 }, { "entropy": 0.9887978391721844, "epoch": 0.5006946135227647, "grad_norm": 9.75, "learning_rate": 4.325446583580579e-05, "loss": 1.016411590576172, "mean_token_accuracy": 0.7673349156975746, "num_tokens": 34552350.0, "step": 17480 }, { "entropy": 1.0526997491717338, "epoch": 0.5009810520888532, "grad_norm": 7.0625, "learning_rate": 4.324666682517676e-05, "loss": 1.1005334854125977, "mean_token_accuracy": 0.7466001737862825, "num_tokens": 34572192.0, "step": 17490 }, { "entropy": 1.0093298159539699, "epoch": 0.5012674906549418, "grad_norm": 7.90625, "learning_rate": 4.3238864012623466e-05, "loss": 0.9956887245178223, "mean_token_accuracy": 0.7835841689258813, "num_tokens": 34590951.0, "step": 17500 }, { "entropy": 1.0219703314825892, "epoch": 0.5015539292210304, "grad_norm": 6.5625, "learning_rate": 4.323105739977174e-05, "loss": 0.9741621017456055, "mean_token_accuracy": 0.7731606539338827, "num_tokens": 34611442.0, "step": 17510 }, { "entropy": 1.1547549776732922, "epoch": 0.5018403677871188, "grad_norm": 8.125, "learning_rate": 4.322324698824817e-05, "loss": 1.1710846900939942, "mean_token_accuracy": 0.7453276500105858, "num_tokens": 34631767.0, "step": 17520 }, { "entropy": 1.0507111344486475, "epoch": 0.5021268063532074, "grad_norm": 6.34375, "learning_rate": 4.321543277968017e-05, "loss": 1.0411754608154298, "mean_token_accuracy": 0.7710024759173393, "num_tokens": 34652588.0, "step": 17530 }, { "entropy": 1.0625345608219505, "epoch": 0.502413244919296, "grad_norm": 7.9375, "learning_rate": 4.320761477569593e-05, "loss": 1.087254524230957, "mean_token_accuracy": 0.7561471063643694, "num_tokens": 34673214.0, "step": 17540 }, { "entropy": 0.9144243970513344, "epoch": 0.5026996834853845, "grad_norm": 6.8125, "learning_rate": 4.319979297792441e-05, "loss": 0.9437449455261231, "mean_token_accuracy": 0.7817872405052185, "num_tokens": 34691758.0, "step": 17550 }, { "entropy": 1.0869301464408636, "epoch": 0.502986122051473, "grad_norm": 9.125, "learning_rate": 4.3191967387995414e-05, "loss": 1.0893980026245118, "mean_token_accuracy": 0.7469348337501287, "num_tokens": 34711913.0, "step": 17560 }, { "entropy": 1.0717716068029404, "epoch": 0.5032725606175615, "grad_norm": 7.78125, "learning_rate": 4.318413800753948e-05, "loss": 1.0915319442749023, "mean_token_accuracy": 0.7577225595712662, "num_tokens": 34732512.0, "step": 17570 }, { "entropy": 1.0140634212642907, "epoch": 0.5035589991836501, "grad_norm": 6.84375, "learning_rate": 4.317630483818795e-05, "loss": 1.0183159828186035, "mean_token_accuracy": 0.7603402189910412, "num_tokens": 34751350.0, "step": 17580 }, { "entropy": 0.9538967240601778, "epoch": 0.5038454377497387, "grad_norm": 7.4375, "learning_rate": 4.3168467881572994e-05, "loss": 0.9289972305297851, "mean_token_accuracy": 0.782543795928359, "num_tokens": 34769879.0, "step": 17590 }, { "entropy": 0.9489595484919846, "epoch": 0.5041318763158271, "grad_norm": 7.28125, "learning_rate": 4.3160627139327516e-05, "loss": 0.9711180686950683, "mean_token_accuracy": 0.7739598851650953, "num_tokens": 34788562.0, "step": 17600 }, { "entropy": 0.9910988450050354, "epoch": 0.5044183148819157, "grad_norm": 5.75, "learning_rate": 4.315278261308524e-05, "loss": 0.9780125617980957, "mean_token_accuracy": 0.7693098466843367, "num_tokens": 34808318.0, "step": 17610 }, { "entropy": 1.0139494251459837, "epoch": 0.5047047534480043, "grad_norm": 7.1875, "learning_rate": 4.314493430448068e-05, "loss": 1.0652266502380372, "mean_token_accuracy": 0.7596605405211448, "num_tokens": 34827889.0, "step": 17620 }, { "entropy": 0.9520850958302617, "epoch": 0.5049911920140928, "grad_norm": 6.875, "learning_rate": 4.313708221514913e-05, "loss": 0.9847989082336426, "mean_token_accuracy": 0.758737226948142, "num_tokens": 34847778.0, "step": 17630 }, { "entropy": 1.0981547605246305, "epoch": 0.5052776305801813, "grad_norm": 9.8125, "learning_rate": 4.312922634672666e-05, "loss": 1.1687585830688476, "mean_token_accuracy": 0.7389815121889114, "num_tokens": 34868321.0, "step": 17640 }, { "entropy": 1.101518685556948, "epoch": 0.5055640691462698, "grad_norm": 8.25, "learning_rate": 4.312136670085014e-05, "loss": 1.1061275482177735, "mean_token_accuracy": 0.7636947996914387, "num_tokens": 34887196.0, "step": 17650 }, { "entropy": 0.9973408224061131, "epoch": 0.5058505077123584, "grad_norm": 10.25, "learning_rate": 4.3113503279157246e-05, "loss": 0.9970702171325684, "mean_token_accuracy": 0.7693190291523934, "num_tokens": 34906891.0, "step": 17660 }, { "entropy": 0.9564379110932351, "epoch": 0.506136946278447, "grad_norm": 6.21875, "learning_rate": 4.3105636083286406e-05, "loss": 0.9570234298706055, "mean_token_accuracy": 0.7727764241397381, "num_tokens": 34926739.0, "step": 17670 }, { "entropy": 1.0849061015993358, "epoch": 0.5064233848445354, "grad_norm": 5.65625, "learning_rate": 4.309776511487686e-05, "loss": 1.1154269218444823, "mean_token_accuracy": 0.7550651457160711, "num_tokens": 34947443.0, "step": 17680 }, { "entropy": 1.007785512506962, "epoch": 0.506709823410624, "grad_norm": 6.46875, "learning_rate": 4.308989037556861e-05, "loss": 1.0166417121887208, "mean_token_accuracy": 0.7633139368146657, "num_tokens": 34967785.0, "step": 17690 }, { "entropy": 1.004833035171032, "epoch": 0.5069962619767125, "grad_norm": 8.5, "learning_rate": 4.308201186700247e-05, "loss": 0.9917290687561036, "mean_token_accuracy": 0.7624304544180631, "num_tokens": 34987961.0, "step": 17700 }, { "entropy": 0.9888427097350359, "epoch": 0.5072827005428011, "grad_norm": 10.8125, "learning_rate": 4.3074129590820023e-05, "loss": 0.9698850631713867, "mean_token_accuracy": 0.774132190272212, "num_tokens": 35008150.0, "step": 17710 }, { "entropy": 0.959241671487689, "epoch": 0.5075691391088896, "grad_norm": 7.09375, "learning_rate": 4.306624354866363e-05, "loss": 0.9847854614257813, "mean_token_accuracy": 0.764955461770296, "num_tokens": 35027845.0, "step": 17720 }, { "entropy": 0.9634015871211886, "epoch": 0.5078555776749781, "grad_norm": 7.9375, "learning_rate": 4.3058353742176474e-05, "loss": 0.9786049842834472, "mean_token_accuracy": 0.7781175464391709, "num_tokens": 35047439.0, "step": 17730 }, { "entropy": 0.8689752431586385, "epoch": 0.5081420162410667, "grad_norm": 6.53125, "learning_rate": 4.305046017300247e-05, "loss": 0.8946043014526367, "mean_token_accuracy": 0.7936122681945562, "num_tokens": 35066446.0, "step": 17740 }, { "entropy": 1.0056325759738685, "epoch": 0.5084284548071553, "grad_norm": 6.8125, "learning_rate": 4.304256284278636e-05, "loss": 0.9554845809936523, "mean_token_accuracy": 0.7830309756100178, "num_tokens": 35085881.0, "step": 17750 }, { "entropy": 1.0537802072241902, "epoch": 0.5087148933732438, "grad_norm": 7.1875, "learning_rate": 4.303466175317364e-05, "loss": 1.0887016296386718, "mean_token_accuracy": 0.7583649516105652, "num_tokens": 35106967.0, "step": 17760 }, { "entropy": 1.054859310016036, "epoch": 0.5090013319393323, "grad_norm": 9.3125, "learning_rate": 4.3026756905810616e-05, "loss": 1.060797119140625, "mean_token_accuracy": 0.7545307252556086, "num_tokens": 35125277.0, "step": 17770 }, { "entropy": 0.9801409143954516, "epoch": 0.5092877705054208, "grad_norm": 7.28125, "learning_rate": 4.301884830234435e-05, "loss": 1.0073978424072265, "mean_token_accuracy": 0.7772514838725328, "num_tokens": 35143882.0, "step": 17780 }, { "entropy": 0.9958844879642129, "epoch": 0.5095742090715094, "grad_norm": 8.9375, "learning_rate": 4.3010935944422716e-05, "loss": 1.0302217483520508, "mean_token_accuracy": 0.7519188895821571, "num_tokens": 35164005.0, "step": 17790 }, { "entropy": 1.0014954233542084, "epoch": 0.509860647637598, "grad_norm": 7.53125, "learning_rate": 4.300301983369433e-05, "loss": 0.9801791191101075, "mean_token_accuracy": 0.7741680897772312, "num_tokens": 35183950.0, "step": 17800 }, { "entropy": 1.1163689505308867, "epoch": 0.5101470862036864, "grad_norm": 7.75, "learning_rate": 4.2995099971808634e-05, "loss": 1.1756239891052247, "mean_token_accuracy": 0.7412028018385172, "num_tokens": 35205061.0, "step": 17810 }, { "entropy": 0.9667664352804423, "epoch": 0.510433524769775, "grad_norm": 7.375, "learning_rate": 4.298717636041583e-05, "loss": 0.9746028900146484, "mean_token_accuracy": 0.7753890853375196, "num_tokens": 35225069.0, "step": 17820 }, { "entropy": 1.1080086616799236, "epoch": 0.5107199633358636, "grad_norm": 9.0, "learning_rate": 4.297924900116689e-05, "loss": 1.1493899345397949, "mean_token_accuracy": 0.7486542209982872, "num_tokens": 35244995.0, "step": 17830 }, { "entropy": 1.088213350251317, "epoch": 0.5110064019019521, "grad_norm": 10.0, "learning_rate": 4.297131789571359e-05, "loss": 1.1243632316589356, "mean_token_accuracy": 0.7373803712427616, "num_tokens": 35263682.0, "step": 17840 }, { "entropy": 0.9457804903388023, "epoch": 0.5112928404680406, "grad_norm": 7.9375, "learning_rate": 4.296338304570847e-05, "loss": 0.911676025390625, "mean_token_accuracy": 0.78768520206213, "num_tokens": 35282774.0, "step": 17850 }, { "entropy": 0.9700626829639077, "epoch": 0.5115792790341291, "grad_norm": 8.6875, "learning_rate": 4.295544445280487e-05, "loss": 0.9432881355285645, "mean_token_accuracy": 0.7733259946107864, "num_tokens": 35301524.0, "step": 17860 }, { "entropy": 1.0470176629722119, "epoch": 0.5118657176002177, "grad_norm": 6.71875, "learning_rate": 4.294750211865688e-05, "loss": 1.0479962348937988, "mean_token_accuracy": 0.7583012700080871, "num_tokens": 35320391.0, "step": 17870 }, { "entropy": 0.9766532107256353, "epoch": 0.5121521561663063, "grad_norm": 7.09375, "learning_rate": 4.29395560449194e-05, "loss": 0.9733241081237793, "mean_token_accuracy": 0.7783255320042372, "num_tokens": 35340401.0, "step": 17880 }, { "entropy": 0.9712235554121434, "epoch": 0.5124385947323947, "grad_norm": 7.3125, "learning_rate": 4.293160623324809e-05, "loss": 0.9993261337280274, "mean_token_accuracy": 0.773225960880518, "num_tokens": 35360345.0, "step": 17890 }, { "entropy": 0.8779443107545376, "epoch": 0.5127250332984833, "grad_norm": 6.375, "learning_rate": 4.2923652685299384e-05, "loss": 0.8596323013305665, "mean_token_accuracy": 0.7955453231930733, "num_tokens": 35380408.0, "step": 17900 }, { "entropy": 0.974922115728259, "epoch": 0.5130114718645719, "grad_norm": 5.9375, "learning_rate": 4.2915695402730515e-05, "loss": 0.9548707962036133, "mean_token_accuracy": 0.7789561577141285, "num_tokens": 35399306.0, "step": 17910 }, { "entropy": 0.9605494774878025, "epoch": 0.5132979104306604, "grad_norm": 8.0625, "learning_rate": 4.2907734387199484e-05, "loss": 0.9792910575866699, "mean_token_accuracy": 0.7734184537082911, "num_tokens": 35419934.0, "step": 17920 }, { "entropy": 0.9569711744785309, "epoch": 0.5135843489967489, "grad_norm": 7.28125, "learning_rate": 4.289976964036506e-05, "loss": 0.9944162368774414, "mean_token_accuracy": 0.7711521308869124, "num_tokens": 35440015.0, "step": 17930 }, { "entropy": 1.0997381042689085, "epoch": 0.5138707875628374, "grad_norm": 6.3125, "learning_rate": 4.289180116388681e-05, "loss": 1.1272847175598144, "mean_token_accuracy": 0.7588967274874449, "num_tokens": 35460865.0, "step": 17940 }, { "entropy": 1.0393663216382265, "epoch": 0.514157226128926, "grad_norm": 8.4375, "learning_rate": 4.2883828959425066e-05, "loss": 1.0994606971740724, "mean_token_accuracy": 0.7392833966761827, "num_tokens": 35480145.0, "step": 17950 }, { "entropy": 1.120609075948596, "epoch": 0.5144436646950146, "grad_norm": 8.0625, "learning_rate": 4.2875853028640934e-05, "loss": 1.1541407585144043, "mean_token_accuracy": 0.7382880769670009, "num_tokens": 35501089.0, "step": 17960 }, { "entropy": 1.0648599294945598, "epoch": 0.514730103261103, "grad_norm": 7.28125, "learning_rate": 4.28678733731963e-05, "loss": 1.002262020111084, "mean_token_accuracy": 0.7615043375641107, "num_tokens": 35521696.0, "step": 17970 }, { "entropy": 0.9882473286241293, "epoch": 0.5150165418271916, "grad_norm": 6.5, "learning_rate": 4.2859889994753836e-05, "loss": 1.0591958045959473, "mean_token_accuracy": 0.7614698220044375, "num_tokens": 35541679.0, "step": 17980 }, { "entropy": 1.0311295229941606, "epoch": 0.5153029803932802, "grad_norm": 5.71875, "learning_rate": 4.285190289497695e-05, "loss": 1.0270458221435548, "mean_token_accuracy": 0.7608290709555149, "num_tokens": 35561678.0, "step": 17990 }, { "entropy": 0.8813514014706015, "epoch": 0.5155894189593687, "grad_norm": 7.71875, "learning_rate": 4.284391207552989e-05, "loss": 0.8853710174560547, "mean_token_accuracy": 0.7864216700196266, "num_tokens": 35581198.0, "step": 18000 }, { "entropy": 1.0528824353590607, "epoch": 0.5158758575254573, "grad_norm": 7.34375, "learning_rate": 4.283591753807763e-05, "loss": 1.0953842163085938, "mean_token_accuracy": 0.7572290316224098, "num_tokens": 35601760.0, "step": 18010 }, { "entropy": 1.0299434075132012, "epoch": 0.5161622960915457, "grad_norm": 5.5625, "learning_rate": 4.2827919284285944e-05, "loss": 1.0040371894836426, "mean_token_accuracy": 0.7689940717071295, "num_tokens": 35622741.0, "step": 18020 }, { "entropy": 0.948230879381299, "epoch": 0.5164487346576343, "grad_norm": 10.1875, "learning_rate": 4.281991731582134e-05, "loss": 0.9695061683654785, "mean_token_accuracy": 0.7651624400168657, "num_tokens": 35643514.0, "step": 18030 }, { "entropy": 1.044832699932158, "epoch": 0.5167351732237229, "grad_norm": 5.09375, "learning_rate": 4.2811911634351166e-05, "loss": 1.1220834732055665, "mean_token_accuracy": 0.7488769918680191, "num_tokens": 35663795.0, "step": 18040 }, { "entropy": 0.9917106911540031, "epoch": 0.5170216117898114, "grad_norm": 6.59375, "learning_rate": 4.2803902241543484e-05, "loss": 0.9732969284057618, "mean_token_accuracy": 0.775698683410883, "num_tokens": 35684563.0, "step": 18050 }, { "entropy": 0.9947383690625429, "epoch": 0.5173080503558999, "grad_norm": 8.6875, "learning_rate": 4.279588913906716e-05, "loss": 1.0314928054809571, "mean_token_accuracy": 0.7632889442145825, "num_tokens": 35704766.0, "step": 18060 }, { "entropy": 0.9774407394230366, "epoch": 0.5175944889219884, "grad_norm": 6.28125, "learning_rate": 4.278787232859183e-05, "loss": 0.9978829383850097, "mean_token_accuracy": 0.7766224015504122, "num_tokens": 35725558.0, "step": 18070 }, { "entropy": 1.1714583218097687, "epoch": 0.517880927488077, "grad_norm": 9.0625, "learning_rate": 4.277985181178789e-05, "loss": 1.1521488189697267, "mean_token_accuracy": 0.7412251070141792, "num_tokens": 35746801.0, "step": 18080 }, { "entropy": 1.139555537328124, "epoch": 0.5181673660541656, "grad_norm": 6.65625, "learning_rate": 4.277182759032652e-05, "loss": 1.160375213623047, "mean_token_accuracy": 0.7425269648432732, "num_tokens": 35768945.0, "step": 18090 }, { "entropy": 1.0504832845181227, "epoch": 0.518453804620254, "grad_norm": 8.625, "learning_rate": 4.2763799665879653e-05, "loss": 1.083017921447754, "mean_token_accuracy": 0.7524487499147654, "num_tokens": 35787334.0, "step": 18100 }, { "entropy": 0.9651131779886782, "epoch": 0.5187402431863426, "grad_norm": 7.1875, "learning_rate": 4.275576804012004e-05, "loss": 1.0056843757629395, "mean_token_accuracy": 0.7749624900519848, "num_tokens": 35808102.0, "step": 18110 }, { "entropy": 1.0091121995821595, "epoch": 0.5190266817524312, "grad_norm": 7.8125, "learning_rate": 4.274773271472115e-05, "loss": 0.9769368171691895, "mean_token_accuracy": 0.7774313103407622, "num_tokens": 35827210.0, "step": 18120 }, { "entropy": 1.0063993139192462, "epoch": 0.5193131203185197, "grad_norm": 8.25, "learning_rate": 4.273969369135725e-05, "loss": 1.0084035873413086, "mean_token_accuracy": 0.7613523133099079, "num_tokens": 35846125.0, "step": 18130 }, { "entropy": 1.0476998765021563, "epoch": 0.5195995588846082, "grad_norm": 11.25, "learning_rate": 4.2731650971703376e-05, "loss": 1.0250536918640136, "mean_token_accuracy": 0.7664006385952234, "num_tokens": 35867176.0, "step": 18140 }, { "entropy": 1.013476044498384, "epoch": 0.5198859974506967, "grad_norm": 11.0625, "learning_rate": 4.272360455743532e-05, "loss": 1.030233669281006, "mean_token_accuracy": 0.7586410600692034, "num_tokens": 35886917.0, "step": 18150 }, { "entropy": 0.9217176243662835, "epoch": 0.5201724360167853, "grad_norm": 7.875, "learning_rate": 4.2715554450229666e-05, "loss": 0.9461106300354004, "mean_token_accuracy": 0.7936211973428726, "num_tokens": 35907845.0, "step": 18160 }, { "entropy": 0.9715134546160697, "epoch": 0.5204588745828739, "grad_norm": 9.5625, "learning_rate": 4.270750065176374e-05, "loss": 1.0033456802368164, "mean_token_accuracy": 0.7736696947366, "num_tokens": 35928257.0, "step": 18170 }, { "entropy": 0.9426901509985328, "epoch": 0.5207453131489623, "grad_norm": 4.71875, "learning_rate": 4.269944316371568e-05, "loss": 0.9362709045410156, "mean_token_accuracy": 0.7752047434449196, "num_tokens": 35950266.0, "step": 18180 }, { "entropy": 0.9634449645876885, "epoch": 0.5210317517150509, "grad_norm": 9.1875, "learning_rate": 4.2691381987764345e-05, "loss": 0.9871819496154786, "mean_token_accuracy": 0.7798014666885138, "num_tokens": 35969149.0, "step": 18190 }, { "entropy": 0.927098448947072, "epoch": 0.5213181902811395, "grad_norm": 8.75, "learning_rate": 4.2683317125589384e-05, "loss": 0.9316041946411133, "mean_token_accuracy": 0.7911450002342463, "num_tokens": 35988402.0, "step": 18200 }, { "entropy": 0.9820064989849925, "epoch": 0.521604628847228, "grad_norm": 8.125, "learning_rate": 4.267524857887122e-05, "loss": 0.9912860870361329, "mean_token_accuracy": 0.7589217390865087, "num_tokens": 36008375.0, "step": 18210 }, { "entropy": 1.061489969305694, "epoch": 0.5218910674133165, "grad_norm": 8.875, "learning_rate": 4.2667176349291035e-05, "loss": 1.0599629402160644, "mean_token_accuracy": 0.7619328621774912, "num_tokens": 36029129.0, "step": 18220 }, { "entropy": 0.9506415290758014, "epoch": 0.522177505979405, "grad_norm": 7.8125, "learning_rate": 4.2659100438530776e-05, "loss": 0.9441619873046875, "mean_token_accuracy": 0.7747184585779905, "num_tokens": 36049270.0, "step": 18230 }, { "entropy": 0.9565562393516303, "epoch": 0.5224639445454936, "grad_norm": 7.65625, "learning_rate": 4.265102084827316e-05, "loss": 0.9955384254455566, "mean_token_accuracy": 0.7661261264234781, "num_tokens": 36070160.0, "step": 18240 }, { "entropy": 0.9518299348652363, "epoch": 0.5227503831115822, "grad_norm": 6.28125, "learning_rate": 4.264293758020169e-05, "loss": 0.9975738525390625, "mean_token_accuracy": 0.7728760436177253, "num_tokens": 36090296.0, "step": 18250 }, { "entropy": 1.0898528631776572, "epoch": 0.5230368216776706, "grad_norm": 10.5, "learning_rate": 4.26348506360006e-05, "loss": 1.0874303817749023, "mean_token_accuracy": 0.7389911904931068, "num_tokens": 36109871.0, "step": 18260 }, { "entropy": 0.9815294438973069, "epoch": 0.5233232602437592, "grad_norm": 9.3125, "learning_rate": 4.2626760017354906e-05, "loss": 0.9133700370788574, "mean_token_accuracy": 0.7874503288418054, "num_tokens": 36130086.0, "step": 18270 }, { "entropy": 0.9049686649814248, "epoch": 0.5236096988098478, "grad_norm": 9.25, "learning_rate": 4.2618665725950404e-05, "loss": 0.9051311492919922, "mean_token_accuracy": 0.779395766928792, "num_tokens": 36148109.0, "step": 18280 }, { "entropy": 1.0278479263186455, "epoch": 0.5238961373759363, "grad_norm": 9.5, "learning_rate": 4.261056776347363e-05, "loss": 1.0871723175048829, "mean_token_accuracy": 0.7575385503470897, "num_tokens": 36167823.0, "step": 18290 }, { "entropy": 1.035915617272258, "epoch": 0.5241825759420249, "grad_norm": 6.875, "learning_rate": 4.2602466131611896e-05, "loss": 1.0602495193481445, "mean_token_accuracy": 0.7688746079802513, "num_tokens": 36188192.0, "step": 18300 }, { "entropy": 1.0230322202667594, "epoch": 0.5244690145081133, "grad_norm": 6.59375, "learning_rate": 4.2594360832053296e-05, "loss": 1.0000368118286134, "mean_token_accuracy": 0.7697128526866436, "num_tokens": 36207249.0, "step": 18310 }, { "entropy": 0.9453598963096738, "epoch": 0.5247554530742019, "grad_norm": 8.375, "learning_rate": 4.258625186648666e-05, "loss": 0.9622668266296387, "mean_token_accuracy": 0.7733538698405027, "num_tokens": 36227975.0, "step": 18320 }, { "entropy": 0.9114329120144248, "epoch": 0.5250418916402905, "grad_norm": 7.6875, "learning_rate": 4.257813923660159e-05, "loss": 0.9374043464660644, "mean_token_accuracy": 0.7840469803661108, "num_tokens": 36246801.0, "step": 18330 }, { "entropy": 1.0108552426099777, "epoch": 0.525328330206379, "grad_norm": 9.3125, "learning_rate": 4.257002294408846e-05, "loss": 1.0148914337158204, "mean_token_accuracy": 0.7724619287997484, "num_tokens": 36264935.0, "step": 18340 }, { "entropy": 0.9624065946787596, "epoch": 0.5256147687724675, "grad_norm": 7.59375, "learning_rate": 4.25619029906384e-05, "loss": 0.9647127151489258, "mean_token_accuracy": 0.7750409301370382, "num_tokens": 36284127.0, "step": 18350 }, { "entropy": 0.8979532336816192, "epoch": 0.525901207338556, "grad_norm": 9.25, "learning_rate": 4.255377937794332e-05, "loss": 0.9485130310058594, "mean_token_accuracy": 0.7733627073466778, "num_tokens": 36304309.0, "step": 18360 }, { "entropy": 0.924005289003253, "epoch": 0.5261876459046446, "grad_norm": 9.375, "learning_rate": 4.254565210769585e-05, "loss": 0.9595027923583984, "mean_token_accuracy": 0.7733161136507988, "num_tokens": 36323623.0, "step": 18370 }, { "entropy": 1.0779311092570425, "epoch": 0.5264740844707332, "grad_norm": 7.25, "learning_rate": 4.253752118158943e-05, "loss": 1.074887752532959, "mean_token_accuracy": 0.7523600362241268, "num_tokens": 36343963.0, "step": 18380 }, { "entropy": 0.9568657351657748, "epoch": 0.5267605230368216, "grad_norm": 6.25, "learning_rate": 4.2529386601318245e-05, "loss": 0.9681062698364258, "mean_token_accuracy": 0.7755594749003649, "num_tokens": 36363446.0, "step": 18390 }, { "entropy": 0.927198201045394, "epoch": 0.5270469616029102, "grad_norm": 6.375, "learning_rate": 4.2521248368577226e-05, "loss": 0.9500542640686035, "mean_token_accuracy": 0.7756378091871738, "num_tokens": 36383431.0, "step": 18400 }, { "entropy": 1.0249531768262385, "epoch": 0.5273334001689988, "grad_norm": 9.3125, "learning_rate": 4.251310648506208e-05, "loss": 1.017384910583496, "mean_token_accuracy": 0.7633178159594536, "num_tokens": 36402698.0, "step": 18410 }, { "entropy": 0.9823536445386708, "epoch": 0.5276198387350873, "grad_norm": 5.75, "learning_rate": 4.250496095246926e-05, "loss": 0.9748650550842285, "mean_token_accuracy": 0.7732032962143421, "num_tokens": 36423221.0, "step": 18420 }, { "entropy": 0.9957347840070725, "epoch": 0.5279062773011758, "grad_norm": 8.3125, "learning_rate": 4.249681177249602e-05, "loss": 1.0128029823303222, "mean_token_accuracy": 0.7662801094353199, "num_tokens": 36444056.0, "step": 18430 }, { "entropy": 0.9218484982848167, "epoch": 0.5281927158672644, "grad_norm": 10.0, "learning_rate": 4.248865894684032e-05, "loss": 0.9279016494750977, "mean_token_accuracy": 0.7783108800649643, "num_tokens": 36465410.0, "step": 18440 }, { "entropy": 0.8914625532925129, "epoch": 0.5284791544333529, "grad_norm": 6.1875, "learning_rate": 4.248050247720091e-05, "loss": 0.9414989471435546, "mean_token_accuracy": 0.7907150596380234, "num_tokens": 36483713.0, "step": 18450 }, { "entropy": 0.8530762501060962, "epoch": 0.5287655929994415, "grad_norm": 7.125, "learning_rate": 4.2472342365277305e-05, "loss": 0.9261279106140137, "mean_token_accuracy": 0.7838302284479142, "num_tokens": 36503705.0, "step": 18460 }, { "entropy": 0.9298483902588487, "epoch": 0.5290520315655299, "grad_norm": 6.59375, "learning_rate": 4.2464178612769755e-05, "loss": 0.9499112129211426, "mean_token_accuracy": 0.7738996341824531, "num_tokens": 36523486.0, "step": 18470 }, { "entropy": 1.034496882930398, "epoch": 0.5293384701316185, "grad_norm": 8.9375, "learning_rate": 4.245601122137928e-05, "loss": 1.0376147270202636, "mean_token_accuracy": 0.7546425886452198, "num_tokens": 36542986.0, "step": 18480 }, { "entropy": 1.0742289628833532, "epoch": 0.5296249086977071, "grad_norm": 8.875, "learning_rate": 4.244784019280768e-05, "loss": 1.068143367767334, "mean_token_accuracy": 0.7624827574938535, "num_tokens": 36561163.0, "step": 18490 }, { "entropy": 0.9775538988411426, "epoch": 0.5299113472637956, "grad_norm": 7.28125, "learning_rate": 4.2439665528757455e-05, "loss": 1.0020852088928223, "mean_token_accuracy": 0.768316762894392, "num_tokens": 36580890.0, "step": 18500 }, { "entropy": 1.0095560170710087, "epoch": 0.5301977858298841, "grad_norm": 6.28125, "learning_rate": 4.243148723093193e-05, "loss": 1.0097763061523437, "mean_token_accuracy": 0.7664507023990155, "num_tokens": 36600801.0, "step": 18510 }, { "entropy": 0.9847262201830744, "epoch": 0.5304842243959726, "grad_norm": 8.25, "learning_rate": 4.2423305301035155e-05, "loss": 1.0043015480041504, "mean_token_accuracy": 0.7763553272932768, "num_tokens": 36621000.0, "step": 18520 }, { "entropy": 0.89938645940274, "epoch": 0.5307706629620612, "grad_norm": 8.75, "learning_rate": 4.241511974077193e-05, "loss": 0.8604474067687988, "mean_token_accuracy": 0.7922192800790071, "num_tokens": 36641716.0, "step": 18530 }, { "entropy": 1.1025999668985604, "epoch": 0.5310571015281498, "grad_norm": 8.0625, "learning_rate": 4.2406930551847824e-05, "loss": 1.141490650177002, "mean_token_accuracy": 0.7465562656521797, "num_tokens": 36661666.0, "step": 18540 }, { "entropy": 0.9981026839464903, "epoch": 0.5313435400942383, "grad_norm": 6.3125, "learning_rate": 4.239873773596915e-05, "loss": 0.9825703620910644, "mean_token_accuracy": 0.7621681142598391, "num_tokens": 36683091.0, "step": 18550 }, { "entropy": 1.089583594724536, "epoch": 0.5316299786603268, "grad_norm": 8.6875, "learning_rate": 4.2390541294843006e-05, "loss": 1.1002711296081542, "mean_token_accuracy": 0.7479295961558818, "num_tokens": 36703983.0, "step": 18560 }, { "entropy": 1.0272770265117288, "epoch": 0.5319164172264154, "grad_norm": 8.375, "learning_rate": 4.23823412301772e-05, "loss": 1.020514965057373, "mean_token_accuracy": 0.7728347435593605, "num_tokens": 36723679.0, "step": 18570 }, { "entropy": 0.9897090133279562, "epoch": 0.5322028557925039, "grad_norm": 13.0625, "learning_rate": 4.2374137543680334e-05, "loss": 1.052346897125244, "mean_token_accuracy": 0.7739234142005443, "num_tokens": 36743396.0, "step": 18580 }, { "entropy": 0.8769473440945148, "epoch": 0.5324892943585925, "grad_norm": 8.1875, "learning_rate": 4.236593023706175e-05, "loss": 0.8517210960388184, "mean_token_accuracy": 0.8023064389824868, "num_tokens": 36761480.0, "step": 18590 }, { "entropy": 0.9887404832988977, "epoch": 0.532775732924681, "grad_norm": 9.875, "learning_rate": 4.235771931203153e-05, "loss": 1.038399887084961, "mean_token_accuracy": 0.748694383725524, "num_tokens": 36782200.0, "step": 18600 }, { "entropy": 0.9543918523937464, "epoch": 0.5330621714907695, "grad_norm": 7.8125, "learning_rate": 4.234950477030054e-05, "loss": 1.0050990104675293, "mean_token_accuracy": 0.7775580734014511, "num_tokens": 36801432.0, "step": 18610 }, { "entropy": 0.9844637623988092, "epoch": 0.5333486100568581, "grad_norm": 7.28125, "learning_rate": 4.2341286613580376e-05, "loss": 0.9462395668029785, "mean_token_accuracy": 0.775806350633502, "num_tokens": 36820482.0, "step": 18620 }, { "entropy": 0.9975185271352529, "epoch": 0.5336350486229466, "grad_norm": 8.5, "learning_rate": 4.23330648435834e-05, "loss": 1.0078046798706055, "mean_token_accuracy": 0.7637744177132845, "num_tokens": 36841022.0, "step": 18630 }, { "entropy": 0.8633401485159993, "epoch": 0.5339214871890351, "grad_norm": 7.09375, "learning_rate": 4.232483946202271e-05, "loss": 0.8383587837219239, "mean_token_accuracy": 0.802937027066946, "num_tokens": 36859389.0, "step": 18640 }, { "entropy": 0.9264299492351711, "epoch": 0.5342079257551237, "grad_norm": 9.875, "learning_rate": 4.231661047061219e-05, "loss": 0.9155117034912109, "mean_token_accuracy": 0.7900910649448634, "num_tokens": 36878149.0, "step": 18650 }, { "entropy": 1.007754699885845, "epoch": 0.5344943643212122, "grad_norm": 9.1875, "learning_rate": 4.230837787106644e-05, "loss": 1.035257911682129, "mean_token_accuracy": 0.7732655949890613, "num_tokens": 36899380.0, "step": 18660 }, { "entropy": 0.9002570047974586, "epoch": 0.5347808028873008, "grad_norm": 5.40625, "learning_rate": 4.230014166510083e-05, "loss": 0.8765363693237305, "mean_token_accuracy": 0.8054404400289059, "num_tokens": 36919593.0, "step": 18670 }, { "entropy": 0.9912328207865357, "epoch": 0.5350672414533892, "grad_norm": 9.8125, "learning_rate": 4.229190185443148e-05, "loss": 1.0469957351684571, "mean_token_accuracy": 0.7630418248474597, "num_tokens": 36939042.0, "step": 18680 }, { "entropy": 1.110708248242736, "epoch": 0.5353536800194778, "grad_norm": 9.5, "learning_rate": 4.228365844077525e-05, "loss": 1.1565019607543945, "mean_token_accuracy": 0.7433866772800684, "num_tokens": 36958277.0, "step": 18690 }, { "entropy": 1.0424179248511791, "epoch": 0.5356401185855664, "grad_norm": 7.15625, "learning_rate": 4.2275411425849774e-05, "loss": 1.0775314331054688, "mean_token_accuracy": 0.754136311635375, "num_tokens": 36977590.0, "step": 18700 }, { "entropy": 1.0898970341309906, "epoch": 0.5359265571516549, "grad_norm": 6.5625, "learning_rate": 4.226716081137341e-05, "loss": 1.0423570632934571, "mean_token_accuracy": 0.7628885980695486, "num_tokens": 36997352.0, "step": 18710 }, { "entropy": 0.9698012646287679, "epoch": 0.5362129957177434, "grad_norm": 6.65625, "learning_rate": 4.225890659906527e-05, "loss": 0.926824951171875, "mean_token_accuracy": 0.7787880446761847, "num_tokens": 37016913.0, "step": 18720 }, { "entropy": 0.9564575517550111, "epoch": 0.536499434283832, "grad_norm": 10.25, "learning_rate": 4.225064879064525e-05, "loss": 0.9458847999572754, "mean_token_accuracy": 0.7774242050945759, "num_tokens": 37036009.0, "step": 18730 }, { "entropy": 0.9452911943197251, "epoch": 0.5367858728499205, "grad_norm": 6.15625, "learning_rate": 4.224238738783395e-05, "loss": 0.9479838371276855, "mean_token_accuracy": 0.7813715692609549, "num_tokens": 37055949.0, "step": 18740 }, { "entropy": 0.8963361142203212, "epoch": 0.5370723114160091, "grad_norm": 7.375, "learning_rate": 4.223412239235274e-05, "loss": 0.9162420272827149, "mean_token_accuracy": 0.8018769826740026, "num_tokens": 37075289.0, "step": 18750 }, { "entropy": 0.9612562710419297, "epoch": 0.5373587499820975, "grad_norm": 5.59375, "learning_rate": 4.2225853805923745e-05, "loss": 1.0085434913635254, "mean_token_accuracy": 0.7756607297807931, "num_tokens": 37097342.0, "step": 18760 }, { "entropy": 0.9166711486876011, "epoch": 0.5376451885481861, "grad_norm": 9.125, "learning_rate": 4.221758163026981e-05, "loss": 0.905830192565918, "mean_token_accuracy": 0.7827754568308591, "num_tokens": 37115293.0, "step": 18770 }, { "entropy": 0.8870739087462425, "epoch": 0.5379316271142747, "grad_norm": 7.03125, "learning_rate": 4.220930586711458e-05, "loss": 0.8888262748718262, "mean_token_accuracy": 0.787341770529747, "num_tokens": 37134709.0, "step": 18780 }, { "entropy": 0.9866439955309033, "epoch": 0.5382180656803632, "grad_norm": 5.5, "learning_rate": 4.220102651818238e-05, "loss": 1.034498405456543, "mean_token_accuracy": 0.7656238980591297, "num_tokens": 37154779.0, "step": 18790 }, { "entropy": 0.9630633728578687, "epoch": 0.5385045042464517, "grad_norm": 8.375, "learning_rate": 4.2192743585198344e-05, "loss": 0.9901782035827636, "mean_token_accuracy": 0.7748003490269184, "num_tokens": 37174711.0, "step": 18800 }, { "entropy": 0.9653576597571373, "epoch": 0.5387909428125403, "grad_norm": 6.09375, "learning_rate": 4.2184457069888314e-05, "loss": 0.9996882438659668, "mean_token_accuracy": 0.769518369063735, "num_tokens": 37194659.0, "step": 18810 }, { "entropy": 0.968729081004858, "epoch": 0.5390773813786288, "grad_norm": 8.0, "learning_rate": 4.217616697397889e-05, "loss": 0.9794042587280274, "mean_token_accuracy": 0.7784108947962523, "num_tokens": 37213539.0, "step": 18820 }, { "entropy": 0.9478037467226386, "epoch": 0.5393638199447174, "grad_norm": 7.65625, "learning_rate": 4.216787329919743e-05, "loss": 0.9019865036010742, "mean_token_accuracy": 0.7855732407420873, "num_tokens": 37232021.0, "step": 18830 }, { "entropy": 0.9927759733051061, "epoch": 0.539650258510806, "grad_norm": 8.25, "learning_rate": 4.215957604727201e-05, "loss": 0.9580434799194336, "mean_token_accuracy": 0.7695677071809769, "num_tokens": 37251113.0, "step": 18840 }, { "entropy": 0.9095350941643119, "epoch": 0.5399366970768944, "grad_norm": 6.9375, "learning_rate": 4.215127521993147e-05, "loss": 0.8837380409240723, "mean_token_accuracy": 0.7993823975324631, "num_tokens": 37270749.0, "step": 18850 }, { "entropy": 0.8933297876268625, "epoch": 0.540223135642983, "grad_norm": 8.3125, "learning_rate": 4.21429708189054e-05, "loss": 0.9428502082824707, "mean_token_accuracy": 0.7757887851446867, "num_tokens": 37290630.0, "step": 18860 }, { "entropy": 0.9630610842257739, "epoch": 0.5405095742090715, "grad_norm": 6.34375, "learning_rate": 4.2134662845924125e-05, "loss": 0.9968518257141114, "mean_token_accuracy": 0.7729216940701008, "num_tokens": 37309595.0, "step": 18870 }, { "entropy": 0.9585330963134766, "epoch": 0.5407960127751601, "grad_norm": 6.09375, "learning_rate": 4.212635130271872e-05, "loss": 0.8919583320617676, "mean_token_accuracy": 0.7935737576335669, "num_tokens": 37328133.0, "step": 18880 }, { "entropy": 0.9751623921096325, "epoch": 0.5410824513412485, "grad_norm": 7.78125, "learning_rate": 4.211803619102099e-05, "loss": 1.0511135101318358, "mean_token_accuracy": 0.7501297175884247, "num_tokens": 37348991.0, "step": 18890 }, { "entropy": 0.8876290641725063, "epoch": 0.5413688899073371, "grad_norm": 7.40625, "learning_rate": 4.210971751256351e-05, "loss": 0.9202899932861328, "mean_token_accuracy": 0.78198076300323, "num_tokens": 37367649.0, "step": 18900 }, { "entropy": 0.9374773848801852, "epoch": 0.5416553284734257, "grad_norm": 9.1875, "learning_rate": 4.210139526907956e-05, "loss": 0.9501521110534668, "mean_token_accuracy": 0.7730865444988012, "num_tokens": 37386187.0, "step": 18910 }, { "entropy": 1.0318306596949696, "epoch": 0.5419417670395142, "grad_norm": 10.25, "learning_rate": 4.2093069462303204e-05, "loss": 1.0163016319274902, "mean_token_accuracy": 0.7591164406388998, "num_tokens": 37404127.0, "step": 18920 }, { "entropy": 1.013629556633532, "epoch": 0.5422282056056027, "grad_norm": 9.5625, "learning_rate": 4.208474009396922e-05, "loss": 1.0392515182495117, "mean_token_accuracy": 0.77359305806458, "num_tokens": 37423667.0, "step": 18930 }, { "entropy": 0.9632765204645694, "epoch": 0.5425146441716913, "grad_norm": 6.34375, "learning_rate": 4.2076407165813145e-05, "loss": 0.9784265518188476, "mean_token_accuracy": 0.78217060752213, "num_tokens": 37443153.0, "step": 18940 }, { "entropy": 0.9851489506661892, "epoch": 0.5428010827377798, "grad_norm": 8.1875, "learning_rate": 4.2068070679571236e-05, "loss": 0.9816110610961915, "mean_token_accuracy": 0.7683041960000991, "num_tokens": 37462492.0, "step": 18950 }, { "entropy": 0.9793066322803498, "epoch": 0.5430875213038684, "grad_norm": 6.21875, "learning_rate": 4.205973063698053e-05, "loss": 1.0025501251220703, "mean_token_accuracy": 0.7545711405575275, "num_tokens": 37481342.0, "step": 18960 }, { "entropy": 0.9695794058963656, "epoch": 0.5433739598699568, "grad_norm": 11.3125, "learning_rate": 4.205138703977875e-05, "loss": 0.9330293655395507, "mean_token_accuracy": 0.7800051450729371, "num_tokens": 37501601.0, "step": 18970 }, { "entropy": 0.9861360523849726, "epoch": 0.5436603984360454, "grad_norm": 8.4375, "learning_rate": 4.2043039889704404e-05, "loss": 1.0017213821411133, "mean_token_accuracy": 0.7645394187420607, "num_tokens": 37521079.0, "step": 18980 }, { "entropy": 0.9288894783705473, "epoch": 0.543946837002134, "grad_norm": 12.5625, "learning_rate": 4.203468918849674e-05, "loss": 0.9886000633239747, "mean_token_accuracy": 0.7773781221359968, "num_tokens": 37541178.0, "step": 18990 }, { "entropy": 0.9507323738187552, "epoch": 0.5442332755682225, "grad_norm": 5.875, "learning_rate": 4.202633493789572e-05, "loss": 0.9986387252807617, "mean_token_accuracy": 0.7629520568996668, "num_tokens": 37560925.0, "step": 19000 }, { "entropy": 0.9584133286029101, "epoch": 0.544519714134311, "grad_norm": 7.9375, "learning_rate": 4.201797713964205e-05, "loss": 0.9792420387268066, "mean_token_accuracy": 0.7746828719973564, "num_tokens": 37579778.0, "step": 19010 }, { "entropy": 1.126902387291193, "epoch": 0.5448061527003996, "grad_norm": 8.4375, "learning_rate": 4.200961579547719e-05, "loss": 1.1250021934509278, "mean_token_accuracy": 0.7491728439927101, "num_tokens": 37599411.0, "step": 19020 }, { "entropy": 0.9646470233798027, "epoch": 0.5450925912664881, "grad_norm": 9.1875, "learning_rate": 4.200125090714334e-05, "loss": 0.9210112571716309, "mean_token_accuracy": 0.7871640287339687, "num_tokens": 37618961.0, "step": 19030 }, { "entropy": 0.9305791702121496, "epoch": 0.5453790298325767, "grad_norm": 10.4375, "learning_rate": 4.1992882476383425e-05, "loss": 0.9539770126342774, "mean_token_accuracy": 0.7653025042265653, "num_tokens": 37637923.0, "step": 19040 }, { "entropy": 1.0297860287129879, "epoch": 0.5456654683986651, "grad_norm": 6.8125, "learning_rate": 4.198451050494111e-05, "loss": 1.0537588119506835, "mean_token_accuracy": 0.7532337259501218, "num_tokens": 37658554.0, "step": 19050 }, { "entropy": 1.0110898189246655, "epoch": 0.5459519069647537, "grad_norm": 8.125, "learning_rate": 4.1976134994560804e-05, "loss": 1.037745761871338, "mean_token_accuracy": 0.7760591752827167, "num_tokens": 37679574.0, "step": 19060 }, { "entropy": 0.9703520519658924, "epoch": 0.5462383455308423, "grad_norm": 8.0625, "learning_rate": 4.1967755946987645e-05, "loss": 0.9784976959228515, "mean_token_accuracy": 0.7692656494677067, "num_tokens": 37699798.0, "step": 19070 }, { "entropy": 0.8735691886395216, "epoch": 0.5465247840969308, "grad_norm": 6.28125, "learning_rate": 4.1959373363967526e-05, "loss": 0.8076004981994629, "mean_token_accuracy": 0.8089750308543444, "num_tokens": 37718769.0, "step": 19080 }, { "entropy": 0.9451670184731483, "epoch": 0.5468112226630194, "grad_norm": 9.3125, "learning_rate": 4.195098724724705e-05, "loss": 0.9979077339172363, "mean_token_accuracy": 0.7636483337730169, "num_tokens": 37738502.0, "step": 19090 }, { "entropy": 0.9564072618260979, "epoch": 0.5470976612291079, "grad_norm": 8.3125, "learning_rate": 4.1942597598573585e-05, "loss": 1.0043194770812989, "mean_token_accuracy": 0.7660236690193415, "num_tokens": 37756768.0, "step": 19100 }, { "entropy": 1.0382267966866494, "epoch": 0.5473840997951964, "grad_norm": 7.53125, "learning_rate": 4.1934204419695223e-05, "loss": 1.1136626243591308, "mean_token_accuracy": 0.7422887045890093, "num_tokens": 37776520.0, "step": 19110 }, { "entropy": 0.9455624375492334, "epoch": 0.547670538361285, "grad_norm": 6.15625, "learning_rate": 4.192580771236076e-05, "loss": 0.9825914382934571, "mean_token_accuracy": 0.7808877781033516, "num_tokens": 37796170.0, "step": 19120 }, { "entropy": 0.9649914403446018, "epoch": 0.5479569769273736, "grad_norm": 9.5625, "learning_rate": 4.1917407478319795e-05, "loss": 0.9664751052856445, "mean_token_accuracy": 0.7780234958976507, "num_tokens": 37815460.0, "step": 19130 }, { "entropy": 1.0194987587630748, "epoch": 0.548243415493462, "grad_norm": 8.0, "learning_rate": 4.1909003719322594e-05, "loss": 1.0122082710266114, "mean_token_accuracy": 0.772532419487834, "num_tokens": 37834789.0, "step": 19140 }, { "entropy": 0.9845464492216707, "epoch": 0.5485298540595506, "grad_norm": 8.5625, "learning_rate": 4.19005964371202e-05, "loss": 0.9775012016296387, "mean_token_accuracy": 0.7709212206304074, "num_tokens": 37853560.0, "step": 19150 }, { "entropy": 1.0180983047932386, "epoch": 0.5488162926256391, "grad_norm": 9.9375, "learning_rate": 4.1892185633464375e-05, "loss": 1.027649211883545, "mean_token_accuracy": 0.7632421582937241, "num_tokens": 37872336.0, "step": 19160 }, { "entropy": 0.9963744878768921, "epoch": 0.5491027311917277, "grad_norm": 8.5625, "learning_rate": 4.188377131010762e-05, "loss": 1.0095620155334473, "mean_token_accuracy": 0.7622698973864317, "num_tokens": 37890658.0, "step": 19170 }, { "entropy": 1.0037853233516216, "epoch": 0.5493891697578162, "grad_norm": 6.0, "learning_rate": 4.187535346880316e-05, "loss": 1.0324936866760255, "mean_token_accuracy": 0.767413829267025, "num_tokens": 37910269.0, "step": 19180 }, { "entropy": 0.9974068082869053, "epoch": 0.5496756083239047, "grad_norm": 8.375, "learning_rate": 4.186693211130495e-05, "loss": 0.9621203422546387, "mean_token_accuracy": 0.7779409468173981, "num_tokens": 37931342.0, "step": 19190 }, { "entropy": 1.0015677127987146, "epoch": 0.5499620468899933, "grad_norm": 10.3125, "learning_rate": 4.185850723936771e-05, "loss": 0.9944249153137207, "mean_token_accuracy": 0.7711773902177811, "num_tokens": 37950287.0, "step": 19200 }, { "entropy": 0.8902222461998462, "epoch": 0.5502484854560818, "grad_norm": 7.34375, "learning_rate": 4.185007885474685e-05, "loss": 0.9176956176757812, "mean_token_accuracy": 0.7782740302383899, "num_tokens": 37969487.0, "step": 19210 }, { "entropy": 0.9460141375660897, "epoch": 0.5505349240221703, "grad_norm": 7.125, "learning_rate": 4.1841646959198536e-05, "loss": 1.009310817718506, "mean_token_accuracy": 0.7705666992813349, "num_tokens": 37991343.0, "step": 19220 }, { "entropy": 0.9415726711973548, "epoch": 0.5508213625882589, "grad_norm": 7.28125, "learning_rate": 4.1833211554479654e-05, "loss": 0.988035774230957, "mean_token_accuracy": 0.7750967808067799, "num_tokens": 38011386.0, "step": 19230 }, { "entropy": 0.9988466555252671, "epoch": 0.5511078011543474, "grad_norm": 6.71875, "learning_rate": 4.182477264234785e-05, "loss": 1.0462284088134766, "mean_token_accuracy": 0.7617311853915453, "num_tokens": 38030083.0, "step": 19240 }, { "entropy": 0.917192343249917, "epoch": 0.551394239720436, "grad_norm": 7.0625, "learning_rate": 4.1816330224561455e-05, "loss": 0.9060014724731446, "mean_token_accuracy": 0.7855589151382446, "num_tokens": 38049742.0, "step": 19250 }, { "entropy": 1.0207097191363572, "epoch": 0.5516806782865245, "grad_norm": 8.0625, "learning_rate": 4.180788430287956e-05, "loss": 0.9629178047180176, "mean_token_accuracy": 0.7734496343880892, "num_tokens": 38070049.0, "step": 19260 }, { "entropy": 0.9937358295544982, "epoch": 0.551967116852613, "grad_norm": 5.96875, "learning_rate": 4.1799434879061985e-05, "loss": 0.980595874786377, "mean_token_accuracy": 0.7729320023208857, "num_tokens": 38089702.0, "step": 19270 }, { "entropy": 0.9689991388469934, "epoch": 0.5522535554187016, "grad_norm": 7.25, "learning_rate": 4.1790981954869276e-05, "loss": 0.9846927642822265, "mean_token_accuracy": 0.7769508343189955, "num_tokens": 38108614.0, "step": 19280 }, { "entropy": 0.9059847016818822, "epoch": 0.5525399939847901, "grad_norm": 8.625, "learning_rate": 4.1782525532062686e-05, "loss": 0.9599862098693848, "mean_token_accuracy": 0.7705480575561523, "num_tokens": 38127987.0, "step": 19290 }, { "entropy": 1.0685237763449549, "epoch": 0.5528264325508786, "grad_norm": 7.0625, "learning_rate": 4.177406561240425e-05, "loss": 1.0888726234436035, "mean_token_accuracy": 0.7567665204405785, "num_tokens": 38148289.0, "step": 19300 }, { "entropy": 1.058514145296067, "epoch": 0.5531128711169672, "grad_norm": 11.6875, "learning_rate": 4.1765602197656674e-05, "loss": 1.0787226676940918, "mean_token_accuracy": 0.7461427260190249, "num_tokens": 38167344.0, "step": 19310 }, { "entropy": 0.9547070179134607, "epoch": 0.5533993096830557, "grad_norm": 6.21875, "learning_rate": 4.1757135289583424e-05, "loss": 0.9950839042663574, "mean_token_accuracy": 0.7731689371168613, "num_tokens": 38185824.0, "step": 19320 }, { "entropy": 1.0977138634771109, "epoch": 0.5536857482491443, "grad_norm": 6.4375, "learning_rate": 4.17486648899487e-05, "loss": 1.0839117050170899, "mean_token_accuracy": 0.7628477077931166, "num_tokens": 38205884.0, "step": 19330 }, { "entropy": 0.8991302141919733, "epoch": 0.5539721868152327, "grad_norm": 6.09375, "learning_rate": 4.17401910005174e-05, "loss": 0.9074352264404297, "mean_token_accuracy": 0.7849322475492955, "num_tokens": 38225748.0, "step": 19340 }, { "entropy": 0.98412509188056, "epoch": 0.5542586253813213, "grad_norm": 7.65625, "learning_rate": 4.173171362305518e-05, "loss": 1.0381229400634766, "mean_token_accuracy": 0.7625836465507746, "num_tokens": 38243976.0, "step": 19350 }, { "entropy": 0.9593858283013106, "epoch": 0.5545450639474099, "grad_norm": 8.375, "learning_rate": 4.172323275932839e-05, "loss": 0.8908781051635742, "mean_token_accuracy": 0.7914481859654188, "num_tokens": 38264899.0, "step": 19360 }, { "entropy": 0.9918803742155433, "epoch": 0.5548315025134984, "grad_norm": 6.9375, "learning_rate": 4.1714748411104155e-05, "loss": 0.9486532211303711, "mean_token_accuracy": 0.7768490660935641, "num_tokens": 38285152.0, "step": 19370 }, { "entropy": 0.9816761322319507, "epoch": 0.555117941079587, "grad_norm": 6.46875, "learning_rate": 4.170626058015027e-05, "loss": 0.9834271430969238, "mean_token_accuracy": 0.7713699210435152, "num_tokens": 38305085.0, "step": 19380 }, { "entropy": 0.927297318354249, "epoch": 0.5554043796456755, "grad_norm": 7.84375, "learning_rate": 4.169776926823529e-05, "loss": 0.9477129936218261, "mean_token_accuracy": 0.7822349708527326, "num_tokens": 38323771.0, "step": 19390 }, { "entropy": 0.9047140829265118, "epoch": 0.555690818211764, "grad_norm": 5.8125, "learning_rate": 4.168927447712849e-05, "loss": 0.8855545043945312, "mean_token_accuracy": 0.7883426390588284, "num_tokens": 38342737.0, "step": 19400 }, { "entropy": 0.8957334676757455, "epoch": 0.5559772567778526, "grad_norm": 8.6875, "learning_rate": 4.168077620859987e-05, "loss": 0.9611346244812011, "mean_token_accuracy": 0.7779878914356232, "num_tokens": 38361675.0, "step": 19410 }, { "entropy": 1.0248532945290207, "epoch": 0.5562636953439412, "grad_norm": 8.875, "learning_rate": 4.167227446442015e-05, "loss": 1.0683626174926757, "mean_token_accuracy": 0.7582519229501485, "num_tokens": 38382147.0, "step": 19420 }, { "entropy": 1.011183512583375, "epoch": 0.5565501339100296, "grad_norm": 8.25, "learning_rate": 4.1663769246360774e-05, "loss": 1.0042107582092286, "mean_token_accuracy": 0.7689656566828489, "num_tokens": 38401796.0, "step": 19430 }, { "entropy": 1.0000979075208307, "epoch": 0.5568365724761182, "grad_norm": 10.3125, "learning_rate": 4.165526055619391e-05, "loss": 0.9932844161987304, "mean_token_accuracy": 0.7723197724670172, "num_tokens": 38421438.0, "step": 19440 }, { "entropy": 0.86902816593647, "epoch": 0.5571230110422067, "grad_norm": 6.90625, "learning_rate": 4.164674839569245e-05, "loss": 0.8739824295043945, "mean_token_accuracy": 0.7951953802257776, "num_tokens": 38440368.0, "step": 19450 }, { "entropy": 0.8607277456671, "epoch": 0.5574094496082953, "grad_norm": 7.03125, "learning_rate": 4.1638232766630017e-05, "loss": 0.8491899490356445, "mean_token_accuracy": 0.7993162356317043, "num_tokens": 38460559.0, "step": 19460 }, { "entropy": 0.9326961737126112, "epoch": 0.5576958881743838, "grad_norm": 7.4375, "learning_rate": 4.1629713670780944e-05, "loss": 0.9336241722106934, "mean_token_accuracy": 0.7811349160969258, "num_tokens": 38480354.0, "step": 19470 }, { "entropy": 0.8983510158024728, "epoch": 0.5579823267404723, "grad_norm": 5.8125, "learning_rate": 4.16211911099203e-05, "loss": 0.914433765411377, "mean_token_accuracy": 0.7867476280778647, "num_tokens": 38501991.0, "step": 19480 }, { "entropy": 0.970943932980299, "epoch": 0.5582687653065609, "grad_norm": 7.09375, "learning_rate": 4.161266508582388e-05, "loss": 1.0002187728881835, "mean_token_accuracy": 0.7682420168071985, "num_tokens": 38524067.0, "step": 19490 }, { "entropy": 1.0015486091375352, "epoch": 0.5585552038726495, "grad_norm": 7.0625, "learning_rate": 4.160413560026816e-05, "loss": 1.0008804321289062, "mean_token_accuracy": 0.7752039108425379, "num_tokens": 38543929.0, "step": 19500 }, { "entropy": 1.0352138586342334, "epoch": 0.5588416424387379, "grad_norm": 7.40625, "learning_rate": 4.1595602655030376e-05, "loss": 1.0092190742492675, "mean_token_accuracy": 0.775368720665574, "num_tokens": 38564365.0, "step": 19510 }, { "entropy": 0.9257352869957686, "epoch": 0.5591280810048265, "grad_norm": 6.21875, "learning_rate": 4.158706625188848e-05, "loss": 0.9338169097900391, "mean_token_accuracy": 0.7742497894912959, "num_tokens": 38583043.0, "step": 19520 }, { "entropy": 0.9947560198605061, "epoch": 0.559414519570915, "grad_norm": 7.6875, "learning_rate": 4.157852639262114e-05, "loss": 1.0305397033691406, "mean_token_accuracy": 0.7714460618793965, "num_tokens": 38603326.0, "step": 19530 }, { "entropy": 0.9525862235575915, "epoch": 0.5597009581370036, "grad_norm": 9.375, "learning_rate": 4.1569983079007754e-05, "loss": 0.9488375663757325, "mean_token_accuracy": 0.7794634312391281, "num_tokens": 38623176.0, "step": 19540 }, { "entropy": 0.9559039887040853, "epoch": 0.559987396703092, "grad_norm": 8.0625, "learning_rate": 4.1561436312828414e-05, "loss": 0.9647384643554687, "mean_token_accuracy": 0.7760484226047992, "num_tokens": 38642272.0, "step": 19550 }, { "entropy": 0.9793501025997102, "epoch": 0.5602738352691806, "grad_norm": 6.65625, "learning_rate": 4.1552886095863945e-05, "loss": 1.0292466163635254, "mean_token_accuracy": 0.765915410220623, "num_tokens": 38663230.0, "step": 19560 }, { "entropy": 0.8350932704284787, "epoch": 0.5605602738352692, "grad_norm": 9.0, "learning_rate": 4.154433242989591e-05, "loss": 0.8241652488708496, "mean_token_accuracy": 0.8014059074223041, "num_tokens": 38682487.0, "step": 19570 }, { "entropy": 1.108338305912912, "epoch": 0.5608467124013577, "grad_norm": 7.4375, "learning_rate": 4.153577531670656e-05, "loss": 1.127332592010498, "mean_token_accuracy": 0.7531335406005383, "num_tokens": 38702580.0, "step": 19580 }, { "entropy": 0.9807157827541232, "epoch": 0.5611331509674462, "grad_norm": 7.15625, "learning_rate": 4.152721475807888e-05, "loss": 0.9722715377807617, "mean_token_accuracy": 0.7702742256224155, "num_tokens": 38724099.0, "step": 19590 }, { "entropy": 0.9845884306356311, "epoch": 0.5614195895335348, "grad_norm": 9.5, "learning_rate": 4.1518650755796565e-05, "loss": 0.9552626609802246, "mean_token_accuracy": 0.7801853995770216, "num_tokens": 38743454.0, "step": 19600 }, { "entropy": 1.0776905428618193, "epoch": 0.5617060280996233, "grad_norm": 6.5, "learning_rate": 4.1510083311644056e-05, "loss": 1.1053731918334961, "mean_token_accuracy": 0.7527314476668835, "num_tokens": 38762981.0, "step": 19610 }, { "entropy": 0.9004903633147479, "epoch": 0.5619924666657119, "grad_norm": 6.34375, "learning_rate": 4.1501512427406464e-05, "loss": 0.9865876197814941, "mean_token_accuracy": 0.7680407512933016, "num_tokens": 38782250.0, "step": 19620 }, { "entropy": 0.9333377033472061, "epoch": 0.5622789052318005, "grad_norm": 7.875, "learning_rate": 4.149293810486965e-05, "loss": 0.8889418601989746, "mean_token_accuracy": 0.7849811259657145, "num_tokens": 38801274.0, "step": 19630 }, { "entropy": 0.9339837461709977, "epoch": 0.5625653437978889, "grad_norm": 6.59375, "learning_rate": 4.14843603458202e-05, "loss": 0.929569149017334, "mean_token_accuracy": 0.7795525718480348, "num_tokens": 38820569.0, "step": 19640 }, { "entropy": 0.9881141383200884, "epoch": 0.5628517823639775, "grad_norm": 8.9375, "learning_rate": 4.147577915204536e-05, "loss": 1.00313081741333, "mean_token_accuracy": 0.7617206372320652, "num_tokens": 38838828.0, "step": 19650 }, { "entropy": 0.8715533567592502, "epoch": 0.563138220930066, "grad_norm": 7.15625, "learning_rate": 4.1467194525333166e-05, "loss": 0.9082240104675293, "mean_token_accuracy": 0.7885855607688427, "num_tokens": 38858809.0, "step": 19660 }, { "entropy": 1.0498733075335622, "epoch": 0.5634246594961546, "grad_norm": 6.53125, "learning_rate": 4.145860646747232e-05, "loss": 1.0786943435668945, "mean_token_accuracy": 0.7626278057694436, "num_tokens": 38879117.0, "step": 19670 }, { "entropy": 1.0971468076109887, "epoch": 0.5637110980622431, "grad_norm": 8.875, "learning_rate": 4.145001498025224e-05, "loss": 1.175865364074707, "mean_token_accuracy": 0.7378982320427895, "num_tokens": 38897833.0, "step": 19680 }, { "entropy": 0.9721847435459494, "epoch": 0.5639975366283316, "grad_norm": 7.21875, "learning_rate": 4.14414200654631e-05, "loss": 0.9975674629211426, "mean_token_accuracy": 0.7665717273950576, "num_tokens": 38917426.0, "step": 19690 }, { "entropy": 0.9583038538694382, "epoch": 0.5642839751944202, "grad_norm": 7.84375, "learning_rate": 4.1432821724895734e-05, "loss": 0.9800829887390137, "mean_token_accuracy": 0.7736961282789707, "num_tokens": 38937072.0, "step": 19700 }, { "entropy": 0.950890189409256, "epoch": 0.5645704137605088, "grad_norm": 7.8125, "learning_rate": 4.142421996034173e-05, "loss": 0.9950137138366699, "mean_token_accuracy": 0.7690510574728251, "num_tokens": 38955688.0, "step": 19710 }, { "entropy": 1.0428343627601862, "epoch": 0.5648568523265972, "grad_norm": 6.34375, "learning_rate": 4.141561477359337e-05, "loss": 1.0521081924438476, "mean_token_accuracy": 0.7594671942293644, "num_tokens": 38975721.0, "step": 19720 }, { "entropy": 1.0106626216322183, "epoch": 0.5651432908926858, "grad_norm": 7.8125, "learning_rate": 4.1407006166443656e-05, "loss": 0.9970620155334473, "mean_token_accuracy": 0.7731382846832275, "num_tokens": 38994653.0, "step": 19730 }, { "entropy": 1.0779481068253518, "epoch": 0.5654297294587743, "grad_norm": 9.25, "learning_rate": 4.1398394140686294e-05, "loss": 1.0601713180541992, "mean_token_accuracy": 0.753212433680892, "num_tokens": 39014631.0, "step": 19740 }, { "entropy": 0.9348740123212338, "epoch": 0.5657161680248629, "grad_norm": 11.1875, "learning_rate": 4.138977869811571e-05, "loss": 0.9546441078186035, "mean_token_accuracy": 0.7863631464540959, "num_tokens": 39032783.0, "step": 19750 }, { "entropy": 0.9436424765735865, "epoch": 0.5660026065909514, "grad_norm": 6.0, "learning_rate": 4.1381159840527054e-05, "loss": 0.9623109817504882, "mean_token_accuracy": 0.7768029198050499, "num_tokens": 39054086.0, "step": 19760 }, { "entropy": 0.9756453232839704, "epoch": 0.5662890451570399, "grad_norm": 8.875, "learning_rate": 4.1372537569716155e-05, "loss": 0.9895077705383301, "mean_token_accuracy": 0.7684864412993193, "num_tokens": 39073128.0, "step": 19770 }, { "entropy": 0.8633647851645947, "epoch": 0.5665754837231285, "grad_norm": 6.3125, "learning_rate": 4.136391188747958e-05, "loss": 0.864451789855957, "mean_token_accuracy": 0.806272380799055, "num_tokens": 39093150.0, "step": 19780 }, { "entropy": 0.9746080070734024, "epoch": 0.5668619222892171, "grad_norm": 7.78125, "learning_rate": 4.13552827956146e-05, "loss": 1.0095254898071289, "mean_token_accuracy": 0.7618807692080736, "num_tokens": 39113091.0, "step": 19790 }, { "entropy": 1.0073129093274473, "epoch": 0.5671483608553055, "grad_norm": 10.625, "learning_rate": 4.1346650295919205e-05, "loss": 1.0164382934570313, "mean_token_accuracy": 0.7714897431433201, "num_tokens": 39133220.0, "step": 19800 }, { "entropy": 0.8674702906981111, "epoch": 0.5674347994213941, "grad_norm": 6.40625, "learning_rate": 4.133801439019207e-05, "loss": 0.8571381568908691, "mean_token_accuracy": 0.7922187574207783, "num_tokens": 39152441.0, "step": 19810 }, { "entropy": 1.0287092326208949, "epoch": 0.5677212379874826, "grad_norm": 7.375, "learning_rate": 4.1329375080232597e-05, "loss": 1.074624729156494, "mean_token_accuracy": 0.7560446955263614, "num_tokens": 39171863.0, "step": 19820 }, { "entropy": 0.9506982645019889, "epoch": 0.5680076765535712, "grad_norm": 7.15625, "learning_rate": 4.132073236784091e-05, "loss": 0.9187474250793457, "mean_token_accuracy": 0.7944683220237494, "num_tokens": 39190964.0, "step": 19830 }, { "entropy": 1.024363349750638, "epoch": 0.5682941151196597, "grad_norm": 10.25, "learning_rate": 4.13120862548178e-05, "loss": 1.0443736076354981, "mean_token_accuracy": 0.7614618310704827, "num_tokens": 39209836.0, "step": 19840 }, { "entropy": 1.0028297476470471, "epoch": 0.5685805536857482, "grad_norm": 7.875, "learning_rate": 4.130343674296483e-05, "loss": 1.0341675758361817, "mean_token_accuracy": 0.7620521996170282, "num_tokens": 39229932.0, "step": 19850 }, { "entropy": 0.9206191564910113, "epoch": 0.5688669922518368, "grad_norm": 7.84375, "learning_rate": 4.1294783834084216e-05, "loss": 0.9203093528747559, "mean_token_accuracy": 0.7892377279698849, "num_tokens": 39248393.0, "step": 19860 }, { "entropy": 0.9425908589735628, "epoch": 0.5691534308179254, "grad_norm": 5.5, "learning_rate": 4.1286127529978905e-05, "loss": 0.9681834220886231, "mean_token_accuracy": 0.7748812358826399, "num_tokens": 39267957.0, "step": 19870 }, { "entropy": 0.8139951415359974, "epoch": 0.5694398693840138, "grad_norm": 6.03125, "learning_rate": 4.127746783245253e-05, "loss": 0.7672500133514404, "mean_token_accuracy": 0.8134459607303143, "num_tokens": 39287194.0, "step": 19880 }, { "entropy": 1.0402536880224944, "epoch": 0.5697263079501024, "grad_norm": 9.625, "learning_rate": 4.1268804743309485e-05, "loss": 1.0744309425354004, "mean_token_accuracy": 0.7562359970062971, "num_tokens": 39306200.0, "step": 19890 }, { "entropy": 0.8958443019539117, "epoch": 0.5700127465161909, "grad_norm": 8.375, "learning_rate": 4.12601382643548e-05, "loss": 0.9081062316894531, "mean_token_accuracy": 0.7849580965936184, "num_tokens": 39326327.0, "step": 19900 }, { "entropy": 0.969285492040217, "epoch": 0.5702991850822795, "grad_norm": 10.0625, "learning_rate": 4.1251468397394264e-05, "loss": 0.9410308837890625, "mean_token_accuracy": 0.7844414513558149, "num_tokens": 39345585.0, "step": 19910 }, { "entropy": 0.950868820026517, "epoch": 0.5705856236483681, "grad_norm": 8.4375, "learning_rate": 4.1242795144234346e-05, "loss": 1.0266042709350587, "mean_token_accuracy": 0.7605800732970238, "num_tokens": 39364869.0, "step": 19920 }, { "entropy": 0.9508584728464484, "epoch": 0.5708720622144565, "grad_norm": 8.25, "learning_rate": 4.123411850668224e-05, "loss": 1.0088253021240234, "mean_token_accuracy": 0.7656967118382454, "num_tokens": 39385728.0, "step": 19930 }, { "entropy": 0.990834153816104, "epoch": 0.5711585007805451, "grad_norm": 8.9375, "learning_rate": 4.122543848654581e-05, "loss": 1.0103014945983886, "mean_token_accuracy": 0.7677418265491724, "num_tokens": 39405902.0, "step": 19940 }, { "entropy": 0.9897529222071171, "epoch": 0.5714449393466337, "grad_norm": 10.625, "learning_rate": 4.1216755085633674e-05, "loss": 0.9950751304626465, "mean_token_accuracy": 0.769730270653963, "num_tokens": 39426863.0, "step": 19950 }, { "entropy": 0.8844190292060375, "epoch": 0.5717313779127222, "grad_norm": 8.1875, "learning_rate": 4.120806830575512e-05, "loss": 0.86932373046875, "mean_token_accuracy": 0.7860382415354252, "num_tokens": 39445920.0, "step": 19960 }, { "entropy": 0.9261470797471703, "epoch": 0.5720178164788107, "grad_norm": 7.3125, "learning_rate": 4.119937814872014e-05, "loss": 0.8737369537353515, "mean_token_accuracy": 0.7987537503242492, "num_tokens": 39465961.0, "step": 19970 }, { "entropy": 0.9400382541120053, "epoch": 0.5723042550448992, "grad_norm": 11.1875, "learning_rate": 4.1190684616339446e-05, "loss": 1.0355422973632813, "mean_token_accuracy": 0.7586205005645752, "num_tokens": 39485972.0, "step": 19980 }, { "entropy": 0.90003581661731, "epoch": 0.5725906936109878, "grad_norm": 6.75, "learning_rate": 4.118198771042444e-05, "loss": 0.872646713256836, "mean_token_accuracy": 0.7867083795368671, "num_tokens": 39505413.0, "step": 19990 }, { "epoch": 0.5728771321770764, "eval_entropy": 0.9877232120037079, "eval_loss": 1.013584852218628, "eval_mean_token_accuracy": 0.7637251317501068, "eval_num_tokens": 39526386.0, "eval_runtime": 43.2607, "eval_samples_per_second": 46.231, "eval_steps_per_second": 5.779, "step": 20000 }, { "entropy": 0.9743144256062806, "epoch": 0.5731635707431648, "grad_norm": 5.96875, "learning_rate": 4.1164583785240656e-05, "loss": 0.9881059646606445, "mean_token_accuracy": 0.7716233748942614, "num_tokens": 39546017.0, "step": 20010 }, { "entropy": 0.9395108044147491, "epoch": 0.5734500093092534, "grad_norm": 7.28125, "learning_rate": 4.11558767695982e-05, "loss": 0.9427123069763184, "mean_token_accuracy": 0.7766081787645817, "num_tokens": 39564709.0, "step": 20020 }, { "entropy": 0.973422285169363, "epoch": 0.573736447875342, "grad_norm": 7.125, "learning_rate": 4.1147166387674097e-05, "loss": 1.0254555702209474, "mean_token_accuracy": 0.7729189310222864, "num_tokens": 39583991.0, "step": 20030 }, { "entropy": 1.015830126963556, "epoch": 0.5740228864414305, "grad_norm": 6.71875, "learning_rate": 4.113845264128326e-05, "loss": 1.0577707290649414, "mean_token_accuracy": 0.7579512394964695, "num_tokens": 39606253.0, "step": 20040 }, { "entropy": 0.9367475468665362, "epoch": 0.574309325007519, "grad_norm": 6.3125, "learning_rate": 4.112973553224131e-05, "loss": 0.9405386924743653, "mean_token_accuracy": 0.7895747713744641, "num_tokens": 39626154.0, "step": 20050 }, { "entropy": 0.9724262777715922, "epoch": 0.5745957635736075, "grad_norm": 6.59375, "learning_rate": 4.112101506236455e-05, "loss": 0.9988237380981445, "mean_token_accuracy": 0.7739479385316372, "num_tokens": 39645381.0, "step": 20060 }, { "entropy": 1.0361915966495872, "epoch": 0.5748822021396961, "grad_norm": 8.4375, "learning_rate": 4.111229123347004e-05, "loss": 1.0676725387573243, "mean_token_accuracy": 0.7619747675955295, "num_tokens": 39665550.0, "step": 20070 }, { "entropy": 1.020539204031229, "epoch": 0.5751686407057847, "grad_norm": 8.875, "learning_rate": 4.1103564047375466e-05, "loss": 1.0539648056030273, "mean_token_accuracy": 0.7598235569894314, "num_tokens": 39685596.0, "step": 20080 }, { "entropy": 1.0001544227823616, "epoch": 0.5754550792718731, "grad_norm": 8.125, "learning_rate": 4.109483350589926e-05, "loss": 1.0027913093566894, "mean_token_accuracy": 0.7725025493651628, "num_tokens": 39704630.0, "step": 20090 }, { "entropy": 0.9718913894146681, "epoch": 0.5757415178379617, "grad_norm": 10.125, "learning_rate": 4.108609961086054e-05, "loss": 0.9541418075561523, "mean_token_accuracy": 0.7838160447776318, "num_tokens": 39724732.0, "step": 20100 }, { "entropy": 0.9927222821861506, "epoch": 0.5760279564040502, "grad_norm": 7.25, "learning_rate": 4.107736236407912e-05, "loss": 0.9706440925598144, "mean_token_accuracy": 0.7728913251310587, "num_tokens": 39745100.0, "step": 20110 }, { "entropy": 0.9994804799556732, "epoch": 0.5763143949701388, "grad_norm": 11.75, "learning_rate": 4.106862176737553e-05, "loss": 0.948979377746582, "mean_token_accuracy": 0.7827293567359448, "num_tokens": 39765468.0, "step": 20120 }, { "entropy": 0.9589021114632488, "epoch": 0.5766008335362273, "grad_norm": 7.15625, "learning_rate": 4.105987782257096e-05, "loss": 0.964389705657959, "mean_token_accuracy": 0.7803164631128311, "num_tokens": 39787139.0, "step": 20130 }, { "entropy": 0.8934176401235163, "epoch": 0.5768872721023158, "grad_norm": 7.21875, "learning_rate": 4.105113053148734e-05, "loss": 0.928364372253418, "mean_token_accuracy": 0.7907134246081113, "num_tokens": 39806794.0, "step": 20140 }, { "entropy": 0.9500906802713871, "epoch": 0.5771737106684044, "grad_norm": 10.4375, "learning_rate": 4.104237989594728e-05, "loss": 0.9524734497070313, "mean_token_accuracy": 0.7670584224164486, "num_tokens": 39825956.0, "step": 20150 }, { "entropy": 0.8618243556469679, "epoch": 0.577460149234493, "grad_norm": 5.90625, "learning_rate": 4.1033625917774064e-05, "loss": 0.8813813209533692, "mean_token_accuracy": 0.7918251369148492, "num_tokens": 39845895.0, "step": 20160 }, { "entropy": 1.0061787150800228, "epoch": 0.5777465878005815, "grad_norm": 8.9375, "learning_rate": 4.102486859879173e-05, "loss": 0.9966843605041504, "mean_token_accuracy": 0.7624151077121496, "num_tokens": 39865281.0, "step": 20170 }, { "entropy": 0.8883185619488358, "epoch": 0.57803302636667, "grad_norm": 9.4375, "learning_rate": 4.101610794082494e-05, "loss": 0.8031073570251465, "mean_token_accuracy": 0.8050013396888971, "num_tokens": 39884844.0, "step": 20180 }, { "entropy": 0.9233494058251381, "epoch": 0.5783194649327585, "grad_norm": 8.25, "learning_rate": 4.100734394569912e-05, "loss": 0.9848557472229004, "mean_token_accuracy": 0.7704064838588238, "num_tokens": 39904345.0, "step": 20190 }, { "entropy": 0.9666221361607313, "epoch": 0.5786059034988471, "grad_norm": 8.4375, "learning_rate": 4.099857661524033e-05, "loss": 0.9810226440429688, "mean_token_accuracy": 0.7690009452402592, "num_tokens": 39924108.0, "step": 20200 }, { "entropy": 0.9859731748700142, "epoch": 0.5788923420649357, "grad_norm": 8.6875, "learning_rate": 4.098980595127537e-05, "loss": 1.0264087677001954, "mean_token_accuracy": 0.7659872639924288, "num_tokens": 39945026.0, "step": 20210 }, { "entropy": 1.0115782588720321, "epoch": 0.5791787806310241, "grad_norm": 7.875, "learning_rate": 4.098103195563173e-05, "loss": 0.9613194465637207, "mean_token_accuracy": 0.7699773252010346, "num_tokens": 39964536.0, "step": 20220 }, { "entropy": 0.8349237475544214, "epoch": 0.5794652191971127, "grad_norm": 6.875, "learning_rate": 4.0972254630137566e-05, "loss": 0.8728310585021972, "mean_token_accuracy": 0.7912918381392956, "num_tokens": 39983862.0, "step": 20230 }, { "entropy": 1.0740262478590012, "epoch": 0.5797516577632013, "grad_norm": 9.6875, "learning_rate": 4.096347397662174e-05, "loss": 1.0913339614868165, "mean_token_accuracy": 0.7502806585282087, "num_tokens": 40003165.0, "step": 20240 }, { "entropy": 0.8802586395293475, "epoch": 0.5800380963292898, "grad_norm": 11.0625, "learning_rate": 4.0954689996913834e-05, "loss": 0.8988991737365722, "mean_token_accuracy": 0.7896165430545807, "num_tokens": 40023456.0, "step": 20250 }, { "entropy": 0.8832138726487756, "epoch": 0.5803245348953783, "grad_norm": 8.3125, "learning_rate": 4.0945902692844087e-05, "loss": 0.8604216575622559, "mean_token_accuracy": 0.788755489885807, "num_tokens": 40043764.0, "step": 20260 }, { "entropy": 0.9689393466338515, "epoch": 0.5806109734614668, "grad_norm": 6.0, "learning_rate": 4.0937112066243436e-05, "loss": 0.9914020538330078, "mean_token_accuracy": 0.7677198424935341, "num_tokens": 40062768.0, "step": 20270 }, { "entropy": 0.8788830837234854, "epoch": 0.5808974120275554, "grad_norm": 9.9375, "learning_rate": 4.092831811894354e-05, "loss": 0.9264053344726563, "mean_token_accuracy": 0.7914253011345863, "num_tokens": 40081780.0, "step": 20280 }, { "entropy": 1.0266006471589209, "epoch": 0.581183850593644, "grad_norm": 11.75, "learning_rate": 4.091952085277673e-05, "loss": 1.0371515274047851, "mean_token_accuracy": 0.7644747916609049, "num_tokens": 40102253.0, "step": 20290 }, { "entropy": 0.8955442847684025, "epoch": 0.5814702891597324, "grad_norm": 7.65625, "learning_rate": 4.0910720269576004e-05, "loss": 0.9469646453857422, "mean_token_accuracy": 0.7812335304915905, "num_tokens": 40122023.0, "step": 20300 }, { "entropy": 0.9341918094083667, "epoch": 0.581756727725821, "grad_norm": 7.15625, "learning_rate": 4.0901916371175095e-05, "loss": 0.9658877372741699, "mean_token_accuracy": 0.7769235357642174, "num_tokens": 40142270.0, "step": 20310 }, { "entropy": 1.0104470368474723, "epoch": 0.5820431662919096, "grad_norm": 7.28125, "learning_rate": 4.0893109159408403e-05, "loss": 0.9800692558288574, "mean_token_accuracy": 0.7685091432183981, "num_tokens": 40162160.0, "step": 20320 }, { "entropy": 0.9051725916564465, "epoch": 0.5823296048579981, "grad_norm": 9.0, "learning_rate": 4.0884298636111015e-05, "loss": 0.8798377990722657, "mean_token_accuracy": 0.7956476740539074, "num_tokens": 40180741.0, "step": 20330 }, { "entropy": 0.9469224305823445, "epoch": 0.5826160434240866, "grad_norm": 9.5625, "learning_rate": 4.087548480311872e-05, "loss": 0.9971781730651855, "mean_token_accuracy": 0.7667026709765196, "num_tokens": 40200449.0, "step": 20340 }, { "entropy": 1.0360435027629138, "epoch": 0.5829024819901751, "grad_norm": 7.65625, "learning_rate": 4.0866667662268e-05, "loss": 1.050649070739746, "mean_token_accuracy": 0.7645127668976783, "num_tokens": 40219897.0, "step": 20350 }, { "entropy": 1.022946797311306, "epoch": 0.5831889205562637, "grad_norm": 6.25, "learning_rate": 4.085784721539601e-05, "loss": 1.019237232208252, "mean_token_accuracy": 0.7648782677948475, "num_tokens": 40239915.0, "step": 20360 }, { "entropy": 0.8659194767475128, "epoch": 0.5834753591223523, "grad_norm": 6.3125, "learning_rate": 4.08490234643406e-05, "loss": 0.8371137619018555, "mean_token_accuracy": 0.7984774462878704, "num_tokens": 40260423.0, "step": 20370 }, { "entropy": 0.8768610382452607, "epoch": 0.5837617976884407, "grad_norm": 7.0625, "learning_rate": 4.084019641094031e-05, "loss": 0.9091633796691895, "mean_token_accuracy": 0.7855933662503958, "num_tokens": 40279822.0, "step": 20380 }, { "entropy": 0.8666309759020805, "epoch": 0.5840482362545293, "grad_norm": 8.8125, "learning_rate": 4.083136605703437e-05, "loss": 0.8934616088867188, "mean_token_accuracy": 0.7890436481684446, "num_tokens": 40299006.0, "step": 20390 }, { "entropy": 0.912430851906538, "epoch": 0.5843346748206178, "grad_norm": 9.8125, "learning_rate": 4.08225324044627e-05, "loss": 0.9640564918518066, "mean_token_accuracy": 0.7753376845270396, "num_tokens": 40317518.0, "step": 20400 }, { "entropy": 0.8935806721448898, "epoch": 0.5846211133867064, "grad_norm": 10.3125, "learning_rate": 4.08136954550659e-05, "loss": 0.792830514907837, "mean_token_accuracy": 0.8115452572703361, "num_tokens": 40336536.0, "step": 20410 }, { "entropy": 0.936208451166749, "epoch": 0.584907551952795, "grad_norm": 7.8125, "learning_rate": 4.0804855210685266e-05, "loss": 0.9398514747619628, "mean_token_accuracy": 0.774126711115241, "num_tokens": 40354968.0, "step": 20420 }, { "entropy": 1.004452271014452, "epoch": 0.5851939905188834, "grad_norm": 6.875, "learning_rate": 4.079601167316276e-05, "loss": 1.0822473526000977, "mean_token_accuracy": 0.7707275457680225, "num_tokens": 40376623.0, "step": 20430 }, { "entropy": 0.8957709370180964, "epoch": 0.585480429084972, "grad_norm": 8.75, "learning_rate": 4.0787164844341066e-05, "loss": 0.9186844825744629, "mean_token_accuracy": 0.7829184107482433, "num_tokens": 40398183.0, "step": 20440 }, { "entropy": 0.906250961497426, "epoch": 0.5857668676510606, "grad_norm": 9.875, "learning_rate": 4.077831472606352e-05, "loss": 0.9339326858520508, "mean_token_accuracy": 0.7821908906102181, "num_tokens": 40417569.0, "step": 20450 }, { "entropy": 0.9379493309184909, "epoch": 0.5860533062171491, "grad_norm": 8.25, "learning_rate": 4.0769461320174154e-05, "loss": 0.9542790412902832, "mean_token_accuracy": 0.7770782265812158, "num_tokens": 40438900.0, "step": 20460 }, { "entropy": 1.097783868573606, "epoch": 0.5863397447832376, "grad_norm": 11.9375, "learning_rate": 4.076060462851769e-05, "loss": 1.1625299453735352, "mean_token_accuracy": 0.7410434048622847, "num_tokens": 40459133.0, "step": 20470 }, { "entropy": 0.9125070013105869, "epoch": 0.5866261833493261, "grad_norm": 7.46875, "learning_rate": 4.075174465293954e-05, "loss": 0.8762696266174317, "mean_token_accuracy": 0.795248543471098, "num_tokens": 40478328.0, "step": 20480 }, { "entropy": 0.936875872220844, "epoch": 0.5869126219154147, "grad_norm": 5.5, "learning_rate": 4.074288139528578e-05, "loss": 0.881074333190918, "mean_token_accuracy": 0.791917197778821, "num_tokens": 40497702.0, "step": 20490 }, { "entropy": 0.8741323390975595, "epoch": 0.5871990604815033, "grad_norm": 8.9375, "learning_rate": 4.073401485740319e-05, "loss": 0.9533127784729004, "mean_token_accuracy": 0.7899199858307838, "num_tokens": 40516319.0, "step": 20500 }, { "entropy": 1.0455211844295262, "epoch": 0.5874854990475917, "grad_norm": 7.75, "learning_rate": 4.072514504113922e-05, "loss": 1.048889446258545, "mean_token_accuracy": 0.7571695540100336, "num_tokens": 40536736.0, "step": 20510 }, { "entropy": 0.9466321220621466, "epoch": 0.5877719376136803, "grad_norm": 7.46875, "learning_rate": 4.071627194834202e-05, "loss": 0.9859343528747558, "mean_token_accuracy": 0.7682564459741116, "num_tokens": 40555745.0, "step": 20520 }, { "entropy": 0.8678402498364448, "epoch": 0.5880583761797689, "grad_norm": 9.75, "learning_rate": 4.0707395580860395e-05, "loss": 0.825813102722168, "mean_token_accuracy": 0.7993369691073895, "num_tokens": 40575010.0, "step": 20530 }, { "entropy": 0.9467619424685836, "epoch": 0.5883448147458574, "grad_norm": 7.4375, "learning_rate": 4.069851594054387e-05, "loss": 0.9585908889770508, "mean_token_accuracy": 0.7831815924495459, "num_tokens": 40595614.0, "step": 20540 }, { "entropy": 0.9116890400648117, "epoch": 0.5886312533119459, "grad_norm": 7.3125, "learning_rate": 4.06896330292426e-05, "loss": 0.9282383918762207, "mean_token_accuracy": 0.7864695079624653, "num_tokens": 40615371.0, "step": 20550 }, { "entropy": 0.893018077686429, "epoch": 0.5889176918780344, "grad_norm": 10.125, "learning_rate": 4.0680746848807486e-05, "loss": 0.854468822479248, "mean_token_accuracy": 0.7927126739174127, "num_tokens": 40634992.0, "step": 20560 }, { "entropy": 0.87540267072618, "epoch": 0.589204130444123, "grad_norm": 7.0625, "learning_rate": 4.067185740109005e-05, "loss": 0.8731182098388672, "mean_token_accuracy": 0.7959563385695219, "num_tokens": 40654685.0, "step": 20570 }, { "entropy": 1.0295328371226788, "epoch": 0.5894905690102116, "grad_norm": 9.8125, "learning_rate": 4.066296468794253e-05, "loss": 1.0021032333374023, "mean_token_accuracy": 0.7662377797067166, "num_tokens": 40674756.0, "step": 20580 }, { "entropy": 1.0410988885909318, "epoch": 0.5897770075763, "grad_norm": 9.5, "learning_rate": 4.065406871121784e-05, "loss": 1.0926506042480468, "mean_token_accuracy": 0.749431798607111, "num_tokens": 40695519.0, "step": 20590 }, { "entropy": 0.8800399286672473, "epoch": 0.5900634461423886, "grad_norm": 6.40625, "learning_rate": 4.064516947276956e-05, "loss": 0.9195139884948731, "mean_token_accuracy": 0.7888823498040438, "num_tokens": 40715652.0, "step": 20600 }, { "entropy": 0.9306248532608151, "epoch": 0.5903498847084772, "grad_norm": 10.0, "learning_rate": 4.0636266974451974e-05, "loss": 0.9525252342224121, "mean_token_accuracy": 0.7809186842292547, "num_tokens": 40733968.0, "step": 20610 }, { "entropy": 1.033230389840901, "epoch": 0.5906363232745657, "grad_norm": 9.125, "learning_rate": 4.062736121812002e-05, "loss": 1.0795620918273925, "mean_token_accuracy": 0.7626445930451154, "num_tokens": 40752228.0, "step": 20620 }, { "entropy": 1.0076969455927611, "epoch": 0.5909227618406542, "grad_norm": 6.65625, "learning_rate": 4.061845220562932e-05, "loss": 0.9812061309814453, "mean_token_accuracy": 0.7731360297650098, "num_tokens": 40770999.0, "step": 20630 }, { "entropy": 0.9555409287102521, "epoch": 0.5912092004067427, "grad_norm": 7.625, "learning_rate": 4.060953993883619e-05, "loss": 1.0335517883300782, "mean_token_accuracy": 0.7745512427762151, "num_tokens": 40791027.0, "step": 20640 }, { "entropy": 0.9497677065432072, "epoch": 0.5914956389728313, "grad_norm": 6.8125, "learning_rate": 4.060062441959761e-05, "loss": 0.911768627166748, "mean_token_accuracy": 0.783646060153842, "num_tokens": 40810600.0, "step": 20650 }, { "entropy": 1.048075314424932, "epoch": 0.5917820775389199, "grad_norm": 7.25, "learning_rate": 4.0591705649771246e-05, "loss": 1.029709529876709, "mean_token_accuracy": 0.7670080941170454, "num_tokens": 40831247.0, "step": 20660 }, { "entropy": 0.8239648763090373, "epoch": 0.5920685161050083, "grad_norm": 7.6875, "learning_rate": 4.0582783631215424e-05, "loss": 0.827114200592041, "mean_token_accuracy": 0.8017411805689335, "num_tokens": 40851361.0, "step": 20670 }, { "entropy": 0.9628026841208339, "epoch": 0.5923549546710969, "grad_norm": 9.75, "learning_rate": 4.057385836578917e-05, "loss": 0.9166473388671875, "mean_token_accuracy": 0.7875780992209911, "num_tokens": 40873110.0, "step": 20680 }, { "entropy": 0.8636716475710273, "epoch": 0.5926413932371855, "grad_norm": 6.1875, "learning_rate": 4.0564929855352174e-05, "loss": 0.9192937850952149, "mean_token_accuracy": 0.7914801485836506, "num_tokens": 40891485.0, "step": 20690 }, { "entropy": 0.8500786259770393, "epoch": 0.592927831803274, "grad_norm": 7.25, "learning_rate": 4.0555998101764805e-05, "loss": 0.8672176361083984, "mean_token_accuracy": 0.803352776169777, "num_tokens": 40912134.0, "step": 20700 }, { "entropy": 1.0164161024615168, "epoch": 0.5932142703693626, "grad_norm": 7.75, "learning_rate": 4.0547063106888106e-05, "loss": 1.0464364051818849, "mean_token_accuracy": 0.7635302990674973, "num_tokens": 40932635.0, "step": 20710 }, { "entropy": 0.9309699583798647, "epoch": 0.593500708935451, "grad_norm": 7.6875, "learning_rate": 4.0538124872583794e-05, "loss": 0.9435456275939942, "mean_token_accuracy": 0.7785880167037249, "num_tokens": 40952026.0, "step": 20720 }, { "entropy": 0.9318991012871265, "epoch": 0.5937871475015396, "grad_norm": 8.4375, "learning_rate": 4.052918340071428e-05, "loss": 0.9538392066955567, "mean_token_accuracy": 0.7795367680490017, "num_tokens": 40970415.0, "step": 20730 }, { "entropy": 0.9007409632205963, "epoch": 0.5940735860676282, "grad_norm": 7.40625, "learning_rate": 4.05202386931426e-05, "loss": 0.8817028999328613, "mean_token_accuracy": 0.799362127110362, "num_tokens": 40991686.0, "step": 20740 }, { "entropy": 1.022671365365386, "epoch": 0.5943600246337167, "grad_norm": 7.8125, "learning_rate": 4.0511290751732524e-05, "loss": 1.018362045288086, "mean_token_accuracy": 0.7605372924357653, "num_tokens": 41011188.0, "step": 20750 }, { "entropy": 0.9238252894952893, "epoch": 0.5946464631998052, "grad_norm": 7.75, "learning_rate": 4.050233957834846e-05, "loss": 0.9521265983581543, "mean_token_accuracy": 0.7810578010976315, "num_tokens": 41030196.0, "step": 20760 }, { "entropy": 0.8961081322282552, "epoch": 0.5949329017658938, "grad_norm": 9.75, "learning_rate": 4.0493385174855505e-05, "loss": 0.9701844215393066, "mean_token_accuracy": 0.7829433962702751, "num_tokens": 41048712.0, "step": 20770 }, { "entropy": 0.907502195239067, "epoch": 0.5952193403319823, "grad_norm": 9.375, "learning_rate": 4.0484427543119405e-05, "loss": 0.9321063995361328, "mean_token_accuracy": 0.7844234146177769, "num_tokens": 41069707.0, "step": 20780 }, { "entropy": 0.9433350671082735, "epoch": 0.5955057788980709, "grad_norm": 6.21875, "learning_rate": 4.047546668500662e-05, "loss": 0.9086404800415039, "mean_token_accuracy": 0.7825839649885893, "num_tokens": 41089278.0, "step": 20790 }, { "entropy": 0.8954040778800845, "epoch": 0.5957922174641593, "grad_norm": 8.75, "learning_rate": 4.046650260238424e-05, "loss": 0.8975656509399415, "mean_token_accuracy": 0.7964496545493602, "num_tokens": 41108864.0, "step": 20800 }, { "entropy": 0.9213673248887062, "epoch": 0.5960786560302479, "grad_norm": 7.5, "learning_rate": 4.0457535297120055e-05, "loss": 0.9145282745361328, "mean_token_accuracy": 0.7992996439337731, "num_tokens": 41127067.0, "step": 20810 }, { "entropy": 0.9741287283599377, "epoch": 0.5963650945963365, "grad_norm": 8.75, "learning_rate": 4.044856477108251e-05, "loss": 0.9720040321350097, "mean_token_accuracy": 0.7732558086514473, "num_tokens": 41147793.0, "step": 20820 }, { "entropy": 0.8446151612326502, "epoch": 0.596651533162425, "grad_norm": 6.6875, "learning_rate": 4.043959102614073e-05, "loss": 0.9002360343933106, "mean_token_accuracy": 0.7926660932600498, "num_tokens": 41167846.0, "step": 20830 }, { "entropy": 0.8957037634216249, "epoch": 0.5969379717285135, "grad_norm": 7.96875, "learning_rate": 4.043061406416452e-05, "loss": 0.9112488746643066, "mean_token_accuracy": 0.7921467173844576, "num_tokens": 41186980.0, "step": 20840 }, { "entropy": 0.9258665155619383, "epoch": 0.597224410294602, "grad_norm": 7.0625, "learning_rate": 4.0421633887024323e-05, "loss": 0.9813747406005859, "mean_token_accuracy": 0.7790419347584248, "num_tokens": 41206120.0, "step": 20850 }, { "entropy": 0.9238900225609541, "epoch": 0.5975108488606906, "grad_norm": 10.6875, "learning_rate": 4.041265049659128e-05, "loss": 0.9519866943359375, "mean_token_accuracy": 0.779297724366188, "num_tokens": 41226601.0, "step": 20860 }, { "entropy": 1.0661541579291225, "epoch": 0.5977972874267792, "grad_norm": 7.34375, "learning_rate": 4.0403663894737205e-05, "loss": 1.0956396102905273, "mean_token_accuracy": 0.7528447434306145, "num_tokens": 41247029.0, "step": 20870 }, { "entropy": 0.8536147611215711, "epoch": 0.5980837259928676, "grad_norm": 6.4375, "learning_rate": 4.039467408333456e-05, "loss": 0.8158473968505859, "mean_token_accuracy": 0.8012623369693757, "num_tokens": 41266124.0, "step": 20880 }, { "entropy": 0.887767580896616, "epoch": 0.5983701645589562, "grad_norm": 7.28125, "learning_rate": 4.0385681064256485e-05, "loss": 0.9154246330261231, "mean_token_accuracy": 0.7874515231698751, "num_tokens": 41285817.0, "step": 20890 }, { "entropy": 0.8830116217955947, "epoch": 0.5986566031250448, "grad_norm": 8.0625, "learning_rate": 4.03766848393768e-05, "loss": 0.853181266784668, "mean_token_accuracy": 0.7987013965845108, "num_tokens": 41304123.0, "step": 20900 }, { "entropy": 0.9142610454931855, "epoch": 0.5989430416911333, "grad_norm": 7.3125, "learning_rate": 4.036768541056997e-05, "loss": 0.9103652000427246, "mean_token_accuracy": 0.7947945483028889, "num_tokens": 41324236.0, "step": 20910 }, { "entropy": 0.984237615764141, "epoch": 0.5992294802572218, "grad_norm": 6.25, "learning_rate": 4.0358682779711156e-05, "loss": 0.9487616539001464, "mean_token_accuracy": 0.7826851081103087, "num_tokens": 41344647.0, "step": 20920 }, { "entropy": 0.8736257541924715, "epoch": 0.5995159188233103, "grad_norm": 8.9375, "learning_rate": 4.034967694867615e-05, "loss": 0.8735903739929199, "mean_token_accuracy": 0.7949574064463377, "num_tokens": 41363345.0, "step": 20930 }, { "entropy": 0.9117791803553701, "epoch": 0.5998023573893989, "grad_norm": 8.5625, "learning_rate": 4.034066791934144e-05, "loss": 1.0124193191528321, "mean_token_accuracy": 0.7686371643096208, "num_tokens": 41383833.0, "step": 20940 }, { "entropy": 0.9353847696445883, "epoch": 0.6000887959554875, "grad_norm": 6.59375, "learning_rate": 4.0331655693584176e-05, "loss": 0.9405402183532715, "mean_token_accuracy": 0.7820982005447149, "num_tokens": 41403314.0, "step": 20950 }, { "entropy": 0.8074826346710324, "epoch": 0.600375234521576, "grad_norm": 7.5625, "learning_rate": 4.0322640273282165e-05, "loss": 0.7605173587799072, "mean_token_accuracy": 0.8140549000352622, "num_tokens": 41423274.0, "step": 20960 }, { "entropy": 0.9272844202816486, "epoch": 0.6006616730876645, "grad_norm": 9.5625, "learning_rate": 4.031362166031388e-05, "loss": 0.9665066719055175, "mean_token_accuracy": 0.7756766356527806, "num_tokens": 41442145.0, "step": 20970 }, { "entropy": 0.9357972528785468, "epoch": 0.6009481116537531, "grad_norm": 7.96875, "learning_rate": 4.030459985655848e-05, "loss": 0.9401085853576661, "mean_token_accuracy": 0.7800631914287806, "num_tokens": 41461342.0, "step": 20980 }, { "entropy": 0.9227657537907362, "epoch": 0.6012345502198416, "grad_norm": 7.21875, "learning_rate": 4.029557486389574e-05, "loss": 0.9202791213989258, "mean_token_accuracy": 0.7881428830325603, "num_tokens": 41480546.0, "step": 20990 }, { "entropy": 0.9187023758888244, "epoch": 0.6015209887859302, "grad_norm": 7.09375, "learning_rate": 4.028654668420617e-05, "loss": 0.9150511741638183, "mean_token_accuracy": 0.7903459273278713, "num_tokens": 41500097.0, "step": 21000 }, { "entropy": 1.0126201277598739, "epoch": 0.6018074273520186, "grad_norm": 7.09375, "learning_rate": 4.027751531937088e-05, "loss": 1.0558706283569337, "mean_token_accuracy": 0.7638945899903774, "num_tokens": 41521353.0, "step": 21010 }, { "entropy": 1.014037550985813, "epoch": 0.6020938659181072, "grad_norm": 7.28125, "learning_rate": 4.0268480771271686e-05, "loss": 1.0154370307922362, "mean_token_accuracy": 0.7747875913977623, "num_tokens": 41541311.0, "step": 21020 }, { "entropy": 0.862037887610495, "epoch": 0.6023803044841958, "grad_norm": 6.0625, "learning_rate": 4.0259443041791034e-05, "loss": 0.8692997932434082, "mean_token_accuracy": 0.7942831709980964, "num_tokens": 41561438.0, "step": 21030 }, { "entropy": 1.0233358446508647, "epoch": 0.6026667430502843, "grad_norm": 5.625, "learning_rate": 4.025040213281206e-05, "loss": 0.980075454711914, "mean_token_accuracy": 0.7743218224495649, "num_tokens": 41581716.0, "step": 21040 }, { "entropy": 0.9603341985493898, "epoch": 0.6029531816163728, "grad_norm": 7.65625, "learning_rate": 4.0241358046218545e-05, "loss": 0.967650318145752, "mean_token_accuracy": 0.7738530497998, "num_tokens": 41600950.0, "step": 21050 }, { "entropy": 0.9888514935970306, "epoch": 0.6032396201824614, "grad_norm": 8.8125, "learning_rate": 4.023231078389495e-05, "loss": 1.0712069511413573, "mean_token_accuracy": 0.756508257985115, "num_tokens": 41622246.0, "step": 21060 }, { "entropy": 0.9421109084039927, "epoch": 0.6035260587485499, "grad_norm": 7.375, "learning_rate": 4.022326034772637e-05, "loss": 0.9729910850524902, "mean_token_accuracy": 0.7771270956844092, "num_tokens": 41641908.0, "step": 21070 }, { "entropy": 0.9741461761295795, "epoch": 0.6038124973146385, "grad_norm": 7.59375, "learning_rate": 4.021420673959859e-05, "loss": 1.000966739654541, "mean_token_accuracy": 0.7841028429567813, "num_tokens": 41660674.0, "step": 21080 }, { "entropy": 0.9843042684718967, "epoch": 0.6040989358807269, "grad_norm": 8.25, "learning_rate": 4.020514996139804e-05, "loss": 0.9296276092529296, "mean_token_accuracy": 0.7809163060039281, "num_tokens": 41679428.0, "step": 21090 }, { "entropy": 0.8387097787111998, "epoch": 0.6043853744468155, "grad_norm": 5.40625, "learning_rate": 4.019609001501182e-05, "loss": 0.8288966178894043, "mean_token_accuracy": 0.8085266873240471, "num_tokens": 41698048.0, "step": 21100 }, { "entropy": 0.9606157869100571, "epoch": 0.6046718130129041, "grad_norm": 10.4375, "learning_rate": 4.018702690232768e-05, "loss": 0.983890438079834, "mean_token_accuracy": 0.7711589809507131, "num_tokens": 41717401.0, "step": 21110 }, { "entropy": 0.918721004575491, "epoch": 0.6049582515789926, "grad_norm": 7.03125, "learning_rate": 4.0177960625234034e-05, "loss": 0.9903434753417969, "mean_token_accuracy": 0.7762091536074877, "num_tokens": 41738753.0, "step": 21120 }, { "entropy": 0.9909901682287454, "epoch": 0.6052446901450811, "grad_norm": 7.125, "learning_rate": 4.016889118561996e-05, "loss": 0.9889702796936035, "mean_token_accuracy": 0.7745804753154516, "num_tokens": 41759950.0, "step": 21130 }, { "entropy": 0.9451931834220886, "epoch": 0.6055311287111697, "grad_norm": 8.75, "learning_rate": 4.0159818585375184e-05, "loss": 0.9409404754638672, "mean_token_accuracy": 0.7859415173530578, "num_tokens": 41778882.0, "step": 21140 }, { "entropy": 0.9710013676434756, "epoch": 0.6058175672772582, "grad_norm": 7.9375, "learning_rate": 4.015074282639011e-05, "loss": 1.022063636779785, "mean_token_accuracy": 0.7670025512576103, "num_tokens": 41798556.0, "step": 21150 }, { "entropy": 0.9538961915299297, "epoch": 0.6061040058433468, "grad_norm": 6.0, "learning_rate": 4.014166391055577e-05, "loss": 0.9876542091369629, "mean_token_accuracy": 0.7772497501224279, "num_tokens": 41818762.0, "step": 21160 }, { "entropy": 0.9731216883286834, "epoch": 0.6063904444094352, "grad_norm": 6.28125, "learning_rate": 4.013258183976388e-05, "loss": 0.9990914344787598, "mean_token_accuracy": 0.7741889987140894, "num_tokens": 41839043.0, "step": 21170 }, { "entropy": 0.9369466709904373, "epoch": 0.6066768829755238, "grad_norm": 8.3125, "learning_rate": 4.01234966159068e-05, "loss": 0.9545680046081543, "mean_token_accuracy": 0.7743865631520748, "num_tokens": 41858436.0, "step": 21180 }, { "entropy": 0.9481218051165342, "epoch": 0.6069633215416124, "grad_norm": 7.53125, "learning_rate": 4.011440824087757e-05, "loss": 0.9469070434570312, "mean_token_accuracy": 0.7886612102389335, "num_tokens": 41878571.0, "step": 21190 }, { "entropy": 0.9387059917673468, "epoch": 0.6072497601077009, "grad_norm": 10.1875, "learning_rate": 4.010531671656984e-05, "loss": 0.8841951370239258, "mean_token_accuracy": 0.7964214541018009, "num_tokens": 41897762.0, "step": 21200 }, { "entropy": 0.9549746591597795, "epoch": 0.6075361986737894, "grad_norm": 7.8125, "learning_rate": 4.009622204487795e-05, "loss": 0.9917261123657226, "mean_token_accuracy": 0.7753554556518794, "num_tokens": 41918338.0, "step": 21210 }, { "entropy": 0.8990516319870949, "epoch": 0.607822637239878, "grad_norm": 7.4375, "learning_rate": 4.0087124227696913e-05, "loss": 0.8554092407226562, "mean_token_accuracy": 0.7967605404555798, "num_tokens": 41938507.0, "step": 21220 }, { "entropy": 0.9326813146471977, "epoch": 0.6081090758059665, "grad_norm": 7.5625, "learning_rate": 4.007802326692236e-05, "loss": 0.9167994499206543, "mean_token_accuracy": 0.7798323288559914, "num_tokens": 41958426.0, "step": 21230 }, { "entropy": 0.8656520204618573, "epoch": 0.6083955143720551, "grad_norm": 6.8125, "learning_rate": 4.006891916445058e-05, "loss": 0.8320615768432618, "mean_token_accuracy": 0.7998116254806519, "num_tokens": 41978095.0, "step": 21240 }, { "entropy": 0.993567768856883, "epoch": 0.6086819529381436, "grad_norm": 9.8125, "learning_rate": 4.005981192217855e-05, "loss": 1.0638136863708496, "mean_token_accuracy": 0.7658849764615298, "num_tokens": 41997571.0, "step": 21250 }, { "entropy": 0.9665811860933899, "epoch": 0.6089683915042321, "grad_norm": 6.84375, "learning_rate": 4.005070154200386e-05, "loss": 0.9924683570861816, "mean_token_accuracy": 0.7683881558477879, "num_tokens": 42019737.0, "step": 21260 }, { "entropy": 0.8849428739398718, "epoch": 0.6092548300703207, "grad_norm": 8.5, "learning_rate": 4.004158802582478e-05, "loss": 0.9356993675231934, "mean_token_accuracy": 0.7801951166242361, "num_tokens": 42037593.0, "step": 21270 }, { "entropy": 0.9559132300317288, "epoch": 0.6095412686364092, "grad_norm": 8.8125, "learning_rate": 4.003247137554024e-05, "loss": 0.9920024871826172, "mean_token_accuracy": 0.7765748884528876, "num_tokens": 42056687.0, "step": 21280 }, { "entropy": 0.9555912531912327, "epoch": 0.6098277072024978, "grad_norm": 6.875, "learning_rate": 4.0023351593049786e-05, "loss": 0.9226361274719238, "mean_token_accuracy": 0.7857959181070328, "num_tokens": 42076948.0, "step": 21290 }, { "entropy": 0.8304474165663123, "epoch": 0.6101141457685862, "grad_norm": 7.9375, "learning_rate": 4.0014228680253655e-05, "loss": 0.8037498474121094, "mean_token_accuracy": 0.8073724310845136, "num_tokens": 42096267.0, "step": 21300 }, { "entropy": 0.91441769618541, "epoch": 0.6104005843346748, "grad_norm": 8.8125, "learning_rate": 4.000510263905273e-05, "loss": 0.9193489074707031, "mean_token_accuracy": 0.7954089157283306, "num_tokens": 42115842.0, "step": 21310 }, { "entropy": 0.8459574146196246, "epoch": 0.6106870229007634, "grad_norm": 4.875, "learning_rate": 3.999597347134851e-05, "loss": 0.8010165214538574, "mean_token_accuracy": 0.8099937357008458, "num_tokens": 42136260.0, "step": 21320 }, { "entropy": 0.8444384815171361, "epoch": 0.6109734614668519, "grad_norm": 7.59375, "learning_rate": 3.9986841179043195e-05, "loss": 0.8454648017883301, "mean_token_accuracy": 0.7997375346720219, "num_tokens": 42155509.0, "step": 21330 }, { "entropy": 1.0567572874948383, "epoch": 0.6112599000329404, "grad_norm": 7.875, "learning_rate": 3.997770576403961e-05, "loss": 1.1003796577453613, "mean_token_accuracy": 0.7578796736896038, "num_tokens": 42175258.0, "step": 21340 }, { "entropy": 0.8765289297327399, "epoch": 0.611546338599029, "grad_norm": 7.6875, "learning_rate": 3.9968567228241225e-05, "loss": 0.8882092475891114, "mean_token_accuracy": 0.7994453281164169, "num_tokens": 42194351.0, "step": 21350 }, { "entropy": 0.7483715382404625, "epoch": 0.6118327771651175, "grad_norm": 8.25, "learning_rate": 3.9959425573552176e-05, "loss": 0.7966334342956543, "mean_token_accuracy": 0.8065416298806667, "num_tokens": 42212865.0, "step": 21360 }, { "entropy": 0.941635518707335, "epoch": 0.6121192157312061, "grad_norm": 11.0625, "learning_rate": 3.995028080187725e-05, "loss": 0.9472028732299804, "mean_token_accuracy": 0.7869414288550616, "num_tokens": 42231316.0, "step": 21370 }, { "entropy": 0.9518864756450057, "epoch": 0.6124056542972945, "grad_norm": 6.34375, "learning_rate": 3.9941132915121864e-05, "loss": 1.0018354415893556, "mean_token_accuracy": 0.771107779070735, "num_tokens": 42251803.0, "step": 21380 }, { "entropy": 0.886208895035088, "epoch": 0.6126920928633831, "grad_norm": 7.6875, "learning_rate": 3.993198191519211e-05, "loss": 0.8533462524414063, "mean_token_accuracy": 0.7929553411900997, "num_tokens": 42271667.0, "step": 21390 }, { "entropy": 0.8870396001264453, "epoch": 0.6129785314294717, "grad_norm": 8.0625, "learning_rate": 3.992282780399469e-05, "loss": 0.8210672378540039, "mean_token_accuracy": 0.8161398217082023, "num_tokens": 42289668.0, "step": 21400 }, { "entropy": 1.0642244413495063, "epoch": 0.6132649699955602, "grad_norm": 6.46875, "learning_rate": 3.9913670583437014e-05, "loss": 1.1320651054382325, "mean_token_accuracy": 0.7501522053033114, "num_tokens": 42309435.0, "step": 21410 }, { "entropy": 0.8919663559645414, "epoch": 0.6135514085616487, "grad_norm": 6.78125, "learning_rate": 3.990451025542707e-05, "loss": 0.8975013732910156, "mean_token_accuracy": 0.7871919363737107, "num_tokens": 42328783.0, "step": 21420 }, { "entropy": 0.8999335646629334, "epoch": 0.6138378471277373, "grad_norm": 6.375, "learning_rate": 3.989534682187356e-05, "loss": 0.8726045608520507, "mean_token_accuracy": 0.8020846236497163, "num_tokens": 42349063.0, "step": 21430 }, { "entropy": 0.949260525777936, "epoch": 0.6141242856938258, "grad_norm": 8.1875, "learning_rate": 3.988618028468578e-05, "loss": 1.0122108459472656, "mean_token_accuracy": 0.7629811208695173, "num_tokens": 42367728.0, "step": 21440 }, { "entropy": 0.9180545607581735, "epoch": 0.6144107242599144, "grad_norm": 9.4375, "learning_rate": 3.9877010645773696e-05, "loss": 0.9360054969787598, "mean_token_accuracy": 0.788599856942892, "num_tokens": 42387145.0, "step": 21450 }, { "entropy": 1.0036912895739079, "epoch": 0.6146971628260028, "grad_norm": 7.34375, "learning_rate": 3.986783790704792e-05, "loss": 1.0235818862915038, "mean_token_accuracy": 0.7695517284795642, "num_tokens": 42407185.0, "step": 21460 }, { "entropy": 0.919987709634006, "epoch": 0.6149836013920914, "grad_norm": 6.9375, "learning_rate": 3.985866207041972e-05, "loss": 0.9531692504882813, "mean_token_accuracy": 0.7836550898849964, "num_tokens": 42425639.0, "step": 21470 }, { "entropy": 1.0659559171646833, "epoch": 0.61527003995818, "grad_norm": 8.6875, "learning_rate": 3.9849483137800984e-05, "loss": 1.1032164573669434, "mean_token_accuracy": 0.7574559256434441, "num_tokens": 42446794.0, "step": 21480 }, { "entropy": 0.9576913375407458, "epoch": 0.6155564785242685, "grad_norm": 8.25, "learning_rate": 3.984030111110426e-05, "loss": 0.9815732002258301, "mean_token_accuracy": 0.7753238756209612, "num_tokens": 42468295.0, "step": 21490 }, { "entropy": 0.9121747886762023, "epoch": 0.6158429170903571, "grad_norm": 9.1875, "learning_rate": 3.983111599224275e-05, "loss": 0.9027762413024902, "mean_token_accuracy": 0.7837694879621268, "num_tokens": 42487238.0, "step": 21500 }, { "entropy": 0.9780509900301695, "epoch": 0.6161293556564456, "grad_norm": 9.0, "learning_rate": 3.982192778313029e-05, "loss": 0.9976916313171387, "mean_token_accuracy": 0.7688472300767899, "num_tokens": 42507164.0, "step": 21510 }, { "entropy": 0.9557992301881313, "epoch": 0.6164157942225341, "grad_norm": 7.34375, "learning_rate": 3.981273648568134e-05, "loss": 0.9735465049743652, "mean_token_accuracy": 0.7786841005086899, "num_tokens": 42527070.0, "step": 21520 }, { "entropy": 0.9095773328095674, "epoch": 0.6167022327886227, "grad_norm": 8.1875, "learning_rate": 3.9803542101811044e-05, "loss": 0.9097620010375976, "mean_token_accuracy": 0.7947625555098057, "num_tokens": 42547018.0, "step": 21530 }, { "entropy": 0.9053039344027638, "epoch": 0.6169886713547112, "grad_norm": 9.8125, "learning_rate": 3.979434463343515e-05, "loss": 0.8891491889953613, "mean_token_accuracy": 0.8050674170255661, "num_tokens": 42566533.0, "step": 21540 }, { "entropy": 0.8114087164402009, "epoch": 0.6172751099207997, "grad_norm": 8.8125, "learning_rate": 3.978514408247009e-05, "loss": 0.8709220886230469, "mean_token_accuracy": 0.7960758753120899, "num_tokens": 42587702.0, "step": 21550 }, { "entropy": 0.7838315076194704, "epoch": 0.6175615484868883, "grad_norm": 8.125, "learning_rate": 3.97759404508329e-05, "loss": 0.818719482421875, "mean_token_accuracy": 0.8078423563390971, "num_tokens": 42607044.0, "step": 21560 }, { "entropy": 0.9934518793597817, "epoch": 0.6178479870529768, "grad_norm": 10.5, "learning_rate": 3.9766733740441274e-05, "loss": 0.9469232559204102, "mean_token_accuracy": 0.7810003712773324, "num_tokens": 42626707.0, "step": 21570 }, { "entropy": 0.885506845265627, "epoch": 0.6181344256190654, "grad_norm": 7.75, "learning_rate": 3.975752395321355e-05, "loss": 0.8913700103759765, "mean_token_accuracy": 0.7940637603402138, "num_tokens": 42645791.0, "step": 21580 }, { "entropy": 0.8530406372621655, "epoch": 0.6184208641851539, "grad_norm": 7.46875, "learning_rate": 3.974831109106871e-05, "loss": 0.8667236328125, "mean_token_accuracy": 0.7981486685574055, "num_tokens": 42663516.0, "step": 21590 }, { "entropy": 1.0198580898344516, "epoch": 0.6187073027512424, "grad_norm": 5.59375, "learning_rate": 3.973909515592636e-05, "loss": 1.0000584602355957, "mean_token_accuracy": 0.7748429756611586, "num_tokens": 42683553.0, "step": 21600 }, { "entropy": 0.8609779054298997, "epoch": 0.618993741317331, "grad_norm": 9.25, "learning_rate": 3.972987614970676e-05, "loss": 0.8467598915100097, "mean_token_accuracy": 0.8031350560486317, "num_tokens": 42703277.0, "step": 21610 }, { "entropy": 0.9730033710598945, "epoch": 0.6192801798834195, "grad_norm": 9.375, "learning_rate": 3.97206540743308e-05, "loss": 0.9542336463928223, "mean_token_accuracy": 0.7802342090755701, "num_tokens": 42723065.0, "step": 21620 }, { "entropy": 0.9092322899028659, "epoch": 0.619566618449508, "grad_norm": 9.625, "learning_rate": 3.971142893172004e-05, "loss": 0.9304965972900391, "mean_token_accuracy": 0.7851572770625352, "num_tokens": 42742077.0, "step": 21630 }, { "entropy": 0.8767265608534217, "epoch": 0.6198530570155966, "grad_norm": 8.375, "learning_rate": 3.970220072379662e-05, "loss": 0.908015251159668, "mean_token_accuracy": 0.7878688059747219, "num_tokens": 42762527.0, "step": 21640 }, { "entropy": 0.8960085434839129, "epoch": 0.6201394955816851, "grad_norm": 10.125, "learning_rate": 3.9692969452483384e-05, "loss": 0.882050895690918, "mean_token_accuracy": 0.7907858695834875, "num_tokens": 42782039.0, "step": 21650 }, { "entropy": 0.8196407787501812, "epoch": 0.6204259341477737, "grad_norm": 8.25, "learning_rate": 3.968373511970378e-05, "loss": 0.8495737075805664, "mean_token_accuracy": 0.794497049599886, "num_tokens": 42801074.0, "step": 21660 }, { "entropy": 0.9734192976728082, "epoch": 0.6207123727138621, "grad_norm": 10.875, "learning_rate": 3.967449772738188e-05, "loss": 0.9475679397583008, "mean_token_accuracy": 0.7783634439110756, "num_tokens": 42821565.0, "step": 21670 }, { "entropy": 0.8653921574354172, "epoch": 0.6209988112799507, "grad_norm": 7.15625, "learning_rate": 3.966525727744243e-05, "loss": 0.8672385215759277, "mean_token_accuracy": 0.8005895636975765, "num_tokens": 42840658.0, "step": 21680 }, { "entropy": 0.9960725169628859, "epoch": 0.6212852498460393, "grad_norm": 7.4375, "learning_rate": 3.965601377181079e-05, "loss": 1.001399326324463, "mean_token_accuracy": 0.7646365784108639, "num_tokens": 42858920.0, "step": 21690 }, { "entropy": 0.976169890165329, "epoch": 0.6215716884121278, "grad_norm": 8.25, "learning_rate": 3.964676721241295e-05, "loss": 0.9807143211364746, "mean_token_accuracy": 0.7736262317746878, "num_tokens": 42878650.0, "step": 21700 }, { "entropy": 0.9904242061078549, "epoch": 0.6218581269782163, "grad_norm": 8.375, "learning_rate": 3.9637517601175564e-05, "loss": 1.0749170303344726, "mean_token_accuracy": 0.756168657541275, "num_tokens": 42898078.0, "step": 21710 }, { "entropy": 0.8459861533716321, "epoch": 0.6221445655443049, "grad_norm": 7.46875, "learning_rate": 3.96282649400259e-05, "loss": 0.8309358596801758, "mean_token_accuracy": 0.8131593700498343, "num_tokens": 42917169.0, "step": 21720 }, { "entropy": 0.8487146643921732, "epoch": 0.6224310041103934, "grad_norm": 7.9375, "learning_rate": 3.961900923089186e-05, "loss": 0.8306548118591308, "mean_token_accuracy": 0.8059241883456707, "num_tokens": 42936288.0, "step": 21730 }, { "entropy": 0.8764183197170496, "epoch": 0.622717442676482, "grad_norm": 6.28125, "learning_rate": 3.9609750475702e-05, "loss": 0.8847857475280761, "mean_token_accuracy": 0.791563218086958, "num_tokens": 42955226.0, "step": 21740 }, { "entropy": 0.9937205128371716, "epoch": 0.6230038812425704, "grad_norm": 7.15625, "learning_rate": 3.9600488676385504e-05, "loss": 0.9262320518493652, "mean_token_accuracy": 0.7865871626883745, "num_tokens": 42974860.0, "step": 21750 }, { "entropy": 0.941679079644382, "epoch": 0.623290319808659, "grad_norm": 9.75, "learning_rate": 3.959122383487216e-05, "loss": 0.9909570693969727, "mean_token_accuracy": 0.7756388328969479, "num_tokens": 42994902.0, "step": 21760 }, { "entropy": 0.9695995369926095, "epoch": 0.6235767583747476, "grad_norm": 6.375, "learning_rate": 3.9581955953092435e-05, "loss": 0.9894150733947754, "mean_token_accuracy": 0.7699768807739019, "num_tokens": 43015736.0, "step": 21770 }, { "entropy": 1.0112689251080156, "epoch": 0.6238631969408361, "grad_norm": 9.0, "learning_rate": 3.9572685032977405e-05, "loss": 1.044120979309082, "mean_token_accuracy": 0.7665673263370991, "num_tokens": 43034517.0, "step": 21780 }, { "entropy": 0.898890046030283, "epoch": 0.6241496355069247, "grad_norm": 8.6875, "learning_rate": 3.956341107645879e-05, "loss": 1.0126422882080077, "mean_token_accuracy": 0.7743716809898615, "num_tokens": 43055043.0, "step": 21790 }, { "entropy": 0.99359982162714, "epoch": 0.6244360740730132, "grad_norm": 9.5, "learning_rate": 3.955413408546892e-05, "loss": 1.012258529663086, "mean_token_accuracy": 0.7691522307693959, "num_tokens": 43075370.0, "step": 21800 }, { "entropy": 0.9251581087708474, "epoch": 0.6247225126391017, "grad_norm": 8.4375, "learning_rate": 3.95448540619408e-05, "loss": 0.8824054718017578, "mean_token_accuracy": 0.7972671285271644, "num_tokens": 43094072.0, "step": 21810 }, { "entropy": 0.857103344425559, "epoch": 0.6250089512051903, "grad_norm": 6.375, "learning_rate": 3.9535571007808006e-05, "loss": 0.8577948570251465, "mean_token_accuracy": 0.7906800910830498, "num_tokens": 43113252.0, "step": 21820 }, { "entropy": 0.9064915968105197, "epoch": 0.6252953897712789, "grad_norm": 8.375, "learning_rate": 3.9526284925004794e-05, "loss": 0.8851880073547364, "mean_token_accuracy": 0.79220184199512, "num_tokens": 43131984.0, "step": 21830 }, { "entropy": 0.9035031069070101, "epoch": 0.6255818283373673, "grad_norm": 10.4375, "learning_rate": 3.951699581546606e-05, "loss": 0.8989022254943848, "mean_token_accuracy": 0.7871453911066055, "num_tokens": 43151513.0, "step": 21840 }, { "entropy": 0.9971307696774602, "epoch": 0.6258682669034559, "grad_norm": 8.25, "learning_rate": 3.9507703681127277e-05, "loss": 1.0234750747680663, "mean_token_accuracy": 0.7748494818806648, "num_tokens": 43172284.0, "step": 21850 }, { "entropy": 0.9900875061750412, "epoch": 0.6261547054695444, "grad_norm": 8.4375, "learning_rate": 3.949840852392459e-05, "loss": 1.0449282646179199, "mean_token_accuracy": 0.7648820500820875, "num_tokens": 43192658.0, "step": 21860 }, { "entropy": 0.913403133675456, "epoch": 0.626441144035633, "grad_norm": 6.1875, "learning_rate": 3.948911034579477e-05, "loss": 0.9260476112365723, "mean_token_accuracy": 0.788822765275836, "num_tokens": 43212271.0, "step": 21870 }, { "entropy": 0.9513774402439594, "epoch": 0.6267275826017215, "grad_norm": 5.21875, "learning_rate": 3.9479809148675206e-05, "loss": 0.9205931663513184, "mean_token_accuracy": 0.7873339593410492, "num_tokens": 43233004.0, "step": 21880 }, { "entropy": 0.9041346196085215, "epoch": 0.62701402116781, "grad_norm": 8.0625, "learning_rate": 3.9470504934503904e-05, "loss": 0.9279412269592285, "mean_token_accuracy": 0.779343643411994, "num_tokens": 43253174.0, "step": 21890 }, { "entropy": 0.9794464088976383, "epoch": 0.6273004597338986, "grad_norm": 6.78125, "learning_rate": 3.9461197705219546e-05, "loss": 0.9935440063476563, "mean_token_accuracy": 0.7687275119125843, "num_tokens": 43272616.0, "step": 21900 }, { "entropy": 0.9813774359878152, "epoch": 0.6275868982999872, "grad_norm": 8.0625, "learning_rate": 3.9451887462761386e-05, "loss": 0.9266609191894531, "mean_token_accuracy": 0.7832588758319616, "num_tokens": 43292168.0, "step": 21910 }, { "entropy": 0.9154514050111174, "epoch": 0.6278733368660756, "grad_norm": 7.59375, "learning_rate": 3.944257420906934e-05, "loss": 0.8751792907714844, "mean_token_accuracy": 0.7905846066772938, "num_tokens": 43313668.0, "step": 21920 }, { "entropy": 0.8968888252973557, "epoch": 0.6281597754321642, "grad_norm": 8.25, "learning_rate": 3.943325794608393e-05, "loss": 0.9274250030517578, "mean_token_accuracy": 0.7881258871406317, "num_tokens": 43332515.0, "step": 21930 }, { "entropy": 0.9620690947398544, "epoch": 0.6284462139982527, "grad_norm": 8.3125, "learning_rate": 3.942393867574635e-05, "loss": 1.0148891448974608, "mean_token_accuracy": 0.7651188805699348, "num_tokens": 43352326.0, "step": 21940 }, { "entropy": 0.9012795368209481, "epoch": 0.6287326525643413, "grad_norm": 7.25, "learning_rate": 3.941461639999835e-05, "loss": 0.951259708404541, "mean_token_accuracy": 0.781118031218648, "num_tokens": 43371666.0, "step": 21950 }, { "entropy": 0.9552686661481857, "epoch": 0.6290190911304298, "grad_norm": 6.3125, "learning_rate": 3.9405291120782374e-05, "loss": 0.998451042175293, "mean_token_accuracy": 0.7703643348067999, "num_tokens": 43392052.0, "step": 21960 }, { "entropy": 0.9365689104422927, "epoch": 0.6293055296965183, "grad_norm": 7.21875, "learning_rate": 3.939596284004143e-05, "loss": 0.872525691986084, "mean_token_accuracy": 0.7938596583902836, "num_tokens": 43412363.0, "step": 21970 }, { "entropy": 0.9144134005531669, "epoch": 0.6295919682626069, "grad_norm": 8.1875, "learning_rate": 3.938663155971922e-05, "loss": 0.9601176261901856, "mean_token_accuracy": 0.7727459536865353, "num_tokens": 43431662.0, "step": 21980 }, { "entropy": 0.8954760676249862, "epoch": 0.6298784068286954, "grad_norm": 8.375, "learning_rate": 3.937729728176002e-05, "loss": 0.8879722595214844, "mean_token_accuracy": 0.8007520616054535, "num_tokens": 43451461.0, "step": 21990 }, { "entropy": 0.9030739717185498, "epoch": 0.6301648453947839, "grad_norm": 7.09375, "learning_rate": 3.936796000810873e-05, "loss": 0.9617762565612793, "mean_token_accuracy": 0.7725638631731272, "num_tokens": 43469531.0, "step": 22000 }, { "entropy": 0.8425525259226561, "epoch": 0.6304512839608725, "grad_norm": 7.15625, "learning_rate": 3.935861974071091e-05, "loss": 0.8613410949707031, "mean_token_accuracy": 0.8038687307387591, "num_tokens": 43488938.0, "step": 22010 }, { "entropy": 0.9750666160136461, "epoch": 0.630737722526961, "grad_norm": 5.5, "learning_rate": 3.934927648151271e-05, "loss": 0.994815444946289, "mean_token_accuracy": 0.7835616357624531, "num_tokens": 43508555.0, "step": 22020 }, { "entropy": 0.9725808409973979, "epoch": 0.6310241610930496, "grad_norm": 6.5, "learning_rate": 3.933993023246093e-05, "loss": 0.9908555030822754, "mean_token_accuracy": 0.7858356811106205, "num_tokens": 43528507.0, "step": 22030 }, { "entropy": 0.8921185329556465, "epoch": 0.6313105996591382, "grad_norm": 9.1875, "learning_rate": 3.933058099550296e-05, "loss": 0.8680631637573242, "mean_token_accuracy": 0.7986000508069993, "num_tokens": 43548330.0, "step": 22040 }, { "entropy": 0.9197222735732794, "epoch": 0.6315970382252266, "grad_norm": 8.9375, "learning_rate": 3.932122877258685e-05, "loss": 0.8812421798706055, "mean_token_accuracy": 0.7980240326374769, "num_tokens": 43568310.0, "step": 22050 }, { "entropy": 0.902125951461494, "epoch": 0.6318834767913152, "grad_norm": 8.5, "learning_rate": 3.9311873565661245e-05, "loss": 0.8925121307373047, "mean_token_accuracy": 0.7870840545743704, "num_tokens": 43587730.0, "step": 22060 }, { "entropy": 0.9313517795875669, "epoch": 0.6321699153574037, "grad_norm": 9.25, "learning_rate": 3.930251537667542e-05, "loss": 0.9625690460205079, "mean_token_accuracy": 0.7717984311282635, "num_tokens": 43609123.0, "step": 22070 }, { "entropy": 0.8662886992096901, "epoch": 0.6324563539234923, "grad_norm": 9.875, "learning_rate": 3.9293154207579274e-05, "loss": 0.9740381240844727, "mean_token_accuracy": 0.7767984326928854, "num_tokens": 43629937.0, "step": 22080 }, { "entropy": 0.8445108029991388, "epoch": 0.6327427924895808, "grad_norm": 8.625, "learning_rate": 3.928379006032333e-05, "loss": 0.8383246421813965, "mean_token_accuracy": 0.8011367581784725, "num_tokens": 43649606.0, "step": 22090 }, { "entropy": 1.0122460559010507, "epoch": 0.6330292310556693, "grad_norm": 7.34375, "learning_rate": 3.927442293685872e-05, "loss": 1.0044979095458983, "mean_token_accuracy": 0.7732941288501024, "num_tokens": 43669662.0, "step": 22100 }, { "entropy": 0.8975360499694943, "epoch": 0.6333156696217579, "grad_norm": 7.28125, "learning_rate": 3.9265052839137204e-05, "loss": 0.9004294395446777, "mean_token_accuracy": 0.794927317649126, "num_tokens": 43688851.0, "step": 22110 }, { "entropy": 0.9065792698413133, "epoch": 0.6336021081878465, "grad_norm": 7.71875, "learning_rate": 3.9255679769111175e-05, "loss": 0.9747360229492188, "mean_token_accuracy": 0.7772964276373386, "num_tokens": 43708800.0, "step": 22120 }, { "entropy": 0.8763492200523615, "epoch": 0.6338885467539349, "grad_norm": 7.09375, "learning_rate": 3.924630372873361e-05, "loss": 0.8573235511779785, "mean_token_accuracy": 0.802193546667695, "num_tokens": 43728763.0, "step": 22130 }, { "entropy": 0.9529889117926359, "epoch": 0.6341749853200235, "grad_norm": 5.75, "learning_rate": 3.923692471995813e-05, "loss": 0.9217046737670899, "mean_token_accuracy": 0.7940693061798811, "num_tokens": 43748054.0, "step": 22140 }, { "entropy": 0.9323940431699157, "epoch": 0.634461423886112, "grad_norm": 6.875, "learning_rate": 3.922754274473898e-05, "loss": 0.8833812713623047, "mean_token_accuracy": 0.7922771837562322, "num_tokens": 43768540.0, "step": 22150 }, { "entropy": 0.8668142009526492, "epoch": 0.6347478624522006, "grad_norm": 7.8125, "learning_rate": 3.921815780503101e-05, "loss": 0.916175651550293, "mean_token_accuracy": 0.7913786351680756, "num_tokens": 43786998.0, "step": 22160 }, { "entropy": 0.9192729352042079, "epoch": 0.6350343010182891, "grad_norm": 10.0, "learning_rate": 3.920876990278968e-05, "loss": 0.9265934944152832, "mean_token_accuracy": 0.7872365403920412, "num_tokens": 43806645.0, "step": 22170 }, { "entropy": 0.889906695485115, "epoch": 0.6353207395843776, "grad_norm": 6.625, "learning_rate": 3.91993790399711e-05, "loss": 0.9652253150939941, "mean_token_accuracy": 0.7815795511007309, "num_tokens": 43826982.0, "step": 22180 }, { "entropy": 0.9756072624586523, "epoch": 0.6356071781504662, "grad_norm": 9.1875, "learning_rate": 3.9189985218531954e-05, "loss": 1.0104361534118653, "mean_token_accuracy": 0.7678293228149414, "num_tokens": 43847019.0, "step": 22190 }, { "entropy": 1.068906707689166, "epoch": 0.6358936167165548, "grad_norm": 11.8125, "learning_rate": 3.918058844042957e-05, "loss": 1.1275259971618652, "mean_token_accuracy": 0.753492145985365, "num_tokens": 43866807.0, "step": 22200 }, { "entropy": 0.8884169787168503, "epoch": 0.6361800552826432, "grad_norm": 7.09375, "learning_rate": 3.91711887076219e-05, "loss": 0.9018492698669434, "mean_token_accuracy": 0.7966490957885981, "num_tokens": 43886949.0, "step": 22210 }, { "entropy": 0.8576098520308733, "epoch": 0.6364664938487318, "grad_norm": 7.28125, "learning_rate": 3.916178602206747e-05, "loss": 0.8391011238098145, "mean_token_accuracy": 0.8052167434245348, "num_tokens": 43906116.0, "step": 22220 }, { "entropy": 0.959751558303833, "epoch": 0.6367529324148203, "grad_norm": 7.75, "learning_rate": 3.9152380385725475e-05, "loss": 0.9795754432678223, "mean_token_accuracy": 0.772762817516923, "num_tokens": 43928132.0, "step": 22230 }, { "entropy": 0.986600223556161, "epoch": 0.6370393709809089, "grad_norm": 9.5, "learning_rate": 3.914297180055569e-05, "loss": 1.048435115814209, "mean_token_accuracy": 0.7678979497402907, "num_tokens": 43948647.0, "step": 22240 }, { "entropy": 0.8919928649440407, "epoch": 0.6373258095469974, "grad_norm": 16.5, "learning_rate": 3.91335602685185e-05, "loss": 0.9076590538024902, "mean_token_accuracy": 0.7863856438547373, "num_tokens": 43969060.0, "step": 22250 }, { "entropy": 0.9068727388978004, "epoch": 0.6376122481130859, "grad_norm": 7.90625, "learning_rate": 3.912414579157494e-05, "loss": 0.8976054191589355, "mean_token_accuracy": 0.7875074785202741, "num_tokens": 43988125.0, "step": 22260 }, { "entropy": 0.9643635045737028, "epoch": 0.6378986866791745, "grad_norm": 7.0625, "learning_rate": 3.911472837168661e-05, "loss": 0.9923530578613281, "mean_token_accuracy": 0.7769703358411789, "num_tokens": 44009432.0, "step": 22270 }, { "entropy": 0.9225421917624772, "epoch": 0.638185125245263, "grad_norm": 7.25, "learning_rate": 3.910530801081578e-05, "loss": 0.8976520538330078, "mean_token_accuracy": 0.7898676216602325, "num_tokens": 44029652.0, "step": 22280 }, { "entropy": 1.0199335306882857, "epoch": 0.6384715638113515, "grad_norm": 7.6875, "learning_rate": 3.9095884710925265e-05, "loss": 1.0756010055541991, "mean_token_accuracy": 0.757290604710579, "num_tokens": 44050761.0, "step": 22290 }, { "entropy": 0.8560690857470036, "epoch": 0.6387580023774401, "grad_norm": 6.09375, "learning_rate": 3.908645847397856e-05, "loss": 0.8347340583801269, "mean_token_accuracy": 0.796586674451828, "num_tokens": 44071014.0, "step": 22300 }, { "entropy": 0.944689245801419, "epoch": 0.6390444409435286, "grad_norm": 6.5, "learning_rate": 3.9077029301939725e-05, "loss": 0.9123414993286133, "mean_token_accuracy": 0.791766332089901, "num_tokens": 44090815.0, "step": 22310 }, { "entropy": 0.8729799523949623, "epoch": 0.6393308795096172, "grad_norm": 8.3125, "learning_rate": 3.9067597196773455e-05, "loss": 0.9163877487182617, "mean_token_accuracy": 0.7888689719140529, "num_tokens": 44110656.0, "step": 22320 }, { "entropy": 0.9006530899554491, "epoch": 0.6396173180757058, "grad_norm": 7.3125, "learning_rate": 3.9058162160445036e-05, "loss": 0.9575582504272461, "mean_token_accuracy": 0.7837183397263289, "num_tokens": 44129545.0, "step": 22330 }, { "entropy": 0.8503710435703397, "epoch": 0.6399037566417942, "grad_norm": 7.09375, "learning_rate": 3.90487241949204e-05, "loss": 0.816905403137207, "mean_token_accuracy": 0.8006047587841749, "num_tokens": 44150330.0, "step": 22340 }, { "entropy": 0.9433940965682268, "epoch": 0.6401901952078828, "grad_norm": 8.0625, "learning_rate": 3.903928330216604e-05, "loss": 0.9354496955871582, "mean_token_accuracy": 0.78372464440763, "num_tokens": 44170369.0, "step": 22350 }, { "entropy": 0.8338274862617254, "epoch": 0.6404766337739713, "grad_norm": 8.4375, "learning_rate": 3.90298394841491e-05, "loss": 0.8598258018493652, "mean_token_accuracy": 0.79914346113801, "num_tokens": 44189857.0, "step": 22360 }, { "entropy": 0.8946568100713194, "epoch": 0.6407630723400599, "grad_norm": 10.5625, "learning_rate": 3.902039274283732e-05, "loss": 0.8722133636474609, "mean_token_accuracy": 0.794972014427185, "num_tokens": 44210535.0, "step": 22370 }, { "entropy": 0.8309621941298246, "epoch": 0.6410495109061484, "grad_norm": 8.5, "learning_rate": 3.9010943080199045e-05, "loss": 0.8612496376037597, "mean_token_accuracy": 0.7979394897818566, "num_tokens": 44230522.0, "step": 22380 }, { "entropy": 1.0275702426210045, "epoch": 0.6413359494722369, "grad_norm": 7.25, "learning_rate": 3.900149049820323e-05, "loss": 1.0629887580871582, "mean_token_accuracy": 0.7690297964960336, "num_tokens": 44249864.0, "step": 22390 }, { "entropy": 0.9767688054591417, "epoch": 0.6416223880383255, "grad_norm": 9.75, "learning_rate": 3.899203499881945e-05, "loss": 0.953999137878418, "mean_token_accuracy": 0.7919405065476894, "num_tokens": 44271131.0, "step": 22400 }, { "entropy": 0.9294959982857108, "epoch": 0.6419088266044141, "grad_norm": 8.9375, "learning_rate": 3.898257658401786e-05, "loss": 0.9641952514648438, "mean_token_accuracy": 0.7883687581866979, "num_tokens": 44291382.0, "step": 22410 }, { "entropy": 0.8459644271060824, "epoch": 0.6421952651705025, "grad_norm": 9.625, "learning_rate": 3.8973115255769265e-05, "loss": 0.819830322265625, "mean_token_accuracy": 0.8105485625565052, "num_tokens": 44310407.0, "step": 22420 }, { "entropy": 0.9576626213267445, "epoch": 0.6424817037365911, "grad_norm": 8.25, "learning_rate": 3.8963651016045034e-05, "loss": 0.9917973518371582, "mean_token_accuracy": 0.7719242431223392, "num_tokens": 44331077.0, "step": 22430 }, { "entropy": 0.9282437870278955, "epoch": 0.6427681423026796, "grad_norm": 9.8125, "learning_rate": 3.895418386681717e-05, "loss": 0.9387789726257324, "mean_token_accuracy": 0.7888801168650389, "num_tokens": 44350166.0, "step": 22440 }, { "entropy": 0.8456738986074924, "epoch": 0.6430545808687682, "grad_norm": 7.375, "learning_rate": 3.894471381005827e-05, "loss": 0.8855236053466797, "mean_token_accuracy": 0.7942288026213646, "num_tokens": 44369510.0, "step": 22450 }, { "entropy": 0.8561990622431039, "epoch": 0.6433410194348567, "grad_norm": 6.1875, "learning_rate": 3.893524084774153e-05, "loss": 0.8386794090270996, "mean_token_accuracy": 0.7894306804984808, "num_tokens": 44390167.0, "step": 22460 }, { "entropy": 0.8619652320630848, "epoch": 0.6436274580009452, "grad_norm": 6.78125, "learning_rate": 3.8925764981840776e-05, "loss": 0.8096957206726074, "mean_token_accuracy": 0.8049199424684048, "num_tokens": 44409600.0, "step": 22470 }, { "entropy": 0.9459259003400803, "epoch": 0.6439138965670338, "grad_norm": 14.0, "learning_rate": 3.8916286214330426e-05, "loss": 0.9588747978210449, "mean_token_accuracy": 0.7801275923848152, "num_tokens": 44428718.0, "step": 22480 }, { "entropy": 0.9236369654536247, "epoch": 0.6442003351331224, "grad_norm": 6.96875, "learning_rate": 3.89068045471855e-05, "loss": 0.8956018447875976, "mean_token_accuracy": 0.7848766662180424, "num_tokens": 44449264.0, "step": 22490 }, { "entropy": 0.8311104310676456, "epoch": 0.6444867736992108, "grad_norm": 9.0625, "learning_rate": 3.8897319982381605e-05, "loss": 0.8809353828430175, "mean_token_accuracy": 0.7970906995236874, "num_tokens": 44469169.0, "step": 22500 }, { "entropy": 0.9523693701252341, "epoch": 0.6447732122652994, "grad_norm": 7.0625, "learning_rate": 3.8887832521895e-05, "loss": 0.9376598358154297, "mean_token_accuracy": 0.7859144486486912, "num_tokens": 44489928.0, "step": 22510 }, { "entropy": 0.9099814087152481, "epoch": 0.6450596508313879, "grad_norm": 6.9375, "learning_rate": 3.88783421677025e-05, "loss": 0.9119604110717774, "mean_token_accuracy": 0.787454879656434, "num_tokens": 44509930.0, "step": 22520 }, { "entropy": 0.8894009451381862, "epoch": 0.6453460893974765, "grad_norm": 6.75, "learning_rate": 3.886884892178154e-05, "loss": 0.956300163269043, "mean_token_accuracy": 0.7796136941760778, "num_tokens": 44529759.0, "step": 22530 }, { "entropy": 0.9388137497007847, "epoch": 0.645632527963565, "grad_norm": 8.375, "learning_rate": 3.885935278611016e-05, "loss": 0.9333770751953125, "mean_token_accuracy": 0.7783537801355124, "num_tokens": 44549383.0, "step": 22540 }, { "entropy": 0.9887114821001888, "epoch": 0.6459189665296535, "grad_norm": 7.78125, "learning_rate": 3.884985376266701e-05, "loss": 0.9868999481201172, "mean_token_accuracy": 0.7881288662552833, "num_tokens": 44569365.0, "step": 22550 }, { "entropy": 0.919053116440773, "epoch": 0.6462054050957421, "grad_norm": 6.40625, "learning_rate": 3.884035185343131e-05, "loss": 0.9126174926757813, "mean_token_accuracy": 0.7788828633725643, "num_tokens": 44587327.0, "step": 22560 }, { "entropy": 1.0299420004710556, "epoch": 0.6464918436618307, "grad_norm": 9.125, "learning_rate": 3.883084706038292e-05, "loss": 1.0252874374389649, "mean_token_accuracy": 0.7592982098460197, "num_tokens": 44606861.0, "step": 22570 }, { "entropy": 0.9452397517859936, "epoch": 0.6467782822279192, "grad_norm": 10.375, "learning_rate": 3.8821339385502286e-05, "loss": 0.9575634002685547, "mean_token_accuracy": 0.7732752721756697, "num_tokens": 44628004.0, "step": 22580 }, { "entropy": 0.9163175793364644, "epoch": 0.6470647207940077, "grad_norm": 8.5, "learning_rate": 3.8811828830770447e-05, "loss": 0.8650115966796875, "mean_token_accuracy": 0.7982464917004108, "num_tokens": 44647277.0, "step": 22590 }, { "entropy": 0.8501980051398277, "epoch": 0.6473511593600962, "grad_norm": 7.4375, "learning_rate": 3.880231539816905e-05, "loss": 0.8509060859680175, "mean_token_accuracy": 0.7979789350181818, "num_tokens": 44666789.0, "step": 22600 }, { "entropy": 0.8882537086494267, "epoch": 0.6476375979261848, "grad_norm": 7.28125, "learning_rate": 3.8792799089680335e-05, "loss": 0.8898092269897461, "mean_token_accuracy": 0.7982908442616463, "num_tokens": 44685735.0, "step": 22610 }, { "entropy": 0.9092659370973706, "epoch": 0.6479240364922734, "grad_norm": 10.5, "learning_rate": 3.878327990728714e-05, "loss": 0.9800436973571778, "mean_token_accuracy": 0.7881735842674971, "num_tokens": 44707240.0, "step": 22620 }, { "entropy": 0.7355032010003925, "epoch": 0.6482104750583618, "grad_norm": 8.0625, "learning_rate": 3.8773757852972925e-05, "loss": 0.7902781963348389, "mean_token_accuracy": 0.8144808396697044, "num_tokens": 44725351.0, "step": 22630 }, { "entropy": 0.9388284519314766, "epoch": 0.6484969136244504, "grad_norm": 9.25, "learning_rate": 3.876423292872171e-05, "loss": 1.0065260887145997, "mean_token_accuracy": 0.7760294701904058, "num_tokens": 44745660.0, "step": 22640 }, { "entropy": 0.9486516360193491, "epoch": 0.648783352190539, "grad_norm": 9.4375, "learning_rate": 3.8754705136518154e-05, "loss": 0.9543668746948242, "mean_token_accuracy": 0.7778625778853894, "num_tokens": 44766653.0, "step": 22650 }, { "entropy": 0.8811884829774499, "epoch": 0.6490697907566275, "grad_norm": 5.90625, "learning_rate": 3.8745174478347476e-05, "loss": 0.8522655487060546, "mean_token_accuracy": 0.8103316944092512, "num_tokens": 44786618.0, "step": 22660 }, { "entropy": 0.8679312387481332, "epoch": 0.649356229322716, "grad_norm": 8.3125, "learning_rate": 3.873564095619552e-05, "loss": 0.8800905227661133, "mean_token_accuracy": 0.7946135979145765, "num_tokens": 44807148.0, "step": 22670 }, { "entropy": 0.9480700666084886, "epoch": 0.6496426678888045, "grad_norm": 11.4375, "learning_rate": 3.872610457204872e-05, "loss": 0.9936513900756836, "mean_token_accuracy": 0.770840159803629, "num_tokens": 44827454.0, "step": 22680 }, { "entropy": 0.8437151649966836, "epoch": 0.6499291064548931, "grad_norm": 7.625, "learning_rate": 3.871656532789409e-05, "loss": 0.8436770439147949, "mean_token_accuracy": 0.7978602487593889, "num_tokens": 44846120.0, "step": 22690 }, { "entropy": 0.9959442108869553, "epoch": 0.6502155450209817, "grad_norm": 5.90625, "learning_rate": 3.8707023225719254e-05, "loss": 0.9619386672973633, "mean_token_accuracy": 0.792440676316619, "num_tokens": 44866513.0, "step": 22700 }, { "entropy": 1.0226761890575289, "epoch": 0.6505019835870701, "grad_norm": 9.625, "learning_rate": 3.869747826751244e-05, "loss": 1.027959442138672, "mean_token_accuracy": 0.7675781823694706, "num_tokens": 44885237.0, "step": 22710 }, { "entropy": 0.9059097156859934, "epoch": 0.6507884221531587, "grad_norm": 10.75, "learning_rate": 3.868793045526245e-05, "loss": 0.9633118629455566, "mean_token_accuracy": 0.7799510974436998, "num_tokens": 44905072.0, "step": 22720 }, { "entropy": 0.9725006885826588, "epoch": 0.6510748607192473, "grad_norm": 6.65625, "learning_rate": 3.86783797909587e-05, "loss": 0.9461207389831543, "mean_token_accuracy": 0.7843978337943553, "num_tokens": 44923643.0, "step": 22730 }, { "entropy": 0.9747046899050474, "epoch": 0.6513612992853358, "grad_norm": 5.71875, "learning_rate": 3.8668826276591185e-05, "loss": 0.9596343040466309, "mean_token_accuracy": 0.7839418992400169, "num_tokens": 44944385.0, "step": 22740 }, { "entropy": 0.8609721411019564, "epoch": 0.6516477378514243, "grad_norm": 10.1875, "learning_rate": 3.865926991415051e-05, "loss": 0.8540242195129395, "mean_token_accuracy": 0.7934511575847865, "num_tokens": 44963887.0, "step": 22750 }, { "entropy": 0.9093576775863766, "epoch": 0.6519341764175128, "grad_norm": 7.28125, "learning_rate": 3.864971070562785e-05, "loss": 0.9144698143005371, "mean_token_accuracy": 0.7814730063080788, "num_tokens": 44983330.0, "step": 22760 }, { "entropy": 0.9059786170721054, "epoch": 0.6522206149836014, "grad_norm": 7.28125, "learning_rate": 3.8640148653014996e-05, "loss": 0.9081611633300781, "mean_token_accuracy": 0.7908361550420523, "num_tokens": 45002457.0, "step": 22770 }, { "entropy": 0.8813687536865473, "epoch": 0.65250705354969, "grad_norm": 7.875, "learning_rate": 3.863058375830433e-05, "loss": 0.9298584938049317, "mean_token_accuracy": 0.7796319764107466, "num_tokens": 45022772.0, "step": 22780 }, { "entropy": 0.7959211783483624, "epoch": 0.6527934921157784, "grad_norm": 8.9375, "learning_rate": 3.8621016023488805e-05, "loss": 0.7696258068084717, "mean_token_accuracy": 0.8180242717266083, "num_tokens": 45042825.0, "step": 22790 }, { "entropy": 0.8323979537934065, "epoch": 0.653079930681867, "grad_norm": 7.6875, "learning_rate": 3.861144545056199e-05, "loss": 0.8022558212280273, "mean_token_accuracy": 0.8124545853585005, "num_tokens": 45062979.0, "step": 22800 }, { "entropy": 0.7982686029747128, "epoch": 0.6533663692479555, "grad_norm": 8.375, "learning_rate": 3.860187204151803e-05, "loss": 0.8256909370422363, "mean_token_accuracy": 0.8086091376841068, "num_tokens": 45082377.0, "step": 22810 }, { "entropy": 0.8759147889912129, "epoch": 0.6536528078140441, "grad_norm": 7.90625, "learning_rate": 3.8592295798351666e-05, "loss": 0.9384151458740234, "mean_token_accuracy": 0.783957288786769, "num_tokens": 45102259.0, "step": 22820 }, { "entropy": 1.0228074008598924, "epoch": 0.6539392463801326, "grad_norm": 7.03125, "learning_rate": 3.858271672305824e-05, "loss": 1.0605764389038086, "mean_token_accuracy": 0.7615953620523215, "num_tokens": 45121661.0, "step": 22830 }, { "entropy": 0.812204186618328, "epoch": 0.6542256849462211, "grad_norm": 8.625, "learning_rate": 3.857313481763365e-05, "loss": 0.8009726524353027, "mean_token_accuracy": 0.8216852936893702, "num_tokens": 45140585.0, "step": 22840 }, { "entropy": 0.7916817590594292, "epoch": 0.6545121235123097, "grad_norm": 7.46875, "learning_rate": 3.856355008407443e-05, "loss": 0.8606937408447266, "mean_token_accuracy": 0.8061037711799145, "num_tokens": 45160519.0, "step": 22850 }, { "entropy": 0.9227229975163936, "epoch": 0.6547985620783983, "grad_norm": 7.46875, "learning_rate": 3.8553962524377674e-05, "loss": 0.8921630859375, "mean_token_accuracy": 0.7862365450710058, "num_tokens": 45179569.0, "step": 22860 }, { "entropy": 0.9050315000116825, "epoch": 0.6550850006444868, "grad_norm": 7.3125, "learning_rate": 3.854437214054107e-05, "loss": 0.954566478729248, "mean_token_accuracy": 0.7868342835456132, "num_tokens": 45198814.0, "step": 22870 }, { "entropy": 0.9461556099355221, "epoch": 0.6553714392105753, "grad_norm": 9.0, "learning_rate": 3.8534778934562895e-05, "loss": 0.9370518684387207, "mean_token_accuracy": 0.7834421284496784, "num_tokens": 45218996.0, "step": 22880 }, { "entropy": 0.9407024182379246, "epoch": 0.6556578777766638, "grad_norm": 11.3125, "learning_rate": 3.852518290844202e-05, "loss": 0.9654740333557129, "mean_token_accuracy": 0.7831741657108069, "num_tokens": 45237838.0, "step": 22890 }, { "entropy": 0.8815357193350792, "epoch": 0.6559443163427524, "grad_norm": 7.625, "learning_rate": 3.851558406417789e-05, "loss": 0.8830876350402832, "mean_token_accuracy": 0.7963199000805616, "num_tokens": 45256805.0, "step": 22900 }, { "entropy": 0.8782296074554324, "epoch": 0.656230754908841, "grad_norm": 11.0, "learning_rate": 3.8505982403770554e-05, "loss": 0.9437088966369629, "mean_token_accuracy": 0.7836847331374883, "num_tokens": 45275512.0, "step": 22910 }, { "entropy": 1.0104555912315845, "epoch": 0.6565171934749294, "grad_norm": 8.9375, "learning_rate": 3.8496377929220625e-05, "loss": 1.0315958976745605, "mean_token_accuracy": 0.76339814029634, "num_tokens": 45295084.0, "step": 22920 }, { "entropy": 0.8609929211437702, "epoch": 0.656803632041018, "grad_norm": 6.0625, "learning_rate": 3.848677064252935e-05, "loss": 0.8577310562133789, "mean_token_accuracy": 0.8015160631388426, "num_tokens": 45314186.0, "step": 22930 }, { "entropy": 0.9470567163079977, "epoch": 0.6570900706071066, "grad_norm": 11.0625, "learning_rate": 3.84771605456985e-05, "loss": 0.9081389427185058, "mean_token_accuracy": 0.7880242943763733, "num_tokens": 45335275.0, "step": 22940 }, { "entropy": 0.8757361777126789, "epoch": 0.6573765091731951, "grad_norm": 6.46875, "learning_rate": 3.8467547640730456e-05, "loss": 0.8774962425231934, "mean_token_accuracy": 0.7940940015017987, "num_tokens": 45355456.0, "step": 22950 }, { "entropy": 0.8433198031038046, "epoch": 0.6576629477392836, "grad_norm": 11.875, "learning_rate": 3.8457931929628215e-05, "loss": 0.8380443572998046, "mean_token_accuracy": 0.800097682327032, "num_tokens": 45375332.0, "step": 22960 }, { "entropy": 0.9152161931619048, "epoch": 0.6579493863053721, "grad_norm": 7.46875, "learning_rate": 3.844831341439531e-05, "loss": 0.8949036598205566, "mean_token_accuracy": 0.7754564691334963, "num_tokens": 45395567.0, "step": 22970 }, { "entropy": 0.7952107956632972, "epoch": 0.6582358248714607, "grad_norm": 7.375, "learning_rate": 3.843869209703589e-05, "loss": 0.7261805057525634, "mean_token_accuracy": 0.8109205737709999, "num_tokens": 45414157.0, "step": 22980 }, { "entropy": 0.8574653865769506, "epoch": 0.6585222634375493, "grad_norm": 7.65625, "learning_rate": 3.842906797955468e-05, "loss": 0.8881130218505859, "mean_token_accuracy": 0.7971735812723637, "num_tokens": 45432740.0, "step": 22990 }, { "entropy": 0.873758516088128, "epoch": 0.6588087020036377, "grad_norm": 6.25, "learning_rate": 3.841944106395698e-05, "loss": 0.8962624549865723, "mean_token_accuracy": 0.7915884006768465, "num_tokens": 45451597.0, "step": 23000 }, { "entropy": 0.8562300365418196, "epoch": 0.6590951405697263, "grad_norm": 8.4375, "learning_rate": 3.840981135224868e-05, "loss": 0.8257713317871094, "mean_token_accuracy": 0.8008463565260172, "num_tokens": 45471432.0, "step": 23010 }, { "entropy": 0.8971815157681704, "epoch": 0.6593815791358149, "grad_norm": 9.6875, "learning_rate": 3.840017884643626e-05, "loss": 0.94833402633667, "mean_token_accuracy": 0.7707555256783962, "num_tokens": 45490699.0, "step": 23020 }, { "entropy": 0.8889431161805987, "epoch": 0.6596680177019034, "grad_norm": 8.25, "learning_rate": 3.839054354852677e-05, "loss": 0.9022657394409179, "mean_token_accuracy": 0.7944431319832802, "num_tokens": 45509939.0, "step": 23030 }, { "entropy": 0.9908782538026571, "epoch": 0.6599544562679919, "grad_norm": 9.5, "learning_rate": 3.838090546052785e-05, "loss": 1.0272876739501953, "mean_token_accuracy": 0.7685921404510736, "num_tokens": 45530238.0, "step": 23040 }, { "entropy": 0.9399600770324469, "epoch": 0.6602408948340804, "grad_norm": 8.6875, "learning_rate": 3.837126458444772e-05, "loss": 1.0116050720214844, "mean_token_accuracy": 0.7777301128953695, "num_tokens": 45550492.0, "step": 23050 }, { "entropy": 0.8885143099352717, "epoch": 0.660527333400169, "grad_norm": 8.5, "learning_rate": 3.836162092229516e-05, "loss": 0.8525900840759277, "mean_token_accuracy": 0.7940516788512468, "num_tokens": 45569578.0, "step": 23060 }, { "entropy": 0.857690074108541, "epoch": 0.6608137719662576, "grad_norm": 6.625, "learning_rate": 3.835197447607957e-05, "loss": 0.8312179565429687, "mean_token_accuracy": 0.8000508733093739, "num_tokens": 45589321.0, "step": 23070 }, { "entropy": 0.7944382214918733, "epoch": 0.661100210532346, "grad_norm": 10.5, "learning_rate": 3.8342325247810895e-05, "loss": 0.818697452545166, "mean_token_accuracy": 0.8069204747676849, "num_tokens": 45609098.0, "step": 23080 }, { "entropy": 0.8796201297082007, "epoch": 0.6613866490984346, "grad_norm": 8.875, "learning_rate": 3.833267323949969e-05, "loss": 0.9343830108642578, "mean_token_accuracy": 0.7889334291219712, "num_tokens": 45628822.0, "step": 23090 }, { "entropy": 0.9392872717231512, "epoch": 0.6616730876645232, "grad_norm": 7.40625, "learning_rate": 3.832301845315706e-05, "loss": 0.9675754547119141, "mean_token_accuracy": 0.7764622312039137, "num_tokens": 45648857.0, "step": 23100 }, { "entropy": 0.9299656821414828, "epoch": 0.6619595262306117, "grad_norm": 6.1875, "learning_rate": 3.831336089079471e-05, "loss": 0.9380331039428711, "mean_token_accuracy": 0.7860646154731512, "num_tokens": 45668057.0, "step": 23110 }, { "entropy": 0.90357981082052, "epoch": 0.6622459647967003, "grad_norm": 9.6875, "learning_rate": 3.8303700554424905e-05, "loss": 0.9348695755004883, "mean_token_accuracy": 0.788814963772893, "num_tokens": 45688533.0, "step": 23120 }, { "entropy": 0.9116713162511587, "epoch": 0.6625324033627887, "grad_norm": 6.125, "learning_rate": 3.8294037446060504e-05, "loss": 0.8847149848937989, "mean_token_accuracy": 0.7953954737633466, "num_tokens": 45708358.0, "step": 23130 }, { "entropy": 0.893862858787179, "epoch": 0.6628188419288773, "grad_norm": 7.0, "learning_rate": 3.828437156771495e-05, "loss": 0.8806056976318359, "mean_token_accuracy": 0.7973021131008864, "num_tokens": 45728216.0, "step": 23140 }, { "entropy": 0.8641118073835969, "epoch": 0.6631052804949659, "grad_norm": 7.5, "learning_rate": 3.827470292140223e-05, "loss": 0.8210006713867187, "mean_token_accuracy": 0.8014064136892557, "num_tokens": 45746818.0, "step": 23150 }, { "entropy": 0.9554972615092993, "epoch": 0.6633917190610544, "grad_norm": 11.0, "learning_rate": 3.826503150913695e-05, "loss": 1.0344480514526366, "mean_token_accuracy": 0.7642830304801465, "num_tokens": 45767389.0, "step": 23160 }, { "entropy": 0.9017923820763827, "epoch": 0.6636781576271429, "grad_norm": 5.9375, "learning_rate": 3.825535733293425e-05, "loss": 0.9085247039794921, "mean_token_accuracy": 0.7912683442234993, "num_tokens": 45786200.0, "step": 23170 }, { "entropy": 0.9547636365517974, "epoch": 0.6639645961932314, "grad_norm": 7.78125, "learning_rate": 3.824568039480988e-05, "loss": 0.9796084403991699, "mean_token_accuracy": 0.7788782030344009, "num_tokens": 45805377.0, "step": 23180 }, { "entropy": 0.9325101274996996, "epoch": 0.66425103475932, "grad_norm": 8.0, "learning_rate": 3.8236000696780156e-05, "loss": 0.9932963371276855, "mean_token_accuracy": 0.7687444686889648, "num_tokens": 45825726.0, "step": 23190 }, { "entropy": 0.8763208875432611, "epoch": 0.6645374733254086, "grad_norm": 8.8125, "learning_rate": 3.8226318240861956e-05, "loss": 0.8843619346618652, "mean_token_accuracy": 0.794028839096427, "num_tokens": 45845252.0, "step": 23200 }, { "entropy": 0.7843074448406696, "epoch": 0.664823911891497, "grad_norm": 7.6875, "learning_rate": 3.821663302907275e-05, "loss": 0.7874396800994873, "mean_token_accuracy": 0.8177121058106422, "num_tokens": 45863676.0, "step": 23210 }, { "entropy": 0.9136452928185463, "epoch": 0.6651103504575856, "grad_norm": 8.5625, "learning_rate": 3.820694506343057e-05, "loss": 0.9183270454406738, "mean_token_accuracy": 0.8006648808717728, "num_tokens": 45883923.0, "step": 23220 }, { "entropy": 0.8632227946072817, "epoch": 0.6653967890236742, "grad_norm": 9.25, "learning_rate": 3.819725434595403e-05, "loss": 0.8685300827026368, "mean_token_accuracy": 0.8010946236550808, "num_tokens": 45902950.0, "step": 23230 }, { "entropy": 0.9303806554526091, "epoch": 0.6656832275897627, "grad_norm": 8.0, "learning_rate": 3.818756087866231e-05, "loss": 0.9483536720275879, "mean_token_accuracy": 0.7845831368118524, "num_tokens": 45923386.0, "step": 23240 }, { "entropy": 0.8897776961326599, "epoch": 0.6659696661558512, "grad_norm": 7.9375, "learning_rate": 3.8177864663575166e-05, "loss": 0.8765877723693848, "mean_token_accuracy": 0.7978586934506893, "num_tokens": 45943512.0, "step": 23250 }, { "entropy": 0.8420126687735319, "epoch": 0.6662561047219397, "grad_norm": 6.1875, "learning_rate": 3.8168165702712935e-05, "loss": 0.7989052772521973, "mean_token_accuracy": 0.8130182828754187, "num_tokens": 45963650.0, "step": 23260 }, { "entropy": 0.9216004284098744, "epoch": 0.6665425432880283, "grad_norm": 7.25, "learning_rate": 3.8158463998096506e-05, "loss": 0.9407343864440918, "mean_token_accuracy": 0.7956110060214996, "num_tokens": 45982428.0, "step": 23270 }, { "entropy": 0.9197284761816263, "epoch": 0.6668289818541169, "grad_norm": 6.375, "learning_rate": 3.814875955174736e-05, "loss": 0.9001524925231934, "mean_token_accuracy": 0.7977133721113205, "num_tokens": 46002699.0, "step": 23280 }, { "entropy": 0.8211668686941266, "epoch": 0.6671154204202053, "grad_norm": 7.40625, "learning_rate": 3.8139052365687546e-05, "loss": 0.8624239921569824, "mean_token_accuracy": 0.799767604470253, "num_tokens": 46022581.0, "step": 23290 }, { "entropy": 0.8306294087320566, "epoch": 0.6674018589862939, "grad_norm": 6.0, "learning_rate": 3.812934244193967e-05, "loss": 0.8160804748535156, "mean_token_accuracy": 0.8062486603856087, "num_tokens": 46042860.0, "step": 23300 }, { "entropy": 0.855907554551959, "epoch": 0.6676882975523825, "grad_norm": 8.0625, "learning_rate": 3.811962978252692e-05, "loss": 0.8971040725708008, "mean_token_accuracy": 0.7978474866598845, "num_tokens": 46062892.0, "step": 23310 }, { "entropy": 0.9086446503177286, "epoch": 0.667974736118471, "grad_norm": 8.0, "learning_rate": 3.810991438947306e-05, "loss": 0.9208392143249512, "mean_token_accuracy": 0.7840793844312429, "num_tokens": 46082210.0, "step": 23320 }, { "entropy": 0.8421589640900493, "epoch": 0.6682611746845595, "grad_norm": 6.6875, "learning_rate": 3.81001962648024e-05, "loss": 0.7965210914611817, "mean_token_accuracy": 0.8150952901691199, "num_tokens": 46100920.0, "step": 23330 }, { "entropy": 0.8577923273667694, "epoch": 0.668547613250648, "grad_norm": 9.125, "learning_rate": 3.809047541053985e-05, "loss": 0.9250428199768066, "mean_token_accuracy": 0.7848080772906542, "num_tokens": 46119557.0, "step": 23340 }, { "entropy": 0.8931930897757411, "epoch": 0.6688340518167366, "grad_norm": 10.9375, "learning_rate": 3.808075182871086e-05, "loss": 0.8762700080871582, "mean_token_accuracy": 0.7881566148251296, "num_tokens": 46139611.0, "step": 23350 }, { "entropy": 0.9251813896000385, "epoch": 0.6691204903828252, "grad_norm": 6.21875, "learning_rate": 3.807102552134148e-05, "loss": 0.8911492347717285, "mean_token_accuracy": 0.7905508443713188, "num_tokens": 46160814.0, "step": 23360 }, { "entropy": 0.8740447130054235, "epoch": 0.6694069289489136, "grad_norm": 11.1875, "learning_rate": 3.8061296490458284e-05, "loss": 0.9040107727050781, "mean_token_accuracy": 0.7891867198050022, "num_tokens": 46180837.0, "step": 23370 }, { "entropy": 0.8201585682108998, "epoch": 0.6696933675150022, "grad_norm": 6.71875, "learning_rate": 3.805156473808845e-05, "loss": 0.8851461410522461, "mean_token_accuracy": 0.7935717169195413, "num_tokens": 46200104.0, "step": 23380 }, { "entropy": 0.9080373041331768, "epoch": 0.6699798060810908, "grad_norm": 10.0, "learning_rate": 3.8041830266259726e-05, "loss": 0.9129886627197266, "mean_token_accuracy": 0.7867343708872795, "num_tokens": 46220555.0, "step": 23390 }, { "entropy": 0.9192170156165957, "epoch": 0.6702662446471793, "grad_norm": 6.15625, "learning_rate": 3.803209307700038e-05, "loss": 0.8875781059265136, "mean_token_accuracy": 0.7926689025014639, "num_tokens": 46239908.0, "step": 23400 }, { "entropy": 0.9543895147740841, "epoch": 0.6705526832132679, "grad_norm": 6.59375, "learning_rate": 3.802235317233932e-05, "loss": 0.90999755859375, "mean_token_accuracy": 0.7824549444019795, "num_tokens": 46260337.0, "step": 23410 }, { "entropy": 0.8238056251779199, "epoch": 0.6708391217793563, "grad_norm": 6.6875, "learning_rate": 3.801261055430595e-05, "loss": 0.8561161994934082, "mean_token_accuracy": 0.7915153440088034, "num_tokens": 46279233.0, "step": 23420 }, { "entropy": 0.8776079719886184, "epoch": 0.6711255603454449, "grad_norm": 5.53125, "learning_rate": 3.8002865224930276e-05, "loss": 0.8759838104248047, "mean_token_accuracy": 0.7970323484390974, "num_tokens": 46300202.0, "step": 23430 }, { "entropy": 0.966572598926723, "epoch": 0.6714119989115335, "grad_norm": 7.65625, "learning_rate": 3.7993117186242854e-05, "loss": 0.9568003654479981, "mean_token_accuracy": 0.7862712480127811, "num_tokens": 46320009.0, "step": 23440 }, { "entropy": 0.7571846072562038, "epoch": 0.671698437477622, "grad_norm": 6.6875, "learning_rate": 3.7983366440274824e-05, "loss": 0.7800245761871338, "mean_token_accuracy": 0.812897089868784, "num_tokens": 46340095.0, "step": 23450 }, { "entropy": 0.8918323492631316, "epoch": 0.6719848760437105, "grad_norm": 7.5, "learning_rate": 3.797361298905787e-05, "loss": 0.9016538619995117, "mean_token_accuracy": 0.7905817065387964, "num_tokens": 46361264.0, "step": 23460 }, { "entropy": 0.8704618336632848, "epoch": 0.672271314609799, "grad_norm": 7.5, "learning_rate": 3.7963856834624244e-05, "loss": 0.8952795028686523, "mean_token_accuracy": 0.7963431309908628, "num_tokens": 46380785.0, "step": 23470 }, { "entropy": 0.7960759287700057, "epoch": 0.6725577531758876, "grad_norm": 6.96875, "learning_rate": 3.7954097979006774e-05, "loss": 0.7884669780731202, "mean_token_accuracy": 0.8157178360968829, "num_tokens": 46399795.0, "step": 23480 }, { "entropy": 0.9695372845977545, "epoch": 0.6728441917419762, "grad_norm": 6.71875, "learning_rate": 3.7944336424238844e-05, "loss": 1.0191239356994628, "mean_token_accuracy": 0.7655313782393932, "num_tokens": 46420465.0, "step": 23490 }, { "entropy": 0.9198993441648782, "epoch": 0.6731306303080646, "grad_norm": 8.75, "learning_rate": 3.793457217235438e-05, "loss": 0.8935195922851562, "mean_token_accuracy": 0.7888022102415562, "num_tokens": 46440636.0, "step": 23500 }, { "entropy": 0.8171261554583907, "epoch": 0.6734170688741532, "grad_norm": 7.21875, "learning_rate": 3.792480522538789e-05, "loss": 0.7994399547576905, "mean_token_accuracy": 0.8140453927218914, "num_tokens": 46461241.0, "step": 23510 }, { "entropy": 0.9676499631255865, "epoch": 0.6737035074402418, "grad_norm": 8.4375, "learning_rate": 3.7915035585374456e-05, "loss": 1.0052270889282227, "mean_token_accuracy": 0.7816280674189329, "num_tokens": 46480362.0, "step": 23520 }, { "entropy": 0.8269085709005595, "epoch": 0.6739899460063303, "grad_norm": 8.625, "learning_rate": 3.79052632543497e-05, "loss": 0.842251205444336, "mean_token_accuracy": 0.8143334649503231, "num_tokens": 46499814.0, "step": 23530 }, { "entropy": 0.9777561783790588, "epoch": 0.6742763845724188, "grad_norm": 10.0625, "learning_rate": 3.789548823434981e-05, "loss": 1.0528251647949218, "mean_token_accuracy": 0.7656882911920547, "num_tokens": 46519519.0, "step": 23540 }, { "entropy": 0.7869767639786005, "epoch": 0.6745628231385074, "grad_norm": 7.25, "learning_rate": 3.788571052741153e-05, "loss": 0.7685704231262207, "mean_token_accuracy": 0.8163337204605341, "num_tokens": 46538019.0, "step": 23550 }, { "entropy": 0.8506517441011965, "epoch": 0.6748492617045959, "grad_norm": 7.1875, "learning_rate": 3.787593013557218e-05, "loss": 0.8097248077392578, "mean_token_accuracy": 0.8070813931524754, "num_tokens": 46557453.0, "step": 23560 }, { "entropy": 0.769198240339756, "epoch": 0.6751357002706845, "grad_norm": 6.28125, "learning_rate": 3.786614706086962e-05, "loss": 0.7628098487854004, "mean_token_accuracy": 0.8097487449645996, "num_tokens": 46575993.0, "step": 23570 }, { "entropy": 0.8417650980874896, "epoch": 0.6754221388367729, "grad_norm": 6.875, "learning_rate": 3.785636130534228e-05, "loss": 0.8811795234680175, "mean_token_accuracy": 0.789256677776575, "num_tokens": 46596226.0, "step": 23580 }, { "entropy": 0.8256034040823579, "epoch": 0.6757085774028615, "grad_norm": 7.125, "learning_rate": 3.784657287102915e-05, "loss": 0.8187993049621582, "mean_token_accuracy": 0.8100414216518402, "num_tokens": 46615578.0, "step": 23590 }, { "entropy": 0.8269222309812904, "epoch": 0.6759950159689501, "grad_norm": 8.1875, "learning_rate": 3.783678175996976e-05, "loss": 0.8582427024841308, "mean_token_accuracy": 0.8037688598036766, "num_tokens": 46635949.0, "step": 23600 }, { "entropy": 0.8698379435576499, "epoch": 0.6762814545350386, "grad_norm": 7.0, "learning_rate": 3.7826987974204245e-05, "loss": 0.8518117904663086, "mean_token_accuracy": 0.7998022887855768, "num_tokens": 46655453.0, "step": 23610 }, { "entropy": 0.9736084995791316, "epoch": 0.6765678931011271, "grad_norm": 8.25, "learning_rate": 3.781719151577322e-05, "loss": 1.00388765335083, "mean_token_accuracy": 0.774443319439888, "num_tokens": 46676981.0, "step": 23620 }, { "entropy": 0.7718381651677191, "epoch": 0.6768543316672156, "grad_norm": 6.125, "learning_rate": 3.7807392386717925e-05, "loss": 0.7796341419219971, "mean_token_accuracy": 0.8147437456995249, "num_tokens": 46696333.0, "step": 23630 }, { "entropy": 0.8309880215674639, "epoch": 0.6771407702333042, "grad_norm": 8.875, "learning_rate": 3.779759058908015e-05, "loss": 0.8464741706848145, "mean_token_accuracy": 0.8070103503763676, "num_tokens": 46715933.0, "step": 23640 }, { "entropy": 0.7961538839153945, "epoch": 0.6774272087993928, "grad_norm": 8.0625, "learning_rate": 3.7787786124902183e-05, "loss": 0.7830343246459961, "mean_token_accuracy": 0.8080305829644203, "num_tokens": 46735029.0, "step": 23650 }, { "entropy": 0.8212189765647053, "epoch": 0.6777136473654813, "grad_norm": 7.96875, "learning_rate": 3.777797899622694e-05, "loss": 0.8574483871459961, "mean_token_accuracy": 0.804504644498229, "num_tokens": 46754781.0, "step": 23660 }, { "entropy": 0.8547359514981508, "epoch": 0.6780000859315698, "grad_norm": 6.6875, "learning_rate": 3.776816920509786e-05, "loss": 0.885096549987793, "mean_token_accuracy": 0.8049687501043081, "num_tokens": 46773648.0, "step": 23670 }, { "entropy": 0.8393470600247384, "epoch": 0.6782865244976584, "grad_norm": 8.5625, "learning_rate": 3.775835675355891e-05, "loss": 0.8691526412963867, "mean_token_accuracy": 0.7947827219963074, "num_tokens": 46792902.0, "step": 23680 }, { "entropy": 0.9281520107761025, "epoch": 0.6785729630637469, "grad_norm": 7.84375, "learning_rate": 3.774854164365467e-05, "loss": 0.9006784439086915, "mean_token_accuracy": 0.7891056396067142, "num_tokens": 46813550.0, "step": 23690 }, { "entropy": 0.9720629405230283, "epoch": 0.6788594016298355, "grad_norm": 8.4375, "learning_rate": 3.7738723877430223e-05, "loss": 1.01405668258667, "mean_token_accuracy": 0.7691835843026638, "num_tokens": 46833224.0, "step": 23700 }, { "entropy": 0.8647079547867179, "epoch": 0.6791458401959239, "grad_norm": 8.375, "learning_rate": 3.772890345693123e-05, "loss": 0.883263111114502, "mean_token_accuracy": 0.7846177857369184, "num_tokens": 46853820.0, "step": 23710 }, { "entropy": 0.9543108440935612, "epoch": 0.6794322787620125, "grad_norm": 7.78125, "learning_rate": 3.77190803842039e-05, "loss": 0.9913612365722656, "mean_token_accuracy": 0.7813449997454882, "num_tokens": 46873954.0, "step": 23720 }, { "entropy": 0.9256950682029128, "epoch": 0.6797187173281011, "grad_norm": 7.90625, "learning_rate": 3.770925466129501e-05, "loss": 0.9193596839904785, "mean_token_accuracy": 0.7979480311274528, "num_tokens": 46893498.0, "step": 23730 }, { "entropy": 0.9301346521824598, "epoch": 0.6800051558941896, "grad_norm": 7.625, "learning_rate": 3.769942629025185e-05, "loss": 0.9542093276977539, "mean_token_accuracy": 0.7830264322459698, "num_tokens": 46914134.0, "step": 23740 }, { "entropy": 0.9466976599767805, "epoch": 0.6802915944602781, "grad_norm": 6.09375, "learning_rate": 3.768959527312229e-05, "loss": 0.9109285354614258, "mean_token_accuracy": 0.7890682589262724, "num_tokens": 46934658.0, "step": 23750 }, { "entropy": 0.9107558296993374, "epoch": 0.6805780330263667, "grad_norm": 8.25, "learning_rate": 3.767976161195475e-05, "loss": 0.8836893081665039, "mean_token_accuracy": 0.7992097400128841, "num_tokens": 46954110.0, "step": 23760 }, { "entropy": 0.9006217638030648, "epoch": 0.6808644715924552, "grad_norm": 8.1875, "learning_rate": 3.766992530879821e-05, "loss": 0.9244226455688477, "mean_token_accuracy": 0.7843036446720362, "num_tokens": 46973567.0, "step": 23770 }, { "entropy": 0.882096703350544, "epoch": 0.6811509101585438, "grad_norm": 6.0625, "learning_rate": 3.766008636570218e-05, "loss": 0.8864049911499023, "mean_token_accuracy": 0.8032234638929368, "num_tokens": 46994552.0, "step": 23780 }, { "entropy": 0.798071656934917, "epoch": 0.6814373487246322, "grad_norm": 7.5, "learning_rate": 3.7650244784716734e-05, "loss": 0.7669909954071045, "mean_token_accuracy": 0.8172485463321209, "num_tokens": 47014602.0, "step": 23790 }, { "entropy": 0.9085443234071136, "epoch": 0.6817237872907208, "grad_norm": 10.0625, "learning_rate": 3.764040056789247e-05, "loss": 0.9262447357177734, "mean_token_accuracy": 0.776689887791872, "num_tokens": 47035523.0, "step": 23800 }, { "entropy": 0.8039026020094753, "epoch": 0.6820102258568094, "grad_norm": 9.75, "learning_rate": 3.763055371728057e-05, "loss": 0.7580043315887451, "mean_token_accuracy": 0.8162250146269798, "num_tokens": 47056567.0, "step": 23810 }, { "entropy": 0.8289847819134593, "epoch": 0.6822966644228979, "grad_norm": 8.0625, "learning_rate": 3.7620704234932755e-05, "loss": 0.9210149765014648, "mean_token_accuracy": 0.7901448838412761, "num_tokens": 47075721.0, "step": 23820 }, { "entropy": 0.786400451976806, "epoch": 0.6825831029889864, "grad_norm": 7.28125, "learning_rate": 3.7610852122901273e-05, "loss": 0.7949518680572509, "mean_token_accuracy": 0.8030009407550096, "num_tokens": 47095868.0, "step": 23830 }, { "entropy": 0.7877665994688868, "epoch": 0.682869541555075, "grad_norm": 7.0625, "learning_rate": 3.760099738323896e-05, "loss": 0.7625834941864014, "mean_token_accuracy": 0.8196571815758944, "num_tokens": 47116376.0, "step": 23840 }, { "entropy": 0.8860090170055628, "epoch": 0.6831559801211635, "grad_norm": 7.9375, "learning_rate": 3.759114001799915e-05, "loss": 0.9824397087097168, "mean_token_accuracy": 0.7786292754113674, "num_tokens": 47135690.0, "step": 23850 }, { "entropy": 0.9434447078034282, "epoch": 0.6834424186872521, "grad_norm": 7.21875, "learning_rate": 3.758128002923578e-05, "loss": 0.9440702438354492, "mean_token_accuracy": 0.7875627759844065, "num_tokens": 47155858.0, "step": 23860 }, { "entropy": 0.9028685019351542, "epoch": 0.6837288572533405, "grad_norm": 8.0, "learning_rate": 3.757141741900327e-05, "loss": 0.9039607048034668, "mean_token_accuracy": 0.7916537120938301, "num_tokens": 47176672.0, "step": 23870 }, { "entropy": 0.9192259043455124, "epoch": 0.6840152958194291, "grad_norm": 7.34375, "learning_rate": 3.756155218935663e-05, "loss": 0.9251203536987305, "mean_token_accuracy": 0.7870229419320822, "num_tokens": 47199714.0, "step": 23880 }, { "entropy": 0.9896009426563979, "epoch": 0.6843017343855177, "grad_norm": 7.8125, "learning_rate": 3.755168434235144e-05, "loss": 1.0596629142761231, "mean_token_accuracy": 0.7645628433674574, "num_tokens": 47219460.0, "step": 23890 }, { "entropy": 0.8386084627360105, "epoch": 0.6845881729516062, "grad_norm": 6.90625, "learning_rate": 3.754181388004374e-05, "loss": 0.8011569023132324, "mean_token_accuracy": 0.8116822019219398, "num_tokens": 47237881.0, "step": 23900 }, { "entropy": 0.8817425843328237, "epoch": 0.6848746115176947, "grad_norm": 8.625, "learning_rate": 3.75319408044902e-05, "loss": 0.8680102348327636, "mean_token_accuracy": 0.7938362259417773, "num_tokens": 47257729.0, "step": 23910 }, { "entropy": 0.9330436183139682, "epoch": 0.6851610500837833, "grad_norm": 8.375, "learning_rate": 3.7522065117747977e-05, "loss": 0.9403269767761231, "mean_token_accuracy": 0.7798145253211259, "num_tokens": 47277172.0, "step": 23920 }, { "entropy": 0.7988518288359046, "epoch": 0.6854474886498718, "grad_norm": 8.75, "learning_rate": 3.7512186821874806e-05, "loss": 0.8403150558471679, "mean_token_accuracy": 0.8052618935704231, "num_tokens": 47295425.0, "step": 23930 }, { "entropy": 0.8242566533386707, "epoch": 0.6857339272159604, "grad_norm": 9.75, "learning_rate": 3.750230591892897e-05, "loss": 0.8384486198425293, "mean_token_accuracy": 0.8128284107893705, "num_tokens": 47314463.0, "step": 23940 }, { "entropy": 0.828976514749229, "epoch": 0.686020365782049, "grad_norm": 9.9375, "learning_rate": 3.749242241096926e-05, "loss": 0.7850234985351563, "mean_token_accuracy": 0.814599159732461, "num_tokens": 47334030.0, "step": 23950 }, { "entropy": 0.8347015677019953, "epoch": 0.6863068043481374, "grad_norm": 8.0625, "learning_rate": 3.7482536300055036e-05, "loss": 0.8457798957824707, "mean_token_accuracy": 0.8063288155943156, "num_tokens": 47354162.0, "step": 23960 }, { "entropy": 0.8873117652721703, "epoch": 0.686593242914226, "grad_norm": 10.1875, "learning_rate": 3.747264758824619e-05, "loss": 0.8859106063842773, "mean_token_accuracy": 0.7920020740479231, "num_tokens": 47374711.0, "step": 23970 }, { "entropy": 0.8185331977438182, "epoch": 0.6868796814803145, "grad_norm": 8.1875, "learning_rate": 3.746275627760318e-05, "loss": 0.8844112396240235, "mean_token_accuracy": 0.7977825257927179, "num_tokens": 47394024.0, "step": 23980 }, { "entropy": 0.9755201451480389, "epoch": 0.6871661200464031, "grad_norm": 6.03125, "learning_rate": 3.745286237018696e-05, "loss": 0.9543863296508789, "mean_token_accuracy": 0.775180934369564, "num_tokens": 47413961.0, "step": 23990 }, { "epoch": 0.6874525586124915, "eval_entropy": 0.9170454417467118, "eval_loss": 0.9256865978240967, "eval_mean_token_accuracy": 0.7836886106729507, "eval_num_tokens": 47434849.0, "eval_runtime": 43.1079, "eval_samples_per_second": 46.395, "eval_steps_per_second": 5.799, "step": 24000 }, { "entropy": 0.8320842329412699, "epoch": 0.6877389971785801, "grad_norm": 8.125, "learning_rate": 3.743306677328156e-05, "loss": 0.8275287628173829, "mean_token_accuracy": 0.8075450304895639, "num_tokens": 47453853.0, "step": 24010 }, { "entropy": 0.9436167422682047, "epoch": 0.6880254357446687, "grad_norm": 11.3125, "learning_rate": 3.7423165087917035e-05, "loss": 0.9847878456115723, "mean_token_accuracy": 0.7843574348837137, "num_tokens": 47472536.0, "step": 24020 }, { "entropy": 0.7477353625930846, "epoch": 0.6883118743107572, "grad_norm": 7.96875, "learning_rate": 3.741326081402864e-05, "loss": 0.7448188781738281, "mean_token_accuracy": 0.8303573679178953, "num_tokens": 47492511.0, "step": 24030 }, { "entropy": 0.8753996063023806, "epoch": 0.6885983128768457, "grad_norm": 10.5625, "learning_rate": 3.740335395368005e-05, "loss": 0.8863739967346191, "mean_token_accuracy": 0.7792684946209192, "num_tokens": 47511886.0, "step": 24040 }, { "entropy": 0.9268189895898103, "epoch": 0.6888847514429343, "grad_norm": 7.78125, "learning_rate": 3.739344450893549e-05, "loss": 0.9089580535888672, "mean_token_accuracy": 0.7892167646437883, "num_tokens": 47531608.0, "step": 24050 }, { "entropy": 0.8559127619490028, "epoch": 0.6891711900090228, "grad_norm": 7.71875, "learning_rate": 3.738353248185973e-05, "loss": 0.8585469245910644, "mean_token_accuracy": 0.7998679392039776, "num_tokens": 47551003.0, "step": 24060 }, { "entropy": 0.8106321642175317, "epoch": 0.6894576285751114, "grad_norm": 8.1875, "learning_rate": 3.737361787451804e-05, "loss": 0.7850768566131592, "mean_token_accuracy": 0.8118389155715704, "num_tokens": 47569632.0, "step": 24070 }, { "entropy": 0.8248413396067917, "epoch": 0.6897440671411998, "grad_norm": 9.0, "learning_rate": 3.736370068897626e-05, "loss": 0.8475696563720703, "mean_token_accuracy": 0.8024980660527945, "num_tokens": 47588638.0, "step": 24080 }, { "entropy": 0.7947097034193575, "epoch": 0.6900305057072884, "grad_norm": 8.875, "learning_rate": 3.7353780927300784e-05, "loss": 0.8593223571777344, "mean_token_accuracy": 0.797731912881136, "num_tokens": 47608897.0, "step": 24090 }, { "entropy": 0.8744115469977259, "epoch": 0.690316944273377, "grad_norm": 6.8125, "learning_rate": 3.7343858591558505e-05, "loss": 0.9088281631469727, "mean_token_accuracy": 0.7928579300642014, "num_tokens": 47628310.0, "step": 24100 }, { "entropy": 0.8737337691709399, "epoch": 0.6906033828394655, "grad_norm": 10.875, "learning_rate": 3.7333933683816856e-05, "loss": 0.8501747131347657, "mean_token_accuracy": 0.8070201613008976, "num_tokens": 47647897.0, "step": 24110 }, { "entropy": 0.852601028420031, "epoch": 0.690889821405554, "grad_norm": 7.0625, "learning_rate": 3.732400620614384e-05, "loss": 0.9036587715148926, "mean_token_accuracy": 0.7916225723922252, "num_tokens": 47668014.0, "step": 24120 }, { "entropy": 0.8993831885978579, "epoch": 0.6911762599716426, "grad_norm": 6.78125, "learning_rate": 3.731407616060796e-05, "loss": 0.9492385864257813, "mean_token_accuracy": 0.7832627769559621, "num_tokens": 47688098.0, "step": 24130 }, { "entropy": 0.7997074939310551, "epoch": 0.6914626985377311, "grad_norm": 9.8125, "learning_rate": 3.7304143549278266e-05, "loss": 0.8072966575622559, "mean_token_accuracy": 0.8164156705141068, "num_tokens": 47707525.0, "step": 24140 }, { "entropy": 0.8286505179479718, "epoch": 0.6917491371038197, "grad_norm": 7.34375, "learning_rate": 3.7294208374224335e-05, "loss": 0.8787816047668457, "mean_token_accuracy": 0.7964305099099874, "num_tokens": 47726620.0, "step": 24150 }, { "entropy": 0.8535699050873518, "epoch": 0.6920355756699081, "grad_norm": 7.5625, "learning_rate": 3.728427063751631e-05, "loss": 0.8932140350341797, "mean_token_accuracy": 0.7885459687560796, "num_tokens": 47746580.0, "step": 24160 }, { "entropy": 0.9530906442552805, "epoch": 0.6923220142359967, "grad_norm": 8.5625, "learning_rate": 3.7274330341224836e-05, "loss": 0.9543826103210449, "mean_token_accuracy": 0.7746529798954725, "num_tokens": 47766788.0, "step": 24170 }, { "entropy": 0.8913158476352692, "epoch": 0.6926084528020853, "grad_norm": 6.5, "learning_rate": 3.7264387487421084e-05, "loss": 0.8770264625549317, "mean_token_accuracy": 0.8090068537741899, "num_tokens": 47786360.0, "step": 24180 }, { "entropy": 0.8746037418022752, "epoch": 0.6928948913681738, "grad_norm": 7.09375, "learning_rate": 3.7254442078176786e-05, "loss": 0.889888858795166, "mean_token_accuracy": 0.8017952561378479, "num_tokens": 47805798.0, "step": 24190 }, { "entropy": 0.8507535761222244, "epoch": 0.6931813299342624, "grad_norm": 8.3125, "learning_rate": 3.72444941155642e-05, "loss": 0.8407798767089844, "mean_token_accuracy": 0.7961721129715442, "num_tokens": 47825230.0, "step": 24200 }, { "entropy": 0.8398197388276458, "epoch": 0.6934677685003509, "grad_norm": 6.96875, "learning_rate": 3.723454360165609e-05, "loss": 0.8552226066589356, "mean_token_accuracy": 0.7996520016342401, "num_tokens": 47844135.0, "step": 24210 }, { "entropy": 0.9954616278409958, "epoch": 0.6937542070664394, "grad_norm": 9.3125, "learning_rate": 3.7224590538525796e-05, "loss": 0.9790471076965332, "mean_token_accuracy": 0.765663568675518, "num_tokens": 47864040.0, "step": 24220 }, { "entropy": 0.8452286321669817, "epoch": 0.694040645632528, "grad_norm": 6.875, "learning_rate": 3.721463492824715e-05, "loss": 0.8486843109130859, "mean_token_accuracy": 0.8110845539718866, "num_tokens": 47882612.0, "step": 24230 }, { "entropy": 0.9404670706018805, "epoch": 0.6943270841986166, "grad_norm": 6.03125, "learning_rate": 3.720467677289454e-05, "loss": 0.9627102851867676, "mean_token_accuracy": 0.7750114072114229, "num_tokens": 47902110.0, "step": 24240 }, { "entropy": 0.8143452545627952, "epoch": 0.694613522764705, "grad_norm": 6.53125, "learning_rate": 3.719471607454286e-05, "loss": 0.8512958526611328, "mean_token_accuracy": 0.8037332255393267, "num_tokens": 47922124.0, "step": 24250 }, { "entropy": 0.9068429347127676, "epoch": 0.6948999613307936, "grad_norm": 7.78125, "learning_rate": 3.718475283526755e-05, "loss": 0.890805435180664, "mean_token_accuracy": 0.7938920769840478, "num_tokens": 47941887.0, "step": 24260 }, { "entropy": 0.8921038338914513, "epoch": 0.6951863998968821, "grad_norm": 8.4375, "learning_rate": 3.717478705714459e-05, "loss": 0.9193027496337891, "mean_token_accuracy": 0.7878501407802105, "num_tokens": 47961501.0, "step": 24270 }, { "entropy": 0.8531112568452954, "epoch": 0.6954728384629707, "grad_norm": 6.6875, "learning_rate": 3.716481874225046e-05, "loss": 0.8416627883911133, "mean_token_accuracy": 0.8026750486344099, "num_tokens": 47979434.0, "step": 24280 }, { "entropy": 0.8986908689141273, "epoch": 0.6957592770290592, "grad_norm": 7.46875, "learning_rate": 3.7154847892662206e-05, "loss": 0.9239437103271484, "mean_token_accuracy": 0.7812710590660572, "num_tokens": 47998403.0, "step": 24290 }, { "entropy": 0.7492501908913255, "epoch": 0.6960457155951477, "grad_norm": 7.40625, "learning_rate": 3.714487451045735e-05, "loss": 0.7248305320739746, "mean_token_accuracy": 0.828965525329113, "num_tokens": 48018228.0, "step": 24300 }, { "entropy": 0.900933374837041, "epoch": 0.6963321541612363, "grad_norm": 6.375, "learning_rate": 3.713489859771401e-05, "loss": 0.9335248947143555, "mean_token_accuracy": 0.7910063769668341, "num_tokens": 48037999.0, "step": 24310 }, { "entropy": 0.8868171740323305, "epoch": 0.6966185927273248, "grad_norm": 7.28125, "learning_rate": 3.712492015651076e-05, "loss": 0.8473359107971191, "mean_token_accuracy": 0.7943813256919384, "num_tokens": 48058093.0, "step": 24320 }, { "entropy": 0.8771782496944069, "epoch": 0.6969050312934133, "grad_norm": 7.875, "learning_rate": 3.711493918892675e-05, "loss": 0.8803249359130859, "mean_token_accuracy": 0.7926054686307907, "num_tokens": 48077899.0, "step": 24330 }, { "entropy": 0.7925760008394718, "epoch": 0.6971914698595019, "grad_norm": 4.40625, "learning_rate": 3.710495569704164e-05, "loss": 0.791726541519165, "mean_token_accuracy": 0.8075418349355459, "num_tokens": 48097497.0, "step": 24340 }, { "entropy": 0.8639530636370182, "epoch": 0.6974779084255904, "grad_norm": 10.5625, "learning_rate": 3.709496968293562e-05, "loss": 0.8617840766906738, "mean_token_accuracy": 0.8056206267327071, "num_tokens": 48115580.0, "step": 24350 }, { "entropy": 0.7220375942066312, "epoch": 0.697764346991679, "grad_norm": 10.6875, "learning_rate": 3.708498114868939e-05, "loss": 0.7322781085968018, "mean_token_accuracy": 0.8130369201302529, "num_tokens": 48133298.0, "step": 24360 }, { "entropy": 0.8128467313945293, "epoch": 0.6980507855577675, "grad_norm": 9.0, "learning_rate": 3.707499009638421e-05, "loss": 0.8220549583435058, "mean_token_accuracy": 0.8082006350159645, "num_tokens": 48153122.0, "step": 24370 }, { "entropy": 0.8922281099483371, "epoch": 0.698337224123856, "grad_norm": 8.0, "learning_rate": 3.706499652810183e-05, "loss": 0.9855802536010743, "mean_token_accuracy": 0.7793151929974556, "num_tokens": 48172598.0, "step": 24380 }, { "entropy": 0.8139053754508495, "epoch": 0.6986236626899446, "grad_norm": 10.125, "learning_rate": 3.7055000445924524e-05, "loss": 0.7709712028503418, "mean_token_accuracy": 0.8123778875917196, "num_tokens": 48191728.0, "step": 24390 }, { "entropy": 0.8217745428904891, "epoch": 0.6989101012560331, "grad_norm": 5.40625, "learning_rate": 3.704500185193512e-05, "loss": 0.8592321395874023, "mean_token_accuracy": 0.8043582398444414, "num_tokens": 48211604.0, "step": 24400 }, { "entropy": 0.8804588638246059, "epoch": 0.6991965398221216, "grad_norm": 7.625, "learning_rate": 3.7035000748216946e-05, "loss": 0.8346160888671875, "mean_token_accuracy": 0.8027471043169498, "num_tokens": 48231433.0, "step": 24410 }, { "entropy": 0.9157680001109838, "epoch": 0.6994829783882102, "grad_norm": 7.71875, "learning_rate": 3.7024997136853864e-05, "loss": 0.9334989547729492, "mean_token_accuracy": 0.7771507669240236, "num_tokens": 48251555.0, "step": 24420 }, { "entropy": 0.9577648447826504, "epoch": 0.6997694169542987, "grad_norm": 7.28125, "learning_rate": 3.701499101993024e-05, "loss": 1.029730987548828, "mean_token_accuracy": 0.7684868574142456, "num_tokens": 48273259.0, "step": 24430 }, { "entropy": 0.9802593341097235, "epoch": 0.7000558555203873, "grad_norm": 8.0, "learning_rate": 3.7004982399530994e-05, "loss": 0.9533609390258789, "mean_token_accuracy": 0.7865672312676907, "num_tokens": 48293398.0, "step": 24440 }, { "entropy": 0.9322400186210871, "epoch": 0.7003422940864759, "grad_norm": 4.90625, "learning_rate": 3.699497127774152e-05, "loss": 0.8832309722900391, "mean_token_accuracy": 0.7979009091854096, "num_tokens": 48313745.0, "step": 24450 }, { "entropy": 0.8969527354463935, "epoch": 0.7006287326525643, "grad_norm": 7.875, "learning_rate": 3.698495765664779e-05, "loss": 0.9008283615112305, "mean_token_accuracy": 0.7838116530328989, "num_tokens": 48333126.0, "step": 24460 }, { "entropy": 0.7459261387586593, "epoch": 0.7009151712186529, "grad_norm": 7.59375, "learning_rate": 3.697494153833626e-05, "loss": 0.760207986831665, "mean_token_accuracy": 0.8132480531930923, "num_tokens": 48352446.0, "step": 24470 }, { "entropy": 0.8882219929248094, "epoch": 0.7012016097847414, "grad_norm": 10.6875, "learning_rate": 3.696492292489392e-05, "loss": 0.9176007270812988, "mean_token_accuracy": 0.7964286029338836, "num_tokens": 48371092.0, "step": 24480 }, { "entropy": 0.9542246686294675, "epoch": 0.70148804835083, "grad_norm": 7.625, "learning_rate": 3.695490181840826e-05, "loss": 1.001837921142578, "mean_token_accuracy": 0.7761807925999165, "num_tokens": 48392376.0, "step": 24490 }, { "entropy": 0.8528949799016118, "epoch": 0.7017744869169185, "grad_norm": 8.0625, "learning_rate": 3.6944878220967314e-05, "loss": 0.8738615036010742, "mean_token_accuracy": 0.7925578620284796, "num_tokens": 48412189.0, "step": 24500 }, { "entropy": 0.8872066676616669, "epoch": 0.702060925483007, "grad_norm": 6.71875, "learning_rate": 3.693485213465963e-05, "loss": 0.9026021957397461, "mean_token_accuracy": 0.7847229167819023, "num_tokens": 48433645.0, "step": 24510 }, { "entropy": 0.8101624321192503, "epoch": 0.7023473640490956, "grad_norm": 12.0, "learning_rate": 3.692482356157427e-05, "loss": 0.8111007690429688, "mean_token_accuracy": 0.8094050262123347, "num_tokens": 48453130.0, "step": 24520 }, { "entropy": 0.8125691677443683, "epoch": 0.7026338026151842, "grad_norm": 8.5, "learning_rate": 3.6914792503800797e-05, "loss": 0.7810537815093994, "mean_token_accuracy": 0.8109431155025959, "num_tokens": 48473585.0, "step": 24530 }, { "entropy": 0.7966423815116286, "epoch": 0.7029202411812726, "grad_norm": 8.875, "learning_rate": 3.690475896342933e-05, "loss": 0.8331488609313965, "mean_token_accuracy": 0.8114167861640453, "num_tokens": 48494044.0, "step": 24540 }, { "entropy": 0.8213833974674344, "epoch": 0.7032066797473612, "grad_norm": 9.4375, "learning_rate": 3.689472294255047e-05, "loss": 0.8178174018859863, "mean_token_accuracy": 0.8069458220154047, "num_tokens": 48513800.0, "step": 24550 }, { "entropy": 0.8288965802639723, "epoch": 0.7034931183134497, "grad_norm": 7.5625, "learning_rate": 3.688468444325536e-05, "loss": 0.7747990608215332, "mean_token_accuracy": 0.8208260878920555, "num_tokens": 48533062.0, "step": 24560 }, { "entropy": 0.7590049094520509, "epoch": 0.7037795568795383, "grad_norm": 6.78125, "learning_rate": 3.687464346763565e-05, "loss": 0.7685303211212158, "mean_token_accuracy": 0.8226388655602932, "num_tokens": 48551359.0, "step": 24570 }, { "entropy": 0.7918385278433562, "epoch": 0.7040659954456268, "grad_norm": 8.125, "learning_rate": 3.686460001778349e-05, "loss": 0.7780099391937256, "mean_token_accuracy": 0.8081594161689282, "num_tokens": 48571030.0, "step": 24580 }, { "entropy": 0.9068219905719161, "epoch": 0.7043524340117153, "grad_norm": 7.5, "learning_rate": 3.685455409579157e-05, "loss": 0.9807154655456543, "mean_token_accuracy": 0.7835599850863219, "num_tokens": 48590412.0, "step": 24590 }, { "entropy": 0.8774999534711242, "epoch": 0.7046388725778039, "grad_norm": 9.9375, "learning_rate": 3.6844505703753085e-05, "loss": 0.93710355758667, "mean_token_accuracy": 0.7930587969720364, "num_tokens": 48609509.0, "step": 24600 }, { "entropy": 0.9169191809371113, "epoch": 0.7049253111438925, "grad_norm": 8.0625, "learning_rate": 3.683445484376174e-05, "loss": 0.9161656379699707, "mean_token_accuracy": 0.7990161798894405, "num_tokens": 48628402.0, "step": 24610 }, { "entropy": 0.784486335888505, "epoch": 0.7052117497099809, "grad_norm": 8.4375, "learning_rate": 3.6824401517911765e-05, "loss": 0.7554248332977295, "mean_token_accuracy": 0.8186745442450046, "num_tokens": 48646478.0, "step": 24620 }, { "entropy": 0.917958570830524, "epoch": 0.7054981882760695, "grad_norm": 8.3125, "learning_rate": 3.6814345728297895e-05, "loss": 0.8936305046081543, "mean_token_accuracy": 0.7865938775241375, "num_tokens": 48666432.0, "step": 24630 }, { "entropy": 0.8962295152246952, "epoch": 0.705784626842158, "grad_norm": 7.78125, "learning_rate": 3.680428747701539e-05, "loss": 0.9056150436401367, "mean_token_accuracy": 0.7982874237000942, "num_tokens": 48686377.0, "step": 24640 }, { "entropy": 0.8813980758190155, "epoch": 0.7060710654082466, "grad_norm": 10.0625, "learning_rate": 3.679422676615999e-05, "loss": 0.8951904296875, "mean_token_accuracy": 0.7825820710510015, "num_tokens": 48705216.0, "step": 24650 }, { "entropy": 0.8333178224042058, "epoch": 0.706357503974335, "grad_norm": 9.1875, "learning_rate": 3.678416359782799e-05, "loss": 0.7824797630310059, "mean_token_accuracy": 0.8113893788307905, "num_tokens": 48724770.0, "step": 24660 }, { "entropy": 0.8183223536238075, "epoch": 0.7066439425404236, "grad_norm": 7.75, "learning_rate": 3.677409797411618e-05, "loss": 0.8160299301147461, "mean_token_accuracy": 0.8100057207047939, "num_tokens": 48745284.0, "step": 24670 }, { "entropy": 0.8935088727623224, "epoch": 0.7069303811065122, "grad_norm": 7.9375, "learning_rate": 3.6764029897121856e-05, "loss": 0.9133176803588867, "mean_token_accuracy": 0.7844197612255812, "num_tokens": 48764447.0, "step": 24680 }, { "entropy": 0.8730123307555914, "epoch": 0.7072168196726007, "grad_norm": 7.375, "learning_rate": 3.675395936894283e-05, "loss": 0.9146931648254395, "mean_token_accuracy": 0.800732908770442, "num_tokens": 48784723.0, "step": 24690 }, { "entropy": 0.8042549195699393, "epoch": 0.7075032582386892, "grad_norm": 7.75, "learning_rate": 3.674388639167742e-05, "loss": 0.8193799018859863, "mean_token_accuracy": 0.8056302301585674, "num_tokens": 48803224.0, "step": 24700 }, { "entropy": 0.8660958832129836, "epoch": 0.7077896968047778, "grad_norm": 9.5, "learning_rate": 3.673381096742446e-05, "loss": 0.8972262382507324, "mean_token_accuracy": 0.7992315500974655, "num_tokens": 48822055.0, "step": 24710 }, { "entropy": 0.7201851662248373, "epoch": 0.7080761353708663, "grad_norm": 8.0, "learning_rate": 3.6723733098283305e-05, "loss": 0.7442617416381836, "mean_token_accuracy": 0.832540974766016, "num_tokens": 48840568.0, "step": 24720 }, { "entropy": 0.7807918494567275, "epoch": 0.7083625739369549, "grad_norm": 8.125, "learning_rate": 3.6713652786353786e-05, "loss": 0.7479044914245605, "mean_token_accuracy": 0.8165827848017215, "num_tokens": 48859453.0, "step": 24730 }, { "entropy": 0.8202137500047684, "epoch": 0.7086490125030435, "grad_norm": 8.5625, "learning_rate": 3.6703570033736275e-05, "loss": 0.8364398002624511, "mean_token_accuracy": 0.8051929485052824, "num_tokens": 48880396.0, "step": 24740 }, { "entropy": 0.8442575002089143, "epoch": 0.7089354510691319, "grad_norm": 8.1875, "learning_rate": 3.6693484842531645e-05, "loss": 0.8244970321655274, "mean_token_accuracy": 0.8019424226135016, "num_tokens": 48901228.0, "step": 24750 }, { "entropy": 0.8255954269319773, "epoch": 0.7092218896352205, "grad_norm": 9.0625, "learning_rate": 3.668339721484126e-05, "loss": 0.8358854293823242, "mean_token_accuracy": 0.8070498321205377, "num_tokens": 48920689.0, "step": 24760 }, { "entropy": 0.8563813163898886, "epoch": 0.709508328201309, "grad_norm": 8.875, "learning_rate": 3.667330715276702e-05, "loss": 0.8916967391967774, "mean_token_accuracy": 0.7933955866843462, "num_tokens": 48940730.0, "step": 24770 }, { "entropy": 0.7875993371941149, "epoch": 0.7097947667673976, "grad_norm": 8.875, "learning_rate": 3.6663214658411303e-05, "loss": 0.856473731994629, "mean_token_accuracy": 0.8085438180714846, "num_tokens": 48960175.0, "step": 24780 }, { "entropy": 0.8658637532964348, "epoch": 0.7100812053334861, "grad_norm": 8.25, "learning_rate": 3.665311973387703e-05, "loss": 0.8882229804992676, "mean_token_accuracy": 0.7904190748929978, "num_tokens": 48980088.0, "step": 24790 }, { "entropy": 0.8634634293615818, "epoch": 0.7103676438995746, "grad_norm": 6.90625, "learning_rate": 3.664302238126758e-05, "loss": 0.8364635467529297, "mean_token_accuracy": 0.7960839185863733, "num_tokens": 49000063.0, "step": 24800 }, { "entropy": 0.9048838572576642, "epoch": 0.7106540824656632, "grad_norm": 9.3125, "learning_rate": 3.663292260268688e-05, "loss": 0.9128030776977539, "mean_token_accuracy": 0.7919073175638914, "num_tokens": 49020191.0, "step": 24810 }, { "entropy": 0.9535730510950089, "epoch": 0.7109405210317518, "grad_norm": 10.375, "learning_rate": 3.662282040023936e-05, "loss": 0.9490864753723145, "mean_token_accuracy": 0.782025120407343, "num_tokens": 49039128.0, "step": 24820 }, { "entropy": 0.8247288456186652, "epoch": 0.7112269595978402, "grad_norm": 8.1875, "learning_rate": 3.66127157760299e-05, "loss": 0.8833017349243164, "mean_token_accuracy": 0.8069334965199232, "num_tokens": 49058248.0, "step": 24830 }, { "entropy": 0.9842846591025591, "epoch": 0.7115133981639288, "grad_norm": 7.65625, "learning_rate": 3.660260873216396e-05, "loss": 1.0087266921997071, "mean_token_accuracy": 0.7835214611142873, "num_tokens": 49079877.0, "step": 24840 }, { "entropy": 0.8269510615617037, "epoch": 0.7117998367300173, "grad_norm": 9.1875, "learning_rate": 3.659249927074747e-05, "loss": 0.8558285713195801, "mean_token_accuracy": 0.8082619827240706, "num_tokens": 49098187.0, "step": 24850 }, { "entropy": 0.8203220343217253, "epoch": 0.7120862752961059, "grad_norm": 6.53125, "learning_rate": 3.658238739388685e-05, "loss": 0.7810757160186768, "mean_token_accuracy": 0.8198346484452486, "num_tokens": 49117854.0, "step": 24860 }, { "entropy": 0.8428788097575307, "epoch": 0.7123727138621944, "grad_norm": 7.9375, "learning_rate": 3.6572273103689045e-05, "loss": 0.8275889396667481, "mean_token_accuracy": 0.8003102771937847, "num_tokens": 49137955.0, "step": 24870 }, { "entropy": 0.8262346537783742, "epoch": 0.7126591524282829, "grad_norm": 6.21875, "learning_rate": 3.6562156402261496e-05, "loss": 0.8443349838256836, "mean_token_accuracy": 0.8036100789904594, "num_tokens": 49157801.0, "step": 24880 }, { "entropy": 0.8555899580940605, "epoch": 0.7129455909943715, "grad_norm": 8.625, "learning_rate": 3.655203729171215e-05, "loss": 0.862637996673584, "mean_token_accuracy": 0.7958963971585036, "num_tokens": 49177160.0, "step": 24890 }, { "entropy": 0.7836555119603872, "epoch": 0.7132320295604601, "grad_norm": 8.9375, "learning_rate": 3.654191577414944e-05, "loss": 0.7367152690887451, "mean_token_accuracy": 0.8232878509908914, "num_tokens": 49196941.0, "step": 24900 }, { "entropy": 0.7707573924213648, "epoch": 0.7135184681265485, "grad_norm": 8.3125, "learning_rate": 3.653179185168232e-05, "loss": 0.7978598117828369, "mean_token_accuracy": 0.813903345912695, "num_tokens": 49217342.0, "step": 24910 }, { "entropy": 0.9440126268193125, "epoch": 0.7138049066926371, "grad_norm": 8.5625, "learning_rate": 3.652166552642025e-05, "loss": 0.9993322372436524, "mean_token_accuracy": 0.7818494781851768, "num_tokens": 49239298.0, "step": 24920 }, { "entropy": 0.8518192843534053, "epoch": 0.7140913452587256, "grad_norm": 6.6875, "learning_rate": 3.651153680047315e-05, "loss": 0.8596327781677247, "mean_token_accuracy": 0.8030738394707442, "num_tokens": 49260252.0, "step": 24930 }, { "entropy": 1.0094398139044642, "epoch": 0.7143777838248142, "grad_norm": 7.5625, "learning_rate": 3.6501405675951485e-05, "loss": 0.9751731872558593, "mean_token_accuracy": 0.7781467054039239, "num_tokens": 49280723.0, "step": 24940 }, { "entropy": 0.9012328576296568, "epoch": 0.7146642223909027, "grad_norm": 7.96875, "learning_rate": 3.6491272154966207e-05, "loss": 0.8963910102844238, "mean_token_accuracy": 0.7931661121547222, "num_tokens": 49300898.0, "step": 24950 }, { "entropy": 0.8988064870238304, "epoch": 0.7149506609569912, "grad_norm": 11.6875, "learning_rate": 3.6481136239628755e-05, "loss": 0.8269492149353027, "mean_token_accuracy": 0.8027182165533304, "num_tokens": 49319620.0, "step": 24960 }, { "entropy": 0.8501068165525794, "epoch": 0.7152370995230798, "grad_norm": 6.78125, "learning_rate": 3.647099793205109e-05, "loss": 0.8887551307678223, "mean_token_accuracy": 0.7910312186926604, "num_tokens": 49339040.0, "step": 24970 }, { "entropy": 0.8463203959167004, "epoch": 0.7155235380891684, "grad_norm": 7.46875, "learning_rate": 3.646085723434562e-05, "loss": 0.8355653762817383, "mean_token_accuracy": 0.7973845578730107, "num_tokens": 49358278.0, "step": 24980 }, { "entropy": 0.8013463664799929, "epoch": 0.7158099766552569, "grad_norm": 7.6875, "learning_rate": 3.645071414862534e-05, "loss": 0.8089795112609863, "mean_token_accuracy": 0.8143985062837601, "num_tokens": 49377020.0, "step": 24990 }, { "entropy": 0.811373152025044, "epoch": 0.7160964152213454, "grad_norm": 9.4375, "learning_rate": 3.644056867700365e-05, "loss": 0.8276477813720703, "mean_token_accuracy": 0.7968491937965154, "num_tokens": 49398466.0, "step": 25000 }, { "entropy": 0.8552335403859616, "epoch": 0.7163828537874339, "grad_norm": 8.875, "learning_rate": 3.64304208215945e-05, "loss": 0.823689079284668, "mean_token_accuracy": 0.802936702221632, "num_tokens": 49419793.0, "step": 25010 }, { "entropy": 0.823295722156763, "epoch": 0.7166692923535225, "grad_norm": 9.375, "learning_rate": 3.6420270584512336e-05, "loss": 0.9247366905212402, "mean_token_accuracy": 0.7920031473040581, "num_tokens": 49441303.0, "step": 25020 }, { "entropy": 0.8406313685700297, "epoch": 0.7169557309196111, "grad_norm": 8.1875, "learning_rate": 3.641011796787207e-05, "loss": 0.8393570899963378, "mean_token_accuracy": 0.8010467164218426, "num_tokens": 49459610.0, "step": 25030 }, { "entropy": 0.8841170135885477, "epoch": 0.7172421694856995, "grad_norm": 6.5, "learning_rate": 3.639996297378914e-05, "loss": 0.8965392112731934, "mean_token_accuracy": 0.7953462149947882, "num_tokens": 49480033.0, "step": 25040 }, { "entropy": 0.944437708798796, "epoch": 0.7175286080517881, "grad_norm": 6.0625, "learning_rate": 3.638980560437947e-05, "loss": 0.9791392326354981, "mean_token_accuracy": 0.7897530149668455, "num_tokens": 49500167.0, "step": 25050 }, { "entropy": 0.9637589974328875, "epoch": 0.7178150466178767, "grad_norm": 8.25, "learning_rate": 3.637964586175946e-05, "loss": 1.007373046875, "mean_token_accuracy": 0.7755039159208537, "num_tokens": 49521338.0, "step": 25060 }, { "entropy": 0.8788907270878553, "epoch": 0.7181014851839652, "grad_norm": 12.1875, "learning_rate": 3.636948374804604e-05, "loss": 0.8600860595703125, "mean_token_accuracy": 0.8039681255817414, "num_tokens": 49540880.0, "step": 25070 }, { "entropy": 0.7687335006892682, "epoch": 0.7183879237500537, "grad_norm": 6.84375, "learning_rate": 3.635931926535659e-05, "loss": 0.7829152584075928, "mean_token_accuracy": 0.818188413232565, "num_tokens": 49559596.0, "step": 25080 }, { "entropy": 0.7920591594651342, "epoch": 0.7186743623161422, "grad_norm": 9.125, "learning_rate": 3.634915241580905e-05, "loss": 0.786812686920166, "mean_token_accuracy": 0.8104493461549283, "num_tokens": 49579145.0, "step": 25090 }, { "entropy": 0.8454561771824955, "epoch": 0.7189608008822308, "grad_norm": 7.9375, "learning_rate": 3.633898320152178e-05, "loss": 0.8687270164489747, "mean_token_accuracy": 0.8007260449230671, "num_tokens": 49600230.0, "step": 25100 }, { "entropy": 0.9388252783566713, "epoch": 0.7192472394483194, "grad_norm": 7.34375, "learning_rate": 3.632881162461367e-05, "loss": 0.9690038681030273, "mean_token_accuracy": 0.7759719740599393, "num_tokens": 49620081.0, "step": 25110 }, { "entropy": 0.8162021109834313, "epoch": 0.7195336780144078, "grad_norm": 10.5, "learning_rate": 3.6318637687204094e-05, "loss": 0.8754613876342774, "mean_token_accuracy": 0.8002492271363735, "num_tokens": 49637601.0, "step": 25120 }, { "entropy": 0.8678007081151009, "epoch": 0.7198201165804964, "grad_norm": 7.78125, "learning_rate": 3.6308461391412935e-05, "loss": 0.7952215671539307, "mean_token_accuracy": 0.8012065790593624, "num_tokens": 49657406.0, "step": 25130 }, { "entropy": 0.9015241904184222, "epoch": 0.720106555146585, "grad_norm": 7.15625, "learning_rate": 3.629828273936055e-05, "loss": 0.8606724739074707, "mean_token_accuracy": 0.8041101556271315, "num_tokens": 49677243.0, "step": 25140 }, { "entropy": 0.8616856399923563, "epoch": 0.7203929937126735, "grad_norm": 6.4375, "learning_rate": 3.628810173316777e-05, "loss": 0.8727873802185059, "mean_token_accuracy": 0.8025168646126986, "num_tokens": 49696986.0, "step": 25150 }, { "entropy": 0.7870444439351558, "epoch": 0.720679432278762, "grad_norm": 7.15625, "learning_rate": 3.6277918374955956e-05, "loss": 0.7852448463439942, "mean_token_accuracy": 0.8184985876083374, "num_tokens": 49715352.0, "step": 25160 }, { "entropy": 0.7633501128293574, "epoch": 0.7209658708448505, "grad_norm": 7.3125, "learning_rate": 3.6267732666846934e-05, "loss": 0.7551411628723145, "mean_token_accuracy": 0.8186328396201134, "num_tokens": 49734986.0, "step": 25170 }, { "entropy": 0.85511832581833, "epoch": 0.7212523094109391, "grad_norm": 6.75, "learning_rate": 3.6257544610963025e-05, "loss": 0.8977536201477051, "mean_token_accuracy": 0.7954110193997621, "num_tokens": 49756789.0, "step": 25180 }, { "entropy": 0.8978054605424404, "epoch": 0.7215387479770277, "grad_norm": 10.875, "learning_rate": 3.624735420942705e-05, "loss": 0.8928098678588867, "mean_token_accuracy": 0.7939706485718488, "num_tokens": 49776027.0, "step": 25190 }, { "entropy": 0.9643866701051593, "epoch": 0.7218251865431161, "grad_norm": 8.5, "learning_rate": 3.623716146436229e-05, "loss": 0.970761775970459, "mean_token_accuracy": 0.779435719549656, "num_tokens": 49796575.0, "step": 25200 }, { "entropy": 0.8257108256220818, "epoch": 0.7221116251092047, "grad_norm": 8.375, "learning_rate": 3.6226966377892546e-05, "loss": 0.8336959838867187, "mean_token_accuracy": 0.8105511389672756, "num_tokens": 49814955.0, "step": 25210 }, { "entropy": 0.886202254705131, "epoch": 0.7223980636752932, "grad_norm": 7.78125, "learning_rate": 3.6216768952142093e-05, "loss": 0.8790486335754395, "mean_token_accuracy": 0.7987617738544941, "num_tokens": 49833723.0, "step": 25220 }, { "entropy": 0.8769304728135466, "epoch": 0.7226845022413818, "grad_norm": 6.59375, "learning_rate": 3.620656918923569e-05, "loss": 0.8774904251098633, "mean_token_accuracy": 0.7949467454105615, "num_tokens": 49854822.0, "step": 25230 }, { "entropy": 0.9062212869524956, "epoch": 0.7229709408074703, "grad_norm": 8.5625, "learning_rate": 3.619636709129858e-05, "loss": 0.9479777336120605, "mean_token_accuracy": 0.7838595557957888, "num_tokens": 49873575.0, "step": 25240 }, { "entropy": 0.7590373813640326, "epoch": 0.7232573793735588, "grad_norm": 7.9375, "learning_rate": 3.618616266045651e-05, "loss": 0.7561225891113281, "mean_token_accuracy": 0.820141177624464, "num_tokens": 49893139.0, "step": 25250 }, { "entropy": 0.7808217267505825, "epoch": 0.7235438179396474, "grad_norm": 8.3125, "learning_rate": 3.617595589883569e-05, "loss": 0.7352260112762451, "mean_token_accuracy": 0.8220109827816486, "num_tokens": 49911853.0, "step": 25260 }, { "entropy": 0.8877162696793676, "epoch": 0.723830256505736, "grad_norm": 4.59375, "learning_rate": 3.616574680856285e-05, "loss": 0.8666891098022461, "mean_token_accuracy": 0.8051755167543888, "num_tokens": 49931155.0, "step": 25270 }, { "entropy": 0.8880802664905787, "epoch": 0.7241166950718245, "grad_norm": 12.1875, "learning_rate": 3.6155535391765165e-05, "loss": 0.9708821296691894, "mean_token_accuracy": 0.7877816524356603, "num_tokens": 49950514.0, "step": 25280 }, { "entropy": 0.8563689401373267, "epoch": 0.724403133637913, "grad_norm": 8.0625, "learning_rate": 3.614532165057032e-05, "loss": 0.8444599151611328, "mean_token_accuracy": 0.7887032944709063, "num_tokens": 49970892.0, "step": 25290 }, { "entropy": 0.8647924887016416, "epoch": 0.7246895722040015, "grad_norm": 9.5, "learning_rate": 3.6135105587106474e-05, "loss": 0.8575145721435546, "mean_token_accuracy": 0.8014380410313606, "num_tokens": 49989829.0, "step": 25300 }, { "entropy": 0.8008024420589208, "epoch": 0.7249760107700901, "grad_norm": 6.34375, "learning_rate": 3.6124887203502276e-05, "loss": 0.7911601543426514, "mean_token_accuracy": 0.8129055164754391, "num_tokens": 50009042.0, "step": 25310 }, { "entropy": 0.8116602819412947, "epoch": 0.7252624493361787, "grad_norm": 14.625, "learning_rate": 3.611466650188685e-05, "loss": 0.8293948173522949, "mean_token_accuracy": 0.8167246378958225, "num_tokens": 50027625.0, "step": 25320 }, { "entropy": 0.913325471803546, "epoch": 0.7255488879022671, "grad_norm": 8.1875, "learning_rate": 3.6104443484389815e-05, "loss": 0.9089467048645019, "mean_token_accuracy": 0.7899933759123087, "num_tokens": 50046987.0, "step": 25330 }, { "entropy": 0.7464435068890453, "epoch": 0.7258353264683557, "grad_norm": 9.25, "learning_rate": 3.609421815314127e-05, "loss": 0.7980657577514648, "mean_token_accuracy": 0.8171733662486076, "num_tokens": 50066084.0, "step": 25340 }, { "entropy": 0.9087998055852949, "epoch": 0.7261217650344443, "grad_norm": 7.90625, "learning_rate": 3.6083990510271785e-05, "loss": 0.8500869750976563, "mean_token_accuracy": 0.8082822248339653, "num_tokens": 50085982.0, "step": 25350 }, { "entropy": 0.805213930644095, "epoch": 0.7264082036005328, "grad_norm": 7.1875, "learning_rate": 3.6073760557912424e-05, "loss": 0.8128963470458984, "mean_token_accuracy": 0.8148401349782943, "num_tokens": 50105624.0, "step": 25360 }, { "entropy": 0.857085132598877, "epoch": 0.7266946421666213, "grad_norm": 7.0625, "learning_rate": 3.6063528298194725e-05, "loss": 0.883035945892334, "mean_token_accuracy": 0.7993238713592291, "num_tokens": 50125907.0, "step": 25370 }, { "entropy": 0.8717297909781336, "epoch": 0.7269810807327098, "grad_norm": 8.375, "learning_rate": 3.6053293733250696e-05, "loss": 0.9299320220947266, "mean_token_accuracy": 0.7942509803920984, "num_tokens": 50145674.0, "step": 25380 }, { "entropy": 0.8375752992928028, "epoch": 0.7272675192987984, "grad_norm": 6.34375, "learning_rate": 3.604305686521286e-05, "loss": 0.8175417900085449, "mean_token_accuracy": 0.800636537373066, "num_tokens": 50165434.0, "step": 25390 }, { "entropy": 0.7830001374706625, "epoch": 0.727553957864887, "grad_norm": 6.78125, "learning_rate": 3.6032817696214196e-05, "loss": 0.7582241535186768, "mean_token_accuracy": 0.8185066506266594, "num_tokens": 50184485.0, "step": 25400 }, { "entropy": 0.767955869436264, "epoch": 0.7278403964309754, "grad_norm": 9.5625, "learning_rate": 3.602257622838814e-05, "loss": 0.7483684539794921, "mean_token_accuracy": 0.8316808439791202, "num_tokens": 50202246.0, "step": 25410 }, { "entropy": 0.7491380538791418, "epoch": 0.728126834997064, "grad_norm": 8.5625, "learning_rate": 3.601233246386866e-05, "loss": 0.7491294384002686, "mean_token_accuracy": 0.8253129716962576, "num_tokens": 50221915.0, "step": 25420 }, { "entropy": 0.8463462656363845, "epoch": 0.7284132735631526, "grad_norm": 8.125, "learning_rate": 3.600208640479016e-05, "loss": 0.883491039276123, "mean_token_accuracy": 0.7949466314166784, "num_tokens": 50241010.0, "step": 25430 }, { "entropy": 0.7316294064745307, "epoch": 0.7286997121292411, "grad_norm": 8.875, "learning_rate": 3.599183805328754e-05, "loss": 0.7621360301971436, "mean_token_accuracy": 0.8111925840377807, "num_tokens": 50260881.0, "step": 25440 }, { "entropy": 0.9040399137884378, "epoch": 0.7289861506953296, "grad_norm": 7.3125, "learning_rate": 3.5981587411496174e-05, "loss": 0.9092502593994141, "mean_token_accuracy": 0.7972023166716099, "num_tokens": 50280390.0, "step": 25450 }, { "entropy": 0.8928201645612717, "epoch": 0.7292725892614181, "grad_norm": 6.21875, "learning_rate": 3.597133448155191e-05, "loss": 0.9162413597106933, "mean_token_accuracy": 0.7866269256919622, "num_tokens": 50299917.0, "step": 25460 }, { "entropy": 0.9010098559781909, "epoch": 0.7295590278275067, "grad_norm": 6.59375, "learning_rate": 3.596107926559108e-05, "loss": 0.9302038192749024, "mean_token_accuracy": 0.7894194804131984, "num_tokens": 50319321.0, "step": 25470 }, { "entropy": 0.8775648446753621, "epoch": 0.7298454663935953, "grad_norm": 10.75, "learning_rate": 3.5950821765750485e-05, "loss": 0.8193497657775879, "mean_token_accuracy": 0.811574999243021, "num_tokens": 50338741.0, "step": 25480 }, { "entropy": 0.8680825915187598, "epoch": 0.7301319049596837, "grad_norm": 8.0625, "learning_rate": 3.594056198416741e-05, "loss": 0.878885555267334, "mean_token_accuracy": 0.7932611789554358, "num_tokens": 50358014.0, "step": 25490 }, { "entropy": 0.8629014974460005, "epoch": 0.7304183435257723, "grad_norm": 7.78125, "learning_rate": 3.59302999229796e-05, "loss": 0.8506993293762207, "mean_token_accuracy": 0.8075351934880018, "num_tokens": 50378092.0, "step": 25500 }, { "entropy": 0.8716317000798881, "epoch": 0.7307047820918608, "grad_norm": 7.75, "learning_rate": 3.59200355843253e-05, "loss": 0.8653067588806153, "mean_token_accuracy": 0.8030672948807478, "num_tokens": 50398477.0, "step": 25510 }, { "entropy": 0.8630946153774858, "epoch": 0.7309912206579494, "grad_norm": 8.125, "learning_rate": 3.59097689703432e-05, "loss": 0.9012486457824707, "mean_token_accuracy": 0.7892118867486715, "num_tokens": 50418802.0, "step": 25520 }, { "entropy": 1.0236148610711098, "epoch": 0.731277659224038, "grad_norm": 9.625, "learning_rate": 3.58995000831725e-05, "loss": 1.0553603172302246, "mean_token_accuracy": 0.7616301469504834, "num_tokens": 50440334.0, "step": 25530 }, { "entropy": 0.8734800208359956, "epoch": 0.7315640977901264, "grad_norm": 9.25, "learning_rate": 3.588922892495283e-05, "loss": 0.8897005081176758, "mean_token_accuracy": 0.7944554537534714, "num_tokens": 50460114.0, "step": 25540 }, { "entropy": 0.8958484664559364, "epoch": 0.731850536356215, "grad_norm": 5.71875, "learning_rate": 3.5878955497824326e-05, "loss": 0.885152530670166, "mean_token_accuracy": 0.793623449653387, "num_tokens": 50480277.0, "step": 25550 }, { "entropy": 0.9197828475385904, "epoch": 0.7321369749223036, "grad_norm": 9.5, "learning_rate": 3.586867980392758e-05, "loss": 0.9227399826049805, "mean_token_accuracy": 0.7779494524002075, "num_tokens": 50500179.0, "step": 25560 }, { "entropy": 0.9099521866068244, "epoch": 0.7324234134883921, "grad_norm": 7.75, "learning_rate": 3.585840184540368e-05, "loss": 0.9108148574829101, "mean_token_accuracy": 0.7942201592028141, "num_tokens": 50520406.0, "step": 25570 }, { "entropy": 0.8826533364132046, "epoch": 0.7327098520544806, "grad_norm": 7.21875, "learning_rate": 3.5848121624394156e-05, "loss": 0.8318147659301758, "mean_token_accuracy": 0.8102368142455816, "num_tokens": 50539988.0, "step": 25580 }, { "entropy": 0.8213028468191623, "epoch": 0.7329962906205691, "grad_norm": 8.625, "learning_rate": 3.583783914304102e-05, "loss": 0.8443984985351562, "mean_token_accuracy": 0.8002722475677728, "num_tokens": 50559507.0, "step": 25590 }, { "entropy": 0.8935061763972044, "epoch": 0.7332827291866577, "grad_norm": 5.96875, "learning_rate": 3.582755440348676e-05, "loss": 0.9767901420593261, "mean_token_accuracy": 0.7856005642563104, "num_tokens": 50580096.0, "step": 25600 }, { "entropy": 0.8468574969097972, "epoch": 0.7335691677527463, "grad_norm": 7.6875, "learning_rate": 3.581726740787434e-05, "loss": 0.8435724258422852, "mean_token_accuracy": 0.803973813354969, "num_tokens": 50598573.0, "step": 25610 }, { "entropy": 0.9201878350228071, "epoch": 0.7338556063188347, "grad_norm": 8.6875, "learning_rate": 3.580697815834718e-05, "loss": 0.9392012596130371, "mean_token_accuracy": 0.7843753419816494, "num_tokens": 50619466.0, "step": 25620 }, { "entropy": 0.8217475406825543, "epoch": 0.7341420448849233, "grad_norm": 8.0625, "learning_rate": 3.579668665704917e-05, "loss": 0.8090158462524414, "mean_token_accuracy": 0.8104457199573517, "num_tokens": 50638829.0, "step": 25630 }, { "entropy": 0.8251393364742399, "epoch": 0.7344284834510119, "grad_norm": 8.9375, "learning_rate": 3.5786392906124674e-05, "loss": 0.7742052555084229, "mean_token_accuracy": 0.8107036590576172, "num_tokens": 50657096.0, "step": 25640 }, { "entropy": 0.7661686180159449, "epoch": 0.7347149220171004, "grad_norm": 9.625, "learning_rate": 3.577609690771855e-05, "loss": 0.8344218254089355, "mean_token_accuracy": 0.8112305730581284, "num_tokens": 50675862.0, "step": 25650 }, { "entropy": 0.8311743228696287, "epoch": 0.7350013605831889, "grad_norm": 8.375, "learning_rate": 3.576579866397606e-05, "loss": 0.829670524597168, "mean_token_accuracy": 0.8036914974451065, "num_tokens": 50695614.0, "step": 25660 }, { "entropy": 0.8535969400778413, "epoch": 0.7352877991492774, "grad_norm": 7.15625, "learning_rate": 3.5755498177043e-05, "loss": 0.8303332328796387, "mean_token_accuracy": 0.8072097986936569, "num_tokens": 50715884.0, "step": 25670 }, { "entropy": 0.8131112158298492, "epoch": 0.735574237715366, "grad_norm": 10.4375, "learning_rate": 3.574519544906561e-05, "loss": 0.8319113731384278, "mean_token_accuracy": 0.7982664216309786, "num_tokens": 50735403.0, "step": 25680 }, { "entropy": 0.8632119562476873, "epoch": 0.7358606762814546, "grad_norm": 6.46875, "learning_rate": 3.5734890482190576e-05, "loss": 0.8611366271972656, "mean_token_accuracy": 0.8116211704909801, "num_tokens": 50756019.0, "step": 25690 }, { "entropy": 0.8526527509093285, "epoch": 0.736147114847543, "grad_norm": 8.3125, "learning_rate": 3.572458327856508e-05, "loss": 0.8800951957702636, "mean_token_accuracy": 0.7935364175587892, "num_tokens": 50776095.0, "step": 25700 }, { "entropy": 0.8133847190067172, "epoch": 0.7364335534136316, "grad_norm": 8.375, "learning_rate": 3.5714273840336756e-05, "loss": 0.8385985374450684, "mean_token_accuracy": 0.8041869215667248, "num_tokens": 50795854.0, "step": 25710 }, { "entropy": 0.868499792739749, "epoch": 0.7367199919797202, "grad_norm": 8.875, "learning_rate": 3.570396216965372e-05, "loss": 0.8760632514953614, "mean_token_accuracy": 0.8023925203830004, "num_tokens": 50817022.0, "step": 25720 }, { "entropy": 0.8643961064517498, "epoch": 0.7370064305458087, "grad_norm": 7.40625, "learning_rate": 3.56936482686645e-05, "loss": 0.8781773567199707, "mean_token_accuracy": 0.8054949671030045, "num_tokens": 50835420.0, "step": 25730 }, { "entropy": 0.820056433416903, "epoch": 0.7372928691118972, "grad_norm": 8.75, "learning_rate": 3.568333213951816e-05, "loss": 0.8661311149597168, "mean_token_accuracy": 0.8077930971980095, "num_tokens": 50854304.0, "step": 25740 }, { "entropy": 0.8688059527426958, "epoch": 0.7375793076779857, "grad_norm": 8.8125, "learning_rate": 3.567301378436421e-05, "loss": 0.939057445526123, "mean_token_accuracy": 0.7895231589674949, "num_tokens": 50874263.0, "step": 25750 }, { "entropy": 0.7764919400215149, "epoch": 0.7378657462440743, "grad_norm": 7.3125, "learning_rate": 3.566269320535257e-05, "loss": 0.771301555633545, "mean_token_accuracy": 0.8211447533220053, "num_tokens": 50894763.0, "step": 25760 }, { "entropy": 0.8642727121710777, "epoch": 0.7381521848101629, "grad_norm": 7.1875, "learning_rate": 3.565237040463369e-05, "loss": 0.8714384078979492, "mean_token_accuracy": 0.8084221445024014, "num_tokens": 50913907.0, "step": 25770 }, { "entropy": 0.9059589210897684, "epoch": 0.7384386233762513, "grad_norm": 8.4375, "learning_rate": 3.564204538435845e-05, "loss": 0.900432014465332, "mean_token_accuracy": 0.7974840853363275, "num_tokens": 50933128.0, "step": 25780 }, { "entropy": 0.8344452487304806, "epoch": 0.7387250619423399, "grad_norm": 11.375, "learning_rate": 3.56317181466782e-05, "loss": 0.8775764465332031, "mean_token_accuracy": 0.8043027073144913, "num_tokens": 50951949.0, "step": 25790 }, { "entropy": 0.8202037416398525, "epoch": 0.7390115005084285, "grad_norm": 8.6875, "learning_rate": 3.562138869374474e-05, "loss": 0.8269149780273437, "mean_token_accuracy": 0.8021810695528984, "num_tokens": 50970981.0, "step": 25800 }, { "entropy": 0.9222113093361258, "epoch": 0.739297939074517, "grad_norm": 8.1875, "learning_rate": 3.561105702771036e-05, "loss": 0.8812948226928711, "mean_token_accuracy": 0.8018766734749079, "num_tokens": 50989988.0, "step": 25810 }, { "entropy": 0.7829474653117359, "epoch": 0.7395843776406056, "grad_norm": 6.5625, "learning_rate": 3.560072315072779e-05, "loss": 0.7730511665344239, "mean_token_accuracy": 0.8189279146492481, "num_tokens": 51009472.0, "step": 25820 }, { "entropy": 0.8658244260586798, "epoch": 0.739870816206694, "grad_norm": 9.375, "learning_rate": 3.5590387064950204e-05, "loss": 0.8431542396545411, "mean_token_accuracy": 0.8013987984508276, "num_tokens": 51028566.0, "step": 25830 }, { "entropy": 0.8187919298186899, "epoch": 0.7401572547727826, "grad_norm": 11.9375, "learning_rate": 3.558004877253128e-05, "loss": 0.8367950439453125, "mean_token_accuracy": 0.8042069599032402, "num_tokens": 51049343.0, "step": 25840 }, { "entropy": 0.8362379780039191, "epoch": 0.7404436933388712, "grad_norm": 8.4375, "learning_rate": 3.556970827562513e-05, "loss": 0.806118106842041, "mean_token_accuracy": 0.8116401378065348, "num_tokens": 51068734.0, "step": 25850 }, { "entropy": 0.8945028910413384, "epoch": 0.7407301319049597, "grad_norm": 7.53125, "learning_rate": 3.555936557638632e-05, "loss": 0.9049418449401856, "mean_token_accuracy": 0.7845442332327366, "num_tokens": 51089233.0, "step": 25860 }, { "entropy": 0.8354742009192705, "epoch": 0.7410165704710482, "grad_norm": 11.5625, "learning_rate": 3.5549020676969876e-05, "loss": 0.8491250038146972, "mean_token_accuracy": 0.8030696041882038, "num_tokens": 51108354.0, "step": 25870 }, { "entropy": 0.769727398827672, "epoch": 0.7413030090371368, "grad_norm": 8.5625, "learning_rate": 3.55386735795313e-05, "loss": 0.7674683094024658, "mean_token_accuracy": 0.8235304746776819, "num_tokens": 51127470.0, "step": 25880 }, { "entropy": 0.8559348948299885, "epoch": 0.7415894476032253, "grad_norm": 6.3125, "learning_rate": 3.552832428622653e-05, "loss": 0.8524891853332519, "mean_token_accuracy": 0.8069794569164515, "num_tokens": 51146204.0, "step": 25890 }, { "entropy": 0.7955260834656656, "epoch": 0.7418758861693139, "grad_norm": 5.78125, "learning_rate": 3.5517972799212e-05, "loss": 0.788578462600708, "mean_token_accuracy": 0.8154920611530543, "num_tokens": 51166625.0, "step": 25900 }, { "entropy": 0.8393904096446931, "epoch": 0.7421623247354023, "grad_norm": 8.75, "learning_rate": 3.550761912064454e-05, "loss": 0.8390960693359375, "mean_token_accuracy": 0.8166884388774633, "num_tokens": 51188297.0, "step": 25910 }, { "entropy": 0.8153709162026643, "epoch": 0.7424487633014909, "grad_norm": 12.6875, "learning_rate": 3.549726325268149e-05, "loss": 0.828587818145752, "mean_token_accuracy": 0.8129624269902707, "num_tokens": 51209466.0, "step": 25920 }, { "entropy": 0.9046401615254581, "epoch": 0.7427352018675795, "grad_norm": 7.3125, "learning_rate": 3.548690519748062e-05, "loss": 0.977498722076416, "mean_token_accuracy": 0.7834621861577034, "num_tokens": 51231405.0, "step": 25930 }, { "entropy": 0.7820390421897173, "epoch": 0.743021640433668, "grad_norm": 7.125, "learning_rate": 3.547654495720015e-05, "loss": 0.8079113006591797, "mean_token_accuracy": 0.8138581451028586, "num_tokens": 51250019.0, "step": 25940 }, { "entropy": 1.0124660728499293, "epoch": 0.7433080789997565, "grad_norm": 10.25, "learning_rate": 3.5466182533998796e-05, "loss": 1.0319920539855958, "mean_token_accuracy": 0.7666232988238335, "num_tokens": 51270693.0, "step": 25950 }, { "entropy": 0.9429703708738089, "epoch": 0.743594517565845, "grad_norm": 9.5, "learning_rate": 3.545581793003567e-05, "loss": 0.9450200080871582, "mean_token_accuracy": 0.7808747459203005, "num_tokens": 51292151.0, "step": 25960 }, { "entropy": 0.824187702126801, "epoch": 0.7438809561319336, "grad_norm": 9.0625, "learning_rate": 3.54454511474704e-05, "loss": 0.8381131172180176, "mean_token_accuracy": 0.8006341129541397, "num_tokens": 51311910.0, "step": 25970 }, { "entropy": 0.8678090825676918, "epoch": 0.7441673946980222, "grad_norm": 8.25, "learning_rate": 3.5435082188463e-05, "loss": 0.8155076980590821, "mean_token_accuracy": 0.8131590910255909, "num_tokens": 51330426.0, "step": 25980 }, { "entropy": 0.861419098265469, "epoch": 0.7444538332641106, "grad_norm": 7.8125, "learning_rate": 3.5424711055173995e-05, "loss": 0.9492282867431641, "mean_token_accuracy": 0.7819139890372753, "num_tokens": 51350045.0, "step": 25990 }, { "entropy": 0.8569882918149233, "epoch": 0.7447402718301992, "grad_norm": 7.59375, "learning_rate": 3.541433774976435e-05, "loss": 0.8695609092712402, "mean_token_accuracy": 0.7995440557599067, "num_tokens": 51369696.0, "step": 26000 }, { "entropy": 0.873808422870934, "epoch": 0.7450267103962878, "grad_norm": 11.125, "learning_rate": 3.540396227439546e-05, "loss": 0.8560063362121582, "mean_token_accuracy": 0.8067202430218459, "num_tokens": 51388261.0, "step": 26010 }, { "entropy": 0.8037474295124412, "epoch": 0.7453131489623763, "grad_norm": 9.0, "learning_rate": 3.5393584631229195e-05, "loss": 0.7332080364227295, "mean_token_accuracy": 0.8144133012741804, "num_tokens": 51407096.0, "step": 26020 }, { "entropy": 0.8231912013143301, "epoch": 0.7455995875284648, "grad_norm": 7.625, "learning_rate": 3.538320482242786e-05, "loss": 0.8327185630798339, "mean_token_accuracy": 0.8151165079325438, "num_tokens": 51426906.0, "step": 26030 }, { "entropy": 0.7550816997885704, "epoch": 0.7458860260945533, "grad_norm": 8.0, "learning_rate": 3.537282285015422e-05, "loss": 0.8356232643127441, "mean_token_accuracy": 0.811156802624464, "num_tokens": 51445662.0, "step": 26040 }, { "entropy": 0.8293792847078294, "epoch": 0.7461724646606419, "grad_norm": 10.0625, "learning_rate": 3.5362438716571506e-05, "loss": 0.8377252578735351, "mean_token_accuracy": 0.8096207238733768, "num_tokens": 51465726.0, "step": 26050 }, { "entropy": 0.8844648484140635, "epoch": 0.7464589032267305, "grad_norm": 8.9375, "learning_rate": 3.5352052423843366e-05, "loss": 0.8894292831420898, "mean_token_accuracy": 0.7933140449225903, "num_tokens": 51485857.0, "step": 26060 }, { "entropy": 0.8335542250424623, "epoch": 0.746745341792819, "grad_norm": 8.8125, "learning_rate": 3.534166397413393e-05, "loss": 0.8875211715698242, "mean_token_accuracy": 0.7995186943560839, "num_tokens": 51506422.0, "step": 26070 }, { "entropy": 0.8407507000491024, "epoch": 0.7470317803589075, "grad_norm": 6.65625, "learning_rate": 3.5331273369607744e-05, "loss": 0.870060920715332, "mean_token_accuracy": 0.7967653557658195, "num_tokens": 51525369.0, "step": 26080 }, { "entropy": 0.8357246555387974, "epoch": 0.7473182189249961, "grad_norm": 7.71875, "learning_rate": 3.532088061242983e-05, "loss": 0.8532617568969727, "mean_token_accuracy": 0.7999270983040333, "num_tokens": 51544727.0, "step": 26090 }, { "entropy": 0.7833263717591763, "epoch": 0.7476046574910846, "grad_norm": 9.625, "learning_rate": 3.531048570476567e-05, "loss": 0.7686203479766845, "mean_token_accuracy": 0.8179000586271286, "num_tokens": 51563519.0, "step": 26100 }, { "entropy": 0.8685168832540512, "epoch": 0.7478910960571732, "grad_norm": 6.96875, "learning_rate": 3.530008864878115e-05, "loss": 0.8958255767822265, "mean_token_accuracy": 0.7918981589376927, "num_tokens": 51581897.0, "step": 26110 }, { "entropy": 0.8774122266098857, "epoch": 0.7481775346232616, "grad_norm": 6.90625, "learning_rate": 3.528968944664264e-05, "loss": 0.9404688835144043, "mean_token_accuracy": 0.7875281944870949, "num_tokens": 51600854.0, "step": 26120 }, { "entropy": 0.8331232646480202, "epoch": 0.7484639731893502, "grad_norm": 6.4375, "learning_rate": 3.527928810051695e-05, "loss": 0.8630148887634277, "mean_token_accuracy": 0.7937082324177027, "num_tokens": 51621362.0, "step": 26130 }, { "entropy": 0.833460976742208, "epoch": 0.7487504117554388, "grad_norm": 5.71875, "learning_rate": 3.5268884612571314e-05, "loss": 0.7642493724822998, "mean_token_accuracy": 0.8224336314946413, "num_tokens": 51640498.0, "step": 26140 }, { "entropy": 0.8090186337009072, "epoch": 0.7490368503215273, "grad_norm": 8.8125, "learning_rate": 3.5258478984973456e-05, "loss": 0.7941810607910156, "mean_token_accuracy": 0.8121600780636072, "num_tokens": 51660292.0, "step": 26150 }, { "entropy": 0.879202481219545, "epoch": 0.7493232888876158, "grad_norm": 5.9375, "learning_rate": 3.524807121989149e-05, "loss": 0.8528727531433106, "mean_token_accuracy": 0.8112926602363586, "num_tokens": 51681331.0, "step": 26160 }, { "entropy": 0.7680205410346389, "epoch": 0.7496097274537044, "grad_norm": 7.71875, "learning_rate": 3.523766131949403e-05, "loss": 0.76336669921875, "mean_token_accuracy": 0.8126701395958662, "num_tokens": 51700486.0, "step": 26170 }, { "entropy": 0.8317784878425301, "epoch": 0.7498961660197929, "grad_norm": 8.4375, "learning_rate": 3.52272492859501e-05, "loss": 0.7898430824279785, "mean_token_accuracy": 0.8107345547527075, "num_tokens": 51721362.0, "step": 26180 }, { "entropy": 0.8822249639779329, "epoch": 0.7501826045858815, "grad_norm": 13.6875, "learning_rate": 3.521683512142918e-05, "loss": 0.9336329460144043, "mean_token_accuracy": 0.7861962988972664, "num_tokens": 51740799.0, "step": 26190 }, { "entropy": 0.7635739616118371, "epoch": 0.7504690431519699, "grad_norm": 5.875, "learning_rate": 3.5206418828101197e-05, "loss": 0.7606573581695557, "mean_token_accuracy": 0.81234714910388, "num_tokens": 51759763.0, "step": 26200 }, { "entropy": 0.7891520591452718, "epoch": 0.7507554817180585, "grad_norm": 7.46875, "learning_rate": 3.5196000408136524e-05, "loss": 0.8098342895507813, "mean_token_accuracy": 0.8095672111958265, "num_tokens": 51780483.0, "step": 26210 }, { "entropy": 0.8234855726361274, "epoch": 0.7510419202841471, "grad_norm": 6.34375, "learning_rate": 3.5185579863705944e-05, "loss": 0.8616086959838867, "mean_token_accuracy": 0.8050942860543728, "num_tokens": 51799789.0, "step": 26220 }, { "entropy": 0.8246013527736068, "epoch": 0.7513283588502356, "grad_norm": 7.71875, "learning_rate": 3.517515719698074e-05, "loss": 0.8544775962829589, "mean_token_accuracy": 0.7987392358481884, "num_tokens": 51818793.0, "step": 26230 }, { "entropy": 0.8523023383691907, "epoch": 0.7516147974163241, "grad_norm": 6.5625, "learning_rate": 3.5164732410132594e-05, "loss": 0.864194393157959, "mean_token_accuracy": 0.7897499937564134, "num_tokens": 51839659.0, "step": 26240 }, { "entropy": 0.8035355418920517, "epoch": 0.7519012359824127, "grad_norm": 7.6875, "learning_rate": 3.5154305505333646e-05, "loss": 0.7928609848022461, "mean_token_accuracy": 0.817879532277584, "num_tokens": 51860235.0, "step": 26250 }, { "entropy": 0.8394896944984793, "epoch": 0.7521876745485012, "grad_norm": 8.625, "learning_rate": 3.514387648475646e-05, "loss": 0.8573348999023438, "mean_token_accuracy": 0.795827804505825, "num_tokens": 51879907.0, "step": 26260 }, { "entropy": 0.824612878356129, "epoch": 0.7524741131145898, "grad_norm": 11.4375, "learning_rate": 3.513344535057408e-05, "loss": 0.7836009502410889, "mean_token_accuracy": 0.8175262290984392, "num_tokens": 51899277.0, "step": 26270 }, { "entropy": 0.8277591485530138, "epoch": 0.7527605516806782, "grad_norm": 5.0, "learning_rate": 3.512301210495994e-05, "loss": 0.8160225868225097, "mean_token_accuracy": 0.8197535883635283, "num_tokens": 51917700.0, "step": 26280 }, { "entropy": 0.7451574834994972, "epoch": 0.7530469902467668, "grad_norm": 7.78125, "learning_rate": 3.511257675008795e-05, "loss": 0.753144645690918, "mean_token_accuracy": 0.8260019727051258, "num_tokens": 51935260.0, "step": 26290 }, { "entropy": 0.8926470294594765, "epoch": 0.7533334288128554, "grad_norm": 10.6875, "learning_rate": 3.510213928813245e-05, "loss": 0.8888670921325683, "mean_token_accuracy": 0.797199783846736, "num_tokens": 51954918.0, "step": 26300 }, { "entropy": 0.9743563750758767, "epoch": 0.7536198673789439, "grad_norm": 8.0, "learning_rate": 3.509169972126822e-05, "loss": 0.98086576461792, "mean_token_accuracy": 0.7941437188535929, "num_tokens": 51974465.0, "step": 26310 }, { "entropy": 0.8561498478055001, "epoch": 0.7539063059450324, "grad_norm": 9.3125, "learning_rate": 3.5081258051670464e-05, "loss": 0.8359295845031738, "mean_token_accuracy": 0.8092184867709875, "num_tokens": 51994574.0, "step": 26320 }, { "entropy": 0.7877449616789818, "epoch": 0.754192744511121, "grad_norm": 8.375, "learning_rate": 3.5070814281514844e-05, "loss": 0.8276229858398437, "mean_token_accuracy": 0.8102397363632917, "num_tokens": 52014239.0, "step": 26330 }, { "entropy": 0.8564531905576587, "epoch": 0.7544791830772095, "grad_norm": 9.8125, "learning_rate": 3.506036841297745e-05, "loss": 0.8242484092712402, "mean_token_accuracy": 0.8077566057443619, "num_tokens": 52032999.0, "step": 26340 }, { "entropy": 0.7600436992943287, "epoch": 0.7547656216432981, "grad_norm": 11.0625, "learning_rate": 3.504992044823482e-05, "loss": 0.7518444061279297, "mean_token_accuracy": 0.8198941953480243, "num_tokens": 52052554.0, "step": 26350 }, { "entropy": 0.726802156213671, "epoch": 0.7550520602093866, "grad_norm": 10.125, "learning_rate": 3.50394703894639e-05, "loss": 0.7423184394836426, "mean_token_accuracy": 0.8298457097262144, "num_tokens": 52071545.0, "step": 26360 }, { "entropy": 0.7876180458813906, "epoch": 0.7553384987754751, "grad_norm": 5.78125, "learning_rate": 3.502901823884212e-05, "loss": 0.8596455574035644, "mean_token_accuracy": 0.7963002383708954, "num_tokens": 52090889.0, "step": 26370 }, { "entropy": 0.785641991533339, "epoch": 0.7556249373415637, "grad_norm": 8.625, "learning_rate": 3.5018563998547296e-05, "loss": 0.7831881523132325, "mean_token_accuracy": 0.8133076779544354, "num_tokens": 52109118.0, "step": 26380 }, { "entropy": 0.879093511775136, "epoch": 0.7559113759076522, "grad_norm": 5.71875, "learning_rate": 3.500810767075769e-05, "loss": 0.8494023323059082, "mean_token_accuracy": 0.8061054971069097, "num_tokens": 52127961.0, "step": 26390 }, { "entropy": 0.9178974408656358, "epoch": 0.7561978144737408, "grad_norm": 9.5625, "learning_rate": 3.499764925765206e-05, "loss": 0.9461101531982422, "mean_token_accuracy": 0.7897113401442766, "num_tokens": 52148327.0, "step": 26400 }, { "entropy": 0.8440957156009972, "epoch": 0.7564842530398292, "grad_norm": 7.28125, "learning_rate": 3.4987188761409493e-05, "loss": 0.859461784362793, "mean_token_accuracy": 0.8005023315548897, "num_tokens": 52167939.0, "step": 26410 }, { "entropy": 0.8308511272072792, "epoch": 0.7567706916059178, "grad_norm": 8.1875, "learning_rate": 3.49767261842096e-05, "loss": 0.8349628448486328, "mean_token_accuracy": 0.7993259865790605, "num_tokens": 52186616.0, "step": 26420 }, { "entropy": 0.8234991502016783, "epoch": 0.7570571301720064, "grad_norm": 9.25, "learning_rate": 3.496626152823238e-05, "loss": 0.8001429557800293, "mean_token_accuracy": 0.8214220400899649, "num_tokens": 52205639.0, "step": 26430 }, { "entropy": 0.8433365033939481, "epoch": 0.7573435687380949, "grad_norm": 10.375, "learning_rate": 3.495579479565828e-05, "loss": 0.8318280220031739, "mean_token_accuracy": 0.8027717597782612, "num_tokens": 52225235.0, "step": 26440 }, { "entropy": 0.8551079725846649, "epoch": 0.7576300073041834, "grad_norm": 10.8125, "learning_rate": 3.494532598866817e-05, "loss": 0.8449461936950684, "mean_token_accuracy": 0.8136380106210709, "num_tokens": 52245031.0, "step": 26450 }, { "entropy": 0.768262859620154, "epoch": 0.757916445870272, "grad_norm": 6.9375, "learning_rate": 3.493485510944337e-05, "loss": 0.7951266288757324, "mean_token_accuracy": 0.8070656560361386, "num_tokens": 52265163.0, "step": 26460 }, { "entropy": 0.859142622537911, "epoch": 0.7582028844363605, "grad_norm": 9.0625, "learning_rate": 3.492438216016561e-05, "loss": 0.8857991218566894, "mean_token_accuracy": 0.7953007224947214, "num_tokens": 52285658.0, "step": 26470 }, { "entropy": 0.7794176394119858, "epoch": 0.7584893230024491, "grad_norm": 8.6875, "learning_rate": 3.4913907143017065e-05, "loss": 0.7602837562561036, "mean_token_accuracy": 0.8252001650631428, "num_tokens": 52303837.0, "step": 26480 }, { "entropy": 0.8041056545451284, "epoch": 0.7587757615685375, "grad_norm": 7.875, "learning_rate": 3.490343006018034e-05, "loss": 0.8547499656677247, "mean_token_accuracy": 0.8084862355142832, "num_tokens": 52324898.0, "step": 26490 }, { "entropy": 0.7510609744116664, "epoch": 0.7590622001346261, "grad_norm": 5.875, "learning_rate": 3.4892950913838466e-05, "loss": 0.7699031829833984, "mean_token_accuracy": 0.8215194433927536, "num_tokens": 52343740.0, "step": 26500 }, { "entropy": 0.8653112836182117, "epoch": 0.7593486387007147, "grad_norm": 8.125, "learning_rate": 3.4882469706174904e-05, "loss": 0.9233150482177734, "mean_token_accuracy": 0.7936650454998017, "num_tokens": 52362862.0, "step": 26510 }, { "entropy": 0.8440946815535426, "epoch": 0.7596350772668032, "grad_norm": 6.75, "learning_rate": 3.487198643937354e-05, "loss": 0.8550547599792481, "mean_token_accuracy": 0.7979623310267925, "num_tokens": 52381186.0, "step": 26520 }, { "entropy": 0.8838265772908926, "epoch": 0.7599215158328917, "grad_norm": 8.875, "learning_rate": 3.4861501115618724e-05, "loss": 0.9206209182739258, "mean_token_accuracy": 0.7834353622049093, "num_tokens": 52401555.0, "step": 26530 }, { "entropy": 0.8420044707134366, "epoch": 0.7602079543989803, "grad_norm": 7.375, "learning_rate": 3.485101373709516e-05, "loss": 0.8102311134338379, "mean_token_accuracy": 0.8176534339785576, "num_tokens": 52421708.0, "step": 26540 }, { "entropy": 0.9073421392589808, "epoch": 0.7604943929650688, "grad_norm": 9.4375, "learning_rate": 3.4840524305988076e-05, "loss": 0.8838107109069824, "mean_token_accuracy": 0.8005119971930981, "num_tokens": 52441186.0, "step": 26550 }, { "entropy": 1.0016237566247583, "epoch": 0.7607808315311574, "grad_norm": 9.6875, "learning_rate": 3.483003282448304e-05, "loss": 0.9525158882141114, "mean_token_accuracy": 0.7797915127128363, "num_tokens": 52461889.0, "step": 26560 }, { "entropy": 0.8442256396636367, "epoch": 0.7610672700972458, "grad_norm": 6.75, "learning_rate": 3.4819539294766105e-05, "loss": 0.8680953979492188, "mean_token_accuracy": 0.7979808766394854, "num_tokens": 52482569.0, "step": 26570 }, { "entropy": 0.7813249445520342, "epoch": 0.7613537086633344, "grad_norm": 9.25, "learning_rate": 3.480904371902373e-05, "loss": 0.7986842632293701, "mean_token_accuracy": 0.8105838857591152, "num_tokens": 52502470.0, "step": 26580 }, { "entropy": 0.8098172329366207, "epoch": 0.761640147229423, "grad_norm": 8.6875, "learning_rate": 3.479854609944278e-05, "loss": 0.8059099197387696, "mean_token_accuracy": 0.8170627236366272, "num_tokens": 52521291.0, "step": 26590 }, { "entropy": 0.7610129810869694, "epoch": 0.7619265857955115, "grad_norm": 9.6875, "learning_rate": 3.478804643821059e-05, "loss": 0.8094117164611816, "mean_token_accuracy": 0.8065736886113882, "num_tokens": 52540702.0, "step": 26600 }, { "entropy": 0.769207671098411, "epoch": 0.7622130243616001, "grad_norm": 8.6875, "learning_rate": 3.477754473751489e-05, "loss": 0.7706964015960693, "mean_token_accuracy": 0.8162071980535984, "num_tokens": 52560380.0, "step": 26610 }, { "entropy": 0.8744391903281212, "epoch": 0.7624994629276886, "grad_norm": 6.9375, "learning_rate": 3.476704099954385e-05, "loss": 0.8761724472045899, "mean_token_accuracy": 0.79612399302423, "num_tokens": 52580178.0, "step": 26620 }, { "entropy": 0.8036561131477356, "epoch": 0.7627859014937771, "grad_norm": 8.375, "learning_rate": 3.475653522648604e-05, "loss": 0.7980080604553222, "mean_token_accuracy": 0.8018644016236067, "num_tokens": 52598871.0, "step": 26630 }, { "entropy": 0.8312596496194601, "epoch": 0.7630723400598657, "grad_norm": 7.5625, "learning_rate": 3.474602742053049e-05, "loss": 0.855492115020752, "mean_token_accuracy": 0.7996783971786499, "num_tokens": 52618660.0, "step": 26640 }, { "entropy": 0.7979629758745432, "epoch": 0.7633587786259542, "grad_norm": 5.34375, "learning_rate": 3.473551758386663e-05, "loss": 0.8056489944458007, "mean_token_accuracy": 0.8090913765132427, "num_tokens": 52638310.0, "step": 26650 }, { "entropy": 0.7865894125774503, "epoch": 0.7636452171920427, "grad_norm": 9.25, "learning_rate": 3.47250057186843e-05, "loss": 0.7554585933685303, "mean_token_accuracy": 0.8267163578420877, "num_tokens": 52656953.0, "step": 26660 }, { "entropy": 0.8006116697564721, "epoch": 0.7639316557581313, "grad_norm": 8.4375, "learning_rate": 3.47144918271738e-05, "loss": 0.8059024810791016, "mean_token_accuracy": 0.8084939509630203, "num_tokens": 52677334.0, "step": 26670 }, { "entropy": 0.8334105296060443, "epoch": 0.7642180943242198, "grad_norm": 8.125, "learning_rate": 3.470397591152582e-05, "loss": 0.8132050514221192, "mean_token_accuracy": 0.8097854886204005, "num_tokens": 52697671.0, "step": 26680 }, { "entropy": 0.7812070894986392, "epoch": 0.7645045328903084, "grad_norm": 8.8125, "learning_rate": 3.469345797393149e-05, "loss": 0.8130982398986817, "mean_token_accuracy": 0.8082083892077208, "num_tokens": 52717148.0, "step": 26690 }, { "entropy": 0.7898033026605844, "epoch": 0.7647909714563969, "grad_norm": 7.4375, "learning_rate": 3.468293801658237e-05, "loss": 0.7881356716156006, "mean_token_accuracy": 0.8161711033433676, "num_tokens": 52736480.0, "step": 26700 }, { "entropy": 0.8968030896969139, "epoch": 0.7650774100224854, "grad_norm": 7.96875, "learning_rate": 3.4672416041670396e-05, "loss": 0.8516274452209472, "mean_token_accuracy": 0.8137021400034428, "num_tokens": 52756083.0, "step": 26710 }, { "entropy": 0.7484582712873816, "epoch": 0.765363848588574, "grad_norm": 9.1875, "learning_rate": 3.466189205138798e-05, "loss": 0.8066902160644531, "mean_token_accuracy": 0.8175411507487297, "num_tokens": 52774817.0, "step": 26720 }, { "entropy": 0.8153332147747279, "epoch": 0.7656502871546625, "grad_norm": 8.1875, "learning_rate": 3.4651366047927915e-05, "loss": 0.8128476142883301, "mean_token_accuracy": 0.8207752674818038, "num_tokens": 52794232.0, "step": 26730 }, { "entropy": 0.8779219122603535, "epoch": 0.765936725720751, "grad_norm": 9.0625, "learning_rate": 3.4640838033483435e-05, "loss": 0.9276914596557617, "mean_token_accuracy": 0.7996852677315474, "num_tokens": 52813386.0, "step": 26740 }, { "entropy": 0.9061706382781267, "epoch": 0.7662231642868396, "grad_norm": 5.59375, "learning_rate": 3.4630308010248185e-05, "loss": 0.8966855049133301, "mean_token_accuracy": 0.7990551006048918, "num_tokens": 52832265.0, "step": 26750 }, { "entropy": 0.7319659563712776, "epoch": 0.7665096028529281, "grad_norm": 6.625, "learning_rate": 3.4619775980416217e-05, "loss": 0.7310292720794678, "mean_token_accuracy": 0.8259186536073685, "num_tokens": 52851990.0, "step": 26760 }, { "entropy": 0.7539542730897665, "epoch": 0.7667960414190167, "grad_norm": 9.5625, "learning_rate": 3.460924194618203e-05, "loss": 0.7357964515686035, "mean_token_accuracy": 0.8321579232811928, "num_tokens": 52870064.0, "step": 26770 }, { "entropy": 0.9479546038433909, "epoch": 0.7670824799851051, "grad_norm": 7.40625, "learning_rate": 3.4598705909740516e-05, "loss": 0.9756563186645508, "mean_token_accuracy": 0.777190325781703, "num_tokens": 52890872.0, "step": 26780 }, { "entropy": 0.7963769463822246, "epoch": 0.7673689185511937, "grad_norm": 9.5625, "learning_rate": 3.458816787328698e-05, "loss": 0.84909029006958, "mean_token_accuracy": 0.7991176892071963, "num_tokens": 52909015.0, "step": 26790 }, { "entropy": 0.7373009636998177, "epoch": 0.7676553571172823, "grad_norm": 8.875, "learning_rate": 3.457762783901718e-05, "loss": 0.7288544654846192, "mean_token_accuracy": 0.8258714508265257, "num_tokens": 52927349.0, "step": 26800 }, { "entropy": 0.8150943864136935, "epoch": 0.7679417956833708, "grad_norm": 8.875, "learning_rate": 3.456708580912725e-05, "loss": 0.8595602989196778, "mean_token_accuracy": 0.797896345332265, "num_tokens": 52947370.0, "step": 26810 }, { "entropy": 0.70361780077219, "epoch": 0.7682282342494593, "grad_norm": 5.9375, "learning_rate": 3.455654178581375e-05, "loss": 0.6710364818572998, "mean_token_accuracy": 0.8373038295656443, "num_tokens": 52966777.0, "step": 26820 }, { "entropy": 0.8199217488989234, "epoch": 0.7685146728155479, "grad_norm": 6.40625, "learning_rate": 3.4545995771273674e-05, "loss": 0.83297119140625, "mean_token_accuracy": 0.8009786643087864, "num_tokens": 52985897.0, "step": 26830 }, { "entropy": 0.753619728423655, "epoch": 0.7688011113816364, "grad_norm": 7.75, "learning_rate": 3.453544776770441e-05, "loss": 0.7200868606567383, "mean_token_accuracy": 0.83602180108428, "num_tokens": 53004188.0, "step": 26840 }, { "entropy": 0.933182941749692, "epoch": 0.769087549947725, "grad_norm": 9.4375, "learning_rate": 3.452489777730377e-05, "loss": 0.9220870971679688, "mean_token_accuracy": 0.7968029022216797, "num_tokens": 53023339.0, "step": 26850 }, { "entropy": 0.8836947565898299, "epoch": 0.7693739885138134, "grad_norm": 9.6875, "learning_rate": 3.4514345802269986e-05, "loss": 0.8659859657287597, "mean_token_accuracy": 0.8050314284861088, "num_tokens": 53043522.0, "step": 26860 }, { "entropy": 0.8281948423013091, "epoch": 0.769660427079902, "grad_norm": 11.125, "learning_rate": 3.450379184480168e-05, "loss": 0.842377758026123, "mean_token_accuracy": 0.7976966060698032, "num_tokens": 53063076.0, "step": 26870 }, { "entropy": 0.8752348531968892, "epoch": 0.7699468656459906, "grad_norm": 8.25, "learning_rate": 3.4493235907097916e-05, "loss": 0.914576244354248, "mean_token_accuracy": 0.7861531101167202, "num_tokens": 53083699.0, "step": 26880 }, { "entropy": 0.8393763355910778, "epoch": 0.7702333042120791, "grad_norm": 7.8125, "learning_rate": 3.448267799135815e-05, "loss": 0.842592716217041, "mean_token_accuracy": 0.8053008638322353, "num_tokens": 53103912.0, "step": 26890 }, { "entropy": 0.729134879168123, "epoch": 0.7705197427781677, "grad_norm": 8.0625, "learning_rate": 3.4472118099782264e-05, "loss": 0.6856610298156738, "mean_token_accuracy": 0.835609806701541, "num_tokens": 53122620.0, "step": 26900 }, { "entropy": 0.7276488861069084, "epoch": 0.7708061813442562, "grad_norm": 9.9375, "learning_rate": 3.446155623457054e-05, "loss": 0.7291742324829101, "mean_token_accuracy": 0.8268118564039468, "num_tokens": 53141592.0, "step": 26910 }, { "entropy": 0.8518563400954008, "epoch": 0.7710926199103447, "grad_norm": 9.0, "learning_rate": 3.4450992397923675e-05, "loss": 0.8903237342834472, "mean_token_accuracy": 0.8002647507935763, "num_tokens": 53160523.0, "step": 26920 }, { "entropy": 0.9105667233467102, "epoch": 0.7713790584764333, "grad_norm": 7.34375, "learning_rate": 3.444042659204279e-05, "loss": 0.8919118881225586, "mean_token_accuracy": 0.7916404575109481, "num_tokens": 53181456.0, "step": 26930 }, { "entropy": 0.778540666308254, "epoch": 0.7716654970425219, "grad_norm": 7.46875, "learning_rate": 3.442985881912938e-05, "loss": 0.792505931854248, "mean_token_accuracy": 0.8024680253118277, "num_tokens": 53201986.0, "step": 26940 }, { "entropy": 0.7972658818587661, "epoch": 0.7719519356086103, "grad_norm": 10.875, "learning_rate": 3.44192890813854e-05, "loss": 0.8635075569152832, "mean_token_accuracy": 0.7937218848615885, "num_tokens": 53220745.0, "step": 26950 }, { "entropy": 0.8693443853408098, "epoch": 0.7722383741746989, "grad_norm": 8.5, "learning_rate": 3.4408717381013175e-05, "loss": 0.8732491493225097, "mean_token_accuracy": 0.7991531960666179, "num_tokens": 53241676.0, "step": 26960 }, { "entropy": 0.8666753245517611, "epoch": 0.7725248127407874, "grad_norm": 6.96875, "learning_rate": 3.4398143720215455e-05, "loss": 0.850350284576416, "mean_token_accuracy": 0.8009880725294352, "num_tokens": 53261974.0, "step": 26970 }, { "entropy": 0.806812792737037, "epoch": 0.772811251306876, "grad_norm": 5.0625, "learning_rate": 3.43875681011954e-05, "loss": 0.799549913406372, "mean_token_accuracy": 0.8158707648515702, "num_tokens": 53281481.0, "step": 26980 }, { "entropy": 0.7640191270038486, "epoch": 0.7730976898729645, "grad_norm": 6.125, "learning_rate": 3.437699052615658e-05, "loss": 0.7338577270507812, "mean_token_accuracy": 0.8351240772753954, "num_tokens": 53300775.0, "step": 26990 }, { "entropy": 0.8337939767166972, "epoch": 0.773384128439053, "grad_norm": 9.8125, "learning_rate": 3.436641099730295e-05, "loss": 0.840492057800293, "mean_token_accuracy": 0.8057096224278212, "num_tokens": 53320063.0, "step": 27000 }, { "entropy": 0.8568708445876837, "epoch": 0.7736705670051416, "grad_norm": 7.3125, "learning_rate": 3.43558295168389e-05, "loss": 0.9396190643310547, "mean_token_accuracy": 0.7830590751022101, "num_tokens": 53339413.0, "step": 27010 }, { "entropy": 0.7883619027212262, "epoch": 0.7739570055712301, "grad_norm": 11.75, "learning_rate": 3.434524608696921e-05, "loss": 0.7952919960021972, "mean_token_accuracy": 0.8152478486299515, "num_tokens": 53358055.0, "step": 27020 }, { "entropy": 0.8211036130785943, "epoch": 0.7742434441373186, "grad_norm": 6.375, "learning_rate": 3.433466070989908e-05, "loss": 0.8939673423767089, "mean_token_accuracy": 0.7951222565025091, "num_tokens": 53378796.0, "step": 27030 }, { "entropy": 0.7845817420631647, "epoch": 0.7745298827034072, "grad_norm": 7.34375, "learning_rate": 3.43240733878341e-05, "loss": 0.7997756481170655, "mean_token_accuracy": 0.8088216118514537, "num_tokens": 53399419.0, "step": 27040 }, { "entropy": 0.9287640003487467, "epoch": 0.7748163212694957, "grad_norm": 8.5, "learning_rate": 3.431348412298028e-05, "loss": 0.8988548278808594, "mean_token_accuracy": 0.79531756862998, "num_tokens": 53418434.0, "step": 27050 }, { "entropy": 0.8726784281432629, "epoch": 0.7751027598355843, "grad_norm": 7.25, "learning_rate": 3.430289291754401e-05, "loss": 0.8501397132873535, "mean_token_accuracy": 0.8100136790424586, "num_tokens": 53441720.0, "step": 27060 }, { "entropy": 0.8586845025420189, "epoch": 0.7753891984016728, "grad_norm": 10.0625, "learning_rate": 3.429229977373212e-05, "loss": 0.8545910835266113, "mean_token_accuracy": 0.8084834858775138, "num_tokens": 53462944.0, "step": 27070 }, { "entropy": 0.7835575360804796, "epoch": 0.7756756369677613, "grad_norm": 7.21875, "learning_rate": 3.428170469375183e-05, "loss": 0.7763792514801026, "mean_token_accuracy": 0.8187863413244486, "num_tokens": 53481500.0, "step": 27080 }, { "entropy": 0.862365310639143, "epoch": 0.7759620755338499, "grad_norm": 9.4375, "learning_rate": 3.4271107679810744e-05, "loss": 0.9501632690429688, "mean_token_accuracy": 0.7812996838241816, "num_tokens": 53501424.0, "step": 27090 }, { "entropy": 0.9122387520968914, "epoch": 0.7762485140999384, "grad_norm": 7.25, "learning_rate": 3.4260508734116886e-05, "loss": 0.9594810485839844, "mean_token_accuracy": 0.7871096946299077, "num_tokens": 53521417.0, "step": 27100 }, { "entropy": 0.8092892481014132, "epoch": 0.7765349526660269, "grad_norm": 9.375, "learning_rate": 3.424990785887869e-05, "loss": 0.7497461318969727, "mean_token_accuracy": 0.8203950241208077, "num_tokens": 53540194.0, "step": 27110 }, { "entropy": 0.8705169286578893, "epoch": 0.7768213912321155, "grad_norm": 8.1875, "learning_rate": 3.423930505630497e-05, "loss": 0.8663592338562012, "mean_token_accuracy": 0.7992919992655516, "num_tokens": 53559562.0, "step": 27120 }, { "entropy": 0.8209005341865122, "epoch": 0.777107829798204, "grad_norm": 10.0, "learning_rate": 3.422870032860497e-05, "loss": 0.7983068943023681, "mean_token_accuracy": 0.8199239693582058, "num_tokens": 53580439.0, "step": 27130 }, { "entropy": 0.8295883171260356, "epoch": 0.7773942683642926, "grad_norm": 7.25, "learning_rate": 3.42180936779883e-05, "loss": 0.8422317504882812, "mean_token_accuracy": 0.8057965029031038, "num_tokens": 53598813.0, "step": 27140 }, { "entropy": 0.7256599813699722, "epoch": 0.7776807069303812, "grad_norm": 10.6875, "learning_rate": 3.420748510666501e-05, "loss": 0.7299038887023925, "mean_token_accuracy": 0.8247861757874488, "num_tokens": 53617965.0, "step": 27150 }, { "entropy": 0.8243170566856861, "epoch": 0.7779671454964696, "grad_norm": 6.9375, "learning_rate": 3.4196874616845516e-05, "loss": 0.803136157989502, "mean_token_accuracy": 0.8106223549693823, "num_tokens": 53637152.0, "step": 27160 }, { "entropy": 0.9652814101427794, "epoch": 0.7782535840625582, "grad_norm": 6.25, "learning_rate": 3.418626221074065e-05, "loss": 0.9970827102661133, "mean_token_accuracy": 0.7834303803741932, "num_tokens": 53658367.0, "step": 27170 }, { "entropy": 0.9135570010170341, "epoch": 0.7785400226286467, "grad_norm": 10.625, "learning_rate": 3.417564789056165e-05, "loss": 0.9946195602416992, "mean_token_accuracy": 0.7765499509871006, "num_tokens": 53678214.0, "step": 27180 }, { "entropy": 0.856888217292726, "epoch": 0.7788264611947353, "grad_norm": 7.34375, "learning_rate": 3.4165031658520134e-05, "loss": 0.8718758583068847, "mean_token_accuracy": 0.803025733679533, "num_tokens": 53698503.0, "step": 27190 }, { "entropy": 0.8088695771992207, "epoch": 0.7791128997608238, "grad_norm": 7.6875, "learning_rate": 3.415441351682814e-05, "loss": 0.8087964057922363, "mean_token_accuracy": 0.811004389077425, "num_tokens": 53717688.0, "step": 27200 }, { "entropy": 0.8159357467666268, "epoch": 0.7793993383269123, "grad_norm": 9.0, "learning_rate": 3.414379346769808e-05, "loss": 0.8449319839477539, "mean_token_accuracy": 0.7994780499488116, "num_tokens": 53735991.0, "step": 27210 }, { "entropy": 0.8922705762088299, "epoch": 0.7796857768930009, "grad_norm": 6.40625, "learning_rate": 3.4133171513342774e-05, "loss": 0.9272421836853028, "mean_token_accuracy": 0.7931429699063302, "num_tokens": 53756627.0, "step": 27220 }, { "entropy": 0.7911061668768525, "epoch": 0.7799722154590895, "grad_norm": 9.75, "learning_rate": 3.412254765597547e-05, "loss": 0.7809607505798339, "mean_token_accuracy": 0.8146204989403486, "num_tokens": 53776695.0, "step": 27230 }, { "entropy": 0.9404831908643245, "epoch": 0.7802586540251779, "grad_norm": 8.5625, "learning_rate": 3.411192189780974e-05, "loss": 0.9064420700073242, "mean_token_accuracy": 0.7950816452503204, "num_tokens": 53797100.0, "step": 27240 }, { "entropy": 0.9270672312006354, "epoch": 0.7805450925912665, "grad_norm": 7.09375, "learning_rate": 3.410129424105962e-05, "loss": 0.8955494880676269, "mean_token_accuracy": 0.7878506675362587, "num_tokens": 53818264.0, "step": 27250 }, { "entropy": 0.8404777822084725, "epoch": 0.780831531157355, "grad_norm": 8.5, "learning_rate": 3.409066468793952e-05, "loss": 0.8340245246887207, "mean_token_accuracy": 0.8061087608337403, "num_tokens": 53837796.0, "step": 27260 }, { "entropy": 0.7830475624650717, "epoch": 0.7811179697234436, "grad_norm": 8.125, "learning_rate": 3.408003324066423e-05, "loss": 0.7928773403167725, "mean_token_accuracy": 0.8180467002093792, "num_tokens": 53857690.0, "step": 27270 }, { "entropy": 0.9136176530271769, "epoch": 0.7814044082895321, "grad_norm": 8.8125, "learning_rate": 3.406939990144895e-05, "loss": 0.9114476203918457, "mean_token_accuracy": 0.7952320639044046, "num_tokens": 53878092.0, "step": 27280 }, { "entropy": 0.7446376724168658, "epoch": 0.7816908468556206, "grad_norm": 7.09375, "learning_rate": 3.405876467250928e-05, "loss": 0.712208604812622, "mean_token_accuracy": 0.8371457189321518, "num_tokens": 53897536.0, "step": 27290 }, { "entropy": 0.738610465824604, "epoch": 0.7819772854217092, "grad_norm": 10.125, "learning_rate": 3.4048127556061196e-05, "loss": 0.731499195098877, "mean_token_accuracy": 0.8251092560589314, "num_tokens": 53917562.0, "step": 27300 }, { "entropy": 0.7806694192811847, "epoch": 0.7822637239877978, "grad_norm": 5.625, "learning_rate": 3.4037488554321076e-05, "loss": 0.7975717544555664, "mean_token_accuracy": 0.8179233971983194, "num_tokens": 53937753.0, "step": 27310 }, { "entropy": 0.7662141846492887, "epoch": 0.7825501625538862, "grad_norm": 7.53125, "learning_rate": 3.402684766950569e-05, "loss": 0.797464656829834, "mean_token_accuracy": 0.8247101880609989, "num_tokens": 53957123.0, "step": 27320 }, { "entropy": 0.7789935833774507, "epoch": 0.7828366011199748, "grad_norm": 7.6875, "learning_rate": 3.401620490383222e-05, "loss": 0.780854606628418, "mean_token_accuracy": 0.8135128449648619, "num_tokens": 53976563.0, "step": 27330 }, { "entropy": 0.7429076720029115, "epoch": 0.7831230396860633, "grad_norm": 7.34375, "learning_rate": 3.4005560259518185e-05, "loss": 0.815247917175293, "mean_token_accuracy": 0.82175083309412, "num_tokens": 53995717.0, "step": 27340 }, { "entropy": 0.8562973607331514, "epoch": 0.7834094782521519, "grad_norm": 6.9375, "learning_rate": 3.3994913738781565e-05, "loss": 0.9203106880187988, "mean_token_accuracy": 0.7865301363170147, "num_tokens": 54015424.0, "step": 27350 }, { "entropy": 0.8890067538246512, "epoch": 0.7836959168182404, "grad_norm": 8.6875, "learning_rate": 3.3984265343840675e-05, "loss": 0.9090202331542969, "mean_token_accuracy": 0.7966403916478157, "num_tokens": 54036222.0, "step": 27360 }, { "entropy": 0.8855936180800199, "epoch": 0.7839823553843289, "grad_norm": 8.5625, "learning_rate": 3.3973615076914255e-05, "loss": 0.8600604057312011, "mean_token_accuracy": 0.8035691384226084, "num_tokens": 54055841.0, "step": 27370 }, { "entropy": 0.8426823664456606, "epoch": 0.7842687939504175, "grad_norm": 6.21875, "learning_rate": 3.396296294022142e-05, "loss": 0.8297712326049804, "mean_token_accuracy": 0.811662421002984, "num_tokens": 54073868.0, "step": 27380 }, { "entropy": 0.7921288596466184, "epoch": 0.784555232516506, "grad_norm": 7.46875, "learning_rate": 3.3952308935981685e-05, "loss": 0.7447253227233886, "mean_token_accuracy": 0.8174099512398243, "num_tokens": 54093610.0, "step": 27390 }, { "entropy": 0.7598327457904815, "epoch": 0.7848416710825945, "grad_norm": 6.59375, "learning_rate": 3.394165306641494e-05, "loss": 0.7683858871459961, "mean_token_accuracy": 0.8222594115883112, "num_tokens": 54112996.0, "step": 27400 }, { "entropy": 0.7445010785013437, "epoch": 0.7851281096486831, "grad_norm": 9.25, "learning_rate": 3.3930995333741454e-05, "loss": 0.822658634185791, "mean_token_accuracy": 0.8040300581604243, "num_tokens": 54132530.0, "step": 27410 }, { "entropy": 0.9261618816293776, "epoch": 0.7854145482147716, "grad_norm": 8.0, "learning_rate": 3.392033574018193e-05, "loss": 0.930577278137207, "mean_token_accuracy": 0.7895480517297984, "num_tokens": 54151805.0, "step": 27420 }, { "entropy": 0.7637275498360395, "epoch": 0.7857009867808602, "grad_norm": 10.875, "learning_rate": 3.3909674287957416e-05, "loss": 0.7505126476287842, "mean_token_accuracy": 0.8293727092444897, "num_tokens": 54170983.0, "step": 27430 }, { "entropy": 0.8338512158952653, "epoch": 0.7859874253469488, "grad_norm": 9.0, "learning_rate": 3.389901097928935e-05, "loss": 0.7913447380065918, "mean_token_accuracy": 0.8192352034151554, "num_tokens": 54189833.0, "step": 27440 }, { "entropy": 0.7370092187076807, "epoch": 0.7862738639130372, "grad_norm": 6.15625, "learning_rate": 3.388834581639959e-05, "loss": 0.757990026473999, "mean_token_accuracy": 0.832134285569191, "num_tokens": 54209440.0, "step": 27450 }, { "entropy": 0.8110763914883137, "epoch": 0.7865603024791258, "grad_norm": 9.9375, "learning_rate": 3.387767880151034e-05, "loss": 0.8233203887939453, "mean_token_accuracy": 0.8048214562237263, "num_tokens": 54228539.0, "step": 27460 }, { "entropy": 0.704314601328224, "epoch": 0.7868467410452143, "grad_norm": 8.1875, "learning_rate": 3.386700993684422e-05, "loss": 0.7126755237579345, "mean_token_accuracy": 0.8277702014893293, "num_tokens": 54247802.0, "step": 27470 }, { "entropy": 0.7902232861146331, "epoch": 0.7871331796113029, "grad_norm": 7.9375, "learning_rate": 3.3856339224624216e-05, "loss": 0.7953148365020752, "mean_token_accuracy": 0.8167730834335089, "num_tokens": 54268264.0, "step": 27480 }, { "entropy": 0.8709781529381871, "epoch": 0.7874196181773914, "grad_norm": 10.1875, "learning_rate": 3.3845666667073703e-05, "loss": 0.9177001953125, "mean_token_accuracy": 0.7905503377318382, "num_tokens": 54287998.0, "step": 27490 }, { "entropy": 0.8529580660164356, "epoch": 0.7877060567434799, "grad_norm": 7.625, "learning_rate": 3.3834992266416455e-05, "loss": 0.881006908416748, "mean_token_accuracy": 0.7997597977519035, "num_tokens": 54307952.0, "step": 27500 }, { "entropy": 0.7449952673166991, "epoch": 0.7879924953095685, "grad_norm": 8.5625, "learning_rate": 3.38243160248766e-05, "loss": 0.7763334751129151, "mean_token_accuracy": 0.819374593347311, "num_tokens": 54326697.0, "step": 27510 }, { "entropy": 0.8664587201550603, "epoch": 0.7882789338756571, "grad_norm": 11.0625, "learning_rate": 3.381363794467869e-05, "loss": 0.8257038116455078, "mean_token_accuracy": 0.8158924922347068, "num_tokens": 54346387.0, "step": 27520 }, { "entropy": 0.8010411325842142, "epoch": 0.7885653724417455, "grad_norm": 7.1875, "learning_rate": 3.380295802804762e-05, "loss": 0.7511368274688721, "mean_token_accuracy": 0.8195327013731003, "num_tokens": 54364375.0, "step": 27530 }, { "entropy": 0.7704990653321147, "epoch": 0.7888518110078341, "grad_norm": 10.125, "learning_rate": 3.37922762772087e-05, "loss": 0.7807973384857178, "mean_token_accuracy": 0.8134928107261657, "num_tokens": 54384327.0, "step": 27540 }, { "entropy": 0.7036254572682082, "epoch": 0.7891382495739226, "grad_norm": 10.9375, "learning_rate": 3.3781592694387595e-05, "loss": 0.7475922584533692, "mean_token_accuracy": 0.8302642039954662, "num_tokens": 54402999.0, "step": 27550 }, { "entropy": 0.8672280000522733, "epoch": 0.7894246881400112, "grad_norm": 7.5, "learning_rate": 3.3770907281810374e-05, "loss": 0.8906898498535156, "mean_token_accuracy": 0.7962109569460154, "num_tokens": 54422873.0, "step": 27560 }, { "entropy": 0.886970626655966, "epoch": 0.7897111267060997, "grad_norm": 9.5625, "learning_rate": 3.376022004170348e-05, "loss": 0.8768546104431152, "mean_token_accuracy": 0.7906805079430341, "num_tokens": 54442341.0, "step": 27570 }, { "entropy": 0.7895265596918761, "epoch": 0.7899975652721882, "grad_norm": 9.125, "learning_rate": 3.3749530976293734e-05, "loss": 0.8083590507507324, "mean_token_accuracy": 0.8171726644039154, "num_tokens": 54462517.0, "step": 27580 }, { "entropy": 0.8577082969248295, "epoch": 0.7902840038382768, "grad_norm": 6.40625, "learning_rate": 3.373884008780833e-05, "loss": 0.8830826759338379, "mean_token_accuracy": 0.7991163253784179, "num_tokens": 54482638.0, "step": 27590 }, { "entropy": 0.8720566106960177, "epoch": 0.7905704424043654, "grad_norm": 12.8125, "learning_rate": 3.3728147378474855e-05, "loss": 0.8983368873596191, "mean_token_accuracy": 0.7954681914299726, "num_tokens": 54502593.0, "step": 27600 }, { "entropy": 0.8416969131678342, "epoch": 0.7908568809704538, "grad_norm": 8.3125, "learning_rate": 3.371745285052127e-05, "loss": 0.8389544486999512, "mean_token_accuracy": 0.8033607788383961, "num_tokens": 54521617.0, "step": 27610 }, { "entropy": 0.8012358367443084, "epoch": 0.7911433195365424, "grad_norm": 7.78125, "learning_rate": 3.370675650617592e-05, "loss": 0.8166860580444336, "mean_token_accuracy": 0.8080071896314621, "num_tokens": 54540342.0, "step": 27620 }, { "entropy": 0.8698962925001978, "epoch": 0.7914297581026309, "grad_norm": 5.75, "learning_rate": 3.369605834766752e-05, "loss": 0.8347339630126953, "mean_token_accuracy": 0.8169273231178522, "num_tokens": 54560399.0, "step": 27630 }, { "entropy": 0.7485087238252163, "epoch": 0.7917161966687195, "grad_norm": 8.4375, "learning_rate": 3.368535837722516e-05, "loss": 0.7746393203735351, "mean_token_accuracy": 0.814680828526616, "num_tokens": 54580707.0, "step": 27640 }, { "entropy": 0.8822613493539393, "epoch": 0.792002635234808, "grad_norm": 9.25, "learning_rate": 3.3674656597078326e-05, "loss": 0.8859702110290527, "mean_token_accuracy": 0.7957746129482984, "num_tokens": 54600850.0, "step": 27650 }, { "entropy": 0.8395327577367425, "epoch": 0.7922890738008965, "grad_norm": 10.5, "learning_rate": 3.3663953009456865e-05, "loss": 0.8797383308410645, "mean_token_accuracy": 0.7987513985484839, "num_tokens": 54621396.0, "step": 27660 }, { "entropy": 0.8077081792056561, "epoch": 0.7925755123669851, "grad_norm": 6.15625, "learning_rate": 3.3653247616591014e-05, "loss": 0.8178219795227051, "mean_token_accuracy": 0.8214574571698904, "num_tokens": 54640363.0, "step": 27670 }, { "entropy": 0.6903973253443837, "epoch": 0.7928619509330737, "grad_norm": 9.375, "learning_rate": 3.3642540420711356e-05, "loss": 0.6705481052398682, "mean_token_accuracy": 0.8393583551049233, "num_tokens": 54660367.0, "step": 27680 }, { "entropy": 0.804171965457499, "epoch": 0.7931483894991622, "grad_norm": 9.8125, "learning_rate": 3.363183142404889e-05, "loss": 0.8228458404541016, "mean_token_accuracy": 0.802550283819437, "num_tokens": 54679532.0, "step": 27690 }, { "entropy": 0.8355716333724559, "epoch": 0.7934348280652507, "grad_norm": 8.1875, "learning_rate": 3.362112062883496e-05, "loss": 0.888131046295166, "mean_token_accuracy": 0.8022970698773861, "num_tokens": 54698721.0, "step": 27700 }, { "entropy": 0.7744325898587704, "epoch": 0.7937212666313392, "grad_norm": 10.0625, "learning_rate": 3.36104080373013e-05, "loss": 0.7843059062957763, "mean_token_accuracy": 0.8119222715497016, "num_tokens": 54718188.0, "step": 27710 }, { "entropy": 0.7492793755605817, "epoch": 0.7940077051974278, "grad_norm": 9.375, "learning_rate": 3.3599693651680014e-05, "loss": 0.7239820480346679, "mean_token_accuracy": 0.8196954429149628, "num_tokens": 54736663.0, "step": 27720 }, { "entropy": 0.8001454466953873, "epoch": 0.7942941437635164, "grad_norm": 8.8125, "learning_rate": 3.3588977474203586e-05, "loss": 0.7705713748931885, "mean_token_accuracy": 0.8149224519729614, "num_tokens": 54754746.0, "step": 27730 }, { "entropy": 0.7890005730092525, "epoch": 0.7945805823296048, "grad_norm": 7.15625, "learning_rate": 3.357825950710486e-05, "loss": 0.8422120094299317, "mean_token_accuracy": 0.8063961088657379, "num_tokens": 54774950.0, "step": 27740 }, { "entropy": 0.9306843562051654, "epoch": 0.7948670208956934, "grad_norm": 9.5625, "learning_rate": 3.356753975261706e-05, "loss": 0.9213499069213867, "mean_token_accuracy": 0.7931857898831367, "num_tokens": 54794879.0, "step": 27750 }, { "entropy": 0.8222947584465146, "epoch": 0.795153459461782, "grad_norm": 8.375, "learning_rate": 3.355681821297378e-05, "loss": 0.8459925651550293, "mean_token_accuracy": 0.797735521197319, "num_tokens": 54813878.0, "step": 27760 }, { "entropy": 0.8204174122773111, "epoch": 0.7954398980278705, "grad_norm": 5.40625, "learning_rate": 3.3546094890409e-05, "loss": 0.8607306480407715, "mean_token_accuracy": 0.8043927855789661, "num_tokens": 54832458.0, "step": 27770 }, { "entropy": 0.817804906796664, "epoch": 0.795726336593959, "grad_norm": 9.5, "learning_rate": 3.3535369787157055e-05, "loss": 0.803005599975586, "mean_token_accuracy": 0.8113078087568283, "num_tokens": 54852538.0, "step": 27780 }, { "entropy": 0.8652782214805483, "epoch": 0.7960127751600475, "grad_norm": 10.625, "learning_rate": 3.352464290545265e-05, "loss": 0.8507365226745606, "mean_token_accuracy": 0.7972301304340362, "num_tokens": 54872841.0, "step": 27790 }, { "entropy": 0.916761283390224, "epoch": 0.7962992137261361, "grad_norm": 7.84375, "learning_rate": 3.3513914247530874e-05, "loss": 0.9459691047668457, "mean_token_accuracy": 0.7870757639408111, "num_tokens": 54892453.0, "step": 27800 }, { "entropy": 0.9235548799857497, "epoch": 0.7965856522922247, "grad_norm": 8.3125, "learning_rate": 3.3503183815627176e-05, "loss": 0.9205671310424804, "mean_token_accuracy": 0.7954581264406443, "num_tokens": 54912667.0, "step": 27810 }, { "entropy": 0.8028525048866868, "epoch": 0.7968720908583131, "grad_norm": 10.25, "learning_rate": 3.3492451611977385e-05, "loss": 0.7804036140441895, "mean_token_accuracy": 0.8128953039646148, "num_tokens": 54932708.0, "step": 27820 }, { "entropy": 0.7424164745025337, "epoch": 0.7971585294244017, "grad_norm": 6.84375, "learning_rate": 3.3481717638817675e-05, "loss": 0.6822882652282715, "mean_token_accuracy": 0.8353868663311005, "num_tokens": 54952235.0, "step": 27830 }, { "entropy": 0.7837825223803521, "epoch": 0.7974449679904902, "grad_norm": 6.59375, "learning_rate": 3.347098189838461e-05, "loss": 0.7703558444976807, "mean_token_accuracy": 0.8114307932555676, "num_tokens": 54972200.0, "step": 27840 }, { "entropy": 0.7263157333247363, "epoch": 0.7977314065565788, "grad_norm": 9.125, "learning_rate": 3.3460244392915134e-05, "loss": 0.7378087997436523, "mean_token_accuracy": 0.8233725275844336, "num_tokens": 54993415.0, "step": 27850 }, { "entropy": 0.8423685887828469, "epoch": 0.7980178451226673, "grad_norm": 7.34375, "learning_rate": 3.344950512464653e-05, "loss": 0.8709941864013672, "mean_token_accuracy": 0.7998374745249748, "num_tokens": 55013786.0, "step": 27860 }, { "entropy": 0.7437105781398714, "epoch": 0.7983042836887558, "grad_norm": 7.84375, "learning_rate": 3.343876409581645e-05, "loss": 0.7061602592468261, "mean_token_accuracy": 0.8246432077139616, "num_tokens": 55035007.0, "step": 27870 }, { "entropy": 0.8426749626174569, "epoch": 0.7985907222548444, "grad_norm": 10.75, "learning_rate": 3.342802130866295e-05, "loss": 0.9132275581359863, "mean_token_accuracy": 0.7971338201314211, "num_tokens": 55053796.0, "step": 27880 }, { "entropy": 0.8186741705052555, "epoch": 0.798877160820933, "grad_norm": 8.125, "learning_rate": 3.3417276765424396e-05, "loss": 0.7768548488616943, "mean_token_accuracy": 0.8114475965499878, "num_tokens": 55072392.0, "step": 27890 }, { "entropy": 0.8107778772711753, "epoch": 0.7991635993870214, "grad_norm": 6.40625, "learning_rate": 3.340653046833957e-05, "loss": 0.8070590019226074, "mean_token_accuracy": 0.8183181062340736, "num_tokens": 55091742.0, "step": 27900 }, { "entropy": 0.8377520043402911, "epoch": 0.79945003795311, "grad_norm": 8.0625, "learning_rate": 3.33957824196476e-05, "loss": 0.8700351715087891, "mean_token_accuracy": 0.8086950473487378, "num_tokens": 55111402.0, "step": 27910 }, { "entropy": 0.8931532787159085, "epoch": 0.7997364765191985, "grad_norm": 7.8125, "learning_rate": 3.3385032621587966e-05, "loss": 0.8629809379577636, "mean_token_accuracy": 0.8035509563982487, "num_tokens": 55131816.0, "step": 27920 }, { "entropy": 0.7146860882639885, "epoch": 0.8000229150852871, "grad_norm": 5.875, "learning_rate": 3.3374281076400533e-05, "loss": 0.7089365005493165, "mean_token_accuracy": 0.8271175030618906, "num_tokens": 55151912.0, "step": 27930 }, { "entropy": 0.7818871272727848, "epoch": 0.8003093536513757, "grad_norm": 9.0625, "learning_rate": 3.336352778632551e-05, "loss": 0.7777845859527588, "mean_token_accuracy": 0.819730905070901, "num_tokens": 55172128.0, "step": 27940 }, { "entropy": 0.7809330351650715, "epoch": 0.8005957922174641, "grad_norm": 9.4375, "learning_rate": 3.33527727536035e-05, "loss": 0.801824951171875, "mean_token_accuracy": 0.8095112022012472, "num_tokens": 55193607.0, "step": 27950 }, { "entropy": 0.8180649184621871, "epoch": 0.8008822307835527, "grad_norm": 10.0, "learning_rate": 3.334201598047544e-05, "loss": 0.8939565658569336, "mean_token_accuracy": 0.8010160747915507, "num_tokens": 55213481.0, "step": 27960 }, { "entropy": 0.7968553135171532, "epoch": 0.8011686693496413, "grad_norm": 9.1875, "learning_rate": 3.333125746918263e-05, "loss": 0.806216812133789, "mean_token_accuracy": 0.8172412820160389, "num_tokens": 55234128.0, "step": 27970 }, { "entropy": 0.8370412548072637, "epoch": 0.8014551079157298, "grad_norm": 7.25, "learning_rate": 3.332049722196677e-05, "loss": 0.8066755294799804, "mean_token_accuracy": 0.7961332734674216, "num_tokens": 55253407.0, "step": 27980 }, { "entropy": 0.7825516179203987, "epoch": 0.8017415464818183, "grad_norm": 9.9375, "learning_rate": 3.330973524106986e-05, "loss": 0.8366578102111817, "mean_token_accuracy": 0.8125187080353499, "num_tokens": 55273315.0, "step": 27990 }, { "epoch": 0.8020279850479068, "eval_entropy": 0.8579977637529373, "eval_loss": 0.8514816761016846, "eval_mean_token_accuracy": 0.8004682188034058, "eval_num_tokens": 55292588.0, "eval_runtime": 42.8981, "eval_samples_per_second": 46.622, "eval_steps_per_second": 5.828, "step": 28000 }, { "entropy": 0.7965041088871658, "epoch": 0.8023144236139954, "grad_norm": 5.53125, "learning_rate": 3.32882060872029e-05, "loss": 0.767036771774292, "mean_token_accuracy": 0.8245044101029635, "num_tokens": 55312172.0, "step": 28010 }, { "entropy": 0.8278432270511985, "epoch": 0.802600862180084, "grad_norm": 5.09375, "learning_rate": 3.327743891871871e-05, "loss": 0.8559127807617187, "mean_token_accuracy": 0.798911839723587, "num_tokens": 55331720.0, "step": 28020 }, { "entropy": 0.8071053460240364, "epoch": 0.8028873007461724, "grad_norm": 7.21875, "learning_rate": 3.326667002552523e-05, "loss": 0.8126046180725097, "mean_token_accuracy": 0.8210407923907042, "num_tokens": 55350656.0, "step": 28030 }, { "entropy": 0.777292434964329, "epoch": 0.803173739312261, "grad_norm": 6.78125, "learning_rate": 3.32558994098663e-05, "loss": 0.8126914978027344, "mean_token_accuracy": 0.8060299221426248, "num_tokens": 55370524.0, "step": 28040 }, { "entropy": 0.9075377456843853, "epoch": 0.8034601778783496, "grad_norm": 10.5, "learning_rate": 3.32451270739861e-05, "loss": 0.9714938163757324, "mean_token_accuracy": 0.785105611756444, "num_tokens": 55389716.0, "step": 28050 }, { "entropy": 0.9205982012674212, "epoch": 0.8037466164444381, "grad_norm": 13.1875, "learning_rate": 3.32343530201292e-05, "loss": 0.9746971130371094, "mean_token_accuracy": 0.7889183472841979, "num_tokens": 55409068.0, "step": 28060 }, { "entropy": 0.7408014304935933, "epoch": 0.8040330550105266, "grad_norm": 8.6875, "learning_rate": 3.32235772505405e-05, "loss": 0.6835726737976074, "mean_token_accuracy": 0.8376939497888088, "num_tokens": 55428087.0, "step": 28070 }, { "entropy": 0.9731947622261942, "epoch": 0.8043194935766151, "grad_norm": 7.5, "learning_rate": 3.3212799767465266e-05, "loss": 1.0123875617980957, "mean_token_accuracy": 0.7754117127507925, "num_tokens": 55447840.0, "step": 28080 }, { "entropy": 0.8219267277047038, "epoch": 0.8046059321427037, "grad_norm": 9.5625, "learning_rate": 3.320202057314913e-05, "loss": 0.8382545471191406, "mean_token_accuracy": 0.8078667342662811, "num_tokens": 55466296.0, "step": 28090 }, { "entropy": 0.8654251422733068, "epoch": 0.8048923707087923, "grad_norm": 8.0625, "learning_rate": 3.319123966983808e-05, "loss": 0.8922965049743652, "mean_token_accuracy": 0.7910533580929041, "num_tokens": 55485786.0, "step": 28100 }, { "entropy": 0.8985217202454805, "epoch": 0.8051788092748807, "grad_norm": 6.875, "learning_rate": 3.318045705977844e-05, "loss": 0.8435938835144043, "mean_token_accuracy": 0.8026093490421772, "num_tokens": 55507422.0, "step": 28110 }, { "entropy": 0.7964549114927649, "epoch": 0.8054652478409693, "grad_norm": 10.6875, "learning_rate": 3.316967274521691e-05, "loss": 0.7600378036499024, "mean_token_accuracy": 0.8110054653137923, "num_tokens": 55526464.0, "step": 28120 }, { "entropy": 0.7920875212177634, "epoch": 0.8057516864070579, "grad_norm": 8.75, "learning_rate": 3.3158886728400535e-05, "loss": 0.7771776199340821, "mean_token_accuracy": 0.8169278211891651, "num_tokens": 55545723.0, "step": 28130 }, { "entropy": 0.768783807568252, "epoch": 0.8060381249731464, "grad_norm": 7.1875, "learning_rate": 3.3148099011576724e-05, "loss": 0.7491528987884521, "mean_token_accuracy": 0.8237960509955883, "num_tokens": 55564422.0, "step": 28140 }, { "entropy": 0.8112536994740367, "epoch": 0.8063245635392349, "grad_norm": 7.90625, "learning_rate": 3.313730959699322e-05, "loss": 0.8170635223388671, "mean_token_accuracy": 0.814702083542943, "num_tokens": 55583602.0, "step": 28150 }, { "entropy": 0.8673863649368286, "epoch": 0.8066110021053234, "grad_norm": 6.5625, "learning_rate": 3.3126518486898165e-05, "loss": 0.8710968017578125, "mean_token_accuracy": 0.7991614185273648, "num_tokens": 55604271.0, "step": 28160 }, { "entropy": 0.8141280696727335, "epoch": 0.806897440671412, "grad_norm": 9.125, "learning_rate": 3.311572568353999e-05, "loss": 0.803193473815918, "mean_token_accuracy": 0.8101694494485855, "num_tokens": 55623518.0, "step": 28170 }, { "entropy": 0.7534861601889133, "epoch": 0.8071838792375006, "grad_norm": 8.25, "learning_rate": 3.310493118916753e-05, "loss": 0.7779221057891845, "mean_token_accuracy": 0.8185298666357994, "num_tokens": 55643159.0, "step": 28180 }, { "entropy": 0.8317865122109651, "epoch": 0.807470317803589, "grad_norm": 9.625, "learning_rate": 3.309413500602996e-05, "loss": 0.8105935096740723, "mean_token_accuracy": 0.8151186440140009, "num_tokens": 55663553.0, "step": 28190 }, { "entropy": 0.8132535924669355, "epoch": 0.8077567563696776, "grad_norm": 7.4375, "learning_rate": 3.3083337136376774e-05, "loss": 0.828223991394043, "mean_token_accuracy": 0.8068164076656104, "num_tokens": 55683458.0, "step": 28200 }, { "entropy": 0.8282989108934998, "epoch": 0.8080431949357662, "grad_norm": 17.125, "learning_rate": 3.3072537582457876e-05, "loss": 0.8760874748229981, "mean_token_accuracy": 0.7999740038067102, "num_tokens": 55703474.0, "step": 28210 }, { "entropy": 0.6915542869828641, "epoch": 0.8083296335018547, "grad_norm": 11.8125, "learning_rate": 3.306173634652348e-05, "loss": 0.7259965419769288, "mean_token_accuracy": 0.8261226303875446, "num_tokens": 55723444.0, "step": 28220 }, { "entropy": 0.8110984233208001, "epoch": 0.8086160720679433, "grad_norm": 11.9375, "learning_rate": 3.3050933430824155e-05, "loss": 0.8824068069458008, "mean_token_accuracy": 0.8024394981563091, "num_tokens": 55743775.0, "step": 28230 }, { "entropy": 0.7036050744354725, "epoch": 0.8089025106340317, "grad_norm": 7.0625, "learning_rate": 3.304012883761082e-05, "loss": 0.7061667919158936, "mean_token_accuracy": 0.8298017721623182, "num_tokens": 55762481.0, "step": 28240 }, { "entropy": 0.8209268234670162, "epoch": 0.8091889492001203, "grad_norm": 8.25, "learning_rate": 3.3029322569134765e-05, "loss": 0.8277984619140625, "mean_token_accuracy": 0.8000136941671372, "num_tokens": 55782979.0, "step": 28250 }, { "entropy": 0.7996790800243616, "epoch": 0.8094753877662089, "grad_norm": 7.65625, "learning_rate": 3.301851462764761e-05, "loss": 0.7634175300598145, "mean_token_accuracy": 0.8244042079895735, "num_tokens": 55802711.0, "step": 28260 }, { "entropy": 0.7720209307968616, "epoch": 0.8097618263322974, "grad_norm": 6.625, "learning_rate": 3.3007705015401315e-05, "loss": 0.7042385101318359, "mean_token_accuracy": 0.8331066224724054, "num_tokens": 55822042.0, "step": 28270 }, { "entropy": 0.8143428886309266, "epoch": 0.8100482648983859, "grad_norm": 6.34375, "learning_rate": 3.299689373464821e-05, "loss": 0.7786048412322998, "mean_token_accuracy": 0.8136181354522705, "num_tokens": 55842486.0, "step": 28280 }, { "entropy": 0.6399426753632724, "epoch": 0.8103347034644744, "grad_norm": 9.0625, "learning_rate": 3.298608078764096e-05, "loss": 0.6788989543914795, "mean_token_accuracy": 0.8458281025290489, "num_tokens": 55861622.0, "step": 28290 }, { "entropy": 0.7723801395855844, "epoch": 0.810621142030563, "grad_norm": 7.90625, "learning_rate": 3.297526617663257e-05, "loss": 0.7573992729187011, "mean_token_accuracy": 0.8250520456582308, "num_tokens": 55882058.0, "step": 28300 }, { "entropy": 0.8319909907877445, "epoch": 0.8109075805966516, "grad_norm": 11.1875, "learning_rate": 3.296444990387641e-05, "loss": 0.8488040924072265, "mean_token_accuracy": 0.8045039303600788, "num_tokens": 55900741.0, "step": 28310 }, { "entropy": 0.7003204156644642, "epoch": 0.81119401916274, "grad_norm": 9.875, "learning_rate": 3.2953631971626195e-05, "loss": 0.7582035541534424, "mean_token_accuracy": 0.8310518264770508, "num_tokens": 55920154.0, "step": 28320 }, { "entropy": 0.7558060493320227, "epoch": 0.8114804577288286, "grad_norm": 9.875, "learning_rate": 3.294281238213597e-05, "loss": 0.8771191596984863, "mean_token_accuracy": 0.8069724943488836, "num_tokens": 55938835.0, "step": 28330 }, { "entropy": 0.766294585634023, "epoch": 0.8117668962949172, "grad_norm": 6.59375, "learning_rate": 3.293199113766013e-05, "loss": 0.8008727073669434, "mean_token_accuracy": 0.8161512058228254, "num_tokens": 55958557.0, "step": 28340 }, { "entropy": 0.785760188056156, "epoch": 0.8120533348610057, "grad_norm": 8.5, "learning_rate": 3.292116824045343e-05, "loss": 0.7491011142730712, "mean_token_accuracy": 0.8138927549123764, "num_tokens": 55976957.0, "step": 28350 }, { "entropy": 0.7914698297157884, "epoch": 0.8123397734270942, "grad_norm": 7.03125, "learning_rate": 3.291034369277095e-05, "loss": 0.7969761848449707, "mean_token_accuracy": 0.8066071681678295, "num_tokens": 55996228.0, "step": 28360 }, { "entropy": 0.7710186077281833, "epoch": 0.8126262119931827, "grad_norm": 6.96875, "learning_rate": 3.28995174968681e-05, "loss": 0.7355557441711426, "mean_token_accuracy": 0.8310621995478868, "num_tokens": 56016286.0, "step": 28370 }, { "entropy": 0.7336072530597448, "epoch": 0.8129126505592713, "grad_norm": 6.6875, "learning_rate": 3.2888689655000704e-05, "loss": 0.7370304107666016, "mean_token_accuracy": 0.8258808370679617, "num_tokens": 56036154.0, "step": 28380 }, { "entropy": 0.8553747545927763, "epoch": 0.8131990891253599, "grad_norm": 8.1875, "learning_rate": 3.287786016942485e-05, "loss": 0.8886061668395996, "mean_token_accuracy": 0.7941734835505485, "num_tokens": 56057331.0, "step": 28390 }, { "entropy": 0.697972783073783, "epoch": 0.8134855276914483, "grad_norm": 7.875, "learning_rate": 3.286702904239698e-05, "loss": 0.6739721775054932, "mean_token_accuracy": 0.8350292831659317, "num_tokens": 56078279.0, "step": 28400 }, { "entropy": 0.7766121156979352, "epoch": 0.8137719662575369, "grad_norm": 8.625, "learning_rate": 3.285619627617394e-05, "loss": 0.8122026443481445, "mean_token_accuracy": 0.8055469546467066, "num_tokens": 56097224.0, "step": 28410 }, { "entropy": 0.9134762043133378, "epoch": 0.8140584048236255, "grad_norm": 10.625, "learning_rate": 3.284536187301284e-05, "loss": 0.9300140380859375, "mean_token_accuracy": 0.7876807183027268, "num_tokens": 56117879.0, "step": 28420 }, { "entropy": 0.8468256225809455, "epoch": 0.814344843389714, "grad_norm": 11.4375, "learning_rate": 3.2834525835171186e-05, "loss": 0.8127585411071777, "mean_token_accuracy": 0.8125965811312199, "num_tokens": 56137361.0, "step": 28430 }, { "entropy": 0.6850379346869886, "epoch": 0.8146312819558025, "grad_norm": 9.4375, "learning_rate": 3.2823688164906794e-05, "loss": 0.7070194244384765, "mean_token_accuracy": 0.8307677719742059, "num_tokens": 56156527.0, "step": 28440 }, { "entropy": 0.9230156814679503, "epoch": 0.814917720521891, "grad_norm": 7.5, "learning_rate": 3.2812848864477825e-05, "loss": 0.959440803527832, "mean_token_accuracy": 0.7797123346477747, "num_tokens": 56177564.0, "step": 28450 }, { "entropy": 0.7334650885313749, "epoch": 0.8152041590879796, "grad_norm": 8.75, "learning_rate": 3.280200793614279e-05, "loss": 0.7139073848724365, "mean_token_accuracy": 0.8284463182091713, "num_tokens": 56195973.0, "step": 28460 }, { "entropy": 0.7367174927145242, "epoch": 0.8154905976540682, "grad_norm": 8.5, "learning_rate": 3.279116538216054e-05, "loss": 0.7559236526489258, "mean_token_accuracy": 0.8243048164993525, "num_tokens": 56214941.0, "step": 28470 }, { "entropy": 0.8480804964434355, "epoch": 0.8157770362201567, "grad_norm": 7.0625, "learning_rate": 3.278032120479025e-05, "loss": 0.8648321151733398, "mean_token_accuracy": 0.8149437446147203, "num_tokens": 56236347.0, "step": 28480 }, { "entropy": 0.7884205592796206, "epoch": 0.8160634747862452, "grad_norm": 7.0625, "learning_rate": 3.276947540629145e-05, "loss": 0.7757551193237304, "mean_token_accuracy": 0.8176909003406763, "num_tokens": 56256605.0, "step": 28490 }, { "entropy": 0.8537431471049786, "epoch": 0.8163499133523338, "grad_norm": 8.3125, "learning_rate": 3.275862798892399e-05, "loss": 0.883885669708252, "mean_token_accuracy": 0.7964702393859625, "num_tokens": 56277880.0, "step": 28500 }, { "entropy": 0.8472736172378064, "epoch": 0.8166363519184223, "grad_norm": 6.84375, "learning_rate": 3.274777895494808e-05, "loss": 0.8621554374694824, "mean_token_accuracy": 0.8078082256019116, "num_tokens": 56296402.0, "step": 28510 }, { "entropy": 0.8340712578967213, "epoch": 0.8169227904845109, "grad_norm": 7.28125, "learning_rate": 3.273692830662423e-05, "loss": 0.8262110710144043, "mean_token_accuracy": 0.8100854031741619, "num_tokens": 56315837.0, "step": 28520 }, { "entropy": 0.8134298447519541, "epoch": 0.8172092290505993, "grad_norm": 10.4375, "learning_rate": 3.272607604621334e-05, "loss": 0.7706833839416504, "mean_token_accuracy": 0.82297851331532, "num_tokens": 56336066.0, "step": 28530 }, { "entropy": 0.7645992210134864, "epoch": 0.8174956676166879, "grad_norm": 8.3125, "learning_rate": 3.271522217597659e-05, "loss": 0.7834047317504883, "mean_token_accuracy": 0.8217083159834146, "num_tokens": 56356098.0, "step": 28540 }, { "entropy": 0.7113511046394706, "epoch": 0.8177821061827765, "grad_norm": 9.4375, "learning_rate": 3.270436669817554e-05, "loss": 0.7099591732025147, "mean_token_accuracy": 0.8334423072636128, "num_tokens": 56376660.0, "step": 28550 }, { "entropy": 0.7362639323342591, "epoch": 0.818068544748865, "grad_norm": 9.9375, "learning_rate": 3.2693509615072046e-05, "loss": 0.7709840297698974, "mean_token_accuracy": 0.8163731936365366, "num_tokens": 56395724.0, "step": 28560 }, { "entropy": 0.779928307235241, "epoch": 0.8183549833149535, "grad_norm": 5.0625, "learning_rate": 3.268265092892835e-05, "loss": 0.8373103141784668, "mean_token_accuracy": 0.8215111322700978, "num_tokens": 56415559.0, "step": 28570 }, { "entropy": 0.8506896877661347, "epoch": 0.818641421881042, "grad_norm": 6.1875, "learning_rate": 3.267179064200697e-05, "loss": 0.888783073425293, "mean_token_accuracy": 0.7982708849012852, "num_tokens": 56434445.0, "step": 28580 }, { "entropy": 0.8119755172170698, "epoch": 0.8189278604471306, "grad_norm": 8.1875, "learning_rate": 3.2660928756570785e-05, "loss": 0.7820671081542969, "mean_token_accuracy": 0.8132979936897755, "num_tokens": 56455010.0, "step": 28590 }, { "entropy": 0.8307918988168239, "epoch": 0.8192142990132192, "grad_norm": 7.875, "learning_rate": 3.265006527488303e-05, "loss": 0.8435712814331054, "mean_token_accuracy": 0.810058568790555, "num_tokens": 56474307.0, "step": 28600 }, { "entropy": 0.8997833956032991, "epoch": 0.8195007375793076, "grad_norm": 10.5, "learning_rate": 3.263920019920722e-05, "loss": 0.93572998046875, "mean_token_accuracy": 0.7860208701342344, "num_tokens": 56494552.0, "step": 28610 }, { "entropy": 0.8387562816962599, "epoch": 0.8197871761453962, "grad_norm": 7.25, "learning_rate": 3.262833353180725e-05, "loss": 0.8587051391601562, "mean_token_accuracy": 0.7979085359722375, "num_tokens": 56514769.0, "step": 28620 }, { "entropy": 0.8135805578902364, "epoch": 0.8200736147114848, "grad_norm": 9.0625, "learning_rate": 3.261746527494732e-05, "loss": 0.7536961555480957, "mean_token_accuracy": 0.8163473837077617, "num_tokens": 56534548.0, "step": 28630 }, { "entropy": 0.876524878013879, "epoch": 0.8203600532775733, "grad_norm": 8.875, "learning_rate": 3.2606595430891976e-05, "loss": 0.8418699264526367, "mean_token_accuracy": 0.8009232211858034, "num_tokens": 56554726.0, "step": 28640 }, { "entropy": 0.8523045282810926, "epoch": 0.8206464918436618, "grad_norm": 9.125, "learning_rate": 3.259572400190608e-05, "loss": 0.8775565147399902, "mean_token_accuracy": 0.792010610550642, "num_tokens": 56573853.0, "step": 28650 }, { "entropy": 0.7184994790703059, "epoch": 0.8209329304097503, "grad_norm": 7.46875, "learning_rate": 3.2584850990254845e-05, "loss": 0.7418111801147461, "mean_token_accuracy": 0.8296581000089646, "num_tokens": 56592966.0, "step": 28660 }, { "entropy": 0.7740728376433254, "epoch": 0.8212193689758389, "grad_norm": 8.6875, "learning_rate": 3.257397639820377e-05, "loss": 0.7192776203155518, "mean_token_accuracy": 0.8281273398548364, "num_tokens": 56613029.0, "step": 28670 }, { "entropy": 0.7948544580489397, "epoch": 0.8215058075419275, "grad_norm": 8.8125, "learning_rate": 3.2563100228018755e-05, "loss": 0.7648997783660889, "mean_token_accuracy": 0.8154974408447743, "num_tokens": 56633248.0, "step": 28680 }, { "entropy": 0.6921715181320905, "epoch": 0.8217922461080159, "grad_norm": 5.09375, "learning_rate": 3.2552222481965965e-05, "loss": 0.7475815296173096, "mean_token_accuracy": 0.8150351971387864, "num_tokens": 56652176.0, "step": 28690 }, { "entropy": 0.7420700205489993, "epoch": 0.8220786846741045, "grad_norm": 8.6875, "learning_rate": 3.254134316231191e-05, "loss": 0.7592799663543701, "mean_token_accuracy": 0.8190534114837646, "num_tokens": 56670895.0, "step": 28700 }, { "entropy": 0.8127527175471186, "epoch": 0.8223651232401931, "grad_norm": 9.1875, "learning_rate": 3.253046227132345e-05, "loss": 0.8312885284423828, "mean_token_accuracy": 0.8041517049074173, "num_tokens": 56690314.0, "step": 28710 }, { "entropy": 0.6863895329646766, "epoch": 0.8226515618062816, "grad_norm": 7.78125, "learning_rate": 3.2519579811267756e-05, "loss": 0.6524003982543946, "mean_token_accuracy": 0.8450367726385594, "num_tokens": 56709121.0, "step": 28720 }, { "entropy": 0.7860417971387506, "epoch": 0.8229380003723701, "grad_norm": 9.3125, "learning_rate": 3.2508695784412305e-05, "loss": 0.7660788059234619, "mean_token_accuracy": 0.82461027354002, "num_tokens": 56727750.0, "step": 28730 }, { "entropy": 0.7708477799780666, "epoch": 0.8232244389384586, "grad_norm": 7.96875, "learning_rate": 3.2497810193024944e-05, "loss": 0.8180028915405273, "mean_token_accuracy": 0.8103749591857194, "num_tokens": 56746377.0, "step": 28740 }, { "entropy": 0.8290466409176588, "epoch": 0.8235108775045472, "grad_norm": 9.5625, "learning_rate": 3.248692303937382e-05, "loss": 0.8325183868408204, "mean_token_accuracy": 0.8113024167716503, "num_tokens": 56766457.0, "step": 28750 }, { "entropy": 0.8260959193110466, "epoch": 0.8237973160706358, "grad_norm": 8.125, "learning_rate": 3.2476034325727406e-05, "loss": 0.8485879898071289, "mean_token_accuracy": 0.8011265866458416, "num_tokens": 56787596.0, "step": 28760 }, { "entropy": 0.778990913927555, "epoch": 0.8240837546367243, "grad_norm": 10.125, "learning_rate": 3.24651440543545e-05, "loss": 0.7551025390625, "mean_token_accuracy": 0.8159596487879753, "num_tokens": 56807822.0, "step": 28770 }, { "entropy": 0.8110850658267736, "epoch": 0.8243701932028128, "grad_norm": 11.0, "learning_rate": 3.245425222752423e-05, "loss": 0.8402592658996582, "mean_token_accuracy": 0.8083339963108301, "num_tokens": 56828068.0, "step": 28780 }, { "entropy": 0.8704190145246684, "epoch": 0.8246566317689014, "grad_norm": 10.5625, "learning_rate": 3.244335884750606e-05, "loss": 0.9087417602539063, "mean_token_accuracy": 0.7925322979688645, "num_tokens": 56848827.0, "step": 28790 }, { "entropy": 0.7692789008840919, "epoch": 0.8249430703349899, "grad_norm": 8.3125, "learning_rate": 3.243246391656974e-05, "loss": 0.7886733055114746, "mean_token_accuracy": 0.8189909964799881, "num_tokens": 56867883.0, "step": 28800 }, { "entropy": 0.6994083169847727, "epoch": 0.8252295089010785, "grad_norm": 8.0, "learning_rate": 3.242156743698539e-05, "loss": 0.6890432834625244, "mean_token_accuracy": 0.835236270725727, "num_tokens": 56888214.0, "step": 28810 }, { "entropy": 0.7664016184397042, "epoch": 0.8255159474671669, "grad_norm": 8.625, "learning_rate": 3.2410669411023415e-05, "loss": 0.764271593093872, "mean_token_accuracy": 0.8205571450293064, "num_tokens": 56907604.0, "step": 28820 }, { "entropy": 0.7621973350644111, "epoch": 0.8258023860332555, "grad_norm": 7.5, "learning_rate": 3.2399769840954554e-05, "loss": 0.7871853828430175, "mean_token_accuracy": 0.8190434738993645, "num_tokens": 56926689.0, "step": 28830 }, { "entropy": 0.849034524988383, "epoch": 0.8260888245993441, "grad_norm": 12.1875, "learning_rate": 3.238886872904989e-05, "loss": 0.8808290481567382, "mean_token_accuracy": 0.7923092033714056, "num_tokens": 56946105.0, "step": 28840 }, { "entropy": 0.8557514196261764, "epoch": 0.8263752631654326, "grad_norm": 6.71875, "learning_rate": 3.237796607758078e-05, "loss": 0.8582379341125488, "mean_token_accuracy": 0.7992957204580307, "num_tokens": 56965702.0, "step": 28850 }, { "entropy": 0.7085797235369682, "epoch": 0.8266617017315211, "grad_norm": 5.75, "learning_rate": 3.236706188881895e-05, "loss": 0.706516170501709, "mean_token_accuracy": 0.8275632135570049, "num_tokens": 56985004.0, "step": 28860 }, { "entropy": 0.7767271500080823, "epoch": 0.8269481402976097, "grad_norm": 9.4375, "learning_rate": 3.2356156165036414e-05, "loss": 0.7479190349578857, "mean_token_accuracy": 0.8254701979458332, "num_tokens": 57003359.0, "step": 28870 }, { "entropy": 0.8262583189178259, "epoch": 0.8272345788636982, "grad_norm": 8.25, "learning_rate": 3.234524890850553e-05, "loss": 0.8163822174072266, "mean_token_accuracy": 0.8039794281125069, "num_tokens": 57023186.0, "step": 28880 }, { "entropy": 0.824275058042258, "epoch": 0.8275210174297868, "grad_norm": 9.25, "learning_rate": 3.2334340121498964e-05, "loss": 0.8308199882507324, "mean_token_accuracy": 0.8000341504812241, "num_tokens": 57043357.0, "step": 28890 }, { "entropy": 0.7880806102417409, "epoch": 0.8278074559958752, "grad_norm": 9.5625, "learning_rate": 3.232342980628968e-05, "loss": 0.8126429557800293, "mean_token_accuracy": 0.8105969198048115, "num_tokens": 57062215.0, "step": 28900 }, { "entropy": 0.7171701500192285, "epoch": 0.8280938945619638, "grad_norm": 8.0, "learning_rate": 3.2312517965151007e-05, "loss": 0.7064039230346679, "mean_token_accuracy": 0.8323098070919513, "num_tokens": 57083877.0, "step": 28910 }, { "entropy": 0.7919406086206436, "epoch": 0.8283803331280524, "grad_norm": 7.5625, "learning_rate": 3.2301604600356536e-05, "loss": 0.8065586090087891, "mean_token_accuracy": 0.8159829415380955, "num_tokens": 57103525.0, "step": 28920 }, { "entropy": 0.7674940312281251, "epoch": 0.8286667716941409, "grad_norm": 7.53125, "learning_rate": 3.2290689714180236e-05, "loss": 0.7834873676300049, "mean_token_accuracy": 0.8185291822999716, "num_tokens": 57123195.0, "step": 28930 }, { "entropy": 0.6776399201713502, "epoch": 0.8289532102602294, "grad_norm": 9.375, "learning_rate": 3.2279773308896336e-05, "loss": 0.6901066780090332, "mean_token_accuracy": 0.8391685344278812, "num_tokens": 57142673.0, "step": 28940 }, { "entropy": 0.8446305659599602, "epoch": 0.829239648826318, "grad_norm": 9.5625, "learning_rate": 3.2268855386779424e-05, "loss": 0.8691059112548828, "mean_token_accuracy": 0.804456577450037, "num_tokens": 57162096.0, "step": 28950 }, { "entropy": 0.8454586542211473, "epoch": 0.8295260873924065, "grad_norm": 8.75, "learning_rate": 3.225793595010438e-05, "loss": 0.9151178359985351, "mean_token_accuracy": 0.8009891044348478, "num_tokens": 57181544.0, "step": 28960 }, { "entropy": 0.7958985361270606, "epoch": 0.8298125259584951, "grad_norm": 8.625, "learning_rate": 3.224701500114641e-05, "loss": 0.8257027626037597, "mean_token_accuracy": 0.8114207804203033, "num_tokens": 57201976.0, "step": 28970 }, { "entropy": 0.7508324461057783, "epoch": 0.8300989645245835, "grad_norm": 10.4375, "learning_rate": 3.223609254218102e-05, "loss": 0.7666289806365967, "mean_token_accuracy": 0.8118197880685329, "num_tokens": 57222220.0, "step": 28980 }, { "entropy": 0.8517249467782676, "epoch": 0.8303854030906721, "grad_norm": 5.78125, "learning_rate": 3.222516857548407e-05, "loss": 0.8572571754455567, "mean_token_accuracy": 0.8018763616681099, "num_tokens": 57242467.0, "step": 28990 }, { "entropy": 0.8245821138843894, "epoch": 0.8306718416567607, "grad_norm": 9.0625, "learning_rate": 3.2214243103331675e-05, "loss": 0.7939984798431396, "mean_token_accuracy": 0.818734259530902, "num_tokens": 57262247.0, "step": 29000 }, { "entropy": 0.8628938066773116, "epoch": 0.8309582802228492, "grad_norm": 7.0625, "learning_rate": 3.220331612800032e-05, "loss": 0.8253108024597168, "mean_token_accuracy": 0.8032734628766776, "num_tokens": 57283528.0, "step": 29010 }, { "entropy": 0.8129822970367968, "epoch": 0.8312447187889378, "grad_norm": 7.8125, "learning_rate": 3.2192387651766765e-05, "loss": 0.7605215549468994, "mean_token_accuracy": 0.822435387596488, "num_tokens": 57303955.0, "step": 29020 }, { "entropy": 0.8088655080646276, "epoch": 0.8315311573550263, "grad_norm": 10.4375, "learning_rate": 3.21814576769081e-05, "loss": 0.8265468597412109, "mean_token_accuracy": 0.8128928136080503, "num_tokens": 57326556.0, "step": 29030 }, { "entropy": 0.8507853345945477, "epoch": 0.8318175959211148, "grad_norm": 13.0625, "learning_rate": 3.217052620570173e-05, "loss": 0.828614616394043, "mean_token_accuracy": 0.8098709601908922, "num_tokens": 57346665.0, "step": 29040 }, { "entropy": 0.7253714235499501, "epoch": 0.8321040344872034, "grad_norm": 10.3125, "learning_rate": 3.215959324042535e-05, "loss": 0.6951502799987793, "mean_token_accuracy": 0.828867943584919, "num_tokens": 57366497.0, "step": 29050 }, { "entropy": 0.7835259784013033, "epoch": 0.832390473053292, "grad_norm": 7.5625, "learning_rate": 3.214865878335701e-05, "loss": 0.7736464023590088, "mean_token_accuracy": 0.8104513548314571, "num_tokens": 57387538.0, "step": 29060 }, { "entropy": 0.8261747828684747, "epoch": 0.8326769116193804, "grad_norm": 9.0, "learning_rate": 3.213772283677501e-05, "loss": 0.8669047355651855, "mean_token_accuracy": 0.8016688678413629, "num_tokens": 57407327.0, "step": 29070 }, { "entropy": 0.7915076227858663, "epoch": 0.832963350185469, "grad_norm": 7.625, "learning_rate": 3.2126785402958006e-05, "loss": 0.788362455368042, "mean_token_accuracy": 0.8155329164117575, "num_tokens": 57427115.0, "step": 29080 }, { "entropy": 0.6921886822208763, "epoch": 0.8332497887515575, "grad_norm": 6.71875, "learning_rate": 3.2115846484184965e-05, "loss": 0.7455945014953613, "mean_token_accuracy": 0.8243699949234724, "num_tokens": 57447480.0, "step": 29090 }, { "entropy": 0.7629973012953997, "epoch": 0.8335362273176461, "grad_norm": 9.9375, "learning_rate": 3.210490608273513e-05, "loss": 0.7807924270629882, "mean_token_accuracy": 0.820216416567564, "num_tokens": 57467338.0, "step": 29100 }, { "entropy": 0.8359290927648544, "epoch": 0.8338226658837345, "grad_norm": 9.625, "learning_rate": 3.209396420088808e-05, "loss": 0.8548377990722656, "mean_token_accuracy": 0.8144516542553901, "num_tokens": 57486233.0, "step": 29110 }, { "entropy": 0.678508349135518, "epoch": 0.8341091044498231, "grad_norm": 6.5625, "learning_rate": 3.20830208409237e-05, "loss": 0.6754230499267578, "mean_token_accuracy": 0.84351711794734, "num_tokens": 57505667.0, "step": 29120 }, { "entropy": 0.7941045488230885, "epoch": 0.8343955430159117, "grad_norm": 11.1875, "learning_rate": 3.207207600512216e-05, "loss": 0.7737654685974121, "mean_token_accuracy": 0.8157783303409815, "num_tokens": 57524075.0, "step": 29130 }, { "entropy": 0.7165412522852421, "epoch": 0.8346819815820002, "grad_norm": 8.4375, "learning_rate": 3.206112969576397e-05, "loss": 0.7099976539611816, "mean_token_accuracy": 0.8289723888039588, "num_tokens": 57544530.0, "step": 29140 }, { "entropy": 0.7106779512017966, "epoch": 0.8349684201480887, "grad_norm": 8.4375, "learning_rate": 3.205018191512994e-05, "loss": 0.7253697872161865, "mean_token_accuracy": 0.8257729358971119, "num_tokens": 57566056.0, "step": 29150 }, { "entropy": 0.7406747503206134, "epoch": 0.8352548587141773, "grad_norm": 6.5625, "learning_rate": 3.203923266550116e-05, "loss": 0.7929279327392578, "mean_token_accuracy": 0.8131102744489909, "num_tokens": 57586737.0, "step": 29160 }, { "entropy": 0.7373269101604819, "epoch": 0.8355412972802658, "grad_norm": 8.625, "learning_rate": 3.2028281949159053e-05, "loss": 0.7766078472137451, "mean_token_accuracy": 0.826121573522687, "num_tokens": 57605376.0, "step": 29170 }, { "entropy": 0.8228349772747606, "epoch": 0.8358277358463544, "grad_norm": 8.0625, "learning_rate": 3.201732976838534e-05, "loss": 0.8680471420288086, "mean_token_accuracy": 0.7965134758502245, "num_tokens": 57624081.0, "step": 29180 }, { "entropy": 0.9185493508353829, "epoch": 0.8361141744124428, "grad_norm": 7.3125, "learning_rate": 3.200637612546205e-05, "loss": 0.9282817840576172, "mean_token_accuracy": 0.8032187689095736, "num_tokens": 57644531.0, "step": 29190 }, { "entropy": 0.743029922991991, "epoch": 0.8364006129785314, "grad_norm": 8.375, "learning_rate": 3.19954210226715e-05, "loss": 0.7601142883300781, "mean_token_accuracy": 0.8233107179403305, "num_tokens": 57665144.0, "step": 29200 }, { "entropy": 0.8051600575447082, "epoch": 0.83668705154462, "grad_norm": 9.3125, "learning_rate": 3.1984464462296346e-05, "loss": 0.7823023796081543, "mean_token_accuracy": 0.8154573202133178, "num_tokens": 57685220.0, "step": 29210 }, { "entropy": 0.7031362980604172, "epoch": 0.8369734901107085, "grad_norm": 6.40625, "learning_rate": 3.197350644661951e-05, "loss": 0.6761599063873291, "mean_token_accuracy": 0.8394243247807026, "num_tokens": 57704892.0, "step": 29220 }, { "entropy": 0.7564663738943637, "epoch": 0.837259928676797, "grad_norm": 13.375, "learning_rate": 3.1962546977924234e-05, "loss": 0.7057957172393798, "mean_token_accuracy": 0.8242655277252198, "num_tokens": 57724093.0, "step": 29230 }, { "entropy": 0.7181255374103784, "epoch": 0.8375463672428856, "grad_norm": 6.46875, "learning_rate": 3.195158605849407e-05, "loss": 0.7168997764587403, "mean_token_accuracy": 0.8363456908613444, "num_tokens": 57743800.0, "step": 29240 }, { "entropy": 0.8513247050344944, "epoch": 0.8378328058089741, "grad_norm": 10.375, "learning_rate": 3.194062369061286e-05, "loss": 0.8606356620788574, "mean_token_accuracy": 0.7992973003536463, "num_tokens": 57763566.0, "step": 29250 }, { "entropy": 0.7350227138027549, "epoch": 0.8381192443750627, "grad_norm": 9.0625, "learning_rate": 3.192965987656475e-05, "loss": 0.7816920757293702, "mean_token_accuracy": 0.8240187197923661, "num_tokens": 57783694.0, "step": 29260 }, { "entropy": 0.7392491979524494, "epoch": 0.8384056829411511, "grad_norm": 8.9375, "learning_rate": 3.191869461863419e-05, "loss": 0.7478960990905762, "mean_token_accuracy": 0.826750497892499, "num_tokens": 57802249.0, "step": 29270 }, { "entropy": 0.7357187330722809, "epoch": 0.8386921215072397, "grad_norm": 11.6875, "learning_rate": 3.190772791910594e-05, "loss": 0.7710955142974854, "mean_token_accuracy": 0.8198306538164616, "num_tokens": 57822310.0, "step": 29280 }, { "entropy": 0.7296189492568373, "epoch": 0.8389785600733283, "grad_norm": 7.4375, "learning_rate": 3.189675978026504e-05, "loss": 0.7288360595703125, "mean_token_accuracy": 0.8227283403277397, "num_tokens": 57841794.0, "step": 29290 }, { "entropy": 0.7932238206267357, "epoch": 0.8392649986394168, "grad_norm": 6.9375, "learning_rate": 3.188579020439684e-05, "loss": 0.771299409866333, "mean_token_accuracy": 0.8284369084984065, "num_tokens": 57860143.0, "step": 29300 }, { "entropy": 0.8306482901796699, "epoch": 0.8395514372055054, "grad_norm": 8.3125, "learning_rate": 3.1874819193787004e-05, "loss": 0.8477312088012695, "mean_token_accuracy": 0.8065820928663016, "num_tokens": 57879704.0, "step": 29310 }, { "entropy": 0.7541067880578339, "epoch": 0.8398378757715939, "grad_norm": 6.4375, "learning_rate": 3.186384675072146e-05, "loss": 0.7423059463500976, "mean_token_accuracy": 0.8279709845781327, "num_tokens": 57901445.0, "step": 29320 }, { "entropy": 0.766757283359766, "epoch": 0.8401243143376824, "grad_norm": 8.4375, "learning_rate": 3.185287287748647e-05, "loss": 0.7305764198303223, "mean_token_accuracy": 0.8299424115568399, "num_tokens": 57922188.0, "step": 29330 }, { "entropy": 0.7459492382593453, "epoch": 0.840410752903771, "grad_norm": 5.96875, "learning_rate": 3.184189757636859e-05, "loss": 0.7391788482666015, "mean_token_accuracy": 0.8236037932336331, "num_tokens": 57942454.0, "step": 29340 }, { "entropy": 0.7702073644846678, "epoch": 0.8406971914698596, "grad_norm": 8.9375, "learning_rate": 3.183092084965463e-05, "loss": 0.7896190166473389, "mean_token_accuracy": 0.8088330015540123, "num_tokens": 57965346.0, "step": 29350 }, { "entropy": 0.6787860548589378, "epoch": 0.840983630035948, "grad_norm": 6.71875, "learning_rate": 3.1819942699631764e-05, "loss": 0.7106056690216065, "mean_token_accuracy": 0.8334883838891983, "num_tokens": 57985634.0, "step": 29360 }, { "entropy": 0.848620287515223, "epoch": 0.8412700686020366, "grad_norm": 7.34375, "learning_rate": 3.180896312858741e-05, "loss": 0.8988020896911622, "mean_token_accuracy": 0.8035101570188999, "num_tokens": 58005419.0, "step": 29370 }, { "entropy": 0.6616977493977174, "epoch": 0.8415565071681251, "grad_norm": 7.46875, "learning_rate": 3.17979821388093e-05, "loss": 0.707094955444336, "mean_token_accuracy": 0.8374154612421989, "num_tokens": 58023931.0, "step": 29380 }, { "entropy": 0.7452078210189939, "epoch": 0.8418429457342137, "grad_norm": 8.375, "learning_rate": 3.178699973258548e-05, "loss": 0.8167258262634277, "mean_token_accuracy": 0.8132761023938656, "num_tokens": 58043022.0, "step": 29390 }, { "entropy": 0.6937616747803986, "epoch": 0.8421293843003022, "grad_norm": 9.1875, "learning_rate": 3.177601591220425e-05, "loss": 0.6656507015228271, "mean_token_accuracy": 0.8395255409181118, "num_tokens": 58062548.0, "step": 29400 }, { "entropy": 0.7489753557369113, "epoch": 0.8424158228663907, "grad_norm": 8.8125, "learning_rate": 3.176503067995424e-05, "loss": 0.8207554817199707, "mean_token_accuracy": 0.8116433970630169, "num_tokens": 58082839.0, "step": 29410 }, { "entropy": 0.6508860488422215, "epoch": 0.8427022614324793, "grad_norm": 7.5, "learning_rate": 3.175404403812436e-05, "loss": 0.6639792919158936, "mean_token_accuracy": 0.8384425722062587, "num_tokens": 58101865.0, "step": 29420 }, { "entropy": 0.7035850162617863, "epoch": 0.8429886999985678, "grad_norm": 7.8125, "learning_rate": 3.174305598900382e-05, "loss": 0.7123931884765625, "mean_token_accuracy": 0.8251034196466207, "num_tokens": 58120894.0, "step": 29430 }, { "entropy": 0.8038545677438378, "epoch": 0.8432751385646563, "grad_norm": 7.34375, "learning_rate": 3.1732066534882124e-05, "loss": 0.7898514747619629, "mean_token_accuracy": 0.8154408723115921, "num_tokens": 58141245.0, "step": 29440 }, { "entropy": 0.8122020891867578, "epoch": 0.8435615771307449, "grad_norm": 11.875, "learning_rate": 3.1721075678049036e-05, "loss": 0.8467793464660645, "mean_token_accuracy": 0.8070625845342875, "num_tokens": 58161216.0, "step": 29450 }, { "entropy": 0.8285332832485437, "epoch": 0.8438480156968334, "grad_norm": 10.375, "learning_rate": 3.1710083420794686e-05, "loss": 0.807187843322754, "mean_token_accuracy": 0.8108110353350639, "num_tokens": 58180683.0, "step": 29460 }, { "entropy": 0.7554002204909921, "epoch": 0.844134454262922, "grad_norm": 10.9375, "learning_rate": 3.169908976540941e-05, "loss": 0.7587087631225586, "mean_token_accuracy": 0.8232350915670394, "num_tokens": 58199961.0, "step": 29470 }, { "entropy": 0.7055379319004714, "epoch": 0.8444208928290104, "grad_norm": 9.5, "learning_rate": 3.168809471418389e-05, "loss": 0.7197497844696045, "mean_token_accuracy": 0.8358284704387188, "num_tokens": 58219745.0, "step": 29480 }, { "entropy": 0.7964072683826089, "epoch": 0.844707331395099, "grad_norm": 8.8125, "learning_rate": 3.167709826940909e-05, "loss": 0.7579833507537842, "mean_token_accuracy": 0.8169283546507359, "num_tokens": 58239798.0, "step": 29490 }, { "entropy": 0.706321632862091, "epoch": 0.8449937699611876, "grad_norm": 7.125, "learning_rate": 3.166610043337626e-05, "loss": 0.6792866230010987, "mean_token_accuracy": 0.8281148575246334, "num_tokens": 58258662.0, "step": 29500 }, { "entropy": 0.6932786353863776, "epoch": 0.8452802085272761, "grad_norm": 8.3125, "learning_rate": 3.1655101208376926e-05, "loss": 0.6874987602233886, "mean_token_accuracy": 0.842122595384717, "num_tokens": 58277502.0, "step": 29510 }, { "entropy": 0.7157686484977603, "epoch": 0.8455666470933646, "grad_norm": 7.53125, "learning_rate": 3.164410059670292e-05, "loss": 0.7199172496795654, "mean_token_accuracy": 0.8303503785282373, "num_tokens": 58297502.0, "step": 29520 }, { "entropy": 0.8119903335347771, "epoch": 0.8458530856594532, "grad_norm": 8.0625, "learning_rate": 3.163309860064636e-05, "loss": 0.8692126274108887, "mean_token_accuracy": 0.8046592935919762, "num_tokens": 58316476.0, "step": 29530 }, { "entropy": 0.7364863570779562, "epoch": 0.8461395242255417, "grad_norm": 7.875, "learning_rate": 3.162209522249966e-05, "loss": 0.728443956375122, "mean_token_accuracy": 0.8319874659180642, "num_tokens": 58337216.0, "step": 29540 }, { "entropy": 0.7561438208445906, "epoch": 0.8464259627916303, "grad_norm": 6.125, "learning_rate": 3.161109046455549e-05, "loss": 0.7627835750579834, "mean_token_accuracy": 0.8247303564101458, "num_tokens": 58357554.0, "step": 29550 }, { "entropy": 0.7783890915568918, "epoch": 0.8467124013577189, "grad_norm": 9.625, "learning_rate": 3.160008432910686e-05, "loss": 0.7792095184326172, "mean_token_accuracy": 0.8215398017317057, "num_tokens": 58377494.0, "step": 29560 }, { "entropy": 0.8347054060548544, "epoch": 0.8469988399238073, "grad_norm": 9.4375, "learning_rate": 3.158907681844702e-05, "loss": 0.8622361183166504, "mean_token_accuracy": 0.8008704412728548, "num_tokens": 58398122.0, "step": 29570 }, { "entropy": 0.7898128937929869, "epoch": 0.8472852784898959, "grad_norm": 11.75, "learning_rate": 3.1578067934869523e-05, "loss": 0.790475606918335, "mean_token_accuracy": 0.8117433078587055, "num_tokens": 58417631.0, "step": 29580 }, { "entropy": 0.8714401613920927, "epoch": 0.8475717170559844, "grad_norm": 7.21875, "learning_rate": 3.156705768066823e-05, "loss": 0.8754071235656739, "mean_token_accuracy": 0.7997871626168489, "num_tokens": 58436892.0, "step": 29590 }, { "entropy": 0.8440285982564092, "epoch": 0.847858155622073, "grad_norm": 8.4375, "learning_rate": 3.155604605813723e-05, "loss": 0.8943504333496094, "mean_token_accuracy": 0.8052049677819013, "num_tokens": 58456648.0, "step": 29600 }, { "entropy": 0.7448900604620576, "epoch": 0.8481445941881615, "grad_norm": 7.65625, "learning_rate": 3.154503306957097e-05, "loss": 0.7124160766601563, "mean_token_accuracy": 0.8396284341812134, "num_tokens": 58476357.0, "step": 29610 }, { "entropy": 0.873932268191129, "epoch": 0.84843103275425, "grad_norm": 10.75, "learning_rate": 3.1534018717264135e-05, "loss": 0.9113627433776855, "mean_token_accuracy": 0.7966835845261813, "num_tokens": 58496744.0, "step": 29620 }, { "entropy": 0.8021034531295299, "epoch": 0.8487174713203386, "grad_norm": 6.625, "learning_rate": 3.152300300351169e-05, "loss": 0.8754084587097168, "mean_token_accuracy": 0.8049545519053936, "num_tokens": 58516792.0, "step": 29630 }, { "entropy": 0.7801473496481777, "epoch": 0.8490039098864272, "grad_norm": 8.125, "learning_rate": 3.1511985930608914e-05, "loss": 0.7542544841766358, "mean_token_accuracy": 0.8133180722594261, "num_tokens": 58536193.0, "step": 29640 }, { "entropy": 0.7719281597994267, "epoch": 0.8492903484525156, "grad_norm": 6.6875, "learning_rate": 3.150096750085135e-05, "loss": 0.7703906059265136, "mean_token_accuracy": 0.8207990549504757, "num_tokens": 58554859.0, "step": 29650 }, { "entropy": 0.7150281745940447, "epoch": 0.8495767870186042, "grad_norm": 6.1875, "learning_rate": 3.148994771653482e-05, "loss": 0.6578533172607421, "mean_token_accuracy": 0.8320480920374393, "num_tokens": 58575060.0, "step": 29660 }, { "entropy": 0.7639662696048617, "epoch": 0.8498632255846927, "grad_norm": 9.25, "learning_rate": 3.1478926579955455e-05, "loss": 0.7797040939331055, "mean_token_accuracy": 0.8146282244473696, "num_tokens": 58593576.0, "step": 29670 }, { "entropy": 0.8075905228964985, "epoch": 0.8501496641507813, "grad_norm": 7.875, "learning_rate": 3.1467904093409636e-05, "loss": 0.803914737701416, "mean_token_accuracy": 0.821362116932869, "num_tokens": 58613521.0, "step": 29680 }, { "entropy": 0.8702132214792073, "epoch": 0.8504361027168698, "grad_norm": 7.40625, "learning_rate": 3.145688025919403e-05, "loss": 0.8660801887512207, "mean_token_accuracy": 0.8040414817631245, "num_tokens": 58633521.0, "step": 29690 }, { "entropy": 0.8223677053116262, "epoch": 0.8507225412829583, "grad_norm": 8.5625, "learning_rate": 3.14458550796056e-05, "loss": 0.8386767387390137, "mean_token_accuracy": 0.8053471349179745, "num_tokens": 58653572.0, "step": 29700 }, { "entropy": 0.8052819548174739, "epoch": 0.8510089798490469, "grad_norm": 9.0625, "learning_rate": 3.143482855694159e-05, "loss": 0.7941282272338868, "mean_token_accuracy": 0.817620062455535, "num_tokens": 58672872.0, "step": 29710 }, { "entropy": 0.681879812432453, "epoch": 0.8512954184151355, "grad_norm": 8.125, "learning_rate": 3.14238006934995e-05, "loss": 0.6477042198181152, "mean_token_accuracy": 0.8514641031622887, "num_tokens": 58693722.0, "step": 29720 }, { "entropy": 0.7587384727783502, "epoch": 0.8515818569812239, "grad_norm": 8.125, "learning_rate": 3.1412771491577135e-05, "loss": 0.7373646259307861, "mean_token_accuracy": 0.8188790328800678, "num_tokens": 58713507.0, "step": 29730 }, { "entropy": 0.8914771698415279, "epoch": 0.8518682955473125, "grad_norm": 10.0, "learning_rate": 3.1401740953472575e-05, "loss": 0.9002939224243164, "mean_token_accuracy": 0.8048862464725971, "num_tokens": 58733235.0, "step": 29740 }, { "entropy": 0.6263743080198765, "epoch": 0.852154734113401, "grad_norm": 13.625, "learning_rate": 3.139070908148415e-05, "loss": 0.634743070602417, "mean_token_accuracy": 0.846338263899088, "num_tokens": 58751925.0, "step": 29750 }, { "entropy": 0.7055350361391902, "epoch": 0.8524411726794896, "grad_norm": 4.46875, "learning_rate": 3.137967587791052e-05, "loss": 0.7316250324249267, "mean_token_accuracy": 0.8308370128273964, "num_tokens": 58771499.0, "step": 29760 }, { "entropy": 0.7560039680451155, "epoch": 0.852727611245578, "grad_norm": 8.5625, "learning_rate": 3.1368641345050576e-05, "loss": 0.7966852188110352, "mean_token_accuracy": 0.8252310365438461, "num_tokens": 58790374.0, "step": 29770 }, { "entropy": 0.6503319650888443, "epoch": 0.8530140498116666, "grad_norm": 12.8125, "learning_rate": 3.13576054852035e-05, "loss": 0.6839728355407715, "mean_token_accuracy": 0.8427787020802497, "num_tokens": 58808938.0, "step": 29780 }, { "entropy": 0.7183228876441717, "epoch": 0.8533004883777552, "grad_norm": 8.4375, "learning_rate": 3.134656830066875e-05, "loss": 0.7589735984802246, "mean_token_accuracy": 0.8266226522624492, "num_tokens": 58828314.0, "step": 29790 }, { "entropy": 0.7297594799660146, "epoch": 0.8535869269438437, "grad_norm": 6.6875, "learning_rate": 3.1335529793746075e-05, "loss": 0.7116528511047363, "mean_token_accuracy": 0.8314943522214889, "num_tokens": 58847819.0, "step": 29800 }, { "entropy": 0.7228276317939162, "epoch": 0.8538733655099322, "grad_norm": 7.78125, "learning_rate": 3.132448996673549e-05, "loss": 0.7128180980682373, "mean_token_accuracy": 0.8297586496919394, "num_tokens": 58867258.0, "step": 29810 }, { "entropy": 0.7602316838689148, "epoch": 0.8541598040760208, "grad_norm": 7.96875, "learning_rate": 3.1313448821937274e-05, "loss": 0.7543773651123047, "mean_token_accuracy": 0.820031663402915, "num_tokens": 58887613.0, "step": 29820 }, { "entropy": 0.867661448288709, "epoch": 0.8544462426421093, "grad_norm": 8.25, "learning_rate": 3.130240636165199e-05, "loss": 0.8908706665039062, "mean_token_accuracy": 0.7938743144273758, "num_tokens": 58909524.0, "step": 29830 }, { "entropy": 0.8111098986119032, "epoch": 0.8547326812081979, "grad_norm": 8.625, "learning_rate": 3.1291362588180484e-05, "loss": 0.7645383358001709, "mean_token_accuracy": 0.8261738441884517, "num_tokens": 58929868.0, "step": 29840 }, { "entropy": 0.9123094631824642, "epoch": 0.8550191197742865, "grad_norm": 7.4375, "learning_rate": 3.128031750382385e-05, "loss": 0.9809228897094726, "mean_token_accuracy": 0.7748530812561512, "num_tokens": 58950213.0, "step": 29850 }, { "entropy": 0.7807058731094003, "epoch": 0.8553055583403749, "grad_norm": 7.90625, "learning_rate": 3.126927111088349e-05, "loss": 0.8220767021179199, "mean_token_accuracy": 0.8242660365998745, "num_tokens": 58969458.0, "step": 29860 }, { "entropy": 0.8383877983316779, "epoch": 0.8555919969064635, "grad_norm": 6.53125, "learning_rate": 3.125822341166104e-05, "loss": 0.8202462196350098, "mean_token_accuracy": 0.8145148970186711, "num_tokens": 58989053.0, "step": 29870 }, { "entropy": 0.6999437553808093, "epoch": 0.855878435472552, "grad_norm": 7.53125, "learning_rate": 3.1247174408458434e-05, "loss": 0.6929960727691651, "mean_token_accuracy": 0.8402774814516306, "num_tokens": 59008133.0, "step": 29880 }, { "entropy": 0.8392708515748382, "epoch": 0.8561648740386406, "grad_norm": 9.625, "learning_rate": 3.123612410357789e-05, "loss": 0.8333162307739258, "mean_token_accuracy": 0.8147697720676661, "num_tokens": 59029137.0, "step": 29890 }, { "entropy": 0.7976293741725385, "epoch": 0.8564513126047291, "grad_norm": 10.75, "learning_rate": 3.1225072499321854e-05, "loss": 0.8260221481323242, "mean_token_accuracy": 0.8095488131046296, "num_tokens": 59048534.0, "step": 29900 }, { "entropy": 0.8414044523611665, "epoch": 0.8567377511708176, "grad_norm": 6.65625, "learning_rate": 3.1214019597993085e-05, "loss": 0.8093011856079102, "mean_token_accuracy": 0.8116516247391701, "num_tokens": 59067847.0, "step": 29910 }, { "entropy": 0.7112448582425713, "epoch": 0.8570241897369062, "grad_norm": 10.375, "learning_rate": 3.1202965401894586e-05, "loss": 0.7427616596221924, "mean_token_accuracy": 0.8258505128324032, "num_tokens": 59088715.0, "step": 29920 }, { "entropy": 0.7070449813269079, "epoch": 0.8573106283029948, "grad_norm": 8.5, "learning_rate": 3.119190991332964e-05, "loss": 0.7183035850524903, "mean_token_accuracy": 0.8281891718506813, "num_tokens": 59109122.0, "step": 29930 }, { "entropy": 0.7945078454911709, "epoch": 0.8575970668690832, "grad_norm": 8.75, "learning_rate": 3.1180853134601805e-05, "loss": 0.8091774940490722, "mean_token_accuracy": 0.8144068978726864, "num_tokens": 59128079.0, "step": 29940 }, { "entropy": 0.7561862553935498, "epoch": 0.8578835054351718, "grad_norm": 6.84375, "learning_rate": 3.116979506801489e-05, "loss": 0.7737064361572266, "mean_token_accuracy": 0.8270713735371829, "num_tokens": 59147798.0, "step": 29950 }, { "entropy": 0.6933464638888835, "epoch": 0.8581699440012603, "grad_norm": 9.125, "learning_rate": 3.115873571587299e-05, "loss": 0.6441201210021973, "mean_token_accuracy": 0.8448137640953064, "num_tokens": 59167467.0, "step": 29960 }, { "entropy": 0.6791793362237513, "epoch": 0.8584563825673489, "grad_norm": 9.0, "learning_rate": 3.114767508048047e-05, "loss": 0.6966997623443604, "mean_token_accuracy": 0.8284056231379509, "num_tokens": 59187055.0, "step": 29970 }, { "entropy": 0.7402877224609256, "epoch": 0.8587428211334374, "grad_norm": 9.375, "learning_rate": 3.113661316414193e-05, "loss": 0.7743849754333496, "mean_token_accuracy": 0.8210965856909752, "num_tokens": 59206848.0, "step": 29980 }, { "entropy": 0.7097019250504673, "epoch": 0.8590292596995259, "grad_norm": 7.59375, "learning_rate": 3.112554996916229e-05, "loss": 0.7464244842529297, "mean_token_accuracy": 0.8353237647563219, "num_tokens": 59227428.0, "step": 29990 }, { "entropy": 0.8087463481351733, "epoch": 0.8593156982656145, "grad_norm": 8.4375, "learning_rate": 3.111448549784667e-05, "loss": 0.8480051994323731, "mean_token_accuracy": 0.8011137254536151, "num_tokens": 59247267.0, "step": 30000 }, { "entropy": 0.7890509435907006, "epoch": 0.8596021368317031, "grad_norm": 8.8125, "learning_rate": 3.110341975250053e-05, "loss": 0.7484670162200928, "mean_token_accuracy": 0.8226761814206839, "num_tokens": 59265610.0, "step": 30010 }, { "entropy": 0.8186336108483374, "epoch": 0.8598885753977915, "grad_norm": 7.46875, "learning_rate": 3.109235273542954e-05, "loss": 0.8160028457641602, "mean_token_accuracy": 0.8097330272197724, "num_tokens": 59284473.0, "step": 30020 }, { "entropy": 0.7684104894287884, "epoch": 0.8601750139638801, "grad_norm": 9.5, "learning_rate": 3.108128444893965e-05, "loss": 0.7655003547668457, "mean_token_accuracy": 0.8185867525637149, "num_tokens": 59304070.0, "step": 30030 }, { "entropy": 0.6820543326437474, "epoch": 0.8604614525299686, "grad_norm": 14.0, "learning_rate": 3.1070214895337086e-05, "loss": 0.6808469772338868, "mean_token_accuracy": 0.8350047565996647, "num_tokens": 59323070.0, "step": 30040 }, { "entropy": 0.7389034054242074, "epoch": 0.8607478910960572, "grad_norm": 8.5625, "learning_rate": 3.105914407692833e-05, "loss": 0.7344375133514405, "mean_token_accuracy": 0.8260802514851093, "num_tokens": 59343499.0, "step": 30050 }, { "entropy": 0.8010847726836801, "epoch": 0.8610343296621457, "grad_norm": 11.3125, "learning_rate": 3.104807199602011e-05, "loss": 0.8188401222229004, "mean_token_accuracy": 0.8137032255530358, "num_tokens": 59362512.0, "step": 30060 }, { "entropy": 0.7424802869558335, "epoch": 0.8613207682282342, "grad_norm": 11.1875, "learning_rate": 3.103699865491947e-05, "loss": 0.7395939826965332, "mean_token_accuracy": 0.8249667797237634, "num_tokens": 59382459.0, "step": 30070 }, { "entropy": 0.7593066449277103, "epoch": 0.8616072067943228, "grad_norm": 9.3125, "learning_rate": 3.102592405593365e-05, "loss": 0.7773125648498536, "mean_token_accuracy": 0.8172085732221603, "num_tokens": 59403275.0, "step": 30080 }, { "entropy": 0.7122728399001061, "epoch": 0.8618936453604114, "grad_norm": 7.53125, "learning_rate": 3.101484820137019e-05, "loss": 0.765667724609375, "mean_token_accuracy": 0.8176973961293698, "num_tokens": 59422183.0, "step": 30090 }, { "entropy": 0.7277290469035507, "epoch": 0.8621800839264999, "grad_norm": 8.1875, "learning_rate": 3.100377109353688e-05, "loss": 0.7209650993347168, "mean_token_accuracy": 0.8400656208395958, "num_tokens": 59442017.0, "step": 30100 }, { "entropy": 0.7732758129015564, "epoch": 0.8624665224925884, "grad_norm": 8.625, "learning_rate": 3.099269273474179e-05, "loss": 0.7924113750457764, "mean_token_accuracy": 0.8099720265716315, "num_tokens": 59461709.0, "step": 30110 }, { "entropy": 0.8202110813930631, "epoch": 0.8627529610586769, "grad_norm": 8.5, "learning_rate": 3.098161312729324e-05, "loss": 0.7806685447692872, "mean_token_accuracy": 0.8135755136609077, "num_tokens": 59481720.0, "step": 30120 }, { "entropy": 0.7105918015353382, "epoch": 0.8630393996247655, "grad_norm": 5.84375, "learning_rate": 3.097053227349978e-05, "loss": 0.7195912837982178, "mean_token_accuracy": 0.833269190788269, "num_tokens": 59500307.0, "step": 30130 }, { "entropy": 0.6488443666137755, "epoch": 0.8633258381908541, "grad_norm": 8.375, "learning_rate": 3.095945017567027e-05, "loss": 0.7129469394683838, "mean_token_accuracy": 0.8309390552341938, "num_tokens": 59519855.0, "step": 30140 }, { "entropy": 0.6797159533016384, "epoch": 0.8636122767569425, "grad_norm": 8.25, "learning_rate": 3.09483668361138e-05, "loss": 0.7184768199920655, "mean_token_accuracy": 0.8401269085705281, "num_tokens": 59538781.0, "step": 30150 }, { "entropy": 0.7732895592227578, "epoch": 0.8638987153230311, "grad_norm": 7.71875, "learning_rate": 3.093728225713972e-05, "loss": 0.7819478988647461, "mean_token_accuracy": 0.8132290545850992, "num_tokens": 59558165.0, "step": 30160 }, { "entropy": 0.7054218160919845, "epoch": 0.8641851538891197, "grad_norm": 9.0, "learning_rate": 3.092619644105764e-05, "loss": 0.7119922637939453, "mean_token_accuracy": 0.828713946044445, "num_tokens": 59578775.0, "step": 30170 }, { "entropy": 0.7059946920722723, "epoch": 0.8644715924552082, "grad_norm": 5.90625, "learning_rate": 3.091510939017744e-05, "loss": 0.6921760082244873, "mean_token_accuracy": 0.8393604807555676, "num_tokens": 59598523.0, "step": 30180 }, { "entropy": 0.7441066274419427, "epoch": 0.8647580310212967, "grad_norm": 10.1875, "learning_rate": 3.090402110680925e-05, "loss": 0.7504639625549316, "mean_token_accuracy": 0.8217106312513351, "num_tokens": 59618271.0, "step": 30190 }, { "entropy": 0.8230331391096115, "epoch": 0.8650444695873852, "grad_norm": 7.1875, "learning_rate": 3.089293159326343e-05, "loss": 0.8328859329223632, "mean_token_accuracy": 0.8032637715339661, "num_tokens": 59638899.0, "step": 30200 }, { "entropy": 0.6077782147563994, "epoch": 0.8653309081534738, "grad_norm": 5.5625, "learning_rate": 3.088184085185065e-05, "loss": 0.5731133937835693, "mean_token_accuracy": 0.8662423215806484, "num_tokens": 59656804.0, "step": 30210 }, { "entropy": 0.6921277226880193, "epoch": 0.8656173467195624, "grad_norm": 10.6875, "learning_rate": 3.087074888488179e-05, "loss": 0.6871782302856445, "mean_token_accuracy": 0.830440815538168, "num_tokens": 59676124.0, "step": 30220 }, { "entropy": 0.6663014395162463, "epoch": 0.8659037852856508, "grad_norm": 12.375, "learning_rate": 3.0859655694668e-05, "loss": 0.6427361011505127, "mean_token_accuracy": 0.846822426840663, "num_tokens": 59695351.0, "step": 30230 }, { "entropy": 0.7187425933778286, "epoch": 0.8661902238517394, "grad_norm": 7.5, "learning_rate": 3.0848561283520706e-05, "loss": 0.7347735404968262, "mean_token_accuracy": 0.8389670893549919, "num_tokens": 59715467.0, "step": 30240 }, { "entropy": 0.8130124798044562, "epoch": 0.866476662417828, "grad_norm": 6.3125, "learning_rate": 3.083746565375154e-05, "loss": 0.7934590816497803, "mean_token_accuracy": 0.8166183460503816, "num_tokens": 59735247.0, "step": 30250 }, { "entropy": 0.6907448563724756, "epoch": 0.8667631009839165, "grad_norm": 12.5625, "learning_rate": 3.082636880767244e-05, "loss": 0.6908100605010986, "mean_token_accuracy": 0.8347482241690158, "num_tokens": 59754915.0, "step": 30260 }, { "entropy": 0.7391698568128049, "epoch": 0.867049539550005, "grad_norm": 10.25, "learning_rate": 3.081527074759557e-05, "loss": 0.7797351837158203, "mean_token_accuracy": 0.8219196606427431, "num_tokens": 59774510.0, "step": 30270 }, { "entropy": 0.7512252605520189, "epoch": 0.8673359781160935, "grad_norm": 5.4375, "learning_rate": 3.080417147583334e-05, "loss": 0.7478962421417237, "mean_token_accuracy": 0.830263139307499, "num_tokens": 59793510.0, "step": 30280 }, { "entropy": 0.723433973453939, "epoch": 0.8676224166821821, "grad_norm": 9.875, "learning_rate": 3.0793070994698443e-05, "loss": 0.7361720085144043, "mean_token_accuracy": 0.8414429426193237, "num_tokens": 59812650.0, "step": 30290 }, { "entropy": 0.8634285374544561, "epoch": 0.8679088552482707, "grad_norm": 8.3125, "learning_rate": 3.078196930650379e-05, "loss": 0.8988590240478516, "mean_token_accuracy": 0.7933920502662659, "num_tokens": 59831961.0, "step": 30300 }, { "entropy": 0.7539684932678938, "epoch": 0.8681952938143591, "grad_norm": 9.125, "learning_rate": 3.077086641356256e-05, "loss": 0.7947973728179931, "mean_token_accuracy": 0.8270232316106558, "num_tokens": 59852187.0, "step": 30310 }, { "entropy": 0.7588585375808179, "epoch": 0.8684817323804477, "grad_norm": 7.15625, "learning_rate": 3.075976231818819e-05, "loss": 0.7555005073547363, "mean_token_accuracy": 0.8193250134587288, "num_tokens": 59872096.0, "step": 30320 }, { "entropy": 0.7501446263864636, "epoch": 0.8687681709465362, "grad_norm": 5.71875, "learning_rate": 3.074865702269435e-05, "loss": 0.720142412185669, "mean_token_accuracy": 0.8408188410103321, "num_tokens": 59891995.0, "step": 30330 }, { "entropy": 0.7548750305548311, "epoch": 0.8690546095126248, "grad_norm": 9.125, "learning_rate": 3.0737550529394974e-05, "loss": 0.7815385341644288, "mean_token_accuracy": 0.8103883296251297, "num_tokens": 59912277.0, "step": 30340 }, { "entropy": 0.7323271587491036, "epoch": 0.8693410480787133, "grad_norm": 9.25, "learning_rate": 3.0726442840604244e-05, "loss": 0.739259910583496, "mean_token_accuracy": 0.8307231415063143, "num_tokens": 59930995.0, "step": 30350 }, { "entropy": 0.8113714377395809, "epoch": 0.8696274866448018, "grad_norm": 10.5, "learning_rate": 3.071533395863657e-05, "loss": 0.8654248237609863, "mean_token_accuracy": 0.8046215593814849, "num_tokens": 59951011.0, "step": 30360 }, { "entropy": 0.7803494727239013, "epoch": 0.8699139252108904, "grad_norm": 10.0, "learning_rate": 3.070422388580665e-05, "loss": 0.8025836944580078, "mean_token_accuracy": 0.8116781808435917, "num_tokens": 59970388.0, "step": 30370 }, { "entropy": 0.7634242146275938, "epoch": 0.870200363776979, "grad_norm": 10.5, "learning_rate": 3.06931126244294e-05, "loss": 0.7575103759765625, "mean_token_accuracy": 0.8196574464440346, "num_tokens": 59990676.0, "step": 30380 }, { "entropy": 0.8157408440485596, "epoch": 0.8704868023430675, "grad_norm": 10.875, "learning_rate": 3.068200017681999e-05, "loss": 0.8240473747253418, "mean_token_accuracy": 0.8153008233755827, "num_tokens": 60011412.0, "step": 30390 }, { "entropy": 0.7637706554494799, "epoch": 0.870773240909156, "grad_norm": 6.34375, "learning_rate": 3.0670886545293845e-05, "loss": 0.7706390857696533, "mean_token_accuracy": 0.8275805495679378, "num_tokens": 60031496.0, "step": 30400 }, { "entropy": 0.7497460615821183, "epoch": 0.8710596794752445, "grad_norm": 5.53125, "learning_rate": 3.0659771732166614e-05, "loss": 0.7561752319335937, "mean_token_accuracy": 0.8217258058488369, "num_tokens": 60051293.0, "step": 30410 }, { "entropy": 0.7476054855622352, "epoch": 0.8713461180413331, "grad_norm": 11.125, "learning_rate": 3.064865573975423e-05, "loss": 0.7450579643249512, "mean_token_accuracy": 0.8248162738978863, "num_tokens": 60071024.0, "step": 30420 }, { "entropy": 0.7381102896295488, "epoch": 0.8716325566074217, "grad_norm": 10.875, "learning_rate": 3.063753857037285e-05, "loss": 0.8093603134155274, "mean_token_accuracy": 0.8167049948126077, "num_tokens": 60091100.0, "step": 30430 }, { "entropy": 0.7689142506569624, "epoch": 0.8719189951735101, "grad_norm": 9.375, "learning_rate": 3.062642022633886e-05, "loss": 0.8225009918212891, "mean_token_accuracy": 0.812428206577897, "num_tokens": 60112325.0, "step": 30440 }, { "entropy": 0.7268811858259141, "epoch": 0.8722054337395987, "grad_norm": 9.1875, "learning_rate": 3.0615300709968927e-05, "loss": 0.7163402557373046, "mean_token_accuracy": 0.8231858421117068, "num_tokens": 60130899.0, "step": 30450 }, { "entropy": 0.7447432201355696, "epoch": 0.8724918723056873, "grad_norm": 6.625, "learning_rate": 3.0604180023579926e-05, "loss": 0.6999099731445313, "mean_token_accuracy": 0.8356437928974628, "num_tokens": 60150785.0, "step": 30460 }, { "entropy": 0.8216216952539981, "epoch": 0.8727783108717758, "grad_norm": 11.125, "learning_rate": 3.0593058169489004e-05, "loss": 0.818881893157959, "mean_token_accuracy": 0.8060849711298943, "num_tokens": 60169630.0, "step": 30470 }, { "entropy": 0.6953288790769875, "epoch": 0.8730647494378643, "grad_norm": 8.4375, "learning_rate": 3.0581935150013535e-05, "loss": 0.6562338829040527, "mean_token_accuracy": 0.8441466689109802, "num_tokens": 60188783.0, "step": 30480 }, { "entropy": 0.7925171073526144, "epoch": 0.8733511880039528, "grad_norm": 7.3125, "learning_rate": 3.057081096747115e-05, "loss": 0.7840872287750245, "mean_token_accuracy": 0.8212714832276106, "num_tokens": 60209680.0, "step": 30490 }, { "entropy": 0.7325895581394434, "epoch": 0.8736376265700414, "grad_norm": 9.375, "learning_rate": 3.05596856241797e-05, "loss": 0.7623010635375976, "mean_token_accuracy": 0.8194494169205427, "num_tokens": 60228758.0, "step": 30500 }, { "entropy": 0.6919432799564674, "epoch": 0.87392406513613, "grad_norm": 6.25, "learning_rate": 3.05485591224573e-05, "loss": 0.6616633892059326, "mean_token_accuracy": 0.8463066637516021, "num_tokens": 60248417.0, "step": 30510 }, { "entropy": 0.7577609959058463, "epoch": 0.8742105037022184, "grad_norm": 9.9375, "learning_rate": 3.05374314646223e-05, "loss": 0.8477311134338379, "mean_token_accuracy": 0.8038159959018231, "num_tokens": 60266774.0, "step": 30520 }, { "entropy": 0.724104695674032, "epoch": 0.874496942268307, "grad_norm": 10.6875, "learning_rate": 3.0526302652993276e-05, "loss": 0.738587474822998, "mean_token_accuracy": 0.8188330203294754, "num_tokens": 60286500.0, "step": 30530 }, { "entropy": 0.7668314936105162, "epoch": 0.8747833808343956, "grad_norm": 13.5, "learning_rate": 3.051517268988907e-05, "loss": 0.8029433250427246, "mean_token_accuracy": 0.8261900506913662, "num_tokens": 60307656.0, "step": 30540 }, { "entropy": 0.6802383087575435, "epoch": 0.8750698194004841, "grad_norm": 9.75, "learning_rate": 3.0504041577628745e-05, "loss": 0.6897707939147949, "mean_token_accuracy": 0.8369365632534027, "num_tokens": 60326173.0, "step": 30550 }, { "entropy": 0.7740585630759597, "epoch": 0.8753562579665726, "grad_norm": 6.625, "learning_rate": 3.0492909318531604e-05, "loss": 0.7605361938476562, "mean_token_accuracy": 0.8229627441614866, "num_tokens": 60346096.0, "step": 30560 }, { "entropy": 0.7840164438821375, "epoch": 0.8756426965326611, "grad_norm": 6.96875, "learning_rate": 3.048177591491721e-05, "loss": 0.784083366394043, "mean_token_accuracy": 0.8242418687790632, "num_tokens": 60365249.0, "step": 30570 }, { "entropy": 0.8256821922957898, "epoch": 0.8759291350987497, "grad_norm": 6.78125, "learning_rate": 3.0470641369105335e-05, "loss": 0.833033275604248, "mean_token_accuracy": 0.8103102602064609, "num_tokens": 60384833.0, "step": 30580 }, { "entropy": 0.7147727408446372, "epoch": 0.8762155736648383, "grad_norm": 12.375, "learning_rate": 3.0459505683416013e-05, "loss": 0.7261588096618652, "mean_token_accuracy": 0.8306484211236238, "num_tokens": 60404806.0, "step": 30590 }, { "entropy": 0.8441930187866091, "epoch": 0.8765020122309267, "grad_norm": 7.65625, "learning_rate": 3.0448368860169484e-05, "loss": 0.9191892623901368, "mean_token_accuracy": 0.7935157366096973, "num_tokens": 60426421.0, "step": 30600 }, { "entropy": 0.7927142448723317, "epoch": 0.8767884507970153, "grad_norm": 7.375, "learning_rate": 3.0437230901686277e-05, "loss": 0.8189248085021973, "mean_token_accuracy": 0.8152483072131872, "num_tokens": 60446908.0, "step": 30610 }, { "entropy": 0.7185558651573956, "epoch": 0.8770748893631038, "grad_norm": 15.6875, "learning_rate": 3.0426091810287105e-05, "loss": 0.7604306221008301, "mean_token_accuracy": 0.8188759844750166, "num_tokens": 60465624.0, "step": 30620 }, { "entropy": 0.7620188863016665, "epoch": 0.8773613279291924, "grad_norm": 10.5, "learning_rate": 3.041495158829294e-05, "loss": 0.7399320602416992, "mean_token_accuracy": 0.8275215137749911, "num_tokens": 60484169.0, "step": 30630 }, { "entropy": 0.7971155850216747, "epoch": 0.877647766495281, "grad_norm": 10.8125, "learning_rate": 3.0403810238025e-05, "loss": 0.7680153846740723, "mean_token_accuracy": 0.8237178038805724, "num_tokens": 60502227.0, "step": 30640 }, { "entropy": 0.68349031470716, "epoch": 0.8779342050613694, "grad_norm": 8.6875, "learning_rate": 3.039266776180472e-05, "loss": 0.6794829368591309, "mean_token_accuracy": 0.8362726598978043, "num_tokens": 60522403.0, "step": 30650 }, { "entropy": 0.8197264751419425, "epoch": 0.878220643627458, "grad_norm": 9.1875, "learning_rate": 3.0381524161953773e-05, "loss": 0.8297025680541992, "mean_token_accuracy": 0.8081941585987806, "num_tokens": 60541387.0, "step": 30660 }, { "entropy": 0.7062901511788369, "epoch": 0.8785070821935466, "grad_norm": 8.3125, "learning_rate": 3.0370379440794078e-05, "loss": 0.6845837116241456, "mean_token_accuracy": 0.8361088272184134, "num_tokens": 60560624.0, "step": 30670 }, { "entropy": 0.7271107519976795, "epoch": 0.8787935207596351, "grad_norm": 6.0625, "learning_rate": 3.0359233600647762e-05, "loss": 0.6891570568084717, "mean_token_accuracy": 0.8380659099668264, "num_tokens": 60580010.0, "step": 30680 }, { "entropy": 0.8001046588644385, "epoch": 0.8790799593257236, "grad_norm": 9.25, "learning_rate": 3.0348086643837224e-05, "loss": 0.7931215286254882, "mean_token_accuracy": 0.8099168732762336, "num_tokens": 60600544.0, "step": 30690 }, { "entropy": 0.7773623916320502, "epoch": 0.8793663978918121, "grad_norm": 10.8125, "learning_rate": 3.033693857268506e-05, "loss": 0.8181222915649414, "mean_token_accuracy": 0.8166461087763309, "num_tokens": 60620623.0, "step": 30700 }, { "entropy": 0.7564819736406208, "epoch": 0.8796528364579007, "grad_norm": 8.4375, "learning_rate": 3.0325789389514115e-05, "loss": 0.7967268943786621, "mean_token_accuracy": 0.8130446758121253, "num_tokens": 60639611.0, "step": 30710 }, { "entropy": 0.7058803061023354, "epoch": 0.8799392750239893, "grad_norm": 8.1875, "learning_rate": 3.0314639096647458e-05, "loss": 0.7387288093566895, "mean_token_accuracy": 0.8288683012127877, "num_tokens": 60659047.0, "step": 30720 }, { "entropy": 0.6799276730045676, "epoch": 0.8802257135900777, "grad_norm": 5.4375, "learning_rate": 3.0303487696408402e-05, "loss": 0.6555741786956787, "mean_token_accuracy": 0.8393810819834471, "num_tokens": 60677200.0, "step": 30730 }, { "entropy": 0.7212142433971167, "epoch": 0.8805121521561663, "grad_norm": 5.46875, "learning_rate": 3.0292335191120476e-05, "loss": 0.7322101593017578, "mean_token_accuracy": 0.8280284982174635, "num_tokens": 60697507.0, "step": 30740 }, { "entropy": 0.6601237121969461, "epoch": 0.8807985907222549, "grad_norm": 7.5625, "learning_rate": 3.0281181583107454e-05, "loss": 0.7039535999298095, "mean_token_accuracy": 0.8313065115362406, "num_tokens": 60716982.0, "step": 30750 }, { "entropy": 0.6821398260071874, "epoch": 0.8810850292883434, "grad_norm": 7.03125, "learning_rate": 3.0270026874693314e-05, "loss": 0.6786174297332763, "mean_token_accuracy": 0.8420228850096464, "num_tokens": 60736675.0, "step": 30760 }, { "entropy": 0.6836420711129904, "epoch": 0.8813714678544319, "grad_norm": 6.90625, "learning_rate": 3.025887106820231e-05, "loss": 0.6533515453338623, "mean_token_accuracy": 0.8497208420187234, "num_tokens": 60756061.0, "step": 30770 }, { "entropy": 0.764008273743093, "epoch": 0.8816579064205204, "grad_norm": 7.125, "learning_rate": 3.0247714165958867e-05, "loss": 0.7639576911926269, "mean_token_accuracy": 0.8147179692983627, "num_tokens": 60774781.0, "step": 30780 }, { "entropy": 0.7028985355049372, "epoch": 0.881944344986609, "grad_norm": 6.5, "learning_rate": 3.0236556170287684e-05, "loss": 0.6570648670196533, "mean_token_accuracy": 0.8449258655309677, "num_tokens": 60795376.0, "step": 30790 }, { "entropy": 0.7239825608208775, "epoch": 0.8822307835526976, "grad_norm": 7.5, "learning_rate": 3.0225397083513663e-05, "loss": 0.7176084518432617, "mean_token_accuracy": 0.8264756493270398, "num_tokens": 60815773.0, "step": 30800 }, { "entropy": 0.7251630943268538, "epoch": 0.882517222118786, "grad_norm": 10.25, "learning_rate": 3.021423690796194e-05, "loss": 0.7179080963134765, "mean_token_accuracy": 0.8368282493203878, "num_tokens": 60836433.0, "step": 30810 }, { "entropy": 0.7919731775298715, "epoch": 0.8828036606848746, "grad_norm": 10.6875, "learning_rate": 3.020307564595789e-05, "loss": 0.8655158042907715, "mean_token_accuracy": 0.7968268454074859, "num_tokens": 60855765.0, "step": 30820 }, { "entropy": 0.7411508040502668, "epoch": 0.8830900992509632, "grad_norm": 11.0625, "learning_rate": 3.0191913299827092e-05, "loss": 0.7353606700897217, "mean_token_accuracy": 0.8321244582533837, "num_tokens": 60875545.0, "step": 30830 }, { "entropy": 0.6617496353108436, "epoch": 0.8833765378170517, "grad_norm": 8.25, "learning_rate": 3.0180749871895365e-05, "loss": 0.6615064144134521, "mean_token_accuracy": 0.8370318964123726, "num_tokens": 60895462.0, "step": 30840 }, { "entropy": 0.7592549323104322, "epoch": 0.8836629763831402, "grad_norm": 7.3125, "learning_rate": 3.016958536448875e-05, "loss": 0.8096492767333985, "mean_token_accuracy": 0.8189971137791872, "num_tokens": 60915042.0, "step": 30850 }, { "entropy": 0.6978416374884546, "epoch": 0.8839494149492287, "grad_norm": 8.1875, "learning_rate": 3.0158419779933522e-05, "loss": 0.7231961250305176, "mean_token_accuracy": 0.8337355773895979, "num_tokens": 60935163.0, "step": 30860 }, { "entropy": 0.9080134457908571, "epoch": 0.8842358535153173, "grad_norm": 9.5, "learning_rate": 3.0147253120556163e-05, "loss": 0.9699234008789063, "mean_token_accuracy": 0.7830836530774832, "num_tokens": 60954628.0, "step": 30870 }, { "entropy": 0.7694738387130201, "epoch": 0.8845222920814059, "grad_norm": 9.0, "learning_rate": 3.013608538868339e-05, "loss": 0.7606583595275879, "mean_token_accuracy": 0.8223088577389717, "num_tokens": 60975567.0, "step": 30880 }, { "entropy": 0.8216118371114135, "epoch": 0.8848087306474943, "grad_norm": 8.125, "learning_rate": 3.0124916586642138e-05, "loss": 0.7614274024963379, "mean_token_accuracy": 0.8249473243951797, "num_tokens": 60995219.0, "step": 30890 }, { "entropy": 0.7571396732702851, "epoch": 0.8850951692135829, "grad_norm": 7.5, "learning_rate": 3.0113746716759577e-05, "loss": 0.7938486576080322, "mean_token_accuracy": 0.8243913173675537, "num_tokens": 61012933.0, "step": 30900 }, { "entropy": 0.7443052959628403, "epoch": 0.8853816077796715, "grad_norm": 5.78125, "learning_rate": 3.0102575781363086e-05, "loss": 0.7210092067718505, "mean_token_accuracy": 0.8359295934438705, "num_tokens": 61031706.0, "step": 30910 }, { "entropy": 0.7093844223767519, "epoch": 0.88566804634576, "grad_norm": 9.4375, "learning_rate": 3.0091403782780277e-05, "loss": 0.7536305904388427, "mean_token_accuracy": 0.8251762878149748, "num_tokens": 61053386.0, "step": 30920 }, { "entropy": 0.689289870718494, "epoch": 0.8859544849118486, "grad_norm": 8.8125, "learning_rate": 3.008023072333896e-05, "loss": 0.6628387928009033, "mean_token_accuracy": 0.8332017607986927, "num_tokens": 61073416.0, "step": 30930 }, { "entropy": 0.7848109440878034, "epoch": 0.886240923477937, "grad_norm": 9.5, "learning_rate": 3.0069056605367196e-05, "loss": 0.7856605052947998, "mean_token_accuracy": 0.808146058768034, "num_tokens": 61092806.0, "step": 30940 }, { "entropy": 0.7681239143013954, "epoch": 0.8865273620440256, "grad_norm": 14.125, "learning_rate": 3.0057881431193262e-05, "loss": 0.7663568019866943, "mean_token_accuracy": 0.8171605970710516, "num_tokens": 61111766.0, "step": 30950 }, { "entropy": 0.7106232667341829, "epoch": 0.8868138006101142, "grad_norm": 8.1875, "learning_rate": 3.004670520314563e-05, "loss": 0.7089918613433838, "mean_token_accuracy": 0.827999022975564, "num_tokens": 61130136.0, "step": 30960 }, { "entropy": 0.7730832124128938, "epoch": 0.8871002391762027, "grad_norm": 8.25, "learning_rate": 3.003552792355302e-05, "loss": 0.7596082210540771, "mean_token_accuracy": 0.8352843791246414, "num_tokens": 61151084.0, "step": 30970 }, { "entropy": 0.8277015628293156, "epoch": 0.8873866777422912, "grad_norm": 9.4375, "learning_rate": 3.002434959474436e-05, "loss": 0.8891929626464844, "mean_token_accuracy": 0.7981308862566948, "num_tokens": 61171236.0, "step": 30980 }, { "entropy": 0.7458932900801301, "epoch": 0.8876731163083798, "grad_norm": 13.5, "learning_rate": 3.0013170219048785e-05, "loss": 0.7512352943420411, "mean_token_accuracy": 0.8195790208876133, "num_tokens": 61189893.0, "step": 30990 }, { "entropy": 0.6911372106522322, "epoch": 0.8879595548744683, "grad_norm": 13.8125, "learning_rate": 3.0001989798795676e-05, "loss": 0.67549147605896, "mean_token_accuracy": 0.8400860242545605, "num_tokens": 61208585.0, "step": 31000 }, { "entropy": 0.729536060243845, "epoch": 0.8882459934405569, "grad_norm": 10.75, "learning_rate": 2.9990808336314607e-05, "loss": 0.7327952861785889, "mean_token_accuracy": 0.825945646315813, "num_tokens": 61226191.0, "step": 31010 }, { "entropy": 0.7175138656049966, "epoch": 0.8885324320066453, "grad_norm": 10.6875, "learning_rate": 2.997962583393538e-05, "loss": 0.7524642944335938, "mean_token_accuracy": 0.8236678455024957, "num_tokens": 61244689.0, "step": 31020 }, { "entropy": 0.6970237294211984, "epoch": 0.8888188705727339, "grad_norm": 7.46875, "learning_rate": 2.9968442293988003e-05, "loss": 0.7233943462371826, "mean_token_accuracy": 0.8313529267907143, "num_tokens": 61264197.0, "step": 31030 }, { "entropy": 0.7873996950685977, "epoch": 0.8891053091388225, "grad_norm": 9.9375, "learning_rate": 2.9957257718802717e-05, "loss": 0.8161042213439942, "mean_token_accuracy": 0.8175555322319269, "num_tokens": 61283569.0, "step": 31040 }, { "entropy": 0.7179760131984949, "epoch": 0.889391747704911, "grad_norm": 9.8125, "learning_rate": 2.9946072110709965e-05, "loss": 0.7448568344116211, "mean_token_accuracy": 0.8231851443648338, "num_tokens": 61302190.0, "step": 31050 }, { "entropy": 0.7373472161591053, "epoch": 0.8896781862709995, "grad_norm": 10.0625, "learning_rate": 2.9934885472040412e-05, "loss": 0.697323226928711, "mean_token_accuracy": 0.8315782330930233, "num_tokens": 61322250.0, "step": 31060 }, { "entropy": 0.7402709219604731, "epoch": 0.889964624837088, "grad_norm": 10.125, "learning_rate": 2.992369780512494e-05, "loss": 0.7481690883636475, "mean_token_accuracy": 0.8352062918245793, "num_tokens": 61342434.0, "step": 31070 }, { "entropy": 0.6676525418646634, "epoch": 0.8902510634031766, "grad_norm": 7.09375, "learning_rate": 2.9912509112294634e-05, "loss": 0.7065566539764404, "mean_token_accuracy": 0.8333274267613888, "num_tokens": 61362507.0, "step": 31080 }, { "entropy": 0.9020956603810191, "epoch": 0.8905375019692652, "grad_norm": 11.375, "learning_rate": 2.99013193958808e-05, "loss": 0.9186498641967773, "mean_token_accuracy": 0.7928092129528522, "num_tokens": 61381121.0, "step": 31090 }, { "entropy": 0.7983300136402249, "epoch": 0.8908239405353536, "grad_norm": 9.5, "learning_rate": 2.9890128658214965e-05, "loss": 0.7900227546691895, "mean_token_accuracy": 0.8162098735570907, "num_tokens": 61401543.0, "step": 31100 }, { "entropy": 0.8040341572836042, "epoch": 0.8911103791014422, "grad_norm": 9.5625, "learning_rate": 2.9878936901628857e-05, "loss": 0.7442851066589355, "mean_token_accuracy": 0.8413120318204165, "num_tokens": 61420924.0, "step": 31110 }, { "entropy": 0.6577093188650907, "epoch": 0.8913968176675308, "grad_norm": 10.875, "learning_rate": 2.9867744128454422e-05, "loss": 0.681004524230957, "mean_token_accuracy": 0.8353380359709263, "num_tokens": 61442004.0, "step": 31120 }, { "entropy": 0.6750234639272094, "epoch": 0.8916832562336193, "grad_norm": 11.5, "learning_rate": 2.9856550341023804e-05, "loss": 0.725086784362793, "mean_token_accuracy": 0.8326871432363987, "num_tokens": 61462551.0, "step": 31130 }, { "entropy": 0.7027946091257036, "epoch": 0.8919696947997078, "grad_norm": 8.375, "learning_rate": 2.9845355541669388e-05, "loss": 0.7278618335723877, "mean_token_accuracy": 0.8312160987406969, "num_tokens": 61483342.0, "step": 31140 }, { "entropy": 0.7856769408099353, "epoch": 0.8922561333657963, "grad_norm": 7.625, "learning_rate": 2.9834159732723748e-05, "loss": 0.7381580352783204, "mean_token_accuracy": 0.8243792865425348, "num_tokens": 61502653.0, "step": 31150 }, { "entropy": 0.7422053655609488, "epoch": 0.8925425719318849, "grad_norm": 7.96875, "learning_rate": 2.982296291651966e-05, "loss": 0.686269474029541, "mean_token_accuracy": 0.84371406622231, "num_tokens": 61522767.0, "step": 31160 }, { "entropy": 0.6906449371948838, "epoch": 0.8928290104979735, "grad_norm": 9.625, "learning_rate": 2.9811765095390142e-05, "loss": 0.7338810443878174, "mean_token_accuracy": 0.8254051491618156, "num_tokens": 61544979.0, "step": 31170 }, { "entropy": 0.6567263992503285, "epoch": 0.893115449064062, "grad_norm": 8.0625, "learning_rate": 2.9800566271668383e-05, "loss": 0.6736366748809814, "mean_token_accuracy": 0.8441880621016026, "num_tokens": 61564492.0, "step": 31180 }, { "entropy": 0.7523484025150537, "epoch": 0.8934018876301505, "grad_norm": 7.6875, "learning_rate": 2.9789366447687812e-05, "loss": 0.7650484085083008, "mean_token_accuracy": 0.8245291475206613, "num_tokens": 61584968.0, "step": 31190 }, { "entropy": 0.7069922818802297, "epoch": 0.8936883261962391, "grad_norm": 10.125, "learning_rate": 2.9778165625782056e-05, "loss": 0.6990158557891846, "mean_token_accuracy": 0.838983615860343, "num_tokens": 61604066.0, "step": 31200 }, { "entropy": 0.7056529687717557, "epoch": 0.8939747647623276, "grad_norm": 9.5625, "learning_rate": 2.976696380828493e-05, "loss": 0.7294295787811279, "mean_token_accuracy": 0.8325434073805809, "num_tokens": 61622559.0, "step": 31210 }, { "entropy": 0.8315901113674045, "epoch": 0.8942612033284162, "grad_norm": 8.5, "learning_rate": 2.9755760997530503e-05, "loss": 0.8582427024841308, "mean_token_accuracy": 0.8072742480784655, "num_tokens": 61642900.0, "step": 31220 }, { "entropy": 0.8346749696880579, "epoch": 0.8945476418945046, "grad_norm": 7.5625, "learning_rate": 2.9744557195852997e-05, "loss": 0.8532216072082519, "mean_token_accuracy": 0.808398736268282, "num_tokens": 61662931.0, "step": 31230 }, { "entropy": 0.757306386064738, "epoch": 0.8948340804605932, "grad_norm": 8.375, "learning_rate": 2.9733352405586878e-05, "loss": 0.7357732772827148, "mean_token_accuracy": 0.8290942400693894, "num_tokens": 61683000.0, "step": 31240 }, { "entropy": 0.8105206049978733, "epoch": 0.8951205190266818, "grad_norm": 8.5625, "learning_rate": 2.9722146629066806e-05, "loss": 0.8476202964782715, "mean_token_accuracy": 0.8138906635344029, "num_tokens": 61703699.0, "step": 31250 }, { "entropy": 0.7138552552089095, "epoch": 0.8954069575927703, "grad_norm": 5.9375, "learning_rate": 2.9710939868627646e-05, "loss": 0.7024792194366455, "mean_token_accuracy": 0.8383521988987923, "num_tokens": 61724894.0, "step": 31260 }, { "entropy": 0.7535786624066532, "epoch": 0.8956933961588588, "grad_norm": 8.1875, "learning_rate": 2.9699732126604467e-05, "loss": 0.7880331993103027, "mean_token_accuracy": 0.818932880833745, "num_tokens": 61745724.0, "step": 31270 }, { "entropy": 0.7256142221391201, "epoch": 0.8959798347249474, "grad_norm": 9.5625, "learning_rate": 2.968852340533254e-05, "loss": 0.7544530868530274, "mean_token_accuracy": 0.8239728383719921, "num_tokens": 61764695.0, "step": 31280 }, { "entropy": 0.7014750675298274, "epoch": 0.8962662732910359, "grad_norm": 9.875, "learning_rate": 2.9677313707147354e-05, "loss": 0.7054186820983886, "mean_token_accuracy": 0.8325873002409935, "num_tokens": 61785240.0, "step": 31290 }, { "entropy": 0.7169062677770853, "epoch": 0.8965527118571245, "grad_norm": 8.375, "learning_rate": 2.9666103034384586e-05, "loss": 0.7243823051452637, "mean_token_accuracy": 0.8182522401213645, "num_tokens": 61804829.0, "step": 31300 }, { "entropy": 0.7188352025114, "epoch": 0.8968391504232129, "grad_norm": 9.0, "learning_rate": 2.9654891389380112e-05, "loss": 0.6789646148681641, "mean_token_accuracy": 0.8357134558260441, "num_tokens": 61824502.0, "step": 31310 }, { "entropy": 0.7230908527038992, "epoch": 0.8971255889893015, "grad_norm": 12.0625, "learning_rate": 2.9643678774470046e-05, "loss": 0.7360464096069336, "mean_token_accuracy": 0.8173789419233799, "num_tokens": 61843555.0, "step": 31320 }, { "entropy": 0.6575697573833168, "epoch": 0.8974120275553901, "grad_norm": 7.5, "learning_rate": 2.9632465191990655e-05, "loss": 0.6717941761016846, "mean_token_accuracy": 0.8392052993178367, "num_tokens": 61863086.0, "step": 31330 }, { "entropy": 0.7477656358852982, "epoch": 0.8976984661214786, "grad_norm": 9.8125, "learning_rate": 2.962125064427843e-05, "loss": 0.8158635139465332, "mean_token_accuracy": 0.816642464324832, "num_tokens": 61883025.0, "step": 31340 }, { "entropy": 0.7603571466170251, "epoch": 0.8979849046875671, "grad_norm": 7.5, "learning_rate": 2.961003513367009e-05, "loss": 0.795188570022583, "mean_token_accuracy": 0.8248804248869419, "num_tokens": 61903274.0, "step": 31350 }, { "entropy": 0.6878170750103891, "epoch": 0.8982713432536557, "grad_norm": 9.0625, "learning_rate": 2.9598818662502504e-05, "loss": 0.7193904399871827, "mean_token_accuracy": 0.826022668927908, "num_tokens": 61922472.0, "step": 31360 }, { "entropy": 0.7751140899956226, "epoch": 0.8985577818197442, "grad_norm": 9.25, "learning_rate": 2.958760123311277e-05, "loss": 0.7936097145080566, "mean_token_accuracy": 0.8174173459410667, "num_tokens": 61941493.0, "step": 31370 }, { "entropy": 0.8272498942911625, "epoch": 0.8988442203858328, "grad_norm": 15.9375, "learning_rate": 2.9576382847838185e-05, "loss": 0.8450757026672363, "mean_token_accuracy": 0.8060385465621949, "num_tokens": 61961703.0, "step": 31380 }, { "entropy": 0.7364816202782094, "epoch": 0.8991306589519212, "grad_norm": 10.125, "learning_rate": 2.956516350901625e-05, "loss": 0.7294492721557617, "mean_token_accuracy": 0.8288434680551291, "num_tokens": 61981998.0, "step": 31390 }, { "entropy": 0.7489566548727453, "epoch": 0.8994170975180098, "grad_norm": 7.96875, "learning_rate": 2.9553943218984644e-05, "loss": 0.6987955093383789, "mean_token_accuracy": 0.8359244290739298, "num_tokens": 62001904.0, "step": 31400 }, { "entropy": 0.7545577180571854, "epoch": 0.8997035360840984, "grad_norm": 9.5, "learning_rate": 2.954272198008125e-05, "loss": 0.7620506763458252, "mean_token_accuracy": 0.8204831626266241, "num_tokens": 62022370.0, "step": 31410 }, { "entropy": 0.6748882193118334, "epoch": 0.8999899746501869, "grad_norm": 11.3125, "learning_rate": 2.9531499794644184e-05, "loss": 0.7021085262298584, "mean_token_accuracy": 0.8351902060210705, "num_tokens": 62040834.0, "step": 31420 }, { "entropy": 0.6967566643841565, "epoch": 0.9002764132162754, "grad_norm": 7.59375, "learning_rate": 2.9520276665011703e-05, "loss": 0.6857142448425293, "mean_token_accuracy": 0.830024653673172, "num_tokens": 62059972.0, "step": 31430 }, { "entropy": 0.7148443370126187, "epoch": 0.900562851782364, "grad_norm": 14.0625, "learning_rate": 2.9509052593522295e-05, "loss": 0.8035076141357422, "mean_token_accuracy": 0.8185323245823384, "num_tokens": 62079715.0, "step": 31440 }, { "entropy": 0.7593570794910193, "epoch": 0.9008492903484525, "grad_norm": 10.6875, "learning_rate": 2.9497827582514652e-05, "loss": 0.8087222099304199, "mean_token_accuracy": 0.8143355693668127, "num_tokens": 62098451.0, "step": 31450 }, { "entropy": 0.8112756595015526, "epoch": 0.9011357289145411, "grad_norm": 11.1875, "learning_rate": 2.9486601634327625e-05, "loss": 0.7825881481170655, "mean_token_accuracy": 0.8222827546298503, "num_tokens": 62118079.0, "step": 31460 }, { "entropy": 0.7795058527030051, "epoch": 0.9014221674806296, "grad_norm": 15.8125, "learning_rate": 2.94753747513003e-05, "loss": 0.7744061470031738, "mean_token_accuracy": 0.8158979788422585, "num_tokens": 62137035.0, "step": 31470 }, { "entropy": 0.6742089619860053, "epoch": 0.9017086060467181, "grad_norm": 10.8125, "learning_rate": 2.946414693577193e-05, "loss": 0.6621050357818603, "mean_token_accuracy": 0.8385760270059108, "num_tokens": 62156036.0, "step": 31480 }, { "entropy": 0.703850641194731, "epoch": 0.9019950446128067, "grad_norm": 9.875, "learning_rate": 2.9452918190081972e-05, "loss": 0.7163612365722656, "mean_token_accuracy": 0.8330206520855427, "num_tokens": 62174362.0, "step": 31490 }, { "entropy": 0.8593509015627205, "epoch": 0.9022814831788952, "grad_norm": 8.8125, "learning_rate": 2.9441688516570094e-05, "loss": 0.801654052734375, "mean_token_accuracy": 0.8163538090884686, "num_tokens": 62194863.0, "step": 31500 }, { "entropy": 0.8585990556515753, "epoch": 0.9025679217449838, "grad_norm": 11.25, "learning_rate": 2.9430457917576122e-05, "loss": 0.8224228858947754, "mean_token_accuracy": 0.806947735697031, "num_tokens": 62215015.0, "step": 31510 }, { "entropy": 0.7357140269130469, "epoch": 0.9028543603110722, "grad_norm": 10.6875, "learning_rate": 2.9419226395440102e-05, "loss": 0.7166444301605225, "mean_token_accuracy": 0.827725674957037, "num_tokens": 62234649.0, "step": 31520 }, { "entropy": 0.6936469420790672, "epoch": 0.9031407988771608, "grad_norm": 7.90625, "learning_rate": 2.9407993952502255e-05, "loss": 0.6898537635803222, "mean_token_accuracy": 0.8411212660372257, "num_tokens": 62254305.0, "step": 31530 }, { "entropy": 0.7241666647605598, "epoch": 0.9034272374432494, "grad_norm": 7.03125, "learning_rate": 2.9396760591103016e-05, "loss": 0.7040422439575196, "mean_token_accuracy": 0.8353231672197581, "num_tokens": 62273565.0, "step": 31540 }, { "entropy": 0.7190627657808364, "epoch": 0.9037136760093379, "grad_norm": 11.125, "learning_rate": 2.9385526313582994e-05, "loss": 0.7573830127716065, "mean_token_accuracy": 0.8212734516710043, "num_tokens": 62293974.0, "step": 31550 }, { "entropy": 0.7020899516530335, "epoch": 0.9040001145754264, "grad_norm": 6.84375, "learning_rate": 2.9374291122282982e-05, "loss": 0.7332519054412842, "mean_token_accuracy": 0.8295746177434922, "num_tokens": 62313750.0, "step": 31560 }, { "entropy": 0.6634957105852664, "epoch": 0.904286553141515, "grad_norm": 10.5, "learning_rate": 2.9363055019543995e-05, "loss": 0.6631300449371338, "mean_token_accuracy": 0.8447445970028639, "num_tokens": 62333375.0, "step": 31570 }, { "entropy": 0.6728171294555068, "epoch": 0.9045729917076035, "grad_norm": 10.8125, "learning_rate": 2.93518180077072e-05, "loss": 0.6319359302520752, "mean_token_accuracy": 0.8445135407149792, "num_tokens": 62351824.0, "step": 31580 }, { "entropy": 0.7362899030558765, "epoch": 0.9048594302736921, "grad_norm": 13.0625, "learning_rate": 2.934058008911398e-05, "loss": 0.7283154964447022, "mean_token_accuracy": 0.8316422224044799, "num_tokens": 62372580.0, "step": 31590 }, { "entropy": 0.7187744650989771, "epoch": 0.9051458688397805, "grad_norm": 8.0, "learning_rate": 2.9329341266105896e-05, "loss": 0.7219864368438721, "mean_token_accuracy": 0.825536771863699, "num_tokens": 62392614.0, "step": 31600 }, { "entropy": 0.6740025511477142, "epoch": 0.9054323074058691, "grad_norm": 7.34375, "learning_rate": 2.931810154102469e-05, "loss": 0.6770771026611329, "mean_token_accuracy": 0.8338985428214073, "num_tokens": 62412714.0, "step": 31610 }, { "entropy": 0.6248881016857922, "epoch": 0.9057187459719577, "grad_norm": 11.3125, "learning_rate": 2.9306860916212313e-05, "loss": 0.6387589931488037, "mean_token_accuracy": 0.8355521783232689, "num_tokens": 62431619.0, "step": 31620 }, { "entropy": 0.7290095265954732, "epoch": 0.9060051845380462, "grad_norm": 10.8125, "learning_rate": 2.9295619394010894e-05, "loss": 0.731112289428711, "mean_token_accuracy": 0.8288287714123725, "num_tokens": 62452247.0, "step": 31630 }, { "entropy": 0.8544218683615327, "epoch": 0.9062916231041347, "grad_norm": 9.4375, "learning_rate": 2.928437697676273e-05, "loss": 0.9018502235412598, "mean_token_accuracy": 0.8107961840927601, "num_tokens": 62471562.0, "step": 31640 }, { "entropy": 0.7390581543557346, "epoch": 0.9065780616702233, "grad_norm": 9.9375, "learning_rate": 2.9273133666810336e-05, "loss": 0.7546993255615234, "mean_token_accuracy": 0.8403464127331972, "num_tokens": 62491570.0, "step": 31650 }, { "entropy": 0.7329729869961739, "epoch": 0.9068645002363118, "grad_norm": 8.4375, "learning_rate": 2.926188946649639e-05, "loss": 0.7525569438934326, "mean_token_accuracy": 0.8365613598376512, "num_tokens": 62510125.0, "step": 31660 }, { "entropy": 0.7492935438640416, "epoch": 0.9071509388024004, "grad_norm": 10.5625, "learning_rate": 2.9250644378163776e-05, "loss": 0.7845086097717285, "mean_token_accuracy": 0.8255662865936756, "num_tokens": 62528954.0, "step": 31670 }, { "entropy": 0.7449580421671271, "epoch": 0.9074373773684888, "grad_norm": 7.8125, "learning_rate": 2.923939840415553e-05, "loss": 0.7695770740509034, "mean_token_accuracy": 0.8159236744046211, "num_tokens": 62550239.0, "step": 31680 }, { "entropy": 0.7755580667406321, "epoch": 0.9077238159345774, "grad_norm": 10.5, "learning_rate": 2.9228151546814914e-05, "loss": 0.767540168762207, "mean_token_accuracy": 0.820448062941432, "num_tokens": 62570696.0, "step": 31690 }, { "entropy": 0.6946647071279586, "epoch": 0.908010254500666, "grad_norm": 7.6875, "learning_rate": 2.9216903808485345e-05, "loss": 0.6396018505096436, "mean_token_accuracy": 0.8424449384212493, "num_tokens": 62590084.0, "step": 31700 }, { "entropy": 0.7388099811971187, "epoch": 0.9082966930667545, "grad_norm": 8.375, "learning_rate": 2.9205655191510423e-05, "loss": 0.7431666851043701, "mean_token_accuracy": 0.8243351325392723, "num_tokens": 62609231.0, "step": 31710 }, { "entropy": 0.8131321831606328, "epoch": 0.9085831316328431, "grad_norm": 10.875, "learning_rate": 2.9194405698233958e-05, "loss": 0.8745104789733886, "mean_token_accuracy": 0.801719157025218, "num_tokens": 62629374.0, "step": 31720 }, { "entropy": 0.7507283895276486, "epoch": 0.9088695701989316, "grad_norm": 7.15625, "learning_rate": 2.9183155330999905e-05, "loss": 0.6649708271026611, "mean_token_accuracy": 0.8437069479376078, "num_tokens": 62648655.0, "step": 31730 }, { "entropy": 0.7885823886841535, "epoch": 0.9091560087650201, "grad_norm": 11.0625, "learning_rate": 2.917190409215243e-05, "loss": 0.7782921314239502, "mean_token_accuracy": 0.8211049899458885, "num_tokens": 62668855.0, "step": 31740 }, { "entropy": 0.7401616541668773, "epoch": 0.9094424473311087, "grad_norm": 7.375, "learning_rate": 2.916065198403588e-05, "loss": 0.7428979873657227, "mean_token_accuracy": 0.8281892757862807, "num_tokens": 62688241.0, "step": 31750 }, { "entropy": 0.7733067704364658, "epoch": 0.9097288858971972, "grad_norm": 7.625, "learning_rate": 2.914939900899476e-05, "loss": 0.8419400215148926, "mean_token_accuracy": 0.8085472885519266, "num_tokens": 62708061.0, "step": 31760 }, { "entropy": 0.6649927786551416, "epoch": 0.9100153244632857, "grad_norm": 7.96875, "learning_rate": 2.9138145169373777e-05, "loss": 0.6369128227233887, "mean_token_accuracy": 0.8477082684636116, "num_tokens": 62729123.0, "step": 31770 }, { "entropy": 0.7138575472868979, "epoch": 0.9103017630293743, "grad_norm": 9.8125, "learning_rate": 2.9126890467517802e-05, "loss": 0.721143388748169, "mean_token_accuracy": 0.8366635706275701, "num_tokens": 62748957.0, "step": 31780 }, { "entropy": 0.7686808630824089, "epoch": 0.9105882015954628, "grad_norm": 9.1875, "learning_rate": 2.911563490577191e-05, "loss": 0.7773112773895263, "mean_token_accuracy": 0.819014685228467, "num_tokens": 62769270.0, "step": 31790 }, { "entropy": 0.7524145107716322, "epoch": 0.9108746401615514, "grad_norm": 8.0625, "learning_rate": 2.910437848648133e-05, "loss": 0.710072660446167, "mean_token_accuracy": 0.8368499759584666, "num_tokens": 62789066.0, "step": 31800 }, { "entropy": 0.7506163151934743, "epoch": 0.9111610787276399, "grad_norm": 10.6875, "learning_rate": 2.909312121199148e-05, "loss": 0.7587294101715087, "mean_token_accuracy": 0.8208259314298629, "num_tokens": 62811309.0, "step": 31810 }, { "entropy": 0.7362167067825794, "epoch": 0.9114475172937284, "grad_norm": 8.6875, "learning_rate": 2.9081863084647965e-05, "loss": 0.7316089630126953, "mean_token_accuracy": 0.8291648272424936, "num_tokens": 62832870.0, "step": 31820 }, { "entropy": 0.728352018352598, "epoch": 0.911733955859817, "grad_norm": 6.9375, "learning_rate": 2.9070604106796547e-05, "loss": 0.7544605731964111, "mean_token_accuracy": 0.8219658058136702, "num_tokens": 62852188.0, "step": 31830 }, { "entropy": 0.8075040376745164, "epoch": 0.9120203944259055, "grad_norm": 10.8125, "learning_rate": 2.9059344280783174e-05, "loss": 0.8330258369445801, "mean_token_accuracy": 0.8064204879105091, "num_tokens": 62872733.0, "step": 31840 }, { "entropy": 0.7481285523623228, "epoch": 0.912306832991994, "grad_norm": 7.78125, "learning_rate": 2.9048083608953992e-05, "loss": 0.7964035511016846, "mean_token_accuracy": 0.8239479623734951, "num_tokens": 62892601.0, "step": 31850 }, { "entropy": 0.6737873202189804, "epoch": 0.9125932715580826, "grad_norm": 7.53125, "learning_rate": 2.903682209365528e-05, "loss": 0.6516993999481201, "mean_token_accuracy": 0.8448345594108104, "num_tokens": 62912315.0, "step": 31860 }, { "entropy": 0.7904157625511289, "epoch": 0.9128797101241711, "grad_norm": 7.8125, "learning_rate": 2.9025559737233537e-05, "loss": 0.8032742500305176, "mean_token_accuracy": 0.813806938752532, "num_tokens": 62930955.0, "step": 31870 }, { "entropy": 0.8429348040372133, "epoch": 0.9131661486902597, "grad_norm": 9.5625, "learning_rate": 2.9014296542035414e-05, "loss": 0.8911533355712891, "mean_token_accuracy": 0.8017095036804676, "num_tokens": 62952002.0, "step": 31880 }, { "entropy": 0.7410570094361901, "epoch": 0.9134525872563481, "grad_norm": 9.4375, "learning_rate": 2.900303251040773e-05, "loss": 0.7683367252349853, "mean_token_accuracy": 0.8241291139274836, "num_tokens": 62971662.0, "step": 31890 }, { "entropy": 0.7138321973383427, "epoch": 0.9137390258224367, "grad_norm": 7.0, "learning_rate": 2.8991767644697497e-05, "loss": 0.7363371849060059, "mean_token_accuracy": 0.8282822303473949, "num_tokens": 62991283.0, "step": 31900 }, { "entropy": 0.8175505900755524, "epoch": 0.9140254643885253, "grad_norm": 7.78125, "learning_rate": 2.8980501947251898e-05, "loss": 0.8047837257385254, "mean_token_accuracy": 0.8185700699687004, "num_tokens": 63012485.0, "step": 31910 }, { "entropy": 0.7987545650452376, "epoch": 0.9143119029546138, "grad_norm": 9.625, "learning_rate": 2.8969235420418274e-05, "loss": 0.7709282875061035, "mean_token_accuracy": 0.8309549584984779, "num_tokens": 63032969.0, "step": 31920 }, { "entropy": 0.741315673943609, "epoch": 0.9145983415207023, "grad_norm": 10.1875, "learning_rate": 2.895796806654415e-05, "loss": 0.754824161529541, "mean_token_accuracy": 0.8188746023923159, "num_tokens": 63052590.0, "step": 31930 }, { "entropy": 0.7676701046526432, "epoch": 0.9148847800867909, "grad_norm": 8.3125, "learning_rate": 2.894669988797723e-05, "loss": 0.7613906383514404, "mean_token_accuracy": 0.830718194320798, "num_tokens": 63072058.0, "step": 31940 }, { "entropy": 0.6324413171969354, "epoch": 0.9151712186528794, "grad_norm": 9.0625, "learning_rate": 2.8935430887065374e-05, "loss": 0.6272721767425538, "mean_token_accuracy": 0.8514070764183999, "num_tokens": 63092101.0, "step": 31950 }, { "entropy": 0.7214945896528662, "epoch": 0.915457657218968, "grad_norm": 5.875, "learning_rate": 2.8924161066156614e-05, "loss": 0.6717380046844482, "mean_token_accuracy": 0.8345632407814264, "num_tokens": 63113831.0, "step": 31960 }, { "entropy": 0.6731991032138467, "epoch": 0.9157440957850566, "grad_norm": 10.625, "learning_rate": 2.8912890427599177e-05, "loss": 0.6964722156524659, "mean_token_accuracy": 0.830223273485899, "num_tokens": 63133580.0, "step": 31970 }, { "entropy": 0.6781891839578748, "epoch": 0.916030534351145, "grad_norm": 8.5, "learning_rate": 2.8901618973741433e-05, "loss": 0.6699615478515625, "mean_token_accuracy": 0.8291253335773945, "num_tokens": 63153098.0, "step": 31980 }, { "entropy": 0.7845070753246546, "epoch": 0.9163169729172336, "grad_norm": 9.0, "learning_rate": 2.8890346706931935e-05, "loss": 0.8258766174316406, "mean_token_accuracy": 0.8216951984912158, "num_tokens": 63172249.0, "step": 31990 }, { "epoch": 0.9166034114833221, "eval_entropy": 0.772518795311451, "eval_loss": 0.7784592509269714, "eval_mean_token_accuracy": 0.8175579745769501, "eval_num_tokens": 63190998.0, "eval_runtime": 43.0079, "eval_samples_per_second": 46.503, "eval_steps_per_second": 5.813, "step": 32000 } ], "logging_steps": 10, "max_steps": 69824, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 4000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.10716081203948e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }