Instructions to use taejoon89/refqa with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use taejoon89/refqa with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("google/gemma-3-27b-it") model = PeftModel.from_pretrained(base_model, "taejoon89/refqa") - Notebooks
- Google Colab
- Kaggle
Download trainer_state.json from taejoon89/refqa: direct link, hf CLI and curl.
- Browser
- Download file 321 kB
-
https://huggingface.co/taejoon89/refqa/resolve/main/trainer_state.json
- Command line
-
hf download hf://taejoon89/refqa/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/taejoon89/refqa/resolve/main/trainer_state.json
321 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 1500, | |
| "global_step": 50224, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.3379378823935986, | |
| "epoch": 0.001991079961771265, | |
| "grad_norm": 2.79451847076416, | |
| "learning_rate": 6.5029860650298604e-06, | |
| "loss": 1.7820364379882812, | |
| "mean_token_accuracy": 0.7173230850696564, | |
| "num_tokens": 3818304.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.6726230216026307, | |
| "epoch": 0.00398215992354253, | |
| "grad_norm": 1.2477459907531738, | |
| "learning_rate": 1.3138686131386862e-05, | |
| "loss": 0.666585693359375, | |
| "mean_token_accuracy": 0.828263390660286, | |
| "num_tokens": 7722811.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.3462180678546429, | |
| "epoch": 0.0059732398853137945, | |
| "grad_norm": 1.1506513357162476, | |
| "learning_rate": 1.9774386197743863e-05, | |
| "loss": 0.3362165069580078, | |
| "mean_token_accuracy": 0.8953030824661254, | |
| "num_tokens": 11445148.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.2893742734193802, | |
| "epoch": 0.00796431984708506, | |
| "grad_norm": 0.8775256872177124, | |
| "learning_rate": 2.6410086264100863e-05, | |
| "loss": 0.2852581214904785, | |
| "mean_token_accuracy": 0.9090695399045944, | |
| "num_tokens": 15380668.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.26955254435539244, | |
| "epoch": 0.009955399808856324, | |
| "grad_norm": 0.57791668176651, | |
| "learning_rate": 3.3045786330457866e-05, | |
| "loss": 0.26207345962524414, | |
| "mean_token_accuracy": 0.9136792892217636, | |
| "num_tokens": 19181789.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.25845475763082504, | |
| "epoch": 0.011946479770627589, | |
| "grad_norm": 0.5533633232116699, | |
| "learning_rate": 3.968148639681486e-05, | |
| "loss": 0.2490983200073242, | |
| "mean_token_accuracy": 0.9160848289728165, | |
| "num_tokens": 22992039.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.2542937259376049, | |
| "epoch": 0.013937559732398854, | |
| "grad_norm": 0.5990102291107178, | |
| "learning_rate": 4.631718646317187e-05, | |
| "loss": 0.25011444091796875, | |
| "mean_token_accuracy": 0.9170939832925796, | |
| "num_tokens": 27108018.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.2444898281991482, | |
| "epoch": 0.01592863969417012, | |
| "grad_norm": 0.43611571192741394, | |
| "learning_rate": 5.295288652952887e-05, | |
| "loss": 0.23930130004882813, | |
| "mean_token_accuracy": 0.9197874891757966, | |
| "num_tokens": 31057058.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.24174359649419785, | |
| "epoch": 0.01791971965594138, | |
| "grad_norm": 2.912916898727417, | |
| "learning_rate": 5.9588586595885865e-05, | |
| "loss": 0.2378847885131836, | |
| "mean_token_accuracy": 0.9206177514791488, | |
| "num_tokens": 34886145.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.23314271196722985, | |
| "epoch": 0.019910799617712648, | |
| "grad_norm": 0.5054332613945007, | |
| "learning_rate": 6.622428666224287e-05, | |
| "loss": 0.2341362190246582, | |
| "mean_token_accuracy": 0.9219391363859176, | |
| "num_tokens": 38822339.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.24051452845335006, | |
| "epoch": 0.02190187957948391, | |
| "grad_norm": 0.5167355537414551, | |
| "learning_rate": 7.285998672859987e-05, | |
| "loss": 0.24161724090576173, | |
| "mean_token_accuracy": 0.9203771650791168, | |
| "num_tokens": 42957563.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.2295207805931568, | |
| "epoch": 0.023892959541255178, | |
| "grad_norm": 0.9762596487998962, | |
| "learning_rate": 7.949568679495687e-05, | |
| "loss": 0.2272401809692383, | |
| "mean_token_accuracy": 0.9232405090332031, | |
| "num_tokens": 46768583.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.23686898455023767, | |
| "epoch": 0.02588403950302644, | |
| "grad_norm": 0.466611385345459, | |
| "learning_rate": 8.613138686131386e-05, | |
| "loss": 0.23224437713623047, | |
| "mean_token_accuracy": 0.9218472588062286, | |
| "num_tokens": 50645803.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.23130884274840355, | |
| "epoch": 0.027875119464797708, | |
| "grad_norm": 0.38592949509620667, | |
| "learning_rate": 9.276708692767087e-05, | |
| "loss": 0.23153045654296875, | |
| "mean_token_accuracy": 0.9227015018463135, | |
| "num_tokens": 54572014.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.23954722553491592, | |
| "epoch": 0.02986619942656897, | |
| "grad_norm": 0.3463596999645233, | |
| "learning_rate": 9.940278699402787e-05, | |
| "loss": 0.24017810821533203, | |
| "mean_token_accuracy": 0.9208958899974823, | |
| "num_tokens": 58564303.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.23351749897003174, | |
| "epoch": 0.03185727938834024, | |
| "grad_norm": 0.44391459226608276, | |
| "learning_rate": 0.00010603848706038488, | |
| "loss": 0.23203353881835936, | |
| "mean_token_accuracy": 0.9222453135251999, | |
| "num_tokens": 62457510.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 0.2437037083506584, | |
| "epoch": 0.033848359350111504, | |
| "grad_norm": 0.5019763112068176, | |
| "learning_rate": 0.00011267418712674188, | |
| "loss": 0.24389320373535156, | |
| "mean_token_accuracy": 0.9196780633926391, | |
| "num_tokens": 66530019.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 0.22831465810537338, | |
| "epoch": 0.03583943931188276, | |
| "grad_norm": 0.33829352259635925, | |
| "learning_rate": 0.00011930988719309889, | |
| "loss": 0.2317771339416504, | |
| "mean_token_accuracy": 0.9224331545829773, | |
| "num_tokens": 70424005.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 0.22766645520925521, | |
| "epoch": 0.03783051927365403, | |
| "grad_norm": 0.5179854035377502, | |
| "learning_rate": 0.00012594558725945588, | |
| "loss": 0.22764064788818358, | |
| "mean_token_accuracy": 0.923973958492279, | |
| "num_tokens": 74253770.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 0.23552999064326285, | |
| "epoch": 0.039821599235425297, | |
| "grad_norm": 0.44404569268226624, | |
| "learning_rate": 0.00013258128732581288, | |
| "loss": 0.23626502990722656, | |
| "mean_token_accuracy": 0.9216047769784927, | |
| "num_tokens": 78182200.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 0.22930314570665358, | |
| "epoch": 0.041812679197196556, | |
| "grad_norm": 0.448462575674057, | |
| "learning_rate": 0.00013921698739216987, | |
| "loss": 0.23278812408447266, | |
| "mean_token_accuracy": 0.9230523258447647, | |
| "num_tokens": 81937838.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 0.23650458663702012, | |
| "epoch": 0.04380375915896782, | |
| "grad_norm": 0.3995441794395447, | |
| "learning_rate": 0.00014585268745852687, | |
| "loss": 0.23656768798828126, | |
| "mean_token_accuracy": 0.9211232715845108, | |
| "num_tokens": 85927588.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 0.23935676783323287, | |
| "epoch": 0.04579483912073909, | |
| "grad_norm": 0.39098668098449707, | |
| "learning_rate": 0.00015248838752488387, | |
| "loss": 0.2379437255859375, | |
| "mean_token_accuracy": 0.921039087176323, | |
| "num_tokens": 89882949.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 0.24524856984615326, | |
| "epoch": 0.047785919082510356, | |
| "grad_norm": 0.4632549583911896, | |
| "learning_rate": 0.0001591240875912409, | |
| "loss": 0.24808704376220703, | |
| "mean_token_accuracy": 0.9186844676733017, | |
| "num_tokens": 93855605.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 0.23450494036078454, | |
| "epoch": 0.049776999044281615, | |
| "grad_norm": 0.4616311490535736, | |
| "learning_rate": 0.0001657597876575979, | |
| "loss": 0.23671966552734375, | |
| "mean_token_accuracy": 0.9223334664106368, | |
| "num_tokens": 97726256.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 0.23849584758281708, | |
| "epoch": 0.05176807900605288, | |
| "grad_norm": 0.5183118581771851, | |
| "learning_rate": 0.00017239548772395488, | |
| "loss": 0.2390594482421875, | |
| "mean_token_accuracy": 0.9210267335176467, | |
| "num_tokens": 101712424.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 0.24750934526324272, | |
| "epoch": 0.05375915896782415, | |
| "grad_norm": 0.6962779760360718, | |
| "learning_rate": 0.0001790311877903119, | |
| "loss": 0.2504555702209473, | |
| "mean_token_accuracy": 0.9193422102928162, | |
| "num_tokens": 105526982.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 0.25117891386151314, | |
| "epoch": 0.055750238929595415, | |
| "grad_norm": 1.4407775402069092, | |
| "learning_rate": 0.00018566688785666888, | |
| "loss": 0.2523708534240723, | |
| "mean_token_accuracy": 0.9178527224063874, | |
| "num_tokens": 109426865.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 0.247833551466465, | |
| "epoch": 0.057741318891366675, | |
| "grad_norm": 1.0299957990646362, | |
| "learning_rate": 0.0001923025879230259, | |
| "loss": 0.2527511787414551, | |
| "mean_token_accuracy": 0.918297466635704, | |
| "num_tokens": 113259105.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 0.2641977226734161, | |
| "epoch": 0.05973239885313794, | |
| "grad_norm": 0.5299701690673828, | |
| "learning_rate": 0.0001989382879893829, | |
| "loss": 0.2680278015136719, | |
| "mean_token_accuracy": 0.9148374336957932, | |
| "num_tokens": 117180907.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.05973239885313794, | |
| "eval_entropy": 0.238698192295574, | |
| "eval_loss": 0.25736984610557556, | |
| "eval_mean_token_accuracy": 0.9147308885105072, | |
| "eval_num_tokens": 117180907.0, | |
| "eval_runtime": 97.8199, | |
| "eval_samples_per_second": 10.223, | |
| "eval_steps_per_second": 0.644, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 0.26027600586414334, | |
| "epoch": 0.06172347881490921, | |
| "grad_norm": 0.49680882692337036, | |
| "learning_rate": 0.00019999963321886343, | |
| "loss": 0.2606443786621094, | |
| "mean_token_accuracy": 0.9150975352525711, | |
| "num_tokens": 121066461.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 0.2638482017815113, | |
| "epoch": 0.06371455877668047, | |
| "grad_norm": 0.4531654119491577, | |
| "learning_rate": 0.00019999824011999318, | |
| "loss": 0.26884456634521486, | |
| "mean_token_accuracy": 0.9154274082183838, | |
| "num_tokens": 124953674.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 0.26387491196393964, | |
| "epoch": 0.06570563873845174, | |
| "grad_norm": 0.5205627083778381, | |
| "learning_rate": 0.0001999958074106123, | |
| "loss": 0.26874935150146484, | |
| "mean_token_accuracy": 0.9152652221918106, | |
| "num_tokens": 128863995.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 0.2617137129604816, | |
| "epoch": 0.06769671870022301, | |
| "grad_norm": 0.5326299071311951, | |
| "learning_rate": 0.00019999233511601205, | |
| "loss": 0.26520500183105467, | |
| "mean_token_accuracy": 0.9143794012069703, | |
| "num_tokens": 132781419.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 0.2951073496043682, | |
| "epoch": 0.06968779866199426, | |
| "grad_norm": 1.5515563488006592, | |
| "learning_rate": 0.00019998782327229132, | |
| "loss": 0.2992689514160156, | |
| "mean_token_accuracy": 0.9068609338998794, | |
| "num_tokens": 136746142.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 0.2911060942709446, | |
| "epoch": 0.07167887862376553, | |
| "grad_norm": 0.9882198572158813, | |
| "learning_rate": 0.00019998227192635662, | |
| "loss": 0.2912177658081055, | |
| "mean_token_accuracy": 0.9083128577470779, | |
| "num_tokens": 140635934.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 0.30583499386906626, | |
| "epoch": 0.0736699585855368, | |
| "grad_norm": 0.9490135312080383, | |
| "learning_rate": 0.00019997568113592123, | |
| "loss": 0.30314250946044924, | |
| "mean_token_accuracy": 0.9060158902406692, | |
| "num_tokens": 144351764.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 0.29104826986789706, | |
| "epoch": 0.07566103854730806, | |
| "grad_norm": 0.5743433833122253, | |
| "learning_rate": 0.00019996805096950495, | |
| "loss": 0.2896587562561035, | |
| "mean_token_accuracy": 0.9093901348114014, | |
| "num_tokens": 148317341.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 0.2791394780576229, | |
| "epoch": 0.07765211850907933, | |
| "grad_norm": 0.6630957722663879, | |
| "learning_rate": 0.00019995938150643323, | |
| "loss": 0.27749942779541015, | |
| "mean_token_accuracy": 0.9116008925437927, | |
| "num_tokens": 152115011.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 0.2864747692644596, | |
| "epoch": 0.07964319847085059, | |
| "grad_norm": 0.5167714357376099, | |
| "learning_rate": 0.0001999496728368363, | |
| "loss": 0.2892703628540039, | |
| "mean_token_accuracy": 0.9101212161779404, | |
| "num_tokens": 155955543.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 0.29486714631319044, | |
| "epoch": 0.08163427843262186, | |
| "grad_norm": 0.6764300465583801, | |
| "learning_rate": 0.00019993892506164817, | |
| "loss": 0.2938148880004883, | |
| "mean_token_accuracy": 0.907455735206604, | |
| "num_tokens": 159950282.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 0.289661710858345, | |
| "epoch": 0.08362535839439311, | |
| "grad_norm": 1.3380991220474243, | |
| "learning_rate": 0.00019992713829260596, | |
| "loss": 0.29367408752441404, | |
| "mean_token_accuracy": 0.9090178072452545, | |
| "num_tokens": 163946195.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 0.2813515478372574, | |
| "epoch": 0.08561643835616438, | |
| "grad_norm": 0.5605268478393555, | |
| "learning_rate": 0.00019991431265224826, | |
| "loss": 0.28127031326293944, | |
| "mean_token_accuracy": 0.9111650967597962, | |
| "num_tokens": 167803895.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 0.2813937878608704, | |
| "epoch": 0.08760751831793565, | |
| "grad_norm": 0.545811653137207, | |
| "learning_rate": 0.0001999004482739141, | |
| "loss": 0.2833607864379883, | |
| "mean_token_accuracy": 0.9109566658735275, | |
| "num_tokens": 171609856.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 0.27727267012000084, | |
| "epoch": 0.08959859827970691, | |
| "grad_norm": 7.048864364624023, | |
| "learning_rate": 0.00019988554530174155, | |
| "loss": 0.27622432708740235, | |
| "mean_token_accuracy": 0.912345079779625, | |
| "num_tokens": 175465546.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 0.28270753011107447, | |
| "epoch": 0.09158967824147818, | |
| "grad_norm": 0.6423642635345459, | |
| "learning_rate": 0.00019986960389066624, | |
| "loss": 0.27773189544677734, | |
| "mean_token_accuracy": 0.9109648811817169, | |
| "num_tokens": 179431473.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 0.2899395690858364, | |
| "epoch": 0.09358075820324945, | |
| "grad_norm": 0.675128161907196, | |
| "learning_rate": 0.00019985262420641964, | |
| "loss": 0.29255908966064453, | |
| "mean_token_accuracy": 0.9083035236597061, | |
| "num_tokens": 183254030.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 0.2949830622971058, | |
| "epoch": 0.09557183816502071, | |
| "grad_norm": 0.7517677545547485, | |
| "learning_rate": 0.00019983460642552747, | |
| "loss": 0.2965231704711914, | |
| "mean_token_accuracy": 0.9082889229059219, | |
| "num_tokens": 187001777.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 0.2832724647223949, | |
| "epoch": 0.09756291812679198, | |
| "grad_norm": 5.088311195373535, | |
| "learning_rate": 0.00019981555073530772, | |
| "loss": 0.2839857864379883, | |
| "mean_token_accuracy": 0.9105693870782852, | |
| "num_tokens": 190883577.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 0.291139078438282, | |
| "epoch": 0.09955399808856323, | |
| "grad_norm": 0.8445279598236084, | |
| "learning_rate": 0.0001997954573338689, | |
| "loss": 0.2915267562866211, | |
| "mean_token_accuracy": 0.9080010551214218, | |
| "num_tokens": 194770386.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 0.28031437411904336, | |
| "epoch": 0.1015450780503345, | |
| "grad_norm": 0.6642708778381348, | |
| "learning_rate": 0.00019977432643010775, | |
| "loss": 0.28441873550415037, | |
| "mean_token_accuracy": 0.9110708701610565, | |
| "num_tokens": 198620457.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 0.27880264043807984, | |
| "epoch": 0.10353615801210576, | |
| "grad_norm": 0.8699315786361694, | |
| "learning_rate": 0.0001997521582437072, | |
| "loss": 0.27945274353027344, | |
| "mean_token_accuracy": 0.911846690773964, | |
| "num_tokens": 202386820.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 0.2867648507654667, | |
| "epoch": 0.10552723797387703, | |
| "grad_norm": 1.2071722745895386, | |
| "learning_rate": 0.00019972895300513418, | |
| "loss": 0.2882248497009277, | |
| "mean_token_accuracy": 0.9101024943590165, | |
| "num_tokens": 206364615.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 0.304570385068655, | |
| "epoch": 0.1075183179356483, | |
| "grad_norm": 4.0775251388549805, | |
| "learning_rate": 0.000199704710955637, | |
| "loss": 0.3016018295288086, | |
| "mean_token_accuracy": 0.9069358545541764, | |
| "num_tokens": 210183973.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 0.3049754598736763, | |
| "epoch": 0.10950939789741956, | |
| "grad_norm": 1.0843818187713623, | |
| "learning_rate": 0.00019967943234724302, | |
| "loss": 0.3067584419250488, | |
| "mean_token_accuracy": 0.9062304347753525, | |
| "num_tokens": 214136281.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 0.29823502883315084, | |
| "epoch": 0.11150047785919083, | |
| "grad_norm": 0.6775873899459839, | |
| "learning_rate": 0.00019965311744275587, | |
| "loss": 0.29334327697753904, | |
| "mean_token_accuracy": 0.9081481236219406, | |
| "num_tokens": 217930544.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 0.3078458538651466, | |
| "epoch": 0.1134915578209621, | |
| "grad_norm": 0.7490587830543518, | |
| "learning_rate": 0.00019962576651575296, | |
| "loss": 0.3025942230224609, | |
| "mean_token_accuracy": 0.905663657784462, | |
| "num_tokens": 221877887.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 0.30110266715288164, | |
| "epoch": 0.11548263778273335, | |
| "grad_norm": 0.6697282791137695, | |
| "learning_rate": 0.00019959737985058234, | |
| "loss": 0.3010330581665039, | |
| "mean_token_accuracy": 0.9064904636144638, | |
| "num_tokens": 225627001.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 0.2984598980844021, | |
| "epoch": 0.11747371774450462, | |
| "grad_norm": 0.8348047733306885, | |
| "learning_rate": 0.00019956795774235997, | |
| "loss": 0.29577600479125976, | |
| "mean_token_accuracy": 0.9069764482975006, | |
| "num_tokens": 229611801.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 0.29838990807533267, | |
| "epoch": 0.11946479770627588, | |
| "grad_norm": 1.1875905990600586, | |
| "learning_rate": 0.00019953750049696658, | |
| "loss": 0.2987412643432617, | |
| "mean_token_accuracy": 0.9088970798254014, | |
| "num_tokens": 233561259.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.11946479770627588, | |
| "eval_entropy": 0.3022507036489154, | |
| "eval_loss": 0.30308812856674194, | |
| "eval_mean_token_accuracy": 0.9028340615923443, | |
| "eval_num_tokens": 233561259.0, | |
| "eval_runtime": 97.5155, | |
| "eval_samples_per_second": 10.255, | |
| "eval_steps_per_second": 0.646, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 0.29537968412041665, | |
| "epoch": 0.12145587766804715, | |
| "grad_norm": 0.8750671744346619, | |
| "learning_rate": 0.00019950600843104445, | |
| "loss": 0.29412849426269533, | |
| "mean_token_accuracy": 0.9083840191364289, | |
| "num_tokens": 237437091.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 0.30670097917318345, | |
| "epoch": 0.12344695762981842, | |
| "grad_norm": 2.4987075328826904, | |
| "learning_rate": 0.0001994734818719942, | |
| "loss": 0.30259759902954103, | |
| "mean_token_accuracy": 0.9058998501300812, | |
| "num_tokens": 241436828.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 0.29469338595867156, | |
| "epoch": 0.12543803759158967, | |
| "grad_norm": 1.7380224466323853, | |
| "learning_rate": 0.00019943992115797126, | |
| "loss": 0.2931842803955078, | |
| "mean_token_accuracy": 0.9096289926767349, | |
| "num_tokens": 245351552.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 0.29411437809467317, | |
| "epoch": 0.12742911755336095, | |
| "grad_norm": 0.7798497676849365, | |
| "learning_rate": 0.0001994053266378825, | |
| "loss": 0.2951908874511719, | |
| "mean_token_accuracy": 0.9085562580823898, | |
| "num_tokens": 249301096.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 0.2993234470486641, | |
| "epoch": 0.1294201975151322, | |
| "grad_norm": 0.8817734718322754, | |
| "learning_rate": 0.00019936969867138254, | |
| "loss": 0.30352956771850587, | |
| "mean_token_accuracy": 0.9072857981920243, | |
| "num_tokens": 253277622.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 0.29699300721287725, | |
| "epoch": 0.13141127747690348, | |
| "grad_norm": 1.2130342721939087, | |
| "learning_rate": 0.00019933303762886996, | |
| "loss": 0.29787822723388674, | |
| "mean_token_accuracy": 0.9083835577964783, | |
| "num_tokens": 257227304.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 0.29587675660848617, | |
| "epoch": 0.13340235743867473, | |
| "grad_norm": 0.5530600547790527, | |
| "learning_rate": 0.00019929534389148354, | |
| "loss": 0.29798791885375975, | |
| "mean_token_accuracy": 0.908504787683487, | |
| "num_tokens": 261108205.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 0.29003412410616874, | |
| "epoch": 0.13539343740044602, | |
| "grad_norm": 0.8571836948394775, | |
| "learning_rate": 0.00019925661785109822, | |
| "loss": 0.2917255973815918, | |
| "mean_token_accuracy": 0.9100581562519073, | |
| "num_tokens": 265017318.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 0.30487392365932464, | |
| "epoch": 0.13738451736221727, | |
| "grad_norm": 0.8164399862289429, | |
| "learning_rate": 0.00019921685991032106, | |
| "loss": 0.30083534240722654, | |
| "mean_token_accuracy": 0.9061442995071411, | |
| "num_tokens": 268861028.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 0.2943995995819569, | |
| "epoch": 0.13937559732398852, | |
| "grad_norm": 0.7428765296936035, | |
| "learning_rate": 0.00019917607048248708, | |
| "loss": 0.29643802642822265, | |
| "mean_token_accuracy": 0.9087468749284744, | |
| "num_tokens": 272883824.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 0.2999743050336838, | |
| "epoch": 0.1413666772857598, | |
| "grad_norm": 0.6750977039337158, | |
| "learning_rate": 0.0001991342499916549, | |
| "loss": 0.29727874755859374, | |
| "mean_token_accuracy": 0.9070488250255585, | |
| "num_tokens": 276710051.0, | |
| "step": 3550 | |
| }, | |
| { | |
| "entropy": 0.2862047958374023, | |
| "epoch": 0.14335775724753105, | |
| "grad_norm": 0.891075074672699, | |
| "learning_rate": 0.0001990913988726024, | |
| "loss": 0.2836902618408203, | |
| "mean_token_accuracy": 0.9103441405296325, | |
| "num_tokens": 280668466.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 0.2909073846042156, | |
| "epoch": 0.14534883720930233, | |
| "grad_norm": 0.6584152579307556, | |
| "learning_rate": 0.00019904751757082219, | |
| "loss": 0.2913536262512207, | |
| "mean_token_accuracy": 0.9092260366678238, | |
| "num_tokens": 284596662.0, | |
| "step": 3650 | |
| }, | |
| { | |
| "entropy": 0.295346038043499, | |
| "epoch": 0.1473399171710736, | |
| "grad_norm": 1.0523701906204224, | |
| "learning_rate": 0.00019900260654251689, | |
| "loss": 0.297835636138916, | |
| "mean_token_accuracy": 0.907945249080658, | |
| "num_tokens": 288479589.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 0.2844700115919113, | |
| "epoch": 0.14933099713284487, | |
| "grad_norm": 0.5819393992424011, | |
| "learning_rate": 0.0001989566662545945, | |
| "loss": 0.2872531509399414, | |
| "mean_token_accuracy": 0.9114671903848648, | |
| "num_tokens": 292311632.0, | |
| "step": 3750 | |
| }, | |
| { | |
| "entropy": 0.28947981700301173, | |
| "epoch": 0.15132207709461612, | |
| "grad_norm": 0.5562146306037903, | |
| "learning_rate": 0.00019890969718466345, | |
| "loss": 0.28745689392089846, | |
| "mean_token_accuracy": 0.9094958698749542, | |
| "num_tokens": 296097039.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 0.29930747270584107, | |
| "epoch": 0.15331315705638737, | |
| "grad_norm": 0.6150246262550354, | |
| "learning_rate": 0.0001988616998210278, | |
| "loss": 0.29687225341796875, | |
| "mean_token_accuracy": 0.9068776845932007, | |
| "num_tokens": 299857385.0, | |
| "step": 3850 | |
| }, | |
| { | |
| "entropy": 0.28908350199460986, | |
| "epoch": 0.15530423701815865, | |
| "grad_norm": 0.5917616486549377, | |
| "learning_rate": 0.0001988126746626819, | |
| "loss": 0.2879753112792969, | |
| "mean_token_accuracy": 0.9093427962064743, | |
| "num_tokens": 303701551.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 0.28460383400321004, | |
| "epoch": 0.1572953169799299, | |
| "grad_norm": 0.6134833693504333, | |
| "learning_rate": 0.00019876262221930544, | |
| "loss": 0.2821200752258301, | |
| "mean_token_accuracy": 0.9112467098236084, | |
| "num_tokens": 307464728.0, | |
| "step": 3950 | |
| }, | |
| { | |
| "entropy": 0.2812545415759087, | |
| "epoch": 0.15928639694170119, | |
| "grad_norm": 0.741555392742157, | |
| "learning_rate": 0.00019871154301125802, | |
| "loss": 0.28286741256713865, | |
| "mean_token_accuracy": 0.9115043008327484, | |
| "num_tokens": 311352582.0, | |
| "step": 4000 | |
| }, | |
| { | |
| "entropy": 0.29000384598970413, | |
| "epoch": 0.16127747690347244, | |
| "grad_norm": 0.5392553210258484, | |
| "learning_rate": 0.00019865943756957385, | |
| "loss": 0.2881851005554199, | |
| "mean_token_accuracy": 0.9097525632381439, | |
| "num_tokens": 315178809.0, | |
| "step": 4050 | |
| }, | |
| { | |
| "entropy": 0.2849612885713577, | |
| "epoch": 0.16326855686524372, | |
| "grad_norm": 0.6325093507766724, | |
| "learning_rate": 0.0001986063064359561, | |
| "loss": 0.28987804412841794, | |
| "mean_token_accuracy": 0.9114274823665619, | |
| "num_tokens": 319128941.0, | |
| "step": 4100 | |
| }, | |
| { | |
| "entropy": 0.28891856864094734, | |
| "epoch": 0.16525963682701497, | |
| "grad_norm": 0.6090471744537354, | |
| "learning_rate": 0.0001985521501627713, | |
| "loss": 0.2873344421386719, | |
| "mean_token_accuracy": 0.9105158835649491, | |
| "num_tokens": 323051101.0, | |
| "step": 4150 | |
| }, | |
| { | |
| "entropy": 0.27601037934422495, | |
| "epoch": 0.16725071678878622, | |
| "grad_norm": 0.5414860844612122, | |
| "learning_rate": 0.0001984969693130437, | |
| "loss": 0.2741785430908203, | |
| "mean_token_accuracy": 0.9122807896137237, | |
| "num_tokens": 327024528.0, | |
| "step": 4200 | |
| }, | |
| { | |
| "entropy": 0.2906373116374016, | |
| "epoch": 0.1692417967505575, | |
| "grad_norm": 1.431944727897644, | |
| "learning_rate": 0.0001984407644604493, | |
| "loss": 0.29466737747192384, | |
| "mean_token_accuracy": 0.9092401885986328, | |
| "num_tokens": 331009920.0, | |
| "step": 4250 | |
| }, | |
| { | |
| "entropy": 0.2901481683552265, | |
| "epoch": 0.17123287671232876, | |
| "grad_norm": 0.6499968767166138, | |
| "learning_rate": 0.0001983835361893099, | |
| "loss": 0.2953326416015625, | |
| "mean_token_accuracy": 0.9093990051746368, | |
| "num_tokens": 334868780.0, | |
| "step": 4300 | |
| }, | |
| { | |
| "entropy": 0.28857042759656903, | |
| "epoch": 0.17322395667410004, | |
| "grad_norm": 0.7128919363021851, | |
| "learning_rate": 0.0001983252850945872, | |
| "loss": 0.28462093353271484, | |
| "mean_token_accuracy": 0.9101207864284515, | |
| "num_tokens": 338781001.0, | |
| "step": 4350 | |
| }, | |
| { | |
| "entropy": 0.2894445453584194, | |
| "epoch": 0.1752150366358713, | |
| "grad_norm": 0.6674997806549072, | |
| "learning_rate": 0.00019826601178187626, | |
| "loss": 0.2883860015869141, | |
| "mean_token_accuracy": 0.9103347849845886, | |
| "num_tokens": 342625321.0, | |
| "step": 4400 | |
| }, | |
| { | |
| "entropy": 0.29015815258026123, | |
| "epoch": 0.17720611659764257, | |
| "grad_norm": 1.1805739402770996, | |
| "learning_rate": 0.00019820571686739955, | |
| "loss": 0.2924055099487305, | |
| "mean_token_accuracy": 0.9087706804275513, | |
| "num_tokens": 346524954.0, | |
| "step": 4450 | |
| }, | |
| { | |
| "entropy": 0.29237871393561365, | |
| "epoch": 0.17919719655941382, | |
| "grad_norm": 0.8005287051200867, | |
| "learning_rate": 0.00019814440097800035, | |
| "loss": 0.2911919403076172, | |
| "mean_token_accuracy": 0.9096369504928589, | |
| "num_tokens": 350433271.0, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.17919719655941382, | |
| "eval_entropy": 0.28920668079739525, | |
| "eval_loss": 0.27546826004981995, | |
| "eval_mean_token_accuracy": 0.909925399318574, | |
| "eval_num_tokens": 350433271.0, | |
| "eval_runtime": 97.8322, | |
| "eval_samples_per_second": 10.222, | |
| "eval_steps_per_second": 0.644, | |
| "step": 4500 | |
| }, | |
| { | |
| "entropy": 0.292726431787014, | |
| "epoch": 0.1811882765211851, | |
| "grad_norm": 0.6807382702827454, | |
| "learning_rate": 0.00019808206475113634, | |
| "loss": 0.2953124809265137, | |
| "mean_token_accuracy": 0.9097322398424148, | |
| "num_tokens": 354258375.0, | |
| "step": 4550 | |
| }, | |
| { | |
| "entropy": 0.29881048142910005, | |
| "epoch": 0.18317935648295636, | |
| "grad_norm": 0.6803342700004578, | |
| "learning_rate": 0.00019801870883487288, | |
| "loss": 0.3002021408081055, | |
| "mean_token_accuracy": 0.9072781252861023, | |
| "num_tokens": 358243758.0, | |
| "step": 4600 | |
| }, | |
| { | |
| "entropy": 0.2855297502875328, | |
| "epoch": 0.1851704364447276, | |
| "grad_norm": 0.7521423101425171, | |
| "learning_rate": 0.00019795433388787633, | |
| "loss": 0.2812104034423828, | |
| "mean_token_accuracy": 0.9116834425926208, | |
| "num_tokens": 362027461.0, | |
| "step": 4650 | |
| }, | |
| { | |
| "entropy": 0.28612853690981865, | |
| "epoch": 0.1871615164064989, | |
| "grad_norm": 0.751583993434906, | |
| "learning_rate": 0.00019788894057940715, | |
| "loss": 0.2890420913696289, | |
| "mean_token_accuracy": 0.9100965994596482, | |
| "num_tokens": 365914009.0, | |
| "step": 4700 | |
| }, | |
| { | |
| "entropy": 0.291155586540699, | |
| "epoch": 0.18915259636827014, | |
| "grad_norm": 0.6980162858963013, | |
| "learning_rate": 0.00019782252958931305, | |
| "loss": 0.29225175857543945, | |
| "mean_token_accuracy": 0.9092732155323029, | |
| "num_tokens": 369831495.0, | |
| "step": 4750 | |
| }, | |
| { | |
| "entropy": 0.3040496847033501, | |
| "epoch": 0.19114367633004142, | |
| "grad_norm": 2.299229145050049, | |
| "learning_rate": 0.0001977551016080218, | |
| "loss": 0.3051426887512207, | |
| "mean_token_accuracy": 0.9069945514202118, | |
| "num_tokens": 373643390.0, | |
| "step": 4800 | |
| }, | |
| { | |
| "entropy": 0.30234193950891497, | |
| "epoch": 0.19313475629181268, | |
| "grad_norm": 12.250136375427246, | |
| "learning_rate": 0.00019768665733653414, | |
| "loss": 0.2970439910888672, | |
| "mean_token_accuracy": 0.907816288471222, | |
| "num_tokens": 377532130.0, | |
| "step": 4850 | |
| }, | |
| { | |
| "entropy": 0.3253930774331093, | |
| "epoch": 0.19512583625358396, | |
| "grad_norm": 602.9488525390625, | |
| "learning_rate": 0.0001976171974864164, | |
| "loss": 0.3245069122314453, | |
| "mean_token_accuracy": 0.9026554811000824, | |
| "num_tokens": 381481906.0, | |
| "step": 4900 | |
| }, | |
| { | |
| "entropy": 0.43629378005862235, | |
| "epoch": 0.1971169162153552, | |
| "grad_norm": 9.55897045135498, | |
| "learning_rate": 0.00019754672277979323, | |
| "loss": 0.503008041381836, | |
| "mean_token_accuracy": 0.8766559469699859, | |
| "num_tokens": 385427117.0, | |
| "step": 4950 | |
| }, | |
| { | |
| "entropy": 1.2075729909539223, | |
| "epoch": 0.19910799617712646, | |
| "grad_norm": 10.384903907775879, | |
| "learning_rate": 0.00019747523394933992, | |
| "loss": 1.4099630737304687, | |
| "mean_token_accuracy": 0.760298758149147, | |
| "num_tokens": 389336381.0, | |
| "step": 5000 | |
| }, | |
| { | |
| "entropy": 4.1178853380680085, | |
| "epoch": 0.20109907613889774, | |
| "grad_norm": 13.629193305969238, | |
| "learning_rate": 0.00019740273173827499, | |
| "loss": 5.369188232421875, | |
| "mean_token_accuracy": 0.2704500517481938, | |
| "num_tokens": 393303618.0, | |
| "step": 5050 | |
| }, | |
| { | |
| "entropy": 2.060445339679718, | |
| "epoch": 0.203090156100669, | |
| "grad_norm": 16.477094650268555, | |
| "learning_rate": 0.0001973292169003523, | |
| "loss": 2.518390808105469, | |
| "mean_token_accuracy": 0.6017715675383806, | |
| "num_tokens": 397093081.0, | |
| "step": 5100 | |
| }, | |
| { | |
| "entropy": 0.7607585701346398, | |
| "epoch": 0.20508123606244028, | |
| "grad_norm": 153.88894653320312, | |
| "learning_rate": 0.00019725469019985333, | |
| "loss": 0.813140869140625, | |
| "mean_token_accuracy": 0.8155078822374344, | |
| "num_tokens": 400936352.0, | |
| "step": 5150 | |
| }, | |
| { | |
| "entropy": 0.9180069261789322, | |
| "epoch": 0.20707231602421153, | |
| "grad_norm": 2.9457428455352783, | |
| "learning_rate": 0.00019717915241157903, | |
| "loss": 0.9284542846679688, | |
| "mean_token_accuracy": 0.7885740977525711, | |
| "num_tokens": 404917718.0, | |
| "step": 5200 | |
| }, | |
| { | |
| "entropy": 0.3624985629320145, | |
| "epoch": 0.2090633959859828, | |
| "grad_norm": 0.9943515658378601, | |
| "learning_rate": 0.00019710260432084206, | |
| "loss": 0.35674095153808594, | |
| "mean_token_accuracy": 0.896698716878891, | |
| "num_tokens": 408859179.0, | |
| "step": 5250 | |
| }, | |
| { | |
| "entropy": 0.9530950874090195, | |
| "epoch": 0.21105447594775406, | |
| "grad_norm": 1371642.5, | |
| "learning_rate": 0.00019702504672345844, | |
| "loss": 0.9454847717285156, | |
| "mean_token_accuracy": 0.7871760299801827, | |
| "num_tokens": 412673154.0, | |
| "step": 5300 | |
| }, | |
| { | |
| "entropy": 1.998653382062912, | |
| "epoch": 0.2130455559095253, | |
| "grad_norm": 31218.666015625, | |
| "learning_rate": 0.0001969464804257393, | |
| "loss": 2.0618492126464845, | |
| "mean_token_accuracy": 0.6287000980228186, | |
| "num_tokens": 416647839.0, | |
| "step": 5350 | |
| }, | |
| { | |
| "entropy": 0.7908964619040489, | |
| "epoch": 0.2150366358712966, | |
| "grad_norm": 274.27215576171875, | |
| "learning_rate": 0.00019686690624448242, | |
| "loss": 0.7396269226074219, | |
| "mean_token_accuracy": 0.8199971842765809, | |
| "num_tokens": 420594394.0, | |
| "step": 5400 | |
| }, | |
| { | |
| "entropy": 0.49078064411878586, | |
| "epoch": 0.21702771583306785, | |
| "grad_norm": 937.0590209960938, | |
| "learning_rate": 0.000196786325006964, | |
| "loss": 0.48082077026367187, | |
| "mean_token_accuracy": 0.8696271818876267, | |
| "num_tokens": 424562376.0, | |
| "step": 5450 | |
| }, | |
| { | |
| "entropy": 0.5351789909601211, | |
| "epoch": 0.21901879579483913, | |
| "grad_norm": 2242.97705078125, | |
| "learning_rate": 0.0001967047375509298, | |
| "loss": 0.5486760711669922, | |
| "mean_token_accuracy": 0.857095856666565, | |
| "num_tokens": 428515673.0, | |
| "step": 5500 | |
| }, | |
| { | |
| "entropy": 0.426470011472702, | |
| "epoch": 0.22100987575661038, | |
| "grad_norm": 659.4993896484375, | |
| "learning_rate": 0.00019662214472458646, | |
| "loss": 0.4073149490356445, | |
| "mean_token_accuracy": 0.8857790929079056, | |
| "num_tokens": 432280329.0, | |
| "step": 5550 | |
| }, | |
| { | |
| "entropy": 0.7251139760017395, | |
| "epoch": 0.22300095571838166, | |
| "grad_norm": 282.25775146484375, | |
| "learning_rate": 0.00019653854738659282, | |
| "loss": 0.7429944610595703, | |
| "mean_token_accuracy": 0.8232876443862915, | |
| "num_tokens": 436242118.0, | |
| "step": 5600 | |
| }, | |
| { | |
| "entropy": 0.3698262667655945, | |
| "epoch": 0.2249920356801529, | |
| "grad_norm": 12.503119468688965, | |
| "learning_rate": 0.00019645394640605086, | |
| "loss": 0.3565479278564453, | |
| "mean_token_accuracy": 0.8944947463274002, | |
| "num_tokens": 440146433.0, | |
| "step": 5650 | |
| }, | |
| { | |
| "entropy": 0.40973065614700316, | |
| "epoch": 0.2269831156419242, | |
| "grad_norm": 1084.4339599609375, | |
| "learning_rate": 0.0001963683426624968, | |
| "loss": 0.3894519805908203, | |
| "mean_token_accuracy": 0.8877280789613724, | |
| "num_tokens": 443964090.0, | |
| "step": 5700 | |
| }, | |
| { | |
| "entropy": 0.35581542521715165, | |
| "epoch": 0.22897419560369545, | |
| "grad_norm": 16.15648651123047, | |
| "learning_rate": 0.0001962817370458918, | |
| "loss": 0.33966888427734376, | |
| "mean_token_accuracy": 0.8968688982725144, | |
| "num_tokens": 448011349.0, | |
| "step": 5750 | |
| }, | |
| { | |
| "entropy": 0.3509592401981354, | |
| "epoch": 0.2309652755654667, | |
| "grad_norm": 6.693056106567383, | |
| "learning_rate": 0.00019619413045661276, | |
| "loss": 0.34591773986816404, | |
| "mean_token_accuracy": 0.8965184450149536, | |
| "num_tokens": 451928063.0, | |
| "step": 5800 | |
| }, | |
| { | |
| "entropy": 0.36452227845788004, | |
| "epoch": 0.23295635552723798, | |
| "grad_norm": 5.892772674560547, | |
| "learning_rate": 0.00019610552380544305, | |
| "loss": 0.36557510375976565, | |
| "mean_token_accuracy": 0.8949929642677307, | |
| "num_tokens": 455889435.0, | |
| "step": 5850 | |
| }, | |
| { | |
| "entropy": 0.4062237656116486, | |
| "epoch": 0.23494743548900923, | |
| "grad_norm": 381.70843505859375, | |
| "learning_rate": 0.00019601591801356297, | |
| "loss": 0.39245895385742186, | |
| "mean_token_accuracy": 0.8865513950586319, | |
| "num_tokens": 459661149.0, | |
| "step": 5900 | |
| }, | |
| { | |
| "entropy": 1.057219158411026, | |
| "epoch": 0.2369385154507805, | |
| "grad_norm": 11522.1162109375, | |
| "learning_rate": 0.00019592531401254007, | |
| "loss": 1.5552653503417968, | |
| "mean_token_accuracy": 0.7360941077768802, | |
| "num_tokens": 463672650.0, | |
| "step": 5950 | |
| }, | |
| { | |
| "entropy": 0.666157491505146, | |
| "epoch": 0.23892959541255177, | |
| "grad_norm": 200332.671875, | |
| "learning_rate": 0.00019583371274431972, | |
| "loss": 0.6437340545654296, | |
| "mean_token_accuracy": 0.8398592573404312, | |
| "num_tokens": 467497899.0, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.23892959541255177, | |
| "eval_entropy": 0.9302403725801952, | |
| "eval_loss": 0.9569904804229736, | |
| "eval_mean_token_accuracy": 0.7763322539745815, | |
| "eval_num_tokens": 467497899.0, | |
| "eval_runtime": 97.7568, | |
| "eval_samples_per_second": 10.229, | |
| "eval_steps_per_second": 0.644, | |
| "step": 6000 | |
| }, | |
| { | |
| "entropy": 2.966293410360813, | |
| "epoch": 0.24092067537432305, | |
| "grad_norm": 501369.0, | |
| "learning_rate": 0.00019574111516121502, | |
| "loss": 6.155978393554688, | |
| "mean_token_accuracy": 0.2130392006225884, | |
| "num_tokens": 471444277.0, | |
| "step": 6050 | |
| }, | |
| { | |
| "entropy": 5.9350907564163204, | |
| "epoch": 0.2429117553360943, | |
| "grad_norm": 6855.62939453125, | |
| "learning_rate": 0.0001956475222258972, | |
| "loss": 5.958920288085937, | |
| "mean_token_accuracy": 0.11675349000841378, | |
| "num_tokens": 475364729.0, | |
| "step": 6100 | |
| }, | |
| { | |
| "entropy": 5.5845241355896, | |
| "epoch": 0.24490283529786555, | |
| "grad_norm": 44784.75, | |
| "learning_rate": 0.00019555293491138527, | |
| "loss": 5.494525146484375, | |
| "mean_token_accuracy": 0.16664834439754486, | |
| "num_tokens": 479140786.0, | |
| "step": 6150 | |
| }, | |
| { | |
| "entropy": 5.335302751064301, | |
| "epoch": 0.24689391525963683, | |
| "grad_norm": 52592.01953125, | |
| "learning_rate": 0.00019545735420103632, | |
| "loss": 5.037943725585937, | |
| "mean_token_accuracy": 0.20628853604197503, | |
| "num_tokens": 483031362.0, | |
| "step": 6200 | |
| }, | |
| { | |
| "entropy": 4.4165141177177425, | |
| "epoch": 0.24888499522140808, | |
| "grad_norm": 310.85443115234375, | |
| "learning_rate": 0.0001953607810885349, | |
| "loss": 4.302553100585937, | |
| "mean_token_accuracy": 0.3041644987463951, | |
| "num_tokens": 486844277.0, | |
| "step": 6250 | |
| }, | |
| { | |
| "entropy": 2.018350040316582, | |
| "epoch": 0.25087607518317934, | |
| "grad_norm": 35.01002883911133, | |
| "learning_rate": 0.00019526321657788284, | |
| "loss": 1.953983612060547, | |
| "mean_token_accuracy": 0.6572630336880684, | |
| "num_tokens": 490907642.0, | |
| "step": 6300 | |
| }, | |
| { | |
| "entropy": 0.8694989970326423, | |
| "epoch": 0.2528671551449506, | |
| "grad_norm": 5267.51171875, | |
| "learning_rate": 0.000195164661683389, | |
| "loss": 0.8423341369628906, | |
| "mean_token_accuracy": 0.8066436392068863, | |
| "num_tokens": 494826463.0, | |
| "step": 6350 | |
| }, | |
| { | |
| "entropy": 1.5338060796260833, | |
| "epoch": 0.2548582351067219, | |
| "grad_norm": 48.75986099243164, | |
| "learning_rate": 0.0001950651174296584, | |
| "loss": 1.5342300415039063, | |
| "mean_token_accuracy": 0.7021114355325699, | |
| "num_tokens": 498718456.0, | |
| "step": 6400 | |
| }, | |
| { | |
| "entropy": 0.481953441798687, | |
| "epoch": 0.2568493150684932, | |
| "grad_norm": 11.493451118469238, | |
| "learning_rate": 0.0001949645848515818, | |
| "loss": 0.4798401641845703, | |
| "mean_token_accuracy": 0.8721405351161957, | |
| "num_tokens": 502656552.0, | |
| "step": 6450 | |
| }, | |
| { | |
| "entropy": 0.3813651466369629, | |
| "epoch": 0.2588403950302644, | |
| "grad_norm": 3.466660499572754, | |
| "learning_rate": 0.00019486306499432482, | |
| "loss": 0.3856293487548828, | |
| "mean_token_accuracy": 0.890442590713501, | |
| "num_tokens": 506485211.0, | |
| "step": 6500 | |
| }, | |
| { | |
| "entropy": 0.40147233694791795, | |
| "epoch": 0.2608314749920357, | |
| "grad_norm": 40.556732177734375, | |
| "learning_rate": 0.00019476055891331714, | |
| "loss": 0.41530418395996094, | |
| "mean_token_accuracy": 0.8841481399536133, | |
| "num_tokens": 510331860.0, | |
| "step": 6550 | |
| }, | |
| { | |
| "entropy": 0.362121434956789, | |
| "epoch": 0.26282255495380696, | |
| "grad_norm": 2307.35986328125, | |
| "learning_rate": 0.0001946570676742415, | |
| "loss": 0.3579364013671875, | |
| "mean_token_accuracy": 0.8953806155920029, | |
| "num_tokens": 514145400.0, | |
| "step": 6600 | |
| }, | |
| { | |
| "entropy": 0.37644080132246016, | |
| "epoch": 0.2648136349155782, | |
| "grad_norm": 9.581275939941406, | |
| "learning_rate": 0.0001945525923530227, | |
| "loss": 0.36162376403808594, | |
| "mean_token_accuracy": 0.8937028670310974, | |
| "num_tokens": 517942120.0, | |
| "step": 6650 | |
| }, | |
| { | |
| "entropy": 0.35380700886249544, | |
| "epoch": 0.26680471487734947, | |
| "grad_norm": 1.5564302206039429, | |
| "learning_rate": 0.00019444713403581618, | |
| "loss": 0.35733158111572266, | |
| "mean_token_accuracy": 0.8964051580429078, | |
| "num_tokens": 521893159.0, | |
| "step": 6700 | |
| }, | |
| { | |
| "entropy": 0.37363972336053847, | |
| "epoch": 0.26879579483912075, | |
| "grad_norm": 1.5304275751113892, | |
| "learning_rate": 0.00019434069381899706, | |
| "loss": 0.37166786193847656, | |
| "mean_token_accuracy": 0.8930052673816681, | |
| "num_tokens": 525839647.0, | |
| "step": 6750 | |
| }, | |
| { | |
| "entropy": 0.38540501803159716, | |
| "epoch": 0.27078687480089203, | |
| "grad_norm": 2.896862745285034, | |
| "learning_rate": 0.00019423327280914844, | |
| "loss": 0.3824498748779297, | |
| "mean_token_accuracy": 0.8903352475166321, | |
| "num_tokens": 529639037.0, | |
| "step": 6800 | |
| }, | |
| { | |
| "entropy": 0.36461210548877715, | |
| "epoch": 0.27277795476266326, | |
| "grad_norm": 1.4935225248336792, | |
| "learning_rate": 0.00019412487212305013, | |
| "loss": 0.36563232421875, | |
| "mean_token_accuracy": 0.8926044535636902, | |
| "num_tokens": 533576552.0, | |
| "step": 6850 | |
| }, | |
| { | |
| "entropy": 0.36362177550792696, | |
| "epoch": 0.27476903472443454, | |
| "grad_norm": 17.895999908447266, | |
| "learning_rate": 0.00019401549288766687, | |
| "loss": 0.3659773635864258, | |
| "mean_token_accuracy": 0.8953115308284759, | |
| "num_tokens": 537490959.0, | |
| "step": 6900 | |
| }, | |
| { | |
| "entropy": 0.3655336833000183, | |
| "epoch": 0.2767601146862058, | |
| "grad_norm": 5.626742839813232, | |
| "learning_rate": 0.00019390513624013668, | |
| "loss": 0.36942741394042966, | |
| "mean_token_accuracy": 0.894575121998787, | |
| "num_tokens": 541390561.0, | |
| "step": 6950 | |
| }, | |
| { | |
| "entropy": 0.35650448843836785, | |
| "epoch": 0.27875119464797704, | |
| "grad_norm": 96.78727722167969, | |
| "learning_rate": 0.0001937938033277591, | |
| "loss": 0.3513477325439453, | |
| "mean_token_accuracy": 0.8967016339302063, | |
| "num_tokens": 545281049.0, | |
| "step": 7000 | |
| }, | |
| { | |
| "entropy": 0.35293409407138826, | |
| "epoch": 0.2807422746097483, | |
| "grad_norm": 2.599032402038574, | |
| "learning_rate": 0.00019368149530798312, | |
| "loss": 0.3563782501220703, | |
| "mean_token_accuracy": 0.8972502571344375, | |
| "num_tokens": 549276429.0, | |
| "step": 7050 | |
| }, | |
| { | |
| "entropy": 0.35024922251701357, | |
| "epoch": 0.2827333545715196, | |
| "grad_norm": 0.8024204969406128, | |
| "learning_rate": 0.0001935682133483953, | |
| "loss": 0.34738357543945314, | |
| "mean_token_accuracy": 0.8967534548044205, | |
| "num_tokens": 553205921.0, | |
| "step": 7100 | |
| }, | |
| { | |
| "entropy": 0.3569410502910614, | |
| "epoch": 0.2847244345332909, | |
| "grad_norm": 1.7590816020965576, | |
| "learning_rate": 0.0001934539586267075, | |
| "loss": 0.3522836685180664, | |
| "mean_token_accuracy": 0.8969353812932969, | |
| "num_tokens": 557069513.0, | |
| "step": 7150 | |
| }, | |
| { | |
| "entropy": 0.3849373859167099, | |
| "epoch": 0.2867155144950621, | |
| "grad_norm": 46.36662292480469, | |
| "learning_rate": 0.00019333873233074472, | |
| "loss": 0.39945281982421876, | |
| "mean_token_accuracy": 0.8912153190374374, | |
| "num_tokens": 560866827.0, | |
| "step": 7200 | |
| }, | |
| { | |
| "entropy": 0.40855299681425095, | |
| "epoch": 0.2887065944568334, | |
| "grad_norm": 9.179975509643555, | |
| "learning_rate": 0.0001932225356584327, | |
| "loss": 0.42264102935791015, | |
| "mean_token_accuracy": 0.8837257975339889, | |
| "num_tokens": 564787263.0, | |
| "step": 7250 | |
| }, | |
| { | |
| "entropy": 0.37339140236377716, | |
| "epoch": 0.29069767441860467, | |
| "grad_norm": 1.1612548828125, | |
| "learning_rate": 0.0001931053698177856, | |
| "loss": 0.3683134841918945, | |
| "mean_token_accuracy": 0.8944310307502746, | |
| "num_tokens": 568512960.0, | |
| "step": 7300 | |
| }, | |
| { | |
| "entropy": 0.3807790431380272, | |
| "epoch": 0.2926887543803759, | |
| "grad_norm": 1.9693306684494019, | |
| "learning_rate": 0.00019298723602689317, | |
| "loss": 0.3835409545898438, | |
| "mean_token_accuracy": 0.8914188152551651, | |
| "num_tokens": 572379891.0, | |
| "step": 7350 | |
| }, | |
| { | |
| "entropy": 0.37928400114178656, | |
| "epoch": 0.2946798343421472, | |
| "grad_norm": 1.244362235069275, | |
| "learning_rate": 0.00019286813551390837, | |
| "loss": 0.380733757019043, | |
| "mean_token_accuracy": 0.8911453211307525, | |
| "num_tokens": 576081528.0, | |
| "step": 7400 | |
| }, | |
| { | |
| "entropy": 0.3649085074663162, | |
| "epoch": 0.29667091430391845, | |
| "grad_norm": 0.8187659978866577, | |
| "learning_rate": 0.00019274806951703445, | |
| "loss": 0.3639445495605469, | |
| "mean_token_accuracy": 0.894467893242836, | |
| "num_tokens": 579946103.0, | |
| "step": 7450 | |
| }, | |
| { | |
| "entropy": 0.36849416941404345, | |
| "epoch": 0.29866199426568973, | |
| "grad_norm": 1.0430868864059448, | |
| "learning_rate": 0.00019262703928451207, | |
| "loss": 0.3664413833618164, | |
| "mean_token_accuracy": 0.8947416061162948, | |
| "num_tokens": 583781528.0, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.29866199426568973, | |
| "eval_entropy": 0.34230647933861563, | |
| "eval_loss": 0.3402383327484131, | |
| "eval_mean_token_accuracy": 0.8959205642579093, | |
| "eval_num_tokens": 583781528.0, | |
| "eval_runtime": 97.7872, | |
| "eval_samples_per_second": 10.226, | |
| "eval_steps_per_second": 0.644, | |
| "step": 7500 | |
| }, | |
| { | |
| "entropy": 0.37259786248207094, | |
| "epoch": 0.30065307422746096, | |
| "grad_norm": 0.8896583914756775, | |
| "learning_rate": 0.0001925050460746064, | |
| "loss": 0.3731904602050781, | |
| "mean_token_accuracy": 0.8927891421318054, | |
| "num_tokens": 587722557.0, | |
| "step": 7550 | |
| }, | |
| { | |
| "entropy": 0.37399895280599593, | |
| "epoch": 0.30264415418923224, | |
| "grad_norm": 1.1005648374557495, | |
| "learning_rate": 0.000192382091155594, | |
| "loss": 0.37042266845703126, | |
| "mean_token_accuracy": 0.8932842481136322, | |
| "num_tokens": 591520045.0, | |
| "step": 7600 | |
| }, | |
| { | |
| "entropy": 0.3673844130337238, | |
| "epoch": 0.3046352341510035, | |
| "grad_norm": 1.466604232788086, | |
| "learning_rate": 0.00019225817580574965, | |
| "loss": 0.3599439239501953, | |
| "mean_token_accuracy": 0.8947141844034195, | |
| "num_tokens": 595316335.0, | |
| "step": 7650 | |
| }, | |
| { | |
| "entropy": 0.36627118915319445, | |
| "epoch": 0.30662631411277474, | |
| "grad_norm": 1.2781370878219604, | |
| "learning_rate": 0.000192133301313333, | |
| "loss": 0.3659734344482422, | |
| "mean_token_accuracy": 0.8943902653455734, | |
| "num_tokens": 599157999.0, | |
| "step": 7700 | |
| }, | |
| { | |
| "entropy": 0.35352533668279645, | |
| "epoch": 0.308617394074546, | |
| "grad_norm": 1.158922791481018, | |
| "learning_rate": 0.0001920074689765752, | |
| "loss": 0.3468752670288086, | |
| "mean_token_accuracy": 0.8980030977725982, | |
| "num_tokens": 603082301.0, | |
| "step": 7750 | |
| }, | |
| { | |
| "entropy": 0.34789875760674477, | |
| "epoch": 0.3106084740363173, | |
| "grad_norm": 0.880212128162384, | |
| "learning_rate": 0.00019188068010366554, | |
| "loss": 0.34264190673828127, | |
| "mean_token_accuracy": 0.8996097964048385, | |
| "num_tokens": 607008342.0, | |
| "step": 7800 | |
| }, | |
| { | |
| "entropy": 0.34500489801168444, | |
| "epoch": 0.3125995539980886, | |
| "grad_norm": 14.691442489624023, | |
| "learning_rate": 0.00019175293601273764, | |
| "loss": 0.34683135986328123, | |
| "mean_token_accuracy": 0.8989066386222839, | |
| "num_tokens": 610911357.0, | |
| "step": 7850 | |
| }, | |
| { | |
| "entropy": 0.35687451854348184, | |
| "epoch": 0.3145906339598598, | |
| "grad_norm": 1.848387360572815, | |
| "learning_rate": 0.00019162423803185588, | |
| "loss": 0.35826019287109373, | |
| "mean_token_accuracy": 0.8975167566537857, | |
| "num_tokens": 614717230.0, | |
| "step": 7900 | |
| }, | |
| { | |
| "entropy": 0.35088829398155214, | |
| "epoch": 0.3165817139216311, | |
| "grad_norm": 0.8692337274551392, | |
| "learning_rate": 0.00019149458749900152, | |
| "loss": 0.34867095947265625, | |
| "mean_token_accuracy": 0.8979580408334732, | |
| "num_tokens": 618525149.0, | |
| "step": 7950 | |
| }, | |
| { | |
| "entropy": 0.3300197960436344, | |
| "epoch": 0.31857279388340237, | |
| "grad_norm": 2.092395782470703, | |
| "learning_rate": 0.00019136398576205887, | |
| "loss": 0.3315239334106445, | |
| "mean_token_accuracy": 0.9027900397777557, | |
| "num_tokens": 622547718.0, | |
| "step": 8000 | |
| }, | |
| { | |
| "entropy": 0.3332029429078102, | |
| "epoch": 0.3205638738451736, | |
| "grad_norm": 1.8703268766403198, | |
| "learning_rate": 0.0001912324341788012, | |
| "loss": 0.3339826202392578, | |
| "mean_token_accuracy": 0.9025326895713807, | |
| "num_tokens": 626427568.0, | |
| "step": 8050 | |
| }, | |
| { | |
| "entropy": 0.33984847337007523, | |
| "epoch": 0.3225549538069449, | |
| "grad_norm": 1.5212745666503906, | |
| "learning_rate": 0.00019109993411687664, | |
| "loss": 0.33795059204101563, | |
| "mean_token_accuracy": 0.9009978342056274, | |
| "num_tokens": 630210962.0, | |
| "step": 8100 | |
| }, | |
| { | |
| "entropy": 0.3363041001558304, | |
| "epoch": 0.32454603376871616, | |
| "grad_norm": 1.234013319015503, | |
| "learning_rate": 0.0001909664869537941, | |
| "loss": 0.3278226470947266, | |
| "mean_token_accuracy": 0.9014317804574966, | |
| "num_tokens": 634125543.0, | |
| "step": 8150 | |
| }, | |
| { | |
| "entropy": 0.3360677129030228, | |
| "epoch": 0.32653711373048744, | |
| "grad_norm": 1.0590438842773438, | |
| "learning_rate": 0.0001908320940769086, | |
| "loss": 0.3332764434814453, | |
| "mean_token_accuracy": 0.9014078599214553, | |
| "num_tokens": 637941773.0, | |
| "step": 8200 | |
| }, | |
| { | |
| "entropy": 0.34391440004110335, | |
| "epoch": 0.32852819369225866, | |
| "grad_norm": 0.9203246235847473, | |
| "learning_rate": 0.00019069675688340726, | |
| "loss": 0.340236701965332, | |
| "mean_token_accuracy": 0.898968591094017, | |
| "num_tokens": 641798240.0, | |
| "step": 8250 | |
| }, | |
| { | |
| "entropy": 0.34178978830575946, | |
| "epoch": 0.33051927365402994, | |
| "grad_norm": 0.9042324423789978, | |
| "learning_rate": 0.00019056047678029457, | |
| "loss": 0.33527900695800783, | |
| "mean_token_accuracy": 0.9003325819969177, | |
| "num_tokens": 645536522.0, | |
| "step": 8300 | |
| }, | |
| { | |
| "entropy": 0.3407294301688671, | |
| "epoch": 0.3325103536158012, | |
| "grad_norm": 1.2946654558181763, | |
| "learning_rate": 0.00019042325518437767, | |
| "loss": 0.33740230560302736, | |
| "mean_token_accuracy": 0.8995247167348862, | |
| "num_tokens": 649471189.0, | |
| "step": 8350 | |
| }, | |
| { | |
| "entropy": 0.34715739250183103, | |
| "epoch": 0.33450143357757245, | |
| "grad_norm": 2.5181047916412354, | |
| "learning_rate": 0.00019028509352225184, | |
| "loss": 0.34464599609375, | |
| "mean_token_accuracy": 0.8989213883876801, | |
| "num_tokens": 653419486.0, | |
| "step": 8400 | |
| }, | |
| { | |
| "entropy": 0.34275659039616585, | |
| "epoch": 0.33649251353934373, | |
| "grad_norm": 2.0157740116119385, | |
| "learning_rate": 0.0001901459932302855, | |
| "loss": 0.3392407989501953, | |
| "mean_token_accuracy": 0.8996652096509934, | |
| "num_tokens": 657395348.0, | |
| "step": 8450 | |
| }, | |
| { | |
| "entropy": 0.3413443921506405, | |
| "epoch": 0.338483593501115, | |
| "grad_norm": 1.2651079893112183, | |
| "learning_rate": 0.00019000595575460538, | |
| "loss": 0.3354787826538086, | |
| "mean_token_accuracy": 0.8999969434738159, | |
| "num_tokens": 661309063.0, | |
| "step": 8500 | |
| }, | |
| { | |
| "entropy": 0.3259673485159874, | |
| "epoch": 0.3404746734628863, | |
| "grad_norm": 3.185722827911377, | |
| "learning_rate": 0.0001898649825510814, | |
| "loss": 0.32872161865234373, | |
| "mean_token_accuracy": 0.9023973035812378, | |
| "num_tokens": 665351968.0, | |
| "step": 8550 | |
| }, | |
| { | |
| "entropy": 0.32777484819293023, | |
| "epoch": 0.3424657534246575, | |
| "grad_norm": 1.12962806224823, | |
| "learning_rate": 0.00018972307508531157, | |
| "loss": 0.32322891235351564, | |
| "mean_token_accuracy": 0.9025442850589752, | |
| "num_tokens": 669185049.0, | |
| "step": 8600 | |
| }, | |
| { | |
| "entropy": 0.3300194789469242, | |
| "epoch": 0.3444568333864288, | |
| "grad_norm": 1.0274972915649414, | |
| "learning_rate": 0.00018958023483260685, | |
| "loss": 0.3235230255126953, | |
| "mean_token_accuracy": 0.9018253254890441, | |
| "num_tokens": 673207624.0, | |
| "step": 8650 | |
| }, | |
| { | |
| "entropy": 0.32774477630853655, | |
| "epoch": 0.3464479133482001, | |
| "grad_norm": 7.125645160675049, | |
| "learning_rate": 0.00018943646327797563, | |
| "loss": 0.32126655578613283, | |
| "mean_token_accuracy": 0.9035478168725968, | |
| "num_tokens": 677078148.0, | |
| "step": 8700 | |
| }, | |
| { | |
| "entropy": 0.32380919888615606, | |
| "epoch": 0.3484389933099713, | |
| "grad_norm": 3.365225076675415, | |
| "learning_rate": 0.00018929176191610834, | |
| "loss": 0.327957763671875, | |
| "mean_token_accuracy": 0.9035161393880844, | |
| "num_tokens": 681086478.0, | |
| "step": 8750 | |
| }, | |
| { | |
| "entropy": 0.33227564081549643, | |
| "epoch": 0.3504300732717426, | |
| "grad_norm": 1.3480267524719238, | |
| "learning_rate": 0.00018914613225136208, | |
| "loss": 0.32949310302734375, | |
| "mean_token_accuracy": 0.9014780944585801, | |
| "num_tokens": 684932957.0, | |
| "step": 8800 | |
| }, | |
| { | |
| "entropy": 0.3357052344083786, | |
| "epoch": 0.35242115323351386, | |
| "grad_norm": 1.2543643712997437, | |
| "learning_rate": 0.00018899957579774482, | |
| "loss": 0.3339249038696289, | |
| "mean_token_accuracy": 0.90175577044487, | |
| "num_tokens": 688754691.0, | |
| "step": 8850 | |
| }, | |
| { | |
| "entropy": 0.32843308195471765, | |
| "epoch": 0.35441223319528514, | |
| "grad_norm": 1.2409096956253052, | |
| "learning_rate": 0.00018885209407889963, | |
| "loss": 0.32397491455078126, | |
| "mean_token_accuracy": 0.9031638616323471, | |
| "num_tokens": 692624575.0, | |
| "step": 8900 | |
| }, | |
| { | |
| "entropy": 0.33613822489976886, | |
| "epoch": 0.35640331315705637, | |
| "grad_norm": 0.8692443370819092, | |
| "learning_rate": 0.00018870368862808893, | |
| "loss": 0.3323232650756836, | |
| "mean_token_accuracy": 0.9011309146881104, | |
| "num_tokens": 696555101.0, | |
| "step": 8950 | |
| }, | |
| { | |
| "entropy": 0.3358862918615341, | |
| "epoch": 0.35839439311882765, | |
| "grad_norm": 0.9862300753593445, | |
| "learning_rate": 0.0001885543609881786, | |
| "loss": 0.3345521926879883, | |
| "mean_token_accuracy": 0.9014543277025223, | |
| "num_tokens": 700464446.0, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.35839439311882765, | |
| "eval_entropy": 0.3540645409671087, | |
| "eval_loss": 0.3069337010383606, | |
| "eval_mean_token_accuracy": 0.9003797656013852, | |
| "eval_num_tokens": 700464446.0, | |
| "eval_runtime": 97.6772, | |
| "eval_samples_per_second": 10.238, | |
| "eval_steps_per_second": 0.645, | |
| "step": 9000 | |
| }, | |
| { | |
| "entropy": 0.3317222049832344, | |
| "epoch": 0.36038547308059893, | |
| "grad_norm": 1.0164847373962402, | |
| "learning_rate": 0.00018840411271162175, | |
| "loss": 0.32544532775878904, | |
| "mean_token_accuracy": 0.9019567215442658, | |
| "num_tokens": 704486622.0, | |
| "step": 9050 | |
| }, | |
| { | |
| "entropy": 0.3411662185192108, | |
| "epoch": 0.3623765530423702, | |
| "grad_norm": 2.0326812267303467, | |
| "learning_rate": 0.00018825294536044279, | |
| "loss": 0.3403163909912109, | |
| "mean_token_accuracy": 0.900407105088234, | |
| "num_tokens": 708521341.0, | |
| "step": 9100 | |
| }, | |
| { | |
| "entropy": 0.34867027416825297, | |
| "epoch": 0.36436763300414143, | |
| "grad_norm": 5.65775203704834, | |
| "learning_rate": 0.00018810086050622096, | |
| "loss": 0.3441625213623047, | |
| "mean_token_accuracy": 0.898092051744461, | |
| "num_tokens": 712486951.0, | |
| "step": 9150 | |
| }, | |
| { | |
| "entropy": 0.3382836529612541, | |
| "epoch": 0.3663587129659127, | |
| "grad_norm": 3.062307119369507, | |
| "learning_rate": 0.0001879478597300743, | |
| "loss": 0.33507949829101563, | |
| "mean_token_accuracy": 0.900296345949173, | |
| "num_tokens": 716374950.0, | |
| "step": 9200 | |
| }, | |
| { | |
| "entropy": 0.34634460166096687, | |
| "epoch": 0.368349792927684, | |
| "grad_norm": 0.9268959760665894, | |
| "learning_rate": 0.00018779394462264292, | |
| "loss": 0.3423932647705078, | |
| "mean_token_accuracy": 0.9000798559188843, | |
| "num_tokens": 720399611.0, | |
| "step": 9250 | |
| }, | |
| { | |
| "entropy": 0.3209140484035015, | |
| "epoch": 0.3703408728894552, | |
| "grad_norm": 2.2739686965942383, | |
| "learning_rate": 0.00018763911678407262, | |
| "loss": 0.31782310485839843, | |
| "mean_token_accuracy": 0.9058271765708923, | |
| "num_tokens": 724451159.0, | |
| "step": 9300 | |
| }, | |
| { | |
| "entropy": 0.3298003524541855, | |
| "epoch": 0.3723319528512265, | |
| "grad_norm": 1.6039739847183228, | |
| "learning_rate": 0.0001874833778239982, | |
| "loss": 0.3229019546508789, | |
| "mean_token_accuracy": 0.9025483858585358, | |
| "num_tokens": 728314361.0, | |
| "step": 9350 | |
| }, | |
| { | |
| "entropy": 0.32751597940921784, | |
| "epoch": 0.3743230328129978, | |
| "grad_norm": 1.0868877172470093, | |
| "learning_rate": 0.0001873267293615268, | |
| "loss": 0.3307640838623047, | |
| "mean_token_accuracy": 0.9025738561153411, | |
| "num_tokens": 732403704.0, | |
| "step": 9400 | |
| }, | |
| { | |
| "entropy": 0.33524883300065994, | |
| "epoch": 0.37631411277476906, | |
| "grad_norm": 1.4577653408050537, | |
| "learning_rate": 0.00018716917302522088, | |
| "loss": 0.3307836151123047, | |
| "mean_token_accuracy": 0.9017768156528473, | |
| "num_tokens": 736441982.0, | |
| "step": 9450 | |
| }, | |
| { | |
| "entropy": 0.3285181725025177, | |
| "epoch": 0.3783051927365403, | |
| "grad_norm": 2.9845902919769287, | |
| "learning_rate": 0.00018701071045308158, | |
| "loss": 0.33323326110839846, | |
| "mean_token_accuracy": 0.9035674440860748, | |
| "num_tokens": 740646337.0, | |
| "step": 9500 | |
| }, | |
| { | |
| "entropy": 0.3377829885482788, | |
| "epoch": 0.38029627269831157, | |
| "grad_norm": 9.927241325378418, | |
| "learning_rate": 0.0001868513432925314, | |
| "loss": 0.32894989013671877, | |
| "mean_token_accuracy": 0.9022834372520446, | |
| "num_tokens": 744420398.0, | |
| "step": 9550 | |
| }, | |
| { | |
| "entropy": 0.32720001712441443, | |
| "epoch": 0.38228735266008285, | |
| "grad_norm": 13.3615140914917, | |
| "learning_rate": 0.00018669107320039725, | |
| "loss": 0.3185526657104492, | |
| "mean_token_accuracy": 0.9035963034629821, | |
| "num_tokens": 748222636.0, | |
| "step": 9600 | |
| }, | |
| { | |
| "entropy": 0.32563656270504, | |
| "epoch": 0.38427843262185407, | |
| "grad_norm": 1.9300962686538696, | |
| "learning_rate": 0.0001865299018428932, | |
| "loss": 0.32204307556152345, | |
| "mean_token_accuracy": 0.9047492408752441, | |
| "num_tokens": 752252628.0, | |
| "step": 9650 | |
| }, | |
| { | |
| "entropy": 0.3329929667711258, | |
| "epoch": 0.38626951258362535, | |
| "grad_norm": 1.4427231550216675, | |
| "learning_rate": 0.00018636783089560313, | |
| "loss": 0.32571704864501955, | |
| "mean_token_accuracy": 0.903377760052681, | |
| "num_tokens": 756155491.0, | |
| "step": 9700 | |
| }, | |
| { | |
| "entropy": 0.31390463262796403, | |
| "epoch": 0.38826059254539663, | |
| "grad_norm": 2.628187894821167, | |
| "learning_rate": 0.0001862048620434632, | |
| "loss": 0.31584739685058594, | |
| "mean_token_accuracy": 0.9056806528568268, | |
| "num_tokens": 759986563.0, | |
| "step": 9750 | |
| }, | |
| { | |
| "entropy": 0.3302036462724209, | |
| "epoch": 0.3902516725071679, | |
| "grad_norm": 0.9627712965011597, | |
| "learning_rate": 0.00018604099698074465, | |
| "loss": 0.32947277069091796, | |
| "mean_token_accuracy": 0.9025924801826477, | |
| "num_tokens": 763977260.0, | |
| "step": 9800 | |
| }, | |
| { | |
| "entropy": 0.3402106484770775, | |
| "epoch": 0.39224275246893914, | |
| "grad_norm": 1.7044585943222046, | |
| "learning_rate": 0.00018587623741103584, | |
| "loss": 0.33517219543457033, | |
| "mean_token_accuracy": 0.8997596955299377, | |
| "num_tokens": 767863446.0, | |
| "step": 9850 | |
| }, | |
| { | |
| "entropy": 0.3359699550271034, | |
| "epoch": 0.3942338324307104, | |
| "grad_norm": 3.5311906337738037, | |
| "learning_rate": 0.00018571058504722468, | |
| "loss": 0.33161392211914065, | |
| "mean_token_accuracy": 0.9013146412372589, | |
| "num_tokens": 771818608.0, | |
| "step": 9900 | |
| }, | |
| { | |
| "entropy": 0.3312606856226921, | |
| "epoch": 0.3962249123924817, | |
| "grad_norm": 2.716005563735962, | |
| "learning_rate": 0.00018554404161148091, | |
| "loss": 0.3253916549682617, | |
| "mean_token_accuracy": 0.9028956240415573, | |
| "num_tokens": 775679110.0, | |
| "step": 9950 | |
| }, | |
| { | |
| "entropy": 0.3289224162697792, | |
| "epoch": 0.3982159923542529, | |
| "grad_norm": 1.4217242002487183, | |
| "learning_rate": 0.00018537660883523807, | |
| "loss": 0.3240834808349609, | |
| "mean_token_accuracy": 0.9021329081058502, | |
| "num_tokens": 779749036.0, | |
| "step": 10000 | |
| }, | |
| { | |
| "entropy": 0.33332769259810446, | |
| "epoch": 0.4002070723160242, | |
| "grad_norm": 6.87371826171875, | |
| "learning_rate": 0.00018520828845917548, | |
| "loss": 0.32686050415039064, | |
| "mean_token_accuracy": 0.9011375176906585, | |
| "num_tokens": 783452539.0, | |
| "step": 10050 | |
| }, | |
| { | |
| "entropy": 1.0259594152867795, | |
| "epoch": 0.4021981522777955, | |
| "grad_norm": 3533.30126953125, | |
| "learning_rate": 0.0001850390822332003, | |
| "loss": 0.9963255310058594, | |
| "mean_token_accuracy": 0.8286776062846184, | |
| "num_tokens": 787264679.0, | |
| "step": 10100 | |
| }, | |
| { | |
| "entropy": 0.503859292268753, | |
| "epoch": 0.40418923223956676, | |
| "grad_norm": 16.601173400878906, | |
| "learning_rate": 0.0001848689919164292, | |
| "loss": 0.527906494140625, | |
| "mean_token_accuracy": 0.8762823796272278, | |
| "num_tokens": 791204711.0, | |
| "step": 10150 | |
| }, | |
| { | |
| "entropy": 0.33264376640319826, | |
| "epoch": 0.406180312201338, | |
| "grad_norm": 2.0443027019500732, | |
| "learning_rate": 0.00018469801927717012, | |
| "loss": 0.3257022476196289, | |
| "mean_token_accuracy": 0.9036731535196304, | |
| "num_tokens": 795039803.0, | |
| "step": 10200 | |
| }, | |
| { | |
| "entropy": 0.34522681057453153, | |
| "epoch": 0.40817139216310927, | |
| "grad_norm": 1.7004640102386475, | |
| "learning_rate": 0.0001845261660929038, | |
| "loss": 0.3389078521728516, | |
| "mean_token_accuracy": 0.900550023317337, | |
| "num_tokens": 798967618.0, | |
| "step": 10250 | |
| }, | |
| { | |
| "entropy": 0.3206296694278717, | |
| "epoch": 0.41016247212488055, | |
| "grad_norm": 1.374759316444397, | |
| "learning_rate": 0.00018435343415026554, | |
| "loss": 0.31887237548828123, | |
| "mean_token_accuracy": 0.9031812793016434, | |
| "num_tokens": 802807489.0, | |
| "step": 10300 | |
| }, | |
| { | |
| "entropy": 0.3326367573440075, | |
| "epoch": 0.4121535520866518, | |
| "grad_norm": 2.7548818588256836, | |
| "learning_rate": 0.00018417982524502634, | |
| "loss": 0.3289806365966797, | |
| "mean_token_accuracy": 0.9024446880817414, | |
| "num_tokens": 806748487.0, | |
| "step": 10350 | |
| }, | |
| { | |
| "entropy": 0.35558821737766266, | |
| "epoch": 0.41414463204842306, | |
| "grad_norm": 1.5409172773361206, | |
| "learning_rate": 0.00018400534118207434, | |
| "loss": 0.35315872192382813, | |
| "mean_token_accuracy": 0.8966484147310257, | |
| "num_tokens": 810571481.0, | |
| "step": 10400 | |
| }, | |
| { | |
| "entropy": 0.3421195350587368, | |
| "epoch": 0.41613571201019434, | |
| "grad_norm": 1.0726041793823242, | |
| "learning_rate": 0.0001838299837753962, | |
| "loss": 0.3423193359375, | |
| "mean_token_accuracy": 0.9004592525959015, | |
| "num_tokens": 814548459.0, | |
| "step": 10450 | |
| }, | |
| { | |
| "entropy": 0.346246090978384, | |
| "epoch": 0.4181267919719656, | |
| "grad_norm": 6.47501277923584, | |
| "learning_rate": 0.00018365375484805796, | |
| "loss": 0.3463835906982422, | |
| "mean_token_accuracy": 0.8999297505617142, | |
| "num_tokens": 818554549.0, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 0.4181267919719656, | |
| "eval_entropy": 0.34332345946440623, | |
| "eval_loss": 0.32466962933540344, | |
| "eval_mean_token_accuracy": 0.897943411554609, | |
| "eval_num_tokens": 818554549.0, | |
| "eval_runtime": 97.8264, | |
| "eval_samples_per_second": 10.222, | |
| "eval_steps_per_second": 0.644, | |
| "step": 10500 | |
| }, | |
| { | |
| "entropy": 0.3290373648703098, | |
| "epoch": 0.42011787193373684, | |
| "grad_norm": 2.2451601028442383, | |
| "learning_rate": 0.0001834766562321864, | |
| "loss": 0.3220062255859375, | |
| "mean_token_accuracy": 0.9034412264823913, | |
| "num_tokens": 822366765.0, | |
| "step": 10550 | |
| }, | |
| { | |
| "entropy": 0.3280380629003048, | |
| "epoch": 0.4221089518955081, | |
| "grad_norm": 0.9720843434333801, | |
| "learning_rate": 0.00018329868976894967, | |
| "loss": 0.31923383712768555, | |
| "mean_token_accuracy": 0.9032741272449494, | |
| "num_tokens": 826285549.0, | |
| "step": 10600 | |
| }, | |
| { | |
| "entropy": 0.33660112977027895, | |
| "epoch": 0.4241000318572794, | |
| "grad_norm": 0.8592673540115356, | |
| "learning_rate": 0.00018311985730853843, | |
| "loss": 0.3342922210693359, | |
| "mean_token_accuracy": 0.9008872789144516, | |
| "num_tokens": 830046916.0, | |
| "step": 10650 | |
| }, | |
| { | |
| "entropy": 0.3543057516217232, | |
| "epoch": 0.4260911118190506, | |
| "grad_norm": 1.0152907371520996, | |
| "learning_rate": 0.00018294016071014642, | |
| "loss": 0.34568778991699217, | |
| "mean_token_accuracy": 0.896729109287262, | |
| "num_tokens": 833982631.0, | |
| "step": 10700 | |
| }, | |
| { | |
| "entropy": 0.3369723661243916, | |
| "epoch": 0.4280821917808219, | |
| "grad_norm": 0.7823643684387207, | |
| "learning_rate": 0.00018275960184195128, | |
| "loss": 0.33126594543457033, | |
| "mean_token_accuracy": 0.9012682574987412, | |
| "num_tokens": 837812830.0, | |
| "step": 10750 | |
| }, | |
| { | |
| "entropy": 0.3429368932545185, | |
| "epoch": 0.4300732717425932, | |
| "grad_norm": 1.8691685199737549, | |
| "learning_rate": 0.000182578182581095, | |
| "loss": 0.3399934768676758, | |
| "mean_token_accuracy": 0.8995037811994553, | |
| "num_tokens": 841603806.0, | |
| "step": 10800 | |
| }, | |
| { | |
| "entropy": 0.33411232218146325, | |
| "epoch": 0.43206435170436447, | |
| "grad_norm": 3.0383706092834473, | |
| "learning_rate": 0.0001823959048136645, | |
| "loss": 0.32936439514160154, | |
| "mean_token_accuracy": 0.9018221443891525, | |
| "num_tokens": 845494879.0, | |
| "step": 10850 | |
| }, | |
| { | |
| "entropy": 0.3343386217951775, | |
| "epoch": 0.4340554316661357, | |
| "grad_norm": 1.645346999168396, | |
| "learning_rate": 0.0001822127704346719, | |
| "loss": 0.3314424133300781, | |
| "mean_token_accuracy": 0.9026519441604615, | |
| "num_tokens": 849314636.0, | |
| "step": 10900 | |
| }, | |
| { | |
| "entropy": 0.3347695617377758, | |
| "epoch": 0.436046511627907, | |
| "grad_norm": 5.8606743812561035, | |
| "learning_rate": 0.00018202878134803503, | |
| "loss": 0.32734596252441406, | |
| "mean_token_accuracy": 0.9020316791534424, | |
| "num_tokens": 853257617.0, | |
| "step": 10950 | |
| }, | |
| { | |
| "entropy": 0.3335135568678379, | |
| "epoch": 0.43803759158967825, | |
| "grad_norm": 1.44121515750885, | |
| "learning_rate": 0.0001818439394665574, | |
| "loss": 0.3274779510498047, | |
| "mean_token_accuracy": 0.902123721241951, | |
| "num_tokens": 857031141.0, | |
| "step": 11000 | |
| }, | |
| { | |
| "entropy": 0.3393210792541504, | |
| "epoch": 0.4400286715514495, | |
| "grad_norm": 5.344813346862793, | |
| "learning_rate": 0.00018165824671190843, | |
| "loss": 0.3328717803955078, | |
| "mean_token_accuracy": 0.9012005394697189, | |
| "num_tokens": 860887023.0, | |
| "step": 11050 | |
| }, | |
| { | |
| "entropy": 0.3307928714156151, | |
| "epoch": 0.44201975151322076, | |
| "grad_norm": 0.6774300932884216, | |
| "learning_rate": 0.00018147170501460353, | |
| "loss": 0.32967548370361327, | |
| "mean_token_accuracy": 0.9018965286016464, | |
| "num_tokens": 864790027.0, | |
| "step": 11100 | |
| }, | |
| { | |
| "entropy": 0.32985477536916735, | |
| "epoch": 0.44401083147499204, | |
| "grad_norm": 0.8618547916412354, | |
| "learning_rate": 0.00018128431631398394, | |
| "loss": 0.32960365295410154, | |
| "mean_token_accuracy": 0.9027633172273636, | |
| "num_tokens": 868592333.0, | |
| "step": 11150 | |
| }, | |
| { | |
| "entropy": 0.33718678772449495, | |
| "epoch": 0.4460019114367633, | |
| "grad_norm": 3.609206199645996, | |
| "learning_rate": 0.00018109608255819653, | |
| "loss": 0.3314109420776367, | |
| "mean_token_accuracy": 0.9008357304334641, | |
| "num_tokens": 872508470.0, | |
| "step": 11200 | |
| }, | |
| { | |
| "entropy": 0.34362460523843763, | |
| "epoch": 0.44799299139853455, | |
| "grad_norm": 1.003614068031311, | |
| "learning_rate": 0.00018090700570417366, | |
| "loss": 0.3378079223632813, | |
| "mean_token_accuracy": 0.8999038857221603, | |
| "num_tokens": 876363185.0, | |
| "step": 11250 | |
| }, | |
| { | |
| "entropy": 0.3392866799235344, | |
| "epoch": 0.4499840713603058, | |
| "grad_norm": 0.7893933653831482, | |
| "learning_rate": 0.00018071708771761277, | |
| "loss": 0.3362896728515625, | |
| "mean_token_accuracy": 0.9011469954252243, | |
| "num_tokens": 880303922.0, | |
| "step": 11300 | |
| }, | |
| { | |
| "entropy": 0.33675415202975273, | |
| "epoch": 0.4519751513220771, | |
| "grad_norm": 1.591785192489624, | |
| "learning_rate": 0.00018052633057295592, | |
| "loss": 0.33205352783203124, | |
| "mean_token_accuracy": 0.9002311301231384, | |
| "num_tokens": 884081854.0, | |
| "step": 11350 | |
| }, | |
| { | |
| "entropy": 0.33132238522171975, | |
| "epoch": 0.4539662312838484, | |
| "grad_norm": 0.8481300473213196, | |
| "learning_rate": 0.00018033473625336943, | |
| "loss": 0.3324263000488281, | |
| "mean_token_accuracy": 0.9015952390432358, | |
| "num_tokens": 887979780.0, | |
| "step": 11400 | |
| }, | |
| { | |
| "entropy": 0.32730998218059537, | |
| "epoch": 0.4559573112456196, | |
| "grad_norm": 0.9017524719238281, | |
| "learning_rate": 0.00018014230675072296, | |
| "loss": 0.33089866638183596, | |
| "mean_token_accuracy": 0.9035227233171463, | |
| "num_tokens": 892030186.0, | |
| "step": 11450 | |
| }, | |
| { | |
| "entropy": 0.3259911689162254, | |
| "epoch": 0.4579483912073909, | |
| "grad_norm": 0.8241736888885498, | |
| "learning_rate": 0.0001799490440655691, | |
| "loss": 0.32311305999755857, | |
| "mean_token_accuracy": 0.9039623945951462, | |
| "num_tokens": 895947945.0, | |
| "step": 11500 | |
| }, | |
| { | |
| "entropy": 0.32894982740283013, | |
| "epoch": 0.4599394711691622, | |
| "grad_norm": 0.6679379940032959, | |
| "learning_rate": 0.00017975495020712236, | |
| "loss": 0.32866409301757815, | |
| "mean_token_accuracy": 0.9023572719097137, | |
| "num_tokens": 899931286.0, | |
| "step": 11550 | |
| }, | |
| { | |
| "entropy": 0.3283787477016449, | |
| "epoch": 0.4619305511309334, | |
| "grad_norm": 0.7148107290267944, | |
| "learning_rate": 0.00017956002719323846, | |
| "loss": 0.3312802505493164, | |
| "mean_token_accuracy": 0.9040138351917267, | |
| "num_tokens": 903816597.0, | |
| "step": 11600 | |
| }, | |
| { | |
| "entropy": 0.34928158164024353, | |
| "epoch": 0.4639216310927047, | |
| "grad_norm": 0.7012563347816467, | |
| "learning_rate": 0.00017936427705039312, | |
| "loss": 0.34329158782958985, | |
| "mean_token_accuracy": 0.8994199293851852, | |
| "num_tokens": 907643305.0, | |
| "step": 11650 | |
| }, | |
| { | |
| "entropy": 0.3263499431312084, | |
| "epoch": 0.46591271105447596, | |
| "grad_norm": 3.0909736156463623, | |
| "learning_rate": 0.00017916770181366126, | |
| "loss": 0.3217006301879883, | |
| "mean_token_accuracy": 0.9037967169284821, | |
| "num_tokens": 911644445.0, | |
| "step": 11700 | |
| }, | |
| { | |
| "entropy": 0.3224152271449566, | |
| "epoch": 0.46790379101624724, | |
| "grad_norm": 3.0938165187835693, | |
| "learning_rate": 0.00017897030352669567, | |
| "loss": 0.30827510833740235, | |
| "mean_token_accuracy": 0.9065712589025497, | |
| "num_tokens": 915520505.0, | |
| "step": 11750 | |
| }, | |
| { | |
| "entropy": 0.3168146115541458, | |
| "epoch": 0.46989487097801846, | |
| "grad_norm": 13.391618728637695, | |
| "learning_rate": 0.00017877208424170582, | |
| "loss": 0.31009477615356446, | |
| "mean_token_accuracy": 0.9047369199991226, | |
| "num_tokens": 919202508.0, | |
| "step": 11800 | |
| }, | |
| { | |
| "entropy": 0.3283210161328316, | |
| "epoch": 0.47188595093978974, | |
| "grad_norm": 5.35004997253418, | |
| "learning_rate": 0.00017857304601943648, | |
| "loss": 0.3183258056640625, | |
| "mean_token_accuracy": 0.9028832757472992, | |
| "num_tokens": 922999097.0, | |
| "step": 11850 | |
| }, | |
| { | |
| "entropy": 0.3331063890457153, | |
| "epoch": 0.473877030901561, | |
| "grad_norm": 1.4924137592315674, | |
| "learning_rate": 0.00017837319092914636, | |
| "loss": 0.3294242858886719, | |
| "mean_token_accuracy": 0.9027070623636245, | |
| "num_tokens": 926760951.0, | |
| "step": 11900 | |
| }, | |
| { | |
| "entropy": 0.3223375345766544, | |
| "epoch": 0.47586811086333225, | |
| "grad_norm": 2.2390682697296143, | |
| "learning_rate": 0.00017817252104858648, | |
| "loss": 0.31913780212402343, | |
| "mean_token_accuracy": 0.904842980504036, | |
| "num_tokens": 930682949.0, | |
| "step": 11950 | |
| }, | |
| { | |
| "entropy": 0.33492707505822183, | |
| "epoch": 0.47785919082510353, | |
| "grad_norm": 1.0135114192962646, | |
| "learning_rate": 0.00017797103846397882, | |
| "loss": 0.32693416595458985, | |
| "mean_token_accuracy": 0.9027973359823227, | |
| "num_tokens": 934629003.0, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 0.47785919082510353, | |
| "eval_entropy": 0.3142273492283291, | |
| "eval_loss": 0.2967698872089386, | |
| "eval_mean_token_accuracy": 0.9049411766112797, | |
| "eval_num_tokens": 934629003.0, | |
| "eval_runtime": 98.1038, | |
| "eval_samples_per_second": 10.193, | |
| "eval_steps_per_second": 0.642, | |
| "step": 12000 | |
| }, | |
| { | |
| "entropy": 0.3153399461507797, | |
| "epoch": 0.4798502707868748, | |
| "grad_norm": 1.6073180437088013, | |
| "learning_rate": 0.00017776874526999431, | |
| "loss": 0.3167377471923828, | |
| "mean_token_accuracy": 0.9059252417087555, | |
| "num_tokens": 938589514.0, | |
| "step": 12050 | |
| }, | |
| { | |
| "entropy": 0.3352287206053734, | |
| "epoch": 0.4818413507486461, | |
| "grad_norm": 1.6080002784729004, | |
| "learning_rate": 0.0001775656435697313, | |
| "loss": 0.32828590393066404, | |
| "mean_token_accuracy": 0.9015354603528977, | |
| "num_tokens": 942478665.0, | |
| "step": 12100 | |
| }, | |
| { | |
| "entropy": 0.32980587109923365, | |
| "epoch": 0.4838324307104173, | |
| "grad_norm": 1.054014801979065, | |
| "learning_rate": 0.00017736173547469358, | |
| "loss": 0.32828296661376954, | |
| "mean_token_accuracy": 0.9027411657571792, | |
| "num_tokens": 946330112.0, | |
| "step": 12150 | |
| }, | |
| { | |
| "entropy": 0.31484507247805593, | |
| "epoch": 0.4858235106721886, | |
| "grad_norm": 1.0270887613296509, | |
| "learning_rate": 0.00017715702310476842, | |
| "loss": 0.3141517639160156, | |
| "mean_token_accuracy": 0.9055408567190171, | |
| "num_tokens": 950227059.0, | |
| "step": 12200 | |
| }, | |
| { | |
| "entropy": 0.3244850052893162, | |
| "epoch": 0.4878145906339599, | |
| "grad_norm": 2.9883229732513428, | |
| "learning_rate": 0.0001769515085882046, | |
| "loss": 0.32130313873291017, | |
| "mean_token_accuracy": 0.9037606674432754, | |
| "num_tokens": 954308948.0, | |
| "step": 12250 | |
| }, | |
| { | |
| "entropy": 0.3182083103060722, | |
| "epoch": 0.4898056705957311, | |
| "grad_norm": 1.0146301984786987, | |
| "learning_rate": 0.00017674519406159022, | |
| "loss": 0.3161518287658691, | |
| "mean_token_accuracy": 0.9044882690906525, | |
| "num_tokens": 958083284.0, | |
| "step": 12300 | |
| }, | |
| { | |
| "entropy": 0.3185697332024574, | |
| "epoch": 0.4917967505575024, | |
| "grad_norm": 1.2245451211929321, | |
| "learning_rate": 0.00017653808166983055, | |
| "loss": 0.3119895553588867, | |
| "mean_token_accuracy": 0.9051649940013885, | |
| "num_tokens": 961909213.0, | |
| "step": 12350 | |
| }, | |
| { | |
| "entropy": 0.32179706066846847, | |
| "epoch": 0.49378783051927366, | |
| "grad_norm": 4.297907829284668, | |
| "learning_rate": 0.00017633017356612568, | |
| "loss": 0.32323280334472654, | |
| "mean_token_accuracy": 0.9024811029434204, | |
| "num_tokens": 965715395.0, | |
| "step": 12400 | |
| }, | |
| { | |
| "entropy": 0.3084810623526573, | |
| "epoch": 0.49577891048104494, | |
| "grad_norm": 0.6699567437171936, | |
| "learning_rate": 0.00017612147191194813, | |
| "loss": 0.30496238708496093, | |
| "mean_token_accuracy": 0.9064372587203979, | |
| "num_tokens": 969651097.0, | |
| "step": 12450 | |
| }, | |
| { | |
| "entropy": 0.3179575477540493, | |
| "epoch": 0.49776999044281617, | |
| "grad_norm": 1.3979785442352295, | |
| "learning_rate": 0.00017591197887702043, | |
| "loss": 0.31622880935668946, | |
| "mean_token_accuracy": 0.9055276393890381, | |
| "num_tokens": 973561253.0, | |
| "step": 12500 | |
| }, | |
| { | |
| "entropy": 0.31216868028044703, | |
| "epoch": 0.49976107040458745, | |
| "grad_norm": 0.7845538854598999, | |
| "learning_rate": 0.0001757016966392925, | |
| "loss": 0.31015949249267577, | |
| "mean_token_accuracy": 0.906750670671463, | |
| "num_tokens": 977586836.0, | |
| "step": 12550 | |
| }, | |
| { | |
| "entropy": 0.3053250414133072, | |
| "epoch": 0.5017521503663587, | |
| "grad_norm": 3.190662145614624, | |
| "learning_rate": 0.0001754906273849191, | |
| "loss": 0.30805967330932615, | |
| "mean_token_accuracy": 0.9076743638515472, | |
| "num_tokens": 981492525.0, | |
| "step": 12600 | |
| }, | |
| { | |
| "entropy": 0.30219964385032655, | |
| "epoch": 0.50374323032813, | |
| "grad_norm": 2.1294660568237305, | |
| "learning_rate": 0.00017527877330823696, | |
| "loss": 0.3018102264404297, | |
| "mean_token_accuracy": 0.9099226385354996, | |
| "num_tokens": 985505201.0, | |
| "step": 12650 | |
| }, | |
| { | |
| "entropy": 0.3099065946042538, | |
| "epoch": 0.5057343102899012, | |
| "grad_norm": 0.6970147490501404, | |
| "learning_rate": 0.00017506613661174208, | |
| "loss": 0.3070409393310547, | |
| "mean_token_accuracy": 0.9077232587337494, | |
| "num_tokens": 989354252.0, | |
| "step": 12700 | |
| }, | |
| { | |
| "entropy": 0.31281920209527014, | |
| "epoch": 0.5077253902516725, | |
| "grad_norm": 2.2930996417999268, | |
| "learning_rate": 0.00017485271950606687, | |
| "loss": 0.3116877555847168, | |
| "mean_token_accuracy": 0.9060627329349518, | |
| "num_tokens": 993286554.0, | |
| "step": 12750 | |
| }, | |
| { | |
| "entropy": 0.30280036211013794, | |
| "epoch": 0.5097164702134438, | |
| "grad_norm": 0.7827371954917908, | |
| "learning_rate": 0.000174638524209957, | |
| "loss": 0.30319522857666015, | |
| "mean_token_accuracy": 0.9087213289737701, | |
| "num_tokens": 997343233.0, | |
| "step": 12800 | |
| }, | |
| { | |
| "entropy": 0.31477322295308113, | |
| "epoch": 0.5117075501752151, | |
| "grad_norm": 0.7464041113853455, | |
| "learning_rate": 0.0001744235529502485, | |
| "loss": 0.3129489135742187, | |
| "mean_token_accuracy": 0.9058337074518203, | |
| "num_tokens": 1001334843.0, | |
| "step": 12850 | |
| }, | |
| { | |
| "entropy": 0.30997680947184564, | |
| "epoch": 0.5136986301369864, | |
| "grad_norm": 0.6095921993255615, | |
| "learning_rate": 0.00017420780796184446, | |
| "loss": 0.30621599197387694, | |
| "mean_token_accuracy": 0.9058770096302032, | |
| "num_tokens": 1005310855.0, | |
| "step": 12900 | |
| }, | |
| { | |
| "entropy": 0.3065580949187279, | |
| "epoch": 0.5156897100987575, | |
| "grad_norm": 2.350802421569824, | |
| "learning_rate": 0.00017399129148769194, | |
| "loss": 0.3066014862060547, | |
| "mean_token_accuracy": 0.908355308175087, | |
| "num_tokens": 1009346212.0, | |
| "step": 12950 | |
| }, | |
| { | |
| "entropy": 0.31059773072600366, | |
| "epoch": 0.5176807900605288, | |
| "grad_norm": 0.8811128735542297, | |
| "learning_rate": 0.00017377400577875862, | |
| "loss": 0.3058795928955078, | |
| "mean_token_accuracy": 0.9066431885957718, | |
| "num_tokens": 1013288916.0, | |
| "step": 13000 | |
| }, | |
| { | |
| "entropy": 0.3080012533068657, | |
| "epoch": 0.5196718700223001, | |
| "grad_norm": 0.7292214632034302, | |
| "learning_rate": 0.0001735559530940093, | |
| "loss": 0.30621482849121096, | |
| "mean_token_accuracy": 0.9068697249889374, | |
| "num_tokens": 1017269907.0, | |
| "step": 13050 | |
| }, | |
| { | |
| "entropy": 0.29841029316186907, | |
| "epoch": 0.5216629499840714, | |
| "grad_norm": 0.8363134860992432, | |
| "learning_rate": 0.0001733371357003825, | |
| "loss": 0.2961251640319824, | |
| "mean_token_accuracy": 0.909942420721054, | |
| "num_tokens": 1021232491.0, | |
| "step": 13100 | |
| }, | |
| { | |
| "entropy": 0.3209612062573433, | |
| "epoch": 0.5236540299458426, | |
| "grad_norm": 0.6443411707878113, | |
| "learning_rate": 0.00017311755587276685, | |
| "loss": 0.32036983489990234, | |
| "mean_token_accuracy": 0.9041855382919312, | |
| "num_tokens": 1025059216.0, | |
| "step": 13150 | |
| }, | |
| { | |
| "entropy": 0.3188166154921055, | |
| "epoch": 0.5256451099076139, | |
| "grad_norm": 0.7593351006507874, | |
| "learning_rate": 0.00017289721589397756, | |
| "loss": 0.31142175674438477, | |
| "mean_token_accuracy": 0.9049467498064041, | |
| "num_tokens": 1028841409.0, | |
| "step": 13200 | |
| }, | |
| { | |
| "entropy": 0.30779171898961066, | |
| "epoch": 0.5276361898693852, | |
| "grad_norm": 0.720933735370636, | |
| "learning_rate": 0.00017267611805473246, | |
| "loss": 0.30698768615722655, | |
| "mean_token_accuracy": 0.9066478383541107, | |
| "num_tokens": 1032855591.0, | |
| "step": 13250 | |
| }, | |
| { | |
| "entropy": 0.3156025929749012, | |
| "epoch": 0.5296272698311564, | |
| "grad_norm": 0.8520675897598267, | |
| "learning_rate": 0.0001724542646536284, | |
| "loss": 0.31248844146728516, | |
| "mean_token_accuracy": 0.9060261619091033, | |
| "num_tokens": 1036858782.0, | |
| "step": 13300 | |
| }, | |
| { | |
| "entropy": 0.30919904172420504, | |
| "epoch": 0.5316183497929277, | |
| "grad_norm": 0.7996109127998352, | |
| "learning_rate": 0.00017223165799711728, | |
| "loss": 0.3059793853759766, | |
| "mean_token_accuracy": 0.9064883595705032, | |
| "num_tokens": 1040726732.0, | |
| "step": 13350 | |
| }, | |
| { | |
| "entropy": 0.31799424409866334, | |
| "epoch": 0.5336094297546989, | |
| "grad_norm": 0.8917890191078186, | |
| "learning_rate": 0.00017200830039948198, | |
| "loss": 0.3163420486450195, | |
| "mean_token_accuracy": 0.9045793133974075, | |
| "num_tokens": 1044542496.0, | |
| "step": 13400 | |
| }, | |
| { | |
| "entropy": 0.3092480516433716, | |
| "epoch": 0.5356005097164702, | |
| "grad_norm": 1.9236994981765747, | |
| "learning_rate": 0.00017178419418281243, | |
| "loss": 0.3074158096313477, | |
| "mean_token_accuracy": 0.9063370931148529, | |
| "num_tokens": 1048428916.0, | |
| "step": 13450 | |
| }, | |
| { | |
| "entropy": 0.3134460225701332, | |
| "epoch": 0.5375915896782415, | |
| "grad_norm": 1.0063883066177368, | |
| "learning_rate": 0.00017155934167698144, | |
| "loss": 0.30935720443725584, | |
| "mean_token_accuracy": 0.9052882140874863, | |
| "num_tokens": 1052237764.0, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 0.5375915896782415, | |
| "eval_entropy": 0.29078047734404366, | |
| "eval_loss": 0.29036185145378113, | |
| "eval_mean_token_accuracy": 0.9072613971573966, | |
| "eval_num_tokens": 1052237764.0, | |
| "eval_runtime": 97.9425, | |
| "eval_samples_per_second": 10.21, | |
| "eval_steps_per_second": 0.643, | |
| "step": 13500 | |
| }, | |
| { | |
| "entropy": 0.3147663879394531, | |
| "epoch": 0.5395826696400128, | |
| "grad_norm": 0.8451830148696899, | |
| "learning_rate": 0.00017133374521962044, | |
| "loss": 0.3125171279907227, | |
| "mean_token_accuracy": 0.9064455604553223, | |
| "num_tokens": 1056119070.0, | |
| "step": 13550 | |
| }, | |
| { | |
| "entropy": 0.3062629546225071, | |
| "epoch": 0.5415737496017841, | |
| "grad_norm": 0.7669914364814758, | |
| "learning_rate": 0.00017110740715609515, | |
| "loss": 0.30674230575561523, | |
| "mean_token_accuracy": 0.9074991244077683, | |
| "num_tokens": 1059949704.0, | |
| "step": 13600 | |
| }, | |
| { | |
| "entropy": 0.3162059251964092, | |
| "epoch": 0.5435648295635552, | |
| "grad_norm": 0.7038897275924683, | |
| "learning_rate": 0.0001708803298394813, | |
| "loss": 0.31566192626953127, | |
| "mean_token_accuracy": 0.9061574387550354, | |
| "num_tokens": 1063824943.0, | |
| "step": 13650 | |
| }, | |
| { | |
| "entropy": 0.29972497284412386, | |
| "epoch": 0.5455559095253265, | |
| "grad_norm": 0.7049840092658997, | |
| "learning_rate": 0.0001706525156305401, | |
| "loss": 0.2954620933532715, | |
| "mean_token_accuracy": 0.908453021645546, | |
| "num_tokens": 1067693856.0, | |
| "step": 13700 | |
| }, | |
| { | |
| "entropy": 0.30088669553399083, | |
| "epoch": 0.5475469894870978, | |
| "grad_norm": 0.803152322769165, | |
| "learning_rate": 0.00017042396689769364, | |
| "loss": 0.29926998138427735, | |
| "mean_token_accuracy": 0.9087596547603607, | |
| "num_tokens": 1071601421.0, | |
| "step": 13750 | |
| }, | |
| { | |
| "entropy": 0.30597650140523913, | |
| "epoch": 0.5495380694488691, | |
| "grad_norm": 0.6174252033233643, | |
| "learning_rate": 0.00017019468601700045, | |
| "loss": 0.30020965576171876, | |
| "mean_token_accuracy": 0.9079719346761703, | |
| "num_tokens": 1075507557.0, | |
| "step": 13800 | |
| }, | |
| { | |
| "entropy": 0.3030544947087765, | |
| "epoch": 0.5515291494106404, | |
| "grad_norm": 0.7198078632354736, | |
| "learning_rate": 0.00016996467537213058, | |
| "loss": 0.3055330467224121, | |
| "mean_token_accuracy": 0.9072394198179246, | |
| "num_tokens": 1079464929.0, | |
| "step": 13850 | |
| }, | |
| { | |
| "entropy": 0.30408748909831046, | |
| "epoch": 0.5535202293724116, | |
| "grad_norm": 0.6543081402778625, | |
| "learning_rate": 0.000169733937354341, | |
| "loss": 0.2971897315979004, | |
| "mean_token_accuracy": 0.9081903666257858, | |
| "num_tokens": 1083442664.0, | |
| "step": 13900 | |
| }, | |
| { | |
| "entropy": 0.3111391983926296, | |
| "epoch": 0.5555113093341829, | |
| "grad_norm": 0.6148940920829773, | |
| "learning_rate": 0.00016950247436245053, | |
| "loss": 0.306310863494873, | |
| "mean_token_accuracy": 0.907039784193039, | |
| "num_tokens": 1087353509.0, | |
| "step": 13950 | |
| }, | |
| { | |
| "entropy": 0.29428019240498543, | |
| "epoch": 0.5575023892959541, | |
| "grad_norm": 0.6194506287574768, | |
| "learning_rate": 0.00016927028880281514, | |
| "loss": 0.29547828674316406, | |
| "mean_token_accuracy": 0.9099029290676117, | |
| "num_tokens": 1091242469.0, | |
| "step": 14000 | |
| }, | |
| { | |
| "entropy": 0.3118854616582394, | |
| "epoch": 0.5594934692577254, | |
| "grad_norm": 0.6568689942359924, | |
| "learning_rate": 0.00016903738308930285, | |
| "loss": 0.3083318138122559, | |
| "mean_token_accuracy": 0.9061790078878402, | |
| "num_tokens": 1095156664.0, | |
| "step": 14050 | |
| }, | |
| { | |
| "entropy": 0.3039117956161499, | |
| "epoch": 0.5614845492194966, | |
| "grad_norm": 0.5354903340339661, | |
| "learning_rate": 0.00016880375964326846, | |
| "loss": 0.2998150634765625, | |
| "mean_token_accuracy": 0.9083393847942353, | |
| "num_tokens": 1099149736.0, | |
| "step": 14100 | |
| }, | |
| { | |
| "entropy": 0.3004564446210861, | |
| "epoch": 0.5634756291812679, | |
| "grad_norm": 0.8700271844863892, | |
| "learning_rate": 0.00016856942089352872, | |
| "loss": 0.29739187240600584, | |
| "mean_token_accuracy": 0.9088945603370666, | |
| "num_tokens": 1103166304.0, | |
| "step": 14150 | |
| }, | |
| { | |
| "entropy": 0.3004854147136211, | |
| "epoch": 0.5654667091430392, | |
| "grad_norm": 0.637499988079071, | |
| "learning_rate": 0.00016833436927633666, | |
| "loss": 0.2929790687561035, | |
| "mean_token_accuracy": 0.9093893361091614, | |
| "num_tokens": 1106876529.0, | |
| "step": 14200 | |
| }, | |
| { | |
| "entropy": 0.3055184032022953, | |
| "epoch": 0.5674577891048105, | |
| "grad_norm": 0.8712766766548157, | |
| "learning_rate": 0.00016809860723535669, | |
| "loss": 0.2989055252075195, | |
| "mean_token_accuracy": 0.9075117868185043, | |
| "num_tokens": 1110762872.0, | |
| "step": 14250 | |
| }, | |
| { | |
| "entropy": 0.30708494916558265, | |
| "epoch": 0.5694488690665818, | |
| "grad_norm": 1.903483271598816, | |
| "learning_rate": 0.00016786213722163885, | |
| "loss": 0.3001683807373047, | |
| "mean_token_accuracy": 0.9074388015270233, | |
| "num_tokens": 1114612687.0, | |
| "step": 14300 | |
| }, | |
| { | |
| "entropy": 0.3030554646253586, | |
| "epoch": 0.5714399490283529, | |
| "grad_norm": 0.7355078458786011, | |
| "learning_rate": 0.00016762496169359358, | |
| "loss": 0.29985538482666013, | |
| "mean_token_accuracy": 0.9085291236639023, | |
| "num_tokens": 1118477075.0, | |
| "step": 14350 | |
| }, | |
| { | |
| "entropy": 0.30076363891363145, | |
| "epoch": 0.5734310289901242, | |
| "grad_norm": 0.8253635168075562, | |
| "learning_rate": 0.00016738708311696593, | |
| "loss": 0.3000423240661621, | |
| "mean_token_accuracy": 0.9090260636806488, | |
| "num_tokens": 1122308979.0, | |
| "step": 14400 | |
| }, | |
| { | |
| "entropy": 0.30372032582759856, | |
| "epoch": 0.5754221089518955, | |
| "grad_norm": 0.6847742199897766, | |
| "learning_rate": 0.00016714850396481017, | |
| "loss": 0.2999353790283203, | |
| "mean_token_accuracy": 0.907860655784607, | |
| "num_tokens": 1126179144.0, | |
| "step": 14450 | |
| }, | |
| { | |
| "entropy": 0.3549429287016392, | |
| "epoch": 0.5774131889136668, | |
| "grad_norm": 35.38624572753906, | |
| "learning_rate": 0.00016690922671746386, | |
| "loss": 0.3448126220703125, | |
| "mean_token_accuracy": 0.8990497767925263, | |
| "num_tokens": 1130075144.0, | |
| "step": 14500 | |
| }, | |
| { | |
| "entropy": 0.6645228517055511, | |
| "epoch": 0.579404268875438, | |
| "grad_norm": 1.238425850868225, | |
| "learning_rate": 0.00016666925386252214, | |
| "loss": 0.6474810791015625, | |
| "mean_token_accuracy": 0.8487717002630234, | |
| "num_tokens": 1134094101.0, | |
| "step": 14550 | |
| }, | |
| { | |
| "entropy": 0.31654783099889755, | |
| "epoch": 0.5813953488372093, | |
| "grad_norm": 15.627394676208496, | |
| "learning_rate": 0.00016642858789481203, | |
| "loss": 0.3142976760864258, | |
| "mean_token_accuracy": 0.9052912598848343, | |
| "num_tokens": 1137971828.0, | |
| "step": 14600 | |
| }, | |
| { | |
| "entropy": 0.32167117565870285, | |
| "epoch": 0.5833864287989806, | |
| "grad_norm": 0.7982883453369141, | |
| "learning_rate": 0.0001661872313163662, | |
| "loss": 0.31979732513427733, | |
| "mean_token_accuracy": 0.9049945157766343, | |
| "num_tokens": 1141842535.0, | |
| "step": 14650 | |
| }, | |
| { | |
| "entropy": 0.3142679385840893, | |
| "epoch": 0.5853775087607518, | |
| "grad_norm": 0.6818510890007019, | |
| "learning_rate": 0.0001659451866363972, | |
| "loss": 0.30938182830810546, | |
| "mean_token_accuracy": 0.9058419001102448, | |
| "num_tokens": 1145759897.0, | |
| "step": 14700 | |
| }, | |
| { | |
| "entropy": 0.2997730879485607, | |
| "epoch": 0.5873685887225231, | |
| "grad_norm": 0.6930510997772217, | |
| "learning_rate": 0.00016570245637127122, | |
| "loss": 0.29986000061035156, | |
| "mean_token_accuracy": 0.9088831174373627, | |
| "num_tokens": 1149589724.0, | |
| "step": 14750 | |
| }, | |
| { | |
| "entropy": 0.312316772788763, | |
| "epoch": 0.5893596686842943, | |
| "grad_norm": 0.6712312698364258, | |
| "learning_rate": 0.00016545904304448203, | |
| "loss": 0.3064308166503906, | |
| "mean_token_accuracy": 0.9068194925785065, | |
| "num_tokens": 1153496283.0, | |
| "step": 14800 | |
| }, | |
| { | |
| "entropy": 0.3025803528726101, | |
| "epoch": 0.5913507486460656, | |
| "grad_norm": 0.6911669373512268, | |
| "learning_rate": 0.0001652149491866247, | |
| "loss": 0.2982275390625, | |
| "mean_token_accuracy": 0.907840421795845, | |
| "num_tokens": 1157421693.0, | |
| "step": 14850 | |
| }, | |
| { | |
| "entropy": 0.29524740323424337, | |
| "epoch": 0.5933418286078369, | |
| "grad_norm": 0.7912169098854065, | |
| "learning_rate": 0.0001649701773353693, | |
| "loss": 0.29299890518188476, | |
| "mean_token_accuracy": 0.9105656880140305, | |
| "num_tokens": 1161399402.0, | |
| "step": 14900 | |
| }, | |
| { | |
| "entropy": 0.3046035374701023, | |
| "epoch": 0.5953329085696082, | |
| "grad_norm": 0.9637547135353088, | |
| "learning_rate": 0.0001647247300354345, | |
| "loss": 0.3020786666870117, | |
| "mean_token_accuracy": 0.908284249305725, | |
| "num_tokens": 1165069341.0, | |
| "step": 14950 | |
| }, | |
| { | |
| "entropy": 0.30247773334383965, | |
| "epoch": 0.5973239885313795, | |
| "grad_norm": 0.9919803142547607, | |
| "learning_rate": 0.00016447860983856113, | |
| "loss": 0.30090438842773437, | |
| "mean_token_accuracy": 0.9087945199012757, | |
| "num_tokens": 1169068940.0, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 0.5973239885313795, | |
| "eval_entropy": 0.2821128155503954, | |
| "eval_loss": 0.28751349449157715, | |
| "eval_mean_token_accuracy": 0.9066080706460136, | |
| "eval_num_tokens": 1169068940.0, | |
| "eval_runtime": 97.6893, | |
| "eval_samples_per_second": 10.237, | |
| "eval_steps_per_second": 0.645, | |
| "step": 15000 | |
| }, | |
| { | |
| "entropy": 0.31097124218940736, | |
| "epoch": 0.5993150684931506, | |
| "grad_norm": 0.8885817527770996, | |
| "learning_rate": 0.0001642318193034856, | |
| "loss": 0.30851236343383787, | |
| "mean_token_accuracy": 0.9082132822275162, | |
| "num_tokens": 1172972451.0, | |
| "step": 15050 | |
| }, | |
| { | |
| "entropy": 0.31379259154200556, | |
| "epoch": 0.6013061484549219, | |
| "grad_norm": 1.2566955089569092, | |
| "learning_rate": 0.00016398436099591352, | |
| "loss": 0.3080220603942871, | |
| "mean_token_accuracy": 0.9050265049934387, | |
| "num_tokens": 1176806828.0, | |
| "step": 15100 | |
| }, | |
| { | |
| "entropy": 0.2992862512171268, | |
| "epoch": 0.6032972284166932, | |
| "grad_norm": 0.8937509059906006, | |
| "learning_rate": 0.0001637362374884927, | |
| "loss": 0.2970610237121582, | |
| "mean_token_accuracy": 0.9087365788221359, | |
| "num_tokens": 1180674932.0, | |
| "step": 15150 | |
| }, | |
| { | |
| "entropy": 0.3095300954580307, | |
| "epoch": 0.6052883083784645, | |
| "grad_norm": 1.584878921508789, | |
| "learning_rate": 0.00016348745136078653, | |
| "loss": 0.30665403366088867, | |
| "mean_token_accuracy": 0.9072186440229416, | |
| "num_tokens": 1184537147.0, | |
| "step": 15200 | |
| }, | |
| { | |
| "entropy": 0.29855361983180045, | |
| "epoch": 0.6072793883402358, | |
| "grad_norm": 1.3048124313354492, | |
| "learning_rate": 0.00016323800519924735, | |
| "loss": 0.29641626358032225, | |
| "mean_token_accuracy": 0.9099707293510437, | |
| "num_tokens": 1188428000.0, | |
| "step": 15250 | |
| }, | |
| { | |
| "entropy": 0.2976492203772068, | |
| "epoch": 0.609270468302007, | |
| "grad_norm": 0.6167215704917908, | |
| "learning_rate": 0.00016298790159718926, | |
| "loss": 0.297906379699707, | |
| "mean_token_accuracy": 0.9093478834629058, | |
| "num_tokens": 1192267569.0, | |
| "step": 15300 | |
| }, | |
| { | |
| "entropy": 0.30622323855757716, | |
| "epoch": 0.6112615482637783, | |
| "grad_norm": 0.7061218023300171, | |
| "learning_rate": 0.00016273714315476136, | |
| "loss": 0.304271354675293, | |
| "mean_token_accuracy": 0.907381860613823, | |
| "num_tokens": 1196019611.0, | |
| "step": 15350 | |
| }, | |
| { | |
| "entropy": 0.3076668280363083, | |
| "epoch": 0.6132526282255495, | |
| "grad_norm": 240.22381591796875, | |
| "learning_rate": 0.00016248573247892067, | |
| "loss": 0.30590225219726563, | |
| "mean_token_accuracy": 0.9069288223981857, | |
| "num_tokens": 1199742259.0, | |
| "step": 15400 | |
| }, | |
| { | |
| "entropy": 0.31544667705893514, | |
| "epoch": 0.6152437081873208, | |
| "grad_norm": 1.87211012840271, | |
| "learning_rate": 0.000162233672183405, | |
| "loss": 0.3146724319458008, | |
| "mean_token_accuracy": 0.9056917190551758, | |
| "num_tokens": 1203572364.0, | |
| "step": 15450 | |
| }, | |
| { | |
| "entropy": 0.3039634561538696, | |
| "epoch": 0.617234788149092, | |
| "grad_norm": 1.5390677452087402, | |
| "learning_rate": 0.0001619809648887058, | |
| "loss": 0.30161951065063475, | |
| "mean_token_accuracy": 0.9080253195762634, | |
| "num_tokens": 1207520141.0, | |
| "step": 15500 | |
| }, | |
| { | |
| "entropy": 0.31154225423932075, | |
| "epoch": 0.6192258681108633, | |
| "grad_norm": 0.857286810874939, | |
| "learning_rate": 0.00016172761322204085, | |
| "loss": 0.31182092666625977, | |
| "mean_token_accuracy": 0.9067489957809448, | |
| "num_tokens": 1211333212.0, | |
| "step": 15550 | |
| }, | |
| { | |
| "entropy": 0.31209865912795065, | |
| "epoch": 0.6212169480726346, | |
| "grad_norm": 0.7612581849098206, | |
| "learning_rate": 0.0001614736198173271, | |
| "loss": 0.3040530776977539, | |
| "mean_token_accuracy": 0.90670563519001, | |
| "num_tokens": 1215160534.0, | |
| "step": 15600 | |
| }, | |
| { | |
| "entropy": 0.29721666797995566, | |
| "epoch": 0.6232080280344059, | |
| "grad_norm": 0.7850686311721802, | |
| "learning_rate": 0.00016121898731515316, | |
| "loss": 0.291649169921875, | |
| "mean_token_accuracy": 0.9091300505399704, | |
| "num_tokens": 1219130947.0, | |
| "step": 15650 | |
| }, | |
| { | |
| "entropy": 0.30366104453802106, | |
| "epoch": 0.6251991079961772, | |
| "grad_norm": 1.0647870302200317, | |
| "learning_rate": 0.00016096371836275188, | |
| "loss": 0.302098388671875, | |
| "mean_token_accuracy": 0.9079624992609024, | |
| "num_tokens": 1223022715.0, | |
| "step": 15700 | |
| }, | |
| { | |
| "entropy": 0.3063186949491501, | |
| "epoch": 0.6271901879579483, | |
| "grad_norm": 0.8293745517730713, | |
| "learning_rate": 0.0001607078156139728, | |
| "loss": 0.3030096435546875, | |
| "mean_token_accuracy": 0.9075041776895523, | |
| "num_tokens": 1226895035.0, | |
| "step": 15750 | |
| }, | |
| { | |
| "entropy": 0.3002316528558731, | |
| "epoch": 0.6291812679197196, | |
| "grad_norm": 1.4709408283233643, | |
| "learning_rate": 0.00016045128172925458, | |
| "loss": 0.2943367767333984, | |
| "mean_token_accuracy": 0.9096330875158309, | |
| "num_tokens": 1230708015.0, | |
| "step": 15800 | |
| }, | |
| { | |
| "entropy": 0.29358057424426076, | |
| "epoch": 0.6311723478814909, | |
| "grad_norm": 0.8506943583488464, | |
| "learning_rate": 0.00016019411937559747, | |
| "loss": 0.2879058074951172, | |
| "mean_token_accuracy": 0.9099520862102508, | |
| "num_tokens": 1234614905.0, | |
| "step": 15850 | |
| }, | |
| { | |
| "entropy": 0.2941122964024544, | |
| "epoch": 0.6331634278432622, | |
| "grad_norm": 0.559323787689209, | |
| "learning_rate": 0.00015993633122653533, | |
| "loss": 0.29281805038452147, | |
| "mean_token_accuracy": 0.9098799300193786, | |
| "num_tokens": 1238339678.0, | |
| "step": 15900 | |
| }, | |
| { | |
| "entropy": 0.303873111307621, | |
| "epoch": 0.6351545078050335, | |
| "grad_norm": 0.6046428084373474, | |
| "learning_rate": 0.00015967791996210798, | |
| "loss": 0.2978951835632324, | |
| "mean_token_accuracy": 0.9086865013837815, | |
| "num_tokens": 1242266921.0, | |
| "step": 15950 | |
| }, | |
| { | |
| "entropy": 0.30071055710315703, | |
| "epoch": 0.6371455877668047, | |
| "grad_norm": 0.7457103133201599, | |
| "learning_rate": 0.0001594188882688335, | |
| "loss": 0.2999392318725586, | |
| "mean_token_accuracy": 0.9086949378252029, | |
| "num_tokens": 1246168678.0, | |
| "step": 16000 | |
| }, | |
| { | |
| "entropy": 0.29887919217348097, | |
| "epoch": 0.639136667728576, | |
| "grad_norm": 0.5880980491638184, | |
| "learning_rate": 0.00015915923883967983, | |
| "loss": 0.2973442459106445, | |
| "mean_token_accuracy": 0.9098987239599228, | |
| "num_tokens": 1250086915.0, | |
| "step": 16050 | |
| }, | |
| { | |
| "entropy": 0.29837347254157065, | |
| "epoch": 0.6411277476903472, | |
| "grad_norm": 0.9620305895805359, | |
| "learning_rate": 0.0001588989743740373, | |
| "loss": 0.2971031188964844, | |
| "mean_token_accuracy": 0.9090900254249573, | |
| "num_tokens": 1254079336.0, | |
| "step": 16100 | |
| }, | |
| { | |
| "entropy": 0.299031962454319, | |
| "epoch": 0.6431188276521185, | |
| "grad_norm": 0.7873280644416809, | |
| "learning_rate": 0.0001586380975776903, | |
| "loss": 0.29656692504882814, | |
| "mean_token_accuracy": 0.9089064407348633, | |
| "num_tokens": 1257957112.0, | |
| "step": 16150 | |
| }, | |
| { | |
| "entropy": 0.29284371227025985, | |
| "epoch": 0.6451099076138898, | |
| "grad_norm": 0.6219205856323242, | |
| "learning_rate": 0.0001583766111627891, | |
| "loss": 0.2923365020751953, | |
| "mean_token_accuracy": 0.9103443801403046, | |
| "num_tokens": 1261754811.0, | |
| "step": 16200 | |
| }, | |
| { | |
| "entropy": 0.29972797065973283, | |
| "epoch": 0.647100987575661, | |
| "grad_norm": 0.539088249206543, | |
| "learning_rate": 0.00015811451784782183, | |
| "loss": 0.2995792961120605, | |
| "mean_token_accuracy": 0.9090916502475739, | |
| "num_tokens": 1265832992.0, | |
| "step": 16250 | |
| }, | |
| { | |
| "entropy": 0.294071561396122, | |
| "epoch": 0.6490920675374323, | |
| "grad_norm": 0.5955763459205627, | |
| "learning_rate": 0.0001578518203575861, | |
| "loss": 0.2936357879638672, | |
| "mean_token_accuracy": 0.9097523200511932, | |
| "num_tokens": 1269767119.0, | |
| "step": 16300 | |
| }, | |
| { | |
| "entropy": 0.29488854959607125, | |
| "epoch": 0.6510831474992036, | |
| "grad_norm": 0.7521705031394958, | |
| "learning_rate": 0.00015758852142316063, | |
| "loss": 0.28754150390625, | |
| "mean_token_accuracy": 0.9101364457607269, | |
| "num_tokens": 1273614979.0, | |
| "step": 16350 | |
| }, | |
| { | |
| "entropy": 0.2972512972354889, | |
| "epoch": 0.6530742274609749, | |
| "grad_norm": 0.6611602306365967, | |
| "learning_rate": 0.00015732462378187706, | |
| "loss": 0.2997426986694336, | |
| "mean_token_accuracy": 0.9092181521654129, | |
| "num_tokens": 1277572176.0, | |
| "step": 16400 | |
| }, | |
| { | |
| "entropy": 0.29382382974028587, | |
| "epoch": 0.655065307422746, | |
| "grad_norm": 0.590353786945343, | |
| "learning_rate": 0.0001570601301772913, | |
| "loss": 0.29196489334106446, | |
| "mean_token_accuracy": 0.9105822455883026, | |
| "num_tokens": 1281466782.0, | |
| "step": 16450 | |
| }, | |
| { | |
| "entropy": 0.29887585699558256, | |
| "epoch": 0.6570563873845173, | |
| "grad_norm": 0.8136062622070312, | |
| "learning_rate": 0.000156795043359155, | |
| "loss": 0.2935719680786133, | |
| "mean_token_accuracy": 0.9095307844877243, | |
| "num_tokens": 1285329315.0, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 0.6570563873845173, | |
| "eval_entropy": 0.2827215705599104, | |
| "eval_loss": 0.2723085582256317, | |
| "eval_mean_token_accuracy": 0.9104196637395828, | |
| "eval_num_tokens": 1285329315.0, | |
| "eval_runtime": 97.6475, | |
| "eval_samples_per_second": 10.241, | |
| "eval_steps_per_second": 0.645, | |
| "step": 16500 | |
| }, | |
| { | |
| "entropy": 0.29116875618696214, | |
| "epoch": 0.6590474673462886, | |
| "grad_norm": 0.6756787896156311, | |
| "learning_rate": 0.00015652936608338708, | |
| "loss": 0.292112979888916, | |
| "mean_token_accuracy": 0.9107584869861602, | |
| "num_tokens": 1289158324.0, | |
| "step": 16550 | |
| }, | |
| { | |
| "entropy": 0.3033373598754406, | |
| "epoch": 0.6610385473080599, | |
| "grad_norm": 0.5568836331367493, | |
| "learning_rate": 0.0001562631011120451, | |
| "loss": 0.300805835723877, | |
| "mean_token_accuracy": 0.9088966238498688, | |
| "num_tokens": 1293138088.0, | |
| "step": 16600 | |
| }, | |
| { | |
| "entropy": 0.29870939210057257, | |
| "epoch": 0.6630296272698312, | |
| "grad_norm": 0.4821166396141052, | |
| "learning_rate": 0.00015599625121329633, | |
| "loss": 0.29582101821899415, | |
| "mean_token_accuracy": 0.9083776873350143, | |
| "num_tokens": 1296974595.0, | |
| "step": 16650 | |
| }, | |
| { | |
| "entropy": 0.3019963566958904, | |
| "epoch": 0.6650207072316024, | |
| "grad_norm": 0.6496310234069824, | |
| "learning_rate": 0.00015572881916138922, | |
| "loss": 0.2965621566772461, | |
| "mean_token_accuracy": 0.9087733340263366, | |
| "num_tokens": 1300854839.0, | |
| "step": 16700 | |
| }, | |
| { | |
| "entropy": 0.3023223000764847, | |
| "epoch": 0.6670117871933737, | |
| "grad_norm": 0.5332936644554138, | |
| "learning_rate": 0.00015546080773662445, | |
| "loss": 0.30265289306640625, | |
| "mean_token_accuracy": 0.9071105599403382, | |
| "num_tokens": 1304789155.0, | |
| "step": 16750 | |
| }, | |
| { | |
| "entropy": 0.29066399201750753, | |
| "epoch": 0.6690028671551449, | |
| "grad_norm": 0.7210190296173096, | |
| "learning_rate": 0.00015519221972532595, | |
| "loss": 0.2885586166381836, | |
| "mean_token_accuracy": 0.9106798976659775, | |
| "num_tokens": 1308687388.0, | |
| "step": 16800 | |
| }, | |
| { | |
| "entropy": 0.29611540913581846, | |
| "epoch": 0.6709939471169162, | |
| "grad_norm": 0.6555887460708618, | |
| "learning_rate": 0.00015492305791981207, | |
| "loss": 0.2925202751159668, | |
| "mean_token_accuracy": 0.9097654807567597, | |
| "num_tokens": 1312619729.0, | |
| "step": 16850 | |
| }, | |
| { | |
| "entropy": 0.29771857395768164, | |
| "epoch": 0.6729850270786875, | |
| "grad_norm": 0.7073614597320557, | |
| "learning_rate": 0.00015465332511836649, | |
| "loss": 0.2960833740234375, | |
| "mean_token_accuracy": 0.9092891854047775, | |
| "num_tokens": 1316556214.0, | |
| "step": 16900 | |
| }, | |
| { | |
| "entropy": 0.3011424207687378, | |
| "epoch": 0.6749761070404587, | |
| "grad_norm": 0.6379684209823608, | |
| "learning_rate": 0.00015438302412520912, | |
| "loss": 0.2977731513977051, | |
| "mean_token_accuracy": 0.9088351279497147, | |
| "num_tokens": 1320381264.0, | |
| "step": 16950 | |
| }, | |
| { | |
| "entropy": 0.2937157228589058, | |
| "epoch": 0.67696718700223, | |
| "grad_norm": 0.7161999940872192, | |
| "learning_rate": 0.00015411215775046694, | |
| "loss": 0.2912364196777344, | |
| "mean_token_accuracy": 0.9099707108736038, | |
| "num_tokens": 1324178055.0, | |
| "step": 17000 | |
| }, | |
| { | |
| "entropy": 0.3029134801030159, | |
| "epoch": 0.6789582669640013, | |
| "grad_norm": 0.6558506488800049, | |
| "learning_rate": 0.0001538407288101448, | |
| "loss": 0.3023427200317383, | |
| "mean_token_accuracy": 0.9085495692491531, | |
| "num_tokens": 1328003856.0, | |
| "step": 17050 | |
| }, | |
| { | |
| "entropy": 0.29839008167386055, | |
| "epoch": 0.6809493469257726, | |
| "grad_norm": 0.6463945508003235, | |
| "learning_rate": 0.00015356874012609616, | |
| "loss": 0.29343448638916014, | |
| "mean_token_accuracy": 0.9084646880626679, | |
| "num_tokens": 1331838767.0, | |
| "step": 17100 | |
| }, | |
| { | |
| "entropy": 0.2972496284544468, | |
| "epoch": 0.6829404268875438, | |
| "grad_norm": 0.5411743521690369, | |
| "learning_rate": 0.00015329619452599368, | |
| "loss": 0.2923093032836914, | |
| "mean_token_accuracy": 0.9086371755599976, | |
| "num_tokens": 1335556122.0, | |
| "step": 17150 | |
| }, | |
| { | |
| "entropy": 0.30380251407623293, | |
| "epoch": 0.684931506849315, | |
| "grad_norm": 0.8152517080307007, | |
| "learning_rate": 0.00015302309484330003, | |
| "loss": 0.30057912826538086, | |
| "mean_token_accuracy": 0.9079786992073059, | |
| "num_tokens": 1339554013.0, | |
| "step": 17200 | |
| }, | |
| { | |
| "entropy": 0.2984812180697918, | |
| "epoch": 0.6869225868110863, | |
| "grad_norm": 0.5806976556777954, | |
| "learning_rate": 0.00015274944391723816, | |
| "loss": 0.29322574615478514, | |
| "mean_token_accuracy": 0.9091445273160934, | |
| "num_tokens": 1343281511.0, | |
| "step": 17250 | |
| }, | |
| { | |
| "entropy": 0.29485598862171175, | |
| "epoch": 0.6889136667728576, | |
| "grad_norm": 0.7114775776863098, | |
| "learning_rate": 0.00015247524459276185, | |
| "loss": 0.2939446830749512, | |
| "mean_token_accuracy": 0.9100499159097671, | |
| "num_tokens": 1347097878.0, | |
| "step": 17300 | |
| }, | |
| { | |
| "entropy": 0.2901600030064583, | |
| "epoch": 0.6909047467346289, | |
| "grad_norm": 0.68736332654953, | |
| "learning_rate": 0.00015220049972052637, | |
| "loss": 0.283979606628418, | |
| "mean_token_accuracy": 0.9118931919336319, | |
| "num_tokens": 1350909068.0, | |
| "step": 17350 | |
| }, | |
| { | |
| "entropy": 0.29703174635767937, | |
| "epoch": 0.6928958266964002, | |
| "grad_norm": 0.6926178336143494, | |
| "learning_rate": 0.00015192521215685845, | |
| "loss": 0.2921230697631836, | |
| "mean_token_accuracy": 0.9102600651979447, | |
| "num_tokens": 1354886686.0, | |
| "step": 17400 | |
| }, | |
| { | |
| "entropy": 0.29716769069433213, | |
| "epoch": 0.6948869066581714, | |
| "grad_norm": 0.9371346831321716, | |
| "learning_rate": 0.00015164938476372702, | |
| "loss": 0.29703765869140625, | |
| "mean_token_accuracy": 0.9095548176765442, | |
| "num_tokens": 1358830404.0, | |
| "step": 17450 | |
| }, | |
| { | |
| "entropy": 0.28911288678646085, | |
| "epoch": 0.6968779866199426, | |
| "grad_norm": 0.6537544131278992, | |
| "learning_rate": 0.00015137302040871297, | |
| "loss": 0.28646724700927734, | |
| "mean_token_accuracy": 0.9115975719690322, | |
| "num_tokens": 1362857525.0, | |
| "step": 17500 | |
| }, | |
| { | |
| "entropy": 0.29342864006757735, | |
| "epoch": 0.6988690665817139, | |
| "grad_norm": 0.7813704609870911, | |
| "learning_rate": 0.0001510961219649799, | |
| "loss": 0.2936690902709961, | |
| "mean_token_accuracy": 0.9103942143917084, | |
| "num_tokens": 1366849276.0, | |
| "step": 17550 | |
| }, | |
| { | |
| "entropy": 0.2983704087138176, | |
| "epoch": 0.7008601465434852, | |
| "grad_norm": 1.6893558502197266, | |
| "learning_rate": 0.0001508186923112437, | |
| "loss": 0.29162357330322264, | |
| "mean_token_accuracy": 0.9090755820274353, | |
| "num_tokens": 1370662227.0, | |
| "step": 17600 | |
| }, | |
| { | |
| "entropy": 0.29516899332404134, | |
| "epoch": 0.7028512265052564, | |
| "grad_norm": 0.8770793080329895, | |
| "learning_rate": 0.00015054073433174302, | |
| "loss": 0.29333614349365233, | |
| "mean_token_accuracy": 0.9101587522029877, | |
| "num_tokens": 1374576458.0, | |
| "step": 17650 | |
| }, | |
| { | |
| "entropy": 0.2941126237809658, | |
| "epoch": 0.7048423064670277, | |
| "grad_norm": 0.9740257263183594, | |
| "learning_rate": 0.00015026225091620903, | |
| "loss": 0.28899494171142576, | |
| "mean_token_accuracy": 0.9100642812252044, | |
| "num_tokens": 1378537578.0, | |
| "step": 17700 | |
| }, | |
| { | |
| "entropy": 0.2944283872842789, | |
| "epoch": 0.706833386428799, | |
| "grad_norm": 0.6625619530677795, | |
| "learning_rate": 0.0001499832449598356, | |
| "loss": 0.29200618743896484, | |
| "mean_token_accuracy": 0.9104565042257309, | |
| "num_tokens": 1382448767.0, | |
| "step": 17750 | |
| }, | |
| { | |
| "entropy": 0.2947066053748131, | |
| "epoch": 0.7088244663905703, | |
| "grad_norm": 2.771057605743408, | |
| "learning_rate": 0.00014970371936324895, | |
| "loss": 0.2908017158508301, | |
| "mean_token_accuracy": 0.9104269522428513, | |
| "num_tokens": 1386405902.0, | |
| "step": 17800 | |
| }, | |
| { | |
| "entropy": 0.29732597529888155, | |
| "epoch": 0.7108155463523416, | |
| "grad_norm": 0.5472576022148132, | |
| "learning_rate": 0.0001494236770324778, | |
| "loss": 0.29684444427490236, | |
| "mean_token_accuracy": 0.910416322350502, | |
| "num_tokens": 1390358474.0, | |
| "step": 17850 | |
| }, | |
| { | |
| "entropy": 0.29257937729358674, | |
| "epoch": 0.7128066263141127, | |
| "grad_norm": 1.0813127756118774, | |
| "learning_rate": 0.0001491431208789228, | |
| "loss": 0.2898148727416992, | |
| "mean_token_accuracy": 0.9104039406776429, | |
| "num_tokens": 1394304161.0, | |
| "step": 17900 | |
| }, | |
| { | |
| "entropy": 0.310485008507967, | |
| "epoch": 0.714797706275884, | |
| "grad_norm": 1.656209945678711, | |
| "learning_rate": 0.00014886205381932664, | |
| "loss": 0.30217992782592773, | |
| "mean_token_accuracy": 0.9074555486440659, | |
| "num_tokens": 1398216238.0, | |
| "step": 17950 | |
| }, | |
| { | |
| "entropy": 0.2969197675585747, | |
| "epoch": 0.7167887862376553, | |
| "grad_norm": 1.2976051568984985, | |
| "learning_rate": 0.00014858047877574333, | |
| "loss": 0.29079368591308596, | |
| "mean_token_accuracy": 0.9102236968278885, | |
| "num_tokens": 1402161098.0, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 0.7167887862376553, | |
| "eval_entropy": 0.2776823304002247, | |
| "eval_loss": 0.27006426453590393, | |
| "eval_mean_token_accuracy": 0.9105973158563886, | |
| "eval_num_tokens": 1402161098.0, | |
| "eval_runtime": 97.7364, | |
| "eval_samples_per_second": 10.232, | |
| "eval_steps_per_second": 0.645, | |
| "step": 18000 | |
| }, | |
| { | |
| "entropy": 0.3027782902121544, | |
| "epoch": 0.7187798661994266, | |
| "grad_norm": 0.7084875106811523, | |
| "learning_rate": 0.0001482983986755082, | |
| "loss": 0.3031645965576172, | |
| "mean_token_accuracy": 0.9077838987112046, | |
| "num_tokens": 1406155433.0, | |
| "step": 18050 | |
| }, | |
| { | |
| "entropy": 0.2902723887562752, | |
| "epoch": 0.7207709461611979, | |
| "grad_norm": 0.6873666644096375, | |
| "learning_rate": 0.00014801581645120724, | |
| "loss": 0.28865398406982423, | |
| "mean_token_accuracy": 0.9106548523902893, | |
| "num_tokens": 1410067965.0, | |
| "step": 18100 | |
| }, | |
| { | |
| "entropy": 0.3013344857096672, | |
| "epoch": 0.7227620261229691, | |
| "grad_norm": 1.7805606126785278, | |
| "learning_rate": 0.0001477327350406466, | |
| "loss": 0.30110008239746094, | |
| "mean_token_accuracy": 0.9085298550128936, | |
| "num_tokens": 1414072722.0, | |
| "step": 18150 | |
| }, | |
| { | |
| "entropy": 0.28914564475417137, | |
| "epoch": 0.7247531060847404, | |
| "grad_norm": 0.7139489054679871, | |
| "learning_rate": 0.00014744915738682223, | |
| "loss": 0.2870366668701172, | |
| "mean_token_accuracy": 0.9122559130191803, | |
| "num_tokens": 1418102886.0, | |
| "step": 18200 | |
| }, | |
| { | |
| "entropy": 0.28566819444298747, | |
| "epoch": 0.7267441860465116, | |
| "grad_norm": 1.1385061740875244, | |
| "learning_rate": 0.00014716508643788906, | |
| "loss": 0.2867041015625, | |
| "mean_token_accuracy": 0.9124609512090683, | |
| "num_tokens": 1422071589.0, | |
| "step": 18250 | |
| }, | |
| { | |
| "entropy": 0.29601184636354444, | |
| "epoch": 0.7287352660082829, | |
| "grad_norm": 2.188579559326172, | |
| "learning_rate": 0.00014688052514713056, | |
| "loss": 0.2922092628479004, | |
| "mean_token_accuracy": 0.9099663990736008, | |
| "num_tokens": 1425915264.0, | |
| "step": 18300 | |
| }, | |
| { | |
| "entropy": 0.29879319921135905, | |
| "epoch": 0.7307263459700541, | |
| "grad_norm": 0.7400273680686951, | |
| "learning_rate": 0.00014659547647292786, | |
| "loss": 0.29849246978759764, | |
| "mean_token_accuracy": 0.9087599730491638, | |
| "num_tokens": 1429792362.0, | |
| "step": 18350 | |
| }, | |
| { | |
| "entropy": 0.29069077476859095, | |
| "epoch": 0.7327174259318254, | |
| "grad_norm": 0.7535748481750488, | |
| "learning_rate": 0.00014630994337872907, | |
| "loss": 0.28666929244995115, | |
| "mean_token_accuracy": 0.9114148426055908, | |
| "num_tokens": 1433808948.0, | |
| "step": 18400 | |
| }, | |
| { | |
| "entropy": 0.28963286653161047, | |
| "epoch": 0.7347085058935967, | |
| "grad_norm": 0.6362102031707764, | |
| "learning_rate": 0.0001460239288330185, | |
| "loss": 0.2875527572631836, | |
| "mean_token_accuracy": 0.9118727374076844, | |
| "num_tokens": 1437675494.0, | |
| "step": 18450 | |
| }, | |
| { | |
| "entropy": 0.293488028049469, | |
| "epoch": 0.736699585855368, | |
| "grad_norm": 0.7438880801200867, | |
| "learning_rate": 0.00014573743580928577, | |
| "loss": 0.28785888671875, | |
| "mean_token_accuracy": 0.910496751666069, | |
| "num_tokens": 1441521509.0, | |
| "step": 18500 | |
| }, | |
| { | |
| "entropy": 0.30329610586166383, | |
| "epoch": 0.7386906658171393, | |
| "grad_norm": 1.0525658130645752, | |
| "learning_rate": 0.00014545046728599488, | |
| "loss": 0.30172367095947267, | |
| "mean_token_accuracy": 0.9077435076236725, | |
| "num_tokens": 1445204302.0, | |
| "step": 18550 | |
| }, | |
| { | |
| "entropy": 0.2981826615333557, | |
| "epoch": 0.7406817457789104, | |
| "grad_norm": 1.3919222354888916, | |
| "learning_rate": 0.00014516302624655326, | |
| "loss": 0.29980438232421874, | |
| "mean_token_accuracy": 0.9100686204433441, | |
| "num_tokens": 1449194930.0, | |
| "step": 18600 | |
| }, | |
| { | |
| "entropy": 0.2883556368947029, | |
| "epoch": 0.7426728257406817, | |
| "grad_norm": 1.6801507472991943, | |
| "learning_rate": 0.00014487511567928073, | |
| "loss": 0.2883398818969727, | |
| "mean_token_accuracy": 0.9120700871944427, | |
| "num_tokens": 1453217275.0, | |
| "step": 18650 | |
| }, | |
| { | |
| "entropy": 0.2880104921758175, | |
| "epoch": 0.744663905702453, | |
| "grad_norm": 0.7567607760429382, | |
| "learning_rate": 0.00014458673857737858, | |
| "loss": 0.2865783882141113, | |
| "mean_token_accuracy": 0.9125986665487289, | |
| "num_tokens": 1457091456.0, | |
| "step": 18700 | |
| }, | |
| { | |
| "entropy": 0.30921834856271746, | |
| "epoch": 0.7466549856642243, | |
| "grad_norm": 2.5473389625549316, | |
| "learning_rate": 0.00014429789793889811, | |
| "loss": 0.30196685791015626, | |
| "mean_token_accuracy": 0.9076807588338852, | |
| "num_tokens": 1461061681.0, | |
| "step": 18750 | |
| }, | |
| { | |
| "entropy": 0.3230498093366623, | |
| "epoch": 0.7486460656259956, | |
| "grad_norm": 2.3257391452789307, | |
| "learning_rate": 0.0001440085967667099, | |
| "loss": 0.31749179840087893, | |
| "mean_token_accuracy": 0.9054018408060074, | |
| "num_tokens": 1464864891.0, | |
| "step": 18800 | |
| }, | |
| { | |
| "entropy": 0.2896036101877689, | |
| "epoch": 0.7506371455877668, | |
| "grad_norm": 3.0310580730438232, | |
| "learning_rate": 0.00014371883806847219, | |
| "loss": 0.29054962158203124, | |
| "mean_token_accuracy": 0.9120853686332703, | |
| "num_tokens": 1468777272.0, | |
| "step": 18850 | |
| }, | |
| { | |
| "entropy": 0.2924629697203636, | |
| "epoch": 0.7526282255495381, | |
| "grad_norm": 4.587695121765137, | |
| "learning_rate": 0.00014342862485659997, | |
| "loss": 0.28793231964111327, | |
| "mean_token_accuracy": 0.9110544735193252, | |
| "num_tokens": 1472695008.0, | |
| "step": 18900 | |
| }, | |
| { | |
| "entropy": 0.2869010743498802, | |
| "epoch": 0.7546193055113093, | |
| "grad_norm": 1.2988804578781128, | |
| "learning_rate": 0.0001431379601482333, | |
| "loss": 0.28417259216308594, | |
| "mean_token_accuracy": 0.9118612110614777, | |
| "num_tokens": 1476515856.0, | |
| "step": 18950 | |
| }, | |
| { | |
| "entropy": 0.2902405472099781, | |
| "epoch": 0.7566103854730806, | |
| "grad_norm": 1.1833847761154175, | |
| "learning_rate": 0.00014284684696520632, | |
| "loss": 0.28866044998168944, | |
| "mean_token_accuracy": 0.911122555732727, | |
| "num_tokens": 1480466260.0, | |
| "step": 19000 | |
| }, | |
| { | |
| "entropy": 0.30060096830129623, | |
| "epoch": 0.7586014654348519, | |
| "grad_norm": 0.6701699495315552, | |
| "learning_rate": 0.00014255528833401546, | |
| "loss": 0.2944635009765625, | |
| "mean_token_accuracy": 0.9087423354387283, | |
| "num_tokens": 1484335907.0, | |
| "step": 19050 | |
| }, | |
| { | |
| "entropy": 0.2922394719719887, | |
| "epoch": 0.7605925453966231, | |
| "grad_norm": 0.6822696328163147, | |
| "learning_rate": 0.00014226328728578823, | |
| "loss": 0.28974374771118167, | |
| "mean_token_accuracy": 0.9104707038402557, | |
| "num_tokens": 1488384107.0, | |
| "step": 19100 | |
| }, | |
| { | |
| "entropy": 0.29056561514735224, | |
| "epoch": 0.7625836253583944, | |
| "grad_norm": 0.663240373134613, | |
| "learning_rate": 0.00014197084685625173, | |
| "loss": 0.28836177825927733, | |
| "mean_token_accuracy": 0.9108587235212326, | |
| "num_tokens": 1492303395.0, | |
| "step": 19150 | |
| }, | |
| { | |
| "entropy": 0.29222132071852686, | |
| "epoch": 0.7645747053201657, | |
| "grad_norm": 0.961523711681366, | |
| "learning_rate": 0.00014167797008570086, | |
| "loss": 0.2904374313354492, | |
| "mean_token_accuracy": 0.9102330458164215, | |
| "num_tokens": 1496159763.0, | |
| "step": 19200 | |
| }, | |
| { | |
| "entropy": 0.29562861084938047, | |
| "epoch": 0.766565785281937, | |
| "grad_norm": 1.7865084409713745, | |
| "learning_rate": 0.00014138466001896685, | |
| "loss": 0.29582069396972654, | |
| "mean_token_accuracy": 0.9101934987306595, | |
| "num_tokens": 1499926969.0, | |
| "step": 19250 | |
| }, | |
| { | |
| "entropy": 0.28988956794142723, | |
| "epoch": 0.7685568652437081, | |
| "grad_norm": 0.6116553544998169, | |
| "learning_rate": 0.0001410909197053857, | |
| "loss": 0.2851591110229492, | |
| "mean_token_accuracy": 0.9100542116165161, | |
| "num_tokens": 1503862695.0, | |
| "step": 19300 | |
| }, | |
| { | |
| "entropy": 0.29101185873150826, | |
| "epoch": 0.7705479452054794, | |
| "grad_norm": 1.3416796922683716, | |
| "learning_rate": 0.00014079675219876633, | |
| "loss": 0.2863225173950195, | |
| "mean_token_accuracy": 0.9115383142232895, | |
| "num_tokens": 1507760784.0, | |
| "step": 19350 | |
| }, | |
| { | |
| "entropy": 0.2864786148071289, | |
| "epoch": 0.7725390251672507, | |
| "grad_norm": 0.9288985729217529, | |
| "learning_rate": 0.00014050216055735883, | |
| "loss": 0.28394302368164065, | |
| "mean_token_accuracy": 0.9118870466947555, | |
| "num_tokens": 1511621148.0, | |
| "step": 19400 | |
| }, | |
| { | |
| "entropy": 0.28903682947158815, | |
| "epoch": 0.774530105129022, | |
| "grad_norm": 0.806553065776825, | |
| "learning_rate": 0.00014020714784382284, | |
| "loss": 0.28795175552368163, | |
| "mean_token_accuracy": 0.9115160834789277, | |
| "num_tokens": 1515475336.0, | |
| "step": 19450 | |
| }, | |
| { | |
| "entropy": 0.2937713272869587, | |
| "epoch": 0.7765211850907933, | |
| "grad_norm": 0.7800868153572083, | |
| "learning_rate": 0.00013991171712519549, | |
| "loss": 0.2913181304931641, | |
| "mean_token_accuracy": 0.9106004512310029, | |
| "num_tokens": 1519341000.0, | |
| "step": 19500 | |
| }, | |
| { | |
| "epoch": 0.7765211850907933, | |
| "eval_entropy": 0.2831347535053889, | |
| "eval_loss": 0.2765350937843323, | |
| "eval_mean_token_accuracy": 0.9100822115701342, | |
| "eval_num_tokens": 1519341000.0, | |
| "eval_runtime": 97.9023, | |
| "eval_samples_per_second": 10.214, | |
| "eval_steps_per_second": 0.643, | |
| "step": 19500 | |
| }, | |
| { | |
| "entropy": 0.3002046720683575, | |
| "epoch": 0.7785122650525645, | |
| "grad_norm": 0.9976291656494141, | |
| "learning_rate": 0.00013961587147285959, | |
| "loss": 0.2960696029663086, | |
| "mean_token_accuracy": 0.9085316699743271, | |
| "num_tokens": 1523229141.0, | |
| "step": 19550 | |
| }, | |
| { | |
| "entropy": 0.2912782900035381, | |
| "epoch": 0.7805033450143358, | |
| "grad_norm": 0.733523428440094, | |
| "learning_rate": 0.0001393196139625118, | |
| "loss": 0.2924472618103027, | |
| "mean_token_accuracy": 0.9113868337869644, | |
| "num_tokens": 1527144650.0, | |
| "step": 19600 | |
| }, | |
| { | |
| "entropy": 0.29683601841330526, | |
| "epoch": 0.782494424976107, | |
| "grad_norm": 3.6049697399139404, | |
| "learning_rate": 0.00013902294767413053, | |
| "loss": 0.29792266845703125, | |
| "mean_token_accuracy": 0.9101977044343948, | |
| "num_tokens": 1531082847.0, | |
| "step": 19650 | |
| }, | |
| { | |
| "entropy": 0.3064700323343277, | |
| "epoch": 0.7844855049378783, | |
| "grad_norm": 1.5944907665252686, | |
| "learning_rate": 0.00013872587569194398, | |
| "loss": 0.3019302558898926, | |
| "mean_token_accuracy": 0.9075633251667022, | |
| "num_tokens": 1534948012.0, | |
| "step": 19700 | |
| }, | |
| { | |
| "entropy": 0.29351558551192286, | |
| "epoch": 0.7864765848996496, | |
| "grad_norm": 1.3509517908096313, | |
| "learning_rate": 0.00013842840110439808, | |
| "loss": 0.28674448013305665, | |
| "mean_token_accuracy": 0.9099786525964737, | |
| "num_tokens": 1538734393.0, | |
| "step": 19750 | |
| }, | |
| { | |
| "entropy": 0.3015498013794422, | |
| "epoch": 0.7884676648614208, | |
| "grad_norm": 1.0253088474273682, | |
| "learning_rate": 0.00013813052700412427, | |
| "loss": 0.2966987419128418, | |
| "mean_token_accuracy": 0.9085263866186142, | |
| "num_tokens": 1542526844.0, | |
| "step": 19800 | |
| }, | |
| { | |
| "entropy": 0.28495381683111193, | |
| "epoch": 0.7904587448231921, | |
| "grad_norm": 0.5539796352386475, | |
| "learning_rate": 0.00013783225648790755, | |
| "loss": 0.2807819175720215, | |
| "mean_token_accuracy": 0.9120886480808258, | |
| "num_tokens": 1546491227.0, | |
| "step": 19850 | |
| }, | |
| { | |
| "entropy": 0.29954033985733985, | |
| "epoch": 0.7924498247849634, | |
| "grad_norm": 0.7651054859161377, | |
| "learning_rate": 0.0001375335926566541, | |
| "loss": 0.29225250244140627, | |
| "mean_token_accuracy": 0.9085421603918076, | |
| "num_tokens": 1550363335.0, | |
| "step": 19900 | |
| }, | |
| { | |
| "entropy": 0.30176965445280074, | |
| "epoch": 0.7944409047467347, | |
| "grad_norm": 0.857192873954773, | |
| "learning_rate": 0.0001372345386153592, | |
| "loss": 0.2950387954711914, | |
| "mean_token_accuracy": 0.9084928894042968, | |
| "num_tokens": 1554358423.0, | |
| "step": 19950 | |
| }, | |
| { | |
| "entropy": 0.2943139246106148, | |
| "epoch": 0.7964319847085058, | |
| "grad_norm": 1.0411840677261353, | |
| "learning_rate": 0.00013693509747307475, | |
| "loss": 0.2914638137817383, | |
| "mean_token_accuracy": 0.9101592683792115, | |
| "num_tokens": 1558255298.0, | |
| "step": 20000 | |
| }, | |
| { | |
| "entropy": 0.2895458571612835, | |
| "epoch": 0.7984230646702771, | |
| "grad_norm": 0.6626200079917908, | |
| "learning_rate": 0.0001366352723428772, | |
| "loss": 0.28636066436767577, | |
| "mean_token_accuracy": 0.9115378284454345, | |
| "num_tokens": 1562020206.0, | |
| "step": 20050 | |
| }, | |
| { | |
| "entropy": 0.29198448449373243, | |
| "epoch": 0.8004141446320484, | |
| "grad_norm": 0.5825337171554565, | |
| "learning_rate": 0.0001363350663418349, | |
| "loss": 0.28708467483520506, | |
| "mean_token_accuracy": 0.9096462821960449, | |
| "num_tokens": 1565841289.0, | |
| "step": 20100 | |
| }, | |
| { | |
| "entropy": 0.29816041797399523, | |
| "epoch": 0.8024052245938197, | |
| "grad_norm": 1.3403664827346802, | |
| "learning_rate": 0.00013603448259097594, | |
| "loss": 0.2884747314453125, | |
| "mean_token_accuracy": 0.9092539829015732, | |
| "num_tokens": 1569616432.0, | |
| "step": 20150 | |
| }, | |
| { | |
| "entropy": 0.28857394456863406, | |
| "epoch": 0.804396304555591, | |
| "grad_norm": 0.6245424151420593, | |
| "learning_rate": 0.0001357335242152556, | |
| "loss": 0.2860875701904297, | |
| "mean_token_accuracy": 0.9124082696437835, | |
| "num_tokens": 1573553700.0, | |
| "step": 20200 | |
| }, | |
| { | |
| "entropy": 0.28813895463943484, | |
| "epoch": 0.8063873845173622, | |
| "grad_norm": 1.2858823537826538, | |
| "learning_rate": 0.00013543219434352378, | |
| "loss": 0.28842620849609374, | |
| "mean_token_accuracy": 0.9118660360574722, | |
| "num_tokens": 1577421693.0, | |
| "step": 20250 | |
| }, | |
| { | |
| "entropy": 0.2930313354730606, | |
| "epoch": 0.8083784644791335, | |
| "grad_norm": 0.7111997008323669, | |
| "learning_rate": 0.00013513049610849276, | |
| "loss": 0.29174827575683593, | |
| "mean_token_accuracy": 0.909861397743225, | |
| "num_tokens": 1581253990.0, | |
| "step": 20300 | |
| }, | |
| { | |
| "entropy": 0.29792274728417395, | |
| "epoch": 0.8103695444409047, | |
| "grad_norm": 0.805564284324646, | |
| "learning_rate": 0.00013482843264670417, | |
| "loss": 0.29509361267089845, | |
| "mean_token_accuracy": 0.9099700027704238, | |
| "num_tokens": 1585185270.0, | |
| "step": 20350 | |
| }, | |
| { | |
| "entropy": 0.2874870964884758, | |
| "epoch": 0.812360624402676, | |
| "grad_norm": 1.422304391860962, | |
| "learning_rate": 0.00013452600709849683, | |
| "loss": 0.2821670913696289, | |
| "mean_token_accuracy": 0.9122043216228485, | |
| "num_tokens": 1588938656.0, | |
| "step": 20400 | |
| }, | |
| { | |
| "entropy": 0.2863489907979965, | |
| "epoch": 0.8143517043644473, | |
| "grad_norm": 0.6061295866966248, | |
| "learning_rate": 0.00013422322260797388, | |
| "loss": 0.2792085266113281, | |
| "mean_token_accuracy": 0.9122142070531845, | |
| "num_tokens": 1592889695.0, | |
| "step": 20450 | |
| }, | |
| { | |
| "entropy": 0.2885513660311699, | |
| "epoch": 0.8163427843262185, | |
| "grad_norm": 0.8144425749778748, | |
| "learning_rate": 0.00013392008232297007, | |
| "loss": 0.2867462158203125, | |
| "mean_token_accuracy": 0.9113090354204177, | |
| "num_tokens": 1596752777.0, | |
| "step": 20500 | |
| }, | |
| { | |
| "entropy": 0.29169064000248907, | |
| "epoch": 0.8183338642879898, | |
| "grad_norm": 0.6729059219360352, | |
| "learning_rate": 0.00013361658939501918, | |
| "loss": 0.28905179977416995, | |
| "mean_token_accuracy": 0.9103005719184876, | |
| "num_tokens": 1600576446.0, | |
| "step": 20550 | |
| }, | |
| { | |
| "entropy": 0.2888325278460979, | |
| "epoch": 0.8203249442497611, | |
| "grad_norm": 0.6104068756103516, | |
| "learning_rate": 0.00013331274697932102, | |
| "loss": 0.2853478813171387, | |
| "mean_token_accuracy": 0.9112936478853225, | |
| "num_tokens": 1604457022.0, | |
| "step": 20600 | |
| }, | |
| { | |
| "entropy": 0.2846215434372425, | |
| "epoch": 0.8223160242115324, | |
| "grad_norm": 0.7673185467720032, | |
| "learning_rate": 0.00013300855823470897, | |
| "loss": 0.27966604232788084, | |
| "mean_token_accuracy": 0.9125616484880448, | |
| "num_tokens": 1608292991.0, | |
| "step": 20650 | |
| }, | |
| { | |
| "entropy": 0.29237379983067513, | |
| "epoch": 0.8243071041733036, | |
| "grad_norm": 0.6417551040649414, | |
| "learning_rate": 0.0001327040263236168, | |
| "loss": 0.2925300216674805, | |
| "mean_token_accuracy": 0.9110818821191787, | |
| "num_tokens": 1612190418.0, | |
| "step": 20700 | |
| }, | |
| { | |
| "entropy": 0.2841272747516632, | |
| "epoch": 0.8262981841350748, | |
| "grad_norm": 0.7522392868995667, | |
| "learning_rate": 0.00013239915441204595, | |
| "loss": 0.2833536529541016, | |
| "mean_token_accuracy": 0.9123351633548736, | |
| "num_tokens": 1616165303.0, | |
| "step": 20750 | |
| }, | |
| { | |
| "entropy": 0.2900773739814758, | |
| "epoch": 0.8282892640968461, | |
| "grad_norm": 0.7694281339645386, | |
| "learning_rate": 0.00013209394566953274, | |
| "loss": 0.28611156463623044, | |
| "mean_token_accuracy": 0.9110399371385575, | |
| "num_tokens": 1620119842.0, | |
| "step": 20800 | |
| }, | |
| { | |
| "entropy": 0.2869560627639294, | |
| "epoch": 0.8302803440586174, | |
| "grad_norm": 0.612058162689209, | |
| "learning_rate": 0.00013178840326911505, | |
| "loss": 0.28881828308105467, | |
| "mean_token_accuracy": 0.9115813100337982, | |
| "num_tokens": 1624074063.0, | |
| "step": 20850 | |
| }, | |
| { | |
| "entropy": 0.28707610845565795, | |
| "epoch": 0.8322714240203887, | |
| "grad_norm": 4.706964015960693, | |
| "learning_rate": 0.0001314825303872998, | |
| "loss": 0.28341548919677734, | |
| "mean_token_accuracy": 0.9111490190029145, | |
| "num_tokens": 1627862759.0, | |
| "step": 20900 | |
| }, | |
| { | |
| "entropy": 0.29098447114229203, | |
| "epoch": 0.83426250398216, | |
| "grad_norm": 83.11225891113281, | |
| "learning_rate": 0.00013117633020402948, | |
| "loss": 0.29449493408203126, | |
| "mean_token_accuracy": 0.9103209149837493, | |
| "num_tokens": 1631880304.0, | |
| "step": 20950 | |
| }, | |
| { | |
| "entropy": 0.28104673102498057, | |
| "epoch": 0.8362535839439312, | |
| "grad_norm": 0.9187382459640503, | |
| "learning_rate": 0.0001308698059026495, | |
| "loss": 0.2771605110168457, | |
| "mean_token_accuracy": 0.9139135485887527, | |
| "num_tokens": 1635803010.0, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 0.8362535839439312, | |
| "eval_entropy": 0.272681377709858, | |
| "eval_loss": 0.2638475000858307, | |
| "eval_mean_token_accuracy": 0.9123603133928209, | |
| "eval_num_tokens": 1635803010.0, | |
| "eval_runtime": 98.3478, | |
| "eval_samples_per_second": 10.168, | |
| "eval_steps_per_second": 0.641, | |
| "step": 21000 | |
| }, | |
| { | |
| "entropy": 0.27485424920916557, | |
| "epoch": 0.8382446639057024, | |
| "grad_norm": 0.7038730382919312, | |
| "learning_rate": 0.00013056296066987473, | |
| "loss": 0.27148242950439455, | |
| "mean_token_accuracy": 0.9148015469312668, | |
| "num_tokens": 1639495679.0, | |
| "step": 21050 | |
| }, | |
| { | |
| "entropy": 0.28288276672363283, | |
| "epoch": 0.8402357438674737, | |
| "grad_norm": 0.577369213104248, | |
| "learning_rate": 0.00013025579769575666, | |
| "loss": 0.28407854080200196, | |
| "mean_token_accuracy": 0.913193479180336, | |
| "num_tokens": 1643444580.0, | |
| "step": 21100 | |
| }, | |
| { | |
| "entropy": 0.2863396653532982, | |
| "epoch": 0.842226823829245, | |
| "grad_norm": 0.675909161567688, | |
| "learning_rate": 0.00012994832017365, | |
| "loss": 0.28254219055175783, | |
| "mean_token_accuracy": 0.9116067427396775, | |
| "num_tokens": 1647401591.0, | |
| "step": 21150 | |
| }, | |
| { | |
| "entropy": 0.2777939510345459, | |
| "epoch": 0.8442179037910162, | |
| "grad_norm": 0.6068330407142639, | |
| "learning_rate": 0.00012964053130017965, | |
| "loss": 0.2754404067993164, | |
| "mean_token_accuracy": 0.9133421510457993, | |
| "num_tokens": 1651250447.0, | |
| "step": 21200 | |
| }, | |
| { | |
| "entropy": 0.27697601169347763, | |
| "epoch": 0.8462089837527875, | |
| "grad_norm": 0.6943087577819824, | |
| "learning_rate": 0.00012933243427520744, | |
| "loss": 0.2733424949645996, | |
| "mean_token_accuracy": 0.9146704155206681, | |
| "num_tokens": 1655031979.0, | |
| "step": 21250 | |
| }, | |
| { | |
| "entropy": 0.28300220489501954, | |
| "epoch": 0.8482000637145588, | |
| "grad_norm": 0.6098906993865967, | |
| "learning_rate": 0.00012902403230179876, | |
| "loss": 0.27838035583496096, | |
| "mean_token_accuracy": 0.9125377869606018, | |
| "num_tokens": 1658919160.0, | |
| "step": 21300 | |
| }, | |
| { | |
| "entropy": 0.28187712758779526, | |
| "epoch": 0.8501911436763301, | |
| "grad_norm": 0.6931467652320862, | |
| "learning_rate": 0.00012871532858618938, | |
| "loss": 0.27799694061279295, | |
| "mean_token_accuracy": 0.9131047081947327, | |
| "num_tokens": 1662939793.0, | |
| "step": 21350 | |
| }, | |
| { | |
| "entropy": 0.277739409506321, | |
| "epoch": 0.8521822236381013, | |
| "grad_norm": 1.1240650415420532, | |
| "learning_rate": 0.00012840632633775206, | |
| "loss": 0.2785769462585449, | |
| "mean_token_accuracy": 0.9145133805274963, | |
| "num_tokens": 1666887365.0, | |
| "step": 21400 | |
| }, | |
| { | |
| "entropy": 0.284853600114584, | |
| "epoch": 0.8541733035998725, | |
| "grad_norm": 0.633203387260437, | |
| "learning_rate": 0.00012809702876896318, | |
| "loss": 0.283808536529541, | |
| "mean_token_accuracy": 0.9126669526100158, | |
| "num_tokens": 1670758104.0, | |
| "step": 21450 | |
| }, | |
| { | |
| "entropy": 0.2907887764275074, | |
| "epoch": 0.8561643835616438, | |
| "grad_norm": 0.6257302761077881, | |
| "learning_rate": 0.00012778743909536933, | |
| "loss": 0.28514747619628905, | |
| "mean_token_accuracy": 0.9115799862146378, | |
| "num_tokens": 1674580664.0, | |
| "step": 21500 | |
| }, | |
| { | |
| "entropy": 0.2757272598147392, | |
| "epoch": 0.8581554635234151, | |
| "grad_norm": 0.8768251538276672, | |
| "learning_rate": 0.000127477560535554, | |
| "loss": 0.2793731117248535, | |
| "mean_token_accuracy": 0.9143383550643921, | |
| "num_tokens": 1678625665.0, | |
| "step": 21550 | |
| }, | |
| { | |
| "entropy": 0.283792520314455, | |
| "epoch": 0.8601465434851864, | |
| "grad_norm": 0.7027562856674194, | |
| "learning_rate": 0.0001271673963111039, | |
| "loss": 0.2817673110961914, | |
| "mean_token_accuracy": 0.9126435059309006, | |
| "num_tokens": 1682588441.0, | |
| "step": 21600 | |
| }, | |
| { | |
| "entropy": 0.28072837233543396, | |
| "epoch": 0.8621376234469577, | |
| "grad_norm": 0.6573081612586975, | |
| "learning_rate": 0.00012685694964657577, | |
| "loss": 0.27910221099853516, | |
| "mean_token_accuracy": 0.9130741447210312, | |
| "num_tokens": 1686440667.0, | |
| "step": 21650 | |
| }, | |
| { | |
| "entropy": 0.29020294785499573, | |
| "epoch": 0.8641287034087289, | |
| "grad_norm": 0.8147639036178589, | |
| "learning_rate": 0.00012654622376946244, | |
| "loss": 0.28830547332763673, | |
| "mean_token_accuracy": 0.9110956585407257, | |
| "num_tokens": 1690334875.0, | |
| "step": 21700 | |
| }, | |
| { | |
| "entropy": 0.2864123769104481, | |
| "epoch": 0.8661197833705001, | |
| "grad_norm": 0.6632215976715088, | |
| "learning_rate": 0.0001262352219101597, | |
| "loss": 0.284028205871582, | |
| "mean_token_accuracy": 0.9122103857994079, | |
| "num_tokens": 1694351164.0, | |
| "step": 21750 | |
| }, | |
| { | |
| "entropy": 0.27724299728870394, | |
| "epoch": 0.8681108633322714, | |
| "grad_norm": 0.6660967469215393, | |
| "learning_rate": 0.00012592394730193243, | |
| "loss": 0.27416006088256833, | |
| "mean_token_accuracy": 0.9146931290626525, | |
| "num_tokens": 1698319175.0, | |
| "step": 21800 | |
| }, | |
| { | |
| "entropy": 0.2856806117296219, | |
| "epoch": 0.8701019432940427, | |
| "grad_norm": 0.6249071955680847, | |
| "learning_rate": 0.00012561240318088117, | |
| "loss": 0.2827252197265625, | |
| "mean_token_accuracy": 0.9123916620016098, | |
| "num_tokens": 1702324421.0, | |
| "step": 21850 | |
| }, | |
| { | |
| "entropy": 0.27884934067726136, | |
| "epoch": 0.872093023255814, | |
| "grad_norm": 0.6073641180992126, | |
| "learning_rate": 0.00012530059278590834, | |
| "loss": 0.2758992767333984, | |
| "mean_token_accuracy": 0.9137480568885803, | |
| "num_tokens": 1706271279.0, | |
| "step": 21900 | |
| }, | |
| { | |
| "entropy": 0.27764024019241335, | |
| "epoch": 0.8740841032175852, | |
| "grad_norm": 0.678048849105835, | |
| "learning_rate": 0.00012498851935868462, | |
| "loss": 0.2740013885498047, | |
| "mean_token_accuracy": 0.9140461575984955, | |
| "num_tokens": 1710144015.0, | |
| "step": 21950 | |
| }, | |
| { | |
| "entropy": 0.2866260698437691, | |
| "epoch": 0.8760751831793565, | |
| "grad_norm": 0.552971363067627, | |
| "learning_rate": 0.00012467618614361522, | |
| "loss": 0.2822286796569824, | |
| "mean_token_accuracy": 0.9123277628421783, | |
| "num_tokens": 1714077414.0, | |
| "step": 22000 | |
| }, | |
| { | |
| "entropy": 0.28236930549144745, | |
| "epoch": 0.8780662631411278, | |
| "grad_norm": 0.794441819190979, | |
| "learning_rate": 0.00012436359638780625, | |
| "loss": 0.2772479248046875, | |
| "mean_token_accuracy": 0.9128434807062149, | |
| "num_tokens": 1717927801.0, | |
| "step": 22050 | |
| }, | |
| { | |
| "entropy": 0.281161185503006, | |
| "epoch": 0.880057343102899, | |
| "grad_norm": 0.6617610454559326, | |
| "learning_rate": 0.0001240507533410309, | |
| "loss": 0.2774828910827637, | |
| "mean_token_accuracy": 0.9129059422016144, | |
| "num_tokens": 1721773313.0, | |
| "step": 22100 | |
| }, | |
| { | |
| "entropy": 0.2819554080069065, | |
| "epoch": 0.8820484230646702, | |
| "grad_norm": 0.6973550915718079, | |
| "learning_rate": 0.00012373766025569553, | |
| "loss": 0.28294713973999025, | |
| "mean_token_accuracy": 0.912370182275772, | |
| "num_tokens": 1725624454.0, | |
| "step": 22150 | |
| }, | |
| { | |
| "entropy": 0.27646703749895096, | |
| "epoch": 0.8840395030264415, | |
| "grad_norm": 0.6695847511291504, | |
| "learning_rate": 0.00012342432038680613, | |
| "loss": 0.2731535530090332, | |
| "mean_token_accuracy": 0.9140887254476547, | |
| "num_tokens": 1729506204.0, | |
| "step": 22200 | |
| }, | |
| { | |
| "entropy": 0.2871167133748531, | |
| "epoch": 0.8860305829882128, | |
| "grad_norm": 0.6398441791534424, | |
| "learning_rate": 0.00012311073699193417, | |
| "loss": 0.2833348655700684, | |
| "mean_token_accuracy": 0.9114724487066269, | |
| "num_tokens": 1733325644.0, | |
| "step": 22250 | |
| }, | |
| { | |
| "entropy": 0.2782342202961445, | |
| "epoch": 0.8880216629499841, | |
| "grad_norm": 0.7357836961746216, | |
| "learning_rate": 0.00012279691333118295, | |
| "loss": 0.27574146270751954, | |
| "mean_token_accuracy": 0.9140692150592804, | |
| "num_tokens": 1737060975.0, | |
| "step": 22300 | |
| }, | |
| { | |
| "entropy": 0.2777273601293564, | |
| "epoch": 0.8900127429117554, | |
| "grad_norm": 0.9853019118309021, | |
| "learning_rate": 0.00012248285266715372, | |
| "loss": 0.2757154083251953, | |
| "mean_token_accuracy": 0.9137124174833298, | |
| "num_tokens": 1740993084.0, | |
| "step": 22350 | |
| }, | |
| { | |
| "entropy": 0.28363671705126764, | |
| "epoch": 0.8920038228735266, | |
| "grad_norm": 1.481124997138977, | |
| "learning_rate": 0.00012216855826491157, | |
| "loss": 0.27882377624511717, | |
| "mean_token_accuracy": 0.9136800271272659, | |
| "num_tokens": 1744954440.0, | |
| "step": 22400 | |
| }, | |
| { | |
| "entropy": 0.294609692543745, | |
| "epoch": 0.8939949028352978, | |
| "grad_norm": 1.5501596927642822, | |
| "learning_rate": 0.0001218540333919516, | |
| "loss": 0.28765769958496096, | |
| "mean_token_accuracy": 0.909398307800293, | |
| "num_tokens": 1748996368.0, | |
| "step": 22450 | |
| }, | |
| { | |
| "entropy": 0.28076896131038664, | |
| "epoch": 0.8959859827970691, | |
| "grad_norm": 0.7389530539512634, | |
| "learning_rate": 0.00012153928131816508, | |
| "loss": 0.2751160621643066, | |
| "mean_token_accuracy": 0.9133437407016755, | |
| "num_tokens": 1752755641.0, | |
| "step": 22500 | |
| }, | |
| { | |
| "epoch": 0.8959859827970691, | |
| "eval_entropy": 0.2637722234404276, | |
| "eval_loss": 0.26361361145973206, | |
| "eval_mean_token_accuracy": 0.9137998251687913, | |
| "eval_num_tokens": 1752755641.0, | |
| "eval_runtime": 97.9442, | |
| "eval_samples_per_second": 10.21, | |
| "eval_steps_per_second": 0.643, | |
| "step": 22500 | |
| }, | |
| { | |
| "entropy": 0.28221323758363726, | |
| "epoch": 0.8979770627588404, | |
| "grad_norm": 1.2229335308074951, | |
| "learning_rate": 0.00012122430531580518, | |
| "loss": 0.2809852981567383, | |
| "mean_token_accuracy": 0.9124694418907165, | |
| "num_tokens": 1756678555.0, | |
| "step": 22550 | |
| }, | |
| { | |
| "entropy": 0.27395280748605727, | |
| "epoch": 0.8999681427206117, | |
| "grad_norm": 0.9872536659240723, | |
| "learning_rate": 0.0001209091086594532, | |
| "loss": 0.2725690841674805, | |
| "mean_token_accuracy": 0.9150059783458709, | |
| "num_tokens": 1760475624.0, | |
| "step": 22600 | |
| }, | |
| { | |
| "entropy": 0.2766468720138073, | |
| "epoch": 0.9019592226823829, | |
| "grad_norm": 0.7842338681221008, | |
| "learning_rate": 0.00012059369462598434, | |
| "loss": 0.2731148147583008, | |
| "mean_token_accuracy": 0.9147698014974595, | |
| "num_tokens": 1764358750.0, | |
| "step": 22650 | |
| }, | |
| { | |
| "entropy": 0.2784818311035633, | |
| "epoch": 0.9039503026441542, | |
| "grad_norm": 1.282228946685791, | |
| "learning_rate": 0.00012027806649453375, | |
| "loss": 0.271495475769043, | |
| "mean_token_accuracy": 0.9144920819997787, | |
| "num_tokens": 1768380630.0, | |
| "step": 22700 | |
| }, | |
| { | |
| "entropy": 0.2735689042508602, | |
| "epoch": 0.9059413826059255, | |
| "grad_norm": 0.7193032503128052, | |
| "learning_rate": 0.00011996222754646243, | |
| "loss": 0.2712744140625, | |
| "mean_token_accuracy": 0.9150397133827209, | |
| "num_tokens": 1772361438.0, | |
| "step": 22750 | |
| }, | |
| { | |
| "entropy": 0.2756591281294823, | |
| "epoch": 0.9079324625676968, | |
| "grad_norm": 1.0555336475372314, | |
| "learning_rate": 0.00011964618106532305, | |
| "loss": 0.2744468688964844, | |
| "mean_token_accuracy": 0.9148192751407623, | |
| "num_tokens": 1776341205.0, | |
| "step": 22800 | |
| }, | |
| { | |
| "entropy": 0.27616533294320106, | |
| "epoch": 0.9099235425294679, | |
| "grad_norm": 1.0314396619796753, | |
| "learning_rate": 0.00011932993033682594, | |
| "loss": 0.27454004287719724, | |
| "mean_token_accuracy": 0.9143799149990082, | |
| "num_tokens": 1780235661.0, | |
| "step": 22850 | |
| }, | |
| { | |
| "entropy": 0.26893782630562785, | |
| "epoch": 0.9119146224912392, | |
| "grad_norm": 1.0618172883987427, | |
| "learning_rate": 0.00011901347864880465, | |
| "loss": 0.2655687141418457, | |
| "mean_token_accuracy": 0.9161686682701111, | |
| "num_tokens": 1784043451.0, | |
| "step": 22900 | |
| }, | |
| { | |
| "entropy": 0.27906202867627145, | |
| "epoch": 0.9139057024530105, | |
| "grad_norm": 2.1218345165252686, | |
| "learning_rate": 0.00011869682929118218, | |
| "loss": 0.2727456474304199, | |
| "mean_token_accuracy": 0.9137376379966736, | |
| "num_tokens": 1787896121.0, | |
| "step": 22950 | |
| }, | |
| { | |
| "entropy": 0.27811609491705896, | |
| "epoch": 0.9158967824147818, | |
| "grad_norm": 3.4673054218292236, | |
| "learning_rate": 0.00011837998555593641, | |
| "loss": 0.2778665542602539, | |
| "mean_token_accuracy": 0.9137892138957977, | |
| "num_tokens": 1791848628.0, | |
| "step": 23000 | |
| }, | |
| { | |
| "entropy": 0.2751833336055279, | |
| "epoch": 0.9178878623765531, | |
| "grad_norm": 1.046271800994873, | |
| "learning_rate": 0.00011806295073706616, | |
| "loss": 0.2735797691345215, | |
| "mean_token_accuracy": 0.9143856483697891, | |
| "num_tokens": 1795804119.0, | |
| "step": 23050 | |
| }, | |
| { | |
| "entropy": 0.2802681289613247, | |
| "epoch": 0.9198789423383243, | |
| "grad_norm": 0.8259762525558472, | |
| "learning_rate": 0.00011774572813055664, | |
| "loss": 0.2742568016052246, | |
| "mean_token_accuracy": 0.9139988601207734, | |
| "num_tokens": 1799488591.0, | |
| "step": 23100 | |
| }, | |
| { | |
| "entropy": 0.278084037899971, | |
| "epoch": 0.9218700223000956, | |
| "grad_norm": 0.6955431699752808, | |
| "learning_rate": 0.00011742832103434554, | |
| "loss": 0.2744667434692383, | |
| "mean_token_accuracy": 0.914206195473671, | |
| "num_tokens": 1803610334.0, | |
| "step": 23150 | |
| }, | |
| { | |
| "entropy": 0.2704257676005363, | |
| "epoch": 0.9238611022618668, | |
| "grad_norm": 0.672705352306366, | |
| "learning_rate": 0.0001171107327482884, | |
| "loss": 0.2704540061950684, | |
| "mean_token_accuracy": 0.9158248662948608, | |
| "num_tokens": 1807570820.0, | |
| "step": 23200 | |
| }, | |
| { | |
| "entropy": 0.2817454455792904, | |
| "epoch": 0.9258521822236381, | |
| "grad_norm": 0.9053704738616943, | |
| "learning_rate": 0.00011679296657412457, | |
| "loss": 0.2776220703125, | |
| "mean_token_accuracy": 0.9126688486337662, | |
| "num_tokens": 1811374443.0, | |
| "step": 23250 | |
| }, | |
| { | |
| "entropy": 0.2809554924070835, | |
| "epoch": 0.9278432621854094, | |
| "grad_norm": 0.7101280689239502, | |
| "learning_rate": 0.00011647502581544272, | |
| "loss": 0.2807320022583008, | |
| "mean_token_accuracy": 0.9124188989400863, | |
| "num_tokens": 1815335476.0, | |
| "step": 23300 | |
| }, | |
| { | |
| "entropy": 0.2801722341775894, | |
| "epoch": 0.9298343421471806, | |
| "grad_norm": 0.9088023900985718, | |
| "learning_rate": 0.0001161569137776466, | |
| "loss": 0.2738960838317871, | |
| "mean_token_accuracy": 0.9143745040893555, | |
| "num_tokens": 1819119258.0, | |
| "step": 23350 | |
| }, | |
| { | |
| "entropy": 0.279843023866415, | |
| "epoch": 0.9318254221089519, | |
| "grad_norm": 0.7811700105667114, | |
| "learning_rate": 0.0001158386337679205, | |
| "loss": 0.27740699768066407, | |
| "mean_token_accuracy": 0.9128563135862351, | |
| "num_tokens": 1822965082.0, | |
| "step": 23400 | |
| }, | |
| { | |
| "entropy": 0.2781392467021942, | |
| "epoch": 0.9338165020707232, | |
| "grad_norm": 0.5838942527770996, | |
| "learning_rate": 0.00011552018909519516, | |
| "loss": 0.2734776496887207, | |
| "mean_token_accuracy": 0.9132671678066253, | |
| "num_tokens": 1826899316.0, | |
| "step": 23450 | |
| }, | |
| { | |
| "entropy": 0.28047511413693427, | |
| "epoch": 0.9358075820324945, | |
| "grad_norm": 3.2033631801605225, | |
| "learning_rate": 0.00011520158307011313, | |
| "loss": 0.27559213638305663, | |
| "mean_token_accuracy": 0.9144525969028473, | |
| "num_tokens": 1830712474.0, | |
| "step": 23500 | |
| }, | |
| { | |
| "entropy": 0.2832055461406708, | |
| "epoch": 0.9377986619942656, | |
| "grad_norm": 28.602519989013672, | |
| "learning_rate": 0.00011488281900499443, | |
| "loss": 0.2764240074157715, | |
| "mean_token_accuracy": 0.9124950170516968, | |
| "num_tokens": 1834596753.0, | |
| "step": 23550 | |
| }, | |
| { | |
| "entropy": 0.3014590518176556, | |
| "epoch": 0.9397897419560369, | |
| "grad_norm": 17.5722599029541, | |
| "learning_rate": 0.00011456390021380206, | |
| "loss": 0.29091754913330076, | |
| "mean_token_accuracy": 0.9100847208499908, | |
| "num_tokens": 1838467819.0, | |
| "step": 23600 | |
| }, | |
| { | |
| "entropy": 0.29293319925665856, | |
| "epoch": 0.9417808219178082, | |
| "grad_norm": 10.521018028259277, | |
| "learning_rate": 0.00011424483001210768, | |
| "loss": 0.28235774993896484, | |
| "mean_token_accuracy": 0.9123268640041351, | |
| "num_tokens": 1842299724.0, | |
| "step": 23650 | |
| }, | |
| { | |
| "entropy": 0.27152210757136347, | |
| "epoch": 0.9437719018795795, | |
| "grad_norm": 16.392244338989258, | |
| "learning_rate": 0.000113925611717057, | |
| "loss": 0.27001758575439455, | |
| "mean_token_accuracy": 0.9153967237472534, | |
| "num_tokens": 1846207939.0, | |
| "step": 23700 | |
| }, | |
| { | |
| "entropy": 0.27423043057322505, | |
| "epoch": 0.9457629818413508, | |
| "grad_norm": 161.79493713378906, | |
| "learning_rate": 0.00011360624864733542, | |
| "loss": 0.2701198959350586, | |
| "mean_token_accuracy": 0.9150199323892594, | |
| "num_tokens": 1850200783.0, | |
| "step": 23750 | |
| }, | |
| { | |
| "entropy": 0.2868032360076904, | |
| "epoch": 0.947754061803122, | |
| "grad_norm": 34.27143478393555, | |
| "learning_rate": 0.00011328674412313338, | |
| "loss": 0.2828762435913086, | |
| "mean_token_accuracy": 0.910566845536232, | |
| "num_tokens": 1853983913.0, | |
| "step": 23800 | |
| }, | |
| { | |
| "entropy": 0.28378346920013425, | |
| "epoch": 0.9497451417648933, | |
| "grad_norm": 19.305675506591797, | |
| "learning_rate": 0.00011296710146611191, | |
| "loss": 0.27950349807739255, | |
| "mean_token_accuracy": 0.9141000217199325, | |
| "num_tokens": 1858015165.0, | |
| "step": 23850 | |
| }, | |
| { | |
| "entropy": 0.2722449879348278, | |
| "epoch": 0.9517362217266645, | |
| "grad_norm": 5.517458915710449, | |
| "learning_rate": 0.00011264732399936821, | |
| "loss": 0.27257476806640624, | |
| "mean_token_accuracy": 0.915144516825676, | |
| "num_tokens": 1862150874.0, | |
| "step": 23900 | |
| }, | |
| { | |
| "entropy": 0.28292769208550456, | |
| "epoch": 0.9537273016884358, | |
| "grad_norm": 4.40126371383667, | |
| "learning_rate": 0.00011232741504740095, | |
| "loss": 0.2809117317199707, | |
| "mean_token_accuracy": 0.912839834690094, | |
| "num_tokens": 1865854098.0, | |
| "step": 23950 | |
| }, | |
| { | |
| "entropy": 0.27857477843761447, | |
| "epoch": 0.9557183816502071, | |
| "grad_norm": 5.774588584899902, | |
| "learning_rate": 0.00011200737793607572, | |
| "loss": 0.2793265914916992, | |
| "mean_token_accuracy": 0.9136429125070572, | |
| "num_tokens": 1869802187.0, | |
| "step": 24000 | |
| }, | |
| { | |
| "epoch": 0.9557183816502071, | |
| "eval_entropy": 0.2723109987046983, | |
| "eval_loss": 0.25965479016304016, | |
| "eval_mean_token_accuracy": 0.9130434602025955, | |
| "eval_num_tokens": 1869802187.0, | |
| "eval_runtime": 97.8102, | |
| "eval_samples_per_second": 10.224, | |
| "eval_steps_per_second": 0.644, | |
| "step": 24000 | |
| }, | |
| { | |
| "entropy": 0.6563278517127037, | |
| "epoch": 0.9577094616119783, | |
| "grad_norm": 39.699913024902344, | |
| "learning_rate": 0.00011168721599259049, | |
| "loss": 0.6549944305419921, | |
| "mean_token_accuracy": 0.8380170410871506, | |
| "num_tokens": 1873744084.0, | |
| "step": 24050 | |
| }, | |
| { | |
| "entropy": 0.4795880228281021, | |
| "epoch": 0.9597005415737496, | |
| "grad_norm": 1335.2706298828125, | |
| "learning_rate": 0.0001113669325454411, | |
| "loss": 0.45922279357910156, | |
| "mean_token_accuracy": 0.8766013658046723, | |
| "num_tokens": 1877664337.0, | |
| "step": 24100 | |
| }, | |
| { | |
| "entropy": 0.36844881772995, | |
| "epoch": 0.9616916215355209, | |
| "grad_norm": 125.4538803100586, | |
| "learning_rate": 0.00011104653092438652, | |
| "loss": 0.357088623046875, | |
| "mean_token_accuracy": 0.899301546216011, | |
| "num_tokens": 1881595432.0, | |
| "step": 24150 | |
| }, | |
| { | |
| "entropy": 0.37986351013183595, | |
| "epoch": 0.9636827014972922, | |
| "grad_norm": 41.903934478759766, | |
| "learning_rate": 0.00011072601446041435, | |
| "loss": 0.3584012222290039, | |
| "mean_token_accuracy": 0.8966500133275985, | |
| "num_tokens": 1885438520.0, | |
| "step": 24200 | |
| }, | |
| { | |
| "entropy": 0.39044318586587906, | |
| "epoch": 0.9656737814590634, | |
| "grad_norm": 44.811279296875, | |
| "learning_rate": 0.00011040538648570596, | |
| "loss": 0.36628631591796873, | |
| "mean_token_accuracy": 0.8948707044124603, | |
| "num_tokens": 1889295407.0, | |
| "step": 24250 | |
| }, | |
| { | |
| "entropy": 0.33998255178332326, | |
| "epoch": 0.9676648614208346, | |
| "grad_norm": 57.77637481689453, | |
| "learning_rate": 0.00011008465033360225, | |
| "loss": 0.32590660095214846, | |
| "mean_token_accuracy": 0.9039149129390717, | |
| "num_tokens": 1893118198.0, | |
| "step": 24300 | |
| }, | |
| { | |
| "entropy": 0.32903214752674104, | |
| "epoch": 0.9696559413826059, | |
| "grad_norm": 51.61495590209961, | |
| "learning_rate": 0.00010976380933856858, | |
| "loss": 0.32896270751953127, | |
| "mean_token_accuracy": 0.9040062379837036, | |
| "num_tokens": 1897060288.0, | |
| "step": 24350 | |
| }, | |
| { | |
| "entropy": 0.3667915537953377, | |
| "epoch": 0.9716470213443772, | |
| "grad_norm": 47.6137580871582, | |
| "learning_rate": 0.0001094428668361604, | |
| "loss": 0.35173583984375, | |
| "mean_token_accuracy": 0.8967252117395401, | |
| "num_tokens": 1900824780.0, | |
| "step": 24400 | |
| }, | |
| { | |
| "entropy": 0.349236313700676, | |
| "epoch": 0.9736381013061485, | |
| "grad_norm": 64.8992919921875, | |
| "learning_rate": 0.00010912182616298838, | |
| "loss": 0.33668148040771484, | |
| "mean_token_accuracy": 0.903141537308693, | |
| "num_tokens": 1904750342.0, | |
| "step": 24450 | |
| }, | |
| { | |
| "entropy": 0.35872448712587357, | |
| "epoch": 0.9756291812679198, | |
| "grad_norm": 11.008445739746094, | |
| "learning_rate": 0.0001088006906566839, | |
| "loss": 0.34439208984375, | |
| "mean_token_accuracy": 0.8992702323198318, | |
| "num_tokens": 1908808184.0, | |
| "step": 24500 | |
| }, | |
| { | |
| "entropy": 0.33843471750617027, | |
| "epoch": 0.977620261229691, | |
| "grad_norm": 15.063654899597168, | |
| "learning_rate": 0.00010847946365586413, | |
| "loss": 0.3207670974731445, | |
| "mean_token_accuracy": 0.9043490439653397, | |
| "num_tokens": 1912630065.0, | |
| "step": 24550 | |
| }, | |
| { | |
| "entropy": 0.4166515836119652, | |
| "epoch": 0.9796113411914622, | |
| "grad_norm": 665.3616333007812, | |
| "learning_rate": 0.00010815814850009753, | |
| "loss": 0.39070816040039064, | |
| "mean_token_accuracy": 0.8894343000650405, | |
| "num_tokens": 1916567398.0, | |
| "step": 24600 | |
| }, | |
| { | |
| "entropy": 0.3832103142142296, | |
| "epoch": 0.9816024211532335, | |
| "grad_norm": 145.4870147705078, | |
| "learning_rate": 0.00010783674852986903, | |
| "loss": 0.363221435546875, | |
| "mean_token_accuracy": 0.895402774810791, | |
| "num_tokens": 1920587404.0, | |
| "step": 24650 | |
| }, | |
| { | |
| "entropy": 0.35218898981809615, | |
| "epoch": 0.9835935011150048, | |
| "grad_norm": 288.9332580566406, | |
| "learning_rate": 0.00010751526708654531, | |
| "loss": 0.3388285827636719, | |
| "mean_token_accuracy": 0.9000647193193436, | |
| "num_tokens": 1924451590.0, | |
| "step": 24700 | |
| }, | |
| { | |
| "entropy": 0.363860125541687, | |
| "epoch": 0.985584581076776, | |
| "grad_norm": 128.26956176757812, | |
| "learning_rate": 0.00010719370751234003, | |
| "loss": 0.34467056274414065, | |
| "mean_token_accuracy": 0.8984408980607986, | |
| "num_tokens": 1928295240.0, | |
| "step": 24750 | |
| }, | |
| { | |
| "entropy": 0.332768639922142, | |
| "epoch": 0.9875756610385473, | |
| "grad_norm": 9.291278839111328, | |
| "learning_rate": 0.00010687207315027919, | |
| "loss": 0.3231398773193359, | |
| "mean_token_accuracy": 0.9035398948192597, | |
| "num_tokens": 1932020575.0, | |
| "step": 24800 | |
| }, | |
| { | |
| "entropy": 0.32511512815952304, | |
| "epoch": 0.9895667410003186, | |
| "grad_norm": 12.312918663024902, | |
| "learning_rate": 0.00010655036734416624, | |
| "loss": 0.3185703086853027, | |
| "mean_token_accuracy": 0.9060599678754806, | |
| "num_tokens": 1936014439.0, | |
| "step": 24850 | |
| }, | |
| { | |
| "entropy": 0.3694388023018837, | |
| "epoch": 0.9915578209620899, | |
| "grad_norm": 1.855156421661377, | |
| "learning_rate": 0.00010622859343854743, | |
| "loss": 0.357412223815918, | |
| "mean_token_accuracy": 0.8961717420816422, | |
| "num_tokens": 1939922696.0, | |
| "step": 24900 | |
| }, | |
| { | |
| "entropy": 0.35190608859062195, | |
| "epoch": 0.9935489009238611, | |
| "grad_norm": 79.05413818359375, | |
| "learning_rate": 0.000105906754778677, | |
| "loss": 0.3574227523803711, | |
| "mean_token_accuracy": 0.8979073971509933, | |
| "num_tokens": 1944061420.0, | |
| "step": 24950 | |
| }, | |
| { | |
| "entropy": 0.3361901544034481, | |
| "epoch": 0.9955399808856323, | |
| "grad_norm": 14.088053703308105, | |
| "learning_rate": 0.00010558485471048232, | |
| "loss": 0.3378467559814453, | |
| "mean_token_accuracy": 0.9023239356279373, | |
| "num_tokens": 1948190479.0, | |
| "step": 25000 | |
| }, | |
| { | |
| "entropy": 0.3119985489547253, | |
| "epoch": 0.9975310608474036, | |
| "grad_norm": 35.4752082824707, | |
| "learning_rate": 0.00010526289658052926, | |
| "loss": 0.30782127380371094, | |
| "mean_token_accuracy": 0.9068952518701553, | |
| "num_tokens": 1952114636.0, | |
| "step": 25050 | |
| }, | |
| { | |
| "entropy": 0.2962914815545082, | |
| "epoch": 0.9995221408091749, | |
| "grad_norm": 27.441314697265625, | |
| "learning_rate": 0.00010494088373598727, | |
| "loss": 0.2854899215698242, | |
| "mean_token_accuracy": 0.9109463971853257, | |
| "num_tokens": 1955930483.0, | |
| "step": 25100 | |
| }, | |
| { | |
| "entropy": 0.28696138501167295, | |
| "epoch": 1.001513220770946, | |
| "grad_norm": 3.6715400218963623, | |
| "learning_rate": 0.00010461881952459469, | |
| "loss": 0.28212398529052735, | |
| "mean_token_accuracy": 0.9123009568452836, | |
| "num_tokens": 1959705137.0, | |
| "step": 25150 | |
| }, | |
| { | |
| "entropy": 0.26907322466373446, | |
| "epoch": 1.0035043007327173, | |
| "grad_norm": 28.90825843811035, | |
| "learning_rate": 0.00010429670729462373, | |
| "loss": 0.2622692680358887, | |
| "mean_token_accuracy": 0.9167272865772247, | |
| "num_tokens": 1963657615.0, | |
| "step": 25200 | |
| }, | |
| { | |
| "entropy": 0.2590576921403408, | |
| "epoch": 1.0054953806944886, | |
| "grad_norm": 4.9817585945129395, | |
| "learning_rate": 0.00010397455039484605, | |
| "loss": 0.2512243843078613, | |
| "mean_token_accuracy": 0.9190041106939316, | |
| "num_tokens": 1967587403.0, | |
| "step": 25250 | |
| }, | |
| { | |
| "entropy": 0.25928459629416467, | |
| "epoch": 1.00748646065626, | |
| "grad_norm": 3.129709482192993, | |
| "learning_rate": 0.0001036523521744975, | |
| "loss": 0.25957672119140623, | |
| "mean_token_accuracy": 0.9176103568077087, | |
| "num_tokens": 1971448796.0, | |
| "step": 25300 | |
| }, | |
| { | |
| "entropy": 0.26116902694106103, | |
| "epoch": 1.0094775406180312, | |
| "grad_norm": 10.038873672485352, | |
| "learning_rate": 0.00010333011598324363, | |
| "loss": 0.25494049072265623, | |
| "mean_token_accuracy": 0.9185484343767166, | |
| "num_tokens": 1975297418.0, | |
| "step": 25350 | |
| }, | |
| { | |
| "entropy": 0.27020337790250776, | |
| "epoch": 1.0114686205798025, | |
| "grad_norm": 5.4823174476623535, | |
| "learning_rate": 0.00010300784517114466, | |
| "loss": 0.26545324325561526, | |
| "mean_token_accuracy": 0.9158938974142075, | |
| "num_tokens": 1979155438.0, | |
| "step": 25400 | |
| }, | |
| { | |
| "entropy": 0.26256797939538956, | |
| "epoch": 1.0134597005415737, | |
| "grad_norm": 36.92467498779297, | |
| "learning_rate": 0.00010268554308862088, | |
| "loss": 0.2575288009643555, | |
| "mean_token_accuracy": 0.9181166028976441, | |
| "num_tokens": 1983024409.0, | |
| "step": 25450 | |
| }, | |
| { | |
| "entropy": 0.29766422316432, | |
| "epoch": 1.015450780503345, | |
| "grad_norm": 26.67340660095215, | |
| "learning_rate": 0.0001023632130864175, | |
| "loss": 0.2937025451660156, | |
| "mean_token_accuracy": 0.9106646543741226, | |
| "num_tokens": 1986958622.0, | |
| "step": 25500 | |
| }, | |
| { | |
| "epoch": 1.015450780503345, | |
| "eval_entropy": 0.2694250995677615, | |
| "eval_loss": 0.2797989845275879, | |
| "eval_mean_token_accuracy": 0.9101072105150374, | |
| "eval_num_tokens": 1986958622.0, | |
| "eval_runtime": 97.8746, | |
| "eval_samples_per_second": 10.217, | |
| "eval_steps_per_second": 0.644, | |
| "step": 25500 | |
| }, | |
| { | |
| "entropy": 0.28613715797662737, | |
| "epoch": 1.0174418604651163, | |
| "grad_norm": 9088.736328125, | |
| "learning_rate": 0.00010204085851557011, | |
| "loss": 0.27716789245605467, | |
| "mean_token_accuracy": 0.9129116219282151, | |
| "num_tokens": 1990813233.0, | |
| "step": 25550 | |
| }, | |
| { | |
| "entropy": 0.27504936650395395, | |
| "epoch": 1.0194329404268876, | |
| "grad_norm": 38.234413146972656, | |
| "learning_rate": 0.00010171848272736968, | |
| "loss": 0.26801122665405275, | |
| "mean_token_accuracy": 0.9150198262929916, | |
| "num_tokens": 1994731019.0, | |
| "step": 25600 | |
| }, | |
| { | |
| "entropy": 0.25914262115955355, | |
| "epoch": 1.0214240203886589, | |
| "grad_norm": 27.66782569885254, | |
| "learning_rate": 0.0001013960890733278, | |
| "loss": 0.25058454513549805, | |
| "mean_token_accuracy": 0.9187197256088256, | |
| "num_tokens": 1998645827.0, | |
| "step": 25650 | |
| }, | |
| { | |
| "entropy": 0.2702752210199833, | |
| "epoch": 1.0234151003504302, | |
| "grad_norm": 86.97796630859375, | |
| "learning_rate": 0.00010107368090514173, | |
| "loss": 0.2650441551208496, | |
| "mean_token_accuracy": 0.9166213870048523, | |
| "num_tokens": 2002590388.0, | |
| "step": 25700 | |
| }, | |
| { | |
| "entropy": 0.26510491490364074, | |
| "epoch": 1.0254061803122014, | |
| "grad_norm": 2.416658878326416, | |
| "learning_rate": 0.00010075126157465969, | |
| "loss": 0.26374332427978514, | |
| "mean_token_accuracy": 0.9164919888973236, | |
| "num_tokens": 2006390464.0, | |
| "step": 25750 | |
| }, | |
| { | |
| "entropy": 0.2767194920778275, | |
| "epoch": 1.0273972602739727, | |
| "grad_norm": 121.55948638916016, | |
| "learning_rate": 0.00010042883443384588, | |
| "loss": 0.2746761322021484, | |
| "mean_token_accuracy": 0.9133573430776596, | |
| "num_tokens": 2010376074.0, | |
| "step": 25800 | |
| }, | |
| { | |
| "entropy": 0.2857384331524372, | |
| "epoch": 1.0293883402357438, | |
| "grad_norm": 8.534170150756836, | |
| "learning_rate": 0.00010010640283474577, | |
| "loss": 0.27749507904052734, | |
| "mean_token_accuracy": 0.9122277122735977, | |
| "num_tokens": 2014314880.0, | |
| "step": 25850 | |
| }, | |
| { | |
| "entropy": 0.2771646900475025, | |
| "epoch": 1.031379420197515, | |
| "grad_norm": 14.0018949508667, | |
| "learning_rate": 9.978397012945118e-05, | |
| "loss": 0.27255733489990236, | |
| "mean_token_accuracy": 0.9154339116811753, | |
| "num_tokens": 2018153993.0, | |
| "step": 25900 | |
| }, | |
| { | |
| "entropy": 0.2549267649650574, | |
| "epoch": 1.0333705001592863, | |
| "grad_norm": 141.65396118164062, | |
| "learning_rate": 9.946153967006528e-05, | |
| "loss": 0.25027942657470703, | |
| "mean_token_accuracy": 0.9198796671628952, | |
| "num_tokens": 2021908727.0, | |
| "step": 25950 | |
| }, | |
| { | |
| "entropy": 0.2677805428206921, | |
| "epoch": 1.0353615801210576, | |
| "grad_norm": 19253.08984375, | |
| "learning_rate": 9.913911480866817e-05, | |
| "loss": 0.2630371856689453, | |
| "mean_token_accuracy": 0.916558683514595, | |
| "num_tokens": 2025550628.0, | |
| "step": 26000 | |
| }, | |
| { | |
| "entropy": 0.2855284099280834, | |
| "epoch": 1.037352660082829, | |
| "grad_norm": 127.2653579711914, | |
| "learning_rate": 9.881669889728144e-05, | |
| "loss": 0.28463106155395507, | |
| "mean_token_accuracy": 0.9130609530210495, | |
| "num_tokens": 2029278311.0, | |
| "step": 26050 | |
| }, | |
| { | |
| "entropy": 0.29474446415901184, | |
| "epoch": 1.0393437400446002, | |
| "grad_norm": 43.862098693847656, | |
| "learning_rate": 9.849429528783385e-05, | |
| "loss": 0.28278093338012694, | |
| "mean_token_accuracy": 0.9114625084400177, | |
| "num_tokens": 2033259136.0, | |
| "step": 26100 | |
| }, | |
| { | |
| "entropy": 0.30185434013605117, | |
| "epoch": 1.0413348200063715, | |
| "grad_norm": 5.1499857902526855, | |
| "learning_rate": 9.817190733212623e-05, | |
| "loss": 0.2916604995727539, | |
| "mean_token_accuracy": 0.9096384018659591, | |
| "num_tokens": 2037052103.0, | |
| "step": 26150 | |
| }, | |
| { | |
| "entropy": 0.29071212783455846, | |
| "epoch": 1.0433258999681427, | |
| "grad_norm": 364.8683776855469, | |
| "learning_rate": 9.784953838179657e-05, | |
| "loss": 0.28531660079956056, | |
| "mean_token_accuracy": 0.9106332343816758, | |
| "num_tokens": 2040924159.0, | |
| "step": 26200 | |
| }, | |
| { | |
| "entropy": 0.27380838453769685, | |
| "epoch": 1.045316979929914, | |
| "grad_norm": 8.768333435058594, | |
| "learning_rate": 9.752719178828534e-05, | |
| "loss": 0.2673329734802246, | |
| "mean_token_accuracy": 0.9157132452726364, | |
| "num_tokens": 2044692885.0, | |
| "step": 26250 | |
| }, | |
| { | |
| "entropy": 0.2756735447049141, | |
| "epoch": 1.0473080598916853, | |
| "grad_norm": 107.49151611328125, | |
| "learning_rate": 9.72048709028007e-05, | |
| "loss": 0.2699962425231934, | |
| "mean_token_accuracy": 0.9157623893022537, | |
| "num_tokens": 2048454708.0, | |
| "step": 26300 | |
| }, | |
| { | |
| "entropy": 0.29151566803455353, | |
| "epoch": 1.0492991398534566, | |
| "grad_norm": 85.45984649658203, | |
| "learning_rate": 9.688257907628326e-05, | |
| "loss": 0.2861785888671875, | |
| "mean_token_accuracy": 0.9122406727075577, | |
| "num_tokens": 2052418372.0, | |
| "step": 26350 | |
| }, | |
| { | |
| "entropy": 0.27055223628878594, | |
| "epoch": 1.0512902198152279, | |
| "grad_norm": 3.6944844722747803, | |
| "learning_rate": 9.656031965937183e-05, | |
| "loss": 0.2670576858520508, | |
| "mean_token_accuracy": 0.9155509883165359, | |
| "num_tokens": 2056406304.0, | |
| "step": 26400 | |
| }, | |
| { | |
| "entropy": 0.2726173362135887, | |
| "epoch": 1.0532812997769991, | |
| "grad_norm": 71.38996887207031, | |
| "learning_rate": 9.623809600236805e-05, | |
| "loss": 0.2644667625427246, | |
| "mean_token_accuracy": 0.9153118109703064, | |
| "num_tokens": 2060233499.0, | |
| "step": 26450 | |
| }, | |
| { | |
| "entropy": 0.27969068244099615, | |
| "epoch": 1.0552723797387704, | |
| "grad_norm": 320.3172607421875, | |
| "learning_rate": 9.591591145520193e-05, | |
| "loss": 0.2756903457641602, | |
| "mean_token_accuracy": 0.9137703001499176, | |
| "num_tokens": 2064138841.0, | |
| "step": 26500 | |
| }, | |
| { | |
| "entropy": 0.2718262220919132, | |
| "epoch": 1.0572634597005415, | |
| "grad_norm": 8.090370178222656, | |
| "learning_rate": 9.559376936739682e-05, | |
| "loss": 0.2698848342895508, | |
| "mean_token_accuracy": 0.9147110247611999, | |
| "num_tokens": 2067856174.0, | |
| "step": 26550 | |
| }, | |
| { | |
| "entropy": 0.2986389592289925, | |
| "epoch": 1.0592545396623128, | |
| "grad_norm": 11.137097358703613, | |
| "learning_rate": 9.527167308803465e-05, | |
| "loss": 0.3257150650024414, | |
| "mean_token_accuracy": 0.910808190703392, | |
| "num_tokens": 2071739841.0, | |
| "step": 26600 | |
| }, | |
| { | |
| "entropy": 0.3147141246497631, | |
| "epoch": 1.061245619624084, | |
| "grad_norm": 7.234685897827148, | |
| "learning_rate": 9.494962596572111e-05, | |
| "loss": 0.3103673553466797, | |
| "mean_token_accuracy": 0.9063691395521164, | |
| "num_tokens": 2075735990.0, | |
| "step": 26650 | |
| }, | |
| { | |
| "entropy": 0.31178212597966193, | |
| "epoch": 1.0632366995858553, | |
| "grad_norm": 8.27217960357666, | |
| "learning_rate": 9.462763134855093e-05, | |
| "loss": 0.3050539016723633, | |
| "mean_token_accuracy": 0.9069130408763886, | |
| "num_tokens": 2079589023.0, | |
| "step": 26700 | |
| }, | |
| { | |
| "entropy": 0.3006526806950569, | |
| "epoch": 1.0652277795476266, | |
| "grad_norm": 11.008944511413574, | |
| "learning_rate": 9.430569258407283e-05, | |
| "loss": 0.29765275955200193, | |
| "mean_token_accuracy": 0.9091472399234771, | |
| "num_tokens": 2083622258.0, | |
| "step": 26750 | |
| }, | |
| { | |
| "entropy": 0.29270223453640937, | |
| "epoch": 1.0672188595093979, | |
| "grad_norm": 3.3960471153259277, | |
| "learning_rate": 9.398381301925499e-05, | |
| "loss": 0.2888037872314453, | |
| "mean_token_accuracy": 0.9113785433769226, | |
| "num_tokens": 2087604238.0, | |
| "step": 26800 | |
| }, | |
| { | |
| "entropy": 0.28832288086414337, | |
| "epoch": 1.0692099394711692, | |
| "grad_norm": 19.040067672729492, | |
| "learning_rate": 9.366199600045005e-05, | |
| "loss": 0.28535903930664064, | |
| "mean_token_accuracy": 0.9119643104076386, | |
| "num_tokens": 2091472329.0, | |
| "step": 26850 | |
| }, | |
| { | |
| "entropy": 0.2806944952905178, | |
| "epoch": 1.0712010194329404, | |
| "grad_norm": 15.679569244384766, | |
| "learning_rate": 9.334024487336048e-05, | |
| "loss": 0.2734016227722168, | |
| "mean_token_accuracy": 0.9133606183528901, | |
| "num_tokens": 2095395642.0, | |
| "step": 26900 | |
| }, | |
| { | |
| "entropy": 0.28680155262351037, | |
| "epoch": 1.0731920993947117, | |
| "grad_norm": 1.7365965843200684, | |
| "learning_rate": 9.301856298300369e-05, | |
| "loss": 0.27998071670532226, | |
| "mean_token_accuracy": 0.9116964995861053, | |
| "num_tokens": 2099217252.0, | |
| "step": 26950 | |
| }, | |
| { | |
| "entropy": 0.29625475078821184, | |
| "epoch": 1.075183179356483, | |
| "grad_norm": 6.737451076507568, | |
| "learning_rate": 9.26969536736772e-05, | |
| "loss": 0.28877586364746094, | |
| "mean_token_accuracy": 0.9105580598115921, | |
| "num_tokens": 2103184387.0, | |
| "step": 27000 | |
| }, | |
| { | |
| "epoch": 1.075183179356483, | |
| "eval_entropy": 0.29035906659232247, | |
| "eval_loss": 0.2825865149497986, | |
| "eval_mean_token_accuracy": 0.9076645118849618, | |
| "eval_num_tokens": 2103184387.0, | |
| "eval_runtime": 98.213, | |
| "eval_samples_per_second": 10.182, | |
| "eval_steps_per_second": 0.641, | |
| "step": 27000 | |
| }, | |
| { | |
| "entropy": 0.2876469852030277, | |
| "epoch": 1.0771742593182543, | |
| "grad_norm": 1.4166911840438843, | |
| "learning_rate": 9.237542028892412e-05, | |
| "loss": 0.28487411499023435, | |
| "mean_token_accuracy": 0.911678535938263, | |
| "num_tokens": 2107077111.0, | |
| "step": 27050 | |
| }, | |
| { | |
| "entropy": 0.29179634869098664, | |
| "epoch": 1.0791653392800256, | |
| "grad_norm": 3.1514477729797363, | |
| "learning_rate": 9.205396617149813e-05, | |
| "loss": 0.2909921836853027, | |
| "mean_token_accuracy": 0.910441267490387, | |
| "num_tokens": 2110962261.0, | |
| "step": 27100 | |
| }, | |
| { | |
| "entropy": 0.29678445786237717, | |
| "epoch": 1.0811564192417968, | |
| "grad_norm": 40.26863098144531, | |
| "learning_rate": 9.173259466332881e-05, | |
| "loss": 0.29503396987915037, | |
| "mean_token_accuracy": 0.9089562743902206, | |
| "num_tokens": 2114690971.0, | |
| "step": 27150 | |
| }, | |
| { | |
| "entropy": 0.27730693414807317, | |
| "epoch": 1.0831474992035681, | |
| "grad_norm": 14.38628101348877, | |
| "learning_rate": 9.14113091054869e-05, | |
| "loss": 0.2759782028198242, | |
| "mean_token_accuracy": 0.9139302664995194, | |
| "num_tokens": 2118761603.0, | |
| "step": 27200 | |
| }, | |
| { | |
| "entropy": 0.27558964386582374, | |
| "epoch": 1.0851385791653392, | |
| "grad_norm": 7.265783309936523, | |
| "learning_rate": 9.109011283814975e-05, | |
| "loss": 0.273838005065918, | |
| "mean_token_accuracy": 0.9154215580224991, | |
| "num_tokens": 2122603326.0, | |
| "step": 27250 | |
| }, | |
| { | |
| "entropy": 0.27117940336465834, | |
| "epoch": 1.0871296591271105, | |
| "grad_norm": 67.00965881347656, | |
| "learning_rate": 9.07690092005661e-05, | |
| "loss": 0.2704639434814453, | |
| "mean_token_accuracy": 0.9143139374256134, | |
| "num_tokens": 2126467523.0, | |
| "step": 27300 | |
| }, | |
| { | |
| "entropy": 0.27915058851242064, | |
| "epoch": 1.0891207390888817, | |
| "grad_norm": 15.945594787597656, | |
| "learning_rate": 9.044800153102201e-05, | |
| "loss": 0.27274932861328127, | |
| "mean_token_accuracy": 0.9147227293252945, | |
| "num_tokens": 2130549596.0, | |
| "step": 27350 | |
| }, | |
| { | |
| "entropy": 0.28577979490160943, | |
| "epoch": 1.091111819050653, | |
| "grad_norm": 20.842540740966797, | |
| "learning_rate": 9.01270931668056e-05, | |
| "loss": 0.2831624984741211, | |
| "mean_token_accuracy": 0.9122427719831466, | |
| "num_tokens": 2134470609.0, | |
| "step": 27400 | |
| }, | |
| { | |
| "entropy": 0.279740676432848, | |
| "epoch": 1.0931028990124243, | |
| "grad_norm": 26.93157958984375, | |
| "learning_rate": 8.98062874441727e-05, | |
| "loss": 0.27642791748046874, | |
| "mean_token_accuracy": 0.9142916613817215, | |
| "num_tokens": 2138309187.0, | |
| "step": 27450 | |
| }, | |
| { | |
| "entropy": 0.2770803037285805, | |
| "epoch": 1.0950939789741956, | |
| "grad_norm": 35.35862350463867, | |
| "learning_rate": 8.948558769831204e-05, | |
| "loss": 0.2779220390319824, | |
| "mean_token_accuracy": 0.9131919813156127, | |
| "num_tokens": 2142245103.0, | |
| "step": 27500 | |
| }, | |
| { | |
| "entropy": 0.2848608887195587, | |
| "epoch": 1.0970850589359669, | |
| "grad_norm": 11.261760711669922, | |
| "learning_rate": 8.91649972633105e-05, | |
| "loss": 0.28272476196289065, | |
| "mean_token_accuracy": 0.9128847599029541, | |
| "num_tokens": 2146150563.0, | |
| "step": 27550 | |
| }, | |
| { | |
| "entropy": 0.2844234037399292, | |
| "epoch": 1.0990761388977381, | |
| "grad_norm": 22.945674896240234, | |
| "learning_rate": 8.88445194721186e-05, | |
| "loss": 0.27900018692016604, | |
| "mean_token_accuracy": 0.9139061546325684, | |
| "num_tokens": 2150074053.0, | |
| "step": 27600 | |
| }, | |
| { | |
| "entropy": 0.2817272536456585, | |
| "epoch": 1.1010672188595094, | |
| "grad_norm": 9.653203964233398, | |
| "learning_rate": 8.852415765651586e-05, | |
| "loss": 0.274036750793457, | |
| "mean_token_accuracy": 0.9139328610897064, | |
| "num_tokens": 2153979617.0, | |
| "step": 27650 | |
| }, | |
| { | |
| "entropy": 0.28654327005147934, | |
| "epoch": 1.1030582988212807, | |
| "grad_norm": 3.253051280975342, | |
| "learning_rate": 8.820391514707593e-05, | |
| "loss": 0.285811767578125, | |
| "mean_token_accuracy": 0.9110492730140686, | |
| "num_tokens": 2157862641.0, | |
| "step": 27700 | |
| }, | |
| { | |
| "entropy": 0.27920183435082435, | |
| "epoch": 1.105049378783052, | |
| "grad_norm": 3.2318739891052246, | |
| "learning_rate": 8.788379527313222e-05, | |
| "loss": 0.27893768310546874, | |
| "mean_token_accuracy": 0.913199360370636, | |
| "num_tokens": 2161581604.0, | |
| "step": 27750 | |
| }, | |
| { | |
| "entropy": 0.2770452558994293, | |
| "epoch": 1.1070404587448233, | |
| "grad_norm": 2.511895179748535, | |
| "learning_rate": 8.756380136274312e-05, | |
| "loss": 0.2762653160095215, | |
| "mean_token_accuracy": 0.9135860896110535, | |
| "num_tokens": 2165453934.0, | |
| "step": 27800 | |
| }, | |
| { | |
| "entropy": 0.277307867705822, | |
| "epoch": 1.1090315387065945, | |
| "grad_norm": 2.83260440826416, | |
| "learning_rate": 8.724393674265751e-05, | |
| "loss": 0.27308944702148436, | |
| "mean_token_accuracy": 0.913974158167839, | |
| "num_tokens": 2169354403.0, | |
| "step": 27850 | |
| }, | |
| { | |
| "entropy": 0.28175134643912314, | |
| "epoch": 1.1110226186683658, | |
| "grad_norm": 3.690707206726074, | |
| "learning_rate": 8.692420473828017e-05, | |
| "loss": 0.27765316009521485, | |
| "mean_token_accuracy": 0.9128604310750962, | |
| "num_tokens": 2173255846.0, | |
| "step": 27900 | |
| }, | |
| { | |
| "entropy": 0.2807075062394142, | |
| "epoch": 1.1130136986301369, | |
| "grad_norm": 47.7031135559082, | |
| "learning_rate": 8.660460867363705e-05, | |
| "loss": 0.27419795989990237, | |
| "mean_token_accuracy": 0.912740181684494, | |
| "num_tokens": 2177173636.0, | |
| "step": 27950 | |
| }, | |
| { | |
| "entropy": 0.26901765435934066, | |
| "epoch": 1.1150047785919082, | |
| "grad_norm": 39.53254318237305, | |
| "learning_rate": 8.628515187134095e-05, | |
| "loss": 0.267020149230957, | |
| "mean_token_accuracy": 0.9155882316827774, | |
| "num_tokens": 2181073758.0, | |
| "step": 28000 | |
| }, | |
| { | |
| "entropy": 0.27070899575948715, | |
| "epoch": 1.1169958585536794, | |
| "grad_norm": 95.63186645507812, | |
| "learning_rate": 8.596583765255684e-05, | |
| "loss": 0.2706641387939453, | |
| "mean_token_accuracy": 0.9151144373416901, | |
| "num_tokens": 2185055281.0, | |
| "step": 28050 | |
| }, | |
| { | |
| "entropy": 0.2648503905534744, | |
| "epoch": 1.1189869385154507, | |
| "grad_norm": 5.548442840576172, | |
| "learning_rate": 8.564666933696725e-05, | |
| "loss": 0.2619986152648926, | |
| "mean_token_accuracy": 0.9176148587465286, | |
| "num_tokens": 2188982724.0, | |
| "step": 28100 | |
| }, | |
| { | |
| "entropy": 0.26699685767292974, | |
| "epoch": 1.120978018477222, | |
| "grad_norm": 111.70710754394531, | |
| "learning_rate": 8.5327650242738e-05, | |
| "loss": 0.2617582702636719, | |
| "mean_token_accuracy": 0.9162463837862015, | |
| "num_tokens": 2192938733.0, | |
| "step": 28150 | |
| }, | |
| { | |
| "entropy": 0.262488604336977, | |
| "epoch": 1.1229690984389933, | |
| "grad_norm": 430.6045227050781, | |
| "learning_rate": 8.500878368648343e-05, | |
| "loss": 0.2608696746826172, | |
| "mean_token_accuracy": 0.9173845279216767, | |
| "num_tokens": 2196846764.0, | |
| "step": 28200 | |
| }, | |
| { | |
| "entropy": 0.25803896233439444, | |
| "epoch": 1.1249601784007646, | |
| "grad_norm": 3.5406253337860107, | |
| "learning_rate": 8.469007298323213e-05, | |
| "loss": 0.2512600326538086, | |
| "mean_token_accuracy": 0.9178572076559067, | |
| "num_tokens": 2200645521.0, | |
| "step": 28250 | |
| }, | |
| { | |
| "entropy": 0.26972849801182747, | |
| "epoch": 1.1269512583625358, | |
| "grad_norm": 92.98139190673828, | |
| "learning_rate": 8.437152144639246e-05, | |
| "loss": 0.26785884857177733, | |
| "mean_token_accuracy": 0.9155970722436905, | |
| "num_tokens": 2204445686.0, | |
| "step": 28300 | |
| }, | |
| { | |
| "entropy": 0.26320109009742737, | |
| "epoch": 1.1289423383243071, | |
| "grad_norm": 9.081830024719238, | |
| "learning_rate": 8.405313238771784e-05, | |
| "loss": 0.25778596878051757, | |
| "mean_token_accuracy": 0.9171466076374054, | |
| "num_tokens": 2208115754.0, | |
| "step": 28350 | |
| }, | |
| { | |
| "entropy": 0.26801792293787, | |
| "epoch": 1.1309334182860784, | |
| "grad_norm": 8.996872901916504, | |
| "learning_rate": 8.373490911727271e-05, | |
| "loss": 0.26728742599487304, | |
| "mean_token_accuracy": 0.914549406170845, | |
| "num_tokens": 2212015806.0, | |
| "step": 28400 | |
| }, | |
| { | |
| "entropy": 0.26803364634513854, | |
| "epoch": 1.1329244982478497, | |
| "grad_norm": 5.314253807067871, | |
| "learning_rate": 8.341685494339786e-05, | |
| "loss": 0.26380897521972657, | |
| "mean_token_accuracy": 0.915499085187912, | |
| "num_tokens": 2215916150.0, | |
| "step": 28450 | |
| }, | |
| { | |
| "entropy": 0.2681669166684151, | |
| "epoch": 1.134915578209621, | |
| "grad_norm": 2.105147361755371, | |
| "learning_rate": 8.309897317267608e-05, | |
| "loss": 0.2656439208984375, | |
| "mean_token_accuracy": 0.9164936941862106, | |
| "num_tokens": 2219835264.0, | |
| "step": 28500 | |
| }, | |
| { | |
| "epoch": 1.134915578209621, | |
| "eval_entropy": 0.26389308983371373, | |
| "eval_loss": 0.26379474997520447, | |
| "eval_mean_token_accuracy": 0.9127354971946232, | |
| "eval_num_tokens": 2219835264.0, | |
| "eval_runtime": 97.959, | |
| "eval_samples_per_second": 10.208, | |
| "eval_steps_per_second": 0.643, | |
| "step": 28500 | |
| }, | |
| { | |
| "entropy": 0.27185188308358194, | |
| "epoch": 1.1369066581713922, | |
| "grad_norm": 18.015384674072266, | |
| "learning_rate": 8.278126710989782e-05, | |
| "loss": 0.2707905960083008, | |
| "mean_token_accuracy": 0.9136988991498947, | |
| "num_tokens": 2223642742.0, | |
| "step": 28550 | |
| }, | |
| { | |
| "entropy": 0.2693157321214676, | |
| "epoch": 1.1388977381331635, | |
| "grad_norm": 2.083514451980591, | |
| "learning_rate": 8.24637400580269e-05, | |
| "loss": 0.26923891067504885, | |
| "mean_token_accuracy": 0.9148537760972977, | |
| "num_tokens": 2227448481.0, | |
| "step": 28600 | |
| }, | |
| { | |
| "entropy": 0.2842481462657452, | |
| "epoch": 1.1408888180949348, | |
| "grad_norm": 5.290956974029541, | |
| "learning_rate": 8.214639531816595e-05, | |
| "loss": 0.2816263198852539, | |
| "mean_token_accuracy": 0.9124980694055558, | |
| "num_tokens": 2231471576.0, | |
| "step": 28650 | |
| }, | |
| { | |
| "entropy": 0.2704421180486679, | |
| "epoch": 1.1428798980567059, | |
| "grad_norm": 8.295283317565918, | |
| "learning_rate": 8.182923618952235e-05, | |
| "loss": 0.27311107635498044, | |
| "mean_token_accuracy": 0.914927179813385, | |
| "num_tokens": 2235399047.0, | |
| "step": 28700 | |
| }, | |
| { | |
| "entropy": 0.27379641339182853, | |
| "epoch": 1.1448709780184771, | |
| "grad_norm": 1.0736641883850098, | |
| "learning_rate": 8.15122659693737e-05, | |
| "loss": 0.2708183479309082, | |
| "mean_token_accuracy": 0.9151065689325333, | |
| "num_tokens": 2239234964.0, | |
| "step": 28750 | |
| }, | |
| { | |
| "entropy": 0.2751020123064518, | |
| "epoch": 1.1468620579802484, | |
| "grad_norm": 1.4961488246917725, | |
| "learning_rate": 8.119548795303376e-05, | |
| "loss": 0.27098175048828127, | |
| "mean_token_accuracy": 0.9147888046503067, | |
| "num_tokens": 2243217403.0, | |
| "step": 28800 | |
| }, | |
| { | |
| "entropy": 0.2790540789067745, | |
| "epoch": 1.1488531379420197, | |
| "grad_norm": 2.4600632190704346, | |
| "learning_rate": 8.087890543381806e-05, | |
| "loss": 0.2748415184020996, | |
| "mean_token_accuracy": 0.913057005405426, | |
| "num_tokens": 2247087511.0, | |
| "step": 28850 | |
| }, | |
| { | |
| "entropy": 0.27438779309391975, | |
| "epoch": 1.150844217903791, | |
| "grad_norm": 1.100923776626587, | |
| "learning_rate": 8.05625217030096e-05, | |
| "loss": 0.273856143951416, | |
| "mean_token_accuracy": 0.9144889223575592, | |
| "num_tokens": 2251015377.0, | |
| "step": 28900 | |
| }, | |
| { | |
| "entropy": 0.2724647945165634, | |
| "epoch": 1.1528352978655623, | |
| "grad_norm": 1.0084789991378784, | |
| "learning_rate": 8.024634004982485e-05, | |
| "loss": 0.26770015716552736, | |
| "mean_token_accuracy": 0.9148356276750564, | |
| "num_tokens": 2254827896.0, | |
| "step": 28950 | |
| }, | |
| { | |
| "entropy": 0.2752744263410568, | |
| "epoch": 1.1548263778273336, | |
| "grad_norm": 1.1662410497665405, | |
| "learning_rate": 7.993036376137936e-05, | |
| "loss": 0.2729286956787109, | |
| "mean_token_accuracy": 0.9148583126068115, | |
| "num_tokens": 2258661646.0, | |
| "step": 29000 | |
| }, | |
| { | |
| "entropy": 0.26966445341706274, | |
| "epoch": 1.1568174577891048, | |
| "grad_norm": 0.924314558506012, | |
| "learning_rate": 7.961459612265361e-05, | |
| "loss": 0.2723007392883301, | |
| "mean_token_accuracy": 0.9145607137680054, | |
| "num_tokens": 2262646618.0, | |
| "step": 29050 | |
| }, | |
| { | |
| "entropy": 0.26575383394956587, | |
| "epoch": 1.158808537750876, | |
| "grad_norm": 0.7235977649688721, | |
| "learning_rate": 7.929904041645899e-05, | |
| "loss": 0.25847774505615234, | |
| "mean_token_accuracy": 0.9171443176269531, | |
| "num_tokens": 2266428868.0, | |
| "step": 29100 | |
| }, | |
| { | |
| "entropy": 0.2669110006093979, | |
| "epoch": 1.1607996177126474, | |
| "grad_norm": 1.0300394296646118, | |
| "learning_rate": 7.898369992340343e-05, | |
| "loss": 0.2586103057861328, | |
| "mean_token_accuracy": 0.9165506374835968, | |
| "num_tokens": 2270328111.0, | |
| "step": 29150 | |
| }, | |
| { | |
| "entropy": 0.2686790293455124, | |
| "epoch": 1.1627906976744187, | |
| "grad_norm": 1.061711311340332, | |
| "learning_rate": 7.866857792185757e-05, | |
| "loss": 0.2652849006652832, | |
| "mean_token_accuracy": 0.9159308975934982, | |
| "num_tokens": 2274115543.0, | |
| "step": 29200 | |
| }, | |
| { | |
| "entropy": 0.2602678190171719, | |
| "epoch": 1.16478177763619, | |
| "grad_norm": 0.9144725203514099, | |
| "learning_rate": 7.835367768792062e-05, | |
| "loss": 0.2613193130493164, | |
| "mean_token_accuracy": 0.9169529223442078, | |
| "num_tokens": 2278001125.0, | |
| "step": 29250 | |
| }, | |
| { | |
| "entropy": 0.26131615310907363, | |
| "epoch": 1.166772857597961, | |
| "grad_norm": 2.1445415019989014, | |
| "learning_rate": 7.803900249538595e-05, | |
| "loss": 0.25913362503051757, | |
| "mean_token_accuracy": 0.9180044931173325, | |
| "num_tokens": 2281717812.0, | |
| "step": 29300 | |
| }, | |
| { | |
| "entropy": 0.2564562624692917, | |
| "epoch": 1.1687639375597323, | |
| "grad_norm": 2.700810670852661, | |
| "learning_rate": 7.772455561570765e-05, | |
| "loss": 0.260410213470459, | |
| "mean_token_accuracy": 0.9175380313396454, | |
| "num_tokens": 2285608129.0, | |
| "step": 29350 | |
| }, | |
| { | |
| "entropy": 0.25623603761196134, | |
| "epoch": 1.1707550175215036, | |
| "grad_norm": 26.131128311157227, | |
| "learning_rate": 7.7410340317966e-05, | |
| "loss": 0.2592426300048828, | |
| "mean_token_accuracy": 0.9185863476991654, | |
| "num_tokens": 2289552213.0, | |
| "step": 29400 | |
| }, | |
| { | |
| "entropy": 0.25995843529701235, | |
| "epoch": 1.1727460974832749, | |
| "grad_norm": 11.526826858520508, | |
| "learning_rate": 7.709635986883377e-05, | |
| "loss": 0.2492630386352539, | |
| "mean_token_accuracy": 0.9200164544582367, | |
| "num_tokens": 2293527997.0, | |
| "step": 29450 | |
| }, | |
| { | |
| "entropy": 0.2562264314293861, | |
| "epoch": 1.1747371774450461, | |
| "grad_norm": 5.011427879333496, | |
| "learning_rate": 7.678261753254215e-05, | |
| "loss": 0.2549386405944824, | |
| "mean_token_accuracy": 0.9187822026014328, | |
| "num_tokens": 2297456343.0, | |
| "step": 29500 | |
| }, | |
| { | |
| "entropy": 0.2528035534918308, | |
| "epoch": 1.1767282574068174, | |
| "grad_norm": 7.7611517906188965, | |
| "learning_rate": 7.646911657084681e-05, | |
| "loss": 0.24742359161376953, | |
| "mean_token_accuracy": 0.9208133661746979, | |
| "num_tokens": 2301308339.0, | |
| "step": 29550 | |
| }, | |
| { | |
| "entropy": 0.2551653176546097, | |
| "epoch": 1.1787193373685887, | |
| "grad_norm": 0.9861001372337341, | |
| "learning_rate": 7.61558602429941e-05, | |
| "loss": 0.25268321990966797, | |
| "mean_token_accuracy": 0.9187040156126023, | |
| "num_tokens": 2305141997.0, | |
| "step": 29600 | |
| }, | |
| { | |
| "entropy": 0.26116091802716257, | |
| "epoch": 1.18071041733036, | |
| "grad_norm": 5.062619209289551, | |
| "learning_rate": 7.584285180568707e-05, | |
| "loss": 0.25951030731201175, | |
| "mean_token_accuracy": 0.9177165216207505, | |
| "num_tokens": 2308988046.0, | |
| "step": 29650 | |
| }, | |
| { | |
| "entropy": 0.2451816527545452, | |
| "epoch": 1.1827014972921313, | |
| "grad_norm": 9.454245567321777, | |
| "learning_rate": 7.553009451305155e-05, | |
| "loss": 0.24350931167602538, | |
| "mean_token_accuracy": 0.9213841730356216, | |
| "num_tokens": 2312985492.0, | |
| "step": 29700 | |
| }, | |
| { | |
| "entropy": 0.25349168688058854, | |
| "epoch": 1.1846925772539025, | |
| "grad_norm": 7.0926618576049805, | |
| "learning_rate": 7.521759161660246e-05, | |
| "loss": 0.2522360038757324, | |
| "mean_token_accuracy": 0.9197132277488709, | |
| "num_tokens": 2316998826.0, | |
| "step": 29750 | |
| }, | |
| { | |
| "entropy": 0.2608468522131443, | |
| "epoch": 1.1866836572156738, | |
| "grad_norm": 0.7596117854118347, | |
| "learning_rate": 7.490534636520997e-05, | |
| "loss": 0.26308231353759765, | |
| "mean_token_accuracy": 0.9175483292341232, | |
| "num_tokens": 2321019054.0, | |
| "step": 29800 | |
| }, | |
| { | |
| "entropy": 0.25581578224897383, | |
| "epoch": 1.188674737177445, | |
| "grad_norm": 0.8175065517425537, | |
| "learning_rate": 7.45933620050656e-05, | |
| "loss": 0.2528280830383301, | |
| "mean_token_accuracy": 0.9190493965148926, | |
| "num_tokens": 2324919096.0, | |
| "step": 29850 | |
| }, | |
| { | |
| "entropy": 0.25523352801799776, | |
| "epoch": 1.1906658171392164, | |
| "grad_norm": 0.8316560983657837, | |
| "learning_rate": 7.428164177964867e-05, | |
| "loss": 0.25129295349121095, | |
| "mean_token_accuracy": 0.9194622355699539, | |
| "num_tokens": 2328750442.0, | |
| "step": 29900 | |
| }, | |
| { | |
| "entropy": 0.25839961007237433, | |
| "epoch": 1.1926568971009877, | |
| "grad_norm": 6.435125827789307, | |
| "learning_rate": 7.397018892969245e-05, | |
| "loss": 0.25191268920898435, | |
| "mean_token_accuracy": 0.9188542717695236, | |
| "num_tokens": 2332618559.0, | |
| "step": 29950 | |
| }, | |
| { | |
| "entropy": 0.2525199219584465, | |
| "epoch": 1.194647977062759, | |
| "grad_norm": 0.6968880295753479, | |
| "learning_rate": 7.365900669315046e-05, | |
| "loss": 0.2460643768310547, | |
| "mean_token_accuracy": 0.9193591141700744, | |
| "num_tokens": 2336422417.0, | |
| "step": 30000 | |
| }, | |
| { | |
| "epoch": 1.194647977062759, | |
| "eval_entropy": 0.24912547024469528, | |
| "eval_loss": 0.2590893507003784, | |
| "eval_mean_token_accuracy": 0.9145408395736937, | |
| "eval_num_tokens": 2336422417.0, | |
| "eval_runtime": 97.5931, | |
| "eval_samples_per_second": 10.247, | |
| "eval_steps_per_second": 0.646, | |
| "step": 30000 | |
| }, | |
| { | |
| "entropy": 0.26732305482029917, | |
| "epoch": 1.1966390570245302, | |
| "grad_norm": 0.8476821780204773, | |
| "learning_rate": 7.33480983051629e-05, | |
| "loss": 0.2643488693237305, | |
| "mean_token_accuracy": 0.9154199087619781, | |
| "num_tokens": 2340302827.0, | |
| "step": 30050 | |
| }, | |
| { | |
| "entropy": 0.25488393008708954, | |
| "epoch": 1.1986301369863013, | |
| "grad_norm": 0.6083821654319763, | |
| "learning_rate": 7.303746699802289e-05, | |
| "loss": 0.2518123435974121, | |
| "mean_token_accuracy": 0.9191535788774491, | |
| "num_tokens": 2344164776.0, | |
| "step": 30100 | |
| }, | |
| { | |
| "entropy": 0.2546880353987217, | |
| "epoch": 1.2006212169480726, | |
| "grad_norm": 1.4273827075958252, | |
| "learning_rate": 7.272711600114301e-05, | |
| "loss": 0.25110788345336915, | |
| "mean_token_accuracy": 0.9193621718883515, | |
| "num_tokens": 2347949626.0, | |
| "step": 30150 | |
| }, | |
| { | |
| "entropy": 0.2577556924521923, | |
| "epoch": 1.2026122969098438, | |
| "grad_norm": 0.8106961250305176, | |
| "learning_rate": 7.241704854102167e-05, | |
| "loss": 0.25635360717773437, | |
| "mean_token_accuracy": 0.9184073209762573, | |
| "num_tokens": 2351900229.0, | |
| "step": 30200 | |
| }, | |
| { | |
| "entropy": 0.25620258957147596, | |
| "epoch": 1.2046033768716151, | |
| "grad_norm": 0.8120598793029785, | |
| "learning_rate": 7.210726784120941e-05, | |
| "loss": 0.25334203720092774, | |
| "mean_token_accuracy": 0.9191883337497712, | |
| "num_tokens": 2355735339.0, | |
| "step": 30250 | |
| }, | |
| { | |
| "entropy": 0.25752839639782904, | |
| "epoch": 1.2065944568333864, | |
| "grad_norm": 3.0607850551605225, | |
| "learning_rate": 7.179777712227569e-05, | |
| "loss": 0.25776454925537107, | |
| "mean_token_accuracy": 0.9180021786689758, | |
| "num_tokens": 2359574343.0, | |
| "step": 30300 | |
| }, | |
| { | |
| "entropy": 0.2576423817873001, | |
| "epoch": 1.2085855367951577, | |
| "grad_norm": 3.523740768432617, | |
| "learning_rate": 7.14885796017752e-05, | |
| "loss": 0.25613277435302734, | |
| "mean_token_accuracy": 0.9186793148517609, | |
| "num_tokens": 2363536733.0, | |
| "step": 30350 | |
| }, | |
| { | |
| "entropy": 0.2511074875295162, | |
| "epoch": 1.210576616756929, | |
| "grad_norm": 1.0753810405731201, | |
| "learning_rate": 7.117967849421436e-05, | |
| "loss": 0.24952831268310546, | |
| "mean_token_accuracy": 0.9197322314977646, | |
| "num_tokens": 2367519596.0, | |
| "step": 30400 | |
| }, | |
| { | |
| "entropy": 0.25169111222028734, | |
| "epoch": 1.2125676967187002, | |
| "grad_norm": 2.098910331726074, | |
| "learning_rate": 7.087107701101813e-05, | |
| "loss": 0.24964860916137696, | |
| "mean_token_accuracy": 0.9197195601463318, | |
| "num_tokens": 2371517180.0, | |
| "step": 30450 | |
| }, | |
| { | |
| "entropy": 0.2529001899808645, | |
| "epoch": 1.2145587766804715, | |
| "grad_norm": 1.0066713094711304, | |
| "learning_rate": 7.056277836049636e-05, | |
| "loss": 0.24566022872924806, | |
| "mean_token_accuracy": 0.9205902856588364, | |
| "num_tokens": 2375391104.0, | |
| "step": 30500 | |
| }, | |
| { | |
| "entropy": 0.25578666806221007, | |
| "epoch": 1.2165498566422428, | |
| "grad_norm": 1.1897060871124268, | |
| "learning_rate": 7.02547857478107e-05, | |
| "loss": 0.25263437271118167, | |
| "mean_token_accuracy": 0.9195209097862244, | |
| "num_tokens": 2379348591.0, | |
| "step": 30550 | |
| }, | |
| { | |
| "entropy": 0.2526996345818043, | |
| "epoch": 1.218540936604014, | |
| "grad_norm": 1.1875773668289185, | |
| "learning_rate": 6.994710237494107e-05, | |
| "loss": 0.2487725067138672, | |
| "mean_token_accuracy": 0.9197922104597092, | |
| "num_tokens": 2383260952.0, | |
| "step": 30600 | |
| }, | |
| { | |
| "entropy": 0.2540097612142563, | |
| "epoch": 1.2205320165657854, | |
| "grad_norm": 0.6080695390701294, | |
| "learning_rate": 6.963973144065239e-05, | |
| "loss": 0.2553993225097656, | |
| "mean_token_accuracy": 0.919166492819786, | |
| "num_tokens": 2387348809.0, | |
| "step": 30650 | |
| }, | |
| { | |
| "entropy": 0.2552763396501541, | |
| "epoch": 1.2225230965275566, | |
| "grad_norm": 0.8603153824806213, | |
| "learning_rate": 6.933267614046148e-05, | |
| "loss": 0.25409666061401365, | |
| "mean_token_accuracy": 0.9181348937749862, | |
| "num_tokens": 2391236010.0, | |
| "step": 30700 | |
| }, | |
| { | |
| "entropy": 0.2569490122795105, | |
| "epoch": 1.2245141764893277, | |
| "grad_norm": 0.9919761419296265, | |
| "learning_rate": 6.902593966660371e-05, | |
| "loss": 0.252379093170166, | |
| "mean_token_accuracy": 0.9187397682666778, | |
| "num_tokens": 2395300445.0, | |
| "step": 30750 | |
| }, | |
| { | |
| "entropy": 0.2513756537437439, | |
| "epoch": 1.226505256451099, | |
| "grad_norm": 1.3306828737258911, | |
| "learning_rate": 6.871952520799978e-05, | |
| "loss": 0.250519905090332, | |
| "mean_token_accuracy": 0.91956602871418, | |
| "num_tokens": 2399168189.0, | |
| "step": 30800 | |
| }, | |
| { | |
| "entropy": 0.2564035221934319, | |
| "epoch": 1.2284963364128703, | |
| "grad_norm": 7.042972564697266, | |
| "learning_rate": 6.841343595022272e-05, | |
| "loss": 0.2522756576538086, | |
| "mean_token_accuracy": 0.9194320529699326, | |
| "num_tokens": 2402898724.0, | |
| "step": 30850 | |
| }, | |
| { | |
| "entropy": 0.24428572967648507, | |
| "epoch": 1.2304874163746415, | |
| "grad_norm": 4.51497745513916, | |
| "learning_rate": 6.810767507546457e-05, | |
| "loss": 0.24056669235229491, | |
| "mean_token_accuracy": 0.9221302163600922, | |
| "num_tokens": 2406820462.0, | |
| "step": 30900 | |
| }, | |
| { | |
| "entropy": 0.24979312285780908, | |
| "epoch": 1.2324784963364128, | |
| "grad_norm": 1.6140036582946777, | |
| "learning_rate": 6.780224576250347e-05, | |
| "loss": 0.2473303985595703, | |
| "mean_token_accuracy": 0.9202413827180862, | |
| "num_tokens": 2410783096.0, | |
| "step": 30950 | |
| }, | |
| { | |
| "entropy": 0.24745888367295266, | |
| "epoch": 1.234469576298184, | |
| "grad_norm": 1.5148733854293823, | |
| "learning_rate": 6.749715118667061e-05, | |
| "loss": 0.24445684432983397, | |
| "mean_token_accuracy": 0.9212743645906448, | |
| "num_tokens": 2414615195.0, | |
| "step": 31000 | |
| }, | |
| { | |
| "entropy": 0.24440625712275504, | |
| "epoch": 1.2364606562599554, | |
| "grad_norm": 166.31959533691406, | |
| "learning_rate": 6.719239451981702e-05, | |
| "loss": 0.24271812438964843, | |
| "mean_token_accuracy": 0.9218738675117493, | |
| "num_tokens": 2418498880.0, | |
| "step": 31050 | |
| }, | |
| { | |
| "entropy": 0.24401699602603913, | |
| "epoch": 1.2384517362217267, | |
| "grad_norm": 8.616495132446289, | |
| "learning_rate": 6.68879789302808e-05, | |
| "loss": 0.2441313934326172, | |
| "mean_token_accuracy": 0.9215966653823853, | |
| "num_tokens": 2422507271.0, | |
| "step": 31100 | |
| }, | |
| { | |
| "entropy": 0.24902054503560067, | |
| "epoch": 1.240442816183498, | |
| "grad_norm": 2.768110990524292, | |
| "learning_rate": 6.65839075828542e-05, | |
| "loss": 0.24927122116088868, | |
| "mean_token_accuracy": 0.9191774350404739, | |
| "num_tokens": 2426513554.0, | |
| "step": 31150 | |
| }, | |
| { | |
| "entropy": 0.24414533570408822, | |
| "epoch": 1.2424338961452692, | |
| "grad_norm": 12.899252891540527, | |
| "learning_rate": 6.628018363875041e-05, | |
| "loss": 0.23875503540039061, | |
| "mean_token_accuracy": 0.9229415136575699, | |
| "num_tokens": 2430368231.0, | |
| "step": 31200 | |
| }, | |
| { | |
| "entropy": 0.24678532421588897, | |
| "epoch": 1.2444249761070405, | |
| "grad_norm": 1.429768681526184, | |
| "learning_rate": 6.597681025557113e-05, | |
| "loss": 0.24450605392456054, | |
| "mean_token_accuracy": 0.9218378084897995, | |
| "num_tokens": 2434271946.0, | |
| "step": 31250 | |
| }, | |
| { | |
| "entropy": 0.2424020729959011, | |
| "epoch": 1.2464160560688118, | |
| "grad_norm": 29.401817321777344, | |
| "learning_rate": 6.567379058727346e-05, | |
| "loss": 0.24003870010375977, | |
| "mean_token_accuracy": 0.9231269294023514, | |
| "num_tokens": 2438249891.0, | |
| "step": 31300 | |
| }, | |
| { | |
| "entropy": 0.24916338324546813, | |
| "epoch": 1.248407136030583, | |
| "grad_norm": 2.3196229934692383, | |
| "learning_rate": 6.537112778413708e-05, | |
| "loss": 0.24266057968139648, | |
| "mean_token_accuracy": 0.9209426647424698, | |
| "num_tokens": 2442158811.0, | |
| "step": 31350 | |
| }, | |
| { | |
| "entropy": 0.2501223590970039, | |
| "epoch": 1.2503982159923543, | |
| "grad_norm": 1.933199405670166, | |
| "learning_rate": 6.506882499273174e-05, | |
| "loss": 0.25150131225585937, | |
| "mean_token_accuracy": 0.9188826751708984, | |
| "num_tokens": 2446164868.0, | |
| "step": 31400 | |
| }, | |
| { | |
| "entropy": 0.2436576010286808, | |
| "epoch": 1.2523892959541256, | |
| "grad_norm": 5.695888519287109, | |
| "learning_rate": 6.476688535588433e-05, | |
| "loss": 0.24076358795166017, | |
| "mean_token_accuracy": 0.9218398368358612, | |
| "num_tokens": 2449972536.0, | |
| "step": 31450 | |
| }, | |
| { | |
| "entropy": 0.2507163964211941, | |
| "epoch": 1.254380375915897, | |
| "grad_norm": 3.518038749694824, | |
| "learning_rate": 6.446531201264626e-05, | |
| "loss": 0.24629838943481444, | |
| "mean_token_accuracy": 0.9203240805864334, | |
| "num_tokens": 2453851011.0, | |
| "step": 31500 | |
| }, | |
| { | |
| "epoch": 1.254380375915897, | |
| "eval_entropy": 0.24153777602173032, | |
| "eval_loss": 0.2523416578769684, | |
| "eval_mean_token_accuracy": 0.9161454656767467, | |
| "eval_num_tokens": 2453851011.0, | |
| "eval_runtime": 97.9272, | |
| "eval_samples_per_second": 10.212, | |
| "eval_steps_per_second": 0.643, | |
| "step": 31500 | |
| }, | |
| { | |
| "entropy": 0.24645958006381988, | |
| "epoch": 1.256371455877668, | |
| "grad_norm": 34.6347770690918, | |
| "learning_rate": 6.416410809826095e-05, | |
| "loss": 0.2486136817932129, | |
| "mean_token_accuracy": 0.9206688398122788, | |
| "num_tokens": 2457709584.0, | |
| "step": 31550 | |
| }, | |
| { | |
| "entropy": 0.24550958037376402, | |
| "epoch": 1.2583625358394392, | |
| "grad_norm": 2.1734249591827393, | |
| "learning_rate": 6.386327674413102e-05, | |
| "loss": 0.24396198272705077, | |
| "mean_token_accuracy": 0.9210328465700149, | |
| "num_tokens": 2461565590.0, | |
| "step": 31600 | |
| }, | |
| { | |
| "entropy": 0.24458111330866814, | |
| "epoch": 1.2603536158012105, | |
| "grad_norm": 2.1308200359344482, | |
| "learning_rate": 6.356282107778587e-05, | |
| "loss": 0.244349365234375, | |
| "mean_token_accuracy": 0.9208364903926849, | |
| "num_tokens": 2465397732.0, | |
| "step": 31650 | |
| }, | |
| { | |
| "entropy": 0.24412568658590317, | |
| "epoch": 1.2623446957629818, | |
| "grad_norm": 5.350144386291504, | |
| "learning_rate": 6.326274422284922e-05, | |
| "loss": 0.2402265739440918, | |
| "mean_token_accuracy": 0.9222062975168228, | |
| "num_tokens": 2469225379.0, | |
| "step": 31700 | |
| }, | |
| { | |
| "entropy": 0.2523250526189804, | |
| "epoch": 1.264335775724753, | |
| "grad_norm": 1.7639020681381226, | |
| "learning_rate": 6.296304929900638e-05, | |
| "loss": 0.25054126739501953, | |
| "mean_token_accuracy": 0.9195391660928727, | |
| "num_tokens": 2473175319.0, | |
| "step": 31750 | |
| }, | |
| { | |
| "entropy": 0.2518117180466652, | |
| "epoch": 1.2663268556865244, | |
| "grad_norm": 8.069989204406738, | |
| "learning_rate": 6.266373942197228e-05, | |
| "loss": 0.2470506477355957, | |
| "mean_token_accuracy": 0.9194836449623108, | |
| "num_tokens": 2476989249.0, | |
| "step": 31800 | |
| }, | |
| { | |
| "entropy": 0.24566985920071602, | |
| "epoch": 1.2683179356482956, | |
| "grad_norm": 40.28060531616211, | |
| "learning_rate": 6.236481770345845e-05, | |
| "loss": 0.24796669006347657, | |
| "mean_token_accuracy": 0.9207878285646438, | |
| "num_tokens": 2480876708.0, | |
| "step": 31850 | |
| }, | |
| { | |
| "entropy": 0.25329444035887716, | |
| "epoch": 1.270309015610067, | |
| "grad_norm": 1.2897652387619019, | |
| "learning_rate": 6.20662872511413e-05, | |
| "loss": 0.24721664428710938, | |
| "mean_token_accuracy": 0.9197079193592071, | |
| "num_tokens": 2484637032.0, | |
| "step": 31900 | |
| }, | |
| { | |
| "entropy": 0.25620452091097834, | |
| "epoch": 1.2723000955718382, | |
| "grad_norm": 3.7153172492980957, | |
| "learning_rate": 6.176815116862938e-05, | |
| "loss": 0.25328746795654294, | |
| "mean_token_accuracy": 0.918477959036827, | |
| "num_tokens": 2488241591.0, | |
| "step": 31950 | |
| }, | |
| { | |
| "entropy": 0.259455299526453, | |
| "epoch": 1.2742911755336095, | |
| "grad_norm": 0.9825824499130249, | |
| "learning_rate": 6.147041255543127e-05, | |
| "loss": 0.2515993499755859, | |
| "mean_token_accuracy": 0.9188154804706573, | |
| "num_tokens": 2491967910.0, | |
| "step": 32000 | |
| }, | |
| { | |
| "entropy": 0.2545319566130638, | |
| "epoch": 1.2762822554953808, | |
| "grad_norm": 1.2730064392089844, | |
| "learning_rate": 6.117307450692335e-05, | |
| "loss": 0.2528094482421875, | |
| "mean_token_accuracy": 0.9184557616710662, | |
| "num_tokens": 2495775884.0, | |
| "step": 32050 | |
| }, | |
| { | |
| "entropy": 0.24805585592985152, | |
| "epoch": 1.2782733354571518, | |
| "grad_norm": 0.7051454186439514, | |
| "learning_rate": 6.0876140114317716e-05, | |
| "loss": 0.2452733612060547, | |
| "mean_token_accuracy": 0.921332939863205, | |
| "num_tokens": 2499673582.0, | |
| "step": 32100 | |
| }, | |
| { | |
| "entropy": 0.25301434338092804, | |
| "epoch": 1.280264415418923, | |
| "grad_norm": 0.8264440894126892, | |
| "learning_rate": 6.057961246462971e-05, | |
| "loss": 0.24915611267089843, | |
| "mean_token_accuracy": 0.9208215099573135, | |
| "num_tokens": 2503798886.0, | |
| "step": 32150 | |
| }, | |
| { | |
| "entropy": 0.25116061940789225, | |
| "epoch": 1.2822554953806944, | |
| "grad_norm": 0.850557267665863, | |
| "learning_rate": 6.028349464064633e-05, | |
| "loss": 0.24718658447265626, | |
| "mean_token_accuracy": 0.9197705388069153, | |
| "num_tokens": 2507890066.0, | |
| "step": 32200 | |
| }, | |
| { | |
| "entropy": 0.26222523510456086, | |
| "epoch": 1.2842465753424657, | |
| "grad_norm": 0.7549040913581848, | |
| "learning_rate": 5.998778972089368e-05, | |
| "loss": 0.2575231552124023, | |
| "mean_token_accuracy": 0.9183403277397155, | |
| "num_tokens": 2511708723.0, | |
| "step": 32250 | |
| }, | |
| { | |
| "entropy": 0.2572297029197216, | |
| "epoch": 1.286237655304237, | |
| "grad_norm": 0.859230637550354, | |
| "learning_rate": 5.969250077960534e-05, | |
| "loss": 0.2545322799682617, | |
| "mean_token_accuracy": 0.9189767295122147, | |
| "num_tokens": 2515749413.0, | |
| "step": 32300 | |
| }, | |
| { | |
| "entropy": 0.2539103680849075, | |
| "epoch": 1.2882287352660082, | |
| "grad_norm": 0.6217833757400513, | |
| "learning_rate": 5.9397630886690214e-05, | |
| "loss": 0.2517101287841797, | |
| "mean_token_accuracy": 0.9185271793603897, | |
| "num_tokens": 2519642278.0, | |
| "step": 32350 | |
| }, | |
| { | |
| "entropy": 0.2602769346535206, | |
| "epoch": 1.2902198152277795, | |
| "grad_norm": 0.7290419340133667, | |
| "learning_rate": 5.91031831077006e-05, | |
| "loss": 0.25576301574707033, | |
| "mean_token_accuracy": 0.9181579911708831, | |
| "num_tokens": 2523561621.0, | |
| "step": 32400 | |
| }, | |
| { | |
| "entropy": 0.25307921051979065, | |
| "epoch": 1.2922108951895508, | |
| "grad_norm": 45.058815002441406, | |
| "learning_rate": 5.8809160503800455e-05, | |
| "loss": 0.24822502136230468, | |
| "mean_token_accuracy": 0.9194051826000214, | |
| "num_tokens": 2527427498.0, | |
| "step": 32450 | |
| }, | |
| { | |
| "entropy": 0.2419722370803356, | |
| "epoch": 1.294201975151322, | |
| "grad_norm": 1.0116926431655884, | |
| "learning_rate": 5.8515566131733504e-05, | |
| "loss": 0.23900753021240234, | |
| "mean_token_accuracy": 0.9218295383453369, | |
| "num_tokens": 2531296733.0, | |
| "step": 32500 | |
| }, | |
| { | |
| "entropy": 0.24807915300130845, | |
| "epoch": 1.2961930551130934, | |
| "grad_norm": 0.7379711270332336, | |
| "learning_rate": 5.822240304379134e-05, | |
| "loss": 0.2472970199584961, | |
| "mean_token_accuracy": 0.9201249468326569, | |
| "num_tokens": 2535154807.0, | |
| "step": 32550 | |
| }, | |
| { | |
| "entropy": 0.23525363981723785, | |
| "epoch": 1.2981841350748646, | |
| "grad_norm": 0.8442062139511108, | |
| "learning_rate": 5.7929674287781955e-05, | |
| "loss": 0.22923601150512696, | |
| "mean_token_accuracy": 0.9241575568914413, | |
| "num_tokens": 2538967544.0, | |
| "step": 32600 | |
| }, | |
| { | |
| "entropy": 0.25001087591052057, | |
| "epoch": 1.300175215036636, | |
| "grad_norm": 3.9452688694000244, | |
| "learning_rate": 5.7637382906997814e-05, | |
| "loss": 0.24733707427978516, | |
| "mean_token_accuracy": 0.9203029495477676, | |
| "num_tokens": 2542898400.0, | |
| "step": 32650 | |
| }, | |
| { | |
| "entropy": 0.24979558914899827, | |
| "epoch": 1.3021662949984072, | |
| "grad_norm": 0.7694733142852783, | |
| "learning_rate": 5.734553194018425e-05, | |
| "loss": 0.24733903884887695, | |
| "mean_token_accuracy": 0.9204252606630325, | |
| "num_tokens": 2546816900.0, | |
| "step": 32700 | |
| }, | |
| { | |
| "entropy": 0.25051434099674225, | |
| "epoch": 1.3041573749601785, | |
| "grad_norm": 0.617893636226654, | |
| "learning_rate": 5.7054124421508015e-05, | |
| "loss": 0.2471194839477539, | |
| "mean_token_accuracy": 0.9202513420581817, | |
| "num_tokens": 2550760619.0, | |
| "step": 32750 | |
| }, | |
| { | |
| "entropy": 0.2535126593708992, | |
| "epoch": 1.3061484549219498, | |
| "grad_norm": 0.5893092155456543, | |
| "learning_rate": 5.676316338052563e-05, | |
| "loss": 0.24661418914794922, | |
| "mean_token_accuracy": 0.9190385782718659, | |
| "num_tokens": 2554805633.0, | |
| "step": 32800 | |
| }, | |
| { | |
| "entropy": 0.24486387819051741, | |
| "epoch": 1.308139534883721, | |
| "grad_norm": 0.6626051664352417, | |
| "learning_rate": 5.6472651842151894e-05, | |
| "loss": 0.24294389724731447, | |
| "mean_token_accuracy": 0.9217797529697418, | |
| "num_tokens": 2558688969.0, | |
| "step": 32850 | |
| }, | |
| { | |
| "entropy": 0.24416929215192795, | |
| "epoch": 1.3101306148454923, | |
| "grad_norm": 0.6610086560249329, | |
| "learning_rate": 5.618259282662848e-05, | |
| "loss": 0.24305530548095702, | |
| "mean_token_accuracy": 0.9212112122774124, | |
| "num_tokens": 2562599912.0, | |
| "step": 32900 | |
| }, | |
| { | |
| "entropy": 0.2474717128276825, | |
| "epoch": 1.3121216948072636, | |
| "grad_norm": 0.5333130359649658, | |
| "learning_rate": 5.5892989349492345e-05, | |
| "loss": 0.23954826354980469, | |
| "mean_token_accuracy": 0.9213361912965774, | |
| "num_tokens": 2566367287.0, | |
| "step": 32950 | |
| }, | |
| { | |
| "entropy": 0.24256782814860345, | |
| "epoch": 1.3141127747690347, | |
| "grad_norm": 0.7705857753753662, | |
| "learning_rate": 5.560384442154478e-05, | |
| "loss": 0.24114227294921875, | |
| "mean_token_accuracy": 0.9220344460010529, | |
| "num_tokens": 2570302308.0, | |
| "step": 33000 | |
| }, | |
| { | |
| "epoch": 1.3141127747690347, | |
| "eval_entropy": 0.23286663776352293, | |
| "eval_loss": 0.2405821532011032, | |
| "eval_mean_token_accuracy": 0.9191571152399457, | |
| "eval_num_tokens": 2570302308.0, | |
| "eval_runtime": 97.7772, | |
| "eval_samples_per_second": 10.227, | |
| "eval_steps_per_second": 0.644, | |
| "step": 33000 | |
| }, | |
| { | |
| "entropy": 0.24588322430849074, | |
| "epoch": 1.316103854730806, | |
| "grad_norm": 29.474529266357422, | |
| "learning_rate": 5.5315161048819776e-05, | |
| "loss": 0.24144397735595702, | |
| "mean_token_accuracy": 0.9207844561338425, | |
| "num_tokens": 2574129327.0, | |
| "step": 33050 | |
| }, | |
| { | |
| "entropy": 0.2438132531940937, | |
| "epoch": 1.3180949346925772, | |
| "grad_norm": 0.6323732137680054, | |
| "learning_rate": 5.5026942232552735e-05, | |
| "loss": 0.23987579345703125, | |
| "mean_token_accuracy": 0.9224971890449524, | |
| "num_tokens": 2578112074.0, | |
| "step": 33100 | |
| }, | |
| { | |
| "entropy": 0.2441749645769596, | |
| "epoch": 1.3200860146543485, | |
| "grad_norm": 0.8209773898124695, | |
| "learning_rate": 5.473919096914954e-05, | |
| "loss": 0.24236057281494142, | |
| "mean_token_accuracy": 0.9216016113758088, | |
| "num_tokens": 2582025585.0, | |
| "step": 33150 | |
| }, | |
| { | |
| "entropy": 0.23785219475626945, | |
| "epoch": 1.3220770946161198, | |
| "grad_norm": 2.8132340908050537, | |
| "learning_rate": 5.4451910250155216e-05, | |
| "loss": 0.23749332427978515, | |
| "mean_token_accuracy": 0.923515859246254, | |
| "num_tokens": 2585956896.0, | |
| "step": 33200 | |
| }, | |
| { | |
| "entropy": 0.2299913875758648, | |
| "epoch": 1.324068174577891, | |
| "grad_norm": 0.7741996049880981, | |
| "learning_rate": 5.4165103062222867e-05, | |
| "loss": 0.22954608917236327, | |
| "mean_token_accuracy": 0.9249764865636826, | |
| "num_tokens": 2589937310.0, | |
| "step": 33250 | |
| }, | |
| { | |
| "entropy": 0.2423437401652336, | |
| "epoch": 1.3260592545396623, | |
| "grad_norm": 0.7221020460128784, | |
| "learning_rate": 5.387877238708265e-05, | |
| "loss": 0.24239322662353516, | |
| "mean_token_accuracy": 0.9219006705284118, | |
| "num_tokens": 2593689295.0, | |
| "step": 33300 | |
| }, | |
| { | |
| "entropy": 0.24256222799420357, | |
| "epoch": 1.3280503345014336, | |
| "grad_norm": 0.7761672735214233, | |
| "learning_rate": 5.359292120151076e-05, | |
| "loss": 0.2391761589050293, | |
| "mean_token_accuracy": 0.9220723509788513, | |
| "num_tokens": 2597558264.0, | |
| "step": 33350 | |
| }, | |
| { | |
| "entropy": 0.23777956932783126, | |
| "epoch": 1.330041414463205, | |
| "grad_norm": 2.2677993774414062, | |
| "learning_rate": 5.330755247729844e-05, | |
| "loss": 0.23516349792480468, | |
| "mean_token_accuracy": 0.9231782990694046, | |
| "num_tokens": 2601329828.0, | |
| "step": 33400 | |
| }, | |
| { | |
| "entropy": 0.2337485946714878, | |
| "epoch": 1.3320324944249762, | |
| "grad_norm": 1.0745105743408203, | |
| "learning_rate": 5.3022669181221207e-05, | |
| "loss": 0.2339678382873535, | |
| "mean_token_accuracy": 0.9244587421417236, | |
| "num_tokens": 2605206875.0, | |
| "step": 33450 | |
| }, | |
| { | |
| "entropy": 0.23775503277778626, | |
| "epoch": 1.3340235743867472, | |
| "grad_norm": 36.53923416137695, | |
| "learning_rate": 5.273827427500779e-05, | |
| "loss": 0.2353268814086914, | |
| "mean_token_accuracy": 0.9228319334983826, | |
| "num_tokens": 2609060555.0, | |
| "step": 33500 | |
| }, | |
| { | |
| "entropy": 0.2393827061355114, | |
| "epoch": 1.3360146543485185, | |
| "grad_norm": 78.85201263427734, | |
| "learning_rate": 5.245437071530961e-05, | |
| "loss": 0.2345823860168457, | |
| "mean_token_accuracy": 0.9233963018655778, | |
| "num_tokens": 2612925433.0, | |
| "step": 33550 | |
| }, | |
| { | |
| "entropy": 0.23465632140636444, | |
| "epoch": 1.3380057343102898, | |
| "grad_norm": 1.3723814487457275, | |
| "learning_rate": 5.217096145366983e-05, | |
| "loss": 0.23387849807739258, | |
| "mean_token_accuracy": 0.9243163061141968, | |
| "num_tokens": 2616759404.0, | |
| "step": 33600 | |
| }, | |
| { | |
| "entropy": 0.23068988770246507, | |
| "epoch": 1.339996814272061, | |
| "grad_norm": 3.5395326614379883, | |
| "learning_rate": 5.188804943649279e-05, | |
| "loss": 0.22669374465942382, | |
| "mean_token_accuracy": 0.9251353144645691, | |
| "num_tokens": 2620628454.0, | |
| "step": 33650 | |
| }, | |
| { | |
| "entropy": 0.23261408492922783, | |
| "epoch": 1.3419878942338324, | |
| "grad_norm": 15.65046501159668, | |
| "learning_rate": 5.1605637605013334e-05, | |
| "loss": 0.22891586303710937, | |
| "mean_token_accuracy": 0.9242624086141586, | |
| "num_tokens": 2624539152.0, | |
| "step": 33700 | |
| }, | |
| { | |
| "entropy": 0.23109879538416864, | |
| "epoch": 1.3439789741956036, | |
| "grad_norm": 4.173908710479736, | |
| "learning_rate": 5.1323728895266196e-05, | |
| "loss": 0.22842176437377928, | |
| "mean_token_accuracy": 0.9252660167217255, | |
| "num_tokens": 2628689353.0, | |
| "step": 33750 | |
| }, | |
| { | |
| "entropy": 0.23846592292189597, | |
| "epoch": 1.345970054157375, | |
| "grad_norm": 5.710038185119629, | |
| "learning_rate": 5.1042326238055535e-05, | |
| "loss": 0.23568607330322267, | |
| "mean_token_accuracy": 0.9234002131223679, | |
| "num_tokens": 2632732563.0, | |
| "step": 33800 | |
| }, | |
| { | |
| "entropy": 0.23529886215925216, | |
| "epoch": 1.3479611341191462, | |
| "grad_norm": 0.7667160034179688, | |
| "learning_rate": 5.0761432558924474e-05, | |
| "loss": 0.2357318115234375, | |
| "mean_token_accuracy": 0.923137486577034, | |
| "num_tokens": 2636584074.0, | |
| "step": 33850 | |
| }, | |
| { | |
| "entropy": 0.23543915316462516, | |
| "epoch": 1.3499522140809175, | |
| "grad_norm": 0.8430137634277344, | |
| "learning_rate": 5.04810507781245e-05, | |
| "loss": 0.2351871681213379, | |
| "mean_token_accuracy": 0.9230859690904617, | |
| "num_tokens": 2640542951.0, | |
| "step": 33900 | |
| }, | |
| { | |
| "entropy": 0.2279362289607525, | |
| "epoch": 1.3519432940426888, | |
| "grad_norm": 1.9170082807540894, | |
| "learning_rate": 5.0201183810585516e-05, | |
| "loss": 0.22495718002319337, | |
| "mean_token_accuracy": 0.9254985123872757, | |
| "num_tokens": 2644430887.0, | |
| "step": 33950 | |
| }, | |
| { | |
| "entropy": 0.23527911379933358, | |
| "epoch": 1.35393437400446, | |
| "grad_norm": 4.333722114562988, | |
| "learning_rate": 4.9921834565885114e-05, | |
| "loss": 0.23201578140258788, | |
| "mean_token_accuracy": 0.9242059302330017, | |
| "num_tokens": 2648158641.0, | |
| "step": 34000 | |
| }, | |
| { | |
| "entropy": 0.23212642058730126, | |
| "epoch": 1.3559254539662313, | |
| "grad_norm": 0.9224748611450195, | |
| "learning_rate": 4.9643005948218445e-05, | |
| "loss": 0.2337823486328125, | |
| "mean_token_accuracy": 0.924061541557312, | |
| "num_tokens": 2652005779.0, | |
| "step": 34050 | |
| }, | |
| { | |
| "entropy": 0.2346086983382702, | |
| "epoch": 1.3579165339280026, | |
| "grad_norm": 3.9253106117248535, | |
| "learning_rate": 4.9364700856368164e-05, | |
| "loss": 0.23258901596069337, | |
| "mean_token_accuracy": 0.9240314346551896, | |
| "num_tokens": 2656030308.0, | |
| "step": 34100 | |
| }, | |
| { | |
| "entropy": 0.23181153550744057, | |
| "epoch": 1.3599076138897739, | |
| "grad_norm": 0.8032912015914917, | |
| "learning_rate": 4.908692218367419e-05, | |
| "loss": 0.2263050079345703, | |
| "mean_token_accuracy": 0.9245618444681167, | |
| "num_tokens": 2660035042.0, | |
| "step": 34150 | |
| }, | |
| { | |
| "entropy": 0.23851815313100816, | |
| "epoch": 1.3618986938515452, | |
| "grad_norm": 0.6259279847145081, | |
| "learning_rate": 4.880967281800363e-05, | |
| "loss": 0.23707332611083984, | |
| "mean_token_accuracy": 0.9224560678005218, | |
| "num_tokens": 2663994099.0, | |
| "step": 34200 | |
| }, | |
| { | |
| "entropy": 0.23847059220075606, | |
| "epoch": 1.3638897738133164, | |
| "grad_norm": 3.1073203086853027, | |
| "learning_rate": 4.8532955641720734e-05, | |
| "loss": 0.23576877593994142, | |
| "mean_token_accuracy": 0.9226966214179992, | |
| "num_tokens": 2667859794.0, | |
| "step": 34250 | |
| }, | |
| { | |
| "entropy": 0.23225814297795297, | |
| "epoch": 1.3658808537750877, | |
| "grad_norm": 3.2821524143218994, | |
| "learning_rate": 4.8256773531656995e-05, | |
| "loss": 0.2301523780822754, | |
| "mean_token_accuracy": 0.9242325490713119, | |
| "num_tokens": 2671725053.0, | |
| "step": 34300 | |
| }, | |
| { | |
| "entropy": 0.23081228151917457, | |
| "epoch": 1.367871933736859, | |
| "grad_norm": 0.706429660320282, | |
| "learning_rate": 4.7981129359081186e-05, | |
| "loss": 0.22877843856811522, | |
| "mean_token_accuracy": 0.9250713670253754, | |
| "num_tokens": 2675721071.0, | |
| "step": 34350 | |
| }, | |
| { | |
| "entropy": 0.2314528863132, | |
| "epoch": 1.36986301369863, | |
| "grad_norm": 4.0343756675720215, | |
| "learning_rate": 4.770602598966958e-05, | |
| "loss": 0.23183086395263672, | |
| "mean_token_accuracy": 0.9241064774990082, | |
| "num_tokens": 2679745102.0, | |
| "step": 34400 | |
| }, | |
| { | |
| "entropy": 0.23779025599360465, | |
| "epoch": 1.3718540936604013, | |
| "grad_norm": 0.8716291189193726, | |
| "learning_rate": 4.7431466283475956e-05, | |
| "loss": 0.23494630813598633, | |
| "mean_token_accuracy": 0.9234051322937011, | |
| "num_tokens": 2683798504.0, | |
| "step": 34450 | |
| }, | |
| { | |
| "entropy": 0.23259786665439605, | |
| "epoch": 1.3738451736221726, | |
| "grad_norm": 0.7196080684661865, | |
| "learning_rate": 4.715745309490216e-05, | |
| "loss": 0.2321007537841797, | |
| "mean_token_accuracy": 0.925023084282875, | |
| "num_tokens": 2687619200.0, | |
| "step": 34500 | |
| }, | |
| { | |
| "epoch": 1.3738451736221726, | |
| "eval_entropy": 0.22921637552125113, | |
| "eval_loss": 0.23520071804523468, | |
| "eval_mean_token_accuracy": 0.9218012671622019, | |
| "eval_num_tokens": 2687619200.0, | |
| "eval_runtime": 97.7538, | |
| "eval_samples_per_second": 10.23, | |
| "eval_steps_per_second": 0.644, | |
| "step": 34500 | |
| }, | |
| { | |
| "entropy": 0.2326103214919567, | |
| "epoch": 1.375836253583944, | |
| "grad_norm": 2.9911444187164307, | |
| "learning_rate": 4.688398927266824e-05, | |
| "loss": 0.2314113426208496, | |
| "mean_token_accuracy": 0.9237373173236847, | |
| "num_tokens": 2691437944.0, | |
| "step": 34550 | |
| }, | |
| { | |
| "entropy": 0.2364209407567978, | |
| "epoch": 1.3778273335457152, | |
| "grad_norm": 1.710113286972046, | |
| "learning_rate": 4.661107765978285e-05, | |
| "loss": 0.2364255142211914, | |
| "mean_token_accuracy": 0.9232726913690567, | |
| "num_tokens": 2695267662.0, | |
| "step": 34600 | |
| }, | |
| { | |
| "entropy": 0.22886888533830643, | |
| "epoch": 1.3798184135074865, | |
| "grad_norm": 0.5442627668380737, | |
| "learning_rate": 4.633872109351376e-05, | |
| "loss": 0.22827606201171874, | |
| "mean_token_accuracy": 0.9248815947771072, | |
| "num_tokens": 2699192303.0, | |
| "step": 34650 | |
| }, | |
| { | |
| "entropy": 0.2333889891207218, | |
| "epoch": 1.3818094934692577, | |
| "grad_norm": 15.227090835571289, | |
| "learning_rate": 4.606692240535826e-05, | |
| "loss": 0.23413402557373048, | |
| "mean_token_accuracy": 0.9247659987211228, | |
| "num_tokens": 2703104258.0, | |
| "step": 34700 | |
| }, | |
| { | |
| "entropy": 0.22734193563461302, | |
| "epoch": 1.383800573431029, | |
| "grad_norm": 0.7748773694038391, | |
| "learning_rate": 4.579568442101384e-05, | |
| "loss": 0.22380889892578126, | |
| "mean_token_accuracy": 0.9268061184883117, | |
| "num_tokens": 2707095473.0, | |
| "step": 34750 | |
| }, | |
| { | |
| "entropy": 0.23382432997226715, | |
| "epoch": 1.3857916533928003, | |
| "grad_norm": 0.8901104927062988, | |
| "learning_rate": 4.5525009960348744e-05, | |
| "loss": 0.23436962127685546, | |
| "mean_token_accuracy": 0.9240539067983627, | |
| "num_tokens": 2711056973.0, | |
| "step": 34800 | |
| }, | |
| { | |
| "entropy": 0.22885996341705322, | |
| "epoch": 1.3877827333545716, | |
| "grad_norm": 1.1532673835754395, | |
| "learning_rate": 4.525490183737251e-05, | |
| "loss": 0.22763313293457033, | |
| "mean_token_accuracy": 0.9247712236642838, | |
| "num_tokens": 2714954312.0, | |
| "step": 34850 | |
| }, | |
| { | |
| "entropy": 0.2330388432741165, | |
| "epoch": 1.3897738133163429, | |
| "grad_norm": 0.6920197010040283, | |
| "learning_rate": 4.498536286020717e-05, | |
| "loss": 0.2267754364013672, | |
| "mean_token_accuracy": 0.9240225440263748, | |
| "num_tokens": 2718758819.0, | |
| "step": 34900 | |
| }, | |
| { | |
| "entropy": 0.23108075708150863, | |
| "epoch": 1.391764893278114, | |
| "grad_norm": 4.368566513061523, | |
| "learning_rate": 4.471639583105744e-05, | |
| "loss": 0.23003168106079103, | |
| "mean_token_accuracy": 0.9252905690670014, | |
| "num_tokens": 2722720972.0, | |
| "step": 34950 | |
| }, | |
| { | |
| "entropy": 0.23428089499473573, | |
| "epoch": 1.3937559732398852, | |
| "grad_norm": 0.8221115469932556, | |
| "learning_rate": 4.4448003546182105e-05, | |
| "loss": 0.23146120071411133, | |
| "mean_token_accuracy": 0.9236508792638779, | |
| "num_tokens": 2726644445.0, | |
| "step": 35000 | |
| }, | |
| { | |
| "entropy": 0.22516697466373445, | |
| "epoch": 1.3957470532016565, | |
| "grad_norm": 1.4155395030975342, | |
| "learning_rate": 4.4180188795864644e-05, | |
| "loss": 0.2231873893737793, | |
| "mean_token_accuracy": 0.926362236738205, | |
| "num_tokens": 2730496965.0, | |
| "step": 35050 | |
| }, | |
| { | |
| "entropy": 0.2283501335978508, | |
| "epoch": 1.3977381331634278, | |
| "grad_norm": 0.9996873140335083, | |
| "learning_rate": 4.391295436438435e-05, | |
| "loss": 0.2270090675354004, | |
| "mean_token_accuracy": 0.9249064707756043, | |
| "num_tokens": 2734456737.0, | |
| "step": 35100 | |
| }, | |
| { | |
| "entropy": 0.22467306211590768, | |
| "epoch": 1.399729213125199, | |
| "grad_norm": 0.8343448042869568, | |
| "learning_rate": 4.3646303029987376e-05, | |
| "loss": 0.22622060775756836, | |
| "mean_token_accuracy": 0.9265091502666474, | |
| "num_tokens": 2738380451.0, | |
| "step": 35150 | |
| }, | |
| { | |
| "entropy": 0.2316141229867935, | |
| "epoch": 1.4017202930869703, | |
| "grad_norm": 2.3793368339538574, | |
| "learning_rate": 4.3380237564857795e-05, | |
| "loss": 0.23149314880371094, | |
| "mean_token_accuracy": 0.9249173974990845, | |
| "num_tokens": 2742380657.0, | |
| "step": 35200 | |
| }, | |
| { | |
| "entropy": 0.2239141072332859, | |
| "epoch": 1.4037113730487416, | |
| "grad_norm": 3.4736902713775635, | |
| "learning_rate": 4.3114760735088836e-05, | |
| "loss": 0.22573705673217773, | |
| "mean_token_accuracy": 0.9256602203845978, | |
| "num_tokens": 2746460877.0, | |
| "step": 35250 | |
| }, | |
| { | |
| "entropy": 0.229984879642725, | |
| "epoch": 1.4057024530105129, | |
| "grad_norm": 1.3222185373306274, | |
| "learning_rate": 4.2849875300654076e-05, | |
| "loss": 0.2258452606201172, | |
| "mean_token_accuracy": 0.9248714512586593, | |
| "num_tokens": 2750412271.0, | |
| "step": 35300 | |
| }, | |
| { | |
| "entropy": 0.23881920039653778, | |
| "epoch": 1.4076935329722842, | |
| "grad_norm": 1.6275558471679688, | |
| "learning_rate": 4.2585584015378856e-05, | |
| "loss": 0.23602088928222656, | |
| "mean_token_accuracy": 0.9232524186372757, | |
| "num_tokens": 2754252714.0, | |
| "step": 35350 | |
| }, | |
| { | |
| "entropy": 0.22928894877433778, | |
| "epoch": 1.4096846129340554, | |
| "grad_norm": 0.6506333947181702, | |
| "learning_rate": 4.2321889626911414e-05, | |
| "loss": 0.22902776718139647, | |
| "mean_token_accuracy": 0.925293561220169, | |
| "num_tokens": 2758297379.0, | |
| "step": 35400 | |
| }, | |
| { | |
| "entropy": 0.2295927706360817, | |
| "epoch": 1.4116756928958267, | |
| "grad_norm": 0.7610980272293091, | |
| "learning_rate": 4.205879487669464e-05, | |
| "loss": 0.2256919288635254, | |
| "mean_token_accuracy": 0.9253293204307557, | |
| "num_tokens": 2762180568.0, | |
| "step": 35450 | |
| }, | |
| { | |
| "entropy": 0.23466120764613152, | |
| "epoch": 1.413666772857598, | |
| "grad_norm": 0.9445284008979797, | |
| "learning_rate": 4.1796302499937335e-05, | |
| "loss": 0.23389270782470703, | |
| "mean_token_accuracy": 0.923297768831253, | |
| "num_tokens": 2766024401.0, | |
| "step": 35500 | |
| }, | |
| { | |
| "entropy": 0.22722692921757698, | |
| "epoch": 1.4156578528193693, | |
| "grad_norm": 1.244280457496643, | |
| "learning_rate": 4.1534415225585854e-05, | |
| "loss": 0.22508651733398438, | |
| "mean_token_accuracy": 0.9255350995063781, | |
| "num_tokens": 2769745794.0, | |
| "step": 35550 | |
| }, | |
| { | |
| "entropy": 0.227867431640625, | |
| "epoch": 1.4176489327811406, | |
| "grad_norm": 0.7465041875839233, | |
| "learning_rate": 4.127313577629575e-05, | |
| "loss": 0.23069664001464843, | |
| "mean_token_accuracy": 0.9248278605937957, | |
| "num_tokens": 2773587205.0, | |
| "step": 35600 | |
| }, | |
| { | |
| "entropy": 0.22520581975579262, | |
| "epoch": 1.4196400127429118, | |
| "grad_norm": 0.605065643787384, | |
| "learning_rate": 4.101246686840344e-05, | |
| "loss": 0.22308128356933593, | |
| "mean_token_accuracy": 0.9263810759782791, | |
| "num_tokens": 2777527560.0, | |
| "step": 35650 | |
| }, | |
| { | |
| "entropy": 0.22442895591259002, | |
| "epoch": 1.4216310927046831, | |
| "grad_norm": 0.6026067733764648, | |
| "learning_rate": 4.075241121189799e-05, | |
| "loss": 0.22064193725585937, | |
| "mean_token_accuracy": 0.9266389012336731, | |
| "num_tokens": 2781333287.0, | |
| "step": 35700 | |
| }, | |
| { | |
| "entropy": 0.22473806738853455, | |
| "epoch": 1.4236221726664544, | |
| "grad_norm": 0.5562543272972107, | |
| "learning_rate": 4.049297151039295e-05, | |
| "loss": 0.22368572235107423, | |
| "mean_token_accuracy": 0.926014997959137, | |
| "num_tokens": 2785247144.0, | |
| "step": 35750 | |
| }, | |
| { | |
| "entropy": 0.23306748121976853, | |
| "epoch": 1.4256132526282255, | |
| "grad_norm": 14.433042526245117, | |
| "learning_rate": 4.0234150461098084e-05, | |
| "loss": 0.2335945701599121, | |
| "mean_token_accuracy": 0.9244680607318878, | |
| "num_tokens": 2789231231.0, | |
| "step": 35800 | |
| }, | |
| { | |
| "entropy": 0.22841948732733727, | |
| "epoch": 1.4276043325899967, | |
| "grad_norm": 9.771605491638184, | |
| "learning_rate": 3.997595075479171e-05, | |
| "loss": 0.2260110855102539, | |
| "mean_token_accuracy": 0.9248299193382263, | |
| "num_tokens": 2793086574.0, | |
| "step": 35850 | |
| }, | |
| { | |
| "entropy": 0.2289821219444275, | |
| "epoch": 1.429595412551768, | |
| "grad_norm": 1.2308059930801392, | |
| "learning_rate": 3.971837507579228e-05, | |
| "loss": 0.22705148696899413, | |
| "mean_token_accuracy": 0.9248201483488083, | |
| "num_tokens": 2797062663.0, | |
| "step": 35900 | |
| }, | |
| { | |
| "entropy": 0.22674365878105163, | |
| "epoch": 1.4315864925135393, | |
| "grad_norm": 0.6203780770301819, | |
| "learning_rate": 3.946142610193075e-05, | |
| "loss": 0.22311054229736327, | |
| "mean_token_accuracy": 0.9253755122423172, | |
| "num_tokens": 2801003084.0, | |
| "step": 35950 | |
| }, | |
| { | |
| "entropy": 0.2285499520599842, | |
| "epoch": 1.4335775724753106, | |
| "grad_norm": 0.6966903805732727, | |
| "learning_rate": 3.920510650452269e-05, | |
| "loss": 0.22486160278320313, | |
| "mean_token_accuracy": 0.9250599068403244, | |
| "num_tokens": 2804929445.0, | |
| "step": 36000 | |
| }, | |
| { | |
| "epoch": 1.4335775724753106, | |
| "eval_entropy": 0.22345993916193643, | |
| "eval_loss": 0.2309042513370514, | |
| "eval_mean_token_accuracy": 0.9215882713832553, | |
| "eval_num_tokens": 2804929445.0, | |
| "eval_runtime": 97.9244, | |
| "eval_samples_per_second": 10.212, | |
| "eval_steps_per_second": 0.643, | |
| "step": 36000 | |
| }, | |
| { | |
| "entropy": 0.22846704930067063, | |
| "epoch": 1.4355686524370819, | |
| "grad_norm": 18.896896362304688, | |
| "learning_rate": 3.894941894834048e-05, | |
| "loss": 0.22570266723632812, | |
| "mean_token_accuracy": 0.9257201546430588, | |
| "num_tokens": 2808763772.0, | |
| "step": 36050 | |
| }, | |
| { | |
| "entropy": 0.22670045271515846, | |
| "epoch": 1.4375597323988532, | |
| "grad_norm": 2.932440996170044, | |
| "learning_rate": 3.869436609158559e-05, | |
| "loss": 0.22269927978515625, | |
| "mean_token_accuracy": 0.9260558187961578, | |
| "num_tokens": 2812551635.0, | |
| "step": 36100 | |
| }, | |
| { | |
| "entropy": 0.2322857917845249, | |
| "epoch": 1.4395508123606244, | |
| "grad_norm": 2.4364428520202637, | |
| "learning_rate": 3.8439950585861e-05, | |
| "loss": 0.22790021896362306, | |
| "mean_token_accuracy": 0.9243459624052047, | |
| "num_tokens": 2816505564.0, | |
| "step": 36150 | |
| }, | |
| { | |
| "entropy": 0.23179278627038002, | |
| "epoch": 1.4415418923223957, | |
| "grad_norm": 0.8245556950569153, | |
| "learning_rate": 3.81861750761436e-05, | |
| "loss": 0.22998580932617188, | |
| "mean_token_accuracy": 0.9245978146791458, | |
| "num_tokens": 2820466604.0, | |
| "step": 36200 | |
| }, | |
| { | |
| "entropy": 0.23288773104548455, | |
| "epoch": 1.443532972284167, | |
| "grad_norm": 1.0259772539138794, | |
| "learning_rate": 3.793304220075672e-05, | |
| "loss": 0.23358001708984374, | |
| "mean_token_accuracy": 0.9243580067157745, | |
| "num_tokens": 2824397515.0, | |
| "step": 36250 | |
| }, | |
| { | |
| "entropy": 0.22789985239505767, | |
| "epoch": 1.4455240522459383, | |
| "grad_norm": 9.18964672088623, | |
| "learning_rate": 3.7680554591342595e-05, | |
| "loss": 0.224021053314209, | |
| "mean_token_accuracy": 0.9257315665483474, | |
| "num_tokens": 2828322125.0, | |
| "step": 36300 | |
| }, | |
| { | |
| "entropy": 0.22588057518005372, | |
| "epoch": 1.4475151322077093, | |
| "grad_norm": 1.5855872631072998, | |
| "learning_rate": 3.742871487283517e-05, | |
| "loss": 0.2249225616455078, | |
| "mean_token_accuracy": 0.9258129727840424, | |
| "num_tokens": 2832064808.0, | |
| "step": 36350 | |
| }, | |
| { | |
| "entropy": 0.22681081116199495, | |
| "epoch": 1.4495062121694806, | |
| "grad_norm": 0.9966343641281128, | |
| "learning_rate": 3.717752566343271e-05, | |
| "loss": 0.22803802490234376, | |
| "mean_token_accuracy": 0.9256650274991989, | |
| "num_tokens": 2836024488.0, | |
| "step": 36400 | |
| }, | |
| { | |
| "entropy": 0.23106618836522103, | |
| "epoch": 1.451497292131252, | |
| "grad_norm": 4.7284464836120605, | |
| "learning_rate": 3.69269895745706e-05, | |
| "loss": 0.22984613418579103, | |
| "mean_token_accuracy": 0.9237276768684387, | |
| "num_tokens": 2839943059.0, | |
| "step": 36450 | |
| }, | |
| { | |
| "entropy": 0.22288828268647193, | |
| "epoch": 1.4534883720930232, | |
| "grad_norm": 0.7623031139373779, | |
| "learning_rate": 3.667710921089418e-05, | |
| "loss": 0.22018928527832032, | |
| "mean_token_accuracy": 0.9268843108415603, | |
| "num_tokens": 2843833836.0, | |
| "step": 36500 | |
| }, | |
| { | |
| "entropy": 0.23100583925843238, | |
| "epoch": 1.4554794520547945, | |
| "grad_norm": 0.8289280533790588, | |
| "learning_rate": 3.64278871702317e-05, | |
| "loss": 0.22793426513671874, | |
| "mean_token_accuracy": 0.9247871005535125, | |
| "num_tokens": 2847710648.0, | |
| "step": 36550 | |
| }, | |
| { | |
| "entropy": 0.2282957051694393, | |
| "epoch": 1.4574705320165657, | |
| "grad_norm": 0.7811777591705322, | |
| "learning_rate": 3.617932604356729e-05, | |
| "loss": 0.22422840118408202, | |
| "mean_token_accuracy": 0.9262890052795411, | |
| "num_tokens": 2851604514.0, | |
| "step": 36600 | |
| }, | |
| { | |
| "entropy": 0.22520012721419336, | |
| "epoch": 1.459461611978337, | |
| "grad_norm": 0.8696520328521729, | |
| "learning_rate": 3.5931428415014014e-05, | |
| "loss": 0.22324569702148436, | |
| "mean_token_accuracy": 0.9258240640163422, | |
| "num_tokens": 2855664391.0, | |
| "step": 36650 | |
| }, | |
| { | |
| "entropy": 0.22581250563263894, | |
| "epoch": 1.4614526919401083, | |
| "grad_norm": 0.744315505027771, | |
| "learning_rate": 3.568419686178708e-05, | |
| "loss": 0.22559711456298828, | |
| "mean_token_accuracy": 0.9261856961250305, | |
| "num_tokens": 2859509766.0, | |
| "step": 36700 | |
| }, | |
| { | |
| "entropy": 0.2275920917093754, | |
| "epoch": 1.4634437719018796, | |
| "grad_norm": 1.2164433002471924, | |
| "learning_rate": 3.543763395417682e-05, | |
| "loss": 0.2258456802368164, | |
| "mean_token_accuracy": 0.9255189836025238, | |
| "num_tokens": 2863404259.0, | |
| "step": 36750 | |
| }, | |
| { | |
| "entropy": 0.22345173820853234, | |
| "epoch": 1.4654348518636509, | |
| "grad_norm": 0.6867997646331787, | |
| "learning_rate": 3.5191742255522395e-05, | |
| "loss": 0.22099639892578124, | |
| "mean_token_accuracy": 0.9270286786556244, | |
| "num_tokens": 2867284843.0, | |
| "step": 36800 | |
| }, | |
| { | |
| "entropy": 0.21736916065216064, | |
| "epoch": 1.4674259318254221, | |
| "grad_norm": 0.7665778994560242, | |
| "learning_rate": 3.494652432218463e-05, | |
| "loss": 0.2197450065612793, | |
| "mean_token_accuracy": 0.9281142580509186, | |
| "num_tokens": 2871146245.0, | |
| "step": 36850 | |
| }, | |
| { | |
| "entropy": 0.2261849372088909, | |
| "epoch": 1.4694170117871934, | |
| "grad_norm": 1.0307066440582275, | |
| "learning_rate": 3.470198270351983e-05, | |
| "loss": 0.2237540054321289, | |
| "mean_token_accuracy": 0.9261994022130966, | |
| "num_tokens": 2874929172.0, | |
| "step": 36900 | |
| }, | |
| { | |
| "entropy": 0.22291465908288954, | |
| "epoch": 1.4714080917489647, | |
| "grad_norm": 111.51166534423828, | |
| "learning_rate": 3.445811994185311e-05, | |
| "loss": 0.21993278503417968, | |
| "mean_token_accuracy": 0.9265702044963837, | |
| "num_tokens": 2878907889.0, | |
| "step": 36950 | |
| }, | |
| { | |
| "entropy": 0.22984845981001853, | |
| "epoch": 1.473399171710736, | |
| "grad_norm": 0.6987447738647461, | |
| "learning_rate": 3.421493857245199e-05, | |
| "loss": 0.23014335632324218, | |
| "mean_token_accuracy": 0.9256218951940537, | |
| "num_tokens": 2882673971.0, | |
| "step": 37000 | |
| }, | |
| { | |
| "entropy": 0.22242909878492356, | |
| "epoch": 1.4753902516725073, | |
| "grad_norm": 2.1599528789520264, | |
| "learning_rate": 3.3972441123500045e-05, | |
| "loss": 0.22177177429199219, | |
| "mean_token_accuracy": 0.9269962483644485, | |
| "num_tokens": 2886614337.0, | |
| "step": 37050 | |
| }, | |
| { | |
| "entropy": 0.22314247265458106, | |
| "epoch": 1.4773813316342785, | |
| "grad_norm": 0.648526132106781, | |
| "learning_rate": 3.373063011607059e-05, | |
| "loss": 0.22280792236328126, | |
| "mean_token_accuracy": 0.9268735468387603, | |
| "num_tokens": 2890594824.0, | |
| "step": 37100 | |
| }, | |
| { | |
| "entropy": 0.22995008423924446, | |
| "epoch": 1.4793724115960498, | |
| "grad_norm": 0.9100789427757263, | |
| "learning_rate": 3.348950806410054e-05, | |
| "loss": 0.22757783889770508, | |
| "mean_token_accuracy": 0.9252729284763336, | |
| "num_tokens": 2894438864.0, | |
| "step": 37150 | |
| }, | |
| { | |
| "entropy": 0.22689683616161346, | |
| "epoch": 1.481363491557821, | |
| "grad_norm": 121.19415283203125, | |
| "learning_rate": 3.324907747436423e-05, | |
| "loss": 0.2277880859375, | |
| "mean_token_accuracy": 0.9258731609582901, | |
| "num_tokens": 2898300182.0, | |
| "step": 37200 | |
| }, | |
| { | |
| "entropy": 0.22294052615761756, | |
| "epoch": 1.4833545715195922, | |
| "grad_norm": 30.978212356567383, | |
| "learning_rate": 3.300934084644727e-05, | |
| "loss": 0.21728097915649414, | |
| "mean_token_accuracy": 0.9270085525512696, | |
| "num_tokens": 2902221223.0, | |
| "step": 37250 | |
| }, | |
| { | |
| "entropy": 0.23212106972932817, | |
| "epoch": 1.4853456514813634, | |
| "grad_norm": 0.8279492259025574, | |
| "learning_rate": 3.277030067272072e-05, | |
| "loss": 0.23210474014282226, | |
| "mean_token_accuracy": 0.9236459809541703, | |
| "num_tokens": 2905980634.0, | |
| "step": 37300 | |
| }, | |
| { | |
| "entropy": 0.22908665359020233, | |
| "epoch": 1.4873367314431347, | |
| "grad_norm": 2.934983015060425, | |
| "learning_rate": 3.253195943831511e-05, | |
| "loss": 0.22299076080322267, | |
| "mean_token_accuracy": 0.925340690612793, | |
| "num_tokens": 2909868699.0, | |
| "step": 37350 | |
| }, | |
| { | |
| "entropy": 0.22319218948483466, | |
| "epoch": 1.489327811404906, | |
| "grad_norm": 11.222670555114746, | |
| "learning_rate": 3.229431962109455e-05, | |
| "loss": 0.22189111709594728, | |
| "mean_token_accuracy": 0.9269910353422165, | |
| "num_tokens": 2913868017.0, | |
| "step": 37400 | |
| }, | |
| { | |
| "entropy": 0.2243164885044098, | |
| "epoch": 1.4913188913666773, | |
| "grad_norm": 25.52601432800293, | |
| "learning_rate": 3.205738369163105e-05, | |
| "loss": 0.22555835723876952, | |
| "mean_token_accuracy": 0.9249966585636139, | |
| "num_tokens": 2917728385.0, | |
| "step": 37450 | |
| }, | |
| { | |
| "entropy": 0.2241789762675762, | |
| "epoch": 1.4933099713284486, | |
| "grad_norm": 9572.515625, | |
| "learning_rate": 3.182115411317879e-05, | |
| "loss": 0.22412548065185547, | |
| "mean_token_accuracy": 0.9268283969163895, | |
| "num_tokens": 2921629087.0, | |
| "step": 37500 | |
| }, | |
| { | |
| "epoch": 1.4933099713284486, | |
| "eval_entropy": 0.22155299451616076, | |
| "eval_loss": 0.226557195186615, | |
| "eval_mean_token_accuracy": 0.9227044922964913, | |
| "eval_num_tokens": 2921629087.0, | |
| "eval_runtime": 97.8985, | |
| "eval_samples_per_second": 10.215, | |
| "eval_steps_per_second": 0.644, | |
| "step": 37500 | |
| }, | |
| { | |
| "entropy": 0.2184179201722145, | |
| "epoch": 1.4953010512902198, | |
| "grad_norm": 1.632070541381836, | |
| "learning_rate": 3.1585633341648505e-05, | |
| "loss": 0.21661128997802734, | |
| "mean_token_accuracy": 0.927964398264885, | |
| "num_tokens": 2925570451.0, | |
| "step": 37550 | |
| }, | |
| { | |
| "entropy": 0.2241984224319458, | |
| "epoch": 1.4972921312519911, | |
| "grad_norm": 2.975705862045288, | |
| "learning_rate": 3.135082382558202e-05, | |
| "loss": 0.22081336975097657, | |
| "mean_token_accuracy": 0.9267278093099595, | |
| "num_tokens": 2929558328.0, | |
| "step": 37600 | |
| }, | |
| { | |
| "entropy": 0.2238903446495533, | |
| "epoch": 1.4992832112137624, | |
| "grad_norm": 1.1821390390396118, | |
| "learning_rate": 3.111672800612664e-05, | |
| "loss": 0.2203415298461914, | |
| "mean_token_accuracy": 0.9268561029434204, | |
| "num_tokens": 2933576475.0, | |
| "step": 37650 | |
| }, | |
| { | |
| "entropy": 0.21960934937000276, | |
| "epoch": 1.5012742911755335, | |
| "grad_norm": 4.258495330810547, | |
| "learning_rate": 3.088334831700993e-05, | |
| "loss": 0.21440572738647462, | |
| "mean_token_accuracy": 0.9271126753091812, | |
| "num_tokens": 2937500631.0, | |
| "step": 37700 | |
| }, | |
| { | |
| "entropy": 0.22476192206144333, | |
| "epoch": 1.5032653711373047, | |
| "grad_norm": 3.1449878215789795, | |
| "learning_rate": 3.0650687184514485e-05, | |
| "loss": 0.2259622573852539, | |
| "mean_token_accuracy": 0.925874103307724, | |
| "num_tokens": 2941343777.0, | |
| "step": 37750 | |
| }, | |
| { | |
| "entropy": 0.22604495018720627, | |
| "epoch": 1.505256451099076, | |
| "grad_norm": 8.281270980834961, | |
| "learning_rate": 3.0418747027452344e-05, | |
| "loss": 0.2268206787109375, | |
| "mean_token_accuracy": 0.9257059663534164, | |
| "num_tokens": 2945269139.0, | |
| "step": 37800 | |
| }, | |
| { | |
| "entropy": 0.2256699912250042, | |
| "epoch": 1.5072475310608473, | |
| "grad_norm": 1.3491407632827759, | |
| "learning_rate": 3.018753025714024e-05, | |
| "loss": 0.2271018409729004, | |
| "mean_token_accuracy": 0.92496422290802, | |
| "num_tokens": 2949257027.0, | |
| "step": 37850 | |
| }, | |
| { | |
| "entropy": 0.2192372766137123, | |
| "epoch": 1.5092386110226186, | |
| "grad_norm": 8.2188720703125, | |
| "learning_rate": 2.9957039277374323e-05, | |
| "loss": 0.2174224090576172, | |
| "mean_token_accuracy": 0.9276827430725098, | |
| "num_tokens": 2953283440.0, | |
| "step": 37900 | |
| }, | |
| { | |
| "entropy": 0.22263924196362495, | |
| "epoch": 1.5112296909843899, | |
| "grad_norm": 4.670276165008545, | |
| "learning_rate": 2.972727648440521e-05, | |
| "loss": 0.21921150207519532, | |
| "mean_token_accuracy": 0.9276534301042557, | |
| "num_tokens": 2956989210.0, | |
| "step": 37950 | |
| }, | |
| { | |
| "entropy": 0.21206003218889236, | |
| "epoch": 1.5132207709461611, | |
| "grad_norm": 2.4002881050109863, | |
| "learning_rate": 2.9498244266913077e-05, | |
| "loss": 0.2130445671081543, | |
| "mean_token_accuracy": 0.9293075942993164, | |
| "num_tokens": 2960990017.0, | |
| "step": 38000 | |
| }, | |
| { | |
| "entropy": 0.22117702782154083, | |
| "epoch": 1.5152118509079324, | |
| "grad_norm": 6.803835391998291, | |
| "learning_rate": 2.926994500598288e-05, | |
| "loss": 0.22471899032592774, | |
| "mean_token_accuracy": 0.9264506107568741, | |
| "num_tokens": 2964919811.0, | |
| "step": 38050 | |
| }, | |
| { | |
| "entropy": 0.22678003415465356, | |
| "epoch": 1.5172029308697037, | |
| "grad_norm": 1.0673514604568481, | |
| "learning_rate": 2.9042381075079394e-05, | |
| "loss": 0.2256137275695801, | |
| "mean_token_accuracy": 0.9257134348154068, | |
| "num_tokens": 2968978045.0, | |
| "step": 38100 | |
| }, | |
| { | |
| "entropy": 0.22859185308218002, | |
| "epoch": 1.519194010831475, | |
| "grad_norm": 1.2845282554626465, | |
| "learning_rate": 2.881555484002293e-05, | |
| "loss": 0.22426969528198243, | |
| "mean_token_accuracy": 0.9252816712856293, | |
| "num_tokens": 2972980896.0, | |
| "step": 38150 | |
| }, | |
| { | |
| "entropy": 0.22109326124191284, | |
| "epoch": 1.5211850907932463, | |
| "grad_norm": 5.438140392303467, | |
| "learning_rate": 2.858946865896428e-05, | |
| "loss": 0.21824604034423828, | |
| "mean_token_accuracy": 0.9274251675605774, | |
| "num_tokens": 2976722951.0, | |
| "step": 38200 | |
| }, | |
| { | |
| "entropy": 0.22596635431051254, | |
| "epoch": 1.5231761707550175, | |
| "grad_norm": 14.905731201171875, | |
| "learning_rate": 2.8364124882360544e-05, | |
| "loss": 0.22388429641723634, | |
| "mean_token_accuracy": 0.9256227517127991, | |
| "num_tokens": 2980714087.0, | |
| "step": 38250 | |
| }, | |
| { | |
| "entropy": 0.2224484533071518, | |
| "epoch": 1.5251672507167888, | |
| "grad_norm": 3.0896732807159424, | |
| "learning_rate": 2.813952585295052e-05, | |
| "loss": 0.22124006271362304, | |
| "mean_token_accuracy": 0.9260759902000427, | |
| "num_tokens": 2984690559.0, | |
| "step": 38300 | |
| }, | |
| { | |
| "entropy": 0.2202881780266762, | |
| "epoch": 1.52715833067856, | |
| "grad_norm": 5.143960475921631, | |
| "learning_rate": 2.7915673905730434e-05, | |
| "loss": 0.21950557708740234, | |
| "mean_token_accuracy": 0.9270938616991043, | |
| "num_tokens": 2988553760.0, | |
| "step": 38350 | |
| }, | |
| { | |
| "entropy": 0.22221544161438941, | |
| "epoch": 1.5291494106403314, | |
| "grad_norm": 4.49341344833374, | |
| "learning_rate": 2.7692571367929608e-05, | |
| "loss": 0.22334598541259765, | |
| "mean_token_accuracy": 0.9261446082592011, | |
| "num_tokens": 2992421474.0, | |
| "step": 38400 | |
| }, | |
| { | |
| "entropy": 0.22259217351675034, | |
| "epoch": 1.5311404906021027, | |
| "grad_norm": 22.436153411865234, | |
| "learning_rate": 2.7470220558986293e-05, | |
| "loss": 0.2211014747619629, | |
| "mean_token_accuracy": 0.927097294330597, | |
| "num_tokens": 2996393136.0, | |
| "step": 38450 | |
| }, | |
| { | |
| "entropy": 0.2215883442759514, | |
| "epoch": 1.533131570563874, | |
| "grad_norm": 12.471090316772461, | |
| "learning_rate": 2.7248623790523552e-05, | |
| "loss": 0.21897666931152343, | |
| "mean_token_accuracy": 0.9272121900320053, | |
| "num_tokens": 3000399931.0, | |
| "step": 38500 | |
| }, | |
| { | |
| "entropy": 0.2189611642062664, | |
| "epoch": 1.5351226505256452, | |
| "grad_norm": 2.521131753921509, | |
| "learning_rate": 2.7027783366325255e-05, | |
| "loss": 0.22009151458740234, | |
| "mean_token_accuracy": 0.9275297212600708, | |
| "num_tokens": 3004351373.0, | |
| "step": 38550 | |
| }, | |
| { | |
| "entropy": 0.21605175256729126, | |
| "epoch": 1.5371137304874165, | |
| "grad_norm": 0.8228936195373535, | |
| "learning_rate": 2.6807701582312007e-05, | |
| "loss": 0.21643526077270508, | |
| "mean_token_accuracy": 0.9290778201818466, | |
| "num_tokens": 3008120830.0, | |
| "step": 38600 | |
| }, | |
| { | |
| "entropy": 0.21972268596291541, | |
| "epoch": 1.5391048104491878, | |
| "grad_norm": 4.456844329833984, | |
| "learning_rate": 2.6588380726517438e-05, | |
| "loss": 0.21687641143798828, | |
| "mean_token_accuracy": 0.927766455411911, | |
| "num_tokens": 3011862850.0, | |
| "step": 38650 | |
| }, | |
| { | |
| "entropy": 0.21665039166808128, | |
| "epoch": 1.541095890410959, | |
| "grad_norm": 13.769525527954102, | |
| "learning_rate": 2.6369823079064426e-05, | |
| "loss": 0.21669651031494142, | |
| "mean_token_accuracy": 0.9281174397468567, | |
| "num_tokens": 3015844338.0, | |
| "step": 38700 | |
| }, | |
| { | |
| "entropy": 0.21486522629857063, | |
| "epoch": 1.5430869703727301, | |
| "grad_norm": 2.328981637954712, | |
| "learning_rate": 2.6152030912141156e-05, | |
| "loss": 0.213769588470459, | |
| "mean_token_accuracy": 0.9283159101009368, | |
| "num_tokens": 3019795586.0, | |
| "step": 38750 | |
| }, | |
| { | |
| "entropy": 0.2236236061155796, | |
| "epoch": 1.5450780503345014, | |
| "grad_norm": 1.409731388092041, | |
| "learning_rate": 2.5935006489977753e-05, | |
| "loss": 0.22388771057128906, | |
| "mean_token_accuracy": 0.9261727368831635, | |
| "num_tokens": 3023785071.0, | |
| "step": 38800 | |
| }, | |
| { | |
| "entropy": 0.22205795854330063, | |
| "epoch": 1.5470691302962727, | |
| "grad_norm": 0.8017808794975281, | |
| "learning_rate": 2.5718752068822637e-05, | |
| "loss": 0.21935756683349608, | |
| "mean_token_accuracy": 0.9270194679498672, | |
| "num_tokens": 3027649742.0, | |
| "step": 38850 | |
| }, | |
| { | |
| "entropy": 0.21731107220053672, | |
| "epoch": 1.549060210258044, | |
| "grad_norm": 1.1843457221984863, | |
| "learning_rate": 2.5503269896919056e-05, | |
| "loss": 0.21343338012695312, | |
| "mean_token_accuracy": 0.9281834596395493, | |
| "num_tokens": 3031508387.0, | |
| "step": 38900 | |
| }, | |
| { | |
| "entropy": 0.2247211866080761, | |
| "epoch": 1.5510512902198152, | |
| "grad_norm": 2.625734567642212, | |
| "learning_rate": 2.5288562214481783e-05, | |
| "loss": 0.21889663696289063, | |
| "mean_token_accuracy": 0.9264307451248169, | |
| "num_tokens": 3035507408.0, | |
| "step": 38950 | |
| }, | |
| { | |
| "entropy": 0.21469190895557402, | |
| "epoch": 1.5530423701815865, | |
| "grad_norm": 1.0048292875289917, | |
| "learning_rate": 2.5074631253673662e-05, | |
| "loss": 0.21466026306152344, | |
| "mean_token_accuracy": 0.928369175195694, | |
| "num_tokens": 3039388849.0, | |
| "step": 39000 | |
| }, | |
| { | |
| "epoch": 1.5530423701815865, | |
| "eval_entropy": 0.21342357555552136, | |
| "eval_loss": 0.22486525774002075, | |
| "eval_mean_token_accuracy": 0.9228534215972537, | |
| "eval_num_tokens": 3039388849.0, | |
| "eval_runtime": 98.35, | |
| "eval_samples_per_second": 10.168, | |
| "eval_steps_per_second": 0.641, | |
| "step": 39000 | |
| }, | |
| { | |
| "entropy": 0.22176682874560355, | |
| "epoch": 1.5550334501433578, | |
| "grad_norm": 3.4707674980163574, | |
| "learning_rate": 2.4861479238582596e-05, | |
| "loss": 0.22119997024536134, | |
| "mean_token_accuracy": 0.9259116953611374, | |
| "num_tokens": 3043265800.0, | |
| "step": 39050 | |
| }, | |
| { | |
| "entropy": 0.21799086198210715, | |
| "epoch": 1.5570245301051289, | |
| "grad_norm": 2.8396286964416504, | |
| "learning_rate": 2.4649108385198427e-05, | |
| "loss": 0.2187785530090332, | |
| "mean_token_accuracy": 0.9272249537706375, | |
| "num_tokens": 3047277743.0, | |
| "step": 39100 | |
| }, | |
| { | |
| "entropy": 0.21569239243865013, | |
| "epoch": 1.5590156100669001, | |
| "grad_norm": 1.3464019298553467, | |
| "learning_rate": 2.4437520901389632e-05, | |
| "loss": 0.2122294807434082, | |
| "mean_token_accuracy": 0.9286917650699615, | |
| "num_tokens": 3051165918.0, | |
| "step": 39150 | |
| }, | |
| { | |
| "entropy": 0.22129391238093377, | |
| "epoch": 1.5610066900286714, | |
| "grad_norm": 50.253761291503906, | |
| "learning_rate": 2.422671898688068e-05, | |
| "loss": 0.2180173873901367, | |
| "mean_token_accuracy": 0.9284462577104569, | |
| "num_tokens": 3055024433.0, | |
| "step": 39200 | |
| }, | |
| { | |
| "entropy": 0.22183120295405387, | |
| "epoch": 1.5629977699904427, | |
| "grad_norm": 2.614213705062866, | |
| "learning_rate": 2.4016704833228998e-05, | |
| "loss": 0.21925174713134765, | |
| "mean_token_accuracy": 0.9262894040346146, | |
| "num_tokens": 3058925272.0, | |
| "step": 39250 | |
| }, | |
| { | |
| "entropy": 0.21707088455557824, | |
| "epoch": 1.564988849952214, | |
| "grad_norm": 2.362391710281372, | |
| "learning_rate": 2.3807480623802216e-05, | |
| "loss": 0.21744693756103517, | |
| "mean_token_accuracy": 0.9284393548965454, | |
| "num_tokens": 3062926466.0, | |
| "step": 39300 | |
| }, | |
| { | |
| "entropy": 0.2231329759955406, | |
| "epoch": 1.5669799299139853, | |
| "grad_norm": 2.7910847663879395, | |
| "learning_rate": 2.3599048533755484e-05, | |
| "loss": 0.2215903091430664, | |
| "mean_token_accuracy": 0.92674241065979, | |
| "num_tokens": 3066774481.0, | |
| "step": 39350 | |
| }, | |
| { | |
| "entropy": 0.218631292283535, | |
| "epoch": 1.5689710098757566, | |
| "grad_norm": 2.050013780593872, | |
| "learning_rate": 2.339141073000888e-05, | |
| "loss": 0.2163446044921875, | |
| "mean_token_accuracy": 0.9279627180099488, | |
| "num_tokens": 3070759669.0, | |
| "step": 39400 | |
| }, | |
| { | |
| "entropy": 0.22251748919487, | |
| "epoch": 1.5709620898375278, | |
| "grad_norm": 1.1582326889038086, | |
| "learning_rate": 2.3184569371224796e-05, | |
| "loss": 0.22154170989990235, | |
| "mean_token_accuracy": 0.9265431314706802, | |
| "num_tokens": 3074745933.0, | |
| "step": 39450 | |
| }, | |
| { | |
| "entropy": 0.21645621821284294, | |
| "epoch": 1.5729531697992991, | |
| "grad_norm": 1.1507421731948853, | |
| "learning_rate": 2.297852660778561e-05, | |
| "loss": 0.2131570053100586, | |
| "mean_token_accuracy": 0.9290761828422547, | |
| "num_tokens": 3078609666.0, | |
| "step": 39500 | |
| }, | |
| { | |
| "entropy": 0.21492433786392212, | |
| "epoch": 1.5749442497610704, | |
| "grad_norm": 4.330776691436768, | |
| "learning_rate": 2.2773284581771214e-05, | |
| "loss": 0.2180664825439453, | |
| "mean_token_accuracy": 0.9282948035001755, | |
| "num_tokens": 3082354144.0, | |
| "step": 39550 | |
| }, | |
| { | |
| "entropy": 0.21522749200463295, | |
| "epoch": 1.5769353297228417, | |
| "grad_norm": 1.0180329084396362, | |
| "learning_rate": 2.2568845426936823e-05, | |
| "loss": 0.2134151840209961, | |
| "mean_token_accuracy": 0.9284723418951034, | |
| "num_tokens": 3086179781.0, | |
| "step": 39600 | |
| }, | |
| { | |
| "entropy": 0.21389096170663835, | |
| "epoch": 1.578926409684613, | |
| "grad_norm": 2.2567880153656006, | |
| "learning_rate": 2.2365211268690856e-05, | |
| "loss": 0.21490795135498048, | |
| "mean_token_accuracy": 0.9287674587965011, | |
| "num_tokens": 3090053115.0, | |
| "step": 39650 | |
| }, | |
| { | |
| "entropy": 0.21932182297110558, | |
| "epoch": 1.5809174896463842, | |
| "grad_norm": 20.473278045654297, | |
| "learning_rate": 2.2162384224072608e-05, | |
| "loss": 0.21317176818847655, | |
| "mean_token_accuracy": 0.9280319666862488, | |
| "num_tokens": 3093969332.0, | |
| "step": 39700 | |
| }, | |
| { | |
| "entropy": 0.21719238206744193, | |
| "epoch": 1.5829085696081555, | |
| "grad_norm": 1.1855759620666504, | |
| "learning_rate": 2.1960366401730492e-05, | |
| "loss": 0.21747058868408203, | |
| "mean_token_accuracy": 0.9273398566246033, | |
| "num_tokens": 3097928473.0, | |
| "step": 39750 | |
| }, | |
| { | |
| "entropy": 0.22151433676481247, | |
| "epoch": 1.5848996495699268, | |
| "grad_norm": 12.52309513092041, | |
| "learning_rate": 2.1759159901899972e-05, | |
| "loss": 0.21812362670898439, | |
| "mean_token_accuracy": 0.927079439163208, | |
| "num_tokens": 3101781883.0, | |
| "step": 39800 | |
| }, | |
| { | |
| "entropy": 0.21495074391365052, | |
| "epoch": 1.586890729531698, | |
| "grad_norm": 0.7089627981185913, | |
| "learning_rate": 2.1558766816381804e-05, | |
| "loss": 0.2153666114807129, | |
| "mean_token_accuracy": 0.9288167887926102, | |
| "num_tokens": 3105821084.0, | |
| "step": 39850 | |
| }, | |
| { | |
| "entropy": 0.22185655996203424, | |
| "epoch": 1.5888818094934694, | |
| "grad_norm": 20.341962814331055, | |
| "learning_rate": 2.1359189228520237e-05, | |
| "loss": 0.22094457626342773, | |
| "mean_token_accuracy": 0.9260220712423325, | |
| "num_tokens": 3109657086.0, | |
| "step": 39900 | |
| }, | |
| { | |
| "entropy": 0.22154104918241502, | |
| "epoch": 1.5908728894552406, | |
| "grad_norm": 1.856255054473877, | |
| "learning_rate": 2.116042921318133e-05, | |
| "loss": 0.22122642517089844, | |
| "mean_token_accuracy": 0.9261481338739395, | |
| "num_tokens": 3113612059.0, | |
| "step": 39950 | |
| }, | |
| { | |
| "entropy": 0.21654552415013315, | |
| "epoch": 1.592863969417012, | |
| "grad_norm": 2.5476434230804443, | |
| "learning_rate": 2.0962488836731443e-05, | |
| "loss": 0.21597785949707032, | |
| "mean_token_accuracy": 0.9289438962936402, | |
| "num_tokens": 3117625330.0, | |
| "step": 40000 | |
| }, | |
| { | |
| "entropy": 0.21598056226968765, | |
| "epoch": 1.5948550493787832, | |
| "grad_norm": 26.293344497680664, | |
| "learning_rate": 2.076537015701584e-05, | |
| "loss": 0.21633754730224608, | |
| "mean_token_accuracy": 0.9281029665470123, | |
| "num_tokens": 3121425433.0, | |
| "step": 40050 | |
| }, | |
| { | |
| "entropy": 0.21721562683582307, | |
| "epoch": 1.5968461293405545, | |
| "grad_norm": 2.0095717906951904, | |
| "learning_rate": 2.056907522333701e-05, | |
| "loss": 0.2188913917541504, | |
| "mean_token_accuracy": 0.9278429085016251, | |
| "num_tokens": 3125303976.0, | |
| "step": 40100 | |
| }, | |
| { | |
| "entropy": 0.21628726929426192, | |
| "epoch": 1.5988372093023255, | |
| "grad_norm": 12.751546859741211, | |
| "learning_rate": 2.0373606076433672e-05, | |
| "loss": 0.21001420974731444, | |
| "mean_token_accuracy": 0.9288813596963883, | |
| "num_tokens": 3129189259.0, | |
| "step": 40150 | |
| }, | |
| { | |
| "entropy": 0.21064794391393662, | |
| "epoch": 1.6008282892640968, | |
| "grad_norm": 0.977423906326294, | |
| "learning_rate": 2.0178964748459362e-05, | |
| "loss": 0.20974472045898437, | |
| "mean_token_accuracy": 0.9297809761762619, | |
| "num_tokens": 3133051181.0, | |
| "step": 40200 | |
| }, | |
| { | |
| "entropy": 0.22305100120604038, | |
| "epoch": 1.602819369225868, | |
| "grad_norm": 0.8115474581718445, | |
| "learning_rate": 1.998515326296142e-05, | |
| "loss": 0.2161123847961426, | |
| "mean_token_accuracy": 0.9274122947454453, | |
| "num_tokens": 3136743350.0, | |
| "step": 40250 | |
| }, | |
| { | |
| "entropy": 0.21686189234256745, | |
| "epoch": 1.6048104491876394, | |
| "grad_norm": 1.618212342262268, | |
| "learning_rate": 1.979217363485989e-05, | |
| "loss": 0.2156623649597168, | |
| "mean_token_accuracy": 0.9281445103883743, | |
| "num_tokens": 3140659012.0, | |
| "step": 40300 | |
| }, | |
| { | |
| "entropy": 0.21185349941253662, | |
| "epoch": 1.6068015291494107, | |
| "grad_norm": 0.9155282974243164, | |
| "learning_rate": 1.9600027870426506e-05, | |
| "loss": 0.20886346817016602, | |
| "mean_token_accuracy": 0.9293528980016709, | |
| "num_tokens": 3144567867.0, | |
| "step": 40350 | |
| }, | |
| { | |
| "entropy": 0.21675873085856437, | |
| "epoch": 1.608792609111182, | |
| "grad_norm": 21.752269744873047, | |
| "learning_rate": 1.9408717967264066e-05, | |
| "loss": 0.2155482864379883, | |
| "mean_token_accuracy": 0.9282829076051712, | |
| "num_tokens": 3148409926.0, | |
| "step": 40400 | |
| }, | |
| { | |
| "entropy": 0.2160284450650215, | |
| "epoch": 1.6107836890729532, | |
| "grad_norm": 11.025493621826172, | |
| "learning_rate": 1.9218245914285437e-05, | |
| "loss": 0.2147054672241211, | |
| "mean_token_accuracy": 0.9282228392362595, | |
| "num_tokens": 3152435454.0, | |
| "step": 40450 | |
| }, | |
| { | |
| "entropy": 0.21994507059454918, | |
| "epoch": 1.6127747690347243, | |
| "grad_norm": 31.000930786132812, | |
| "learning_rate": 1.9028613691692887e-05, | |
| "loss": 0.2158209800720215, | |
| "mean_token_accuracy": 0.9269871145486832, | |
| "num_tokens": 3156288599.0, | |
| "step": 40500 | |
| }, | |
| { | |
| "epoch": 1.6127747690347243, | |
| "eval_entropy": 0.21402156861528518, | |
| "eval_loss": 0.22149111330509186, | |
| "eval_mean_token_accuracy": 0.9242527182140048, | |
| "eval_num_tokens": 3156288599.0, | |
| "eval_runtime": 98.1435, | |
| "eval_samples_per_second": 10.189, | |
| "eval_steps_per_second": 0.642, | |
| "step": 40500 | |
| }, | |
| { | |
| "entropy": 0.2200436171889305, | |
| "epoch": 1.6147658489964956, | |
| "grad_norm": 7.249177932739258, | |
| "learning_rate": 1.8839823270957625e-05, | |
| "loss": 0.2148914909362793, | |
| "mean_token_accuracy": 0.9276934152841568, | |
| "num_tokens": 3160109492.0, | |
| "step": 40550 | |
| }, | |
| { | |
| "entropy": 0.21039872646331786, | |
| "epoch": 1.6167569289582668, | |
| "grad_norm": 3.97442626953125, | |
| "learning_rate": 1.8651876614799347e-05, | |
| "loss": 0.20821548461914063, | |
| "mean_token_accuracy": 0.92963711977005, | |
| "num_tokens": 3163948586.0, | |
| "step": 40600 | |
| }, | |
| { | |
| "entropy": 0.2125879742205143, | |
| "epoch": 1.6187480089200381, | |
| "grad_norm": 4.380746841430664, | |
| "learning_rate": 1.8464775677165536e-05, | |
| "loss": 0.21132637023925782, | |
| "mean_token_accuracy": 0.9289473402500152, | |
| "num_tokens": 3167768217.0, | |
| "step": 40650 | |
| }, | |
| { | |
| "entropy": 0.2152009476721287, | |
| "epoch": 1.6207390888818094, | |
| "grad_norm": 2.1306657791137695, | |
| "learning_rate": 1.8278522403211472e-05, | |
| "loss": 0.21508853912353515, | |
| "mean_token_accuracy": 0.9290641701221466, | |
| "num_tokens": 3171738971.0, | |
| "step": 40700 | |
| }, | |
| { | |
| "entropy": 0.2135643979907036, | |
| "epoch": 1.6227301688435807, | |
| "grad_norm": 6.235568046569824, | |
| "learning_rate": 1.8093118729279847e-05, | |
| "loss": 0.21154956817626952, | |
| "mean_token_accuracy": 0.9292153662443161, | |
| "num_tokens": 3175414893.0, | |
| "step": 40750 | |
| }, | |
| { | |
| "entropy": 0.21976500377058983, | |
| "epoch": 1.624721248805352, | |
| "grad_norm": 1.4987317323684692, | |
| "learning_rate": 1.7908566582880658e-05, | |
| "loss": 0.2205881118774414, | |
| "mean_token_accuracy": 0.9276097309589386, | |
| "num_tokens": 3179363316.0, | |
| "step": 40800 | |
| }, | |
| { | |
| "entropy": 0.2242605820298195, | |
| "epoch": 1.6267123287671232, | |
| "grad_norm": 1.8390077352523804, | |
| "learning_rate": 1.7724867882671205e-05, | |
| "loss": 0.22253013610839845, | |
| "mean_token_accuracy": 0.9263802176713943, | |
| "num_tokens": 3183142991.0, | |
| "step": 40850 | |
| }, | |
| { | |
| "entropy": 0.21403965666890146, | |
| "epoch": 1.6287034087288945, | |
| "grad_norm": 0.9712594747543335, | |
| "learning_rate": 1.7542024538436054e-05, | |
| "loss": 0.20888723373413087, | |
| "mean_token_accuracy": 0.9288804924488068, | |
| "num_tokens": 3187113070.0, | |
| "step": 40900 | |
| }, | |
| { | |
| "entropy": 0.2297496658563614, | |
| "epoch": 1.6306944886906658, | |
| "grad_norm": 2.2136800289154053, | |
| "learning_rate": 1.7360038451067274e-05, | |
| "loss": 0.22716428756713866, | |
| "mean_token_accuracy": 0.9243395751714707, | |
| "num_tokens": 3190985017.0, | |
| "step": 40950 | |
| }, | |
| { | |
| "entropy": 0.21799209505319594, | |
| "epoch": 1.632685568652437, | |
| "grad_norm": 1.661545991897583, | |
| "learning_rate": 1.7178911512544738e-05, | |
| "loss": 0.2154435920715332, | |
| "mean_token_accuracy": 0.9278116518259049, | |
| "num_tokens": 3194821627.0, | |
| "step": 41000 | |
| }, | |
| { | |
| "entropy": 0.21571315512061118, | |
| "epoch": 1.6346766486142084, | |
| "grad_norm": 1.2771720886230469, | |
| "learning_rate": 1.6998645605916186e-05, | |
| "loss": 0.21327953338623046, | |
| "mean_token_accuracy": 0.9287315171957016, | |
| "num_tokens": 3198747711.0, | |
| "step": 41050 | |
| }, | |
| { | |
| "entropy": 0.21436791002750397, | |
| "epoch": 1.6366677285759796, | |
| "grad_norm": 0.8762326836585999, | |
| "learning_rate": 1.681924260527795e-05, | |
| "loss": 0.21281551361083983, | |
| "mean_token_accuracy": 0.9294509363174438, | |
| "num_tokens": 3202530074.0, | |
| "step": 41100 | |
| }, | |
| { | |
| "entropy": 0.2123296819627285, | |
| "epoch": 1.638658808537751, | |
| "grad_norm": 0.7044285535812378, | |
| "learning_rate": 1.66407043757553e-05, | |
| "loss": 0.21069869995117188, | |
| "mean_token_accuracy": 0.9294757169485092, | |
| "num_tokens": 3206534011.0, | |
| "step": 41150 | |
| }, | |
| { | |
| "entropy": 0.21492626041173934, | |
| "epoch": 1.6406498884995222, | |
| "grad_norm": 9.144807815551758, | |
| "learning_rate": 1.64630327734831e-05, | |
| "loss": 0.2130570602416992, | |
| "mean_token_accuracy": 0.9289986944198608, | |
| "num_tokens": 3210440419.0, | |
| "step": 41200 | |
| }, | |
| { | |
| "entropy": 0.21355638578534125, | |
| "epoch": 1.6426409684612935, | |
| "grad_norm": 8.384472846984863, | |
| "learning_rate": 1.6286229645586536e-05, | |
| "loss": 0.2130125045776367, | |
| "mean_token_accuracy": 0.9284316200017929, | |
| "num_tokens": 3214291090.0, | |
| "step": 41250 | |
| }, | |
| { | |
| "entropy": 0.2188258746266365, | |
| "epoch": 1.6446320484230648, | |
| "grad_norm": 1.3508156538009644, | |
| "learning_rate": 1.6110296830161785e-05, | |
| "loss": 0.21920238494873046, | |
| "mean_token_accuracy": 0.9268940687179565, | |
| "num_tokens": 3218226397.0, | |
| "step": 41300 | |
| }, | |
| { | |
| "entropy": 0.2143702931702137, | |
| "epoch": 1.646623128384836, | |
| "grad_norm": 2.916459560394287, | |
| "learning_rate": 1.593523615625714e-05, | |
| "loss": 0.2127183723449707, | |
| "mean_token_accuracy": 0.9287808537483215, | |
| "num_tokens": 3222172225.0, | |
| "step": 41350 | |
| }, | |
| { | |
| "entropy": 0.21112210765480996, | |
| "epoch": 1.6486142083466073, | |
| "grad_norm": 0.9712974429130554, | |
| "learning_rate": 1.5761049443853804e-05, | |
| "loss": 0.21317562103271484, | |
| "mean_token_accuracy": 0.9286684322357178, | |
| "num_tokens": 3225972480.0, | |
| "step": 41400 | |
| }, | |
| { | |
| "entropy": 0.20567390725016593, | |
| "epoch": 1.6506052883083786, | |
| "grad_norm": 0.9209238886833191, | |
| "learning_rate": 1.558773850384697e-05, | |
| "loss": 0.205433349609375, | |
| "mean_token_accuracy": 0.9311077183485031, | |
| "num_tokens": 3229892438.0, | |
| "step": 41450 | |
| }, | |
| { | |
| "entropy": 0.21239387080073358, | |
| "epoch": 1.6525963682701499, | |
| "grad_norm": 1.4846440553665161, | |
| "learning_rate": 1.5415305138027104e-05, | |
| "loss": 0.21052703857421876, | |
| "mean_token_accuracy": 0.9296367019414902, | |
| "num_tokens": 3233832878.0, | |
| "step": 41500 | |
| }, | |
| { | |
| "entropy": 0.21011498600244521, | |
| "epoch": 1.654587448231921, | |
| "grad_norm": 2.049940824508667, | |
| "learning_rate": 1.5243751139061203e-05, | |
| "loss": 0.21002595901489257, | |
| "mean_token_accuracy": 0.9301602828502655, | |
| "num_tokens": 3237785637.0, | |
| "step": 41550 | |
| }, | |
| { | |
| "entropy": 0.2112150290608406, | |
| "epoch": 1.6565785281936922, | |
| "grad_norm": 55.68623352050781, | |
| "learning_rate": 1.5073078290473996e-05, | |
| "loss": 0.20992542266845704, | |
| "mean_token_accuracy": 0.9297233396768569, | |
| "num_tokens": 3241741524.0, | |
| "step": 41600 | |
| }, | |
| { | |
| "entropy": 0.21753552749753, | |
| "epoch": 1.6585696081554635, | |
| "grad_norm": 2.9803659915924072, | |
| "learning_rate": 1.4903288366629598e-05, | |
| "loss": 0.21804637908935548, | |
| "mean_token_accuracy": 0.9274892538785935, | |
| "num_tokens": 3245552506.0, | |
| "step": 41650 | |
| }, | |
| { | |
| "entropy": 0.21577703446149826, | |
| "epoch": 1.6605606881172348, | |
| "grad_norm": 7.269993305206299, | |
| "learning_rate": 1.4734383132712993e-05, | |
| "loss": 0.21403234481811523, | |
| "mean_token_accuracy": 0.9283736723661423, | |
| "num_tokens": 3249441151.0, | |
| "step": 41700 | |
| }, | |
| { | |
| "entropy": 0.2176537710428238, | |
| "epoch": 1.662551768079006, | |
| "grad_norm": 6.361774444580078, | |
| "learning_rate": 1.4566364344711615e-05, | |
| "loss": 0.21713001251220704, | |
| "mean_token_accuracy": 0.927847085595131, | |
| "num_tokens": 3253343053.0, | |
| "step": 41750 | |
| }, | |
| { | |
| "entropy": 0.21354290679097176, | |
| "epoch": 1.6645428480407773, | |
| "grad_norm": 106.82672882080078, | |
| "learning_rate": 1.4399233749397234e-05, | |
| "loss": 0.21209760665893554, | |
| "mean_token_accuracy": 0.9293800675868988, | |
| "num_tokens": 3257267667.0, | |
| "step": 41800 | |
| }, | |
| { | |
| "entropy": 0.21319517716765404, | |
| "epoch": 1.6665339280025486, | |
| "grad_norm": 1.91234290599823, | |
| "learning_rate": 1.4232993084307612e-05, | |
| "loss": 0.2100328254699707, | |
| "mean_token_accuracy": 0.9298084115982056, | |
| "num_tokens": 3261167140.0, | |
| "step": 41850 | |
| }, | |
| { | |
| "entropy": 0.2159775422513485, | |
| "epoch": 1.6685250079643197, | |
| "grad_norm": 1.951257586479187, | |
| "learning_rate": 1.406764407772858e-05, | |
| "loss": 0.21279817581176758, | |
| "mean_token_accuracy": 0.9280615490674973, | |
| "num_tokens": 3265013887.0, | |
| "step": 41900 | |
| }, | |
| { | |
| "entropy": 0.21692703947424888, | |
| "epoch": 1.670516087926091, | |
| "grad_norm": 1.1800713539123535, | |
| "learning_rate": 1.390318844867613e-05, | |
| "loss": 0.21641178131103517, | |
| "mean_token_accuracy": 0.9281920313835144, | |
| "num_tokens": 3268863519.0, | |
| "step": 41950 | |
| }, | |
| { | |
| "entropy": 0.21288384214043618, | |
| "epoch": 1.6725071678878622, | |
| "grad_norm": 4.761718273162842, | |
| "learning_rate": 1.3739627906878271e-05, | |
| "loss": 0.21155868530273436, | |
| "mean_token_accuracy": 0.9296810233592987, | |
| "num_tokens": 3272665262.0, | |
| "step": 42000 | |
| }, | |
| { | |
| "epoch": 1.6725071678878622, | |
| "eval_entropy": 0.20912929730755941, | |
| "eval_loss": 0.22023142874240875, | |
| "eval_mean_token_accuracy": 0.9255002112615676, | |
| "eval_num_tokens": 3272665262.0, | |
| "eval_runtime": 98.2674, | |
| "eval_samples_per_second": 10.176, | |
| "eval_steps_per_second": 0.641, | |
| "step": 42000 | |
| }, | |
| { | |
| "entropy": 0.2097879809141159, | |
| "epoch": 1.6744982478496335, | |
| "grad_norm": 2.2647664546966553, | |
| "learning_rate": 1.3576964152757542e-05, | |
| "loss": 0.211810359954834, | |
| "mean_token_accuracy": 0.929447072148323, | |
| "num_tokens": 3276463801.0, | |
| "step": 42050 | |
| }, | |
| { | |
| "entropy": 0.21398061096668244, | |
| "epoch": 1.6764893278114048, | |
| "grad_norm": 1.7430264949798584, | |
| "learning_rate": 1.3415198877413193e-05, | |
| "loss": 0.21089591979980468, | |
| "mean_token_accuracy": 0.9287590628862381, | |
| "num_tokens": 3280413045.0, | |
| "step": 42100 | |
| }, | |
| { | |
| "entropy": 0.2118249951303005, | |
| "epoch": 1.678480407773176, | |
| "grad_norm": 0.7513388991355896, | |
| "learning_rate": 1.3254333762603622e-05, | |
| "loss": 0.211072998046875, | |
| "mean_token_accuracy": 0.9304378354549407, | |
| "num_tokens": 3284422179.0, | |
| "step": 42150 | |
| }, | |
| { | |
| "entropy": 0.2193823230266571, | |
| "epoch": 1.6804714877349474, | |
| "grad_norm": 1.4407684803009033, | |
| "learning_rate": 1.3094370480728912e-05, | |
| "loss": 0.21676433563232422, | |
| "mean_token_accuracy": 0.9272742563486099, | |
| "num_tokens": 3288271873.0, | |
| "step": 42200 | |
| }, | |
| { | |
| "entropy": 0.21136553287506105, | |
| "epoch": 1.6824625676967186, | |
| "grad_norm": 2.6618618965148926, | |
| "learning_rate": 1.2935310694813373e-05, | |
| "loss": 0.21298866271972655, | |
| "mean_token_accuracy": 0.9293400466442108, | |
| "num_tokens": 3292167154.0, | |
| "step": 42250 | |
| }, | |
| { | |
| "entropy": 0.20674633592367173, | |
| "epoch": 1.68445364765849, | |
| "grad_norm": 4.363306999206543, | |
| "learning_rate": 1.2777156058488426e-05, | |
| "loss": 0.20549545288085938, | |
| "mean_token_accuracy": 0.9310127758979797, | |
| "num_tokens": 3296150069.0, | |
| "step": 42300 | |
| }, | |
| { | |
| "entropy": 0.20810180857777597, | |
| "epoch": 1.6864447276202612, | |
| "grad_norm": 12.78535270690918, | |
| "learning_rate": 1.2619908215975219e-05, | |
| "loss": 0.20621026992797853, | |
| "mean_token_accuracy": 0.9300779277086257, | |
| "num_tokens": 3299908223.0, | |
| "step": 42350 | |
| }, | |
| { | |
| "entropy": 0.21136780738830566, | |
| "epoch": 1.6884358075820325, | |
| "grad_norm": 2.215325355529785, | |
| "learning_rate": 1.2463568802067583e-05, | |
| "loss": 0.21058544158935547, | |
| "mean_token_accuracy": 0.929671134352684, | |
| "num_tokens": 3303818694.0, | |
| "step": 42400 | |
| }, | |
| { | |
| "entropy": 0.21534586906433106, | |
| "epoch": 1.6904268875438038, | |
| "grad_norm": 4.338953495025635, | |
| "learning_rate": 1.2308139442115096e-05, | |
| "loss": 0.2148575973510742, | |
| "mean_token_accuracy": 0.9283660215139389, | |
| "num_tokens": 3307853357.0, | |
| "step": 42450 | |
| }, | |
| { | |
| "entropy": 0.21038600355386733, | |
| "epoch": 1.692417967505575, | |
| "grad_norm": 0.9631744027137756, | |
| "learning_rate": 1.2153621752006228e-05, | |
| "loss": 0.21024368286132813, | |
| "mean_token_accuracy": 0.9297681283950806, | |
| "num_tokens": 3311773443.0, | |
| "step": 42500 | |
| }, | |
| { | |
| "entropy": 0.2123473997414112, | |
| "epoch": 1.6944090474673463, | |
| "grad_norm": 1.845744013786316, | |
| "learning_rate": 1.2000017338151336e-05, | |
| "loss": 0.21207157135009766, | |
| "mean_token_accuracy": 0.9293401914834977, | |
| "num_tokens": 3315703478.0, | |
| "step": 42550 | |
| }, | |
| { | |
| "entropy": 0.20351918905973435, | |
| "epoch": 1.6964001274291176, | |
| "grad_norm": 3.7353572845458984, | |
| "learning_rate": 1.184732779746619e-05, | |
| "loss": 0.20555198669433594, | |
| "mean_token_accuracy": 0.9311838829517365, | |
| "num_tokens": 3319556817.0, | |
| "step": 42600 | |
| }, | |
| { | |
| "entropy": 0.21710732728242874, | |
| "epoch": 1.698391207390889, | |
| "grad_norm": 2.4422550201416016, | |
| "learning_rate": 1.1695554717355172e-05, | |
| "loss": 0.21829830169677733, | |
| "mean_token_accuracy": 0.9286286699771881, | |
| "num_tokens": 3323630231.0, | |
| "step": 42650 | |
| }, | |
| { | |
| "entropy": 0.20919491305947305, | |
| "epoch": 1.7003822873526602, | |
| "grad_norm": 6.628872871398926, | |
| "learning_rate": 1.1544699675695025e-05, | |
| "loss": 0.20743906021118164, | |
| "mean_token_accuracy": 0.9308319443464279, | |
| "num_tokens": 3327433458.0, | |
| "step": 42700 | |
| }, | |
| { | |
| "entropy": 0.2133838464319706, | |
| "epoch": 1.7023733673144315, | |
| "grad_norm": 2.618858814239502, | |
| "learning_rate": 1.13947642408182e-05, | |
| "loss": 0.21412492752075196, | |
| "mean_token_accuracy": 0.9283889561891556, | |
| "num_tokens": 3331158681.0, | |
| "step": 42750 | |
| }, | |
| { | |
| "entropy": 0.20949604049324988, | |
| "epoch": 1.7043644472762027, | |
| "grad_norm": 0.9396565556526184, | |
| "learning_rate": 1.1245749971496645e-05, | |
| "loss": 0.21225997924804688, | |
| "mean_token_accuracy": 0.9299770307540893, | |
| "num_tokens": 3335081969.0, | |
| "step": 42800 | |
| }, | |
| { | |
| "entropy": 0.21171203643083572, | |
| "epoch": 1.706355527237974, | |
| "grad_norm": 1.2607985734939575, | |
| "learning_rate": 1.1097658416925616e-05, | |
| "loss": 0.20964282989501953, | |
| "mean_token_accuracy": 0.929639783501625, | |
| "num_tokens": 3338842508.0, | |
| "step": 42850 | |
| }, | |
| { | |
| "entropy": 0.21066647991538048, | |
| "epoch": 1.7083466071997453, | |
| "grad_norm": 1.8953777551651, | |
| "learning_rate": 1.095049111670764e-05, | |
| "loss": 0.2089408493041992, | |
| "mean_token_accuracy": 0.9304516243934632, | |
| "num_tokens": 3342667327.0, | |
| "step": 42900 | |
| }, | |
| { | |
| "entropy": 0.20289117962121964, | |
| "epoch": 1.7103376871615164, | |
| "grad_norm": 1.4316964149475098, | |
| "learning_rate": 1.0804249600836302e-05, | |
| "loss": 0.20412372589111327, | |
| "mean_token_accuracy": 0.9313151943683624, | |
| "num_tokens": 3346511164.0, | |
| "step": 42950 | |
| }, | |
| { | |
| "entropy": 0.21303703948855401, | |
| "epoch": 1.7123287671232876, | |
| "grad_norm": 3.427518844604492, | |
| "learning_rate": 1.0658935389680558e-05, | |
| "loss": 0.20701854705810546, | |
| "mean_token_accuracy": 0.9287211322784423, | |
| "num_tokens": 3350321196.0, | |
| "step": 43000 | |
| }, | |
| { | |
| "entropy": 0.21614415727555752, | |
| "epoch": 1.714319847085059, | |
| "grad_norm": 1.8059314489364624, | |
| "learning_rate": 1.0514549993968793e-05, | |
| "loss": 0.2118132972717285, | |
| "mean_token_accuracy": 0.9284475427865982, | |
| "num_tokens": 3354110443.0, | |
| "step": 43050 | |
| }, | |
| { | |
| "entropy": 0.21574504926800728, | |
| "epoch": 1.7163109270468302, | |
| "grad_norm": 1.618677020072937, | |
| "learning_rate": 1.0371094914773194e-05, | |
| "loss": 0.21516273498535157, | |
| "mean_token_accuracy": 0.928774631023407, | |
| "num_tokens": 3358010083.0, | |
| "step": 43100 | |
| }, | |
| { | |
| "entropy": 0.20823818922042847, | |
| "epoch": 1.7183020070086015, | |
| "grad_norm": 1.8982270956039429, | |
| "learning_rate": 1.0228571643494089e-05, | |
| "loss": 0.20659427642822265, | |
| "mean_token_accuracy": 0.9304153192043304, | |
| "num_tokens": 3361793567.0, | |
| "step": 43150 | |
| }, | |
| { | |
| "entropy": 0.20770151138305665, | |
| "epoch": 1.7202930869703728, | |
| "grad_norm": 23.347454071044922, | |
| "learning_rate": 1.0086981661844408e-05, | |
| "loss": 0.20477155685424805, | |
| "mean_token_accuracy": 0.9307419693470002, | |
| "num_tokens": 3365725960.0, | |
| "step": 43200 | |
| }, | |
| { | |
| "entropy": 0.21326481088995933, | |
| "epoch": 1.722284166932144, | |
| "grad_norm": 17.471525192260742, | |
| "learning_rate": 9.946326441834453e-06, | |
| "loss": 0.20951253890991212, | |
| "mean_token_accuracy": 0.9291504013538361, | |
| "num_tokens": 3369568841.0, | |
| "step": 43250 | |
| }, | |
| { | |
| "entropy": 0.21126571625471116, | |
| "epoch": 1.7242752468939153, | |
| "grad_norm": 1.2022254467010498, | |
| "learning_rate": 9.806607445756399e-06, | |
| "loss": 0.21334413528442384, | |
| "mean_token_accuracy": 0.9292098581790924, | |
| "num_tokens": 3373491379.0, | |
| "step": 43300 | |
| }, | |
| { | |
| "entropy": 0.2141697633266449, | |
| "epoch": 1.7262663268556864, | |
| "grad_norm": 2.5144846439361572, | |
| "learning_rate": 9.667826126169154e-06, | |
| "loss": 0.2119060516357422, | |
| "mean_token_accuracy": 0.9293478113412857, | |
| "num_tokens": 3377378314.0, | |
| "step": 43350 | |
| }, | |
| { | |
| "entropy": 0.20566872745752335, | |
| "epoch": 1.7282574068174577, | |
| "grad_norm": 11.5548677444458, | |
| "learning_rate": 9.52998392588329e-06, | |
| "loss": 0.20603267669677736, | |
| "mean_token_accuracy": 0.9311341369152069, | |
| "num_tokens": 3381359306.0, | |
| "step": 43400 | |
| }, | |
| { | |
| "entropy": 0.20955051869153976, | |
| "epoch": 1.730248486779229, | |
| "grad_norm": 0.9183319211006165, | |
| "learning_rate": 9.393082277946075e-06, | |
| "loss": 0.2130196762084961, | |
| "mean_token_accuracy": 0.9288085114955902, | |
| "num_tokens": 3385082710.0, | |
| "step": 43450 | |
| }, | |
| { | |
| "entropy": 0.2085769698023796, | |
| "epoch": 1.7322395667410002, | |
| "grad_norm": 73.6777572631836, | |
| "learning_rate": 9.257122605626433e-06, | |
| "loss": 0.2063262367248535, | |
| "mean_token_accuracy": 0.930268183350563, | |
| "num_tokens": 3389013368.0, | |
| "step": 43500 | |
| }, | |
| { | |
| "epoch": 1.7322395667410002, | |
| "eval_entropy": 0.20851521726165498, | |
| "eval_loss": 0.21822857856750488, | |
| "eval_mean_token_accuracy": 0.9255683289633857, | |
| "eval_num_tokens": 3389013368.0, | |
| "eval_runtime": 98.7957, | |
| "eval_samples_per_second": 10.122, | |
| "eval_steps_per_second": 0.638, | |
| "step": 43500 | |
| }, | |
| { | |
| "entropy": 0.2073688104748726, | |
| "epoch": 1.7342306467027715, | |
| "grad_norm": 0.8740753531455994, | |
| "learning_rate": 9.122106322400315e-06, | |
| "loss": 0.20818450927734375, | |
| "mean_token_accuracy": 0.9306763833761216, | |
| "num_tokens": 3392916416.0, | |
| "step": 43550 | |
| }, | |
| { | |
| "entropy": 0.20800496503710747, | |
| "epoch": 1.7362217266645428, | |
| "grad_norm": 3.2264981269836426, | |
| "learning_rate": 8.988034831935843e-06, | |
| "loss": 0.20605121612548827, | |
| "mean_token_accuracy": 0.9305061846971512, | |
| "num_tokens": 3396765916.0, | |
| "step": 43600 | |
| }, | |
| { | |
| "entropy": 0.21000043153762818, | |
| "epoch": 1.738212806626314, | |
| "grad_norm": 1.0980819463729858, | |
| "learning_rate": 8.854909528078903e-06, | |
| "loss": 0.2113180923461914, | |
| "mean_token_accuracy": 0.9291634374856949, | |
| "num_tokens": 3400647162.0, | |
| "step": 43650 | |
| }, | |
| { | |
| "entropy": 0.20911528274416924, | |
| "epoch": 1.7402038865880853, | |
| "grad_norm": 6.803044319152832, | |
| "learning_rate": 8.722731794838513e-06, | |
| "loss": 0.2107940673828125, | |
| "mean_token_accuracy": 0.9301030486822128, | |
| "num_tokens": 3404614062.0, | |
| "step": 43700 | |
| }, | |
| { | |
| "entropy": 0.20988879695534707, | |
| "epoch": 1.7421949665498566, | |
| "grad_norm": 1.7961214780807495, | |
| "learning_rate": 8.591503006372426e-06, | |
| "loss": 0.20849388122558593, | |
| "mean_token_accuracy": 0.9299481153488159, | |
| "num_tokens": 3408435982.0, | |
| "step": 43750 | |
| }, | |
| { | |
| "entropy": 0.2071615570783615, | |
| "epoch": 1.744186046511628, | |
| "grad_norm": 3.4115519523620605, | |
| "learning_rate": 8.46122452697291e-06, | |
| "loss": 0.20572685241699218, | |
| "mean_token_accuracy": 0.9306599938869476, | |
| "num_tokens": 3412386645.0, | |
| "step": 43800 | |
| }, | |
| { | |
| "entropy": 0.20959770992398263, | |
| "epoch": 1.7461771264733992, | |
| "grad_norm": 0.7829149961471558, | |
| "learning_rate": 8.33189771105265e-06, | |
| "loss": 0.20827945709228515, | |
| "mean_token_accuracy": 0.9304309511184692, | |
| "num_tokens": 3416238232.0, | |
| "step": 43850 | |
| }, | |
| { | |
| "entropy": 0.2114715176820755, | |
| "epoch": 1.7481682064351705, | |
| "grad_norm": 1.1714812517166138, | |
| "learning_rate": 8.203523903130406e-06, | |
| "loss": 0.21069385528564452, | |
| "mean_token_accuracy": 0.9288992536067963, | |
| "num_tokens": 3420152151.0, | |
| "step": 43900 | |
| }, | |
| { | |
| "entropy": 0.20665415987372399, | |
| "epoch": 1.7501592863969417, | |
| "grad_norm": 5.990740776062012, | |
| "learning_rate": 8.07610443781729e-06, | |
| "loss": 0.2081171989440918, | |
| "mean_token_accuracy": 0.930669231414795, | |
| "num_tokens": 3424216197.0, | |
| "step": 43950 | |
| }, | |
| { | |
| "entropy": 0.209456440359354, | |
| "epoch": 1.752150366358713, | |
| "grad_norm": 20.553333282470703, | |
| "learning_rate": 7.949640639802757e-06, | |
| "loss": 0.20741764068603516, | |
| "mean_token_accuracy": 0.9296394234895706, | |
| "num_tokens": 3428132649.0, | |
| "step": 44000 | |
| }, | |
| { | |
| "entropy": 0.2040299132466316, | |
| "epoch": 1.7541414463204843, | |
| "grad_norm": 6.445930480957031, | |
| "learning_rate": 7.824133823840906e-06, | |
| "loss": 0.20229070663452148, | |
| "mean_token_accuracy": 0.9324067449569702, | |
| "num_tokens": 3431970957.0, | |
| "step": 44050 | |
| }, | |
| { | |
| "entropy": 0.21209723398089408, | |
| "epoch": 1.7561325262822556, | |
| "grad_norm": 1.6934711933135986, | |
| "learning_rate": 7.699585294736744e-06, | |
| "loss": 0.21100982666015625, | |
| "mean_token_accuracy": 0.9297117662429809, | |
| "num_tokens": 3435914647.0, | |
| "step": 44100 | |
| }, | |
| { | |
| "entropy": 0.21320962592959403, | |
| "epoch": 1.7581236062440269, | |
| "grad_norm": 1.044862985610962, | |
| "learning_rate": 7.575996347332626e-06, | |
| "loss": 0.21576282501220703, | |
| "mean_token_accuracy": 0.9285241341590882, | |
| "num_tokens": 3439805283.0, | |
| "step": 44150 | |
| }, | |
| { | |
| "entropy": 0.2151702319085598, | |
| "epoch": 1.7601146862057981, | |
| "grad_norm": 15.684170722961426, | |
| "learning_rate": 7.453368266494876e-06, | |
| "loss": 0.2126181411743164, | |
| "mean_token_accuracy": 0.9285902082920074, | |
| "num_tokens": 3443870181.0, | |
| "step": 44200 | |
| }, | |
| { | |
| "entropy": 0.2085086138546467, | |
| "epoch": 1.7621057661675694, | |
| "grad_norm": 0.8928887844085693, | |
| "learning_rate": 7.331702327100376e-06, | |
| "loss": 0.20794538497924805, | |
| "mean_token_accuracy": 0.9304049378633499, | |
| "num_tokens": 3447760675.0, | |
| "step": 44250 | |
| }, | |
| { | |
| "entropy": 0.21238367155194282, | |
| "epoch": 1.7640968461293407, | |
| "grad_norm": 0.8010930418968201, | |
| "learning_rate": 7.210999794023232e-06, | |
| "loss": 0.2140846633911133, | |
| "mean_token_accuracy": 0.9294155049324035, | |
| "num_tokens": 3451731264.0, | |
| "step": 44300 | |
| }, | |
| { | |
| "entropy": 0.20554652333259582, | |
| "epoch": 1.766087926091112, | |
| "grad_norm": 53.679508209228516, | |
| "learning_rate": 7.091261922121761e-06, | |
| "loss": 0.20279741287231445, | |
| "mean_token_accuracy": 0.9304215121269226, | |
| "num_tokens": 3455753973.0, | |
| "step": 44350 | |
| }, | |
| { | |
| "entropy": 0.2106124371290207, | |
| "epoch": 1.768079006052883, | |
| "grad_norm": 6.591165542602539, | |
| "learning_rate": 6.972489956225381e-06, | |
| "loss": 0.2088141632080078, | |
| "mean_token_accuracy": 0.9303308349847793, | |
| "num_tokens": 3459535337.0, | |
| "step": 44400 | |
| }, | |
| { | |
| "entropy": 0.20883979350328447, | |
| "epoch": 1.7700700860146543, | |
| "grad_norm": 18.591882705688477, | |
| "learning_rate": 6.854685131121663e-06, | |
| "loss": 0.20666999816894532, | |
| "mean_token_accuracy": 0.9313195276260376, | |
| "num_tokens": 3463470882.0, | |
| "step": 44450 | |
| }, | |
| { | |
| "entropy": 0.20805159598588943, | |
| "epoch": 1.7720611659764256, | |
| "grad_norm": 8.411771774291992, | |
| "learning_rate": 6.7378486715435226e-06, | |
| "loss": 0.20834875106811523, | |
| "mean_token_accuracy": 0.9310674071311951, | |
| "num_tokens": 3467382434.0, | |
| "step": 44500 | |
| }, | |
| { | |
| "entropy": 0.20722934901714324, | |
| "epoch": 1.7740522459381969, | |
| "grad_norm": 2.585312604904175, | |
| "learning_rate": 6.621981792156385e-06, | |
| "loss": 0.20870906829833985, | |
| "mean_token_accuracy": 0.9306829625368118, | |
| "num_tokens": 3471390056.0, | |
| "step": 44550 | |
| }, | |
| { | |
| "entropy": 0.20751627907156944, | |
| "epoch": 1.7760433258999682, | |
| "grad_norm": 3.3848342895507812, | |
| "learning_rate": 6.507085697545778e-06, | |
| "loss": 0.20677597045898438, | |
| "mean_token_accuracy": 0.9305989545583725, | |
| "num_tokens": 3475472414.0, | |
| "step": 44600 | |
| }, | |
| { | |
| "entropy": 0.21149674832820892, | |
| "epoch": 1.7780344058617394, | |
| "grad_norm": 2.8175301551818848, | |
| "learning_rate": 6.393161582204588e-06, | |
| "loss": 0.21632415771484376, | |
| "mean_token_accuracy": 0.9287760710716247, | |
| "num_tokens": 3479447899.0, | |
| "step": 44650 | |
| }, | |
| { | |
| "entropy": 0.20839301392436027, | |
| "epoch": 1.7800254858235107, | |
| "grad_norm": 0.7601056098937988, | |
| "learning_rate": 6.2802106305207e-06, | |
| "loss": 0.2067262077331543, | |
| "mean_token_accuracy": 0.9304411447048188, | |
| "num_tokens": 3483376906.0, | |
| "step": 44700 | |
| }, | |
| { | |
| "entropy": 0.21109894961118697, | |
| "epoch": 1.7820165657852818, | |
| "grad_norm": 0.9799630641937256, | |
| "learning_rate": 6.1682340167647516e-06, | |
| "loss": 0.21058021545410155, | |
| "mean_token_accuracy": 0.9301919043064117, | |
| "num_tokens": 3487224795.0, | |
| "step": 44750 | |
| }, | |
| { | |
| "entropy": 0.20875480249524117, | |
| "epoch": 1.784007645747053, | |
| "grad_norm": 96.13130187988281, | |
| "learning_rate": 6.057232905077914e-06, | |
| "loss": 0.20701271057128906, | |
| "mean_token_accuracy": 0.9302035439014434, | |
| "num_tokens": 3490949200.0, | |
| "step": 44800 | |
| }, | |
| { | |
| "entropy": 0.20825668588280677, | |
| "epoch": 1.7859987257088243, | |
| "grad_norm": 2.4636387825012207, | |
| "learning_rate": 5.947208449459685e-06, | |
| "loss": 0.20573083877563478, | |
| "mean_token_accuracy": 0.9306117433309555, | |
| "num_tokens": 3495007448.0, | |
| "step": 44850 | |
| }, | |
| { | |
| "entropy": 0.21141499862074853, | |
| "epoch": 1.7879898056705956, | |
| "grad_norm": 0.6885759234428406, | |
| "learning_rate": 5.838161793756014e-06, | |
| "loss": 0.2095553207397461, | |
| "mean_token_accuracy": 0.9298090773820877, | |
| "num_tokens": 3498907935.0, | |
| "step": 44900 | |
| }, | |
| { | |
| "entropy": 0.2129495669901371, | |
| "epoch": 1.789980885632367, | |
| "grad_norm": 0.7798480987548828, | |
| "learning_rate": 5.7300940716473405e-06, | |
| "loss": 0.21014495849609374, | |
| "mean_token_accuracy": 0.9300975173711776, | |
| "num_tokens": 3502670704.0, | |
| "step": 44950 | |
| }, | |
| { | |
| "entropy": 0.21165331333875656, | |
| "epoch": 1.7919719655941382, | |
| "grad_norm": 1.102869987487793, | |
| "learning_rate": 5.623006406636843e-06, | |
| "loss": 0.2064545440673828, | |
| "mean_token_accuracy": 0.9297413504123688, | |
| "num_tokens": 3506472079.0, | |
| "step": 45000 | |
| }, | |
| { | |
| "epoch": 1.7919719655941382, | |
| "eval_entropy": 0.20767719807132842, | |
| "eval_loss": 0.21640749275684357, | |
| "eval_mean_token_accuracy": 0.9258228899940611, | |
| "eval_num_tokens": 3506472079.0, | |
| "eval_runtime": 98.1901, | |
| "eval_samples_per_second": 10.184, | |
| "eval_steps_per_second": 0.642, | |
| "step": 45000 | |
| }, | |
| { | |
| "entropy": 0.20470431208610534, | |
| "epoch": 1.7939630455559095, | |
| "grad_norm": 59.79706954956055, | |
| "learning_rate": 5.516899912038742e-06, | |
| "loss": 0.20203092575073242, | |
| "mean_token_accuracy": 0.9314306324720383, | |
| "num_tokens": 3510430565.0, | |
| "step": 45050 | |
| }, | |
| { | |
| "entropy": 0.21255202189087868, | |
| "epoch": 1.7959541255176807, | |
| "grad_norm": 2.5185296535491943, | |
| "learning_rate": 5.41177569096667e-06, | |
| "loss": 0.21200386047363282, | |
| "mean_token_accuracy": 0.9287832349538803, | |
| "num_tokens": 3514394913.0, | |
| "step": 45100 | |
| }, | |
| { | |
| "entropy": 0.2104589892923832, | |
| "epoch": 1.797945205479452, | |
| "grad_norm": 0.7058978080749512, | |
| "learning_rate": 5.307634836322384e-06, | |
| "loss": 0.2101261329650879, | |
| "mean_token_accuracy": 0.9302563655376435, | |
| "num_tokens": 3518315848.0, | |
| "step": 45150 | |
| }, | |
| { | |
| "entropy": 0.20902628675103188, | |
| "epoch": 1.7999362854412233, | |
| "grad_norm": 3.984861135482788, | |
| "learning_rate": 5.204478430784176e-06, | |
| "loss": 0.20765369415283202, | |
| "mean_token_accuracy": 0.9305371862649917, | |
| "num_tokens": 3522202111.0, | |
| "step": 45200 | |
| }, | |
| { | |
| "entropy": 0.2147587051987648, | |
| "epoch": 1.8019273654029946, | |
| "grad_norm": 0.5527628660202026, | |
| "learning_rate": 5.102307546795737e-06, | |
| "loss": 0.21070705413818358, | |
| "mean_token_accuracy": 0.9285232800245286, | |
| "num_tokens": 3526104312.0, | |
| "step": 45250 | |
| }, | |
| { | |
| "entropy": 0.21127821996808052, | |
| "epoch": 1.8039184453647659, | |
| "grad_norm": 0.8246101140975952, | |
| "learning_rate": 5.00112324655504e-06, | |
| "loss": 0.20989871978759767, | |
| "mean_token_accuracy": 0.929241014122963, | |
| "num_tokens": 3529962044.0, | |
| "step": 45300 | |
| }, | |
| { | |
| "entropy": 0.20899385526776315, | |
| "epoch": 1.8059095253265371, | |
| "grad_norm": 0.49908512830734253, | |
| "learning_rate": 4.900926582003196e-06, | |
| "loss": 0.2079372787475586, | |
| "mean_token_accuracy": 0.9290895968675613, | |
| "num_tokens": 3533872881.0, | |
| "step": 45350 | |
| }, | |
| { | |
| "entropy": 0.2041157440841198, | |
| "epoch": 1.8079006052883084, | |
| "grad_norm": 58.90666198730469, | |
| "learning_rate": 4.801718594813598e-06, | |
| "loss": 0.20337408065795898, | |
| "mean_token_accuracy": 0.9310873591899872, | |
| "num_tokens": 3537766572.0, | |
| "step": 45400 | |
| }, | |
| { | |
| "entropy": 0.2129148316383362, | |
| "epoch": 1.8098916852500797, | |
| "grad_norm": 3.738131046295166, | |
| "learning_rate": 4.703500316381082e-06, | |
| "loss": 0.2082274627685547, | |
| "mean_token_accuracy": 0.9294615036249161, | |
| "num_tokens": 3541632871.0, | |
| "step": 45450 | |
| }, | |
| { | |
| "entropy": 0.20847861975431442, | |
| "epoch": 1.811882765211851, | |
| "grad_norm": 1.109789490699768, | |
| "learning_rate": 4.606272767811115e-06, | |
| "loss": 0.20543277740478516, | |
| "mean_token_accuracy": 0.9305390655994416, | |
| "num_tokens": 3545534405.0, | |
| "step": 45500 | |
| }, | |
| { | |
| "entropy": 0.2059105433523655, | |
| "epoch": 1.8138738451736223, | |
| "grad_norm": 0.9735215902328491, | |
| "learning_rate": 4.510036959909347e-06, | |
| "loss": 0.20821889877319336, | |
| "mean_token_accuracy": 0.9318612819910049, | |
| "num_tokens": 3549408355.0, | |
| "step": 45550 | |
| }, | |
| { | |
| "entropy": 0.20953644335269928, | |
| "epoch": 1.8158649251353935, | |
| "grad_norm": 13.94512939453125, | |
| "learning_rate": 4.414793893170943e-06, | |
| "loss": 0.21036842346191406, | |
| "mean_token_accuracy": 0.9298856401443482, | |
| "num_tokens": 3553166674.0, | |
| "step": 45600 | |
| }, | |
| { | |
| "entropy": 0.2068518304824829, | |
| "epoch": 1.8178560050971648, | |
| "grad_norm": 4.7155632972717285, | |
| "learning_rate": 4.320544557770267e-06, | |
| "loss": 0.2043770408630371, | |
| "mean_token_accuracy": 0.9310851716995239, | |
| "num_tokens": 3557126079.0, | |
| "step": 45650 | |
| }, | |
| { | |
| "entropy": 0.21182461187243462, | |
| "epoch": 1.819847085058936, | |
| "grad_norm": 2.7940444946289062, | |
| "learning_rate": 4.2272899335505265e-06, | |
| "loss": 0.210545654296875, | |
| "mean_token_accuracy": 0.9293639028072357, | |
| "num_tokens": 3561059632.0, | |
| "step": 45700 | |
| }, | |
| { | |
| "entropy": 0.20587970972061156, | |
| "epoch": 1.8218381650207074, | |
| "grad_norm": 0.5957472324371338, | |
| "learning_rate": 4.135030990013711e-06, | |
| "loss": 0.20679553985595703, | |
| "mean_token_accuracy": 0.9308193498849868, | |
| "num_tokens": 3564821358.0, | |
| "step": 45750 | |
| }, | |
| { | |
| "entropy": 0.20069470301270484, | |
| "epoch": 1.8238292449824784, | |
| "grad_norm": 1.8275463581085205, | |
| "learning_rate": 4.0437686863103455e-06, | |
| "loss": 0.198288516998291, | |
| "mean_token_accuracy": 0.9327347731590271, | |
| "num_tokens": 3568773612.0, | |
| "step": 45800 | |
| }, | |
| { | |
| "entropy": 0.207653941065073, | |
| "epoch": 1.8258203249442497, | |
| "grad_norm": 16.50977897644043, | |
| "learning_rate": 3.953503971229622e-06, | |
| "loss": 0.2065102005004883, | |
| "mean_token_accuracy": 0.9299451869726181, | |
| "num_tokens": 3572667298.0, | |
| "step": 45850 | |
| }, | |
| { | |
| "entropy": 0.20317922204732894, | |
| "epoch": 1.827811404906021, | |
| "grad_norm": 0.9150100350379944, | |
| "learning_rate": 3.8642377831895394e-06, | |
| "loss": 0.20408899307250977, | |
| "mean_token_accuracy": 0.9323972845077515, | |
| "num_tokens": 3576632810.0, | |
| "step": 45900 | |
| }, | |
| { | |
| "entropy": 0.20271479919552804, | |
| "epoch": 1.8298024848677923, | |
| "grad_norm": 0.8775530457496643, | |
| "learning_rate": 3.7759710502271007e-06, | |
| "loss": 0.20193222045898437, | |
| "mean_token_accuracy": 0.932313597202301, | |
| "num_tokens": 3580570503.0, | |
| "step": 45950 | |
| }, | |
| { | |
| "entropy": 0.20898037731647492, | |
| "epoch": 1.8317935648295636, | |
| "grad_norm": 1.5123686790466309, | |
| "learning_rate": 3.688704689988687e-06, | |
| "loss": 0.20746551513671874, | |
| "mean_token_accuracy": 0.9301503264904022, | |
| "num_tokens": 3584290381.0, | |
| "step": 46000 | |
| }, | |
| { | |
| "entropy": 0.20438008531928062, | |
| "epoch": 1.8337846447913349, | |
| "grad_norm": 1.9140816926956177, | |
| "learning_rate": 3.602439609720487e-06, | |
| "loss": 0.20290145874023438, | |
| "mean_token_accuracy": 0.9307840871810913, | |
| "num_tokens": 3588239293.0, | |
| "step": 46050 | |
| }, | |
| { | |
| "entropy": 0.20243030577898025, | |
| "epoch": 1.8357757247531061, | |
| "grad_norm": 1.6704521179199219, | |
| "learning_rate": 3.517176706259173e-06, | |
| "loss": 0.20418481826782225, | |
| "mean_token_accuracy": 0.9315272670984268, | |
| "num_tokens": 3592083917.0, | |
| "step": 46100 | |
| }, | |
| { | |
| "entropy": 0.21051367938518525, | |
| "epoch": 1.8377668047148772, | |
| "grad_norm": 10.357985496520996, | |
| "learning_rate": 3.4329168660224288e-06, | |
| "loss": 0.21083585739135743, | |
| "mean_token_accuracy": 0.9296258103847503, | |
| "num_tokens": 3595926812.0, | |
| "step": 46150 | |
| }, | |
| { | |
| "entropy": 0.2138805329799652, | |
| "epoch": 1.8397578846766485, | |
| "grad_norm": 49.06830596923828, | |
| "learning_rate": 3.3496609649998345e-06, | |
| "loss": 0.21048126220703126, | |
| "mean_token_accuracy": 0.9295951730012894, | |
| "num_tokens": 3599861416.0, | |
| "step": 46200 | |
| }, | |
| { | |
| "entropy": 0.21018945664167404, | |
| "epoch": 1.8417489646384197, | |
| "grad_norm": 1.570406436920166, | |
| "learning_rate": 3.2674098687436984e-06, | |
| "loss": 0.2073902130126953, | |
| "mean_token_accuracy": 0.9296689444780349, | |
| "num_tokens": 3603701996.0, | |
| "step": 46250 | |
| }, | |
| { | |
| "entropy": 0.21012910723686218, | |
| "epoch": 1.843740044600191, | |
| "grad_norm": 2.4205453395843506, | |
| "learning_rate": 3.186164432360128e-06, | |
| "loss": 0.2063848876953125, | |
| "mean_token_accuracy": 0.9299239891767502, | |
| "num_tokens": 3607681405.0, | |
| "step": 46300 | |
| }, | |
| { | |
| "entropy": 0.20703335404396056, | |
| "epoch": 1.8457311245619623, | |
| "grad_norm": 1.4932438135147095, | |
| "learning_rate": 3.1059255005000954e-06, | |
| "loss": 0.20379390716552734, | |
| "mean_token_accuracy": 0.9307261490821839, | |
| "num_tokens": 3611673251.0, | |
| "step": 46350 | |
| }, | |
| { | |
| "entropy": 0.21025602117180825, | |
| "epoch": 1.8477222045237336, | |
| "grad_norm": 13.070518493652344, | |
| "learning_rate": 3.0266939073506418e-06, | |
| "loss": 0.21065128326416016, | |
| "mean_token_accuracy": 0.9293994671106338, | |
| "num_tokens": 3615446363.0, | |
| "step": 46400 | |
| }, | |
| { | |
| "entropy": 0.21034426152706145, | |
| "epoch": 1.8497132844855049, | |
| "grad_norm": 1.4634066820144653, | |
| "learning_rate": 2.9484704766261973e-06, | |
| "loss": 0.2110739517211914, | |
| "mean_token_accuracy": 0.930075461268425, | |
| "num_tokens": 3619263825.0, | |
| "step": 46450 | |
| }, | |
| { | |
| "entropy": 0.21479475244879723, | |
| "epoch": 1.8517043644472762, | |
| "grad_norm": 1.4576468467712402, | |
| "learning_rate": 2.8712560215601314e-06, | |
| "loss": 0.21280271530151368, | |
| "mean_token_accuracy": 0.928877608180046, | |
| "num_tokens": 3623131519.0, | |
| "step": 46500 | |
| }, | |
| { | |
| "epoch": 1.8517043644472762, | |
| "eval_entropy": 0.20671257494934023, | |
| "eval_loss": 0.21556128561496735, | |
| "eval_mean_token_accuracy": 0.9257090545835949, | |
| "eval_num_tokens": 3623131519.0, | |
| "eval_runtime": 98.1917, | |
| "eval_samples_per_second": 10.184, | |
| "eval_steps_per_second": 0.642, | |
| "step": 46500 | |
| }, | |
| { | |
| "entropy": 0.2045709379017353, | |
| "epoch": 1.8536954444090474, | |
| "grad_norm": 0.93439120054245, | |
| "learning_rate": 2.7950513448961603e-06, | |
| "loss": 0.2093747329711914, | |
| "mean_token_accuracy": 0.9314322662353516, | |
| "num_tokens": 3626926506.0, | |
| "step": 46550 | |
| }, | |
| { | |
| "entropy": 0.20439017698168754, | |
| "epoch": 1.8556865243708187, | |
| "grad_norm": 1.1999908685684204, | |
| "learning_rate": 2.7198572388800305e-06, | |
| "loss": 0.20209259033203125, | |
| "mean_token_accuracy": 0.9320348417758941, | |
| "num_tokens": 3630707819.0, | |
| "step": 46600 | |
| }, | |
| { | |
| "entropy": 0.21055062592029572, | |
| "epoch": 1.85767760433259, | |
| "grad_norm": 2.1831114292144775, | |
| "learning_rate": 2.645674485251326e-06, | |
| "loss": 0.20812604904174806, | |
| "mean_token_accuracy": 0.9298756116628647, | |
| "num_tokens": 3634652608.0, | |
| "step": 46650 | |
| }, | |
| { | |
| "entropy": 0.20818702280521392, | |
| "epoch": 1.8596686842943613, | |
| "grad_norm": 4.211587429046631, | |
| "learning_rate": 2.572503855235342e-06, | |
| "loss": 0.21088375091552736, | |
| "mean_token_accuracy": 0.9295736873149871, | |
| "num_tokens": 3638476600.0, | |
| "step": 46700 | |
| }, | |
| { | |
| "entropy": 0.20586246758699417, | |
| "epoch": 1.8616597642561326, | |
| "grad_norm": 2.066452980041504, | |
| "learning_rate": 2.500346109535012e-06, | |
| "loss": 0.2036473846435547, | |
| "mean_token_accuracy": 0.9310190284252167, | |
| "num_tokens": 3642389549.0, | |
| "step": 46750 | |
| }, | |
| { | |
| "entropy": 0.21279745489358903, | |
| "epoch": 1.8636508442179038, | |
| "grad_norm": 3.4920811653137207, | |
| "learning_rate": 2.4292019983230607e-06, | |
| "loss": 0.2081696319580078, | |
| "mean_token_accuracy": 0.9292943155765534, | |
| "num_tokens": 3646393721.0, | |
| "step": 46800 | |
| }, | |
| { | |
| "entropy": 0.21361444383859635, | |
| "epoch": 1.8656419241796751, | |
| "grad_norm": 18.080303192138672, | |
| "learning_rate": 2.359072261234152e-06, | |
| "loss": 0.21170433044433593, | |
| "mean_token_accuracy": 0.9282393491268158, | |
| "num_tokens": 3650136601.0, | |
| "step": 46850 | |
| }, | |
| { | |
| "entropy": 0.20671701848506926, | |
| "epoch": 1.8676330041414464, | |
| "grad_norm": 2.1680543422698975, | |
| "learning_rate": 2.289957627357231e-06, | |
| "loss": 0.20514652252197266, | |
| "mean_token_accuracy": 0.9300593328475952, | |
| "num_tokens": 3654008883.0, | |
| "step": 46900 | |
| }, | |
| { | |
| "entropy": 0.20612944304943084, | |
| "epoch": 1.8696240841032177, | |
| "grad_norm": 3.544213056564331, | |
| "learning_rate": 2.221858815227973e-06, | |
| "loss": 0.20879905700683593, | |
| "mean_token_accuracy": 0.9298162144422532, | |
| "num_tokens": 3657878785.0, | |
| "step": 46950 | |
| }, | |
| { | |
| "entropy": 0.20561033993959427, | |
| "epoch": 1.871615164064989, | |
| "grad_norm": 17.90035629272461, | |
| "learning_rate": 2.15477653282119e-06, | |
| "loss": 0.20452678680419922, | |
| "mean_token_accuracy": 0.9309412103891372, | |
| "num_tokens": 3661838269.0, | |
| "step": 47000 | |
| }, | |
| { | |
| "entropy": 0.20409692838788032, | |
| "epoch": 1.8736062440267602, | |
| "grad_norm": 63.73369598388672, | |
| "learning_rate": 2.088711477543659e-06, | |
| "loss": 0.2018229103088379, | |
| "mean_token_accuracy": 0.9308506631851197, | |
| "num_tokens": 3665698438.0, | |
| "step": 47050 | |
| }, | |
| { | |
| "entropy": 0.2098672604560852, | |
| "epoch": 1.8755973239885315, | |
| "grad_norm": 1.7252836227416992, | |
| "learning_rate": 2.023664336226716e-06, | |
| "loss": 0.20646530151367187, | |
| "mean_token_accuracy": 0.9303743714094161, | |
| "num_tokens": 3669603184.0, | |
| "step": 47100 | |
| }, | |
| { | |
| "entropy": 0.21036667585372926, | |
| "epoch": 1.8775884039503028, | |
| "grad_norm": 0.7469420433044434, | |
| "learning_rate": 1.9596357851191737e-06, | |
| "loss": 0.2089185333251953, | |
| "mean_token_accuracy": 0.9294323736429214, | |
| "num_tokens": 3673458486.0, | |
| "step": 47150 | |
| }, | |
| { | |
| "entropy": 0.2143134069442749, | |
| "epoch": 1.8795794839120739, | |
| "grad_norm": 4.1622467041015625, | |
| "learning_rate": 1.8966264898802932e-06, | |
| "loss": 0.2129537582397461, | |
| "mean_token_accuracy": 0.9273243010044098, | |
| "num_tokens": 3677379228.0, | |
| "step": 47200 | |
| }, | |
| { | |
| "entropy": 0.20456415072083473, | |
| "epoch": 1.8815705638738451, | |
| "grad_norm": 0.871599018573761, | |
| "learning_rate": 1.8346371055728672e-06, | |
| "loss": 0.2008742332458496, | |
| "mean_token_accuracy": 0.9321694928407669, | |
| "num_tokens": 3681325572.0, | |
| "step": 47250 | |
| }, | |
| { | |
| "entropy": 0.20833082988858223, | |
| "epoch": 1.8835616438356164, | |
| "grad_norm": 1.9216362237930298, | |
| "learning_rate": 1.7736682766563817e-06, | |
| "loss": 0.2087716865539551, | |
| "mean_token_accuracy": 0.9310186111927032, | |
| "num_tokens": 3685280505.0, | |
| "step": 47300 | |
| }, | |
| { | |
| "entropy": 0.20786230847239495, | |
| "epoch": 1.8855527237973877, | |
| "grad_norm": 0.5801077485084534, | |
| "learning_rate": 1.713720636980365e-06, | |
| "loss": 0.20443031311035156, | |
| "mean_token_accuracy": 0.9308688986301422, | |
| "num_tokens": 3689082889.0, | |
| "step": 47350 | |
| }, | |
| { | |
| "entropy": 0.21038655385375024, | |
| "epoch": 1.887543803759159, | |
| "grad_norm": 25.913808822631836, | |
| "learning_rate": 1.6547948097777155e-06, | |
| "loss": 0.20781410217285157, | |
| "mean_token_accuracy": 0.929584339261055, | |
| "num_tokens": 3693020179.0, | |
| "step": 47400 | |
| }, | |
| { | |
| "entropy": 0.20780225247144699, | |
| "epoch": 1.8895348837209303, | |
| "grad_norm": 1.085632085800171, | |
| "learning_rate": 1.5968914076583296e-06, | |
| "loss": 0.20219169616699217, | |
| "mean_token_accuracy": 0.9305776798725128, | |
| "num_tokens": 3696782672.0, | |
| "step": 47450 | |
| }, | |
| { | |
| "entropy": 0.2080184116959572, | |
| "epoch": 1.8915259636827015, | |
| "grad_norm": 2.220388650894165, | |
| "learning_rate": 1.5400110326026617e-06, | |
| "loss": 0.20734561920166017, | |
| "mean_token_accuracy": 0.9301981914043427, | |
| "num_tokens": 3700838688.0, | |
| "step": 47500 | |
| }, | |
| { | |
| "entropy": 0.21338329300284387, | |
| "epoch": 1.8935170436444726, | |
| "grad_norm": 4.149438381195068, | |
| "learning_rate": 1.4841542759554626e-06, | |
| "loss": 0.21353832244873047, | |
| "mean_token_accuracy": 0.9283533388376236, | |
| "num_tokens": 3704590951.0, | |
| "step": 47550 | |
| }, | |
| { | |
| "entropy": 0.21080107524991035, | |
| "epoch": 1.8955081236062439, | |
| "grad_norm": 23.682764053344727, | |
| "learning_rate": 1.429321718419674e-06, | |
| "loss": 0.2076173782348633, | |
| "mean_token_accuracy": 0.9303930050134659, | |
| "num_tokens": 3708629326.0, | |
| "step": 47600 | |
| }, | |
| { | |
| "entropy": 0.20033822111785413, | |
| "epoch": 1.8974992035680152, | |
| "grad_norm": 2.2728614807128906, | |
| "learning_rate": 1.3755139300503427e-06, | |
| "loss": 0.20009140014648438, | |
| "mean_token_accuracy": 0.9331355339288712, | |
| "num_tokens": 3712486088.0, | |
| "step": 47650 | |
| }, | |
| { | |
| "entropy": 0.20737343326210975, | |
| "epoch": 1.8994902835297864, | |
| "grad_norm": 5.053152561187744, | |
| "learning_rate": 1.3227314702487504e-06, | |
| "loss": 0.20637876510620118, | |
| "mean_token_accuracy": 0.9308607363700867, | |
| "num_tokens": 3716283064.0, | |
| "step": 47700 | |
| }, | |
| { | |
| "entropy": 0.2088836833834648, | |
| "epoch": 1.9014813634915577, | |
| "grad_norm": 0.7800954580307007, | |
| "learning_rate": 1.2709748877565597e-06, | |
| "loss": 0.20897350311279297, | |
| "mean_token_accuracy": 0.9295745211839676, | |
| "num_tokens": 3720089023.0, | |
| "step": 47750 | |
| }, | |
| { | |
| "entropy": 0.20781102195382117, | |
| "epoch": 1.903472443453329, | |
| "grad_norm": 6.860362529754639, | |
| "learning_rate": 1.2202447206500988e-06, | |
| "loss": 0.20449775695800781, | |
| "mean_token_accuracy": 0.9301507288217544, | |
| "num_tokens": 3723806031.0, | |
| "step": 47800 | |
| }, | |
| { | |
| "entropy": 0.21246332317590713, | |
| "epoch": 1.9054635234151003, | |
| "grad_norm": 0.762394368648529, | |
| "learning_rate": 1.1705414963348093e-06, | |
| "loss": 0.21171236038208008, | |
| "mean_token_accuracy": 0.9293036895990372, | |
| "num_tokens": 3727598397.0, | |
| "step": 47850 | |
| }, | |
| { | |
| "entropy": 0.20728234931826592, | |
| "epoch": 1.9074546033768716, | |
| "grad_norm": 0.8638309240341187, | |
| "learning_rate": 1.1218657315397284e-06, | |
| "loss": 0.2101401710510254, | |
| "mean_token_accuracy": 0.9301428550481796, | |
| "num_tokens": 3731653061.0, | |
| "step": 47900 | |
| }, | |
| { | |
| "entropy": 0.20614495024085044, | |
| "epoch": 1.9094456833386428, | |
| "grad_norm": 37.10430908203125, | |
| "learning_rate": 1.0742179323121048e-06, | |
| "loss": 0.20347900390625, | |
| "mean_token_accuracy": 0.9306625306606293, | |
| "num_tokens": 3735395635.0, | |
| "step": 47950 | |
| }, | |
| { | |
| "entropy": 0.20366091713309287, | |
| "epoch": 1.9114367633004141, | |
| "grad_norm": 1.1358367204666138, | |
| "learning_rate": 1.0275985940122245e-06, | |
| "loss": 0.20321054458618165, | |
| "mean_token_accuracy": 0.9320428788661956, | |
| "num_tokens": 3739487498.0, | |
| "step": 48000 | |
| }, | |
| { | |
| "epoch": 1.9114367633004141, | |
| "eval_entropy": 0.20564406140456123, | |
| "eval_loss": 0.21469460427761078, | |
| "eval_mean_token_accuracy": 0.9262936096342783, | |
| "eval_num_tokens": 3739487498.0, | |
| "eval_runtime": 97.8916, | |
| "eval_samples_per_second": 10.215, | |
| "eval_steps_per_second": 0.644, | |
| "step": 48000 | |
| }, | |
| { | |
| "entropy": 0.2046898439526558, | |
| "epoch": 1.9134278432621854, | |
| "grad_norm": 2.3159406185150146, | |
| "learning_rate": 9.820082013081267e-07, | |
| "loss": 0.20289798736572265, | |
| "mean_token_accuracy": 0.9317283999919891, | |
| "num_tokens": 3743289077.0, | |
| "step": 48050 | |
| }, | |
| { | |
| "entropy": 0.2038572260737419, | |
| "epoch": 1.9154189232239567, | |
| "grad_norm": 34.183570861816406, | |
| "learning_rate": 9.374472281706848e-07, | |
| "loss": 0.2002842330932617, | |
| "mean_token_accuracy": 0.9313328862190247, | |
| "num_tokens": 3747227416.0, | |
| "step": 48100 | |
| }, | |
| { | |
| "entropy": 0.20457203462719917, | |
| "epoch": 1.917410003185728, | |
| "grad_norm": 0.7753530740737915, | |
| "learning_rate": 8.939161378686001e-07, | |
| "loss": 0.20426761627197265, | |
| "mean_token_accuracy": 0.9307034468650818, | |
| "num_tokens": 3751042675.0, | |
| "step": 48150 | |
| }, | |
| { | |
| "entropy": 0.21071830078959464, | |
| "epoch": 1.9194010831474992, | |
| "grad_norm": 3.788648843765259, | |
| "learning_rate": 8.514153829636385e-07, | |
| "loss": 0.21027889251708984, | |
| "mean_token_accuracy": 0.9291975992918015, | |
| "num_tokens": 3755042100.0, | |
| "step": 48200 | |
| }, | |
| { | |
| "entropy": 0.2066432397067547, | |
| "epoch": 1.9213921631092705, | |
| "grad_norm": 1.2828806638717651, | |
| "learning_rate": 8.099454053058786e-07, | |
| "loss": 0.20229366302490234, | |
| "mean_token_accuracy": 0.9315379053354264, | |
| "num_tokens": 3758965564.0, | |
| "step": 48250 | |
| }, | |
| { | |
| "entropy": 0.20838844984769822, | |
| "epoch": 1.9233832430710418, | |
| "grad_norm": 1.511154294013977, | |
| "learning_rate": 7.695066360291824e-07, | |
| "loss": 0.20771406173706056, | |
| "mean_token_accuracy": 0.9306799596548081, | |
| "num_tokens": 3762804386.0, | |
| "step": 48300 | |
| }, | |
| { | |
| "entropy": 0.20677204117178916, | |
| "epoch": 1.925374323032813, | |
| "grad_norm": 2331.79150390625, | |
| "learning_rate": 7.300994955465989e-07, | |
| "loss": 0.20275856018066407, | |
| "mean_token_accuracy": 0.9303908598423004, | |
| "num_tokens": 3766566420.0, | |
| "step": 48350 | |
| }, | |
| { | |
| "entropy": 0.20770261108875274, | |
| "epoch": 1.9273654029945844, | |
| "grad_norm": 1.7849552631378174, | |
| "learning_rate": 6.917243935461448e-07, | |
| "loss": 0.20769720077514647, | |
| "mean_token_accuracy": 0.9299451416730881, | |
| "num_tokens": 3770266452.0, | |
| "step": 48400 | |
| }, | |
| { | |
| "entropy": 0.20397947937250138, | |
| "epoch": 1.9293564829563556, | |
| "grad_norm": 2.3596925735473633, | |
| "learning_rate": 6.543817289864307e-07, | |
| "loss": 0.20101829528808593, | |
| "mean_token_accuracy": 0.9313901931047439, | |
| "num_tokens": 3774158287.0, | |
| "step": 48450 | |
| }, | |
| { | |
| "entropy": 0.2011245361715555, | |
| "epoch": 1.931347562918127, | |
| "grad_norm": 4.982568740844727, | |
| "learning_rate": 6.18071890092553e-07, | |
| "loss": 0.1985802459716797, | |
| "mean_token_accuracy": 0.9325529444217682, | |
| "num_tokens": 3778191840.0, | |
| "step": 48500 | |
| }, | |
| { | |
| "entropy": 0.20900342330336572, | |
| "epoch": 1.9333386428798982, | |
| "grad_norm": 32.73358917236328, | |
| "learning_rate": 5.827952543520531e-07, | |
| "loss": 0.20671030044555663, | |
| "mean_token_accuracy": 0.9303619009256363, | |
| "num_tokens": 3782038440.0, | |
| "step": 48550 | |
| }, | |
| { | |
| "entropy": 0.20034867897629738, | |
| "epoch": 1.9353297228416695, | |
| "grad_norm": 0.882574737071991, | |
| "learning_rate": 5.485521885109978e-07, | |
| "loss": 0.19909774780273437, | |
| "mean_token_accuracy": 0.9321212899684906, | |
| "num_tokens": 3786002509.0, | |
| "step": 48600 | |
| }, | |
| { | |
| "entropy": 0.2031031160056591, | |
| "epoch": 1.9373208028034405, | |
| "grad_norm": 0.915739119052887, | |
| "learning_rate": 5.153430485701605e-07, | |
| "loss": 0.20162731170654297, | |
| "mean_token_accuracy": 0.9324739265441895, | |
| "num_tokens": 3790093261.0, | |
| "step": 48650 | |
| }, | |
| { | |
| "entropy": 0.2046504382789135, | |
| "epoch": 1.9393118827652118, | |
| "grad_norm": 0.8648226857185364, | |
| "learning_rate": 4.831681797813348e-07, | |
| "loss": 0.2067060089111328, | |
| "mean_token_accuracy": 0.9310611593723297, | |
| "num_tokens": 3793937975.0, | |
| "step": 48700 | |
| }, | |
| { | |
| "entropy": 0.20531852021813393, | |
| "epoch": 1.941302962726983, | |
| "grad_norm": 7.1985297203063965, | |
| "learning_rate": 4.520279166437269e-07, | |
| "loss": 0.2054092025756836, | |
| "mean_token_accuracy": 0.9317763692140579, | |
| "num_tokens": 3797910387.0, | |
| "step": 48750 | |
| }, | |
| { | |
| "entropy": 0.20719680860638617, | |
| "epoch": 1.9432940426887544, | |
| "grad_norm": 22.304264068603516, | |
| "learning_rate": 4.2192258290048025e-07, | |
| "loss": 0.20710372924804688, | |
| "mean_token_accuracy": 0.9299324482679368, | |
| "num_tokens": 3801898227.0, | |
| "step": 48800 | |
| }, | |
| { | |
| "entropy": 0.20797187641263007, | |
| "epoch": 1.9452851226505257, | |
| "grad_norm": 18.511686325073242, | |
| "learning_rate": 3.9285249153531155e-07, | |
| "loss": 0.20651954650878906, | |
| "mean_token_accuracy": 0.9307465720176696, | |
| "num_tokens": 3805909141.0, | |
| "step": 48850 | |
| }, | |
| { | |
| "entropy": 0.20582071751356124, | |
| "epoch": 1.947276202612297, | |
| "grad_norm": 1.2667385339736938, | |
| "learning_rate": 3.64817944769269e-07, | |
| "loss": 0.20809062957763672, | |
| "mean_token_accuracy": 0.9303789657354354, | |
| "num_tokens": 3809760421.0, | |
| "step": 48900 | |
| }, | |
| { | |
| "entropy": 0.20571558341383933, | |
| "epoch": 1.9492672825740682, | |
| "grad_norm": 3.226757049560547, | |
| "learning_rate": 3.378192340575792e-07, | |
| "loss": 0.2017552947998047, | |
| "mean_token_accuracy": 0.9309007340669632, | |
| "num_tokens": 3813550255.0, | |
| "step": 48950 | |
| }, | |
| { | |
| "entropy": 0.20174807600677014, | |
| "epoch": 1.9512583625358393, | |
| "grad_norm": 25.680898666381836, | |
| "learning_rate": 3.118566400866052e-07, | |
| "loss": 0.202763614654541, | |
| "mean_token_accuracy": 0.93158675968647, | |
| "num_tokens": 3817405098.0, | |
| "step": 49000 | |
| }, | |
| { | |
| "entropy": 0.20707564577460288, | |
| "epoch": 1.9532494424976106, | |
| "grad_norm": 3.1009507179260254, | |
| "learning_rate": 2.86930432770971e-07, | |
| "loss": 0.2066007995605469, | |
| "mean_token_accuracy": 0.9312508022785186, | |
| "num_tokens": 3821383869.0, | |
| "step": 49050 | |
| }, | |
| { | |
| "entropy": 0.2084057731926441, | |
| "epoch": 1.9552405224593818, | |
| "grad_norm": 0.6516017913818359, | |
| "learning_rate": 2.63040871250686e-07, | |
| "loss": 0.2070516586303711, | |
| "mean_token_accuracy": 0.9299625343084336, | |
| "num_tokens": 3825143915.0, | |
| "step": 49100 | |
| }, | |
| { | |
| "entropy": 0.21188082933425903, | |
| "epoch": 1.9572316024211531, | |
| "grad_norm": 1.871128797531128, | |
| "learning_rate": 2.4018820388853616e-07, | |
| "loss": 0.2084772491455078, | |
| "mean_token_accuracy": 0.9292748957872391, | |
| "num_tokens": 3829132016.0, | |
| "step": 49150 | |
| }, | |
| { | |
| "entropy": 0.21081951320171355, | |
| "epoch": 1.9592226823829244, | |
| "grad_norm": 1.8061888217926025, | |
| "learning_rate": 2.183726682674192e-07, | |
| "loss": 0.21075002670288087, | |
| "mean_token_accuracy": 0.9300468742847443, | |
| "num_tokens": 3833181633.0, | |
| "step": 49200 | |
| }, | |
| { | |
| "entropy": 0.20759766191244125, | |
| "epoch": 1.9612137623446957, | |
| "grad_norm": 1.1670663356781006, | |
| "learning_rate": 1.9759449118793572e-07, | |
| "loss": 0.207088623046875, | |
| "mean_token_accuracy": 0.930818041563034, | |
| "num_tokens": 3837176299.0, | |
| "step": 49250 | |
| }, | |
| { | |
| "entropy": 0.20684496089816093, | |
| "epoch": 1.963204842306467, | |
| "grad_norm": 0.7471051216125488, | |
| "learning_rate": 1.7785388866599084e-07, | |
| "loss": 0.20402929306030274, | |
| "mean_token_accuracy": 0.9307003366947174, | |
| "num_tokens": 3841191395.0, | |
| "step": 49300 | |
| }, | |
| { | |
| "entropy": 0.21133894830942154, | |
| "epoch": 1.9651959222682382, | |
| "grad_norm": 13.016488075256348, | |
| "learning_rate": 1.5915106593058504e-07, | |
| "loss": 0.2060970115661621, | |
| "mean_token_accuracy": 0.9299823653697967, | |
| "num_tokens": 3844941023.0, | |
| "step": 49350 | |
| }, | |
| { | |
| "entropy": 0.21003282114863395, | |
| "epoch": 1.9671870022300095, | |
| "grad_norm": 0.6203821301460266, | |
| "learning_rate": 1.4148621742163804e-07, | |
| "loss": 0.20873613357543946, | |
| "mean_token_accuracy": 0.9288827109336854, | |
| "num_tokens": 3848840082.0, | |
| "step": 49400 | |
| }, | |
| { | |
| "entropy": 0.20687765166163444, | |
| "epoch": 1.9691780821917808, | |
| "grad_norm": 5.534557819366455, | |
| "learning_rate": 1.248595267880237e-07, | |
| "loss": 0.20545137405395508, | |
| "mean_token_accuracy": 0.9310005211830139, | |
| "num_tokens": 3852805539.0, | |
| "step": 49450 | |
| }, | |
| { | |
| "entropy": 0.20607408091425897, | |
| "epoch": 1.971169162153552, | |
| "grad_norm": 26.854223251342773, | |
| "learning_rate": 1.0927116688559392e-07, | |
| "loss": 0.20466529846191406, | |
| "mean_token_accuracy": 0.9308301746845246, | |
| "num_tokens": 3856699416.0, | |
| "step": 49500 | |
| }, | |
| { | |
| "epoch": 1.971169162153552, | |
| "eval_entropy": 0.20582637699350478, | |
| "eval_loss": 0.2147466093301773, | |
| "eval_mean_token_accuracy": 0.9266640799386161, | |
| "eval_num_tokens": 3856699416.0, | |
| "eval_runtime": 98.3223, | |
| "eval_samples_per_second": 10.171, | |
| "eval_steps_per_second": 0.641, | |
| "step": 49500 | |
| }, | |
| { | |
| "entropy": 0.20653628379106523, | |
| "epoch": 1.9731602421153234, | |
| "grad_norm": 1.1142542362213135, | |
| "learning_rate": 9.472129977542432e-08, | |
| "loss": 0.2072589111328125, | |
| "mean_token_accuracy": 0.9303338515758515, | |
| "num_tokens": 3860596992.0, | |
| "step": 49550 | |
| }, | |
| { | |
| "entropy": 0.20690153531730174, | |
| "epoch": 1.9751513220770947, | |
| "grad_norm": 7.65147066116333, | |
| "learning_rate": 8.121007672213799e-08, | |
| "loss": 0.2086052703857422, | |
| "mean_token_accuracy": 0.9305313348770141, | |
| "num_tokens": 3864521466.0, | |
| "step": 49600 | |
| }, | |
| { | |
| "entropy": 0.20702269583940505, | |
| "epoch": 1.977142402038866, | |
| "grad_norm": 32.16565704345703, | |
| "learning_rate": 6.873763819229551e-08, | |
| "loss": 0.2078022003173828, | |
| "mean_token_accuracy": 0.93008549451828, | |
| "num_tokens": 3868526158.0, | |
| "step": 49650 | |
| }, | |
| { | |
| "entropy": 0.21008945062756537, | |
| "epoch": 1.9791334820006372, | |
| "grad_norm": 9.32603931427002, | |
| "learning_rate": 5.730411385296286e-08, | |
| "loss": 0.21051559448242188, | |
| "mean_token_accuracy": 0.9299064064025879, | |
| "num_tokens": 3872432069.0, | |
| "step": 49700 | |
| }, | |
| { | |
| "entropy": 0.20985413163900377, | |
| "epoch": 1.9811245619624085, | |
| "grad_norm": 5.055283069610596, | |
| "learning_rate": 4.690962257034581e-08, | |
| "loss": 0.2076975631713867, | |
| "mean_token_accuracy": 0.929867318868637, | |
| "num_tokens": 3876470872.0, | |
| "step": 49750 | |
| }, | |
| { | |
| "entropy": 0.20643711417913438, | |
| "epoch": 1.9831156419241798, | |
| "grad_norm": 26.450632095336914, | |
| "learning_rate": 3.755427240857978e-08, | |
| "loss": 0.2061263656616211, | |
| "mean_token_accuracy": 0.9302699691057206, | |
| "num_tokens": 3880458553.0, | |
| "step": 49800 | |
| }, | |
| { | |
| "entropy": 0.2079177989065647, | |
| "epoch": 1.985106721885951, | |
| "grad_norm": 1.292538046836853, | |
| "learning_rate": 2.9238160628575207e-08, | |
| "loss": 0.2060544204711914, | |
| "mean_token_accuracy": 0.9301692873239518, | |
| "num_tokens": 3884124520.0, | |
| "step": 49850 | |
| }, | |
| { | |
| "entropy": 0.21075452208518983, | |
| "epoch": 1.9870978018477223, | |
| "grad_norm": 0.7453241944313049, | |
| "learning_rate": 2.196137368702944e-08, | |
| "loss": 0.2081309127807617, | |
| "mean_token_accuracy": 0.930830671787262, | |
| "num_tokens": 3888180011.0, | |
| "step": 49900 | |
| }, | |
| { | |
| "entropy": 0.21127940952777863, | |
| "epoch": 1.9890888818094936, | |
| "grad_norm": 1.3387459516525269, | |
| "learning_rate": 1.5723987235505277e-08, | |
| "loss": 0.21070463180541993, | |
| "mean_token_accuracy": 0.9282910376787186, | |
| "num_tokens": 3892182274.0, | |
| "step": 49950 | |
| }, | |
| { | |
| "entropy": 0.20441270008683204, | |
| "epoch": 1.991079961771265, | |
| "grad_norm": 4.187839031219482, | |
| "learning_rate": 1.0526066119675992e-08, | |
| "loss": 0.2010428237915039, | |
| "mean_token_accuracy": 0.9325181847810745, | |
| "num_tokens": 3896204467.0, | |
| "step": 50000 | |
| }, | |
| { | |
| "entropy": 0.20435837164521217, | |
| "epoch": 1.993071041733036, | |
| "grad_norm": 1.1942611932754517, | |
| "learning_rate": 6.367664378625904e-09, | |
| "loss": 0.2057977294921875, | |
| "mean_token_accuracy": 0.931745657324791, | |
| "num_tokens": 3900102828.0, | |
| "step": 50050 | |
| }, | |
| { | |
| "entropy": 0.2092647895216942, | |
| "epoch": 1.9950621216948072, | |
| "grad_norm": 0.8024593591690063, | |
| "learning_rate": 3.2488252443063636e-09, | |
| "loss": 0.20857706069946289, | |
| "mean_token_accuracy": 0.9304239410161972, | |
| "num_tokens": 3904170822.0, | |
| "step": 50100 | |
| }, | |
| { | |
| "entropy": 0.21017679318785668, | |
| "epoch": 1.9970532016565785, | |
| "grad_norm": 43.912872314453125, | |
| "learning_rate": 1.1695811410472602e-09, | |
| "loss": 0.20722965240478516, | |
| "mean_token_accuracy": 0.929292955994606, | |
| "num_tokens": 3908122364.0, | |
| "step": 50150 | |
| }, | |
| { | |
| "entropy": 0.20791637182235717, | |
| "epoch": 1.9990442816183498, | |
| "grad_norm": 2.973179817199707, | |
| "learning_rate": 1.2995368529056252e-10, | |
| "loss": 0.20523807525634766, | |
| "mean_token_accuracy": 0.9306921732425689, | |
| "num_tokens": 3911893024.0, | |
| "step": 50200 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_entropy": 0.20587446363199324, | |
| "eval_loss": 0.21491390466690063, | |
| "eval_mean_token_accuracy": 0.9264521419055878, | |
| "eval_num_tokens": 3913614351.0, | |
| "eval_runtime": 97.9895, | |
| "eval_samples_per_second": 10.205, | |
| "eval_steps_per_second": 0.643, | |
| "step": 50224 | |
| } | |
| ], | |
| "logging_steps": 50, | |
| "max_steps": 50224, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 2500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.1421745685818801e+21, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |