{ "task": "nosql2doc", "model_name": "Salesforce/codegen-350M-multi", "device": "cuda:0", "checkpoint_run": "v4", "adapter_path": "/kaggle/working/models/checkpoints/v4/nosql2doc", "train_rows": 8040, "eval_rows": 1035, "train_loss": 0.5501504028135771, "eval_loss": 1.013381004333496, "best_eval_loss": 1.013381004333496, "train_runtime_seconds": 13547.859, "mlflow_run_id": null, "filter_stats": { "input_rows": 8040, "kept_rows": 8040, "skipped_rows": 0, "skip_reasons": {} }, "token_stats": { "rows": 8040, "avg_prompt_tokens": 485.68, "avg_target_tokens": 27.33, "avg_total_tokens": 513.01, "max_total_tokens": 1439, "skipped_too_long_target": 0, "skipped_too_long_prompt": 0 }, "log_history": [ { "loss": 3.3999290466308594, "grad_norm": 3.4684948921203613, "learning_rate": 7.142857142857143e-06, "entropy": 2.8841454654932024, "num_tokens": 84042.0, "mean_token_accuracy": 0.36815835647284983, "epoch": 0.01990049751243781, "step": 10 }, { "loss": 3.1389333724975588, "grad_norm": 3.199768304824829, "learning_rate": 1.5079365079365079e-05, "entropy": 2.871115285158157, "num_tokens": 166453.0, "mean_token_accuracy": 0.41857333555817605, "epoch": 0.03980099502487562, "step": 20 }, { "loss": 2.5403181076049806, "grad_norm": 2.241548776626587, "learning_rate": 2.3015873015873015e-05, "entropy": 2.689709846675396, "num_tokens": 248357.0, "mean_token_accuracy": 0.45860434919595716, "epoch": 0.05970149253731343, "step": 30 }, { "loss": 2.2156551361083983, "grad_norm": 2.2443745136260986, "learning_rate": 3.095238095238095e-05, "entropy": 2.371776354312897, "num_tokens": 329302.0, "mean_token_accuracy": 0.534111600741744, "epoch": 0.07960199004975124, "step": 40 }, { "loss": 1.9395181655883789, "grad_norm": 2.8479607105255127, "learning_rate": 3.888888888888889e-05, "entropy": 1.9646751508116722, "num_tokens": 410388.0, "mean_token_accuracy": 0.5719782687723637, "epoch": 0.09950248756218906, "step": 50 }, { "loss": 1.7669334411621094, "grad_norm": 2.5392374992370605, "learning_rate": 4.682539682539683e-05, "entropy": 1.712027932703495, "num_tokens": 491142.0, "mean_token_accuracy": 0.5962413489818573, "epoch": 0.11940298507462686, "step": 60 }, { "loss": 1.6198507308959962, "grad_norm": 2.8646080493927, "learning_rate": 5.4761904761904766e-05, "entropy": 1.6189243733882903, "num_tokens": 573054.0, "mean_token_accuracy": 0.6142528053373099, "epoch": 0.13930348258706468, "step": 70 }, { "loss": 1.6246612548828125, "grad_norm": 3.0876874923706055, "learning_rate": 6.26984126984127e-05, "entropy": 1.6242131367325783, "num_tokens": 658316.0, "mean_token_accuracy": 0.626776534691453, "epoch": 0.15920398009950248, "step": 80 }, { "loss": 1.5039705276489257, "grad_norm": 2.827972650527954, "learning_rate": 7.063492063492065e-05, "entropy": 1.5123998656868936, "num_tokens": 738196.0, "mean_token_accuracy": 0.6451249852776527, "epoch": 0.1791044776119403, "step": 90 }, { "loss": 1.4707328796386718, "grad_norm": 2.794956684112549, "learning_rate": 7.857142857142858e-05, "entropy": 1.4389337845146657, "num_tokens": 818366.0, "mean_token_accuracy": 0.6486270293593407, "epoch": 0.19900497512437812, "step": 100 }, { "loss": 1.461697483062744, "grad_norm": 2.650611639022827, "learning_rate": 8.650793650793651e-05, "entropy": 1.4290485948324203, "num_tokens": 900542.0, "mean_token_accuracy": 0.6452589213848114, "epoch": 0.21890547263681592, "step": 110 }, { "loss": 1.3799741744995118, "grad_norm": 3.212292194366455, "learning_rate": 9.444444444444444e-05, "entropy": 1.4537153281271458, "num_tokens": 983783.0, "mean_token_accuracy": 0.665483495220542, "epoch": 0.23880597014925373, "step": 120 }, { "loss": 1.339876365661621, "grad_norm": 2.367784261703491, "learning_rate": 0.00010238095238095237, "entropy": 1.3213311471045017, "num_tokens": 1065282.0, "mean_token_accuracy": 0.6738482430577278, "epoch": 0.25870646766169153, "step": 130 }, { "loss": 1.3189430236816406, "grad_norm": 2.7096056938171387, "learning_rate": 0.00011031746031746033, "entropy": 1.2877162352204323, "num_tokens": 1147430.0, "mean_token_accuracy": 0.6620625633746385, "epoch": 0.27860696517412936, "step": 140 }, { "loss": 1.3049938201904296, "grad_norm": 2.497452974319458, "learning_rate": 0.00011825396825396826, "entropy": 1.3201022632420063, "num_tokens": 1225840.0, "mean_token_accuracy": 0.6833859849721193, "epoch": 0.29850746268656714, "step": 150 }, { "loss": 1.231965923309326, "grad_norm": 3.0387496948242188, "learning_rate": 0.0001261904761904762, "entropy": 1.2007936105132102, "num_tokens": 1309268.0, "mean_token_accuracy": 0.7017441529780626, "epoch": 0.31840796019900497, "step": 160 }, { "loss": 1.2840826034545898, "grad_norm": 2.327012300491333, "learning_rate": 0.00013412698412698412, "entropy": 1.3119081839919091, "num_tokens": 1389094.0, "mean_token_accuracy": 0.6792996764183045, "epoch": 0.3383084577114428, "step": 170 }, { "loss": 1.2992033958435059, "grad_norm": 2.426831007003784, "learning_rate": 0.00014206349206349208, "entropy": 1.2995639897882938, "num_tokens": 1471243.0, "mean_token_accuracy": 0.6910909987986088, "epoch": 0.3582089552238806, "step": 180 }, { "loss": 1.1649029731750489, "grad_norm": 2.783355951309204, "learning_rate": 0.00015000000000000001, "entropy": 1.1952705256640912, "num_tokens": 1552783.0, "mean_token_accuracy": 0.7020247872918844, "epoch": 0.3781094527363184, "step": 190 }, { "loss": 1.2627052307128905, "grad_norm": 2.162163019180298, "learning_rate": 0.00015793650793650795, "entropy": 1.2681411176919937, "num_tokens": 1635174.0, "mean_token_accuracy": 0.6855453528463841, "epoch": 0.39800995024875624, "step": 200 }, { "loss": 1.237012004852295, "grad_norm": 2.3045036792755127, "learning_rate": 0.0001658730158730159, "entropy": 1.2593041777610778, "num_tokens": 1720930.0, "mean_token_accuracy": 0.6885611288249492, "epoch": 0.417910447761194, "step": 210 }, { "loss": 1.2200750350952148, "grad_norm": 2.291395664215088, "learning_rate": 0.00017380952380952383, "entropy": 1.1904637023806572, "num_tokens": 1803132.0, "mean_token_accuracy": 0.6859784577041864, "epoch": 0.43781094527363185, "step": 220 }, { "loss": 1.2164555549621583, "grad_norm": 2.553251266479492, "learning_rate": 0.00018174603174603177, "entropy": 1.1843627236783505, "num_tokens": 1884825.0, "mean_token_accuracy": 0.6943051021546125, "epoch": 0.4577114427860697, "step": 230 }, { "loss": 1.1573832511901856, "grad_norm": 2.403580904006958, "learning_rate": 0.0001896825396825397, "entropy": 1.1876815035939217, "num_tokens": 1968914.0, "mean_token_accuracy": 0.7180207531899214, "epoch": 0.47761194029850745, "step": 240 }, { "loss": 1.1767531394958497, "grad_norm": 2.3557302951812744, "learning_rate": 0.00019761904761904763, "entropy": 1.1310456305742265, "num_tokens": 2050602.0, "mean_token_accuracy": 0.6986724361777306, "epoch": 0.4975124378109453, "step": 250 }, { "loss": 1.187550926208496, "grad_norm": 2.430337905883789, "learning_rate": 0.0001999989408126818, "entropy": 1.2115244895219803, "num_tokens": 2134774.0, "mean_token_accuracy": 0.6943733543157578, "epoch": 0.5174129353233831, "step": 260 }, { "loss": 1.1683053970336914, "grad_norm": 1.848976969718933, "learning_rate": 0.0001999937530104439, "entropy": 1.1603886000812054, "num_tokens": 2214022.0, "mean_token_accuracy": 0.6958795577287674, "epoch": 0.5373134328358209, "step": 270 }, { "loss": 1.087782859802246, "grad_norm": 2.297624111175537, "learning_rate": 0.00019998424227267588, "entropy": 1.083036269247532, "num_tokens": 2295817.0, "mean_token_accuracy": 0.7164598941802979, "epoch": 0.5572139303482587, "step": 280 }, { "loss": 1.1336830139160157, "grad_norm": 2.1926214694976807, "learning_rate": 0.00019997040901054646, "entropy": 1.1467085666954517, "num_tokens": 2379081.0, "mean_token_accuracy": 0.7070459358394146, "epoch": 0.5771144278606966, "step": 290 }, { "loss": 1.104503059387207, "grad_norm": 2.108574390411377, "learning_rate": 0.000199952253822096, "entropy": 1.1092145919799805, "num_tokens": 2461290.0, "mean_token_accuracy": 0.7167623668909073, "epoch": 0.5970149253731343, "step": 300 }, { "loss": 1.0758417129516602, "grad_norm": 1.9235388040542603, "learning_rate": 0.00019992977749221064, "entropy": 1.0762298285961152, "num_tokens": 2546927.0, "mean_token_accuracy": 0.7244217373430729, "epoch": 0.6169154228855721, "step": 310 }, { "loss": 1.0714119911193847, "grad_norm": 2.015493154525757, "learning_rate": 0.0001999029809925883, "entropy": 1.058315774053335, "num_tokens": 2627151.0, "mean_token_accuracy": 0.7185824103653431, "epoch": 0.6368159203980099, "step": 320 }, { "loss": 1.0344210624694825, "grad_norm": 1.824608564376831, "learning_rate": 0.00019987186548169682, "entropy": 1.040397210419178, "num_tokens": 2711367.0, "mean_token_accuracy": 0.7333592250943184, "epoch": 0.6567164179104478, "step": 330 }, { "loss": 0.9733485221862793, "grad_norm": 1.9432896375656128, "learning_rate": 0.0001998364323047236, "entropy": 0.9891116008162498, "num_tokens": 2793468.0, "mean_token_accuracy": 0.7416356436908245, "epoch": 0.6766169154228856, "step": 340 }, { "loss": 1.0494978904724122, "grad_norm": 1.906457781791687, "learning_rate": 0.00019979668299351783, "entropy": 1.0004291333258153, "num_tokens": 2875166.0, "mean_token_accuracy": 0.7176768533885479, "epoch": 0.6965174129353234, "step": 350 }, { "loss": 1.0371734619140625, "grad_norm": 1.7709777355194092, "learning_rate": 0.00019975261926652392, "entropy": 1.0571318455040455, "num_tokens": 2959671.0, "mean_token_accuracy": 0.7288566574454307, "epoch": 0.7164179104477612, "step": 360 }, { "loss": 0.9970813751220703, "grad_norm": 1.896713376045227, "learning_rate": 0.00019970424302870739, "entropy": 0.9674378834664822, "num_tokens": 3041437.0, "mean_token_accuracy": 0.7395003981888294, "epoch": 0.736318407960199, "step": 370 }, { "loss": 1.0752775192260742, "grad_norm": 1.7242449522018433, "learning_rate": 0.00019965155637147243, "entropy": 1.1270258143544196, "num_tokens": 3123865.0, "mean_token_accuracy": 0.7305668473243714, "epoch": 0.7562189054726368, "step": 380 }, { "loss": 0.9751872062683106, "grad_norm": 1.781772255897522, "learning_rate": 0.0001995945615725716, "entropy": 0.9315242812037468, "num_tokens": 3205032.0, "mean_token_accuracy": 0.7497406356036663, "epoch": 0.7761194029850746, "step": 390 }, { "loss": 1.0796968460083007, "grad_norm": 1.8422024250030518, "learning_rate": 0.00019953326109600728, "entropy": 1.076903734356165, "num_tokens": 3286003.0, "mean_token_accuracy": 0.7176821112632752, "epoch": 0.7960199004975125, "step": 400 }, { "loss": 0.9697890281677246, "grad_norm": 1.7082111835479736, "learning_rate": 0.00019946765759192497, "entropy": 0.9634652934968472, "num_tokens": 3367484.0, "mean_token_accuracy": 0.7406083434820175, "epoch": 0.8159203980099502, "step": 410 }, { "loss": 0.9277518272399903, "grad_norm": 1.8066761493682861, "learning_rate": 0.00019939775389649916, "entropy": 0.9321402795612812, "num_tokens": 3453904.0, "mean_token_accuracy": 0.7574292354285717, "epoch": 0.835820895522388, "step": 420 }, { "loss": 0.9705208778381348, "grad_norm": 1.6425416469573975, "learning_rate": 0.00019932355303181026, "entropy": 0.9754443395882845, "num_tokens": 3536472.0, "mean_token_accuracy": 0.7435099229216575, "epoch": 0.8557213930348259, "step": 430 }, { "loss": 1.036739444732666, "grad_norm": 1.707189679145813, "learning_rate": 0.00019924505820571425, "entropy": 0.9742012087255716, "num_tokens": 3616711.0, "mean_token_accuracy": 0.7312861289829016, "epoch": 0.8756218905472637, "step": 440 }, { "loss": 1.0217846870422362, "grad_norm": 1.865692377090454, "learning_rate": 0.0001991622728117038, "entropy": 1.0537842728197575, "num_tokens": 3701126.0, "mean_token_accuracy": 0.7338800489902496, "epoch": 0.8955223880597015, "step": 450 }, { "loss": 1.0003718376159667, "grad_norm": 1.7353651523590088, "learning_rate": 0.00019907520042876172, "entropy": 0.989534855633974, "num_tokens": 3783495.0, "mean_token_accuracy": 0.7480997510254384, "epoch": 0.9154228855721394, "step": 460 }, { "loss": 1.0100757598876953, "grad_norm": 2.007262706756592, "learning_rate": 0.00019898384482120614, "entropy": 0.9294702004641294, "num_tokens": 3863784.0, "mean_token_accuracy": 0.7364842720329762, "epoch": 0.9353233830845771, "step": 470 }, { "loss": 0.9432971000671386, "grad_norm": 1.9396175146102905, "learning_rate": 0.0001988882099385278, "entropy": 0.9523782070726157, "num_tokens": 3947540.0, "mean_token_accuracy": 0.756897260248661, "epoch": 0.9552238805970149, "step": 480 }, { "loss": 0.9125359535217286, "grad_norm": 1.8582719564437866, "learning_rate": 0.00019878829991521935, "entropy": 0.9421051684767008, "num_tokens": 4031284.0, "mean_token_accuracy": 0.7575220972299576, "epoch": 0.9751243781094527, "step": 490 }, { "loss": 0.9656861305236817, "grad_norm": 1.9623899459838867, "learning_rate": 0.00019868411907059645, "entropy": 0.9381607126444578, "num_tokens": 4112149.0, "mean_token_accuracy": 0.7544871643185616, "epoch": 0.9950248756218906, "step": 500 }, { "eval_loss": 1.063795566558838, "eval_runtime": 88.6229, "eval_samples_per_second": 11.679, "eval_steps_per_second": 5.845, "eval_entropy": 0.9874700385516214, "eval_num_tokens": 4132656.0, "eval_mean_token_accuracy": 0.7334998920847551, "epoch": 1.0, "step": 503 }, { "loss": 0.7886298179626465, "grad_norm": 1.6549201011657715, "learning_rate": 0.00019857567190861126, "entropy": 0.8532990099568116, "num_tokens": 4190723.0, "mean_token_accuracy": 0.7860889779893976, "epoch": 1.0139303482587065, "step": 510 }, { "loss": 0.777919864654541, "grad_norm": 1.6148929595947266, "learning_rate": 0.00019846296311765754, "entropy": 0.7671804554760456, "num_tokens": 4273358.0, "mean_token_accuracy": 0.789631099998951, "epoch": 1.0338308457711443, "step": 520 }, { "loss": 0.7967178821563721, "grad_norm": 1.765950322151184, "learning_rate": 0.00019834599757036803, "entropy": 0.8041674952954054, "num_tokens": 4356030.0, "mean_token_accuracy": 0.784614659100771, "epoch": 1.053731343283582, "step": 530 }, { "loss": 0.7301093578338623, "grad_norm": 1.7868931293487549, "learning_rate": 0.00019822478032340387, "entropy": 0.7405303593724966, "num_tokens": 4440157.0, "mean_token_accuracy": 0.8020888641476631, "epoch": 1.07363184079602, "step": 540 }, { "loss": 0.7884031295776367, "grad_norm": 1.991782784461975, "learning_rate": 0.0001980993166172358, "entropy": 0.7550990927964449, "num_tokens": 4523343.0, "mean_token_accuracy": 0.7879343688488006, "epoch": 1.0935323383084576, "step": 550 }, { "loss": 0.8159590721130371, "grad_norm": 1.869396686553955, "learning_rate": 0.00019796961187591781, "entropy": 0.812371177971363, "num_tokens": 4605454.0, "mean_token_accuracy": 0.7711428456008435, "epoch": 1.1134328358208956, "step": 560 }, { "loss": 0.8079433441162109, "grad_norm": 1.9530060291290283, "learning_rate": 0.00019783567170685262, "entropy": 0.7879433136433363, "num_tokens": 4687318.0, "mean_token_accuracy": 0.7875082984566688, "epoch": 1.1333333333333333, "step": 570 }, { "loss": 0.8188363075256347, "grad_norm": 1.7895166873931885, "learning_rate": 0.00019769750190054905, "entropy": 0.8396137218922377, "num_tokens": 4768232.0, "mean_token_accuracy": 0.7710263684391976, "epoch": 1.153233830845771, "step": 580 }, { "loss": 0.8532954216003418, "grad_norm": 1.8147255182266235, "learning_rate": 0.00019755510843037191, "entropy": 0.8406378872692585, "num_tokens": 4850366.0, "mean_token_accuracy": 0.7680545568466186, "epoch": 1.173134328358209, "step": 590 }, { "loss": 0.7972042560577393, "grad_norm": 1.9839149713516235, "learning_rate": 0.00019740849745228367, "entropy": 0.7758986987173557, "num_tokens": 4932940.0, "mean_token_accuracy": 0.77668926268816, "epoch": 1.1930348258706467, "step": 600 }, { "loss": 0.7664913654327392, "grad_norm": 1.776328444480896, "learning_rate": 0.00019725767530457837, "entropy": 0.825455692410469, "num_tokens": 5012821.0, "mean_token_accuracy": 0.7940710753202438, "epoch": 1.2129353233830846, "step": 610 }, { "loss": 0.7731894969940185, "grad_norm": 2.0241360664367676, "learning_rate": 0.00019710264850760756, "entropy": 0.7286036755889654, "num_tokens": 5095340.0, "mean_token_accuracy": 0.7846131704747676, "epoch": 1.2328358208955223, "step": 620 }, { "loss": 0.7303972244262695, "grad_norm": 1.7310129404067993, "learning_rate": 0.00019694342376349835, "entropy": 0.7920811083167791, "num_tokens": 5177547.0, "mean_token_accuracy": 0.7983584970235824, "epoch": 1.25273631840796, "step": 630 }, { "loss": 0.8018975257873535, "grad_norm": 1.7608613967895508, "learning_rate": 0.00019678000795586386, "entropy": 0.7178942065685987, "num_tokens": 5265612.0, "mean_token_accuracy": 0.7767767131328582, "epoch": 1.272636815920398, "step": 640 }, { "loss": 0.7223423480987549, "grad_norm": 2.0576155185699463, "learning_rate": 0.00019661240814950536, "entropy": 0.8001765824854374, "num_tokens": 5348652.0, "mean_token_accuracy": 0.7918425254523754, "epoch": 1.292537313432836, "step": 650 }, { "loss": 0.8217278480529785, "grad_norm": 1.539169430732727, "learning_rate": 0.00019644063159010716, "entropy": 0.7580439992249012, "num_tokens": 5431834.0, "mean_token_accuracy": 0.7793662197887897, "epoch": 1.3124378109452737, "step": 660 }, { "loss": 0.7759135723114013, "grad_norm": 1.8933053016662598, "learning_rate": 0.00019626468570392298, "entropy": 0.8075141672044992, "num_tokens": 5514228.0, "mean_token_accuracy": 0.7861333280801773, "epoch": 1.3323383084577114, "step": 670 }, { "loss": 0.8088616371154785, "grad_norm": 1.7051018476486206, "learning_rate": 0.00019608457809745537, "entropy": 0.7623774103820324, "num_tokens": 5594702.0, "mean_token_accuracy": 0.7746041730046272, "epoch": 1.3522388059701491, "step": 680 }, { "loss": 0.7946909904479981, "grad_norm": 1.8061248064041138, "learning_rate": 0.00019590031655712631, "entropy": 0.8089807592332363, "num_tokens": 5676309.0, "mean_token_accuracy": 0.7781320951879025, "epoch": 1.372139303482587, "step": 690 }, { "loss": 0.7615675926208496, "grad_norm": 1.9005513191223145, "learning_rate": 0.00019571190904894115, "entropy": 0.7627177253365517, "num_tokens": 5757314.0, "mean_token_accuracy": 0.788880155980587, "epoch": 1.392039800995025, "step": 700 }, { "loss": 0.7611291408538818, "grad_norm": 1.9883071184158325, "learning_rate": 0.00019551936371814375, "entropy": 0.7580569207668304, "num_tokens": 5838877.0, "mean_token_accuracy": 0.7861187107861042, "epoch": 1.4119402985074627, "step": 710 }, { "loss": 0.7204749584197998, "grad_norm": 2.187103033065796, "learning_rate": 0.0001953226888888647, "entropy": 0.7182941000908614, "num_tokens": 5920820.0, "mean_token_accuracy": 0.7946790263056756, "epoch": 1.4318407960199004, "step": 720 }, { "loss": 0.757196044921875, "grad_norm": 1.7006845474243164, "learning_rate": 0.00019512189306376118, "entropy": 0.6957223568111658, "num_tokens": 6004382.0, "mean_token_accuracy": 0.7921811021864414, "epoch": 1.4517412935323384, "step": 730 }, { "loss": 0.7292089462280273, "grad_norm": 1.6335111856460571, "learning_rate": 0.0001949169849236496, "entropy": 0.7850441809743642, "num_tokens": 6086449.0, "mean_token_accuracy": 0.797366950660944, "epoch": 1.471641791044776, "step": 740 }, { "loss": 0.8179457664489747, "grad_norm": 1.7224810123443604, "learning_rate": 0.00019470797332713012, "entropy": 0.7639980979263783, "num_tokens": 6168749.0, "mean_token_accuracy": 0.7910384394228458, "epoch": 1.491542288557214, "step": 750 }, { "loss": 0.7916707515716552, "grad_norm": 1.9208451509475708, "learning_rate": 0.0001944948673102038, "entropy": 0.8024922411888837, "num_tokens": 6248672.0, "mean_token_accuracy": 0.7822470977902413, "epoch": 1.5114427860696518, "step": 760 }, { "loss": 0.7538708209991455, "grad_norm": 1.9618816375732422, "learning_rate": 0.00019427767608588183, "entropy": 0.7430106606334448, "num_tokens": 6331261.0, "mean_token_accuracy": 0.7816703900694847, "epoch": 1.5313432835820895, "step": 770 }, { "loss": 0.7316685676574707, "grad_norm": 1.6858505010604858, "learning_rate": 0.0001940564090437875, "entropy": 0.7457086000591516, "num_tokens": 6415504.0, "mean_token_accuracy": 0.8001063913106918, "epoch": 1.5512437810945272, "step": 780 }, { "loss": 0.7277198791503906, "grad_norm": 1.9956564903259277, "learning_rate": 0.00019383107574974984, "entropy": 0.7096565395593644, "num_tokens": 6497199.0, "mean_token_accuracy": 0.7895878478884697, "epoch": 1.5711442786069652, "step": 790 }, { "loss": 0.7483164310455322, "grad_norm": 1.7207188606262207, "learning_rate": 0.00019360168594539055, "entropy": 0.7606754396110773, "num_tokens": 6577494.0, "mean_token_accuracy": 0.7934170700609684, "epoch": 1.591044776119403, "step": 800 }, { "loss": 0.7517632007598877, "grad_norm": 1.7885297536849976, "learning_rate": 0.0001933682495477024, "entropy": 0.7786010228097439, "num_tokens": 6660010.0, "mean_token_accuracy": 0.791710589081049, "epoch": 1.6109452736318408, "step": 810 }, { "loss": 0.7747976303100585, "grad_norm": 1.929076910018921, "learning_rate": 0.00019313077664862092, "entropy": 0.73126558996737, "num_tokens": 6739669.0, "mean_token_accuracy": 0.7895058654248714, "epoch": 1.6308457711442785, "step": 820 }, { "loss": 0.6981019020080567, "grad_norm": 1.6692851781845093, "learning_rate": 0.00019288927751458766, "entropy": 0.7332248043268919, "num_tokens": 6819838.0, "mean_token_accuracy": 0.8055072821676731, "epoch": 1.6507462686567163, "step": 830 }, { "loss": 0.7524178504943848, "grad_norm": 1.5395867824554443, "learning_rate": 0.0001926437625861068, "entropy": 0.712925647944212, "num_tokens": 6901777.0, "mean_token_accuracy": 0.7908283203840256, "epoch": 1.6706467661691542, "step": 840 }, { "loss": 0.7306118488311768, "grad_norm": 1.6641769409179688, "learning_rate": 0.00019239424247729345, "entropy": 0.7585150092840195, "num_tokens": 6983222.0, "mean_token_accuracy": 0.7910356394946575, "epoch": 1.6905472636815921, "step": 850 }, { "loss": 0.752435302734375, "grad_norm": 1.9537489414215088, "learning_rate": 0.0001921407279754149, "entropy": 0.7012663371860981, "num_tokens": 7067291.0, "mean_token_accuracy": 0.8054570883512497, "epoch": 1.7104477611940299, "step": 860 }, { "loss": 0.6932102680206299, "grad_norm": 1.8359386920928955, "learning_rate": 0.00019188323004042435, "entropy": 0.7264402851462364, "num_tokens": 7150268.0, "mean_token_accuracy": 0.802193396538496, "epoch": 1.7303482587064676, "step": 870 }, { "loss": 0.7538199424743652, "grad_norm": 1.9146333932876587, "learning_rate": 0.00019162175980448688, "entropy": 0.6838662784546614, "num_tokens": 7231091.0, "mean_token_accuracy": 0.796929395198822, "epoch": 1.7502487562189055, "step": 880 }, { "loss": 0.7104074954986572, "grad_norm": 2.0510952472686768, "learning_rate": 0.0001913563285714984, "entropy": 0.7262898899614811, "num_tokens": 7313340.0, "mean_token_accuracy": 0.8008449010550975, "epoch": 1.7701492537313432, "step": 890 }, { "loss": 0.8105827331542969, "grad_norm": 2.0180599689483643, "learning_rate": 0.0001910869478165969, "entropy": 0.7481670882552862, "num_tokens": 7393519.0, "mean_token_accuracy": 0.7843330048024655, "epoch": 1.7900497512437812, "step": 900 }, { "loss": 0.7446431636810302, "grad_norm": 1.646704912185669, "learning_rate": 0.00019081362918566618, "entropy": 0.7768452275544405, "num_tokens": 7475016.0, "mean_token_accuracy": 0.8008080549538136, "epoch": 1.809950248756219, "step": 910 }, { "loss": 0.7266605854034424, "grad_norm": 1.638253092765808, "learning_rate": 0.00019053638449483259, "entropy": 0.683229249343276, "num_tokens": 7559243.0, "mean_token_accuracy": 0.7936579927802085, "epoch": 1.8298507462686566, "step": 920 }, { "loss": 0.738245677947998, "grad_norm": 1.6552717685699463, "learning_rate": 0.0001902552257299542, "entropy": 0.7504678606987, "num_tokens": 7643029.0, "mean_token_accuracy": 0.7894984453916549, "epoch": 1.8497512437810946, "step": 930 }, { "loss": 0.7275553226470948, "grad_norm": 1.4619513750076294, "learning_rate": 0.00018997016504610246, "entropy": 0.7069665104150772, "num_tokens": 7726479.0, "mean_token_accuracy": 0.8092396840453148, "epoch": 1.8696517412935323, "step": 940 }, { "loss": 0.6958948612213135, "grad_norm": 1.6785398721694946, "learning_rate": 0.00018968121476703678, "entropy": 0.6909922767430544, "num_tokens": 7808235.0, "mean_token_accuracy": 0.8184511929750442, "epoch": 1.8895522388059702, "step": 950 }, { "loss": 0.7307656288146973, "grad_norm": 1.8156358003616333, "learning_rate": 0.00018938838738467184, "entropy": 0.7206986505538225, "num_tokens": 7888802.0, "mean_token_accuracy": 0.795404677093029, "epoch": 1.909452736318408, "step": 960 }, { "loss": 0.6951888084411622, "grad_norm": 1.9570693969726562, "learning_rate": 0.00018909169555853743, "entropy": 0.7154657423496247, "num_tokens": 7970204.0, "mean_token_accuracy": 0.7979383312165738, "epoch": 1.9293532338308457, "step": 970 }, { "loss": 0.6544716358184814, "grad_norm": 1.5071886777877808, "learning_rate": 0.00018879115211523117, "entropy": 0.6446726582944393, "num_tokens": 8053307.0, "mean_token_accuracy": 0.8045676186680794, "epoch": 1.9492537313432836, "step": 980 }, { "loss": 0.7055366516113282, "grad_norm": 1.4266027212142944, "learning_rate": 0.0001884867700478641, "entropy": 0.699823185056448, "num_tokens": 8135193.0, "mean_token_accuracy": 0.7992964766919612, "epoch": 1.9691542288557216, "step": 990 }, { "loss": 0.7184643268585205, "grad_norm": 2.0378243923187256, "learning_rate": 0.00018817856251549867, "entropy": 0.7140736062079668, "num_tokens": 8219594.0, "mean_token_accuracy": 0.7989312529563903, "epoch": 1.9890547263681593, "step": 1000 }, { "eval_loss": 1.0154445171356201, "eval_runtime": 88.2, "eval_samples_per_second": 11.735, "eval_steps_per_second": 5.873, "eval_entropy": 0.8002531397008988, "eval_num_tokens": 8265312.0, "eval_mean_token_accuracy": 0.7423216365709268, "epoch": 2.0, "step": 1006 }, { "loss": 0.6638185501098632, "grad_norm": 1.6040326356887817, "learning_rate": 0.00018786654284258034, "entropy": 0.7038449613671554, "num_tokens": 8297623.0, "mean_token_accuracy": 0.8091712115626586, "epoch": 2.007960199004975, "step": 1010 }, { "loss": 0.5153174877166748, "grad_norm": 2.1827661991119385, "learning_rate": 0.00018755072451836097, "entropy": 0.5252644840627909, "num_tokens": 8379050.0, "mean_token_accuracy": 0.8446948520839215, "epoch": 2.027860696517413, "step": 1020 }, { "loss": 0.5017234325408936, "grad_norm": 1.8835452795028687, "learning_rate": 0.00018723112119631608, "entropy": 0.5121854435652494, "num_tokens": 8462847.0, "mean_token_accuracy": 0.8539764225482941, "epoch": 2.047761194029851, "step": 1030 }, { "loss": 0.5333661079406739, "grad_norm": 1.6592763662338257, "learning_rate": 0.00018690774669355442, "entropy": 0.5651770515367389, "num_tokens": 8542681.0, "mean_token_accuracy": 0.8419696733355522, "epoch": 2.0676616915422885, "step": 1040 }, { "loss": 0.4740941047668457, "grad_norm": 1.8748646974563599, "learning_rate": 0.00018658061499022055, "entropy": 0.47107693143188956, "num_tokens": 8627432.0, "mean_token_accuracy": 0.8567564368247986, "epoch": 2.0875621890547262, "step": 1050 }, { "loss": 0.48979806900024414, "grad_norm": 2.027717351913452, "learning_rate": 0.0001862497402288906, "entropy": 0.49270418751984835, "num_tokens": 8708822.0, "mean_token_accuracy": 0.8501696541905404, "epoch": 2.107462686567164, "step": 1060 }, { "loss": 0.4521069049835205, "grad_norm": 1.8452632427215576, "learning_rate": 0.0001859151367139608, "entropy": 0.4634111661463976, "num_tokens": 8789791.0, "mean_token_accuracy": 0.8683336563408375, "epoch": 2.127363184079602, "step": 1070 }, { "loss": 0.5178594589233398, "grad_norm": 1.9295680522918701, "learning_rate": 0.000185576818911029, "entropy": 0.46942942440509794, "num_tokens": 8870514.0, "mean_token_accuracy": 0.8462874710559845, "epoch": 2.14726368159204, "step": 1080 }, { "loss": 0.5196755409240723, "grad_norm": 1.6308494806289673, "learning_rate": 0.00018523480144626948, "entropy": 0.5393101962283253, "num_tokens": 8952466.0, "mean_token_accuracy": 0.8491615362465381, "epoch": 2.1671641791044776, "step": 1090 }, { "loss": 0.507460069656372, "grad_norm": 1.9126944541931152, "learning_rate": 0.00018488909910580037, "entropy": 0.491584631241858, "num_tokens": 9034965.0, "mean_token_accuracy": 0.8491294652223587, "epoch": 2.1870646766169153, "step": 1100 }, { "loss": 0.5434001445770263, "grad_norm": 2.245730400085449, "learning_rate": 0.00018453972683504466, "entropy": 0.5460982380434871, "num_tokens": 9117636.0, "mean_token_accuracy": 0.8417311415076256, "epoch": 2.206965174129353, "step": 1110 }, { "loss": 0.5176630973815918, "grad_norm": 1.7490206956863403, "learning_rate": 0.00018418669973808386, "entropy": 0.5413472417742013, "num_tokens": 9203719.0, "mean_token_accuracy": 0.8437662713229657, "epoch": 2.226865671641791, "step": 1120 }, { "loss": 0.4966591358184814, "grad_norm": 2.32169246673584, "learning_rate": 0.00018383003307700525, "entropy": 0.5068975739181042, "num_tokens": 9285285.0, "mean_token_accuracy": 0.8558630302548409, "epoch": 2.246766169154229, "step": 1130 }, { "loss": 0.4562082290649414, "grad_norm": 2.121119499206543, "learning_rate": 0.0001834697422712419, "entropy": 0.472692010179162, "num_tokens": 9368724.0, "mean_token_accuracy": 0.861832109093666, "epoch": 2.2666666666666666, "step": 1140 }, { "loss": 0.5065945148468017, "grad_norm": 2.003596305847168, "learning_rate": 0.00018310584289690608, "entropy": 0.48463920764625074, "num_tokens": 9450345.0, "mean_token_accuracy": 0.8411129087209701, "epoch": 2.2865671641791043, "step": 1150 }, { "loss": 0.5093509674072265, "grad_norm": 1.9170504808425903, "learning_rate": 0.0001827383506861159, "entropy": 0.5297361209988594, "num_tokens": 9531914.0, "mean_token_accuracy": 0.8439007833600044, "epoch": 2.306467661691542, "step": 1160 }, { "loss": 0.5065027236938476, "grad_norm": 1.8182140588760376, "learning_rate": 0.00018236728152631526, "entropy": 0.508120141364634, "num_tokens": 9613824.0, "mean_token_accuracy": 0.8519511334598064, "epoch": 2.32636815920398, "step": 1170 }, { "loss": 0.5736330032348633, "grad_norm": 1.6451319456100464, "learning_rate": 0.00018199265145958678, "entropy": 0.5490097716450691, "num_tokens": 9696070.0, "mean_token_accuracy": 0.8286732420325279, "epoch": 2.346268656716418, "step": 1180 }, { "loss": 0.5310076236724853, "grad_norm": 1.8924293518066406, "learning_rate": 0.00018161447668195858, "entropy": 0.5155842589214444, "num_tokens": 9777568.0, "mean_token_accuracy": 0.8431366585195065, "epoch": 2.3661691542288557, "step": 1190 }, { "loss": 0.46693716049194334, "grad_norm": 1.9782637357711792, "learning_rate": 0.00018123277354270372, "entropy": 0.4998965173959732, "num_tokens": 9858081.0, "mean_token_accuracy": 0.8578181132674217, "epoch": 2.3860696517412934, "step": 1200 }, { "loss": 0.5384686946868896, "grad_norm": 1.8333914279937744, "learning_rate": 0.00018084755854363377, "entropy": 0.5187313890084624, "num_tokens": 9940187.0, "mean_token_accuracy": 0.8451795615255833, "epoch": 2.405970149253731, "step": 1210 }, { "loss": 0.5079335689544677, "grad_norm": 2.00839900970459, "learning_rate": 0.00018045884833838512, "entropy": 0.5085030103102326, "num_tokens": 10018432.0, "mean_token_accuracy": 0.8514300569891929, "epoch": 2.4258706467661693, "step": 1220 }, { "loss": 0.5386298179626465, "grad_norm": 1.9003617763519287, "learning_rate": 0.00018006665973169911, "entropy": 0.5382265558466315, "num_tokens": 10100137.0, "mean_token_accuracy": 0.8454402416944504, "epoch": 2.445771144278607, "step": 1230 }, { "loss": 0.5553887367248536, "grad_norm": 2.1470773220062256, "learning_rate": 0.0001796710096786956, "entropy": 0.5438722034916281, "num_tokens": 10184025.0, "mean_token_accuracy": 0.8391343042254448, "epoch": 2.4656716417910447, "step": 1240 }, { "loss": 0.5232258319854737, "grad_norm": 1.992197036743164, "learning_rate": 0.0001792719152841398, "entropy": 0.5251597924157977, "num_tokens": 10268664.0, "mean_token_accuracy": 0.8480332940816879, "epoch": 2.4855721393034824, "step": 1250 }, { "loss": 0.5130891799926758, "grad_norm": 1.6610969305038452, "learning_rate": 0.0001788693938017029, "entropy": 0.5361188564449548, "num_tokens": 10349492.0, "mean_token_accuracy": 0.8441365607082844, "epoch": 2.50547263681592, "step": 1260 }, { "loss": 0.5028162956237793, "grad_norm": 2.0173373222351074, "learning_rate": 0.00017846346263321623, "entropy": 0.4794240856543183, "num_tokens": 10432597.0, "mean_token_accuracy": 0.84928208142519, "epoch": 2.5253731343283583, "step": 1270 }, { "loss": 0.5137399673461914, "grad_norm": 2.124582290649414, "learning_rate": 0.00017805413932791875, "entropy": 0.5074908941984176, "num_tokens": 10513192.0, "mean_token_accuracy": 0.8484948351979256, "epoch": 2.545273631840796, "step": 1280 }, { "loss": 0.5218567848205566, "grad_norm": 1.7741371393203735, "learning_rate": 0.00017764144158169856, "entropy": 0.5202818088233471, "num_tokens": 10597049.0, "mean_token_accuracy": 0.8525593280792236, "epoch": 2.5651741293532337, "step": 1290 }, { "loss": 0.5342438697814942, "grad_norm": 2.03674054145813, "learning_rate": 0.00017722538723632773, "entropy": 0.5169114828109741, "num_tokens": 10679839.0, "mean_token_accuracy": 0.8379098229110241, "epoch": 2.585074626865672, "step": 1300 }, { "loss": 0.5268249988555909, "grad_norm": 1.7481690645217896, "learning_rate": 0.000176805994278691, "entropy": 0.527920619212091, "num_tokens": 10763374.0, "mean_token_accuracy": 0.8468565516173839, "epoch": 2.604975124378109, "step": 1310 }, { "loss": 0.5637305736541748, "grad_norm": 2.044337511062622, "learning_rate": 0.0001763832808400082, "entropy": 0.5612680882215499, "num_tokens": 10846467.0, "mean_token_accuracy": 0.8389740340411663, "epoch": 2.6248756218905474, "step": 1320 }, { "loss": 0.5200609683990478, "grad_norm": 1.5558581352233887, "learning_rate": 0.00017595726519505043, "entropy": 0.526572679169476, "num_tokens": 10929729.0, "mean_token_accuracy": 0.848398495465517, "epoch": 2.644776119402985, "step": 1330 }, { "loss": 0.5190268993377686, "grad_norm": 2.233233690261841, "learning_rate": 0.00017552796576134985, "entropy": 0.5076324449852109, "num_tokens": 11012769.0, "mean_token_accuracy": 0.841417095810175, "epoch": 2.664676616915423, "step": 1340 }, { "loss": 0.547359848022461, "grad_norm": 1.8738890886306763, "learning_rate": 0.00017509540109840365, "entropy": 0.5502721823751926, "num_tokens": 11094716.0, "mean_token_accuracy": 0.8380319178104401, "epoch": 2.684577114427861, "step": 1350 }, { "loss": 0.5218305110931396, "grad_norm": 1.8149367570877075, "learning_rate": 0.00017465958990687156, "entropy": 0.5275072449818253, "num_tokens": 11175013.0, "mean_token_accuracy": 0.8568139627575875, "epoch": 2.7044776119402982, "step": 1360 }, { "loss": 0.5018157482147216, "grad_norm": 1.698498010635376, "learning_rate": 0.0001742205510277674, "entropy": 0.5119684131816029, "num_tokens": 11256288.0, "mean_token_accuracy": 0.8495248600840568, "epoch": 2.7243781094527364, "step": 1370 }, { "loss": 0.5008152484893799, "grad_norm": 1.837099552154541, "learning_rate": 0.00017377830344164464, "entropy": 0.5109101135283709, "num_tokens": 11338498.0, "mean_token_accuracy": 0.8569738574326038, "epoch": 2.744278606965174, "step": 1380 }, { "loss": 0.5308613777160645, "grad_norm": 2.1258440017700195, "learning_rate": 0.00017333286626777564, "entropy": 0.5329740956425667, "num_tokens": 11422122.0, "mean_token_accuracy": 0.8408495858311653, "epoch": 2.764179104477612, "step": 1390 }, { "loss": 0.5461023807525635, "grad_norm": 2.0416526794433594, "learning_rate": 0.00017288425876332527, "entropy": 0.5458354912698269, "num_tokens": 11506227.0, "mean_token_accuracy": 0.8418126352131367, "epoch": 2.78407960199005, "step": 1400 }, { "loss": 0.5320337772369385, "grad_norm": 1.8857133388519287, "learning_rate": 0.00017243250032251823, "entropy": 0.5177356921136379, "num_tokens": 11586611.0, "mean_token_accuracy": 0.8437633819878101, "epoch": 2.8039800995024877, "step": 1410 }, { "loss": 0.4947951793670654, "grad_norm": 2.1604552268981934, "learning_rate": 0.00017197761047580082, "entropy": 0.5068972071632742, "num_tokens": 11670179.0, "mean_token_accuracy": 0.8533644363284111, "epoch": 2.8238805970149254, "step": 1420 }, { "loss": 0.5062966346740723, "grad_norm": 1.9001272916793823, "learning_rate": 0.00017151960888899627, "entropy": 0.491135448589921, "num_tokens": 11750106.0, "mean_token_accuracy": 0.8556574188172817, "epoch": 2.843781094527363, "step": 1430 }, { "loss": 0.48212461471557616, "grad_norm": 1.9398213624954224, "learning_rate": 0.00017105851536245492, "entropy": 0.5211849508807063, "num_tokens": 11831237.0, "mean_token_accuracy": 0.8569056294858456, "epoch": 2.863681592039801, "step": 1440 }, { "loss": 0.5234591960906982, "grad_norm": 1.8992606401443481, "learning_rate": 0.0001705943498301979, "entropy": 0.4800686825066805, "num_tokens": 11915761.0, "mean_token_accuracy": 0.8473109625279903, "epoch": 2.883582089552239, "step": 1450 }, { "loss": 0.5000662803649902, "grad_norm": 1.7360588312149048, "learning_rate": 0.00017012713235905547, "entropy": 0.5110673246905207, "num_tokens": 11996666.0, "mean_token_accuracy": 0.8583845689892768, "epoch": 2.9034825870646768, "step": 1460 }, { "loss": 0.5083964824676513, "grad_norm": 2.0405280590057373, "learning_rate": 0.00016965688314779956, "entropy": 0.49351408518850803, "num_tokens": 12082260.0, "mean_token_accuracy": 0.8502242051064968, "epoch": 2.9233830845771145, "step": 1470 }, { "loss": 0.5238072872161865, "grad_norm": 1.9192203283309937, "learning_rate": 0.00016918362252627036, "entropy": 0.5278301501646638, "num_tokens": 12160973.0, "mean_token_accuracy": 0.8439404472708703, "epoch": 2.943283582089552, "step": 1480 }, { "loss": 0.5171586036682129, "grad_norm": 1.6478546857833862, "learning_rate": 0.00016870737095449754, "entropy": 0.5115002764388918, "num_tokens": 12244781.0, "mean_token_accuracy": 0.8549239777028561, "epoch": 2.96318407960199, "step": 1490 }, { "loss": 0.4724470615386963, "grad_norm": 2.152078866958618, "learning_rate": 0.00016822814902181583, "entropy": 0.4658357990905643, "num_tokens": 12328430.0, "mean_token_accuracy": 0.8588747374713421, "epoch": 2.983084577114428, "step": 1500 }, { "eval_loss": 1.013381004333496, "eval_runtime": 89.0725, "eval_samples_per_second": 11.62, "eval_steps_per_second": 5.815, "eval_entropy": 0.6918873670421052, "eval_num_tokens": 12397968.0, "eval_mean_token_accuracy": 0.7516806636537824, "epoch": 3.0, "step": 1509 }, { "loss": 0.524122667312622, "grad_norm": 1.2526023387908936, "learning_rate": 0.00016774597744597457, "entropy": 0.5304617995494291, "num_tokens": 12405849.0, "mean_token_accuracy": 0.841843033307477, "epoch": 3.0019900497512437, "step": 1510 }, { "loss": 0.3169110774993896, "grad_norm": 2.0134313106536865, "learning_rate": 0.00016726087707224236, "entropy": 0.37756410874426366, "num_tokens": 12487545.0, "mean_token_accuracy": 0.9008184991776943, "epoch": 3.0218905472636814, "step": 1520 }, { "loss": 0.31904311180114747, "grad_norm": 1.9329195022583008, "learning_rate": 0.00016677286887250572, "entropy": 0.31940033063292506, "num_tokens": 12569892.0, "mean_token_accuracy": 0.8977621793746948, "epoch": 3.0417910447761196, "step": 1530 }, { "loss": 0.31394209861755373, "grad_norm": 1.681523323059082, "learning_rate": 0.00016628197394436247, "entropy": 0.34449700023978946, "num_tokens": 12651094.0, "mean_token_accuracy": 0.9006784312427044, "epoch": 3.0616915422885573, "step": 1540 }, { "loss": 0.29366445541381836, "grad_norm": 1.9879311323165894, "learning_rate": 0.00016578821351020964, "entropy": 0.315945752710104, "num_tokens": 12732906.0, "mean_token_accuracy": 0.9038687475025654, "epoch": 3.081592039800995, "step": 1550 }, { "loss": 0.32794480323791503, "grad_norm": 1.9403680562973022, "learning_rate": 0.00016529160891632597, "entropy": 0.3383891684934497, "num_tokens": 12814067.0, "mean_token_accuracy": 0.893728756159544, "epoch": 3.1014925373134328, "step": 1560 }, { "loss": 0.3342399597167969, "grad_norm": 1.9990283250808716, "learning_rate": 0.00016479218163194904, "entropy": 0.33618702124804256, "num_tokens": 12895605.0, "mean_token_accuracy": 0.8921422258019447, "epoch": 3.1213930348258705, "step": 1570 }, { "loss": 0.32936697006225585, "grad_norm": 1.9695919752120972, "learning_rate": 0.00016428995324834723, "entropy": 0.3401200842112303, "num_tokens": 12979094.0, "mean_token_accuracy": 0.9001650154590607, "epoch": 3.1412935323383087, "step": 1580 }, { "loss": 0.30141172409057615, "grad_norm": 1.8548579216003418, "learning_rate": 0.00016378494547788613, "entropy": 0.3256719596683979, "num_tokens": 13061107.0, "mean_token_accuracy": 0.9027377247810364, "epoch": 3.1611940298507464, "step": 1590 }, { "loss": 0.33073742389678956, "grad_norm": 2.56424617767334, "learning_rate": 0.00016327718015308998, "entropy": 0.33555619083344934, "num_tokens": 13143766.0, "mean_token_accuracy": 0.8924005568027497, "epoch": 3.181094527363184, "step": 1600 }, { "loss": 0.3116974592208862, "grad_norm": 1.8065255880355835, "learning_rate": 0.0001627666792256977, "entropy": 0.3388229014351964, "num_tokens": 13228296.0, "mean_token_accuracy": 0.9034810848534107, "epoch": 3.200995024875622, "step": 1610 }, { "loss": 0.35255770683288573, "grad_norm": 2.3625452518463135, "learning_rate": 0.00016225346476571396, "entropy": 0.35893154982477427, "num_tokens": 13310326.0, "mean_token_accuracy": 0.8877448745071888, "epoch": 3.2208955223880595, "step": 1620 }, { "loss": 0.35570693016052246, "grad_norm": 2.29675030708313, "learning_rate": 0.00016173755896045506, "entropy": 0.3679086913354695, "num_tokens": 13391862.0, "mean_token_accuracy": 0.8964587457478046, "epoch": 3.2407960199004977, "step": 1630 }, { "loss": 0.35628087520599366, "grad_norm": 1.8130031824111938, "learning_rate": 0.00016121898411358966, "entropy": 0.36298612505197525, "num_tokens": 13476890.0, "mean_token_accuracy": 0.8880530841648578, "epoch": 3.2606965174129354, "step": 1640 }, { "loss": 0.3256735324859619, "grad_norm": 1.7297886610031128, "learning_rate": 0.00016069776264417463, "entropy": 0.3571936976164579, "num_tokens": 13560962.0, "mean_token_accuracy": 0.8932363368570805, "epoch": 3.280597014925373, "step": 1650 }, { "loss": 0.3441990852355957, "grad_norm": 2.114352226257324, "learning_rate": 0.00016017391708568563, "entropy": 0.33980772607028487, "num_tokens": 13642374.0, "mean_token_accuracy": 0.8990235075354576, "epoch": 3.300497512437811, "step": 1660 }, { "loss": 0.3780921697616577, "grad_norm": 2.2089595794677734, "learning_rate": 0.00015964747008504325, "entropy": 0.3775214830413461, "num_tokens": 13724787.0, "mean_token_accuracy": 0.8860153228044509, "epoch": 3.3203980099502486, "step": 1670 }, { "loss": 0.35315823554992676, "grad_norm": 1.8260467052459717, "learning_rate": 0.00015911844440163371, "entropy": 0.37848529405891895, "num_tokens": 13804379.0, "mean_token_accuracy": 0.8853729166090488, "epoch": 3.3402985074626868, "step": 1680 }, { "loss": 0.3457970142364502, "grad_norm": 2.5162901878356934, "learning_rate": 0.00015858686290632493, "entropy": 0.35254298616200686, "num_tokens": 13883828.0, "mean_token_accuracy": 0.8893432796001435, "epoch": 3.3601990049751245, "step": 1690 }, { "loss": 0.3127096176147461, "grad_norm": 2.613616466522217, "learning_rate": 0.0001580527485804779, "entropy": 0.3147669959813356, "num_tokens": 13965784.0, "mean_token_accuracy": 0.903999711573124, "epoch": 3.380099502487562, "step": 1700 }, { "loss": 0.338837718963623, "grad_norm": 1.8569570779800415, "learning_rate": 0.00015751612451495313, "entropy": 0.345753663033247, "num_tokens": 14048546.0, "mean_token_accuracy": 0.896949079632759, "epoch": 3.4, "step": 1710 }, { "loss": 0.3418254852294922, "grad_norm": 1.975127100944519, "learning_rate": 0.00015697701390911218, "entropy": 0.3369439946487546, "num_tokens": 14130348.0, "mean_token_accuracy": 0.8862252190709115, "epoch": 3.4199004975124376, "step": 1720 }, { "loss": 0.36044361591339114, "grad_norm": 1.8558331727981567, "learning_rate": 0.00015643544006981505, "entropy": 0.3699260259047151, "num_tokens": 14209009.0, "mean_token_accuracy": 0.8909381292760372, "epoch": 3.439800995024876, "step": 1730 }, { "loss": 0.31586222648620604, "grad_norm": 1.7793047428131104, "learning_rate": 0.0001558914264104122, "entropy": 0.3264750910922885, "num_tokens": 14289936.0, "mean_token_accuracy": 0.8986882567405701, "epoch": 3.4597014925373135, "step": 1740 }, { "loss": 0.3266884803771973, "grad_norm": 1.7176367044448853, "learning_rate": 0.00015534499644973267, "entropy": 0.3284300332888961, "num_tokens": 14372769.0, "mean_token_accuracy": 0.8963496647775173, "epoch": 3.4796019900497512, "step": 1750 }, { "loss": 0.31137449741363527, "grad_norm": 2.04630184173584, "learning_rate": 0.00015479617381106711, "entropy": 0.34350175261497495, "num_tokens": 14456141.0, "mean_token_accuracy": 0.9009241946041584, "epoch": 3.499502487562189, "step": 1760 }, { "loss": 0.3356631755828857, "grad_norm": 1.8468575477600098, "learning_rate": 0.00015424498222114662, "entropy": 0.3304918609559536, "num_tokens": 14540151.0, "mean_token_accuracy": 0.8924445942044258, "epoch": 3.5194029850746267, "step": 1770 }, { "loss": 0.3501142501831055, "grad_norm": 1.9734855890274048, "learning_rate": 0.00015369144550911678, "entropy": 0.36590540781617165, "num_tokens": 14624972.0, "mean_token_accuracy": 0.88669129088521, "epoch": 3.539303482587065, "step": 1780 }, { "loss": 0.3299347639083862, "grad_norm": 2.0176360607147217, "learning_rate": 0.0001531355876055078, "entropy": 0.33581888526678083, "num_tokens": 14707098.0, "mean_token_accuracy": 0.8888270042836666, "epoch": 3.5592039800995026, "step": 1790 }, { "loss": 0.3689806222915649, "grad_norm": 2.206531047821045, "learning_rate": 0.00015257743254119973, "entropy": 0.3515732469037175, "num_tokens": 14789628.0, "mean_token_accuracy": 0.8852153360843659, "epoch": 3.5791044776119403, "step": 1800 }, { "loss": 0.32832067012786864, "grad_norm": 1.6956323385238647, "learning_rate": 0.00015201700444638348, "entropy": 0.35302160643041136, "num_tokens": 14870207.0, "mean_token_accuracy": 0.8937827706336975, "epoch": 3.599004975124378, "step": 1810 }, { "loss": 0.37772986888885496, "grad_norm": 1.7329686880111694, "learning_rate": 0.00015145432754951784, "entropy": 0.3665313167497516, "num_tokens": 14952333.0, "mean_token_accuracy": 0.8815502606332302, "epoch": 3.6189054726368157, "step": 1820 }, { "loss": 0.3516186237335205, "grad_norm": 1.77907133102417, "learning_rate": 0.000150889426176282, "entropy": 0.3640569668263197, "num_tokens": 15033429.0, "mean_token_accuracy": 0.8912140592932701, "epoch": 3.638805970149254, "step": 1830 }, { "loss": 0.37269628047943115, "grad_norm": 1.7633020877838135, "learning_rate": 0.00015032232474852371, "entropy": 0.3742990693077445, "num_tokens": 15113657.0, "mean_token_accuracy": 0.8849355317652225, "epoch": 3.6587064676616916, "step": 1840 }, { "loss": 0.3090696096420288, "grad_norm": 1.9857285022735596, "learning_rate": 0.00014975304778320364, "entropy": 0.3482851915061474, "num_tokens": 15197089.0, "mean_token_accuracy": 0.9004555702209472, "epoch": 3.6786069651741293, "step": 1850 }, { "loss": 0.36194648742675783, "grad_norm": 2.1343369483947754, "learning_rate": 0.00014918161989133552, "entropy": 0.3528735195286572, "num_tokens": 15283755.0, "mean_token_accuracy": 0.8829138934612274, "epoch": 3.698507462686567, "step": 1860 }, { "loss": 0.3398463010787964, "grad_norm": 1.8817847967147827, "learning_rate": 0.0001486080657769219, "entropy": 0.3488534286618233, "num_tokens": 15367535.0, "mean_token_accuracy": 0.896855903416872, "epoch": 3.7184079601990048, "step": 1870 }, { "loss": 0.37033088207244874, "grad_norm": 1.852171778678894, "learning_rate": 0.00014803241023588637, "entropy": 0.3992158595472574, "num_tokens": 15449277.0, "mean_token_accuracy": 0.8842400945723057, "epoch": 3.738308457711443, "step": 1880 }, { "loss": 0.3576947212219238, "grad_norm": 1.7177051305770874, "learning_rate": 0.00014745467815500157, "entropy": 0.37072331327944996, "num_tokens": 15529651.0, "mean_token_accuracy": 0.8907733589410782, "epoch": 3.7582089552238807, "step": 1890 }, { "loss": 0.3160592794418335, "grad_norm": 2.013315200805664, "learning_rate": 0.0001468748945108131, "entropy": 0.3132282990962267, "num_tokens": 15612895.0, "mean_token_accuracy": 0.8976165451109409, "epoch": 3.7781094527363184, "step": 1900 }, { "loss": 0.32902114391326903, "grad_norm": 1.553937554359436, "learning_rate": 0.00014629308436856, "entropy": 0.3400567851960659, "num_tokens": 15695353.0, "mean_token_accuracy": 0.8929221451282501, "epoch": 3.798009950248756, "step": 1910 }, { "loss": 0.38461942672729493, "grad_norm": 2.164433717727661, "learning_rate": 0.0001457092728810909, "entropy": 0.36988206636160614, "num_tokens": 15775948.0, "mean_token_accuracy": 0.8848864234983921, "epoch": 3.817910447761194, "step": 1920 }, { "loss": 0.36692650318145753, "grad_norm": 1.9492835998535156, "learning_rate": 0.00014512348528777675, "entropy": 0.38128890469670296, "num_tokens": 15859777.0, "mean_token_accuracy": 0.8892743974924088, "epoch": 3.837810945273632, "step": 1930 }, { "loss": 0.38012266159057617, "grad_norm": 2.2882587909698486, "learning_rate": 0.00014453574691341957, "entropy": 0.3851106442511082, "num_tokens": 15940237.0, "mean_token_accuracy": 0.8856042474508286, "epoch": 3.8577114427860697, "step": 1940 }, { "loss": 0.362756085395813, "grad_norm": 1.8618828058242798, "learning_rate": 0.00014394608316715764, "entropy": 0.3671020517125726, "num_tokens": 16024873.0, "mean_token_accuracy": 0.8824686802923679, "epoch": 3.8776119402985074, "step": 1950 }, { "loss": 0.3531129598617554, "grad_norm": 1.7716271877288818, "learning_rate": 0.00014335451954136712, "entropy": 0.36526877535507085, "num_tokens": 16107783.0, "mean_token_accuracy": 0.8884353943169117, "epoch": 3.897512437810945, "step": 1960 }, { "loss": 0.35922248363494874, "grad_norm": 1.609451174736023, "learning_rate": 0.00014276108161055977, "entropy": 0.3464937123470008, "num_tokens": 16188195.0, "mean_token_accuracy": 0.8906741172075272, "epoch": 3.917412935323383, "step": 1970 }, { "loss": 0.37455728054046633, "grad_norm": 1.922342300415039, "learning_rate": 0.00014216579503027748, "entropy": 0.3929541580379009, "num_tokens": 16270260.0, "mean_token_accuracy": 0.8852056123316288, "epoch": 3.937313432835821, "step": 1980 }, { "loss": 0.3485581636428833, "grad_norm": 2.2290749549865723, "learning_rate": 0.000141568685535983, "entropy": 0.3450996743515134, "num_tokens": 16350810.0, "mean_token_accuracy": 0.8908451579511165, "epoch": 3.9572139303482587, "step": 1990 }, { "loss": 0.3451216697692871, "grad_norm": 1.5832468271255493, "learning_rate": 0.00014096977894194741, "entropy": 0.3624888777732849, "num_tokens": 16436556.0, "mean_token_accuracy": 0.899410167336464, "epoch": 3.9771144278606965, "step": 2000 }, { "loss": 0.3591928243637085, "grad_norm": 2.0904476642608643, "learning_rate": 0.0001403691011401342, "entropy": 0.368430376984179, "num_tokens": 16518893.0, "mean_token_accuracy": 0.8849965989589691, "epoch": 3.997014925373134, "step": 2010 }, { "eval_loss": 1.1314672231674194, "eval_runtime": 88.5632, "eval_samples_per_second": 11.687, "eval_steps_per_second": 5.849, "eval_entropy": 0.47168861136818485, "eval_num_tokens": 16530624.0, "eval_mean_token_accuracy": 0.7530034936417944, "epoch": 4.0, "step": 2012 }, { "loss": 0.23610332012176513, "grad_norm": 1.5669670104980469, "learning_rate": 0.00013976667809907967, "entropy": 0.2812192935104433, "num_tokens": 16594663.0, "mean_token_accuracy": 0.9318282988510633, "epoch": 4.01592039800995, "step": 2020 }, { "loss": 0.19126780033111573, "grad_norm": 1.8125327825546265, "learning_rate": 0.00013916253586277046, "entropy": 0.2425563176162541, "num_tokens": 16677999.0, "mean_token_accuracy": 0.9397158071398735, "epoch": 4.035820895522388, "step": 2030 }, { "loss": 0.18233511447906495, "grad_norm": 1.2361959218978882, "learning_rate": 0.00013855670054951764, "entropy": 0.21818739883601665, "num_tokens": 16762226.0, "mean_token_accuracy": 0.9379066251218319, "epoch": 4.055721393034826, "step": 2040 }, { "loss": 0.1836015224456787, "grad_norm": 1.4206912517547607, "learning_rate": 0.00013794919835082733, "entropy": 0.21597656197845935, "num_tokens": 16843862.0, "mean_token_accuracy": 0.9375724367797375, "epoch": 4.075621890547263, "step": 2050 }, { "loss": 0.21675570011138917, "grad_norm": 1.6368014812469482, "learning_rate": 0.00013734005553026863, "entropy": 0.24125779159367083, "num_tokens": 16927499.0, "mean_token_accuracy": 0.9257908374071121, "epoch": 4.095522388059702, "step": 2060 }, { "loss": 0.2040395975112915, "grad_norm": 1.9235601425170898, "learning_rate": 0.00013672929842233807, "entropy": 0.24503452610224485, "num_tokens": 17009422.0, "mean_token_accuracy": 0.93132429048419, "epoch": 4.115422885572139, "step": 2070 }, { "loss": 0.21393344402313233, "grad_norm": 1.7291146516799927, "learning_rate": 0.00013611695343132118, "entropy": 0.23869293741881847, "num_tokens": 17091305.0, "mean_token_accuracy": 0.9325790904462338, "epoch": 4.135323383084577, "step": 2080 }, { "loss": 0.21835823059082032, "grad_norm": 1.7889643907546997, "learning_rate": 0.00013550304703015083, "entropy": 0.25416098097339274, "num_tokens": 17173267.0, "mean_token_accuracy": 0.9285577841103076, "epoch": 4.155223880597015, "step": 2090 }, { "loss": 0.21137917041778564, "grad_norm": 2.037461757659912, "learning_rate": 0.000134887605759263, "entropy": 0.24891419094055892, "num_tokens": 17256705.0, "mean_token_accuracy": 0.931586105376482, "epoch": 4.1751243781094525, "step": 2100 }, { "loss": 0.20982325077056885, "grad_norm": 1.7877676486968994, "learning_rate": 0.00013427065622544914, "entropy": 0.22691308157518505, "num_tokens": 17338188.0, "mean_token_accuracy": 0.9303626663982868, "epoch": 4.195024875621891, "step": 2110 }, { "loss": 0.22454733848571778, "grad_norm": 1.761404037475586, "learning_rate": 0.0001336522251007061, "entropy": 0.24377617733553053, "num_tokens": 17418864.0, "mean_token_accuracy": 0.925045907497406, "epoch": 4.214925373134328, "step": 2120 }, { "loss": 0.20816371440887452, "grad_norm": 1.6466680765151978, "learning_rate": 0.00013303233912108283, "entropy": 0.24038536921143533, "num_tokens": 17499343.0, "mean_token_accuracy": 0.93259956240654, "epoch": 4.234825870646766, "step": 2130 }, { "loss": 0.20254700183868407, "grad_norm": 1.6878200769424438, "learning_rate": 0.00013241102508552475, "entropy": 0.2293321386910975, "num_tokens": 17582158.0, "mean_token_accuracy": 0.9291081473231315, "epoch": 4.254726368159204, "step": 2140 }, { "loss": 0.21738946437835693, "grad_norm": 1.8285473585128784, "learning_rate": 0.00013178830985471505, "entropy": 0.23572409860789775, "num_tokens": 17662645.0, "mean_token_accuracy": 0.9273534499108791, "epoch": 4.2746268656716415, "step": 2150 }, { "loss": 0.22995378971099853, "grad_norm": 2.1973538398742676, "learning_rate": 0.00013116422034991347, "entropy": 0.2525733551941812, "num_tokens": 17743786.0, "mean_token_accuracy": 0.9257130898535252, "epoch": 4.29452736318408, "step": 2160 }, { "loss": 0.19108937978744506, "grad_norm": 1.4349671602249146, "learning_rate": 0.00013053878355179244, "entropy": 0.23723841486498715, "num_tokens": 17826549.0, "mean_token_accuracy": 0.9368034176528454, "epoch": 4.314427860696517, "step": 2170 }, { "loss": 0.21866753101348876, "grad_norm": 1.8653446435928345, "learning_rate": 0.00012991202649927056, "entropy": 0.2479944357648492, "num_tokens": 17910217.0, "mean_token_accuracy": 0.928318190574646, "epoch": 4.334328358208955, "step": 2180 }, { "loss": 0.21983544826507567, "grad_norm": 1.4839264154434204, "learning_rate": 0.00012928397628834395, "entropy": 0.2442836315371096, "num_tokens": 17993954.0, "mean_token_accuracy": 0.931411312520504, "epoch": 4.354228855721393, "step": 2190 }, { "loss": 0.21417014598846434, "grad_norm": 1.8984490633010864, "learning_rate": 0.0001286546600709144, "entropy": 0.26048750150948763, "num_tokens": 18074834.0, "mean_token_accuracy": 0.9260428458452225, "epoch": 4.374129353233831, "step": 2200 }, { "loss": 0.20807394981384278, "grad_norm": 1.6519417762756348, "learning_rate": 0.00012802410505361592, "entropy": 0.2315901905298233, "num_tokens": 18157020.0, "mean_token_accuracy": 0.9260378688573837, "epoch": 4.394029850746269, "step": 2210 }, { "loss": 0.20873630046844482, "grad_norm": 1.6588348150253296, "learning_rate": 0.0001273923384966383, "entropy": 0.22860154528170823, "num_tokens": 18239163.0, "mean_token_accuracy": 0.9287099935114383, "epoch": 4.413930348258706, "step": 2220 }, { "loss": 0.20987870693206787, "grad_norm": 1.6810976266860962, "learning_rate": 0.00012675938771254872, "entropy": 0.2467828250490129, "num_tokens": 18319296.0, "mean_token_accuracy": 0.9340152963995934, "epoch": 4.433830845771144, "step": 2230 }, { "loss": 0.2371424674987793, "grad_norm": 1.9242221117019653, "learning_rate": 0.00012612528006511093, "entropy": 0.23780915308743716, "num_tokens": 18400836.0, "mean_token_accuracy": 0.9244723625481128, "epoch": 4.453731343283582, "step": 2240 }, { "loss": 0.23316283226013185, "grad_norm": 1.9295995235443115, "learning_rate": 0.0001254900429681023, "entropy": 0.2639192405156791, "num_tokens": 18481842.0, "mean_token_accuracy": 0.9205155313014984, "epoch": 4.47363184079602, "step": 2250 }, { "loss": 0.23252336978912352, "grad_norm": 2.227384090423584, "learning_rate": 0.0001248537038841285, "entropy": 0.25302106477320196, "num_tokens": 18563047.0, "mean_token_accuracy": 0.9212457716464997, "epoch": 4.493532338308458, "step": 2260 }, { "loss": 0.21879236698150634, "grad_norm": 1.714643955230713, "learning_rate": 0.0001242162903234365, "entropy": 0.24494377207010984, "num_tokens": 18645551.0, "mean_token_accuracy": 0.9271452203392982, "epoch": 4.513432835820895, "step": 2270 }, { "loss": 0.2192246913909912, "grad_norm": 1.9092953205108643, "learning_rate": 0.00012357782984272504, "entropy": 0.23652592720463872, "num_tokens": 18727345.0, "mean_token_accuracy": 0.9352771908044815, "epoch": 4.533333333333333, "step": 2280 }, { "loss": 0.21921801567077637, "grad_norm": 1.6674190759658813, "learning_rate": 0.0001229383500439534, "entropy": 0.25822186917066575, "num_tokens": 18808521.0, "mean_token_accuracy": 0.926652018725872, "epoch": 4.553233830845771, "step": 2290 }, { "loss": 0.22446150779724122, "grad_norm": 1.7135406732559204, "learning_rate": 0.00012229787857314801, "entropy": 0.2487781412899494, "num_tokens": 18893033.0, "mean_token_accuracy": 0.9268894538283348, "epoch": 4.573134328358209, "step": 2300 }, { "loss": 0.2381376266479492, "grad_norm": 1.7335484027862549, "learning_rate": 0.00012165644311920741, "entropy": 0.24882857529446484, "num_tokens": 18975174.0, "mean_token_accuracy": 0.921249159425497, "epoch": 4.593034825870647, "step": 2310 }, { "loss": 0.24528043270111083, "grad_norm": 1.5288317203521729, "learning_rate": 0.000121014071412705, "entropy": 0.2677458773367107, "num_tokens": 19055831.0, "mean_token_accuracy": 0.9206675894558429, "epoch": 4.612935323383084, "step": 2320 }, { "loss": 0.23617784976959227, "grad_norm": 1.570332646369934, "learning_rate": 0.00012037079122469044, "entropy": 0.26810272233560684, "num_tokens": 19137919.0, "mean_token_accuracy": 0.9237006165087223, "epoch": 4.632835820895522, "step": 2330 }, { "loss": 0.2327519416809082, "grad_norm": 1.6146273612976074, "learning_rate": 0.00011972663036548884, "entropy": 0.25389791969209907, "num_tokens": 19219581.0, "mean_token_accuracy": 0.9215208649635315, "epoch": 4.65273631840796, "step": 2340 }, { "loss": 0.22447736263275148, "grad_norm": 1.8854310512542725, "learning_rate": 0.0001190816166834985, "entropy": 0.2654360429383814, "num_tokens": 19303929.0, "mean_token_accuracy": 0.9278781965374947, "epoch": 4.672636815920398, "step": 2350 }, { "loss": 0.21850359439849854, "grad_norm": 1.862807035446167, "learning_rate": 0.00011843577806398705, "entropy": 0.24387211743742226, "num_tokens": 19387796.0, "mean_token_accuracy": 0.9249358050525188, "epoch": 4.692537313432836, "step": 2360 }, { "loss": 0.21842756271362304, "grad_norm": 1.6853046417236328, "learning_rate": 0.00011778914242788588, "entropy": 0.2461325339972973, "num_tokens": 19469134.0, "mean_token_accuracy": 0.9314172364771366, "epoch": 4.712437810945273, "step": 2370 }, { "loss": 0.23487024307250975, "grad_norm": 1.6848011016845703, "learning_rate": 0.00011714173773058304, "entropy": 0.2532777524553239, "num_tokens": 19551990.0, "mean_token_accuracy": 0.9258120492100715, "epoch": 4.732338308457711, "step": 2380 }, { "loss": 0.2275081157684326, "grad_norm": 1.8661749362945557, "learning_rate": 0.00011649359196071459, "entropy": 0.24442209769040346, "num_tokens": 19632037.0, "mean_token_accuracy": 0.9279134057462215, "epoch": 4.7522388059701495, "step": 2390 }, { "loss": 0.23597207069396972, "grad_norm": 1.6075812578201294, "learning_rate": 0.00011584473313895483, "entropy": 0.2620496856048703, "num_tokens": 19715489.0, "mean_token_accuracy": 0.9233741469681263, "epoch": 4.772139303482587, "step": 2400 }, { "loss": 0.23563318252563475, "grad_norm": 1.8898063898086548, "learning_rate": 0.00011519518931680463, "entropy": 0.24913959829136728, "num_tokens": 19800527.0, "mean_token_accuracy": 0.9218057818710804, "epoch": 4.792039800995025, "step": 2410 }, { "loss": 0.23714659214019776, "grad_norm": 1.7826662063598633, "learning_rate": 0.00011454498857537893, "entropy": 0.2391042524948716, "num_tokens": 19883911.0, "mean_token_accuracy": 0.9197839744389057, "epoch": 4.811940298507462, "step": 2420 }, { "loss": 0.2159576416015625, "grad_norm": 1.67578125, "learning_rate": 0.00011389415902419251, "entropy": 0.25182965537533164, "num_tokens": 19968155.0, "mean_token_accuracy": 0.922177518159151, "epoch": 4.8318407960199, "step": 2430 }, { "loss": 0.22929255962371825, "grad_norm": 1.9571832418441772, "learning_rate": 0.00011324272879994509, "entropy": 0.26527754878625276, "num_tokens": 20049798.0, "mean_token_accuracy": 0.9268258795142174, "epoch": 4.8517412935323385, "step": 2440 }, { "loss": 0.2240236520767212, "grad_norm": 1.4346449375152588, "learning_rate": 0.00011259072606530452, "entropy": 0.23304696725681423, "num_tokens": 20131529.0, "mean_token_accuracy": 0.9269200436770916, "epoch": 4.871641791044776, "step": 2450 }, { "loss": 0.23434126377105713, "grad_norm": 1.7825595140457153, "learning_rate": 0.0001119381790076896, "entropy": 0.24932249234989284, "num_tokens": 20214183.0, "mean_token_accuracy": 0.9212065361440182, "epoch": 4.891542288557214, "step": 2460 }, { "loss": 0.24337990283966066, "grad_norm": 2.058513641357422, "learning_rate": 0.00011128511583805122, "entropy": 0.2578001916408539, "num_tokens": 20297522.0, "mean_token_accuracy": 0.9210958659648896, "epoch": 4.911442786069652, "step": 2470 }, { "loss": 0.23612210750579835, "grad_norm": 1.8045240640640259, "learning_rate": 0.00011063156478965293, "entropy": 0.26722495248541234, "num_tokens": 20382566.0, "mean_token_accuracy": 0.9243033178150654, "epoch": 4.931343283582089, "step": 2480 }, { "loss": 0.2361851453781128, "grad_norm": 2.051356792449951, "learning_rate": 0.00010997755411685022, "entropy": 0.2558716372586787, "num_tokens": 20463700.0, "mean_token_accuracy": 0.9235666677355766, "epoch": 4.951243781094528, "step": 2490 }, { "loss": 0.22444696426391603, "grad_norm": 1.8039820194244385, "learning_rate": 0.0001093231120938692, "entropy": 0.25451266625896096, "num_tokens": 20544398.0, "mean_token_accuracy": 0.9238814383745193, "epoch": 4.971144278606965, "step": 2500 }, { "loss": 0.22053093910217286, "grad_norm": 1.730843186378479, "learning_rate": 0.000108668267013584, "entropy": 0.23836419014260174, "num_tokens": 20627521.0, "mean_token_accuracy": 0.9234050408005714, "epoch": 4.991044776119403, "step": 2510 }, { "eval_loss": 1.2360295057296753, "eval_runtime": 88.484, "eval_samples_per_second": 11.697, "eval_steps_per_second": 5.854, "eval_entropy": 0.3996568917365148, "eval_num_tokens": 20663280.0, "eval_mean_token_accuracy": 0.7523371222856883, "epoch": 5.0, "step": 2515 }, { "loss": 0.17534947395324707, "grad_norm": 1.2422212362289429, "learning_rate": 0.0001080130471862938, "entropy": 0.22914624449453855, "num_tokens": 20704454.0, "mean_token_accuracy": 0.9460896575137189, "epoch": 5.009950248756219, "step": 2520 }, { "loss": 0.13762762546539306, "grad_norm": 1.7252610921859741, "learning_rate": 0.00010735748093849889, "entropy": 0.1832891060039401, "num_tokens": 20787381.0, "mean_token_accuracy": 0.950270488858223, "epoch": 5.029850746268656, "step": 2530 }, { "loss": 0.12815582752227783, "grad_norm": 1.141512393951416, "learning_rate": 0.000106701596611676, "entropy": 0.17471029767766594, "num_tokens": 20865490.0, "mean_token_accuracy": 0.9606716863811016, "epoch": 5.0497512437810945, "step": 2540 }, { "loss": 0.12197397947311402, "grad_norm": 1.4147164821624756, "learning_rate": 0.00010604542256105308, "entropy": 0.1596170690841973, "num_tokens": 20950468.0, "mean_token_accuracy": 0.9579751871526241, "epoch": 5.069651741293533, "step": 2550 }, { "loss": 0.12484253644943237, "grad_norm": 1.597422480583191, "learning_rate": 0.00010538898715438345, "entropy": 0.16889475984498858, "num_tokens": 21034447.0, "mean_token_accuracy": 0.9622776135802269, "epoch": 5.08955223880597, "step": 2560 }, { "loss": 0.13227113485336303, "grad_norm": 1.4799704551696777, "learning_rate": 0.00010473231877071933, "entropy": 0.18726657945662736, "num_tokens": 21116879.0, "mean_token_accuracy": 0.9566851153969764, "epoch": 5.109452736318408, "step": 2570 }, { "loss": 0.13044761419296264, "grad_norm": 1.5792561769485474, "learning_rate": 0.00010407544579918509, "entropy": 0.1735865803901106, "num_tokens": 21196772.0, "mean_token_accuracy": 0.9568023070693016, "epoch": 5.129353233830845, "step": 2580 }, { "loss": 0.13447166681289674, "grad_norm": 1.6878907680511475, "learning_rate": 0.00010341839663774986, "entropy": 0.1790808086283505, "num_tokens": 21279157.0, "mean_token_accuracy": 0.957117061316967, "epoch": 5.149253731343284, "step": 2590 }, { "loss": 0.14305230379104614, "grad_norm": 1.554625153541565, "learning_rate": 0.00010276119969199973, "entropy": 0.16902345772832633, "num_tokens": 21360919.0, "mean_token_accuracy": 0.9540403395891189, "epoch": 5.169154228855722, "step": 2600 }, { "loss": 0.14377222061157227, "grad_norm": 1.1937791109085083, "learning_rate": 0.00010210388337390986, "entropy": 0.17945182584226133, "num_tokens": 21442198.0, "mean_token_accuracy": 0.95441407635808, "epoch": 5.189054726368159, "step": 2610 }, { "loss": 0.14531824588775635, "grad_norm": 1.5391591787338257, "learning_rate": 0.00010144647610061617, "entropy": 0.16971054766327143, "num_tokens": 21524694.0, "mean_token_accuracy": 0.9517566092312336, "epoch": 5.208955223880597, "step": 2620 }, { "loss": 0.13437284231185914, "grad_norm": 1.4127544164657593, "learning_rate": 0.00010078900629318666, "entropy": 0.16742002535611392, "num_tokens": 21610173.0, "mean_token_accuracy": 0.9551968172192573, "epoch": 5.2288557213930345, "step": 2630 }, { "loss": 0.1439760446548462, "grad_norm": 1.5808171033859253, "learning_rate": 0.00010013150237539291, "entropy": 0.17231757938861847, "num_tokens": 21691601.0, "mean_token_accuracy": 0.9500082366168499, "epoch": 5.248756218905473, "step": 2640 }, { "loss": 0.14982556104660033, "grad_norm": 1.6159675121307373, "learning_rate": 9.947399277248114e-05, "entropy": 0.18437913516536356, "num_tokens": 21773640.0, "mean_token_accuracy": 0.9472062647342682, "epoch": 5.268656716417911, "step": 2650 }, { "loss": 0.1454100251197815, "grad_norm": 1.3811414241790771, "learning_rate": 9.881650590994321e-05, "entropy": 0.17077813004143536, "num_tokens": 21856383.0, "mean_token_accuracy": 0.9554009273648262, "epoch": 5.288557213930348, "step": 2660 }, { "loss": 0.1529370903968811, "grad_norm": 2.063105583190918, "learning_rate": 9.81590702122881e-05, "entropy": 0.1808861500583589, "num_tokens": 21938383.0, "mean_token_accuracy": 0.948763107508421, "epoch": 5.308457711442786, "step": 2670 }, { "loss": 0.13557761907577515, "grad_norm": 1.606972575187683, "learning_rate": 9.750171410181268e-05, "entropy": 0.17785537512972951, "num_tokens": 22022051.0, "mean_token_accuracy": 0.9500960379838943, "epoch": 5.3283582089552235, "step": 2680 }, { "loss": 0.14070883989334107, "grad_norm": 1.4112268686294556, "learning_rate": 9.684446599737313e-05, "entropy": 0.17111114114522935, "num_tokens": 22103736.0, "mean_token_accuracy": 0.9535823926329613, "epoch": 5.348258706467662, "step": 2690 }, { "loss": 0.15326887369155884, "grad_norm": 1.5268429517745972, "learning_rate": 9.618735431315628e-05, "entropy": 0.17168783275410532, "num_tokens": 22187778.0, "mean_token_accuracy": 0.9476280555129051, "epoch": 5.3681592039801, "step": 2700 }, { "loss": 0.14742431640625, "grad_norm": 1.8421076536178589, "learning_rate": 9.553040745745131e-05, "entropy": 0.1878282987046987, "num_tokens": 22267019.0, "mean_token_accuracy": 0.9506012089550495, "epoch": 5.388059701492537, "step": 2710 }, { "loss": 0.15141576528549194, "grad_norm": 1.8283631801605225, "learning_rate": 9.487365383142144e-05, "entropy": 0.16636274261400102, "num_tokens": 22347911.0, "mean_token_accuracy": 0.952550733089447, "epoch": 5.407960199004975, "step": 2720 }, { "loss": 0.14472270011901855, "grad_norm": 1.6224932670593262, "learning_rate": 9.42171218278762e-05, "entropy": 0.18225679048337043, "num_tokens": 22429956.0, "mean_token_accuracy": 0.9502832368016243, "epoch": 5.4278606965174125, "step": 2730 }, { "loss": 0.1553632140159607, "grad_norm": 1.2014065980911255, "learning_rate": 9.3560839830044e-05, "entropy": 0.1860564828850329, "num_tokens": 22514805.0, "mean_token_accuracy": 0.9482575446367264, "epoch": 5.447761194029851, "step": 2740 }, { "loss": 0.1534173846244812, "grad_norm": 1.1483746767044067, "learning_rate": 9.290483621034485e-05, "entropy": 0.19335241308435797, "num_tokens": 22594162.0, "mean_token_accuracy": 0.9506968580186367, "epoch": 5.467661691542289, "step": 2750 }, { "loss": 0.1423805832862854, "grad_norm": 1.1802810430526733, "learning_rate": 9.224913932916401e-05, "entropy": 0.17522130645811557, "num_tokens": 22675103.0, "mean_token_accuracy": 0.9564061060547828, "epoch": 5.487562189054726, "step": 2760 }, { "loss": 0.16999696493148803, "grad_norm": 1.7545998096466064, "learning_rate": 9.159377753362577e-05, "entropy": 0.177274182299152, "num_tokens": 22756462.0, "mean_token_accuracy": 0.9441149212419987, "epoch": 5.507462686567164, "step": 2770 }, { "loss": 0.15599164962768555, "grad_norm": 1.9323716163635254, "learning_rate": 9.0938779156368e-05, "entropy": 0.19683469235897064, "num_tokens": 22837647.0, "mean_token_accuracy": 0.9493952229619026, "epoch": 5.5273631840796025, "step": 2780 }, { "loss": 0.1470987915992737, "grad_norm": 1.420862078666687, "learning_rate": 9.028417251431717e-05, "entropy": 0.19523371988907456, "num_tokens": 22918963.0, "mean_token_accuracy": 0.9484399504959583, "epoch": 5.54726368159204, "step": 2790 }, { "loss": 0.14478300809860228, "grad_norm": 1.446480393409729, "learning_rate": 8.962998590746434e-05, "entropy": 0.185859234072268, "num_tokens": 23004621.0, "mean_token_accuracy": 0.9514032013714313, "epoch": 5.567164179104478, "step": 2800 }, { "loss": 0.1497580051422119, "grad_norm": 1.7207252979278564, "learning_rate": 8.897624761764152e-05, "entropy": 0.17532276483252646, "num_tokens": 23088455.0, "mean_token_accuracy": 0.950810880959034, "epoch": 5.587064676616915, "step": 2810 }, { "loss": 0.13927290439605713, "grad_norm": 1.8666800260543823, "learning_rate": 8.832298590729904e-05, "entropy": 0.16813257774338125, "num_tokens": 23169585.0, "mean_token_accuracy": 0.9538753777742386, "epoch": 5.606965174129353, "step": 2820 }, { "loss": 0.15171360969543457, "grad_norm": 1.593052625656128, "learning_rate": 8.76702290182838e-05, "entropy": 0.17214933927170933, "num_tokens": 23252281.0, "mean_token_accuracy": 0.9514808319509029, "epoch": 5.6268656716417915, "step": 2830 }, { "loss": 0.1722355604171753, "grad_norm": 1.8211098909378052, "learning_rate": 8.701800517061814e-05, "entropy": 0.18063214914873243, "num_tokens": 23334920.0, "mean_token_accuracy": 0.9428443647921085, "epoch": 5.646766169154229, "step": 2840 }, { "loss": 0.15239322185516357, "grad_norm": 1.7044843435287476, "learning_rate": 8.636634256127995e-05, "entropy": 0.18335627112537622, "num_tokens": 23413119.0, "mean_token_accuracy": 0.9484156593680382, "epoch": 5.666666666666667, "step": 2850 }, { "loss": 0.15082073211669922, "grad_norm": 1.735919713973999, "learning_rate": 8.571526936298372e-05, "entropy": 0.18242506040260195, "num_tokens": 23496782.0, "mean_token_accuracy": 0.949397337436676, "epoch": 5.686567164179104, "step": 2860 }, { "loss": 0.14254711866378783, "grad_norm": 1.5481796264648438, "learning_rate": 8.506481372296233e-05, "entropy": 0.1668767651543021, "num_tokens": 23579345.0, "mean_token_accuracy": 0.9547528505325318, "epoch": 5.706467661691542, "step": 2870 }, { "loss": 0.16232469081878662, "grad_norm": 1.276487112045288, "learning_rate": 8.441500376175055e-05, "entropy": 0.17980635408312082, "num_tokens": 23661589.0, "mean_token_accuracy": 0.9454159937798977, "epoch": 5.726368159203981, "step": 2880 }, { "loss": 0.15084612369537354, "grad_norm": 1.5978649854660034, "learning_rate": 8.376586757196893e-05, "entropy": 0.17503846548497676, "num_tokens": 23745040.0, "mean_token_accuracy": 0.9508810967206955, "epoch": 5.746268656716418, "step": 2890 }, { "loss": 0.15577337741851807, "grad_norm": 1.5376180410385132, "learning_rate": 8.311743321710962e-05, "entropy": 0.17748838970437647, "num_tokens": 23828741.0, "mean_token_accuracy": 0.947283898293972, "epoch": 5.766169154228856, "step": 2900 }, { "loss": 0.16305129528045653, "grad_norm": 1.410995364189148, "learning_rate": 8.246972873032292e-05, "entropy": 0.19196225269697606, "num_tokens": 23909202.0, "mean_token_accuracy": 0.9454095579683781, "epoch": 5.786069651741293, "step": 2910 }, { "loss": 0.15421292781829835, "grad_norm": 1.559767723083496, "learning_rate": 8.182278211320556e-05, "entropy": 0.18598383609205485, "num_tokens": 23991867.0, "mean_token_accuracy": 0.9466542080044746, "epoch": 5.8059701492537314, "step": 2920 }, { "loss": 0.14998261928558348, "grad_norm": 1.3756979703903198, "learning_rate": 8.117662133458984e-05, "entropy": 0.18076377538964153, "num_tokens": 24073174.0, "mean_token_accuracy": 0.951042790710926, "epoch": 5.82587064676617, "step": 2930 }, { "loss": 0.133389675617218, "grad_norm": 1.2057956457138062, "learning_rate": 8.053127432933475e-05, "entropy": 0.17494694823399187, "num_tokens": 24157497.0, "mean_token_accuracy": 0.952403973788023, "epoch": 5.845771144278607, "step": 2940 }, { "loss": 0.15985946655273436, "grad_norm": 1.7077171802520752, "learning_rate": 7.98867689971182e-05, "entropy": 0.18435341790318488, "num_tokens": 24240308.0, "mean_token_accuracy": 0.9459442816674709, "epoch": 5.865671641791045, "step": 2950 }, { "loss": 0.1396994948387146, "grad_norm": 1.349231243133545, "learning_rate": 7.924313320123075e-05, "entropy": 0.16967748273164035, "num_tokens": 24321979.0, "mean_token_accuracy": 0.9525260709226131, "epoch": 5.885572139303482, "step": 2960 }, { "loss": 0.15299395322799683, "grad_norm": 1.283353328704834, "learning_rate": 7.860039476737118e-05, "entropy": 0.18029331043362617, "num_tokens": 24406277.0, "mean_token_accuracy": 0.9431722618639469, "epoch": 5.9054726368159205, "step": 2970 }, { "loss": 0.14895654916763307, "grad_norm": 1.2930275201797485, "learning_rate": 7.795858148244348e-05, "entropy": 0.18708901344798506, "num_tokens": 24489586.0, "mean_token_accuracy": 0.945338387042284, "epoch": 5.925373134328359, "step": 2980 }, { "loss": 0.16557281017303466, "grad_norm": 1.5504826307296753, "learning_rate": 7.731772109335558e-05, "entropy": 0.19565808903425932, "num_tokens": 24570771.0, "mean_token_accuracy": 0.9432554632425308, "epoch": 5.945273631840796, "step": 2990 }, { "loss": 0.1594693899154663, "grad_norm": 2.1034810543060303, "learning_rate": 7.667784130581963e-05, "entropy": 0.1870686740614474, "num_tokens": 24653405.0, "mean_token_accuracy": 0.9398707859218121, "epoch": 5.965174129353234, "step": 3000 }, { "loss": 0.1598202109336853, "grad_norm": 1.5232559442520142, "learning_rate": 7.603896978315446e-05, "entropy": 0.1835718069691211, "num_tokens": 24733064.0, "mean_token_accuracy": 0.9420231267809868, "epoch": 5.985074626865671, "step": 3010 }, { "eval_loss": 1.2987958192825317, "eval_runtime": 88.7372, "eval_samples_per_second": 11.664, "eval_steps_per_second": 5.837, "eval_entropy": 0.36483325235344266, "eval_num_tokens": 24795936.0, "eval_mean_token_accuracy": 0.7524902858559229, "epoch": 6.0, "step": 3018 }, { "train_runtime": 13547.859, "train_samples_per_second": 5.935, "train_steps_per_second": 0.371, "total_flos": 5.281255645485466e+16, "train_loss": 0.5501504028135771, "epoch": 6.0, "step": 3018 }, { "eval_loss": 1.013381004333496, "eval_runtime": 88.0872, "eval_samples_per_second": 11.75, "eval_steps_per_second": 5.881, "eval_entropy": 0.6918873670421052, "eval_num_tokens": 24795936.0, "eval_mean_token_accuracy": 0.7516806636537824, "epoch": 6.0, "step": 3018 } ] }