{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 29704, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00033665499596014, "grad_norm": 2.0698454535440955, "learning_rate": 9.999999552565099e-06, "loss": 0.8854928970336914, "num_input_tokens_seen": 156912, "step": 5, "train_runtime": 15.0055, "train_tokens_per_second": 10456.944 }, { "epoch": 0.00067330999192028, "grad_norm": 1.595348631388974, "learning_rate": 9.999997734860948e-06, "loss": 0.6845027446746826, "num_input_tokens_seen": 310632, "step": 10, "train_runtime": 27.7655, "train_tokens_per_second": 11187.707 }, { "epoch": 0.0010099649878804202, "grad_norm": 1.4987275661962902, "learning_rate": 9.999994518923374e-06, "loss": 0.6747148513793946, "num_input_tokens_seen": 466600, "step": 15, "train_runtime": 40.4341, "train_tokens_per_second": 11539.762 }, { "epoch": 0.00134661998384056, "grad_norm": 1.2961275674842117, "learning_rate": 9.999989904753278e-06, "loss": 0.6179544925689697, "num_input_tokens_seen": 625032, "step": 20, "train_runtime": 54.0293, "train_tokens_per_second": 11568.382 }, { "epoch": 0.0016832749798007002, "grad_norm": 1.3270010040761284, "learning_rate": 9.999983892351947e-06, "loss": 0.6241541385650635, "num_input_tokens_seen": 785400, "step": 25, "train_runtime": 66.8662, "train_tokens_per_second": 11745.851 }, { "epoch": 0.0020199299757608404, "grad_norm": 1.2944622140890807, "learning_rate": 9.999976481721066e-06, "loss": 0.5376529693603516, "num_input_tokens_seen": 940640, "step": 30, "train_runtime": 79.3784, "train_tokens_per_second": 11850.078 }, { "epoch": 0.0023565849717209803, "grad_norm": 1.2313305414677842, "learning_rate": 9.999967672862704e-06, "loss": 0.5632558822631836, "num_input_tokens_seen": 1095816, "step": 35, "train_runtime": 91.858, "train_tokens_per_second": 11929.456 }, { "epoch": 0.00269323996768112, "grad_norm": 1.0541117790236472, "learning_rate": 9.999957465779326e-06, "loss": 0.5211737155914307, "num_input_tokens_seen": 1259144, "step": 40, "train_runtime": 104.769, "train_tokens_per_second": 12018.284 }, { "epoch": 0.0030298949636412605, "grad_norm": 1.3166924160252729, "learning_rate": 9.999945860473788e-06, "loss": 0.5659154415130615, "num_input_tokens_seen": 1414720, "step": 45, "train_runtime": 117.875, "train_tokens_per_second": 12001.87 }, { "epoch": 0.0033665499596014004, "grad_norm": 1.5398853879452326, "learning_rate": 9.999932856949333e-06, "loss": 0.5425772190093994, "num_input_tokens_seen": 1573368, "step": 50, "train_runtime": 130.9149, "train_tokens_per_second": 12018.25 }, { "epoch": 0.0037032049555615404, "grad_norm": 1.1138942943585206, "learning_rate": 9.999918455209599e-06, "loss": 0.5183193683624268, "num_input_tokens_seen": 1731392, "step": 55, "train_runtime": 143.6109, "train_tokens_per_second": 12056.13 }, { "epoch": 0.004039859951521681, "grad_norm": 1.2511809161167968, "learning_rate": 9.99990265525861e-06, "loss": 0.5496606349945068, "num_input_tokens_seen": 1889256, "step": 60, "train_runtime": 157.0216, "train_tokens_per_second": 12031.822 }, { "epoch": 0.004376514947481821, "grad_norm": 1.3649377833425977, "learning_rate": 9.999885457100789e-06, "loss": 0.5638967514038086, "num_input_tokens_seen": 2043608, "step": 65, "train_runtime": 170.0156, "train_tokens_per_second": 12020.119 }, { "epoch": 0.0047131699434419605, "grad_norm": 1.2134449261239417, "learning_rate": 9.999866860740943e-06, "loss": 0.5087326526641845, "num_input_tokens_seen": 2197176, "step": 70, "train_runtime": 183.0566, "train_tokens_per_second": 12002.712 }, { "epoch": 0.005049824939402101, "grad_norm": 1.109519206634432, "learning_rate": 9.999846866184274e-06, "loss": 0.521860408782959, "num_input_tokens_seen": 2361016, "step": 75, "train_runtime": 195.5143, "train_tokens_per_second": 12075.922 }, { "epoch": 0.00538647993536224, "grad_norm": 1.1342972606494852, "learning_rate": 9.99982547343637e-06, "loss": 0.49937987327575684, "num_input_tokens_seen": 2506120, "step": 80, "train_runtime": 209.4003, "train_tokens_per_second": 11968.084 }, { "epoch": 0.005723134931322381, "grad_norm": 1.2085456562956363, "learning_rate": 9.999802682503217e-06, "loss": 0.4897414207458496, "num_input_tokens_seen": 2667224, "step": 85, "train_runtime": 222.3909, "train_tokens_per_second": 11993.405 }, { "epoch": 0.006059789927282521, "grad_norm": 1.0987132862115228, "learning_rate": 9.999778493391186e-06, "loss": 0.5461398124694824, "num_input_tokens_seen": 2827728, "step": 90, "train_runtime": 235.4162, "train_tokens_per_second": 12011.612 }, { "epoch": 0.0063964449232426605, "grad_norm": 1.249478349933596, "learning_rate": 9.999752906107043e-06, "loss": 0.5407850265502929, "num_input_tokens_seen": 2988616, "step": 95, "train_runtime": 248.305, "train_tokens_per_second": 12036.066 }, { "epoch": 0.006733099919202801, "grad_norm": 2.567034402628015, "learning_rate": 9.999725920657944e-06, "loss": 0.5400688648223877, "num_input_tokens_seen": 3144096, "step": 100, "train_runtime": 261.0944, "train_tokens_per_second": 12041.989 }, { "epoch": 0.007069754915162941, "grad_norm": 1.1398675016545547, "learning_rate": 9.999697537051432e-06, "loss": 0.5188553810119629, "num_input_tokens_seen": 3298368, "step": 105, "train_runtime": 274.325, "train_tokens_per_second": 12023.578 }, { "epoch": 0.007406409911123081, "grad_norm": 1.227717719283168, "learning_rate": 9.999667755295449e-06, "loss": 0.49572024345397947, "num_input_tokens_seen": 3455432, "step": 110, "train_runtime": 287.1766, "train_tokens_per_second": 12032.43 }, { "epoch": 0.007743064907083221, "grad_norm": 1.303289307700912, "learning_rate": 9.999636575398319e-06, "loss": 0.5078877449035645, "num_input_tokens_seen": 3612472, "step": 115, "train_runtime": 300.1408, "train_tokens_per_second": 12035.923 }, { "epoch": 0.008079719903043361, "grad_norm": 1.39142518218521, "learning_rate": 9.999603997368766e-06, "loss": 0.4322662353515625, "num_input_tokens_seen": 3767256, "step": 120, "train_runtime": 312.8849, "train_tokens_per_second": 12040.389 }, { "epoch": 0.008416374899003501, "grad_norm": 1.2287739937650264, "learning_rate": 9.999570021215895e-06, "loss": 0.4877100944519043, "num_input_tokens_seen": 3927448, "step": 125, "train_runtime": 326.8862, "train_tokens_per_second": 12014.727 }, { "epoch": 0.008753029894963642, "grad_norm": 1.134810485220154, "learning_rate": 9.99953464694921e-06, "loss": 0.502169418334961, "num_input_tokens_seen": 4081760, "step": 130, "train_runtime": 339.6024, "train_tokens_per_second": 12019.231 }, { "epoch": 0.009089684890923782, "grad_norm": 1.3207295749847312, "learning_rate": 9.999497874578606e-06, "loss": 0.4972585678100586, "num_input_tokens_seen": 4244320, "step": 135, "train_runtime": 352.2974, "train_tokens_per_second": 12047.549 }, { "epoch": 0.009426339886883921, "grad_norm": 1.2630112814754622, "learning_rate": 9.999459704114361e-06, "loss": 0.4974041938781738, "num_input_tokens_seen": 4405272, "step": 140, "train_runtime": 366.1704, "train_tokens_per_second": 12030.661 }, { "epoch": 0.00976299488284406, "grad_norm": 1.095641717852237, "learning_rate": 9.999420135567153e-06, "loss": 0.5314162254333497, "num_input_tokens_seen": 4564624, "step": 145, "train_runtime": 379.5194, "train_tokens_per_second": 12027.381 }, { "epoch": 0.010099649878804202, "grad_norm": 1.1191641925266658, "learning_rate": 9.999379168948047e-06, "loss": 0.5017687797546386, "num_input_tokens_seen": 4725648, "step": 150, "train_runtime": 392.5065, "train_tokens_per_second": 12039.667 }, { "epoch": 0.010436304874764341, "grad_norm": 1.1510811912223, "learning_rate": 9.999336804268496e-06, "loss": 0.4947249412536621, "num_input_tokens_seen": 4888368, "step": 155, "train_runtime": 405.3102, "train_tokens_per_second": 12060.808 }, { "epoch": 0.01077295987072448, "grad_norm": 1.1750854077516668, "learning_rate": 9.999293041540351e-06, "loss": 0.5044156551361084, "num_input_tokens_seen": 5048056, "step": 160, "train_runtime": 418.3097, "train_tokens_per_second": 12067.747 }, { "epoch": 0.011109614866684622, "grad_norm": 1.0712399661489687, "learning_rate": 9.999247880775849e-06, "loss": 0.5079492568969727, "num_input_tokens_seen": 5205448, "step": 165, "train_runtime": 431.6836, "train_tokens_per_second": 12058.48 }, { "epoch": 0.011446269862644761, "grad_norm": 1.2383086918864776, "learning_rate": 9.999201321987617e-06, "loss": 0.463563346862793, "num_input_tokens_seen": 5365176, "step": 170, "train_runtime": 444.459, "train_tokens_per_second": 12071.251 }, { "epoch": 0.011782924858604901, "grad_norm": 1.1021188326109024, "learning_rate": 9.999153365188676e-06, "loss": 0.5227638244628906, "num_input_tokens_seen": 5526232, "step": 175, "train_runtime": 457.9486, "train_tokens_per_second": 12067.362 }, { "epoch": 0.012119579854565042, "grad_norm": 1.170848709161684, "learning_rate": 9.99910401039244e-06, "loss": 0.45966787338256837, "num_input_tokens_seen": 5679600, "step": 180, "train_runtime": 470.9486, "train_tokens_per_second": 12059.915 }, { "epoch": 0.012456234850525182, "grad_norm": 1.2694832577032766, "learning_rate": 9.999053257612708e-06, "loss": 0.46491479873657227, "num_input_tokens_seen": 5840616, "step": 185, "train_runtime": 483.4766, "train_tokens_per_second": 12080.453 }, { "epoch": 0.012792889846485321, "grad_norm": 1.2155432705353497, "learning_rate": 9.999001106863672e-06, "loss": 0.5444772243499756, "num_input_tokens_seen": 6000464, "step": 190, "train_runtime": 496.987, "train_tokens_per_second": 12073.683 }, { "epoch": 0.013129544842445462, "grad_norm": 1.097304634737417, "learning_rate": 9.998947558159916e-06, "loss": 0.5072970390319824, "num_input_tokens_seen": 6163560, "step": 195, "train_runtime": 510.6688, "train_tokens_per_second": 12069.583 }, { "epoch": 0.013466199838405602, "grad_norm": 1.2223737546636617, "learning_rate": 9.99889261151642e-06, "loss": 0.4785150051116943, "num_input_tokens_seen": 6315248, "step": 200, "train_runtime": 523.2587, "train_tokens_per_second": 12069.074 }, { "epoch": 0.013802854834365741, "grad_norm": 1.1080866067904105, "learning_rate": 9.998836266948542e-06, "loss": 0.47400674819946287, "num_input_tokens_seen": 6473920, "step": 205, "train_runtime": 536.7226, "train_tokens_per_second": 12061.947 }, { "epoch": 0.014139509830325882, "grad_norm": 1.2536449494794142, "learning_rate": 9.998778524472043e-06, "loss": 0.47736215591430664, "num_input_tokens_seen": 6627424, "step": 210, "train_runtime": 549.4742, "train_tokens_per_second": 12061.393 }, { "epoch": 0.014476164826286022, "grad_norm": 1.1320332661833703, "learning_rate": 9.99871938410307e-06, "loss": 0.4658658981323242, "num_input_tokens_seen": 6786896, "step": 215, "train_runtime": 563.8482, "train_tokens_per_second": 12036.744 }, { "epoch": 0.014812819822246161, "grad_norm": 1.096574211089579, "learning_rate": 9.99865884585816e-06, "loss": 0.5220664978027344, "num_input_tokens_seen": 6941568, "step": 220, "train_runtime": 577.1139, "train_tokens_per_second": 12028.072 }, { "epoch": 0.015149474818206303, "grad_norm": 1.2726189219492656, "learning_rate": 9.998596909754245e-06, "loss": 0.4895173072814941, "num_input_tokens_seen": 7100664, "step": 225, "train_runtime": 590.0872, "train_tokens_per_second": 12033.246 }, { "epoch": 0.015486129814166442, "grad_norm": 1.1458655876594552, "learning_rate": 9.998533575808642e-06, "loss": 0.4762932777404785, "num_input_tokens_seen": 7256336, "step": 230, "train_runtime": 603.4384, "train_tokens_per_second": 12024.981 }, { "epoch": 0.015822784810126583, "grad_norm": 1.0631508251033874, "learning_rate": 9.998468844039064e-06, "loss": 0.4685684680938721, "num_input_tokens_seen": 7414968, "step": 235, "train_runtime": 617.0903, "train_tokens_per_second": 12016.019 }, { "epoch": 0.016159439806086723, "grad_norm": 1.084732059086051, "learning_rate": 9.998402714463613e-06, "loss": 0.5053768634796143, "num_input_tokens_seen": 7577360, "step": 240, "train_runtime": 630.1816, "train_tokens_per_second": 12024.09 }, { "epoch": 0.016496094802046862, "grad_norm": 1.0156196358315555, "learning_rate": 9.998335187100782e-06, "loss": 0.5120949745178223, "num_input_tokens_seen": 7739440, "step": 245, "train_runtime": 643.3035, "train_tokens_per_second": 12030.776 }, { "epoch": 0.016832749798007002, "grad_norm": 1.1229637578221257, "learning_rate": 9.998266261969453e-06, "loss": 0.504401445388794, "num_input_tokens_seen": 7899936, "step": 250, "train_runtime": 657.508, "train_tokens_per_second": 12014.966 }, { "epoch": 0.01716940479396714, "grad_norm": 1.2876741817370467, "learning_rate": 9.998195939088905e-06, "loss": 0.4625980854034424, "num_input_tokens_seen": 8056808, "step": 255, "train_runtime": 670.0585, "train_tokens_per_second": 12024.037 }, { "epoch": 0.017506059789927284, "grad_norm": 1.0368124284942595, "learning_rate": 9.998124218478797e-06, "loss": 0.4769831657409668, "num_input_tokens_seen": 8213304, "step": 260, "train_runtime": 682.9, "train_tokens_per_second": 12027.096 }, { "epoch": 0.017842714785887424, "grad_norm": 1.1997697453880334, "learning_rate": 9.998051100159192e-06, "loss": 0.487578010559082, "num_input_tokens_seen": 8374848, "step": 265, "train_runtime": 695.4867, "train_tokens_per_second": 12041.708 }, { "epoch": 0.018179369781847563, "grad_norm": 1.201893381999332, "learning_rate": 9.997976584150533e-06, "loss": 0.4916214466094971, "num_input_tokens_seen": 8530464, "step": 270, "train_runtime": 708.2783, "train_tokens_per_second": 12043.944 }, { "epoch": 0.018516024777807703, "grad_norm": 1.0347058674493075, "learning_rate": 9.997900670473662e-06, "loss": 0.45754213333129884, "num_input_tokens_seen": 8694304, "step": 275, "train_runtime": 720.7436, "train_tokens_per_second": 12062.963 }, { "epoch": 0.018852679773767842, "grad_norm": 1.4544548395931927, "learning_rate": 9.997823359149804e-06, "loss": 0.46946043968200685, "num_input_tokens_seen": 8852488, "step": 280, "train_runtime": 733.9296, "train_tokens_per_second": 12061.768 }, { "epoch": 0.01918933476972798, "grad_norm": 1.1584230365138628, "learning_rate": 9.997744650200579e-06, "loss": 0.5050385951995849, "num_input_tokens_seen": 9012816, "step": 285, "train_runtime": 746.4205, "train_tokens_per_second": 12074.716 }, { "epoch": 0.01952598976568812, "grad_norm": 1.113884799754799, "learning_rate": 9.997664543648e-06, "loss": 0.48331484794616697, "num_input_tokens_seen": 9174280, "step": 290, "train_runtime": 760.3185, "train_tokens_per_second": 12066.364 }, { "epoch": 0.019862644761648264, "grad_norm": 1.019614337642649, "learning_rate": 9.997583039514469e-06, "loss": 0.47200641632080076, "num_input_tokens_seen": 9335248, "step": 295, "train_runtime": 772.846, "train_tokens_per_second": 12079.053 }, { "epoch": 0.020199299757608404, "grad_norm": 1.4804768664527224, "learning_rate": 9.997500137822776e-06, "loss": 0.4960646152496338, "num_input_tokens_seen": 9495888, "step": 300, "train_runtime": 785.7977, "train_tokens_per_second": 12084.392 }, { "epoch": 0.020535954753568543, "grad_norm": 1.1427763401474098, "learning_rate": 9.997415838596106e-06, "loss": 0.4839154243469238, "num_input_tokens_seen": 9654848, "step": 305, "train_runtime": 798.7343, "train_tokens_per_second": 12087.684 }, { "epoch": 0.020872609749528682, "grad_norm": 1.0110138422928279, "learning_rate": 9.997330141858032e-06, "loss": 0.5144286155700684, "num_input_tokens_seen": 9814600, "step": 310, "train_runtime": 813.0583, "train_tokens_per_second": 12071.213 }, { "epoch": 0.021209264745488822, "grad_norm": 1.105136204965642, "learning_rate": 9.997243047632519e-06, "loss": 0.4798739433288574, "num_input_tokens_seen": 9975904, "step": 315, "train_runtime": 826.9079, "train_tokens_per_second": 12064.105 }, { "epoch": 0.02154591974144896, "grad_norm": 1.1324864490597988, "learning_rate": 9.997154555943923e-06, "loss": 0.46115951538085936, "num_input_tokens_seen": 10135000, "step": 320, "train_runtime": 840.0743, "train_tokens_per_second": 12064.409 }, { "epoch": 0.021882574737409104, "grad_norm": 1.3005230058569233, "learning_rate": 9.997064666816992e-06, "loss": 0.45470561981201174, "num_input_tokens_seen": 10294608, "step": 325, "train_runtime": 852.5464, "train_tokens_per_second": 12075.129 }, { "epoch": 0.022219229733369244, "grad_norm": 1.2818583347173096, "learning_rate": 9.996973380276858e-06, "loss": 0.5623361587524414, "num_input_tokens_seen": 10453864, "step": 330, "train_runtime": 865.3451, "train_tokens_per_second": 12080.572 }, { "epoch": 0.022555884729329383, "grad_norm": 1.2407139272421785, "learning_rate": 9.996880696349053e-06, "loss": 0.4563101291656494, "num_input_tokens_seen": 10611128, "step": 335, "train_runtime": 877.9259, "train_tokens_per_second": 12086.588 }, { "epoch": 0.022892539725289523, "grad_norm": 1.207825477896831, "learning_rate": 9.996786615059497e-06, "loss": 0.5624344825744629, "num_input_tokens_seen": 10774352, "step": 340, "train_runtime": 891.5374, "train_tokens_per_second": 12085.137 }, { "epoch": 0.023229194721249662, "grad_norm": 1.0946064123587629, "learning_rate": 9.996691136434498e-06, "loss": 0.44589719772338865, "num_input_tokens_seen": 10935440, "step": 345, "train_runtime": 904.0983, "train_tokens_per_second": 12095.41 }, { "epoch": 0.023565849717209802, "grad_norm": 0.9586302067686466, "learning_rate": 9.996594260500753e-06, "loss": 0.510599422454834, "num_input_tokens_seen": 11096032, "step": 350, "train_runtime": 917.0355, "train_tokens_per_second": 12099.893 }, { "epoch": 0.023902504713169945, "grad_norm": 3.970662818569927, "learning_rate": 9.996495987285358e-06, "loss": 0.48085312843322753, "num_input_tokens_seen": 11257408, "step": 355, "train_runtime": 930.1712, "train_tokens_per_second": 12102.512 }, { "epoch": 0.024239159709130084, "grad_norm": 1.1902431964261908, "learning_rate": 9.996396316815793e-06, "loss": 0.46994600296020506, "num_input_tokens_seen": 11421040, "step": 360, "train_runtime": 943.2767, "train_tokens_per_second": 12107.836 }, { "epoch": 0.024575814705090224, "grad_norm": 1.267567993582934, "learning_rate": 9.99629524911993e-06, "loss": 0.4939387798309326, "num_input_tokens_seen": 11580896, "step": 365, "train_runtime": 956.953, "train_tokens_per_second": 12101.845 }, { "epoch": 0.024912469701050363, "grad_norm": 1.1519649584363651, "learning_rate": 9.996192784226033e-06, "loss": 0.454149866104126, "num_input_tokens_seen": 11733552, "step": 370, "train_runtime": 970.5711, "train_tokens_per_second": 12089.327 }, { "epoch": 0.025249124697010503, "grad_norm": 1.0319156097649216, "learning_rate": 9.996088922162755e-06, "loss": 0.47430944442749023, "num_input_tokens_seen": 11893936, "step": 375, "train_runtime": 983.1279, "train_tokens_per_second": 12098.056 }, { "epoch": 0.025585779692970642, "grad_norm": 1.1432443630299396, "learning_rate": 9.995983662959141e-06, "loss": 0.4670549392700195, "num_input_tokens_seen": 12053464, "step": 380, "train_runtime": 995.6173, "train_tokens_per_second": 12106.524 }, { "epoch": 0.025922434688930785, "grad_norm": 1.1662824248938957, "learning_rate": 9.995877006644627e-06, "loss": 0.48958525657653806, "num_input_tokens_seen": 12212832, "step": 385, "train_runtime": 1008.0928, "train_tokens_per_second": 12114.79 }, { "epoch": 0.026259089684890925, "grad_norm": 1.0514476882370498, "learning_rate": 9.995768953249038e-06, "loss": 0.4802351951599121, "num_input_tokens_seen": 12375632, "step": 390, "train_runtime": 1021.6958, "train_tokens_per_second": 12112.834 }, { "epoch": 0.026595744680851064, "grad_norm": 1.0063667401265024, "learning_rate": 9.995659502802594e-06, "loss": 0.47361931800842283, "num_input_tokens_seen": 12536216, "step": 395, "train_runtime": 1034.8136, "train_tokens_per_second": 12114.468 }, { "epoch": 0.026932399676811204, "grad_norm": 1.0493703848726703, "learning_rate": 9.995548655335899e-06, "loss": 0.48278303146362306, "num_input_tokens_seen": 12695352, "step": 400, "train_runtime": 1048.6981, "train_tokens_per_second": 12105.822 }, { "epoch": 0.027269054672771343, "grad_norm": 1.1152602747254188, "learning_rate": 9.995436410879951e-06, "loss": 0.524066162109375, "num_input_tokens_seen": 12855464, "step": 405, "train_runtime": 1061.8738, "train_tokens_per_second": 12106.396 }, { "epoch": 0.027605709668731482, "grad_norm": 1.074711634836309, "learning_rate": 9.99532276946614e-06, "loss": 0.4452226161956787, "num_input_tokens_seen": 13012488, "step": 410, "train_runtime": 1074.7137, "train_tokens_per_second": 12107.865 }, { "epoch": 0.027942364664691625, "grad_norm": 1.086494646437696, "learning_rate": 9.995207731126246e-06, "loss": 0.4838810920715332, "num_input_tokens_seen": 13176328, "step": 415, "train_runtime": 1087.1581, "train_tokens_per_second": 12119.974 }, { "epoch": 0.028279019660651765, "grad_norm": 1.0498946914612328, "learning_rate": 9.99509129589244e-06, "loss": 0.46650209426879885, "num_input_tokens_seen": 13337808, "step": 420, "train_runtime": 1101.109, "train_tokens_per_second": 12113.068 }, { "epoch": 0.028615674656611904, "grad_norm": 1.0337410324279293, "learning_rate": 9.994973463797279e-06, "loss": 0.46839241981506347, "num_input_tokens_seen": 13498832, "step": 425, "train_runtime": 1114.3492, "train_tokens_per_second": 12113.646 }, { "epoch": 0.028952329652572044, "grad_norm": 0.959037281710558, "learning_rate": 9.99485423487372e-06, "loss": 0.43642430305480956, "num_input_tokens_seen": 13656128, "step": 430, "train_runtime": 1127.1305, "train_tokens_per_second": 12115.836 }, { "epoch": 0.029288984648532183, "grad_norm": 1.0570573377555286, "learning_rate": 9.994733609155097e-06, "loss": 0.4827410697937012, "num_input_tokens_seen": 13813816, "step": 435, "train_runtime": 1140.299, "train_tokens_per_second": 12114.206 }, { "epoch": 0.029625639644492323, "grad_norm": 1.0550529434197375, "learning_rate": 9.994611586675149e-06, "loss": 0.46020212173461916, "num_input_tokens_seen": 13976104, "step": 440, "train_runtime": 1153.2254, "train_tokens_per_second": 12119.144 }, { "epoch": 0.029962294640452466, "grad_norm": 1.1474716966097382, "learning_rate": 9.994488167468e-06, "loss": 0.47103166580200195, "num_input_tokens_seen": 14134544, "step": 445, "train_runtime": 1166.8123, "train_tokens_per_second": 12113.811 }, { "epoch": 0.030298949636412605, "grad_norm": 0.9834376602833634, "learning_rate": 9.994363351568158e-06, "loss": 0.5048730850219727, "num_input_tokens_seen": 14291656, "step": 450, "train_runtime": 1180.3802, "train_tokens_per_second": 12107.672 }, { "epoch": 0.030635604632372745, "grad_norm": 1.0083779942246125, "learning_rate": 9.994237139010532e-06, "loss": 0.43943028450012206, "num_input_tokens_seen": 14452536, "step": 455, "train_runtime": 1194.4152, "train_tokens_per_second": 12100.094 }, { "epoch": 0.030972259628332884, "grad_norm": 1.0794597287319003, "learning_rate": 9.994109529830414e-06, "loss": 0.4924136161804199, "num_input_tokens_seen": 14616376, "step": 460, "train_runtime": 1206.8605, "train_tokens_per_second": 12111.073 }, { "epoch": 0.03130891462429303, "grad_norm": 0.9226732783084329, "learning_rate": 9.993980524063494e-06, "loss": 0.44845852851867674, "num_input_tokens_seen": 14775768, "step": 465, "train_runtime": 1220.0841, "train_tokens_per_second": 12110.45 }, { "epoch": 0.03164556962025317, "grad_norm": 0.9438662462795622, "learning_rate": 9.993850121745842e-06, "loss": 0.44841880798339845, "num_input_tokens_seen": 14933696, "step": 470, "train_runtime": 1233.4337, "train_tokens_per_second": 12107.416 }, { "epoch": 0.031982224616213306, "grad_norm": 1.2188633174885952, "learning_rate": 9.99371832291393e-06, "loss": 0.453628396987915, "num_input_tokens_seen": 15096136, "step": 475, "train_runtime": 1246.7957, "train_tokens_per_second": 12107.947 }, { "epoch": 0.032318879612173446, "grad_norm": 1.0759831528718735, "learning_rate": 9.993585127604612e-06, "loss": 0.4647801399230957, "num_input_tokens_seen": 15251304, "step": 480, "train_runtime": 1260.0513, "train_tokens_per_second": 12103.717 }, { "epoch": 0.032655534608133585, "grad_norm": 0.9560841791603152, "learning_rate": 9.993450535855136e-06, "loss": 0.45053730010986326, "num_input_tokens_seen": 15403056, "step": 485, "train_runtime": 1272.996, "train_tokens_per_second": 12099.847 }, { "epoch": 0.032992189604093725, "grad_norm": 1.1090118863756386, "learning_rate": 9.993314547703142e-06, "loss": 0.4434460163116455, "num_input_tokens_seen": 15563008, "step": 490, "train_runtime": 1286.256, "train_tokens_per_second": 12099.464 }, { "epoch": 0.033328844600053864, "grad_norm": 1.0830839786557283, "learning_rate": 9.993177163186655e-06, "loss": 0.4664647102355957, "num_input_tokens_seen": 15720104, "step": 495, "train_runtime": 1299.3267, "train_tokens_per_second": 12098.654 }, { "epoch": 0.033665499596014004, "grad_norm": 0.9820160136655524, "learning_rate": 9.993038382344097e-06, "loss": 0.4616697311401367, "num_input_tokens_seen": 15881912, "step": 500, "train_runtime": 1312.931, "train_tokens_per_second": 12096.532 }, { "epoch": 0.03400215459197414, "grad_norm": 1.0673159099564704, "learning_rate": 9.992898205214279e-06, "loss": 0.4627403259277344, "num_input_tokens_seen": 16043688, "step": 505, "train_runtime": 1326.1273, "train_tokens_per_second": 12098.151 }, { "epoch": 0.03433880958793428, "grad_norm": 0.9816448509608875, "learning_rate": 9.992756631836397e-06, "loss": 0.4467434883117676, "num_input_tokens_seen": 16202248, "step": 510, "train_runtime": 1338.7163, "train_tokens_per_second": 12102.825 }, { "epoch": 0.03467546458389442, "grad_norm": 0.9239724345264948, "learning_rate": 9.992613662250044e-06, "loss": 0.4464684009552002, "num_input_tokens_seen": 16362368, "step": 515, "train_runtime": 1351.278, "train_tokens_per_second": 12108.81 }, { "epoch": 0.03501211957985457, "grad_norm": 1.0208266697634873, "learning_rate": 9.992469296495201e-06, "loss": 0.47051296234130857, "num_input_tokens_seen": 16524408, "step": 520, "train_runtime": 1363.9154, "train_tokens_per_second": 12115.42 }, { "epoch": 0.03534877457581471, "grad_norm": 0.9247632887609387, "learning_rate": 9.992323534612238e-06, "loss": 0.4322772979736328, "num_input_tokens_seen": 16684832, "step": 525, "train_runtime": 1376.7774, "train_tokens_per_second": 12118.758 }, { "epoch": 0.03568542957177485, "grad_norm": 1.0983886927927062, "learning_rate": 9.99217637664192e-06, "loss": 0.4783305644989014, "num_input_tokens_seen": 16843328, "step": 530, "train_runtime": 1389.9174, "train_tokens_per_second": 12118.222 }, { "epoch": 0.03602208456773499, "grad_norm": 0.9935756434492818, "learning_rate": 9.992027822625397e-06, "loss": 0.47626543045043945, "num_input_tokens_seen": 17002608, "step": 535, "train_runtime": 1403.7351, "train_tokens_per_second": 12112.405 }, { "epoch": 0.036358739563695126, "grad_norm": 1.0577254554025446, "learning_rate": 9.99187787260421e-06, "loss": 0.44533343315124513, "num_input_tokens_seen": 17161128, "step": 540, "train_runtime": 1417.6336, "train_tokens_per_second": 12105.475 }, { "epoch": 0.036695394559655266, "grad_norm": 0.951402445225616, "learning_rate": 9.991726526620294e-06, "loss": 0.44655756950378417, "num_input_tokens_seen": 17323816, "step": 545, "train_runtime": 1430.3487, "train_tokens_per_second": 12111.604 }, { "epoch": 0.037032049555615405, "grad_norm": 1.0264088800049578, "learning_rate": 9.991573784715973e-06, "loss": 0.48914365768432616, "num_input_tokens_seen": 17485416, "step": 550, "train_runtime": 1443.3081, "train_tokens_per_second": 12114.819 }, { "epoch": 0.037368704551575545, "grad_norm": 1.551942927190482, "learning_rate": 9.99141964693396e-06, "loss": 0.47848825454711913, "num_input_tokens_seen": 17643336, "step": 555, "train_runtime": 1456.0373, "train_tokens_per_second": 12117.365 }, { "epoch": 0.037705359547535684, "grad_norm": 0.9768543659315769, "learning_rate": 9.99126411331736e-06, "loss": 0.45151920318603517, "num_input_tokens_seen": 17806512, "step": 560, "train_runtime": 1468.938, "train_tokens_per_second": 12122.031 }, { "epoch": 0.038042014543495824, "grad_norm": 1.1094768464979605, "learning_rate": 9.991107183909665e-06, "loss": 0.48669800758361814, "num_input_tokens_seen": 17967352, "step": 565, "train_runtime": 1482.238, "train_tokens_per_second": 12121.773 }, { "epoch": 0.03837866953945596, "grad_norm": 0.9882371790231235, "learning_rate": 9.990948858754763e-06, "loss": 0.4621871471405029, "num_input_tokens_seen": 18123856, "step": 570, "train_runtime": 1495.8694, "train_tokens_per_second": 12115.935 }, { "epoch": 0.0387153245354161, "grad_norm": 0.9516495724438331, "learning_rate": 9.990789137896927e-06, "loss": 0.4640963554382324, "num_input_tokens_seen": 18284408, "step": 575, "train_runtime": 1508.3987, "train_tokens_per_second": 12121.734 }, { "epoch": 0.03905197953137624, "grad_norm": 1.00191074793403, "learning_rate": 9.990628021380823e-06, "loss": 0.4907210826873779, "num_input_tokens_seen": 18444864, "step": 580, "train_runtime": 1521.2353, "train_tokens_per_second": 12124.925 }, { "epoch": 0.03938863452733639, "grad_norm": 1.1160586745314365, "learning_rate": 9.990465509251508e-06, "loss": 0.4765368938446045, "num_input_tokens_seen": 18599416, "step": 585, "train_runtime": 1534.4103, "train_tokens_per_second": 12121.54 }, { "epoch": 0.03972528952329653, "grad_norm": 0.9988597526211553, "learning_rate": 9.990301601554425e-06, "loss": 0.49938344955444336, "num_input_tokens_seen": 18753096, "step": 590, "train_runtime": 1547.2795, "train_tokens_per_second": 12120.045 }, { "epoch": 0.04006194451925667, "grad_norm": 1.2643211743220946, "learning_rate": 9.990136298335414e-06, "loss": 0.4231258869171143, "num_input_tokens_seen": 18911440, "step": 595, "train_runtime": 1560.4894, "train_tokens_per_second": 12118.916 }, { "epoch": 0.04039859951521681, "grad_norm": 0.9833512331323415, "learning_rate": 9.989969599640698e-06, "loss": 0.44031991958618166, "num_input_tokens_seen": 19071632, "step": 600, "train_runtime": 1573.2249, "train_tokens_per_second": 12122.636 }, { "epoch": 0.040735254511176947, "grad_norm": 0.9655762524888978, "learning_rate": 9.989801505516895e-06, "loss": 0.5200843334197998, "num_input_tokens_seen": 19235296, "step": 605, "train_runtime": 1585.712, "train_tokens_per_second": 12130.384 }, { "epoch": 0.041071909507137086, "grad_norm": 2.227105087763655, "learning_rate": 9.989632016011012e-06, "loss": 0.48972220420837403, "num_input_tokens_seen": 19394960, "step": 610, "train_runtime": 1598.957, "train_tokens_per_second": 12129.757 }, { "epoch": 0.041408564503097225, "grad_norm": 1.0816966835058763, "learning_rate": 9.989461131170448e-06, "loss": 0.49865164756774905, "num_input_tokens_seen": 19551032, "step": 615, "train_runtime": 1612.8609, "train_tokens_per_second": 12121.958 }, { "epoch": 0.041745219499057365, "grad_norm": 1.0211909000275807, "learning_rate": 9.98928885104299e-06, "loss": 0.4630419254302979, "num_input_tokens_seen": 19707904, "step": 620, "train_runtime": 1625.3538, "train_tokens_per_second": 12125.301 }, { "epoch": 0.042081874495017504, "grad_norm": 0.8870274603164188, "learning_rate": 9.989115175676812e-06, "loss": 0.41678524017333984, "num_input_tokens_seen": 19867840, "step": 625, "train_runtime": 1638.8019, "train_tokens_per_second": 12123.393 }, { "epoch": 0.042418529490977644, "grad_norm": 1.0973938509280696, "learning_rate": 9.988940105120483e-06, "loss": 0.47776055335998535, "num_input_tokens_seen": 20027256, "step": 630, "train_runtime": 1651.8885, "train_tokens_per_second": 12123.855 }, { "epoch": 0.04275518448693778, "grad_norm": 0.9754955473188553, "learning_rate": 9.988763639422965e-06, "loss": 0.49677300453186035, "num_input_tokens_seen": 20187928, "step": 635, "train_runtime": 1664.3713, "train_tokens_per_second": 12129.461 }, { "epoch": 0.04309183948289792, "grad_norm": 1.05710332676753, "learning_rate": 9.988585778633604e-06, "loss": 0.44564361572265626, "num_input_tokens_seen": 20337672, "step": 640, "train_runtime": 1677.242, "train_tokens_per_second": 12125.664 }, { "epoch": 0.04342849447885807, "grad_norm": 1.0755486143060007, "learning_rate": 9.988406522802134e-06, "loss": 0.4577667236328125, "num_input_tokens_seen": 20493384, "step": 645, "train_runtime": 1690.9599, "train_tokens_per_second": 12119.379 }, { "epoch": 0.04376514947481821, "grad_norm": 0.9957485095541426, "learning_rate": 9.98822587197869e-06, "loss": 0.41981868743896483, "num_input_tokens_seen": 20652248, "step": 650, "train_runtime": 1703.6982, "train_tokens_per_second": 12122.011 }, { "epoch": 0.04410180447077835, "grad_norm": 1.097361010079167, "learning_rate": 9.988043826213785e-06, "loss": 0.4444459915161133, "num_input_tokens_seen": 20810184, "step": 655, "train_runtime": 1716.7975, "train_tokens_per_second": 12121.514 }, { "epoch": 0.04443845946673849, "grad_norm": 0.9688622586590958, "learning_rate": 9.98786038555833e-06, "loss": 0.4006513595581055, "num_input_tokens_seen": 20971432, "step": 660, "train_runtime": 1730.1133, "train_tokens_per_second": 12121.421 }, { "epoch": 0.04477511446269863, "grad_norm": 1.065686120976239, "learning_rate": 9.987675550063625e-06, "loss": 0.4553042411804199, "num_input_tokens_seen": 21132776, "step": 665, "train_runtime": 1743.2392, "train_tokens_per_second": 12122.706 }, { "epoch": 0.04511176945865877, "grad_norm": 1.2388907576786294, "learning_rate": 9.987489319781355e-06, "loss": 0.4581089973449707, "num_input_tokens_seen": 21291848, "step": 670, "train_runtime": 1757.0713, "train_tokens_per_second": 12117.805 }, { "epoch": 0.045448424454618906, "grad_norm": 0.9382466004733375, "learning_rate": 9.987301694763602e-06, "loss": 0.5131166934967041, "num_input_tokens_seen": 21449872, "step": 675, "train_runtime": 1770.1588, "train_tokens_per_second": 12117.484 }, { "epoch": 0.045785079450579046, "grad_norm": 1.0397110435257384, "learning_rate": 9.987112675062834e-06, "loss": 0.4381747245788574, "num_input_tokens_seen": 21608688, "step": 680, "train_runtime": 1782.9453, "train_tokens_per_second": 12119.659 }, { "epoch": 0.046121734446539185, "grad_norm": 0.9636033745701335, "learning_rate": 9.986922260731908e-06, "loss": 0.4304304599761963, "num_input_tokens_seen": 21765680, "step": 685, "train_runtime": 1796.8322, "train_tokens_per_second": 12113.363 }, { "epoch": 0.046458389442499325, "grad_norm": 0.8540414275451069, "learning_rate": 9.986730451824073e-06, "loss": 0.47147550582885744, "num_input_tokens_seen": 21923856, "step": 690, "train_runtime": 1809.5653, "train_tokens_per_second": 12115.537 }, { "epoch": 0.046795044438459464, "grad_norm": 0.9872550347858896, "learning_rate": 9.986537248392969e-06, "loss": 0.47453083992004397, "num_input_tokens_seen": 22086424, "step": 695, "train_runtime": 1823.0195, "train_tokens_per_second": 12115.298 }, { "epoch": 0.047131699434419604, "grad_norm": 1.1266168723622052, "learning_rate": 9.986342650492626e-06, "loss": 0.4527026653289795, "num_input_tokens_seen": 22249592, "step": 700, "train_runtime": 1836.1295, "train_tokens_per_second": 12117.659 }, { "epoch": 0.04746835443037975, "grad_norm": 0.9400657818178781, "learning_rate": 9.98614665817746e-06, "loss": 0.4358218193054199, "num_input_tokens_seen": 22404016, "step": 705, "train_runtime": 1849.5818, "train_tokens_per_second": 12113.017 }, { "epoch": 0.04780500942633989, "grad_norm": 1.1061918007274816, "learning_rate": 9.98594927150228e-06, "loss": 0.4545723915100098, "num_input_tokens_seen": 22567856, "step": 710, "train_runtime": 1862.0175, "train_tokens_per_second": 12120.11 }, { "epoch": 0.04814166442230003, "grad_norm": 0.9213558129731466, "learning_rate": 9.985750490522286e-06, "loss": 0.42123003005981446, "num_input_tokens_seen": 22727280, "step": 715, "train_runtime": 1876.2106, "train_tokens_per_second": 12113.395 }, { "epoch": 0.04847831941826017, "grad_norm": 0.9594189723125057, "learning_rate": 9.985550315293066e-06, "loss": 0.4831345558166504, "num_input_tokens_seen": 22891120, "step": 720, "train_runtime": 1888.6573, "train_tokens_per_second": 12120.314 }, { "epoch": 0.04881497441422031, "grad_norm": 1.069807928188195, "learning_rate": 9.985348745870598e-06, "loss": 0.47385759353637696, "num_input_tokens_seen": 23051680, "step": 725, "train_runtime": 1901.7329, "train_tokens_per_second": 12121.408 }, { "epoch": 0.04915162941018045, "grad_norm": 0.8975497520665994, "learning_rate": 9.98514578231125e-06, "loss": 0.4108592510223389, "num_input_tokens_seen": 23213160, "step": 730, "train_runtime": 1914.5418, "train_tokens_per_second": 12124.656 }, { "epoch": 0.04948828440614059, "grad_norm": 0.9493558709229178, "learning_rate": 9.984941424671781e-06, "loss": 0.4824410915374756, "num_input_tokens_seen": 23374792, "step": 735, "train_runtime": 1928.375, "train_tokens_per_second": 12121.497 }, { "epoch": 0.049824939402100726, "grad_norm": 1.0344641837261108, "learning_rate": 9.984735673009337e-06, "loss": 0.4443234443664551, "num_input_tokens_seen": 23535176, "step": 740, "train_runtime": 1941.4685, "train_tokens_per_second": 12122.358 }, { "epoch": 0.050161594398060866, "grad_norm": 0.9580131202241611, "learning_rate": 9.984528527381458e-06, "loss": 0.45436906814575195, "num_input_tokens_seen": 23690408, "step": 745, "train_runtime": 1954.1461, "train_tokens_per_second": 12123.151 }, { "epoch": 0.050498249394021005, "grad_norm": 1.0597551372281049, "learning_rate": 9.984319987846072e-06, "loss": 0.4441669464111328, "num_input_tokens_seen": 23849512, "step": 750, "train_runtime": 1967.5717, "train_tokens_per_second": 12121.292 }, { "epoch": 0.050834904389981145, "grad_norm": 1.091777532592783, "learning_rate": 9.984110054461495e-06, "loss": 0.4507458686828613, "num_input_tokens_seen": 24013352, "step": 755, "train_runtime": 1980.0144, "train_tokens_per_second": 12127.867 }, { "epoch": 0.051171559385941284, "grad_norm": 0.8403560730705298, "learning_rate": 9.983898727286435e-06, "loss": 0.43334531784057617, "num_input_tokens_seen": 24174008, "step": 760, "train_runtime": 1992.5423, "train_tokens_per_second": 12132.243 }, { "epoch": 0.05150821438190143, "grad_norm": 1.0556905650410375, "learning_rate": 9.983686006379985e-06, "loss": 0.47033281326293946, "num_input_tokens_seen": 24331120, "step": 765, "train_runtime": 2005.6323, "train_tokens_per_second": 12131.396 }, { "epoch": 0.05184486937786157, "grad_norm": 0.9955114482895413, "learning_rate": 9.983471891801638e-06, "loss": 0.4417285919189453, "num_input_tokens_seen": 24491688, "step": 770, "train_runtime": 2018.1024, "train_tokens_per_second": 12135.998 }, { "epoch": 0.05218152437382171, "grad_norm": 1.0914149014820869, "learning_rate": 9.983256383611267e-06, "loss": 0.4434773921966553, "num_input_tokens_seen": 24647920, "step": 775, "train_runtime": 2030.5642, "train_tokens_per_second": 12138.459 }, { "epoch": 0.05251817936978185, "grad_norm": 1.0353304994801185, "learning_rate": 9.983039481869138e-06, "loss": 0.43852434158325193, "num_input_tokens_seen": 24807688, "step": 780, "train_runtime": 2043.5833, "train_tokens_per_second": 12139.309 }, { "epoch": 0.05285483436574199, "grad_norm": 0.9713045784537268, "learning_rate": 9.98282118663591e-06, "loss": 0.44553141593933104, "num_input_tokens_seen": 24970376, "step": 785, "train_runtime": 2056.2335, "train_tokens_per_second": 12143.745 }, { "epoch": 0.05319148936170213, "grad_norm": 0.9394098983302592, "learning_rate": 9.982601497972624e-06, "loss": 0.45570807456970214, "num_input_tokens_seen": 25129328, "step": 790, "train_runtime": 2069.1329, "train_tokens_per_second": 12144.859 }, { "epoch": 0.05352814435766227, "grad_norm": 1.0032209046748868, "learning_rate": 9.982380415940717e-06, "loss": 0.4181360721588135, "num_input_tokens_seen": 25287752, "step": 795, "train_runtime": 2083.1836, "train_tokens_per_second": 12138.993 }, { "epoch": 0.05386479935362241, "grad_norm": 0.9744314586907671, "learning_rate": 9.982157940602015e-06, "loss": 0.4843122959136963, "num_input_tokens_seen": 25450064, "step": 800, "train_runtime": 2096.4053, "train_tokens_per_second": 12139.859 }, { "epoch": 0.05420145434958255, "grad_norm": 0.9501135820643248, "learning_rate": 9.981934072018732e-06, "loss": 0.468695068359375, "num_input_tokens_seen": 25610400, "step": 805, "train_runtime": 2108.8645, "train_tokens_per_second": 12144.166 }, { "epoch": 0.054538109345542686, "grad_norm": 0.9230825263230974, "learning_rate": 9.981708810253472e-06, "loss": 0.44299874305725095, "num_input_tokens_seen": 25770208, "step": 810, "train_runtime": 2122.0915, "train_tokens_per_second": 12143.778 }, { "epoch": 0.054874764341502826, "grad_norm": 1.068961383822381, "learning_rate": 9.981482155369229e-06, "loss": 0.46859169006347656, "num_input_tokens_seen": 25930424, "step": 815, "train_runtime": 2134.6437, "train_tokens_per_second": 12147.425 }, { "epoch": 0.055211419337462965, "grad_norm": 1.1127926351239978, "learning_rate": 9.981254107429385e-06, "loss": 0.4283432960510254, "num_input_tokens_seen": 26086816, "step": 820, "train_runtime": 2147.5432, "train_tokens_per_second": 12147.284 }, { "epoch": 0.05554807433342311, "grad_norm": 0.9379990425064615, "learning_rate": 9.981024666497716e-06, "loss": 0.4239189147949219, "num_input_tokens_seen": 26246576, "step": 825, "train_runtime": 2160.7057, "train_tokens_per_second": 12147.224 }, { "epoch": 0.05588472932938325, "grad_norm": 0.9832051634385591, "learning_rate": 9.98079383263838e-06, "loss": 0.4533884048461914, "num_input_tokens_seen": 26399456, "step": 830, "train_runtime": 2173.7939, "train_tokens_per_second": 12144.415 }, { "epoch": 0.05622138432534339, "grad_norm": 1.0348712759741439, "learning_rate": 9.980561605915932e-06, "loss": 0.44814014434814453, "num_input_tokens_seen": 26561712, "step": 835, "train_runtime": 2188.2651, "train_tokens_per_second": 12138.252 }, { "epoch": 0.05655803932130353, "grad_norm": 0.9937143809000505, "learning_rate": 9.980327986395316e-06, "loss": 0.45450782775878906, "num_input_tokens_seen": 26719000, "step": 840, "train_runtime": 2201.5501, "train_tokens_per_second": 12136.449 }, { "epoch": 0.05689469431726367, "grad_norm": 0.878069446594541, "learning_rate": 9.980092974141855e-06, "loss": 0.44374475479125974, "num_input_tokens_seen": 26879984, "step": 845, "train_runtime": 2214.5802, "train_tokens_per_second": 12137.733 }, { "epoch": 0.05723134931322381, "grad_norm": 0.981586328607755, "learning_rate": 9.979856569221276e-06, "loss": 0.4550945281982422, "num_input_tokens_seen": 27039752, "step": 850, "train_runtime": 2227.5365, "train_tokens_per_second": 12138.859 }, { "epoch": 0.05756800430918395, "grad_norm": 0.9578561598243582, "learning_rate": 9.979618771699688e-06, "loss": 0.48041372299194335, "num_input_tokens_seen": 27202888, "step": 855, "train_runtime": 2241.1941, "train_tokens_per_second": 12137.676 }, { "epoch": 0.05790465930514409, "grad_norm": 1.0554037548126747, "learning_rate": 9.979379581643588e-06, "loss": 0.42430791854858396, "num_input_tokens_seen": 27361456, "step": 860, "train_runtime": 2254.4805, "train_tokens_per_second": 12136.479 }, { "epoch": 0.05824131430110423, "grad_norm": 0.9964914745895169, "learning_rate": 9.979138999119866e-06, "loss": 0.4808645248413086, "num_input_tokens_seen": 27520968, "step": 865, "train_runtime": 2267.3816, "train_tokens_per_second": 12137.775 }, { "epoch": 0.05857796929706437, "grad_norm": 0.9998883552859759, "learning_rate": 9.978897024195801e-06, "loss": 0.446726131439209, "num_input_tokens_seen": 27684808, "step": 870, "train_runtime": 2279.831, "train_tokens_per_second": 12143.36 }, { "epoch": 0.058914624293024506, "grad_norm": 0.9213470897090208, "learning_rate": 9.978653656939058e-06, "loss": 0.4312605857849121, "num_input_tokens_seen": 27847040, "step": 875, "train_runtime": 2294.1163, "train_tokens_per_second": 12138.46 }, { "epoch": 0.059251279288984646, "grad_norm": 1.2113903884256734, "learning_rate": 9.978408897417699e-06, "loss": 0.4486079692840576, "num_input_tokens_seen": 28007872, "step": 880, "train_runtime": 2306.8486, "train_tokens_per_second": 12141.183 }, { "epoch": 0.059587934284944785, "grad_norm": 0.9378337150853849, "learning_rate": 9.978162745700165e-06, "loss": 0.4522806167602539, "num_input_tokens_seen": 28168824, "step": 885, "train_runtime": 2319.9217, "train_tokens_per_second": 12142.144 }, { "epoch": 0.05992458928090493, "grad_norm": 0.9045748055251455, "learning_rate": 9.977915201855293e-06, "loss": 0.4393168449401855, "num_input_tokens_seen": 28329240, "step": 890, "train_runtime": 2333.4008, "train_tokens_per_second": 12140.752 }, { "epoch": 0.06026124427686507, "grad_norm": 0.9751095599503165, "learning_rate": 9.977666265952309e-06, "loss": 0.456513786315918, "num_input_tokens_seen": 28488464, "step": 895, "train_runtime": 2346.3956, "train_tokens_per_second": 12141.373 }, { "epoch": 0.06059789927282521, "grad_norm": 0.9753716871374147, "learning_rate": 9.977415938060823e-06, "loss": 0.4530789852142334, "num_input_tokens_seen": 28646600, "step": 900, "train_runtime": 2359.6604, "train_tokens_per_second": 12140.137 }, { "epoch": 0.06093455426878535, "grad_norm": 0.9588995853125265, "learning_rate": 9.977164218250846e-06, "loss": 0.44556493759155275, "num_input_tokens_seen": 28805688, "step": 905, "train_runtime": 2372.5925, "train_tokens_per_second": 12141.018 }, { "epoch": 0.06127120926474549, "grad_norm": 0.9668287099742489, "learning_rate": 9.976911106592765e-06, "loss": 0.4143209457397461, "num_input_tokens_seen": 28961112, "step": 910, "train_runtime": 2385.8131, "train_tokens_per_second": 12138.886 }, { "epoch": 0.06160786426070563, "grad_norm": 0.9914823534100267, "learning_rate": 9.976656603157363e-06, "loss": 0.4627963066101074, "num_input_tokens_seen": 29121760, "step": 915, "train_runtime": 2399.6101, "train_tokens_per_second": 12136.038 }, { "epoch": 0.06194451925666577, "grad_norm": 0.9814944984261621, "learning_rate": 9.976400708015811e-06, "loss": 0.4357560157775879, "num_input_tokens_seen": 29279904, "step": 920, "train_runtime": 2413.1364, "train_tokens_per_second": 12133.547 }, { "epoch": 0.06228117425262591, "grad_norm": 0.9717162351659326, "learning_rate": 9.97614342123967e-06, "loss": 0.4263772487640381, "num_input_tokens_seen": 29442280, "step": 925, "train_runtime": 2425.8257, "train_tokens_per_second": 12137.014 }, { "epoch": 0.06261782924858605, "grad_norm": 0.9536663678940152, "learning_rate": 9.97588474290089e-06, "loss": 0.4196614265441895, "num_input_tokens_seen": 29601608, "step": 930, "train_runtime": 2439.3365, "train_tokens_per_second": 12135.106 }, { "epoch": 0.0629544842445462, "grad_norm": 1.1042378197565843, "learning_rate": 9.975624673071806e-06, "loss": 0.4309551239013672, "num_input_tokens_seen": 29760856, "step": 935, "train_runtime": 2452.7937, "train_tokens_per_second": 12133.452 }, { "epoch": 0.06329113924050633, "grad_norm": 0.9721153951582121, "learning_rate": 9.97536321182515e-06, "loss": 0.4095101833343506, "num_input_tokens_seen": 29914728, "step": 940, "train_runtime": 2465.8468, "train_tokens_per_second": 12131.625 }, { "epoch": 0.06362779423646647, "grad_norm": 0.964650368114325, "learning_rate": 9.975100359234037e-06, "loss": 0.47099714279174804, "num_input_tokens_seen": 30076816, "step": 945, "train_runtime": 2479.1451, "train_tokens_per_second": 12131.93 }, { "epoch": 0.06396444923242661, "grad_norm": 0.9596190554790406, "learning_rate": 9.974836115371972e-06, "loss": 0.45456132888793943, "num_input_tokens_seen": 30239696, "step": 950, "train_runtime": 2492.7665, "train_tokens_per_second": 12130.978 }, { "epoch": 0.06430110422838675, "grad_norm": 0.9238515492144911, "learning_rate": 9.974570480312852e-06, "loss": 0.43305373191833496, "num_input_tokens_seen": 30403536, "step": 955, "train_runtime": 2505.2275, "train_tokens_per_second": 12136.038 }, { "epoch": 0.06463775922434689, "grad_norm": 0.8960003111608499, "learning_rate": 9.974303454130962e-06, "loss": 0.45706024169921877, "num_input_tokens_seen": 30557376, "step": 960, "train_runtime": 2519.1244, "train_tokens_per_second": 12130.158 }, { "epoch": 0.06497441422030703, "grad_norm": 0.9160566129873569, "learning_rate": 9.97403503690097e-06, "loss": 0.4423353672027588, "num_input_tokens_seen": 30717464, "step": 965, "train_runtime": 2531.8805, "train_tokens_per_second": 12132.272 }, { "epoch": 0.06531106921626717, "grad_norm": 0.9556030749245238, "learning_rate": 9.973765228697942e-06, "loss": 0.41098475456237793, "num_input_tokens_seen": 30876392, "step": 970, "train_runtime": 2545.4042, "train_tokens_per_second": 12130.251 }, { "epoch": 0.06564772421222731, "grad_norm": 0.9421151616624401, "learning_rate": 9.973494029597327e-06, "loss": 0.4436800956726074, "num_input_tokens_seen": 31028488, "step": 975, "train_runtime": 2558.5511, "train_tokens_per_second": 12127.367 }, { "epoch": 0.06598437920818745, "grad_norm": 1.1836654392332189, "learning_rate": 9.973221439674968e-06, "loss": 0.4125687599182129, "num_input_tokens_seen": 31186536, "step": 980, "train_runtime": 2571.8573, "train_tokens_per_second": 12126.075 }, { "epoch": 0.06632103420414759, "grad_norm": 0.9154423214731736, "learning_rate": 9.972947459007089e-06, "loss": 0.450439977645874, "num_input_tokens_seen": 31343544, "step": 985, "train_runtime": 2585.0281, "train_tokens_per_second": 12125.03 }, { "epoch": 0.06665768920010773, "grad_norm": 0.9835095618826193, "learning_rate": 9.972672087670313e-06, "loss": 0.44240775108337405, "num_input_tokens_seen": 31503376, "step": 990, "train_runtime": 2597.7517, "train_tokens_per_second": 12127.17 }, { "epoch": 0.06699434419606787, "grad_norm": 0.8920790454204629, "learning_rate": 9.972395325741644e-06, "loss": 0.4211949348449707, "num_input_tokens_seen": 31662736, "step": 995, "train_runtime": 2610.5234, "train_tokens_per_second": 12128.884 }, { "epoch": 0.06733099919202801, "grad_norm": 0.8739919784346051, "learning_rate": 9.972117173298476e-06, "loss": 0.3989120960235596, "num_input_tokens_seen": 31821072, "step": 1000, "train_runtime": 2624.7352, "train_tokens_per_second": 12123.536 }, { "epoch": 0.06766765418798815, "grad_norm": 0.9426689708047346, "learning_rate": 9.971837630418597e-06, "loss": 0.42686920166015624, "num_input_tokens_seen": 31980040, "step": 1005, "train_runtime": 2638.3383, "train_tokens_per_second": 12121.281 }, { "epoch": 0.06800430918394829, "grad_norm": 0.9261265568747744, "learning_rate": 9.971556697180179e-06, "loss": 0.45174551010131836, "num_input_tokens_seen": 32135704, "step": 1010, "train_runtime": 2651.1069, "train_tokens_per_second": 12121.618 }, { "epoch": 0.06834096417990843, "grad_norm": 0.9533090303087755, "learning_rate": 9.971274373661784e-06, "loss": 0.44016642570495607, "num_input_tokens_seen": 32293272, "step": 1015, "train_runtime": 2663.6674, "train_tokens_per_second": 12123.613 }, { "epoch": 0.06867761917586857, "grad_norm": 0.9262311080176922, "learning_rate": 9.97099065994236e-06, "loss": 0.41562590599060056, "num_input_tokens_seen": 32455576, "step": 1020, "train_runtime": 2676.1481, "train_tokens_per_second": 12127.721 }, { "epoch": 0.0690142741718287, "grad_norm": 0.8953125099202213, "learning_rate": 9.970705556101253e-06, "loss": 0.45358028411865237, "num_input_tokens_seen": 32611264, "step": 1025, "train_runtime": 2690.3807, "train_tokens_per_second": 12121.431 }, { "epoch": 0.06935092916778884, "grad_norm": 0.9163240638824789, "learning_rate": 9.970419062218186e-06, "loss": 0.46768550872802733, "num_input_tokens_seen": 32774528, "step": 1030, "train_runtime": 2703.239, "train_tokens_per_second": 12124.169 }, { "epoch": 0.06968758416374898, "grad_norm": 0.9603827773348432, "learning_rate": 9.970131178373276e-06, "loss": 0.48101062774658204, "num_input_tokens_seen": 32934904, "step": 1035, "train_runtime": 2715.744, "train_tokens_per_second": 12127.396 }, { "epoch": 0.07002423915970914, "grad_norm": 1.0282896743824106, "learning_rate": 9.969841904647033e-06, "loss": 0.48900203704833983, "num_input_tokens_seen": 33092888, "step": 1040, "train_runtime": 2728.7943, "train_tokens_per_second": 12127.293 }, { "epoch": 0.07036089415566928, "grad_norm": 0.9804303127303902, "learning_rate": 9.969551241120349e-06, "loss": 0.442124080657959, "num_input_tokens_seen": 33254368, "step": 1045, "train_runtime": 2742.0081, "train_tokens_per_second": 12127.743 }, { "epoch": 0.07069754915162942, "grad_norm": 0.9257510383264234, "learning_rate": 9.969259187874507e-06, "loss": 0.43998470306396487, "num_input_tokens_seen": 33415336, "step": 1050, "train_runtime": 2754.6516, "train_tokens_per_second": 12130.513 }, { "epoch": 0.07103420414758956, "grad_norm": 0.9155175873229721, "learning_rate": 9.968965744991178e-06, "loss": 0.4427349090576172, "num_input_tokens_seen": 33576136, "step": 1055, "train_runtime": 2768.1845, "train_tokens_per_second": 12129.298 }, { "epoch": 0.0713708591435497, "grad_norm": 1.016727740243101, "learning_rate": 9.968670912552422e-06, "loss": 0.42871675491333006, "num_input_tokens_seen": 33735992, "step": 1060, "train_runtime": 2780.9264, "train_tokens_per_second": 12131.206 }, { "epoch": 0.07170751413950983, "grad_norm": 0.9472032533692066, "learning_rate": 9.968374690640692e-06, "loss": 0.42758769989013673, "num_input_tokens_seen": 33897520, "step": 1065, "train_runtime": 2793.4592, "train_tokens_per_second": 12134.603 }, { "epoch": 0.07204416913546997, "grad_norm": 0.9520158989514792, "learning_rate": 9.968077079338822e-06, "loss": 0.4488554000854492, "num_input_tokens_seen": 34057720, "step": 1070, "train_runtime": 2806.3094, "train_tokens_per_second": 12136.124 }, { "epoch": 0.07238082413143011, "grad_norm": 0.9911935639040145, "learning_rate": 9.967778078730038e-06, "loss": 0.4689912796020508, "num_input_tokens_seen": 34220392, "step": 1075, "train_runtime": 2819.3589, "train_tokens_per_second": 12137.65 }, { "epoch": 0.07271747912739025, "grad_norm": 0.9386121465327312, "learning_rate": 9.967477688897957e-06, "loss": 0.4770233631134033, "num_input_tokens_seen": 34380368, "step": 1080, "train_runtime": 2832.8794, "train_tokens_per_second": 12136.192 }, { "epoch": 0.07305413412335039, "grad_norm": 0.849002130220033, "learning_rate": 9.967175909926578e-06, "loss": 0.45032968521118166, "num_input_tokens_seen": 34541920, "step": 1085, "train_runtime": 2845.9238, "train_tokens_per_second": 12137.331 }, { "epoch": 0.07339078911931053, "grad_norm": 1.0708298307957156, "learning_rate": 9.966872741900296e-06, "loss": 0.4828330516815186, "num_input_tokens_seen": 34705120, "step": 1090, "train_runtime": 2858.8246, "train_tokens_per_second": 12139.647 }, { "epoch": 0.07372744411527067, "grad_norm": 1.0832687212391385, "learning_rate": 9.96656818490389e-06, "loss": 0.46305160522460936, "num_input_tokens_seen": 34866424, "step": 1095, "train_runtime": 2871.2932, "train_tokens_per_second": 12143.108 }, { "epoch": 0.07406409911123081, "grad_norm": 0.9632528346713082, "learning_rate": 9.966262239022529e-06, "loss": 0.48505916595458987, "num_input_tokens_seen": 35026944, "step": 1100, "train_runtime": 2884.2426, "train_tokens_per_second": 12144.243 }, { "epoch": 0.07440075410719095, "grad_norm": 0.9924514881032961, "learning_rate": 9.965954904341768e-06, "loss": 0.4741023540496826, "num_input_tokens_seen": 35186824, "step": 1105, "train_runtime": 2898.0253, "train_tokens_per_second": 12141.655 }, { "epoch": 0.07473740910315109, "grad_norm": 0.901432988676257, "learning_rate": 9.965646180947555e-06, "loss": 0.44626588821411134, "num_input_tokens_seen": 35344536, "step": 1110, "train_runtime": 2910.6383, "train_tokens_per_second": 12143.225 }, { "epoch": 0.07507406409911123, "grad_norm": 0.9166866632852102, "learning_rate": 9.96533606892622e-06, "loss": 0.42901973724365233, "num_input_tokens_seen": 35502296, "step": 1115, "train_runtime": 2924.5765, "train_tokens_per_second": 12139.295 }, { "epoch": 0.07541071909507137, "grad_norm": 0.9226116187763157, "learning_rate": 9.965024568364487e-06, "loss": 0.4359426975250244, "num_input_tokens_seen": 35665888, "step": 1120, "train_runtime": 2937.62, "train_tokens_per_second": 12141.083 }, { "epoch": 0.07574737409103151, "grad_norm": 0.9440127468004684, "learning_rate": 9.964711679349467e-06, "loss": 0.42251172065734866, "num_input_tokens_seen": 35820432, "step": 1125, "train_runtime": 2950.7812, "train_tokens_per_second": 12139.305 }, { "epoch": 0.07608402908699165, "grad_norm": 1.3678719819459766, "learning_rate": 9.964397401968656e-06, "loss": 0.4953521728515625, "num_input_tokens_seen": 35978544, "step": 1130, "train_runtime": 2963.2708, "train_tokens_per_second": 12141.497 }, { "epoch": 0.07642068408295179, "grad_norm": 0.9608408454067201, "learning_rate": 9.964081736309942e-06, "loss": 0.43913826942443845, "num_input_tokens_seen": 36142384, "step": 1135, "train_runtime": 2975.718, "train_tokens_per_second": 12145.769 }, { "epoch": 0.07675733907891193, "grad_norm": 0.898926228112129, "learning_rate": 9.963764682461599e-06, "loss": 0.4480710029602051, "num_input_tokens_seen": 36304896, "step": 1140, "train_runtime": 2988.4618, "train_tokens_per_second": 12148.356 }, { "epoch": 0.07709399407487207, "grad_norm": 0.9776204961335204, "learning_rate": 9.96344624051229e-06, "loss": 0.44857540130615237, "num_input_tokens_seen": 36464624, "step": 1145, "train_runtime": 3001.9843, "train_tokens_per_second": 12146.84 }, { "epoch": 0.0774306490708322, "grad_norm": 1.0214306211301467, "learning_rate": 9.96312641055107e-06, "loss": 0.424755859375, "num_input_tokens_seen": 36628000, "step": 1150, "train_runtime": 3015.0435, "train_tokens_per_second": 12148.415 }, { "epoch": 0.07776730406679234, "grad_norm": 1.1870289328200219, "learning_rate": 9.962805192667375e-06, "loss": 0.41829962730407716, "num_input_tokens_seen": 36786728, "step": 1155, "train_runtime": 3028.3516, "train_tokens_per_second": 12147.443 }, { "epoch": 0.07810395906275248, "grad_norm": 1.105027574907607, "learning_rate": 9.962482586951033e-06, "loss": 0.4151276111602783, "num_input_tokens_seen": 36948808, "step": 1160, "train_runtime": 3041.647, "train_tokens_per_second": 12147.632 }, { "epoch": 0.07844061405871264, "grad_norm": 0.8984616758301404, "learning_rate": 9.962158593492258e-06, "loss": 0.4334708213806152, "num_input_tokens_seen": 37108496, "step": 1165, "train_runtime": 3055.107, "train_tokens_per_second": 12146.382 }, { "epoch": 0.07877726905467278, "grad_norm": 0.8738845454844043, "learning_rate": 9.961833212381657e-06, "loss": 0.44759311676025393, "num_input_tokens_seen": 37270392, "step": 1170, "train_runtime": 3068.9872, "train_tokens_per_second": 12144.199 }, { "epoch": 0.07911392405063292, "grad_norm": 0.9223430513688491, "learning_rate": 9.961506443710221e-06, "loss": 0.44571504592895506, "num_input_tokens_seen": 37433024, "step": 1175, "train_runtime": 3082.4156, "train_tokens_per_second": 12144.055 }, { "epoch": 0.07945057904659306, "grad_norm": 1.108925270054749, "learning_rate": 9.961178287569326e-06, "loss": 0.40459270477294923, "num_input_tokens_seen": 37594584, "step": 1180, "train_runtime": 3094.9914, "train_tokens_per_second": 12146.911 }, { "epoch": 0.0797872340425532, "grad_norm": 0.9619238247568774, "learning_rate": 9.960848744050747e-06, "loss": 0.45792160034179685, "num_input_tokens_seen": 37752984, "step": 1185, "train_runtime": 3109.8913, "train_tokens_per_second": 12139.647 }, { "epoch": 0.08012388903851334, "grad_norm": 0.8310051890549981, "learning_rate": 9.960517813246633e-06, "loss": 0.4673145771026611, "num_input_tokens_seen": 37910904, "step": 1190, "train_runtime": 3123.4113, "train_tokens_per_second": 12137.66 }, { "epoch": 0.08046054403447347, "grad_norm": 0.9912816890677105, "learning_rate": 9.96018549524953e-06, "loss": 0.44765472412109375, "num_input_tokens_seen": 38069952, "step": 1195, "train_runtime": 3136.9484, "train_tokens_per_second": 12135.983 }, { "epoch": 0.08079719903043361, "grad_norm": 1.245467796411856, "learning_rate": 9.959851790152371e-06, "loss": 0.4483974456787109, "num_input_tokens_seen": 38230168, "step": 1200, "train_runtime": 3149.8925, "train_tokens_per_second": 12136.975 }, { "epoch": 0.08113385402639375, "grad_norm": 0.8609337799542169, "learning_rate": 9.959516698048475e-06, "loss": 0.40086779594421384, "num_input_tokens_seen": 38386248, "step": 1205, "train_runtime": 3163.7275, "train_tokens_per_second": 12133.234 }, { "epoch": 0.08147050902235389, "grad_norm": 0.9318743561328942, "learning_rate": 9.959180219031551e-06, "loss": 0.38164477348327636, "num_input_tokens_seen": 38545360, "step": 1210, "train_runtime": 3176.404, "train_tokens_per_second": 12134.905 }, { "epoch": 0.08180716401831403, "grad_norm": 0.8889836854898727, "learning_rate": 9.958842353195688e-06, "loss": 0.4082005977630615, "num_input_tokens_seen": 38706448, "step": 1215, "train_runtime": 3189.3509, "train_tokens_per_second": 12136.152 }, { "epoch": 0.08214381901427417, "grad_norm": 0.950575810030566, "learning_rate": 9.958503100635377e-06, "loss": 0.45647764205932617, "num_input_tokens_seen": 38859696, "step": 1220, "train_runtime": 3202.0646, "train_tokens_per_second": 12135.825 }, { "epoch": 0.08248047401023431, "grad_norm": 0.9161106694220389, "learning_rate": 9.958162461445484e-06, "loss": 0.46908087730407716, "num_input_tokens_seen": 39020472, "step": 1225, "train_runtime": 3215.0335, "train_tokens_per_second": 12136.879 }, { "epoch": 0.08281712900619445, "grad_norm": 0.9224080666472065, "learning_rate": 9.957820435721271e-06, "loss": 0.4472689628601074, "num_input_tokens_seen": 39178424, "step": 1230, "train_runtime": 3228.0044, "train_tokens_per_second": 12137.042 }, { "epoch": 0.08315378400215459, "grad_norm": 0.9837165995216243, "learning_rate": 9.95747702355838e-06, "loss": 0.4689658164978027, "num_input_tokens_seen": 39339920, "step": 1235, "train_runtime": 3241.1748, "train_tokens_per_second": 12137.549 }, { "epoch": 0.08349043899811473, "grad_norm": 0.8353197310709026, "learning_rate": 9.957132225052848e-06, "loss": 0.46484966278076173, "num_input_tokens_seen": 39500072, "step": 1240, "train_runtime": 3254.4365, "train_tokens_per_second": 12137.3 }, { "epoch": 0.08382709399407487, "grad_norm": 0.9366691451614378, "learning_rate": 9.956786040301098e-06, "loss": 0.43509821891784667, "num_input_tokens_seen": 39659832, "step": 1245, "train_runtime": 3268.1416, "train_tokens_per_second": 12135.286 }, { "epoch": 0.08416374899003501, "grad_norm": 0.9994105110699071, "learning_rate": 9.956438469399936e-06, "loss": 0.4476628303527832, "num_input_tokens_seen": 39817576, "step": 1250, "train_runtime": 3280.8605, "train_tokens_per_second": 12136.321 }, { "epoch": 0.08450040398599515, "grad_norm": 1.0899840849477886, "learning_rate": 9.956089512446562e-06, "loss": 0.43466830253601074, "num_input_tokens_seen": 39973840, "step": 1255, "train_runtime": 3294.8454, "train_tokens_per_second": 12132.235 }, { "epoch": 0.08483705898195529, "grad_norm": 0.9782638411396614, "learning_rate": 9.955739169538559e-06, "loss": 0.4437400817871094, "num_input_tokens_seen": 40132360, "step": 1260, "train_runtime": 3308.4365, "train_tokens_per_second": 12130.31 }, { "epoch": 0.08517371397791543, "grad_norm": 1.073873825751969, "learning_rate": 9.955387440773902e-06, "loss": 0.438496732711792, "num_input_tokens_seen": 40292856, "step": 1265, "train_runtime": 3322.4584, "train_tokens_per_second": 12127.422 }, { "epoch": 0.08551036897387557, "grad_norm": 1.062730821617072, "learning_rate": 9.955034326250947e-06, "loss": 0.40947647094726564, "num_input_tokens_seen": 40455504, "step": 1270, "train_runtime": 3335.9083, "train_tokens_per_second": 12127.283 }, { "epoch": 0.0858470239698357, "grad_norm": 0.8666865316986838, "learning_rate": 9.954679826068444e-06, "loss": 0.41518335342407225, "num_input_tokens_seen": 40609864, "step": 1275, "train_runtime": 3348.5211, "train_tokens_per_second": 12127.701 }, { "epoch": 0.08618367896579585, "grad_norm": 0.8954599093534942, "learning_rate": 9.954323940325526e-06, "loss": 0.42731266021728515, "num_input_tokens_seen": 40767416, "step": 1280, "train_runtime": 3361.3846, "train_tokens_per_second": 12128.162 }, { "epoch": 0.086520333961756, "grad_norm": 0.8951000012290237, "learning_rate": 9.953966669121715e-06, "loss": 0.44504098892211913, "num_input_tokens_seen": 40931256, "step": 1285, "train_runtime": 3373.8252, "train_tokens_per_second": 12132.003 }, { "epoch": 0.08685698895771614, "grad_norm": 0.958524125965118, "learning_rate": 9.953608012556924e-06, "loss": 0.4569901466369629, "num_input_tokens_seen": 41093872, "step": 1290, "train_runtime": 3387.2465, "train_tokens_per_second": 12131.94 }, { "epoch": 0.08719364395367628, "grad_norm": 0.8299090977720209, "learning_rate": 9.953247970731449e-06, "loss": 0.450609016418457, "num_input_tokens_seen": 41253288, "step": 1295, "train_runtime": 3400.6827, "train_tokens_per_second": 12130.884 }, { "epoch": 0.08753029894963642, "grad_norm": 0.9978150904199796, "learning_rate": 9.952886543745973e-06, "loss": 0.45717573165893555, "num_input_tokens_seen": 41413936, "step": 1300, "train_runtime": 3414.7123, "train_tokens_per_second": 12128.089 }, { "epoch": 0.08786695394559656, "grad_norm": 1.0544884402830437, "learning_rate": 9.952523731701566e-06, "loss": 0.4507907867431641, "num_input_tokens_seen": 41577576, "step": 1305, "train_runtime": 3427.1987, "train_tokens_per_second": 12131.65 }, { "epoch": 0.0882036089415567, "grad_norm": 0.8823892227065908, "learning_rate": 9.952159534699693e-06, "loss": 0.4093925476074219, "num_input_tokens_seen": 41732360, "step": 1310, "train_runtime": 3440.2939, "train_tokens_per_second": 12130.464 }, { "epoch": 0.08854026393751684, "grad_norm": 1.0182163971375215, "learning_rate": 9.951793952842197e-06, "loss": 0.4836570739746094, "num_input_tokens_seen": 41887800, "step": 1315, "train_runtime": 3453.9625, "train_tokens_per_second": 12127.462 }, { "epoch": 0.08887691893347698, "grad_norm": 0.9258509674609388, "learning_rate": 9.95142698623131e-06, "loss": 0.4167964458465576, "num_input_tokens_seen": 42043408, "step": 1320, "train_runtime": 3468.2289, "train_tokens_per_second": 12122.443 }, { "epoch": 0.08921357392943711, "grad_norm": 1.0047184965677176, "learning_rate": 9.951058634969657e-06, "loss": 0.44746012687683107, "num_input_tokens_seen": 42200128, "step": 1325, "train_runtime": 3481.5576, "train_tokens_per_second": 12121.048 }, { "epoch": 0.08955022892539725, "grad_norm": 0.953025597735266, "learning_rate": 9.950688899160244e-06, "loss": 0.4588298797607422, "num_input_tokens_seen": 42362480, "step": 1330, "train_runtime": 3494.227, "train_tokens_per_second": 12123.563 }, { "epoch": 0.0898868839213574, "grad_norm": 0.9174157514853671, "learning_rate": 9.950317778906469e-06, "loss": 0.4360856056213379, "num_input_tokens_seen": 42525872, "step": 1335, "train_runtime": 3507.2399, "train_tokens_per_second": 12125.168 }, { "epoch": 0.09022353891731753, "grad_norm": 0.8669923017517235, "learning_rate": 9.949945274312109e-06, "loss": 0.4161503314971924, "num_input_tokens_seen": 42689472, "step": 1340, "train_runtime": 3520.2982, "train_tokens_per_second": 12126.664 }, { "epoch": 0.09056019391327767, "grad_norm": 1.0627728227791875, "learning_rate": 9.94957138548134e-06, "loss": 0.4660347938537598, "num_input_tokens_seen": 42840376, "step": 1345, "train_runtime": 3533.6444, "train_tokens_per_second": 12123.567 }, { "epoch": 0.09089684890923781, "grad_norm": 1.0413034989700771, "learning_rate": 9.949196112518715e-06, "loss": 0.42073640823364256, "num_input_tokens_seen": 43000168, "step": 1350, "train_runtime": 3546.1296, "train_tokens_per_second": 12125.944 }, { "epoch": 0.09123350390519795, "grad_norm": 0.9926759290790045, "learning_rate": 9.94881945552918e-06, "loss": 0.45658254623413086, "num_input_tokens_seen": 43160680, "step": 1355, "train_runtime": 3558.6026, "train_tokens_per_second": 12128.547 }, { "epoch": 0.09157015890115809, "grad_norm": 1.1331792792018747, "learning_rate": 9.948441414618064e-06, "loss": 0.4689138889312744, "num_input_tokens_seen": 43319456, "step": 1360, "train_runtime": 3571.6871, "train_tokens_per_second": 12128.57 }, { "epoch": 0.09190681389711823, "grad_norm": 0.9748317820985101, "learning_rate": 9.948061989891085e-06, "loss": 0.4370171070098877, "num_input_tokens_seen": 43481296, "step": 1365, "train_runtime": 3585.0845, "train_tokens_per_second": 12128.388 }, { "epoch": 0.09224346889307837, "grad_norm": 0.9857529772608139, "learning_rate": 9.94768118145435e-06, "loss": 0.4425950527191162, "num_input_tokens_seen": 43639760, "step": 1370, "train_runtime": 3599.0995, "train_tokens_per_second": 12125.189 }, { "epoch": 0.09258012388903851, "grad_norm": 0.8818333263856521, "learning_rate": 9.947298989414349e-06, "loss": 0.4210357666015625, "num_input_tokens_seen": 43801224, "step": 1375, "train_runtime": 3611.6488, "train_tokens_per_second": 12127.764 }, { "epoch": 0.09291677888499865, "grad_norm": 0.9852834539317858, "learning_rate": 9.946915413877963e-06, "loss": 0.4292550563812256, "num_input_tokens_seen": 43965032, "step": 1380, "train_runtime": 3624.7725, "train_tokens_per_second": 12129.046 }, { "epoch": 0.09325343388095879, "grad_norm": 0.9306783826618251, "learning_rate": 9.946530454952454e-06, "loss": 0.45383524894714355, "num_input_tokens_seen": 44128872, "step": 1385, "train_runtime": 3637.2176, "train_tokens_per_second": 12132.591 }, { "epoch": 0.09359008887691893, "grad_norm": 0.9581511629288435, "learning_rate": 9.946144112745477e-06, "loss": 0.4641427040100098, "num_input_tokens_seen": 44290256, "step": 1390, "train_runtime": 3649.7337, "train_tokens_per_second": 12135.202 }, { "epoch": 0.09392674387287907, "grad_norm": 1.1591141466046666, "learning_rate": 9.94575638736507e-06, "loss": 0.4267313003540039, "num_input_tokens_seen": 44451016, "step": 1395, "train_runtime": 3662.6274, "train_tokens_per_second": 12136.374 }, { "epoch": 0.09426339886883921, "grad_norm": 1.0467058730294923, "learning_rate": 9.945367278919662e-06, "loss": 0.46062068939208983, "num_input_tokens_seen": 44611696, "step": 1400, "train_runtime": 3676.3758, "train_tokens_per_second": 12134.694 }, { "epoch": 0.09460005386479936, "grad_norm": 1.0240264460043018, "learning_rate": 9.944976787518064e-06, "loss": 0.450745964050293, "num_input_tokens_seen": 44770592, "step": 1405, "train_runtime": 3689.9272, "train_tokens_per_second": 12133.191 }, { "epoch": 0.0949367088607595, "grad_norm": 0.9071400522366527, "learning_rate": 9.944584913269474e-06, "loss": 0.43937244415283205, "num_input_tokens_seen": 44934288, "step": 1410, "train_runtime": 3703.0161, "train_tokens_per_second": 12134.511 }, { "epoch": 0.09527336385671964, "grad_norm": 0.83937585899858, "learning_rate": 9.944191656283481e-06, "loss": 0.4137714862823486, "num_input_tokens_seen": 45095936, "step": 1415, "train_runtime": 3716.2965, "train_tokens_per_second": 12134.644 }, { "epoch": 0.09561001885267978, "grad_norm": 1.0868900519848876, "learning_rate": 9.943797016670059e-06, "loss": 0.43173813819885254, "num_input_tokens_seen": 45253448, "step": 1420, "train_runtime": 3730.3934, "train_tokens_per_second": 12131.012 }, { "epoch": 0.09594667384863992, "grad_norm": 0.9753176495018745, "learning_rate": 9.943400994539565e-06, "loss": 0.43209304809570315, "num_input_tokens_seen": 45413944, "step": 1425, "train_runtime": 3743.8384, "train_tokens_per_second": 12130.316 }, { "epoch": 0.09628332884460006, "grad_norm": 0.9392448880944373, "learning_rate": 9.943003590002744e-06, "loss": 0.44062557220458987, "num_input_tokens_seen": 45576136, "step": 1430, "train_runtime": 3756.4936, "train_tokens_per_second": 12132.627 }, { "epoch": 0.0966199838405602, "grad_norm": 0.9854116851896264, "learning_rate": 9.942604803170733e-06, "loss": 0.44598841667175293, "num_input_tokens_seen": 45732544, "step": 1435, "train_runtime": 3770.057, "train_tokens_per_second": 12130.465 }, { "epoch": 0.09695663883652034, "grad_norm": 0.9165607209930458, "learning_rate": 9.94220463415505e-06, "loss": 0.44730443954467775, "num_input_tokens_seen": 45887432, "step": 1440, "train_runtime": 3782.7157, "train_tokens_per_second": 12130.817 }, { "epoch": 0.09729329383248048, "grad_norm": 0.8480367621187166, "learning_rate": 9.9418030830676e-06, "loss": 0.45311617851257324, "num_input_tokens_seen": 46051272, "step": 1445, "train_runtime": 3795.1625, "train_tokens_per_second": 12134.203 }, { "epoch": 0.09762994882844062, "grad_norm": 1.0583837703836312, "learning_rate": 9.941400150020676e-06, "loss": 0.4435733795166016, "num_input_tokens_seen": 46205616, "step": 1450, "train_runtime": 3808.5648, "train_tokens_per_second": 12132.028 }, { "epoch": 0.09796660382440076, "grad_norm": 0.8871343722220218, "learning_rate": 9.940995835126957e-06, "loss": 0.4543262481689453, "num_input_tokens_seen": 46366208, "step": 1455, "train_runtime": 3821.9036, "train_tokens_per_second": 12131.705 }, { "epoch": 0.0983032588203609, "grad_norm": 0.9118323090649372, "learning_rate": 9.940590138499508e-06, "loss": 0.4204091548919678, "num_input_tokens_seen": 46528168, "step": 1460, "train_runtime": 3835.0607, "train_tokens_per_second": 12132.316 }, { "epoch": 0.09863991381632103, "grad_norm": 0.918325004832027, "learning_rate": 9.940183060251783e-06, "loss": 0.428496265411377, "num_input_tokens_seen": 46678840, "step": 1465, "train_runtime": 3848.1423, "train_tokens_per_second": 12130.227 }, { "epoch": 0.09897656881228117, "grad_norm": 0.8356241263106327, "learning_rate": 9.939774600497616e-06, "loss": 0.40030221939086913, "num_input_tokens_seen": 46840008, "step": 1470, "train_runtime": 3861.5684, "train_tokens_per_second": 12129.788 }, { "epoch": 0.09931322380824131, "grad_norm": 0.8633439072735342, "learning_rate": 9.939364759351236e-06, "loss": 0.44556803703308107, "num_input_tokens_seen": 46999400, "step": 1475, "train_runtime": 3875.3513, "train_tokens_per_second": 12127.778 }, { "epoch": 0.09964987880420145, "grad_norm": 0.9241174116140954, "learning_rate": 9.938953536927249e-06, "loss": 0.4041449546813965, "num_input_tokens_seen": 47163112, "step": 1480, "train_runtime": 3888.4121, "train_tokens_per_second": 12129.144 }, { "epoch": 0.09998653380016159, "grad_norm": 0.9158896320984881, "learning_rate": 9.938540933340657e-06, "loss": 0.45334687232971194, "num_input_tokens_seen": 47322520, "step": 1485, "train_runtime": 3901.8571, "train_tokens_per_second": 12128.204 }, { "epoch": 0.10032318879612173, "grad_norm": 0.8162617020873536, "learning_rate": 9.938126948706839e-06, "loss": 0.43866500854492185, "num_input_tokens_seen": 47484520, "step": 1490, "train_runtime": 3915.1052, "train_tokens_per_second": 12128.542 }, { "epoch": 0.10065984379208187, "grad_norm": 0.7596109827826565, "learning_rate": 9.937711583141567e-06, "loss": 0.42181997299194335, "num_input_tokens_seen": 47644776, "step": 1495, "train_runtime": 3928.329, "train_tokens_per_second": 12128.51 }, { "epoch": 0.10099649878804201, "grad_norm": 0.9017738622746162, "learning_rate": 9.937294836760995e-06, "loss": 0.4284855365753174, "num_input_tokens_seen": 47804768, "step": 1500, "train_runtime": 3942.2453, "train_tokens_per_second": 12126.279 }, { "epoch": 0.10133315378400215, "grad_norm": 1.4606469661161126, "learning_rate": 9.936876709681668e-06, "loss": 0.4764401435852051, "num_input_tokens_seen": 47967000, "step": 1505, "train_runtime": 3955.5768, "train_tokens_per_second": 12126.424 }, { "epoch": 0.10166980877996229, "grad_norm": 0.839610105506026, "learning_rate": 9.93645720202051e-06, "loss": 0.38546133041381836, "num_input_tokens_seen": 48126392, "step": 1510, "train_runtime": 3968.7386, "train_tokens_per_second": 12126.37 }, { "epoch": 0.10200646377592243, "grad_norm": 0.9106614882016977, "learning_rate": 9.936036313894836e-06, "loss": 0.46453375816345216, "num_input_tokens_seen": 48283456, "step": 1515, "train_runtime": 3982.4835, "train_tokens_per_second": 12123.956 }, { "epoch": 0.10234311877188257, "grad_norm": 1.0247329171439983, "learning_rate": 9.935614045422349e-06, "loss": 0.4605582237243652, "num_input_tokens_seen": 48443448, "step": 1520, "train_runtime": 3995.2111, "train_tokens_per_second": 12125.379 }, { "epoch": 0.10267977376784271, "grad_norm": 0.8980150113086468, "learning_rate": 9.935190396721132e-06, "loss": 0.4190380096435547, "num_input_tokens_seen": 48603992, "step": 1525, "train_runtime": 4008.1549, "train_tokens_per_second": 12126.276 }, { "epoch": 0.10301642876380286, "grad_norm": 0.9254513639303532, "learning_rate": 9.934765367909658e-06, "loss": 0.44364585876464846, "num_input_tokens_seen": 48763344, "step": 1530, "train_runtime": 4020.8471, "train_tokens_per_second": 12127.629 }, { "epoch": 0.103353083759763, "grad_norm": 0.9852787080419828, "learning_rate": 9.934338959106783e-06, "loss": 0.4201723575592041, "num_input_tokens_seen": 48921168, "step": 1535, "train_runtime": 4033.5296, "train_tokens_per_second": 12128.625 }, { "epoch": 0.10368973875572314, "grad_norm": 1.1623498598175181, "learning_rate": 9.933911170431753e-06, "loss": 0.46906318664550783, "num_input_tokens_seen": 49075448, "step": 1540, "train_runtime": 4047.5353, "train_tokens_per_second": 12124.773 }, { "epoch": 0.10402639375168328, "grad_norm": 1.0049841697626876, "learning_rate": 9.933482002004198e-06, "loss": 0.4533809185028076, "num_input_tokens_seen": 49239008, "step": 1545, "train_runtime": 4060.5543, "train_tokens_per_second": 12126.179 }, { "epoch": 0.10436304874764342, "grad_norm": 1.0829885273211237, "learning_rate": 9.933051453944134e-06, "loss": 0.4875025749206543, "num_input_tokens_seen": 49398224, "step": 1550, "train_runtime": 4073.2749, "train_tokens_per_second": 12127.398 }, { "epoch": 0.10469970374360356, "grad_norm": 0.8862916745420065, "learning_rate": 9.932619526371958e-06, "loss": 0.39573619365692136, "num_input_tokens_seen": 49559168, "step": 1555, "train_runtime": 4086.1177, "train_tokens_per_second": 12128.669 }, { "epoch": 0.1050363587395637, "grad_norm": 0.9136804465008656, "learning_rate": 9.932186219408463e-06, "loss": 0.4129672050476074, "num_input_tokens_seen": 49711104, "step": 1560, "train_runtime": 4098.7775, "train_tokens_per_second": 12128.276 }, { "epoch": 0.10537301373552384, "grad_norm": 1.080397205079806, "learning_rate": 9.931751533174819e-06, "loss": 0.46036815643310547, "num_input_tokens_seen": 49867376, "step": 1565, "train_runtime": 4112.219, "train_tokens_per_second": 12126.634 }, { "epoch": 0.10570966873148398, "grad_norm": 0.9233372326641195, "learning_rate": 9.931315467792584e-06, "loss": 0.44809575080871583, "num_input_tokens_seen": 50031216, "step": 1570, "train_runtime": 4124.6563, "train_tokens_per_second": 12129.79 }, { "epoch": 0.10604632372744412, "grad_norm": 0.9000342578095065, "learning_rate": 9.930878023383705e-06, "loss": 0.4406759738922119, "num_input_tokens_seen": 50190816, "step": 1575, "train_runtime": 4137.8195, "train_tokens_per_second": 12129.774 }, { "epoch": 0.10638297872340426, "grad_norm": 0.8317163547044458, "learning_rate": 9.93043920007051e-06, "loss": 0.42117891311645506, "num_input_tokens_seen": 50352472, "step": 1580, "train_runtime": 4150.6882, "train_tokens_per_second": 12131.114 }, { "epoch": 0.1067196337193644, "grad_norm": 1.1160349310192461, "learning_rate": 9.929998997975712e-06, "loss": 0.42940635681152345, "num_input_tokens_seen": 50515560, "step": 1585, "train_runtime": 4163.5451, "train_tokens_per_second": 12132.824 }, { "epoch": 0.10705628871532454, "grad_norm": 0.9220999821639656, "learning_rate": 9.929557417222417e-06, "loss": 0.416658353805542, "num_input_tokens_seen": 50670216, "step": 1590, "train_runtime": 4176.866, "train_tokens_per_second": 12131.157 }, { "epoch": 0.10739294371128467, "grad_norm": 0.9373099688109692, "learning_rate": 9.929114457934109e-06, "loss": 0.43518705368041993, "num_input_tokens_seen": 50822800, "step": 1595, "train_runtime": 4189.4316, "train_tokens_per_second": 12131.192 }, { "epoch": 0.10772959870724481, "grad_norm": 0.9412657002038296, "learning_rate": 9.92867012023466e-06, "loss": 0.4593684196472168, "num_input_tokens_seen": 50982720, "step": 1600, "train_runtime": 4202.2286, "train_tokens_per_second": 12132.305 }, { "epoch": 0.10806625370320495, "grad_norm": 0.9024611883882057, "learning_rate": 9.92822440424833e-06, "loss": 0.4697587966918945, "num_input_tokens_seen": 51143544, "step": 1605, "train_runtime": 4214.7171, "train_tokens_per_second": 12134.514 }, { "epoch": 0.1084029086991651, "grad_norm": 0.9206575384576616, "learning_rate": 9.927777310099759e-06, "loss": 0.4916232585906982, "num_input_tokens_seen": 51306432, "step": 1610, "train_runtime": 4227.7571, "train_tokens_per_second": 12135.615 }, { "epoch": 0.10873956369512523, "grad_norm": 0.9475097961115961, "learning_rate": 9.927328837913976e-06, "loss": 0.4308351516723633, "num_input_tokens_seen": 51466696, "step": 1615, "train_runtime": 4240.3507, "train_tokens_per_second": 12137.368 }, { "epoch": 0.10907621869108537, "grad_norm": 0.9096331088191733, "learning_rate": 9.926878987816397e-06, "loss": 0.42225494384765627, "num_input_tokens_seen": 51630536, "step": 1620, "train_runtime": 4252.8043, "train_tokens_per_second": 12140.351 }, { "epoch": 0.10941287368704551, "grad_norm": 0.8204446692865083, "learning_rate": 9.92642775993282e-06, "loss": 0.4369563102722168, "num_input_tokens_seen": 51792200, "step": 1625, "train_runtime": 4265.892, "train_tokens_per_second": 12141.001 }, { "epoch": 0.10974952868300565, "grad_norm": 0.8990218935810885, "learning_rate": 9.925975154389428e-06, "loss": 0.39328005313873293, "num_input_tokens_seen": 51948552, "step": 1630, "train_runtime": 4278.7623, "train_tokens_per_second": 12141.023 }, { "epoch": 0.11008618367896579, "grad_norm": 0.9257407765811783, "learning_rate": 9.925521171312792e-06, "loss": 0.42905502319335936, "num_input_tokens_seen": 52105488, "step": 1635, "train_runtime": 4291.3414, "train_tokens_per_second": 12142.005 }, { "epoch": 0.11042283867492593, "grad_norm": 0.9306979963405362, "learning_rate": 9.925065810829868e-06, "loss": 0.45661077499389646, "num_input_tokens_seen": 52260032, "step": 1640, "train_runtime": 4304.5997, "train_tokens_per_second": 12140.509 }, { "epoch": 0.11075949367088607, "grad_norm": 0.9518070246743361, "learning_rate": 9.924609073067994e-06, "loss": 0.46037540435791013, "num_input_tokens_seen": 52420192, "step": 1645, "train_runtime": 4317.5488, "train_tokens_per_second": 12141.193 }, { "epoch": 0.11109614866684622, "grad_norm": 0.9996141438042896, "learning_rate": 9.924150958154897e-06, "loss": 0.4645636558532715, "num_input_tokens_seen": 52583640, "step": 1650, "train_runtime": 4330.6265, "train_tokens_per_second": 12142.271 }, { "epoch": 0.11143280366280636, "grad_norm": 0.9288808966586459, "learning_rate": 9.923691466218686e-06, "loss": 0.41077795028686526, "num_input_tokens_seen": 52744216, "step": 1655, "train_runtime": 4343.3621, "train_tokens_per_second": 12143.638 }, { "epoch": 0.1117694586587665, "grad_norm": 0.9560837089912206, "learning_rate": 9.923230597387856e-06, "loss": 0.4429797649383545, "num_input_tokens_seen": 52908056, "step": 1660, "train_runtime": 4355.8028, "train_tokens_per_second": 12146.568 }, { "epoch": 0.11210611365472664, "grad_norm": 1.0012339857977564, "learning_rate": 9.922768351791289e-06, "loss": 0.46070384979248047, "num_input_tokens_seen": 53064256, "step": 1665, "train_runtime": 4368.5474, "train_tokens_per_second": 12146.888 }, { "epoch": 0.11244276865068678, "grad_norm": 0.907849566596143, "learning_rate": 9.92230472955825e-06, "loss": 0.4141829490661621, "num_input_tokens_seen": 53227248, "step": 1670, "train_runtime": 4382.1861, "train_tokens_per_second": 12146.277 }, { "epoch": 0.11277942364664692, "grad_norm": 0.8460392997155691, "learning_rate": 9.92183973081839e-06, "loss": 0.40268354415893554, "num_input_tokens_seen": 53390448, "step": 1675, "train_runtime": 4395.3076, "train_tokens_per_second": 12147.147 }, { "epoch": 0.11311607864260706, "grad_norm": 0.8495464006739524, "learning_rate": 9.921373355701743e-06, "loss": 0.4864508152008057, "num_input_tokens_seen": 53551912, "step": 1680, "train_runtime": 4408.1744, "train_tokens_per_second": 12148.32 }, { "epoch": 0.1134527336385672, "grad_norm": 0.86896584972378, "learning_rate": 9.920905604338732e-06, "loss": 0.46452083587646487, "num_input_tokens_seen": 53715528, "step": 1685, "train_runtime": 4420.9546, "train_tokens_per_second": 12150.21 }, { "epoch": 0.11378938863452734, "grad_norm": 0.9097096798343015, "learning_rate": 9.920436476860158e-06, "loss": 0.4091813087463379, "num_input_tokens_seen": 53873288, "step": 1690, "train_runtime": 4434.5402, "train_tokens_per_second": 12148.562 }, { "epoch": 0.11412604363048748, "grad_norm": 0.8584497153256407, "learning_rate": 9.919965973397214e-06, "loss": 0.4077142715454102, "num_input_tokens_seen": 54031912, "step": 1695, "train_runtime": 4448.0087, "train_tokens_per_second": 12147.438 }, { "epoch": 0.11446269862644762, "grad_norm": 0.9078107756345885, "learning_rate": 9.919494094081475e-06, "loss": 0.4653289794921875, "num_input_tokens_seen": 54189080, "step": 1700, "train_runtime": 4461.9538, "train_tokens_per_second": 12144.698 }, { "epoch": 0.11479935362240776, "grad_norm": 0.9511292995129742, "learning_rate": 9.919020839044899e-06, "loss": 0.4436480522155762, "num_input_tokens_seen": 54352920, "step": 1705, "train_runtime": 4474.3818, "train_tokens_per_second": 12147.582 }, { "epoch": 0.1151360086183679, "grad_norm": 0.7937590042259438, "learning_rate": 9.918546208419832e-06, "loss": 0.4208201885223389, "num_input_tokens_seen": 54512176, "step": 1710, "train_runtime": 4487.0913, "train_tokens_per_second": 12148.667 }, { "epoch": 0.11547266361432804, "grad_norm": 0.8928356534020111, "learning_rate": 9.918070202339e-06, "loss": 0.4348869323730469, "num_input_tokens_seen": 54674880, "step": 1715, "train_runtime": 4500.0807, "train_tokens_per_second": 12149.755 }, { "epoch": 0.11580931861028818, "grad_norm": 0.9292342724588977, "learning_rate": 9.91759282093552e-06, "loss": 0.4313792705535889, "num_input_tokens_seen": 54832480, "step": 1720, "train_runtime": 4513.3919, "train_tokens_per_second": 12148.841 }, { "epoch": 0.11614597360624832, "grad_norm": 0.8640350706481296, "learning_rate": 9.917114064342888e-06, "loss": 0.40947756767272947, "num_input_tokens_seen": 54989208, "step": 1725, "train_runtime": 4526.7887, "train_tokens_per_second": 12147.509 }, { "epoch": 0.11648262860220845, "grad_norm": 1.1359038702136577, "learning_rate": 9.916633932694988e-06, "loss": 0.4014447212219238, "num_input_tokens_seen": 55150064, "step": 1730, "train_runtime": 4539.8194, "train_tokens_per_second": 12148.074 }, { "epoch": 0.1168192835981686, "grad_norm": 0.9063518913514674, "learning_rate": 9.916152426126086e-06, "loss": 0.38015270233154297, "num_input_tokens_seen": 55310872, "step": 1735, "train_runtime": 4553.8494, "train_tokens_per_second": 12145.96 }, { "epoch": 0.11715593859412873, "grad_norm": 0.9687998748062824, "learning_rate": 9.915669544770837e-06, "loss": 0.4296428680419922, "num_input_tokens_seen": 55474240, "step": 1740, "train_runtime": 4566.3211, "train_tokens_per_second": 12148.563 }, { "epoch": 0.11749259359008887, "grad_norm": 0.7877490489384283, "learning_rate": 9.915185288764272e-06, "loss": 0.42476983070373536, "num_input_tokens_seen": 55636768, "step": 1745, "train_runtime": 4579.0625, "train_tokens_per_second": 12150.253 }, { "epoch": 0.11782924858604901, "grad_norm": 0.847654496280336, "learning_rate": 9.914699658241815e-06, "loss": 0.42523956298828125, "num_input_tokens_seen": 55799656, "step": 1750, "train_runtime": 4592.5643, "train_tokens_per_second": 12150.0 }, { "epoch": 0.11816590358200915, "grad_norm": 0.9957985712545597, "learning_rate": 9.91421265333927e-06, "loss": 0.44651594161987307, "num_input_tokens_seen": 55962608, "step": 1755, "train_runtime": 4605.3874, "train_tokens_per_second": 12151.553 }, { "epoch": 0.11850255857796929, "grad_norm": 0.8694558678305105, "learning_rate": 9.913724274192829e-06, "loss": 0.4229731559753418, "num_input_tokens_seen": 56125320, "step": 1760, "train_runtime": 4618.1847, "train_tokens_per_second": 12153.113 }, { "epoch": 0.11883921357392943, "grad_norm": 0.9377605837423263, "learning_rate": 9.91323452093906e-06, "loss": 0.41498355865478515, "num_input_tokens_seen": 56283976, "step": 1765, "train_runtime": 4631.6, "train_tokens_per_second": 12152.167 }, { "epoch": 0.11917586856988957, "grad_norm": 0.94791109184082, "learning_rate": 9.912743393714927e-06, "loss": 0.3888449192047119, "num_input_tokens_seen": 56443152, "step": 1770, "train_runtime": 4644.2836, "train_tokens_per_second": 12153.253 }, { "epoch": 0.11951252356584972, "grad_norm": 0.8685863959576018, "learning_rate": 9.912250892657769e-06, "loss": 0.41208562850952146, "num_input_tokens_seen": 56602848, "step": 1775, "train_runtime": 4657.3503, "train_tokens_per_second": 12153.444 }, { "epoch": 0.11984917856180986, "grad_norm": 0.9020342597516245, "learning_rate": 9.911757017905312e-06, "loss": 0.42429428100585936, "num_input_tokens_seen": 56756320, "step": 1780, "train_runtime": 4670.8096, "train_tokens_per_second": 12151.281 }, { "epoch": 0.12018583355777, "grad_norm": 0.9266008330206336, "learning_rate": 9.911261769595668e-06, "loss": 0.4274741649627686, "num_input_tokens_seen": 56919768, "step": 1785, "train_runtime": 4683.8192, "train_tokens_per_second": 12152.426 }, { "epoch": 0.12052248855373014, "grad_norm": 1.0093198843999878, "learning_rate": 9.910765147867332e-06, "loss": 0.4207764148712158, "num_input_tokens_seen": 57079784, "step": 1790, "train_runtime": 4697.0317, "train_tokens_per_second": 12152.31 }, { "epoch": 0.12085914354969028, "grad_norm": 0.9416409677441909, "learning_rate": 9.91026715285918e-06, "loss": 0.425150203704834, "num_input_tokens_seen": 57239952, "step": 1795, "train_runtime": 4710.1098, "train_tokens_per_second": 12152.573 }, { "epoch": 0.12119579854565042, "grad_norm": 1.02313325709948, "learning_rate": 9.909767784710476e-06, "loss": 0.4768087387084961, "num_input_tokens_seen": 57403792, "step": 1800, "train_runtime": 4722.5445, "train_tokens_per_second": 12155.268 }, { "epoch": 0.12153245354161056, "grad_norm": 0.8894346181418543, "learning_rate": 9.909267043560868e-06, "loss": 0.46009435653686526, "num_input_tokens_seen": 57560992, "step": 1805, "train_runtime": 4735.1093, "train_tokens_per_second": 12156.212 }, { "epoch": 0.1218691085375707, "grad_norm": 0.9078126221919158, "learning_rate": 9.908764929550388e-06, "loss": 0.43431482315063474, "num_input_tokens_seen": 57721744, "step": 1810, "train_runtime": 4748.2558, "train_tokens_per_second": 12156.41 }, { "epoch": 0.12220576353353084, "grad_norm": 0.9240817581316834, "learning_rate": 9.908261442819444e-06, "loss": 0.4190185070037842, "num_input_tokens_seen": 57874976, "step": 1815, "train_runtime": 4761.5437, "train_tokens_per_second": 12154.667 }, { "epoch": 0.12254241852949098, "grad_norm": 0.9186413943945044, "learning_rate": 9.907756583508842e-06, "loss": 0.4270307540893555, "num_input_tokens_seen": 58038264, "step": 1820, "train_runtime": 4774.0203, "train_tokens_per_second": 12157.105 }, { "epoch": 0.12287907352545112, "grad_norm": 0.853608751016872, "learning_rate": 9.907250351759761e-06, "loss": 0.4223791122436523, "num_input_tokens_seen": 58199144, "step": 1825, "train_runtime": 4787.4318, "train_tokens_per_second": 12156.652 }, { "epoch": 0.12321572852141126, "grad_norm": 0.9741325446978811, "learning_rate": 9.906742747713766e-06, "loss": 0.4422037124633789, "num_input_tokens_seen": 58357976, "step": 1830, "train_runtime": 4801.0386, "train_tokens_per_second": 12155.282 }, { "epoch": 0.1235523835173714, "grad_norm": 0.9856021144089, "learning_rate": 9.906233771512808e-06, "loss": 0.4520071506500244, "num_input_tokens_seen": 58515072, "step": 1835, "train_runtime": 4814.2615, "train_tokens_per_second": 12154.527 }, { "epoch": 0.12388903851333154, "grad_norm": 1.081238427906188, "learning_rate": 9.905723423299222e-06, "loss": 0.47678585052490235, "num_input_tokens_seen": 58676736, "step": 1840, "train_runtime": 4826.7508, "train_tokens_per_second": 12156.57 }, { "epoch": 0.12422569350929168, "grad_norm": 0.9362505076125667, "learning_rate": 9.905211703215723e-06, "loss": 0.40844020843505857, "num_input_tokens_seen": 58831800, "step": 1845, "train_runtime": 4839.5987, "train_tokens_per_second": 12156.338 }, { "epoch": 0.12456234850525182, "grad_norm": 0.8264260910013779, "learning_rate": 9.904698611405412e-06, "loss": 0.4227871894836426, "num_input_tokens_seen": 58991928, "step": 1850, "train_runtime": 4853.1645, "train_tokens_per_second": 12155.353 }, { "epoch": 0.12489900350121196, "grad_norm": 0.7919523068279856, "learning_rate": 9.904184148011774e-06, "loss": 0.43866868019104005, "num_input_tokens_seen": 59151208, "step": 1855, "train_runtime": 4866.1326, "train_tokens_per_second": 12155.692 }, { "epoch": 0.1252356584971721, "grad_norm": 1.0239417593489215, "learning_rate": 9.903668313178681e-06, "loss": 0.46463823318481445, "num_input_tokens_seen": 59313416, "step": 1860, "train_runtime": 4878.7524, "train_tokens_per_second": 12157.497 }, { "epoch": 0.12557231349313225, "grad_norm": 0.9699631652297127, "learning_rate": 9.903151107050377e-06, "loss": 0.40071907043457033, "num_input_tokens_seen": 59467808, "step": 1865, "train_runtime": 4892.2397, "train_tokens_per_second": 12155.538 }, { "epoch": 0.1259089684890924, "grad_norm": 0.918565763654552, "learning_rate": 9.902632529771502e-06, "loss": 0.4531282424926758, "num_input_tokens_seen": 59628216, "step": 1870, "train_runtime": 4905.2225, "train_tokens_per_second": 12156.068 }, { "epoch": 0.12624562348505253, "grad_norm": 1.08492557807277, "learning_rate": 9.902112581487074e-06, "loss": 0.43126940727233887, "num_input_tokens_seen": 59789424, "step": 1875, "train_runtime": 4919.234, "train_tokens_per_second": 12154.214 }, { "epoch": 0.12658227848101267, "grad_norm": 0.9330675985787636, "learning_rate": 9.901591262342494e-06, "loss": 0.45319561958312987, "num_input_tokens_seen": 59947864, "step": 1880, "train_runtime": 4932.3163, "train_tokens_per_second": 12154.1 }, { "epoch": 0.1269189334769728, "grad_norm": 1.0144851121417797, "learning_rate": 9.901068572483548e-06, "loss": 0.41886653900146487, "num_input_tokens_seen": 60109312, "step": 1885, "train_runtime": 4945.7008, "train_tokens_per_second": 12153.851 }, { "epoch": 0.12725558847293295, "grad_norm": 0.9503891138886303, "learning_rate": 9.900544512056402e-06, "loss": 0.4605095863342285, "num_input_tokens_seen": 60271256, "step": 1890, "train_runtime": 4958.9237, "train_tokens_per_second": 12154.1 }, { "epoch": 0.12759224346889309, "grad_norm": 0.855031792864856, "learning_rate": 9.900019081207612e-06, "loss": 0.4420969009399414, "num_input_tokens_seen": 60434864, "step": 1895, "train_runtime": 4972.0377, "train_tokens_per_second": 12154.949 }, { "epoch": 0.12792889846485322, "grad_norm": 0.9396584523608502, "learning_rate": 9.89949228008411e-06, "loss": 0.42201433181762693, "num_input_tokens_seen": 60598240, "step": 1900, "train_runtime": 4985.1037, "train_tokens_per_second": 12155.864 }, { "epoch": 0.12826555346081336, "grad_norm": 0.8849544336878005, "learning_rate": 9.898964108833216e-06, "loss": 0.439554500579834, "num_input_tokens_seen": 60759632, "step": 1905, "train_runtime": 4998.2545, "train_tokens_per_second": 12156.17 }, { "epoch": 0.1286022084567735, "grad_norm": 0.889455508342976, "learning_rate": 9.898434567602629e-06, "loss": 0.4066291809082031, "num_input_tokens_seen": 60920720, "step": 1910, "train_runtime": 5011.1512, "train_tokens_per_second": 12157.031 }, { "epoch": 0.12893886345273364, "grad_norm": 1.0063744423310308, "learning_rate": 9.897903656540437e-06, "loss": 0.4452242374420166, "num_input_tokens_seen": 61079144, "step": 1915, "train_runtime": 5023.7899, "train_tokens_per_second": 12157.981 }, { "epoch": 0.12927551844869378, "grad_norm": 1.0542159138203344, "learning_rate": 9.897371375795103e-06, "loss": 0.45699567794799806, "num_input_tokens_seen": 61237432, "step": 1920, "train_runtime": 5036.9101, "train_tokens_per_second": 12157.738 }, { "epoch": 0.12961217344465392, "grad_norm": 0.914664701355832, "learning_rate": 9.896837725515484e-06, "loss": 0.4431015491485596, "num_input_tokens_seen": 61393024, "step": 1925, "train_runtime": 5049.7862, "train_tokens_per_second": 12157.549 }, { "epoch": 0.12994882844061406, "grad_norm": 0.7777937706476692, "learning_rate": 9.89630270585081e-06, "loss": 0.3898467063903809, "num_input_tokens_seen": 61553304, "step": 1930, "train_runtime": 5063.9994, "train_tokens_per_second": 12155.077 }, { "epoch": 0.1302854834365742, "grad_norm": 0.9528636579416194, "learning_rate": 9.895766316950694e-06, "loss": 0.4428374767303467, "num_input_tokens_seen": 61710824, "step": 1935, "train_runtime": 5077.017, "train_tokens_per_second": 12154.937 }, { "epoch": 0.13062213843253434, "grad_norm": 0.8688429945161484, "learning_rate": 9.89522855896514e-06, "loss": 0.4184412002563477, "num_input_tokens_seen": 61872784, "step": 1940, "train_runtime": 5089.6153, "train_tokens_per_second": 12156.672 }, { "epoch": 0.13095879342849448, "grad_norm": 0.8882981258541316, "learning_rate": 9.89468943204453e-06, "loss": 0.42222070693969727, "num_input_tokens_seen": 62034264, "step": 1945, "train_runtime": 5102.7622, "train_tokens_per_second": 12156.997 }, { "epoch": 0.13129544842445462, "grad_norm": 0.9682131919957763, "learning_rate": 9.89414893633963e-06, "loss": 0.4139063835144043, "num_input_tokens_seen": 62188736, "step": 1950, "train_runtime": 5115.4607, "train_tokens_per_second": 12157.016 }, { "epoch": 0.13163210342041476, "grad_norm": 0.949298813494029, "learning_rate": 9.893607072001584e-06, "loss": 0.4268019199371338, "num_input_tokens_seen": 62352576, "step": 1955, "train_runtime": 5127.9193, "train_tokens_per_second": 12159.43 }, { "epoch": 0.1319687584163749, "grad_norm": 0.8291848995043224, "learning_rate": 9.893063839181925e-06, "loss": 0.4225578308105469, "num_input_tokens_seen": 62513376, "step": 1960, "train_runtime": 5140.417, "train_tokens_per_second": 12161.149 }, { "epoch": 0.13230541341233504, "grad_norm": 0.8979947424718404, "learning_rate": 9.892519238032566e-06, "loss": 0.4502850532531738, "num_input_tokens_seen": 62674000, "step": 1965, "train_runtime": 5152.9267, "train_tokens_per_second": 12162.797 }, { "epoch": 0.13264206840829518, "grad_norm": 0.917298699883059, "learning_rate": 9.891973268705804e-06, "loss": 0.43758282661437986, "num_input_tokens_seen": 62832344, "step": 1970, "train_runtime": 5166.6163, "train_tokens_per_second": 12161.217 }, { "epoch": 0.13297872340425532, "grad_norm": 0.7773452536847344, "learning_rate": 9.891425931354316e-06, "loss": 0.4187131404876709, "num_input_tokens_seen": 62992416, "step": 1975, "train_runtime": 5179.3362, "train_tokens_per_second": 12162.257 }, { "epoch": 0.13331537840021546, "grad_norm": 1.0238820241724995, "learning_rate": 9.890877226131165e-06, "loss": 0.43040995597839354, "num_input_tokens_seen": 63156088, "step": 1980, "train_runtime": 5192.4586, "train_tokens_per_second": 12163.041 }, { "epoch": 0.1336520333961756, "grad_norm": 0.9235638745612735, "learning_rate": 9.890327153189793e-06, "loss": 0.4169161319732666, "num_input_tokens_seen": 63317336, "step": 1985, "train_runtime": 5205.0035, "train_tokens_per_second": 12164.706 }, { "epoch": 0.13398868839213574, "grad_norm": 0.9909414973730858, "learning_rate": 9.889775712684026e-06, "loss": 0.42840237617492677, "num_input_tokens_seen": 63480248, "step": 1990, "train_runtime": 5218.107, "train_tokens_per_second": 12165.379 }, { "epoch": 0.13432534338809587, "grad_norm": 1.1076612141519002, "learning_rate": 9.889222904768074e-06, "loss": 0.4068309783935547, "num_input_tokens_seen": 63641160, "step": 1995, "train_runtime": 5231.2841, "train_tokens_per_second": 12165.495 }, { "epoch": 0.13466199838405601, "grad_norm": 1.0720905515219408, "learning_rate": 9.888668729596528e-06, "loss": 0.4225417137145996, "num_input_tokens_seen": 63798584, "step": 2000, "train_runtime": 5244.604, "train_tokens_per_second": 12164.614 }, { "epoch": 0.13499865338001615, "grad_norm": 0.9384464485062592, "learning_rate": 9.88811318732436e-06, "loss": 0.4285943031311035, "num_input_tokens_seen": 63952560, "step": 2005, "train_runtime": 5257.3901, "train_tokens_per_second": 12164.317 }, { "epoch": 0.1353353083759763, "grad_norm": 1.0757053762684194, "learning_rate": 9.887556278106927e-06, "loss": 0.43933773040771484, "num_input_tokens_seen": 64114424, "step": 2010, "train_runtime": 5270.6599, "train_tokens_per_second": 12164.402 }, { "epoch": 0.13567196337193643, "grad_norm": 0.95817810959479, "learning_rate": 9.886998002099964e-06, "loss": 0.43896913528442383, "num_input_tokens_seen": 64277520, "step": 2015, "train_runtime": 5283.6079, "train_tokens_per_second": 12165.46 }, { "epoch": 0.13600861836789657, "grad_norm": 0.9545132118654873, "learning_rate": 9.886438359459595e-06, "loss": 0.45852227210998536, "num_input_tokens_seen": 64436808, "step": 2020, "train_runtime": 5296.8625, "train_tokens_per_second": 12165.09 }, { "epoch": 0.1363452733638567, "grad_norm": 0.8832538179927079, "learning_rate": 9.885877350342319e-06, "loss": 0.4092560768127441, "num_input_tokens_seen": 64597360, "step": 2025, "train_runtime": 5309.885, "train_tokens_per_second": 12165.491 }, { "epoch": 0.13668192835981685, "grad_norm": 0.834871105055598, "learning_rate": 9.885314974905024e-06, "loss": 0.39460463523864747, "num_input_tokens_seen": 64761200, "step": 2030, "train_runtime": 5322.3483, "train_tokens_per_second": 12167.787 }, { "epoch": 0.137018583355777, "grad_norm": 0.9915336773494975, "learning_rate": 9.884751233304973e-06, "loss": 0.4243456840515137, "num_input_tokens_seen": 64914432, "step": 2035, "train_runtime": 5335.5537, "train_tokens_per_second": 12166.391 }, { "epoch": 0.13735523835173713, "grad_norm": 0.9056028477037573, "learning_rate": 9.884186125699816e-06, "loss": 0.4550370693206787, "num_input_tokens_seen": 65073232, "step": 2040, "train_runtime": 5348.0538, "train_tokens_per_second": 12167.647 }, { "epoch": 0.13769189334769727, "grad_norm": 1.0062509762778098, "learning_rate": 9.883619652247584e-06, "loss": 0.4427315711975098, "num_input_tokens_seen": 65236072, "step": 2045, "train_runtime": 5362.2891, "train_tokens_per_second": 12165.713 }, { "epoch": 0.1380285483436574, "grad_norm": 0.7808483009573155, "learning_rate": 9.883051813106687e-06, "loss": 0.37587838172912597, "num_input_tokens_seen": 65397080, "step": 2050, "train_runtime": 5375.969, "train_tokens_per_second": 12164.705 }, { "epoch": 0.13836520333961755, "grad_norm": 0.99011518278659, "learning_rate": 9.882482608435924e-06, "loss": 0.4543206214904785, "num_input_tokens_seen": 65558984, "step": 2055, "train_runtime": 5389.3222, "train_tokens_per_second": 12164.606 }, { "epoch": 0.1387018583355777, "grad_norm": 0.9788486450877367, "learning_rate": 9.881912038394468e-06, "loss": 0.43818678855896, "num_input_tokens_seen": 65718448, "step": 2060, "train_runtime": 5402.1701, "train_tokens_per_second": 12165.194 }, { "epoch": 0.13903851333153783, "grad_norm": 0.8491765071717267, "learning_rate": 9.881340103141878e-06, "loss": 0.450365686416626, "num_input_tokens_seen": 65880032, "step": 2065, "train_runtime": 5414.7268, "train_tokens_per_second": 12166.825 }, { "epoch": 0.13937516832749797, "grad_norm": 0.8495415772711788, "learning_rate": 9.880766802838092e-06, "loss": 0.40735154151916503, "num_input_tokens_seen": 66040328, "step": 2070, "train_runtime": 5427.2214, "train_tokens_per_second": 12168.35 }, { "epoch": 0.1397118233234581, "grad_norm": 0.8098099702853278, "learning_rate": 9.880192137643434e-06, "loss": 0.39875073432922364, "num_input_tokens_seen": 66198856, "step": 2075, "train_runtime": 5440.6209, "train_tokens_per_second": 12167.518 }, { "epoch": 0.14004847831941827, "grad_norm": 1.0095396615032801, "learning_rate": 9.879616107718608e-06, "loss": 0.41994829177856446, "num_input_tokens_seen": 66355264, "step": 2080, "train_runtime": 5454.1025, "train_tokens_per_second": 12166.12 }, { "epoch": 0.1403851333153784, "grad_norm": 0.8761389171509144, "learning_rate": 9.879038713224695e-06, "loss": 0.43233041763305663, "num_input_tokens_seen": 66519080, "step": 2085, "train_runtime": 5467.2099, "train_tokens_per_second": 12166.915 }, { "epoch": 0.14072178831133855, "grad_norm": 0.8347151191842973, "learning_rate": 9.878459954323165e-06, "loss": 0.4214962005615234, "num_input_tokens_seen": 66679536, "step": 2090, "train_runtime": 5480.0942, "train_tokens_per_second": 12167.589 }, { "epoch": 0.1410584433072987, "grad_norm": 0.9102580199880363, "learning_rate": 9.877879831175865e-06, "loss": 0.40982770919799805, "num_input_tokens_seen": 66838848, "step": 2095, "train_runtime": 5492.7321, "train_tokens_per_second": 12168.598 }, { "epoch": 0.14139509830325883, "grad_norm": 0.7947832663386954, "learning_rate": 9.877298343945025e-06, "loss": 0.4155694007873535, "num_input_tokens_seen": 67001488, "step": 2100, "train_runtime": 5506.2047, "train_tokens_per_second": 12168.361 }, { "epoch": 0.14173175329921897, "grad_norm": 0.8056645514749221, "learning_rate": 9.876715492793256e-06, "loss": 0.41213302612304686, "num_input_tokens_seen": 67162024, "step": 2105, "train_runtime": 5519.9743, "train_tokens_per_second": 12167.09 }, { "epoch": 0.1420684082951791, "grad_norm": 1.0016942058541025, "learning_rate": 9.87613127788355e-06, "loss": 0.38554019927978517, "num_input_tokens_seen": 67316344, "step": 2110, "train_runtime": 5532.6493, "train_tokens_per_second": 12167.108 }, { "epoch": 0.14240506329113925, "grad_norm": 1.0181137444524948, "learning_rate": 9.87554569937928e-06, "loss": 0.48628959655761717, "num_input_tokens_seen": 67480184, "step": 2115, "train_runtime": 5545.0919, "train_tokens_per_second": 12169.353 }, { "epoch": 0.1427417182870994, "grad_norm": 0.986771189199152, "learning_rate": 9.874958757444203e-06, "loss": 0.4479678153991699, "num_input_tokens_seen": 67644024, "step": 2120, "train_runtime": 5557.5597, "train_tokens_per_second": 12171.533 }, { "epoch": 0.14307837328305953, "grad_norm": 0.9172627224791394, "learning_rate": 9.874370452242454e-06, "loss": 0.4456611633300781, "num_input_tokens_seen": 67806360, "step": 2125, "train_runtime": 5570.1901, "train_tokens_per_second": 12173.078 }, { "epoch": 0.14341502827901967, "grad_norm": 0.9169203833420295, "learning_rate": 9.873780783938553e-06, "loss": 0.46516051292419436, "num_input_tokens_seen": 67966688, "step": 2130, "train_runtime": 5583.0612, "train_tokens_per_second": 12173.732 }, { "epoch": 0.1437516832749798, "grad_norm": 0.825432726696393, "learning_rate": 9.873189752697396e-06, "loss": 0.3940959215164185, "num_input_tokens_seen": 68126832, "step": 2135, "train_runtime": 5596.261, "train_tokens_per_second": 12173.634 }, { "epoch": 0.14408833827093995, "grad_norm": 0.869345593681209, "learning_rate": 9.872597358684265e-06, "loss": 0.45507278442382815, "num_input_tokens_seen": 68281776, "step": 2140, "train_runtime": 5609.5935, "train_tokens_per_second": 12172.322 }, { "epoch": 0.1444249932669001, "grad_norm": 0.9128839986312763, "learning_rate": 9.872003602064816e-06, "loss": 0.42637219429016116, "num_input_tokens_seen": 68443200, "step": 2145, "train_runtime": 5622.7866, "train_tokens_per_second": 12172.47 }, { "epoch": 0.14476164826286023, "grad_norm": 1.5946973137189007, "learning_rate": 9.8714084830051e-06, "loss": 0.4010769844055176, "num_input_tokens_seen": 68605992, "step": 2150, "train_runtime": 5636.282, "train_tokens_per_second": 12172.207 }, { "epoch": 0.14509830325882037, "grad_norm": 0.8619865349758978, "learning_rate": 9.870812001671533e-06, "loss": 0.4232743740081787, "num_input_tokens_seen": 68766816, "step": 2155, "train_runtime": 5649.7052, "train_tokens_per_second": 12171.753 }, { "epoch": 0.1454349582547805, "grad_norm": 1.0450211873307693, "learning_rate": 9.870214158230922e-06, "loss": 0.4479037284851074, "num_input_tokens_seen": 68926608, "step": 2160, "train_runtime": 5662.5827, "train_tokens_per_second": 12172.292 }, { "epoch": 0.14577161325074064, "grad_norm": 0.8433864802768252, "learning_rate": 9.869614952850454e-06, "loss": 0.4208380699157715, "num_input_tokens_seen": 69087056, "step": 2165, "train_runtime": 5675.9909, "train_tokens_per_second": 12171.805 }, { "epoch": 0.14610826824670078, "grad_norm": 0.9697911217534166, "learning_rate": 9.86901438569769e-06, "loss": 0.45280089378356936, "num_input_tokens_seen": 69246632, "step": 2170, "train_runtime": 5688.7466, "train_tokens_per_second": 12172.564 }, { "epoch": 0.14644492324266092, "grad_norm": 0.9135087367546444, "learning_rate": 9.86841245694058e-06, "loss": 0.4174619197845459, "num_input_tokens_seen": 69400416, "step": 2175, "train_runtime": 5702.6752, "train_tokens_per_second": 12169.8 }, { "epoch": 0.14678157823862106, "grad_norm": 0.9724829776782624, "learning_rate": 9.86780916674745e-06, "loss": 0.4612767219543457, "num_input_tokens_seen": 69554912, "step": 2180, "train_runtime": 5716.8379, "train_tokens_per_second": 12166.675 }, { "epoch": 0.1471182332345812, "grad_norm": 0.8728710316147338, "learning_rate": 9.86720451528701e-06, "loss": 0.41460409164428713, "num_input_tokens_seen": 69711744, "step": 2185, "train_runtime": 5730.3482, "train_tokens_per_second": 12165.359 }, { "epoch": 0.14745488823054134, "grad_norm": 0.8781031333623331, "learning_rate": 9.866598502728348e-06, "loss": 0.42920470237731934, "num_input_tokens_seen": 69867784, "step": 2190, "train_runtime": 5744.164, "train_tokens_per_second": 12163.264 }, { "epoch": 0.14779154322650148, "grad_norm": 0.9045139793419407, "learning_rate": 9.865991129240931e-06, "loss": 0.44884295463562013, "num_input_tokens_seen": 70030376, "step": 2195, "train_runtime": 5758.4003, "train_tokens_per_second": 12161.429 }, { "epoch": 0.14812819822246162, "grad_norm": 0.958863730674743, "learning_rate": 9.865382394994614e-06, "loss": 0.42292466163635256, "num_input_tokens_seen": 70189512, "step": 2200, "train_runtime": 5772.4201, "train_tokens_per_second": 12159.46 }, { "epoch": 0.14846485321842176, "grad_norm": 0.7648537293414875, "learning_rate": 9.864772300159622e-06, "loss": 0.40708608627319337, "num_input_tokens_seen": 70348864, "step": 2205, "train_runtime": 5785.619, "train_tokens_per_second": 12159.263 }, { "epoch": 0.1488015082143819, "grad_norm": 1.1608650859727252, "learning_rate": 9.864160844906571e-06, "loss": 0.4426380157470703, "num_input_tokens_seen": 70505376, "step": 2210, "train_runtime": 5798.6779, "train_tokens_per_second": 12158.871 }, { "epoch": 0.14913816321034204, "grad_norm": 0.9109203404235952, "learning_rate": 9.863548029406449e-06, "loss": 0.4217958450317383, "num_input_tokens_seen": 70665688, "step": 2215, "train_runtime": 5811.9703, "train_tokens_per_second": 12158.646 }, { "epoch": 0.14947481820630218, "grad_norm": 0.8430512469870374, "learning_rate": 9.86293385383063e-06, "loss": 0.40331134796142576, "num_input_tokens_seen": 70825128, "step": 2220, "train_runtime": 5825.3252, "train_tokens_per_second": 12158.141 }, { "epoch": 0.14981147320226232, "grad_norm": 1.008019018116167, "learning_rate": 9.862318318350865e-06, "loss": 0.4379251956939697, "num_input_tokens_seen": 70984600, "step": 2225, "train_runtime": 5838.3079, "train_tokens_per_second": 12158.42 }, { "epoch": 0.15014812819822246, "grad_norm": 0.9655406579116413, "learning_rate": 9.861701423139287e-06, "loss": 0.3935262203216553, "num_input_tokens_seen": 71148136, "step": 2230, "train_runtime": 5851.4308, "train_tokens_per_second": 12159.101 }, { "epoch": 0.1504847831941826, "grad_norm": 0.9093511787917998, "learning_rate": 9.861083168368411e-06, "loss": 0.42951068878173826, "num_input_tokens_seen": 71311368, "step": 2235, "train_runtime": 5865.1801, "train_tokens_per_second": 12158.428 }, { "epoch": 0.15082143819014274, "grad_norm": 0.9401396276354811, "learning_rate": 9.860463554211125e-06, "loss": 0.3876911401748657, "num_input_tokens_seen": 71473080, "step": 2240, "train_runtime": 5878.2512, "train_tokens_per_second": 12158.902 }, { "epoch": 0.15115809318610288, "grad_norm": 0.9564800891090146, "learning_rate": 9.859842580840706e-06, "loss": 0.47974791526794436, "num_input_tokens_seen": 71633144, "step": 2245, "train_runtime": 5890.7142, "train_tokens_per_second": 12160.35 }, { "epoch": 0.15149474818206302, "grad_norm": 0.8089120994707854, "learning_rate": 9.859220248430806e-06, "loss": 0.42336549758911135, "num_input_tokens_seen": 71796984, "step": 2250, "train_runtime": 5903.1665, "train_tokens_per_second": 12162.453 }, { "epoch": 0.15183140317802316, "grad_norm": 0.7748896563225325, "learning_rate": 9.85859655715546e-06, "loss": 0.4047839164733887, "num_input_tokens_seen": 71959704, "step": 2255, "train_runtime": 5915.6264, "train_tokens_per_second": 12164.342 }, { "epoch": 0.1521680581739833, "grad_norm": 0.9576851563232459, "learning_rate": 9.857971507189077e-06, "loss": 0.39892871379852296, "num_input_tokens_seen": 72121744, "step": 2260, "train_runtime": 5929.0855, "train_tokens_per_second": 12164.059 }, { "epoch": 0.15250471316994343, "grad_norm": 0.9744963176053137, "learning_rate": 9.857345098706455e-06, "loss": 0.43654985427856446, "num_input_tokens_seen": 72284992, "step": 2265, "train_runtime": 5942.0473, "train_tokens_per_second": 12164.998 }, { "epoch": 0.15284136816590357, "grad_norm": 0.9424102984854913, "learning_rate": 9.856717331882765e-06, "loss": 0.41117372512817385, "num_input_tokens_seen": 72439104, "step": 2270, "train_runtime": 5955.4614, "train_tokens_per_second": 12163.475 }, { "epoch": 0.1531780231618637, "grad_norm": 0.7862135004212158, "learning_rate": 9.85608820689356e-06, "loss": 0.40647225379943847, "num_input_tokens_seen": 72598448, "step": 2275, "train_runtime": 5968.2423, "train_tokens_per_second": 12164.126 }, { "epoch": 0.15351467815782385, "grad_norm": 0.8981793910298355, "learning_rate": 9.855457723914772e-06, "loss": 0.41314330101013186, "num_input_tokens_seen": 72755712, "step": 2280, "train_runtime": 5981.6016, "train_tokens_per_second": 12163.249 }, { "epoch": 0.153851333153784, "grad_norm": 0.9094111779304819, "learning_rate": 9.854825883122713e-06, "loss": 0.39554009437561033, "num_input_tokens_seen": 72916040, "step": 2285, "train_runtime": 5994.8711, "train_tokens_per_second": 12163.071 }, { "epoch": 0.15418798814974413, "grad_norm": 0.8669042633507054, "learning_rate": 9.85419268469408e-06, "loss": 0.3989769697189331, "num_input_tokens_seen": 73073200, "step": 2290, "train_runtime": 6009.0924, "train_tokens_per_second": 12160.439 }, { "epoch": 0.15452464314570427, "grad_norm": 0.8198038272205199, "learning_rate": 9.85355812880594e-06, "loss": 0.3911727428436279, "num_input_tokens_seen": 73232400, "step": 2295, "train_runtime": 6022.5474, "train_tokens_per_second": 12159.705 }, { "epoch": 0.1548612981416644, "grad_norm": 0.8637946234496597, "learning_rate": 9.852922215635747e-06, "loss": 0.3806226968765259, "num_input_tokens_seen": 73390896, "step": 2300, "train_runtime": 6035.8007, "train_tokens_per_second": 12159.264 }, { "epoch": 0.15519795313762455, "grad_norm": 1.040980399846696, "learning_rate": 9.85228494536133e-06, "loss": 0.44347715377807617, "num_input_tokens_seen": 73549800, "step": 2305, "train_runtime": 6049.1517, "train_tokens_per_second": 12158.697 }, { "epoch": 0.1555346081335847, "grad_norm": 0.9415171415056507, "learning_rate": 9.851646318160901e-06, "loss": 0.4267573833465576, "num_input_tokens_seen": 73710168, "step": 2310, "train_runtime": 6062.413, "train_tokens_per_second": 12158.553 }, { "epoch": 0.15587126312954483, "grad_norm": 0.8401530802692957, "learning_rate": 9.85100633421305e-06, "loss": 0.39694502353668215, "num_input_tokens_seen": 73868280, "step": 2315, "train_runtime": 6075.6392, "train_tokens_per_second": 12158.108 }, { "epoch": 0.15620791812550497, "grad_norm": 0.93708089274018, "learning_rate": 9.850364993696749e-06, "loss": 0.43337383270263674, "num_input_tokens_seen": 74028280, "step": 2320, "train_runtime": 6088.7386, "train_tokens_per_second": 12158.229 }, { "epoch": 0.15654457312146514, "grad_norm": 0.9432320297946613, "learning_rate": 9.849722296791339e-06, "loss": 0.4253643035888672, "num_input_tokens_seen": 74187608, "step": 2325, "train_runtime": 6102.8667, "train_tokens_per_second": 12156.19 }, { "epoch": 0.15688122811742528, "grad_norm": 0.9514214571023777, "learning_rate": 9.849078243676558e-06, "loss": 0.44068102836608886, "num_input_tokens_seen": 74343432, "step": 2330, "train_runtime": 6115.8292, "train_tokens_per_second": 12155.904 }, { "epoch": 0.15721788311338541, "grad_norm": 0.8444722942485434, "learning_rate": 9.848432834532506e-06, "loss": 0.39463765621185304, "num_input_tokens_seen": 74503128, "step": 2335, "train_runtime": 6128.4435, "train_tokens_per_second": 12156.941 }, { "epoch": 0.15755453810934555, "grad_norm": 0.9842436989673532, "learning_rate": 9.847786069539673e-06, "loss": 0.443955135345459, "num_input_tokens_seen": 74665328, "step": 2340, "train_runtime": 6141.4003, "train_tokens_per_second": 12157.704 }, { "epoch": 0.1578911931053057, "grad_norm": 0.8763206059627097, "learning_rate": 9.847137948878926e-06, "loss": 0.4358677387237549, "num_input_tokens_seen": 74824624, "step": 2345, "train_runtime": 6154.7616, "train_tokens_per_second": 12157.193 }, { "epoch": 0.15822784810126583, "grad_norm": 0.9931358669314813, "learning_rate": 9.846488472731505e-06, "loss": 0.4636721134185791, "num_input_tokens_seen": 74987320, "step": 2350, "train_runtime": 6167.4837, "train_tokens_per_second": 12158.495 }, { "epoch": 0.15856450309722597, "grad_norm": 0.8697944936866674, "learning_rate": 9.845837641279038e-06, "loss": 0.4378199577331543, "num_input_tokens_seen": 75148664, "step": 2355, "train_runtime": 6180.3608, "train_tokens_per_second": 12159.268 }, { "epoch": 0.1589011580931861, "grad_norm": 1.0143506592640161, "learning_rate": 9.845185454703528e-06, "loss": 0.4419397830963135, "num_input_tokens_seen": 75309896, "step": 2360, "train_runtime": 6193.4918, "train_tokens_per_second": 12159.521 }, { "epoch": 0.15923781308914625, "grad_norm": 0.8430647178312407, "learning_rate": 9.844531913187356e-06, "loss": 0.3914985418319702, "num_input_tokens_seen": 75469432, "step": 2365, "train_runtime": 6206.8694, "train_tokens_per_second": 12159.017 }, { "epoch": 0.1595744680851064, "grad_norm": 1.0483327683762995, "learning_rate": 9.84387701691328e-06, "loss": 0.4408010482788086, "num_input_tokens_seen": 75624264, "step": 2370, "train_runtime": 6220.8391, "train_tokens_per_second": 12156.602 }, { "epoch": 0.15991112308106653, "grad_norm": 1.0875999522455426, "learning_rate": 9.843220766064443e-06, "loss": 0.4410550117492676, "num_input_tokens_seen": 75775016, "step": 2375, "train_runtime": 6233.8454, "train_tokens_per_second": 12155.421 }, { "epoch": 0.16024777807702667, "grad_norm": 0.9938095872966253, "learning_rate": 9.842563160824364e-06, "loss": 0.45755348205566404, "num_input_tokens_seen": 75929952, "step": 2380, "train_runtime": 6246.8067, "train_tokens_per_second": 12155.003 }, { "epoch": 0.1605844330729868, "grad_norm": 0.9224873550407295, "learning_rate": 9.841904201376939e-06, "loss": 0.44507179260253904, "num_input_tokens_seen": 76091720, "step": 2385, "train_runtime": 6259.4067, "train_tokens_per_second": 12156.379 }, { "epoch": 0.16092108806894695, "grad_norm": 0.8954708178473121, "learning_rate": 9.841243887906443e-06, "loss": 0.3931128740310669, "num_input_tokens_seen": 76248824, "step": 2390, "train_runtime": 6272.2133, "train_tokens_per_second": 12156.606 }, { "epoch": 0.1612577430649071, "grad_norm": 0.9715207985878648, "learning_rate": 9.840582220597532e-06, "loss": 0.41417856216430665, "num_input_tokens_seen": 76409640, "step": 2395, "train_runtime": 6284.8091, "train_tokens_per_second": 12157.83 }, { "epoch": 0.16159439806086723, "grad_norm": 1.0263942745724974, "learning_rate": 9.839919199635238e-06, "loss": 0.44920849800109863, "num_input_tokens_seen": 76568248, "step": 2400, "train_runtime": 6297.7759, "train_tokens_per_second": 12157.982 }, { "epoch": 0.16193105305682737, "grad_norm": 0.8954264246418393, "learning_rate": 9.839254825204973e-06, "loss": 0.4416805744171143, "num_input_tokens_seen": 76732088, "step": 2405, "train_runtime": 6310.208, "train_tokens_per_second": 12159.993 }, { "epoch": 0.1622677080527875, "grad_norm": 0.8590077363557056, "learning_rate": 9.838589097492527e-06, "loss": 0.42504053115844725, "num_input_tokens_seen": 76893152, "step": 2410, "train_runtime": 6323.2115, "train_tokens_per_second": 12160.459 }, { "epoch": 0.16260436304874765, "grad_norm": 1.6131964591850911, "learning_rate": 9.83792201668407e-06, "loss": 0.4367863655090332, "num_input_tokens_seen": 77054616, "step": 2415, "train_runtime": 6335.7627, "train_tokens_per_second": 12161.853 }, { "epoch": 0.16294101804470779, "grad_norm": 0.9932610149244813, "learning_rate": 9.837253582966146e-06, "loss": 0.43808488845825194, "num_input_tokens_seen": 77215984, "step": 2420, "train_runtime": 6348.4083, "train_tokens_per_second": 12163.046 }, { "epoch": 0.16327767304066793, "grad_norm": 0.8794695278434497, "learning_rate": 9.836583796525686e-06, "loss": 0.40805864334106445, "num_input_tokens_seen": 77370960, "step": 2425, "train_runtime": 6361.9206, "train_tokens_per_second": 12161.573 }, { "epoch": 0.16361432803662807, "grad_norm": 0.8687875334455333, "learning_rate": 9.835912657549986e-06, "loss": 0.4591360092163086, "num_input_tokens_seen": 77534032, "step": 2430, "train_runtime": 6375.4291, "train_tokens_per_second": 12161.382 }, { "epoch": 0.1639509830325882, "grad_norm": 1.2016065936588156, "learning_rate": 9.835240166226734e-06, "loss": 0.397727370262146, "num_input_tokens_seen": 77688728, "step": 2435, "train_runtime": 6388.0355, "train_tokens_per_second": 12161.599 }, { "epoch": 0.16428763802854834, "grad_norm": 0.8731767631359908, "learning_rate": 9.834566322743987e-06, "loss": 0.4353171825408936, "num_input_tokens_seen": 77847832, "step": 2440, "train_runtime": 6401.7612, "train_tokens_per_second": 12160.377 }, { "epoch": 0.16462429302450848, "grad_norm": 0.8438337804367104, "learning_rate": 9.833891127290186e-06, "loss": 0.43749122619628905, "num_input_tokens_seen": 78011296, "step": 2445, "train_runtime": 6414.7845, "train_tokens_per_second": 12161.172 }, { "epoch": 0.16496094802046862, "grad_norm": 0.8870021679922767, "learning_rate": 9.833214580054145e-06, "loss": 0.4270503997802734, "num_input_tokens_seen": 78172288, "step": 2450, "train_runtime": 6428.2269, "train_tokens_per_second": 12160.785 }, { "epoch": 0.16529760301642876, "grad_norm": 0.9237164801991081, "learning_rate": 9.832536681225058e-06, "loss": 0.4602365493774414, "num_input_tokens_seen": 78332160, "step": 2455, "train_runtime": 6440.9361, "train_tokens_per_second": 12161.611 }, { "epoch": 0.1656342580123889, "grad_norm": 0.9214469997052653, "learning_rate": 9.831857430992497e-06, "loss": 0.40315423011779783, "num_input_tokens_seen": 78493104, "step": 2460, "train_runtime": 6455.0697, "train_tokens_per_second": 12159.916 }, { "epoch": 0.16597091300834904, "grad_norm": 0.8056048888909143, "learning_rate": 9.831176829546416e-06, "loss": 0.42696781158447267, "num_input_tokens_seen": 78655152, "step": 2465, "train_runtime": 6468.3366, "train_tokens_per_second": 12160.028 }, { "epoch": 0.16630756800430918, "grad_norm": 1.0553250985583589, "learning_rate": 9.830494877077137e-06, "loss": 0.4728592872619629, "num_input_tokens_seen": 78816776, "step": 2470, "train_runtime": 6480.9069, "train_tokens_per_second": 12161.381 }, { "epoch": 0.16664422300026932, "grad_norm": 0.9689257334196517, "learning_rate": 9.82981157377537e-06, "loss": 0.4275308609008789, "num_input_tokens_seen": 78976120, "step": 2475, "train_runtime": 6493.9932, "train_tokens_per_second": 12161.411 }, { "epoch": 0.16698087799622946, "grad_norm": 0.8285231772392113, "learning_rate": 9.829126919832198e-06, "loss": 0.3852450132369995, "num_input_tokens_seen": 79135080, "step": 2480, "train_runtime": 6507.2063, "train_tokens_per_second": 12161.145 }, { "epoch": 0.1673175329921896, "grad_norm": 0.8967928469902711, "learning_rate": 9.82844091543908e-06, "loss": 0.4357333183288574, "num_input_tokens_seen": 79298848, "step": 2485, "train_runtime": 6520.3067, "train_tokens_per_second": 12161.828 }, { "epoch": 0.16765418798814974, "grad_norm": 0.9143571418251295, "learning_rate": 9.82775356078786e-06, "loss": 0.42016186714172366, "num_input_tokens_seen": 79456992, "step": 2490, "train_runtime": 6533.9499, "train_tokens_per_second": 12160.637 }, { "epoch": 0.16799084298410988, "grad_norm": 0.9118578208778196, "learning_rate": 9.82706485607075e-06, "loss": 0.38487706184387205, "num_input_tokens_seen": 79611344, "step": 2495, "train_runtime": 6547.0016, "train_tokens_per_second": 12159.97 }, { "epoch": 0.16832749798007002, "grad_norm": 0.8450782831368749, "learning_rate": 9.826374801480346e-06, "loss": 0.410227632522583, "num_input_tokens_seen": 79770824, "step": 2500, "train_runtime": 6560.7522, "train_tokens_per_second": 12158.792 }, { "epoch": 0.16866415297603016, "grad_norm": 0.8375845343278367, "learning_rate": 9.825683397209617e-06, "loss": 0.4221829414367676, "num_input_tokens_seen": 79920104, "step": 2505, "train_runtime": 6573.4772, "train_tokens_per_second": 12157.965 }, { "epoch": 0.1690008079719903, "grad_norm": 0.7837675798267905, "learning_rate": 9.824990643451915e-06, "loss": 0.4117011547088623, "num_input_tokens_seen": 80081520, "step": 2510, "train_runtime": 6586.5265, "train_tokens_per_second": 12158.384 }, { "epoch": 0.16933746296795044, "grad_norm": 0.8697124256039522, "learning_rate": 9.824296540400965e-06, "loss": 0.40143237113952634, "num_input_tokens_seen": 80244744, "step": 2515, "train_runtime": 6599.4131, "train_tokens_per_second": 12159.376 }, { "epoch": 0.16967411796391058, "grad_norm": 1.0611311966583283, "learning_rate": 9.823601088250872e-06, "loss": 0.4585402488708496, "num_input_tokens_seen": 80398424, "step": 2520, "train_runtime": 6612.251, "train_tokens_per_second": 12159.01 }, { "epoch": 0.17001077295987072, "grad_norm": 0.8557854915028446, "learning_rate": 9.822904287196114e-06, "loss": 0.43123817443847656, "num_input_tokens_seen": 80557272, "step": 2525, "train_runtime": 6625.5651, "train_tokens_per_second": 12158.551 }, { "epoch": 0.17034742795583085, "grad_norm": 0.8191619605994133, "learning_rate": 9.822206137431553e-06, "loss": 0.40825510025024414, "num_input_tokens_seen": 80718240, "step": 2530, "train_runtime": 6638.029, "train_tokens_per_second": 12159.971 }, { "epoch": 0.170684082951791, "grad_norm": 0.8126959627832543, "learning_rate": 9.821506639152421e-06, "loss": 0.4190530300140381, "num_input_tokens_seen": 80879840, "step": 2535, "train_runtime": 6651.1124, "train_tokens_per_second": 12160.348 }, { "epoch": 0.17102073794775113, "grad_norm": 0.8496155390347591, "learning_rate": 9.820805792554334e-06, "loss": 0.4158648490905762, "num_input_tokens_seen": 81041736, "step": 2540, "train_runtime": 6664.2902, "train_tokens_per_second": 12160.595 }, { "epoch": 0.17135739294371127, "grad_norm": 0.9451309622270121, "learning_rate": 9.820103597833278e-06, "loss": 0.4214468002319336, "num_input_tokens_seen": 81201000, "step": 2545, "train_runtime": 6677.4235, "train_tokens_per_second": 12160.529 }, { "epoch": 0.1716940479396714, "grad_norm": 0.8402392769387538, "learning_rate": 9.819400055185622e-06, "loss": 0.4187011241912842, "num_input_tokens_seen": 81361200, "step": 2550, "train_runtime": 6690.8951, "train_tokens_per_second": 12159.987 }, { "epoch": 0.17203070293563155, "grad_norm": 0.9037007349024135, "learning_rate": 9.818695164808108e-06, "loss": 0.41239018440246583, "num_input_tokens_seen": 81523800, "step": 2555, "train_runtime": 6703.5938, "train_tokens_per_second": 12161.208 }, { "epoch": 0.1723673579315917, "grad_norm": 0.9297174818427115, "learning_rate": 9.817988926897856e-06, "loss": 0.39138197898864746, "num_input_tokens_seen": 81682504, "step": 2560, "train_runtime": 6716.8172, "train_tokens_per_second": 12160.894 }, { "epoch": 0.17270401292755186, "grad_norm": 0.9393954949772274, "learning_rate": 9.817281341652367e-06, "loss": 0.42818775177001955, "num_input_tokens_seen": 81844192, "step": 2565, "train_runtime": 6729.3381, "train_tokens_per_second": 12162.294 }, { "epoch": 0.173040667923512, "grad_norm": 0.8832508392667486, "learning_rate": 9.816572409269508e-06, "loss": 0.402614688873291, "num_input_tokens_seen": 82006440, "step": 2570, "train_runtime": 6742.1024, "train_tokens_per_second": 12163.334 }, { "epoch": 0.17337732291947214, "grad_norm": 0.8466478124703766, "learning_rate": 9.815862129947537e-06, "loss": 0.42305798530578614, "num_input_tokens_seen": 82166424, "step": 2575, "train_runtime": 6754.9399, "train_tokens_per_second": 12163.902 }, { "epoch": 0.17371397791543228, "grad_norm": 0.774763775922723, "learning_rate": 9.815150503885078e-06, "loss": 0.367329740524292, "num_input_tokens_seen": 82328816, "step": 2580, "train_runtime": 6768.293, "train_tokens_per_second": 12163.897 }, { "epoch": 0.17405063291139242, "grad_norm": 0.9261869754299975, "learning_rate": 9.814437531281133e-06, "loss": 0.40413622856140136, "num_input_tokens_seen": 82491080, "step": 2585, "train_runtime": 6781.6228, "train_tokens_per_second": 12163.915 }, { "epoch": 0.17438728790735256, "grad_norm": 1.0138226450468546, "learning_rate": 9.813723212335085e-06, "loss": 0.45269336700439455, "num_input_tokens_seen": 82643744, "step": 2590, "train_runtime": 6794.8755, "train_tokens_per_second": 12162.658 }, { "epoch": 0.1747239429033127, "grad_norm": 0.8426136420315739, "learning_rate": 9.813007547246691e-06, "loss": 0.4036527633666992, "num_input_tokens_seen": 82805256, "step": 2595, "train_runtime": 6807.6723, "train_tokens_per_second": 12163.52 }, { "epoch": 0.17506059789927284, "grad_norm": 0.8414014497399007, "learning_rate": 9.812290536216083e-06, "loss": 0.4595314025878906, "num_input_tokens_seen": 82958360, "step": 2600, "train_runtime": 6821.2966, "train_tokens_per_second": 12161.67 }, { "epoch": 0.17539725289523297, "grad_norm": 0.7955425707874572, "learning_rate": 9.811572179443773e-06, "loss": 0.38980703353881835, "num_input_tokens_seen": 83119088, "step": 2605, "train_runtime": 6833.7817, "train_tokens_per_second": 12162.971 }, { "epoch": 0.17573390789119311, "grad_norm": 0.8183931476197165, "learning_rate": 9.810852477130645e-06, "loss": 0.41729736328125, "num_input_tokens_seen": 83274536, "step": 2610, "train_runtime": 6847.748, "train_tokens_per_second": 12160.865 }, { "epoch": 0.17607056288715325, "grad_norm": 0.8895853968317164, "learning_rate": 9.810131429477964e-06, "loss": 0.39148788452148436, "num_input_tokens_seen": 83435416, "step": 2615, "train_runtime": 6860.1969, "train_tokens_per_second": 12162.248 }, { "epoch": 0.1764072178831134, "grad_norm": 0.8620651172704589, "learning_rate": 9.809409036687364e-06, "loss": 0.4088418006896973, "num_input_tokens_seen": 83597400, "step": 2620, "train_runtime": 6873.4452, "train_tokens_per_second": 12162.372 }, { "epoch": 0.17674387287907353, "grad_norm": 0.8246484917953475, "learning_rate": 9.808685298960867e-06, "loss": 0.4190103054046631, "num_input_tokens_seen": 83758200, "step": 2625, "train_runtime": 6886.2817, "train_tokens_per_second": 12163.052 }, { "epoch": 0.17708052787503367, "grad_norm": 0.8588629656167998, "learning_rate": 9.807960216500858e-06, "loss": 0.42969322204589844, "num_input_tokens_seen": 83915552, "step": 2630, "train_runtime": 6899.6483, "train_tokens_per_second": 12162.294 }, { "epoch": 0.1774171828709938, "grad_norm": 1.0135195974125502, "learning_rate": 9.807233789510106e-06, "loss": 0.37296199798583984, "num_input_tokens_seen": 84076096, "step": 2635, "train_runtime": 6913.9177, "train_tokens_per_second": 12160.413 }, { "epoch": 0.17775383786695395, "grad_norm": 0.7809124707439674, "learning_rate": 9.806506018191754e-06, "loss": 0.38485772609710694, "num_input_tokens_seen": 84236056, "step": 2640, "train_runtime": 6926.647, "train_tokens_per_second": 12161.159 }, { "epoch": 0.1780904928629141, "grad_norm": 1.0144407983937282, "learning_rate": 9.80577690274932e-06, "loss": 0.4194784164428711, "num_input_tokens_seen": 84399400, "step": 2645, "train_runtime": 6939.7689, "train_tokens_per_second": 12161.702 }, { "epoch": 0.17842714785887423, "grad_norm": 0.7521181520011776, "learning_rate": 9.8050464433867e-06, "loss": 0.3938760757446289, "num_input_tokens_seen": 84559960, "step": 2650, "train_runtime": 6952.834, "train_tokens_per_second": 12161.941 }, { "epoch": 0.17876380285483437, "grad_norm": 0.9689786862195398, "learning_rate": 9.804314640308165e-06, "loss": 0.44164037704467773, "num_input_tokens_seen": 84723800, "step": 2655, "train_runtime": 6965.2711, "train_tokens_per_second": 12163.748 }, { "epoch": 0.1791004578507945, "grad_norm": 0.9156543326978483, "learning_rate": 9.803581493718361e-06, "loss": 0.4237776756286621, "num_input_tokens_seen": 84883616, "step": 2660, "train_runtime": 6978.1955, "train_tokens_per_second": 12164.121 }, { "epoch": 0.17943711284675465, "grad_norm": 0.8221596882586261, "learning_rate": 9.80284700382231e-06, "loss": 0.4029380798339844, "num_input_tokens_seen": 85047456, "step": 2665, "train_runtime": 6990.6242, "train_tokens_per_second": 12165.932 }, { "epoch": 0.1797737678427148, "grad_norm": 0.7769300670443012, "learning_rate": 9.802111170825408e-06, "loss": 0.42000017166137693, "num_input_tokens_seen": 85210840, "step": 2670, "train_runtime": 7003.6331, "train_tokens_per_second": 12166.662 }, { "epoch": 0.18011042283867493, "grad_norm": 0.8866332542495312, "learning_rate": 9.80137399493343e-06, "loss": 0.4232648849487305, "num_input_tokens_seen": 85368704, "step": 2675, "train_runtime": 7017.1544, "train_tokens_per_second": 12165.715 }, { "epoch": 0.18044707783463507, "grad_norm": 0.9409106245388923, "learning_rate": 9.800635476352525e-06, "loss": 0.38126511573791505, "num_input_tokens_seen": 85523832, "step": 2680, "train_runtime": 7030.4943, "train_tokens_per_second": 12164.697 }, { "epoch": 0.1807837328305952, "grad_norm": 1.0123542346764463, "learning_rate": 9.799895615289218e-06, "loss": 0.3863433837890625, "num_input_tokens_seen": 85681544, "step": 2685, "train_runtime": 7043.2736, "train_tokens_per_second": 12165.017 }, { "epoch": 0.18112038782655535, "grad_norm": 1.098626435506201, "learning_rate": 9.799154411950407e-06, "loss": 0.45793566703796384, "num_input_tokens_seen": 85844584, "step": 2690, "train_runtime": 7056.1259, "train_tokens_per_second": 12165.966 }, { "epoch": 0.18145704282251549, "grad_norm": 1.1325905133131922, "learning_rate": 9.79841186654337e-06, "loss": 0.4152644157409668, "num_input_tokens_seen": 86002320, "step": 2695, "train_runtime": 7069.3229, "train_tokens_per_second": 12165.567 }, { "epoch": 0.18179369781847562, "grad_norm": 0.9374756267248823, "learning_rate": 9.797667979275752e-06, "loss": 0.44652814865112306, "num_input_tokens_seen": 86157600, "step": 2700, "train_runtime": 7082.855, "train_tokens_per_second": 12164.247 }, { "epoch": 0.18213035281443576, "grad_norm": 0.8491406094262439, "learning_rate": 9.796922750355584e-06, "loss": 0.4005905628204346, "num_input_tokens_seen": 86311024, "step": 2705, "train_runtime": 7095.5694, "train_tokens_per_second": 12164.073 }, { "epoch": 0.1824670078103959, "grad_norm": 0.8990044402579392, "learning_rate": 9.796176179991266e-06, "loss": 0.425658130645752, "num_input_tokens_seen": 86471544, "step": 2710, "train_runtime": 7108.7293, "train_tokens_per_second": 12164.135 }, { "epoch": 0.18280366280635604, "grad_norm": 0.8891891913189444, "learning_rate": 9.795428268391572e-06, "loss": 0.403977108001709, "num_input_tokens_seen": 86630224, "step": 2715, "train_runtime": 7122.4635, "train_tokens_per_second": 12162.958 }, { "epoch": 0.18314031780231618, "grad_norm": 0.9094741656220893, "learning_rate": 9.794679015765655e-06, "loss": 0.4087190628051758, "num_input_tokens_seen": 86788728, "step": 2720, "train_runtime": 7135.5668, "train_tokens_per_second": 12162.836 }, { "epoch": 0.18347697279827632, "grad_norm": 1.0351580409636236, "learning_rate": 9.793928422323041e-06, "loss": 0.4177706718444824, "num_input_tokens_seen": 86950832, "step": 2725, "train_runtime": 7148.8797, "train_tokens_per_second": 12162.861 }, { "epoch": 0.18381362779423646, "grad_norm": 1.0331667856852635, "learning_rate": 9.793176488273629e-06, "loss": 0.41898436546325685, "num_input_tokens_seen": 87105184, "step": 2730, "train_runtime": 7161.7664, "train_tokens_per_second": 12162.528 }, { "epoch": 0.1841502827901966, "grad_norm": 0.8513843479720603, "learning_rate": 9.792423213827697e-06, "loss": 0.3745435237884521, "num_input_tokens_seen": 87264928, "step": 2735, "train_runtime": 7174.6237, "train_tokens_per_second": 12162.997 }, { "epoch": 0.18448693778615674, "grad_norm": 0.8666803968531231, "learning_rate": 9.791668599195897e-06, "loss": 0.3980299711227417, "num_input_tokens_seen": 87424552, "step": 2740, "train_runtime": 7187.7765, "train_tokens_per_second": 12162.948 }, { "epoch": 0.18482359278211688, "grad_norm": 0.8030918471890202, "learning_rate": 9.790912644589248e-06, "loss": 0.4387831211090088, "num_input_tokens_seen": 87580968, "step": 2745, "train_runtime": 7201.8702, "train_tokens_per_second": 12160.865 }, { "epoch": 0.18516024777807702, "grad_norm": 0.9206122330144707, "learning_rate": 9.790155350219159e-06, "loss": 0.417657470703125, "num_input_tokens_seen": 87739344, "step": 2750, "train_runtime": 7214.3685, "train_tokens_per_second": 12161.75 }, { "epoch": 0.18549690277403716, "grad_norm": 0.8551440661183929, "learning_rate": 9.789396716297399e-06, "loss": 0.4504976272583008, "num_input_tokens_seen": 87902840, "step": 2755, "train_runtime": 7227.3929, "train_tokens_per_second": 12162.455 }, { "epoch": 0.1858335577699973, "grad_norm": 0.9362762822669367, "learning_rate": 9.788636743036122e-06, "loss": 0.3734339475631714, "num_input_tokens_seen": 88060096, "step": 2760, "train_runtime": 7240.6836, "train_tokens_per_second": 12161.848 }, { "epoch": 0.18617021276595744, "grad_norm": 0.8145318910541296, "learning_rate": 9.787875430647847e-06, "loss": 0.3930145263671875, "num_input_tokens_seen": 88222640, "step": 2765, "train_runtime": 7253.4231, "train_tokens_per_second": 12162.897 }, { "epoch": 0.18650686776191758, "grad_norm": 0.7981761472815465, "learning_rate": 9.787112779345477e-06, "loss": 0.4006065845489502, "num_input_tokens_seen": 88379192, "step": 2770, "train_runtime": 7267.1114, "train_tokens_per_second": 12161.53 }, { "epoch": 0.18684352275787772, "grad_norm": 0.9598533194834584, "learning_rate": 9.786348789342283e-06, "loss": 0.4450218200683594, "num_input_tokens_seen": 88536504, "step": 2775, "train_runtime": 7280.1281, "train_tokens_per_second": 12161.394 }, { "epoch": 0.18718017775383786, "grad_norm": 0.8716847862241821, "learning_rate": 9.785583460851912e-06, "loss": 0.39981999397277834, "num_input_tokens_seen": 88697776, "step": 2780, "train_runtime": 7293.0778, "train_tokens_per_second": 12161.913 }, { "epoch": 0.187516832749798, "grad_norm": 0.910674818087515, "learning_rate": 9.784816794088386e-06, "loss": 0.4131113052368164, "num_input_tokens_seen": 88859520, "step": 2785, "train_runtime": 7305.6749, "train_tokens_per_second": 12163.082 }, { "epoch": 0.18785348774575814, "grad_norm": 0.9720515826750926, "learning_rate": 9.784048789266101e-06, "loss": 0.4105926513671875, "num_input_tokens_seen": 89013912, "step": 2790, "train_runtime": 7318.59, "train_tokens_per_second": 12162.713 }, { "epoch": 0.18819014274171827, "grad_norm": 0.8711404511229854, "learning_rate": 9.78327944659983e-06, "loss": 0.43026247024536135, "num_input_tokens_seen": 89172584, "step": 2795, "train_runtime": 7332.1093, "train_tokens_per_second": 12161.928 }, { "epoch": 0.18852679773767841, "grad_norm": 0.8164065363789803, "learning_rate": 9.78250876630471e-06, "loss": 0.41289725303649905, "num_input_tokens_seen": 89326984, "step": 2800, "train_runtime": 7345.5873, "train_tokens_per_second": 12160.632 }, { "epoch": 0.18886345273363855, "grad_norm": 1.0155942984958568, "learning_rate": 9.781736748596267e-06, "loss": 0.4130856513977051, "num_input_tokens_seen": 89482336, "step": 2805, "train_runtime": 7358.7224, "train_tokens_per_second": 12160.037 }, { "epoch": 0.18920010772959872, "grad_norm": 0.8422345644716879, "learning_rate": 9.78096339369039e-06, "loss": 0.3859609842300415, "num_input_tokens_seen": 89638376, "step": 2810, "train_runtime": 7372.1145, "train_tokens_per_second": 12159.113 }, { "epoch": 0.18953676272555886, "grad_norm": 0.8106747269763328, "learning_rate": 9.780188701803345e-06, "loss": 0.44630231857299807, "num_input_tokens_seen": 89802168, "step": 2815, "train_runtime": 7385.2602, "train_tokens_per_second": 12159.649 }, { "epoch": 0.189873417721519, "grad_norm": 0.872900128190699, "learning_rate": 9.779412673151772e-06, "loss": 0.41963987350463866, "num_input_tokens_seen": 89963536, "step": 2820, "train_runtime": 7397.801, "train_tokens_per_second": 12160.848 }, { "epoch": 0.19021007271747914, "grad_norm": 0.8565924751370928, "learning_rate": 9.778635307952686e-06, "loss": 0.4156802177429199, "num_input_tokens_seen": 90122712, "step": 2825, "train_runtime": 7410.4509, "train_tokens_per_second": 12161.569 }, { "epoch": 0.19054672771343928, "grad_norm": 1.0698030465139041, "learning_rate": 9.777856606423472e-06, "loss": 0.41915321350097656, "num_input_tokens_seen": 90286104, "step": 2830, "train_runtime": 7424.9422, "train_tokens_per_second": 12159.839 }, { "epoch": 0.19088338270939942, "grad_norm": 0.8986591027777142, "learning_rate": 9.777076568781897e-06, "loss": 0.4459648132324219, "num_input_tokens_seen": 90440088, "step": 2835, "train_runtime": 7438.485, "train_tokens_per_second": 12158.402 }, { "epoch": 0.19122003770535956, "grad_norm": 0.8342790040470093, "learning_rate": 9.77629519524609e-06, "loss": 0.37772140502929685, "num_input_tokens_seen": 90595824, "step": 2840, "train_runtime": 7451.5547, "train_tokens_per_second": 12157.976 }, { "epoch": 0.1915566927013197, "grad_norm": 0.8408752721654029, "learning_rate": 9.775512486034564e-06, "loss": 0.4278468132019043, "num_input_tokens_seen": 90754960, "step": 2845, "train_runtime": 7464.817, "train_tokens_per_second": 12157.694 }, { "epoch": 0.19189334769727984, "grad_norm": 0.8521883494579162, "learning_rate": 9.774728441366197e-06, "loss": 0.41966590881347654, "num_input_tokens_seen": 90910112, "step": 2850, "train_runtime": 7478.3399, "train_tokens_per_second": 12156.456 }, { "epoch": 0.19223000269323998, "grad_norm": 0.8642989378062204, "learning_rate": 9.773943061460249e-06, "loss": 0.390500807762146, "num_input_tokens_seen": 91067432, "step": 2855, "train_runtime": 7491.5905, "train_tokens_per_second": 12155.954 }, { "epoch": 0.19256665768920012, "grad_norm": 0.894117584925718, "learning_rate": 9.773156346536345e-06, "loss": 0.43290910720825193, "num_input_tokens_seen": 91230056, "step": 2860, "train_runtime": 7504.9646, "train_tokens_per_second": 12155.961 }, { "epoch": 0.19290331268516026, "grad_norm": 0.8518180966932317, "learning_rate": 9.772368296814489e-06, "loss": 0.38295803070068357, "num_input_tokens_seen": 91388624, "step": 2865, "train_runtime": 7518.0106, "train_tokens_per_second": 12155.958 }, { "epoch": 0.1932399676811204, "grad_norm": 0.7887625782981932, "learning_rate": 9.771578912515058e-06, "loss": 0.45216002464294436, "num_input_tokens_seen": 91546448, "step": 2870, "train_runtime": 7530.8069, "train_tokens_per_second": 12156.26 }, { "epoch": 0.19357662267708053, "grad_norm": 0.9211482501729458, "learning_rate": 9.7707881938588e-06, "loss": 0.4019335746765137, "num_input_tokens_seen": 91707400, "step": 2875, "train_runtime": 7544.5763, "train_tokens_per_second": 12155.408 }, { "epoch": 0.19391327767304067, "grad_norm": 0.8826251271691166, "learning_rate": 9.769996141066836e-06, "loss": 0.4338651657104492, "num_input_tokens_seen": 91869920, "step": 2880, "train_runtime": 7557.0555, "train_tokens_per_second": 12156.841 }, { "epoch": 0.1942499326690008, "grad_norm": 0.8697792140617978, "learning_rate": 9.76920275436066e-06, "loss": 0.4350432395935059, "num_input_tokens_seen": 92033560, "step": 2885, "train_runtime": 7570.127, "train_tokens_per_second": 12157.466 }, { "epoch": 0.19458658766496095, "grad_norm": 1.0903094359374617, "learning_rate": 9.768408033962145e-06, "loss": 0.446491003036499, "num_input_tokens_seen": 92195696, "step": 2890, "train_runtime": 7583.0794, "train_tokens_per_second": 12158.081 }, { "epoch": 0.1949232426609211, "grad_norm": 0.9335200253214792, "learning_rate": 9.767611980093525e-06, "loss": 0.4211887836456299, "num_input_tokens_seen": 92358584, "step": 2895, "train_runtime": 7596.5506, "train_tokens_per_second": 12157.963 }, { "epoch": 0.19525989765688123, "grad_norm": 0.8276915732212518, "learning_rate": 9.76681459297742e-06, "loss": 0.4165052890777588, "num_input_tokens_seen": 92518424, "step": 2900, "train_runtime": 7609.3436, "train_tokens_per_second": 12158.529 }, { "epoch": 0.19559655265284137, "grad_norm": 1.01759440098603, "learning_rate": 9.766015872836814e-06, "loss": 0.47567176818847656, "num_input_tokens_seen": 92678896, "step": 2905, "train_runtime": 7621.8279, "train_tokens_per_second": 12159.668 }, { "epoch": 0.1959332076488015, "grad_norm": 1.1625047414651473, "learning_rate": 9.765215819895066e-06, "loss": 0.43273239135742186, "num_input_tokens_seen": 92839112, "step": 2910, "train_runtime": 7634.3086, "train_tokens_per_second": 12160.775 }, { "epoch": 0.19626986264476165, "grad_norm": 0.8158629948489308, "learning_rate": 9.76441443437591e-06, "loss": 0.393531060218811, "num_input_tokens_seen": 93001648, "step": 2915, "train_runtime": 7647.6992, "train_tokens_per_second": 12160.736 }, { "epoch": 0.1966065176407218, "grad_norm": 0.7954184432681562, "learning_rate": 9.76361171650345e-06, "loss": 0.4203947067260742, "num_input_tokens_seen": 93162648, "step": 2920, "train_runtime": 7660.9004, "train_tokens_per_second": 12160.796 }, { "epoch": 0.19694317263668193, "grad_norm": 0.9471817720249008, "learning_rate": 9.762807666502164e-06, "loss": 0.42482929229736327, "num_input_tokens_seen": 93319936, "step": 2925, "train_runtime": 7673.6178, "train_tokens_per_second": 12161.139 }, { "epoch": 0.19727982763264207, "grad_norm": 0.8768205029130177, "learning_rate": 9.762002284596898e-06, "loss": 0.43389034271240234, "num_input_tokens_seen": 93480400, "step": 2930, "train_runtime": 7687.0679, "train_tokens_per_second": 12160.736 }, { "epoch": 0.1976164826286022, "grad_norm": 1.0118364807310998, "learning_rate": 9.761195571012882e-06, "loss": 0.44169158935546876, "num_input_tokens_seen": 93634912, "step": 2935, "train_runtime": 7700.6411, "train_tokens_per_second": 12159.366 }, { "epoch": 0.19795313762456235, "grad_norm": 0.9102576448858622, "learning_rate": 9.760387525975705e-06, "loss": 0.410272216796875, "num_input_tokens_seen": 93796968, "step": 2940, "train_runtime": 7713.3396, "train_tokens_per_second": 12160.358 }, { "epoch": 0.1982897926205225, "grad_norm": 0.7958475773304091, "learning_rate": 9.759578149711337e-06, "loss": 0.3830035924911499, "num_input_tokens_seen": 93960704, "step": 2945, "train_runtime": 7726.4358, "train_tokens_per_second": 12160.938 }, { "epoch": 0.19862644761648263, "grad_norm": 0.8329908107054564, "learning_rate": 9.758767442446117e-06, "loss": 0.39389288425445557, "num_input_tokens_seen": 94123704, "step": 2950, "train_runtime": 7739.3374, "train_tokens_per_second": 12161.726 }, { "epoch": 0.19896310261244277, "grad_norm": 0.8390174649344401, "learning_rate": 9.757955404406755e-06, "loss": 0.37879266738891604, "num_input_tokens_seen": 94286048, "step": 2955, "train_runtime": 7753.4735, "train_tokens_per_second": 12160.491 }, { "epoch": 0.1992997576084029, "grad_norm": 0.8677565205797986, "learning_rate": 9.757142035820337e-06, "loss": 0.3828702688217163, "num_input_tokens_seen": 94437776, "step": 2960, "train_runtime": 7766.2468, "train_tokens_per_second": 12160.028 }, { "epoch": 0.19963641260436304, "grad_norm": 0.927542779772148, "learning_rate": 9.756327336914318e-06, "loss": 0.4129635810852051, "num_input_tokens_seen": 94594824, "step": 2965, "train_runtime": 7779.0812, "train_tokens_per_second": 12160.154 }, { "epoch": 0.19997306760032318, "grad_norm": 1.1419132753671308, "learning_rate": 9.755511307916526e-06, "loss": 0.4133798599243164, "num_input_tokens_seen": 94753928, "step": 2970, "train_runtime": 7792.1302, "train_tokens_per_second": 12160.208 }, { "epoch": 0.20030972259628332, "grad_norm": 0.9776269219331849, "learning_rate": 9.754693949055161e-06, "loss": 0.43349714279174806, "num_input_tokens_seen": 94914776, "step": 2975, "train_runtime": 7804.5945, "train_tokens_per_second": 12161.398 }, { "epoch": 0.20064637759224346, "grad_norm": 0.854838153204509, "learning_rate": 9.753875260558795e-06, "loss": 0.4501204490661621, "num_input_tokens_seen": 95068304, "step": 2980, "train_runtime": 7818.2941, "train_tokens_per_second": 12159.725 }, { "epoch": 0.2009830325882036, "grad_norm": 0.8760234967586558, "learning_rate": 9.75305524265637e-06, "loss": 0.40970430374145506, "num_input_tokens_seen": 95231064, "step": 2985, "train_runtime": 7831.6655, "train_tokens_per_second": 12159.746 }, { "epoch": 0.20131968758416374, "grad_norm": 0.8818880816417082, "learning_rate": 9.752233895577205e-06, "loss": 0.4172060012817383, "num_input_tokens_seen": 95387144, "step": 2990, "train_runtime": 7844.9517, "train_tokens_per_second": 12159.048 }, { "epoch": 0.20165634258012388, "grad_norm": 0.7218494693494788, "learning_rate": 9.751411219550984e-06, "loss": 0.4078125, "num_input_tokens_seen": 95548240, "step": 2995, "train_runtime": 7858.6602, "train_tokens_per_second": 12158.337 }, { "epoch": 0.20199299757608402, "grad_norm": 1.1790781023404124, "learning_rate": 9.750587214807766e-06, "loss": 0.4112940788269043, "num_input_tokens_seen": 95705288, "step": 3000, "train_runtime": 7872.4553, "train_tokens_per_second": 12156.981 }, { "epoch": 0.20232965257204416, "grad_norm": 0.9196973959618487, "learning_rate": 9.749761881577981e-06, "loss": 0.4491419792175293, "num_input_tokens_seen": 95869128, "step": 3005, "train_runtime": 7884.8991, "train_tokens_per_second": 12158.574 }, { "epoch": 0.2026663075680043, "grad_norm": 0.7973597683978836, "learning_rate": 9.748935220092434e-06, "loss": 0.40469770431518554, "num_input_tokens_seen": 96032536, "step": 3010, "train_runtime": 7897.9103, "train_tokens_per_second": 12159.234 }, { "epoch": 0.20300296256396444, "grad_norm": 0.8995241253842347, "learning_rate": 9.748107230582295e-06, "loss": 0.39678263664245605, "num_input_tokens_seen": 96186080, "step": 3015, "train_runtime": 7910.6393, "train_tokens_per_second": 12159.078 }, { "epoch": 0.20333961755992458, "grad_norm": 0.7974175987572382, "learning_rate": 9.747277913279109e-06, "loss": 0.4466853141784668, "num_input_tokens_seen": 96345216, "step": 3020, "train_runtime": 7923.8113, "train_tokens_per_second": 12158.949 }, { "epoch": 0.20367627255588472, "grad_norm": 0.8304329993373757, "learning_rate": 9.746447268414794e-06, "loss": 0.436503267288208, "num_input_tokens_seen": 96506360, "step": 3025, "train_runtime": 7936.3638, "train_tokens_per_second": 12160.022 }, { "epoch": 0.20401292755184486, "grad_norm": 0.9572821429492109, "learning_rate": 9.745615296221635e-06, "loss": 0.4237049579620361, "num_input_tokens_seen": 96668832, "step": 3030, "train_runtime": 7949.4524, "train_tokens_per_second": 12160.439 }, { "epoch": 0.204349582547805, "grad_norm": 0.7972173189225592, "learning_rate": 9.74478199693229e-06, "loss": 0.4324819087982178, "num_input_tokens_seen": 96832480, "step": 3035, "train_runtime": 7962.5041, "train_tokens_per_second": 12161.059 }, { "epoch": 0.20468623754376514, "grad_norm": 1.336232294002001, "learning_rate": 9.743947370779791e-06, "loss": 0.42787981033325195, "num_input_tokens_seen": 96995840, "step": 3040, "train_runtime": 7975.4913, "train_tokens_per_second": 12161.739 }, { "epoch": 0.20502289253972528, "grad_norm": 0.8748869490603304, "learning_rate": 9.743111417997536e-06, "loss": 0.4295599937438965, "num_input_tokens_seen": 97154256, "step": 3045, "train_runtime": 7988.0299, "train_tokens_per_second": 12162.48 }, { "epoch": 0.20535954753568542, "grad_norm": 0.8920763711941498, "learning_rate": 9.742274138819298e-06, "loss": 0.4323575496673584, "num_input_tokens_seen": 97310736, "step": 3050, "train_runtime": 8001.5648, "train_tokens_per_second": 12161.463 }, { "epoch": 0.20569620253164558, "grad_norm": 1.0095917523925655, "learning_rate": 9.74143553347922e-06, "loss": 0.4573812484741211, "num_input_tokens_seen": 97467776, "step": 3055, "train_runtime": 8014.1969, "train_tokens_per_second": 12161.889 }, { "epoch": 0.20603285752760572, "grad_norm": 0.8332008065946794, "learning_rate": 9.740595602211814e-06, "loss": 0.39818904399871824, "num_input_tokens_seen": 97629216, "step": 3060, "train_runtime": 8028.6216, "train_tokens_per_second": 12160.147 }, { "epoch": 0.20636951252356586, "grad_norm": 0.8005408499866398, "learning_rate": 9.739754345251963e-06, "loss": 0.37448973655700685, "num_input_tokens_seen": 97786176, "step": 3065, "train_runtime": 8041.9188, "train_tokens_per_second": 12159.558 }, { "epoch": 0.206706167519526, "grad_norm": 0.7996545807373647, "learning_rate": 9.738911762834924e-06, "loss": 0.36400160789489744, "num_input_tokens_seen": 97948256, "step": 3070, "train_runtime": 8054.8616, "train_tokens_per_second": 12160.141 }, { "epoch": 0.20704282251548614, "grad_norm": 0.9714099397223024, "learning_rate": 9.738067855196323e-06, "loss": 0.41321558952331544, "num_input_tokens_seen": 98108008, "step": 3075, "train_runtime": 8068.1005, "train_tokens_per_second": 12159.988 }, { "epoch": 0.20737947751144628, "grad_norm": 1.369065615445435, "learning_rate": 9.737222622572153e-06, "loss": 0.4634650230407715, "num_input_tokens_seen": 98266064, "step": 3080, "train_runtime": 8081.9079, "train_tokens_per_second": 12158.771 }, { "epoch": 0.20771613250740642, "grad_norm": 1.120909995185053, "learning_rate": 9.736376065198784e-06, "loss": 0.43927874565124514, "num_input_tokens_seen": 98427848, "step": 3085, "train_runtime": 8095.4609, "train_tokens_per_second": 12158.4 }, { "epoch": 0.20805278750336656, "grad_norm": 0.8086704751867378, "learning_rate": 9.735528183312951e-06, "loss": 0.4097087860107422, "num_input_tokens_seen": 98591688, "step": 3090, "train_runtime": 8107.8895, "train_tokens_per_second": 12159.969 }, { "epoch": 0.2083894424993267, "grad_norm": 0.8915868941281733, "learning_rate": 9.734678977151762e-06, "loss": 0.38752074241638185, "num_input_tokens_seen": 98748168, "step": 3095, "train_runtime": 8120.4895, "train_tokens_per_second": 12160.371 }, { "epoch": 0.20872609749528684, "grad_norm": 0.8231356778578908, "learning_rate": 9.733828446952696e-06, "loss": 0.4035062789916992, "num_input_tokens_seen": 98910264, "step": 3100, "train_runtime": 8133.6192, "train_tokens_per_second": 12160.671 }, { "epoch": 0.20906275249124698, "grad_norm": 0.8821657328268957, "learning_rate": 9.732976592953598e-06, "loss": 0.40680575370788574, "num_input_tokens_seen": 99072408, "step": 3105, "train_runtime": 8146.8998, "train_tokens_per_second": 12160.75 }, { "epoch": 0.20939940748720712, "grad_norm": 0.8565146753565397, "learning_rate": 9.73212341539269e-06, "loss": 0.41437864303588867, "num_input_tokens_seen": 99234840, "step": 3110, "train_runtime": 8159.3684, "train_tokens_per_second": 12162.074 }, { "epoch": 0.20973606248316726, "grad_norm": 0.8276772182350852, "learning_rate": 9.731268914508556e-06, "loss": 0.39754509925842285, "num_input_tokens_seen": 99394624, "step": 3115, "train_runtime": 8172.875, "train_tokens_per_second": 12161.525 }, { "epoch": 0.2100727174791274, "grad_norm": 0.900299837752339, "learning_rate": 9.730413090540158e-06, "loss": 0.38875527381896974, "num_input_tokens_seen": 99556136, "step": 3120, "train_runtime": 8186.0856, "train_tokens_per_second": 12161.629 }, { "epoch": 0.21040937247508754, "grad_norm": 0.836001039487523, "learning_rate": 9.729555943726825e-06, "loss": 0.40328731536865237, "num_input_tokens_seen": 99716376, "step": 3125, "train_runtime": 8198.5925, "train_tokens_per_second": 12162.621 }, { "epoch": 0.21074602747104768, "grad_norm": 0.8509910416434696, "learning_rate": 9.728697474308253e-06, "loss": 0.41985578536987306, "num_input_tokens_seen": 99872328, "step": 3130, "train_runtime": 8211.3525, "train_tokens_per_second": 12162.713 }, { "epoch": 0.21108268246700782, "grad_norm": 0.872107986549131, "learning_rate": 9.72783768252451e-06, "loss": 0.3964792251586914, "num_input_tokens_seen": 100029832, "step": 3135, "train_runtime": 8224.7236, "train_tokens_per_second": 12162.09 }, { "epoch": 0.21141933746296795, "grad_norm": 0.9236085383641873, "learning_rate": 9.726976568616036e-06, "loss": 0.41443648338317873, "num_input_tokens_seen": 100186592, "step": 3140, "train_runtime": 8238.4528, "train_tokens_per_second": 12160.85 }, { "epoch": 0.2117559924589281, "grad_norm": 0.9247419871443403, "learning_rate": 9.726114132823638e-06, "loss": 0.3887040615081787, "num_input_tokens_seen": 100346168, "step": 3145, "train_runtime": 8252.3725, "train_tokens_per_second": 12159.675 }, { "epoch": 0.21209264745488823, "grad_norm": 0.8041125503838713, "learning_rate": 9.725250375388493e-06, "loss": 0.4268604278564453, "num_input_tokens_seen": 100505536, "step": 3150, "train_runtime": 8266.1973, "train_tokens_per_second": 12158.618 }, { "epoch": 0.21242930245084837, "grad_norm": 0.8594485198729911, "learning_rate": 9.724385296552147e-06, "loss": 0.42397661209106446, "num_input_tokens_seen": 100666152, "step": 3155, "train_runtime": 8279.1036, "train_tokens_per_second": 12159.064 }, { "epoch": 0.2127659574468085, "grad_norm": 1.0289391436416353, "learning_rate": 9.72351889655652e-06, "loss": 0.4171248435974121, "num_input_tokens_seen": 100824512, "step": 3160, "train_runtime": 8291.5714, "train_tokens_per_second": 12159.88 }, { "epoch": 0.21310261244276865, "grad_norm": 0.8080902580573331, "learning_rate": 9.722651175643895e-06, "loss": 0.4044322967529297, "num_input_tokens_seen": 100984552, "step": 3165, "train_runtime": 8305.6097, "train_tokens_per_second": 12158.596 }, { "epoch": 0.2134392674387288, "grad_norm": 0.9482368453276383, "learning_rate": 9.721782134056928e-06, "loss": 0.376081657409668, "num_input_tokens_seen": 101147192, "step": 3170, "train_runtime": 8318.3116, "train_tokens_per_second": 12159.582 }, { "epoch": 0.21377592243468893, "grad_norm": 0.9050342589181328, "learning_rate": 9.720911772038645e-06, "loss": 0.4162557125091553, "num_input_tokens_seen": 101310512, "step": 3175, "train_runtime": 8332.0342, "train_tokens_per_second": 12159.157 }, { "epoch": 0.21411257743064907, "grad_norm": 0.8660334310465176, "learning_rate": 9.720040089832436e-06, "loss": 0.423879337310791, "num_input_tokens_seen": 101463920, "step": 3180, "train_runtime": 8346.1319, "train_tokens_per_second": 12156.999 }, { "epoch": 0.2144492324266092, "grad_norm": 0.8811187388129222, "learning_rate": 9.719167087682069e-06, "loss": 0.40487022399902345, "num_input_tokens_seen": 101625256, "step": 3185, "train_runtime": 8359.7941, "train_tokens_per_second": 12156.43 }, { "epoch": 0.21478588742256935, "grad_norm": 0.9001390582702702, "learning_rate": 9.718292765831673e-06, "loss": 0.4114086151123047, "num_input_tokens_seen": 101788184, "step": 3190, "train_runtime": 8372.6283, "train_tokens_per_second": 12157.256 }, { "epoch": 0.2151225424185295, "grad_norm": 0.8835423060335061, "learning_rate": 9.71741712452575e-06, "loss": 0.43125486373901367, "num_input_tokens_seen": 101947752, "step": 3195, "train_runtime": 8385.2485, "train_tokens_per_second": 12157.988 }, { "epoch": 0.21545919741448963, "grad_norm": 0.8119730896502064, "learning_rate": 9.716540164009174e-06, "loss": 0.4259305953979492, "num_input_tokens_seen": 102099480, "step": 3200, "train_runtime": 8398.405, "train_tokens_per_second": 12157.008 }, { "epoch": 0.21579585241044977, "grad_norm": 0.9469764098613102, "learning_rate": 9.715661884527178e-06, "loss": 0.41490988731384276, "num_input_tokens_seen": 102261192, "step": 3205, "train_runtime": 8411.6318, "train_tokens_per_second": 12157.117 }, { "epoch": 0.2161325074064099, "grad_norm": 0.9315977277195763, "learning_rate": 9.714782286325374e-06, "loss": 0.4179119110107422, "num_input_tokens_seen": 102421752, "step": 3210, "train_runtime": 8424.4462, "train_tokens_per_second": 12157.684 }, { "epoch": 0.21646916240237005, "grad_norm": 0.924460885738849, "learning_rate": 9.713901369649738e-06, "loss": 0.41758270263671876, "num_input_tokens_seen": 102583040, "step": 3215, "train_runtime": 8437.5349, "train_tokens_per_second": 12157.94 }, { "epoch": 0.2168058173983302, "grad_norm": 0.8398704839344228, "learning_rate": 9.713019134746618e-06, "loss": 0.3930691719055176, "num_input_tokens_seen": 102746872, "step": 3220, "train_runtime": 8450.6951, "train_tokens_per_second": 12158.393 }, { "epoch": 0.21714247239429033, "grad_norm": 0.8247134694776286, "learning_rate": 9.712135581862722e-06, "loss": 0.42127256393432616, "num_input_tokens_seen": 102906336, "step": 3225, "train_runtime": 8463.1779, "train_tokens_per_second": 12159.302 }, { "epoch": 0.21747912739025047, "grad_norm": 0.8659094086556777, "learning_rate": 9.711250711245139e-06, "loss": 0.4215373516082764, "num_input_tokens_seen": 103067224, "step": 3230, "train_runtime": 8476.7753, "train_tokens_per_second": 12158.777 }, { "epoch": 0.2178157823862106, "grad_norm": 0.7891654542020214, "learning_rate": 9.710364523141317e-06, "loss": 0.41613125801086426, "num_input_tokens_seen": 103230792, "step": 3235, "train_runtime": 8489.868, "train_tokens_per_second": 12159.293 }, { "epoch": 0.21815243738217074, "grad_norm": 0.8540677372377209, "learning_rate": 9.709477017799076e-06, "loss": 0.44175148010253906, "num_input_tokens_seen": 103386888, "step": 3240, "train_runtime": 8502.9321, "train_tokens_per_second": 12158.969 }, { "epoch": 0.21848909237813088, "grad_norm": 0.9257612373175095, "learning_rate": 9.708588195466604e-06, "loss": 0.4187493324279785, "num_input_tokens_seen": 103546144, "step": 3245, "train_runtime": 8516.97, "train_tokens_per_second": 12157.627 }, { "epoch": 0.21882574737409102, "grad_norm": 0.8196498692945057, "learning_rate": 9.707698056392458e-06, "loss": 0.40938844680786135, "num_input_tokens_seen": 103704088, "step": 3250, "train_runtime": 8530.1842, "train_tokens_per_second": 12157.309 }, { "epoch": 0.21916240237005116, "grad_norm": 0.8348783569427588, "learning_rate": 9.706806600825562e-06, "loss": 0.4203173637390137, "num_input_tokens_seen": 103863264, "step": 3255, "train_runtime": 8543.1459, "train_tokens_per_second": 12157.496 }, { "epoch": 0.2194990573660113, "grad_norm": 0.9924397888990996, "learning_rate": 9.70591382901521e-06, "loss": 0.43382821083068845, "num_input_tokens_seen": 104021368, "step": 3260, "train_runtime": 8555.9376, "train_tokens_per_second": 12157.799 }, { "epoch": 0.21983571236197144, "grad_norm": 0.878732565925723, "learning_rate": 9.705019741211061e-06, "loss": 0.3969125747680664, "num_input_tokens_seen": 104180800, "step": 3265, "train_runtime": 8568.6206, "train_tokens_per_second": 12158.41 }, { "epoch": 0.22017236735793158, "grad_norm": 0.8715059083657861, "learning_rate": 9.704124337663145e-06, "loss": 0.40511722564697267, "num_input_tokens_seen": 104342824, "step": 3270, "train_runtime": 8581.2586, "train_tokens_per_second": 12159.385 }, { "epoch": 0.22050902235389172, "grad_norm": 0.9524389427909125, "learning_rate": 9.703227618621859e-06, "loss": 0.411458683013916, "num_input_tokens_seen": 104500776, "step": 3275, "train_runtime": 8594.1626, "train_tokens_per_second": 12159.507 }, { "epoch": 0.22084567734985186, "grad_norm": 0.9009508149880984, "learning_rate": 9.702329584337965e-06, "loss": 0.42221755981445314, "num_input_tokens_seen": 104653048, "step": 3280, "train_runtime": 8607.6314, "train_tokens_per_second": 12158.17 }, { "epoch": 0.221182332345812, "grad_norm": 0.8993845512420526, "learning_rate": 9.701430235062599e-06, "loss": 0.41233162879943847, "num_input_tokens_seen": 104811048, "step": 3285, "train_runtime": 8621.0373, "train_tokens_per_second": 12157.591 }, { "epoch": 0.22151898734177214, "grad_norm": 0.9593772464522136, "learning_rate": 9.700529571047259e-06, "loss": 0.4482554912567139, "num_input_tokens_seen": 104969448, "step": 3290, "train_runtime": 8634.6689, "train_tokens_per_second": 12156.743 }, { "epoch": 0.22185564233773228, "grad_norm": 0.9663087812516342, "learning_rate": 9.699627592543814e-06, "loss": 0.4106715202331543, "num_input_tokens_seen": 105130880, "step": 3295, "train_runtime": 8648.4886, "train_tokens_per_second": 12155.983 }, { "epoch": 0.22219229733369245, "grad_norm": 0.8710129534870628, "learning_rate": 9.698724299804498e-06, "loss": 0.43678598403930663, "num_input_tokens_seen": 105293160, "step": 3300, "train_runtime": 8661.5605, "train_tokens_per_second": 12156.373 }, { "epoch": 0.22252895232965259, "grad_norm": 0.8766988326847366, "learning_rate": 9.697819693081915e-06, "loss": 0.4082034111022949, "num_input_tokens_seen": 105453872, "step": 3305, "train_runtime": 8674.1095, "train_tokens_per_second": 12157.314 }, { "epoch": 0.22286560732561272, "grad_norm": 0.8297196286245672, "learning_rate": 9.696913772629034e-06, "loss": 0.381276535987854, "num_input_tokens_seen": 105613656, "step": 3310, "train_runtime": 8686.8857, "train_tokens_per_second": 12157.827 }, { "epoch": 0.22320226232157286, "grad_norm": 0.8248529690674457, "learning_rate": 9.696006538699195e-06, "loss": 0.4185637474060059, "num_input_tokens_seen": 105771304, "step": 3315, "train_runtime": 8699.7702, "train_tokens_per_second": 12157.942 }, { "epoch": 0.223538917317533, "grad_norm": 0.9144822279409108, "learning_rate": 9.695097991546102e-06, "loss": 0.4286025047302246, "num_input_tokens_seen": 105924784, "step": 3320, "train_runtime": 8713.7221, "train_tokens_per_second": 12156.089 }, { "epoch": 0.22387557231349314, "grad_norm": 0.8582715250020818, "learning_rate": 9.694188131423828e-06, "loss": 0.3919801712036133, "num_input_tokens_seen": 106081192, "step": 3325, "train_runtime": 8726.4794, "train_tokens_per_second": 12156.242 }, { "epoch": 0.22421222730945328, "grad_norm": 0.8454697290206538, "learning_rate": 9.693276958586809e-06, "loss": 0.4598099708557129, "num_input_tokens_seen": 106243008, "step": 3330, "train_runtime": 8738.9344, "train_tokens_per_second": 12157.433 }, { "epoch": 0.22454888230541342, "grad_norm": 0.7607502024337314, "learning_rate": 9.692364473289856e-06, "loss": 0.389451789855957, "num_input_tokens_seen": 106399472, "step": 3335, "train_runtime": 8751.5885, "train_tokens_per_second": 12157.732 }, { "epoch": 0.22488553730137356, "grad_norm": 0.9167999336481737, "learning_rate": 9.69145067578814e-06, "loss": 0.37474632263183594, "num_input_tokens_seen": 106558728, "step": 3340, "train_runtime": 8764.4007, "train_tokens_per_second": 12158.131 }, { "epoch": 0.2252221922973337, "grad_norm": 0.9761161865850733, "learning_rate": 9.690535566337205e-06, "loss": 0.45883026123046877, "num_input_tokens_seen": 106717872, "step": 3345, "train_runtime": 8777.7964, "train_tokens_per_second": 12157.706 }, { "epoch": 0.22555884729329384, "grad_norm": 0.9643433582960327, "learning_rate": 9.689619145192955e-06, "loss": 0.4292914390563965, "num_input_tokens_seen": 106876840, "step": 3350, "train_runtime": 8790.4212, "train_tokens_per_second": 12158.33 }, { "epoch": 0.22589550228925398, "grad_norm": 0.8341523166429599, "learning_rate": 9.688701412611663e-06, "loss": 0.4082505226135254, "num_input_tokens_seen": 107036800, "step": 3355, "train_runtime": 8802.9062, "train_tokens_per_second": 12159.257 }, { "epoch": 0.22623215728521412, "grad_norm": 0.8091868277401202, "learning_rate": 9.687782368849973e-06, "loss": 0.4042107582092285, "num_input_tokens_seen": 107198072, "step": 3360, "train_runtime": 8815.4307, "train_tokens_per_second": 12160.276 }, { "epoch": 0.22656881228117426, "grad_norm": 0.8929999519853563, "learning_rate": 9.686862014164893e-06, "loss": 0.39135012626647947, "num_input_tokens_seen": 107358656, "step": 3365, "train_runtime": 8827.8963, "train_tokens_per_second": 12161.295 }, { "epoch": 0.2269054672771344, "grad_norm": 0.8479553361847132, "learning_rate": 9.685940348813795e-06, "loss": 0.3882725954055786, "num_input_tokens_seen": 107521904, "step": 3370, "train_runtime": 8840.8074, "train_tokens_per_second": 12162.0 }, { "epoch": 0.22724212227309454, "grad_norm": 0.8710866407583131, "learning_rate": 9.685017373054421e-06, "loss": 0.40677661895751954, "num_input_tokens_seen": 107682984, "step": 3375, "train_runtime": 8853.5816, "train_tokens_per_second": 12162.647 }, { "epoch": 0.22757877726905468, "grad_norm": 0.8084350149654155, "learning_rate": 9.68409308714488e-06, "loss": 0.40839109420776365, "num_input_tokens_seen": 107841976, "step": 3380, "train_runtime": 8866.6224, "train_tokens_per_second": 12162.69 }, { "epoch": 0.22791543226501482, "grad_norm": 0.8419818745037261, "learning_rate": 9.68316749134364e-06, "loss": 0.4161202430725098, "num_input_tokens_seen": 108005816, "step": 3385, "train_runtime": 8879.0525, "train_tokens_per_second": 12164.115 }, { "epoch": 0.22825208726097496, "grad_norm": 0.795688788607716, "learning_rate": 9.682240585909545e-06, "loss": 0.3866273880004883, "num_input_tokens_seen": 108163880, "step": 3390, "train_runtime": 8892.2418, "train_tokens_per_second": 12163.848 }, { "epoch": 0.2285887422569351, "grad_norm": 0.9031481040507628, "learning_rate": 9.681312371101803e-06, "loss": 0.37649009227752683, "num_input_tokens_seen": 108326320, "step": 3395, "train_runtime": 8904.9215, "train_tokens_per_second": 12164.77 }, { "epoch": 0.22892539725289524, "grad_norm": 0.8295586705692858, "learning_rate": 9.680382847179984e-06, "loss": 0.4147799491882324, "num_input_tokens_seen": 108487936, "step": 3400, "train_runtime": 8917.7876, "train_tokens_per_second": 12165.342 }, { "epoch": 0.22926205224885537, "grad_norm": 0.9086751151899561, "learning_rate": 9.679452014404025e-06, "loss": 0.42338104248046876, "num_input_tokens_seen": 108646768, "step": 3405, "train_runtime": 8932.0181, "train_tokens_per_second": 12163.742 }, { "epoch": 0.22959870724481551, "grad_norm": 1.2669512598145285, "learning_rate": 9.678519873034234e-06, "loss": 0.44754681587219236, "num_input_tokens_seen": 108809224, "step": 3410, "train_runtime": 8944.4917, "train_tokens_per_second": 12164.942 }, { "epoch": 0.22993536224077565, "grad_norm": 1.0160062497283133, "learning_rate": 9.677586423331277e-06, "loss": 0.42498102188110354, "num_input_tokens_seen": 108969712, "step": 3415, "train_runtime": 8957.2939, "train_tokens_per_second": 12165.472 }, { "epoch": 0.2302720172367358, "grad_norm": 0.7540799760126341, "learning_rate": 9.676651665556194e-06, "loss": 0.4081888198852539, "num_input_tokens_seen": 109133552, "step": 3420, "train_runtime": 8969.7437, "train_tokens_per_second": 12166.853 }, { "epoch": 0.23060867223269593, "grad_norm": 0.9202476266256654, "learning_rate": 9.675715599970383e-06, "loss": 0.4067695617675781, "num_input_tokens_seen": 109291328, "step": 3425, "train_runtime": 8982.6477, "train_tokens_per_second": 12166.939 }, { "epoch": 0.23094532722865607, "grad_norm": 0.9847071425682539, "learning_rate": 9.674778226835617e-06, "loss": 0.44423513412475585, "num_input_tokens_seen": 109444560, "step": 3430, "train_runtime": 8995.8823, "train_tokens_per_second": 12166.073 }, { "epoch": 0.2312819822246162, "grad_norm": 0.8727331062700421, "learning_rate": 9.673839546414026e-06, "loss": 0.4344576358795166, "num_input_tokens_seen": 109599736, "step": 3435, "train_runtime": 9009.2288, "train_tokens_per_second": 12165.274 }, { "epoch": 0.23161863722057635, "grad_norm": 0.8463609953608888, "learning_rate": 9.672899558968107e-06, "loss": 0.3959089994430542, "num_input_tokens_seen": 109757400, "step": 3440, "train_runtime": 9022.9432, "train_tokens_per_second": 12164.257 }, { "epoch": 0.2319552922165365, "grad_norm": 0.8233020078002306, "learning_rate": 9.67195826476073e-06, "loss": 0.4379754543304443, "num_input_tokens_seen": 109919176, "step": 3445, "train_runtime": 9035.4825, "train_tokens_per_second": 12165.28 }, { "epoch": 0.23229194721249663, "grad_norm": 0.8949658507352379, "learning_rate": 9.671015664055122e-06, "loss": 0.4128607749938965, "num_input_tokens_seen": 110079376, "step": 3450, "train_runtime": 9048.5881, "train_tokens_per_second": 12165.365 }, { "epoch": 0.23262860220845677, "grad_norm": 0.8541695601708745, "learning_rate": 9.670071757114877e-06, "loss": 0.4062610626220703, "num_input_tokens_seen": 110240984, "step": 3455, "train_runtime": 9061.8142, "train_tokens_per_second": 12165.443 }, { "epoch": 0.2329652572044169, "grad_norm": 0.8278278168855996, "learning_rate": 9.669126544203957e-06, "loss": 0.41463732719421387, "num_input_tokens_seen": 110391984, "step": 3460, "train_runtime": 9074.7432, "train_tokens_per_second": 12164.75 }, { "epoch": 0.23330191220037705, "grad_norm": 0.8782609857711834, "learning_rate": 9.668180025586689e-06, "loss": 0.41456012725830077, "num_input_tokens_seen": 110553664, "step": 3465, "train_runtime": 9087.3052, "train_tokens_per_second": 12165.726 }, { "epoch": 0.2336385671963372, "grad_norm": 0.7805598450692157, "learning_rate": 9.667232201527761e-06, "loss": 0.39628050327301023, "num_input_tokens_seen": 110706472, "step": 3470, "train_runtime": 9100.5008, "train_tokens_per_second": 12164.877 }, { "epoch": 0.23397522219229733, "grad_norm": 0.8813139375760343, "learning_rate": 9.666283072292234e-06, "loss": 0.4283869743347168, "num_input_tokens_seen": 110863224, "step": 3475, "train_runtime": 9113.994, "train_tokens_per_second": 12164.066 }, { "epoch": 0.23431187718825747, "grad_norm": 0.8232365244583492, "learning_rate": 9.665332638145522e-06, "loss": 0.4345715999603271, "num_input_tokens_seen": 111022704, "step": 3480, "train_runtime": 9127.1895, "train_tokens_per_second": 12163.953 }, { "epoch": 0.2346485321842176, "grad_norm": 0.8941185025264897, "learning_rate": 9.664380899353414e-06, "loss": 0.43789987564086913, "num_input_tokens_seen": 111184200, "step": 3485, "train_runtime": 9141.2982, "train_tokens_per_second": 12162.846 }, { "epoch": 0.23498518718017775, "grad_norm": 0.9214894480781967, "learning_rate": 9.663427856182062e-06, "loss": 0.416960334777832, "num_input_tokens_seen": 111348040, "step": 3490, "train_runtime": 9153.7253, "train_tokens_per_second": 12164.232 }, { "epoch": 0.23532184217613789, "grad_norm": 0.8164186286997915, "learning_rate": 9.662473508897981e-06, "loss": 0.4084165573120117, "num_input_tokens_seen": 111509616, "step": 3495, "train_runtime": 9166.2758, "train_tokens_per_second": 12165.204 }, { "epoch": 0.23565849717209802, "grad_norm": 0.9390022953122675, "learning_rate": 9.661517857768052e-06, "loss": 0.4370316982269287, "num_input_tokens_seen": 111667608, "step": 3500, "train_runtime": 9180.1453, "train_tokens_per_second": 12164.035 }, { "epoch": 0.23599515216805816, "grad_norm": 0.8984087082769315, "learning_rate": 9.660560903059517e-06, "loss": 0.4216012001037598, "num_input_tokens_seen": 111823168, "step": 3505, "train_runtime": 9192.9066, "train_tokens_per_second": 12164.071 }, { "epoch": 0.2363318071640183, "grad_norm": 0.7621452436957418, "learning_rate": 9.659602645039988e-06, "loss": 0.437092924118042, "num_input_tokens_seen": 111985056, "step": 3510, "train_runtime": 9205.5066, "train_tokens_per_second": 12165.007 }, { "epoch": 0.23666846215997844, "grad_norm": 0.7702986013180412, "learning_rate": 9.658643083977435e-06, "loss": 0.3486215591430664, "num_input_tokens_seen": 112142272, "step": 3515, "train_runtime": 9218.5073, "train_tokens_per_second": 12164.906 }, { "epoch": 0.23700511715593858, "grad_norm": 0.8892495321950995, "learning_rate": 9.657682220140202e-06, "loss": 0.38922462463378904, "num_input_tokens_seen": 112297832, "step": 3520, "train_runtime": 9231.7055, "train_tokens_per_second": 12164.365 }, { "epoch": 0.23734177215189872, "grad_norm": 1.0978691917136367, "learning_rate": 9.656720053796987e-06, "loss": 0.42437143325805665, "num_input_tokens_seen": 112456296, "step": 3525, "train_runtime": 9245.836, "train_tokens_per_second": 12162.913 }, { "epoch": 0.23767842714785886, "grad_norm": 1.0892584214851264, "learning_rate": 9.655756585216859e-06, "loss": 0.3968771457672119, "num_input_tokens_seen": 112614048, "step": 3530, "train_runtime": 9258.5112, "train_tokens_per_second": 12163.3 }, { "epoch": 0.238015082143819, "grad_norm": 0.863200664259044, "learning_rate": 9.654791814669246e-06, "loss": 0.43172311782836914, "num_input_tokens_seen": 112773928, "step": 3535, "train_runtime": 9271.8075, "train_tokens_per_second": 12163.101 }, { "epoch": 0.23835173713977914, "grad_norm": 0.7943682018371147, "learning_rate": 9.653825742423949e-06, "loss": 0.38676478862762453, "num_input_tokens_seen": 112932416, "step": 3540, "train_runtime": 9284.418, "train_tokens_per_second": 12163.651 }, { "epoch": 0.2386883921357393, "grad_norm": 0.9045352823000757, "learning_rate": 9.652858368751118e-06, "loss": 0.39141116142272947, "num_input_tokens_seen": 113087808, "step": 3545, "train_runtime": 9298.3679, "train_tokens_per_second": 12162.114 }, { "epoch": 0.23902504713169945, "grad_norm": 3.479202922125915, "learning_rate": 9.651889693921284e-06, "loss": 0.40999598503112794, "num_input_tokens_seen": 113250736, "step": 3550, "train_runtime": 9311.1924, "train_tokens_per_second": 12162.861 }, { "epoch": 0.2393617021276596, "grad_norm": 0.8677941344170815, "learning_rate": 9.650919718205331e-06, "loss": 0.4603950023651123, "num_input_tokens_seen": 113410528, "step": 3555, "train_runtime": 9324.6788, "train_tokens_per_second": 12162.406 }, { "epoch": 0.23969835712361973, "grad_norm": 0.7941907491255483, "learning_rate": 9.649948441874509e-06, "loss": 0.4159419536590576, "num_input_tokens_seen": 113571624, "step": 3560, "train_runtime": 9337.8768, "train_tokens_per_second": 12162.468 }, { "epoch": 0.24003501211957987, "grad_norm": 0.7973463112110178, "learning_rate": 9.648975865200434e-06, "loss": 0.38080658912658694, "num_input_tokens_seen": 113728184, "step": 3565, "train_runtime": 9350.8519, "train_tokens_per_second": 12162.334 }, { "epoch": 0.24037166711554, "grad_norm": 0.7793641951819085, "learning_rate": 9.648001988455082e-06, "loss": 0.4260855674743652, "num_input_tokens_seen": 113890688, "step": 3570, "train_runtime": 9363.799, "train_tokens_per_second": 12162.872 }, { "epoch": 0.24070832211150014, "grad_norm": 0.8236218271067685, "learning_rate": 9.647026811910794e-06, "loss": 0.41405014991760253, "num_input_tokens_seen": 114046720, "step": 3575, "train_runtime": 9377.1067, "train_tokens_per_second": 12162.25 }, { "epoch": 0.24104497710746028, "grad_norm": 0.8099877926881521, "learning_rate": 9.646050335840279e-06, "loss": 0.45738959312438965, "num_input_tokens_seen": 114209520, "step": 3580, "train_runtime": 9389.9039, "train_tokens_per_second": 12163.013 }, { "epoch": 0.24138163210342042, "grad_norm": 0.9054846944082656, "learning_rate": 9.6450725605166e-06, "loss": 0.4009879112243652, "num_input_tokens_seen": 114365000, "step": 3585, "train_runtime": 9402.8509, "train_tokens_per_second": 12162.801 }, { "epoch": 0.24171828709938056, "grad_norm": 0.8331422411123904, "learning_rate": 9.644093486213192e-06, "loss": 0.43718719482421875, "num_input_tokens_seen": 114527896, "step": 3590, "train_runtime": 9415.9905, "train_tokens_per_second": 12163.128 }, { "epoch": 0.2420549420953407, "grad_norm": 1.0163723356338525, "learning_rate": 9.64311311320385e-06, "loss": 0.4103853225708008, "num_input_tokens_seen": 114686832, "step": 3595, "train_runtime": 9429.7622, "train_tokens_per_second": 12162.219 }, { "epoch": 0.24239159709130084, "grad_norm": 0.8185094841374555, "learning_rate": 9.642131441762732e-06, "loss": 0.3965426445007324, "num_input_tokens_seen": 114842480, "step": 3600, "train_runtime": 9444.0371, "train_tokens_per_second": 12160.317 }, { "epoch": 0.24272825208726098, "grad_norm": 0.8976878644890596, "learning_rate": 9.641148472164359e-06, "loss": 0.3918168067932129, "num_input_tokens_seen": 115000304, "step": 3605, "train_runtime": 9457.5047, "train_tokens_per_second": 12159.688 }, { "epoch": 0.24306490708322112, "grad_norm": 0.9339461558763776, "learning_rate": 9.640164204683616e-06, "loss": 0.4022397994995117, "num_input_tokens_seen": 115160808, "step": 3610, "train_runtime": 9470.3104, "train_tokens_per_second": 12160.194 }, { "epoch": 0.24340156207918126, "grad_norm": 0.9776924879153237, "learning_rate": 9.639178639595748e-06, "loss": 0.4423379898071289, "num_input_tokens_seen": 115318208, "step": 3615, "train_runtime": 9483.0396, "train_tokens_per_second": 12160.469 }, { "epoch": 0.2437382170751414, "grad_norm": 0.7941532684789867, "learning_rate": 9.638191777176367e-06, "loss": 0.3806135892868042, "num_input_tokens_seen": 115477480, "step": 3620, "train_runtime": 9496.5642, "train_tokens_per_second": 12159.922 }, { "epoch": 0.24407487207110154, "grad_norm": 0.9379879505500848, "learning_rate": 9.637203617701446e-06, "loss": 0.4460176467895508, "num_input_tokens_seen": 115638088, "step": 3625, "train_runtime": 9509.6313, "train_tokens_per_second": 12160.102 }, { "epoch": 0.24441152706706168, "grad_norm": 0.8337398676521538, "learning_rate": 9.63621416144732e-06, "loss": 0.4018817901611328, "num_input_tokens_seen": 115796992, "step": 3630, "train_runtime": 9522.715, "train_tokens_per_second": 12160.082 }, { "epoch": 0.24474818206302182, "grad_norm": 0.9003889527549371, "learning_rate": 9.635223408690688e-06, "loss": 0.3894858121871948, "num_input_tokens_seen": 115952400, "step": 3635, "train_runtime": 9536.5119, "train_tokens_per_second": 12158.785 }, { "epoch": 0.24508483705898196, "grad_norm": 0.8842498925456987, "learning_rate": 9.63423135970861e-06, "loss": 0.432171630859375, "num_input_tokens_seen": 116112808, "step": 3640, "train_runtime": 9548.9899, "train_tokens_per_second": 12159.695 }, { "epoch": 0.2454214920549421, "grad_norm": 1.3307025961396473, "learning_rate": 9.633238014778511e-06, "loss": 0.43020148277282716, "num_input_tokens_seen": 116274056, "step": 3645, "train_runtime": 9561.7538, "train_tokens_per_second": 12160.327 }, { "epoch": 0.24575814705090224, "grad_norm": 0.9547235782138878, "learning_rate": 9.632243374178173e-06, "loss": 0.42804861068725586, "num_input_tokens_seen": 116431600, "step": 3650, "train_runtime": 9574.2286, "train_tokens_per_second": 12160.938 }, { "epoch": 0.24609480204686238, "grad_norm": 0.8714338720390338, "learning_rate": 9.63124743818575e-06, "loss": 0.4338388442993164, "num_input_tokens_seen": 116594064, "step": 3655, "train_runtime": 9587.2781, "train_tokens_per_second": 12161.331 }, { "epoch": 0.24643145704282252, "grad_norm": 0.8184366745128226, "learning_rate": 9.630250207079745e-06, "loss": 0.3941220998764038, "num_input_tokens_seen": 116751224, "step": 3660, "train_runtime": 9599.7534, "train_tokens_per_second": 12161.898 }, { "epoch": 0.24676811203878266, "grad_norm": 0.765148639704, "learning_rate": 9.629251681139038e-06, "loss": 0.42835197448730467, "num_input_tokens_seen": 116913096, "step": 3665, "train_runtime": 9612.304, "train_tokens_per_second": 12162.859 }, { "epoch": 0.2471047670347428, "grad_norm": 1.1360850339361914, "learning_rate": 9.628251860642857e-06, "loss": 0.4193881988525391, "num_input_tokens_seen": 117073408, "step": 3670, "train_runtime": 9624.9445, "train_tokens_per_second": 12163.541 }, { "epoch": 0.24744142203070293, "grad_norm": 0.7877207003672969, "learning_rate": 9.627250745870805e-06, "loss": 0.41612563133239744, "num_input_tokens_seen": 117230136, "step": 3675, "train_runtime": 9637.6207, "train_tokens_per_second": 12163.805 }, { "epoch": 0.24777807702666307, "grad_norm": 1.0769249370912934, "learning_rate": 9.626248337102834e-06, "loss": 0.452846097946167, "num_input_tokens_seen": 117389368, "step": 3680, "train_runtime": 9650.0845, "train_tokens_per_second": 12164.595 }, { "epoch": 0.2481147320226232, "grad_norm": 0.8804891180806412, "learning_rate": 9.625244634619269e-06, "loss": 0.4418637275695801, "num_input_tokens_seen": 117546008, "step": 3685, "train_runtime": 9662.8278, "train_tokens_per_second": 12164.763 }, { "epoch": 0.24845138701858335, "grad_norm": 0.8784089897442168, "learning_rate": 9.62423963870079e-06, "loss": 0.4203824996948242, "num_input_tokens_seen": 117703800, "step": 3690, "train_runtime": 9676.6665, "train_tokens_per_second": 12163.672 }, { "epoch": 0.2487880420145435, "grad_norm": 0.7519237597934966, "learning_rate": 9.623233349628441e-06, "loss": 0.3803875923156738, "num_input_tokens_seen": 117862392, "step": 3695, "train_runtime": 9689.7761, "train_tokens_per_second": 12163.583 }, { "epoch": 0.24912469701050363, "grad_norm": 0.8432619493847373, "learning_rate": 9.62222576768363e-06, "loss": 0.39006571769714354, "num_input_tokens_seen": 118021752, "step": 3700, "train_runtime": 9703.3832, "train_tokens_per_second": 12162.949 }, { "epoch": 0.24946135200646377, "grad_norm": 0.8922021759723706, "learning_rate": 9.62121689314812e-06, "loss": 0.45485243797302244, "num_input_tokens_seen": 118181152, "step": 3705, "train_runtime": 9716.7491, "train_tokens_per_second": 12162.623 }, { "epoch": 0.2497980070024239, "grad_norm": 0.909038938570329, "learning_rate": 9.620206726304045e-06, "loss": 0.4149444580078125, "num_input_tokens_seen": 118338520, "step": 3710, "train_runtime": 9730.0455, "train_tokens_per_second": 12162.175 }, { "epoch": 0.2501346619983841, "grad_norm": 0.816315175951374, "learning_rate": 9.61919526743389e-06, "loss": 0.44527549743652345, "num_input_tokens_seen": 118499080, "step": 3715, "train_runtime": 9743.0239, "train_tokens_per_second": 12162.454 }, { "epoch": 0.2504713169943442, "grad_norm": 0.8898586216688498, "learning_rate": 9.618182516820507e-06, "loss": 0.41652116775512693, "num_input_tokens_seen": 118658800, "step": 3720, "train_runtime": 9755.5248, "train_tokens_per_second": 12163.241 }, { "epoch": 0.25080797199030436, "grad_norm": 0.9284705137003402, "learning_rate": 9.61716847474711e-06, "loss": 0.4005583763122559, "num_input_tokens_seen": 118816936, "step": 3725, "train_runtime": 9768.5428, "train_tokens_per_second": 12163.22 }, { "epoch": 0.2511446269862645, "grad_norm": 0.9162132854818476, "learning_rate": 9.616153141497273e-06, "loss": 0.42869110107421876, "num_input_tokens_seen": 118977976, "step": 3730, "train_runtime": 9781.3517, "train_tokens_per_second": 12163.756 }, { "epoch": 0.25148128198222464, "grad_norm": 0.9835631763540246, "learning_rate": 9.61513651735493e-06, "loss": 0.3941942691802979, "num_input_tokens_seen": 119136280, "step": 3735, "train_runtime": 9794.0361, "train_tokens_per_second": 12164.166 }, { "epoch": 0.2518179369781848, "grad_norm": 0.9109271168084004, "learning_rate": 9.614118602604376e-06, "loss": 0.4011667251586914, "num_input_tokens_seen": 119294320, "step": 3740, "train_runtime": 9808.3307, "train_tokens_per_second": 12162.551 }, { "epoch": 0.2521545919741449, "grad_norm": 0.8934994154932886, "learning_rate": 9.613099397530267e-06, "loss": 0.3783116340637207, "num_input_tokens_seen": 119457592, "step": 3745, "train_runtime": 9821.9706, "train_tokens_per_second": 12162.284 }, { "epoch": 0.25249124697010505, "grad_norm": 0.9907929313420286, "learning_rate": 9.612078902417623e-06, "loss": 0.40924620628356934, "num_input_tokens_seen": 119618992, "step": 3750, "train_runtime": 9834.4945, "train_tokens_per_second": 12163.207 }, { "epoch": 0.2528279019660652, "grad_norm": 0.8377882888839838, "learning_rate": 9.611057117551821e-06, "loss": 0.4197675704956055, "num_input_tokens_seen": 119773872, "step": 3755, "train_runtime": 9848.0055, "train_tokens_per_second": 12162.247 }, { "epoch": 0.25316455696202533, "grad_norm": 0.8553504629298129, "learning_rate": 9.610034043218598e-06, "loss": 0.4289577007293701, "num_input_tokens_seen": 119937712, "step": 3760, "train_runtime": 9860.4203, "train_tokens_per_second": 12163.55 }, { "epoch": 0.2535012119579855, "grad_norm": 0.9789984046142575, "learning_rate": 9.609009679704057e-06, "loss": 0.42050838470458984, "num_input_tokens_seen": 120098256, "step": 3765, "train_runtime": 9874.0298, "train_tokens_per_second": 12163.044 }, { "epoch": 0.2538378669539456, "grad_norm": 0.8674853758619395, "learning_rate": 9.607984027294654e-06, "loss": 0.3979710578918457, "num_input_tokens_seen": 120255440, "step": 3770, "train_runtime": 9887.3676, "train_tokens_per_second": 12162.534 }, { "epoch": 0.25417452194990575, "grad_norm": 0.816873443414167, "learning_rate": 9.606957086277213e-06, "loss": 0.40817813873291015, "num_input_tokens_seen": 120415344, "step": 3775, "train_runtime": 9900.8466, "train_tokens_per_second": 12162.126 }, { "epoch": 0.2545111769458659, "grad_norm": 0.9594431870087078, "learning_rate": 9.605928856938913e-06, "loss": 0.41196308135986326, "num_input_tokens_seen": 120577640, "step": 3780, "train_runtime": 9915.6773, "train_tokens_per_second": 12160.303 }, { "epoch": 0.25484783194182603, "grad_norm": 0.7960282199265253, "learning_rate": 9.604899339567298e-06, "loss": 0.37593517303466795, "num_input_tokens_seen": 120735752, "step": 3785, "train_runtime": 9928.2264, "train_tokens_per_second": 12160.858 }, { "epoch": 0.25518448693778617, "grad_norm": 0.7962533782097339, "learning_rate": 9.603868534450263e-06, "loss": 0.36553468704223635, "num_input_tokens_seen": 120897616, "step": 3790, "train_runtime": 9940.6697, "train_tokens_per_second": 12161.919 }, { "epoch": 0.2555211419337463, "grad_norm": 0.8421695508225978, "learning_rate": 9.602836441876074e-06, "loss": 0.3682673692703247, "num_input_tokens_seen": 121059784, "step": 3795, "train_runtime": 9953.6002, "train_tokens_per_second": 12162.412 }, { "epoch": 0.25585779692970645, "grad_norm": 1.0912803893952283, "learning_rate": 9.601803062133353e-06, "loss": 0.41713991165161135, "num_input_tokens_seen": 121219216, "step": 3800, "train_runtime": 9966.083, "train_tokens_per_second": 12163.175 }, { "epoch": 0.2561944519256666, "grad_norm": 0.8021159110741525, "learning_rate": 9.600768395511078e-06, "loss": 0.3794227600097656, "num_input_tokens_seen": 121381704, "step": 3805, "train_runtime": 9978.8149, "train_tokens_per_second": 12163.94 }, { "epoch": 0.25653110692162673, "grad_norm": 0.779826167648677, "learning_rate": 9.599732442298592e-06, "loss": 0.3875307559967041, "num_input_tokens_seen": 121542336, "step": 3810, "train_runtime": 9992.353, "train_tokens_per_second": 12163.535 }, { "epoch": 0.25686776191758687, "grad_norm": 0.8825055218863129, "learning_rate": 9.598695202785596e-06, "loss": 0.40799479484558104, "num_input_tokens_seen": 121701792, "step": 3815, "train_runtime": 10005.9395, "train_tokens_per_second": 12162.955 }, { "epoch": 0.257204416913547, "grad_norm": 0.8194261588814046, "learning_rate": 9.59765667726215e-06, "loss": 0.37521777153015134, "num_input_tokens_seen": 121864104, "step": 3820, "train_runtime": 10019.9204, "train_tokens_per_second": 12162.183 }, { "epoch": 0.25754107190950715, "grad_norm": 0.9087654582196822, "learning_rate": 9.596616866018677e-06, "loss": 0.46813130378723145, "num_input_tokens_seen": 122020640, "step": 3825, "train_runtime": 10033.4693, "train_tokens_per_second": 12161.361 }, { "epoch": 0.2578777269054673, "grad_norm": 0.8257266846043245, "learning_rate": 9.595575769345955e-06, "loss": 0.408492374420166, "num_input_tokens_seen": 122171256, "step": 3830, "train_runtime": 10046.232, "train_tokens_per_second": 12160.903 }, { "epoch": 0.2582143819014274, "grad_norm": 0.8801058611550759, "learning_rate": 9.594533387535122e-06, "loss": 0.4131655693054199, "num_input_tokens_seen": 122332304, "step": 3835, "train_runtime": 10059.3406, "train_tokens_per_second": 12161.066 }, { "epoch": 0.25855103689738757, "grad_norm": 0.831723258226366, "learning_rate": 9.593489720877678e-06, "loss": 0.40161967277526855, "num_input_tokens_seen": 122493200, "step": 3840, "train_runtime": 10073.4046, "train_tokens_per_second": 12160.06 }, { "epoch": 0.2588876918933477, "grad_norm": 0.7614200186829221, "learning_rate": 9.592444769665482e-06, "loss": 0.38043780326843263, "num_input_tokens_seen": 122657040, "step": 3845, "train_runtime": 10085.8317, "train_tokens_per_second": 12161.321 }, { "epoch": 0.25922434688930784, "grad_norm": 1.0088565155547762, "learning_rate": 9.59139853419075e-06, "loss": 0.3997699975967407, "num_input_tokens_seen": 122808368, "step": 3850, "train_runtime": 10099.1824, "train_tokens_per_second": 12160.229 }, { "epoch": 0.259561001885268, "grad_norm": 0.8767073880258983, "learning_rate": 9.590351014746059e-06, "loss": 0.40987696647644045, "num_input_tokens_seen": 122968912, "step": 3855, "train_runtime": 10112.0461, "train_tokens_per_second": 12160.636 }, { "epoch": 0.2598976568812281, "grad_norm": 0.8828697336988384, "learning_rate": 9.589302211624343e-06, "loss": 0.4118494987487793, "num_input_tokens_seen": 123127512, "step": 3860, "train_runtime": 10125.2526, "train_tokens_per_second": 12160.439 }, { "epoch": 0.26023431187718826, "grad_norm": 0.8868223300685006, "learning_rate": 9.5882521251189e-06, "loss": 0.40972070693969725, "num_input_tokens_seen": 123287848, "step": 3865, "train_runtime": 10138.0573, "train_tokens_per_second": 12160.895 }, { "epoch": 0.2605709668731484, "grad_norm": 1.2065392684686351, "learning_rate": 9.58720075552338e-06, "loss": 0.4448376655578613, "num_input_tokens_seen": 123447760, "step": 3870, "train_runtime": 10151.7607, "train_tokens_per_second": 12160.231 }, { "epoch": 0.26090762186910854, "grad_norm": 0.9136276056161826, "learning_rate": 9.586148103131797e-06, "loss": 0.41599197387695314, "num_input_tokens_seen": 123602968, "step": 3875, "train_runtime": 10165.7037, "train_tokens_per_second": 12158.821 }, { "epoch": 0.2612442768650687, "grad_norm": 0.8954825767082152, "learning_rate": 9.585094168238518e-06, "loss": 0.4437089920043945, "num_input_tokens_seen": 123760432, "step": 3880, "train_runtime": 10178.7516, "train_tokens_per_second": 12158.704 }, { "epoch": 0.2615809318610288, "grad_norm": 0.8267604883535505, "learning_rate": 9.58403895113828e-06, "loss": 0.4033670425415039, "num_input_tokens_seen": 123919920, "step": 3885, "train_runtime": 10191.7169, "train_tokens_per_second": 12158.886 }, { "epoch": 0.26191758685698896, "grad_norm": 1.0222514064696477, "learning_rate": 9.582982452126164e-06, "loss": 0.38756608963012695, "num_input_tokens_seen": 124077120, "step": 3890, "train_runtime": 10204.4045, "train_tokens_per_second": 12159.173 }, { "epoch": 0.2622542418529491, "grad_norm": 0.8430500795054858, "learning_rate": 9.58192467149762e-06, "loss": 0.3738124370574951, "num_input_tokens_seen": 124230192, "step": 3895, "train_runtime": 10216.8592, "train_tokens_per_second": 12159.333 }, { "epoch": 0.26259089684890924, "grad_norm": 0.8924627372368323, "learning_rate": 9.580865609548452e-06, "loss": 0.4181983470916748, "num_input_tokens_seen": 124380808, "step": 3900, "train_runtime": 10229.7768, "train_tokens_per_second": 12158.702 }, { "epoch": 0.2629275518448694, "grad_norm": 0.7468481866069557, "learning_rate": 9.579805266574824e-06, "loss": 0.38424651622772216, "num_input_tokens_seen": 124542288, "step": 3905, "train_runtime": 10244.0941, "train_tokens_per_second": 12157.472 }, { "epoch": 0.2632642068408295, "grad_norm": 0.8568115894821399, "learning_rate": 9.578743642873258e-06, "loss": 0.3943238973617554, "num_input_tokens_seen": 124697856, "step": 3910, "train_runtime": 10256.8037, "train_tokens_per_second": 12157.575 }, { "epoch": 0.26360086183678966, "grad_norm": 0.8326496620327833, "learning_rate": 9.57768073874063e-06, "loss": 0.41575775146484373, "num_input_tokens_seen": 124858128, "step": 3915, "train_runtime": 10269.7185, "train_tokens_per_second": 12157.892 }, { "epoch": 0.2639375168327498, "grad_norm": 0.8295294469717871, "learning_rate": 9.576616554474182e-06, "loss": 0.4290400505065918, "num_input_tokens_seen": 125011600, "step": 3920, "train_runtime": 10283.5875, "train_tokens_per_second": 12156.419 }, { "epoch": 0.26427417182870994, "grad_norm": 0.8719151139755162, "learning_rate": 9.575551090371512e-06, "loss": 0.4100490093231201, "num_input_tokens_seen": 125167128, "step": 3925, "train_runtime": 10297.6114, "train_tokens_per_second": 12154.967 }, { "epoch": 0.2646108268246701, "grad_norm": 0.8752971220136497, "learning_rate": 9.574484346730564e-06, "loss": 0.4104010105133057, "num_input_tokens_seen": 125326112, "step": 3930, "train_runtime": 10311.0567, "train_tokens_per_second": 12154.536 }, { "epoch": 0.2649474818206302, "grad_norm": 0.9716557279175105, "learning_rate": 9.573416323849658e-06, "loss": 0.4124293327331543, "num_input_tokens_seen": 125489136, "step": 3935, "train_runtime": 10325.4421, "train_tokens_per_second": 12153.391 }, { "epoch": 0.26528413681659035, "grad_norm": 0.8661697653347159, "learning_rate": 9.572347022027461e-06, "loss": 0.4076035499572754, "num_input_tokens_seen": 125650216, "step": 3940, "train_runtime": 10338.5406, "train_tokens_per_second": 12153.574 }, { "epoch": 0.2656207918125505, "grad_norm": 0.7906552471950526, "learning_rate": 9.571276441563e-06, "loss": 0.40136399269104006, "num_input_tokens_seen": 125801104, "step": 3945, "train_runtime": 10351.3617, "train_tokens_per_second": 12153.097 }, { "epoch": 0.26595744680851063, "grad_norm": 0.8572791710316278, "learning_rate": 9.570204582755659e-06, "loss": 0.404392147064209, "num_input_tokens_seen": 125960768, "step": 3950, "train_runtime": 10364.0359, "train_tokens_per_second": 12153.641 }, { "epoch": 0.2662941018044708, "grad_norm": 0.8902696335485862, "learning_rate": 9.569131445905178e-06, "loss": 0.42226834297180177, "num_input_tokens_seen": 126118184, "step": 3955, "train_runtime": 10377.4825, "train_tokens_per_second": 12153.062 }, { "epoch": 0.2666307568004309, "grad_norm": 0.9207282485771399, "learning_rate": 9.568057031311659e-06, "loss": 0.4274171829223633, "num_input_tokens_seen": 126272784, "step": 3960, "train_runtime": 10390.9154, "train_tokens_per_second": 12152.229 }, { "epoch": 0.26696741179639105, "grad_norm": 0.9286636294772894, "learning_rate": 9.566981339275557e-06, "loss": 0.44168734550476074, "num_input_tokens_seen": 126430944, "step": 3965, "train_runtime": 10405.1173, "train_tokens_per_second": 12150.843 }, { "epoch": 0.2673040667923512, "grad_norm": 0.8502211820106121, "learning_rate": 9.565904370097687e-06, "loss": 0.40860185623168943, "num_input_tokens_seen": 126585376, "step": 3970, "train_runtime": 10419.0017, "train_tokens_per_second": 12149.473 }, { "epoch": 0.26764072178831133, "grad_norm": 0.8249241010822921, "learning_rate": 9.564826124079219e-06, "loss": 0.38613989353179934, "num_input_tokens_seen": 126745440, "step": 3975, "train_runtime": 10431.4835, "train_tokens_per_second": 12150.28 }, { "epoch": 0.26797737678427147, "grad_norm": 0.8818213747826239, "learning_rate": 9.563746601521681e-06, "loss": 0.37488436698913574, "num_input_tokens_seen": 126905040, "step": 3980, "train_runtime": 10444.587, "train_tokens_per_second": 12150.317 }, { "epoch": 0.2683140317802316, "grad_norm": 0.8918529631279178, "learning_rate": 9.562665802726961e-06, "loss": 0.4101956844329834, "num_input_tokens_seen": 127067696, "step": 3985, "train_runtime": 10457.3572, "train_tokens_per_second": 12151.033 }, { "epoch": 0.26865068677619175, "grad_norm": 0.9196599081003479, "learning_rate": 9.561583727997297e-06, "loss": 0.4102800369262695, "num_input_tokens_seen": 127224496, "step": 3990, "train_runtime": 10470.3267, "train_tokens_per_second": 12150.958 }, { "epoch": 0.2689873417721519, "grad_norm": 1.1778946563404906, "learning_rate": 9.560500377635288e-06, "loss": 0.4151009082794189, "num_input_tokens_seen": 127383952, "step": 3995, "train_runtime": 10482.9527, "train_tokens_per_second": 12151.534 }, { "epoch": 0.26932399676811203, "grad_norm": 0.9621523823599923, "learning_rate": 9.559415751943893e-06, "loss": 0.4220369815826416, "num_input_tokens_seen": 127542080, "step": 4000, "train_runtime": 10496.592, "train_tokens_per_second": 12150.809 }, { "epoch": 0.26966065176407217, "grad_norm": 0.8641340293653632, "learning_rate": 9.558329851226422e-06, "loss": 0.4216341018676758, "num_input_tokens_seen": 127702264, "step": 4005, "train_runtime": 10509.7822, "train_tokens_per_second": 12150.8 }, { "epoch": 0.2699973067600323, "grad_norm": 0.8592458141913455, "learning_rate": 9.557242675786542e-06, "loss": 0.4289440631866455, "num_input_tokens_seen": 127864824, "step": 4010, "train_runtime": 10522.7404, "train_tokens_per_second": 12151.286 }, { "epoch": 0.27033396175599245, "grad_norm": 0.8034543033623522, "learning_rate": 9.55615422592828e-06, "loss": 0.44036264419555665, "num_input_tokens_seen": 128026096, "step": 4015, "train_runtime": 10535.8616, "train_tokens_per_second": 12151.46 }, { "epoch": 0.2706706167519526, "grad_norm": 0.9076276734306452, "learning_rate": 9.555064501956018e-06, "loss": 0.42022361755371096, "num_input_tokens_seen": 128183400, "step": 4020, "train_runtime": 10549.2538, "train_tokens_per_second": 12150.945 }, { "epoch": 0.2710072717479127, "grad_norm": 0.8070570838578593, "learning_rate": 9.553973504174493e-06, "loss": 0.3850049257278442, "num_input_tokens_seen": 128345912, "step": 4025, "train_runtime": 10561.9287, "train_tokens_per_second": 12151.75 }, { "epoch": 0.27134392674387287, "grad_norm": 0.8797477977719831, "learning_rate": 9.5528812328888e-06, "loss": 0.42907538414001467, "num_input_tokens_seen": 128504512, "step": 4030, "train_runtime": 10575.6451, "train_tokens_per_second": 12150.986 }, { "epoch": 0.271680581739833, "grad_norm": 1.4841886312416466, "learning_rate": 9.551787688404386e-06, "loss": 0.3940990447998047, "num_input_tokens_seen": 128661440, "step": 4035, "train_runtime": 10589.0185, "train_tokens_per_second": 12150.46 }, { "epoch": 0.27201723673579314, "grad_norm": 0.8376724870244265, "learning_rate": 9.550692871027061e-06, "loss": 0.39757022857666013, "num_input_tokens_seen": 128823512, "step": 4040, "train_runtime": 10601.4746, "train_tokens_per_second": 12151.471 }, { "epoch": 0.2723538917317533, "grad_norm": 0.940089191419943, "learning_rate": 9.549596781062984e-06, "loss": 0.37547945976257324, "num_input_tokens_seen": 128987352, "step": 4045, "train_runtime": 10613.9244, "train_tokens_per_second": 12152.654 }, { "epoch": 0.2726905467277134, "grad_norm": 1.0051950843366402, "learning_rate": 9.548499418818677e-06, "loss": 0.38057746887207033, "num_input_tokens_seen": 129146048, "step": 4050, "train_runtime": 10627.3533, "train_tokens_per_second": 12152.231 }, { "epoch": 0.27302720172367356, "grad_norm": 0.8633820138217068, "learning_rate": 9.547400784601011e-06, "loss": 0.4335151672363281, "num_input_tokens_seen": 129306696, "step": 4055, "train_runtime": 10640.8708, "train_tokens_per_second": 12151.89 }, { "epoch": 0.2733638567196337, "grad_norm": 0.8537731535280159, "learning_rate": 9.546300878717216e-06, "loss": 0.4264829158782959, "num_input_tokens_seen": 129467632, "step": 4060, "train_runtime": 10654.5637, "train_tokens_per_second": 12151.378 }, { "epoch": 0.27370051171559384, "grad_norm": 0.7561876786663848, "learning_rate": 9.545199701474877e-06, "loss": 0.4020991325378418, "num_input_tokens_seen": 129631472, "step": 4065, "train_runtime": 10666.9987, "train_tokens_per_second": 12152.572 }, { "epoch": 0.274037166711554, "grad_norm": 0.8677494015248345, "learning_rate": 9.544097253181935e-06, "loss": 0.38918609619140626, "num_input_tokens_seen": 129788824, "step": 4070, "train_runtime": 10680.0504, "train_tokens_per_second": 12152.454 }, { "epoch": 0.2743738217075141, "grad_norm": 0.8372079147921017, "learning_rate": 9.542993534146687e-06, "loss": 0.4239842414855957, "num_input_tokens_seen": 129947792, "step": 4075, "train_runtime": 10693.3772, "train_tokens_per_second": 12152.175 }, { "epoch": 0.27471047670347426, "grad_norm": 0.8691398700152315, "learning_rate": 9.541888544677784e-06, "loss": 0.40438117980957033, "num_input_tokens_seen": 130105792, "step": 4080, "train_runtime": 10705.8545, "train_tokens_per_second": 12152.77 }, { "epoch": 0.2750471316994344, "grad_norm": 0.8466844758295657, "learning_rate": 9.540782285084232e-06, "loss": 0.36170125007629395, "num_input_tokens_seen": 130260848, "step": 4085, "train_runtime": 10718.7616, "train_tokens_per_second": 12152.602 }, { "epoch": 0.27538378669539454, "grad_norm": 0.8411277603364619, "learning_rate": 9.539674755675392e-06, "loss": 0.39405972957611085, "num_input_tokens_seen": 130421640, "step": 4090, "train_runtime": 10732.8636, "train_tokens_per_second": 12151.616 }, { "epoch": 0.2757204416913547, "grad_norm": 3.2958252601384914, "learning_rate": 9.538565956760983e-06, "loss": 0.36522512435913085, "num_input_tokens_seen": 130583688, "step": 4095, "train_runtime": 10746.1308, "train_tokens_per_second": 12151.694 }, { "epoch": 0.2760570966873148, "grad_norm": 0.8613146328251964, "learning_rate": 9.537455888651078e-06, "loss": 0.4022481918334961, "num_input_tokens_seen": 130747352, "step": 4100, "train_runtime": 10759.1879, "train_tokens_per_second": 12152.158 }, { "epoch": 0.27639375168327496, "grad_norm": 1.3186680984598695, "learning_rate": 9.536344551656103e-06, "loss": 0.4055627822875977, "num_input_tokens_seen": 130908840, "step": 4105, "train_runtime": 10772.8159, "train_tokens_per_second": 12151.775 }, { "epoch": 0.2767304066792351, "grad_norm": 0.8543652458654861, "learning_rate": 9.535231946086838e-06, "loss": 0.40320382118225095, "num_input_tokens_seen": 131065584, "step": 4110, "train_runtime": 10786.1636, "train_tokens_per_second": 12151.27 }, { "epoch": 0.27706706167519524, "grad_norm": 0.8340108259232891, "learning_rate": 9.534118072254421e-06, "loss": 0.41141462326049805, "num_input_tokens_seen": 131227928, "step": 4115, "train_runtime": 10798.7898, "train_tokens_per_second": 12152.096 }, { "epoch": 0.2774037166711554, "grad_norm": 0.8529357998550278, "learning_rate": 9.533002930470345e-06, "loss": 0.3830364227294922, "num_input_tokens_seen": 131388264, "step": 4120, "train_runtime": 10811.601, "train_tokens_per_second": 12152.526 }, { "epoch": 0.2777403716671155, "grad_norm": 0.7250703589785162, "learning_rate": 9.531886521046452e-06, "loss": 0.38754801750183104, "num_input_tokens_seen": 131544184, "step": 4125, "train_runtime": 10824.9104, "train_tokens_per_second": 12151.988 }, { "epoch": 0.27807702666307565, "grad_norm": 0.8427427927057928, "learning_rate": 9.530768844294947e-06, "loss": 0.4119289398193359, "num_input_tokens_seen": 131703456, "step": 4130, "train_runtime": 10837.9826, "train_tokens_per_second": 12152.027 }, { "epoch": 0.2784136816590358, "grad_norm": 0.8791185440797648, "learning_rate": 9.52964990052838e-06, "loss": 0.42822465896606443, "num_input_tokens_seen": 131861344, "step": 4135, "train_runtime": 10851.2268, "train_tokens_per_second": 12151.745 }, { "epoch": 0.27875033665499593, "grad_norm": 0.820978091717965, "learning_rate": 9.528529690059663e-06, "loss": 0.3799431800842285, "num_input_tokens_seen": 132024592, "step": 4140, "train_runtime": 10864.1584, "train_tokens_per_second": 12152.307 }, { "epoch": 0.2790869916509561, "grad_norm": 0.9925027913446373, "learning_rate": 9.52740821320206e-06, "loss": 0.4137421607971191, "num_input_tokens_seen": 132182088, "step": 4145, "train_runtime": 10877.5079, "train_tokens_per_second": 12151.872 }, { "epoch": 0.2794236466469162, "grad_norm": 0.8612955543167724, "learning_rate": 9.526285470269185e-06, "loss": 0.44510555267333984, "num_input_tokens_seen": 132344056, "step": 4150, "train_runtime": 10891.8434, "train_tokens_per_second": 12150.749 }, { "epoch": 0.2797603016428764, "grad_norm": 0.8456208582653145, "learning_rate": 9.525161461575012e-06, "loss": 0.40246405601501467, "num_input_tokens_seen": 132499456, "step": 4155, "train_runtime": 10905.0227, "train_tokens_per_second": 12150.315 }, { "epoch": 0.28009695663883655, "grad_norm": 0.791031346916803, "learning_rate": 9.524036187433867e-06, "loss": 0.3801803827285767, "num_input_tokens_seen": 132654568, "step": 4160, "train_runtime": 10918.5434, "train_tokens_per_second": 12149.475 }, { "epoch": 0.2804336116347967, "grad_norm": 0.9901434372888882, "learning_rate": 9.522909648160427e-06, "loss": 0.39869370460510256, "num_input_tokens_seen": 132811560, "step": 4165, "train_runtime": 10931.6236, "train_tokens_per_second": 12149.299 }, { "epoch": 0.2807702666307568, "grad_norm": 0.9555149736622928, "learning_rate": 9.521781844069727e-06, "loss": 0.4037034034729004, "num_input_tokens_seen": 132971800, "step": 4170, "train_runtime": 10944.5622, "train_tokens_per_second": 12149.577 }, { "epoch": 0.28110692162671697, "grad_norm": 0.8749219237389935, "learning_rate": 9.520652775477154e-06, "loss": 0.40973973274230957, "num_input_tokens_seen": 133130120, "step": 4175, "train_runtime": 10957.7183, "train_tokens_per_second": 12149.438 }, { "epoch": 0.2814435766226771, "grad_norm": 0.7967954387626621, "learning_rate": 9.519522442698447e-06, "loss": 0.3809692621231079, "num_input_tokens_seen": 133282672, "step": 4180, "train_runtime": 10971.0443, "train_tokens_per_second": 12148.586 }, { "epoch": 0.28178023161863724, "grad_norm": 0.8389319962323508, "learning_rate": 9.518390846049699e-06, "loss": 0.40291223526000974, "num_input_tokens_seen": 133441208, "step": 4185, "train_runtime": 10983.5519, "train_tokens_per_second": 12149.185 }, { "epoch": 0.2821168866145974, "grad_norm": 0.8022457546594207, "learning_rate": 9.517257985847361e-06, "loss": 0.43160762786865237, "num_input_tokens_seen": 133600032, "step": 4190, "train_runtime": 10996.1743, "train_tokens_per_second": 12149.683 }, { "epoch": 0.2824535416105575, "grad_norm": 0.8403775711561599, "learning_rate": 9.516123862408232e-06, "loss": 0.45180859565734866, "num_input_tokens_seen": 133763832, "step": 4195, "train_runtime": 11009.9286, "train_tokens_per_second": 12149.382 }, { "epoch": 0.28279019660651766, "grad_norm": 0.9073939948857712, "learning_rate": 9.514988476049466e-06, "loss": 0.3903691053390503, "num_input_tokens_seen": 133921352, "step": 4200, "train_runtime": 11023.2191, "train_tokens_per_second": 12149.024 }, { "epoch": 0.2831268516024778, "grad_norm": 0.7845901590607888, "learning_rate": 9.513851827088567e-06, "loss": 0.40480241775512693, "num_input_tokens_seen": 134077496, "step": 4205, "train_runtime": 11035.7154, "train_tokens_per_second": 12149.416 }, { "epoch": 0.28346350659843794, "grad_norm": 0.9707194632348691, "learning_rate": 9.512713915843402e-06, "loss": 0.3853065013885498, "num_input_tokens_seen": 134238456, "step": 4210, "train_runtime": 11048.8357, "train_tokens_per_second": 12149.557 }, { "epoch": 0.2838001615943981, "grad_norm": 0.7882020899530009, "learning_rate": 9.511574742632177e-06, "loss": 0.38508694171905516, "num_input_tokens_seen": 134401968, "step": 4215, "train_runtime": 11061.3181, "train_tokens_per_second": 12150.629 }, { "epoch": 0.2841368165903582, "grad_norm": 0.8245499350242305, "learning_rate": 9.510434307773464e-06, "loss": 0.46449713706970214, "num_input_tokens_seen": 134563912, "step": 4220, "train_runtime": 11074.4166, "train_tokens_per_second": 12150.88 }, { "epoch": 0.28447347158631836, "grad_norm": 0.8270810808899612, "learning_rate": 9.509292611586179e-06, "loss": 0.3642393112182617, "num_input_tokens_seen": 134713656, "step": 4225, "train_runtime": 11087.3679, "train_tokens_per_second": 12150.193 }, { "epoch": 0.2848101265822785, "grad_norm": 0.8514366882422044, "learning_rate": 9.508149654389592e-06, "loss": 0.40613679885864257, "num_input_tokens_seen": 134877496, "step": 4230, "train_runtime": 11099.8146, "train_tokens_per_second": 12151.329 }, { "epoch": 0.28514678157823864, "grad_norm": 0.7351343130063843, "learning_rate": 9.507005436503331e-06, "loss": 0.38147788047790526, "num_input_tokens_seen": 135039464, "step": 4235, "train_runtime": 11112.3947, "train_tokens_per_second": 12152.148 }, { "epoch": 0.2854834365741988, "grad_norm": 0.8921418832255089, "learning_rate": 9.505859958247373e-06, "loss": 0.41287670135498045, "num_input_tokens_seen": 135200480, "step": 4240, "train_runtime": 11126.0739, "train_tokens_per_second": 12151.679 }, { "epoch": 0.2858200915701589, "grad_norm": 1.0955574578627245, "learning_rate": 9.504713219942045e-06, "loss": 0.38956336975097655, "num_input_tokens_seen": 135362656, "step": 4245, "train_runtime": 11138.8697, "train_tokens_per_second": 12152.279 }, { "epoch": 0.28615674656611906, "grad_norm": 1.0346635278780059, "learning_rate": 9.503565221908029e-06, "loss": 0.40523953437805177, "num_input_tokens_seen": 135521928, "step": 4250, "train_runtime": 11152.0297, "train_tokens_per_second": 12152.221 }, { "epoch": 0.2864934015620792, "grad_norm": 0.8283715162137227, "learning_rate": 9.50241596446636e-06, "loss": 0.43901691436767576, "num_input_tokens_seen": 135681936, "step": 4255, "train_runtime": 11165.178, "train_tokens_per_second": 12152.241 }, { "epoch": 0.28683005655803934, "grad_norm": 0.8646236196491948, "learning_rate": 9.501265447938423e-06, "loss": 0.39167323112487795, "num_input_tokens_seen": 135838168, "step": 4260, "train_runtime": 11178.9682, "train_tokens_per_second": 12151.226 }, { "epoch": 0.2871667115539995, "grad_norm": 0.909317286454628, "learning_rate": 9.500113672645958e-06, "loss": 0.4129340648651123, "num_input_tokens_seen": 135995232, "step": 4265, "train_runtime": 11192.2296, "train_tokens_per_second": 12150.862 }, { "epoch": 0.2875033665499596, "grad_norm": 0.8463895506085269, "learning_rate": 9.498960638911054e-06, "loss": 0.38132309913635254, "num_input_tokens_seen": 136151416, "step": 4270, "train_runtime": 11205.0992, "train_tokens_per_second": 12150.844 }, { "epoch": 0.28784002154591976, "grad_norm": 1.3972308100657642, "learning_rate": 9.497806347056153e-06, "loss": 0.4125657081604004, "num_input_tokens_seen": 136314760, "step": 4275, "train_runtime": 11218.7557, "train_tokens_per_second": 12150.613 }, { "epoch": 0.2881766765418799, "grad_norm": 0.9522163184661055, "learning_rate": 9.49665079740405e-06, "loss": 0.42870287895202636, "num_input_tokens_seen": 136473352, "step": 4280, "train_runtime": 11231.4159, "train_tokens_per_second": 12151.037 }, { "epoch": 0.28851333153784003, "grad_norm": 1.1180231154347653, "learning_rate": 9.495493990277889e-06, "loss": 0.41233291625976565, "num_input_tokens_seen": 136630312, "step": 4285, "train_runtime": 11244.4219, "train_tokens_per_second": 12150.941 }, { "epoch": 0.2888499865338002, "grad_norm": 0.8815055094974447, "learning_rate": 9.49433592600117e-06, "loss": 0.4076373100280762, "num_input_tokens_seen": 136794152, "step": 4290, "train_runtime": 11256.8586, "train_tokens_per_second": 12152.072 }, { "epoch": 0.2891866415297603, "grad_norm": 1.0161708837721504, "learning_rate": 9.49317660489774e-06, "loss": 0.41091256141662597, "num_input_tokens_seen": 136956864, "step": 4295, "train_runtime": 11269.5927, "train_tokens_per_second": 12152.778 }, { "epoch": 0.28952329652572045, "grad_norm": 1.349032180296885, "learning_rate": 9.4920160272918e-06, "loss": 0.3965152263641357, "num_input_tokens_seen": 137117528, "step": 4300, "train_runtime": 11282.0668, "train_tokens_per_second": 12153.582 }, { "epoch": 0.2898599515216806, "grad_norm": 1.094701939369197, "learning_rate": 9.490854193507904e-06, "loss": 0.4082478523254395, "num_input_tokens_seen": 137275328, "step": 4305, "train_runtime": 11295.4408, "train_tokens_per_second": 12153.163 }, { "epoch": 0.29019660651764073, "grad_norm": 0.9570476290737923, "learning_rate": 9.489691103870951e-06, "loss": 0.4289418697357178, "num_input_tokens_seen": 137433528, "step": 4310, "train_runtime": 11307.9997, "train_tokens_per_second": 12153.655 }, { "epoch": 0.29053326151360087, "grad_norm": 0.9234343510694029, "learning_rate": 9.488526758706198e-06, "loss": 0.39855406284332273, "num_input_tokens_seen": 137592952, "step": 4315, "train_runtime": 11320.7537, "train_tokens_per_second": 12154.045 }, { "epoch": 0.290869916509561, "grad_norm": 0.9703115717445585, "learning_rate": 9.48736115833925e-06, "loss": 0.4281930446624756, "num_input_tokens_seen": 137745600, "step": 4320, "train_runtime": 11334.1515, "train_tokens_per_second": 12153.146 }, { "epoch": 0.29120657150552115, "grad_norm": 0.8103780205610209, "learning_rate": 9.486194303096062e-06, "loss": 0.3839207410812378, "num_input_tokens_seen": 137908784, "step": 4325, "train_runtime": 11347.7586, "train_tokens_per_second": 12152.954 }, { "epoch": 0.2915432265014813, "grad_norm": 0.8243675909986489, "learning_rate": 9.485026193302945e-06, "loss": 0.3825213432312012, "num_input_tokens_seen": 138070808, "step": 4330, "train_runtime": 11360.9226, "train_tokens_per_second": 12153.133 }, { "epoch": 0.29187988149744143, "grad_norm": 0.7249358032108992, "learning_rate": 9.483856829286552e-06, "loss": 0.44112935066223147, "num_input_tokens_seen": 138232360, "step": 4335, "train_runtime": 11373.382, "train_tokens_per_second": 12154.024 }, { "epoch": 0.29221653649340157, "grad_norm": 1.0451893486261747, "learning_rate": 9.482686211373896e-06, "loss": 0.4225608825683594, "num_input_tokens_seen": 138395136, "step": 4340, "train_runtime": 11386.1979, "train_tokens_per_second": 12154.64 }, { "epoch": 0.2925531914893617, "grad_norm": 0.9436916338064438, "learning_rate": 9.481514339892335e-06, "loss": 0.4296980381011963, "num_input_tokens_seen": 138557648, "step": 4345, "train_runtime": 11398.8661, "train_tokens_per_second": 12155.389 }, { "epoch": 0.29288984648532185, "grad_norm": 0.7728240407150901, "learning_rate": 9.48034121516958e-06, "loss": 0.4123666286468506, "num_input_tokens_seen": 138715080, "step": 4350, "train_runtime": 11412.1857, "train_tokens_per_second": 12154.997 }, { "epoch": 0.293226501481282, "grad_norm": 0.7324110291364622, "learning_rate": 9.47916683753369e-06, "loss": 0.4054971694946289, "num_input_tokens_seen": 138875448, "step": 4355, "train_runtime": 11425.3298, "train_tokens_per_second": 12155.049 }, { "epoch": 0.2935631564772421, "grad_norm": 0.8851222055351642, "learning_rate": 9.477991207313077e-06, "loss": 0.41019449234008787, "num_input_tokens_seen": 139035344, "step": 4360, "train_runtime": 11437.9101, "train_tokens_per_second": 12155.66 }, { "epoch": 0.29389981147320227, "grad_norm": 0.8419158898950759, "learning_rate": 9.476814324836504e-06, "loss": 0.39893355369567873, "num_input_tokens_seen": 139197800, "step": 4365, "train_runtime": 11450.5808, "train_tokens_per_second": 12156.397 }, { "epoch": 0.2942364664691624, "grad_norm": 0.9172784511100571, "learning_rate": 9.475636190433078e-06, "loss": 0.46141653060913085, "num_input_tokens_seen": 139359936, "step": 4370, "train_runtime": 11463.0487, "train_tokens_per_second": 12157.319 }, { "epoch": 0.29457312146512254, "grad_norm": 0.8131494523021554, "learning_rate": 9.474456804432264e-06, "loss": 0.4125767707824707, "num_input_tokens_seen": 139522080, "step": 4375, "train_runtime": 11476.2288, "train_tokens_per_second": 12157.485 }, { "epoch": 0.2949097764610827, "grad_norm": 0.8801724628849412, "learning_rate": 9.473276167163872e-06, "loss": 0.40921797752380373, "num_input_tokens_seen": 139684512, "step": 4380, "train_runtime": 11488.6749, "train_tokens_per_second": 12158.453 }, { "epoch": 0.2952464314570428, "grad_norm": 0.817729180466838, "learning_rate": 9.472094278958066e-06, "loss": 0.436159086227417, "num_input_tokens_seen": 139847496, "step": 4385, "train_runtime": 11501.4919, "train_tokens_per_second": 12159.074 }, { "epoch": 0.29558308645300296, "grad_norm": 0.8156745528230597, "learning_rate": 9.470911140145353e-06, "loss": 0.41635875701904296, "num_input_tokens_seen": 140004552, "step": 4390, "train_runtime": 11514.1639, "train_tokens_per_second": 12159.333 }, { "epoch": 0.2959197414489631, "grad_norm": 0.9033147544759869, "learning_rate": 9.469726751056599e-06, "loss": 0.40703392028808594, "num_input_tokens_seen": 140166880, "step": 4395, "train_runtime": 11527.281, "train_tokens_per_second": 12159.579 }, { "epoch": 0.29625639644492324, "grad_norm": 1.0566716332279595, "learning_rate": 9.468541112023009e-06, "loss": 0.43402862548828125, "num_input_tokens_seen": 140323904, "step": 4400, "train_runtime": 11540.9513, "train_tokens_per_second": 12158.781 }, { "epoch": 0.2965930514408834, "grad_norm": 0.8266801927187695, "learning_rate": 9.467354223376149e-06, "loss": 0.41649560928344725, "num_input_tokens_seen": 140476704, "step": 4405, "train_runtime": 11554.866, "train_tokens_per_second": 12157.363 }, { "epoch": 0.2969297064368435, "grad_norm": 0.8412248467398555, "learning_rate": 9.466166085447923e-06, "loss": 0.39827594757080076, "num_input_tokens_seen": 140634016, "step": 4410, "train_runtime": 11568.2122, "train_tokens_per_second": 12156.936 }, { "epoch": 0.29726636143280366, "grad_norm": 0.856232253356463, "learning_rate": 9.464976698570595e-06, "loss": 0.3855783939361572, "num_input_tokens_seen": 140784784, "step": 4415, "train_runtime": 11582.342, "train_tokens_per_second": 12155.122 }, { "epoch": 0.2976030164287638, "grad_norm": 0.8481816554616582, "learning_rate": 9.463786063076769e-06, "loss": 0.43189396858215334, "num_input_tokens_seen": 140943328, "step": 4420, "train_runtime": 11595.3464, "train_tokens_per_second": 12155.163 }, { "epoch": 0.29793967142472394, "grad_norm": 0.8715209931650221, "learning_rate": 9.462594179299408e-06, "loss": 0.34606108665466306, "num_input_tokens_seen": 141102432, "step": 4425, "train_runtime": 11608.3572, "train_tokens_per_second": 12155.246 }, { "epoch": 0.2982763264206841, "grad_norm": 0.8899438755819059, "learning_rate": 9.461401047571811e-06, "loss": 0.3818617343902588, "num_input_tokens_seen": 141265112, "step": 4430, "train_runtime": 11621.3112, "train_tokens_per_second": 12155.695 }, { "epoch": 0.2986129814166442, "grad_norm": 0.8002666354318052, "learning_rate": 9.460206668227639e-06, "loss": 0.41319904327392576, "num_input_tokens_seen": 141428840, "step": 4435, "train_runtime": 11634.3807, "train_tokens_per_second": 12156.112 }, { "epoch": 0.29894963641260436, "grad_norm": 0.7284442701043069, "learning_rate": 9.459011041600895e-06, "loss": 0.390230131149292, "num_input_tokens_seen": 141592680, "step": 4440, "train_runtime": 11646.8126, "train_tokens_per_second": 12157.204 }, { "epoch": 0.2992862914085645, "grad_norm": 0.7891894798493347, "learning_rate": 9.457814168025932e-06, "loss": 0.37724034786224364, "num_input_tokens_seen": 141752448, "step": 4445, "train_runtime": 11659.6033, "train_tokens_per_second": 12157.57 }, { "epoch": 0.29962294640452464, "grad_norm": 0.9299250490290664, "learning_rate": 9.456616047837452e-06, "loss": 0.41147918701171876, "num_input_tokens_seen": 141905464, "step": 4450, "train_runtime": 11672.6854, "train_tokens_per_second": 12157.054 }, { "epoch": 0.2999596014004848, "grad_norm": 0.8540909625650474, "learning_rate": 9.455416681370506e-06, "loss": 0.44285898208618163, "num_input_tokens_seen": 142066760, "step": 4455, "train_runtime": 11685.7211, "train_tokens_per_second": 12157.295 }, { "epoch": 0.3002962563964449, "grad_norm": 1.4763148051228883, "learning_rate": 9.45421606896049e-06, "loss": 0.42873735427856446, "num_input_tokens_seen": 142229688, "step": 4460, "train_runtime": 11698.4995, "train_tokens_per_second": 12157.943 }, { "epoch": 0.30063291139240506, "grad_norm": 0.8497188670993348, "learning_rate": 9.453014210943155e-06, "loss": 0.4182133674621582, "num_input_tokens_seen": 142391240, "step": 4465, "train_runtime": 11711.0648, "train_tokens_per_second": 12158.693 }, { "epoch": 0.3009695663883652, "grad_norm": 0.8082557462294843, "learning_rate": 9.451811107654596e-06, "loss": 0.39871602058410643, "num_input_tokens_seen": 142552992, "step": 4470, "train_runtime": 11723.6574, "train_tokens_per_second": 12159.43 }, { "epoch": 0.30130622138432533, "grad_norm": 0.9053717388781125, "learning_rate": 9.450606759431255e-06, "loss": 0.4201824188232422, "num_input_tokens_seen": 142714592, "step": 4475, "train_runtime": 11736.1645, "train_tokens_per_second": 12160.241 }, { "epoch": 0.3016428763802855, "grad_norm": 1.1379930610932143, "learning_rate": 9.449401166609928e-06, "loss": 0.43520140647888184, "num_input_tokens_seen": 142872288, "step": 4480, "train_runtime": 11750.0031, "train_tokens_per_second": 12159.34 }, { "epoch": 0.3019795313762456, "grad_norm": 0.8193985705001284, "learning_rate": 9.448194329527752e-06, "loss": 0.41699957847595215, "num_input_tokens_seen": 143030336, "step": 4485, "train_runtime": 11763.089, "train_tokens_per_second": 12159.25 }, { "epoch": 0.30231618637220575, "grad_norm": 0.7565937337060026, "learning_rate": 9.446986248522216e-06, "loss": 0.3980448246002197, "num_input_tokens_seen": 143188152, "step": 4490, "train_runtime": 11776.1576, "train_tokens_per_second": 12159.157 }, { "epoch": 0.3026528413681659, "grad_norm": 0.7855961183604351, "learning_rate": 9.445776923931157e-06, "loss": 0.38038811683654783, "num_input_tokens_seen": 143341280, "step": 4495, "train_runtime": 11788.8192, "train_tokens_per_second": 12159.087 }, { "epoch": 0.30298949636412603, "grad_norm": 0.9074275710891186, "learning_rate": 9.444566356092754e-06, "loss": 0.4193134307861328, "num_input_tokens_seen": 143503248, "step": 4500, "train_runtime": 11802.6779, "train_tokens_per_second": 12158.533 }, { "epoch": 0.30332615136008617, "grad_norm": 0.8561921751722225, "learning_rate": 9.443354545345545e-06, "loss": 0.3744628429412842, "num_input_tokens_seen": 143663264, "step": 4505, "train_runtime": 11815.8114, "train_tokens_per_second": 12158.561 }, { "epoch": 0.3036628063560463, "grad_norm": 0.6971244335977618, "learning_rate": 9.442141492028406e-06, "loss": 0.3868942022323608, "num_input_tokens_seen": 143826192, "step": 4510, "train_runtime": 11829.5405, "train_tokens_per_second": 12158.223 }, { "epoch": 0.30399946135200645, "grad_norm": 0.9156373436448563, "learning_rate": 9.440927196480563e-06, "loss": 0.397089409828186, "num_input_tokens_seen": 143987960, "step": 4515, "train_runtime": 11842.3872, "train_tokens_per_second": 12158.694 }, { "epoch": 0.3043361163479666, "grad_norm": 0.7312761786649533, "learning_rate": 9.439711659041593e-06, "loss": 0.39508748054504395, "num_input_tokens_seen": 144148208, "step": 4520, "train_runtime": 11855.9172, "train_tokens_per_second": 12158.335 }, { "epoch": 0.30467277134392673, "grad_norm": 0.8197796372255761, "learning_rate": 9.438494880051413e-06, "loss": 0.4180232048034668, "num_input_tokens_seen": 144308840, "step": 4525, "train_runtime": 11868.7404, "train_tokens_per_second": 12158.733 }, { "epoch": 0.30500942633988687, "grad_norm": 0.8001528057679329, "learning_rate": 9.437276859850293e-06, "loss": 0.3978069543838501, "num_input_tokens_seen": 144469856, "step": 4530, "train_runtime": 11882.3043, "train_tokens_per_second": 12158.404 }, { "epoch": 0.305346081335847, "grad_norm": 0.9047970325185543, "learning_rate": 9.436057598778848e-06, "loss": 0.4406630516052246, "num_input_tokens_seen": 144629648, "step": 4535, "train_runtime": 11895.832, "train_tokens_per_second": 12158.01 }, { "epoch": 0.30568273633180715, "grad_norm": 0.8524924733353111, "learning_rate": 9.434837097178043e-06, "loss": 0.46436290740966796, "num_input_tokens_seen": 144790904, "step": 4540, "train_runtime": 11909.1159, "train_tokens_per_second": 12157.989 }, { "epoch": 0.3060193913277673, "grad_norm": 0.9196616779628041, "learning_rate": 9.433615355389183e-06, "loss": 0.42666077613830566, "num_input_tokens_seen": 144945576, "step": 4545, "train_runtime": 11922.4772, "train_tokens_per_second": 12157.337 }, { "epoch": 0.3063560463237274, "grad_norm": 0.8038992071450518, "learning_rate": 9.432392373753926e-06, "loss": 0.4093827247619629, "num_input_tokens_seen": 145106704, "step": 4550, "train_runtime": 11935.5079, "train_tokens_per_second": 12157.564 }, { "epoch": 0.30669270131968757, "grad_norm": 0.7660744108716969, "learning_rate": 9.431168152614278e-06, "loss": 0.4056282043457031, "num_input_tokens_seen": 145267504, "step": 4555, "train_runtime": 11948.5275, "train_tokens_per_second": 12157.775 }, { "epoch": 0.3070293563156477, "grad_norm": 0.8265055133962735, "learning_rate": 9.429942692312585e-06, "loss": 0.37420063018798827, "num_input_tokens_seen": 145425192, "step": 4560, "train_runtime": 11961.5804, "train_tokens_per_second": 12157.69 }, { "epoch": 0.30736601131160785, "grad_norm": 0.6646715297703406, "learning_rate": 9.428715993191546e-06, "loss": 0.3812062740325928, "num_input_tokens_seen": 145587880, "step": 4565, "train_runtime": 11975.0302, "train_tokens_per_second": 12157.621 }, { "epoch": 0.307702666307568, "grad_norm": 0.8232878462191243, "learning_rate": 9.427488055594199e-06, "loss": 0.4013862609863281, "num_input_tokens_seen": 145746552, "step": 4570, "train_runtime": 11989.8051, "train_tokens_per_second": 12155.873 }, { "epoch": 0.3080393213035281, "grad_norm": 0.9078231146166715, "learning_rate": 9.426258879863937e-06, "loss": 0.4333981513977051, "num_input_tokens_seen": 145910392, "step": 4575, "train_runtime": 12002.2394, "train_tokens_per_second": 12156.931 }, { "epoch": 0.30837597629948826, "grad_norm": 1.0674900960925655, "learning_rate": 9.425028466344494e-06, "loss": 0.36445639133453367, "num_input_tokens_seen": 146067464, "step": 4580, "train_runtime": 12014.8232, "train_tokens_per_second": 12157.271 }, { "epoch": 0.3087126312954484, "grad_norm": 1.174643176821385, "learning_rate": 9.42379681537995e-06, "loss": 0.3764669895172119, "num_input_tokens_seen": 146226792, "step": 4585, "train_runtime": 12027.5759, "train_tokens_per_second": 12157.628 }, { "epoch": 0.30904928629140854, "grad_norm": 0.9052483555370321, "learning_rate": 9.422563927314732e-06, "loss": 0.4020869731903076, "num_input_tokens_seen": 146385584, "step": 4590, "train_runtime": 12040.2597, "train_tokens_per_second": 12158.009 }, { "epoch": 0.3093859412873687, "grad_norm": 0.8941761904858248, "learning_rate": 9.421329802493615e-06, "loss": 0.3765645742416382, "num_input_tokens_seen": 146546272, "step": 4595, "train_runtime": 12053.0465, "train_tokens_per_second": 12158.442 }, { "epoch": 0.3097225962833288, "grad_norm": 0.8172363692615738, "learning_rate": 9.420094441261717e-06, "loss": 0.3999391317367554, "num_input_tokens_seen": 146706520, "step": 4600, "train_runtime": 12065.951, "train_tokens_per_second": 12158.72 }, { "epoch": 0.31005925127928896, "grad_norm": 0.8654481893727304, "learning_rate": 9.418857843964506e-06, "loss": 0.3883073806762695, "num_input_tokens_seen": 146863528, "step": 4605, "train_runtime": 12078.8423, "train_tokens_per_second": 12158.742 }, { "epoch": 0.3103959062752491, "grad_norm": 0.7922873475473806, "learning_rate": 9.417620010947786e-06, "loss": 0.42149972915649414, "num_input_tokens_seen": 147017824, "step": 4610, "train_runtime": 12091.4001, "train_tokens_per_second": 12158.875 }, { "epoch": 0.31073256127120924, "grad_norm": 0.7773461059949922, "learning_rate": 9.416380942557719e-06, "loss": 0.3709684371948242, "num_input_tokens_seen": 147180312, "step": 4615, "train_runtime": 12104.3074, "train_tokens_per_second": 12159.334 }, { "epoch": 0.3110692162671694, "grad_norm": 1.3474794135025365, "learning_rate": 9.415140639140803e-06, "loss": 0.4084783554077148, "num_input_tokens_seen": 147336656, "step": 4620, "train_runtime": 12117.9338, "train_tokens_per_second": 12158.563 }, { "epoch": 0.3114058712631295, "grad_norm": 0.7998900902540631, "learning_rate": 9.413899101043887e-06, "loss": 0.4386431694030762, "num_input_tokens_seen": 147491840, "step": 4625, "train_runtime": 12131.2798, "train_tokens_per_second": 12157.979 }, { "epoch": 0.31174252625908966, "grad_norm": 0.9229934872160875, "learning_rate": 9.412656328614162e-06, "loss": 0.4202288627624512, "num_input_tokens_seen": 147649512, "step": 4630, "train_runtime": 12144.4037, "train_tokens_per_second": 12157.823 }, { "epoch": 0.3120791812550498, "grad_norm": 0.8744546564002237, "learning_rate": 9.411412322199165e-06, "loss": 0.41219310760498046, "num_input_tokens_seen": 147812056, "step": 4635, "train_runtime": 12158.1718, "train_tokens_per_second": 12157.425 }, { "epoch": 0.31241583625100994, "grad_norm": 0.7083917759084929, "learning_rate": 9.41016708214678e-06, "loss": 0.4056905746459961, "num_input_tokens_seen": 147970528, "step": 4640, "train_runtime": 12171.6511, "train_tokens_per_second": 12156.981 }, { "epoch": 0.31275249124697013, "grad_norm": 0.8235496817803302, "learning_rate": 9.408920608805233e-06, "loss": 0.40030794143676757, "num_input_tokens_seen": 148130632, "step": 4645, "train_runtime": 12184.3441, "train_tokens_per_second": 12157.456 }, { "epoch": 0.31308914624293027, "grad_norm": 0.7825366245386461, "learning_rate": 9.407672902523097e-06, "loss": 0.412338924407959, "num_input_tokens_seen": 148293280, "step": 4650, "train_runtime": 12197.0494, "train_tokens_per_second": 12158.127 }, { "epoch": 0.3134258012388904, "grad_norm": 0.8335452999443579, "learning_rate": 9.406423963649287e-06, "loss": 0.402410888671875, "num_input_tokens_seen": 148450520, "step": 4655, "train_runtime": 12209.7691, "train_tokens_per_second": 12158.34 }, { "epoch": 0.31376245623485055, "grad_norm": 0.7840629327492388, "learning_rate": 9.405173792533069e-06, "loss": 0.3869786262512207, "num_input_tokens_seen": 148612952, "step": 4660, "train_runtime": 12222.3325, "train_tokens_per_second": 12159.132 }, { "epoch": 0.3140991112308107, "grad_norm": 0.7910144308714715, "learning_rate": 9.403922389524045e-06, "loss": 0.4036257743835449, "num_input_tokens_seen": 148769664, "step": 4665, "train_runtime": 12234.9384, "train_tokens_per_second": 12159.413 }, { "epoch": 0.31443576622677083, "grad_norm": 0.833877535981925, "learning_rate": 9.40266975497217e-06, "loss": 0.4103482723236084, "num_input_tokens_seen": 148926896, "step": 4670, "train_runtime": 12248.1091, "train_tokens_per_second": 12159.174 }, { "epoch": 0.31477242122273097, "grad_norm": 0.8485970901895429, "learning_rate": 9.401415889227736e-06, "loss": 0.42368435859680176, "num_input_tokens_seen": 149090048, "step": 4675, "train_runtime": 12261.1324, "train_tokens_per_second": 12159.566 }, { "epoch": 0.3151090762186911, "grad_norm": 0.7825259543818295, "learning_rate": 9.400160792641385e-06, "loss": 0.4236462593078613, "num_input_tokens_seen": 149253888, "step": 4680, "train_runtime": 12273.5615, "train_tokens_per_second": 12160.601 }, { "epoch": 0.31544573121465125, "grad_norm": 0.769365701722422, "learning_rate": 9.398904465564097e-06, "loss": 0.40953617095947265, "num_input_tokens_seen": 149413600, "step": 4685, "train_runtime": 12286.7741, "train_tokens_per_second": 12160.523 }, { "epoch": 0.3157823862106114, "grad_norm": 0.7674338149775708, "learning_rate": 9.397646908347203e-06, "loss": 0.3950378894805908, "num_input_tokens_seen": 149570592, "step": 4690, "train_runtime": 12299.472, "train_tokens_per_second": 12160.733 }, { "epoch": 0.3161190412065715, "grad_norm": 1.5817771573879629, "learning_rate": 9.396388121342375e-06, "loss": 0.37178051471710205, "num_input_tokens_seen": 149734192, "step": 4695, "train_runtime": 12312.522, "train_tokens_per_second": 12161.131 }, { "epoch": 0.31645569620253167, "grad_norm": 0.9386685224889469, "learning_rate": 9.395128104901628e-06, "loss": 0.37784833908081056, "num_input_tokens_seen": 149890656, "step": 4700, "train_runtime": 12325.5045, "train_tokens_per_second": 12161.016 }, { "epoch": 0.3167923511984918, "grad_norm": 0.8455532511447771, "learning_rate": 9.393866859377321e-06, "loss": 0.43805780410766604, "num_input_tokens_seen": 150051288, "step": 4705, "train_runtime": 12338.4461, "train_tokens_per_second": 12161.279 }, { "epoch": 0.31712900619445195, "grad_norm": 0.8408644125122793, "learning_rate": 9.392604385122157e-06, "loss": 0.42035617828369143, "num_input_tokens_seen": 150213736, "step": 4710, "train_runtime": 12351.1061, "train_tokens_per_second": 12161.966 }, { "epoch": 0.3174656611904121, "grad_norm": 0.7855649433639134, "learning_rate": 9.391340682489185e-06, "loss": 0.3809244155883789, "num_input_tokens_seen": 150371992, "step": 4715, "train_runtime": 12364.4079, "train_tokens_per_second": 12161.682 }, { "epoch": 0.3178023161863722, "grad_norm": 0.9612928324671719, "learning_rate": 9.390075751831794e-06, "loss": 0.42129902839660643, "num_input_tokens_seen": 150532456, "step": 4720, "train_runtime": 12377.7085, "train_tokens_per_second": 12161.577 }, { "epoch": 0.31813897118233236, "grad_norm": 0.916937940209648, "learning_rate": 9.388809593503718e-06, "loss": 0.4207742214202881, "num_input_tokens_seen": 150691232, "step": 4725, "train_runtime": 12390.3201, "train_tokens_per_second": 12162.013 }, { "epoch": 0.3184756261782925, "grad_norm": 0.9869853480917334, "learning_rate": 9.387542207859034e-06, "loss": 0.46114530563354494, "num_input_tokens_seen": 150849560, "step": 4730, "train_runtime": 12403.2652, "train_tokens_per_second": 12162.085 }, { "epoch": 0.31881228117425264, "grad_norm": 0.8468363939082243, "learning_rate": 9.386273595252161e-06, "loss": 0.4186831474304199, "num_input_tokens_seen": 151011472, "step": 4735, "train_runtime": 12415.8054, "train_tokens_per_second": 12162.841 }, { "epoch": 0.3191489361702128, "grad_norm": 0.8779763566849437, "learning_rate": 9.385003756037865e-06, "loss": 0.4159707069396973, "num_input_tokens_seen": 151172248, "step": 4740, "train_runtime": 12428.681, "train_tokens_per_second": 12163.177 }, { "epoch": 0.3194855911661729, "grad_norm": 1.0800308048510612, "learning_rate": 9.383732690571253e-06, "loss": 0.4065821647644043, "num_input_tokens_seen": 151336088, "step": 4745, "train_runtime": 12441.1123, "train_tokens_per_second": 12164.193 }, { "epoch": 0.31982224616213306, "grad_norm": 0.7787481334432229, "learning_rate": 9.382460399207769e-06, "loss": 0.41455612182617185, "num_input_tokens_seen": 151497904, "step": 4750, "train_runtime": 12453.6968, "train_tokens_per_second": 12164.894 }, { "epoch": 0.3201589011580932, "grad_norm": 0.7989212668442146, "learning_rate": 9.381186882303212e-06, "loss": 0.38765130043029783, "num_input_tokens_seen": 151647912, "step": 4755, "train_runtime": 12466.2562, "train_tokens_per_second": 12164.672 }, { "epoch": 0.32049555615405334, "grad_norm": 0.8564718229985108, "learning_rate": 9.379912140213713e-06, "loss": 0.4071049690246582, "num_input_tokens_seen": 151802808, "step": 4760, "train_runtime": 12479.2361, "train_tokens_per_second": 12164.431 }, { "epoch": 0.3208322111500135, "grad_norm": 0.7406210590047412, "learning_rate": 9.37863617329575e-06, "loss": 0.38042144775390624, "num_input_tokens_seen": 151963024, "step": 4765, "train_runtime": 12493.3746, "train_tokens_per_second": 12163.489 }, { "epoch": 0.3211688661459736, "grad_norm": 0.9020902505405521, "learning_rate": 9.377358981906145e-06, "loss": 0.3874586343765259, "num_input_tokens_seen": 152121440, "step": 4770, "train_runtime": 12506.1342, "train_tokens_per_second": 12163.746 }, { "epoch": 0.32150552114193376, "grad_norm": 0.7649066199895285, "learning_rate": 9.376080566402059e-06, "loss": 0.4204458713531494, "num_input_tokens_seen": 152285280, "step": 4775, "train_runtime": 12518.5723, "train_tokens_per_second": 12164.748 }, { "epoch": 0.3218421761378939, "grad_norm": 0.7384489913772869, "learning_rate": 9.374800927140994e-06, "loss": 0.3313518285751343, "num_input_tokens_seen": 152448192, "step": 4780, "train_runtime": 12531.5765, "train_tokens_per_second": 12165.125 }, { "epoch": 0.32217883113385404, "grad_norm": 0.8386048485384894, "learning_rate": 9.373520064480804e-06, "loss": 0.38408641815185546, "num_input_tokens_seen": 152610000, "step": 4785, "train_runtime": 12544.1684, "train_tokens_per_second": 12165.812 }, { "epoch": 0.3225154861298142, "grad_norm": 0.824439348353975, "learning_rate": 9.372237978779672e-06, "loss": 0.4035375118255615, "num_input_tokens_seen": 152772720, "step": 4790, "train_runtime": 12556.6327, "train_tokens_per_second": 12166.695 }, { "epoch": 0.3228521411257743, "grad_norm": 0.8334478415115991, "learning_rate": 9.37095467039613e-06, "loss": 0.3929436206817627, "num_input_tokens_seen": 152926368, "step": 4795, "train_runtime": 12569.2435, "train_tokens_per_second": 12166.712 }, { "epoch": 0.32318879612173446, "grad_norm": 0.8072416528920171, "learning_rate": 9.369670139689056e-06, "loss": 0.3829780340194702, "num_input_tokens_seen": 153084776, "step": 4800, "train_runtime": 12582.1322, "train_tokens_per_second": 12166.839 }, { "epoch": 0.3235254511176946, "grad_norm": 0.7767829514462551, "learning_rate": 9.368384387017659e-06, "loss": 0.38355996608734133, "num_input_tokens_seen": 153238984, "step": 4805, "train_runtime": 12596.4786, "train_tokens_per_second": 12165.224 }, { "epoch": 0.32386210611365474, "grad_norm": 0.8005623513813104, "learning_rate": 9.367097412741497e-06, "loss": 0.3950089931488037, "num_input_tokens_seen": 153393936, "step": 4810, "train_runtime": 12609.5254, "train_tokens_per_second": 12164.925 }, { "epoch": 0.3241987611096149, "grad_norm": 0.976355566941992, "learning_rate": 9.36580921722047e-06, "loss": 0.41298389434814453, "num_input_tokens_seen": 153556688, "step": 4815, "train_runtime": 12622.232, "train_tokens_per_second": 12165.573 }, { "epoch": 0.324535416105575, "grad_norm": 0.7889158643184929, "learning_rate": 9.364519800814818e-06, "loss": 0.3670580625534058, "num_input_tokens_seen": 153719616, "step": 4820, "train_runtime": 12634.6591, "train_tokens_per_second": 12166.503 }, { "epoch": 0.32487207110153515, "grad_norm": 0.6594362745631708, "learning_rate": 9.36322916388512e-06, "loss": 0.3989641904830933, "num_input_tokens_seen": 153880488, "step": 4825, "train_runtime": 12647.1236, "train_tokens_per_second": 12167.232 }, { "epoch": 0.3252087260974953, "grad_norm": 0.7912959674385803, "learning_rate": 9.3619373067923e-06, "loss": 0.36187832355499266, "num_input_tokens_seen": 154042224, "step": 4830, "train_runtime": 12659.6591, "train_tokens_per_second": 12167.96 }, { "epoch": 0.32554538109345543, "grad_norm": 0.7861261637169029, "learning_rate": 9.360644229897622e-06, "loss": 0.4024681091308594, "num_input_tokens_seen": 154201664, "step": 4835, "train_runtime": 12672.5838, "train_tokens_per_second": 12168.131 }, { "epoch": 0.32588203608941557, "grad_norm": 1.7371560857219417, "learning_rate": 9.35934993356269e-06, "loss": 0.42070827484130857, "num_input_tokens_seen": 154360976, "step": 4840, "train_runtime": 12685.9092, "train_tokens_per_second": 12167.908 }, { "epoch": 0.3262186910853757, "grad_norm": 0.9320942600152324, "learning_rate": 9.35805441814945e-06, "loss": 0.35839457511901857, "num_input_tokens_seen": 154521192, "step": 4845, "train_runtime": 12698.3262, "train_tokens_per_second": 12168.627 }, { "epoch": 0.32655534608133585, "grad_norm": 0.879351394336123, "learning_rate": 9.356757684020188e-06, "loss": 0.42413878440856934, "num_input_tokens_seen": 154676968, "step": 4850, "train_runtime": 12711.4483, "train_tokens_per_second": 12168.32 }, { "epoch": 0.326892001077296, "grad_norm": 0.907509715514265, "learning_rate": 9.355459731537533e-06, "loss": 0.3926476240158081, "num_input_tokens_seen": 154836584, "step": 4855, "train_runtime": 12724.2091, "train_tokens_per_second": 12168.661 }, { "epoch": 0.32722865607325613, "grad_norm": 0.9458456785324451, "learning_rate": 9.354160561064451e-06, "loss": 0.41061720848083494, "num_input_tokens_seen": 154997536, "step": 4860, "train_runtime": 12737.7757, "train_tokens_per_second": 12168.336 }, { "epoch": 0.32756531106921627, "grad_norm": 0.8010538144988205, "learning_rate": 9.352860172964254e-06, "loss": 0.43629021644592286, "num_input_tokens_seen": 155158880, "step": 4865, "train_runtime": 12750.805, "train_tokens_per_second": 12168.556 }, { "epoch": 0.3279019660651764, "grad_norm": 0.8690731601875019, "learning_rate": 9.35155856760059e-06, "loss": 0.35876505374908446, "num_input_tokens_seen": 155321408, "step": 4870, "train_runtime": 12763.4917, "train_tokens_per_second": 12169.194 }, { "epoch": 0.32823862106113655, "grad_norm": 0.7890294783649087, "learning_rate": 9.35025574533745e-06, "loss": 0.41234002113342283, "num_input_tokens_seen": 155483600, "step": 4875, "train_runtime": 12776.1295, "train_tokens_per_second": 12169.852 }, { "epoch": 0.3285752760570967, "grad_norm": 0.8823416631189168, "learning_rate": 9.34895170653916e-06, "loss": 0.39826986789703367, "num_input_tokens_seen": 155644456, "step": 4880, "train_runtime": 12789.2606, "train_tokens_per_second": 12169.934 }, { "epoch": 0.3289119310530568, "grad_norm": 0.7832857690809821, "learning_rate": 9.347646451570394e-06, "loss": 0.3966914176940918, "num_input_tokens_seen": 155803504, "step": 4885, "train_runtime": 12802.5671, "train_tokens_per_second": 12169.708 }, { "epoch": 0.32924858604901697, "grad_norm": 0.840055873131497, "learning_rate": 9.346339980796162e-06, "loss": 0.43817987442016604, "num_input_tokens_seen": 155966968, "step": 4890, "train_runtime": 12815.6307, "train_tokens_per_second": 12170.058 }, { "epoch": 0.3295852410449771, "grad_norm": 0.8014174183838414, "learning_rate": 9.345032294581813e-06, "loss": 0.41841840744018555, "num_input_tokens_seen": 156126984, "step": 4895, "train_runtime": 12828.4869, "train_tokens_per_second": 12170.335 }, { "epoch": 0.32992189604093725, "grad_norm": 0.804468546314331, "learning_rate": 9.343723393293038e-06, "loss": 0.3968712568283081, "num_input_tokens_seen": 156287560, "step": 4900, "train_runtime": 12842.0225, "train_tokens_per_second": 12170.011 }, { "epoch": 0.3302585510368974, "grad_norm": 0.9095252272234827, "learning_rate": 9.342413277295869e-06, "loss": 0.40456581115722656, "num_input_tokens_seen": 156447272, "step": 4905, "train_runtime": 12854.5586, "train_tokens_per_second": 12170.567 }, { "epoch": 0.3305952060328575, "grad_norm": 0.7203551553891038, "learning_rate": 9.341101946956672e-06, "loss": 0.3821167230606079, "num_input_tokens_seen": 156607864, "step": 4910, "train_runtime": 12868.8587, "train_tokens_per_second": 12169.522 }, { "epoch": 0.33093186102881766, "grad_norm": 0.80282151693793, "learning_rate": 9.33978940264216e-06, "loss": 0.42123165130615237, "num_input_tokens_seen": 156765504, "step": 4915, "train_runtime": 12883.3998, "train_tokens_per_second": 12168.023 }, { "epoch": 0.3312685160247778, "grad_norm": 0.9697382535598529, "learning_rate": 9.338475644719377e-06, "loss": 0.4235970497131348, "num_input_tokens_seen": 156927656, "step": 4920, "train_runtime": 12895.9771, "train_tokens_per_second": 12168.729 }, { "epoch": 0.33160517102073794, "grad_norm": 0.8772457722559294, "learning_rate": 9.337160673555719e-06, "loss": 0.3926654815673828, "num_input_tokens_seen": 157086904, "step": 4925, "train_runtime": 12909.3567, "train_tokens_per_second": 12168.453 }, { "epoch": 0.3319418260166981, "grad_norm": 0.7722093241333533, "learning_rate": 9.335844489518905e-06, "loss": 0.40118021965026857, "num_input_tokens_seen": 157244616, "step": 4930, "train_runtime": 12922.3594, "train_tokens_per_second": 12168.414 }, { "epoch": 0.3322784810126582, "grad_norm": 0.8203445572972957, "learning_rate": 9.334527092977008e-06, "loss": 0.3770778179168701, "num_input_tokens_seen": 157398016, "step": 4935, "train_runtime": 12935.9395, "train_tokens_per_second": 12167.498 }, { "epoch": 0.33261513600861836, "grad_norm": 0.79769655241568, "learning_rate": 9.33320848429843e-06, "loss": 0.3995029449462891, "num_input_tokens_seen": 157561856, "step": 4940, "train_runtime": 12948.3755, "train_tokens_per_second": 12168.465 }, { "epoch": 0.3329517910045785, "grad_norm": 0.815590516356396, "learning_rate": 9.331888663851917e-06, "loss": 0.40761737823486327, "num_input_tokens_seen": 157722800, "step": 4945, "train_runtime": 12961.1902, "train_tokens_per_second": 12168.852 }, { "epoch": 0.33328844600053864, "grad_norm": 0.8978773502517382, "learning_rate": 9.330567632006552e-06, "loss": 0.4201383590698242, "num_input_tokens_seen": 157884016, "step": 4950, "train_runtime": 12973.6641, "train_tokens_per_second": 12169.578 }, { "epoch": 0.3336251009964988, "grad_norm": 0.8681429501018025, "learning_rate": 9.329245389131759e-06, "loss": 0.4080531597137451, "num_input_tokens_seen": 158046352, "step": 4955, "train_runtime": 12986.8358, "train_tokens_per_second": 12169.735 }, { "epoch": 0.3339617559924589, "grad_norm": 0.8239020738381359, "learning_rate": 9.327921935597298e-06, "loss": 0.3816958427429199, "num_input_tokens_seen": 158203704, "step": 4960, "train_runtime": 12999.6804, "train_tokens_per_second": 12169.815 }, { "epoch": 0.33429841098841906, "grad_norm": 0.9343386065339763, "learning_rate": 9.326597271773267e-06, "loss": 0.3920842885971069, "num_input_tokens_seen": 158359960, "step": 4965, "train_runtime": 13013.0866, "train_tokens_per_second": 12169.285 }, { "epoch": 0.3346350659843792, "grad_norm": 0.8200770490423416, "learning_rate": 9.325271398030107e-06, "loss": 0.4145952701568604, "num_input_tokens_seen": 158519944, "step": 4970, "train_runtime": 13026.2511, "train_tokens_per_second": 12169.268 }, { "epoch": 0.33497172098033934, "grad_norm": 0.9053857793792193, "learning_rate": 9.323944314738591e-06, "loss": 0.40570497512817383, "num_input_tokens_seen": 158681360, "step": 4975, "train_runtime": 13040.1541, "train_tokens_per_second": 12168.672 }, { "epoch": 0.3353083759762995, "grad_norm": 0.7996888086126086, "learning_rate": 9.322616022269838e-06, "loss": 0.3849011421203613, "num_input_tokens_seen": 158837128, "step": 4980, "train_runtime": 13053.0305, "train_tokens_per_second": 12168.602 }, { "epoch": 0.3356450309722596, "grad_norm": 0.8483129981929501, "learning_rate": 9.321286520995297e-06, "loss": 0.40636348724365234, "num_input_tokens_seen": 158994224, "step": 4985, "train_runtime": 13066.5499, "train_tokens_per_second": 12168.034 }, { "epoch": 0.33598168596821976, "grad_norm": 0.9507363918325171, "learning_rate": 9.319955811286758e-06, "loss": 0.3894704818725586, "num_input_tokens_seen": 159155960, "step": 4990, "train_runtime": 13079.096, "train_tokens_per_second": 12168.728 }, { "epoch": 0.3363183409641799, "grad_norm": 0.760280975510304, "learning_rate": 9.318623893516354e-06, "loss": 0.3991784334182739, "num_input_tokens_seen": 159313664, "step": 4995, "train_runtime": 13092.5355, "train_tokens_per_second": 12168.282 }, { "epoch": 0.33665499596014004, "grad_norm": 0.8652066070950722, "learning_rate": 9.317290768056548e-06, "loss": 0.4180765628814697, "num_input_tokens_seen": 159469480, "step": 5000, "train_runtime": 13106.0662, "train_tokens_per_second": 12167.608 }, { "epoch": 0.3369916509561002, "grad_norm": 0.7994492721646552, "learning_rate": 9.315956435280147e-06, "loss": 0.39785919189453123, "num_input_tokens_seen": 159624728, "step": 5005, "train_runtime": 13118.6223, "train_tokens_per_second": 12167.797 }, { "epoch": 0.3373283059520603, "grad_norm": 0.8243698850386498, "learning_rate": 9.314620895560292e-06, "loss": 0.39923934936523436, "num_input_tokens_seen": 159781920, "step": 5010, "train_runtime": 13131.6053, "train_tokens_per_second": 12167.737 }, { "epoch": 0.33766496094802045, "grad_norm": 0.9829489011292506, "learning_rate": 9.313284149270459e-06, "loss": 0.43280954360961915, "num_input_tokens_seen": 159941592, "step": 5015, "train_runtime": 13144.9858, "train_tokens_per_second": 12167.498 }, { "epoch": 0.3380016159439806, "grad_norm": 0.8358057172912196, "learning_rate": 9.311946196784469e-06, "loss": 0.3909532308578491, "num_input_tokens_seen": 160100576, "step": 5020, "train_runtime": 13158.0765, "train_tokens_per_second": 12167.476 }, { "epoch": 0.33833827093994073, "grad_norm": 0.7922816876792169, "learning_rate": 9.310607038476476e-06, "loss": 0.4048126220703125, "num_input_tokens_seen": 160257800, "step": 5025, "train_runtime": 13170.9561, "train_tokens_per_second": 12167.515 }, { "epoch": 0.3386749259359009, "grad_norm": 0.8270426201720833, "learning_rate": 9.30926667472097e-06, "loss": 0.3984680652618408, "num_input_tokens_seen": 160419888, "step": 5030, "train_runtime": 13183.4271, "train_tokens_per_second": 12168.299 }, { "epoch": 0.339011580931861, "grad_norm": 0.8461148763888398, "learning_rate": 9.307925105892779e-06, "loss": 0.4075295448303223, "num_input_tokens_seen": 160582976, "step": 5035, "train_runtime": 13196.2883, "train_tokens_per_second": 12168.799 }, { "epoch": 0.33934823592782115, "grad_norm": 0.8641955395243164, "learning_rate": 9.30658233236707e-06, "loss": 0.40024585723876954, "num_input_tokens_seen": 160746816, "step": 5040, "train_runtime": 13208.7224, "train_tokens_per_second": 12169.747 }, { "epoch": 0.3396848909237813, "grad_norm": 0.7877497901050131, "learning_rate": 9.30523835451934e-06, "loss": 0.3929188966751099, "num_input_tokens_seen": 160906304, "step": 5045, "train_runtime": 13221.2214, "train_tokens_per_second": 12170.306 }, { "epoch": 0.34002154591974143, "grad_norm": 0.8559007486668534, "learning_rate": 9.303893172725437e-06, "loss": 0.43031940460205076, "num_input_tokens_seen": 161066264, "step": 5050, "train_runtime": 13233.6825, "train_tokens_per_second": 12170.933 }, { "epoch": 0.34035820091570157, "grad_norm": 0.8386124456749575, "learning_rate": 9.302546787361533e-06, "loss": 0.4001013278961182, "num_input_tokens_seen": 161226864, "step": 5055, "train_runtime": 13246.5457, "train_tokens_per_second": 12171.238 }, { "epoch": 0.3406948559116617, "grad_norm": 0.9832603552616476, "learning_rate": 9.301199198804139e-06, "loss": 0.38755548000335693, "num_input_tokens_seen": 161384936, "step": 5060, "train_runtime": 13259.7888, "train_tokens_per_second": 12171.003 }, { "epoch": 0.34103151090762185, "grad_norm": 0.8415817747022057, "learning_rate": 9.299850407430102e-06, "loss": 0.43251619338989256, "num_input_tokens_seen": 161548576, "step": 5065, "train_runtime": 13272.9376, "train_tokens_per_second": 12171.275 }, { "epoch": 0.341368165903582, "grad_norm": 0.7918084834966653, "learning_rate": 9.298500413616613e-06, "loss": 0.3998404502868652, "num_input_tokens_seen": 161706704, "step": 5070, "train_runtime": 13285.5914, "train_tokens_per_second": 12171.585 }, { "epoch": 0.3417048208995421, "grad_norm": 0.8379729927001233, "learning_rate": 9.297149217741188e-06, "loss": 0.38343086242675783, "num_input_tokens_seen": 161861952, "step": 5075, "train_runtime": 13298.3515, "train_tokens_per_second": 12171.58 }, { "epoch": 0.34204147589550227, "grad_norm": 0.8195439727473155, "learning_rate": 9.295796820181688e-06, "loss": 0.42993960380554197, "num_input_tokens_seen": 162022432, "step": 5080, "train_runtime": 13311.4181, "train_tokens_per_second": 12171.688 }, { "epoch": 0.3423781308914624, "grad_norm": 0.8061875320272616, "learning_rate": 9.294443221316305e-06, "loss": 0.3996783018112183, "num_input_tokens_seen": 162182064, "step": 5085, "train_runtime": 13324.518, "train_tokens_per_second": 12171.702 }, { "epoch": 0.34271478588742255, "grad_norm": 0.731048556024357, "learning_rate": 9.293088421523569e-06, "loss": 0.4098616600036621, "num_input_tokens_seen": 162339840, "step": 5090, "train_runtime": 13338.381, "train_tokens_per_second": 12170.88 }, { "epoch": 0.3430514408833827, "grad_norm": 0.8657234214130419, "learning_rate": 9.291732421182346e-06, "loss": 0.40361852645874025, "num_input_tokens_seen": 162500768, "step": 5095, "train_runtime": 13351.6498, "train_tokens_per_second": 12170.838 }, { "epoch": 0.3433880958793428, "grad_norm": 0.8613102507340347, "learning_rate": 9.290375220671837e-06, "loss": 0.3931206464767456, "num_input_tokens_seen": 162659344, "step": 5100, "train_runtime": 13365.1727, "train_tokens_per_second": 12170.388 }, { "epoch": 0.34372475087530296, "grad_norm": 0.8702383602516465, "learning_rate": 9.28901682037158e-06, "loss": 0.3695573091506958, "num_input_tokens_seen": 162813336, "step": 5105, "train_runtime": 13378.1977, "train_tokens_per_second": 12170.05 }, { "epoch": 0.3440614058712631, "grad_norm": 0.7968940810354391, "learning_rate": 9.287657220661442e-06, "loss": 0.41938180923461915, "num_input_tokens_seen": 162975448, "step": 5110, "train_runtime": 13391.4901, "train_tokens_per_second": 12170.076 }, { "epoch": 0.34439806086722324, "grad_norm": 0.973285452878614, "learning_rate": 9.286296421921636e-06, "loss": 0.38599095344543455, "num_input_tokens_seen": 163130048, "step": 5115, "train_runtime": 13404.0948, "train_tokens_per_second": 12170.165 }, { "epoch": 0.3447347158631834, "grad_norm": 0.8632588369833437, "learning_rate": 9.284934424532706e-06, "loss": 0.45295009613037107, "num_input_tokens_seen": 163287184, "step": 5120, "train_runtime": 13416.5447, "train_tokens_per_second": 12170.584 }, { "epoch": 0.3450713708591435, "grad_norm": 0.7564900214036272, "learning_rate": 9.283571228875525e-06, "loss": 0.3599048137664795, "num_input_tokens_seen": 163440256, "step": 5125, "train_runtime": 13430.2464, "train_tokens_per_second": 12169.565 }, { "epoch": 0.3454080258551037, "grad_norm": 0.8924664211318143, "learning_rate": 9.282206835331311e-06, "loss": 0.4371681213378906, "num_input_tokens_seen": 163601080, "step": 5130, "train_runtime": 13443.1298, "train_tokens_per_second": 12169.865 }, { "epoch": 0.34574468085106386, "grad_norm": 0.7825280868736085, "learning_rate": 9.28084124428161e-06, "loss": 0.3430314540863037, "num_input_tokens_seen": 163760984, "step": 5135, "train_runtime": 13456.045, "train_tokens_per_second": 12170.068 }, { "epoch": 0.346081335847024, "grad_norm": 1.5002090633337872, "learning_rate": 9.279474456108305e-06, "loss": 0.3737651824951172, "num_input_tokens_seen": 163924824, "step": 5140, "train_runtime": 13468.4932, "train_tokens_per_second": 12170.985 }, { "epoch": 0.34641799084298414, "grad_norm": 0.8436504377406616, "learning_rate": 9.278106471193615e-06, "loss": 0.36956377029418946, "num_input_tokens_seen": 164085368, "step": 5145, "train_runtime": 13482.2317, "train_tokens_per_second": 12170.49 }, { "epoch": 0.3467546458389443, "grad_norm": 0.9267689020286888, "learning_rate": 9.276737289920093e-06, "loss": 0.4128605842590332, "num_input_tokens_seen": 164244920, "step": 5150, "train_runtime": 13494.9426, "train_tokens_per_second": 12170.85 }, { "epoch": 0.3470913008349044, "grad_norm": 0.8201254055115633, "learning_rate": 9.275366912670624e-06, "loss": 0.40582122802734377, "num_input_tokens_seen": 164398576, "step": 5155, "train_runtime": 13507.5812, "train_tokens_per_second": 12170.838 }, { "epoch": 0.34742795583086455, "grad_norm": 0.881610349853351, "learning_rate": 9.273995339828432e-06, "loss": 0.3749147176742554, "num_input_tokens_seen": 164556400, "step": 5160, "train_runtime": 13521.267, "train_tokens_per_second": 12170.191 }, { "epoch": 0.3477646108268247, "grad_norm": 0.8786679347737169, "learning_rate": 9.272622571777072e-06, "loss": 0.4523941993713379, "num_input_tokens_seen": 164715704, "step": 5165, "train_runtime": 13534.2339, "train_tokens_per_second": 12170.301 }, { "epoch": 0.34810126582278483, "grad_norm": 0.7689584997649798, "learning_rate": 9.271248608900434e-06, "loss": 0.33801937103271484, "num_input_tokens_seen": 164878472, "step": 5170, "train_runtime": 13547.822, "train_tokens_per_second": 12170.109 }, { "epoch": 0.348437920818745, "grad_norm": 0.9206282375177812, "learning_rate": 9.269873451582741e-06, "loss": 0.4213468074798584, "num_input_tokens_seen": 165037824, "step": 5175, "train_runtime": 13562.3222, "train_tokens_per_second": 12168.847 }, { "epoch": 0.3487745758147051, "grad_norm": 0.8836613417353555, "learning_rate": 9.268497100208556e-06, "loss": 0.4191449642181396, "num_input_tokens_seen": 165195096, "step": 5180, "train_runtime": 13575.0516, "train_tokens_per_second": 12169.022 }, { "epoch": 0.34911123081066525, "grad_norm": 0.8914245007990452, "learning_rate": 9.267119555162765e-06, "loss": 0.38235011100769045, "num_input_tokens_seen": 165358280, "step": 5185, "train_runtime": 13587.9476, "train_tokens_per_second": 12169.482 }, { "epoch": 0.3494478858066254, "grad_norm": 0.8533894512176639, "learning_rate": 9.2657408168306e-06, "loss": 0.38951256275177004, "num_input_tokens_seen": 165517600, "step": 5190, "train_runtime": 13600.976, "train_tokens_per_second": 12169.538 }, { "epoch": 0.34978454080258553, "grad_norm": 0.9022772579251818, "learning_rate": 9.264360885597617e-06, "loss": 0.4006654262542725, "num_input_tokens_seen": 165677344, "step": 5195, "train_runtime": 13613.4185, "train_tokens_per_second": 12170.15 }, { "epoch": 0.35012119579854567, "grad_norm": 0.874376830598592, "learning_rate": 9.262979761849709e-06, "loss": 0.4045432090759277, "num_input_tokens_seen": 165840408, "step": 5200, "train_runtime": 13626.3327, "train_tokens_per_second": 12170.583 }, { "epoch": 0.3504578507945058, "grad_norm": 0.9160254727219028, "learning_rate": 9.261597445973106e-06, "loss": 0.4306468963623047, "num_input_tokens_seen": 166001240, "step": 5205, "train_runtime": 13638.8719, "train_tokens_per_second": 12171.185 }, { "epoch": 0.35079450579046595, "grad_norm": 0.8837276917778313, "learning_rate": 9.260213938354365e-06, "loss": 0.3968240976333618, "num_input_tokens_seen": 166158608, "step": 5210, "train_runtime": 13651.827, "train_tokens_per_second": 12171.163 }, { "epoch": 0.3511311607864261, "grad_norm": 0.7712525171864484, "learning_rate": 9.25882923938038e-06, "loss": 0.4188511371612549, "num_input_tokens_seen": 166315536, "step": 5215, "train_runtime": 13665.3447, "train_tokens_per_second": 12170.607 }, { "epoch": 0.35146781578238623, "grad_norm": 0.9159058917952215, "learning_rate": 9.257443349438382e-06, "loss": 0.42844762802124026, "num_input_tokens_seen": 166475480, "step": 5220, "train_runtime": 13677.906, "train_tokens_per_second": 12171.123 }, { "epoch": 0.35180447077834637, "grad_norm": 0.9075235164525466, "learning_rate": 9.256056268915924e-06, "loss": 0.411525297164917, "num_input_tokens_seen": 166639064, "step": 5225, "train_runtime": 13690.9142, "train_tokens_per_second": 12171.507 }, { "epoch": 0.3521411257743065, "grad_norm": 0.7413431616163271, "learning_rate": 9.254667998200906e-06, "loss": 0.4199207305908203, "num_input_tokens_seen": 166799520, "step": 5230, "train_runtime": 13703.6821, "train_tokens_per_second": 12171.876 }, { "epoch": 0.35247778077026665, "grad_norm": 0.8502337993119097, "learning_rate": 9.253278537681548e-06, "loss": 0.42876243591308594, "num_input_tokens_seen": 166960712, "step": 5235, "train_runtime": 13716.1955, "train_tokens_per_second": 12172.524 }, { "epoch": 0.3528144357662268, "grad_norm": 0.8667935075836979, "learning_rate": 9.251887887746407e-06, "loss": 0.410980749130249, "num_input_tokens_seen": 167123768, "step": 5240, "train_runtime": 13729.7701, "train_tokens_per_second": 12172.365 }, { "epoch": 0.3531510907621869, "grad_norm": 1.0943017680301057, "learning_rate": 9.25049604878438e-06, "loss": 0.3909928798675537, "num_input_tokens_seen": 167285568, "step": 5245, "train_runtime": 13742.8361, "train_tokens_per_second": 12172.565 }, { "epoch": 0.35348774575814707, "grad_norm": 0.855698377539809, "learning_rate": 9.249103021184684e-06, "loss": 0.41027007102966306, "num_input_tokens_seen": 167448152, "step": 5250, "train_runtime": 13756.9221, "train_tokens_per_second": 12171.92 }, { "epoch": 0.3538244007541072, "grad_norm": 0.8949901826951719, "learning_rate": 9.24770880533688e-06, "loss": 0.4402909278869629, "num_input_tokens_seen": 167611920, "step": 5255, "train_runtime": 13770.0535, "train_tokens_per_second": 12172.205 }, { "epoch": 0.35416105575006734, "grad_norm": 0.9934360109662183, "learning_rate": 9.24631340163085e-06, "loss": 0.43441362380981446, "num_input_tokens_seen": 167759112, "step": 5260, "train_runtime": 13783.3241, "train_tokens_per_second": 12171.165 }, { "epoch": 0.3544977107460275, "grad_norm": 0.8656170451196837, "learning_rate": 9.244916810456822e-06, "loss": 0.3673239231109619, "num_input_tokens_seen": 167921080, "step": 5265, "train_runtime": 13795.7758, "train_tokens_per_second": 12171.92 }, { "epoch": 0.3548343657419876, "grad_norm": 0.7529848291338072, "learning_rate": 9.24351903220534e-06, "loss": 0.40373005867004397, "num_input_tokens_seen": 168082592, "step": 5270, "train_runtime": 13808.747, "train_tokens_per_second": 12172.183 }, { "epoch": 0.35517102073794776, "grad_norm": 0.9375049476682222, "learning_rate": 9.242120067267295e-06, "loss": 0.38245971202850343, "num_input_tokens_seen": 168240328, "step": 5275, "train_runtime": 13821.8773, "train_tokens_per_second": 12172.032 }, { "epoch": 0.3555076757339079, "grad_norm": 0.8709047347805172, "learning_rate": 9.2407199160339e-06, "loss": 0.40095043182373047, "num_input_tokens_seen": 168398304, "step": 5280, "train_runtime": 13835.0664, "train_tokens_per_second": 12171.846 }, { "epoch": 0.35584433072986804, "grad_norm": 0.8986209107879686, "learning_rate": 9.239318578896701e-06, "loss": 0.39379229545593264, "num_input_tokens_seen": 168556416, "step": 5285, "train_runtime": 13848.5603, "train_tokens_per_second": 12171.404 }, { "epoch": 0.3561809857258282, "grad_norm": 0.8952588111347618, "learning_rate": 9.237916056247583e-06, "loss": 0.40959725379943845, "num_input_tokens_seen": 168714328, "step": 5290, "train_runtime": 13861.6497, "train_tokens_per_second": 12171.302 }, { "epoch": 0.3565176407217883, "grad_norm": 1.1077750281959418, "learning_rate": 9.23651234847875e-06, "loss": 0.4346426010131836, "num_input_tokens_seen": 168874192, "step": 5295, "train_runtime": 13875.131, "train_tokens_per_second": 12170.998 }, { "epoch": 0.35685429571774846, "grad_norm": 0.8059544405243951, "learning_rate": 9.23510745598275e-06, "loss": 0.40315923690795896, "num_input_tokens_seen": 169026760, "step": 5300, "train_runtime": 13888.4047, "train_tokens_per_second": 12170.351 }, { "epoch": 0.3571909507137086, "grad_norm": 0.6723592906916273, "learning_rate": 9.233701379152456e-06, "loss": 0.38354921340942383, "num_input_tokens_seen": 169186368, "step": 5305, "train_runtime": 13901.4029, "train_tokens_per_second": 12170.453 }, { "epoch": 0.35752760570966874, "grad_norm": 0.8182667707693383, "learning_rate": 9.232294118381069e-06, "loss": 0.41822118759155275, "num_input_tokens_seen": 169346664, "step": 5310, "train_runtime": 13914.3013, "train_tokens_per_second": 12170.691 }, { "epoch": 0.3578642607056289, "grad_norm": 0.808438568114564, "learning_rate": 9.230885674062129e-06, "loss": 0.38440418243408203, "num_input_tokens_seen": 169505032, "step": 5315, "train_runtime": 13926.8374, "train_tokens_per_second": 12171.107 }, { "epoch": 0.358200915701589, "grad_norm": 0.9084068636232191, "learning_rate": 9.2294760465895e-06, "loss": 0.4449141502380371, "num_input_tokens_seen": 169665216, "step": 5320, "train_runtime": 13939.6295, "train_tokens_per_second": 12171.429 }, { "epoch": 0.35853757069754916, "grad_norm": 1.26081903620349, "learning_rate": 9.228065236357383e-06, "loss": 0.4199626922607422, "num_input_tokens_seen": 169824280, "step": 5325, "train_runtime": 13952.1976, "train_tokens_per_second": 12171.866 }, { "epoch": 0.3588742256935093, "grad_norm": 0.7600938530344189, "learning_rate": 9.226653243760304e-06, "loss": 0.3862861156463623, "num_input_tokens_seen": 169983664, "step": 5330, "train_runtime": 13965.3009, "train_tokens_per_second": 12171.858 }, { "epoch": 0.35921088068946944, "grad_norm": 0.8019187098213592, "learning_rate": 9.225240069193124e-06, "loss": 0.4181028366088867, "num_input_tokens_seen": 170147312, "step": 5335, "train_runtime": 13978.3125, "train_tokens_per_second": 12172.235 }, { "epoch": 0.3595475356854296, "grad_norm": 0.9319117172807395, "learning_rate": 9.223825713051034e-06, "loss": 0.40991716384887694, "num_input_tokens_seen": 170304840, "step": 5340, "train_runtime": 13991.2879, "train_tokens_per_second": 12172.206 }, { "epoch": 0.3598841906813897, "grad_norm": 0.8476252757020172, "learning_rate": 9.222410175729549e-06, "loss": 0.3886315107345581, "num_input_tokens_seen": 170467448, "step": 5345, "train_runtime": 14003.9776, "train_tokens_per_second": 12172.788 }, { "epoch": 0.36022084567734985, "grad_norm": 0.7147961669642899, "learning_rate": 9.220993457624523e-06, "loss": 0.3842186689376831, "num_input_tokens_seen": 170627320, "step": 5350, "train_runtime": 14016.4194, "train_tokens_per_second": 12173.389 }, { "epoch": 0.36055750067331, "grad_norm": 0.8959018010745233, "learning_rate": 9.219575559132136e-06, "loss": 0.42137994766235354, "num_input_tokens_seen": 170786160, "step": 5355, "train_runtime": 14029.6972, "train_tokens_per_second": 12173.189 }, { "epoch": 0.36089415566927013, "grad_norm": 0.8706592271679208, "learning_rate": 9.2181564806489e-06, "loss": 0.37853660583496096, "num_input_tokens_seen": 170947008, "step": 5360, "train_runtime": 14043.8386, "train_tokens_per_second": 12172.385 }, { "epoch": 0.3612308106652303, "grad_norm": 0.7741015293316653, "learning_rate": 9.216736222571655e-06, "loss": 0.37652509212493895, "num_input_tokens_seen": 171107304, "step": 5365, "train_runtime": 14056.5568, "train_tokens_per_second": 12172.775 }, { "epoch": 0.3615674656611904, "grad_norm": 0.8747891666388579, "learning_rate": 9.215314785297572e-06, "loss": 0.43374929428100584, "num_input_tokens_seen": 171259032, "step": 5370, "train_runtime": 14070.4661, "train_tokens_per_second": 12171.525 }, { "epoch": 0.36190412065715055, "grad_norm": 0.8248728924065581, "learning_rate": 9.21389216922415e-06, "loss": 0.3997281789779663, "num_input_tokens_seen": 171421592, "step": 5375, "train_runtime": 14084.1203, "train_tokens_per_second": 12171.267 }, { "epoch": 0.3622407756531107, "grad_norm": 1.127273081754096, "learning_rate": 9.212468374749222e-06, "loss": 0.4404153823852539, "num_input_tokens_seen": 171581768, "step": 5380, "train_runtime": 14097.602, "train_tokens_per_second": 12170.99 }, { "epoch": 0.36257743064907083, "grad_norm": 0.8409125355103068, "learning_rate": 9.211043402270942e-06, "loss": 0.396565580368042, "num_input_tokens_seen": 171739688, "step": 5385, "train_runtime": 14110.4921, "train_tokens_per_second": 12171.063 }, { "epoch": 0.36291408564503097, "grad_norm": 0.782349328647705, "learning_rate": 9.209617252187806e-06, "loss": 0.37641682624816897, "num_input_tokens_seen": 171899328, "step": 5390, "train_runtime": 14124.3435, "train_tokens_per_second": 12170.43 }, { "epoch": 0.3632507406409911, "grad_norm": 1.5789828430298494, "learning_rate": 9.208189924898627e-06, "loss": 0.3491178035736084, "num_input_tokens_seen": 172055864, "step": 5395, "train_runtime": 14137.5415, "train_tokens_per_second": 12170.14 }, { "epoch": 0.36358739563695125, "grad_norm": 0.8591137013189266, "learning_rate": 9.206761420802554e-06, "loss": 0.4361734390258789, "num_input_tokens_seen": 172216224, "step": 5400, "train_runtime": 14150.8361, "train_tokens_per_second": 12170.039 }, { "epoch": 0.3639240506329114, "grad_norm": 0.793100446784095, "learning_rate": 9.205331740299065e-06, "loss": 0.39650869369506836, "num_input_tokens_seen": 172373320, "step": 5405, "train_runtime": 14163.9108, "train_tokens_per_second": 12169.896 }, { "epoch": 0.36426070562887153, "grad_norm": 0.7357072663371851, "learning_rate": 9.203900883787967e-06, "loss": 0.4177663326263428, "num_input_tokens_seen": 172532312, "step": 5410, "train_runtime": 14176.6289, "train_tokens_per_second": 12170.193 }, { "epoch": 0.36459736062483167, "grad_norm": 0.9359744188774798, "learning_rate": 9.202468851669388e-06, "loss": 0.42070827484130857, "num_input_tokens_seen": 172694568, "step": 5415, "train_runtime": 14189.9651, "train_tokens_per_second": 12170.19 }, { "epoch": 0.3649340156207918, "grad_norm": 0.9566702448992348, "learning_rate": 9.201035644343797e-06, "loss": 0.4181356906890869, "num_input_tokens_seen": 172852960, "step": 5420, "train_runtime": 14203.5279, "train_tokens_per_second": 12169.72 }, { "epoch": 0.36527067061675195, "grad_norm": 0.857426528144976, "learning_rate": 9.199601262211985e-06, "loss": 0.41099071502685547, "num_input_tokens_seen": 173009896, "step": 5425, "train_runtime": 14217.8906, "train_tokens_per_second": 12168.464 }, { "epoch": 0.3656073256127121, "grad_norm": 0.8090681659423706, "learning_rate": 9.19816570567507e-06, "loss": 0.40360093116760254, "num_input_tokens_seen": 173172528, "step": 5430, "train_runtime": 14231.2608, "train_tokens_per_second": 12168.46 }, { "epoch": 0.3659439806086722, "grad_norm": 0.9198145252434449, "learning_rate": 9.196728975134503e-06, "loss": 0.40351595878601076, "num_input_tokens_seen": 173330768, "step": 5435, "train_runtime": 14244.5371, "train_tokens_per_second": 12168.227 }, { "epoch": 0.36628063560463237, "grad_norm": 0.8871786057809372, "learning_rate": 9.195291070992061e-06, "loss": 0.40013465881347654, "num_input_tokens_seen": 173489168, "step": 5440, "train_runtime": 14257.3716, "train_tokens_per_second": 12168.384 }, { "epoch": 0.3666172906005925, "grad_norm": 0.7591105123533345, "learning_rate": 9.193851993649849e-06, "loss": 0.3656224489212036, "num_input_tokens_seen": 173651608, "step": 5445, "train_runtime": 14270.0293, "train_tokens_per_second": 12168.973 }, { "epoch": 0.36695394559655264, "grad_norm": 0.7917581616134372, "learning_rate": 9.1924117435103e-06, "loss": 0.3992220640182495, "num_input_tokens_seen": 173813640, "step": 5450, "train_runtime": 14284.594, "train_tokens_per_second": 12167.909 }, { "epoch": 0.3672906005925128, "grad_norm": 0.9644535132477472, "learning_rate": 9.190970320976176e-06, "loss": 0.38292953968048093, "num_input_tokens_seen": 173975976, "step": 5455, "train_runtime": 14297.4913, "train_tokens_per_second": 12168.287 }, { "epoch": 0.3676272555884729, "grad_norm": 0.9272476811861222, "learning_rate": 9.189527726450565e-06, "loss": 0.4454700469970703, "num_input_tokens_seen": 174126728, "step": 5460, "train_runtime": 14311.2685, "train_tokens_per_second": 12167.107 }, { "epoch": 0.36796391058443306, "grad_norm": 0.7631388334899264, "learning_rate": 9.188083960336885e-06, "loss": 0.3804170608520508, "num_input_tokens_seen": 174286720, "step": 5465, "train_runtime": 14324.3185, "train_tokens_per_second": 12167.191 }, { "epoch": 0.3683005655803932, "grad_norm": 0.8911542710537709, "learning_rate": 9.186639023038879e-06, "loss": 0.4201070785522461, "num_input_tokens_seen": 174444640, "step": 5470, "train_runtime": 14336.8437, "train_tokens_per_second": 12167.576 }, { "epoch": 0.36863722057635334, "grad_norm": 0.8904517292247853, "learning_rate": 9.185192914960622e-06, "loss": 0.4242672920227051, "num_input_tokens_seen": 174603088, "step": 5475, "train_runtime": 14350.2797, "train_tokens_per_second": 12167.225 }, { "epoch": 0.3689738755723135, "grad_norm": 0.8099982686077623, "learning_rate": 9.183745636506511e-06, "loss": 0.3790933609008789, "num_input_tokens_seen": 174756968, "step": 5480, "train_runtime": 14363.2812, "train_tokens_per_second": 12166.925 }, { "epoch": 0.3693105305682736, "grad_norm": 0.7866468441310667, "learning_rate": 9.182297188081274e-06, "loss": 0.42302284240722654, "num_input_tokens_seen": 174916744, "step": 5485, "train_runtime": 14376.4425, "train_tokens_per_second": 12166.9 }, { "epoch": 0.36964718556423376, "grad_norm": 0.7676797852311467, "learning_rate": 9.180847570089964e-06, "loss": 0.38768396377563474, "num_input_tokens_seen": 175070976, "step": 5490, "train_runtime": 14389.8927, "train_tokens_per_second": 12166.246 }, { "epoch": 0.3699838405601939, "grad_norm": 0.9132375685904397, "learning_rate": 9.179396782937965e-06, "loss": 0.45098104476928713, "num_input_tokens_seen": 175234816, "step": 5495, "train_runtime": 14402.3244, "train_tokens_per_second": 12167.12 }, { "epoch": 0.37032049555615404, "grad_norm": 0.9392819970580462, "learning_rate": 9.17794482703098e-06, "loss": 0.448504638671875, "num_input_tokens_seen": 175394096, "step": 5500, "train_runtime": 14415.4204, "train_tokens_per_second": 12167.116 }, { "epoch": 0.3706571505521142, "grad_norm": 0.8215392485819866, "learning_rate": 9.176491702775049e-06, "loss": 0.42099428176879883, "num_input_tokens_seen": 175551864, "step": 5505, "train_runtime": 14429.7417, "train_tokens_per_second": 12165.974 }, { "epoch": 0.3709938055480743, "grad_norm": 0.8187564645822528, "learning_rate": 9.17503741057653e-06, "loss": 0.43409528732299807, "num_input_tokens_seen": 175713368, "step": 5510, "train_runtime": 14442.7162, "train_tokens_per_second": 12166.227 }, { "epoch": 0.37133046054403446, "grad_norm": 0.7715462826711784, "learning_rate": 9.173581950842111e-06, "loss": 0.38469316959381106, "num_input_tokens_seen": 175869752, "step": 5515, "train_runtime": 14455.6556, "train_tokens_per_second": 12166.155 }, { "epoch": 0.3716671155399946, "grad_norm": 0.962006007111934, "learning_rate": 9.172125323978811e-06, "loss": 0.42240176200866697, "num_input_tokens_seen": 176029104, "step": 5520, "train_runtime": 14468.8354, "train_tokens_per_second": 12166.087 }, { "epoch": 0.37200377053595474, "grad_norm": 0.837968435330365, "learning_rate": 9.170667530393966e-06, "loss": 0.39805238246917723, "num_input_tokens_seen": 176190264, "step": 5525, "train_runtime": 14481.3117, "train_tokens_per_second": 12166.734 }, { "epoch": 0.3723404255319149, "grad_norm": 0.8076745384422905, "learning_rate": 9.169208570495247e-06, "loss": 0.3894563436508179, "num_input_tokens_seen": 176351328, "step": 5530, "train_runtime": 14494.4014, "train_tokens_per_second": 12166.858 }, { "epoch": 0.372677080527875, "grad_norm": 0.7535944618782825, "learning_rate": 9.167748444690646e-06, "loss": 0.3739210844039917, "num_input_tokens_seen": 176506488, "step": 5535, "train_runtime": 14507.4727, "train_tokens_per_second": 12166.591 }, { "epoch": 0.37301373552383515, "grad_norm": 0.8136183852272242, "learning_rate": 9.16628715338848e-06, "loss": 0.39924371242523193, "num_input_tokens_seen": 176665416, "step": 5540, "train_runtime": 14521.2476, "train_tokens_per_second": 12165.994 }, { "epoch": 0.3733503905197953, "grad_norm": 0.7769219837739544, "learning_rate": 9.164824696997398e-06, "loss": 0.37765989303588865, "num_input_tokens_seen": 176819992, "step": 5545, "train_runtime": 14533.8681, "train_tokens_per_second": 12166.066 }, { "epoch": 0.37368704551575543, "grad_norm": 0.7746481378249906, "learning_rate": 9.163361075926371e-06, "loss": 0.42786331176757814, "num_input_tokens_seen": 176981816, "step": 5550, "train_runtime": 14546.9976, "train_tokens_per_second": 12166.209 }, { "epoch": 0.3740237005117156, "grad_norm": 0.7710835899607028, "learning_rate": 9.161896290584695e-06, "loss": 0.3802783727645874, "num_input_tokens_seen": 177143816, "step": 5555, "train_runtime": 14560.2464, "train_tokens_per_second": 12166.265 }, { "epoch": 0.3743603555076757, "grad_norm": 0.8120536606566661, "learning_rate": 9.160430341381991e-06, "loss": 0.40530972480773925, "num_input_tokens_seen": 177299952, "step": 5560, "train_runtime": 14573.1894, "train_tokens_per_second": 12166.174 }, { "epoch": 0.37469701050363585, "grad_norm": 0.8005440309863602, "learning_rate": 9.15896322872821e-06, "loss": 0.40654287338256834, "num_input_tokens_seen": 177457184, "step": 5565, "train_runtime": 14586.1781, "train_tokens_per_second": 12166.119 }, { "epoch": 0.375033665499596, "grad_norm": 0.8336876755861642, "learning_rate": 9.157494953033625e-06, "loss": 0.4060182571411133, "num_input_tokens_seen": 177616256, "step": 5570, "train_runtime": 14598.7549, "train_tokens_per_second": 12166.535 }, { "epoch": 0.37537032049555613, "grad_norm": 0.7971953206236163, "learning_rate": 9.156025514708832e-06, "loss": 0.40840883255004884, "num_input_tokens_seen": 177780096, "step": 5575, "train_runtime": 14611.1835, "train_tokens_per_second": 12167.399 }, { "epoch": 0.37570697549151627, "grad_norm": 0.9032953055211189, "learning_rate": 9.154554914164757e-06, "loss": 0.40496139526367186, "num_input_tokens_seen": 177943936, "step": 5580, "train_runtime": 14623.6079, "train_tokens_per_second": 12168.265 }, { "epoch": 0.3760436304874764, "grad_norm": 0.9269836124316817, "learning_rate": 9.153083151812649e-06, "loss": 0.3801657438278198, "num_input_tokens_seen": 178106792, "step": 5585, "train_runtime": 14637.0727, "train_tokens_per_second": 12168.198 }, { "epoch": 0.37638028548343655, "grad_norm": 0.7861253764502524, "learning_rate": 9.151610228064078e-06, "loss": 0.4101823329925537, "num_input_tokens_seen": 178266120, "step": 5590, "train_runtime": 14649.5915, "train_tokens_per_second": 12168.675 }, { "epoch": 0.3767169404793967, "grad_norm": 0.9021453681705658, "learning_rate": 9.150136143330949e-06, "loss": 0.4283175468444824, "num_input_tokens_seen": 178425568, "step": 5595, "train_runtime": 14663.3037, "train_tokens_per_second": 12168.17 }, { "epoch": 0.37705359547535683, "grad_norm": 0.7770077485391865, "learning_rate": 9.14866089802548e-06, "loss": 0.38265461921691896, "num_input_tokens_seen": 178587480, "step": 5600, "train_runtime": 14675.7639, "train_tokens_per_second": 12168.871 }, { "epoch": 0.37739025047131697, "grad_norm": 0.9395926061437876, "learning_rate": 9.147184492560219e-06, "loss": 0.37009391784667967, "num_input_tokens_seen": 178746008, "step": 5605, "train_runtime": 14689.0252, "train_tokens_per_second": 12168.677 }, { "epoch": 0.3777269054672771, "grad_norm": 0.8455249908859552, "learning_rate": 9.14570692734804e-06, "loss": 0.3915083408355713, "num_input_tokens_seen": 178905264, "step": 5610, "train_runtime": 14701.6137, "train_tokens_per_second": 12169.09 }, { "epoch": 0.37806356046323725, "grad_norm": 0.9041363350213437, "learning_rate": 9.144228202802137e-06, "loss": 0.4065399169921875, "num_input_tokens_seen": 179066360, "step": 5615, "train_runtime": 14714.6407, "train_tokens_per_second": 12169.265 }, { "epoch": 0.37840021545919744, "grad_norm": 1.2263757573882148, "learning_rate": 9.142748319336033e-06, "loss": 0.3947492837905884, "num_input_tokens_seen": 179228208, "step": 5620, "train_runtime": 14727.1869, "train_tokens_per_second": 12169.887 }, { "epoch": 0.3787368704551576, "grad_norm": 0.7951021213093052, "learning_rate": 9.141267277363573e-06, "loss": 0.3920163631439209, "num_input_tokens_seen": 179380480, "step": 5625, "train_runtime": 14740.6069, "train_tokens_per_second": 12169.138 }, { "epoch": 0.3790735254511177, "grad_norm": 0.8174096183896313, "learning_rate": 9.139785077298921e-06, "loss": 0.3512788534164429, "num_input_tokens_seen": 179541312, "step": 5630, "train_runtime": 14753.6406, "train_tokens_per_second": 12169.289 }, { "epoch": 0.37941018044707786, "grad_norm": 0.8466272717055351, "learning_rate": 9.138301719556577e-06, "loss": 0.4015397071838379, "num_input_tokens_seen": 179701144, "step": 5635, "train_runtime": 14767.1186, "train_tokens_per_second": 12169.005 }, { "epoch": 0.379746835443038, "grad_norm": 0.7415804913081718, "learning_rate": 9.136817204551352e-06, "loss": 0.3865314722061157, "num_input_tokens_seen": 179860816, "step": 5640, "train_runtime": 14779.9261, "train_tokens_per_second": 12169.264 }, { "epoch": 0.38008349043899814, "grad_norm": 1.355504995480586, "learning_rate": 9.135331532698385e-06, "loss": 0.39690232276916504, "num_input_tokens_seen": 180019992, "step": 5645, "train_runtime": 14793.0097, "train_tokens_per_second": 12169.261 }, { "epoch": 0.3804201454349583, "grad_norm": 0.7425264963124952, "learning_rate": 9.133844704413144e-06, "loss": 0.3869367837905884, "num_input_tokens_seen": 180177648, "step": 5650, "train_runtime": 14806.427, "train_tokens_per_second": 12168.881 }, { "epoch": 0.3807568004309184, "grad_norm": 0.7552524034699898, "learning_rate": 9.132356720111413e-06, "loss": 0.4172785758972168, "num_input_tokens_seen": 180336960, "step": 5655, "train_runtime": 14819.5314, "train_tokens_per_second": 12168.871 }, { "epoch": 0.38109345542687856, "grad_norm": 0.8076926411735782, "learning_rate": 9.1308675802093e-06, "loss": 0.38221077919006347, "num_input_tokens_seen": 180495360, "step": 5660, "train_runtime": 14832.4018, "train_tokens_per_second": 12168.991 }, { "epoch": 0.3814301104228387, "grad_norm": 0.8504971136032399, "learning_rate": 9.129377285123241e-06, "loss": 0.39042105674743655, "num_input_tokens_seen": 180653216, "step": 5665, "train_runtime": 14846.115, "train_tokens_per_second": 12168.383 }, { "epoch": 0.38176676541879884, "grad_norm": 0.9151089894670424, "learning_rate": 9.127885835269996e-06, "loss": 0.4058138370513916, "num_input_tokens_seen": 180812832, "step": 5670, "train_runtime": 14859.4374, "train_tokens_per_second": 12168.215 }, { "epoch": 0.382103420414759, "grad_norm": 0.8002759244872248, "learning_rate": 9.126393231066636e-06, "loss": 0.3943216323852539, "num_input_tokens_seen": 180971504, "step": 5675, "train_runtime": 14872.9419, "train_tokens_per_second": 12167.835 }, { "epoch": 0.3824400754107191, "grad_norm": 0.7787199320047549, "learning_rate": 9.124899472930568e-06, "loss": 0.4211256980895996, "num_input_tokens_seen": 181132808, "step": 5680, "train_runtime": 14886.0525, "train_tokens_per_second": 12167.954 }, { "epoch": 0.38277673040667926, "grad_norm": 0.8401227616643309, "learning_rate": 9.123404561279517e-06, "loss": 0.4256914138793945, "num_input_tokens_seen": 181289376, "step": 5685, "train_runtime": 14899.1143, "train_tokens_per_second": 12167.796 }, { "epoch": 0.3831133854026394, "grad_norm": 0.8201153390190173, "learning_rate": 9.121908496531527e-06, "loss": 0.39665195941925047, "num_input_tokens_seen": 181448296, "step": 5690, "train_runtime": 14912.3678, "train_tokens_per_second": 12167.638 }, { "epoch": 0.38345004039859953, "grad_norm": 0.7393431449344484, "learning_rate": 9.120411279104971e-06, "loss": 0.4066039562225342, "num_input_tokens_seen": 181608312, "step": 5695, "train_runtime": 14924.9902, "train_tokens_per_second": 12168.069 }, { "epoch": 0.3837866953945597, "grad_norm": 0.8007982770126021, "learning_rate": 9.118912909418538e-06, "loss": 0.39641437530517576, "num_input_tokens_seen": 181767824, "step": 5700, "train_runtime": 14937.6696, "train_tokens_per_second": 12168.419 }, { "epoch": 0.3841233503905198, "grad_norm": 0.8468123415657721, "learning_rate": 9.117413387891246e-06, "loss": 0.43598108291625975, "num_input_tokens_seen": 181927176, "step": 5705, "train_runtime": 14950.6981, "train_tokens_per_second": 12168.474 }, { "epoch": 0.38446000538647995, "grad_norm": 0.8515726932958023, "learning_rate": 9.11591271494243e-06, "loss": 0.40558586120605467, "num_input_tokens_seen": 182086072, "step": 5710, "train_runtime": 14963.8442, "train_tokens_per_second": 12168.402 }, { "epoch": 0.3847966603824401, "grad_norm": 0.8816896294455118, "learning_rate": 9.114410890991748e-06, "loss": 0.3944713592529297, "num_input_tokens_seen": 182246408, "step": 5715, "train_runtime": 14976.817, "train_tokens_per_second": 12168.567 }, { "epoch": 0.38513331537840023, "grad_norm": 0.830910035563101, "learning_rate": 9.112907916459177e-06, "loss": 0.37573947906494143, "num_input_tokens_seen": 182398464, "step": 5720, "train_runtime": 14990.4181, "train_tokens_per_second": 12167.67 }, { "epoch": 0.38546997037436037, "grad_norm": 0.8454436188931626, "learning_rate": 9.111403791765025e-06, "loss": 0.4055496692657471, "num_input_tokens_seen": 182558360, "step": 5725, "train_runtime": 15003.9494, "train_tokens_per_second": 12167.354 }, { "epoch": 0.3858066253703205, "grad_norm": 0.8200948435098427, "learning_rate": 9.109898517329914e-06, "loss": 0.3865630626678467, "num_input_tokens_seen": 182721176, "step": 5730, "train_runtime": 15017.4338, "train_tokens_per_second": 12167.27 }, { "epoch": 0.38614328036628065, "grad_norm": 0.806582487164594, "learning_rate": 9.108392093574785e-06, "loss": 0.39389605522155763, "num_input_tokens_seen": 182879168, "step": 5735, "train_runtime": 15029.9144, "train_tokens_per_second": 12167.679 }, { "epoch": 0.3864799353622408, "grad_norm": 1.0220999968490372, "learning_rate": 9.10688452092091e-06, "loss": 0.36595332622528076, "num_input_tokens_seen": 183036016, "step": 5740, "train_runtime": 15043.1609, "train_tokens_per_second": 12167.391 }, { "epoch": 0.38681659035820093, "grad_norm": 0.9483636654575818, "learning_rate": 9.105375799789874e-06, "loss": 0.39159164428710935, "num_input_tokens_seen": 183192744, "step": 5745, "train_runtime": 15056.1087, "train_tokens_per_second": 12167.337 }, { "epoch": 0.38715324535416107, "grad_norm": 0.9446174214024551, "learning_rate": 9.103865930603586e-06, "loss": 0.3879040241241455, "num_input_tokens_seen": 183352800, "step": 5750, "train_runtime": 15068.8803, "train_tokens_per_second": 12167.646 }, { "epoch": 0.3874899003501212, "grad_norm": 0.8698776344339706, "learning_rate": 9.102354913784279e-06, "loss": 0.3768143177032471, "num_input_tokens_seen": 183513504, "step": 5755, "train_runtime": 15082.4847, "train_tokens_per_second": 12167.326 }, { "epoch": 0.38782655534608135, "grad_norm": 0.7930820769724194, "learning_rate": 9.100842749754499e-06, "loss": 0.367011570930481, "num_input_tokens_seen": 183675944, "step": 5760, "train_runtime": 15095.1321, "train_tokens_per_second": 12167.892 }, { "epoch": 0.3881632103420415, "grad_norm": 0.75049975851598, "learning_rate": 9.099329438937122e-06, "loss": 0.41629934310913086, "num_input_tokens_seen": 183832944, "step": 5765, "train_runtime": 15108.5489, "train_tokens_per_second": 12167.478 }, { "epoch": 0.3884998653380016, "grad_norm": 0.8929032755400228, "learning_rate": 9.09781498175534e-06, "loss": 0.36588306427001954, "num_input_tokens_seen": 183988360, "step": 5770, "train_runtime": 15121.7871, "train_tokens_per_second": 12167.104 }, { "epoch": 0.38883652033396177, "grad_norm": 0.7853231079312388, "learning_rate": 9.096299378632666e-06, "loss": 0.3768979549407959, "num_input_tokens_seen": 184150184, "step": 5775, "train_runtime": 15134.3328, "train_tokens_per_second": 12167.711 }, { "epoch": 0.3891731753299219, "grad_norm": 0.8219082469266189, "learning_rate": 9.09478262999293e-06, "loss": 0.4181269645690918, "num_input_tokens_seen": 184313928, "step": 5780, "train_runtime": 15147.4113, "train_tokens_per_second": 12168.015 }, { "epoch": 0.38950983032588204, "grad_norm": 0.819243053311245, "learning_rate": 9.09326473626029e-06, "loss": 0.3907138824462891, "num_input_tokens_seen": 184474160, "step": 5785, "train_runtime": 15160.7168, "train_tokens_per_second": 12167.905 }, { "epoch": 0.3898464853218422, "grad_norm": 0.87035948515625, "learning_rate": 9.091745697859218e-06, "loss": 0.4154670715332031, "num_input_tokens_seen": 184635832, "step": 5790, "train_runtime": 15173.2416, "train_tokens_per_second": 12168.516 }, { "epoch": 0.3901831403178023, "grad_norm": 0.9080500459010776, "learning_rate": 9.090225515214512e-06, "loss": 0.40126667022705076, "num_input_tokens_seen": 184794224, "step": 5795, "train_runtime": 15185.8968, "train_tokens_per_second": 12168.805 }, { "epoch": 0.39051979531376246, "grad_norm": 0.897892240078457, "learning_rate": 9.088704188751281e-06, "loss": 0.41934909820556643, "num_input_tokens_seen": 184951904, "step": 5800, "train_runtime": 15199.3745, "train_tokens_per_second": 12168.389 }, { "epoch": 0.3908564503097226, "grad_norm": 0.9187883276401101, "learning_rate": 9.087181718894963e-06, "loss": 0.4034393310546875, "num_input_tokens_seen": 185115744, "step": 5805, "train_runtime": 15211.7969, "train_tokens_per_second": 12169.223 }, { "epoch": 0.39119310530568274, "grad_norm": 0.8018265047341445, "learning_rate": 9.085658106071309e-06, "loss": 0.3991898536682129, "num_input_tokens_seen": 185272992, "step": 5810, "train_runtime": 15225.0177, "train_tokens_per_second": 12168.984 }, { "epoch": 0.3915297603016429, "grad_norm": 0.8042124878943258, "learning_rate": 9.084133350706394e-06, "loss": 0.39764938354492185, "num_input_tokens_seen": 185430776, "step": 5815, "train_runtime": 15238.0174, "train_tokens_per_second": 12168.957 }, { "epoch": 0.391866415297603, "grad_norm": 1.1724651938015462, "learning_rate": 9.082607453226613e-06, "loss": 0.368347692489624, "num_input_tokens_seen": 185590712, "step": 5820, "train_runtime": 15251.7535, "train_tokens_per_second": 12168.484 }, { "epoch": 0.39220307029356316, "grad_norm": 0.8206580766339412, "learning_rate": 9.081080414058674e-06, "loss": 0.4035919666290283, "num_input_tokens_seen": 185746704, "step": 5825, "train_runtime": 15264.759, "train_tokens_per_second": 12168.335 }, { "epoch": 0.3925397252895233, "grad_norm": 0.9899489284328178, "learning_rate": 9.079552233629612e-06, "loss": 0.3828219175338745, "num_input_tokens_seen": 185905824, "step": 5830, "train_runtime": 15277.3724, "train_tokens_per_second": 12168.704 }, { "epoch": 0.39287638028548344, "grad_norm": 0.8675174625974806, "learning_rate": 9.078022912366776e-06, "loss": 0.3968531131744385, "num_input_tokens_seen": 186066216, "step": 5835, "train_runtime": 15290.1079, "train_tokens_per_second": 12169.058 }, { "epoch": 0.3932130352814436, "grad_norm": 0.8760718072859601, "learning_rate": 9.076492450697835e-06, "loss": 0.41472568511962893, "num_input_tokens_seen": 186228752, "step": 5840, "train_runtime": 15303.4815, "train_tokens_per_second": 12169.045 }, { "epoch": 0.3935496902774037, "grad_norm": 1.0266589139098974, "learning_rate": 9.074960849050782e-06, "loss": 0.41312284469604493, "num_input_tokens_seen": 186387896, "step": 5845, "train_runtime": 15316.5546, "train_tokens_per_second": 12169.049 }, { "epoch": 0.39388634527336386, "grad_norm": 0.7634786648002566, "learning_rate": 9.07342810785392e-06, "loss": 0.3797821044921875, "num_input_tokens_seen": 186541912, "step": 5850, "train_runtime": 15330.1905, "train_tokens_per_second": 12168.271 }, { "epoch": 0.394223000269324, "grad_norm": 0.844673236007135, "learning_rate": 9.071894227535878e-06, "loss": 0.377911901473999, "num_input_tokens_seen": 186698896, "step": 5855, "train_runtime": 15342.837, "train_tokens_per_second": 12168.473 }, { "epoch": 0.39455965526528414, "grad_norm": 0.8915012174115184, "learning_rate": 9.070359208525598e-06, "loss": 0.411223030090332, "num_input_tokens_seen": 186858400, "step": 5860, "train_runtime": 15356.1349, "train_tokens_per_second": 12168.322 }, { "epoch": 0.3948963102612443, "grad_norm": 0.8370255662698854, "learning_rate": 9.068823051252346e-06, "loss": 0.40084524154663087, "num_input_tokens_seen": 187021040, "step": 5865, "train_runtime": 15369.4971, "train_tokens_per_second": 12168.325 }, { "epoch": 0.3952329652572044, "grad_norm": 0.8029216927292948, "learning_rate": 9.067285756145702e-06, "loss": 0.3786440134048462, "num_input_tokens_seen": 187183768, "step": 5870, "train_runtime": 15382.2157, "train_tokens_per_second": 12168.843 }, { "epoch": 0.39556962025316456, "grad_norm": 0.8524017651600102, "learning_rate": 9.065747323635565e-06, "loss": 0.34367804527282714, "num_input_tokens_seen": 187330264, "step": 5875, "train_runtime": 15395.6644, "train_tokens_per_second": 12167.728 }, { "epoch": 0.3959062752491247, "grad_norm": 0.9063536628710379, "learning_rate": 9.064207754152154e-06, "loss": 0.42354135513305663, "num_input_tokens_seen": 187487432, "step": 5880, "train_runtime": 15408.226, "train_tokens_per_second": 12168.009 }, { "epoch": 0.39624293024508483, "grad_norm": 0.8052408528246583, "learning_rate": 9.062667048126005e-06, "loss": 0.39244871139526366, "num_input_tokens_seen": 187650960, "step": 5885, "train_runtime": 15421.2318, "train_tokens_per_second": 12168.351 }, { "epoch": 0.396579585241045, "grad_norm": 0.8609627530954982, "learning_rate": 9.061125205987971e-06, "loss": 0.42192506790161133, "num_input_tokens_seen": 187809824, "step": 5890, "train_runtime": 15434.7336, "train_tokens_per_second": 12167.999 }, { "epoch": 0.3969162402370051, "grad_norm": 0.9358273490435912, "learning_rate": 9.059582228169222e-06, "loss": 0.38229267597198485, "num_input_tokens_seen": 187962480, "step": 5895, "train_runtime": 15448.1777, "train_tokens_per_second": 12167.291 }, { "epoch": 0.39725289523296525, "grad_norm": 0.8098644138468156, "learning_rate": 9.058038115101248e-06, "loss": 0.40517187118530273, "num_input_tokens_seen": 188125032, "step": 5900, "train_runtime": 15460.8407, "train_tokens_per_second": 12167.84 }, { "epoch": 0.3975895502289254, "grad_norm": 0.7648835503770965, "learning_rate": 9.056492867215857e-06, "loss": 0.3762061595916748, "num_input_tokens_seen": 188281880, "step": 5905, "train_runtime": 15474.5271, "train_tokens_per_second": 12167.214 }, { "epoch": 0.39792620522488553, "grad_norm": 0.747794607520484, "learning_rate": 9.05494648494517e-06, "loss": 0.39612545967102053, "num_input_tokens_seen": 188438496, "step": 5910, "train_runtime": 15487.9809, "train_tokens_per_second": 12166.757 }, { "epoch": 0.39826286022084567, "grad_norm": 0.7620731357615933, "learning_rate": 9.053398968721629e-06, "loss": 0.3705871343612671, "num_input_tokens_seen": 188602120, "step": 5915, "train_runtime": 15501.7093, "train_tokens_per_second": 12166.537 }, { "epoch": 0.3985995152168058, "grad_norm": 0.8018640078537024, "learning_rate": 9.05185031897799e-06, "loss": 0.4284857749938965, "num_input_tokens_seen": 188763320, "step": 5920, "train_runtime": 15514.5217, "train_tokens_per_second": 12166.88 }, { "epoch": 0.39893617021276595, "grad_norm": 0.866387989255959, "learning_rate": 9.050300536147331e-06, "loss": 0.4351509094238281, "num_input_tokens_seen": 188927160, "step": 5925, "train_runtime": 15526.9376, "train_tokens_per_second": 12167.703 }, { "epoch": 0.3992728252087261, "grad_norm": 0.8936389951020064, "learning_rate": 9.048749620663044e-06, "loss": 0.3660414218902588, "num_input_tokens_seen": 189090312, "step": 5930, "train_runtime": 15539.7926, "train_tokens_per_second": 12168.136 }, { "epoch": 0.39960948020468623, "grad_norm": 0.803482186573226, "learning_rate": 9.047197572958834e-06, "loss": 0.387343168258667, "num_input_tokens_seen": 189252584, "step": 5935, "train_runtime": 15552.2237, "train_tokens_per_second": 12168.844 }, { "epoch": 0.39994613520064637, "grad_norm": 0.838252065087558, "learning_rate": 9.04564439346873e-06, "loss": 0.3894481897354126, "num_input_tokens_seen": 189406888, "step": 5940, "train_runtime": 15564.8973, "train_tokens_per_second": 12168.849 }, { "epoch": 0.4002827901966065, "grad_norm": 0.9667848225791741, "learning_rate": 9.044090082627071e-06, "loss": 0.4214315414428711, "num_input_tokens_seen": 189559896, "step": 5945, "train_runtime": 15577.8575, "train_tokens_per_second": 12168.547 }, { "epoch": 0.40061944519256665, "grad_norm": 0.8400420293920484, "learning_rate": 9.042534640868514e-06, "loss": 0.408921480178833, "num_input_tokens_seen": 189711728, "step": 5950, "train_runtime": 15590.6384, "train_tokens_per_second": 12168.31 }, { "epoch": 0.4009561001885268, "grad_norm": 0.7616169642484772, "learning_rate": 9.04097806862804e-06, "loss": 0.415556001663208, "num_input_tokens_seen": 189870832, "step": 5955, "train_runtime": 15603.7912, "train_tokens_per_second": 12168.25 }, { "epoch": 0.4012927551844869, "grad_norm": 0.8858349537977714, "learning_rate": 9.03942036634093e-06, "loss": 0.4213587760925293, "num_input_tokens_seen": 190028904, "step": 5960, "train_runtime": 15617.2964, "train_tokens_per_second": 12167.849 }, { "epoch": 0.40162941018044707, "grad_norm": 0.9141605664703594, "learning_rate": 9.037861534442797e-06, "loss": 0.37289316654205323, "num_input_tokens_seen": 190191840, "step": 5965, "train_runtime": 15630.0631, "train_tokens_per_second": 12168.335 }, { "epoch": 0.4019660651764072, "grad_norm": 0.8192586079814421, "learning_rate": 9.036301573369563e-06, "loss": 0.4016674041748047, "num_input_tokens_seen": 190355496, "step": 5970, "train_runtime": 15643.1143, "train_tokens_per_second": 12168.644 }, { "epoch": 0.40230272017236735, "grad_norm": 0.8120674008486066, "learning_rate": 9.034740483557465e-06, "loss": 0.3864711284637451, "num_input_tokens_seen": 190515816, "step": 5975, "train_runtime": 15655.8952, "train_tokens_per_second": 12168.951 }, { "epoch": 0.4026393751683275, "grad_norm": 0.8375662565507036, "learning_rate": 9.033178265443055e-06, "loss": 0.3972316265106201, "num_input_tokens_seen": 190676784, "step": 5980, "train_runtime": 15669.5932, "train_tokens_per_second": 12168.585 }, { "epoch": 0.4029760301642876, "grad_norm": 0.7948683684826887, "learning_rate": 9.031614919463206e-06, "loss": 0.3926998615264893, "num_input_tokens_seen": 190836056, "step": 5985, "train_runtime": 15682.0858, "train_tokens_per_second": 12169.048 }, { "epoch": 0.40331268516024776, "grad_norm": 0.7750158583199912, "learning_rate": 9.030050446055099e-06, "loss": 0.3480082988739014, "num_input_tokens_seen": 190992424, "step": 5990, "train_runtime": 15694.8333, "train_tokens_per_second": 12169.127 }, { "epoch": 0.4036493401562079, "grad_norm": 0.8056815087789841, "learning_rate": 9.028484845656235e-06, "loss": 0.39787003993988035, "num_input_tokens_seen": 191155872, "step": 5995, "train_runtime": 15707.2746, "train_tokens_per_second": 12169.894 }, { "epoch": 0.40398599515216804, "grad_norm": 0.7618788072626257, "learning_rate": 9.026918118704431e-06, "loss": 0.45204849243164064, "num_input_tokens_seen": 191316712, "step": 6000, "train_runtime": 15720.3448, "train_tokens_per_second": 12170.007 }, { "epoch": 0.4043226501481282, "grad_norm": 0.7065275851884097, "learning_rate": 9.025350265637816e-06, "loss": 0.36794228553771974, "num_input_tokens_seen": 191479024, "step": 6005, "train_runtime": 15733.3655, "train_tokens_per_second": 12170.252 }, { "epoch": 0.4046593051440883, "grad_norm": 1.037368970805501, "learning_rate": 9.023781286894834e-06, "loss": 0.381566596031189, "num_input_tokens_seen": 191634136, "step": 6010, "train_runtime": 15746.1296, "train_tokens_per_second": 12170.237 }, { "epoch": 0.40499596014004846, "grad_norm": 0.8031970303960078, "learning_rate": 9.022211182914247e-06, "loss": 0.4001512050628662, "num_input_tokens_seen": 191791816, "step": 6015, "train_runtime": 15758.7662, "train_tokens_per_second": 12170.484 }, { "epoch": 0.4053326151360086, "grad_norm": 0.811674031567323, "learning_rate": 9.020639954135128e-06, "loss": 0.3773888826370239, "num_input_tokens_seen": 191948704, "step": 6020, "train_runtime": 15771.8651, "train_tokens_per_second": 12170.324 }, { "epoch": 0.40566927013196874, "grad_norm": 0.7368352838298349, "learning_rate": 9.019067600996867e-06, "loss": 0.3350774049758911, "num_input_tokens_seen": 192103376, "step": 6025, "train_runtime": 15785.3402, "train_tokens_per_second": 12169.733 }, { "epoch": 0.4060059251279289, "grad_norm": 0.8228241168164091, "learning_rate": 9.017494123939169e-06, "loss": 0.39459714889526365, "num_input_tokens_seen": 192263096, "step": 6030, "train_runtime": 15798.0287, "train_tokens_per_second": 12170.069 }, { "epoch": 0.406342580123889, "grad_norm": 0.7493182645039433, "learning_rate": 9.015919523402048e-06, "loss": 0.39789183139801027, "num_input_tokens_seen": 192423632, "step": 6035, "train_runtime": 15811.4076, "train_tokens_per_second": 12169.924 }, { "epoch": 0.40667923511984916, "grad_norm": 0.944138570357275, "learning_rate": 9.014343799825838e-06, "loss": 0.405488109588623, "num_input_tokens_seen": 192576160, "step": 6040, "train_runtime": 15824.8331, "train_tokens_per_second": 12169.238 }, { "epoch": 0.4070158901158093, "grad_norm": 0.7229076218989445, "learning_rate": 9.012766953651186e-06, "loss": 0.4446002960205078, "num_input_tokens_seen": 192738024, "step": 6045, "train_runtime": 15837.3665, "train_tokens_per_second": 12169.828 }, { "epoch": 0.40735254511176944, "grad_norm": 0.7346346622124152, "learning_rate": 9.01118898531905e-06, "loss": 0.42488913536071776, "num_input_tokens_seen": 192896808, "step": 6050, "train_runtime": 15851.3029, "train_tokens_per_second": 12169.145 }, { "epoch": 0.4076892001077296, "grad_norm": 0.7545877021696753, "learning_rate": 9.009609895270708e-06, "loss": 0.36740038394927976, "num_input_tokens_seen": 193060096, "step": 6055, "train_runtime": 15864.2103, "train_tokens_per_second": 12169.537 }, { "epoch": 0.4080258551036897, "grad_norm": 0.8929205988945362, "learning_rate": 9.008029683947743e-06, "loss": 0.432479190826416, "num_input_tokens_seen": 193219616, "step": 6060, "train_runtime": 15876.8956, "train_tokens_per_second": 12169.861 }, { "epoch": 0.40836251009964986, "grad_norm": 0.837476773262991, "learning_rate": 9.006448351792057e-06, "loss": 0.41374797821044923, "num_input_tokens_seen": 193380576, "step": 6065, "train_runtime": 15890.3347, "train_tokens_per_second": 12169.698 }, { "epoch": 0.40869916509561, "grad_norm": 0.7238584969936781, "learning_rate": 9.004865899245864e-06, "loss": 0.39906086921691897, "num_input_tokens_seen": 193540592, "step": 6070, "train_runtime": 15902.9456, "train_tokens_per_second": 12170.11 }, { "epoch": 0.40903582009157013, "grad_norm": 0.8608805638553695, "learning_rate": 9.003282326751694e-06, "loss": 0.4137234687805176, "num_input_tokens_seen": 193702528, "step": 6075, "train_runtime": 15916.4029, "train_tokens_per_second": 12169.994 }, { "epoch": 0.4093724750875303, "grad_norm": 0.9214624756540415, "learning_rate": 9.001697634752387e-06, "loss": 0.40547928810119627, "num_input_tokens_seen": 193857872, "step": 6080, "train_runtime": 15929.847, "train_tokens_per_second": 12169.475 }, { "epoch": 0.4097091300834904, "grad_norm": 0.8070033670926007, "learning_rate": 9.000111823691097e-06, "loss": 0.39362249374389646, "num_input_tokens_seen": 194020144, "step": 6085, "train_runtime": 15943.1037, "train_tokens_per_second": 12169.534 }, { "epoch": 0.41004578507945055, "grad_norm": 0.8981515344845221, "learning_rate": 8.99852489401129e-06, "loss": 0.4239961624145508, "num_input_tokens_seen": 194180504, "step": 6090, "train_runtime": 15955.5323, "train_tokens_per_second": 12170.105 }, { "epoch": 0.4103824400754107, "grad_norm": 0.8182106166403889, "learning_rate": 8.996936846156748e-06, "loss": 0.3660509824752808, "num_input_tokens_seen": 194338048, "step": 6095, "train_runtime": 15968.6049, "train_tokens_per_second": 12170.008 }, { "epoch": 0.41071909507137083, "grad_norm": 0.9047333854399864, "learning_rate": 8.995347680571563e-06, "loss": 0.4100959777832031, "num_input_tokens_seen": 194499064, "step": 6100, "train_runtime": 15982.0207, "train_tokens_per_second": 12169.867 }, { "epoch": 0.41105575006733097, "grad_norm": 0.7778770496312896, "learning_rate": 8.993757397700137e-06, "loss": 0.4050309181213379, "num_input_tokens_seen": 194660184, "step": 6105, "train_runtime": 15995.5461, "train_tokens_per_second": 12169.649 }, { "epoch": 0.41139240506329117, "grad_norm": 1.4907452336465898, "learning_rate": 8.99216599798719e-06, "loss": 0.4434063911437988, "num_input_tokens_seen": 194824024, "step": 6110, "train_runtime": 16007.9622, "train_tokens_per_second": 12170.445 }, { "epoch": 0.4117290600592513, "grad_norm": 0.7858470845855655, "learning_rate": 8.990573481877753e-06, "loss": 0.37927401065826416, "num_input_tokens_seen": 194980144, "step": 6115, "train_runtime": 16021.803, "train_tokens_per_second": 12169.676 }, { "epoch": 0.41206571505521145, "grad_norm": 0.8632857159384224, "learning_rate": 8.988979849817167e-06, "loss": 0.36629629135131836, "num_input_tokens_seen": 195129536, "step": 6120, "train_runtime": 16035.0786, "train_tokens_per_second": 12168.917 }, { "epoch": 0.4124023700511716, "grad_norm": 0.8252474045339431, "learning_rate": 8.987385102251085e-06, "loss": 0.3823172330856323, "num_input_tokens_seen": 195284256, "step": 6125, "train_runtime": 16048.6856, "train_tokens_per_second": 12168.24 }, { "epoch": 0.4127390250471317, "grad_norm": 0.8412642559178806, "learning_rate": 8.985789239625475e-06, "loss": 0.4026922702789307, "num_input_tokens_seen": 195444920, "step": 6130, "train_runtime": 16061.1364, "train_tokens_per_second": 12168.81 }, { "epoch": 0.41307568004309186, "grad_norm": 0.8540486966451508, "learning_rate": 8.984192262386613e-06, "loss": 0.37354564666748047, "num_input_tokens_seen": 195607008, "step": 6135, "train_runtime": 16073.9344, "train_tokens_per_second": 12169.205 }, { "epoch": 0.413412335039052, "grad_norm": 0.8107912129309226, "learning_rate": 8.98259417098109e-06, "loss": 0.40629425048828127, "num_input_tokens_seen": 195770784, "step": 6140, "train_runtime": 16086.9606, "train_tokens_per_second": 12169.532 }, { "epoch": 0.41374899003501214, "grad_norm": 0.8114748297424631, "learning_rate": 8.980994965855808e-06, "loss": 0.40453157424926756, "num_input_tokens_seen": 195929880, "step": 6145, "train_runtime": 16099.3823, "train_tokens_per_second": 12170.025 }, { "epoch": 0.4140856450309723, "grad_norm": 0.8195637603118618, "learning_rate": 8.979394647457976e-06, "loss": 0.4065361976623535, "num_input_tokens_seen": 196090936, "step": 6150, "train_runtime": 16111.8583, "train_tokens_per_second": 12170.597 }, { "epoch": 0.4144223000269324, "grad_norm": 0.7491849435521459, "learning_rate": 8.97779321623512e-06, "loss": 0.35030360221862794, "num_input_tokens_seen": 196245128, "step": 6155, "train_runtime": 16125.0804, "train_tokens_per_second": 12170.18 }, { "epoch": 0.41475895502289256, "grad_norm": 0.7708602924157264, "learning_rate": 8.976190672635077e-06, "loss": 0.40508880615234377, "num_input_tokens_seen": 196406272, "step": 6160, "train_runtime": 16138.0809, "train_tokens_per_second": 12170.361 }, { "epoch": 0.4150956100188527, "grad_norm": 0.8593333629155138, "learning_rate": 8.974587017105991e-06, "loss": 0.4211843490600586, "num_input_tokens_seen": 196560072, "step": 6165, "train_runtime": 16150.8737, "train_tokens_per_second": 12170.244 }, { "epoch": 0.41543226501481284, "grad_norm": 0.8208749917281156, "learning_rate": 8.97298225009632e-06, "loss": 0.407952880859375, "num_input_tokens_seen": 196721824, "step": 6170, "train_runtime": 16163.8993, "train_tokens_per_second": 12170.444 }, { "epoch": 0.415768920010773, "grad_norm": 0.7562947302772545, "learning_rate": 8.971376372054829e-06, "loss": 0.42374467849731445, "num_input_tokens_seen": 196883024, "step": 6175, "train_runtime": 16177.0713, "train_tokens_per_second": 12170.499 }, { "epoch": 0.4161055750067331, "grad_norm": 0.7955561472836911, "learning_rate": 8.969769383430602e-06, "loss": 0.39401679039001464, "num_input_tokens_seen": 197043040, "step": 6180, "train_runtime": 16189.7638, "train_tokens_per_second": 12170.841 }, { "epoch": 0.41644223000269326, "grad_norm": 0.759803900299695, "learning_rate": 8.968161284673027e-06, "loss": 0.3870995998382568, "num_input_tokens_seen": 197204472, "step": 6185, "train_runtime": 16202.3082, "train_tokens_per_second": 12171.381 }, { "epoch": 0.4167788849986534, "grad_norm": 0.7942920161369126, "learning_rate": 8.9665520762318e-06, "loss": 0.3831200122833252, "num_input_tokens_seen": 197366792, "step": 6190, "train_runtime": 16215.3475, "train_tokens_per_second": 12171.604 }, { "epoch": 0.41711553999461354, "grad_norm": 0.8769219430868023, "learning_rate": 8.964941758556934e-06, "loss": 0.41658754348754884, "num_input_tokens_seen": 197524608, "step": 6195, "train_runtime": 16229.0733, "train_tokens_per_second": 12171.034 }, { "epoch": 0.4174521949905737, "grad_norm": 0.7566960557757276, "learning_rate": 8.963330332098747e-06, "loss": 0.3765744924545288, "num_input_tokens_seen": 197676176, "step": 6200, "train_runtime": 16241.8149, "train_tokens_per_second": 12170.818 }, { "epoch": 0.4177888499865338, "grad_norm": 0.7896100385839332, "learning_rate": 8.961717797307872e-06, "loss": 0.36784772872924804, "num_input_tokens_seen": 197837608, "step": 6205, "train_runtime": 16254.8732, "train_tokens_per_second": 12170.972 }, { "epoch": 0.41812550498249396, "grad_norm": 0.9123405461314523, "learning_rate": 8.960104154635248e-06, "loss": 0.40808467864990233, "num_input_tokens_seen": 197992952, "step": 6210, "train_runtime": 16267.3764, "train_tokens_per_second": 12171.167 }, { "epoch": 0.4184621599784541, "grad_norm": 0.8011919607851222, "learning_rate": 8.958489404532125e-06, "loss": 0.40915279388427733, "num_input_tokens_seen": 198149216, "step": 6215, "train_runtime": 16280.3392, "train_tokens_per_second": 12171.074 }, { "epoch": 0.41879881497441424, "grad_norm": 0.7494244230690413, "learning_rate": 8.956873547450062e-06, "loss": 0.39697990417480467, "num_input_tokens_seen": 198308392, "step": 6220, "train_runtime": 16293.2682, "train_tokens_per_second": 12171.186 }, { "epoch": 0.4191354699703744, "grad_norm": 0.9582653313602688, "learning_rate": 8.95525658384093e-06, "loss": 0.4475069046020508, "num_input_tokens_seen": 198465496, "step": 6225, "train_runtime": 16306.766, "train_tokens_per_second": 12170.745 }, { "epoch": 0.4194721249663345, "grad_norm": 0.7776093919803606, "learning_rate": 8.953638514156908e-06, "loss": 0.4056656837463379, "num_input_tokens_seen": 198625160, "step": 6230, "train_runtime": 16320.0486, "train_tokens_per_second": 12170.623 }, { "epoch": 0.41980877996229465, "grad_norm": 0.7767806422411496, "learning_rate": 8.952019338850481e-06, "loss": 0.38939704895019533, "num_input_tokens_seen": 198784016, "step": 6235, "train_runtime": 16332.8976, "train_tokens_per_second": 12170.775 }, { "epoch": 0.4201454349582548, "grad_norm": 0.9012689676117106, "learning_rate": 8.950399058374447e-06, "loss": 0.3841665029525757, "num_input_tokens_seen": 198945344, "step": 6240, "train_runtime": 16345.8275, "train_tokens_per_second": 12171.017 }, { "epoch": 0.42048208995421493, "grad_norm": 0.8633903218074196, "learning_rate": 8.948777673181913e-06, "loss": 0.3867220640182495, "num_input_tokens_seen": 199107400, "step": 6245, "train_runtime": 16359.0192, "train_tokens_per_second": 12171.109 }, { "epoch": 0.42081874495017507, "grad_norm": 0.8017319486424882, "learning_rate": 8.947155183726296e-06, "loss": 0.3729018926620483, "num_input_tokens_seen": 199269448, "step": 6250, "train_runtime": 16372.062, "train_tokens_per_second": 12171.31 }, { "epoch": 0.4211553999461352, "grad_norm": 0.8163275104027464, "learning_rate": 8.94553159046132e-06, "loss": 0.37907135486602783, "num_input_tokens_seen": 199426096, "step": 6255, "train_runtime": 16385.2401, "train_tokens_per_second": 12171.082 }, { "epoch": 0.42149205494209535, "grad_norm": 0.7607843183411673, "learning_rate": 8.943906893841015e-06, "loss": 0.38002800941467285, "num_input_tokens_seen": 199587736, "step": 6260, "train_runtime": 16398.4572, "train_tokens_per_second": 12171.129 }, { "epoch": 0.4218287099380555, "grad_norm": 0.8887736244229288, "learning_rate": 8.942281094319721e-06, "loss": 0.43198213577270506, "num_input_tokens_seen": 199742616, "step": 6265, "train_runtime": 16411.2663, "train_tokens_per_second": 12171.067 }, { "epoch": 0.42216536493401563, "grad_norm": 0.8187426365560948, "learning_rate": 8.940654192352092e-06, "loss": 0.40901384353637693, "num_input_tokens_seen": 199898128, "step": 6270, "train_runtime": 16424.6515, "train_tokens_per_second": 12170.616 }, { "epoch": 0.42250201992997577, "grad_norm": 0.8789552757882678, "learning_rate": 8.939026188393083e-06, "loss": 0.3866248607635498, "num_input_tokens_seen": 200060936, "step": 6275, "train_runtime": 16437.4024, "train_tokens_per_second": 12171.08 }, { "epoch": 0.4228386749259359, "grad_norm": 0.7203565152395781, "learning_rate": 8.937397082897963e-06, "loss": 0.3998734951019287, "num_input_tokens_seen": 200223864, "step": 6280, "train_runtime": 16450.9201, "train_tokens_per_second": 12170.983 }, { "epoch": 0.42317532992189605, "grad_norm": 0.7756494113576382, "learning_rate": 8.935766876322303e-06, "loss": 0.4059271335601807, "num_input_tokens_seen": 200382296, "step": 6285, "train_runtime": 16464.0097, "train_tokens_per_second": 12170.929 }, { "epoch": 0.4235119849178562, "grad_norm": 0.7467971465269441, "learning_rate": 8.934135569121985e-06, "loss": 0.41104855537414553, "num_input_tokens_seen": 200545160, "step": 6290, "train_runtime": 16477.1281, "train_tokens_per_second": 12171.123 }, { "epoch": 0.4238486399138163, "grad_norm": 0.7831102362746416, "learning_rate": 8.932503161753202e-06, "loss": 0.37763237953186035, "num_input_tokens_seen": 200706664, "step": 6295, "train_runtime": 16491.3629, "train_tokens_per_second": 12170.411 }, { "epoch": 0.42418529490977647, "grad_norm": 0.8711319413573633, "learning_rate": 8.930869654672449e-06, "loss": 0.398427152633667, "num_input_tokens_seen": 200863712, "step": 6300, "train_runtime": 16503.8862, "train_tokens_per_second": 12170.692 }, { "epoch": 0.4245219499057366, "grad_norm": 0.8852711513006012, "learning_rate": 8.929235048336531e-06, "loss": 0.3873772144317627, "num_input_tokens_seen": 201025136, "step": 6305, "train_runtime": 16517.3164, "train_tokens_per_second": 12170.569 }, { "epoch": 0.42485860490169675, "grad_norm": 0.9583855949667159, "learning_rate": 8.927599343202563e-06, "loss": 0.4271397590637207, "num_input_tokens_seen": 201186984, "step": 6310, "train_runtime": 16529.8803, "train_tokens_per_second": 12171.11 }, { "epoch": 0.4251952598976569, "grad_norm": 0.9957624333329684, "learning_rate": 8.92596253972796e-06, "loss": 0.4059957504272461, "num_input_tokens_seen": 201350824, "step": 6315, "train_runtime": 16542.3331, "train_tokens_per_second": 12171.852 }, { "epoch": 0.425531914893617, "grad_norm": 0.8220383823221571, "learning_rate": 8.924324638370454e-06, "loss": 0.4262758731842041, "num_input_tokens_seen": 201514664, "step": 6320, "train_runtime": 16554.7804, "train_tokens_per_second": 12172.597 }, { "epoch": 0.42586856988957716, "grad_norm": 0.6974983819037354, "learning_rate": 8.922685639588076e-06, "loss": 0.3435081481933594, "num_input_tokens_seen": 201667208, "step": 6325, "train_runtime": 16568.0216, "train_tokens_per_second": 12172.075 }, { "epoch": 0.4262052248855373, "grad_norm": 0.8025442664097825, "learning_rate": 8.921045543839167e-06, "loss": 0.4132560729980469, "num_input_tokens_seen": 201828440, "step": 6330, "train_runtime": 16580.5082, "train_tokens_per_second": 12172.633 }, { "epoch": 0.42654187988149744, "grad_norm": 0.7580964703879259, "learning_rate": 8.919404351582376e-06, "loss": 0.3796800374984741, "num_input_tokens_seen": 201986256, "step": 6335, "train_runtime": 16593.1761, "train_tokens_per_second": 12172.851 }, { "epoch": 0.4268785348774576, "grad_norm": 0.7601594560802152, "learning_rate": 8.917762063276657e-06, "loss": 0.3857969522476196, "num_input_tokens_seen": 202141168, "step": 6340, "train_runtime": 16605.8796, "train_tokens_per_second": 12172.867 }, { "epoch": 0.4272151898734177, "grad_norm": 0.7696437366726852, "learning_rate": 8.916118679381268e-06, "loss": 0.3719454526901245, "num_input_tokens_seen": 202302784, "step": 6345, "train_runtime": 16619.0137, "train_tokens_per_second": 12172.972 }, { "epoch": 0.42755184486937786, "grad_norm": 0.7645595854372058, "learning_rate": 8.914474200355777e-06, "loss": 0.4145723819732666, "num_input_tokens_seen": 202463664, "step": 6350, "train_runtime": 16632.3917, "train_tokens_per_second": 12172.853 }, { "epoch": 0.427888499865338, "grad_norm": 0.9344552043434483, "learning_rate": 8.912828626660059e-06, "loss": 0.4205318450927734, "num_input_tokens_seen": 202623624, "step": 6355, "train_runtime": 16645.6046, "train_tokens_per_second": 12172.801 }, { "epoch": 0.42822515486129814, "grad_norm": 0.8541854290730081, "learning_rate": 8.911181958754294e-06, "loss": 0.4175868988037109, "num_input_tokens_seen": 202783832, "step": 6360, "train_runtime": 16658.0436, "train_tokens_per_second": 12173.328 }, { "epoch": 0.4285618098572583, "grad_norm": 0.8073663004497286, "learning_rate": 8.909534197098966e-06, "loss": 0.418334436416626, "num_input_tokens_seen": 202946472, "step": 6365, "train_runtime": 16670.8113, "train_tokens_per_second": 12173.761 }, { "epoch": 0.4288984648532184, "grad_norm": 0.8478465127920592, "learning_rate": 8.907885342154865e-06, "loss": 0.3911870241165161, "num_input_tokens_seen": 203106432, "step": 6370, "train_runtime": 16684.3891, "train_tokens_per_second": 12173.441 }, { "epoch": 0.42923511984917856, "grad_norm": 0.8514826203924523, "learning_rate": 8.906235394383089e-06, "loss": 0.3916271448135376, "num_input_tokens_seen": 203261320, "step": 6375, "train_runtime": 16698.3456, "train_tokens_per_second": 12172.542 }, { "epoch": 0.4295717748451387, "grad_norm": 0.7694754730675708, "learning_rate": 8.904584354245042e-06, "loss": 0.38933758735656737, "num_input_tokens_seen": 203423376, "step": 6380, "train_runtime": 16712.2435, "train_tokens_per_second": 12172.117 }, { "epoch": 0.42990842984109884, "grad_norm": 0.9025773225725443, "learning_rate": 8.902932222202433e-06, "loss": 0.41636996269226073, "num_input_tokens_seen": 203587216, "step": 6385, "train_runtime": 16724.6822, "train_tokens_per_second": 12172.86 }, { "epoch": 0.430245084837059, "grad_norm": 0.7411666207577537, "learning_rate": 8.901278998717272e-06, "loss": 0.37010984420776366, "num_input_tokens_seen": 203745920, "step": 6390, "train_runtime": 16737.7751, "train_tokens_per_second": 12172.82 }, { "epoch": 0.4305817398330191, "grad_norm": 0.8851181563210012, "learning_rate": 8.899624684251878e-06, "loss": 0.38461480140686033, "num_input_tokens_seen": 203906136, "step": 6395, "train_runtime": 16750.2006, "train_tokens_per_second": 12173.355 }, { "epoch": 0.43091839482897926, "grad_norm": 0.7376785945451684, "learning_rate": 8.897969279268877e-06, "loss": 0.3654215335845947, "num_input_tokens_seen": 204065088, "step": 6400, "train_runtime": 16763.7124, "train_tokens_per_second": 12173.025 }, { "epoch": 0.4312550498249394, "grad_norm": 0.767766339824947, "learning_rate": 8.896312784231196e-06, "loss": 0.37800936698913573, "num_input_tokens_seen": 204218200, "step": 6405, "train_runtime": 16776.3752, "train_tokens_per_second": 12172.963 }, { "epoch": 0.43159170482089954, "grad_norm": 0.8647014605767486, "learning_rate": 8.89465519960207e-06, "loss": 0.4516145706176758, "num_input_tokens_seen": 204379112, "step": 6410, "train_runtime": 16789.4607, "train_tokens_per_second": 12173.06 }, { "epoch": 0.4319283598168597, "grad_norm": 0.7586251558449697, "learning_rate": 8.892996525845037e-06, "loss": 0.3941913604736328, "num_input_tokens_seen": 204542648, "step": 6415, "train_runtime": 16803.1228, "train_tokens_per_second": 12172.895 }, { "epoch": 0.4322650148128198, "grad_norm": 0.8113777619222794, "learning_rate": 8.89133676342394e-06, "loss": 0.3958760738372803, "num_input_tokens_seen": 204695928, "step": 6420, "train_runtime": 16816.5603, "train_tokens_per_second": 12172.283 }, { "epoch": 0.43260166980877995, "grad_norm": 0.779944474262146, "learning_rate": 8.889675912802923e-06, "loss": 0.3866041898727417, "num_input_tokens_seen": 204855760, "step": 6425, "train_runtime": 16829.8761, "train_tokens_per_second": 12172.149 }, { "epoch": 0.4329383248047401, "grad_norm": 0.8856747506771431, "learning_rate": 8.888013974446443e-06, "loss": 0.41153998374938966, "num_input_tokens_seen": 205016560, "step": 6430, "train_runtime": 16842.6785, "train_tokens_per_second": 12172.444 }, { "epoch": 0.43327497980070023, "grad_norm": 0.8903721739980905, "learning_rate": 8.886350948819253e-06, "loss": 0.3754237174987793, "num_input_tokens_seen": 205170616, "step": 6435, "train_runtime": 16856.0772, "train_tokens_per_second": 12171.908 }, { "epoch": 0.4336116347966604, "grad_norm": 0.7785309730752001, "learning_rate": 8.884686836386412e-06, "loss": 0.3853541374206543, "num_input_tokens_seen": 205331288, "step": 6440, "train_runtime": 16869.4471, "train_tokens_per_second": 12171.785 }, { "epoch": 0.4339482897926205, "grad_norm": 1.080649968407136, "learning_rate": 8.883021637613286e-06, "loss": 0.40599737167358396, "num_input_tokens_seen": 205492152, "step": 6445, "train_runtime": 16882.2669, "train_tokens_per_second": 12172.071 }, { "epoch": 0.43428494478858065, "grad_norm": 0.7418465419288072, "learning_rate": 8.881355352965537e-06, "loss": 0.3794271230697632, "num_input_tokens_seen": 205651240, "step": 6450, "train_runtime": 16895.8877, "train_tokens_per_second": 12171.674 }, { "epoch": 0.4346215997845408, "grad_norm": 0.7335827511668068, "learning_rate": 8.879687982909145e-06, "loss": 0.3569803714752197, "num_input_tokens_seen": 205805808, "step": 6455, "train_runtime": 16908.5562, "train_tokens_per_second": 12171.696 }, { "epoch": 0.43495825478050093, "grad_norm": 1.001987415047391, "learning_rate": 8.878019527910378e-06, "loss": 0.4369661331176758, "num_input_tokens_seen": 205956232, "step": 6460, "train_runtime": 16921.8604, "train_tokens_per_second": 12171.016 }, { "epoch": 0.43529490977646107, "grad_norm": 0.8005061611445161, "learning_rate": 8.876349988435815e-06, "loss": 0.46979198455810545, "num_input_tokens_seen": 206116112, "step": 6465, "train_runtime": 16935.1726, "train_tokens_per_second": 12170.889 }, { "epoch": 0.4356315647724212, "grad_norm": 0.826756852432038, "learning_rate": 8.874679364952339e-06, "loss": 0.40633292198181153, "num_input_tokens_seen": 206279952, "step": 6470, "train_runtime": 16947.6033, "train_tokens_per_second": 12171.63 }, { "epoch": 0.43596821976838135, "grad_norm": 0.7496165082560022, "learning_rate": 8.873007657927135e-06, "loss": 0.38650712966918943, "num_input_tokens_seen": 206441440, "step": 6475, "train_runtime": 16960.1135, "train_tokens_per_second": 12172.173 }, { "epoch": 0.4363048747643415, "grad_norm": 0.7835729027641085, "learning_rate": 8.87133486782769e-06, "loss": 0.36956214904785156, "num_input_tokens_seen": 206595640, "step": 6480, "train_runtime": 16974.8493, "train_tokens_per_second": 12170.691 }, { "epoch": 0.4366415297603016, "grad_norm": 0.7061650916424851, "learning_rate": 8.869660995121792e-06, "loss": 0.40279216766357423, "num_input_tokens_seen": 206756288, "step": 6485, "train_runtime": 16987.7467, "train_tokens_per_second": 12170.907 }, { "epoch": 0.43697818475626177, "grad_norm": 0.8158854326348044, "learning_rate": 8.867986040277537e-06, "loss": 0.4118006706237793, "num_input_tokens_seen": 206912712, "step": 6490, "train_runtime": 17001.8686, "train_tokens_per_second": 12169.998 }, { "epoch": 0.4373148397522219, "grad_norm": 0.8243070992286381, "learning_rate": 8.86631000376332e-06, "loss": 0.4177233695983887, "num_input_tokens_seen": 207069176, "step": 6495, "train_runtime": 17015.2578, "train_tokens_per_second": 12169.617 }, { "epoch": 0.43765149474818205, "grad_norm": 0.7912651297537403, "learning_rate": 8.864632886047841e-06, "loss": 0.3682330846786499, "num_input_tokens_seen": 207227144, "step": 6500, "train_runtime": 17028.0961, "train_tokens_per_second": 12169.719 }, { "epoch": 0.4379881497441422, "grad_norm": 0.9261598462539096, "learning_rate": 8.862954687600097e-06, "loss": 0.41315951347351076, "num_input_tokens_seen": 207383400, "step": 6505, "train_runtime": 17040.9889, "train_tokens_per_second": 12169.681 }, { "epoch": 0.4383248047401023, "grad_norm": 1.1330731074748384, "learning_rate": 8.861275408889393e-06, "loss": 0.4136187076568604, "num_input_tokens_seen": 207542168, "step": 6510, "train_runtime": 17054.5497, "train_tokens_per_second": 12169.314 }, { "epoch": 0.43866145973606246, "grad_norm": 0.9327818733323059, "learning_rate": 8.859595050385332e-06, "loss": 0.40981483459472656, "num_input_tokens_seen": 207703736, "step": 6515, "train_runtime": 17068.2618, "train_tokens_per_second": 12169.003 }, { "epoch": 0.4389981147320226, "grad_norm": 0.7885621842572841, "learning_rate": 8.857913612557825e-06, "loss": 0.3984759569168091, "num_input_tokens_seen": 207864200, "step": 6520, "train_runtime": 17081.795, "train_tokens_per_second": 12168.756 }, { "epoch": 0.43933476972798274, "grad_norm": 0.8749563441795234, "learning_rate": 8.856231095877077e-06, "loss": 0.3816246509552002, "num_input_tokens_seen": 208019152, "step": 6525, "train_runtime": 17094.4348, "train_tokens_per_second": 12168.823 }, { "epoch": 0.4396714247239429, "grad_norm": 0.8141550743345219, "learning_rate": 8.8545475008136e-06, "loss": 0.4005760669708252, "num_input_tokens_seen": 208179640, "step": 6530, "train_runtime": 17107.2657, "train_tokens_per_second": 12169.077 }, { "epoch": 0.440008079719903, "grad_norm": 0.8987331662227747, "learning_rate": 8.852862827838207e-06, "loss": 0.37380046844482423, "num_input_tokens_seen": 208337936, "step": 6535, "train_runtime": 17120.9085, "train_tokens_per_second": 12168.626 }, { "epoch": 0.44034473471586316, "grad_norm": 0.765956198966461, "learning_rate": 8.851177077422008e-06, "loss": 0.4113166809082031, "num_input_tokens_seen": 208501472, "step": 6540, "train_runtime": 17133.944, "train_tokens_per_second": 12168.913 }, { "epoch": 0.4406813897118233, "grad_norm": 1.0106113443016926, "learning_rate": 8.849490250036421e-06, "loss": 0.42745304107666016, "num_input_tokens_seen": 208657360, "step": 6545, "train_runtime": 17147.108, "train_tokens_per_second": 12168.662 }, { "epoch": 0.44101804470778344, "grad_norm": 0.8229589045758727, "learning_rate": 8.847802346153159e-06, "loss": 0.3718966722488403, "num_input_tokens_seen": 208815528, "step": 6550, "train_runtime": 17160.7233, "train_tokens_per_second": 12168.224 }, { "epoch": 0.4413546997037436, "grad_norm": 0.796960460826291, "learning_rate": 8.846113366244241e-06, "loss": 0.4133618354797363, "num_input_tokens_seen": 208974696, "step": 6555, "train_runtime": 17173.6823, "train_tokens_per_second": 12168.31 }, { "epoch": 0.4416913546997037, "grad_norm": 0.751544981464247, "learning_rate": 8.844423310781986e-06, "loss": 0.35882039070129396, "num_input_tokens_seen": 209137368, "step": 6560, "train_runtime": 17186.3785, "train_tokens_per_second": 12168.786 }, { "epoch": 0.44202800969566386, "grad_norm": 0.8147794467919871, "learning_rate": 8.842732180239011e-06, "loss": 0.4266206741333008, "num_input_tokens_seen": 209298600, "step": 6565, "train_runtime": 17199.6802, "train_tokens_per_second": 12168.75 }, { "epoch": 0.442364664691624, "grad_norm": 0.9851723203083609, "learning_rate": 8.841039975088234e-06, "loss": 0.3815274953842163, "num_input_tokens_seen": 209456896, "step": 6570, "train_runtime": 17212.5306, "train_tokens_per_second": 12168.861 }, { "epoch": 0.44270131968758414, "grad_norm": 0.7881267267746809, "learning_rate": 8.839346695802878e-06, "loss": 0.46625118255615233, "num_input_tokens_seen": 209618920, "step": 6575, "train_runtime": 17225.6984, "train_tokens_per_second": 12168.965 }, { "epoch": 0.4430379746835443, "grad_norm": 0.8247864465981104, "learning_rate": 8.837652342856459e-06, "loss": 0.40712246894836424, "num_input_tokens_seen": 209778592, "step": 6580, "train_runtime": 17238.7642, "train_tokens_per_second": 12169.004 }, { "epoch": 0.4433746296795044, "grad_norm": 0.7479122721100551, "learning_rate": 8.835956916722803e-06, "loss": 0.37038216590881345, "num_input_tokens_seen": 209938736, "step": 6585, "train_runtime": 17251.7156, "train_tokens_per_second": 12169.151 }, { "epoch": 0.44371128467546456, "grad_norm": 0.8037524924384541, "learning_rate": 8.834260417876024e-06, "loss": 0.4097486972808838, "num_input_tokens_seen": 210095024, "step": 6590, "train_runtime": 17264.6922, "train_tokens_per_second": 12169.057 }, { "epoch": 0.4440479396714247, "grad_norm": 0.8117819027739414, "learning_rate": 8.832562846790549e-06, "loss": 0.39945507049560547, "num_input_tokens_seen": 210257736, "step": 6595, "train_runtime": 17278.1134, "train_tokens_per_second": 12169.022 }, { "epoch": 0.4443845946673849, "grad_norm": 0.760431393143732, "learning_rate": 8.830864203941092e-06, "loss": 0.40523157119750974, "num_input_tokens_seen": 210419872, "step": 6600, "train_runtime": 17292.0997, "train_tokens_per_second": 12168.555 }, { "epoch": 0.44472124966334503, "grad_norm": 0.8406259681036701, "learning_rate": 8.829164489802677e-06, "loss": 0.3919215202331543, "num_input_tokens_seen": 210577272, "step": 6605, "train_runtime": 17305.2143, "train_tokens_per_second": 12168.429 }, { "epoch": 0.44505790465930517, "grad_norm": 0.8874134198545599, "learning_rate": 8.827463704850622e-06, "loss": 0.3872117042541504, "num_input_tokens_seen": 210737528, "step": 6610, "train_runtime": 17318.719, "train_tokens_per_second": 12168.194 }, { "epoch": 0.4453945596552653, "grad_norm": 0.8771821703382103, "learning_rate": 8.825761849560547e-06, "loss": 0.38438212871551514, "num_input_tokens_seen": 210896192, "step": 6615, "train_runtime": 17331.8987, "train_tokens_per_second": 12168.095 }, { "epoch": 0.44573121465122545, "grad_norm": 0.892410750033935, "learning_rate": 8.824058924408371e-06, "loss": 0.40035238265991213, "num_input_tokens_seen": 211056312, "step": 6620, "train_runtime": 17344.3902, "train_tokens_per_second": 12168.563 }, { "epoch": 0.4460678696471856, "grad_norm": 0.7760070552432398, "learning_rate": 8.822354929870311e-06, "loss": 0.39186439514160154, "num_input_tokens_seen": 211215168, "step": 6625, "train_runtime": 17357.5707, "train_tokens_per_second": 12168.475 }, { "epoch": 0.44640452464314573, "grad_norm": 0.7836388794703599, "learning_rate": 8.820649866422884e-06, "loss": 0.40058097839355467, "num_input_tokens_seen": 211378952, "step": 6630, "train_runtime": 17370.6912, "train_tokens_per_second": 12168.713 }, { "epoch": 0.44674117963910587, "grad_norm": 0.7406913292362001, "learning_rate": 8.818943734542905e-06, "loss": 0.3794663429260254, "num_input_tokens_seen": 211538880, "step": 6635, "train_runtime": 17383.4248, "train_tokens_per_second": 12168.999 }, { "epoch": 0.447077834635066, "grad_norm": 0.8669209063529325, "learning_rate": 8.817236534707486e-06, "loss": 0.3923959732055664, "num_input_tokens_seen": 211699136, "step": 6640, "train_runtime": 17396.3703, "train_tokens_per_second": 12169.156 }, { "epoch": 0.44741448963102615, "grad_norm": 0.9249704546623426, "learning_rate": 8.815528267394045e-06, "loss": 0.39086484909057617, "num_input_tokens_seen": 211859248, "step": 6645, "train_runtime": 17408.8413, "train_tokens_per_second": 12169.635 }, { "epoch": 0.4477511446269863, "grad_norm": 0.7906495271904804, "learning_rate": 8.81381893308029e-06, "loss": 0.4134485721588135, "num_input_tokens_seen": 212021880, "step": 6650, "train_runtime": 17421.8541, "train_tokens_per_second": 12169.88 }, { "epoch": 0.4480877996229464, "grad_norm": 0.7898332042713607, "learning_rate": 8.81210853224423e-06, "loss": 0.4078489303588867, "num_input_tokens_seen": 212178808, "step": 6655, "train_runtime": 17435.0406, "train_tokens_per_second": 12169.677 }, { "epoch": 0.44842445461890656, "grad_norm": 0.8404495359433463, "learning_rate": 8.810397065364177e-06, "loss": 0.37212514877319336, "num_input_tokens_seen": 212331904, "step": 6660, "train_runtime": 17448.5209, "train_tokens_per_second": 12169.049 }, { "epoch": 0.4487611096148667, "grad_norm": 0.7825132274677199, "learning_rate": 8.808684532918735e-06, "loss": 0.40340847969055177, "num_input_tokens_seen": 212492088, "step": 6665, "train_runtime": 17462.0371, "train_tokens_per_second": 12168.803 }, { "epoch": 0.44909776461082684, "grad_norm": 0.8570183065553999, "learning_rate": 8.806970935386807e-06, "loss": 0.3904376745223999, "num_input_tokens_seen": 212648056, "step": 6670, "train_runtime": 17475.2084, "train_tokens_per_second": 12168.556 }, { "epoch": 0.449434419606787, "grad_norm": 0.8284935573964377, "learning_rate": 8.805256273247597e-06, "loss": 0.39842920303344725, "num_input_tokens_seen": 212808760, "step": 6675, "train_runtime": 17487.8267, "train_tokens_per_second": 12168.965 }, { "epoch": 0.4497710746027471, "grad_norm": 0.796623884357856, "learning_rate": 8.803540546980605e-06, "loss": 0.40415778160095217, "num_input_tokens_seen": 212965304, "step": 6680, "train_runtime": 17500.828, "train_tokens_per_second": 12168.87 }, { "epoch": 0.45010772959870726, "grad_norm": 0.7744746352317847, "learning_rate": 8.801823757065628e-06, "loss": 0.4022409915924072, "num_input_tokens_seen": 213125232, "step": 6685, "train_runtime": 17514.0128, "train_tokens_per_second": 12168.841 }, { "epoch": 0.4504443845946674, "grad_norm": 0.7580401213092398, "learning_rate": 8.800105903982758e-06, "loss": 0.38105192184448244, "num_input_tokens_seen": 213280840, "step": 6690, "train_runtime": 17527.0911, "train_tokens_per_second": 12168.639 }, { "epoch": 0.45078103959062754, "grad_norm": 0.8406139757419543, "learning_rate": 8.798386988212393e-06, "loss": 0.36024372577667235, "num_input_tokens_seen": 213433632, "step": 6695, "train_runtime": 17540.7379, "train_tokens_per_second": 12167.882 }, { "epoch": 0.4511176945865877, "grad_norm": 0.75351032576296, "learning_rate": 8.796667010235216e-06, "loss": 0.4107832431793213, "num_input_tokens_seen": 213596120, "step": 6700, "train_runtime": 17554.2753, "train_tokens_per_second": 12167.755 }, { "epoch": 0.4514543495825478, "grad_norm": 0.8697942812642919, "learning_rate": 8.794945970532219e-06, "loss": 0.39205708503723147, "num_input_tokens_seen": 213756792, "step": 6705, "train_runtime": 17566.7415, "train_tokens_per_second": 12168.267 }, { "epoch": 0.45179100457850796, "grad_norm": 0.8508593484656624, "learning_rate": 8.79322386958468e-06, "loss": 0.42752652168273925, "num_input_tokens_seen": 213916936, "step": 6710, "train_runtime": 17579.2101, "train_tokens_per_second": 12168.746 }, { "epoch": 0.4521276595744681, "grad_norm": 0.8201516596388327, "learning_rate": 8.791500707874183e-06, "loss": 0.35318779945373535, "num_input_tokens_seen": 214078000, "step": 6715, "train_runtime": 17593.4481, "train_tokens_per_second": 12168.052 }, { "epoch": 0.45246431457042824, "grad_norm": 0.8088966745033099, "learning_rate": 8.789776485882601e-06, "loss": 0.40700445175170896, "num_input_tokens_seen": 214240720, "step": 6720, "train_runtime": 17606.1625, "train_tokens_per_second": 12168.507 }, { "epoch": 0.4528009695663884, "grad_norm": 0.789583358396357, "learning_rate": 8.788051204092112e-06, "loss": 0.38327717781066895, "num_input_tokens_seen": 214402544, "step": 6725, "train_runtime": 17619.6186, "train_tokens_per_second": 12168.399 }, { "epoch": 0.4531376245623485, "grad_norm": 0.85960794851224, "learning_rate": 8.786324862985183e-06, "loss": 0.3902151107788086, "num_input_tokens_seen": 214557824, "step": 6730, "train_runtime": 17632.1516, "train_tokens_per_second": 12168.556 }, { "epoch": 0.45347427955830866, "grad_norm": 0.7771633639450803, "learning_rate": 8.78459746304458e-06, "loss": 0.36953599452972413, "num_input_tokens_seen": 214707008, "step": 6735, "train_runtime": 17646.0626, "train_tokens_per_second": 12167.417 }, { "epoch": 0.4538109345542688, "grad_norm": 0.9306154065922544, "learning_rate": 8.782869004753363e-06, "loss": 0.3993424892425537, "num_input_tokens_seen": 214863688, "step": 6740, "train_runtime": 17658.9199, "train_tokens_per_second": 12167.431 }, { "epoch": 0.45414758955022894, "grad_norm": 0.8713376597304905, "learning_rate": 8.781139488594892e-06, "loss": 0.39494800567626953, "num_input_tokens_seen": 215021672, "step": 6745, "train_runtime": 17671.4196, "train_tokens_per_second": 12167.765 }, { "epoch": 0.4544842445461891, "grad_norm": 0.6753005342703616, "learning_rate": 8.779408915052821e-06, "loss": 0.36996941566467284, "num_input_tokens_seen": 215182088, "step": 6750, "train_runtime": 17685.1772, "train_tokens_per_second": 12167.37 }, { "epoch": 0.4548208995421492, "grad_norm": 0.7950795116058244, "learning_rate": 8.777677284611096e-06, "loss": 0.354027533531189, "num_input_tokens_seen": 215332952, "step": 6755, "train_runtime": 17699.1602, "train_tokens_per_second": 12166.281 }, { "epoch": 0.45515755453810935, "grad_norm": 0.8834425196894982, "learning_rate": 8.775944597753969e-06, "loss": 0.39939677715301514, "num_input_tokens_seen": 215488848, "step": 6760, "train_runtime": 17712.1667, "train_tokens_per_second": 12166.148 }, { "epoch": 0.4554942095340695, "grad_norm": 0.7426046058775196, "learning_rate": 8.774210854965972e-06, "loss": 0.4040395736694336, "num_input_tokens_seen": 215648288, "step": 6765, "train_runtime": 17725.1406, "train_tokens_per_second": 12166.238 }, { "epoch": 0.45583086453002963, "grad_norm": 0.8505219793928216, "learning_rate": 8.772476056731946e-06, "loss": 0.36863436698913576, "num_input_tokens_seen": 215810448, "step": 6770, "train_runtime": 17737.7264, "train_tokens_per_second": 12166.748 }, { "epoch": 0.4561675195259898, "grad_norm": 0.7396477168608548, "learning_rate": 8.77074020353702e-06, "loss": 0.3714876174926758, "num_input_tokens_seen": 215969208, "step": 6775, "train_runtime": 17751.017, "train_tokens_per_second": 12166.582 }, { "epoch": 0.4565041745219499, "grad_norm": 0.9123448652752225, "learning_rate": 8.76900329586662e-06, "loss": 0.4195611000061035, "num_input_tokens_seen": 216131120, "step": 6780, "train_runtime": 17764.2864, "train_tokens_per_second": 12166.609 }, { "epoch": 0.45684082951791005, "grad_norm": 0.8231517437976272, "learning_rate": 8.767265334206467e-06, "loss": 0.38347907066345216, "num_input_tokens_seen": 216291168, "step": 6785, "train_runtime": 17777.2516, "train_tokens_per_second": 12166.738 }, { "epoch": 0.4571774845138702, "grad_norm": 0.7977872024966792, "learning_rate": 8.765526319042577e-06, "loss": 0.3858048439025879, "num_input_tokens_seen": 216449456, "step": 6790, "train_runtime": 17789.792, "train_tokens_per_second": 12167.059 }, { "epoch": 0.45751413950983033, "grad_norm": 0.8541744268445306, "learning_rate": 8.763786250861258e-06, "loss": 0.3648559093475342, "num_input_tokens_seen": 216612928, "step": 6795, "train_runtime": 17802.9115, "train_tokens_per_second": 12167.275 }, { "epoch": 0.45785079450579047, "grad_norm": 0.9194657749875546, "learning_rate": 8.762045130149114e-06, "loss": 0.3854583978652954, "num_input_tokens_seen": 216775024, "step": 6800, "train_runtime": 17815.528, "train_tokens_per_second": 12167.757 }, { "epoch": 0.4581874495017506, "grad_norm": 0.7200621597310751, "learning_rate": 8.76030295739305e-06, "loss": 0.3729256153106689, "num_input_tokens_seen": 216937600, "step": 6805, "train_runtime": 17828.8545, "train_tokens_per_second": 12167.781 }, { "epoch": 0.45852410449771075, "grad_norm": 0.7894993409186029, "learning_rate": 8.758559733080252e-06, "loss": 0.40532307624816893, "num_input_tokens_seen": 217096152, "step": 6810, "train_runtime": 17841.4522, "train_tokens_per_second": 12168.076 }, { "epoch": 0.4588607594936709, "grad_norm": 0.8093445467642725, "learning_rate": 8.75681545769821e-06, "loss": 0.3983329772949219, "num_input_tokens_seen": 217259520, "step": 6815, "train_runtime": 17854.4145, "train_tokens_per_second": 12168.392 }, { "epoch": 0.45919741448963103, "grad_norm": 0.8232103268961845, "learning_rate": 8.755070131734706e-06, "loss": 0.3976221799850464, "num_input_tokens_seen": 217421624, "step": 6820, "train_runtime": 17867.6365, "train_tokens_per_second": 12168.46 }, { "epoch": 0.45953406948559117, "grad_norm": 0.8958033190100124, "learning_rate": 8.753323755677812e-06, "loss": 0.41740145683288576, "num_input_tokens_seen": 217579464, "step": 6825, "train_runtime": 17880.9597, "train_tokens_per_second": 12168.221 }, { "epoch": 0.4598707244815513, "grad_norm": 0.8002993819969272, "learning_rate": 8.7515763300159e-06, "loss": 0.34453320503234863, "num_input_tokens_seen": 217742072, "step": 6830, "train_runtime": 17894.3239, "train_tokens_per_second": 12168.22 }, { "epoch": 0.46020737947751145, "grad_norm": 0.7532701777270369, "learning_rate": 8.74982785523763e-06, "loss": 0.4114655017852783, "num_input_tokens_seen": 217902256, "step": 6835, "train_runtime": 17907.2925, "train_tokens_per_second": 12168.353 }, { "epoch": 0.4605440344734716, "grad_norm": 0.7239052161210936, "learning_rate": 8.748078331831957e-06, "loss": 0.3882114887237549, "num_input_tokens_seen": 218065288, "step": 6840, "train_runtime": 17920.1302, "train_tokens_per_second": 12168.733 }, { "epoch": 0.4608806894694317, "grad_norm": 0.8408536904821221, "learning_rate": 8.746327760288129e-06, "loss": 0.3962335348129272, "num_input_tokens_seen": 218228736, "step": 6845, "train_runtime": 17933.1293, "train_tokens_per_second": 12169.027 }, { "epoch": 0.46121734446539187, "grad_norm": 0.8899269826641489, "learning_rate": 8.744576141095691e-06, "loss": 0.39309852123260497, "num_input_tokens_seen": 218385216, "step": 6850, "train_runtime": 17947.5304, "train_tokens_per_second": 12167.981 }, { "epoch": 0.461553999461352, "grad_norm": 0.7850798579701105, "learning_rate": 8.742823474744476e-06, "loss": 0.3981865406036377, "num_input_tokens_seen": 218542896, "step": 6855, "train_runtime": 17960.6226, "train_tokens_per_second": 12167.891 }, { "epoch": 0.46189065445731214, "grad_norm": 0.8890118580060308, "learning_rate": 8.74106976172461e-06, "loss": 0.4196115016937256, "num_input_tokens_seen": 218704176, "step": 6860, "train_runtime": 17973.0681, "train_tokens_per_second": 12168.439 }, { "epoch": 0.4622273094532723, "grad_norm": 0.8224090861959624, "learning_rate": 8.739315002526513e-06, "loss": 0.39695000648498535, "num_input_tokens_seen": 218865072, "step": 6865, "train_runtime": 17986.7731, "train_tokens_per_second": 12168.112 }, { "epoch": 0.4625639644492324, "grad_norm": 0.7164602207810157, "learning_rate": 8.737559197640902e-06, "loss": 0.36735970973968507, "num_input_tokens_seen": 219025624, "step": 6870, "train_runtime": 18000.1906, "train_tokens_per_second": 12167.961 }, { "epoch": 0.46290061944519256, "grad_norm": 0.8357823103032376, "learning_rate": 8.735802347558778e-06, "loss": 0.4234785079956055, "num_input_tokens_seen": 219181568, "step": 6875, "train_runtime": 18013.3505, "train_tokens_per_second": 12167.729 }, { "epoch": 0.4632372744411527, "grad_norm": 0.8309752476170185, "learning_rate": 8.734044452771442e-06, "loss": 0.38432772159576417, "num_input_tokens_seen": 219334728, "step": 6880, "train_runtime": 18025.8307, "train_tokens_per_second": 12167.801 }, { "epoch": 0.46357392943711284, "grad_norm": 0.8811580036900444, "learning_rate": 8.73228551377048e-06, "loss": 0.4391273021697998, "num_input_tokens_seen": 219493880, "step": 6885, "train_runtime": 18038.4519, "train_tokens_per_second": 12168.111 }, { "epoch": 0.463910584433073, "grad_norm": 0.7792481733734428, "learning_rate": 8.730525531047776e-06, "loss": 0.43122043609619143, "num_input_tokens_seen": 219654464, "step": 6890, "train_runtime": 18052.0699, "train_tokens_per_second": 12167.827 }, { "epoch": 0.4642472394290331, "grad_norm": 0.7476440147927917, "learning_rate": 8.728764505095503e-06, "loss": 0.40107998847961424, "num_input_tokens_seen": 219815544, "step": 6895, "train_runtime": 18064.9371, "train_tokens_per_second": 12168.077 }, { "epoch": 0.46458389442499326, "grad_norm": 0.7353933681022436, "learning_rate": 8.727002436406126e-06, "loss": 0.3747609853744507, "num_input_tokens_seen": 219979200, "step": 6900, "train_runtime": 18077.362, "train_tokens_per_second": 12168.767 }, { "epoch": 0.4649205494209534, "grad_norm": 0.7895603215904783, "learning_rate": 8.725239325472404e-06, "loss": 0.4177891731262207, "num_input_tokens_seen": 220139608, "step": 6905, "train_runtime": 18089.7798, "train_tokens_per_second": 12169.281 }, { "epoch": 0.46525720441691354, "grad_norm": 0.8021107552844692, "learning_rate": 8.723475172787381e-06, "loss": 0.3995223045349121, "num_input_tokens_seen": 220300208, "step": 6910, "train_runtime": 18102.6102, "train_tokens_per_second": 12169.527 }, { "epoch": 0.4655938594128737, "grad_norm": 0.9122128866486677, "learning_rate": 8.7217099788444e-06, "loss": 0.39371824264526367, "num_input_tokens_seen": 220461264, "step": 6915, "train_runtime": 18115.9139, "train_tokens_per_second": 12169.481 }, { "epoch": 0.4659305144088338, "grad_norm": 0.7737315036622889, "learning_rate": 8.719943744137091e-06, "loss": 0.39672868251800536, "num_input_tokens_seen": 220622360, "step": 6920, "train_runtime": 18128.7224, "train_tokens_per_second": 12169.769 }, { "epoch": 0.46626716940479396, "grad_norm": 0.7837743297102105, "learning_rate": 8.718176469159378e-06, "loss": 0.42811408042907717, "num_input_tokens_seen": 220785336, "step": 6925, "train_runtime": 18141.5243, "train_tokens_per_second": 12170.165 }, { "epoch": 0.4666038244007541, "grad_norm": 0.8511441920864125, "learning_rate": 8.716408154405469e-06, "loss": 0.3826107978820801, "num_input_tokens_seen": 220944312, "step": 6930, "train_runtime": 18154.6976, "train_tokens_per_second": 12170.09 }, { "epoch": 0.46694047939671424, "grad_norm": 1.1182358195891273, "learning_rate": 8.714638800369872e-06, "loss": 0.4499194145202637, "num_input_tokens_seen": 221095344, "step": 6935, "train_runtime": 18167.3442, "train_tokens_per_second": 12169.932 }, { "epoch": 0.4672771343926744, "grad_norm": 0.7239425685342206, "learning_rate": 8.712868407547378e-06, "loss": 0.41254420280456544, "num_input_tokens_seen": 221256952, "step": 6940, "train_runtime": 18180.5934, "train_tokens_per_second": 12169.952 }, { "epoch": 0.4676137893886345, "grad_norm": 0.8953238184350519, "learning_rate": 8.711096976433076e-06, "loss": 0.4014854431152344, "num_input_tokens_seen": 221419912, "step": 6945, "train_runtime": 18194.1087, "train_tokens_per_second": 12169.869 }, { "epoch": 0.46795044438459465, "grad_norm": 0.688036549653125, "learning_rate": 8.709324507522337e-06, "loss": 0.3690744400024414, "num_input_tokens_seen": 221581240, "step": 6950, "train_runtime": 18208.4558, "train_tokens_per_second": 12169.14 }, { "epoch": 0.4682870993805548, "grad_norm": 0.8439062836244687, "learning_rate": 8.707551001310828e-06, "loss": 0.3911032438278198, "num_input_tokens_seen": 221742400, "step": 6955, "train_runtime": 18220.923, "train_tokens_per_second": 12169.658 }, { "epoch": 0.46862375437651493, "grad_norm": 0.7958934368299119, "learning_rate": 8.705776458294503e-06, "loss": 0.38139638900756834, "num_input_tokens_seen": 221896080, "step": 6960, "train_runtime": 18233.9691, "train_tokens_per_second": 12169.379 }, { "epoch": 0.4689604093724751, "grad_norm": 0.7318534337550506, "learning_rate": 8.704000878969608e-06, "loss": 0.372223424911499, "num_input_tokens_seen": 222055360, "step": 6965, "train_runtime": 18248.2545, "train_tokens_per_second": 12168.581 }, { "epoch": 0.4692970643684352, "grad_norm": 0.7832820185939897, "learning_rate": 8.702224263832679e-06, "loss": 0.3828082799911499, "num_input_tokens_seen": 222218632, "step": 6970, "train_runtime": 18261.159, "train_tokens_per_second": 12168.923 }, { "epoch": 0.46963371936439535, "grad_norm": 0.8041866756514505, "learning_rate": 8.700446613380542e-06, "loss": 0.4333803653717041, "num_input_tokens_seen": 222382472, "step": 6975, "train_runtime": 18273.5743, "train_tokens_per_second": 12169.621 }, { "epoch": 0.4699703743603555, "grad_norm": 0.8351140006367409, "learning_rate": 8.698667928110307e-06, "loss": 0.37558832168579104, "num_input_tokens_seen": 222543544, "step": 6980, "train_runtime": 18286.0791, "train_tokens_per_second": 12170.107 }, { "epoch": 0.47030702935631563, "grad_norm": 1.0237851805051659, "learning_rate": 8.696888208519381e-06, "loss": 0.3982857227325439, "num_input_tokens_seen": 222700984, "step": 6985, "train_runtime": 18299.021, "train_tokens_per_second": 12170.104 }, { "epoch": 0.47064368435227577, "grad_norm": 0.7787491433474013, "learning_rate": 8.695107455105454e-06, "loss": 0.36977086067199705, "num_input_tokens_seen": 222856224, "step": 6990, "train_runtime": 18312.1219, "train_tokens_per_second": 12169.874 }, { "epoch": 0.4709803393482359, "grad_norm": 0.7720287118080041, "learning_rate": 8.693325668366513e-06, "loss": 0.40237860679626464, "num_input_tokens_seen": 223014120, "step": 6995, "train_runtime": 18325.4079, "train_tokens_per_second": 12169.667 }, { "epoch": 0.47131699434419605, "grad_norm": 0.879008593693964, "learning_rate": 8.691542848800825e-06, "loss": 0.4074204444885254, "num_input_tokens_seen": 223173984, "step": 7000, "train_runtime": 18338.2755, "train_tokens_per_second": 12169.846 }, { "epoch": 0.4716536493401562, "grad_norm": 0.9119760727659342, "learning_rate": 8.68975899690695e-06, "loss": 0.39657690525054934, "num_input_tokens_seen": 223335504, "step": 7005, "train_runtime": 18350.7771, "train_tokens_per_second": 12170.357 }, { "epoch": 0.47199030433611633, "grad_norm": 0.756123000198057, "learning_rate": 8.687974113183738e-06, "loss": 0.3958401679992676, "num_input_tokens_seen": 223498296, "step": 7010, "train_runtime": 18364.2103, "train_tokens_per_second": 12170.319 }, { "epoch": 0.47232695933207647, "grad_norm": 0.88566005211872, "learning_rate": 8.686188198130326e-06, "loss": 0.39900622367858884, "num_input_tokens_seen": 223658048, "step": 7015, "train_runtime": 18377.422, "train_tokens_per_second": 12170.262 }, { "epoch": 0.4726636143280366, "grad_norm": 0.7409509036889722, "learning_rate": 8.684401252246138e-06, "loss": 0.4031393527984619, "num_input_tokens_seen": 223821440, "step": 7020, "train_runtime": 18390.3747, "train_tokens_per_second": 12170.575 }, { "epoch": 0.47300026932399675, "grad_norm": 0.8413951860648937, "learning_rate": 8.68261327603089e-06, "loss": 0.4226849555969238, "num_input_tokens_seen": 223979960, "step": 7025, "train_runtime": 18404.0224, "train_tokens_per_second": 12170.163 }, { "epoch": 0.4733369243199569, "grad_norm": 0.9485066890931744, "learning_rate": 8.68082426998458e-06, "loss": 0.4254887580871582, "num_input_tokens_seen": 224143776, "step": 7030, "train_runtime": 18417.1362, "train_tokens_per_second": 12170.393 }, { "epoch": 0.473673579315917, "grad_norm": 0.7758108273203596, "learning_rate": 8.6790342346075e-06, "loss": 0.3716390609741211, "num_input_tokens_seen": 224298384, "step": 7035, "train_runtime": 18429.7502, "train_tokens_per_second": 12170.452 }, { "epoch": 0.47401023431187717, "grad_norm": 0.6717080586827616, "learning_rate": 8.677243170400228e-06, "loss": 0.37898454666137693, "num_input_tokens_seen": 224452768, "step": 7040, "train_runtime": 18442.3614, "train_tokens_per_second": 12170.5 }, { "epoch": 0.4743468893078373, "grad_norm": 0.7943940524806025, "learning_rate": 8.675451077863632e-06, "loss": 0.3969534397125244, "num_input_tokens_seen": 224608128, "step": 7045, "train_runtime": 18455.5512, "train_tokens_per_second": 12170.22 }, { "epoch": 0.47468354430379744, "grad_norm": 0.7793871640043072, "learning_rate": 8.67365795749886e-06, "loss": 0.3900038719177246, "num_input_tokens_seen": 224763912, "step": 7050, "train_runtime": 18468.2248, "train_tokens_per_second": 12170.304 }, { "epoch": 0.4750201992997576, "grad_norm": 0.792065481304858, "learning_rate": 8.671863809807355e-06, "loss": 0.35427536964416506, "num_input_tokens_seen": 224918960, "step": 7055, "train_runtime": 18481.5992, "train_tokens_per_second": 12169.886 }, { "epoch": 0.4753568542957177, "grad_norm": 0.7833904992101803, "learning_rate": 8.670068635290844e-06, "loss": 0.3800031661987305, "num_input_tokens_seen": 225078712, "step": 7060, "train_runtime": 18494.7178, "train_tokens_per_second": 12169.892 }, { "epoch": 0.47569350929167786, "grad_norm": 0.7486941563825608, "learning_rate": 8.668272434451343e-06, "loss": 0.37044103145599366, "num_input_tokens_seen": 225237856, "step": 7065, "train_runtime": 18507.6596, "train_tokens_per_second": 12169.98 }, { "epoch": 0.476030164287638, "grad_norm": 0.7973969961446149, "learning_rate": 8.666475207791154e-06, "loss": 0.4061105251312256, "num_input_tokens_seen": 225391400, "step": 7070, "train_runtime": 18521.0431, "train_tokens_per_second": 12169.477 }, { "epoch": 0.47636681928359814, "grad_norm": 0.7056974726052286, "learning_rate": 8.664676955812863e-06, "loss": 0.3848630428314209, "num_input_tokens_seen": 225554232, "step": 7075, "train_runtime": 18534.772, "train_tokens_per_second": 12169.248 }, { "epoch": 0.4767034742795583, "grad_norm": 0.8314253905216896, "learning_rate": 8.662877679019348e-06, "loss": 0.3976008892059326, "num_input_tokens_seen": 225714616, "step": 7080, "train_runtime": 18547.9962, "train_tokens_per_second": 12169.218 }, { "epoch": 0.4770401292755185, "grad_norm": 0.8089730595552718, "learning_rate": 8.66107737791377e-06, "loss": 0.4049996376037598, "num_input_tokens_seen": 225877832, "step": 7085, "train_runtime": 18561.6135, "train_tokens_per_second": 12169.084 }, { "epoch": 0.4773767842714786, "grad_norm": 0.8280415165088731, "learning_rate": 8.659276052999574e-06, "loss": 0.36771228313446047, "num_input_tokens_seen": 226029392, "step": 7090, "train_runtime": 18574.4947, "train_tokens_per_second": 12168.804 }, { "epoch": 0.47771343926743876, "grad_norm": 0.7937245006086171, "learning_rate": 8.657473704780504e-06, "loss": 0.4083720684051514, "num_input_tokens_seen": 226182576, "step": 7095, "train_runtime": 18587.1866, "train_tokens_per_second": 12168.737 }, { "epoch": 0.4780500942633989, "grad_norm": 0.8082274828008125, "learning_rate": 8.65567033376057e-06, "loss": 0.38915488719940183, "num_input_tokens_seen": 226342936, "step": 7100, "train_runtime": 18600.0812, "train_tokens_per_second": 12168.922 }, { "epoch": 0.47838674925935903, "grad_norm": 0.721123867877659, "learning_rate": 8.65386594044409e-06, "loss": 0.4009056091308594, "num_input_tokens_seen": 226502536, "step": 7105, "train_runtime": 18612.9093, "train_tokens_per_second": 12169.11 }, { "epoch": 0.4787234042553192, "grad_norm": 0.7851747833802771, "learning_rate": 8.652060525335647e-06, "loss": 0.35300569534301757, "num_input_tokens_seen": 226658496, "step": 7110, "train_runtime": 18626.3958, "train_tokens_per_second": 12168.672 }, { "epoch": 0.4790600592512793, "grad_norm": 0.7367297018516998, "learning_rate": 8.650254088940125e-06, "loss": 0.39135017395019533, "num_input_tokens_seen": 226812312, "step": 7115, "train_runtime": 18639.6761, "train_tokens_per_second": 12168.254 }, { "epoch": 0.47939671424723945, "grad_norm": 0.7889127972539557, "learning_rate": 8.648446631762686e-06, "loss": 0.4005890846252441, "num_input_tokens_seen": 226967840, "step": 7120, "train_runtime": 18653.5656, "train_tokens_per_second": 12167.531 }, { "epoch": 0.4797333692431996, "grad_norm": 0.7652681758015323, "learning_rate": 8.646638154308781e-06, "loss": 0.3942344427108765, "num_input_tokens_seen": 227125008, "step": 7125, "train_runtime": 18667.1049, "train_tokens_per_second": 12167.125 }, { "epoch": 0.48007002423915973, "grad_norm": 0.7235084190604785, "learning_rate": 8.644828657084144e-06, "loss": 0.359389591217041, "num_input_tokens_seen": 227286280, "step": 7130, "train_runtime": 18680.2392, "train_tokens_per_second": 12167.204 }, { "epoch": 0.48040667923511987, "grad_norm": 0.7522643507653209, "learning_rate": 8.643018140594797e-06, "loss": 0.3650181293487549, "num_input_tokens_seen": 227440440, "step": 7135, "train_runtime": 18692.8213, "train_tokens_per_second": 12167.261 }, { "epoch": 0.48074333423108, "grad_norm": 0.6960712285977015, "learning_rate": 8.641206605347042e-06, "loss": 0.3616954326629639, "num_input_tokens_seen": 227602432, "step": 7140, "train_runtime": 18705.9285, "train_tokens_per_second": 12167.396 }, { "epoch": 0.48107998922704015, "grad_norm": 1.0043484290836913, "learning_rate": 8.639394051847472e-06, "loss": 0.37091000080108644, "num_input_tokens_seen": 227759264, "step": 7145, "train_runtime": 18719.1006, "train_tokens_per_second": 12167.212 }, { "epoch": 0.4814166442230003, "grad_norm": 1.219247047591243, "learning_rate": 8.63758048060296e-06, "loss": 0.3871778964996338, "num_input_tokens_seen": 227917840, "step": 7150, "train_runtime": 18732.4163, "train_tokens_per_second": 12167.028 }, { "epoch": 0.48175329921896043, "grad_norm": 0.8263739399318326, "learning_rate": 8.635765892120666e-06, "loss": 0.3666724681854248, "num_input_tokens_seen": 228081680, "step": 7155, "train_runtime": 18744.8474, "train_tokens_per_second": 12167.7 }, { "epoch": 0.48208995421492057, "grad_norm": 0.9342396606059361, "learning_rate": 8.633950286908032e-06, "loss": 0.3934246778488159, "num_input_tokens_seen": 228237752, "step": 7160, "train_runtime": 18757.3623, "train_tokens_per_second": 12167.902 }, { "epoch": 0.4824266092108807, "grad_norm": 0.9580504896372071, "learning_rate": 8.63213366547279e-06, "loss": 0.4105491638183594, "num_input_tokens_seen": 228393320, "step": 7165, "train_runtime": 18770.8746, "train_tokens_per_second": 12167.431 }, { "epoch": 0.48276326420684085, "grad_norm": 0.8545310829644184, "learning_rate": 8.630316028322952e-06, "loss": 0.37929890155792234, "num_input_tokens_seen": 228554080, "step": 7170, "train_runtime": 18784.9313, "train_tokens_per_second": 12166.884 }, { "epoch": 0.483099919202801, "grad_norm": 0.8392666194219107, "learning_rate": 8.628497375966811e-06, "loss": 0.36797289848327636, "num_input_tokens_seen": 228717160, "step": 7175, "train_runtime": 18797.4019, "train_tokens_per_second": 12167.488 }, { "epoch": 0.4834365741987611, "grad_norm": 0.8238488351186392, "learning_rate": 8.62667770891295e-06, "loss": 0.4252311706542969, "num_input_tokens_seen": 228881000, "step": 7180, "train_runtime": 18809.8453, "train_tokens_per_second": 12168.149 }, { "epoch": 0.48377322919472127, "grad_norm": 0.6629076604492486, "learning_rate": 8.624857027670232e-06, "loss": 0.3757671356201172, "num_input_tokens_seen": 229042536, "step": 7185, "train_runtime": 18822.3237, "train_tokens_per_second": 12168.664 }, { "epoch": 0.4841098841906814, "grad_norm": 0.6925496567965691, "learning_rate": 8.623035332747804e-06, "loss": 0.4328261375427246, "num_input_tokens_seen": 229196680, "step": 7190, "train_runtime": 18835.575, "train_tokens_per_second": 12168.287 }, { "epoch": 0.48444653918664154, "grad_norm": 0.828165661281709, "learning_rate": 8.6212126246551e-06, "loss": 0.36807425022125245, "num_input_tokens_seen": 229350936, "step": 7195, "train_runtime": 18849.1423, "train_tokens_per_second": 12167.712 }, { "epoch": 0.4847831941826017, "grad_norm": 0.7725903396363935, "learning_rate": 8.619388903901833e-06, "loss": 0.393758487701416, "num_input_tokens_seen": 229510128, "step": 7200, "train_runtime": 18862.1802, "train_tokens_per_second": 12167.741 }, { "epoch": 0.4851198491785618, "grad_norm": 0.8423500182531545, "learning_rate": 8.617564170997998e-06, "loss": 0.38716416358947753, "num_input_tokens_seen": 229672152, "step": 7205, "train_runtime": 18875.0092, "train_tokens_per_second": 12168.055 }, { "epoch": 0.48545650417452196, "grad_norm": 0.7308449425619794, "learning_rate": 8.61573842645388e-06, "loss": 0.4164746761322021, "num_input_tokens_seen": 229833528, "step": 7210, "train_runtime": 18887.9124, "train_tokens_per_second": 12168.286 }, { "epoch": 0.4857931591704821, "grad_norm": 0.7793960754097168, "learning_rate": 8.61391167078004e-06, "loss": 0.39917917251586915, "num_input_tokens_seen": 229997072, "step": 7215, "train_runtime": 18901.6131, "train_tokens_per_second": 12168.119 }, { "epoch": 0.48612981416644224, "grad_norm": 0.8451245235723249, "learning_rate": 8.612083904487324e-06, "loss": 0.4313366889953613, "num_input_tokens_seen": 230156376, "step": 7220, "train_runtime": 18915.6258, "train_tokens_per_second": 12167.526 }, { "epoch": 0.4864664691624024, "grad_norm": 0.8521695692081358, "learning_rate": 8.610255128086867e-06, "loss": 0.40326638221740724, "num_input_tokens_seen": 230313304, "step": 7225, "train_runtime": 18929.7858, "train_tokens_per_second": 12166.715 }, { "epoch": 0.4868031241583625, "grad_norm": 0.8050386510678731, "learning_rate": 8.60842534209007e-06, "loss": 0.39557466506958006, "num_input_tokens_seen": 230475720, "step": 7230, "train_runtime": 18942.2481, "train_tokens_per_second": 12167.284 }, { "epoch": 0.48713977915432266, "grad_norm": 0.8082307432870961, "learning_rate": 8.606594547008636e-06, "loss": 0.35011341571807864, "num_input_tokens_seen": 230632600, "step": 7235, "train_runtime": 18954.7226, "train_tokens_per_second": 12167.553 }, { "epoch": 0.4874764341502828, "grad_norm": 1.0017943008042627, "learning_rate": 8.604762743354536e-06, "loss": 0.40049118995666505, "num_input_tokens_seen": 230796440, "step": 7240, "train_runtime": 18967.1762, "train_tokens_per_second": 12168.202 }, { "epoch": 0.48781308914624294, "grad_norm": 0.7981797628269263, "learning_rate": 8.602929931640029e-06, "loss": 0.41891989707946775, "num_input_tokens_seen": 230952464, "step": 7245, "train_runtime": 18981.4591, "train_tokens_per_second": 12167.266 }, { "epoch": 0.4881497441422031, "grad_norm": 0.9095281408060589, "learning_rate": 8.601096112377659e-06, "loss": 0.4262809753417969, "num_input_tokens_seen": 231109384, "step": 7250, "train_runtime": 18994.0573, "train_tokens_per_second": 12167.457 }, { "epoch": 0.4884863991381632, "grad_norm": 0.7643689769995177, "learning_rate": 8.59926128608024e-06, "loss": 0.38933048248291013, "num_input_tokens_seen": 231269392, "step": 7255, "train_runtime": 19006.7388, "train_tokens_per_second": 12167.758 }, { "epoch": 0.48882305413412336, "grad_norm": 0.7592561526267536, "learning_rate": 8.597425453260881e-06, "loss": 0.38649346828460696, "num_input_tokens_seen": 231424080, "step": 7260, "train_runtime": 19019.8184, "train_tokens_per_second": 12167.523 }, { "epoch": 0.4891597091300835, "grad_norm": 0.7925823797575888, "learning_rate": 8.595588614432967e-06, "loss": 0.38105430603027346, "num_input_tokens_seen": 231577080, "step": 7265, "train_runtime": 19032.8116, "train_tokens_per_second": 12167.255 }, { "epoch": 0.48949636412604364, "grad_norm": 0.7428295823783329, "learning_rate": 8.59375077011016e-06, "loss": 0.3714127540588379, "num_input_tokens_seen": 231740040, "step": 7270, "train_runtime": 19045.6479, "train_tokens_per_second": 12167.611 }, { "epoch": 0.4898330191220038, "grad_norm": 0.8435109599364333, "learning_rate": 8.591911920806412e-06, "loss": 0.4041157245635986, "num_input_tokens_seen": 231902720, "step": 7275, "train_runtime": 19058.3506, "train_tokens_per_second": 12168.037 }, { "epoch": 0.4901696741179639, "grad_norm": 0.8322023688385077, "learning_rate": 8.590072067035947e-06, "loss": 0.4000819206237793, "num_input_tokens_seen": 232064472, "step": 7280, "train_runtime": 19071.5335, "train_tokens_per_second": 12168.108 }, { "epoch": 0.49050632911392406, "grad_norm": 0.745203809756682, "learning_rate": 8.588231209313278e-06, "loss": 0.3859596252441406, "num_input_tokens_seen": 232228312, "step": 7285, "train_runtime": 19083.9793, "train_tokens_per_second": 12168.757 }, { "epoch": 0.4908429841098842, "grad_norm": 0.9308728658219169, "learning_rate": 8.586389348153192e-06, "loss": 0.3805895566940308, "num_input_tokens_seen": 232386608, "step": 7290, "train_runtime": 19097.3855, "train_tokens_per_second": 12168.504 }, { "epoch": 0.49117963910584433, "grad_norm": 0.8355659832138728, "learning_rate": 8.584546484070762e-06, "loss": 0.39642109870910647, "num_input_tokens_seen": 232545848, "step": 7295, "train_runtime": 19110.2701, "train_tokens_per_second": 12168.632 }, { "epoch": 0.4915162941018045, "grad_norm": 0.8025104909986821, "learning_rate": 8.582702617581338e-06, "loss": 0.3807774543762207, "num_input_tokens_seen": 232708040, "step": 7300, "train_runtime": 19124.206, "train_tokens_per_second": 12168.246 }, { "epoch": 0.4918529490977646, "grad_norm": 0.829236226042725, "learning_rate": 8.58085774920055e-06, "loss": 0.3820274829864502, "num_input_tokens_seen": 232863752, "step": 7305, "train_runtime": 19137.4555, "train_tokens_per_second": 12167.958 }, { "epoch": 0.49218960409372475, "grad_norm": 0.8240924008864927, "learning_rate": 8.579011879444313e-06, "loss": 0.43933906555175783, "num_input_tokens_seen": 233027224, "step": 7310, "train_runtime": 19150.7035, "train_tokens_per_second": 12168.076 }, { "epoch": 0.4925262590896849, "grad_norm": 0.7568917401896091, "learning_rate": 8.577165008828817e-06, "loss": 0.36581594944000245, "num_input_tokens_seen": 233182440, "step": 7315, "train_runtime": 19164.479, "train_tokens_per_second": 12167.429 }, { "epoch": 0.49286291408564503, "grad_norm": 0.8032131779692756, "learning_rate": 8.57531713787053e-06, "loss": 0.39217257499694824, "num_input_tokens_seen": 233336664, "step": 7320, "train_runtime": 19177.6754, "train_tokens_per_second": 12167.098 }, { "epoch": 0.49319956908160517, "grad_norm": 0.8942793216104644, "learning_rate": 8.573468267086208e-06, "loss": 0.3723256826400757, "num_input_tokens_seen": 233495256, "step": 7325, "train_runtime": 19190.9738, "train_tokens_per_second": 12166.931 }, { "epoch": 0.4935362240775653, "grad_norm": 0.7747893411559189, "learning_rate": 8.57161839699288e-06, "loss": 0.371173357963562, "num_input_tokens_seen": 233656224, "step": 7330, "train_runtime": 19204.4715, "train_tokens_per_second": 12166.762 }, { "epoch": 0.49387287907352545, "grad_norm": 0.9068913623850248, "learning_rate": 8.569767528107857e-06, "loss": 0.3850739002227783, "num_input_tokens_seen": 233814584, "step": 7335, "train_runtime": 19217.1072, "train_tokens_per_second": 12167.002 }, { "epoch": 0.4942095340694856, "grad_norm": 0.7385027125017917, "learning_rate": 8.567915660948727e-06, "loss": 0.37473487854003906, "num_input_tokens_seen": 233973864, "step": 7340, "train_runtime": 19229.6046, "train_tokens_per_second": 12167.378 }, { "epoch": 0.49454618906544573, "grad_norm": 0.824237938872014, "learning_rate": 8.566062796033358e-06, "loss": 0.41674509048461916, "num_input_tokens_seen": 234132952, "step": 7345, "train_runtime": 19242.5975, "train_tokens_per_second": 12167.43 }, { "epoch": 0.49488284406140587, "grad_norm": 0.8680983633290126, "learning_rate": 8.564208933879903e-06, "loss": 0.3666702747344971, "num_input_tokens_seen": 234286280, "step": 7350, "train_runtime": 19255.0868, "train_tokens_per_second": 12167.501 }, { "epoch": 0.495219499057366, "grad_norm": 0.7612132445523104, "learning_rate": 8.562354075006782e-06, "loss": 0.360690975189209, "num_input_tokens_seen": 234446784, "step": 7355, "train_runtime": 19269.2341, "train_tokens_per_second": 12166.897 }, { "epoch": 0.49555615405332615, "grad_norm": 0.802037477303204, "learning_rate": 8.560498219932706e-06, "loss": 0.4306445598602295, "num_input_tokens_seen": 234607880, "step": 7360, "train_runtime": 19282.9528, "train_tokens_per_second": 12166.595 }, { "epoch": 0.4958928090492863, "grad_norm": 0.742109746389664, "learning_rate": 8.558641369176654e-06, "loss": 0.32950568199157715, "num_input_tokens_seen": 234762864, "step": 7365, "train_runtime": 19296.163, "train_tokens_per_second": 12166.298 }, { "epoch": 0.4962294640452464, "grad_norm": 0.9235646081545151, "learning_rate": 8.556783523257892e-06, "loss": 0.40966596603393557, "num_input_tokens_seen": 234920088, "step": 7370, "train_runtime": 19309.0039, "train_tokens_per_second": 12166.349 }, { "epoch": 0.49656611904120657, "grad_norm": 0.7244504718388206, "learning_rate": 8.554924682695959e-06, "loss": 0.3682614803314209, "num_input_tokens_seen": 235075224, "step": 7375, "train_runtime": 19322.4372, "train_tokens_per_second": 12165.92 }, { "epoch": 0.4969027740371667, "grad_norm": 0.7768787755664207, "learning_rate": 8.553064848010677e-06, "loss": 0.4121041774749756, "num_input_tokens_seen": 235231432, "step": 7380, "train_runtime": 19336.0195, "train_tokens_per_second": 12165.453 }, { "epoch": 0.49723942903312685, "grad_norm": 0.7685923527523802, "learning_rate": 8.551204019722137e-06, "loss": 0.3862525701522827, "num_input_tokens_seen": 235387816, "step": 7385, "train_runtime": 19348.6684, "train_tokens_per_second": 12165.582 }, { "epoch": 0.497576084029087, "grad_norm": 0.9050937914697457, "learning_rate": 8.549342198350718e-06, "loss": 0.4252310752868652, "num_input_tokens_seen": 235548672, "step": 7390, "train_runtime": 19361.527, "train_tokens_per_second": 12165.811 }, { "epoch": 0.4979127390250471, "grad_norm": 0.7720720987560661, "learning_rate": 8.54747938441707e-06, "loss": 0.37248151302337645, "num_input_tokens_seen": 235709512, "step": 7395, "train_runtime": 19375.1405, "train_tokens_per_second": 12165.564 }, { "epoch": 0.49824939402100726, "grad_norm": 0.8291025850724041, "learning_rate": 8.545615578442126e-06, "loss": 0.36538872718811033, "num_input_tokens_seen": 235870312, "step": 7400, "train_runtime": 19388.0634, "train_tokens_per_second": 12165.749 }, { "epoch": 0.4985860490169674, "grad_norm": 0.910963815850178, "learning_rate": 8.54375078094709e-06, "loss": 0.37861878871917726, "num_input_tokens_seen": 236028208, "step": 7405, "train_runtime": 19400.6204, "train_tokens_per_second": 12166.013 }, { "epoch": 0.49892270401292754, "grad_norm": 0.7748510620627111, "learning_rate": 8.541884992453449e-06, "loss": 0.37966189384460447, "num_input_tokens_seen": 236188904, "step": 7410, "train_runtime": 19413.4046, "train_tokens_per_second": 12166.279 }, { "epoch": 0.4992593590088877, "grad_norm": 0.7848473061975617, "learning_rate": 8.540018213482966e-06, "loss": 0.40282344818115234, "num_input_tokens_seen": 236351696, "step": 7415, "train_runtime": 19426.1495, "train_tokens_per_second": 12166.677 }, { "epoch": 0.4995960140048478, "grad_norm": 0.7683440760802511, "learning_rate": 8.538150444557676e-06, "loss": 0.38904709815979005, "num_input_tokens_seen": 236508368, "step": 7420, "train_runtime": 19439.6034, "train_tokens_per_second": 12166.317 }, { "epoch": 0.49993266900080796, "grad_norm": 0.902781369044073, "learning_rate": 8.536281686199896e-06, "loss": 0.39225544929504397, "num_input_tokens_seen": 236667672, "step": 7425, "train_runtime": 19452.0455, "train_tokens_per_second": 12166.724 }, { "epoch": 0.5002693239967682, "grad_norm": 0.7970050827980126, "learning_rate": 8.534411938932218e-06, "loss": 0.38663678169250487, "num_input_tokens_seen": 236827488, "step": 7430, "train_runtime": 19464.4942, "train_tokens_per_second": 12167.153 }, { "epoch": 0.5006059789927283, "grad_norm": 0.7669132812395764, "learning_rate": 8.532541203277515e-06, "loss": 0.36896088123321535, "num_input_tokens_seen": 236988456, "step": 7435, "train_runtime": 19477.6134, "train_tokens_per_second": 12167.223 }, { "epoch": 0.5009426339886884, "grad_norm": 0.8878355004903203, "learning_rate": 8.530669479758926e-06, "loss": 0.3835675001144409, "num_input_tokens_seen": 237148488, "step": 7440, "train_runtime": 19490.297, "train_tokens_per_second": 12167.515 }, { "epoch": 0.5012792889846486, "grad_norm": 0.8489847968410151, "learning_rate": 8.528796768899878e-06, "loss": 0.38852581977844236, "num_input_tokens_seen": 237303120, "step": 7445, "train_runtime": 19503.635, "train_tokens_per_second": 12167.123 }, { "epoch": 0.5016159439806087, "grad_norm": 0.7422409117601764, "learning_rate": 8.526923071224064e-06, "loss": 0.3939798355102539, "num_input_tokens_seen": 237464112, "step": 7450, "train_runtime": 19517.2973, "train_tokens_per_second": 12166.854 }, { "epoch": 0.5019525989765689, "grad_norm": 0.7608285116002562, "learning_rate": 8.525048387255461e-06, "loss": 0.4041768550872803, "num_input_tokens_seen": 237626928, "step": 7455, "train_runtime": 19529.9549, "train_tokens_per_second": 12167.305 }, { "epoch": 0.502289253972529, "grad_norm": 0.8380333530892272, "learning_rate": 8.523172717518315e-06, "loss": 0.3676736354827881, "num_input_tokens_seen": 237783856, "step": 7460, "train_runtime": 19542.9495, "train_tokens_per_second": 12167.245 }, { "epoch": 0.5026259089684891, "grad_norm": 0.8189479656433616, "learning_rate": 8.521296062537156e-06, "loss": 0.389082670211792, "num_input_tokens_seen": 237943672, "step": 7465, "train_runtime": 19556.3916, "train_tokens_per_second": 12167.054 }, { "epoch": 0.5029625639644493, "grad_norm": 0.9315388775794754, "learning_rate": 8.51941842283678e-06, "loss": 0.3850302457809448, "num_input_tokens_seen": 238101752, "step": 7470, "train_runtime": 19570.342, "train_tokens_per_second": 12166.458 }, { "epoch": 0.5032992189604094, "grad_norm": 0.8967299187583033, "learning_rate": 8.517539798942265e-06, "loss": 0.38015069961547854, "num_input_tokens_seen": 238262696, "step": 7475, "train_runtime": 19583.1735, "train_tokens_per_second": 12166.705 }, { "epoch": 0.5036358739563696, "grad_norm": 0.7083454489790483, "learning_rate": 8.515660191378962e-06, "loss": 0.3841752529144287, "num_input_tokens_seen": 238423472, "step": 7480, "train_runtime": 19596.3601, "train_tokens_per_second": 12166.722 }, { "epoch": 0.5039725289523297, "grad_norm": 0.8069264290032326, "learning_rate": 8.513779600672495e-06, "loss": 0.3637341022491455, "num_input_tokens_seen": 238586368, "step": 7485, "train_runtime": 19609.8881, "train_tokens_per_second": 12166.636 }, { "epoch": 0.5043091839482898, "grad_norm": 0.7564689029445455, "learning_rate": 8.511898027348771e-06, "loss": 0.3830281734466553, "num_input_tokens_seen": 238739184, "step": 7490, "train_runtime": 19623.3643, "train_tokens_per_second": 12166.068 }, { "epoch": 0.50464583894425, "grad_norm": 0.7794347900353182, "learning_rate": 8.51001547193396e-06, "loss": 0.37814195156097413, "num_input_tokens_seen": 238899384, "step": 7495, "train_runtime": 19636.1538, "train_tokens_per_second": 12166.302 }, { "epoch": 0.5049824939402101, "grad_norm": 0.8619149041371794, "learning_rate": 8.508131934954515e-06, "loss": 0.37680203914642335, "num_input_tokens_seen": 239053992, "step": 7500, "train_runtime": 19648.6489, "train_tokens_per_second": 12166.434 }, { "epoch": 0.5053191489361702, "grad_norm": 0.8338488966440819, "learning_rate": 8.50624741693716e-06, "loss": 0.39595775604248046, "num_input_tokens_seen": 239208000, "step": 7505, "train_runtime": 19661.908, "train_tokens_per_second": 12166.062 }, { "epoch": 0.5056558039321304, "grad_norm": 0.9679525675145325, "learning_rate": 8.5043619184089e-06, "loss": 0.4429058074951172, "num_input_tokens_seen": 239365952, "step": 7510, "train_runtime": 19674.7092, "train_tokens_per_second": 12166.175 }, { "epoch": 0.5059924589280905, "grad_norm": 0.8648709784716618, "learning_rate": 8.502475439897e-06, "loss": 0.4197493553161621, "num_input_tokens_seen": 239526976, "step": 7515, "train_runtime": 19688.2169, "train_tokens_per_second": 12166.007 }, { "epoch": 0.5063291139240507, "grad_norm": 0.6912066851641233, "learning_rate": 8.500587981929013e-06, "loss": 0.3921358585357666, "num_input_tokens_seen": 239685984, "step": 7520, "train_runtime": 19701.1855, "train_tokens_per_second": 12166.069 }, { "epoch": 0.5066657689200108, "grad_norm": 0.8549956604670848, "learning_rate": 8.498699545032758e-06, "loss": 0.3827868938446045, "num_input_tokens_seen": 239846936, "step": 7525, "train_runtime": 19713.6453, "train_tokens_per_second": 12166.544 }, { "epoch": 0.507002423915971, "grad_norm": 0.7730257566710779, "learning_rate": 8.496810129736334e-06, "loss": 0.4004085063934326, "num_input_tokens_seen": 240009304, "step": 7530, "train_runtime": 19726.9965, "train_tokens_per_second": 12166.541 }, { "epoch": 0.5073390789119311, "grad_norm": 0.8578613508801158, "learning_rate": 8.494919736568105e-06, "loss": 0.3898079633712769, "num_input_tokens_seen": 240166072, "step": 7535, "train_runtime": 19739.9661, "train_tokens_per_second": 12166.489 }, { "epoch": 0.5076757339078912, "grad_norm": 0.8847458062741189, "learning_rate": 8.49302836605672e-06, "loss": 0.3955669403076172, "num_input_tokens_seen": 240329200, "step": 7540, "train_runtime": 19753.5471, "train_tokens_per_second": 12166.382 }, { "epoch": 0.5080123889038514, "grad_norm": 0.7306983596069232, "learning_rate": 8.491136018731088e-06, "loss": 0.377892804145813, "num_input_tokens_seen": 240491352, "step": 7545, "train_runtime": 19766.2004, "train_tokens_per_second": 12166.797 }, { "epoch": 0.5083490438998115, "grad_norm": 0.8312924055029284, "learning_rate": 8.4892426951204e-06, "loss": 0.37731308937072755, "num_input_tokens_seen": 240648120, "step": 7550, "train_runtime": 19778.9615, "train_tokens_per_second": 12166.873 }, { "epoch": 0.5086856988957716, "grad_norm": 0.762426867682343, "learning_rate": 8.48734839575412e-06, "loss": 0.3856975078582764, "num_input_tokens_seen": 240808192, "step": 7555, "train_runtime": 19791.5374, "train_tokens_per_second": 12167.23 }, { "epoch": 0.5090223538917318, "grad_norm": 0.7172912578935791, "learning_rate": 8.485453121161983e-06, "loss": 0.3787505626678467, "num_input_tokens_seen": 240969544, "step": 7560, "train_runtime": 19803.9573, "train_tokens_per_second": 12167.747 }, { "epoch": 0.5093590088876919, "grad_norm": 0.9498827879975054, "learning_rate": 8.483556871873993e-06, "loss": 0.44745187759399413, "num_input_tokens_seen": 241126864, "step": 7565, "train_runtime": 19816.4176, "train_tokens_per_second": 12168.035 }, { "epoch": 0.5096956638836521, "grad_norm": 0.7758613005293536, "learning_rate": 8.481659648420433e-06, "loss": 0.394504714012146, "num_input_tokens_seen": 241289048, "step": 7570, "train_runtime": 19829.6676, "train_tokens_per_second": 12168.083 }, { "epoch": 0.5100323188796122, "grad_norm": 0.8266814657366572, "learning_rate": 8.479761451331855e-06, "loss": 0.3816620588302612, "num_input_tokens_seen": 241439040, "step": 7575, "train_runtime": 19843.4902, "train_tokens_per_second": 12167.166 }, { "epoch": 0.5103689738755723, "grad_norm": 1.0558269134572658, "learning_rate": 8.477862281139082e-06, "loss": 0.3548101902008057, "num_input_tokens_seen": 241601992, "step": 7580, "train_runtime": 19856.9542, "train_tokens_per_second": 12167.122 }, { "epoch": 0.5107056288715325, "grad_norm": 0.9328783809010911, "learning_rate": 8.475962138373212e-06, "loss": 0.4315321445465088, "num_input_tokens_seen": 241754552, "step": 7585, "train_runtime": 19870.1777, "train_tokens_per_second": 12166.703 }, { "epoch": 0.5110422838674926, "grad_norm": 0.8412357848336036, "learning_rate": 8.474061023565614e-06, "loss": 0.39973859786987304, "num_input_tokens_seen": 241914200, "step": 7590, "train_runtime": 19882.949, "train_tokens_per_second": 12166.917 }, { "epoch": 0.5113789388634528, "grad_norm": 0.7726466280220472, "learning_rate": 8.472158937247931e-06, "loss": 0.41996207237243655, "num_input_tokens_seen": 242074056, "step": 7595, "train_runtime": 19896.7215, "train_tokens_per_second": 12166.53 }, { "epoch": 0.5117155938594129, "grad_norm": 0.8497524440338405, "learning_rate": 8.47025587995207e-06, "loss": 0.3897047758102417, "num_input_tokens_seen": 242229744, "step": 7600, "train_runtime": 19909.1637, "train_tokens_per_second": 12166.746 }, { "epoch": 0.512052248855373, "grad_norm": 0.8792368480569257, "learning_rate": 8.46835185221022e-06, "loss": 0.3975832939147949, "num_input_tokens_seen": 242385768, "step": 7605, "train_runtime": 19921.7492, "train_tokens_per_second": 12166.892 }, { "epoch": 0.5123889038513332, "grad_norm": 0.8754946329275609, "learning_rate": 8.466446854554835e-06, "loss": 0.36615700721740724, "num_input_tokens_seen": 242540456, "step": 7610, "train_runtime": 19934.5433, "train_tokens_per_second": 12166.843 }, { "epoch": 0.5127255588472933, "grad_norm": 0.7136502747491608, "learning_rate": 8.464540887518638e-06, "loss": 0.37505927085876467, "num_input_tokens_seen": 242696552, "step": 7615, "train_runtime": 19947.1594, "train_tokens_per_second": 12166.973 }, { "epoch": 0.5130622138432535, "grad_norm": 0.7829888877987689, "learning_rate": 8.462633951634631e-06, "loss": 0.3695961952209473, "num_input_tokens_seen": 242857896, "step": 7620, "train_runtime": 19960.4643, "train_tokens_per_second": 12166.946 }, { "epoch": 0.5133988688392136, "grad_norm": 0.7068907817328869, "learning_rate": 8.46072604743608e-06, "loss": 0.3502632141113281, "num_input_tokens_seen": 243016816, "step": 7625, "train_runtime": 19973.9017, "train_tokens_per_second": 12166.717 }, { "epoch": 0.5137355238351737, "grad_norm": 0.8506792473687397, "learning_rate": 8.458817175456528e-06, "loss": 0.40693235397338867, "num_input_tokens_seen": 243174048, "step": 7630, "train_runtime": 19987.1906, "train_tokens_per_second": 12166.495 }, { "epoch": 0.5140721788311339, "grad_norm": 0.8127883060542206, "learning_rate": 8.45690733622978e-06, "loss": 0.37832767963409425, "num_input_tokens_seen": 243333912, "step": 7635, "train_runtime": 19999.6168, "train_tokens_per_second": 12166.929 }, { "epoch": 0.514408833827094, "grad_norm": 0.8968057976755485, "learning_rate": 8.45499653028992e-06, "loss": 0.3742717981338501, "num_input_tokens_seen": 243493224, "step": 7640, "train_runtime": 20012.9478, "train_tokens_per_second": 12166.785 }, { "epoch": 0.5147454888230542, "grad_norm": 0.7569776972548438, "learning_rate": 8.453084758171297e-06, "loss": 0.3892237663269043, "num_input_tokens_seen": 243654280, "step": 7645, "train_runtime": 20025.4141, "train_tokens_per_second": 12167.253 }, { "epoch": 0.5150821438190143, "grad_norm": 0.778873899046102, "learning_rate": 8.451172020408532e-06, "loss": 0.39396061897277834, "num_input_tokens_seen": 243813424, "step": 7650, "train_runtime": 20038.4698, "train_tokens_per_second": 12167.268 }, { "epoch": 0.5154187988149744, "grad_norm": 0.7767233641799279, "learning_rate": 8.449258317536517e-06, "loss": 0.3607063293457031, "num_input_tokens_seen": 243974976, "step": 7655, "train_runtime": 20052.1346, "train_tokens_per_second": 12167.033 }, { "epoch": 0.5157554538109346, "grad_norm": 0.7795016196075504, "learning_rate": 8.447343650090412e-06, "loss": 0.3432271480560303, "num_input_tokens_seen": 244134640, "step": 7660, "train_runtime": 20065.2402, "train_tokens_per_second": 12167.043 }, { "epoch": 0.5160921088068947, "grad_norm": 0.7782332883208828, "learning_rate": 8.445428018605647e-06, "loss": 0.41146144866943357, "num_input_tokens_seen": 244297536, "step": 7665, "train_runtime": 20078.7232, "train_tokens_per_second": 12166.986 }, { "epoch": 0.5164287638028549, "grad_norm": 0.7414761064456209, "learning_rate": 8.443511423617924e-06, "loss": 0.35539951324462893, "num_input_tokens_seen": 244458608, "step": 7670, "train_runtime": 20091.7448, "train_tokens_per_second": 12167.117 }, { "epoch": 0.516765418798815, "grad_norm": 0.7815287739903983, "learning_rate": 8.441593865663213e-06, "loss": 0.4221913814544678, "num_input_tokens_seen": 244620464, "step": 7675, "train_runtime": 20104.9014, "train_tokens_per_second": 12167.205 }, { "epoch": 0.5171020737947751, "grad_norm": 0.7440374984488749, "learning_rate": 8.439675345277751e-06, "loss": 0.4159858703613281, "num_input_tokens_seen": 244782280, "step": 7680, "train_runtime": 20119.1111, "train_tokens_per_second": 12166.655 }, { "epoch": 0.5174387287907353, "grad_norm": 0.8014815644288046, "learning_rate": 8.437755862998047e-06, "loss": 0.39878134727478026, "num_input_tokens_seen": 244941944, "step": 7685, "train_runtime": 20132.4215, "train_tokens_per_second": 12166.542 }, { "epoch": 0.5177753837866954, "grad_norm": 0.7111023492510823, "learning_rate": 8.435835419360878e-06, "loss": 0.41121768951416016, "num_input_tokens_seen": 245103320, "step": 7690, "train_runtime": 20144.9166, "train_tokens_per_second": 12167.006 }, { "epoch": 0.5181120387826555, "grad_norm": 0.8123618429863106, "learning_rate": 8.433914014903291e-06, "loss": 0.4353185653686523, "num_input_tokens_seen": 245260784, "step": 7695, "train_runtime": 20157.9165, "train_tokens_per_second": 12166.971 }, { "epoch": 0.5184486937786157, "grad_norm": 0.79179170382196, "learning_rate": 8.431991650162599e-06, "loss": 0.37683467864990233, "num_input_tokens_seen": 245419456, "step": 7700, "train_runtime": 20171.232, "train_tokens_per_second": 12166.805 }, { "epoch": 0.5187853487745758, "grad_norm": 0.8091620590462157, "learning_rate": 8.430068325676386e-06, "loss": 0.3776644229888916, "num_input_tokens_seen": 245580880, "step": 7705, "train_runtime": 20185.2724, "train_tokens_per_second": 12166.34 }, { "epoch": 0.519122003770536, "grad_norm": 0.7498266146947521, "learning_rate": 8.428144041982502e-06, "loss": 0.40474853515625, "num_input_tokens_seen": 245738352, "step": 7710, "train_runtime": 20198.2936, "train_tokens_per_second": 12166.293 }, { "epoch": 0.5194586587664961, "grad_norm": 0.7138303446787942, "learning_rate": 8.42621879961907e-06, "loss": 0.37674245834350584, "num_input_tokens_seen": 245899776, "step": 7715, "train_runtime": 20210.7724, "train_tokens_per_second": 12166.768 }, { "epoch": 0.5197953137624562, "grad_norm": 0.7767770915280027, "learning_rate": 8.424292599124476e-06, "loss": 0.3740605592727661, "num_input_tokens_seen": 246061600, "step": 7720, "train_runtime": 20224.546, "train_tokens_per_second": 12166.483 }, { "epoch": 0.5201319687584164, "grad_norm": 0.9248925753056944, "learning_rate": 8.422365441037374e-06, "loss": 0.3987976789474487, "num_input_tokens_seen": 246221432, "step": 7725, "train_runtime": 20236.9882, "train_tokens_per_second": 12166.901 }, { "epoch": 0.5204686237543765, "grad_norm": 0.8200949380573862, "learning_rate": 8.420437325896692e-06, "loss": 0.40408992767333984, "num_input_tokens_seen": 246382304, "step": 7730, "train_runtime": 20249.9735, "train_tokens_per_second": 12167.043 }, { "epoch": 0.5208052787503367, "grad_norm": 0.8598375346576372, "learning_rate": 8.418508254241617e-06, "loss": 0.40617833137512205, "num_input_tokens_seen": 246542040, "step": 7735, "train_runtime": 20263.483, "train_tokens_per_second": 12166.815 }, { "epoch": 0.5211419337462968, "grad_norm": 0.7810428539264734, "learning_rate": 8.416578226611612e-06, "loss": 0.38080477714538574, "num_input_tokens_seen": 246700464, "step": 7740, "train_runtime": 20277.1689, "train_tokens_per_second": 12166.416 }, { "epoch": 0.5214785887422569, "grad_norm": 1.010595620595859, "learning_rate": 8.414647243546398e-06, "loss": 0.384970498085022, "num_input_tokens_seen": 246860784, "step": 7745, "train_runtime": 20290.5191, "train_tokens_per_second": 12166.312 }, { "epoch": 0.5218152437382171, "grad_norm": 0.7240710878438316, "learning_rate": 8.412715305585973e-06, "loss": 0.38633999824523924, "num_input_tokens_seen": 247021592, "step": 7750, "train_runtime": 20302.958, "train_tokens_per_second": 12166.778 }, { "epoch": 0.5221518987341772, "grad_norm": 0.7049935231055876, "learning_rate": 8.410782413270594e-06, "loss": 0.39238436222076417, "num_input_tokens_seen": 247185144, "step": 7755, "train_runtime": 20316.6095, "train_tokens_per_second": 12166.653 }, { "epoch": 0.5224885537301374, "grad_norm": 0.841964335887728, "learning_rate": 8.408848567140787e-06, "loss": 0.3709267616271973, "num_input_tokens_seen": 247335832, "step": 7760, "train_runtime": 20330.4889, "train_tokens_per_second": 12165.759 }, { "epoch": 0.5228252087260975, "grad_norm": 0.788929782171271, "learning_rate": 8.406913767737353e-06, "loss": 0.3649853229522705, "num_input_tokens_seen": 247495408, "step": 7765, "train_runtime": 20343.0868, "train_tokens_per_second": 12166.07 }, { "epoch": 0.5231618637220576, "grad_norm": 0.7624272221215714, "learning_rate": 8.404978015601344e-06, "loss": 0.3929929256439209, "num_input_tokens_seen": 247655200, "step": 7770, "train_runtime": 20355.5281, "train_tokens_per_second": 12166.484 }, { "epoch": 0.5234985187180178, "grad_norm": 0.7396381636756648, "learning_rate": 8.403041311274091e-06, "loss": 0.4017702579498291, "num_input_tokens_seen": 247817440, "step": 7775, "train_runtime": 20368.7975, "train_tokens_per_second": 12166.523 }, { "epoch": 0.5238351737139779, "grad_norm": 0.8371009855425124, "learning_rate": 8.401103655297188e-06, "loss": 0.38645689487457274, "num_input_tokens_seen": 247977560, "step": 7780, "train_runtime": 20382.3991, "train_tokens_per_second": 12166.26 }, { "epoch": 0.5241718287099381, "grad_norm": 0.7046093758482901, "learning_rate": 8.399165048212494e-06, "loss": 0.35761566162109376, "num_input_tokens_seen": 248133968, "step": 7785, "train_runtime": 20395.539, "train_tokens_per_second": 12166.09 }, { "epoch": 0.5245084837058982, "grad_norm": 0.816213114840001, "learning_rate": 8.397225490562131e-06, "loss": 0.41030006408691405, "num_input_tokens_seen": 248293760, "step": 7790, "train_runtime": 20408.6403, "train_tokens_per_second": 12166.11 }, { "epoch": 0.5248451387018583, "grad_norm": 0.833352904084274, "learning_rate": 8.395284982888494e-06, "loss": 0.3800528049468994, "num_input_tokens_seen": 248456616, "step": 7795, "train_runtime": 20422.0732, "train_tokens_per_second": 12166.082 }, { "epoch": 0.5251817936978185, "grad_norm": 0.9607875155809358, "learning_rate": 8.393343525734239e-06, "loss": 0.3983436346054077, "num_input_tokens_seen": 248618224, "step": 7800, "train_runtime": 20434.9908, "train_tokens_per_second": 12166.3 }, { "epoch": 0.5255184486937786, "grad_norm": 0.9147627066521322, "learning_rate": 8.391401119642286e-06, "loss": 0.3930044651031494, "num_input_tokens_seen": 248769512, "step": 7805, "train_runtime": 20448.1038, "train_tokens_per_second": 12165.896 }, { "epoch": 0.5258551036897388, "grad_norm": 0.7843803427735412, "learning_rate": 8.389457765155824e-06, "loss": 0.4199055671691895, "num_input_tokens_seen": 248924376, "step": 7810, "train_runtime": 20461.3065, "train_tokens_per_second": 12165.615 }, { "epoch": 0.5261917586856989, "grad_norm": 0.7646396350868451, "learning_rate": 8.387513462818309e-06, "loss": 0.3531463623046875, "num_input_tokens_seen": 249083936, "step": 7815, "train_runtime": 20473.8857, "train_tokens_per_second": 12165.934 }, { "epoch": 0.526528413681659, "grad_norm": 0.7768900595010912, "learning_rate": 8.385568213173453e-06, "loss": 0.3795043468475342, "num_input_tokens_seen": 249243224, "step": 7820, "train_runtime": 20488.0505, "train_tokens_per_second": 12165.297 }, { "epoch": 0.5268650686776192, "grad_norm": 0.7794627164528214, "learning_rate": 8.383622016765242e-06, "loss": 0.3782067060470581, "num_input_tokens_seen": 249405808, "step": 7825, "train_runtime": 20501.3971, "train_tokens_per_second": 12165.308 }, { "epoch": 0.5272017236735793, "grad_norm": 0.8385909978428195, "learning_rate": 8.381674874137926e-06, "loss": 0.403814697265625, "num_input_tokens_seen": 249564352, "step": 7830, "train_runtime": 20515.0477, "train_tokens_per_second": 12164.941 }, { "epoch": 0.5275383786695395, "grad_norm": 1.0122437021354653, "learning_rate": 8.379726785836013e-06, "loss": 0.361968994140625, "num_input_tokens_seen": 249726520, "step": 7835, "train_runtime": 20527.6346, "train_tokens_per_second": 12165.382 }, { "epoch": 0.5278750336654996, "grad_norm": 0.7678244244105163, "learning_rate": 8.377777752404283e-06, "loss": 0.38558340072631836, "num_input_tokens_seen": 249890360, "step": 7840, "train_runtime": 20540.6656, "train_tokens_per_second": 12165.641 }, { "epoch": 0.5282116886614597, "grad_norm": 0.8052327288520001, "learning_rate": 8.375827774387774e-06, "loss": 0.3559632062911987, "num_input_tokens_seen": 250043112, "step": 7845, "train_runtime": 20554.3468, "train_tokens_per_second": 12164.975 }, { "epoch": 0.5285483436574199, "grad_norm": 0.725806198965624, "learning_rate": 8.373876852331793e-06, "loss": 0.366229772567749, "num_input_tokens_seen": 250205824, "step": 7850, "train_runtime": 20567.0496, "train_tokens_per_second": 12165.373 }, { "epoch": 0.52888499865338, "grad_norm": 0.8520018416014798, "learning_rate": 8.371924986781909e-06, "loss": 0.40759763717651365, "num_input_tokens_seen": 250363328, "step": 7855, "train_runtime": 20580.2525, "train_tokens_per_second": 12165.221 }, { "epoch": 0.5292216536493402, "grad_norm": 0.8288492403392017, "learning_rate": 8.369972178283955e-06, "loss": 0.36505701541900637, "num_input_tokens_seen": 250526008, "step": 7860, "train_runtime": 20592.9496, "train_tokens_per_second": 12165.62 }, { "epoch": 0.5295583086453003, "grad_norm": 1.0179341615443855, "learning_rate": 8.368018427384027e-06, "loss": 0.3974146366119385, "num_input_tokens_seen": 250687128, "step": 7865, "train_runtime": 20605.8176, "train_tokens_per_second": 12165.842 }, { "epoch": 0.5298949636412604, "grad_norm": 0.8117119583218815, "learning_rate": 8.366063734628485e-06, "loss": 0.37839417457580565, "num_input_tokens_seen": 250846720, "step": 7870, "train_runtime": 20619.0419, "train_tokens_per_second": 12165.78 }, { "epoch": 0.5302316186372206, "grad_norm": 0.8170966197918764, "learning_rate": 8.364108100563955e-06, "loss": 0.39380273818969724, "num_input_tokens_seen": 251008152, "step": 7875, "train_runtime": 20632.5666, "train_tokens_per_second": 12165.629 }, { "epoch": 0.5305682736331807, "grad_norm": 0.8255489516799258, "learning_rate": 8.362151525737321e-06, "loss": 0.43450231552124025, "num_input_tokens_seen": 251168832, "step": 7880, "train_runtime": 20644.9953, "train_tokens_per_second": 12166.088 }, { "epoch": 0.5309049286291408, "grad_norm": 0.8077496068379889, "learning_rate": 8.360194010695733e-06, "loss": 0.36590213775634767, "num_input_tokens_seen": 251328480, "step": 7885, "train_runtime": 20658.4251, "train_tokens_per_second": 12165.907 }, { "epoch": 0.531241583625101, "grad_norm": 0.7633973042774351, "learning_rate": 8.358235555986607e-06, "loss": 0.39882049560546873, "num_input_tokens_seen": 251487248, "step": 7890, "train_runtime": 20671.0092, "train_tokens_per_second": 12166.181 }, { "epoch": 0.5315782386210611, "grad_norm": 0.8283702885559234, "learning_rate": 8.356276162157613e-06, "loss": 0.36642003059387207, "num_input_tokens_seen": 251648360, "step": 7895, "train_runtime": 20683.57, "train_tokens_per_second": 12166.582 }, { "epoch": 0.5319148936170213, "grad_norm": 0.7739911236375652, "learning_rate": 8.354315829756696e-06, "loss": 0.3816749095916748, "num_input_tokens_seen": 251811016, "step": 7900, "train_runtime": 20696.8503, "train_tokens_per_second": 12166.635 }, { "epoch": 0.5322515486129814, "grad_norm": 0.7413155522951834, "learning_rate": 8.352354559332053e-06, "loss": 0.3656564235687256, "num_input_tokens_seen": 251967920, "step": 7905, "train_runtime": 20709.649, "train_tokens_per_second": 12166.692 }, { "epoch": 0.5325882036089415, "grad_norm": 0.7414665289152079, "learning_rate": 8.350392351432146e-06, "loss": 0.3953502893447876, "num_input_tokens_seen": 252123224, "step": 7910, "train_runtime": 20722.866, "train_tokens_per_second": 12166.426 }, { "epoch": 0.5329248586049017, "grad_norm": 0.8209203115906711, "learning_rate": 8.348429206605702e-06, "loss": 0.377488112449646, "num_input_tokens_seen": 252287064, "step": 7915, "train_runtime": 20735.2911, "train_tokens_per_second": 12167.037 }, { "epoch": 0.5332615136008618, "grad_norm": 0.9159843598480798, "learning_rate": 8.346465125401706e-06, "loss": 0.42546706199645995, "num_input_tokens_seen": 252444448, "step": 7920, "train_runtime": 20748.3336, "train_tokens_per_second": 12166.975 }, { "epoch": 0.533598168596822, "grad_norm": 0.7761276140410946, "learning_rate": 8.344500108369412e-06, "loss": 0.3723264217376709, "num_input_tokens_seen": 252607952, "step": 7925, "train_runtime": 20762.0531, "train_tokens_per_second": 12166.81 }, { "epoch": 0.5339348235927821, "grad_norm": 0.8042724923676196, "learning_rate": 8.342534156058326e-06, "loss": 0.4076098442077637, "num_input_tokens_seen": 252768032, "step": 7930, "train_runtime": 20775.4302, "train_tokens_per_second": 12166.681 }, { "epoch": 0.5342714785887422, "grad_norm": 0.8605619741915326, "learning_rate": 8.34056726901822e-06, "loss": 0.39628233909606936, "num_input_tokens_seen": 252928512, "step": 7935, "train_runtime": 20788.7648, "train_tokens_per_second": 12166.596 }, { "epoch": 0.5346081335847024, "grad_norm": 0.7876151311590377, "learning_rate": 8.338599447799132e-06, "loss": 0.3728104829788208, "num_input_tokens_seen": 253080656, "step": 7940, "train_runtime": 20801.8402, "train_tokens_per_second": 12166.263 }, { "epoch": 0.5349447885806625, "grad_norm": 0.8682662531395543, "learning_rate": 8.336630692951353e-06, "loss": 0.397021222114563, "num_input_tokens_seen": 253241440, "step": 7945, "train_runtime": 20814.8163, "train_tokens_per_second": 12166.403 }, { "epoch": 0.5352814435766227, "grad_norm": 0.8177289067366508, "learning_rate": 8.334661005025441e-06, "loss": 0.40717229843139646, "num_input_tokens_seen": 253399952, "step": 7950, "train_runtime": 20827.8131, "train_tokens_per_second": 12166.421 }, { "epoch": 0.5356180985725828, "grad_norm": 0.8782876265032664, "learning_rate": 8.332690384572213e-06, "loss": 0.4144033432006836, "num_input_tokens_seen": 253558104, "step": 7955, "train_runtime": 20841.1597, "train_tokens_per_second": 12166.219 }, { "epoch": 0.5359547535685429, "grad_norm": 0.7365889529271511, "learning_rate": 8.330718832142746e-06, "loss": 0.3852388381958008, "num_input_tokens_seen": 253721936, "step": 7960, "train_runtime": 20854.2739, "train_tokens_per_second": 12166.424 }, { "epoch": 0.5362914085645031, "grad_norm": 0.7807756560653858, "learning_rate": 8.328746348288379e-06, "loss": 0.3837946891784668, "num_input_tokens_seen": 253879912, "step": 7965, "train_runtime": 20867.9567, "train_tokens_per_second": 12166.017 }, { "epoch": 0.5366280635604632, "grad_norm": 0.8000760057512833, "learning_rate": 8.32677293356071e-06, "loss": 0.4331723690032959, "num_input_tokens_seen": 254043312, "step": 7970, "train_runtime": 20880.9469, "train_tokens_per_second": 12166.274 }, { "epoch": 0.5369647185564234, "grad_norm": 0.7930234163833042, "learning_rate": 8.324798588511598e-06, "loss": 0.38106508255004884, "num_input_tokens_seen": 254201456, "step": 7975, "train_runtime": 20894.9202, "train_tokens_per_second": 12165.706 }, { "epoch": 0.5373013735523835, "grad_norm": 0.7903696270192934, "learning_rate": 8.322823313693162e-06, "loss": 0.39886314868927003, "num_input_tokens_seen": 254357256, "step": 7980, "train_runtime": 20907.6205, "train_tokens_per_second": 12165.768 }, { "epoch": 0.5376380285483436, "grad_norm": 0.7829286849514997, "learning_rate": 8.320847109657782e-06, "loss": 0.38727149963378904, "num_input_tokens_seen": 254518128, "step": 7985, "train_runtime": 20920.4799, "train_tokens_per_second": 12165.979 }, { "epoch": 0.5379746835443038, "grad_norm": 0.7351681774217423, "learning_rate": 8.318869976958099e-06, "loss": 0.34882638454437254, "num_input_tokens_seen": 254680256, "step": 7990, "train_runtime": 20933.3133, "train_tokens_per_second": 12166.266 }, { "epoch": 0.5383113385402639, "grad_norm": 0.8033044200957941, "learning_rate": 8.316891916147007e-06, "loss": 0.42199172973632815, "num_input_tokens_seen": 254839392, "step": 7995, "train_runtime": 20946.1093, "train_tokens_per_second": 12166.431 }, { "epoch": 0.5386479935362241, "grad_norm": 0.8416378503675388, "learning_rate": 8.314912927777671e-06, "loss": 0.3883615016937256, "num_input_tokens_seen": 254997072, "step": 8000, "train_runtime": 20958.6464, "train_tokens_per_second": 12166.677 }, { "epoch": 0.5389846485321842, "grad_norm": 0.8290087239270112, "learning_rate": 8.312933012403503e-06, "loss": 0.38657207489013673, "num_input_tokens_seen": 255149992, "step": 8005, "train_runtime": 20971.6178, "train_tokens_per_second": 12166.443 }, { "epoch": 0.5393213035281443, "grad_norm": 0.7456774013033717, "learning_rate": 8.310952170578184e-06, "loss": 0.39329233169555666, "num_input_tokens_seen": 255305648, "step": 8010, "train_runtime": 20984.7562, "train_tokens_per_second": 12166.243 }, { "epoch": 0.5396579585241045, "grad_norm": 0.8638884996816859, "learning_rate": 8.308970402855647e-06, "loss": 0.36403968334198, "num_input_tokens_seen": 255459520, "step": 8015, "train_runtime": 20997.9482, "train_tokens_per_second": 12165.928 }, { "epoch": 0.5399946135200646, "grad_norm": 0.8921896241768411, "learning_rate": 8.306987709790087e-06, "loss": 0.36961803436279295, "num_input_tokens_seen": 255617080, "step": 8020, "train_runtime": 21010.6946, "train_tokens_per_second": 12166.046 }, { "epoch": 0.5403312685160248, "grad_norm": 0.7884543600476868, "learning_rate": 8.305004091935962e-06, "loss": 0.38249356746673585, "num_input_tokens_seen": 255779960, "step": 8025, "train_runtime": 21023.8214, "train_tokens_per_second": 12166.197 }, { "epoch": 0.5406679235119849, "grad_norm": 0.8576962211180145, "learning_rate": 8.303019549847979e-06, "loss": 0.4121133804321289, "num_input_tokens_seen": 255939616, "step": 8030, "train_runtime": 21036.9758, "train_tokens_per_second": 12166.179 }, { "epoch": 0.541004578507945, "grad_norm": 0.8077388305870126, "learning_rate": 8.301034084081114e-06, "loss": 0.366147518157959, "num_input_tokens_seen": 256101712, "step": 8035, "train_runtime": 21050.2145, "train_tokens_per_second": 12166.228 }, { "epoch": 0.5413412335039052, "grad_norm": 0.9355436403969812, "learning_rate": 8.299047695190592e-06, "loss": 0.41315793991088867, "num_input_tokens_seen": 256260216, "step": 8040, "train_runtime": 21062.8995, "train_tokens_per_second": 12166.426 }, { "epoch": 0.5416778884998653, "grad_norm": 0.8029423840121809, "learning_rate": 8.297060383731903e-06, "loss": 0.39433751106262205, "num_input_tokens_seen": 256419136, "step": 8045, "train_runtime": 21075.9222, "train_tokens_per_second": 12166.449 }, { "epoch": 0.5420145434958255, "grad_norm": 0.7976789965945154, "learning_rate": 8.29507215026079e-06, "loss": 0.42723779678344725, "num_input_tokens_seen": 256578472, "step": 8050, "train_runtime": 21089.028, "train_tokens_per_second": 12166.444 }, { "epoch": 0.5423511984917856, "grad_norm": 0.9088627087336268, "learning_rate": 8.293082995333257e-06, "loss": 0.37396821975708006, "num_input_tokens_seen": 256738496, "step": 8055, "train_runtime": 21101.7723, "train_tokens_per_second": 12166.679 }, { "epoch": 0.5426878534877457, "grad_norm": 0.7719170522386951, "learning_rate": 8.291092919505568e-06, "loss": 0.35263934135437014, "num_input_tokens_seen": 256895880, "step": 8060, "train_runtime": 21114.8952, "train_tokens_per_second": 12166.571 }, { "epoch": 0.5430245084837059, "grad_norm": 0.799782147518969, "learning_rate": 8.289101923334237e-06, "loss": 0.3940428733825684, "num_input_tokens_seen": 257057392, "step": 8065, "train_runtime": 21128.5026, "train_tokens_per_second": 12166.38 }, { "epoch": 0.543361163479666, "grad_norm": 0.8608741107233793, "learning_rate": 8.28711000737604e-06, "loss": 0.38349123001098634, "num_input_tokens_seen": 257216648, "step": 8070, "train_runtime": 21142.0974, "train_tokens_per_second": 12166.089 }, { "epoch": 0.5436978184756261, "grad_norm": 0.8124190970204751, "learning_rate": 8.285117172188013e-06, "loss": 0.4074282646179199, "num_input_tokens_seen": 257379272, "step": 8075, "train_runtime": 21154.8627, "train_tokens_per_second": 12166.435 }, { "epoch": 0.5440344734715863, "grad_norm": 0.9612535327891233, "learning_rate": 8.283123418327443e-06, "loss": 0.4188706398010254, "num_input_tokens_seen": 257538168, "step": 8080, "train_runtime": 21167.4838, "train_tokens_per_second": 12166.688 }, { "epoch": 0.5443711284675464, "grad_norm": 0.7760901263834276, "learning_rate": 8.281128746351878e-06, "loss": 0.3785744905471802, "num_input_tokens_seen": 257699888, "step": 8085, "train_runtime": 21180.4504, "train_tokens_per_second": 12166.875 }, { "epoch": 0.5447077834635066, "grad_norm": 0.7636941815034735, "learning_rate": 8.279133156819123e-06, "loss": 0.41728720664978025, "num_input_tokens_seen": 257857016, "step": 8090, "train_runtime": 21193.4221, "train_tokens_per_second": 12166.842 }, { "epoch": 0.5450444384594667, "grad_norm": 0.7904308387858431, "learning_rate": 8.277136650287237e-06, "loss": 0.36835551261901855, "num_input_tokens_seen": 258020800, "step": 8095, "train_runtime": 21206.5193, "train_tokens_per_second": 12167.051 }, { "epoch": 0.5453810934554268, "grad_norm": 0.8753312039925617, "learning_rate": 8.275139227314537e-06, "loss": 0.38594019412994385, "num_input_tokens_seen": 258179016, "step": 8100, "train_runtime": 21219.9491, "train_tokens_per_second": 12166.807 }, { "epoch": 0.545717748451387, "grad_norm": 0.876517530377018, "learning_rate": 8.273140888459594e-06, "loss": 0.4352447509765625, "num_input_tokens_seen": 258339720, "step": 8105, "train_runtime": 21232.578, "train_tokens_per_second": 12167.139 }, { "epoch": 0.5460544034473471, "grad_norm": 0.8571059235986455, "learning_rate": 8.27114163428124e-06, "loss": 0.3966317653656006, "num_input_tokens_seen": 258496768, "step": 8110, "train_runtime": 21245.3685, "train_tokens_per_second": 12167.206 }, { "epoch": 0.5463910584433073, "grad_norm": 0.8191605218307668, "learning_rate": 8.26914146533856e-06, "loss": 0.3764180660247803, "num_input_tokens_seen": 258659288, "step": 8115, "train_runtime": 21258.05, "train_tokens_per_second": 12167.592 }, { "epoch": 0.5467277134392674, "grad_norm": 0.7076217618322249, "learning_rate": 8.267140382190892e-06, "loss": 0.38625895977020264, "num_input_tokens_seen": 258822600, "step": 8120, "train_runtime": 21270.9505, "train_tokens_per_second": 12167.891 }, { "epoch": 0.5470643684352275, "grad_norm": 0.6873517575005611, "learning_rate": 8.265138385397835e-06, "loss": 0.38873815536499023, "num_input_tokens_seen": 258984208, "step": 8125, "train_runtime": 21283.9922, "train_tokens_per_second": 12168.028 }, { "epoch": 0.5474010234311877, "grad_norm": 0.7065896847522521, "learning_rate": 8.263135475519241e-06, "loss": 0.3519615173339844, "num_input_tokens_seen": 259147520, "step": 8130, "train_runtime": 21296.9705, "train_tokens_per_second": 12168.281 }, { "epoch": 0.5477376784271478, "grad_norm": 0.7478595008927922, "learning_rate": 8.261131653115216e-06, "loss": 0.41793012619018555, "num_input_tokens_seen": 259309360, "step": 8135, "train_runtime": 21309.6629, "train_tokens_per_second": 12168.628 }, { "epoch": 0.548074333423108, "grad_norm": 0.7429522179656578, "learning_rate": 8.259126918746122e-06, "loss": 0.3670862436294556, "num_input_tokens_seen": 259468888, "step": 8140, "train_runtime": 21322.1509, "train_tokens_per_second": 12168.983 }, { "epoch": 0.5484109884190681, "grad_norm": 0.7661716108119748, "learning_rate": 8.25712127297258e-06, "loss": 0.4059457778930664, "num_input_tokens_seen": 259630856, "step": 8145, "train_runtime": 21335.3619, "train_tokens_per_second": 12169.039 }, { "epoch": 0.5487476434150282, "grad_norm": 0.8370165993133727, "learning_rate": 8.255114716355459e-06, "loss": 0.41359848976135255, "num_input_tokens_seen": 259793512, "step": 8150, "train_runtime": 21348.073, "train_tokens_per_second": 12169.413 }, { "epoch": 0.5490842984109884, "grad_norm": 0.7143909078266771, "learning_rate": 8.253107249455887e-06, "loss": 0.40358386039733884, "num_input_tokens_seen": 259952888, "step": 8155, "train_runtime": 21361.2066, "train_tokens_per_second": 12169.392 }, { "epoch": 0.5494209534069485, "grad_norm": 0.7882241759978242, "learning_rate": 8.251098872835247e-06, "loss": 0.39182052612304685, "num_input_tokens_seen": 260113960, "step": 8160, "train_runtime": 21373.6647, "train_tokens_per_second": 12169.834 }, { "epoch": 0.5497576084029087, "grad_norm": 0.6747458733466716, "learning_rate": 8.249089587055175e-06, "loss": 0.35428686141967775, "num_input_tokens_seen": 260271968, "step": 8165, "train_runtime": 21386.5977, "train_tokens_per_second": 12169.863 }, { "epoch": 0.5500942633988688, "grad_norm": 0.7128552139516158, "learning_rate": 8.247079392677558e-06, "loss": 0.38996999263763427, "num_input_tokens_seen": 260431992, "step": 8170, "train_runtime": 21399.4532, "train_tokens_per_second": 12170.03 }, { "epoch": 0.5504309183948289, "grad_norm": 0.7517140615498464, "learning_rate": 8.245068290264544e-06, "loss": 0.3815065860748291, "num_input_tokens_seen": 260592392, "step": 8175, "train_runtime": 21411.8849, "train_tokens_per_second": 12170.455 }, { "epoch": 0.5507675733907891, "grad_norm": 0.8416414791589104, "learning_rate": 8.243056280378531e-06, "loss": 0.39004452228546144, "num_input_tokens_seen": 260755024, "step": 8180, "train_runtime": 21424.8351, "train_tokens_per_second": 12170.69 }, { "epoch": 0.5511042283867492, "grad_norm": 0.7468734694875759, "learning_rate": 8.241043363582171e-06, "loss": 0.35741243362426756, "num_input_tokens_seen": 260917784, "step": 8185, "train_runtime": 21437.3025, "train_tokens_per_second": 12171.204 }, { "epoch": 0.5514408833827094, "grad_norm": 0.7103716877935099, "learning_rate": 8.239029540438369e-06, "loss": 0.35527615547180175, "num_input_tokens_seen": 261080520, "step": 8190, "train_runtime": 21450.0333, "train_tokens_per_second": 12171.567 }, { "epoch": 0.5517775383786695, "grad_norm": 0.7554093517707741, "learning_rate": 8.237014811510284e-06, "loss": 0.3753568172454834, "num_input_tokens_seen": 261242352, "step": 8195, "train_runtime": 21463.3012, "train_tokens_per_second": 12171.583 }, { "epoch": 0.5521141933746296, "grad_norm": 0.8373822534978808, "learning_rate": 8.234999177361329e-06, "loss": 0.3857575416564941, "num_input_tokens_seen": 261404840, "step": 8200, "train_runtime": 21476.1197, "train_tokens_per_second": 12171.884 }, { "epoch": 0.5524508483705898, "grad_norm": 0.802756688777733, "learning_rate": 8.232982638555169e-06, "loss": 0.4095576286315918, "num_input_tokens_seen": 261565560, "step": 8205, "train_runtime": 21489.4729, "train_tokens_per_second": 12171.8 }, { "epoch": 0.5527875033665499, "grad_norm": 0.722754241987713, "learning_rate": 8.230965195655724e-06, "loss": 0.3943202972412109, "num_input_tokens_seen": 261729400, "step": 8210, "train_runtime": 21501.9135, "train_tokens_per_second": 12172.377 }, { "epoch": 0.55312415836251, "grad_norm": 0.8695634418914352, "learning_rate": 8.228946849227167e-06, "loss": 0.4108874320983887, "num_input_tokens_seen": 261893072, "step": 8215, "train_runtime": 21514.9726, "train_tokens_per_second": 12172.596 }, { "epoch": 0.5534608133584702, "grad_norm": 0.7716735366927598, "learning_rate": 8.226927599833916e-06, "loss": 0.4123076438903809, "num_input_tokens_seen": 262056072, "step": 8220, "train_runtime": 21527.8144, "train_tokens_per_second": 12172.907 }, { "epoch": 0.5537974683544303, "grad_norm": 0.8315520614140791, "learning_rate": 8.224907448040655e-06, "loss": 0.38757858276367185, "num_input_tokens_seen": 262219288, "step": 8225, "train_runtime": 21540.7157, "train_tokens_per_second": 12173.193 }, { "epoch": 0.5541341233503905, "grad_norm": 0.734912972299796, "learning_rate": 8.222886394412309e-06, "loss": 0.40882530212402346, "num_input_tokens_seen": 262379536, "step": 8230, "train_runtime": 21554.7448, "train_tokens_per_second": 12172.704 }, { "epoch": 0.5544707783463506, "grad_norm": 0.7564290211402108, "learning_rate": 8.220864439514057e-06, "loss": 0.3858541488647461, "num_input_tokens_seen": 262540024, "step": 8235, "train_runtime": 21567.7596, "train_tokens_per_second": 12172.8 }, { "epoch": 0.5548074333423108, "grad_norm": 0.8271864431813577, "learning_rate": 8.218841583911338e-06, "loss": 0.36765623092651367, "num_input_tokens_seen": 262703544, "step": 8240, "train_runtime": 21581.4534, "train_tokens_per_second": 12172.653 }, { "epoch": 0.5551440883382709, "grad_norm": 0.7594293827762876, "learning_rate": 8.216817828169834e-06, "loss": 0.41515312194824217, "num_input_tokens_seen": 262862680, "step": 8245, "train_runtime": 21594.5782, "train_tokens_per_second": 12172.624 }, { "epoch": 0.555480743334231, "grad_norm": 0.9611220663082597, "learning_rate": 8.214793172855481e-06, "loss": 0.3621303796768188, "num_input_tokens_seen": 263024248, "step": 8250, "train_runtime": 21608.3432, "train_tokens_per_second": 12172.347 }, { "epoch": 0.5558173983301912, "grad_norm": 0.6898171571625179, "learning_rate": 8.21276761853447e-06, "loss": 0.3664684534072876, "num_input_tokens_seen": 263185984, "step": 8255, "train_runtime": 21621.8566, "train_tokens_per_second": 12172.219 }, { "epoch": 0.5561540533261513, "grad_norm": 0.8783686407005666, "learning_rate": 8.210741165773238e-06, "loss": 0.39526987075805664, "num_input_tokens_seen": 263348280, "step": 8260, "train_runtime": 21634.5167, "train_tokens_per_second": 12172.598 }, { "epoch": 0.5564907083221114, "grad_norm": 0.7790868136221593, "learning_rate": 8.208713815138476e-06, "loss": 0.3606027364730835, "num_input_tokens_seen": 263511104, "step": 8265, "train_runtime": 21647.272, "train_tokens_per_second": 12172.947 }, { "epoch": 0.5568273633180716, "grad_norm": 0.7176895296935734, "learning_rate": 8.20668556719713e-06, "loss": 0.36252636909484864, "num_input_tokens_seen": 263667440, "step": 8270, "train_runtime": 21661.1473, "train_tokens_per_second": 12172.367 }, { "epoch": 0.5571640183140317, "grad_norm": 0.8265667546030943, "learning_rate": 8.204656422516388e-06, "loss": 0.3659949541091919, "num_input_tokens_seen": 263822664, "step": 8275, "train_runtime": 21673.9371, "train_tokens_per_second": 12172.346 }, { "epoch": 0.5575006733099919, "grad_norm": 0.8184529864280441, "learning_rate": 8.2026263816637e-06, "loss": 0.3745150566101074, "num_input_tokens_seen": 263977896, "step": 8280, "train_runtime": 21687.1232, "train_tokens_per_second": 12172.103 }, { "epoch": 0.557837328305952, "grad_norm": 0.8032973510381942, "learning_rate": 8.200595445206753e-06, "loss": 0.3884341955184937, "num_input_tokens_seen": 264137152, "step": 8285, "train_runtime": 21700.3594, "train_tokens_per_second": 12172.017 }, { "epoch": 0.5581739833019121, "grad_norm": 0.8485317228465236, "learning_rate": 8.198563613713497e-06, "loss": 0.37020292282104494, "num_input_tokens_seen": 264292776, "step": 8290, "train_runtime": 21713.2594, "train_tokens_per_second": 12171.953 }, { "epoch": 0.5585106382978723, "grad_norm": 0.8949440536013235, "learning_rate": 8.196530887752127e-06, "loss": 0.3872734546661377, "num_input_tokens_seen": 264454128, "step": 8295, "train_runtime": 21726.9007, "train_tokens_per_second": 12171.737 }, { "epoch": 0.5588472932938324, "grad_norm": 0.8109015537228611, "learning_rate": 8.194497267891086e-06, "loss": 0.3815859317779541, "num_input_tokens_seen": 264616936, "step": 8300, "train_runtime": 21739.7694, "train_tokens_per_second": 12172.021 }, { "epoch": 0.5591839482897926, "grad_norm": 0.8124142643204788, "learning_rate": 8.19246275469907e-06, "loss": 0.3873375415802002, "num_input_tokens_seen": 264779592, "step": 8305, "train_runtime": 21752.4712, "train_tokens_per_second": 12172.391 }, { "epoch": 0.5595206032857528, "grad_norm": 0.756754880722595, "learning_rate": 8.190427348745027e-06, "loss": 0.3874617338180542, "num_input_tokens_seen": 264938912, "step": 8310, "train_runtime": 21765.3057, "train_tokens_per_second": 12172.533 }, { "epoch": 0.559857258281713, "grad_norm": 0.8239454837314649, "learning_rate": 8.188391050598146e-06, "loss": 0.3656805753707886, "num_input_tokens_seen": 265102752, "step": 8315, "train_runtime": 21777.7362, "train_tokens_per_second": 12173.109 }, { "epoch": 0.5601939132776731, "grad_norm": 0.8185450853395417, "learning_rate": 8.186353860827878e-06, "loss": 0.37709674835205076, "num_input_tokens_seen": 265257952, "step": 8320, "train_runtime": 21791.0779, "train_tokens_per_second": 12172.778 }, { "epoch": 0.5605305682736332, "grad_norm": 0.7124691940502255, "learning_rate": 8.184315780003911e-06, "loss": 0.39144511222839357, "num_input_tokens_seen": 265419888, "step": 8325, "train_runtime": 21804.2674, "train_tokens_per_second": 12172.841 }, { "epoch": 0.5608672232695934, "grad_norm": 0.7229200696217318, "learning_rate": 8.182276808696193e-06, "loss": 0.4190876007080078, "num_input_tokens_seen": 265573272, "step": 8330, "train_runtime": 21817.4744, "train_tokens_per_second": 12172.503 }, { "epoch": 0.5612038782655535, "grad_norm": 0.6850738096416372, "learning_rate": 8.18023694747491e-06, "loss": 0.3996566295623779, "num_input_tokens_seen": 265735536, "step": 8335, "train_runtime": 21830.2524, "train_tokens_per_second": 12172.811 }, { "epoch": 0.5615405332615137, "grad_norm": 0.9012775793624178, "learning_rate": 8.178196196910508e-06, "loss": 0.37130112648010255, "num_input_tokens_seen": 265898448, "step": 8340, "train_runtime": 21843.0524, "train_tokens_per_second": 12173.136 }, { "epoch": 0.5618771882574738, "grad_norm": 0.8285357952897106, "learning_rate": 8.176154557573672e-06, "loss": 0.41409831047058104, "num_input_tokens_seen": 266059472, "step": 8345, "train_runtime": 21855.5106, "train_tokens_per_second": 12173.565 }, { "epoch": 0.5622138432534339, "grad_norm": 0.8202784248577092, "learning_rate": 8.174112030035344e-06, "loss": 0.3550588130950928, "num_input_tokens_seen": 266221024, "step": 8350, "train_runtime": 21868.5725, "train_tokens_per_second": 12173.681 }, { "epoch": 0.5625504982493941, "grad_norm": 0.7442094656739202, "learning_rate": 8.172068614866707e-06, "loss": 0.3731220245361328, "num_input_tokens_seen": 266373080, "step": 8355, "train_runtime": 21881.6034, "train_tokens_per_second": 12173.38 }, { "epoch": 0.5628871532453542, "grad_norm": 0.8153921212340124, "learning_rate": 8.170024312639197e-06, "loss": 0.4146949291229248, "num_input_tokens_seen": 266535376, "step": 8360, "train_runtime": 21894.812, "train_tokens_per_second": 12173.449 }, { "epoch": 0.5632238082413143, "grad_norm": 0.7276035779833736, "learning_rate": 8.167979123924496e-06, "loss": 0.4149846076965332, "num_input_tokens_seen": 266694712, "step": 8365, "train_runtime": 21907.581, "train_tokens_per_second": 12173.627 }, { "epoch": 0.5635604632372745, "grad_norm": 0.835081908225235, "learning_rate": 8.165933049294537e-06, "loss": 0.4069093704223633, "num_input_tokens_seen": 266852256, "step": 8370, "train_runtime": 21920.7325, "train_tokens_per_second": 12173.51 }, { "epoch": 0.5638971182332346, "grad_norm": 0.8827699456387667, "learning_rate": 8.163886089321493e-06, "loss": 0.3603796482086182, "num_input_tokens_seen": 267014304, "step": 8375, "train_runtime": 21933.2709, "train_tokens_per_second": 12173.939 }, { "epoch": 0.5642337732291948, "grad_norm": 0.7270849273987028, "learning_rate": 8.161838244577795e-06, "loss": 0.3624864101409912, "num_input_tokens_seen": 267175920, "step": 8380, "train_runtime": 21945.9983, "train_tokens_per_second": 12174.243 }, { "epoch": 0.5645704282251549, "grad_norm": 0.7370969189073313, "learning_rate": 8.159789515636114e-06, "loss": 0.3571066379547119, "num_input_tokens_seen": 267331512, "step": 8385, "train_runtime": 21958.7734, "train_tokens_per_second": 12174.246 }, { "epoch": 0.564907083221115, "grad_norm": 0.8381292867158753, "learning_rate": 8.15773990306937e-06, "loss": 0.39977755546569826, "num_input_tokens_seen": 267485704, "step": 8390, "train_runtime": 21972.0191, "train_tokens_per_second": 12173.925 }, { "epoch": 0.5652437382170752, "grad_norm": 0.943740758025792, "learning_rate": 8.155689407450732e-06, "loss": 0.39592530727386477, "num_input_tokens_seen": 267648568, "step": 8395, "train_runtime": 21984.7736, "train_tokens_per_second": 12174.27 }, { "epoch": 0.5655803932130353, "grad_norm": 0.8043708769303783, "learning_rate": 8.153638029353615e-06, "loss": 0.3897716999053955, "num_input_tokens_seen": 267807064, "step": 8400, "train_runtime": 21998.2899, "train_tokens_per_second": 12173.995 }, { "epoch": 0.5659170482089955, "grad_norm": 0.8193110586615127, "learning_rate": 8.151585769351678e-06, "loss": 0.4180576324462891, "num_input_tokens_seen": 267967016, "step": 8405, "train_runtime": 22011.5405, "train_tokens_per_second": 12173.933 }, { "epoch": 0.5662537032049556, "grad_norm": 0.8163507788864877, "learning_rate": 8.149532628018833e-06, "loss": 0.3977893114089966, "num_input_tokens_seen": 268121784, "step": 8410, "train_runtime": 22024.0712, "train_tokens_per_second": 12174.034 }, { "epoch": 0.5665903582009157, "grad_norm": 0.8364728254577559, "learning_rate": 8.147478605929228e-06, "loss": 0.38081111907958987, "num_input_tokens_seen": 268282952, "step": 8415, "train_runtime": 22036.5487, "train_tokens_per_second": 12174.454 }, { "epoch": 0.5669270131968759, "grad_norm": 0.8680009193804383, "learning_rate": 8.145423703657269e-06, "loss": 0.35738024711608884, "num_input_tokens_seen": 268444200, "step": 8420, "train_runtime": 22049.6609, "train_tokens_per_second": 12174.527 }, { "epoch": 0.567263668192836, "grad_norm": 0.8056087281466204, "learning_rate": 8.143367921777601e-06, "loss": 0.4098641395568848, "num_input_tokens_seen": 268606664, "step": 8425, "train_runtime": 22062.7745, "train_tokens_per_second": 12174.655 }, { "epoch": 0.5676003231887962, "grad_norm": 0.8504922477420707, "learning_rate": 8.141311260865117e-06, "loss": 0.4474315643310547, "num_input_tokens_seen": 268767816, "step": 8430, "train_runtime": 22076.0916, "train_tokens_per_second": 12174.61 }, { "epoch": 0.5679369781847563, "grad_norm": 0.8444411391348389, "learning_rate": 8.139253721494956e-06, "loss": 0.4369081974029541, "num_input_tokens_seen": 268926840, "step": 8435, "train_runtime": 22089.8305, "train_tokens_per_second": 12174.237 }, { "epoch": 0.5682736331807164, "grad_norm": 0.7355145625285048, "learning_rate": 8.137195304242502e-06, "loss": 0.36676859855651855, "num_input_tokens_seen": 269088248, "step": 8440, "train_runtime": 22103.139, "train_tokens_per_second": 12174.21 }, { "epoch": 0.5686102881766766, "grad_norm": 0.690829657473422, "learning_rate": 8.135136009683387e-06, "loss": 0.3793917179107666, "num_input_tokens_seen": 269245512, "step": 8445, "train_runtime": 22116.3118, "train_tokens_per_second": 12174.069 }, { "epoch": 0.5689469431726367, "grad_norm": 0.7234183447556742, "learning_rate": 8.13307583839348e-06, "loss": 0.3861642360687256, "num_input_tokens_seen": 269408320, "step": 8450, "train_runtime": 22129.7623, "train_tokens_per_second": 12174.027 }, { "epoch": 0.5692835981685969, "grad_norm": 0.7854405385581302, "learning_rate": 8.131014790948908e-06, "loss": 0.4038506507873535, "num_input_tokens_seen": 269571032, "step": 8455, "train_runtime": 22143.1297, "train_tokens_per_second": 12174.026 }, { "epoch": 0.569620253164557, "grad_norm": 0.8161949815873275, "learning_rate": 8.128952867926035e-06, "loss": 0.4216309070587158, "num_input_tokens_seen": 269726688, "step": 8460, "train_runtime": 22156.3727, "train_tokens_per_second": 12173.775 }, { "epoch": 0.5699569081605171, "grad_norm": 0.7836594801256083, "learning_rate": 8.126890069901468e-06, "loss": 0.3847153425216675, "num_input_tokens_seen": 269881936, "step": 8465, "train_runtime": 22168.9263, "train_tokens_per_second": 12173.884 }, { "epoch": 0.5702935631564773, "grad_norm": 0.82059150815824, "learning_rate": 8.124826397452064e-06, "loss": 0.38450558185577394, "num_input_tokens_seen": 270045416, "step": 8470, "train_runtime": 22181.9378, "train_tokens_per_second": 12174.113 }, { "epoch": 0.5706302181524374, "grad_norm": 0.7167766567984177, "learning_rate": 8.122761851154923e-06, "loss": 0.38742387294769287, "num_input_tokens_seen": 270202728, "step": 8475, "train_runtime": 22195.1913, "train_tokens_per_second": 12173.931 }, { "epoch": 0.5709668731483976, "grad_norm": 0.9276943461747567, "learning_rate": 8.120696431587387e-06, "loss": 0.39433815479278567, "num_input_tokens_seen": 270363168, "step": 8480, "train_runtime": 22208.5952, "train_tokens_per_second": 12173.808 }, { "epoch": 0.5713035281443577, "grad_norm": 0.776133607676395, "learning_rate": 8.118630139327046e-06, "loss": 0.370235538482666, "num_input_tokens_seen": 270522464, "step": 8485, "train_runtime": 22221.7427, "train_tokens_per_second": 12173.774 }, { "epoch": 0.5716401831403178, "grad_norm": 0.7156344523220457, "learning_rate": 8.116562974951731e-06, "loss": 0.41245274543762206, "num_input_tokens_seen": 270684136, "step": 8490, "train_runtime": 22234.2535, "train_tokens_per_second": 12174.195 }, { "epoch": 0.571976838136278, "grad_norm": 0.7804048892656817, "learning_rate": 8.11449493903952e-06, "loss": 0.39719586372375487, "num_input_tokens_seen": 270847400, "step": 8495, "train_runtime": 22247.094, "train_tokens_per_second": 12174.507 }, { "epoch": 0.5723134931322381, "grad_norm": 0.7207332804711001, "learning_rate": 8.112426032168727e-06, "loss": 0.3941131591796875, "num_input_tokens_seen": 271005608, "step": 8500, "train_runtime": 22260.2787, "train_tokens_per_second": 12174.403 }, { "epoch": 0.5726501481281983, "grad_norm": 0.6967662545242425, "learning_rate": 8.11035625491792e-06, "loss": 0.35590691566467286, "num_input_tokens_seen": 271160672, "step": 8505, "train_runtime": 22273.9817, "train_tokens_per_second": 12173.875 }, { "epoch": 0.5729868031241584, "grad_norm": 0.8131319355102123, "learning_rate": 8.108285607865907e-06, "loss": 0.39660770893096925, "num_input_tokens_seen": 271319104, "step": 8510, "train_runtime": 22287.6069, "train_tokens_per_second": 12173.541 }, { "epoch": 0.5733234581201185, "grad_norm": 0.7575521275020969, "learning_rate": 8.106214091591731e-06, "loss": 0.3723886251449585, "num_input_tokens_seen": 271482944, "step": 8515, "train_runtime": 22300.0239, "train_tokens_per_second": 12174.11 }, { "epoch": 0.5736601131160787, "grad_norm": 0.7830147335499614, "learning_rate": 8.104141706674693e-06, "loss": 0.3499229192733765, "num_input_tokens_seen": 271644256, "step": 8520, "train_runtime": 22312.9529, "train_tokens_per_second": 12174.285 }, { "epoch": 0.5739967681120388, "grad_norm": 0.8800645904563533, "learning_rate": 8.102068453694324e-06, "loss": 0.40448813438415526, "num_input_tokens_seen": 271802664, "step": 8525, "train_runtime": 22325.9414, "train_tokens_per_second": 12174.298 }, { "epoch": 0.574333423107999, "grad_norm": 0.8439399507971489, "learning_rate": 8.099994333230404e-06, "loss": 0.4061802864074707, "num_input_tokens_seen": 271957560, "step": 8530, "train_runtime": 22338.7315, "train_tokens_per_second": 12174.262 }, { "epoch": 0.5746700781039591, "grad_norm": 0.9612036758130611, "learning_rate": 8.097919345862952e-06, "loss": 0.4010190963745117, "num_input_tokens_seen": 272111792, "step": 8535, "train_runtime": 22352.4003, "train_tokens_per_second": 12173.717 }, { "epoch": 0.5750067330999192, "grad_norm": 0.7399560763202631, "learning_rate": 8.095843492172235e-06, "loss": 0.3945467948913574, "num_input_tokens_seen": 272269928, "step": 8540, "train_runtime": 22365.0601, "train_tokens_per_second": 12173.897 }, { "epoch": 0.5753433880958794, "grad_norm": 0.9785278522948974, "learning_rate": 8.093766772738758e-06, "loss": 0.32863426208496094, "num_input_tokens_seen": 272427928, "step": 8545, "train_runtime": 22378.469, "train_tokens_per_second": 12173.662 }, { "epoch": 0.5756800430918395, "grad_norm": 0.8298269615242244, "learning_rate": 8.091689188143267e-06, "loss": 0.4153585910797119, "num_input_tokens_seen": 272585816, "step": 8550, "train_runtime": 22392.0085, "train_tokens_per_second": 12173.353 }, { "epoch": 0.5760166980877997, "grad_norm": 0.8011625906672519, "learning_rate": 8.089610738966754e-06, "loss": 0.39707293510437014, "num_input_tokens_seen": 272742840, "step": 8555, "train_runtime": 22404.855, "train_tokens_per_second": 12173.381 }, { "epoch": 0.5763533530837598, "grad_norm": 0.8746069596813106, "learning_rate": 8.08753142579045e-06, "loss": 0.4332891464233398, "num_input_tokens_seen": 272902336, "step": 8560, "train_runtime": 22418.6766, "train_tokens_per_second": 12172.99 }, { "epoch": 0.5766900080797199, "grad_norm": 0.7512638221808229, "learning_rate": 8.085451249195828e-06, "loss": 0.3762501239776611, "num_input_tokens_seen": 273065176, "step": 8565, "train_runtime": 22431.4598, "train_tokens_per_second": 12173.313 }, { "epoch": 0.5770266630756801, "grad_norm": 0.808258096006063, "learning_rate": 8.083370209764603e-06, "loss": 0.38850204944610595, "num_input_tokens_seen": 273223568, "step": 8570, "train_runtime": 22443.9159, "train_tokens_per_second": 12173.614 }, { "epoch": 0.5773633180716402, "grad_norm": 0.7890239528574572, "learning_rate": 8.081288308078731e-06, "loss": 0.39879584312438965, "num_input_tokens_seen": 273387000, "step": 8575, "train_runtime": 22456.9007, "train_tokens_per_second": 12173.853 }, { "epoch": 0.5776999730676003, "grad_norm": 0.7147821954311969, "learning_rate": 8.07920554472041e-06, "loss": 0.37086896896362304, "num_input_tokens_seen": 273550696, "step": 8580, "train_runtime": 22469.9443, "train_tokens_per_second": 12174.071 }, { "epoch": 0.5780366280635605, "grad_norm": 0.7777265304649422, "learning_rate": 8.077121920272075e-06, "loss": 0.3966056346893311, "num_input_tokens_seen": 273709456, "step": 8585, "train_runtime": 22482.5209, "train_tokens_per_second": 12174.322 }, { "epoch": 0.5783732830595206, "grad_norm": 0.721689173604904, "learning_rate": 8.07503743531641e-06, "loss": 0.3649152278900146, "num_input_tokens_seen": 273871032, "step": 8590, "train_runtime": 22496.9472, "train_tokens_per_second": 12173.698 }, { "epoch": 0.5787099380554808, "grad_norm": 0.6952559696965347, "learning_rate": 8.072952090436328e-06, "loss": 0.3712308406829834, "num_input_tokens_seen": 274030920, "step": 8595, "train_runtime": 22509.5918, "train_tokens_per_second": 12173.962 }, { "epoch": 0.5790465930514409, "grad_norm": 0.8158945573185497, "learning_rate": 8.070865886214996e-06, "loss": 0.3915894031524658, "num_input_tokens_seen": 274188688, "step": 8600, "train_runtime": 22522.6309, "train_tokens_per_second": 12173.919 }, { "epoch": 0.579383248047401, "grad_norm": 0.8636587925759287, "learning_rate": 8.06877882323581e-06, "loss": 0.3938615798950195, "num_input_tokens_seen": 274344832, "step": 8605, "train_runtime": 22535.0767, "train_tokens_per_second": 12174.125 }, { "epoch": 0.5797199030433612, "grad_norm": 0.8244518270421494, "learning_rate": 8.066690902082413e-06, "loss": 0.3691457748413086, "num_input_tokens_seen": 274505952, "step": 8610, "train_runtime": 22548.0573, "train_tokens_per_second": 12174.262 }, { "epoch": 0.5800565580393213, "grad_norm": 0.8122949601775046, "learning_rate": 8.064602123338683e-06, "loss": 0.4260343074798584, "num_input_tokens_seen": 274668272, "step": 8615, "train_runtime": 22560.662, "train_tokens_per_second": 12174.655 }, { "epoch": 0.5803932130352815, "grad_norm": 0.8227638337281615, "learning_rate": 8.06251248758874e-06, "loss": 0.38289215564727785, "num_input_tokens_seen": 274830080, "step": 8620, "train_runtime": 22573.6823, "train_tokens_per_second": 12174.801 }, { "epoch": 0.5807298680312416, "grad_norm": 0.775636416833392, "learning_rate": 8.060421995416949e-06, "loss": 0.41685895919799804, "num_input_tokens_seen": 274990488, "step": 8625, "train_runtime": 22587.0817, "train_tokens_per_second": 12174.68 }, { "epoch": 0.5810665230272017, "grad_norm": 0.8042505540363598, "learning_rate": 8.058330647407904e-06, "loss": 0.37619171142578123, "num_input_tokens_seen": 275147760, "step": 8630, "train_runtime": 22599.7347, "train_tokens_per_second": 12174.823 }, { "epoch": 0.5814031780231619, "grad_norm": 0.9291989077120335, "learning_rate": 8.056238444146445e-06, "loss": 0.3848073959350586, "num_input_tokens_seen": 275304784, "step": 8635, "train_runtime": 22612.9196, "train_tokens_per_second": 12174.668 }, { "epoch": 0.581739833019122, "grad_norm": 0.800751675448568, "learning_rate": 8.054145386217652e-06, "loss": 0.3641780138015747, "num_input_tokens_seen": 275467216, "step": 8640, "train_runtime": 22625.963, "train_tokens_per_second": 12174.828 }, { "epoch": 0.5820764880150822, "grad_norm": 0.7486964706026495, "learning_rate": 8.05205147420684e-06, "loss": 0.36989707946777345, "num_input_tokens_seen": 275626184, "step": 8645, "train_runtime": 22639.411, "train_tokens_per_second": 12174.618 }, { "epoch": 0.5824131430110423, "grad_norm": 0.8941003159988418, "learning_rate": 8.049956708699567e-06, "loss": 0.4291075706481934, "num_input_tokens_seen": 275784608, "step": 8650, "train_runtime": 22652.7497, "train_tokens_per_second": 12174.443 }, { "epoch": 0.5827497980070024, "grad_norm": 0.9339586414219014, "learning_rate": 8.047861090281623e-06, "loss": 0.39731745719909667, "num_input_tokens_seen": 275941720, "step": 8655, "train_runtime": 22665.576, "train_tokens_per_second": 12174.485 }, { "epoch": 0.5830864530029626, "grad_norm": 0.7109480431725202, "learning_rate": 8.045764619539047e-06, "loss": 0.37222120761871336, "num_input_tokens_seen": 276103832, "step": 8660, "train_runtime": 22678.5989, "train_tokens_per_second": 12174.642 }, { "epoch": 0.5834231079989227, "grad_norm": 0.7106880449575651, "learning_rate": 8.043667297058106e-06, "loss": 0.3681588888168335, "num_input_tokens_seen": 276260800, "step": 8665, "train_runtime": 22691.9031, "train_tokens_per_second": 12174.422 }, { "epoch": 0.5837597629948829, "grad_norm": 0.7149673404758417, "learning_rate": 8.04156912342531e-06, "loss": 0.3993093252182007, "num_input_tokens_seen": 276420256, "step": 8670, "train_runtime": 22705.3574, "train_tokens_per_second": 12174.231 }, { "epoch": 0.584096417990843, "grad_norm": 0.8914321219093229, "learning_rate": 8.03947009922741e-06, "loss": 0.3780981540679932, "num_input_tokens_seen": 276581744, "step": 8675, "train_runtime": 22718.4773, "train_tokens_per_second": 12174.308 }, { "epoch": 0.5844330729868031, "grad_norm": 0.8359863707888998, "learning_rate": 8.037370225051387e-06, "loss": 0.43466815948486326, "num_input_tokens_seen": 276739832, "step": 8680, "train_runtime": 22731.9708, "train_tokens_per_second": 12174.036 }, { "epoch": 0.5847697279827633, "grad_norm": 0.7874980324200367, "learning_rate": 8.035269501484467e-06, "loss": 0.37740159034729004, "num_input_tokens_seen": 276900544, "step": 8685, "train_runtime": 22745.3541, "train_tokens_per_second": 12173.939 }, { "epoch": 0.5851063829787234, "grad_norm": 0.8961160981913266, "learning_rate": 8.03316792911411e-06, "loss": 0.42656307220458983, "num_input_tokens_seen": 277056840, "step": 8690, "train_runtime": 22758.6526, "train_tokens_per_second": 12173.693 }, { "epoch": 0.5854430379746836, "grad_norm": 0.7127667643073454, "learning_rate": 8.031065508528011e-06, "loss": 0.3715827226638794, "num_input_tokens_seen": 277218544, "step": 8695, "train_runtime": 22771.7111, "train_tokens_per_second": 12173.813 }, { "epoch": 0.5857796929706437, "grad_norm": 0.7420706976281825, "learning_rate": 8.028962240314111e-06, "loss": 0.37357990741729735, "num_input_tokens_seen": 277380800, "step": 8700, "train_runtime": 22784.3049, "train_tokens_per_second": 12174.205 }, { "epoch": 0.5861163479666038, "grad_norm": 0.9183448741636746, "learning_rate": 8.026858125060577e-06, "loss": 0.4012912750244141, "num_input_tokens_seen": 277543976, "step": 8705, "train_runtime": 22797.2611, "train_tokens_per_second": 12174.444 }, { "epoch": 0.586453002962564, "grad_norm": 0.8040404792936039, "learning_rate": 8.024753163355821e-06, "loss": 0.43096342086791994, "num_input_tokens_seen": 277706592, "step": 8710, "train_runtime": 22810.6207, "train_tokens_per_second": 12174.443 }, { "epoch": 0.5867896579585241, "grad_norm": 0.7334247851298463, "learning_rate": 8.022647355788489e-06, "loss": 0.3863797903060913, "num_input_tokens_seen": 277869440, "step": 8715, "train_runtime": 22823.6524, "train_tokens_per_second": 12174.626 }, { "epoch": 0.5871263129544843, "grad_norm": 0.8634058779630797, "learning_rate": 8.02054070294746e-06, "loss": 0.4158777236938477, "num_input_tokens_seen": 278030304, "step": 8720, "train_runtime": 22836.8703, "train_tokens_per_second": 12174.624 }, { "epoch": 0.5874629679504444, "grad_norm": 0.988254186329373, "learning_rate": 8.018433205421859e-06, "loss": 0.37461717128753663, "num_input_tokens_seen": 278191104, "step": 8725, "train_runtime": 22849.7108, "train_tokens_per_second": 12174.819 }, { "epoch": 0.5877996229464045, "grad_norm": 0.8286663324292157, "learning_rate": 8.016324863801036e-06, "loss": 0.39465899467468263, "num_input_tokens_seen": 278352680, "step": 8730, "train_runtime": 22862.7181, "train_tokens_per_second": 12174.96 }, { "epoch": 0.5881362779423647, "grad_norm": 0.7949949062878114, "learning_rate": 8.014215678674581e-06, "loss": 0.41408047676086424, "num_input_tokens_seen": 278516472, "step": 8735, "train_runtime": 22875.7993, "train_tokens_per_second": 12175.158 }, { "epoch": 0.5884729329383248, "grad_norm": 0.6753628598508605, "learning_rate": 8.012105650632325e-06, "loss": 0.3678672075271606, "num_input_tokens_seen": 278675872, "step": 8740, "train_runtime": 22889.4729, "train_tokens_per_second": 12174.849 }, { "epoch": 0.588809587934285, "grad_norm": 0.736473655899873, "learning_rate": 8.009994780264328e-06, "loss": 0.41208972930908205, "num_input_tokens_seen": 278826360, "step": 8745, "train_runtime": 22902.7511, "train_tokens_per_second": 12174.361 }, { "epoch": 0.5891462429302451, "grad_norm": 0.8168118745280201, "learning_rate": 8.00788306816089e-06, "loss": 0.3884446382522583, "num_input_tokens_seen": 278984896, "step": 8750, "train_runtime": 22915.6377, "train_tokens_per_second": 12174.433 }, { "epoch": 0.5894828979262052, "grad_norm": 0.8489483429047614, "learning_rate": 8.005770514912543e-06, "loss": 0.39844307899475095, "num_input_tokens_seen": 279148736, "step": 8755, "train_runtime": 22928.0541, "train_tokens_per_second": 12174.986 }, { "epoch": 0.5898195529221654, "grad_norm": 0.7941232601197789, "learning_rate": 8.003657121110055e-06, "loss": 0.38739628791809083, "num_input_tokens_seen": 279312576, "step": 8760, "train_runtime": 22940.4675, "train_tokens_per_second": 12175.54 }, { "epoch": 0.5901562079181255, "grad_norm": 0.8409881816856485, "learning_rate": 8.001542887344432e-06, "loss": 0.35993902683258056, "num_input_tokens_seen": 279470760, "step": 8765, "train_runtime": 22953.4012, "train_tokens_per_second": 12175.571 }, { "epoch": 0.5904928629140856, "grad_norm": 0.7491800421278206, "learning_rate": 7.999427814206911e-06, "loss": 0.3962878942489624, "num_input_tokens_seen": 279629592, "step": 8770, "train_runtime": 22966.3941, "train_tokens_per_second": 12175.598 }, { "epoch": 0.5908295179100458, "grad_norm": 0.8087658568362288, "learning_rate": 7.997311902288968e-06, "loss": 0.34962759017944334, "num_input_tokens_seen": 279790416, "step": 8775, "train_runtime": 22979.2247, "train_tokens_per_second": 12175.799 }, { "epoch": 0.5911661729060059, "grad_norm": 0.7103341446273141, "learning_rate": 7.995195152182307e-06, "loss": 0.347735857963562, "num_input_tokens_seen": 279948192, "step": 8780, "train_runtime": 22993.027, "train_tokens_per_second": 12175.352 }, { "epoch": 0.5915028279019661, "grad_norm": 0.7451778041182738, "learning_rate": 7.993077564478875e-06, "loss": 0.3549297332763672, "num_input_tokens_seen": 280110600, "step": 8785, "train_runtime": 23005.6833, "train_tokens_per_second": 12175.713 }, { "epoch": 0.5918394828979262, "grad_norm": 0.8300167940942154, "learning_rate": 7.990959139770844e-06, "loss": 0.3999783039093018, "num_input_tokens_seen": 280273760, "step": 8790, "train_runtime": 23018.5371, "train_tokens_per_second": 12176.002 }, { "epoch": 0.5921761378938863, "grad_norm": 0.8143973170883196, "learning_rate": 7.988839878650628e-06, "loss": 0.3855675935745239, "num_input_tokens_seen": 280436736, "step": 8795, "train_runtime": 23031.3402, "train_tokens_per_second": 12176.31 }, { "epoch": 0.5925127928898465, "grad_norm": 0.8448232082458818, "learning_rate": 7.986719781710872e-06, "loss": 0.40084547996520997, "num_input_tokens_seen": 280599328, "step": 8800, "train_runtime": 23044.7132, "train_tokens_per_second": 12176.299 }, { "epoch": 0.5928494478858066, "grad_norm": 0.8602322554365683, "learning_rate": 7.984598849544452e-06, "loss": 0.39586241245269777, "num_input_tokens_seen": 280759112, "step": 8805, "train_runtime": 23057.9959, "train_tokens_per_second": 12176.215 }, { "epoch": 0.5931861028817668, "grad_norm": 0.7899005891649498, "learning_rate": 7.98247708274448e-06, "loss": 0.39266557693481446, "num_input_tokens_seen": 280918480, "step": 8810, "train_runtime": 23071.6304, "train_tokens_per_second": 12175.927 }, { "epoch": 0.5935227578777269, "grad_norm": 0.7050545158480707, "learning_rate": 7.980354481904303e-06, "loss": 0.41337099075317385, "num_input_tokens_seen": 281079096, "step": 8815, "train_runtime": 23084.6181, "train_tokens_per_second": 12176.034 }, { "epoch": 0.593859412873687, "grad_norm": 0.7923408727023673, "learning_rate": 7.978231047617498e-06, "loss": 0.3995427131652832, "num_input_tokens_seen": 281237712, "step": 8820, "train_runtime": 23097.7902, "train_tokens_per_second": 12175.957 }, { "epoch": 0.5941960678696472, "grad_norm": 0.7871674414211024, "learning_rate": 7.976106780477878e-06, "loss": 0.38719174861907957, "num_input_tokens_seen": 281398936, "step": 8825, "train_runtime": 23110.8706, "train_tokens_per_second": 12176.042 }, { "epoch": 0.5945327228656073, "grad_norm": 0.8253029439980832, "learning_rate": 7.973981681079487e-06, "loss": 0.3673261642456055, "num_input_tokens_seen": 281558368, "step": 8830, "train_runtime": 23124.2971, "train_tokens_per_second": 12175.867 }, { "epoch": 0.5948693778615675, "grad_norm": 0.804235107789454, "learning_rate": 7.971855750016603e-06, "loss": 0.3686270475387573, "num_input_tokens_seen": 281718672, "step": 8835, "train_runtime": 23137.6598, "train_tokens_per_second": 12175.763 }, { "epoch": 0.5952060328575276, "grad_norm": 0.8452937818474988, "learning_rate": 7.969728987883734e-06, "loss": 0.4011039733886719, "num_input_tokens_seen": 281877344, "step": 8840, "train_runtime": 23150.2095, "train_tokens_per_second": 12176.017 }, { "epoch": 0.5955426878534877, "grad_norm": 0.8362119491621816, "learning_rate": 7.967601395275624e-06, "loss": 0.3875253438949585, "num_input_tokens_seen": 282037776, "step": 8845, "train_runtime": 23162.6057, "train_tokens_per_second": 12176.427 }, { "epoch": 0.5958793428494479, "grad_norm": 0.6566904327209583, "learning_rate": 7.965472972787247e-06, "loss": 0.3690237522125244, "num_input_tokens_seen": 282198616, "step": 8850, "train_runtime": 23175.6661, "train_tokens_per_second": 12176.505 }, { "epoch": 0.596215997845408, "grad_norm": 0.7347838525342171, "learning_rate": 7.963343721013808e-06, "loss": 0.3724492073059082, "num_input_tokens_seen": 282360136, "step": 8855, "train_runtime": 23188.1491, "train_tokens_per_second": 12176.916 }, { "epoch": 0.5965526528413682, "grad_norm": 0.7364155953264305, "learning_rate": 7.961213640550748e-06, "loss": 0.3840902328491211, "num_input_tokens_seen": 282522184, "step": 8860, "train_runtime": 23200.595, "train_tokens_per_second": 12177.368 }, { "epoch": 0.5968893078373283, "grad_norm": 0.7080907547368479, "learning_rate": 7.959082731993736e-06, "loss": 0.35625221729278567, "num_input_tokens_seen": 282682128, "step": 8865, "train_runtime": 23213.6346, "train_tokens_per_second": 12177.418 }, { "epoch": 0.5972259628332884, "grad_norm": 0.8238642332231467, "learning_rate": 7.956950995938673e-06, "loss": 0.3702124834060669, "num_input_tokens_seen": 282839920, "step": 8870, "train_runtime": 23226.8434, "train_tokens_per_second": 12177.286 }, { "epoch": 0.5975626178292486, "grad_norm": 0.7849987649911606, "learning_rate": 7.954818432981694e-06, "loss": 0.4011682987213135, "num_input_tokens_seen": 282997704, "step": 8875, "train_runtime": 23240.0692, "train_tokens_per_second": 12177.146 }, { "epoch": 0.5978992728252087, "grad_norm": 0.7736111628596385, "learning_rate": 7.952685043719162e-06, "loss": 0.36965084075927734, "num_input_tokens_seen": 283157928, "step": 8880, "train_runtime": 23253.0856, "train_tokens_per_second": 12177.22 }, { "epoch": 0.5982359278211689, "grad_norm": 0.8666893211101858, "learning_rate": 7.950550828747672e-06, "loss": 0.3772313117980957, "num_input_tokens_seen": 283320040, "step": 8885, "train_runtime": 23265.5242, "train_tokens_per_second": 12177.677 }, { "epoch": 0.598572582817129, "grad_norm": 0.7647879799162872, "learning_rate": 7.948415788664052e-06, "loss": 0.4188659191131592, "num_input_tokens_seen": 283478352, "step": 8890, "train_runtime": 23278.6013, "train_tokens_per_second": 12177.637 }, { "epoch": 0.5989092378130891, "grad_norm": 0.8678610623407963, "learning_rate": 7.946279924065359e-06, "loss": 0.3735698699951172, "num_input_tokens_seen": 283635440, "step": 8895, "train_runtime": 23291.851, "train_tokens_per_second": 12177.454 }, { "epoch": 0.5992458928090493, "grad_norm": 0.8213500777997411, "learning_rate": 7.94414323554888e-06, "loss": 0.4037994384765625, "num_input_tokens_seen": 283798128, "step": 8900, "train_runtime": 23304.8949, "train_tokens_per_second": 12177.619 }, { "epoch": 0.5995825478050094, "grad_norm": 0.7857615760198975, "learning_rate": 7.942005723712135e-06, "loss": 0.3853250503540039, "num_input_tokens_seen": 283960768, "step": 8905, "train_runtime": 23317.5692, "train_tokens_per_second": 12177.975 }, { "epoch": 0.5999192028009696, "grad_norm": 0.7497548305321684, "learning_rate": 7.939867389152868e-06, "loss": 0.3475773334503174, "num_input_tokens_seen": 284119888, "step": 8910, "train_runtime": 23330.3746, "train_tokens_per_second": 12178.111 }, { "epoch": 0.6002558577969297, "grad_norm": 0.7819093336243684, "learning_rate": 7.937728232469062e-06, "loss": 0.4126457214355469, "num_input_tokens_seen": 284279320, "step": 8915, "train_runtime": 23343.5346, "train_tokens_per_second": 12178.075 }, { "epoch": 0.6005925127928898, "grad_norm": 0.7601000914299808, "learning_rate": 7.935588254258921e-06, "loss": 0.4114988803863525, "num_input_tokens_seen": 284435456, "step": 8920, "train_runtime": 23357.2799, "train_tokens_per_second": 12177.593 }, { "epoch": 0.60092916778885, "grad_norm": 0.7900040179056541, "learning_rate": 7.933447455120889e-06, "loss": 0.37104811668396, "num_input_tokens_seen": 284594008, "step": 8925, "train_runtime": 23370.0561, "train_tokens_per_second": 12177.72 }, { "epoch": 0.6012658227848101, "grad_norm": 0.8022451977677605, "learning_rate": 7.931305835653629e-06, "loss": 0.3637326955795288, "num_input_tokens_seen": 284755288, "step": 8930, "train_runtime": 23382.4795, "train_tokens_per_second": 12178.148 }, { "epoch": 0.6016024777807703, "grad_norm": 0.7375049038345973, "learning_rate": 7.929163396456038e-06, "loss": 0.40918521881103515, "num_input_tokens_seen": 284913176, "step": 8935, "train_runtime": 23395.3012, "train_tokens_per_second": 12178.222 }, { "epoch": 0.6019391327767304, "grad_norm": 0.8072144346128841, "learning_rate": 7.927020138127245e-06, "loss": 0.38272120952606203, "num_input_tokens_seen": 285073000, "step": 8940, "train_runtime": 23407.9168, "train_tokens_per_second": 12178.487 }, { "epoch": 0.6022757877726905, "grad_norm": 0.7882028314213002, "learning_rate": 7.924876061266603e-06, "loss": 0.3714626312255859, "num_input_tokens_seen": 285234480, "step": 8945, "train_runtime": 23420.4564, "train_tokens_per_second": 12178.861 }, { "epoch": 0.6026124427686507, "grad_norm": 0.8754163575029166, "learning_rate": 7.922731166473698e-06, "loss": 0.40097503662109374, "num_input_tokens_seen": 285394888, "step": 8950, "train_runtime": 23433.9563, "train_tokens_per_second": 12178.69 }, { "epoch": 0.6029490977646108, "grad_norm": 0.8508960258467497, "learning_rate": 7.920585454348341e-06, "loss": 0.37189421653747556, "num_input_tokens_seen": 285555016, "step": 8955, "train_runtime": 23447.8168, "train_tokens_per_second": 12178.32 }, { "epoch": 0.603285752760571, "grad_norm": 0.8362788484676088, "learning_rate": 7.918438925490578e-06, "loss": 0.35410442352294924, "num_input_tokens_seen": 285717328, "step": 8960, "train_runtime": 23461.1444, "train_tokens_per_second": 12178.32 }, { "epoch": 0.6036224077565311, "grad_norm": 0.8386698450276354, "learning_rate": 7.916291580500672e-06, "loss": 0.37752423286437986, "num_input_tokens_seen": 285876280, "step": 8965, "train_runtime": 23473.7226, "train_tokens_per_second": 12178.566 }, { "epoch": 0.6039590627524912, "grad_norm": 0.8045346955682096, "learning_rate": 7.914143419979127e-06, "loss": 0.35655837059020995, "num_input_tokens_seen": 286038840, "step": 8970, "train_runtime": 23486.717, "train_tokens_per_second": 12178.749 }, { "epoch": 0.6042957177484514, "grad_norm": 0.7017855589952327, "learning_rate": 7.911994444526667e-06, "loss": 0.34722366333007815, "num_input_tokens_seen": 286199160, "step": 8975, "train_runtime": 23500.129, "train_tokens_per_second": 12178.621 }, { "epoch": 0.6046323727444115, "grad_norm": 0.6849381736555221, "learning_rate": 7.909844654744246e-06, "loss": 0.3659569263458252, "num_input_tokens_seen": 286360816, "step": 8980, "train_runtime": 23513.3141, "train_tokens_per_second": 12178.667 }, { "epoch": 0.6049690277403716, "grad_norm": 0.8095170848709679, "learning_rate": 7.907694051233044e-06, "loss": 0.4197356700897217, "num_input_tokens_seen": 286519024, "step": 8985, "train_runtime": 23526.823, "train_tokens_per_second": 12178.398 }, { "epoch": 0.6053056827363318, "grad_norm": 0.6597064582321633, "learning_rate": 7.905542634594476e-06, "loss": 0.3881105899810791, "num_input_tokens_seen": 286677648, "step": 8990, "train_runtime": 23539.3624, "train_tokens_per_second": 12178.65 }, { "epoch": 0.6056423377322919, "grad_norm": 0.7848981795311314, "learning_rate": 7.903390405430174e-06, "loss": 0.3517893314361572, "num_input_tokens_seen": 286837536, "step": 8995, "train_runtime": 23552.9672, "train_tokens_per_second": 12178.403 }, { "epoch": 0.6059789927282521, "grad_norm": 0.8482209975508648, "learning_rate": 7.901237364342003e-06, "loss": 0.36460878849029543, "num_input_tokens_seen": 286988872, "step": 9000, "train_runtime": 23565.9246, "train_tokens_per_second": 12178.129 }, { "epoch": 0.6063156477242122, "grad_norm": 0.7955616993774309, "learning_rate": 7.899083511932053e-06, "loss": 0.3517482042312622, "num_input_tokens_seen": 287147792, "step": 9005, "train_runtime": 23578.9165, "train_tokens_per_second": 12178.159 }, { "epoch": 0.6066523027201723, "grad_norm": 0.7697559834799271, "learning_rate": 7.896928848802645e-06, "loss": 0.3766965389251709, "num_input_tokens_seen": 287311632, "step": 9010, "train_runtime": 23591.3251, "train_tokens_per_second": 12178.698 }, { "epoch": 0.6069889577161325, "grad_norm": 0.7199901453444618, "learning_rate": 7.894773375556322e-06, "loss": 0.3919867753982544, "num_input_tokens_seen": 287465672, "step": 9015, "train_runtime": 23604.5386, "train_tokens_per_second": 12178.407 }, { "epoch": 0.6073256127120926, "grad_norm": 0.8101691652911277, "learning_rate": 7.892617092795855e-06, "loss": 0.42398991584777834, "num_input_tokens_seen": 287623632, "step": 9020, "train_runtime": 23617.7205, "train_tokens_per_second": 12178.298 }, { "epoch": 0.6076622677080528, "grad_norm": 0.7689033259377673, "learning_rate": 7.890460001124242e-06, "loss": 0.3903092861175537, "num_input_tokens_seen": 287781584, "step": 9025, "train_runtime": 23631.0546, "train_tokens_per_second": 12178.11 }, { "epoch": 0.6079989227040129, "grad_norm": 0.8003076154440676, "learning_rate": 7.888302101144707e-06, "loss": 0.39416003227233887, "num_input_tokens_seen": 287939840, "step": 9030, "train_runtime": 23643.7573, "train_tokens_per_second": 12178.261 }, { "epoch": 0.608335577699973, "grad_norm": 0.7865560672753751, "learning_rate": 7.886143393460699e-06, "loss": 0.41128716468811033, "num_input_tokens_seen": 288101744, "step": 9035, "train_runtime": 23656.3058, "train_tokens_per_second": 12178.645 }, { "epoch": 0.6086722326959332, "grad_norm": 0.7875181115627478, "learning_rate": 7.883983878675895e-06, "loss": 0.37975549697875977, "num_input_tokens_seen": 288265584, "step": 9040, "train_runtime": 23668.7304, "train_tokens_per_second": 12179.174 }, { "epoch": 0.6090088876918933, "grad_norm": 0.7582833487953359, "learning_rate": 7.881823557394194e-06, "loss": 0.39029483795166015, "num_input_tokens_seen": 288429328, "step": 9045, "train_runtime": 23681.8035, "train_tokens_per_second": 12179.365 }, { "epoch": 0.6093455426878535, "grad_norm": 0.749531808486419, "learning_rate": 7.879662430219728e-06, "loss": 0.36229681968688965, "num_input_tokens_seen": 288584096, "step": 9050, "train_runtime": 23695.2908, "train_tokens_per_second": 12178.964 }, { "epoch": 0.6096821976838136, "grad_norm": 0.8493674933295446, "learning_rate": 7.877500497756843e-06, "loss": 0.4147617340087891, "num_input_tokens_seen": 288745008, "step": 9055, "train_runtime": 23708.329, "train_tokens_per_second": 12179.054 }, { "epoch": 0.6100188526797737, "grad_norm": 0.9887661985930278, "learning_rate": 7.87533776061012e-06, "loss": 0.38833179473876955, "num_input_tokens_seen": 288904576, "step": 9060, "train_runtime": 23721.5335, "train_tokens_per_second": 12179.001 }, { "epoch": 0.6103555076757339, "grad_norm": 0.7686606359638662, "learning_rate": 7.873174219384362e-06, "loss": 0.413944149017334, "num_input_tokens_seen": 289065528, "step": 9065, "train_runtime": 23734.2953, "train_tokens_per_second": 12179.234 }, { "epoch": 0.610692162671694, "grad_norm": 0.8110899315310492, "learning_rate": 7.871009874684595e-06, "loss": 0.4094103813171387, "num_input_tokens_seen": 289226656, "step": 9070, "train_runtime": 23746.8077, "train_tokens_per_second": 12179.602 }, { "epoch": 0.6110288176676542, "grad_norm": 0.9484941214828831, "learning_rate": 7.868844727116072e-06, "loss": 0.40843710899353025, "num_input_tokens_seen": 289384936, "step": 9075, "train_runtime": 23759.9151, "train_tokens_per_second": 12179.544 }, { "epoch": 0.6113654726636143, "grad_norm": 0.7242308894248829, "learning_rate": 7.866678777284267e-06, "loss": 0.3753045558929443, "num_input_tokens_seen": 289545840, "step": 9080, "train_runtime": 23773.3948, "train_tokens_per_second": 12179.407 }, { "epoch": 0.6117021276595744, "grad_norm": 0.7845727151169357, "learning_rate": 7.864512025794886e-06, "loss": 0.38861889839172364, "num_input_tokens_seen": 289706912, "step": 9085, "train_runtime": 23786.1323, "train_tokens_per_second": 12179.656 }, { "epoch": 0.6120387826555346, "grad_norm": 0.9692023666159564, "learning_rate": 7.86234447325385e-06, "loss": 0.35805387496948243, "num_input_tokens_seen": 289865864, "step": 9090, "train_runtime": 23798.7783, "train_tokens_per_second": 12179.863 }, { "epoch": 0.6123754376514947, "grad_norm": 0.9122754061754776, "learning_rate": 7.860176120267309e-06, "loss": 0.42113037109375, "num_input_tokens_seen": 290027224, "step": 9095, "train_runtime": 23811.3137, "train_tokens_per_second": 12180.228 }, { "epoch": 0.6127120926474549, "grad_norm": 0.7268134512640009, "learning_rate": 7.858006967441637e-06, "loss": 0.3743340492248535, "num_input_tokens_seen": 290184216, "step": 9100, "train_runtime": 23824.8737, "train_tokens_per_second": 12179.885 }, { "epoch": 0.613048747643415, "grad_norm": 0.8719108636652475, "learning_rate": 7.85583701538343e-06, "loss": 0.4194091796875, "num_input_tokens_seen": 290346312, "step": 9105, "train_runtime": 23837.4548, "train_tokens_per_second": 12180.256 }, { "epoch": 0.6133854026393751, "grad_norm": 0.8611505214761725, "learning_rate": 7.853666264699506e-06, "loss": 0.3680274963378906, "num_input_tokens_seen": 290505432, "step": 9110, "train_runtime": 23850.9427, "train_tokens_per_second": 12180.04 }, { "epoch": 0.6137220576353353, "grad_norm": 0.7512745837140431, "learning_rate": 7.851494715996914e-06, "loss": 0.4184731006622314, "num_input_tokens_seen": 290664120, "step": 9115, "train_runtime": 23863.6889, "train_tokens_per_second": 12180.184 }, { "epoch": 0.6140587126312954, "grad_norm": 0.8121069178417053, "learning_rate": 7.849322369882915e-06, "loss": 0.36065824031829835, "num_input_tokens_seen": 290825632, "step": 9120, "train_runtime": 23876.1368, "train_tokens_per_second": 12180.598 }, { "epoch": 0.6143953676272556, "grad_norm": 0.7577998032576303, "learning_rate": 7.847149226965003e-06, "loss": 0.3561420440673828, "num_input_tokens_seen": 290981504, "step": 9125, "train_runtime": 23888.7392, "train_tokens_per_second": 12180.697 }, { "epoch": 0.6147320226232157, "grad_norm": 0.9172271248760583, "learning_rate": 7.844975287850886e-06, "loss": 0.3470319271087646, "num_input_tokens_seen": 291142904, "step": 9130, "train_runtime": 23902.4085, "train_tokens_per_second": 12180.484 }, { "epoch": 0.6150686776191758, "grad_norm": 0.719020617041841, "learning_rate": 7.842800553148506e-06, "loss": 0.4091758728027344, "num_input_tokens_seen": 291300552, "step": 9135, "train_runtime": 23916.2763, "train_tokens_per_second": 12180.013 }, { "epoch": 0.615405332615136, "grad_norm": 0.7404291565440465, "learning_rate": 7.840625023466014e-06, "loss": 0.37669970989227297, "num_input_tokens_seen": 291464384, "step": 9140, "train_runtime": 23929.4137, "train_tokens_per_second": 12180.172 }, { "epoch": 0.6157419876110961, "grad_norm": 0.8431832118210815, "learning_rate": 7.838448699411792e-06, "loss": 0.36565518379211426, "num_input_tokens_seen": 291625040, "step": 9145, "train_runtime": 23942.5143, "train_tokens_per_second": 12180.218 }, { "epoch": 0.6160786426070562, "grad_norm": 0.7662486188210009, "learning_rate": 7.836271581594442e-06, "loss": 0.4152923583984375, "num_input_tokens_seen": 291788592, "step": 9150, "train_runtime": 23955.5591, "train_tokens_per_second": 12180.413 }, { "epoch": 0.6164152976030164, "grad_norm": 0.8101167711617063, "learning_rate": 7.834093670622789e-06, "loss": 0.40111422538757324, "num_input_tokens_seen": 291945824, "step": 9155, "train_runtime": 23968.7824, "train_tokens_per_second": 12180.253 }, { "epoch": 0.6167519525989765, "grad_norm": 0.7762839315864667, "learning_rate": 7.831914967105878e-06, "loss": 0.4347250938415527, "num_input_tokens_seen": 292106656, "step": 9160, "train_runtime": 23981.2091, "train_tokens_per_second": 12180.648 }, { "epoch": 0.6170886075949367, "grad_norm": 0.7125706272776811, "learning_rate": 7.829735471652978e-06, "loss": 0.35070099830627444, "num_input_tokens_seen": 292265792, "step": 9165, "train_runtime": 23994.3153, "train_tokens_per_second": 12180.626 }, { "epoch": 0.6174252625908968, "grad_norm": 0.9294847354353997, "learning_rate": 7.827555184873575e-06, "loss": 0.4055934906005859, "num_input_tokens_seen": 292425880, "step": 9170, "train_runtime": 24007.2315, "train_tokens_per_second": 12180.741 }, { "epoch": 0.617761917586857, "grad_norm": 0.7492561996379158, "learning_rate": 7.825374107377381e-06, "loss": 0.3657411813735962, "num_input_tokens_seen": 292586440, "step": 9175, "train_runtime": 24019.8859, "train_tokens_per_second": 12181.009 }, { "epoch": 0.6180985725828171, "grad_norm": 0.8712370340218983, "learning_rate": 7.823192239774327e-06, "loss": 0.3919386863708496, "num_input_tokens_seen": 292745960, "step": 9180, "train_runtime": 24033.4372, "train_tokens_per_second": 12180.778 }, { "epoch": 0.6184352275787772, "grad_norm": 0.7540690727529309, "learning_rate": 7.821009582674567e-06, "loss": 0.39654107093811036, "num_input_tokens_seen": 292904952, "step": 9185, "train_runtime": 24046.5699, "train_tokens_per_second": 12180.737 }, { "epoch": 0.6187718825747374, "grad_norm": 0.7841719577989008, "learning_rate": 7.818826136688473e-06, "loss": 0.41560792922973633, "num_input_tokens_seen": 293067016, "step": 9190, "train_runtime": 24059.0237, "train_tokens_per_second": 12181.168 }, { "epoch": 0.6191085375706975, "grad_norm": 0.8190941515639358, "learning_rate": 7.816641902426638e-06, "loss": 0.40740361213684084, "num_input_tokens_seen": 293226608, "step": 9195, "train_runtime": 24071.4867, "train_tokens_per_second": 12181.491 }, { "epoch": 0.6194451925666576, "grad_norm": 0.8743595905110048, "learning_rate": 7.814456880499877e-06, "loss": 0.3890812873840332, "num_input_tokens_seen": 293384608, "step": 9200, "train_runtime": 24085.1341, "train_tokens_per_second": 12181.149 }, { "epoch": 0.6197818475626178, "grad_norm": 0.928077575479999, "learning_rate": 7.812271071519222e-06, "loss": 0.4053468704223633, "num_input_tokens_seen": 293541656, "step": 9205, "train_runtime": 24098.7869, "train_tokens_per_second": 12180.765 }, { "epoch": 0.6201185025585779, "grad_norm": 0.73520523977525, "learning_rate": 7.810084476095932e-06, "loss": 0.35848202705383303, "num_input_tokens_seen": 293702368, "step": 9210, "train_runtime": 24112.1333, "train_tokens_per_second": 12180.688 }, { "epoch": 0.6204551575545381, "grad_norm": 0.780470601554464, "learning_rate": 7.807897094841476e-06, "loss": 0.39025588035583497, "num_input_tokens_seen": 293859200, "step": 9215, "train_runtime": 24125.2113, "train_tokens_per_second": 12180.586 }, { "epoch": 0.6207918125504982, "grad_norm": 0.7618089512461381, "learning_rate": 7.805708928367555e-06, "loss": 0.37273664474487306, "num_input_tokens_seen": 294013792, "step": 9220, "train_runtime": 24139.0048, "train_tokens_per_second": 12180.03 }, { "epoch": 0.6211284675464583, "grad_norm": 0.7819775526912318, "learning_rate": 7.803519977286075e-06, "loss": 0.41295676231384276, "num_input_tokens_seen": 294168016, "step": 9225, "train_runtime": 24151.6562, "train_tokens_per_second": 12180.035 }, { "epoch": 0.6214651225424185, "grad_norm": 0.7487835022848892, "learning_rate": 7.801330242209176e-06, "loss": 0.3901520729064941, "num_input_tokens_seen": 294321824, "step": 9230, "train_runtime": 24164.0927, "train_tokens_per_second": 12180.131 }, { "epoch": 0.6218017775383786, "grad_norm": 0.8670256618164732, "learning_rate": 7.799139723749207e-06, "loss": 0.404341983795166, "num_input_tokens_seen": 294475952, "step": 9235, "train_runtime": 24177.1819, "train_tokens_per_second": 12179.912 }, { "epoch": 0.6221384325343388, "grad_norm": 0.8435578140362983, "learning_rate": 7.79694842251874e-06, "loss": 0.4066864013671875, "num_input_tokens_seen": 294636528, "step": 9240, "train_runtime": 24189.6066, "train_tokens_per_second": 12180.294 }, { "epoch": 0.6224750875302989, "grad_norm": 0.7215396442858609, "learning_rate": 7.794756339130565e-06, "loss": 0.38472962379455566, "num_input_tokens_seen": 294799728, "step": 9245, "train_runtime": 24202.4406, "train_tokens_per_second": 12180.579 }, { "epoch": 0.622811742526259, "grad_norm": 0.7765244248354118, "learning_rate": 7.792563474197692e-06, "loss": 0.3896779537200928, "num_input_tokens_seen": 294955560, "step": 9250, "train_runtime": 24216.2673, "train_tokens_per_second": 12180.059 }, { "epoch": 0.6231483975222192, "grad_norm": 0.7285516595637883, "learning_rate": 7.79036982833335e-06, "loss": 0.409562349319458, "num_input_tokens_seen": 295117640, "step": 9255, "train_runtime": 24228.858, "train_tokens_per_second": 12180.419 }, { "epoch": 0.6234850525181793, "grad_norm": 0.802454557810152, "learning_rate": 7.78817540215098e-06, "loss": 0.3786600351333618, "num_input_tokens_seen": 295278544, "step": 9260, "train_runtime": 24241.9456, "train_tokens_per_second": 12180.48 }, { "epoch": 0.6238217075141395, "grad_norm": 0.7418031601802797, "learning_rate": 7.78598019626425e-06, "loss": 0.3960576057434082, "num_input_tokens_seen": 295439992, "step": 9265, "train_runtime": 24254.4825, "train_tokens_per_second": 12180.841 }, { "epoch": 0.6241583625100996, "grad_norm": 0.7436413209478754, "learning_rate": 7.783784211287044e-06, "loss": 0.3982872486114502, "num_input_tokens_seen": 295591312, "step": 9270, "train_runtime": 24267.9091, "train_tokens_per_second": 12180.337 }, { "epoch": 0.6244950175060597, "grad_norm": 0.8225552651030371, "learning_rate": 7.78158744783346e-06, "loss": 0.4066149711608887, "num_input_tokens_seen": 295751928, "step": 9275, "train_runtime": 24281.8287, "train_tokens_per_second": 12179.969 }, { "epoch": 0.6248316725020199, "grad_norm": 0.8776165063676942, "learning_rate": 7.779389906517813e-06, "loss": 0.36040706634521485, "num_input_tokens_seen": 295912176, "step": 9280, "train_runtime": 24294.8564, "train_tokens_per_second": 12180.034 }, { "epoch": 0.6251683274979801, "grad_norm": 0.8096869951293024, "learning_rate": 7.777191587954645e-06, "loss": 0.3809802532196045, "num_input_tokens_seen": 296066848, "step": 9285, "train_runtime": 24307.744, "train_tokens_per_second": 12179.939 }, { "epoch": 0.6255049824939403, "grad_norm": 0.8494302477707368, "learning_rate": 7.774992492758704e-06, "loss": 0.37774038314819336, "num_input_tokens_seen": 296223360, "step": 9290, "train_runtime": 24320.5823, "train_tokens_per_second": 12179.945 }, { "epoch": 0.6258416374899004, "grad_norm": 0.7589427998234359, "learning_rate": 7.77279262154496e-06, "loss": 0.3866282939910889, "num_input_tokens_seen": 296384384, "step": 9295, "train_runtime": 24333.8313, "train_tokens_per_second": 12179.931 }, { "epoch": 0.6261782924858605, "grad_norm": 0.8752839079239674, "learning_rate": 7.770591974928604e-06, "loss": 0.42908878326416017, "num_input_tokens_seen": 296545152, "step": 9300, "train_runtime": 24346.2857, "train_tokens_per_second": 12180.304 }, { "epoch": 0.6265149474818207, "grad_norm": 0.7120098656109812, "learning_rate": 7.768390553525034e-06, "loss": 0.37722671031951904, "num_input_tokens_seen": 296708992, "step": 9305, "train_runtime": 24358.7147, "train_tokens_per_second": 12180.815 }, { "epoch": 0.6268516024777808, "grad_norm": 0.7880343935520849, "learning_rate": 7.766188357949875e-06, "loss": 0.37330379486083987, "num_input_tokens_seen": 296867896, "step": 9310, "train_runtime": 24371.6229, "train_tokens_per_second": 12180.883 }, { "epoch": 0.627188257473741, "grad_norm": 0.8277986295011157, "learning_rate": 7.763985388818963e-06, "loss": 0.3654982566833496, "num_input_tokens_seen": 297026312, "step": 9315, "train_runtime": 24384.6928, "train_tokens_per_second": 12180.851 }, { "epoch": 0.6275249124697011, "grad_norm": 0.8374240498833566, "learning_rate": 7.76178164674835e-06, "loss": 0.3375447988510132, "num_input_tokens_seen": 297183520, "step": 9320, "train_runtime": 24398.2991, "train_tokens_per_second": 12180.502 }, { "epoch": 0.6278615674656612, "grad_norm": 0.7816731165558601, "learning_rate": 7.759577132354305e-06, "loss": 0.38550314903259275, "num_input_tokens_seen": 297345448, "step": 9325, "train_runtime": 24410.9048, "train_tokens_per_second": 12180.845 }, { "epoch": 0.6281982224616214, "grad_norm": 0.7578409675591835, "learning_rate": 7.757371846253315e-06, "loss": 0.34258270263671875, "num_input_tokens_seen": 297501024, "step": 9330, "train_runtime": 24423.649, "train_tokens_per_second": 12180.859 }, { "epoch": 0.6285348774575815, "grad_norm": 0.7505307392363114, "learning_rate": 7.755165789062083e-06, "loss": 0.4085099220275879, "num_input_tokens_seen": 297661824, "step": 9335, "train_runtime": 24436.2613, "train_tokens_per_second": 12181.152 }, { "epoch": 0.6288715324535417, "grad_norm": 0.7448974634311154, "learning_rate": 7.752958961397522e-06, "loss": 0.38463964462280276, "num_input_tokens_seen": 297821848, "step": 9340, "train_runtime": 24448.6821, "train_tokens_per_second": 12181.509 }, { "epoch": 0.6292081874495018, "grad_norm": 0.7353586561374738, "learning_rate": 7.750751363876765e-06, "loss": 0.3922884941101074, "num_input_tokens_seen": 297979992, "step": 9345, "train_runtime": 24461.5405, "train_tokens_per_second": 12181.571 }, { "epoch": 0.6295448424454619, "grad_norm": 0.7840945054857366, "learning_rate": 7.748542997117162e-06, "loss": 0.3817403316497803, "num_input_tokens_seen": 298141720, "step": 9350, "train_runtime": 24475.0162, "train_tokens_per_second": 12181.472 }, { "epoch": 0.6298814974414221, "grad_norm": 0.7872579958313309, "learning_rate": 7.746333861736275e-06, "loss": 0.35845060348510743, "num_input_tokens_seen": 298298488, "step": 9355, "train_runtime": 24488.9948, "train_tokens_per_second": 12180.92 }, { "epoch": 0.6302181524373822, "grad_norm": 0.772511553990588, "learning_rate": 7.74412395835188e-06, "loss": 0.39458537101745605, "num_input_tokens_seen": 298457392, "step": 9360, "train_runtime": 24501.5503, "train_tokens_per_second": 12181.164 }, { "epoch": 0.6305548074333424, "grad_norm": 0.7394341024220819, "learning_rate": 7.74191328758197e-06, "loss": 0.3871213674545288, "num_input_tokens_seen": 298615648, "step": 9365, "train_runtime": 24514.4067, "train_tokens_per_second": 12181.231 }, { "epoch": 0.6308914624293025, "grad_norm": 0.9128110585746823, "learning_rate": 7.739701850044752e-06, "loss": 0.4151636600494385, "num_input_tokens_seen": 298775352, "step": 9370, "train_runtime": 24527.7166, "train_tokens_per_second": 12181.132 }, { "epoch": 0.6312281174252626, "grad_norm": 0.7729114399406369, "learning_rate": 7.73748964635865e-06, "loss": 0.3765444040298462, "num_input_tokens_seen": 298936488, "step": 9375, "train_runtime": 24540.7166, "train_tokens_per_second": 12181.245 }, { "epoch": 0.6315647724212228, "grad_norm": 0.8021515237596587, "learning_rate": 7.735276677142297e-06, "loss": 0.34388697147369385, "num_input_tokens_seen": 299088880, "step": 9380, "train_runtime": 24554.2559, "train_tokens_per_second": 12180.735 }, { "epoch": 0.6319014274171829, "grad_norm": 0.7845684536905075, "learning_rate": 7.733062943014542e-06, "loss": 0.4200117111206055, "num_input_tokens_seen": 299251040, "step": 9385, "train_runtime": 24567.0177, "train_tokens_per_second": 12181.008 }, { "epoch": 0.632238082413143, "grad_norm": 0.7580483437022177, "learning_rate": 7.730848444594452e-06, "loss": 0.3718400478363037, "num_input_tokens_seen": 299412360, "step": 9390, "train_runtime": 24579.5433, "train_tokens_per_second": 12181.364 }, { "epoch": 0.6325747374091032, "grad_norm": 0.7644558018026806, "learning_rate": 7.7286331825013e-06, "loss": 0.36536850929260256, "num_input_tokens_seen": 299569992, "step": 9395, "train_runtime": 24592.5727, "train_tokens_per_second": 12181.32 }, { "epoch": 0.6329113924050633, "grad_norm": 0.8855408815221194, "learning_rate": 7.72641715735458e-06, "loss": 0.38566153049468993, "num_input_tokens_seen": 299728600, "step": 9400, "train_runtime": 24605.4558, "train_tokens_per_second": 12181.388 }, { "epoch": 0.6332480474010235, "grad_norm": 0.860610224670672, "learning_rate": 7.724200369773998e-06, "loss": 0.4158731460571289, "num_input_tokens_seen": 299891664, "step": 9405, "train_runtime": 24618.6065, "train_tokens_per_second": 12181.504 }, { "epoch": 0.6335847023969836, "grad_norm": 0.7674006834943989, "learning_rate": 7.721982820379467e-06, "loss": 0.374387526512146, "num_input_tokens_seen": 300050872, "step": 9410, "train_runtime": 24632.172, "train_tokens_per_second": 12181.259 }, { "epoch": 0.6339213573929438, "grad_norm": 0.8370842010257241, "learning_rate": 7.719764509791123e-06, "loss": 0.3891880989074707, "num_input_tokens_seen": 300200416, "step": 9415, "train_runtime": 24645.6499, "train_tokens_per_second": 12180.665 }, { "epoch": 0.6342580123889039, "grad_norm": 0.8418827874617654, "learning_rate": 7.717545438629303e-06, "loss": 0.4424652099609375, "num_input_tokens_seen": 300364096, "step": 9420, "train_runtime": 24658.7003, "train_tokens_per_second": 12180.857 }, { "epoch": 0.634594667384864, "grad_norm": 0.8044552876573974, "learning_rate": 7.71532560751457e-06, "loss": 0.3684035301208496, "num_input_tokens_seen": 300524592, "step": 9425, "train_runtime": 24672.1734, "train_tokens_per_second": 12180.71 }, { "epoch": 0.6349313223808242, "grad_norm": 0.7916068717380753, "learning_rate": 7.713105017067686e-06, "loss": 0.3946441411972046, "num_input_tokens_seen": 300688432, "step": 9430, "train_runtime": 24684.5941, "train_tokens_per_second": 12181.218 }, { "epoch": 0.6352679773767843, "grad_norm": 0.7835795313529306, "learning_rate": 7.710883667909639e-06, "loss": 0.37479429244995116, "num_input_tokens_seen": 300846544, "step": 9435, "train_runtime": 24697.5913, "train_tokens_per_second": 12181.21 }, { "epoch": 0.6356046323727444, "grad_norm": 0.8073490872966396, "learning_rate": 7.708661560661617e-06, "loss": 0.4086909294128418, "num_input_tokens_seen": 301007096, "step": 9440, "train_runtime": 24710.0148, "train_tokens_per_second": 12181.583 }, { "epoch": 0.6359412873687046, "grad_norm": 0.9170585496865793, "learning_rate": 7.706438695945026e-06, "loss": 0.3982698917388916, "num_input_tokens_seen": 301166248, "step": 9445, "train_runtime": 24722.6192, "train_tokens_per_second": 12181.81 }, { "epoch": 0.6362779423646647, "grad_norm": 0.8099390338660851, "learning_rate": 7.704215074381484e-06, "loss": 0.38959312438964844, "num_input_tokens_seen": 301315752, "step": 9450, "train_runtime": 24735.2575, "train_tokens_per_second": 12181.63 }, { "epoch": 0.6366145973606249, "grad_norm": 0.8832774892333866, "learning_rate": 7.70199069659282e-06, "loss": 0.3853009223937988, "num_input_tokens_seen": 301473864, "step": 9455, "train_runtime": 24748.4005, "train_tokens_per_second": 12181.549 }, { "epoch": 0.636951252356585, "grad_norm": 0.7629907383605017, "learning_rate": 7.699765563201075e-06, "loss": 0.3948886156082153, "num_input_tokens_seen": 301633592, "step": 9460, "train_runtime": 24760.9519, "train_tokens_per_second": 12181.825 }, { "epoch": 0.6372879073525451, "grad_norm": 0.7332082529886655, "learning_rate": 7.697539674828498e-06, "loss": 0.38031625747680664, "num_input_tokens_seen": 301797336, "step": 9465, "train_runtime": 24774.0405, "train_tokens_per_second": 12181.999 }, { "epoch": 0.6376245623485053, "grad_norm": 0.7664332509282752, "learning_rate": 7.695313032097554e-06, "loss": 0.3588172197341919, "num_input_tokens_seen": 301956024, "step": 9470, "train_runtime": 24787.0756, "train_tokens_per_second": 12181.995 }, { "epoch": 0.6379612173444654, "grad_norm": 0.7416778875937772, "learning_rate": 7.693085635630913e-06, "loss": 0.38371524810791013, "num_input_tokens_seen": 302109184, "step": 9475, "train_runtime": 24799.9308, "train_tokens_per_second": 12181.856 }, { "epoch": 0.6382978723404256, "grad_norm": 0.8303200197730307, "learning_rate": 7.690857486051463e-06, "loss": 0.37233662605285645, "num_input_tokens_seen": 302271160, "step": 9480, "train_runtime": 24812.5754, "train_tokens_per_second": 12182.176 }, { "epoch": 0.6386345273363857, "grad_norm": 0.7166377093512025, "learning_rate": 7.688628583982298e-06, "loss": 0.3579227924346924, "num_input_tokens_seen": 302424952, "step": 9485, "train_runtime": 24825.1099, "train_tokens_per_second": 12182.22 }, { "epoch": 0.6389711823323458, "grad_norm": 0.7657009096898025, "learning_rate": 7.68639893004672e-06, "loss": 0.36395127773284913, "num_input_tokens_seen": 302587216, "step": 9490, "train_runtime": 24838.3303, "train_tokens_per_second": 12182.269 }, { "epoch": 0.639307837328306, "grad_norm": 0.7886960877465337, "learning_rate": 7.684168524868253e-06, "loss": 0.36876890659332273, "num_input_tokens_seen": 302751056, "step": 9495, "train_runtime": 24850.7543, "train_tokens_per_second": 12182.771 }, { "epoch": 0.6396444923242661, "grad_norm": 0.7671192065472773, "learning_rate": 7.681937369070612e-06, "loss": 0.39136033058166503, "num_input_tokens_seen": 302907128, "step": 9500, "train_runtime": 24864.212, "train_tokens_per_second": 12182.454 }, { "epoch": 0.6399811473202263, "grad_norm": 0.8186722468718604, "learning_rate": 7.67970546327774e-06, "loss": 0.3906740665435791, "num_input_tokens_seen": 303068112, "step": 9505, "train_runtime": 24877.0468, "train_tokens_per_second": 12182.64 }, { "epoch": 0.6403178023161864, "grad_norm": 1.0085198271159794, "learning_rate": 7.67747280811378e-06, "loss": 0.3567544460296631, "num_input_tokens_seen": 303226688, "step": 9510, "train_runtime": 24889.935, "train_tokens_per_second": 12182.703 }, { "epoch": 0.6406544573121465, "grad_norm": 0.672436175512182, "learning_rate": 7.675239404203088e-06, "loss": 0.34552655220031736, "num_input_tokens_seen": 303385680, "step": 9515, "train_runtime": 24902.4084, "train_tokens_per_second": 12182.985 }, { "epoch": 0.6409911123081067, "grad_norm": 0.8385608894310054, "learning_rate": 7.673005252170226e-06, "loss": 0.40718975067138674, "num_input_tokens_seen": 303548088, "step": 9520, "train_runtime": 24915.0188, "train_tokens_per_second": 12183.338 }, { "epoch": 0.6413277673040668, "grad_norm": 0.8078099550398448, "learning_rate": 7.670770352639968e-06, "loss": 0.36879839897155764, "num_input_tokens_seen": 303708288, "step": 9525, "train_runtime": 24929.3781, "train_tokens_per_second": 12182.746 }, { "epoch": 0.641664422300027, "grad_norm": 0.7597356786701748, "learning_rate": 7.668534706237299e-06, "loss": 0.3803065299987793, "num_input_tokens_seen": 303866264, "step": 9530, "train_runtime": 24942.5705, "train_tokens_per_second": 12182.636 }, { "epoch": 0.6420010772959871, "grad_norm": 0.8329749626046767, "learning_rate": 7.666298313587409e-06, "loss": 0.4222110748291016, "num_input_tokens_seen": 304026192, "step": 9535, "train_runtime": 24955.753, "train_tokens_per_second": 12182.609 }, { "epoch": 0.6423377322919472, "grad_norm": 0.8170117359261758, "learning_rate": 7.664061175315696e-06, "loss": 0.369573712348938, "num_input_tokens_seen": 304182296, "step": 9540, "train_runtime": 24970.481, "train_tokens_per_second": 12181.675 }, { "epoch": 0.6426743872879074, "grad_norm": 0.7612852091189225, "learning_rate": 7.661823292047771e-06, "loss": 0.3984743595123291, "num_input_tokens_seen": 304339032, "step": 9545, "train_runtime": 24983.3821, "train_tokens_per_second": 12181.659 }, { "epoch": 0.6430110422838675, "grad_norm": 0.8527087021681153, "learning_rate": 7.659584664409452e-06, "loss": 0.3907004833221436, "num_input_tokens_seen": 304501992, "step": 9550, "train_runtime": 24996.8685, "train_tokens_per_second": 12181.606 }, { "epoch": 0.6433476972798277, "grad_norm": 0.8144762067752043, "learning_rate": 7.65734529302676e-06, "loss": 0.34315185546875, "num_input_tokens_seen": 304655232, "step": 9555, "train_runtime": 25009.934, "train_tokens_per_second": 12181.369 }, { "epoch": 0.6436843522757878, "grad_norm": 0.7886409332528834, "learning_rate": 7.655105178525932e-06, "loss": 0.3718048095703125, "num_input_tokens_seen": 304816944, "step": 9560, "train_runtime": 25022.8235, "train_tokens_per_second": 12181.557 }, { "epoch": 0.6440210072717479, "grad_norm": 0.8644964037890213, "learning_rate": 7.652864321533406e-06, "loss": 0.3928435564041138, "num_input_tokens_seen": 304976336, "step": 9565, "train_runtime": 25036.4702, "train_tokens_per_second": 12181.283 }, { "epoch": 0.6443576622677081, "grad_norm": 0.7362874646222378, "learning_rate": 7.650622722675833e-06, "loss": 0.4045905590057373, "num_input_tokens_seen": 305138512, "step": 9570, "train_runtime": 25049.7234, "train_tokens_per_second": 12181.313 }, { "epoch": 0.6446943172636682, "grad_norm": 0.8162906089665554, "learning_rate": 7.648380382580067e-06, "loss": 0.389904260635376, "num_input_tokens_seen": 305299944, "step": 9575, "train_runtime": 25063.3948, "train_tokens_per_second": 12181.109 }, { "epoch": 0.6450309722596284, "grad_norm": 0.723990288129423, "learning_rate": 7.646137301873173e-06, "loss": 0.37366542816162107, "num_input_tokens_seen": 305458184, "step": 9580, "train_runtime": 25077.0908, "train_tokens_per_second": 12180.766 }, { "epoch": 0.6453676272555885, "grad_norm": 0.8269042502669389, "learning_rate": 7.643893481182421e-06, "loss": 0.3626148223876953, "num_input_tokens_seen": 305620520, "step": 9585, "train_runtime": 25090.2536, "train_tokens_per_second": 12180.846 }, { "epoch": 0.6457042822515486, "grad_norm": 0.8610511922656466, "learning_rate": 7.641648921135287e-06, "loss": 0.4106851577758789, "num_input_tokens_seen": 305781784, "step": 9590, "train_runtime": 25103.151, "train_tokens_per_second": 12181.012 }, { "epoch": 0.6460409372475088, "grad_norm": 0.9561088313444258, "learning_rate": 7.639403622359455e-06, "loss": 0.3923514366149902, "num_input_tokens_seen": 305936704, "step": 9595, "train_runtime": 25116.1382, "train_tokens_per_second": 12180.882 }, { "epoch": 0.6463775922434689, "grad_norm": 0.7872686779268968, "learning_rate": 7.637157585482817e-06, "loss": 0.3662883758544922, "num_input_tokens_seen": 306096480, "step": 9600, "train_runtime": 25129.1469, "train_tokens_per_second": 12180.934 }, { "epoch": 0.646714247239429, "grad_norm": 0.9076202095685655, "learning_rate": 7.63491081113347e-06, "loss": 0.4183998107910156, "num_input_tokens_seen": 306259616, "step": 9605, "train_runtime": 25142.1871, "train_tokens_per_second": 12181.105 }, { "epoch": 0.6470509022353892, "grad_norm": 0.774755520994566, "learning_rate": 7.632663299939718e-06, "loss": 0.404583740234375, "num_input_tokens_seen": 306420184, "step": 9610, "train_runtime": 25154.9485, "train_tokens_per_second": 12181.308 }, { "epoch": 0.6473875572313493, "grad_norm": 0.9220122077740786, "learning_rate": 7.630415052530066e-06, "loss": 0.39755327701568605, "num_input_tokens_seen": 306580520, "step": 9615, "train_runtime": 25168.2563, "train_tokens_per_second": 12181.238 }, { "epoch": 0.6477242122273095, "grad_norm": 0.8291395476380609, "learning_rate": 7.628166069533235e-06, "loss": 0.3870555400848389, "num_input_tokens_seen": 306739072, "step": 9620, "train_runtime": 25181.8184, "train_tokens_per_second": 12180.974 }, { "epoch": 0.6480608672232696, "grad_norm": 0.8919244139115249, "learning_rate": 7.625916351578141e-06, "loss": 0.3941284894943237, "num_input_tokens_seen": 306898096, "step": 9625, "train_runtime": 25194.7987, "train_tokens_per_second": 12181.01 }, { "epoch": 0.6483975222192297, "grad_norm": 0.6969023858397622, "learning_rate": 7.623665899293914e-06, "loss": 0.37345314025878906, "num_input_tokens_seen": 307057560, "step": 9630, "train_runtime": 25207.961, "train_tokens_per_second": 12180.976 }, { "epoch": 0.6487341772151899, "grad_norm": 0.7518861887107433, "learning_rate": 7.621414713309885e-06, "loss": 0.34434750080108645, "num_input_tokens_seen": 307217376, "step": 9635, "train_runtime": 25221.0785, "train_tokens_per_second": 12180.977 }, { "epoch": 0.64907083221115, "grad_norm": 0.787163708730269, "learning_rate": 7.61916279425559e-06, "loss": 0.40105438232421875, "num_input_tokens_seen": 307378760, "step": 9640, "train_runtime": 25234.0596, "train_tokens_per_second": 12181.106 }, { "epoch": 0.6494074872071102, "grad_norm": 0.7993018306000265, "learning_rate": 7.6169101427607716e-06, "loss": 0.3876271963119507, "num_input_tokens_seen": 307541640, "step": 9645, "train_runtime": 25247.5068, "train_tokens_per_second": 12181.07 }, { "epoch": 0.6497441422030703, "grad_norm": 0.9096689011807212, "learning_rate": 7.614656759455375e-06, "loss": 0.3859602212905884, "num_input_tokens_seen": 307703544, "step": 9650, "train_runtime": 25259.9592, "train_tokens_per_second": 12181.474 }, { "epoch": 0.6500807971990304, "grad_norm": 0.8251040937430476, "learning_rate": 7.612402644969555e-06, "loss": 0.3871248006820679, "num_input_tokens_seen": 307862800, "step": 9655, "train_runtime": 25273.7073, "train_tokens_per_second": 12181.149 }, { "epoch": 0.6504174521949906, "grad_norm": 0.8256474458399202, "learning_rate": 7.6101477999336646e-06, "loss": 0.3942007064819336, "num_input_tokens_seen": 308022760, "step": 9660, "train_runtime": 25286.9558, "train_tokens_per_second": 12181.093 }, { "epoch": 0.6507541071909507, "grad_norm": 0.8791909618349235, "learning_rate": 7.607892224978266e-06, "loss": 0.38946921825408937, "num_input_tokens_seen": 308178968, "step": 9665, "train_runtime": 25300.2463, "train_tokens_per_second": 12180.868 }, { "epoch": 0.6510907621869109, "grad_norm": 0.8032008443292392, "learning_rate": 7.605635920734122e-06, "loss": 0.3705273151397705, "num_input_tokens_seen": 308336208, "step": 9670, "train_runtime": 25312.8103, "train_tokens_per_second": 12181.034 }, { "epoch": 0.651427417182871, "grad_norm": 0.7483294169399682, "learning_rate": 7.603378887832202e-06, "loss": 0.386503267288208, "num_input_tokens_seen": 308492480, "step": 9675, "train_runtime": 25327.0247, "train_tokens_per_second": 12180.368 }, { "epoch": 0.6517640721788311, "grad_norm": 0.7458627092296664, "learning_rate": 7.601121126903676e-06, "loss": 0.37947180271148684, "num_input_tokens_seen": 308652120, "step": 9680, "train_runtime": 25339.7711, "train_tokens_per_second": 12180.541 }, { "epoch": 0.6521007271747913, "grad_norm": 0.8847560409058672, "learning_rate": 7.598862638579922e-06, "loss": 0.3812716007232666, "num_input_tokens_seen": 308814328, "step": 9685, "train_runtime": 25352.2157, "train_tokens_per_second": 12180.96 }, { "epoch": 0.6524373821707514, "grad_norm": 0.8906863338778178, "learning_rate": 7.5966034234925205e-06, "loss": 0.3827708959579468, "num_input_tokens_seen": 308977776, "step": 9690, "train_runtime": 25364.6197, "train_tokens_per_second": 12181.447 }, { "epoch": 0.6527740371667116, "grad_norm": 0.8751351809077597, "learning_rate": 7.59434348227325e-06, "loss": 0.4421831607818604, "num_input_tokens_seen": 309135688, "step": 9695, "train_runtime": 25377.2098, "train_tokens_per_second": 12181.626 }, { "epoch": 0.6531106921626717, "grad_norm": 0.895852937529799, "learning_rate": 7.592082815554098e-06, "loss": 0.42072525024414065, "num_input_tokens_seen": 309294728, "step": 9700, "train_runtime": 25389.9869, "train_tokens_per_second": 12181.76 }, { "epoch": 0.6534473471586318, "grad_norm": 0.8869418187692794, "learning_rate": 7.58982142396725e-06, "loss": 0.4356858253479004, "num_input_tokens_seen": 309449264, "step": 9705, "train_runtime": 25403.2826, "train_tokens_per_second": 12181.468 }, { "epoch": 0.653784002154592, "grad_norm": 0.845593712665352, "learning_rate": 7.5875593081451e-06, "loss": 0.3816426515579224, "num_input_tokens_seen": 309610800, "step": 9710, "train_runtime": 25416.4944, "train_tokens_per_second": 12181.491 }, { "epoch": 0.6541206571505521, "grad_norm": 0.8062485662678909, "learning_rate": 7.585296468720243e-06, "loss": 0.3842586040496826, "num_input_tokens_seen": 309774640, "step": 9715, "train_runtime": 25428.9282, "train_tokens_per_second": 12181.978 }, { "epoch": 0.6544573121465123, "grad_norm": 0.7522165161884529, "learning_rate": 7.5830329063254705e-06, "loss": 0.4123539924621582, "num_input_tokens_seen": 309931472, "step": 9720, "train_runtime": 25442.467, "train_tokens_per_second": 12181.66 }, { "epoch": 0.6547939671424724, "grad_norm": 0.7440081994074869, "learning_rate": 7.5807686215937835e-06, "loss": 0.3866130828857422, "num_input_tokens_seen": 310089504, "step": 9725, "train_runtime": 25455.1132, "train_tokens_per_second": 12181.816 }, { "epoch": 0.6551306221384325, "grad_norm": 0.7430494379805457, "learning_rate": 7.578503615158379e-06, "loss": 0.3380992889404297, "num_input_tokens_seen": 310249216, "step": 9730, "train_runtime": 25468.227, "train_tokens_per_second": 12181.814 }, { "epoch": 0.6554672771343927, "grad_norm": 0.8304087764709839, "learning_rate": 7.576237887652662e-06, "loss": 0.3985629081726074, "num_input_tokens_seen": 310411584, "step": 9735, "train_runtime": 25481.2626, "train_tokens_per_second": 12181.955 }, { "epoch": 0.6558039321303528, "grad_norm": 0.8693652255663747, "learning_rate": 7.573971439710235e-06, "loss": 0.3582068204879761, "num_input_tokens_seen": 310573600, "step": 9740, "train_runtime": 25494.8904, "train_tokens_per_second": 12181.798 }, { "epoch": 0.656140587126313, "grad_norm": 0.8290254643807483, "learning_rate": 7.571704271964902e-06, "loss": 0.38382997512817385, "num_input_tokens_seen": 310729920, "step": 9745, "train_runtime": 25508.4923, "train_tokens_per_second": 12181.43 }, { "epoch": 0.6564772421222731, "grad_norm": 0.8499552647007896, "learning_rate": 7.56943638505067e-06, "loss": 0.3603231906890869, "num_input_tokens_seen": 310892176, "step": 9750, "train_runtime": 25521.0917, "train_tokens_per_second": 12181.774 }, { "epoch": 0.6568138971182332, "grad_norm": 0.7173243765712516, "learning_rate": 7.567167779601746e-06, "loss": 0.3939405679702759, "num_input_tokens_seen": 311055552, "step": 9755, "train_runtime": 25534.0834, "train_tokens_per_second": 12181.974 }, { "epoch": 0.6571505521141934, "grad_norm": 0.8253879299998719, "learning_rate": 7.56489845625254e-06, "loss": 0.4330586910247803, "num_input_tokens_seen": 311214272, "step": 9760, "train_runtime": 25547.5932, "train_tokens_per_second": 12181.745 }, { "epoch": 0.6574872071101535, "grad_norm": 0.754252538780929, "learning_rate": 7.562628415637659e-06, "loss": 0.38188397884368896, "num_input_tokens_seen": 311369408, "step": 9765, "train_runtime": 25560.5101, "train_tokens_per_second": 12181.659 }, { "epoch": 0.6578238621061137, "grad_norm": 0.8506197898430271, "learning_rate": 7.560357658391913e-06, "loss": 0.4343846797943115, "num_input_tokens_seen": 311528856, "step": 9770, "train_runtime": 25573.2346, "train_tokens_per_second": 12181.832 }, { "epoch": 0.6581605171020738, "grad_norm": 0.8013104150536664, "learning_rate": 7.558086185150311e-06, "loss": 0.39814023971557616, "num_input_tokens_seen": 311685720, "step": 9775, "train_runtime": 25585.8339, "train_tokens_per_second": 12181.964 }, { "epoch": 0.6584971720980339, "grad_norm": 0.8549640317267945, "learning_rate": 7.555813996548065e-06, "loss": 0.40965728759765624, "num_input_tokens_seen": 311847536, "step": 9780, "train_runtime": 25598.2592, "train_tokens_per_second": 12182.373 }, { "epoch": 0.6588338270939941, "grad_norm": 0.8083135311596874, "learning_rate": 7.553541093220586e-06, "loss": 0.37792439460754396, "num_input_tokens_seen": 312006176, "step": 9785, "train_runtime": 25612.3599, "train_tokens_per_second": 12181.86 }, { "epoch": 0.6591704820899542, "grad_norm": 0.7756961925661809, "learning_rate": 7.551267475803481e-06, "loss": 0.3783126354217529, "num_input_tokens_seen": 312168360, "step": 9790, "train_runtime": 25625.4161, "train_tokens_per_second": 12181.982 }, { "epoch": 0.6595071370859144, "grad_norm": 0.8703307085760885, "learning_rate": 7.5489931449325635e-06, "loss": 0.39372930526733396, "num_input_tokens_seen": 312329384, "step": 9795, "train_runtime": 25639.0336, "train_tokens_per_second": 12181.792 }, { "epoch": 0.6598437920818745, "grad_norm": 1.0021899032964838, "learning_rate": 7.546718101243842e-06, "loss": 0.4002224445343018, "num_input_tokens_seen": 312488784, "step": 9800, "train_runtime": 25652.6326, "train_tokens_per_second": 12181.548 }, { "epoch": 0.6601804470778346, "grad_norm": 0.8820199639721414, "learning_rate": 7.544442345373522e-06, "loss": 0.3753774642944336, "num_input_tokens_seen": 312646848, "step": 9805, "train_runtime": 25666.2823, "train_tokens_per_second": 12181.228 }, { "epoch": 0.6605171020737948, "grad_norm": 0.6903212317132906, "learning_rate": 7.542165877958014e-06, "loss": 0.3762394428253174, "num_input_tokens_seen": 312804232, "step": 9810, "train_runtime": 25679.0291, "train_tokens_per_second": 12181.311 }, { "epoch": 0.6608537570697549, "grad_norm": 0.8460053276972204, "learning_rate": 7.539888699633926e-06, "loss": 0.39285638332366946, "num_input_tokens_seen": 312966160, "step": 9815, "train_runtime": 25691.5839, "train_tokens_per_second": 12181.661 }, { "epoch": 0.661190412065715, "grad_norm": 0.8187018480492271, "learning_rate": 7.5376108110380606e-06, "loss": 0.35872712135314944, "num_input_tokens_seen": 313130000, "step": 9820, "train_runtime": 25704.0018, "train_tokens_per_second": 12182.15 }, { "epoch": 0.6615270670616752, "grad_norm": 0.8070742336951411, "learning_rate": 7.535332212807426e-06, "loss": 0.35670814514160154, "num_input_tokens_seen": 313285744, "step": 9825, "train_runtime": 25718.1151, "train_tokens_per_second": 12181.52 }, { "epoch": 0.6618637220576353, "grad_norm": 0.8578920473261384, "learning_rate": 7.53305290557922e-06, "loss": 0.4046154975891113, "num_input_tokens_seen": 313449584, "step": 9830, "train_runtime": 25730.5423, "train_tokens_per_second": 12182.005 }, { "epoch": 0.6622003770535955, "grad_norm": 0.8258896744546548, "learning_rate": 7.530772889990848e-06, "loss": 0.3669726371765137, "num_input_tokens_seen": 313613424, "step": 9835, "train_runtime": 25742.9774, "train_tokens_per_second": 12182.485 }, { "epoch": 0.6625370320495556, "grad_norm": 0.7431375122017521, "learning_rate": 7.528492166679907e-06, "loss": 0.3685587406158447, "num_input_tokens_seen": 313776432, "step": 9840, "train_runtime": 25756.072, "train_tokens_per_second": 12182.62 }, { "epoch": 0.6628736870455157, "grad_norm": 0.765884184679842, "learning_rate": 7.526210736284194e-06, "loss": 0.3904863834381104, "num_input_tokens_seen": 313929704, "step": 9845, "train_runtime": 25769.4615, "train_tokens_per_second": 12182.238 }, { "epoch": 0.6632103420414759, "grad_norm": 0.8153739338176538, "learning_rate": 7.523928599441706e-06, "loss": 0.3999138355255127, "num_input_tokens_seen": 314090408, "step": 9850, "train_runtime": 25782.3192, "train_tokens_per_second": 12182.395 }, { "epoch": 0.663546997037436, "grad_norm": 0.799265914002858, "learning_rate": 7.5216457567906295e-06, "loss": 0.3770828008651733, "num_input_tokens_seen": 314251912, "step": 9855, "train_runtime": 25794.8459, "train_tokens_per_second": 12182.74 }, { "epoch": 0.6638836520333962, "grad_norm": 0.915491347028832, "learning_rate": 7.519362208969362e-06, "loss": 0.37642536163330076, "num_input_tokens_seen": 314414008, "step": 9860, "train_runtime": 25808.1348, "train_tokens_per_second": 12182.748 }, { "epoch": 0.6642203070293563, "grad_norm": 0.7841136256157107, "learning_rate": 7.5170779566164855e-06, "loss": 0.40261316299438477, "num_input_tokens_seen": 314576696, "step": 9865, "train_runtime": 25820.7744, "train_tokens_per_second": 12183.085 }, { "epoch": 0.6645569620253164, "grad_norm": 0.8448488716348264, "learning_rate": 7.514793000370783e-06, "loss": 0.39379613399505614, "num_input_tokens_seen": 314732328, "step": 9870, "train_runtime": 25833.9209, "train_tokens_per_second": 12182.91 }, { "epoch": 0.6648936170212766, "grad_norm": 0.8573553585615501, "learning_rate": 7.512507340871239e-06, "loss": 0.3863104820251465, "num_input_tokens_seen": 314893408, "step": 9875, "train_runtime": 25847.1427, "train_tokens_per_second": 12182.91 }, { "epoch": 0.6652302720172367, "grad_norm": 0.8665271548059639, "learning_rate": 7.510220978757028e-06, "loss": 0.4033992767333984, "num_input_tokens_seen": 315052296, "step": 9880, "train_runtime": 25860.1347, "train_tokens_per_second": 12182.933 }, { "epoch": 0.6655669270131969, "grad_norm": 0.846832427144157, "learning_rate": 7.507933914667524e-06, "loss": 0.4033173084259033, "num_input_tokens_seen": 315215136, "step": 9885, "train_runtime": 25872.8904, "train_tokens_per_second": 12183.221 }, { "epoch": 0.665903582009157, "grad_norm": 0.8821013828118095, "learning_rate": 7.505646149242299e-06, "loss": 0.38404011726379395, "num_input_tokens_seen": 315373928, "step": 9890, "train_runtime": 25885.4926, "train_tokens_per_second": 12183.424 }, { "epoch": 0.6662402370051171, "grad_norm": 0.6724064246825471, "learning_rate": 7.503357683121119e-06, "loss": 0.3648186683654785, "num_input_tokens_seen": 315537480, "step": 9895, "train_runtime": 25898.5098, "train_tokens_per_second": 12183.615 }, { "epoch": 0.6665768920010773, "grad_norm": 0.8074596985920827, "learning_rate": 7.501068516943944e-06, "loss": 0.32072086334228517, "num_input_tokens_seen": 315695248, "step": 9900, "train_runtime": 25911.1257, "train_tokens_per_second": 12183.772 }, { "epoch": 0.6669135469970374, "grad_norm": 0.7785943996479217, "learning_rate": 7.498778651350934e-06, "loss": 0.38613865375518797, "num_input_tokens_seen": 315859088, "step": 9905, "train_runtime": 25923.5549, "train_tokens_per_second": 12184.251 }, { "epoch": 0.6672502019929976, "grad_norm": 0.802215818779068, "learning_rate": 7.496488086982443e-06, "loss": 0.36365737915039065, "num_input_tokens_seen": 316018344, "step": 9910, "train_runtime": 25936.1738, "train_tokens_per_second": 12184.463 }, { "epoch": 0.6675868569889577, "grad_norm": 0.8375789729653921, "learning_rate": 7.494196824479019e-06, "loss": 0.37540483474731445, "num_input_tokens_seen": 316177272, "step": 9915, "train_runtime": 25950.4645, "train_tokens_per_second": 12183.877 }, { "epoch": 0.6679235119849178, "grad_norm": 0.8435926622684569, "learning_rate": 7.491904864481406e-06, "loss": 0.3755911111831665, "num_input_tokens_seen": 316331600, "step": 9920, "train_runtime": 25963.585, "train_tokens_per_second": 12183.664 }, { "epoch": 0.668260166980878, "grad_norm": 0.6913111487006595, "learning_rate": 7.489612207630543e-06, "loss": 0.3194437503814697, "num_input_tokens_seen": 316495392, "step": 9925, "train_runtime": 25976.6698, "train_tokens_per_second": 12183.832 }, { "epoch": 0.6685968219768381, "grad_norm": 0.8020540151106973, "learning_rate": 7.487318854567566e-06, "loss": 0.38332204818725585, "num_input_tokens_seen": 316651384, "step": 9930, "train_runtime": 25989.5053, "train_tokens_per_second": 12183.817 }, { "epoch": 0.6689334769727983, "grad_norm": 0.7056521943298735, "learning_rate": 7.485024805933803e-06, "loss": 0.37098064422607424, "num_input_tokens_seen": 316808960, "step": 9935, "train_runtime": 26003.1928, "train_tokens_per_second": 12183.464 }, { "epoch": 0.6692701319687584, "grad_norm": 0.7121499704423223, "learning_rate": 7.482730062370776e-06, "loss": 0.36148796081542967, "num_input_tokens_seen": 316965456, "step": 9940, "train_runtime": 26015.9718, "train_tokens_per_second": 12183.495 }, { "epoch": 0.6696067869647185, "grad_norm": 0.8781179478463884, "learning_rate": 7.480434624520205e-06, "loss": 0.355879020690918, "num_input_tokens_seen": 317129296, "step": 9945, "train_runtime": 26028.4002, "train_tokens_per_second": 12183.972 }, { "epoch": 0.6699434419606787, "grad_norm": 0.8044029137899269, "learning_rate": 7.478138493024001e-06, "loss": 0.418122386932373, "num_input_tokens_seen": 317288776, "step": 9950, "train_runtime": 26041.047, "train_tokens_per_second": 12184.179 }, { "epoch": 0.6702800969566388, "grad_norm": 0.7400060610621629, "learning_rate": 7.475841668524268e-06, "loss": 0.3775538682937622, "num_input_tokens_seen": 317448320, "step": 9955, "train_runtime": 26054.735, "train_tokens_per_second": 12183.901 }, { "epoch": 0.670616751952599, "grad_norm": 0.8600938989506957, "learning_rate": 7.473544151663309e-06, "loss": 0.4203483581542969, "num_input_tokens_seen": 317606408, "step": 9960, "train_runtime": 26067.7335, "train_tokens_per_second": 12183.89 }, { "epoch": 0.6709534069485591, "grad_norm": 0.9595844992156295, "learning_rate": 7.471245943083615e-06, "loss": 0.37787139415740967, "num_input_tokens_seen": 317767008, "step": 9965, "train_runtime": 26081.1934, "train_tokens_per_second": 12183.76 }, { "epoch": 0.6712900619445192, "grad_norm": 0.7062887868439995, "learning_rate": 7.468947043427873e-06, "loss": 0.3433822154998779, "num_input_tokens_seen": 317928392, "step": 9970, "train_runtime": 26094.5822, "train_tokens_per_second": 12183.693 }, { "epoch": 0.6716267169404794, "grad_norm": 0.7881467977054103, "learning_rate": 7.466647453338965e-06, "loss": 0.3903756380081177, "num_input_tokens_seen": 318090712, "step": 9975, "train_runtime": 26108.1966, "train_tokens_per_second": 12183.557 }, { "epoch": 0.6719633719364395, "grad_norm": 0.7606740723482138, "learning_rate": 7.464347173459958e-06, "loss": 0.39801740646362305, "num_input_tokens_seen": 318254552, "step": 9980, "train_runtime": 26120.6882, "train_tokens_per_second": 12184.003 }, { "epoch": 0.6723000269323997, "grad_norm": 0.690811652488791, "learning_rate": 7.462046204434126e-06, "loss": 0.3544230222702026, "num_input_tokens_seen": 318418000, "step": 9985, "train_runtime": 26133.728, "train_tokens_per_second": 12184.178 }, { "epoch": 0.6726366819283598, "grad_norm": 0.8698234595344321, "learning_rate": 7.459744546904922e-06, "loss": 0.38443453311920167, "num_input_tokens_seen": 318576648, "step": 9990, "train_runtime": 26146.646, "train_tokens_per_second": 12184.226 }, { "epoch": 0.6729733369243199, "grad_norm": 0.7747255494704058, "learning_rate": 7.457442201516001e-06, "loss": 0.34813766479492186, "num_input_tokens_seen": 318737056, "step": 9995, "train_runtime": 26159.4224, "train_tokens_per_second": 12184.407 }, { "epoch": 0.6733099919202801, "grad_norm": 0.7228010570772834, "learning_rate": 7.455139168911203e-06, "loss": 0.3796975135803223, "num_input_tokens_seen": 318887736, "step": 10000, "train_runtime": 26172.7351, "train_tokens_per_second": 12183.967 }, { "epoch": 0.6736466469162402, "grad_norm": 0.8105541741528355, "learning_rate": 7.452835449734564e-06, "loss": 0.3744520664215088, "num_input_tokens_seen": 319043976, "step": 10005, "train_runtime": 26185.7809, "train_tokens_per_second": 12183.863 }, { "epoch": 0.6739833019122003, "grad_norm": 0.7412754308474214, "learning_rate": 7.450531044630315e-06, "loss": 0.3376976490020752, "num_input_tokens_seen": 319202152, "step": 10010, "train_runtime": 26199.1485, "train_tokens_per_second": 12183.684 }, { "epoch": 0.6743199569081605, "grad_norm": 0.8514432321336665, "learning_rate": 7.448225954242874e-06, "loss": 0.38923444747924807, "num_input_tokens_seen": 319363976, "step": 10015, "train_runtime": 26211.7837, "train_tokens_per_second": 12183.985 }, { "epoch": 0.6746566119041206, "grad_norm": 0.8536921056017616, "learning_rate": 7.44592017921685e-06, "loss": 0.3782106876373291, "num_input_tokens_seen": 319523120, "step": 10020, "train_runtime": 26224.5069, "train_tokens_per_second": 12184.142 }, { "epoch": 0.6749932669000808, "grad_norm": 0.7833643350090261, "learning_rate": 7.443613720197048e-06, "loss": 0.39757614135742186, "num_input_tokens_seen": 319681568, "step": 10025, "train_runtime": 26237.4441, "train_tokens_per_second": 12184.173 }, { "epoch": 0.6753299218960409, "grad_norm": 0.800564589256561, "learning_rate": 7.44130657782846e-06, "loss": 0.3686829090118408, "num_input_tokens_seen": 319839112, "step": 10030, "train_runtime": 26250.2355, "train_tokens_per_second": 12184.238 }, { "epoch": 0.675666576892001, "grad_norm": 0.8081185649869477, "learning_rate": 7.438998752756274e-06, "loss": 0.38120274543762206, "num_input_tokens_seen": 319999856, "step": 10035, "train_runtime": 26262.7411, "train_tokens_per_second": 12184.557 }, { "epoch": 0.6760032318879612, "grad_norm": 0.7628731233372505, "learning_rate": 7.436690245625864e-06, "loss": 0.37954211235046387, "num_input_tokens_seen": 320159008, "step": 10040, "train_runtime": 26275.8603, "train_tokens_per_second": 12184.53 }, { "epoch": 0.6763398868839213, "grad_norm": 0.8869529404521618, "learning_rate": 7.434381057082797e-06, "loss": 0.36778442859649657, "num_input_tokens_seen": 320314224, "step": 10045, "train_runtime": 26289.1964, "train_tokens_per_second": 12184.253 }, { "epoch": 0.6766765418798815, "grad_norm": 0.8579576724943593, "learning_rate": 7.4320711877728305e-06, "loss": 0.4174938678741455, "num_input_tokens_seen": 320474872, "step": 10050, "train_runtime": 26301.9712, "train_tokens_per_second": 12184.443 }, { "epoch": 0.6770131968758416, "grad_norm": 0.7499299413591257, "learning_rate": 7.429760638341909e-06, "loss": 0.3572435140609741, "num_input_tokens_seen": 320631120, "step": 10055, "train_runtime": 26316.0252, "train_tokens_per_second": 12183.873 }, { "epoch": 0.6773498518718017, "grad_norm": 0.8423251053815365, "learning_rate": 7.427449409436176e-06, "loss": 0.4229987144470215, "num_input_tokens_seen": 320789920, "step": 10060, "train_runtime": 26328.9762, "train_tokens_per_second": 12183.912 }, { "epoch": 0.6776865068677619, "grad_norm": 0.6401417481421369, "learning_rate": 7.425137501701955e-06, "loss": 0.36402719020843505, "num_input_tokens_seen": 320952392, "step": 10065, "train_runtime": 26341.628, "train_tokens_per_second": 12184.228 }, { "epoch": 0.678023161863722, "grad_norm": 0.9335939898709256, "learning_rate": 7.422824915785765e-06, "loss": 0.36553995609283446, "num_input_tokens_seen": 321113200, "step": 10070, "train_runtime": 26354.6757, "train_tokens_per_second": 12184.297 }, { "epoch": 0.6783598168596822, "grad_norm": 0.846171357113435, "learning_rate": 7.420511652334313e-06, "loss": 0.38360445499420165, "num_input_tokens_seen": 321267120, "step": 10075, "train_runtime": 26367.7188, "train_tokens_per_second": 12184.107 }, { "epoch": 0.6786964718556423, "grad_norm": 0.7435239539694964, "learning_rate": 7.418197711994495e-06, "loss": 0.3540541648864746, "num_input_tokens_seen": 321425072, "step": 10080, "train_runtime": 26380.6528, "train_tokens_per_second": 12184.121 }, { "epoch": 0.6790331268516024, "grad_norm": 0.8459317207465824, "learning_rate": 7.4158830954133984e-06, "loss": 0.3685738563537598, "num_input_tokens_seen": 321588656, "step": 10085, "train_runtime": 26393.6008, "train_tokens_per_second": 12184.342 }, { "epoch": 0.6793697818475626, "grad_norm": 0.7102508995085847, "learning_rate": 7.413567803238298e-06, "loss": 0.36223621368408204, "num_input_tokens_seen": 321745744, "step": 10090, "train_runtime": 26406.7361, "train_tokens_per_second": 12184.23 }, { "epoch": 0.6797064368435227, "grad_norm": 0.7180570697719586, "learning_rate": 7.411251836116658e-06, "loss": 0.38073318004608153, "num_input_tokens_seen": 321909584, "step": 10095, "train_runtime": 26419.1613, "train_tokens_per_second": 12184.701 }, { "epoch": 0.6800430918394829, "grad_norm": 0.7381396116767438, "learning_rate": 7.408935194696132e-06, "loss": 0.3999310493469238, "num_input_tokens_seen": 322069320, "step": 10100, "train_runtime": 26432.2128, "train_tokens_per_second": 12184.728 }, { "epoch": 0.680379746835443, "grad_norm": 0.7846664802668101, "learning_rate": 7.406617879624558e-06, "loss": 0.39309277534484866, "num_input_tokens_seen": 322232920, "step": 10105, "train_runtime": 26445.2227, "train_tokens_per_second": 12184.92 }, { "epoch": 0.6807164018314031, "grad_norm": 0.724559884967463, "learning_rate": 7.40429989154997e-06, "loss": 0.36521596908569337, "num_input_tokens_seen": 322391680, "step": 10110, "train_runtime": 26458.8428, "train_tokens_per_second": 12184.648 }, { "epoch": 0.6810530568273633, "grad_norm": 0.8349427054484625, "learning_rate": 7.4019812311205826e-06, "loss": 0.40368123054504396, "num_input_tokens_seen": 322552192, "step": 10115, "train_runtime": 26471.2585, "train_tokens_per_second": 12184.996 }, { "epoch": 0.6813897118233234, "grad_norm": 0.7608025074156023, "learning_rate": 7.399661898984805e-06, "loss": 0.39532663822174074, "num_input_tokens_seen": 322716032, "step": 10120, "train_runtime": 26483.6791, "train_tokens_per_second": 12185.468 }, { "epoch": 0.6817263668192836, "grad_norm": 0.8229171737607052, "learning_rate": 7.397341895791228e-06, "loss": 0.39187328815460204, "num_input_tokens_seen": 322874208, "step": 10125, "train_runtime": 26496.6823, "train_tokens_per_second": 12185.458 }, { "epoch": 0.6820630218152437, "grad_norm": 0.957713726541619, "learning_rate": 7.395021222188634e-06, "loss": 0.36869134902954104, "num_input_tokens_seen": 323032128, "step": 10130, "train_runtime": 26509.6823, "train_tokens_per_second": 12185.439 }, { "epoch": 0.6823996768112038, "grad_norm": 0.7835244543232316, "learning_rate": 7.392699878825993e-06, "loss": 0.41825523376464846, "num_input_tokens_seen": 323189592, "step": 10135, "train_runtime": 26522.9146, "train_tokens_per_second": 12185.297 }, { "epoch": 0.682736331807164, "grad_norm": 0.7595415205703406, "learning_rate": 7.390377866352462e-06, "loss": 0.3895062685012817, "num_input_tokens_seen": 323343144, "step": 10140, "train_runtime": 26536.1195, "train_tokens_per_second": 12185.02 }, { "epoch": 0.6830729868031241, "grad_norm": 0.8183701998233642, "learning_rate": 7.388055185417382e-06, "loss": 0.39305891990661623, "num_input_tokens_seen": 323505504, "step": 10145, "train_runtime": 26549.3029, "train_tokens_per_second": 12185.085 }, { "epoch": 0.6834096417990843, "grad_norm": 0.7507889166165261, "learning_rate": 7.3857318366702844e-06, "loss": 0.3604459285736084, "num_input_tokens_seen": 323667624, "step": 10150, "train_runtime": 26562.5448, "train_tokens_per_second": 12185.114 }, { "epoch": 0.6837462967950444, "grad_norm": 0.8062848777006045, "learning_rate": 7.383407820760885e-06, "loss": 0.39438633918762206, "num_input_tokens_seen": 323828232, "step": 10155, "train_runtime": 26574.9701, "train_tokens_per_second": 12185.46 }, { "epoch": 0.6840829517910045, "grad_norm": 0.7363876304189422, "learning_rate": 7.381083138339089e-06, "loss": 0.37736239433288576, "num_input_tokens_seen": 323985632, "step": 10160, "train_runtime": 26588.1946, "train_tokens_per_second": 12185.319 }, { "epoch": 0.6844196067869647, "grad_norm": 0.806794215618462, "learning_rate": 7.378757790054988e-06, "loss": 0.3931479215621948, "num_input_tokens_seen": 324148960, "step": 10165, "train_runtime": 26600.6103, "train_tokens_per_second": 12185.772 }, { "epoch": 0.6847562617829248, "grad_norm": 0.8723766735969465, "learning_rate": 7.376431776558855e-06, "loss": 0.3919412851333618, "num_input_tokens_seen": 324310152, "step": 10170, "train_runtime": 26614.004, "train_tokens_per_second": 12185.696 }, { "epoch": 0.685092916778885, "grad_norm": 0.8292000512038669, "learning_rate": 7.3741050985011546e-06, "loss": 0.3860538721084595, "num_input_tokens_seen": 324472272, "step": 10175, "train_runtime": 26627.2282, "train_tokens_per_second": 12185.732 }, { "epoch": 0.6854295717748451, "grad_norm": 0.7307669046697011, "learning_rate": 7.371777756532531e-06, "loss": 0.3597079277038574, "num_input_tokens_seen": 324631096, "step": 10180, "train_runtime": 26639.7764, "train_tokens_per_second": 12185.954 }, { "epoch": 0.6857662267708052, "grad_norm": 0.8106411980276297, "learning_rate": 7.369449751303823e-06, "loss": 0.40822649002075195, "num_input_tokens_seen": 324787416, "step": 10185, "train_runtime": 26652.3464, "train_tokens_per_second": 12186.072 }, { "epoch": 0.6861028817667654, "grad_norm": 0.6418435864980344, "learning_rate": 7.367121083466048e-06, "loss": 0.35878982543945315, "num_input_tokens_seen": 324946528, "step": 10190, "train_runtime": 26664.9286, "train_tokens_per_second": 12186.289 }, { "epoch": 0.6864395367627255, "grad_norm": 0.8858295882319781, "learning_rate": 7.364791753670409e-06, "loss": 0.38283023834228513, "num_input_tokens_seen": 325107840, "step": 10195, "train_runtime": 26677.8385, "train_tokens_per_second": 12186.439 }, { "epoch": 0.6867761917586857, "grad_norm": 0.7859562889427392, "learning_rate": 7.362461762568298e-06, "loss": 0.3875227689743042, "num_input_tokens_seen": 325268576, "step": 10200, "train_runtime": 26690.5841, "train_tokens_per_second": 12186.641 }, { "epoch": 0.6871128467546458, "grad_norm": 1.0748034827954138, "learning_rate": 7.360131110811287e-06, "loss": 0.3560051918029785, "num_input_tokens_seen": 325428976, "step": 10205, "train_runtime": 26703.6801, "train_tokens_per_second": 12186.671 }, { "epoch": 0.6874495017506059, "grad_norm": 0.7510334458885797, "learning_rate": 7.357799799051138e-06, "loss": 0.36168246269226073, "num_input_tokens_seen": 325587400, "step": 10210, "train_runtime": 26716.1582, "train_tokens_per_second": 12186.909 }, { "epoch": 0.6877861567465661, "grad_norm": 0.9154613005985477, "learning_rate": 7.355467827939794e-06, "loss": 0.39054856300354, "num_input_tokens_seen": 325741104, "step": 10215, "train_runtime": 26728.6565, "train_tokens_per_second": 12186.961 }, { "epoch": 0.6881228117425262, "grad_norm": 0.8277638856527207, "learning_rate": 7.353135198129382e-06, "loss": 0.3998368501663208, "num_input_tokens_seen": 325894768, "step": 10220, "train_runtime": 26741.1182, "train_tokens_per_second": 12187.028 }, { "epoch": 0.6884594667384863, "grad_norm": 0.7956122054130275, "learning_rate": 7.350801910272216e-06, "loss": 0.3863977909088135, "num_input_tokens_seen": 326055928, "step": 10225, "train_runtime": 26753.7944, "train_tokens_per_second": 12187.278 }, { "epoch": 0.6887961217344465, "grad_norm": 0.8236927655364495, "learning_rate": 7.348467965020791e-06, "loss": 0.3548075437545776, "num_input_tokens_seen": 326214104, "step": 10230, "train_runtime": 26766.7281, "train_tokens_per_second": 12187.298 }, { "epoch": 0.6891327767304066, "grad_norm": 0.8260095036629345, "learning_rate": 7.3461333630277885e-06, "loss": 0.37176966667175293, "num_input_tokens_seen": 326365360, "step": 10235, "train_runtime": 26779.7742, "train_tokens_per_second": 12187.009 }, { "epoch": 0.6894694317263668, "grad_norm": 0.8776993441562492, "learning_rate": 7.343798104946074e-06, "loss": 0.375214672088623, "num_input_tokens_seen": 326525000, "step": 10240, "train_runtime": 26792.6634, "train_tokens_per_second": 12187.105 }, { "epoch": 0.6898060867223269, "grad_norm": 0.8444867691580653, "learning_rate": 7.341462191428692e-06, "loss": 0.3909226179122925, "num_input_tokens_seen": 326682568, "step": 10245, "train_runtime": 26805.9788, "train_tokens_per_second": 12186.929 }, { "epoch": 0.690142741718287, "grad_norm": 0.7456799749352725, "learning_rate": 7.339125623128874e-06, "loss": 0.39707517623901367, "num_input_tokens_seen": 326844200, "step": 10250, "train_runtime": 26818.9887, "train_tokens_per_second": 12187.044 }, { "epoch": 0.6904793967142472, "grad_norm": 0.7316673981380943, "learning_rate": 7.336788400700035e-06, "loss": 0.38560636043548585, "num_input_tokens_seen": 327001984, "step": 10255, "train_runtime": 26832.1099, "train_tokens_per_second": 12186.965 }, { "epoch": 0.6908160517102074, "grad_norm": 0.9156039289988064, "learning_rate": 7.334450524795771e-06, "loss": 0.4110163688659668, "num_input_tokens_seen": 327163072, "step": 10260, "train_runtime": 26844.7205, "train_tokens_per_second": 12187.241 }, { "epoch": 0.6911527067061676, "grad_norm": 0.7915660742753489, "learning_rate": 7.332111996069863e-06, "loss": 0.38647310733795165, "num_input_tokens_seen": 327324936, "step": 10265, "train_runtime": 26857.9086, "train_tokens_per_second": 12187.283 }, { "epoch": 0.6914893617021277, "grad_norm": 0.8704922928746365, "learning_rate": 7.32977281517627e-06, "loss": 0.4231839179992676, "num_input_tokens_seen": 327478368, "step": 10270, "train_runtime": 26871.2094, "train_tokens_per_second": 12186.961 }, { "epoch": 0.6918260166980879, "grad_norm": 0.805944140851274, "learning_rate": 7.3274329827691406e-06, "loss": 0.3946662902832031, "num_input_tokens_seen": 327632864, "step": 10275, "train_runtime": 26884.1836, "train_tokens_per_second": 12186.826 }, { "epoch": 0.692162671694048, "grad_norm": 0.7776015723872965, "learning_rate": 7.325092499502796e-06, "loss": 0.36268651485443115, "num_input_tokens_seen": 327794968, "step": 10280, "train_runtime": 26896.6691, "train_tokens_per_second": 12187.196 }, { "epoch": 0.6924993266900081, "grad_norm": 0.752726335448874, "learning_rate": 7.322751366031751e-06, "loss": 0.38288938999176025, "num_input_tokens_seen": 327956088, "step": 10285, "train_runtime": 26909.1346, "train_tokens_per_second": 12187.538 }, { "epoch": 0.6928359816859683, "grad_norm": 0.8046941449226112, "learning_rate": 7.320409583010691e-06, "loss": 0.35768985748291016, "num_input_tokens_seen": 328117760, "step": 10290, "train_runtime": 26922.1385, "train_tokens_per_second": 12187.656 }, { "epoch": 0.6931726366819284, "grad_norm": 0.7650369082517492, "learning_rate": 7.318067151094493e-06, "loss": 0.4216940879821777, "num_input_tokens_seen": 328278296, "step": 10295, "train_runtime": 26934.9865, "train_tokens_per_second": 12187.802 }, { "epoch": 0.6935092916778886, "grad_norm": 0.6536873829927895, "learning_rate": 7.3157240709382046e-06, "loss": 0.3889284372329712, "num_input_tokens_seen": 328440520, "step": 10300, "train_runtime": 26947.5978, "train_tokens_per_second": 12188.119 }, { "epoch": 0.6938459466738487, "grad_norm": 0.7873609957834201, "learning_rate": 7.313380343197066e-06, "loss": 0.37988121509552003, "num_input_tokens_seen": 328604048, "step": 10305, "train_runtime": 26960.6332, "train_tokens_per_second": 12188.291 }, { "epoch": 0.6941826016698088, "grad_norm": 0.7913397680773571, "learning_rate": 7.311035968526492e-06, "loss": 0.38131234645843504, "num_input_tokens_seen": 328765712, "step": 10310, "train_runtime": 26973.7833, "train_tokens_per_second": 12188.343 }, { "epoch": 0.694519256665769, "grad_norm": 0.7466596495806964, "learning_rate": 7.308690947582078e-06, "loss": 0.3827646017074585, "num_input_tokens_seen": 328923712, "step": 10315, "train_runtime": 26987.0572, "train_tokens_per_second": 12188.202 }, { "epoch": 0.6948559116617291, "grad_norm": 0.8085663945078247, "learning_rate": 7.306345281019602e-06, "loss": 0.3687703847885132, "num_input_tokens_seen": 329081360, "step": 10320, "train_runtime": 26999.979, "train_tokens_per_second": 12188.208 }, { "epoch": 0.6951925666576892, "grad_norm": 0.8430397583952443, "learning_rate": 7.303998969495023e-06, "loss": 0.40967388153076173, "num_input_tokens_seen": 329239984, "step": 10325, "train_runtime": 27013.1902, "train_tokens_per_second": 12188.119 }, { "epoch": 0.6955292216536494, "grad_norm": 0.8082925067739092, "learning_rate": 7.301652013664479e-06, "loss": 0.4006376266479492, "num_input_tokens_seen": 329401288, "step": 10330, "train_runtime": 27025.6495, "train_tokens_per_second": 12188.469 }, { "epoch": 0.6958658766496095, "grad_norm": 0.8985917537074096, "learning_rate": 7.299304414184288e-06, "loss": 0.42286376953125, "num_input_tokens_seen": 329564760, "step": 10335, "train_runtime": 27038.6719, "train_tokens_per_second": 12188.645 }, { "epoch": 0.6962025316455697, "grad_norm": 0.7489344308739019, "learning_rate": 7.296956171710951e-06, "loss": 0.38113889694213865, "num_input_tokens_seen": 329728600, "step": 10340, "train_runtime": 27051.1177, "train_tokens_per_second": 12189.093 }, { "epoch": 0.6965391866415298, "grad_norm": 0.8105629546202905, "learning_rate": 7.294607286901146e-06, "loss": 0.37472970485687257, "num_input_tokens_seen": 329887432, "step": 10345, "train_runtime": 27063.7834, "train_tokens_per_second": 12189.258 }, { "epoch": 0.69687584163749, "grad_norm": 0.9438656688794996, "learning_rate": 7.292257760411726e-06, "loss": 0.40358500480651854, "num_input_tokens_seen": 330042480, "step": 10350, "train_runtime": 27076.5213, "train_tokens_per_second": 12189.25 }, { "epoch": 0.6972124966334501, "grad_norm": 0.839061240682651, "learning_rate": 7.289907592899737e-06, "loss": 0.3847759962081909, "num_input_tokens_seen": 330205672, "step": 10355, "train_runtime": 27089.4133, "train_tokens_per_second": 12189.473 }, { "epoch": 0.6975491516294102, "grad_norm": 0.7292548691484909, "learning_rate": 7.287556785022389e-06, "loss": 0.3925790786743164, "num_input_tokens_seen": 330366824, "step": 10360, "train_runtime": 27102.3082, "train_tokens_per_second": 12189.619 }, { "epoch": 0.6978858066253704, "grad_norm": 0.7659776948021519, "learning_rate": 7.285205337437082e-06, "loss": 0.38510780334472655, "num_input_tokens_seen": 330519152, "step": 10365, "train_runtime": 27115.2917, "train_tokens_per_second": 12189.401 }, { "epoch": 0.6982224616213305, "grad_norm": 0.8398933019021609, "learning_rate": 7.2828532508013895e-06, "loss": 0.40337285995483396, "num_input_tokens_seen": 330679376, "step": 10370, "train_runtime": 27128.5198, "train_tokens_per_second": 12189.363 }, { "epoch": 0.6985591166172906, "grad_norm": 0.8750234887398435, "learning_rate": 7.2805005257730625e-06, "loss": 0.3946542263031006, "num_input_tokens_seen": 330835848, "step": 10375, "train_runtime": 27141.0685, "train_tokens_per_second": 12189.492 }, { "epoch": 0.6988957716132508, "grad_norm": 0.6671735235581735, "learning_rate": 7.278147163010037e-06, "loss": 0.35418856143951416, "num_input_tokens_seen": 330998848, "step": 10380, "train_runtime": 27153.9217, "train_tokens_per_second": 12189.725 }, { "epoch": 0.6992324266092109, "grad_norm": 0.8856550948697094, "learning_rate": 7.275793163170423e-06, "loss": 0.3769704818725586, "num_input_tokens_seen": 331162688, "step": 10385, "train_runtime": 27166.3553, "train_tokens_per_second": 12190.177 }, { "epoch": 0.6995690816051711, "grad_norm": 0.891365448607796, "learning_rate": 7.273438526912506e-06, "loss": 0.4074446678161621, "num_input_tokens_seen": 331318824, "step": 10390, "train_runtime": 27179.0287, "train_tokens_per_second": 12190.238 }, { "epoch": 0.6999057366011312, "grad_norm": 0.7815057508543167, "learning_rate": 7.271083254894757e-06, "loss": 0.3431298017501831, "num_input_tokens_seen": 331479824, "step": 10395, "train_runtime": 27192.6399, "train_tokens_per_second": 12190.057 }, { "epoch": 0.7002423915970913, "grad_norm": 0.8483270956901738, "learning_rate": 7.268727347775815e-06, "loss": 0.3751350402832031, "num_input_tokens_seen": 331641648, "step": 10400, "train_runtime": 27205.831, "train_tokens_per_second": 12190.094 }, { "epoch": 0.7005790465930515, "grad_norm": 0.7692567407492608, "learning_rate": 7.266370806214506e-06, "loss": 0.3447124004364014, "num_input_tokens_seen": 331802728, "step": 10405, "train_runtime": 27218.5525, "train_tokens_per_second": 12190.315 }, { "epoch": 0.7009157015890116, "grad_norm": 0.7339097738749953, "learning_rate": 7.264013630869827e-06, "loss": 0.3879251480102539, "num_input_tokens_seen": 331963528, "step": 10410, "train_runtime": 27231.4414, "train_tokens_per_second": 12190.45 }, { "epoch": 0.7012523565849718, "grad_norm": 0.7312168967370632, "learning_rate": 7.261655822400957e-06, "loss": 0.42895097732543946, "num_input_tokens_seen": 332127128, "step": 10415, "train_runtime": 27243.9665, "train_tokens_per_second": 12190.851 }, { "epoch": 0.7015890115809319, "grad_norm": 0.7284365845120744, "learning_rate": 7.259297381467248e-06, "loss": 0.3983313798904419, "num_input_tokens_seen": 332288656, "step": 10420, "train_runtime": 27257.7505, "train_tokens_per_second": 12190.612 }, { "epoch": 0.701925666576892, "grad_norm": 0.722320689357718, "learning_rate": 7.2569383087282285e-06, "loss": 0.35359694957733157, "num_input_tokens_seen": 332443968, "step": 10425, "train_runtime": 27271.0828, "train_tokens_per_second": 12190.347 }, { "epoch": 0.7022623215728522, "grad_norm": 0.7859525334844696, "learning_rate": 7.25457860484361e-06, "loss": 0.40454750061035155, "num_input_tokens_seen": 332601424, "step": 10430, "train_runtime": 27283.8874, "train_tokens_per_second": 12190.397 }, { "epoch": 0.7025989765688123, "grad_norm": 0.8294035043786365, "learning_rate": 7.252218270473274e-06, "loss": 0.38651447296142577, "num_input_tokens_seen": 332757128, "step": 10435, "train_runtime": 27297.1978, "train_tokens_per_second": 12190.157 }, { "epoch": 0.7029356315647725, "grad_norm": 0.8340251018294074, "learning_rate": 7.249857306277279e-06, "loss": 0.3877000570297241, "num_input_tokens_seen": 332914056, "step": 10440, "train_runtime": 27310.547, "train_tokens_per_second": 12189.945 }, { "epoch": 0.7032722865607326, "grad_norm": 0.961008413138041, "learning_rate": 7.247495712915864e-06, "loss": 0.3554750919342041, "num_input_tokens_seen": 333070728, "step": 10445, "train_runtime": 27323.5993, "train_tokens_per_second": 12189.856 }, { "epoch": 0.7036089415566927, "grad_norm": 0.7616112052529687, "learning_rate": 7.245133491049439e-06, "loss": 0.3589456558227539, "num_input_tokens_seen": 333229928, "step": 10450, "train_runtime": 27337.4177, "train_tokens_per_second": 12189.517 }, { "epoch": 0.7039455965526529, "grad_norm": 0.7626312922651117, "learning_rate": 7.242770641338592e-06, "loss": 0.41412696838378904, "num_input_tokens_seen": 333387496, "step": 10455, "train_runtime": 27350.139, "train_tokens_per_second": 12189.609 }, { "epoch": 0.704282251548613, "grad_norm": 0.7476257803163171, "learning_rate": 7.240407164444088e-06, "loss": 0.37882261276245116, "num_input_tokens_seen": 333544704, "step": 10460, "train_runtime": 27363.2394, "train_tokens_per_second": 12189.518 }, { "epoch": 0.7046189065445732, "grad_norm": 0.7807818337013487, "learning_rate": 7.238043061026862e-06, "loss": 0.34720165729522706, "num_input_tokens_seen": 333705176, "step": 10465, "train_runtime": 27376.9093, "train_tokens_per_second": 12189.293 }, { "epoch": 0.7049555615405333, "grad_norm": 0.7379065701950852, "learning_rate": 7.235678331748034e-06, "loss": 0.3561399459838867, "num_input_tokens_seen": 333859696, "step": 10470, "train_runtime": 27390.9338, "train_tokens_per_second": 12188.693 }, { "epoch": 0.7052922165364934, "grad_norm": 0.8222849846094239, "learning_rate": 7.233312977268887e-06, "loss": 0.41248311996459963, "num_input_tokens_seen": 334018144, "step": 10475, "train_runtime": 27403.7765, "train_tokens_per_second": 12188.763 }, { "epoch": 0.7056288715324536, "grad_norm": 0.7623273179016814, "learning_rate": 7.230946998250889e-06, "loss": 0.3755314350128174, "num_input_tokens_seen": 334174808, "step": 10480, "train_runtime": 27416.9027, "train_tokens_per_second": 12188.642 }, { "epoch": 0.7059655265284137, "grad_norm": 0.7248461008403937, "learning_rate": 7.228580395355676e-06, "loss": 0.35682685375213624, "num_input_tokens_seen": 334332776, "step": 10485, "train_runtime": 27430.0016, "train_tokens_per_second": 12188.58 }, { "epoch": 0.7063021815243739, "grad_norm": 0.8243671727037906, "learning_rate": 7.226213169245062e-06, "loss": 0.38257484436035155, "num_input_tokens_seen": 334494808, "step": 10490, "train_runtime": 27443.2141, "train_tokens_per_second": 12188.616 }, { "epoch": 0.706638836520334, "grad_norm": 0.7423819739459254, "learning_rate": 7.223845320581035e-06, "loss": 0.36231935024261475, "num_input_tokens_seen": 334654072, "step": 10495, "train_runtime": 27456.2662, "train_tokens_per_second": 12188.623 }, { "epoch": 0.7069754915162941, "grad_norm": 0.6987298915843461, "learning_rate": 7.221476850025754e-06, "loss": 0.3746235132217407, "num_input_tokens_seen": 334816536, "step": 10500, "train_runtime": 27468.9372, "train_tokens_per_second": 12188.915 }, { "epoch": 0.7073121465122543, "grad_norm": 0.7644208058141404, "learning_rate": 7.219107758241557e-06, "loss": 0.3961141347885132, "num_input_tokens_seen": 334975024, "step": 10505, "train_runtime": 27481.5614, "train_tokens_per_second": 12189.083 }, { "epoch": 0.7076488015082144, "grad_norm": 0.7491706497637073, "learning_rate": 7.2167380458909505e-06, "loss": 0.37524521350860596, "num_input_tokens_seen": 335138376, "step": 10510, "train_runtime": 27495.1856, "train_tokens_per_second": 12188.984 }, { "epoch": 0.7079854565041745, "grad_norm": 0.7311996786775199, "learning_rate": 7.214367713636619e-06, "loss": 0.39238715171813965, "num_input_tokens_seen": 335297904, "step": 10515, "train_runtime": 27507.6351, "train_tokens_per_second": 12189.267 }, { "epoch": 0.7083221115001347, "grad_norm": 0.7414040054350306, "learning_rate": 7.211996762141418e-06, "loss": 0.3972428321838379, "num_input_tokens_seen": 335456384, "step": 10520, "train_runtime": 27520.5384, "train_tokens_per_second": 12189.31 }, { "epoch": 0.7086587664960948, "grad_norm": 0.8165162989857522, "learning_rate": 7.209625192068374e-06, "loss": 0.40686378479003904, "num_input_tokens_seen": 335614784, "step": 10525, "train_runtime": 27533.0982, "train_tokens_per_second": 12189.503 }, { "epoch": 0.708995421492055, "grad_norm": 0.6662750370338081, "learning_rate": 7.207253004080692e-06, "loss": 0.3693063735961914, "num_input_tokens_seen": 335778624, "step": 10530, "train_runtime": 27545.5284, "train_tokens_per_second": 12189.95 }, { "epoch": 0.7093320764880151, "grad_norm": 0.8268750418106456, "learning_rate": 7.204880198841746e-06, "loss": 0.35259528160095216, "num_input_tokens_seen": 335932240, "step": 10535, "train_runtime": 27558.4994, "train_tokens_per_second": 12189.787 }, { "epoch": 0.7096687314839752, "grad_norm": 0.8419107529379701, "learning_rate": 7.2025067770150835e-06, "loss": 0.3927944183349609, "num_input_tokens_seen": 336092408, "step": 10540, "train_runtime": 27570.9648, "train_tokens_per_second": 12190.085 }, { "epoch": 0.7100053864799354, "grad_norm": 0.7818842094737565, "learning_rate": 7.2001327392644235e-06, "loss": 0.36365313529968263, "num_input_tokens_seen": 336254408, "step": 10545, "train_runtime": 27583.8016, "train_tokens_per_second": 12190.285 }, { "epoch": 0.7103420414758955, "grad_norm": 0.8023061722783627, "learning_rate": 7.197758086253659e-06, "loss": 0.4142625331878662, "num_input_tokens_seen": 336415464, "step": 10550, "train_runtime": 27597.221, "train_tokens_per_second": 12190.193 }, { "epoch": 0.7106786964718557, "grad_norm": 0.7250370208647923, "learning_rate": 7.195382818646854e-06, "loss": 0.3925436496734619, "num_input_tokens_seen": 336573176, "step": 10555, "train_runtime": 27611.0996, "train_tokens_per_second": 12189.778 }, { "epoch": 0.7110153514678158, "grad_norm": 0.7851252446584273, "learning_rate": 7.1930069371082445e-06, "loss": 0.3854833602905273, "num_input_tokens_seen": 336733304, "step": 10560, "train_runtime": 27624.7276, "train_tokens_per_second": 12189.561 }, { "epoch": 0.7113520064637759, "grad_norm": 0.7249592548132505, "learning_rate": 7.190630442302238e-06, "loss": 0.3884006977081299, "num_input_tokens_seen": 336893416, "step": 10565, "train_runtime": 27637.1474, "train_tokens_per_second": 12189.877 }, { "epoch": 0.7116886614597361, "grad_norm": 0.7186907426363982, "learning_rate": 7.188253334893414e-06, "loss": 0.40602989196777345, "num_input_tokens_seen": 337054360, "step": 10570, "train_runtime": 27650.6343, "train_tokens_per_second": 12189.751 }, { "epoch": 0.7120253164556962, "grad_norm": 0.9383929090444015, "learning_rate": 7.18587561554652e-06, "loss": 0.3929422378540039, "num_input_tokens_seen": 337210200, "step": 10575, "train_runtime": 27663.9117, "train_tokens_per_second": 12189.534 }, { "epoch": 0.7123619714516564, "grad_norm": 0.715860824674725, "learning_rate": 7.183497284926483e-06, "loss": 0.38482906818389895, "num_input_tokens_seen": 337373528, "step": 10580, "train_runtime": 27676.3714, "train_tokens_per_second": 12189.948 }, { "epoch": 0.7126986264476165, "grad_norm": 0.781166796455755, "learning_rate": 7.181118343698392e-06, "loss": 0.35902695655822753, "num_input_tokens_seen": 337528656, "step": 10585, "train_runtime": 27689.3314, "train_tokens_per_second": 12189.845 }, { "epoch": 0.7130352814435766, "grad_norm": 0.7794364190082421, "learning_rate": 7.178738792527512e-06, "loss": 0.4160478591918945, "num_input_tokens_seen": 337688792, "step": 10590, "train_runtime": 27702.5465, "train_tokens_per_second": 12189.81 }, { "epoch": 0.7133719364395368, "grad_norm": 0.9078124349340013, "learning_rate": 7.176358632079277e-06, "loss": 0.3646445035934448, "num_input_tokens_seen": 337847408, "step": 10595, "train_runtime": 27716.2359, "train_tokens_per_second": 12189.513 }, { "epoch": 0.7137085914354969, "grad_norm": 0.8152601091441659, "learning_rate": 7.173977863019288e-06, "loss": 0.3717693567276001, "num_input_tokens_seen": 338011136, "step": 10600, "train_runtime": 27728.703, "train_tokens_per_second": 12189.937 }, { "epoch": 0.7140452464314571, "grad_norm": 0.7325800560107413, "learning_rate": 7.171596486013323e-06, "loss": 0.3579261064529419, "num_input_tokens_seen": 338171184, "step": 10605, "train_runtime": 27741.1227, "train_tokens_per_second": 12190.249 }, { "epoch": 0.7143819014274172, "grad_norm": 0.8270114172418782, "learning_rate": 7.169214501727326e-06, "loss": 0.39139370918273925, "num_input_tokens_seen": 338324280, "step": 10610, "train_runtime": 27754.8468, "train_tokens_per_second": 12189.737 }, { "epoch": 0.7147185564233773, "grad_norm": 0.7587642851491243, "learning_rate": 7.16683191082741e-06, "loss": 0.369968843460083, "num_input_tokens_seen": 338482800, "step": 10615, "train_runtime": 27768.5105, "train_tokens_per_second": 12189.447 }, { "epoch": 0.7150552114193375, "grad_norm": 0.868044388753589, "learning_rate": 7.16444871397986e-06, "loss": 0.367620587348938, "num_input_tokens_seen": 338636096, "step": 10620, "train_runtime": 27781.2556, "train_tokens_per_second": 12189.373 }, { "epoch": 0.7153918664152976, "grad_norm": 0.7781232580543597, "learning_rate": 7.162064911851129e-06, "loss": 0.3659256935119629, "num_input_tokens_seen": 338798592, "step": 10625, "train_runtime": 27793.8587, "train_tokens_per_second": 12189.693 }, { "epoch": 0.7157285214112578, "grad_norm": 0.6606277368973356, "learning_rate": 7.15968050510784e-06, "loss": 0.395468544960022, "num_input_tokens_seen": 338957728, "step": 10630, "train_runtime": 27807.0685, "train_tokens_per_second": 12189.625 }, { "epoch": 0.7160651764072179, "grad_norm": 0.9534224388965269, "learning_rate": 7.1572954944167834e-06, "loss": 0.388535737991333, "num_input_tokens_seen": 339115264, "step": 10635, "train_runtime": 27819.9596, "train_tokens_per_second": 12189.639 }, { "epoch": 0.716401831403178, "grad_norm": 0.7964451095287164, "learning_rate": 7.154909880444922e-06, "loss": 0.3943023681640625, "num_input_tokens_seen": 339275584, "step": 10640, "train_runtime": 27832.5999, "train_tokens_per_second": 12189.863 }, { "epoch": 0.7167384863991382, "grad_norm": 0.7925800259984985, "learning_rate": 7.152523663859384e-06, "loss": 0.37608633041381834, "num_input_tokens_seen": 339436504, "step": 10645, "train_runtime": 27845.7987, "train_tokens_per_second": 12189.864 }, { "epoch": 0.7170751413950983, "grad_norm": 0.7705052861204793, "learning_rate": 7.150136845327466e-06, "loss": 0.37072129249572755, "num_input_tokens_seen": 339596464, "step": 10650, "train_runtime": 27858.4924, "train_tokens_per_second": 12190.052 }, { "epoch": 0.7174117963910585, "grad_norm": 0.7941401271476695, "learning_rate": 7.147749425516637e-06, "loss": 0.3894063711166382, "num_input_tokens_seen": 339758496, "step": 10655, "train_runtime": 27871.0792, "train_tokens_per_second": 12190.36 }, { "epoch": 0.7177484513870186, "grad_norm": 0.784326615970473, "learning_rate": 7.145361405094529e-06, "loss": 0.36672239303588866, "num_input_tokens_seen": 339922168, "step": 10660, "train_runtime": 27884.1143, "train_tokens_per_second": 12190.531 }, { "epoch": 0.7180851063829787, "grad_norm": 0.7198016757248019, "learning_rate": 7.142972784728945e-06, "loss": 0.3425378561019897, "num_input_tokens_seen": 340083264, "step": 10665, "train_runtime": 27897.5396, "train_tokens_per_second": 12190.439 }, { "epoch": 0.7184217613789389, "grad_norm": 0.8364815956422419, "learning_rate": 7.140583565087856e-06, "loss": 0.3542825698852539, "num_input_tokens_seen": 340240728, "step": 10670, "train_runtime": 27909.98, "train_tokens_per_second": 12190.648 }, { "epoch": 0.718758416374899, "grad_norm": 0.7674437890454157, "learning_rate": 7.138193746839399e-06, "loss": 0.4162745475769043, "num_input_tokens_seen": 340402880, "step": 10675, "train_runtime": 27923.2493, "train_tokens_per_second": 12190.662 }, { "epoch": 0.7190950713708592, "grad_norm": 0.7718282668105777, "learning_rate": 7.135803330651878e-06, "loss": 0.39674816131591795, "num_input_tokens_seen": 340565144, "step": 10680, "train_runtime": 27935.8599, "train_tokens_per_second": 12190.967 }, { "epoch": 0.7194317263668193, "grad_norm": 0.7732556536928907, "learning_rate": 7.133412317193766e-06, "loss": 0.38421599864959716, "num_input_tokens_seen": 340727736, "step": 10685, "train_runtime": 27948.5334, "train_tokens_per_second": 12191.256 }, { "epoch": 0.7197683813627794, "grad_norm": 0.899091902994993, "learning_rate": 7.131020707133703e-06, "loss": 0.38947148323059083, "num_input_tokens_seen": 340879800, "step": 10690, "train_runtime": 27961.6914, "train_tokens_per_second": 12190.958 }, { "epoch": 0.7201050363587396, "grad_norm": 0.765227904803758, "learning_rate": 7.128628501140495e-06, "loss": 0.40358428955078124, "num_input_tokens_seen": 341036088, "step": 10695, "train_runtime": 27974.4425, "train_tokens_per_second": 12190.988 }, { "epoch": 0.7204416913546997, "grad_norm": 0.8612854137590272, "learning_rate": 7.126235699883115e-06, "loss": 0.35994644165039064, "num_input_tokens_seen": 341191928, "step": 10700, "train_runtime": 27987.3153, "train_tokens_per_second": 12190.949 }, { "epoch": 0.7207783463506598, "grad_norm": 0.7557529933064636, "learning_rate": 7.1238423040306995e-06, "loss": 0.3696707010269165, "num_input_tokens_seen": 341354928, "step": 10705, "train_runtime": 28002.1956, "train_tokens_per_second": 12190.292 }, { "epoch": 0.72111500134662, "grad_norm": 0.7683709245482409, "learning_rate": 7.121448314252557e-06, "loss": 0.3456122636795044, "num_input_tokens_seen": 341518768, "step": 10710, "train_runtime": 28014.6162, "train_tokens_per_second": 12190.735 }, { "epoch": 0.7214516563425801, "grad_norm": 0.7525902569740035, "learning_rate": 7.1190537312181586e-06, "loss": 0.3708991050720215, "num_input_tokens_seen": 341674408, "step": 10715, "train_runtime": 28027.2339, "train_tokens_per_second": 12190.8 }, { "epoch": 0.7217883113385403, "grad_norm": 0.7682714708553864, "learning_rate": 7.116658555597141e-06, "loss": 0.36903038024902346, "num_input_tokens_seen": 341823976, "step": 10720, "train_runtime": 28041.0515, "train_tokens_per_second": 12190.127 }, { "epoch": 0.7221249663345004, "grad_norm": 0.7379297949200991, "learning_rate": 7.114262788059308e-06, "loss": 0.36638965606689455, "num_input_tokens_seen": 341981600, "step": 10725, "train_runtime": 28054.2014, "train_tokens_per_second": 12190.032 }, { "epoch": 0.7224616213304605, "grad_norm": 0.7576346068327312, "learning_rate": 7.111866429274627e-06, "loss": 0.37665524482727053, "num_input_tokens_seen": 342139872, "step": 10730, "train_runtime": 28068.279, "train_tokens_per_second": 12189.556 }, { "epoch": 0.7227982763264207, "grad_norm": 0.8864285703330764, "learning_rate": 7.1094694799132356e-06, "loss": 0.4015091896057129, "num_input_tokens_seen": 342303024, "step": 10735, "train_runtime": 28081.1618, "train_tokens_per_second": 12189.774 }, { "epoch": 0.7231349313223808, "grad_norm": 0.7276423257551156, "learning_rate": 7.10707194064543e-06, "loss": 0.3598616361618042, "num_input_tokens_seen": 342464544, "step": 10740, "train_runtime": 28095.3885, "train_tokens_per_second": 12189.351 }, { "epoch": 0.723471586318341, "grad_norm": 0.8087085237045454, "learning_rate": 7.104673812141676e-06, "loss": 0.4158106803894043, "num_input_tokens_seen": 342624888, "step": 10745, "train_runtime": 28108.0365, "train_tokens_per_second": 12189.57 }, { "epoch": 0.7238082413143011, "grad_norm": 0.872629832568239, "learning_rate": 7.102275095072601e-06, "loss": 0.39856777191162107, "num_input_tokens_seen": 342787792, "step": 10750, "train_runtime": 28120.7825, "train_tokens_per_second": 12189.838 }, { "epoch": 0.7241448963102612, "grad_norm": 0.7639045859682624, "learning_rate": 7.099875790108998e-06, "loss": 0.37062621116638184, "num_input_tokens_seen": 342949784, "step": 10755, "train_runtime": 28133.3539, "train_tokens_per_second": 12190.149 }, { "epoch": 0.7244815513062214, "grad_norm": 0.6964740220400891, "learning_rate": 7.097475897921827e-06, "loss": 0.37868902683258054, "num_input_tokens_seen": 343112440, "step": 10760, "train_runtime": 28146.6934, "train_tokens_per_second": 12190.151 }, { "epoch": 0.7248182063021815, "grad_norm": 0.7504051012605525, "learning_rate": 7.09507541918221e-06, "loss": 0.39956738948822024, "num_input_tokens_seen": 343269208, "step": 10765, "train_runtime": 28159.5197, "train_tokens_per_second": 12190.166 }, { "epoch": 0.7251548612981417, "grad_norm": 0.6549894176623092, "learning_rate": 7.092674354561433e-06, "loss": 0.39935975074768065, "num_input_tokens_seen": 343428440, "step": 10770, "train_runtime": 28172.2195, "train_tokens_per_second": 12190.322 }, { "epoch": 0.7254915162941018, "grad_norm": 1.254793393903918, "learning_rate": 7.090272704730945e-06, "loss": 0.35133283138275145, "num_input_tokens_seen": 343583144, "step": 10775, "train_runtime": 28185.3377, "train_tokens_per_second": 12190.138 }, { "epoch": 0.7258281712900619, "grad_norm": 0.7244088678840466, "learning_rate": 7.08787047036236e-06, "loss": 0.3733917951583862, "num_input_tokens_seen": 343746984, "step": 10780, "train_runtime": 28197.7535, "train_tokens_per_second": 12190.58 }, { "epoch": 0.7261648262860221, "grad_norm": 0.805215070944072, "learning_rate": 7.085467652127457e-06, "loss": 0.4085439682006836, "num_input_tokens_seen": 343908288, "step": 10785, "train_runtime": 28210.7366, "train_tokens_per_second": 12190.688 }, { "epoch": 0.7265014812819822, "grad_norm": 0.7429186764397921, "learning_rate": 7.083064250698175e-06, "loss": 0.3563601016998291, "num_input_tokens_seen": 344068456, "step": 10790, "train_runtime": 28223.1507, "train_tokens_per_second": 12191.001 }, { "epoch": 0.7268381362779424, "grad_norm": 0.7367035083050605, "learning_rate": 7.0806602667466175e-06, "loss": 0.386067533493042, "num_input_tokens_seen": 344231032, "step": 10795, "train_runtime": 28235.813, "train_tokens_per_second": 12191.292 }, { "epoch": 0.7271747912739025, "grad_norm": 0.7573296908801356, "learning_rate": 7.078255700945051e-06, "loss": 0.3892808437347412, "num_input_tokens_seen": 344386016, "step": 10800, "train_runtime": 28249.0749, "train_tokens_per_second": 12191.055 }, { "epoch": 0.7275114462698626, "grad_norm": 0.8938068023827014, "learning_rate": 7.075850553965904e-06, "loss": 0.3707104682922363, "num_input_tokens_seen": 344539736, "step": 10805, "train_runtime": 28262.1548, "train_tokens_per_second": 12190.852 }, { "epoch": 0.7278481012658228, "grad_norm": 0.9620156937207518, "learning_rate": 7.07344482648177e-06, "loss": 0.40392327308654785, "num_input_tokens_seen": 344697400, "step": 10810, "train_runtime": 28275.0138, "train_tokens_per_second": 12190.884 }, { "epoch": 0.7281847562617829, "grad_norm": 0.8257473123283324, "learning_rate": 7.071038519165402e-06, "loss": 0.3887991428375244, "num_input_tokens_seen": 344855536, "step": 10815, "train_runtime": 28287.9078, "train_tokens_per_second": 12190.917 }, { "epoch": 0.7285214112577431, "grad_norm": 0.8079518972191025, "learning_rate": 7.068631632689716e-06, "loss": 0.3810680627822876, "num_input_tokens_seen": 345014864, "step": 10820, "train_runtime": 28300.4853, "train_tokens_per_second": 12191.129 }, { "epoch": 0.7288580662537032, "grad_norm": 0.860753180218142, "learning_rate": 7.066224167727791e-06, "loss": 0.4030139923095703, "num_input_tokens_seen": 345175544, "step": 10825, "train_runtime": 28314.1332, "train_tokens_per_second": 12190.927 }, { "epoch": 0.7291947212496633, "grad_norm": 0.7666125853117247, "learning_rate": 7.063816124952865e-06, "loss": 0.36918230056762696, "num_input_tokens_seen": 345333976, "step": 10830, "train_runtime": 28327.0894, "train_tokens_per_second": 12190.945 }, { "epoch": 0.7295313762456235, "grad_norm": 0.7176807913897995, "learning_rate": 7.061407505038341e-06, "loss": 0.3628925561904907, "num_input_tokens_seen": 345495176, "step": 10835, "train_runtime": 28340.2438, "train_tokens_per_second": 12190.974 }, { "epoch": 0.7298680312415836, "grad_norm": 1.1746539208753348, "learning_rate": 7.058998308657782e-06, "loss": 0.3935364007949829, "num_input_tokens_seen": 345658656, "step": 10840, "train_runtime": 28353.3065, "train_tokens_per_second": 12191.123 }, { "epoch": 0.7302046862375438, "grad_norm": 0.7159174579985556, "learning_rate": 7.056588536484912e-06, "loss": 0.3441486835479736, "num_input_tokens_seen": 345809480, "step": 10845, "train_runtime": 28366.8538, "train_tokens_per_second": 12190.618 }, { "epoch": 0.7305413412335039, "grad_norm": 0.6628617352153386, "learning_rate": 7.0541781891936145e-06, "loss": 0.3633133888244629, "num_input_tokens_seen": 345968544, "step": 10850, "train_runtime": 28379.8466, "train_tokens_per_second": 12190.642 }, { "epoch": 0.730877996229464, "grad_norm": 0.8035015103488539, "learning_rate": 7.0517672674579364e-06, "loss": 0.37425904273986815, "num_input_tokens_seen": 346125752, "step": 10855, "train_runtime": 28392.5513, "train_tokens_per_second": 12190.724 }, { "epoch": 0.7312146512254242, "grad_norm": 0.8337969646990308, "learning_rate": 7.049355771952087e-06, "loss": 0.37378602027893065, "num_input_tokens_seen": 346281088, "step": 10860, "train_runtime": 28405.8732, "train_tokens_per_second": 12190.475 }, { "epoch": 0.7315513062213843, "grad_norm": 0.7659756718702523, "learning_rate": 7.046943703350429e-06, "loss": 0.381595253944397, "num_input_tokens_seen": 346444904, "step": 10865, "train_runtime": 28418.9565, "train_tokens_per_second": 12190.627 }, { "epoch": 0.7318879612173445, "grad_norm": 0.7463020246616815, "learning_rate": 7.044531062327492e-06, "loss": 0.37255134582519533, "num_input_tokens_seen": 346604232, "step": 10870, "train_runtime": 28432.0746, "train_tokens_per_second": 12190.606 }, { "epoch": 0.7322246162133046, "grad_norm": 0.7067416530205086, "learning_rate": 7.042117849557963e-06, "loss": 0.3892983436584473, "num_input_tokens_seen": 346767424, "step": 10875, "train_runtime": 28444.9421, "train_tokens_per_second": 12190.829 }, { "epoch": 0.7325612712092647, "grad_norm": 0.7801124589065547, "learning_rate": 7.0397040657166885e-06, "loss": 0.3601548194885254, "num_input_tokens_seen": 346926904, "step": 10880, "train_runtime": 28457.5529, "train_tokens_per_second": 12191.031 }, { "epoch": 0.7328979262052249, "grad_norm": 0.7649475493052427, "learning_rate": 7.037289711478676e-06, "loss": 0.3586939811706543, "num_input_tokens_seen": 347082872, "step": 10885, "train_runtime": 28470.9833, "train_tokens_per_second": 12190.758 }, { "epoch": 0.733234581201185, "grad_norm": 0.7907576252881421, "learning_rate": 7.034874787519095e-06, "loss": 0.3743765354156494, "num_input_tokens_seen": 347245600, "step": 10890, "train_runtime": 28484.0533, "train_tokens_per_second": 12190.877 }, { "epoch": 0.7335712361971451, "grad_norm": 0.7252725337230612, "learning_rate": 7.0324592945132655e-06, "loss": 0.41841630935668944, "num_input_tokens_seen": 347405328, "step": 10895, "train_runtime": 28496.7209, "train_tokens_per_second": 12191.063 }, { "epoch": 0.7339078911931053, "grad_norm": 0.7406333516765419, "learning_rate": 7.0300432331366764e-06, "loss": 0.38999099731445314, "num_input_tokens_seen": 347562472, "step": 10900, "train_runtime": 28510.1453, "train_tokens_per_second": 12190.835 }, { "epoch": 0.7342445461890654, "grad_norm": 0.7621404512742588, "learning_rate": 7.02762660406497e-06, "loss": 0.3798921346664429, "num_input_tokens_seen": 347723568, "step": 10905, "train_runtime": 28524.2497, "train_tokens_per_second": 12190.454 }, { "epoch": 0.7345812011850256, "grad_norm": 0.7095460004925469, "learning_rate": 7.02520940797395e-06, "loss": 0.38338747024536135, "num_input_tokens_seen": 347881128, "step": 10910, "train_runtime": 28537.8705, "train_tokens_per_second": 12190.157 }, { "epoch": 0.7349178561809857, "grad_norm": 0.7595574367992566, "learning_rate": 7.022791645539576e-06, "loss": 0.3737035274505615, "num_input_tokens_seen": 348034928, "step": 10915, "train_runtime": 28551.2091, "train_tokens_per_second": 12189.849 }, { "epoch": 0.7352545111769458, "grad_norm": 0.8053033063795544, "learning_rate": 7.02037331743797e-06, "loss": 0.4115499496459961, "num_input_tokens_seen": 348193504, "step": 10920, "train_runtime": 28563.9096, "train_tokens_per_second": 12189.981 }, { "epoch": 0.735591166172906, "grad_norm": 0.7859396208213398, "learning_rate": 7.0179544243454076e-06, "loss": 0.37235002517700194, "num_input_tokens_seen": 348356712, "step": 10925, "train_runtime": 28576.8047, "train_tokens_per_second": 12190.191 }, { "epoch": 0.7359278211688661, "grad_norm": 0.8038765297550386, "learning_rate": 7.0155349669383245e-06, "loss": 0.38625392913818357, "num_input_tokens_seen": 348516192, "step": 10930, "train_runtime": 28589.8397, "train_tokens_per_second": 12190.211 }, { "epoch": 0.7362644761648263, "grad_norm": 0.6995250176492618, "learning_rate": 7.013114945893316e-06, "loss": 0.35385162830352784, "num_input_tokens_seen": 348677232, "step": 10935, "train_runtime": 28602.2835, "train_tokens_per_second": 12190.538 }, { "epoch": 0.7366011311607864, "grad_norm": 0.6820520260462778, "learning_rate": 7.010694361887131e-06, "loss": 0.36516613960266114, "num_input_tokens_seen": 348841072, "step": 10940, "train_runtime": 28614.7059, "train_tokens_per_second": 12190.972 }, { "epoch": 0.7369377861567465, "grad_norm": 0.7272829036236642, "learning_rate": 7.008273215596681e-06, "loss": 0.4030038833618164, "num_input_tokens_seen": 349000096, "step": 10945, "train_runtime": 28627.3709, "train_tokens_per_second": 12191.133 }, { "epoch": 0.7372744411527067, "grad_norm": 0.69924006658489, "learning_rate": 7.005851507699029e-06, "loss": 0.37035179138183594, "num_input_tokens_seen": 349161216, "step": 10950, "train_runtime": 28640.456, "train_tokens_per_second": 12191.189 }, { "epoch": 0.7376110961486668, "grad_norm": 0.6889365743760394, "learning_rate": 7.003429238871399e-06, "loss": 0.36351757049560546, "num_input_tokens_seen": 349325056, "step": 10955, "train_runtime": 28652.8689, "train_tokens_per_second": 12191.626 }, { "epoch": 0.737947751144627, "grad_norm": 0.7599391803072556, "learning_rate": 7.001006409791171e-06, "loss": 0.40810480117797854, "num_input_tokens_seen": 349484024, "step": 10960, "train_runtime": 28665.5641, "train_tokens_per_second": 12191.772 }, { "epoch": 0.7382844061405871, "grad_norm": 0.8499585323454134, "learning_rate": 6.998583021135882e-06, "loss": 0.36732144355773927, "num_input_tokens_seen": 349643960, "step": 10965, "train_runtime": 28678.3827, "train_tokens_per_second": 12191.9 }, { "epoch": 0.7386210611365472, "grad_norm": 0.8167452189482237, "learning_rate": 6.996159073583224e-06, "loss": 0.38299145698547366, "num_input_tokens_seen": 349803848, "step": 10970, "train_runtime": 28691.5701, "train_tokens_per_second": 12191.868 }, { "epoch": 0.7389577161325074, "grad_norm": 0.7454367228465312, "learning_rate": 6.993734567811046e-06, "loss": 0.3518054008483887, "num_input_tokens_seen": 349964880, "step": 10975, "train_runtime": 28704.8456, "train_tokens_per_second": 12191.84 }, { "epoch": 0.7392943711284675, "grad_norm": 0.75989089905664, "learning_rate": 6.991309504497352e-06, "loss": 0.3895235061645508, "num_input_tokens_seen": 350127400, "step": 10980, "train_runtime": 28718.1315, "train_tokens_per_second": 12191.859 }, { "epoch": 0.7396310261244277, "grad_norm": 0.8390880777520918, "learning_rate": 6.988883884320307e-06, "loss": 0.3668651103973389, "num_input_tokens_seen": 350286720, "step": 10985, "train_runtime": 28732.3812, "train_tokens_per_second": 12191.357 }, { "epoch": 0.7399676811203878, "grad_norm": 0.7769868566526152, "learning_rate": 6.9864577079582254e-06, "loss": 0.3895045280456543, "num_input_tokens_seen": 350446680, "step": 10990, "train_runtime": 28744.8118, "train_tokens_per_second": 12191.65 }, { "epoch": 0.7403043361163479, "grad_norm": 0.7598938344773035, "learning_rate": 6.984030976089581e-06, "loss": 0.3538069486618042, "num_input_tokens_seen": 350606392, "step": 10995, "train_runtime": 28757.7513, "train_tokens_per_second": 12191.718 }, { "epoch": 0.7406409911123081, "grad_norm": 0.7684784808729817, "learning_rate": 6.981603689392999e-06, "loss": 0.375300669670105, "num_input_tokens_seen": 350765992, "step": 11000, "train_runtime": 28770.7447, "train_tokens_per_second": 12191.759 }, { "epoch": 0.7409776461082682, "grad_norm": 0.7353534368233693, "learning_rate": 6.979175848547263e-06, "loss": 0.3612549066543579, "num_input_tokens_seen": 350920560, "step": 11005, "train_runtime": 28783.2396, "train_tokens_per_second": 12191.837 }, { "epoch": 0.7413143011042284, "grad_norm": 0.8251660635475988, "learning_rate": 6.976747454231316e-06, "loss": 0.36198992729187013, "num_input_tokens_seen": 351080808, "step": 11010, "train_runtime": 28796.0067, "train_tokens_per_second": 12191.996 }, { "epoch": 0.7416509561001885, "grad_norm": 0.748045451307221, "learning_rate": 6.974318507124245e-06, "loss": 0.3802135467529297, "num_input_tokens_seen": 351239064, "step": 11015, "train_runtime": 28809.7118, "train_tokens_per_second": 12191.69 }, { "epoch": 0.7419876110961486, "grad_norm": 0.8269015310519211, "learning_rate": 6.971889007905299e-06, "loss": 0.3873478889465332, "num_input_tokens_seen": 351392016, "step": 11020, "train_runtime": 28822.5962, "train_tokens_per_second": 12191.546 }, { "epoch": 0.7423242660921088, "grad_norm": 0.7571107197374777, "learning_rate": 6.9694589572538795e-06, "loss": 0.4120494842529297, "num_input_tokens_seen": 351555856, "step": 11025, "train_runtime": 28835.0106, "train_tokens_per_second": 12191.979 }, { "epoch": 0.7426609210880689, "grad_norm": 0.7817612654651281, "learning_rate": 6.9670283558495436e-06, "loss": 0.38866589069366453, "num_input_tokens_seen": 351716488, "step": 11030, "train_runtime": 28847.8259, "train_tokens_per_second": 12192.132 }, { "epoch": 0.742997576084029, "grad_norm": 0.8313633361570423, "learning_rate": 6.964597204371999e-06, "loss": 0.4034535884857178, "num_input_tokens_seen": 351870424, "step": 11035, "train_runtime": 28860.5483, "train_tokens_per_second": 12192.091 }, { "epoch": 0.7433342310799892, "grad_norm": 0.746626410951858, "learning_rate": 6.962165503501111e-06, "loss": 0.3369437217712402, "num_input_tokens_seen": 352031240, "step": 11040, "train_runtime": 28873.3945, "train_tokens_per_second": 12192.236 }, { "epoch": 0.7436708860759493, "grad_norm": 0.7511190441872951, "learning_rate": 6.959733253916899e-06, "loss": 0.39778661727905273, "num_input_tokens_seen": 352195016, "step": 11045, "train_runtime": 28886.4232, "train_tokens_per_second": 12192.407 }, { "epoch": 0.7440075410719095, "grad_norm": 0.8894496072353121, "learning_rate": 6.95730045629953e-06, "loss": 0.3642216444015503, "num_input_tokens_seen": 352352880, "step": 11050, "train_runtime": 28900.4416, "train_tokens_per_second": 12191.955 }, { "epoch": 0.7443441960678696, "grad_norm": 0.8603292352789983, "learning_rate": 6.954867111329329e-06, "loss": 0.4088578224182129, "num_input_tokens_seen": 352514848, "step": 11055, "train_runtime": 28913.6684, "train_tokens_per_second": 12191.979 }, { "epoch": 0.7446808510638298, "grad_norm": 0.7913107669747537, "learning_rate": 6.952433219686775e-06, "loss": 0.38846783638000487, "num_input_tokens_seen": 352677112, "step": 11060, "train_runtime": 28927.1027, "train_tokens_per_second": 12191.927 }, { "epoch": 0.7450175060597899, "grad_norm": 0.7888051251464282, "learning_rate": 6.949998782052497e-06, "loss": 0.3961481094360352, "num_input_tokens_seen": 352837840, "step": 11065, "train_runtime": 28941.3438, "train_tokens_per_second": 12191.481 }, { "epoch": 0.74535416105575, "grad_norm": 0.729534910853266, "learning_rate": 6.947563799107277e-06, "loss": 0.35516939163208006, "num_input_tokens_seen": 352993664, "step": 11070, "train_runtime": 28954.3841, "train_tokens_per_second": 12191.372 }, { "epoch": 0.7456908160517102, "grad_norm": 0.8128142264821825, "learning_rate": 6.945128271532052e-06, "loss": 0.36089444160461426, "num_input_tokens_seen": 353157504, "step": 11075, "train_runtime": 28966.7826, "train_tokens_per_second": 12191.81 }, { "epoch": 0.7460274710476703, "grad_norm": 0.745263020066342, "learning_rate": 6.942692200007908e-06, "loss": 0.38309080600738527, "num_input_tokens_seen": 353315680, "step": 11080, "train_runtime": 28979.5037, "train_tokens_per_second": 12191.916 }, { "epoch": 0.7463641260436304, "grad_norm": 0.7435729424190132, "learning_rate": 6.9402555852160845e-06, "loss": 0.408322811126709, "num_input_tokens_seen": 353478176, "step": 11085, "train_runtime": 28992.808, "train_tokens_per_second": 12191.926 }, { "epoch": 0.7467007810395906, "grad_norm": 0.7042572138842473, "learning_rate": 6.937818427837975e-06, "loss": 0.38018217086791994, "num_input_tokens_seen": 353641384, "step": 11090, "train_runtime": 29005.6811, "train_tokens_per_second": 12192.142 }, { "epoch": 0.7470374360355507, "grad_norm": 0.9306564695444097, "learning_rate": 6.93538072855512e-06, "loss": 0.4043403625488281, "num_input_tokens_seen": 353803808, "step": 11095, "train_runtime": 29019.0423, "train_tokens_per_second": 12192.126 }, { "epoch": 0.7473740910315109, "grad_norm": 0.7416083352080415, "learning_rate": 6.932942488049217e-06, "loss": 0.33733205795288085, "num_input_tokens_seen": 353961024, "step": 11100, "train_runtime": 29032.4211, "train_tokens_per_second": 12191.922 }, { "epoch": 0.747710746027471, "grad_norm": 0.7473002189009285, "learning_rate": 6.930503707002108e-06, "loss": 0.40807476043701174, "num_input_tokens_seen": 354120896, "step": 11105, "train_runtime": 29045.8035, "train_tokens_per_second": 12191.809 }, { "epoch": 0.7480474010234311, "grad_norm": 0.6958595855081899, "learning_rate": 6.928064386095796e-06, "loss": 0.3731332540512085, "num_input_tokens_seen": 354284736, "step": 11110, "train_runtime": 29058.2111, "train_tokens_per_second": 12192.242 }, { "epoch": 0.7483840560193913, "grad_norm": 0.8839227583713383, "learning_rate": 6.9256245260124264e-06, "loss": 0.38963606357574465, "num_input_tokens_seen": 354445576, "step": 11115, "train_runtime": 29070.6483, "train_tokens_per_second": 12192.558 }, { "epoch": 0.7487207110153514, "grad_norm": 0.7435427288059749, "learning_rate": 6.923184127434298e-06, "loss": 0.3701322555541992, "num_input_tokens_seen": 354598736, "step": 11120, "train_runtime": 29083.7693, "train_tokens_per_second": 12192.324 }, { "epoch": 0.7490573660113116, "grad_norm": 0.9811755512839009, "learning_rate": 6.920743191043861e-06, "loss": 0.34794456958770753, "num_input_tokens_seen": 354754808, "step": 11125, "train_runtime": 29096.4452, "train_tokens_per_second": 12192.376 }, { "epoch": 0.7493940210072717, "grad_norm": 0.6417933775269338, "learning_rate": 6.918301717523714e-06, "loss": 0.3479334354400635, "num_input_tokens_seen": 354911328, "step": 11130, "train_runtime": 29109.0736, "train_tokens_per_second": 12192.464 }, { "epoch": 0.7497306760032318, "grad_norm": 0.7741077754094616, "learning_rate": 6.915859707556611e-06, "loss": 0.3851003170013428, "num_input_tokens_seen": 355068488, "step": 11135, "train_runtime": 29121.5598, "train_tokens_per_second": 12192.633 }, { "epoch": 0.750067330999192, "grad_norm": 0.8390171220875373, "learning_rate": 6.913417161825449e-06, "loss": 0.4130240440368652, "num_input_tokens_seen": 355226344, "step": 11140, "train_runtime": 29134.7528, "train_tokens_per_second": 12192.53 }, { "epoch": 0.7504039859951521, "grad_norm": 0.7487968636238541, "learning_rate": 6.91097408101328e-06, "loss": 0.3791627883911133, "num_input_tokens_seen": 355386896, "step": 11145, "train_runtime": 29147.8169, "train_tokens_per_second": 12192.573 }, { "epoch": 0.7507406409911123, "grad_norm": 0.9765637692779789, "learning_rate": 6.908530465803302e-06, "loss": 0.3772862434387207, "num_input_tokens_seen": 355540696, "step": 11150, "train_runtime": 29161.1843, "train_tokens_per_second": 12192.258 }, { "epoch": 0.7510772959870724, "grad_norm": 0.8557504378000204, "learning_rate": 6.906086316878865e-06, "loss": 0.3812490224838257, "num_input_tokens_seen": 355693720, "step": 11155, "train_runtime": 29174.6216, "train_tokens_per_second": 12191.888 }, { "epoch": 0.7514139509830325, "grad_norm": 0.7219876610404651, "learning_rate": 6.903641634923468e-06, "loss": 0.3538412570953369, "num_input_tokens_seen": 355850208, "step": 11160, "train_runtime": 29187.0605, "train_tokens_per_second": 12192.054 }, { "epoch": 0.7517506059789927, "grad_norm": 0.8396885968011758, "learning_rate": 6.9011964206207585e-06, "loss": 0.4000197410583496, "num_input_tokens_seen": 356003032, "step": 11165, "train_runtime": 29201.3197, "train_tokens_per_second": 12191.334 }, { "epoch": 0.7520872609749528, "grad_norm": 0.8139340499458105, "learning_rate": 6.898750674654531e-06, "loss": 0.37145266532897947, "num_input_tokens_seen": 356164080, "step": 11170, "train_runtime": 29215.0693, "train_tokens_per_second": 12191.109 }, { "epoch": 0.752423915970913, "grad_norm": 0.79460109141314, "learning_rate": 6.896304397708733e-06, "loss": 0.3592658281326294, "num_input_tokens_seen": 356321656, "step": 11175, "train_runtime": 29228.216, "train_tokens_per_second": 12191.016 }, { "epoch": 0.7527605709668731, "grad_norm": 0.8669921164210402, "learning_rate": 6.893857590467456e-06, "loss": 0.3539292573928833, "num_input_tokens_seen": 356476320, "step": 11180, "train_runtime": 29240.8622, "train_tokens_per_second": 12191.033 }, { "epoch": 0.7530972259628332, "grad_norm": 0.7919910070074195, "learning_rate": 6.891410253614944e-06, "loss": 0.35689308643341067, "num_input_tokens_seen": 356632400, "step": 11185, "train_runtime": 29254.0285, "train_tokens_per_second": 12190.882 }, { "epoch": 0.7534338809587934, "grad_norm": 0.8004556253149746, "learning_rate": 6.888962387835586e-06, "loss": 0.3711047887802124, "num_input_tokens_seen": 356793824, "step": 11190, "train_runtime": 29267.1883, "train_tokens_per_second": 12190.916 }, { "epoch": 0.7537705359547535, "grad_norm": 0.8134820844966203, "learning_rate": 6.886513993813919e-06, "loss": 0.40021324157714844, "num_input_tokens_seen": 356953920, "step": 11195, "train_runtime": 29281.1668, "train_tokens_per_second": 12190.563 }, { "epoch": 0.7541071909507137, "grad_norm": 0.7642009268562932, "learning_rate": 6.88406507223463e-06, "loss": 0.37061433792114257, "num_input_tokens_seen": 357117760, "step": 11200, "train_runtime": 29293.5827, "train_tokens_per_second": 12190.99 }, { "epoch": 0.7544438459466738, "grad_norm": 0.7471490246561128, "learning_rate": 6.881615623782551e-06, "loss": 0.36925468444824217, "num_input_tokens_seen": 357275832, "step": 11205, "train_runtime": 29307.9034, "train_tokens_per_second": 12190.426 }, { "epoch": 0.7547805009426339, "grad_norm": 0.6774004726417472, "learning_rate": 6.879165649142663e-06, "loss": 0.3666870594024658, "num_input_tokens_seen": 357437568, "step": 11210, "train_runtime": 29321.4085, "train_tokens_per_second": 12190.327 }, { "epoch": 0.7551171559385941, "grad_norm": 0.7872210007616245, "learning_rate": 6.876715149000093e-06, "loss": 0.37008869647979736, "num_input_tokens_seen": 357591616, "step": 11215, "train_runtime": 29334.3948, "train_tokens_per_second": 12190.182 }, { "epoch": 0.7554538109345542, "grad_norm": 0.757046930474841, "learning_rate": 6.874264124040117e-06, "loss": 0.37499892711639404, "num_input_tokens_seen": 357754320, "step": 11220, "train_runtime": 29347.3324, "train_tokens_per_second": 12190.352 }, { "epoch": 0.7557904659305144, "grad_norm": 0.8327627703764695, "learning_rate": 6.871812574948154e-06, "loss": 0.40956530570983884, "num_input_tokens_seen": 357913480, "step": 11225, "train_runtime": 29360.25, "train_tokens_per_second": 12190.41 }, { "epoch": 0.7561271209264745, "grad_norm": 0.8662811620632913, "learning_rate": 6.869360502409773e-06, "loss": 0.38788011074066164, "num_input_tokens_seen": 358074680, "step": 11230, "train_runtime": 29372.992, "train_tokens_per_second": 12190.61 }, { "epoch": 0.7564637759224346, "grad_norm": 0.8094273414786728, "learning_rate": 6.866907907110689e-06, "loss": 0.36602394580841063, "num_input_tokens_seen": 358230048, "step": 11235, "train_runtime": 29385.6207, "train_tokens_per_second": 12190.658 }, { "epoch": 0.7568004309183949, "grad_norm": 0.720484140196403, "learning_rate": 6.864454789736763e-06, "loss": 0.3442512512207031, "num_input_tokens_seen": 358393608, "step": 11240, "train_runtime": 29398.6233, "train_tokens_per_second": 12190.83 }, { "epoch": 0.757137085914355, "grad_norm": 0.6873358735140016, "learning_rate": 6.8620011509740005e-06, "loss": 0.34670538902282716, "num_input_tokens_seen": 358551896, "step": 11245, "train_runtime": 29411.2089, "train_tokens_per_second": 12190.995 }, { "epoch": 0.7574737409103152, "grad_norm": 0.7891565359818309, "learning_rate": 6.859546991508552e-06, "loss": 0.3740941762924194, "num_input_tokens_seen": 358710872, "step": 11250, "train_runtime": 29423.8088, "train_tokens_per_second": 12191.177 }, { "epoch": 0.7578103959062753, "grad_norm": 0.6993226475720027, "learning_rate": 6.857092312026716e-06, "loss": 0.34750382900238036, "num_input_tokens_seen": 358872592, "step": 11255, "train_runtime": 29436.3283, "train_tokens_per_second": 12191.486 }, { "epoch": 0.7581470509022354, "grad_norm": 0.7677525233859016, "learning_rate": 6.8546371132149395e-06, "loss": 0.394059944152832, "num_input_tokens_seen": 359030944, "step": 11260, "train_runtime": 29448.9164, "train_tokens_per_second": 12191.652 }, { "epoch": 0.7584837058981956, "grad_norm": 0.7683725348939942, "learning_rate": 6.852181395759807e-06, "loss": 0.41542778015136717, "num_input_tokens_seen": 359194280, "step": 11265, "train_runtime": 29461.866, "train_tokens_per_second": 12191.837 }, { "epoch": 0.7588203608941557, "grad_norm": 0.6567574430482627, "learning_rate": 6.849725160348054e-06, "loss": 0.3582466125488281, "num_input_tokens_seen": 359352176, "step": 11270, "train_runtime": 29474.562, "train_tokens_per_second": 12191.943 }, { "epoch": 0.7591570158901159, "grad_norm": 0.8630367003820414, "learning_rate": 6.847268407666557e-06, "loss": 0.34615659713745117, "num_input_tokens_seen": 359512888, "step": 11275, "train_runtime": 29487.5686, "train_tokens_per_second": 12192.015 }, { "epoch": 0.759493670886076, "grad_norm": 0.8062156136396837, "learning_rate": 6.844811138402341e-06, "loss": 0.3790543794631958, "num_input_tokens_seen": 359675376, "step": 11280, "train_runtime": 29500.315, "train_tokens_per_second": 12192.255 }, { "epoch": 0.7598303258820361, "grad_norm": 0.7616178646648184, "learning_rate": 6.842353353242574e-06, "loss": 0.3697885274887085, "num_input_tokens_seen": 359832992, "step": 11285, "train_runtime": 29513.7338, "train_tokens_per_second": 12192.052 }, { "epoch": 0.7601669808779963, "grad_norm": 0.8835486212985131, "learning_rate": 6.839895052874565e-06, "loss": 0.39465861320495604, "num_input_tokens_seen": 359995320, "step": 11290, "train_runtime": 29526.7553, "train_tokens_per_second": 12192.173 }, { "epoch": 0.7605036358739564, "grad_norm": 0.7299233138556133, "learning_rate": 6.837436237985772e-06, "loss": 0.35462312698364257, "num_input_tokens_seen": 360157272, "step": 11295, "train_runtime": 29540.0725, "train_tokens_per_second": 12192.159 }, { "epoch": 0.7608402908699166, "grad_norm": 0.8612570451494536, "learning_rate": 6.834976909263794e-06, "loss": 0.38593153953552245, "num_input_tokens_seen": 360317424, "step": 11300, "train_runtime": 29553.6827, "train_tokens_per_second": 12191.964 }, { "epoch": 0.7611769458658767, "grad_norm": 0.7717601359819006, "learning_rate": 6.832517067396374e-06, "loss": 0.3730529546737671, "num_input_tokens_seen": 360480592, "step": 11305, "train_runtime": 29566.5355, "train_tokens_per_second": 12192.182 }, { "epoch": 0.7615136008618368, "grad_norm": 0.8029276193294044, "learning_rate": 6.8300567130714e-06, "loss": 0.39319963455200196, "num_input_tokens_seen": 360641592, "step": 11310, "train_runtime": 29578.9829, "train_tokens_per_second": 12192.495 }, { "epoch": 0.761850255857797, "grad_norm": 0.7422145690110517, "learning_rate": 6.8275958469769035e-06, "loss": 0.39521007537841796, "num_input_tokens_seen": 360802776, "step": 11315, "train_runtime": 29591.4701, "train_tokens_per_second": 12192.797 }, { "epoch": 0.7621869108537571, "grad_norm": 0.8185854436182528, "learning_rate": 6.825134469801055e-06, "loss": 0.3593320369720459, "num_input_tokens_seen": 360965128, "step": 11320, "train_runtime": 29604.1139, "train_tokens_per_second": 12193.073 }, { "epoch": 0.7625235658497173, "grad_norm": 0.8243747513242757, "learning_rate": 6.8226725822321715e-06, "loss": 0.40591912269592284, "num_input_tokens_seen": 361120704, "step": 11325, "train_runtime": 29617.4144, "train_tokens_per_second": 12192.85 }, { "epoch": 0.7628602208456774, "grad_norm": 0.7739255592175426, "learning_rate": 6.820210184958712e-06, "loss": 0.39017329216003416, "num_input_tokens_seen": 361284512, "step": 11330, "train_runtime": 29629.8738, "train_tokens_per_second": 12193.252 }, { "epoch": 0.7631968758416375, "grad_norm": 0.7869095068819479, "learning_rate": 6.81774727866928e-06, "loss": 0.38749332427978517, "num_input_tokens_seen": 361444352, "step": 11335, "train_runtime": 29643.8844, "train_tokens_per_second": 12192.881 }, { "epoch": 0.7635335308375977, "grad_norm": 0.8052285572147169, "learning_rate": 6.815283864052617e-06, "loss": 0.3830084800720215, "num_input_tokens_seen": 361604808, "step": 11340, "train_runtime": 29657.3765, "train_tokens_per_second": 12192.744 }, { "epoch": 0.7638701858335578, "grad_norm": 0.8210171420985842, "learning_rate": 6.812819941797611e-06, "loss": 0.397029447555542, "num_input_tokens_seen": 361757928, "step": 11345, "train_runtime": 29669.8755, "train_tokens_per_second": 12192.769 }, { "epoch": 0.764206840829518, "grad_norm": 0.8581451721551036, "learning_rate": 6.810355512593288e-06, "loss": 0.38977923393249514, "num_input_tokens_seen": 361917728, "step": 11350, "train_runtime": 29682.6505, "train_tokens_per_second": 12192.905 }, { "epoch": 0.7645434958254781, "grad_norm": 0.6712921829905516, "learning_rate": 6.807890577128817e-06, "loss": 0.3445927619934082, "num_input_tokens_seen": 362079696, "step": 11355, "train_runtime": 29695.7704, "train_tokens_per_second": 12192.972 }, { "epoch": 0.7648801508214382, "grad_norm": 0.7863791585585402, "learning_rate": 6.805425136093513e-06, "loss": 0.37203330993652345, "num_input_tokens_seen": 362238440, "step": 11360, "train_runtime": 29709.2908, "train_tokens_per_second": 12192.766 }, { "epoch": 0.7652168058173984, "grad_norm": 0.8479470132816593, "learning_rate": 6.802959190176827e-06, "loss": 0.38611886501312254, "num_input_tokens_seen": 362396280, "step": 11365, "train_runtime": 29722.627, "train_tokens_per_second": 12192.606 }, { "epoch": 0.7655534608133585, "grad_norm": 0.8222171740359264, "learning_rate": 6.800492740068352e-06, "loss": 0.3653825283050537, "num_input_tokens_seen": 362549696, "step": 11370, "train_runtime": 29736.3359, "train_tokens_per_second": 12192.144 }, { "epoch": 0.7658901158093187, "grad_norm": 0.8727787911253201, "learning_rate": 6.798025786457825e-06, "loss": 0.37914419174194336, "num_input_tokens_seen": 362711336, "step": 11375, "train_runtime": 29748.9516, "train_tokens_per_second": 12192.407 }, { "epoch": 0.7662267708052788, "grad_norm": 0.7244506826489351, "learning_rate": 6.795558330035118e-06, "loss": 0.37247552871704104, "num_input_tokens_seen": 362873448, "step": 11380, "train_runtime": 29761.481, "train_tokens_per_second": 12192.721 }, { "epoch": 0.7665634258012389, "grad_norm": 0.6813233772596614, "learning_rate": 6.793090371490251e-06, "loss": 0.3876584529876709, "num_input_tokens_seen": 363033344, "step": 11385, "train_runtime": 29773.9183, "train_tokens_per_second": 12192.999 }, { "epoch": 0.7669000807971991, "grad_norm": 0.8147571353650083, "learning_rate": 6.790621911513378e-06, "loss": 0.3760810852050781, "num_input_tokens_seen": 363192144, "step": 11390, "train_runtime": 29786.911, "train_tokens_per_second": 12193.011 }, { "epoch": 0.7672367357931592, "grad_norm": 0.8211650499021289, "learning_rate": 6.788152950794799e-06, "loss": 0.39856245517730715, "num_input_tokens_seen": 363350632, "step": 11395, "train_runtime": 29800.0292, "train_tokens_per_second": 12192.962 }, { "epoch": 0.7675733907891193, "grad_norm": 0.8689286824664951, "learning_rate": 6.7856834900249495e-06, "loss": 0.40386271476745605, "num_input_tokens_seen": 363511320, "step": 11400, "train_runtime": 29812.4685, "train_tokens_per_second": 12193.265 }, { "epoch": 0.7679100457850795, "grad_norm": 0.7798105528572442, "learning_rate": 6.783213529894405e-06, "loss": 0.3570334672927856, "num_input_tokens_seen": 363673184, "step": 11405, "train_runtime": 29824.9984, "train_tokens_per_second": 12193.569 }, { "epoch": 0.7682467007810396, "grad_norm": 0.7147971811410965, "learning_rate": 6.780743071093883e-06, "loss": 0.34810585975646974, "num_input_tokens_seen": 363834200, "step": 11410, "train_runtime": 29838.4608, "train_tokens_per_second": 12193.464 }, { "epoch": 0.7685833557769998, "grad_norm": 0.8090101958649409, "learning_rate": 6.77827211431424e-06, "loss": 0.3833613395690918, "num_input_tokens_seen": 363993880, "step": 11415, "train_runtime": 29851.0682, "train_tokens_per_second": 12193.663 }, { "epoch": 0.7689200107729599, "grad_norm": 0.6950873673459217, "learning_rate": 6.775800660246471e-06, "loss": 0.37551772594451904, "num_input_tokens_seen": 364146208, "step": 11420, "train_runtime": 29864.434, "train_tokens_per_second": 12193.307 }, { "epoch": 0.76925666576892, "grad_norm": 0.8926310843991966, "learning_rate": 6.77332870958171e-06, "loss": 0.37343225479125974, "num_input_tokens_seen": 364307056, "step": 11425, "train_runtime": 29876.8796, "train_tokens_per_second": 12193.611 }, { "epoch": 0.7695933207648802, "grad_norm": 0.7170998110429361, "learning_rate": 6.770856263011229e-06, "loss": 0.36758739948272706, "num_input_tokens_seen": 364464312, "step": 11430, "train_runtime": 29890.5294, "train_tokens_per_second": 12193.304 }, { "epoch": 0.7699299757608403, "grad_norm": 0.8981508930887381, "learning_rate": 6.768383321226442e-06, "loss": 0.3995571851730347, "num_input_tokens_seen": 364617288, "step": 11435, "train_runtime": 29903.6194, "train_tokens_per_second": 12193.082 }, { "epoch": 0.7702666307568005, "grad_norm": 0.8147507601969611, "learning_rate": 6.765909884918898e-06, "loss": 0.38014495372772217, "num_input_tokens_seen": 364771728, "step": 11440, "train_runtime": 29916.8318, "train_tokens_per_second": 12192.86 }, { "epoch": 0.7706032857527606, "grad_norm": 0.7524886291121373, "learning_rate": 6.763435954780286e-06, "loss": 0.3776134729385376, "num_input_tokens_seen": 364931408, "step": 11445, "train_runtime": 29929.698, "train_tokens_per_second": 12192.953 }, { "epoch": 0.7709399407487207, "grad_norm": 0.8168633699889626, "learning_rate": 6.7609615315024325e-06, "loss": 0.3896333694458008, "num_input_tokens_seen": 365089752, "step": 11450, "train_runtime": 29942.3106, "train_tokens_per_second": 12193.105 }, { "epoch": 0.7712765957446809, "grad_norm": 0.7691934325905628, "learning_rate": 6.758486615777301e-06, "loss": 0.3641579389572144, "num_input_tokens_seen": 365248576, "step": 11455, "train_runtime": 29955.3533, "train_tokens_per_second": 12193.099 }, { "epoch": 0.771613250740641, "grad_norm": 0.8507056742596609, "learning_rate": 6.756011208296995e-06, "loss": 0.3841691970825195, "num_input_tokens_seen": 365405808, "step": 11460, "train_runtime": 29968.7497, "train_tokens_per_second": 12192.895 }, { "epoch": 0.7719499057366012, "grad_norm": 0.9103659200468566, "learning_rate": 6.753535309753755e-06, "loss": 0.37653412818908694, "num_input_tokens_seen": 365561856, "step": 11465, "train_runtime": 29982.0373, "train_tokens_per_second": 12192.696 }, { "epoch": 0.7722865607325613, "grad_norm": 0.8512208053762094, "learning_rate": 6.7510589208399565e-06, "loss": 0.3696767568588257, "num_input_tokens_seen": 365719760, "step": 11470, "train_runtime": 29994.9306, "train_tokens_per_second": 12192.719 }, { "epoch": 0.7726232157285214, "grad_norm": 0.8501120940347665, "learning_rate": 6.748582042248115e-06, "loss": 0.3655768156051636, "num_input_tokens_seen": 365878168, "step": 11475, "train_runtime": 30007.8885, "train_tokens_per_second": 12192.733 }, { "epoch": 0.7729598707244816, "grad_norm": 0.7818660038196905, "learning_rate": 6.746104674670882e-06, "loss": 0.4025142192840576, "num_input_tokens_seen": 366037760, "step": 11480, "train_runtime": 30020.4375, "train_tokens_per_second": 12192.952 }, { "epoch": 0.7732965257204417, "grad_norm": 0.8367259012984112, "learning_rate": 6.743626818801042e-06, "loss": 0.4009434700012207, "num_input_tokens_seen": 366198568, "step": 11485, "train_runtime": 30033.341, "train_tokens_per_second": 12193.068 }, { "epoch": 0.7736331807164019, "grad_norm": 0.785632382930976, "learning_rate": 6.741148475331525e-06, "loss": 0.3762365818023682, "num_input_tokens_seen": 366358576, "step": 11490, "train_runtime": 30046.6623, "train_tokens_per_second": 12192.987 }, { "epoch": 0.773969835712362, "grad_norm": 0.7088082874155206, "learning_rate": 6.738669644955388e-06, "loss": 0.36430606842041013, "num_input_tokens_seen": 366519664, "step": 11495, "train_runtime": 30060.0103, "train_tokens_per_second": 12192.932 }, { "epoch": 0.7743064907083221, "grad_norm": 0.8063067943270414, "learning_rate": 6.736190328365828e-06, "loss": 0.36579194068908694, "num_input_tokens_seen": 366679576, "step": 11500, "train_runtime": 30072.721, "train_tokens_per_second": 12193.096 }, { "epoch": 0.7746431457042823, "grad_norm": 0.8080995968205417, "learning_rate": 6.73371052625618e-06, "loss": 0.3714073896408081, "num_input_tokens_seen": 366841464, "step": 11505, "train_runtime": 30085.261, "train_tokens_per_second": 12193.395 }, { "epoch": 0.7749798007002424, "grad_norm": 0.7137876393206664, "learning_rate": 6.731230239319912e-06, "loss": 0.37815117835998535, "num_input_tokens_seen": 367003472, "step": 11510, "train_runtime": 30098.4767, "train_tokens_per_second": 12193.423 }, { "epoch": 0.7753164556962026, "grad_norm": 0.6908970692232513, "learning_rate": 6.728749468250627e-06, "loss": 0.39992058277130127, "num_input_tokens_seen": 367164312, "step": 11515, "train_runtime": 30110.9249, "train_tokens_per_second": 12193.724 }, { "epoch": 0.7756531106921627, "grad_norm": 0.8408036808852651, "learning_rate": 6.726268213742066e-06, "loss": 0.37851681709289553, "num_input_tokens_seen": 367321704, "step": 11520, "train_runtime": 30124.3634, "train_tokens_per_second": 12193.509 }, { "epoch": 0.7759897656881228, "grad_norm": 0.6754893847148205, "learning_rate": 6.723786476488105e-06, "loss": 0.3802226781845093, "num_input_tokens_seen": 367480496, "step": 11525, "train_runtime": 30136.9362, "train_tokens_per_second": 12193.691 }, { "epoch": 0.776326420684083, "grad_norm": 0.7437825294940577, "learning_rate": 6.72130425718275e-06, "loss": 0.3518873929977417, "num_input_tokens_seen": 367637624, "step": 11530, "train_runtime": 30150.8119, "train_tokens_per_second": 12193.291 }, { "epoch": 0.7766630756800431, "grad_norm": 0.8881777690824689, "learning_rate": 6.718821556520151e-06, "loss": 0.39986333847045896, "num_input_tokens_seen": 367794592, "step": 11535, "train_runtime": 30164.271, "train_tokens_per_second": 12193.054 }, { "epoch": 0.7769997306760033, "grad_norm": 0.7806031710739979, "learning_rate": 6.716338375194583e-06, "loss": 0.38141722679138185, "num_input_tokens_seen": 367955144, "step": 11540, "train_runtime": 30177.3168, "train_tokens_per_second": 12193.103 }, { "epoch": 0.7773363856719634, "grad_norm": 0.7980098500901036, "learning_rate": 6.713854713900463e-06, "loss": 0.40670599937438967, "num_input_tokens_seen": 368115176, "step": 11545, "train_runtime": 30190.1441, "train_tokens_per_second": 12193.224 }, { "epoch": 0.7776730406679235, "grad_norm": 0.8412667780541814, "learning_rate": 6.7113705733323365e-06, "loss": 0.3950677394866943, "num_input_tokens_seen": 368272216, "step": 11550, "train_runtime": 30203.2624, "train_tokens_per_second": 12193.127 }, { "epoch": 0.7780096956638837, "grad_norm": 0.9087359918885015, "learning_rate": 6.708885954184885e-06, "loss": 0.3833591461181641, "num_input_tokens_seen": 368432040, "step": 11555, "train_runtime": 30215.7407, "train_tokens_per_second": 12193.381 }, { "epoch": 0.7783463506598438, "grad_norm": 0.7752373268635098, "learning_rate": 6.7064008571529275e-06, "loss": 0.37513597011566163, "num_input_tokens_seen": 368591832, "step": 11560, "train_runtime": 30229.0695, "train_tokens_per_second": 12193.291 }, { "epoch": 0.778683005655804, "grad_norm": 0.6944239729539391, "learning_rate": 6.703915282931411e-06, "loss": 0.38096203804016116, "num_input_tokens_seen": 368754872, "step": 11565, "train_runtime": 30241.9184, "train_tokens_per_second": 12193.501 }, { "epoch": 0.7790196606517641, "grad_norm": 0.8103378865790789, "learning_rate": 6.701429232215418e-06, "loss": 0.4006359100341797, "num_input_tokens_seen": 368910552, "step": 11570, "train_runtime": 30255.017, "train_tokens_per_second": 12193.368 }, { "epoch": 0.7793563156477242, "grad_norm": 0.9051610241041872, "learning_rate": 6.6989427057001665e-06, "loss": 0.3906524181365967, "num_input_tokens_seen": 369072008, "step": 11575, "train_runtime": 30267.5624, "train_tokens_per_second": 12193.648 }, { "epoch": 0.7796929706436844, "grad_norm": 0.7041134301033419, "learning_rate": 6.696455704081006e-06, "loss": 0.38783533573150636, "num_input_tokens_seen": 369231576, "step": 11580, "train_runtime": 30280.544, "train_tokens_per_second": 12193.69 }, { "epoch": 0.7800296256396445, "grad_norm": 0.8953769843443542, "learning_rate": 6.693968228053416e-06, "loss": 0.4039203643798828, "num_input_tokens_seen": 369393784, "step": 11585, "train_runtime": 30294.6595, "train_tokens_per_second": 12193.363 }, { "epoch": 0.7803662806356046, "grad_norm": 0.7610614278051683, "learning_rate": 6.691480278313013e-06, "loss": 0.3878408193588257, "num_input_tokens_seen": 369553424, "step": 11590, "train_runtime": 30308.1726, "train_tokens_per_second": 12193.194 }, { "epoch": 0.7807029356315648, "grad_norm": 0.6798490583335733, "learning_rate": 6.688991855555545e-06, "loss": 0.33335702419281005, "num_input_tokens_seen": 369713328, "step": 11595, "train_runtime": 30321.2149, "train_tokens_per_second": 12193.223 }, { "epoch": 0.7810395906275249, "grad_norm": 0.7259787068866819, "learning_rate": 6.686502960476888e-06, "loss": 0.36715357303619384, "num_input_tokens_seen": 369877168, "step": 11600, "train_runtime": 30333.65, "train_tokens_per_second": 12193.625 }, { "epoch": 0.7813762456234851, "grad_norm": 0.7316860285582696, "learning_rate": 6.684013593773058e-06, "loss": 0.325596284866333, "num_input_tokens_seen": 370040232, "step": 11605, "train_runtime": 30346.5011, "train_tokens_per_second": 12193.835 }, { "epoch": 0.7817129006194452, "grad_norm": 0.8633160914589647, "learning_rate": 6.6815237561401955e-06, "loss": 0.3432020664215088, "num_input_tokens_seen": 370191280, "step": 11610, "train_runtime": 30359.8132, "train_tokens_per_second": 12193.464 }, { "epoch": 0.7820495556154053, "grad_norm": 0.8484681444227207, "learning_rate": 6.679033448274577e-06, "loss": 0.35393800735473635, "num_input_tokens_seen": 370352752, "step": 11615, "train_runtime": 30372.8037, "train_tokens_per_second": 12193.565 }, { "epoch": 0.7823862106113655, "grad_norm": 0.8029709600545277, "learning_rate": 6.676542670872609e-06, "loss": 0.38855772018432616, "num_input_tokens_seen": 370512544, "step": 11620, "train_runtime": 30386.2008, "train_tokens_per_second": 12193.447 }, { "epoch": 0.7827228656073256, "grad_norm": 0.7740112208651453, "learning_rate": 6.674051424630829e-06, "loss": 0.3719889402389526, "num_input_tokens_seen": 370676008, "step": 11625, "train_runtime": 30399.7958, "train_tokens_per_second": 12193.372 }, { "epoch": 0.7830595206032858, "grad_norm": 0.7248123417324678, "learning_rate": 6.671559710245905e-06, "loss": 0.3854742288589478, "num_input_tokens_seen": 370835776, "step": 11630, "train_runtime": 30412.3675, "train_tokens_per_second": 12193.585 }, { "epoch": 0.7833961755992459, "grad_norm": 0.8469304588324509, "learning_rate": 6.669067528414639e-06, "loss": 0.3675633192062378, "num_input_tokens_seen": 370997432, "step": 11635, "train_runtime": 30424.8914, "train_tokens_per_second": 12193.879 }, { "epoch": 0.783732830595206, "grad_norm": 0.7940908814394724, "learning_rate": 6.6665748798339606e-06, "loss": 0.4011989593505859, "num_input_tokens_seen": 371157608, "step": 11640, "train_runtime": 30437.9075, "train_tokens_per_second": 12193.927 }, { "epoch": 0.7840694855911662, "grad_norm": 0.826378679690705, "learning_rate": 6.664081765200932e-06, "loss": 0.3851266860961914, "num_input_tokens_seen": 371312352, "step": 11645, "train_runtime": 30451.5569, "train_tokens_per_second": 12193.542 }, { "epoch": 0.7844061405871263, "grad_norm": 0.7285857964794943, "learning_rate": 6.661588185212745e-06, "loss": 0.40223045349121095, "num_input_tokens_seen": 371475112, "step": 11650, "train_runtime": 30464.576, "train_tokens_per_second": 12193.674 }, { "epoch": 0.7847427955830865, "grad_norm": 0.8379470496059848, "learning_rate": 6.65909414056672e-06, "loss": 0.3703483581542969, "num_input_tokens_seen": 371634128, "step": 11655, "train_runtime": 30477.9086, "train_tokens_per_second": 12193.557 }, { "epoch": 0.7850794505790466, "grad_norm": 0.8587991790713585, "learning_rate": 6.6565996319603075e-06, "loss": 0.35973210334777833, "num_input_tokens_seen": 371790216, "step": 11660, "train_runtime": 30490.8776, "train_tokens_per_second": 12193.49 }, { "epoch": 0.7854161055750067, "grad_norm": 0.6897779170041637, "learning_rate": 6.6541046600910915e-06, "loss": 0.3497686624526978, "num_input_tokens_seen": 371947840, "step": 11665, "train_runtime": 30503.9243, "train_tokens_per_second": 12193.442 }, { "epoch": 0.7857527605709669, "grad_norm": 0.8945831990006606, "learning_rate": 6.6516092256567824e-06, "loss": 0.37085485458374023, "num_input_tokens_seen": 372108968, "step": 11670, "train_runtime": 30516.8604, "train_tokens_per_second": 12193.553 }, { "epoch": 0.786089415566927, "grad_norm": 0.9297348262453087, "learning_rate": 6.64911332935522e-06, "loss": 0.3924281597137451, "num_input_tokens_seen": 372271984, "step": 11675, "train_runtime": 30530.4881, "train_tokens_per_second": 12193.45 }, { "epoch": 0.7864260705628872, "grad_norm": 0.847973747006015, "learning_rate": 6.646616971884373e-06, "loss": 0.36455602645874025, "num_input_tokens_seen": 372434424, "step": 11680, "train_runtime": 30543.1516, "train_tokens_per_second": 12193.713 }, { "epoch": 0.7867627255588473, "grad_norm": 0.7118435029490061, "learning_rate": 6.64412015394234e-06, "loss": 0.3776170969009399, "num_input_tokens_seen": 372584992, "step": 11685, "train_runtime": 30555.9126, "train_tokens_per_second": 12193.548 }, { "epoch": 0.7870993805548074, "grad_norm": 0.7858565999471193, "learning_rate": 6.641622876227349e-06, "loss": 0.3869914531707764, "num_input_tokens_seen": 372742968, "step": 11690, "train_runtime": 30570.1857, "train_tokens_per_second": 12193.023 }, { "epoch": 0.7874360355507676, "grad_norm": 0.9533709005709372, "learning_rate": 6.639125139437756e-06, "loss": 0.3708347320556641, "num_input_tokens_seen": 372905104, "step": 11695, "train_runtime": 30582.8377, "train_tokens_per_second": 12193.28 }, { "epoch": 0.7877726905467277, "grad_norm": 0.7900532863526302, "learning_rate": 6.6366269442720446e-06, "loss": 0.37346682548522947, "num_input_tokens_seen": 373066232, "step": 11700, "train_runtime": 30596.3182, "train_tokens_per_second": 12193.174 }, { "epoch": 0.7881093455426879, "grad_norm": 0.7949751899978424, "learning_rate": 6.634128291428827e-06, "loss": 0.43591084480285647, "num_input_tokens_seen": 373225944, "step": 11705, "train_runtime": 30609.6388, "train_tokens_per_second": 12193.086 }, { "epoch": 0.788446000538648, "grad_norm": 0.7662468521530408, "learning_rate": 6.631629181606842e-06, "loss": 0.38541278839111326, "num_input_tokens_seen": 373387920, "step": 11710, "train_runtime": 30622.2245, "train_tokens_per_second": 12193.364 }, { "epoch": 0.7887826555346081, "grad_norm": 0.8135084460960876, "learning_rate": 6.629129615504961e-06, "loss": 0.3854079723358154, "num_input_tokens_seen": 373550528, "step": 11715, "train_runtime": 30635.5997, "train_tokens_per_second": 12193.348 }, { "epoch": 0.7891193105305683, "grad_norm": 0.778210766219173, "learning_rate": 6.626629593822178e-06, "loss": 0.35331389904022215, "num_input_tokens_seen": 373710888, "step": 11720, "train_runtime": 30648.4004, "train_tokens_per_second": 12193.488 }, { "epoch": 0.7894559655265284, "grad_norm": 0.8259052580688125, "learning_rate": 6.624129117257616e-06, "loss": 0.4102816581726074, "num_input_tokens_seen": 373873104, "step": 11725, "train_runtime": 30661.5996, "train_tokens_per_second": 12193.529 }, { "epoch": 0.7897926205224886, "grad_norm": 0.8767344638501338, "learning_rate": 6.621628186510524e-06, "loss": 0.3956955909729004, "num_input_tokens_seen": 374031224, "step": 11730, "train_runtime": 30674.9705, "train_tokens_per_second": 12193.369 }, { "epoch": 0.7901292755184487, "grad_norm": 0.7554110006400164, "learning_rate": 6.619126802280281e-06, "loss": 0.353791332244873, "num_input_tokens_seen": 374192080, "step": 11735, "train_runtime": 30689.1202, "train_tokens_per_second": 12192.988 }, { "epoch": 0.7904659305144088, "grad_norm": 0.7991100911297014, "learning_rate": 6.616624965266392e-06, "loss": 0.3949237823486328, "num_input_tokens_seen": 374351896, "step": 11740, "train_runtime": 30702.5521, "train_tokens_per_second": 12192.859 }, { "epoch": 0.790802585510369, "grad_norm": 0.8078460559476426, "learning_rate": 6.614122676168486e-06, "loss": 0.4061460018157959, "num_input_tokens_seen": 374509912, "step": 11745, "train_runtime": 30715.1732, "train_tokens_per_second": 12192.994 }, { "epoch": 0.7911392405063291, "grad_norm": 0.8735380125724772, "learning_rate": 6.611619935686321e-06, "loss": 0.3557483196258545, "num_input_tokens_seen": 374666432, "step": 11750, "train_runtime": 30728.0374, "train_tokens_per_second": 12192.983 }, { "epoch": 0.7914758955022893, "grad_norm": 0.9459188275834557, "learning_rate": 6.609116744519779e-06, "loss": 0.4006349563598633, "num_input_tokens_seen": 374828240, "step": 11755, "train_runtime": 30741.0749, "train_tokens_per_second": 12193.075 }, { "epoch": 0.7918125504982494, "grad_norm": 0.8179656988264756, "learning_rate": 6.60661310336887e-06, "loss": 0.3551258325576782, "num_input_tokens_seen": 374983584, "step": 11760, "train_runtime": 30753.8753, "train_tokens_per_second": 12193.051 }, { "epoch": 0.7921492054942095, "grad_norm": 0.7871026100210354, "learning_rate": 6.604109012933732e-06, "loss": 0.3638493061065674, "num_input_tokens_seen": 375134472, "step": 11765, "train_runtime": 30767.3219, "train_tokens_per_second": 12192.627 }, { "epoch": 0.7924858604901697, "grad_norm": 0.7459684768926129, "learning_rate": 6.601604473914622e-06, "loss": 0.39454286098480223, "num_input_tokens_seen": 375293496, "step": 11770, "train_runtime": 30780.5351, "train_tokens_per_second": 12192.559 }, { "epoch": 0.7928225154861298, "grad_norm": 0.8004297652193146, "learning_rate": 6.599099487011928e-06, "loss": 0.365021276473999, "num_input_tokens_seen": 375457336, "step": 11775, "train_runtime": 30792.9726, "train_tokens_per_second": 12192.955 }, { "epoch": 0.79315917048209, "grad_norm": 0.7579668293097163, "learning_rate": 6.596594052926163e-06, "loss": 0.3989898204803467, "num_input_tokens_seen": 375619592, "step": 11780, "train_runtime": 30805.577, "train_tokens_per_second": 12193.233 }, { "epoch": 0.7934958254780501, "grad_norm": 0.6807714942097018, "learning_rate": 6.5940881723579595e-06, "loss": 0.3649766445159912, "num_input_tokens_seen": 375782232, "step": 11785, "train_runtime": 30818.9442, "train_tokens_per_second": 12193.222 }, { "epoch": 0.7938324804740102, "grad_norm": 0.7349600359284761, "learning_rate": 6.591581846008085e-06, "loss": 0.34767608642578124, "num_input_tokens_seen": 375942792, "step": 11790, "train_runtime": 30832.0265, "train_tokens_per_second": 12193.256 }, { "epoch": 0.7941691354699704, "grad_norm": 0.7825436727327969, "learning_rate": 6.589075074577421e-06, "loss": 0.37279183864593507, "num_input_tokens_seen": 376100072, "step": 11795, "train_runtime": 30844.8809, "train_tokens_per_second": 12193.274 }, { "epoch": 0.7945057904659305, "grad_norm": 0.7945380666861541, "learning_rate": 6.5865678587669805e-06, "loss": 0.36253886222839354, "num_input_tokens_seen": 376262408, "step": 11800, "train_runtime": 30858.1836, "train_tokens_per_second": 12193.278 }, { "epoch": 0.7948424454618906, "grad_norm": 0.7691648658973432, "learning_rate": 6.584060199277897e-06, "loss": 0.3986492156982422, "num_input_tokens_seen": 376422000, "step": 11805, "train_runtime": 30871.6977, "train_tokens_per_second": 12193.11 }, { "epoch": 0.7951791004578508, "grad_norm": 0.7803770300153521, "learning_rate": 6.581552096811428e-06, "loss": 0.38816232681274415, "num_input_tokens_seen": 376580200, "step": 11810, "train_runtime": 30884.2023, "train_tokens_per_second": 12193.295 }, { "epoch": 0.7955157554538109, "grad_norm": 0.789715745960649, "learning_rate": 6.57904355206896e-06, "loss": 0.3801249980926514, "num_input_tokens_seen": 376739504, "step": 11815, "train_runtime": 30896.773, "train_tokens_per_second": 12193.49 }, { "epoch": 0.7958524104497711, "grad_norm": 0.7711691651459045, "learning_rate": 6.576534565751997e-06, "loss": 0.3491034507751465, "num_input_tokens_seen": 376898512, "step": 11820, "train_runtime": 30909.4288, "train_tokens_per_second": 12193.642 }, { "epoch": 0.7961890654457312, "grad_norm": 0.7175811661801019, "learning_rate": 6.574025138562172e-06, "loss": 0.3864483594894409, "num_input_tokens_seen": 377053992, "step": 11825, "train_runtime": 30922.5383, "train_tokens_per_second": 12193.501 }, { "epoch": 0.7965257204416913, "grad_norm": 0.6935684369467853, "learning_rate": 6.571515271201234e-06, "loss": 0.34622974395751954, "num_input_tokens_seen": 377216984, "step": 11830, "train_runtime": 30936.1385, "train_tokens_per_second": 12193.409 }, { "epoch": 0.7968623754376515, "grad_norm": 0.7168792601580581, "learning_rate": 6.569004964371062e-06, "loss": 0.3999671697616577, "num_input_tokens_seen": 377376648, "step": 11835, "train_runtime": 30949.1353, "train_tokens_per_second": 12193.447 }, { "epoch": 0.7971990304336116, "grad_norm": 0.7563764887229703, "learning_rate": 6.566494218773656e-06, "loss": 0.38115367889404295, "num_input_tokens_seen": 377538656, "step": 11840, "train_runtime": 30961.7253, "train_tokens_per_second": 12193.722 }, { "epoch": 0.7975356854295718, "grad_norm": 0.8898827525439222, "learning_rate": 6.563983035111136e-06, "loss": 0.40212154388427734, "num_input_tokens_seen": 377700584, "step": 11845, "train_runtime": 30974.2959, "train_tokens_per_second": 12194.001 }, { "epoch": 0.7978723404255319, "grad_norm": 0.7148248979899465, "learning_rate": 6.561471414085748e-06, "loss": 0.38744680881500243, "num_input_tokens_seen": 377860712, "step": 11850, "train_runtime": 30986.9252, "train_tokens_per_second": 12194.198 }, { "epoch": 0.798208995421492, "grad_norm": 0.8069153370067991, "learning_rate": 6.558959356399859e-06, "loss": 0.3977175235748291, "num_input_tokens_seen": 378021280, "step": 11855, "train_runtime": 31000.7958, "train_tokens_per_second": 12193.922 }, { "epoch": 0.7985456504174522, "grad_norm": 0.6951368044158354, "learning_rate": 6.5564468627559544e-06, "loss": 0.3698373079299927, "num_input_tokens_seen": 378179704, "step": 11860, "train_runtime": 31013.9985, "train_tokens_per_second": 12193.839 }, { "epoch": 0.7988823054134123, "grad_norm": 0.750739046403931, "learning_rate": 6.5539339338566495e-06, "loss": 0.40657758712768555, "num_input_tokens_seen": 378341368, "step": 11865, "train_runtime": 31027.3064, "train_tokens_per_second": 12193.819 }, { "epoch": 0.7992189604093725, "grad_norm": 0.8399156667471254, "learning_rate": 6.5514205704046754e-06, "loss": 0.36922540664672854, "num_input_tokens_seen": 378495416, "step": 11870, "train_runtime": 31040.4479, "train_tokens_per_second": 12193.62 }, { "epoch": 0.7995556154053326, "grad_norm": 0.715294480193292, "learning_rate": 6.548906773102886e-06, "loss": 0.3407998561859131, "num_input_tokens_seen": 378652224, "step": 11875, "train_runtime": 31053.6044, "train_tokens_per_second": 12193.503 }, { "epoch": 0.7998922704012927, "grad_norm": 0.8117550767915204, "learning_rate": 6.546392542654257e-06, "loss": 0.37957718372344973, "num_input_tokens_seen": 378809304, "step": 11880, "train_runtime": 31066.8675, "train_tokens_per_second": 12193.354 }, { "epoch": 0.8002289253972529, "grad_norm": 0.7912191799640419, "learning_rate": 6.543877879761882e-06, "loss": 0.40323448181152344, "num_input_tokens_seen": 378966952, "step": 11885, "train_runtime": 31079.909, "train_tokens_per_second": 12193.31 }, { "epoch": 0.800565580393213, "grad_norm": 0.7607875949533927, "learning_rate": 6.5413627851289825e-06, "loss": 0.36257200241088866, "num_input_tokens_seen": 379128888, "step": 11890, "train_runtime": 31092.7952, "train_tokens_per_second": 12193.464 }, { "epoch": 0.8009022353891732, "grad_norm": 0.7794719917058088, "learning_rate": 6.538847259458896e-06, "loss": 0.3527742862701416, "num_input_tokens_seen": 379288840, "step": 11895, "train_runtime": 31105.2593, "train_tokens_per_second": 12193.721 }, { "epoch": 0.8012388903851333, "grad_norm": 0.7891004112272468, "learning_rate": 6.5363313034550805e-06, "loss": 0.3575753688812256, "num_input_tokens_seen": 379447224, "step": 11900, "train_runtime": 31118.8155, "train_tokens_per_second": 12193.498 }, { "epoch": 0.8015755453810934, "grad_norm": 0.8103725616145434, "learning_rate": 6.533814917821114e-06, "loss": 0.38735027313232423, "num_input_tokens_seen": 379609368, "step": 11905, "train_runtime": 31132.7615, "train_tokens_per_second": 12193.244 }, { "epoch": 0.8019122003770536, "grad_norm": 0.6448241207076659, "learning_rate": 6.531298103260696e-06, "loss": 0.36227076053619384, "num_input_tokens_seen": 379768720, "step": 11910, "train_runtime": 31146.5083, "train_tokens_per_second": 12192.979 }, { "epoch": 0.8022488553730137, "grad_norm": 0.7736871420388424, "learning_rate": 6.528780860477648e-06, "loss": 0.3709725379943848, "num_input_tokens_seen": 379929752, "step": 11915, "train_runtime": 31159.2273, "train_tokens_per_second": 12193.17 }, { "epoch": 0.8025855103689739, "grad_norm": 1.1546400069916714, "learning_rate": 6.526263190175907e-06, "loss": 0.35191028118133544, "num_input_tokens_seen": 380092624, "step": 11920, "train_runtime": 31172.2607, "train_tokens_per_second": 12193.297 }, { "epoch": 0.802922165364934, "grad_norm": 0.7104968387271792, "learning_rate": 6.523745093059531e-06, "loss": 0.3585056304931641, "num_input_tokens_seen": 380252752, "step": 11925, "train_runtime": 31186.2333, "train_tokens_per_second": 12192.968 }, { "epoch": 0.8032588203608941, "grad_norm": 0.8769292534207647, "learning_rate": 6.521226569832699e-06, "loss": 0.3812487840652466, "num_input_tokens_seen": 380414000, "step": 11930, "train_runtime": 31199.4611, "train_tokens_per_second": 12192.967 }, { "epoch": 0.8035954753568543, "grad_norm": 0.7501362778697537, "learning_rate": 6.518707621199707e-06, "loss": 0.3717649459838867, "num_input_tokens_seen": 380575328, "step": 11935, "train_runtime": 31212.4775, "train_tokens_per_second": 12193.051 }, { "epoch": 0.8039321303528144, "grad_norm": 0.872381604019058, "learning_rate": 6.516188247864972e-06, "loss": 0.38443984985351565, "num_input_tokens_seen": 380735112, "step": 11940, "train_runtime": 31225.0093, "train_tokens_per_second": 12193.275 }, { "epoch": 0.8042687853487746, "grad_norm": 0.8545876913829898, "learning_rate": 6.513668450533028e-06, "loss": 0.3629001617431641, "num_input_tokens_seen": 380894424, "step": 11945, "train_runtime": 31238.0883, "train_tokens_per_second": 12193.269 }, { "epoch": 0.8046054403447347, "grad_norm": 0.827176773722661, "learning_rate": 6.511148229908531e-06, "loss": 0.38925743103027344, "num_input_tokens_seen": 381056832, "step": 11950, "train_runtime": 31250.9692, "train_tokens_per_second": 12193.44 }, { "epoch": 0.8049420953406948, "grad_norm": 0.9609530843404303, "learning_rate": 6.508627586696248e-06, "loss": 0.3513191699981689, "num_input_tokens_seen": 381213320, "step": 11955, "train_runtime": 31263.6651, "train_tokens_per_second": 12193.494 }, { "epoch": 0.805278750336655, "grad_norm": 0.783032204711069, "learning_rate": 6.5061065216010695e-06, "loss": 0.3700404167175293, "num_input_tokens_seen": 381373160, "step": 11960, "train_runtime": 31276.3491, "train_tokens_per_second": 12193.66 }, { "epoch": 0.8056154053326151, "grad_norm": 0.777233594202281, "learning_rate": 6.5035850353280075e-06, "loss": 0.34110169410705565, "num_input_tokens_seen": 381530528, "step": 11965, "train_runtime": 31289.4785, "train_tokens_per_second": 12193.573 }, { "epoch": 0.8059520603285752, "grad_norm": 0.7547207543315777, "learning_rate": 6.501063128582183e-06, "loss": 0.379962158203125, "num_input_tokens_seen": 381688176, "step": 11970, "train_runtime": 31303.276, "train_tokens_per_second": 12193.234 }, { "epoch": 0.8062887153245354, "grad_norm": 0.9615151114054373, "learning_rate": 6.498540802068843e-06, "loss": 0.3809072971343994, "num_input_tokens_seen": 381847024, "step": 11975, "train_runtime": 31316.5577, "train_tokens_per_second": 12193.135 }, { "epoch": 0.8066253703204955, "grad_norm": 0.7860950420896803, "learning_rate": 6.4960180564933454e-06, "loss": 0.36175639629364015, "num_input_tokens_seen": 382009984, "step": 11980, "train_runtime": 31329.3754, "train_tokens_per_second": 12193.348 }, { "epoch": 0.8069620253164557, "grad_norm": 0.8008864490800088, "learning_rate": 6.493494892561167e-06, "loss": 0.3794721126556396, "num_input_tokens_seen": 382166688, "step": 11985, "train_runtime": 31342.2375, "train_tokens_per_second": 12193.344 }, { "epoch": 0.8072986803124158, "grad_norm": 0.8324350584857002, "learning_rate": 6.490971310977907e-06, "loss": 0.39203081130981443, "num_input_tokens_seen": 382327616, "step": 11990, "train_runtime": 31354.6834, "train_tokens_per_second": 12193.637 }, { "epoch": 0.807635335308376, "grad_norm": 0.7621675364319107, "learning_rate": 6.488447312449273e-06, "loss": 0.3973099946975708, "num_input_tokens_seen": 382487256, "step": 11995, "train_runtime": 31367.9741, "train_tokens_per_second": 12193.559 }, { "epoch": 0.8079719903043361, "grad_norm": 0.9002205018927582, "learning_rate": 6.485922897681095e-06, "loss": 0.3939211845397949, "num_input_tokens_seen": 382648576, "step": 12000, "train_runtime": 31380.8063, "train_tokens_per_second": 12193.714 }, { "epoch": 0.8083086453002962, "grad_norm": 0.7995594834427153, "learning_rate": 6.483398067379316e-06, "loss": 0.417647123336792, "num_input_tokens_seen": 382810008, "step": 12005, "train_runtime": 31393.2985, "train_tokens_per_second": 12194.004 }, { "epoch": 0.8086453002962564, "grad_norm": 0.7264461541616981, "learning_rate": 6.480872822249998e-06, "loss": 0.3664550304412842, "num_input_tokens_seen": 382972040, "step": 12010, "train_runtime": 31407.1732, "train_tokens_per_second": 12193.776 }, { "epoch": 0.8089819552922165, "grad_norm": 0.7903704742653824, "learning_rate": 6.478347162999318e-06, "loss": 0.39343421459197997, "num_input_tokens_seen": 383131016, "step": 12015, "train_runtime": 31420.1052, "train_tokens_per_second": 12193.817 }, { "epoch": 0.8093186102881766, "grad_norm": 0.7110519624982528, "learning_rate": 6.475821090333568e-06, "loss": 0.3729506492614746, "num_input_tokens_seen": 383291920, "step": 12020, "train_runtime": 31432.9842, "train_tokens_per_second": 12193.94 }, { "epoch": 0.8096552652841368, "grad_norm": 0.7870705845706162, "learning_rate": 6.473294604959156e-06, "loss": 0.391314959526062, "num_input_tokens_seen": 383447920, "step": 12025, "train_runtime": 31446.292, "train_tokens_per_second": 12193.74 }, { "epoch": 0.8099919202800969, "grad_norm": 0.8003202166281154, "learning_rate": 6.470767707582605e-06, "loss": 0.34874165058135986, "num_input_tokens_seen": 383610568, "step": 12030, "train_runtime": 31459.6632, "train_tokens_per_second": 12193.728 }, { "epoch": 0.8103285752760571, "grad_norm": 1.062551099781154, "learning_rate": 6.468240398910555e-06, "loss": 0.3764477252960205, "num_input_tokens_seen": 383764544, "step": 12035, "train_runtime": 31473.6491, "train_tokens_per_second": 12193.201 }, { "epoch": 0.8106652302720172, "grad_norm": 0.762018094492472, "learning_rate": 6.4657126796497595e-06, "loss": 0.36851727962493896, "num_input_tokens_seen": 383928384, "step": 12040, "train_runtime": 31486.0724, "train_tokens_per_second": 12193.594 }, { "epoch": 0.8110018852679773, "grad_norm": 0.851367240405606, "learning_rate": 6.463184550507087e-06, "loss": 0.3719032764434814, "num_input_tokens_seen": 384090160, "step": 12045, "train_runtime": 31500.2109, "train_tokens_per_second": 12193.257 }, { "epoch": 0.8113385402639375, "grad_norm": 0.7869914824478589, "learning_rate": 6.46065601218952e-06, "loss": 0.3447405338287354, "num_input_tokens_seen": 384251224, "step": 12050, "train_runtime": 31513.6496, "train_tokens_per_second": 12193.168 }, { "epoch": 0.8116751952598976, "grad_norm": 0.7358766036384202, "learning_rate": 6.458127065404156e-06, "loss": 0.3866471290588379, "num_input_tokens_seen": 384414408, "step": 12055, "train_runtime": 31526.5033, "train_tokens_per_second": 12193.373 }, { "epoch": 0.8120118502558578, "grad_norm": 0.981258791483655, "learning_rate": 6.45559771085821e-06, "loss": 0.3673221588134766, "num_input_tokens_seen": 384575848, "step": 12060, "train_runtime": 31539.5126, "train_tokens_per_second": 12193.462 }, { "epoch": 0.8123485052518179, "grad_norm": 0.7743307413906022, "learning_rate": 6.453067949259005e-06, "loss": 0.3619658946990967, "num_input_tokens_seen": 384738280, "step": 12065, "train_runtime": 31552.5195, "train_tokens_per_second": 12193.583 }, { "epoch": 0.812685160247778, "grad_norm": 0.7399302549467262, "learning_rate": 6.450537781313982e-06, "loss": 0.3535545110702515, "num_input_tokens_seen": 384896840, "step": 12070, "train_runtime": 31565.4824, "train_tokens_per_second": 12193.599 }, { "epoch": 0.8130218152437382, "grad_norm": 0.728045628593235, "learning_rate": 6.448007207730693e-06, "loss": 0.3631807088851929, "num_input_tokens_seen": 385055432, "step": 12075, "train_runtime": 31578.3246, "train_tokens_per_second": 12193.662 }, { "epoch": 0.8133584702396983, "grad_norm": 0.8472448042332094, "learning_rate": 6.445476229216805e-06, "loss": 0.3557400703430176, "num_input_tokens_seen": 385218320, "step": 12080, "train_runtime": 31591.0798, "train_tokens_per_second": 12193.895 }, { "epoch": 0.8136951252356585, "grad_norm": 1.0485866986367949, "learning_rate": 6.442944846480099e-06, "loss": 0.40411863327026365, "num_input_tokens_seen": 385377384, "step": 12085, "train_runtime": 31605.191, "train_tokens_per_second": 12193.484 }, { "epoch": 0.8140317802316186, "grad_norm": 0.8510072556015127, "learning_rate": 6.44041306022847e-06, "loss": 0.38596439361572266, "num_input_tokens_seen": 385537192, "step": 12090, "train_runtime": 31617.608, "train_tokens_per_second": 12193.75 }, { "epoch": 0.8143684352275787, "grad_norm": 0.8422873278675023, "learning_rate": 6.43788087116992e-06, "loss": 0.3989336252212524, "num_input_tokens_seen": 385699808, "step": 12095, "train_runtime": 31630.055, "train_tokens_per_second": 12194.092 }, { "epoch": 0.8147050902235389, "grad_norm": 0.85877522938351, "learning_rate": 6.43534828001257e-06, "loss": 0.3854092597961426, "num_input_tokens_seen": 385858016, "step": 12100, "train_runtime": 31642.5939, "train_tokens_per_second": 12194.26 }, { "epoch": 0.815041745219499, "grad_norm": 0.857029302516094, "learning_rate": 6.43281528746465e-06, "loss": 0.37953619956970214, "num_input_tokens_seen": 386011872, "step": 12105, "train_runtime": 31655.8764, "train_tokens_per_second": 12194.004 }, { "epoch": 0.8153784002154592, "grad_norm": 0.6433767713001484, "learning_rate": 6.430281894234504e-06, "loss": 0.37154712677001955, "num_input_tokens_seen": 386171288, "step": 12110, "train_runtime": 31668.6913, "train_tokens_per_second": 12194.103 }, { "epoch": 0.8157150552114193, "grad_norm": 0.7461633622032543, "learning_rate": 6.427748101030587e-06, "loss": 0.38327181339263916, "num_input_tokens_seen": 386326664, "step": 12115, "train_runtime": 31681.278, "train_tokens_per_second": 12194.163 }, { "epoch": 0.8160517102073794, "grad_norm": 0.7772147899433034, "learning_rate": 6.425213908561468e-06, "loss": 0.37313592433929443, "num_input_tokens_seen": 386488264, "step": 12120, "train_runtime": 31693.9949, "train_tokens_per_second": 12194.369 }, { "epoch": 0.8163883652033396, "grad_norm": 0.7206897367997068, "learning_rate": 6.422679317535823e-06, "loss": 0.3711486577987671, "num_input_tokens_seen": 386647320, "step": 12125, "train_runtime": 31708.009, "train_tokens_per_second": 12193.996 }, { "epoch": 0.8167250201992997, "grad_norm": 0.8057360201793661, "learning_rate": 6.420144328662441e-06, "loss": 0.43384904861450196, "num_input_tokens_seen": 386809216, "step": 12130, "train_runtime": 31721.0471, "train_tokens_per_second": 12194.087 }, { "epoch": 0.8170616751952599, "grad_norm": 0.7717114124652743, "learning_rate": 6.417608942650229e-06, "loss": 0.38415067195892333, "num_input_tokens_seen": 386963784, "step": 12135, "train_runtime": 31733.5763, "train_tokens_per_second": 12194.144 }, { "epoch": 0.81739833019122, "grad_norm": 0.7522938088955058, "learning_rate": 6.415073160208196e-06, "loss": 0.37050905227661135, "num_input_tokens_seen": 387125464, "step": 12140, "train_runtime": 31746.7675, "train_tokens_per_second": 12194.17 }, { "epoch": 0.8177349851871801, "grad_norm": 0.7993705575590916, "learning_rate": 6.412536982045465e-06, "loss": 0.3859358310699463, "num_input_tokens_seen": 387278152, "step": 12145, "train_runtime": 31760.7122, "train_tokens_per_second": 12193.623 }, { "epoch": 0.8180716401831403, "grad_norm": 0.894561034480977, "learning_rate": 6.410000408871273e-06, "loss": 0.38177971839904784, "num_input_tokens_seen": 387436304, "step": 12150, "train_runtime": 31774.1816, "train_tokens_per_second": 12193.431 }, { "epoch": 0.8184082951791004, "grad_norm": 0.9046929829045078, "learning_rate": 6.407463441394961e-06, "loss": 0.3825327157974243, "num_input_tokens_seen": 387599384, "step": 12155, "train_runtime": 31787.0279, "train_tokens_per_second": 12193.634 }, { "epoch": 0.8187449501750605, "grad_norm": 0.8758116040527244, "learning_rate": 6.4049260803259874e-06, "loss": 0.39542713165283205, "num_input_tokens_seen": 387761568, "step": 12160, "train_runtime": 31799.6084, "train_tokens_per_second": 12193.91 }, { "epoch": 0.8190816051710207, "grad_norm": 0.8766352701967576, "learning_rate": 6.402388326373914e-06, "loss": 0.350589919090271, "num_input_tokens_seen": 387920744, "step": 12165, "train_runtime": 31812.7441, "train_tokens_per_second": 12193.879 }, { "epoch": 0.8194182601669808, "grad_norm": 0.7660274946843856, "learning_rate": 6.399850180248418e-06, "loss": 0.4039796829223633, "num_input_tokens_seen": 388084584, "step": 12170, "train_runtime": 31825.1633, "train_tokens_per_second": 12194.268 }, { "epoch": 0.819754915162941, "grad_norm": 0.8158015564138612, "learning_rate": 6.397311642659283e-06, "loss": 0.39557342529296874, "num_input_tokens_seen": 388242832, "step": 12175, "train_runtime": 31838.0977, "train_tokens_per_second": 12194.285 }, { "epoch": 0.8200915701589011, "grad_norm": 0.8021180553137337, "learning_rate": 6.394772714316402e-06, "loss": 0.37081055641174315, "num_input_tokens_seen": 388404784, "step": 12180, "train_runtime": 31851.239, "train_tokens_per_second": 12194.338 }, { "epoch": 0.8204282251548612, "grad_norm": 0.7901376160060586, "learning_rate": 6.392233395929779e-06, "loss": 0.3661466598510742, "num_input_tokens_seen": 388560464, "step": 12185, "train_runtime": 31864.4365, "train_tokens_per_second": 12194.173 }, { "epoch": 0.8207648801508214, "grad_norm": 0.7891281122473084, "learning_rate": 6.389693688209526e-06, "loss": 0.35634541511535645, "num_input_tokens_seen": 388720120, "step": 12190, "train_runtime": 31877.8118, "train_tokens_per_second": 12194.065 }, { "epoch": 0.8211015351467815, "grad_norm": 0.8809576462144182, "learning_rate": 6.387153591865867e-06, "loss": 0.3973454236984253, "num_input_tokens_seen": 388882304, "step": 12195, "train_runtime": 31890.3993, "train_tokens_per_second": 12194.338 }, { "epoch": 0.8214381901427417, "grad_norm": 0.7341726379590188, "learning_rate": 6.384613107609127e-06, "loss": 0.3915351152420044, "num_input_tokens_seen": 389041048, "step": 12200, "train_runtime": 31903.9012, "train_tokens_per_second": 12194.153 }, { "epoch": 0.8217748451387018, "grad_norm": 0.7874314855638644, "learning_rate": 6.382072236149747e-06, "loss": 0.366193962097168, "num_input_tokens_seen": 389202064, "step": 12205, "train_runtime": 31916.8361, "train_tokens_per_second": 12194.256 }, { "epoch": 0.8221115001346619, "grad_norm": 0.6933149435196174, "learning_rate": 6.379530978198273e-06, "loss": 0.332134485244751, "num_input_tokens_seen": 389362872, "step": 12210, "train_runtime": 31930.3204, "train_tokens_per_second": 12194.142 }, { "epoch": 0.8224481551306222, "grad_norm": 0.6940979609333797, "learning_rate": 6.376989334465361e-06, "loss": 0.35556254386901853, "num_input_tokens_seen": 389525024, "step": 12215, "train_runtime": 31943.5439, "train_tokens_per_second": 12194.171 }, { "epoch": 0.8227848101265823, "grad_norm": 0.7227755774407384, "learning_rate": 6.374447305661772e-06, "loss": 0.3727825164794922, "num_input_tokens_seen": 389688864, "step": 12220, "train_runtime": 31955.9606, "train_tokens_per_second": 12194.56 }, { "epoch": 0.8231214651225425, "grad_norm": 0.6988930605292222, "learning_rate": 6.3719048924983776e-06, "loss": 0.3540207386016846, "num_input_tokens_seen": 389845792, "step": 12225, "train_runtime": 31969.0842, "train_tokens_per_second": 12194.462 }, { "epoch": 0.8234581201185026, "grad_norm": 0.8310840987190118, "learning_rate": 6.369362095686152e-06, "loss": 0.36890084743499757, "num_input_tokens_seen": 390001440, "step": 12230, "train_runtime": 31982.3101, "train_tokens_per_second": 12194.286 }, { "epoch": 0.8237947751144628, "grad_norm": 0.8124630924945688, "learning_rate": 6.366818915936185e-06, "loss": 0.35982298851013184, "num_input_tokens_seen": 390159296, "step": 12235, "train_runtime": 31995.118, "train_tokens_per_second": 12194.338 }, { "epoch": 0.8241314301104229, "grad_norm": 0.8372260135657977, "learning_rate": 6.364275353959667e-06, "loss": 0.37121498584747314, "num_input_tokens_seen": 390319312, "step": 12240, "train_runtime": 32008.7376, "train_tokens_per_second": 12194.149 }, { "epoch": 0.824468085106383, "grad_norm": 0.8313294107945519, "learning_rate": 6.3617314104678966e-06, "loss": 0.35704631805419923, "num_input_tokens_seen": 390482904, "step": 12245, "train_runtime": 32021.15, "train_tokens_per_second": 12194.531 }, { "epoch": 0.8248047401023432, "grad_norm": 0.7843128998750705, "learning_rate": 6.359187086172278e-06, "loss": 0.39774384498596194, "num_input_tokens_seen": 390637808, "step": 12250, "train_runtime": 32034.861, "train_tokens_per_second": 12194.147 }, { "epoch": 0.8251413950983033, "grad_norm": 0.7876615477955945, "learning_rate": 6.356642381784326e-06, "loss": 0.3775974750518799, "num_input_tokens_seen": 390795024, "step": 12255, "train_runtime": 32048.4447, "train_tokens_per_second": 12193.884 }, { "epoch": 0.8254780500942634, "grad_norm": 0.9216690376822768, "learning_rate": 6.354097298015658e-06, "loss": 0.362050199508667, "num_input_tokens_seen": 390944648, "step": 12260, "train_runtime": 32061.1133, "train_tokens_per_second": 12193.733 }, { "epoch": 0.8258147050902236, "grad_norm": 0.7988495958835761, "learning_rate": 6.3515518355779985e-06, "loss": 0.3888446807861328, "num_input_tokens_seen": 391099056, "step": 12265, "train_runtime": 32074.6449, "train_tokens_per_second": 12193.403 }, { "epoch": 0.8261513600861837, "grad_norm": 0.7138841083910371, "learning_rate": 6.349005995183177e-06, "loss": 0.3540192127227783, "num_input_tokens_seen": 391260800, "step": 12270, "train_runtime": 32087.7866, "train_tokens_per_second": 12193.449 }, { "epoch": 0.8264880150821439, "grad_norm": 0.6480792425134566, "learning_rate": 6.346459777543131e-06, "loss": 0.3683655023574829, "num_input_tokens_seen": 391419832, "step": 12275, "train_runtime": 32101.2186, "train_tokens_per_second": 12193.301 }, { "epoch": 0.826824670078104, "grad_norm": 0.8044098314399165, "learning_rate": 6.343913183369902e-06, "loss": 0.36744327545166017, "num_input_tokens_seen": 391577560, "step": 12280, "train_runtime": 32114.3778, "train_tokens_per_second": 12193.216 }, { "epoch": 0.8271613250740641, "grad_norm": 0.779058959186197, "learning_rate": 6.341366213375637e-06, "loss": 0.3613635778427124, "num_input_tokens_seen": 391739864, "step": 12285, "train_runtime": 32126.9024, "train_tokens_per_second": 12193.515 }, { "epoch": 0.8274979800700243, "grad_norm": 0.6948633336185721, "learning_rate": 6.338818868272587e-06, "loss": 0.371414852142334, "num_input_tokens_seen": 391899528, "step": 12290, "train_runtime": 32140.458, "train_tokens_per_second": 12193.34 }, { "epoch": 0.8278346350659844, "grad_norm": 0.7438132262080402, "learning_rate": 6.336271148773111e-06, "loss": 0.38228573799133303, "num_input_tokens_seen": 392060072, "step": 12295, "train_runtime": 32152.891, "train_tokens_per_second": 12193.618 }, { "epoch": 0.8281712900619446, "grad_norm": 0.7453550718352379, "learning_rate": 6.333723055589669e-06, "loss": 0.4205354690551758, "num_input_tokens_seen": 392221320, "step": 12300, "train_runtime": 32165.6354, "train_tokens_per_second": 12193.8 }, { "epoch": 0.8285079450579047, "grad_norm": 0.7820962932589253, "learning_rate": 6.331174589434826e-06, "loss": 0.3833889961242676, "num_input_tokens_seen": 392380968, "step": 12305, "train_runtime": 32178.9551, "train_tokens_per_second": 12193.714 }, { "epoch": 0.8288446000538648, "grad_norm": 0.8149128419904814, "learning_rate": 6.328625751021254e-06, "loss": 0.34661312103271485, "num_input_tokens_seen": 392535416, "step": 12310, "train_runtime": 32192.133, "train_tokens_per_second": 12193.52 }, { "epoch": 0.829181255049825, "grad_norm": 0.7736543261604117, "learning_rate": 6.326076541061729e-06, "loss": 0.3403275489807129, "num_input_tokens_seen": 392695256, "step": 12315, "train_runtime": 32205.282, "train_tokens_per_second": 12193.505 }, { "epoch": 0.8295179100457851, "grad_norm": 0.7660002945299594, "learning_rate": 6.323526960269127e-06, "loss": 0.40069074630737306, "num_input_tokens_seen": 392850600, "step": 12320, "train_runtime": 32218.3002, "train_tokens_per_second": 12193.399 }, { "epoch": 0.8298545650417453, "grad_norm": 0.7413057333512925, "learning_rate": 6.3209770093564315e-06, "loss": 0.3497325897216797, "num_input_tokens_seen": 393012200, "step": 12325, "train_runtime": 32231.3359, "train_tokens_per_second": 12193.482 }, { "epoch": 0.8301912200377054, "grad_norm": 0.866586278590947, "learning_rate": 6.318426689036727e-06, "loss": 0.37470273971557616, "num_input_tokens_seen": 393172032, "step": 12330, "train_runtime": 32244.4995, "train_tokens_per_second": 12193.461 }, { "epoch": 0.8305278750336655, "grad_norm": 0.8055220009336936, "learning_rate": 6.315876000023202e-06, "loss": 0.3900545597076416, "num_input_tokens_seen": 393328824, "step": 12335, "train_runtime": 32257.6693, "train_tokens_per_second": 12193.343 }, { "epoch": 0.8308645300296257, "grad_norm": 0.8293665669039914, "learning_rate": 6.313324943029151e-06, "loss": 0.39550180435180665, "num_input_tokens_seen": 393489888, "step": 12340, "train_runtime": 32270.5043, "train_tokens_per_second": 12193.484 }, { "epoch": 0.8312011850255858, "grad_norm": 0.7568454728583817, "learning_rate": 6.310773518767967e-06, "loss": 0.3788604736328125, "num_input_tokens_seen": 393647456, "step": 12345, "train_runtime": 32283.9325, "train_tokens_per_second": 12193.293 }, { "epoch": 0.831537840021546, "grad_norm": 0.7713231753128954, "learning_rate": 6.30822172795315e-06, "loss": 0.385570764541626, "num_input_tokens_seen": 393799648, "step": 12350, "train_runtime": 32296.8967, "train_tokens_per_second": 12193.111 }, { "epoch": 0.8318744950175061, "grad_norm": 0.9146456078996831, "learning_rate": 6.3056695712982965e-06, "loss": 0.42081537246704104, "num_input_tokens_seen": 393956744, "step": 12355, "train_runtime": 32310.0641, "train_tokens_per_second": 12193.004 }, { "epoch": 0.8322111500134662, "grad_norm": 0.7474238076935905, "learning_rate": 6.303117049517111e-06, "loss": 0.3621697425842285, "num_input_tokens_seen": 394116760, "step": 12360, "train_runtime": 32323.663, "train_tokens_per_second": 12192.825 }, { "epoch": 0.8325478050094264, "grad_norm": 0.795037804719156, "learning_rate": 6.300564163323398e-06, "loss": 0.35672545433044434, "num_input_tokens_seen": 394275192, "step": 12365, "train_runtime": 32336.9922, "train_tokens_per_second": 12192.698 }, { "epoch": 0.8328844600053865, "grad_norm": 0.8854781920548779, "learning_rate": 6.298010913431065e-06, "loss": 0.38801937103271483, "num_input_tokens_seen": 394436384, "step": 12370, "train_runtime": 32350.6413, "train_tokens_per_second": 12192.537 }, { "epoch": 0.8332211150013467, "grad_norm": 0.7980405079907703, "learning_rate": 6.295457300554119e-06, "loss": 0.35552163124084474, "num_input_tokens_seen": 394595952, "step": 12375, "train_runtime": 32363.214, "train_tokens_per_second": 12192.731 }, { "epoch": 0.8335577699973068, "grad_norm": 0.8074996115185465, "learning_rate": 6.292903325406668e-06, "loss": 0.39913334846496584, "num_input_tokens_seen": 394753408, "step": 12380, "train_runtime": 32376.9682, "train_tokens_per_second": 12192.414 }, { "epoch": 0.8338944249932669, "grad_norm": 0.7837634454065847, "learning_rate": 6.2903489887029255e-06, "loss": 0.35669057369232177, "num_input_tokens_seen": 394915088, "step": 12385, "train_runtime": 32390.7895, "train_tokens_per_second": 12192.203 }, { "epoch": 0.8342310799892271, "grad_norm": 0.7084060362320729, "learning_rate": 6.287794291157204e-06, "loss": 0.3691649198532104, "num_input_tokens_seen": 395072224, "step": 12390, "train_runtime": 32403.4217, "train_tokens_per_second": 12192.3 }, { "epoch": 0.8345677349851872, "grad_norm": 0.7529181885364955, "learning_rate": 6.285239233483915e-06, "loss": 0.3749589204788208, "num_input_tokens_seen": 395234944, "step": 12395, "train_runtime": 32416.1394, "train_tokens_per_second": 12192.536 }, { "epoch": 0.8349043899811474, "grad_norm": 0.769698710449742, "learning_rate": 6.2826838163975724e-06, "loss": 0.386875581741333, "num_input_tokens_seen": 395391440, "step": 12400, "train_runtime": 32429.5844, "train_tokens_per_second": 12192.307 }, { "epoch": 0.8352410449771075, "grad_norm": 0.7488662560308984, "learning_rate": 6.2801280406127905e-06, "loss": 0.37825257778167726, "num_input_tokens_seen": 395553904, "step": 12405, "train_runtime": 32442.8698, "train_tokens_per_second": 12192.322 }, { "epoch": 0.8355776999730676, "grad_norm": 0.7774460685339145, "learning_rate": 6.2775719068442845e-06, "loss": 0.34813885688781737, "num_input_tokens_seen": 395712112, "step": 12410, "train_runtime": 32455.2933, "train_tokens_per_second": 12192.529 }, { "epoch": 0.8359143549690278, "grad_norm": 0.8239099626289091, "learning_rate": 6.275015415806869e-06, "loss": 0.350118088722229, "num_input_tokens_seen": 395867608, "step": 12415, "train_runtime": 32468.3786, "train_tokens_per_second": 12192.405 }, { "epoch": 0.8362510099649879, "grad_norm": 0.7219717097214713, "learning_rate": 6.272458568215458e-06, "loss": 0.3892244338989258, "num_input_tokens_seen": 396026312, "step": 12420, "train_runtime": 32481.0107, "train_tokens_per_second": 12192.549 }, { "epoch": 0.836587664960948, "grad_norm": 0.8301911040076562, "learning_rate": 6.269901364785066e-06, "loss": 0.37661147117614746, "num_input_tokens_seen": 396187992, "step": 12425, "train_runtime": 32494.4183, "train_tokens_per_second": 12192.494 }, { "epoch": 0.8369243199569082, "grad_norm": 0.7788347916884113, "learning_rate": 6.2673438062308055e-06, "loss": 0.3893986701965332, "num_input_tokens_seen": 396351832, "step": 12430, "train_runtime": 32506.8253, "train_tokens_per_second": 12192.88 }, { "epoch": 0.8372609749528683, "grad_norm": 0.8573069353423344, "learning_rate": 6.264785893267892e-06, "loss": 0.3590924501419067, "num_input_tokens_seen": 396502888, "step": 12435, "train_runtime": 32520.0825, "train_tokens_per_second": 12192.555 }, { "epoch": 0.8375976299488285, "grad_norm": 0.6943543037801961, "learning_rate": 6.2622276266116366e-06, "loss": 0.3629936218261719, "num_input_tokens_seen": 396661248, "step": 12440, "train_runtime": 32532.5715, "train_tokens_per_second": 12192.742 }, { "epoch": 0.8379342849447886, "grad_norm": 0.6725735055738319, "learning_rate": 6.25966900697745e-06, "loss": 0.3948936462402344, "num_input_tokens_seen": 396821928, "step": 12445, "train_runtime": 32545.3617, "train_tokens_per_second": 12192.887 }, { "epoch": 0.8382709399407487, "grad_norm": 0.7204533884937845, "learning_rate": 6.257110035080843e-06, "loss": 0.349798583984375, "num_input_tokens_seen": 396981288, "step": 12450, "train_runtime": 32557.9665, "train_tokens_per_second": 12193.062 }, { "epoch": 0.8386075949367089, "grad_norm": 0.7786696931575168, "learning_rate": 6.254550711637422e-06, "loss": 0.40909461975097655, "num_input_tokens_seen": 397136128, "step": 12455, "train_runtime": 32570.8675, "train_tokens_per_second": 12192.986 }, { "epoch": 0.838944249932669, "grad_norm": 0.7836857074035071, "learning_rate": 6.251991037362897e-06, "loss": 0.3861907958984375, "num_input_tokens_seen": 397289120, "step": 12460, "train_runtime": 32584.0985, "train_tokens_per_second": 12192.73 }, { "epoch": 0.8392809049286292, "grad_norm": 0.7477115764264664, "learning_rate": 6.249431012973068e-06, "loss": 0.38586227893829345, "num_input_tokens_seen": 397450760, "step": 12465, "train_runtime": 32597.3657, "train_tokens_per_second": 12192.726 }, { "epoch": 0.8396175599245893, "grad_norm": 0.724986745577849, "learning_rate": 6.246870639183843e-06, "loss": 0.3684225082397461, "num_input_tokens_seen": 397608824, "step": 12470, "train_runtime": 32610.9582, "train_tokens_per_second": 12192.491 }, { "epoch": 0.8399542149205494, "grad_norm": 0.8242561774267139, "learning_rate": 6.2443099167112185e-06, "loss": 0.4017937660217285, "num_input_tokens_seen": 397769304, "step": 12475, "train_runtime": 32623.9407, "train_tokens_per_second": 12192.558 }, { "epoch": 0.8402908699165096, "grad_norm": 0.7507190913705805, "learning_rate": 6.241748846271293e-06, "loss": 0.3807955503463745, "num_input_tokens_seen": 397932720, "step": 12480, "train_runtime": 32637.5938, "train_tokens_per_second": 12192.465 }, { "epoch": 0.8406275249124697, "grad_norm": 0.8215140678733114, "learning_rate": 6.239187428580263e-06, "loss": 0.3828019142150879, "num_input_tokens_seen": 398083808, "step": 12485, "train_runtime": 32650.0526, "train_tokens_per_second": 12192.44 }, { "epoch": 0.8409641799084299, "grad_norm": 0.7815103193784516, "learning_rate": 6.236625664354421e-06, "loss": 0.3829792499542236, "num_input_tokens_seen": 398246040, "step": 12490, "train_runtime": 32663.3273, "train_tokens_per_second": 12192.452 }, { "epoch": 0.84130083490439, "grad_norm": 0.7680839527275634, "learning_rate": 6.2340635543101545e-06, "loss": 0.35940754413604736, "num_input_tokens_seen": 398402216, "step": 12495, "train_runtime": 32676.2112, "train_tokens_per_second": 12192.424 }, { "epoch": 0.8416374899003501, "grad_norm": 0.7600370119133143, "learning_rate": 6.23150109916395e-06, "loss": 0.3576354026794434, "num_input_tokens_seen": 398562400, "step": 12500, "train_runtime": 32688.8958, "train_tokens_per_second": 12192.593 }, { "epoch": 0.8419741448963103, "grad_norm": 0.967728150217961, "learning_rate": 6.22893829963239e-06, "loss": 0.38012650012969973, "num_input_tokens_seen": 398720680, "step": 12505, "train_runtime": 32702.268, "train_tokens_per_second": 12192.447 }, { "epoch": 0.8423107998922704, "grad_norm": 0.8573841807457057, "learning_rate": 6.226375156432153e-06, "loss": 0.3830904245376587, "num_input_tokens_seen": 398883144, "step": 12510, "train_runtime": 32715.5969, "train_tokens_per_second": 12192.446 }, { "epoch": 0.8426474548882306, "grad_norm": 0.779343348897009, "learning_rate": 6.2238116702800145e-06, "loss": 0.37163257598876953, "num_input_tokens_seen": 399040224, "step": 12515, "train_runtime": 32729.1218, "train_tokens_per_second": 12192.207 }, { "epoch": 0.8429841098841907, "grad_norm": 0.8388240735122002, "learning_rate": 6.221247841892846e-06, "loss": 0.3885157346725464, "num_input_tokens_seen": 399195792, "step": 12520, "train_runtime": 32741.6564, "train_tokens_per_second": 12192.291 }, { "epoch": 0.8433207648801508, "grad_norm": 0.7763817090582618, "learning_rate": 6.218683671987611e-06, "loss": 0.3673069477081299, "num_input_tokens_seen": 399358328, "step": 12525, "train_runtime": 32754.3198, "train_tokens_per_second": 12192.539 }, { "epoch": 0.843657419876111, "grad_norm": 0.8125506760711246, "learning_rate": 6.216119161281373e-06, "loss": 0.37899010181427, "num_input_tokens_seen": 399518240, "step": 12530, "train_runtime": 32766.7832, "train_tokens_per_second": 12192.782 }, { "epoch": 0.8439940748720711, "grad_norm": 0.7264369828709771, "learning_rate": 6.213554310491291e-06, "loss": 0.3721353530883789, "num_input_tokens_seen": 399673560, "step": 12535, "train_runtime": 32779.7526, "train_tokens_per_second": 12192.696 }, { "epoch": 0.8443307298680313, "grad_norm": 0.6895907366753489, "learning_rate": 6.210989120334616e-06, "loss": 0.37443482875823975, "num_input_tokens_seen": 399831168, "step": 12540, "train_runtime": 32792.7824, "train_tokens_per_second": 12192.658 }, { "epoch": 0.8446673848639914, "grad_norm": 0.8937676714699526, "learning_rate": 6.208423591528694e-06, "loss": 0.39349913597106934, "num_input_tokens_seen": 399988176, "step": 12545, "train_runtime": 32805.4958, "train_tokens_per_second": 12192.719 }, { "epoch": 0.8450040398599515, "grad_norm": 0.7316902300296461, "learning_rate": 6.205857724790969e-06, "loss": 0.3690343379974365, "num_input_tokens_seen": 400144368, "step": 12550, "train_runtime": 32818.4211, "train_tokens_per_second": 12192.676 }, { "epoch": 0.8453406948559117, "grad_norm": 0.851807690881045, "learning_rate": 6.203291520838974e-06, "loss": 0.40696015357971194, "num_input_tokens_seen": 400307104, "step": 12555, "train_runtime": 32831.8307, "train_tokens_per_second": 12192.653 }, { "epoch": 0.8456773498518718, "grad_norm": 0.7130685225382905, "learning_rate": 6.200724980390344e-06, "loss": 0.3358847856521606, "num_input_tokens_seen": 400460520, "step": 12560, "train_runtime": 32845.8782, "train_tokens_per_second": 12192.109 }, { "epoch": 0.846014004847832, "grad_norm": 0.8268186235538687, "learning_rate": 6.198158104162804e-06, "loss": 0.32937169075012207, "num_input_tokens_seen": 400617512, "step": 12565, "train_runtime": 32859.2701, "train_tokens_per_second": 12191.918 }, { "epoch": 0.8463506598437921, "grad_norm": 0.7976638888606921, "learning_rate": 6.1955908928741685e-06, "loss": 0.3984895944595337, "num_input_tokens_seen": 400781352, "step": 12570, "train_runtime": 32871.6765, "train_tokens_per_second": 12192.3 }, { "epoch": 0.8466873148397522, "grad_norm": 0.7462138033530691, "learning_rate": 6.193023347242353e-06, "loss": 0.3751025676727295, "num_input_tokens_seen": 400943568, "step": 12575, "train_runtime": 32884.254, "train_tokens_per_second": 12192.57 }, { "epoch": 0.8470239698357124, "grad_norm": 0.8073717142308791, "learning_rate": 6.190455467985361e-06, "loss": 0.3694050073623657, "num_input_tokens_seen": 401103848, "step": 12580, "train_runtime": 32896.7843, "train_tokens_per_second": 12192.798 }, { "epoch": 0.8473606248316725, "grad_norm": 0.8302570849938541, "learning_rate": 6.187887255821295e-06, "loss": 0.40051612854003904, "num_input_tokens_seen": 401264768, "step": 12585, "train_runtime": 32909.7114, "train_tokens_per_second": 12192.898 }, { "epoch": 0.8476972798276327, "grad_norm": 0.9316038846522084, "learning_rate": 6.185318711468345e-06, "loss": 0.3508431434631348, "num_input_tokens_seen": 401417800, "step": 12590, "train_runtime": 32922.2671, "train_tokens_per_second": 12192.897 }, { "epoch": 0.8480339348235928, "grad_norm": 0.781890086152173, "learning_rate": 6.182749835644799e-06, "loss": 0.3576326370239258, "num_input_tokens_seen": 401572640, "step": 12595, "train_runtime": 32935.0293, "train_tokens_per_second": 12192.873 }, { "epoch": 0.8483705898195529, "grad_norm": 0.750843738984787, "learning_rate": 6.180180629069031e-06, "loss": 0.36127438545227053, "num_input_tokens_seen": 401736480, "step": 12600, "train_runtime": 32947.456, "train_tokens_per_second": 12193.247 }, { "epoch": 0.8487072448155131, "grad_norm": 0.7819741535922999, "learning_rate": 6.177611092459514e-06, "loss": 0.3495652675628662, "num_input_tokens_seen": 401893736, "step": 12605, "train_runtime": 32960.1075, "train_tokens_per_second": 12193.338 }, { "epoch": 0.8490438998114732, "grad_norm": 0.722893346123921, "learning_rate": 6.175041226534809e-06, "loss": 0.3683613300323486, "num_input_tokens_seen": 402056200, "step": 12610, "train_runtime": 32972.7637, "train_tokens_per_second": 12193.585 }, { "epoch": 0.8493805548074334, "grad_norm": 0.7742308438988654, "learning_rate": 6.172471032013574e-06, "loss": 0.3373131036758423, "num_input_tokens_seen": 402219256, "step": 12615, "train_runtime": 32985.6121, "train_tokens_per_second": 12193.779 }, { "epoch": 0.8497172098033935, "grad_norm": 0.6794174128467396, "learning_rate": 6.169900509614553e-06, "loss": 0.367539119720459, "num_input_tokens_seen": 402382456, "step": 12620, "train_runtime": 32999.2118, "train_tokens_per_second": 12193.699 }, { "epoch": 0.8500538647993536, "grad_norm": 0.8002691506605063, "learning_rate": 6.167329660056585e-06, "loss": 0.37078495025634767, "num_input_tokens_seen": 402541424, "step": 12625, "train_runtime": 33012.879, "train_tokens_per_second": 12193.466 }, { "epoch": 0.8503905197953138, "grad_norm": 0.6905025863939127, "learning_rate": 6.1647584840586e-06, "loss": 0.37767093181610106, "num_input_tokens_seen": 402703848, "step": 12630, "train_runtime": 33026.1611, "train_tokens_per_second": 12193.48 }, { "epoch": 0.8507271747912739, "grad_norm": 0.779807320390761, "learning_rate": 6.1621869823396175e-06, "loss": 0.36885714530944824, "num_input_tokens_seen": 402865168, "step": 12635, "train_runtime": 33038.6353, "train_tokens_per_second": 12193.759 }, { "epoch": 0.851063829787234, "grad_norm": 0.7601342008663453, "learning_rate": 6.159615155618752e-06, "loss": 0.3726487636566162, "num_input_tokens_seen": 403026192, "step": 12640, "train_runtime": 33051.1543, "train_tokens_per_second": 12194.013 }, { "epoch": 0.8514004847831942, "grad_norm": 0.8509473851267122, "learning_rate": 6.157043004615207e-06, "loss": 0.4008166313171387, "num_input_tokens_seen": 403190032, "step": 12645, "train_runtime": 33063.5762, "train_tokens_per_second": 12194.387 }, { "epoch": 0.8517371397791543, "grad_norm": 0.839165803676292, "learning_rate": 6.1544705300482755e-06, "loss": 0.39062521457672117, "num_input_tokens_seen": 403350784, "step": 12650, "train_runtime": 33076.6802, "train_tokens_per_second": 12194.416 }, { "epoch": 0.8520737947751145, "grad_norm": 0.7195594961981636, "learning_rate": 6.151897732637341e-06, "loss": 0.3450798988342285, "num_input_tokens_seen": 403508536, "step": 12655, "train_runtime": 33090.6945, "train_tokens_per_second": 12194.018 }, { "epoch": 0.8524104497710746, "grad_norm": 1.1397000959712602, "learning_rate": 6.149324613101877e-06, "loss": 0.37447295188903806, "num_input_tokens_seen": 403668736, "step": 12660, "train_runtime": 33103.5006, "train_tokens_per_second": 12194.14 }, { "epoch": 0.8527471047670347, "grad_norm": 0.7181606459255789, "learning_rate": 6.146751172161453e-06, "loss": 0.34419114589691163, "num_input_tokens_seen": 403828664, "step": 12665, "train_runtime": 33115.9592, "train_tokens_per_second": 12194.382 }, { "epoch": 0.8530837597629949, "grad_norm": 0.9039847988524667, "learning_rate": 6.144177410535719e-06, "loss": 0.3686807632446289, "num_input_tokens_seen": 403987816, "step": 12670, "train_runtime": 33128.9954, "train_tokens_per_second": 12194.388 }, { "epoch": 0.853420414758955, "grad_norm": 0.7687917755016143, "learning_rate": 6.14160332894442e-06, "loss": 0.3606849670410156, "num_input_tokens_seen": 404140960, "step": 12675, "train_runtime": 33142.3875, "train_tokens_per_second": 12194.081 }, { "epoch": 0.8537570697549152, "grad_norm": 0.8066960521776163, "learning_rate": 6.139028928107391e-06, "loss": 0.37674221992492674, "num_input_tokens_seen": 404302360, "step": 12680, "train_runtime": 33156.028, "train_tokens_per_second": 12193.932 }, { "epoch": 0.8540937247508753, "grad_norm": 0.7204606916110843, "learning_rate": 6.136454208744553e-06, "loss": 0.3510474920272827, "num_input_tokens_seen": 404462192, "step": 12685, "train_runtime": 33169.4945, "train_tokens_per_second": 12193.8 }, { "epoch": 0.8544303797468354, "grad_norm": 1.0080917081615282, "learning_rate": 6.133879171575921e-06, "loss": 0.37795443534851075, "num_input_tokens_seen": 404621512, "step": 12690, "train_runtime": 33182.3362, "train_tokens_per_second": 12193.883 }, { "epoch": 0.8547670347427956, "grad_norm": 0.7643254989413517, "learning_rate": 6.131303817321595e-06, "loss": 0.40749382972717285, "num_input_tokens_seen": 404785352, "step": 12695, "train_runtime": 33194.7633, "train_tokens_per_second": 12194.253 }, { "epoch": 0.8551036897387557, "grad_norm": 0.6664348025714469, "learning_rate": 6.128728146701763e-06, "loss": 0.3764413118362427, "num_input_tokens_seen": 404947808, "step": 12700, "train_runtime": 33208.2587, "train_tokens_per_second": 12194.19 }, { "epoch": 0.8554403447347159, "grad_norm": 0.6983900921830037, "learning_rate": 6.126152160436705e-06, "loss": 0.3326622247695923, "num_input_tokens_seen": 405110144, "step": 12705, "train_runtime": 33220.9893, "train_tokens_per_second": 12194.403 }, { "epoch": 0.855776999730676, "grad_norm": 0.9281329338517793, "learning_rate": 6.123575859246784e-06, "loss": 0.382525372505188, "num_input_tokens_seen": 405268424, "step": 12710, "train_runtime": 33233.7579, "train_tokens_per_second": 12194.481 }, { "epoch": 0.8561136547266361, "grad_norm": 0.8498839317386597, "learning_rate": 6.120999243852459e-06, "loss": 0.37018160820007323, "num_input_tokens_seen": 405426872, "step": 12715, "train_runtime": 33246.9018, "train_tokens_per_second": 12194.426 }, { "epoch": 0.8564503097225963, "grad_norm": 0.8928689419493613, "learning_rate": 6.118422314974269e-06, "loss": 0.39122605323791504, "num_input_tokens_seen": 405585688, "step": 12720, "train_runtime": 33259.834, "train_tokens_per_second": 12194.459 }, { "epoch": 0.8567869647185564, "grad_norm": 0.8352537355686774, "learning_rate": 6.115845073332845e-06, "loss": 0.3892014503479004, "num_input_tokens_seen": 405747808, "step": 12725, "train_runtime": 33273.0813, "train_tokens_per_second": 12194.477 }, { "epoch": 0.8571236197145166, "grad_norm": 0.8985030821020111, "learning_rate": 6.113267519648905e-06, "loss": 0.4044198036193848, "num_input_tokens_seen": 405911648, "step": 12730, "train_runtime": 33285.5058, "train_tokens_per_second": 12194.847 }, { "epoch": 0.8574602747104767, "grad_norm": 0.658944427605796, "learning_rate": 6.110689654643253e-06, "loss": 0.37032299041748046, "num_input_tokens_seen": 406069808, "step": 12735, "train_runtime": 33299.0048, "train_tokens_per_second": 12194.653 }, { "epoch": 0.8577969297064368, "grad_norm": 0.7314294668266916, "learning_rate": 6.1081114790367805e-06, "loss": 0.35985755920410156, "num_input_tokens_seen": 406225784, "step": 12740, "train_runtime": 33312.1797, "train_tokens_per_second": 12194.512 }, { "epoch": 0.858133584702397, "grad_norm": 0.7398811878050553, "learning_rate": 6.105532993550467e-06, "loss": 0.3731865882873535, "num_input_tokens_seen": 406387064, "step": 12745, "train_runtime": 33325.0991, "train_tokens_per_second": 12194.624 }, { "epoch": 0.8584702396983571, "grad_norm": 0.7378257625909477, "learning_rate": 6.1029541989053765e-06, "loss": 0.3603785276412964, "num_input_tokens_seen": 406549584, "step": 12750, "train_runtime": 33337.9649, "train_tokens_per_second": 12194.793 }, { "epoch": 0.8588068946943173, "grad_norm": 0.7450638904454566, "learning_rate": 6.100375095822661e-06, "loss": 0.39239749908447263, "num_input_tokens_seen": 406706312, "step": 12755, "train_runtime": 33350.6992, "train_tokens_per_second": 12194.836 }, { "epoch": 0.8591435496902774, "grad_norm": 0.7179052780595722, "learning_rate": 6.097795685023558e-06, "loss": 0.34895436763763427, "num_input_tokens_seen": 406865072, "step": 12760, "train_runtime": 33363.855, "train_tokens_per_second": 12194.786 }, { "epoch": 0.8594802046862375, "grad_norm": 0.7301341564039867, "learning_rate": 6.095215967229396e-06, "loss": 0.37278900146484373, "num_input_tokens_seen": 407020208, "step": 12765, "train_runtime": 33377.6106, "train_tokens_per_second": 12194.408 }, { "epoch": 0.8598168596821977, "grad_norm": 0.7692591032657112, "learning_rate": 6.092635943161578e-06, "loss": 0.3720006227493286, "num_input_tokens_seen": 407179696, "step": 12770, "train_runtime": 33390.5361, "train_tokens_per_second": 12194.464 }, { "epoch": 0.8601535146781578, "grad_norm": 0.7962386613929501, "learning_rate": 6.090055613541603e-06, "loss": 0.3699465751647949, "num_input_tokens_seen": 407342288, "step": 12775, "train_runtime": 33403.2121, "train_tokens_per_second": 12194.704 }, { "epoch": 0.860490169674118, "grad_norm": 0.8485093072788619, "learning_rate": 6.087474979091052e-06, "loss": 0.3725653886795044, "num_input_tokens_seen": 407498232, "step": 12780, "train_runtime": 33416.1338, "train_tokens_per_second": 12194.655 }, { "epoch": 0.8608268246700781, "grad_norm": 0.7860612783111367, "learning_rate": 6.084894040531591e-06, "loss": 0.3481574773788452, "num_input_tokens_seen": 407659744, "step": 12785, "train_runtime": 33428.6235, "train_tokens_per_second": 12194.931 }, { "epoch": 0.8611634796660382, "grad_norm": 0.7658199357483233, "learning_rate": 6.0823127985849705e-06, "loss": 0.3575266361236572, "num_input_tokens_seen": 407815360, "step": 12790, "train_runtime": 33441.9637, "train_tokens_per_second": 12194.719 }, { "epoch": 0.8615001346619984, "grad_norm": 0.77805466995071, "learning_rate": 6.079731253973028e-06, "loss": 0.3454300880432129, "num_input_tokens_seen": 407976112, "step": 12795, "train_runtime": 33455.3744, "train_tokens_per_second": 12194.636 }, { "epoch": 0.8618367896579585, "grad_norm": 0.7881419636748516, "learning_rate": 6.077149407417683e-06, "loss": 0.35955722332000734, "num_input_tokens_seen": 408134624, "step": 12800, "train_runtime": 33467.9949, "train_tokens_per_second": 12194.774 }, { "epoch": 0.8621734446539187, "grad_norm": 0.7557302069572392, "learning_rate": 6.07456725964094e-06, "loss": 0.377480673789978, "num_input_tokens_seen": 408293632, "step": 12805, "train_runtime": 33480.9384, "train_tokens_per_second": 12194.808 }, { "epoch": 0.8625100996498788, "grad_norm": 0.6942248951997614, "learning_rate": 6.07198481136489e-06, "loss": 0.34640040397644045, "num_input_tokens_seen": 408454688, "step": 12810, "train_runtime": 33495.47, "train_tokens_per_second": 12194.326 }, { "epoch": 0.8628467546458389, "grad_norm": 0.8195548991443865, "learning_rate": 6.069402063311706e-06, "loss": 0.36253116130828855, "num_input_tokens_seen": 408610896, "step": 12815, "train_runtime": 33508.3651, "train_tokens_per_second": 12194.295 }, { "epoch": 0.8631834096417991, "grad_norm": 0.8913361911505505, "learning_rate": 6.066819016203646e-06, "loss": 0.37452623844146726, "num_input_tokens_seen": 408768952, "step": 12820, "train_runtime": 33522.1167, "train_tokens_per_second": 12194.008 }, { "epoch": 0.8635200646377592, "grad_norm": 0.782206360214692, "learning_rate": 6.064235670763048e-06, "loss": 0.3726938724517822, "num_input_tokens_seen": 408930208, "step": 12825, "train_runtime": 33535.2514, "train_tokens_per_second": 12194.04 }, { "epoch": 0.8638567196337193, "grad_norm": 0.7699473020225349, "learning_rate": 6.06165202771234e-06, "loss": 0.40253872871398927, "num_input_tokens_seen": 409091504, "step": 12830, "train_runtime": 33548.3445, "train_tokens_per_second": 12194.089 }, { "epoch": 0.8641933746296795, "grad_norm": 0.6868305867696708, "learning_rate": 6.059068087774026e-06, "loss": 0.34599416255950927, "num_input_tokens_seen": 409249648, "step": 12835, "train_runtime": 33561.6571, "train_tokens_per_second": 12193.964 }, { "epoch": 0.8645300296256396, "grad_norm": 0.7689136943985069, "learning_rate": 6.0564838516707005e-06, "loss": 0.4018962860107422, "num_input_tokens_seen": 409412632, "step": 12840, "train_runtime": 33574.5644, "train_tokens_per_second": 12194.131 }, { "epoch": 0.8648666846215998, "grad_norm": 0.7139669760122431, "learning_rate": 6.053899320125033e-06, "loss": 0.3490764141082764, "num_input_tokens_seen": 409573872, "step": 12845, "train_runtime": 33588.1341, "train_tokens_per_second": 12194.005 }, { "epoch": 0.8652033396175599, "grad_norm": 0.8518848234602384, "learning_rate": 6.051314493859782e-06, "loss": 0.38599472045898436, "num_input_tokens_seen": 409735800, "step": 12850, "train_runtime": 33601.184, "train_tokens_per_second": 12194.088 }, { "epoch": 0.86553999461352, "grad_norm": 0.6950213087304614, "learning_rate": 6.048729373597786e-06, "loss": 0.36157453060150146, "num_input_tokens_seen": 409897232, "step": 12855, "train_runtime": 33615.2059, "train_tokens_per_second": 12193.804 }, { "epoch": 0.8658766496094802, "grad_norm": 0.8002476802050338, "learning_rate": 6.046143960061963e-06, "loss": 0.3891181468963623, "num_input_tokens_seen": 410056144, "step": 12860, "train_runtime": 33628.1962, "train_tokens_per_second": 12193.819 }, { "epoch": 0.8662133046054403, "grad_norm": 0.8918912706460341, "learning_rate": 6.043558253975319e-06, "loss": 0.3897066354751587, "num_input_tokens_seen": 410218256, "step": 12865, "train_runtime": 33641.3634, "train_tokens_per_second": 12193.865 }, { "epoch": 0.8665499596014005, "grad_norm": 0.7729623391622175, "learning_rate": 6.040972256060936e-06, "loss": 0.3626770734786987, "num_input_tokens_seen": 410376472, "step": 12870, "train_runtime": 33654.9437, "train_tokens_per_second": 12193.646 }, { "epoch": 0.8668866145973606, "grad_norm": 0.6766534276158708, "learning_rate": 6.038385967041982e-06, "loss": 0.36469197273254395, "num_input_tokens_seen": 410534264, "step": 12875, "train_runtime": 33668.4176, "train_tokens_per_second": 12193.453 }, { "epoch": 0.8672232695933207, "grad_norm": 0.7032803539437972, "learning_rate": 6.035799387641703e-06, "loss": 0.38130509853363037, "num_input_tokens_seen": 410694576, "step": 12880, "train_runtime": 33680.8215, "train_tokens_per_second": 12193.722 }, { "epoch": 0.8675599245892809, "grad_norm": 0.7762694515631788, "learning_rate": 6.033212518583427e-06, "loss": 0.38940274715423584, "num_input_tokens_seen": 410853008, "step": 12885, "train_runtime": 33693.3584, "train_tokens_per_second": 12193.887 }, { "epoch": 0.867896579585241, "grad_norm": 0.8474303988806787, "learning_rate": 6.030625360590567e-06, "loss": 0.37598414421081544, "num_input_tokens_seen": 411011920, "step": 12890, "train_runtime": 33705.8183, "train_tokens_per_second": 12194.094 }, { "epoch": 0.8682332345812012, "grad_norm": 0.7087498583601097, "learning_rate": 6.028037914386609e-06, "loss": 0.3651896953582764, "num_input_tokens_seen": 411172416, "step": 12895, "train_runtime": 33719.5992, "train_tokens_per_second": 12193.87 }, { "epoch": 0.8685698895771613, "grad_norm": 0.8373781193441389, "learning_rate": 6.025450180695128e-06, "loss": 0.39384140968322756, "num_input_tokens_seen": 411335176, "step": 12900, "train_runtime": 33733.031, "train_tokens_per_second": 12193.84 }, { "epoch": 0.8689065445731214, "grad_norm": 0.8052785411699693, "learning_rate": 6.022862160239774e-06, "loss": 0.3569489002227783, "num_input_tokens_seen": 411495936, "step": 12905, "train_runtime": 33745.9405, "train_tokens_per_second": 12193.939 }, { "epoch": 0.8692431995690816, "grad_norm": 0.6918394011509618, "learning_rate": 6.020273853744277e-06, "loss": 0.35686182975769043, "num_input_tokens_seen": 411655640, "step": 12910, "train_runtime": 33759.0314, "train_tokens_per_second": 12193.941 }, { "epoch": 0.8695798545650417, "grad_norm": 0.7458713683528733, "learning_rate": 6.017685261932452e-06, "loss": 0.37008347511291506, "num_input_tokens_seen": 411803848, "step": 12915, "train_runtime": 33771.6074, "train_tokens_per_second": 12193.789 }, { "epoch": 0.8699165095610019, "grad_norm": 0.7805079347128676, "learning_rate": 6.015096385528189e-06, "loss": 0.37687828540802004, "num_input_tokens_seen": 411962496, "step": 12920, "train_runtime": 33785.3897, "train_tokens_per_second": 12193.51 }, { "epoch": 0.870253164556962, "grad_norm": 0.7288989433804928, "learning_rate": 6.012507225255457e-06, "loss": 0.38899846076965333, "num_input_tokens_seen": 412114792, "step": 12925, "train_runtime": 33798.9921, "train_tokens_per_second": 12193.109 }, { "epoch": 0.8705898195529221, "grad_norm": 0.7233373226940525, "learning_rate": 6.009917781838309e-06, "loss": 0.3851949691772461, "num_input_tokens_seen": 412273624, "step": 12930, "train_runtime": 33812.6646, "train_tokens_per_second": 12192.876 }, { "epoch": 0.8709264745488823, "grad_norm": 0.7173827686166462, "learning_rate": 6.007328056000873e-06, "loss": 0.3766153573989868, "num_input_tokens_seen": 412433736, "step": 12935, "train_runtime": 33825.6316, "train_tokens_per_second": 12192.935 }, { "epoch": 0.8712631295448424, "grad_norm": 0.8833430194303291, "learning_rate": 6.004738048467359e-06, "loss": 0.3949904203414917, "num_input_tokens_seen": 412596208, "step": 12940, "train_runtime": 33838.9673, "train_tokens_per_second": 12192.931 }, { "epoch": 0.8715997845408026, "grad_norm": 0.7593578933751526, "learning_rate": 6.002147759962054e-06, "loss": 0.3708235263824463, "num_input_tokens_seen": 412757856, "step": 12945, "train_runtime": 33852.1298, "train_tokens_per_second": 12192.966 }, { "epoch": 0.8719364395367627, "grad_norm": 0.977158902305095, "learning_rate": 5.999557191209323e-06, "loss": 0.39374637603759766, "num_input_tokens_seen": 412921696, "step": 12950, "train_runtime": 33864.5388, "train_tokens_per_second": 12193.336 }, { "epoch": 0.8722730945327228, "grad_norm": 0.792808958727639, "learning_rate": 5.996966342933611e-06, "loss": 0.3341085433959961, "num_input_tokens_seen": 413083192, "step": 12955, "train_runtime": 33877.59, "train_tokens_per_second": 12193.405 }, { "epoch": 0.872609749528683, "grad_norm": 0.7928487673183624, "learning_rate": 5.99437521585944e-06, "loss": 0.37221875190734866, "num_input_tokens_seen": 413240568, "step": 12960, "train_runtime": 33890.7697, "train_tokens_per_second": 12193.307 }, { "epoch": 0.8729464045246431, "grad_norm": 0.7959131200819058, "learning_rate": 5.99178381071141e-06, "loss": 0.3860820531845093, "num_input_tokens_seen": 413398952, "step": 12965, "train_runtime": 33903.3226, "train_tokens_per_second": 12193.464 }, { "epoch": 0.8732830595206033, "grad_norm": 0.8411813990718096, "learning_rate": 5.989192128214201e-06, "loss": 0.3725898265838623, "num_input_tokens_seen": 413555456, "step": 12970, "train_runtime": 33916.2722, "train_tokens_per_second": 12193.423 }, { "epoch": 0.8736197145165634, "grad_norm": 0.8261820749612145, "learning_rate": 5.986600169092568e-06, "loss": 0.36458826065063477, "num_input_tokens_seen": 413715760, "step": 12975, "train_runtime": 33929.4407, "train_tokens_per_second": 12193.415 }, { "epoch": 0.8739563695125235, "grad_norm": 0.808581678931111, "learning_rate": 5.984007934071343e-06, "loss": 0.39312138557434084, "num_input_tokens_seen": 413879600, "step": 12980, "train_runtime": 33941.8605, "train_tokens_per_second": 12193.781 }, { "epoch": 0.8742930245084837, "grad_norm": 0.7669903965127057, "learning_rate": 5.981415423875436e-06, "loss": 0.3765831708908081, "num_input_tokens_seen": 414040488, "step": 12985, "train_runtime": 33954.3008, "train_tokens_per_second": 12194.051 }, { "epoch": 0.8746296795044438, "grad_norm": 0.874873818693881, "learning_rate": 5.978822639229836e-06, "loss": 0.36043601036071776, "num_input_tokens_seen": 414192888, "step": 12990, "train_runtime": 33967.2873, "train_tokens_per_second": 12193.876 }, { "epoch": 0.874966334500404, "grad_norm": 0.7834550704306165, "learning_rate": 5.976229580859607e-06, "loss": 0.3817555904388428, "num_input_tokens_seen": 414354168, "step": 12995, "train_runtime": 33980.3661, "train_tokens_per_second": 12193.929 }, { "epoch": 0.8753029894963641, "grad_norm": 0.7948978778888021, "learning_rate": 5.9736362494898895e-06, "loss": 0.3524010181427002, "num_input_tokens_seen": 414512088, "step": 13000, "train_runtime": 33993.6209, "train_tokens_per_second": 12193.82 }, { "epoch": 0.8756396444923242, "grad_norm": 0.7408346475228127, "learning_rate": 5.971042645845897e-06, "loss": 0.37934682369232176, "num_input_tokens_seen": 414670616, "step": 13005, "train_runtime": 34006.3425, "train_tokens_per_second": 12193.92 }, { "epoch": 0.8759762994882844, "grad_norm": 0.7493180498429644, "learning_rate": 5.968448770652926e-06, "loss": 0.36423530578613283, "num_input_tokens_seen": 414832728, "step": 13010, "train_runtime": 34019.3361, "train_tokens_per_second": 12194.028 }, { "epoch": 0.8763129544842445, "grad_norm": 0.8020445034511668, "learning_rate": 5.965854624636345e-06, "loss": 0.40179805755615233, "num_input_tokens_seen": 414987776, "step": 13015, "train_runtime": 34032.7217, "train_tokens_per_second": 12193.787 }, { "epoch": 0.8766496094802047, "grad_norm": 0.8162241297318947, "learning_rate": 5.963260208521598e-06, "loss": 0.37693307399749754, "num_input_tokens_seen": 415145824, "step": 13020, "train_runtime": 34045.743, "train_tokens_per_second": 12193.766 }, { "epoch": 0.8769862644761648, "grad_norm": 0.7712413820992793, "learning_rate": 5.960665523034205e-06, "loss": 0.3809064388275146, "num_input_tokens_seen": 415301600, "step": 13025, "train_runtime": 34058.7228, "train_tokens_per_second": 12193.693 }, { "epoch": 0.8773229194721249, "grad_norm": 1.0377289687679634, "learning_rate": 5.958070568899762e-06, "loss": 0.3460919618606567, "num_input_tokens_seen": 415465440, "step": 13030, "train_runtime": 34071.3476, "train_tokens_per_second": 12193.983 }, { "epoch": 0.8776595744680851, "grad_norm": 0.7689126908297821, "learning_rate": 5.955475346843939e-06, "loss": 0.3675867557525635, "num_input_tokens_seen": 415618288, "step": 13035, "train_runtime": 34084.0033, "train_tokens_per_second": 12193.94 }, { "epoch": 0.8779962294640452, "grad_norm": 0.7433218130193447, "learning_rate": 5.952879857592482e-06, "loss": 0.3404216766357422, "num_input_tokens_seen": 415776832, "step": 13040, "train_runtime": 34097.5085, "train_tokens_per_second": 12193.76 }, { "epoch": 0.8783328844600053, "grad_norm": 0.7903239259849757, "learning_rate": 5.950284101871212e-06, "loss": 0.39055964946746824, "num_input_tokens_seen": 415932720, "step": 13045, "train_runtime": 34110.8904, "train_tokens_per_second": 12193.546 }, { "epoch": 0.8786695394559655, "grad_norm": 0.7705301724281072, "learning_rate": 5.947688080406023e-06, "loss": 0.3599937915802002, "num_input_tokens_seen": 416088168, "step": 13050, "train_runtime": 34124.608, "train_tokens_per_second": 12193.2 }, { "epoch": 0.8790061944519256, "grad_norm": 0.7624602425386903, "learning_rate": 5.945091793922885e-06, "loss": 0.3516396999359131, "num_input_tokens_seen": 416246624, "step": 13055, "train_runtime": 34138.3357, "train_tokens_per_second": 12192.938 }, { "epoch": 0.8793428494478858, "grad_norm": 0.7815443147904304, "learning_rate": 5.942495243147839e-06, "loss": 0.4112947940826416, "num_input_tokens_seen": 416405152, "step": 13060, "train_runtime": 34151.175, "train_tokens_per_second": 12192.996 }, { "epoch": 0.8796795044438459, "grad_norm": 0.7263386803421994, "learning_rate": 5.939898428807004e-06, "loss": 0.3809444189071655, "num_input_tokens_seen": 416564968, "step": 13065, "train_runtime": 34163.9252, "train_tokens_per_second": 12193.124 }, { "epoch": 0.880016159439806, "grad_norm": 0.8454893587056186, "learning_rate": 5.937301351626571e-06, "loss": 0.3815094709396362, "num_input_tokens_seen": 416723320, "step": 13070, "train_runtime": 34176.8969, "train_tokens_per_second": 12193.129 }, { "epoch": 0.8803528144357662, "grad_norm": 0.776536709943707, "learning_rate": 5.934704012332803e-06, "loss": 0.3818216323852539, "num_input_tokens_seen": 416885952, "step": 13075, "train_runtime": 34190.2846, "train_tokens_per_second": 12193.112 }, { "epoch": 0.8806894694317263, "grad_norm": 0.8626439121563402, "learning_rate": 5.93210641165204e-06, "loss": 0.41301589012145995, "num_input_tokens_seen": 417048096, "step": 13080, "train_runtime": 34203.47, "train_tokens_per_second": 12193.152 }, { "epoch": 0.8810261244276865, "grad_norm": 0.9674089686262991, "learning_rate": 5.92950855031069e-06, "loss": 0.38540401458740237, "num_input_tokens_seen": 417208088, "step": 13085, "train_runtime": 34216.7544, "train_tokens_per_second": 12193.094 }, { "epoch": 0.8813627794236466, "grad_norm": 0.7668980878724503, "learning_rate": 5.926910429035239e-06, "loss": 0.3853085994720459, "num_input_tokens_seen": 417364864, "step": 13090, "train_runtime": 34229.4106, "train_tokens_per_second": 12193.165 }, { "epoch": 0.8816994344196067, "grad_norm": 0.7280443921582831, "learning_rate": 5.924312048552241e-06, "loss": 0.36177754402160645, "num_input_tokens_seen": 417525448, "step": 13095, "train_runtime": 34242.4949, "train_tokens_per_second": 12193.196 }, { "epoch": 0.8820360894155669, "grad_norm": 2.261440141786363, "learning_rate": 5.9217134095883265e-06, "loss": 0.3674927234649658, "num_input_tokens_seen": 417689288, "step": 13100, "train_runtime": 34254.9196, "train_tokens_per_second": 12193.556 }, { "epoch": 0.882372744411527, "grad_norm": 0.8097265428499648, "learning_rate": 5.919114512870197e-06, "loss": 0.3579556941986084, "num_input_tokens_seen": 417852832, "step": 13105, "train_runtime": 34267.9309, "train_tokens_per_second": 12193.699 }, { "epoch": 0.8827093994074872, "grad_norm": 0.7486064152000329, "learning_rate": 5.916515359124623e-06, "loss": 0.35618577003479, "num_input_tokens_seen": 418007328, "step": 13110, "train_runtime": 34280.9474, "train_tokens_per_second": 12193.576 }, { "epoch": 0.8830460544034473, "grad_norm": 0.8119623364837927, "learning_rate": 5.913915949078453e-06, "loss": 0.37612075805664064, "num_input_tokens_seen": 418168656, "step": 13115, "train_runtime": 34293.8792, "train_tokens_per_second": 12193.682 }, { "epoch": 0.8833827093994074, "grad_norm": 0.8147606284926963, "learning_rate": 5.911316283458601e-06, "loss": 0.36575419902801515, "num_input_tokens_seen": 418326656, "step": 13120, "train_runtime": 34308.0516, "train_tokens_per_second": 12193.25 }, { "epoch": 0.8837193643953676, "grad_norm": 0.7533740176987012, "learning_rate": 5.908716362992057e-06, "loss": 0.3725563049316406, "num_input_tokens_seen": 418482984, "step": 13125, "train_runtime": 34320.946, "train_tokens_per_second": 12193.224 }, { "epoch": 0.8840560193913277, "grad_norm": 0.7424864211809662, "learning_rate": 5.90611618840588e-06, "loss": 0.38197789192199705, "num_input_tokens_seen": 418642768, "step": 13130, "train_runtime": 34333.3443, "train_tokens_per_second": 12193.475 }, { "epoch": 0.8843926743872879, "grad_norm": 0.8235444028639038, "learning_rate": 5.903515760427198e-06, "loss": 0.3972452163696289, "num_input_tokens_seen": 418800520, "step": 13135, "train_runtime": 34346.3685, "train_tokens_per_second": 12193.444 }, { "epoch": 0.884729329383248, "grad_norm": 0.8248324207654019, "learning_rate": 5.900915079783218e-06, "loss": 0.36539907455444337, "num_input_tokens_seen": 418963816, "step": 13140, "train_runtime": 34359.2617, "train_tokens_per_second": 12193.621 }, { "epoch": 0.8850659843792081, "grad_norm": 0.8342316226053779, "learning_rate": 5.898314147201207e-06, "loss": 0.3543950319290161, "num_input_tokens_seen": 419119120, "step": 13145, "train_runtime": 34372.7761, "train_tokens_per_second": 12193.345 }, { "epoch": 0.8854026393751683, "grad_norm": 0.9497082491364792, "learning_rate": 5.895712963408511e-06, "loss": 0.4082606315612793, "num_input_tokens_seen": 419278560, "step": 13150, "train_runtime": 34386.7536, "train_tokens_per_second": 12193.025 }, { "epoch": 0.8857392943711284, "grad_norm": 0.8149686642704281, "learning_rate": 5.893111529132539e-06, "loss": 0.4085671901702881, "num_input_tokens_seen": 419433680, "step": 13155, "train_runtime": 34399.8527, "train_tokens_per_second": 12192.892 }, { "epoch": 0.8860759493670886, "grad_norm": 0.7998442546583407, "learning_rate": 5.8905098451007755e-06, "loss": 0.3963483810424805, "num_input_tokens_seen": 419591312, "step": 13160, "train_runtime": 34413.3568, "train_tokens_per_second": 12192.688 }, { "epoch": 0.8864126043630487, "grad_norm": 0.761298875678993, "learning_rate": 5.887907912040774e-06, "loss": 0.3726170539855957, "num_input_tokens_seen": 419747280, "step": 13165, "train_runtime": 34425.8225, "train_tokens_per_second": 12192.803 }, { "epoch": 0.8867492593590088, "grad_norm": 0.8493023219785234, "learning_rate": 5.885305730680158e-06, "loss": 0.3757298469543457, "num_input_tokens_seen": 419909128, "step": 13170, "train_runtime": 34438.3494, "train_tokens_per_second": 12193.068 }, { "epoch": 0.887085914354969, "grad_norm": 0.733066963399798, "learning_rate": 5.882703301746616e-06, "loss": 0.3611739635467529, "num_input_tokens_seen": 420064800, "step": 13175, "train_runtime": 34450.8689, "train_tokens_per_second": 12193.155 }, { "epoch": 0.8874225693509291, "grad_norm": 0.7543688289110454, "learning_rate": 5.88010062596791e-06, "loss": 0.35973658561706545, "num_input_tokens_seen": 420223928, "step": 13180, "train_runtime": 34463.9725, "train_tokens_per_second": 12193.137 }, { "epoch": 0.8877592243468893, "grad_norm": 0.7161801494945618, "learning_rate": 5.877497704071871e-06, "loss": 0.345694899559021, "num_input_tokens_seen": 420385552, "step": 13185, "train_runtime": 34477.1725, "train_tokens_per_second": 12193.156 }, { "epoch": 0.8880958793428494, "grad_norm": 0.7665959576898872, "learning_rate": 5.874894536786396e-06, "loss": 0.33997349739074706, "num_input_tokens_seen": 420543264, "step": 13190, "train_runtime": 34490.3552, "train_tokens_per_second": 12193.069 }, { "epoch": 0.8884325343388096, "grad_norm": 0.7291767394288539, "learning_rate": 5.8722911248394555e-06, "loss": 0.35655348300933837, "num_input_tokens_seen": 420691600, "step": 13195, "train_runtime": 34503.9133, "train_tokens_per_second": 12192.576 }, { "epoch": 0.8887691893347698, "grad_norm": 0.7936495104352435, "learning_rate": 5.8696874689590824e-06, "loss": 0.34440979957580564, "num_input_tokens_seen": 420847856, "step": 13200, "train_runtime": 34516.8749, "train_tokens_per_second": 12192.525 }, { "epoch": 0.8891058443307299, "grad_norm": 0.8796854926201408, "learning_rate": 5.867083569873383e-06, "loss": 0.3730029106140137, "num_input_tokens_seen": 421008608, "step": 13205, "train_runtime": 34529.909, "train_tokens_per_second": 12192.578 }, { "epoch": 0.8894424993266901, "grad_norm": 0.8482665946134398, "learning_rate": 5.8644794283105255e-06, "loss": 0.36316943168640137, "num_input_tokens_seen": 421168040, "step": 13210, "train_runtime": 34543.413, "train_tokens_per_second": 12192.427 }, { "epoch": 0.8897791543226502, "grad_norm": 0.7923660818371361, "learning_rate": 5.861875044998755e-06, "loss": 0.4084757328033447, "num_input_tokens_seen": 421327608, "step": 13215, "train_runtime": 34556.4132, "train_tokens_per_second": 12192.458 }, { "epoch": 0.8901158093186103, "grad_norm": 0.8396418544847153, "learning_rate": 5.859270420666377e-06, "loss": 0.37616701126098634, "num_input_tokens_seen": 421486288, "step": 13220, "train_runtime": 34568.9584, "train_tokens_per_second": 12192.623 }, { "epoch": 0.8904524643145705, "grad_norm": 0.758085318159808, "learning_rate": 5.856665556041764e-06, "loss": 0.3437247037887573, "num_input_tokens_seen": 421640568, "step": 13225, "train_runtime": 34582.0221, "train_tokens_per_second": 12192.479 }, { "epoch": 0.8907891193105306, "grad_norm": 0.7865276082622846, "learning_rate": 5.8540604518533605e-06, "loss": 0.40551133155822755, "num_input_tokens_seen": 421803496, "step": 13230, "train_runtime": 34595.496, "train_tokens_per_second": 12192.44 }, { "epoch": 0.8911257743064908, "grad_norm": 0.8254416895174947, "learning_rate": 5.851455108829675e-06, "loss": 0.36055431365966795, "num_input_tokens_seen": 421959376, "step": 13235, "train_runtime": 34608.3605, "train_tokens_per_second": 12192.412 }, { "epoch": 0.8914624293024509, "grad_norm": 0.7907894831125426, "learning_rate": 5.848849527699283e-06, "loss": 0.3840185642242432, "num_input_tokens_seen": 422116888, "step": 13240, "train_runtime": 34621.7384, "train_tokens_per_second": 12192.25 }, { "epoch": 0.891799084298411, "grad_norm": 0.8520052004501267, "learning_rate": 5.846243709190827e-06, "loss": 0.3593330383300781, "num_input_tokens_seen": 422277392, "step": 13245, "train_runtime": 34635.1367, "train_tokens_per_second": 12192.168 }, { "epoch": 0.8921357392943712, "grad_norm": 0.8784061305526504, "learning_rate": 5.843637654033019e-06, "loss": 0.38776819705963134, "num_input_tokens_seen": 422432704, "step": 13250, "train_runtime": 34649.1972, "train_tokens_per_second": 12191.702 }, { "epoch": 0.8924723942903313, "grad_norm": 0.7548385463443169, "learning_rate": 5.841031362954629e-06, "loss": 0.39724297523498536, "num_input_tokens_seen": 422593264, "step": 13255, "train_runtime": 34662.2209, "train_tokens_per_second": 12191.754 }, { "epoch": 0.8928090492862915, "grad_norm": 0.741688836475473, "learning_rate": 5.8384248366845e-06, "loss": 0.385623836517334, "num_input_tokens_seen": 422753056, "step": 13260, "train_runtime": 34675.3123, "train_tokens_per_second": 12191.759 }, { "epoch": 0.8931457042822516, "grad_norm": 0.737776550227351, "learning_rate": 5.8358180759515396e-06, "loss": 0.3823493480682373, "num_input_tokens_seen": 422911352, "step": 13265, "train_runtime": 34688.5118, "train_tokens_per_second": 12191.683 }, { "epoch": 0.8934823592782117, "grad_norm": 0.8057927040258587, "learning_rate": 5.833211081484719e-06, "loss": 0.3861107587814331, "num_input_tokens_seen": 423067592, "step": 13270, "train_runtime": 34701.1427, "train_tokens_per_second": 12191.748 }, { "epoch": 0.8938190142741719, "grad_norm": 1.0800560287480332, "learning_rate": 5.830603854013077e-06, "loss": 0.3815847635269165, "num_input_tokens_seen": 423226848, "step": 13275, "train_runtime": 34714.4814, "train_tokens_per_second": 12191.651 }, { "epoch": 0.894155669270132, "grad_norm": 0.8122470031767568, "learning_rate": 5.827996394265716e-06, "loss": 0.3494251251220703, "num_input_tokens_seen": 423383168, "step": 13280, "train_runtime": 34727.742, "train_tokens_per_second": 12191.497 }, { "epoch": 0.8944923242660922, "grad_norm": 0.7649105753596509, "learning_rate": 5.825388702971802e-06, "loss": 0.3518451452255249, "num_input_tokens_seen": 423543040, "step": 13285, "train_runtime": 34741.4488, "train_tokens_per_second": 12191.289 }, { "epoch": 0.8948289792620523, "grad_norm": 2.3009187415826093, "learning_rate": 5.822780780860571e-06, "loss": 0.38631153106689453, "num_input_tokens_seen": 423701712, "step": 13290, "train_runtime": 34754.9864, "train_tokens_per_second": 12191.106 }, { "epoch": 0.8951656342580124, "grad_norm": 0.7778464229800114, "learning_rate": 5.820172628661317e-06, "loss": 0.3693638563156128, "num_input_tokens_seen": 423864912, "step": 13295, "train_runtime": 34767.792, "train_tokens_per_second": 12191.309 }, { "epoch": 0.8955022892539726, "grad_norm": 0.7634265641248088, "learning_rate": 5.8175642471034045e-06, "loss": 0.3683186054229736, "num_input_tokens_seen": 424025016, "step": 13300, "train_runtime": 34780.4805, "train_tokens_per_second": 12191.465 }, { "epoch": 0.8958389442499327, "grad_norm": 0.8892845495152538, "learning_rate": 5.8149556369162565e-06, "loss": 0.3742434740066528, "num_input_tokens_seen": 424178288, "step": 13305, "train_runtime": 34793.1428, "train_tokens_per_second": 12191.434 }, { "epoch": 0.8961755992458929, "grad_norm": 0.8154867999024771, "learning_rate": 5.812346798829361e-06, "loss": 0.39190590381622314, "num_input_tokens_seen": 424338760, "step": 13310, "train_runtime": 34806.1804, "train_tokens_per_second": 12191.477 }, { "epoch": 0.896512254241853, "grad_norm": 0.719550354234362, "learning_rate": 5.809737733572276e-06, "loss": 0.34295594692230225, "num_input_tokens_seen": 424496088, "step": 13315, "train_runtime": 34819.6975, "train_tokens_per_second": 12191.263 }, { "epoch": 0.8968489092378131, "grad_norm": 0.8544400335941631, "learning_rate": 5.8071284418746166e-06, "loss": 0.3649880886077881, "num_input_tokens_seen": 424655168, "step": 13320, "train_runtime": 34832.2818, "train_tokens_per_second": 12191.425 }, { "epoch": 0.8971855642337733, "grad_norm": 0.756172677011678, "learning_rate": 5.80451892446606e-06, "loss": 0.3966256856918335, "num_input_tokens_seen": 424818296, "step": 13325, "train_runtime": 34845.145, "train_tokens_per_second": 12191.607 }, { "epoch": 0.8975222192297334, "grad_norm": 0.7021946840319796, "learning_rate": 5.801909182076354e-06, "loss": 0.3582056999206543, "num_input_tokens_seen": 424977920, "step": 13330, "train_runtime": 34857.789, "train_tokens_per_second": 12191.763 }, { "epoch": 0.8978588742256935, "grad_norm": 0.8159392595911944, "learning_rate": 5.7992992154353e-06, "loss": 0.39885869026184084, "num_input_tokens_seen": 425135944, "step": 13335, "train_runtime": 34870.4793, "train_tokens_per_second": 12191.858 }, { "epoch": 0.8981955292216537, "grad_norm": 0.7767614328805698, "learning_rate": 5.79668902527277e-06, "loss": 0.3844503879547119, "num_input_tokens_seen": 425291464, "step": 13340, "train_runtime": 34883.5049, "train_tokens_per_second": 12191.764 }, { "epoch": 0.8985321842176138, "grad_norm": 6.050973785331642, "learning_rate": 5.794078612318695e-06, "loss": 0.36563012599945066, "num_input_tokens_seen": 425451848, "step": 13345, "train_runtime": 34896.2743, "train_tokens_per_second": 12191.899 }, { "epoch": 0.898868839213574, "grad_norm": 0.7993592315509648, "learning_rate": 5.791467977303068e-06, "loss": 0.36136345863342284, "num_input_tokens_seen": 425603376, "step": 13350, "train_runtime": 34908.7813, "train_tokens_per_second": 12191.872 }, { "epoch": 0.8992054942095341, "grad_norm": 0.9150884954642485, "learning_rate": 5.788857120955945e-06, "loss": 0.38617358207702634, "num_input_tokens_seen": 425760352, "step": 13355, "train_runtime": 34922.0552, "train_tokens_per_second": 12191.732 }, { "epoch": 0.8995421492054942, "grad_norm": 0.7518432041045526, "learning_rate": 5.786246044007443e-06, "loss": 0.34881646633148194, "num_input_tokens_seen": 425918112, "step": 13360, "train_runtime": 34935.6834, "train_tokens_per_second": 12191.492 }, { "epoch": 0.8998788042014544, "grad_norm": 0.7444423272321159, "learning_rate": 5.783634747187743e-06, "loss": 0.3730934143066406, "num_input_tokens_seen": 426078528, "step": 13365, "train_runtime": 34948.2517, "train_tokens_per_second": 12191.698 }, { "epoch": 0.9002154591974145, "grad_norm": 0.79883218900397, "learning_rate": 5.781023231227084e-06, "loss": 0.38190927505493166, "num_input_tokens_seen": 426239664, "step": 13370, "train_runtime": 34962.1191, "train_tokens_per_second": 12191.471 }, { "epoch": 0.9005521141933747, "grad_norm": 0.73227697232891, "learning_rate": 5.778411496855769e-06, "loss": 0.3742210865020752, "num_input_tokens_seen": 426399000, "step": 13375, "train_runtime": 34974.7821, "train_tokens_per_second": 12191.613 }, { "epoch": 0.9008887691893348, "grad_norm": 0.8508150230525733, "learning_rate": 5.775799544804161e-06, "loss": 0.3930072784423828, "num_input_tokens_seen": 426559528, "step": 13380, "train_runtime": 34987.6981, "train_tokens_per_second": 12191.7 }, { "epoch": 0.9012254241852949, "grad_norm": 0.7986874064589201, "learning_rate": 5.7731873758026845e-06, "loss": 0.35907678604125975, "num_input_tokens_seen": 426717488, "step": 13385, "train_runtime": 35000.3757, "train_tokens_per_second": 12191.797 }, { "epoch": 0.9015620791812551, "grad_norm": 0.833203601985892, "learning_rate": 5.770574990581823e-06, "loss": 0.3693462133407593, "num_input_tokens_seen": 426876280, "step": 13390, "train_runtime": 35013.3937, "train_tokens_per_second": 12191.8 }, { "epoch": 0.9018987341772152, "grad_norm": 0.8392835446698765, "learning_rate": 5.767962389872124e-06, "loss": 0.33575925827026365, "num_input_tokens_seen": 427034720, "step": 13395, "train_runtime": 35027.4122, "train_tokens_per_second": 12191.444 }, { "epoch": 0.9022353891731754, "grad_norm": 0.7612415598428929, "learning_rate": 5.765349574404191e-06, "loss": 0.3605826377868652, "num_input_tokens_seen": 427189792, "step": 13400, "train_runtime": 35040.7719, "train_tokens_per_second": 12191.221 }, { "epoch": 0.9025720441691355, "grad_norm": 0.7294017964348306, "learning_rate": 5.7627365449086905e-06, "loss": 0.3711873769760132, "num_input_tokens_seen": 427340544, "step": 13405, "train_runtime": 35054.3118, "train_tokens_per_second": 12190.813 }, { "epoch": 0.9029086991650956, "grad_norm": 0.7903338814651439, "learning_rate": 5.760123302116345e-06, "loss": 0.3938957691192627, "num_input_tokens_seen": 427500888, "step": 13410, "train_runtime": 35067.2002, "train_tokens_per_second": 12190.904 }, { "epoch": 0.9032453541610558, "grad_norm": 0.8750741220457778, "learning_rate": 5.757509846757945e-06, "loss": 0.38195626735687255, "num_input_tokens_seen": 427660128, "step": 13415, "train_runtime": 35079.6346, "train_tokens_per_second": 12191.123 }, { "epoch": 0.9035820091570159, "grad_norm": 0.8513761284518359, "learning_rate": 5.75489617956433e-06, "loss": 0.395311975479126, "num_input_tokens_seen": 427823896, "step": 13420, "train_runtime": 35092.7454, "train_tokens_per_second": 12191.235 }, { "epoch": 0.9039186641529761, "grad_norm": 0.732615221170027, "learning_rate": 5.752282301266406e-06, "loss": 0.3921032905578613, "num_input_tokens_seen": 427983136, "step": 13425, "train_runtime": 35105.3297, "train_tokens_per_second": 12191.401 }, { "epoch": 0.9042553191489362, "grad_norm": 0.7325929552729605, "learning_rate": 5.749668212595136e-06, "loss": 0.3708685636520386, "num_input_tokens_seen": 428140912, "step": 13430, "train_runtime": 35118.702, "train_tokens_per_second": 12191.251 }, { "epoch": 0.9045919741448963, "grad_norm": 0.7955016985373715, "learning_rate": 5.747053914281539e-06, "loss": 0.3694139957427979, "num_input_tokens_seen": 428295448, "step": 13435, "train_runtime": 35131.9078, "train_tokens_per_second": 12191.067 }, { "epoch": 0.9049286291408565, "grad_norm": 0.7558650972837816, "learning_rate": 5.744439407056699e-06, "loss": 0.34850897789001467, "num_input_tokens_seen": 428453056, "step": 13440, "train_runtime": 35145.0095, "train_tokens_per_second": 12191.007 }, { "epoch": 0.9052652841368166, "grad_norm": 0.661957279232183, "learning_rate": 5.741824691651752e-06, "loss": 0.34030466079711913, "num_input_tokens_seen": 428611560, "step": 13445, "train_runtime": 35157.4822, "train_tokens_per_second": 12191.19 }, { "epoch": 0.9056019391327768, "grad_norm": 0.8470233964267815, "learning_rate": 5.739209768797896e-06, "loss": 0.3740764379501343, "num_input_tokens_seen": 428760712, "step": 13450, "train_runtime": 35170.5838, "train_tokens_per_second": 12190.89 }, { "epoch": 0.9059385941287369, "grad_norm": 0.9046747430698882, "learning_rate": 5.736594639226385e-06, "loss": 0.3245997428894043, "num_input_tokens_seen": 428918448, "step": 13455, "train_runtime": 35183.9583, "train_tokens_per_second": 12190.739 }, { "epoch": 0.906275249124697, "grad_norm": 0.786718501154718, "learning_rate": 5.7339793036685306e-06, "loss": 0.37534098625183104, "num_input_tokens_seen": 429081160, "step": 13460, "train_runtime": 35197.0567, "train_tokens_per_second": 12190.825 }, { "epoch": 0.9066119041206572, "grad_norm": 0.7355374187550461, "learning_rate": 5.731363762855706e-06, "loss": 0.3430805683135986, "num_input_tokens_seen": 429237800, "step": 13465, "train_runtime": 35209.989, "train_tokens_per_second": 12190.796 }, { "epoch": 0.9069485591166173, "grad_norm": 0.8179229468010564, "learning_rate": 5.728748017519337e-06, "loss": 0.4214427947998047, "num_input_tokens_seen": 429394720, "step": 13470, "train_runtime": 35223.2317, "train_tokens_per_second": 12190.668 }, { "epoch": 0.9072852141125775, "grad_norm": 0.717317464187995, "learning_rate": 5.726132068390908e-06, "loss": 0.35298852920532225, "num_input_tokens_seen": 429550408, "step": 13475, "train_runtime": 35237.5715, "train_tokens_per_second": 12190.125 }, { "epoch": 0.9076218691085376, "grad_norm": 0.8994482695267444, "learning_rate": 5.723515916201962e-06, "loss": 0.408160924911499, "num_input_tokens_seen": 429710680, "step": 13480, "train_runtime": 35251.0465, "train_tokens_per_second": 12190.012 }, { "epoch": 0.9079585241044977, "grad_norm": 0.7128442602046751, "learning_rate": 5.720899561684098e-06, "loss": 0.3687018871307373, "num_input_tokens_seen": 429868840, "step": 13485, "train_runtime": 35264.3494, "train_tokens_per_second": 12189.899 }, { "epoch": 0.9082951791004579, "grad_norm": 0.771041703269352, "learning_rate": 5.71828300556897e-06, "loss": 0.368972110748291, "num_input_tokens_seen": 430031736, "step": 13490, "train_runtime": 35277.8187, "train_tokens_per_second": 12189.862 }, { "epoch": 0.908631834096418, "grad_norm": 0.6915849834536898, "learning_rate": 5.715666248588289e-06, "loss": 0.35815114974975587, "num_input_tokens_seen": 430191368, "step": 13495, "train_runtime": 35291.0069, "train_tokens_per_second": 12189.83 }, { "epoch": 0.9089684890923782, "grad_norm": 0.8219703743548636, "learning_rate": 5.713049291473825e-06, "loss": 0.410277271270752, "num_input_tokens_seen": 430353792, "step": 13500, "train_runtime": 35304.3287, "train_tokens_per_second": 12189.831 }, { "epoch": 0.9093051440883383, "grad_norm": 0.7533280344436573, "learning_rate": 5.710432134957399e-06, "loss": 0.3380936861038208, "num_input_tokens_seen": 430506472, "step": 13505, "train_runtime": 35317.5565, "train_tokens_per_second": 12189.588 }, { "epoch": 0.9096417990842984, "grad_norm": 0.7271423360840092, "learning_rate": 5.707814779770892e-06, "loss": 0.3381925106048584, "num_input_tokens_seen": 430663480, "step": 13510, "train_runtime": 35331.3323, "train_tokens_per_second": 12189.279 }, { "epoch": 0.9099784540802586, "grad_norm": 0.7494573171412836, "learning_rate": 5.7051972266462395e-06, "loss": 0.35069563388824465, "num_input_tokens_seen": 430820424, "step": 13515, "train_runtime": 35344.1052, "train_tokens_per_second": 12189.315 }, { "epoch": 0.9103151090762187, "grad_norm": 0.8839719491103175, "learning_rate": 5.702579476315431e-06, "loss": 0.3460576057434082, "num_input_tokens_seen": 430980072, "step": 13520, "train_runtime": 35357.5549, "train_tokens_per_second": 12189.193 }, { "epoch": 0.9106517640721788, "grad_norm": 0.9271110943988584, "learning_rate": 5.699961529510513e-06, "loss": 0.35433759689331057, "num_input_tokens_seen": 431136096, "step": 13525, "train_runtime": 35371.3455, "train_tokens_per_second": 12188.852 }, { "epoch": 0.910988419068139, "grad_norm": 0.8580491885781263, "learning_rate": 5.697343386963586e-06, "loss": 0.3892681121826172, "num_input_tokens_seen": 431294640, "step": 13530, "train_runtime": 35383.8313, "train_tokens_per_second": 12189.032 }, { "epoch": 0.9113250740640991, "grad_norm": 0.7241399273882059, "learning_rate": 5.694725049406801e-06, "loss": 0.36517624855041503, "num_input_tokens_seen": 431455288, "step": 13535, "train_runtime": 35397.474, "train_tokens_per_second": 12188.872 }, { "epoch": 0.9116617290600593, "grad_norm": 0.7289588534116486, "learning_rate": 5.692106517572373e-06, "loss": 0.40781345367431643, "num_input_tokens_seen": 431611864, "step": 13540, "train_runtime": 35411.1184, "train_tokens_per_second": 12188.597 }, { "epoch": 0.9119983840560194, "grad_norm": 0.8110702410343946, "learning_rate": 5.689487792192566e-06, "loss": 0.39562430381774905, "num_input_tokens_seen": 431774536, "step": 13545, "train_runtime": 35424.1801, "train_tokens_per_second": 12188.695 }, { "epoch": 0.9123350390519795, "grad_norm": 0.774027019373964, "learning_rate": 5.686868873999696e-06, "loss": 0.3897235870361328, "num_input_tokens_seen": 431936448, "step": 13550, "train_runtime": 35437.3122, "train_tokens_per_second": 12188.747 }, { "epoch": 0.9126716940479397, "grad_norm": 0.740651979537237, "learning_rate": 5.684249763726135e-06, "loss": 0.39835100173950194, "num_input_tokens_seen": 432094168, "step": 13555, "train_runtime": 35450.1126, "train_tokens_per_second": 12188.795 }, { "epoch": 0.9130083490438998, "grad_norm": 0.7282103232114707, "learning_rate": 5.681630462104308e-06, "loss": 0.36507291793823243, "num_input_tokens_seen": 432249800, "step": 13560, "train_runtime": 35463.4428, "train_tokens_per_second": 12188.602 }, { "epoch": 0.91334500403986, "grad_norm": 0.7686449436564229, "learning_rate": 5.679010969866697e-06, "loss": 0.3869205951690674, "num_input_tokens_seen": 432404208, "step": 13565, "train_runtime": 35476.4032, "train_tokens_per_second": 12188.502 }, { "epoch": 0.9136816590358201, "grad_norm": 0.8027550391239413, "learning_rate": 5.676391287745835e-06, "loss": 0.3621238708496094, "num_input_tokens_seen": 432567472, "step": 13570, "train_runtime": 35490.0567, "train_tokens_per_second": 12188.413 }, { "epoch": 0.9140183140317802, "grad_norm": 0.7611785956967995, "learning_rate": 5.673771416474305e-06, "loss": 0.3609843969345093, "num_input_tokens_seen": 432728400, "step": 13575, "train_runtime": 35502.9729, "train_tokens_per_second": 12188.512 }, { "epoch": 0.9143549690277404, "grad_norm": 0.8677035639172358, "learning_rate": 5.671151356784747e-06, "loss": 0.3543481588363647, "num_input_tokens_seen": 432885576, "step": 13580, "train_runtime": 35516.8724, "train_tokens_per_second": 12188.167 }, { "epoch": 0.9146916240237005, "grad_norm": 0.7125369019855851, "learning_rate": 5.668531109409851e-06, "loss": 0.3914100408554077, "num_input_tokens_seen": 433044352, "step": 13585, "train_runtime": 35530.0053, "train_tokens_per_second": 12188.131 }, { "epoch": 0.9150282790196607, "grad_norm": 0.8082639911621977, "learning_rate": 5.665910675082362e-06, "loss": 0.36147136688232423, "num_input_tokens_seen": 433206304, "step": 13590, "train_runtime": 35543.0493, "train_tokens_per_second": 12188.214 }, { "epoch": 0.9153649340156208, "grad_norm": 0.7332669084158943, "learning_rate": 5.663290054535078e-06, "loss": 0.34022817611694334, "num_input_tokens_seen": 433362288, "step": 13595, "train_runtime": 35556.4007, "train_tokens_per_second": 12188.025 }, { "epoch": 0.9157015890115809, "grad_norm": 1.189938791704453, "learning_rate": 5.660669248500846e-06, "loss": 0.42548360824584963, "num_input_tokens_seen": 433520616, "step": 13600, "train_runtime": 35569.0173, "train_tokens_per_second": 12188.153 }, { "epoch": 0.9160382440075411, "grad_norm": 0.7993602089800331, "learning_rate": 5.658048257712563e-06, "loss": 0.360113263130188, "num_input_tokens_seen": 433682056, "step": 13605, "train_runtime": 35581.7367, "train_tokens_per_second": 12188.333 }, { "epoch": 0.9163748990035012, "grad_norm": 0.7627463130965576, "learning_rate": 5.655427082903184e-06, "loss": 0.3676086664199829, "num_input_tokens_seen": 433842048, "step": 13610, "train_runtime": 35595.2357, "train_tokens_per_second": 12188.206 }, { "epoch": 0.9167115539994614, "grad_norm": 0.8487433121029654, "learning_rate": 5.652805724805711e-06, "loss": 0.35324907302856445, "num_input_tokens_seen": 434001544, "step": 13615, "train_runtime": 35608.115, "train_tokens_per_second": 12188.276 }, { "epoch": 0.9170482089954215, "grad_norm": 0.7823794681501385, "learning_rate": 5.650184184153199e-06, "loss": 0.3836455106735229, "num_input_tokens_seen": 434164840, "step": 13620, "train_runtime": 35621.0438, "train_tokens_per_second": 12188.437 }, { "epoch": 0.9173848639913816, "grad_norm": 0.7481177520800324, "learning_rate": 5.647562461678754e-06, "loss": 0.4001375675201416, "num_input_tokens_seen": 434326616, "step": 13625, "train_runtime": 35633.7007, "train_tokens_per_second": 12188.647 }, { "epoch": 0.9177215189873418, "grad_norm": 0.8028197451382855, "learning_rate": 5.64494055811553e-06, "loss": 0.3532702922821045, "num_input_tokens_seen": 434487072, "step": 13630, "train_runtime": 35646.1422, "train_tokens_per_second": 12188.895 }, { "epoch": 0.9180581739833019, "grad_norm": 0.7786459826230611, "learning_rate": 5.642318474196737e-06, "loss": 0.353279709815979, "num_input_tokens_seen": 434647968, "step": 13635, "train_runtime": 35659.2346, "train_tokens_per_second": 12188.931 }, { "epoch": 0.9183948289792621, "grad_norm": 0.7501623544904534, "learning_rate": 5.63969621065563e-06, "loss": 0.3520198345184326, "num_input_tokens_seen": 434805472, "step": 13640, "train_runtime": 35672.5319, "train_tokens_per_second": 12188.803 }, { "epoch": 0.9187314839752222, "grad_norm": 0.6997699725511924, "learning_rate": 5.637073768225517e-06, "loss": 0.3382099151611328, "num_input_tokens_seen": 434964592, "step": 13645, "train_runtime": 35685.812, "train_tokens_per_second": 12188.726 }, { "epoch": 0.9190681389711823, "grad_norm": 0.8305126878904916, "learning_rate": 5.634451147639758e-06, "loss": 0.3398799657821655, "num_input_tokens_seen": 435119368, "step": 13650, "train_runtime": 35698.9502, "train_tokens_per_second": 12188.576 }, { "epoch": 0.9194047939671425, "grad_norm": 0.7218866910068225, "learning_rate": 5.631828349631757e-06, "loss": 0.33959915637969973, "num_input_tokens_seen": 435277080, "step": 13655, "train_runtime": 35711.6912, "train_tokens_per_second": 12188.644 }, { "epoch": 0.9197414489631026, "grad_norm": 0.9045107922970621, "learning_rate": 5.629205374934974e-06, "loss": 0.3553279161453247, "num_input_tokens_seen": 435437208, "step": 13660, "train_runtime": 35726.7389, "train_tokens_per_second": 12187.992 }, { "epoch": 0.9200781039590628, "grad_norm": 0.7403388418217152, "learning_rate": 5.626582224282913e-06, "loss": 0.3548685789108276, "num_input_tokens_seen": 435599272, "step": 13665, "train_runtime": 35740.0237, "train_tokens_per_second": 12187.996 }, { "epoch": 0.9204147589550229, "grad_norm": 0.7582255009938885, "learning_rate": 5.623958898409132e-06, "loss": 0.3900468826293945, "num_input_tokens_seen": 435759224, "step": 13670, "train_runtime": 35753.5795, "train_tokens_per_second": 12187.849 }, { "epoch": 0.920751413950983, "grad_norm": 0.7343918306482689, "learning_rate": 5.621335398047234e-06, "loss": 0.3853520154953003, "num_input_tokens_seen": 435919368, "step": 13675, "train_runtime": 35766.9338, "train_tokens_per_second": 12187.776 }, { "epoch": 0.9210880689469432, "grad_norm": 0.8284130013815835, "learning_rate": 5.618711723930874e-06, "loss": 0.3782789707183838, "num_input_tokens_seen": 436075592, "step": 13680, "train_runtime": 35780.1438, "train_tokens_per_second": 12187.642 }, { "epoch": 0.9214247239429033, "grad_norm": 0.7510678690702973, "learning_rate": 5.616087876793753e-06, "loss": 0.37306177616119385, "num_input_tokens_seen": 436236768, "step": 13685, "train_runtime": 35793.2417, "train_tokens_per_second": 12187.685 }, { "epoch": 0.9217613789388635, "grad_norm": 0.7455238631733695, "learning_rate": 5.613463857369621e-06, "loss": 0.38380353450775145, "num_input_tokens_seen": 436400208, "step": 13690, "train_runtime": 35806.3473, "train_tokens_per_second": 12187.789 }, { "epoch": 0.9220980339348236, "grad_norm": 0.7926070300483002, "learning_rate": 5.610839666392278e-06, "loss": 0.360155987739563, "num_input_tokens_seen": 436562384, "step": 13695, "train_runtime": 35819.5642, "train_tokens_per_second": 12187.82 }, { "epoch": 0.9224346889307837, "grad_norm": 0.7945456937110481, "learning_rate": 5.608215304595571e-06, "loss": 0.3858468532562256, "num_input_tokens_seen": 436724472, "step": 13700, "train_runtime": 35832.7907, "train_tokens_per_second": 12187.844 }, { "epoch": 0.9227713439267439, "grad_norm": 0.7245062158291434, "learning_rate": 5.605590772713393e-06, "loss": 0.35793142318725585, "num_input_tokens_seen": 436881528, "step": 13705, "train_runtime": 35846.7912, "train_tokens_per_second": 12187.465 }, { "epoch": 0.923107998922704, "grad_norm": 0.7954866085668164, "learning_rate": 5.602966071479687e-06, "loss": 0.37648849487304686, "num_input_tokens_seen": 437037280, "step": 13710, "train_runtime": 35860.1152, "train_tokens_per_second": 12187.28 }, { "epoch": 0.9234446539186641, "grad_norm": 0.6873798437968969, "learning_rate": 5.600341201628439e-06, "loss": 0.3618522882461548, "num_input_tokens_seen": 437199080, "step": 13715, "train_runtime": 35873.596, "train_tokens_per_second": 12187.211 }, { "epoch": 0.9237813089146243, "grad_norm": 0.7155045224900212, "learning_rate": 5.597716163893692e-06, "loss": 0.3160524368286133, "num_input_tokens_seen": 437361216, "step": 13720, "train_runtime": 35886.2012, "train_tokens_per_second": 12187.448 }, { "epoch": 0.9241179639105844, "grad_norm": 0.8178363046279644, "learning_rate": 5.595090959009525e-06, "loss": 0.3420442581176758, "num_input_tokens_seen": 437521968, "step": 13725, "train_runtime": 35898.9889, "train_tokens_per_second": 12187.585 }, { "epoch": 0.9244546189065446, "grad_norm": 0.7183387031247779, "learning_rate": 5.592465587710068e-06, "loss": 0.33625240325927735, "num_input_tokens_seen": 437683384, "step": 13730, "train_runtime": 35911.468, "train_tokens_per_second": 12187.844 }, { "epoch": 0.9247912739025047, "grad_norm": 0.7219246101906679, "learning_rate": 5.589840050729498e-06, "loss": 0.3400043725967407, "num_input_tokens_seen": 437843760, "step": 13735, "train_runtime": 35924.6045, "train_tokens_per_second": 12187.852 }, { "epoch": 0.9251279288984648, "grad_norm": 0.8497876871994456, "learning_rate": 5.587214348802039e-06, "loss": 0.4082938194274902, "num_input_tokens_seen": 438002784, "step": 13740, "train_runtime": 35937.5558, "train_tokens_per_second": 12187.885 }, { "epoch": 0.925464583894425, "grad_norm": 0.745585340686398, "learning_rate": 5.5845884826619615e-06, "loss": 0.3598623752593994, "num_input_tokens_seen": 438163264, "step": 13745, "train_runtime": 35951.213, "train_tokens_per_second": 12187.719 }, { "epoch": 0.9258012388903851, "grad_norm": 1.2043469270837208, "learning_rate": 5.5819624530435775e-06, "loss": 0.3688164234161377, "num_input_tokens_seen": 438323856, "step": 13750, "train_runtime": 35964.1505, "train_tokens_per_second": 12187.8 }, { "epoch": 0.9261378938863453, "grad_norm": 0.7585430791296551, "learning_rate": 5.57933626068125e-06, "loss": 0.40395293235778806, "num_input_tokens_seen": 438485320, "step": 13755, "train_runtime": 35977.0602, "train_tokens_per_second": 12187.914 }, { "epoch": 0.9264745488823054, "grad_norm": 0.7982525057780485, "learning_rate": 5.5767099063093835e-06, "loss": 0.37363805770874026, "num_input_tokens_seen": 438644152, "step": 13760, "train_runtime": 35989.6404, "train_tokens_per_second": 12188.067 }, { "epoch": 0.9268112038782655, "grad_norm": 1.0198431554371141, "learning_rate": 5.574083390662431e-06, "loss": 0.38454232215881345, "num_input_tokens_seen": 438805168, "step": 13765, "train_runtime": 36002.5293, "train_tokens_per_second": 12188.176 }, { "epoch": 0.9271478588742257, "grad_norm": 0.8058498846239168, "learning_rate": 5.57145671447489e-06, "loss": 0.3844372510910034, "num_input_tokens_seen": 438958120, "step": 13770, "train_runtime": 36015.496, "train_tokens_per_second": 12188.035 }, { "epoch": 0.9274845138701858, "grad_norm": 0.8573202254881467, "learning_rate": 5.5688298784813e-06, "loss": 0.3866144895553589, "num_input_tokens_seen": 439117688, "step": 13775, "train_runtime": 36029.6355, "train_tokens_per_second": 12187.681 }, { "epoch": 0.927821168866146, "grad_norm": 0.7556113281045054, "learning_rate": 5.566202883416249e-06, "loss": 0.4027858734130859, "num_input_tokens_seen": 439279152, "step": 13780, "train_runtime": 36042.0966, "train_tokens_per_second": 12187.947 }, { "epoch": 0.9281578238621061, "grad_norm": 0.8969969329826353, "learning_rate": 5.563575730014366e-06, "loss": 0.40751848220825193, "num_input_tokens_seen": 439434992, "step": 13785, "train_runtime": 36055.4626, "train_tokens_per_second": 12187.751 }, { "epoch": 0.9284944788580662, "grad_norm": 0.7953107672749814, "learning_rate": 5.560948419010328e-06, "loss": 0.3921651363372803, "num_input_tokens_seen": 439598688, "step": 13790, "train_runtime": 36068.5069, "train_tokens_per_second": 12187.881 }, { "epoch": 0.9288311338540264, "grad_norm": 0.7318609376027997, "learning_rate": 5.558320951138853e-06, "loss": 0.3627305507659912, "num_input_tokens_seen": 439761200, "step": 13795, "train_runtime": 36081.8154, "train_tokens_per_second": 12187.89 }, { "epoch": 0.9291677888499865, "grad_norm": 0.7543206884172933, "learning_rate": 5.5556933271347046e-06, "loss": 0.3809455394744873, "num_input_tokens_seen": 439921784, "step": 13800, "train_runtime": 36094.6929, "train_tokens_per_second": 12187.991 }, { "epoch": 0.9295044438459467, "grad_norm": 0.7249638777934448, "learning_rate": 5.55306554773269e-06, "loss": 0.3896027088165283, "num_input_tokens_seen": 440079400, "step": 13805, "train_runtime": 36107.5854, "train_tokens_per_second": 12188.004 }, { "epoch": 0.9298410988419068, "grad_norm": 0.8577222631813816, "learning_rate": 5.550437613667658e-06, "loss": 0.3538863182067871, "num_input_tokens_seen": 440233488, "step": 13810, "train_runtime": 36121.4544, "train_tokens_per_second": 12187.59 }, { "epoch": 0.9301777538378669, "grad_norm": 0.7679644627129287, "learning_rate": 5.547809525674501e-06, "loss": 0.3617534160614014, "num_input_tokens_seen": 440389392, "step": 13815, "train_runtime": 36134.7055, "train_tokens_per_second": 12187.435 }, { "epoch": 0.9305144088338271, "grad_norm": 1.1484592077230544, "learning_rate": 5.545181284488159e-06, "loss": 0.3943178176879883, "num_input_tokens_seen": 440552216, "step": 13820, "train_runtime": 36147.4655, "train_tokens_per_second": 12187.638 }, { "epoch": 0.9308510638297872, "grad_norm": 0.8318210445063801, "learning_rate": 5.5425528908436085e-06, "loss": 0.37734689712524416, "num_input_tokens_seen": 440710096, "step": 13825, "train_runtime": 36161.2689, "train_tokens_per_second": 12187.352 }, { "epoch": 0.9311877188257474, "grad_norm": 0.8153835492590567, "learning_rate": 5.539924345475873e-06, "loss": 0.38255393505096436, "num_input_tokens_seen": 440863472, "step": 13830, "train_runtime": 36174.7345, "train_tokens_per_second": 12187.055 }, { "epoch": 0.9315243738217075, "grad_norm": 0.8290801093520833, "learning_rate": 5.5372956491200145e-06, "loss": 0.3836904764175415, "num_input_tokens_seen": 441017848, "step": 13835, "train_runtime": 36187.5446, "train_tokens_per_second": 12187.007 }, { "epoch": 0.9318610288176676, "grad_norm": 0.7545905605006498, "learning_rate": 5.534666802511143e-06, "loss": 0.36342949867248536, "num_input_tokens_seen": 441172752, "step": 13840, "train_runtime": 36200.7846, "train_tokens_per_second": 12186.828 }, { "epoch": 0.9321976838136278, "grad_norm": 0.9370753732456154, "learning_rate": 5.532037806384404e-06, "loss": 0.3723859071731567, "num_input_tokens_seen": 441333832, "step": 13845, "train_runtime": 36213.9333, "train_tokens_per_second": 12186.852 }, { "epoch": 0.9325343388095879, "grad_norm": 0.7693952993648859, "learning_rate": 5.529408661474989e-06, "loss": 0.35491232872009276, "num_input_tokens_seen": 441485480, "step": 13850, "train_runtime": 36226.7617, "train_tokens_per_second": 12186.722 }, { "epoch": 0.932870993805548, "grad_norm": 0.7914960218939375, "learning_rate": 5.526779368518129e-06, "loss": 0.404754114151001, "num_input_tokens_seen": 441647440, "step": 13855, "train_runtime": 36239.3257, "train_tokens_per_second": 12186.966 }, { "epoch": 0.9332076488015082, "grad_norm": 0.8928356628841586, "learning_rate": 5.5241499282491e-06, "loss": 0.37383761405944826, "num_input_tokens_seen": 441803144, "step": 13860, "train_runtime": 36253.1819, "train_tokens_per_second": 12186.603 }, { "epoch": 0.9335443037974683, "grad_norm": 0.7142641768444611, "learning_rate": 5.5215203414032135e-06, "loss": 0.35165064334869384, "num_input_tokens_seen": 441966280, "step": 13865, "train_runtime": 36265.9786, "train_tokens_per_second": 12186.801 }, { "epoch": 0.9338809587934285, "grad_norm": 0.7606356934359481, "learning_rate": 5.518890608715828e-06, "loss": 0.36032867431640625, "num_input_tokens_seen": 442126040, "step": 13870, "train_runtime": 36279.1756, "train_tokens_per_second": 12186.772 }, { "epoch": 0.9342176137893886, "grad_norm": 0.9170878942581523, "learning_rate": 5.516260730922337e-06, "loss": 0.39864609241485593, "num_input_tokens_seen": 442280072, "step": 13875, "train_runtime": 36292.3268, "train_tokens_per_second": 12186.6 }, { "epoch": 0.9345542687853488, "grad_norm": 0.7759815527790396, "learning_rate": 5.51363070875818e-06, "loss": 0.3764288663864136, "num_input_tokens_seen": 442438424, "step": 13880, "train_runtime": 36305.5866, "train_tokens_per_second": 12186.511 }, { "epoch": 0.9348909237813089, "grad_norm": 0.7103101909517316, "learning_rate": 5.511000542958832e-06, "loss": 0.39668152332305906, "num_input_tokens_seen": 442596432, "step": 13885, "train_runtime": 36319.6998, "train_tokens_per_second": 12186.126 }, { "epoch": 0.935227578777269, "grad_norm": 0.8891080198861476, "learning_rate": 5.508370234259812e-06, "loss": 0.3612593412399292, "num_input_tokens_seen": 442754888, "step": 13890, "train_runtime": 36332.166, "train_tokens_per_second": 12186.306 }, { "epoch": 0.9355642337732292, "grad_norm": 0.7746743052198768, "learning_rate": 5.505739783396678e-06, "loss": 0.4050482749938965, "num_input_tokens_seen": 442913432, "step": 13895, "train_runtime": 36345.2963, "train_tokens_per_second": 12186.266 }, { "epoch": 0.9359008887691893, "grad_norm": 0.7806922017303211, "learning_rate": 5.503109191105026e-06, "loss": 0.36899418830871583, "num_input_tokens_seen": 443068464, "step": 13900, "train_runtime": 36358.7129, "train_tokens_per_second": 12186.033 }, { "epoch": 0.9362375437651494, "grad_norm": 0.7668651109460208, "learning_rate": 5.500478458120493e-06, "loss": 0.4057442665100098, "num_input_tokens_seen": 443227784, "step": 13905, "train_runtime": 36371.4379, "train_tokens_per_second": 12186.15 }, { "epoch": 0.9365741987611096, "grad_norm": 0.7440293900675143, "learning_rate": 5.497847585178754e-06, "loss": 0.3907855272293091, "num_input_tokens_seen": 443387080, "step": 13910, "train_runtime": 36384.4614, "train_tokens_per_second": 12186.166 }, { "epoch": 0.9369108537570697, "grad_norm": 0.7255660960702708, "learning_rate": 5.495216573015526e-06, "loss": 0.3533169746398926, "num_input_tokens_seen": 443544512, "step": 13915, "train_runtime": 36397.2578, "train_tokens_per_second": 12186.207 }, { "epoch": 0.9372475087530299, "grad_norm": 0.7382644356718363, "learning_rate": 5.492585422366562e-06, "loss": 0.3474785089492798, "num_input_tokens_seen": 443704008, "step": 13920, "train_runtime": 36409.9181, "train_tokens_per_second": 12186.35 }, { "epoch": 0.93758416374899, "grad_norm": 0.7005126443786297, "learning_rate": 5.489954133967657e-06, "loss": 0.3417153835296631, "num_input_tokens_seen": 443858624, "step": 13925, "train_runtime": 36422.5608, "train_tokens_per_second": 12186.365 }, { "epoch": 0.9379208187449501, "grad_norm": 0.7610057894605636, "learning_rate": 5.48732270855464e-06, "loss": 0.3548431873321533, "num_input_tokens_seen": 444022416, "step": 13930, "train_runtime": 36435.6483, "train_tokens_per_second": 12186.483 }, { "epoch": 0.9382574737409103, "grad_norm": 0.76856369287446, "learning_rate": 5.48469114686338e-06, "loss": 0.3636350393295288, "num_input_tokens_seen": 444176648, "step": 13935, "train_runtime": 36448.5689, "train_tokens_per_second": 12186.395 }, { "epoch": 0.9385941287368704, "grad_norm": 0.7710704926418497, "learning_rate": 5.482059449629788e-06, "loss": 0.35806918144226074, "num_input_tokens_seen": 444337888, "step": 13940, "train_runtime": 36461.0497, "train_tokens_per_second": 12186.646 }, { "epoch": 0.9389307837328306, "grad_norm": 0.7246643438859957, "learning_rate": 5.479427617589808e-06, "loss": 0.3702289581298828, "num_input_tokens_seen": 444497160, "step": 13945, "train_runtime": 36473.9183, "train_tokens_per_second": 12186.713 }, { "epoch": 0.9392674387287907, "grad_norm": 0.7112055160792288, "learning_rate": 5.4767956514794226e-06, "loss": 0.38546218872070315, "num_input_tokens_seen": 444657920, "step": 13950, "train_runtime": 36486.3546, "train_tokens_per_second": 12186.965 }, { "epoch": 0.9396040937247508, "grad_norm": 0.8755228518876836, "learning_rate": 5.474163552034655e-06, "loss": 0.36105003356933596, "num_input_tokens_seen": 444811744, "step": 13955, "train_runtime": 36499.4943, "train_tokens_per_second": 12186.792 }, { "epoch": 0.939940748720711, "grad_norm": 0.7641643222459481, "learning_rate": 5.4715313199915595e-06, "loss": 0.3539999485015869, "num_input_tokens_seen": 444967144, "step": 13960, "train_runtime": 36513.6935, "train_tokens_per_second": 12186.309 }, { "epoch": 0.9402774037166711, "grad_norm": 0.8671036623458517, "learning_rate": 5.468898956086236e-06, "loss": 0.37435474395751955, "num_input_tokens_seen": 445127160, "step": 13965, "train_runtime": 36526.4978, "train_tokens_per_second": 12186.418 }, { "epoch": 0.9406140587126313, "grad_norm": 0.7977875793230513, "learning_rate": 5.466266461054815e-06, "loss": 0.3693050146102905, "num_input_tokens_seen": 445289696, "step": 13970, "train_runtime": 36538.9516, "train_tokens_per_second": 12186.712 }, { "epoch": 0.9409507137085914, "grad_norm": 0.7499401867807944, "learning_rate": 5.463633835633464e-06, "loss": 0.391118597984314, "num_input_tokens_seen": 445452896, "step": 13975, "train_runtime": 36551.7812, "train_tokens_per_second": 12186.9 }, { "epoch": 0.9412873687045515, "grad_norm": 0.7362568406494412, "learning_rate": 5.46100108055839e-06, "loss": 0.37929835319519045, "num_input_tokens_seen": 445613848, "step": 13980, "train_runtime": 36564.6549, "train_tokens_per_second": 12187.011 }, { "epoch": 0.9416240237005117, "grad_norm": 0.8221134354682008, "learning_rate": 5.458368196565833e-06, "loss": 0.3321723222732544, "num_input_tokens_seen": 445775584, "step": 13985, "train_runtime": 36577.6663, "train_tokens_per_second": 12187.097 }, { "epoch": 0.9419606786964718, "grad_norm": 0.8558306169627611, "learning_rate": 5.455735184392073e-06, "loss": 0.38138484954833984, "num_input_tokens_seen": 445939096, "step": 13990, "train_runtime": 36590.0973, "train_tokens_per_second": 12187.426 }, { "epoch": 0.942297333692432, "grad_norm": 0.8116076487236336, "learning_rate": 5.4531020447734204e-06, "loss": 0.38126182556152344, "num_input_tokens_seen": 446096856, "step": 13995, "train_runtime": 36603.1819, "train_tokens_per_second": 12187.379 }, { "epoch": 0.9426339886883921, "grad_norm": 2.010805132193222, "learning_rate": 5.450468778446226e-06, "loss": 0.37644472122192385, "num_input_tokens_seen": 446260696, "step": 14000, "train_runtime": 36615.6118, "train_tokens_per_second": 12187.717 }, { "epoch": 0.9429706436843522, "grad_norm": 0.8343198443956905, "learning_rate": 5.447835386146875e-06, "loss": 0.3727182626724243, "num_input_tokens_seen": 446423848, "step": 14005, "train_runtime": 36628.4716, "train_tokens_per_second": 12187.892 }, { "epoch": 0.9433072986803124, "grad_norm": 0.7317344712550558, "learning_rate": 5.445201868611784e-06, "loss": 0.4103872776031494, "num_input_tokens_seen": 446584104, "step": 14010, "train_runtime": 36641.9557, "train_tokens_per_second": 12187.78 }, { "epoch": 0.9436439536762725, "grad_norm": 0.7317534250849597, "learning_rate": 5.442568226577413e-06, "loss": 0.3761645555496216, "num_input_tokens_seen": 446745576, "step": 14015, "train_runtime": 36654.9035, "train_tokens_per_second": 12187.88 }, { "epoch": 0.9439806086722327, "grad_norm": 0.7354748681825876, "learning_rate": 5.439934460780247e-06, "loss": 0.34859304428100585, "num_input_tokens_seen": 446905720, "step": 14020, "train_runtime": 36667.7324, "train_tokens_per_second": 12187.984 }, { "epoch": 0.9443172636681928, "grad_norm": 0.6699010344372787, "learning_rate": 5.437300571956813e-06, "loss": 0.3796972751617432, "num_input_tokens_seen": 447059320, "step": 14025, "train_runtime": 36680.4761, "train_tokens_per_second": 12187.937 }, { "epoch": 0.9446539186641529, "grad_norm": 0.7416459126571048, "learning_rate": 5.434666560843667e-06, "loss": 0.35377705097198486, "num_input_tokens_seen": 447213656, "step": 14030, "train_runtime": 36693.1772, "train_tokens_per_second": 12187.924 }, { "epoch": 0.9449905736601131, "grad_norm": 0.7297523647373726, "learning_rate": 5.432032428177405e-06, "loss": 0.38315491676330565, "num_input_tokens_seen": 447376432, "step": 14035, "train_runtime": 36705.9213, "train_tokens_per_second": 12188.127 }, { "epoch": 0.9453272286560732, "grad_norm": 0.82855793269814, "learning_rate": 5.429398174694651e-06, "loss": 0.34437713623046873, "num_input_tokens_seen": 447539112, "step": 14040, "train_runtime": 36718.6177, "train_tokens_per_second": 12188.343 }, { "epoch": 0.9456638836520334, "grad_norm": 0.7225058758957088, "learning_rate": 5.426763801132067e-06, "loss": 0.3724466562271118, "num_input_tokens_seen": 447689232, "step": 14045, "train_runtime": 36732.1853, "train_tokens_per_second": 12187.928 }, { "epoch": 0.9460005386479935, "grad_norm": 0.8120492077889117, "learning_rate": 5.424129308226347e-06, "loss": 0.3902392864227295, "num_input_tokens_seen": 447843968, "step": 14050, "train_runtime": 36744.8917, "train_tokens_per_second": 12187.925 }, { "epoch": 0.9463371936439536, "grad_norm": 0.77097565782903, "learning_rate": 5.421494696714219e-06, "loss": 0.4099125862121582, "num_input_tokens_seen": 448007808, "step": 14055, "train_runtime": 36757.3229, "train_tokens_per_second": 12188.26 }, { "epoch": 0.9466738486399138, "grad_norm": 0.7053564537083229, "learning_rate": 5.418859967332442e-06, "loss": 0.35971038341522216, "num_input_tokens_seen": 448169648, "step": 14060, "train_runtime": 36769.859, "train_tokens_per_second": 12188.506 }, { "epoch": 0.9470105036358739, "grad_norm": 0.8779938524669136, "learning_rate": 5.416225120817811e-06, "loss": 0.38056182861328125, "num_input_tokens_seen": 448319600, "step": 14065, "train_runtime": 36783.4362, "train_tokens_per_second": 12188.084 }, { "epoch": 0.947347158631834, "grad_norm": 0.8294238448858673, "learning_rate": 5.413590157907153e-06, "loss": 0.3597753047943115, "num_input_tokens_seen": 448483440, "step": 14070, "train_runtime": 36795.8644, "train_tokens_per_second": 12188.42 }, { "epoch": 0.9476838136277942, "grad_norm": 0.7471990852830855, "learning_rate": 5.4109550793373255e-06, "loss": 0.3628887414932251, "num_input_tokens_seen": 448644736, "step": 14075, "train_runtime": 36808.3291, "train_tokens_per_second": 12188.674 }, { "epoch": 0.9480204686237543, "grad_norm": 0.8181142574573709, "learning_rate": 5.40831988584522e-06, "loss": 0.39128866195678713, "num_input_tokens_seen": 448804280, "step": 14080, "train_runtime": 36821.1039, "train_tokens_per_second": 12188.779 }, { "epoch": 0.9483571236197145, "grad_norm": 0.7581642721164937, "learning_rate": 5.40568457816776e-06, "loss": 0.381651496887207, "num_input_tokens_seen": 448967728, "step": 14085, "train_runtime": 36834.1092, "train_tokens_per_second": 12188.912 }, { "epoch": 0.9486937786156746, "grad_norm": 0.7008786642035699, "learning_rate": 5.403049157041903e-06, "loss": 0.36566188335418703, "num_input_tokens_seen": 449127152, "step": 14090, "train_runtime": 36846.916, "train_tokens_per_second": 12189.003 }, { "epoch": 0.9490304336116347, "grad_norm": 0.8712206615664322, "learning_rate": 5.400413623204635e-06, "loss": 0.3482259750366211, "num_input_tokens_seen": 449288008, "step": 14095, "train_runtime": 36860.673, "train_tokens_per_second": 12188.817 }, { "epoch": 0.9493670886075949, "grad_norm": 0.8470507877600656, "learning_rate": 5.397777977392973e-06, "loss": 0.4060727596282959, "num_input_tokens_seen": 449450856, "step": 14100, "train_runtime": 36874.7797, "train_tokens_per_second": 12188.571 }, { "epoch": 0.949703743603555, "grad_norm": 0.7607946082993723, "learning_rate": 5.395142220343967e-06, "loss": 0.37915027141571045, "num_input_tokens_seen": 449612920, "step": 14105, "train_runtime": 36888.0555, "train_tokens_per_second": 12188.577 }, { "epoch": 0.9500403985995152, "grad_norm": 0.7446290397140839, "learning_rate": 5.3925063527947e-06, "loss": 0.3664482355117798, "num_input_tokens_seen": 449775456, "step": 14110, "train_runtime": 36902.7499, "train_tokens_per_second": 12188.128 }, { "epoch": 0.9503770535954753, "grad_norm": 0.7709488654203768, "learning_rate": 5.389870375482283e-06, "loss": 0.40068492889404295, "num_input_tokens_seen": 449932416, "step": 14115, "train_runtime": 36916.7268, "train_tokens_per_second": 12187.766 }, { "epoch": 0.9507137085914354, "grad_norm": 0.9440710909792275, "learning_rate": 5.387234289143859e-06, "loss": 0.35057199001312256, "num_input_tokens_seen": 450089272, "step": 14120, "train_runtime": 36930.1936, "train_tokens_per_second": 12187.569 }, { "epoch": 0.9510503635873956, "grad_norm": 0.7244910811376039, "learning_rate": 5.384598094516601e-06, "loss": 0.3898542642593384, "num_input_tokens_seen": 450252216, "step": 14125, "train_runtime": 36943.6998, "train_tokens_per_second": 12187.524 }, { "epoch": 0.9513870185833557, "grad_norm": 0.7296658717889744, "learning_rate": 5.381961792337712e-06, "loss": 0.3796407461166382, "num_input_tokens_seen": 450414720, "step": 14130, "train_runtime": 36956.3757, "train_tokens_per_second": 12187.741 }, { "epoch": 0.9517236735793159, "grad_norm": 0.7183164253815125, "learning_rate": 5.3793253833444245e-06, "loss": 0.3474994897842407, "num_input_tokens_seen": 450573848, "step": 14135, "train_runtime": 36969.0658, "train_tokens_per_second": 12187.861 }, { "epoch": 0.952060328575276, "grad_norm": 0.6884243012361292, "learning_rate": 5.3766888682740045e-06, "loss": 0.3536869525909424, "num_input_tokens_seen": 450734904, "step": 14140, "train_runtime": 36982.3916, "train_tokens_per_second": 12187.825 }, { "epoch": 0.9523969835712361, "grad_norm": 0.8188414535712991, "learning_rate": 5.374052247863745e-06, "loss": 0.37145175933837893, "num_input_tokens_seen": 450891392, "step": 14145, "train_runtime": 36995.6293, "train_tokens_per_second": 12187.694 }, { "epoch": 0.9527336385671963, "grad_norm": 0.767305436419478, "learning_rate": 5.371415522850966e-06, "loss": 0.37569870948791506, "num_input_tokens_seen": 451049032, "step": 14150, "train_runtime": 37008.8009, "train_tokens_per_second": 12187.615 }, { "epoch": 0.9530702935631564, "grad_norm": 0.9797885723961564, "learning_rate": 5.368778693973019e-06, "loss": 0.3529491901397705, "num_input_tokens_seen": 451206776, "step": 14155, "train_runtime": 37021.8381, "train_tokens_per_second": 12187.584 }, { "epoch": 0.9534069485591166, "grad_norm": 0.7335182006097138, "learning_rate": 5.366141761967287e-06, "loss": 0.38477230072021484, "num_input_tokens_seen": 451364320, "step": 14160, "train_runtime": 37034.3662, "train_tokens_per_second": 12187.716 }, { "epoch": 0.9537436035550767, "grad_norm": 0.8292175762414618, "learning_rate": 5.363504727571179e-06, "loss": 0.38037211894989015, "num_input_tokens_seen": 451523952, "step": 14165, "train_runtime": 37047.701, "train_tokens_per_second": 12187.638 }, { "epoch": 0.954080258551037, "grad_norm": 0.8744536988474335, "learning_rate": 5.360867591522133e-06, "loss": 0.42474966049194335, "num_input_tokens_seen": 451687792, "step": 14170, "train_runtime": 37060.1278, "train_tokens_per_second": 12187.972 }, { "epoch": 0.9544169135469971, "grad_norm": 0.7647512759883638, "learning_rate": 5.358230354557617e-06, "loss": 0.34644064903259275, "num_input_tokens_seen": 451848696, "step": 14175, "train_runtime": 37073.6017, "train_tokens_per_second": 12187.882 }, { "epoch": 0.9547535685429572, "grad_norm": 0.809870693160124, "learning_rate": 5.355593017415123e-06, "loss": 0.4143869400024414, "num_input_tokens_seen": 452009784, "step": 14180, "train_runtime": 37086.5086, "train_tokens_per_second": 12187.984 }, { "epoch": 0.9550902235389174, "grad_norm": 0.7491096506251071, "learning_rate": 5.352955580832176e-06, "loss": 0.3671841859817505, "num_input_tokens_seen": 452173624, "step": 14185, "train_runtime": 37098.9293, "train_tokens_per_second": 12188.32 }, { "epoch": 0.9554268785348775, "grad_norm": 0.7185791041884471, "learning_rate": 5.350318045546326e-06, "loss": 0.36811280250549316, "num_input_tokens_seen": 452332592, "step": 14190, "train_runtime": 37111.5189, "train_tokens_per_second": 12188.469 }, { "epoch": 0.9557635335308377, "grad_norm": 0.78134114785335, "learning_rate": 5.347680412295152e-06, "loss": 0.3897176027297974, "num_input_tokens_seen": 452492584, "step": 14195, "train_runtime": 37124.9231, "train_tokens_per_second": 12188.378 }, { "epoch": 0.9561001885267978, "grad_norm": 0.886941867472269, "learning_rate": 5.34504268181626e-06, "loss": 0.3777491807937622, "num_input_tokens_seen": 452650872, "step": 14200, "train_runtime": 37138.1786, "train_tokens_per_second": 12188.289 }, { "epoch": 0.9564368435227579, "grad_norm": 0.936749729452858, "learning_rate": 5.342404854847282e-06, "loss": 0.3859711170196533, "num_input_tokens_seen": 452804328, "step": 14205, "train_runtime": 37151.5339, "train_tokens_per_second": 12188.039 }, { "epoch": 0.9567734985187181, "grad_norm": 0.6951983340438338, "learning_rate": 5.3397669321258776e-06, "loss": 0.3589979648590088, "num_input_tokens_seen": 452966984, "step": 14210, "train_runtime": 37164.2394, "train_tokens_per_second": 12188.248 }, { "epoch": 0.9571101535146782, "grad_norm": 0.7434936287166044, "learning_rate": 5.337128914389734e-06, "loss": 0.40025577545166013, "num_input_tokens_seen": 453128488, "step": 14215, "train_runtime": 37177.0684, "train_tokens_per_second": 12188.387 }, { "epoch": 0.9574468085106383, "grad_norm": 0.764591281125932, "learning_rate": 5.334490802376565e-06, "loss": 0.373136305809021, "num_input_tokens_seen": 453291728, "step": 14220, "train_runtime": 37189.525, "train_tokens_per_second": 12188.694 }, { "epoch": 0.9577834635065985, "grad_norm": 1.2439273878082822, "learning_rate": 5.33185259682411e-06, "loss": 0.3976832628250122, "num_input_tokens_seen": 453444056, "step": 14225, "train_runtime": 37202.2116, "train_tokens_per_second": 12188.632 }, { "epoch": 0.9581201185025586, "grad_norm": 0.7540906865696856, "learning_rate": 5.329214298470134e-06, "loss": 0.39126389026641845, "num_input_tokens_seen": 453604512, "step": 14230, "train_runtime": 37215.6913, "train_tokens_per_second": 12188.528 }, { "epoch": 0.9584567734985188, "grad_norm": 0.7417173621803747, "learning_rate": 5.326575908052428e-06, "loss": 0.3592424154281616, "num_input_tokens_seen": 453767328, "step": 14235, "train_runtime": 37228.3566, "train_tokens_per_second": 12188.755 }, { "epoch": 0.9587934284944789, "grad_norm": 1.112988824368141, "learning_rate": 5.323937426308813e-06, "loss": 0.42380571365356445, "num_input_tokens_seen": 453929080, "step": 14240, "train_runtime": 37240.8956, "train_tokens_per_second": 12188.995 }, { "epoch": 0.959130083490439, "grad_norm": 0.74821466402817, "learning_rate": 5.321298853977128e-06, "loss": 0.3365647315979004, "num_input_tokens_seen": 454092920, "step": 14245, "train_runtime": 37253.3311, "train_tokens_per_second": 12189.324 }, { "epoch": 0.9594667384863992, "grad_norm": 0.7225322558169128, "learning_rate": 5.318660191795244e-06, "loss": 0.3519944667816162, "num_input_tokens_seen": 454248608, "step": 14250, "train_runtime": 37266.3091, "train_tokens_per_second": 12189.257 }, { "epoch": 0.9598033934823593, "grad_norm": 0.7153740342072372, "learning_rate": 5.316021440501053e-06, "loss": 0.3227083206176758, "num_input_tokens_seen": 454410032, "step": 14255, "train_runtime": 37281.321, "train_tokens_per_second": 12188.678 }, { "epoch": 0.9601400484783195, "grad_norm": 0.7389520545340884, "learning_rate": 5.313382600832474e-06, "loss": 0.3425132751464844, "num_input_tokens_seen": 454572528, "step": 14260, "train_runtime": 37294.8662, "train_tokens_per_second": 12188.609 }, { "epoch": 0.9604767034742796, "grad_norm": 0.7852045345588873, "learning_rate": 5.310743673527451e-06, "loss": 0.39432587623596194, "num_input_tokens_seen": 454733200, "step": 14265, "train_runtime": 37307.3568, "train_tokens_per_second": 12188.835 }, { "epoch": 0.9608133584702397, "grad_norm": 0.7307382606692295, "learning_rate": 5.3081046593239496e-06, "loss": 0.3800446271896362, "num_input_tokens_seen": 454891192, "step": 14270, "train_runtime": 37319.7706, "train_tokens_per_second": 12189.014 }, { "epoch": 0.9611500134661999, "grad_norm": 0.7237620345275972, "learning_rate": 5.305465558959964e-06, "loss": 0.36459693908691404, "num_input_tokens_seen": 455051208, "step": 14275, "train_runtime": 37333.6012, "train_tokens_per_second": 12188.784 }, { "epoch": 0.96148666846216, "grad_norm": 0.7863378298144611, "learning_rate": 5.302826373173506e-06, "loss": 0.3564426898956299, "num_input_tokens_seen": 455210928, "step": 14280, "train_runtime": 37346.2719, "train_tokens_per_second": 12188.926 }, { "epoch": 0.9618233234581202, "grad_norm": 0.755744196548147, "learning_rate": 5.3001871027026194e-06, "loss": 0.36427080631256104, "num_input_tokens_seen": 455368904, "step": 14285, "train_runtime": 37359.7785, "train_tokens_per_second": 12188.747 }, { "epoch": 0.9621599784540803, "grad_norm": 0.7502650304796661, "learning_rate": 5.2975477482853685e-06, "loss": 0.36396446228027346, "num_input_tokens_seen": 455529648, "step": 14290, "train_runtime": 37372.203, "train_tokens_per_second": 12188.996 }, { "epoch": 0.9624966334500404, "grad_norm": 0.8439977122593634, "learning_rate": 5.294908310659838e-06, "loss": 0.35645992755889894, "num_input_tokens_seen": 455689008, "step": 14295, "train_runtime": 37384.6388, "train_tokens_per_second": 12189.205 }, { "epoch": 0.9628332884460006, "grad_norm": 0.8232400167706919, "learning_rate": 5.292268790564138e-06, "loss": 0.35867953300476074, "num_input_tokens_seen": 455848688, "step": 14300, "train_runtime": 37397.309, "train_tokens_per_second": 12189.345 }, { "epoch": 0.9631699434419607, "grad_norm": 0.790494087299572, "learning_rate": 5.289629188736403e-06, "loss": 0.40677671432495116, "num_input_tokens_seen": 456011208, "step": 14305, "train_runtime": 37411.2715, "train_tokens_per_second": 12189.14 }, { "epoch": 0.9635065984379209, "grad_norm": 0.8591506703062213, "learning_rate": 5.286989505914788e-06, "loss": 0.3871395349502563, "num_input_tokens_seen": 456174568, "step": 14310, "train_runtime": 37424.2371, "train_tokens_per_second": 12189.282 }, { "epoch": 0.963843253433881, "grad_norm": 0.951215245991792, "learning_rate": 5.284349742837475e-06, "loss": 0.37456276416778567, "num_input_tokens_seen": 456336416, "step": 14315, "train_runtime": 37436.7693, "train_tokens_per_second": 12189.524 }, { "epoch": 0.9641799084298411, "grad_norm": 0.9728174147500613, "learning_rate": 5.281709900242662e-06, "loss": 0.36783158779144287, "num_input_tokens_seen": 456496664, "step": 14320, "train_runtime": 37449.5352, "train_tokens_per_second": 12189.648 }, { "epoch": 0.9645165634258013, "grad_norm": 0.7539586731921601, "learning_rate": 5.279069978868574e-06, "loss": 0.3605900049209595, "num_input_tokens_seen": 456658304, "step": 14325, "train_runtime": 37462.6009, "train_tokens_per_second": 12189.712 }, { "epoch": 0.9648532184217614, "grad_norm": 0.789045301350713, "learning_rate": 5.276429979453455e-06, "loss": 0.39236452579498293, "num_input_tokens_seen": 456817752, "step": 14330, "train_runtime": 37475.9762, "train_tokens_per_second": 12189.616 }, { "epoch": 0.9651898734177216, "grad_norm": 0.7037960674999219, "learning_rate": 5.273789902735575e-06, "loss": 0.35866966247558596, "num_input_tokens_seen": 456977016, "step": 14335, "train_runtime": 37488.8683, "train_tokens_per_second": 12189.672 }, { "epoch": 0.9655265284136817, "grad_norm": 0.773957684548207, "learning_rate": 5.27114974945322e-06, "loss": 0.35486769676208496, "num_input_tokens_seen": 457135240, "step": 14340, "train_runtime": 37502.3174, "train_tokens_per_second": 12189.52 }, { "epoch": 0.9658631834096418, "grad_norm": 0.8146027035613111, "learning_rate": 5.2685095203447046e-06, "loss": 0.36144609451293946, "num_input_tokens_seen": 457296672, "step": 14345, "train_runtime": 37515.9357, "train_tokens_per_second": 12189.398 }, { "epoch": 0.966199838405602, "grad_norm": 0.7307889812805859, "learning_rate": 5.265869216148357e-06, "loss": 0.36154971122741697, "num_input_tokens_seen": 457455128, "step": 14350, "train_runtime": 37528.6014, "train_tokens_per_second": 12189.506 }, { "epoch": 0.9665364934015621, "grad_norm": 0.7871377891361506, "learning_rate": 5.263228837602532e-06, "loss": 0.4133151054382324, "num_input_tokens_seen": 457611312, "step": 14355, "train_runtime": 37541.4637, "train_tokens_per_second": 12189.49 }, { "epoch": 0.9668731483975223, "grad_norm": 0.7438574811560466, "learning_rate": 5.2605883854456e-06, "loss": 0.37948946952819823, "num_input_tokens_seen": 457774000, "step": 14360, "train_runtime": 37554.4747, "train_tokens_per_second": 12189.599 }, { "epoch": 0.9672098033934824, "grad_norm": 0.6945289211089826, "learning_rate": 5.257947860415957e-06, "loss": 0.32939133644104, "num_input_tokens_seen": 457933224, "step": 14365, "train_runtime": 37567.3265, "train_tokens_per_second": 12189.668 }, { "epoch": 0.9675464583894425, "grad_norm": 0.8365326863548435, "learning_rate": 5.255307263252019e-06, "loss": 0.34754252433776855, "num_input_tokens_seen": 458094632, "step": 14370, "train_runtime": 37580.431, "train_tokens_per_second": 12189.712 }, { "epoch": 0.9678831133854027, "grad_norm": 0.6993116447208811, "learning_rate": 5.2526665946922185e-06, "loss": 0.39890940189361573, "num_input_tokens_seen": 458256368, "step": 14375, "train_runtime": 37592.9606, "train_tokens_per_second": 12189.952 }, { "epoch": 0.9682197683813628, "grad_norm": 0.7583886440316113, "learning_rate": 5.25002585547501e-06, "loss": 0.36263489723205566, "num_input_tokens_seen": 458416944, "step": 14380, "train_runtime": 37605.9782, "train_tokens_per_second": 12190.002 }, { "epoch": 0.968556423377323, "grad_norm": 0.7455960611864481, "learning_rate": 5.2473850463388675e-06, "loss": 0.39397149085998534, "num_input_tokens_seen": 458577400, "step": 14385, "train_runtime": 37618.3855, "train_tokens_per_second": 12190.247 }, { "epoch": 0.9688930783732831, "grad_norm": 0.7884269754008423, "learning_rate": 5.244744168022288e-06, "loss": 0.36410582065582275, "num_input_tokens_seen": 458740008, "step": 14390, "train_runtime": 37631.0766, "train_tokens_per_second": 12190.457 }, { "epoch": 0.9692297333692432, "grad_norm": 0.7777869069441501, "learning_rate": 5.24210322126378e-06, "loss": 0.3689519166946411, "num_input_tokens_seen": 458903352, "step": 14395, "train_runtime": 37644.1715, "train_tokens_per_second": 12190.555 }, { "epoch": 0.9695663883652034, "grad_norm": 0.7742942403465678, "learning_rate": 5.23946220680188e-06, "loss": 0.37396509647369386, "num_input_tokens_seen": 459067192, "step": 14400, "train_runtime": 37656.6105, "train_tokens_per_second": 12190.879 }, { "epoch": 0.9699030433611635, "grad_norm": 0.8079182267709639, "learning_rate": 5.236821125375136e-06, "loss": 0.35969550609588624, "num_input_tokens_seen": 459228472, "step": 14405, "train_runtime": 37669.881, "train_tokens_per_second": 12190.866 }, { "epoch": 0.9702396983571236, "grad_norm": 0.6655218005996368, "learning_rate": 5.234179977722119e-06, "loss": 0.3288028955459595, "num_input_tokens_seen": 459392312, "step": 14410, "train_runtime": 37682.3158, "train_tokens_per_second": 12191.191 }, { "epoch": 0.9705763533530838, "grad_norm": 0.7013689432600881, "learning_rate": 5.23153876458142e-06, "loss": 0.36847169399261476, "num_input_tokens_seen": 459550776, "step": 14415, "train_runtime": 37696.8265, "train_tokens_per_second": 12190.702 }, { "epoch": 0.9709130083490439, "grad_norm": 0.7787213569762704, "learning_rate": 5.2288974866916435e-06, "loss": 0.37161428928375245, "num_input_tokens_seen": 459699472, "step": 14420, "train_runtime": 37709.4211, "train_tokens_per_second": 12190.574 }, { "epoch": 0.9712496633450041, "grad_norm": 0.8239083471099061, "learning_rate": 5.226256144791414e-06, "loss": 0.379974365234375, "num_input_tokens_seen": 459854680, "step": 14425, "train_runtime": 37722.8214, "train_tokens_per_second": 12190.358 }, { "epoch": 0.9715863183409642, "grad_norm": 0.7716519508546801, "learning_rate": 5.223614739619375e-06, "loss": 0.37413322925567627, "num_input_tokens_seen": 460009640, "step": 14430, "train_runtime": 37736.5311, "train_tokens_per_second": 12190.035 }, { "epoch": 0.9719229733369243, "grad_norm": 0.6951826925866688, "learning_rate": 5.2209732719141855e-06, "loss": 0.34517014026641846, "num_input_tokens_seen": 460168216, "step": 14435, "train_runtime": 37749.5691, "train_tokens_per_second": 12190.026 }, { "epoch": 0.9722596283328845, "grad_norm": 0.8089390327054088, "learning_rate": 5.218331742414528e-06, "loss": 0.35672996044158933, "num_input_tokens_seen": 460329360, "step": 14440, "train_runtime": 37762.6676, "train_tokens_per_second": 12190.065 }, { "epoch": 0.9725962833288446, "grad_norm": 0.7634757472096132, "learning_rate": 5.215690151859094e-06, "loss": 0.3562602519989014, "num_input_tokens_seen": 460485672, "step": 14445, "train_runtime": 37775.7036, "train_tokens_per_second": 12189.996 }, { "epoch": 0.9729329383248048, "grad_norm": 0.7933560250898755, "learning_rate": 5.213048500986597e-06, "loss": 0.38979640007019045, "num_input_tokens_seen": 460646552, "step": 14450, "train_runtime": 37789.1612, "train_tokens_per_second": 12189.912 }, { "epoch": 0.9732695933207649, "grad_norm": 0.8272756708843483, "learning_rate": 5.210406790535766e-06, "loss": 0.3738735198974609, "num_input_tokens_seen": 460804272, "step": 14455, "train_runtime": 37802.3389, "train_tokens_per_second": 12189.835 }, { "epoch": 0.973606248316725, "grad_norm": 0.7441848802672192, "learning_rate": 5.207765021245346e-06, "loss": 0.37014117240905764, "num_input_tokens_seen": 460963520, "step": 14460, "train_runtime": 37815.7726, "train_tokens_per_second": 12189.716 }, { "epoch": 0.9739429033126852, "grad_norm": 0.8125375048886795, "learning_rate": 5.2051231938541015e-06, "loss": 0.3655364513397217, "num_input_tokens_seen": 461118152, "step": 14465, "train_runtime": 37829.2046, "train_tokens_per_second": 12189.475 }, { "epoch": 0.9742795583086453, "grad_norm": 0.7688422566461453, "learning_rate": 5.202481309100808e-06, "loss": 0.36936194896698, "num_input_tokens_seen": 461276184, "step": 14470, "train_runtime": 37842.6202, "train_tokens_per_second": 12189.33 }, { "epoch": 0.9746162133046055, "grad_norm": 0.7809438496801016, "learning_rate": 5.199839367724266e-06, "loss": 0.3820170879364014, "num_input_tokens_seen": 461437400, "step": 14475, "train_runtime": 37855.0747, "train_tokens_per_second": 12189.578 }, { "epoch": 0.9749528683005656, "grad_norm": 0.7382035432021151, "learning_rate": 5.197197370463278e-06, "loss": 0.3520524024963379, "num_input_tokens_seen": 461601240, "step": 14480, "train_runtime": 37867.5138, "train_tokens_per_second": 12189.901 }, { "epoch": 0.9752895232965257, "grad_norm": 0.9968966691462924, "learning_rate": 5.194555318056675e-06, "loss": 0.40593700408935546, "num_input_tokens_seen": 461765080, "step": 14485, "train_runtime": 37879.9541, "train_tokens_per_second": 12190.223 }, { "epoch": 0.9756261782924859, "grad_norm": 0.9263491316623089, "learning_rate": 5.191913211243299e-06, "loss": 0.3960269927978516, "num_input_tokens_seen": 461925784, "step": 14490, "train_runtime": 37892.3912, "train_tokens_per_second": 12190.463 }, { "epoch": 0.975962833288446, "grad_norm": 0.9232103319973263, "learning_rate": 5.1892710507620055e-06, "loss": 0.3641959190368652, "num_input_tokens_seen": 462086600, "step": 14495, "train_runtime": 37905.917, "train_tokens_per_second": 12190.355 }, { "epoch": 0.9762994882844062, "grad_norm": 0.7201328186407614, "learning_rate": 5.186628837351666e-06, "loss": 0.3365805149078369, "num_input_tokens_seen": 462247552, "step": 14500, "train_runtime": 37918.8323, "train_tokens_per_second": 12190.448 }, { "epoch": 0.9766361432803663, "grad_norm": 0.7336594502036727, "learning_rate": 5.183986571751167e-06, "loss": 0.37297930717468264, "num_input_tokens_seen": 462410056, "step": 14505, "train_runtime": 37932.1738, "train_tokens_per_second": 12190.444 }, { "epoch": 0.9769727982763264, "grad_norm": 1.671714332768747, "learning_rate": 5.181344254699408e-06, "loss": 0.396826958656311, "num_input_tokens_seen": 462569928, "step": 14510, "train_runtime": 37945.0329, "train_tokens_per_second": 12190.526 }, { "epoch": 0.9773094532722866, "grad_norm": 0.7223086551779808, "learning_rate": 5.178701886935309e-06, "loss": 0.3570199489593506, "num_input_tokens_seen": 462724368, "step": 14515, "train_runtime": 37958.3798, "train_tokens_per_second": 12190.309 }, { "epoch": 0.9776461082682467, "grad_norm": 0.6831554958682025, "learning_rate": 5.176059469197796e-06, "loss": 0.3520961284637451, "num_input_tokens_seen": 462885360, "step": 14520, "train_runtime": 37971.3489, "train_tokens_per_second": 12190.385 }, { "epoch": 0.9779827632642069, "grad_norm": 0.8049938496894542, "learning_rate": 5.173417002225815e-06, "loss": 0.34856243133544923, "num_input_tokens_seen": 463044496, "step": 14525, "train_runtime": 37984.6605, "train_tokens_per_second": 12190.302 }, { "epoch": 0.978319418260167, "grad_norm": 1.0130538246511267, "learning_rate": 5.170774486758322e-06, "loss": 0.37352752685546875, "num_input_tokens_seen": 463193728, "step": 14530, "train_runtime": 37997.9777, "train_tokens_per_second": 12189.957 }, { "epoch": 0.9786560732561271, "grad_norm": 0.7060297629483385, "learning_rate": 5.168131923534287e-06, "loss": 0.38727126121520994, "num_input_tokens_seen": 463354016, "step": 14535, "train_runtime": 38011.1479, "train_tokens_per_second": 12189.951 }, { "epoch": 0.9789927282520873, "grad_norm": 0.7725840183103372, "learning_rate": 5.165489313292696e-06, "loss": 0.36117095947265626, "num_input_tokens_seen": 463512296, "step": 14540, "train_runtime": 38024.1813, "train_tokens_per_second": 12189.935 }, { "epoch": 0.9793293832480474, "grad_norm": 0.741042917241812, "learning_rate": 5.162846656772548e-06, "loss": 0.3356083869934082, "num_input_tokens_seen": 463670272, "step": 14545, "train_runtime": 38036.6662, "train_tokens_per_second": 12190.087 }, { "epoch": 0.9796660382440076, "grad_norm": 0.8454127740063642, "learning_rate": 5.16020395471285e-06, "loss": 0.3562184810638428, "num_input_tokens_seen": 463829952, "step": 14550, "train_runtime": 38049.6801, "train_tokens_per_second": 12190.114 }, { "epoch": 0.9800026932399677, "grad_norm": 0.7490317449064234, "learning_rate": 5.157561207852628e-06, "loss": 0.376031231880188, "num_input_tokens_seen": 463982872, "step": 14555, "train_runtime": 38062.8747, "train_tokens_per_second": 12189.906 }, { "epoch": 0.9803393482359278, "grad_norm": 0.7952757370643082, "learning_rate": 5.154918416930915e-06, "loss": 0.3518802642822266, "num_input_tokens_seen": 464141192, "step": 14560, "train_runtime": 38076.4912, "train_tokens_per_second": 12189.705 }, { "epoch": 0.980676003231888, "grad_norm": 0.8383011603568105, "learning_rate": 5.152275582686761e-06, "loss": 0.4002518653869629, "num_input_tokens_seen": 464298328, "step": 14565, "train_runtime": 38089.2328, "train_tokens_per_second": 12189.753 }, { "epoch": 0.9810126582278481, "grad_norm": 0.8069517483258946, "learning_rate": 5.149632705859227e-06, "loss": 0.3675529956817627, "num_input_tokens_seen": 464460232, "step": 14570, "train_runtime": 38102.4546, "train_tokens_per_second": 12189.772 }, { "epoch": 0.9813493132238083, "grad_norm": 0.8626272001319256, "learning_rate": 5.146989787187383e-06, "loss": 0.3813780307769775, "num_input_tokens_seen": 464618776, "step": 14575, "train_runtime": 38114.9992, "train_tokens_per_second": 12189.92 }, { "epoch": 0.9816859682197684, "grad_norm": 0.7804321206014594, "learning_rate": 5.144346827410314e-06, "loss": 0.37446858882904055, "num_input_tokens_seen": 464777600, "step": 14580, "train_runtime": 38127.5605, "train_tokens_per_second": 12190.069 }, { "epoch": 0.9820226232157285, "grad_norm": 0.8622149732520641, "learning_rate": 5.141703827267117e-06, "loss": 0.39135141372680665, "num_input_tokens_seen": 464936560, "step": 14585, "train_runtime": 38140.1023, "train_tokens_per_second": 12190.228 }, { "epoch": 0.9823592782116887, "grad_norm": 0.7511951111785298, "learning_rate": 5.139060787496893e-06, "loss": 0.384206485748291, "num_input_tokens_seen": 465097040, "step": 14590, "train_runtime": 38152.7256, "train_tokens_per_second": 12190.401 }, { "epoch": 0.9826959332076488, "grad_norm": 0.9634676325548029, "learning_rate": 5.136417708838766e-06, "loss": 0.38232452869415284, "num_input_tokens_seen": 465252168, "step": 14595, "train_runtime": 38167.0006, "train_tokens_per_second": 12189.906 }, { "epoch": 0.983032588203609, "grad_norm": 0.8437121707370554, "learning_rate": 5.13377459203186e-06, "loss": 0.3698857069015503, "num_input_tokens_seen": 465410864, "step": 14600, "train_runtime": 38181.3123, "train_tokens_per_second": 12189.494 }, { "epoch": 0.9833692431995691, "grad_norm": 0.734436813582297, "learning_rate": 5.131131437815318e-06, "loss": 0.3412070035934448, "num_input_tokens_seen": 465570960, "step": 14605, "train_runtime": 38194.6815, "train_tokens_per_second": 12189.419 }, { "epoch": 0.9837058981955292, "grad_norm": 0.735107304989146, "learning_rate": 5.128488246928287e-06, "loss": 0.3736592769622803, "num_input_tokens_seen": 465732504, "step": 14610, "train_runtime": 38207.2099, "train_tokens_per_second": 12189.65 }, { "epoch": 0.9840425531914894, "grad_norm": 0.772764873286212, "learning_rate": 5.125845020109925e-06, "loss": 0.37637863159179685, "num_input_tokens_seen": 465894856, "step": 14615, "train_runtime": 38219.8878, "train_tokens_per_second": 12189.854 }, { "epoch": 0.9843792081874495, "grad_norm": 0.8526057276579204, "learning_rate": 5.123201758099406e-06, "loss": 0.37646872997283937, "num_input_tokens_seen": 466055048, "step": 14620, "train_runtime": 38233.3819, "train_tokens_per_second": 12189.742 }, { "epoch": 0.9847158631834096, "grad_norm": 0.8615279653418381, "learning_rate": 5.12055846163591e-06, "loss": 0.38402888774871824, "num_input_tokens_seen": 466210464, "step": 14625, "train_runtime": 38245.8569, "train_tokens_per_second": 12189.829 }, { "epoch": 0.9850525181793698, "grad_norm": 0.70316794770979, "learning_rate": 5.117915131458623e-06, "loss": 0.33484597206115724, "num_input_tokens_seen": 466373032, "step": 14630, "train_runtime": 38259.4654, "train_tokens_per_second": 12189.743 }, { "epoch": 0.9853891731753299, "grad_norm": 0.8857117300487848, "learning_rate": 5.115271768306745e-06, "loss": 0.3731785774230957, "num_input_tokens_seen": 466527464, "step": 14635, "train_runtime": 38272.3041, "train_tokens_per_second": 12189.688 }, { "epoch": 0.9857258281712901, "grad_norm": 0.7593815421749512, "learning_rate": 5.112628372919485e-06, "loss": 0.3848330736160278, "num_input_tokens_seen": 466689408, "step": 14640, "train_runtime": 38285.5776, "train_tokens_per_second": 12189.692 }, { "epoch": 0.9860624831672502, "grad_norm": 0.7371794230732585, "learning_rate": 5.1099849460360595e-06, "loss": 0.3547880411148071, "num_input_tokens_seen": 466838856, "step": 14645, "train_runtime": 38298.7327, "train_tokens_per_second": 12189.407 }, { "epoch": 0.9863991381632103, "grad_norm": 0.6764122726709579, "learning_rate": 5.107341488395695e-06, "loss": 0.3506003856658936, "num_input_tokens_seen": 467002480, "step": 14650, "train_runtime": 38311.7702, "train_tokens_per_second": 12189.53 }, { "epoch": 0.9867357931591705, "grad_norm": 0.7471504762959407, "learning_rate": 5.104698000737626e-06, "loss": 0.37791857719421384, "num_input_tokens_seen": 467163640, "step": 14655, "train_runtime": 38324.7813, "train_tokens_per_second": 12189.597 }, { "epoch": 0.9870724481551306, "grad_norm": 0.7498307704092784, "learning_rate": 5.102054483801094e-06, "loss": 0.3794479131698608, "num_input_tokens_seen": 467327280, "step": 14660, "train_runtime": 38337.8242, "train_tokens_per_second": 12189.718 }, { "epoch": 0.9874091031510908, "grad_norm": 0.6887394754180528, "learning_rate": 5.099410938325351e-06, "loss": 0.3883463621139526, "num_input_tokens_seen": 467487784, "step": 14665, "train_runtime": 38350.8446, "train_tokens_per_second": 12189.765 }, { "epoch": 0.9877457581470509, "grad_norm": 0.7888553019094406, "learning_rate": 5.096767365049657e-06, "loss": 0.35828289985656736, "num_input_tokens_seen": 467642104, "step": 14670, "train_runtime": 38363.8098, "train_tokens_per_second": 12189.668 }, { "epoch": 0.988082413143011, "grad_norm": 0.6316462645305534, "learning_rate": 5.094123764713277e-06, "loss": 0.33677384853363035, "num_input_tokens_seen": 467805240, "step": 14675, "train_runtime": 38376.6303, "train_tokens_per_second": 12189.847 }, { "epoch": 0.9884190681389712, "grad_norm": 0.7988930417641884, "learning_rate": 5.091480138055487e-06, "loss": 0.38098456859588625, "num_input_tokens_seen": 467965872, "step": 14680, "train_runtime": 38389.459, "train_tokens_per_second": 12189.957 }, { "epoch": 0.9887557231349313, "grad_norm": 0.8573503854534872, "learning_rate": 5.088836485815568e-06, "loss": 0.3684356689453125, "num_input_tokens_seen": 468116992, "step": 14685, "train_runtime": 38402.4444, "train_tokens_per_second": 12189.771 }, { "epoch": 0.9890923781308915, "grad_norm": 0.7733438064653952, "learning_rate": 5.086192808732809e-06, "loss": 0.36145625114440916, "num_input_tokens_seen": 468270736, "step": 14690, "train_runtime": 38415.0685, "train_tokens_per_second": 12189.767 }, { "epoch": 0.9894290331268516, "grad_norm": 0.8379262214307905, "learning_rate": 5.083549107546505e-06, "loss": 0.37652878761291503, "num_input_tokens_seen": 468423360, "step": 14695, "train_runtime": 38428.3322, "train_tokens_per_second": 12189.531 }, { "epoch": 0.9897656881228117, "grad_norm": 0.7716888898498779, "learning_rate": 5.080905382995961e-06, "loss": 0.3989598274230957, "num_input_tokens_seen": 468585256, "step": 14700, "train_runtime": 38440.8723, "train_tokens_per_second": 12189.766 }, { "epoch": 0.9901023431187719, "grad_norm": 0.7035478532135641, "learning_rate": 5.0782616358204835e-06, "loss": 0.38455634117126464, "num_input_tokens_seen": 468744608, "step": 14705, "train_runtime": 38454.0633, "train_tokens_per_second": 12189.729 }, { "epoch": 0.990438998114732, "grad_norm": 0.8230253775506062, "learning_rate": 5.075617866759389e-06, "loss": 0.3496450901031494, "num_input_tokens_seen": 468900016, "step": 14710, "train_runtime": 38466.8983, "train_tokens_per_second": 12189.702 }, { "epoch": 0.9907756531106922, "grad_norm": 0.7644415289687652, "learning_rate": 5.0729740765519995e-06, "loss": 0.41901111602783203, "num_input_tokens_seen": 469058616, "step": 14715, "train_runtime": 38480.1259, "train_tokens_per_second": 12189.633 }, { "epoch": 0.9911123081066523, "grad_norm": 0.7935556940637902, "learning_rate": 5.070330265937643e-06, "loss": 0.36202635765075686, "num_input_tokens_seen": 469213944, "step": 14720, "train_runtime": 38493.5655, "train_tokens_per_second": 12189.412 }, { "epoch": 0.9914489631026124, "grad_norm": 0.7777524920648146, "learning_rate": 5.067686435655651e-06, "loss": 0.38873977661132814, "num_input_tokens_seen": 469377120, "step": 14725, "train_runtime": 38507.1609, "train_tokens_per_second": 12189.346 }, { "epoch": 0.9917856180985726, "grad_norm": 0.767938122684092, "learning_rate": 5.065042586445363e-06, "loss": 0.38827083110809324, "num_input_tokens_seen": 469531408, "step": 14730, "train_runtime": 38520.1831, "train_tokens_per_second": 12189.231 }, { "epoch": 0.9921222730945327, "grad_norm": 0.7672822762349635, "learning_rate": 5.0623987190461245e-06, "loss": 0.33096330165863036, "num_input_tokens_seen": 469687784, "step": 14735, "train_runtime": 38533.0715, "train_tokens_per_second": 12189.212 }, { "epoch": 0.9924589280904929, "grad_norm": 0.8592535902194339, "learning_rate": 5.059754834197281e-06, "loss": 0.38752386569976804, "num_input_tokens_seen": 469847608, "step": 14740, "train_runtime": 38546.3236, "train_tokens_per_second": 12189.168 }, { "epoch": 0.992795583086453, "grad_norm": 0.6701916289320892, "learning_rate": 5.05711093263819e-06, "loss": 0.3065890073776245, "num_input_tokens_seen": 470008320, "step": 14745, "train_runtime": 38560.0845, "train_tokens_per_second": 12188.986 }, { "epoch": 0.9931322380824131, "grad_norm": 0.8121691015014327, "learning_rate": 5.054467015108208e-06, "loss": 0.40102643966674806, "num_input_tokens_seen": 470171736, "step": 14750, "train_runtime": 38573.0821, "train_tokens_per_second": 12189.115 }, { "epoch": 0.9934688930783733, "grad_norm": 0.7849767621136483, "learning_rate": 5.051823082346701e-06, "loss": 0.3718144178390503, "num_input_tokens_seen": 470329800, "step": 14755, "train_runtime": 38585.9969, "train_tokens_per_second": 12189.132 }, { "epoch": 0.9938055480743334, "grad_norm": 0.8431159544435034, "learning_rate": 5.049179135093033e-06, "loss": 0.37436881065368655, "num_input_tokens_seen": 470490288, "step": 14760, "train_runtime": 38599.5296, "train_tokens_per_second": 12189.016 }, { "epoch": 0.9941422030702936, "grad_norm": 0.7264065460372751, "learning_rate": 5.046535174086575e-06, "loss": 0.382991099357605, "num_input_tokens_seen": 470650976, "step": 14765, "train_runtime": 38612.3934, "train_tokens_per_second": 12189.117 }, { "epoch": 0.9944788580662537, "grad_norm": 0.8081427587146074, "learning_rate": 5.043891200066706e-06, "loss": 0.36737618446350095, "num_input_tokens_seen": 470812552, "step": 14770, "train_runtime": 38625.6988, "train_tokens_per_second": 12189.101 }, { "epoch": 0.9948155130622138, "grad_norm": 0.7468630070744658, "learning_rate": 5.041247213772802e-06, "loss": 0.3550856113433838, "num_input_tokens_seen": 470976392, "step": 14775, "train_runtime": 38638.1326, "train_tokens_per_second": 12189.419 }, { "epoch": 0.995152168058174, "grad_norm": 0.8661324517569222, "learning_rate": 5.038603215944247e-06, "loss": 0.37668414115905763, "num_input_tokens_seen": 471125648, "step": 14780, "train_runtime": 38651.6107, "train_tokens_per_second": 12189.03 }, { "epoch": 0.9954888230541341, "grad_norm": 0.7998243342432169, "learning_rate": 5.0359592073204254e-06, "loss": 0.3421839714050293, "num_input_tokens_seen": 471281056, "step": 14785, "train_runtime": 38664.3506, "train_tokens_per_second": 12189.033 }, { "epoch": 0.9958254780500942, "grad_norm": 0.8347736664971019, "learning_rate": 5.033315188640725e-06, "loss": 0.3480769395828247, "num_input_tokens_seen": 471444288, "step": 14790, "train_runtime": 38677.2441, "train_tokens_per_second": 12189.19 }, { "epoch": 0.9961621330460544, "grad_norm": 0.7088835818485234, "learning_rate": 5.03067116064454e-06, "loss": 0.3531078815460205, "num_input_tokens_seen": 471607544, "step": 14795, "train_runtime": 38690.3087, "train_tokens_per_second": 12189.294 }, { "epoch": 0.9964987880420145, "grad_norm": 0.7102750769536917, "learning_rate": 5.028027124071262e-06, "loss": 0.3675748348236084, "num_input_tokens_seen": 471763328, "step": 14800, "train_runtime": 38703.2442, "train_tokens_per_second": 12189.245 }, { "epoch": 0.9968354430379747, "grad_norm": 0.7142184067704911, "learning_rate": 5.025383079660289e-06, "loss": 0.3480186700820923, "num_input_tokens_seen": 471926824, "step": 14805, "train_runtime": 38716.2587, "train_tokens_per_second": 12189.371 }, { "epoch": 0.9971720980339348, "grad_norm": 0.772594813278471, "learning_rate": 5.0227390281510166e-06, "loss": 0.3718601703643799, "num_input_tokens_seen": 472085760, "step": 14810, "train_runtime": 38728.836, "train_tokens_per_second": 12189.516 }, { "epoch": 0.997508753029895, "grad_norm": 0.7265510590897472, "learning_rate": 5.020094970282849e-06, "loss": 0.3606245517730713, "num_input_tokens_seen": 472238096, "step": 14815, "train_runtime": 38742.0492, "train_tokens_per_second": 12189.291 }, { "epoch": 0.9978454080258551, "grad_norm": 0.7933018562893929, "learning_rate": 5.017450906795187e-06, "loss": 0.3589968204498291, "num_input_tokens_seen": 472399544, "step": 14820, "train_runtime": 38754.5831, "train_tokens_per_second": 12189.514 }, { "epoch": 0.9981820630218152, "grad_norm": 0.7360374145233007, "learning_rate": 5.014806838427434e-06, "loss": 0.37145347595214845, "num_input_tokens_seen": 472557768, "step": 14825, "train_runtime": 38769.5693, "train_tokens_per_second": 12188.884 }, { "epoch": 0.9985187180177754, "grad_norm": 0.737675632861731, "learning_rate": 5.0121627659189964e-06, "loss": 0.36044859886169434, "num_input_tokens_seen": 472719752, "step": 14830, "train_runtime": 38782.0732, "train_tokens_per_second": 12189.131 }, { "epoch": 0.9988553730137355, "grad_norm": 0.9154770931403123, "learning_rate": 5.009518690009281e-06, "loss": 0.36890339851379395, "num_input_tokens_seen": 472873712, "step": 14835, "train_runtime": 38794.8734, "train_tokens_per_second": 12189.077 }, { "epoch": 0.9991920280096956, "grad_norm": 0.7973189235618524, "learning_rate": 5.006874611437692e-06, "loss": 0.3721126079559326, "num_input_tokens_seen": 473036384, "step": 14840, "train_runtime": 38807.7055, "train_tokens_per_second": 12189.239 }, { "epoch": 0.9995286830056558, "grad_norm": 0.7066298729868201, "learning_rate": 5.004230530943641e-06, "loss": 0.35857548713684084, "num_input_tokens_seen": 473199600, "step": 14845, "train_runtime": 38821.3327, "train_tokens_per_second": 12189.164 }, { "epoch": 0.9998653380016159, "grad_norm": 0.7674343390337574, "learning_rate": 5.001586449266536e-06, "loss": 0.3374613046646118, "num_input_tokens_seen": 473361976, "step": 14850, "train_runtime": 38833.9612, "train_tokens_per_second": 12189.382 }, { "epoch": 1.000201992997576, "grad_norm": 0.6705871939026546, "learning_rate": 4.998942367145787e-06, "loss": 0.34558203220367434, "num_input_tokens_seen": 473519176, "step": 14855, "train_runtime": 39005.0494, "train_tokens_per_second": 12139.946 }, { "epoch": 1.0005386479935363, "grad_norm": 0.7966159468716607, "learning_rate": 4.996298285320798e-06, "loss": 0.2983903408050537, "num_input_tokens_seen": 473670848, "step": 14860, "train_runtime": 39017.8807, "train_tokens_per_second": 12139.841 }, { "epoch": 1.0008753029894963, "grad_norm": 0.8062317848022944, "learning_rate": 4.993654204530983e-06, "loss": 0.3015679121017456, "num_input_tokens_seen": 473830880, "step": 14865, "train_runtime": 39030.7995, "train_tokens_per_second": 12139.922 }, { "epoch": 1.0012119579854566, "grad_norm": 0.7780150686596056, "learning_rate": 4.99101012551575e-06, "loss": 0.30467169284820556, "num_input_tokens_seen": 473979264, "step": 14870, "train_runtime": 39043.9053, "train_tokens_per_second": 12139.648 }, { "epoch": 1.0015486129814166, "grad_norm": 0.7867978083039806, "learning_rate": 4.9883660490145075e-06, "loss": 0.3058297157287598, "num_input_tokens_seen": 474143104, "step": 14875, "train_runtime": 39056.3373, "train_tokens_per_second": 12139.979 }, { "epoch": 1.0018852679773769, "grad_norm": 0.7340867135672074, "learning_rate": 4.985721975766661e-06, "loss": 0.3142852306365967, "num_input_tokens_seen": 474301104, "step": 14880, "train_runtime": 39069.2671, "train_tokens_per_second": 12140.005 }, { "epoch": 1.002221922973337, "grad_norm": 0.8211587526473608, "learning_rate": 4.983077906511619e-06, "loss": 0.3184364795684814, "num_input_tokens_seen": 474459776, "step": 14885, "train_runtime": 39082.3504, "train_tokens_per_second": 12140.001 }, { "epoch": 1.0025585779692971, "grad_norm": 0.7927471846307965, "learning_rate": 4.980433841988786e-06, "loss": 0.29326457977294923, "num_input_tokens_seen": 474619304, "step": 14890, "train_runtime": 39095.1809, "train_tokens_per_second": 12140.097 }, { "epoch": 1.0028952329652572, "grad_norm": 0.8056356008728264, "learning_rate": 4.977789782937568e-06, "loss": 0.30637235641479493, "num_input_tokens_seen": 474782752, "step": 14895, "train_runtime": 39108.1726, "train_tokens_per_second": 12140.244 }, { "epoch": 1.0032318879612174, "grad_norm": 0.8271742083544236, "learning_rate": 4.975145730097364e-06, "loss": 0.30994338989257814, "num_input_tokens_seen": 474937832, "step": 14900, "train_runtime": 39121.7025, "train_tokens_per_second": 12140.009 }, { "epoch": 1.0035685429571775, "grad_norm": 0.7572057918138807, "learning_rate": 4.97250168420758e-06, "loss": 0.30400514602661133, "num_input_tokens_seen": 475093640, "step": 14905, "train_runtime": 39134.5567, "train_tokens_per_second": 12140.003 }, { "epoch": 1.0039051979531377, "grad_norm": 0.8184971479869119, "learning_rate": 4.96985764600761e-06, "loss": 0.3087057590484619, "num_input_tokens_seen": 475257480, "step": 14910, "train_runtime": 39146.9774, "train_tokens_per_second": 12140.337 }, { "epoch": 1.0042418529490977, "grad_norm": 0.7551672835062946, "learning_rate": 4.967213616236855e-06, "loss": 0.31442787647247317, "num_input_tokens_seen": 475414480, "step": 14915, "train_runtime": 39159.9859, "train_tokens_per_second": 12140.313 }, { "epoch": 1.004578507945058, "grad_norm": 0.8907511821677292, "learning_rate": 4.964569595634706e-06, "loss": 0.31869916915893554, "num_input_tokens_seen": 475576136, "step": 14920, "train_runtime": 39172.4171, "train_tokens_per_second": 12140.587 }, { "epoch": 1.004915162941018, "grad_norm": 0.8038716472571167, "learning_rate": 4.961925584940559e-06, "loss": 0.3332134008407593, "num_input_tokens_seen": 475737936, "step": 14925, "train_runtime": 39184.9648, "train_tokens_per_second": 12140.828 }, { "epoch": 1.0052518179369783, "grad_norm": 0.796286764759513, "learning_rate": 4.959281584893799e-06, "loss": 0.27721872329711916, "num_input_tokens_seen": 475896760, "step": 14930, "train_runtime": 39197.544, "train_tokens_per_second": 12140.984 }, { "epoch": 1.0055884729329383, "grad_norm": 1.0596097827467876, "learning_rate": 4.956637596233814e-06, "loss": 0.31590662002563474, "num_input_tokens_seen": 476051992, "step": 14935, "train_runtime": 39211.4987, "train_tokens_per_second": 12140.622 }, { "epoch": 1.0059251279288985, "grad_norm": 0.7825866276852012, "learning_rate": 4.953993619699986e-06, "loss": 0.30376486778259276, "num_input_tokens_seen": 476210664, "step": 14940, "train_runtime": 39224.5654, "train_tokens_per_second": 12140.623 }, { "epoch": 1.0062617829248586, "grad_norm": 0.763076546094469, "learning_rate": 4.951349656031698e-06, "loss": 0.29827275276184084, "num_input_tokens_seen": 476372464, "step": 14945, "train_runtime": 39237.8088, "train_tokens_per_second": 12140.649 }, { "epoch": 1.0065984379208188, "grad_norm": 0.8114419181000545, "learning_rate": 4.948705705968322e-06, "loss": 0.3202513694763184, "num_input_tokens_seen": 476533456, "step": 14950, "train_runtime": 39250.8261, "train_tokens_per_second": 12140.724 }, { "epoch": 1.0069350929167789, "grad_norm": 0.718462429090509, "learning_rate": 4.946061770249233e-06, "loss": 0.303941535949707, "num_input_tokens_seen": 476695024, "step": 14955, "train_runtime": 39264.5568, "train_tokens_per_second": 12140.594 }, { "epoch": 1.007271747912739, "grad_norm": 0.7391776582057842, "learning_rate": 4.9434178496137955e-06, "loss": 0.32828574180603026, "num_input_tokens_seen": 476855264, "step": 14960, "train_runtime": 39277.6671, "train_tokens_per_second": 12140.621 }, { "epoch": 1.0076084029086991, "grad_norm": 0.7250506471342612, "learning_rate": 4.940773944801378e-06, "loss": 0.30356998443603517, "num_input_tokens_seen": 477014400, "step": 14965, "train_runtime": 39291.2399, "train_tokens_per_second": 12140.477 }, { "epoch": 1.0079450579046594, "grad_norm": 0.9205406447341752, "learning_rate": 4.938130056551337e-06, "loss": 0.32108659744262696, "num_input_tokens_seen": 477174616, "step": 14970, "train_runtime": 39303.921, "train_tokens_per_second": 12140.636 }, { "epoch": 1.0082817129006194, "grad_norm": 0.7214209925335233, "learning_rate": 4.9354861856030305e-06, "loss": 0.3137290239334106, "num_input_tokens_seen": 477333264, "step": 14975, "train_runtime": 39316.381, "train_tokens_per_second": 12140.824 }, { "epoch": 1.0086183678965797, "grad_norm": 0.8269121707839991, "learning_rate": 4.932842332695803e-06, "loss": 0.2959961175918579, "num_input_tokens_seen": 477489120, "step": 14980, "train_runtime": 39330.4954, "train_tokens_per_second": 12140.43 }, { "epoch": 1.0089550228925397, "grad_norm": 0.7952572939709217, "learning_rate": 4.9301984985690055e-06, "loss": 0.3175344467163086, "num_input_tokens_seen": 477652832, "step": 14985, "train_runtime": 39343.481, "train_tokens_per_second": 12140.584 }, { "epoch": 1.0092916778885, "grad_norm": 0.8855264278942446, "learning_rate": 4.927554683961974e-06, "loss": 0.3260321617126465, "num_input_tokens_seen": 477810192, "step": 14990, "train_runtime": 39356.2329, "train_tokens_per_second": 12140.649 }, { "epoch": 1.00962833288446, "grad_norm": 0.7564543412301691, "learning_rate": 4.924910889614046e-06, "loss": 0.2932924747467041, "num_input_tokens_seen": 477971256, "step": 14995, "train_runtime": 39370.0613, "train_tokens_per_second": 12140.475 }, { "epoch": 1.0099649878804202, "grad_norm": 0.8076110068815173, "learning_rate": 4.922267116264546e-06, "loss": 0.32979135513305663, "num_input_tokens_seen": 478123976, "step": 15000, "train_runtime": 39382.8246, "train_tokens_per_second": 12140.419 }, { "epoch": 1.0103016428763802, "grad_norm": 0.8172184811454559, "learning_rate": 4.919623364652801e-06, "loss": 0.29823894500732423, "num_input_tokens_seen": 478281480, "step": 15005, "train_runtime": 39395.7931, "train_tokens_per_second": 12140.42 }, { "epoch": 1.0106382978723405, "grad_norm": 0.7882461689682837, "learning_rate": 4.916979635518124e-06, "loss": 0.32759990692138674, "num_input_tokens_seen": 478435192, "step": 15010, "train_runtime": 39408.7817, "train_tokens_per_second": 12140.319 }, { "epoch": 1.0109749528683005, "grad_norm": 0.7904949057510042, "learning_rate": 4.914335929599828e-06, "loss": 0.3193901777267456, "num_input_tokens_seen": 478598288, "step": 15015, "train_runtime": 39421.6536, "train_tokens_per_second": 12140.492 }, { "epoch": 1.0113116078642608, "grad_norm": 0.89903611592992, "learning_rate": 4.9116922476372155e-06, "loss": 0.3195690870285034, "num_input_tokens_seen": 478759896, "step": 15020, "train_runtime": 39435.3711, "train_tokens_per_second": 12140.367 }, { "epoch": 1.0116482628602208, "grad_norm": 0.8455563216714693, "learning_rate": 4.909048590369586e-06, "loss": 0.30799388885498047, "num_input_tokens_seen": 478919224, "step": 15025, "train_runtime": 39448.5885, "train_tokens_per_second": 12140.339 }, { "epoch": 1.011984917856181, "grad_norm": 0.771178353861204, "learning_rate": 4.906404958536227e-06, "loss": 0.30479068756103517, "num_input_tokens_seen": 479080912, "step": 15030, "train_runtime": 39461.1228, "train_tokens_per_second": 12140.58 }, { "epoch": 1.012321572852141, "grad_norm": 0.7323087139637398, "learning_rate": 4.903761352876422e-06, "loss": 0.32252049446105957, "num_input_tokens_seen": 479236208, "step": 15035, "train_runtime": 39474.2336, "train_tokens_per_second": 12140.482 }, { "epoch": 1.0126582278481013, "grad_norm": 0.8654964782312182, "learning_rate": 4.9011177741294485e-06, "loss": 0.30508058071136473, "num_input_tokens_seen": 479390208, "step": 15040, "train_runtime": 39487.4524, "train_tokens_per_second": 12140.317 }, { "epoch": 1.0129948828440614, "grad_norm": 0.7440129822001812, "learning_rate": 4.898474223034576e-06, "loss": 0.3174762725830078, "num_input_tokens_seen": 479553752, "step": 15045, "train_runtime": 39500.4856, "train_tokens_per_second": 12140.452 }, { "epoch": 1.0133315378400216, "grad_norm": 0.8558713265492676, "learning_rate": 4.895830700331061e-06, "loss": 0.32155675888061525, "num_input_tokens_seen": 479711504, "step": 15050, "train_runtime": 39514.3392, "train_tokens_per_second": 12140.188 }, { "epoch": 1.0136681928359816, "grad_norm": 0.845004201463467, "learning_rate": 4.893187206758158e-06, "loss": 0.3127194166183472, "num_input_tokens_seen": 479870504, "step": 15055, "train_runtime": 39527.5774, "train_tokens_per_second": 12140.145 }, { "epoch": 1.014004847831942, "grad_norm": 0.9235731007514596, "learning_rate": 4.890543743055115e-06, "loss": 0.2902012586593628, "num_input_tokens_seen": 480030408, "step": 15060, "train_runtime": 39540.0963, "train_tokens_per_second": 12140.345 }, { "epoch": 1.014341502827902, "grad_norm": 0.7785770715607198, "learning_rate": 4.887900309961163e-06, "loss": 0.3177165985107422, "num_input_tokens_seen": 480190616, "step": 15065, "train_runtime": 39553.7345, "train_tokens_per_second": 12140.209 }, { "epoch": 1.0146781578238622, "grad_norm": 0.7488225820561665, "learning_rate": 4.885256908215532e-06, "loss": 0.3219867706298828, "num_input_tokens_seen": 480347736, "step": 15070, "train_runtime": 39566.5653, "train_tokens_per_second": 12140.243 }, { "epoch": 1.0150148128198222, "grad_norm": 0.7641437941572442, "learning_rate": 4.88261353855744e-06, "loss": 0.30176339149475095, "num_input_tokens_seen": 480510640, "step": 15075, "train_runtime": 39580.0783, "train_tokens_per_second": 12140.214 }, { "epoch": 1.0153514678157824, "grad_norm": 0.7541865739481328, "learning_rate": 4.8799702017261e-06, "loss": 0.26839122772216795, "num_input_tokens_seen": 480668744, "step": 15080, "train_runtime": 39592.846, "train_tokens_per_second": 12140.293 }, { "epoch": 1.0156881228117425, "grad_norm": 0.8337459210320616, "learning_rate": 4.877326898460709e-06, "loss": 0.3106881856918335, "num_input_tokens_seen": 480829912, "step": 15085, "train_runtime": 39606.0808, "train_tokens_per_second": 12140.305 }, { "epoch": 1.0160247778077027, "grad_norm": 0.7239097954927662, "learning_rate": 4.87468362950046e-06, "loss": 0.27660608291625977, "num_input_tokens_seen": 480987872, "step": 15090, "train_runtime": 39619.4693, "train_tokens_per_second": 12140.19 }, { "epoch": 1.0163614328036628, "grad_norm": 0.7957268375717846, "learning_rate": 4.872040395584533e-06, "loss": 0.31780261993408204, "num_input_tokens_seen": 481144784, "step": 15095, "train_runtime": 39632.65, "train_tokens_per_second": 12140.111 }, { "epoch": 1.016698087799623, "grad_norm": 0.8244179066039832, "learning_rate": 4.869397197452104e-06, "loss": 0.27200262546539306, "num_input_tokens_seen": 481305144, "step": 15100, "train_runtime": 39645.3403, "train_tokens_per_second": 12140.27 }, { "epoch": 1.017034742795583, "grad_norm": 0.9390239650385678, "learning_rate": 4.866754035842329e-06, "loss": 0.29276602268218993, "num_input_tokens_seen": 481465384, "step": 15105, "train_runtime": 39659.2215, "train_tokens_per_second": 12140.061 }, { "epoch": 1.0173713977915433, "grad_norm": 0.8400657661915847, "learning_rate": 4.8641109114943666e-06, "loss": 0.29243738651275636, "num_input_tokens_seen": 481622480, "step": 15110, "train_runtime": 39671.9192, "train_tokens_per_second": 12140.136 }, { "epoch": 1.0177080527875033, "grad_norm": 0.7967285330560733, "learning_rate": 4.861467825147352e-06, "loss": 0.29627945423126223, "num_input_tokens_seen": 481781328, "step": 15115, "train_runtime": 39685.4654, "train_tokens_per_second": 12139.994 }, { "epoch": 1.0180447077834636, "grad_norm": 0.8288297329746581, "learning_rate": 4.858824777540419e-06, "loss": 0.29321043491363524, "num_input_tokens_seen": 481940288, "step": 15120, "train_runtime": 39698.0466, "train_tokens_per_second": 12140.151 }, { "epoch": 1.0183813627794236, "grad_norm": 0.816647911107894, "learning_rate": 4.856181769412686e-06, "loss": 0.3050651788711548, "num_input_tokens_seen": 482097384, "step": 15125, "train_runtime": 39711.9621, "train_tokens_per_second": 12139.853 }, { "epoch": 1.0187180177753838, "grad_norm": 0.8161940351398661, "learning_rate": 4.8535388015032644e-06, "loss": 0.3015030860900879, "num_input_tokens_seen": 482256688, "step": 15130, "train_runtime": 39725.415, "train_tokens_per_second": 12139.752 }, { "epoch": 1.0190546727713439, "grad_norm": 0.6881612122333698, "learning_rate": 4.850895874551248e-06, "loss": 0.3095236301422119, "num_input_tokens_seen": 482419000, "step": 15135, "train_runtime": 39738.4578, "train_tokens_per_second": 12139.852 }, { "epoch": 1.0193913277673041, "grad_norm": 0.7944609897360215, "learning_rate": 4.848252989295726e-06, "loss": 0.33499579429626464, "num_input_tokens_seen": 482575296, "step": 15140, "train_runtime": 39751.452, "train_tokens_per_second": 12139.816 }, { "epoch": 1.0197279827632642, "grad_norm": 0.7329336936586256, "learning_rate": 4.845610146475771e-06, "loss": 0.27798492908477784, "num_input_tokens_seen": 482734648, "step": 15145, "train_runtime": 39764.6239, "train_tokens_per_second": 12139.802 }, { "epoch": 1.0200646377592244, "grad_norm": 0.8686166400123077, "learning_rate": 4.842967346830447e-06, "loss": 0.3024160385131836, "num_input_tokens_seen": 482898008, "step": 15150, "train_runtime": 39777.6078, "train_tokens_per_second": 12139.946 }, { "epoch": 1.0204012927551844, "grad_norm": 0.8767784526793144, "learning_rate": 4.840324591098803e-06, "loss": 0.30704617500305176, "num_input_tokens_seen": 483059112, "step": 15155, "train_runtime": 39791.3706, "train_tokens_per_second": 12139.796 }, { "epoch": 1.0207379477511447, "grad_norm": 0.7904418653230822, "learning_rate": 4.83768188001988e-06, "loss": 0.3019458293914795, "num_input_tokens_seen": 483217504, "step": 15160, "train_runtime": 39804.5503, "train_tokens_per_second": 12139.755 }, { "epoch": 1.0210746027471047, "grad_norm": 0.7834581111448851, "learning_rate": 4.835039214332699e-06, "loss": 0.290245509147644, "num_input_tokens_seen": 483376688, "step": 15165, "train_runtime": 39817.4418, "train_tokens_per_second": 12139.823 }, { "epoch": 1.021411257743065, "grad_norm": 0.7200605971762654, "learning_rate": 4.832396594776277e-06, "loss": 0.2989678382873535, "num_input_tokens_seen": 483540280, "step": 15170, "train_runtime": 39829.8639, "train_tokens_per_second": 12140.144 }, { "epoch": 1.021747912739025, "grad_norm": 0.7271107576178001, "learning_rate": 4.82975402208961e-06, "loss": 0.30151023864746096, "num_input_tokens_seen": 483703224, "step": 15175, "train_runtime": 39844.1958, "train_tokens_per_second": 12139.867 }, { "epoch": 1.0220845677349852, "grad_norm": 0.8344344470827905, "learning_rate": 4.827111497011692e-06, "loss": 0.28261580467224123, "num_input_tokens_seen": 483867064, "step": 15180, "train_runtime": 39856.6263, "train_tokens_per_second": 12140.191 }, { "epoch": 1.0224212227309453, "grad_norm": 0.8614747317203577, "learning_rate": 4.82446902028149e-06, "loss": 0.30556159019470214, "num_input_tokens_seen": 484026848, "step": 15185, "train_runtime": 39869.3087, "train_tokens_per_second": 12140.337 }, { "epoch": 1.0227578777269055, "grad_norm": 0.8957681172242815, "learning_rate": 4.821826592637968e-06, "loss": 0.319193172454834, "num_input_tokens_seen": 484186120, "step": 15190, "train_runtime": 39881.961, "train_tokens_per_second": 12140.479 }, { "epoch": 1.0230945327228655, "grad_norm": 0.8000588457774874, "learning_rate": 4.8191842148200694e-06, "loss": 0.3015614986419678, "num_input_tokens_seen": 484349360, "step": 15195, "train_runtime": 39894.8505, "train_tokens_per_second": 12140.649 }, { "epoch": 1.0234311877188258, "grad_norm": 0.8023934231191953, "learning_rate": 4.8165418875667315e-06, "loss": 0.294821572303772, "num_input_tokens_seen": 484511680, "step": 15200, "train_runtime": 39907.4656, "train_tokens_per_second": 12140.878 }, { "epoch": 1.0237678427147858, "grad_norm": 0.6950426551421778, "learning_rate": 4.813899611616867e-06, "loss": 0.3134977102279663, "num_input_tokens_seen": 484672552, "step": 15205, "train_runtime": 39921.3082, "train_tokens_per_second": 12140.698 }, { "epoch": 1.024104497710746, "grad_norm": 0.8182813180711925, "learning_rate": 4.8112573877093855e-06, "loss": 0.2890610218048096, "num_input_tokens_seen": 484835872, "step": 15210, "train_runtime": 39934.5117, "train_tokens_per_second": 12140.774 }, { "epoch": 1.024441152706706, "grad_norm": 0.8090918860339908, "learning_rate": 4.808615216583171e-06, "loss": 0.30469717979431155, "num_input_tokens_seen": 484993168, "step": 15215, "train_runtime": 39948.1935, "train_tokens_per_second": 12140.553 }, { "epoch": 1.0247778077026664, "grad_norm": 0.9146973303528697, "learning_rate": 4.805973098977102e-06, "loss": 0.30773401260375977, "num_input_tokens_seen": 485152816, "step": 15220, "train_runtime": 39962.2664, "train_tokens_per_second": 12140.273 }, { "epoch": 1.0251144626986264, "grad_norm": 0.8529999387159083, "learning_rate": 4.803331035630037e-06, "loss": 0.31885361671447754, "num_input_tokens_seen": 485313400, "step": 15225, "train_runtime": 39974.7027, "train_tokens_per_second": 12140.513 }, { "epoch": 1.0254511176945866, "grad_norm": 0.7727144658216679, "learning_rate": 4.800689027280822e-06, "loss": 0.2875771760940552, "num_input_tokens_seen": 485466152, "step": 15230, "train_runtime": 39987.2924, "train_tokens_per_second": 12140.511 }, { "epoch": 1.0257877726905467, "grad_norm": 0.8244214262196446, "learning_rate": 4.798047074668283e-06, "loss": 0.2990741491317749, "num_input_tokens_seen": 485626072, "step": 15235, "train_runtime": 40000.8223, "train_tokens_per_second": 12140.402 }, { "epoch": 1.026124427686507, "grad_norm": 0.7415401930431901, "learning_rate": 4.795405178531236e-06, "loss": 0.2889739751815796, "num_input_tokens_seen": 485780944, "step": 15240, "train_runtime": 40014.1338, "train_tokens_per_second": 12140.234 }, { "epoch": 1.026461082682467, "grad_norm": 0.8211435189469937, "learning_rate": 4.792763339608478e-06, "loss": 0.3030578374862671, "num_input_tokens_seen": 485934984, "step": 15245, "train_runtime": 40026.7785, "train_tokens_per_second": 12140.247 }, { "epoch": 1.0267977376784272, "grad_norm": 0.8978167915807699, "learning_rate": 4.790121558638793e-06, "loss": 0.2705661773681641, "num_input_tokens_seen": 486096664, "step": 15250, "train_runtime": 40039.599, "train_tokens_per_second": 12140.398 }, { "epoch": 1.0271343926743872, "grad_norm": 0.7609769763577684, "learning_rate": 4.787479836360944e-06, "loss": 0.3211428165435791, "num_input_tokens_seen": 486252624, "step": 15255, "train_runtime": 40052.2741, "train_tokens_per_second": 12140.45 }, { "epoch": 1.0274710476703475, "grad_norm": 0.7844643495384684, "learning_rate": 4.784838173513682e-06, "loss": 0.2951428651809692, "num_input_tokens_seen": 486411344, "step": 15260, "train_runtime": 40065.3555, "train_tokens_per_second": 12140.447 }, { "epoch": 1.0278077026663075, "grad_norm": 0.8478434989614024, "learning_rate": 4.782196570835737e-06, "loss": 0.2943997383117676, "num_input_tokens_seen": 486571448, "step": 15265, "train_runtime": 40077.9033, "train_tokens_per_second": 12140.641 }, { "epoch": 1.0281443576622677, "grad_norm": 0.8195626198569597, "learning_rate": 4.779555029065827e-06, "loss": 0.2975254774093628, "num_input_tokens_seen": 486724128, "step": 15270, "train_runtime": 40090.9795, "train_tokens_per_second": 12140.49 }, { "epoch": 1.0284810126582278, "grad_norm": 0.8116973535849498, "learning_rate": 4.776913548942649e-06, "loss": 0.30239067077636717, "num_input_tokens_seen": 486885704, "step": 15275, "train_runtime": 40103.5686, "train_tokens_per_second": 12140.708 }, { "epoch": 1.028817667654188, "grad_norm": 0.8172848907843281, "learning_rate": 4.774272131204889e-06, "loss": 0.3130920886993408, "num_input_tokens_seen": 487048192, "step": 15280, "train_runtime": 40116.5235, "train_tokens_per_second": 12140.837 }, { "epoch": 1.029154322650148, "grad_norm": 0.8923513541854086, "learning_rate": 4.7716307765912045e-06, "loss": 0.3016470670700073, "num_input_tokens_seen": 487210360, "step": 15285, "train_runtime": 40129.1641, "train_tokens_per_second": 12141.054 }, { "epoch": 1.0294909776461083, "grad_norm": 0.7992772255253157, "learning_rate": 4.768989485840246e-06, "loss": 0.3130969047546387, "num_input_tokens_seen": 487372048, "step": 15290, "train_runtime": 40142.0443, "train_tokens_per_second": 12141.187 }, { "epoch": 1.0298276326420683, "grad_norm": 0.8729193651340412, "learning_rate": 4.766348259690641e-06, "loss": 0.2877023220062256, "num_input_tokens_seen": 487529832, "step": 15295, "train_runtime": 40155.2168, "train_tokens_per_second": 12141.133 }, { "epoch": 1.0301642876380286, "grad_norm": 0.8206803317553585, "learning_rate": 4.763707098881002e-06, "loss": 0.30493950843811035, "num_input_tokens_seen": 487687704, "step": 15300, "train_runtime": 40168.2925, "train_tokens_per_second": 12141.111 }, { "epoch": 1.0305009426339886, "grad_norm": 0.8659920427933887, "learning_rate": 4.761066004149917e-06, "loss": 0.33200578689575194, "num_input_tokens_seen": 487843720, "step": 15305, "train_runtime": 40180.8918, "train_tokens_per_second": 12141.187 }, { "epoch": 1.0308375976299489, "grad_norm": 1.0594039325887077, "learning_rate": 4.758424976235964e-06, "loss": 0.32883241176605227, "num_input_tokens_seen": 488004552, "step": 15310, "train_runtime": 40194.3335, "train_tokens_per_second": 12141.128 }, { "epoch": 1.031174252625909, "grad_norm": 0.8979303497711981, "learning_rate": 4.755784015877694e-06, "loss": 0.3260646343231201, "num_input_tokens_seen": 488166296, "step": 15315, "train_runtime": 40206.8749, "train_tokens_per_second": 12141.364 }, { "epoch": 1.0315109076218691, "grad_norm": 0.8334221380814353, "learning_rate": 4.753143123813646e-06, "loss": 0.3162816524505615, "num_input_tokens_seen": 488322496, "step": 15320, "train_runtime": 40220.0663, "train_tokens_per_second": 12141.265 }, { "epoch": 1.0318475626178292, "grad_norm": 0.8623512113245309, "learning_rate": 4.7505023007823365e-06, "loss": 0.3234898328781128, "num_input_tokens_seen": 488482368, "step": 15325, "train_runtime": 40233.3571, "train_tokens_per_second": 12141.228 }, { "epoch": 1.0321842176137894, "grad_norm": 0.7508707514226148, "learning_rate": 4.747861547522264e-06, "loss": 0.2953406810760498, "num_input_tokens_seen": 488641888, "step": 15330, "train_runtime": 40245.7897, "train_tokens_per_second": 12141.441 }, { "epoch": 1.0325208726097495, "grad_norm": 0.7153252782703782, "learning_rate": 4.745220864771904e-06, "loss": 0.28333287239074706, "num_input_tokens_seen": 488795424, "step": 15335, "train_runtime": 40258.7318, "train_tokens_per_second": 12141.352 }, { "epoch": 1.0328575276057097, "grad_norm": 0.7183356579215424, "learning_rate": 4.742580253269718e-06, "loss": 0.31073908805847167, "num_input_tokens_seen": 488953024, "step": 15340, "train_runtime": 40272.2166, "train_tokens_per_second": 12141.2 }, { "epoch": 1.0331941826016697, "grad_norm": 0.8045495036028653, "learning_rate": 4.739939713754141e-06, "loss": 0.2809459209442139, "num_input_tokens_seen": 489110264, "step": 15345, "train_runtime": 40284.7736, "train_tokens_per_second": 12141.318 }, { "epoch": 1.03353083759763, "grad_norm": 0.8062160834455826, "learning_rate": 4.737299246963597e-06, "loss": 0.30010926723480225, "num_input_tokens_seen": 489271592, "step": 15350, "train_runtime": 40297.9144, "train_tokens_per_second": 12141.363 }, { "epoch": 1.03386749259359, "grad_norm": 0.8086162086935216, "learning_rate": 4.734658853636479e-06, "loss": 0.3008315086364746, "num_input_tokens_seen": 489430112, "step": 15355, "train_runtime": 40311.8248, "train_tokens_per_second": 12141.105 }, { "epoch": 1.0342041475895503, "grad_norm": 0.8431828814749335, "learning_rate": 4.732018534511167e-06, "loss": 0.33202786445617677, "num_input_tokens_seen": 489587040, "step": 15360, "train_runtime": 40324.4524, "train_tokens_per_second": 12141.195 }, { "epoch": 1.0345408025855103, "grad_norm": 0.817599883158712, "learning_rate": 4.729378290326017e-06, "loss": 0.2919569492340088, "num_input_tokens_seen": 489745608, "step": 15365, "train_runtime": 40338.6418, "train_tokens_per_second": 12140.855 }, { "epoch": 1.0348774575814705, "grad_norm": 0.7162527438810427, "learning_rate": 4.726738121819365e-06, "loss": 0.31473674774169924, "num_input_tokens_seen": 489902456, "step": 15370, "train_runtime": 40351.8533, "train_tokens_per_second": 12140.767 }, { "epoch": 1.0352141125774306, "grad_norm": 1.3334678646746396, "learning_rate": 4.7240980297295255e-06, "loss": 0.2772502422332764, "num_input_tokens_seen": 490058768, "step": 15375, "train_runtime": 40365.3463, "train_tokens_per_second": 12140.581 }, { "epoch": 1.0355507675733908, "grad_norm": 0.6610740765076342, "learning_rate": 4.721458014794795e-06, "loss": 0.3005315065383911, "num_input_tokens_seen": 490218904, "step": 15380, "train_runtime": 40378.5379, "train_tokens_per_second": 12140.581 }, { "epoch": 1.0358874225693508, "grad_norm": 0.9759511504699067, "learning_rate": 4.718818077753439e-06, "loss": 0.3232064723968506, "num_input_tokens_seen": 490381560, "step": 15385, "train_runtime": 40392.4697, "train_tokens_per_second": 12140.42 }, { "epoch": 1.036224077565311, "grad_norm": 0.7827665132811843, "learning_rate": 4.716178219343712e-06, "loss": 0.3020668029785156, "num_input_tokens_seen": 490538648, "step": 15390, "train_runtime": 40405.6835, "train_tokens_per_second": 12140.338 }, { "epoch": 1.0365607325612711, "grad_norm": 0.8852796795043774, "learning_rate": 4.713538440303841e-06, "loss": 0.3057693004608154, "num_input_tokens_seen": 490687424, "step": 15395, "train_runtime": 40418.9586, "train_tokens_per_second": 12140.031 }, { "epoch": 1.0368973875572314, "grad_norm": 0.7954186500254895, "learning_rate": 4.7108987413720335e-06, "loss": 0.3214967966079712, "num_input_tokens_seen": 490843712, "step": 15400, "train_runtime": 40431.484, "train_tokens_per_second": 12140.136 }, { "epoch": 1.0372340425531914, "grad_norm": 0.8506904845143792, "learning_rate": 4.708259123286469e-06, "loss": 0.3077725410461426, "num_input_tokens_seen": 490998184, "step": 15405, "train_runtime": 40444.6349, "train_tokens_per_second": 12140.008 }, { "epoch": 1.0375706975491517, "grad_norm": 0.8879981892697617, "learning_rate": 4.7056195867853105e-06, "loss": 0.318404483795166, "num_input_tokens_seen": 491159920, "step": 15410, "train_runtime": 40457.6275, "train_tokens_per_second": 12140.107 }, { "epoch": 1.0379073525451117, "grad_norm": 0.7731614759214138, "learning_rate": 4.702980132606696e-06, "loss": 0.28397555351257325, "num_input_tokens_seen": 491321184, "step": 15415, "train_runtime": 40470.599, "train_tokens_per_second": 12140.2 }, { "epoch": 1.038244007541072, "grad_norm": 0.803677194220429, "learning_rate": 4.700340761488741e-06, "loss": 0.2894084692001343, "num_input_tokens_seen": 491482376, "step": 15420, "train_runtime": 40484.2137, "train_tokens_per_second": 12140.099 }, { "epoch": 1.038580662537032, "grad_norm": 0.7286042600692628, "learning_rate": 4.6977014741695345e-06, "loss": 0.29176557064056396, "num_input_tokens_seen": 491643248, "step": 15425, "train_runtime": 40496.7104, "train_tokens_per_second": 12140.326 }, { "epoch": 1.0389173175329922, "grad_norm": 0.7395624413326506, "learning_rate": 4.69506227138715e-06, "loss": 0.31354827880859376, "num_input_tokens_seen": 491805800, "step": 15430, "train_runtime": 40509.3861, "train_tokens_per_second": 12140.539 }, { "epoch": 1.0392539725289522, "grad_norm": 0.8039203309499465, "learning_rate": 4.6924231538796265e-06, "loss": 0.32450170516967775, "num_input_tokens_seen": 491967504, "step": 15435, "train_runtime": 40522.391, "train_tokens_per_second": 12140.634 }, { "epoch": 1.0395906275249125, "grad_norm": 0.8032907221283301, "learning_rate": 4.6897841223849885e-06, "loss": 0.3096402883529663, "num_input_tokens_seen": 492127240, "step": 15440, "train_runtime": 40535.9591, "train_tokens_per_second": 12140.511 }, { "epoch": 1.0399272825208725, "grad_norm": 0.749873526646356, "learning_rate": 4.68714517764123e-06, "loss": 0.2843073606491089, "num_input_tokens_seen": 492286680, "step": 15445, "train_runtime": 40548.5266, "train_tokens_per_second": 12140.68 }, { "epoch": 1.0402639375168328, "grad_norm": 0.6587176431930899, "learning_rate": 4.684506320386327e-06, "loss": 0.28523907661437986, "num_input_tokens_seen": 492444520, "step": 15450, "train_runtime": 40561.3609, "train_tokens_per_second": 12140.73 }, { "epoch": 1.0406005925127928, "grad_norm": 0.7303682422559145, "learning_rate": 4.6818675513582235e-06, "loss": 0.28906548023223877, "num_input_tokens_seen": 492608048, "step": 15455, "train_runtime": 40574.3712, "train_tokens_per_second": 12140.867 }, { "epoch": 1.040937247508753, "grad_norm": 0.8194671774703502, "learning_rate": 4.679228871294846e-06, "loss": 0.27915356159210203, "num_input_tokens_seen": 492768152, "step": 15460, "train_runtime": 40587.525, "train_tokens_per_second": 12140.877 }, { "epoch": 1.041273902504713, "grad_norm": 0.7888920505638816, "learning_rate": 4.67659028093409e-06, "loss": 0.31377453804016114, "num_input_tokens_seen": 492928560, "step": 15465, "train_runtime": 40600.8218, "train_tokens_per_second": 12140.852 }, { "epoch": 1.0416105575006733, "grad_norm": 0.8654971039360112, "learning_rate": 4.673951781013834e-06, "loss": 0.33304409980773925, "num_input_tokens_seen": 493085824, "step": 15470, "train_runtime": 40613.5563, "train_tokens_per_second": 12140.917 }, { "epoch": 1.0419472124966334, "grad_norm": 0.7575923199417002, "learning_rate": 4.67131337227192e-06, "loss": 0.3072779655456543, "num_input_tokens_seen": 493247632, "step": 15475, "train_runtime": 40627.283, "train_tokens_per_second": 12140.798 }, { "epoch": 1.0422838674925936, "grad_norm": 0.7684046271365783, "learning_rate": 4.668675055446175e-06, "loss": 0.31185169219970704, "num_input_tokens_seen": 493406584, "step": 15480, "train_runtime": 40640.9476, "train_tokens_per_second": 12140.627 }, { "epoch": 1.0426205224885536, "grad_norm": 0.9795255158061947, "learning_rate": 4.666036831274392e-06, "loss": 0.27005825042724607, "num_input_tokens_seen": 493561712, "step": 15485, "train_runtime": 40653.6877, "train_tokens_per_second": 12140.638 }, { "epoch": 1.0429571774845139, "grad_norm": 1.4538015681097096, "learning_rate": 4.663398700494346e-06, "loss": 0.3166783332824707, "num_input_tokens_seen": 493718920, "step": 15490, "train_runtime": 40666.7895, "train_tokens_per_second": 12140.593 }, { "epoch": 1.043293832480474, "grad_norm": 0.8044585270951892, "learning_rate": 4.66076066384378e-06, "loss": 0.3103484153747559, "num_input_tokens_seen": 493878224, "step": 15495, "train_runtime": 40679.3423, "train_tokens_per_second": 12140.762 }, { "epoch": 1.0436304874764342, "grad_norm": 0.6685193897646251, "learning_rate": 4.658122722060413e-06, "loss": 0.31473257541656496, "num_input_tokens_seen": 494038504, "step": 15500, "train_runtime": 40692.9579, "train_tokens_per_second": 12140.639 }, { "epoch": 1.0439671424723942, "grad_norm": 0.7640360760465873, "learning_rate": 4.655484875881935e-06, "loss": 0.32730019092559814, "num_input_tokens_seen": 494198512, "step": 15505, "train_runtime": 40706.1495, "train_tokens_per_second": 12140.635 }, { "epoch": 1.0443037974683544, "grad_norm": 0.836737033993298, "learning_rate": 4.652847126046014e-06, "loss": 0.3173715114593506, "num_input_tokens_seen": 494349400, "step": 15510, "train_runtime": 40720.3218, "train_tokens_per_second": 12140.115 }, { "epoch": 1.0446404524643145, "grad_norm": 0.7870292674168577, "learning_rate": 4.650209473290286e-06, "loss": 0.32094688415527345, "num_input_tokens_seen": 494509480, "step": 15515, "train_runtime": 40733.3751, "train_tokens_per_second": 12140.155 }, { "epoch": 1.0449771074602747, "grad_norm": 0.8205299701544333, "learning_rate": 4.647571918352366e-06, "loss": 0.3088592529296875, "num_input_tokens_seen": 494667656, "step": 15520, "train_runtime": 40745.9057, "train_tokens_per_second": 12140.303 }, { "epoch": 1.0453137624562348, "grad_norm": 0.7961879693116772, "learning_rate": 4.644934461969833e-06, "loss": 0.3034135103225708, "num_input_tokens_seen": 494829920, "step": 15525, "train_runtime": 40758.3436, "train_tokens_per_second": 12140.58 }, { "epoch": 1.045650417452195, "grad_norm": 0.7129139091123158, "learning_rate": 4.642297104880247e-06, "loss": 0.2811610698699951, "num_input_tokens_seen": 494991504, "step": 15530, "train_runtime": 40772.0416, "train_tokens_per_second": 12140.464 }, { "epoch": 1.045987072448155, "grad_norm": 0.7970021500580954, "learning_rate": 4.639659847821133e-06, "loss": 0.2915218353271484, "num_input_tokens_seen": 495151544, "step": 15535, "train_runtime": 40785.6407, "train_tokens_per_second": 12140.34 }, { "epoch": 1.0463237274441153, "grad_norm": 0.8432601612760606, "learning_rate": 4.6370226915299945e-06, "loss": 0.3025413274765015, "num_input_tokens_seen": 495309792, "step": 15540, "train_runtime": 40799.0033, "train_tokens_per_second": 12140.242 }, { "epoch": 1.0466603824400753, "grad_norm": 0.7736505353016837, "learning_rate": 4.634385636744302e-06, "loss": 0.31579957008361814, "num_input_tokens_seen": 495472608, "step": 15545, "train_runtime": 40811.6696, "train_tokens_per_second": 12140.464 }, { "epoch": 1.0469970374360356, "grad_norm": 0.8542988788107384, "learning_rate": 4.631748684201503e-06, "loss": 0.3162078380584717, "num_input_tokens_seen": 495632320, "step": 15550, "train_runtime": 40824.0897, "train_tokens_per_second": 12140.683 }, { "epoch": 1.0473336924319956, "grad_norm": 0.7574058631996403, "learning_rate": 4.629111834639008e-06, "loss": 0.28935353755950927, "num_input_tokens_seen": 495792040, "step": 15555, "train_runtime": 40836.7542, "train_tokens_per_second": 12140.829 }, { "epoch": 1.0476703474279558, "grad_norm": 0.7752268236907609, "learning_rate": 4.626475088794206e-06, "loss": 0.29108147621154784, "num_input_tokens_seen": 495952568, "step": 15560, "train_runtime": 40849.184, "train_tokens_per_second": 12141.064 }, { "epoch": 1.0480070024239159, "grad_norm": 0.8281505396948898, "learning_rate": 4.623838447404454e-06, "loss": 0.3071067094802856, "num_input_tokens_seen": 496114448, "step": 15565, "train_runtime": 40862.3416, "train_tokens_per_second": 12141.116 }, { "epoch": 1.0483436574198761, "grad_norm": 0.7021233706746992, "learning_rate": 4.621201911207082e-06, "loss": 0.3025949478149414, "num_input_tokens_seen": 496271224, "step": 15570, "train_runtime": 40875.5846, "train_tokens_per_second": 12141.018 }, { "epoch": 1.0486803124158361, "grad_norm": 0.7382981012676141, "learning_rate": 4.618565480939387e-06, "loss": 0.3078681468963623, "num_input_tokens_seen": 496434328, "step": 15575, "train_runtime": 40888.4466, "train_tokens_per_second": 12141.188 }, { "epoch": 1.0490169674117964, "grad_norm": 0.8784045966814769, "learning_rate": 4.6159291573386395e-06, "loss": 0.30956554412841797, "num_input_tokens_seen": 496592456, "step": 15580, "train_runtime": 40901.0196, "train_tokens_per_second": 12141.322 }, { "epoch": 1.0493536224077564, "grad_norm": 0.7080734204547475, "learning_rate": 4.613292941142077e-06, "loss": 0.309919548034668, "num_input_tokens_seen": 496751808, "step": 15585, "train_runtime": 40913.4755, "train_tokens_per_second": 12141.521 }, { "epoch": 1.0496902774037167, "grad_norm": 0.8020327765750802, "learning_rate": 4.610656833086912e-06, "loss": 0.30821919441223145, "num_input_tokens_seen": 496905200, "step": 15590, "train_runtime": 40926.6312, "train_tokens_per_second": 12141.366 }, { "epoch": 1.0500269323996767, "grad_norm": 0.9070846713266137, "learning_rate": 4.60802083391032e-06, "loss": 0.3466046333312988, "num_input_tokens_seen": 497064136, "step": 15595, "train_runtime": 40939.7696, "train_tokens_per_second": 12141.352 }, { "epoch": 1.050363587395637, "grad_norm": 0.7913533398088878, "learning_rate": 4.605384944349454e-06, "loss": 0.277728796005249, "num_input_tokens_seen": 497221256, "step": 15600, "train_runtime": 40952.8472, "train_tokens_per_second": 12141.311 }, { "epoch": 1.050700242391597, "grad_norm": 0.7437937794846986, "learning_rate": 4.602749165141429e-06, "loss": 0.2947253942489624, "num_input_tokens_seen": 497377224, "step": 15605, "train_runtime": 40966.7459, "train_tokens_per_second": 12140.999 }, { "epoch": 1.0510368973875572, "grad_norm": 0.7639512433659383, "learning_rate": 4.600113497023333e-06, "loss": 0.32112808227539064, "num_input_tokens_seen": 497536024, "step": 15610, "train_runtime": 40979.9151, "train_tokens_per_second": 12140.973 }, { "epoch": 1.0513735523835175, "grad_norm": 0.7825943430599259, "learning_rate": 4.597477940732222e-06, "loss": 0.29928107261657716, "num_input_tokens_seen": 497691088, "step": 15615, "train_runtime": 40992.8746, "train_tokens_per_second": 12140.917 }, { "epoch": 1.0517102073794775, "grad_norm": 0.8224364231495325, "learning_rate": 4.594842497005124e-06, "loss": 0.29639034271240233, "num_input_tokens_seen": 497851400, "step": 15620, "train_runtime": 41005.7774, "train_tokens_per_second": 12141.006 }, { "epoch": 1.0520468623754375, "grad_norm": 0.71963143504583, "learning_rate": 4.5922071665790264e-06, "loss": 0.3243539810180664, "num_input_tokens_seen": 498008624, "step": 15625, "train_runtime": 41018.8641, "train_tokens_per_second": 12140.966 }, { "epoch": 1.0523835173713978, "grad_norm": 0.7394806230325817, "learning_rate": 4.589571950190897e-06, "loss": 0.3089911460876465, "num_input_tokens_seen": 498172464, "step": 15630, "train_runtime": 41031.3015, "train_tokens_per_second": 12141.279 }, { "epoch": 1.052720172367358, "grad_norm": 0.7693978980750562, "learning_rate": 4.586936848577661e-06, "loss": 0.3002563238143921, "num_input_tokens_seen": 498333256, "step": 15635, "train_runtime": 41044.9279, "train_tokens_per_second": 12141.165 }, { "epoch": 1.053056827363318, "grad_norm": 0.7220698823164534, "learning_rate": 4.584301862476219e-06, "loss": 0.3249997138977051, "num_input_tokens_seen": 498491424, "step": 15640, "train_runtime": 41057.9386, "train_tokens_per_second": 12141.17 }, { "epoch": 1.053393482359278, "grad_norm": 0.7580345413979345, "learning_rate": 4.581666992623435e-06, "loss": 0.2922648906707764, "num_input_tokens_seen": 498655264, "step": 15645, "train_runtime": 41070.395, "train_tokens_per_second": 12141.477 }, { "epoch": 1.0537301373552383, "grad_norm": 0.8604028925426824, "learning_rate": 4.579032239756144e-06, "loss": 0.30808842182159424, "num_input_tokens_seen": 498814264, "step": 15650, "train_runtime": 41083.889, "train_tokens_per_second": 12141.359 }, { "epoch": 1.0540667923511986, "grad_norm": 0.7604796423457374, "learning_rate": 4.576397604611143e-06, "loss": 0.3018012285232544, "num_input_tokens_seen": 498975768, "step": 15655, "train_runtime": 41097.1878, "train_tokens_per_second": 12141.36 }, { "epoch": 1.0544034473471586, "grad_norm": 0.7729971816117196, "learning_rate": 4.573763087925202e-06, "loss": 0.304763650894165, "num_input_tokens_seen": 499137976, "step": 15660, "train_runtime": 41110.3329, "train_tokens_per_second": 12141.424 }, { "epoch": 1.0547401023431189, "grad_norm": 0.8166783729445071, "learning_rate": 4.571128690435053e-06, "loss": 0.3164165258407593, "num_input_tokens_seen": 499299984, "step": 15665, "train_runtime": 41122.9174, "train_tokens_per_second": 12141.648 }, { "epoch": 1.055076757339079, "grad_norm": 0.9523824673439621, "learning_rate": 4.568494412877401e-06, "loss": 0.3166008472442627, "num_input_tokens_seen": 499454520, "step": 15670, "train_runtime": 41136.268, "train_tokens_per_second": 12141.464 }, { "epoch": 1.0554134123350392, "grad_norm": 0.8604205059395552, "learning_rate": 4.565860255988908e-06, "loss": 0.30739483833312986, "num_input_tokens_seen": 499610736, "step": 15675, "train_runtime": 41149.4833, "train_tokens_per_second": 12141.361 }, { "epoch": 1.0557500673309992, "grad_norm": 0.8599882474328476, "learning_rate": 4.563226220506212e-06, "loss": 0.3091917037963867, "num_input_tokens_seen": 499774576, "step": 15680, "train_runtime": 41161.932, "train_tokens_per_second": 12141.67 }, { "epoch": 1.0560867223269594, "grad_norm": 0.7166199216375662, "learning_rate": 4.5605923071659085e-06, "loss": 0.3108429193496704, "num_input_tokens_seen": 499932088, "step": 15685, "train_runtime": 41175.2927, "train_tokens_per_second": 12141.555 }, { "epoch": 1.0564233773229195, "grad_norm": 0.7783368747610865, "learning_rate": 4.557958516704566e-06, "loss": 0.29545657634735106, "num_input_tokens_seen": 500093016, "step": 15690, "train_runtime": 41188.8206, "train_tokens_per_second": 12141.475 }, { "epoch": 1.0567600323188797, "grad_norm": 0.7639467038269939, "learning_rate": 4.5553248498587144e-06, "loss": 0.30799593925476076, "num_input_tokens_seen": 500249704, "step": 15695, "train_runtime": 41201.8753, "train_tokens_per_second": 12141.43 }, { "epoch": 1.0570966873148397, "grad_norm": 0.855452169072172, "learning_rate": 4.552691307364853e-06, "loss": 0.31041455268859863, "num_input_tokens_seen": 500409136, "step": 15700, "train_runtime": 41215.9419, "train_tokens_per_second": 12141.155 }, { "epoch": 1.0574333423108, "grad_norm": 0.9157896787688669, "learning_rate": 4.5500578899594375e-06, "loss": 0.3277078866958618, "num_input_tokens_seen": 500570952, "step": 15705, "train_runtime": 41229.81, "train_tokens_per_second": 12140.996 }, { "epoch": 1.05776999730676, "grad_norm": 0.7489539433497033, "learning_rate": 4.5474245983789e-06, "loss": 0.3013786315917969, "num_input_tokens_seen": 500727568, "step": 15710, "train_runtime": 41242.2364, "train_tokens_per_second": 12141.135 }, { "epoch": 1.0581066523027203, "grad_norm": 0.740308006414045, "learning_rate": 4.54479143335963e-06, "loss": 0.29260926246643065, "num_input_tokens_seen": 500890432, "step": 15715, "train_runtime": 41255.0153, "train_tokens_per_second": 12141.322 }, { "epoch": 1.0584433072986803, "grad_norm": 0.8392210769341023, "learning_rate": 4.5421583956379855e-06, "loss": 0.317919921875, "num_input_tokens_seen": 501049616, "step": 15720, "train_runtime": 41268.4443, "train_tokens_per_second": 12141.229 }, { "epoch": 1.0587799622946406, "grad_norm": 0.7869549951404201, "learning_rate": 4.539525485950284e-06, "loss": 0.2929553508758545, "num_input_tokens_seen": 501213432, "step": 15725, "train_runtime": 41281.545, "train_tokens_per_second": 12141.344 }, { "epoch": 1.0591166172906006, "grad_norm": 0.9557886922130165, "learning_rate": 4.536892705032815e-06, "loss": 0.32071738243103026, "num_input_tokens_seen": 501372832, "step": 15730, "train_runtime": 41294.1911, "train_tokens_per_second": 12141.486 }, { "epoch": 1.0594532722865608, "grad_norm": 0.8043401353079279, "learning_rate": 4.534260053621821e-06, "loss": 0.29186296463012695, "num_input_tokens_seen": 501533064, "step": 15735, "train_runtime": 41307.8357, "train_tokens_per_second": 12141.354 }, { "epoch": 1.0597899272825209, "grad_norm": 0.8026413405454789, "learning_rate": 4.531627532453519e-06, "loss": 0.27665510177612307, "num_input_tokens_seen": 501691976, "step": 15740, "train_runtime": 41320.6017, "train_tokens_per_second": 12141.449 }, { "epoch": 1.0601265822784811, "grad_norm": 0.7889160677144242, "learning_rate": 4.5289951422640826e-06, "loss": 0.32256455421447755, "num_input_tokens_seen": 501847936, "step": 15745, "train_runtime": 41333.609, "train_tokens_per_second": 12141.401 }, { "epoch": 1.0604632372744411, "grad_norm": 0.826341886805559, "learning_rate": 4.526362883789655e-06, "loss": 0.29686803817749025, "num_input_tokens_seen": 502010752, "step": 15750, "train_runtime": 41346.5267, "train_tokens_per_second": 12141.546 }, { "epoch": 1.0607998922704014, "grad_norm": 0.9112805532666093, "learning_rate": 4.5237307577663345e-06, "loss": 0.33019020557403567, "num_input_tokens_seen": 502172528, "step": 15755, "train_runtime": 41359.0966, "train_tokens_per_second": 12141.767 }, { "epoch": 1.0611365472663614, "grad_norm": 0.6938062080422588, "learning_rate": 4.52109876493019e-06, "loss": 0.3061249256134033, "num_input_tokens_seen": 502334584, "step": 15760, "train_runtime": 41372.9119, "train_tokens_per_second": 12141.63 }, { "epoch": 1.0614732022623217, "grad_norm": 0.7370196937125292, "learning_rate": 4.518466906017249e-06, "loss": 0.3247066974639893, "num_input_tokens_seen": 502495160, "step": 15765, "train_runtime": 41386.4269, "train_tokens_per_second": 12141.545 }, { "epoch": 1.0618098572582817, "grad_norm": 0.8087408045747353, "learning_rate": 4.515835181763503e-06, "loss": 0.29228289127349855, "num_input_tokens_seen": 502654008, "step": 15770, "train_runtime": 41398.9834, "train_tokens_per_second": 12141.699 }, { "epoch": 1.062146512254242, "grad_norm": 0.7414272672545331, "learning_rate": 4.513203592904903e-06, "loss": 0.3032099962234497, "num_input_tokens_seen": 502815408, "step": 15775, "train_runtime": 41412.0057, "train_tokens_per_second": 12141.779 }, { "epoch": 1.062483167250202, "grad_norm": 0.7887934841677506, "learning_rate": 4.510572140177368e-06, "loss": 0.31247117519378664, "num_input_tokens_seen": 502979248, "step": 15780, "train_runtime": 41424.4474, "train_tokens_per_second": 12142.087 }, { "epoch": 1.0628198222461622, "grad_norm": 0.817120390119069, "learning_rate": 4.507940824316771e-06, "loss": 0.3199119567871094, "num_input_tokens_seen": 503138144, "step": 15785, "train_runtime": 41437.8429, "train_tokens_per_second": 12141.997 }, { "epoch": 1.0631564772421223, "grad_norm": 0.7163399295997693, "learning_rate": 4.505309646058954e-06, "loss": 0.3010636568069458, "num_input_tokens_seen": 503300400, "step": 15790, "train_runtime": 41451.2585, "train_tokens_per_second": 12141.981 }, { "epoch": 1.0634931322380825, "grad_norm": 0.8698374743160174, "learning_rate": 4.502678606139716e-06, "loss": 0.2943506956100464, "num_input_tokens_seen": 503459832, "step": 15795, "train_runtime": 41464.3194, "train_tokens_per_second": 12142.002 }, { "epoch": 1.0638297872340425, "grad_norm": 0.683418469449124, "learning_rate": 4.500047705294823e-06, "loss": 0.27575345039367677, "num_input_tokens_seen": 503622704, "step": 15800, "train_runtime": 41477.4484, "train_tokens_per_second": 12142.085 }, { "epoch": 1.0641664422300028, "grad_norm": 0.7433492874399087, "learning_rate": 4.497416944259993e-06, "loss": 0.30148606300354003, "num_input_tokens_seen": 503784960, "step": 15805, "train_runtime": 41491.405, "train_tokens_per_second": 12141.911 }, { "epoch": 1.0645030972259628, "grad_norm": 0.784045647285606, "learning_rate": 4.494786323770912e-06, "loss": 0.3191340684890747, "num_input_tokens_seen": 503946344, "step": 15810, "train_runtime": 41504.4859, "train_tokens_per_second": 12141.973 }, { "epoch": 1.064839752221923, "grad_norm": 0.8038057768448763, "learning_rate": 4.492155844563224e-06, "loss": 0.2987980842590332, "num_input_tokens_seen": 504106392, "step": 15815, "train_runtime": 41518.0631, "train_tokens_per_second": 12141.857 }, { "epoch": 1.065176407217883, "grad_norm": 0.8278255813891302, "learning_rate": 4.489525507372537e-06, "loss": 0.3317086696624756, "num_input_tokens_seen": 504260776, "step": 15820, "train_runtime": 41530.5376, "train_tokens_per_second": 12141.927 }, { "epoch": 1.0655130622138433, "grad_norm": 0.7605081211399658, "learning_rate": 4.486895312934411e-06, "loss": 0.29726648330688477, "num_input_tokens_seen": 504419984, "step": 15825, "train_runtime": 41543.5078, "train_tokens_per_second": 12141.969 }, { "epoch": 1.0658497172098034, "grad_norm": 0.8892114411078401, "learning_rate": 4.484265261984378e-06, "loss": 0.35415384769439695, "num_input_tokens_seen": 504583480, "step": 15830, "train_runtime": 41556.5287, "train_tokens_per_second": 12142.099 }, { "epoch": 1.0661863722057636, "grad_norm": 0.7911529635978167, "learning_rate": 4.4816353552579165e-06, "loss": 0.29717953205108644, "num_input_tokens_seen": 504740904, "step": 15835, "train_runtime": 41569.5041, "train_tokens_per_second": 12142.096 }, { "epoch": 1.0665230272017237, "grad_norm": 0.8164744324364961, "learning_rate": 4.479005593490477e-06, "loss": 0.3261962175369263, "num_input_tokens_seen": 504899536, "step": 15840, "train_runtime": 41582.1907, "train_tokens_per_second": 12142.206 }, { "epoch": 1.066859682197684, "grad_norm": 0.7472282273296579, "learning_rate": 4.476375977417461e-06, "loss": 0.2812601089477539, "num_input_tokens_seen": 505061560, "step": 15845, "train_runtime": 41594.7742, "train_tokens_per_second": 12142.428 }, { "epoch": 1.067196337193644, "grad_norm": 0.8945826388832476, "learning_rate": 4.473746507774235e-06, "loss": 0.30530753135681155, "num_input_tokens_seen": 505224600, "step": 15850, "train_runtime": 41607.6248, "train_tokens_per_second": 12142.597 }, { "epoch": 1.0675329921896042, "grad_norm": 0.796737877670132, "learning_rate": 4.471117185296117e-06, "loss": 0.28793628215789796, "num_input_tokens_seen": 505384632, "step": 15855, "train_runtime": 41620.5553, "train_tokens_per_second": 12142.669 }, { "epoch": 1.0678696471855642, "grad_norm": 0.7141899690343959, "learning_rate": 4.468488010718394e-06, "loss": 0.2760047435760498, "num_input_tokens_seen": 505540816, "step": 15860, "train_runtime": 41634.3455, "train_tokens_per_second": 12142.399 }, { "epoch": 1.0682063021815245, "grad_norm": 0.8149575204075473, "learning_rate": 4.465858984776302e-06, "loss": 0.3093507528305054, "num_input_tokens_seen": 505698672, "step": 15865, "train_runtime": 41647.2736, "train_tokens_per_second": 12142.42 }, { "epoch": 1.0685429571774845, "grad_norm": 0.7756964961522265, "learning_rate": 4.463230108205044e-06, "loss": 0.30608930587768557, "num_input_tokens_seen": 505849368, "step": 15870, "train_runtime": 41661.6765, "train_tokens_per_second": 12141.839 }, { "epoch": 1.0688796121734447, "grad_norm": 0.7299853686580681, "learning_rate": 4.460601381739772e-06, "loss": 0.30599393844604494, "num_input_tokens_seen": 506012200, "step": 15875, "train_runtime": 41675.1316, "train_tokens_per_second": 12141.826 }, { "epoch": 1.0692162671694048, "grad_norm": 0.8044127197515359, "learning_rate": 4.457972806115607e-06, "loss": 0.3312252044677734, "num_input_tokens_seen": 506171584, "step": 15880, "train_runtime": 41687.606, "train_tokens_per_second": 12142.016 }, { "epoch": 1.069552922165365, "grad_norm": 0.7622947813623563, "learning_rate": 4.455344382067616e-06, "loss": 0.29750833511352537, "num_input_tokens_seen": 506326216, "step": 15885, "train_runtime": 41700.1445, "train_tokens_per_second": 12142.073 }, { "epoch": 1.069889577161325, "grad_norm": 0.7900556405084451, "learning_rate": 4.452716110330832e-06, "loss": 0.3218410015106201, "num_input_tokens_seen": 506488256, "step": 15890, "train_runtime": 41713.1883, "train_tokens_per_second": 12142.161 }, { "epoch": 1.0702262321572853, "grad_norm": 0.7674155895751068, "learning_rate": 4.450087991640242e-06, "loss": 0.2956411123275757, "num_input_tokens_seen": 506642552, "step": 15895, "train_runtime": 41726.8616, "train_tokens_per_second": 12141.88 }, { "epoch": 1.0705628871532453, "grad_norm": 0.8400634289493644, "learning_rate": 4.447460026730794e-06, "loss": 0.31752021312713624, "num_input_tokens_seen": 506802544, "step": 15900, "train_runtime": 41740.0769, "train_tokens_per_second": 12141.869 }, { "epoch": 1.0708995421492056, "grad_norm": 0.8674125441207241, "learning_rate": 4.444832216337384e-06, "loss": 0.2998190879821777, "num_input_tokens_seen": 506961352, "step": 15905, "train_runtime": 41753.6472, "train_tokens_per_second": 12141.726 }, { "epoch": 1.0712361971451656, "grad_norm": 1.0146359541815608, "learning_rate": 4.442204561194877e-06, "loss": 0.30346121788024905, "num_input_tokens_seen": 507119544, "step": 15910, "train_runtime": 41766.8454, "train_tokens_per_second": 12141.677 }, { "epoch": 1.0715728521411259, "grad_norm": 0.7726994426895054, "learning_rate": 4.439577062038085e-06, "loss": 0.29607155323028567, "num_input_tokens_seen": 507283384, "step": 15915, "train_runtime": 41779.2663, "train_tokens_per_second": 12141.989 }, { "epoch": 1.0719095071370859, "grad_norm": 0.7931230438107604, "learning_rate": 4.436949719601782e-06, "loss": 0.32483975887298583, "num_input_tokens_seen": 507438968, "step": 15920, "train_runtime": 41792.2795, "train_tokens_per_second": 12141.931 }, { "epoch": 1.0722461621330461, "grad_norm": 0.8944388649128798, "learning_rate": 4.434322534620692e-06, "loss": 0.32542123794555666, "num_input_tokens_seen": 507591744, "step": 15925, "train_runtime": 41805.472, "train_tokens_per_second": 12141.754 }, { "epoch": 1.0725828171290062, "grad_norm": 0.7009415269611473, "learning_rate": 4.431695507829504e-06, "loss": 0.2663717269897461, "num_input_tokens_seen": 507752888, "step": 15930, "train_runtime": 41818.5581, "train_tokens_per_second": 12141.808 }, { "epoch": 1.0729194721249664, "grad_norm": 0.8945073836205689, "learning_rate": 4.429068639962853e-06, "loss": 0.3137186050415039, "num_input_tokens_seen": 507906136, "step": 15935, "train_runtime": 41831.3185, "train_tokens_per_second": 12141.767 }, { "epoch": 1.0732561271209264, "grad_norm": 0.7892931047698717, "learning_rate": 4.426441931755337e-06, "loss": 0.3003633260726929, "num_input_tokens_seen": 508068256, "step": 15940, "train_runtime": 41843.9013, "train_tokens_per_second": 12141.991 }, { "epoch": 1.0735927821168867, "grad_norm": 0.7050125545508502, "learning_rate": 4.4238153839415045e-06, "loss": 0.30908546447753904, "num_input_tokens_seen": 508229096, "step": 15945, "train_runtime": 41856.3796, "train_tokens_per_second": 12142.213 }, { "epoch": 1.0739294371128467, "grad_norm": 0.8246728697405513, "learning_rate": 4.421188997255865e-06, "loss": 0.3237894058227539, "num_input_tokens_seen": 508380424, "step": 15950, "train_runtime": 41869.1635, "train_tokens_per_second": 12142.12 }, { "epoch": 1.074266092108807, "grad_norm": 0.8006298435114627, "learning_rate": 4.418562772432874e-06, "loss": 0.31391019821166993, "num_input_tokens_seen": 508539688, "step": 15955, "train_runtime": 41882.3198, "train_tokens_per_second": 12142.109 }, { "epoch": 1.074602747104767, "grad_norm": 0.8411378775283455, "learning_rate": 4.415936710206952e-06, "loss": 0.30562567710876465, "num_input_tokens_seen": 508702216, "step": 15960, "train_runtime": 41894.9891, "train_tokens_per_second": 12142.316 }, { "epoch": 1.0749394021007272, "grad_norm": 0.7928299260507526, "learning_rate": 4.413310811312465e-06, "loss": 0.3055277824401855, "num_input_tokens_seen": 508860928, "step": 15965, "train_runtime": 41908.3745, "train_tokens_per_second": 12142.225 }, { "epoch": 1.0752760570966873, "grad_norm": 0.7318352729499958, "learning_rate": 4.41068507648374e-06, "loss": 0.2734399318695068, "num_input_tokens_seen": 509021128, "step": 15970, "train_runtime": 41921.1686, "train_tokens_per_second": 12142.341 }, { "epoch": 1.0756127120926475, "grad_norm": 0.7689755499687533, "learning_rate": 4.408059506455053e-06, "loss": 0.29433891773223875, "num_input_tokens_seen": 509184576, "step": 15975, "train_runtime": 41934.1652, "train_tokens_per_second": 12142.476 }, { "epoch": 1.0759493670886076, "grad_norm": 0.7597709482532323, "learning_rate": 4.40543410196064e-06, "loss": 0.31100993156433104, "num_input_tokens_seen": 509345904, "step": 15980, "train_runtime": 41947.0494, "train_tokens_per_second": 12142.592 }, { "epoch": 1.0762860220845678, "grad_norm": 0.8336391826154143, "learning_rate": 4.402808863734681e-06, "loss": 0.3164000272750854, "num_input_tokens_seen": 509507320, "step": 15985, "train_runtime": 41961.2752, "train_tokens_per_second": 12142.322 }, { "epoch": 1.0766226770805278, "grad_norm": 0.6956734429204328, "learning_rate": 4.40018379251132e-06, "loss": 0.30722713470458984, "num_input_tokens_seen": 509668672, "step": 15990, "train_runtime": 41974.1459, "train_tokens_per_second": 12142.443 }, { "epoch": 1.076959332076488, "grad_norm": 0.8787725042611539, "learning_rate": 4.397558889024649e-06, "loss": 0.3348447322845459, "num_input_tokens_seen": 509826056, "step": 15995, "train_runtime": 41987.2304, "train_tokens_per_second": 12142.407 }, { "epoch": 1.0772959870724481, "grad_norm": 0.7063604512091014, "learning_rate": 4.394934154008715e-06, "loss": 0.3141545295715332, "num_input_tokens_seen": 509983328, "step": 16000, "train_runtime": 41999.6493, "train_tokens_per_second": 12142.562 }, { "epoch": 1.0776326420684084, "grad_norm": 0.7582125772597686, "learning_rate": 4.392309588197514e-06, "loss": 0.3068138837814331, "num_input_tokens_seen": 510143712, "step": 16005, "train_runtime": 42012.8988, "train_tokens_per_second": 12142.55 }, { "epoch": 1.0779692970643684, "grad_norm": 0.7331137660688943, "learning_rate": 4.389685192324999e-06, "loss": 0.29303736686706544, "num_input_tokens_seen": 510302152, "step": 16010, "train_runtime": 42026.1676, "train_tokens_per_second": 12142.486 }, { "epoch": 1.0783059520603286, "grad_norm": 0.72484844650925, "learning_rate": 4.387060967125073e-06, "loss": 0.32088570594787597, "num_input_tokens_seen": 510455976, "step": 16015, "train_runtime": 42039.7395, "train_tokens_per_second": 12142.225 }, { "epoch": 1.0786426070562887, "grad_norm": 0.8753196315765692, "learning_rate": 4.384436913331596e-06, "loss": 0.33355059623718264, "num_input_tokens_seen": 510617360, "step": 16020, "train_runtime": 42052.5935, "train_tokens_per_second": 12142.351 }, { "epoch": 1.078979262052249, "grad_norm": 0.755121324850921, "learning_rate": 4.38181303167837e-06, "loss": 0.29300589561462403, "num_input_tokens_seen": 510779032, "step": 16025, "train_runtime": 42065.7711, "train_tokens_per_second": 12142.391 }, { "epoch": 1.079315917048209, "grad_norm": 0.8011959734887001, "learning_rate": 4.379189322899159e-06, "loss": 0.28904061317443847, "num_input_tokens_seen": 510932624, "step": 16030, "train_runtime": 42079.1941, "train_tokens_per_second": 12142.168 }, { "epoch": 1.0796525720441692, "grad_norm": 0.8032161697039722, "learning_rate": 4.376565787727676e-06, "loss": 0.3017615079879761, "num_input_tokens_seen": 511092704, "step": 16035, "train_runtime": 42092.6723, "train_tokens_per_second": 12142.083 }, { "epoch": 1.0799892270401292, "grad_norm": 0.7768452477087278, "learning_rate": 4.373942426897581e-06, "loss": 0.30951457023620604, "num_input_tokens_seen": 511247584, "step": 16040, "train_runtime": 42105.2347, "train_tokens_per_second": 12142.138 }, { "epoch": 1.0803258820360895, "grad_norm": 0.8152582723648151, "learning_rate": 4.37131924114249e-06, "loss": 0.3175765037536621, "num_input_tokens_seen": 511404032, "step": 16045, "train_runtime": 42118.3127, "train_tokens_per_second": 12142.083 }, { "epoch": 1.0806625370320495, "grad_norm": 0.7479414952160768, "learning_rate": 4.368696231195968e-06, "loss": 0.3115133047103882, "num_input_tokens_seen": 511565848, "step": 16050, "train_runtime": 42131.1813, "train_tokens_per_second": 12142.215 }, { "epoch": 1.0809991920280098, "grad_norm": 0.8664411279547134, "learning_rate": 4.366073397791534e-06, "loss": 0.289443826675415, "num_input_tokens_seen": 511725400, "step": 16055, "train_runtime": 42145.1265, "train_tokens_per_second": 12141.983 }, { "epoch": 1.0813358470239698, "grad_norm": 0.770396154441638, "learning_rate": 4.363450741662651e-06, "loss": 0.27687194347381594, "num_input_tokens_seen": 511886168, "step": 16060, "train_runtime": 42157.5451, "train_tokens_per_second": 12142.22 }, { "epoch": 1.08167250201993, "grad_norm": 0.8068595200622422, "learning_rate": 4.360828263542739e-06, "loss": 0.28565425872802735, "num_input_tokens_seen": 512045872, "step": 16065, "train_runtime": 42170.8663, "train_tokens_per_second": 12142.171 }, { "epoch": 1.08200915701589, "grad_norm": 0.8152651172299057, "learning_rate": 4.358205964165164e-06, "loss": 0.30882987976074217, "num_input_tokens_seen": 512207848, "step": 16070, "train_runtime": 42184.0081, "train_tokens_per_second": 12142.228 }, { "epoch": 1.0823458120118503, "grad_norm": 0.7961550000669346, "learning_rate": 4.355583844263247e-06, "loss": 0.3348849773406982, "num_input_tokens_seen": 512368568, "step": 16075, "train_runtime": 42196.9026, "train_tokens_per_second": 12142.326 }, { "epoch": 1.0826824670078103, "grad_norm": 0.8597139183818611, "learning_rate": 4.352961904570251e-06, "loss": 0.29843184947967527, "num_input_tokens_seen": 512523552, "step": 16080, "train_runtime": 42209.6572, "train_tokens_per_second": 12142.329 }, { "epoch": 1.0830191220037706, "grad_norm": 0.6999582326364607, "learning_rate": 4.350340145819397e-06, "loss": 0.3177281379699707, "num_input_tokens_seen": 512681984, "step": 16085, "train_runtime": 42223.134, "train_tokens_per_second": 12142.206 }, { "epoch": 1.0833557769997306, "grad_norm": 0.7630997784370741, "learning_rate": 4.347718568743847e-06, "loss": 0.3115131616592407, "num_input_tokens_seen": 512842496, "step": 16090, "train_runtime": 42235.5777, "train_tokens_per_second": 12142.429 }, { "epoch": 1.0836924319956909, "grad_norm": 0.796934092352418, "learning_rate": 4.34509717407672e-06, "loss": 0.32775604724884033, "num_input_tokens_seen": 513005936, "step": 16095, "train_runtime": 42248.5852, "train_tokens_per_second": 12142.559 }, { "epoch": 1.084029086991651, "grad_norm": 0.7837319483259637, "learning_rate": 4.342475962551081e-06, "loss": 0.3085785865783691, "num_input_tokens_seen": 513165168, "step": 16100, "train_runtime": 42261.6237, "train_tokens_per_second": 12142.58 }, { "epoch": 1.0843657419876112, "grad_norm": 0.747949236586764, "learning_rate": 4.339854934899943e-06, "loss": 0.2832313299179077, "num_input_tokens_seen": 513324136, "step": 16105, "train_runtime": 42275.5947, "train_tokens_per_second": 12142.328 }, { "epoch": 1.0847023969835712, "grad_norm": 0.6801092182516424, "learning_rate": 4.337234091856265e-06, "loss": 0.2824375867843628, "num_input_tokens_seen": 513485968, "step": 16110, "train_runtime": 42288.1265, "train_tokens_per_second": 12142.557 }, { "epoch": 1.0850390519795314, "grad_norm": 0.7876340660063319, "learning_rate": 4.334613434152961e-06, "loss": 0.2991558313369751, "num_input_tokens_seen": 513639936, "step": 16115, "train_runtime": 42300.5636, "train_tokens_per_second": 12142.626 }, { "epoch": 1.0853757069754915, "grad_norm": 0.858270331322216, "learning_rate": 4.331992962522888e-06, "loss": 0.33192427158355714, "num_input_tokens_seen": 513801240, "step": 16120, "train_runtime": 42313.2839, "train_tokens_per_second": 12142.788 }, { "epoch": 1.0857123619714517, "grad_norm": 0.7623271972473266, "learning_rate": 4.329372677698854e-06, "loss": 0.31349477767944334, "num_input_tokens_seen": 513965080, "step": 16125, "train_runtime": 42325.7019, "train_tokens_per_second": 12143.096 }, { "epoch": 1.0860490169674117, "grad_norm": 0.8325650038048475, "learning_rate": 4.3267525804136114e-06, "loss": 0.3035757064819336, "num_input_tokens_seen": 514121144, "step": 16130, "train_runtime": 42338.4827, "train_tokens_per_second": 12143.117 }, { "epoch": 1.086385671963372, "grad_norm": 0.8215091915349555, "learning_rate": 4.324132671399864e-06, "loss": 0.31330142021179197, "num_input_tokens_seen": 514278736, "step": 16135, "train_runtime": 42352.2375, "train_tokens_per_second": 12142.894 }, { "epoch": 1.086722326959332, "grad_norm": 0.9517379181212042, "learning_rate": 4.321512951390258e-06, "loss": 0.31854069232940674, "num_input_tokens_seen": 514438768, "step": 16140, "train_runtime": 42365.4203, "train_tokens_per_second": 12142.893 }, { "epoch": 1.0870589819552923, "grad_norm": 0.7432116493268239, "learning_rate": 4.318893421117393e-06, "loss": 0.2987842082977295, "num_input_tokens_seen": 514597536, "step": 16145, "train_runtime": 42378.1645, "train_tokens_per_second": 12142.988 }, { "epoch": 1.0873956369512523, "grad_norm": 0.7099860604888883, "learning_rate": 4.31627408131381e-06, "loss": 0.29923858642578127, "num_input_tokens_seen": 514757216, "step": 16150, "train_runtime": 42391.5934, "train_tokens_per_second": 12142.908 }, { "epoch": 1.0877322919472125, "grad_norm": 0.7513437885259707, "learning_rate": 4.313654932712001e-06, "loss": 0.28290209770202634, "num_input_tokens_seen": 514917192, "step": 16155, "train_runtime": 42404.8049, "train_tokens_per_second": 12142.897 }, { "epoch": 1.0880689469431726, "grad_norm": 0.6917614094403428, "learning_rate": 4.3110359760444e-06, "loss": 0.30543758869171145, "num_input_tokens_seen": 515080744, "step": 16160, "train_runtime": 42417.837, "train_tokens_per_second": 12143.022 }, { "epoch": 1.0884056019391328, "grad_norm": 0.7059364529527964, "learning_rate": 4.308417212043392e-06, "loss": 0.2869384527206421, "num_input_tokens_seen": 515237120, "step": 16165, "train_runtime": 42430.6585, "train_tokens_per_second": 12143.038 }, { "epoch": 1.0887422569350929, "grad_norm": 0.7587259656975229, "learning_rate": 4.305798641441304e-06, "loss": 0.28521573543548584, "num_input_tokens_seen": 515397672, "step": 16170, "train_runtime": 42443.4915, "train_tokens_per_second": 12143.15 }, { "epoch": 1.089078911931053, "grad_norm": 0.7671442724109391, "learning_rate": 4.303180264970416e-06, "loss": 0.3034674644470215, "num_input_tokens_seen": 515557768, "step": 16175, "train_runtime": 42457.2775, "train_tokens_per_second": 12142.978 }, { "epoch": 1.0894155669270131, "grad_norm": 0.7247684279515608, "learning_rate": 4.3005620833629415e-06, "loss": 0.2748046875, "num_input_tokens_seen": 515717744, "step": 16180, "train_runtime": 42470.5221, "train_tokens_per_second": 12142.957 }, { "epoch": 1.0897522219229734, "grad_norm": 0.8195842749574394, "learning_rate": 4.297944097351053e-06, "loss": 0.3098749160766602, "num_input_tokens_seen": 515873776, "step": 16185, "train_runtime": 42483.2906, "train_tokens_per_second": 12142.981 }, { "epoch": 1.0900888769189334, "grad_norm": 0.7156167363580491, "learning_rate": 4.295326307666856e-06, "loss": 0.3206508159637451, "num_input_tokens_seen": 516037224, "step": 16190, "train_runtime": 42496.2986, "train_tokens_per_second": 12143.11 }, { "epoch": 1.0904255319148937, "grad_norm": 0.8095871146954722, "learning_rate": 4.292708715042411e-06, "loss": 0.29314846992492677, "num_input_tokens_seen": 516193800, "step": 16195, "train_runtime": 42508.8235, "train_tokens_per_second": 12143.215 }, { "epoch": 1.0907621869108537, "grad_norm": 0.8612207401482795, "learning_rate": 4.290091320209718e-06, "loss": 0.31816318035125735, "num_input_tokens_seen": 516356952, "step": 16200, "train_runtime": 42521.6828, "train_tokens_per_second": 12143.38 }, { "epoch": 1.091098841906814, "grad_norm": 0.7573667487632446, "learning_rate": 4.287474123900726e-06, "loss": 0.310860800743103, "num_input_tokens_seen": 516512480, "step": 16205, "train_runtime": 42534.8384, "train_tokens_per_second": 12143.281 }, { "epoch": 1.091435496902774, "grad_norm": 0.8128234652222646, "learning_rate": 4.284857126847321e-06, "loss": 0.3073211669921875, "num_input_tokens_seen": 516666920, "step": 16210, "train_runtime": 42547.4742, "train_tokens_per_second": 12143.304 }, { "epoch": 1.0917721518987342, "grad_norm": 0.7519137562268962, "learning_rate": 4.28224032978134e-06, "loss": 0.3210838794708252, "num_input_tokens_seen": 516830112, "step": 16215, "train_runtime": 42560.351, "train_tokens_per_second": 12143.465 }, { "epoch": 1.0921088068946943, "grad_norm": 0.7849906032769867, "learning_rate": 4.279623733434561e-06, "loss": 0.3127107620239258, "num_input_tokens_seen": 516991288, "step": 16220, "train_runtime": 42573.8003, "train_tokens_per_second": 12143.414 }, { "epoch": 1.0924454618906545, "grad_norm": 0.7941015624118866, "learning_rate": 4.277007338538711e-06, "loss": 0.27778594493865966, "num_input_tokens_seen": 517154008, "step": 16225, "train_runtime": 42586.5184, "train_tokens_per_second": 12143.609 }, { "epoch": 1.0927821168866145, "grad_norm": 0.6385759084636674, "learning_rate": 4.27439114582545e-06, "loss": 0.27554757595062257, "num_input_tokens_seen": 517316352, "step": 16230, "train_runtime": 42600.0405, "train_tokens_per_second": 12143.565 }, { "epoch": 1.0931187718825748, "grad_norm": 0.869868839253338, "learning_rate": 4.271775156026395e-06, "loss": 0.32135074138641356, "num_input_tokens_seen": 517473040, "step": 16235, "train_runtime": 42613.4852, "train_tokens_per_second": 12143.41 }, { "epoch": 1.0934554268785348, "grad_norm": 0.7097794953608657, "learning_rate": 4.269159369873093e-06, "loss": 0.3008142948150635, "num_input_tokens_seen": 517625936, "step": 16240, "train_runtime": 42626.7102, "train_tokens_per_second": 12143.23 }, { "epoch": 1.093792081874495, "grad_norm": 1.0745335015887238, "learning_rate": 4.266543788097043e-06, "loss": 0.29512729644775393, "num_input_tokens_seen": 517789568, "step": 16245, "train_runtime": 42640.4063, "train_tokens_per_second": 12143.167 }, { "epoch": 1.094128736870455, "grad_norm": 0.8386242349730625, "learning_rate": 4.263928411429683e-06, "loss": 0.3487131595611572, "num_input_tokens_seen": 517945176, "step": 16250, "train_runtime": 42653.0038, "train_tokens_per_second": 12143.229 }, { "epoch": 1.0944653918664153, "grad_norm": 0.8708778387863215, "learning_rate": 4.261313240602398e-06, "loss": 0.31237106323242186, "num_input_tokens_seen": 518102840, "step": 16255, "train_runtime": 42666.6208, "train_tokens_per_second": 12143.048 }, { "epoch": 1.0948020468623754, "grad_norm": 0.8713071305026213, "learning_rate": 4.2586982763465064e-06, "loss": 0.29385929107666015, "num_input_tokens_seen": 518264520, "step": 16260, "train_runtime": 42679.1445, "train_tokens_per_second": 12143.273 }, { "epoch": 1.0951387018583356, "grad_norm": 0.8034382762500902, "learning_rate": 4.256083519393281e-06, "loss": 0.3068211078643799, "num_input_tokens_seen": 518426200, "step": 16265, "train_runtime": 42692.2797, "train_tokens_per_second": 12143.324 }, { "epoch": 1.0954753568542956, "grad_norm": 0.7950086549599764, "learning_rate": 4.253468970473925e-06, "loss": 0.3150953769683838, "num_input_tokens_seen": 518586184, "step": 16270, "train_runtime": 42705.1534, "train_tokens_per_second": 12143.41 }, { "epoch": 1.095812011850256, "grad_norm": 0.8054529714464732, "learning_rate": 4.250854630319593e-06, "loss": 0.3317426204681396, "num_input_tokens_seen": 518742464, "step": 16275, "train_runtime": 42717.8194, "train_tokens_per_second": 12143.468 }, { "epoch": 1.096148666846216, "grad_norm": 0.756324090329135, "learning_rate": 4.248240499661373e-06, "loss": 0.3024318218231201, "num_input_tokens_seen": 518896976, "step": 16280, "train_runtime": 42731.5139, "train_tokens_per_second": 12143.192 }, { "epoch": 1.0964853218421762, "grad_norm": 0.8768147154005344, "learning_rate": 4.245626579230302e-06, "loss": 0.27411704063415526, "num_input_tokens_seen": 519056016, "step": 16285, "train_runtime": 42744.6587, "train_tokens_per_second": 12143.178 }, { "epoch": 1.0968219768381362, "grad_norm": 0.9908850979949622, "learning_rate": 4.243012869757351e-06, "loss": 0.30057971477508544, "num_input_tokens_seen": 519219856, "step": 16290, "train_runtime": 42757.076, "train_tokens_per_second": 12143.484 }, { "epoch": 1.0971586318340965, "grad_norm": 0.7797781971021313, "learning_rate": 4.240399371973438e-06, "loss": 0.29999120235443116, "num_input_tokens_seen": 519382704, "step": 16295, "train_runtime": 42769.8186, "train_tokens_per_second": 12143.673 }, { "epoch": 1.0974952868300565, "grad_norm": 0.859772325255097, "learning_rate": 4.2377860866094165e-06, "loss": 0.32585830688476564, "num_input_tokens_seen": 519543296, "step": 16300, "train_runtime": 42782.8828, "train_tokens_per_second": 12143.719 }, { "epoch": 1.0978319418260167, "grad_norm": 0.8872067994313502, "learning_rate": 4.235173014396088e-06, "loss": 0.3113248348236084, "num_input_tokens_seen": 519702328, "step": 16305, "train_runtime": 42796.179, "train_tokens_per_second": 12143.662 }, { "epoch": 1.0981685968219768, "grad_norm": 0.718673312506372, "learning_rate": 4.2325601560641854e-06, "loss": 0.3198572874069214, "num_input_tokens_seen": 519865744, "step": 16310, "train_runtime": 42809.1587, "train_tokens_per_second": 12143.797 }, { "epoch": 1.098505251817937, "grad_norm": 0.7161498524569786, "learning_rate": 4.229947512344389e-06, "loss": 0.2932559013366699, "num_input_tokens_seen": 520024976, "step": 16315, "train_runtime": 42822.5452, "train_tokens_per_second": 12143.719 }, { "epoch": 1.098841906813897, "grad_norm": 0.8005662693779073, "learning_rate": 4.227335083967314e-06, "loss": 0.31361708641052244, "num_input_tokens_seen": 520181872, "step": 16320, "train_runtime": 42835.4124, "train_tokens_per_second": 12143.734 }, { "epoch": 1.0991785618098573, "grad_norm": 0.7712369108361606, "learning_rate": 4.224722871663522e-06, "loss": 0.28961164951324464, "num_input_tokens_seen": 520339752, "step": 16325, "train_runtime": 42848.8611, "train_tokens_per_second": 12143.608 }, { "epoch": 1.0995152168058173, "grad_norm": 0.7155936063193538, "learning_rate": 4.222110876163503e-06, "loss": 0.33086836338043213, "num_input_tokens_seen": 520502560, "step": 16330, "train_runtime": 42861.3023, "train_tokens_per_second": 12143.881 }, { "epoch": 1.0998518718017776, "grad_norm": 0.8198435314464898, "learning_rate": 4.2194990981977e-06, "loss": 0.29511992931365966, "num_input_tokens_seen": 520662472, "step": 16335, "train_runtime": 42873.7238, "train_tokens_per_second": 12144.093 }, { "epoch": 1.1001885267977376, "grad_norm": 0.8116702693724875, "learning_rate": 4.216887538496482e-06, "loss": 0.2890969753265381, "num_input_tokens_seen": 520821680, "step": 16340, "train_runtime": 42887.0836, "train_tokens_per_second": 12144.022 }, { "epoch": 1.1005251817936978, "grad_norm": 0.8439012904713973, "learning_rate": 4.2142761977901695e-06, "loss": 0.3554262161254883, "num_input_tokens_seen": 520981152, "step": 16345, "train_runtime": 42900.6133, "train_tokens_per_second": 12143.909 }, { "epoch": 1.1008618367896579, "grad_norm": 0.8427584736798379, "learning_rate": 4.21166507680901e-06, "loss": 0.32249984741210935, "num_input_tokens_seen": 521135152, "step": 16350, "train_runtime": 42913.7727, "train_tokens_per_second": 12143.774 }, { "epoch": 1.1011984917856181, "grad_norm": 0.8113832346360442, "learning_rate": 4.209054176283202e-06, "loss": 0.29596123695373533, "num_input_tokens_seen": 521294072, "step": 16355, "train_runtime": 42926.9982, "train_tokens_per_second": 12143.735 }, { "epoch": 1.1015351467815782, "grad_norm": 0.818554904791197, "learning_rate": 4.206443496942868e-06, "loss": 0.3072291374206543, "num_input_tokens_seen": 521450224, "step": 16360, "train_runtime": 42939.7323, "train_tokens_per_second": 12143.77 }, { "epoch": 1.1018718017775384, "grad_norm": 0.8274487066904288, "learning_rate": 4.203833039518081e-06, "loss": 0.2813434600830078, "num_input_tokens_seen": 521607248, "step": 16365, "train_runtime": 42952.2583, "train_tokens_per_second": 12143.884 }, { "epoch": 1.1022084567734984, "grad_norm": 0.8316527632743279, "learning_rate": 4.201222804738845e-06, "loss": 0.3044417381286621, "num_input_tokens_seen": 521769136, "step": 16370, "train_runtime": 42965.3723, "train_tokens_per_second": 12143.945 }, { "epoch": 1.1025451117694587, "grad_norm": 0.8340993615080122, "learning_rate": 4.198612793335107e-06, "loss": 0.29143385887145995, "num_input_tokens_seen": 521929304, "step": 16375, "train_runtime": 42978.425, "train_tokens_per_second": 12143.984 }, { "epoch": 1.1028817667654187, "grad_norm": 0.718624256411508, "learning_rate": 4.196003006036743e-06, "loss": 0.3010996341705322, "num_input_tokens_seen": 522087632, "step": 16380, "train_runtime": 42991.6727, "train_tokens_per_second": 12143.925 }, { "epoch": 1.103218421761379, "grad_norm": 0.8493770822721732, "learning_rate": 4.193393443573576e-06, "loss": 0.3024613857269287, "num_input_tokens_seen": 522247224, "step": 16385, "train_runtime": 43004.6825, "train_tokens_per_second": 12143.962 }, { "epoch": 1.103555076757339, "grad_norm": 0.7905228265671207, "learning_rate": 4.19078410667536e-06, "loss": 0.32945923805236815, "num_input_tokens_seen": 522405720, "step": 16390, "train_runtime": 43017.601, "train_tokens_per_second": 12143.999 }, { "epoch": 1.1038917317532992, "grad_norm": 0.7281244545542417, "learning_rate": 4.188174996071788e-06, "loss": 0.318757438659668, "num_input_tokens_seen": 522553984, "step": 16395, "train_runtime": 43031.4871, "train_tokens_per_second": 12143.526 }, { "epoch": 1.1042283867492593, "grad_norm": 0.6973509107367324, "learning_rate": 4.18556611249249e-06, "loss": 0.2981884956359863, "num_input_tokens_seen": 522715456, "step": 16400, "train_runtime": 43045.0699, "train_tokens_per_second": 12143.445 }, { "epoch": 1.1045650417452195, "grad_norm": 0.9465322310336238, "learning_rate": 4.182957456667032e-06, "loss": 0.3188304901123047, "num_input_tokens_seen": 522877272, "step": 16405, "train_runtime": 43057.4845, "train_tokens_per_second": 12143.702 }, { "epoch": 1.1049016967411796, "grad_norm": 0.7581757107786998, "learning_rate": 4.1803490293249145e-06, "loss": 0.33195176124572756, "num_input_tokens_seen": 523035664, "step": 16410, "train_runtime": 43070.0534, "train_tokens_per_second": 12143.836 }, { "epoch": 1.1052383517371398, "grad_norm": 0.904014876714174, "learning_rate": 4.1777408311955785e-06, "loss": 0.30089755058288575, "num_input_tokens_seen": 523190776, "step": 16415, "train_runtime": 43083.5498, "train_tokens_per_second": 12143.632 }, { "epoch": 1.1055750067330998, "grad_norm": 0.837501695323459, "learning_rate": 4.175132863008395e-06, "loss": 0.34442529678344724, "num_input_tokens_seen": 523350912, "step": 16420, "train_runtime": 43096.4372, "train_tokens_per_second": 12143.716 }, { "epoch": 1.10591166172906, "grad_norm": 0.8964836524563399, "learning_rate": 4.17252512549268e-06, "loss": 0.3033717632293701, "num_input_tokens_seen": 523498544, "step": 16425, "train_runtime": 43109.3181, "train_tokens_per_second": 12143.513 }, { "epoch": 1.10624831672502, "grad_norm": 0.8016503796216948, "learning_rate": 4.169917619377671e-06, "loss": 0.3006324768066406, "num_input_tokens_seen": 523660816, "step": 16430, "train_runtime": 43123.4433, "train_tokens_per_second": 12143.298 }, { "epoch": 1.1065849717209804, "grad_norm": 0.9109348937175265, "learning_rate": 4.167310345392557e-06, "loss": 0.34682116508483884, "num_input_tokens_seen": 523815320, "step": 16435, "train_runtime": 43136.5392, "train_tokens_per_second": 12143.193 }, { "epoch": 1.1069216267169404, "grad_norm": 0.7323176495317748, "learning_rate": 4.1647033042664455e-06, "loss": 0.3289669990539551, "num_input_tokens_seen": 523972552, "step": 16440, "train_runtime": 43149.5086, "train_tokens_per_second": 12143.187 }, { "epoch": 1.1072582817129006, "grad_norm": 0.7290678296039488, "learning_rate": 4.162096496728394e-06, "loss": 0.29602556228637694, "num_input_tokens_seen": 524131424, "step": 16445, "train_runtime": 43162.1037, "train_tokens_per_second": 12143.324 }, { "epoch": 1.1075949367088607, "grad_norm": 0.7978316542718361, "learning_rate": 4.1594899235073835e-06, "loss": 0.30616140365600586, "num_input_tokens_seen": 524295264, "step": 16450, "train_runtime": 43174.536, "train_tokens_per_second": 12143.622 }, { "epoch": 1.107931591704821, "grad_norm": 0.781256768571631, "learning_rate": 4.156883585332338e-06, "loss": 0.334748649597168, "num_input_tokens_seen": 524457800, "step": 16455, "train_runtime": 43187.209, "train_tokens_per_second": 12143.823 }, { "epoch": 1.108268246700781, "grad_norm": 0.7021335378116609, "learning_rate": 4.154277482932107e-06, "loss": 0.32042970657348635, "num_input_tokens_seen": 524612320, "step": 16460, "train_runtime": 43200.701, "train_tokens_per_second": 12143.607 }, { "epoch": 1.1086049016967412, "grad_norm": 0.7534201172928595, "learning_rate": 4.151671617035482e-06, "loss": 0.3039975881576538, "num_input_tokens_seen": 524767480, "step": 16465, "train_runtime": 43214.0198, "train_tokens_per_second": 12143.454 }, { "epoch": 1.1089415566927012, "grad_norm": 0.7479141175427881, "learning_rate": 4.149065988371184e-06, "loss": 0.2894607067108154, "num_input_tokens_seen": 524926032, "step": 16470, "train_runtime": 43227.2765, "train_tokens_per_second": 12143.398 }, { "epoch": 1.1092782116886615, "grad_norm": 0.8108807130173762, "learning_rate": 4.14646059766787e-06, "loss": 0.30585517883300783, "num_input_tokens_seen": 525082032, "step": 16475, "train_runtime": 43240.5102, "train_tokens_per_second": 12143.289 }, { "epoch": 1.1096148666846215, "grad_norm": 0.7130893484730619, "learning_rate": 4.143855445654127e-06, "loss": 0.29894223213195803, "num_input_tokens_seen": 525245440, "step": 16480, "train_runtime": 43253.514, "train_tokens_per_second": 12143.417 }, { "epoch": 1.1099515216805818, "grad_norm": 0.79610241847635, "learning_rate": 4.14125053305848e-06, "loss": 0.28519444465637206, "num_input_tokens_seen": 525398920, "step": 16485, "train_runtime": 43266.79, "train_tokens_per_second": 12143.238 }, { "epoch": 1.1102881766765418, "grad_norm": 0.7824865959683505, "learning_rate": 4.1386458606093805e-06, "loss": 0.29976956844329833, "num_input_tokens_seen": 525556680, "step": 16490, "train_runtime": 43279.5548, "train_tokens_per_second": 12143.301 }, { "epoch": 1.110624831672502, "grad_norm": 0.8259920341179898, "learning_rate": 4.1360414290352214e-06, "loss": 0.3209113121032715, "num_input_tokens_seen": 525719296, "step": 16495, "train_runtime": 43292.9762, "train_tokens_per_second": 12143.293 }, { "epoch": 1.110961486668462, "grad_norm": 0.859160619417763, "learning_rate": 4.1334372390643205e-06, "loss": 0.2984657287597656, "num_input_tokens_seen": 525883136, "step": 16500, "train_runtime": 43305.4094, "train_tokens_per_second": 12143.59 }, { "epoch": 1.1112981416644223, "grad_norm": 0.6938627820686201, "learning_rate": 4.130833291424934e-06, "loss": 0.31500074863433836, "num_input_tokens_seen": 526042736, "step": 16505, "train_runtime": 43317.8314, "train_tokens_per_second": 12143.792 }, { "epoch": 1.1116347966603823, "grad_norm": 0.835906323663683, "learning_rate": 4.128229586845244e-06, "loss": 0.28493990898132326, "num_input_tokens_seen": 526203664, "step": 16510, "train_runtime": 43331.7279, "train_tokens_per_second": 12143.611 }, { "epoch": 1.1119714516563426, "grad_norm": 0.6310815118440094, "learning_rate": 4.125626126053372e-06, "loss": 0.2798593521118164, "num_input_tokens_seen": 526362624, "step": 16515, "train_runtime": 43344.7326, "train_tokens_per_second": 12143.635 }, { "epoch": 1.1123081066523026, "grad_norm": 0.9261497840544736, "learning_rate": 4.123022909777364e-06, "loss": 0.3052553176879883, "num_input_tokens_seen": 526521336, "step": 16520, "train_runtime": 43357.8937, "train_tokens_per_second": 12143.61 }, { "epoch": 1.1126447616482629, "grad_norm": 0.7816107238166144, "learning_rate": 4.120419938745205e-06, "loss": 0.3066908359527588, "num_input_tokens_seen": 526684096, "step": 16525, "train_runtime": 43370.3495, "train_tokens_per_second": 12143.875 }, { "epoch": 1.112981416644223, "grad_norm": 0.8504062852433165, "learning_rate": 4.1178172136848035e-06, "loss": 0.28658390045166016, "num_input_tokens_seen": 526838464, "step": 16530, "train_runtime": 43383.4231, "train_tokens_per_second": 12143.774 }, { "epoch": 1.1133180716401831, "grad_norm": 0.8675535768661058, "learning_rate": 4.115214735324007e-06, "loss": 0.2815955638885498, "num_input_tokens_seen": 527000888, "step": 16535, "train_runtime": 43396.074, "train_tokens_per_second": 12143.976 }, { "epoch": 1.1136547266361432, "grad_norm": 0.6944688251897749, "learning_rate": 4.112612504390586e-06, "loss": 0.27120413780212405, "num_input_tokens_seen": 527162456, "step": 16540, "train_runtime": 43409.5836, "train_tokens_per_second": 12143.919 }, { "epoch": 1.1139913816321034, "grad_norm": 0.805256165583911, "learning_rate": 4.11001052161225e-06, "loss": 0.3365485668182373, "num_input_tokens_seen": 527324944, "step": 16545, "train_runtime": 43422.2685, "train_tokens_per_second": 12144.113 }, { "epoch": 1.1143280366280637, "grad_norm": 0.8204477946750075, "learning_rate": 4.107408787716632e-06, "loss": 0.31297597885131834, "num_input_tokens_seen": 527486544, "step": 16550, "train_runtime": 43435.3376, "train_tokens_per_second": 12144.18 }, { "epoch": 1.1146646916240237, "grad_norm": 0.7456119447474984, "learning_rate": 4.104807303431303e-06, "loss": 0.306234073638916, "num_input_tokens_seen": 527647064, "step": 16555, "train_runtime": 43448.8515, "train_tokens_per_second": 12144.097 }, { "epoch": 1.1150013466199837, "grad_norm": 0.9037303363720901, "learning_rate": 4.102206069483754e-06, "loss": 0.32191832065582277, "num_input_tokens_seen": 527805888, "step": 16560, "train_runtime": 43462.3067, "train_tokens_per_second": 12143.992 }, { "epoch": 1.115338001615944, "grad_norm": 0.757956349276041, "learning_rate": 4.099605086601417e-06, "loss": 0.27638850212097166, "num_input_tokens_seen": 527959464, "step": 16565, "train_runtime": 43475.5428, "train_tokens_per_second": 12143.827 }, { "epoch": 1.1156746566119042, "grad_norm": 0.8258892845370119, "learning_rate": 4.097004355511645e-06, "loss": 0.29239535331726074, "num_input_tokens_seen": 528120168, "step": 16570, "train_runtime": 43488.3866, "train_tokens_per_second": 12143.936 }, { "epoch": 1.1160113116078643, "grad_norm": 0.8407072578587406, "learning_rate": 4.094403876941728e-06, "loss": 0.2621783971786499, "num_input_tokens_seen": 528275312, "step": 16575, "train_runtime": 43500.8833, "train_tokens_per_second": 12144.013 }, { "epoch": 1.1163479666038243, "grad_norm": 0.658608673412688, "learning_rate": 4.0918036516188755e-06, "loss": 0.30341520309448244, "num_input_tokens_seen": 528432456, "step": 16580, "train_runtime": 43514.5116, "train_tokens_per_second": 12143.821 }, { "epoch": 1.1166846215997845, "grad_norm": 0.8418078009048707, "learning_rate": 4.0892036802702395e-06, "loss": 0.30974364280700684, "num_input_tokens_seen": 528595328, "step": 16585, "train_runtime": 43528.0076, "train_tokens_per_second": 12143.798 }, { "epoch": 1.1170212765957448, "grad_norm": 0.7506779725085156, "learning_rate": 4.086603963622887e-06, "loss": 0.28029513359069824, "num_input_tokens_seen": 528758272, "step": 16590, "train_runtime": 43541.365, "train_tokens_per_second": 12143.815 }, { "epoch": 1.1173579315917048, "grad_norm": 0.7899748690850563, "learning_rate": 4.084004502403825e-06, "loss": 0.3236206293106079, "num_input_tokens_seen": 528915520, "step": 16595, "train_runtime": 43553.83, "train_tokens_per_second": 12143.95 }, { "epoch": 1.1176945865876649, "grad_norm": 0.8160660957938676, "learning_rate": 4.081405297339982e-06, "loss": 0.29514460563659667, "num_input_tokens_seen": 529077376, "step": 16600, "train_runtime": 43566.3436, "train_tokens_per_second": 12144.177 }, { "epoch": 1.118031241583625, "grad_norm": 0.8004454304729841, "learning_rate": 4.0788063491582205e-06, "loss": 0.30223424434661866, "num_input_tokens_seen": 529234712, "step": 16605, "train_runtime": 43579.8, "train_tokens_per_second": 12144.037 }, { "epoch": 1.1183678965795854, "grad_norm": 0.9197485130715908, "learning_rate": 4.076207658585323e-06, "loss": 0.2935061454772949, "num_input_tokens_seen": 529395640, "step": 16610, "train_runtime": 43592.2692, "train_tokens_per_second": 12144.255 }, { "epoch": 1.1187045515755454, "grad_norm": 0.7625676317862476, "learning_rate": 4.07360922634801e-06, "loss": 0.290375804901123, "num_input_tokens_seen": 529556856, "step": 16615, "train_runtime": 43604.7781, "train_tokens_per_second": 12144.469 }, { "epoch": 1.1190412065715054, "grad_norm": 0.8281950940102131, "learning_rate": 4.071011053172922e-06, "loss": 0.30091009140014646, "num_input_tokens_seen": 529713856, "step": 16620, "train_runtime": 43618.8239, "train_tokens_per_second": 12144.157 }, { "epoch": 1.1193778615674657, "grad_norm": 0.7652072948984868, "learning_rate": 4.068413139786631e-06, "loss": 0.29552178382873534, "num_input_tokens_seen": 529873080, "step": 16625, "train_runtime": 43632.1521, "train_tokens_per_second": 12144.097 }, { "epoch": 1.119714516563426, "grad_norm": 0.8067537723081993, "learning_rate": 4.065815486915635e-06, "loss": 0.29994003772735595, "num_input_tokens_seen": 530036304, "step": 16630, "train_runtime": 43645.0514, "train_tokens_per_second": 12144.247 }, { "epoch": 1.120051171559386, "grad_norm": 0.7635841509137418, "learning_rate": 4.063218095286359e-06, "loss": 0.3320046901702881, "num_input_tokens_seen": 530199312, "step": 16635, "train_runtime": 43658.4209, "train_tokens_per_second": 12144.262 }, { "epoch": 1.120387826555346, "grad_norm": 0.8083874794780219, "learning_rate": 4.0606209656251555e-06, "loss": 0.28829739093780515, "num_input_tokens_seen": 530360624, "step": 16640, "train_runtime": 43671.5548, "train_tokens_per_second": 12144.304 }, { "epoch": 1.1207244815513062, "grad_norm": 0.7545106323823049, "learning_rate": 4.058024098658304e-06, "loss": 0.3185067415237427, "num_input_tokens_seen": 530522584, "step": 16645, "train_runtime": 43684.555, "train_tokens_per_second": 12144.397 }, { "epoch": 1.1210611365472665, "grad_norm": 0.7614003109930435, "learning_rate": 4.055427495112008e-06, "loss": 0.33021135330200196, "num_input_tokens_seen": 530683832, "step": 16650, "train_runtime": 43698.2113, "train_tokens_per_second": 12144.292 }, { "epoch": 1.1213977915432265, "grad_norm": 0.8262777941969183, "learning_rate": 4.052831155712403e-06, "loss": 0.2895543098449707, "num_input_tokens_seen": 530843408, "step": 16655, "train_runtime": 43710.8212, "train_tokens_per_second": 12144.439 }, { "epoch": 1.1217344465391865, "grad_norm": 0.681354448943446, "learning_rate": 4.050235081185544e-06, "loss": 0.26581830978393556, "num_input_tokens_seen": 531001680, "step": 16660, "train_runtime": 43723.8715, "train_tokens_per_second": 12144.434 }, { "epoch": 1.1220711015351468, "grad_norm": 0.8463176991030703, "learning_rate": 4.047639272257415e-06, "loss": 0.30289411544799805, "num_input_tokens_seen": 531164384, "step": 16665, "train_runtime": 43737.2279, "train_tokens_per_second": 12144.446 }, { "epoch": 1.122407756531107, "grad_norm": 0.7271047054456528, "learning_rate": 4.045043729653927e-06, "loss": 0.27604360580444337, "num_input_tokens_seen": 531327568, "step": 16670, "train_runtime": 43750.3117, "train_tokens_per_second": 12144.544 }, { "epoch": 1.122744411527067, "grad_norm": 0.7827703865542933, "learning_rate": 4.0424484541009175e-06, "loss": 0.3208983659744263, "num_input_tokens_seen": 531490688, "step": 16675, "train_runtime": 43762.7727, "train_tokens_per_second": 12144.813 }, { "epoch": 1.1230810665230273, "grad_norm": 0.8113315064570628, "learning_rate": 4.039853446324141e-06, "loss": 0.2941084146499634, "num_input_tokens_seen": 531649392, "step": 16680, "train_runtime": 43776.1322, "train_tokens_per_second": 12144.732 }, { "epoch": 1.1234177215189873, "grad_norm": 0.8475446734045625, "learning_rate": 4.037258707049289e-06, "loss": 0.2989093780517578, "num_input_tokens_seen": 531805968, "step": 16685, "train_runtime": 43789.2538, "train_tokens_per_second": 12144.668 }, { "epoch": 1.1237543765149476, "grad_norm": 0.6924909422030741, "learning_rate": 4.034664237001969e-06, "loss": 0.2961087703704834, "num_input_tokens_seen": 531969024, "step": 16690, "train_runtime": 43802.1133, "train_tokens_per_second": 12144.826 }, { "epoch": 1.1240910315109076, "grad_norm": 0.8351516199395201, "learning_rate": 4.032070036907716e-06, "loss": 0.3192195177078247, "num_input_tokens_seen": 532125688, "step": 16695, "train_runtime": 43814.7815, "train_tokens_per_second": 12144.89 }, { "epoch": 1.1244276865068679, "grad_norm": 0.8427751125560105, "learning_rate": 4.029476107491991e-06, "loss": 0.32015242576599123, "num_input_tokens_seen": 532283456, "step": 16700, "train_runtime": 43827.3178, "train_tokens_per_second": 12145.016 }, { "epoch": 1.124764341502828, "grad_norm": 0.872841252197788, "learning_rate": 4.0268824494801784e-06, "loss": 0.30301501750946047, "num_input_tokens_seen": 532442440, "step": 16705, "train_runtime": 43839.9885, "train_tokens_per_second": 12145.132 }, { "epoch": 1.1251009964987881, "grad_norm": 0.7604015208835635, "learning_rate": 4.024289063597585e-06, "loss": 0.3071014165878296, "num_input_tokens_seen": 532599904, "step": 16710, "train_runtime": 43853.5971, "train_tokens_per_second": 12144.954 }, { "epoch": 1.1254376514947482, "grad_norm": 0.8372602312254506, "learning_rate": 4.021695950569443e-06, "loss": 0.30000388622283936, "num_input_tokens_seen": 532757808, "step": 16715, "train_runtime": 43866.3862, "train_tokens_per_second": 12145.012 }, { "epoch": 1.1257743064907082, "grad_norm": 0.848013159357868, "learning_rate": 4.01910311112091e-06, "loss": 0.31327269077301023, "num_input_tokens_seen": 532919472, "step": 16720, "train_runtime": 43880.4437, "train_tokens_per_second": 12144.806 }, { "epoch": 1.1261109614866684, "grad_norm": 0.8372382746973116, "learning_rate": 4.016510545977064e-06, "loss": 0.3042671918869019, "num_input_tokens_seen": 533083312, "step": 16725, "train_runtime": 43892.8645, "train_tokens_per_second": 12145.102 }, { "epoch": 1.1264476164826287, "grad_norm": 1.002446156871759, "learning_rate": 4.013918255862908e-06, "loss": 0.31206183433532714, "num_input_tokens_seen": 533238416, "step": 16730, "train_runtime": 43906.0774, "train_tokens_per_second": 12144.98 }, { "epoch": 1.1267842714785887, "grad_norm": 0.7782055563668424, "learning_rate": 4.011326241503369e-06, "loss": 0.2938835144042969, "num_input_tokens_seen": 533396536, "step": 16735, "train_runtime": 43918.7653, "train_tokens_per_second": 12145.071 }, { "epoch": 1.127120926474549, "grad_norm": 0.764581520508395, "learning_rate": 4.00873450362329e-06, "loss": 0.314333176612854, "num_input_tokens_seen": 533558696, "step": 16740, "train_runtime": 43931.6648, "train_tokens_per_second": 12145.196 }, { "epoch": 1.127457581470509, "grad_norm": 0.755947972872487, "learning_rate": 4.0061430429474476e-06, "loss": 0.31098499298095705, "num_input_tokens_seen": 533712368, "step": 16745, "train_runtime": 43944.7345, "train_tokens_per_second": 12145.081 }, { "epoch": 1.1277942364664693, "grad_norm": 0.7593443960403506, "learning_rate": 4.003551860200534e-06, "loss": 0.3035487174987793, "num_input_tokens_seen": 533867016, "step": 16750, "train_runtime": 43957.4589, "train_tokens_per_second": 12145.084 }, { "epoch": 1.1281308914624293, "grad_norm": 0.7711903899630963, "learning_rate": 4.000960956107167e-06, "loss": 0.33294000625610354, "num_input_tokens_seen": 534022360, "step": 16755, "train_runtime": 43970.6044, "train_tokens_per_second": 12144.986 }, { "epoch": 1.1284675464583895, "grad_norm": 0.8281540525610708, "learning_rate": 3.998370331391881e-06, "loss": 0.29976511001586914, "num_input_tokens_seen": 534175392, "step": 16760, "train_runtime": 43983.9755, "train_tokens_per_second": 12144.773 }, { "epoch": 1.1288042014543496, "grad_norm": 0.7783058500319283, "learning_rate": 3.995779986779139e-06, "loss": 0.299426007270813, "num_input_tokens_seen": 534329608, "step": 16765, "train_runtime": 43997.7702, "train_tokens_per_second": 12144.47 }, { "epoch": 1.1291408564503098, "grad_norm": 0.7614041058927454, "learning_rate": 3.9931899229933204e-06, "loss": 0.3206852674484253, "num_input_tokens_seen": 534488904, "step": 16770, "train_runtime": 44010.9183, "train_tokens_per_second": 12144.462 }, { "epoch": 1.1294775114462698, "grad_norm": 0.7699015784928196, "learning_rate": 3.990600140758731e-06, "loss": 0.29125022888183594, "num_input_tokens_seen": 534651376, "step": 16775, "train_runtime": 44023.5763, "train_tokens_per_second": 12144.66 }, { "epoch": 1.12981416644223, "grad_norm": 0.7163997109366104, "learning_rate": 3.988010640799591e-06, "loss": 0.2984292507171631, "num_input_tokens_seen": 534813448, "step": 16780, "train_runtime": 44036.4786, "train_tokens_per_second": 12144.782 }, { "epoch": 1.1301508214381901, "grad_norm": 0.8695339779715218, "learning_rate": 3.985421423840051e-06, "loss": 0.33612785339355467, "num_input_tokens_seen": 534967624, "step": 16785, "train_runtime": 44049.3083, "train_tokens_per_second": 12144.745 }, { "epoch": 1.1304874764341504, "grad_norm": 0.8500388113489217, "learning_rate": 3.982832490604173e-06, "loss": 0.28299052715301515, "num_input_tokens_seen": 535129816, "step": 16790, "train_runtime": 44061.9063, "train_tokens_per_second": 12144.954 }, { "epoch": 1.1308241314301104, "grad_norm": 0.8741870304525861, "learning_rate": 3.9802438418159465e-06, "loss": 0.30555727481842043, "num_input_tokens_seen": 535293656, "step": 16795, "train_runtime": 44074.3279, "train_tokens_per_second": 12145.248 }, { "epoch": 1.1311607864260707, "grad_norm": 0.8275118782174252, "learning_rate": 3.977655478199275e-06, "loss": 0.3156377077102661, "num_input_tokens_seen": 535455832, "step": 16800, "train_runtime": 44086.8875, "train_tokens_per_second": 12145.467 }, { "epoch": 1.1314974414220307, "grad_norm": 0.8268152983326666, "learning_rate": 3.975067400477993e-06, "loss": 0.3336094856262207, "num_input_tokens_seen": 535604992, "step": 16805, "train_runtime": 44099.5493, "train_tokens_per_second": 12145.362 }, { "epoch": 1.131834096417991, "grad_norm": 0.8703703138733289, "learning_rate": 3.972479609375842e-06, "loss": 0.3120142936706543, "num_input_tokens_seen": 535762856, "step": 16810, "train_runtime": 44112.0283, "train_tokens_per_second": 12145.505 }, { "epoch": 1.132170751413951, "grad_norm": 0.7819466382200351, "learning_rate": 3.969892105616492e-06, "loss": 0.3231369495391846, "num_input_tokens_seen": 535926696, "step": 16815, "train_runtime": 44124.4668, "train_tokens_per_second": 12145.794 }, { "epoch": 1.1325074064099112, "grad_norm": 0.8270335347693695, "learning_rate": 3.967304889923529e-06, "loss": 0.29298269748687744, "num_input_tokens_seen": 536089032, "step": 16820, "train_runtime": 44136.9047, "train_tokens_per_second": 12146.05 }, { "epoch": 1.1328440614058712, "grad_norm": 0.8376474886061578, "learning_rate": 3.964717963020463e-06, "loss": 0.29854645729064944, "num_input_tokens_seen": 536245584, "step": 16825, "train_runtime": 44149.904, "train_tokens_per_second": 12146.019 }, { "epoch": 1.1331807164018315, "grad_norm": 0.879058724499406, "learning_rate": 3.962131325630715e-06, "loss": 0.29366650581359866, "num_input_tokens_seen": 536408920, "step": 16830, "train_runtime": 44162.875, "train_tokens_per_second": 12146.15 }, { "epoch": 1.1335173713977915, "grad_norm": 0.916843758393496, "learning_rate": 3.959544978477634e-06, "loss": 0.3356415510177612, "num_input_tokens_seen": 536565656, "step": 16835, "train_runtime": 44175.9399, "train_tokens_per_second": 12146.106 }, { "epoch": 1.1338540263937518, "grad_norm": 0.7347836325822532, "learning_rate": 3.9569589222844805e-06, "loss": 0.3050784349441528, "num_input_tokens_seen": 536727544, "step": 16840, "train_runtime": 44189.4018, "train_tokens_per_second": 12146.069 }, { "epoch": 1.1341906813897118, "grad_norm": 0.7579372765853083, "learning_rate": 3.954373157774439e-06, "loss": 0.31089119911193847, "num_input_tokens_seen": 536886440, "step": 16845, "train_runtime": 44201.9278, "train_tokens_per_second": 12146.222 }, { "epoch": 1.134527336385672, "grad_norm": 0.8404684636704761, "learning_rate": 3.951787685670609e-06, "loss": 0.2953361749649048, "num_input_tokens_seen": 537045840, "step": 16850, "train_runtime": 44214.5537, "train_tokens_per_second": 12146.359 }, { "epoch": 1.134863991381632, "grad_norm": 0.8611130948039886, "learning_rate": 3.949202506696012e-06, "loss": 0.3068122386932373, "num_input_tokens_seen": 537202272, "step": 16855, "train_runtime": 44227.9423, "train_tokens_per_second": 12146.219 }, { "epoch": 1.1352006463775923, "grad_norm": 0.7623656836361321, "learning_rate": 3.946617621573581e-06, "loss": 0.29924960136413575, "num_input_tokens_seen": 537365400, "step": 16860, "train_runtime": 44240.8155, "train_tokens_per_second": 12146.372 }, { "epoch": 1.1355373013735524, "grad_norm": 0.7745188963701689, "learning_rate": 3.944033031026175e-06, "loss": 0.27745418548583983, "num_input_tokens_seen": 537518480, "step": 16865, "train_runtime": 44254.2264, "train_tokens_per_second": 12146.15 }, { "epoch": 1.1358739563695126, "grad_norm": 0.905542809681017, "learning_rate": 3.941448735776563e-06, "loss": 0.298679780960083, "num_input_tokens_seen": 537677712, "step": 16870, "train_runtime": 44267.487, "train_tokens_per_second": 12146.109 }, { "epoch": 1.1362106113654726, "grad_norm": 0.7570444410974061, "learning_rate": 3.938864736547439e-06, "loss": 0.30825071334838866, "num_input_tokens_seen": 537839096, "step": 16875, "train_runtime": 44280.6112, "train_tokens_per_second": 12146.153 }, { "epoch": 1.1365472663614329, "grad_norm": 0.7487674134882696, "learning_rate": 3.936281034061405e-06, "loss": 0.2948976993560791, "num_input_tokens_seen": 538002160, "step": 16880, "train_runtime": 44294.1048, "train_tokens_per_second": 12146.135 }, { "epoch": 1.136883921357393, "grad_norm": 0.7575851814034306, "learning_rate": 3.93369762904099e-06, "loss": 0.31870982646942136, "num_input_tokens_seen": 538159096, "step": 16885, "train_runtime": 44307.4066, "train_tokens_per_second": 12146.03 }, { "epoch": 1.1372205763533532, "grad_norm": 0.7193113070772132, "learning_rate": 3.931114522208631e-06, "loss": 0.30561189651489257, "num_input_tokens_seen": 538318832, "step": 16890, "train_runtime": 44321.0629, "train_tokens_per_second": 12145.892 }, { "epoch": 1.1375572313493132, "grad_norm": 0.8138741458729092, "learning_rate": 3.928531714286689e-06, "loss": 0.3008100509643555, "num_input_tokens_seen": 538482672, "step": 16895, "train_runtime": 44333.4859, "train_tokens_per_second": 12146.184 }, { "epoch": 1.1378938863452734, "grad_norm": 0.8011588227732436, "learning_rate": 3.925949205997434e-06, "loss": 0.3239983081817627, "num_input_tokens_seen": 538640440, "step": 16900, "train_runtime": 44346.359, "train_tokens_per_second": 12146.216 }, { "epoch": 1.1382305413412335, "grad_norm": 0.7398460559280121, "learning_rate": 3.923366998063062e-06, "loss": 0.2898430824279785, "num_input_tokens_seen": 538795048, "step": 16905, "train_runtime": 44359.141, "train_tokens_per_second": 12146.201 }, { "epoch": 1.1385671963371937, "grad_norm": 0.7360182338583346, "learning_rate": 3.920785091205674e-06, "loss": 0.27588777542114257, "num_input_tokens_seen": 538956056, "step": 16910, "train_runtime": 44372.6579, "train_tokens_per_second": 12146.13 }, { "epoch": 1.1389038513331537, "grad_norm": 0.90712532484992, "learning_rate": 3.918203486147294e-06, "loss": 0.3511468172073364, "num_input_tokens_seen": 539114568, "step": 16915, "train_runtime": 44386.3731, "train_tokens_per_second": 12145.948 }, { "epoch": 1.139240506329114, "grad_norm": 0.8972206889657058, "learning_rate": 3.9156221836098594e-06, "loss": 0.33047473430633545, "num_input_tokens_seen": 539271528, "step": 16920, "train_runtime": 44399.2903, "train_tokens_per_second": 12145.949 }, { "epoch": 1.139577161325074, "grad_norm": 0.8641607801911978, "learning_rate": 3.913041184315224e-06, "loss": 0.3061272144317627, "num_input_tokens_seen": 539432848, "step": 16925, "train_runtime": 44412.8532, "train_tokens_per_second": 12145.872 }, { "epoch": 1.1399138163210343, "grad_norm": 0.8575801137444691, "learning_rate": 3.910460488985154e-06, "loss": 0.3044703245162964, "num_input_tokens_seen": 539594216, "step": 16930, "train_runtime": 44425.6885, "train_tokens_per_second": 12145.996 }, { "epoch": 1.1402504713169943, "grad_norm": 0.7781826121372492, "learning_rate": 3.9078800983413355e-06, "loss": 0.3161719799041748, "num_input_tokens_seen": 539751984, "step": 16935, "train_runtime": 44438.22, "train_tokens_per_second": 12146.121 }, { "epoch": 1.1405871263129546, "grad_norm": 0.7292895761663459, "learning_rate": 3.905300013105365e-06, "loss": 0.27150721549987794, "num_input_tokens_seen": 539913264, "step": 16940, "train_runtime": 44451.7458, "train_tokens_per_second": 12146.053 }, { "epoch": 1.1409237813089146, "grad_norm": 0.7944189981708061, "learning_rate": 3.902720233998754e-06, "loss": 0.2900334358215332, "num_input_tokens_seen": 540072160, "step": 16945, "train_runtime": 44465.7403, "train_tokens_per_second": 12145.804 }, { "epoch": 1.1412604363048748, "grad_norm": 0.7618614198635505, "learning_rate": 3.90014076174293e-06, "loss": 0.309930419921875, "num_input_tokens_seen": 540232376, "step": 16950, "train_runtime": 44478.7548, "train_tokens_per_second": 12145.852 }, { "epoch": 1.1415970913008349, "grad_norm": 0.7377014664591213, "learning_rate": 3.897561597059237e-06, "loss": 0.29001574516296386, "num_input_tokens_seen": 540393464, "step": 16955, "train_runtime": 44492.251, "train_tokens_per_second": 12145.788 }, { "epoch": 1.1419337462967951, "grad_norm": 0.7989097012956159, "learning_rate": 3.894982740668927e-06, "loss": 0.29951283931732176, "num_input_tokens_seen": 540546384, "step": 16960, "train_runtime": 44505.7638, "train_tokens_per_second": 12145.537 }, { "epoch": 1.1422704012927551, "grad_norm": 0.8737483601389187, "learning_rate": 3.89240419329317e-06, "loss": 0.3264753341674805, "num_input_tokens_seen": 540710224, "step": 16965, "train_runtime": 44518.1758, "train_tokens_per_second": 12145.831 }, { "epoch": 1.1426070562887154, "grad_norm": 0.8557395576573769, "learning_rate": 3.889825955653046e-06, "loss": 0.3058238744735718, "num_input_tokens_seen": 540866496, "step": 16970, "train_runtime": 44530.9682, "train_tokens_per_second": 12145.851 }, { "epoch": 1.1429437112846754, "grad_norm": 0.8093664160139745, "learning_rate": 3.887248028469558e-06, "loss": 0.2706881046295166, "num_input_tokens_seen": 541029160, "step": 16975, "train_runtime": 44544.2609, "train_tokens_per_second": 12145.878 }, { "epoch": 1.1432803662806357, "grad_norm": 0.6925577760919885, "learning_rate": 3.884670412463607e-06, "loss": 0.2888359546661377, "num_input_tokens_seen": 541190160, "step": 16980, "train_runtime": 44558.0227, "train_tokens_per_second": 12145.74 }, { "epoch": 1.1436170212765957, "grad_norm": 3.3042252360763786, "learning_rate": 3.8820931083560194e-06, "loss": 0.3178676128387451, "num_input_tokens_seen": 541348240, "step": 16985, "train_runtime": 44570.8097, "train_tokens_per_second": 12145.802 }, { "epoch": 1.143953676272556, "grad_norm": 0.8098723525468328, "learning_rate": 3.879516116867531e-06, "loss": 0.2848562717437744, "num_input_tokens_seen": 541503760, "step": 16990, "train_runtime": 44583.7478, "train_tokens_per_second": 12145.766 }, { "epoch": 1.144290331268516, "grad_norm": 0.9223004347735128, "learning_rate": 3.876939438718786e-06, "loss": 0.3077042579650879, "num_input_tokens_seen": 541664680, "step": 16995, "train_runtime": 44597.4478, "train_tokens_per_second": 12145.643 }, { "epoch": 1.1446269862644762, "grad_norm": 0.7195326616603016, "learning_rate": 3.874363074630345e-06, "loss": 0.29122610092163087, "num_input_tokens_seen": 541820576, "step": 17000, "train_runtime": 44611.6145, "train_tokens_per_second": 12145.281 }, { "epoch": 1.1449636412604363, "grad_norm": 0.836886158853234, "learning_rate": 3.871787025322681e-06, "loss": 0.31101183891296386, "num_input_tokens_seen": 541979120, "step": 17005, "train_runtime": 44624.1962, "train_tokens_per_second": 12145.409 }, { "epoch": 1.1453002962563965, "grad_norm": 0.7986969648231006, "learning_rate": 3.86921129151618e-06, "loss": 0.3107777118682861, "num_input_tokens_seen": 542132792, "step": 17010, "train_runtime": 44637.361, "train_tokens_per_second": 12145.27 }, { "epoch": 1.1456369512523565, "grad_norm": 0.8334286167348997, "learning_rate": 3.866635873931133e-06, "loss": 0.3248122692108154, "num_input_tokens_seen": 542296320, "step": 17015, "train_runtime": 44650.4076, "train_tokens_per_second": 12145.383 }, { "epoch": 1.1459736062483168, "grad_norm": 0.7927407948835387, "learning_rate": 3.864060773287751e-06, "loss": 0.3016833305358887, "num_input_tokens_seen": 542453528, "step": 17020, "train_runtime": 44663.0007, "train_tokens_per_second": 12145.479 }, { "epoch": 1.1463102612442768, "grad_norm": 0.7548343564407981, "learning_rate": 3.861485990306151e-06, "loss": 0.3086510181427002, "num_input_tokens_seen": 542617112, "step": 17025, "train_runtime": 44675.9328, "train_tokens_per_second": 12145.625 }, { "epoch": 1.146646916240237, "grad_norm": 0.8439268572112969, "learning_rate": 3.858911525706365e-06, "loss": 0.2968446731567383, "num_input_tokens_seen": 542778208, "step": 17030, "train_runtime": 44688.9178, "train_tokens_per_second": 12145.7 }, { "epoch": 1.146983571236197, "grad_norm": 0.9103247109831742, "learning_rate": 3.85633738020833e-06, "loss": 0.3424351215362549, "num_input_tokens_seen": 542941192, "step": 17035, "train_runtime": 44701.7266, "train_tokens_per_second": 12145.866 }, { "epoch": 1.1473202262321573, "grad_norm": 0.814960825615862, "learning_rate": 3.853763554531902e-06, "loss": 0.31267409324645995, "num_input_tokens_seen": 543098856, "step": 17040, "train_runtime": 44714.7156, "train_tokens_per_second": 12145.864 }, { "epoch": 1.1476568812281174, "grad_norm": 0.8179817694662539, "learning_rate": 3.851190049396839e-06, "loss": 0.2735781669616699, "num_input_tokens_seen": 543259408, "step": 17045, "train_runtime": 44727.8779, "train_tokens_per_second": 12145.879 }, { "epoch": 1.1479935362240776, "grad_norm": 0.7591411157060375, "learning_rate": 3.848616865522815e-06, "loss": 0.29964208602905273, "num_input_tokens_seen": 543419736, "step": 17050, "train_runtime": 44741.3544, "train_tokens_per_second": 12145.804 }, { "epoch": 1.1483301912200377, "grad_norm": 0.7729175677960473, "learning_rate": 3.846044003629414e-06, "loss": 0.31813759803771974, "num_input_tokens_seen": 543580640, "step": 17055, "train_runtime": 44753.9635, "train_tokens_per_second": 12145.978 }, { "epoch": 1.148666846215998, "grad_norm": 0.7172630460580574, "learning_rate": 3.843471464436128e-06, "loss": 0.27354888916015624, "num_input_tokens_seen": 543733448, "step": 17060, "train_runtime": 44767.4589, "train_tokens_per_second": 12145.73 }, { "epoch": 1.149003501211958, "grad_norm": 0.8323765798131523, "learning_rate": 3.840899248662358e-06, "loss": 0.32833089828491213, "num_input_tokens_seen": 543885248, "step": 17065, "train_runtime": 44779.9847, "train_tokens_per_second": 12145.722 }, { "epoch": 1.1493401562079182, "grad_norm": 0.8543409205123543, "learning_rate": 3.838327357027419e-06, "loss": 0.3162813186645508, "num_input_tokens_seen": 544041384, "step": 17070, "train_runtime": 44793.2339, "train_tokens_per_second": 12145.615 }, { "epoch": 1.1496768112038782, "grad_norm": 0.7892023718918849, "learning_rate": 3.835755790250528e-06, "loss": 0.3141947269439697, "num_input_tokens_seen": 544204440, "step": 17075, "train_runtime": 44806.0905, "train_tokens_per_second": 12145.769 }, { "epoch": 1.1500134661998385, "grad_norm": 0.8647430014610052, "learning_rate": 3.83318454905082e-06, "loss": 0.3012948751449585, "num_input_tokens_seen": 544367704, "step": 17080, "train_runtime": 44818.9102, "train_tokens_per_second": 12145.938 }, { "epoch": 1.1503501211957985, "grad_norm": 0.8069631672690868, "learning_rate": 3.830613634147331e-06, "loss": 0.31517179012298585, "num_input_tokens_seen": 544525640, "step": 17085, "train_runtime": 44831.6477, "train_tokens_per_second": 12146.01 }, { "epoch": 1.1506867761917587, "grad_norm": 0.7556796830990403, "learning_rate": 3.82804304625901e-06, "loss": 0.3082268714904785, "num_input_tokens_seen": 544688312, "step": 17090, "train_runtime": 44844.3404, "train_tokens_per_second": 12146.2 }, { "epoch": 1.1510234311877188, "grad_norm": 0.8225563710288478, "learning_rate": 3.825472786104715e-06, "loss": 0.28848557472229003, "num_input_tokens_seen": 544851280, "step": 17095, "train_runtime": 44857.1556, "train_tokens_per_second": 12146.363 }, { "epoch": 1.151360086183679, "grad_norm": 0.9089195581934792, "learning_rate": 3.8229028544032095e-06, "loss": 0.3184187889099121, "num_input_tokens_seen": 545003872, "step": 17100, "train_runtime": 44870.1763, "train_tokens_per_second": 12146.239 }, { "epoch": 1.151696741179639, "grad_norm": 0.9603453245357494, "learning_rate": 3.8203332518731666e-06, "loss": 0.30712997913360596, "num_input_tokens_seen": 545161944, "step": 17105, "train_runtime": 44883.3028, "train_tokens_per_second": 12146.208 }, { "epoch": 1.1520333961755993, "grad_norm": 0.786889082664916, "learning_rate": 3.8177639792331695e-06, "loss": 0.3168989658355713, "num_input_tokens_seen": 545321336, "step": 17110, "train_runtime": 44895.7253, "train_tokens_per_second": 12146.398 }, { "epoch": 1.1523700511715593, "grad_norm": 0.9223204520474808, "learning_rate": 3.815195037201704e-06, "loss": 0.3337859630584717, "num_input_tokens_seen": 545476080, "step": 17115, "train_runtime": 44908.4002, "train_tokens_per_second": 12146.415 }, { "epoch": 1.1527067061675196, "grad_norm": 1.284631700549255, "learning_rate": 3.8126264264971694e-06, "loss": 0.3208210229873657, "num_input_tokens_seen": 545637128, "step": 17120, "train_runtime": 44921.4507, "train_tokens_per_second": 12146.472 }, { "epoch": 1.1530433611634796, "grad_norm": 0.7800533053499017, "learning_rate": 3.8100581478378673e-06, "loss": 0.3071185827255249, "num_input_tokens_seen": 545797368, "step": 17125, "train_runtime": 44933.8867, "train_tokens_per_second": 12146.676 }, { "epoch": 1.1533800161594399, "grad_norm": 0.8343636532263582, "learning_rate": 3.807490201942012e-06, "loss": 0.3163712978363037, "num_input_tokens_seen": 545958336, "step": 17130, "train_runtime": 44946.3671, "train_tokens_per_second": 12146.885 }, { "epoch": 1.1537166711553999, "grad_norm": 0.9149341286024075, "learning_rate": 3.804922589527717e-06, "loss": 0.2998265981674194, "num_input_tokens_seen": 546115536, "step": 17135, "train_runtime": 44958.8334, "train_tokens_per_second": 12147.013 }, { "epoch": 1.1540533261513601, "grad_norm": 0.8353778423904503, "learning_rate": 3.8023553113130096e-06, "loss": 0.32700958251953127, "num_input_tokens_seen": 546278944, "step": 17140, "train_runtime": 44971.8266, "train_tokens_per_second": 12147.137 }, { "epoch": 1.1543899811473202, "grad_norm": 0.8531399788377376, "learning_rate": 3.799788368015821e-06, "loss": 0.2914307117462158, "num_input_tokens_seen": 546439072, "step": 17145, "train_runtime": 44985.0962, "train_tokens_per_second": 12147.114 }, { "epoch": 1.1547266361432804, "grad_norm": 0.8236647368645641, "learning_rate": 3.7972217603539873e-06, "loss": 0.32138705253601074, "num_input_tokens_seen": 546595032, "step": 17150, "train_runtime": 44998.6978, "train_tokens_per_second": 12146.908 }, { "epoch": 1.1550632911392404, "grad_norm": 0.8090598008703196, "learning_rate": 3.7946554890452524e-06, "loss": 0.30844531059265134, "num_input_tokens_seen": 546756032, "step": 17155, "train_runtime": 45011.1976, "train_tokens_per_second": 12147.111 }, { "epoch": 1.1553999461352007, "grad_norm": 0.8536989597370267, "learning_rate": 3.792089554807269e-06, "loss": 0.316030478477478, "num_input_tokens_seen": 546916072, "step": 17160, "train_runtime": 45023.9921, "train_tokens_per_second": 12147.214 }, { "epoch": 1.1557366011311607, "grad_norm": 0.8503560434872435, "learning_rate": 3.789523958357587e-06, "loss": 0.30642380714416506, "num_input_tokens_seen": 547073992, "step": 17165, "train_runtime": 45037.0837, "train_tokens_per_second": 12147.19 }, { "epoch": 1.156073256127121, "grad_norm": 0.7794887481482436, "learning_rate": 3.7869587004136714e-06, "loss": 0.26918396949768064, "num_input_tokens_seen": 547236528, "step": 17170, "train_runtime": 45050.5586, "train_tokens_per_second": 12147.164 }, { "epoch": 1.156409911123081, "grad_norm": 0.8250918068175273, "learning_rate": 3.7843937816928864e-06, "loss": 0.3241715431213379, "num_input_tokens_seen": 547397360, "step": 17175, "train_runtime": 45063.0485, "train_tokens_per_second": 12147.366 }, { "epoch": 1.1567465661190413, "grad_norm": 0.84984457848406, "learning_rate": 3.781829202912506e-06, "loss": 0.3171783447265625, "num_input_tokens_seen": 547553520, "step": 17180, "train_runtime": 45076.5319, "train_tokens_per_second": 12147.197 }, { "epoch": 1.1570832211150013, "grad_norm": 0.8519543563528018, "learning_rate": 3.7792649647897023e-06, "loss": 0.3070185661315918, "num_input_tokens_seen": 547714776, "step": 17185, "train_runtime": 45089.0287, "train_tokens_per_second": 12147.407 }, { "epoch": 1.1574198761109615, "grad_norm": 0.7472613660191926, "learning_rate": 3.7767010680415595e-06, "loss": 0.3007053375244141, "num_input_tokens_seen": 547874800, "step": 17190, "train_runtime": 45102.5038, "train_tokens_per_second": 12147.326 }, { "epoch": 1.1577565311069216, "grad_norm": 0.7878331235468579, "learning_rate": 3.774137513385061e-06, "loss": 0.29999527931213377, "num_input_tokens_seen": 548034608, "step": 17195, "train_runtime": 45115.3997, "train_tokens_per_second": 12147.396 }, { "epoch": 1.1580931861028818, "grad_norm": 0.7961222031940645, "learning_rate": 3.7715743015371005e-06, "loss": 0.3082253456115723, "num_input_tokens_seen": 548198304, "step": 17200, "train_runtime": 45128.6497, "train_tokens_per_second": 12147.456 }, { "epoch": 1.1584298410988418, "grad_norm": 0.7044360093781137, "learning_rate": 3.769011433214467e-06, "loss": 0.2966219425201416, "num_input_tokens_seen": 548359584, "step": 17205, "train_runtime": 45141.6554, "train_tokens_per_second": 12147.529 }, { "epoch": 1.158766496094802, "grad_norm": 0.8883857700854241, "learning_rate": 3.766448909133863e-06, "loss": 0.3264200687408447, "num_input_tokens_seen": 548521496, "step": 17210, "train_runtime": 45154.7949, "train_tokens_per_second": 12147.58 }, { "epoch": 1.1591031510907621, "grad_norm": 0.7349002287122213, "learning_rate": 3.7638867300118864e-06, "loss": 0.28376796245574953, "num_input_tokens_seen": 548682576, "step": 17215, "train_runtime": 45168.7585, "train_tokens_per_second": 12147.391 }, { "epoch": 1.1594398060867224, "grad_norm": 0.7947616639053485, "learning_rate": 3.7613248965650447e-06, "loss": 0.29664950370788573, "num_input_tokens_seen": 548844600, "step": 17220, "train_runtime": 45181.3395, "train_tokens_per_second": 12147.595 }, { "epoch": 1.1597764610826824, "grad_norm": 0.7575118280644969, "learning_rate": 3.758763409509745e-06, "loss": 0.2930509805679321, "num_input_tokens_seen": 549006720, "step": 17225, "train_runtime": 45193.9393, "train_tokens_per_second": 12147.795 }, { "epoch": 1.1601131160786426, "grad_norm": 0.8176902974561484, "learning_rate": 3.7562022695623013e-06, "loss": 0.3191149473190308, "num_input_tokens_seen": 549168280, "step": 17230, "train_runtime": 45207.0922, "train_tokens_per_second": 12147.835 }, { "epoch": 1.1604497710746027, "grad_norm": 0.6868655985057994, "learning_rate": 3.7536414774389252e-06, "loss": 0.29757959842681886, "num_input_tokens_seen": 549328064, "step": 17235, "train_runtime": 45220.3702, "train_tokens_per_second": 12147.801 }, { "epoch": 1.160786426070563, "grad_norm": 0.9444973451145825, "learning_rate": 3.7510810338557363e-06, "loss": 0.2959771633148193, "num_input_tokens_seen": 549484432, "step": 17240, "train_runtime": 45233.491, "train_tokens_per_second": 12147.734 }, { "epoch": 1.161123081066523, "grad_norm": 0.7881154356543624, "learning_rate": 3.748520939528753e-06, "loss": 0.30174553394317627, "num_input_tokens_seen": 549645136, "step": 17245, "train_runtime": 45246.2161, "train_tokens_per_second": 12147.87 }, { "epoch": 1.1614597360624832, "grad_norm": 0.7256015734046158, "learning_rate": 3.7459611951739007e-06, "loss": 0.28409805297851565, "num_input_tokens_seen": 549806112, "step": 17250, "train_runtime": 45258.6883, "train_tokens_per_second": 12148.079 }, { "epoch": 1.1617963910584432, "grad_norm": 0.8569281465968295, "learning_rate": 3.7434018015069984e-06, "loss": 0.31328768730163575, "num_input_tokens_seen": 549967136, "step": 17255, "train_runtime": 45272.355, "train_tokens_per_second": 12147.968 }, { "epoch": 1.1621330460544035, "grad_norm": 0.8705983444551582, "learning_rate": 3.740842759243778e-06, "loss": 0.3136750221252441, "num_input_tokens_seen": 550127352, "step": 17260, "train_runtime": 45285.6071, "train_tokens_per_second": 12147.951 }, { "epoch": 1.1624697010503635, "grad_norm": 0.7768674997922687, "learning_rate": 3.738284069099862e-06, "loss": 0.2892464160919189, "num_input_tokens_seen": 550289384, "step": 17265, "train_runtime": 45298.2328, "train_tokens_per_second": 12148.142 }, { "epoch": 1.1628063560463238, "grad_norm": 0.71280265279478, "learning_rate": 3.735725731790785e-06, "loss": 0.3096620082855225, "num_input_tokens_seen": 550449632, "step": 17270, "train_runtime": 45310.9422, "train_tokens_per_second": 12148.272 }, { "epoch": 1.1631430110422838, "grad_norm": 0.8267712910645286, "learning_rate": 3.733167748031974e-06, "loss": 0.30355277061462405, "num_input_tokens_seen": 550612192, "step": 17275, "train_runtime": 45323.5474, "train_tokens_per_second": 12148.48 }, { "epoch": 1.163479666038244, "grad_norm": 0.7787240690009112, "learning_rate": 3.7306101185387646e-06, "loss": 0.2952958822250366, "num_input_tokens_seen": 550772864, "step": 17280, "train_runtime": 45336.2008, "train_tokens_per_second": 12148.633 }, { "epoch": 1.163816321034204, "grad_norm": 0.7544324521829344, "learning_rate": 3.728052844026386e-06, "loss": 0.306009316444397, "num_input_tokens_seen": 550935408, "step": 17285, "train_runtime": 45349.5335, "train_tokens_per_second": 12148.646 }, { "epoch": 1.1641529760301643, "grad_norm": 0.9153730047787004, "learning_rate": 3.7254959252099745e-06, "loss": 0.3008617401123047, "num_input_tokens_seen": 551091984, "step": 17290, "train_runtime": 45363.0471, "train_tokens_per_second": 12148.478 }, { "epoch": 1.1644896310261243, "grad_norm": 0.8164412322678456, "learning_rate": 3.7229393628045617e-06, "loss": 0.28227987289428713, "num_input_tokens_seen": 551253512, "step": 17295, "train_runtime": 45376.1827, "train_tokens_per_second": 12148.521 }, { "epoch": 1.1648262860220846, "grad_norm": 0.7889309165450333, "learning_rate": 3.720383157525087e-06, "loss": 0.28754358291625975, "num_input_tokens_seen": 551413992, "step": 17300, "train_runtime": 45389.125, "train_tokens_per_second": 12148.593 }, { "epoch": 1.1651629410180446, "grad_norm": 0.8450470839644866, "learning_rate": 3.717827310086379e-06, "loss": 0.29293045997619627, "num_input_tokens_seen": 551570816, "step": 17305, "train_runtime": 45402.3576, "train_tokens_per_second": 12148.506 }, { "epoch": 1.1654995960140049, "grad_norm": 0.8194621698592489, "learning_rate": 3.7152718212031778e-06, "loss": 0.2980987787246704, "num_input_tokens_seen": 551729072, "step": 17310, "train_runtime": 45415.2371, "train_tokens_per_second": 12148.545 }, { "epoch": 1.165836251009965, "grad_norm": 0.926619065211319, "learning_rate": 3.7127166915901123e-06, "loss": 0.33600964546203616, "num_input_tokens_seen": 551886032, "step": 17315, "train_runtime": 45429.4406, "train_tokens_per_second": 12148.202 }, { "epoch": 1.1661729060059252, "grad_norm": 0.8186364136172581, "learning_rate": 3.710161921961721e-06, "loss": 0.31142098903656007, "num_input_tokens_seen": 552044352, "step": 17320, "train_runtime": 45442.2533, "train_tokens_per_second": 12148.261 }, { "epoch": 1.1665095610018852, "grad_norm": 0.8150016932706918, "learning_rate": 3.707607513032434e-06, "loss": 0.3039080142974854, "num_input_tokens_seen": 552203304, "step": 17325, "train_runtime": 45455.6107, "train_tokens_per_second": 12148.188 }, { "epoch": 1.1668462159978454, "grad_norm": 0.8147878550134559, "learning_rate": 3.705053465516587e-06, "loss": 0.29843170642852784, "num_input_tokens_seen": 552365976, "step": 17330, "train_runtime": 45468.307, "train_tokens_per_second": 12148.373 }, { "epoch": 1.1671828709938055, "grad_norm": 0.7535037497813986, "learning_rate": 3.702499780128407e-06, "loss": 0.28657941818237304, "num_input_tokens_seen": 552522912, "step": 17335, "train_runtime": 45481.7875, "train_tokens_per_second": 12148.223 }, { "epoch": 1.1675195259897657, "grad_norm": 0.8529492339229267, "learning_rate": 3.6999464575820266e-06, "loss": 0.30574495792388917, "num_input_tokens_seen": 552682264, "step": 17340, "train_runtime": 45494.8939, "train_tokens_per_second": 12148.226 }, { "epoch": 1.1678561809857257, "grad_norm": 0.7935911302861638, "learning_rate": 3.697393498591473e-06, "loss": 0.3005890130996704, "num_input_tokens_seen": 552845440, "step": 17345, "train_runtime": 45507.815, "train_tokens_per_second": 12148.363 }, { "epoch": 1.168192835981686, "grad_norm": 0.7460935214464078, "learning_rate": 3.694840903870676e-06, "loss": 0.34033129215240476, "num_input_tokens_seen": 553003512, "step": 17350, "train_runtime": 45521.0228, "train_tokens_per_second": 12148.31 }, { "epoch": 1.168529490977646, "grad_norm": 0.833748691363083, "learning_rate": 3.6922886741334564e-06, "loss": 0.30861701965332033, "num_input_tokens_seen": 553160888, "step": 17355, "train_runtime": 45533.8378, "train_tokens_per_second": 12148.348 }, { "epoch": 1.1688661459736063, "grad_norm": 0.8607726655391488, "learning_rate": 3.689736810093541e-06, "loss": 0.29722349643707274, "num_input_tokens_seen": 553323848, "step": 17360, "train_runtime": 45547.3855, "train_tokens_per_second": 12148.312 }, { "epoch": 1.1692028009695663, "grad_norm": 0.8419115606722761, "learning_rate": 3.6871853124645464e-06, "loss": 0.3002346992492676, "num_input_tokens_seen": 553485640, "step": 17365, "train_runtime": 45559.876, "train_tokens_per_second": 12148.533 }, { "epoch": 1.1695394559655266, "grad_norm": 0.8149321307743822, "learning_rate": 3.684634181959994e-06, "loss": 0.3011584758758545, "num_input_tokens_seen": 553649384, "step": 17370, "train_runtime": 45572.2891, "train_tokens_per_second": 12148.817 }, { "epoch": 1.1698761109614866, "grad_norm": 0.9688274623708251, "learning_rate": 3.6820834192932974e-06, "loss": 0.30669479370117186, "num_input_tokens_seen": 553807576, "step": 17375, "train_runtime": 45585.0117, "train_tokens_per_second": 12148.896 }, { "epoch": 1.1702127659574468, "grad_norm": 0.8270516866998457, "learning_rate": 3.679533025177772e-06, "loss": 0.33387815952301025, "num_input_tokens_seen": 553971416, "step": 17380, "train_runtime": 45597.4511, "train_tokens_per_second": 12149.175 }, { "epoch": 1.1705494209534069, "grad_norm": 0.8129483118355065, "learning_rate": 3.6769830003266234e-06, "loss": 0.29645040035247805, "num_input_tokens_seen": 554130576, "step": 17385, "train_runtime": 45610.0423, "train_tokens_per_second": 12149.311 }, { "epoch": 1.1708860759493671, "grad_norm": 0.7890786876508313, "learning_rate": 3.6744333454529607e-06, "loss": 0.3048261165618896, "num_input_tokens_seen": 554292024, "step": 17390, "train_runtime": 45622.5242, "train_tokens_per_second": 12149.526 }, { "epoch": 1.1712227309453271, "grad_norm": 0.7797851037266244, "learning_rate": 3.6718840612697847e-06, "loss": 0.301741623878479, "num_input_tokens_seen": 554455864, "step": 17395, "train_runtime": 45634.9629, "train_tokens_per_second": 12149.804 }, { "epoch": 1.1715593859412874, "grad_norm": 0.8049698931944371, "learning_rate": 3.6693351484899986e-06, "loss": 0.2979268550872803, "num_input_tokens_seen": 554609008, "step": 17400, "train_runtime": 45647.5263, "train_tokens_per_second": 12149.815 }, { "epoch": 1.1718960409372474, "grad_norm": 1.0347704623956588, "learning_rate": 3.6667866078263937e-06, "loss": 0.29062800407409667, "num_input_tokens_seen": 554761824, "step": 17405, "train_runtime": 45660.128, "train_tokens_per_second": 12149.809 }, { "epoch": 1.1722326959332077, "grad_norm": 0.7487630343529679, "learning_rate": 3.664238439991663e-06, "loss": 0.3335871696472168, "num_input_tokens_seen": 554920280, "step": 17410, "train_runtime": 45673.585, "train_tokens_per_second": 12149.698 }, { "epoch": 1.1725693509291677, "grad_norm": 0.7446295261724114, "learning_rate": 3.6616906456983925e-06, "loss": 0.3145869731903076, "num_input_tokens_seen": 555082128, "step": 17415, "train_runtime": 45686.8715, "train_tokens_per_second": 12149.708 }, { "epoch": 1.172906005925128, "grad_norm": 0.7820036047613893, "learning_rate": 3.659143225659065e-06, "loss": 0.3277442455291748, "num_input_tokens_seen": 555241808, "step": 17420, "train_runtime": 45699.7653, "train_tokens_per_second": 12149.774 }, { "epoch": 1.173242660921088, "grad_norm": 0.7412034470381428, "learning_rate": 3.6565961805860595e-06, "loss": 0.30117168426513674, "num_input_tokens_seen": 555405648, "step": 17425, "train_runtime": 45712.1777, "train_tokens_per_second": 12150.059 }, { "epoch": 1.1735793159170482, "grad_norm": 0.7550550478779435, "learning_rate": 3.654049511191649e-06, "loss": 0.303936243057251, "num_input_tokens_seen": 555564480, "step": 17430, "train_runtime": 45724.7169, "train_tokens_per_second": 12150.201 }, { "epoch": 1.1739159709130083, "grad_norm": 0.8296758009245497, "learning_rate": 3.6515032181879995e-06, "loss": 0.31157379150390624, "num_input_tokens_seen": 555727656, "step": 17435, "train_runtime": 45737.5856, "train_tokens_per_second": 12150.35 }, { "epoch": 1.1742526259089685, "grad_norm": 0.696196065210496, "learning_rate": 3.6489573022871755e-06, "loss": 0.2630504846572876, "num_input_tokens_seen": 555887232, "step": 17440, "train_runtime": 45750.1805, "train_tokens_per_second": 12150.493 }, { "epoch": 1.1745892809049285, "grad_norm": 0.8091269771789984, "learning_rate": 3.6464117642011333e-06, "loss": 0.3271594524383545, "num_input_tokens_seen": 556041680, "step": 17445, "train_runtime": 45763.7881, "train_tokens_per_second": 12150.255 }, { "epoch": 1.1749259359008888, "grad_norm": 0.832838789748369, "learning_rate": 3.643866604641726e-06, "loss": 0.31891813278198244, "num_input_tokens_seen": 556204784, "step": 17450, "train_runtime": 45776.6362, "train_tokens_per_second": 12150.408 }, { "epoch": 1.1752625908968488, "grad_norm": 0.8227746836200858, "learning_rate": 3.641321824320697e-06, "loss": 0.2925240993499756, "num_input_tokens_seen": 556365240, "step": 17455, "train_runtime": 45789.6982, "train_tokens_per_second": 12150.446 }, { "epoch": 1.175599245892809, "grad_norm": 0.7526150328127748, "learning_rate": 3.6387774239496893e-06, "loss": 0.288327693939209, "num_input_tokens_seen": 556529000, "step": 17460, "train_runtime": 45802.7863, "train_tokens_per_second": 12150.549 }, { "epoch": 1.175935900888769, "grad_norm": 0.8424688072879664, "learning_rate": 3.6362334042402326e-06, "loss": 0.30585613250732424, "num_input_tokens_seen": 556689104, "step": 17465, "train_runtime": 45815.4212, "train_tokens_per_second": 12150.693 }, { "epoch": 1.1762725558847293, "grad_norm": 0.7377834377133992, "learning_rate": 3.6336897659037563e-06, "loss": 0.27790706157684325, "num_input_tokens_seen": 556838752, "step": 17470, "train_runtime": 45828.1594, "train_tokens_per_second": 12150.581 }, { "epoch": 1.1766092108806894, "grad_norm": 0.8412082374445791, "learning_rate": 3.6311465096515787e-06, "loss": 0.30019321441650393, "num_input_tokens_seen": 556998160, "step": 17475, "train_runtime": 45841.2996, "train_tokens_per_second": 12150.575 }, { "epoch": 1.1769458658766496, "grad_norm": 0.7592474295372953, "learning_rate": 3.6286036361949175e-06, "loss": 0.2577529430389404, "num_input_tokens_seen": 557159808, "step": 17480, "train_runtime": 45854.5165, "train_tokens_per_second": 12150.598 }, { "epoch": 1.1772825208726099, "grad_norm": 0.8392425164935884, "learning_rate": 3.6260611462448736e-06, "loss": 0.263155198097229, "num_input_tokens_seen": 557321104, "step": 17485, "train_runtime": 45867.4537, "train_tokens_per_second": 12150.688 }, { "epoch": 1.17761917586857, "grad_norm": 1.0412371782799181, "learning_rate": 3.623519040512451e-06, "loss": 0.33727331161499025, "num_input_tokens_seen": 557475784, "step": 17490, "train_runtime": 45881.5082, "train_tokens_per_second": 12150.337 }, { "epoch": 1.17795583086453, "grad_norm": 0.6429483406065157, "learning_rate": 3.6209773197085373e-06, "loss": 0.2657941818237305, "num_input_tokens_seen": 557637824, "step": 17495, "train_runtime": 45894.0851, "train_tokens_per_second": 12150.538 }, { "epoch": 1.1782924858604902, "grad_norm": 0.8639232594851377, "learning_rate": 3.6184359845439214e-06, "loss": 0.32529640197753906, "num_input_tokens_seen": 557800184, "step": 17500, "train_runtime": 45906.52, "train_tokens_per_second": 12150.783 }, { "epoch": 1.1786291408564504, "grad_norm": 0.837791471621092, "learning_rate": 3.615895035729275e-06, "loss": 0.32194719314575193, "num_input_tokens_seen": 557961128, "step": 17505, "train_runtime": 45919.4797, "train_tokens_per_second": 12150.859 }, { "epoch": 1.1789657958524105, "grad_norm": 0.8322176614875726, "learning_rate": 3.6133544739751703e-06, "loss": 0.309560489654541, "num_input_tokens_seen": 558116296, "step": 17510, "train_runtime": 45932.0657, "train_tokens_per_second": 12150.908 }, { "epoch": 1.1793024508483705, "grad_norm": 0.7747817401228362, "learning_rate": 3.6108142999920633e-06, "loss": 0.3072824239730835, "num_input_tokens_seen": 558274864, "step": 17515, "train_runtime": 45945.5924, "train_tokens_per_second": 12150.782 }, { "epoch": 1.1796391058443307, "grad_norm": 0.7576174588939192, "learning_rate": 3.608274514490308e-06, "loss": 0.29747934341430665, "num_input_tokens_seen": 558435600, "step": 17520, "train_runtime": 45958.3307, "train_tokens_per_second": 12150.911 }, { "epoch": 1.179975760840291, "grad_norm": 0.8583549250960663, "learning_rate": 3.605735118180146e-06, "loss": 0.2899029731750488, "num_input_tokens_seen": 558598120, "step": 17525, "train_runtime": 45971.6569, "train_tokens_per_second": 12150.924 }, { "epoch": 1.180312415836251, "grad_norm": 0.7668356206588756, "learning_rate": 3.6031961117717144e-06, "loss": 0.2827759265899658, "num_input_tokens_seen": 558755432, "step": 17530, "train_runtime": 45984.3794, "train_tokens_per_second": 12150.983 }, { "epoch": 1.180649070832211, "grad_norm": 0.8193913954843525, "learning_rate": 3.600657495975034e-06, "loss": 0.3110912322998047, "num_input_tokens_seen": 558917256, "step": 17535, "train_runtime": 45997.545, "train_tokens_per_second": 12151.024 }, { "epoch": 1.1809857258281713, "grad_norm": 0.8270517541795064, "learning_rate": 3.598119271500024e-06, "loss": 0.3022993326187134, "num_input_tokens_seen": 559076464, "step": 17540, "train_runtime": 46010.9356, "train_tokens_per_second": 12150.948 }, { "epoch": 1.1813223808241315, "grad_norm": 0.7708251471259241, "learning_rate": 3.5955814390564882e-06, "loss": 0.28093929290771485, "num_input_tokens_seen": 559238360, "step": 17545, "train_runtime": 46024.7442, "train_tokens_per_second": 12150.82 }, { "epoch": 1.1816590358200916, "grad_norm": 0.8171228914399099, "learning_rate": 3.5930439993541265e-06, "loss": 0.3191326141357422, "num_input_tokens_seen": 559395560, "step": 17550, "train_runtime": 46038.2235, "train_tokens_per_second": 12150.677 }, { "epoch": 1.1819956908160516, "grad_norm": 0.7404132249124264, "learning_rate": 3.590506953102522e-06, "loss": 0.3204774856567383, "num_input_tokens_seen": 559552784, "step": 17555, "train_runtime": 46051.4285, "train_tokens_per_second": 12150.606 }, { "epoch": 1.1823323458120119, "grad_norm": 0.7322016019221741, "learning_rate": 3.5879703010111554e-06, "loss": 0.3034974575042725, "num_input_tokens_seen": 559711520, "step": 17560, "train_runtime": 46064.0244, "train_tokens_per_second": 12150.73 }, { "epoch": 1.182669000807972, "grad_norm": 0.8278122469525622, "learning_rate": 3.5854340437893898e-06, "loss": 0.3104384183883667, "num_input_tokens_seen": 559875048, "step": 17565, "train_runtime": 46077.1019, "train_tokens_per_second": 12150.83 }, { "epoch": 1.1830056558039321, "grad_norm": 0.8298350414877184, "learning_rate": 3.5828981821464838e-06, "loss": 0.31849663257598876, "num_input_tokens_seen": 560030600, "step": 17570, "train_runtime": 46090.5857, "train_tokens_per_second": 12150.651 }, { "epoch": 1.1833423107998922, "grad_norm": 1.1995431217722516, "learning_rate": 3.580362716791582e-06, "loss": 0.32473204135894773, "num_input_tokens_seen": 560194440, "step": 17575, "train_runtime": 46103.0245, "train_tokens_per_second": 12150.926 }, { "epoch": 1.1836789657958524, "grad_norm": 0.7704162233167612, "learning_rate": 3.5778276484337205e-06, "loss": 0.32905077934265137, "num_input_tokens_seen": 560351848, "step": 17580, "train_runtime": 46116.3093, "train_tokens_per_second": 12150.839 }, { "epoch": 1.1840156207918127, "grad_norm": 0.681880325468424, "learning_rate": 3.575292977781821e-06, "loss": 0.2930294036865234, "num_input_tokens_seen": 560512088, "step": 17585, "train_runtime": 46129.3064, "train_tokens_per_second": 12150.889 }, { "epoch": 1.1843522757877727, "grad_norm": 0.8133042008948044, "learning_rate": 3.5727587055446976e-06, "loss": 0.30595741271972654, "num_input_tokens_seen": 560675928, "step": 17590, "train_runtime": 46141.7614, "train_tokens_per_second": 12151.16 }, { "epoch": 1.1846889307837327, "grad_norm": 0.7922630626149236, "learning_rate": 3.570224832431051e-06, "loss": 0.3272273540496826, "num_input_tokens_seen": 560838064, "step": 17595, "train_runtime": 46155.1007, "train_tokens_per_second": 12151.161 }, { "epoch": 1.185025585779693, "grad_norm": 0.7894285816275776, "learning_rate": 3.5676913591494715e-06, "loss": 0.2990771770477295, "num_input_tokens_seen": 560999904, "step": 17600, "train_runtime": 46168.1263, "train_tokens_per_second": 12151.238 }, { "epoch": 1.1853622407756532, "grad_norm": 0.7587555450446855, "learning_rate": 3.5651582864084345e-06, "loss": 0.3309017181396484, "num_input_tokens_seen": 561157912, "step": 17605, "train_runtime": 46181.0169, "train_tokens_per_second": 12151.268 }, { "epoch": 1.1856988957716132, "grad_norm": 0.8019450105065055, "learning_rate": 3.5626256149163096e-06, "loss": 0.3106407880783081, "num_input_tokens_seen": 561319480, "step": 17610, "train_runtime": 46194.9856, "train_tokens_per_second": 12151.091 }, { "epoch": 1.1860355507675733, "grad_norm": 0.8961913065247755, "learning_rate": 3.5600933453813464e-06, "loss": 0.31326682567596437, "num_input_tokens_seen": 561482128, "step": 17615, "train_runtime": 46207.7686, "train_tokens_per_second": 12151.25 }, { "epoch": 1.1863722057635335, "grad_norm": 0.7589926736910999, "learning_rate": 3.5575614785116886e-06, "loss": 0.29508700370788576, "num_input_tokens_seen": 561640568, "step": 17620, "train_runtime": 46220.3284, "train_tokens_per_second": 12151.376 }, { "epoch": 1.1867088607594938, "grad_norm": 0.86259647075367, "learning_rate": 3.5550300150153618e-06, "loss": 0.3041362285614014, "num_input_tokens_seen": 561798064, "step": 17625, "train_runtime": 46232.957, "train_tokens_per_second": 12151.463 }, { "epoch": 1.1870455157554538, "grad_norm": 0.8113768710035015, "learning_rate": 3.5524989556002863e-06, "loss": 0.28933746814727784, "num_input_tokens_seen": 561956256, "step": 17630, "train_runtime": 46246.0167, "train_tokens_per_second": 12151.452 }, { "epoch": 1.1873821707514138, "grad_norm": 0.6987533825329738, "learning_rate": 3.5499683009742604e-06, "loss": 0.2985436677932739, "num_input_tokens_seen": 562114096, "step": 17635, "train_runtime": 46259.2277, "train_tokens_per_second": 12151.394 }, { "epoch": 1.187718825747374, "grad_norm": 0.803484846503656, "learning_rate": 3.5474380518449757e-06, "loss": 0.28164746761322024, "num_input_tokens_seen": 562274840, "step": 17640, "train_runtime": 46272.2344, "train_tokens_per_second": 12151.452 }, { "epoch": 1.1880554807433343, "grad_norm": 0.8778671610181865, "learning_rate": 3.5449082089200072e-06, "loss": 0.2974414825439453, "num_input_tokens_seen": 562437568, "step": 17645, "train_runtime": 46285.6793, "train_tokens_per_second": 12151.438 }, { "epoch": 1.1883921357392944, "grad_norm": 0.7230273876040618, "learning_rate": 3.5423787729068206e-06, "loss": 0.3281216621398926, "num_input_tokens_seen": 562594104, "step": 17650, "train_runtime": 46298.7514, "train_tokens_per_second": 12151.388 }, { "epoch": 1.1887287907352544, "grad_norm": 0.7316016550924603, "learning_rate": 3.539849744512759e-06, "loss": 0.2960752248764038, "num_input_tokens_seen": 562753608, "step": 17655, "train_runtime": 46312.3612, "train_tokens_per_second": 12151.261 }, { "epoch": 1.1890654457312146, "grad_norm": 0.8044973566681579, "learning_rate": 3.5373211244450633e-06, "loss": 0.29789443016052247, "num_input_tokens_seen": 562914248, "step": 17660, "train_runtime": 46324.8001, "train_tokens_per_second": 12151.466 }, { "epoch": 1.189402100727175, "grad_norm": 0.746561599504987, "learning_rate": 3.5347929134108483e-06, "loss": 0.3126965045928955, "num_input_tokens_seen": 563072200, "step": 17665, "train_runtime": 46338.2293, "train_tokens_per_second": 12151.353 }, { "epoch": 1.189738755723135, "grad_norm": 1.1549879037937163, "learning_rate": 3.532265112117125e-06, "loss": 0.32831697463989257, "num_input_tokens_seen": 563235560, "step": 17670, "train_runtime": 46351.2429, "train_tokens_per_second": 12151.466 }, { "epoch": 1.190075410719095, "grad_norm": 0.7140035776257948, "learning_rate": 3.5297377212707805e-06, "loss": 0.26281650066375734, "num_input_tokens_seen": 563393096, "step": 17675, "train_runtime": 46364.2798, "train_tokens_per_second": 12151.447 }, { "epoch": 1.1904120657150552, "grad_norm": 0.8388881295552748, "learning_rate": 3.527210741578596e-06, "loss": 0.3121821641921997, "num_input_tokens_seen": 563553472, "step": 17680, "train_runtime": 46377.6951, "train_tokens_per_second": 12151.39 }, { "epoch": 1.1907487207110155, "grad_norm": 0.8281633960995729, "learning_rate": 3.5246841737472304e-06, "loss": 0.30962719917297366, "num_input_tokens_seen": 563704312, "step": 17685, "train_runtime": 46390.3052, "train_tokens_per_second": 12151.339 }, { "epoch": 1.1910853757069755, "grad_norm": 0.7820749382031627, "learning_rate": 3.522158018483231e-06, "loss": 0.28770737648010253, "num_input_tokens_seen": 563868128, "step": 17690, "train_runtime": 46403.4297, "train_tokens_per_second": 12151.432 }, { "epoch": 1.1914220307029355, "grad_norm": 0.8315654118797977, "learning_rate": 3.519632276493029e-06, "loss": 0.31392655372619627, "num_input_tokens_seen": 564028856, "step": 17695, "train_runtime": 46416.6713, "train_tokens_per_second": 12151.428 }, { "epoch": 1.1917586856988958, "grad_norm": 0.7614957628153395, "learning_rate": 3.5171069484829417e-06, "loss": 0.3177612781524658, "num_input_tokens_seen": 564187040, "step": 17700, "train_runtime": 46429.9188, "train_tokens_per_second": 12151.368 }, { "epoch": 1.192095340694856, "grad_norm": 0.7938877431521906, "learning_rate": 3.5145820351591663e-06, "loss": 0.2747988224029541, "num_input_tokens_seen": 564348432, "step": 17705, "train_runtime": 46442.9876, "train_tokens_per_second": 12151.424 }, { "epoch": 1.192431995690816, "grad_norm": 0.8341317773867487, "learning_rate": 3.51205753722779e-06, "loss": 0.3229677200317383, "num_input_tokens_seen": 564510192, "step": 17710, "train_runtime": 46455.546, "train_tokens_per_second": 12151.621 }, { "epoch": 1.1927686506867763, "grad_norm": 0.840907055895606, "learning_rate": 3.5095334553947757e-06, "loss": 0.3147230625152588, "num_input_tokens_seen": 564671136, "step": 17715, "train_runtime": 46468.011, "train_tokens_per_second": 12151.825 }, { "epoch": 1.1931053056827363, "grad_norm": 0.730440620747168, "learning_rate": 3.50700979036598e-06, "loss": 0.2902683258056641, "num_input_tokens_seen": 564830632, "step": 17720, "train_runtime": 46481.1116, "train_tokens_per_second": 12151.831 }, { "epoch": 1.1934419606786966, "grad_norm": 0.8027784304679113, "learning_rate": 3.5044865428471343e-06, "loss": 0.29388995170593263, "num_input_tokens_seen": 564986928, "step": 17725, "train_runtime": 46495.073, "train_tokens_per_second": 12151.544 }, { "epoch": 1.1937786156746566, "grad_norm": 0.6798330092423434, "learning_rate": 3.50196371354386e-06, "loss": 0.3117683410644531, "num_input_tokens_seen": 565148960, "step": 17730, "train_runtime": 46509.3614, "train_tokens_per_second": 12151.295 }, { "epoch": 1.1941152706706168, "grad_norm": 0.9004462888111853, "learning_rate": 3.499441303161655e-06, "loss": 0.3353108882904053, "num_input_tokens_seen": 565310088, "step": 17735, "train_runtime": 46522.2541, "train_tokens_per_second": 12151.391 }, { "epoch": 1.1944519256665769, "grad_norm": 0.8666486029909161, "learning_rate": 3.4969193124059042e-06, "loss": 0.29062471389770506, "num_input_tokens_seen": 565470024, "step": 17740, "train_runtime": 46534.9347, "train_tokens_per_second": 12151.516 }, { "epoch": 1.1947885806625371, "grad_norm": 0.7900329130547086, "learning_rate": 3.4943977419818748e-06, "loss": 0.3008563995361328, "num_input_tokens_seen": 565632736, "step": 17745, "train_runtime": 46547.6746, "train_tokens_per_second": 12151.686 }, { "epoch": 1.1951252356584972, "grad_norm": 0.8228020002776071, "learning_rate": 3.4918765925947173e-06, "loss": 0.3041223526000977, "num_input_tokens_seen": 565795136, "step": 17750, "train_runtime": 46561.0547, "train_tokens_per_second": 12151.682 }, { "epoch": 1.1954618906544574, "grad_norm": 0.8968691579526893, "learning_rate": 3.4893558649494595e-06, "loss": 0.3254541873931885, "num_input_tokens_seen": 565958912, "step": 17755, "train_runtime": 46574.0952, "train_tokens_per_second": 12151.796 }, { "epoch": 1.1957985456504174, "grad_norm": 1.1354276920818505, "learning_rate": 3.4868355597510194e-06, "loss": 0.29193673133850095, "num_input_tokens_seen": 566116432, "step": 17760, "train_runtime": 46586.983, "train_tokens_per_second": 12151.816 }, { "epoch": 1.1961352006463777, "grad_norm": 0.814188322586844, "learning_rate": 3.4843156777041887e-06, "loss": 0.28440284729003906, "num_input_tokens_seen": 566277480, "step": 17765, "train_runtime": 46600.5626, "train_tokens_per_second": 12151.731 }, { "epoch": 1.1964718556423377, "grad_norm": 0.8795942294365611, "learning_rate": 3.4817962195136457e-06, "loss": 0.29191007614135744, "num_input_tokens_seen": 566433232, "step": 17770, "train_runtime": 46613.7306, "train_tokens_per_second": 12151.639 }, { "epoch": 1.196808510638298, "grad_norm": 0.913075876064718, "learning_rate": 3.479277185883947e-06, "loss": 0.31943354606628416, "num_input_tokens_seen": 566591584, "step": 17775, "train_runtime": 46626.9579, "train_tokens_per_second": 12151.588 }, { "epoch": 1.197145165634258, "grad_norm": 0.7402657189002572, "learning_rate": 3.476758577519537e-06, "loss": 0.2841529130935669, "num_input_tokens_seen": 566752792, "step": 17780, "train_runtime": 46640.2686, "train_tokens_per_second": 12151.577 }, { "epoch": 1.1974818206302182, "grad_norm": 0.8704387508559097, "learning_rate": 3.4742403951247318e-06, "loss": 0.30609564781188964, "num_input_tokens_seen": 566910664, "step": 17785, "train_runtime": 46652.8446, "train_tokens_per_second": 12151.685 }, { "epoch": 1.1978184756261783, "grad_norm": 0.827243114464678, "learning_rate": 3.471722639403735e-06, "loss": 0.3014299154281616, "num_input_tokens_seen": 567068976, "step": 17790, "train_runtime": 46665.2553, "train_tokens_per_second": 12151.846 }, { "epoch": 1.1981551306221385, "grad_norm": 0.7837802792959181, "learning_rate": 3.4692053110606277e-06, "loss": 0.3090204238891602, "num_input_tokens_seen": 567221808, "step": 17795, "train_runtime": 46678.2929, "train_tokens_per_second": 12151.726 }, { "epoch": 1.1984917856180985, "grad_norm": 0.6950229254256485, "learning_rate": 3.4666884107993766e-06, "loss": 0.2893324136734009, "num_input_tokens_seen": 567380120, "step": 17800, "train_runtime": 46691.7299, "train_tokens_per_second": 12151.619 }, { "epoch": 1.1988284406140588, "grad_norm": 0.8179883904951026, "learning_rate": 3.464171939323819e-06, "loss": 0.29560964107513427, "num_input_tokens_seen": 567543280, "step": 17805, "train_runtime": 46705.3122, "train_tokens_per_second": 12151.579 }, { "epoch": 1.1991650956100188, "grad_norm": 0.7855535497025751, "learning_rate": 3.4616558973376848e-06, "loss": 0.2991500377655029, "num_input_tokens_seen": 567697496, "step": 17810, "train_runtime": 46718.5271, "train_tokens_per_second": 12151.443 }, { "epoch": 1.199501750605979, "grad_norm": 0.8381663835542378, "learning_rate": 3.4591402855445697e-06, "loss": 0.3060968637466431, "num_input_tokens_seen": 567855672, "step": 17815, "train_runtime": 46731.0905, "train_tokens_per_second": 12151.56 }, { "epoch": 1.199838405601939, "grad_norm": 0.7219875989091953, "learning_rate": 3.4566251046479625e-06, "loss": 0.3001152515411377, "num_input_tokens_seen": 568018328, "step": 17820, "train_runtime": 46743.903, "train_tokens_per_second": 12151.709 }, { "epoch": 1.2001750605978994, "grad_norm": 0.8119207478165796, "learning_rate": 3.454110355351221e-06, "loss": 0.30767116546630857, "num_input_tokens_seen": 568177128, "step": 17825, "train_runtime": 46756.4492, "train_tokens_per_second": 12151.845 }, { "epoch": 1.2005117155938594, "grad_norm": 0.8102058933334578, "learning_rate": 3.451596038357593e-06, "loss": 0.3000184535980225, "num_input_tokens_seen": 568339944, "step": 17830, "train_runtime": 46769.9071, "train_tokens_per_second": 12151.83 }, { "epoch": 1.2008483705898196, "grad_norm": 0.8011544968228623, "learning_rate": 3.4490821543701924e-06, "loss": 0.30973286628723146, "num_input_tokens_seen": 568500680, "step": 17835, "train_runtime": 46782.7736, "train_tokens_per_second": 12151.923 }, { "epoch": 1.2011850255857797, "grad_norm": 0.8044756743367137, "learning_rate": 3.4465687040920227e-06, "loss": 0.29834637641906736, "num_input_tokens_seen": 568662248, "step": 17840, "train_runtime": 46795.9797, "train_tokens_per_second": 12151.947 }, { "epoch": 1.20152168058174, "grad_norm": 0.7782002230049677, "learning_rate": 3.44405568822596e-06, "loss": 0.27195043563842775, "num_input_tokens_seen": 568822328, "step": 17845, "train_runtime": 46809.5137, "train_tokens_per_second": 12151.853 }, { "epoch": 1.2018583355777, "grad_norm": 0.944995387308152, "learning_rate": 3.441543107474765e-06, "loss": 0.30285005569458007, "num_input_tokens_seen": 568976912, "step": 17850, "train_runtime": 46822.9454, "train_tokens_per_second": 12151.669 }, { "epoch": 1.2021949905736602, "grad_norm": 0.8316285861707877, "learning_rate": 3.439030962541069e-06, "loss": 0.29416570663452146, "num_input_tokens_seen": 569137424, "step": 17855, "train_runtime": 46836.7547, "train_tokens_per_second": 12151.513 }, { "epoch": 1.2025316455696202, "grad_norm": 0.7485861418886484, "learning_rate": 3.4365192541273885e-06, "loss": 0.28441247940063474, "num_input_tokens_seen": 569294928, "step": 17860, "train_runtime": 46850.2624, "train_tokens_per_second": 12151.371 }, { "epoch": 1.2028683005655805, "grad_norm": 0.7711708929097452, "learning_rate": 3.4340079829361108e-06, "loss": 0.31755905151367186, "num_input_tokens_seen": 569446520, "step": 17865, "train_runtime": 46863.9584, "train_tokens_per_second": 12151.055 }, { "epoch": 1.2032049555615405, "grad_norm": 0.8063765257375277, "learning_rate": 3.4314971496695078e-06, "loss": 0.32381525039672854, "num_input_tokens_seen": 569607400, "step": 17870, "train_runtime": 46876.5212, "train_tokens_per_second": 12151.23 }, { "epoch": 1.2035416105575008, "grad_norm": 0.6929707481029308, "learning_rate": 3.428986755029724e-06, "loss": 0.2725623369216919, "num_input_tokens_seen": 569771240, "step": 17875, "train_runtime": 46888.9433, "train_tokens_per_second": 12151.505 }, { "epoch": 1.2038782655534608, "grad_norm": 0.7831387459888866, "learning_rate": 3.4264767997187874e-06, "loss": 0.2895507335662842, "num_input_tokens_seen": 569934840, "step": 17880, "train_runtime": 46901.9709, "train_tokens_per_second": 12151.618 }, { "epoch": 1.204214920549421, "grad_norm": 0.8027126283485034, "learning_rate": 3.423967284438594e-06, "loss": 0.3056935787200928, "num_input_tokens_seen": 570088256, "step": 17885, "train_runtime": 46914.6059, "train_tokens_per_second": 12151.616 }, { "epoch": 1.204551575545381, "grad_norm": 0.7856246685138956, "learning_rate": 3.421458209890925e-06, "loss": 0.30243093967437745, "num_input_tokens_seen": 570251736, "step": 17890, "train_runtime": 46928.2977, "train_tokens_per_second": 12151.554 }, { "epoch": 1.2048882305413413, "grad_norm": 0.7756182820173754, "learning_rate": 3.418949576777433e-06, "loss": 0.30045175552368164, "num_input_tokens_seen": 570415368, "step": 17895, "train_runtime": 46940.7567, "train_tokens_per_second": 12151.814 }, { "epoch": 1.2052248855373013, "grad_norm": 0.8689168690968989, "learning_rate": 3.4164413857996513e-06, "loss": 0.2956207752227783, "num_input_tokens_seen": 570571680, "step": 17900, "train_runtime": 46954.1829, "train_tokens_per_second": 12151.669 }, { "epoch": 1.2055615405332616, "grad_norm": 0.7624302233640684, "learning_rate": 3.4139336376589853e-06, "loss": 0.2786736011505127, "num_input_tokens_seen": 570734048, "step": 17905, "train_runtime": 46967.2064, "train_tokens_per_second": 12151.756 }, { "epoch": 1.2058981955292216, "grad_norm": 0.9260894254062003, "learning_rate": 3.411426333056722e-06, "loss": 0.3092201709747314, "num_input_tokens_seen": 570884856, "step": 17910, "train_runtime": 46980.6194, "train_tokens_per_second": 12151.497 }, { "epoch": 1.2062348505251819, "grad_norm": 0.784201854685884, "learning_rate": 3.408919472694017e-06, "loss": 0.3036609172821045, "num_input_tokens_seen": 571047024, "step": 17915, "train_runtime": 46993.1975, "train_tokens_per_second": 12151.695 }, { "epoch": 1.206571505521142, "grad_norm": 0.7793430943613993, "learning_rate": 3.406413057271909e-06, "loss": 0.2953254222869873, "num_input_tokens_seen": 571204640, "step": 17920, "train_runtime": 47006.3163, "train_tokens_per_second": 12151.657 }, { "epoch": 1.2069081605171021, "grad_norm": 0.8058779774258039, "learning_rate": 3.403907087491306e-06, "loss": 0.29497694969177246, "num_input_tokens_seen": 571362648, "step": 17925, "train_runtime": 47019.4006, "train_tokens_per_second": 12151.636 }, { "epoch": 1.2072448155130622, "grad_norm": 0.8245814192877534, "learning_rate": 3.4014015640529996e-06, "loss": 0.31172614097595214, "num_input_tokens_seen": 571517856, "step": 17930, "train_runtime": 47032.5861, "train_tokens_per_second": 12151.529 }, { "epoch": 1.2075814705090224, "grad_norm": 0.7959023521273502, "learning_rate": 3.398896487657646e-06, "loss": 0.3130847930908203, "num_input_tokens_seen": 571677672, "step": 17935, "train_runtime": 47045.6381, "train_tokens_per_second": 12151.555 }, { "epoch": 1.2079181255049825, "grad_norm": 0.8189190412137193, "learning_rate": 3.396391859005785e-06, "loss": 0.2894524812698364, "num_input_tokens_seen": 571836872, "step": 17940, "train_runtime": 47059.0874, "train_tokens_per_second": 12151.465 }, { "epoch": 1.2082547805009427, "grad_norm": 0.7009741826852409, "learning_rate": 3.393887678797826e-06, "loss": 0.2940798044204712, "num_input_tokens_seen": 571996376, "step": 17945, "train_runtime": 47072.7064, "train_tokens_per_second": 12151.338 }, { "epoch": 1.2085914354969027, "grad_norm": 0.7596536273492601, "learning_rate": 3.3913839477340575e-06, "loss": 0.312032413482666, "num_input_tokens_seen": 572153688, "step": 17950, "train_runtime": 47086.3945, "train_tokens_per_second": 12151.147 }, { "epoch": 1.208928090492863, "grad_norm": 0.8222355649043206, "learning_rate": 3.388880666514637e-06, "loss": 0.2860033273696899, "num_input_tokens_seen": 572313904, "step": 17955, "train_runtime": 47099.4371, "train_tokens_per_second": 12151.184 }, { "epoch": 1.209264745488823, "grad_norm": 0.7602763105292438, "learning_rate": 3.3863778358396033e-06, "loss": 0.309263277053833, "num_input_tokens_seen": 572471736, "step": 17960, "train_runtime": 47111.9042, "train_tokens_per_second": 12151.318 }, { "epoch": 1.2096014004847833, "grad_norm": 0.7889687596431745, "learning_rate": 3.3838754564088592e-06, "loss": 0.28440108299255373, "num_input_tokens_seen": 572633392, "step": 17965, "train_runtime": 47124.7791, "train_tokens_per_second": 12151.429 }, { "epoch": 1.2099380554807433, "grad_norm": 0.7146790274586586, "learning_rate": 3.3813735289221923e-06, "loss": 0.2906285285949707, "num_input_tokens_seen": 572791496, "step": 17970, "train_runtime": 47137.6727, "train_tokens_per_second": 12151.459 }, { "epoch": 1.2102747104767035, "grad_norm": 0.6689714295059437, "learning_rate": 3.378872054079255e-06, "loss": 0.27923150062561036, "num_input_tokens_seen": 572947776, "step": 17975, "train_runtime": 47150.0933, "train_tokens_per_second": 12151.572 }, { "epoch": 1.2106113654726636, "grad_norm": 0.8010649975368276, "learning_rate": 3.3763710325795784e-06, "loss": 0.3243656396865845, "num_input_tokens_seen": 573104936, "step": 17980, "train_runtime": 47165.1796, "train_tokens_per_second": 12151.018 }, { "epoch": 1.2109480204686238, "grad_norm": 0.7690972727209558, "learning_rate": 3.3738704651225673e-06, "loss": 0.30284533500671384, "num_input_tokens_seen": 573267344, "step": 17985, "train_runtime": 47177.6198, "train_tokens_per_second": 12151.256 }, { "epoch": 1.2112846754645838, "grad_norm": 0.7801078488543157, "learning_rate": 3.3713703524074936e-06, "loss": 0.2852578639984131, "num_input_tokens_seen": 573423648, "step": 17990, "train_runtime": 47190.8304, "train_tokens_per_second": 12151.167 }, { "epoch": 1.211621330460544, "grad_norm": 0.8224166749666002, "learning_rate": 3.3688706951335082e-06, "loss": 0.31235241889953613, "num_input_tokens_seen": 573574432, "step": 17995, "train_runtime": 47203.8552, "train_tokens_per_second": 12151.008 }, { "epoch": 1.2119579854565041, "grad_norm": 0.7680398291413184, "learning_rate": 3.3663714939996305e-06, "loss": 0.31341843605041503, "num_input_tokens_seen": 573738272, "step": 18000, "train_runtime": 47216.2895, "train_tokens_per_second": 12151.278 }, { "epoch": 1.2122946404524644, "grad_norm": 0.8254891894824747, "learning_rate": 3.3638727497047575e-06, "loss": 0.2909956455230713, "num_input_tokens_seen": 573890192, "step": 18005, "train_runtime": 47229.4859, "train_tokens_per_second": 12151.1 }, { "epoch": 1.2126312954484244, "grad_norm": 0.7554840919740514, "learning_rate": 3.3613744629476507e-06, "loss": 0.2978204250335693, "num_input_tokens_seen": 574049896, "step": 18010, "train_runtime": 47243.3519, "train_tokens_per_second": 12150.914 }, { "epoch": 1.2129679504443847, "grad_norm": 0.8463464374283453, "learning_rate": 3.358876634426952e-06, "loss": 0.27528061866760256, "num_input_tokens_seen": 574208696, "step": 18015, "train_runtime": 47255.8509, "train_tokens_per_second": 12151.06 }, { "epoch": 1.2133046054403447, "grad_norm": 0.7982674687411516, "learning_rate": 3.3563792648411676e-06, "loss": 0.3229090929031372, "num_input_tokens_seen": 574363352, "step": 18020, "train_runtime": 47269.1763, "train_tokens_per_second": 12150.907 }, { "epoch": 1.213641260436305, "grad_norm": 0.7678606915989108, "learning_rate": 3.353882354888681e-06, "loss": 0.2996983528137207, "num_input_tokens_seen": 574522296, "step": 18025, "train_runtime": 47282.4558, "train_tokens_per_second": 12150.856 }, { "epoch": 1.213977915432265, "grad_norm": 0.8393848577094165, "learning_rate": 3.3513859052677444e-06, "loss": 0.2800508975982666, "num_input_tokens_seen": 574675704, "step": 18030, "train_runtime": 47295.7111, "train_tokens_per_second": 12150.694 }, { "epoch": 1.2143145704282252, "grad_norm": 0.8070502536245979, "learning_rate": 3.3488899166764842e-06, "loss": 0.31464133262634275, "num_input_tokens_seen": 574838592, "step": 18035, "train_runtime": 47310.0459, "train_tokens_per_second": 12150.455 }, { "epoch": 1.2146512254241852, "grad_norm": 0.8024564283004648, "learning_rate": 3.346394389812892e-06, "loss": 0.2928361415863037, "num_input_tokens_seen": 574994176, "step": 18040, "train_runtime": 47322.4538, "train_tokens_per_second": 12150.557 }, { "epoch": 1.2149878804201455, "grad_norm": 0.7612487429733211, "learning_rate": 3.3438993253748365e-06, "loss": 0.29835045337677, "num_input_tokens_seen": 575152168, "step": 18045, "train_runtime": 47335.0133, "train_tokens_per_second": 12150.671 }, { "epoch": 1.2153245354161055, "grad_norm": 0.7351378372598166, "learning_rate": 3.3414047240600526e-06, "loss": 0.30321204662323, "num_input_tokens_seen": 575310856, "step": 18050, "train_runtime": 47347.5513, "train_tokens_per_second": 12150.805 }, { "epoch": 1.2156611904120658, "grad_norm": 0.8620028583674225, "learning_rate": 3.338910586566151e-06, "loss": 0.2911694526672363, "num_input_tokens_seen": 575462672, "step": 18055, "train_runtime": 47360.0916, "train_tokens_per_second": 12150.793 }, { "epoch": 1.2159978454080258, "grad_norm": 0.7853325078595972, "learning_rate": 3.336416913590605e-06, "loss": 0.3024179935455322, "num_input_tokens_seen": 575620280, "step": 18060, "train_runtime": 47374.2764, "train_tokens_per_second": 12150.482 }, { "epoch": 1.216334500403986, "grad_norm": 0.7450515322026561, "learning_rate": 3.333923705830766e-06, "loss": 0.2946027755737305, "num_input_tokens_seen": 575782472, "step": 18065, "train_runtime": 47387.4884, "train_tokens_per_second": 12150.517 }, { "epoch": 1.216671155399946, "grad_norm": 1.0433960135595954, "learning_rate": 3.3314309639838484e-06, "loss": 0.3284256935119629, "num_input_tokens_seen": 575943088, "step": 18070, "train_runtime": 47400.5762, "train_tokens_per_second": 12150.55 }, { "epoch": 1.2170078103959063, "grad_norm": 0.8095019427286518, "learning_rate": 3.328938688746942e-06, "loss": 0.3049996614456177, "num_input_tokens_seen": 576105296, "step": 18075, "train_runtime": 47413.1637, "train_tokens_per_second": 12150.746 }, { "epoch": 1.2173444653918664, "grad_norm": 0.8464215296908669, "learning_rate": 3.3264468808170012e-06, "loss": 0.35430088043212893, "num_input_tokens_seen": 576267016, "step": 18080, "train_runtime": 47426.6597, "train_tokens_per_second": 12150.698 }, { "epoch": 1.2176811203878266, "grad_norm": 0.8681948685878391, "learning_rate": 3.3239555408908562e-06, "loss": 0.31813869476318357, "num_input_tokens_seen": 576417944, "step": 18085, "train_runtime": 47440.1175, "train_tokens_per_second": 12150.432 }, { "epoch": 1.2180177753837866, "grad_norm": 0.7806745614289626, "learning_rate": 3.3214646696651974e-06, "loss": 0.28757009506225584, "num_input_tokens_seen": 576576392, "step": 18090, "train_runtime": 47452.9539, "train_tokens_per_second": 12150.485 }, { "epoch": 1.2183544303797469, "grad_norm": 0.8081053741056332, "learning_rate": 3.3189742678365923e-06, "loss": 0.3226039886474609, "num_input_tokens_seen": 576732864, "step": 18095, "train_runtime": 47465.6489, "train_tokens_per_second": 12150.532 }, { "epoch": 1.218691085375707, "grad_norm": 0.7750560531041005, "learning_rate": 3.316484336101472e-06, "loss": 0.27719364166259763, "num_input_tokens_seen": 576889880, "step": 18100, "train_runtime": 47479.7963, "train_tokens_per_second": 12150.218 }, { "epoch": 1.2190277403716672, "grad_norm": 0.7588890225825011, "learning_rate": 3.313994875156141e-06, "loss": 0.3108834743499756, "num_input_tokens_seen": 577047536, "step": 18105, "train_runtime": 47492.6661, "train_tokens_per_second": 12150.245 }, { "epoch": 1.2193643953676272, "grad_norm": 0.77547839594807, "learning_rate": 3.3115058856967643e-06, "loss": 0.31075754165649416, "num_input_tokens_seen": 577209800, "step": 18110, "train_runtime": 47505.9234, "train_tokens_per_second": 12150.27 }, { "epoch": 1.2197010503635874, "grad_norm": 0.8586114694947962, "learning_rate": 3.3090173684193845e-06, "loss": 0.2806204080581665, "num_input_tokens_seen": 577370640, "step": 18115, "train_runtime": 47519.5759, "train_tokens_per_second": 12150.164 }, { "epoch": 1.2200377053595475, "grad_norm": 0.7446612933946813, "learning_rate": 3.3065293240199037e-06, "loss": 0.3068239688873291, "num_input_tokens_seen": 577532856, "step": 18120, "train_runtime": 47532.1594, "train_tokens_per_second": 12150.36 }, { "epoch": 1.2203743603555077, "grad_norm": 0.774105711261429, "learning_rate": 3.3040417531940982e-06, "loss": 0.31845722198486326, "num_input_tokens_seen": 577696280, "step": 18125, "train_runtime": 47545.1348, "train_tokens_per_second": 12150.481 }, { "epoch": 1.2207110153514678, "grad_norm": 0.80099919341523, "learning_rate": 3.301554656637607e-06, "loss": 0.3007077693939209, "num_input_tokens_seen": 577853792, "step": 18130, "train_runtime": 47558.4724, "train_tokens_per_second": 12150.386 }, { "epoch": 1.221047670347428, "grad_norm": 0.6989193431532472, "learning_rate": 3.2990680350459427e-06, "loss": 0.29122214317321776, "num_input_tokens_seen": 578009456, "step": 18135, "train_runtime": 47571.5838, "train_tokens_per_second": 12150.309 }, { "epoch": 1.221384325343388, "grad_norm": 0.7796028735434357, "learning_rate": 3.2965818891144763e-06, "loss": 0.3225094795227051, "num_input_tokens_seen": 578169976, "step": 18140, "train_runtime": 47585.2889, "train_tokens_per_second": 12150.183 }, { "epoch": 1.2217209803393483, "grad_norm": 0.782376539132792, "learning_rate": 3.294096219538454e-06, "loss": 0.3024899482727051, "num_input_tokens_seen": 578333632, "step": 18145, "train_runtime": 47598.3226, "train_tokens_per_second": 12150.294 }, { "epoch": 1.2220576353353083, "grad_norm": 0.8105950417204018, "learning_rate": 3.291611027012983e-06, "loss": 0.3225839138031006, "num_input_tokens_seen": 578496168, "step": 18150, "train_runtime": 47611.5811, "train_tokens_per_second": 12150.325 }, { "epoch": 1.2223942903312686, "grad_norm": 0.854074249453237, "learning_rate": 3.289126312233043e-06, "loss": 0.2955545663833618, "num_input_tokens_seen": 578660008, "step": 18155, "train_runtime": 47624.008, "train_tokens_per_second": 12150.594 }, { "epoch": 1.2227309453272286, "grad_norm": 0.7572560018259764, "learning_rate": 3.2866420758934714e-06, "loss": 0.30736656188964845, "num_input_tokens_seen": 578818600, "step": 18160, "train_runtime": 47636.7322, "train_tokens_per_second": 12150.678 }, { "epoch": 1.2230676003231888, "grad_norm": 0.8009414870758533, "learning_rate": 3.2841583186889826e-06, "loss": 0.298984432220459, "num_input_tokens_seen": 578978624, "step": 18165, "train_runtime": 47649.3165, "train_tokens_per_second": 12150.827 }, { "epoch": 1.2234042553191489, "grad_norm": 0.8144106832655196, "learning_rate": 3.281675041314146e-06, "loss": 0.27940974235534666, "num_input_tokens_seen": 579139136, "step": 18170, "train_runtime": 47662.4381, "train_tokens_per_second": 12150.85 }, { "epoch": 1.2237409103151091, "grad_norm": 0.7046220285854843, "learning_rate": 3.279192244463406e-06, "loss": 0.29690823554992674, "num_input_tokens_seen": 579299240, "step": 18175, "train_runtime": 47675.747, "train_tokens_per_second": 12150.816 }, { "epoch": 1.2240775653110691, "grad_norm": 0.800948066528882, "learning_rate": 3.2767099288310667e-06, "loss": 0.2955416202545166, "num_input_tokens_seen": 579460200, "step": 18180, "train_runtime": 47688.1834, "train_tokens_per_second": 12151.023 }, { "epoch": 1.2244142203070294, "grad_norm": 0.7193330744763012, "learning_rate": 3.2742280951113025e-06, "loss": 0.29018535614013674, "num_input_tokens_seen": 579622272, "step": 18185, "train_runtime": 47701.3488, "train_tokens_per_second": 12151.067 }, { "epoch": 1.2247508753029894, "grad_norm": 0.9277726836180876, "learning_rate": 3.2717467439981464e-06, "loss": 0.31015563011169434, "num_input_tokens_seen": 579776096, "step": 18190, "train_runtime": 47713.7776, "train_tokens_per_second": 12151.125 }, { "epoch": 1.2250875302989497, "grad_norm": 0.7707101647023258, "learning_rate": 3.2692658761855033e-06, "loss": 0.2692745208740234, "num_input_tokens_seen": 579929976, "step": 18195, "train_runtime": 47727.848, "train_tokens_per_second": 12150.767 }, { "epoch": 1.2254241852949097, "grad_norm": 0.7848905594539523, "learning_rate": 3.266785492367138e-06, "loss": 0.27900674343109133, "num_input_tokens_seen": 580089776, "step": 18200, "train_runtime": 47741.2186, "train_tokens_per_second": 12150.712 }, { "epoch": 1.22576084029087, "grad_norm": 0.7980871757386302, "learning_rate": 3.2643055932366852e-06, "loss": 0.2756039142608643, "num_input_tokens_seen": 580246832, "step": 18205, "train_runtime": 47754.4577, "train_tokens_per_second": 12150.632 }, { "epoch": 1.22609749528683, "grad_norm": 0.7641353925385463, "learning_rate": 3.2618261794876365e-06, "loss": 0.28605146408081056, "num_input_tokens_seen": 580409496, "step": 18210, "train_runtime": 47767.7942, "train_tokens_per_second": 12150.645 }, { "epoch": 1.2264341502827902, "grad_norm": 0.732523009843604, "learning_rate": 3.259347251813356e-06, "loss": 0.28086276054382325, "num_input_tokens_seen": 580572080, "step": 18215, "train_runtime": 47780.4812, "train_tokens_per_second": 12150.821 }, { "epoch": 1.2267708052787503, "grad_norm": 0.8303094419003498, "learning_rate": 3.256868810907064e-06, "loss": 0.32007722854614257, "num_input_tokens_seen": 580735920, "step": 18220, "train_runtime": 47793.5265, "train_tokens_per_second": 12150.933 }, { "epoch": 1.2271074602747105, "grad_norm": 0.846108700719284, "learning_rate": 3.2543908574618514e-06, "loss": 0.3041520595550537, "num_input_tokens_seen": 580896328, "step": 18225, "train_runtime": 47807.3159, "train_tokens_per_second": 12150.783 }, { "epoch": 1.2274441152706705, "grad_norm": 0.7348248942399288, "learning_rate": 3.251913392170668e-06, "loss": 0.29837563037872317, "num_input_tokens_seen": 581057616, "step": 18230, "train_runtime": 47821.0298, "train_tokens_per_second": 12150.671 }, { "epoch": 1.2277807702666308, "grad_norm": 0.7520647659959094, "learning_rate": 3.249436415726333e-06, "loss": 0.301265811920166, "num_input_tokens_seen": 581219368, "step": 18235, "train_runtime": 47834.7866, "train_tokens_per_second": 12150.558 }, { "epoch": 1.2281174252625908, "grad_norm": 0.8622896121132416, "learning_rate": 3.24695992882152e-06, "loss": 0.3059053421020508, "num_input_tokens_seen": 581377528, "step": 18240, "train_runtime": 47848.1416, "train_tokens_per_second": 12150.472 }, { "epoch": 1.228454080258551, "grad_norm": 0.8274784849189706, "learning_rate": 3.244483932148773e-06, "loss": 0.3040431499481201, "num_input_tokens_seen": 581535376, "step": 18245, "train_runtime": 47861.7296, "train_tokens_per_second": 12150.321 }, { "epoch": 1.228790735254511, "grad_norm": 0.7549838521912406, "learning_rate": 3.2420084264004966e-06, "loss": 0.29225361347198486, "num_input_tokens_seen": 581694280, "step": 18250, "train_runtime": 47875.7055, "train_tokens_per_second": 12150.093 }, { "epoch": 1.2291273902504714, "grad_norm": 0.7890188016839296, "learning_rate": 3.2395334122689594e-06, "loss": 0.2962925910949707, "num_input_tokens_seen": 581854992, "step": 18255, "train_runtime": 47888.138, "train_tokens_per_second": 12150.295 }, { "epoch": 1.2294640452464314, "grad_norm": 0.7629318323355759, "learning_rate": 3.2370588904462873e-06, "loss": 0.30828404426574707, "num_input_tokens_seen": 582017432, "step": 18260, "train_runtime": 47900.7998, "train_tokens_per_second": 12150.474 }, { "epoch": 1.2298007002423916, "grad_norm": 1.1505239459563361, "learning_rate": 3.2345848616244775e-06, "loss": 0.3083354949951172, "num_input_tokens_seen": 582168928, "step": 18265, "train_runtime": 47914.3968, "train_tokens_per_second": 12150.188 }, { "epoch": 1.2301373552383517, "grad_norm": 0.8664640237311136, "learning_rate": 3.2321113264953797e-06, "loss": 0.29277701377868653, "num_input_tokens_seen": 582329480, "step": 18270, "train_runtime": 47926.8613, "train_tokens_per_second": 12150.378 }, { "epoch": 1.230474010234312, "grad_norm": 0.8031158298531158, "learning_rate": 3.2296382857507124e-06, "loss": 0.28634214401245117, "num_input_tokens_seen": 582487728, "step": 18275, "train_runtime": 47939.9283, "train_tokens_per_second": 12150.367 }, { "epoch": 1.230810665230272, "grad_norm": 0.7172943433278278, "learning_rate": 3.227165740082053e-06, "loss": 0.3119499921798706, "num_input_tokens_seen": 582651176, "step": 18280, "train_runtime": 47953.0745, "train_tokens_per_second": 12150.445 }, { "epoch": 1.2311473202262322, "grad_norm": 0.748157491013375, "learning_rate": 3.2246936901808424e-06, "loss": 0.27671198844909667, "num_input_tokens_seen": 582814320, "step": 18285, "train_runtime": 47966.5303, "train_tokens_per_second": 12150.437 }, { "epoch": 1.2314839752221922, "grad_norm": 0.8262162707913374, "learning_rate": 3.2222221367383786e-06, "loss": 0.3189072132110596, "num_input_tokens_seen": 582975992, "step": 18290, "train_runtime": 47979.0424, "train_tokens_per_second": 12150.638 }, { "epoch": 1.2318206302181525, "grad_norm": 0.773105351272229, "learning_rate": 3.2197510804458265e-06, "loss": 0.28573269844055177, "num_input_tokens_seen": 583135064, "step": 18295, "train_runtime": 47992.7661, "train_tokens_per_second": 12150.478 }, { "epoch": 1.2321572852141125, "grad_norm": 0.6836337387790852, "learning_rate": 3.217280521994207e-06, "loss": 0.295214319229126, "num_input_tokens_seen": 583298088, "step": 18300, "train_runtime": 48006.2532, "train_tokens_per_second": 12150.461 }, { "epoch": 1.2324939402100727, "grad_norm": 0.7878509574429907, "learning_rate": 3.214810462074407e-06, "loss": 0.29805593490600585, "num_input_tokens_seen": 583457672, "step": 18305, "train_runtime": 48018.7028, "train_tokens_per_second": 12150.634 }, { "epoch": 1.2328305952060328, "grad_norm": 0.8278604048903027, "learning_rate": 3.2123409013771666e-06, "loss": 0.2960082530975342, "num_input_tokens_seen": 583618288, "step": 18310, "train_runtime": 48031.1282, "train_tokens_per_second": 12150.834 }, { "epoch": 1.233167250201993, "grad_norm": 0.7289641417184982, "learning_rate": 3.209871840593095e-06, "loss": 0.31537551879882814, "num_input_tokens_seen": 583781712, "step": 18315, "train_runtime": 48044.1301, "train_tokens_per_second": 12150.948 }, { "epoch": 1.233503905197953, "grad_norm": 0.8157290511283004, "learning_rate": 3.207403280412652e-06, "loss": 0.30629892349243165, "num_input_tokens_seen": 583942552, "step": 18320, "train_runtime": 48058.1345, "train_tokens_per_second": 12150.754 }, { "epoch": 1.2338405601939133, "grad_norm": 0.7960079110537235, "learning_rate": 3.2049352215261677e-06, "loss": 0.27916431427001953, "num_input_tokens_seen": 584105232, "step": 18325, "train_runtime": 48071.1704, "train_tokens_per_second": 12150.843 }, { "epoch": 1.2341772151898733, "grad_norm": 0.7003397429578239, "learning_rate": 3.2024676646238222e-06, "loss": 0.2954216480255127, "num_input_tokens_seen": 584266440, "step": 18330, "train_runtime": 48084.7875, "train_tokens_per_second": 12150.754 }, { "epoch": 1.2345138701858336, "grad_norm": 1.0413563958948153, "learning_rate": 3.2000006103956653e-06, "loss": 0.3101287841796875, "num_input_tokens_seen": 584424840, "step": 18335, "train_runtime": 48097.2837, "train_tokens_per_second": 12150.891 }, { "epoch": 1.2348505251817936, "grad_norm": 0.8658694552995145, "learning_rate": 3.1975340595315956e-06, "loss": 0.28044853210449217, "num_input_tokens_seen": 584581352, "step": 18340, "train_runtime": 48110.3356, "train_tokens_per_second": 12150.848 }, { "epoch": 1.2351871801777539, "grad_norm": 0.7618542224094096, "learning_rate": 3.1950680127213796e-06, "loss": 0.2872614860534668, "num_input_tokens_seen": 584740536, "step": 18345, "train_runtime": 48122.9989, "train_tokens_per_second": 12150.958 }, { "epoch": 1.235523835173714, "grad_norm": 0.8336117566995166, "learning_rate": 3.192602470654638e-06, "loss": 0.3127295017242432, "num_input_tokens_seen": 584900504, "step": 18350, "train_runtime": 48136.7686, "train_tokens_per_second": 12150.805 }, { "epoch": 1.2358604901696741, "grad_norm": 0.8024403588651453, "learning_rate": 3.190137434020853e-06, "loss": 0.29363412857055665, "num_input_tokens_seen": 585062056, "step": 18355, "train_runtime": 48149.6921, "train_tokens_per_second": 12150.899 }, { "epoch": 1.2361971451656342, "grad_norm": 0.9480512411683943, "learning_rate": 3.1876729035093616e-06, "loss": 0.29247169494628905, "num_input_tokens_seen": 585222080, "step": 18360, "train_runtime": 48162.9011, "train_tokens_per_second": 12150.889 }, { "epoch": 1.2365338001615944, "grad_norm": 0.8280887163803946, "learning_rate": 3.185208879809366e-06, "loss": 0.28556480407714846, "num_input_tokens_seen": 585383144, "step": 18365, "train_runtime": 48175.91, "train_tokens_per_second": 12150.951 }, { "epoch": 1.2368704551575544, "grad_norm": 0.7632898766832383, "learning_rate": 3.1827453636099183e-06, "loss": 0.29779829978942873, "num_input_tokens_seen": 585546984, "step": 18370, "train_runtime": 48188.3459, "train_tokens_per_second": 12151.216 }, { "epoch": 1.2372071101535147, "grad_norm": 0.9136465291321273, "learning_rate": 3.1802823555999356e-06, "loss": 0.27601118087768556, "num_input_tokens_seen": 585708968, "step": 18375, "train_runtime": 48202.1485, "train_tokens_per_second": 12151.097 }, { "epoch": 1.2375437651494747, "grad_norm": 1.0205214542122862, "learning_rate": 3.1778198564681885e-06, "loss": 0.33374767303466796, "num_input_tokens_seen": 585870264, "step": 18380, "train_runtime": 48214.8389, "train_tokens_per_second": 12151.244 }, { "epoch": 1.237880420145435, "grad_norm": 0.823940161056751, "learning_rate": 3.17535786690331e-06, "loss": 0.31405541896820066, "num_input_tokens_seen": 586028728, "step": 18385, "train_runtime": 48227.6414, "train_tokens_per_second": 12151.304 }, { "epoch": 1.238217075141395, "grad_norm": 0.9242764494569721, "learning_rate": 3.172896387593784e-06, "loss": 0.30832514762878416, "num_input_tokens_seen": 586186976, "step": 18390, "train_runtime": 48240.0564, "train_tokens_per_second": 12151.457 }, { "epoch": 1.2385537301373553, "grad_norm": 0.8272352829059965, "learning_rate": 3.1704354192279573e-06, "loss": 0.29794576168060305, "num_input_tokens_seen": 586346040, "step": 18395, "train_runtime": 48253.1358, "train_tokens_per_second": 12151.46 }, { "epoch": 1.2388903851333153, "grad_norm": 0.8711717698745463, "learning_rate": 3.1679749624940316e-06, "loss": 0.3032227993011475, "num_input_tokens_seen": 586505608, "step": 18400, "train_runtime": 48265.7782, "train_tokens_per_second": 12151.583 }, { "epoch": 1.2392270401292755, "grad_norm": 0.8654132947482516, "learning_rate": 3.165515018080067e-06, "loss": 0.3107591152191162, "num_input_tokens_seen": 586664296, "step": 18405, "train_runtime": 48279.3047, "train_tokens_per_second": 12151.465 }, { "epoch": 1.2395636951252356, "grad_norm": 0.9107676182775081, "learning_rate": 3.163055586673976e-06, "loss": 0.2882097244262695, "num_input_tokens_seen": 586821552, "step": 18410, "train_runtime": 48292.6638, "train_tokens_per_second": 12151.36 }, { "epoch": 1.2399003501211958, "grad_norm": 0.8948645268665629, "learning_rate": 3.1605966689635348e-06, "loss": 0.32485346794128417, "num_input_tokens_seen": 586981640, "step": 18415, "train_runtime": 48305.8877, "train_tokens_per_second": 12151.348 }, { "epoch": 1.2402370051171558, "grad_norm": 1.8378352283681567, "learning_rate": 3.1581382656363666e-06, "loss": 0.30637297630310056, "num_input_tokens_seen": 587133256, "step": 18420, "train_runtime": 48319.0316, "train_tokens_per_second": 12151.18 }, { "epoch": 1.240573660113116, "grad_norm": 0.6994908098971349, "learning_rate": 3.1556803773799616e-06, "loss": 0.30309300422668456, "num_input_tokens_seen": 587292264, "step": 18425, "train_runtime": 48332.1236, "train_tokens_per_second": 12151.179 }, { "epoch": 1.2409103151090761, "grad_norm": 0.7680223740591987, "learning_rate": 3.1532230048816564e-06, "loss": 0.2859400749206543, "num_input_tokens_seen": 587452256, "step": 18430, "train_runtime": 48345.1392, "train_tokens_per_second": 12151.217 }, { "epoch": 1.2412469701050364, "grad_norm": 0.755698465757994, "learning_rate": 3.150766148828651e-06, "loss": 0.3058071851730347, "num_input_tokens_seen": 587609720, "step": 18435, "train_runtime": 48357.6507, "train_tokens_per_second": 12151.329 }, { "epoch": 1.2415836251009964, "grad_norm": 0.768736794938594, "learning_rate": 3.1483098099079934e-06, "loss": 0.2847443580627441, "num_input_tokens_seen": 587772536, "step": 18440, "train_runtime": 48371.2295, "train_tokens_per_second": 12151.284 }, { "epoch": 1.2419202800969567, "grad_norm": 0.752636058926188, "learning_rate": 3.1458539888065937e-06, "loss": 0.3014049530029297, "num_input_tokens_seen": 587930216, "step": 18445, "train_runtime": 48384.6189, "train_tokens_per_second": 12151.18 }, { "epoch": 1.2422569350929167, "grad_norm": 0.8716597231988518, "learning_rate": 3.143398686211212e-06, "loss": 0.2980872631072998, "num_input_tokens_seen": 588090624, "step": 18450, "train_runtime": 48398.5205, "train_tokens_per_second": 12151.004 }, { "epoch": 1.242593590088877, "grad_norm": 0.8221083688354442, "learning_rate": 3.1409439028084706e-06, "loss": 0.3100332260131836, "num_input_tokens_seen": 588250072, "step": 18455, "train_runtime": 48411.4534, "train_tokens_per_second": 12151.052 }, { "epoch": 1.2429302450848372, "grad_norm": 0.7941737233275576, "learning_rate": 3.1384896392848363e-06, "loss": 0.29020214080810547, "num_input_tokens_seen": 588410312, "step": 18460, "train_runtime": 48424.9592, "train_tokens_per_second": 12150.972 }, { "epoch": 1.2432669000807972, "grad_norm": 0.7758460075391419, "learning_rate": 3.1360358963266404e-06, "loss": 0.3344435691833496, "num_input_tokens_seen": 588570592, "step": 18465, "train_runtime": 48437.6883, "train_tokens_per_second": 12151.088 }, { "epoch": 1.2436035550767572, "grad_norm": 0.8037128736311963, "learning_rate": 3.1335826746200594e-06, "loss": 0.2929240226745605, "num_input_tokens_seen": 588724760, "step": 18470, "train_runtime": 48451.0694, "train_tokens_per_second": 12150.914 }, { "epoch": 1.2439402100727175, "grad_norm": 0.787467411714124, "learning_rate": 3.1311299748511335e-06, "loss": 0.306843638420105, "num_input_tokens_seen": 588886048, "step": 18475, "train_runtime": 48464.3406, "train_tokens_per_second": 12150.914 }, { "epoch": 1.2442768650686777, "grad_norm": 0.8248330818865219, "learning_rate": 3.1286777977057504e-06, "loss": 0.3001504421234131, "num_input_tokens_seen": 589043904, "step": 18480, "train_runtime": 48476.8201, "train_tokens_per_second": 12151.043 }, { "epoch": 1.2446135200646378, "grad_norm": 0.7725886359498364, "learning_rate": 3.126226143869655e-06, "loss": 0.3069874048233032, "num_input_tokens_seen": 589198776, "step": 18485, "train_runtime": 48490.2215, "train_tokens_per_second": 12150.878 }, { "epoch": 1.2449501750605978, "grad_norm": 0.6971446511754704, "learning_rate": 3.1237750140284424e-06, "loss": 0.26791791915893554, "num_input_tokens_seen": 589357392, "step": 18490, "train_runtime": 48503.607, "train_tokens_per_second": 12150.795 }, { "epoch": 1.245286830056558, "grad_norm": 0.7681998122647371, "learning_rate": 3.1213244088675647e-06, "loss": 0.31435227394104004, "num_input_tokens_seen": 589517760, "step": 18495, "train_runtime": 48516.4513, "train_tokens_per_second": 12150.884 }, { "epoch": 1.2456234850525183, "grad_norm": 0.8802744781549877, "learning_rate": 3.1188743290723246e-06, "loss": 0.3252289056777954, "num_input_tokens_seen": 589676696, "step": 18500, "train_runtime": 48528.9997, "train_tokens_per_second": 12151.017 }, { "epoch": 1.2459601400484783, "grad_norm": 0.8280790221363046, "learning_rate": 3.116424775327882e-06, "loss": 0.3172433376312256, "num_input_tokens_seen": 589835632, "step": 18505, "train_runtime": 48541.5304, "train_tokens_per_second": 12151.154 }, { "epoch": 1.2462967950444384, "grad_norm": 0.7099793541579976, "learning_rate": 3.1139757483192423e-06, "loss": 0.3101557016372681, "num_input_tokens_seen": 589997200, "step": 18510, "train_runtime": 48554.22, "train_tokens_per_second": 12151.306 }, { "epoch": 1.2466334500403986, "grad_norm": 0.8277130000482371, "learning_rate": 3.1115272487312727e-06, "loss": 0.2895765781402588, "num_input_tokens_seen": 590151288, "step": 18515, "train_runtime": 48567.9546, "train_tokens_per_second": 12151.043 }, { "epoch": 1.2469701050363589, "grad_norm": 0.8635354852918634, "learning_rate": 3.109079277248684e-06, "loss": 0.27374701499938964, "num_input_tokens_seen": 590303728, "step": 18520, "train_runtime": 48580.7261, "train_tokens_per_second": 12150.986 }, { "epoch": 1.2473067600323189, "grad_norm": 0.8161375864517258, "learning_rate": 3.1066318345560463e-06, "loss": 0.31182475090026857, "num_input_tokens_seen": 590456352, "step": 18525, "train_runtime": 48593.2724, "train_tokens_per_second": 12150.99 }, { "epoch": 1.247643415028279, "grad_norm": 0.7674389736394365, "learning_rate": 3.1041849213377782e-06, "loss": 0.3141264200210571, "num_input_tokens_seen": 590620192, "step": 18530, "train_runtime": 48605.7074, "train_tokens_per_second": 12151.252 }, { "epoch": 1.2479800700242392, "grad_norm": 0.8094534425257751, "learning_rate": 3.101738538278154e-06, "loss": 0.29593911170959475, "num_input_tokens_seen": 590777336, "step": 18535, "train_runtime": 48618.5567, "train_tokens_per_second": 12151.273 }, { "epoch": 1.2483167250201994, "grad_norm": 0.7450796897526799, "learning_rate": 3.0992926860612914e-06, "loss": 0.29093637466430666, "num_input_tokens_seen": 590937120, "step": 18540, "train_runtime": 48631.1383, "train_tokens_per_second": 12151.415 }, { "epoch": 1.2486533800161594, "grad_norm": 0.7959104325146444, "learning_rate": 3.0968473653711693e-06, "loss": 0.3038785457611084, "num_input_tokens_seen": 591100960, "step": 18545, "train_runtime": 48643.5864, "train_tokens_per_second": 12151.673 }, { "epoch": 1.2489900350121195, "grad_norm": 0.7691748225760048, "learning_rate": 3.094402576891613e-06, "loss": 0.3200667142868042, "num_input_tokens_seen": 591260104, "step": 18550, "train_runtime": 48656.2174, "train_tokens_per_second": 12151.789 }, { "epoch": 1.2493266900080797, "grad_norm": 0.7662235054039968, "learning_rate": 3.0919583213063004e-06, "loss": 0.3187409400939941, "num_input_tokens_seen": 591419000, "step": 18555, "train_runtime": 48668.6872, "train_tokens_per_second": 12151.941 }, { "epoch": 1.24966334500404, "grad_norm": 0.7623305613154947, "learning_rate": 3.0895145992987574e-06, "loss": 0.29469714164733884, "num_input_tokens_seen": 591582840, "step": 18560, "train_runtime": 48681.1393, "train_tokens_per_second": 12152.198 }, { "epoch": 1.25, "grad_norm": 0.7221757026638028, "learning_rate": 3.087071411552366e-06, "loss": 0.28711910247802735, "num_input_tokens_seen": 591742000, "step": 18565, "train_runtime": 48694.0612, "train_tokens_per_second": 12152.242 }, { "epoch": 1.25033665499596, "grad_norm": 0.803799283905667, "learning_rate": 3.084628758750353e-06, "loss": 0.3040918827056885, "num_input_tokens_seen": 591901712, "step": 18570, "train_runtime": 48707.1391, "train_tokens_per_second": 12152.258 }, { "epoch": 1.2506733099919203, "grad_norm": 0.8955465889115405, "learning_rate": 3.082186641575801e-06, "loss": 0.3238292455673218, "num_input_tokens_seen": 592064696, "step": 18575, "train_runtime": 48719.9888, "train_tokens_per_second": 12152.398 }, { "epoch": 1.2510099649878805, "grad_norm": 0.7710750898141562, "learning_rate": 3.0797450607116384e-06, "loss": 0.2966698169708252, "num_input_tokens_seen": 592225616, "step": 18580, "train_runtime": 48732.9799, "train_tokens_per_second": 12152.461 }, { "epoch": 1.2513466199838406, "grad_norm": 0.7768847475404367, "learning_rate": 3.0773040168406475e-06, "loss": 0.3099688529968262, "num_input_tokens_seen": 592389456, "step": 18585, "train_runtime": 48745.4282, "train_tokens_per_second": 12152.718 }, { "epoch": 1.2516832749798006, "grad_norm": 0.88533715743012, "learning_rate": 3.074863510645456e-06, "loss": 0.3184183597564697, "num_input_tokens_seen": 592549896, "step": 18590, "train_runtime": 48759.1701, "train_tokens_per_second": 12152.584 }, { "epoch": 1.2520199299757608, "grad_norm": 0.7081451322686154, "learning_rate": 3.072423542808546e-06, "loss": 0.30428285598754884, "num_input_tokens_seen": 592706712, "step": 18595, "train_runtime": 48771.625, "train_tokens_per_second": 12152.696 }, { "epoch": 1.252356584971721, "grad_norm": 0.8411863854651365, "learning_rate": 3.0699841140122443e-06, "loss": 0.2989403963088989, "num_input_tokens_seen": 592864832, "step": 18600, "train_runtime": 48784.1101, "train_tokens_per_second": 12152.827 }, { "epoch": 1.2526932399676811, "grad_norm": 0.79369129364369, "learning_rate": 3.0675452249387327e-06, "loss": 0.282259464263916, "num_input_tokens_seen": 593027080, "step": 18605, "train_runtime": 48797.2692, "train_tokens_per_second": 12152.874 }, { "epoch": 1.2530298949636411, "grad_norm": 0.7977932583385071, "learning_rate": 3.0651068762700354e-06, "loss": 0.3334193706512451, "num_input_tokens_seen": 593183784, "step": 18610, "train_runtime": 48810.1179, "train_tokens_per_second": 12152.886 }, { "epoch": 1.2533665499596014, "grad_norm": 0.8483578490181285, "learning_rate": 3.0626690686880313e-06, "loss": 0.3076553583145142, "num_input_tokens_seen": 593347512, "step": 18615, "train_runtime": 48823.2048, "train_tokens_per_second": 12152.982 }, { "epoch": 1.2537032049555616, "grad_norm": 0.8476084926325579, "learning_rate": 3.060231802874443e-06, "loss": 0.31014347076416016, "num_input_tokens_seen": 593508880, "step": 18620, "train_runtime": 48835.7425, "train_tokens_per_second": 12153.166 }, { "epoch": 1.2540398599515217, "grad_norm": 0.7972967217870532, "learning_rate": 3.0577950795108462e-06, "loss": 0.30380656719207766, "num_input_tokens_seen": 593672080, "step": 18625, "train_runtime": 48849.3257, "train_tokens_per_second": 12153.127 }, { "epoch": 1.2543765149474817, "grad_norm": 0.814858153426829, "learning_rate": 3.055358899278662e-06, "loss": 0.30417346954345703, "num_input_tokens_seen": 593833280, "step": 18630, "train_runtime": 48862.2297, "train_tokens_per_second": 12153.217 }, { "epoch": 1.254713169943442, "grad_norm": 0.7816142980744644, "learning_rate": 3.052923262859162e-06, "loss": 0.28918018341064455, "num_input_tokens_seen": 593993408, "step": 18635, "train_runtime": 48875.1578, "train_tokens_per_second": 12153.279 }, { "epoch": 1.2550498249394022, "grad_norm": 0.7316289574612365, "learning_rate": 3.0504881709334603e-06, "loss": 0.2974682331085205, "num_input_tokens_seen": 594156864, "step": 18640, "train_runtime": 48888.1114, "train_tokens_per_second": 12153.402 }, { "epoch": 1.2553864799353622, "grad_norm": 0.7389347439232504, "learning_rate": 3.0480536241825263e-06, "loss": 0.2809246301651001, "num_input_tokens_seen": 594320024, "step": 18645, "train_runtime": 48901.7133, "train_tokens_per_second": 12153.358 }, { "epoch": 1.2557231349313223, "grad_norm": 0.7948340319390428, "learning_rate": 3.0456196232871715e-06, "loss": 0.3050450086593628, "num_input_tokens_seen": 594478264, "step": 18650, "train_runtime": 48915.7119, "train_tokens_per_second": 12153.115 }, { "epoch": 1.2560597899272825, "grad_norm": 0.7846576015043074, "learning_rate": 3.043186168928059e-06, "loss": 0.3019444942474365, "num_input_tokens_seen": 594638384, "step": 18655, "train_runtime": 48929.2866, "train_tokens_per_second": 12153.016 }, { "epoch": 1.2563964449232428, "grad_norm": 0.8996658631717475, "learning_rate": 3.040753261785692e-06, "loss": 0.26363744735717776, "num_input_tokens_seen": 594791960, "step": 18660, "train_runtime": 48942.0032, "train_tokens_per_second": 12152.996 }, { "epoch": 1.2567330999192028, "grad_norm": 0.7433787411482523, "learning_rate": 3.038320902540429e-06, "loss": 0.28797097206115724, "num_input_tokens_seen": 594955800, "step": 18665, "train_runtime": 48954.4507, "train_tokens_per_second": 12153.252 }, { "epoch": 1.2570697549151628, "grad_norm": 0.8491208696472583, "learning_rate": 3.0358890918724706e-06, "loss": 0.30237703323364257, "num_input_tokens_seen": 595118152, "step": 18670, "train_runtime": 48967.5215, "train_tokens_per_second": 12153.324 }, { "epoch": 1.257406409911123, "grad_norm": 0.8289160563753655, "learning_rate": 3.0334578304618646e-06, "loss": 0.2913827419281006, "num_input_tokens_seen": 595271112, "step": 18675, "train_runtime": 48980.6431, "train_tokens_per_second": 12153.191 }, { "epoch": 1.2577430649070833, "grad_norm": 0.7832607104535844, "learning_rate": 3.0310271189885037e-06, "loss": 0.304503345489502, "num_input_tokens_seen": 595424368, "step": 18680, "train_runtime": 48993.9969, "train_tokens_per_second": 12153.007 }, { "epoch": 1.2580797199030433, "grad_norm": 0.761528586215838, "learning_rate": 3.0285969581321328e-06, "loss": 0.2896098613739014, "num_input_tokens_seen": 595584936, "step": 18685, "train_runtime": 49007.1602, "train_tokens_per_second": 12153.019 }, { "epoch": 1.2584163748990034, "grad_norm": 0.8598814521591376, "learning_rate": 3.0261673485723343e-06, "loss": 0.3433079719543457, "num_input_tokens_seen": 595742464, "step": 18690, "train_runtime": 49020.5829, "train_tokens_per_second": 12152.905 }, { "epoch": 1.2587530298949636, "grad_norm": 0.7650156769969552, "learning_rate": 3.023738290988544e-06, "loss": 0.28599891662597654, "num_input_tokens_seen": 595902976, "step": 18695, "train_runtime": 49033.5055, "train_tokens_per_second": 12152.975 }, { "epoch": 1.2590896848909239, "grad_norm": 0.7865983196623746, "learning_rate": 3.021309786060037e-06, "loss": 0.2984224796295166, "num_input_tokens_seen": 596059392, "step": 18700, "train_runtime": 49046.1265, "train_tokens_per_second": 12153.037 }, { "epoch": 1.259426339886884, "grad_norm": 0.7340309559741682, "learning_rate": 3.018881834465941e-06, "loss": 0.2849896430969238, "num_input_tokens_seen": 596216648, "step": 18705, "train_runtime": 49059.4885, "train_tokens_per_second": 12152.932 }, { "epoch": 1.259762994882844, "grad_norm": 0.8722883304282024, "learning_rate": 3.016454436885221e-06, "loss": 0.31316194534301756, "num_input_tokens_seen": 596373384, "step": 18710, "train_runtime": 49071.9163, "train_tokens_per_second": 12153.049 }, { "epoch": 1.2600996498788042, "grad_norm": 0.8848448211432962, "learning_rate": 3.0140275939966934e-06, "loss": 0.29825854301452637, "num_input_tokens_seen": 596534464, "step": 18715, "train_runtime": 49084.8209, "train_tokens_per_second": 12153.135 }, { "epoch": 1.2604363048747644, "grad_norm": 0.83738244242207, "learning_rate": 3.0116013064790166e-06, "loss": 0.3469051122665405, "num_input_tokens_seen": 596697272, "step": 18720, "train_runtime": 49098.2894, "train_tokens_per_second": 12153.117 }, { "epoch": 1.2607729598707245, "grad_norm": 0.8478094043957985, "learning_rate": 3.0091755750106937e-06, "loss": 0.30471096038818357, "num_input_tokens_seen": 596856608, "step": 18725, "train_runtime": 49112.2456, "train_tokens_per_second": 12152.908 }, { "epoch": 1.2611096148666845, "grad_norm": 0.7687994753008406, "learning_rate": 3.006750400270072e-06, "loss": 0.2853196620941162, "num_input_tokens_seen": 597015712, "step": 18730, "train_runtime": 49125.4476, "train_tokens_per_second": 12152.881 }, { "epoch": 1.2614462698626447, "grad_norm": 0.7273027775614012, "learning_rate": 3.0043257829353466e-06, "loss": 0.28669233322143556, "num_input_tokens_seen": 597170232, "step": 18735, "train_runtime": 49137.899, "train_tokens_per_second": 12152.946 }, { "epoch": 1.261782924858605, "grad_norm": 0.9139145233962981, "learning_rate": 3.0019017236845504e-06, "loss": 0.30709290504455566, "num_input_tokens_seen": 597330056, "step": 18740, "train_runtime": 49151.2814, "train_tokens_per_second": 12152.889 }, { "epoch": 1.262119579854565, "grad_norm": 0.901721490270064, "learning_rate": 2.9994782231955673e-06, "loss": 0.30857210159301757, "num_input_tokens_seen": 597484664, "step": 18745, "train_runtime": 49164.3587, "train_tokens_per_second": 12152.801 }, { "epoch": 1.262456234850525, "grad_norm": 0.7028076032662609, "learning_rate": 2.9970552821461185e-06, "loss": 0.29036540985107423, "num_input_tokens_seen": 597645744, "step": 18750, "train_runtime": 49177.9044, "train_tokens_per_second": 12152.729 }, { "epoch": 1.2627928898464853, "grad_norm": 0.9106764953190556, "learning_rate": 2.994632901213775e-06, "loss": 0.30046758651733396, "num_input_tokens_seen": 597802072, "step": 18755, "train_runtime": 49191.4022, "train_tokens_per_second": 12152.572 }, { "epoch": 1.2631295448424456, "grad_norm": 0.8737859957723585, "learning_rate": 2.9922110810759443e-06, "loss": 0.31121273040771485, "num_input_tokens_seen": 597959448, "step": 18760, "train_runtime": 49204.6222, "train_tokens_per_second": 12152.506 }, { "epoch": 1.2634661998384056, "grad_norm": 0.8205909059256062, "learning_rate": 2.989789822409883e-06, "loss": 0.3124363660812378, "num_input_tokens_seen": 598120184, "step": 18765, "train_runtime": 49217.9066, "train_tokens_per_second": 12152.491 }, { "epoch": 1.2638028548343656, "grad_norm": 0.8292142974223398, "learning_rate": 2.9873691258926864e-06, "loss": 0.33669533729553225, "num_input_tokens_seen": 598284024, "step": 18770, "train_runtime": 49230.3356, "train_tokens_per_second": 12152.751 }, { "epoch": 1.2641395098303259, "grad_norm": 0.8065415172989155, "learning_rate": 2.9849489922012985e-06, "loss": 0.29337100982666015, "num_input_tokens_seen": 598441672, "step": 18775, "train_runtime": 49243.0057, "train_tokens_per_second": 12152.826 }, { "epoch": 1.264476164826286, "grad_norm": 0.7795059725357247, "learning_rate": 2.982529422012498e-06, "loss": 0.3284898042678833, "num_input_tokens_seen": 598604168, "step": 18780, "train_runtime": 49255.616, "train_tokens_per_second": 12153.014 }, { "epoch": 1.2648128198222461, "grad_norm": 0.8205886554179143, "learning_rate": 2.9801104160029127e-06, "loss": 0.2727202892303467, "num_input_tokens_seen": 598760400, "step": 18785, "train_runtime": 49268.6174, "train_tokens_per_second": 12152.978 }, { "epoch": 1.2651494748182062, "grad_norm": 0.8034382924090836, "learning_rate": 2.9776919748490063e-06, "loss": 0.30403928756713866, "num_input_tokens_seen": 598918128, "step": 18790, "train_runtime": 49281.4237, "train_tokens_per_second": 12153.02 }, { "epoch": 1.2654861298141664, "grad_norm": 0.8442680210073279, "learning_rate": 2.975274099227092e-06, "loss": 0.322404670715332, "num_input_tokens_seen": 599075696, "step": 18795, "train_runtime": 49294.8268, "train_tokens_per_second": 12152.912 }, { "epoch": 1.2658227848101267, "grad_norm": 0.8855148054974662, "learning_rate": 2.9728567898133183e-06, "loss": 0.3041447877883911, "num_input_tokens_seen": 599233536, "step": 18800, "train_runtime": 49307.365, "train_tokens_per_second": 12153.023 }, { "epoch": 1.2661594398060867, "grad_norm": 0.7390092429278636, "learning_rate": 2.9704400472836816e-06, "loss": 0.3029345989227295, "num_input_tokens_seen": 599395768, "step": 18805, "train_runtime": 49321.3061, "train_tokens_per_second": 12152.877 }, { "epoch": 1.266496094802047, "grad_norm": 0.9788237053394778, "learning_rate": 2.9680238723140108e-06, "loss": 0.323366641998291, "num_input_tokens_seen": 599552864, "step": 18810, "train_runtime": 49334.8884, "train_tokens_per_second": 12152.716 }, { "epoch": 1.266832749798007, "grad_norm": 0.8215753605147385, "learning_rate": 2.9656082655799866e-06, "loss": 0.3169821262359619, "num_input_tokens_seen": 599705328, "step": 18815, "train_runtime": 49347.5162, "train_tokens_per_second": 12152.695 }, { "epoch": 1.2671694047939672, "grad_norm": 0.8977088472527147, "learning_rate": 2.9631932277571225e-06, "loss": 0.2970638990402222, "num_input_tokens_seen": 599868192, "step": 18820, "train_runtime": 49361.5845, "train_tokens_per_second": 12152.531 }, { "epoch": 1.2675060597899273, "grad_norm": 0.8567378069145913, "learning_rate": 2.9607787595207794e-06, "loss": 0.28716063499450684, "num_input_tokens_seen": 600029376, "step": 18825, "train_runtime": 49374.8159, "train_tokens_per_second": 12152.539 }, { "epoch": 1.2678427147858875, "grad_norm": 0.7319754507041214, "learning_rate": 2.9583648615461514e-06, "loss": 0.29655938148498534, "num_input_tokens_seen": 600187792, "step": 18830, "train_runtime": 49388.6552, "train_tokens_per_second": 12152.341 }, { "epoch": 1.2681793697818475, "grad_norm": 0.7576553852842867, "learning_rate": 2.955951534508281e-06, "loss": 0.34119083881378176, "num_input_tokens_seen": 600347360, "step": 18835, "train_runtime": 49401.9523, "train_tokens_per_second": 12152.3 }, { "epoch": 1.2685160247778078, "grad_norm": 0.7662576056342805, "learning_rate": 2.9535387790820452e-06, "loss": 0.31615149974823, "num_input_tokens_seen": 600507912, "step": 18840, "train_runtime": 49414.3753, "train_tokens_per_second": 12152.494 }, { "epoch": 1.2688526797737678, "grad_norm": 0.8285085753924084, "learning_rate": 2.951126595942165e-06, "loss": 0.2867731094360352, "num_input_tokens_seen": 600669520, "step": 18845, "train_runtime": 49427.426, "train_tokens_per_second": 12152.555 }, { "epoch": 1.269189334769728, "grad_norm": 0.7500496699263153, "learning_rate": 2.948714985763197e-06, "loss": 0.2837223052978516, "num_input_tokens_seen": 600827376, "step": 18850, "train_runtime": 49440.6377, "train_tokens_per_second": 12152.501 }, { "epoch": 1.269525989765688, "grad_norm": 0.8559095942215431, "learning_rate": 2.9463039492195445e-06, "loss": 0.303429913520813, "num_input_tokens_seen": 600991216, "step": 18855, "train_runtime": 49453.0737, "train_tokens_per_second": 12152.758 }, { "epoch": 1.2698626447616483, "grad_norm": 0.8215644464949324, "learning_rate": 2.9438934869854417e-06, "loss": 0.28866920471191404, "num_input_tokens_seen": 601153024, "step": 18860, "train_runtime": 49466.2547, "train_tokens_per_second": 12152.79 }, { "epoch": 1.2701992997576084, "grad_norm": 0.8547411099372176, "learning_rate": 2.9414835997349705e-06, "loss": 0.2780210733413696, "num_input_tokens_seen": 601314752, "step": 18865, "train_runtime": 49479.3557, "train_tokens_per_second": 12152.841 }, { "epoch": 1.2705359547535686, "grad_norm": 0.7405285784926955, "learning_rate": 2.939074288142045e-06, "loss": 0.31252293586730956, "num_input_tokens_seen": 601477112, "step": 18870, "train_runtime": 49492.6789, "train_tokens_per_second": 12152.85 }, { "epoch": 1.2708726097495286, "grad_norm": 0.7863578441451208, "learning_rate": 2.9366655528804257e-06, "loss": 0.2919419765472412, "num_input_tokens_seen": 601639880, "step": 18875, "train_runtime": 49506.1482, "train_tokens_per_second": 12152.832 }, { "epoch": 1.271209264745489, "grad_norm": 0.7166480684490629, "learning_rate": 2.934257394623702e-06, "loss": 0.2909376621246338, "num_input_tokens_seen": 601800304, "step": 18880, "train_runtime": 49518.9493, "train_tokens_per_second": 12152.93 }, { "epoch": 1.271545919741449, "grad_norm": 0.7163817859262532, "learning_rate": 2.9318498140453134e-06, "loss": 0.29977262020111084, "num_input_tokens_seen": 601960496, "step": 18885, "train_runtime": 49531.9719, "train_tokens_per_second": 12152.969 }, { "epoch": 1.2718825747374092, "grad_norm": 0.9082748367982564, "learning_rate": 2.929442811818527e-06, "loss": 0.30515575408935547, "num_input_tokens_seen": 602116736, "step": 18890, "train_runtime": 49544.7314, "train_tokens_per_second": 12152.992 }, { "epoch": 1.2722192297333692, "grad_norm": 0.8393355793129604, "learning_rate": 2.927036388616457e-06, "loss": 0.30097830295562744, "num_input_tokens_seen": 602270648, "step": 18895, "train_runtime": 49557.7875, "train_tokens_per_second": 12152.896 }, { "epoch": 1.2725558847293295, "grad_norm": 0.8991547677386357, "learning_rate": 2.9246305451120494e-06, "loss": 0.3226932048797607, "num_input_tokens_seen": 602424440, "step": 18900, "train_runtime": 49570.3818, "train_tokens_per_second": 12152.911 }, { "epoch": 1.2728925397252895, "grad_norm": 0.7858401051914873, "learning_rate": 2.922225281978095e-06, "loss": 0.3055391788482666, "num_input_tokens_seen": 602586976, "step": 18905, "train_runtime": 49583.729, "train_tokens_per_second": 12152.918 }, { "epoch": 1.2732291947212497, "grad_norm": 0.8484824536541136, "learning_rate": 2.919820599887212e-06, "loss": 0.29495623111724856, "num_input_tokens_seen": 602744896, "step": 18910, "train_runtime": 49596.211, "train_tokens_per_second": 12153.043 }, { "epoch": 1.2735658497172098, "grad_norm": 0.9002199793468915, "learning_rate": 2.917416499511866e-06, "loss": 0.29449806213378904, "num_input_tokens_seen": 602899200, "step": 18915, "train_runtime": 49609.4428, "train_tokens_per_second": 12152.912 }, { "epoch": 1.27390250471317, "grad_norm": 0.7683660618366864, "learning_rate": 2.9150129815243553e-06, "loss": 0.28325610160827636, "num_input_tokens_seen": 603060584, "step": 18920, "train_runtime": 49622.4751, "train_tokens_per_second": 12152.973 }, { "epoch": 1.27423915970913, "grad_norm": 0.884450978488993, "learning_rate": 2.912610046596816e-06, "loss": 0.3023883581161499, "num_input_tokens_seen": 603217736, "step": 18925, "train_runtime": 49635.8435, "train_tokens_per_second": 12152.866 }, { "epoch": 1.2745758147050903, "grad_norm": 0.748728177113573, "learning_rate": 2.91020769540122e-06, "loss": 0.30546083450317385, "num_input_tokens_seen": 603370984, "step": 18930, "train_runtime": 49649.3167, "train_tokens_per_second": 12152.654 }, { "epoch": 1.2749124697010503, "grad_norm": 0.7573276132254194, "learning_rate": 2.9078059286093795e-06, "loss": 0.2985365867614746, "num_input_tokens_seen": 603529784, "step": 18935, "train_runtime": 49662.5921, "train_tokens_per_second": 12152.603 }, { "epoch": 1.2752491246970106, "grad_norm": 0.7997916730115476, "learning_rate": 2.905404746892937e-06, "loss": 0.28757438659667967, "num_input_tokens_seen": 603685464, "step": 18940, "train_runtime": 49675.1122, "train_tokens_per_second": 12152.674 }, { "epoch": 1.2755857796929706, "grad_norm": 0.7542760729385981, "learning_rate": 2.903004150923382e-06, "loss": 0.2960397958755493, "num_input_tokens_seen": 603846928, "step": 18945, "train_runtime": 49688.1633, "train_tokens_per_second": 12152.732 }, { "epoch": 1.2759224346889309, "grad_norm": 0.8174320935214524, "learning_rate": 2.9006041413720252e-06, "loss": 0.3410667896270752, "num_input_tokens_seen": 604006120, "step": 18950, "train_runtime": 49700.9718, "train_tokens_per_second": 12152.803 }, { "epoch": 1.2762590896848909, "grad_norm": 0.8412227898758261, "learning_rate": 2.8982047189100276e-06, "loss": 0.3006908416748047, "num_input_tokens_seen": 604168768, "step": 18955, "train_runtime": 49713.8767, "train_tokens_per_second": 12152.92 }, { "epoch": 1.2765957446808511, "grad_norm": 0.8879122428055022, "learning_rate": 2.895805884208378e-06, "loss": 0.30857186317443847, "num_input_tokens_seen": 604319416, "step": 18960, "train_runtime": 49726.4133, "train_tokens_per_second": 12152.886 }, { "epoch": 1.2769323996768112, "grad_norm": 0.9027865852267539, "learning_rate": 2.8934076379379016e-06, "loss": 0.3112833261489868, "num_input_tokens_seen": 604480848, "step": 18965, "train_runtime": 49739.3966, "train_tokens_per_second": 12152.959 }, { "epoch": 1.2772690546727714, "grad_norm": 0.7911404334024478, "learning_rate": 2.891009980769266e-06, "loss": 0.2947298526763916, "num_input_tokens_seen": 604641928, "step": 18970, "train_runtime": 49752.5836, "train_tokens_per_second": 12152.975 }, { "epoch": 1.2776057096687314, "grad_norm": 0.9564593228272439, "learning_rate": 2.88861291337296e-06, "loss": 0.3028806924819946, "num_input_tokens_seen": 604801224, "step": 18975, "train_runtime": 49766.4742, "train_tokens_per_second": 12152.784 }, { "epoch": 1.2779423646646917, "grad_norm": 0.7669301412939422, "learning_rate": 2.8862164364193236e-06, "loss": 0.28706295490264894, "num_input_tokens_seen": 604963816, "step": 18980, "train_runtime": 49779.4913, "train_tokens_per_second": 12152.873 }, { "epoch": 1.2782790196606517, "grad_norm": 0.7545436164403377, "learning_rate": 2.8838205505785168e-06, "loss": 0.3003144502639771, "num_input_tokens_seen": 605124856, "step": 18985, "train_runtime": 49792.561, "train_tokens_per_second": 12152.917 }, { "epoch": 1.278615674656612, "grad_norm": 0.7150653788656524, "learning_rate": 2.881425256520547e-06, "loss": 0.2822824716567993, "num_input_tokens_seen": 605282232, "step": 18990, "train_runtime": 49805.9721, "train_tokens_per_second": 12152.804 }, { "epoch": 1.278952329652572, "grad_norm": 0.7405072882818217, "learning_rate": 2.8790305549152487e-06, "loss": 0.2495818853378296, "num_input_tokens_seen": 605444896, "step": 18995, "train_runtime": 49818.8651, "train_tokens_per_second": 12152.924 }, { "epoch": 1.2792889846485322, "grad_norm": 0.7654979207467363, "learning_rate": 2.876636446432292e-06, "loss": 0.30813183784484866, "num_input_tokens_seen": 605605248, "step": 19000, "train_runtime": 49831.7749, "train_tokens_per_second": 12152.994 }, { "epoch": 1.2796256396444923, "grad_norm": 0.7730705415760324, "learning_rate": 2.8742429317411826e-06, "loss": 0.3068549156188965, "num_input_tokens_seen": 605766456, "step": 19005, "train_runtime": 49844.8748, "train_tokens_per_second": 12153.034 }, { "epoch": 1.2799622946404525, "grad_norm": 0.8680882410871714, "learning_rate": 2.8718500115112585e-06, "loss": 0.31152465343475344, "num_input_tokens_seen": 605920088, "step": 19010, "train_runtime": 49857.6089, "train_tokens_per_second": 12153.011 }, { "epoch": 1.2802989496364126, "grad_norm": 0.7703535693196939, "learning_rate": 2.869457686411691e-06, "loss": 0.3294264316558838, "num_input_tokens_seen": 606077856, "step": 19015, "train_runtime": 49870.1402, "train_tokens_per_second": 12153.121 }, { "epoch": 1.2806356046323728, "grad_norm": 0.8404786827537626, "learning_rate": 2.8670659571114912e-06, "loss": 0.3040056943893433, "num_input_tokens_seen": 606238224, "step": 19020, "train_runtime": 49882.6117, "train_tokens_per_second": 12153.298 }, { "epoch": 1.2809722596283328, "grad_norm": 0.6960599715562762, "learning_rate": 2.864674824279491e-06, "loss": 0.2875059127807617, "num_input_tokens_seen": 606398864, "step": 19025, "train_runtime": 49896.4929, "train_tokens_per_second": 12153.136 }, { "epoch": 1.281308914624293, "grad_norm": 0.789796602593778, "learning_rate": 2.862284288584371e-06, "loss": 0.2823715448379517, "num_input_tokens_seen": 606559352, "step": 19030, "train_runtime": 49909.4206, "train_tokens_per_second": 12153.204 }, { "epoch": 1.2816455696202531, "grad_norm": 0.8740623798328989, "learning_rate": 2.8598943506946297e-06, "loss": 0.3081759691238403, "num_input_tokens_seen": 606718928, "step": 19035, "train_runtime": 49921.9419, "train_tokens_per_second": 12153.352 }, { "epoch": 1.2819822246162134, "grad_norm": 0.7950820761611049, "learning_rate": 2.85750501127861e-06, "loss": 0.28339433670043945, "num_input_tokens_seen": 606878744, "step": 19040, "train_runtime": 49935.7061, "train_tokens_per_second": 12153.202 }, { "epoch": 1.2823188796121734, "grad_norm": 0.7385173275255058, "learning_rate": 2.8551162710044827e-06, "loss": 0.31591482162475587, "num_input_tokens_seen": 607038704, "step": 19045, "train_runtime": 49948.8706, "train_tokens_per_second": 12153.202 }, { "epoch": 1.2826555346081336, "grad_norm": 0.7876415246681366, "learning_rate": 2.8527281305402503e-06, "loss": 0.3255245923995972, "num_input_tokens_seen": 607200640, "step": 19050, "train_runtime": 49962.566, "train_tokens_per_second": 12153.112 }, { "epoch": 1.2829921896040937, "grad_norm": 0.9060905067376765, "learning_rate": 2.8503405905537496e-06, "loss": 0.29764814376831056, "num_input_tokens_seen": 607357368, "step": 19055, "train_runtime": 49976.2314, "train_tokens_per_second": 12152.925 }, { "epoch": 1.283328844600054, "grad_norm": 0.7441690653990919, "learning_rate": 2.847953651712647e-06, "loss": 0.301771354675293, "num_input_tokens_seen": 607519960, "step": 19060, "train_runtime": 49988.9337, "train_tokens_per_second": 12153.089 }, { "epoch": 1.283665499596014, "grad_norm": 0.7843632782648001, "learning_rate": 2.8455673146844426e-06, "loss": 0.2886895418167114, "num_input_tokens_seen": 607677216, "step": 19065, "train_runtime": 50002.7539, "train_tokens_per_second": 12152.875 }, { "epoch": 1.2840021545919742, "grad_norm": 1.0631864152436574, "learning_rate": 2.8431815801364717e-06, "loss": 0.32060041427612307, "num_input_tokens_seen": 607838120, "step": 19070, "train_runtime": 50015.6421, "train_tokens_per_second": 12152.96 }, { "epoch": 1.2843388095879342, "grad_norm": 0.8823375813971637, "learning_rate": 2.8407964487358906e-06, "loss": 0.30711042881011963, "num_input_tokens_seen": 607999704, "step": 19075, "train_runtime": 50028.1577, "train_tokens_per_second": 12153.15 }, { "epoch": 1.2846754645838945, "grad_norm": 0.7603407365169693, "learning_rate": 2.838411921149702e-06, "loss": 0.3008668661117554, "num_input_tokens_seen": 608153296, "step": 19080, "train_runtime": 50041.5861, "train_tokens_per_second": 12152.958 }, { "epoch": 1.2850121195798545, "grad_norm": 0.7722295259943268, "learning_rate": 2.836027998044722e-06, "loss": 0.28954713344573973, "num_input_tokens_seen": 608309552, "step": 19085, "train_runtime": 50055.1985, "train_tokens_per_second": 12152.775 }, { "epoch": 1.2853487745758148, "grad_norm": 0.8329708544279469, "learning_rate": 2.8336446800876143e-06, "loss": 0.2998910903930664, "num_input_tokens_seen": 608459888, "step": 19090, "train_runtime": 50068.9058, "train_tokens_per_second": 12152.45 }, { "epoch": 1.2856854295717748, "grad_norm": 0.8256074596429657, "learning_rate": 2.8312619679448637e-06, "loss": 0.29074892997741697, "num_input_tokens_seen": 608618928, "step": 19095, "train_runtime": 50081.9694, "train_tokens_per_second": 12152.456 }, { "epoch": 1.286022084567735, "grad_norm": 0.8655096259439734, "learning_rate": 2.8288798622827884e-06, "loss": 0.309846019744873, "num_input_tokens_seen": 608773120, "step": 19100, "train_runtime": 50095.267, "train_tokens_per_second": 12152.308 }, { "epoch": 1.286358739563695, "grad_norm": 0.9141284798833497, "learning_rate": 2.826498363767536e-06, "loss": 0.3036093235015869, "num_input_tokens_seen": 608926904, "step": 19105, "train_runtime": 50108.9935, "train_tokens_per_second": 12152.048 }, { "epoch": 1.2866953945596553, "grad_norm": 2.2249312562043397, "learning_rate": 2.8241174730650855e-06, "loss": 0.298044228553772, "num_input_tokens_seen": 609085864, "step": 19110, "train_runtime": 50121.9192, "train_tokens_per_second": 12152.086 }, { "epoch": 1.2870320495556153, "grad_norm": 0.8069750249784594, "learning_rate": 2.821737190841244e-06, "loss": 0.2968132019042969, "num_input_tokens_seen": 609246552, "step": 19115, "train_runtime": 50135.7197, "train_tokens_per_second": 12151.946 }, { "epoch": 1.2873687045515756, "grad_norm": 0.8220307299753202, "learning_rate": 2.8193575177616537e-06, "loss": 0.291119647026062, "num_input_tokens_seen": 609405408, "step": 19120, "train_runtime": 50148.48, "train_tokens_per_second": 12152.022 }, { "epoch": 1.2877053595475356, "grad_norm": 0.7963017861512874, "learning_rate": 2.816978454491777e-06, "loss": 0.2780735731124878, "num_input_tokens_seen": 609568344, "step": 19125, "train_runtime": 50161.2532, "train_tokens_per_second": 12152.175 }, { "epoch": 1.2880420145434959, "grad_norm": 0.8850018470467759, "learning_rate": 2.814600001696919e-06, "loss": 0.308332633972168, "num_input_tokens_seen": 609723592, "step": 19130, "train_runtime": 50173.7579, "train_tokens_per_second": 12152.241 }, { "epoch": 1.288378669539456, "grad_norm": 0.8427057723974886, "learning_rate": 2.812222160042196e-06, "loss": 0.3095693588256836, "num_input_tokens_seen": 609885136, "step": 19135, "train_runtime": 50186.725, "train_tokens_per_second": 12152.32 }, { "epoch": 1.2887153245354162, "grad_norm": 0.7686568729059485, "learning_rate": 2.809844930192573e-06, "loss": 0.3177642345428467, "num_input_tokens_seen": 610045128, "step": 19140, "train_runtime": 50199.4356, "train_tokens_per_second": 12152.43 }, { "epoch": 1.2890519795313762, "grad_norm": 0.7975989817940082, "learning_rate": 2.807468312812831e-06, "loss": 0.31854543685913084, "num_input_tokens_seen": 610201792, "step": 19145, "train_runtime": 50212.3643, "train_tokens_per_second": 12152.421 }, { "epoch": 1.2893886345273364, "grad_norm": 0.8114246268565122, "learning_rate": 2.805092308567584e-06, "loss": 0.2737419128417969, "num_input_tokens_seen": 610363648, "step": 19150, "train_runtime": 50225.4263, "train_tokens_per_second": 12152.483 }, { "epoch": 1.2897252895232965, "grad_norm": 0.8168499955312384, "learning_rate": 2.802716918121273e-06, "loss": 0.29413819313049316, "num_input_tokens_seen": 610527280, "step": 19155, "train_runtime": 50238.4574, "train_tokens_per_second": 12152.588 }, { "epoch": 1.2900619445192567, "grad_norm": 0.815486456903987, "learning_rate": 2.8003421421381704e-06, "loss": 0.28854918479919434, "num_input_tokens_seen": 610687872, "step": 19160, "train_runtime": 50251.5409, "train_tokens_per_second": 12152.62 }, { "epoch": 1.2903985995152167, "grad_norm": 0.8428913664999467, "learning_rate": 2.797967981282371e-06, "loss": 0.3136820077896118, "num_input_tokens_seen": 610848680, "step": 19165, "train_runtime": 50264.1563, "train_tokens_per_second": 12152.769 }, { "epoch": 1.290735254511177, "grad_norm": 0.762451034482807, "learning_rate": 2.795594436217808e-06, "loss": 0.29275429248809814, "num_input_tokens_seen": 611008352, "step": 19170, "train_runtime": 50276.6907, "train_tokens_per_second": 12152.915 }, { "epoch": 1.291071909507137, "grad_norm": 0.7392659555762797, "learning_rate": 2.7932215076082277e-06, "loss": 0.2877834320068359, "num_input_tokens_seen": 611162384, "step": 19175, "train_runtime": 50289.8402, "train_tokens_per_second": 12152.8 }, { "epoch": 1.2914085645030973, "grad_norm": 0.7950732434389722, "learning_rate": 2.790849196117219e-06, "loss": 0.29698824882507324, "num_input_tokens_seen": 611326224, "step": 19180, "train_runtime": 50302.265, "train_tokens_per_second": 12153.056 }, { "epoch": 1.2917452194990573, "grad_norm": 0.7809062013733077, "learning_rate": 2.7884775024081856e-06, "loss": 0.2998488426208496, "num_input_tokens_seen": 611484848, "step": 19185, "train_runtime": 50315.1103, "train_tokens_per_second": 12153.106 }, { "epoch": 1.2920818744950175, "grad_norm": 0.7726086980819804, "learning_rate": 2.786106427144367e-06, "loss": 0.29848670959472656, "num_input_tokens_seen": 611643720, "step": 19190, "train_runtime": 50327.9492, "train_tokens_per_second": 12153.162 }, { "epoch": 1.2924185294909776, "grad_norm": 0.7702712513183868, "learning_rate": 2.783735970988828e-06, "loss": 0.27229182720184325, "num_input_tokens_seen": 611804424, "step": 19195, "train_runtime": 50340.9842, "train_tokens_per_second": 12153.207 }, { "epoch": 1.2927551844869378, "grad_norm": 0.8588948549995771, "learning_rate": 2.7813661346044566e-06, "loss": 0.30161190032958984, "num_input_tokens_seen": 611964816, "step": 19200, "train_runtime": 50354.301, "train_tokens_per_second": 12153.179 }, { "epoch": 1.2930918394828979, "grad_norm": 0.854366312663946, "learning_rate": 2.7789969186539713e-06, "loss": 0.30611362457275393, "num_input_tokens_seen": 612123464, "step": 19205, "train_runtime": 50367.6036, "train_tokens_per_second": 12153.119 }, { "epoch": 1.293428494478858, "grad_norm": 0.8495031381467388, "learning_rate": 2.776628323799915e-06, "loss": 0.2994052886962891, "num_input_tokens_seen": 612278920, "step": 19210, "train_runtime": 50380.3975, "train_tokens_per_second": 12153.118 }, { "epoch": 1.2937651494748181, "grad_norm": 0.7975051903657048, "learning_rate": 2.774260350704657e-06, "loss": 0.3006717681884766, "num_input_tokens_seen": 612437832, "step": 19215, "train_runtime": 50393.2999, "train_tokens_per_second": 12153.16 }, { "epoch": 1.2941018044707784, "grad_norm": 0.9686123541201149, "learning_rate": 2.771893000030398e-06, "loss": 0.3138278007507324, "num_input_tokens_seen": 612596920, "step": 19220, "train_runtime": 50406.1435, "train_tokens_per_second": 12153.219 }, { "epoch": 1.2944384594667384, "grad_norm": 0.8461336070935334, "learning_rate": 2.7695262724391526e-06, "loss": 0.3118725299835205, "num_input_tokens_seen": 612754280, "step": 19225, "train_runtime": 50419.7391, "train_tokens_per_second": 12153.063 }, { "epoch": 1.2947751144626987, "grad_norm": 0.8898820073506066, "learning_rate": 2.767160168592777e-06, "loss": 0.35455176830291746, "num_input_tokens_seen": 612917944, "step": 19230, "train_runtime": 50432.7752, "train_tokens_per_second": 12153.167 }, { "epoch": 1.2951117694586587, "grad_norm": 0.8431737620252795, "learning_rate": 2.7647946891529355e-06, "loss": 0.3121018648147583, "num_input_tokens_seen": 613071920, "step": 19235, "train_runtime": 50446.6787, "train_tokens_per_second": 12152.87 }, { "epoch": 1.295448424454619, "grad_norm": 0.7761520879756472, "learning_rate": 2.7624298347811342e-06, "loss": 0.30832886695861816, "num_input_tokens_seen": 613230552, "step": 19240, "train_runtime": 50460.5808, "train_tokens_per_second": 12152.665 }, { "epoch": 1.295785079450579, "grad_norm": 0.902232284504158, "learning_rate": 2.7600656061386945e-06, "loss": 0.32223007678985593, "num_input_tokens_seen": 613389944, "step": 19245, "train_runtime": 50473.2147, "train_tokens_per_second": 12152.781 }, { "epoch": 1.2961217344465392, "grad_norm": 0.8074586172047405, "learning_rate": 2.757702003886765e-06, "loss": 0.299889063835144, "num_input_tokens_seen": 613549304, "step": 19250, "train_runtime": 50487.7717, "train_tokens_per_second": 12152.434 }, { "epoch": 1.2964583894424992, "grad_norm": 0.8467134719842135, "learning_rate": 2.7553390286863205e-06, "loss": 0.29910955429077146, "num_input_tokens_seen": 613705872, "step": 19255, "train_runtime": 50501.9411, "train_tokens_per_second": 12152.124 }, { "epoch": 1.2967950444384595, "grad_norm": 0.7975895517979533, "learning_rate": 2.752976681198159e-06, "loss": 0.30665476322174073, "num_input_tokens_seen": 613867360, "step": 19260, "train_runtime": 50515.0978, "train_tokens_per_second": 12152.156 }, { "epoch": 1.2971316994344195, "grad_norm": 0.8644252621435792, "learning_rate": 2.750614962082901e-06, "loss": 0.29886689186096194, "num_input_tokens_seen": 614030536, "step": 19265, "train_runtime": 50528.1055, "train_tokens_per_second": 12152.257 }, { "epoch": 1.2974683544303798, "grad_norm": 0.705007809844978, "learning_rate": 2.748253872001e-06, "loss": 0.28118033409118653, "num_input_tokens_seen": 614187416, "step": 19270, "train_runtime": 50540.7303, "train_tokens_per_second": 12152.326 }, { "epoch": 1.2978050094263398, "grad_norm": 0.8645902514800793, "learning_rate": 2.74589341161272e-06, "loss": 0.30217299461364744, "num_input_tokens_seen": 614342592, "step": 19275, "train_runtime": 50554.0926, "train_tokens_per_second": 12152.183 }, { "epoch": 1.2981416644223, "grad_norm": 0.8171819188549311, "learning_rate": 2.743533581578163e-06, "loss": 0.30187819004058836, "num_input_tokens_seen": 614500200, "step": 19280, "train_runtime": 50566.9275, "train_tokens_per_second": 12152.215 }, { "epoch": 1.29847831941826, "grad_norm": 0.9786296752176804, "learning_rate": 2.7411743825572407e-06, "loss": 0.3500667572021484, "num_input_tokens_seen": 614663568, "step": 19285, "train_runtime": 50579.9223, "train_tokens_per_second": 12152.323 }, { "epoch": 1.2988149744142203, "grad_norm": 0.7927490365153944, "learning_rate": 2.7388158152097015e-06, "loss": 0.29631524085998534, "num_input_tokens_seen": 614826240, "step": 19290, "train_runtime": 50593.0132, "train_tokens_per_second": 12152.394 }, { "epoch": 1.2991516294101804, "grad_norm": 0.7632317250757582, "learning_rate": 2.736457880195109e-06, "loss": 0.31474192142486573, "num_input_tokens_seen": 614985344, "step": 19295, "train_runtime": 50606.1471, "train_tokens_per_second": 12152.384 }, { "epoch": 1.2994882844061406, "grad_norm": 0.8405221259363495, "learning_rate": 2.7341005781728523e-06, "loss": 0.33559064865112304, "num_input_tokens_seen": 615146608, "step": 19300, "train_runtime": 50619.2257, "train_tokens_per_second": 12152.43 }, { "epoch": 1.2998249394021006, "grad_norm": 0.8294104271001096, "learning_rate": 2.7317439098021444e-06, "loss": 0.30346877574920655, "num_input_tokens_seen": 615303640, "step": 19305, "train_runtime": 50632.0397, "train_tokens_per_second": 12152.456 }, { "epoch": 1.300161594398061, "grad_norm": 0.794912913133469, "learning_rate": 2.7293878757420185e-06, "loss": 0.30107893943786623, "num_input_tokens_seen": 615462952, "step": 19310, "train_runtime": 50644.6471, "train_tokens_per_second": 12152.577 }, { "epoch": 1.3004982493940211, "grad_norm": 0.772799828704457, "learning_rate": 2.7270324766513306e-06, "loss": 0.3015410900115967, "num_input_tokens_seen": 615624992, "step": 19315, "train_runtime": 50657.213, "train_tokens_per_second": 12152.761 }, { "epoch": 1.3008349043899812, "grad_norm": 0.78290767832286, "learning_rate": 2.724677713188767e-06, "loss": 0.3036373138427734, "num_input_tokens_seen": 615783792, "step": 19320, "train_runtime": 50670.2435, "train_tokens_per_second": 12152.77 }, { "epoch": 1.3011715593859412, "grad_norm": 0.9032441620865872, "learning_rate": 2.722323586012821e-06, "loss": 0.3068065643310547, "num_input_tokens_seen": 615946736, "step": 19325, "train_runtime": 50682.9429, "train_tokens_per_second": 12152.939 }, { "epoch": 1.3015082143819015, "grad_norm": 0.8049017214690037, "learning_rate": 2.7199700957818252e-06, "loss": 0.28746345043182375, "num_input_tokens_seen": 616108776, "step": 19330, "train_runtime": 50695.95, "train_tokens_per_second": 12153.018 }, { "epoch": 1.3018448693778617, "grad_norm": 0.8606417673000492, "learning_rate": 2.717617243153918e-06, "loss": 0.3037557601928711, "num_input_tokens_seen": 616265184, "step": 19335, "train_runtime": 50708.3794, "train_tokens_per_second": 12153.123 }, { "epoch": 1.3021815243738217, "grad_norm": 0.7820839143729765, "learning_rate": 2.715265028787073e-06, "loss": 0.3088447093963623, "num_input_tokens_seen": 616419448, "step": 19340, "train_runtime": 50721.2854, "train_tokens_per_second": 12153.072 }, { "epoch": 1.3025181793697818, "grad_norm": 0.9279179195378255, "learning_rate": 2.7129134533390765e-06, "loss": 0.331957745552063, "num_input_tokens_seen": 616582184, "step": 19345, "train_runtime": 50733.7158, "train_tokens_per_second": 12153.302 }, { "epoch": 1.302854834365742, "grad_norm": 0.8795953317221421, "learning_rate": 2.7105625174675404e-06, "loss": 0.2849281311035156, "num_input_tokens_seen": 616743768, "step": 19350, "train_runtime": 50746.2301, "train_tokens_per_second": 12153.489 }, { "epoch": 1.3031914893617023, "grad_norm": 0.8024830172412205, "learning_rate": 2.7082122218298957e-06, "loss": 0.29079256057739256, "num_input_tokens_seen": 616899512, "step": 19355, "train_runtime": 50759.5112, "train_tokens_per_second": 12153.378 }, { "epoch": 1.3035281443576623, "grad_norm": 0.8216082117798608, "learning_rate": 2.7058625670833947e-06, "loss": 0.28796977996826173, "num_input_tokens_seen": 617052856, "step": 19360, "train_runtime": 50772.1524, "train_tokens_per_second": 12153.372 }, { "epoch": 1.3038647993536223, "grad_norm": 0.84879494773889, "learning_rate": 2.70351355388511e-06, "loss": 0.31571574211120607, "num_input_tokens_seen": 617208952, "step": 19365, "train_runtime": 50785.2184, "train_tokens_per_second": 12153.319 }, { "epoch": 1.3042014543495826, "grad_norm": 0.8084811549012915, "learning_rate": 2.7011651828919407e-06, "loss": 0.3083205699920654, "num_input_tokens_seen": 617368432, "step": 19370, "train_runtime": 50798.1183, "train_tokens_per_second": 12153.372 }, { "epoch": 1.3045381093455428, "grad_norm": 0.899456326303277, "learning_rate": 2.698817454760593e-06, "loss": 0.31144065856933595, "num_input_tokens_seen": 617522760, "step": 19375, "train_runtime": 50810.8754, "train_tokens_per_second": 12153.358 }, { "epoch": 1.3048747643415028, "grad_norm": 0.7874306599097675, "learning_rate": 2.696470370147611e-06, "loss": 0.30310258865356443, "num_input_tokens_seen": 617682576, "step": 19380, "train_runtime": 50823.7822, "train_tokens_per_second": 12153.416 }, { "epoch": 1.3052114193374629, "grad_norm": 0.817462490309342, "learning_rate": 2.69412392970934e-06, "loss": 0.33252105712890623, "num_input_tokens_seen": 617842024, "step": 19385, "train_runtime": 50837.0107, "train_tokens_per_second": 12153.39 }, { "epoch": 1.3055480743334231, "grad_norm": 0.7180311841570963, "learning_rate": 2.6917781341019615e-06, "loss": 0.2898344278335571, "num_input_tokens_seen": 618001464, "step": 19390, "train_runtime": 50850.1063, "train_tokens_per_second": 12153.396 }, { "epoch": 1.3058847293293834, "grad_norm": 0.7869603056004898, "learning_rate": 2.689432983981467e-06, "loss": 0.2947995185852051, "num_input_tokens_seen": 618163800, "step": 19395, "train_runtime": 50862.7308, "train_tokens_per_second": 12153.571 }, { "epoch": 1.3062213843253434, "grad_norm": 0.7256848575572841, "learning_rate": 2.6870884800036713e-06, "loss": 0.2963334798812866, "num_input_tokens_seen": 618323008, "step": 19400, "train_runtime": 50875.6808, "train_tokens_per_second": 12153.607 }, { "epoch": 1.3065580393213034, "grad_norm": 0.8359624181575982, "learning_rate": 2.684744622824207e-06, "loss": 0.32390923500061036, "num_input_tokens_seen": 618476008, "step": 19405, "train_runtime": 50888.4903, "train_tokens_per_second": 12153.554 }, { "epoch": 1.3068946943172637, "grad_norm": 0.7561296037628713, "learning_rate": 2.6824014130985255e-06, "loss": 0.30150132179260253, "num_input_tokens_seen": 618634536, "step": 19410, "train_runtime": 50901.3015, "train_tokens_per_second": 12153.609 }, { "epoch": 1.307231349313224, "grad_norm": 0.7625068799720057, "learning_rate": 2.680058851481896e-06, "loss": 0.28853092193603513, "num_input_tokens_seen": 618791032, "step": 19415, "train_runtime": 50914.2188, "train_tokens_per_second": 12153.6 }, { "epoch": 1.307568004309184, "grad_norm": 0.9086420844998367, "learning_rate": 2.6777169386294154e-06, "loss": 0.3090104103088379, "num_input_tokens_seen": 618947568, "step": 19420, "train_runtime": 50927.1061, "train_tokens_per_second": 12153.598 }, { "epoch": 1.307904659305144, "grad_norm": 1.1208392053742278, "learning_rate": 2.6753756751959846e-06, "loss": 0.30269370079040525, "num_input_tokens_seen": 619108664, "step": 19425, "train_runtime": 50939.577, "train_tokens_per_second": 12153.785 }, { "epoch": 1.3082413143011042, "grad_norm": 0.7727990872657099, "learning_rate": 2.6730350618363367e-06, "loss": 0.2951890707015991, "num_input_tokens_seen": 619269176, "step": 19430, "train_runtime": 50953.2194, "train_tokens_per_second": 12153.681 }, { "epoch": 1.3085779692970645, "grad_norm": 0.7683100655665543, "learning_rate": 2.6706950992050097e-06, "loss": 0.3051133155822754, "num_input_tokens_seen": 619425720, "step": 19435, "train_runtime": 50966.1333, "train_tokens_per_second": 12153.673 }, { "epoch": 1.3089146242930245, "grad_norm": 0.8365023474882791, "learning_rate": 2.6683557879563726e-06, "loss": 0.3211726188659668, "num_input_tokens_seen": 619585240, "step": 19440, "train_runtime": 50979.6561, "train_tokens_per_second": 12153.578 }, { "epoch": 1.3092512792889845, "grad_norm": 0.797114249011439, "learning_rate": 2.6660171287446045e-06, "loss": 0.3359297513961792, "num_input_tokens_seen": 619746104, "step": 19445, "train_runtime": 50992.4773, "train_tokens_per_second": 12153.677 }, { "epoch": 1.3095879342849448, "grad_norm": 0.8414524313814291, "learning_rate": 2.6636791222237034e-06, "loss": 0.3211383819580078, "num_input_tokens_seen": 619905264, "step": 19450, "train_runtime": 51005.4939, "train_tokens_per_second": 12153.696 }, { "epoch": 1.309924589280905, "grad_norm": 0.8330208898157156, "learning_rate": 2.6613417690474864e-06, "loss": 0.29979941844940183, "num_input_tokens_seen": 620063264, "step": 19455, "train_runtime": 51018.4005, "train_tokens_per_second": 12153.718 }, { "epoch": 1.310261244276865, "grad_norm": 0.8253621326976531, "learning_rate": 2.6590050698695856e-06, "loss": 0.3024393081665039, "num_input_tokens_seen": 620220976, "step": 19460, "train_runtime": 51030.8188, "train_tokens_per_second": 12153.851 }, { "epoch": 1.310597899272825, "grad_norm": 0.7428989443394158, "learning_rate": 2.6566690253434508e-06, "loss": 0.3112042903900146, "num_input_tokens_seen": 620383056, "step": 19465, "train_runtime": 51043.4074, "train_tokens_per_second": 12154.029 }, { "epoch": 1.3109345542687854, "grad_norm": 0.7885880659010636, "learning_rate": 2.654333636122354e-06, "loss": 0.28822941780090333, "num_input_tokens_seen": 620544160, "step": 19470, "train_runtime": 51056.3785, "train_tokens_per_second": 12154.097 }, { "epoch": 1.3112712092647456, "grad_norm": 0.7905743392699995, "learning_rate": 2.6519989028593728e-06, "loss": 0.3059583902359009, "num_input_tokens_seen": 620705704, "step": 19475, "train_runtime": 51068.8412, "train_tokens_per_second": 12154.294 }, { "epoch": 1.3116078642607056, "grad_norm": 0.7745742693211273, "learning_rate": 2.649664826207414e-06, "loss": 0.3137577295303345, "num_input_tokens_seen": 620866024, "step": 19480, "train_runtime": 51081.7664, "train_tokens_per_second": 12154.357 }, { "epoch": 1.3119445192566657, "grad_norm": 0.82953354582996, "learning_rate": 2.647331406819189e-06, "loss": 0.3231818199157715, "num_input_tokens_seen": 621025552, "step": 19485, "train_runtime": 51095.7897, "train_tokens_per_second": 12154.143 }, { "epoch": 1.312281174252626, "grad_norm": 0.707543081543998, "learning_rate": 2.644998645347236e-06, "loss": 0.28951272964477537, "num_input_tokens_seen": 621183464, "step": 19490, "train_runtime": 51109.0852, "train_tokens_per_second": 12154.071 }, { "epoch": 1.3126178292485862, "grad_norm": 0.9121508647342764, "learning_rate": 2.6426665424439025e-06, "loss": 0.3198955297470093, "num_input_tokens_seen": 621346088, "step": 19495, "train_runtime": 51121.7112, "train_tokens_per_second": 12154.251 }, { "epoch": 1.3129544842445462, "grad_norm": 0.8574420271957544, "learning_rate": 2.6403350987613526e-06, "loss": 0.30613884925842283, "num_input_tokens_seen": 621506320, "step": 19500, "train_runtime": 51134.5718, "train_tokens_per_second": 12154.327 }, { "epoch": 1.3132911392405062, "grad_norm": 0.8503916968253756, "learning_rate": 2.6380043149515676e-06, "loss": 0.3064993381500244, "num_input_tokens_seen": 621663760, "step": 19505, "train_runtime": 51148.0516, "train_tokens_per_second": 12154.202 }, { "epoch": 1.3136277942364665, "grad_norm": 0.86049677615533, "learning_rate": 2.6356741916663453e-06, "loss": 0.30734429359436033, "num_input_tokens_seen": 621826168, "step": 19510, "train_runtime": 51161.0489, "train_tokens_per_second": 12154.289 }, { "epoch": 1.3139644492324267, "grad_norm": 0.8533114870241088, "learning_rate": 2.6333447295572933e-06, "loss": 0.32071857452392577, "num_input_tokens_seen": 621988744, "step": 19515, "train_runtime": 51174.3456, "train_tokens_per_second": 12154.308 }, { "epoch": 1.3143011042283868, "grad_norm": 0.7663248817016668, "learning_rate": 2.631015929275845e-06, "loss": 0.30270018577575686, "num_input_tokens_seen": 622145832, "step": 19520, "train_runtime": 51187.5188, "train_tokens_per_second": 12154.249 }, { "epoch": 1.3146377592243468, "grad_norm": 0.896019977610222, "learning_rate": 2.628687791473234e-06, "loss": 0.28989624977111816, "num_input_tokens_seen": 622306016, "step": 19525, "train_runtime": 51200.4916, "train_tokens_per_second": 12154.298 }, { "epoch": 1.314974414220307, "grad_norm": 0.860712890152173, "learning_rate": 2.6263603168005224e-06, "loss": 0.2762287616729736, "num_input_tokens_seen": 622467576, "step": 19530, "train_runtime": 51213.0121, "train_tokens_per_second": 12154.481 }, { "epoch": 1.3153110692162673, "grad_norm": 0.7509866742864634, "learning_rate": 2.6240335059085797e-06, "loss": 0.30350775718688966, "num_input_tokens_seen": 622628464, "step": 19535, "train_runtime": 51226.1602, "train_tokens_per_second": 12154.502 }, { "epoch": 1.3156477242122273, "grad_norm": 0.9272330754229331, "learning_rate": 2.62170735944809e-06, "loss": 0.3107863664627075, "num_input_tokens_seen": 622786016, "step": 19540, "train_runtime": 51239.5308, "train_tokens_per_second": 12154.405 }, { "epoch": 1.3159843792081873, "grad_norm": 0.7967580808965196, "learning_rate": 2.6193818780695537e-06, "loss": 0.29716806411743163, "num_input_tokens_seen": 622945112, "step": 19545, "train_runtime": 51252.3172, "train_tokens_per_second": 12154.477 }, { "epoch": 1.3163210342041476, "grad_norm": 0.9051371337678246, "learning_rate": 2.6170570624232837e-06, "loss": 0.3097166776657104, "num_input_tokens_seen": 623097736, "step": 19550, "train_runtime": 51265.6402, "train_tokens_per_second": 12154.295 }, { "epoch": 1.3166576892001078, "grad_norm": 0.823702453692766, "learning_rate": 2.6147329131594078e-06, "loss": 0.290910530090332, "num_input_tokens_seen": 623260688, "step": 19555, "train_runtime": 51278.4662, "train_tokens_per_second": 12154.433 }, { "epoch": 1.3169943441960679, "grad_norm": 0.9126620153570457, "learning_rate": 2.612409430927867e-06, "loss": 0.2691087245941162, "num_input_tokens_seen": 623421912, "step": 19560, "train_runtime": 51291.4874, "train_tokens_per_second": 12154.491 }, { "epoch": 1.317330999192028, "grad_norm": 1.034136265084071, "learning_rate": 2.610086616378413e-06, "loss": 0.27335002422332766, "num_input_tokens_seen": 623578456, "step": 19565, "train_runtime": 51305.0401, "train_tokens_per_second": 12154.331 }, { "epoch": 1.3176676541879881, "grad_norm": 0.7594328571843869, "learning_rate": 2.60776447016062e-06, "loss": 0.30710887908935547, "num_input_tokens_seen": 623741128, "step": 19570, "train_runtime": 51318.0715, "train_tokens_per_second": 12154.415 }, { "epoch": 1.3180043091839484, "grad_norm": 0.8750229927937976, "learning_rate": 2.6054429929238607e-06, "loss": 0.31640024185180665, "num_input_tokens_seen": 623895912, "step": 19575, "train_runtime": 51331.1475, "train_tokens_per_second": 12154.334 }, { "epoch": 1.3183409641799084, "grad_norm": 0.7169821376224397, "learning_rate": 2.603122185317335e-06, "loss": 0.28309829235076905, "num_input_tokens_seen": 624052808, "step": 19580, "train_runtime": 51344.8004, "train_tokens_per_second": 12154.158 }, { "epoch": 1.3186776191758685, "grad_norm": 0.8084567445019526, "learning_rate": 2.6008020479900465e-06, "loss": 0.2615352630615234, "num_input_tokens_seen": 624213840, "step": 19585, "train_runtime": 51358.0629, "train_tokens_per_second": 12154.155 }, { "epoch": 1.3190142741718287, "grad_norm": 0.7788142530057693, "learning_rate": 2.598482581590815e-06, "loss": 0.2996666431427002, "num_input_tokens_seen": 624375832, "step": 19590, "train_runtime": 51370.6315, "train_tokens_per_second": 12154.334 }, { "epoch": 1.319350929167789, "grad_norm": 0.776199913372685, "learning_rate": 2.5961637867682715e-06, "loss": 0.27076921463012693, "num_input_tokens_seen": 624538968, "step": 19595, "train_runtime": 51383.4589, "train_tokens_per_second": 12154.475 }, { "epoch": 1.319687584163749, "grad_norm": 0.7731871966869023, "learning_rate": 2.5938456641708598e-06, "loss": 0.27604074478149415, "num_input_tokens_seen": 624694792, "step": 19600, "train_runtime": 51395.917, "train_tokens_per_second": 12154.561 }, { "epoch": 1.320024239159709, "grad_norm": 0.8869622761454629, "learning_rate": 2.591528214446836e-06, "loss": 0.2942762613296509, "num_input_tokens_seen": 624857320, "step": 19605, "train_runtime": 51408.6066, "train_tokens_per_second": 12154.722 }, { "epoch": 1.3203608941556693, "grad_norm": 0.8319141741007687, "learning_rate": 2.5892114382442664e-06, "loss": 0.3119437456130981, "num_input_tokens_seen": 625018504, "step": 19610, "train_runtime": 51422.2564, "train_tokens_per_second": 12154.63 }, { "epoch": 1.3206975491516295, "grad_norm": 0.7453286931899984, "learning_rate": 2.5868953362110287e-06, "loss": 0.3089602947235107, "num_input_tokens_seen": 625176808, "step": 19615, "train_runtime": 51434.7773, "train_tokens_per_second": 12154.749 }, { "epoch": 1.3210342041475895, "grad_norm": 0.7695081180328626, "learning_rate": 2.5845799089948196e-06, "loss": 0.3006046533584595, "num_input_tokens_seen": 625334984, "step": 19620, "train_runtime": 51448.1783, "train_tokens_per_second": 12154.657 }, { "epoch": 1.3213708591435496, "grad_norm": 0.8313242401041385, "learning_rate": 2.5822651572431323e-06, "loss": 0.28742949962615966, "num_input_tokens_seen": 625494304, "step": 19625, "train_runtime": 51460.6615, "train_tokens_per_second": 12154.805 }, { "epoch": 1.3217075141395098, "grad_norm": 0.8923232472036869, "learning_rate": 2.5799510816032867e-06, "loss": 0.3045827388763428, "num_input_tokens_seen": 625646248, "step": 19630, "train_runtime": 51474.6109, "train_tokens_per_second": 12154.463 }, { "epoch": 1.32204416913547, "grad_norm": 0.8206765679477448, "learning_rate": 2.577637682722404e-06, "loss": 0.3064920663833618, "num_input_tokens_seen": 625805272, "step": 19635, "train_runtime": 51488.0176, "train_tokens_per_second": 12154.387 }, { "epoch": 1.32238082413143, "grad_norm": 0.9669158006397705, "learning_rate": 2.5753249612474195e-06, "loss": 0.31276593208312986, "num_input_tokens_seen": 625965696, "step": 19640, "train_runtime": 51501.534, "train_tokens_per_second": 12154.312 }, { "epoch": 1.3227174791273901, "grad_norm": 0.7936738656190904, "learning_rate": 2.5730129178250774e-06, "loss": 0.308038067817688, "num_input_tokens_seen": 626127968, "step": 19645, "train_runtime": 51513.9695, "train_tokens_per_second": 12154.528 }, { "epoch": 1.3230541341233504, "grad_norm": 0.7292287721186009, "learning_rate": 2.570701553101933e-06, "loss": 0.29520750045776367, "num_input_tokens_seen": 626287800, "step": 19650, "train_runtime": 51527.5551, "train_tokens_per_second": 12154.425 }, { "epoch": 1.3233907891193106, "grad_norm": 0.810933398662699, "learning_rate": 2.568390867724354e-06, "loss": 0.3198778867721558, "num_input_tokens_seen": 626447696, "step": 19655, "train_runtime": 51540.1949, "train_tokens_per_second": 12154.547 }, { "epoch": 1.3237274441152707, "grad_norm": 0.8893684432004132, "learning_rate": 2.5660808623385143e-06, "loss": 0.30401718616485596, "num_input_tokens_seen": 626604976, "step": 19660, "train_runtime": 51553.1487, "train_tokens_per_second": 12154.543 }, { "epoch": 1.3240640991112307, "grad_norm": 0.737504220497609, "learning_rate": 2.5637715375903984e-06, "loss": 0.27608156204223633, "num_input_tokens_seen": 626763904, "step": 19665, "train_runtime": 51565.6547, "train_tokens_per_second": 12154.678 }, { "epoch": 1.324400754107191, "grad_norm": 0.8679580728059286, "learning_rate": 2.5614628941258075e-06, "loss": 0.28482856750488283, "num_input_tokens_seen": 626915392, "step": 19670, "train_runtime": 51578.7953, "train_tokens_per_second": 12154.518 }, { "epoch": 1.3247374091031512, "grad_norm": 0.8926079342176564, "learning_rate": 2.5591549325903388e-06, "loss": 0.30926659107208254, "num_input_tokens_seen": 627078840, "step": 19675, "train_runtime": 51591.2308, "train_tokens_per_second": 12154.756 }, { "epoch": 1.3250740640991112, "grad_norm": 0.8225348615484551, "learning_rate": 2.5568476536294105e-06, "loss": 0.3154122829437256, "num_input_tokens_seen": 627240232, "step": 19680, "train_runtime": 51605.0014, "train_tokens_per_second": 12154.64 }, { "epoch": 1.3254107190950712, "grad_norm": 0.8328104218677164, "learning_rate": 2.5545410578882466e-06, "loss": 0.2782647132873535, "num_input_tokens_seen": 627400376, "step": 19685, "train_runtime": 51617.4429, "train_tokens_per_second": 12154.813 }, { "epoch": 1.3257473740910315, "grad_norm": 0.9054075095938547, "learning_rate": 2.5522351460118776e-06, "loss": 0.28180980682373047, "num_input_tokens_seen": 627552576, "step": 19690, "train_runtime": 51630.7248, "train_tokens_per_second": 12154.634 }, { "epoch": 1.3260840290869917, "grad_norm": 0.759290983151401, "learning_rate": 2.549929918645144e-06, "loss": 0.3023005485534668, "num_input_tokens_seen": 627713032, "step": 19695, "train_runtime": 51643.1624, "train_tokens_per_second": 12154.814 }, { "epoch": 1.3264206840829518, "grad_norm": 0.7819641715403917, "learning_rate": 2.5476253764326963e-06, "loss": 0.28793699741363527, "num_input_tokens_seen": 627868016, "step": 19700, "train_runtime": 51656.2834, "train_tokens_per_second": 12154.727 }, { "epoch": 1.3267573390789118, "grad_norm": 0.8146269629700942, "learning_rate": 2.5453215200189927e-06, "loss": 0.29643688201904295, "num_input_tokens_seen": 628026096, "step": 19705, "train_runtime": 51669.4113, "train_tokens_per_second": 12154.698 }, { "epoch": 1.327093994074872, "grad_norm": 0.792352710196902, "learning_rate": 2.543018350048298e-06, "loss": 0.28310070037841795, "num_input_tokens_seen": 628185696, "step": 19710, "train_runtime": 51682.0675, "train_tokens_per_second": 12154.81 }, { "epoch": 1.3274306490708323, "grad_norm": 0.8792669158722032, "learning_rate": 2.540715867164685e-06, "loss": 0.31339011192321775, "num_input_tokens_seen": 628347392, "step": 19715, "train_runtime": 51695.7946, "train_tokens_per_second": 12154.71 }, { "epoch": 1.3277673040667923, "grad_norm": 0.7581743801224934, "learning_rate": 2.538414072012042e-06, "loss": 0.3200429201126099, "num_input_tokens_seen": 628505816, "step": 19720, "train_runtime": 51708.8831, "train_tokens_per_second": 12154.697 }, { "epoch": 1.3281039590627524, "grad_norm": 0.9109197326763242, "learning_rate": 2.53611296523405e-06, "loss": 0.31004900932312013, "num_input_tokens_seen": 628662232, "step": 19725, "train_runtime": 51723.0129, "train_tokens_per_second": 12154.401 }, { "epoch": 1.3284406140587126, "grad_norm": 0.8503272190874704, "learning_rate": 2.5338125474742127e-06, "loss": 0.2877772331237793, "num_input_tokens_seen": 628818200, "step": 19730, "train_runtime": 51735.6435, "train_tokens_per_second": 12154.448 }, { "epoch": 1.3287772690546729, "grad_norm": 0.7674807669742923, "learning_rate": 2.531512819375832e-06, "loss": 0.2906970024108887, "num_input_tokens_seen": 628978024, "step": 19735, "train_runtime": 51748.1296, "train_tokens_per_second": 12154.604 }, { "epoch": 1.3291139240506329, "grad_norm": 0.786402406831615, "learning_rate": 2.52921378158202e-06, "loss": 0.2792159080505371, "num_input_tokens_seen": 629132712, "step": 19740, "train_runtime": 51761.6167, "train_tokens_per_second": 12154.425 }, { "epoch": 1.329450579046593, "grad_norm": 0.826128388834396, "learning_rate": 2.5269154347356957e-06, "loss": 0.27422029972076417, "num_input_tokens_seen": 629291504, "step": 19745, "train_runtime": 51774.3129, "train_tokens_per_second": 12154.512 }, { "epoch": 1.3297872340425532, "grad_norm": 0.9624224796152259, "learning_rate": 2.5246177794795834e-06, "loss": 0.3086543560028076, "num_input_tokens_seen": 629445600, "step": 19750, "train_runtime": 51787.9875, "train_tokens_per_second": 12154.278 }, { "epoch": 1.3301238890385134, "grad_norm": 0.7126395621128093, "learning_rate": 2.5223208164562163e-06, "loss": 0.3087146520614624, "num_input_tokens_seen": 629600312, "step": 19755, "train_runtime": 51800.6331, "train_tokens_per_second": 12154.298 }, { "epoch": 1.3304605440344734, "grad_norm": 0.7856457956260945, "learning_rate": 2.5200245463079315e-06, "loss": 0.3151549816131592, "num_input_tokens_seen": 629759920, "step": 19760, "train_runtime": 51813.8985, "train_tokens_per_second": 12154.266 }, { "epoch": 1.3307971990304335, "grad_norm": 0.8079116093773693, "learning_rate": 2.5177289696768725e-06, "loss": 0.3017305850982666, "num_input_tokens_seen": 629917960, "step": 19765, "train_runtime": 51826.9977, "train_tokens_per_second": 12154.244 }, { "epoch": 1.3311338540263937, "grad_norm": 0.837008394646822, "learning_rate": 2.515434087204996e-06, "loss": 0.29909167289733884, "num_input_tokens_seen": 630080144, "step": 19770, "train_runtime": 51839.5988, "train_tokens_per_second": 12154.418 }, { "epoch": 1.331470509022354, "grad_norm": 0.7233785928159718, "learning_rate": 2.51313989953405e-06, "loss": 0.30140299797058107, "num_input_tokens_seen": 630241184, "step": 19775, "train_runtime": 51852.5332, "train_tokens_per_second": 12154.492 }, { "epoch": 1.331807164018314, "grad_norm": 0.7707903583020421, "learning_rate": 2.510846407305603e-06, "loss": 0.28589801788330077, "num_input_tokens_seen": 630400544, "step": 19780, "train_runtime": 51865.3788, "train_tokens_per_second": 12154.554 }, { "epoch": 1.332143819014274, "grad_norm": 0.7641749363354232, "learning_rate": 2.508553611161021e-06, "loss": 0.30675008296966555, "num_input_tokens_seen": 630563344, "step": 19785, "train_runtime": 51878.3597, "train_tokens_per_second": 12154.651 }, { "epoch": 1.3324804740102343, "grad_norm": 0.7893444557412274, "learning_rate": 2.5062615117414773e-06, "loss": 0.3037196159362793, "num_input_tokens_seen": 630727136, "step": 19790, "train_runtime": 51891.4796, "train_tokens_per_second": 12154.734 }, { "epoch": 1.3328171290061945, "grad_norm": 0.7773922753063138, "learning_rate": 2.50397010968795e-06, "loss": 0.27981841564178467, "num_input_tokens_seen": 630882312, "step": 19795, "train_runtime": 51904.3495, "train_tokens_per_second": 12154.71 }, { "epoch": 1.3331537840021546, "grad_norm": 0.869981684318592, "learning_rate": 2.501679405641222e-06, "loss": 0.3257544279098511, "num_input_tokens_seen": 631041224, "step": 19800, "train_runtime": 51916.8851, "train_tokens_per_second": 12154.836 }, { "epoch": 1.3334904389981148, "grad_norm": 0.8316798513378483, "learning_rate": 2.499389400241881e-06, "loss": 0.29658730030059816, "num_input_tokens_seen": 631193760, "step": 19805, "train_runtime": 51930.268, "train_tokens_per_second": 12154.641 }, { "epoch": 1.3338270939940748, "grad_norm": 0.805546278814821, "learning_rate": 2.497100094130321e-06, "loss": 0.2668275833129883, "num_input_tokens_seen": 631353656, "step": 19810, "train_runtime": 51943.4149, "train_tokens_per_second": 12154.643 }, { "epoch": 1.334163748990035, "grad_norm": 0.7900818195890321, "learning_rate": 2.494811487946737e-06, "loss": 0.2999356746673584, "num_input_tokens_seen": 631514072, "step": 19815, "train_runtime": 51956.4481, "train_tokens_per_second": 12154.681 }, { "epoch": 1.3345004039859951, "grad_norm": 0.7916016675742044, "learning_rate": 2.492523582331135e-06, "loss": 0.3024959325790405, "num_input_tokens_seen": 631671160, "step": 19820, "train_runtime": 51968.8966, "train_tokens_per_second": 12154.793 }, { "epoch": 1.3348370589819554, "grad_norm": 0.8189347327381548, "learning_rate": 2.4902363779233134e-06, "loss": 0.27855596542358396, "num_input_tokens_seen": 631830776, "step": 19825, "train_runtime": 51982.0558, "train_tokens_per_second": 12154.786 }, { "epoch": 1.3351737139779154, "grad_norm": 0.7747595173437904, "learning_rate": 2.4879498753628885e-06, "loss": 0.29611940383911134, "num_input_tokens_seen": 631985976, "step": 19830, "train_runtime": 51995.0139, "train_tokens_per_second": 12154.742 }, { "epoch": 1.3355103689738757, "grad_norm": 0.6724048275768274, "learning_rate": 2.4856640752892702e-06, "loss": 0.2555154085159302, "num_input_tokens_seen": 632147616, "step": 19835, "train_runtime": 52008.1678, "train_tokens_per_second": 12154.776 }, { "epoch": 1.3358470239698357, "grad_norm": 0.8092913043168205, "learning_rate": 2.4833789783416757e-06, "loss": 0.27653489112854, "num_input_tokens_seen": 632307536, "step": 19840, "train_runtime": 52021.689, "train_tokens_per_second": 12154.691 }, { "epoch": 1.336183678965796, "grad_norm": 0.8630187769543424, "learning_rate": 2.4810945851591245e-06, "loss": 0.3180494785308838, "num_input_tokens_seen": 632466168, "step": 19845, "train_runtime": 52036.1571, "train_tokens_per_second": 12154.36 }, { "epoch": 1.336520333961756, "grad_norm": 0.829062470257664, "learning_rate": 2.4788108963804406e-06, "loss": 0.30126290321350097, "num_input_tokens_seen": 632627768, "step": 19850, "train_runtime": 52049.9319, "train_tokens_per_second": 12154.248 }, { "epoch": 1.3368569889577162, "grad_norm": 0.7533111845683165, "learning_rate": 2.4765279126442502e-06, "loss": 0.29823622703552244, "num_input_tokens_seen": 632790136, "step": 19855, "train_runtime": 52063.2331, "train_tokens_per_second": 12154.261 }, { "epoch": 1.3371936439536762, "grad_norm": 0.7697610454269382, "learning_rate": 2.4742456345889828e-06, "loss": 0.30764946937561033, "num_input_tokens_seen": 632946720, "step": 19860, "train_runtime": 52076.6061, "train_tokens_per_second": 12154.147 }, { "epoch": 1.3375302989496365, "grad_norm": 0.7979137173361226, "learning_rate": 2.471964062852867e-06, "loss": 0.3004822015762329, "num_input_tokens_seen": 633105872, "step": 19865, "train_runtime": 52089.1042, "train_tokens_per_second": 12154.286 }, { "epoch": 1.3378669539455965, "grad_norm": 0.7211803037205384, "learning_rate": 2.469683198073943e-06, "loss": 0.2771628379821777, "num_input_tokens_seen": 633267904, "step": 19870, "train_runtime": 52102.6158, "train_tokens_per_second": 12154.244 }, { "epoch": 1.3382036089415568, "grad_norm": 0.9844008517763483, "learning_rate": 2.4674030408900414e-06, "loss": 0.29499120712280275, "num_input_tokens_seen": 633420176, "step": 19875, "train_runtime": 52117.7849, "train_tokens_per_second": 12153.628 }, { "epoch": 1.3385402639375168, "grad_norm": 0.8688585282802, "learning_rate": 2.465123591938805e-06, "loss": 0.30530877113342286, "num_input_tokens_seen": 633580640, "step": 19880, "train_runtime": 52132.0287, "train_tokens_per_second": 12153.385 }, { "epoch": 1.338876918933477, "grad_norm": 0.6927180242123807, "learning_rate": 2.462844851857673e-06, "loss": 0.3009660720825195, "num_input_tokens_seen": 633740800, "step": 19885, "train_runtime": 52145.2335, "train_tokens_per_second": 12153.379 }, { "epoch": 1.339213573929437, "grad_norm": 0.9173090432629345, "learning_rate": 2.4605668212838878e-06, "loss": 0.31364850997924804, "num_input_tokens_seen": 633894712, "step": 19890, "train_runtime": 52158.0247, "train_tokens_per_second": 12153.35 }, { "epoch": 1.3395502289253973, "grad_norm": 0.8671865075518089, "learning_rate": 2.458289500854493e-06, "loss": 0.34432239532470704, "num_input_tokens_seen": 634054968, "step": 19895, "train_runtime": 52170.6499, "train_tokens_per_second": 12153.48 }, { "epoch": 1.3398868839213574, "grad_norm": 0.7644951678305448, "learning_rate": 2.4560128912063353e-06, "loss": 0.3196416854858398, "num_input_tokens_seen": 634211088, "step": 19900, "train_runtime": 52183.176, "train_tokens_per_second": 12153.555 }, { "epoch": 1.3402235389173176, "grad_norm": 0.9512354150127618, "learning_rate": 2.4537369929760596e-06, "loss": 0.33624939918518065, "num_input_tokens_seen": 634373920, "step": 19905, "train_runtime": 52195.9398, "train_tokens_per_second": 12153.702 }, { "epoch": 1.3405601939132776, "grad_norm": 0.7645194368857552, "learning_rate": 2.4514618068001144e-06, "loss": 0.29656047821044923, "num_input_tokens_seen": 634532608, "step": 19910, "train_runtime": 52209.5133, "train_tokens_per_second": 12153.582 }, { "epoch": 1.3408968489092379, "grad_norm": 0.8491749965957714, "learning_rate": 2.4491873333147463e-06, "loss": 0.29364495277404784, "num_input_tokens_seen": 634692920, "step": 19915, "train_runtime": 52223.0599, "train_tokens_per_second": 12153.499 }, { "epoch": 1.341233503905198, "grad_norm": 0.7826073957281497, "learning_rate": 2.4469135731560106e-06, "loss": 0.26431825160980227, "num_input_tokens_seen": 634853984, "step": 19920, "train_runtime": 52236.6501, "train_tokens_per_second": 12153.421 }, { "epoch": 1.3415701589011582, "grad_norm": 0.8363216956410162, "learning_rate": 2.4446405269597494e-06, "loss": 0.3138526439666748, "num_input_tokens_seen": 635014616, "step": 19925, "train_runtime": 52249.1179, "train_tokens_per_second": 12153.595 }, { "epoch": 1.3419068138971182, "grad_norm": 0.7565652427878659, "learning_rate": 2.442368195361618e-06, "loss": 0.26955063343048097, "num_input_tokens_seen": 635175840, "step": 19930, "train_runtime": 52262.2119, "train_tokens_per_second": 12153.635 }, { "epoch": 1.3422434688930784, "grad_norm": 0.7927779914012338, "learning_rate": 2.4400965789970647e-06, "loss": 0.26891498565673827, "num_input_tokens_seen": 635332568, "step": 19935, "train_runtime": 52275.5723, "train_tokens_per_second": 12153.527 }, { "epoch": 1.3425801238890385, "grad_norm": 0.810981689028006, "learning_rate": 2.437825678501339e-06, "loss": 0.30417168140411377, "num_input_tokens_seen": 635494384, "step": 19940, "train_runtime": 52288.68, "train_tokens_per_second": 12153.575 }, { "epoch": 1.3429167788849987, "grad_norm": 0.7299683185413863, "learning_rate": 2.4355554945094956e-06, "loss": 0.3055759906768799, "num_input_tokens_seen": 635653272, "step": 19945, "train_runtime": 52301.4903, "train_tokens_per_second": 12153.636 }, { "epoch": 1.3432534338809587, "grad_norm": 0.8175416819947094, "learning_rate": 2.4332860276563763e-06, "loss": 0.29556589126586913, "num_input_tokens_seen": 635814144, "step": 19950, "train_runtime": 52314.4698, "train_tokens_per_second": 12153.696 }, { "epoch": 1.343590088876919, "grad_norm": 0.7521649670790872, "learning_rate": 2.4310172785766396e-06, "loss": 0.30762975215911864, "num_input_tokens_seen": 635973408, "step": 19955, "train_runtime": 52327.5224, "train_tokens_per_second": 12153.708 }, { "epoch": 1.343926743872879, "grad_norm": 0.9515691037989283, "learning_rate": 2.428749247904724e-06, "loss": 0.3347216844558716, "num_input_tokens_seen": 636134256, "step": 19960, "train_runtime": 52341.0765, "train_tokens_per_second": 12153.633 }, { "epoch": 1.3442633988688393, "grad_norm": 0.9032666472354995, "learning_rate": 2.4264819362748856e-06, "loss": 0.3079484462738037, "num_input_tokens_seen": 636294264, "step": 19965, "train_runtime": 52354.3419, "train_tokens_per_second": 12153.61 }, { "epoch": 1.3446000538647993, "grad_norm": 0.8694679246828867, "learning_rate": 2.4242153443211663e-06, "loss": 0.3199774265289307, "num_input_tokens_seen": 636453696, "step": 19970, "train_runtime": 52366.832, "train_tokens_per_second": 12153.756 }, { "epoch": 1.3449367088607596, "grad_norm": 0.6981243209367544, "learning_rate": 2.4219494726774124e-06, "loss": 0.285122275352478, "num_input_tokens_seen": 636615048, "step": 19975, "train_runtime": 52379.8466, "train_tokens_per_second": 12153.817 }, { "epoch": 1.3452733638567196, "grad_norm": 0.8016713620691758, "learning_rate": 2.419684321977268e-06, "loss": 0.28094542026519775, "num_input_tokens_seen": 636773464, "step": 19980, "train_runtime": 52393.0724, "train_tokens_per_second": 12153.772 }, { "epoch": 1.3456100188526798, "grad_norm": 0.7880713494728689, "learning_rate": 2.417419892854175e-06, "loss": 0.29432547092437744, "num_input_tokens_seen": 636936944, "step": 19985, "train_runtime": 52406.0792, "train_tokens_per_second": 12153.875 }, { "epoch": 1.3459466738486399, "grad_norm": 0.8321660809639218, "learning_rate": 2.415156185941371e-06, "loss": 0.28353219032287597, "num_input_tokens_seen": 637093328, "step": 19990, "train_runtime": 52419.2539, "train_tokens_per_second": 12153.804 }, { "epoch": 1.3462833288446001, "grad_norm": 0.9027367087215813, "learning_rate": 2.412893201871902e-06, "loss": 0.2969489336013794, "num_input_tokens_seen": 637249448, "step": 19995, "train_runtime": 52432.2755, "train_tokens_per_second": 12153.763 }, { "epoch": 1.3466199838405601, "grad_norm": 0.8621812867353942, "learning_rate": 2.410630941278595e-06, "loss": 0.31229348182678224, "num_input_tokens_seen": 637409000, "step": 20000, "train_runtime": 52444.7741, "train_tokens_per_second": 12153.909 }, { "epoch": 1.3469566388365204, "grad_norm": 0.8793321350766958, "learning_rate": 2.408369404794092e-06, "loss": 0.2945550441741943, "num_input_tokens_seen": 637566568, "step": 20005, "train_runtime": 52458.1115, "train_tokens_per_second": 12153.822 }, { "epoch": 1.3472932938324804, "grad_norm": 0.8136369098059965, "learning_rate": 2.4061085930508176e-06, "loss": 0.3121423959732056, "num_input_tokens_seen": 637726152, "step": 20010, "train_runtime": 52471.9089, "train_tokens_per_second": 12153.668 }, { "epoch": 1.3476299488284407, "grad_norm": 0.8031971613534401, "learning_rate": 2.4038485066810058e-06, "loss": 0.30166139602661135, "num_input_tokens_seen": 637882736, "step": 20015, "train_runtime": 52484.5444, "train_tokens_per_second": 12153.725 }, { "epoch": 1.3479666038244007, "grad_norm": 0.8433180944775368, "learning_rate": 2.40158914631668e-06, "loss": 0.28267199993133546, "num_input_tokens_seen": 638040056, "step": 20020, "train_runtime": 52497.8495, "train_tokens_per_second": 12153.642 }, { "epoch": 1.348303258820361, "grad_norm": 0.7735758816815589, "learning_rate": 2.399330512589664e-06, "loss": 0.2838400602340698, "num_input_tokens_seen": 638199384, "step": 20025, "train_runtime": 52510.5884, "train_tokens_per_second": 12153.728 }, { "epoch": 1.348639913816321, "grad_norm": 0.7395757615136218, "learning_rate": 2.3970726061315775e-06, "loss": 0.2910667896270752, "num_input_tokens_seen": 638357712, "step": 20030, "train_runtime": 52523.2855, "train_tokens_per_second": 12153.804 }, { "epoch": 1.3489765688122812, "grad_norm": 0.7485677250584262, "learning_rate": 2.394815427573836e-06, "loss": 0.2860706329345703, "num_input_tokens_seen": 638521552, "step": 20035, "train_runtime": 52535.7247, "train_tokens_per_second": 12154.045 }, { "epoch": 1.3493132238082413, "grad_norm": 0.8977453709520217, "learning_rate": 2.3925589775476516e-06, "loss": 0.29819340705871583, "num_input_tokens_seen": 638676840, "step": 20040, "train_runtime": 52548.2715, "train_tokens_per_second": 12154.098 }, { "epoch": 1.3496498788042015, "grad_norm": 0.7675039206175186, "learning_rate": 2.3903032566840377e-06, "loss": 0.2958210945129395, "num_input_tokens_seen": 638838424, "step": 20045, "train_runtime": 52561.2984, "train_tokens_per_second": 12154.16 }, { "epoch": 1.3499865338001615, "grad_norm": 0.8027559792710525, "learning_rate": 2.3880482656137926e-06, "loss": 0.3185994863510132, "num_input_tokens_seen": 639001688, "step": 20050, "train_runtime": 52574.1419, "train_tokens_per_second": 12154.296 }, { "epoch": 1.3503231887961218, "grad_norm": 0.8008503641107605, "learning_rate": 2.3857940049675254e-06, "loss": 0.2951274156570435, "num_input_tokens_seen": 639160168, "step": 20055, "train_runtime": 52586.6652, "train_tokens_per_second": 12154.415 }, { "epoch": 1.3506598437920818, "grad_norm": 0.749398809109107, "learning_rate": 2.383540475375625e-06, "loss": 0.29441251754760744, "num_input_tokens_seen": 639321264, "step": 20060, "train_runtime": 52599.5699, "train_tokens_per_second": 12154.496 }, { "epoch": 1.350996498788042, "grad_norm": 0.8856747280013086, "learning_rate": 2.3812876774682886e-06, "loss": 0.3095348834991455, "num_input_tokens_seen": 639484632, "step": 20065, "train_runtime": 52612.5574, "train_tokens_per_second": 12154.601 }, { "epoch": 1.351333153784002, "grad_norm": 0.8713164599063117, "learning_rate": 2.379035611875503e-06, "loss": 0.3180835723876953, "num_input_tokens_seen": 639648232, "step": 20070, "train_runtime": 52625.5822, "train_tokens_per_second": 12154.701 }, { "epoch": 1.3516698087799623, "grad_norm": 0.7787086722092307, "learning_rate": 2.376784279227051e-06, "loss": 0.2957012176513672, "num_input_tokens_seen": 639810456, "step": 20075, "train_runtime": 52638.1761, "train_tokens_per_second": 12154.875 }, { "epoch": 1.3520064637759224, "grad_norm": 0.7454683425133161, "learning_rate": 2.3745336801525105e-06, "loss": 0.2989673614501953, "num_input_tokens_seen": 639973664, "step": 20080, "train_runtime": 52651.0791, "train_tokens_per_second": 12154.996 }, { "epoch": 1.3523431187718826, "grad_norm": 0.825988768846959, "learning_rate": 2.3722838152812543e-06, "loss": 0.3139394044876099, "num_input_tokens_seen": 640136112, "step": 20085, "train_runtime": 52663.7533, "train_tokens_per_second": 12155.156 }, { "epoch": 1.3526797737678427, "grad_norm": 0.6902843722757951, "learning_rate": 2.3700346852424485e-06, "loss": 0.29785478115081787, "num_input_tokens_seen": 640293120, "step": 20090, "train_runtime": 52676.675, "train_tokens_per_second": 12155.154 }, { "epoch": 1.353016428763803, "grad_norm": 0.769242715723652, "learning_rate": 2.3677862906650594e-06, "loss": 0.31523053646087645, "num_input_tokens_seen": 640451600, "step": 20095, "train_runtime": 52690.4172, "train_tokens_per_second": 12154.992 }, { "epoch": 1.353353083759763, "grad_norm": 0.8916299069224247, "learning_rate": 2.365538632177837e-06, "loss": 0.3254724025726318, "num_input_tokens_seen": 640609000, "step": 20100, "train_runtime": 52704.209, "train_tokens_per_second": 12154.798 }, { "epoch": 1.3536897387557232, "grad_norm": 0.8597770559813573, "learning_rate": 2.36329171040934e-06, "loss": 0.2984098196029663, "num_input_tokens_seen": 640770752, "step": 20105, "train_runtime": 52717.332, "train_tokens_per_second": 12154.84 }, { "epoch": 1.3540263937516832, "grad_norm": 0.832823347777731, "learning_rate": 2.3610455259879045e-06, "loss": 0.2707779884338379, "num_input_tokens_seen": 640928896, "step": 20110, "train_runtime": 52730.0837, "train_tokens_per_second": 12154.9 }, { "epoch": 1.3543630487476435, "grad_norm": 0.8701175587509546, "learning_rate": 2.358800079541674e-06, "loss": 0.3292681217193604, "num_input_tokens_seen": 641085304, "step": 20115, "train_runtime": 52742.8493, "train_tokens_per_second": 12154.924 }, { "epoch": 1.3546997037436035, "grad_norm": 0.8036502264634139, "learning_rate": 2.3565553716985794e-06, "loss": 0.3127922296524048, "num_input_tokens_seen": 641247320, "step": 20120, "train_runtime": 52756.3204, "train_tokens_per_second": 12154.891 }, { "epoch": 1.3550363587395637, "grad_norm": 0.8138511888964206, "learning_rate": 2.3543114030863457e-06, "loss": 0.2915943622589111, "num_input_tokens_seen": 641402344, "step": 20125, "train_runtime": 52769.5696, "train_tokens_per_second": 12154.777 }, { "epoch": 1.3553730137355238, "grad_norm": 0.7866679518898284, "learning_rate": 2.352068174332491e-06, "loss": 0.29277997016906737, "num_input_tokens_seen": 641558016, "step": 20130, "train_runtime": 52782.4153, "train_tokens_per_second": 12154.768 }, { "epoch": 1.355709668731484, "grad_norm": 0.7635350230589175, "learning_rate": 2.349825686064329e-06, "loss": 0.2615662097930908, "num_input_tokens_seen": 641716112, "step": 20135, "train_runtime": 52795.261, "train_tokens_per_second": 12154.805 }, { "epoch": 1.356046323727444, "grad_norm": 0.7900592585406084, "learning_rate": 2.3475839389089605e-06, "loss": 0.30844969749450685, "num_input_tokens_seen": 641877440, "step": 20140, "train_runtime": 52807.8695, "train_tokens_per_second": 12154.958 }, { "epoch": 1.3563829787234043, "grad_norm": 0.8383462166740326, "learning_rate": 2.345342933493289e-06, "loss": 0.3140614748001099, "num_input_tokens_seen": 642037840, "step": 20145, "train_runtime": 52821.4997, "train_tokens_per_second": 12154.858 }, { "epoch": 1.3567196337193643, "grad_norm": 0.7917548783183068, "learning_rate": 2.343102670443998e-06, "loss": 0.2943148612976074, "num_input_tokens_seen": 642197584, "step": 20150, "train_runtime": 52834.5267, "train_tokens_per_second": 12154.885 }, { "epoch": 1.3570562887153246, "grad_norm": 0.8532196620748863, "learning_rate": 2.3408631503875763e-06, "loss": 0.3162414312362671, "num_input_tokens_seen": 642360600, "step": 20155, "train_runtime": 52847.3705, "train_tokens_per_second": 12155.015 }, { "epoch": 1.3573929437112846, "grad_norm": 0.9476095408820352, "learning_rate": 2.338624373950291e-06, "loss": 0.2608856201171875, "num_input_tokens_seen": 642517280, "step": 20160, "train_runtime": 52860.3661, "train_tokens_per_second": 12154.991 }, { "epoch": 1.3577295987072449, "grad_norm": 0.8690424888057344, "learning_rate": 2.336386341758216e-06, "loss": 0.30047221183776857, "num_input_tokens_seen": 642680464, "step": 20165, "train_runtime": 52873.2499, "train_tokens_per_second": 12155.116 }, { "epoch": 1.3580662537032049, "grad_norm": 0.7918968008107469, "learning_rate": 2.3341490544372063e-06, "loss": 0.30344624519348146, "num_input_tokens_seen": 642841328, "step": 20170, "train_runtime": 52886.3849, "train_tokens_per_second": 12155.138 }, { "epoch": 1.3584029086991651, "grad_norm": 0.8283289286328732, "learning_rate": 2.3319125126129128e-06, "loss": 0.30180726051330564, "num_input_tokens_seen": 643001144, "step": 20175, "train_runtime": 52899.5875, "train_tokens_per_second": 12155.126 }, { "epoch": 1.3587395636951252, "grad_norm": 0.8090597312132042, "learning_rate": 2.329676716910777e-06, "loss": 0.3208785057067871, "num_input_tokens_seen": 643160168, "step": 20180, "train_runtime": 52912.8792, "train_tokens_per_second": 12155.078 }, { "epoch": 1.3590762186910854, "grad_norm": 0.8823636834617153, "learning_rate": 2.3274416679560325e-06, "loss": 0.3125479698181152, "num_input_tokens_seen": 643317136, "step": 20185, "train_runtime": 52925.3834, "train_tokens_per_second": 12155.172 }, { "epoch": 1.3594128736870454, "grad_norm": 0.8064380366613495, "learning_rate": 2.3252073663737016e-06, "loss": 0.3070643901824951, "num_input_tokens_seen": 643476488, "step": 20190, "train_runtime": 52938.1674, "train_tokens_per_second": 12155.247 }, { "epoch": 1.3597495286830057, "grad_norm": 0.9077138242757049, "learning_rate": 2.3229738127886054e-06, "loss": 0.29928030967712405, "num_input_tokens_seen": 643632272, "step": 20195, "train_runtime": 52951.3469, "train_tokens_per_second": 12155.163 }, { "epoch": 1.3600861836789657, "grad_norm": 0.764593905570044, "learning_rate": 2.3207410078253416e-06, "loss": 0.3044393539428711, "num_input_tokens_seen": 643794064, "step": 20200, "train_runtime": 52964.55, "train_tokens_per_second": 12155.188 }, { "epoch": 1.360422838674926, "grad_norm": 0.7860160753653275, "learning_rate": 2.3185089521083154e-06, "loss": 0.2984424591064453, "num_input_tokens_seen": 643952064, "step": 20205, "train_runtime": 52977.7879, "train_tokens_per_second": 12155.133 }, { "epoch": 1.360759493670886, "grad_norm": 0.8242439762496754, "learning_rate": 2.3162776462617067e-06, "loss": 0.29924328327178956, "num_input_tokens_seen": 644110720, "step": 20210, "train_runtime": 52991.2186, "train_tokens_per_second": 12155.046 }, { "epoch": 1.3610961486668463, "grad_norm": 0.9064423233978224, "learning_rate": 2.314047090909498e-06, "loss": 0.2972831726074219, "num_input_tokens_seen": 644268552, "step": 20215, "train_runtime": 53004.8521, "train_tokens_per_second": 12154.898 }, { "epoch": 1.3614328036628063, "grad_norm": 0.7953908340523524, "learning_rate": 2.3118172866754557e-06, "loss": 0.2784623146057129, "num_input_tokens_seen": 644428640, "step": 20220, "train_runtime": 53018.4882, "train_tokens_per_second": 12154.791 }, { "epoch": 1.3617694586587665, "grad_norm": 0.8545430247946103, "learning_rate": 2.309588234183137e-06, "loss": 0.3083958625793457, "num_input_tokens_seen": 644590768, "step": 20225, "train_runtime": 53031.0894, "train_tokens_per_second": 12154.96 }, { "epoch": 1.3621061136547266, "grad_norm": 0.8543218659958202, "learning_rate": 2.3073599340558896e-06, "loss": 0.3121353626251221, "num_input_tokens_seen": 644743488, "step": 20230, "train_runtime": 53043.5142, "train_tokens_per_second": 12154.992 }, { "epoch": 1.3624427686506868, "grad_norm": 0.840823539646017, "learning_rate": 2.3051323869168506e-06, "loss": 0.31676955223083497, "num_input_tokens_seen": 644906448, "step": 20235, "train_runtime": 53056.9507, "train_tokens_per_second": 12154.985 }, { "epoch": 1.3627794236466468, "grad_norm": 0.7695727050359703, "learning_rate": 2.3029055933889443e-06, "loss": 0.29796838760375977, "num_input_tokens_seen": 645067216, "step": 20240, "train_runtime": 53070.5915, "train_tokens_per_second": 12154.89 }, { "epoch": 1.363116078642607, "grad_norm": 0.7413222298191311, "learning_rate": 2.300679554094892e-06, "loss": 0.28080062866210936, "num_input_tokens_seen": 645221152, "step": 20245, "train_runtime": 53084.0085, "train_tokens_per_second": 12154.718 }, { "epoch": 1.3634527336385671, "grad_norm": 0.7995496189254991, "learning_rate": 2.298454269657191e-06, "loss": 0.29342241287231446, "num_input_tokens_seen": 645384952, "step": 20250, "train_runtime": 53097.121, "train_tokens_per_second": 12154.801 }, { "epoch": 1.3637893886345274, "grad_norm": 0.8235469360233216, "learning_rate": 2.2962297406981432e-06, "loss": 0.2905342817306519, "num_input_tokens_seen": 645547064, "step": 20255, "train_runtime": 53110.3531, "train_tokens_per_second": 12154.825 }, { "epoch": 1.3641260436304874, "grad_norm": 0.8200034628825106, "learning_rate": 2.2940059678398223e-06, "loss": 0.29088120460510253, "num_input_tokens_seen": 645704912, "step": 20260, "train_runtime": 53123.9112, "train_tokens_per_second": 12154.695 }, { "epoch": 1.3644626986264476, "grad_norm": 0.8196035605889611, "learning_rate": 2.291782951704106e-06, "loss": 0.3106068134307861, "num_input_tokens_seen": 645859536, "step": 20265, "train_runtime": 53136.4196, "train_tokens_per_second": 12154.743 }, { "epoch": 1.3647993536224077, "grad_norm": 0.8369724176849058, "learning_rate": 2.289560692912651e-06, "loss": 0.31033525466918943, "num_input_tokens_seen": 646022440, "step": 20270, "train_runtime": 53149.1968, "train_tokens_per_second": 12154.886 }, { "epoch": 1.365136008618368, "grad_norm": 0.77014717726597, "learning_rate": 2.287339192086906e-06, "loss": 0.3115870714187622, "num_input_tokens_seen": 646185656, "step": 20275, "train_runtime": 53162.1028, "train_tokens_per_second": 12155.006 }, { "epoch": 1.365472663614328, "grad_norm": 0.8339959826906802, "learning_rate": 2.2851184498481056e-06, "loss": 0.2991509437561035, "num_input_tokens_seen": 646342728, "step": 20280, "train_runtime": 53174.7987, "train_tokens_per_second": 12155.057 }, { "epoch": 1.3658093186102882, "grad_norm": 0.9393207244577194, "learning_rate": 2.2828984668172732e-06, "loss": 0.3031912803649902, "num_input_tokens_seen": 646500168, "step": 20285, "train_runtime": 53187.6798, "train_tokens_per_second": 12155.074 }, { "epoch": 1.3661459736062485, "grad_norm": 0.860650306064623, "learning_rate": 2.2806792436152185e-06, "loss": 0.3075080871582031, "num_input_tokens_seen": 646659128, "step": 20290, "train_runtime": 53201.0408, "train_tokens_per_second": 12155.009 }, { "epoch": 1.3664826286022085, "grad_norm": 0.7783009056387936, "learning_rate": 2.2784607808625463e-06, "loss": 0.30388917922973635, "num_input_tokens_seen": 646817080, "step": 20295, "train_runtime": 53214.1281, "train_tokens_per_second": 12154.988 }, { "epoch": 1.3668192835981685, "grad_norm": 0.7917413854384189, "learning_rate": 2.276243079179634e-06, "loss": 0.3020165920257568, "num_input_tokens_seen": 646971976, "step": 20300, "train_runtime": 53226.7817, "train_tokens_per_second": 12155.008 }, { "epoch": 1.3671559385941288, "grad_norm": 0.8149458607077814, "learning_rate": 2.2740261391866634e-06, "loss": 0.32889571189880373, "num_input_tokens_seen": 647132648, "step": 20305, "train_runtime": 53240.1881, "train_tokens_per_second": 12154.965 }, { "epoch": 1.367492593590089, "grad_norm": 0.730122124638197, "learning_rate": 2.2718099615035865e-06, "loss": 0.25882878303527834, "num_input_tokens_seen": 647290056, "step": 20310, "train_runtime": 53252.9228, "train_tokens_per_second": 12155.015 }, { "epoch": 1.367829248586049, "grad_norm": 0.8543694785134872, "learning_rate": 2.2695945467501567e-06, "loss": 0.30951781272888185, "num_input_tokens_seen": 647450296, "step": 20315, "train_runtime": 53266.3677, "train_tokens_per_second": 12154.955 }, { "epoch": 1.368165903582009, "grad_norm": 0.7235852274698236, "learning_rate": 2.267379895545905e-06, "loss": 0.2906651020050049, "num_input_tokens_seen": 647611760, "step": 20320, "train_runtime": 53279.4908, "train_tokens_per_second": 12154.992 }, { "epoch": 1.3685025585779693, "grad_norm": 0.7344515603703453, "learning_rate": 2.2651660085101513e-06, "loss": 0.3059160470962524, "num_input_tokens_seen": 647773504, "step": 20325, "train_runtime": 53292.8561, "train_tokens_per_second": 12154.978 }, { "epoch": 1.3688392135739296, "grad_norm": 0.7776802484841481, "learning_rate": 2.262952886262003e-06, "loss": 0.31058714389801023, "num_input_tokens_seen": 647936232, "step": 20330, "train_runtime": 53305.2746, "train_tokens_per_second": 12155.199 }, { "epoch": 1.3691758685698896, "grad_norm": 0.7566630176376529, "learning_rate": 2.260740529420352e-06, "loss": 0.29704785346984863, "num_input_tokens_seen": 648096152, "step": 20335, "train_runtime": 53318.5677, "train_tokens_per_second": 12155.168 }, { "epoch": 1.3695125235658496, "grad_norm": 0.8749092245796063, "learning_rate": 2.2585289386038754e-06, "loss": 0.29091415405273435, "num_input_tokens_seen": 648259992, "step": 20340, "train_runtime": 53331.0008, "train_tokens_per_second": 12155.406 }, { "epoch": 1.3698491785618099, "grad_norm": 0.8316044451868643, "learning_rate": 2.256318114431043e-06, "loss": 0.3181851863861084, "num_input_tokens_seen": 648423448, "step": 20345, "train_runtime": 53343.9543, "train_tokens_per_second": 12155.519 }, { "epoch": 1.3701858335577701, "grad_norm": 4.219110823247903, "learning_rate": 2.2541080575200973e-06, "loss": 0.30272440910339354, "num_input_tokens_seen": 648577384, "step": 20350, "train_runtime": 53356.6458, "train_tokens_per_second": 12155.513 }, { "epoch": 1.3705224885537302, "grad_norm": 0.9293639816098712, "learning_rate": 2.251898768489081e-06, "loss": 0.3147286891937256, "num_input_tokens_seen": 648739552, "step": 20355, "train_runtime": 53369.2478, "train_tokens_per_second": 12155.681 }, { "epoch": 1.3708591435496902, "grad_norm": 0.8065309017181531, "learning_rate": 2.249690247955807e-06, "loss": 0.30603728294372556, "num_input_tokens_seen": 648901096, "step": 20360, "train_runtime": 53383.0399, "train_tokens_per_second": 12155.567 }, { "epoch": 1.3711957985456504, "grad_norm": 1.1345342644250749, "learning_rate": 2.247482496537887e-06, "loss": 0.3286911487579346, "num_input_tokens_seen": 649061496, "step": 20365, "train_runtime": 53396.2643, "train_tokens_per_second": 12155.56 }, { "epoch": 1.3715324535416107, "grad_norm": 0.7883719025065131, "learning_rate": 2.24527551485271e-06, "loss": 0.291964054107666, "num_input_tokens_seen": 649221616, "step": 20370, "train_runtime": 53410.646, "train_tokens_per_second": 12155.285 }, { "epoch": 1.3718691085375707, "grad_norm": 0.7878282261106022, "learning_rate": 2.243069303517451e-06, "loss": 0.3231219291687012, "num_input_tokens_seen": 649378072, "step": 20375, "train_runtime": 53423.9051, "train_tokens_per_second": 12155.197 }, { "epoch": 1.3722057635335307, "grad_norm": 0.7310456743376753, "learning_rate": 2.2408638631490696e-06, "loss": 0.2690922260284424, "num_input_tokens_seen": 649535328, "step": 20380, "train_runtime": 53436.9424, "train_tokens_per_second": 12155.174 }, { "epoch": 1.372542418529491, "grad_norm": 0.8489539609784894, "learning_rate": 2.2386591943643117e-06, "loss": 0.2847634792327881, "num_input_tokens_seen": 649696992, "step": 20385, "train_runtime": 53449.4184, "train_tokens_per_second": 12155.361 }, { "epoch": 1.3728790735254512, "grad_norm": 0.9903118227967844, "learning_rate": 2.2364552977797023e-06, "loss": 0.31690526008605957, "num_input_tokens_seen": 649858424, "step": 20390, "train_runtime": 53462.2038, "train_tokens_per_second": 12155.474 }, { "epoch": 1.3732157285214113, "grad_norm": 0.9845624989259556, "learning_rate": 2.23425217401156e-06, "loss": 0.3207815647125244, "num_input_tokens_seen": 650016632, "step": 20395, "train_runtime": 53474.9841, "train_tokens_per_second": 12155.527 }, { "epoch": 1.3735523835173713, "grad_norm": 0.7864501432037757, "learning_rate": 2.2320498236759746e-06, "loss": 0.2835537433624268, "num_input_tokens_seen": 650174296, "step": 20400, "train_runtime": 53488.1165, "train_tokens_per_second": 12155.491 }, { "epoch": 1.3738890385133316, "grad_norm": 0.7211067744869608, "learning_rate": 2.2298482473888335e-06, "loss": 0.2840959787368774, "num_input_tokens_seen": 650332048, "step": 20405, "train_runtime": 53501.3699, "train_tokens_per_second": 12155.428 }, { "epoch": 1.3742256935092918, "grad_norm": 0.8430885595797492, "learning_rate": 2.227647445765792e-06, "loss": 0.30764546394348147, "num_input_tokens_seen": 650494928, "step": 20410, "train_runtime": 53514.0615, "train_tokens_per_second": 12155.589 }, { "epoch": 1.3745623485052518, "grad_norm": 0.8836690848301012, "learning_rate": 2.225447419422305e-06, "loss": 0.26287431716918946, "num_input_tokens_seen": 650652568, "step": 20415, "train_runtime": 53526.8535, "train_tokens_per_second": 12155.629 }, { "epoch": 1.3748990035012119, "grad_norm": 0.8416496862738256, "learning_rate": 2.223248168973599e-06, "loss": 0.28356237411499025, "num_input_tokens_seen": 650810656, "step": 20420, "train_runtime": 53539.5576, "train_tokens_per_second": 12155.697 }, { "epoch": 1.375235658497172, "grad_norm": 0.7617847217190507, "learning_rate": 2.221049695034688e-06, "loss": 0.2823204517364502, "num_input_tokens_seen": 650972040, "step": 20425, "train_runtime": 53553.1804, "train_tokens_per_second": 12155.619 }, { "epoch": 1.3755723134931324, "grad_norm": 0.8865559131956195, "learning_rate": 2.218851998220369e-06, "loss": 0.3196236610412598, "num_input_tokens_seen": 651130128, "step": 20430, "train_runtime": 53566.2387, "train_tokens_per_second": 12155.607 }, { "epoch": 1.3759089684890924, "grad_norm": 0.7729107191356331, "learning_rate": 2.21665507914522e-06, "loss": 0.28019592761993406, "num_input_tokens_seen": 651286648, "step": 20435, "train_runtime": 53579.215, "train_tokens_per_second": 12155.584 }, { "epoch": 1.3762456234850524, "grad_norm": 0.752525906536745, "learning_rate": 2.214458938423601e-06, "loss": 0.29229083061218264, "num_input_tokens_seen": 651447448, "step": 20440, "train_runtime": 53591.8469, "train_tokens_per_second": 12155.719 }, { "epoch": 1.3765822784810127, "grad_norm": 0.6961154947465655, "learning_rate": 2.212263576669661e-06, "loss": 0.2930954933166504, "num_input_tokens_seen": 651610472, "step": 20445, "train_runtime": 53605.2735, "train_tokens_per_second": 12155.716 }, { "epoch": 1.376918933476973, "grad_norm": 0.8985677006398, "learning_rate": 2.2100689944973182e-06, "loss": 0.30328404903411865, "num_input_tokens_seen": 651772256, "step": 20450, "train_runtime": 53617.7376, "train_tokens_per_second": 12155.907 }, { "epoch": 1.377255588472933, "grad_norm": 0.7958408325362172, "learning_rate": 2.2078751925202886e-06, "loss": 0.3348668336868286, "num_input_tokens_seen": 651934192, "step": 20455, "train_runtime": 53630.3207, "train_tokens_per_second": 12156.075 }, { "epoch": 1.377592243468893, "grad_norm": 2.077161486397874, "learning_rate": 2.205682171352054e-06, "loss": 0.3221259355545044, "num_input_tokens_seen": 652096248, "step": 20460, "train_runtime": 53644.219, "train_tokens_per_second": 12155.946 }, { "epoch": 1.3779288984648532, "grad_norm": 0.8389439841220695, "learning_rate": 2.2034899316058926e-06, "loss": 0.27936711311340334, "num_input_tokens_seen": 652256688, "step": 20465, "train_runtime": 53656.646, "train_tokens_per_second": 12156.121 }, { "epoch": 1.3782655534608135, "grad_norm": 0.7760689466241427, "learning_rate": 2.201298473894854e-06, "loss": 0.2952296733856201, "num_input_tokens_seen": 652413392, "step": 20470, "train_runtime": 53671.0839, "train_tokens_per_second": 12155.771 }, { "epoch": 1.3786022084567735, "grad_norm": 0.8029590636209288, "learning_rate": 2.1991077988317723e-06, "loss": 0.2822009801864624, "num_input_tokens_seen": 652576280, "step": 20475, "train_runtime": 53683.8633, "train_tokens_per_second": 12155.911 }, { "epoch": 1.3789388634527335, "grad_norm": 0.7636519039850963, "learning_rate": 2.1969179070292637e-06, "loss": 0.2849242925643921, "num_input_tokens_seen": 652736336, "step": 20480, "train_runtime": 53696.8706, "train_tokens_per_second": 12155.947 }, { "epoch": 1.3792755184486938, "grad_norm": 0.8570378389404146, "learning_rate": 2.1947287990997236e-06, "loss": 0.3027640342712402, "num_input_tokens_seen": 652894400, "step": 20485, "train_runtime": 53710.8954, "train_tokens_per_second": 12155.716 }, { "epoch": 1.379612173444654, "grad_norm": 0.8554262849684636, "learning_rate": 2.192540475655328e-06, "loss": 0.2953397274017334, "num_input_tokens_seen": 653049456, "step": 20490, "train_runtime": 53724.3702, "train_tokens_per_second": 12155.554 }, { "epoch": 1.379948828440614, "grad_norm": 0.8026316210684016, "learning_rate": 2.1903529373080397e-06, "loss": 0.3119431257247925, "num_input_tokens_seen": 653210608, "step": 20495, "train_runtime": 53737.5531, "train_tokens_per_second": 12155.57 }, { "epoch": 1.380285483436574, "grad_norm": 0.8228897802583538, "learning_rate": 2.1881661846695895e-06, "loss": 0.2704279899597168, "num_input_tokens_seen": 653357880, "step": 20500, "train_runtime": 53750.6258, "train_tokens_per_second": 12155.354 }, { "epoch": 1.3806221384325343, "grad_norm": 0.8509726085801045, "learning_rate": 2.185980218351503e-06, "loss": 0.3270567417144775, "num_input_tokens_seen": 653517008, "step": 20505, "train_runtime": 53763.8635, "train_tokens_per_second": 12155.321 }, { "epoch": 1.3809587934284946, "grad_norm": 0.9120062736551066, "learning_rate": 2.1837950389650714e-06, "loss": 0.28235254287719724, "num_input_tokens_seen": 653680256, "step": 20510, "train_runtime": 53776.7675, "train_tokens_per_second": 12155.44 }, { "epoch": 1.3812954484244546, "grad_norm": 0.7555083290841399, "learning_rate": 2.1816106471213787e-06, "loss": 0.2907303810119629, "num_input_tokens_seen": 653844096, "step": 20515, "train_runtime": 53789.2225, "train_tokens_per_second": 12155.671 }, { "epoch": 1.3816321034204146, "grad_norm": 0.866327021994922, "learning_rate": 2.179427043431282e-06, "loss": 0.32350399494171145, "num_input_tokens_seen": 654005408, "step": 20520, "train_runtime": 53802.535, "train_tokens_per_second": 12155.662 }, { "epoch": 1.381968758416375, "grad_norm": 0.7528383816585712, "learning_rate": 2.177244228505418e-06, "loss": 0.3229414939880371, "num_input_tokens_seen": 654161520, "step": 20525, "train_runtime": 53816.0358, "train_tokens_per_second": 12155.513 }, { "epoch": 1.3823054134123351, "grad_norm": 0.9989225028687713, "learning_rate": 2.1750622029542047e-06, "loss": 0.2938276767730713, "num_input_tokens_seen": 654324464, "step": 20530, "train_runtime": 53828.509, "train_tokens_per_second": 12155.723 }, { "epoch": 1.3826420684082952, "grad_norm": 0.838121570528202, "learning_rate": 2.1728809673878374e-06, "loss": 0.2945178270339966, "num_input_tokens_seen": 654483440, "step": 20535, "train_runtime": 53842.0088, "train_tokens_per_second": 12155.628 }, { "epoch": 1.3829787234042552, "grad_norm": 0.9043744828770097, "learning_rate": 2.1707005224162915e-06, "loss": 0.29343178272247317, "num_input_tokens_seen": 654645600, "step": 20540, "train_runtime": 53855.3782, "train_tokens_per_second": 12155.622 }, { "epoch": 1.3833153784002155, "grad_norm": 0.8046123406161302, "learning_rate": 2.1685208686493257e-06, "loss": 0.2951530933380127, "num_input_tokens_seen": 654799576, "step": 20545, "train_runtime": 53868.3171, "train_tokens_per_second": 12155.56 }, { "epoch": 1.3836520333961757, "grad_norm": 0.7837290344006682, "learning_rate": 2.166342006696467e-06, "loss": 0.3003102779388428, "num_input_tokens_seen": 654953616, "step": 20550, "train_runtime": 53881.4343, "train_tokens_per_second": 12155.46 }, { "epoch": 1.3839886883921357, "grad_norm": 0.8419208049155158, "learning_rate": 2.1641639371670335e-06, "loss": 0.3069209098815918, "num_input_tokens_seen": 655114608, "step": 20555, "train_runtime": 53895.609, "train_tokens_per_second": 12155.25 }, { "epoch": 1.3843253433880958, "grad_norm": 1.130520302817265, "learning_rate": 2.161986660670109e-06, "loss": 0.3187168836593628, "num_input_tokens_seen": 655277784, "step": 20560, "train_runtime": 53908.0472, "train_tokens_per_second": 12155.472 }, { "epoch": 1.384661998384056, "grad_norm": 0.7371524483213872, "learning_rate": 2.159810177814566e-06, "loss": 0.29647324085235593, "num_input_tokens_seen": 655434416, "step": 20565, "train_runtime": 53921.427, "train_tokens_per_second": 12155.361 }, { "epoch": 1.3849986533800163, "grad_norm": 0.8948364673197701, "learning_rate": 2.1576344892090507e-06, "loss": 0.3221231460571289, "num_input_tokens_seen": 655590320, "step": 20570, "train_runtime": 53934.6702, "train_tokens_per_second": 12155.267 }, { "epoch": 1.3853353083759763, "grad_norm": 0.7702079275267318, "learning_rate": 2.1554595954619866e-06, "loss": 0.3005852699279785, "num_input_tokens_seen": 655749448, "step": 20575, "train_runtime": 53947.9241, "train_tokens_per_second": 12155.23 }, { "epoch": 1.3856719633719363, "grad_norm": 0.8232806743748647, "learning_rate": 2.1532854971815763e-06, "loss": 0.2936416149139404, "num_input_tokens_seen": 655908288, "step": 20580, "train_runtime": 53961.568, "train_tokens_per_second": 12155.101 }, { "epoch": 1.3860086183678966, "grad_norm": 0.6873782863749368, "learning_rate": 2.151112194975799e-06, "loss": 0.27318587303161623, "num_input_tokens_seen": 656071008, "step": 20585, "train_runtime": 53974.016, "train_tokens_per_second": 12155.312 }, { "epoch": 1.3863452733638568, "grad_norm": 0.6943274888202149, "learning_rate": 2.1489396894524106e-06, "loss": 0.27690088748931885, "num_input_tokens_seen": 656234440, "step": 20590, "train_runtime": 53987.0359, "train_tokens_per_second": 12155.408 }, { "epoch": 1.3866819283598169, "grad_norm": 0.7532789543825452, "learning_rate": 2.1467679812189497e-06, "loss": 0.2981242656707764, "num_input_tokens_seen": 656390440, "step": 20595, "train_runtime": 54000.0767, "train_tokens_per_second": 12155.361 }, { "epoch": 1.3870185833557769, "grad_norm": 0.8307455733839373, "learning_rate": 2.1445970708827213e-06, "loss": 0.3125548124313354, "num_input_tokens_seen": 656546320, "step": 20600, "train_runtime": 54013.7769, "train_tokens_per_second": 12155.164 }, { "epoch": 1.3873552383517371, "grad_norm": 0.7249972270232963, "learning_rate": 2.14242695905082e-06, "loss": 0.2849388122558594, "num_input_tokens_seen": 656705688, "step": 20605, "train_runtime": 54027.2556, "train_tokens_per_second": 12155.081 }, { "epoch": 1.3876918933476974, "grad_norm": 0.893174570008363, "learning_rate": 2.1402576463301044e-06, "loss": 0.3187171459197998, "num_input_tokens_seen": 656869528, "step": 20610, "train_runtime": 54039.6983, "train_tokens_per_second": 12155.314 }, { "epoch": 1.3880285483436574, "grad_norm": 0.8678460832552309, "learning_rate": 2.13808913332722e-06, "loss": 0.2718982458114624, "num_input_tokens_seen": 657027912, "step": 20615, "train_runtime": 54052.7282, "train_tokens_per_second": 12155.315 }, { "epoch": 1.3883652033396174, "grad_norm": 0.8579744815924049, "learning_rate": 2.1359214206485845e-06, "loss": 0.3030441999435425, "num_input_tokens_seen": 657185056, "step": 20620, "train_runtime": 54065.7949, "train_tokens_per_second": 12155.283 }, { "epoch": 1.3887018583355777, "grad_norm": 0.7666784497696234, "learning_rate": 2.1337545089003905e-06, "loss": 0.2615054607391357, "num_input_tokens_seen": 657338640, "step": 20625, "train_runtime": 54079.2954, "train_tokens_per_second": 12155.089 }, { "epoch": 1.389038513331538, "grad_norm": 0.8530811699509007, "learning_rate": 2.131588398688608e-06, "loss": 0.3017681121826172, "num_input_tokens_seen": 657498864, "step": 20630, "train_runtime": 54092.5207, "train_tokens_per_second": 12155.079 }, { "epoch": 1.389375168327498, "grad_norm": 0.745741005772621, "learning_rate": 2.1294230906189833e-06, "loss": 0.2829160213470459, "num_input_tokens_seen": 657654664, "step": 20635, "train_runtime": 54105.1274, "train_tokens_per_second": 12155.126 }, { "epoch": 1.389711823323458, "grad_norm": 0.7559887447939505, "learning_rate": 2.1272585852970358e-06, "loss": 0.28513526916503906, "num_input_tokens_seen": 657811880, "step": 20640, "train_runtime": 54118.4367, "train_tokens_per_second": 12155.042 }, { "epoch": 1.3900484783194182, "grad_norm": 0.8485092469868943, "learning_rate": 2.125094883328068e-06, "loss": 0.2961697578430176, "num_input_tokens_seen": 657967248, "step": 20645, "train_runtime": 54131.878, "train_tokens_per_second": 12154.894 }, { "epoch": 1.3903851333153785, "grad_norm": 0.8992611374022871, "learning_rate": 2.1229319853171447e-06, "loss": 0.27866368293762206, "num_input_tokens_seen": 658122768, "step": 20650, "train_runtime": 54145.4947, "train_tokens_per_second": 12154.71 }, { "epoch": 1.3907217883113385, "grad_norm": 0.876485330450587, "learning_rate": 2.1207698918691217e-06, "loss": 0.31116452217102053, "num_input_tokens_seen": 658284032, "step": 20655, "train_runtime": 54159.2801, "train_tokens_per_second": 12154.593 }, { "epoch": 1.3910584433072986, "grad_norm": 0.8895435894322041, "learning_rate": 2.1186086035886133e-06, "loss": 0.29702067375183105, "num_input_tokens_seen": 658445288, "step": 20660, "train_runtime": 54172.2193, "train_tokens_per_second": 12154.667 }, { "epoch": 1.3913950983032588, "grad_norm": 0.8925336299109211, "learning_rate": 2.116448121080023e-06, "loss": 0.3145890712738037, "num_input_tokens_seen": 658609128, "step": 20665, "train_runtime": 54184.6694, "train_tokens_per_second": 12154.898 }, { "epoch": 1.391731753299219, "grad_norm": 0.8412894438536123, "learning_rate": 2.1142884449475205e-06, "loss": 0.3074498653411865, "num_input_tokens_seen": 658771384, "step": 20670, "train_runtime": 54197.3103, "train_tokens_per_second": 12155.057 }, { "epoch": 1.392068408295179, "grad_norm": 0.8060827585149174, "learning_rate": 2.112129575795052e-06, "loss": 0.29236836433410646, "num_input_tokens_seen": 658932776, "step": 20675, "train_runtime": 54210.3732, "train_tokens_per_second": 12155.105 }, { "epoch": 1.3924050632911391, "grad_norm": 0.7592720631038189, "learning_rate": 2.1099715142263394e-06, "loss": 0.28681292533874514, "num_input_tokens_seen": 659090384, "step": 20680, "train_runtime": 54223.2315, "train_tokens_per_second": 12155.129 }, { "epoch": 1.3927417182870994, "grad_norm": 0.7166519857589716, "learning_rate": 2.1078142608448773e-06, "loss": 0.2725334644317627, "num_input_tokens_seen": 659252040, "step": 20685, "train_runtime": 54236.4617, "train_tokens_per_second": 12155.145 }, { "epoch": 1.3930783732830596, "grad_norm": 0.9232562553788313, "learning_rate": 2.1056578162539327e-06, "loss": 0.31885356903076173, "num_input_tokens_seen": 659411592, "step": 20690, "train_runtime": 54248.9923, "train_tokens_per_second": 12155.278 }, { "epoch": 1.3934150282790196, "grad_norm": 0.8297819435919894, "learning_rate": 2.103502181056554e-06, "loss": 0.30214226245880127, "num_input_tokens_seen": 659575088, "step": 20695, "train_runtime": 54262.0344, "train_tokens_per_second": 12155.37 }, { "epoch": 1.3937516832749797, "grad_norm": 0.8241283525710857, "learning_rate": 2.1013473558555503e-06, "loss": 0.289078426361084, "num_input_tokens_seen": 659738928, "step": 20700, "train_runtime": 54274.479, "train_tokens_per_second": 12155.601 }, { "epoch": 1.39408833827094, "grad_norm": 0.7305413380835792, "learning_rate": 2.099193341253519e-06, "loss": 0.29375219345092773, "num_input_tokens_seen": 659897272, "step": 20705, "train_runtime": 54288.4866, "train_tokens_per_second": 12155.382 }, { "epoch": 1.3944249932669002, "grad_norm": 0.7506548867882089, "learning_rate": 2.0970401378528167e-06, "loss": 0.28227407932281495, "num_input_tokens_seen": 660050824, "step": 20710, "train_runtime": 54301.1669, "train_tokens_per_second": 12155.371 }, { "epoch": 1.3947616482628602, "grad_norm": 0.7479026187231906, "learning_rate": 2.0948877462555844e-06, "loss": 0.2800161838531494, "num_input_tokens_seen": 660210016, "step": 20715, "train_runtime": 54314.4045, "train_tokens_per_second": 12155.339 }, { "epoch": 1.3950983032588202, "grad_norm": 0.7679638071694884, "learning_rate": 2.09273616706373e-06, "loss": 0.30209167003631593, "num_input_tokens_seen": 660370848, "step": 20720, "train_runtime": 54326.8626, "train_tokens_per_second": 12155.512 }, { "epoch": 1.3954349582547805, "grad_norm": 0.7955495021385083, "learning_rate": 2.090585400878936e-06, "loss": 0.31611971855163573, "num_input_tokens_seen": 660531464, "step": 20725, "train_runtime": 54339.698, "train_tokens_per_second": 12155.597 }, { "epoch": 1.3957716132507407, "grad_norm": 0.8615853389553981, "learning_rate": 2.0884354483026576e-06, "loss": 0.3125169038772583, "num_input_tokens_seen": 660689512, "step": 20730, "train_runtime": 54352.5476, "train_tokens_per_second": 12155.631 }, { "epoch": 1.3961082682467008, "grad_norm": 0.7579016246920184, "learning_rate": 2.0862863099361214e-06, "loss": 0.30734028816223147, "num_input_tokens_seen": 660853352, "step": 20735, "train_runtime": 54364.999, "train_tokens_per_second": 12155.861 }, { "epoch": 1.3964449232426608, "grad_norm": 0.817064244578435, "learning_rate": 2.084137986380326e-06, "loss": 0.33032703399658203, "num_input_tokens_seen": 661009088, "step": 20740, "train_runtime": 54377.7708, "train_tokens_per_second": 12155.87 }, { "epoch": 1.396781578238621, "grad_norm": 0.7876017236428002, "learning_rate": 2.081990478236048e-06, "loss": 0.27702276706695556, "num_input_tokens_seen": 661163752, "step": 20745, "train_runtime": 54391.8542, "train_tokens_per_second": 12155.566 }, { "epoch": 1.3971182332345813, "grad_norm": 0.8038784262169215, "learning_rate": 2.079843786103824e-06, "loss": 0.28578896522521974, "num_input_tokens_seen": 661324824, "step": 20750, "train_runtime": 54405.4781, "train_tokens_per_second": 12155.482 }, { "epoch": 1.3974548882305413, "grad_norm": 0.8981684674471448, "learning_rate": 2.0776979105839774e-06, "loss": 0.302164101600647, "num_input_tokens_seen": 661486256, "step": 20755, "train_runtime": 54417.992, "train_tokens_per_second": 12155.654 }, { "epoch": 1.3977915432265013, "grad_norm": 0.8968143466418896, "learning_rate": 2.075552852276588e-06, "loss": 0.3322463035583496, "num_input_tokens_seen": 661648400, "step": 20760, "train_runtime": 54431.0415, "train_tokens_per_second": 12155.718 }, { "epoch": 1.3981281982224616, "grad_norm": 0.8893680118872508, "learning_rate": 2.07340861178152e-06, "loss": 0.29132239818572997, "num_input_tokens_seen": 661809656, "step": 20765, "train_runtime": 54444.8401, "train_tokens_per_second": 12155.599 }, { "epoch": 1.3984648532184218, "grad_norm": 0.8298743248245876, "learning_rate": 2.0712651896984013e-06, "loss": 0.3066413879394531, "num_input_tokens_seen": 661973200, "step": 20770, "train_runtime": 54457.8899, "train_tokens_per_second": 12155.689 }, { "epoch": 1.3988015082143819, "grad_norm": 0.8177213771127584, "learning_rate": 2.0691225866266335e-06, "loss": 0.3036322593688965, "num_input_tokens_seen": 662128168, "step": 20775, "train_runtime": 54470.4473, "train_tokens_per_second": 12155.732 }, { "epoch": 1.3991381632103421, "grad_norm": 0.8608732159606955, "learning_rate": 2.066980803165388e-06, "loss": 0.3045391798019409, "num_input_tokens_seen": 662287984, "step": 20780, "train_runtime": 54483.1962, "train_tokens_per_second": 12155.821 }, { "epoch": 1.3994748182063022, "grad_norm": 0.8551144618532229, "learning_rate": 2.0648398399136088e-06, "loss": 0.30803370475769043, "num_input_tokens_seen": 662448088, "step": 20785, "train_runtime": 54496.2577, "train_tokens_per_second": 12155.845 }, { "epoch": 1.3998114732022624, "grad_norm": 0.73451889551276, "learning_rate": 2.062699697470007e-06, "loss": 0.2977804899215698, "num_input_tokens_seen": 662606256, "step": 20790, "train_runtime": 54509.7638, "train_tokens_per_second": 12155.735 }, { "epoch": 1.4001481281982224, "grad_norm": 0.8280462471142737, "learning_rate": 2.060560376433072e-06, "loss": 0.3162750482559204, "num_input_tokens_seen": 662769272, "step": 20795, "train_runtime": 54523.211, "train_tokens_per_second": 12155.727 }, { "epoch": 1.4004847831941827, "grad_norm": 0.7173336569466907, "learning_rate": 2.05842187740105e-06, "loss": 0.3020288944244385, "num_input_tokens_seen": 662928296, "step": 20800, "train_runtime": 54536.6604, "train_tokens_per_second": 12155.645 }, { "epoch": 1.4008214381901427, "grad_norm": 0.777341071381465, "learning_rate": 2.0562842009719745e-06, "loss": 0.2713037967681885, "num_input_tokens_seen": 663075064, "step": 20805, "train_runtime": 54550.0195, "train_tokens_per_second": 12155.359 }, { "epoch": 1.401158093186103, "grad_norm": 0.8247246098014612, "learning_rate": 2.0541473477436317e-06, "loss": 0.27657513618469237, "num_input_tokens_seen": 663235280, "step": 20810, "train_runtime": 54562.8843, "train_tokens_per_second": 12155.429 }, { "epoch": 1.401494748182063, "grad_norm": 0.8072781249572049, "learning_rate": 2.052011318313591e-06, "loss": 0.27658560276031496, "num_input_tokens_seen": 663397752, "step": 20815, "train_runtime": 54575.9801, "train_tokens_per_second": 12155.489 }, { "epoch": 1.4018314031780232, "grad_norm": 0.8187843940548012, "learning_rate": 2.049876113279185e-06, "loss": 0.3338526010513306, "num_input_tokens_seen": 663560984, "step": 20820, "train_runtime": 54588.8868, "train_tokens_per_second": 12155.606 }, { "epoch": 1.4021680581739833, "grad_norm": 0.7982378825561747, "learning_rate": 2.0477417332375165e-06, "loss": 0.2930063486099243, "num_input_tokens_seen": 663722144, "step": 20825, "train_runtime": 54601.3592, "train_tokens_per_second": 12155.781 }, { "epoch": 1.4025047131699435, "grad_norm": 0.7933946412250249, "learning_rate": 2.045608178785458e-06, "loss": 0.2954334020614624, "num_input_tokens_seen": 663884232, "step": 20830, "train_runtime": 54614.5624, "train_tokens_per_second": 12155.81 }, { "epoch": 1.4028413681659035, "grad_norm": 0.8002124374409366, "learning_rate": 2.043475450519652e-06, "loss": 0.2986750602722168, "num_input_tokens_seen": 664043592, "step": 20835, "train_runtime": 54628.4642, "train_tokens_per_second": 12155.634 }, { "epoch": 1.4031780231618638, "grad_norm": 0.8306370883498027, "learning_rate": 2.0413435490365064e-06, "loss": 0.28760695457458496, "num_input_tokens_seen": 664198592, "step": 20840, "train_runtime": 54641.8279, "train_tokens_per_second": 12155.497 }, { "epoch": 1.4035146781578238, "grad_norm": 0.8507119929053484, "learning_rate": 2.0392124749322064e-06, "loss": 0.3281423330307007, "num_input_tokens_seen": 664361728, "step": 20845, "train_runtime": 54654.6558, "train_tokens_per_second": 12155.629 }, { "epoch": 1.403851333153784, "grad_norm": 0.8139173527877805, "learning_rate": 2.037082228802693e-06, "loss": 0.2736141443252563, "num_input_tokens_seen": 664522344, "step": 20850, "train_runtime": 54668.1191, "train_tokens_per_second": 12155.574 }, { "epoch": 1.404187988149744, "grad_norm": 0.7131337798046449, "learning_rate": 2.03495281124369e-06, "loss": 0.27420663833618164, "num_input_tokens_seen": 664680752, "step": 20855, "train_runtime": 54680.8817, "train_tokens_per_second": 12155.633 }, { "epoch": 1.4045246431457044, "grad_norm": 0.7379177529244906, "learning_rate": 2.0328242228506746e-06, "loss": 0.2869014024734497, "num_input_tokens_seen": 664841096, "step": 20860, "train_runtime": 54694.2912, "train_tokens_per_second": 12155.585 }, { "epoch": 1.4048612981416644, "grad_norm": 0.8903796633752868, "learning_rate": 2.0306964642189053e-06, "loss": 0.2895898580551147, "num_input_tokens_seen": 664998856, "step": 20865, "train_runtime": 54706.9827, "train_tokens_per_second": 12155.649 }, { "epoch": 1.4051979531376246, "grad_norm": 0.7547859285642092, "learning_rate": 2.028569535943402e-06, "loss": 0.28022797107696534, "num_input_tokens_seen": 665156200, "step": 20870, "train_runtime": 54720.264, "train_tokens_per_second": 12155.574 }, { "epoch": 1.4055346081335847, "grad_norm": 1.0717408356055804, "learning_rate": 2.0264434386189524e-06, "loss": 0.2991631507873535, "num_input_tokens_seen": 665311160, "step": 20875, "train_runtime": 54733.3379, "train_tokens_per_second": 12155.501 }, { "epoch": 1.405871263129545, "grad_norm": 0.7343491213782462, "learning_rate": 2.0243181728401136e-06, "loss": 0.2980818510055542, "num_input_tokens_seen": 665473592, "step": 20880, "train_runtime": 54747.6385, "train_tokens_per_second": 12155.293 }, { "epoch": 1.406207918125505, "grad_norm": 0.8527889717640886, "learning_rate": 2.022193739201208e-06, "loss": 0.3042200803756714, "num_input_tokens_seen": 665625536, "step": 20885, "train_runtime": 54760.5554, "train_tokens_per_second": 12155.201 }, { "epoch": 1.4065445731214652, "grad_norm": 0.7573194751458604, "learning_rate": 2.0200701382963267e-06, "loss": 0.2779937744140625, "num_input_tokens_seen": 665783392, "step": 20890, "train_runtime": 54773.3548, "train_tokens_per_second": 12155.242 }, { "epoch": 1.4068812281174252, "grad_norm": 0.7664024422424403, "learning_rate": 2.0179473707193324e-06, "loss": 0.28447072505950927, "num_input_tokens_seen": 665946920, "step": 20895, "train_runtime": 54786.3763, "train_tokens_per_second": 12155.338 }, { "epoch": 1.4072178831133855, "grad_norm": 0.7051923882784243, "learning_rate": 2.0158254370638435e-06, "loss": 0.2863420009613037, "num_input_tokens_seen": 666105736, "step": 20900, "train_runtime": 54799.047, "train_tokens_per_second": 12155.426 }, { "epoch": 1.4075545381093455, "grad_norm": 0.7311150450776002, "learning_rate": 2.0137043379232585e-06, "loss": 0.29042930603027345, "num_input_tokens_seen": 666266752, "step": 20905, "train_runtime": 54812.1899, "train_tokens_per_second": 12155.449 }, { "epoch": 1.4078911931053057, "grad_norm": 0.7140574961981422, "learning_rate": 2.0115840738907293e-06, "loss": 0.2854149341583252, "num_input_tokens_seen": 666424320, "step": 20910, "train_runtime": 54826.0899, "train_tokens_per_second": 12155.241 }, { "epoch": 1.4082278481012658, "grad_norm": 0.8091024196731981, "learning_rate": 2.0094646455591865e-06, "loss": 0.2945026636123657, "num_input_tokens_seen": 666586280, "step": 20915, "train_runtime": 54839.2569, "train_tokens_per_second": 12155.276 }, { "epoch": 1.408564503097226, "grad_norm": 0.7489971328317317, "learning_rate": 2.007346053521319e-06, "loss": 0.31034603118896487, "num_input_tokens_seen": 666746312, "step": 20920, "train_runtime": 54852.016, "train_tokens_per_second": 12155.366 }, { "epoch": 1.408901158093186, "grad_norm": 0.8611253904666468, "learning_rate": 2.005228298369583e-06, "loss": 0.3167555809020996, "num_input_tokens_seen": 666897808, "step": 20925, "train_runtime": 54864.6164, "train_tokens_per_second": 12155.335 }, { "epoch": 1.4092378130891463, "grad_norm": 0.8063060042735796, "learning_rate": 2.003111380696208e-06, "loss": 0.27892022132873534, "num_input_tokens_seen": 667060880, "step": 20930, "train_runtime": 54877.3868, "train_tokens_per_second": 12155.478 }, { "epoch": 1.4095744680851063, "grad_norm": 0.906936730667048, "learning_rate": 2.0009953010931747e-06, "loss": 0.29097919464111327, "num_input_tokens_seen": 667223920, "step": 20935, "train_runtime": 54890.3957, "train_tokens_per_second": 12155.568 }, { "epoch": 1.4099111230810666, "grad_norm": 0.85967155792743, "learning_rate": 1.998880060152244e-06, "loss": 0.3286836862564087, "num_input_tokens_seen": 667383176, "step": 20940, "train_runtime": 54902.9715, "train_tokens_per_second": 12155.684 }, { "epoch": 1.4102477780770266, "grad_norm": 0.8202102122420725, "learning_rate": 1.9967656584649354e-06, "loss": 0.3003001928329468, "num_input_tokens_seen": 667542840, "step": 20945, "train_runtime": 54916.132, "train_tokens_per_second": 12155.678 }, { "epoch": 1.4105844330729869, "grad_norm": 0.7859309374999206, "learning_rate": 1.994652096622533e-06, "loss": 0.31295218467712405, "num_input_tokens_seen": 667702752, "step": 20950, "train_runtime": 54929.2172, "train_tokens_per_second": 12155.694 }, { "epoch": 1.410921088068947, "grad_norm": 0.7823562268201744, "learning_rate": 1.992539375216089e-06, "loss": 0.30660452842712405, "num_input_tokens_seen": 667866592, "step": 20955, "train_runtime": 54941.65, "train_tokens_per_second": 12155.925 }, { "epoch": 1.4112577430649071, "grad_norm": 0.7696996231647802, "learning_rate": 1.9904274948364184e-06, "loss": 0.2958907842636108, "num_input_tokens_seen": 668027600, "step": 20960, "train_runtime": 54955.1517, "train_tokens_per_second": 12155.869 }, { "epoch": 1.4115943980608672, "grad_norm": 0.918883900786541, "learning_rate": 1.988316456074102e-06, "loss": 0.3099415063858032, "num_input_tokens_seen": 668191440, "step": 20965, "train_runtime": 54967.578, "train_tokens_per_second": 12156.101 }, { "epoch": 1.4119310530568274, "grad_norm": 0.7918069853503352, "learning_rate": 1.9862062595194854e-06, "loss": 0.3219482898712158, "num_input_tokens_seen": 668348688, "step": 20970, "train_runtime": 54981.03, "train_tokens_per_second": 12155.987 }, { "epoch": 1.4122677080527875, "grad_norm": 0.8746414376875723, "learning_rate": 1.984096905762676e-06, "loss": 0.3007672786712646, "num_input_tokens_seen": 668507072, "step": 20975, "train_runtime": 54994.023, "train_tokens_per_second": 12155.995 }, { "epoch": 1.4126043630487477, "grad_norm": 0.8007824483939163, "learning_rate": 1.9819883953935533e-06, "loss": 0.3088326930999756, "num_input_tokens_seen": 668670016, "step": 20980, "train_runtime": 55006.7425, "train_tokens_per_second": 12156.146 }, { "epoch": 1.4129410180447077, "grad_norm": 0.7940277605983056, "learning_rate": 1.9798807290017485e-06, "loss": 0.2929655075073242, "num_input_tokens_seen": 668826368, "step": 20985, "train_runtime": 55019.4064, "train_tokens_per_second": 12156.19 }, { "epoch": 1.413277673040668, "grad_norm": 0.7713319525670047, "learning_rate": 1.9777739071766693e-06, "loss": 0.3011338472366333, "num_input_tokens_seen": 668984720, "step": 20990, "train_runtime": 55032.6868, "train_tokens_per_second": 12156.134 }, { "epoch": 1.413614328036628, "grad_norm": 0.777433206310864, "learning_rate": 1.97566793050748e-06, "loss": 0.2870569944381714, "num_input_tokens_seen": 669139032, "step": 20995, "train_runtime": 55045.8846, "train_tokens_per_second": 12156.023 }, { "epoch": 1.4139509830325883, "grad_norm": 0.837211950632524, "learning_rate": 1.9735627995831096e-06, "loss": 0.2744601726531982, "num_input_tokens_seen": 669300224, "step": 21000, "train_runtime": 55058.4522, "train_tokens_per_second": 12156.176 }, { "epoch": 1.4142876380285483, "grad_norm": 0.8665244008838211, "learning_rate": 1.9714585149922523e-06, "loss": 0.31123199462890627, "num_input_tokens_seen": 669464040, "step": 21005, "train_runtime": 55070.8805, "train_tokens_per_second": 12156.407 }, { "epoch": 1.4146242930245085, "grad_norm": 0.8056199433128648, "learning_rate": 1.9693550773233634e-06, "loss": 0.28864521980285646, "num_input_tokens_seen": 669623568, "step": 21010, "train_runtime": 55083.4977, "train_tokens_per_second": 12156.519 }, { "epoch": 1.4149609480204686, "grad_norm": 1.0143001505034885, "learning_rate": 1.967252487164663e-06, "loss": 0.2820691347122192, "num_input_tokens_seen": 669784880, "step": 21015, "train_runtime": 55096.7466, "train_tokens_per_second": 12156.523 }, { "epoch": 1.4152976030164288, "grad_norm": 0.8439838637247834, "learning_rate": 1.9651507451041344e-06, "loss": 0.3045512199401855, "num_input_tokens_seen": 669944648, "step": 21020, "train_runtime": 55110.3362, "train_tokens_per_second": 12156.425 }, { "epoch": 1.4156342580123888, "grad_norm": 0.8614437995540749, "learning_rate": 1.9630498517295204e-06, "loss": 0.29846189022064207, "num_input_tokens_seen": 670107408, "step": 21025, "train_runtime": 55123.435, "train_tokens_per_second": 12156.489 }, { "epoch": 1.415970913008349, "grad_norm": 0.8494136532817852, "learning_rate": 1.960949807628335e-06, "loss": 0.2990385055541992, "num_input_tokens_seen": 670268280, "step": 21030, "train_runtime": 55136.5777, "train_tokens_per_second": 12156.509 }, { "epoch": 1.4163075680043091, "grad_norm": 0.810379912538388, "learning_rate": 1.9588506133878415e-06, "loss": 0.33489117622375486, "num_input_tokens_seen": 670427256, "step": 21035, "train_runtime": 55149.6884, "train_tokens_per_second": 12156.501 }, { "epoch": 1.4166442230002694, "grad_norm": 0.7628748636828452, "learning_rate": 1.956752269595078e-06, "loss": 0.311111307144165, "num_input_tokens_seen": 670588248, "step": 21040, "train_runtime": 55162.9955, "train_tokens_per_second": 12156.487 }, { "epoch": 1.4169808779962294, "grad_norm": 0.8270682327454322, "learning_rate": 1.9546547768368384e-06, "loss": 0.28902468681335447, "num_input_tokens_seen": 670750080, "step": 21045, "train_runtime": 55175.5346, "train_tokens_per_second": 12156.658 }, { "epoch": 1.4173175329921897, "grad_norm": 0.9340835893032142, "learning_rate": 1.9525581356996793e-06, "loss": 0.290776801109314, "num_input_tokens_seen": 670911752, "step": 21050, "train_runtime": 55188.7907, "train_tokens_per_second": 12156.667 }, { "epoch": 1.4176541879881497, "grad_norm": 0.8447282940494785, "learning_rate": 1.95046234676992e-06, "loss": 0.2880901575088501, "num_input_tokens_seen": 671075592, "step": 21055, "train_runtime": 55201.2218, "train_tokens_per_second": 12156.897 }, { "epoch": 1.41799084298411, "grad_norm": 0.8254266242570487, "learning_rate": 1.9483674106336416e-06, "loss": 0.2703708171844482, "num_input_tokens_seen": 671228712, "step": 21060, "train_runtime": 55213.9143, "train_tokens_per_second": 12156.876 }, { "epoch": 1.41832749798007, "grad_norm": 0.7737329220955402, "learning_rate": 1.9462733278766853e-06, "loss": 0.29945170879364014, "num_input_tokens_seen": 671387816, "step": 21065, "train_runtime": 55226.8907, "train_tokens_per_second": 12156.901 }, { "epoch": 1.4186641529760302, "grad_norm": 0.8138047644878008, "learning_rate": 1.9441800990846553e-06, "loss": 0.2919990062713623, "num_input_tokens_seen": 671546744, "step": 21070, "train_runtime": 55239.4876, "train_tokens_per_second": 12157.005 }, { "epoch": 1.4190008079719902, "grad_norm": 0.7519332793938329, "learning_rate": 1.942087724842915e-06, "loss": 0.3107193946838379, "num_input_tokens_seen": 671701408, "step": 21075, "train_runtime": 55252.6722, "train_tokens_per_second": 12156.904 }, { "epoch": 1.4193374629679505, "grad_norm": 0.8664060770979677, "learning_rate": 1.9399962057365944e-06, "loss": 0.2897336959838867, "num_input_tokens_seen": 671855264, "step": 21080, "train_runtime": 55266.1698, "train_tokens_per_second": 12156.718 }, { "epoch": 1.4196741179639105, "grad_norm": 0.8240649286629831, "learning_rate": 1.937905542350574e-06, "loss": 0.3101287603378296, "num_input_tokens_seen": 672016216, "step": 21085, "train_runtime": 55279.0619, "train_tokens_per_second": 12156.795 }, { "epoch": 1.4200107729598708, "grad_norm": 0.899627650566381, "learning_rate": 1.935815735269506e-06, "loss": 0.31273272037506106, "num_input_tokens_seen": 672173280, "step": 21090, "train_runtime": 55292.0327, "train_tokens_per_second": 12156.784 }, { "epoch": 1.4203474279558308, "grad_norm": 0.9294466370019883, "learning_rate": 1.933726785077797e-06, "loss": 0.3313465595245361, "num_input_tokens_seen": 672330608, "step": 21095, "train_runtime": 55304.4842, "train_tokens_per_second": 12156.891 }, { "epoch": 1.420684082951791, "grad_norm": 0.7881630642096581, "learning_rate": 1.9316386923596146e-06, "loss": 0.3223684310913086, "num_input_tokens_seen": 672487096, "step": 21100, "train_runtime": 55317.0599, "train_tokens_per_second": 12156.957 }, { "epoch": 1.421020737947751, "grad_norm": 0.8709967776505805, "learning_rate": 1.929551457698888e-06, "loss": 0.3101195335388184, "num_input_tokens_seen": 672645736, "step": 21105, "train_runtime": 55330.0097, "train_tokens_per_second": 12156.978 }, { "epoch": 1.4213573929437113, "grad_norm": 0.7868017586093501, "learning_rate": 1.9274650816793044e-06, "loss": 0.3017850160598755, "num_input_tokens_seen": 672807176, "step": 21110, "train_runtime": 55342.4293, "train_tokens_per_second": 12157.167 }, { "epoch": 1.4216940479396714, "grad_norm": 0.9329412150289632, "learning_rate": 1.9253795648843136e-06, "loss": 0.31035542488098145, "num_input_tokens_seen": 672965712, "step": 21115, "train_runtime": 55355.4492, "train_tokens_per_second": 12157.172 }, { "epoch": 1.4220307029356316, "grad_norm": 0.8001133470664693, "learning_rate": 1.9232949078971236e-06, "loss": 0.30742316246032714, "num_input_tokens_seen": 673125840, "step": 21120, "train_runtime": 55368.4085, "train_tokens_per_second": 12157.218 }, { "epoch": 1.4223673579315916, "grad_norm": 0.8044515612861367, "learning_rate": 1.9212111113006998e-06, "loss": 0.29122295379638674, "num_input_tokens_seen": 673289680, "step": 21125, "train_runtime": 55380.8284, "train_tokens_per_second": 12157.45 }, { "epoch": 1.4227040129275519, "grad_norm": 0.813711849466303, "learning_rate": 1.919128175677775e-06, "loss": 0.28965320587158205, "num_input_tokens_seen": 673447264, "step": 21130, "train_runtime": 55394.3969, "train_tokens_per_second": 12157.317 }, { "epoch": 1.423040667923512, "grad_norm": 0.8173294841163761, "learning_rate": 1.917046101610827e-06, "loss": 0.2809044122695923, "num_input_tokens_seen": 673607112, "step": 21135, "train_runtime": 55407.1666, "train_tokens_per_second": 12157.4 }, { "epoch": 1.4233773229194722, "grad_norm": 0.7629773189349726, "learning_rate": 1.9149648896821087e-06, "loss": 0.307040810585022, "num_input_tokens_seen": 673769024, "step": 21140, "train_runtime": 55420.5074, "train_tokens_per_second": 12157.395 }, { "epoch": 1.4237139779154322, "grad_norm": 0.8424367858269722, "learning_rate": 1.912884540473621e-06, "loss": 0.2925193071365356, "num_input_tokens_seen": 673922984, "step": 21145, "train_runtime": 55434.3897, "train_tokens_per_second": 12157.128 }, { "epoch": 1.4240506329113924, "grad_norm": 0.8802231400199286, "learning_rate": 1.9108050545671283e-06, "loss": 0.2741716384887695, "num_input_tokens_seen": 674079824, "step": 21150, "train_runtime": 55448.1724, "train_tokens_per_second": 12156.935 }, { "epoch": 1.4243872879073525, "grad_norm": 0.8540227414032426, "learning_rate": 1.9087264325441507e-06, "loss": 0.26904964447021484, "num_input_tokens_seen": 674240032, "step": 21155, "train_runtime": 55461.4638, "train_tokens_per_second": 12156.91 }, { "epoch": 1.4247239429033127, "grad_norm": 0.9163676425391353, "learning_rate": 1.9066486749859686e-06, "loss": 0.32110090255737306, "num_input_tokens_seen": 674396560, "step": 21160, "train_runtime": 55474.3185, "train_tokens_per_second": 12156.915 }, { "epoch": 1.4250605978992728, "grad_norm": 0.7273802265068893, "learning_rate": 1.9045717824736209e-06, "loss": 0.3160089015960693, "num_input_tokens_seen": 674555832, "step": 21165, "train_runtime": 55486.9148, "train_tokens_per_second": 12157.025 }, { "epoch": 1.425397252895233, "grad_norm": 0.9264693794919668, "learning_rate": 1.9024957555879037e-06, "loss": 0.3039489507675171, "num_input_tokens_seen": 674707776, "step": 21170, "train_runtime": 55499.9146, "train_tokens_per_second": 12156.916 }, { "epoch": 1.425733907891193, "grad_norm": 0.8099773802174989, "learning_rate": 1.9004205949093695e-06, "loss": 0.2939807176589966, "num_input_tokens_seen": 674865328, "step": 21175, "train_runtime": 55512.9709, "train_tokens_per_second": 12156.894 }, { "epoch": 1.4260705628871533, "grad_norm": 0.8075039027333336, "learning_rate": 1.8983463010183355e-06, "loss": 0.3183480978012085, "num_input_tokens_seen": 675022584, "step": 21180, "train_runtime": 55526.5637, "train_tokens_per_second": 12156.751 }, { "epoch": 1.4264072178831133, "grad_norm": 0.7630924665018629, "learning_rate": 1.8962728744948644e-06, "loss": 0.30946836471557615, "num_input_tokens_seen": 675186424, "step": 21185, "train_runtime": 55538.9902, "train_tokens_per_second": 12156.981 }, { "epoch": 1.4267438728790736, "grad_norm": 0.8392343554852615, "learning_rate": 1.894200315918789e-06, "loss": 0.30475497245788574, "num_input_tokens_seen": 675349392, "step": 21190, "train_runtime": 55551.7948, "train_tokens_per_second": 12157.112 }, { "epoch": 1.4270805278750336, "grad_norm": 0.8109563508046852, "learning_rate": 1.8921286258696913e-06, "loss": 0.2869288444519043, "num_input_tokens_seen": 675500192, "step": 21195, "train_runtime": 55564.6299, "train_tokens_per_second": 12157.018 }, { "epoch": 1.4274171828709938, "grad_norm": 0.8413780035102365, "learning_rate": 1.890057804926913e-06, "loss": 0.30377175807952883, "num_input_tokens_seen": 675661744, "step": 21200, "train_runtime": 55577.1366, "train_tokens_per_second": 12157.189 }, { "epoch": 1.4277538378669539, "grad_norm": 0.8009082947160341, "learning_rate": 1.887987853669553e-06, "loss": 0.2659959077835083, "num_input_tokens_seen": 675823128, "step": 21205, "train_runtime": 55590.8956, "train_tokens_per_second": 12157.083 }, { "epoch": 1.4280904928629141, "grad_norm": 0.9297945141354858, "learning_rate": 1.8859187726764654e-06, "loss": 0.30696640014648435, "num_input_tokens_seen": 675983296, "step": 21210, "train_runtime": 55603.5415, "train_tokens_per_second": 12157.199 }, { "epoch": 1.4284271478588741, "grad_norm": 0.8342897761211544, "learning_rate": 1.8838505625262638e-06, "loss": 0.29467411041259767, "num_input_tokens_seen": 676144424, "step": 21215, "train_runtime": 55616.0197, "train_tokens_per_second": 12157.368 }, { "epoch": 1.4287638028548344, "grad_norm": 0.802338836125089, "learning_rate": 1.8817832237973154e-06, "loss": 0.2830294132232666, "num_input_tokens_seen": 676303272, "step": 21220, "train_runtime": 55628.4322, "train_tokens_per_second": 12157.511 }, { "epoch": 1.4291004578507944, "grad_norm": 0.8111032479295406, "learning_rate": 1.8797167570677439e-06, "loss": 0.27536394596099856, "num_input_tokens_seen": 676462536, "step": 21225, "train_runtime": 55640.8332, "train_tokens_per_second": 12157.664 }, { "epoch": 1.4294371128467547, "grad_norm": 0.8013847844029551, "learning_rate": 1.8776511629154342e-06, "loss": 0.3162542819976807, "num_input_tokens_seen": 676625088, "step": 21230, "train_runtime": 55653.5027, "train_tokens_per_second": 12157.817 }, { "epoch": 1.4297737678427147, "grad_norm": 0.8018879789604034, "learning_rate": 1.8755864419180176e-06, "loss": 0.2986203670501709, "num_input_tokens_seen": 676786488, "step": 21235, "train_runtime": 55666.6263, "train_tokens_per_second": 12157.85 }, { "epoch": 1.430110422838675, "grad_norm": 0.7782613857007677, "learning_rate": 1.8735225946528906e-06, "loss": 0.30481600761413574, "num_input_tokens_seen": 676948128, "step": 21240, "train_runtime": 55679.1479, "train_tokens_per_second": 12158.019 }, { "epoch": 1.430447077834635, "grad_norm": 0.8938079243742394, "learning_rate": 1.8714596216972008e-06, "loss": 0.3058157444000244, "num_input_tokens_seen": 677107872, "step": 21245, "train_runtime": 55692.2215, "train_tokens_per_second": 12158.033 }, { "epoch": 1.4307837328305952, "grad_norm": 0.7858481517675684, "learning_rate": 1.8693975236278512e-06, "loss": 0.2930753231048584, "num_input_tokens_seen": 677267064, "step": 21250, "train_runtime": 55705.0235, "train_tokens_per_second": 12158.097 }, { "epoch": 1.4311203878265553, "grad_norm": 0.8704437172846795, "learning_rate": 1.8673363010215017e-06, "loss": 0.3337438106536865, "num_input_tokens_seen": 677426112, "step": 21255, "train_runtime": 55718.8506, "train_tokens_per_second": 12157.934 }, { "epoch": 1.4314570428225155, "grad_norm": 0.81490648902403, "learning_rate": 1.8652759544545661e-06, "loss": 0.3077549457550049, "num_input_tokens_seen": 677589952, "step": 21260, "train_runtime": 55731.2705, "train_tokens_per_second": 12158.164 }, { "epoch": 1.4317936978184758, "grad_norm": 0.7867439030425964, "learning_rate": 1.863216484503214e-06, "loss": 0.296589994430542, "num_input_tokens_seen": 677747656, "step": 21265, "train_runtime": 55744.4655, "train_tokens_per_second": 12158.116 }, { "epoch": 1.4321303528144358, "grad_norm": 0.8600250138820671, "learning_rate": 1.8611578917433698e-06, "loss": 0.32840142250061033, "num_input_tokens_seen": 677909472, "step": 21270, "train_runtime": 55757.5593, "train_tokens_per_second": 12158.163 }, { "epoch": 1.4324670078103958, "grad_norm": 0.8382862473213238, "learning_rate": 1.85910017675071e-06, "loss": 0.3198842525482178, "num_input_tokens_seen": 678066912, "step": 21275, "train_runtime": 55770.8971, "train_tokens_per_second": 12158.078 }, { "epoch": 1.432803662806356, "grad_norm": 0.7281648267814856, "learning_rate": 1.8570433401006737e-06, "loss": 0.26290369033813477, "num_input_tokens_seen": 678229528, "step": 21280, "train_runtime": 55783.7702, "train_tokens_per_second": 12158.187 }, { "epoch": 1.4331403178023163, "grad_norm": 1.136206886167445, "learning_rate": 1.8549873823684418e-06, "loss": 0.27656700611114504, "num_input_tokens_seen": 678389488, "step": 21285, "train_runtime": 55796.8752, "train_tokens_per_second": 12158.199 }, { "epoch": 1.4334769727982763, "grad_norm": 0.7797648999275555, "learning_rate": 1.8529323041289616e-06, "loss": 0.3268596649169922, "num_input_tokens_seen": 678550680, "step": 21290, "train_runtime": 55810.0123, "train_tokens_per_second": 12158.225 }, { "epoch": 1.4338136277942364, "grad_norm": 0.7639621711925553, "learning_rate": 1.850878105956927e-06, "loss": 0.2793318271636963, "num_input_tokens_seen": 678710392, "step": 21295, "train_runtime": 55823.0178, "train_tokens_per_second": 12158.253 }, { "epoch": 1.4341502827901966, "grad_norm": 0.7463992125697302, "learning_rate": 1.8488247884267885e-06, "loss": 0.28080949783325193, "num_input_tokens_seen": 678873704, "step": 21300, "train_runtime": 55835.9203, "train_tokens_per_second": 12158.369 }, { "epoch": 1.4344869377861569, "grad_norm": 0.8047760558116408, "learning_rate": 1.8467723521127495e-06, "loss": 0.2996971130371094, "num_input_tokens_seen": 679033472, "step": 21305, "train_runtime": 55849.1126, "train_tokens_per_second": 12158.357 }, { "epoch": 1.434823592782117, "grad_norm": 0.8640964976594291, "learning_rate": 1.8447207975887671e-06, "loss": 0.29690799713134763, "num_input_tokens_seen": 679192064, "step": 21310, "train_runtime": 55862.1539, "train_tokens_per_second": 12158.358 }, { "epoch": 1.435160247778077, "grad_norm": 0.8599610073097582, "learning_rate": 1.8426701254285522e-06, "loss": 0.30842161178588867, "num_input_tokens_seen": 679352472, "step": 21315, "train_runtime": 55874.5807, "train_tokens_per_second": 12158.525 }, { "epoch": 1.4354969027740372, "grad_norm": 0.8479316932676714, "learning_rate": 1.840620336205569e-06, "loss": 0.32105112075805664, "num_input_tokens_seen": 679512592, "step": 21320, "train_runtime": 55887.9789, "train_tokens_per_second": 12158.475 }, { "epoch": 1.4358335577699974, "grad_norm": 0.7671230182886822, "learning_rate": 1.8385714304930324e-06, "loss": 0.2665998458862305, "num_input_tokens_seen": 679672936, "step": 21325, "train_runtime": 55900.384, "train_tokens_per_second": 12158.645 }, { "epoch": 1.4361702127659575, "grad_norm": 0.7776175599887056, "learning_rate": 1.8365234088639178e-06, "loss": 0.2932872295379639, "num_input_tokens_seen": 679833552, "step": 21330, "train_runtime": 55913.7732, "train_tokens_per_second": 12158.606 }, { "epoch": 1.4365068677619175, "grad_norm": 0.8517853062803455, "learning_rate": 1.834476271890941e-06, "loss": 0.2763814926147461, "num_input_tokens_seen": 679987920, "step": 21335, "train_runtime": 55926.6054, "train_tokens_per_second": 12158.577 }, { "epoch": 1.4368435227578777, "grad_norm": 0.9210536635646197, "learning_rate": 1.8324300201465823e-06, "loss": 0.2705744743347168, "num_input_tokens_seen": 680148872, "step": 21340, "train_runtime": 55939.2363, "train_tokens_per_second": 12158.709 }, { "epoch": 1.437180177753838, "grad_norm": 0.8839284294447675, "learning_rate": 1.8303846542030674e-06, "loss": 0.3186767816543579, "num_input_tokens_seen": 680303360, "step": 21345, "train_runtime": 55951.9717, "train_tokens_per_second": 12158.702 }, { "epoch": 1.437516832749798, "grad_norm": 0.7068151177368024, "learning_rate": 1.828340174632377e-06, "loss": 0.2777002573013306, "num_input_tokens_seen": 680465664, "step": 21350, "train_runtime": 55965.9224, "train_tokens_per_second": 12158.571 }, { "epoch": 1.437853487745758, "grad_norm": 0.8534727297405322, "learning_rate": 1.8262965820062434e-06, "loss": 0.2907694339752197, "num_input_tokens_seen": 680624496, "step": 21355, "train_runtime": 55979.1814, "train_tokens_per_second": 12158.529 }, { "epoch": 1.4381901427417183, "grad_norm": 0.7535014122583716, "learning_rate": 1.8242538768961499e-06, "loss": 0.28483853340148924, "num_input_tokens_seen": 680781576, "step": 21360, "train_runtime": 55992.4754, "train_tokens_per_second": 12158.448 }, { "epoch": 1.4385267977376786, "grad_norm": 0.8690268193552331, "learning_rate": 1.8222120598733317e-06, "loss": 0.28143222332000734, "num_input_tokens_seen": 680945416, "step": 21365, "train_runtime": 56004.8926, "train_tokens_per_second": 12158.677 }, { "epoch": 1.4388634527336386, "grad_norm": 0.7737322165539616, "learning_rate": 1.820171131508781e-06, "loss": 0.32750644683837893, "num_input_tokens_seen": 681101704, "step": 21370, "train_runtime": 56018.4947, "train_tokens_per_second": 12158.515 }, { "epoch": 1.4392001077295986, "grad_norm": 0.8089917567865031, "learning_rate": 1.8181310923732304e-06, "loss": 0.26973321437835696, "num_input_tokens_seen": 681257256, "step": 21375, "train_runtime": 56031.1052, "train_tokens_per_second": 12158.555 }, { "epoch": 1.4395367627255589, "grad_norm": 0.7570295101572517, "learning_rate": 1.8160919430371764e-06, "loss": 0.31278605461120607, "num_input_tokens_seen": 681414712, "step": 21380, "train_runtime": 56044.3987, "train_tokens_per_second": 12158.48 }, { "epoch": 1.439873417721519, "grad_norm": 0.7913222820346503, "learning_rate": 1.814053684070855e-06, "loss": 0.28987956047058105, "num_input_tokens_seen": 681575456, "step": 21385, "train_runtime": 56057.2879, "train_tokens_per_second": 12158.552 }, { "epoch": 1.4402100727174791, "grad_norm": 0.7461149458225613, "learning_rate": 1.8120163160442633e-06, "loss": 0.2691861867904663, "num_input_tokens_seen": 681736600, "step": 21390, "train_runtime": 56069.7804, "train_tokens_per_second": 12158.717 }, { "epoch": 1.4405467277134392, "grad_norm": 0.8518112031645841, "learning_rate": 1.8099798395271428e-06, "loss": 0.3051251173019409, "num_input_tokens_seen": 681899024, "step": 21395, "train_runtime": 56082.4088, "train_tokens_per_second": 12158.875 }, { "epoch": 1.4408833827093994, "grad_norm": 0.9029857919230043, "learning_rate": 1.807944255088988e-06, "loss": 0.26226377487182617, "num_input_tokens_seen": 682057120, "step": 21400, "train_runtime": 56095.8838, "train_tokens_per_second": 12158.773 }, { "epoch": 1.4412200377053597, "grad_norm": 0.8823333700329987, "learning_rate": 1.8059095632990437e-06, "loss": 0.2917477607727051, "num_input_tokens_seen": 682218112, "step": 21405, "train_runtime": 56109.6401, "train_tokens_per_second": 12158.661 }, { "epoch": 1.4415566927013197, "grad_norm": 0.9166061747778074, "learning_rate": 1.8038757647263045e-06, "loss": 0.30876636505126953, "num_input_tokens_seen": 682376680, "step": 21410, "train_runtime": 56122.126, "train_tokens_per_second": 12158.782 }, { "epoch": 1.4418933476972797, "grad_norm": 0.7395607613262293, "learning_rate": 1.8018428599395143e-06, "loss": 0.2834480762481689, "num_input_tokens_seen": 682535760, "step": 21415, "train_runtime": 56134.5499, "train_tokens_per_second": 12158.925 }, { "epoch": 1.44223000269324, "grad_norm": 0.7507365515737661, "learning_rate": 1.7998108495071743e-06, "loss": 0.2868551254272461, "num_input_tokens_seen": 682698272, "step": 21420, "train_runtime": 56147.2099, "train_tokens_per_second": 12159.077 }, { "epoch": 1.4425666576892002, "grad_norm": 0.7195802445551491, "learning_rate": 1.797779733997521e-06, "loss": 0.29749279022216796, "num_input_tokens_seen": 682859408, "step": 21425, "train_runtime": 56160.7357, "train_tokens_per_second": 12159.018 }, { "epoch": 1.4429033126851603, "grad_norm": 0.8038981856926783, "learning_rate": 1.7957495139785585e-06, "loss": 0.31753060817718504, "num_input_tokens_seen": 683022312, "step": 21430, "train_runtime": 56174.2291, "train_tokens_per_second": 12158.998 }, { "epoch": 1.4432399676811203, "grad_norm": 0.8101308316696099, "learning_rate": 1.7937201900180228e-06, "loss": 0.2885474681854248, "num_input_tokens_seen": 683181360, "step": 21435, "train_runtime": 56188.4501, "train_tokens_per_second": 12158.751 }, { "epoch": 1.4435766226770805, "grad_norm": 0.8721945293025303, "learning_rate": 1.7916917626834134e-06, "loss": 0.31629080772399903, "num_input_tokens_seen": 683343096, "step": 21440, "train_runtime": 56200.8975, "train_tokens_per_second": 12158.936 }, { "epoch": 1.4439132776730408, "grad_norm": 0.804847599439285, "learning_rate": 1.7896642325419722e-06, "loss": 0.3054671764373779, "num_input_tokens_seen": 683503256, "step": 21445, "train_runtime": 56213.6228, "train_tokens_per_second": 12159.032 }, { "epoch": 1.4442499326690008, "grad_norm": 0.8571638144056907, "learning_rate": 1.7876376001606915e-06, "loss": 0.2939744472503662, "num_input_tokens_seen": 683658648, "step": 21450, "train_runtime": 56227.3792, "train_tokens_per_second": 12158.821 }, { "epoch": 1.4445865876649608, "grad_norm": 0.7304948314736766, "learning_rate": 1.7856118661063128e-06, "loss": 0.2670135021209717, "num_input_tokens_seen": 683822488, "step": 21455, "train_runtime": 56239.8054, "train_tokens_per_second": 12159.048 }, { "epoch": 1.444923242660921, "grad_norm": 0.7626352295598008, "learning_rate": 1.7835870309453251e-06, "loss": 0.2866842746734619, "num_input_tokens_seen": 683982128, "step": 21460, "train_runtime": 56253.5652, "train_tokens_per_second": 12158.912 }, { "epoch": 1.4452598976568813, "grad_norm": 0.8566538435293638, "learning_rate": 1.7815630952439667e-06, "loss": 0.29722516536712645, "num_input_tokens_seen": 684142992, "step": 21465, "train_runtime": 56267.2544, "train_tokens_per_second": 12158.812 }, { "epoch": 1.4455965526528414, "grad_norm": 0.7140566201619843, "learning_rate": 1.7795400595682289e-06, "loss": 0.3011247396469116, "num_input_tokens_seen": 684302056, "step": 21470, "train_runtime": 56280.7372, "train_tokens_per_second": 12158.726 }, { "epoch": 1.4459332076488014, "grad_norm": 0.8596531447643275, "learning_rate": 1.7775179244838408e-06, "loss": 0.32985286712646483, "num_input_tokens_seen": 684454880, "step": 21475, "train_runtime": 56293.7311, "train_tokens_per_second": 12158.634 }, { "epoch": 1.4462698626447617, "grad_norm": 0.7616688972474056, "learning_rate": 1.7754966905562925e-06, "loss": 0.27933244705200194, "num_input_tokens_seen": 684611888, "step": 21480, "train_runtime": 56306.9349, "train_tokens_per_second": 12158.571 }, { "epoch": 1.446606517640722, "grad_norm": 1.0618426951338584, "learning_rate": 1.7734763583508098e-06, "loss": 0.28763225078582766, "num_input_tokens_seen": 684772608, "step": 21485, "train_runtime": 56320.9338, "train_tokens_per_second": 12158.403 }, { "epoch": 1.446943172636682, "grad_norm": 0.8140189460786941, "learning_rate": 1.7714569284323757e-06, "loss": 0.2967977046966553, "num_input_tokens_seen": 684935168, "step": 21490, "train_runtime": 56333.3347, "train_tokens_per_second": 12158.612 }, { "epoch": 1.447279827632642, "grad_norm": 0.8430648848131194, "learning_rate": 1.7694384013657173e-06, "loss": 0.2972251892089844, "num_input_tokens_seen": 685093464, "step": 21495, "train_runtime": 56346.178, "train_tokens_per_second": 12158.65 }, { "epoch": 1.4476164826286022, "grad_norm": 0.796870231179487, "learning_rate": 1.767420777715308e-06, "loss": 0.31137757301330565, "num_input_tokens_seen": 685257304, "step": 21500, "train_runtime": 56358.5915, "train_tokens_per_second": 12158.879 }, { "epoch": 1.4479531376245625, "grad_norm": 0.8133643909610662, "learning_rate": 1.7654040580453702e-06, "loss": 0.28451905250549314, "num_input_tokens_seen": 685417648, "step": 21505, "train_runtime": 56371.3117, "train_tokens_per_second": 12158.98 }, { "epoch": 1.4482897926205225, "grad_norm": 0.7210214934455141, "learning_rate": 1.7633882429198734e-06, "loss": 0.3130315065383911, "num_input_tokens_seen": 685578560, "step": 21510, "train_runtime": 56383.7591, "train_tokens_per_second": 12159.15 }, { "epoch": 1.4486264476164825, "grad_norm": 0.7551439242442248, "learning_rate": 1.7613733329025318e-06, "loss": 0.29886622428894044, "num_input_tokens_seen": 685742400, "step": 21515, "train_runtime": 56396.182, "train_tokens_per_second": 12159.376 }, { "epoch": 1.4489631026124428, "grad_norm": 0.7434773451987416, "learning_rate": 1.759359328556814e-06, "loss": 0.31097979545593263, "num_input_tokens_seen": 685903624, "step": 21520, "train_runtime": 56408.6727, "train_tokens_per_second": 12159.542 }, { "epoch": 1.449299757608403, "grad_norm": 0.7970450861926961, "learning_rate": 1.7573462304459227e-06, "loss": 0.3127882957458496, "num_input_tokens_seen": 686063696, "step": 21525, "train_runtime": 56421.6866, "train_tokens_per_second": 12159.574 }, { "epoch": 1.449636412604363, "grad_norm": 0.8405521775564402, "learning_rate": 1.7553340391328216e-06, "loss": 0.30340938568115233, "num_input_tokens_seen": 686222928, "step": 21530, "train_runtime": 56434.7584, "train_tokens_per_second": 12159.579 }, { "epoch": 1.449973067600323, "grad_norm": 0.8318611910972775, "learning_rate": 1.7533227551802068e-06, "loss": 0.3056394100189209, "num_input_tokens_seen": 686384208, "step": 21535, "train_runtime": 56447.2105, "train_tokens_per_second": 12159.754 }, { "epoch": 1.4503097225962833, "grad_norm": 0.7891807978480752, "learning_rate": 1.7513123791505321e-06, "loss": 0.3165531873703003, "num_input_tokens_seen": 686542424, "step": 21540, "train_runtime": 56460.5763, "train_tokens_per_second": 12159.678 }, { "epoch": 1.4506463775922436, "grad_norm": 0.811067578094932, "learning_rate": 1.7493029116059913e-06, "loss": 0.3050800085067749, "num_input_tokens_seen": 686700600, "step": 21545, "train_runtime": 56473.8854, "train_tokens_per_second": 12159.613 }, { "epoch": 1.4509830325882036, "grad_norm": 0.7653939457423206, "learning_rate": 1.7472943531085252e-06, "loss": 0.30484685897827146, "num_input_tokens_seen": 686863184, "step": 21550, "train_runtime": 56486.5602, "train_tokens_per_second": 12159.763 }, { "epoch": 1.4513196875841636, "grad_norm": 0.8491299705942827, "learning_rate": 1.7452867042198212e-06, "loss": 0.28639864921569824, "num_input_tokens_seen": 687021208, "step": 21555, "train_runtime": 56499.1375, "train_tokens_per_second": 12159.853 }, { "epoch": 1.4516563425801239, "grad_norm": 0.7884690898621628, "learning_rate": 1.7432799655013122e-06, "loss": 0.28300116062164304, "num_input_tokens_seen": 687183360, "step": 21560, "train_runtime": 56512.3409, "train_tokens_per_second": 12159.881 }, { "epoch": 1.4519929975760841, "grad_norm": 0.7838449284348402, "learning_rate": 1.741274137514174e-06, "loss": 0.30590014457702636, "num_input_tokens_seen": 687342176, "step": 21565, "train_runtime": 56525.671, "train_tokens_per_second": 12159.823 }, { "epoch": 1.4523296525720442, "grad_norm": 0.8129609340304309, "learning_rate": 1.7392692208193351e-06, "loss": 0.28932440280914307, "num_input_tokens_seen": 687500120, "step": 21570, "train_runtime": 56538.6912, "train_tokens_per_second": 12159.817 }, { "epoch": 1.4526663075680042, "grad_norm": 0.7990204851467065, "learning_rate": 1.7372652159774578e-06, "loss": 0.26776914596557616, "num_input_tokens_seen": 687661640, "step": 21575, "train_runtime": 56551.1845, "train_tokens_per_second": 12159.987 }, { "epoch": 1.4530029625639644, "grad_norm": 0.8100846372904865, "learning_rate": 1.7352621235489625e-06, "loss": 0.28267197608947753, "num_input_tokens_seen": 687822464, "step": 21580, "train_runtime": 56564.7069, "train_tokens_per_second": 12159.923 }, { "epoch": 1.4533396175599247, "grad_norm": 0.9413468826323067, "learning_rate": 1.733259944094e-06, "loss": 0.3131802320480347, "num_input_tokens_seen": 687979464, "step": 21585, "train_runtime": 56577.4555, "train_tokens_per_second": 12159.958 }, { "epoch": 1.4536762725558847, "grad_norm": 0.7667098667048667, "learning_rate": 1.7312586781724789e-06, "loss": 0.29518172740936277, "num_input_tokens_seen": 688139224, "step": 21590, "train_runtime": 56590.6632, "train_tokens_per_second": 12159.943 }, { "epoch": 1.4540129275518447, "grad_norm": 0.8543632845666106, "learning_rate": 1.7292583263440454e-06, "loss": 0.31833181381225584, "num_input_tokens_seen": 688295520, "step": 21595, "train_runtime": 56603.443, "train_tokens_per_second": 12159.959 }, { "epoch": 1.454349582547805, "grad_norm": 0.826204547232496, "learning_rate": 1.7272588891680914e-06, "loss": 0.2934000015258789, "num_input_tokens_seen": 688453280, "step": 21600, "train_runtime": 56616.7332, "train_tokens_per_second": 12159.891 }, { "epoch": 1.4546862375437652, "grad_norm": 0.9121824989175548, "learning_rate": 1.7252603672037527e-06, "loss": 0.28450870513916016, "num_input_tokens_seen": 688609416, "step": 21605, "train_runtime": 56629.8267, "train_tokens_per_second": 12159.836 }, { "epoch": 1.4550228925397253, "grad_norm": 0.8181807965862449, "learning_rate": 1.72326276100991e-06, "loss": 0.2809373140335083, "num_input_tokens_seen": 688772344, "step": 21610, "train_runtime": 56642.6144, "train_tokens_per_second": 12159.967 }, { "epoch": 1.4553595475356853, "grad_norm": 0.8029632686030225, "learning_rate": 1.721266071145186e-06, "loss": 0.3233592987060547, "num_input_tokens_seen": 688932688, "step": 21615, "train_runtime": 56655.2153, "train_tokens_per_second": 12160.093 }, { "epoch": 1.4556962025316456, "grad_norm": 0.7452444064061056, "learning_rate": 1.7192702981679531e-06, "loss": 0.30849566459655764, "num_input_tokens_seen": 689094272, "step": 21620, "train_runtime": 56667.9552, "train_tokens_per_second": 12160.211 }, { "epoch": 1.4560328575276058, "grad_norm": 0.7858216629109098, "learning_rate": 1.717275442636317e-06, "loss": 0.2630155563354492, "num_input_tokens_seen": 689256704, "step": 21625, "train_runtime": 56680.526, "train_tokens_per_second": 12160.379 }, { "epoch": 1.4563695125235658, "grad_norm": 1.0564395769040469, "learning_rate": 1.7152815051081384e-06, "loss": 0.31965184211730957, "num_input_tokens_seen": 689415328, "step": 21630, "train_runtime": 56693.8752, "train_tokens_per_second": 12160.314 }, { "epoch": 1.4567061675195259, "grad_norm": 0.73330799555457, "learning_rate": 1.7132884861410093e-06, "loss": 0.2977971315383911, "num_input_tokens_seen": 689572824, "step": 21635, "train_runtime": 56706.9176, "train_tokens_per_second": 12160.295 }, { "epoch": 1.4570428225154861, "grad_norm": 0.8478087734585148, "learning_rate": 1.7112963862922766e-06, "loss": 0.2808065891265869, "num_input_tokens_seen": 689729696, "step": 21640, "train_runtime": 56719.6182, "train_tokens_per_second": 12160.337 }, { "epoch": 1.4573794775114464, "grad_norm": 0.7912794573815, "learning_rate": 1.7093052061190224e-06, "loss": 0.30621819496154784, "num_input_tokens_seen": 689893360, "step": 21645, "train_runtime": 56732.6714, "train_tokens_per_second": 12160.424 }, { "epoch": 1.4577161325074064, "grad_norm": 0.8362175201732533, "learning_rate": 1.7073149461780742e-06, "loss": 0.2925211191177368, "num_input_tokens_seen": 690055544, "step": 21650, "train_runtime": 56745.2835, "train_tokens_per_second": 12160.58 }, { "epoch": 1.4580527875033664, "grad_norm": 0.9076278128604351, "learning_rate": 1.705325607026001e-06, "loss": 0.304974627494812, "num_input_tokens_seen": 690210416, "step": 21655, "train_runtime": 56757.8022, "train_tokens_per_second": 12160.626 }, { "epoch": 1.4583894424993267, "grad_norm": 0.8754132700959792, "learning_rate": 1.7033371892191164e-06, "loss": 0.30251388549804686, "num_input_tokens_seen": 690370128, "step": 21660, "train_runtime": 56770.5412, "train_tokens_per_second": 12160.711 }, { "epoch": 1.458726097495287, "grad_norm": 0.8607860752993293, "learning_rate": 1.7013496933134726e-06, "loss": 0.305312967300415, "num_input_tokens_seen": 690526664, "step": 21665, "train_runtime": 56783.3667, "train_tokens_per_second": 12160.721 }, { "epoch": 1.459062752491247, "grad_norm": 0.7833076191979462, "learning_rate": 1.6993631198648724e-06, "loss": 0.33922324180603025, "num_input_tokens_seen": 690686888, "step": 21670, "train_runtime": 56797.0151, "train_tokens_per_second": 12160.619 }, { "epoch": 1.459399407487207, "grad_norm": 0.8876253004366031, "learning_rate": 1.697377469428847e-06, "loss": 0.2973735809326172, "num_input_tokens_seen": 690849520, "step": 21675, "train_runtime": 56810.5513, "train_tokens_per_second": 12160.585 }, { "epoch": 1.4597360624831672, "grad_norm": 0.8473232698736883, "learning_rate": 1.6953927425606842e-06, "loss": 0.32192392349243165, "num_input_tokens_seen": 691009656, "step": 21680, "train_runtime": 56823.808, "train_tokens_per_second": 12160.566 }, { "epoch": 1.4600727174791275, "grad_norm": 0.7003133936070418, "learning_rate": 1.6934089398154002e-06, "loss": 0.27196240425109863, "num_input_tokens_seen": 691168592, "step": 21685, "train_runtime": 56837.0784, "train_tokens_per_second": 12160.523 }, { "epoch": 1.4604093724750875, "grad_norm": 0.7047252653125704, "learning_rate": 1.6914260617477634e-06, "loss": 0.2757792234420776, "num_input_tokens_seen": 691327792, "step": 21690, "train_runtime": 56849.9583, "train_tokens_per_second": 12160.568 }, { "epoch": 1.4607460274710475, "grad_norm": 0.7045483722420454, "learning_rate": 1.6894441089122788e-06, "loss": 0.2627258777618408, "num_input_tokens_seen": 691488248, "step": 21695, "train_runtime": 56862.9279, "train_tokens_per_second": 12160.616 }, { "epoch": 1.4610826824670078, "grad_norm": 0.9390560886824095, "learning_rate": 1.6874630818631926e-06, "loss": 0.3093214511871338, "num_input_tokens_seen": 691649584, "step": 21700, "train_runtime": 56875.3652, "train_tokens_per_second": 12160.794 }, { "epoch": 1.461419337462968, "grad_norm": 0.7600123658609799, "learning_rate": 1.685482981154492e-06, "loss": 0.30641195774078367, "num_input_tokens_seen": 691810648, "step": 21705, "train_runtime": 56889.3407, "train_tokens_per_second": 12160.637 }, { "epoch": 1.461755992458928, "grad_norm": 0.7703978041383395, "learning_rate": 1.683503807339907e-06, "loss": 0.2964465141296387, "num_input_tokens_seen": 691971304, "step": 21710, "train_runtime": 56901.7958, "train_tokens_per_second": 12160.799 }, { "epoch": 1.462092647454888, "grad_norm": 0.8071186234033529, "learning_rate": 1.6815255609729047e-06, "loss": 0.3109596729278564, "num_input_tokens_seen": 692130800, "step": 21715, "train_runtime": 56914.454, "train_tokens_per_second": 12160.897 }, { "epoch": 1.4624293024508483, "grad_norm": 0.9074560559812094, "learning_rate": 1.6795482426067012e-06, "loss": 0.3002187967300415, "num_input_tokens_seen": 692284200, "step": 21720, "train_runtime": 56927.332, "train_tokens_per_second": 12160.84 }, { "epoch": 1.4627659574468086, "grad_norm": 0.9118115520023707, "learning_rate": 1.6775718527942403e-06, "loss": 0.2810234785079956, "num_input_tokens_seen": 692434768, "step": 21725, "train_runtime": 56941.6154, "train_tokens_per_second": 12160.434 }, { "epoch": 1.4631026124427686, "grad_norm": 1.338477873739346, "learning_rate": 1.675596392088219e-06, "loss": 0.2986829996109009, "num_input_tokens_seen": 692593432, "step": 21730, "train_runtime": 56954.1775, "train_tokens_per_second": 12160.538 }, { "epoch": 1.4634392674387287, "grad_norm": 0.7924862839798946, "learning_rate": 1.6736218610410633e-06, "loss": 0.2923915386199951, "num_input_tokens_seen": 692757272, "step": 21735, "train_runtime": 56966.6095, "train_tokens_per_second": 12160.76 }, { "epoch": 1.463775922434689, "grad_norm": 0.7805534920410327, "learning_rate": 1.6716482602049483e-06, "loss": 0.2890747547149658, "num_input_tokens_seen": 692913440, "step": 21740, "train_runtime": 56979.6811, "train_tokens_per_second": 12160.711 }, { "epoch": 1.4641125774306492, "grad_norm": 1.0264225372370543, "learning_rate": 1.669675590131784e-06, "loss": 0.3072577714920044, "num_input_tokens_seen": 693067128, "step": 21745, "train_runtime": 56993.1543, "train_tokens_per_second": 12160.533 }, { "epoch": 1.4644492324266092, "grad_norm": 0.8339566810095834, "learning_rate": 1.6677038513732214e-06, "loss": 0.3025707721710205, "num_input_tokens_seen": 693227848, "step": 21750, "train_runtime": 57006.3233, "train_tokens_per_second": 12160.543 }, { "epoch": 1.4647858874225694, "grad_norm": 0.8820807153206564, "learning_rate": 1.6657330444806508e-06, "loss": 0.3012739419937134, "num_input_tokens_seen": 693388168, "step": 21755, "train_runtime": 57020.5387, "train_tokens_per_second": 12160.323 }, { "epoch": 1.4651225424185295, "grad_norm": 0.8057176722233966, "learning_rate": 1.6637631700052021e-06, "loss": 0.29248919486999514, "num_input_tokens_seen": 693549880, "step": 21760, "train_runtime": 57033.6587, "train_tokens_per_second": 12160.361 }, { "epoch": 1.4654591974144897, "grad_norm": 0.788429603686, "learning_rate": 1.6617942284977428e-06, "loss": 0.27145137786865237, "num_input_tokens_seen": 693712880, "step": 21765, "train_runtime": 57046.4965, "train_tokens_per_second": 12160.482 }, { "epoch": 1.4657958524104497, "grad_norm": 0.8922539153296827, "learning_rate": 1.6598262205088862e-06, "loss": 0.3073990821838379, "num_input_tokens_seen": 693874712, "step": 21770, "train_runtime": 57059.7056, "train_tokens_per_second": 12160.503 }, { "epoch": 1.46613250740641, "grad_norm": 0.9074965378405806, "learning_rate": 1.6578591465889722e-06, "loss": 0.30682687759399413, "num_input_tokens_seen": 694036360, "step": 21775, "train_runtime": 57072.2493, "train_tokens_per_second": 12160.662 }, { "epoch": 1.46646916240237, "grad_norm": 0.802719267695498, "learning_rate": 1.6558930072880942e-06, "loss": 0.31342990398406984, "num_input_tokens_seen": 694197208, "step": 21780, "train_runtime": 57085.2144, "train_tokens_per_second": 12160.718 }, { "epoch": 1.4668058173983303, "grad_norm": 0.7944538935643626, "learning_rate": 1.6539278031560695e-06, "loss": 0.3204882383346558, "num_input_tokens_seen": 694354592, "step": 21785, "train_runtime": 57097.718, "train_tokens_per_second": 12160.812 }, { "epoch": 1.4671424723942903, "grad_norm": 0.946971906503643, "learning_rate": 1.6519635347424672e-06, "loss": 0.30272531509399414, "num_input_tokens_seen": 694509792, "step": 21790, "train_runtime": 57110.5879, "train_tokens_per_second": 12160.789 }, { "epoch": 1.4674791273902505, "grad_norm": 0.8256759423233608, "learning_rate": 1.650000202596586e-06, "loss": 0.3298978328704834, "num_input_tokens_seen": 694672520, "step": 21795, "train_runtime": 57123.0275, "train_tokens_per_second": 12160.989 }, { "epoch": 1.4678157823862106, "grad_norm": 0.9610444906539193, "learning_rate": 1.6480378072674659e-06, "loss": 0.304123067855835, "num_input_tokens_seen": 694834184, "step": 21800, "train_runtime": 57136.1132, "train_tokens_per_second": 12161.033 }, { "epoch": 1.4681524373821708, "grad_norm": 0.7554751854144708, "learning_rate": 1.646076349303884e-06, "loss": 0.287105131149292, "num_input_tokens_seen": 694995024, "step": 21805, "train_runtime": 57149.8773, "train_tokens_per_second": 12160.919 }, { "epoch": 1.4684890923781309, "grad_norm": 0.8640938887275199, "learning_rate": 1.6441158292543557e-06, "loss": 0.3035315990447998, "num_input_tokens_seen": 695155736, "step": 21810, "train_runtime": 57162.6254, "train_tokens_per_second": 12161.018 }, { "epoch": 1.468825747374091, "grad_norm": 0.7617390162940705, "learning_rate": 1.6421562476671339e-06, "loss": 0.33049280643463136, "num_input_tokens_seen": 695315528, "step": 21815, "train_runtime": 57175.1943, "train_tokens_per_second": 12161.14 }, { "epoch": 1.4691624023700511, "grad_norm": 0.7478745100343435, "learning_rate": 1.640197605090213e-06, "loss": 0.27458982467651366, "num_input_tokens_seen": 695476840, "step": 21820, "train_runtime": 57188.3996, "train_tokens_per_second": 12161.152 }, { "epoch": 1.4694990573660114, "grad_norm": 0.7683446394142356, "learning_rate": 1.6382399020713146e-06, "loss": 0.29114446640014646, "num_input_tokens_seen": 695629176, "step": 21825, "train_runtime": 57202.143, "train_tokens_per_second": 12160.894 }, { "epoch": 1.4698357123619714, "grad_norm": 0.8134183056000038, "learning_rate": 1.6362831391579115e-06, "loss": 0.27961149215698244, "num_input_tokens_seen": 695788352, "step": 21830, "train_runtime": 57214.8672, "train_tokens_per_second": 12160.971 }, { "epoch": 1.4701723673579317, "grad_norm": 0.8053622238046876, "learning_rate": 1.634327316897199e-06, "loss": 0.27769694328308103, "num_input_tokens_seen": 695947496, "step": 21835, "train_runtime": 57228.7127, "train_tokens_per_second": 12160.81 }, { "epoch": 1.4705090223538917, "grad_norm": 0.7177786556094375, "learning_rate": 1.6323724358361216e-06, "loss": 0.2857221603393555, "num_input_tokens_seen": 696103888, "step": 21840, "train_runtime": 57242.4539, "train_tokens_per_second": 12160.623 }, { "epoch": 1.470845677349852, "grad_norm": 0.8067103656560941, "learning_rate": 1.6304184965213537e-06, "loss": 0.28710260391235354, "num_input_tokens_seen": 696260920, "step": 21845, "train_runtime": 57255.2412, "train_tokens_per_second": 12160.649 }, { "epoch": 1.471182332345812, "grad_norm": 0.8138513564337244, "learning_rate": 1.6284654994993088e-06, "loss": 0.3102174043655396, "num_input_tokens_seen": 696424472, "step": 21850, "train_runtime": 57268.2816, "train_tokens_per_second": 12160.736 }, { "epoch": 1.4715189873417722, "grad_norm": 0.7643060201554904, "learning_rate": 1.6265134453161358e-06, "loss": 0.29467175006866453, "num_input_tokens_seen": 696583664, "step": 21855, "train_runtime": 57281.7107, "train_tokens_per_second": 12160.664 }, { "epoch": 1.4718556423377323, "grad_norm": 0.7472690398602665, "learning_rate": 1.6245623345177203e-06, "loss": 0.28908791542053225, "num_input_tokens_seen": 696742696, "step": 21860, "train_runtime": 57294.9559, "train_tokens_per_second": 12160.629 }, { "epoch": 1.4721922973336925, "grad_norm": 0.6787669045710994, "learning_rate": 1.622612167649683e-06, "loss": 0.28769631385803224, "num_input_tokens_seen": 696897816, "step": 21865, "train_runtime": 57307.7516, "train_tokens_per_second": 12160.62 }, { "epoch": 1.4725289523296525, "grad_norm": 0.721393453080723, "learning_rate": 1.6206629452573868e-06, "loss": 0.27122280597686765, "num_input_tokens_seen": 697059128, "step": 21870, "train_runtime": 57320.8263, "train_tokens_per_second": 12160.661 }, { "epoch": 1.4728656073256128, "grad_norm": 0.8095693695292882, "learning_rate": 1.618714667885919e-06, "loss": 0.28151531219482423, "num_input_tokens_seen": 697220856, "step": 21875, "train_runtime": 57334.1474, "train_tokens_per_second": 12160.656 }, { "epoch": 1.4732022623215728, "grad_norm": 0.8307888372213474, "learning_rate": 1.6167673360801151e-06, "loss": 0.28565587997436526, "num_input_tokens_seen": 697383408, "step": 21880, "train_runtime": 57347.4356, "train_tokens_per_second": 12160.673 }, { "epoch": 1.473538917317533, "grad_norm": 0.8557104639694532, "learning_rate": 1.6148209503845336e-06, "loss": 0.3425395965576172, "num_input_tokens_seen": 697543400, "step": 21885, "train_runtime": 57360.2743, "train_tokens_per_second": 12160.74 }, { "epoch": 1.473875572313493, "grad_norm": 0.8261641029621242, "learning_rate": 1.6128755113434808e-06, "loss": 0.29276294708251954, "num_input_tokens_seen": 697702640, "step": 21890, "train_runtime": 57373.3111, "train_tokens_per_second": 12160.753 }, { "epoch": 1.4742122273094533, "grad_norm": 0.7460022438197418, "learning_rate": 1.6109310195009908e-06, "loss": 0.29490392208099364, "num_input_tokens_seen": 697866184, "step": 21895, "train_runtime": 57385.744, "train_tokens_per_second": 12160.968 }, { "epoch": 1.4745488823054134, "grad_norm": 0.8588584589338877, "learning_rate": 1.6089874754008323e-06, "loss": 0.2767459869384766, "num_input_tokens_seen": 698022304, "step": 21900, "train_runtime": 57399.5422, "train_tokens_per_second": 12160.764 }, { "epoch": 1.4748855373013736, "grad_norm": 0.8104450979587057, "learning_rate": 1.6070448795865162e-06, "loss": 0.2919157028198242, "num_input_tokens_seen": 698182936, "step": 21905, "train_runtime": 57412.6653, "train_tokens_per_second": 12160.783 }, { "epoch": 1.4752221922973336, "grad_norm": 0.9028325624474686, "learning_rate": 1.605103232601277e-06, "loss": 0.29503540992736815, "num_input_tokens_seen": 698339728, "step": 21910, "train_runtime": 57425.5182, "train_tokens_per_second": 12160.791 }, { "epoch": 1.475558847293294, "grad_norm": 0.6623573356343531, "learning_rate": 1.603162534988096e-06, "loss": 0.25478668212890626, "num_input_tokens_seen": 698500000, "step": 21915, "train_runtime": 57438.1055, "train_tokens_per_second": 12160.916 }, { "epoch": 1.475895502289254, "grad_norm": 0.8076918869329043, "learning_rate": 1.6012227872896791e-06, "loss": 0.2746097564697266, "num_input_tokens_seen": 698657976, "step": 21920, "train_runtime": 57451.1495, "train_tokens_per_second": 12160.905 }, { "epoch": 1.4762321572852142, "grad_norm": 0.7659695292709491, "learning_rate": 1.599283990048472e-06, "loss": 0.2935265064239502, "num_input_tokens_seen": 698812176, "step": 21925, "train_runtime": 57464.5066, "train_tokens_per_second": 12160.762 }, { "epoch": 1.4765688122811742, "grad_norm": 0.8418017216775949, "learning_rate": 1.5973461438066533e-06, "loss": 0.29478678703308103, "num_input_tokens_seen": 698973104, "step": 21930, "train_runtime": 57477.5088, "train_tokens_per_second": 12160.811 }, { "epoch": 1.4769054672771345, "grad_norm": 0.7919703500226196, "learning_rate": 1.5954092491061351e-06, "loss": 0.29035129547119143, "num_input_tokens_seen": 699134968, "step": 21935, "train_runtime": 57490.6451, "train_tokens_per_second": 12160.847 }, { "epoch": 1.4772421222730945, "grad_norm": 0.6678113689151396, "learning_rate": 1.5934733064885637e-06, "loss": 0.2938823223114014, "num_input_tokens_seen": 699297352, "step": 21940, "train_runtime": 57503.2752, "train_tokens_per_second": 12161.0 }, { "epoch": 1.4775787772690547, "grad_norm": 0.8937976617522727, "learning_rate": 1.5915383164953203e-06, "loss": 0.2971139430999756, "num_input_tokens_seen": 699452064, "step": 21945, "train_runtime": 57516.166, "train_tokens_per_second": 12160.965 }, { "epoch": 1.4779154322650148, "grad_norm": 0.8957473532669773, "learning_rate": 1.5896042796675155e-06, "loss": 0.2998655319213867, "num_input_tokens_seen": 699607440, "step": 21950, "train_runtime": 57529.1895, "train_tokens_per_second": 12160.913 }, { "epoch": 1.478252087260975, "grad_norm": 0.780653909346158, "learning_rate": 1.5876711965460023e-06, "loss": 0.3008512020111084, "num_input_tokens_seen": 699769240, "step": 21955, "train_runtime": 57542.3704, "train_tokens_per_second": 12160.939 }, { "epoch": 1.478588742256935, "grad_norm": 0.7571595357338647, "learning_rate": 1.5857390676713546e-06, "loss": 0.2968494415283203, "num_input_tokens_seen": 699922848, "step": 21960, "train_runtime": 57556.0221, "train_tokens_per_second": 12160.723 }, { "epoch": 1.4789253972528953, "grad_norm": 0.7644449740339404, "learning_rate": 1.5838078935838913e-06, "loss": 0.2694641351699829, "num_input_tokens_seen": 700077872, "step": 21965, "train_runtime": 57568.8696, "train_tokens_per_second": 12160.702 }, { "epoch": 1.4792620522488553, "grad_norm": 0.8159690709468568, "learning_rate": 1.581877674823657e-06, "loss": 0.2921644926071167, "num_input_tokens_seen": 700232352, "step": 21970, "train_runtime": 57582.3183, "train_tokens_per_second": 12160.545 }, { "epoch": 1.4795987072448156, "grad_norm": 0.7132647017481912, "learning_rate": 1.5799484119304308e-06, "loss": 0.30087804794311523, "num_input_tokens_seen": 700390120, "step": 21975, "train_runtime": 57594.9229, "train_tokens_per_second": 12160.623 }, { "epoch": 1.4799353622407756, "grad_norm": 0.7854791737176585, "learning_rate": 1.578020105443726e-06, "loss": 0.2734895467758179, "num_input_tokens_seen": 700550664, "step": 21980, "train_runtime": 57607.8592, "train_tokens_per_second": 12160.679 }, { "epoch": 1.4802720172367358, "grad_norm": 0.9393453472689324, "learning_rate": 1.576092755902787e-06, "loss": 0.3157112836837769, "num_input_tokens_seen": 700710728, "step": 21985, "train_runtime": 57620.8357, "train_tokens_per_second": 12160.718 }, { "epoch": 1.4806086722326959, "grad_norm": 0.7854820115765618, "learning_rate": 1.5741663638465903e-06, "loss": 0.3182875871658325, "num_input_tokens_seen": 700863096, "step": 21990, "train_runtime": 57633.3745, "train_tokens_per_second": 12160.716 }, { "epoch": 1.4809453272286561, "grad_norm": 0.808013459384627, "learning_rate": 1.5722409298138463e-06, "loss": 0.2827549934387207, "num_input_tokens_seen": 701018928, "step": 21995, "train_runtime": 57646.7984, "train_tokens_per_second": 12160.587 }, { "epoch": 1.4812819822246162, "grad_norm": 1.0220902810696029, "learning_rate": 1.570316454342994e-06, "loss": 0.3213972568511963, "num_input_tokens_seen": 701178224, "step": 22000, "train_runtime": 57660.8298, "train_tokens_per_second": 12160.391 }, { "epoch": 1.4816186372205764, "grad_norm": 0.7058270491010112, "learning_rate": 1.568392937972212e-06, "loss": 0.29758486747741697, "num_input_tokens_seen": 701342064, "step": 22005, "train_runtime": 57673.2655, "train_tokens_per_second": 12160.61 }, { "epoch": 1.4819552922165364, "grad_norm": 0.8648784223813537, "learning_rate": 1.5664703812393988e-06, "loss": 0.2885399580001831, "num_input_tokens_seen": 701505904, "step": 22010, "train_runtime": 57685.6923, "train_tokens_per_second": 12160.83 }, { "epoch": 1.4822919472124967, "grad_norm": 0.7900199187374539, "learning_rate": 1.5645487846821967e-06, "loss": 0.2926321506500244, "num_input_tokens_seen": 701668400, "step": 22015, "train_runtime": 57699.0809, "train_tokens_per_second": 12160.825 }, { "epoch": 1.4826286022084567, "grad_norm": 0.7888468998175585, "learning_rate": 1.5626281488379724e-06, "loss": 0.3058467388153076, "num_input_tokens_seen": 701829584, "step": 22020, "train_runtime": 57712.3597, "train_tokens_per_second": 12160.819 }, { "epoch": 1.482965257204417, "grad_norm": 0.7881499624685758, "learning_rate": 1.560708474243825e-06, "loss": 0.27547659873962405, "num_input_tokens_seen": 701991776, "step": 22025, "train_runtime": 57726.3047, "train_tokens_per_second": 12160.691 }, { "epoch": 1.483301912200377, "grad_norm": 0.9682973109498847, "learning_rate": 1.5587897614365854e-06, "loss": 0.3041182518005371, "num_input_tokens_seen": 702154296, "step": 22030, "train_runtime": 57738.9642, "train_tokens_per_second": 12160.84 }, { "epoch": 1.4836385671963372, "grad_norm": 0.8078596499091372, "learning_rate": 1.5568720109528163e-06, "loss": 0.2979097366333008, "num_input_tokens_seen": 702316168, "step": 22035, "train_runtime": 57752.1685, "train_tokens_per_second": 12160.862 }, { "epoch": 1.4839752221922973, "grad_norm": 0.8198291866225513, "learning_rate": 1.5549552233288095e-06, "loss": 0.318677282333374, "num_input_tokens_seen": 702470552, "step": 22040, "train_runtime": 57764.7047, "train_tokens_per_second": 12160.896 }, { "epoch": 1.4843118771882575, "grad_norm": 0.7682584202868828, "learning_rate": 1.5530393991005893e-06, "loss": 0.2923455715179443, "num_input_tokens_seen": 702631880, "step": 22045, "train_runtime": 57777.67, "train_tokens_per_second": 12160.959 }, { "epoch": 1.4846485321842176, "grad_norm": 0.7964315205715882, "learning_rate": 1.551124538803908e-06, "loss": 0.29217450618743895, "num_input_tokens_seen": 702790928, "step": 22050, "train_runtime": 57790.2816, "train_tokens_per_second": 12161.057 }, { "epoch": 1.4849851871801778, "grad_norm": 0.8168480951740427, "learning_rate": 1.5492106429742547e-06, "loss": 0.30246269702911377, "num_input_tokens_seen": 702951992, "step": 22055, "train_runtime": 57803.4446, "train_tokens_per_second": 12161.074 }, { "epoch": 1.4853218421761378, "grad_norm": 0.8624772194104877, "learning_rate": 1.5472977121468386e-06, "loss": 0.30541276931762695, "num_input_tokens_seen": 703113344, "step": 22060, "train_runtime": 57816.3273, "train_tokens_per_second": 12161.155 }, { "epoch": 1.485658497172098, "grad_norm": 0.8686719580731861, "learning_rate": 1.545385746856609e-06, "loss": 0.2763216495513916, "num_input_tokens_seen": 703267888, "step": 22065, "train_runtime": 57829.0322, "train_tokens_per_second": 12161.156 }, { "epoch": 1.485995152168058, "grad_norm": 0.7644751620951357, "learning_rate": 1.5434747476382388e-06, "loss": 0.2551461696624756, "num_input_tokens_seen": 703431032, "step": 22070, "train_runtime": 57841.9206, "train_tokens_per_second": 12161.267 }, { "epoch": 1.4863318071640184, "grad_norm": 0.9413585639050013, "learning_rate": 1.5415647150261337e-06, "loss": 0.2813568115234375, "num_input_tokens_seen": 703585856, "step": 22075, "train_runtime": 57855.2174, "train_tokens_per_second": 12161.148 }, { "epoch": 1.4866684621599784, "grad_norm": 0.8302429649355397, "learning_rate": 1.539655649554428e-06, "loss": 0.3002461910247803, "num_input_tokens_seen": 703746360, "step": 22080, "train_runtime": 57868.6384, "train_tokens_per_second": 12161.101 }, { "epoch": 1.4870051171559386, "grad_norm": 0.8390172593398922, "learning_rate": 1.5377475517569856e-06, "loss": 0.28984642028808594, "num_input_tokens_seen": 703902616, "step": 22085, "train_runtime": 57881.656, "train_tokens_per_second": 12161.066 }, { "epoch": 1.4873417721518987, "grad_norm": 0.8830222774369477, "learning_rate": 1.5358404221674e-06, "loss": 0.30376505851745605, "num_input_tokens_seen": 704061704, "step": 22090, "train_runtime": 57895.2346, "train_tokens_per_second": 12160.961 }, { "epoch": 1.487678427147859, "grad_norm": 0.7664812878488345, "learning_rate": 1.533934261318994e-06, "loss": 0.2926789283752441, "num_input_tokens_seen": 704219440, "step": 22095, "train_runtime": 57908.0521, "train_tokens_per_second": 12160.993 }, { "epoch": 1.488015082143819, "grad_norm": 0.7282356372573082, "learning_rate": 1.5320290697448177e-06, "loss": 0.2853104114532471, "num_input_tokens_seen": 704378704, "step": 22100, "train_runtime": 57921.0548, "train_tokens_per_second": 12161.013 }, { "epoch": 1.4883517371397792, "grad_norm": 0.8995352281082737, "learning_rate": 1.530124847977657e-06, "loss": 0.3070134878158569, "num_input_tokens_seen": 704540040, "step": 22105, "train_runtime": 57934.9604, "train_tokens_per_second": 12160.879 }, { "epoch": 1.4886883921357392, "grad_norm": 0.8458146075863114, "learning_rate": 1.528221596550014e-06, "loss": 0.2793126106262207, "num_input_tokens_seen": 704702584, "step": 22110, "train_runtime": 57948.3121, "train_tokens_per_second": 12160.882 }, { "epoch": 1.4890250471316995, "grad_norm": 0.809014193419703, "learning_rate": 1.5263193159941331e-06, "loss": 0.29033966064453126, "num_input_tokens_seen": 704863752, "step": 22115, "train_runtime": 57960.7829, "train_tokens_per_second": 12161.046 }, { "epoch": 1.4893617021276595, "grad_norm": 0.7676854559074024, "learning_rate": 1.5244180068419783e-06, "loss": 0.27314608097076415, "num_input_tokens_seen": 705024744, "step": 22120, "train_runtime": 57973.884, "train_tokens_per_second": 12161.075 }, { "epoch": 1.4896983571236198, "grad_norm": 0.9208978890852293, "learning_rate": 1.5225176696252453e-06, "loss": 0.3191307544708252, "num_input_tokens_seen": 705182712, "step": 22125, "train_runtime": 57986.9962, "train_tokens_per_second": 12161.049 }, { "epoch": 1.4900350121195798, "grad_norm": 0.9266664913064606, "learning_rate": 1.5206183048753575e-06, "loss": 0.3077064514160156, "num_input_tokens_seen": 705341608, "step": 22130, "train_runtime": 57999.6095, "train_tokens_per_second": 12161.144 }, { "epoch": 1.49037166711554, "grad_norm": 1.0508839842852964, "learning_rate": 1.5187199131234653e-06, "loss": 0.3335201501846313, "num_input_tokens_seen": 705499544, "step": 22135, "train_runtime": 58012.6307, "train_tokens_per_second": 12161.137 }, { "epoch": 1.4907083221115, "grad_norm": 0.7955013280795981, "learning_rate": 1.5168224949004484e-06, "loss": 0.30562918186187743, "num_input_tokens_seen": 705655032, "step": 22140, "train_runtime": 58025.7035, "train_tokens_per_second": 12161.077 }, { "epoch": 1.4910449771074603, "grad_norm": 0.7839344645502176, "learning_rate": 1.514926050736914e-06, "loss": 0.28303353786468505, "num_input_tokens_seen": 705816760, "step": 22145, "train_runtime": 58038.1992, "train_tokens_per_second": 12161.245 }, { "epoch": 1.4913816321034203, "grad_norm": 0.7730378068372598, "learning_rate": 1.5130305811631945e-06, "loss": 0.30832529067993164, "num_input_tokens_seen": 705976032, "step": 22150, "train_runtime": 58050.6702, "train_tokens_per_second": 12161.376 }, { "epoch": 1.4917182870993806, "grad_norm": 0.840435743762005, "learning_rate": 1.5111360867093571e-06, "loss": 0.3058335542678833, "num_input_tokens_seen": 706139752, "step": 22155, "train_runtime": 58063.7795, "train_tokens_per_second": 12161.45 }, { "epoch": 1.4920549420953406, "grad_norm": 0.8598024051610549, "learning_rate": 1.5092425679051848e-06, "loss": 0.2843809127807617, "num_input_tokens_seen": 706298832, "step": 22160, "train_runtime": 58076.4458, "train_tokens_per_second": 12161.537 }, { "epoch": 1.4923915970913009, "grad_norm": 0.864458486016635, "learning_rate": 1.5073500252801988e-06, "loss": 0.31615653038024905, "num_input_tokens_seen": 706459136, "step": 22165, "train_runtime": 58089.0851, "train_tokens_per_second": 12161.65 }, { "epoch": 1.492728252087261, "grad_norm": 0.8189887657231626, "learning_rate": 1.5054584593636412e-06, "loss": 0.2970459222793579, "num_input_tokens_seen": 706621512, "step": 22170, "train_runtime": 58102.3664, "train_tokens_per_second": 12161.665 }, { "epoch": 1.4930649070832211, "grad_norm": 0.8723747129265235, "learning_rate": 1.5035678706844814e-06, "loss": 0.31584391593933103, "num_input_tokens_seen": 706782264, "step": 22175, "train_runtime": 58115.5711, "train_tokens_per_second": 12161.668 }, { "epoch": 1.4934015620791812, "grad_norm": 0.7412093337505787, "learning_rate": 1.501678259771418e-06, "loss": 0.3040097713470459, "num_input_tokens_seen": 706943200, "step": 22180, "train_runtime": 58128.4511, "train_tokens_per_second": 12161.742 }, { "epoch": 1.4937382170751414, "grad_norm": 0.8987352374170409, "learning_rate": 1.499789627152874e-06, "loss": 0.3002941131591797, "num_input_tokens_seen": 707103960, "step": 22185, "train_runtime": 58141.2641, "train_tokens_per_second": 12161.826 }, { "epoch": 1.4940748720711015, "grad_norm": 0.8072341876850407, "learning_rate": 1.497901973356999e-06, "loss": 0.26718697547912595, "num_input_tokens_seen": 707264368, "step": 22190, "train_runtime": 58154.7745, "train_tokens_per_second": 12161.759 }, { "epoch": 1.4944115270670617, "grad_norm": 0.7275727890913124, "learning_rate": 1.4960152989116694e-06, "loss": 0.29034998416900637, "num_input_tokens_seen": 707424280, "step": 22195, "train_runtime": 58167.2673, "train_tokens_per_second": 12161.896 }, { "epoch": 1.4947481820630217, "grad_norm": 0.8496728849197415, "learning_rate": 1.4941296043444869e-06, "loss": 0.3018314361572266, "num_input_tokens_seen": 707582296, "step": 22200, "train_runtime": 58180.5199, "train_tokens_per_second": 12161.842 }, { "epoch": 1.495084837058982, "grad_norm": 0.7056862259275045, "learning_rate": 1.4922448901827847e-06, "loss": 0.28294010162353517, "num_input_tokens_seen": 707743624, "step": 22205, "train_runtime": 58193.0068, "train_tokens_per_second": 12162.005 }, { "epoch": 1.495421492054942, "grad_norm": 0.8956731023139126, "learning_rate": 1.4903611569536103e-06, "loss": 0.28267407417297363, "num_input_tokens_seen": 707891424, "step": 22210, "train_runtime": 58205.7386, "train_tokens_per_second": 12161.884 }, { "epoch": 1.4957581470509023, "grad_norm": 0.7947114245491367, "learning_rate": 1.488478405183748e-06, "loss": 0.3011770486831665, "num_input_tokens_seen": 708042944, "step": 22215, "train_runtime": 58219.0039, "train_tokens_per_second": 12161.715 }, { "epoch": 1.4960948020468623, "grad_norm": 0.7976741320470214, "learning_rate": 1.4865966353997024e-06, "loss": 0.2968148231506348, "num_input_tokens_seen": 708205680, "step": 22220, "train_runtime": 58231.9928, "train_tokens_per_second": 12161.797 }, { "epoch": 1.4964314570428225, "grad_norm": 0.7219478079552263, "learning_rate": 1.4847158481277047e-06, "loss": 0.2789992094039917, "num_input_tokens_seen": 708365968, "step": 22225, "train_runtime": 58244.7177, "train_tokens_per_second": 12161.892 }, { "epoch": 1.4967681120387826, "grad_norm": 0.881694178453512, "learning_rate": 1.48283604389371e-06, "loss": 0.27448248863220215, "num_input_tokens_seen": 708521232, "step": 22230, "train_runtime": 58257.5856, "train_tokens_per_second": 12161.871 }, { "epoch": 1.4971047670347428, "grad_norm": 0.6995602961530029, "learning_rate": 1.480957223223401e-06, "loss": 0.27577791213989256, "num_input_tokens_seen": 708684016, "step": 22235, "train_runtime": 58271.037, "train_tokens_per_second": 12161.857 }, { "epoch": 1.497441422030703, "grad_norm": 0.8239582683652602, "learning_rate": 1.4790793866421826e-06, "loss": 0.33448789119720457, "num_input_tokens_seen": 708839272, "step": 22240, "train_runtime": 58283.7134, "train_tokens_per_second": 12161.876 }, { "epoch": 1.497778077026663, "grad_norm": 0.8914818108155549, "learning_rate": 1.4772025346751862e-06, "loss": 0.2982901334762573, "num_input_tokens_seen": 708995072, "step": 22245, "train_runtime": 58296.4886, "train_tokens_per_second": 12161.883 }, { "epoch": 1.4981147320226231, "grad_norm": 0.7451035236587146, "learning_rate": 1.475326667847266e-06, "loss": 0.3039821147918701, "num_input_tokens_seen": 709155888, "step": 22250, "train_runtime": 58309.921, "train_tokens_per_second": 12161.839 }, { "epoch": 1.4984513870185834, "grad_norm": 0.9273829571900518, "learning_rate": 1.4734517866830073e-06, "loss": 0.3145290374755859, "num_input_tokens_seen": 709318632, "step": 22255, "train_runtime": 58322.6633, "train_tokens_per_second": 12161.973 }, { "epoch": 1.4987880420145436, "grad_norm": 0.8181070989350961, "learning_rate": 1.4715778917067081e-06, "loss": 0.30013322830200195, "num_input_tokens_seen": 709478800, "step": 22260, "train_runtime": 58336.0589, "train_tokens_per_second": 12161.925 }, { "epoch": 1.4991246970105037, "grad_norm": 0.7488580426882897, "learning_rate": 1.4697049834424016e-06, "loss": 0.27686998844146726, "num_input_tokens_seen": 709635488, "step": 22265, "train_runtime": 58348.7333, "train_tokens_per_second": 12161.969 }, { "epoch": 1.4994613520064637, "grad_norm": 0.8647920774965072, "learning_rate": 1.4678330624138387e-06, "loss": 0.2847649097442627, "num_input_tokens_seen": 709790816, "step": 22270, "train_runtime": 58361.5296, "train_tokens_per_second": 12161.964 }, { "epoch": 1.499798007002424, "grad_norm": 0.7800853967615423, "learning_rate": 1.465962129144497e-06, "loss": 0.30553445816040037, "num_input_tokens_seen": 709948712, "step": 22275, "train_runtime": 58374.0188, "train_tokens_per_second": 12162.067 }, { "epoch": 1.5001346619983842, "grad_norm": 0.9943155961981985, "learning_rate": 1.4640921841575766e-06, "loss": 0.3349766254425049, "num_input_tokens_seen": 710112096, "step": 22280, "train_runtime": 58387.0046, "train_tokens_per_second": 12162.16 }, { "epoch": 1.5004713169943442, "grad_norm": 1.5199964097145087, "learning_rate": 1.4622232279760018e-06, "loss": 0.2890611171722412, "num_input_tokens_seen": 710269416, "step": 22285, "train_runtime": 58399.7002, "train_tokens_per_second": 12162.21 }, { "epoch": 1.5008079719903042, "grad_norm": 0.8097233404721841, "learning_rate": 1.4603552611224202e-06, "loss": 0.3098331689834595, "num_input_tokens_seen": 710431184, "step": 22290, "train_runtime": 58412.8103, "train_tokens_per_second": 12162.25 }, { "epoch": 1.5011446269862645, "grad_norm": 0.7809107753388665, "learning_rate": 1.4584882841192027e-06, "loss": 0.30844788551330565, "num_input_tokens_seen": 710591216, "step": 22295, "train_runtime": 58426.6274, "train_tokens_per_second": 12162.113 }, { "epoch": 1.5014812819822247, "grad_norm": 0.8348887701436766, "learning_rate": 1.456622297488442e-06, "loss": 0.2780912399291992, "num_input_tokens_seen": 710746720, "step": 22300, "train_runtime": 58439.6655, "train_tokens_per_second": 12162.06 }, { "epoch": 1.5018179369781848, "grad_norm": 0.8328637003948696, "learning_rate": 1.4547573017519595e-06, "loss": 0.28893346786499025, "num_input_tokens_seen": 710905312, "step": 22305, "train_runtime": 58453.3965, "train_tokens_per_second": 12161.916 }, { "epoch": 1.5021545919741448, "grad_norm": 0.8164233513020881, "learning_rate": 1.4528932974312897e-06, "loss": 0.2727975368499756, "num_input_tokens_seen": 711069112, "step": 22310, "train_runtime": 58466.4917, "train_tokens_per_second": 12161.994 }, { "epoch": 1.502491246970105, "grad_norm": 0.8912331195664639, "learning_rate": 1.4510302850477005e-06, "loss": 0.2958809852600098, "num_input_tokens_seen": 711229784, "step": 22315, "train_runtime": 58480.7305, "train_tokens_per_second": 12161.78 }, { "epoch": 1.5028279019660653, "grad_norm": 0.7210165990084275, "learning_rate": 1.4491682651221746e-06, "loss": 0.274484920501709, "num_input_tokens_seen": 711387352, "step": 22320, "train_runtime": 58493.4348, "train_tokens_per_second": 12161.832 }, { "epoch": 1.5031645569620253, "grad_norm": 0.8532580037263516, "learning_rate": 1.447307238175421e-06, "loss": 0.28702850341796876, "num_input_tokens_seen": 711542800, "step": 22325, "train_runtime": 58506.9314, "train_tokens_per_second": 12161.684 }, { "epoch": 1.5035012119579854, "grad_norm": 0.9047123518370407, "learning_rate": 1.4454472047278688e-06, "loss": 0.29506919384002683, "num_input_tokens_seen": 711699336, "step": 22330, "train_runtime": 58519.9605, "train_tokens_per_second": 12161.651 }, { "epoch": 1.5038378669539456, "grad_norm": 0.7637916550949423, "learning_rate": 1.443588165299672e-06, "loss": 0.2757214069366455, "num_input_tokens_seen": 711859600, "step": 22335, "train_runtime": 58532.917, "train_tokens_per_second": 12161.697 }, { "epoch": 1.5041745219499059, "grad_norm": 0.8230997225570305, "learning_rate": 1.4417301204107037e-06, "loss": 0.31171507835388185, "num_input_tokens_seen": 712019120, "step": 22340, "train_runtime": 58546.1254, "train_tokens_per_second": 12161.678 }, { "epoch": 1.504511176945866, "grad_norm": 0.8223000651184691, "learning_rate": 1.4398730705805607e-06, "loss": 0.28942370414733887, "num_input_tokens_seen": 712178696, "step": 22345, "train_runtime": 58558.871, "train_tokens_per_second": 12161.756 }, { "epoch": 1.504847831941826, "grad_norm": 0.7684032323103801, "learning_rate": 1.43801701632856e-06, "loss": 0.2952467918395996, "num_input_tokens_seen": 712340560, "step": 22350, "train_runtime": 58571.4254, "train_tokens_per_second": 12161.913 }, { "epoch": 1.5051844869377862, "grad_norm": 0.8834924161927463, "learning_rate": 1.436161958173745e-06, "loss": 0.3219234704971313, "num_input_tokens_seen": 712503024, "step": 22355, "train_runtime": 58584.0785, "train_tokens_per_second": 12162.059 }, { "epoch": 1.5055211419337464, "grad_norm": 0.7279584088167114, "learning_rate": 1.4343078966348718e-06, "loss": 0.2985443115234375, "num_input_tokens_seen": 712662360, "step": 22360, "train_runtime": 58597.8737, "train_tokens_per_second": 12161.915 }, { "epoch": 1.5058577969297064, "grad_norm": 0.7999296939031575, "learning_rate": 1.432454832230426e-06, "loss": 0.3008028507232666, "num_input_tokens_seen": 712825848, "step": 22365, "train_runtime": 58610.8782, "train_tokens_per_second": 12162.006 }, { "epoch": 1.5061944519256665, "grad_norm": 0.7636266842246873, "learning_rate": 1.4306027654786103e-06, "loss": 0.27956788539886473, "num_input_tokens_seen": 712987768, "step": 22370, "train_runtime": 58623.8344, "train_tokens_per_second": 12162.08 }, { "epoch": 1.5065311069216267, "grad_norm": 0.7680347423752818, "learning_rate": 1.4287516968973491e-06, "loss": 0.29725937843322753, "num_input_tokens_seen": 713144992, "step": 22375, "train_runtime": 58636.5014, "train_tokens_per_second": 12162.134 }, { "epoch": 1.506867761917587, "grad_norm": 0.8195603605176168, "learning_rate": 1.4269016270042884e-06, "loss": 0.31431739330291747, "num_input_tokens_seen": 713307672, "step": 22380, "train_runtime": 58649.9476, "train_tokens_per_second": 12162.12 }, { "epoch": 1.507204416913547, "grad_norm": 0.8767570869419723, "learning_rate": 1.425052556316794e-06, "loss": 0.28953397274017334, "num_input_tokens_seen": 713466992, "step": 22385, "train_runtime": 58663.1566, "train_tokens_per_second": 12162.097 }, { "epoch": 1.507541071909507, "grad_norm": 0.9455128425810174, "learning_rate": 1.4232044853519522e-06, "loss": 0.29953551292419434, "num_input_tokens_seen": 713620984, "step": 22390, "train_runtime": 58675.8147, "train_tokens_per_second": 12162.098 }, { "epoch": 1.5078777269054673, "grad_norm": 0.6681376304839848, "learning_rate": 1.4213574146265708e-06, "loss": 0.28127517700195315, "num_input_tokens_seen": 713774832, "step": 22395, "train_runtime": 58689.1101, "train_tokens_per_second": 12161.964 }, { "epoch": 1.5082143819014275, "grad_norm": 0.835589882630449, "learning_rate": 1.4195113446571752e-06, "loss": 0.3473880529403687, "num_input_tokens_seen": 713932464, "step": 22400, "train_runtime": 58702.5166, "train_tokens_per_second": 12161.872 }, { "epoch": 1.5085510368973876, "grad_norm": 0.7268541500822289, "learning_rate": 1.417666275960018e-06, "loss": 0.2736452579498291, "num_input_tokens_seen": 714095528, "step": 22405, "train_runtime": 58715.5705, "train_tokens_per_second": 12161.945 }, { "epoch": 1.5088876918933476, "grad_norm": 0.7385779066804373, "learning_rate": 1.4158222090510605e-06, "loss": 0.2688118934631348, "num_input_tokens_seen": 714256616, "step": 22410, "train_runtime": 58728.005, "train_tokens_per_second": 12162.113 }, { "epoch": 1.5092243468893078, "grad_norm": 0.7832178835559508, "learning_rate": 1.4139791444459945e-06, "loss": 0.2954734802246094, "num_input_tokens_seen": 714416744, "step": 22415, "train_runtime": 58741.4938, "train_tokens_per_second": 12162.046 }, { "epoch": 1.509561001885268, "grad_norm": 0.939593572603419, "learning_rate": 1.4121370826602254e-06, "loss": 0.28285238742828367, "num_input_tokens_seen": 714572608, "step": 22420, "train_runtime": 58754.9388, "train_tokens_per_second": 12161.916 }, { "epoch": 1.5098976568812281, "grad_norm": 0.8123666936599141, "learning_rate": 1.4102960242088803e-06, "loss": 0.3100184679031372, "num_input_tokens_seen": 714733568, "step": 22425, "train_runtime": 58767.3769, "train_tokens_per_second": 12162.08 }, { "epoch": 1.5102343118771882, "grad_norm": 0.8125567213041536, "learning_rate": 1.4084559696068057e-06, "loss": 0.28680465221405027, "num_input_tokens_seen": 714894728, "step": 22430, "train_runtime": 58780.2707, "train_tokens_per_second": 12162.154 }, { "epoch": 1.5105709668731484, "grad_norm": 0.7331931906633005, "learning_rate": 1.406616919368567e-06, "loss": 0.30208990573883054, "num_input_tokens_seen": 715057648, "step": 22435, "train_runtime": 58793.2715, "train_tokens_per_second": 12162.236 }, { "epoch": 1.5109076218691087, "grad_norm": 0.8375579124249747, "learning_rate": 1.4047788740084474e-06, "loss": 0.28663761615753175, "num_input_tokens_seen": 715218912, "step": 22440, "train_runtime": 58806.2826, "train_tokens_per_second": 12162.287 }, { "epoch": 1.5112442768650687, "grad_norm": 0.7816313221337211, "learning_rate": 1.402941834040452e-06, "loss": 0.28301610946655276, "num_input_tokens_seen": 715380048, "step": 22445, "train_runtime": 58818.7658, "train_tokens_per_second": 12162.446 }, { "epoch": 1.5115809318610287, "grad_norm": 0.7990188400347819, "learning_rate": 1.4011057999783006e-06, "loss": 0.28008761405944826, "num_input_tokens_seen": 715535896, "step": 22450, "train_runtime": 58832.0122, "train_tokens_per_second": 12162.356 }, { "epoch": 1.511917586856989, "grad_norm": 0.7879227757586994, "learning_rate": 1.3992707723354398e-06, "loss": 0.2888712167739868, "num_input_tokens_seen": 715696216, "step": 22455, "train_runtime": 58844.9241, "train_tokens_per_second": 12162.412 }, { "epoch": 1.5122542418529492, "grad_norm": 0.7550642249395687, "learning_rate": 1.397436751625022e-06, "loss": 0.2787339210510254, "num_input_tokens_seen": 715856760, "step": 22460, "train_runtime": 58857.7312, "train_tokens_per_second": 12162.493 }, { "epoch": 1.5125908968489092, "grad_norm": 0.8335895334032981, "learning_rate": 1.3956037383599308e-06, "loss": 0.28026251792907714, "num_input_tokens_seen": 716019240, "step": 22465, "train_runtime": 58870.3975, "train_tokens_per_second": 12162.636 }, { "epoch": 1.5129275518448693, "grad_norm": 0.7381731464961705, "learning_rate": 1.39377173305276e-06, "loss": 0.2853630542755127, "num_input_tokens_seen": 716173976, "step": 22470, "train_runtime": 58883.3115, "train_tokens_per_second": 12162.597 }, { "epoch": 1.5132642068408295, "grad_norm": 0.8496550289629963, "learning_rate": 1.3919407362158254e-06, "loss": 0.31069705486297605, "num_input_tokens_seen": 716337016, "step": 22475, "train_runtime": 58896.1653, "train_tokens_per_second": 12162.711 }, { "epoch": 1.5136008618367898, "grad_norm": 0.8331130134598611, "learning_rate": 1.3901107483611582e-06, "loss": 0.288267707824707, "num_input_tokens_seen": 716490936, "step": 22480, "train_runtime": 58909.4002, "train_tokens_per_second": 12162.591 }, { "epoch": 1.5139375168327498, "grad_norm": 0.7718796041004999, "learning_rate": 1.3882817700005091e-06, "loss": 0.28669161796569825, "num_input_tokens_seen": 716649696, "step": 22485, "train_runtime": 58921.9462, "train_tokens_per_second": 12162.696 }, { "epoch": 1.5142741718287098, "grad_norm": 0.8767547836145987, "learning_rate": 1.3864538016453466e-06, "loss": 0.3005767822265625, "num_input_tokens_seen": 716803584, "step": 22490, "train_runtime": 58935.6282, "train_tokens_per_second": 12162.483 }, { "epoch": 1.51461082682467, "grad_norm": 0.9088718099376718, "learning_rate": 1.384626843806855e-06, "loss": 0.30231337547302245, "num_input_tokens_seen": 716958496, "step": 22495, "train_runtime": 58949.1198, "train_tokens_per_second": 12162.327 }, { "epoch": 1.5149474818206303, "grad_norm": 0.7588852953234072, "learning_rate": 1.3828008969959367e-06, "loss": 0.30952341556549073, "num_input_tokens_seen": 717121360, "step": 22500, "train_runtime": 58961.8928, "train_tokens_per_second": 12162.455 }, { "epoch": 1.5152841368165904, "grad_norm": 0.842371168826284, "learning_rate": 1.3809759617232166e-06, "loss": 0.28448638916015623, "num_input_tokens_seen": 717280976, "step": 22505, "train_runtime": 58975.2562, "train_tokens_per_second": 12162.405 }, { "epoch": 1.5156207918125504, "grad_norm": 0.7704161273473085, "learning_rate": 1.3791520384990247e-06, "loss": 0.2891338586807251, "num_input_tokens_seen": 717440384, "step": 22510, "train_runtime": 58988.9198, "train_tokens_per_second": 12162.291 }, { "epoch": 1.5159574468085106, "grad_norm": 0.724030706598745, "learning_rate": 1.3773291278334216e-06, "loss": 0.28957176208496094, "num_input_tokens_seen": 717600128, "step": 22515, "train_runtime": 59001.6464, "train_tokens_per_second": 12162.375 }, { "epoch": 1.5162941018044709, "grad_norm": 0.7647257817007969, "learning_rate": 1.3755072302361754e-06, "loss": 0.3053462505340576, "num_input_tokens_seen": 717763968, "step": 22520, "train_runtime": 59014.0707, "train_tokens_per_second": 12162.59 }, { "epoch": 1.516630756800431, "grad_norm": 0.7898838442855936, "learning_rate": 1.3736863462167749e-06, "loss": 0.28431057929992676, "num_input_tokens_seen": 717919152, "step": 22525, "train_runtime": 59027.3597, "train_tokens_per_second": 12162.481 }, { "epoch": 1.516967411796391, "grad_norm": 0.8192890951291476, "learning_rate": 1.3718664762844242e-06, "loss": 0.2807717561721802, "num_input_tokens_seen": 718078520, "step": 22530, "train_runtime": 59040.5826, "train_tokens_per_second": 12162.457 }, { "epoch": 1.5173040667923512, "grad_norm": 0.8158887654473395, "learning_rate": 1.370047620948044e-06, "loss": 0.29694461822509766, "num_input_tokens_seen": 718240608, "step": 22535, "train_runtime": 59053.1726, "train_tokens_per_second": 12162.608 }, { "epoch": 1.5176407217883114, "grad_norm": 0.7934396063151912, "learning_rate": 1.368229780716272e-06, "loss": 0.3102105617523193, "num_input_tokens_seen": 718397904, "step": 22540, "train_runtime": 59066.2801, "train_tokens_per_second": 12162.572 }, { "epoch": 1.5179773767842715, "grad_norm": 0.910528152197629, "learning_rate": 1.3664129560974604e-06, "loss": 0.2921405553817749, "num_input_tokens_seen": 718554992, "step": 22545, "train_runtime": 59079.3707, "train_tokens_per_second": 12162.536 }, { "epoch": 1.5183140317802315, "grad_norm": 0.8860137257012383, "learning_rate": 1.3645971475996777e-06, "loss": 0.2833313226699829, "num_input_tokens_seen": 718710184, "step": 22550, "train_runtime": 59092.7031, "train_tokens_per_second": 12162.418 }, { "epoch": 1.5186506867761917, "grad_norm": 0.8524522876712192, "learning_rate": 1.3627823557307135e-06, "loss": 0.2982018947601318, "num_input_tokens_seen": 718873376, "step": 22555, "train_runtime": 59105.5968, "train_tokens_per_second": 12162.526 }, { "epoch": 1.518987341772152, "grad_norm": 0.688286493113632, "learning_rate": 1.3609685809980616e-06, "loss": 0.30071923732757566, "num_input_tokens_seen": 719036056, "step": 22560, "train_runtime": 59118.2963, "train_tokens_per_second": 12162.665 }, { "epoch": 1.519323996768112, "grad_norm": 0.7973915683926959, "learning_rate": 1.3591558239089443e-06, "loss": 0.28338260650634767, "num_input_tokens_seen": 719198320, "step": 22565, "train_runtime": 59131.5915, "train_tokens_per_second": 12162.675 }, { "epoch": 1.519660651764072, "grad_norm": 0.8626309267824943, "learning_rate": 1.3573440849702902e-06, "loss": 0.3180524826049805, "num_input_tokens_seen": 719362160, "step": 22570, "train_runtime": 59144.0336, "train_tokens_per_second": 12162.886 }, { "epoch": 1.5199973067600323, "grad_norm": 0.8471297572397387, "learning_rate": 1.3555333646887476e-06, "loss": 0.3034017086029053, "num_input_tokens_seen": 719521640, "step": 22575, "train_runtime": 59156.7944, "train_tokens_per_second": 12162.959 }, { "epoch": 1.5203339617559926, "grad_norm": 0.7633412615725172, "learning_rate": 1.3537236635706779e-06, "loss": 0.28931436538696287, "num_input_tokens_seen": 719683928, "step": 22580, "train_runtime": 59169.4205, "train_tokens_per_second": 12163.106 }, { "epoch": 1.5206706167519526, "grad_norm": 0.8109797326643368, "learning_rate": 1.351914982122159e-06, "loss": 0.2645892143249512, "num_input_tokens_seen": 719846232, "step": 22585, "train_runtime": 59181.9802, "train_tokens_per_second": 12163.267 }, { "epoch": 1.5210072717479126, "grad_norm": 0.811607137207679, "learning_rate": 1.3501073208489823e-06, "loss": 0.2924932956695557, "num_input_tokens_seen": 720004384, "step": 22590, "train_runtime": 59195.6953, "train_tokens_per_second": 12163.121 }, { "epoch": 1.5213439267438729, "grad_norm": 0.8175464829852251, "learning_rate": 1.3483006802566546e-06, "loss": 0.3018640995025635, "num_input_tokens_seen": 720164416, "step": 22595, "train_runtime": 59208.4573, "train_tokens_per_second": 12163.202 }, { "epoch": 1.5216805817398331, "grad_norm": 0.875511541718078, "learning_rate": 1.3464950608503957e-06, "loss": 0.3094246625900269, "num_input_tokens_seen": 720323688, "step": 22600, "train_runtime": 59221.902, "train_tokens_per_second": 12163.13 }, { "epoch": 1.5220172367357931, "grad_norm": 0.8602197918749629, "learning_rate": 1.344690463135146e-06, "loss": 0.30721702575683596, "num_input_tokens_seen": 720485216, "step": 22605, "train_runtime": 59235.6512, "train_tokens_per_second": 12163.034 }, { "epoch": 1.5223538917317532, "grad_norm": 0.8021495233525912, "learning_rate": 1.3428868876155493e-06, "loss": 0.3159857988357544, "num_input_tokens_seen": 720635112, "step": 22610, "train_runtime": 59248.4272, "train_tokens_per_second": 12162.941 }, { "epoch": 1.5226905467277134, "grad_norm": 0.6938520051260284, "learning_rate": 1.3410843347959745e-06, "loss": 0.2776130437850952, "num_input_tokens_seen": 720792152, "step": 22615, "train_runtime": 59261.2745, "train_tokens_per_second": 12162.954 }, { "epoch": 1.5230272017236737, "grad_norm": 0.7495250598648787, "learning_rate": 1.3392828051804979e-06, "loss": 0.3007868766784668, "num_input_tokens_seen": 720954712, "step": 22620, "train_runtime": 59273.8851, "train_tokens_per_second": 12163.109 }, { "epoch": 1.5233638567196337, "grad_norm": 0.735830102701975, "learning_rate": 1.3374822992729114e-06, "loss": 0.3064920902252197, "num_input_tokens_seen": 721117416, "step": 22625, "train_runtime": 59286.6069, "train_tokens_per_second": 12163.243 }, { "epoch": 1.5237005117155937, "grad_norm": 0.7985835634234847, "learning_rate": 1.3356828175767212e-06, "loss": 0.2888817548751831, "num_input_tokens_seen": 721275280, "step": 22630, "train_runtime": 59300.425, "train_tokens_per_second": 12163.071 }, { "epoch": 1.524037166711554, "grad_norm": 0.739255684162013, "learning_rate": 1.3338843605951462e-06, "loss": 0.2747783899307251, "num_input_tokens_seen": 721438280, "step": 22635, "train_runtime": 59313.931, "train_tokens_per_second": 12163.05 }, { "epoch": 1.5243738217075142, "grad_norm": 0.7797345871202387, "learning_rate": 1.33208692883112e-06, "loss": 0.2792922019958496, "num_input_tokens_seen": 721602120, "step": 22640, "train_runtime": 59326.3537, "train_tokens_per_second": 12163.264 }, { "epoch": 1.5247104767034743, "grad_norm": 0.6916888648656614, "learning_rate": 1.3302905227872876e-06, "loss": 0.2778587818145752, "num_input_tokens_seen": 721765688, "step": 22645, "train_runtime": 59339.3711, "train_tokens_per_second": 12163.353 }, { "epoch": 1.5250471316994343, "grad_norm": 0.7997440011215657, "learning_rate": 1.328495142966007e-06, "loss": 0.29504852294921874, "num_input_tokens_seen": 721923184, "step": 22650, "train_runtime": 59352.963, "train_tokens_per_second": 12163.221 }, { "epoch": 1.5253837866953945, "grad_norm": 0.768358857052409, "learning_rate": 1.3267007898693552e-06, "loss": 0.2853509187698364, "num_input_tokens_seen": 722087024, "step": 22655, "train_runtime": 59365.4077, "train_tokens_per_second": 12163.431 }, { "epoch": 1.5257204416913548, "grad_norm": 0.8019756286141467, "learning_rate": 1.324907463999111e-06, "loss": 0.30272064208984373, "num_input_tokens_seen": 722249704, "step": 22660, "train_runtime": 59378.111, "train_tokens_per_second": 12163.568 }, { "epoch": 1.5260570966873148, "grad_norm": 0.891640594431585, "learning_rate": 1.3231151658567776e-06, "loss": 0.30310521125793455, "num_input_tokens_seen": 722403048, "step": 22665, "train_runtime": 59391.1817, "train_tokens_per_second": 12163.473 }, { "epoch": 1.5263937516832748, "grad_norm": 0.8837917343262014, "learning_rate": 1.321323895943563e-06, "loss": 0.3033485174179077, "num_input_tokens_seen": 722564720, "step": 22670, "train_runtime": 59403.7109, "train_tokens_per_second": 12163.629 }, { "epoch": 1.526730406679235, "grad_norm": 0.8414900977242138, "learning_rate": 1.3195336547603905e-06, "loss": 0.3113853454589844, "num_input_tokens_seen": 722725168, "step": 22675, "train_runtime": 59416.5372, "train_tokens_per_second": 12163.704 }, { "epoch": 1.5270670616751953, "grad_norm": 0.773084013538252, "learning_rate": 1.3177444428078951e-06, "loss": 0.2729278802871704, "num_input_tokens_seen": 722880848, "step": 22680, "train_runtime": 59429.602, "train_tokens_per_second": 12163.649 }, { "epoch": 1.5274037166711554, "grad_norm": 0.8713948220580527, "learning_rate": 1.3159562605864245e-06, "loss": 0.2988485336303711, "num_input_tokens_seen": 723042696, "step": 22685, "train_runtime": 59442.6691, "train_tokens_per_second": 12163.698 }, { "epoch": 1.5277403716671154, "grad_norm": 0.9670116580608046, "learning_rate": 1.3141691085960385e-06, "loss": 0.29040334224700926, "num_input_tokens_seen": 723206536, "step": 22690, "train_runtime": 59455.1127, "train_tokens_per_second": 12163.908 }, { "epoch": 1.5280770266630757, "grad_norm": 0.7650667220008859, "learning_rate": 1.3123829873365073e-06, "loss": 0.28452630043029786, "num_input_tokens_seen": 723364832, "step": 22695, "train_runtime": 59467.8747, "train_tokens_per_second": 12163.96 }, { "epoch": 1.528413681659036, "grad_norm": 0.767114090260498, "learning_rate": 1.3105978973073136e-06, "loss": 0.2738353729248047, "num_input_tokens_seen": 723526200, "step": 22700, "train_runtime": 59481.4943, "train_tokens_per_second": 12163.887 }, { "epoch": 1.528750336654996, "grad_norm": 0.7631789164878374, "learning_rate": 1.3088138390076565e-06, "loss": 0.29928605556488036, "num_input_tokens_seen": 723683688, "step": 22705, "train_runtime": 59493.9517, "train_tokens_per_second": 12163.988 }, { "epoch": 1.529086991650956, "grad_norm": 0.7925612796007708, "learning_rate": 1.3070308129364357e-06, "loss": 0.27777714729309083, "num_input_tokens_seen": 723844872, "step": 22710, "train_runtime": 59507.6674, "train_tokens_per_second": 12163.893 }, { "epoch": 1.5294236466469162, "grad_norm": 0.7922180074886799, "learning_rate": 1.3052488195922736e-06, "loss": 0.28077311515808107, "num_input_tokens_seen": 723999992, "step": 22715, "train_runtime": 59520.6383, "train_tokens_per_second": 12163.848 }, { "epoch": 1.5297603016428765, "grad_norm": 0.8195123139703518, "learning_rate": 1.3034678594734972e-06, "loss": 0.27829957008361816, "num_input_tokens_seen": 724161512, "step": 22720, "train_runtime": 59533.7273, "train_tokens_per_second": 12163.887 }, { "epoch": 1.5300969566388365, "grad_norm": 0.8919690102270895, "learning_rate": 1.3016879330781468e-06, "loss": 0.30177719593048097, "num_input_tokens_seen": 724316960, "step": 22725, "train_runtime": 59546.8936, "train_tokens_per_second": 12163.808 }, { "epoch": 1.5304336116347965, "grad_norm": 0.8242368615781638, "learning_rate": 1.2999090409039728e-06, "loss": 0.31191267967224123, "num_input_tokens_seen": 724480792, "step": 22730, "train_runtime": 59559.9919, "train_tokens_per_second": 12163.883 }, { "epoch": 1.5307702666307568, "grad_norm": 0.8314019220172901, "learning_rate": 1.2981311834484367e-06, "loss": 0.30935657024383545, "num_input_tokens_seen": 724641440, "step": 22735, "train_runtime": 59572.7804, "train_tokens_per_second": 12163.969 }, { "epoch": 1.531106921626717, "grad_norm": 0.7787195498991406, "learning_rate": 1.296354361208711e-06, "loss": 0.2740952491760254, "num_input_tokens_seen": 724803904, "step": 22740, "train_runtime": 59585.7214, "train_tokens_per_second": 12164.054 }, { "epoch": 1.531443576622677, "grad_norm": 0.8618997682714752, "learning_rate": 1.294578574681678e-06, "loss": 0.31820383071899416, "num_input_tokens_seen": 724959232, "step": 22745, "train_runtime": 59598.9377, "train_tokens_per_second": 12163.962 }, { "epoch": 1.531780231618637, "grad_norm": 0.8591799251237343, "learning_rate": 1.292803824363929e-06, "loss": 0.2783145189285278, "num_input_tokens_seen": 725118048, "step": 22750, "train_runtime": 59611.4971, "train_tokens_per_second": 12164.064 }, { "epoch": 1.5321168866145973, "grad_norm": 0.86335692065507, "learning_rate": 1.2910301107517726e-06, "loss": 0.31418445110321047, "num_input_tokens_seen": 725274520, "step": 22755, "train_runtime": 59624.0029, "train_tokens_per_second": 12164.137 }, { "epoch": 1.5324535416105576, "grad_norm": 0.869848542243531, "learning_rate": 1.2892574343412156e-06, "loss": 0.3068138360977173, "num_input_tokens_seen": 725430432, "step": 22760, "train_runtime": 59636.9236, "train_tokens_per_second": 12164.116 }, { "epoch": 1.5327901966065176, "grad_norm": 0.8262261087203683, "learning_rate": 1.2874857956279858e-06, "loss": 0.2983036994934082, "num_input_tokens_seen": 725589384, "step": 22765, "train_runtime": 59649.807, "train_tokens_per_second": 12164.153 }, { "epoch": 1.5331268516024776, "grad_norm": 0.8332741417095026, "learning_rate": 1.2857151951075147e-06, "loss": 0.29120535850524903, "num_input_tokens_seen": 725751832, "step": 22770, "train_runtime": 59663.129, "train_tokens_per_second": 12164.16 }, { "epoch": 1.5334635065984379, "grad_norm": 0.7566676849727013, "learning_rate": 1.2839456332749456e-06, "loss": 0.28792848587036135, "num_input_tokens_seen": 725911616, "step": 22775, "train_runtime": 59676.7401, "train_tokens_per_second": 12164.063 }, { "epoch": 1.5338001615943981, "grad_norm": 0.8243242187685503, "learning_rate": 1.2821771106251308e-06, "loss": 0.2932237148284912, "num_input_tokens_seen": 726070456, "step": 22780, "train_runtime": 59690.1077, "train_tokens_per_second": 12164.0 }, { "epoch": 1.5341368165903582, "grad_norm": 0.7456731965831106, "learning_rate": 1.2804096276526312e-06, "loss": 0.270353889465332, "num_input_tokens_seen": 726224976, "step": 22785, "train_runtime": 59702.6365, "train_tokens_per_second": 12164.035 }, { "epoch": 1.5344734715863182, "grad_norm": 0.9139920045965834, "learning_rate": 1.2786431848517184e-06, "loss": 0.2909053087234497, "num_input_tokens_seen": 726376784, "step": 22790, "train_runtime": 59715.4212, "train_tokens_per_second": 12163.973 }, { "epoch": 1.5348101265822784, "grad_norm": 0.9023343652822307, "learning_rate": 1.2768777827163725e-06, "loss": 0.3015217065811157, "num_input_tokens_seen": 726537256, "step": 22795, "train_runtime": 59728.4525, "train_tokens_per_second": 12164.006 }, { "epoch": 1.5351467815782387, "grad_norm": 0.8546881227187612, "learning_rate": 1.2751134217402811e-06, "loss": 0.3047091722488403, "num_input_tokens_seen": 726692936, "step": 22800, "train_runtime": 59742.7543, "train_tokens_per_second": 12163.7 }, { "epoch": 1.5354834365741987, "grad_norm": 0.6727762442555562, "learning_rate": 1.2733501024168465e-06, "loss": 0.2649812698364258, "num_input_tokens_seen": 726850352, "step": 22805, "train_runtime": 59755.2291, "train_tokens_per_second": 12163.795 }, { "epoch": 1.5358200915701588, "grad_norm": 0.8998478069133383, "learning_rate": 1.2715878252391695e-06, "loss": 0.301397442817688, "num_input_tokens_seen": 727005944, "step": 22810, "train_runtime": 59767.9732, "train_tokens_per_second": 12163.805 }, { "epoch": 1.536156746566119, "grad_norm": 0.7692228679204597, "learning_rate": 1.269826590700069e-06, "loss": 0.29273266792297364, "num_input_tokens_seen": 727166912, "step": 22815, "train_runtime": 59781.03, "train_tokens_per_second": 12163.84 }, { "epoch": 1.5364934015620793, "grad_norm": 1.195924350138272, "learning_rate": 1.2680663992920684e-06, "loss": 0.2927964210510254, "num_input_tokens_seen": 727328280, "step": 22820, "train_runtime": 59793.9811, "train_tokens_per_second": 12163.905 }, { "epoch": 1.5368300565580393, "grad_norm": 0.8623250586002384, "learning_rate": 1.2663072515073988e-06, "loss": 0.302318811416626, "num_input_tokens_seen": 727484264, "step": 22825, "train_runtime": 59807.1352, "train_tokens_per_second": 12163.837 }, { "epoch": 1.5371667115539993, "grad_norm": 0.7803982946842419, "learning_rate": 1.2645491478380002e-06, "loss": 0.29267148971557616, "num_input_tokens_seen": 727641632, "step": 22830, "train_runtime": 59820.3704, "train_tokens_per_second": 12163.777 }, { "epoch": 1.5375033665499596, "grad_norm": 0.9091394963001928, "learning_rate": 1.2627920887755212e-06, "loss": 0.2972847938537598, "num_input_tokens_seen": 727797728, "step": 22835, "train_runtime": 59833.9065, "train_tokens_per_second": 12163.634 }, { "epoch": 1.5378400215459198, "grad_norm": 0.7623492031549824, "learning_rate": 1.261036074811317e-06, "loss": 0.31333317756652834, "num_input_tokens_seen": 727958440, "step": 22840, "train_runtime": 59847.3437, "train_tokens_per_second": 12163.588 }, { "epoch": 1.5381766765418798, "grad_norm": 0.8041356773921878, "learning_rate": 1.2592811064364524e-06, "loss": 0.2968874931335449, "num_input_tokens_seen": 728118112, "step": 22845, "train_runtime": 59859.7767, "train_tokens_per_second": 12163.729 }, { "epoch": 1.5385133315378399, "grad_norm": 0.8883060070663998, "learning_rate": 1.2575271841416963e-06, "loss": 0.3248203992843628, "num_input_tokens_seen": 728266168, "step": 22850, "train_runtime": 59873.4152, "train_tokens_per_second": 12163.431 }, { "epoch": 1.5388499865338001, "grad_norm": 0.8347727872277496, "learning_rate": 1.2557743084175327e-06, "loss": 0.27903060913085936, "num_input_tokens_seen": 728426208, "step": 22855, "train_runtime": 59887.0464, "train_tokens_per_second": 12163.335 }, { "epoch": 1.5391866415297604, "grad_norm": 0.8186428263176526, "learning_rate": 1.254022479754141e-06, "loss": 0.28824586868286134, "num_input_tokens_seen": 728586456, "step": 22860, "train_runtime": 59900.3982, "train_tokens_per_second": 12163.299 }, { "epoch": 1.5395232965257204, "grad_norm": 0.8318001867188793, "learning_rate": 1.252271698641419e-06, "loss": 0.292581844329834, "num_input_tokens_seen": 728745144, "step": 22865, "train_runtime": 59912.9646, "train_tokens_per_second": 12163.397 }, { "epoch": 1.5398599515216804, "grad_norm": 0.7494089898058677, "learning_rate": 1.2505219655689659e-06, "loss": 0.29260101318359377, "num_input_tokens_seen": 728907088, "step": 22870, "train_runtime": 59925.5571, "train_tokens_per_second": 12163.543 }, { "epoch": 1.5401966065176407, "grad_norm": 0.7680761672967052, "learning_rate": 1.2487732810260877e-06, "loss": 0.291391921043396, "num_input_tokens_seen": 729066992, "step": 22875, "train_runtime": 59939.2737, "train_tokens_per_second": 12163.427 }, { "epoch": 1.540533261513601, "grad_norm": 0.7518227523846464, "learning_rate": 1.2470256455018027e-06, "loss": 0.2672252655029297, "num_input_tokens_seen": 729229976, "step": 22880, "train_runtime": 59951.7134, "train_tokens_per_second": 12163.622 }, { "epoch": 1.540869916509561, "grad_norm": 0.8190723467315617, "learning_rate": 1.2452790594848257e-06, "loss": 0.26885218620300294, "num_input_tokens_seen": 729393016, "step": 22885, "train_runtime": 59964.5586, "train_tokens_per_second": 12163.735 }, { "epoch": 1.541206571505521, "grad_norm": 0.9195826711343672, "learning_rate": 1.2435335234635892e-06, "loss": 0.31464276313781736, "num_input_tokens_seen": 729549096, "step": 22890, "train_runtime": 59977.2032, "train_tokens_per_second": 12163.773 }, { "epoch": 1.5415432265014812, "grad_norm": 0.7666475754739664, "learning_rate": 1.2417890379262221e-06, "loss": 0.29359161853790283, "num_input_tokens_seen": 729711384, "step": 22895, "train_runtime": 59990.6577, "train_tokens_per_second": 12163.75 }, { "epoch": 1.5418798814974415, "grad_norm": 0.8284494431771039, "learning_rate": 1.2400456033605672e-06, "loss": 0.26127352714538576, "num_input_tokens_seen": 729870440, "step": 22900, "train_runtime": 60004.3696, "train_tokens_per_second": 12163.621 }, { "epoch": 1.5422165364934015, "grad_norm": 0.7649351133065323, "learning_rate": 1.2383032202541706e-06, "loss": 0.31118364334106446, "num_input_tokens_seen": 730026080, "step": 22905, "train_runtime": 60017.2825, "train_tokens_per_second": 12163.598 }, { "epoch": 1.5425531914893615, "grad_norm": 0.7822003674051046, "learning_rate": 1.2365618890942827e-06, "loss": 0.3109957933425903, "num_input_tokens_seen": 730183000, "step": 22910, "train_runtime": 60029.7251, "train_tokens_per_second": 12163.691 }, { "epoch": 1.5428898464853218, "grad_norm": 0.8923914012903582, "learning_rate": 1.2348216103678618e-06, "loss": 0.32297348976135254, "num_input_tokens_seen": 730341512, "step": 22915, "train_runtime": 60042.2927, "train_tokens_per_second": 12163.785 }, { "epoch": 1.543226501481282, "grad_norm": 0.8574399113989104, "learning_rate": 1.2330823845615713e-06, "loss": 0.2824406623840332, "num_input_tokens_seen": 730497024, "step": 22920, "train_runtime": 60056.5156, "train_tokens_per_second": 12163.493 }, { "epoch": 1.543563156477242, "grad_norm": 0.7975582089846489, "learning_rate": 1.2313442121617785e-06, "loss": 0.296402645111084, "num_input_tokens_seen": 730659000, "step": 22925, "train_runtime": 60069.1072, "train_tokens_per_second": 12163.64 }, { "epoch": 1.543899811473202, "grad_norm": 0.8426178343566919, "learning_rate": 1.229607093654563e-06, "loss": 0.2669986248016357, "num_input_tokens_seen": 730818272, "step": 22930, "train_runtime": 60082.0052, "train_tokens_per_second": 12163.68 }, { "epoch": 1.5442364664691623, "grad_norm": 0.7771660924237656, "learning_rate": 1.2278710295256974e-06, "loss": 0.30116374492645265, "num_input_tokens_seen": 730980776, "step": 22935, "train_runtime": 60094.697, "train_tokens_per_second": 12163.815 }, { "epoch": 1.5445731214651226, "grad_norm": 0.780681085063772, "learning_rate": 1.2261360202606725e-06, "loss": 0.27906479835510256, "num_input_tokens_seen": 731143056, "step": 22940, "train_runtime": 60107.3269, "train_tokens_per_second": 12163.959 }, { "epoch": 1.5449097764610826, "grad_norm": 0.7816108151536917, "learning_rate": 1.2244020663446731e-06, "loss": 0.2986234903335571, "num_input_tokens_seen": 731302424, "step": 22945, "train_runtime": 60120.92, "train_tokens_per_second": 12163.86 }, { "epoch": 1.5452464314570427, "grad_norm": 0.9253823645201016, "learning_rate": 1.222669168262598e-06, "loss": 0.29760174751281737, "num_input_tokens_seen": 731465312, "step": 22950, "train_runtime": 60135.0003, "train_tokens_per_second": 12163.72 }, { "epoch": 1.545583086453003, "grad_norm": 0.7108731563129567, "learning_rate": 1.2209373264990448e-06, "loss": 0.27967774868011475, "num_input_tokens_seen": 731619840, "step": 22955, "train_runtime": 60147.5105, "train_tokens_per_second": 12163.759 }, { "epoch": 1.5459197414489632, "grad_norm": 0.866179924726618, "learning_rate": 1.2192065415383176e-06, "loss": 0.29625301361083983, "num_input_tokens_seen": 731780232, "step": 22960, "train_runtime": 60161.0845, "train_tokens_per_second": 12163.681 }, { "epoch": 1.5462563964449232, "grad_norm": 0.7861738486181785, "learning_rate": 1.217476813864425e-06, "loss": 0.30833067893981936, "num_input_tokens_seen": 731942872, "step": 22965, "train_runtime": 60173.7894, "train_tokens_per_second": 12163.815 }, { "epoch": 1.5465930514408834, "grad_norm": 0.7681230832599563, "learning_rate": 1.2157481439610801e-06, "loss": 0.2545867204666138, "num_input_tokens_seen": 732101920, "step": 22970, "train_runtime": 60187.0759, "train_tokens_per_second": 12163.773 }, { "epoch": 1.5469297064368437, "grad_norm": 0.9161972868847953, "learning_rate": 1.2140205323116976e-06, "loss": 0.30569305419921877, "num_input_tokens_seen": 732253920, "step": 22975, "train_runtime": 60200.428, "train_tokens_per_second": 12163.6 }, { "epoch": 1.5472663614328037, "grad_norm": 0.7399102515239029, "learning_rate": 1.2122939793994043e-06, "loss": 0.2779374599456787, "num_input_tokens_seen": 732412808, "step": 22980, "train_runtime": 60213.7169, "train_tokens_per_second": 12163.554 }, { "epoch": 1.5476030164287637, "grad_norm": 0.7216817617474057, "learning_rate": 1.2105684857070182e-06, "loss": 0.27604074478149415, "num_input_tokens_seen": 732575168, "step": 22985, "train_runtime": 60227.0392, "train_tokens_per_second": 12163.559 }, { "epoch": 1.547939671424724, "grad_norm": 0.8228090879319583, "learning_rate": 1.2088440517170729e-06, "loss": 0.2893498420715332, "num_input_tokens_seen": 732735504, "step": 22990, "train_runtime": 60239.4829, "train_tokens_per_second": 12163.708 }, { "epoch": 1.5482763264206842, "grad_norm": 0.8390520563755358, "learning_rate": 1.2071206779117994e-06, "loss": 0.28883676528930663, "num_input_tokens_seen": 732895888, "step": 22995, "train_runtime": 60252.8071, "train_tokens_per_second": 12163.68 }, { "epoch": 1.5486129814166443, "grad_norm": 0.9265247946455487, "learning_rate": 1.2053983647731337e-06, "loss": 0.3107041597366333, "num_input_tokens_seen": 733057520, "step": 23000, "train_runtime": 60265.3774, "train_tokens_per_second": 12163.825 }, { "epoch": 1.5489496364126043, "grad_norm": 0.7464637701076479, "learning_rate": 1.2036771127827152e-06, "loss": 0.286514139175415, "num_input_tokens_seen": 733213032, "step": 23005, "train_runtime": 60279.2163, "train_tokens_per_second": 12163.613 }, { "epoch": 1.5492862914085646, "grad_norm": 0.8158854773008193, "learning_rate": 1.2019569224218869e-06, "loss": 0.32193081378936766, "num_input_tokens_seen": 733376872, "step": 23010, "train_runtime": 60291.67, "train_tokens_per_second": 12163.818 }, { "epoch": 1.5496229464045248, "grad_norm": 0.7151331333285766, "learning_rate": 1.2002377941716936e-06, "loss": 0.26620028018951414, "num_input_tokens_seen": 733533208, "step": 23015, "train_runtime": 60305.1135, "train_tokens_per_second": 12163.698 }, { "epoch": 1.5499596014004848, "grad_norm": 1.0550421241107877, "learning_rate": 1.1985197285128853e-06, "loss": 0.30360434055328367, "num_input_tokens_seen": 733691768, "step": 23020, "train_runtime": 60318.2124, "train_tokens_per_second": 12163.686 }, { "epoch": 1.5502962563964449, "grad_norm": 0.7890582939753223, "learning_rate": 1.1968027259259107e-06, "loss": 0.2946274757385254, "num_input_tokens_seen": 733848368, "step": 23025, "train_runtime": 60331.8642, "train_tokens_per_second": 12163.529 }, { "epoch": 1.5506329113924051, "grad_norm": 0.8214821102297931, "learning_rate": 1.1950867868909293e-06, "loss": 0.26646084785461427, "num_input_tokens_seen": 734005896, "step": 23030, "train_runtime": 60345.6953, "train_tokens_per_second": 12163.351 }, { "epoch": 1.5509695663883654, "grad_norm": 0.8902687085608858, "learning_rate": 1.1933719118877923e-06, "loss": 0.30422391891479494, "num_input_tokens_seen": 734169736, "step": 23035, "train_runtime": 60358.1404, "train_tokens_per_second": 12163.558 }, { "epoch": 1.5513062213843254, "grad_norm": 1.3049478762340514, "learning_rate": 1.1916581013960632e-06, "loss": 0.25280778408050536, "num_input_tokens_seen": 734333576, "step": 23040, "train_runtime": 60370.5949, "train_tokens_per_second": 12163.762 }, { "epoch": 1.5516428763802854, "grad_norm": 0.8673003581992507, "learning_rate": 1.189945355895002e-06, "loss": 0.3032198667526245, "num_input_tokens_seen": 734494392, "step": 23045, "train_runtime": 60384.1006, "train_tokens_per_second": 12163.705 }, { "epoch": 1.5519795313762457, "grad_norm": 0.8543350321352065, "learning_rate": 1.1882336758635727e-06, "loss": 0.2696817398071289, "num_input_tokens_seen": 734658232, "step": 23050, "train_runtime": 60397.1422, "train_tokens_per_second": 12163.791 }, { "epoch": 1.552316186372206, "grad_norm": 0.9633308137903916, "learning_rate": 1.1865230617804412e-06, "loss": 0.3258500099182129, "num_input_tokens_seen": 734817896, "step": 23055, "train_runtime": 60409.5751, "train_tokens_per_second": 12163.931 }, { "epoch": 1.552652841368166, "grad_norm": 0.8221039646728788, "learning_rate": 1.1848135141239753e-06, "loss": 0.2778597116470337, "num_input_tokens_seen": 734977336, "step": 23060, "train_runtime": 60423.1955, "train_tokens_per_second": 12163.828 }, { "epoch": 1.552989496364126, "grad_norm": 0.8328168017044412, "learning_rate": 1.1831050333722438e-06, "loss": 0.3028880596160889, "num_input_tokens_seen": 735132912, "step": 23065, "train_runtime": 60436.2328, "train_tokens_per_second": 12163.778 }, { "epoch": 1.5533261513600862, "grad_norm": 0.7513946366880544, "learning_rate": 1.1813976200030191e-06, "loss": 0.27589375972747804, "num_input_tokens_seen": 735294800, "step": 23070, "train_runtime": 60450.4025, "train_tokens_per_second": 12163.605 }, { "epoch": 1.5536628063560465, "grad_norm": 0.7434952413858029, "learning_rate": 1.1796912744937717e-06, "loss": 0.2990890026092529, "num_input_tokens_seen": 735456896, "step": 23075, "train_runtime": 60463.6552, "train_tokens_per_second": 12163.62 }, { "epoch": 1.5539994613520065, "grad_norm": 0.7934732318439129, "learning_rate": 1.1779859973216802e-06, "loss": 0.29690263271331785, "num_input_tokens_seen": 735615128, "step": 23080, "train_runtime": 60477.2113, "train_tokens_per_second": 12163.509 }, { "epoch": 1.5543361163479665, "grad_norm": 0.8971167542616845, "learning_rate": 1.1762817889636142e-06, "loss": 0.29803128242492677, "num_input_tokens_seen": 735769640, "step": 23085, "train_runtime": 60491.1857, "train_tokens_per_second": 12163.254 }, { "epoch": 1.5546727713439268, "grad_norm": 0.8379450786254626, "learning_rate": 1.1745786498961542e-06, "loss": 0.3054941654205322, "num_input_tokens_seen": 735933480, "step": 23090, "train_runtime": 60503.9252, "train_tokens_per_second": 12163.401 }, { "epoch": 1.555009426339887, "grad_norm": 0.7856850757944269, "learning_rate": 1.1728765805955766e-06, "loss": 0.2800941467285156, "num_input_tokens_seen": 736091104, "step": 23095, "train_runtime": 60517.7252, "train_tokens_per_second": 12163.232 }, { "epoch": 1.555346081335847, "grad_norm": 0.9265194089950859, "learning_rate": 1.1711755815378595e-06, "loss": 0.3234413623809814, "num_input_tokens_seen": 736248368, "step": 23100, "train_runtime": 60531.3478, "train_tokens_per_second": 12163.092 }, { "epoch": 1.555682736331807, "grad_norm": 0.7847198133517144, "learning_rate": 1.1694756531986818e-06, "loss": 0.2967512130737305, "num_input_tokens_seen": 736412208, "step": 23105, "train_runtime": 60543.7789, "train_tokens_per_second": 12163.301 }, { "epoch": 1.5560193913277673, "grad_norm": 0.7875121322793062, "learning_rate": 1.1677767960534232e-06, "loss": 0.3001002073287964, "num_input_tokens_seen": 736568456, "step": 23110, "train_runtime": 60556.6453, "train_tokens_per_second": 12163.297 }, { "epoch": 1.5563560463237276, "grad_norm": 0.7759507921470586, "learning_rate": 1.166079010577163e-06, "loss": 0.3113714694976807, "num_input_tokens_seen": 736728152, "step": 23115, "train_runtime": 60569.8701, "train_tokens_per_second": 12163.278 }, { "epoch": 1.5566927013196876, "grad_norm": 0.8735265527346818, "learning_rate": 1.1643822972446823e-06, "loss": 0.3008978605270386, "num_input_tokens_seen": 736888448, "step": 23120, "train_runtime": 60582.5995, "train_tokens_per_second": 12163.368 }, { "epoch": 1.5570293563156477, "grad_norm": 0.788389552214716, "learning_rate": 1.1626866565304594e-06, "loss": 0.294887113571167, "num_input_tokens_seen": 737051608, "step": 23125, "train_runtime": 60595.0391, "train_tokens_per_second": 12163.564 }, { "epoch": 1.557366011311608, "grad_norm": 0.7713080581521571, "learning_rate": 1.16099208890868e-06, "loss": 0.288470196723938, "num_input_tokens_seen": 737210136, "step": 23130, "train_runtime": 60608.1437, "train_tokens_per_second": 12163.549 }, { "epoch": 1.5577026663075682, "grad_norm": 2.148170817130903, "learning_rate": 1.1592985948532187e-06, "loss": 0.28723735809326173, "num_input_tokens_seen": 737367240, "step": 23135, "train_runtime": 60621.7966, "train_tokens_per_second": 12163.401 }, { "epoch": 1.5580393213035282, "grad_norm": 0.7937948471800973, "learning_rate": 1.1576061748376594e-06, "loss": 0.2882655620574951, "num_input_tokens_seen": 737523096, "step": 23140, "train_runtime": 60634.3628, "train_tokens_per_second": 12163.451 }, { "epoch": 1.5583759762994882, "grad_norm": 0.8047898549966961, "learning_rate": 1.1559148293352805e-06, "loss": 0.2820580959320068, "num_input_tokens_seen": 737682616, "step": 23145, "train_runtime": 60647.0877, "train_tokens_per_second": 12163.529 }, { "epoch": 1.5587126312954485, "grad_norm": 0.7668356841882308, "learning_rate": 1.154224558819062e-06, "loss": 0.2904337406158447, "num_input_tokens_seen": 737842976, "step": 23150, "train_runtime": 60659.9939, "train_tokens_per_second": 12163.585 }, { "epoch": 1.5590492862914087, "grad_norm": 0.811851104373591, "learning_rate": 1.1525353637616821e-06, "loss": 0.28730196952819825, "num_input_tokens_seen": 738001592, "step": 23155, "train_runtime": 60672.8691, "train_tokens_per_second": 12163.618 }, { "epoch": 1.5593859412873687, "grad_norm": 0.858925884628469, "learning_rate": 1.1508472446355196e-06, "loss": 0.29271821975708007, "num_input_tokens_seen": 738165432, "step": 23160, "train_runtime": 60685.2993, "train_tokens_per_second": 12163.826 }, { "epoch": 1.5597225962833288, "grad_norm": 0.8069614990464805, "learning_rate": 1.1491602019126501e-06, "loss": 0.3047060966491699, "num_input_tokens_seen": 738329128, "step": 23165, "train_runtime": 60698.3298, "train_tokens_per_second": 12163.912 }, { "epoch": 1.560059251279289, "grad_norm": 0.8502361412677573, "learning_rate": 1.1474742360648515e-06, "loss": 0.29802546501159666, "num_input_tokens_seen": 738489416, "step": 23170, "train_runtime": 60710.7583, "train_tokens_per_second": 12164.062 }, { "epoch": 1.5603959062752493, "grad_norm": 0.8611928572387201, "learning_rate": 1.1457893475635968e-06, "loss": 0.3120441913604736, "num_input_tokens_seen": 738645984, "step": 23175, "train_runtime": 60723.8576, "train_tokens_per_second": 12164.016 }, { "epoch": 1.5607325612712093, "grad_norm": 0.8554315750729933, "learning_rate": 1.144105536880063e-06, "loss": 0.2776580810546875, "num_input_tokens_seen": 738804832, "step": 23180, "train_runtime": 60737.5554, "train_tokens_per_second": 12163.888 }, { "epoch": 1.5610692162671693, "grad_norm": 0.8328715622881653, "learning_rate": 1.1424228044851176e-06, "loss": 0.2846327304840088, "num_input_tokens_seen": 738961256, "step": 23185, "train_runtime": 60751.8902, "train_tokens_per_second": 12163.593 }, { "epoch": 1.5614058712631296, "grad_norm": 0.7237227234164573, "learning_rate": 1.1407411508493355e-06, "loss": 0.28693265914916993, "num_input_tokens_seen": 739118856, "step": 23190, "train_runtime": 60764.9864, "train_tokens_per_second": 12163.565 }, { "epoch": 1.5617425262590898, "grad_norm": 0.7845524124349043, "learning_rate": 1.1390605764429846e-06, "loss": 0.2674920082092285, "num_input_tokens_seen": 739278488, "step": 23195, "train_runtime": 60777.8153, "train_tokens_per_second": 12163.624 }, { "epoch": 1.5620791812550499, "grad_norm": 0.8929289326485473, "learning_rate": 1.1373810817360314e-06, "loss": 0.2981806039810181, "num_input_tokens_seen": 739441800, "step": 23200, "train_runtime": 60790.7239, "train_tokens_per_second": 12163.727 }, { "epoch": 1.5624158362510099, "grad_norm": 0.9044612113654503, "learning_rate": 1.135702667198142e-06, "loss": 0.3152334690093994, "num_input_tokens_seen": 739603880, "step": 23205, "train_runtime": 60804.0461, "train_tokens_per_second": 12163.728 }, { "epoch": 1.5627524912469701, "grad_norm": 0.8378447701082983, "learning_rate": 1.134025333298679e-06, "loss": 0.26320223808288573, "num_input_tokens_seen": 739757192, "step": 23210, "train_runtime": 60816.8962, "train_tokens_per_second": 12163.679 }, { "epoch": 1.5630891462429304, "grad_norm": 0.8544615120702004, "learning_rate": 1.1323490805067045e-06, "loss": 0.2773989200592041, "num_input_tokens_seen": 739916776, "step": 23215, "train_runtime": 60830.2675, "train_tokens_per_second": 12163.629 }, { "epoch": 1.5634258012388904, "grad_norm": 0.8068933586041359, "learning_rate": 1.1306739092909757e-06, "loss": 0.2633871793746948, "num_input_tokens_seen": 740073848, "step": 23220, "train_runtime": 60843.3804, "train_tokens_per_second": 12163.589 }, { "epoch": 1.5637624562348504, "grad_norm": 0.7900715290821706, "learning_rate": 1.1289998201199493e-06, "loss": 0.27851572036743166, "num_input_tokens_seen": 740233400, "step": 23225, "train_runtime": 60856.757, "train_tokens_per_second": 12163.537 }, { "epoch": 1.5640991112308107, "grad_norm": 0.806297674238551, "learning_rate": 1.1273268134617816e-06, "loss": 0.3013458251953125, "num_input_tokens_seen": 740395416, "step": 23230, "train_runtime": 60869.3455, "train_tokens_per_second": 12163.683 }, { "epoch": 1.564435766226771, "grad_norm": 0.7196484840293191, "learning_rate": 1.1256548897843189e-06, "loss": 0.3004997491836548, "num_input_tokens_seen": 740558624, "step": 23235, "train_runtime": 60882.3874, "train_tokens_per_second": 12163.758 }, { "epoch": 1.564772421222731, "grad_norm": 0.7640318488229205, "learning_rate": 1.1239840495551136e-06, "loss": 0.2844345808029175, "num_input_tokens_seen": 740721184, "step": 23240, "train_runtime": 60894.9931, "train_tokens_per_second": 12163.909 }, { "epoch": 1.565109076218691, "grad_norm": 0.8648528222788187, "learning_rate": 1.1223142932414087e-06, "loss": 0.32747530937194824, "num_input_tokens_seen": 740885024, "step": 23245, "train_runtime": 60907.4387, "train_tokens_per_second": 12164.114 }, { "epoch": 1.5654457312146512, "grad_norm": 0.7210810976826967, "learning_rate": 1.120645621310147e-06, "loss": 0.29173855781555175, "num_input_tokens_seen": 741045944, "step": 23250, "train_runtime": 60919.9115, "train_tokens_per_second": 12164.265 }, { "epoch": 1.5657823862106115, "grad_norm": 0.9652057816898654, "learning_rate": 1.1189780342279666e-06, "loss": 0.2980844259262085, "num_input_tokens_seen": 741197304, "step": 23255, "train_runtime": 60932.5106, "train_tokens_per_second": 12164.234 }, { "epoch": 1.5661190412065715, "grad_norm": 0.7632355133382442, "learning_rate": 1.1173115324612033e-06, "loss": 0.3174387693405151, "num_input_tokens_seen": 741352024, "step": 23260, "train_runtime": 60945.6082, "train_tokens_per_second": 12164.158 }, { "epoch": 1.5664556962025316, "grad_norm": 0.8524277751319136, "learning_rate": 1.1156461164758891e-06, "loss": 0.3171722412109375, "num_input_tokens_seen": 741515864, "step": 23265, "train_runtime": 60958.0332, "train_tokens_per_second": 12164.367 }, { "epoch": 1.5667923511984918, "grad_norm": 0.7388589419155768, "learning_rate": 1.1139817867377522e-06, "loss": 0.24607739448547364, "num_input_tokens_seen": 741678272, "step": 23270, "train_runtime": 60970.6731, "train_tokens_per_second": 12164.509 }, { "epoch": 1.567129006194452, "grad_norm": 0.7999273112283958, "learning_rate": 1.1123185437122153e-06, "loss": 0.2833959341049194, "num_input_tokens_seen": 741842112, "step": 23275, "train_runtime": 60983.111, "train_tokens_per_second": 12164.714 }, { "epoch": 1.567465661190412, "grad_norm": 0.8532553354759879, "learning_rate": 1.1106563878644038e-06, "loss": 0.28699569702148436, "num_input_tokens_seen": 742002120, "step": 23280, "train_runtime": 60995.6004, "train_tokens_per_second": 12164.847 }, { "epoch": 1.5678023161863721, "grad_norm": 0.7991473194536528, "learning_rate": 1.1089953196591286e-06, "loss": 0.2935714483261108, "num_input_tokens_seen": 742162880, "step": 23285, "train_runtime": 61009.1363, "train_tokens_per_second": 12164.783 }, { "epoch": 1.5681389711823324, "grad_norm": 0.8974969088409925, "learning_rate": 1.107335339560906e-06, "loss": 0.30866389274597167, "num_input_tokens_seen": 742318360, "step": 23290, "train_runtime": 61022.8719, "train_tokens_per_second": 12164.592 }, { "epoch": 1.5684756261782926, "grad_norm": 0.8467021168415199, "learning_rate": 1.1056764480339427e-06, "loss": 0.294776177406311, "num_input_tokens_seen": 742482040, "step": 23295, "train_runtime": 61035.9754, "train_tokens_per_second": 12164.662 }, { "epoch": 1.5688122811742526, "grad_norm": 0.8499248608204794, "learning_rate": 1.1040186455421425e-06, "loss": 0.32110395431518557, "num_input_tokens_seen": 742644992, "step": 23300, "train_runtime": 61049.4657, "train_tokens_per_second": 12164.644 }, { "epoch": 1.5691489361702127, "grad_norm": 0.8372293846127322, "learning_rate": 1.1023619325491052e-06, "loss": 0.2966631889343262, "num_input_tokens_seen": 742804256, "step": 23305, "train_runtime": 61062.4203, "train_tokens_per_second": 12164.671 }, { "epoch": 1.569485591166173, "grad_norm": 0.685148142297708, "learning_rate": 1.1007063095181248e-06, "loss": 0.2775959730148315, "num_input_tokens_seen": 742963336, "step": 23310, "train_runtime": 61075.9682, "train_tokens_per_second": 12164.577 }, { "epoch": 1.5698222461621332, "grad_norm": 0.822782838837817, "learning_rate": 1.0990517769121905e-06, "loss": 0.3007147789001465, "num_input_tokens_seen": 743115912, "step": 23315, "train_runtime": 61089.1205, "train_tokens_per_second": 12164.456 }, { "epoch": 1.5701589011580932, "grad_norm": 0.9049653976399583, "learning_rate": 1.0973983351939876e-06, "loss": 0.30109505653381347, "num_input_tokens_seen": 743276432, "step": 23320, "train_runtime": 61102.483, "train_tokens_per_second": 12164.423 }, { "epoch": 1.5704955561540532, "grad_norm": 0.868828467049675, "learning_rate": 1.095745984825895e-06, "loss": 0.2956847667694092, "num_input_tokens_seen": 743435680, "step": 23325, "train_runtime": 61114.9034, "train_tokens_per_second": 12164.556 }, { "epoch": 1.5708322111500135, "grad_norm": 0.8686982955432532, "learning_rate": 1.0940947262699902e-06, "loss": 0.29397897720336913, "num_input_tokens_seen": 743591080, "step": 23330, "train_runtime": 61127.7418, "train_tokens_per_second": 12164.544 }, { "epoch": 1.5711688661459737, "grad_norm": 0.7251408874691271, "learning_rate": 1.092444559988038e-06, "loss": 0.28177633285522463, "num_input_tokens_seen": 743751736, "step": 23335, "train_runtime": 61140.9215, "train_tokens_per_second": 12164.549 }, { "epoch": 1.5715055211419338, "grad_norm": 0.7704535936860318, "learning_rate": 1.0907954864415048e-06, "loss": 0.293503999710083, "num_input_tokens_seen": 743913584, "step": 23340, "train_runtime": 61153.4451, "train_tokens_per_second": 12164.704 }, { "epoch": 1.5718421761378938, "grad_norm": 0.871551036206662, "learning_rate": 1.089147506091549e-06, "loss": 0.2725985527038574, "num_input_tokens_seen": 744072416, "step": 23345, "train_runtime": 61166.4124, "train_tokens_per_second": 12164.722 }, { "epoch": 1.572178831133854, "grad_norm": 0.9478749742803037, "learning_rate": 1.0875006193990217e-06, "loss": 0.3075448989868164, "num_input_tokens_seen": 744228888, "step": 23350, "train_runtime": 61179.8297, "train_tokens_per_second": 12164.612 }, { "epoch": 1.5725154861298143, "grad_norm": 0.8378236147152379, "learning_rate": 1.0858548268244706e-06, "loss": 0.28488545417785643, "num_input_tokens_seen": 744387760, "step": 23355, "train_runtime": 61192.4529, "train_tokens_per_second": 12164.699 }, { "epoch": 1.5728521411257743, "grad_norm": 0.8097247759842988, "learning_rate": 1.0842101288281359e-06, "loss": 0.288008975982666, "num_input_tokens_seen": 744548624, "step": 23360, "train_runtime": 61205.8871, "train_tokens_per_second": 12164.657 }, { "epoch": 1.5731887961217343, "grad_norm": 0.8129984259831883, "learning_rate": 1.082566525869952e-06, "loss": 0.2869732856750488, "num_input_tokens_seen": 744712352, "step": 23365, "train_runtime": 61218.9788, "train_tokens_per_second": 12164.73 }, { "epoch": 1.5735254511176946, "grad_norm": 0.8591360978323196, "learning_rate": 1.0809240184095476e-06, "loss": 0.31190996170043944, "num_input_tokens_seen": 744870784, "step": 23370, "train_runtime": 61231.8139, "train_tokens_per_second": 12164.768 }, { "epoch": 1.5738621061136548, "grad_norm": 0.7730497939452526, "learning_rate": 1.0792826069062429e-06, "loss": 0.27433960437774657, "num_input_tokens_seen": 745033336, "step": 23375, "train_runtime": 61244.7198, "train_tokens_per_second": 12164.858 }, { "epoch": 1.5741987611096149, "grad_norm": 0.7040122224160477, "learning_rate": 1.0776422918190576e-06, "loss": 0.30633959770202634, "num_input_tokens_seen": 745191712, "step": 23380, "train_runtime": 61257.2034, "train_tokens_per_second": 12164.965 }, { "epoch": 1.574535416105575, "grad_norm": 0.9112582956707095, "learning_rate": 1.0760030736066952e-06, "loss": 0.28393733501434326, "num_input_tokens_seen": 745346800, "step": 23385, "train_runtime": 61270.116, "train_tokens_per_second": 12164.932 }, { "epoch": 1.5748720711015352, "grad_norm": 0.7738243422361231, "learning_rate": 1.0743649527275619e-06, "loss": 0.28804926872253417, "num_input_tokens_seen": 745508296, "step": 23390, "train_runtime": 61283.2168, "train_tokens_per_second": 12164.967 }, { "epoch": 1.5752087260974954, "grad_norm": 0.7990054611874563, "learning_rate": 1.0727279296397514e-06, "loss": 0.29540624618530276, "num_input_tokens_seen": 745671592, "step": 23395, "train_runtime": 61296.2886, "train_tokens_per_second": 12165.037 }, { "epoch": 1.5755453810934554, "grad_norm": 0.9084433459683746, "learning_rate": 1.0710920048010526e-06, "loss": 0.31709871292114256, "num_input_tokens_seen": 745828784, "step": 23400, "train_runtime": 61308.728, "train_tokens_per_second": 12165.132 }, { "epoch": 1.5758820360894155, "grad_norm": 0.8420521370700118, "learning_rate": 1.0694571786689462e-06, "loss": 0.3073237657546997, "num_input_tokens_seen": 745992624, "step": 23405, "train_runtime": 61321.1557, "train_tokens_per_second": 12165.339 }, { "epoch": 1.5762186910853757, "grad_norm": 0.8925934933824081, "learning_rate": 1.067823451700606e-06, "loss": 0.28224446773529055, "num_input_tokens_seen": 746146096, "step": 23410, "train_runtime": 61333.6304, "train_tokens_per_second": 12165.367 }, { "epoch": 1.576555346081336, "grad_norm": 0.8935956607390586, "learning_rate": 1.066190824352899e-06, "loss": 0.2907134532928467, "num_input_tokens_seen": 746307544, "step": 23415, "train_runtime": 61346.7943, "train_tokens_per_second": 12165.388 }, { "epoch": 1.576892001077296, "grad_norm": 0.7808873564423955, "learning_rate": 1.0645592970823837e-06, "loss": 0.26576077938079834, "num_input_tokens_seen": 746463336, "step": 23420, "train_runtime": 61359.7407, "train_tokens_per_second": 12165.36 }, { "epoch": 1.577228656073256, "grad_norm": 0.771891208129401, "learning_rate": 1.0629288703453105e-06, "loss": 0.3038355350494385, "num_input_tokens_seen": 746625544, "step": 23425, "train_runtime": 61372.3443, "train_tokens_per_second": 12165.505 }, { "epoch": 1.5775653110692163, "grad_norm": 0.8560705484247997, "learning_rate": 1.061299544597627e-06, "loss": 0.29100608825683594, "num_input_tokens_seen": 746776008, "step": 23430, "train_runtime": 61385.1363, "train_tokens_per_second": 12165.421 }, { "epoch": 1.5779019660651765, "grad_norm": 0.7663357578575652, "learning_rate": 1.0596713202949637e-06, "loss": 0.297916579246521, "num_input_tokens_seen": 746938864, "step": 23435, "train_runtime": 61397.5995, "train_tokens_per_second": 12165.604 }, { "epoch": 1.5782386210611365, "grad_norm": 0.7797505610957637, "learning_rate": 1.0580441978926527e-06, "loss": 0.29828839302062987, "num_input_tokens_seen": 747098632, "step": 23440, "train_runtime": 61410.8318, "train_tokens_per_second": 12165.584 }, { "epoch": 1.5785752760570966, "grad_norm": 0.9435630949370322, "learning_rate": 1.056418177845711e-06, "loss": 0.2888603925704956, "num_input_tokens_seen": 747250464, "step": 23445, "train_runtime": 61423.716, "train_tokens_per_second": 12165.504 }, { "epoch": 1.5789119310530568, "grad_norm": 0.7393657273691062, "learning_rate": 1.0547932606088506e-06, "loss": 0.2955147743225098, "num_input_tokens_seen": 747409064, "step": 23450, "train_runtime": 61437.1285, "train_tokens_per_second": 12165.43 }, { "epoch": 1.579248586049017, "grad_norm": 0.8026188231971175, "learning_rate": 1.053169446636475e-06, "loss": 0.29681265354156494, "num_input_tokens_seen": 747571032, "step": 23455, "train_runtime": 61449.7081, "train_tokens_per_second": 12165.575 }, { "epoch": 1.579585241044977, "grad_norm": 0.9838278644291032, "learning_rate": 1.0515467363826782e-06, "loss": 0.299529504776001, "num_input_tokens_seen": 747731048, "step": 23460, "train_runtime": 61462.9109, "train_tokens_per_second": 12165.565 }, { "epoch": 1.5799218960409371, "grad_norm": 0.8347350106674356, "learning_rate": 1.0499251303012454e-06, "loss": 0.2828847646713257, "num_input_tokens_seen": 747893688, "step": 23465, "train_runtime": 61475.5948, "train_tokens_per_second": 12165.701 }, { "epoch": 1.5802585510368974, "grad_norm": 0.8744689452614091, "learning_rate": 1.0483046288456544e-06, "loss": 0.30875506401062014, "num_input_tokens_seen": 748046968, "step": 23470, "train_runtime": 61488.8129, "train_tokens_per_second": 12165.578 }, { "epoch": 1.5805952060328576, "grad_norm": 0.7978321641396979, "learning_rate": 1.0466852324690719e-06, "loss": 0.28389878273010255, "num_input_tokens_seen": 748205080, "step": 23475, "train_runtime": 61502.4089, "train_tokens_per_second": 12165.46 }, { "epoch": 1.5809318610288177, "grad_norm": 0.7982304213551433, "learning_rate": 1.0450669416243596e-06, "loss": 0.274608850479126, "num_input_tokens_seen": 748368520, "step": 23480, "train_runtime": 61516.0892, "train_tokens_per_second": 12165.411 }, { "epoch": 1.5812685160247777, "grad_norm": 0.7634355853805972, "learning_rate": 1.0434497567640639e-06, "loss": 0.29886023998260497, "num_input_tokens_seen": 748529888, "step": 23485, "train_runtime": 61529.1537, "train_tokens_per_second": 12165.451 }, { "epoch": 1.581605171020738, "grad_norm": 0.8666736886582709, "learning_rate": 1.0418336783404282e-06, "loss": 0.2986772537231445, "num_input_tokens_seen": 748687032, "step": 23490, "train_runtime": 61541.6751, "train_tokens_per_second": 12165.529 }, { "epoch": 1.5819418260166982, "grad_norm": 0.8037655437026634, "learning_rate": 1.0402187068053825e-06, "loss": 0.29055209159851075, "num_input_tokens_seen": 748844416, "step": 23495, "train_runtime": 61554.6716, "train_tokens_per_second": 12165.517 }, { "epoch": 1.5822784810126582, "grad_norm": 0.8342463481999536, "learning_rate": 1.0386048426105495e-06, "loss": 0.2872841119766235, "num_input_tokens_seen": 749002496, "step": 23500, "train_runtime": 61568.4343, "train_tokens_per_second": 12165.365 }, { "epoch": 1.5826151360086183, "grad_norm": 0.7872311353118867, "learning_rate": 1.0369920862072396e-06, "loss": 0.2815727710723877, "num_input_tokens_seen": 749156000, "step": 23505, "train_runtime": 61581.0605, "train_tokens_per_second": 12165.364 }, { "epoch": 1.5829517910045785, "grad_norm": 1.0684142289656602, "learning_rate": 1.0353804380464556e-06, "loss": 0.2715763092041016, "num_input_tokens_seen": 749317328, "step": 23510, "train_runtime": 61593.5583, "train_tokens_per_second": 12165.515 }, { "epoch": 1.5832884460005388, "grad_norm": 0.7640166452131792, "learning_rate": 1.0337698985788903e-06, "loss": 0.27533583641052245, "num_input_tokens_seen": 749480144, "step": 23515, "train_runtime": 61606.2338, "train_tokens_per_second": 12165.654 }, { "epoch": 1.5836251009964988, "grad_norm": 0.8178932490682378, "learning_rate": 1.0321604682549247e-06, "loss": 0.28578457832336424, "num_input_tokens_seen": 749643920, "step": 23520, "train_runtime": 61618.7191, "train_tokens_per_second": 12165.847 }, { "epoch": 1.5839617559924588, "grad_norm": 0.8784746701406516, "learning_rate": 1.0305521475246311e-06, "loss": 0.31900773048400877, "num_input_tokens_seen": 749797952, "step": 23525, "train_runtime": 61632.3772, "train_tokens_per_second": 12165.65 }, { "epoch": 1.584298410988419, "grad_norm": 0.8464043719963891, "learning_rate": 1.028944936837774e-06, "loss": 0.3088363170623779, "num_input_tokens_seen": 749952040, "step": 23530, "train_runtime": 61645.8559, "train_tokens_per_second": 12165.49 }, { "epoch": 1.5846350659843793, "grad_norm": 0.7911167392502553, "learning_rate": 1.0273388366438003e-06, "loss": 0.30842061042785646, "num_input_tokens_seen": 750114648, "step": 23535, "train_runtime": 61658.3251, "train_tokens_per_second": 12165.667 }, { "epoch": 1.5849717209803393, "grad_norm": 0.7578873092135829, "learning_rate": 1.0257338473918538e-06, "loss": 0.288736629486084, "num_input_tokens_seen": 750273424, "step": 23540, "train_runtime": 61670.7707, "train_tokens_per_second": 12165.786 }, { "epoch": 1.5853083759762994, "grad_norm": 0.7653009302192686, "learning_rate": 1.0241299695307644e-06, "loss": 0.2909852981567383, "num_input_tokens_seen": 750428872, "step": 23545, "train_runtime": 61683.9163, "train_tokens_per_second": 12165.714 }, { "epoch": 1.5856450309722596, "grad_norm": 0.7577211746878623, "learning_rate": 1.0225272035090506e-06, "loss": 0.28070902824401855, "num_input_tokens_seen": 750592712, "step": 23550, "train_runtime": 61696.3456, "train_tokens_per_second": 12165.918 }, { "epoch": 1.5859816859682199, "grad_norm": 0.8282012116532642, "learning_rate": 1.0209255497749209e-06, "loss": 0.30391921997070315, "num_input_tokens_seen": 750754904, "step": 23555, "train_runtime": 61708.9452, "train_tokens_per_second": 12166.063 }, { "epoch": 1.58631834096418, "grad_norm": 0.7903227302579233, "learning_rate": 1.0193250087762735e-06, "loss": 0.2886161804199219, "num_input_tokens_seen": 750914008, "step": 23560, "train_runtime": 61721.5417, "train_tokens_per_second": 12166.158 }, { "epoch": 1.58665499596014, "grad_norm": 0.6942488136841164, "learning_rate": 1.0177255809606934e-06, "loss": 0.29778280258178713, "num_input_tokens_seen": 751074368, "step": 23565, "train_runtime": 61735.106, "train_tokens_per_second": 12166.082 }, { "epoch": 1.5869916509561002, "grad_norm": 0.8980104470822609, "learning_rate": 1.0161272667754562e-06, "loss": 0.2906529903411865, "num_input_tokens_seen": 751237408, "step": 23570, "train_runtime": 61747.9652, "train_tokens_per_second": 12166.189 }, { "epoch": 1.5873283059520604, "grad_norm": 0.6902435429125515, "learning_rate": 1.014530066667524e-06, "loss": 0.2831205606460571, "num_input_tokens_seen": 751398784, "step": 23575, "train_runtime": 61760.4285, "train_tokens_per_second": 12166.347 }, { "epoch": 1.5876649609480205, "grad_norm": 0.7406565618833525, "learning_rate": 1.0129339810835526e-06, "loss": 0.2706297397613525, "num_input_tokens_seen": 751558640, "step": 23580, "train_runtime": 61773.6876, "train_tokens_per_second": 12166.323 }, { "epoch": 1.5880016159439805, "grad_norm": 0.8686686545311294, "learning_rate": 1.0113390104698767e-06, "loss": 0.27473959922790525, "num_input_tokens_seen": 751721840, "step": 23585, "train_runtime": 61786.5346, "train_tokens_per_second": 12166.435 }, { "epoch": 1.5883382709399407, "grad_norm": 0.7592500243821104, "learning_rate": 1.009745155272529e-06, "loss": 0.30735254287719727, "num_input_tokens_seen": 751884608, "step": 23590, "train_runtime": 61799.3825, "train_tokens_per_second": 12166.539 }, { "epoch": 1.588674925935901, "grad_norm": 0.7219638923153485, "learning_rate": 1.0081524159372246e-06, "loss": 0.29011518955230714, "num_input_tokens_seen": 752041320, "step": 23595, "train_runtime": 61813.5056, "train_tokens_per_second": 12166.295 }, { "epoch": 1.589011580931861, "grad_norm": 0.7952963497852942, "learning_rate": 1.0065607929093685e-06, "loss": 0.29025843143463137, "num_input_tokens_seen": 752200048, "step": 23600, "train_runtime": 61827.1031, "train_tokens_per_second": 12166.186 }, { "epoch": 1.589348235927821, "grad_norm": 0.8068418815456807, "learning_rate": 1.0049702866340521e-06, "loss": 0.2741154909133911, "num_input_tokens_seen": 752361456, "step": 23605, "train_runtime": 61840.2077, "train_tokens_per_second": 12166.218 }, { "epoch": 1.5896848909237813, "grad_norm": 0.7609310286232867, "learning_rate": 1.0033808975560556e-06, "loss": 0.26850142478942873, "num_input_tokens_seen": 752520640, "step": 23610, "train_runtime": 61853.8229, "train_tokens_per_second": 12166.114 }, { "epoch": 1.5900215459197415, "grad_norm": 0.8454710220906957, "learning_rate": 1.0017926261198473e-06, "loss": 0.29633140563964844, "num_input_tokens_seen": 752682600, "step": 23615, "train_runtime": 61866.977, "train_tokens_per_second": 12166.145 }, { "epoch": 1.5903582009157016, "grad_norm": 0.9184516817932522, "learning_rate": 1.0002054727695814e-06, "loss": 0.2838845491409302, "num_input_tokens_seen": 752839624, "step": 23620, "train_runtime": 61880.9459, "train_tokens_per_second": 12165.936 }, { "epoch": 1.5906948559116616, "grad_norm": 0.7817624173455998, "learning_rate": 9.986194379490993e-07, "loss": 0.297656774520874, "num_input_tokens_seen": 752996384, "step": 23625, "train_runtime": 61894.095, "train_tokens_per_second": 12165.884 }, { "epoch": 1.5910315109076218, "grad_norm": 0.8458505707728549, "learning_rate": 9.970345221019345e-07, "loss": 0.3040682315826416, "num_input_tokens_seen": 753151104, "step": 23630, "train_runtime": 61907.4641, "train_tokens_per_second": 12165.756 }, { "epoch": 1.591368165903582, "grad_norm": 0.9984066302606829, "learning_rate": 9.954507256712987e-07, "loss": 0.3052212715148926, "num_input_tokens_seen": 753309592, "step": 23635, "train_runtime": 61920.2593, "train_tokens_per_second": 12165.802 }, { "epoch": 1.5917048208995421, "grad_norm": 0.8079082440429876, "learning_rate": 9.938680491000991e-07, "loss": 0.2925656080245972, "num_input_tokens_seen": 753468032, "step": 23640, "train_runtime": 61933.1553, "train_tokens_per_second": 12165.827 }, { "epoch": 1.5920414758955022, "grad_norm": 0.7677942364658136, "learning_rate": 9.92286492830925e-07, "loss": 0.29314634799957273, "num_input_tokens_seen": 753630200, "step": 23645, "train_runtime": 61945.7809, "train_tokens_per_second": 12165.965 }, { "epoch": 1.5923781308914624, "grad_norm": 0.7501256049068767, "learning_rate": 9.907060573060535e-07, "loss": 0.30775933265686034, "num_input_tokens_seen": 753788936, "step": 23650, "train_runtime": 61958.3679, "train_tokens_per_second": 12166.055 }, { "epoch": 1.5927147858874227, "grad_norm": 0.7757216044188825, "learning_rate": 9.891267429674484e-07, "loss": 0.29603424072265627, "num_input_tokens_seen": 753947720, "step": 23655, "train_runtime": 61973.4905, "train_tokens_per_second": 12165.649 }, { "epoch": 1.5930514408833827, "grad_norm": 0.9124889965011846, "learning_rate": 9.8754855025676e-07, "loss": 0.2801192283630371, "num_input_tokens_seen": 754105888, "step": 23660, "train_runtime": 61986.6885, "train_tokens_per_second": 12165.61 }, { "epoch": 1.5933880958793427, "grad_norm": 0.8743539632201028, "learning_rate": 9.85971479615324e-07, "loss": 0.2901712656021118, "num_input_tokens_seen": 754267984, "step": 23665, "train_runtime": 61999.3659, "train_tokens_per_second": 12165.737 }, { "epoch": 1.593724750875303, "grad_norm": 0.7240708736595821, "learning_rate": 9.843955314841647e-07, "loss": 0.27735702991485595, "num_input_tokens_seen": 754427992, "step": 23670, "train_runtime": 62012.6497, "train_tokens_per_second": 12165.711 }, { "epoch": 1.5940614058712632, "grad_norm": 0.7956634194670543, "learning_rate": 9.82820706303989e-07, "loss": 0.28912575244903566, "num_input_tokens_seen": 754587704, "step": 23675, "train_runtime": 62025.7276, "train_tokens_per_second": 12165.721 }, { "epoch": 1.5943980608672232, "grad_norm": 0.7900671104903814, "learning_rate": 9.812470045151952e-07, "loss": 0.2891338586807251, "num_input_tokens_seen": 754745984, "step": 23680, "train_runtime": 62040.787, "train_tokens_per_second": 12165.319 }, { "epoch": 1.5947347158631833, "grad_norm": 0.8363698447560103, "learning_rate": 9.79674426557859e-07, "loss": 0.29004683494567873, "num_input_tokens_seen": 754901792, "step": 23685, "train_runtime": 62053.8159, "train_tokens_per_second": 12165.276 }, { "epoch": 1.5950713708591435, "grad_norm": 0.699101916970364, "learning_rate": 9.781029728717513e-07, "loss": 0.2821507453918457, "num_input_tokens_seen": 755061848, "step": 23690, "train_runtime": 62066.5316, "train_tokens_per_second": 12165.362 }, { "epoch": 1.5954080258551038, "grad_norm": 0.7641796399889572, "learning_rate": 9.765326438963218e-07, "loss": 0.30041255950927737, "num_input_tokens_seen": 755222400, "step": 23695, "train_runtime": 62079.7611, "train_tokens_per_second": 12165.356 }, { "epoch": 1.5957446808510638, "grad_norm": 0.7744527111588857, "learning_rate": 9.749634400707087e-07, "loss": 0.27595863342285154, "num_input_tokens_seen": 755380792, "step": 23700, "train_runtime": 62093.3695, "train_tokens_per_second": 12165.241 }, { "epoch": 1.5960813358470238, "grad_norm": 0.734421638172271, "learning_rate": 9.733953618337344e-07, "loss": 0.293001651763916, "num_input_tokens_seen": 755538408, "step": 23705, "train_runtime": 62106.6735, "train_tokens_per_second": 12165.173 }, { "epoch": 1.596417990842984, "grad_norm": 0.8363342511839025, "learning_rate": 9.718284096239077e-07, "loss": 0.32360756397247314, "num_input_tokens_seen": 755702248, "step": 23710, "train_runtime": 62119.1171, "train_tokens_per_second": 12165.373 }, { "epoch": 1.5967546458389443, "grad_norm": 0.8072185909567865, "learning_rate": 9.702625838794215e-07, "loss": 0.28470401763916015, "num_input_tokens_seen": 755859784, "step": 23715, "train_runtime": 62132.2815, "train_tokens_per_second": 12165.331 }, { "epoch": 1.5970913008349044, "grad_norm": 0.7808018944773587, "learning_rate": 9.686978850381535e-07, "loss": 0.284358286857605, "num_input_tokens_seen": 756022776, "step": 23720, "train_runtime": 62145.1256, "train_tokens_per_second": 12165.44 }, { "epoch": 1.5974279558308644, "grad_norm": 0.8129130908518589, "learning_rate": 9.67134313537666e-07, "loss": 0.2720520257949829, "num_input_tokens_seen": 756181168, "step": 23725, "train_runtime": 62158.7961, "train_tokens_per_second": 12165.312 }, { "epoch": 1.5977646108268246, "grad_norm": 2.105982538627707, "learning_rate": 9.6557186981521e-07, "loss": 0.305348801612854, "num_input_tokens_seen": 756341096, "step": 23730, "train_runtime": 62171.4801, "train_tokens_per_second": 12165.403 }, { "epoch": 1.5981012658227849, "grad_norm": 0.8120863702396408, "learning_rate": 9.640105543077133e-07, "loss": 0.29778907299041746, "num_input_tokens_seen": 756503600, "step": 23735, "train_runtime": 62184.5413, "train_tokens_per_second": 12165.461 }, { "epoch": 1.598437920818745, "grad_norm": 0.8340768863410528, "learning_rate": 9.624503674517972e-07, "loss": 0.2994217872619629, "num_input_tokens_seen": 756663888, "step": 23740, "train_runtime": 62196.9896, "train_tokens_per_second": 12165.603 }, { "epoch": 1.598774575814705, "grad_norm": 1.028529909831064, "learning_rate": 9.608913096837603e-07, "loss": 0.2685131311416626, "num_input_tokens_seen": 756827640, "step": 23745, "train_runtime": 62210.1021, "train_tokens_per_second": 12165.671 }, { "epoch": 1.5991112308106652, "grad_norm": 0.7757460874293973, "learning_rate": 9.593333814395889e-07, "loss": 0.3071715831756592, "num_input_tokens_seen": 756980088, "step": 23750, "train_runtime": 62222.9411, "train_tokens_per_second": 12165.611 }, { "epoch": 1.5994478858066254, "grad_norm": 0.759429298468551, "learning_rate": 9.577765831549529e-07, "loss": 0.2900444507598877, "num_input_tokens_seen": 757142560, "step": 23755, "train_runtime": 62236.2082, "train_tokens_per_second": 12165.628 }, { "epoch": 1.5997845408025855, "grad_norm": 0.7540992120671355, "learning_rate": 9.562209152652058e-07, "loss": 0.3045480251312256, "num_input_tokens_seen": 757299688, "step": 23760, "train_runtime": 62248.6255, "train_tokens_per_second": 12165.725 }, { "epoch": 1.6001211957985455, "grad_norm": 0.8511417040813506, "learning_rate": 9.54666378205385e-07, "loss": 0.31048357486724854, "num_input_tokens_seen": 757462920, "step": 23765, "train_runtime": 62261.5311, "train_tokens_per_second": 12165.825 }, { "epoch": 1.6004578507945058, "grad_norm": 0.7905626781475694, "learning_rate": 9.531129724102117e-07, "loss": 0.2925772428512573, "num_input_tokens_seen": 757623264, "step": 23770, "train_runtime": 62274.8925, "train_tokens_per_second": 12165.79 }, { "epoch": 1.600794505790466, "grad_norm": 0.7970022112572606, "learning_rate": 9.515606983140896e-07, "loss": 0.28814122676849363, "num_input_tokens_seen": 757783208, "step": 23775, "train_runtime": 62287.8552, "train_tokens_per_second": 12165.826 }, { "epoch": 1.601131160786426, "grad_norm": 0.8095590586517496, "learning_rate": 9.500095563511119e-07, "loss": 0.29329063892364504, "num_input_tokens_seen": 757944936, "step": 23780, "train_runtime": 62300.3432, "train_tokens_per_second": 12165.983 }, { "epoch": 1.601467815782386, "grad_norm": 0.7846797695107003, "learning_rate": 9.484595469550445e-07, "loss": 0.2858744621276855, "num_input_tokens_seen": 758106224, "step": 23785, "train_runtime": 62313.2989, "train_tokens_per_second": 12166.042 }, { "epoch": 1.6018044707783463, "grad_norm": 0.7561047913931127, "learning_rate": 9.469106705593462e-07, "loss": 0.2850042819976807, "num_input_tokens_seen": 758262888, "step": 23790, "train_runtime": 62326.8254, "train_tokens_per_second": 12165.915 }, { "epoch": 1.6021411257743066, "grad_norm": 0.8383870082780074, "learning_rate": 9.453629275971549e-07, "loss": 0.29554004669189454, "num_input_tokens_seen": 758421800, "step": 23795, "train_runtime": 62339.3403, "train_tokens_per_second": 12166.022 }, { "epoch": 1.6024777807702666, "grad_norm": 0.736498479841838, "learning_rate": 9.438163185012916e-07, "loss": 0.28136382102966306, "num_input_tokens_seen": 758575968, "step": 23800, "train_runtime": 62351.9331, "train_tokens_per_second": 12166.038 }, { "epoch": 1.6028144357662266, "grad_norm": 0.7641098663703605, "learning_rate": 9.422708437042604e-07, "loss": 0.26924445629119875, "num_input_tokens_seen": 758738456, "step": 23805, "train_runtime": 62364.375, "train_tokens_per_second": 12166.216 }, { "epoch": 1.6031510907621869, "grad_norm": 0.763982949181992, "learning_rate": 9.40726503638249e-07, "loss": 0.3191770076751709, "num_input_tokens_seen": 758896608, "step": 23810, "train_runtime": 62377.5477, "train_tokens_per_second": 12166.182 }, { "epoch": 1.6034877457581471, "grad_norm": 0.8202118561698065, "learning_rate": 9.391832987351268e-07, "loss": 0.29884905815124513, "num_input_tokens_seen": 759052480, "step": 23815, "train_runtime": 62390.2454, "train_tokens_per_second": 12166.204 }, { "epoch": 1.6038244007541071, "grad_norm": 0.8606186146560654, "learning_rate": 9.376412294264458e-07, "loss": 0.29393439292907714, "num_input_tokens_seen": 759211120, "step": 23820, "train_runtime": 62402.8138, "train_tokens_per_second": 12166.296 }, { "epoch": 1.6041610557500672, "grad_norm": 0.7100429244040334, "learning_rate": 9.361002961434401e-07, "loss": 0.2816779613494873, "num_input_tokens_seen": 759371640, "step": 23825, "train_runtime": 62416.0655, "train_tokens_per_second": 12166.285 }, { "epoch": 1.6044977107460274, "grad_norm": 0.862546006701609, "learning_rate": 9.345604993170299e-07, "loss": 0.3149986267089844, "num_input_tokens_seen": 759531776, "step": 23830, "train_runtime": 62428.9873, "train_tokens_per_second": 12166.332 }, { "epoch": 1.6048343657419877, "grad_norm": 0.8740335285982169, "learning_rate": 9.330218393778101e-07, "loss": 0.2918510437011719, "num_input_tokens_seen": 759686128, "step": 23835, "train_runtime": 62441.7941, "train_tokens_per_second": 12166.308 }, { "epoch": 1.6051710207379477, "grad_norm": 0.8463441127459306, "learning_rate": 9.314843167560656e-07, "loss": 0.28692121505737306, "num_input_tokens_seen": 759839216, "step": 23840, "train_runtime": 62454.3017, "train_tokens_per_second": 12166.323 }, { "epoch": 1.6055076757339077, "grad_norm": 0.7739159853638357, "learning_rate": 9.299479318817578e-07, "loss": 0.28337562084198, "num_input_tokens_seen": 759995656, "step": 23845, "train_runtime": 62467.1842, "train_tokens_per_second": 12166.318 }, { "epoch": 1.605844330729868, "grad_norm": 0.8445095272669748, "learning_rate": 9.284126851845316e-07, "loss": 0.2813390254974365, "num_input_tokens_seen": 760159496, "step": 23850, "train_runtime": 62479.616, "train_tokens_per_second": 12166.52 }, { "epoch": 1.6061809857258282, "grad_norm": 0.8061944828827718, "learning_rate": 9.268785770937172e-07, "loss": 0.29737081527709963, "num_input_tokens_seen": 760320520, "step": 23855, "train_runtime": 62492.7043, "train_tokens_per_second": 12166.549 }, { "epoch": 1.6065176407217883, "grad_norm": 0.9164530419514815, "learning_rate": 9.253456080383178e-07, "loss": 0.3048983573913574, "num_input_tokens_seen": 760481760, "step": 23860, "train_runtime": 62505.7277, "train_tokens_per_second": 12166.593 }, { "epoch": 1.6068542957177483, "grad_norm": 0.808491764444421, "learning_rate": 9.238137784470286e-07, "loss": 0.31508593559265136, "num_input_tokens_seen": 760634008, "step": 23865, "train_runtime": 62519.1102, "train_tokens_per_second": 12166.424 }, { "epoch": 1.6071909507137085, "grad_norm": 0.8793919761807834, "learning_rate": 9.222830887482153e-07, "loss": 0.27198152542114257, "num_input_tokens_seen": 760795600, "step": 23870, "train_runtime": 62532.7101, "train_tokens_per_second": 12166.362 }, { "epoch": 1.6075276057096688, "grad_norm": 0.9018421718930305, "learning_rate": 9.207535393699351e-07, "loss": 0.3121297597885132, "num_input_tokens_seen": 760949848, "step": 23875, "train_runtime": 62545.9747, "train_tokens_per_second": 12166.248 }, { "epoch": 1.6078642607056288, "grad_norm": 0.8258946859093949, "learning_rate": 9.192251307399197e-07, "loss": 0.30213170051574706, "num_input_tokens_seen": 761111240, "step": 23880, "train_runtime": 62559.5067, "train_tokens_per_second": 12166.196 }, { "epoch": 1.6082009157015889, "grad_norm": 0.8051883975711595, "learning_rate": 9.176978632855842e-07, "loss": 0.29917683601379397, "num_input_tokens_seen": 761269896, "step": 23885, "train_runtime": 62572.2454, "train_tokens_per_second": 12166.255 }, { "epoch": 1.608537570697549, "grad_norm": 0.8518695134779092, "learning_rate": 9.161717374340235e-07, "loss": 0.28396599292755126, "num_input_tokens_seen": 761432952, "step": 23890, "train_runtime": 62585.1253, "train_tokens_per_second": 12166.357 }, { "epoch": 1.6088742256935094, "grad_norm": 0.9069344781741441, "learning_rate": 9.14646753612014e-07, "loss": 0.2971592903137207, "num_input_tokens_seen": 761593472, "step": 23895, "train_runtime": 62598.9205, "train_tokens_per_second": 12166.24 }, { "epoch": 1.6092108806894694, "grad_norm": 0.7386370782188281, "learning_rate": 9.131229122460112e-07, "loss": 0.2967731475830078, "num_input_tokens_seen": 761757312, "step": 23900, "train_runtime": 62611.3584, "train_tokens_per_second": 12166.44 }, { "epoch": 1.6095475356854294, "grad_norm": 0.7768509211464094, "learning_rate": 9.116002137621566e-07, "loss": 0.3001314878463745, "num_input_tokens_seen": 761917216, "step": 23905, "train_runtime": 62624.2993, "train_tokens_per_second": 12166.479 }, { "epoch": 1.6098841906813897, "grad_norm": 0.8521260620788292, "learning_rate": 9.100786585862626e-07, "loss": 0.3259676218032837, "num_input_tokens_seen": 762073008, "step": 23910, "train_runtime": 62637.3959, "train_tokens_per_second": 12166.422 }, { "epoch": 1.61022084567735, "grad_norm": 0.8740086081050383, "learning_rate": 9.085582471438326e-07, "loss": 0.2971473217010498, "num_input_tokens_seen": 762233520, "step": 23915, "train_runtime": 62650.5497, "train_tokens_per_second": 12166.43 }, { "epoch": 1.61055750067331, "grad_norm": 0.8479815326973054, "learning_rate": 9.070389798600394e-07, "loss": 0.2925459146499634, "num_input_tokens_seen": 762388824, "step": 23920, "train_runtime": 62663.3493, "train_tokens_per_second": 12166.423 }, { "epoch": 1.61089415566927, "grad_norm": 0.8595847744997765, "learning_rate": 9.055208571597451e-07, "loss": 0.2985935926437378, "num_input_tokens_seen": 762548552, "step": 23925, "train_runtime": 62676.0562, "train_tokens_per_second": 12166.505 }, { "epoch": 1.6112308106652302, "grad_norm": 0.9508306098646893, "learning_rate": 9.040038794674872e-07, "loss": 0.3077725887298584, "num_input_tokens_seen": 762708328, "step": 23930, "train_runtime": 62689.199, "train_tokens_per_second": 12166.503 }, { "epoch": 1.6115674656611905, "grad_norm": 0.74859069790838, "learning_rate": 9.024880472074831e-07, "loss": 0.2688113212585449, "num_input_tokens_seen": 762867864, "step": 23935, "train_runtime": 62702.3344, "train_tokens_per_second": 12166.499 }, { "epoch": 1.6119041206571505, "grad_norm": 0.8101866821759104, "learning_rate": 9.009733608036308e-07, "loss": 0.30013370513916016, "num_input_tokens_seen": 763028280, "step": 23940, "train_runtime": 62714.7483, "train_tokens_per_second": 12166.648 }, { "epoch": 1.6122407756531107, "grad_norm": 0.9428810785294192, "learning_rate": 8.994598206795068e-07, "loss": 0.279677677154541, "num_input_tokens_seen": 763183752, "step": 23945, "train_runtime": 62727.7798, "train_tokens_per_second": 12166.599 }, { "epoch": 1.612577430649071, "grad_norm": 0.7337719320084028, "learning_rate": 8.979474272583672e-07, "loss": 0.2854472637176514, "num_input_tokens_seen": 763339344, "step": 23950, "train_runtime": 62740.8994, "train_tokens_per_second": 12166.535 }, { "epoch": 1.612914085645031, "grad_norm": 0.7969190508471568, "learning_rate": 8.964361809631517e-07, "loss": 0.29798264503479005, "num_input_tokens_seen": 763499776, "step": 23955, "train_runtime": 62753.3272, "train_tokens_per_second": 12166.682 }, { "epoch": 1.613250740640991, "grad_norm": 0.8482276013688518, "learning_rate": 8.949260822164707e-07, "loss": 0.29980831146240233, "num_input_tokens_seen": 763659024, "step": 23960, "train_runtime": 62767.3444, "train_tokens_per_second": 12166.502 }, { "epoch": 1.6135873956369513, "grad_norm": 0.7678386623510182, "learning_rate": 8.934171314406226e-07, "loss": 0.30230298042297366, "num_input_tokens_seen": 763821936, "step": 23965, "train_runtime": 62780.1289, "train_tokens_per_second": 12166.619 }, { "epoch": 1.6139240506329116, "grad_norm": 0.8064893242433274, "learning_rate": 8.919093290575765e-07, "loss": 0.2942954540252686, "num_input_tokens_seen": 763976568, "step": 23970, "train_runtime": 62793.1417, "train_tokens_per_second": 12166.561 }, { "epoch": 1.6142607056288716, "grad_norm": 0.8544901054127001, "learning_rate": 8.904026754889877e-07, "loss": 0.2950057744979858, "num_input_tokens_seen": 764136360, "step": 23975, "train_runtime": 62806.7229, "train_tokens_per_second": 12166.474 }, { "epoch": 1.6145973606248316, "grad_norm": 0.8924913419416338, "learning_rate": 8.888971711561867e-07, "loss": 0.31065855026245115, "num_input_tokens_seen": 764294456, "step": 23980, "train_runtime": 62819.4626, "train_tokens_per_second": 12166.523 }, { "epoch": 1.6149340156207919, "grad_norm": 0.9262072960785322, "learning_rate": 8.873928164801821e-07, "loss": 0.3403141975402832, "num_input_tokens_seen": 764452608, "step": 23985, "train_runtime": 62832.0475, "train_tokens_per_second": 12166.603 }, { "epoch": 1.6152706706167521, "grad_norm": 0.808070170410782, "learning_rate": 8.858896118816624e-07, "loss": 0.2961104869842529, "num_input_tokens_seen": 764600216, "step": 23990, "train_runtime": 62845.0414, "train_tokens_per_second": 12166.437 }, { "epoch": 1.6156073256127121, "grad_norm": 0.793795929528486, "learning_rate": 8.84387557780994e-07, "loss": 0.2917397737503052, "num_input_tokens_seen": 764755536, "step": 23995, "train_runtime": 62857.6182, "train_tokens_per_second": 12166.473 }, { "epoch": 1.6159439806086722, "grad_norm": 0.8207326650772828, "learning_rate": 8.828866545982196e-07, "loss": 0.27533702850341796, "num_input_tokens_seen": 764918488, "step": 24000, "train_runtime": 62870.4455, "train_tokens_per_second": 12166.583 }, { "epoch": 1.6162806356046324, "grad_norm": 0.807083008731918, "learning_rate": 8.813869027530664e-07, "loss": 0.29796686172485354, "num_input_tokens_seen": 765079184, "step": 24005, "train_runtime": 62882.8572, "train_tokens_per_second": 12166.737 }, { "epoch": 1.6166172906005927, "grad_norm": 0.8302061593282672, "learning_rate": 8.798883026649302e-07, "loss": 0.30478296279907224, "num_input_tokens_seen": 765240968, "step": 24010, "train_runtime": 62895.9421, "train_tokens_per_second": 12166.778 }, { "epoch": 1.6169539455965527, "grad_norm": 0.7336147187311574, "learning_rate": 8.783908547528947e-07, "loss": 0.2698078155517578, "num_input_tokens_seen": 765398312, "step": 24015, "train_runtime": 62908.9864, "train_tokens_per_second": 12166.756 }, { "epoch": 1.6172906005925127, "grad_norm": 0.8416134435279844, "learning_rate": 8.768945594357109e-07, "loss": 0.29384913444519045, "num_input_tokens_seen": 765555080, "step": 24020, "train_runtime": 62922.3438, "train_tokens_per_second": 12166.665 }, { "epoch": 1.617627255588473, "grad_norm": 0.8300741695905465, "learning_rate": 8.753994171318175e-07, "loss": 0.29502367973327637, "num_input_tokens_seen": 765709488, "step": 24025, "train_runtime": 62935.7849, "train_tokens_per_second": 12166.52 }, { "epoch": 1.6179639105844332, "grad_norm": 0.7823052689022453, "learning_rate": 8.739054282593245e-07, "loss": 0.3124000310897827, "num_input_tokens_seen": 765871520, "step": 24030, "train_runtime": 62948.5443, "train_tokens_per_second": 12166.628 }, { "epoch": 1.6183005655803933, "grad_norm": 0.8077522470188067, "learning_rate": 8.724125932360217e-07, "loss": 0.3132227182388306, "num_input_tokens_seen": 766030504, "step": 24035, "train_runtime": 62962.4612, "train_tokens_per_second": 12166.464 }, { "epoch": 1.6186372205763533, "grad_norm": 0.7610397747599223, "learning_rate": 8.70920912479375e-07, "loss": 0.30763969421386717, "num_input_tokens_seen": 766187000, "step": 24040, "train_runtime": 62975.347, "train_tokens_per_second": 12166.459 }, { "epoch": 1.6189738755723135, "grad_norm": 0.8297523286713625, "learning_rate": 8.694303864065285e-07, "loss": 0.30072593688964844, "num_input_tokens_seen": 766350144, "step": 24045, "train_runtime": 62988.2184, "train_tokens_per_second": 12166.563 }, { "epoch": 1.6193105305682738, "grad_norm": 0.7838228440717495, "learning_rate": 8.679410154343015e-07, "loss": 0.2808335781097412, "num_input_tokens_seen": 766509040, "step": 24050, "train_runtime": 63001.5735, "train_tokens_per_second": 12166.506 }, { "epoch": 1.6196471855642338, "grad_norm": 0.9291175282426894, "learning_rate": 8.664527999791961e-07, "loss": 0.3260240316390991, "num_input_tokens_seen": 766668720, "step": 24055, "train_runtime": 63014.9195, "train_tokens_per_second": 12166.464 }, { "epoch": 1.6199838405601938, "grad_norm": 0.8473704140035717, "learning_rate": 8.649657404573819e-07, "loss": 0.29311039447784426, "num_input_tokens_seen": 766832112, "step": 24060, "train_runtime": 63027.8574, "train_tokens_per_second": 12166.558 }, { "epoch": 1.620320495556154, "grad_norm": 0.9173578848697701, "learning_rate": 8.634798372847148e-07, "loss": 0.3103797912597656, "num_input_tokens_seen": 766991984, "step": 24065, "train_runtime": 63040.5792, "train_tokens_per_second": 12166.639 }, { "epoch": 1.6206571505521143, "grad_norm": 0.8451169695872937, "learning_rate": 8.619950908767189e-07, "loss": 0.26868252754211425, "num_input_tokens_seen": 767146712, "step": 24070, "train_runtime": 63053.468, "train_tokens_per_second": 12166.606 }, { "epoch": 1.6209938055480744, "grad_norm": 0.8244721094177448, "learning_rate": 8.605115016486016e-07, "loss": 0.2828901052474976, "num_input_tokens_seen": 767310552, "step": 24075, "train_runtime": 63065.9013, "train_tokens_per_second": 12166.805 }, { "epoch": 1.6213304605440344, "grad_norm": 0.9570790864965937, "learning_rate": 8.590290700152426e-07, "loss": 0.2815671920776367, "num_input_tokens_seen": 767471496, "step": 24080, "train_runtime": 63078.7731, "train_tokens_per_second": 12166.874 }, { "epoch": 1.6216671155399947, "grad_norm": 0.8345386623172896, "learning_rate": 8.575477963912005e-07, "loss": 0.2973333835601807, "num_input_tokens_seen": 767633560, "step": 24085, "train_runtime": 63091.884, "train_tokens_per_second": 12166.915 }, { "epoch": 1.622003770535955, "grad_norm": 0.8383253479804074, "learning_rate": 8.560676811907071e-07, "loss": 0.2976699352264404, "num_input_tokens_seen": 767795928, "step": 24090, "train_runtime": 63105.1958, "train_tokens_per_second": 12166.921 }, { "epoch": 1.622340425531915, "grad_norm": 0.8615703139623555, "learning_rate": 8.54588724827673e-07, "loss": 0.28347082138061525, "num_input_tokens_seen": 767948488, "step": 24095, "train_runtime": 63117.9038, "train_tokens_per_second": 12166.888 }, { "epoch": 1.622677080527875, "grad_norm": 0.849619425770004, "learning_rate": 8.531109277156818e-07, "loss": 0.29941763877868655, "num_input_tokens_seen": 768110632, "step": 24100, "train_runtime": 63130.8159, "train_tokens_per_second": 12166.968 }, { "epoch": 1.6230137355238352, "grad_norm": 0.6898343766474888, "learning_rate": 8.516342902679986e-07, "loss": 0.26726560592651366, "num_input_tokens_seen": 768272000, "step": 24105, "train_runtime": 63143.7565, "train_tokens_per_second": 12167.03 }, { "epoch": 1.6233503905197955, "grad_norm": 0.7843208623137609, "learning_rate": 8.501588128975557e-07, "loss": 0.28057262897491453, "num_input_tokens_seen": 768433744, "step": 24110, "train_runtime": 63157.1221, "train_tokens_per_second": 12167.016 }, { "epoch": 1.6236870455157555, "grad_norm": 0.751807847608498, "learning_rate": 8.486844960169704e-07, "loss": 0.2688769340515137, "num_input_tokens_seen": 768594160, "step": 24115, "train_runtime": 63170.5329, "train_tokens_per_second": 12166.973 }, { "epoch": 1.6240237005117155, "grad_norm": 0.8375231375872785, "learning_rate": 8.472113400385257e-07, "loss": 0.280105447769165, "num_input_tokens_seen": 768755832, "step": 24120, "train_runtime": 63183.592, "train_tokens_per_second": 12167.017 }, { "epoch": 1.6243603555076758, "grad_norm": 0.8365248711910799, "learning_rate": 8.457393453741886e-07, "loss": 0.2927290201187134, "num_input_tokens_seen": 768916224, "step": 24125, "train_runtime": 63196.9009, "train_tokens_per_second": 12166.993 }, { "epoch": 1.624697010503636, "grad_norm": 0.9052271176007426, "learning_rate": 8.442685124355965e-07, "loss": 0.2913320541381836, "num_input_tokens_seen": 769072768, "step": 24130, "train_runtime": 63209.9842, "train_tokens_per_second": 12166.951 }, { "epoch": 1.625033665499596, "grad_norm": 0.8045218226698183, "learning_rate": 8.427988416340633e-07, "loss": 0.3093292713165283, "num_input_tokens_seen": 769223880, "step": 24135, "train_runtime": 63223.8196, "train_tokens_per_second": 12166.678 }, { "epoch": 1.625370320495556, "grad_norm": 0.8876575969485171, "learning_rate": 8.413303333805777e-07, "loss": 0.29044246673583984, "num_input_tokens_seen": 769383144, "step": 24140, "train_runtime": 63237.6733, "train_tokens_per_second": 12166.531 }, { "epoch": 1.6257069754915163, "grad_norm": 0.9411217661060414, "learning_rate": 8.398629880858034e-07, "loss": 0.3149867057800293, "num_input_tokens_seen": 769545304, "step": 24145, "train_runtime": 63250.2657, "train_tokens_per_second": 12166.673 }, { "epoch": 1.6260436304874766, "grad_norm": 0.8002804179260032, "learning_rate": 8.383968061600778e-07, "loss": 0.3086592674255371, "num_input_tokens_seen": 769702512, "step": 24150, "train_runtime": 63263.9072, "train_tokens_per_second": 12166.535 }, { "epoch": 1.6263802854834366, "grad_norm": 0.7774754201494821, "learning_rate": 8.36931788013417e-07, "loss": 0.2835515022277832, "num_input_tokens_seen": 769863344, "step": 24155, "train_runtime": 63276.9583, "train_tokens_per_second": 12166.567 }, { "epoch": 1.6267169404793966, "grad_norm": 1.1161743661659889, "learning_rate": 8.354679340555044e-07, "loss": 0.3146426439285278, "num_input_tokens_seen": 770019560, "step": 24160, "train_runtime": 63289.9489, "train_tokens_per_second": 12166.538 }, { "epoch": 1.6270535954753569, "grad_norm": 0.7952408894900088, "learning_rate": 8.34005244695707e-07, "loss": 0.2780102252960205, "num_input_tokens_seen": 770176480, "step": 24165, "train_runtime": 63303.211, "train_tokens_per_second": 12166.468 }, { "epoch": 1.6273902504713171, "grad_norm": 0.7486200156296614, "learning_rate": 8.325437203430558e-07, "loss": 0.2834614753723145, "num_input_tokens_seen": 770339096, "step": 24170, "train_runtime": 63315.8924, "train_tokens_per_second": 12166.599 }, { "epoch": 1.6277269054672772, "grad_norm": 0.7737967800920933, "learning_rate": 8.310833614062652e-07, "loss": 0.2856858730316162, "num_input_tokens_seen": 770497872, "step": 24175, "train_runtime": 63328.5684, "train_tokens_per_second": 12166.671 }, { "epoch": 1.6280635604632372, "grad_norm": 0.9274625579728031, "learning_rate": 8.296241682937189e-07, "loss": 0.29600985050201417, "num_input_tokens_seen": 770661040, "step": 24180, "train_runtime": 63341.4437, "train_tokens_per_second": 12166.774 }, { "epoch": 1.6284002154591974, "grad_norm": 0.8079267319951388, "learning_rate": 8.281661414134761e-07, "loss": 0.2907759189605713, "num_input_tokens_seen": 770820912, "step": 24185, "train_runtime": 63354.5998, "train_tokens_per_second": 12166.771 }, { "epoch": 1.6287368704551577, "grad_norm": 0.845864441731933, "learning_rate": 8.267092811732686e-07, "loss": 0.3025081634521484, "num_input_tokens_seen": 770981824, "step": 24190, "train_runtime": 63367.0383, "train_tokens_per_second": 12166.922 }, { "epoch": 1.6290735254511177, "grad_norm": 0.7080033781103762, "learning_rate": 8.252535879805029e-07, "loss": 0.27605319023132324, "num_input_tokens_seen": 771145112, "step": 24195, "train_runtime": 63380.5946, "train_tokens_per_second": 12166.896 }, { "epoch": 1.6294101804470777, "grad_norm": 0.8033876998268532, "learning_rate": 8.237990622422576e-07, "loss": 0.27672591209411623, "num_input_tokens_seen": 771305248, "step": 24200, "train_runtime": 63393.4492, "train_tokens_per_second": 12166.955 }, { "epoch": 1.629746835443038, "grad_norm": 0.7655449967698873, "learning_rate": 8.223457043652905e-07, "loss": 0.30393733978271487, "num_input_tokens_seen": 771463680, "step": 24205, "train_runtime": 63406.3015, "train_tokens_per_second": 12166.988 }, { "epoch": 1.6300834904389983, "grad_norm": 0.8451137950840152, "learning_rate": 8.208935147560227e-07, "loss": 0.28078672885894773, "num_input_tokens_seen": 771613552, "step": 24210, "train_runtime": 63420.1784, "train_tokens_per_second": 12166.688 }, { "epoch": 1.6304201454349583, "grad_norm": 0.804429927757353, "learning_rate": 8.194424938205597e-07, "loss": 0.3120806455612183, "num_input_tokens_seen": 771777376, "step": 24215, "train_runtime": 63433.2778, "train_tokens_per_second": 12166.759 }, { "epoch": 1.6307568004309183, "grad_norm": 0.782631122733815, "learning_rate": 8.179926419646705e-07, "loss": 0.2855846881866455, "num_input_tokens_seen": 771938032, "step": 24220, "train_runtime": 63447.3338, "train_tokens_per_second": 12166.595 }, { "epoch": 1.6310934554268786, "grad_norm": 0.8600488533172096, "learning_rate": 8.165439595938047e-07, "loss": 0.3102189302444458, "num_input_tokens_seen": 772094568, "step": 24225, "train_runtime": 63460.8781, "train_tokens_per_second": 12166.465 }, { "epoch": 1.6314301104228388, "grad_norm": 0.806568039891321, "learning_rate": 8.150964471130801e-07, "loss": 0.27042691707611083, "num_input_tokens_seen": 772256024, "step": 24230, "train_runtime": 63473.8003, "train_tokens_per_second": 12166.532 }, { "epoch": 1.6317667654187988, "grad_norm": 0.8369493286590751, "learning_rate": 8.136501049272899e-07, "loss": 0.30075955390930176, "num_input_tokens_seen": 772415168, "step": 24235, "train_runtime": 63486.7184, "train_tokens_per_second": 12166.563 }, { "epoch": 1.6321034204147589, "grad_norm": 0.8156058326835, "learning_rate": 8.122049334408983e-07, "loss": 0.29486808776855467, "num_input_tokens_seen": 772571464, "step": 24240, "train_runtime": 63499.7164, "train_tokens_per_second": 12166.534 }, { "epoch": 1.6324400754107191, "grad_norm": 0.794288060930167, "learning_rate": 8.107609330580429e-07, "loss": 0.2836303234100342, "num_input_tokens_seen": 772730200, "step": 24245, "train_runtime": 63512.8394, "train_tokens_per_second": 12166.52 }, { "epoch": 1.6327767304066794, "grad_norm": 0.8035824180793449, "learning_rate": 8.093181041825332e-07, "loss": 0.3022428512573242, "num_input_tokens_seen": 772889904, "step": 24250, "train_runtime": 63525.4523, "train_tokens_per_second": 12166.618 }, { "epoch": 1.6331133854026394, "grad_norm": 0.7930371606299825, "learning_rate": 8.078764472178552e-07, "loss": 0.28709795475006106, "num_input_tokens_seen": 773050360, "step": 24255, "train_runtime": 63538.795, "train_tokens_per_second": 12166.588 }, { "epoch": 1.6334500403985994, "grad_norm": 0.7620219829466326, "learning_rate": 8.06435962567158e-07, "loss": 0.3325523376464844, "num_input_tokens_seen": 773200576, "step": 24260, "train_runtime": 63552.2196, "train_tokens_per_second": 12166.382 }, { "epoch": 1.6337866953945597, "grad_norm": 0.8221932630750418, "learning_rate": 8.049966506332746e-07, "loss": 0.26060056686401367, "num_input_tokens_seen": 773360104, "step": 24265, "train_runtime": 63565.2594, "train_tokens_per_second": 12166.396 }, { "epoch": 1.63412335039052, "grad_norm": 0.6856320664378047, "learning_rate": 8.035585118186984e-07, "loss": 0.2741750717163086, "num_input_tokens_seen": 773516544, "step": 24270, "train_runtime": 63578.3636, "train_tokens_per_second": 12166.349 }, { "epoch": 1.63446000538648, "grad_norm": 0.8581768641464982, "learning_rate": 8.021215465256038e-07, "loss": 0.2776967525482178, "num_input_tokens_seen": 773680384, "step": 24275, "train_runtime": 63590.7991, "train_tokens_per_second": 12166.546 }, { "epoch": 1.63479666038244, "grad_norm": 0.7821643611991164, "learning_rate": 8.006857551558328e-07, "loss": 0.29167101383209226, "num_input_tokens_seen": 773841632, "step": 24280, "train_runtime": 63603.2777, "train_tokens_per_second": 12166.694 }, { "epoch": 1.6351333153784002, "grad_norm": 0.8211554745480923, "learning_rate": 7.992511381108997e-07, "loss": 0.29289889335632324, "num_input_tokens_seen": 774005472, "step": 24285, "train_runtime": 63615.7292, "train_tokens_per_second": 12166.888 }, { "epoch": 1.6354699703743605, "grad_norm": 0.7986141595545517, "learning_rate": 7.978176957919909e-07, "loss": 0.29323616027832033, "num_input_tokens_seen": 774162896, "step": 24290, "train_runtime": 63628.9795, "train_tokens_per_second": 12166.829 }, { "epoch": 1.6358066253703205, "grad_norm": 0.7328296562966558, "learning_rate": 7.963854285999634e-07, "loss": 0.26825311183929446, "num_input_tokens_seen": 774323320, "step": 24295, "train_runtime": 63642.284, "train_tokens_per_second": 12166.806 }, { "epoch": 1.6361432803662805, "grad_norm": 0.8240197526386364, "learning_rate": 7.949543369353452e-07, "loss": 0.283182430267334, "num_input_tokens_seen": 774475992, "step": 24300, "train_runtime": 63654.9716, "train_tokens_per_second": 12166.779 }, { "epoch": 1.6364799353622408, "grad_norm": 0.7668292683811512, "learning_rate": 7.9352442119834e-07, "loss": 0.31056530475616456, "num_input_tokens_seen": 774633784, "step": 24305, "train_runtime": 63668.0438, "train_tokens_per_second": 12166.76 }, { "epoch": 1.636816590358201, "grad_norm": 0.8738225059299793, "learning_rate": 7.920956817888148e-07, "loss": 0.30580363273620603, "num_input_tokens_seen": 774792136, "step": 24310, "train_runtime": 63680.5945, "train_tokens_per_second": 12166.848 }, { "epoch": 1.637153245354161, "grad_norm": 0.8642533231809156, "learning_rate": 7.906681191063165e-07, "loss": 0.28445570468902587, "num_input_tokens_seen": 774953704, "step": 24315, "train_runtime": 63693.924, "train_tokens_per_second": 12166.839 }, { "epoch": 1.637489900350121, "grad_norm": 0.8458765554541205, "learning_rate": 7.892417335500541e-07, "loss": 0.29718751907348634, "num_input_tokens_seen": 775108032, "step": 24320, "train_runtime": 63707.1626, "train_tokens_per_second": 12166.733 }, { "epoch": 1.6378265553460813, "grad_norm": 0.8596582141905486, "learning_rate": 7.878165255189146e-07, "loss": 0.30609903335571287, "num_input_tokens_seen": 775263728, "step": 24325, "train_runtime": 63721.4602, "train_tokens_per_second": 12166.446 }, { "epoch": 1.6381632103420416, "grad_norm": 0.9126288868451309, "learning_rate": 7.863924954114522e-07, "loss": 0.2848400115966797, "num_input_tokens_seen": 775417728, "step": 24330, "train_runtime": 63734.9331, "train_tokens_per_second": 12166.291 }, { "epoch": 1.6384998653380016, "grad_norm": 0.738572347750081, "learning_rate": 7.849696436258919e-07, "loss": 0.2891238212585449, "num_input_tokens_seen": 775575368, "step": 24335, "train_runtime": 63747.9713, "train_tokens_per_second": 12166.275 }, { "epoch": 1.6388365203339617, "grad_norm": 0.824887729877554, "learning_rate": 7.835479705601307e-07, "loss": 0.30775496959686277, "num_input_tokens_seen": 775732568, "step": 24340, "train_runtime": 63761.221, "train_tokens_per_second": 12166.213 }, { "epoch": 1.639173175329922, "grad_norm": 0.702895576509229, "learning_rate": 7.821274766117337e-07, "loss": 0.2852254629135132, "num_input_tokens_seen": 775892552, "step": 24345, "train_runtime": 63774.0817, "train_tokens_per_second": 12166.268 }, { "epoch": 1.6395098303258822, "grad_norm": 0.8800750132058125, "learning_rate": 7.807081621779367e-07, "loss": 0.31917245388031007, "num_input_tokens_seen": 776052032, "step": 24350, "train_runtime": 63787.306, "train_tokens_per_second": 12166.246 }, { "epoch": 1.6398464853218422, "grad_norm": 0.8215854971835287, "learning_rate": 7.792900276556509e-07, "loss": 0.30937120914459226, "num_input_tokens_seen": 776215016, "step": 24355, "train_runtime": 63800.1336, "train_tokens_per_second": 12166.354 }, { "epoch": 1.6401831403178022, "grad_norm": 0.9790639792640997, "learning_rate": 7.778730734414469e-07, "loss": 0.29734656810760496, "num_input_tokens_seen": 776371536, "step": 24360, "train_runtime": 63813.3018, "train_tokens_per_second": 12166.296 }, { "epoch": 1.6405197953137625, "grad_norm": 0.8277688813243606, "learning_rate": 7.764572999315772e-07, "loss": 0.29772610664367677, "num_input_tokens_seen": 776533944, "step": 24365, "train_runtime": 63825.7413, "train_tokens_per_second": 12166.47 }, { "epoch": 1.6408564503097227, "grad_norm": 0.9025338683222252, "learning_rate": 7.750427075219536e-07, "loss": 0.30924651622772215, "num_input_tokens_seen": 776694664, "step": 24370, "train_runtime": 63839.2529, "train_tokens_per_second": 12166.412 }, { "epoch": 1.6411931053056827, "grad_norm": 0.8534588650036673, "learning_rate": 7.736292966081655e-07, "loss": 0.2794644355773926, "num_input_tokens_seen": 776848984, "step": 24375, "train_runtime": 63852.7888, "train_tokens_per_second": 12166.25 }, { "epoch": 1.6415297603016428, "grad_norm": 0.6731146122196049, "learning_rate": 7.722170675854673e-07, "loss": 0.2518440246582031, "num_input_tokens_seen": 777012168, "step": 24380, "train_runtime": 63865.6895, "train_tokens_per_second": 12166.347 }, { "epoch": 1.641866415297603, "grad_norm": 0.8778606499912358, "learning_rate": 7.70806020848785e-07, "loss": 0.28110690116882325, "num_input_tokens_seen": 777169536, "step": 24385, "train_runtime": 63878.5592, "train_tokens_per_second": 12166.36 }, { "epoch": 1.6422030702935633, "grad_norm": 0.7349206220743536, "learning_rate": 7.693961567927133e-07, "loss": 0.28679332733154295, "num_input_tokens_seen": 777328920, "step": 24390, "train_runtime": 63891.8442, "train_tokens_per_second": 12166.325 }, { "epoch": 1.6425397252895233, "grad_norm": 0.794626711975228, "learning_rate": 7.679874758115153e-07, "loss": 0.28293309211730955, "num_input_tokens_seen": 777489512, "step": 24395, "train_runtime": 63904.295, "train_tokens_per_second": 12166.467 }, { "epoch": 1.6428763802854833, "grad_norm": 0.7491062357049881, "learning_rate": 7.66579978299124e-07, "loss": 0.29605047702789306, "num_input_tokens_seen": 777651216, "step": 24400, "train_runtime": 63916.8433, "train_tokens_per_second": 12166.609 }, { "epoch": 1.6432130352814436, "grad_norm": 0.9334734303650634, "learning_rate": 7.651736646491447e-07, "loss": 0.31244916915893556, "num_input_tokens_seen": 777805072, "step": 24405, "train_runtime": 63929.6701, "train_tokens_per_second": 12166.574 }, { "epoch": 1.6435496902774038, "grad_norm": 0.7137461174549735, "learning_rate": 7.63768535254844e-07, "loss": 0.2654087543487549, "num_input_tokens_seen": 777961056, "step": 24410, "train_runtime": 63942.3061, "train_tokens_per_second": 12166.609 }, { "epoch": 1.6438863452733639, "grad_norm": 0.8075241409367051, "learning_rate": 7.623645905091664e-07, "loss": 0.3217033863067627, "num_input_tokens_seen": 778123672, "step": 24415, "train_runtime": 63956.2644, "train_tokens_per_second": 12166.497 }, { "epoch": 1.6442230002693239, "grad_norm": 0.8320110918344632, "learning_rate": 7.609618308047156e-07, "loss": 0.295696496963501, "num_input_tokens_seen": 778279768, "step": 24420, "train_runtime": 63969.0501, "train_tokens_per_second": 12166.505 }, { "epoch": 1.6445596552652841, "grad_norm": 0.818360548136631, "learning_rate": 7.595602565337729e-07, "loss": 0.2922187805175781, "num_input_tokens_seen": 778442360, "step": 24425, "train_runtime": 63981.759, "train_tokens_per_second": 12166.63 }, { "epoch": 1.6448963102612444, "grad_norm": 0.9051018105676516, "learning_rate": 7.581598680882829e-07, "loss": 0.32529101371765134, "num_input_tokens_seen": 778603096, "step": 24430, "train_runtime": 63994.6544, "train_tokens_per_second": 12166.69 }, { "epoch": 1.6452329652572044, "grad_norm": 0.8512258132001573, "learning_rate": 7.567606658598592e-07, "loss": 0.29698853492736815, "num_input_tokens_seen": 778764928, "step": 24435, "train_runtime": 64007.3131, "train_tokens_per_second": 12166.812 }, { "epoch": 1.6455696202531644, "grad_norm": 0.7737965517345735, "learning_rate": 7.553626502397848e-07, "loss": 0.3084287166595459, "num_input_tokens_seen": 778925096, "step": 24440, "train_runtime": 64020.1161, "train_tokens_per_second": 12166.88 }, { "epoch": 1.6459062752491247, "grad_norm": 0.8388135353213578, "learning_rate": 7.539658216190099e-07, "loss": 0.27610599994659424, "num_input_tokens_seen": 779087216, "step": 24445, "train_runtime": 64034.0301, "train_tokens_per_second": 12166.768 }, { "epoch": 1.646242930245085, "grad_norm": 0.8353793438820949, "learning_rate": 7.525701803881525e-07, "loss": 0.28893413543701174, "num_input_tokens_seen": 779244472, "step": 24450, "train_runtime": 64047.2685, "train_tokens_per_second": 12166.709 }, { "epoch": 1.646579585241045, "grad_norm": 0.8495842876277677, "learning_rate": 7.511757269375019e-07, "loss": 0.29696547985076904, "num_input_tokens_seen": 779401800, "step": 24455, "train_runtime": 64060.6533, "train_tokens_per_second": 12166.623 }, { "epoch": 1.646916240237005, "grad_norm": 0.7318834495535411, "learning_rate": 7.497824616570087e-07, "loss": 0.3057637929916382, "num_input_tokens_seen": 779557528, "step": 24460, "train_runtime": 64074.4667, "train_tokens_per_second": 12166.43 }, { "epoch": 1.6472528952329653, "grad_norm": 0.7519547033221803, "learning_rate": 7.483903849362995e-07, "loss": 0.30504086017608645, "num_input_tokens_seen": 779720736, "step": 24465, "train_runtime": 64087.3919, "train_tokens_per_second": 12166.523 }, { "epoch": 1.6475895502289255, "grad_norm": 0.8023276071812534, "learning_rate": 7.469994971646594e-07, "loss": 0.30136420726776125, "num_input_tokens_seen": 779884576, "step": 24470, "train_runtime": 64099.8358, "train_tokens_per_second": 12166.717 }, { "epoch": 1.6479262052248855, "grad_norm": 0.7999572249193063, "learning_rate": 7.456097987310495e-07, "loss": 0.3037379026412964, "num_input_tokens_seen": 780042880, "step": 24475, "train_runtime": 64112.497, "train_tokens_per_second": 12166.784 }, { "epoch": 1.6482628602208456, "grad_norm": 0.8891394877797107, "learning_rate": 7.442212900240931e-07, "loss": 0.3144464731216431, "num_input_tokens_seen": 780202224, "step": 24480, "train_runtime": 64126.0869, "train_tokens_per_second": 12166.69 }, { "epoch": 1.6485995152168058, "grad_norm": 0.8225060528988165, "learning_rate": 7.42833971432082e-07, "loss": 0.26826887130737304, "num_input_tokens_seen": 780357752, "step": 24485, "train_runtime": 64139.6515, "train_tokens_per_second": 12166.542 }, { "epoch": 1.648936170212766, "grad_norm": 0.852375756224124, "learning_rate": 7.414478433429756e-07, "loss": 0.3042499542236328, "num_input_tokens_seen": 780517424, "step": 24490, "train_runtime": 64152.9481, "train_tokens_per_second": 12166.509 }, { "epoch": 1.649272825208726, "grad_norm": 0.8297732205005874, "learning_rate": 7.400629061444003e-07, "loss": 0.28996710777282714, "num_input_tokens_seen": 780680168, "step": 24495, "train_runtime": 64165.6924, "train_tokens_per_second": 12166.629 }, { "epoch": 1.6496094802046861, "grad_norm": 0.7762853077289567, "learning_rate": 7.386791602236482e-07, "loss": 0.3154712200164795, "num_input_tokens_seen": 780842352, "step": 24500, "train_runtime": 64178.3105, "train_tokens_per_second": 12166.764 }, { "epoch": 1.6499461352006464, "grad_norm": 0.7358643541224151, "learning_rate": 7.372966059676834e-07, "loss": 0.34027299880981443, "num_input_tokens_seen": 781005312, "step": 24505, "train_runtime": 64190.7988, "train_tokens_per_second": 12166.936 }, { "epoch": 1.6502827901966066, "grad_norm": 0.7860742417587284, "learning_rate": 7.359152437631273e-07, "loss": 0.32011971473693845, "num_input_tokens_seen": 781165832, "step": 24510, "train_runtime": 64203.6236, "train_tokens_per_second": 12167.005 }, { "epoch": 1.6506194451925666, "grad_norm": 0.7915108321402856, "learning_rate": 7.345350739962781e-07, "loss": 0.2763681888580322, "num_input_tokens_seen": 781325080, "step": 24515, "train_runtime": 64217.0725, "train_tokens_per_second": 12166.937 }, { "epoch": 1.6509561001885267, "grad_norm": 0.7946283389120277, "learning_rate": 7.331560970530921e-07, "loss": 0.2875345230102539, "num_input_tokens_seen": 781485296, "step": 24520, "train_runtime": 64230.7141, "train_tokens_per_second": 12166.847 }, { "epoch": 1.651292755184487, "grad_norm": 0.7706121419902808, "learning_rate": 7.317783133191986e-07, "loss": 0.2798483371734619, "num_input_tokens_seen": 781645032, "step": 24525, "train_runtime": 64243.4483, "train_tokens_per_second": 12166.922 }, { "epoch": 1.6516294101804472, "grad_norm": 0.8180446553701978, "learning_rate": 7.304017231798893e-07, "loss": 0.2899933815002441, "num_input_tokens_seen": 781805960, "step": 24530, "train_runtime": 64256.6043, "train_tokens_per_second": 12166.935 }, { "epoch": 1.6519660651764072, "grad_norm": 0.8591443386862397, "learning_rate": 7.290263270201231e-07, "loss": 0.29896907806396483, "num_input_tokens_seen": 781967288, "step": 24535, "train_runtime": 64270.0333, "train_tokens_per_second": 12166.903 }, { "epoch": 1.6523027201723672, "grad_norm": 0.73914215931305, "learning_rate": 7.276521252245261e-07, "loss": 0.2778233528137207, "num_input_tokens_seen": 782124272, "step": 24540, "train_runtime": 64283.9905, "train_tokens_per_second": 12166.704 }, { "epoch": 1.6526393751683275, "grad_norm": 0.8563638866414667, "learning_rate": 7.262791181773882e-07, "loss": 0.2700481414794922, "num_input_tokens_seen": 782284712, "step": 24545, "train_runtime": 64296.5472, "train_tokens_per_second": 12166.823 }, { "epoch": 1.6529760301642877, "grad_norm": 0.8050080644355319, "learning_rate": 7.24907306262666e-07, "loss": 0.3003551483154297, "num_input_tokens_seen": 782445200, "step": 24550, "train_runtime": 64309.815, "train_tokens_per_second": 12166.808 }, { "epoch": 1.6533126851602478, "grad_norm": 0.8627966280927176, "learning_rate": 7.235366898639856e-07, "loss": 0.31953437328338624, "num_input_tokens_seen": 782605672, "step": 24555, "train_runtime": 64322.6497, "train_tokens_per_second": 12166.876 }, { "epoch": 1.6536493401562078, "grad_norm": 0.8239890846106095, "learning_rate": 7.221672693646309e-07, "loss": 0.3055120944976807, "num_input_tokens_seen": 782767248, "step": 24560, "train_runtime": 64335.724, "train_tokens_per_second": 12166.914 }, { "epoch": 1.653985995152168, "grad_norm": 0.8567067485281902, "learning_rate": 7.207990451475594e-07, "loss": 0.3114776611328125, "num_input_tokens_seen": 782926632, "step": 24565, "train_runtime": 64348.1903, "train_tokens_per_second": 12167.034 }, { "epoch": 1.6543226501481283, "grad_norm": 0.9293053788639143, "learning_rate": 7.194320175953901e-07, "loss": 0.2935426950454712, "num_input_tokens_seen": 783085000, "step": 24570, "train_runtime": 64362.2029, "train_tokens_per_second": 12166.846 }, { "epoch": 1.6546593051440883, "grad_norm": 0.7893763492333773, "learning_rate": 7.180661870904066e-07, "loss": 0.2772150278091431, "num_input_tokens_seen": 783246264, "step": 24575, "train_runtime": 64375.1269, "train_tokens_per_second": 12166.908 }, { "epoch": 1.6549959601400483, "grad_norm": 0.7859561604847938, "learning_rate": 7.167015540145599e-07, "loss": 0.2854712247848511, "num_input_tokens_seen": 783405080, "step": 24580, "train_runtime": 64387.6834, "train_tokens_per_second": 12167.002 }, { "epoch": 1.6553326151360086, "grad_norm": 1.140232536017856, "learning_rate": 7.153381187494657e-07, "loss": 0.314476466178894, "num_input_tokens_seen": 783564432, "step": 24585, "train_runtime": 64401.3051, "train_tokens_per_second": 12166.903 }, { "epoch": 1.6556692701319689, "grad_norm": 0.7641572550593998, "learning_rate": 7.139758816764036e-07, "loss": 0.27437562942504884, "num_input_tokens_seen": 783722520, "step": 24590, "train_runtime": 64415.5495, "train_tokens_per_second": 12166.667 }, { "epoch": 1.6560059251279289, "grad_norm": 0.7809144199716783, "learning_rate": 7.126148431763191e-07, "loss": 0.2809741735458374, "num_input_tokens_seen": 783886144, "step": 24595, "train_runtime": 64428.6143, "train_tokens_per_second": 12166.739 }, { "epoch": 1.656342580123889, "grad_norm": 0.7386572533465269, "learning_rate": 7.11255003629821e-07, "loss": 0.3045970439910889, "num_input_tokens_seen": 784048728, "step": 24600, "train_runtime": 64441.9942, "train_tokens_per_second": 12166.736 }, { "epoch": 1.6566792351198492, "grad_norm": 0.7579949196464796, "learning_rate": 7.098963634171874e-07, "loss": 0.28805837631225584, "num_input_tokens_seen": 784212568, "step": 24605, "train_runtime": 64454.4314, "train_tokens_per_second": 12166.93 }, { "epoch": 1.6570158901158094, "grad_norm": 0.9961820875125137, "learning_rate": 7.085389229183537e-07, "loss": 0.3036026954650879, "num_input_tokens_seen": 784366664, "step": 24610, "train_runtime": 64468.3023, "train_tokens_per_second": 12166.703 }, { "epoch": 1.6573525451117694, "grad_norm": 0.8250558416433791, "learning_rate": 7.071826825129264e-07, "loss": 0.2892672777175903, "num_input_tokens_seen": 784524104, "step": 24615, "train_runtime": 64481.0635, "train_tokens_per_second": 12166.736 }, { "epoch": 1.6576892001077295, "grad_norm": 0.8334326248391096, "learning_rate": 7.058276425801735e-07, "loss": 0.2980621576309204, "num_input_tokens_seen": 784682144, "step": 24620, "train_runtime": 64493.9979, "train_tokens_per_second": 12166.747 }, { "epoch": 1.6580258551036897, "grad_norm": 0.832889988012181, "learning_rate": 7.044738034990273e-07, "loss": 0.28281078338623045, "num_input_tokens_seen": 784836320, "step": 24625, "train_runtime": 64507.2966, "train_tokens_per_second": 12166.629 }, { "epoch": 1.65836251009965, "grad_norm": 0.8173642569194277, "learning_rate": 7.031211656480841e-07, "loss": 0.30190751552581785, "num_input_tokens_seen": 784995672, "step": 24630, "train_runtime": 64520.6157, "train_tokens_per_second": 12166.587 }, { "epoch": 1.65869916509561, "grad_norm": 0.8238521754438797, "learning_rate": 7.017697294056058e-07, "loss": 0.27278072834014894, "num_input_tokens_seen": 785151448, "step": 24635, "train_runtime": 64533.2624, "train_tokens_per_second": 12166.616 }, { "epoch": 1.65903582009157, "grad_norm": 0.8437614794475293, "learning_rate": 7.004194951495163e-07, "loss": 0.31250820159912107, "num_input_tokens_seen": 785312232, "step": 24640, "train_runtime": 64546.0994, "train_tokens_per_second": 12166.688 }, { "epoch": 1.6593724750875303, "grad_norm": 0.8414446713180203, "learning_rate": 6.990704632574046e-07, "loss": 0.2838765621185303, "num_input_tokens_seen": 785475392, "step": 24645, "train_runtime": 64558.9902, "train_tokens_per_second": 12166.786 }, { "epoch": 1.6597091300834905, "grad_norm": 0.8752982276305432, "learning_rate": 6.977226341065219e-07, "loss": 0.2985983371734619, "num_input_tokens_seen": 785635888, "step": 24650, "train_runtime": 64572.5933, "train_tokens_per_second": 12166.708 }, { "epoch": 1.6600457850794506, "grad_norm": 0.7170720497317911, "learning_rate": 6.96376008073788e-07, "loss": 0.3128868579864502, "num_input_tokens_seen": 785791488, "step": 24655, "train_runtime": 64585.6943, "train_tokens_per_second": 12166.649 }, { "epoch": 1.6603824400754106, "grad_norm": 0.8087022953927849, "learning_rate": 6.950305855357781e-07, "loss": 0.28070683479309083, "num_input_tokens_seen": 785951064, "step": 24660, "train_runtime": 64599.4302, "train_tokens_per_second": 12166.532 }, { "epoch": 1.6607190950713708, "grad_norm": 0.8065406231325483, "learning_rate": 6.936863668687383e-07, "loss": 0.2973364591598511, "num_input_tokens_seen": 786110616, "step": 24665, "train_runtime": 64612.7108, "train_tokens_per_second": 12166.501 }, { "epoch": 1.661055750067331, "grad_norm": 0.8741764427135748, "learning_rate": 6.923433524485745e-07, "loss": 0.3147925138473511, "num_input_tokens_seen": 786272752, "step": 24670, "train_runtime": 64625.2994, "train_tokens_per_second": 12166.64 }, { "epoch": 1.6613924050632911, "grad_norm": 0.7848960465835426, "learning_rate": 6.910015426508554e-07, "loss": 0.28102545738220214, "num_input_tokens_seen": 786432592, "step": 24675, "train_runtime": 64637.9967, "train_tokens_per_second": 12166.723 }, { "epoch": 1.6617290600592511, "grad_norm": 0.8781606751794255, "learning_rate": 6.896609378508152e-07, "loss": 0.28995914459228517, "num_input_tokens_seen": 786590112, "step": 24680, "train_runtime": 64651.2917, "train_tokens_per_second": 12166.657 }, { "epoch": 1.6620657150552114, "grad_norm": 0.7834359487259148, "learning_rate": 6.883215384233488e-07, "loss": 0.29813547134399415, "num_input_tokens_seen": 786752560, "step": 24685, "train_runtime": 64663.956, "train_tokens_per_second": 12166.787 }, { "epoch": 1.6624023700511716, "grad_norm": 0.7660412647829145, "learning_rate": 6.869833447430152e-07, "loss": 0.2689774990081787, "num_input_tokens_seen": 786908016, "step": 24690, "train_runtime": 64677.1263, "train_tokens_per_second": 12166.713 }, { "epoch": 1.6627390250471317, "grad_norm": 0.7915924640479196, "learning_rate": 6.856463571840361e-07, "loss": 0.29881303310394286, "num_input_tokens_seen": 787063768, "step": 24695, "train_runtime": 64691.2609, "train_tokens_per_second": 12166.462 }, { "epoch": 1.6630756800430917, "grad_norm": 0.8443564079002597, "learning_rate": 6.843105761202945e-07, "loss": 0.30872206687927245, "num_input_tokens_seen": 787225720, "step": 24700, "train_runtime": 64704.2796, "train_tokens_per_second": 12166.517 }, { "epoch": 1.663412335039052, "grad_norm": 0.8447607488022807, "learning_rate": 6.829760019253412e-07, "loss": 0.31563601493835447, "num_input_tokens_seen": 787386296, "step": 24705, "train_runtime": 64718.5162, "train_tokens_per_second": 12166.322 }, { "epoch": 1.6637489900350122, "grad_norm": 0.7691659766558674, "learning_rate": 6.816426349723804e-07, "loss": 0.2945215702056885, "num_input_tokens_seen": 787545984, "step": 24710, "train_runtime": 64731.8672, "train_tokens_per_second": 12166.279 }, { "epoch": 1.6640856450309722, "grad_norm": 0.7179484283114269, "learning_rate": 6.803104756342877e-07, "loss": 0.27899928092956544, "num_input_tokens_seen": 787709392, "step": 24715, "train_runtime": 64744.8911, "train_tokens_per_second": 12166.356 }, { "epoch": 1.6644223000269323, "grad_norm": 0.7709716945746821, "learning_rate": 6.789795242835962e-07, "loss": 0.2734822750091553, "num_input_tokens_seen": 787871016, "step": 24720, "train_runtime": 64757.4259, "train_tokens_per_second": 12166.497 }, { "epoch": 1.6647589550228925, "grad_norm": 0.8109986173128949, "learning_rate": 6.776497812925015e-07, "loss": 0.2983099460601807, "num_input_tokens_seen": 788026944, "step": 24725, "train_runtime": 64770.4586, "train_tokens_per_second": 12166.456 }, { "epoch": 1.6650956100188528, "grad_norm": 0.8183885397275192, "learning_rate": 6.763212470328628e-07, "loss": 0.3206261396408081, "num_input_tokens_seen": 788187024, "step": 24730, "train_runtime": 64784.3197, "train_tokens_per_second": 12166.324 }, { "epoch": 1.6654322650148128, "grad_norm": 0.8371204081076756, "learning_rate": 6.749939218762003e-07, "loss": 0.28403759002685547, "num_input_tokens_seen": 788346408, "step": 24735, "train_runtime": 64797.4674, "train_tokens_per_second": 12166.315 }, { "epoch": 1.6657689200107728, "grad_norm": 0.762067437460842, "learning_rate": 6.736678061936958e-07, "loss": 0.30754292011260986, "num_input_tokens_seen": 788510248, "step": 24740, "train_runtime": 64809.8992, "train_tokens_per_second": 12166.509 }, { "epoch": 1.666105575006733, "grad_norm": 0.887905166242567, "learning_rate": 6.723429003561937e-07, "loss": 0.3109133720397949, "num_input_tokens_seen": 788674064, "step": 24745, "train_runtime": 64823.0241, "train_tokens_per_second": 12166.573 }, { "epoch": 1.6664422300026933, "grad_norm": 0.818816776587006, "learning_rate": 6.710192047341984e-07, "loss": 0.2882524967193604, "num_input_tokens_seen": 788836864, "step": 24750, "train_runtime": 64836.4744, "train_tokens_per_second": 12166.56 }, { "epoch": 1.6667788849986533, "grad_norm": 0.846196048328415, "learning_rate": 6.69696719697881e-07, "loss": 0.2957979917526245, "num_input_tokens_seen": 788995008, "step": 24755, "train_runtime": 64849.3859, "train_tokens_per_second": 12166.576 }, { "epoch": 1.6671155399946134, "grad_norm": 0.8950515125724958, "learning_rate": 6.683754456170655e-07, "loss": 0.2931551218032837, "num_input_tokens_seen": 789150408, "step": 24760, "train_runtime": 64862.6985, "train_tokens_per_second": 12166.475 }, { "epoch": 1.6674521949905736, "grad_norm": 0.8790866423810335, "learning_rate": 6.670553828612448e-07, "loss": 0.27227044105529785, "num_input_tokens_seen": 789298096, "step": 24765, "train_runtime": 64875.4303, "train_tokens_per_second": 12166.364 }, { "epoch": 1.6677888499865339, "grad_norm": 0.7534159667693646, "learning_rate": 6.657365317995696e-07, "loss": 0.2873995304107666, "num_input_tokens_seen": 789456344, "step": 24770, "train_runtime": 64888.323, "train_tokens_per_second": 12166.385 }, { "epoch": 1.668125504982494, "grad_norm": 0.9008555406699663, "learning_rate": 6.644188928008521e-07, "loss": 0.3240548610687256, "num_input_tokens_seen": 789615872, "step": 24775, "train_runtime": 64901.5678, "train_tokens_per_second": 12166.361 }, { "epoch": 1.668462159978454, "grad_norm": 0.841304067912514, "learning_rate": 6.631024662335667e-07, "loss": 0.2955070972442627, "num_input_tokens_seen": 789777096, "step": 24780, "train_runtime": 64915.5285, "train_tokens_per_second": 12166.228 }, { "epoch": 1.6687988149744142, "grad_norm": 0.7886676019245754, "learning_rate": 6.617872524658469e-07, "loss": 0.29398746490478517, "num_input_tokens_seen": 789939712, "step": 24785, "train_runtime": 64928.3662, "train_tokens_per_second": 12166.327 }, { "epoch": 1.6691354699703744, "grad_norm": 0.911116559677418, "learning_rate": 6.604732518654882e-07, "loss": 0.32519259452819826, "num_input_tokens_seen": 790100112, "step": 24790, "train_runtime": 64941.6739, "train_tokens_per_second": 12166.303 }, { "epoch": 1.6694721249663345, "grad_norm": 0.9911429598771344, "learning_rate": 6.591604647999473e-07, "loss": 0.3286020755767822, "num_input_tokens_seen": 790261832, "step": 24795, "train_runtime": 64954.2364, "train_tokens_per_second": 12166.44 }, { "epoch": 1.6698087799622945, "grad_norm": 0.8196102888807713, "learning_rate": 6.57848891636339e-07, "loss": 0.2925854682922363, "num_input_tokens_seen": 790424512, "step": 24800, "train_runtime": 64967.4825, "train_tokens_per_second": 12166.464 }, { "epoch": 1.6701454349582547, "grad_norm": 0.8547180961356758, "learning_rate": 6.565385327414441e-07, "loss": 0.302751350402832, "num_input_tokens_seen": 790587536, "step": 24805, "train_runtime": 64979.9176, "train_tokens_per_second": 12166.644 }, { "epoch": 1.670482089954215, "grad_norm": 0.9427370040418245, "learning_rate": 6.552293884816968e-07, "loss": 0.28897724151611326, "num_input_tokens_seen": 790749664, "step": 24810, "train_runtime": 64992.5046, "train_tokens_per_second": 12166.782 }, { "epoch": 1.670818744950175, "grad_norm": 0.8119793074297755, "learning_rate": 6.539214592231968e-07, "loss": 0.30264132022857665, "num_input_tokens_seen": 790913160, "step": 24815, "train_runtime": 65005.5266, "train_tokens_per_second": 12166.86 }, { "epoch": 1.671155399946135, "grad_norm": 0.7406111247740471, "learning_rate": 6.526147453317028e-07, "loss": 0.2658879280090332, "num_input_tokens_seen": 791072448, "step": 24820, "train_runtime": 65018.6997, "train_tokens_per_second": 12166.845 }, { "epoch": 1.6714920549420953, "grad_norm": 0.7930303218007095, "learning_rate": 6.513092471726307e-07, "loss": 0.28693251609802245, "num_input_tokens_seen": 791236072, "step": 24825, "train_runtime": 65031.7537, "train_tokens_per_second": 12166.919 }, { "epoch": 1.6718287099380555, "grad_norm": 0.7575652909819368, "learning_rate": 6.500049651110635e-07, "loss": 0.27247180938720705, "num_input_tokens_seen": 791397040, "step": 24830, "train_runtime": 65044.2045, "train_tokens_per_second": 12167.065 }, { "epoch": 1.6721653649340156, "grad_norm": 0.7998019760301968, "learning_rate": 6.487018995117339e-07, "loss": 0.28848905563354493, "num_input_tokens_seen": 791560680, "step": 24835, "train_runtime": 65057.2534, "train_tokens_per_second": 12167.14 }, { "epoch": 1.6725020199299756, "grad_norm": 0.8296847140983191, "learning_rate": 6.474000507390455e-07, "loss": 0.30805058479309083, "num_input_tokens_seen": 791718304, "step": 24840, "train_runtime": 65069.9378, "train_tokens_per_second": 12167.19 }, { "epoch": 1.6728386749259359, "grad_norm": 0.7701757083170343, "learning_rate": 6.460994191570513e-07, "loss": 0.30128433704376223, "num_input_tokens_seen": 791876000, "step": 24845, "train_runtime": 65082.9422, "train_tokens_per_second": 12167.182 }, { "epoch": 1.673175329921896, "grad_norm": 0.7513119329211971, "learning_rate": 6.448000051294717e-07, "loss": 0.2735928535461426, "num_input_tokens_seen": 792034328, "step": 24850, "train_runtime": 65095.5789, "train_tokens_per_second": 12167.252 }, { "epoch": 1.6735119849178561, "grad_norm": 0.8225468389917898, "learning_rate": 6.435018090196832e-07, "loss": 0.308670711517334, "num_input_tokens_seen": 792194048, "step": 24855, "train_runtime": 65108.2782, "train_tokens_per_second": 12167.332 }, { "epoch": 1.6738486399138162, "grad_norm": 0.8609698368247336, "learning_rate": 6.42204831190722e-07, "loss": 0.28301177024841306, "num_input_tokens_seen": 792355728, "step": 24860, "train_runtime": 65120.8944, "train_tokens_per_second": 12167.458 }, { "epoch": 1.6741852949097764, "grad_norm": 0.7659254821924985, "learning_rate": 6.409090720052835e-07, "loss": 0.29714231491088866, "num_input_tokens_seen": 792515296, "step": 24865, "train_runtime": 65134.6343, "train_tokens_per_second": 12167.341 }, { "epoch": 1.6745219499057367, "grad_norm": 0.8604700645447717, "learning_rate": 6.396145318257229e-07, "loss": 0.27208235263824465, "num_input_tokens_seen": 792675656, "step": 24870, "train_runtime": 65147.0717, "train_tokens_per_second": 12167.479 }, { "epoch": 1.6748586049016967, "grad_norm": 0.8609426563584132, "learning_rate": 6.383212110140535e-07, "loss": 0.3103998899459839, "num_input_tokens_seen": 792837608, "step": 24875, "train_runtime": 65160.2245, "train_tokens_per_second": 12167.509 }, { "epoch": 1.6751952598976567, "grad_norm": 0.9586762874187554, "learning_rate": 6.370291099319509e-07, "loss": 0.31565978527069094, "num_input_tokens_seen": 792991128, "step": 24880, "train_runtime": 65173.4604, "train_tokens_per_second": 12167.393 }, { "epoch": 1.675531914893617, "grad_norm": 0.8551573410931695, "learning_rate": 6.357382289407433e-07, "loss": 0.2924635410308838, "num_input_tokens_seen": 793153024, "step": 24885, "train_runtime": 65185.9169, "train_tokens_per_second": 12167.552 }, { "epoch": 1.6758685698895772, "grad_norm": 0.8476076837495868, "learning_rate": 6.344485684014251e-07, "loss": 0.30182876586914065, "num_input_tokens_seen": 793313656, "step": 24890, "train_runtime": 65200.4934, "train_tokens_per_second": 12167.295 }, { "epoch": 1.6762052248855372, "grad_norm": 0.8405731887367258, "learning_rate": 6.33160128674642e-07, "loss": 0.3063340187072754, "num_input_tokens_seen": 793467792, "step": 24895, "train_runtime": 65214.331, "train_tokens_per_second": 12167.077 }, { "epoch": 1.6765418798814973, "grad_norm": 0.7686886313507418, "learning_rate": 6.318729101207055e-07, "loss": 0.2698678493499756, "num_input_tokens_seen": 793629256, "step": 24900, "train_runtime": 65226.8217, "train_tokens_per_second": 12167.223 }, { "epoch": 1.6768785348774575, "grad_norm": 0.7284589151207705, "learning_rate": 6.305869130995807e-07, "loss": 0.29496011734008787, "num_input_tokens_seen": 793787552, "step": 24905, "train_runtime": 65240.1136, "train_tokens_per_second": 12167.17 }, { "epoch": 1.6772151898734178, "grad_norm": 0.833853455823911, "learning_rate": 6.293021379708924e-07, "loss": 0.292670464515686, "num_input_tokens_seen": 793948200, "step": 24910, "train_runtime": 65253.2612, "train_tokens_per_second": 12167.18 }, { "epoch": 1.6775518448693778, "grad_norm": 0.9040130025802267, "learning_rate": 6.280185850939241e-07, "loss": 0.3286106586456299, "num_input_tokens_seen": 794106544, "step": 24915, "train_runtime": 65266.4184, "train_tokens_per_second": 12167.154 }, { "epoch": 1.677888499865338, "grad_norm": 0.9045331775157412, "learning_rate": 6.267362548276173e-07, "loss": 0.29216506481170657, "num_input_tokens_seen": 794260440, "step": 24920, "train_runtime": 65279.3056, "train_tokens_per_second": 12167.109 }, { "epoch": 1.6782251548612983, "grad_norm": 1.0288707002050386, "learning_rate": 6.254551475305703e-07, "loss": 0.2966667652130127, "num_input_tokens_seen": 794412768, "step": 24925, "train_runtime": 65292.4407, "train_tokens_per_second": 12166.995 }, { "epoch": 1.6785618098572583, "grad_norm": 0.8068678335477649, "learning_rate": 6.241752635610443e-07, "loss": 0.311280345916748, "num_input_tokens_seen": 794569672, "step": 24930, "train_runtime": 65305.232, "train_tokens_per_second": 12167.014 }, { "epoch": 1.6788984648532184, "grad_norm": 1.0258507048417855, "learning_rate": 6.228966032769496e-07, "loss": 0.2994679927825928, "num_input_tokens_seen": 794725976, "step": 24935, "train_runtime": 65317.6931, "train_tokens_per_second": 12167.086 }, { "epoch": 1.6792351198491786, "grad_norm": 0.8490317773296896, "learning_rate": 6.216191670358651e-07, "loss": 0.2810512065887451, "num_input_tokens_seen": 794885856, "step": 24940, "train_runtime": 65330.8312, "train_tokens_per_second": 12167.086 }, { "epoch": 1.6795717748451389, "grad_norm": 0.8489160808967282, "learning_rate": 6.203429551950163e-07, "loss": 0.3216299533843994, "num_input_tokens_seen": 795048208, "step": 24945, "train_runtime": 65344.1076, "train_tokens_per_second": 12167.099 }, { "epoch": 1.679908429841099, "grad_norm": 0.802119375622299, "learning_rate": 6.19067968111296e-07, "loss": 0.28259685039520266, "num_input_tokens_seen": 795202472, "step": 24950, "train_runtime": 65356.8625, "train_tokens_per_second": 12167.085 }, { "epoch": 1.680245084837059, "grad_norm": 0.7646118795940126, "learning_rate": 6.177942061412478e-07, "loss": 0.27660164833068845, "num_input_tokens_seen": 795359088, "step": 24955, "train_runtime": 65369.9021, "train_tokens_per_second": 12167.053 }, { "epoch": 1.6805817398330192, "grad_norm": 0.8584390639720236, "learning_rate": 6.16521669641077e-07, "loss": 0.29123899936676023, "num_input_tokens_seen": 795520752, "step": 24960, "train_runtime": 65383.0624, "train_tokens_per_second": 12167.077 }, { "epoch": 1.6809183948289794, "grad_norm": 0.8825573592954843, "learning_rate": 6.152503589666426e-07, "loss": 0.2991896629333496, "num_input_tokens_seen": 795683296, "step": 24965, "train_runtime": 65395.7305, "train_tokens_per_second": 12167.206 }, { "epoch": 1.6812550498249395, "grad_norm": 0.7423301422017123, "learning_rate": 6.139802744734636e-07, "loss": 0.27493629455566404, "num_input_tokens_seen": 795841856, "step": 24970, "train_runtime": 65409.2445, "train_tokens_per_second": 12167.116 }, { "epoch": 1.6815917048208995, "grad_norm": 0.8120249723915178, "learning_rate": 6.127114165167142e-07, "loss": 0.27087857723236086, "num_input_tokens_seen": 796000576, "step": 24975, "train_runtime": 65422.6031, "train_tokens_per_second": 12167.058 }, { "epoch": 1.6819283598168597, "grad_norm": 0.8694596864525649, "learning_rate": 6.11443785451229e-07, "loss": 0.29536535739898684, "num_input_tokens_seen": 796158048, "step": 24980, "train_runtime": 65435.4906, "train_tokens_per_second": 12167.068 }, { "epoch": 1.68226501481282, "grad_norm": 0.7954669130086321, "learning_rate": 6.101773816314926e-07, "loss": 0.28241686820983886, "num_input_tokens_seen": 796321600, "step": 24985, "train_runtime": 65448.4976, "train_tokens_per_second": 12167.149 }, { "epoch": 1.68260166980878, "grad_norm": 0.8158471587174305, "learning_rate": 6.089122054116558e-07, "loss": 0.2966434478759766, "num_input_tokens_seen": 796483744, "step": 24990, "train_runtime": 65461.3473, "train_tokens_per_second": 12167.237 }, { "epoch": 1.68293832480474, "grad_norm": 0.8239316003862425, "learning_rate": 6.076482571455161e-07, "loss": 0.29096825122833253, "num_input_tokens_seen": 796644136, "step": 24995, "train_runtime": 65473.7756, "train_tokens_per_second": 12167.377 }, { "epoch": 1.6832749798007003, "grad_norm": 0.8748118720362762, "learning_rate": 6.063855371865369e-07, "loss": 0.29922871589660643, "num_input_tokens_seen": 796795752, "step": 25000, "train_runtime": 65486.8272, "train_tokens_per_second": 12167.268 }, { "epoch": 1.6836116347966605, "grad_norm": 0.9029056520147132, "learning_rate": 6.051240458878316e-07, "loss": 0.3211724281311035, "num_input_tokens_seen": 796952408, "step": 25005, "train_runtime": 65499.6099, "train_tokens_per_second": 12167.285 }, { "epoch": 1.6839482897926206, "grad_norm": 0.8838281004255323, "learning_rate": 6.038637836021721e-07, "loss": 0.3115694046020508, "num_input_tokens_seen": 797112144, "step": 25010, "train_runtime": 65512.2602, "train_tokens_per_second": 12167.374 }, { "epoch": 1.6842849447885806, "grad_norm": 0.760497580542647, "learning_rate": 6.026047506819882e-07, "loss": 0.28313503265380857, "num_input_tokens_seen": 797268448, "step": 25015, "train_runtime": 65525.3849, "train_tokens_per_second": 12167.322 }, { "epoch": 1.6846215997845408, "grad_norm": 0.759568014344448, "learning_rate": 6.013469474793632e-07, "loss": 0.28777251243591306, "num_input_tokens_seen": 797429480, "step": 25020, "train_runtime": 65537.8376, "train_tokens_per_second": 12167.467 }, { "epoch": 1.684958254780501, "grad_norm": 0.8391435060120102, "learning_rate": 6.000903743460368e-07, "loss": 0.2923095226287842, "num_input_tokens_seen": 797591656, "step": 25025, "train_runtime": 65550.3769, "train_tokens_per_second": 12167.614 }, { "epoch": 1.6852949097764611, "grad_norm": 0.779009047921114, "learning_rate": 5.98835031633409e-07, "loss": 0.306101131439209, "num_input_tokens_seen": 797754744, "step": 25030, "train_runtime": 65563.5068, "train_tokens_per_second": 12167.664 }, { "epoch": 1.6856315647724212, "grad_norm": 0.8654898552594379, "learning_rate": 5.97580919692528e-07, "loss": 0.3088191032409668, "num_input_tokens_seen": 797917040, "step": 25035, "train_runtime": 65576.7921, "train_tokens_per_second": 12167.674 }, { "epoch": 1.6859682197683814, "grad_norm": 0.8153521505961947, "learning_rate": 5.963280388741072e-07, "loss": 0.2744007587432861, "num_input_tokens_seen": 798076840, "step": 25040, "train_runtime": 65590.5025, "train_tokens_per_second": 12167.567 }, { "epoch": 1.6863048747643417, "grad_norm": 0.9418888309743303, "learning_rate": 5.950763895285055e-07, "loss": 0.27949841022491456, "num_input_tokens_seen": 798229648, "step": 25045, "train_runtime": 65603.2589, "train_tokens_per_second": 12167.53 }, { "epoch": 1.6866415297603017, "grad_norm": 0.7379573626459642, "learning_rate": 5.938259720057465e-07, "loss": 0.28723607063293455, "num_input_tokens_seen": 798388304, "step": 25050, "train_runtime": 65616.2777, "train_tokens_per_second": 12167.534 }, { "epoch": 1.6869781847562617, "grad_norm": 0.8030639037252914, "learning_rate": 5.925767866555043e-07, "loss": 0.2873709201812744, "num_input_tokens_seen": 798544608, "step": 25055, "train_runtime": 65629.6022, "train_tokens_per_second": 12167.445 }, { "epoch": 1.687314839752222, "grad_norm": 0.9214551354387678, "learning_rate": 5.913288338271095e-07, "loss": 0.3072784423828125, "num_input_tokens_seen": 798707512, "step": 25060, "train_runtime": 65642.5952, "train_tokens_per_second": 12167.519 }, { "epoch": 1.6876514947481822, "grad_norm": 0.7634145241254645, "learning_rate": 5.900821138695478e-07, "loss": 0.28399407863616943, "num_input_tokens_seen": 798869000, "step": 25065, "train_runtime": 65655.3825, "train_tokens_per_second": 12167.609 }, { "epoch": 1.6879881497441422, "grad_norm": 0.79298226071443, "learning_rate": 5.888366271314605e-07, "loss": 0.28875155448913575, "num_input_tokens_seen": 799031968, "step": 25070, "train_runtime": 65668.1901, "train_tokens_per_second": 12167.717 }, { "epoch": 1.6883248047401023, "grad_norm": 0.8122251724242145, "learning_rate": 5.875923739611439e-07, "loss": 0.3123459339141846, "num_input_tokens_seen": 799190928, "step": 25075, "train_runtime": 65680.9091, "train_tokens_per_second": 12167.781 }, { "epoch": 1.6886614597360625, "grad_norm": 0.7205528364107072, "learning_rate": 5.863493547065513e-07, "loss": 0.28240170478820803, "num_input_tokens_seen": 799349656, "step": 25080, "train_runtime": 65693.7333, "train_tokens_per_second": 12167.822 }, { "epoch": 1.6889981147320228, "grad_norm": 0.7380578058180574, "learning_rate": 5.851075697152858e-07, "loss": 0.2742695093154907, "num_input_tokens_seen": 799512880, "step": 25085, "train_runtime": 65706.6368, "train_tokens_per_second": 12167.917 }, { "epoch": 1.6893347697279828, "grad_norm": 0.8490158962466555, "learning_rate": 5.838670193346118e-07, "loss": 0.30379667282104494, "num_input_tokens_seen": 799669112, "step": 25090, "train_runtime": 65719.2175, "train_tokens_per_second": 12167.965 }, { "epoch": 1.6896714247239428, "grad_norm": 0.8154353187052651, "learning_rate": 5.826277039114426e-07, "loss": 0.27211599349975585, "num_input_tokens_seen": 799831752, "step": 25095, "train_runtime": 65731.9464, "train_tokens_per_second": 12168.083 }, { "epoch": 1.690008079719903, "grad_norm": 0.8059264446728833, "learning_rate": 5.813896237923505e-07, "loss": 0.3278991222381592, "num_input_tokens_seen": 799993864, "step": 25100, "train_runtime": 65744.4972, "train_tokens_per_second": 12168.225 }, { "epoch": 1.6903447347158633, "grad_norm": 0.800496170335914, "learning_rate": 5.801527793235606e-07, "loss": 0.30397605895996094, "num_input_tokens_seen": 800156864, "step": 25105, "train_runtime": 65757.3347, "train_tokens_per_second": 12168.329 }, { "epoch": 1.6906813897118234, "grad_norm": 0.7501265440937339, "learning_rate": 5.789171708509516e-07, "loss": 0.285453724861145, "num_input_tokens_seen": 800314512, "step": 25110, "train_runtime": 65771.4995, "train_tokens_per_second": 12168.105 }, { "epoch": 1.6910180447077834, "grad_norm": 0.7684838344201916, "learning_rate": 5.776827987200584e-07, "loss": 0.307835054397583, "num_input_tokens_seen": 800473488, "step": 25115, "train_runtime": 65784.5323, "train_tokens_per_second": 12168.111 }, { "epoch": 1.6913546997037436, "grad_norm": 0.8267263091646561, "learning_rate": 5.764496632760691e-07, "loss": 0.274769926071167, "num_input_tokens_seen": 800627016, "step": 25120, "train_runtime": 65797.2195, "train_tokens_per_second": 12168.098 }, { "epoch": 1.6916913546997039, "grad_norm": 0.7602366286621726, "learning_rate": 5.752177648638241e-07, "loss": 0.2738208770751953, "num_input_tokens_seen": 800785592, "step": 25125, "train_runtime": 65809.8771, "train_tokens_per_second": 12168.167 }, { "epoch": 1.692028009695664, "grad_norm": 0.8855191529361517, "learning_rate": 5.739871038278239e-07, "loss": 0.3088421106338501, "num_input_tokens_seen": 800942568, "step": 25130, "train_runtime": 65822.8847, "train_tokens_per_second": 12168.147 }, { "epoch": 1.692364664691624, "grad_norm": 0.7763642930103014, "learning_rate": 5.727576805122142e-07, "loss": 0.2768913507461548, "num_input_tokens_seen": 801101544, "step": 25135, "train_runtime": 65836.1083, "train_tokens_per_second": 12168.118 }, { "epoch": 1.6927013196875842, "grad_norm": 0.7696662641219881, "learning_rate": 5.715294952608041e-07, "loss": 0.2835252285003662, "num_input_tokens_seen": 801264232, "step": 25140, "train_runtime": 65848.7502, "train_tokens_per_second": 12168.253 }, { "epoch": 1.6930379746835444, "grad_norm": 0.9588288462807922, "learning_rate": 5.703025484170471e-07, "loss": 0.3243107795715332, "num_input_tokens_seen": 801425240, "step": 25145, "train_runtime": 65861.2258, "train_tokens_per_second": 12168.392 }, { "epoch": 1.6933746296795045, "grad_norm": 0.8809431854390011, "learning_rate": 5.690768403240587e-07, "loss": 0.3107900857925415, "num_input_tokens_seen": 801587016, "step": 25150, "train_runtime": 65875.0499, "train_tokens_per_second": 12168.295 }, { "epoch": 1.6937112846754645, "grad_norm": 0.7938221178191538, "learning_rate": 5.67852371324602e-07, "loss": 0.30399086475372317, "num_input_tokens_seen": 801750680, "step": 25155, "train_runtime": 65888.1034, "train_tokens_per_second": 12168.368 }, { "epoch": 1.6940479396714248, "grad_norm": 0.8069563375262169, "learning_rate": 5.66629141761097e-07, "loss": 0.2899326324462891, "num_input_tokens_seen": 801911128, "step": 25160, "train_runtime": 65900.5449, "train_tokens_per_second": 12168.505 }, { "epoch": 1.694384594667385, "grad_norm": 0.7997407532466363, "learning_rate": 5.654071519756154e-07, "loss": 0.29592466354370117, "num_input_tokens_seen": 802074056, "step": 25165, "train_runtime": 65913.4002, "train_tokens_per_second": 12168.604 }, { "epoch": 1.694721249663345, "grad_norm": 0.8217694503633814, "learning_rate": 5.641864023098831e-07, "loss": 0.3291255712509155, "num_input_tokens_seen": 802235128, "step": 25170, "train_runtime": 65926.9011, "train_tokens_per_second": 12168.555 }, { "epoch": 1.695057904659305, "grad_norm": 0.792292176665687, "learning_rate": 5.629668931052773e-07, "loss": 0.3054348468780518, "num_input_tokens_seen": 802398624, "step": 25175, "train_runtime": 65939.9123, "train_tokens_per_second": 12168.633 }, { "epoch": 1.6953945596552653, "grad_norm": 0.8185731335853207, "learning_rate": 5.61748624702833e-07, "loss": 0.3245995044708252, "num_input_tokens_seen": 802558256, "step": 25180, "train_runtime": 65952.4274, "train_tokens_per_second": 12168.745 }, { "epoch": 1.6957312146512256, "grad_norm": 0.8777389401390597, "learning_rate": 5.605315974432313e-07, "loss": 0.3108147144317627, "num_input_tokens_seen": 802718096, "step": 25185, "train_runtime": 65965.1012, "train_tokens_per_second": 12168.83 }, { "epoch": 1.6960678696471856, "grad_norm": 0.756552154977697, "learning_rate": 5.593158116668146e-07, "loss": 0.2891570568084717, "num_input_tokens_seen": 802881936, "step": 25190, "train_runtime": 65977.544, "train_tokens_per_second": 12169.018 }, { "epoch": 1.6964045246431456, "grad_norm": 0.8816252492366896, "learning_rate": 5.581012677135683e-07, "loss": 0.29001004695892335, "num_input_tokens_seen": 803032584, "step": 25195, "train_runtime": 65991.0029, "train_tokens_per_second": 12168.819 }, { "epoch": 1.6967411796391059, "grad_norm": 0.8250004805569026, "learning_rate": 5.56887965923139e-07, "loss": 0.3027050971984863, "num_input_tokens_seen": 803193512, "step": 25200, "train_runtime": 66003.4904, "train_tokens_per_second": 12168.955 }, { "epoch": 1.6970778346350661, "grad_norm": 0.8384060628920201, "learning_rate": 5.556759066348227e-07, "loss": 0.29056997299194337, "num_input_tokens_seen": 803353376, "step": 25205, "train_runtime": 66015.9885, "train_tokens_per_second": 12169.073 }, { "epoch": 1.6974144896310261, "grad_norm": 0.7681827073711663, "learning_rate": 5.54465090187567e-07, "loss": 0.3030840396881104, "num_input_tokens_seen": 803512024, "step": 25210, "train_runtime": 66029.304, "train_tokens_per_second": 12169.022 }, { "epoch": 1.6977511446269862, "grad_norm": 0.795024711685822, "learning_rate": 5.532555169199727e-07, "loss": 0.28143887519836425, "num_input_tokens_seen": 803667336, "step": 25215, "train_runtime": 66042.6213, "train_tokens_per_second": 12168.919 }, { "epoch": 1.6980877996229464, "grad_norm": 0.7589717236028772, "learning_rate": 5.520471871702937e-07, "loss": 0.2832162618637085, "num_input_tokens_seen": 803827896, "step": 25220, "train_runtime": 66055.7154, "train_tokens_per_second": 12168.938 }, { "epoch": 1.6984244546189067, "grad_norm": 0.8627059760443402, "learning_rate": 5.508401012764341e-07, "loss": 0.2953542709350586, "num_input_tokens_seen": 803985080, "step": 25225, "train_runtime": 66069.0204, "train_tokens_per_second": 12168.866 }, { "epoch": 1.6987611096148667, "grad_norm": 0.75552966329654, "learning_rate": 5.496342595759552e-07, "loss": 0.268917179107666, "num_input_tokens_seen": 804148920, "step": 25230, "train_runtime": 66081.446, "train_tokens_per_second": 12169.058 }, { "epoch": 1.6990977646108267, "grad_norm": 0.7520443819579034, "learning_rate": 5.484296624060626e-07, "loss": 0.2827796220779419, "num_input_tokens_seen": 804311176, "step": 25235, "train_runtime": 66094.0401, "train_tokens_per_second": 12169.194 }, { "epoch": 1.699434419606787, "grad_norm": 0.793656659551414, "learning_rate": 5.472263101036212e-07, "loss": 0.29239912033081056, "num_input_tokens_seen": 804472584, "step": 25240, "train_runtime": 66107.3031, "train_tokens_per_second": 12169.194 }, { "epoch": 1.6997710746027472, "grad_norm": 0.9828065726238588, "learning_rate": 5.460242030051421e-07, "loss": 0.3105603218078613, "num_input_tokens_seen": 804631344, "step": 25245, "train_runtime": 66120.7819, "train_tokens_per_second": 12169.114 }, { "epoch": 1.7001077295987073, "grad_norm": 0.7515100376319965, "learning_rate": 5.448233414467924e-07, "loss": 0.30887694358825685, "num_input_tokens_seen": 804794872, "step": 25250, "train_runtime": 66133.8209, "train_tokens_per_second": 12169.188 }, { "epoch": 1.7004443845946673, "grad_norm": 0.7532891696818705, "learning_rate": 5.43623725764389e-07, "loss": 0.31564314365386964, "num_input_tokens_seen": 804956656, "step": 25255, "train_runtime": 66146.8369, "train_tokens_per_second": 12169.239 }, { "epoch": 1.7007810395906275, "grad_norm": 0.7971741527408678, "learning_rate": 5.424253562934001e-07, "loss": 0.28030054569244384, "num_input_tokens_seen": 805119344, "step": 25260, "train_runtime": 66159.4874, "train_tokens_per_second": 12169.371 }, { "epoch": 1.7011176945865878, "grad_norm": 0.79111863716471, "learning_rate": 5.412282333689461e-07, "loss": 0.30404462814331057, "num_input_tokens_seen": 805280840, "step": 25265, "train_runtime": 66173.1564, "train_tokens_per_second": 12169.298 }, { "epoch": 1.7014543495825478, "grad_norm": 0.8126911369748564, "learning_rate": 5.400323573257987e-07, "loss": 0.29868664741516116, "num_input_tokens_seen": 805442984, "step": 25270, "train_runtime": 66186.3881, "train_tokens_per_second": 12169.315 }, { "epoch": 1.7017910045785078, "grad_norm": 0.7531648950013857, "learning_rate": 5.388377284983803e-07, "loss": 0.2803764581680298, "num_input_tokens_seen": 805602968, "step": 25275, "train_runtime": 66199.1101, "train_tokens_per_second": 12169.393 }, { "epoch": 1.702127659574468, "grad_norm": 0.8686858212633283, "learning_rate": 5.37644347220767e-07, "loss": 0.3020791053771973, "num_input_tokens_seen": 805760112, "step": 25280, "train_runtime": 66211.7765, "train_tokens_per_second": 12169.438 }, { "epoch": 1.7024643145704283, "grad_norm": 0.8803022160278495, "learning_rate": 5.364522138266809e-07, "loss": 0.296372127532959, "num_input_tokens_seen": 805922272, "step": 25285, "train_runtime": 66224.3722, "train_tokens_per_second": 12169.572 }, { "epoch": 1.7028009695663884, "grad_norm": 0.8155451927873711, "learning_rate": 5.352613286495018e-07, "loss": 0.29341325759887693, "num_input_tokens_seen": 806077168, "step": 25290, "train_runtime": 66237.3282, "train_tokens_per_second": 12169.53 }, { "epoch": 1.7031376245623484, "grad_norm": 0.7520090991767232, "learning_rate": 5.340716920222527e-07, "loss": 0.2737943172454834, "num_input_tokens_seen": 806240136, "step": 25295, "train_runtime": 66250.3744, "train_tokens_per_second": 12169.594 }, { "epoch": 1.7034742795583087, "grad_norm": 0.962050645372596, "learning_rate": 5.32883304277616e-07, "loss": 0.3186910629272461, "num_input_tokens_seen": 806397272, "step": 25300, "train_runtime": 66263.47, "train_tokens_per_second": 12169.56 }, { "epoch": 1.703810934554269, "grad_norm": 0.8852503516110072, "learning_rate": 5.31696165747918e-07, "loss": 0.2684332370758057, "num_input_tokens_seen": 806557824, "step": 25305, "train_runtime": 66276.883, "train_tokens_per_second": 12169.52 }, { "epoch": 1.704147589550229, "grad_norm": 0.8404307815649437, "learning_rate": 5.305102767651393e-07, "loss": 0.29191365242004397, "num_input_tokens_seen": 806721296, "step": 25310, "train_runtime": 66289.3267, "train_tokens_per_second": 12169.701 }, { "epoch": 1.704484244546189, "grad_norm": 0.846110243738861, "learning_rate": 5.293256376609091e-07, "loss": 0.30517499446868895, "num_input_tokens_seen": 806881824, "step": 25315, "train_runtime": 66302.0578, "train_tokens_per_second": 12169.786 }, { "epoch": 1.7048208995421492, "grad_norm": 0.7807440591766549, "learning_rate": 5.281422487665089e-07, "loss": 0.28216400146484377, "num_input_tokens_seen": 807045664, "step": 25320, "train_runtime": 66314.498, "train_tokens_per_second": 12169.973 }, { "epoch": 1.7051575545381095, "grad_norm": 0.8635260531680488, "learning_rate": 5.269601104128674e-07, "loss": 0.2909599542617798, "num_input_tokens_seen": 807209504, "step": 25325, "train_runtime": 66326.9527, "train_tokens_per_second": 12170.158 }, { "epoch": 1.7054942095340695, "grad_norm": 0.7950375112966951, "learning_rate": 5.257792229305702e-07, "loss": 0.31408185958862306, "num_input_tokens_seen": 807366936, "step": 25330, "train_runtime": 66339.6443, "train_tokens_per_second": 12170.203 }, { "epoch": 1.7058308645300295, "grad_norm": 0.8419617185275647, "learning_rate": 5.245995866498438e-07, "loss": 0.2757680416107178, "num_input_tokens_seen": 807525288, "step": 25335, "train_runtime": 66352.277, "train_tokens_per_second": 12170.272 }, { "epoch": 1.7061675195259898, "grad_norm": 0.8276594986765249, "learning_rate": 5.234212019005741e-07, "loss": 0.3080322265625, "num_input_tokens_seen": 807682488, "step": 25340, "train_runtime": 66365.6176, "train_tokens_per_second": 12170.195 }, { "epoch": 1.70650417452195, "grad_norm": 0.8101383319675212, "learning_rate": 5.222440690122882e-07, "loss": 0.2870373010635376, "num_input_tokens_seen": 807841080, "step": 25345, "train_runtime": 66378.7291, "train_tokens_per_second": 12170.18 }, { "epoch": 1.70684082951791, "grad_norm": 0.7850745560927895, "learning_rate": 5.210681883141716e-07, "loss": 0.2790995121002197, "num_input_tokens_seen": 808002272, "step": 25350, "train_runtime": 66391.5753, "train_tokens_per_second": 12170.253 }, { "epoch": 1.70717748451387, "grad_norm": 0.8957888916427711, "learning_rate": 5.19893560135053e-07, "loss": 0.290134072303772, "num_input_tokens_seen": 808163320, "step": 25355, "train_runtime": 66404.0398, "train_tokens_per_second": 12170.394 }, { "epoch": 1.7075141395098303, "grad_norm": 0.7858696037693033, "learning_rate": 5.187201848034146e-07, "loss": 0.28968205451965334, "num_input_tokens_seen": 808322728, "step": 25360, "train_runtime": 66417.5816, "train_tokens_per_second": 12170.313 }, { "epoch": 1.7078507945057906, "grad_norm": 0.8550267368462614, "learning_rate": 5.175480626473873e-07, "loss": 0.28513302803039553, "num_input_tokens_seen": 808480216, "step": 25365, "train_runtime": 66430.0339, "train_tokens_per_second": 12170.402 }, { "epoch": 1.7081874495017506, "grad_norm": 0.8828328480467336, "learning_rate": 5.163771939947504e-07, "loss": 0.3155116081237793, "num_input_tokens_seen": 808639720, "step": 25370, "train_runtime": 66442.7997, "train_tokens_per_second": 12170.464 }, { "epoch": 1.7085241044977106, "grad_norm": 0.7612968275476691, "learning_rate": 5.152075791729327e-07, "loss": 0.32192938327789306, "num_input_tokens_seen": 808801456, "step": 25375, "train_runtime": 66455.2734, "train_tokens_per_second": 12170.614 }, { "epoch": 1.7088607594936709, "grad_norm": 0.7431298964019118, "learning_rate": 5.140392185090165e-07, "loss": 0.28952252864837646, "num_input_tokens_seen": 808957096, "step": 25380, "train_runtime": 66469.1381, "train_tokens_per_second": 12170.417 }, { "epoch": 1.7091974144896311, "grad_norm": 1.0990000083010292, "learning_rate": 5.128721123297265e-07, "loss": 0.30175418853759767, "num_input_tokens_seen": 809120936, "step": 25385, "train_runtime": 66481.5743, "train_tokens_per_second": 12170.604 }, { "epoch": 1.7095340694855912, "grad_norm": 0.8230642088537091, "learning_rate": 5.117062609614438e-07, "loss": 0.2878246784210205, "num_input_tokens_seen": 809280272, "step": 25390, "train_runtime": 66495.3832, "train_tokens_per_second": 12170.473 }, { "epoch": 1.7098707244815512, "grad_norm": 0.8900825345581529, "learning_rate": 5.105416647301909e-07, "loss": 0.2841442584991455, "num_input_tokens_seen": 809441840, "step": 25395, "train_runtime": 66507.9221, "train_tokens_per_second": 12170.608 }, { "epoch": 1.7102073794775114, "grad_norm": 0.791905554161877, "learning_rate": 5.093783239616468e-07, "loss": 0.2772679328918457, "num_input_tokens_seen": 809598632, "step": 25400, "train_runtime": 66521.2847, "train_tokens_per_second": 12170.52 }, { "epoch": 1.7105440344734717, "grad_norm": 0.9200165243376989, "learning_rate": 5.082162389811352e-07, "loss": 0.27681775093078614, "num_input_tokens_seen": 809753656, "step": 25405, "train_runtime": 66534.1817, "train_tokens_per_second": 12170.491 }, { "epoch": 1.7108806894694317, "grad_norm": 1.5782738080737202, "learning_rate": 5.070554101136288e-07, "loss": 0.2743373394012451, "num_input_tokens_seen": 809906648, "step": 25410, "train_runtime": 66548.2509, "train_tokens_per_second": 12170.217 }, { "epoch": 1.7112173444653918, "grad_norm": 0.7513323227337197, "learning_rate": 5.058958376837497e-07, "loss": 0.2892336845397949, "num_input_tokens_seen": 810070488, "step": 25415, "train_runtime": 66560.6932, "train_tokens_per_second": 12170.403 }, { "epoch": 1.711553999461352, "grad_norm": 0.8138054579967886, "learning_rate": 5.047375220157691e-07, "loss": 0.2978404998779297, "num_input_tokens_seen": 810232992, "step": 25420, "train_runtime": 66574.0436, "train_tokens_per_second": 12170.404 }, { "epoch": 1.7118906544573123, "grad_norm": 0.7693054586269306, "learning_rate": 5.035804634336056e-07, "loss": 0.309088921546936, "num_input_tokens_seen": 810396688, "step": 25425, "train_runtime": 66587.1051, "train_tokens_per_second": 12170.475 }, { "epoch": 1.7122273094532723, "grad_norm": 0.7561704469377175, "learning_rate": 5.024246622608292e-07, "loss": 0.28566803932189944, "num_input_tokens_seen": 810560528, "step": 25430, "train_runtime": 66599.5478, "train_tokens_per_second": 12170.661 }, { "epoch": 1.7125639644492323, "grad_norm": 0.8608063236563862, "learning_rate": 5.01270118820652e-07, "loss": 0.3105528116226196, "num_input_tokens_seen": 810722896, "step": 25435, "train_runtime": 66612.1159, "train_tokens_per_second": 12170.802 }, { "epoch": 1.7129006194451926, "grad_norm": 0.8956766546025756, "learning_rate": 5.001168334359429e-07, "loss": 0.3243201971054077, "num_input_tokens_seen": 810883976, "step": 25440, "train_runtime": 66625.0262, "train_tokens_per_second": 12170.862 }, { "epoch": 1.7132372744411528, "grad_norm": 0.7532341570616985, "learning_rate": 4.989648064292102e-07, "loss": 0.2967890024185181, "num_input_tokens_seen": 811044848, "step": 25445, "train_runtime": 66637.9197, "train_tokens_per_second": 12170.921 }, { "epoch": 1.7135739294371128, "grad_norm": 0.873970233887233, "learning_rate": 4.978140381226177e-07, "loss": 0.3010232925415039, "num_input_tokens_seen": 811204952, "step": 25450, "train_runtime": 66650.793, "train_tokens_per_second": 12170.972 }, { "epoch": 1.7139105844330729, "grad_norm": 0.8014722503143785, "learning_rate": 4.966645288379729e-07, "loss": 0.27742342948913573, "num_input_tokens_seen": 811367616, "step": 25455, "train_runtime": 66664.1954, "train_tokens_per_second": 12170.965 }, { "epoch": 1.7142472394290331, "grad_norm": 0.8750279199355134, "learning_rate": 4.955162788967327e-07, "loss": 0.31605224609375, "num_input_tokens_seen": 811516008, "step": 25460, "train_runtime": 66678.2276, "train_tokens_per_second": 12170.63 }, { "epoch": 1.7145838944249934, "grad_norm": 0.721234063527085, "learning_rate": 4.943692886200013e-07, "loss": 0.3078624248504639, "num_input_tokens_seen": 811675352, "step": 25465, "train_runtime": 66691.488, "train_tokens_per_second": 12170.599 }, { "epoch": 1.7149205494209534, "grad_norm": 0.7563294229928634, "learning_rate": 4.932235583285305e-07, "loss": 0.2949864149093628, "num_input_tokens_seen": 811838784, "step": 25470, "train_runtime": 66704.4948, "train_tokens_per_second": 12170.676 }, { "epoch": 1.7152572044169134, "grad_norm": 0.8039529212651666, "learning_rate": 4.920790883427201e-07, "loss": 0.2986870288848877, "num_input_tokens_seen": 811996664, "step": 25475, "train_runtime": 66717.6808, "train_tokens_per_second": 12170.637 }, { "epoch": 1.7155938594128737, "grad_norm": 0.7985136356593623, "learning_rate": 4.909358789826196e-07, "loss": 0.30323760509490966, "num_input_tokens_seen": 812152672, "step": 25480, "train_runtime": 66731.6068, "train_tokens_per_second": 12170.435 }, { "epoch": 1.715930514408834, "grad_norm": 0.8711067618686908, "learning_rate": 4.897939305679206e-07, "loss": 0.3026529550552368, "num_input_tokens_seen": 812313928, "step": 25485, "train_runtime": 66744.0954, "train_tokens_per_second": 12170.574 }, { "epoch": 1.716267169404794, "grad_norm": 0.7375686367190549, "learning_rate": 4.886532434179686e-07, "loss": 0.29832355976104735, "num_input_tokens_seen": 812475168, "step": 25490, "train_runtime": 66757.0145, "train_tokens_per_second": 12170.634 }, { "epoch": 1.716603824400754, "grad_norm": 0.7764938970656083, "learning_rate": 4.875138178517497e-07, "loss": 0.25198540687561033, "num_input_tokens_seen": 812632704, "step": 25495, "train_runtime": 66769.8871, "train_tokens_per_second": 12170.647 }, { "epoch": 1.7169404793967142, "grad_norm": 0.841551135718732, "learning_rate": 4.863756541879028e-07, "loss": 0.315032958984375, "num_input_tokens_seen": 812796136, "step": 25500, "train_runtime": 66782.8999, "train_tokens_per_second": 12170.722 }, { "epoch": 1.7172771343926745, "grad_norm": 0.7432246312031906, "learning_rate": 4.852387527447117e-07, "loss": 0.28313241004943845, "num_input_tokens_seen": 812959976, "step": 25505, "train_runtime": 66795.3476, "train_tokens_per_second": 12170.907 }, { "epoch": 1.7176137893886345, "grad_norm": 0.7577631824245612, "learning_rate": 4.84103113840107e-07, "loss": 0.2972623348236084, "num_input_tokens_seen": 813122776, "step": 25510, "train_runtime": 66808.1767, "train_tokens_per_second": 12171.007 }, { "epoch": 1.7179504443845945, "grad_norm": 0.7883606567919665, "learning_rate": 4.829687377916664e-07, "loss": 0.29777188301086427, "num_input_tokens_seen": 813276304, "step": 25515, "train_runtime": 66821.563, "train_tokens_per_second": 12170.866 }, { "epoch": 1.7182870993805548, "grad_norm": 0.8435313346864439, "learning_rate": 4.81835624916614e-07, "loss": 0.27108373641967776, "num_input_tokens_seen": 813434048, "step": 25520, "train_runtime": 66834.3843, "train_tokens_per_second": 12170.892 }, { "epoch": 1.718623754376515, "grad_norm": 0.9132789679859118, "learning_rate": 4.807037755318211e-07, "loss": 0.29337828159332274, "num_input_tokens_seen": 813597104, "step": 25525, "train_runtime": 66847.4783, "train_tokens_per_second": 12170.947 }, { "epoch": 1.718960409372475, "grad_norm": 0.7058141725616477, "learning_rate": 4.795731899538086e-07, "loss": 0.30762457847595215, "num_input_tokens_seen": 813755728, "step": 25530, "train_runtime": 66860.8611, "train_tokens_per_second": 12170.883 }, { "epoch": 1.719297064368435, "grad_norm": 0.7380084515143684, "learning_rate": 4.78443868498737e-07, "loss": 0.26756463050842283, "num_input_tokens_seen": 813917880, "step": 25535, "train_runtime": 66873.4495, "train_tokens_per_second": 12171.017 }, { "epoch": 1.7196337193643954, "grad_norm": 0.8355686413790112, "learning_rate": 4.773158114824206e-07, "loss": 0.262506365776062, "num_input_tokens_seen": 814078216, "step": 25540, "train_runtime": 66887.1137, "train_tokens_per_second": 12170.928 }, { "epoch": 1.7199703743603556, "grad_norm": 0.8208269891522171, "learning_rate": 4.7618901922031445e-07, "loss": 0.2658960819244385, "num_input_tokens_seen": 814241224, "step": 25545, "train_runtime": 66901.3357, "train_tokens_per_second": 12170.777 }, { "epoch": 1.7203070293563156, "grad_norm": 0.8324669074118888, "learning_rate": 4.750634920275243e-07, "loss": 0.29631292819976807, "num_input_tokens_seen": 814399216, "step": 25550, "train_runtime": 66914.2267, "train_tokens_per_second": 12170.793 }, { "epoch": 1.7206436843522757, "grad_norm": 0.8552150436160211, "learning_rate": 4.739392302188001e-07, "loss": 0.31460275650024416, "num_input_tokens_seen": 814561632, "step": 25555, "train_runtime": 66927.1167, "train_tokens_per_second": 12170.876 }, { "epoch": 1.720980339348236, "grad_norm": 0.7958254794931157, "learning_rate": 4.728162341085368e-07, "loss": 0.299389386177063, "num_input_tokens_seen": 814723608, "step": 25560, "train_runtime": 66940.9859, "train_tokens_per_second": 12170.774 }, { "epoch": 1.7213169943441962, "grad_norm": 0.7394302930375213, "learning_rate": 4.7169450401077843e-07, "loss": 0.2992805004119873, "num_input_tokens_seen": 814885680, "step": 25565, "train_runtime": 66953.5686, "train_tokens_per_second": 12170.907 }, { "epoch": 1.7216536493401562, "grad_norm": 0.827383990258824, "learning_rate": 4.7057404023921174e-07, "loss": 0.2992172956466675, "num_input_tokens_seen": 815048136, "step": 25570, "train_runtime": 66966.8292, "train_tokens_per_second": 12170.923 }, { "epoch": 1.7219903043361162, "grad_norm": 0.8310427015417835, "learning_rate": 4.694548431071705e-07, "loss": 0.29741454124450684, "num_input_tokens_seen": 815205896, "step": 25575, "train_runtime": 66979.6326, "train_tokens_per_second": 12170.952 }, { "epoch": 1.7223269593320765, "grad_norm": 0.8117229033236854, "learning_rate": 4.683369129276377e-07, "loss": 0.29701454639434816, "num_input_tokens_seen": 815364968, "step": 25580, "train_runtime": 66992.5503, "train_tokens_per_second": 12170.98 }, { "epoch": 1.7226636143280367, "grad_norm": 0.7097050482395375, "learning_rate": 4.6722025001323444e-07, "loss": 0.2651503562927246, "num_input_tokens_seen": 815520632, "step": 25585, "train_runtime": 67006.0712, "train_tokens_per_second": 12170.847 }, { "epoch": 1.7230002693239967, "grad_norm": 0.8267504674703496, "learning_rate": 4.6610485467623643e-07, "loss": 0.2984716176986694, "num_input_tokens_seen": 815675360, "step": 25590, "train_runtime": 67019.013, "train_tokens_per_second": 12170.805 }, { "epoch": 1.7233369243199568, "grad_norm": 0.7963204100521549, "learning_rate": 4.649907272285564e-07, "loss": 0.27908778190612793, "num_input_tokens_seen": 815836232, "step": 25595, "train_runtime": 67031.8556, "train_tokens_per_second": 12170.873 }, { "epoch": 1.723673579315917, "grad_norm": 0.7782328087253992, "learning_rate": 4.638778679817596e-07, "loss": 0.28272247314453125, "num_input_tokens_seen": 815999424, "step": 25600, "train_runtime": 67044.741, "train_tokens_per_second": 12170.968 }, { "epoch": 1.7240102343118773, "grad_norm": 0.7704604555854352, "learning_rate": 4.6276627724705204e-07, "loss": 0.30708799362182615, "num_input_tokens_seen": 816159296, "step": 25605, "train_runtime": 67057.7622, "train_tokens_per_second": 12170.989 }, { "epoch": 1.7243468893078373, "grad_norm": 0.7417429083057651, "learning_rate": 4.616559553352873e-07, "loss": 0.2608830213546753, "num_input_tokens_seen": 816317360, "step": 25610, "train_runtime": 67070.5189, "train_tokens_per_second": 12171.031 }, { "epoch": 1.7246835443037973, "grad_norm": 0.8246333214622045, "learning_rate": 4.6054690255696256e-07, "loss": 0.31869897842407224, "num_input_tokens_seen": 816480144, "step": 25615, "train_runtime": 67083.2476, "train_tokens_per_second": 12171.148 }, { "epoch": 1.7250201992997576, "grad_norm": 1.004632224475536, "learning_rate": 4.594391192222214e-07, "loss": 0.30283589363098146, "num_input_tokens_seen": 816638352, "step": 25620, "train_runtime": 67095.9416, "train_tokens_per_second": 12171.203 }, { "epoch": 1.7253568542957178, "grad_norm": 0.8824549256015667, "learning_rate": 4.583326056408505e-07, "loss": 0.27205395698547363, "num_input_tokens_seen": 816797808, "step": 25625, "train_runtime": 67109.0322, "train_tokens_per_second": 12171.205 }, { "epoch": 1.7256935092916779, "grad_norm": 0.9383321744551475, "learning_rate": 4.5722736212228613e-07, "loss": 0.3043744802474976, "num_input_tokens_seen": 816952200, "step": 25630, "train_runtime": 67123.0612, "train_tokens_per_second": 12170.962 }, { "epoch": 1.726030164287638, "grad_norm": 0.8515586862345872, "learning_rate": 4.5612338897560227e-07, "loss": 0.2992269039154053, "num_input_tokens_seen": 817114416, "step": 25635, "train_runtime": 67135.4917, "train_tokens_per_second": 12171.124 }, { "epoch": 1.7263668192835981, "grad_norm": 0.9510024916157301, "learning_rate": 4.5502068650952527e-07, "loss": 0.3066097259521484, "num_input_tokens_seen": 817270872, "step": 25640, "train_runtime": 67148.1475, "train_tokens_per_second": 12171.16 }, { "epoch": 1.7267034742795584, "grad_norm": 0.9014889193500454, "learning_rate": 4.5391925503241894e-07, "loss": 0.30767111778259276, "num_input_tokens_seen": 817433176, "step": 25645, "train_runtime": 67160.7108, "train_tokens_per_second": 12171.3 }, { "epoch": 1.7270401292755184, "grad_norm": 0.8593759445809093, "learning_rate": 4.5281909485229704e-07, "loss": 0.3000320911407471, "num_input_tokens_seen": 817591160, "step": 25650, "train_runtime": 67174.1501, "train_tokens_per_second": 12171.217 }, { "epoch": 1.7273767842714784, "grad_norm": 0.8592630782730303, "learning_rate": 4.51720206276815e-07, "loss": 0.26432290077209475, "num_input_tokens_seen": 817752544, "step": 25655, "train_runtime": 67187.4401, "train_tokens_per_second": 12171.211 }, { "epoch": 1.7277134392674387, "grad_norm": 0.8465124939822836, "learning_rate": 4.506225896132743e-07, "loss": 0.2770785570144653, "num_input_tokens_seen": 817911752, "step": 25660, "train_runtime": 67201.01, "train_tokens_per_second": 12171.123 }, { "epoch": 1.728050094263399, "grad_norm": 0.8548950233877984, "learning_rate": 4.4952624516861944e-07, "loss": 0.29408793449401854, "num_input_tokens_seen": 818065904, "step": 25665, "train_runtime": 67214.5879, "train_tokens_per_second": 12170.958 }, { "epoch": 1.728386749259359, "grad_norm": 0.7420863432531281, "learning_rate": 4.4843117324944005e-07, "loss": 0.24960010051727294, "num_input_tokens_seen": 818227848, "step": 25670, "train_runtime": 67227.1533, "train_tokens_per_second": 12171.092 }, { "epoch": 1.728723404255319, "grad_norm": 0.8375266988424531, "learning_rate": 4.4733737416196745e-07, "loss": 0.29548690319061277, "num_input_tokens_seen": 818373512, "step": 25675, "train_runtime": 67241.2185, "train_tokens_per_second": 12170.712 }, { "epoch": 1.7290600592512793, "grad_norm": 0.710513739553924, "learning_rate": 4.4624484821208346e-07, "loss": 0.27407007217407225, "num_input_tokens_seen": 818531256, "step": 25680, "train_runtime": 67255.011, "train_tokens_per_second": 12170.562 }, { "epoch": 1.7293967142472395, "grad_norm": 0.8486943347589415, "learning_rate": 4.451535957053044e-07, "loss": 0.26765587329864504, "num_input_tokens_seen": 818693656, "step": 25685, "train_runtime": 67268.4462, "train_tokens_per_second": 12170.545 }, { "epoch": 1.7297333692431995, "grad_norm": 0.8727696584447258, "learning_rate": 4.440636169467999e-07, "loss": 0.28300814628601073, "num_input_tokens_seen": 818852608, "step": 25690, "train_runtime": 67282.3951, "train_tokens_per_second": 12170.384 }, { "epoch": 1.7300700242391596, "grad_norm": 0.7513397510474625, "learning_rate": 4.429749122413757e-07, "loss": 0.2883636951446533, "num_input_tokens_seen": 819007600, "step": 25695, "train_runtime": 67295.5058, "train_tokens_per_second": 12170.316 }, { "epoch": 1.7304066792351198, "grad_norm": 0.8928870890971538, "learning_rate": 4.418874818934865e-07, "loss": 0.2849260807037354, "num_input_tokens_seen": 819169264, "step": 25700, "train_runtime": 67307.9851, "train_tokens_per_second": 12170.462 }, { "epoch": 1.73074333423108, "grad_norm": 0.8686688202366895, "learning_rate": 4.4080132620722806e-07, "loss": 0.3069554328918457, "num_input_tokens_seen": 819324672, "step": 25705, "train_runtime": 67322.2376, "train_tokens_per_second": 12170.194 }, { "epoch": 1.73107998922704, "grad_norm": 0.8427747531873772, "learning_rate": 4.3971644548634116e-07, "loss": 0.29826138019561765, "num_input_tokens_seen": 819482064, "step": 25710, "train_runtime": 67335.303, "train_tokens_per_second": 12170.17 }, { "epoch": 1.7314166442230001, "grad_norm": 0.9161377771271683, "learning_rate": 4.3863284003420826e-07, "loss": 0.31550326347351076, "num_input_tokens_seen": 819642976, "step": 25715, "train_runtime": 67348.3844, "train_tokens_per_second": 12170.195 }, { "epoch": 1.7317532992189604, "grad_norm": 0.777152507045464, "learning_rate": 4.375505101538563e-07, "loss": 0.2769683837890625, "num_input_tokens_seen": 819800136, "step": 25720, "train_runtime": 67361.1567, "train_tokens_per_second": 12170.221 }, { "epoch": 1.7320899542149206, "grad_norm": 0.8745893098275087, "learning_rate": 4.3646945614795487e-07, "loss": 0.30621986389160155, "num_input_tokens_seen": 819958688, "step": 25725, "train_runtime": 67373.6435, "train_tokens_per_second": 12170.318 }, { "epoch": 1.7324266092108807, "grad_norm": 0.8171291736706696, "learning_rate": 4.3538967831881995e-07, "loss": 0.3169607400894165, "num_input_tokens_seen": 820119296, "step": 25730, "train_runtime": 67386.5387, "train_tokens_per_second": 12170.373 }, { "epoch": 1.7327632642068407, "grad_norm": 0.8059567919709636, "learning_rate": 4.343111769684039e-07, "loss": 0.29121320247650145, "num_input_tokens_seen": 820272776, "step": 25735, "train_runtime": 67399.5266, "train_tokens_per_second": 12170.305 }, { "epoch": 1.733099919202801, "grad_norm": 0.791332015733899, "learning_rate": 4.332339523983103e-07, "loss": 0.2831947565078735, "num_input_tokens_seen": 820431768, "step": 25740, "train_runtime": 67412.1074, "train_tokens_per_second": 12170.392 }, { "epoch": 1.7334365741987612, "grad_norm": 0.8662824553085909, "learning_rate": 4.321580049097773e-07, "loss": 0.2866279125213623, "num_input_tokens_seen": 820587136, "step": 25745, "train_runtime": 67424.5104, "train_tokens_per_second": 12170.457 }, { "epoch": 1.7337732291947212, "grad_norm": 0.7858805360166149, "learning_rate": 4.310833348036941e-07, "loss": 0.27548966407775877, "num_input_tokens_seen": 820744656, "step": 25750, "train_runtime": 67436.9527, "train_tokens_per_second": 12170.548 }, { "epoch": 1.7341098841906812, "grad_norm": 0.8410071802132785, "learning_rate": 4.300099423805865e-07, "loss": 0.29560658931732176, "num_input_tokens_seen": 820901496, "step": 25755, "train_runtime": 67450.3545, "train_tokens_per_second": 12170.455 }, { "epoch": 1.7344465391866415, "grad_norm": 0.8135535352753432, "learning_rate": 4.289378279406264e-07, "loss": 0.2907859802246094, "num_input_tokens_seen": 821059128, "step": 25760, "train_runtime": 67462.8024, "train_tokens_per_second": 12170.546 }, { "epoch": 1.7347831941826017, "grad_norm": 0.8049621834232527, "learning_rate": 4.2786699178362647e-07, "loss": 0.2981605052947998, "num_input_tokens_seen": 821219216, "step": 25765, "train_runtime": 67476.1306, "train_tokens_per_second": 12170.514 }, { "epoch": 1.7351198491785618, "grad_norm": 0.846637612581395, "learning_rate": 4.2679743420904254e-07, "loss": 0.31073014736175536, "num_input_tokens_seen": 821379432, "step": 25770, "train_runtime": 67488.5688, "train_tokens_per_second": 12170.645 }, { "epoch": 1.7354565041745218, "grad_norm": 0.8686555687179883, "learning_rate": 4.257291555159726e-07, "loss": 0.26355729103088377, "num_input_tokens_seen": 821538192, "step": 25775, "train_runtime": 67501.7748, "train_tokens_per_second": 12170.616 }, { "epoch": 1.735793159170482, "grad_norm": 0.8296878955671245, "learning_rate": 4.246621560031594e-07, "loss": 0.28075995445251467, "num_input_tokens_seen": 821695936, "step": 25780, "train_runtime": 67515.5376, "train_tokens_per_second": 12170.472 }, { "epoch": 1.7361298141664423, "grad_norm": 0.8299509869445777, "learning_rate": 4.235964359689837e-07, "loss": 0.26936726570129393, "num_input_tokens_seen": 821856120, "step": 25785, "train_runtime": 67527.9666, "train_tokens_per_second": 12170.604 }, { "epoch": 1.7364664691624023, "grad_norm": 1.0026215744981537, "learning_rate": 4.225319957114726e-07, "loss": 0.305324387550354, "num_input_tokens_seen": 822012704, "step": 25790, "train_runtime": 67541.4757, "train_tokens_per_second": 12170.488 }, { "epoch": 1.7368031241583624, "grad_norm": 0.7833615752061763, "learning_rate": 4.214688355282909e-07, "loss": 0.27938241958618165, "num_input_tokens_seen": 822174648, "step": 25795, "train_runtime": 67555.4724, "train_tokens_per_second": 12170.363 }, { "epoch": 1.7371397791543226, "grad_norm": 0.9927631937715004, "learning_rate": 4.204069557167506e-07, "loss": 0.282896089553833, "num_input_tokens_seen": 822331984, "step": 25800, "train_runtime": 67568.6635, "train_tokens_per_second": 12170.316 }, { "epoch": 1.7374764341502829, "grad_norm": 0.9051055240597761, "learning_rate": 4.1934635657380153e-07, "loss": 0.30646042823791503, "num_input_tokens_seen": 822490280, "step": 25805, "train_runtime": 67581.555, "train_tokens_per_second": 12170.337 }, { "epoch": 1.7378130891462429, "grad_norm": 0.8259070454977737, "learning_rate": 4.1828703839603637e-07, "loss": 0.26773734092712403, "num_input_tokens_seen": 822651272, "step": 25810, "train_runtime": 67594.4213, "train_tokens_per_second": 12170.402 }, { "epoch": 1.738149744142203, "grad_norm": 0.8860702806949541, "learning_rate": 4.172290014796926e-07, "loss": 0.31717891693115235, "num_input_tokens_seen": 822812392, "step": 25815, "train_runtime": 67608.1076, "train_tokens_per_second": 12170.321 }, { "epoch": 1.7384863991381632, "grad_norm": 0.8253235960927757, "learning_rate": 4.1617224612064353e-07, "loss": 0.30143697261810304, "num_input_tokens_seen": 822968992, "step": 25820, "train_runtime": 67620.7873, "train_tokens_per_second": 12170.355 }, { "epoch": 1.7388230541341234, "grad_norm": 0.8469032430386131, "learning_rate": 4.151167726144101e-07, "loss": 0.28963942527770997, "num_input_tokens_seen": 823131232, "step": 25825, "train_runtime": 67633.3369, "train_tokens_per_second": 12170.496 }, { "epoch": 1.7391597091300834, "grad_norm": 0.9506559237709057, "learning_rate": 4.1406258125615106e-07, "loss": 0.31564314365386964, "num_input_tokens_seen": 823293424, "step": 25830, "train_runtime": 67646.0705, "train_tokens_per_second": 12170.602 }, { "epoch": 1.7394963641260435, "grad_norm": 0.8448783604334964, "learning_rate": 4.130096723406674e-07, "loss": 0.28644189834594724, "num_input_tokens_seen": 823454864, "step": 25835, "train_runtime": 67658.6114, "train_tokens_per_second": 12170.733 }, { "epoch": 1.7398330191220037, "grad_norm": 0.8009349505368849, "learning_rate": 4.119580461624023e-07, "loss": 0.29476051330566405, "num_input_tokens_seen": 823609808, "step": 25840, "train_runtime": 67671.6484, "train_tokens_per_second": 12170.677 }, { "epoch": 1.740169674117964, "grad_norm": 0.8097328828865649, "learning_rate": 4.109077030154396e-07, "loss": 0.2973953723907471, "num_input_tokens_seen": 823768760, "step": 25845, "train_runtime": 67684.8412, "train_tokens_per_second": 12170.654 }, { "epoch": 1.740506329113924, "grad_norm": 0.7735847424402714, "learning_rate": 4.0985864319350366e-07, "loss": 0.3041586399078369, "num_input_tokens_seen": 823928096, "step": 25850, "train_runtime": 67697.3387, "train_tokens_per_second": 12170.761 }, { "epoch": 1.740842984109884, "grad_norm": 0.8000685810483197, "learning_rate": 4.0881086698996154e-07, "loss": 0.2893008470535278, "num_input_tokens_seen": 824088728, "step": 25855, "train_runtime": 67710.3763, "train_tokens_per_second": 12170.789 }, { "epoch": 1.7411796391058443, "grad_norm": 0.7103107132674822, "learning_rate": 4.077643746978194e-07, "loss": 0.2892823457717896, "num_input_tokens_seen": 824247056, "step": 25860, "train_runtime": 67723.4134, "train_tokens_per_second": 12170.784 }, { "epoch": 1.7415162941018045, "grad_norm": 0.7254913796660607, "learning_rate": 4.067191666097281e-07, "loss": 0.2916910171508789, "num_input_tokens_seen": 824405528, "step": 25865, "train_runtime": 67735.9465, "train_tokens_per_second": 12170.872 }, { "epoch": 1.7418529490977646, "grad_norm": 0.7478447812368314, "learning_rate": 4.056752430179728e-07, "loss": 0.2701808214187622, "num_input_tokens_seen": 824566288, "step": 25870, "train_runtime": 67749.1007, "train_tokens_per_second": 12170.882 }, { "epoch": 1.7421896040937246, "grad_norm": 0.8082182337262482, "learning_rate": 4.046326042144866e-07, "loss": 0.2708259344100952, "num_input_tokens_seen": 824725688, "step": 25875, "train_runtime": 67762.1114, "train_tokens_per_second": 12170.897 }, { "epoch": 1.7425262590896848, "grad_norm": 0.7136393166697113, "learning_rate": 4.0359125049083956e-07, "loss": 0.26763110160827636, "num_input_tokens_seen": 824885296, "step": 25880, "train_runtime": 67775.2683, "train_tokens_per_second": 12170.889 }, { "epoch": 1.742862914085645, "grad_norm": 0.7808109555891378, "learning_rate": 4.025511821382422e-07, "loss": 0.28880484104156495, "num_input_tokens_seen": 825044464, "step": 25885, "train_runtime": 67788.3239, "train_tokens_per_second": 12170.893 }, { "epoch": 1.7431995690816051, "grad_norm": 0.7700625647874363, "learning_rate": 4.015123994475462e-07, "loss": 0.2705874443054199, "num_input_tokens_seen": 825205648, "step": 25890, "train_runtime": 67801.2345, "train_tokens_per_second": 12170.953 }, { "epoch": 1.7435362240775654, "grad_norm": 0.8753905789152233, "learning_rate": 4.0047490270924417e-07, "loss": 0.2902699947357178, "num_input_tokens_seen": 825369488, "step": 25895, "train_runtime": 67813.6777, "train_tokens_per_second": 12171.136 }, { "epoch": 1.7438728790735256, "grad_norm": 0.7599121855863348, "learning_rate": 3.994386922134691e-07, "loss": 0.29365177154541017, "num_input_tokens_seen": 825531344, "step": 25900, "train_runtime": 67826.4489, "train_tokens_per_second": 12171.231 }, { "epoch": 1.7442095340694856, "grad_norm": 0.7599242902897211, "learning_rate": 3.984037682499936e-07, "loss": 0.29141740798950194, "num_input_tokens_seen": 825695104, "step": 25905, "train_runtime": 67839.5429, "train_tokens_per_second": 12171.295 }, { "epoch": 1.7445461890654457, "grad_norm": 0.8078913076789045, "learning_rate": 3.973701311082301e-07, "loss": 0.30506291389465334, "num_input_tokens_seen": 825855064, "step": 25910, "train_runtime": 67853.4133, "train_tokens_per_second": 12171.165 }, { "epoch": 1.744882844061406, "grad_norm": 0.8250400055358497, "learning_rate": 3.9633778107723454e-07, "loss": 0.28368372917175294, "num_input_tokens_seen": 826014464, "step": 25915, "train_runtime": 67866.966, "train_tokens_per_second": 12171.083 }, { "epoch": 1.7452194990573662, "grad_norm": 0.7950938350677481, "learning_rate": 3.953067184456966e-07, "loss": 0.303162670135498, "num_input_tokens_seen": 826177464, "step": 25920, "train_runtime": 67881.2696, "train_tokens_per_second": 12170.919 }, { "epoch": 1.7455561540533262, "grad_norm": 0.8179246516177795, "learning_rate": 3.9427694350195224e-07, "loss": 0.29900636672973635, "num_input_tokens_seen": 826339368, "step": 25925, "train_runtime": 67894.4983, "train_tokens_per_second": 12170.933 }, { "epoch": 1.7458928090492862, "grad_norm": 0.8591215166716707, "learning_rate": 3.9324845653397446e-07, "loss": 0.30592570304870603, "num_input_tokens_seen": 826497864, "step": 25930, "train_runtime": 67906.9102, "train_tokens_per_second": 12171.042 }, { "epoch": 1.7462294640452465, "grad_norm": 0.8280538889502835, "learning_rate": 3.922212578293755e-07, "loss": 0.2747958660125732, "num_input_tokens_seen": 826653080, "step": 25935, "train_runtime": 67919.6671, "train_tokens_per_second": 12171.041 }, { "epoch": 1.7465661190412067, "grad_norm": 0.8072086912341124, "learning_rate": 3.911953476754088e-07, "loss": 0.27523221969604494, "num_input_tokens_seen": 826812528, "step": 25940, "train_runtime": 67932.7064, "train_tokens_per_second": 12171.052 }, { "epoch": 1.7469027740371668, "grad_norm": 0.8527988954133155, "learning_rate": 3.9017072635896716e-07, "loss": 0.3086763143539429, "num_input_tokens_seen": 826976368, "step": 25945, "train_runtime": 67945.1314, "train_tokens_per_second": 12171.238 }, { "epoch": 1.7472394290331268, "grad_norm": 0.8207133553929679, "learning_rate": 3.891473941665819e-07, "loss": 0.309571647644043, "num_input_tokens_seen": 827139120, "step": 25950, "train_runtime": 67958.576, "train_tokens_per_second": 12171.225 }, { "epoch": 1.747576084029087, "grad_norm": 0.822180435531457, "learning_rate": 3.881253513844246e-07, "loss": 0.284910774230957, "num_input_tokens_seen": 827294512, "step": 25955, "train_runtime": 67972.2687, "train_tokens_per_second": 12171.059 }, { "epoch": 1.7479127390250473, "grad_norm": 0.8049814467717832, "learning_rate": 3.871045982983063e-07, "loss": 0.29324338436126707, "num_input_tokens_seen": 827456960, "step": 25960, "train_runtime": 67984.9214, "train_tokens_per_second": 12171.184 }, { "epoch": 1.7482493940210073, "grad_norm": 0.7793104658189561, "learning_rate": 3.8608513519367897e-07, "loss": 0.25891363620758057, "num_input_tokens_seen": 827620000, "step": 25965, "train_runtime": 67997.7645, "train_tokens_per_second": 12171.282 }, { "epoch": 1.7485860490169673, "grad_norm": 0.9563367614426816, "learning_rate": 3.8506696235562915e-07, "loss": 0.29891912937164306, "num_input_tokens_seen": 827779664, "step": 25970, "train_runtime": 68010.9037, "train_tokens_per_second": 12171.279 }, { "epoch": 1.7489227040129276, "grad_norm": 0.8005269478719645, "learning_rate": 3.840500800688884e-07, "loss": 0.2913177490234375, "num_input_tokens_seen": 827943328, "step": 25975, "train_runtime": 68023.9444, "train_tokens_per_second": 12171.351 }, { "epoch": 1.7492593590088878, "grad_norm": 0.7911652828329712, "learning_rate": 3.8303448861782333e-07, "loss": 0.29439411163330076, "num_input_tokens_seen": 828099856, "step": 25980, "train_runtime": 68038.2685, "train_tokens_per_second": 12171.09 }, { "epoch": 1.7495960140048479, "grad_norm": 0.8557106367441378, "learning_rate": 3.8202018828644105e-07, "loss": 0.2996375322341919, "num_input_tokens_seen": 828260176, "step": 25985, "train_runtime": 68050.9975, "train_tokens_per_second": 12171.169 }, { "epoch": 1.749932669000808, "grad_norm": 1.3179167487126955, "learning_rate": 3.8100717935838804e-07, "loss": 0.30783030986785886, "num_input_tokens_seen": 828420016, "step": 25990, "train_runtime": 68064.4122, "train_tokens_per_second": 12171.118 }, { "epoch": 1.7502693239967682, "grad_norm": 0.7986354102465841, "learning_rate": 3.799954621169477e-07, "loss": 0.2694204807281494, "num_input_tokens_seen": 828574960, "step": 25995, "train_runtime": 68076.8509, "train_tokens_per_second": 12171.171 }, { "epoch": 1.7506059789927284, "grad_norm": 0.8353484628297734, "learning_rate": 3.7898503684504483e-07, "loss": 0.28495326042175295, "num_input_tokens_seen": 828729904, "step": 26000, "train_runtime": 68090.1167, "train_tokens_per_second": 12171.075 }, { "epoch": 1.7509426339886884, "grad_norm": 0.7994364132069013, "learning_rate": 3.7797590382524066e-07, "loss": 0.28560824394226075, "num_input_tokens_seen": 828883616, "step": 26005, "train_runtime": 68103.5639, "train_tokens_per_second": 12170.929 }, { "epoch": 1.7512792889846485, "grad_norm": 0.7861424831465385, "learning_rate": 3.76968063339736e-07, "loss": 0.29622807502746584, "num_input_tokens_seen": 829046816, "step": 26010, "train_runtime": 68117.155, "train_tokens_per_second": 12170.896 }, { "epoch": 1.7516159439806087, "grad_norm": 0.8568620090538059, "learning_rate": 3.759615156703722e-07, "loss": 0.28516526222229005, "num_input_tokens_seen": 829206736, "step": 26015, "train_runtime": 68130.4184, "train_tokens_per_second": 12170.874 }, { "epoch": 1.751952598976569, "grad_norm": 0.8105062700021983, "learning_rate": 3.749562610986235e-07, "loss": 0.3117044448852539, "num_input_tokens_seen": 829365456, "step": 26020, "train_runtime": 68143.4044, "train_tokens_per_second": 12170.884 }, { "epoch": 1.752289253972529, "grad_norm": 0.8457838730293944, "learning_rate": 3.739522999056094e-07, "loss": 0.2834632396697998, "num_input_tokens_seen": 829519520, "step": 26025, "train_runtime": 68156.2977, "train_tokens_per_second": 12170.842 }, { "epoch": 1.752625908968489, "grad_norm": 0.7966888624256843, "learning_rate": 3.7294963237208326e-07, "loss": 0.2870750665664673, "num_input_tokens_seen": 829681256, "step": 26030, "train_runtime": 68168.8305, "train_tokens_per_second": 12170.977 }, { "epoch": 1.7529625639644493, "grad_norm": 0.7851451419305832, "learning_rate": 3.7194825877843786e-07, "loss": 0.27614150047302244, "num_input_tokens_seen": 829843536, "step": 26035, "train_runtime": 68182.1082, "train_tokens_per_second": 12170.987 }, { "epoch": 1.7532992189604095, "grad_norm": 0.7373579735495371, "learning_rate": 3.7094817940470375e-07, "loss": 0.30138297080993653, "num_input_tokens_seen": 830000384, "step": 26040, "train_runtime": 68195.6072, "train_tokens_per_second": 12170.878 }, { "epoch": 1.7536358739563696, "grad_norm": 0.7720647820238346, "learning_rate": 3.6994939453055044e-07, "loss": 0.3058760404586792, "num_input_tokens_seen": 830162568, "step": 26045, "train_runtime": 68208.0551, "train_tokens_per_second": 12171.034 }, { "epoch": 1.7539725289523296, "grad_norm": 0.863624455936118, "learning_rate": 3.6895190443528515e-07, "loss": 0.2941605091094971, "num_input_tokens_seen": 830325784, "step": 26050, "train_runtime": 68221.5634, "train_tokens_per_second": 12171.017 }, { "epoch": 1.7543091839482898, "grad_norm": 0.7516782898069383, "learning_rate": 3.679557093978525e-07, "loss": 0.3141140937805176, "num_input_tokens_seen": 830485960, "step": 26055, "train_runtime": 68235.1696, "train_tokens_per_second": 12170.937 }, { "epoch": 1.75464583894425, "grad_norm": 0.8657816006187536, "learning_rate": 3.669608096968341e-07, "loss": 0.29130532741546633, "num_input_tokens_seen": 830642672, "step": 26060, "train_runtime": 68248.1366, "train_tokens_per_second": 12170.921 }, { "epoch": 1.75498249394021, "grad_norm": 0.8440661121969699, "learning_rate": 3.6596720561045295e-07, "loss": 0.27753758430480957, "num_input_tokens_seen": 830805288, "step": 26065, "train_runtime": 68261.5345, "train_tokens_per_second": 12170.914 }, { "epoch": 1.7553191489361701, "grad_norm": 0.8284615120113076, "learning_rate": 3.6497489741656455e-07, "loss": 0.30378992557525636, "num_input_tokens_seen": 830966136, "step": 26070, "train_runtime": 68274.6076, "train_tokens_per_second": 12170.94 }, { "epoch": 1.7556558039321304, "grad_norm": 0.7518668615361924, "learning_rate": 3.639838853926669e-07, "loss": 0.2975461006164551, "num_input_tokens_seen": 831129832, "step": 26075, "train_runtime": 68287.6435, "train_tokens_per_second": 12171.014 }, { "epoch": 1.7559924589280906, "grad_norm": 0.8750457070563752, "learning_rate": 3.629941698158923e-07, "loss": 0.33007795810699464, "num_input_tokens_seen": 831287536, "step": 26080, "train_runtime": 68300.1319, "train_tokens_per_second": 12171.097 }, { "epoch": 1.7563291139240507, "grad_norm": 0.8406191793330116, "learning_rate": 3.6200575096301207e-07, "loss": 0.2685899257659912, "num_input_tokens_seen": 831447480, "step": 26085, "train_runtime": 68312.6264, "train_tokens_per_second": 12171.212 }, { "epoch": 1.7566657689200107, "grad_norm": 0.8406631617474014, "learning_rate": 3.61018629110434e-07, "loss": 0.30750741958618166, "num_input_tokens_seen": 831608376, "step": 26090, "train_runtime": 68325.4583, "train_tokens_per_second": 12171.281 }, { "epoch": 1.757002423915971, "grad_norm": 0.7740435196887874, "learning_rate": 3.6003280453420386e-07, "loss": 0.2779327630996704, "num_input_tokens_seen": 831771016, "step": 26095, "train_runtime": 68339.0841, "train_tokens_per_second": 12171.234 }, { "epoch": 1.7573390789119312, "grad_norm": 0.8472729438857713, "learning_rate": 3.59048277510004e-07, "loss": 0.27883272171020507, "num_input_tokens_seen": 831930344, "step": 26100, "train_runtime": 68352.1277, "train_tokens_per_second": 12171.243 }, { "epoch": 1.7576757339078912, "grad_norm": 0.8978613058697938, "learning_rate": 3.5806504831315423e-07, "loss": 0.27771453857421874, "num_input_tokens_seen": 832091472, "step": 26105, "train_runtime": 68365.2024, "train_tokens_per_second": 12171.272 }, { "epoch": 1.7580123889038513, "grad_norm": 0.8187986171834535, "learning_rate": 3.570831172186112e-07, "loss": 0.28376994132995603, "num_input_tokens_seen": 832254864, "step": 26110, "train_runtime": 68378.8612, "train_tokens_per_second": 12171.23 }, { "epoch": 1.7583490438998115, "grad_norm": 0.8138659095683347, "learning_rate": 3.5610248450097084e-07, "loss": 0.2963928937911987, "num_input_tokens_seen": 832415560, "step": 26115, "train_runtime": 68391.6667, "train_tokens_per_second": 12171.301 }, { "epoch": 1.7586856988957718, "grad_norm": 0.7578083758134397, "learning_rate": 3.551231504344604e-07, "loss": 0.2807722806930542, "num_input_tokens_seen": 832573352, "step": 26120, "train_runtime": 68404.1396, "train_tokens_per_second": 12171.388 }, { "epoch": 1.7590223538917318, "grad_norm": 0.7789650086734451, "learning_rate": 3.5414511529295036e-07, "loss": 0.30507802963256836, "num_input_tokens_seen": 832728200, "step": 26125, "train_runtime": 68417.4133, "train_tokens_per_second": 12171.29 }, { "epoch": 1.7593590088876918, "grad_norm": 0.9526643775849574, "learning_rate": 3.5316837934994465e-07, "loss": 0.3145780563354492, "num_input_tokens_seen": 832885256, "step": 26130, "train_runtime": 68430.1543, "train_tokens_per_second": 12171.319 }, { "epoch": 1.759695663883652, "grad_norm": 0.709408052662059, "learning_rate": 3.521929428785836e-07, "loss": 0.28622188568115237, "num_input_tokens_seen": 833047232, "step": 26135, "train_runtime": 68443.3345, "train_tokens_per_second": 12171.342 }, { "epoch": 1.7600323188796123, "grad_norm": 0.7418910698613626, "learning_rate": 3.5121880615164584e-07, "loss": 0.3126822471618652, "num_input_tokens_seen": 833206032, "step": 26140, "train_runtime": 68456.2397, "train_tokens_per_second": 12171.367 }, { "epoch": 1.7603689738755723, "grad_norm": 0.7834278032485381, "learning_rate": 3.5024596944154445e-07, "loss": 0.30379271507263184, "num_input_tokens_seen": 833362264, "step": 26145, "train_runtime": 68469.3929, "train_tokens_per_second": 12171.311 }, { "epoch": 1.7607056288715324, "grad_norm": 0.8651300463911419, "learning_rate": 3.4927443302033127e-07, "loss": 0.2798401117324829, "num_input_tokens_seen": 833522792, "step": 26150, "train_runtime": 68481.8012, "train_tokens_per_second": 12171.45 }, { "epoch": 1.7610422838674926, "grad_norm": 0.8041563410212744, "learning_rate": 3.4830419715969233e-07, "loss": 0.2808249473571777, "num_input_tokens_seen": 833682240, "step": 26155, "train_runtime": 68495.3045, "train_tokens_per_second": 12171.378 }, { "epoch": 1.7613789388634529, "grad_norm": 0.8873948348689605, "learning_rate": 3.4733526213095114e-07, "loss": 0.29953155517578123, "num_input_tokens_seen": 833844440, "step": 26160, "train_runtime": 68507.8935, "train_tokens_per_second": 12171.509 }, { "epoch": 1.761715593859413, "grad_norm": 0.8487255523831553, "learning_rate": 3.4636762820506876e-07, "loss": 0.29048471450805663, "num_input_tokens_seen": 834007064, "step": 26165, "train_runtime": 68522.0354, "train_tokens_per_second": 12171.37 }, { "epoch": 1.762052248855373, "grad_norm": 0.9712930232759466, "learning_rate": 3.4540129565263867e-07, "loss": 0.3151499032974243, "num_input_tokens_seen": 834167144, "step": 26170, "train_runtime": 68534.8183, "train_tokens_per_second": 12171.436 }, { "epoch": 1.7623889038513332, "grad_norm": 0.8271596968123386, "learning_rate": 3.444362647438942e-07, "loss": 0.29479053020477297, "num_input_tokens_seen": 834329040, "step": 26175, "train_runtime": 68547.361, "train_tokens_per_second": 12171.571 }, { "epoch": 1.7627255588472934, "grad_norm": 0.8318965925249644, "learning_rate": 3.434725357487029e-07, "loss": 0.30252196788787844, "num_input_tokens_seen": 834492256, "step": 26180, "train_runtime": 68560.2413, "train_tokens_per_second": 12171.665 }, { "epoch": 1.7630622138432535, "grad_norm": 0.8731690536144744, "learning_rate": 3.4251010893656844e-07, "loss": 0.3206812381744385, "num_input_tokens_seen": 834650152, "step": 26185, "train_runtime": 68572.6762, "train_tokens_per_second": 12171.76 }, { "epoch": 1.7633988688392135, "grad_norm": 0.9388429486263101, "learning_rate": 3.4154898457663065e-07, "loss": 0.2851539373397827, "num_input_tokens_seen": 834804648, "step": 26190, "train_runtime": 68585.7187, "train_tokens_per_second": 12171.698 }, { "epoch": 1.7637355238351737, "grad_norm": 0.7323318521974965, "learning_rate": 3.40589162937664e-07, "loss": 0.27820625305175783, "num_input_tokens_seen": 834960120, "step": 26195, "train_runtime": 68599.1278, "train_tokens_per_second": 12171.585 }, { "epoch": 1.764072178831134, "grad_norm": 0.81224541549757, "learning_rate": 3.3963064428808034e-07, "loss": 0.273958683013916, "num_input_tokens_seen": 835119608, "step": 26200, "train_runtime": 68612.3652, "train_tokens_per_second": 12171.561 }, { "epoch": 1.764408833827094, "grad_norm": 0.7423470566975758, "learning_rate": 3.386734288959265e-07, "loss": 0.29813809394836427, "num_input_tokens_seen": 835275592, "step": 26205, "train_runtime": 68626.2912, "train_tokens_per_second": 12171.364 }, { "epoch": 1.764745488823054, "grad_norm": 0.8000263585349465, "learning_rate": 3.377175170288838e-07, "loss": 0.2990430355072021, "num_input_tokens_seen": 835436328, "step": 26210, "train_runtime": 68639.382, "train_tokens_per_second": 12171.385 }, { "epoch": 1.7650821438190143, "grad_norm": 0.8424547830672207, "learning_rate": 3.367629089542712e-07, "loss": 0.27294411659240725, "num_input_tokens_seen": 835600168, "step": 26215, "train_runtime": 68651.8029, "train_tokens_per_second": 12171.569 }, { "epoch": 1.7654187988149745, "grad_norm": 0.8310820624953507, "learning_rate": 3.3580960493904024e-07, "loss": 0.3068228244781494, "num_input_tokens_seen": 835760416, "step": 26220, "train_runtime": 68664.853, "train_tokens_per_second": 12171.59 }, { "epoch": 1.7657554538109346, "grad_norm": 0.7836867062670843, "learning_rate": 3.3485760524978093e-07, "loss": 0.2934136867523193, "num_input_tokens_seen": 835915984, "step": 26225, "train_runtime": 68678.22, "train_tokens_per_second": 12171.486 }, { "epoch": 1.7660921088068946, "grad_norm": 0.8118792612966774, "learning_rate": 3.3390691015271646e-07, "loss": 0.27722289562225344, "num_input_tokens_seen": 836075000, "step": 26230, "train_runtime": 68691.2459, "train_tokens_per_second": 12171.493 }, { "epoch": 1.7664287638028549, "grad_norm": 0.784134256028318, "learning_rate": 3.329575199137053e-07, "loss": 0.2810239315032959, "num_input_tokens_seen": 836236240, "step": 26235, "train_runtime": 68704.8053, "train_tokens_per_second": 12171.437 }, { "epoch": 1.766765418798815, "grad_norm": 0.8146416939158622, "learning_rate": 3.3200943479824113e-07, "loss": 0.3166502952575684, "num_input_tokens_seen": 836393896, "step": 26240, "train_runtime": 68718.6067, "train_tokens_per_second": 12171.287 }, { "epoch": 1.7671020737947751, "grad_norm": 0.7143019389419657, "learning_rate": 3.3106265507145406e-07, "loss": 0.24813783168792725, "num_input_tokens_seen": 836550104, "step": 26245, "train_runtime": 68731.6147, "train_tokens_per_second": 12171.256 }, { "epoch": 1.7674387287907352, "grad_norm": 0.7938698004270511, "learning_rate": 3.3011718099810687e-07, "loss": 0.27550978660583497, "num_input_tokens_seen": 836704096, "step": 26250, "train_runtime": 68744.0983, "train_tokens_per_second": 12171.286 }, { "epoch": 1.7677753837866954, "grad_norm": 0.8644887944098784, "learning_rate": 3.2917301284259904e-07, "loss": 0.29041543006896975, "num_input_tokens_seen": 836864144, "step": 26255, "train_runtime": 68756.5172, "train_tokens_per_second": 12171.416 }, { "epoch": 1.7681120387826557, "grad_norm": 0.8290599040203592, "learning_rate": 3.2823015086896335e-07, "loss": 0.30643649101257325, "num_input_tokens_seen": 837019848, "step": 26260, "train_runtime": 68769.0561, "train_tokens_per_second": 12171.46 }, { "epoch": 1.7684486937786157, "grad_norm": 0.778524774155057, "learning_rate": 3.2728859534087e-07, "loss": 0.2897134065628052, "num_input_tokens_seen": 837181992, "step": 26265, "train_runtime": 68782.9625, "train_tokens_per_second": 12171.357 }, { "epoch": 1.7687853487745757, "grad_norm": 0.7934363973745343, "learning_rate": 3.263483465216194e-07, "loss": 0.2934154987335205, "num_input_tokens_seen": 837344960, "step": 26270, "train_runtime": 68796.4616, "train_tokens_per_second": 12171.338 }, { "epoch": 1.769122003770536, "grad_norm": 0.7411787010396509, "learning_rate": 3.2540940467415126e-07, "loss": 0.278179407119751, "num_input_tokens_seen": 837503672, "step": 26275, "train_runtime": 68810.1784, "train_tokens_per_second": 12171.218 }, { "epoch": 1.7694586587664962, "grad_norm": 0.7441210240292669, "learning_rate": 3.2447177006103726e-07, "loss": 0.2868351936340332, "num_input_tokens_seen": 837660168, "step": 26280, "train_runtime": 68822.9762, "train_tokens_per_second": 12171.228 }, { "epoch": 1.7697953137624562, "grad_norm": 0.7288735938442041, "learning_rate": 3.235354429444831e-07, "loss": 0.28961236476898194, "num_input_tokens_seen": 837815408, "step": 26285, "train_runtime": 68836.6762, "train_tokens_per_second": 12171.061 }, { "epoch": 1.7701319687584163, "grad_norm": 0.830222078252063, "learning_rate": 3.226004235863306e-07, "loss": 0.3047652244567871, "num_input_tokens_seen": 837978176, "step": 26290, "train_runtime": 68849.4121, "train_tokens_per_second": 12171.174 }, { "epoch": 1.7704686237543765, "grad_norm": 0.8074273294046584, "learning_rate": 3.2166671224805437e-07, "loss": 0.2839834690093994, "num_input_tokens_seen": 838138664, "step": 26295, "train_runtime": 68862.1879, "train_tokens_per_second": 12171.247 }, { "epoch": 1.7708052787503368, "grad_norm": 0.7779803608716466, "learning_rate": 3.207343091907633e-07, "loss": 0.28159394264221194, "num_input_tokens_seen": 838294120, "step": 26300, "train_runtime": 68875.3881, "train_tokens_per_second": 12171.171 }, { "epoch": 1.7711419337462968, "grad_norm": 0.8394080431693071, "learning_rate": 3.1980321467520226e-07, "loss": 0.29482412338256836, "num_input_tokens_seen": 838445272, "step": 26305, "train_runtime": 68888.7817, "train_tokens_per_second": 12170.999 }, { "epoch": 1.7714785887422568, "grad_norm": 1.0024168854164968, "learning_rate": 3.1887342896174735e-07, "loss": 0.31112070083618165, "num_input_tokens_seen": 838601096, "step": 26310, "train_runtime": 68901.8674, "train_tokens_per_second": 12170.949 }, { "epoch": 1.771815243738217, "grad_norm": 0.7712599981166565, "learning_rate": 3.1794495231041276e-07, "loss": 0.2907053709030151, "num_input_tokens_seen": 838763824, "step": 26315, "train_runtime": 68914.5879, "train_tokens_per_second": 12171.063 }, { "epoch": 1.7721518987341773, "grad_norm": 0.7886069376926764, "learning_rate": 3.1701778498084035e-07, "loss": 0.3035216569900513, "num_input_tokens_seen": 838917928, "step": 26320, "train_runtime": 68927.9492, "train_tokens_per_second": 12170.94 }, { "epoch": 1.7724885537301374, "grad_norm": 0.8122901571560102, "learning_rate": 3.160919272323121e-07, "loss": 0.30497236251831056, "num_input_tokens_seen": 839081768, "step": 26325, "train_runtime": 68940.3833, "train_tokens_per_second": 12171.121 }, { "epoch": 1.7728252087260974, "grad_norm": 0.7139299546880953, "learning_rate": 3.1516737932374087e-07, "loss": 0.3071502447128296, "num_input_tokens_seen": 839236904, "step": 26330, "train_runtime": 68953.5961, "train_tokens_per_second": 12171.039 }, { "epoch": 1.7731618637220576, "grad_norm": 0.7649674316862415, "learning_rate": 3.142441415136727e-07, "loss": 0.2909811496734619, "num_input_tokens_seen": 839397824, "step": 26335, "train_runtime": 68966.3011, "train_tokens_per_second": 12171.13 }, { "epoch": 1.773498518718018, "grad_norm": 0.7717244992605078, "learning_rate": 3.133222140602893e-07, "loss": 0.2872778415679932, "num_input_tokens_seen": 839551816, "step": 26340, "train_runtime": 68980.2827, "train_tokens_per_second": 12170.896 }, { "epoch": 1.773835173713978, "grad_norm": 0.7768202715292135, "learning_rate": 3.124015972214034e-07, "loss": 0.2989944934844971, "num_input_tokens_seen": 839709280, "step": 26345, "train_runtime": 68993.4136, "train_tokens_per_second": 12170.861 }, { "epoch": 1.774171828709938, "grad_norm": 0.8654011796888754, "learning_rate": 3.114822912544635e-07, "loss": 0.30635437965393064, "num_input_tokens_seen": 839866096, "step": 26350, "train_runtime": 69005.8644, "train_tokens_per_second": 12170.938 }, { "epoch": 1.7745084837058982, "grad_norm": 0.8214804899610394, "learning_rate": 3.1056429641655007e-07, "loss": 0.28124299049377444, "num_input_tokens_seen": 840024112, "step": 26355, "train_runtime": 69019.1233, "train_tokens_per_second": 12170.889 }, { "epoch": 1.7748451387018584, "grad_norm": 0.8413278397004615, "learning_rate": 3.0964761296437665e-07, "loss": 0.28792123794555663, "num_input_tokens_seen": 840185136, "step": 26360, "train_runtime": 69032.3353, "train_tokens_per_second": 12170.893 }, { "epoch": 1.7751817936978185, "grad_norm": 0.8216510706756607, "learning_rate": 3.087322411542937e-07, "loss": 0.29073960781097413, "num_input_tokens_seen": 840347024, "step": 26365, "train_runtime": 69044.8832, "train_tokens_per_second": 12171.025 }, { "epoch": 1.7755184486937785, "grad_norm": 0.8013352594745409, "learning_rate": 3.0781818124227867e-07, "loss": 0.27419252395629884, "num_input_tokens_seen": 840504648, "step": 26370, "train_runtime": 69058.6353, "train_tokens_per_second": 12170.884 }, { "epoch": 1.7758551036897388, "grad_norm": 0.8202755964720164, "learning_rate": 3.0690543348394776e-07, "loss": 0.28411192893981935, "num_input_tokens_seen": 840667976, "step": 26375, "train_runtime": 69072.2673, "train_tokens_per_second": 12170.847 }, { "epoch": 1.776191758685699, "grad_norm": 0.8912154372593172, "learning_rate": 3.059939981345467e-07, "loss": 0.27138538360595704, "num_input_tokens_seen": 840822112, "step": 26380, "train_runtime": 69085.4308, "train_tokens_per_second": 12170.759 }, { "epoch": 1.776528413681659, "grad_norm": 0.8501836326542918, "learning_rate": 3.050838754489566e-07, "loss": 0.2908538818359375, "num_input_tokens_seen": 840981976, "step": 26385, "train_runtime": 69098.4911, "train_tokens_per_second": 12170.772 }, { "epoch": 1.776865068677619, "grad_norm": 0.7550063820444615, "learning_rate": 3.041750656816894e-07, "loss": 0.28323516845703123, "num_input_tokens_seen": 841141640, "step": 26390, "train_runtime": 69111.5914, "train_tokens_per_second": 12170.775 }, { "epoch": 1.7772017236735793, "grad_norm": 0.8579419856571887, "learning_rate": 3.0326756908689135e-07, "loss": 0.3049760818481445, "num_input_tokens_seen": 841302576, "step": 26395, "train_runtime": 69124.9971, "train_tokens_per_second": 12170.743 }, { "epoch": 1.7775383786695396, "grad_norm": 0.7977291916700361, "learning_rate": 3.0236138591833995e-07, "loss": 0.2616129875183105, "num_input_tokens_seen": 841460184, "step": 26400, "train_runtime": 69138.0468, "train_tokens_per_second": 12170.725 }, { "epoch": 1.7778750336654996, "grad_norm": 0.7683885665471022, "learning_rate": 3.0145651642944863e-07, "loss": 0.3078320503234863, "num_input_tokens_seen": 841622592, "step": 26405, "train_runtime": 69150.6958, "train_tokens_per_second": 12170.848 }, { "epoch": 1.7782116886614596, "grad_norm": 0.8113822853931928, "learning_rate": 3.005529608732588e-07, "loss": 0.2570197582244873, "num_input_tokens_seen": 841781400, "step": 26410, "train_runtime": 69163.7673, "train_tokens_per_second": 12170.844 }, { "epoch": 1.7785483436574199, "grad_norm": 0.8022122693523719, "learning_rate": 2.996507195024495e-07, "loss": 0.3254894495010376, "num_input_tokens_seen": 841945240, "step": 26415, "train_runtime": 69176.2114, "train_tokens_per_second": 12171.023 }, { "epoch": 1.7788849986533801, "grad_norm": 0.8486430712695983, "learning_rate": 2.9874979256932614e-07, "loss": 0.2866269588470459, "num_input_tokens_seen": 842102160, "step": 26420, "train_runtime": 69188.6619, "train_tokens_per_second": 12171.101 }, { "epoch": 1.7792216536493402, "grad_norm": 0.8584621658467494, "learning_rate": 2.9785018032583325e-07, "loss": 0.30195250511169436, "num_input_tokens_seen": 842264576, "step": 26425, "train_runtime": 69201.2978, "train_tokens_per_second": 12171.225 }, { "epoch": 1.7795583086453002, "grad_norm": 0.9538845435241674, "learning_rate": 2.969518830235435e-07, "loss": 0.29738245010375974, "num_input_tokens_seen": 842419520, "step": 26430, "train_runtime": 69214.352, "train_tokens_per_second": 12171.168 }, { "epoch": 1.7798949636412604, "grad_norm": 0.8158518019941738, "learning_rate": 2.960549009136626e-07, "loss": 0.28472921848297117, "num_input_tokens_seen": 842581320, "step": 26435, "train_runtime": 69227.5765, "train_tokens_per_second": 12171.18 }, { "epoch": 1.7802316186372207, "grad_norm": 0.8009863560088409, "learning_rate": 2.951592342470289e-07, "loss": 0.3249552249908447, "num_input_tokens_seen": 842738432, "step": 26440, "train_runtime": 69240.0797, "train_tokens_per_second": 12171.252 }, { "epoch": 1.7805682736331807, "grad_norm": 0.8623727914416444, "learning_rate": 2.942648832741124e-07, "loss": 0.2858766555786133, "num_input_tokens_seen": 842896992, "step": 26445, "train_runtime": 69253.5758, "train_tokens_per_second": 12171.169 }, { "epoch": 1.7809049286291407, "grad_norm": 0.7653244663419082, "learning_rate": 2.933718482450154e-07, "loss": 0.2949942111968994, "num_input_tokens_seen": 843057480, "step": 26450, "train_runtime": 69266.1621, "train_tokens_per_second": 12171.275 }, { "epoch": 1.781241583625101, "grad_norm": 0.9713830903690602, "learning_rate": 2.9248012940947423e-07, "loss": 0.3111457109451294, "num_input_tokens_seen": 843219160, "step": 26455, "train_runtime": 69278.8527, "train_tokens_per_second": 12171.379 }, { "epoch": 1.7815782386210612, "grad_norm": 0.839682377014265, "learning_rate": 2.915897270168522e-07, "loss": 0.30369384288787843, "num_input_tokens_seen": 843376336, "step": 26460, "train_runtime": 69291.9963, "train_tokens_per_second": 12171.338 }, { "epoch": 1.7819148936170213, "grad_norm": 0.8515163723669086, "learning_rate": 2.9070064131615004e-07, "loss": 0.3054384708404541, "num_input_tokens_seen": 843533048, "step": 26465, "train_runtime": 69304.6387, "train_tokens_per_second": 12171.379 }, { "epoch": 1.7822515486129813, "grad_norm": 0.8684719584492041, "learning_rate": 2.8981287255599567e-07, "loss": 0.2868688106536865, "num_input_tokens_seen": 843686896, "step": 26470, "train_runtime": 69318.2983, "train_tokens_per_second": 12171.2 }, { "epoch": 1.7825882036089415, "grad_norm": 0.7817718611075751, "learning_rate": 2.8892642098465205e-07, "loss": 0.2904038906097412, "num_input_tokens_seen": 843847192, "step": 26475, "train_runtime": 69331.7107, "train_tokens_per_second": 12171.158 }, { "epoch": 1.7829248586049018, "grad_norm": 0.7985097989223785, "learning_rate": 2.8804128685001263e-07, "loss": 0.278177547454834, "num_input_tokens_seen": 844008120, "step": 26480, "train_runtime": 69344.7488, "train_tokens_per_second": 12171.19 }, { "epoch": 1.7832615136008618, "grad_norm": 0.8259976727480475, "learning_rate": 2.8715747039960216e-07, "loss": 0.26516387462615965, "num_input_tokens_seen": 844165168, "step": 26485, "train_runtime": 69358.1688, "train_tokens_per_second": 12171.099 }, { "epoch": 1.7835981685968219, "grad_norm": 0.8790284237270245, "learning_rate": 2.8627497188057684e-07, "loss": 0.29796299934387205, "num_input_tokens_seen": 844324064, "step": 26490, "train_runtime": 69371.4057, "train_tokens_per_second": 12171.068 }, { "epoch": 1.783934823592782, "grad_norm": 0.7942859710881532, "learning_rate": 2.853937915397248e-07, "loss": 0.32318692207336425, "num_input_tokens_seen": 844485232, "step": 26495, "train_runtime": 69385.072, "train_tokens_per_second": 12170.993 }, { "epoch": 1.7842714785887424, "grad_norm": 0.7780740517604148, "learning_rate": 2.845139296234639e-07, "loss": 0.28280413150787354, "num_input_tokens_seen": 844649072, "step": 26500, "train_runtime": 69397.5151, "train_tokens_per_second": 12171.172 }, { "epoch": 1.7846081335847024, "grad_norm": 0.7190213314704383, "learning_rate": 2.836353863778479e-07, "loss": 0.2819064617156982, "num_input_tokens_seen": 844810744, "step": 26505, "train_runtime": 69410.7384, "train_tokens_per_second": 12171.182 }, { "epoch": 1.7849447885806624, "grad_norm": 0.7697888179222947, "learning_rate": 2.8275816204855534e-07, "loss": 0.3100119590759277, "num_input_tokens_seen": 844971208, "step": 26510, "train_runtime": 69423.6948, "train_tokens_per_second": 12171.222 }, { "epoch": 1.7852814435766227, "grad_norm": 0.9136180012287308, "learning_rate": 2.818822568809015e-07, "loss": 0.3110760450363159, "num_input_tokens_seen": 845125936, "step": 26515, "train_runtime": 69436.5256, "train_tokens_per_second": 12171.201 }, { "epoch": 1.785618098572583, "grad_norm": 0.7611624020400739, "learning_rate": 2.810076711198284e-07, "loss": 0.27563962936401365, "num_input_tokens_seen": 845283576, "step": 26520, "train_runtime": 69449.4226, "train_tokens_per_second": 12171.211 }, { "epoch": 1.785954753568543, "grad_norm": 0.9659565279866518, "learning_rate": 2.801344050099131e-07, "loss": 0.3011836767196655, "num_input_tokens_seen": 845447416, "step": 26525, "train_runtime": 69461.8692, "train_tokens_per_second": 12171.389 }, { "epoch": 1.786291408564503, "grad_norm": 0.7948474156573586, "learning_rate": 2.7926245879536076e-07, "loss": 0.2969949245452881, "num_input_tokens_seen": 845606752, "step": 26530, "train_runtime": 69475.34, "train_tokens_per_second": 12171.322 }, { "epoch": 1.7866280635604632, "grad_norm": 0.744289892948673, "learning_rate": 2.7839183272000857e-07, "loss": 0.27946319580078127, "num_input_tokens_seen": 845769944, "step": 26535, "train_runtime": 69488.9681, "train_tokens_per_second": 12171.284 }, { "epoch": 1.7869647185564235, "grad_norm": 0.8897919507115974, "learning_rate": 2.775225270273241e-07, "loss": 0.2998188972473145, "num_input_tokens_seen": 845932008, "step": 26540, "train_runtime": 69502.1031, "train_tokens_per_second": 12171.315 }, { "epoch": 1.7873013735523835, "grad_norm": 0.7775340306162459, "learning_rate": 2.7665454196040665e-07, "loss": 0.26177880764007566, "num_input_tokens_seen": 846093840, "step": 26545, "train_runtime": 69515.3271, "train_tokens_per_second": 12171.328 }, { "epoch": 1.7876380285483435, "grad_norm": 0.8306001769269159, "learning_rate": 2.7578787776198325e-07, "loss": 0.30067741870880127, "num_input_tokens_seen": 846248448, "step": 26550, "train_runtime": 69528.9022, "train_tokens_per_second": 12171.175 }, { "epoch": 1.7879746835443038, "grad_norm": 0.9156496712006085, "learning_rate": 2.7492253467441775e-07, "loss": 0.2776355504989624, "num_input_tokens_seen": 846409776, "step": 26555, "train_runtime": 69541.8786, "train_tokens_per_second": 12171.224 }, { "epoch": 1.788311338540264, "grad_norm": 0.8179280601311999, "learning_rate": 2.740585129396961e-07, "loss": 0.29197301864624026, "num_input_tokens_seen": 846569896, "step": 26560, "train_runtime": 69554.5982, "train_tokens_per_second": 12171.3 }, { "epoch": 1.788647993536224, "grad_norm": 0.8103438662941587, "learning_rate": 2.731958127994433e-07, "loss": 0.27991909980773927, "num_input_tokens_seen": 846732024, "step": 26565, "train_runtime": 69567.4803, "train_tokens_per_second": 12171.377 }, { "epoch": 1.788984648532184, "grad_norm": 1.0943768422021962, "learning_rate": 2.7233443449490695e-07, "loss": 0.31302409172058104, "num_input_tokens_seen": 846887488, "step": 26570, "train_runtime": 69579.9311, "train_tokens_per_second": 12171.433 }, { "epoch": 1.7893213035281443, "grad_norm": 0.7808940685293475, "learning_rate": 2.7147437826697153e-07, "loss": 0.2940995693206787, "num_input_tokens_seen": 847049192, "step": 26575, "train_runtime": 69593.3163, "train_tokens_per_second": 12171.416 }, { "epoch": 1.7896579585241046, "grad_norm": 0.9172771589261917, "learning_rate": 2.706156443561481e-07, "loss": 0.2893664836883545, "num_input_tokens_seen": 847211304, "step": 26580, "train_runtime": 69606.5284, "train_tokens_per_second": 12171.435 }, { "epoch": 1.7899946135200646, "grad_norm": 0.7460807742213781, "learning_rate": 2.6975823300257884e-07, "loss": 0.29347786903381345, "num_input_tokens_seen": 847367928, "step": 26585, "train_runtime": 69619.7416, "train_tokens_per_second": 12171.374 }, { "epoch": 1.7903312685160246, "grad_norm": 0.7473205973219429, "learning_rate": 2.6890214444603604e-07, "loss": 0.2912222623825073, "num_input_tokens_seen": 847523624, "step": 26590, "train_runtime": 69632.4937, "train_tokens_per_second": 12171.381 }, { "epoch": 1.790667923511985, "grad_norm": 0.7965104210228536, "learning_rate": 2.6804737892592193e-07, "loss": 0.3100412368774414, "num_input_tokens_seen": 847686256, "step": 26595, "train_runtime": 69645.8614, "train_tokens_per_second": 12171.38 }, { "epoch": 1.7910045785079451, "grad_norm": 0.9732187312324612, "learning_rate": 2.671939366812687e-07, "loss": 0.28713240623474123, "num_input_tokens_seen": 847847328, "step": 26600, "train_runtime": 69659.1927, "train_tokens_per_second": 12171.363 }, { "epoch": 1.7913412335039052, "grad_norm": 0.8453433863728608, "learning_rate": 2.66341817950741e-07, "loss": 0.28653693199157715, "num_input_tokens_seen": 848010512, "step": 26605, "train_runtime": 69672.0872, "train_tokens_per_second": 12171.453 }, { "epoch": 1.7916778884998652, "grad_norm": 0.7798753280996197, "learning_rate": 2.6549102297262764e-07, "loss": 0.28526284694671633, "num_input_tokens_seen": 848168784, "step": 26610, "train_runtime": 69685.1881, "train_tokens_per_second": 12171.436 }, { "epoch": 1.7920145434958255, "grad_norm": 0.893826422158948, "learning_rate": 2.6464155198485387e-07, "loss": 0.304105281829834, "num_input_tokens_seen": 848328712, "step": 26615, "train_runtime": 69697.6191, "train_tokens_per_second": 12171.559 }, { "epoch": 1.7923511984917857, "grad_norm": 0.8597403663330097, "learning_rate": 2.6379340522496853e-07, "loss": 0.2891183376312256, "num_input_tokens_seen": 848485704, "step": 26620, "train_runtime": 69710.3551, "train_tokens_per_second": 12171.588 }, { "epoch": 1.7926878534877457, "grad_norm": 0.8495991106187967, "learning_rate": 2.6294658293015584e-07, "loss": 0.3196293115615845, "num_input_tokens_seen": 848649200, "step": 26625, "train_runtime": 69723.4012, "train_tokens_per_second": 12171.655 }, { "epoch": 1.7930245084837058, "grad_norm": 0.9631711133287381, "learning_rate": 2.621010853372258e-07, "loss": 0.3268672227859497, "num_input_tokens_seen": 848806304, "step": 26630, "train_runtime": 69736.6707, "train_tokens_per_second": 12171.592 }, { "epoch": 1.793361163479666, "grad_norm": 0.9387957795925109, "learning_rate": 2.612569126826187e-07, "loss": 0.31911966800689695, "num_input_tokens_seen": 848962744, "step": 26635, "train_runtime": 69749.7901, "train_tokens_per_second": 12171.545 }, { "epoch": 1.7936978184756263, "grad_norm": 0.8178304682726176, "learning_rate": 2.6041406520240563e-07, "loss": 0.31730635166168214, "num_input_tokens_seen": 849124456, "step": 26640, "train_runtime": 69762.8175, "train_tokens_per_second": 12171.591 }, { "epoch": 1.7940344734715863, "grad_norm": 0.9103141172288868, "learning_rate": 2.5957254313228595e-07, "loss": 0.30668325424194337, "num_input_tokens_seen": 849278744, "step": 26645, "train_runtime": 69775.7198, "train_tokens_per_second": 12171.551 }, { "epoch": 1.7943711284675463, "grad_norm": 0.7533510882360192, "learning_rate": 2.5873234670758753e-07, "loss": 0.26509573459625246, "num_input_tokens_seen": 849442584, "step": 26650, "train_runtime": 69788.1565, "train_tokens_per_second": 12171.73 }, { "epoch": 1.7947077834635066, "grad_norm": 0.7524662014517115, "learning_rate": 2.578934761632712e-07, "loss": 0.2707791566848755, "num_input_tokens_seen": 849605800, "step": 26655, "train_runtime": 69801.0623, "train_tokens_per_second": 12171.818 }, { "epoch": 1.7950444384594668, "grad_norm": 0.8772132485207392, "learning_rate": 2.570559317339211e-07, "loss": 0.30501859188079833, "num_input_tokens_seen": 849768344, "step": 26660, "train_runtime": 69814.5716, "train_tokens_per_second": 12171.791 }, { "epoch": 1.7953810934554268, "grad_norm": 0.7625004168181143, "learning_rate": 2.56219713653757e-07, "loss": 0.28802788257598877, "num_input_tokens_seen": 849932088, "step": 26665, "train_runtime": 69827.0049, "train_tokens_per_second": 12171.968 }, { "epoch": 1.7957177484513869, "grad_norm": 0.8772056415708562, "learning_rate": 2.5538482215662187e-07, "loss": 0.30212740898132323, "num_input_tokens_seen": 850090472, "step": 26670, "train_runtime": 69840.2489, "train_tokens_per_second": 12171.928 }, { "epoch": 1.7960544034473471, "grad_norm": 0.8855667963808826, "learning_rate": 2.545512574759923e-07, "loss": 0.2796017169952393, "num_input_tokens_seen": 850252184, "step": 26675, "train_runtime": 69853.9973, "train_tokens_per_second": 12171.847 }, { "epoch": 1.7963910584433074, "grad_norm": 0.8290050021208254, "learning_rate": 2.537190198449713e-07, "loss": 0.2940730094909668, "num_input_tokens_seen": 850408768, "step": 26680, "train_runtime": 69867.3703, "train_tokens_per_second": 12171.759 }, { "epoch": 1.7967277134392674, "grad_norm": 0.8240447804713282, "learning_rate": 2.5288810949629207e-07, "loss": 0.2990156650543213, "num_input_tokens_seen": 850570472, "step": 26685, "train_runtime": 69880.3496, "train_tokens_per_second": 12171.812 }, { "epoch": 1.7970643684352274, "grad_norm": 0.7609781275274295, "learning_rate": 2.5205852666231544e-07, "loss": 0.27978370189666746, "num_input_tokens_seen": 850728848, "step": 26690, "train_runtime": 69893.6487, "train_tokens_per_second": 12171.762 }, { "epoch": 1.7974010234311877, "grad_norm": 0.8347665405452467, "learning_rate": 2.5123027157503144e-07, "loss": 0.2759535312652588, "num_input_tokens_seen": 850885792, "step": 26695, "train_runtime": 69907.7705, "train_tokens_per_second": 12171.548 }, { "epoch": 1.797737678427148, "grad_norm": 0.746905643368537, "learning_rate": 2.504033444660592e-07, "loss": 0.2952668905258179, "num_input_tokens_seen": 851049424, "step": 26700, "train_runtime": 69920.8115, "train_tokens_per_second": 12171.618 }, { "epoch": 1.798074333423108, "grad_norm": 0.7734686036517736, "learning_rate": 2.4957774556664706e-07, "loss": 0.2850339412689209, "num_input_tokens_seen": 851212688, "step": 26705, "train_runtime": 69933.8341, "train_tokens_per_second": 12171.686 }, { "epoch": 1.798410988419068, "grad_norm": 0.8431556528138787, "learning_rate": 2.487534751076692e-07, "loss": 0.29331364631652834, "num_input_tokens_seen": 851374424, "step": 26710, "train_runtime": 69946.3702, "train_tokens_per_second": 12171.817 }, { "epoch": 1.7987476434150282, "grad_norm": 0.834886919573142, "learning_rate": 2.47930533319633e-07, "loss": 0.2681942701339722, "num_input_tokens_seen": 851528336, "step": 26715, "train_runtime": 69958.8773, "train_tokens_per_second": 12171.841 }, { "epoch": 1.7990842984109885, "grad_norm": 0.8432093017256403, "learning_rate": 2.4710892043266823e-07, "loss": 0.32567903995513914, "num_input_tokens_seen": 851690496, "step": 26720, "train_runtime": 69971.4842, "train_tokens_per_second": 12171.966 }, { "epoch": 1.7994209534069485, "grad_norm": 0.8489220961008915, "learning_rate": 2.462886366765388e-07, "loss": 0.2852949857711792, "num_input_tokens_seen": 851852832, "step": 26725, "train_runtime": 69984.0955, "train_tokens_per_second": 12172.092 }, { "epoch": 1.7997576084029085, "grad_norm": 0.8852310269786221, "learning_rate": 2.454696822806341e-07, "loss": 0.2998690128326416, "num_input_tokens_seen": 852010520, "step": 26730, "train_runtime": 69997.8805, "train_tokens_per_second": 12171.947 }, { "epoch": 1.8000942633988688, "grad_norm": 0.7549663852554792, "learning_rate": 2.446520574739708e-07, "loss": 0.27947320938110354, "num_input_tokens_seen": 852171632, "step": 26735, "train_runtime": 70010.9127, "train_tokens_per_second": 12171.983 }, { "epoch": 1.800430918394829, "grad_norm": 0.8860537681445387, "learning_rate": 2.438357624851967e-07, "loss": 0.26890971660614016, "num_input_tokens_seen": 852331712, "step": 26740, "train_runtime": 70024.192, "train_tokens_per_second": 12171.961 }, { "epoch": 1.800767573390789, "grad_norm": 0.7879392209855716, "learning_rate": 2.430207975425847e-07, "loss": 0.29252939224243163, "num_input_tokens_seen": 852492552, "step": 26745, "train_runtime": 70037.0574, "train_tokens_per_second": 12172.021 }, { "epoch": 1.801104228386749, "grad_norm": 0.8344264937951852, "learning_rate": 2.4220716287403744e-07, "loss": 0.30969891548156736, "num_input_tokens_seen": 852656392, "step": 26750, "train_runtime": 70049.4946, "train_tokens_per_second": 12172.199 }, { "epoch": 1.8014408833827094, "grad_norm": 0.7862081879847111, "learning_rate": 2.413948587070869e-07, "loss": 0.3006144523620605, "num_input_tokens_seen": 852807936, "step": 26755, "train_runtime": 70062.944, "train_tokens_per_second": 12172.025 }, { "epoch": 1.8017775383786696, "grad_norm": 0.8554405836798711, "learning_rate": 2.405838852688891e-07, "loss": 0.3035117149353027, "num_input_tokens_seen": 852968656, "step": 26760, "train_runtime": 70075.3923, "train_tokens_per_second": 12172.157 }, { "epoch": 1.8021141933746296, "grad_norm": 0.8904804851752237, "learning_rate": 2.397742427862315e-07, "loss": 0.2719240427017212, "num_input_tokens_seen": 853128136, "step": 26765, "train_runtime": 70088.3924, "train_tokens_per_second": 12172.174 }, { "epoch": 1.8024508483705897, "grad_norm": 0.8915945111092533, "learning_rate": 2.3896593148552695e-07, "loss": 0.2951150417327881, "num_input_tokens_seen": 853280664, "step": 26770, "train_runtime": 70101.1917, "train_tokens_per_second": 12172.128 }, { "epoch": 1.80278750336655, "grad_norm": 0.8245057323119559, "learning_rate": 2.3815895159281844e-07, "loss": 0.28969459533691405, "num_input_tokens_seen": 853442976, "step": 26775, "train_runtime": 70113.8058, "train_tokens_per_second": 12172.253 }, { "epoch": 1.8031241583625102, "grad_norm": 0.8556535117509269, "learning_rate": 2.3735330333377493e-07, "loss": 0.2846656322479248, "num_input_tokens_seen": 853604824, "step": 26780, "train_runtime": 70126.3535, "train_tokens_per_second": 12172.383 }, { "epoch": 1.8034608133584702, "grad_norm": 0.772273224390241, "learning_rate": 2.3654898693369232e-07, "loss": 0.292094087600708, "num_input_tokens_seen": 853764232, "step": 26785, "train_runtime": 70139.8357, "train_tokens_per_second": 12172.316 }, { "epoch": 1.8037974683544302, "grad_norm": 0.8577426238771159, "learning_rate": 2.3574600261749735e-07, "loss": 0.28982200622558596, "num_input_tokens_seen": 853926832, "step": 26790, "train_runtime": 70154.5461, "train_tokens_per_second": 12172.081 }, { "epoch": 1.8041341233503905, "grad_norm": 0.8266505341005959, "learning_rate": 2.3494435060973875e-07, "loss": 0.2977802038192749, "num_input_tokens_seen": 854085640, "step": 26795, "train_runtime": 70167.098, "train_tokens_per_second": 12172.167 }, { "epoch": 1.8044707783463507, "grad_norm": 0.92197930972693, "learning_rate": 2.3414403113459937e-07, "loss": 0.30182411670684817, "num_input_tokens_seen": 854242840, "step": 26800, "train_runtime": 70180.241, "train_tokens_per_second": 12172.127 }, { "epoch": 1.8048074333423108, "grad_norm": 0.8122168619509869, "learning_rate": 2.3334504441588413e-07, "loss": 0.2700166702270508, "num_input_tokens_seen": 854401624, "step": 26805, "train_runtime": 70192.8185, "train_tokens_per_second": 12172.209 }, { "epoch": 1.8051440883382708, "grad_norm": 0.7848662164994366, "learning_rate": 2.3254739067702704e-07, "loss": 0.28065104484558107, "num_input_tokens_seen": 854563432, "step": 26810, "train_runtime": 70205.3599, "train_tokens_per_second": 12172.339 }, { "epoch": 1.805480743334231, "grad_norm": 0.8519509662108244, "learning_rate": 2.3175107014109077e-07, "loss": 0.26915946006774905, "num_input_tokens_seen": 854721024, "step": 26815, "train_runtime": 70218.0283, "train_tokens_per_second": 12172.387 }, { "epoch": 1.8058173983301913, "grad_norm": 0.8552962025029581, "learning_rate": 2.3095608303076223e-07, "loss": 0.2965372562408447, "num_input_tokens_seen": 854882704, "step": 26820, "train_runtime": 70231.0499, "train_tokens_per_second": 12172.432 }, { "epoch": 1.8061540533261513, "grad_norm": 0.8146027501272736, "learning_rate": 2.3016242956835798e-07, "loss": 0.32484922409057615, "num_input_tokens_seen": 855044992, "step": 26825, "train_runtime": 70243.6594, "train_tokens_per_second": 12172.558 }, { "epoch": 1.8064907083221113, "grad_norm": 0.7712852727858308, "learning_rate": 2.2937010997581999e-07, "loss": 0.2744196891784668, "num_input_tokens_seen": 855208256, "step": 26830, "train_runtime": 70257.3118, "train_tokens_per_second": 12172.516 }, { "epoch": 1.8068273633180716, "grad_norm": 0.8824969294482463, "learning_rate": 2.2857912447471818e-07, "loss": 0.2860698938369751, "num_input_tokens_seen": 855360912, "step": 26835, "train_runtime": 70270.3805, "train_tokens_per_second": 12172.425 }, { "epoch": 1.8071640183140318, "grad_norm": 0.7538160364834378, "learning_rate": 2.2778947328625012e-07, "loss": 0.2795755386352539, "num_input_tokens_seen": 855515216, "step": 26840, "train_runtime": 70283.6717, "train_tokens_per_second": 12172.318 }, { "epoch": 1.8075006733099919, "grad_norm": 0.9374565537426578, "learning_rate": 2.2700115663123745e-07, "loss": 0.3118173360824585, "num_input_tokens_seen": 855673800, "step": 26845, "train_runtime": 70297.1075, "train_tokens_per_second": 12172.248 }, { "epoch": 1.807837328305952, "grad_norm": 0.8595840250080625, "learning_rate": 2.2621417473013164e-07, "loss": 0.27746379375457764, "num_input_tokens_seen": 855835848, "step": 26850, "train_runtime": 70310.2749, "train_tokens_per_second": 12172.273 }, { "epoch": 1.8081739833019121, "grad_norm": 0.9068871418435703, "learning_rate": 2.254285278030094e-07, "loss": 0.28034520149230957, "num_input_tokens_seen": 855995944, "step": 26855, "train_runtime": 70323.6377, "train_tokens_per_second": 12172.236 }, { "epoch": 1.8085106382978724, "grad_norm": 0.8317324688611203, "learning_rate": 2.24644216069575e-07, "loss": 0.29037060737609866, "num_input_tokens_seen": 856148896, "step": 26860, "train_runtime": 70336.3185, "train_tokens_per_second": 12172.216 }, { "epoch": 1.8088472932938324, "grad_norm": 0.7757104198167448, "learning_rate": 2.238612397491574e-07, "loss": 0.2824215888977051, "num_input_tokens_seen": 856310856, "step": 26865, "train_runtime": 70348.8927, "train_tokens_per_second": 12172.343 }, { "epoch": 1.8091839482897925, "grad_norm": 0.83949279553892, "learning_rate": 2.230795990607143e-07, "loss": 0.292067289352417, "num_input_tokens_seen": 856473144, "step": 26870, "train_runtime": 70361.3229, "train_tokens_per_second": 12172.499 }, { "epoch": 1.809520603285753, "grad_norm": 0.9379394170247293, "learning_rate": 2.2229929422282915e-07, "loss": 0.28386387825012205, "num_input_tokens_seen": 856630024, "step": 26875, "train_runtime": 70374.9725, "train_tokens_per_second": 12172.367 }, { "epoch": 1.809857258281713, "grad_norm": 0.8766440839778201, "learning_rate": 2.215203254537107e-07, "loss": 0.3175637245178223, "num_input_tokens_seen": 856790704, "step": 26880, "train_runtime": 70388.26, "train_tokens_per_second": 12172.352 }, { "epoch": 1.810193913277673, "grad_norm": 0.7867602307389877, "learning_rate": 2.2074269297119588e-07, "loss": 0.3082930088043213, "num_input_tokens_seen": 856952152, "step": 26885, "train_runtime": 70401.8576, "train_tokens_per_second": 12172.295 }, { "epoch": 1.8105305682736332, "grad_norm": 0.8274595863706828, "learning_rate": 2.199663969927479e-07, "loss": 0.2812648296356201, "num_input_tokens_seen": 857111688, "step": 26890, "train_runtime": 70415.3642, "train_tokens_per_second": 12172.225 }, { "epoch": 1.8108672232695935, "grad_norm": 1.0489949372173941, "learning_rate": 2.1919143773545316e-07, "loss": 0.2942085266113281, "num_input_tokens_seen": 857273320, "step": 26895, "train_runtime": 70429.0447, "train_tokens_per_second": 12172.156 }, { "epoch": 1.8112038782655535, "grad_norm": 1.6175586818236811, "learning_rate": 2.184178154160288e-07, "loss": 0.3006558418273926, "num_input_tokens_seen": 857427400, "step": 26900, "train_runtime": 70441.6398, "train_tokens_per_second": 12172.167 }, { "epoch": 1.8115405332615135, "grad_norm": 0.7812805752391684, "learning_rate": 2.1764553025081514e-07, "loss": 0.2858154773712158, "num_input_tokens_seen": 857589792, "step": 26905, "train_runtime": 70456.1148, "train_tokens_per_second": 12171.971 }, { "epoch": 1.8118771882574738, "grad_norm": 0.963713689849728, "learning_rate": 2.168745824557794e-07, "loss": 0.2870452642440796, "num_input_tokens_seen": 857747496, "step": 26910, "train_runtime": 70469.1924, "train_tokens_per_second": 12171.95 }, { "epoch": 1.812213843253434, "grad_norm": 0.8174060605646627, "learning_rate": 2.161049722465136e-07, "loss": 0.2772712230682373, "num_input_tokens_seen": 857908232, "step": 26915, "train_runtime": 70481.6191, "train_tokens_per_second": 12172.085 }, { "epoch": 1.812550498249394, "grad_norm": 0.8383726227129716, "learning_rate": 2.1533669983823835e-07, "loss": 0.29603776931762693, "num_input_tokens_seen": 858072072, "step": 26920, "train_runtime": 70494.0458, "train_tokens_per_second": 12172.263 }, { "epoch": 1.812887153245354, "grad_norm": 0.7308651503164498, "learning_rate": 2.1456976544579732e-07, "loss": 0.27979373931884766, "num_input_tokens_seen": 858235912, "step": 26925, "train_runtime": 70506.4791, "train_tokens_per_second": 12172.44 }, { "epoch": 1.8132238082413143, "grad_norm": 0.767349085594718, "learning_rate": 2.138041692836623e-07, "loss": 0.295100736618042, "num_input_tokens_seen": 858394888, "step": 26930, "train_runtime": 70519.6022, "train_tokens_per_second": 12172.43 }, { "epoch": 1.8135604632372746, "grad_norm": 0.9164780369529396, "learning_rate": 2.1303991156592818e-07, "loss": 0.3028141975402832, "num_input_tokens_seen": 858553216, "step": 26935, "train_runtime": 70532.7465, "train_tokens_per_second": 12172.406 }, { "epoch": 1.8138971182332346, "grad_norm": 0.8682771103575873, "learning_rate": 2.122769925063195e-07, "loss": 0.2896735191345215, "num_input_tokens_seen": 858712496, "step": 26940, "train_runtime": 70545.6425, "train_tokens_per_second": 12172.439 }, { "epoch": 1.8142337732291947, "grad_norm": 0.8867369246284782, "learning_rate": 2.1151541231818174e-07, "loss": 0.28209409713745115, "num_input_tokens_seen": 858873528, "step": 26945, "train_runtime": 70558.8065, "train_tokens_per_second": 12172.45 }, { "epoch": 1.814570428225155, "grad_norm": 0.854163509027148, "learning_rate": 2.1075517121449063e-07, "loss": 0.3170738220214844, "num_input_tokens_seen": 859031216, "step": 26950, "train_runtime": 70571.5282, "train_tokens_per_second": 12172.49 }, { "epoch": 1.8149070832211152, "grad_norm": 0.908505366459971, "learning_rate": 2.0999626940784334e-07, "loss": 0.26206698417663576, "num_input_tokens_seen": 859191872, "step": 26955, "train_runtime": 70584.9612, "train_tokens_per_second": 12172.449 }, { "epoch": 1.8152437382170752, "grad_norm": 0.9832339802011741, "learning_rate": 2.0923870711046568e-07, "loss": 0.297837495803833, "num_input_tokens_seen": 859353216, "step": 26960, "train_runtime": 70598.6674, "train_tokens_per_second": 12172.372 }, { "epoch": 1.8155803932130352, "grad_norm": 0.7283856366433215, "learning_rate": 2.0848248453420704e-07, "loss": 0.27922711372375486, "num_input_tokens_seen": 859514096, "step": 26965, "train_runtime": 70611.5434, "train_tokens_per_second": 12172.43 }, { "epoch": 1.8159170482089955, "grad_norm": 0.8231284588693126, "learning_rate": 2.077276018905422e-07, "loss": 0.2874908924102783, "num_input_tokens_seen": 859675656, "step": 26970, "train_runtime": 70624.6661, "train_tokens_per_second": 12172.456 }, { "epoch": 1.8162537032049557, "grad_norm": 0.8546622526273433, "learning_rate": 2.0697405939057225e-07, "loss": 0.2974217176437378, "num_input_tokens_seen": 859827240, "step": 26975, "train_runtime": 70638.0449, "train_tokens_per_second": 12172.297 }, { "epoch": 1.8165903582009157, "grad_norm": 0.7666640566728249, "learning_rate": 2.0622185724502253e-07, "loss": 0.2839369535446167, "num_input_tokens_seen": 859985024, "step": 26980, "train_runtime": 70651.3617, "train_tokens_per_second": 12172.236 }, { "epoch": 1.8169270131968758, "grad_norm": 0.7860437404352247, "learning_rate": 2.0547099566424367e-07, "loss": 0.2720181465148926, "num_input_tokens_seen": 860148560, "step": 26985, "train_runtime": 70664.3772, "train_tokens_per_second": 12172.308 }, { "epoch": 1.817263668192836, "grad_norm": 0.8569469413834617, "learning_rate": 2.0472147485821325e-07, "loss": 0.2900655269622803, "num_input_tokens_seen": 860306064, "step": 26990, "train_runtime": 70678.8148, "train_tokens_per_second": 12172.05 }, { "epoch": 1.8176003231887963, "grad_norm": 0.9471079522298579, "learning_rate": 2.0397329503653084e-07, "loss": 0.2749172687530518, "num_input_tokens_seen": 860464344, "step": 26995, "train_runtime": 70691.7561, "train_tokens_per_second": 12172.061 }, { "epoch": 1.8179369781847563, "grad_norm": 0.8197566014626608, "learning_rate": 2.03226456408423e-07, "loss": 0.3060157299041748, "num_input_tokens_seen": 860616656, "step": 27000, "train_runtime": 70705.2216, "train_tokens_per_second": 12171.897 }, { "epoch": 1.8182736331807163, "grad_norm": 0.7698219813025884, "learning_rate": 2.024809591827409e-07, "loss": 0.29669058322906494, "num_input_tokens_seen": 860779640, "step": 27005, "train_runtime": 70718.7237, "train_tokens_per_second": 12171.877 }, { "epoch": 1.8186102881766766, "grad_norm": 0.8284426152034386, "learning_rate": 2.0173680356796066e-07, "loss": 0.27449684143066405, "num_input_tokens_seen": 860935504, "step": 27010, "train_runtime": 70732.6553, "train_tokens_per_second": 12171.684 }, { "epoch": 1.8189469431726368, "grad_norm": 0.7858228479675196, "learning_rate": 2.00993989772183e-07, "loss": 0.29461596012115476, "num_input_tokens_seen": 861094576, "step": 27015, "train_runtime": 70745.8136, "train_tokens_per_second": 12171.668 }, { "epoch": 1.8192835981685969, "grad_norm": 0.7830966772800374, "learning_rate": 2.0025251800313284e-07, "loss": 0.31585776805877686, "num_input_tokens_seen": 861252496, "step": 27020, "train_runtime": 70759.0538, "train_tokens_per_second": 12171.623 }, { "epoch": 1.8196202531645569, "grad_norm": 0.7890415898640881, "learning_rate": 1.9951238846816045e-07, "loss": 0.30937507152557375, "num_input_tokens_seen": 861416216, "step": 27025, "train_runtime": 70771.4763, "train_tokens_per_second": 12171.799 }, { "epoch": 1.8199569081605171, "grad_norm": 0.7877864798480069, "learning_rate": 1.987736013742414e-07, "loss": 0.29053387641906736, "num_input_tokens_seen": 861571560, "step": 27030, "train_runtime": 70784.5743, "train_tokens_per_second": 12171.742 }, { "epoch": 1.8202935631564774, "grad_norm": 0.8178219373525091, "learning_rate": 1.9803615692797375e-07, "loss": 0.27255997657775877, "num_input_tokens_seen": 861731472, "step": 27035, "train_runtime": 70797.2511, "train_tokens_per_second": 12171.821 }, { "epoch": 1.8206302181524374, "grad_norm": 0.7285418331981861, "learning_rate": 1.9730005533558417e-07, "loss": 0.27718803882598875, "num_input_tokens_seen": 861892720, "step": 27040, "train_runtime": 70809.7353, "train_tokens_per_second": 12171.952 }, { "epoch": 1.8209668731483974, "grad_norm": 0.72801899341444, "learning_rate": 1.9656529680291802e-07, "loss": 0.2734086036682129, "num_input_tokens_seen": 862053848, "step": 27045, "train_runtime": 70823.3548, "train_tokens_per_second": 12171.887 }, { "epoch": 1.8213035281443577, "grad_norm": 0.8027209417211447, "learning_rate": 1.9583188153544986e-07, "loss": 0.2741126775741577, "num_input_tokens_seen": 862207736, "step": 27050, "train_runtime": 70836.0261, "train_tokens_per_second": 12171.882 }, { "epoch": 1.821640183140318, "grad_norm": 0.8287585620063663, "learning_rate": 1.9509980973827724e-07, "loss": 0.2951030969619751, "num_input_tokens_seen": 862369176, "step": 27055, "train_runtime": 70849.7478, "train_tokens_per_second": 12171.803 }, { "epoch": 1.821976838136278, "grad_norm": 0.8445685786220319, "learning_rate": 1.943690816161209e-07, "loss": 0.30646162033081054, "num_input_tokens_seen": 862529032, "step": 27060, "train_runtime": 70862.4304, "train_tokens_per_second": 12171.88 }, { "epoch": 1.822313493132238, "grad_norm": 0.8443710592610861, "learning_rate": 1.9363969737332677e-07, "loss": 0.2744742870330811, "num_input_tokens_seen": 862687952, "step": 27065, "train_runtime": 70874.9777, "train_tokens_per_second": 12171.968 }, { "epoch": 1.8226501481281983, "grad_norm": 0.6975098821958919, "learning_rate": 1.9291165721386507e-07, "loss": 0.2670555591583252, "num_input_tokens_seen": 862842960, "step": 27070, "train_runtime": 70888.5189, "train_tokens_per_second": 12171.829 }, { "epoch": 1.8229868031241585, "grad_norm": 0.7878061834787141, "learning_rate": 1.9218496134132957e-07, "loss": 0.3179195404052734, "num_input_tokens_seen": 863002136, "step": 27075, "train_runtime": 70901.5271, "train_tokens_per_second": 12171.841 }, { "epoch": 1.8233234581201185, "grad_norm": 0.7916837964782856, "learning_rate": 1.9145960995893831e-07, "loss": 0.2753622055053711, "num_input_tokens_seen": 863158112, "step": 27080, "train_runtime": 70914.0261, "train_tokens_per_second": 12171.895 }, { "epoch": 1.8236601131160786, "grad_norm": 0.8246354755762004, "learning_rate": 1.9073560326953344e-07, "loss": 0.2880223274230957, "num_input_tokens_seen": 863318592, "step": 27085, "train_runtime": 70926.6211, "train_tokens_per_second": 12171.997 }, { "epoch": 1.8239967681120388, "grad_norm": 0.8622359354830219, "learning_rate": 1.9001294147558303e-07, "loss": 0.30566768646240233, "num_input_tokens_seen": 863474168, "step": 27090, "train_runtime": 70939.7161, "train_tokens_per_second": 12171.943 }, { "epoch": 1.824333423107999, "grad_norm": 0.8378015478811262, "learning_rate": 1.892916247791743e-07, "loss": 0.30236384868621824, "num_input_tokens_seen": 863631352, "step": 27095, "train_runtime": 70952.6254, "train_tokens_per_second": 12171.944 }, { "epoch": 1.824670078103959, "grad_norm": 0.8060336163800181, "learning_rate": 1.885716533820231e-07, "loss": 0.28802154064178465, "num_input_tokens_seen": 863792936, "step": 27100, "train_runtime": 70965.3796, "train_tokens_per_second": 12172.033 }, { "epoch": 1.8250067330999191, "grad_norm": 0.8323050353956888, "learning_rate": 1.878530274854662e-07, "loss": 0.29305567741394045, "num_input_tokens_seen": 863953968, "step": 27105, "train_runtime": 70978.3294, "train_tokens_per_second": 12172.081 }, { "epoch": 1.8253433880958794, "grad_norm": 0.7824473206246785, "learning_rate": 1.8713574729046557e-07, "loss": 0.30150279998779295, "num_input_tokens_seen": 864114440, "step": 27110, "train_runtime": 70990.7776, "train_tokens_per_second": 12172.207 }, { "epoch": 1.8256800430918396, "grad_norm": 0.8605467319914241, "learning_rate": 1.8641981299760582e-07, "loss": 0.2926782608032227, "num_input_tokens_seen": 864269000, "step": 27115, "train_runtime": 71004.3929, "train_tokens_per_second": 12172.05 }, { "epoch": 1.8260166980877997, "grad_norm": 0.838649902523344, "learning_rate": 1.857052248070962e-07, "loss": 0.29631705284118653, "num_input_tokens_seen": 864429408, "step": 27120, "train_runtime": 71017.7441, "train_tokens_per_second": 12172.02 }, { "epoch": 1.8263533530837597, "grad_norm": 0.9731379689988796, "learning_rate": 1.8499198291876907e-07, "loss": 0.27010622024536135, "num_input_tokens_seen": 864588032, "step": 27125, "train_runtime": 71030.9605, "train_tokens_per_second": 12171.988 }, { "epoch": 1.82669000807972, "grad_norm": 0.713343469981639, "learning_rate": 1.8428008753207937e-07, "loss": 0.30358912944793703, "num_input_tokens_seen": 864750528, "step": 27130, "train_runtime": 71044.7812, "train_tokens_per_second": 12171.908 }, { "epoch": 1.8270266630756802, "grad_norm": 0.8260824296237773, "learning_rate": 1.8356953884610673e-07, "loss": 0.30570759773254397, "num_input_tokens_seen": 864914120, "step": 27135, "train_runtime": 71058.475, "train_tokens_per_second": 12171.864 }, { "epoch": 1.8273633180716402, "grad_norm": 0.8570184211488898, "learning_rate": 1.8286033705955554e-07, "loss": 0.28254094123840334, "num_input_tokens_seen": 865076880, "step": 27140, "train_runtime": 71071.5496, "train_tokens_per_second": 12171.915 }, { "epoch": 1.8276999730676002, "grad_norm": 0.8343303100347506, "learning_rate": 1.8215248237074879e-07, "loss": 0.29530584812164307, "num_input_tokens_seen": 865239400, "step": 27145, "train_runtime": 71085.7976, "train_tokens_per_second": 12171.762 }, { "epoch": 1.8280366280635605, "grad_norm": 0.7009581422536433, "learning_rate": 1.8144597497763816e-07, "loss": 0.2859818696975708, "num_input_tokens_seen": 865390984, "step": 27150, "train_runtime": 71098.207, "train_tokens_per_second": 12171.769 }, { "epoch": 1.8283732830595207, "grad_norm": 0.7674281128069027, "learning_rate": 1.8074081507779506e-07, "loss": 0.27884206771850584, "num_input_tokens_seen": 865554824, "step": 27155, "train_runtime": 71110.6173, "train_tokens_per_second": 12171.949 }, { "epoch": 1.8287099380554808, "grad_norm": 0.772589477624742, "learning_rate": 1.8003700286841563e-07, "loss": 0.3010308504104614, "num_input_tokens_seen": 865717416, "step": 27160, "train_runtime": 71123.9511, "train_tokens_per_second": 12171.953 }, { "epoch": 1.8290465930514408, "grad_norm": 0.8344049154720434, "learning_rate": 1.793345385463191e-07, "loss": 0.30673604011535643, "num_input_tokens_seen": 865878976, "step": 27165, "train_runtime": 71137.0557, "train_tokens_per_second": 12171.982 }, { "epoch": 1.829383248047401, "grad_norm": 0.8267761204159912, "learning_rate": 1.7863342230794667e-07, "loss": 0.31325130462646483, "num_input_tokens_seen": 866037416, "step": 27170, "train_runtime": 71150.231, "train_tokens_per_second": 12171.955 }, { "epoch": 1.8297199030433613, "grad_norm": 0.7932352032205876, "learning_rate": 1.7793365434936316e-07, "loss": 0.2942698001861572, "num_input_tokens_seen": 866200624, "step": 27175, "train_runtime": 71163.1174, "train_tokens_per_second": 12172.044 }, { "epoch": 1.8300565580393213, "grad_norm": 0.84363682521872, "learning_rate": 1.7723523486625704e-07, "loss": 0.2991994857788086, "num_input_tokens_seen": 866355792, "step": 27180, "train_runtime": 71176.7025, "train_tokens_per_second": 12171.901 }, { "epoch": 1.8303932130352814, "grad_norm": 0.8049487824964443, "learning_rate": 1.7653816405393766e-07, "loss": 0.3009037017822266, "num_input_tokens_seen": 866514768, "step": 27185, "train_runtime": 71189.9325, "train_tokens_per_second": 12171.872 }, { "epoch": 1.8307298680312416, "grad_norm": 0.8832984858639972, "learning_rate": 1.758424421073418e-07, "loss": 0.29663715362548826, "num_input_tokens_seen": 866676288, "step": 27190, "train_runtime": 71202.4249, "train_tokens_per_second": 12172.005 }, { "epoch": 1.8310665230272019, "grad_norm": 0.7787264884003384, "learning_rate": 1.7514806922102222e-07, "loss": 0.28052749633789065, "num_input_tokens_seen": 866830216, "step": 27195, "train_runtime": 71216.3233, "train_tokens_per_second": 12171.791 }, { "epoch": 1.8314031780231619, "grad_norm": 0.8618031279864221, "learning_rate": 1.7445504558916027e-07, "loss": 0.27704639434814454, "num_input_tokens_seen": 866988416, "step": 27200, "train_runtime": 71230.1039, "train_tokens_per_second": 12171.657 }, { "epoch": 1.831739833019122, "grad_norm": 0.8402533145130692, "learning_rate": 1.7376337140555754e-07, "loss": 0.2793675661087036, "num_input_tokens_seen": 867147880, "step": 27205, "train_runtime": 71243.5687, "train_tokens_per_second": 12171.595 }, { "epoch": 1.8320764880150822, "grad_norm": 0.8377721991737594, "learning_rate": 1.7307304686363825e-07, "loss": 0.28644700050354005, "num_input_tokens_seen": 867307248, "step": 27210, "train_runtime": 71257.0334, "train_tokens_per_second": 12171.532 }, { "epoch": 1.8324131430110424, "grad_norm": 0.7719629430588928, "learning_rate": 1.723840721564496e-07, "loss": 0.2700688362121582, "num_input_tokens_seen": 867470088, "step": 27215, "train_runtime": 71269.4752, "train_tokens_per_second": 12171.692 }, { "epoch": 1.8327497980070024, "grad_norm": 0.7966758936086434, "learning_rate": 1.7169644747666081e-07, "loss": 0.27162020206451415, "num_input_tokens_seen": 867630056, "step": 27220, "train_runtime": 71282.4986, "train_tokens_per_second": 12171.712 }, { "epoch": 1.8330864530029625, "grad_norm": 0.8698336350133569, "learning_rate": 1.710101730165642e-07, "loss": 0.28916010856628416, "num_input_tokens_seen": 867791136, "step": 27225, "train_runtime": 71295.0016, "train_tokens_per_second": 12171.837 }, { "epoch": 1.8334231079989227, "grad_norm": 0.7624470016255673, "learning_rate": 1.7032524896807402e-07, "loss": 0.26928303241729734, "num_input_tokens_seen": 867948760, "step": 27230, "train_runtime": 71309.272, "train_tokens_per_second": 12171.612 }, { "epoch": 1.833759762994883, "grad_norm": 0.8232484234653391, "learning_rate": 1.6964167552272702e-07, "loss": 0.30181159973144533, "num_input_tokens_seen": 868107912, "step": 27235, "train_runtime": 71322.8292, "train_tokens_per_second": 12171.529 }, { "epoch": 1.834096417990843, "grad_norm": 0.8877054460294689, "learning_rate": 1.6895945287168314e-07, "loss": 0.310361385345459, "num_input_tokens_seen": 868267312, "step": 27240, "train_runtime": 71336.861, "train_tokens_per_second": 12171.37 }, { "epoch": 1.834433072986803, "grad_norm": 0.921462805687509, "learning_rate": 1.682785812057225e-07, "loss": 0.30920722484588625, "num_input_tokens_seen": 868418360, "step": 27245, "train_runtime": 71349.6333, "train_tokens_per_second": 12171.308 }, { "epoch": 1.8347697279827633, "grad_norm": 0.846711529164498, "learning_rate": 1.6759906071525e-07, "loss": 0.2906870126724243, "num_input_tokens_seen": 868579528, "step": 27250, "train_runtime": 71363.4556, "train_tokens_per_second": 12171.209 }, { "epoch": 1.8351063829787235, "grad_norm": 0.922495521749728, "learning_rate": 1.669208915902909e-07, "loss": 0.33587601184844973, "num_input_tokens_seen": 868743368, "step": 27255, "train_runtime": 71375.881, "train_tokens_per_second": 12171.386 }, { "epoch": 1.8354430379746836, "grad_norm": 0.7516951150734633, "learning_rate": 1.6624407402049237e-07, "loss": 0.27452590465545657, "num_input_tokens_seen": 868902072, "step": 27260, "train_runtime": 71389.8614, "train_tokens_per_second": 12171.225 }, { "epoch": 1.8357796929706436, "grad_norm": 0.8144726842322143, "learning_rate": 1.655686081951252e-07, "loss": 0.2877694606781006, "num_input_tokens_seen": 869058184, "step": 27265, "train_runtime": 71402.4853, "train_tokens_per_second": 12171.26 }, { "epoch": 1.8361163479666038, "grad_norm": 0.9652416625952254, "learning_rate": 1.6489449430308058e-07, "loss": 0.3203382968902588, "num_input_tokens_seen": 869219888, "step": 27270, "train_runtime": 71415.6469, "train_tokens_per_second": 12171.281 }, { "epoch": 1.836453002962564, "grad_norm": 0.8147954320205363, "learning_rate": 1.6422173253287323e-07, "loss": 0.3085162162780762, "num_input_tokens_seen": 869383728, "step": 27275, "train_runtime": 71428.0705, "train_tokens_per_second": 12171.458 }, { "epoch": 1.8367896579585241, "grad_norm": 1.0029804878846063, "learning_rate": 1.6355032307263764e-07, "loss": 0.2888693332672119, "num_input_tokens_seen": 869543632, "step": 27280, "train_runtime": 71440.7871, "train_tokens_per_second": 12171.529 }, { "epoch": 1.8371263129544841, "grad_norm": 0.8176198685320356, "learning_rate": 1.628802661101314e-07, "loss": 0.2625081539154053, "num_input_tokens_seen": 869699504, "step": 27285, "train_runtime": 71453.7781, "train_tokens_per_second": 12171.498 }, { "epoch": 1.8374629679504444, "grad_norm": 0.753889105424598, "learning_rate": 1.6221156183273524e-07, "loss": 0.2896974802017212, "num_input_tokens_seen": 869862688, "step": 27290, "train_runtime": 71466.6475, "train_tokens_per_second": 12171.589 }, { "epoch": 1.8377996229464046, "grad_norm": 0.8992659563319446, "learning_rate": 1.615442104274484e-07, "loss": 0.30241103172302247, "num_input_tokens_seen": 870023304, "step": 27295, "train_runtime": 71479.0831, "train_tokens_per_second": 12171.719 }, { "epoch": 1.8381362779423647, "grad_norm": 0.9794266627502588, "learning_rate": 1.6087821208089492e-07, "loss": 0.3027640819549561, "num_input_tokens_seen": 870184600, "step": 27300, "train_runtime": 71491.4919, "train_tokens_per_second": 12171.862 }, { "epoch": 1.8384729329383247, "grad_norm": 0.7482425865694278, "learning_rate": 1.6021356697931866e-07, "loss": 0.2621957778930664, "num_input_tokens_seen": 870347520, "step": 27305, "train_runtime": 71504.9509, "train_tokens_per_second": 12171.85 }, { "epoch": 1.838809587934285, "grad_norm": 0.7781524330733605, "learning_rate": 1.5955027530858537e-07, "loss": 0.2564433813095093, "num_input_tokens_seen": 870507552, "step": 27310, "train_runtime": 71517.9568, "train_tokens_per_second": 12171.874 }, { "epoch": 1.8391462429302452, "grad_norm": 0.7501029699322518, "learning_rate": 1.5888833725418275e-07, "loss": 0.2613529682159424, "num_input_tokens_seen": 870667560, "step": 27315, "train_runtime": 71531.1477, "train_tokens_per_second": 12171.866 }, { "epoch": 1.8394828979262052, "grad_norm": 0.8239663025035118, "learning_rate": 1.582277530012194e-07, "loss": 0.26694355010986326, "num_input_tokens_seen": 870829224, "step": 27320, "train_runtime": 71543.6367, "train_tokens_per_second": 12172.001 }, { "epoch": 1.8398195529221653, "grad_norm": 0.9116417283775063, "learning_rate": 1.5756852273442536e-07, "loss": 0.29428849220275877, "num_input_tokens_seen": 870984408, "step": 27325, "train_runtime": 71556.6518, "train_tokens_per_second": 12171.956 }, { "epoch": 1.8401562079181255, "grad_norm": 0.7737270867876666, "learning_rate": 1.569106466381526e-07, "loss": 0.3038698673248291, "num_input_tokens_seen": 871145784, "step": 27330, "train_runtime": 71570.2242, "train_tokens_per_second": 12171.902 }, { "epoch": 1.8404928629140858, "grad_norm": 0.7782434940868362, "learning_rate": 1.5625412489637337e-07, "loss": 0.27227582931518557, "num_input_tokens_seen": 871305880, "step": 27335, "train_runtime": 71582.6391, "train_tokens_per_second": 12172.028 }, { "epoch": 1.8408295179100458, "grad_norm": 0.8889795593827744, "learning_rate": 1.555989576926842e-07, "loss": 0.29062957763671876, "num_input_tokens_seen": 871469720, "step": 27340, "train_runtime": 71595.0706, "train_tokens_per_second": 12172.203 }, { "epoch": 1.8411661729060058, "grad_norm": 0.8594452637531506, "learning_rate": 1.5494514521029736e-07, "loss": 0.2943892478942871, "num_input_tokens_seen": 871631744, "step": 27345, "train_runtime": 71607.6637, "train_tokens_per_second": 12172.325 }, { "epoch": 1.841502827901966, "grad_norm": 0.7905380407009803, "learning_rate": 1.5429268763205108e-07, "loss": 0.28862152099609373, "num_input_tokens_seen": 871792472, "step": 27350, "train_runtime": 71620.4294, "train_tokens_per_second": 12172.399 }, { "epoch": 1.8418394828979263, "grad_norm": 0.7986330508974063, "learning_rate": 1.5364158514040328e-07, "loss": 0.2979848623275757, "num_input_tokens_seen": 871952536, "step": 27355, "train_runtime": 71633.171, "train_tokens_per_second": 12172.469 }, { "epoch": 1.8421761378938863, "grad_norm": 1.0396200796633621, "learning_rate": 1.5299183791743223e-07, "loss": 0.2980222225189209, "num_input_tokens_seen": 872106840, "step": 27360, "train_runtime": 71646.6097, "train_tokens_per_second": 12172.339 }, { "epoch": 1.8425127928898464, "grad_norm": 0.9223987932403381, "learning_rate": 1.523434461448381e-07, "loss": 0.31063032150268555, "num_input_tokens_seen": 872270680, "step": 27365, "train_runtime": 71659.0347, "train_tokens_per_second": 12172.515 }, { "epoch": 1.8428494478858066, "grad_norm": 0.7906190716627437, "learning_rate": 1.5169641000394086e-07, "loss": 0.2921443462371826, "num_input_tokens_seen": 872434336, "step": 27370, "train_runtime": 71672.1503, "train_tokens_per_second": 12172.571 }, { "epoch": 1.8431861028817669, "grad_norm": 0.8057299439125879, "learning_rate": 1.5105072967568246e-07, "loss": 0.2900339126586914, "num_input_tokens_seen": 872591552, "step": 27375, "train_runtime": 71684.9227, "train_tokens_per_second": 12172.595 }, { "epoch": 1.843522757877727, "grad_norm": 0.7175964867064437, "learning_rate": 1.504064053406251e-07, "loss": 0.29469482898712157, "num_input_tokens_seen": 872753232, "step": 27380, "train_runtime": 71698.5611, "train_tokens_per_second": 12172.535 }, { "epoch": 1.843859412873687, "grad_norm": 0.9335406914726482, "learning_rate": 1.4976343717895192e-07, "loss": 0.300518274307251, "num_input_tokens_seen": 872914872, "step": 27385, "train_runtime": 71711.5613, "train_tokens_per_second": 12172.582 }, { "epoch": 1.8441960678696472, "grad_norm": 0.8167853420517825, "learning_rate": 1.491218253704685e-07, "loss": 0.2991645097732544, "num_input_tokens_seen": 873077648, "step": 27390, "train_runtime": 71724.2979, "train_tokens_per_second": 12172.69 }, { "epoch": 1.8445327228656074, "grad_norm": 0.7686677637617825, "learning_rate": 1.484815700945974e-07, "loss": 0.29986402988433836, "num_input_tokens_seen": 873234432, "step": 27395, "train_runtime": 71736.9216, "train_tokens_per_second": 12172.734 }, { "epoch": 1.8448693778615675, "grad_norm": 0.8054071096197858, "learning_rate": 1.478426715303849e-07, "loss": 0.2911808013916016, "num_input_tokens_seen": 873388616, "step": 27400, "train_runtime": 71750.7463, "train_tokens_per_second": 12172.537 }, { "epoch": 1.8452060328575275, "grad_norm": 0.7755531074048934, "learning_rate": 1.4720512985649694e-07, "loss": 0.28577733039855957, "num_input_tokens_seen": 873548624, "step": 27405, "train_runtime": 71764.6433, "train_tokens_per_second": 12172.409 }, { "epoch": 1.8455426878534877, "grad_norm": 0.9375542783148483, "learning_rate": 1.4656894525122034e-07, "loss": 0.295374321937561, "num_input_tokens_seen": 873706784, "step": 27410, "train_runtime": 71777.4695, "train_tokens_per_second": 12172.438 }, { "epoch": 1.845879342849448, "grad_norm": 0.8289218066428363, "learning_rate": 1.459341178924617e-07, "loss": 0.2863925933837891, "num_input_tokens_seen": 873866424, "step": 27415, "train_runtime": 71790.1119, "train_tokens_per_second": 12172.518 }, { "epoch": 1.846215997845408, "grad_norm": 0.8324948723938166, "learning_rate": 1.453006479577479e-07, "loss": 0.2693448543548584, "num_input_tokens_seen": 874019312, "step": 27420, "train_runtime": 71802.5536, "train_tokens_per_second": 12172.538 }, { "epoch": 1.846552652841368, "grad_norm": 0.8032478503855339, "learning_rate": 1.4466853562422778e-07, "loss": 0.30429399013519287, "num_input_tokens_seen": 874168136, "step": 27425, "train_runtime": 71815.4404, "train_tokens_per_second": 12172.426 }, { "epoch": 1.8468893078373283, "grad_norm": 0.8397375923041422, "learning_rate": 1.440377810686694e-07, "loss": 0.27332324981689454, "num_input_tokens_seen": 874327848, "step": 27430, "train_runtime": 71829.4099, "train_tokens_per_second": 12172.282 }, { "epoch": 1.8472259628332885, "grad_norm": 0.9140841420402113, "learning_rate": 1.4340838446746052e-07, "loss": 0.293894624710083, "num_input_tokens_seen": 874486616, "step": 27435, "train_runtime": 71842.1057, "train_tokens_per_second": 12172.341 }, { "epoch": 1.8475626178292486, "grad_norm": 0.8225732553987689, "learning_rate": 1.4278034599661094e-07, "loss": 0.2723236083984375, "num_input_tokens_seen": 874645128, "step": 27440, "train_runtime": 71855.2614, "train_tokens_per_second": 12172.319 }, { "epoch": 1.8478992728252086, "grad_norm": 1.056085285217674, "learning_rate": 1.421536658317485e-07, "loss": 0.27869529724121095, "num_input_tokens_seen": 874797904, "step": 27445, "train_runtime": 71868.6581, "train_tokens_per_second": 12172.175 }, { "epoch": 1.8482359278211689, "grad_norm": 0.8281075836119839, "learning_rate": 1.41528344148123e-07, "loss": 0.2799793004989624, "num_input_tokens_seen": 874961608, "step": 27450, "train_runtime": 71881.7164, "train_tokens_per_second": 12172.241 }, { "epoch": 1.848572582817129, "grad_norm": 0.9206121065506052, "learning_rate": 1.40904381120604e-07, "loss": 0.25560123920440675, "num_input_tokens_seen": 875118712, "step": 27455, "train_runtime": 71894.7985, "train_tokens_per_second": 12172.212 }, { "epoch": 1.8489092378130891, "grad_norm": 0.8389948818156299, "learning_rate": 1.4028177692367973e-07, "loss": 0.29099810123443604, "num_input_tokens_seen": 875277384, "step": 27460, "train_runtime": 71907.6928, "train_tokens_per_second": 12172.236 }, { "epoch": 1.8492458928090492, "grad_norm": 0.7940698844836693, "learning_rate": 1.3966053173146032e-07, "loss": 0.29418370723724363, "num_input_tokens_seen": 875438088, "step": 27465, "train_runtime": 71920.6307, "train_tokens_per_second": 12172.28 }, { "epoch": 1.8495825478050094, "grad_norm": 0.7213998746705305, "learning_rate": 1.3904064571767462e-07, "loss": 0.2881680727005005, "num_input_tokens_seen": 875601896, "step": 27470, "train_runtime": 71933.7346, "train_tokens_per_second": 12172.34 }, { "epoch": 1.8499192028009697, "grad_norm": 0.7783994836679651, "learning_rate": 1.3842211905567227e-07, "loss": 0.27355542182922366, "num_input_tokens_seen": 875759312, "step": 27475, "train_runtime": 71946.8358, "train_tokens_per_second": 12172.312 }, { "epoch": 1.8502558577969297, "grad_norm": 0.8238684200032111, "learning_rate": 1.378049519184216e-07, "loss": 0.29291419982910155, "num_input_tokens_seen": 875917384, "step": 27480, "train_runtime": 71960.0374, "train_tokens_per_second": 12172.275 }, { "epoch": 1.8505925127928897, "grad_norm": 0.7760330888477129, "learning_rate": 1.3718914447851116e-07, "loss": 0.27587141990661623, "num_input_tokens_seen": 876080352, "step": 27485, "train_runtime": 71972.8502, "train_tokens_per_second": 12172.373 }, { "epoch": 1.85092916778885, "grad_norm": 0.7645014310661358, "learning_rate": 1.3657469690815106e-07, "loss": 0.28146064281463623, "num_input_tokens_seen": 876244040, "step": 27490, "train_runtime": 71985.9259, "train_tokens_per_second": 12172.436 }, { "epoch": 1.8512658227848102, "grad_norm": 0.7520126415959406, "learning_rate": 1.359616093791677e-07, "loss": 0.3067142486572266, "num_input_tokens_seen": 876406488, "step": 27495, "train_runtime": 71998.5805, "train_tokens_per_second": 12172.552 }, { "epoch": 1.8516024777807703, "grad_norm": 0.7197164296566871, "learning_rate": 1.353498820630106e-07, "loss": 0.28169894218444824, "num_input_tokens_seen": 876568728, "step": 27500, "train_runtime": 72011.7924, "train_tokens_per_second": 12172.572 }, { "epoch": 1.8519391327767303, "grad_norm": 0.8231057014036376, "learning_rate": 1.3473951513074625e-07, "loss": 0.2980319023132324, "num_input_tokens_seen": 876728376, "step": 27505, "train_runtime": 72024.4911, "train_tokens_per_second": 12172.642 }, { "epoch": 1.8522757877726905, "grad_norm": 0.8179333184858466, "learning_rate": 1.341305087530631e-07, "loss": 0.2921454906463623, "num_input_tokens_seen": 876886784, "step": 27510, "train_runtime": 72037.5784, "train_tokens_per_second": 12172.63 }, { "epoch": 1.8526124427686508, "grad_norm": 0.9488685337931034, "learning_rate": 1.3352286310026663e-07, "loss": 0.30609047412872314, "num_input_tokens_seen": 877046024, "step": 27515, "train_runtime": 72050.8642, "train_tokens_per_second": 12172.595 }, { "epoch": 1.8529490977646108, "grad_norm": 0.7935453432337211, "learning_rate": 1.329165783422831e-07, "loss": 0.31588268280029297, "num_input_tokens_seen": 877205224, "step": 27520, "train_runtime": 72064.5287, "train_tokens_per_second": 12172.497 }, { "epoch": 1.8532857527605708, "grad_norm": 0.8468160317694157, "learning_rate": 1.3231165464865914e-07, "loss": 0.2817737579345703, "num_input_tokens_seen": 877360056, "step": 27525, "train_runtime": 72077.2143, "train_tokens_per_second": 12172.502 }, { "epoch": 1.853622407756531, "grad_norm": 0.7974732968250614, "learning_rate": 1.3170809218855884e-07, "loss": 0.2877452850341797, "num_input_tokens_seen": 877522680, "step": 27530, "train_runtime": 72090.5771, "train_tokens_per_second": 12172.502 }, { "epoch": 1.8539590627524913, "grad_norm": 0.8331855129202257, "learning_rate": 1.3110589113076554e-07, "loss": 0.29010734558105467, "num_input_tokens_seen": 877686056, "step": 27535, "train_runtime": 72103.5532, "train_tokens_per_second": 12172.577 }, { "epoch": 1.8542957177484514, "grad_norm": 0.8540674606929154, "learning_rate": 1.3050505164368566e-07, "loss": 0.2872800588607788, "num_input_tokens_seen": 877844984, "step": 27540, "train_runtime": 72116.479, "train_tokens_per_second": 12172.599 }, { "epoch": 1.8546323727444114, "grad_norm": 0.8976389332919095, "learning_rate": 1.299055738953392e-07, "loss": 0.26750071048736573, "num_input_tokens_seen": 877999608, "step": 27545, "train_runtime": 72129.9104, "train_tokens_per_second": 12172.476 }, { "epoch": 1.8549690277403716, "grad_norm": 0.775081261180271, "learning_rate": 1.293074580533704e-07, "loss": 0.28496038913726807, "num_input_tokens_seen": 878162664, "step": 27550, "train_runtime": 72142.9858, "train_tokens_per_second": 12172.53 }, { "epoch": 1.855305682736332, "grad_norm": 0.8260434916689043, "learning_rate": 1.2871070428503885e-07, "loss": 0.30309720039367677, "num_input_tokens_seen": 878318168, "step": 27555, "train_runtime": 72156.2119, "train_tokens_per_second": 12172.454 }, { "epoch": 1.855642337732292, "grad_norm": 0.7614330294648849, "learning_rate": 1.2811531275722543e-07, "loss": 0.31922097206115724, "num_input_tokens_seen": 878477896, "step": 27560, "train_runtime": 72169.2854, "train_tokens_per_second": 12172.462 }, { "epoch": 1.855978992728252, "grad_norm": 0.8398075272620146, "learning_rate": 1.275212836364298e-07, "loss": 0.2937641143798828, "num_input_tokens_seen": 878640016, "step": 27565, "train_runtime": 72182.9039, "train_tokens_per_second": 12172.412 }, { "epoch": 1.8563156477242122, "grad_norm": 0.807061108497259, "learning_rate": 1.2692861708877014e-07, "loss": 0.2721449136734009, "num_input_tokens_seen": 878797080, "step": 27570, "train_runtime": 72195.3304, "train_tokens_per_second": 12172.492 }, { "epoch": 1.8566523027201725, "grad_norm": 0.7607230875107283, "learning_rate": 1.2633731327998332e-07, "loss": 0.28148822784423827, "num_input_tokens_seen": 878956872, "step": 27575, "train_runtime": 72209.6594, "train_tokens_per_second": 12172.289 }, { "epoch": 1.8569889577161325, "grad_norm": 0.8350663103725182, "learning_rate": 1.25747372375426e-07, "loss": 0.29016618728637694, "num_input_tokens_seen": 879110848, "step": 27580, "train_runtime": 72222.951, "train_tokens_per_second": 12172.181 }, { "epoch": 1.8573256127120925, "grad_norm": 0.8066071274430157, "learning_rate": 1.251587945400723e-07, "loss": 0.3028055906295776, "num_input_tokens_seen": 879271728, "step": 27585, "train_runtime": 72236.6227, "train_tokens_per_second": 12172.105 }, { "epoch": 1.8576622677080528, "grad_norm": 0.8104939244271857, "learning_rate": 1.2457157993851832e-07, "loss": 0.29297661781311035, "num_input_tokens_seen": 879432752, "step": 27590, "train_runtime": 72249.7598, "train_tokens_per_second": 12172.12 }, { "epoch": 1.857998922704013, "grad_norm": 0.8068816762151182, "learning_rate": 1.2398572873497438e-07, "loss": 0.28179564476013186, "num_input_tokens_seen": 879596584, "step": 27595, "train_runtime": 72262.8702, "train_tokens_per_second": 12172.179 }, { "epoch": 1.858335577699973, "grad_norm": 0.8049826965625225, "learning_rate": 1.2340124109327334e-07, "loss": 0.294586706161499, "num_input_tokens_seen": 879757472, "step": 27600, "train_runtime": 72275.8495, "train_tokens_per_second": 12172.219 }, { "epoch": 1.858672232695933, "grad_norm": 0.7914758802484532, "learning_rate": 1.22818117176865e-07, "loss": 0.3095369338989258, "num_input_tokens_seen": 879918976, "step": 27605, "train_runtime": 72288.3424, "train_tokens_per_second": 12172.35 }, { "epoch": 1.8590088876918933, "grad_norm": 0.8477082099647367, "learning_rate": 1.2223635714881777e-07, "loss": 0.29800169467926024, "num_input_tokens_seen": 880075896, "step": 27610, "train_runtime": 72301.1057, "train_tokens_per_second": 12172.371 }, { "epoch": 1.8593455426878536, "grad_norm": 0.757961306211108, "learning_rate": 1.2165596117181931e-07, "loss": 0.286836051940918, "num_input_tokens_seen": 880236864, "step": 27615, "train_runtime": 72313.9924, "train_tokens_per_second": 12172.428 }, { "epoch": 1.8596821976838136, "grad_norm": 0.7219058696615754, "learning_rate": 1.2107692940817594e-07, "loss": 0.3009026527404785, "num_input_tokens_seen": 880394536, "step": 27620, "train_runtime": 72326.5347, "train_tokens_per_second": 12172.497 }, { "epoch": 1.8600188526797736, "grad_norm": 0.8855547725045079, "learning_rate": 1.2049926201981088e-07, "loss": 0.29579958915710447, "num_input_tokens_seen": 880551648, "step": 27625, "train_runtime": 72339.6324, "train_tokens_per_second": 12172.465 }, { "epoch": 1.8603555076757339, "grad_norm": 0.770433702305638, "learning_rate": 1.199229591682677e-07, "loss": 0.3103304862976074, "num_input_tokens_seen": 880710512, "step": 27630, "train_runtime": 72352.3334, "train_tokens_per_second": 12172.524 }, { "epoch": 1.8606921626716941, "grad_norm": 0.9754527664560025, "learning_rate": 1.193480210147069e-07, "loss": 0.30147709846496584, "num_input_tokens_seen": 880873280, "step": 27635, "train_runtime": 72365.063, "train_tokens_per_second": 12172.632 }, { "epoch": 1.8610288176676542, "grad_norm": 0.7885895776645526, "learning_rate": 1.1877444771991042e-07, "loss": 0.28636789321899414, "num_input_tokens_seen": 881035728, "step": 27640, "train_runtime": 72377.8927, "train_tokens_per_second": 12172.719 }, { "epoch": 1.8613654726636142, "grad_norm": 0.7786126360153375, "learning_rate": 1.1820223944427279e-07, "loss": 0.27569682598114015, "num_input_tokens_seen": 881191824, "step": 27645, "train_runtime": 72390.8343, "train_tokens_per_second": 12172.699 }, { "epoch": 1.8617021276595744, "grad_norm": 0.7199390476857687, "learning_rate": 1.1763139634781262e-07, "loss": 0.29572110176086425, "num_input_tokens_seen": 881353488, "step": 27650, "train_runtime": 72404.0157, "train_tokens_per_second": 12172.716 }, { "epoch": 1.8620387826555347, "grad_norm": 0.781387620909201, "learning_rate": 1.1706191859016392e-07, "loss": 0.3168900489807129, "num_input_tokens_seen": 881513960, "step": 27655, "train_runtime": 72417.0932, "train_tokens_per_second": 12172.733 }, { "epoch": 1.8623754376514947, "grad_norm": 0.8617449163816636, "learning_rate": 1.1649380633057927e-07, "loss": 0.2769595146179199, "num_input_tokens_seen": 881668912, "step": 27660, "train_runtime": 72429.9984, "train_tokens_per_second": 12172.704 }, { "epoch": 1.8627120926474547, "grad_norm": 0.7748137491840571, "learning_rate": 1.1592705972792939e-07, "loss": 0.27399134635925293, "num_input_tokens_seen": 881828072, "step": 27665, "train_runtime": 72443.7004, "train_tokens_per_second": 12172.598 }, { "epoch": 1.863048747643415, "grad_norm": 0.7582729403371697, "learning_rate": 1.1536167894070249e-07, "loss": 0.30470900535583495, "num_input_tokens_seen": 881989632, "step": 27670, "train_runtime": 72457.2639, "train_tokens_per_second": 12172.55 }, { "epoch": 1.8633854026393752, "grad_norm": 0.7719897390691288, "learning_rate": 1.1479766412700655e-07, "loss": 0.3218668460845947, "num_input_tokens_seen": 882153424, "step": 27675, "train_runtime": 72470.3733, "train_tokens_per_second": 12172.608 }, { "epoch": 1.8637220576353353, "grad_norm": 0.7696013560298175, "learning_rate": 1.1423501544456595e-07, "loss": 0.30865747928619386, "num_input_tokens_seen": 882309208, "step": 27680, "train_runtime": 72482.8419, "train_tokens_per_second": 12172.663 }, { "epoch": 1.8640587126312953, "grad_norm": 0.7970654453005196, "learning_rate": 1.1367373305072315e-07, "loss": 0.27881536483764646, "num_input_tokens_seen": 882471712, "step": 27685, "train_runtime": 72496.1584, "train_tokens_per_second": 12172.669 }, { "epoch": 1.8643953676272556, "grad_norm": 0.7205948537495926, "learning_rate": 1.1311381710244096e-07, "loss": 0.2617627143859863, "num_input_tokens_seen": 882633976, "step": 27690, "train_runtime": 72508.7631, "train_tokens_per_second": 12172.79 }, { "epoch": 1.8647320226232158, "grad_norm": 1.0981707922908153, "learning_rate": 1.1255526775629521e-07, "loss": 0.26013147830963135, "num_input_tokens_seen": 882795784, "step": 27695, "train_runtime": 72522.1962, "train_tokens_per_second": 12172.767 }, { "epoch": 1.8650686776191758, "grad_norm": 0.8308397344915243, "learning_rate": 1.1199808516848487e-07, "loss": 0.30060672760009766, "num_input_tokens_seen": 882951624, "step": 27700, "train_runtime": 72535.1119, "train_tokens_per_second": 12172.748 }, { "epoch": 1.8654053326151359, "grad_norm": 0.7614020283838211, "learning_rate": 1.1144226949482306e-07, "loss": 0.2741485834121704, "num_input_tokens_seen": 883109504, "step": 27705, "train_runtime": 72548.7784, "train_tokens_per_second": 12172.631 }, { "epoch": 1.865741987611096, "grad_norm": 0.7267544168293171, "learning_rate": 1.1088782089074157e-07, "loss": 0.2698942184448242, "num_input_tokens_seen": 883266656, "step": 27710, "train_runtime": 72561.638, "train_tokens_per_second": 12172.639 }, { "epoch": 1.8660786426070564, "grad_norm": 0.8558606155696188, "learning_rate": 1.1033473951129137e-07, "loss": 0.29747495651245115, "num_input_tokens_seen": 883426048, "step": 27715, "train_runtime": 72574.5333, "train_tokens_per_second": 12172.673 }, { "epoch": 1.8664152976030164, "grad_norm": 0.822951280738268, "learning_rate": 1.0978302551113929e-07, "loss": 0.30676970481872556, "num_input_tokens_seen": 883588984, "step": 27720, "train_runtime": 72587.2856, "train_tokens_per_second": 12172.779 }, { "epoch": 1.8667519525989764, "grad_norm": 0.8538920617511101, "learning_rate": 1.0923267904457025e-07, "loss": 0.3054649353027344, "num_input_tokens_seen": 883750376, "step": 27725, "train_runtime": 72600.4562, "train_tokens_per_second": 12172.794 }, { "epoch": 1.8670886075949367, "grad_norm": 0.7917885023548918, "learning_rate": 1.086837002654867e-07, "loss": 0.2991494655609131, "num_input_tokens_seen": 883907056, "step": 27730, "train_runtime": 72613.288, "train_tokens_per_second": 12172.8 }, { "epoch": 1.867425262590897, "grad_norm": 0.8429094191556364, "learning_rate": 1.0813608932740915e-07, "loss": 0.2981977939605713, "num_input_tokens_seen": 884070896, "step": 27735, "train_runtime": 72625.7173, "train_tokens_per_second": 12172.973 }, { "epoch": 1.867761917586857, "grad_norm": 0.8632924956538994, "learning_rate": 1.0758984638347569e-07, "loss": 0.29195926189422605, "num_input_tokens_seen": 884231936, "step": 27740, "train_runtime": 72638.1958, "train_tokens_per_second": 12173.099 }, { "epoch": 1.868098572582817, "grad_norm": 0.9102952049022162, "learning_rate": 1.0704497158644022e-07, "loss": 0.32872300148010253, "num_input_tokens_seen": 884386520, "step": 27745, "train_runtime": 72650.6623, "train_tokens_per_second": 12173.138 }, { "epoch": 1.8684352275787772, "grad_norm": 0.7497864074848651, "learning_rate": 1.0650146508867642e-07, "loss": 0.28098583221435547, "num_input_tokens_seen": 884544528, "step": 27750, "train_runtime": 72663.752, "train_tokens_per_second": 12173.119 }, { "epoch": 1.8687718825747375, "grad_norm": 0.8301490276644983, "learning_rate": 1.0595932704217327e-07, "loss": 0.3004870891571045, "num_input_tokens_seen": 884706520, "step": 27755, "train_runtime": 72676.898, "train_tokens_per_second": 12173.146 }, { "epoch": 1.8691085375706975, "grad_norm": 0.7934361981303704, "learning_rate": 1.0541855759853837e-07, "loss": 0.28049535751342775, "num_input_tokens_seen": 884870280, "step": 27760, "train_runtime": 72689.3069, "train_tokens_per_second": 12173.321 }, { "epoch": 1.8694451925666575, "grad_norm": 0.8005042190087888, "learning_rate": 1.0487915690899685e-07, "loss": 0.3012115240097046, "num_input_tokens_seen": 885032152, "step": 27765, "train_runtime": 72702.4477, "train_tokens_per_second": 12173.347 }, { "epoch": 1.8697818475626178, "grad_norm": 0.7385473938643486, "learning_rate": 1.0434112512438921e-07, "loss": 0.2842231750488281, "num_input_tokens_seen": 885192552, "step": 27770, "train_runtime": 72715.9269, "train_tokens_per_second": 12173.297 }, { "epoch": 1.870118502558578, "grad_norm": 0.8847364400413646, "learning_rate": 1.0380446239517506e-07, "loss": 0.272721529006958, "num_input_tokens_seen": 885345888, "step": 27775, "train_runtime": 72729.2223, "train_tokens_per_second": 12173.18 }, { "epoch": 1.870455157554538, "grad_norm": 0.8821201818777644, "learning_rate": 1.032691688714299e-07, "loss": 0.28608098030090334, "num_input_tokens_seen": 885495360, "step": 27780, "train_runtime": 72742.1418, "train_tokens_per_second": 12173.072 }, { "epoch": 1.870791812550498, "grad_norm": 0.8705735683370164, "learning_rate": 1.0273524470284734e-07, "loss": 0.3107900142669678, "num_input_tokens_seen": 885658848, "step": 27785, "train_runtime": 72755.1377, "train_tokens_per_second": 12173.145 }, { "epoch": 1.8711284675464583, "grad_norm": 0.9010580375654128, "learning_rate": 1.0220269003873739e-07, "loss": 0.28125360012054446, "num_input_tokens_seen": 885815280, "step": 27790, "train_runtime": 72768.2008, "train_tokens_per_second": 12173.11 }, { "epoch": 1.8714651225424186, "grad_norm": 0.8152127847206131, "learning_rate": 1.0167150502802703e-07, "loss": 0.2652273416519165, "num_input_tokens_seen": 885973968, "step": 27795, "train_runtime": 72781.8532, "train_tokens_per_second": 12173.006 }, { "epoch": 1.8718017775383786, "grad_norm": 0.7832099321616367, "learning_rate": 1.0114168981926075e-07, "loss": 0.30316591262817383, "num_input_tokens_seen": 886136128, "step": 27800, "train_runtime": 72795.6731, "train_tokens_per_second": 12172.923 }, { "epoch": 1.8721384325343386, "grad_norm": 0.7796280147400254, "learning_rate": 1.006132445605995e-07, "loss": 0.2941952466964722, "num_input_tokens_seen": 886287960, "step": 27805, "train_runtime": 72808.8443, "train_tokens_per_second": 12172.806 }, { "epoch": 1.872475087530299, "grad_norm": 0.7871098871950551, "learning_rate": 1.0008616939982118e-07, "loss": 0.28180084228515623, "num_input_tokens_seen": 886445032, "step": 27810, "train_runtime": 72822.2442, "train_tokens_per_second": 12172.723 }, { "epoch": 1.8728117425262591, "grad_norm": 0.8251149939105866, "learning_rate": 9.956046448432177e-08, "loss": 0.2820472478866577, "num_input_tokens_seen": 886604480, "step": 27815, "train_runtime": 72836.1057, "train_tokens_per_second": 12172.596 }, { "epoch": 1.8731483975222192, "grad_norm": 0.750269688245949, "learning_rate": 9.90361299611109e-08, "loss": 0.30066475868225095, "num_input_tokens_seen": 886766152, "step": 27820, "train_runtime": 72849.1102, "train_tokens_per_second": 12172.642 }, { "epoch": 1.8734850525181792, "grad_norm": 0.877487740789378, "learning_rate": 9.851316597681959e-08, "loss": 0.30822277069091797, "num_input_tokens_seen": 886925728, "step": 27825, "train_runtime": 72862.5207, "train_tokens_per_second": 12172.592 }, { "epoch": 1.8738217075141395, "grad_norm": 0.8351287076508815, "learning_rate": 9.799157267769088e-08, "loss": 0.30189104080200196, "num_input_tokens_seen": 887083760, "step": 27830, "train_runtime": 72875.3919, "train_tokens_per_second": 12172.61 }, { "epoch": 1.8741583625100997, "grad_norm": 0.803474666309235, "learning_rate": 9.747135020958753e-08, "loss": 0.29504618644714353, "num_input_tokens_seen": 887245288, "step": 27835, "train_runtime": 72888.314, "train_tokens_per_second": 12172.669 }, { "epoch": 1.8744950175060597, "grad_norm": 0.7797560994529075, "learning_rate": 9.695249871798818e-08, "loss": 0.2727928638458252, "num_input_tokens_seen": 887406264, "step": 27840, "train_runtime": 72902.1108, "train_tokens_per_second": 12172.573 }, { "epoch": 1.8748316725020198, "grad_norm": 0.8622211542518032, "learning_rate": 9.643501834798786e-08, "loss": 0.2960002899169922, "num_input_tokens_seen": 887567200, "step": 27845, "train_runtime": 72915.9309, "train_tokens_per_second": 12172.473 }, { "epoch": 1.8751683274979802, "grad_norm": 0.8963240547969548, "learning_rate": 9.591890924429858e-08, "loss": 0.3056071996688843, "num_input_tokens_seen": 887731040, "step": 27850, "train_runtime": 72928.3555, "train_tokens_per_second": 12172.646 }, { "epoch": 1.8755049824939403, "grad_norm": 0.780586472801103, "learning_rate": 9.540417155124826e-08, "loss": 0.2770434617996216, "num_input_tokens_seen": 887886440, "step": 27855, "train_runtime": 72942.3981, "train_tokens_per_second": 12172.433 }, { "epoch": 1.8758416374899003, "grad_norm": 0.7850527896914666, "learning_rate": 9.489080541278117e-08, "loss": 0.29499149322509766, "num_input_tokens_seen": 888044232, "step": 27860, "train_runtime": 72955.1403, "train_tokens_per_second": 12172.47 }, { "epoch": 1.8761782924858605, "grad_norm": 0.7553449602378549, "learning_rate": 9.437881097246026e-08, "loss": 0.2947093486785889, "num_input_tokens_seen": 888207952, "step": 27865, "train_runtime": 72968.2097, "train_tokens_per_second": 12172.533 }, { "epoch": 1.8765149474818208, "grad_norm": 0.786645120767396, "learning_rate": 9.3868188373461e-08, "loss": 0.29761443138122556, "num_input_tokens_seen": 888366648, "step": 27870, "train_runtime": 72982.0319, "train_tokens_per_second": 12172.402 }, { "epoch": 1.8768516024777808, "grad_norm": 0.898577498960538, "learning_rate": 9.335893775857918e-08, "loss": 0.30380902290344236, "num_input_tokens_seen": 888524440, "step": 27875, "train_runtime": 72996.075, "train_tokens_per_second": 12172.222 }, { "epoch": 1.8771882574737409, "grad_norm": 1.1507064642213123, "learning_rate": 9.285105927022309e-08, "loss": 0.2756707191467285, "num_input_tokens_seen": 888683984, "step": 27880, "train_runtime": 73008.9749, "train_tokens_per_second": 12172.257 }, { "epoch": 1.877524912469701, "grad_norm": 0.8484865408624757, "learning_rate": 9.234455305042133e-08, "loss": 0.28602607250213624, "num_input_tokens_seen": 888837904, "step": 27885, "train_runtime": 73021.9953, "train_tokens_per_second": 12172.194 }, { "epoch": 1.8778615674656614, "grad_norm": 0.8267845931243424, "learning_rate": 9.183941924081563e-08, "loss": 0.2835225105285645, "num_input_tokens_seen": 888996872, "step": 27890, "train_runtime": 73034.9354, "train_tokens_per_second": 12172.214 }, { "epoch": 1.8781982224616214, "grad_norm": 0.7959633390473106, "learning_rate": 9.133565798266574e-08, "loss": 0.2821208477020264, "num_input_tokens_seen": 889155368, "step": 27895, "train_runtime": 73047.6879, "train_tokens_per_second": 12172.259 }, { "epoch": 1.8785348774575814, "grad_norm": 0.882191701119769, "learning_rate": 9.083326941684622e-08, "loss": 0.3249369621276855, "num_input_tokens_seen": 889314256, "step": 27900, "train_runtime": 73060.8167, "train_tokens_per_second": 12172.246 }, { "epoch": 1.8788715324535417, "grad_norm": 0.7827373944313485, "learning_rate": 9.033225368384912e-08, "loss": 0.31013007164001466, "num_input_tokens_seen": 889474016, "step": 27905, "train_runtime": 73074.0017, "train_tokens_per_second": 12172.236 }, { "epoch": 1.879208187449502, "grad_norm": 0.7182055697924479, "learning_rate": 8.98326109237807e-08, "loss": 0.2798023700714111, "num_input_tokens_seen": 889633184, "step": 27910, "train_runtime": 73086.4462, "train_tokens_per_second": 12172.342 }, { "epoch": 1.879544842445462, "grad_norm": 0.8014438382240342, "learning_rate": 8.933434127636586e-08, "loss": 0.3125504732131958, "num_input_tokens_seen": 889791848, "step": 27915, "train_runtime": 73099.2601, "train_tokens_per_second": 12172.378 }, { "epoch": 1.879881497441422, "grad_norm": 0.9111176863754624, "learning_rate": 8.883744488094314e-08, "loss": 0.3022294521331787, "num_input_tokens_seen": 889949632, "step": 27920, "train_runtime": 73112.1967, "train_tokens_per_second": 12172.383 }, { "epoch": 1.8802181524373822, "grad_norm": 0.721452676212702, "learning_rate": 8.834192187646917e-08, "loss": 0.2927600383758545, "num_input_tokens_seen": 890113472, "step": 27925, "train_runtime": 73124.6317, "train_tokens_per_second": 12172.553 }, { "epoch": 1.8805548074333425, "grad_norm": 0.8724636394628685, "learning_rate": 8.784777240151365e-08, "loss": 0.311005163192749, "num_input_tokens_seen": 890272752, "step": 27930, "train_runtime": 73137.8408, "train_tokens_per_second": 12172.533 }, { "epoch": 1.8808914624293025, "grad_norm": 0.7803253748907685, "learning_rate": 8.73549965942655e-08, "loss": 0.2907422542572021, "num_input_tokens_seen": 890433480, "step": 27935, "train_runtime": 73150.5806, "train_tokens_per_second": 12172.61 }, { "epoch": 1.8812281174252625, "grad_norm": 0.6945714830876641, "learning_rate": 8.686359459252725e-08, "loss": 0.28446648120880125, "num_input_tokens_seen": 890589720, "step": 27940, "train_runtime": 73163.3329, "train_tokens_per_second": 12172.624 }, { "epoch": 1.8815647724212228, "grad_norm": 0.7098115133308185, "learning_rate": 8.637356653371787e-08, "loss": 0.2761401176452637, "num_input_tokens_seen": 890750944, "step": 27945, "train_runtime": 73176.6691, "train_tokens_per_second": 12172.608 }, { "epoch": 1.881901427417183, "grad_norm": 0.8796978111265379, "learning_rate": 8.588491255487163e-08, "loss": 0.26764066219329835, "num_input_tokens_seen": 890911096, "step": 27950, "train_runtime": 73190.6225, "train_tokens_per_second": 12172.476 }, { "epoch": 1.882238082413143, "grad_norm": 0.8406207447190257, "learning_rate": 8.539763279264035e-08, "loss": 0.27055528163909914, "num_input_tokens_seen": 891071288, "step": 27955, "train_runtime": 73203.1611, "train_tokens_per_second": 12172.579 }, { "epoch": 1.882574737409103, "grad_norm": 0.7910239075909938, "learning_rate": 8.49117273832889e-08, "loss": 0.3221412658691406, "num_input_tokens_seen": 891229752, "step": 27960, "train_runtime": 73216.1942, "train_tokens_per_second": 12172.577 }, { "epoch": 1.8829113924050633, "grad_norm": 0.7409938632377756, "learning_rate": 8.442719646270082e-08, "loss": 0.2672263622283936, "num_input_tokens_seen": 891389520, "step": 27965, "train_runtime": 73228.8565, "train_tokens_per_second": 12172.654 }, { "epoch": 1.8832480474010236, "grad_norm": 0.8110239820585948, "learning_rate": 8.394404016637159e-08, "loss": 0.2805251836776733, "num_input_tokens_seen": 891552336, "step": 27970, "train_runtime": 73242.3189, "train_tokens_per_second": 12172.639 }, { "epoch": 1.8835847023969836, "grad_norm": 0.8218219254639022, "learning_rate": 8.346225862941592e-08, "loss": 0.2921317100524902, "num_input_tokens_seen": 891707480, "step": 27975, "train_runtime": 73255.6706, "train_tokens_per_second": 12172.539 }, { "epoch": 1.8839213573929436, "grad_norm": 0.807117688588943, "learning_rate": 8.298185198656161e-08, "loss": 0.2985464334487915, "num_input_tokens_seen": 891868888, "step": 27980, "train_runtime": 73268.6137, "train_tokens_per_second": 12172.591 }, { "epoch": 1.884258012388904, "grad_norm": 0.8038610046617606, "learning_rate": 8.25028203721534e-08, "loss": 0.2723139762878418, "num_input_tokens_seen": 892029672, "step": 27985, "train_runtime": 73282.313, "train_tokens_per_second": 12172.51 }, { "epoch": 1.8845946673848641, "grad_norm": 0.7800281251705247, "learning_rate": 8.202516392015081e-08, "loss": 0.297794508934021, "num_input_tokens_seen": 892188656, "step": 27990, "train_runtime": 73295.481, "train_tokens_per_second": 12172.492 }, { "epoch": 1.8849313223808242, "grad_norm": 0.8718531534244764, "learning_rate": 8.154888276412865e-08, "loss": 0.2957782745361328, "num_input_tokens_seen": 892344528, "step": 27995, "train_runtime": 73308.8223, "train_tokens_per_second": 12172.403 }, { "epoch": 1.8852679773767842, "grad_norm": 0.7533056061439469, "learning_rate": 8.10739770372776e-08, "loss": 0.26080372333526614, "num_input_tokens_seen": 892506264, "step": 28000, "train_runtime": 73321.8968, "train_tokens_per_second": 12172.438 }, { "epoch": 1.8856046323727444, "grad_norm": 0.740664967469983, "learning_rate": 8.060044687240365e-08, "loss": 0.26940925121307374, "num_input_tokens_seen": 892670104, "step": 28005, "train_runtime": 73334.3161, "train_tokens_per_second": 12172.611 }, { "epoch": 1.8859412873687047, "grad_norm": 0.7150405646488428, "learning_rate": 8.012829240192754e-08, "loss": 0.2987844705581665, "num_input_tokens_seen": 892830728, "step": 28010, "train_runtime": 73347.0152, "train_tokens_per_second": 12172.693 }, { "epoch": 1.8862779423646647, "grad_norm": 0.7692045128709198, "learning_rate": 7.9657513757887e-08, "loss": 0.2818997859954834, "num_input_tokens_seen": 892994200, "step": 28015, "train_runtime": 73360.7068, "train_tokens_per_second": 12172.65 }, { "epoch": 1.8866145973606248, "grad_norm": 0.8062565564343142, "learning_rate": 7.918811107193225e-08, "loss": 0.26958208084106444, "num_input_tokens_seen": 893155776, "step": 28020, "train_runtime": 73373.2189, "train_tokens_per_second": 12172.776 }, { "epoch": 1.886951252356585, "grad_norm": 0.8814467491240532, "learning_rate": 7.872008447533109e-08, "loss": 0.3207878589630127, "num_input_tokens_seen": 893317648, "step": 28025, "train_runtime": 73386.9338, "train_tokens_per_second": 12172.707 }, { "epoch": 1.8872879073525453, "grad_norm": 0.7699173404723976, "learning_rate": 7.825343409896547e-08, "loss": 0.30684852600097656, "num_input_tokens_seen": 893476088, "step": 28030, "train_runtime": 73399.9028, "train_tokens_per_second": 12172.715 }, { "epoch": 1.8876245623485053, "grad_norm": 0.8246030398917025, "learning_rate": 7.778816007333268e-08, "loss": 0.29779620170593263, "num_input_tokens_seen": 893634728, "step": 28035, "train_runtime": 73412.5214, "train_tokens_per_second": 12172.783 }, { "epoch": 1.8879612173444653, "grad_norm": 0.8387324903243494, "learning_rate": 7.73242625285453e-08, "loss": 0.27918837070465086, "num_input_tokens_seen": 893791024, "step": 28040, "train_runtime": 73425.0311, "train_tokens_per_second": 12172.838 }, { "epoch": 1.8882978723404256, "grad_norm": 0.758701521605094, "learning_rate": 7.686174159433069e-08, "loss": 0.3044358491897583, "num_input_tokens_seen": 893953768, "step": 28045, "train_runtime": 73437.765, "train_tokens_per_second": 12172.944 }, { "epoch": 1.8886345273363858, "grad_norm": 0.7765670601924785, "learning_rate": 7.640059740003091e-08, "loss": 0.27041242122650144, "num_input_tokens_seen": 894114256, "step": 28050, "train_runtime": 73450.6094, "train_tokens_per_second": 12173.0 }, { "epoch": 1.8889711823323458, "grad_norm": 0.8746524368276339, "learning_rate": 7.594083007460396e-08, "loss": 0.29973607063293456, "num_input_tokens_seen": 894270216, "step": 28055, "train_runtime": 73464.1717, "train_tokens_per_second": 12172.876 }, { "epoch": 1.8893078373283059, "grad_norm": 0.7495572374933687, "learning_rate": 7.54824397466225e-08, "loss": 0.29380431175231936, "num_input_tokens_seen": 894428280, "step": 28060, "train_runtime": 73476.59, "train_tokens_per_second": 12172.969 }, { "epoch": 1.8896444923242661, "grad_norm": 0.7638209256706875, "learning_rate": 7.502542654427347e-08, "loss": 0.28548665046691896, "num_input_tokens_seen": 894585872, "step": 28065, "train_runtime": 73489.9202, "train_tokens_per_second": 12172.906 }, { "epoch": 1.8899811473202264, "grad_norm": 0.7879950306900086, "learning_rate": 7.456979059535907e-08, "loss": 0.2989804267883301, "num_input_tokens_seen": 894745216, "step": 28070, "train_runtime": 73502.5665, "train_tokens_per_second": 12172.979 }, { "epoch": 1.8903178023161864, "grad_norm": 0.8717905943149454, "learning_rate": 7.411553202729682e-08, "loss": 0.3004459381103516, "num_input_tokens_seen": 894893832, "step": 28075, "train_runtime": 73515.4863, "train_tokens_per_second": 12172.861 }, { "epoch": 1.8906544573121464, "grad_norm": 0.7526816965311344, "learning_rate": 7.3662650967119e-08, "loss": 0.2719897747039795, "num_input_tokens_seen": 895050712, "step": 28080, "train_runtime": 73528.1004, "train_tokens_per_second": 12172.907 }, { "epoch": 1.8909911123081067, "grad_norm": 0.7775656149909072, "learning_rate": 7.321114754147151e-08, "loss": 0.28068835735321046, "num_input_tokens_seen": 895210192, "step": 28085, "train_runtime": 73540.8782, "train_tokens_per_second": 12172.96 }, { "epoch": 1.891327767304067, "grad_norm": 0.9814244959295657, "learning_rate": 7.276102187661615e-08, "loss": 0.3038950443267822, "num_input_tokens_seen": 895369464, "step": 28090, "train_runtime": 73554.0422, "train_tokens_per_second": 12172.947 }, { "epoch": 1.891664422300027, "grad_norm": 0.8089655889903498, "learning_rate": 7.231227409842944e-08, "loss": 0.304179048538208, "num_input_tokens_seen": 895532520, "step": 28095, "train_runtime": 73567.0785, "train_tokens_per_second": 12173.006 }, { "epoch": 1.892001077295987, "grad_norm": 0.8613976202198683, "learning_rate": 7.186490433240156e-08, "loss": 0.2983412504196167, "num_input_tokens_seen": 895687472, "step": 28100, "train_runtime": 73581.0405, "train_tokens_per_second": 12172.802 }, { "epoch": 1.8923377322919472, "grad_norm": 0.9332227754416748, "learning_rate": 7.14189127036391e-08, "loss": 0.2879823684692383, "num_input_tokens_seen": 895848280, "step": 28105, "train_runtime": 73594.2237, "train_tokens_per_second": 12172.807 }, { "epoch": 1.8926743872879075, "grad_norm": 0.7709022203139972, "learning_rate": 7.097429933686118e-08, "loss": 0.29674487113952636, "num_input_tokens_seen": 896006864, "step": 28110, "train_runtime": 73607.3793, "train_tokens_per_second": 12172.786 }, { "epoch": 1.8930110422838675, "grad_norm": 0.9516869616323473, "learning_rate": 7.053106435640333e-08, "loss": 0.3096130847930908, "num_input_tokens_seen": 896170704, "step": 28115, "train_runtime": 73619.8121, "train_tokens_per_second": 12172.956 }, { "epoch": 1.8933476972798275, "grad_norm": 0.7877756701839224, "learning_rate": 7.008920788621366e-08, "loss": 0.2950739860534668, "num_input_tokens_seen": 896329424, "step": 28120, "train_runtime": 73632.7883, "train_tokens_per_second": 12172.966 }, { "epoch": 1.8936843522757878, "grad_norm": 0.732935372895786, "learning_rate": 6.964873004985717e-08, "loss": 0.2967804431915283, "num_input_tokens_seen": 896486808, "step": 28125, "train_runtime": 73645.2384, "train_tokens_per_second": 12173.045 }, { "epoch": 1.894021007271748, "grad_norm": 0.8291071660652243, "learning_rate": 6.920963097051148e-08, "loss": 0.3088953971862793, "num_input_tokens_seen": 896649008, "step": 28130, "train_runtime": 73658.2597, "train_tokens_per_second": 12173.095 }, { "epoch": 1.894357662267708, "grad_norm": 0.8194329257380047, "learning_rate": 6.877191077096945e-08, "loss": 0.27375426292419436, "num_input_tokens_seen": 896803584, "step": 28135, "train_runtime": 73671.8938, "train_tokens_per_second": 12172.941 }, { "epoch": 1.894694317263668, "grad_norm": 0.782473271247263, "learning_rate": 6.833556957363818e-08, "loss": 0.3107022285461426, "num_input_tokens_seen": 896964472, "step": 28140, "train_runtime": 73685.1733, "train_tokens_per_second": 12172.93 }, { "epoch": 1.8950309722596284, "grad_norm": 0.8493701549064354, "learning_rate": 6.790060750053895e-08, "loss": 0.2936178922653198, "num_input_tokens_seen": 897120408, "step": 28145, "train_runtime": 73698.2501, "train_tokens_per_second": 12172.886 }, { "epoch": 1.8953676272555886, "grad_norm": 0.7692199282769623, "learning_rate": 6.746702467330723e-08, "loss": 0.26618127822875975, "num_input_tokens_seen": 897283744, "step": 28150, "train_runtime": 73711.2212, "train_tokens_per_second": 12172.96 }, { "epoch": 1.8957042822515486, "grad_norm": 0.7627440936656119, "learning_rate": 6.703482121319383e-08, "loss": 0.30237407684326173, "num_input_tokens_seen": 897445968, "step": 28155, "train_runtime": 73723.8346, "train_tokens_per_second": 12173.078 }, { "epoch": 1.8960409372475087, "grad_norm": 0.8359778328267923, "learning_rate": 6.660399724106204e-08, "loss": 0.3182742357254028, "num_input_tokens_seen": 897608400, "step": 28160, "train_runtime": 73736.4154, "train_tokens_per_second": 12173.204 }, { "epoch": 1.896377592243469, "grad_norm": 0.79818066085529, "learning_rate": 6.617455287739161e-08, "loss": 0.2847122669219971, "num_input_tokens_seen": 897765384, "step": 28165, "train_runtime": 73748.9111, "train_tokens_per_second": 12173.27 }, { "epoch": 1.8967142472394292, "grad_norm": 0.8447766546393227, "learning_rate": 6.574648824227369e-08, "loss": 0.2903900623321533, "num_input_tokens_seen": 897927832, "step": 28170, "train_runtime": 73762.242, "train_tokens_per_second": 12173.272 }, { "epoch": 1.8970509022353892, "grad_norm": 0.7787624516294193, "learning_rate": 6.5319803455417e-08, "loss": 0.3023900032043457, "num_input_tokens_seen": 898088912, "step": 28175, "train_runtime": 73775.2078, "train_tokens_per_second": 12173.316 }, { "epoch": 1.8973875572313492, "grad_norm": 0.8210472837129141, "learning_rate": 6.489449863614106e-08, "loss": 0.3084021806716919, "num_input_tokens_seen": 898247848, "step": 28180, "train_runtime": 73788.3178, "train_tokens_per_second": 12173.307 }, { "epoch": 1.8977242122273095, "grad_norm": 0.8800119946902392, "learning_rate": 6.44705739033824e-08, "loss": 0.2934131622314453, "num_input_tokens_seen": 898405368, "step": 28185, "train_runtime": 73801.3516, "train_tokens_per_second": 12173.292 }, { "epoch": 1.8980608672232697, "grad_norm": 0.9142698337304438, "learning_rate": 6.404802937568899e-08, "loss": 0.28001105785369873, "num_input_tokens_seen": 898559232, "step": 28190, "train_runtime": 73815.2767, "train_tokens_per_second": 12173.08 }, { "epoch": 1.8983975222192297, "grad_norm": 0.6884178027995702, "learning_rate": 6.362686517122463e-08, "loss": 0.28214905261993406, "num_input_tokens_seen": 898719448, "step": 28195, "train_runtime": 73827.997, "train_tokens_per_second": 12173.152 }, { "epoch": 1.8987341772151898, "grad_norm": 0.8385974836461252, "learning_rate": 6.320708140776676e-08, "loss": 0.2831768035888672, "num_input_tokens_seen": 898878736, "step": 28200, "train_runtime": 73840.4229, "train_tokens_per_second": 12173.261 }, { "epoch": 1.89907083221115, "grad_norm": 0.8653610880790381, "learning_rate": 6.278867820270596e-08, "loss": 0.28925042152404784, "num_input_tokens_seen": 899037200, "step": 28205, "train_runtime": 73854.0457, "train_tokens_per_second": 12173.161 }, { "epoch": 1.8994074872071103, "grad_norm": 0.8720381446700393, "learning_rate": 6.237165567304749e-08, "loss": 0.29513332843780515, "num_input_tokens_seen": 899197256, "step": 28210, "train_runtime": 73867.7678, "train_tokens_per_second": 12173.067 }, { "epoch": 1.8997441422030703, "grad_norm": 0.811306765106638, "learning_rate": 6.19560139354114e-08, "loss": 0.2988497257232666, "num_input_tokens_seen": 899360552, "step": 28215, "train_runtime": 73880.699, "train_tokens_per_second": 12173.146 }, { "epoch": 1.9000807971990303, "grad_norm": 0.8292822932985056, "learning_rate": 6.154175310602916e-08, "loss": 0.2988564968109131, "num_input_tokens_seen": 899520848, "step": 28220, "train_runtime": 73894.0811, "train_tokens_per_second": 12173.111 }, { "epoch": 1.9004174521949906, "grad_norm": 0.7541881695678712, "learning_rate": 6.112887330074812e-08, "loss": 0.2867105960845947, "num_input_tokens_seen": 899678784, "step": 28225, "train_runtime": 73906.9987, "train_tokens_per_second": 12173.12 }, { "epoch": 1.9007541071909508, "grad_norm": 0.8267116817071879, "learning_rate": 6.07173746350287e-08, "loss": 0.2870633602142334, "num_input_tokens_seen": 899840408, "step": 28230, "train_runtime": 73919.4907, "train_tokens_per_second": 12173.25 }, { "epoch": 1.9010907621869109, "grad_norm": 0.7676123475423281, "learning_rate": 6.030725722394548e-08, "loss": 0.2987704277038574, "num_input_tokens_seen": 900002520, "step": 28235, "train_runtime": 73931.9193, "train_tokens_per_second": 12173.396 }, { "epoch": 1.901427417182871, "grad_norm": 0.8790291176505672, "learning_rate": 5.98985211821862e-08, "loss": 0.3101794242858887, "num_input_tokens_seen": 900163456, "step": 28240, "train_runtime": 73945.8803, "train_tokens_per_second": 12173.274 }, { "epoch": 1.9017640721788311, "grad_norm": 1.0266858773191807, "learning_rate": 5.9491166624052185e-08, "loss": 0.29117119312286377, "num_input_tokens_seen": 900325512, "step": 28245, "train_runtime": 73958.4713, "train_tokens_per_second": 12173.393 }, { "epoch": 1.9021007271747914, "grad_norm": 0.789397707385831, "learning_rate": 5.908519366345955e-08, "loss": 0.28158814907073976, "num_input_tokens_seen": 900476712, "step": 28250, "train_runtime": 73971.6914, "train_tokens_per_second": 12173.261 }, { "epoch": 1.9024373821707514, "grad_norm": 0.8854177629166503, "learning_rate": 5.868060241393747e-08, "loss": 0.30811004638671874, "num_input_tokens_seen": 900640552, "step": 28255, "train_runtime": 73984.1346, "train_tokens_per_second": 12173.428 }, { "epoch": 1.9027740371667115, "grad_norm": 0.8370602838821326, "learning_rate": 5.8277392988627665e-08, "loss": 0.2847187042236328, "num_input_tokens_seen": 900798904, "step": 28260, "train_runtime": 73997.2946, "train_tokens_per_second": 12173.403 }, { "epoch": 1.9031106921626717, "grad_norm": 0.8048290156710194, "learning_rate": 5.787556550028772e-08, "loss": 0.2712104797363281, "num_input_tokens_seen": 900958520, "step": 28265, "train_runtime": 74010.3652, "train_tokens_per_second": 12173.41 }, { "epoch": 1.903447347158632, "grad_norm": 0.8516742609514703, "learning_rate": 5.747512006128553e-08, "loss": 0.3072443962097168, "num_input_tokens_seen": 901120152, "step": 28270, "train_runtime": 74022.8964, "train_tokens_per_second": 12173.533 }, { "epoch": 1.903784002154592, "grad_norm": 0.9024429883234057, "learning_rate": 5.707605678360595e-08, "loss": 0.3129054069519043, "num_input_tokens_seen": 901281544, "step": 28275, "train_runtime": 74035.9174, "train_tokens_per_second": 12173.572 }, { "epoch": 1.904120657150552, "grad_norm": 0.6987843881081706, "learning_rate": 5.6678375778845276e-08, "loss": 0.28444318771362304, "num_input_tokens_seen": 901443296, "step": 28280, "train_runtime": 74048.6893, "train_tokens_per_second": 12173.656 }, { "epoch": 1.9044573121465123, "grad_norm": 0.8251804291084669, "learning_rate": 5.6282077158213435e-08, "loss": 0.27478823661804197, "num_input_tokens_seen": 901606808, "step": 28285, "train_runtime": 74061.7315, "train_tokens_per_second": 12173.72 }, { "epoch": 1.9047939671424725, "grad_norm": 0.9621689700239028, "learning_rate": 5.588716103253511e-08, "loss": 0.3013157844543457, "num_input_tokens_seen": 901769256, "step": 28290, "train_runtime": 74074.3976, "train_tokens_per_second": 12173.832 }, { "epoch": 1.9051306221384325, "grad_norm": 0.8814819554953357, "learning_rate": 5.549362751224585e-08, "loss": 0.3091575622558594, "num_input_tokens_seen": 901925816, "step": 28295, "train_runtime": 74087.1883, "train_tokens_per_second": 12173.843 }, { "epoch": 1.9054672771343926, "grad_norm": 0.7852178287167259, "learning_rate": 5.5101476707397075e-08, "loss": 0.28136377334594725, "num_input_tokens_seen": 902086760, "step": 28300, "train_runtime": 74100.2633, "train_tokens_per_second": 12173.867 }, { "epoch": 1.9058039321303528, "grad_norm": 0.7610848008438819, "learning_rate": 5.471070872765216e-08, "loss": 0.313372540473938, "num_input_tokens_seen": 902248544, "step": 28305, "train_runtime": 74113.747, "train_tokens_per_second": 12173.835 }, { "epoch": 1.906140587126313, "grad_norm": 0.7916940591882744, "learning_rate": 5.432132368228815e-08, "loss": 0.31326045989990237, "num_input_tokens_seen": 902408672, "step": 28310, "train_runtime": 74126.9171, "train_tokens_per_second": 12173.832 }, { "epoch": 1.906477242122273, "grad_norm": 0.7808280945266476, "learning_rate": 5.393332168019572e-08, "loss": 0.2861791610717773, "num_input_tokens_seen": 902571800, "step": 28315, "train_runtime": 74139.7898, "train_tokens_per_second": 12173.919 }, { "epoch": 1.9068138971182331, "grad_norm": 0.7657708108083962, "learning_rate": 5.354670282987695e-08, "loss": 0.3028862476348877, "num_input_tokens_seen": 902735640, "step": 28320, "train_runtime": 74152.2322, "train_tokens_per_second": 12174.086 }, { "epoch": 1.9071505521141934, "grad_norm": 0.8783267690119936, "learning_rate": 5.316146723945037e-08, "loss": 0.3181807041168213, "num_input_tokens_seen": 902897328, "step": 28325, "train_runtime": 74165.2912, "train_tokens_per_second": 12174.122 }, { "epoch": 1.9074872071101536, "grad_norm": 0.8886319355882627, "learning_rate": 5.277761501664535e-08, "loss": 0.2760090589523315, "num_input_tokens_seen": 903055960, "step": 28330, "train_runtime": 74177.977, "train_tokens_per_second": 12174.179 }, { "epoch": 1.9078238621061137, "grad_norm": 0.9483963942110969, "learning_rate": 5.2395146268804934e-08, "loss": 0.2985908031463623, "num_input_tokens_seen": 903214912, "step": 28335, "train_runtime": 74190.5324, "train_tokens_per_second": 12174.261 }, { "epoch": 1.9081605171020737, "grad_norm": 0.7896943592919579, "learning_rate": 5.201406110288465e-08, "loss": 0.2892578125, "num_input_tokens_seen": 903374880, "step": 28340, "train_runtime": 74203.5185, "train_tokens_per_second": 12174.286 }, { "epoch": 1.908497172098034, "grad_norm": 0.7524465473696693, "learning_rate": 5.1634359625454266e-08, "loss": 0.2472975492477417, "num_input_tokens_seen": 903536848, "step": 28345, "train_runtime": 74218.0812, "train_tokens_per_second": 12174.08 }, { "epoch": 1.9088338270939942, "grad_norm": 0.8367092223366324, "learning_rate": 5.125604194269606e-08, "loss": 0.3181473255157471, "num_input_tokens_seen": 903694536, "step": 28350, "train_runtime": 74230.9586, "train_tokens_per_second": 12174.092 }, { "epoch": 1.9091704820899542, "grad_norm": 0.9119462557163616, "learning_rate": 5.087910816040542e-08, "loss": 0.3207047462463379, "num_input_tokens_seen": 903857728, "step": 28355, "train_runtime": 74243.8462, "train_tokens_per_second": 12174.177 }, { "epoch": 1.9095071370859142, "grad_norm": 0.8024103287884415, "learning_rate": 5.0503558383990235e-08, "loss": 0.28914742469787597, "num_input_tokens_seen": 904018224, "step": 28360, "train_runtime": 74256.2757, "train_tokens_per_second": 12174.301 }, { "epoch": 1.9098437920818745, "grad_norm": 0.8307908882881928, "learning_rate": 5.0129392718472614e-08, "loss": 0.29242515563964844, "num_input_tokens_seen": 904177264, "step": 28365, "train_runtime": 74269.4947, "train_tokens_per_second": 12174.275 }, { "epoch": 1.9101804470778347, "grad_norm": 0.7647599369130752, "learning_rate": 4.9756611268486077e-08, "loss": 0.30567944049835205, "num_input_tokens_seen": 904339656, "step": 28370, "train_runtime": 74282.8007, "train_tokens_per_second": 12174.281 }, { "epoch": 1.9105171020737948, "grad_norm": 0.8993852462747537, "learning_rate": 4.9385214138277795e-08, "loss": 0.3096409797668457, "num_input_tokens_seen": 904502184, "step": 28375, "train_runtime": 74295.2507, "train_tokens_per_second": 12174.428 }, { "epoch": 1.9108537570697548, "grad_norm": 0.8256392491941635, "learning_rate": 4.901520143170857e-08, "loss": 0.30844037532806395, "num_input_tokens_seen": 904663888, "step": 28380, "train_runtime": 74308.2605, "train_tokens_per_second": 12174.473 }, { "epoch": 1.911190412065715, "grad_norm": 0.805201873224448, "learning_rate": 4.864657325225064e-08, "loss": 0.29010715484619143, "num_input_tokens_seen": 904827728, "step": 28385, "train_runtime": 74320.696, "train_tokens_per_second": 12174.64 }, { "epoch": 1.9115270670616753, "grad_norm": 0.9204060107064614, "learning_rate": 4.827932970298932e-08, "loss": 0.2752652168273926, "num_input_tokens_seen": 904984472, "step": 28390, "train_runtime": 74333.6273, "train_tokens_per_second": 12174.631 }, { "epoch": 1.9118637220576353, "grad_norm": 0.7887619433528998, "learning_rate": 4.7913470886624125e-08, "loss": 0.29566154479980467, "num_input_tokens_seen": 905143216, "step": 28395, "train_runtime": 74346.6274, "train_tokens_per_second": 12174.637 }, { "epoch": 1.9122003770535954, "grad_norm": 0.8722006140212124, "learning_rate": 4.754899690546544e-08, "loss": 0.2814087152481079, "num_input_tokens_seen": 905303424, "step": 28400, "train_runtime": 74359.7355, "train_tokens_per_second": 12174.646 }, { "epoch": 1.9125370320495556, "grad_norm": 0.8663852395026291, "learning_rate": 4.718590786143729e-08, "loss": 0.29212179183959963, "num_input_tokens_seen": 905463264, "step": 28405, "train_runtime": 74372.8358, "train_tokens_per_second": 12174.65 }, { "epoch": 1.9128736870455159, "grad_norm": 0.824399639283976, "learning_rate": 4.6824203856076776e-08, "loss": 0.2857960224151611, "num_input_tokens_seen": 905627104, "step": 28410, "train_runtime": 74385.2661, "train_tokens_per_second": 12174.818 }, { "epoch": 1.9132103420414759, "grad_norm": 0.7620293495013702, "learning_rate": 4.646388499053356e-08, "loss": 0.2752853870391846, "num_input_tokens_seen": 905786488, "step": 28415, "train_runtime": 74398.3072, "train_tokens_per_second": 12174.827 }, { "epoch": 1.913546997037436, "grad_norm": 0.8514217195501339, "learning_rate": 4.6104951365568696e-08, "loss": 0.28073368072509763, "num_input_tokens_seen": 905947448, "step": 28420, "train_runtime": 74411.4115, "train_tokens_per_second": 12174.846 }, { "epoch": 1.9138836520333962, "grad_norm": 0.8541526604217446, "learning_rate": 4.574740308155801e-08, "loss": 0.2872061252593994, "num_input_tokens_seen": 906106080, "step": 28425, "train_runtime": 74425.2764, "train_tokens_per_second": 12174.709 }, { "epoch": 1.9142203070293564, "grad_norm": 0.8723180176558147, "learning_rate": 4.539124023848762e-08, "loss": 0.29244508743286135, "num_input_tokens_seen": 906269080, "step": 28430, "train_runtime": 74438.1052, "train_tokens_per_second": 12174.8 }, { "epoch": 1.9145569620253164, "grad_norm": 0.8356327897044589, "learning_rate": 4.503646293595787e-08, "loss": 0.32239794731140137, "num_input_tokens_seen": 906425528, "step": 28435, "train_runtime": 74451.3665, "train_tokens_per_second": 12174.733 }, { "epoch": 1.9148936170212765, "grad_norm": 0.8731899153844053, "learning_rate": 4.468307127318105e-08, "loss": 0.29468064308166503, "num_input_tokens_seen": 906586472, "step": 28440, "train_runtime": 74463.8279, "train_tokens_per_second": 12174.857 }, { "epoch": 1.9152302720172367, "grad_norm": 0.942609216376018, "learning_rate": 4.4331065348982014e-08, "loss": 0.2866788864135742, "num_input_tokens_seen": 906746096, "step": 28445, "train_runtime": 74476.7126, "train_tokens_per_second": 12174.894 }, { "epoch": 1.915566927013197, "grad_norm": 0.8400296372211845, "learning_rate": 4.3980445261798125e-08, "loss": 0.29766771793365476, "num_input_tokens_seen": 906907192, "step": 28450, "train_runtime": 74490.2117, "train_tokens_per_second": 12174.851 }, { "epoch": 1.915903582009157, "grad_norm": 0.8320138520570873, "learning_rate": 4.363121110967927e-08, "loss": 0.270781946182251, "num_input_tokens_seen": 907063096, "step": 28455, "train_runtime": 74503.629, "train_tokens_per_second": 12174.751 }, { "epoch": 1.916240237005117, "grad_norm": 0.7568959791799943, "learning_rate": 4.328336299028735e-08, "loss": 0.27180256843566897, "num_input_tokens_seen": 907220912, "step": 28460, "train_runtime": 74517.1927, "train_tokens_per_second": 12174.652 }, { "epoch": 1.9165768920010773, "grad_norm": 0.8190191887227736, "learning_rate": 4.293690100089731e-08, "loss": 0.2916971921920776, "num_input_tokens_seen": 907379240, "step": 28465, "train_runtime": 74530.5673, "train_tokens_per_second": 12174.592 }, { "epoch": 1.9169135469970375, "grad_norm": 0.8893354425757927, "learning_rate": 4.259182523839556e-08, "loss": 0.2838243246078491, "num_input_tokens_seen": 907537048, "step": 28470, "train_runtime": 74543.2797, "train_tokens_per_second": 12174.633 }, { "epoch": 1.9172502019929976, "grad_norm": 0.8882472197317557, "learning_rate": 4.224813579928211e-08, "loss": 0.31717352867126464, "num_input_tokens_seen": 907697680, "step": 28475, "train_runtime": 74556.1353, "train_tokens_per_second": 12174.688 }, { "epoch": 1.9175868569889576, "grad_norm": 0.7955271893747686, "learning_rate": 4.190583277966842e-08, "loss": 0.300145697593689, "num_input_tokens_seen": 907859480, "step": 28480, "train_runtime": 74570.0307, "train_tokens_per_second": 12174.589 }, { "epoch": 1.9179235119849178, "grad_norm": 0.7797486900403856, "learning_rate": 4.1564916275278477e-08, "loss": 0.2774558782577515, "num_input_tokens_seen": 908015248, "step": 28485, "train_runtime": 74583.1816, "train_tokens_per_second": 12174.531 }, { "epoch": 1.918260166980878, "grad_norm": 0.8104200457045871, "learning_rate": 4.122538638144824e-08, "loss": 0.2908132553100586, "num_input_tokens_seen": 908176856, "step": 28490, "train_runtime": 74596.7921, "train_tokens_per_second": 12174.476 }, { "epoch": 1.9185968219768381, "grad_norm": 0.7546098434315309, "learning_rate": 4.08872431931262e-08, "loss": 0.2742162227630615, "num_input_tokens_seen": 908337488, "step": 28495, "train_runtime": 74610.2244, "train_tokens_per_second": 12174.437 }, { "epoch": 1.9189334769727981, "grad_norm": 0.8060257843943104, "learning_rate": 4.055048680487339e-08, "loss": 0.2883006572723389, "num_input_tokens_seen": 908498280, "step": 28500, "train_runtime": 74623.3296, "train_tokens_per_second": 12174.454 }, { "epoch": 1.9192701319687584, "grad_norm": 0.8154788993660225, "learning_rate": 4.0215117310862806e-08, "loss": 0.31098692417144774, "num_input_tokens_seen": 908647968, "step": 28505, "train_runtime": 74635.8841, "train_tokens_per_second": 12174.412 }, { "epoch": 1.9196067869647186, "grad_norm": 0.8901780919215156, "learning_rate": 3.9881134804878316e-08, "loss": 0.3031690359115601, "num_input_tokens_seen": 908802192, "step": 28510, "train_runtime": 74648.6039, "train_tokens_per_second": 12174.403 }, { "epoch": 1.9199434419606787, "grad_norm": 0.8754799599616853, "learning_rate": 3.9548539380318e-08, "loss": 0.3124077320098877, "num_input_tokens_seen": 908961976, "step": 28515, "train_runtime": 74661.0579, "train_tokens_per_second": 12174.512 }, { "epoch": 1.9202800969566387, "grad_norm": 0.8154962644748002, "learning_rate": 3.921733113019077e-08, "loss": 0.2959012985229492, "num_input_tokens_seen": 909115728, "step": 28520, "train_runtime": 74674.4707, "train_tokens_per_second": 12174.385 }, { "epoch": 1.920616751952599, "grad_norm": 0.7963800256502893, "learning_rate": 3.888751014711867e-08, "loss": 0.3138494253158569, "num_input_tokens_seen": 909268344, "step": 28525, "train_runtime": 74687.8668, "train_tokens_per_second": 12174.244 }, { "epoch": 1.9209534069485592, "grad_norm": 1.0836750738140328, "learning_rate": 3.855907652333402e-08, "loss": 0.3021607160568237, "num_input_tokens_seen": 909430832, "step": 28530, "train_runtime": 74700.5402, "train_tokens_per_second": 12174.354 }, { "epoch": 1.9212900619445192, "grad_norm": 0.8343585400415516, "learning_rate": 3.8232030350683344e-08, "loss": 0.2855525016784668, "num_input_tokens_seen": 909594672, "step": 28535, "train_runtime": 74713.5717, "train_tokens_per_second": 12174.424 }, { "epoch": 1.9216267169404793, "grad_norm": 0.897868415984019, "learning_rate": 3.7906371720622946e-08, "loss": 0.3006442070007324, "num_input_tokens_seen": 909755856, "step": 28540, "train_runtime": 74726.0465, "train_tokens_per_second": 12174.548 }, { "epoch": 1.9219633719364395, "grad_norm": 0.77685765574357, "learning_rate": 3.758210072422275e-08, "loss": 0.27744030952453613, "num_input_tokens_seen": 909913496, "step": 28545, "train_runtime": 74738.5227, "train_tokens_per_second": 12174.625 }, { "epoch": 1.9223000269323998, "grad_norm": 0.9330747557127657, "learning_rate": 3.72592174521641e-08, "loss": 0.32152185440063474, "num_input_tokens_seen": 910076432, "step": 28550, "train_runtime": 74751.2797, "train_tokens_per_second": 12174.727 }, { "epoch": 1.9226366819283598, "grad_norm": 0.7538603417361607, "learning_rate": 3.693772199474033e-08, "loss": 0.2951069355010986, "num_input_tokens_seen": 910237384, "step": 28555, "train_runtime": 74764.4317, "train_tokens_per_second": 12174.738 }, { "epoch": 1.9229733369243198, "grad_norm": 0.8115385877941742, "learning_rate": 3.661761444185674e-08, "loss": 0.29569182395935056, "num_input_tokens_seen": 910396240, "step": 28560, "train_runtime": 74777.2775, "train_tokens_per_second": 12174.771 }, { "epoch": 1.92330999192028, "grad_norm": 0.8793323894633963, "learning_rate": 3.6298894883030066e-08, "loss": 0.2983766317367554, "num_input_tokens_seen": 910556992, "step": 28565, "train_runtime": 74790.1602, "train_tokens_per_second": 12174.823 }, { "epoch": 1.9236466469162403, "grad_norm": 0.8652189388099313, "learning_rate": 3.5981563407389007e-08, "loss": 0.3157456159591675, "num_input_tokens_seen": 910716352, "step": 28570, "train_runtime": 74803.3056, "train_tokens_per_second": 12174.814 }, { "epoch": 1.9239833019122003, "grad_norm": 0.8477611396008407, "learning_rate": 3.566562010367536e-08, "loss": 0.2746917724609375, "num_input_tokens_seen": 910871640, "step": 28575, "train_runtime": 74816.2575, "train_tokens_per_second": 12174.782 }, { "epoch": 1.9243199569081604, "grad_norm": 0.7501412966120312, "learning_rate": 3.535106506024011e-08, "loss": 0.2954802274703979, "num_input_tokens_seen": 911033064, "step": 28580, "train_runtime": 74829.3391, "train_tokens_per_second": 12174.811 }, { "epoch": 1.9246566119041206, "grad_norm": 0.8401732696889453, "learning_rate": 3.5037898365049005e-08, "loss": 0.2661609411239624, "num_input_tokens_seen": 911193480, "step": 28585, "train_runtime": 74842.513, "train_tokens_per_second": 12174.811 }, { "epoch": 1.9249932669000809, "grad_norm": 0.8349397355536027, "learning_rate": 3.472612010567755e-08, "loss": 0.28289783000946045, "num_input_tokens_seen": 911346480, "step": 28590, "train_runtime": 74855.9391, "train_tokens_per_second": 12174.672 }, { "epoch": 1.925329921896041, "grad_norm": 0.824188973587861, "learning_rate": 3.441573036931323e-08, "loss": 0.311726975440979, "num_input_tokens_seen": 911509520, "step": 28595, "train_runtime": 74868.9895, "train_tokens_per_second": 12174.727 }, { "epoch": 1.925666576892001, "grad_norm": 0.8295410620750222, "learning_rate": 3.410672924275604e-08, "loss": 0.2714081287384033, "num_input_tokens_seen": 911672512, "step": 28600, "train_runtime": 74881.7961, "train_tokens_per_second": 12174.822 }, { "epoch": 1.9260032318879612, "grad_norm": 0.8383477799389843, "learning_rate": 3.3799116812416876e-08, "loss": 0.31270813941955566, "num_input_tokens_seen": 911832952, "step": 28605, "train_runtime": 74894.8388, "train_tokens_per_second": 12174.844 }, { "epoch": 1.9263398868839214, "grad_norm": 0.8982068931458073, "learning_rate": 3.349289316431803e-08, "loss": 0.3105414152145386, "num_input_tokens_seen": 911994056, "step": 28610, "train_runtime": 74907.7439, "train_tokens_per_second": 12174.897 }, { "epoch": 1.9266765418798815, "grad_norm": 0.7884981532710531, "learning_rate": 3.3188058384095446e-08, "loss": 0.2929044723510742, "num_input_tokens_seen": 912149824, "step": 28615, "train_runtime": 74920.5381, "train_tokens_per_second": 12174.897 }, { "epoch": 1.9270131968758415, "grad_norm": 0.8526771036725423, "learning_rate": 3.2884612556993714e-08, "loss": 0.3126600980758667, "num_input_tokens_seen": 912310496, "step": 28620, "train_runtime": 74932.9584, "train_tokens_per_second": 12175.023 }, { "epoch": 1.9273498518718017, "grad_norm": 0.8921230463010991, "learning_rate": 3.258255576787161e-08, "loss": 0.3061052322387695, "num_input_tokens_seen": 912468968, "step": 28625, "train_runtime": 74945.7275, "train_tokens_per_second": 12175.063 }, { "epoch": 1.927686506867762, "grad_norm": 0.93218844870514, "learning_rate": 3.22818881011977e-08, "loss": 0.31447610855102537, "num_input_tokens_seen": 912632688, "step": 28630, "train_runtime": 74959.7849, "train_tokens_per_second": 12174.964 }, { "epoch": 1.928023161863722, "grad_norm": 0.9752478569951576, "learning_rate": 3.198260964105249e-08, "loss": 0.27275815010070803, "num_input_tokens_seen": 912788024, "step": 28635, "train_runtime": 74972.4016, "train_tokens_per_second": 12174.987 }, { "epoch": 1.928359816859682, "grad_norm": 0.80392987898737, "learning_rate": 3.168472047112903e-08, "loss": 0.2988280773162842, "num_input_tokens_seen": 912945632, "step": 28640, "train_runtime": 74984.9197, "train_tokens_per_second": 12175.056 }, { "epoch": 1.9286964718556423, "grad_norm": 0.8516783107242409, "learning_rate": 3.138822067473068e-08, "loss": 0.282541823387146, "num_input_tokens_seen": 913104528, "step": 28645, "train_runtime": 74997.9625, "train_tokens_per_second": 12175.058 }, { "epoch": 1.9290331268516026, "grad_norm": 0.7826579926986188, "learning_rate": 3.10931103347728e-08, "loss": 0.30090980529785155, "num_input_tokens_seen": 913266256, "step": 28650, "train_runtime": 75010.4306, "train_tokens_per_second": 12175.19 }, { "epoch": 1.9293697818475626, "grad_norm": 0.8238918570773871, "learning_rate": 3.0799389533781587e-08, "loss": 0.3158176183700562, "num_input_tokens_seen": 913425064, "step": 28655, "train_runtime": 75022.9116, "train_tokens_per_second": 12175.281 }, { "epoch": 1.9297064368435226, "grad_norm": 0.8405112609956897, "learning_rate": 3.050705835389578e-08, "loss": 0.2814477443695068, "num_input_tokens_seen": 913583312, "step": 28660, "train_runtime": 75035.7511, "train_tokens_per_second": 12175.307 }, { "epoch": 1.9300430918394829, "grad_norm": 0.8347298052448817, "learning_rate": 3.021611687686443e-08, "loss": 0.28585822582244874, "num_input_tokens_seen": 913736344, "step": 28665, "train_runtime": 75048.7454, "train_tokens_per_second": 12175.238 }, { "epoch": 1.9303797468354431, "grad_norm": 0.8201032089668052, "learning_rate": 2.992656518404857e-08, "loss": 0.3008700370788574, "num_input_tokens_seen": 913893944, "step": 28670, "train_runtime": 75062.351, "train_tokens_per_second": 12175.131 }, { "epoch": 1.9307164018314031, "grad_norm": 0.7370696629095344, "learning_rate": 2.96384033564201e-08, "loss": 0.28259131908416746, "num_input_tokens_seen": 914053704, "step": 28675, "train_runtime": 75076.2412, "train_tokens_per_second": 12175.006 }, { "epoch": 1.9310530568273632, "grad_norm": 0.8593889260996549, "learning_rate": 2.935163147456288e-08, "loss": 0.25777606964111327, "num_input_tokens_seen": 914213928, "step": 28680, "train_runtime": 75089.4992, "train_tokens_per_second": 12174.99 }, { "epoch": 1.9313897118233234, "grad_norm": 0.8198702800037067, "learning_rate": 2.906624961867166e-08, "loss": 0.2948530912399292, "num_input_tokens_seen": 914373584, "step": 28685, "train_runtime": 75102.7862, "train_tokens_per_second": 12174.962 }, { "epoch": 1.9317263668192837, "grad_norm": 0.8289033133930079, "learning_rate": 2.8782257868553154e-08, "loss": 0.264910364151001, "num_input_tokens_seen": 914531520, "step": 28690, "train_runtime": 75115.9747, "train_tokens_per_second": 12174.927 }, { "epoch": 1.9320630218152437, "grad_norm": 0.8320342971157785, "learning_rate": 2.849965630362328e-08, "loss": 0.3063076019287109, "num_input_tokens_seen": 914683632, "step": 28695, "train_runtime": 75128.8173, "train_tokens_per_second": 12174.871 }, { "epoch": 1.9323996768112037, "grad_norm": 0.8522074930577093, "learning_rate": 2.8218445002912153e-08, "loss": 0.29024419784545896, "num_input_tokens_seen": 914846616, "step": 28700, "train_runtime": 75141.6334, "train_tokens_per_second": 12174.963 }, { "epoch": 1.932736331807164, "grad_norm": 0.8623257175216014, "learning_rate": 2.7938624045059094e-08, "loss": 0.27026126384735105, "num_input_tokens_seen": 915005264, "step": 28705, "train_runtime": 75155.0092, "train_tokens_per_second": 12174.907 }, { "epoch": 1.9330729868031242, "grad_norm": 0.9294517921718258, "learning_rate": 2.766019350831428e-08, "loss": 0.29651756286621095, "num_input_tokens_seen": 915169104, "step": 28710, "train_runtime": 75167.4435, "train_tokens_per_second": 12175.073 }, { "epoch": 1.9334096417990843, "grad_norm": 0.841329360502712, "learning_rate": 2.7383153470541546e-08, "loss": 0.28957486152648926, "num_input_tokens_seen": 915329968, "step": 28715, "train_runtime": 75179.8978, "train_tokens_per_second": 12175.196 }, { "epoch": 1.9337462967950443, "grad_norm": 0.7893135610406274, "learning_rate": 2.710750400921336e-08, "loss": 0.2849695682525635, "num_input_tokens_seen": 915482888, "step": 28720, "train_runtime": 75193.5317, "train_tokens_per_second": 12175.022 }, { "epoch": 1.9340829517910045, "grad_norm": 0.8180457029686823, "learning_rate": 2.683324520141417e-08, "loss": 0.2861651420593262, "num_input_tokens_seen": 915643272, "step": 28725, "train_runtime": 75206.5938, "train_tokens_per_second": 12175.04 }, { "epoch": 1.9344196067869648, "grad_norm": 0.827301847670361, "learning_rate": 2.65603771238393e-08, "loss": 0.29910333156585694, "num_input_tokens_seen": 915803704, "step": 28730, "train_runtime": 75220.196, "train_tokens_per_second": 12174.971 }, { "epoch": 1.9347562617829248, "grad_norm": 0.836620763360012, "learning_rate": 2.6288899852796036e-08, "loss": 0.28818683624267577, "num_input_tokens_seen": 915967544, "step": 28735, "train_runtime": 75232.6234, "train_tokens_per_second": 12175.138 }, { "epoch": 1.9350929167788848, "grad_norm": 0.9175817750709617, "learning_rate": 2.6018813464202543e-08, "loss": 0.29910736083984374, "num_input_tokens_seen": 916124504, "step": 28740, "train_runtime": 75246.3502, "train_tokens_per_second": 12175.003 }, { "epoch": 1.935429571774845, "grad_norm": 0.783333397709063, "learning_rate": 2.575011803358618e-08, "loss": 0.29322926998138427, "num_input_tokens_seen": 916284824, "step": 28745, "train_runtime": 75259.7328, "train_tokens_per_second": 12174.968 }, { "epoch": 1.9357662267708053, "grad_norm": 0.701525719352334, "learning_rate": 2.5482813636087955e-08, "loss": 0.27543609142303466, "num_input_tokens_seen": 916439744, "step": 28750, "train_runtime": 75272.6038, "train_tokens_per_second": 12174.944 }, { "epoch": 1.9361028817667654, "grad_norm": 0.8298937022459818, "learning_rate": 2.5216900346458073e-08, "loss": 0.2751685380935669, "num_input_tokens_seen": 916599520, "step": 28755, "train_runtime": 75285.1376, "train_tokens_per_second": 12175.039 }, { "epoch": 1.9364395367627254, "grad_norm": 0.7697529406346881, "learning_rate": 2.4952378239058716e-08, "loss": 0.2747399091720581, "num_input_tokens_seen": 916759552, "step": 28760, "train_runtime": 75298.0327, "train_tokens_per_second": 12175.08 }, { "epoch": 1.9367761917586857, "grad_norm": 0.8079101443439097, "learning_rate": 2.4689247387862934e-08, "loss": 0.28501172065734864, "num_input_tokens_seen": 916917360, "step": 28765, "train_runtime": 75310.9807, "train_tokens_per_second": 12175.082 }, { "epoch": 1.937112846754646, "grad_norm": 0.7851748828534685, "learning_rate": 2.4427507866453537e-08, "loss": 0.2746150493621826, "num_input_tokens_seen": 917072808, "step": 28770, "train_runtime": 75325.7647, "train_tokens_per_second": 12174.756 }, { "epoch": 1.937449501750606, "grad_norm": 0.8896379996416431, "learning_rate": 2.416715974802586e-08, "loss": 0.2909178972244263, "num_input_tokens_seen": 917230184, "step": 28775, "train_runtime": 75338.8546, "train_tokens_per_second": 12174.73 }, { "epoch": 1.937786156746566, "grad_norm": 0.7736748263871922, "learning_rate": 2.3908203105384997e-08, "loss": 0.26843369007110596, "num_input_tokens_seen": 917390192, "step": 28780, "train_runtime": 75352.4592, "train_tokens_per_second": 12174.655 }, { "epoch": 1.9381228117425262, "grad_norm": 0.8213438795286101, "learning_rate": 2.365063801094747e-08, "loss": 0.27482404708862307, "num_input_tokens_seen": 917550872, "step": 28785, "train_runtime": 75365.8562, "train_tokens_per_second": 12174.623 }, { "epoch": 1.9384594667384865, "grad_norm": 0.7332889358688368, "learning_rate": 2.3394464536740658e-08, "loss": 0.2989178657531738, "num_input_tokens_seen": 917714712, "step": 28790, "train_runtime": 75378.2852, "train_tokens_per_second": 12174.789 }, { "epoch": 1.9387961217344465, "grad_norm": 0.9068751842099144, "learning_rate": 2.3139682754402816e-08, "loss": 0.3104221343994141, "num_input_tokens_seen": 917877496, "step": 28795, "train_runtime": 75391.0189, "train_tokens_per_second": 12174.892 }, { "epoch": 1.9391327767304065, "grad_norm": 0.724166890937452, "learning_rate": 2.2886292735182502e-08, "loss": 0.27684361934661866, "num_input_tokens_seen": 918041168, "step": 28800, "train_runtime": 75404.7281, "train_tokens_per_second": 12174.849 }, { "epoch": 1.9394694317263668, "grad_norm": 0.7982531372666478, "learning_rate": 2.2634294549939705e-08, "loss": 0.27920310497283934, "num_input_tokens_seen": 918204136, "step": 28805, "train_runtime": 75417.5531, "train_tokens_per_second": 12174.939 }, { "epoch": 1.939806086722327, "grad_norm": 0.8641827141609502, "learning_rate": 2.2383688269144723e-08, "loss": 0.35346529483795164, "num_input_tokens_seen": 918363104, "step": 28810, "train_runtime": 75430.1608, "train_tokens_per_second": 12175.012 }, { "epoch": 1.940142741718287, "grad_norm": 0.8240191785371843, "learning_rate": 2.2134473962878712e-08, "loss": 0.2800391674041748, "num_input_tokens_seen": 918522744, "step": 28815, "train_runtime": 75442.9041, "train_tokens_per_second": 12175.071 }, { "epoch": 1.940479396714247, "grad_norm": 0.98048516221259, "learning_rate": 2.1886651700833705e-08, "loss": 0.2802724838256836, "num_input_tokens_seen": 918672136, "step": 28820, "train_runtime": 75456.2678, "train_tokens_per_second": 12174.895 }, { "epoch": 1.9408160517102075, "grad_norm": 0.7949373780734291, "learning_rate": 2.1640221552312603e-08, "loss": 0.3030146598815918, "num_input_tokens_seen": 918834352, "step": 28825, "train_runtime": 75469.5797, "train_tokens_per_second": 12174.897 }, { "epoch": 1.9411527067061676, "grad_norm": 0.8264078243959045, "learning_rate": 2.1395183586229163e-08, "loss": 0.29787449836730956, "num_input_tokens_seen": 918997744, "step": 28830, "train_runtime": 75482.532, "train_tokens_per_second": 12174.972 }, { "epoch": 1.9414893617021276, "grad_norm": 0.8223092520169791, "learning_rate": 2.1151537871106353e-08, "loss": 0.29082038402557375, "num_input_tokens_seen": 919152352, "step": 28835, "train_runtime": 75495.6136, "train_tokens_per_second": 12174.911 }, { "epoch": 1.9418260166980879, "grad_norm": 0.8794137404330502, "learning_rate": 2.0909284475080226e-08, "loss": 0.2737832546234131, "num_input_tokens_seen": 919310648, "step": 28840, "train_runtime": 75508.7469, "train_tokens_per_second": 12174.889 }, { "epoch": 1.942162671694048, "grad_norm": 0.8439272284428391, "learning_rate": 2.0668423465894928e-08, "loss": 0.281263542175293, "num_input_tokens_seen": 919469136, "step": 28845, "train_runtime": 75521.5422, "train_tokens_per_second": 12174.925 }, { "epoch": 1.9424993266900081, "grad_norm": 0.912412397345424, "learning_rate": 2.0428954910907684e-08, "loss": 0.28661403656005857, "num_input_tokens_seen": 919619192, "step": 28850, "train_runtime": 75535.0224, "train_tokens_per_second": 12174.739 }, { "epoch": 1.9428359816859682, "grad_norm": 0.8729345054680056, "learning_rate": 2.019087887708382e-08, "loss": 0.30406627655029295, "num_input_tokens_seen": 919777024, "step": 28855, "train_runtime": 75548.5454, "train_tokens_per_second": 12174.649 }, { "epoch": 1.9431726366819284, "grad_norm": 0.8653081325127362, "learning_rate": 1.9954195431001744e-08, "loss": 0.2937690258026123, "num_input_tokens_seen": 919938880, "step": 28860, "train_runtime": 75561.044, "train_tokens_per_second": 12174.777 }, { "epoch": 1.9435092916778887, "grad_norm": 0.8578164733456476, "learning_rate": 1.9718904638848513e-08, "loss": 0.2698089122772217, "num_input_tokens_seen": 920096352, "step": 28865, "train_runtime": 75574.4778, "train_tokens_per_second": 12174.697 }, { "epoch": 1.9438459466738487, "grad_norm": 0.8582003830973761, "learning_rate": 1.9485006566422602e-08, "loss": 0.29454870223999025, "num_input_tokens_seen": 920258952, "step": 28870, "train_runtime": 75587.1592, "train_tokens_per_second": 12174.805 }, { "epoch": 1.9441826016698087, "grad_norm": 0.8871505496739368, "learning_rate": 1.9252501279132806e-08, "loss": 0.2968337059020996, "num_input_tokens_seen": 920416536, "step": 28875, "train_runtime": 75599.8966, "train_tokens_per_second": 12174.839 }, { "epoch": 1.944519256665769, "grad_norm": 0.7748574040561794, "learning_rate": 1.902138884199878e-08, "loss": 0.30783467292785643, "num_input_tokens_seen": 920576264, "step": 28880, "train_runtime": 75612.6835, "train_tokens_per_second": 12174.892 }, { "epoch": 1.9448559116617292, "grad_norm": 0.7882081854794212, "learning_rate": 1.879166931964993e-08, "loss": 0.28879528045654296, "num_input_tokens_seen": 920736728, "step": 28885, "train_runtime": 75626.6122, "train_tokens_per_second": 12174.772 }, { "epoch": 1.9451925666576892, "grad_norm": 0.7940039919708077, "learning_rate": 1.856334277632765e-08, "loss": 0.2984178066253662, "num_input_tokens_seen": 920900568, "step": 28890, "train_runtime": 75639.0331, "train_tokens_per_second": 12174.938 }, { "epoch": 1.9455292216536493, "grad_norm": 0.7490523577140491, "learning_rate": 1.8336409275880872e-08, "loss": 0.286403226852417, "num_input_tokens_seen": 921064184, "step": 28895, "train_runtime": 75652.0653, "train_tokens_per_second": 12175.004 }, { "epoch": 1.9458658766496095, "grad_norm": 0.8279865355364764, "learning_rate": 1.8110868881772713e-08, "loss": 0.28240299224853516, "num_input_tokens_seen": 921221224, "step": 28900, "train_runtime": 75665.8744, "train_tokens_per_second": 12174.857 }, { "epoch": 1.9462025316455698, "grad_norm": 0.8157353944704581, "learning_rate": 1.788672165707328e-08, "loss": 0.27784175872802735, "num_input_tokens_seen": 921378912, "step": 28905, "train_runtime": 75678.8574, "train_tokens_per_second": 12174.852 }, { "epoch": 1.9465391866415298, "grad_norm": 0.8776841962951271, "learning_rate": 1.7663967664465763e-08, "loss": 0.2834606647491455, "num_input_tokens_seen": 921531144, "step": 28910, "train_runtime": 75691.7084, "train_tokens_per_second": 12174.796 }, { "epoch": 1.9468758416374898, "grad_norm": 0.816195483283043, "learning_rate": 1.7442606966242005e-08, "loss": 0.30164783000946044, "num_input_tokens_seen": 921694984, "step": 28915, "train_runtime": 75704.1448, "train_tokens_per_second": 12174.961 }, { "epoch": 1.94721249663345, "grad_norm": 0.8283107796460333, "learning_rate": 1.722263962430526e-08, "loss": 0.2983541011810303, "num_input_tokens_seen": 921854680, "step": 28920, "train_runtime": 75716.6746, "train_tokens_per_second": 12175.055 }, { "epoch": 1.9475491516294103, "grad_norm": 0.8376735143756399, "learning_rate": 1.7004065700168547e-08, "loss": 0.270952033996582, "num_input_tokens_seen": 922015936, "step": 28925, "train_runtime": 75729.4109, "train_tokens_per_second": 12175.137 }, { "epoch": 1.9478858066253704, "grad_norm": 0.778301474218795, "learning_rate": 1.6786885254954644e-08, "loss": 0.2830474615097046, "num_input_tokens_seen": 922179744, "step": 28930, "train_runtime": 75742.5317, "train_tokens_per_second": 12175.19 }, { "epoch": 1.9482224616213304, "grad_norm": 0.906311661340437, "learning_rate": 1.6571098349398296e-08, "loss": 0.2901591777801514, "num_input_tokens_seen": 922332128, "step": 28935, "train_runtime": 75756.2107, "train_tokens_per_second": 12175.003 }, { "epoch": 1.9485591166172906, "grad_norm": 0.8518320646022326, "learning_rate": 1.635670504384346e-08, "loss": 0.30651230812072755, "num_input_tokens_seen": 922489824, "step": 28940, "train_runtime": 75769.9359, "train_tokens_per_second": 12174.879 }, { "epoch": 1.948895771613251, "grad_norm": 0.9377215700407561, "learning_rate": 1.6143705398243837e-08, "loss": 0.276810884475708, "num_input_tokens_seen": 922646472, "step": 28945, "train_runtime": 75783.8555, "train_tokens_per_second": 12174.71 }, { "epoch": 1.949232426609211, "grad_norm": 0.871398917601628, "learning_rate": 1.5932099472165674e-08, "loss": 0.2886288404464722, "num_input_tokens_seen": 922802576, "step": 28950, "train_runtime": 75797.3249, "train_tokens_per_second": 12174.606 }, { "epoch": 1.949569081605171, "grad_norm": 0.7707519205131593, "learning_rate": 1.572188732478164e-08, "loss": 0.2909992218017578, "num_input_tokens_seen": 922966216, "step": 28955, "train_runtime": 75810.3354, "train_tokens_per_second": 12174.675 }, { "epoch": 1.9499057366011312, "grad_norm": 0.7765522020228335, "learning_rate": 1.551306901487859e-08, "loss": 0.2856043815612793, "num_input_tokens_seen": 923124824, "step": 28960, "train_runtime": 75824.096, "train_tokens_per_second": 12174.558 }, { "epoch": 1.9502423915970915, "grad_norm": 0.7372001456959646, "learning_rate": 1.5305644600852043e-08, "loss": 0.2813275814056396, "num_input_tokens_seen": 923288568, "step": 28965, "train_runtime": 75837.8895, "train_tokens_per_second": 12174.502 }, { "epoch": 1.9505790465930515, "grad_norm": 0.8056836583340231, "learning_rate": 1.5099614140706154e-08, "loss": 0.2971454620361328, "num_input_tokens_seen": 923450168, "step": 28970, "train_runtime": 75851.2904, "train_tokens_per_second": 12174.482 }, { "epoch": 1.9509157015890115, "grad_norm": 0.8240533851004691, "learning_rate": 1.489497769205761e-08, "loss": 0.30417983531951903, "num_input_tokens_seen": 923610520, "step": 28975, "train_runtime": 75864.9032, "train_tokens_per_second": 12174.411 }, { "epoch": 1.9512523565849718, "grad_norm": 0.7947775367457869, "learning_rate": 1.4691735312132304e-08, "loss": 0.28345279693603515, "num_input_tokens_seen": 923774360, "step": 28980, "train_runtime": 75877.3131, "train_tokens_per_second": 12174.579 }, { "epoch": 1.951589011580932, "grad_norm": 0.8301241233047023, "learning_rate": 1.4489887057766439e-08, "loss": 0.30179758071899415, "num_input_tokens_seen": 923933984, "step": 28985, "train_runtime": 75890.3135, "train_tokens_per_second": 12174.597 }, { "epoch": 1.951925666576892, "grad_norm": 0.8885167147741369, "learning_rate": 1.428943298540597e-08, "loss": 0.28542351722717285, "num_input_tokens_seen": 924096184, "step": 28990, "train_runtime": 75903.5612, "train_tokens_per_second": 12174.609 }, { "epoch": 1.952262321572852, "grad_norm": 0.7594617444287598, "learning_rate": 1.4090373151107173e-08, "loss": 0.3091750144958496, "num_input_tokens_seen": 924259184, "step": 28995, "train_runtime": 75916.9871, "train_tokens_per_second": 12174.603 }, { "epoch": 1.9525989765688123, "grad_norm": 0.7757424716130054, "learning_rate": 1.3892707610536627e-08, "loss": 0.2546836853027344, "num_input_tokens_seen": 924416544, "step": 29000, "train_runtime": 75930.3122, "train_tokens_per_second": 12174.539 }, { "epoch": 1.9529356315647726, "grad_norm": 0.8035441875851526, "learning_rate": 1.3696436418970672e-08, "loss": 0.27744646072387696, "num_input_tokens_seen": 924573312, "step": 29005, "train_runtime": 75942.855, "train_tokens_per_second": 12174.592 }, { "epoch": 1.9532722865607326, "grad_norm": 0.8038054377745673, "learning_rate": 1.3501559631296512e-08, "loss": 0.29370999336242676, "num_input_tokens_seen": 924731136, "step": 29010, "train_runtime": 75956.3032, "train_tokens_per_second": 12174.515 }, { "epoch": 1.9536089415566926, "grad_norm": 0.7778274979718193, "learning_rate": 1.3308077302010557e-08, "loss": 0.31083633899688723, "num_input_tokens_seen": 924894376, "step": 29015, "train_runtime": 75969.1889, "train_tokens_per_second": 12174.599 }, { "epoch": 1.9539455965526529, "grad_norm": 0.8018929033041386, "learning_rate": 1.3115989485218972e-08, "loss": 0.290159010887146, "num_input_tokens_seen": 925048200, "step": 29020, "train_runtime": 75982.681, "train_tokens_per_second": 12174.461 }, { "epoch": 1.9542822515486131, "grad_norm": 1.1657468820625887, "learning_rate": 1.2925296234638784e-08, "loss": 0.27074203491210935, "num_input_tokens_seen": 925206936, "step": 29025, "train_runtime": 75996.0865, "train_tokens_per_second": 12174.402 }, { "epoch": 1.9546189065445732, "grad_norm": 0.9295764768955839, "learning_rate": 1.2735997603597339e-08, "loss": 0.28510513305664065, "num_input_tokens_seen": 925369616, "step": 29030, "train_runtime": 76008.7671, "train_tokens_per_second": 12174.512 }, { "epoch": 1.9549555615405332, "grad_norm": 0.8114093466436221, "learning_rate": 1.2548093645030623e-08, "loss": 0.2804151773452759, "num_input_tokens_seen": 925531952, "step": 29035, "train_runtime": 76021.3688, "train_tokens_per_second": 12174.629 }, { "epoch": 1.9552922165364934, "grad_norm": 0.823131232637778, "learning_rate": 1.236158441148605e-08, "loss": 0.28353567123413087, "num_input_tokens_seen": 925692544, "step": 29040, "train_runtime": 76034.2653, "train_tokens_per_second": 12174.676 }, { "epoch": 1.9556288715324537, "grad_norm": 0.8952614438662455, "learning_rate": 1.2176469955119119e-08, "loss": 0.32651076316833494, "num_input_tokens_seen": 925855240, "step": 29045, "train_runtime": 76046.9737, "train_tokens_per_second": 12174.781 }, { "epoch": 1.9559655265284137, "grad_norm": 0.8828414499503993, "learning_rate": 1.199275032769842e-08, "loss": 0.31638288497924805, "num_input_tokens_seen": 926015424, "step": 29050, "train_runtime": 76060.675, "train_tokens_per_second": 12174.694 }, { "epoch": 1.9563021815243737, "grad_norm": 0.8346491115460912, "learning_rate": 1.1810425580598971e-08, "loss": 0.3131925821304321, "num_input_tokens_seen": 926178040, "step": 29055, "train_runtime": 76073.344, "train_tokens_per_second": 12174.804 }, { "epoch": 1.956638836520334, "grad_norm": 0.9249118296844675, "learning_rate": 1.1629495764807763e-08, "loss": 0.3112865686416626, "num_input_tokens_seen": 926341880, "step": 29060, "train_runtime": 76085.7551, "train_tokens_per_second": 12174.971 }, { "epoch": 1.9569754915162942, "grad_norm": 0.903865299643591, "learning_rate": 1.1449960930921544e-08, "loss": 0.28887715339660647, "num_input_tokens_seen": 926500160, "step": 29065, "train_runtime": 76098.7958, "train_tokens_per_second": 12174.965 }, { "epoch": 1.9573121465122543, "grad_norm": 0.8445204757506805, "learning_rate": 1.1271821129146266e-08, "loss": 0.27671151161193847, "num_input_tokens_seen": 926660312, "step": 29070, "train_runtime": 76111.3016, "train_tokens_per_second": 12175.069 }, { "epoch": 1.9576488015082143, "grad_norm": 0.8774050856238764, "learning_rate": 1.1095076409298189e-08, "loss": 0.2734399318695068, "num_input_tokens_seen": 926815904, "step": 29075, "train_runtime": 76124.115, "train_tokens_per_second": 12175.063 }, { "epoch": 1.9579854565041745, "grad_norm": 0.8052245695910365, "learning_rate": 1.0919726820803889e-08, "loss": 0.2903740882873535, "num_input_tokens_seen": 926976136, "step": 29080, "train_runtime": 76137.3688, "train_tokens_per_second": 12175.048 }, { "epoch": 1.9583221115001348, "grad_norm": 0.7552641170358747, "learning_rate": 1.0745772412698585e-08, "loss": 0.2916219711303711, "num_input_tokens_seen": 927130296, "step": 29085, "train_runtime": 76150.3985, "train_tokens_per_second": 12174.989 }, { "epoch": 1.9586587664960948, "grad_norm": 0.886690885988374, "learning_rate": 1.057321323362892e-08, "loss": 0.29023659229278564, "num_input_tokens_seen": 927294136, "step": 29090, "train_runtime": 76162.8206, "train_tokens_per_second": 12175.155 }, { "epoch": 1.9589954214920549, "grad_norm": 0.8182399718478792, "learning_rate": 1.0402049331849629e-08, "loss": 0.2984285831451416, "num_input_tokens_seen": 927455264, "step": 29095, "train_runtime": 76176.857, "train_tokens_per_second": 12175.027 }, { "epoch": 1.959332076488015, "grad_norm": 0.7857156556666306, "learning_rate": 1.0232280755226865e-08, "loss": 0.3030875205993652, "num_input_tokens_seen": 927614112, "step": 29100, "train_runtime": 76190.4698, "train_tokens_per_second": 12174.936 }, { "epoch": 1.9596687314839754, "grad_norm": 0.8303205475206933, "learning_rate": 1.006390755123543e-08, "loss": 0.28156147003173826, "num_input_tokens_seen": 927774344, "step": 29105, "train_runtime": 76203.8038, "train_tokens_per_second": 12174.909 }, { "epoch": 1.9600053864799354, "grad_norm": 0.85512421200839, "learning_rate": 9.89692976696044e-09, "loss": 0.31151576042175294, "num_input_tokens_seen": 927931320, "step": 29110, "train_runtime": 76216.3109, "train_tokens_per_second": 12174.97 }, { "epoch": 1.9603420414758954, "grad_norm": 0.7459946251599527, "learning_rate": 9.731347449097316e-09, "loss": 0.30746827125549314, "num_input_tokens_seen": 928093392, "step": 29115, "train_runtime": 76229.9159, "train_tokens_per_second": 12174.923 }, { "epoch": 1.9606786964718557, "grad_norm": 0.8376215975248772, "learning_rate": 9.56716064394958e-09, "loss": 0.2999640703201294, "num_input_tokens_seen": 928256312, "step": 29120, "train_runtime": 76242.3376, "train_tokens_per_second": 12175.077 }, { "epoch": 1.961015351467816, "grad_norm": 0.9217112386948961, "learning_rate": 9.404369397432166e-09, "loss": 0.27633986473083494, "num_input_tokens_seen": 928412616, "step": 29125, "train_runtime": 76254.974, "train_tokens_per_second": 12175.109 }, { "epoch": 1.961352006463776, "grad_norm": 0.7845970165115492, "learning_rate": 9.242973755068663e-09, "loss": 0.28524107933044435, "num_input_tokens_seen": 928574528, "step": 29130, "train_runtime": 76267.515, "train_tokens_per_second": 12175.23 }, { "epoch": 1.961688661459736, "grad_norm": 0.8245440931407594, "learning_rate": 9.082973761993518e-09, "loss": 0.28589253425598143, "num_input_tokens_seen": 928731376, "step": 29135, "train_runtime": 76280.2296, "train_tokens_per_second": 12175.257 }, { "epoch": 1.9620253164556962, "grad_norm": 0.7917797055104286, "learning_rate": 8.924369462949834e-09, "loss": 0.32050471305847167, "num_input_tokens_seen": 928886440, "step": 29140, "train_runtime": 76293.4841, "train_tokens_per_second": 12175.174 }, { "epoch": 1.9623619714516565, "grad_norm": 0.7795201316001087, "learning_rate": 8.767160902291016e-09, "loss": 0.29182920455932615, "num_input_tokens_seen": 929047344, "step": 29145, "train_runtime": 76306.6584, "train_tokens_per_second": 12175.181 }, { "epoch": 1.9626986264476165, "grad_norm": 0.7527944642683888, "learning_rate": 8.61134812397968e-09, "loss": 0.2893436193466187, "num_input_tokens_seen": 929207368, "step": 29150, "train_runtime": 76320.0126, "train_tokens_per_second": 12175.147 }, { "epoch": 1.9630352814435765, "grad_norm": 0.792256109923035, "learning_rate": 8.45693117158819e-09, "loss": 0.2741499900817871, "num_input_tokens_seen": 929362520, "step": 29155, "train_runtime": 76333.2266, "train_tokens_per_second": 12175.072 }, { "epoch": 1.9633719364395368, "grad_norm": 0.8823355011819821, "learning_rate": 8.303910088299228e-09, "loss": 0.2860186815261841, "num_input_tokens_seen": 929522096, "step": 29160, "train_runtime": 76345.878, "train_tokens_per_second": 12175.144 }, { "epoch": 1.963708591435497, "grad_norm": 0.7999233681376358, "learning_rate": 8.152284916904674e-09, "loss": 0.3026837587356567, "num_input_tokens_seen": 929682912, "step": 29165, "train_runtime": 76358.3206, "train_tokens_per_second": 12175.267 }, { "epoch": 1.964045246431457, "grad_norm": 0.808755355800198, "learning_rate": 8.002055699805612e-09, "loss": 0.27841997146606445, "num_input_tokens_seen": 929842064, "step": 29170, "train_runtime": 76371.1149, "train_tokens_per_second": 12175.311 }, { "epoch": 1.964381901427417, "grad_norm": 0.7353375648412412, "learning_rate": 7.853222479013434e-09, "loss": 0.2710365056991577, "num_input_tokens_seen": 930005904, "step": 29175, "train_runtime": 76383.5289, "train_tokens_per_second": 12175.477 }, { "epoch": 1.9647185564233773, "grad_norm": 0.730225348719828, "learning_rate": 7.705785296148737e-09, "loss": 0.28692214488983153, "num_input_tokens_seen": 930165272, "step": 29180, "train_runtime": 76396.9893, "train_tokens_per_second": 12175.418 }, { "epoch": 1.9650552114193376, "grad_norm": 0.9179627967196287, "learning_rate": 7.55974419244132e-09, "loss": 0.31088976860046386, "num_input_tokens_seen": 930325152, "step": 29185, "train_runtime": 76410.3498, "train_tokens_per_second": 12175.381 }, { "epoch": 1.9653918664152976, "grad_norm": 0.7973398060217323, "learning_rate": 7.415099208732402e-09, "loss": 0.2749485492706299, "num_input_tokens_seen": 930480584, "step": 29190, "train_runtime": 76422.7714, "train_tokens_per_second": 12175.436 }, { "epoch": 1.9657285214112576, "grad_norm": 0.777671908082559, "learning_rate": 7.2718503854707355e-09, "loss": 0.29342141151428225, "num_input_tokens_seen": 930639232, "step": 29195, "train_runtime": 76435.5933, "train_tokens_per_second": 12175.469 }, { "epoch": 1.966065176407218, "grad_norm": 0.7634360715449815, "learning_rate": 7.129997762715391e-09, "loss": 0.2619804859161377, "num_input_tokens_seen": 930797192, "step": 29200, "train_runtime": 76448.5183, "train_tokens_per_second": 12175.477 }, { "epoch": 1.9664018314031781, "grad_norm": 0.8170596591393084, "learning_rate": 6.98954138013519e-09, "loss": 0.2897006034851074, "num_input_tokens_seen": 930955752, "step": 29205, "train_runtime": 76461.4633, "train_tokens_per_second": 12175.49 }, { "epoch": 1.9667384863991382, "grad_norm": 0.8224837112087526, "learning_rate": 6.850481277008159e-09, "loss": 0.3011942863464355, "num_input_tokens_seen": 931118392, "step": 29210, "train_runtime": 76474.5278, "train_tokens_per_second": 12175.536 }, { "epoch": 1.9670751413950982, "grad_norm": 0.8590772388903853, "learning_rate": 6.712817492222079e-09, "loss": 0.3154435157775879, "num_input_tokens_seen": 931276200, "step": 29215, "train_runtime": 76486.9791, "train_tokens_per_second": 12175.617 }, { "epoch": 1.9674117963910585, "grad_norm": 0.7370067370233849, "learning_rate": 6.576550064273934e-09, "loss": 0.290617847442627, "num_input_tokens_seen": 931433344, "step": 29220, "train_runtime": 76500.118, "train_tokens_per_second": 12175.58 }, { "epoch": 1.9677484513870187, "grad_norm": 0.8349058841392281, "learning_rate": 6.44167903127102e-09, "loss": 0.3119671821594238, "num_input_tokens_seen": 931594304, "step": 29225, "train_runtime": 76513.0002, "train_tokens_per_second": 12175.634 }, { "epoch": 1.9680851063829787, "grad_norm": 0.8873494314559613, "learning_rate": 6.3082044309287215e-09, "loss": 0.28221855163574217, "num_input_tokens_seen": 931756176, "step": 29230, "train_runtime": 76526.0816, "train_tokens_per_second": 12175.668 }, { "epoch": 1.9684217613789388, "grad_norm": 0.7763560275554647, "learning_rate": 6.176126300573848e-09, "loss": 0.292108154296875, "num_input_tokens_seen": 931916984, "step": 29235, "train_runtime": 76538.835, "train_tokens_per_second": 12175.74 }, { "epoch": 1.968758416374899, "grad_norm": 0.858610586630292, "learning_rate": 6.045444677140744e-09, "loss": 0.27784552574157717, "num_input_tokens_seen": 932079816, "step": 29240, "train_runtime": 76551.5814, "train_tokens_per_second": 12175.84 }, { "epoch": 1.9690950713708593, "grad_norm": 0.8491615942184385, "learning_rate": 5.91615959717462e-09, "loss": 0.28981566429138184, "num_input_tokens_seen": 932237248, "step": 29245, "train_runtime": 76564.0612, "train_tokens_per_second": 12175.912 }, { "epoch": 1.9694317263668193, "grad_norm": 0.6818760385053637, "learning_rate": 5.78827109682989e-09, "loss": 0.24991152286529542, "num_input_tokens_seen": 932398016, "step": 29250, "train_runtime": 76577.1815, "train_tokens_per_second": 12175.925 }, { "epoch": 1.9697683813627793, "grad_norm": 0.8100713265658934, "learning_rate": 5.661779211869056e-09, "loss": 0.2760288238525391, "num_input_tokens_seen": 932559336, "step": 29255, "train_runtime": 76590.4102, "train_tokens_per_second": 12175.928 }, { "epoch": 1.9701050363587396, "grad_norm": 0.8854628387437574, "learning_rate": 5.536683977666601e-09, "loss": 0.2981565475463867, "num_input_tokens_seen": 932723096, "step": 29260, "train_runtime": 76603.5043, "train_tokens_per_second": 12175.985 }, { "epoch": 1.9704416913546998, "grad_norm": 0.7458527606708117, "learning_rate": 5.412985429203988e-09, "loss": 0.2862668514251709, "num_input_tokens_seen": 932879296, "step": 29265, "train_runtime": 76616.3147, "train_tokens_per_second": 12175.988 }, { "epoch": 1.9707783463506598, "grad_norm": 0.8295145138160456, "learning_rate": 5.290683601073543e-09, "loss": 0.28243634700775144, "num_input_tokens_seen": 933039944, "step": 29270, "train_runtime": 76629.7985, "train_tokens_per_second": 12175.942 }, { "epoch": 1.9711150013466199, "grad_norm": 0.8003242943795617, "learning_rate": 5.169778527476243e-09, "loss": 0.2951035022735596, "num_input_tokens_seen": 933201704, "step": 29275, "train_runtime": 76642.7107, "train_tokens_per_second": 12176.001 }, { "epoch": 1.9714516563425801, "grad_norm": 0.8411573280682593, "learning_rate": 5.050270242222821e-09, "loss": 0.30519585609436034, "num_input_tokens_seen": 933355320, "step": 29280, "train_runtime": 76656.117, "train_tokens_per_second": 12175.875 }, { "epoch": 1.9717883113385404, "grad_norm": 0.7972038728645241, "learning_rate": 4.932158778733765e-09, "loss": 0.2804659128189087, "num_input_tokens_seen": 933515528, "step": 29285, "train_runtime": 76668.8967, "train_tokens_per_second": 12175.935 }, { "epoch": 1.9721249663345004, "grad_norm": 0.8866508167217122, "learning_rate": 4.8154441700387636e-09, "loss": 0.3104846715927124, "num_input_tokens_seen": 933666640, "step": 29290, "train_runtime": 76682.5124, "train_tokens_per_second": 12175.744 }, { "epoch": 1.9724616213304604, "grad_norm": 0.8016374092314424, "learning_rate": 4.7001264487761545e-09, "loss": 0.3072397232055664, "num_input_tokens_seen": 933827072, "step": 29295, "train_runtime": 76694.9164, "train_tokens_per_second": 12175.867 }, { "epoch": 1.9727982763264207, "grad_norm": 0.7521807178697871, "learning_rate": 4.586205647194031e-09, "loss": 0.3076127529144287, "num_input_tokens_seen": 933988224, "step": 29300, "train_runtime": 76708.8358, "train_tokens_per_second": 12175.758 }, { "epoch": 1.973134931322381, "grad_norm": 0.9051066643736196, "learning_rate": 4.4736817971507974e-09, "loss": 0.2979921817779541, "num_input_tokens_seen": 934146248, "step": 29305, "train_runtime": 76721.9656, "train_tokens_per_second": 12175.734 }, { "epoch": 1.973471586318341, "grad_norm": 0.8034825681678837, "learning_rate": 4.362554930112395e-09, "loss": 0.2878642797470093, "num_input_tokens_seen": 934301736, "step": 29310, "train_runtime": 76735.3903, "train_tokens_per_second": 12175.63 }, { "epoch": 1.973808241314301, "grad_norm": 0.8420632395335224, "learning_rate": 4.252825077155631e-09, "loss": 0.2979853630065918, "num_input_tokens_seen": 934461944, "step": 29315, "train_runtime": 76748.8677, "train_tokens_per_second": 12175.58 }, { "epoch": 1.9741448963102612, "grad_norm": 0.8675204154127251, "learning_rate": 4.1444922689665156e-09, "loss": 0.2956474781036377, "num_input_tokens_seen": 934620336, "step": 29320, "train_runtime": 76762.5477, "train_tokens_per_second": 12175.473 }, { "epoch": 1.9744815513062215, "grad_norm": 0.86023449238149, "learning_rate": 4.037556535839149e-09, "loss": 0.26177656650543213, "num_input_tokens_seen": 934779232, "step": 29325, "train_runtime": 76775.4866, "train_tokens_per_second": 12175.491 }, { "epoch": 1.9748182063021815, "grad_norm": 0.73820683149687, "learning_rate": 3.932017907677943e-09, "loss": 0.2710430145263672, "num_input_tokens_seen": 934942280, "step": 29330, "train_runtime": 76788.3128, "train_tokens_per_second": 12175.58 }, { "epoch": 1.9751548612981416, "grad_norm": 0.7840797682346614, "learning_rate": 3.827876413997067e-09, "loss": 0.29810845851898193, "num_input_tokens_seen": 935094576, "step": 29335, "train_runtime": 76802.4877, "train_tokens_per_second": 12175.316 }, { "epoch": 1.9754915162941018, "grad_norm": 0.8375281112371067, "learning_rate": 3.725132083918781e-09, "loss": 0.2911087989807129, "num_input_tokens_seen": 935252952, "step": 29340, "train_runtime": 76816.3797, "train_tokens_per_second": 12175.176 }, { "epoch": 1.975828171290062, "grad_norm": 0.7657521510165652, "learning_rate": 3.623784946175102e-09, "loss": 0.29820995330810546, "num_input_tokens_seen": 935407608, "step": 29345, "train_runtime": 76829.5433, "train_tokens_per_second": 12175.103 }, { "epoch": 1.976164826286022, "grad_norm": 0.8104504671700982, "learning_rate": 3.5238350291083577e-09, "loss": 0.275114917755127, "num_input_tokens_seen": 935561536, "step": 29350, "train_runtime": 76843.2615, "train_tokens_per_second": 12174.933 }, { "epoch": 1.976501481281982, "grad_norm": 0.806214156225629, "learning_rate": 3.4252823606678588e-09, "loss": 0.3068329572677612, "num_input_tokens_seen": 935722776, "step": 29355, "train_runtime": 76856.2485, "train_tokens_per_second": 12174.973 }, { "epoch": 1.9768381362779424, "grad_norm": 0.8617761238487917, "learning_rate": 3.328126968414336e-09, "loss": 0.311933708190918, "num_input_tokens_seen": 935876760, "step": 29360, "train_runtime": 76869.7495, "train_tokens_per_second": 12174.838 }, { "epoch": 1.9771747912739026, "grad_norm": 0.7910248620353353, "learning_rate": 3.232368879517167e-09, "loss": 0.30498623847961426, "num_input_tokens_seen": 936039376, "step": 29365, "train_runtime": 76883.1192, "train_tokens_per_second": 12174.836 }, { "epoch": 1.9775114462698626, "grad_norm": 0.8446123317850052, "learning_rate": 3.1380081207543766e-09, "loss": 0.2721656560897827, "num_input_tokens_seen": 936198504, "step": 29370, "train_runtime": 76896.8241, "train_tokens_per_second": 12174.736 }, { "epoch": 1.9778481012658227, "grad_norm": 0.8337056911954362, "learning_rate": 3.0450447185137454e-09, "loss": 0.3107349634170532, "num_input_tokens_seen": 936358888, "step": 29375, "train_runtime": 76910.1774, "train_tokens_per_second": 12174.707 }, { "epoch": 1.978184756261783, "grad_norm": 0.8228387935666606, "learning_rate": 2.953478698792256e-09, "loss": 0.2757991552352905, "num_input_tokens_seen": 936521040, "step": 29380, "train_runtime": 76922.7544, "train_tokens_per_second": 12174.825 }, { "epoch": 1.9785214112577432, "grad_norm": 0.8213008480511698, "learning_rate": 2.8633100871960917e-09, "loss": 0.27904744148254396, "num_input_tokens_seen": 936674440, "step": 29385, "train_runtime": 76935.6325, "train_tokens_per_second": 12174.781 }, { "epoch": 1.9788580662537032, "grad_norm": 0.8761024589761595, "learning_rate": 2.774538908940638e-09, "loss": 0.2947150945663452, "num_input_tokens_seen": 936830064, "step": 29390, "train_runtime": 76948.5595, "train_tokens_per_second": 12174.758 }, { "epoch": 1.9791947212496632, "grad_norm": 0.7589192973955758, "learning_rate": 2.687165188849927e-09, "loss": 0.28190290927886963, "num_input_tokens_seen": 936992840, "step": 29395, "train_runtime": 76962.0049, "train_tokens_per_second": 12174.746 }, { "epoch": 1.9795313762456235, "grad_norm": 0.8593300926575295, "learning_rate": 2.6011889513588574e-09, "loss": 0.2864360332489014, "num_input_tokens_seen": 937151104, "step": 29400, "train_runtime": 76975.414, "train_tokens_per_second": 12174.681 }, { "epoch": 1.9798680312415837, "grad_norm": 0.7991317606658112, "learning_rate": 2.5166102205093077e-09, "loss": 0.3007565975189209, "num_input_tokens_seen": 937310744, "step": 29405, "train_runtime": 76988.4696, "train_tokens_per_second": 12174.69 }, { "epoch": 1.9802046862375438, "grad_norm": 0.8902602754945289, "learning_rate": 2.4334290199540254e-09, "loss": 0.28476266860961913, "num_input_tokens_seen": 937467656, "step": 29410, "train_runtime": 77000.8973, "train_tokens_per_second": 12174.763 }, { "epoch": 1.9805413412335038, "grad_norm": 0.8224627931710313, "learning_rate": 2.351645372953848e-09, "loss": 0.2673612594604492, "num_input_tokens_seen": 937628192, "step": 29415, "train_runtime": 77013.9117, "train_tokens_per_second": 12174.79 }, { "epoch": 1.980877996229464, "grad_norm": 0.901435471279115, "learning_rate": 2.2712593023804795e-09, "loss": 0.2813266277313232, "num_input_tokens_seen": 937781104, "step": 29420, "train_runtime": 77026.6802, "train_tokens_per_second": 12174.757 }, { "epoch": 1.9812146512254243, "grad_norm": 0.7871345186400073, "learning_rate": 2.1922708307120512e-09, "loss": 0.2950688362121582, "num_input_tokens_seen": 937942752, "step": 29425, "train_runtime": 77039.8264, "train_tokens_per_second": 12174.778 }, { "epoch": 1.9815513062213843, "grad_norm": 0.7976326292391558, "learning_rate": 2.1146799800386698e-09, "loss": 0.30443737506866453, "num_input_tokens_seen": 938100608, "step": 29430, "train_runtime": 77052.8194, "train_tokens_per_second": 12174.773 }, { "epoch": 1.9818879612173443, "grad_norm": 0.848508194537515, "learning_rate": 2.0384867720579794e-09, "loss": 0.27435779571533203, "num_input_tokens_seen": 938256584, "step": 29435, "train_runtime": 77066.0985, "train_tokens_per_second": 12174.699 }, { "epoch": 1.9822246162133046, "grad_norm": 0.9298469051325583, "learning_rate": 1.96369122807738e-09, "loss": 0.3082582473754883, "num_input_tokens_seen": 938417288, "step": 29440, "train_runtime": 77079.1281, "train_tokens_per_second": 12174.726 }, { "epoch": 1.9825612712092648, "grad_norm": 0.8481077027374472, "learning_rate": 1.8902933690123637e-09, "loss": 0.2730572700500488, "num_input_tokens_seen": 938575840, "step": 29445, "train_runtime": 77092.1315, "train_tokens_per_second": 12174.729 }, { "epoch": 1.9828979262052249, "grad_norm": 0.8010328499854671, "learning_rate": 1.8182932153892884e-09, "loss": 0.29535622596740724, "num_input_tokens_seen": 938736072, "step": 29450, "train_runtime": 77104.8565, "train_tokens_per_second": 12174.798 }, { "epoch": 1.983234581201185, "grad_norm": 0.8489537335074749, "learning_rate": 1.7476907873426041e-09, "loss": 0.27869572639465334, "num_input_tokens_seen": 938895864, "step": 29455, "train_runtime": 77117.3055, "train_tokens_per_second": 12174.905 }, { "epoch": 1.9835712361971451, "grad_norm": 0.7983175571632403, "learning_rate": 1.6784861046159617e-09, "loss": 0.2912956714630127, "num_input_tokens_seen": 939055744, "step": 29460, "train_runtime": 77130.6823, "train_tokens_per_second": 12174.866 }, { "epoch": 1.9839078911931054, "grad_norm": 0.7598396639412233, "learning_rate": 1.610679186561659e-09, "loss": 0.29097628593444824, "num_input_tokens_seen": 939219408, "step": 29465, "train_runtime": 77144.3712, "train_tokens_per_second": 12174.827 }, { "epoch": 1.9842445461890654, "grad_norm": 0.7172928944345176, "learning_rate": 1.5442700521428599e-09, "loss": 0.2674097061157227, "num_input_tokens_seen": 939377952, "step": 29470, "train_runtime": 77157.5723, "train_tokens_per_second": 12174.799 }, { "epoch": 1.9845812011850255, "grad_norm": 0.819529932769271, "learning_rate": 1.4792587199297103e-09, "loss": 0.28331961631774905, "num_input_tokens_seen": 939538568, "step": 29475, "train_runtime": 77170.1586, "train_tokens_per_second": 12174.895 }, { "epoch": 1.9849178561809857, "grad_norm": 0.8639167652586511, "learning_rate": 1.4156452081026672e-09, "loss": 0.29461016654968264, "num_input_tokens_seen": 939699048, "step": 29480, "train_runtime": 77182.5833, "train_tokens_per_second": 12175.014 }, { "epoch": 1.985254511176946, "grad_norm": 0.9108738154013134, "learning_rate": 1.3534295344513893e-09, "loss": 0.2977909088134766, "num_input_tokens_seen": 939861112, "step": 29485, "train_runtime": 77195.2025, "train_tokens_per_second": 12175.123 }, { "epoch": 1.985591166172906, "grad_norm": 0.9389041567530285, "learning_rate": 1.2926117163741813e-09, "loss": 0.27971372604370115, "num_input_tokens_seen": 940023104, "step": 29490, "train_runtime": 77207.7548, "train_tokens_per_second": 12175.242 }, { "epoch": 1.985927821168866, "grad_norm": 0.7918353716275476, "learning_rate": 1.233191770877995e-09, "loss": 0.30565314292907714, "num_input_tokens_seen": 940186016, "step": 29495, "train_runtime": 77221.2233, "train_tokens_per_second": 12175.228 }, { "epoch": 1.9862644761648263, "grad_norm": 0.8468452486759673, "learning_rate": 1.1751697145800934e-09, "loss": 0.2905928134918213, "num_input_tokens_seen": 940348768, "step": 29500, "train_runtime": 77233.8541, "train_tokens_per_second": 12175.344 }, { "epoch": 1.9866011311607865, "grad_norm": 0.8378997663580825, "learning_rate": 1.1185455637052756e-09, "loss": 0.33621797561645506, "num_input_tokens_seen": 940509424, "step": 29505, "train_runtime": 77247.1311, "train_tokens_per_second": 12175.331 }, { "epoch": 1.9869377861567465, "grad_norm": 0.8968025348299586, "learning_rate": 1.063319334089763e-09, "loss": 0.3021702289581299, "num_input_tokens_seen": 940665144, "step": 29510, "train_runtime": 77259.8774, "train_tokens_per_second": 12175.338 }, { "epoch": 1.9872744411527066, "grad_norm": 0.7727664332513424, "learning_rate": 1.0094910411762027e-09, "loss": 0.2760730266571045, "num_input_tokens_seen": 940823912, "step": 29515, "train_runtime": 77272.8938, "train_tokens_per_second": 12175.342 }, { "epoch": 1.9876110961486668, "grad_norm": 0.864133591980906, "learning_rate": 9.570607000175536e-10, "loss": 0.30960218906402587, "num_input_tokens_seen": 940985400, "step": 29520, "train_runtime": 77286.504, "train_tokens_per_second": 12175.287 }, { "epoch": 1.987947751144627, "grad_norm": 0.899554970278401, "learning_rate": 9.060283252765311e-10, "loss": 0.2835289716720581, "num_input_tokens_seen": 941140752, "step": 29525, "train_runtime": 77299.5955, "train_tokens_per_second": 12175.235 }, { "epoch": 1.988284406140587, "grad_norm": 0.8206640583717952, "learning_rate": 8.563939312233871e-10, "loss": 0.2835988521575928, "num_input_tokens_seen": 941295728, "step": 29530, "train_runtime": 77312.1621, "train_tokens_per_second": 12175.261 }, { "epoch": 1.9886210611365471, "grad_norm": 0.848395996343161, "learning_rate": 8.081575317386847e-10, "loss": 0.309305477142334, "num_input_tokens_seen": 941458128, "step": 29535, "train_runtime": 77325.7283, "train_tokens_per_second": 12175.225 }, { "epoch": 1.9889577161325074, "grad_norm": 0.8074536469579221, "learning_rate": 7.613191403116338e-10, "loss": 0.31104748249053954, "num_input_tokens_seen": 941619424, "step": 29540, "train_runtime": 77338.4672, "train_tokens_per_second": 12175.305 }, { "epoch": 1.9892943711284676, "grad_norm": 0.8528998101186868, "learning_rate": 7.158787700400905e-10, "loss": 0.3015526056289673, "num_input_tokens_seen": 941782352, "step": 29545, "train_runtime": 77351.927, "train_tokens_per_second": 12175.293 }, { "epoch": 1.9896310261244277, "grad_norm": 0.7491203828873338, "learning_rate": 6.718364336316674e-10, "loss": 0.28328001499176025, "num_input_tokens_seen": 941943128, "step": 29550, "train_runtime": 77364.9824, "train_tokens_per_second": 12175.316 }, { "epoch": 1.9899676811203877, "grad_norm": 0.7587661311854949, "learning_rate": 6.291921434026238e-10, "loss": 0.27706184387207033, "num_input_tokens_seen": 942105032, "step": 29555, "train_runtime": 77377.5266, "train_tokens_per_second": 12175.435 }, { "epoch": 1.990304336116348, "grad_norm": 0.7278038598180633, "learning_rate": 5.879459112778651e-10, "loss": 0.26283950805664064, "num_input_tokens_seen": 942266520, "step": 29560, "train_runtime": 77391.3468, "train_tokens_per_second": 12175.347 }, { "epoch": 1.9906409911123082, "grad_norm": 0.7474019015144875, "learning_rate": 5.480977487920536e-10, "loss": 0.29887566566467283, "num_input_tokens_seen": 942430360, "step": 29565, "train_runtime": 77403.7559, "train_tokens_per_second": 12175.512 }, { "epoch": 1.9909776461082682, "grad_norm": 0.7540203833863748, "learning_rate": 5.096476670890526e-10, "loss": 0.29635598659515383, "num_input_tokens_seen": 942594200, "step": 29570, "train_runtime": 77416.1724, "train_tokens_per_second": 12175.676 }, { "epoch": 1.9913143011042282, "grad_norm": 0.8376997866780798, "learning_rate": 4.725956769202622e-10, "loss": 0.3023070812225342, "num_input_tokens_seen": 942750888, "step": 29575, "train_runtime": 77429.0143, "train_tokens_per_second": 12175.68 }, { "epoch": 1.9916509561001885, "grad_norm": 0.7409331766308338, "learning_rate": 4.369417886485039e-10, "loss": 0.2884089946746826, "num_input_tokens_seen": 942909592, "step": 29580, "train_runtime": 77442.9272, "train_tokens_per_second": 12175.542 }, { "epoch": 1.9919876110961487, "grad_norm": 0.8010841721462845, "learning_rate": 4.026860122430254e-10, "loss": 0.2792597770690918, "num_input_tokens_seen": 943070080, "step": 29585, "train_runtime": 77456.2648, "train_tokens_per_second": 12175.517 }, { "epoch": 1.9923242660921088, "grad_norm": 0.8653515440495158, "learning_rate": 3.698283572839412e-10, "loss": 0.29066541194915774, "num_input_tokens_seen": 943230024, "step": 29590, "train_runtime": 77469.2872, "train_tokens_per_second": 12175.535 }, { "epoch": 1.9926609210880688, "grad_norm": 1.0419336259041754, "learning_rate": 3.38368832959457e-10, "loss": 0.30399882793426514, "num_input_tokens_seen": 943383728, "step": 29595, "train_runtime": 77481.8642, "train_tokens_per_second": 12175.542 }, { "epoch": 1.992997576084029, "grad_norm": 0.8656319607881853, "learning_rate": 3.0830744806753523e-10, "loss": 0.3008615016937256, "num_input_tokens_seen": 943541952, "step": 29600, "train_runtime": 77494.3808, "train_tokens_per_second": 12175.618 }, { "epoch": 1.9933342310799893, "grad_norm": 0.8429220436900494, "learning_rate": 2.7964421101478457e-10, "loss": 0.2879644393920898, "num_input_tokens_seen": 943697008, "step": 29605, "train_runtime": 77508.4928, "train_tokens_per_second": 12175.401 }, { "epoch": 1.9936708860759493, "grad_norm": 0.790454005331594, "learning_rate": 2.5237912981646016e-10, "loss": 0.31576874256134035, "num_input_tokens_seen": 943857608, "step": 29610, "train_runtime": 77521.4136, "train_tokens_per_second": 12175.444 }, { "epoch": 1.9940075410719094, "grad_norm": 0.8755205578226211, "learning_rate": 2.265122120975738e-10, "loss": 0.28240337371826174, "num_input_tokens_seen": 944015136, "step": 29615, "train_runtime": 77534.6057, "train_tokens_per_second": 12175.404 }, { "epoch": 1.9943441960678696, "grad_norm": 0.7413368540241816, "learning_rate": 2.020434650906733e-10, "loss": 0.28460862636566164, "num_input_tokens_seen": 944176456, "step": 29620, "train_runtime": 77547.1945, "train_tokens_per_second": 12175.508 }, { "epoch": 1.9946808510638299, "grad_norm": 0.8225014042874448, "learning_rate": 1.7897289563972854e-10, "loss": 0.2820748805999756, "num_input_tokens_seen": 944339848, "step": 29625, "train_runtime": 77560.1349, "train_tokens_per_second": 12175.583 }, { "epoch": 1.99501750605979, "grad_norm": 0.8050614746202819, "learning_rate": 1.5730051019569037e-10, "loss": 0.27139968872070314, "num_input_tokens_seen": 944499152, "step": 29630, "train_runtime": 77573.6502, "train_tokens_per_second": 12175.515 }, { "epoch": 1.99535416105575, "grad_norm": 0.7561090790771114, "learning_rate": 1.3702631481926633e-10, "loss": 0.28660154342651367, "num_input_tokens_seen": 944659792, "step": 29635, "train_runtime": 77586.6032, "train_tokens_per_second": 12175.553 }, { "epoch": 1.9956908160517102, "grad_norm": 0.7728508250728632, "learning_rate": 1.1815031517981023e-10, "loss": 0.2818227529525757, "num_input_tokens_seen": 944815192, "step": 29640, "train_runtime": 77599.9837, "train_tokens_per_second": 12175.456 }, { "epoch": 1.9960274710476704, "grad_norm": 0.8242452009121897, "learning_rate": 1.0067251655643262e-10, "loss": 0.28234565258026123, "num_input_tokens_seen": 944978864, "step": 29645, "train_runtime": 77612.4105, "train_tokens_per_second": 12175.615 }, { "epoch": 1.9963641260436304, "grad_norm": 0.8919854040581632, "learning_rate": 8.459292383633522e-11, "loss": 0.29870238304138186, "num_input_tokens_seen": 945135840, "step": 29650, "train_runtime": 77626.3508, "train_tokens_per_second": 12175.451 }, { "epoch": 1.9967007810395905, "grad_norm": 0.7828172510925471, "learning_rate": 6.991154151592128e-11, "loss": 0.27906227111816406, "num_input_tokens_seen": 945295128, "step": 29655, "train_runtime": 77638.9734, "train_tokens_per_second": 12175.523 }, { "epoch": 1.9970374360355507, "grad_norm": 0.7833960276821675, "learning_rate": 5.662837370135066e-11, "loss": 0.30341286659240724, "num_input_tokens_seen": 945455848, "step": 29660, "train_runtime": 77651.4297, "train_tokens_per_second": 12175.64 }, { "epoch": 1.997374091031511, "grad_norm": 0.818635008156073, "learning_rate": 4.47434241074296e-11, "loss": 0.29509916305541994, "num_input_tokens_seen": 945612864, "step": 29665, "train_runtime": 77664.7853, "train_tokens_per_second": 12175.568 }, { "epoch": 1.997710746027471, "grad_norm": 0.9822177117892062, "learning_rate": 3.4256696057055615e-11, "loss": 0.29454774856567384, "num_input_tokens_seen": 945769840, "step": 29670, "train_runtime": 77678.4914, "train_tokens_per_second": 12175.44 }, { "epoch": 1.998047401023431, "grad_norm": 0.8269150531407821, "learning_rate": 2.5168192482882824e-11, "loss": 0.30178217887878417, "num_input_tokens_seen": 945931296, "step": 29675, "train_runtime": 77691.6155, "train_tokens_per_second": 12175.462 }, { "epoch": 1.9983840560193913, "grad_norm": 0.847094917279186, "learning_rate": 1.747791592676684e-11, "loss": 0.26887195110321044, "num_input_tokens_seen": 946095136, "step": 29680, "train_runtime": 77704.05, "train_tokens_per_second": 12175.622 }, { "epoch": 1.9987207110153515, "grad_norm": 0.7990417245340667, "learning_rate": 1.1185868539209665e-11, "loss": 0.28517296314239504, "num_input_tokens_seen": 946255432, "step": 29685, "train_runtime": 77718.7118, "train_tokens_per_second": 12175.388 }, { "epoch": 1.9990573660113116, "grad_norm": 0.8777814215437981, "learning_rate": 6.29205207991479e-12, "loss": 0.2979507207870483, "num_input_tokens_seen": 946409480, "step": 29690, "train_runtime": 77732.7486, "train_tokens_per_second": 12175.171 }, { "epoch": 1.9993940210072716, "grad_norm": 0.790297442863995, "learning_rate": 2.7964679166769815e-12, "loss": 0.29178709983825685, "num_input_tokens_seen": 946571528, "step": 29695, "train_runtime": 77745.2748, "train_tokens_per_second": 12175.293 }, { "epoch": 1.9997306760032318, "grad_norm": 0.9216521251008282, "learning_rate": 6.991170281578364e-13, "loss": 0.2546474695205688, "num_input_tokens_seen": 946724720, "step": 29700, "train_runtime": 77758.7355, "train_tokens_per_second": 12175.156 }, { "epoch": 2.0, "num_input_tokens_seen": 946850504, "step": 29704, "total_flos": 1751052299468800.0, "train_loss": 0.34826657584565623, "train_runtime": 77931.6678, "train_samples_per_second": 1.525, "train_steps_per_second": 0.381 } ], "logging_steps": 5, "max_steps": 29704, "num_input_tokens_seen": 946850504, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1751052299468800.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }