{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.75, "eval_steps": 500, "global_step": 15750, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 9.523809523809524e-05, "grad_norm": 5.334249496459961, "learning_rate": 0.0009599999757483602, "loss": 11.338590621948242, "step": 2 }, { "epoch": 0.00019047619047619048, "grad_norm": 4.912158489227295, "learning_rate": 0.0019199999514967203, "loss": 11.106103897094727, "step": 4 }, { "epoch": 0.00028571428571428574, "grad_norm": 3.8797929286956787, "learning_rate": 0.0028800000436604023, "loss": 10.584598541259766, "step": 6 }, { "epoch": 0.00038095238095238096, "grad_norm": 3.2725608348846436, "learning_rate": 0.0038399999029934406, "loss": 9.865562438964844, "step": 8 }, { "epoch": 0.0004761904761904762, "grad_norm": 2.6068851947784424, "learning_rate": 0.004800000227987766, "loss": 9.060608863830566, "step": 10 }, { "epoch": 0.0005714285714285715, "grad_norm": 1.7468725442886353, "learning_rate": 0.005760000087320805, "loss": 8.384103775024414, "step": 12 }, { "epoch": 0.0006666666666666666, "grad_norm": 1.3570023775100708, "learning_rate": 0.006719999946653843, "loss": 7.987142562866211, "step": 14 }, { "epoch": 0.0007619047619047619, "grad_norm": 1.487230658531189, "learning_rate": 0.007679999805986881, "loss": 7.8146653175354, "step": 16 }, { "epoch": 0.0008571428571428571, "grad_norm": 1.4034303426742554, "learning_rate": 0.008640000596642494, "loss": 7.720141410827637, "step": 18 }, { "epoch": 0.0009523809523809524, "grad_norm": 1.0685454607009888, "learning_rate": 0.009600000455975533, "loss": 7.585640907287598, "step": 20 }, { "epoch": 0.0010476190476190477, "grad_norm": 1.312131404876709, "learning_rate": 0.01056000031530857, "loss": 7.492856025695801, "step": 22 }, { "epoch": 0.001142857142857143, "grad_norm": 1.8928203582763672, "learning_rate": 0.01152000017464161, "loss": 7.4614338874816895, "step": 24 }, { "epoch": 0.001238095238095238, "grad_norm": 0.8378232717514038, "learning_rate": 0.012480000033974648, "loss": 7.34164571762085, "step": 26 }, { "epoch": 0.0013333333333333333, "grad_norm": 1.228731632232666, "learning_rate": 0.013439999893307686, "loss": 7.239810466766357, "step": 28 }, { "epoch": 0.0014285714285714286, "grad_norm": 1.876471757888794, "learning_rate": 0.014400000683963299, "loss": 7.2283172607421875, "step": 30 }, { "epoch": 0.0015238095238095239, "grad_norm": 1.8284523487091064, "learning_rate": 0.015359999611973763, "loss": 7.045976161956787, "step": 32 }, { "epoch": 0.0016190476190476191, "grad_norm": 1.139763593673706, "learning_rate": 0.0163199994713068, "loss": 6.928892612457275, "step": 34 }, { "epoch": 0.0017142857142857142, "grad_norm": 1.4842286109924316, "learning_rate": 0.01728000119328499, "loss": 6.857249736785889, "step": 36 }, { "epoch": 0.0018095238095238095, "grad_norm": 1.2160557508468628, "learning_rate": 0.018239999189972878, "loss": 6.804518699645996, "step": 38 }, { "epoch": 0.0019047619047619048, "grad_norm": 0.7941610217094421, "learning_rate": 0.019200000911951065, "loss": 6.6685380935668945, "step": 40 }, { "epoch": 0.002, "grad_norm": 1.1024287939071655, "learning_rate": 0.020159998908638954, "loss": 6.523946762084961, "step": 42 }, { "epoch": 0.0020952380952380953, "grad_norm": 1.01893150806427, "learning_rate": 0.02112000063061714, "loss": 6.507093906402588, "step": 44 }, { "epoch": 0.0021904761904761906, "grad_norm": 0.9222122430801392, "learning_rate": 0.02208000048995018, "loss": 6.462471008300781, "step": 46 }, { "epoch": 0.002285714285714286, "grad_norm": 0.9372642040252686, "learning_rate": 0.02304000034928322, "loss": 6.336216449737549, "step": 48 }, { "epoch": 0.002380952380952381, "grad_norm": 0.7343265414237976, "learning_rate": 0.024000000208616257, "loss": 6.313828468322754, "step": 50 }, { "epoch": 0.002476190476190476, "grad_norm": 0.7058768272399902, "learning_rate": 0.024000000208616257, "loss": 6.157600402832031, "step": 52 }, { "epoch": 0.0025714285714285713, "grad_norm": 0.6334480047225952, "learning_rate": 0.024000000208616257, "loss": 6.117180824279785, "step": 54 }, { "epoch": 0.0026666666666666666, "grad_norm": 0.6416035890579224, "learning_rate": 0.024000000208616257, "loss": 6.12557315826416, "step": 56 }, { "epoch": 0.002761904761904762, "grad_norm": 0.6256217956542969, "learning_rate": 0.024000000208616257, "loss": 5.993575096130371, "step": 58 }, { "epoch": 0.002857142857142857, "grad_norm": 0.6432225704193115, "learning_rate": 0.024000000208616257, "loss": 5.912439346313477, "step": 60 }, { "epoch": 0.0029523809523809524, "grad_norm": 0.697803258895874, "learning_rate": 0.024000000208616257, "loss": 5.949170112609863, "step": 62 }, { "epoch": 0.0030476190476190477, "grad_norm": 0.5313658118247986, "learning_rate": 0.024000000208616257, "loss": 5.836516380310059, "step": 64 }, { "epoch": 0.003142857142857143, "grad_norm": 0.6081739068031311, "learning_rate": 0.024000000208616257, "loss": 5.72202205657959, "step": 66 }, { "epoch": 0.0032380952380952383, "grad_norm": 0.6072482466697693, "learning_rate": 0.024000000208616257, "loss": 5.780881404876709, "step": 68 }, { "epoch": 0.0033333333333333335, "grad_norm": 0.53412264585495, "learning_rate": 0.024000000208616257, "loss": 5.725709915161133, "step": 70 }, { "epoch": 0.0034285714285714284, "grad_norm": 0.3784787356853485, "learning_rate": 0.024000000208616257, "loss": 5.686314582824707, "step": 72 }, { "epoch": 0.0035238095238095237, "grad_norm": 0.4787817597389221, "learning_rate": 0.024000000208616257, "loss": 5.597344398498535, "step": 74 }, { "epoch": 0.003619047619047619, "grad_norm": 0.40686413645744324, "learning_rate": 0.024000000208616257, "loss": 5.596353530883789, "step": 76 }, { "epoch": 0.0037142857142857142, "grad_norm": 0.5109027028083801, "learning_rate": 0.024000000208616257, "loss": 5.512279510498047, "step": 78 }, { "epoch": 0.0038095238095238095, "grad_norm": 0.3989114463329315, "learning_rate": 0.024000000208616257, "loss": 5.525890350341797, "step": 80 }, { "epoch": 0.003904761904761905, "grad_norm": 0.3629150688648224, "learning_rate": 0.024000000208616257, "loss": 5.484899520874023, "step": 82 }, { "epoch": 0.004, "grad_norm": 0.40528976917266846, "learning_rate": 0.024000000208616257, "loss": 5.402684688568115, "step": 84 }, { "epoch": 0.004095238095238095, "grad_norm": 0.44190651178359985, "learning_rate": 0.024000000208616257, "loss": 5.365906715393066, "step": 86 }, { "epoch": 0.004190476190476191, "grad_norm": 0.38514354825019836, "learning_rate": 0.024000000208616257, "loss": 5.36356258392334, "step": 88 }, { "epoch": 0.004285714285714286, "grad_norm": 0.37013643980026245, "learning_rate": 0.024000000208616257, "loss": 5.330933570861816, "step": 90 }, { "epoch": 0.004380952380952381, "grad_norm": 0.370812326669693, "learning_rate": 0.024000000208616257, "loss": 5.225103378295898, "step": 92 }, { "epoch": 0.0044761904761904765, "grad_norm": 0.32646599411964417, "learning_rate": 0.024000000208616257, "loss": 5.223209381103516, "step": 94 }, { "epoch": 0.004571428571428572, "grad_norm": 0.42137834429740906, "learning_rate": 0.024000000208616257, "loss": 5.143673419952393, "step": 96 }, { "epoch": 0.004666666666666667, "grad_norm": 0.34391850233078003, "learning_rate": 0.024000000208616257, "loss": 5.172023773193359, "step": 98 }, { "epoch": 0.004761904761904762, "grad_norm": 0.40263113379478455, "learning_rate": 0.024000000208616257, "loss": 5.13016414642334, "step": 100 }, { "epoch": 0.004857142857142857, "grad_norm": 0.3414495885372162, "learning_rate": 0.024000000208616257, "loss": 5.08735466003418, "step": 102 }, { "epoch": 0.004952380952380952, "grad_norm": 0.3308958113193512, "learning_rate": 0.024000000208616257, "loss": 4.9940595626831055, "step": 104 }, { "epoch": 0.005047619047619047, "grad_norm": 0.35891515016555786, "learning_rate": 0.024000000208616257, "loss": 5.052173614501953, "step": 106 }, { "epoch": 0.005142857142857143, "grad_norm": 0.3349107801914215, "learning_rate": 0.024000000208616257, "loss": 4.994757652282715, "step": 108 }, { "epoch": 0.005238095238095238, "grad_norm": 0.321865439414978, "learning_rate": 0.024000000208616257, "loss": 4.981725692749023, "step": 110 }, { "epoch": 0.005333333333333333, "grad_norm": 0.3503016233444214, "learning_rate": 0.024000000208616257, "loss": 4.932741165161133, "step": 112 }, { "epoch": 0.0054285714285714284, "grad_norm": 0.28275245428085327, "learning_rate": 0.024000000208616257, "loss": 4.885126113891602, "step": 114 }, { "epoch": 0.005523809523809524, "grad_norm": 0.2764172852039337, "learning_rate": 0.024000000208616257, "loss": 4.904468536376953, "step": 116 }, { "epoch": 0.005619047619047619, "grad_norm": 0.2603635787963867, "learning_rate": 0.024000000208616257, "loss": 4.8304901123046875, "step": 118 }, { "epoch": 0.005714285714285714, "grad_norm": 0.30044037103652954, "learning_rate": 0.024000000208616257, "loss": 4.82453727722168, "step": 120 }, { "epoch": 0.0058095238095238096, "grad_norm": 0.26797524094581604, "learning_rate": 0.024000000208616257, "loss": 4.775590896606445, "step": 122 }, { "epoch": 0.005904761904761905, "grad_norm": 0.22359897196292877, "learning_rate": 0.024000000208616257, "loss": 4.801427841186523, "step": 124 }, { "epoch": 0.006, "grad_norm": 0.22624699771404266, "learning_rate": 0.024000000208616257, "loss": 4.7194647789001465, "step": 126 }, { "epoch": 0.006095238095238095, "grad_norm": 0.25256356596946716, "learning_rate": 0.024000000208616257, "loss": 4.714766502380371, "step": 128 }, { "epoch": 0.006190476190476191, "grad_norm": 0.2946987450122833, "learning_rate": 0.024000000208616257, "loss": 4.684695720672607, "step": 130 }, { "epoch": 0.006285714285714286, "grad_norm": 0.23077909648418427, "learning_rate": 0.024000000208616257, "loss": 4.619433403015137, "step": 132 }, { "epoch": 0.006380952380952381, "grad_norm": 0.26244816184043884, "learning_rate": 0.024000000208616257, "loss": 4.630702972412109, "step": 134 }, { "epoch": 0.0064761904761904765, "grad_norm": 0.2738366723060608, "learning_rate": 0.024000000208616257, "loss": 4.590965270996094, "step": 136 }, { "epoch": 0.006571428571428572, "grad_norm": 0.2275918424129486, "learning_rate": 0.024000000208616257, "loss": 4.600028991699219, "step": 138 }, { "epoch": 0.006666666666666667, "grad_norm": 0.226734459400177, "learning_rate": 0.024000000208616257, "loss": 4.577237129211426, "step": 140 }, { "epoch": 0.0067619047619047615, "grad_norm": 0.23907658457756042, "learning_rate": 0.024000000208616257, "loss": 4.585365295410156, "step": 142 }, { "epoch": 0.006857142857142857, "grad_norm": 0.24208958446979523, "learning_rate": 0.024000000208616257, "loss": 4.519833564758301, "step": 144 }, { "epoch": 0.006952380952380952, "grad_norm": 0.22431696951389313, "learning_rate": 0.024000000208616257, "loss": 4.502078533172607, "step": 146 }, { "epoch": 0.007047619047619047, "grad_norm": 0.20942296087741852, "learning_rate": 0.024000000208616257, "loss": 4.443584442138672, "step": 148 }, { "epoch": 0.007142857142857143, "grad_norm": 0.1971714198589325, "learning_rate": 0.024000000208616257, "loss": 4.461605548858643, "step": 150 }, { "epoch": 0.007238095238095238, "grad_norm": 0.206486776471138, "learning_rate": 0.024000000208616257, "loss": 4.456093788146973, "step": 152 }, { "epoch": 0.007333333333333333, "grad_norm": 0.1869850605726242, "learning_rate": 0.024000000208616257, "loss": 4.357968330383301, "step": 154 }, { "epoch": 0.0074285714285714285, "grad_norm": 0.18810655176639557, "learning_rate": 0.024000000208616257, "loss": 4.3473358154296875, "step": 156 }, { "epoch": 0.007523809523809524, "grad_norm": 0.18723595142364502, "learning_rate": 0.024000000208616257, "loss": 4.243231773376465, "step": 158 }, { "epoch": 0.007619047619047619, "grad_norm": 0.22764718532562256, "learning_rate": 0.024000000208616257, "loss": 4.338347911834717, "step": 160 }, { "epoch": 0.007714285714285714, "grad_norm": 0.18891257047653198, "learning_rate": 0.024000000208616257, "loss": 4.256882667541504, "step": 162 }, { "epoch": 0.00780952380952381, "grad_norm": 0.18442027270793915, "learning_rate": 0.024000000208616257, "loss": 4.249155044555664, "step": 164 }, { "epoch": 0.007904761904761904, "grad_norm": 0.2203933149576187, "learning_rate": 0.024000000208616257, "loss": 4.244586944580078, "step": 166 }, { "epoch": 0.008, "grad_norm": 0.19718140363693237, "learning_rate": 0.024000000208616257, "loss": 4.2194719314575195, "step": 168 }, { "epoch": 0.008095238095238095, "grad_norm": 0.19148792326450348, "learning_rate": 0.024000000208616257, "loss": 4.12512731552124, "step": 170 }, { "epoch": 0.00819047619047619, "grad_norm": 0.2063865214586258, "learning_rate": 0.024000000208616257, "loss": 4.138655662536621, "step": 172 }, { "epoch": 0.008285714285714285, "grad_norm": 0.19589954614639282, "learning_rate": 0.024000000208616257, "loss": 4.122981548309326, "step": 174 }, { "epoch": 0.008380952380952381, "grad_norm": 0.17040422558784485, "learning_rate": 0.024000000208616257, "loss": 4.120534420013428, "step": 176 }, { "epoch": 0.008476190476190476, "grad_norm": 0.16039830446243286, "learning_rate": 0.024000000208616257, "loss": 4.031489372253418, "step": 178 }, { "epoch": 0.008571428571428572, "grad_norm": 0.17483080923557281, "learning_rate": 0.024000000208616257, "loss": 4.093786239624023, "step": 180 }, { "epoch": 0.008666666666666666, "grad_norm": 0.18141613900661469, "learning_rate": 0.024000000208616257, "loss": 4.060184478759766, "step": 182 }, { "epoch": 0.008761904761904762, "grad_norm": 0.20803888142108917, "learning_rate": 0.024000000208616257, "loss": 4.038195610046387, "step": 184 }, { "epoch": 0.008857142857142857, "grad_norm": 0.20504431426525116, "learning_rate": 0.024000000208616257, "loss": 4.010971546173096, "step": 186 }, { "epoch": 0.008952380952380953, "grad_norm": 0.2211029976606369, "learning_rate": 0.024000000208616257, "loss": 4.010530471801758, "step": 188 }, { "epoch": 0.009047619047619047, "grad_norm": 0.16161268949508667, "learning_rate": 0.024000000208616257, "loss": 3.956794261932373, "step": 190 }, { "epoch": 0.009142857142857144, "grad_norm": 0.17623260617256165, "learning_rate": 0.024000000208616257, "loss": 3.981397867202759, "step": 192 }, { "epoch": 0.009238095238095238, "grad_norm": 0.16728992760181427, "learning_rate": 0.024000000208616257, "loss": 3.931537628173828, "step": 194 }, { "epoch": 0.009333333333333334, "grad_norm": 0.14352665841579437, "learning_rate": 0.024000000208616257, "loss": 3.9382262229919434, "step": 196 }, { "epoch": 0.009428571428571429, "grad_norm": 0.17751771211624146, "learning_rate": 0.024000000208616257, "loss": 3.9443423748016357, "step": 198 }, { "epoch": 0.009523809523809525, "grad_norm": 0.18594537675380707, "learning_rate": 0.024000000208616257, "loss": 3.898176431655884, "step": 200 }, { "epoch": 0.009619047619047619, "grad_norm": 0.16507096588611603, "learning_rate": 0.024000000208616257, "loss": 3.8557991981506348, "step": 202 }, { "epoch": 0.009714285714285713, "grad_norm": 0.15689560770988464, "learning_rate": 0.024000000208616257, "loss": 3.8919527530670166, "step": 204 }, { "epoch": 0.00980952380952381, "grad_norm": 0.16706326603889465, "learning_rate": 0.024000000208616257, "loss": 3.8841633796691895, "step": 206 }, { "epoch": 0.009904761904761904, "grad_norm": 0.16349129378795624, "learning_rate": 0.024000000208616257, "loss": 3.871731758117676, "step": 208 }, { "epoch": 0.01, "grad_norm": 0.15250366926193237, "learning_rate": 0.024000000208616257, "loss": 3.835054874420166, "step": 210 }, { "epoch": 0.010095238095238095, "grad_norm": 0.14798583090305328, "learning_rate": 0.024000000208616257, "loss": 3.8407793045043945, "step": 212 }, { "epoch": 0.01019047619047619, "grad_norm": 0.1303013116121292, "learning_rate": 0.024000000208616257, "loss": 3.8467090129852295, "step": 214 }, { "epoch": 0.010285714285714285, "grad_norm": 0.14930962026119232, "learning_rate": 0.024000000208616257, "loss": 3.826352596282959, "step": 216 }, { "epoch": 0.010380952380952381, "grad_norm": 0.13380160927772522, "learning_rate": 0.024000000208616257, "loss": 3.803123712539673, "step": 218 }, { "epoch": 0.010476190476190476, "grad_norm": 0.13185061514377594, "learning_rate": 0.024000000208616257, "loss": 3.764822483062744, "step": 220 }, { "epoch": 0.010571428571428572, "grad_norm": 0.13195107877254486, "learning_rate": 0.024000000208616257, "loss": 3.7949039936065674, "step": 222 }, { "epoch": 0.010666666666666666, "grad_norm": 0.13089139759540558, "learning_rate": 0.024000000208616257, "loss": 3.7087113857269287, "step": 224 }, { "epoch": 0.010761904761904762, "grad_norm": 0.13606908917427063, "learning_rate": 0.024000000208616257, "loss": 3.7712719440460205, "step": 226 }, { "epoch": 0.010857142857142857, "grad_norm": 0.1236468106508255, "learning_rate": 0.024000000208616257, "loss": 3.704202651977539, "step": 228 }, { "epoch": 0.010952380952380953, "grad_norm": 0.13038469851016998, "learning_rate": 0.024000000208616257, "loss": 3.735424518585205, "step": 230 }, { "epoch": 0.011047619047619047, "grad_norm": 0.13107383251190186, "learning_rate": 0.024000000208616257, "loss": 3.7293262481689453, "step": 232 }, { "epoch": 0.011142857142857144, "grad_norm": 0.12255515158176422, "learning_rate": 0.024000000208616257, "loss": 3.7370452880859375, "step": 234 }, { "epoch": 0.011238095238095238, "grad_norm": 0.12898030877113342, "learning_rate": 0.024000000208616257, "loss": 3.721784830093384, "step": 236 }, { "epoch": 0.011333333333333334, "grad_norm": 0.14469777047634125, "learning_rate": 0.024000000208616257, "loss": 3.7427377700805664, "step": 238 }, { "epoch": 0.011428571428571429, "grad_norm": 0.1504635214805603, "learning_rate": 0.024000000208616257, "loss": 3.6971869468688965, "step": 240 }, { "epoch": 0.011523809523809523, "grad_norm": 0.1295986771583557, "learning_rate": 0.024000000208616257, "loss": 3.7021772861480713, "step": 242 }, { "epoch": 0.011619047619047619, "grad_norm": 0.14498457312583923, "learning_rate": 0.024000000208616257, "loss": 3.689133405685425, "step": 244 }, { "epoch": 0.011714285714285714, "grad_norm": 0.15880340337753296, "learning_rate": 0.024000000208616257, "loss": 3.6457457542419434, "step": 246 }, { "epoch": 0.01180952380952381, "grad_norm": 0.12845812737941742, "learning_rate": 0.024000000208616257, "loss": 3.6668453216552734, "step": 248 }, { "epoch": 0.011904761904761904, "grad_norm": 0.11414748430252075, "learning_rate": 0.024000000208616257, "loss": 3.672318935394287, "step": 250 }, { "epoch": 0.012, "grad_norm": 0.10975576192140579, "learning_rate": 0.024000000208616257, "loss": 3.6713898181915283, "step": 252 }, { "epoch": 0.012095238095238095, "grad_norm": 0.11887271702289581, "learning_rate": 0.024000000208616257, "loss": 3.632063865661621, "step": 254 }, { "epoch": 0.01219047619047619, "grad_norm": 0.11623682081699371, "learning_rate": 0.024000000208616257, "loss": 3.6583919525146484, "step": 256 }, { "epoch": 0.012285714285714285, "grad_norm": 0.15844392776489258, "learning_rate": 0.024000000208616257, "loss": 3.615412712097168, "step": 258 }, { "epoch": 0.012380952380952381, "grad_norm": 0.1317964494228363, "learning_rate": 0.024000000208616257, "loss": 3.6437807083129883, "step": 260 }, { "epoch": 0.012476190476190476, "grad_norm": 0.14390750229358673, "learning_rate": 0.024000000208616257, "loss": 3.6259701251983643, "step": 262 }, { "epoch": 0.012571428571428572, "grad_norm": 0.1169910803437233, "learning_rate": 0.024000000208616257, "loss": 3.637897491455078, "step": 264 }, { "epoch": 0.012666666666666666, "grad_norm": 0.11459456384181976, "learning_rate": 0.024000000208616257, "loss": 3.611710786819458, "step": 266 }, { "epoch": 0.012761904761904763, "grad_norm": 0.11044281721115112, "learning_rate": 0.024000000208616257, "loss": 3.613513231277466, "step": 268 }, { "epoch": 0.012857142857142857, "grad_norm": 0.10898206382989883, "learning_rate": 0.024000000208616257, "loss": 3.593027353286743, "step": 270 }, { "epoch": 0.012952380952380953, "grad_norm": 0.1149030476808548, "learning_rate": 0.024000000208616257, "loss": 3.621788501739502, "step": 272 }, { "epoch": 0.013047619047619047, "grad_norm": 0.1170446127653122, "learning_rate": 0.024000000208616257, "loss": 3.610743999481201, "step": 274 }, { "epoch": 0.013142857142857144, "grad_norm": 0.13015896081924438, "learning_rate": 0.024000000208616257, "loss": 3.578035354614258, "step": 276 }, { "epoch": 0.013238095238095238, "grad_norm": 0.11585091799497604, "learning_rate": 0.024000000208616257, "loss": 3.5824408531188965, "step": 278 }, { "epoch": 0.013333333333333334, "grad_norm": 0.12804314494132996, "learning_rate": 0.024000000208616257, "loss": 3.546003818511963, "step": 280 }, { "epoch": 0.013428571428571429, "grad_norm": 0.12476787716150284, "learning_rate": 0.024000000208616257, "loss": 3.5286173820495605, "step": 282 }, { "epoch": 0.013523809523809523, "grad_norm": 0.1275377720594406, "learning_rate": 0.024000000208616257, "loss": 3.5649986267089844, "step": 284 }, { "epoch": 0.01361904761904762, "grad_norm": 0.1443047970533371, "learning_rate": 0.024000000208616257, "loss": 3.534911870956421, "step": 286 }, { "epoch": 0.013714285714285714, "grad_norm": 0.126201793551445, "learning_rate": 0.024000000208616257, "loss": 3.5897974967956543, "step": 288 }, { "epoch": 0.01380952380952381, "grad_norm": 0.14978854358196259, "learning_rate": 0.024000000208616257, "loss": 3.5548784732818604, "step": 290 }, { "epoch": 0.013904761904761904, "grad_norm": 0.12638816237449646, "learning_rate": 0.024000000208616257, "loss": 3.537980794906616, "step": 292 }, { "epoch": 0.014, "grad_norm": 0.12399981170892715, "learning_rate": 0.024000000208616257, "loss": 3.5440704822540283, "step": 294 }, { "epoch": 0.014095238095238095, "grad_norm": 0.13476406037807465, "learning_rate": 0.024000000208616257, "loss": 3.5361413955688477, "step": 296 }, { "epoch": 0.01419047619047619, "grad_norm": 0.11274745315313339, "learning_rate": 0.024000000208616257, "loss": 3.5662314891815186, "step": 298 }, { "epoch": 0.014285714285714285, "grad_norm": 0.10571589320898056, "learning_rate": 0.024000000208616257, "loss": 3.549699068069458, "step": 300 }, { "epoch": 0.014380952380952381, "grad_norm": 0.11887554079294205, "learning_rate": 0.024000000208616257, "loss": 3.5678656101226807, "step": 302 }, { "epoch": 0.014476190476190476, "grad_norm": 0.11401069164276123, "learning_rate": 0.024000000208616257, "loss": 3.5054450035095215, "step": 304 }, { "epoch": 0.014571428571428572, "grad_norm": 0.11524013429880142, "learning_rate": 0.024000000208616257, "loss": 3.521726369857788, "step": 306 }, { "epoch": 0.014666666666666666, "grad_norm": 0.11810661852359772, "learning_rate": 0.024000000208616257, "loss": 3.503756523132324, "step": 308 }, { "epoch": 0.014761904761904763, "grad_norm": 0.1283569484949112, "learning_rate": 0.024000000208616257, "loss": 3.505880355834961, "step": 310 }, { "epoch": 0.014857142857142857, "grad_norm": 0.10811018943786621, "learning_rate": 0.024000000208616257, "loss": 3.4756155014038086, "step": 312 }, { "epoch": 0.014952380952380953, "grad_norm": 0.11082758754491806, "learning_rate": 0.024000000208616257, "loss": 3.496945858001709, "step": 314 }, { "epoch": 0.015047619047619048, "grad_norm": 0.11726303398609161, "learning_rate": 0.024000000208616257, "loss": 3.473219156265259, "step": 316 }, { "epoch": 0.015142857142857144, "grad_norm": 0.10839106887578964, "learning_rate": 0.024000000208616257, "loss": 3.4745240211486816, "step": 318 }, { "epoch": 0.015238095238095238, "grad_norm": 0.1077137365937233, "learning_rate": 0.024000000208616257, "loss": 3.5088939666748047, "step": 320 }, { "epoch": 0.015333333333333332, "grad_norm": 0.12155335396528244, "learning_rate": 0.024000000208616257, "loss": 3.4618678092956543, "step": 322 }, { "epoch": 0.015428571428571429, "grad_norm": 0.10906599462032318, "learning_rate": 0.024000000208616257, "loss": 3.5050854682922363, "step": 324 }, { "epoch": 0.015523809523809523, "grad_norm": 0.11417632550001144, "learning_rate": 0.024000000208616257, "loss": 3.4578499794006348, "step": 326 }, { "epoch": 0.01561904761904762, "grad_norm": 0.09178224205970764, "learning_rate": 0.024000000208616257, "loss": 3.4617133140563965, "step": 328 }, { "epoch": 0.015714285714285715, "grad_norm": 0.1029578447341919, "learning_rate": 0.024000000208616257, "loss": 3.473824977874756, "step": 330 }, { "epoch": 0.015809523809523808, "grad_norm": 0.10480651259422302, "learning_rate": 0.024000000208616257, "loss": 3.4425692558288574, "step": 332 }, { "epoch": 0.015904761904761904, "grad_norm": 0.09576138854026794, "learning_rate": 0.024000000208616257, "loss": 3.4444570541381836, "step": 334 }, { "epoch": 0.016, "grad_norm": 0.10579310357570648, "learning_rate": 0.024000000208616257, "loss": 3.4755492210388184, "step": 336 }, { "epoch": 0.016095238095238096, "grad_norm": 0.11131022870540619, "learning_rate": 0.024000000208616257, "loss": 3.4358997344970703, "step": 338 }, { "epoch": 0.01619047619047619, "grad_norm": 0.11613092571496964, "learning_rate": 0.024000000208616257, "loss": 3.4474031925201416, "step": 340 }, { "epoch": 0.016285714285714285, "grad_norm": 0.10332045704126358, "learning_rate": 0.024000000208616257, "loss": 3.4534311294555664, "step": 342 }, { "epoch": 0.01638095238095238, "grad_norm": 0.10366816073656082, "learning_rate": 0.024000000208616257, "loss": 3.429917335510254, "step": 344 }, { "epoch": 0.016476190476190478, "grad_norm": 0.10107503831386566, "learning_rate": 0.024000000208616257, "loss": 3.4414310455322266, "step": 346 }, { "epoch": 0.01657142857142857, "grad_norm": 0.10653431713581085, "learning_rate": 0.024000000208616257, "loss": 3.451590061187744, "step": 348 }, { "epoch": 0.016666666666666666, "grad_norm": 0.09354981780052185, "learning_rate": 0.024000000208616257, "loss": 3.47836971282959, "step": 350 }, { "epoch": 0.016761904761904763, "grad_norm": 0.10947000980377197, "learning_rate": 0.024000000208616257, "loss": 3.4158945083618164, "step": 352 }, { "epoch": 0.01685714285714286, "grad_norm": 0.10842986404895782, "learning_rate": 0.024000000208616257, "loss": 3.4518861770629883, "step": 354 }, { "epoch": 0.01695238095238095, "grad_norm": 0.09586591273546219, "learning_rate": 0.024000000208616257, "loss": 3.412656307220459, "step": 356 }, { "epoch": 0.017047619047619048, "grad_norm": 0.12009255588054657, "learning_rate": 0.024000000208616257, "loss": 3.439100742340088, "step": 358 }, { "epoch": 0.017142857142857144, "grad_norm": 0.12858207523822784, "learning_rate": 0.024000000208616257, "loss": 3.450693130493164, "step": 360 }, { "epoch": 0.017238095238095236, "grad_norm": 0.0911901518702507, "learning_rate": 0.024000000208616257, "loss": 3.4140405654907227, "step": 362 }, { "epoch": 0.017333333333333333, "grad_norm": 0.09317584335803986, "learning_rate": 0.024000000208616257, "loss": 3.4227757453918457, "step": 364 }, { "epoch": 0.01742857142857143, "grad_norm": 0.09875544905662537, "learning_rate": 0.024000000208616257, "loss": 3.4036762714385986, "step": 366 }, { "epoch": 0.017523809523809525, "grad_norm": 0.09594345837831497, "learning_rate": 0.024000000208616257, "loss": 3.4147934913635254, "step": 368 }, { "epoch": 0.017619047619047618, "grad_norm": 0.09612176567316055, "learning_rate": 0.024000000208616257, "loss": 3.4124817848205566, "step": 370 }, { "epoch": 0.017714285714285714, "grad_norm": 0.11377938836812973, "learning_rate": 0.024000000208616257, "loss": 3.394390821456909, "step": 372 }, { "epoch": 0.01780952380952381, "grad_norm": 0.1012466698884964, "learning_rate": 0.024000000208616257, "loss": 3.3811049461364746, "step": 374 }, { "epoch": 0.017904761904761906, "grad_norm": 0.10026443749666214, "learning_rate": 0.024000000208616257, "loss": 3.375251531600952, "step": 376 }, { "epoch": 0.018, "grad_norm": 0.09609606117010117, "learning_rate": 0.024000000208616257, "loss": 3.377617120742798, "step": 378 }, { "epoch": 0.018095238095238095, "grad_norm": 0.09122078120708466, "learning_rate": 0.024000000208616257, "loss": 3.3962011337280273, "step": 380 }, { "epoch": 0.01819047619047619, "grad_norm": 0.10296985507011414, "learning_rate": 0.024000000208616257, "loss": 3.4071035385131836, "step": 382 }, { "epoch": 0.018285714285714287, "grad_norm": 0.09579654037952423, "learning_rate": 0.024000000208616257, "loss": 3.4162230491638184, "step": 384 }, { "epoch": 0.01838095238095238, "grad_norm": 0.09958939999341965, "learning_rate": 0.024000000208616257, "loss": 3.399854898452759, "step": 386 }, { "epoch": 0.018476190476190476, "grad_norm": 0.10002212971448898, "learning_rate": 0.024000000208616257, "loss": 3.3855652809143066, "step": 388 }, { "epoch": 0.018571428571428572, "grad_norm": 0.08823107928037643, "learning_rate": 0.024000000208616257, "loss": 3.378729820251465, "step": 390 }, { "epoch": 0.018666666666666668, "grad_norm": 0.09617450088262558, "learning_rate": 0.024000000208616257, "loss": 3.3953237533569336, "step": 392 }, { "epoch": 0.01876190476190476, "grad_norm": 0.104954794049263, "learning_rate": 0.024000000208616257, "loss": 3.3744618892669678, "step": 394 }, { "epoch": 0.018857142857142857, "grad_norm": 0.09269546717405319, "learning_rate": 0.024000000208616257, "loss": 3.368316173553467, "step": 396 }, { "epoch": 0.018952380952380953, "grad_norm": 0.11259199678897858, "learning_rate": 0.024000000208616257, "loss": 3.339540958404541, "step": 398 }, { "epoch": 0.01904761904761905, "grad_norm": 0.0991843044757843, "learning_rate": 0.024000000208616257, "loss": 3.3897652626037598, "step": 400 }, { "epoch": 0.019142857142857142, "grad_norm": 0.0994994193315506, "learning_rate": 0.024000000208616257, "loss": 3.376940965652466, "step": 402 }, { "epoch": 0.019238095238095238, "grad_norm": 0.09660818427801132, "learning_rate": 0.024000000208616257, "loss": 3.3687825202941895, "step": 404 }, { "epoch": 0.019333333333333334, "grad_norm": 0.0863373652100563, "learning_rate": 0.024000000208616257, "loss": 3.3705267906188965, "step": 406 }, { "epoch": 0.019428571428571427, "grad_norm": 0.09684601426124573, "learning_rate": 0.024000000208616257, "loss": 3.375084638595581, "step": 408 }, { "epoch": 0.019523809523809523, "grad_norm": 0.10115697234869003, "learning_rate": 0.024000000208616257, "loss": 3.351313591003418, "step": 410 }, { "epoch": 0.01961904761904762, "grad_norm": 0.08989071846008301, "learning_rate": 0.024000000208616257, "loss": 3.356839179992676, "step": 412 }, { "epoch": 0.019714285714285715, "grad_norm": 0.0900016501545906, "learning_rate": 0.024000000208616257, "loss": 3.327641487121582, "step": 414 }, { "epoch": 0.019809523809523808, "grad_norm": 0.09114416688680649, "learning_rate": 0.024000000208616257, "loss": 3.3325247764587402, "step": 416 }, { "epoch": 0.019904761904761904, "grad_norm": 0.10203016549348831, "learning_rate": 0.024000000208616257, "loss": 3.363564968109131, "step": 418 }, { "epoch": 0.02, "grad_norm": 0.09062886983156204, "learning_rate": 0.024000000208616257, "loss": 3.3132519721984863, "step": 420 }, { "epoch": 0.020095238095238097, "grad_norm": 0.10633069276809692, "learning_rate": 0.024000000208616257, "loss": 3.369839668273926, "step": 422 }, { "epoch": 0.02019047619047619, "grad_norm": 0.09011076390743256, "learning_rate": 0.024000000208616257, "loss": 3.3549909591674805, "step": 424 }, { "epoch": 0.020285714285714285, "grad_norm": 0.10212909430265427, "learning_rate": 0.024000000208616257, "loss": 3.364309787750244, "step": 426 }, { "epoch": 0.02038095238095238, "grad_norm": 0.10170941799879074, "learning_rate": 0.024000000208616257, "loss": 3.338170051574707, "step": 428 }, { "epoch": 0.020476190476190478, "grad_norm": 0.08958912640810013, "learning_rate": 0.024000000208616257, "loss": 3.3482747077941895, "step": 430 }, { "epoch": 0.02057142857142857, "grad_norm": 0.0949966311454773, "learning_rate": 0.024000000208616257, "loss": 3.358294725418091, "step": 432 }, { "epoch": 0.020666666666666667, "grad_norm": 0.0901513397693634, "learning_rate": 0.024000000208616257, "loss": 3.353799343109131, "step": 434 }, { "epoch": 0.020761904761904763, "grad_norm": 0.09647983312606812, "learning_rate": 0.024000000208616257, "loss": 3.3723888397216797, "step": 436 }, { "epoch": 0.02085714285714286, "grad_norm": 0.09669607877731323, "learning_rate": 0.024000000208616257, "loss": 3.3483431339263916, "step": 438 }, { "epoch": 0.02095238095238095, "grad_norm": 0.08591976016759872, "learning_rate": 0.024000000208616257, "loss": 3.3569095134735107, "step": 440 }, { "epoch": 0.021047619047619048, "grad_norm": 0.08637959510087967, "learning_rate": 0.024000000208616257, "loss": 3.3328800201416016, "step": 442 }, { "epoch": 0.021142857142857144, "grad_norm": 0.09086910635232925, "learning_rate": 0.024000000208616257, "loss": 3.332063913345337, "step": 444 }, { "epoch": 0.021238095238095236, "grad_norm": 0.08502456545829773, "learning_rate": 0.024000000208616257, "loss": 3.352468252182007, "step": 446 }, { "epoch": 0.021333333333333333, "grad_norm": 0.08834676444530487, "learning_rate": 0.024000000208616257, "loss": 3.353539228439331, "step": 448 }, { "epoch": 0.02142857142857143, "grad_norm": 0.09138694405555725, "learning_rate": 0.024000000208616257, "loss": 3.3436567783355713, "step": 450 }, { "epoch": 0.021523809523809525, "grad_norm": 0.10472003370523453, "learning_rate": 0.024000000208616257, "loss": 3.327854633331299, "step": 452 }, { "epoch": 0.021619047619047618, "grad_norm": 0.09763047099113464, "learning_rate": 0.024000000208616257, "loss": 3.324946641921997, "step": 454 }, { "epoch": 0.021714285714285714, "grad_norm": 0.09421174228191376, "learning_rate": 0.024000000208616257, "loss": 3.3445773124694824, "step": 456 }, { "epoch": 0.02180952380952381, "grad_norm": 0.09068513661623001, "learning_rate": 0.024000000208616257, "loss": 3.3250272274017334, "step": 458 }, { "epoch": 0.021904761904761906, "grad_norm": 0.08916594833135605, "learning_rate": 0.024000000208616257, "loss": 3.3360986709594727, "step": 460 }, { "epoch": 0.022, "grad_norm": 0.10518743097782135, "learning_rate": 0.024000000208616257, "loss": 3.339228630065918, "step": 462 }, { "epoch": 0.022095238095238095, "grad_norm": 0.08912716805934906, "learning_rate": 0.024000000208616257, "loss": 3.3741464614868164, "step": 464 }, { "epoch": 0.02219047619047619, "grad_norm": 0.08554211258888245, "learning_rate": 0.024000000208616257, "loss": 3.3536620140075684, "step": 466 }, { "epoch": 0.022285714285714287, "grad_norm": 0.09278947860002518, "learning_rate": 0.024000000208616257, "loss": 3.2817907333374023, "step": 468 }, { "epoch": 0.02238095238095238, "grad_norm": 0.09330140799283981, "learning_rate": 0.024000000208616257, "loss": 3.340385913848877, "step": 470 }, { "epoch": 0.022476190476190476, "grad_norm": 0.08844682574272156, "learning_rate": 0.024000000208616257, "loss": 3.30399751663208, "step": 472 }, { "epoch": 0.022571428571428572, "grad_norm": 0.08637949079275131, "learning_rate": 0.024000000208616257, "loss": 3.316169261932373, "step": 474 }, { "epoch": 0.02266666666666667, "grad_norm": 0.0865374282002449, "learning_rate": 0.024000000208616257, "loss": 3.337653160095215, "step": 476 }, { "epoch": 0.02276190476190476, "grad_norm": 0.09139890968799591, "learning_rate": 0.024000000208616257, "loss": 3.3410844802856445, "step": 478 }, { "epoch": 0.022857142857142857, "grad_norm": 0.09083344042301178, "learning_rate": 0.024000000208616257, "loss": 3.3579235076904297, "step": 480 }, { "epoch": 0.022952380952380953, "grad_norm": 0.09038805216550827, "learning_rate": 0.024000000208616257, "loss": 3.313967704772949, "step": 482 }, { "epoch": 0.023047619047619046, "grad_norm": 0.08872606605291367, "learning_rate": 0.024000000208616257, "loss": 3.3254542350769043, "step": 484 }, { "epoch": 0.023142857142857142, "grad_norm": 0.0929810181260109, "learning_rate": 0.024000000208616257, "loss": 3.325802803039551, "step": 486 }, { "epoch": 0.023238095238095238, "grad_norm": 0.09297630190849304, "learning_rate": 0.024000000208616257, "loss": 3.3549675941467285, "step": 488 }, { "epoch": 0.023333333333333334, "grad_norm": 0.08241813629865646, "learning_rate": 0.024000000208616257, "loss": 3.3219852447509766, "step": 490 }, { "epoch": 0.023428571428571427, "grad_norm": 0.09606776386499405, "learning_rate": 0.024000000208616257, "loss": 3.3519091606140137, "step": 492 }, { "epoch": 0.023523809523809523, "grad_norm": 0.09051039069890976, "learning_rate": 0.024000000208616257, "loss": 3.303131103515625, "step": 494 }, { "epoch": 0.02361904761904762, "grad_norm": 0.09041043370962143, "learning_rate": 0.024000000208616257, "loss": 3.341622829437256, "step": 496 }, { "epoch": 0.023714285714285716, "grad_norm": 0.08397683501243591, "learning_rate": 0.024000000208616257, "loss": 3.28572678565979, "step": 498 }, { "epoch": 0.023809523809523808, "grad_norm": 0.08695260435342789, "learning_rate": 0.024000000208616257, "loss": 3.2822513580322266, "step": 500 }, { "epoch": 0.023904761904761904, "grad_norm": 0.09433641284704208, "learning_rate": 0.024000000208616257, "loss": 3.3121323585510254, "step": 502 }, { "epoch": 0.024, "grad_norm": 0.08416978269815445, "learning_rate": 0.024000000208616257, "loss": 3.3401541709899902, "step": 504 }, { "epoch": 0.024095238095238097, "grad_norm": 0.07843983173370361, "learning_rate": 0.024000000208616257, "loss": 3.3193306922912598, "step": 506 }, { "epoch": 0.02419047619047619, "grad_norm": 0.08368676155805588, "learning_rate": 0.024000000208616257, "loss": 3.3135461807250977, "step": 508 }, { "epoch": 0.024285714285714285, "grad_norm": 0.0851934403181076, "learning_rate": 0.024000000208616257, "loss": 3.314640998840332, "step": 510 }, { "epoch": 0.02438095238095238, "grad_norm": 0.08735057711601257, "learning_rate": 0.024000000208616257, "loss": 3.3325018882751465, "step": 512 }, { "epoch": 0.024476190476190478, "grad_norm": 0.08266250044107437, "learning_rate": 0.024000000208616257, "loss": 3.2619757652282715, "step": 514 }, { "epoch": 0.02457142857142857, "grad_norm": 0.09488537162542343, "learning_rate": 0.024000000208616257, "loss": 3.3159022331237793, "step": 516 }, { "epoch": 0.024666666666666667, "grad_norm": 0.08253837376832962, "learning_rate": 0.024000000208616257, "loss": 3.2534141540527344, "step": 518 }, { "epoch": 0.024761904761904763, "grad_norm": 0.0889001190662384, "learning_rate": 0.024000000208616257, "loss": 3.312020778656006, "step": 520 }, { "epoch": 0.024857142857142855, "grad_norm": 0.09991835057735443, "learning_rate": 0.024000000208616257, "loss": 3.3071937561035156, "step": 522 }, { "epoch": 0.02495238095238095, "grad_norm": 0.08465713262557983, "learning_rate": 0.024000000208616257, "loss": 3.3195252418518066, "step": 524 }, { "epoch": 0.025047619047619048, "grad_norm": 0.08082892745733261, "learning_rate": 0.024000000208616257, "loss": 3.3125452995300293, "step": 526 }, { "epoch": 0.025142857142857144, "grad_norm": 0.08431288599967957, "learning_rate": 0.024000000208616257, "loss": 3.3238134384155273, "step": 528 }, { "epoch": 0.025238095238095237, "grad_norm": 0.0876336395740509, "learning_rate": 0.024000000208616257, "loss": 3.311713218688965, "step": 530 }, { "epoch": 0.025333333333333333, "grad_norm": 0.08943317085504532, "learning_rate": 0.024000000208616257, "loss": 3.2971935272216797, "step": 532 }, { "epoch": 0.02542857142857143, "grad_norm": 0.08404400944709778, "learning_rate": 0.024000000208616257, "loss": 3.2701122760772705, "step": 534 }, { "epoch": 0.025523809523809525, "grad_norm": 0.08375234156847, "learning_rate": 0.024000000208616257, "loss": 3.299881935119629, "step": 536 }, { "epoch": 0.025619047619047618, "grad_norm": 0.08366347849369049, "learning_rate": 0.024000000208616257, "loss": 3.2689080238342285, "step": 538 }, { "epoch": 0.025714285714285714, "grad_norm": 0.0880344957113266, "learning_rate": 0.024000000208616257, "loss": 3.286287307739258, "step": 540 }, { "epoch": 0.02580952380952381, "grad_norm": 0.08554854989051819, "learning_rate": 0.024000000208616257, "loss": 3.2822937965393066, "step": 542 }, { "epoch": 0.025904761904761906, "grad_norm": 0.09102355688810349, "learning_rate": 0.024000000208616257, "loss": 3.3268446922302246, "step": 544 }, { "epoch": 0.026, "grad_norm": 0.08388399332761765, "learning_rate": 0.024000000208616257, "loss": 3.2783405780792236, "step": 546 }, { "epoch": 0.026095238095238095, "grad_norm": 0.08136118203401566, "learning_rate": 0.024000000208616257, "loss": 3.2847094535827637, "step": 548 }, { "epoch": 0.02619047619047619, "grad_norm": 0.08426133543252945, "learning_rate": 0.024000000208616257, "loss": 3.2694313526153564, "step": 550 }, { "epoch": 0.026285714285714287, "grad_norm": 0.07826825976371765, "learning_rate": 0.024000000208616257, "loss": 3.3067517280578613, "step": 552 }, { "epoch": 0.02638095238095238, "grad_norm": 0.07997143268585205, "learning_rate": 0.024000000208616257, "loss": 3.2627696990966797, "step": 554 }, { "epoch": 0.026476190476190476, "grad_norm": 0.07255858182907104, "learning_rate": 0.024000000208616257, "loss": 3.3173160552978516, "step": 556 }, { "epoch": 0.026571428571428572, "grad_norm": 0.07426390051841736, "learning_rate": 0.024000000208616257, "loss": 3.2966771125793457, "step": 558 }, { "epoch": 0.02666666666666667, "grad_norm": 0.07563555985689163, "learning_rate": 0.024000000208616257, "loss": 3.2874350547790527, "step": 560 }, { "epoch": 0.02676190476190476, "grad_norm": 0.07340831309556961, "learning_rate": 0.024000000208616257, "loss": 3.3080782890319824, "step": 562 }, { "epoch": 0.026857142857142857, "grad_norm": 0.07890055328607559, "learning_rate": 0.024000000208616257, "loss": 3.3063645362854004, "step": 564 }, { "epoch": 0.026952380952380953, "grad_norm": 0.07918807119131088, "learning_rate": 0.024000000208616257, "loss": 3.318636417388916, "step": 566 }, { "epoch": 0.027047619047619046, "grad_norm": 0.07477977126836777, "learning_rate": 0.024000000208616257, "loss": 3.3263745307922363, "step": 568 }, { "epoch": 0.027142857142857142, "grad_norm": 0.0745420902967453, "learning_rate": 0.024000000208616257, "loss": 3.2653188705444336, "step": 570 }, { "epoch": 0.02723809523809524, "grad_norm": 0.07391494512557983, "learning_rate": 0.024000000208616257, "loss": 3.2731356620788574, "step": 572 }, { "epoch": 0.027333333333333334, "grad_norm": 0.07435967773199081, "learning_rate": 0.024000000208616257, "loss": 3.299403667449951, "step": 574 }, { "epoch": 0.027428571428571427, "grad_norm": 0.07816862314939499, "learning_rate": 0.024000000208616257, "loss": 3.292506694793701, "step": 576 }, { "epoch": 0.027523809523809523, "grad_norm": 0.07465045899152756, "learning_rate": 0.024000000208616257, "loss": 3.303959846496582, "step": 578 }, { "epoch": 0.02761904761904762, "grad_norm": 0.08007777482271194, "learning_rate": 0.024000000208616257, "loss": 3.2651515007019043, "step": 580 }, { "epoch": 0.027714285714285716, "grad_norm": 0.07768258452415466, "learning_rate": 0.024000000208616257, "loss": 3.2572450637817383, "step": 582 }, { "epoch": 0.02780952380952381, "grad_norm": 0.07689087092876434, "learning_rate": 0.024000000208616257, "loss": 3.2957043647766113, "step": 584 }, { "epoch": 0.027904761904761904, "grad_norm": 0.08504579216241837, "learning_rate": 0.024000000208616257, "loss": 3.2990970611572266, "step": 586 }, { "epoch": 0.028, "grad_norm": 0.09150636196136475, "learning_rate": 0.024000000208616257, "loss": 3.2734103202819824, "step": 588 }, { "epoch": 0.028095238095238097, "grad_norm": 0.08489084988832474, "learning_rate": 0.024000000208616257, "loss": 3.276306629180908, "step": 590 }, { "epoch": 0.02819047619047619, "grad_norm": 0.0749487578868866, "learning_rate": 0.024000000208616257, "loss": 3.284188747406006, "step": 592 }, { "epoch": 0.028285714285714286, "grad_norm": 0.07584529370069504, "learning_rate": 0.024000000208616257, "loss": 3.2419469356536865, "step": 594 }, { "epoch": 0.02838095238095238, "grad_norm": 0.0757167637348175, "learning_rate": 0.024000000208616257, "loss": 3.2719264030456543, "step": 596 }, { "epoch": 0.028476190476190478, "grad_norm": 0.08220788091421127, "learning_rate": 0.024000000208616257, "loss": 3.2787561416625977, "step": 598 }, { "epoch": 0.02857142857142857, "grad_norm": 0.07616401463747025, "learning_rate": 0.024000000208616257, "loss": 3.251516819000244, "step": 600 }, { "epoch": 0.028666666666666667, "grad_norm": 0.0860067680478096, "learning_rate": 0.024000000208616257, "loss": 3.2518413066864014, "step": 602 }, { "epoch": 0.028761904761904763, "grad_norm": 0.08446262776851654, "learning_rate": 0.024000000208616257, "loss": 3.27824330329895, "step": 604 }, { "epoch": 0.028857142857142856, "grad_norm": 0.07788730412721634, "learning_rate": 0.024000000208616257, "loss": 3.2762060165405273, "step": 606 }, { "epoch": 0.02895238095238095, "grad_norm": 0.08228492736816406, "learning_rate": 0.024000000208616257, "loss": 3.271141767501831, "step": 608 }, { "epoch": 0.029047619047619048, "grad_norm": 0.08117784559726715, "learning_rate": 0.024000000208616257, "loss": 3.268932819366455, "step": 610 }, { "epoch": 0.029142857142857144, "grad_norm": 0.07280375808477402, "learning_rate": 0.024000000208616257, "loss": 3.2373249530792236, "step": 612 }, { "epoch": 0.029238095238095237, "grad_norm": 0.07577385008335114, "learning_rate": 0.024000000208616257, "loss": 3.2347710132598877, "step": 614 }, { "epoch": 0.029333333333333333, "grad_norm": 0.07516426593065262, "learning_rate": 0.024000000208616257, "loss": 3.262713670730591, "step": 616 }, { "epoch": 0.02942857142857143, "grad_norm": 0.08333681523799896, "learning_rate": 0.024000000208616257, "loss": 3.2337334156036377, "step": 618 }, { "epoch": 0.029523809523809525, "grad_norm": 0.07921888679265976, "learning_rate": 0.024000000208616257, "loss": 3.2889490127563477, "step": 620 }, { "epoch": 0.029619047619047618, "grad_norm": 0.076380155980587, "learning_rate": 0.024000000208616257, "loss": 3.2540183067321777, "step": 622 }, { "epoch": 0.029714285714285714, "grad_norm": 0.07165036350488663, "learning_rate": 0.024000000208616257, "loss": 3.2376198768615723, "step": 624 }, { "epoch": 0.02980952380952381, "grad_norm": 0.07230059057474136, "learning_rate": 0.024000000208616257, "loss": 3.2197844982147217, "step": 626 }, { "epoch": 0.029904761904761906, "grad_norm": 0.07571039348840714, "learning_rate": 0.024000000208616257, "loss": 3.2135324478149414, "step": 628 }, { "epoch": 0.03, "grad_norm": 0.0722360759973526, "learning_rate": 0.024000000208616257, "loss": 3.2413320541381836, "step": 630 }, { "epoch": 0.030095238095238095, "grad_norm": 0.0737529769539833, "learning_rate": 0.024000000208616257, "loss": 3.237673759460449, "step": 632 }, { "epoch": 0.03019047619047619, "grad_norm": 0.0708562508225441, "learning_rate": 0.024000000208616257, "loss": 3.239184856414795, "step": 634 }, { "epoch": 0.030285714285714287, "grad_norm": 0.07465169578790665, "learning_rate": 0.024000000208616257, "loss": 3.247126340866089, "step": 636 }, { "epoch": 0.03038095238095238, "grad_norm": 0.07865563780069351, "learning_rate": 0.024000000208616257, "loss": 3.2413077354431152, "step": 638 }, { "epoch": 0.030476190476190476, "grad_norm": 0.07570512592792511, "learning_rate": 0.024000000208616257, "loss": 3.241866111755371, "step": 640 }, { "epoch": 0.030571428571428572, "grad_norm": 0.07566533982753754, "learning_rate": 0.024000000208616257, "loss": 3.230283737182617, "step": 642 }, { "epoch": 0.030666666666666665, "grad_norm": 0.07939726114273071, "learning_rate": 0.024000000208616257, "loss": 3.2430949211120605, "step": 644 }, { "epoch": 0.03076190476190476, "grad_norm": 0.07281908392906189, "learning_rate": 0.024000000208616257, "loss": 3.235027551651001, "step": 646 }, { "epoch": 0.030857142857142857, "grad_norm": 0.07376979291439056, "learning_rate": 0.024000000208616257, "loss": 3.241706132888794, "step": 648 }, { "epoch": 0.030952380952380953, "grad_norm": 0.07461351901292801, "learning_rate": 0.024000000208616257, "loss": 3.2333860397338867, "step": 650 }, { "epoch": 0.031047619047619046, "grad_norm": 0.07640799880027771, "learning_rate": 0.024000000208616257, "loss": 3.2356271743774414, "step": 652 }, { "epoch": 0.031142857142857142, "grad_norm": 0.08132467418909073, "learning_rate": 0.024000000208616257, "loss": 3.2246525287628174, "step": 654 }, { "epoch": 0.03123809523809524, "grad_norm": 0.08438136428594589, "learning_rate": 0.024000000208616257, "loss": 3.238943099975586, "step": 656 }, { "epoch": 0.03133333333333333, "grad_norm": 0.07416946440935135, "learning_rate": 0.024000000208616257, "loss": 3.1642227172851562, "step": 658 }, { "epoch": 0.03142857142857143, "grad_norm": 0.07203076034784317, "learning_rate": 0.024000000208616257, "loss": 3.229591131210327, "step": 660 }, { "epoch": 0.03152380952380952, "grad_norm": 0.06781172007322311, "learning_rate": 0.024000000208616257, "loss": 3.228139877319336, "step": 662 }, { "epoch": 0.031619047619047616, "grad_norm": 0.07503106445074081, "learning_rate": 0.024000000208616257, "loss": 3.197584629058838, "step": 664 }, { "epoch": 0.031714285714285716, "grad_norm": 0.07130474597215652, "learning_rate": 0.024000000208616257, "loss": 3.203066110610962, "step": 666 }, { "epoch": 0.03180952380952381, "grad_norm": 0.0787835493683815, "learning_rate": 0.024000000208616257, "loss": 3.2011899948120117, "step": 668 }, { "epoch": 0.03190476190476191, "grad_norm": 0.07815150171518326, "learning_rate": 0.024000000208616257, "loss": 3.1930465698242188, "step": 670 }, { "epoch": 0.032, "grad_norm": 0.07381319254636765, "learning_rate": 0.024000000208616257, "loss": 3.1839358806610107, "step": 672 }, { "epoch": 0.03209523809523809, "grad_norm": 0.07276026159524918, "learning_rate": 0.024000000208616257, "loss": 3.239224433898926, "step": 674 }, { "epoch": 0.03219047619047619, "grad_norm": 0.07294740527868271, "learning_rate": 0.024000000208616257, "loss": 3.2312121391296387, "step": 676 }, { "epoch": 0.032285714285714286, "grad_norm": 0.06824035942554474, "learning_rate": 0.024000000208616257, "loss": 3.180049419403076, "step": 678 }, { "epoch": 0.03238095238095238, "grad_norm": 0.06968836486339569, "learning_rate": 0.024000000208616257, "loss": 3.2029576301574707, "step": 680 }, { "epoch": 0.03247619047619048, "grad_norm": 0.07547624409198761, "learning_rate": 0.024000000208616257, "loss": 3.2137365341186523, "step": 682 }, { "epoch": 0.03257142857142857, "grad_norm": 0.07893373817205429, "learning_rate": 0.024000000208616257, "loss": 3.2070488929748535, "step": 684 }, { "epoch": 0.03266666666666666, "grad_norm": 0.07199888676404953, "learning_rate": 0.024000000208616257, "loss": 3.1975550651550293, "step": 686 }, { "epoch": 0.03276190476190476, "grad_norm": 0.07550406455993652, "learning_rate": 0.024000000208616257, "loss": 3.183717966079712, "step": 688 }, { "epoch": 0.032857142857142856, "grad_norm": 0.0771876648068428, "learning_rate": 0.024000000208616257, "loss": 3.2129225730895996, "step": 690 }, { "epoch": 0.032952380952380955, "grad_norm": 0.0741945430636406, "learning_rate": 0.024000000208616257, "loss": 3.217057943344116, "step": 692 }, { "epoch": 0.03304761904761905, "grad_norm": 0.08009914308786392, "learning_rate": 0.024000000208616257, "loss": 3.176427125930786, "step": 694 }, { "epoch": 0.03314285714285714, "grad_norm": 0.07615108788013458, "learning_rate": 0.024000000208616257, "loss": 3.1865429878234863, "step": 696 }, { "epoch": 0.03323809523809524, "grad_norm": 0.07548828423023224, "learning_rate": 0.024000000208616257, "loss": 3.2012887001037598, "step": 698 }, { "epoch": 0.03333333333333333, "grad_norm": 0.07466068118810654, "learning_rate": 0.024000000208616257, "loss": 3.1872074604034424, "step": 700 }, { "epoch": 0.033428571428571426, "grad_norm": 0.08404888212680817, "learning_rate": 0.024000000208616257, "loss": 3.212120532989502, "step": 702 }, { "epoch": 0.033523809523809525, "grad_norm": 0.08296217769384384, "learning_rate": 0.024000000208616257, "loss": 3.1915016174316406, "step": 704 }, { "epoch": 0.03361904761904762, "grad_norm": 0.07982564717531204, "learning_rate": 0.024000000208616257, "loss": 3.2320799827575684, "step": 706 }, { "epoch": 0.03371428571428572, "grad_norm": 0.0702260360121727, "learning_rate": 0.024000000208616257, "loss": 3.176420211791992, "step": 708 }, { "epoch": 0.03380952380952381, "grad_norm": 0.06436009705066681, "learning_rate": 0.024000000208616257, "loss": 3.1648738384246826, "step": 710 }, { "epoch": 0.0339047619047619, "grad_norm": 0.06554312258958817, "learning_rate": 0.024000000208616257, "loss": 3.177537441253662, "step": 712 }, { "epoch": 0.034, "grad_norm": 0.0696633830666542, "learning_rate": 0.024000000208616257, "loss": 3.161865711212158, "step": 714 }, { "epoch": 0.034095238095238095, "grad_norm": 0.0706041231751442, "learning_rate": 0.024000000208616257, "loss": 3.1790690422058105, "step": 716 }, { "epoch": 0.03419047619047619, "grad_norm": 0.06836401671171188, "learning_rate": 0.024000000208616257, "loss": 3.154026508331299, "step": 718 }, { "epoch": 0.03428571428571429, "grad_norm": 0.07681194692850113, "learning_rate": 0.024000000208616257, "loss": 3.1468605995178223, "step": 720 }, { "epoch": 0.03438095238095238, "grad_norm": 0.07750710844993591, "learning_rate": 0.024000000208616257, "loss": 3.1578662395477295, "step": 722 }, { "epoch": 0.03447619047619047, "grad_norm": 0.06742233037948608, "learning_rate": 0.024000000208616257, "loss": 3.2457776069641113, "step": 724 }, { "epoch": 0.03457142857142857, "grad_norm": 0.06920700520277023, "learning_rate": 0.024000000208616257, "loss": 3.1927900314331055, "step": 726 }, { "epoch": 0.034666666666666665, "grad_norm": 0.07110117375850677, "learning_rate": 0.024000000208616257, "loss": 3.1812782287597656, "step": 728 }, { "epoch": 0.034761904761904765, "grad_norm": 0.08268111199140549, "learning_rate": 0.024000000208616257, "loss": 3.1666388511657715, "step": 730 }, { "epoch": 0.03485714285714286, "grad_norm": 0.08110952377319336, "learning_rate": 0.024000000208616257, "loss": 3.2147364616394043, "step": 732 }, { "epoch": 0.03495238095238095, "grad_norm": 0.08320687711238861, "learning_rate": 0.024000000208616257, "loss": 3.1722617149353027, "step": 734 }, { "epoch": 0.03504761904761905, "grad_norm": 0.0814925879240036, "learning_rate": 0.024000000208616257, "loss": 3.1830286979675293, "step": 736 }, { "epoch": 0.03514285714285714, "grad_norm": 0.08159703016281128, "learning_rate": 0.024000000208616257, "loss": 3.1796393394470215, "step": 738 }, { "epoch": 0.035238095238095235, "grad_norm": 0.06512708216905594, "learning_rate": 0.024000000208616257, "loss": 3.1944589614868164, "step": 740 }, { "epoch": 0.035333333333333335, "grad_norm": 0.06749378144741058, "learning_rate": 0.024000000208616257, "loss": 3.1454129219055176, "step": 742 }, { "epoch": 0.03542857142857143, "grad_norm": 0.07329411804676056, "learning_rate": 0.024000000208616257, "loss": 3.1638593673706055, "step": 744 }, { "epoch": 0.03552380952380953, "grad_norm": 0.0763290598988533, "learning_rate": 0.024000000208616257, "loss": 3.1893742084503174, "step": 746 }, { "epoch": 0.03561904761904762, "grad_norm": 0.07005666196346283, "learning_rate": 0.024000000208616257, "loss": 3.13489031791687, "step": 748 }, { "epoch": 0.03571428571428571, "grad_norm": 0.06956160068511963, "learning_rate": 0.024000000208616257, "loss": 3.166025161743164, "step": 750 }, { "epoch": 0.03580952380952381, "grad_norm": 0.06571304053068161, "learning_rate": 0.024000000208616257, "loss": 3.156802177429199, "step": 752 }, { "epoch": 0.035904761904761905, "grad_norm": 0.07679462432861328, "learning_rate": 0.024000000208616257, "loss": 3.138455867767334, "step": 754 }, { "epoch": 0.036, "grad_norm": 0.07127557694911957, "learning_rate": 0.024000000208616257, "loss": 3.158381700515747, "step": 756 }, { "epoch": 0.0360952380952381, "grad_norm": 0.06858626753091812, "learning_rate": 0.024000000208616257, "loss": 3.1413769721984863, "step": 758 }, { "epoch": 0.03619047619047619, "grad_norm": 0.06887949258089066, "learning_rate": 0.024000000208616257, "loss": 3.1974706649780273, "step": 760 }, { "epoch": 0.03628571428571428, "grad_norm": 0.07180433720350266, "learning_rate": 0.024000000208616257, "loss": 3.142838954925537, "step": 762 }, { "epoch": 0.03638095238095238, "grad_norm": 0.07630762457847595, "learning_rate": 0.024000000208616257, "loss": 3.13484525680542, "step": 764 }, { "epoch": 0.036476190476190475, "grad_norm": 0.06539653986692429, "learning_rate": 0.024000000208616257, "loss": 3.1610283851623535, "step": 766 }, { "epoch": 0.036571428571428574, "grad_norm": 0.06617697328329086, "learning_rate": 0.024000000208616257, "loss": 3.1803746223449707, "step": 768 }, { "epoch": 0.03666666666666667, "grad_norm": 0.07375525683164597, "learning_rate": 0.024000000208616257, "loss": 3.1807384490966797, "step": 770 }, { "epoch": 0.03676190476190476, "grad_norm": 0.06634707748889923, "learning_rate": 0.024000000208616257, "loss": 3.156447172164917, "step": 772 }, { "epoch": 0.03685714285714286, "grad_norm": 0.06482807546854019, "learning_rate": 0.024000000208616257, "loss": 3.1762161254882812, "step": 774 }, { "epoch": 0.03695238095238095, "grad_norm": 0.06851062923669815, "learning_rate": 0.024000000208616257, "loss": 3.1759800910949707, "step": 776 }, { "epoch": 0.037047619047619045, "grad_norm": 0.06895986944437027, "learning_rate": 0.024000000208616257, "loss": 3.1339364051818848, "step": 778 }, { "epoch": 0.037142857142857144, "grad_norm": 0.07117994874715805, "learning_rate": 0.024000000208616257, "loss": 3.1467373371124268, "step": 780 }, { "epoch": 0.03723809523809524, "grad_norm": 0.07626303285360336, "learning_rate": 0.024000000208616257, "loss": 3.1602282524108887, "step": 782 }, { "epoch": 0.037333333333333336, "grad_norm": 0.06421144306659698, "learning_rate": 0.024000000208616257, "loss": 3.1545724868774414, "step": 784 }, { "epoch": 0.03742857142857143, "grad_norm": 0.06410733610391617, "learning_rate": 0.024000000208616257, "loss": 3.1749696731567383, "step": 786 }, { "epoch": 0.03752380952380952, "grad_norm": 0.06822361052036285, "learning_rate": 0.024000000208616257, "loss": 3.1546266078948975, "step": 788 }, { "epoch": 0.03761904761904762, "grad_norm": 0.06876611709594727, "learning_rate": 0.024000000208616257, "loss": 3.137157917022705, "step": 790 }, { "epoch": 0.037714285714285714, "grad_norm": 0.06471683084964752, "learning_rate": 0.024000000208616257, "loss": 3.1217448711395264, "step": 792 }, { "epoch": 0.03780952380952381, "grad_norm": 0.06299459934234619, "learning_rate": 0.024000000208616257, "loss": 3.1454782485961914, "step": 794 }, { "epoch": 0.037904761904761906, "grad_norm": 0.06754894554615021, "learning_rate": 0.024000000208616257, "loss": 3.1453404426574707, "step": 796 }, { "epoch": 0.038, "grad_norm": 0.07478955388069153, "learning_rate": 0.024000000208616257, "loss": 3.144214153289795, "step": 798 }, { "epoch": 0.0380952380952381, "grad_norm": 0.0659400150179863, "learning_rate": 0.024000000208616257, "loss": 3.1132359504699707, "step": 800 }, { "epoch": 0.03819047619047619, "grad_norm": 0.06845249980688095, "learning_rate": 0.024000000208616257, "loss": 3.1357860565185547, "step": 802 }, { "epoch": 0.038285714285714284, "grad_norm": 0.06860584020614624, "learning_rate": 0.024000000208616257, "loss": 3.1594438552856445, "step": 804 }, { "epoch": 0.038380952380952384, "grad_norm": 0.07030051201581955, "learning_rate": 0.024000000208616257, "loss": 3.18593692779541, "step": 806 }, { "epoch": 0.038476190476190476, "grad_norm": 0.07023944705724716, "learning_rate": 0.024000000208616257, "loss": 3.1356382369995117, "step": 808 }, { "epoch": 0.03857142857142857, "grad_norm": 0.08672435581684113, "learning_rate": 0.024000000208616257, "loss": 3.1328818798065186, "step": 810 }, { "epoch": 0.03866666666666667, "grad_norm": 0.07612980157136917, "learning_rate": 0.024000000208616257, "loss": 3.1412744522094727, "step": 812 }, { "epoch": 0.03876190476190476, "grad_norm": 0.0680103600025177, "learning_rate": 0.024000000208616257, "loss": 3.1005563735961914, "step": 814 }, { "epoch": 0.038857142857142854, "grad_norm": 0.06437309831380844, "learning_rate": 0.024000000208616257, "loss": 3.131866455078125, "step": 816 }, { "epoch": 0.038952380952380954, "grad_norm": 0.0659368485212326, "learning_rate": 0.024000000208616257, "loss": 3.1187214851379395, "step": 818 }, { "epoch": 0.039047619047619046, "grad_norm": 0.06681571900844574, "learning_rate": 0.024000000208616257, "loss": 3.119333267211914, "step": 820 }, { "epoch": 0.039142857142857146, "grad_norm": 0.0727713406085968, "learning_rate": 0.024000000208616257, "loss": 3.1186232566833496, "step": 822 }, { "epoch": 0.03923809523809524, "grad_norm": 0.07257276028394699, "learning_rate": 0.024000000208616257, "loss": 3.1727452278137207, "step": 824 }, { "epoch": 0.03933333333333333, "grad_norm": 0.06537605077028275, "learning_rate": 0.024000000208616257, "loss": 3.1685996055603027, "step": 826 }, { "epoch": 0.03942857142857143, "grad_norm": 0.07205349206924438, "learning_rate": 0.024000000208616257, "loss": 3.126197338104248, "step": 828 }, { "epoch": 0.039523809523809524, "grad_norm": 0.07520736008882523, "learning_rate": 0.024000000208616257, "loss": 3.097465753555298, "step": 830 }, { "epoch": 0.039619047619047616, "grad_norm": 0.06576979160308838, "learning_rate": 0.024000000208616257, "loss": 3.123183488845825, "step": 832 }, { "epoch": 0.039714285714285716, "grad_norm": 0.07439937442541122, "learning_rate": 0.024000000208616257, "loss": 3.1157078742980957, "step": 834 }, { "epoch": 0.03980952380952381, "grad_norm": 0.07092170417308807, "learning_rate": 0.024000000208616257, "loss": 3.0969648361206055, "step": 836 }, { "epoch": 0.03990476190476191, "grad_norm": 0.06886891275644302, "learning_rate": 0.024000000208616257, "loss": 3.130530834197998, "step": 838 }, { "epoch": 0.04, "grad_norm": 0.06731168925762177, "learning_rate": 0.024000000208616257, "loss": 3.1135735511779785, "step": 840 }, { "epoch": 0.040095238095238094, "grad_norm": 0.06422185152769089, "learning_rate": 0.024000000208616257, "loss": 3.132582187652588, "step": 842 }, { "epoch": 0.04019047619047619, "grad_norm": 0.06998761743307114, "learning_rate": 0.024000000208616257, "loss": 3.117568016052246, "step": 844 }, { "epoch": 0.040285714285714286, "grad_norm": 0.06589635461568832, "learning_rate": 0.024000000208616257, "loss": 3.102053642272949, "step": 846 }, { "epoch": 0.04038095238095238, "grad_norm": 0.06501191854476929, "learning_rate": 0.024000000208616257, "loss": 3.120415687561035, "step": 848 }, { "epoch": 0.04047619047619048, "grad_norm": 0.06688158214092255, "learning_rate": 0.024000000208616257, "loss": 3.113985061645508, "step": 850 }, { "epoch": 0.04057142857142857, "grad_norm": 0.07136926054954529, "learning_rate": 0.024000000208616257, "loss": 3.0967507362365723, "step": 852 }, { "epoch": 0.04066666666666666, "grad_norm": 0.07345432043075562, "learning_rate": 0.024000000208616257, "loss": 3.0976791381835938, "step": 854 }, { "epoch": 0.04076190476190476, "grad_norm": 0.06671705096960068, "learning_rate": 0.024000000208616257, "loss": 3.1271042823791504, "step": 856 }, { "epoch": 0.040857142857142856, "grad_norm": 0.0703168734908104, "learning_rate": 0.024000000208616257, "loss": 3.1158695220947266, "step": 858 }, { "epoch": 0.040952380952380955, "grad_norm": 0.0657120868563652, "learning_rate": 0.024000000208616257, "loss": 3.1168711185455322, "step": 860 }, { "epoch": 0.04104761904761905, "grad_norm": 0.06279563158750534, "learning_rate": 0.024000000208616257, "loss": 3.112147808074951, "step": 862 }, { "epoch": 0.04114285714285714, "grad_norm": 0.06903357058763504, "learning_rate": 0.024000000208616257, "loss": 3.130458354949951, "step": 864 }, { "epoch": 0.04123809523809524, "grad_norm": 0.07460320740938187, "learning_rate": 0.024000000208616257, "loss": 3.047708511352539, "step": 866 }, { "epoch": 0.04133333333333333, "grad_norm": 0.07181910425424576, "learning_rate": 0.024000000208616257, "loss": 3.0596158504486084, "step": 868 }, { "epoch": 0.041428571428571426, "grad_norm": 0.062275804579257965, "learning_rate": 0.024000000208616257, "loss": 3.0899834632873535, "step": 870 }, { "epoch": 0.041523809523809525, "grad_norm": 0.06110190227627754, "learning_rate": 0.024000000208616257, "loss": 3.121835708618164, "step": 872 }, { "epoch": 0.04161904761904762, "grad_norm": 0.062481507658958435, "learning_rate": 0.024000000208616257, "loss": 3.1040072441101074, "step": 874 }, { "epoch": 0.04171428571428572, "grad_norm": 0.06465902179479599, "learning_rate": 0.024000000208616257, "loss": 3.0803303718566895, "step": 876 }, { "epoch": 0.04180952380952381, "grad_norm": 0.06454935669898987, "learning_rate": 0.024000000208616257, "loss": 3.0644068717956543, "step": 878 }, { "epoch": 0.0419047619047619, "grad_norm": 0.06235034391283989, "learning_rate": 0.024000000208616257, "loss": 3.0754425525665283, "step": 880 }, { "epoch": 0.042, "grad_norm": 0.06558102369308472, "learning_rate": 0.024000000208616257, "loss": 3.095618724822998, "step": 882 }, { "epoch": 0.042095238095238095, "grad_norm": 0.06225241720676422, "learning_rate": 0.024000000208616257, "loss": 3.0607080459594727, "step": 884 }, { "epoch": 0.04219047619047619, "grad_norm": 0.0613737627863884, "learning_rate": 0.024000000208616257, "loss": 3.1157031059265137, "step": 886 }, { "epoch": 0.04228571428571429, "grad_norm": 0.061712831258773804, "learning_rate": 0.024000000208616257, "loss": 3.0956549644470215, "step": 888 }, { "epoch": 0.04238095238095238, "grad_norm": 0.06462763249874115, "learning_rate": 0.024000000208616257, "loss": 3.0844128131866455, "step": 890 }, { "epoch": 0.04247619047619047, "grad_norm": 0.0794723704457283, "learning_rate": 0.024000000208616257, "loss": 3.0859038829803467, "step": 892 }, { "epoch": 0.04257142857142857, "grad_norm": 0.07729235291481018, "learning_rate": 0.024000000208616257, "loss": 3.072681427001953, "step": 894 }, { "epoch": 0.042666666666666665, "grad_norm": 0.07238233834505081, "learning_rate": 0.024000000208616257, "loss": 3.075396776199341, "step": 896 }, { "epoch": 0.042761904761904765, "grad_norm": 0.06877360492944717, "learning_rate": 0.024000000208616257, "loss": 3.0765905380249023, "step": 898 }, { "epoch": 0.04285714285714286, "grad_norm": 0.07515493035316467, "learning_rate": 0.024000000208616257, "loss": 3.0844407081604004, "step": 900 }, { "epoch": 0.04295238095238095, "grad_norm": 0.07547783106565475, "learning_rate": 0.024000000208616257, "loss": 3.0706019401550293, "step": 902 }, { "epoch": 0.04304761904761905, "grad_norm": 0.06627517938613892, "learning_rate": 0.024000000208616257, "loss": 3.0726070404052734, "step": 904 }, { "epoch": 0.04314285714285714, "grad_norm": 0.06536763906478882, "learning_rate": 0.024000000208616257, "loss": 3.087002992630005, "step": 906 }, { "epoch": 0.043238095238095235, "grad_norm": 0.07094710320234299, "learning_rate": 0.024000000208616257, "loss": 3.051009178161621, "step": 908 }, { "epoch": 0.043333333333333335, "grad_norm": 0.06429240852594376, "learning_rate": 0.024000000208616257, "loss": 3.0804049968719482, "step": 910 }, { "epoch": 0.04342857142857143, "grad_norm": 0.06235828623175621, "learning_rate": 0.024000000208616257, "loss": 3.0663909912109375, "step": 912 }, { "epoch": 0.04352380952380953, "grad_norm": 0.0697418674826622, "learning_rate": 0.024000000208616257, "loss": 3.0646214485168457, "step": 914 }, { "epoch": 0.04361904761904762, "grad_norm": 0.06777344644069672, "learning_rate": 0.024000000208616257, "loss": 3.0696520805358887, "step": 916 }, { "epoch": 0.04371428571428571, "grad_norm": 0.06729612499475479, "learning_rate": 0.024000000208616257, "loss": 3.0770034790039062, "step": 918 }, { "epoch": 0.04380952380952381, "grad_norm": 0.0657837763428688, "learning_rate": 0.024000000208616257, "loss": 3.09183669090271, "step": 920 }, { "epoch": 0.043904761904761905, "grad_norm": 0.06455850601196289, "learning_rate": 0.024000000208616257, "loss": 3.0763893127441406, "step": 922 }, { "epoch": 0.044, "grad_norm": 0.06527040153741837, "learning_rate": 0.024000000208616257, "loss": 3.0549378395080566, "step": 924 }, { "epoch": 0.0440952380952381, "grad_norm": 0.06264866888523102, "learning_rate": 0.024000000208616257, "loss": 3.1002461910247803, "step": 926 }, { "epoch": 0.04419047619047619, "grad_norm": 0.06643705070018768, "learning_rate": 0.024000000208616257, "loss": 3.0791029930114746, "step": 928 }, { "epoch": 0.04428571428571428, "grad_norm": 0.06560289859771729, "learning_rate": 0.024000000208616257, "loss": 3.056124210357666, "step": 930 }, { "epoch": 0.04438095238095238, "grad_norm": 0.07225628942251205, "learning_rate": 0.024000000208616257, "loss": 3.077237606048584, "step": 932 }, { "epoch": 0.044476190476190475, "grad_norm": 0.0648811012506485, "learning_rate": 0.024000000208616257, "loss": 3.051553964614868, "step": 934 }, { "epoch": 0.044571428571428574, "grad_norm": 0.06221294030547142, "learning_rate": 0.024000000208616257, "loss": 3.065746307373047, "step": 936 }, { "epoch": 0.04466666666666667, "grad_norm": 0.06485804170370102, "learning_rate": 0.024000000208616257, "loss": 3.075626850128174, "step": 938 }, { "epoch": 0.04476190476190476, "grad_norm": 0.06684035807847977, "learning_rate": 0.024000000208616257, "loss": 3.0684847831726074, "step": 940 }, { "epoch": 0.04485714285714286, "grad_norm": 0.06848568469285965, "learning_rate": 0.024000000208616257, "loss": 3.0551886558532715, "step": 942 }, { "epoch": 0.04495238095238095, "grad_norm": 0.06428419798612595, "learning_rate": 0.024000000208616257, "loss": 3.0681066513061523, "step": 944 }, { "epoch": 0.045047619047619045, "grad_norm": 0.06246276944875717, "learning_rate": 0.024000000208616257, "loss": 3.069855213165283, "step": 946 }, { "epoch": 0.045142857142857144, "grad_norm": 0.06441211700439453, "learning_rate": 0.024000000208616257, "loss": 3.076978921890259, "step": 948 }, { "epoch": 0.04523809523809524, "grad_norm": 0.060650404542684555, "learning_rate": 0.024000000208616257, "loss": 3.058931827545166, "step": 950 }, { "epoch": 0.04533333333333334, "grad_norm": 0.06274467706680298, "learning_rate": 0.024000000208616257, "loss": 3.0689749717712402, "step": 952 }, { "epoch": 0.04542857142857143, "grad_norm": 0.062426384538412094, "learning_rate": 0.024000000208616257, "loss": 2.9861903190612793, "step": 954 }, { "epoch": 0.04552380952380952, "grad_norm": 0.07028868794441223, "learning_rate": 0.024000000208616257, "loss": 3.0526235103607178, "step": 956 }, { "epoch": 0.04561904761904762, "grad_norm": 0.08050168305635452, "learning_rate": 0.024000000208616257, "loss": 3.0686590671539307, "step": 958 }, { "epoch": 0.045714285714285714, "grad_norm": 0.07005076855421066, "learning_rate": 0.024000000208616257, "loss": 3.067628860473633, "step": 960 }, { "epoch": 0.04580952380952381, "grad_norm": 0.05959608033299446, "learning_rate": 0.024000000208616257, "loss": 3.0191359519958496, "step": 962 }, { "epoch": 0.04590476190476191, "grad_norm": 0.05864005535840988, "learning_rate": 0.024000000208616257, "loss": 3.0680694580078125, "step": 964 }, { "epoch": 0.046, "grad_norm": 0.0645788311958313, "learning_rate": 0.024000000208616257, "loss": 3.074080467224121, "step": 966 }, { "epoch": 0.04609523809523809, "grad_norm": 0.06542934477329254, "learning_rate": 0.024000000208616257, "loss": 3.074032783508301, "step": 968 }, { "epoch": 0.04619047619047619, "grad_norm": 0.06495311111211777, "learning_rate": 0.024000000208616257, "loss": 3.0810647010803223, "step": 970 }, { "epoch": 0.046285714285714284, "grad_norm": 0.06691587716341019, "learning_rate": 0.024000000208616257, "loss": 3.0416259765625, "step": 972 }, { "epoch": 0.046380952380952384, "grad_norm": 0.06752321869134903, "learning_rate": 0.024000000208616257, "loss": 3.090067148208618, "step": 974 }, { "epoch": 0.046476190476190476, "grad_norm": 0.06306398659944534, "learning_rate": 0.024000000208616257, "loss": 3.052189826965332, "step": 976 }, { "epoch": 0.04657142857142857, "grad_norm": 0.06301634758710861, "learning_rate": 0.024000000208616257, "loss": 3.058084487915039, "step": 978 }, { "epoch": 0.04666666666666667, "grad_norm": 0.06827303022146225, "learning_rate": 0.024000000208616257, "loss": 3.0563530921936035, "step": 980 }, { "epoch": 0.04676190476190476, "grad_norm": 0.06573956459760666, "learning_rate": 0.024000000208616257, "loss": 3.0880050659179688, "step": 982 }, { "epoch": 0.046857142857142854, "grad_norm": 0.06142352148890495, "learning_rate": 0.024000000208616257, "loss": 3.0661873817443848, "step": 984 }, { "epoch": 0.046952380952380954, "grad_norm": 0.06406045705080032, "learning_rate": 0.024000000208616257, "loss": 3.063352108001709, "step": 986 }, { "epoch": 0.047047619047619046, "grad_norm": 0.06274869292974472, "learning_rate": 0.024000000208616257, "loss": 3.055903196334839, "step": 988 }, { "epoch": 0.047142857142857146, "grad_norm": 0.05941158905625343, "learning_rate": 0.024000000208616257, "loss": 3.061056137084961, "step": 990 }, { "epoch": 0.04723809523809524, "grad_norm": 0.05682099983096123, "learning_rate": 0.024000000208616257, "loss": 3.079113006591797, "step": 992 }, { "epoch": 0.04733333333333333, "grad_norm": 0.05980977043509483, "learning_rate": 0.024000000208616257, "loss": 3.048689365386963, "step": 994 }, { "epoch": 0.04742857142857143, "grad_norm": 0.061439573764801025, "learning_rate": 0.024000000208616257, "loss": 3.06083607673645, "step": 996 }, { "epoch": 0.047523809523809524, "grad_norm": 0.06291661411523819, "learning_rate": 0.024000000208616257, "loss": 3.055856227874756, "step": 998 }, { "epoch": 0.047619047619047616, "grad_norm": 0.05849756672978401, "learning_rate": 0.024000000208616257, "loss": 3.024712562561035, "step": 1000 }, { "epoch": 0.047714285714285716, "grad_norm": 0.06354766339063644, "learning_rate": 0.024000000208616257, "loss": 3.0479273796081543, "step": 1002 }, { "epoch": 0.04780952380952381, "grad_norm": 0.07189547270536423, "learning_rate": 0.024000000208616257, "loss": 3.037203311920166, "step": 1004 }, { "epoch": 0.0479047619047619, "grad_norm": 0.06168299913406372, "learning_rate": 0.024000000208616257, "loss": 3.0696561336517334, "step": 1006 }, { "epoch": 0.048, "grad_norm": 0.06008967384696007, "learning_rate": 0.024000000208616257, "loss": 3.03644061088562, "step": 1008 }, { "epoch": 0.048095238095238094, "grad_norm": 0.062147356569767, "learning_rate": 0.024000000208616257, "loss": 3.086516857147217, "step": 1010 }, { "epoch": 0.04819047619047619, "grad_norm": 0.0690990760922432, "learning_rate": 0.024000000208616257, "loss": 3.0647566318511963, "step": 1012 }, { "epoch": 0.048285714285714286, "grad_norm": 0.06334016472101212, "learning_rate": 0.024000000208616257, "loss": 3.0747222900390625, "step": 1014 }, { "epoch": 0.04838095238095238, "grad_norm": 0.06369421631097794, "learning_rate": 0.024000000208616257, "loss": 3.0489585399627686, "step": 1016 }, { "epoch": 0.04847619047619048, "grad_norm": 0.05949234217405319, "learning_rate": 0.024000000208616257, "loss": 3.0545129776000977, "step": 1018 }, { "epoch": 0.04857142857142857, "grad_norm": 0.06704841554164886, "learning_rate": 0.024000000208616257, "loss": 3.0756356716156006, "step": 1020 }, { "epoch": 0.048666666666666664, "grad_norm": 0.0626104548573494, "learning_rate": 0.024000000208616257, "loss": 3.0496630668640137, "step": 1022 }, { "epoch": 0.04876190476190476, "grad_norm": 0.06039304658770561, "learning_rate": 0.024000000208616257, "loss": 3.083125352859497, "step": 1024 }, { "epoch": 0.048857142857142856, "grad_norm": 0.06297505646944046, "learning_rate": 0.024000000208616257, "loss": 3.069502830505371, "step": 1026 }, { "epoch": 0.048952380952380956, "grad_norm": 0.06280398368835449, "learning_rate": 0.024000000208616257, "loss": 3.0576858520507812, "step": 1028 }, { "epoch": 0.04904761904761905, "grad_norm": 0.0598304346203804, "learning_rate": 0.024000000208616257, "loss": 3.0707099437713623, "step": 1030 }, { "epoch": 0.04914285714285714, "grad_norm": 0.062489185482263565, "learning_rate": 0.024000000208616257, "loss": 3.0659570693969727, "step": 1032 }, { "epoch": 0.04923809523809524, "grad_norm": 0.06388653814792633, "learning_rate": 0.024000000208616257, "loss": 3.0427517890930176, "step": 1034 }, { "epoch": 0.04933333333333333, "grad_norm": 0.06645842641592026, "learning_rate": 0.024000000208616257, "loss": 3.052427291870117, "step": 1036 }, { "epoch": 0.049428571428571426, "grad_norm": 0.063435398042202, "learning_rate": 0.024000000208616257, "loss": 3.0692105293273926, "step": 1038 }, { "epoch": 0.049523809523809526, "grad_norm": 0.06134660542011261, "learning_rate": 0.024000000208616257, "loss": 3.051891803741455, "step": 1040 }, { "epoch": 0.04961904761904762, "grad_norm": 0.05831262841820717, "learning_rate": 0.024000000208616257, "loss": 3.0275063514709473, "step": 1042 }, { "epoch": 0.04971428571428571, "grad_norm": 0.06195816770195961, "learning_rate": 0.024000000208616257, "loss": 3.0686089992523193, "step": 1044 }, { "epoch": 0.04980952380952381, "grad_norm": 0.06554307043552399, "learning_rate": 0.024000000208616257, "loss": 3.055507183074951, "step": 1046 }, { "epoch": 0.0499047619047619, "grad_norm": 0.0715007558465004, "learning_rate": 0.024000000208616257, "loss": 3.056023597717285, "step": 1048 }, { "epoch": 0.05, "grad_norm": 0.07247067987918854, "learning_rate": 0.024000000208616257, "loss": 3.0667905807495117, "step": 1050 }, { "epoch": 0.050095238095238095, "grad_norm": 0.06911437958478928, "learning_rate": 0.024000000208616257, "loss": 3.0486268997192383, "step": 1052 }, { "epoch": 0.05019047619047619, "grad_norm": 0.06312612444162369, "learning_rate": 0.024000000208616257, "loss": 3.0822343826293945, "step": 1054 }, { "epoch": 0.05028571428571429, "grad_norm": 0.059785693883895874, "learning_rate": 0.024000000208616257, "loss": 3.0627212524414062, "step": 1056 }, { "epoch": 0.05038095238095238, "grad_norm": 0.059214379638433456, "learning_rate": 0.024000000208616257, "loss": 3.054945945739746, "step": 1058 }, { "epoch": 0.05047619047619047, "grad_norm": 0.05899949371814728, "learning_rate": 0.024000000208616257, "loss": 3.0392608642578125, "step": 1060 }, { "epoch": 0.05057142857142857, "grad_norm": 0.058471690863370895, "learning_rate": 0.024000000208616257, "loss": 3.077596426010132, "step": 1062 }, { "epoch": 0.050666666666666665, "grad_norm": 0.058646995574235916, "learning_rate": 0.024000000208616257, "loss": 3.0268001556396484, "step": 1064 }, { "epoch": 0.050761904761904765, "grad_norm": 0.05497264117002487, "learning_rate": 0.024000000208616257, "loss": 3.051115036010742, "step": 1066 }, { "epoch": 0.05085714285714286, "grad_norm": 0.06088046357035637, "learning_rate": 0.024000000208616257, "loss": 3.052265167236328, "step": 1068 }, { "epoch": 0.05095238095238095, "grad_norm": 0.05846144258975983, "learning_rate": 0.024000000208616257, "loss": 3.0579476356506348, "step": 1070 }, { "epoch": 0.05104761904761905, "grad_norm": 0.05864694342017174, "learning_rate": 0.024000000208616257, "loss": 3.052201271057129, "step": 1072 }, { "epoch": 0.05114285714285714, "grad_norm": 0.060412462800741196, "learning_rate": 0.024000000208616257, "loss": 3.0255303382873535, "step": 1074 }, { "epoch": 0.051238095238095235, "grad_norm": 0.057002849876880646, "learning_rate": 0.024000000208616257, "loss": 3.0424985885620117, "step": 1076 }, { "epoch": 0.051333333333333335, "grad_norm": 0.05671170353889465, "learning_rate": 0.024000000208616257, "loss": 3.055744171142578, "step": 1078 }, { "epoch": 0.05142857142857143, "grad_norm": 0.05752897262573242, "learning_rate": 0.024000000208616257, "loss": 3.0241496562957764, "step": 1080 }, { "epoch": 0.05152380952380953, "grad_norm": 0.05675262585282326, "learning_rate": 0.024000000208616257, "loss": 3.0075736045837402, "step": 1082 }, { "epoch": 0.05161904761904762, "grad_norm": 0.05479305982589722, "learning_rate": 0.024000000208616257, "loss": 3.0436277389526367, "step": 1084 }, { "epoch": 0.05171428571428571, "grad_norm": 0.058180734515190125, "learning_rate": 0.024000000208616257, "loss": 3.0406651496887207, "step": 1086 }, { "epoch": 0.05180952380952381, "grad_norm": 0.05768230929970741, "learning_rate": 0.024000000208616257, "loss": 3.01808500289917, "step": 1088 }, { "epoch": 0.051904761904761905, "grad_norm": 0.060971699655056, "learning_rate": 0.024000000208616257, "loss": 3.039900779724121, "step": 1090 }, { "epoch": 0.052, "grad_norm": 0.05676783621311188, "learning_rate": 0.024000000208616257, "loss": 3.0445547103881836, "step": 1092 }, { "epoch": 0.0520952380952381, "grad_norm": 0.05435581132769585, "learning_rate": 0.024000000208616257, "loss": 3.064800262451172, "step": 1094 }, { "epoch": 0.05219047619047619, "grad_norm": 0.0610000379383564, "learning_rate": 0.024000000208616257, "loss": 3.0320749282836914, "step": 1096 }, { "epoch": 0.05228571428571428, "grad_norm": 0.06003008782863617, "learning_rate": 0.024000000208616257, "loss": 3.0314271450042725, "step": 1098 }, { "epoch": 0.05238095238095238, "grad_norm": 0.061458759009838104, "learning_rate": 0.024000000208616257, "loss": 3.0218610763549805, "step": 1100 }, { "epoch": 0.052476190476190475, "grad_norm": 0.06403152644634247, "learning_rate": 0.024000000208616257, "loss": 3.040764808654785, "step": 1102 }, { "epoch": 0.052571428571428575, "grad_norm": 0.059456296265125275, "learning_rate": 0.024000000208616257, "loss": 3.046827793121338, "step": 1104 }, { "epoch": 0.05266666666666667, "grad_norm": 0.059432171285152435, "learning_rate": 0.024000000208616257, "loss": 3.0120744705200195, "step": 1106 }, { "epoch": 0.05276190476190476, "grad_norm": 0.06151725351810455, "learning_rate": 0.024000000208616257, "loss": 3.0427212715148926, "step": 1108 }, { "epoch": 0.05285714285714286, "grad_norm": 0.05983575060963631, "learning_rate": 0.024000000208616257, "loss": 3.0434534549713135, "step": 1110 }, { "epoch": 0.05295238095238095, "grad_norm": 0.060025084763765335, "learning_rate": 0.024000000208616257, "loss": 3.0613644123077393, "step": 1112 }, { "epoch": 0.053047619047619045, "grad_norm": 0.061329133808612823, "learning_rate": 0.024000000208616257, "loss": 3.032843589782715, "step": 1114 }, { "epoch": 0.053142857142857144, "grad_norm": 0.061610158532857895, "learning_rate": 0.024000000208616257, "loss": 3.0331790447235107, "step": 1116 }, { "epoch": 0.05323809523809524, "grad_norm": 0.058027368038892746, "learning_rate": 0.024000000208616257, "loss": 3.0368051528930664, "step": 1118 }, { "epoch": 0.05333333333333334, "grad_norm": 0.05735352635383606, "learning_rate": 0.024000000208616257, "loss": 3.0195162296295166, "step": 1120 }, { "epoch": 0.05342857142857143, "grad_norm": 0.059881627559661865, "learning_rate": 0.024000000208616257, "loss": 3.0228123664855957, "step": 1122 }, { "epoch": 0.05352380952380952, "grad_norm": 0.06019507721066475, "learning_rate": 0.024000000208616257, "loss": 3.031332492828369, "step": 1124 }, { "epoch": 0.05361904761904762, "grad_norm": 0.057742681354284286, "learning_rate": 0.024000000208616257, "loss": 3.040836811065674, "step": 1126 }, { "epoch": 0.053714285714285714, "grad_norm": 0.057205189019441605, "learning_rate": 0.024000000208616257, "loss": 3.0521864891052246, "step": 1128 }, { "epoch": 0.05380952380952381, "grad_norm": 0.056748729199171066, "learning_rate": 0.024000000208616257, "loss": 3.0366411209106445, "step": 1130 }, { "epoch": 0.05390476190476191, "grad_norm": 0.06324241310358047, "learning_rate": 0.024000000208616257, "loss": 3.0562472343444824, "step": 1132 }, { "epoch": 0.054, "grad_norm": 0.05621308088302612, "learning_rate": 0.024000000208616257, "loss": 3.0535342693328857, "step": 1134 }, { "epoch": 0.05409523809523809, "grad_norm": 0.058671917766332626, "learning_rate": 0.024000000208616257, "loss": 3.067357063293457, "step": 1136 }, { "epoch": 0.05419047619047619, "grad_norm": 0.06093320995569229, "learning_rate": 0.024000000208616257, "loss": 3.0442891120910645, "step": 1138 }, { "epoch": 0.054285714285714284, "grad_norm": 0.05917782336473465, "learning_rate": 0.024000000208616257, "loss": 3.0462894439697266, "step": 1140 }, { "epoch": 0.054380952380952384, "grad_norm": 0.057291436940431595, "learning_rate": 0.024000000208616257, "loss": 3.056645393371582, "step": 1142 }, { "epoch": 0.05447619047619048, "grad_norm": 0.05575151368975639, "learning_rate": 0.024000000208616257, "loss": 3.0238351821899414, "step": 1144 }, { "epoch": 0.05457142857142857, "grad_norm": 0.05863843113183975, "learning_rate": 0.024000000208616257, "loss": 3.063243865966797, "step": 1146 }, { "epoch": 0.05466666666666667, "grad_norm": 0.05625324323773384, "learning_rate": 0.024000000208616257, "loss": 3.039976119995117, "step": 1148 }, { "epoch": 0.05476190476190476, "grad_norm": 0.05849955230951309, "learning_rate": 0.024000000208616257, "loss": 3.0391838550567627, "step": 1150 }, { "epoch": 0.054857142857142854, "grad_norm": 0.05602460354566574, "learning_rate": 0.024000000208616257, "loss": 3.0444366931915283, "step": 1152 }, { "epoch": 0.054952380952380954, "grad_norm": 0.05626349151134491, "learning_rate": 0.024000000208616257, "loss": 3.027592658996582, "step": 1154 }, { "epoch": 0.05504761904761905, "grad_norm": 0.05983627960085869, "learning_rate": 0.024000000208616257, "loss": 3.005208730697632, "step": 1156 }, { "epoch": 0.055142857142857146, "grad_norm": 0.05669187009334564, "learning_rate": 0.024000000208616257, "loss": 3.072868824005127, "step": 1158 }, { "epoch": 0.05523809523809524, "grad_norm": 0.05603785812854767, "learning_rate": 0.024000000208616257, "loss": 3.041327953338623, "step": 1160 }, { "epoch": 0.05533333333333333, "grad_norm": 0.05536894500255585, "learning_rate": 0.024000000208616257, "loss": 3.039623737335205, "step": 1162 }, { "epoch": 0.05542857142857143, "grad_norm": 0.0583699569106102, "learning_rate": 0.024000000208616257, "loss": 3.108242988586426, "step": 1164 }, { "epoch": 0.055523809523809524, "grad_norm": 0.06629029661417007, "learning_rate": 0.024000000208616257, "loss": 3.043562650680542, "step": 1166 }, { "epoch": 0.05561904761904762, "grad_norm": 0.060873132199048996, "learning_rate": 0.024000000208616257, "loss": 3.0665910243988037, "step": 1168 }, { "epoch": 0.055714285714285716, "grad_norm": 0.05814237892627716, "learning_rate": 0.024000000208616257, "loss": 3.0411415100097656, "step": 1170 }, { "epoch": 0.05580952380952381, "grad_norm": 0.0546601228415966, "learning_rate": 0.024000000208616257, "loss": 3.0361056327819824, "step": 1172 }, { "epoch": 0.0559047619047619, "grad_norm": 0.05922131985425949, "learning_rate": 0.024000000208616257, "loss": 3.010694980621338, "step": 1174 }, { "epoch": 0.056, "grad_norm": 0.061644259840250015, "learning_rate": 0.024000000208616257, "loss": 3.049976110458374, "step": 1176 }, { "epoch": 0.056095238095238094, "grad_norm": 0.06270940601825714, "learning_rate": 0.024000000208616257, "loss": 3.1042864322662354, "step": 1178 }, { "epoch": 0.05619047619047619, "grad_norm": 0.05776225030422211, "learning_rate": 0.024000000208616257, "loss": 3.020934581756592, "step": 1180 }, { "epoch": 0.056285714285714286, "grad_norm": 0.05527959018945694, "learning_rate": 0.024000000208616257, "loss": 3.0579333305358887, "step": 1182 }, { "epoch": 0.05638095238095238, "grad_norm": 0.05365069955587387, "learning_rate": 0.024000000208616257, "loss": 3.0560717582702637, "step": 1184 }, { "epoch": 0.05647619047619048, "grad_norm": 0.0560082271695137, "learning_rate": 0.024000000208616257, "loss": 3.0488715171813965, "step": 1186 }, { "epoch": 0.05657142857142857, "grad_norm": 0.05341020226478577, "learning_rate": 0.024000000208616257, "loss": 3.0562081336975098, "step": 1188 }, { "epoch": 0.056666666666666664, "grad_norm": 0.05400562658905983, "learning_rate": 0.024000000208616257, "loss": 3.0702807903289795, "step": 1190 }, { "epoch": 0.05676190476190476, "grad_norm": 0.056847184896469116, "learning_rate": 0.024000000208616257, "loss": 3.0575225353240967, "step": 1192 }, { "epoch": 0.056857142857142856, "grad_norm": 0.0556766539812088, "learning_rate": 0.024000000208616257, "loss": 3.033548355102539, "step": 1194 }, { "epoch": 0.056952380952380956, "grad_norm": 0.06070096790790558, "learning_rate": 0.024000000208616257, "loss": 3.0435214042663574, "step": 1196 }, { "epoch": 0.05704761904761905, "grad_norm": 0.05682795122265816, "learning_rate": 0.024000000208616257, "loss": 3.0444326400756836, "step": 1198 }, { "epoch": 0.05714285714285714, "grad_norm": 0.05378428101539612, "learning_rate": 0.024000000208616257, "loss": 3.036590576171875, "step": 1200 }, { "epoch": 0.05723809523809524, "grad_norm": 0.06143005192279816, "learning_rate": 0.024000000208616257, "loss": 3.0738346576690674, "step": 1202 }, { "epoch": 0.05733333333333333, "grad_norm": 0.0571569949388504, "learning_rate": 0.024000000208616257, "loss": 3.077674388885498, "step": 1204 }, { "epoch": 0.057428571428571426, "grad_norm": 0.05762338265776634, "learning_rate": 0.024000000208616257, "loss": 3.0628223419189453, "step": 1206 }, { "epoch": 0.057523809523809526, "grad_norm": 0.057911910116672516, "learning_rate": 0.024000000208616257, "loss": 3.006883382797241, "step": 1208 }, { "epoch": 0.05761904761904762, "grad_norm": 0.061829276382923126, "learning_rate": 0.024000000208616257, "loss": 3.0619115829467773, "step": 1210 }, { "epoch": 0.05771428571428571, "grad_norm": 0.0570538230240345, "learning_rate": 0.024000000208616257, "loss": 3.1065924167633057, "step": 1212 }, { "epoch": 0.05780952380952381, "grad_norm": 0.056189004331827164, "learning_rate": 0.024000000208616257, "loss": 3.0566294193267822, "step": 1214 }, { "epoch": 0.0579047619047619, "grad_norm": 0.05829361826181412, "learning_rate": 0.024000000208616257, "loss": 3.059316873550415, "step": 1216 }, { "epoch": 0.058, "grad_norm": 0.05528026074171066, "learning_rate": 0.024000000208616257, "loss": 3.049365997314453, "step": 1218 }, { "epoch": 0.058095238095238096, "grad_norm": 0.05655008554458618, "learning_rate": 0.024000000208616257, "loss": 3.044992446899414, "step": 1220 }, { "epoch": 0.05819047619047619, "grad_norm": 0.057734113186597824, "learning_rate": 0.024000000208616257, "loss": 3.045952320098877, "step": 1222 }, { "epoch": 0.05828571428571429, "grad_norm": 0.05418461188673973, "learning_rate": 0.024000000208616257, "loss": 3.085960865020752, "step": 1224 }, { "epoch": 0.05838095238095238, "grad_norm": 0.055153876543045044, "learning_rate": 0.024000000208616257, "loss": 3.0350441932678223, "step": 1226 }, { "epoch": 0.05847619047619047, "grad_norm": 0.05870424583554268, "learning_rate": 0.024000000208616257, "loss": 3.0186948776245117, "step": 1228 }, { "epoch": 0.05857142857142857, "grad_norm": 0.05565826594829559, "learning_rate": 0.024000000208616257, "loss": 3.021219253540039, "step": 1230 }, { "epoch": 0.058666666666666666, "grad_norm": 0.05637678503990173, "learning_rate": 0.024000000208616257, "loss": 3.0101027488708496, "step": 1232 }, { "epoch": 0.058761904761904765, "grad_norm": 0.055582012981176376, "learning_rate": 0.024000000208616257, "loss": 3.0474114418029785, "step": 1234 }, { "epoch": 0.05885714285714286, "grad_norm": 0.05842011794447899, "learning_rate": 0.024000000208616257, "loss": 3.0463523864746094, "step": 1236 }, { "epoch": 0.05895238095238095, "grad_norm": 0.05393781140446663, "learning_rate": 0.024000000208616257, "loss": 3.082899332046509, "step": 1238 }, { "epoch": 0.05904761904761905, "grad_norm": 0.05697547271847725, "learning_rate": 0.024000000208616257, "loss": 3.0784435272216797, "step": 1240 }, { "epoch": 0.05914285714285714, "grad_norm": 0.05603957548737526, "learning_rate": 0.024000000208616257, "loss": 3.0417168140411377, "step": 1242 }, { "epoch": 0.059238095238095236, "grad_norm": 0.05376940593123436, "learning_rate": 0.024000000208616257, "loss": 3.080162525177002, "step": 1244 }, { "epoch": 0.059333333333333335, "grad_norm": 0.055727291852235794, "learning_rate": 0.024000000208616257, "loss": 3.0575337409973145, "step": 1246 }, { "epoch": 0.05942857142857143, "grad_norm": 0.05776844918727875, "learning_rate": 0.024000000208616257, "loss": 3.0942487716674805, "step": 1248 }, { "epoch": 0.05952380952380952, "grad_norm": 0.058101195842027664, "learning_rate": 0.024000000208616257, "loss": 3.0732483863830566, "step": 1250 }, { "epoch": 0.05961904761904762, "grad_norm": 0.057925995439291, "learning_rate": 0.024000000208616257, "loss": 3.083416223526001, "step": 1252 }, { "epoch": 0.05971428571428571, "grad_norm": 0.05579056590795517, "learning_rate": 0.024000000208616257, "loss": 3.0561470985412598, "step": 1254 }, { "epoch": 0.05980952380952381, "grad_norm": 0.05993054807186127, "learning_rate": 0.024000000208616257, "loss": 3.070157527923584, "step": 1256 }, { "epoch": 0.059904761904761905, "grad_norm": 0.05810578912496567, "learning_rate": 0.024000000208616257, "loss": 3.0744335651397705, "step": 1258 }, { "epoch": 0.06, "grad_norm": 0.06029128283262253, "learning_rate": 0.024000000208616257, "loss": 3.095670700073242, "step": 1260 }, { "epoch": 0.0600952380952381, "grad_norm": 0.059252843260765076, "learning_rate": 0.024000000208616257, "loss": 3.0702567100524902, "step": 1262 }, { "epoch": 0.06019047619047619, "grad_norm": 0.05639823153614998, "learning_rate": 0.024000000208616257, "loss": 3.0671772956848145, "step": 1264 }, { "epoch": 0.06028571428571428, "grad_norm": 0.05523160472512245, "learning_rate": 0.024000000208616257, "loss": 3.0249438285827637, "step": 1266 }, { "epoch": 0.06038095238095238, "grad_norm": 0.057453662157058716, "learning_rate": 0.024000000208616257, "loss": 3.087273120880127, "step": 1268 }, { "epoch": 0.060476190476190475, "grad_norm": 0.05788185074925423, "learning_rate": 0.024000000208616257, "loss": 3.055483818054199, "step": 1270 }, { "epoch": 0.060571428571428575, "grad_norm": 0.057222433388233185, "learning_rate": 0.024000000208616257, "loss": 3.052868366241455, "step": 1272 }, { "epoch": 0.06066666666666667, "grad_norm": 0.05606599524617195, "learning_rate": 0.024000000208616257, "loss": 3.0848355293273926, "step": 1274 }, { "epoch": 0.06076190476190476, "grad_norm": 0.05571572855114937, "learning_rate": 0.024000000208616257, "loss": 3.067436695098877, "step": 1276 }, { "epoch": 0.06085714285714286, "grad_norm": 0.053575705736875534, "learning_rate": 0.024000000208616257, "loss": 3.0775704383850098, "step": 1278 }, { "epoch": 0.06095238095238095, "grad_norm": 0.054226264357566833, "learning_rate": 0.024000000208616257, "loss": 3.060917615890503, "step": 1280 }, { "epoch": 0.061047619047619045, "grad_norm": 0.05277332291007042, "learning_rate": 0.024000000208616257, "loss": 3.083040714263916, "step": 1282 }, { "epoch": 0.061142857142857145, "grad_norm": 0.05427541211247444, "learning_rate": 0.024000000208616257, "loss": 3.027400016784668, "step": 1284 }, { "epoch": 0.06123809523809524, "grad_norm": 0.05363941565155983, "learning_rate": 0.024000000208616257, "loss": 3.037872314453125, "step": 1286 }, { "epoch": 0.06133333333333333, "grad_norm": 0.05484069511294365, "learning_rate": 0.024000000208616257, "loss": 3.0488343238830566, "step": 1288 }, { "epoch": 0.06142857142857143, "grad_norm": 0.054410722106695175, "learning_rate": 0.024000000208616257, "loss": 3.0742735862731934, "step": 1290 }, { "epoch": 0.06152380952380952, "grad_norm": 0.05448170006275177, "learning_rate": 0.024000000208616257, "loss": 3.0772361755371094, "step": 1292 }, { "epoch": 0.06161904761904762, "grad_norm": 0.053643129765987396, "learning_rate": 0.024000000208616257, "loss": 3.0718836784362793, "step": 1294 }, { "epoch": 0.061714285714285715, "grad_norm": 0.05717478692531586, "learning_rate": 0.024000000208616257, "loss": 3.0542359352111816, "step": 1296 }, { "epoch": 0.06180952380952381, "grad_norm": 0.057955410331487656, "learning_rate": 0.024000000208616257, "loss": 3.0606088638305664, "step": 1298 }, { "epoch": 0.06190476190476191, "grad_norm": 0.05767637863755226, "learning_rate": 0.024000000208616257, "loss": 3.06565523147583, "step": 1300 }, { "epoch": 0.062, "grad_norm": 0.05788761377334595, "learning_rate": 0.024000000208616257, "loss": 3.0516304969787598, "step": 1302 }, { "epoch": 0.06209523809523809, "grad_norm": 0.05905814468860626, "learning_rate": 0.024000000208616257, "loss": 3.0417261123657227, "step": 1304 }, { "epoch": 0.06219047619047619, "grad_norm": 0.05953981727361679, "learning_rate": 0.024000000208616257, "loss": 3.077012062072754, "step": 1306 }, { "epoch": 0.062285714285714285, "grad_norm": 0.05429840832948685, "learning_rate": 0.024000000208616257, "loss": 3.0720133781433105, "step": 1308 }, { "epoch": 0.062380952380952384, "grad_norm": 0.05659131333231926, "learning_rate": 0.024000000208616257, "loss": 3.0504961013793945, "step": 1310 }, { "epoch": 0.06247619047619048, "grad_norm": 0.05538174510002136, "learning_rate": 0.024000000208616257, "loss": 3.0356507301330566, "step": 1312 }, { "epoch": 0.06257142857142857, "grad_norm": 0.056818198412656784, "learning_rate": 0.024000000208616257, "loss": 3.0559210777282715, "step": 1314 }, { "epoch": 0.06266666666666666, "grad_norm": 0.05633227154612541, "learning_rate": 0.024000000208616257, "loss": 3.0519261360168457, "step": 1316 }, { "epoch": 0.06276190476190477, "grad_norm": 0.052252065390348434, "learning_rate": 0.024000000208616257, "loss": 3.0226268768310547, "step": 1318 }, { "epoch": 0.06285714285714286, "grad_norm": 0.05385222285985947, "learning_rate": 0.024000000208616257, "loss": 3.0531070232391357, "step": 1320 }, { "epoch": 0.06295238095238095, "grad_norm": 0.0530044361948967, "learning_rate": 0.024000000208616257, "loss": 3.0255513191223145, "step": 1322 }, { "epoch": 0.06304761904761905, "grad_norm": 0.05505853518843651, "learning_rate": 0.024000000208616257, "loss": 3.0357465744018555, "step": 1324 }, { "epoch": 0.06314285714285714, "grad_norm": 0.0579497404396534, "learning_rate": 0.024000000208616257, "loss": 3.0440921783447266, "step": 1326 }, { "epoch": 0.06323809523809523, "grad_norm": 0.057244379073381424, "learning_rate": 0.024000000208616257, "loss": 3.054093360900879, "step": 1328 }, { "epoch": 0.06333333333333334, "grad_norm": 0.05481645464897156, "learning_rate": 0.024000000208616257, "loss": 3.0809664726257324, "step": 1330 }, { "epoch": 0.06342857142857143, "grad_norm": 0.059082359075546265, "learning_rate": 0.024000000208616257, "loss": 3.0450377464294434, "step": 1332 }, { "epoch": 0.06352380952380952, "grad_norm": 0.054620563983917236, "learning_rate": 0.024000000208616257, "loss": 3.001835346221924, "step": 1334 }, { "epoch": 0.06361904761904762, "grad_norm": 0.0551108755171299, "learning_rate": 0.024000000208616257, "loss": 3.0192904472351074, "step": 1336 }, { "epoch": 0.06371428571428571, "grad_norm": 0.05495007708668709, "learning_rate": 0.024000000208616257, "loss": 2.9814538955688477, "step": 1338 }, { "epoch": 0.06380952380952382, "grad_norm": 0.060208629816770554, "learning_rate": 0.024000000208616257, "loss": 3.0237491130828857, "step": 1340 }, { "epoch": 0.06390476190476191, "grad_norm": 0.05446393042802811, "learning_rate": 0.024000000208616257, "loss": 3.0459742546081543, "step": 1342 }, { "epoch": 0.064, "grad_norm": 0.051229387521743774, "learning_rate": 0.024000000208616257, "loss": 3.0546300411224365, "step": 1344 }, { "epoch": 0.0640952380952381, "grad_norm": 0.053017016500234604, "learning_rate": 0.024000000208616257, "loss": 3.0226893424987793, "step": 1346 }, { "epoch": 0.06419047619047619, "grad_norm": 0.05327665060758591, "learning_rate": 0.024000000208616257, "loss": 2.9940989017486572, "step": 1348 }, { "epoch": 0.06428571428571428, "grad_norm": 0.05563163384795189, "learning_rate": 0.024000000208616257, "loss": 3.0449414253234863, "step": 1350 }, { "epoch": 0.06438095238095239, "grad_norm": 0.055892862379550934, "learning_rate": 0.024000000208616257, "loss": 3.0088772773742676, "step": 1352 }, { "epoch": 0.06447619047619048, "grad_norm": 0.05583472549915314, "learning_rate": 0.024000000208616257, "loss": 3.021486759185791, "step": 1354 }, { "epoch": 0.06457142857142857, "grad_norm": 0.056363992393016815, "learning_rate": 0.024000000208616257, "loss": 3.017400026321411, "step": 1356 }, { "epoch": 0.06466666666666666, "grad_norm": 0.05598435178399086, "learning_rate": 0.024000000208616257, "loss": 2.989924669265747, "step": 1358 }, { "epoch": 0.06476190476190476, "grad_norm": 0.05749648064374924, "learning_rate": 0.024000000208616257, "loss": 3.0302414894104004, "step": 1360 }, { "epoch": 0.06485714285714286, "grad_norm": 0.05641870200634003, "learning_rate": 0.024000000208616257, "loss": 3.0033111572265625, "step": 1362 }, { "epoch": 0.06495238095238096, "grad_norm": 0.0557023286819458, "learning_rate": 0.024000000208616257, "loss": 2.989525318145752, "step": 1364 }, { "epoch": 0.06504761904761905, "grad_norm": 0.054063040763139725, "learning_rate": 0.024000000208616257, "loss": 2.9971821308135986, "step": 1366 }, { "epoch": 0.06514285714285714, "grad_norm": 0.050344355404376984, "learning_rate": 0.024000000208616257, "loss": 3.0008978843688965, "step": 1368 }, { "epoch": 0.06523809523809523, "grad_norm": 0.05040469020605087, "learning_rate": 0.024000000208616257, "loss": 3.0521326065063477, "step": 1370 }, { "epoch": 0.06533333333333333, "grad_norm": 0.056519217789173126, "learning_rate": 0.024000000208616257, "loss": 3.010171890258789, "step": 1372 }, { "epoch": 0.06542857142857143, "grad_norm": 0.05178011208772659, "learning_rate": 0.024000000208616257, "loss": 2.9858317375183105, "step": 1374 }, { "epoch": 0.06552380952380953, "grad_norm": 0.05159865692257881, "learning_rate": 0.024000000208616257, "loss": 3.0254664421081543, "step": 1376 }, { "epoch": 0.06561904761904762, "grad_norm": 0.05314699932932854, "learning_rate": 0.024000000208616257, "loss": 3.0217387676239014, "step": 1378 }, { "epoch": 0.06571428571428571, "grad_norm": 0.051117151975631714, "learning_rate": 0.024000000208616257, "loss": 2.9899749755859375, "step": 1380 }, { "epoch": 0.0658095238095238, "grad_norm": 0.05329446122050285, "learning_rate": 0.024000000208616257, "loss": 2.9847571849823, "step": 1382 }, { "epoch": 0.06590476190476191, "grad_norm": 0.05318654328584671, "learning_rate": 0.024000000208616257, "loss": 3.02400541305542, "step": 1384 }, { "epoch": 0.066, "grad_norm": 0.05273803323507309, "learning_rate": 0.024000000208616257, "loss": 3.001965284347534, "step": 1386 }, { "epoch": 0.0660952380952381, "grad_norm": 0.059401653707027435, "learning_rate": 0.024000000208616257, "loss": 3.0282540321350098, "step": 1388 }, { "epoch": 0.06619047619047619, "grad_norm": 0.05625959858298302, "learning_rate": 0.024000000208616257, "loss": 2.99084734916687, "step": 1390 }, { "epoch": 0.06628571428571428, "grad_norm": 0.055680051445961, "learning_rate": 0.024000000208616257, "loss": 3.02760648727417, "step": 1392 }, { "epoch": 0.06638095238095239, "grad_norm": 0.055258963257074356, "learning_rate": 0.024000000208616257, "loss": 2.9963059425354004, "step": 1394 }, { "epoch": 0.06647619047619048, "grad_norm": 0.055165063589811325, "learning_rate": 0.024000000208616257, "loss": 2.993396282196045, "step": 1396 }, { "epoch": 0.06657142857142857, "grad_norm": 0.055666614323854446, "learning_rate": 0.024000000208616257, "loss": 2.9779701232910156, "step": 1398 }, { "epoch": 0.06666666666666667, "grad_norm": 0.053545158356428146, "learning_rate": 0.024000000208616257, "loss": 2.9770541191101074, "step": 1400 }, { "epoch": 0.06676190476190476, "grad_norm": 0.05078350007534027, "learning_rate": 0.024000000208616257, "loss": 3.0418033599853516, "step": 1402 }, { "epoch": 0.06685714285714285, "grad_norm": 0.053147364407777786, "learning_rate": 0.024000000208616257, "loss": 2.9669225215911865, "step": 1404 }, { "epoch": 0.06695238095238096, "grad_norm": 0.05339110642671585, "learning_rate": 0.024000000208616257, "loss": 2.9853100776672363, "step": 1406 }, { "epoch": 0.06704761904761905, "grad_norm": 0.05479119345545769, "learning_rate": 0.024000000208616257, "loss": 2.9432263374328613, "step": 1408 }, { "epoch": 0.06714285714285714, "grad_norm": 0.05539429932832718, "learning_rate": 0.024000000208616257, "loss": 2.995213508605957, "step": 1410 }, { "epoch": 0.06723809523809524, "grad_norm": 0.054930973798036575, "learning_rate": 0.024000000208616257, "loss": 2.9972450733184814, "step": 1412 }, { "epoch": 0.06733333333333333, "grad_norm": 0.05108562484383583, "learning_rate": 0.024000000208616257, "loss": 2.9776248931884766, "step": 1414 }, { "epoch": 0.06742857142857143, "grad_norm": 0.05199114978313446, "learning_rate": 0.024000000208616257, "loss": 2.9937856197357178, "step": 1416 }, { "epoch": 0.06752380952380953, "grad_norm": 0.05385183170437813, "learning_rate": 0.024000000208616257, "loss": 2.9960269927978516, "step": 1418 }, { "epoch": 0.06761904761904762, "grad_norm": 0.05764460563659668, "learning_rate": 0.024000000208616257, "loss": 2.9696526527404785, "step": 1420 }, { "epoch": 0.06771428571428571, "grad_norm": 0.05284947156906128, "learning_rate": 0.024000000208616257, "loss": 2.9612278938293457, "step": 1422 }, { "epoch": 0.0678095238095238, "grad_norm": 0.05444653704762459, "learning_rate": 0.024000000208616257, "loss": 2.998746871948242, "step": 1424 }, { "epoch": 0.0679047619047619, "grad_norm": 0.054537467658519745, "learning_rate": 0.024000000208616257, "loss": 2.9729442596435547, "step": 1426 }, { "epoch": 0.068, "grad_norm": 0.05496001988649368, "learning_rate": 0.024000000208616257, "loss": 3.013942241668701, "step": 1428 }, { "epoch": 0.0680952380952381, "grad_norm": 0.05087234824895859, "learning_rate": 0.024000000208616257, "loss": 2.961179256439209, "step": 1430 }, { "epoch": 0.06819047619047619, "grad_norm": 0.05314084514975548, "learning_rate": 0.024000000208616257, "loss": 2.9584856033325195, "step": 1432 }, { "epoch": 0.06828571428571428, "grad_norm": 0.05719631910324097, "learning_rate": 0.024000000208616257, "loss": 2.956432342529297, "step": 1434 }, { "epoch": 0.06838095238095238, "grad_norm": 0.05563769489526749, "learning_rate": 0.024000000208616257, "loss": 3.0060951709747314, "step": 1436 }, { "epoch": 0.06847619047619048, "grad_norm": 0.053091928362846375, "learning_rate": 0.024000000208616257, "loss": 2.9785847663879395, "step": 1438 }, { "epoch": 0.06857142857142857, "grad_norm": 0.051365599036216736, "learning_rate": 0.024000000208616257, "loss": 2.955984115600586, "step": 1440 }, { "epoch": 0.06866666666666667, "grad_norm": 0.051559120416641235, "learning_rate": 0.024000000208616257, "loss": 2.933061122894287, "step": 1442 }, { "epoch": 0.06876190476190476, "grad_norm": 0.05057550594210625, "learning_rate": 0.024000000208616257, "loss": 2.991905689239502, "step": 1444 }, { "epoch": 0.06885714285714285, "grad_norm": 0.05389087647199631, "learning_rate": 0.024000000208616257, "loss": 2.9579153060913086, "step": 1446 }, { "epoch": 0.06895238095238095, "grad_norm": 0.05442383885383606, "learning_rate": 0.024000000208616257, "loss": 2.9600930213928223, "step": 1448 }, { "epoch": 0.06904761904761905, "grad_norm": 0.05193992704153061, "learning_rate": 0.024000000208616257, "loss": 2.957550525665283, "step": 1450 }, { "epoch": 0.06914285714285714, "grad_norm": 0.05397174879908562, "learning_rate": 0.024000000208616257, "loss": 2.9609909057617188, "step": 1452 }, { "epoch": 0.06923809523809524, "grad_norm": 0.05526004359126091, "learning_rate": 0.024000000208616257, "loss": 2.9491891860961914, "step": 1454 }, { "epoch": 0.06933333333333333, "grad_norm": 0.052920784801244736, "learning_rate": 0.024000000208616257, "loss": 2.9612784385681152, "step": 1456 }, { "epoch": 0.06942857142857142, "grad_norm": 0.05059688910841942, "learning_rate": 0.024000000208616257, "loss": 2.9757425785064697, "step": 1458 }, { "epoch": 0.06952380952380953, "grad_norm": 0.0504024475812912, "learning_rate": 0.024000000208616257, "loss": 2.950127363204956, "step": 1460 }, { "epoch": 0.06961904761904762, "grad_norm": 0.050467055290937424, "learning_rate": 0.024000000208616257, "loss": 2.9704010486602783, "step": 1462 }, { "epoch": 0.06971428571428571, "grad_norm": 0.0491148866713047, "learning_rate": 0.024000000208616257, "loss": 2.935638904571533, "step": 1464 }, { "epoch": 0.06980952380952381, "grad_norm": 0.05100981518626213, "learning_rate": 0.024000000208616257, "loss": 2.9824423789978027, "step": 1466 }, { "epoch": 0.0699047619047619, "grad_norm": 0.051131974905729294, "learning_rate": 0.024000000208616257, "loss": 2.9281482696533203, "step": 1468 }, { "epoch": 0.07, "grad_norm": 0.05205634981393814, "learning_rate": 0.024000000208616257, "loss": 2.9510130882263184, "step": 1470 }, { "epoch": 0.0700952380952381, "grad_norm": 0.05206327885389328, "learning_rate": 0.024000000208616257, "loss": 2.9778635501861572, "step": 1472 }, { "epoch": 0.07019047619047619, "grad_norm": 0.049035921692848206, "learning_rate": 0.024000000208616257, "loss": 2.9861538410186768, "step": 1474 }, { "epoch": 0.07028571428571428, "grad_norm": 0.04922155663371086, "learning_rate": 0.024000000208616257, "loss": 2.930302619934082, "step": 1476 }, { "epoch": 0.07038095238095238, "grad_norm": 0.05012796074151993, "learning_rate": 0.024000000208616257, "loss": 3.01483154296875, "step": 1478 }, { "epoch": 0.07047619047619047, "grad_norm": 0.05105793476104736, "learning_rate": 0.024000000208616257, "loss": 2.9851787090301514, "step": 1480 }, { "epoch": 0.07057142857142858, "grad_norm": 0.05164980888366699, "learning_rate": 0.024000000208616257, "loss": 2.968639850616455, "step": 1482 }, { "epoch": 0.07066666666666667, "grad_norm": 0.05381036549806595, "learning_rate": 0.024000000208616257, "loss": 2.952967882156372, "step": 1484 }, { "epoch": 0.07076190476190476, "grad_norm": 0.05104340612888336, "learning_rate": 0.024000000208616257, "loss": 2.9537272453308105, "step": 1486 }, { "epoch": 0.07085714285714285, "grad_norm": 0.05003172531723976, "learning_rate": 0.024000000208616257, "loss": 2.95678448677063, "step": 1488 }, { "epoch": 0.07095238095238095, "grad_norm": 0.053165435791015625, "learning_rate": 0.024000000208616257, "loss": 2.939756393432617, "step": 1490 }, { "epoch": 0.07104761904761905, "grad_norm": 0.05094069242477417, "learning_rate": 0.024000000208616257, "loss": 2.9304466247558594, "step": 1492 }, { "epoch": 0.07114285714285715, "grad_norm": 0.05336402729153633, "learning_rate": 0.024000000208616257, "loss": 2.972684383392334, "step": 1494 }, { "epoch": 0.07123809523809524, "grad_norm": 0.05404333770275116, "learning_rate": 0.024000000208616257, "loss": 2.9394259452819824, "step": 1496 }, { "epoch": 0.07133333333333333, "grad_norm": 0.05074213445186615, "learning_rate": 0.024000000208616257, "loss": 2.937626361846924, "step": 1498 }, { "epoch": 0.07142857142857142, "grad_norm": 0.05048748105764389, "learning_rate": 0.024000000208616257, "loss": 2.9671759605407715, "step": 1500 }, { "epoch": 0.07152380952380952, "grad_norm": 0.05700121819972992, "learning_rate": 0.024000000208616257, "loss": 2.9593100547790527, "step": 1502 }, { "epoch": 0.07161904761904762, "grad_norm": 0.05133889988064766, "learning_rate": 0.024000000208616257, "loss": 2.9719390869140625, "step": 1504 }, { "epoch": 0.07171428571428572, "grad_norm": 0.04913727194070816, "learning_rate": 0.024000000208616257, "loss": 2.9642999172210693, "step": 1506 }, { "epoch": 0.07180952380952381, "grad_norm": 0.05593148246407509, "learning_rate": 0.024000000208616257, "loss": 2.953390121459961, "step": 1508 }, { "epoch": 0.0719047619047619, "grad_norm": 0.054479822516441345, "learning_rate": 0.024000000208616257, "loss": 2.947855234146118, "step": 1510 }, { "epoch": 0.072, "grad_norm": 0.05125455930829048, "learning_rate": 0.024000000208616257, "loss": 2.955707311630249, "step": 1512 }, { "epoch": 0.0720952380952381, "grad_norm": 0.05141017958521843, "learning_rate": 0.024000000208616257, "loss": 2.9809012413024902, "step": 1514 }, { "epoch": 0.0721904761904762, "grad_norm": 0.05110297352075577, "learning_rate": 0.024000000208616257, "loss": 2.9538373947143555, "step": 1516 }, { "epoch": 0.07228571428571429, "grad_norm": 0.0498446561396122, "learning_rate": 0.024000000208616257, "loss": 2.986443519592285, "step": 1518 }, { "epoch": 0.07238095238095238, "grad_norm": 0.052777163684368134, "learning_rate": 0.024000000208616257, "loss": 2.954832077026367, "step": 1520 }, { "epoch": 0.07247619047619047, "grad_norm": 0.0540725402534008, "learning_rate": 0.024000000208616257, "loss": 2.9536774158477783, "step": 1522 }, { "epoch": 0.07257142857142856, "grad_norm": 0.053248222917318344, "learning_rate": 0.024000000208616257, "loss": 2.9774022102355957, "step": 1524 }, { "epoch": 0.07266666666666667, "grad_norm": 0.051604487001895905, "learning_rate": 0.024000000208616257, "loss": 2.9838297367095947, "step": 1526 }, { "epoch": 0.07276190476190476, "grad_norm": 0.053434163331985474, "learning_rate": 0.024000000208616257, "loss": 2.934507369995117, "step": 1528 }, { "epoch": 0.07285714285714286, "grad_norm": 0.049254160374403, "learning_rate": 0.024000000208616257, "loss": 2.9355716705322266, "step": 1530 }, { "epoch": 0.07295238095238095, "grad_norm": 0.04825703799724579, "learning_rate": 0.024000000208616257, "loss": 2.9596667289733887, "step": 1532 }, { "epoch": 0.07304761904761904, "grad_norm": 0.051745690405368805, "learning_rate": 0.024000000208616257, "loss": 2.9689760208129883, "step": 1534 }, { "epoch": 0.07314285714285715, "grad_norm": 0.055744338780641556, "learning_rate": 0.024000000208616257, "loss": 2.9682819843292236, "step": 1536 }, { "epoch": 0.07323809523809524, "grad_norm": 0.04985868185758591, "learning_rate": 0.024000000208616257, "loss": 2.962550640106201, "step": 1538 }, { "epoch": 0.07333333333333333, "grad_norm": 0.050407350063323975, "learning_rate": 0.024000000208616257, "loss": 2.962275981903076, "step": 1540 }, { "epoch": 0.07342857142857143, "grad_norm": 0.05071704089641571, "learning_rate": 0.024000000208616257, "loss": 2.960676670074463, "step": 1542 }, { "epoch": 0.07352380952380952, "grad_norm": 0.05203435942530632, "learning_rate": 0.024000000208616257, "loss": 2.9428985118865967, "step": 1544 }, { "epoch": 0.07361904761904763, "grad_norm": 0.05124904587864876, "learning_rate": 0.024000000208616257, "loss": 2.954646110534668, "step": 1546 }, { "epoch": 0.07371428571428572, "grad_norm": 0.0522538460791111, "learning_rate": 0.024000000208616257, "loss": 2.9812703132629395, "step": 1548 }, { "epoch": 0.07380952380952381, "grad_norm": 0.051747582852840424, "learning_rate": 0.024000000208616257, "loss": 3.0026121139526367, "step": 1550 }, { "epoch": 0.0739047619047619, "grad_norm": 0.05250281095504761, "learning_rate": 0.024000000208616257, "loss": 2.9918432235717773, "step": 1552 }, { "epoch": 0.074, "grad_norm": 0.05064147338271141, "learning_rate": 0.024000000208616257, "loss": 2.943103075027466, "step": 1554 }, { "epoch": 0.07409523809523809, "grad_norm": 0.050017327070236206, "learning_rate": 0.024000000208616257, "loss": 2.9461660385131836, "step": 1556 }, { "epoch": 0.0741904761904762, "grad_norm": 0.0501667857170105, "learning_rate": 0.024000000208616257, "loss": 2.940037727355957, "step": 1558 }, { "epoch": 0.07428571428571429, "grad_norm": 0.05168139189481735, "learning_rate": 0.024000000208616257, "loss": 2.998946189880371, "step": 1560 }, { "epoch": 0.07438095238095238, "grad_norm": 0.05031423270702362, "learning_rate": 0.024000000208616257, "loss": 2.9820432662963867, "step": 1562 }, { "epoch": 0.07447619047619047, "grad_norm": 0.052343208342790604, "learning_rate": 0.024000000208616257, "loss": 2.9335556030273438, "step": 1564 }, { "epoch": 0.07457142857142857, "grad_norm": 0.051272597163915634, "learning_rate": 0.024000000208616257, "loss": 2.9939446449279785, "step": 1566 }, { "epoch": 0.07466666666666667, "grad_norm": 0.05321313440799713, "learning_rate": 0.024000000208616257, "loss": 2.9433512687683105, "step": 1568 }, { "epoch": 0.07476190476190477, "grad_norm": 0.05056106299161911, "learning_rate": 0.024000000208616257, "loss": 2.9906277656555176, "step": 1570 }, { "epoch": 0.07485714285714286, "grad_norm": 0.050753768533468246, "learning_rate": 0.024000000208616257, "loss": 2.9522647857666016, "step": 1572 }, { "epoch": 0.07495238095238095, "grad_norm": 0.05238558351993561, "learning_rate": 0.024000000208616257, "loss": 2.999666213989258, "step": 1574 }, { "epoch": 0.07504761904761904, "grad_norm": 0.051249317824840546, "learning_rate": 0.024000000208616257, "loss": 2.9436593055725098, "step": 1576 }, { "epoch": 0.07514285714285714, "grad_norm": 0.05173823982477188, "learning_rate": 0.024000000208616257, "loss": 2.944077253341675, "step": 1578 }, { "epoch": 0.07523809523809524, "grad_norm": 0.05483006313443184, "learning_rate": 0.024000000208616257, "loss": 2.9531617164611816, "step": 1580 }, { "epoch": 0.07533333333333334, "grad_norm": 0.05134297534823418, "learning_rate": 0.024000000208616257, "loss": 2.9907755851745605, "step": 1582 }, { "epoch": 0.07542857142857143, "grad_norm": 0.05116408318281174, "learning_rate": 0.024000000208616257, "loss": 2.972456932067871, "step": 1584 }, { "epoch": 0.07552380952380952, "grad_norm": 0.048827990889549255, "learning_rate": 0.024000000208616257, "loss": 2.974180221557617, "step": 1586 }, { "epoch": 0.07561904761904761, "grad_norm": 0.04789367690682411, "learning_rate": 0.024000000208616257, "loss": 2.9835150241851807, "step": 1588 }, { "epoch": 0.07571428571428572, "grad_norm": 0.048732783645391464, "learning_rate": 0.024000000208616257, "loss": 2.9673824310302734, "step": 1590 }, { "epoch": 0.07580952380952381, "grad_norm": 0.0490325428545475, "learning_rate": 0.024000000208616257, "loss": 2.9274425506591797, "step": 1592 }, { "epoch": 0.0759047619047619, "grad_norm": 0.05035490170121193, "learning_rate": 0.024000000208616257, "loss": 2.937790870666504, "step": 1594 }, { "epoch": 0.076, "grad_norm": 0.05031260848045349, "learning_rate": 0.024000000208616257, "loss": 2.949305295944214, "step": 1596 }, { "epoch": 0.07609523809523809, "grad_norm": 0.04958663508296013, "learning_rate": 0.024000000208616257, "loss": 2.9433674812316895, "step": 1598 }, { "epoch": 0.0761904761904762, "grad_norm": 0.04890432581305504, "learning_rate": 0.024000000208616257, "loss": 2.948641777038574, "step": 1600 }, { "epoch": 0.07628571428571429, "grad_norm": 0.04723256826400757, "learning_rate": 0.024000000208616257, "loss": 2.945173501968384, "step": 1602 }, { "epoch": 0.07638095238095238, "grad_norm": 0.048460956662893295, "learning_rate": 0.024000000208616257, "loss": 2.957202911376953, "step": 1604 }, { "epoch": 0.07647619047619048, "grad_norm": 0.046563368290662766, "learning_rate": 0.024000000208616257, "loss": 2.9298903942108154, "step": 1606 }, { "epoch": 0.07657142857142857, "grad_norm": 0.04844145104289055, "learning_rate": 0.024000000208616257, "loss": 2.9221415519714355, "step": 1608 }, { "epoch": 0.07666666666666666, "grad_norm": 0.04702707380056381, "learning_rate": 0.024000000208616257, "loss": 2.956395149230957, "step": 1610 }, { "epoch": 0.07676190476190477, "grad_norm": 0.05915679782629013, "learning_rate": 0.024000000208616257, "loss": 2.980738639831543, "step": 1612 }, { "epoch": 0.07685714285714286, "grad_norm": 0.04919930174946785, "learning_rate": 0.024000000208616257, "loss": 2.985334634780884, "step": 1614 }, { "epoch": 0.07695238095238095, "grad_norm": 0.047026414424180984, "learning_rate": 0.024000000208616257, "loss": 2.9819750785827637, "step": 1616 }, { "epoch": 0.07704761904761905, "grad_norm": 0.04929918423295021, "learning_rate": 0.024000000208616257, "loss": 2.999006748199463, "step": 1618 }, { "epoch": 0.07714285714285714, "grad_norm": 0.05256955698132515, "learning_rate": 0.024000000208616257, "loss": 2.9548728466033936, "step": 1620 }, { "epoch": 0.07723809523809524, "grad_norm": 0.05229438468813896, "learning_rate": 0.024000000208616257, "loss": 2.9768104553222656, "step": 1622 }, { "epoch": 0.07733333333333334, "grad_norm": 0.051181722432374954, "learning_rate": 0.024000000208616257, "loss": 2.935715913772583, "step": 1624 }, { "epoch": 0.07742857142857143, "grad_norm": 0.05110138654708862, "learning_rate": 0.024000000208616257, "loss": 2.9784393310546875, "step": 1626 }, { "epoch": 0.07752380952380952, "grad_norm": 0.05045212805271149, "learning_rate": 0.024000000208616257, "loss": 2.9721415042877197, "step": 1628 }, { "epoch": 0.07761904761904762, "grad_norm": 0.05290203168988228, "learning_rate": 0.024000000208616257, "loss": 2.9563779830932617, "step": 1630 }, { "epoch": 0.07771428571428571, "grad_norm": 0.05224497616291046, "learning_rate": 0.024000000208616257, "loss": 2.922201633453369, "step": 1632 }, { "epoch": 0.07780952380952381, "grad_norm": 0.05020322650671005, "learning_rate": 0.024000000208616257, "loss": 2.9937567710876465, "step": 1634 }, { "epoch": 0.07790476190476191, "grad_norm": 0.05206846073269844, "learning_rate": 0.024000000208616257, "loss": 2.909306049346924, "step": 1636 }, { "epoch": 0.078, "grad_norm": 0.05338073521852493, "learning_rate": 0.024000000208616257, "loss": 2.9420433044433594, "step": 1638 }, { "epoch": 0.07809523809523809, "grad_norm": 0.053326550871133804, "learning_rate": 0.024000000208616257, "loss": 2.9714150428771973, "step": 1640 }, { "epoch": 0.07819047619047619, "grad_norm": 0.051709383726119995, "learning_rate": 0.024000000208616257, "loss": 2.926772117614746, "step": 1642 }, { "epoch": 0.07828571428571429, "grad_norm": 0.050150658935308456, "learning_rate": 0.024000000208616257, "loss": 2.928222417831421, "step": 1644 }, { "epoch": 0.07838095238095238, "grad_norm": 0.04807840287685394, "learning_rate": 0.024000000208616257, "loss": 2.9870381355285645, "step": 1646 }, { "epoch": 0.07847619047619048, "grad_norm": 0.05002305284142494, "learning_rate": 0.024000000208616257, "loss": 2.914888381958008, "step": 1648 }, { "epoch": 0.07857142857142857, "grad_norm": 0.04878280311822891, "learning_rate": 0.024000000208616257, "loss": 2.9488868713378906, "step": 1650 }, { "epoch": 0.07866666666666666, "grad_norm": 0.050738319754600525, "learning_rate": 0.024000000208616257, "loss": 2.9476637840270996, "step": 1652 }, { "epoch": 0.07876190476190476, "grad_norm": 0.05335826054215431, "learning_rate": 0.024000000208616257, "loss": 2.95307993888855, "step": 1654 }, { "epoch": 0.07885714285714286, "grad_norm": 0.05299368500709534, "learning_rate": 0.024000000208616257, "loss": 2.946465015411377, "step": 1656 }, { "epoch": 0.07895238095238095, "grad_norm": 0.05228763446211815, "learning_rate": 0.024000000208616257, "loss": 2.938046455383301, "step": 1658 }, { "epoch": 0.07904761904761905, "grad_norm": 0.04993869364261627, "learning_rate": 0.024000000208616257, "loss": 2.9637610912323, "step": 1660 }, { "epoch": 0.07914285714285714, "grad_norm": 0.05237402394413948, "learning_rate": 0.024000000208616257, "loss": 2.925386905670166, "step": 1662 }, { "epoch": 0.07923809523809523, "grad_norm": 0.05128273740410805, "learning_rate": 0.024000000208616257, "loss": 2.918161153793335, "step": 1664 }, { "epoch": 0.07933333333333334, "grad_norm": 0.049397796392440796, "learning_rate": 0.024000000208616257, "loss": 2.9336977005004883, "step": 1666 }, { "epoch": 0.07942857142857143, "grad_norm": 0.04721633717417717, "learning_rate": 0.024000000208616257, "loss": 2.915818929672241, "step": 1668 }, { "epoch": 0.07952380952380952, "grad_norm": 0.046410493552684784, "learning_rate": 0.024000000208616257, "loss": 2.9523985385894775, "step": 1670 }, { "epoch": 0.07961904761904762, "grad_norm": 0.047236282378435135, "learning_rate": 0.024000000208616257, "loss": 2.9539542198181152, "step": 1672 }, { "epoch": 0.07971428571428571, "grad_norm": 0.048206545412540436, "learning_rate": 0.024000000208616257, "loss": 2.924769878387451, "step": 1674 }, { "epoch": 0.07980952380952382, "grad_norm": 0.04895470663905144, "learning_rate": 0.024000000208616257, "loss": 2.9760706424713135, "step": 1676 }, { "epoch": 0.07990476190476191, "grad_norm": 0.0469241626560688, "learning_rate": 0.024000000208616257, "loss": 2.944624423980713, "step": 1678 }, { "epoch": 0.08, "grad_norm": 0.05069416016340256, "learning_rate": 0.024000000208616257, "loss": 2.9422690868377686, "step": 1680 }, { "epoch": 0.0800952380952381, "grad_norm": 0.047909315675497055, "learning_rate": 0.024000000208616257, "loss": 2.9560680389404297, "step": 1682 }, { "epoch": 0.08019047619047619, "grad_norm": 0.049206990748643875, "learning_rate": 0.024000000208616257, "loss": 2.926823854446411, "step": 1684 }, { "epoch": 0.08028571428571428, "grad_norm": 0.049896325916051865, "learning_rate": 0.024000000208616257, "loss": 2.9487195014953613, "step": 1686 }, { "epoch": 0.08038095238095239, "grad_norm": 0.04920772835612297, "learning_rate": 0.024000000208616257, "loss": 2.922633409500122, "step": 1688 }, { "epoch": 0.08047619047619048, "grad_norm": 0.047694407403469086, "learning_rate": 0.024000000208616257, "loss": 2.9417123794555664, "step": 1690 }, { "epoch": 0.08057142857142857, "grad_norm": 0.046708762645721436, "learning_rate": 0.024000000208616257, "loss": 2.9191548824310303, "step": 1692 }, { "epoch": 0.08066666666666666, "grad_norm": 0.0494520366191864, "learning_rate": 0.024000000208616257, "loss": 2.943769931793213, "step": 1694 }, { "epoch": 0.08076190476190476, "grad_norm": 0.0505329854786396, "learning_rate": 0.024000000208616257, "loss": 2.9508543014526367, "step": 1696 }, { "epoch": 0.08085714285714286, "grad_norm": 0.05222766473889351, "learning_rate": 0.024000000208616257, "loss": 2.9495925903320312, "step": 1698 }, { "epoch": 0.08095238095238096, "grad_norm": 0.05532173439860344, "learning_rate": 0.024000000208616257, "loss": 2.955954074859619, "step": 1700 }, { "epoch": 0.08104761904761905, "grad_norm": 0.05214424431324005, "learning_rate": 0.024000000208616257, "loss": 2.9537296295166016, "step": 1702 }, { "epoch": 0.08114285714285714, "grad_norm": 0.05549017712473869, "learning_rate": 0.024000000208616257, "loss": 2.9440126419067383, "step": 1704 }, { "epoch": 0.08123809523809523, "grad_norm": 0.048897478729486465, "learning_rate": 0.024000000208616257, "loss": 2.9135632514953613, "step": 1706 }, { "epoch": 0.08133333333333333, "grad_norm": 0.05174533277750015, "learning_rate": 0.024000000208616257, "loss": 2.8939993381500244, "step": 1708 }, { "epoch": 0.08142857142857143, "grad_norm": 0.049746595323085785, "learning_rate": 0.024000000208616257, "loss": 2.937708854675293, "step": 1710 }, { "epoch": 0.08152380952380953, "grad_norm": 0.04751712828874588, "learning_rate": 0.024000000208616257, "loss": 2.936490058898926, "step": 1712 }, { "epoch": 0.08161904761904762, "grad_norm": 0.047995757311582565, "learning_rate": 0.024000000208616257, "loss": 2.917097568511963, "step": 1714 }, { "epoch": 0.08171428571428571, "grad_norm": 0.04844076558947563, "learning_rate": 0.024000000208616257, "loss": 2.896604537963867, "step": 1716 }, { "epoch": 0.0818095238095238, "grad_norm": 0.0512847974896431, "learning_rate": 0.024000000208616257, "loss": 2.912191867828369, "step": 1718 }, { "epoch": 0.08190476190476191, "grad_norm": 0.050481829792261124, "learning_rate": 0.024000000208616257, "loss": 2.899132251739502, "step": 1720 }, { "epoch": 0.082, "grad_norm": 0.0465298555791378, "learning_rate": 0.024000000208616257, "loss": 2.910287857055664, "step": 1722 }, { "epoch": 0.0820952380952381, "grad_norm": 0.04769933223724365, "learning_rate": 0.024000000208616257, "loss": 2.8746402263641357, "step": 1724 }, { "epoch": 0.08219047619047619, "grad_norm": 0.050012752413749695, "learning_rate": 0.024000000208616257, "loss": 2.8983213901519775, "step": 1726 }, { "epoch": 0.08228571428571428, "grad_norm": 0.05396344140172005, "learning_rate": 0.024000000208616257, "loss": 2.904280185699463, "step": 1728 }, { "epoch": 0.08238095238095237, "grad_norm": 0.053190890699625015, "learning_rate": 0.024000000208616257, "loss": 2.8818109035491943, "step": 1730 }, { "epoch": 0.08247619047619048, "grad_norm": 0.048120662569999695, "learning_rate": 0.024000000208616257, "loss": 2.924501657485962, "step": 1732 }, { "epoch": 0.08257142857142857, "grad_norm": 0.04883351922035217, "learning_rate": 0.024000000208616257, "loss": 2.9433979988098145, "step": 1734 }, { "epoch": 0.08266666666666667, "grad_norm": 0.052017178386449814, "learning_rate": 0.024000000208616257, "loss": 2.884570837020874, "step": 1736 }, { "epoch": 0.08276190476190476, "grad_norm": 0.05285165458917618, "learning_rate": 0.024000000208616257, "loss": 2.916743278503418, "step": 1738 }, { "epoch": 0.08285714285714285, "grad_norm": 0.04843684285879135, "learning_rate": 0.024000000208616257, "loss": 2.929807662963867, "step": 1740 }, { "epoch": 0.08295238095238096, "grad_norm": 0.05033249780535698, "learning_rate": 0.024000000208616257, "loss": 2.9302589893341064, "step": 1742 }, { "epoch": 0.08304761904761905, "grad_norm": 0.048141587525606155, "learning_rate": 0.024000000208616257, "loss": 2.923670530319214, "step": 1744 }, { "epoch": 0.08314285714285714, "grad_norm": 0.052375055849552155, "learning_rate": 0.024000000208616257, "loss": 2.912346124649048, "step": 1746 }, { "epoch": 0.08323809523809524, "grad_norm": 0.05359971523284912, "learning_rate": 0.024000000208616257, "loss": 2.933220386505127, "step": 1748 }, { "epoch": 0.08333333333333333, "grad_norm": 0.05416681990027428, "learning_rate": 0.024000000208616257, "loss": 2.9013454914093018, "step": 1750 }, { "epoch": 0.08342857142857144, "grad_norm": 0.05477030947804451, "learning_rate": 0.024000000208616257, "loss": 2.954806327819824, "step": 1752 }, { "epoch": 0.08352380952380953, "grad_norm": 0.0504164844751358, "learning_rate": 0.024000000208616257, "loss": 2.901737928390503, "step": 1754 }, { "epoch": 0.08361904761904762, "grad_norm": 0.0505952462553978, "learning_rate": 0.024000000208616257, "loss": 2.9503352642059326, "step": 1756 }, { "epoch": 0.08371428571428571, "grad_norm": 0.051258429884910583, "learning_rate": 0.024000000208616257, "loss": 2.922111988067627, "step": 1758 }, { "epoch": 0.0838095238095238, "grad_norm": 0.048889029771089554, "learning_rate": 0.024000000208616257, "loss": 2.9323060512542725, "step": 1760 }, { "epoch": 0.0839047619047619, "grad_norm": 0.048582132905721664, "learning_rate": 0.024000000208616257, "loss": 2.9029788970947266, "step": 1762 }, { "epoch": 0.084, "grad_norm": 0.05020999163389206, "learning_rate": 0.024000000208616257, "loss": 2.95003342628479, "step": 1764 }, { "epoch": 0.0840952380952381, "grad_norm": 0.050957951694726944, "learning_rate": 0.024000000208616257, "loss": 2.913956642150879, "step": 1766 }, { "epoch": 0.08419047619047619, "grad_norm": 0.04795093834400177, "learning_rate": 0.024000000208616257, "loss": 2.9243288040161133, "step": 1768 }, { "epoch": 0.08428571428571428, "grad_norm": 0.048361022025346756, "learning_rate": 0.024000000208616257, "loss": 2.932157516479492, "step": 1770 }, { "epoch": 0.08438095238095238, "grad_norm": 0.04864426702260971, "learning_rate": 0.024000000208616257, "loss": 2.922715663909912, "step": 1772 }, { "epoch": 0.08447619047619048, "grad_norm": 0.04898499697446823, "learning_rate": 0.024000000208616257, "loss": 2.9477601051330566, "step": 1774 }, { "epoch": 0.08457142857142858, "grad_norm": 0.0483531653881073, "learning_rate": 0.024000000208616257, "loss": 2.902346611022949, "step": 1776 }, { "epoch": 0.08466666666666667, "grad_norm": 0.05009257048368454, "learning_rate": 0.024000000208616257, "loss": 2.911827325820923, "step": 1778 }, { "epoch": 0.08476190476190476, "grad_norm": 0.04960031434893608, "learning_rate": 0.024000000208616257, "loss": 2.9267053604125977, "step": 1780 }, { "epoch": 0.08485714285714285, "grad_norm": 0.04906485602259636, "learning_rate": 0.024000000208616257, "loss": 2.909885883331299, "step": 1782 }, { "epoch": 0.08495238095238095, "grad_norm": 0.044801630079746246, "learning_rate": 0.024000000208616257, "loss": 2.941408634185791, "step": 1784 }, { "epoch": 0.08504761904761905, "grad_norm": 0.045400481671094894, "learning_rate": 0.024000000208616257, "loss": 2.9211926460266113, "step": 1786 }, { "epoch": 0.08514285714285715, "grad_norm": 0.04736117646098137, "learning_rate": 0.024000000208616257, "loss": 2.9198503494262695, "step": 1788 }, { "epoch": 0.08523809523809524, "grad_norm": 0.04929405450820923, "learning_rate": 0.024000000208616257, "loss": 2.9106826782226562, "step": 1790 }, { "epoch": 0.08533333333333333, "grad_norm": 0.0495775043964386, "learning_rate": 0.024000000208616257, "loss": 2.9230260848999023, "step": 1792 }, { "epoch": 0.08542857142857142, "grad_norm": 0.04621453955769539, "learning_rate": 0.024000000208616257, "loss": 2.9366226196289062, "step": 1794 }, { "epoch": 0.08552380952380953, "grad_norm": 0.04935209080576897, "learning_rate": 0.024000000208616257, "loss": 2.9170100688934326, "step": 1796 }, { "epoch": 0.08561904761904762, "grad_norm": 0.04880139231681824, "learning_rate": 0.024000000208616257, "loss": 2.925306797027588, "step": 1798 }, { "epoch": 0.08571428571428572, "grad_norm": 0.04902074486017227, "learning_rate": 0.024000000208616257, "loss": 2.9086456298828125, "step": 1800 }, { "epoch": 0.08580952380952381, "grad_norm": 0.04751172289252281, "learning_rate": 0.024000000208616257, "loss": 2.926955461502075, "step": 1802 }, { "epoch": 0.0859047619047619, "grad_norm": 0.05038060247898102, "learning_rate": 0.024000000208616257, "loss": 2.9027867317199707, "step": 1804 }, { "epoch": 0.086, "grad_norm": 0.04624738171696663, "learning_rate": 0.024000000208616257, "loss": 2.916271686553955, "step": 1806 }, { "epoch": 0.0860952380952381, "grad_norm": 0.04678872600197792, "learning_rate": 0.024000000208616257, "loss": 2.876336097717285, "step": 1808 }, { "epoch": 0.08619047619047619, "grad_norm": 0.050623569637537, "learning_rate": 0.024000000208616257, "loss": 2.8829941749572754, "step": 1810 }, { "epoch": 0.08628571428571429, "grad_norm": 0.052835430949926376, "learning_rate": 0.024000000208616257, "loss": 2.9349863529205322, "step": 1812 }, { "epoch": 0.08638095238095238, "grad_norm": 0.05240755155682564, "learning_rate": 0.024000000208616257, "loss": 2.871344566345215, "step": 1814 }, { "epoch": 0.08647619047619047, "grad_norm": 0.048297155648469925, "learning_rate": 0.024000000208616257, "loss": 2.902907371520996, "step": 1816 }, { "epoch": 0.08657142857142858, "grad_norm": 0.04735265299677849, "learning_rate": 0.024000000208616257, "loss": 2.919884204864502, "step": 1818 }, { "epoch": 0.08666666666666667, "grad_norm": 0.04946067929267883, "learning_rate": 0.024000000208616257, "loss": 2.9102816581726074, "step": 1820 }, { "epoch": 0.08676190476190476, "grad_norm": 0.05052957683801651, "learning_rate": 0.024000000208616257, "loss": 2.899509906768799, "step": 1822 }, { "epoch": 0.08685714285714285, "grad_norm": 0.047798264771699905, "learning_rate": 0.024000000208616257, "loss": 2.944962501525879, "step": 1824 }, { "epoch": 0.08695238095238095, "grad_norm": 0.04692132771015167, "learning_rate": 0.024000000208616257, "loss": 2.9210376739501953, "step": 1826 }, { "epoch": 0.08704761904761905, "grad_norm": 0.04988217353820801, "learning_rate": 0.024000000208616257, "loss": 2.895080804824829, "step": 1828 }, { "epoch": 0.08714285714285715, "grad_norm": 0.04940056800842285, "learning_rate": 0.024000000208616257, "loss": 2.910677909851074, "step": 1830 }, { "epoch": 0.08723809523809524, "grad_norm": 0.04905298352241516, "learning_rate": 0.024000000208616257, "loss": 2.87399959564209, "step": 1832 }, { "epoch": 0.08733333333333333, "grad_norm": 0.04785619303584099, "learning_rate": 0.024000000208616257, "loss": 2.9453775882720947, "step": 1834 }, { "epoch": 0.08742857142857142, "grad_norm": 0.04924243688583374, "learning_rate": 0.024000000208616257, "loss": 2.871040105819702, "step": 1836 }, { "epoch": 0.08752380952380952, "grad_norm": 0.047585658729076385, "learning_rate": 0.024000000208616257, "loss": 2.9043450355529785, "step": 1838 }, { "epoch": 0.08761904761904762, "grad_norm": 0.051190439611673355, "learning_rate": 0.024000000208616257, "loss": 2.921894073486328, "step": 1840 }, { "epoch": 0.08771428571428572, "grad_norm": 0.0523282065987587, "learning_rate": 0.024000000208616257, "loss": 2.9013051986694336, "step": 1842 }, { "epoch": 0.08780952380952381, "grad_norm": 0.04741648957133293, "learning_rate": 0.024000000208616257, "loss": 2.8834471702575684, "step": 1844 }, { "epoch": 0.0879047619047619, "grad_norm": 0.04696672037243843, "learning_rate": 0.024000000208616257, "loss": 2.919973373413086, "step": 1846 }, { "epoch": 0.088, "grad_norm": 0.04543508216738701, "learning_rate": 0.024000000208616257, "loss": 2.90704345703125, "step": 1848 }, { "epoch": 0.0880952380952381, "grad_norm": 0.045827776193618774, "learning_rate": 0.024000000208616257, "loss": 2.8946852684020996, "step": 1850 }, { "epoch": 0.0881904761904762, "grad_norm": 0.0484558567404747, "learning_rate": 0.024000000208616257, "loss": 2.8845162391662598, "step": 1852 }, { "epoch": 0.08828571428571429, "grad_norm": 0.04969274252653122, "learning_rate": 0.024000000208616257, "loss": 2.896610736846924, "step": 1854 }, { "epoch": 0.08838095238095238, "grad_norm": 0.047750845551490784, "learning_rate": 0.024000000208616257, "loss": 2.925387144088745, "step": 1856 }, { "epoch": 0.08847619047619047, "grad_norm": 0.04754344001412392, "learning_rate": 0.024000000208616257, "loss": 2.9030370712280273, "step": 1858 }, { "epoch": 0.08857142857142856, "grad_norm": 0.04745683819055557, "learning_rate": 0.024000000208616257, "loss": 2.8768744468688965, "step": 1860 }, { "epoch": 0.08866666666666667, "grad_norm": 0.04529402777552605, "learning_rate": 0.024000000208616257, "loss": 2.937650680541992, "step": 1862 }, { "epoch": 0.08876190476190476, "grad_norm": 0.045453060418367386, "learning_rate": 0.024000000208616257, "loss": 2.9259190559387207, "step": 1864 }, { "epoch": 0.08885714285714286, "grad_norm": 0.051195286214351654, "learning_rate": 0.024000000208616257, "loss": 2.8839707374572754, "step": 1866 }, { "epoch": 0.08895238095238095, "grad_norm": 0.051619917154312134, "learning_rate": 0.024000000208616257, "loss": 2.8866395950317383, "step": 1868 }, { "epoch": 0.08904761904761904, "grad_norm": 0.053829122334718704, "learning_rate": 0.024000000208616257, "loss": 2.892927408218384, "step": 1870 }, { "epoch": 0.08914285714285715, "grad_norm": 0.047841109335422516, "learning_rate": 0.024000000208616257, "loss": 2.894252300262451, "step": 1872 }, { "epoch": 0.08923809523809524, "grad_norm": 0.046796709299087524, "learning_rate": 0.024000000208616257, "loss": 2.8708386421203613, "step": 1874 }, { "epoch": 0.08933333333333333, "grad_norm": 0.052024565637111664, "learning_rate": 0.024000000208616257, "loss": 2.859463930130005, "step": 1876 }, { "epoch": 0.08942857142857143, "grad_norm": 0.04834221675992012, "learning_rate": 0.024000000208616257, "loss": 2.8736495971679688, "step": 1878 }, { "epoch": 0.08952380952380952, "grad_norm": 0.04942356422543526, "learning_rate": 0.024000000208616257, "loss": 2.8546204566955566, "step": 1880 }, { "epoch": 0.08961904761904763, "grad_norm": 0.050201307982206345, "learning_rate": 0.024000000208616257, "loss": 2.8966493606567383, "step": 1882 }, { "epoch": 0.08971428571428572, "grad_norm": 0.04961952194571495, "learning_rate": 0.024000000208616257, "loss": 2.832888603210449, "step": 1884 }, { "epoch": 0.08980952380952381, "grad_norm": 0.04845400154590607, "learning_rate": 0.024000000208616257, "loss": 2.9102015495300293, "step": 1886 }, { "epoch": 0.0899047619047619, "grad_norm": 0.04760521650314331, "learning_rate": 0.024000000208616257, "loss": 2.8759899139404297, "step": 1888 }, { "epoch": 0.09, "grad_norm": 0.04865095764398575, "learning_rate": 0.024000000208616257, "loss": 2.873173713684082, "step": 1890 }, { "epoch": 0.09009523809523809, "grad_norm": 0.04782674461603165, "learning_rate": 0.024000000208616257, "loss": 2.8944315910339355, "step": 1892 }, { "epoch": 0.0901904761904762, "grad_norm": 0.04953862726688385, "learning_rate": 0.024000000208616257, "loss": 2.8837642669677734, "step": 1894 }, { "epoch": 0.09028571428571429, "grad_norm": 0.04587021842598915, "learning_rate": 0.024000000208616257, "loss": 2.8647146224975586, "step": 1896 }, { "epoch": 0.09038095238095238, "grad_norm": 0.04698994755744934, "learning_rate": 0.024000000208616257, "loss": 2.8609018325805664, "step": 1898 }, { "epoch": 0.09047619047619047, "grad_norm": 0.05049850419163704, "learning_rate": 0.024000000208616257, "loss": 2.864516496658325, "step": 1900 }, { "epoch": 0.09057142857142857, "grad_norm": 0.046002715826034546, "learning_rate": 0.024000000208616257, "loss": 2.866804838180542, "step": 1902 }, { "epoch": 0.09066666666666667, "grad_norm": 0.04630015045404434, "learning_rate": 0.024000000208616257, "loss": 2.8910927772521973, "step": 1904 }, { "epoch": 0.09076190476190477, "grad_norm": 0.04620473086833954, "learning_rate": 0.024000000208616257, "loss": 2.885674238204956, "step": 1906 }, { "epoch": 0.09085714285714286, "grad_norm": 0.04824550077319145, "learning_rate": 0.024000000208616257, "loss": 2.8710174560546875, "step": 1908 }, { "epoch": 0.09095238095238095, "grad_norm": 0.04841945692896843, "learning_rate": 0.024000000208616257, "loss": 2.8912553787231445, "step": 1910 }, { "epoch": 0.09104761904761904, "grad_norm": 0.049596238881349564, "learning_rate": 0.024000000208616257, "loss": 2.852769613265991, "step": 1912 }, { "epoch": 0.09114285714285714, "grad_norm": 0.04636437073349953, "learning_rate": 0.024000000208616257, "loss": 2.839388370513916, "step": 1914 }, { "epoch": 0.09123809523809524, "grad_norm": 0.04494453966617584, "learning_rate": 0.024000000208616257, "loss": 2.9251198768615723, "step": 1916 }, { "epoch": 0.09133333333333334, "grad_norm": 0.04819165915250778, "learning_rate": 0.024000000208616257, "loss": 2.8807997703552246, "step": 1918 }, { "epoch": 0.09142857142857143, "grad_norm": 0.044840097427368164, "learning_rate": 0.024000000208616257, "loss": 2.865434169769287, "step": 1920 }, { "epoch": 0.09152380952380952, "grad_norm": 0.04443307965993881, "learning_rate": 0.024000000208616257, "loss": 2.8829140663146973, "step": 1922 }, { "epoch": 0.09161904761904761, "grad_norm": 0.04454384371638298, "learning_rate": 0.024000000208616257, "loss": 2.8671813011169434, "step": 1924 }, { "epoch": 0.09171428571428572, "grad_norm": 0.04788820818066597, "learning_rate": 0.024000000208616257, "loss": 2.9038796424865723, "step": 1926 }, { "epoch": 0.09180952380952381, "grad_norm": 0.0465865395963192, "learning_rate": 0.024000000208616257, "loss": 2.866696834564209, "step": 1928 }, { "epoch": 0.0919047619047619, "grad_norm": 0.047647133469581604, "learning_rate": 0.024000000208616257, "loss": 2.885589599609375, "step": 1930 }, { "epoch": 0.092, "grad_norm": 0.04957328736782074, "learning_rate": 0.024000000208616257, "loss": 2.88862943649292, "step": 1932 }, { "epoch": 0.09209523809523809, "grad_norm": 0.048244498670101166, "learning_rate": 0.024000000208616257, "loss": 2.8736824989318848, "step": 1934 }, { "epoch": 0.09219047619047618, "grad_norm": 0.04724639281630516, "learning_rate": 0.024000000208616257, "loss": 2.8921637535095215, "step": 1936 }, { "epoch": 0.09228571428571429, "grad_norm": 0.04675273224711418, "learning_rate": 0.024000000208616257, "loss": 2.8413829803466797, "step": 1938 }, { "epoch": 0.09238095238095238, "grad_norm": 0.04670845717191696, "learning_rate": 0.024000000208616257, "loss": 2.8642895221710205, "step": 1940 }, { "epoch": 0.09247619047619048, "grad_norm": 0.04450660198926926, "learning_rate": 0.024000000208616257, "loss": 2.878390312194824, "step": 1942 }, { "epoch": 0.09257142857142857, "grad_norm": 0.04861907660961151, "learning_rate": 0.024000000208616257, "loss": 2.8296988010406494, "step": 1944 }, { "epoch": 0.09266666666666666, "grad_norm": 0.04889195039868355, "learning_rate": 0.024000000208616257, "loss": 2.8825531005859375, "step": 1946 }, { "epoch": 0.09276190476190477, "grad_norm": 0.04825654625892639, "learning_rate": 0.024000000208616257, "loss": 2.8327250480651855, "step": 1948 }, { "epoch": 0.09285714285714286, "grad_norm": 0.04776325449347496, "learning_rate": 0.024000000208616257, "loss": 2.858691692352295, "step": 1950 }, { "epoch": 0.09295238095238095, "grad_norm": 0.047096576541662216, "learning_rate": 0.024000000208616257, "loss": 2.8326539993286133, "step": 1952 }, { "epoch": 0.09304761904761905, "grad_norm": 0.05279967933893204, "learning_rate": 0.024000000208616257, "loss": 2.842270851135254, "step": 1954 }, { "epoch": 0.09314285714285714, "grad_norm": 0.048733871430158615, "learning_rate": 0.024000000208616257, "loss": 2.8517894744873047, "step": 1956 }, { "epoch": 0.09323809523809524, "grad_norm": 0.04669317230582237, "learning_rate": 0.024000000208616257, "loss": 2.853306293487549, "step": 1958 }, { "epoch": 0.09333333333333334, "grad_norm": 0.04687914624810219, "learning_rate": 0.024000000208616257, "loss": 2.845712661743164, "step": 1960 }, { "epoch": 0.09342857142857143, "grad_norm": 0.04500582441687584, "learning_rate": 0.024000000208616257, "loss": 2.856719732284546, "step": 1962 }, { "epoch": 0.09352380952380952, "grad_norm": 0.04837122559547424, "learning_rate": 0.024000000208616257, "loss": 2.832679271697998, "step": 1964 }, { "epoch": 0.09361904761904762, "grad_norm": 0.04894803836941719, "learning_rate": 0.024000000208616257, "loss": 2.845010757446289, "step": 1966 }, { "epoch": 0.09371428571428571, "grad_norm": 0.04745759442448616, "learning_rate": 0.024000000208616257, "loss": 2.874016523361206, "step": 1968 }, { "epoch": 0.09380952380952381, "grad_norm": 0.04585672914981842, "learning_rate": 0.024000000208616257, "loss": 2.846766471862793, "step": 1970 }, { "epoch": 0.09390476190476191, "grad_norm": 0.046256132423877716, "learning_rate": 0.024000000208616257, "loss": 2.819000720977783, "step": 1972 }, { "epoch": 0.094, "grad_norm": 0.045277297496795654, "learning_rate": 0.024000000208616257, "loss": 2.849764823913574, "step": 1974 }, { "epoch": 0.09409523809523809, "grad_norm": 0.04414394870400429, "learning_rate": 0.024000000208616257, "loss": 2.862924337387085, "step": 1976 }, { "epoch": 0.09419047619047619, "grad_norm": 0.04697718471288681, "learning_rate": 0.024000000208616257, "loss": 2.849367141723633, "step": 1978 }, { "epoch": 0.09428571428571429, "grad_norm": 0.04767430201172829, "learning_rate": 0.024000000208616257, "loss": 2.871857166290283, "step": 1980 }, { "epoch": 0.09438095238095238, "grad_norm": 0.049441032111644745, "learning_rate": 0.024000000208616257, "loss": 2.8404994010925293, "step": 1982 }, { "epoch": 0.09447619047619048, "grad_norm": 0.04973596706986427, "learning_rate": 0.024000000208616257, "loss": 2.8469762802124023, "step": 1984 }, { "epoch": 0.09457142857142857, "grad_norm": 0.04772248491644859, "learning_rate": 0.024000000208616257, "loss": 2.859570026397705, "step": 1986 }, { "epoch": 0.09466666666666666, "grad_norm": 0.04859307035803795, "learning_rate": 0.024000000208616257, "loss": 2.8513991832733154, "step": 1988 }, { "epoch": 0.09476190476190476, "grad_norm": 0.04829339683055878, "learning_rate": 0.024000000208616257, "loss": 2.8382010459899902, "step": 1990 }, { "epoch": 0.09485714285714286, "grad_norm": 0.049595948308706284, "learning_rate": 0.024000000208616257, "loss": 2.8291382789611816, "step": 1992 }, { "epoch": 0.09495238095238095, "grad_norm": 0.04629486799240112, "learning_rate": 0.024000000208616257, "loss": 2.8208744525909424, "step": 1994 }, { "epoch": 0.09504761904761905, "grad_norm": 0.0447094589471817, "learning_rate": 0.024000000208616257, "loss": 2.833498477935791, "step": 1996 }, { "epoch": 0.09514285714285714, "grad_norm": 0.04580864682793617, "learning_rate": 0.024000000208616257, "loss": 2.8686211109161377, "step": 1998 }, { "epoch": 0.09523809523809523, "grad_norm": 0.0470288023352623, "learning_rate": 0.024000000208616257, "loss": 2.8630638122558594, "step": 2000 }, { "epoch": 0.09533333333333334, "grad_norm": 0.04554036259651184, "learning_rate": 0.024000000208616257, "loss": 2.831763744354248, "step": 2002 }, { "epoch": 0.09542857142857143, "grad_norm": 0.04663560166954994, "learning_rate": 0.024000000208616257, "loss": 2.8406424522399902, "step": 2004 }, { "epoch": 0.09552380952380952, "grad_norm": 0.04670238122344017, "learning_rate": 0.024000000208616257, "loss": 2.858717441558838, "step": 2006 }, { "epoch": 0.09561904761904762, "grad_norm": 0.04544892907142639, "learning_rate": 0.024000000208616257, "loss": 2.846251964569092, "step": 2008 }, { "epoch": 0.09571428571428571, "grad_norm": 0.04494383558630943, "learning_rate": 0.024000000208616257, "loss": 2.836210250854492, "step": 2010 }, { "epoch": 0.0958095238095238, "grad_norm": 0.04496229439973831, "learning_rate": 0.024000000208616257, "loss": 2.8258056640625, "step": 2012 }, { "epoch": 0.09590476190476191, "grad_norm": 0.04366561397910118, "learning_rate": 0.024000000208616257, "loss": 2.8283958435058594, "step": 2014 }, { "epoch": 0.096, "grad_norm": 0.043547749519348145, "learning_rate": 0.024000000208616257, "loss": 2.8297252655029297, "step": 2016 }, { "epoch": 0.0960952380952381, "grad_norm": 0.04916880652308464, "learning_rate": 0.024000000208616257, "loss": 2.85078763961792, "step": 2018 }, { "epoch": 0.09619047619047619, "grad_norm": 0.04956594109535217, "learning_rate": 0.024000000208616257, "loss": 2.856487274169922, "step": 2020 }, { "epoch": 0.09628571428571428, "grad_norm": 0.04618437588214874, "learning_rate": 0.024000000208616257, "loss": 2.8403139114379883, "step": 2022 }, { "epoch": 0.09638095238095239, "grad_norm": 0.04574640840291977, "learning_rate": 0.024000000208616257, "loss": 2.8448681831359863, "step": 2024 }, { "epoch": 0.09647619047619048, "grad_norm": 0.04415767267346382, "learning_rate": 0.024000000208616257, "loss": 2.883380174636841, "step": 2026 }, { "epoch": 0.09657142857142857, "grad_norm": 0.04504362866282463, "learning_rate": 0.024000000208616257, "loss": 2.848153591156006, "step": 2028 }, { "epoch": 0.09666666666666666, "grad_norm": 0.043912649154663086, "learning_rate": 0.024000000208616257, "loss": 2.8664803504943848, "step": 2030 }, { "epoch": 0.09676190476190476, "grad_norm": 0.04732342064380646, "learning_rate": 0.024000000208616257, "loss": 2.8426120281219482, "step": 2032 }, { "epoch": 0.09685714285714286, "grad_norm": 0.043381985276937485, "learning_rate": 0.024000000208616257, "loss": 2.8614749908447266, "step": 2034 }, { "epoch": 0.09695238095238096, "grad_norm": 0.043311990797519684, "learning_rate": 0.024000000208616257, "loss": 2.890892505645752, "step": 2036 }, { "epoch": 0.09704761904761905, "grad_norm": 0.04673368111252785, "learning_rate": 0.024000000208616257, "loss": 2.8286983966827393, "step": 2038 }, { "epoch": 0.09714285714285714, "grad_norm": 0.04454313963651657, "learning_rate": 0.024000000208616257, "loss": 2.8314905166625977, "step": 2040 }, { "epoch": 0.09723809523809523, "grad_norm": 0.046734172850847244, "learning_rate": 0.024000000208616257, "loss": 2.8361523151397705, "step": 2042 }, { "epoch": 0.09733333333333333, "grad_norm": 0.04624871164560318, "learning_rate": 0.024000000208616257, "loss": 2.842376232147217, "step": 2044 }, { "epoch": 0.09742857142857143, "grad_norm": 0.04599558562040329, "learning_rate": 0.024000000208616257, "loss": 2.844224452972412, "step": 2046 }, { "epoch": 0.09752380952380953, "grad_norm": 0.04524260014295578, "learning_rate": 0.024000000208616257, "loss": 2.8610355854034424, "step": 2048 }, { "epoch": 0.09761904761904762, "grad_norm": 0.043864425271749496, "learning_rate": 0.024000000208616257, "loss": 2.830440044403076, "step": 2050 }, { "epoch": 0.09771428571428571, "grad_norm": 0.04593706876039505, "learning_rate": 0.024000000208616257, "loss": 2.8175859451293945, "step": 2052 }, { "epoch": 0.0978095238095238, "grad_norm": 0.045440398156642914, "learning_rate": 0.024000000208616257, "loss": 2.8330068588256836, "step": 2054 }, { "epoch": 0.09790476190476191, "grad_norm": 0.047161512076854706, "learning_rate": 0.024000000208616257, "loss": 2.8572006225585938, "step": 2056 }, { "epoch": 0.098, "grad_norm": 0.04605802148580551, "learning_rate": 0.024000000208616257, "loss": 2.8463287353515625, "step": 2058 }, { "epoch": 0.0980952380952381, "grad_norm": 0.045254629105329514, "learning_rate": 0.024000000208616257, "loss": 2.840179681777954, "step": 2060 }, { "epoch": 0.09819047619047619, "grad_norm": 0.05186774581670761, "learning_rate": 0.024000000208616257, "loss": 2.8254218101501465, "step": 2062 }, { "epoch": 0.09828571428571428, "grad_norm": 0.04939455911517143, "learning_rate": 0.024000000208616257, "loss": 2.8321309089660645, "step": 2064 }, { "epoch": 0.09838095238095237, "grad_norm": 0.05161518603563309, "learning_rate": 0.024000000208616257, "loss": 2.884840965270996, "step": 2066 }, { "epoch": 0.09847619047619048, "grad_norm": 0.05238473787903786, "learning_rate": 0.024000000208616257, "loss": 2.8062829971313477, "step": 2068 }, { "epoch": 0.09857142857142857, "grad_norm": 0.047204844653606415, "learning_rate": 0.024000000208616257, "loss": 2.8672332763671875, "step": 2070 }, { "epoch": 0.09866666666666667, "grad_norm": 0.04796832054853439, "learning_rate": 0.024000000208616257, "loss": 2.8585565090179443, "step": 2072 }, { "epoch": 0.09876190476190476, "grad_norm": 0.044070784002542496, "learning_rate": 0.024000000208616257, "loss": 2.840139389038086, "step": 2074 }, { "epoch": 0.09885714285714285, "grad_norm": 0.042820632457733154, "learning_rate": 0.024000000208616257, "loss": 2.8405439853668213, "step": 2076 }, { "epoch": 0.09895238095238096, "grad_norm": 0.0434587337076664, "learning_rate": 0.024000000208616257, "loss": 2.8412208557128906, "step": 2078 }, { "epoch": 0.09904761904761905, "grad_norm": 0.04619544371962547, "learning_rate": 0.024000000208616257, "loss": 2.8065357208251953, "step": 2080 }, { "epoch": 0.09914285714285714, "grad_norm": 0.044262588024139404, "learning_rate": 0.024000000208616257, "loss": 2.8465912342071533, "step": 2082 }, { "epoch": 0.09923809523809524, "grad_norm": 0.04671461880207062, "learning_rate": 0.024000000208616257, "loss": 2.8558590412139893, "step": 2084 }, { "epoch": 0.09933333333333333, "grad_norm": 0.04726586118340492, "learning_rate": 0.024000000208616257, "loss": 2.802800416946411, "step": 2086 }, { "epoch": 0.09942857142857142, "grad_norm": 0.04587564617395401, "learning_rate": 0.024000000208616257, "loss": 2.8421497344970703, "step": 2088 }, { "epoch": 0.09952380952380953, "grad_norm": 0.04731918126344681, "learning_rate": 0.024000000208616257, "loss": 2.869065046310425, "step": 2090 }, { "epoch": 0.09961904761904762, "grad_norm": 0.045317549258470535, "learning_rate": 0.024000000208616257, "loss": 2.830443859100342, "step": 2092 }, { "epoch": 0.09971428571428571, "grad_norm": 0.04637543484568596, "learning_rate": 0.024000000208616257, "loss": 2.8099091053009033, "step": 2094 }, { "epoch": 0.0998095238095238, "grad_norm": 0.048281311988830566, "learning_rate": 0.024000000208616257, "loss": 2.8163256645202637, "step": 2096 }, { "epoch": 0.0999047619047619, "grad_norm": 0.045609377324581146, "learning_rate": 0.024000000208616257, "loss": 2.84521746635437, "step": 2098 }, { "epoch": 0.1, "grad_norm": 0.04590599238872528, "learning_rate": 0.024000000208616257, "loss": 2.8496956825256348, "step": 2100 }, { "epoch": 0.1000952380952381, "grad_norm": 0.046635743230581284, "learning_rate": 0.024000000208616257, "loss": 2.8566818237304688, "step": 2102 }, { "epoch": 0.10019047619047619, "grad_norm": 0.044828761368989944, "learning_rate": 0.024000000208616257, "loss": 2.8403878211975098, "step": 2104 }, { "epoch": 0.10028571428571428, "grad_norm": 0.04601656273007393, "learning_rate": 0.024000000208616257, "loss": 2.872518539428711, "step": 2106 }, { "epoch": 0.10038095238095238, "grad_norm": 0.045710448175668716, "learning_rate": 0.024000000208616257, "loss": 2.8315157890319824, "step": 2108 }, { "epoch": 0.10047619047619048, "grad_norm": 0.04519449919462204, "learning_rate": 0.024000000208616257, "loss": 2.8540096282958984, "step": 2110 }, { "epoch": 0.10057142857142858, "grad_norm": 0.04472912847995758, "learning_rate": 0.024000000208616257, "loss": 2.8516390323638916, "step": 2112 }, { "epoch": 0.10066666666666667, "grad_norm": 0.04309597238898277, "learning_rate": 0.024000000208616257, "loss": 2.856410026550293, "step": 2114 }, { "epoch": 0.10076190476190476, "grad_norm": 0.04461464658379555, "learning_rate": 0.024000000208616257, "loss": 2.86624813079834, "step": 2116 }, { "epoch": 0.10085714285714285, "grad_norm": 0.048866286873817444, "learning_rate": 0.024000000208616257, "loss": 2.7971999645233154, "step": 2118 }, { "epoch": 0.10095238095238095, "grad_norm": 0.05240330845117569, "learning_rate": 0.024000000208616257, "loss": 2.8426027297973633, "step": 2120 }, { "epoch": 0.10104761904761905, "grad_norm": 0.04889432713389397, "learning_rate": 0.024000000208616257, "loss": 2.835803508758545, "step": 2122 }, { "epoch": 0.10114285714285715, "grad_norm": 0.04586942866444588, "learning_rate": 0.024000000208616257, "loss": 2.858893394470215, "step": 2124 }, { "epoch": 0.10123809523809524, "grad_norm": 0.04378058388829231, "learning_rate": 0.024000000208616257, "loss": 2.8306028842926025, "step": 2126 }, { "epoch": 0.10133333333333333, "grad_norm": 0.04321957007050514, "learning_rate": 0.024000000208616257, "loss": 2.8214197158813477, "step": 2128 }, { "epoch": 0.10142857142857142, "grad_norm": 0.04393071308732033, "learning_rate": 0.024000000208616257, "loss": 2.8262834548950195, "step": 2130 }, { "epoch": 0.10152380952380953, "grad_norm": 0.04210207611322403, "learning_rate": 0.024000000208616257, "loss": 2.8061437606811523, "step": 2132 }, { "epoch": 0.10161904761904762, "grad_norm": 0.04229958355426788, "learning_rate": 0.024000000208616257, "loss": 2.8295655250549316, "step": 2134 }, { "epoch": 0.10171428571428572, "grad_norm": 0.04320858418941498, "learning_rate": 0.024000000208616257, "loss": 2.8149302005767822, "step": 2136 }, { "epoch": 0.10180952380952381, "grad_norm": 0.04470789432525635, "learning_rate": 0.024000000208616257, "loss": 2.808070659637451, "step": 2138 }, { "epoch": 0.1019047619047619, "grad_norm": 0.04178925231099129, "learning_rate": 0.024000000208616257, "loss": 2.797851800918579, "step": 2140 }, { "epoch": 0.102, "grad_norm": 0.04365589842200279, "learning_rate": 0.024000000208616257, "loss": 2.7991480827331543, "step": 2142 }, { "epoch": 0.1020952380952381, "grad_norm": 0.043695636093616486, "learning_rate": 0.024000000208616257, "loss": 2.855901002883911, "step": 2144 }, { "epoch": 0.10219047619047619, "grad_norm": 0.045504696667194366, "learning_rate": 0.024000000208616257, "loss": 2.8165531158447266, "step": 2146 }, { "epoch": 0.10228571428571429, "grad_norm": 0.047187674790620804, "learning_rate": 0.024000000208616257, "loss": 2.8199291229248047, "step": 2148 }, { "epoch": 0.10238095238095238, "grad_norm": 0.043682459741830826, "learning_rate": 0.024000000208616257, "loss": 2.839977264404297, "step": 2150 }, { "epoch": 0.10247619047619047, "grad_norm": 0.04365682229399681, "learning_rate": 0.024000000208616257, "loss": 2.826511859893799, "step": 2152 }, { "epoch": 0.10257142857142858, "grad_norm": 0.04749247059226036, "learning_rate": 0.024000000208616257, "loss": 2.843919277191162, "step": 2154 }, { "epoch": 0.10266666666666667, "grad_norm": 0.04342002049088478, "learning_rate": 0.024000000208616257, "loss": 2.8201985359191895, "step": 2156 }, { "epoch": 0.10276190476190476, "grad_norm": 0.04460325092077255, "learning_rate": 0.024000000208616257, "loss": 2.821110725402832, "step": 2158 }, { "epoch": 0.10285714285714286, "grad_norm": 0.04470650479197502, "learning_rate": 0.024000000208616257, "loss": 2.858128547668457, "step": 2160 }, { "epoch": 0.10295238095238095, "grad_norm": 0.04588766768574715, "learning_rate": 0.024000000208616257, "loss": 2.8228402137756348, "step": 2162 }, { "epoch": 0.10304761904761905, "grad_norm": 0.0480223074555397, "learning_rate": 0.024000000208616257, "loss": 2.832181215286255, "step": 2164 }, { "epoch": 0.10314285714285715, "grad_norm": 0.04655365273356438, "learning_rate": 0.024000000208616257, "loss": 2.8186793327331543, "step": 2166 }, { "epoch": 0.10323809523809524, "grad_norm": 0.045809727162122726, "learning_rate": 0.024000000208616257, "loss": 2.8475966453552246, "step": 2168 }, { "epoch": 0.10333333333333333, "grad_norm": 0.043699879199266434, "learning_rate": 0.024000000208616257, "loss": 2.841308355331421, "step": 2170 }, { "epoch": 0.10342857142857143, "grad_norm": 0.0426674485206604, "learning_rate": 0.024000000208616257, "loss": 2.8552589416503906, "step": 2172 }, { "epoch": 0.10352380952380952, "grad_norm": 0.04381323233246803, "learning_rate": 0.024000000208616257, "loss": 2.80580735206604, "step": 2174 }, { "epoch": 0.10361904761904762, "grad_norm": 0.04523113742470741, "learning_rate": 0.024000000208616257, "loss": 2.8417515754699707, "step": 2176 }, { "epoch": 0.10371428571428572, "grad_norm": 0.052583128213882446, "learning_rate": 0.024000000208616257, "loss": 2.7783849239349365, "step": 2178 }, { "epoch": 0.10380952380952381, "grad_norm": 0.04889420047402382, "learning_rate": 0.024000000208616257, "loss": 2.85310435295105, "step": 2180 }, { "epoch": 0.1039047619047619, "grad_norm": 0.05313193425536156, "learning_rate": 0.024000000208616257, "loss": 2.8446478843688965, "step": 2182 }, { "epoch": 0.104, "grad_norm": 0.052939850836992264, "learning_rate": 0.024000000208616257, "loss": 2.8644540309906006, "step": 2184 }, { "epoch": 0.1040952380952381, "grad_norm": 0.04608689248561859, "learning_rate": 0.024000000208616257, "loss": 2.8259527683258057, "step": 2186 }, { "epoch": 0.1041904761904762, "grad_norm": 0.04213324561715126, "learning_rate": 0.024000000208616257, "loss": 2.8431973457336426, "step": 2188 }, { "epoch": 0.10428571428571429, "grad_norm": 0.046848978847265244, "learning_rate": 0.024000000208616257, "loss": 2.795813798904419, "step": 2190 }, { "epoch": 0.10438095238095238, "grad_norm": 0.04308215528726578, "learning_rate": 0.024000000208616257, "loss": 2.7969753742218018, "step": 2192 }, { "epoch": 0.10447619047619047, "grad_norm": 0.043003957718610764, "learning_rate": 0.024000000208616257, "loss": 2.825375556945801, "step": 2194 }, { "epoch": 0.10457142857142857, "grad_norm": 0.046162862330675125, "learning_rate": 0.024000000208616257, "loss": 2.8525490760803223, "step": 2196 }, { "epoch": 0.10466666666666667, "grad_norm": 0.04360783100128174, "learning_rate": 0.024000000208616257, "loss": 2.8352913856506348, "step": 2198 }, { "epoch": 0.10476190476190476, "grad_norm": 0.04429905116558075, "learning_rate": 0.024000000208616257, "loss": 2.8292059898376465, "step": 2200 }, { "epoch": 0.10485714285714286, "grad_norm": 0.048310477286577225, "learning_rate": 0.024000000208616257, "loss": 2.840420722961426, "step": 2202 }, { "epoch": 0.10495238095238095, "grad_norm": 0.05058959126472473, "learning_rate": 0.024000000208616257, "loss": 2.8292698860168457, "step": 2204 }, { "epoch": 0.10504761904761904, "grad_norm": 0.047456055879592896, "learning_rate": 0.024000000208616257, "loss": 2.841060161590576, "step": 2206 }, { "epoch": 0.10514285714285715, "grad_norm": 0.043398693203926086, "learning_rate": 0.024000000208616257, "loss": 2.842210292816162, "step": 2208 }, { "epoch": 0.10523809523809524, "grad_norm": 0.04361608251929283, "learning_rate": 0.024000000208616257, "loss": 2.809234142303467, "step": 2210 }, { "epoch": 0.10533333333333333, "grad_norm": 0.04360458254814148, "learning_rate": 0.024000000208616257, "loss": 2.816373348236084, "step": 2212 }, { "epoch": 0.10542857142857143, "grad_norm": 0.042638182640075684, "learning_rate": 0.024000000208616257, "loss": 2.8265433311462402, "step": 2214 }, { "epoch": 0.10552380952380952, "grad_norm": 0.04298174008727074, "learning_rate": 0.024000000208616257, "loss": 2.8274474143981934, "step": 2216 }, { "epoch": 0.10561904761904761, "grad_norm": 0.04192093759775162, "learning_rate": 0.024000000208616257, "loss": 2.806565046310425, "step": 2218 }, { "epoch": 0.10571428571428572, "grad_norm": 0.0414656400680542, "learning_rate": 0.024000000208616257, "loss": 2.8038058280944824, "step": 2220 }, { "epoch": 0.10580952380952381, "grad_norm": 0.043800484389066696, "learning_rate": 0.024000000208616257, "loss": 2.808396339416504, "step": 2222 }, { "epoch": 0.1059047619047619, "grad_norm": 0.0428471602499485, "learning_rate": 0.024000000208616257, "loss": 2.834014892578125, "step": 2224 }, { "epoch": 0.106, "grad_norm": 0.04332656040787697, "learning_rate": 0.024000000208616257, "loss": 2.8288464546203613, "step": 2226 }, { "epoch": 0.10609523809523809, "grad_norm": 0.04396739974617958, "learning_rate": 0.024000000208616257, "loss": 2.8604636192321777, "step": 2228 }, { "epoch": 0.1061904761904762, "grad_norm": 0.044309601187705994, "learning_rate": 0.024000000208616257, "loss": 2.8745779991149902, "step": 2230 }, { "epoch": 0.10628571428571429, "grad_norm": 0.04606819897890091, "learning_rate": 0.024000000208616257, "loss": 2.85555362701416, "step": 2232 }, { "epoch": 0.10638095238095238, "grad_norm": 0.04263854771852493, "learning_rate": 0.024000000208616257, "loss": 2.819735050201416, "step": 2234 }, { "epoch": 0.10647619047619047, "grad_norm": 0.04349078610539436, "learning_rate": 0.024000000208616257, "loss": 2.82175874710083, "step": 2236 }, { "epoch": 0.10657142857142857, "grad_norm": 0.042073123157024384, "learning_rate": 0.024000000208616257, "loss": 2.8130078315734863, "step": 2238 }, { "epoch": 0.10666666666666667, "grad_norm": 0.041954439133405685, "learning_rate": 0.024000000208616257, "loss": 2.801999807357788, "step": 2240 }, { "epoch": 0.10676190476190477, "grad_norm": 0.04304694011807442, "learning_rate": 0.024000000208616257, "loss": 2.821308135986328, "step": 2242 }, { "epoch": 0.10685714285714286, "grad_norm": 0.04589733108878136, "learning_rate": 0.024000000208616257, "loss": 2.827450752258301, "step": 2244 }, { "epoch": 0.10695238095238095, "grad_norm": 0.04315415769815445, "learning_rate": 0.024000000208616257, "loss": 2.8696911334991455, "step": 2246 }, { "epoch": 0.10704761904761904, "grad_norm": 0.04247879236936569, "learning_rate": 0.024000000208616257, "loss": 2.8103904724121094, "step": 2248 }, { "epoch": 0.10714285714285714, "grad_norm": 0.04258597642183304, "learning_rate": 0.024000000208616257, "loss": 2.8390116691589355, "step": 2250 }, { "epoch": 0.10723809523809524, "grad_norm": 0.04168941453099251, "learning_rate": 0.024000000208616257, "loss": 2.8837156295776367, "step": 2252 }, { "epoch": 0.10733333333333334, "grad_norm": 0.04468107596039772, "learning_rate": 0.024000000208616257, "loss": 2.8262386322021484, "step": 2254 }, { "epoch": 0.10742857142857143, "grad_norm": 0.04520596191287041, "learning_rate": 0.024000000208616257, "loss": 2.8208703994750977, "step": 2256 }, { "epoch": 0.10752380952380952, "grad_norm": 0.04420165345072746, "learning_rate": 0.024000000208616257, "loss": 2.8371129035949707, "step": 2258 }, { "epoch": 0.10761904761904761, "grad_norm": 0.04187846928834915, "learning_rate": 0.024000000208616257, "loss": 2.824359178543091, "step": 2260 }, { "epoch": 0.10771428571428572, "grad_norm": 0.04211211949586868, "learning_rate": 0.024000000208616257, "loss": 2.8429744243621826, "step": 2262 }, { "epoch": 0.10780952380952381, "grad_norm": 0.04149043187499046, "learning_rate": 0.024000000208616257, "loss": 2.860873222351074, "step": 2264 }, { "epoch": 0.1079047619047619, "grad_norm": 0.04406444728374481, "learning_rate": 0.024000000208616257, "loss": 2.8222906589508057, "step": 2266 }, { "epoch": 0.108, "grad_norm": 0.042441558092832565, "learning_rate": 0.024000000208616257, "loss": 2.81638240814209, "step": 2268 }, { "epoch": 0.10809523809523809, "grad_norm": 0.0443294420838356, "learning_rate": 0.024000000208616257, "loss": 2.847189426422119, "step": 2270 }, { "epoch": 0.10819047619047618, "grad_norm": 0.04300334304571152, "learning_rate": 0.024000000208616257, "loss": 2.8115720748901367, "step": 2272 }, { "epoch": 0.10828571428571429, "grad_norm": 0.04425588250160217, "learning_rate": 0.024000000208616257, "loss": 2.8434369564056396, "step": 2274 }, { "epoch": 0.10838095238095238, "grad_norm": 0.04260528087615967, "learning_rate": 0.024000000208616257, "loss": 2.853005886077881, "step": 2276 }, { "epoch": 0.10847619047619048, "grad_norm": 0.04244031757116318, "learning_rate": 0.024000000208616257, "loss": 2.8413069248199463, "step": 2278 }, { "epoch": 0.10857142857142857, "grad_norm": 0.04342708736658096, "learning_rate": 0.024000000208616257, "loss": 2.832235813140869, "step": 2280 }, { "epoch": 0.10866666666666666, "grad_norm": 0.04550527036190033, "learning_rate": 0.024000000208616257, "loss": 2.81189227104187, "step": 2282 }, { "epoch": 0.10876190476190477, "grad_norm": 0.04587160423398018, "learning_rate": 0.024000000208616257, "loss": 2.8236989974975586, "step": 2284 }, { "epoch": 0.10885714285714286, "grad_norm": 0.04425467178225517, "learning_rate": 0.024000000208616257, "loss": 2.818662643432617, "step": 2286 }, { "epoch": 0.10895238095238095, "grad_norm": 0.04258762300014496, "learning_rate": 0.024000000208616257, "loss": 2.874483823776245, "step": 2288 }, { "epoch": 0.10904761904761905, "grad_norm": 0.04587321728467941, "learning_rate": 0.024000000208616257, "loss": 2.8553757667541504, "step": 2290 }, { "epoch": 0.10914285714285714, "grad_norm": 0.0433911494910717, "learning_rate": 0.024000000208616257, "loss": 2.8366546630859375, "step": 2292 }, { "epoch": 0.10923809523809523, "grad_norm": 0.043584879487752914, "learning_rate": 0.024000000208616257, "loss": 2.836789608001709, "step": 2294 }, { "epoch": 0.10933333333333334, "grad_norm": 0.044756993651390076, "learning_rate": 0.024000000208616257, "loss": 2.8138184547424316, "step": 2296 }, { "epoch": 0.10942857142857143, "grad_norm": 0.053319793194532394, "learning_rate": 0.024000000208616257, "loss": 2.867032527923584, "step": 2298 }, { "epoch": 0.10952380952380952, "grad_norm": 0.04646826535463333, "learning_rate": 0.024000000208616257, "loss": 2.8240857124328613, "step": 2300 }, { "epoch": 0.10961904761904762, "grad_norm": 0.04508837312459946, "learning_rate": 0.024000000208616257, "loss": 2.8072800636291504, "step": 2302 }, { "epoch": 0.10971428571428571, "grad_norm": 0.04732076823711395, "learning_rate": 0.024000000208616257, "loss": 2.8292336463928223, "step": 2304 }, { "epoch": 0.10980952380952382, "grad_norm": 0.043903470039367676, "learning_rate": 0.024000000208616257, "loss": 2.854513645172119, "step": 2306 }, { "epoch": 0.10990476190476191, "grad_norm": 0.042101193219423294, "learning_rate": 0.024000000208616257, "loss": 2.788601875305176, "step": 2308 }, { "epoch": 0.11, "grad_norm": 0.043917782604694366, "learning_rate": 0.024000000208616257, "loss": 2.845720052719116, "step": 2310 }, { "epoch": 0.1100952380952381, "grad_norm": 0.042219050228595734, "learning_rate": 0.024000000208616257, "loss": 2.866366147994995, "step": 2312 }, { "epoch": 0.11019047619047619, "grad_norm": 0.04372352361679077, "learning_rate": 0.024000000208616257, "loss": 2.8299593925476074, "step": 2314 }, { "epoch": 0.11028571428571429, "grad_norm": 0.044427335262298584, "learning_rate": 0.024000000208616257, "loss": 2.8645622730255127, "step": 2316 }, { "epoch": 0.11038095238095239, "grad_norm": 0.041419245302677155, "learning_rate": 0.024000000208616257, "loss": 2.830963134765625, "step": 2318 }, { "epoch": 0.11047619047619048, "grad_norm": 0.04397374019026756, "learning_rate": 0.024000000208616257, "loss": 2.849337577819824, "step": 2320 }, { "epoch": 0.11057142857142857, "grad_norm": 0.04290112480521202, "learning_rate": 0.024000000208616257, "loss": 2.805194854736328, "step": 2322 }, { "epoch": 0.11066666666666666, "grad_norm": 0.04386370629072189, "learning_rate": 0.024000000208616257, "loss": 2.8648576736450195, "step": 2324 }, { "epoch": 0.11076190476190476, "grad_norm": 0.0430656298995018, "learning_rate": 0.024000000208616257, "loss": 2.8540968894958496, "step": 2326 }, { "epoch": 0.11085714285714286, "grad_norm": 0.04284806549549103, "learning_rate": 0.024000000208616257, "loss": 2.8408892154693604, "step": 2328 }, { "epoch": 0.11095238095238096, "grad_norm": 0.043848469853401184, "learning_rate": 0.024000000208616257, "loss": 2.847029209136963, "step": 2330 }, { "epoch": 0.11104761904761905, "grad_norm": 0.04454044625163078, "learning_rate": 0.024000000208616257, "loss": 2.8233251571655273, "step": 2332 }, { "epoch": 0.11114285714285714, "grad_norm": 0.04285981133580208, "learning_rate": 0.024000000208616257, "loss": 2.7999281883239746, "step": 2334 }, { "epoch": 0.11123809523809523, "grad_norm": 0.04382999986410141, "learning_rate": 0.024000000208616257, "loss": 2.864316701889038, "step": 2336 }, { "epoch": 0.11133333333333334, "grad_norm": 0.04272577166557312, "learning_rate": 0.024000000208616257, "loss": 2.853971481323242, "step": 2338 }, { "epoch": 0.11142857142857143, "grad_norm": 0.041428983211517334, "learning_rate": 0.024000000208616257, "loss": 2.8278865814208984, "step": 2340 }, { "epoch": 0.11152380952380953, "grad_norm": 0.0410514697432518, "learning_rate": 0.024000000208616257, "loss": 2.8294973373413086, "step": 2342 }, { "epoch": 0.11161904761904762, "grad_norm": 0.04077216982841492, "learning_rate": 0.024000000208616257, "loss": 2.831887722015381, "step": 2344 }, { "epoch": 0.11171428571428571, "grad_norm": 0.04132991284132004, "learning_rate": 0.024000000208616257, "loss": 2.8307251930236816, "step": 2346 }, { "epoch": 0.1118095238095238, "grad_norm": 0.042733702808618546, "learning_rate": 0.024000000208616257, "loss": 2.8326148986816406, "step": 2348 }, { "epoch": 0.11190476190476191, "grad_norm": 0.04239274933934212, "learning_rate": 0.024000000208616257, "loss": 2.8187685012817383, "step": 2350 }, { "epoch": 0.112, "grad_norm": 0.04121135547757149, "learning_rate": 0.024000000208616257, "loss": 2.842602252960205, "step": 2352 }, { "epoch": 0.1120952380952381, "grad_norm": 0.041925784200429916, "learning_rate": 0.024000000208616257, "loss": 2.8838212490081787, "step": 2354 }, { "epoch": 0.11219047619047619, "grad_norm": 0.0406259223818779, "learning_rate": 0.024000000208616257, "loss": 2.8404972553253174, "step": 2356 }, { "epoch": 0.11228571428571428, "grad_norm": 0.042709410190582275, "learning_rate": 0.024000000208616257, "loss": 2.829044818878174, "step": 2358 }, { "epoch": 0.11238095238095239, "grad_norm": 0.045218441635370255, "learning_rate": 0.024000000208616257, "loss": 2.8299612998962402, "step": 2360 }, { "epoch": 0.11247619047619048, "grad_norm": 0.046516768634319305, "learning_rate": 0.024000000208616257, "loss": 2.838028907775879, "step": 2362 }, { "epoch": 0.11257142857142857, "grad_norm": 0.044673603028059006, "learning_rate": 0.024000000208616257, "loss": 2.8082804679870605, "step": 2364 }, { "epoch": 0.11266666666666666, "grad_norm": 0.04215879738330841, "learning_rate": 0.024000000208616257, "loss": 2.861239433288574, "step": 2366 }, { "epoch": 0.11276190476190476, "grad_norm": 0.04143514111638069, "learning_rate": 0.024000000208616257, "loss": 2.8396496772766113, "step": 2368 }, { "epoch": 0.11285714285714285, "grad_norm": 0.0444062314927578, "learning_rate": 0.024000000208616257, "loss": 2.8599491119384766, "step": 2370 }, { "epoch": 0.11295238095238096, "grad_norm": 0.0436428003013134, "learning_rate": 0.024000000208616257, "loss": 2.797435998916626, "step": 2372 }, { "epoch": 0.11304761904761905, "grad_norm": 0.0428193137049675, "learning_rate": 0.024000000208616257, "loss": 2.868582010269165, "step": 2374 }, { "epoch": 0.11314285714285714, "grad_norm": 0.04292425885796547, "learning_rate": 0.024000000208616257, "loss": 2.8202855587005615, "step": 2376 }, { "epoch": 0.11323809523809523, "grad_norm": 0.044168662279844284, "learning_rate": 0.024000000208616257, "loss": 2.811751365661621, "step": 2378 }, { "epoch": 0.11333333333333333, "grad_norm": 0.04495973140001297, "learning_rate": 0.024000000208616257, "loss": 2.848576068878174, "step": 2380 }, { "epoch": 0.11342857142857143, "grad_norm": 0.04679540917277336, "learning_rate": 0.024000000208616257, "loss": 2.863935947418213, "step": 2382 }, { "epoch": 0.11352380952380953, "grad_norm": 0.04426640272140503, "learning_rate": 0.024000000208616257, "loss": 2.8212890625, "step": 2384 }, { "epoch": 0.11361904761904762, "grad_norm": 0.043218426406383514, "learning_rate": 0.024000000208616257, "loss": 2.833470582962036, "step": 2386 }, { "epoch": 0.11371428571428571, "grad_norm": 0.04432336613535881, "learning_rate": 0.024000000208616257, "loss": 2.8554797172546387, "step": 2388 }, { "epoch": 0.1138095238095238, "grad_norm": 0.042223673313856125, "learning_rate": 0.024000000208616257, "loss": 2.8440189361572266, "step": 2390 }, { "epoch": 0.11390476190476191, "grad_norm": 0.04422670975327492, "learning_rate": 0.024000000208616257, "loss": 2.8496994972229004, "step": 2392 }, { "epoch": 0.114, "grad_norm": 0.040997084230184555, "learning_rate": 0.024000000208616257, "loss": 2.8587260246276855, "step": 2394 }, { "epoch": 0.1140952380952381, "grad_norm": 0.04322665557265282, "learning_rate": 0.024000000208616257, "loss": 2.840376377105713, "step": 2396 }, { "epoch": 0.11419047619047619, "grad_norm": 0.04394073411822319, "learning_rate": 0.024000000208616257, "loss": 2.8482980728149414, "step": 2398 }, { "epoch": 0.11428571428571428, "grad_norm": 0.040876634418964386, "learning_rate": 0.024000000208616257, "loss": 2.8109383583068848, "step": 2400 }, { "epoch": 0.11438095238095237, "grad_norm": 0.043771810829639435, "learning_rate": 0.024000000208616257, "loss": 2.8027424812316895, "step": 2402 }, { "epoch": 0.11447619047619048, "grad_norm": 0.043264951556921005, "learning_rate": 0.024000000208616257, "loss": 2.817607879638672, "step": 2404 }, { "epoch": 0.11457142857142857, "grad_norm": 0.04173532500863075, "learning_rate": 0.024000000208616257, "loss": 2.8312740325927734, "step": 2406 }, { "epoch": 0.11466666666666667, "grad_norm": 0.04291177913546562, "learning_rate": 0.024000000208616257, "loss": 2.816741943359375, "step": 2408 }, { "epoch": 0.11476190476190476, "grad_norm": 0.04172365739941597, "learning_rate": 0.024000000208616257, "loss": 2.8402504920959473, "step": 2410 }, { "epoch": 0.11485714285714285, "grad_norm": 0.04213319718837738, "learning_rate": 0.024000000208616257, "loss": 2.8233413696289062, "step": 2412 }, { "epoch": 0.11495238095238096, "grad_norm": 0.044634535908699036, "learning_rate": 0.024000000208616257, "loss": 2.8353424072265625, "step": 2414 }, { "epoch": 0.11504761904761905, "grad_norm": 0.04112102463841438, "learning_rate": 0.024000000208616257, "loss": 2.8723654747009277, "step": 2416 }, { "epoch": 0.11514285714285714, "grad_norm": 0.04054361209273338, "learning_rate": 0.024000000208616257, "loss": 2.793976306915283, "step": 2418 }, { "epoch": 0.11523809523809524, "grad_norm": 0.042160842567682266, "learning_rate": 0.024000000208616257, "loss": 2.843012571334839, "step": 2420 }, { "epoch": 0.11533333333333333, "grad_norm": 0.04311958700418472, "learning_rate": 0.024000000208616257, "loss": 2.8622488975524902, "step": 2422 }, { "epoch": 0.11542857142857142, "grad_norm": 0.0469115674495697, "learning_rate": 0.024000000208616257, "loss": 2.834247350692749, "step": 2424 }, { "epoch": 0.11552380952380953, "grad_norm": 0.043748702853918076, "learning_rate": 0.024000000208616257, "loss": 2.8269705772399902, "step": 2426 }, { "epoch": 0.11561904761904762, "grad_norm": 0.042724478989839554, "learning_rate": 0.024000000208616257, "loss": 2.8371024131774902, "step": 2428 }, { "epoch": 0.11571428571428571, "grad_norm": 0.04362207278609276, "learning_rate": 0.024000000208616257, "loss": 2.8114664554595947, "step": 2430 }, { "epoch": 0.1158095238095238, "grad_norm": 0.04225478321313858, "learning_rate": 0.024000000208616257, "loss": 2.8217904567718506, "step": 2432 }, { "epoch": 0.1159047619047619, "grad_norm": 0.04482317715883255, "learning_rate": 0.024000000208616257, "loss": 2.7999391555786133, "step": 2434 }, { "epoch": 0.116, "grad_norm": 0.043676137924194336, "learning_rate": 0.024000000208616257, "loss": 2.8291964530944824, "step": 2436 }, { "epoch": 0.1160952380952381, "grad_norm": 0.042820390313863754, "learning_rate": 0.024000000208616257, "loss": 2.8213815689086914, "step": 2438 }, { "epoch": 0.11619047619047619, "grad_norm": 0.04170040413737297, "learning_rate": 0.024000000208616257, "loss": 2.857628345489502, "step": 2440 }, { "epoch": 0.11628571428571428, "grad_norm": 0.0409671850502491, "learning_rate": 0.024000000208616257, "loss": 2.8355746269226074, "step": 2442 }, { "epoch": 0.11638095238095238, "grad_norm": 0.042207904160022736, "learning_rate": 0.024000000208616257, "loss": 2.8353703022003174, "step": 2444 }, { "epoch": 0.11647619047619047, "grad_norm": 0.042373593896627426, "learning_rate": 0.024000000208616257, "loss": 2.8219804763793945, "step": 2446 }, { "epoch": 0.11657142857142858, "grad_norm": 0.04138309881091118, "learning_rate": 0.024000000208616257, "loss": 2.855465888977051, "step": 2448 }, { "epoch": 0.11666666666666667, "grad_norm": 0.042857978492975235, "learning_rate": 0.024000000208616257, "loss": 2.846458911895752, "step": 2450 }, { "epoch": 0.11676190476190476, "grad_norm": 0.04180941358208656, "learning_rate": 0.024000000208616257, "loss": 2.831083059310913, "step": 2452 }, { "epoch": 0.11685714285714285, "grad_norm": 0.041938502341508865, "learning_rate": 0.024000000208616257, "loss": 2.8106977939605713, "step": 2454 }, { "epoch": 0.11695238095238095, "grad_norm": 0.04620752111077309, "learning_rate": 0.024000000208616257, "loss": 2.8303287029266357, "step": 2456 }, { "epoch": 0.11704761904761905, "grad_norm": 0.04594069719314575, "learning_rate": 0.024000000208616257, "loss": 2.8401880264282227, "step": 2458 }, { "epoch": 0.11714285714285715, "grad_norm": 0.04343053698539734, "learning_rate": 0.024000000208616257, "loss": 2.8270816802978516, "step": 2460 }, { "epoch": 0.11723809523809524, "grad_norm": 0.04365908354520798, "learning_rate": 0.024000000208616257, "loss": 2.8401761054992676, "step": 2462 }, { "epoch": 0.11733333333333333, "grad_norm": 0.0409209243953228, "learning_rate": 0.024000000208616257, "loss": 2.824024200439453, "step": 2464 }, { "epoch": 0.11742857142857142, "grad_norm": 0.0426412895321846, "learning_rate": 0.024000000208616257, "loss": 2.83526611328125, "step": 2466 }, { "epoch": 0.11752380952380953, "grad_norm": 0.041445523500442505, "learning_rate": 0.024000000208616257, "loss": 2.8397469520568848, "step": 2468 }, { "epoch": 0.11761904761904762, "grad_norm": 0.04184895008802414, "learning_rate": 0.024000000208616257, "loss": 2.8130381107330322, "step": 2470 }, { "epoch": 0.11771428571428572, "grad_norm": 0.0399913527071476, "learning_rate": 0.024000000208616257, "loss": 2.8357410430908203, "step": 2472 }, { "epoch": 0.11780952380952381, "grad_norm": 0.040286775678396225, "learning_rate": 0.024000000208616257, "loss": 2.872114896774292, "step": 2474 }, { "epoch": 0.1179047619047619, "grad_norm": 0.04195312783122063, "learning_rate": 0.024000000208616257, "loss": 2.8432769775390625, "step": 2476 }, { "epoch": 0.118, "grad_norm": 0.0407257042825222, "learning_rate": 0.024000000208616257, "loss": 2.821531295776367, "step": 2478 }, { "epoch": 0.1180952380952381, "grad_norm": 0.043279532343149185, "learning_rate": 0.024000000208616257, "loss": 2.832317352294922, "step": 2480 }, { "epoch": 0.11819047619047619, "grad_norm": 0.04548255726695061, "learning_rate": 0.024000000208616257, "loss": 2.841709613800049, "step": 2482 }, { "epoch": 0.11828571428571429, "grad_norm": 0.04240364208817482, "learning_rate": 0.024000000208616257, "loss": 2.8658716678619385, "step": 2484 }, { "epoch": 0.11838095238095238, "grad_norm": 0.04236829653382301, "learning_rate": 0.024000000208616257, "loss": 2.850191116333008, "step": 2486 }, { "epoch": 0.11847619047619047, "grad_norm": 0.04410003125667572, "learning_rate": 0.024000000208616257, "loss": 2.831181764602661, "step": 2488 }, { "epoch": 0.11857142857142858, "grad_norm": 0.04144475236535072, "learning_rate": 0.024000000208616257, "loss": 2.818572521209717, "step": 2490 }, { "epoch": 0.11866666666666667, "grad_norm": 0.04223351553082466, "learning_rate": 0.024000000208616257, "loss": 2.822672128677368, "step": 2492 }, { "epoch": 0.11876190476190476, "grad_norm": 0.04332510009407997, "learning_rate": 0.024000000208616257, "loss": 2.8019838333129883, "step": 2494 }, { "epoch": 0.11885714285714286, "grad_norm": 0.04312538355588913, "learning_rate": 0.024000000208616257, "loss": 2.812119960784912, "step": 2496 }, { "epoch": 0.11895238095238095, "grad_norm": 0.042870163917541504, "learning_rate": 0.024000000208616257, "loss": 2.8283934593200684, "step": 2498 }, { "epoch": 0.11904761904761904, "grad_norm": 0.04303615912795067, "learning_rate": 0.024000000208616257, "loss": 2.8259434700012207, "step": 2500 }, { "epoch": 0.11914285714285715, "grad_norm": 0.04287268593907356, "learning_rate": 0.024000000208616257, "loss": 2.791656970977783, "step": 2502 }, { "epoch": 0.11923809523809524, "grad_norm": 0.044576600193977356, "learning_rate": 0.024000000208616257, "loss": 2.809335708618164, "step": 2504 }, { "epoch": 0.11933333333333333, "grad_norm": 0.04174851253628731, "learning_rate": 0.024000000208616257, "loss": 2.8525495529174805, "step": 2506 }, { "epoch": 0.11942857142857143, "grad_norm": 0.043079923838377, "learning_rate": 0.024000000208616257, "loss": 2.826742172241211, "step": 2508 }, { "epoch": 0.11952380952380952, "grad_norm": 0.04116980358958244, "learning_rate": 0.024000000208616257, "loss": 2.8250632286071777, "step": 2510 }, { "epoch": 0.11961904761904762, "grad_norm": 0.04109499230980873, "learning_rate": 0.024000000208616257, "loss": 2.8161730766296387, "step": 2512 }, { "epoch": 0.11971428571428572, "grad_norm": 0.04191192239522934, "learning_rate": 0.024000000208616257, "loss": 2.824246883392334, "step": 2514 }, { "epoch": 0.11980952380952381, "grad_norm": 0.04260021075606346, "learning_rate": 0.024000000208616257, "loss": 2.805546283721924, "step": 2516 }, { "epoch": 0.1199047619047619, "grad_norm": 0.039424169808626175, "learning_rate": 0.024000000208616257, "loss": 2.8421409130096436, "step": 2518 }, { "epoch": 0.12, "grad_norm": 0.03969598561525345, "learning_rate": 0.024000000208616257, "loss": 2.837010383605957, "step": 2520 }, { "epoch": 0.1200952380952381, "grad_norm": 0.042548663914203644, "learning_rate": 0.024000000208616257, "loss": 2.797226905822754, "step": 2522 }, { "epoch": 0.1201904761904762, "grad_norm": 0.04068288207054138, "learning_rate": 0.024000000208616257, "loss": 2.8313212394714355, "step": 2524 }, { "epoch": 0.12028571428571429, "grad_norm": 0.040572330355644226, "learning_rate": 0.024000000208616257, "loss": 2.8244404792785645, "step": 2526 }, { "epoch": 0.12038095238095238, "grad_norm": 0.04358648136258125, "learning_rate": 0.024000000208616257, "loss": 2.8327105045318604, "step": 2528 }, { "epoch": 0.12047619047619047, "grad_norm": 0.040242988616228104, "learning_rate": 0.024000000208616257, "loss": 2.8164312839508057, "step": 2530 }, { "epoch": 0.12057142857142857, "grad_norm": 0.041757237166166306, "learning_rate": 0.024000000208616257, "loss": 2.839569330215454, "step": 2532 }, { "epoch": 0.12066666666666667, "grad_norm": 0.04144726321101189, "learning_rate": 0.024000000208616257, "loss": 2.8269295692443848, "step": 2534 }, { "epoch": 0.12076190476190476, "grad_norm": 0.041154976934194565, "learning_rate": 0.024000000208616257, "loss": 2.7893707752227783, "step": 2536 }, { "epoch": 0.12085714285714286, "grad_norm": 0.041517194360494614, "learning_rate": 0.024000000208616257, "loss": 2.8037023544311523, "step": 2538 }, { "epoch": 0.12095238095238095, "grad_norm": 0.041037652641534805, "learning_rate": 0.024000000208616257, "loss": 2.7912702560424805, "step": 2540 }, { "epoch": 0.12104761904761904, "grad_norm": 0.04032597318291664, "learning_rate": 0.024000000208616257, "loss": 2.8323111534118652, "step": 2542 }, { "epoch": 0.12114285714285715, "grad_norm": 0.04222707450389862, "learning_rate": 0.024000000208616257, "loss": 2.840578317642212, "step": 2544 }, { "epoch": 0.12123809523809524, "grad_norm": 0.04219461604952812, "learning_rate": 0.024000000208616257, "loss": 2.8192298412323, "step": 2546 }, { "epoch": 0.12133333333333333, "grad_norm": 0.04300006479024887, "learning_rate": 0.024000000208616257, "loss": 2.8006722927093506, "step": 2548 }, { "epoch": 0.12142857142857143, "grad_norm": 0.040970053523778915, "learning_rate": 0.024000000208616257, "loss": 2.8169565200805664, "step": 2550 }, { "epoch": 0.12152380952380952, "grad_norm": 0.04170817509293556, "learning_rate": 0.024000000208616257, "loss": 2.795762062072754, "step": 2552 }, { "epoch": 0.12161904761904761, "grad_norm": 0.039905671030282974, "learning_rate": 0.024000000208616257, "loss": 2.812732458114624, "step": 2554 }, { "epoch": 0.12171428571428572, "grad_norm": 0.04187404736876488, "learning_rate": 0.024000000208616257, "loss": 2.8021366596221924, "step": 2556 }, { "epoch": 0.12180952380952381, "grad_norm": 0.041201017796993256, "learning_rate": 0.024000000208616257, "loss": 2.834861993789673, "step": 2558 }, { "epoch": 0.1219047619047619, "grad_norm": 0.04161055386066437, "learning_rate": 0.024000000208616257, "loss": 2.827259063720703, "step": 2560 }, { "epoch": 0.122, "grad_norm": 0.04024839773774147, "learning_rate": 0.024000000208616257, "loss": 2.7820394039154053, "step": 2562 }, { "epoch": 0.12209523809523809, "grad_norm": 0.042443837970495224, "learning_rate": 0.024000000208616257, "loss": 2.809875965118408, "step": 2564 }, { "epoch": 0.1221904761904762, "grad_norm": 0.04276329278945923, "learning_rate": 0.024000000208616257, "loss": 2.7907843589782715, "step": 2566 }, { "epoch": 0.12228571428571429, "grad_norm": 0.041821978986263275, "learning_rate": 0.024000000208616257, "loss": 2.8167150020599365, "step": 2568 }, { "epoch": 0.12238095238095238, "grad_norm": 0.04059464484453201, "learning_rate": 0.024000000208616257, "loss": 2.8164660930633545, "step": 2570 }, { "epoch": 0.12247619047619047, "grad_norm": 0.042192861437797546, "learning_rate": 0.024000000208616257, "loss": 2.813122272491455, "step": 2572 }, { "epoch": 0.12257142857142857, "grad_norm": 0.04232925549149513, "learning_rate": 0.024000000208616257, "loss": 2.7901129722595215, "step": 2574 }, { "epoch": 0.12266666666666666, "grad_norm": 0.04282986372709274, "learning_rate": 0.024000000208616257, "loss": 2.780177116394043, "step": 2576 }, { "epoch": 0.12276190476190477, "grad_norm": 0.03994080424308777, "learning_rate": 0.024000000208616257, "loss": 2.7782464027404785, "step": 2578 }, { "epoch": 0.12285714285714286, "grad_norm": 0.040026143193244934, "learning_rate": 0.024000000208616257, "loss": 2.7961816787719727, "step": 2580 }, { "epoch": 0.12295238095238095, "grad_norm": 0.04466131329536438, "learning_rate": 0.024000000208616257, "loss": 2.7859439849853516, "step": 2582 }, { "epoch": 0.12304761904761904, "grad_norm": 0.04065300151705742, "learning_rate": 0.024000000208616257, "loss": 2.821704149246216, "step": 2584 }, { "epoch": 0.12314285714285714, "grad_norm": 0.041388481855392456, "learning_rate": 0.024000000208616257, "loss": 2.8279848098754883, "step": 2586 }, { "epoch": 0.12323809523809524, "grad_norm": 0.03929205983877182, "learning_rate": 0.024000000208616257, "loss": 2.77022123336792, "step": 2588 }, { "epoch": 0.12333333333333334, "grad_norm": 0.041244663298130035, "learning_rate": 0.024000000208616257, "loss": 2.7936577796936035, "step": 2590 }, { "epoch": 0.12342857142857143, "grad_norm": 0.041991300880908966, "learning_rate": 0.024000000208616257, "loss": 2.7876901626586914, "step": 2592 }, { "epoch": 0.12352380952380952, "grad_norm": 0.041687339544296265, "learning_rate": 0.024000000208616257, "loss": 2.7761549949645996, "step": 2594 }, { "epoch": 0.12361904761904761, "grad_norm": 0.04078041762113571, "learning_rate": 0.024000000208616257, "loss": 2.7935638427734375, "step": 2596 }, { "epoch": 0.12371428571428572, "grad_norm": 0.041737768799066544, "learning_rate": 0.024000000208616257, "loss": 2.7783260345458984, "step": 2598 }, { "epoch": 0.12380952380952381, "grad_norm": 0.04125306010246277, "learning_rate": 0.024000000208616257, "loss": 2.76729154586792, "step": 2600 }, { "epoch": 0.1239047619047619, "grad_norm": 0.04213384911417961, "learning_rate": 0.024000000208616257, "loss": 2.78336238861084, "step": 2602 }, { "epoch": 0.124, "grad_norm": 0.042800646275281906, "learning_rate": 0.024000000208616257, "loss": 2.8083114624023438, "step": 2604 }, { "epoch": 0.12409523809523809, "grad_norm": 0.03879621624946594, "learning_rate": 0.024000000208616257, "loss": 2.7956390380859375, "step": 2606 }, { "epoch": 0.12419047619047618, "grad_norm": 0.03873562812805176, "learning_rate": 0.024000000208616257, "loss": 2.7316794395446777, "step": 2608 }, { "epoch": 0.12428571428571429, "grad_norm": 0.0406021811068058, "learning_rate": 0.024000000208616257, "loss": 2.8145947456359863, "step": 2610 }, { "epoch": 0.12438095238095238, "grad_norm": 0.040496669709682465, "learning_rate": 0.024000000208616257, "loss": 2.78377628326416, "step": 2612 }, { "epoch": 0.12447619047619048, "grad_norm": 0.041629184037446976, "learning_rate": 0.024000000208616257, "loss": 2.7749762535095215, "step": 2614 }, { "epoch": 0.12457142857142857, "grad_norm": 0.04244022071361542, "learning_rate": 0.024000000208616257, "loss": 2.8054652214050293, "step": 2616 }, { "epoch": 0.12466666666666666, "grad_norm": 0.04082432761788368, "learning_rate": 0.024000000208616257, "loss": 2.776865005493164, "step": 2618 }, { "epoch": 0.12476190476190477, "grad_norm": 0.04231296852231026, "learning_rate": 0.024000000208616257, "loss": 2.777987003326416, "step": 2620 }, { "epoch": 0.12485714285714286, "grad_norm": 0.041969235986471176, "learning_rate": 0.024000000208616257, "loss": 2.788653612136841, "step": 2622 }, { "epoch": 0.12495238095238095, "grad_norm": 0.04375968873500824, "learning_rate": 0.024000000208616257, "loss": 2.7525391578674316, "step": 2624 }, { "epoch": 0.12504761904761905, "grad_norm": 0.04146707430481911, "learning_rate": 0.024000000208616257, "loss": 2.781435251235962, "step": 2626 }, { "epoch": 0.12514285714285714, "grad_norm": 0.04309874027967453, "learning_rate": 0.024000000208616257, "loss": 2.775402307510376, "step": 2628 }, { "epoch": 0.12523809523809523, "grad_norm": 0.04354269802570343, "learning_rate": 0.024000000208616257, "loss": 2.7576117515563965, "step": 2630 }, { "epoch": 0.12533333333333332, "grad_norm": 0.04040273651480675, "learning_rate": 0.024000000208616257, "loss": 2.7722115516662598, "step": 2632 }, { "epoch": 0.12542857142857142, "grad_norm": 0.04038441553711891, "learning_rate": 0.024000000208616257, "loss": 2.7637338638305664, "step": 2634 }, { "epoch": 0.12552380952380954, "grad_norm": 0.041502632200717926, "learning_rate": 0.024000000208616257, "loss": 2.7595763206481934, "step": 2636 }, { "epoch": 0.12561904761904763, "grad_norm": 0.04005318135023117, "learning_rate": 0.024000000208616257, "loss": 2.7612314224243164, "step": 2638 }, { "epoch": 0.12571428571428572, "grad_norm": 0.039453305304050446, "learning_rate": 0.024000000208616257, "loss": 2.7850496768951416, "step": 2640 }, { "epoch": 0.12580952380952382, "grad_norm": 0.038929879665374756, "learning_rate": 0.024000000208616257, "loss": 2.764094352722168, "step": 2642 }, { "epoch": 0.1259047619047619, "grad_norm": 0.04150986298918724, "learning_rate": 0.024000000208616257, "loss": 2.782787561416626, "step": 2644 }, { "epoch": 0.126, "grad_norm": 0.041197072714567184, "learning_rate": 0.024000000208616257, "loss": 2.784712314605713, "step": 2646 }, { "epoch": 0.1260952380952381, "grad_norm": 0.04141385853290558, "learning_rate": 0.024000000208616257, "loss": 2.7543816566467285, "step": 2648 }, { "epoch": 0.1261904761904762, "grad_norm": 0.039842285215854645, "learning_rate": 0.024000000208616257, "loss": 2.731278419494629, "step": 2650 }, { "epoch": 0.12628571428571428, "grad_norm": 0.04048708826303482, "learning_rate": 0.024000000208616257, "loss": 2.766152858734131, "step": 2652 }, { "epoch": 0.12638095238095237, "grad_norm": 0.041250403970479965, "learning_rate": 0.024000000208616257, "loss": 2.781827926635742, "step": 2654 }, { "epoch": 0.12647619047619046, "grad_norm": 0.042609550058841705, "learning_rate": 0.024000000208616257, "loss": 2.741605043411255, "step": 2656 }, { "epoch": 0.12657142857142858, "grad_norm": 0.0402979776263237, "learning_rate": 0.024000000208616257, "loss": 2.748196601867676, "step": 2658 }, { "epoch": 0.12666666666666668, "grad_norm": 0.04009581729769707, "learning_rate": 0.024000000208616257, "loss": 2.760648250579834, "step": 2660 }, { "epoch": 0.12676190476190477, "grad_norm": 0.043276235461235046, "learning_rate": 0.024000000208616257, "loss": 2.757265567779541, "step": 2662 }, { "epoch": 0.12685714285714286, "grad_norm": 0.04315818473696709, "learning_rate": 0.024000000208616257, "loss": 2.7829556465148926, "step": 2664 }, { "epoch": 0.12695238095238096, "grad_norm": 0.04265585541725159, "learning_rate": 0.024000000208616257, "loss": 2.7123332023620605, "step": 2666 }, { "epoch": 0.12704761904761905, "grad_norm": 0.040915347635746, "learning_rate": 0.024000000208616257, "loss": 2.8020167350769043, "step": 2668 }, { "epoch": 0.12714285714285714, "grad_norm": 0.041975103318691254, "learning_rate": 0.024000000208616257, "loss": 2.7441067695617676, "step": 2670 }, { "epoch": 0.12723809523809523, "grad_norm": 0.03998507186770439, "learning_rate": 0.024000000208616257, "loss": 2.7499043941497803, "step": 2672 }, { "epoch": 0.12733333333333333, "grad_norm": 0.041279714554548264, "learning_rate": 0.024000000208616257, "loss": 2.751216411590576, "step": 2674 }, { "epoch": 0.12742857142857142, "grad_norm": 0.0403459332883358, "learning_rate": 0.024000000208616257, "loss": 2.767371654510498, "step": 2676 }, { "epoch": 0.1275238095238095, "grad_norm": 0.042274292558431625, "learning_rate": 0.024000000208616257, "loss": 2.769853115081787, "step": 2678 }, { "epoch": 0.12761904761904763, "grad_norm": 0.04127549007534981, "learning_rate": 0.024000000208616257, "loss": 2.754101514816284, "step": 2680 }, { "epoch": 0.12771428571428572, "grad_norm": 0.04110479727387428, "learning_rate": 0.024000000208616257, "loss": 2.741021156311035, "step": 2682 }, { "epoch": 0.12780952380952382, "grad_norm": 0.0406893752515316, "learning_rate": 0.024000000208616257, "loss": 2.746716260910034, "step": 2684 }, { "epoch": 0.1279047619047619, "grad_norm": 0.04102560132741928, "learning_rate": 0.024000000208616257, "loss": 2.7289562225341797, "step": 2686 }, { "epoch": 0.128, "grad_norm": 0.04158696159720421, "learning_rate": 0.024000000208616257, "loss": 2.7459311485290527, "step": 2688 }, { "epoch": 0.1280952380952381, "grad_norm": 0.042834073305130005, "learning_rate": 0.024000000208616257, "loss": 2.763381004333496, "step": 2690 }, { "epoch": 0.1281904761904762, "grad_norm": 0.041532251983881, "learning_rate": 0.024000000208616257, "loss": 2.751598834991455, "step": 2692 }, { "epoch": 0.12828571428571428, "grad_norm": 0.04195414483547211, "learning_rate": 0.024000000208616257, "loss": 2.7412872314453125, "step": 2694 }, { "epoch": 0.12838095238095237, "grad_norm": 0.039019301533699036, "learning_rate": 0.024000000208616257, "loss": 2.7190961837768555, "step": 2696 }, { "epoch": 0.12847619047619047, "grad_norm": 0.03896051272749901, "learning_rate": 0.024000000208616257, "loss": 2.7399709224700928, "step": 2698 }, { "epoch": 0.12857142857142856, "grad_norm": 0.03877197206020355, "learning_rate": 0.024000000208616257, "loss": 2.7395057678222656, "step": 2700 }, { "epoch": 0.12866666666666668, "grad_norm": 0.03895197808742523, "learning_rate": 0.024000000208616257, "loss": 2.7800097465515137, "step": 2702 }, { "epoch": 0.12876190476190477, "grad_norm": 0.04356874153017998, "learning_rate": 0.024000000208616257, "loss": 2.7174572944641113, "step": 2704 }, { "epoch": 0.12885714285714286, "grad_norm": 0.04686201363801956, "learning_rate": 0.024000000208616257, "loss": 2.7435009479522705, "step": 2706 }, { "epoch": 0.12895238095238096, "grad_norm": 0.04456666484475136, "learning_rate": 0.024000000208616257, "loss": 2.704989433288574, "step": 2708 }, { "epoch": 0.12904761904761905, "grad_norm": 0.04123445600271225, "learning_rate": 0.024000000208616257, "loss": 2.7305989265441895, "step": 2710 }, { "epoch": 0.12914285714285714, "grad_norm": 0.04179234802722931, "learning_rate": 0.024000000208616257, "loss": 2.701507568359375, "step": 2712 }, { "epoch": 0.12923809523809524, "grad_norm": 0.046446118503808975, "learning_rate": 0.024000000208616257, "loss": 2.7445578575134277, "step": 2714 }, { "epoch": 0.12933333333333333, "grad_norm": 0.04205678030848503, "learning_rate": 0.024000000208616257, "loss": 2.752220630645752, "step": 2716 }, { "epoch": 0.12942857142857142, "grad_norm": 0.043627865612506866, "learning_rate": 0.024000000208616257, "loss": 2.7344448566436768, "step": 2718 }, { "epoch": 0.1295238095238095, "grad_norm": 0.04053850099444389, "learning_rate": 0.024000000208616257, "loss": 2.705702304840088, "step": 2720 }, { "epoch": 0.1296190476190476, "grad_norm": 0.044023171067237854, "learning_rate": 0.024000000208616257, "loss": 2.684936046600342, "step": 2722 }, { "epoch": 0.12971428571428573, "grad_norm": 0.044807326048612595, "learning_rate": 0.024000000208616257, "loss": 2.6965909004211426, "step": 2724 }, { "epoch": 0.12980952380952382, "grad_norm": 0.040259864181280136, "learning_rate": 0.024000000208616257, "loss": 2.7287659645080566, "step": 2726 }, { "epoch": 0.1299047619047619, "grad_norm": 0.043028708547353745, "learning_rate": 0.024000000208616257, "loss": 2.721649408340454, "step": 2728 }, { "epoch": 0.13, "grad_norm": 0.04136021062731743, "learning_rate": 0.024000000208616257, "loss": 2.750351905822754, "step": 2730 }, { "epoch": 0.1300952380952381, "grad_norm": 0.04291125014424324, "learning_rate": 0.024000000208616257, "loss": 2.7114293575286865, "step": 2732 }, { "epoch": 0.1301904761904762, "grad_norm": 0.04283392056822777, "learning_rate": 0.024000000208616257, "loss": 2.729598045349121, "step": 2734 }, { "epoch": 0.13028571428571428, "grad_norm": 0.0435488261282444, "learning_rate": 0.024000000208616257, "loss": 2.727576732635498, "step": 2736 }, { "epoch": 0.13038095238095238, "grad_norm": 0.04185225069522858, "learning_rate": 0.024000000208616257, "loss": 2.706106185913086, "step": 2738 }, { "epoch": 0.13047619047619047, "grad_norm": 0.04038235917687416, "learning_rate": 0.024000000208616257, "loss": 2.700671672821045, "step": 2740 }, { "epoch": 0.13057142857142856, "grad_norm": 0.040698155760765076, "learning_rate": 0.024000000208616257, "loss": 2.7165868282318115, "step": 2742 }, { "epoch": 0.13066666666666665, "grad_norm": 0.04006931558251381, "learning_rate": 0.024000000208616257, "loss": 2.72568416595459, "step": 2744 }, { "epoch": 0.13076190476190477, "grad_norm": 0.040233563631772995, "learning_rate": 0.024000000208616257, "loss": 2.7146434783935547, "step": 2746 }, { "epoch": 0.13085714285714287, "grad_norm": 0.038959018886089325, "learning_rate": 0.024000000208616257, "loss": 2.7292914390563965, "step": 2748 }, { "epoch": 0.13095238095238096, "grad_norm": 0.03924540802836418, "learning_rate": 0.024000000208616257, "loss": 2.7347793579101562, "step": 2750 }, { "epoch": 0.13104761904761905, "grad_norm": 0.04025218263268471, "learning_rate": 0.024000000208616257, "loss": 2.740389585494995, "step": 2752 }, { "epoch": 0.13114285714285714, "grad_norm": 0.0399710014462471, "learning_rate": 0.024000000208616257, "loss": 2.7149949073791504, "step": 2754 }, { "epoch": 0.13123809523809524, "grad_norm": 0.04009760543704033, "learning_rate": 0.024000000208616257, "loss": 2.700632095336914, "step": 2756 }, { "epoch": 0.13133333333333333, "grad_norm": 0.041127242147922516, "learning_rate": 0.024000000208616257, "loss": 2.711601734161377, "step": 2758 }, { "epoch": 0.13142857142857142, "grad_norm": 0.04018864408135414, "learning_rate": 0.024000000208616257, "loss": 2.711930751800537, "step": 2760 }, { "epoch": 0.13152380952380952, "grad_norm": 0.0410848967730999, "learning_rate": 0.024000000208616257, "loss": 2.701314926147461, "step": 2762 }, { "epoch": 0.1316190476190476, "grad_norm": 0.04037822410464287, "learning_rate": 0.024000000208616257, "loss": 2.7267751693725586, "step": 2764 }, { "epoch": 0.1317142857142857, "grad_norm": 0.043315108865499496, "learning_rate": 0.024000000208616257, "loss": 2.7330355644226074, "step": 2766 }, { "epoch": 0.13180952380952382, "grad_norm": 0.04093198478221893, "learning_rate": 0.024000000208616257, "loss": 2.7466533184051514, "step": 2768 }, { "epoch": 0.1319047619047619, "grad_norm": 0.04278977960348129, "learning_rate": 0.024000000208616257, "loss": 2.681534767150879, "step": 2770 }, { "epoch": 0.132, "grad_norm": 0.041052766144275665, "learning_rate": 0.024000000208616257, "loss": 2.683458089828491, "step": 2772 }, { "epoch": 0.1320952380952381, "grad_norm": 0.04038380831480026, "learning_rate": 0.024000000208616257, "loss": 2.694136619567871, "step": 2774 }, { "epoch": 0.1321904761904762, "grad_norm": 0.042045921087265015, "learning_rate": 0.024000000208616257, "loss": 2.678288698196411, "step": 2776 }, { "epoch": 0.13228571428571428, "grad_norm": 0.038873106241226196, "learning_rate": 0.024000000208616257, "loss": 2.6905155181884766, "step": 2778 }, { "epoch": 0.13238095238095238, "grad_norm": 0.041868433356285095, "learning_rate": 0.024000000208616257, "loss": 2.6793131828308105, "step": 2780 }, { "epoch": 0.13247619047619047, "grad_norm": 0.045103613287210464, "learning_rate": 0.024000000208616257, "loss": 2.6974549293518066, "step": 2782 }, { "epoch": 0.13257142857142856, "grad_norm": 0.04083101451396942, "learning_rate": 0.024000000208616257, "loss": 2.681457042694092, "step": 2784 }, { "epoch": 0.13266666666666665, "grad_norm": 0.0389193557202816, "learning_rate": 0.024000000208616257, "loss": 2.6764352321624756, "step": 2786 }, { "epoch": 0.13276190476190478, "grad_norm": 0.04059649631381035, "learning_rate": 0.024000000208616257, "loss": 2.701692581176758, "step": 2788 }, { "epoch": 0.13285714285714287, "grad_norm": 0.046153724193573, "learning_rate": 0.024000000208616257, "loss": 2.681943416595459, "step": 2790 }, { "epoch": 0.13295238095238096, "grad_norm": 0.04838388413190842, "learning_rate": 0.024000000208616257, "loss": 2.6785736083984375, "step": 2792 }, { "epoch": 0.13304761904761905, "grad_norm": 0.047838062047958374, "learning_rate": 0.024000000208616257, "loss": 2.6886205673217773, "step": 2794 }, { "epoch": 0.13314285714285715, "grad_norm": 0.04280884563922882, "learning_rate": 0.024000000208616257, "loss": 2.695260524749756, "step": 2796 }, { "epoch": 0.13323809523809524, "grad_norm": 0.039508454501628876, "learning_rate": 0.024000000208616257, "loss": 2.654273509979248, "step": 2798 }, { "epoch": 0.13333333333333333, "grad_norm": 0.039450373500585556, "learning_rate": 0.024000000208616257, "loss": 2.680516242980957, "step": 2800 }, { "epoch": 0.13342857142857142, "grad_norm": 0.039599716663360596, "learning_rate": 0.024000000208616257, "loss": 2.6453986167907715, "step": 2802 }, { "epoch": 0.13352380952380952, "grad_norm": 0.04147465154528618, "learning_rate": 0.024000000208616257, "loss": 2.677910804748535, "step": 2804 }, { "epoch": 0.1336190476190476, "grad_norm": 0.03976032882928848, "learning_rate": 0.024000000208616257, "loss": 2.699850082397461, "step": 2806 }, { "epoch": 0.1337142857142857, "grad_norm": 0.039951391518116, "learning_rate": 0.024000000208616257, "loss": 2.6960697174072266, "step": 2808 }, { "epoch": 0.13380952380952382, "grad_norm": 0.04114368185400963, "learning_rate": 0.024000000208616257, "loss": 2.692931652069092, "step": 2810 }, { "epoch": 0.13390476190476192, "grad_norm": 0.040496353060007095, "learning_rate": 0.024000000208616257, "loss": 2.6931886672973633, "step": 2812 }, { "epoch": 0.134, "grad_norm": 0.04267456382513046, "learning_rate": 0.024000000208616257, "loss": 2.6665735244750977, "step": 2814 }, { "epoch": 0.1340952380952381, "grad_norm": 0.0385521799325943, "learning_rate": 0.024000000208616257, "loss": 2.64929461479187, "step": 2816 }, { "epoch": 0.1341904761904762, "grad_norm": 0.04104091599583626, "learning_rate": 0.024000000208616257, "loss": 2.6566340923309326, "step": 2818 }, { "epoch": 0.13428571428571429, "grad_norm": 0.03943803161382675, "learning_rate": 0.024000000208616257, "loss": 2.6731624603271484, "step": 2820 }, { "epoch": 0.13438095238095238, "grad_norm": 0.03935855254530907, "learning_rate": 0.024000000208616257, "loss": 2.6837475299835205, "step": 2822 }, { "epoch": 0.13447619047619047, "grad_norm": 0.03910178691148758, "learning_rate": 0.024000000208616257, "loss": 2.7134106159210205, "step": 2824 }, { "epoch": 0.13457142857142856, "grad_norm": 0.039158161729574203, "learning_rate": 0.024000000208616257, "loss": 2.6557364463806152, "step": 2826 }, { "epoch": 0.13466666666666666, "grad_norm": 0.03954636678099632, "learning_rate": 0.024000000208616257, "loss": 2.6745145320892334, "step": 2828 }, { "epoch": 0.13476190476190475, "grad_norm": 0.03995664045214653, "learning_rate": 0.024000000208616257, "loss": 2.657139301300049, "step": 2830 }, { "epoch": 0.13485714285714287, "grad_norm": 0.04067015275359154, "learning_rate": 0.024000000208616257, "loss": 2.6779978275299072, "step": 2832 }, { "epoch": 0.13495238095238096, "grad_norm": 0.04139202833175659, "learning_rate": 0.024000000208616257, "loss": 2.6835622787475586, "step": 2834 }, { "epoch": 0.13504761904761906, "grad_norm": 0.039104025810956955, "learning_rate": 0.024000000208616257, "loss": 2.6859207153320312, "step": 2836 }, { "epoch": 0.13514285714285715, "grad_norm": 0.04216964170336723, "learning_rate": 0.024000000208616257, "loss": 2.6594200134277344, "step": 2838 }, { "epoch": 0.13523809523809524, "grad_norm": 0.040267135947942734, "learning_rate": 0.024000000208616257, "loss": 2.6702561378479004, "step": 2840 }, { "epoch": 0.13533333333333333, "grad_norm": 0.04384255036711693, "learning_rate": 0.024000000208616257, "loss": 2.6731019020080566, "step": 2842 }, { "epoch": 0.13542857142857143, "grad_norm": 0.04294711723923683, "learning_rate": 0.024000000208616257, "loss": 2.6381993293762207, "step": 2844 }, { "epoch": 0.13552380952380952, "grad_norm": 0.03817366063594818, "learning_rate": 0.024000000208616257, "loss": 2.6678214073181152, "step": 2846 }, { "epoch": 0.1356190476190476, "grad_norm": 0.038679130375385284, "learning_rate": 0.024000000208616257, "loss": 2.63529372215271, "step": 2848 }, { "epoch": 0.1357142857142857, "grad_norm": 0.03927658125758171, "learning_rate": 0.024000000208616257, "loss": 2.660576105117798, "step": 2850 }, { "epoch": 0.1358095238095238, "grad_norm": 0.03971083462238312, "learning_rate": 0.024000000208616257, "loss": 2.6827425956726074, "step": 2852 }, { "epoch": 0.13590476190476192, "grad_norm": 0.03896373137831688, "learning_rate": 0.024000000208616257, "loss": 2.684269905090332, "step": 2854 }, { "epoch": 0.136, "grad_norm": 0.0378166139125824, "learning_rate": 0.024000000208616257, "loss": 2.636542797088623, "step": 2856 }, { "epoch": 0.1360952380952381, "grad_norm": 0.03954099491238594, "learning_rate": 0.024000000208616257, "loss": 2.673189163208008, "step": 2858 }, { "epoch": 0.1361904761904762, "grad_norm": 0.03805512189865112, "learning_rate": 0.024000000208616257, "loss": 2.6681418418884277, "step": 2860 }, { "epoch": 0.1362857142857143, "grad_norm": 0.03844426944851875, "learning_rate": 0.024000000208616257, "loss": 2.6852381229400635, "step": 2862 }, { "epoch": 0.13638095238095238, "grad_norm": 0.03839988633990288, "learning_rate": 0.024000000208616257, "loss": 2.6407852172851562, "step": 2864 }, { "epoch": 0.13647619047619047, "grad_norm": 0.03929746896028519, "learning_rate": 0.024000000208616257, "loss": 2.6381001472473145, "step": 2866 }, { "epoch": 0.13657142857142857, "grad_norm": 0.03905761241912842, "learning_rate": 0.024000000208616257, "loss": 2.6717286109924316, "step": 2868 }, { "epoch": 0.13666666666666666, "grad_norm": 0.04006391763687134, "learning_rate": 0.024000000208616257, "loss": 2.6785085201263428, "step": 2870 }, { "epoch": 0.13676190476190475, "grad_norm": 0.03996339812874794, "learning_rate": 0.024000000208616257, "loss": 2.678069829940796, "step": 2872 }, { "epoch": 0.13685714285714284, "grad_norm": 0.03989030048251152, "learning_rate": 0.024000000208616257, "loss": 2.6422157287597656, "step": 2874 }, { "epoch": 0.13695238095238096, "grad_norm": 0.04217144474387169, "learning_rate": 0.024000000208616257, "loss": 2.6668789386749268, "step": 2876 }, { "epoch": 0.13704761904761906, "grad_norm": 0.040372416377067566, "learning_rate": 0.024000000208616257, "loss": 2.6651957035064697, "step": 2878 }, { "epoch": 0.13714285714285715, "grad_norm": 0.03993074968457222, "learning_rate": 0.024000000208616257, "loss": 2.662209987640381, "step": 2880 }, { "epoch": 0.13723809523809524, "grad_norm": 0.03925129026174545, "learning_rate": 0.024000000208616257, "loss": 2.682891607284546, "step": 2882 }, { "epoch": 0.13733333333333334, "grad_norm": 0.038872480392456055, "learning_rate": 0.024000000208616257, "loss": 2.673384189605713, "step": 2884 }, { "epoch": 0.13742857142857143, "grad_norm": 0.03834608569741249, "learning_rate": 0.024000000208616257, "loss": 2.672583818435669, "step": 2886 }, { "epoch": 0.13752380952380952, "grad_norm": 0.04069787636399269, "learning_rate": 0.024000000208616257, "loss": 2.641012668609619, "step": 2888 }, { "epoch": 0.1376190476190476, "grad_norm": 0.03847348690032959, "learning_rate": 0.024000000208616257, "loss": 2.6502671241760254, "step": 2890 }, { "epoch": 0.1377142857142857, "grad_norm": 0.04134195297956467, "learning_rate": 0.024000000208616257, "loss": 2.6393933296203613, "step": 2892 }, { "epoch": 0.1378095238095238, "grad_norm": 0.04047824442386627, "learning_rate": 0.024000000208616257, "loss": 2.6315436363220215, "step": 2894 }, { "epoch": 0.1379047619047619, "grad_norm": 0.04260635003447533, "learning_rate": 0.024000000208616257, "loss": 2.647691011428833, "step": 2896 }, { "epoch": 0.138, "grad_norm": 0.0376734621822834, "learning_rate": 0.024000000208616257, "loss": 2.6929445266723633, "step": 2898 }, { "epoch": 0.1380952380952381, "grad_norm": 0.03964005038142204, "learning_rate": 0.024000000208616257, "loss": 2.6126708984375, "step": 2900 }, { "epoch": 0.1381904761904762, "grad_norm": 0.03940735384821892, "learning_rate": 0.024000000208616257, "loss": 2.630216598510742, "step": 2902 }, { "epoch": 0.1382857142857143, "grad_norm": 0.04031897708773613, "learning_rate": 0.024000000208616257, "loss": 2.653235673904419, "step": 2904 }, { "epoch": 0.13838095238095238, "grad_norm": 0.038918230682611465, "learning_rate": 0.024000000208616257, "loss": 2.620633602142334, "step": 2906 }, { "epoch": 0.13847619047619047, "grad_norm": 0.03889259323477745, "learning_rate": 0.024000000208616257, "loss": 2.659282684326172, "step": 2908 }, { "epoch": 0.13857142857142857, "grad_norm": 0.03944620490074158, "learning_rate": 0.024000000208616257, "loss": 2.6663565635681152, "step": 2910 }, { "epoch": 0.13866666666666666, "grad_norm": 0.04059228673577309, "learning_rate": 0.024000000208616257, "loss": 2.6467175483703613, "step": 2912 }, { "epoch": 0.13876190476190475, "grad_norm": 0.04343913495540619, "learning_rate": 0.024000000208616257, "loss": 2.622924327850342, "step": 2914 }, { "epoch": 0.13885714285714285, "grad_norm": 0.043369874358177185, "learning_rate": 0.024000000208616257, "loss": 2.6712074279785156, "step": 2916 }, { "epoch": 0.13895238095238097, "grad_norm": 0.042386528104543686, "learning_rate": 0.024000000208616257, "loss": 2.643153190612793, "step": 2918 }, { "epoch": 0.13904761904761906, "grad_norm": 0.03954014927148819, "learning_rate": 0.024000000208616257, "loss": 2.619866371154785, "step": 2920 }, { "epoch": 0.13914285714285715, "grad_norm": 0.03807791694998741, "learning_rate": 0.024000000208616257, "loss": 2.651921510696411, "step": 2922 }, { "epoch": 0.13923809523809524, "grad_norm": 0.039258792996406555, "learning_rate": 0.024000000208616257, "loss": 2.645901679992676, "step": 2924 }, { "epoch": 0.13933333333333334, "grad_norm": 0.041380736976861954, "learning_rate": 0.024000000208616257, "loss": 2.648244857788086, "step": 2926 }, { "epoch": 0.13942857142857143, "grad_norm": 0.04004960507154465, "learning_rate": 0.024000000208616257, "loss": 2.6421947479248047, "step": 2928 }, { "epoch": 0.13952380952380952, "grad_norm": 0.04143644496798515, "learning_rate": 0.024000000208616257, "loss": 2.645738124847412, "step": 2930 }, { "epoch": 0.13961904761904761, "grad_norm": 0.04151866212487221, "learning_rate": 0.024000000208616257, "loss": 2.650439500808716, "step": 2932 }, { "epoch": 0.1397142857142857, "grad_norm": 0.041612230241298676, "learning_rate": 0.024000000208616257, "loss": 2.6533665657043457, "step": 2934 }, { "epoch": 0.1398095238095238, "grad_norm": 0.04194706305861473, "learning_rate": 0.024000000208616257, "loss": 2.6263740062713623, "step": 2936 }, { "epoch": 0.1399047619047619, "grad_norm": 0.039910729974508286, "learning_rate": 0.024000000208616257, "loss": 2.656196117401123, "step": 2938 }, { "epoch": 0.14, "grad_norm": 0.04038766399025917, "learning_rate": 0.024000000208616257, "loss": 2.6485226154327393, "step": 2940 }, { "epoch": 0.1400952380952381, "grad_norm": 0.04211939871311188, "learning_rate": 0.024000000208616257, "loss": 2.6276211738586426, "step": 2942 }, { "epoch": 0.1401904761904762, "grad_norm": 0.04193573445081711, "learning_rate": 0.024000000208616257, "loss": 2.6352179050445557, "step": 2944 }, { "epoch": 0.1402857142857143, "grad_norm": 0.039469823241233826, "learning_rate": 0.024000000208616257, "loss": 2.6432840824127197, "step": 2946 }, { "epoch": 0.14038095238095238, "grad_norm": 0.038907259702682495, "learning_rate": 0.024000000208616257, "loss": 2.6459147930145264, "step": 2948 }, { "epoch": 0.14047619047619048, "grad_norm": 0.03937728330492973, "learning_rate": 0.024000000208616257, "loss": 2.5971879959106445, "step": 2950 }, { "epoch": 0.14057142857142857, "grad_norm": 0.040734078735113144, "learning_rate": 0.024000000208616257, "loss": 2.638200044631958, "step": 2952 }, { "epoch": 0.14066666666666666, "grad_norm": 0.03872331976890564, "learning_rate": 0.024000000208616257, "loss": 2.612642526626587, "step": 2954 }, { "epoch": 0.14076190476190475, "grad_norm": 0.03724416345357895, "learning_rate": 0.024000000208616257, "loss": 2.6762888431549072, "step": 2956 }, { "epoch": 0.14085714285714285, "grad_norm": 0.04200783744454384, "learning_rate": 0.024000000208616257, "loss": 2.626366138458252, "step": 2958 }, { "epoch": 0.14095238095238094, "grad_norm": 0.04264798015356064, "learning_rate": 0.024000000208616257, "loss": 2.6504194736480713, "step": 2960 }, { "epoch": 0.14104761904761906, "grad_norm": 0.04076986014842987, "learning_rate": 0.024000000208616257, "loss": 2.6391167640686035, "step": 2962 }, { "epoch": 0.14114285714285715, "grad_norm": 0.03790652006864548, "learning_rate": 0.024000000208616257, "loss": 2.639674425125122, "step": 2964 }, { "epoch": 0.14123809523809525, "grad_norm": 0.0388825498521328, "learning_rate": 0.024000000208616257, "loss": 2.6171326637268066, "step": 2966 }, { "epoch": 0.14133333333333334, "grad_norm": 0.03782769665122032, "learning_rate": 0.024000000208616257, "loss": 2.616725444793701, "step": 2968 }, { "epoch": 0.14142857142857143, "grad_norm": 0.037182100117206573, "learning_rate": 0.024000000208616257, "loss": 2.626232147216797, "step": 2970 }, { "epoch": 0.14152380952380952, "grad_norm": 0.039799291640520096, "learning_rate": 0.024000000208616257, "loss": 2.6755733489990234, "step": 2972 }, { "epoch": 0.14161904761904762, "grad_norm": 0.039296701550483704, "learning_rate": 0.024000000208616257, "loss": 2.6368651390075684, "step": 2974 }, { "epoch": 0.1417142857142857, "grad_norm": 0.038548558950424194, "learning_rate": 0.024000000208616257, "loss": 2.615267038345337, "step": 2976 }, { "epoch": 0.1418095238095238, "grad_norm": 0.039839159697294235, "learning_rate": 0.024000000208616257, "loss": 2.587344169616699, "step": 2978 }, { "epoch": 0.1419047619047619, "grad_norm": 0.03981087729334831, "learning_rate": 0.024000000208616257, "loss": 2.61289644241333, "step": 2980 }, { "epoch": 0.142, "grad_norm": 0.04115326702594757, "learning_rate": 0.024000000208616257, "loss": 2.649667739868164, "step": 2982 }, { "epoch": 0.1420952380952381, "grad_norm": 0.04393702372908592, "learning_rate": 0.024000000208616257, "loss": 2.6150436401367188, "step": 2984 }, { "epoch": 0.1421904761904762, "grad_norm": 0.04394924268126488, "learning_rate": 0.024000000208616257, "loss": 2.6212427616119385, "step": 2986 }, { "epoch": 0.1422857142857143, "grad_norm": 0.04177684336900711, "learning_rate": 0.024000000208616257, "loss": 2.618621349334717, "step": 2988 }, { "epoch": 0.14238095238095239, "grad_norm": 0.04122864454984665, "learning_rate": 0.024000000208616257, "loss": 2.5652880668640137, "step": 2990 }, { "epoch": 0.14247619047619048, "grad_norm": 0.03842271491885185, "learning_rate": 0.024000000208616257, "loss": 2.621561050415039, "step": 2992 }, { "epoch": 0.14257142857142857, "grad_norm": 0.04010410234332085, "learning_rate": 0.024000000208616257, "loss": 2.5930819511413574, "step": 2994 }, { "epoch": 0.14266666666666666, "grad_norm": 0.04060627147555351, "learning_rate": 0.024000000208616257, "loss": 2.620056629180908, "step": 2996 }, { "epoch": 0.14276190476190476, "grad_norm": 0.039582088589668274, "learning_rate": 0.024000000208616257, "loss": 2.5957489013671875, "step": 2998 }, { "epoch": 0.14285714285714285, "grad_norm": 0.039420194923877716, "learning_rate": 0.024000000208616257, "loss": 2.6166863441467285, "step": 3000 }, { "epoch": 0.14295238095238094, "grad_norm": 0.0392138808965683, "learning_rate": 0.024000000208616257, "loss": 2.6371893882751465, "step": 3002 }, { "epoch": 0.14304761904761903, "grad_norm": 0.04179920628666878, "learning_rate": 0.024000000208616257, "loss": 2.6331734657287598, "step": 3004 }, { "epoch": 0.14314285714285716, "grad_norm": 0.03786275535821915, "learning_rate": 0.024000000208616257, "loss": 2.6294808387756348, "step": 3006 }, { "epoch": 0.14323809523809525, "grad_norm": 0.0388900563120842, "learning_rate": 0.024000000208616257, "loss": 2.613710880279541, "step": 3008 }, { "epoch": 0.14333333333333334, "grad_norm": 0.03854822367429733, "learning_rate": 0.024000000208616257, "loss": 2.6088547706604004, "step": 3010 }, { "epoch": 0.14342857142857143, "grad_norm": 0.0364716500043869, "learning_rate": 0.024000000208616257, "loss": 2.5984854698181152, "step": 3012 }, { "epoch": 0.14352380952380953, "grad_norm": 0.039459437131881714, "learning_rate": 0.024000000208616257, "loss": 2.584599018096924, "step": 3014 }, { "epoch": 0.14361904761904762, "grad_norm": 0.037484150379896164, "learning_rate": 0.024000000208616257, "loss": 2.632702112197876, "step": 3016 }, { "epoch": 0.1437142857142857, "grad_norm": 0.039724864065647125, "learning_rate": 0.024000000208616257, "loss": 2.6238274574279785, "step": 3018 }, { "epoch": 0.1438095238095238, "grad_norm": 0.03902710974216461, "learning_rate": 0.024000000208616257, "loss": 2.618647813796997, "step": 3020 }, { "epoch": 0.1439047619047619, "grad_norm": 0.040613505989313126, "learning_rate": 0.024000000208616257, "loss": 2.5997371673583984, "step": 3022 }, { "epoch": 0.144, "grad_norm": 0.03852438926696777, "learning_rate": 0.024000000208616257, "loss": 2.616363048553467, "step": 3024 }, { "epoch": 0.14409523809523808, "grad_norm": 0.04180524870753288, "learning_rate": 0.024000000208616257, "loss": 2.6243410110473633, "step": 3026 }, { "epoch": 0.1441904761904762, "grad_norm": 0.04116296023130417, "learning_rate": 0.024000000208616257, "loss": 2.6090919971466064, "step": 3028 }, { "epoch": 0.1442857142857143, "grad_norm": 0.03752176836133003, "learning_rate": 0.024000000208616257, "loss": 2.594334363937378, "step": 3030 }, { "epoch": 0.1443809523809524, "grad_norm": 0.03882811591029167, "learning_rate": 0.024000000208616257, "loss": 2.585858106613159, "step": 3032 }, { "epoch": 0.14447619047619048, "grad_norm": 0.03914063051342964, "learning_rate": 0.024000000208616257, "loss": 2.626927375793457, "step": 3034 }, { "epoch": 0.14457142857142857, "grad_norm": 0.03666650503873825, "learning_rate": 0.024000000208616257, "loss": 2.6382594108581543, "step": 3036 }, { "epoch": 0.14466666666666667, "grad_norm": 0.03868306800723076, "learning_rate": 0.024000000208616257, "loss": 2.6070427894592285, "step": 3038 }, { "epoch": 0.14476190476190476, "grad_norm": 0.0413958914577961, "learning_rate": 0.024000000208616257, "loss": 2.602046489715576, "step": 3040 }, { "epoch": 0.14485714285714285, "grad_norm": 0.039238203316926956, "learning_rate": 0.024000000208616257, "loss": 2.598741054534912, "step": 3042 }, { "epoch": 0.14495238095238094, "grad_norm": 0.03756674751639366, "learning_rate": 0.024000000208616257, "loss": 2.59173583984375, "step": 3044 }, { "epoch": 0.14504761904761904, "grad_norm": 0.038962580263614655, "learning_rate": 0.024000000208616257, "loss": 2.6036300659179688, "step": 3046 }, { "epoch": 0.14514285714285713, "grad_norm": 0.04044633358716965, "learning_rate": 0.024000000208616257, "loss": 2.623006820678711, "step": 3048 }, { "epoch": 0.14523809523809525, "grad_norm": 0.04012296721339226, "learning_rate": 0.024000000208616257, "loss": 2.5926878452301025, "step": 3050 }, { "epoch": 0.14533333333333334, "grad_norm": 0.040498752146959305, "learning_rate": 0.024000000208616257, "loss": 2.5605766773223877, "step": 3052 }, { "epoch": 0.14542857142857143, "grad_norm": 0.03759801387786865, "learning_rate": 0.024000000208616257, "loss": 2.599566698074341, "step": 3054 }, { "epoch": 0.14552380952380953, "grad_norm": 0.03971228748559952, "learning_rate": 0.024000000208616257, "loss": 2.620002269744873, "step": 3056 }, { "epoch": 0.14561904761904762, "grad_norm": 0.04205906391143799, "learning_rate": 0.024000000208616257, "loss": 2.611114025115967, "step": 3058 }, { "epoch": 0.1457142857142857, "grad_norm": 0.03935784474015236, "learning_rate": 0.024000000208616257, "loss": 2.5592851638793945, "step": 3060 }, { "epoch": 0.1458095238095238, "grad_norm": 0.03973614051938057, "learning_rate": 0.024000000208616257, "loss": 2.5818920135498047, "step": 3062 }, { "epoch": 0.1459047619047619, "grad_norm": 0.040794964879751205, "learning_rate": 0.024000000208616257, "loss": 2.5968682765960693, "step": 3064 }, { "epoch": 0.146, "grad_norm": 0.03733645752072334, "learning_rate": 0.024000000208616257, "loss": 2.625763177871704, "step": 3066 }, { "epoch": 0.14609523809523808, "grad_norm": 0.03931474685668945, "learning_rate": 0.024000000208616257, "loss": 2.51363468170166, "step": 3068 }, { "epoch": 0.1461904761904762, "grad_norm": 0.040074340999126434, "learning_rate": 0.024000000208616257, "loss": 2.6052005290985107, "step": 3070 }, { "epoch": 0.1462857142857143, "grad_norm": 0.04078330099582672, "learning_rate": 0.024000000208616257, "loss": 2.5466160774230957, "step": 3072 }, { "epoch": 0.1463809523809524, "grad_norm": 0.03887728601694107, "learning_rate": 0.024000000208616257, "loss": 2.5743465423583984, "step": 3074 }, { "epoch": 0.14647619047619048, "grad_norm": 0.03921743854880333, "learning_rate": 0.024000000208616257, "loss": 2.5866732597351074, "step": 3076 }, { "epoch": 0.14657142857142857, "grad_norm": 0.04153836518526077, "learning_rate": 0.024000000208616257, "loss": 2.5911436080932617, "step": 3078 }, { "epoch": 0.14666666666666667, "grad_norm": 0.03965853527188301, "learning_rate": 0.024000000208616257, "loss": 2.6014280319213867, "step": 3080 }, { "epoch": 0.14676190476190476, "grad_norm": 0.037431709468364716, "learning_rate": 0.024000000208616257, "loss": 2.5915699005126953, "step": 3082 }, { "epoch": 0.14685714285714285, "grad_norm": 0.0392446368932724, "learning_rate": 0.024000000208616257, "loss": 2.604689598083496, "step": 3084 }, { "epoch": 0.14695238095238095, "grad_norm": 0.03892185166478157, "learning_rate": 0.024000000208616257, "loss": 2.568957805633545, "step": 3086 }, { "epoch": 0.14704761904761904, "grad_norm": 0.041385602205991745, "learning_rate": 0.024000000208616257, "loss": 2.5749292373657227, "step": 3088 }, { "epoch": 0.14714285714285713, "grad_norm": 0.0402534157037735, "learning_rate": 0.024000000208616257, "loss": 2.5953779220581055, "step": 3090 }, { "epoch": 0.14723809523809525, "grad_norm": 0.037617940455675125, "learning_rate": 0.024000000208616257, "loss": 2.5967750549316406, "step": 3092 }, { "epoch": 0.14733333333333334, "grad_norm": 0.03831905871629715, "learning_rate": 0.024000000208616257, "loss": 2.588866949081421, "step": 3094 }, { "epoch": 0.14742857142857144, "grad_norm": 0.03952209651470184, "learning_rate": 0.024000000208616257, "loss": 2.605015754699707, "step": 3096 }, { "epoch": 0.14752380952380953, "grad_norm": 0.038520801812410355, "learning_rate": 0.024000000208616257, "loss": 2.5526885986328125, "step": 3098 }, { "epoch": 0.14761904761904762, "grad_norm": 0.044651009142398834, "learning_rate": 0.024000000208616257, "loss": 2.543869972229004, "step": 3100 }, { "epoch": 0.14771428571428571, "grad_norm": 0.04143275320529938, "learning_rate": 0.024000000208616257, "loss": 2.594620943069458, "step": 3102 }, { "epoch": 0.1478095238095238, "grad_norm": 0.03888707235455513, "learning_rate": 0.024000000208616257, "loss": 2.5858654975891113, "step": 3104 }, { "epoch": 0.1479047619047619, "grad_norm": 0.0392955057322979, "learning_rate": 0.024000000208616257, "loss": 2.603306293487549, "step": 3106 }, { "epoch": 0.148, "grad_norm": 0.03902548551559448, "learning_rate": 0.024000000208616257, "loss": 2.582852363586426, "step": 3108 }, { "epoch": 0.14809523809523809, "grad_norm": 0.03929935023188591, "learning_rate": 0.024000000208616257, "loss": 2.5718345642089844, "step": 3110 }, { "epoch": 0.14819047619047618, "grad_norm": 0.03979219123721123, "learning_rate": 0.024000000208616257, "loss": 2.5792267322540283, "step": 3112 }, { "epoch": 0.1482857142857143, "grad_norm": 0.04326530918478966, "learning_rate": 0.024000000208616257, "loss": 2.5757691860198975, "step": 3114 }, { "epoch": 0.1483809523809524, "grad_norm": 0.039412934333086014, "learning_rate": 0.024000000208616257, "loss": 2.580282211303711, "step": 3116 }, { "epoch": 0.14847619047619048, "grad_norm": 0.04083528369665146, "learning_rate": 0.024000000208616257, "loss": 2.553467273712158, "step": 3118 }, { "epoch": 0.14857142857142858, "grad_norm": 0.03762682527303696, "learning_rate": 0.024000000208616257, "loss": 2.534761428833008, "step": 3120 }, { "epoch": 0.14866666666666667, "grad_norm": 0.038149431347846985, "learning_rate": 0.024000000208616257, "loss": 2.5883092880249023, "step": 3122 }, { "epoch": 0.14876190476190476, "grad_norm": 0.03791528940200806, "learning_rate": 0.024000000208616257, "loss": 2.566225528717041, "step": 3124 }, { "epoch": 0.14885714285714285, "grad_norm": 0.03986047953367233, "learning_rate": 0.024000000208616257, "loss": 2.5850725173950195, "step": 3126 }, { "epoch": 0.14895238095238095, "grad_norm": 0.04199884086847305, "learning_rate": 0.024000000208616257, "loss": 2.6232714653015137, "step": 3128 }, { "epoch": 0.14904761904761904, "grad_norm": 0.03842385113239288, "learning_rate": 0.024000000208616257, "loss": 2.6126813888549805, "step": 3130 }, { "epoch": 0.14914285714285713, "grad_norm": 0.03708665072917938, "learning_rate": 0.024000000208616257, "loss": 2.585184097290039, "step": 3132 }, { "epoch": 0.14923809523809523, "grad_norm": 0.03876678645610809, "learning_rate": 0.024000000208616257, "loss": 2.552013874053955, "step": 3134 }, { "epoch": 0.14933333333333335, "grad_norm": 0.03801149129867554, "learning_rate": 0.024000000208616257, "loss": 2.5810422897338867, "step": 3136 }, { "epoch": 0.14942857142857144, "grad_norm": 0.039441123604774475, "learning_rate": 0.024000000208616257, "loss": 2.5559239387512207, "step": 3138 }, { "epoch": 0.14952380952380953, "grad_norm": 0.038277365267276764, "learning_rate": 0.024000000208616257, "loss": 2.5387797355651855, "step": 3140 }, { "epoch": 0.14961904761904762, "grad_norm": 0.038119617849588394, "learning_rate": 0.024000000208616257, "loss": 2.577263355255127, "step": 3142 }, { "epoch": 0.14971428571428572, "grad_norm": 0.041055046021938324, "learning_rate": 0.024000000208616257, "loss": 2.5733118057250977, "step": 3144 }, { "epoch": 0.1498095238095238, "grad_norm": 0.037505995482206345, "learning_rate": 0.024000000208616257, "loss": 2.5887436866760254, "step": 3146 }, { "epoch": 0.1499047619047619, "grad_norm": 0.03691397234797478, "learning_rate": 0.024000000208616257, "loss": 2.5488247871398926, "step": 3148 }, { "epoch": 0.15, "grad_norm": 0.04056220501661301, "learning_rate": 0.024000000208616257, "loss": 2.5925769805908203, "step": 3150 }, { "epoch": 0.1500952380952381, "grad_norm": 0.03678319975733757, "learning_rate": 0.024000000208616257, "loss": 2.5800743103027344, "step": 3152 }, { "epoch": 0.15019047619047618, "grad_norm": 0.038794394582509995, "learning_rate": 0.024000000208616257, "loss": 2.5886306762695312, "step": 3154 }, { "epoch": 0.15028571428571427, "grad_norm": 0.03914694860577583, "learning_rate": 0.024000000208616257, "loss": 2.55511474609375, "step": 3156 }, { "epoch": 0.1503809523809524, "grad_norm": 0.03604903444647789, "learning_rate": 0.024000000208616257, "loss": 2.61460542678833, "step": 3158 }, { "epoch": 0.15047619047619049, "grad_norm": 0.03647039085626602, "learning_rate": 0.024000000208616257, "loss": 2.5767784118652344, "step": 3160 }, { "epoch": 0.15057142857142858, "grad_norm": 0.03931108117103577, "learning_rate": 0.024000000208616257, "loss": 2.5687875747680664, "step": 3162 }, { "epoch": 0.15066666666666667, "grad_norm": 0.041386935859918594, "learning_rate": 0.024000000208616257, "loss": 2.585418939590454, "step": 3164 }, { "epoch": 0.15076190476190476, "grad_norm": 0.04378081485629082, "learning_rate": 0.024000000208616257, "loss": 2.5867645740509033, "step": 3166 }, { "epoch": 0.15085714285714286, "grad_norm": 0.040701672434806824, "learning_rate": 0.024000000208616257, "loss": 2.597322463989258, "step": 3168 }, { "epoch": 0.15095238095238095, "grad_norm": 0.04305503889918327, "learning_rate": 0.024000000208616257, "loss": 2.5856833457946777, "step": 3170 }, { "epoch": 0.15104761904761904, "grad_norm": 0.04334327206015587, "learning_rate": 0.024000000208616257, "loss": 2.605402946472168, "step": 3172 }, { "epoch": 0.15114285714285713, "grad_norm": 0.037112362682819366, "learning_rate": 0.024000000208616257, "loss": 2.5597732067108154, "step": 3174 }, { "epoch": 0.15123809523809523, "grad_norm": 0.03670288994908333, "learning_rate": 0.024000000208616257, "loss": 2.5482399463653564, "step": 3176 }, { "epoch": 0.15133333333333332, "grad_norm": 0.038057245314121246, "learning_rate": 0.024000000208616257, "loss": 2.5790276527404785, "step": 3178 }, { "epoch": 0.15142857142857144, "grad_norm": 0.03869212418794632, "learning_rate": 0.024000000208616257, "loss": 2.577225685119629, "step": 3180 }, { "epoch": 0.15152380952380953, "grad_norm": 0.03775709122419357, "learning_rate": 0.024000000208616257, "loss": 2.5725831985473633, "step": 3182 }, { "epoch": 0.15161904761904763, "grad_norm": 0.03987998142838478, "learning_rate": 0.024000000208616257, "loss": 2.565498113632202, "step": 3184 }, { "epoch": 0.15171428571428572, "grad_norm": 0.0386643260717392, "learning_rate": 0.024000000208616257, "loss": 2.590784788131714, "step": 3186 }, { "epoch": 0.1518095238095238, "grad_norm": 0.038236502557992935, "learning_rate": 0.024000000208616257, "loss": 2.566640853881836, "step": 3188 }, { "epoch": 0.1519047619047619, "grad_norm": 0.0382254496216774, "learning_rate": 0.024000000208616257, "loss": 2.5823230743408203, "step": 3190 }, { "epoch": 0.152, "grad_norm": 0.036894697695970535, "learning_rate": 0.024000000208616257, "loss": 2.580209732055664, "step": 3192 }, { "epoch": 0.1520952380952381, "grad_norm": 0.037333033978939056, "learning_rate": 0.024000000208616257, "loss": 2.5808792114257812, "step": 3194 }, { "epoch": 0.15219047619047618, "grad_norm": 0.0369417741894722, "learning_rate": 0.024000000208616257, "loss": 2.594463348388672, "step": 3196 }, { "epoch": 0.15228571428571427, "grad_norm": 0.038168661296367645, "learning_rate": 0.024000000208616257, "loss": 2.546644449234009, "step": 3198 }, { "epoch": 0.1523809523809524, "grad_norm": 0.03916992247104645, "learning_rate": 0.024000000208616257, "loss": 2.580228328704834, "step": 3200 }, { "epoch": 0.1524761904761905, "grad_norm": 0.03850780427455902, "learning_rate": 0.024000000208616257, "loss": 2.6106181144714355, "step": 3202 }, { "epoch": 0.15257142857142858, "grad_norm": 0.042017631232738495, "learning_rate": 0.024000000208616257, "loss": 2.614043712615967, "step": 3204 }, { "epoch": 0.15266666666666667, "grad_norm": 0.04434071108698845, "learning_rate": 0.024000000208616257, "loss": 2.5827531814575195, "step": 3206 }, { "epoch": 0.15276190476190477, "grad_norm": 0.04001621901988983, "learning_rate": 0.024000000208616257, "loss": 2.578305244445801, "step": 3208 }, { "epoch": 0.15285714285714286, "grad_norm": 0.0393667109310627, "learning_rate": 0.024000000208616257, "loss": 2.5966637134552, "step": 3210 }, { "epoch": 0.15295238095238095, "grad_norm": 0.037795938551425934, "learning_rate": 0.024000000208616257, "loss": 2.5951523780822754, "step": 3212 }, { "epoch": 0.15304761904761904, "grad_norm": 0.03728668391704559, "learning_rate": 0.024000000208616257, "loss": 2.563171863555908, "step": 3214 }, { "epoch": 0.15314285714285714, "grad_norm": 0.037700019776821136, "learning_rate": 0.024000000208616257, "loss": 2.580166816711426, "step": 3216 }, { "epoch": 0.15323809523809523, "grad_norm": 0.03840586915612221, "learning_rate": 0.024000000208616257, "loss": 2.576883316040039, "step": 3218 }, { "epoch": 0.15333333333333332, "grad_norm": 0.03821544721722603, "learning_rate": 0.024000000208616257, "loss": 2.6196446418762207, "step": 3220 }, { "epoch": 0.15342857142857144, "grad_norm": 0.039689864963293076, "learning_rate": 0.024000000208616257, "loss": 2.5961766242980957, "step": 3222 }, { "epoch": 0.15352380952380953, "grad_norm": 0.037422940135002136, "learning_rate": 0.024000000208616257, "loss": 2.5739245414733887, "step": 3224 }, { "epoch": 0.15361904761904763, "grad_norm": 0.03687533363699913, "learning_rate": 0.024000000208616257, "loss": 2.525033950805664, "step": 3226 }, { "epoch": 0.15371428571428572, "grad_norm": 0.03645416349172592, "learning_rate": 0.024000000208616257, "loss": 2.620124101638794, "step": 3228 }, { "epoch": 0.1538095238095238, "grad_norm": 0.03717149421572685, "learning_rate": 0.024000000208616257, "loss": 2.567460775375366, "step": 3230 }, { "epoch": 0.1539047619047619, "grad_norm": 0.03783761337399483, "learning_rate": 0.024000000208616257, "loss": 2.573657751083374, "step": 3232 }, { "epoch": 0.154, "grad_norm": 0.04119350388646126, "learning_rate": 0.024000000208616257, "loss": 2.5738677978515625, "step": 3234 }, { "epoch": 0.1540952380952381, "grad_norm": 0.039168305695056915, "learning_rate": 0.024000000208616257, "loss": 2.5970513820648193, "step": 3236 }, { "epoch": 0.15419047619047618, "grad_norm": 0.03738267347216606, "learning_rate": 0.024000000208616257, "loss": 2.5702152252197266, "step": 3238 }, { "epoch": 0.15428571428571428, "grad_norm": 0.03730668127536774, "learning_rate": 0.024000000208616257, "loss": 2.5735793113708496, "step": 3240 }, { "epoch": 0.15438095238095237, "grad_norm": 0.037182196974754333, "learning_rate": 0.024000000208616257, "loss": 2.558875560760498, "step": 3242 }, { "epoch": 0.1544761904761905, "grad_norm": 0.03875721991062164, "learning_rate": 0.024000000208616257, "loss": 2.5722126960754395, "step": 3244 }, { "epoch": 0.15457142857142858, "grad_norm": 0.03913908824324608, "learning_rate": 0.024000000208616257, "loss": 2.5881104469299316, "step": 3246 }, { "epoch": 0.15466666666666667, "grad_norm": 0.04028948396444321, "learning_rate": 0.024000000208616257, "loss": 2.551118850708008, "step": 3248 }, { "epoch": 0.15476190476190477, "grad_norm": 0.03996875882148743, "learning_rate": 0.024000000208616257, "loss": 2.5976433753967285, "step": 3250 }, { "epoch": 0.15485714285714286, "grad_norm": 0.038361094892024994, "learning_rate": 0.024000000208616257, "loss": 2.598240852355957, "step": 3252 }, { "epoch": 0.15495238095238095, "grad_norm": 0.037602052092552185, "learning_rate": 0.024000000208616257, "loss": 2.5746068954467773, "step": 3254 }, { "epoch": 0.15504761904761905, "grad_norm": 0.0370112843811512, "learning_rate": 0.024000000208616257, "loss": 2.5632176399230957, "step": 3256 }, { "epoch": 0.15514285714285714, "grad_norm": 0.0365217961370945, "learning_rate": 0.024000000208616257, "loss": 2.5950515270233154, "step": 3258 }, { "epoch": 0.15523809523809523, "grad_norm": 0.0372806079685688, "learning_rate": 0.024000000208616257, "loss": 2.571918487548828, "step": 3260 }, { "epoch": 0.15533333333333332, "grad_norm": 0.03837936744093895, "learning_rate": 0.024000000208616257, "loss": 2.55275821685791, "step": 3262 }, { "epoch": 0.15542857142857142, "grad_norm": 0.03752235695719719, "learning_rate": 0.024000000208616257, "loss": 2.572844982147217, "step": 3264 }, { "epoch": 0.15552380952380954, "grad_norm": 0.035989515483379364, "learning_rate": 0.024000000208616257, "loss": 2.5604236125946045, "step": 3266 }, { "epoch": 0.15561904761904763, "grad_norm": 0.03745793551206589, "learning_rate": 0.024000000208616257, "loss": 2.56016206741333, "step": 3268 }, { "epoch": 0.15571428571428572, "grad_norm": 0.03846251219511032, "learning_rate": 0.024000000208616257, "loss": 2.582350254058838, "step": 3270 }, { "epoch": 0.15580952380952381, "grad_norm": 0.03891860321164131, "learning_rate": 0.024000000208616257, "loss": 2.590451240539551, "step": 3272 }, { "epoch": 0.1559047619047619, "grad_norm": 0.04092872887849808, "learning_rate": 0.024000000208616257, "loss": 2.572413921356201, "step": 3274 }, { "epoch": 0.156, "grad_norm": 0.038720179349184036, "learning_rate": 0.024000000208616257, "loss": 2.5542426109313965, "step": 3276 }, { "epoch": 0.1560952380952381, "grad_norm": 0.03598913922905922, "learning_rate": 0.024000000208616257, "loss": 2.568225383758545, "step": 3278 }, { "epoch": 0.15619047619047619, "grad_norm": 0.03866675868630409, "learning_rate": 0.024000000208616257, "loss": 2.590632438659668, "step": 3280 }, { "epoch": 0.15628571428571428, "grad_norm": 0.03821682929992676, "learning_rate": 0.024000000208616257, "loss": 2.5663301944732666, "step": 3282 }, { "epoch": 0.15638095238095237, "grad_norm": 0.03708387166261673, "learning_rate": 0.024000000208616257, "loss": 2.605644702911377, "step": 3284 }, { "epoch": 0.15647619047619046, "grad_norm": 0.03740717098116875, "learning_rate": 0.024000000208616257, "loss": 2.5546374320983887, "step": 3286 }, { "epoch": 0.15657142857142858, "grad_norm": 0.03694584220647812, "learning_rate": 0.024000000208616257, "loss": 2.5737366676330566, "step": 3288 }, { "epoch": 0.15666666666666668, "grad_norm": 0.037131596356630325, "learning_rate": 0.024000000208616257, "loss": 2.5772480964660645, "step": 3290 }, { "epoch": 0.15676190476190477, "grad_norm": 0.04232798516750336, "learning_rate": 0.024000000208616257, "loss": 2.61156964302063, "step": 3292 }, { "epoch": 0.15685714285714286, "grad_norm": 0.04268529266119003, "learning_rate": 0.024000000208616257, "loss": 2.5639820098876953, "step": 3294 }, { "epoch": 0.15695238095238095, "grad_norm": 0.03777864947915077, "learning_rate": 0.024000000208616257, "loss": 2.588480234146118, "step": 3296 }, { "epoch": 0.15704761904761905, "grad_norm": 0.03795722499489784, "learning_rate": 0.024000000208616257, "loss": 2.5941028594970703, "step": 3298 }, { "epoch": 0.15714285714285714, "grad_norm": 0.03813173994421959, "learning_rate": 0.024000000208616257, "loss": 2.5907163619995117, "step": 3300 }, { "epoch": 0.15723809523809523, "grad_norm": 0.03773348033428192, "learning_rate": 0.024000000208616257, "loss": 2.5863349437713623, "step": 3302 }, { "epoch": 0.15733333333333333, "grad_norm": 0.04404408112168312, "learning_rate": 0.024000000208616257, "loss": 2.568857431411743, "step": 3304 }, { "epoch": 0.15742857142857142, "grad_norm": 0.04126882180571556, "learning_rate": 0.024000000208616257, "loss": 2.581489086151123, "step": 3306 }, { "epoch": 0.1575238095238095, "grad_norm": 0.042286887764930725, "learning_rate": 0.024000000208616257, "loss": 2.573014736175537, "step": 3308 }, { "epoch": 0.15761904761904763, "grad_norm": 0.03711560741066933, "learning_rate": 0.024000000208616257, "loss": 2.582048177719116, "step": 3310 }, { "epoch": 0.15771428571428572, "grad_norm": 0.03571171313524246, "learning_rate": 0.024000000208616257, "loss": 2.603975772857666, "step": 3312 }, { "epoch": 0.15780952380952382, "grad_norm": 0.03919314220547676, "learning_rate": 0.024000000208616257, "loss": 2.5679986476898193, "step": 3314 }, { "epoch": 0.1579047619047619, "grad_norm": 0.036842912435531616, "learning_rate": 0.024000000208616257, "loss": 2.6092076301574707, "step": 3316 }, { "epoch": 0.158, "grad_norm": 0.03792094066739082, "learning_rate": 0.024000000208616257, "loss": 2.578662157058716, "step": 3318 }, { "epoch": 0.1580952380952381, "grad_norm": 0.03942570835351944, "learning_rate": 0.024000000208616257, "loss": 2.5927019119262695, "step": 3320 }, { "epoch": 0.1581904761904762, "grad_norm": 0.03766052797436714, "learning_rate": 0.024000000208616257, "loss": 2.5704047679901123, "step": 3322 }, { "epoch": 0.15828571428571428, "grad_norm": 0.03880709782242775, "learning_rate": 0.024000000208616257, "loss": 2.56284761428833, "step": 3324 }, { "epoch": 0.15838095238095237, "grad_norm": 0.04064824432134628, "learning_rate": 0.024000000208616257, "loss": 2.611527442932129, "step": 3326 }, { "epoch": 0.15847619047619046, "grad_norm": 0.038762081414461136, "learning_rate": 0.024000000208616257, "loss": 2.5870156288146973, "step": 3328 }, { "epoch": 0.15857142857142856, "grad_norm": 0.039282746613025665, "learning_rate": 0.024000000208616257, "loss": 2.5951757431030273, "step": 3330 }, { "epoch": 0.15866666666666668, "grad_norm": 0.037641312927007675, "learning_rate": 0.024000000208616257, "loss": 2.6158976554870605, "step": 3332 }, { "epoch": 0.15876190476190477, "grad_norm": 0.03574880585074425, "learning_rate": 0.024000000208616257, "loss": 2.6234731674194336, "step": 3334 }, { "epoch": 0.15885714285714286, "grad_norm": 0.03838929533958435, "learning_rate": 0.024000000208616257, "loss": 2.608250379562378, "step": 3336 }, { "epoch": 0.15895238095238096, "grad_norm": 0.03741077333688736, "learning_rate": 0.024000000208616257, "loss": 2.5765843391418457, "step": 3338 }, { "epoch": 0.15904761904761905, "grad_norm": 0.03563082963228226, "learning_rate": 0.024000000208616257, "loss": 2.5831308364868164, "step": 3340 }, { "epoch": 0.15914285714285714, "grad_norm": 0.03876076638698578, "learning_rate": 0.024000000208616257, "loss": 2.597890853881836, "step": 3342 }, { "epoch": 0.15923809523809523, "grad_norm": 0.03783737123012543, "learning_rate": 0.024000000208616257, "loss": 2.559938430786133, "step": 3344 }, { "epoch": 0.15933333333333333, "grad_norm": 0.03706531226634979, "learning_rate": 0.024000000208616257, "loss": 2.567854881286621, "step": 3346 }, { "epoch": 0.15942857142857142, "grad_norm": 0.03845203295350075, "learning_rate": 0.024000000208616257, "loss": 2.5791778564453125, "step": 3348 }, { "epoch": 0.1595238095238095, "grad_norm": 0.04361313208937645, "learning_rate": 0.024000000208616257, "loss": 2.6156740188598633, "step": 3350 }, { "epoch": 0.15961904761904763, "grad_norm": 0.04642040655016899, "learning_rate": 0.024000000208616257, "loss": 2.5656566619873047, "step": 3352 }, { "epoch": 0.15971428571428573, "grad_norm": 0.04452825337648392, "learning_rate": 0.024000000208616257, "loss": 2.586824417114258, "step": 3354 }, { "epoch": 0.15980952380952382, "grad_norm": 0.041569784283638, "learning_rate": 0.024000000208616257, "loss": 2.585782051086426, "step": 3356 }, { "epoch": 0.1599047619047619, "grad_norm": 0.03729706257581711, "learning_rate": 0.024000000208616257, "loss": 2.58206844329834, "step": 3358 }, { "epoch": 0.16, "grad_norm": 0.03959599882364273, "learning_rate": 0.024000000208616257, "loss": 2.588587760925293, "step": 3360 }, { "epoch": 0.1600952380952381, "grad_norm": 0.03998541459441185, "learning_rate": 0.024000000208616257, "loss": 2.5446887016296387, "step": 3362 }, { "epoch": 0.1601904761904762, "grad_norm": 0.03791630268096924, "learning_rate": 0.024000000208616257, "loss": 2.6077332496643066, "step": 3364 }, { "epoch": 0.16028571428571428, "grad_norm": 0.03891317918896675, "learning_rate": 0.024000000208616257, "loss": 2.595003604888916, "step": 3366 }, { "epoch": 0.16038095238095237, "grad_norm": 0.04127093404531479, "learning_rate": 0.024000000208616257, "loss": 2.5455398559570312, "step": 3368 }, { "epoch": 0.16047619047619047, "grad_norm": 0.037817683070898056, "learning_rate": 0.024000000208616257, "loss": 2.547694683074951, "step": 3370 }, { "epoch": 0.16057142857142856, "grad_norm": 0.03817488253116608, "learning_rate": 0.024000000208616257, "loss": 2.5833773612976074, "step": 3372 }, { "epoch": 0.16066666666666668, "grad_norm": 0.03723282739520073, "learning_rate": 0.024000000208616257, "loss": 2.556349277496338, "step": 3374 }, { "epoch": 0.16076190476190477, "grad_norm": 0.0383579395711422, "learning_rate": 0.024000000208616257, "loss": 2.566047191619873, "step": 3376 }, { "epoch": 0.16085714285714287, "grad_norm": 0.03786962479352951, "learning_rate": 0.024000000208616257, "loss": 2.5930604934692383, "step": 3378 }, { "epoch": 0.16095238095238096, "grad_norm": 0.04001046344637871, "learning_rate": 0.024000000208616257, "loss": 2.5613529682159424, "step": 3380 }, { "epoch": 0.16104761904761905, "grad_norm": 0.04066681116819382, "learning_rate": 0.024000000208616257, "loss": 2.5888655185699463, "step": 3382 }, { "epoch": 0.16114285714285714, "grad_norm": 0.041851963847875595, "learning_rate": 0.024000000208616257, "loss": 2.5783705711364746, "step": 3384 }, { "epoch": 0.16123809523809524, "grad_norm": 0.03625408187508583, "learning_rate": 0.024000000208616257, "loss": 2.5725550651550293, "step": 3386 }, { "epoch": 0.16133333333333333, "grad_norm": 0.038086891174316406, "learning_rate": 0.024000000208616257, "loss": 2.5870871543884277, "step": 3388 }, { "epoch": 0.16142857142857142, "grad_norm": 0.03563603386282921, "learning_rate": 0.024000000208616257, "loss": 2.5637826919555664, "step": 3390 }, { "epoch": 0.16152380952380951, "grad_norm": 0.03612935543060303, "learning_rate": 0.024000000208616257, "loss": 2.5814735889434814, "step": 3392 }, { "epoch": 0.1616190476190476, "grad_norm": 0.03616178408265114, "learning_rate": 0.024000000208616257, "loss": 2.643418312072754, "step": 3394 }, { "epoch": 0.16171428571428573, "grad_norm": 0.03612351790070534, "learning_rate": 0.024000000208616257, "loss": 2.5679268836975098, "step": 3396 }, { "epoch": 0.16180952380952382, "grad_norm": 0.03698921948671341, "learning_rate": 0.024000000208616257, "loss": 2.603511333465576, "step": 3398 }, { "epoch": 0.1619047619047619, "grad_norm": 0.04109130799770355, "learning_rate": 0.024000000208616257, "loss": 2.6019320487976074, "step": 3400 }, { "epoch": 0.162, "grad_norm": 0.038623981177806854, "learning_rate": 0.024000000208616257, "loss": 2.6113646030426025, "step": 3402 }, { "epoch": 0.1620952380952381, "grad_norm": 0.03660590574145317, "learning_rate": 0.024000000208616257, "loss": 2.588685989379883, "step": 3404 }, { "epoch": 0.1621904761904762, "grad_norm": 0.03793664649128914, "learning_rate": 0.024000000208616257, "loss": 2.55141544342041, "step": 3406 }, { "epoch": 0.16228571428571428, "grad_norm": 0.035847485065460205, "learning_rate": 0.024000000208616257, "loss": 2.5615460872650146, "step": 3408 }, { "epoch": 0.16238095238095238, "grad_norm": 0.03646889701485634, "learning_rate": 0.024000000208616257, "loss": 2.6155221462249756, "step": 3410 }, { "epoch": 0.16247619047619047, "grad_norm": 0.036390095949172974, "learning_rate": 0.024000000208616257, "loss": 2.6109771728515625, "step": 3412 }, { "epoch": 0.16257142857142856, "grad_norm": 0.03707512468099594, "learning_rate": 0.024000000208616257, "loss": 2.5646607875823975, "step": 3414 }, { "epoch": 0.16266666666666665, "grad_norm": 0.03661083057522774, "learning_rate": 0.024000000208616257, "loss": 2.6156845092773438, "step": 3416 }, { "epoch": 0.16276190476190477, "grad_norm": 0.03813346102833748, "learning_rate": 0.024000000208616257, "loss": 2.630807399749756, "step": 3418 }, { "epoch": 0.16285714285714287, "grad_norm": 0.03798035904765129, "learning_rate": 0.024000000208616257, "loss": 2.56135892868042, "step": 3420 }, { "epoch": 0.16295238095238096, "grad_norm": 0.03608660399913788, "learning_rate": 0.024000000208616257, "loss": 2.609961748123169, "step": 3422 }, { "epoch": 0.16304761904761905, "grad_norm": 0.0365324430167675, "learning_rate": 0.024000000208616257, "loss": 2.5857741832733154, "step": 3424 }, { "epoch": 0.16314285714285715, "grad_norm": 0.03628375753760338, "learning_rate": 0.024000000208616257, "loss": 2.600064754486084, "step": 3426 }, { "epoch": 0.16323809523809524, "grad_norm": 0.0378803126513958, "learning_rate": 0.024000000208616257, "loss": 2.570301055908203, "step": 3428 }, { "epoch": 0.16333333333333333, "grad_norm": 0.03707236424088478, "learning_rate": 0.024000000208616257, "loss": 2.585999011993408, "step": 3430 }, { "epoch": 0.16342857142857142, "grad_norm": 0.036202870309352875, "learning_rate": 0.024000000208616257, "loss": 2.579110622406006, "step": 3432 }, { "epoch": 0.16352380952380952, "grad_norm": 0.037235550582408905, "learning_rate": 0.024000000208616257, "loss": 2.587153196334839, "step": 3434 }, { "epoch": 0.1636190476190476, "grad_norm": 0.03785668686032295, "learning_rate": 0.024000000208616257, "loss": 2.6179275512695312, "step": 3436 }, { "epoch": 0.1637142857142857, "grad_norm": 0.03860275819897652, "learning_rate": 0.024000000208616257, "loss": 2.570878505706787, "step": 3438 }, { "epoch": 0.16380952380952382, "grad_norm": 0.04103758558630943, "learning_rate": 0.024000000208616257, "loss": 2.5863447189331055, "step": 3440 }, { "epoch": 0.16390476190476191, "grad_norm": 0.03937200456857681, "learning_rate": 0.024000000208616257, "loss": 2.6026244163513184, "step": 3442 }, { "epoch": 0.164, "grad_norm": 0.037641383707523346, "learning_rate": 0.024000000208616257, "loss": 2.596400260925293, "step": 3444 }, { "epoch": 0.1640952380952381, "grad_norm": 0.04015339910984039, "learning_rate": 0.024000000208616257, "loss": 2.5868072509765625, "step": 3446 }, { "epoch": 0.1641904761904762, "grad_norm": 0.03847150877118111, "learning_rate": 0.024000000208616257, "loss": 2.572628974914551, "step": 3448 }, { "epoch": 0.16428571428571428, "grad_norm": 0.036505747586488724, "learning_rate": 0.024000000208616257, "loss": 2.576861619949341, "step": 3450 }, { "epoch": 0.16438095238095238, "grad_norm": 0.03616289421916008, "learning_rate": 0.024000000208616257, "loss": 2.5881576538085938, "step": 3452 }, { "epoch": 0.16447619047619047, "grad_norm": 0.036689721047878265, "learning_rate": 0.024000000208616257, "loss": 2.5626728534698486, "step": 3454 }, { "epoch": 0.16457142857142856, "grad_norm": 0.03737341985106468, "learning_rate": 0.024000000208616257, "loss": 2.6060287952423096, "step": 3456 }, { "epoch": 0.16466666666666666, "grad_norm": 0.03589243441820145, "learning_rate": 0.024000000208616257, "loss": 2.6014389991760254, "step": 3458 }, { "epoch": 0.16476190476190475, "grad_norm": 0.038638778030872345, "learning_rate": 0.024000000208616257, "loss": 2.604635715484619, "step": 3460 }, { "epoch": 0.16485714285714287, "grad_norm": 0.03649429604411125, "learning_rate": 0.024000000208616257, "loss": 2.5763425827026367, "step": 3462 }, { "epoch": 0.16495238095238096, "grad_norm": 0.03698647394776344, "learning_rate": 0.024000000208616257, "loss": 2.579378366470337, "step": 3464 }, { "epoch": 0.16504761904761905, "grad_norm": 0.03638838976621628, "learning_rate": 0.024000000208616257, "loss": 2.5946621894836426, "step": 3466 }, { "epoch": 0.16514285714285715, "grad_norm": 0.03810504451394081, "learning_rate": 0.024000000208616257, "loss": 2.568978786468506, "step": 3468 }, { "epoch": 0.16523809523809524, "grad_norm": 0.03943786025047302, "learning_rate": 0.024000000208616257, "loss": 2.6168923377990723, "step": 3470 }, { "epoch": 0.16533333333333333, "grad_norm": 0.03832157328724861, "learning_rate": 0.024000000208616257, "loss": 2.580315113067627, "step": 3472 }, { "epoch": 0.16542857142857142, "grad_norm": 0.03782135620713234, "learning_rate": 0.024000000208616257, "loss": 2.5799312591552734, "step": 3474 }, { "epoch": 0.16552380952380952, "grad_norm": 0.03735024109482765, "learning_rate": 0.024000000208616257, "loss": 2.595348834991455, "step": 3476 }, { "epoch": 0.1656190476190476, "grad_norm": 0.03641368821263313, "learning_rate": 0.024000000208616257, "loss": 2.6049492359161377, "step": 3478 }, { "epoch": 0.1657142857142857, "grad_norm": 0.03679990768432617, "learning_rate": 0.024000000208616257, "loss": 2.573033571243286, "step": 3480 }, { "epoch": 0.16580952380952382, "grad_norm": 0.03874284774065018, "learning_rate": 0.024000000208616257, "loss": 2.623642921447754, "step": 3482 }, { "epoch": 0.16590476190476192, "grad_norm": 0.038069549947977066, "learning_rate": 0.024000000208616257, "loss": 2.613168716430664, "step": 3484 }, { "epoch": 0.166, "grad_norm": 0.03733432665467262, "learning_rate": 0.024000000208616257, "loss": 2.6016125679016113, "step": 3486 }, { "epoch": 0.1660952380952381, "grad_norm": 0.03669515252113342, "learning_rate": 0.024000000208616257, "loss": 2.5759811401367188, "step": 3488 }, { "epoch": 0.1661904761904762, "grad_norm": 0.03785407543182373, "learning_rate": 0.024000000208616257, "loss": 2.588169574737549, "step": 3490 }, { "epoch": 0.1662857142857143, "grad_norm": 0.03908075764775276, "learning_rate": 0.024000000208616257, "loss": 2.5397157669067383, "step": 3492 }, { "epoch": 0.16638095238095238, "grad_norm": 0.03804094344377518, "learning_rate": 0.024000000208616257, "loss": 2.591651678085327, "step": 3494 }, { "epoch": 0.16647619047619047, "grad_norm": 0.038932785391807556, "learning_rate": 0.024000000208616257, "loss": 2.585786819458008, "step": 3496 }, { "epoch": 0.16657142857142856, "grad_norm": 0.03837302699685097, "learning_rate": 0.024000000208616257, "loss": 2.570621967315674, "step": 3498 }, { "epoch": 0.16666666666666666, "grad_norm": 0.03775116801261902, "learning_rate": 0.024000000208616257, "loss": 2.593334913253784, "step": 3500 }, { "epoch": 0.16676190476190475, "grad_norm": 0.03727610781788826, "learning_rate": 0.024000000208616257, "loss": 2.6168670654296875, "step": 3502 }, { "epoch": 0.16685714285714287, "grad_norm": 0.03580665588378906, "learning_rate": 0.024000000208616257, "loss": 2.5962228775024414, "step": 3504 }, { "epoch": 0.16695238095238096, "grad_norm": 0.034754037857055664, "learning_rate": 0.024000000208616257, "loss": 2.6312170028686523, "step": 3506 }, { "epoch": 0.16704761904761906, "grad_norm": 0.0368194580078125, "learning_rate": 0.024000000208616257, "loss": 2.5954651832580566, "step": 3508 }, { "epoch": 0.16714285714285715, "grad_norm": 0.034947820007801056, "learning_rate": 0.024000000208616257, "loss": 2.591233968734741, "step": 3510 }, { "epoch": 0.16723809523809524, "grad_norm": 0.035841718316078186, "learning_rate": 0.024000000208616257, "loss": 2.613448143005371, "step": 3512 }, { "epoch": 0.16733333333333333, "grad_norm": 0.037476133555173874, "learning_rate": 0.024000000208616257, "loss": 2.5873382091522217, "step": 3514 }, { "epoch": 0.16742857142857143, "grad_norm": 0.036380741745233536, "learning_rate": 0.024000000208616257, "loss": 2.570094347000122, "step": 3516 }, { "epoch": 0.16752380952380952, "grad_norm": 0.03665466979146004, "learning_rate": 0.024000000208616257, "loss": 2.573232650756836, "step": 3518 }, { "epoch": 0.1676190476190476, "grad_norm": 0.035988084971904755, "learning_rate": 0.024000000208616257, "loss": 2.5923912525177, "step": 3520 }, { "epoch": 0.1677142857142857, "grad_norm": 0.036385707557201385, "learning_rate": 0.024000000208616257, "loss": 2.6142523288726807, "step": 3522 }, { "epoch": 0.1678095238095238, "grad_norm": 0.036231014877557755, "learning_rate": 0.024000000208616257, "loss": 2.6069140434265137, "step": 3524 }, { "epoch": 0.16790476190476192, "grad_norm": 0.036921292543411255, "learning_rate": 0.024000000208616257, "loss": 2.623587131500244, "step": 3526 }, { "epoch": 0.168, "grad_norm": 0.04018191993236542, "learning_rate": 0.024000000208616257, "loss": 2.580695152282715, "step": 3528 }, { "epoch": 0.1680952380952381, "grad_norm": 0.03644008934497833, "learning_rate": 0.024000000208616257, "loss": 2.614800453186035, "step": 3530 }, { "epoch": 0.1681904761904762, "grad_norm": 0.03673102706670761, "learning_rate": 0.024000000208616257, "loss": 2.535187244415283, "step": 3532 }, { "epoch": 0.1682857142857143, "grad_norm": 0.037223439663648605, "learning_rate": 0.024000000208616257, "loss": 2.5671334266662598, "step": 3534 }, { "epoch": 0.16838095238095238, "grad_norm": 0.036864832043647766, "learning_rate": 0.024000000208616257, "loss": 2.6305367946624756, "step": 3536 }, { "epoch": 0.16847619047619047, "grad_norm": 0.03546323627233505, "learning_rate": 0.024000000208616257, "loss": 2.5995192527770996, "step": 3538 }, { "epoch": 0.16857142857142857, "grad_norm": 0.04027576372027397, "learning_rate": 0.024000000208616257, "loss": 2.650289297103882, "step": 3540 }, { "epoch": 0.16866666666666666, "grad_norm": 0.03582875058054924, "learning_rate": 0.024000000208616257, "loss": 2.5953903198242188, "step": 3542 }, { "epoch": 0.16876190476190475, "grad_norm": 0.03773697838187218, "learning_rate": 0.024000000208616257, "loss": 2.6257529258728027, "step": 3544 }, { "epoch": 0.16885714285714284, "grad_norm": 0.03596377372741699, "learning_rate": 0.024000000208616257, "loss": 2.58420729637146, "step": 3546 }, { "epoch": 0.16895238095238096, "grad_norm": 0.0364086851477623, "learning_rate": 0.024000000208616257, "loss": 2.5527148246765137, "step": 3548 }, { "epoch": 0.16904761904761906, "grad_norm": 0.037436917424201965, "learning_rate": 0.024000000208616257, "loss": 2.574831962585449, "step": 3550 }, { "epoch": 0.16914285714285715, "grad_norm": 0.039463888853788376, "learning_rate": 0.024000000208616257, "loss": 2.5630855560302734, "step": 3552 }, { "epoch": 0.16923809523809524, "grad_norm": 0.037678178399801254, "learning_rate": 0.024000000208616257, "loss": 2.5879950523376465, "step": 3554 }, { "epoch": 0.16933333333333334, "grad_norm": 0.03604988381266594, "learning_rate": 0.024000000208616257, "loss": 2.573836326599121, "step": 3556 }, { "epoch": 0.16942857142857143, "grad_norm": 0.03617486730217934, "learning_rate": 0.024000000208616257, "loss": 2.557751178741455, "step": 3558 }, { "epoch": 0.16952380952380952, "grad_norm": 0.038458410650491714, "learning_rate": 0.024000000208616257, "loss": 2.5980172157287598, "step": 3560 }, { "epoch": 0.1696190476190476, "grad_norm": 0.03551517426967621, "learning_rate": 0.024000000208616257, "loss": 2.6071441173553467, "step": 3562 }, { "epoch": 0.1697142857142857, "grad_norm": 0.03787603974342346, "learning_rate": 0.024000000208616257, "loss": 2.568479537963867, "step": 3564 }, { "epoch": 0.1698095238095238, "grad_norm": 0.03516482189297676, "learning_rate": 0.024000000208616257, "loss": 2.6213905811309814, "step": 3566 }, { "epoch": 0.1699047619047619, "grad_norm": 0.03558916971087456, "learning_rate": 0.024000000208616257, "loss": 2.621114730834961, "step": 3568 }, { "epoch": 0.17, "grad_norm": 0.035932037979364395, "learning_rate": 0.024000000208616257, "loss": 2.5882320404052734, "step": 3570 }, { "epoch": 0.1700952380952381, "grad_norm": 0.03620745614171028, "learning_rate": 0.024000000208616257, "loss": 2.582932472229004, "step": 3572 }, { "epoch": 0.1701904761904762, "grad_norm": 0.038171831518411636, "learning_rate": 0.024000000208616257, "loss": 2.56256103515625, "step": 3574 }, { "epoch": 0.1702857142857143, "grad_norm": 0.035574108362197876, "learning_rate": 0.024000000208616257, "loss": 2.5865225791931152, "step": 3576 }, { "epoch": 0.17038095238095238, "grad_norm": 0.035827990621328354, "learning_rate": 0.024000000208616257, "loss": 2.5876071453094482, "step": 3578 }, { "epoch": 0.17047619047619048, "grad_norm": 0.03737903758883476, "learning_rate": 0.024000000208616257, "loss": 2.5964996814727783, "step": 3580 }, { "epoch": 0.17057142857142857, "grad_norm": 0.03777303174138069, "learning_rate": 0.024000000208616257, "loss": 2.5624570846557617, "step": 3582 }, { "epoch": 0.17066666666666666, "grad_norm": 0.03596317768096924, "learning_rate": 0.024000000208616257, "loss": 2.584359884262085, "step": 3584 }, { "epoch": 0.17076190476190475, "grad_norm": 0.037259310483932495, "learning_rate": 0.024000000208616257, "loss": 2.6028850078582764, "step": 3586 }, { "epoch": 0.17085714285714285, "grad_norm": 0.035102687776088715, "learning_rate": 0.024000000208616257, "loss": 2.5666756629943848, "step": 3588 }, { "epoch": 0.17095238095238094, "grad_norm": 0.035649124532938004, "learning_rate": 0.024000000208616257, "loss": 2.5990047454833984, "step": 3590 }, { "epoch": 0.17104761904761906, "grad_norm": 0.03729894012212753, "learning_rate": 0.024000000208616257, "loss": 2.582552909851074, "step": 3592 }, { "epoch": 0.17114285714285715, "grad_norm": 0.03548767417669296, "learning_rate": 0.024000000208616257, "loss": 2.5466384887695312, "step": 3594 }, { "epoch": 0.17123809523809524, "grad_norm": 0.03531584143638611, "learning_rate": 0.024000000208616257, "loss": 2.617431402206421, "step": 3596 }, { "epoch": 0.17133333333333334, "grad_norm": 0.03597282990813255, "learning_rate": 0.024000000208616257, "loss": 2.599491596221924, "step": 3598 }, { "epoch": 0.17142857142857143, "grad_norm": 0.03751680627465248, "learning_rate": 0.024000000208616257, "loss": 2.584411144256592, "step": 3600 }, { "epoch": 0.17152380952380952, "grad_norm": 0.037576835602521896, "learning_rate": 0.024000000208616257, "loss": 2.560194492340088, "step": 3602 }, { "epoch": 0.17161904761904762, "grad_norm": 0.03712962940335274, "learning_rate": 0.024000000208616257, "loss": 2.6017680168151855, "step": 3604 }, { "epoch": 0.1717142857142857, "grad_norm": 0.037960439920425415, "learning_rate": 0.024000000208616257, "loss": 2.5726912021636963, "step": 3606 }, { "epoch": 0.1718095238095238, "grad_norm": 0.03876996412873268, "learning_rate": 0.024000000208616257, "loss": 2.561384677886963, "step": 3608 }, { "epoch": 0.1719047619047619, "grad_norm": 0.03482695296406746, "learning_rate": 0.024000000208616257, "loss": 2.5985355377197266, "step": 3610 }, { "epoch": 0.172, "grad_norm": 0.035959262400865555, "learning_rate": 0.024000000208616257, "loss": 2.581573009490967, "step": 3612 }, { "epoch": 0.1720952380952381, "grad_norm": 0.03593228757381439, "learning_rate": 0.024000000208616257, "loss": 2.5873074531555176, "step": 3614 }, { "epoch": 0.1721904761904762, "grad_norm": 0.03638030216097832, "learning_rate": 0.024000000208616257, "loss": 2.5881476402282715, "step": 3616 }, { "epoch": 0.1722857142857143, "grad_norm": 0.03616824746131897, "learning_rate": 0.024000000208616257, "loss": 2.6094048023223877, "step": 3618 }, { "epoch": 0.17238095238095238, "grad_norm": 0.03731926903128624, "learning_rate": 0.024000000208616257, "loss": 2.612442970275879, "step": 3620 }, { "epoch": 0.17247619047619048, "grad_norm": 0.03471209853887558, "learning_rate": 0.024000000208616257, "loss": 2.5927488803863525, "step": 3622 }, { "epoch": 0.17257142857142857, "grad_norm": 0.03509154170751572, "learning_rate": 0.024000000208616257, "loss": 2.60040283203125, "step": 3624 }, { "epoch": 0.17266666666666666, "grad_norm": 0.03731885552406311, "learning_rate": 0.024000000208616257, "loss": 2.5951595306396484, "step": 3626 }, { "epoch": 0.17276190476190476, "grad_norm": 0.036898862570524216, "learning_rate": 0.024000000208616257, "loss": 2.5682528018951416, "step": 3628 }, { "epoch": 0.17285714285714285, "grad_norm": 0.03588828071951866, "learning_rate": 0.024000000208616257, "loss": 2.5972023010253906, "step": 3630 }, { "epoch": 0.17295238095238094, "grad_norm": 0.034947700798511505, "learning_rate": 0.024000000208616257, "loss": 2.5906033515930176, "step": 3632 }, { "epoch": 0.17304761904761906, "grad_norm": 0.035763490945100784, "learning_rate": 0.024000000208616257, "loss": 2.56508731842041, "step": 3634 }, { "epoch": 0.17314285714285715, "grad_norm": 0.036852627992630005, "learning_rate": 0.024000000208616257, "loss": 2.5908162593841553, "step": 3636 }, { "epoch": 0.17323809523809525, "grad_norm": 0.035351671278476715, "learning_rate": 0.024000000208616257, "loss": 2.5650949478149414, "step": 3638 }, { "epoch": 0.17333333333333334, "grad_norm": 0.03427856042981148, "learning_rate": 0.024000000208616257, "loss": 2.598670482635498, "step": 3640 }, { "epoch": 0.17342857142857143, "grad_norm": 0.03623297065496445, "learning_rate": 0.024000000208616257, "loss": 2.58864426612854, "step": 3642 }, { "epoch": 0.17352380952380952, "grad_norm": 0.03480357676744461, "learning_rate": 0.024000000208616257, "loss": 2.5817041397094727, "step": 3644 }, { "epoch": 0.17361904761904762, "grad_norm": 0.03777971491217613, "learning_rate": 0.024000000208616257, "loss": 2.5737428665161133, "step": 3646 }, { "epoch": 0.1737142857142857, "grad_norm": 0.03651659935712814, "learning_rate": 0.024000000208616257, "loss": 2.543006420135498, "step": 3648 }, { "epoch": 0.1738095238095238, "grad_norm": 0.036921169608831406, "learning_rate": 0.024000000208616257, "loss": 2.5738234519958496, "step": 3650 }, { "epoch": 0.1739047619047619, "grad_norm": 0.036098722368478775, "learning_rate": 0.024000000208616257, "loss": 2.6204605102539062, "step": 3652 }, { "epoch": 0.174, "grad_norm": 0.036098141223192215, "learning_rate": 0.024000000208616257, "loss": 2.6146445274353027, "step": 3654 }, { "epoch": 0.1740952380952381, "grad_norm": 0.035169582813978195, "learning_rate": 0.024000000208616257, "loss": 2.592545986175537, "step": 3656 }, { "epoch": 0.1741904761904762, "grad_norm": 0.03683904558420181, "learning_rate": 0.024000000208616257, "loss": 2.6085023880004883, "step": 3658 }, { "epoch": 0.1742857142857143, "grad_norm": 0.03676556050777435, "learning_rate": 0.024000000208616257, "loss": 2.5953969955444336, "step": 3660 }, { "epoch": 0.1743809523809524, "grad_norm": 0.03526705875992775, "learning_rate": 0.024000000208616257, "loss": 2.55515193939209, "step": 3662 }, { "epoch": 0.17447619047619048, "grad_norm": 0.03612072765827179, "learning_rate": 0.024000000208616257, "loss": 2.5799527168273926, "step": 3664 }, { "epoch": 0.17457142857142857, "grad_norm": 0.03832464665174484, "learning_rate": 0.024000000208616257, "loss": 2.6143224239349365, "step": 3666 }, { "epoch": 0.17466666666666666, "grad_norm": 0.03806809335947037, "learning_rate": 0.024000000208616257, "loss": 2.594058036804199, "step": 3668 }, { "epoch": 0.17476190476190476, "grad_norm": 0.03448909893631935, "learning_rate": 0.024000000208616257, "loss": 2.5650601387023926, "step": 3670 }, { "epoch": 0.17485714285714285, "grad_norm": 0.036144960671663284, "learning_rate": 0.024000000208616257, "loss": 2.5896992683410645, "step": 3672 }, { "epoch": 0.17495238095238094, "grad_norm": 0.034775134176015854, "learning_rate": 0.024000000208616257, "loss": 2.628300189971924, "step": 3674 }, { "epoch": 0.17504761904761904, "grad_norm": 0.03409407660365105, "learning_rate": 0.024000000208616257, "loss": 2.5680503845214844, "step": 3676 }, { "epoch": 0.17514285714285716, "grad_norm": 0.0348866805434227, "learning_rate": 0.024000000208616257, "loss": 2.5674936771392822, "step": 3678 }, { "epoch": 0.17523809523809525, "grad_norm": 0.037791550159454346, "learning_rate": 0.024000000208616257, "loss": 2.5739011764526367, "step": 3680 }, { "epoch": 0.17533333333333334, "grad_norm": 0.03485983610153198, "learning_rate": 0.024000000208616257, "loss": 2.568359851837158, "step": 3682 }, { "epoch": 0.17542857142857143, "grad_norm": 0.03463426232337952, "learning_rate": 0.024000000208616257, "loss": 2.5831427574157715, "step": 3684 }, { "epoch": 0.17552380952380953, "grad_norm": 0.036229364573955536, "learning_rate": 0.024000000208616257, "loss": 2.603055000305176, "step": 3686 }, { "epoch": 0.17561904761904762, "grad_norm": 0.03655305504798889, "learning_rate": 0.024000000208616257, "loss": 2.5906405448913574, "step": 3688 }, { "epoch": 0.1757142857142857, "grad_norm": 0.036985304206609726, "learning_rate": 0.024000000208616257, "loss": 2.5781192779541016, "step": 3690 }, { "epoch": 0.1758095238095238, "grad_norm": 0.03758997470140457, "learning_rate": 0.024000000208616257, "loss": 2.603226900100708, "step": 3692 }, { "epoch": 0.1759047619047619, "grad_norm": 0.03595545142889023, "learning_rate": 0.024000000208616257, "loss": 2.5879788398742676, "step": 3694 }, { "epoch": 0.176, "grad_norm": 0.035379160195589066, "learning_rate": 0.024000000208616257, "loss": 2.5790154933929443, "step": 3696 }, { "epoch": 0.17609523809523808, "grad_norm": 0.03553472086787224, "learning_rate": 0.024000000208616257, "loss": 2.606894016265869, "step": 3698 }, { "epoch": 0.1761904761904762, "grad_norm": 0.0357932411134243, "learning_rate": 0.024000000208616257, "loss": 2.6251816749572754, "step": 3700 }, { "epoch": 0.1762857142857143, "grad_norm": 0.03533565625548363, "learning_rate": 0.024000000208616257, "loss": 2.5976457595825195, "step": 3702 }, { "epoch": 0.1763809523809524, "grad_norm": 0.03477932885289192, "learning_rate": 0.024000000208616257, "loss": 2.5823850631713867, "step": 3704 }, { "epoch": 0.17647619047619048, "grad_norm": 0.03873877972364426, "learning_rate": 0.024000000208616257, "loss": 2.6059117317199707, "step": 3706 }, { "epoch": 0.17657142857142857, "grad_norm": 0.03577069938182831, "learning_rate": 0.024000000208616257, "loss": 2.5611815452575684, "step": 3708 }, { "epoch": 0.17666666666666667, "grad_norm": 0.03615465387701988, "learning_rate": 0.024000000208616257, "loss": 2.5618643760681152, "step": 3710 }, { "epoch": 0.17676190476190476, "grad_norm": 0.03739304468035698, "learning_rate": 0.024000000208616257, "loss": 2.5999016761779785, "step": 3712 }, { "epoch": 0.17685714285714285, "grad_norm": 0.03572199493646622, "learning_rate": 0.024000000208616257, "loss": 2.6072468757629395, "step": 3714 }, { "epoch": 0.17695238095238094, "grad_norm": 0.035238515585660934, "learning_rate": 0.024000000208616257, "loss": 2.58591628074646, "step": 3716 }, { "epoch": 0.17704761904761904, "grad_norm": 0.03499443456530571, "learning_rate": 0.024000000208616257, "loss": 2.6075985431671143, "step": 3718 }, { "epoch": 0.17714285714285713, "grad_norm": 0.03582942485809326, "learning_rate": 0.024000000208616257, "loss": 2.5918827056884766, "step": 3720 }, { "epoch": 0.17723809523809525, "grad_norm": 0.036836907267570496, "learning_rate": 0.024000000208616257, "loss": 2.571028709411621, "step": 3722 }, { "epoch": 0.17733333333333334, "grad_norm": 0.03630765527486801, "learning_rate": 0.024000000208616257, "loss": 2.580092430114746, "step": 3724 }, { "epoch": 0.17742857142857144, "grad_norm": 0.036366358399391174, "learning_rate": 0.024000000208616257, "loss": 2.5743050575256348, "step": 3726 }, { "epoch": 0.17752380952380953, "grad_norm": 0.03660175949335098, "learning_rate": 0.024000000208616257, "loss": 2.6147756576538086, "step": 3728 }, { "epoch": 0.17761904761904762, "grad_norm": 0.03643450886011124, "learning_rate": 0.024000000208616257, "loss": 2.5741405487060547, "step": 3730 }, { "epoch": 0.1777142857142857, "grad_norm": 0.03450893983244896, "learning_rate": 0.024000000208616257, "loss": 2.594085216522217, "step": 3732 }, { "epoch": 0.1778095238095238, "grad_norm": 0.03618762642145157, "learning_rate": 0.024000000208616257, "loss": 2.598489284515381, "step": 3734 }, { "epoch": 0.1779047619047619, "grad_norm": 0.03568660095334053, "learning_rate": 0.024000000208616257, "loss": 2.557643413543701, "step": 3736 }, { "epoch": 0.178, "grad_norm": 0.0356903150677681, "learning_rate": 0.024000000208616257, "loss": 2.5890588760375977, "step": 3738 }, { "epoch": 0.17809523809523808, "grad_norm": 0.03534645959734917, "learning_rate": 0.024000000208616257, "loss": 2.6087589263916016, "step": 3740 }, { "epoch": 0.17819047619047618, "grad_norm": 0.03678276017308235, "learning_rate": 0.024000000208616257, "loss": 2.6069393157958984, "step": 3742 }, { "epoch": 0.1782857142857143, "grad_norm": 0.03761300444602966, "learning_rate": 0.024000000208616257, "loss": 2.5609617233276367, "step": 3744 }, { "epoch": 0.1783809523809524, "grad_norm": 0.036356858909130096, "learning_rate": 0.024000000208616257, "loss": 2.5791022777557373, "step": 3746 }, { "epoch": 0.17847619047619048, "grad_norm": 0.03677915781736374, "learning_rate": 0.024000000208616257, "loss": 2.5832128524780273, "step": 3748 }, { "epoch": 0.17857142857142858, "grad_norm": 0.03632054477930069, "learning_rate": 0.024000000208616257, "loss": 2.521916389465332, "step": 3750 }, { "epoch": 0.17866666666666667, "grad_norm": 0.03682326152920723, "learning_rate": 0.024000000208616257, "loss": 2.597667932510376, "step": 3752 }, { "epoch": 0.17876190476190476, "grad_norm": 0.035291146486997604, "learning_rate": 0.024000000208616257, "loss": 2.575679302215576, "step": 3754 }, { "epoch": 0.17885714285714285, "grad_norm": 0.03844251483678818, "learning_rate": 0.024000000208616257, "loss": 2.5977742671966553, "step": 3756 }, { "epoch": 0.17895238095238095, "grad_norm": 0.040382757782936096, "learning_rate": 0.024000000208616257, "loss": 2.5831048488616943, "step": 3758 }, { "epoch": 0.17904761904761904, "grad_norm": 0.0340469628572464, "learning_rate": 0.024000000208616257, "loss": 2.5819618701934814, "step": 3760 }, { "epoch": 0.17914285714285713, "grad_norm": 0.0377904511988163, "learning_rate": 0.024000000208616257, "loss": 2.579611301422119, "step": 3762 }, { "epoch": 0.17923809523809525, "grad_norm": 0.034769341349601746, "learning_rate": 0.024000000208616257, "loss": 2.5916800498962402, "step": 3764 }, { "epoch": 0.17933333333333334, "grad_norm": 0.036123327910900116, "learning_rate": 0.024000000208616257, "loss": 2.5613017082214355, "step": 3766 }, { "epoch": 0.17942857142857144, "grad_norm": 0.036977894604206085, "learning_rate": 0.024000000208616257, "loss": 2.586777687072754, "step": 3768 }, { "epoch": 0.17952380952380953, "grad_norm": 0.03416622430086136, "learning_rate": 0.024000000208616257, "loss": 2.5695276260375977, "step": 3770 }, { "epoch": 0.17961904761904762, "grad_norm": 0.03839719295501709, "learning_rate": 0.024000000208616257, "loss": 2.591599702835083, "step": 3772 }, { "epoch": 0.17971428571428572, "grad_norm": 0.03493225574493408, "learning_rate": 0.024000000208616257, "loss": 2.6083011627197266, "step": 3774 }, { "epoch": 0.1798095238095238, "grad_norm": 0.03486818075180054, "learning_rate": 0.024000000208616257, "loss": 2.565929412841797, "step": 3776 }, { "epoch": 0.1799047619047619, "grad_norm": 0.03632477670907974, "learning_rate": 0.024000000208616257, "loss": 2.5991621017456055, "step": 3778 }, { "epoch": 0.18, "grad_norm": 0.03698736056685448, "learning_rate": 0.024000000208616257, "loss": 2.6066994667053223, "step": 3780 }, { "epoch": 0.18009523809523809, "grad_norm": 0.036889299750328064, "learning_rate": 0.024000000208616257, "loss": 2.5794386863708496, "step": 3782 }, { "epoch": 0.18019047619047618, "grad_norm": 0.03622773289680481, "learning_rate": 0.024000000208616257, "loss": 2.553499698638916, "step": 3784 }, { "epoch": 0.1802857142857143, "grad_norm": 0.03733193501830101, "learning_rate": 0.024000000208616257, "loss": 2.570643186569214, "step": 3786 }, { "epoch": 0.1803809523809524, "grad_norm": 0.03909533843398094, "learning_rate": 0.024000000208616257, "loss": 2.5848593711853027, "step": 3788 }, { "epoch": 0.18047619047619048, "grad_norm": 0.04251650348305702, "learning_rate": 0.024000000208616257, "loss": 2.589991569519043, "step": 3790 }, { "epoch": 0.18057142857142858, "grad_norm": 0.0425642728805542, "learning_rate": 0.024000000208616257, "loss": 2.569910764694214, "step": 3792 }, { "epoch": 0.18066666666666667, "grad_norm": 0.040211379528045654, "learning_rate": 0.024000000208616257, "loss": 2.5878047943115234, "step": 3794 }, { "epoch": 0.18076190476190476, "grad_norm": 0.03971543163061142, "learning_rate": 0.024000000208616257, "loss": 2.596428394317627, "step": 3796 }, { "epoch": 0.18085714285714286, "grad_norm": 0.03757985681295395, "learning_rate": 0.024000000208616257, "loss": 2.5731163024902344, "step": 3798 }, { "epoch": 0.18095238095238095, "grad_norm": 0.039098531007766724, "learning_rate": 0.024000000208616257, "loss": 2.6045825481414795, "step": 3800 }, { "epoch": 0.18104761904761904, "grad_norm": 0.03863958269357681, "learning_rate": 0.024000000208616257, "loss": 2.559603452682495, "step": 3802 }, { "epoch": 0.18114285714285713, "grad_norm": 0.03727087005972862, "learning_rate": 0.024000000208616257, "loss": 2.5800206661224365, "step": 3804 }, { "epoch": 0.18123809523809523, "grad_norm": 0.035311002284288406, "learning_rate": 0.024000000208616257, "loss": 2.5937516689300537, "step": 3806 }, { "epoch": 0.18133333333333335, "grad_norm": 0.03637601435184479, "learning_rate": 0.024000000208616257, "loss": 2.5942938327789307, "step": 3808 }, { "epoch": 0.18142857142857144, "grad_norm": 0.03690359368920326, "learning_rate": 0.024000000208616257, "loss": 2.5750186443328857, "step": 3810 }, { "epoch": 0.18152380952380953, "grad_norm": 0.035629723221063614, "learning_rate": 0.024000000208616257, "loss": 2.5644125938415527, "step": 3812 }, { "epoch": 0.18161904761904762, "grad_norm": 0.03920522704720497, "learning_rate": 0.024000000208616257, "loss": 2.5680899620056152, "step": 3814 }, { "epoch": 0.18171428571428572, "grad_norm": 0.03598304092884064, "learning_rate": 0.024000000208616257, "loss": 2.571955680847168, "step": 3816 }, { "epoch": 0.1818095238095238, "grad_norm": 0.03703358769416809, "learning_rate": 0.024000000208616257, "loss": 2.559556245803833, "step": 3818 }, { "epoch": 0.1819047619047619, "grad_norm": 0.0338224396109581, "learning_rate": 0.024000000208616257, "loss": 2.5974698066711426, "step": 3820 }, { "epoch": 0.182, "grad_norm": 0.03628638759255409, "learning_rate": 0.024000000208616257, "loss": 2.565671443939209, "step": 3822 }, { "epoch": 0.1820952380952381, "grad_norm": 0.03563361242413521, "learning_rate": 0.024000000208616257, "loss": 2.5843684673309326, "step": 3824 }, { "epoch": 0.18219047619047618, "grad_norm": 0.035930778831243515, "learning_rate": 0.024000000208616257, "loss": 2.5907411575317383, "step": 3826 }, { "epoch": 0.18228571428571427, "grad_norm": 0.03542965650558472, "learning_rate": 0.024000000208616257, "loss": 2.582669734954834, "step": 3828 }, { "epoch": 0.1823809523809524, "grad_norm": 0.0352163128554821, "learning_rate": 0.024000000208616257, "loss": 2.5982015132904053, "step": 3830 }, { "epoch": 0.1824761904761905, "grad_norm": 0.03489324077963829, "learning_rate": 0.024000000208616257, "loss": 2.5717952251434326, "step": 3832 }, { "epoch": 0.18257142857142858, "grad_norm": 0.03707144036889076, "learning_rate": 0.024000000208616257, "loss": 2.553835391998291, "step": 3834 }, { "epoch": 0.18266666666666667, "grad_norm": 0.03687654435634613, "learning_rate": 0.024000000208616257, "loss": 2.5953707695007324, "step": 3836 }, { "epoch": 0.18276190476190476, "grad_norm": 0.034177061170339584, "learning_rate": 0.024000000208616257, "loss": 2.579918384552002, "step": 3838 }, { "epoch": 0.18285714285714286, "grad_norm": 0.03682340681552887, "learning_rate": 0.024000000208616257, "loss": 2.5847606658935547, "step": 3840 }, { "epoch": 0.18295238095238095, "grad_norm": 0.03682130202651024, "learning_rate": 0.024000000208616257, "loss": 2.570807456970215, "step": 3842 }, { "epoch": 0.18304761904761904, "grad_norm": 0.03474225476384163, "learning_rate": 0.024000000208616257, "loss": 2.5558857917785645, "step": 3844 }, { "epoch": 0.18314285714285714, "grad_norm": 0.03462562710046768, "learning_rate": 0.024000000208616257, "loss": 2.5621089935302734, "step": 3846 }, { "epoch": 0.18323809523809523, "grad_norm": 0.035473935306072235, "learning_rate": 0.024000000208616257, "loss": 2.5694785118103027, "step": 3848 }, { "epoch": 0.18333333333333332, "grad_norm": 0.03322350233793259, "learning_rate": 0.024000000208616257, "loss": 2.551501750946045, "step": 3850 }, { "epoch": 0.18342857142857144, "grad_norm": 0.03443906456232071, "learning_rate": 0.024000000208616257, "loss": 2.5708844661712646, "step": 3852 }, { "epoch": 0.18352380952380953, "grad_norm": 0.0343591645359993, "learning_rate": 0.024000000208616257, "loss": 2.6071577072143555, "step": 3854 }, { "epoch": 0.18361904761904763, "grad_norm": 0.03414541110396385, "learning_rate": 0.024000000208616257, "loss": 2.5749268531799316, "step": 3856 }, { "epoch": 0.18371428571428572, "grad_norm": 0.035436782985925674, "learning_rate": 0.024000000208616257, "loss": 2.5797038078308105, "step": 3858 }, { "epoch": 0.1838095238095238, "grad_norm": 0.035962190479040146, "learning_rate": 0.024000000208616257, "loss": 2.6006264686584473, "step": 3860 }, { "epoch": 0.1839047619047619, "grad_norm": 0.034405361860990524, "learning_rate": 0.024000000208616257, "loss": 2.5177998542785645, "step": 3862 }, { "epoch": 0.184, "grad_norm": 0.03483660891652107, "learning_rate": 0.024000000208616257, "loss": 2.5903868675231934, "step": 3864 }, { "epoch": 0.1840952380952381, "grad_norm": 0.036718521267175674, "learning_rate": 0.024000000208616257, "loss": 2.5736422538757324, "step": 3866 }, { "epoch": 0.18419047619047618, "grad_norm": 0.03834947943687439, "learning_rate": 0.024000000208616257, "loss": 2.583667755126953, "step": 3868 }, { "epoch": 0.18428571428571427, "grad_norm": 0.033917441964149475, "learning_rate": 0.024000000208616257, "loss": 2.5368809700012207, "step": 3870 }, { "epoch": 0.18438095238095237, "grad_norm": 0.034085649996995926, "learning_rate": 0.024000000208616257, "loss": 2.5599677562713623, "step": 3872 }, { "epoch": 0.1844761904761905, "grad_norm": 0.03609776869416237, "learning_rate": 0.024000000208616257, "loss": 2.5669021606445312, "step": 3874 }, { "epoch": 0.18457142857142858, "grad_norm": 0.03386789187788963, "learning_rate": 0.024000000208616257, "loss": 2.6025452613830566, "step": 3876 }, { "epoch": 0.18466666666666667, "grad_norm": 0.03945763036608696, "learning_rate": 0.024000000208616257, "loss": 2.538090229034424, "step": 3878 }, { "epoch": 0.18476190476190477, "grad_norm": 0.03828416392207146, "learning_rate": 0.024000000208616257, "loss": 2.547985076904297, "step": 3880 }, { "epoch": 0.18485714285714286, "grad_norm": 0.03782835230231285, "learning_rate": 0.024000000208616257, "loss": 2.5466725826263428, "step": 3882 }, { "epoch": 0.18495238095238095, "grad_norm": 0.037058766931295395, "learning_rate": 0.024000000208616257, "loss": 2.5865139961242676, "step": 3884 }, { "epoch": 0.18504761904761904, "grad_norm": 0.03750511631369591, "learning_rate": 0.024000000208616257, "loss": 2.59661865234375, "step": 3886 }, { "epoch": 0.18514285714285714, "grad_norm": 0.03587372228503227, "learning_rate": 0.024000000208616257, "loss": 2.5522284507751465, "step": 3888 }, { "epoch": 0.18523809523809523, "grad_norm": 0.036680918186903, "learning_rate": 0.024000000208616257, "loss": 2.540776252746582, "step": 3890 }, { "epoch": 0.18533333333333332, "grad_norm": 0.03604034706950188, "learning_rate": 0.024000000208616257, "loss": 2.556938409805298, "step": 3892 }, { "epoch": 0.18542857142857141, "grad_norm": 0.03424551710486412, "learning_rate": 0.024000000208616257, "loss": 2.572035312652588, "step": 3894 }, { "epoch": 0.18552380952380954, "grad_norm": 0.03640477731823921, "learning_rate": 0.024000000208616257, "loss": 2.543801784515381, "step": 3896 }, { "epoch": 0.18561904761904763, "grad_norm": 0.035998739302158356, "learning_rate": 0.024000000208616257, "loss": 2.5703468322753906, "step": 3898 }, { "epoch": 0.18571428571428572, "grad_norm": 0.03624982014298439, "learning_rate": 0.024000000208616257, "loss": 2.5546584129333496, "step": 3900 }, { "epoch": 0.1858095238095238, "grad_norm": 0.03669844940304756, "learning_rate": 0.024000000208616257, "loss": 2.579784393310547, "step": 3902 }, { "epoch": 0.1859047619047619, "grad_norm": 0.036059655249118805, "learning_rate": 0.024000000208616257, "loss": 2.5795562267303467, "step": 3904 }, { "epoch": 0.186, "grad_norm": 0.036286402493715286, "learning_rate": 0.024000000208616257, "loss": 2.603867769241333, "step": 3906 }, { "epoch": 0.1860952380952381, "grad_norm": 0.03371820226311684, "learning_rate": 0.024000000208616257, "loss": 2.594308376312256, "step": 3908 }, { "epoch": 0.18619047619047618, "grad_norm": 0.035554610192775726, "learning_rate": 0.024000000208616257, "loss": 2.5368824005126953, "step": 3910 }, { "epoch": 0.18628571428571428, "grad_norm": 0.035783551633358, "learning_rate": 0.024000000208616257, "loss": 2.5571463108062744, "step": 3912 }, { "epoch": 0.18638095238095237, "grad_norm": 0.03562548756599426, "learning_rate": 0.024000000208616257, "loss": 2.5841615200042725, "step": 3914 }, { "epoch": 0.1864761904761905, "grad_norm": 0.0368603952229023, "learning_rate": 0.024000000208616257, "loss": 2.594428062438965, "step": 3916 }, { "epoch": 0.18657142857142858, "grad_norm": 0.03434215858578682, "learning_rate": 0.024000000208616257, "loss": 2.5495433807373047, "step": 3918 }, { "epoch": 0.18666666666666668, "grad_norm": 0.03743297606706619, "learning_rate": 0.024000000208616257, "loss": 2.569371223449707, "step": 3920 }, { "epoch": 0.18676190476190477, "grad_norm": 0.03600861504673958, "learning_rate": 0.024000000208616257, "loss": 2.5812363624572754, "step": 3922 }, { "epoch": 0.18685714285714286, "grad_norm": 0.034476861357688904, "learning_rate": 0.024000000208616257, "loss": 2.5817108154296875, "step": 3924 }, { "epoch": 0.18695238095238095, "grad_norm": 0.03442566469311714, "learning_rate": 0.024000000208616257, "loss": 2.580728530883789, "step": 3926 }, { "epoch": 0.18704761904761905, "grad_norm": 0.03582291677594185, "learning_rate": 0.024000000208616257, "loss": 2.5501585006713867, "step": 3928 }, { "epoch": 0.18714285714285714, "grad_norm": 0.03480437025427818, "learning_rate": 0.024000000208616257, "loss": 2.563168525695801, "step": 3930 }, { "epoch": 0.18723809523809523, "grad_norm": 0.033831916749477386, "learning_rate": 0.024000000208616257, "loss": 2.5686159133911133, "step": 3932 }, { "epoch": 0.18733333333333332, "grad_norm": 0.03668172284960747, "learning_rate": 0.024000000208616257, "loss": 2.567789077758789, "step": 3934 }, { "epoch": 0.18742857142857142, "grad_norm": 0.0369279719889164, "learning_rate": 0.024000000208616257, "loss": 2.5745060443878174, "step": 3936 }, { "epoch": 0.18752380952380954, "grad_norm": 0.03529951348900795, "learning_rate": 0.024000000208616257, "loss": 2.566387176513672, "step": 3938 }, { "epoch": 0.18761904761904763, "grad_norm": 0.037536926567554474, "learning_rate": 0.024000000208616257, "loss": 2.5819735527038574, "step": 3940 }, { "epoch": 0.18771428571428572, "grad_norm": 0.03803282603621483, "learning_rate": 0.024000000208616257, "loss": 2.5803279876708984, "step": 3942 }, { "epoch": 0.18780952380952382, "grad_norm": 0.03888283297419548, "learning_rate": 0.024000000208616257, "loss": 2.5800604820251465, "step": 3944 }, { "epoch": 0.1879047619047619, "grad_norm": 0.03653387352824211, "learning_rate": 0.024000000208616257, "loss": 2.602646589279175, "step": 3946 }, { "epoch": 0.188, "grad_norm": 0.03531850874423981, "learning_rate": 0.024000000208616257, "loss": 2.5851640701293945, "step": 3948 }, { "epoch": 0.1880952380952381, "grad_norm": 0.03786034137010574, "learning_rate": 0.024000000208616257, "loss": 2.558778762817383, "step": 3950 }, { "epoch": 0.18819047619047619, "grad_norm": 0.036380134522914886, "learning_rate": 0.024000000208616257, "loss": 2.5725481510162354, "step": 3952 }, { "epoch": 0.18828571428571428, "grad_norm": 0.03544646501541138, "learning_rate": 0.024000000208616257, "loss": 2.6077680587768555, "step": 3954 }, { "epoch": 0.18838095238095237, "grad_norm": 0.03478200361132622, "learning_rate": 0.024000000208616257, "loss": 2.595104217529297, "step": 3956 }, { "epoch": 0.18847619047619046, "grad_norm": 0.03539995476603508, "learning_rate": 0.024000000208616257, "loss": 2.567141056060791, "step": 3958 }, { "epoch": 0.18857142857142858, "grad_norm": 0.03709389269351959, "learning_rate": 0.024000000208616257, "loss": 2.5832438468933105, "step": 3960 }, { "epoch": 0.18866666666666668, "grad_norm": 0.03470085188746452, "learning_rate": 0.024000000208616257, "loss": 2.5676064491271973, "step": 3962 }, { "epoch": 0.18876190476190477, "grad_norm": 0.03516855090856552, "learning_rate": 0.024000000208616257, "loss": 2.569812059402466, "step": 3964 }, { "epoch": 0.18885714285714286, "grad_norm": 0.0350259393453598, "learning_rate": 0.024000000208616257, "loss": 2.6041622161865234, "step": 3966 }, { "epoch": 0.18895238095238095, "grad_norm": 0.034796375781297684, "learning_rate": 0.024000000208616257, "loss": 2.5570831298828125, "step": 3968 }, { "epoch": 0.18904761904761905, "grad_norm": 0.034140463918447495, "learning_rate": 0.024000000208616257, "loss": 2.583599090576172, "step": 3970 }, { "epoch": 0.18914285714285714, "grad_norm": 0.03554283455014229, "learning_rate": 0.024000000208616257, "loss": 2.584758758544922, "step": 3972 }, { "epoch": 0.18923809523809523, "grad_norm": 0.03525828942656517, "learning_rate": 0.024000000208616257, "loss": 2.594377040863037, "step": 3974 }, { "epoch": 0.18933333333333333, "grad_norm": 0.03587576374411583, "learning_rate": 0.024000000208616257, "loss": 2.588909387588501, "step": 3976 }, { "epoch": 0.18942857142857142, "grad_norm": 0.03541038930416107, "learning_rate": 0.024000000208616257, "loss": 2.552457094192505, "step": 3978 }, { "epoch": 0.1895238095238095, "grad_norm": 0.03540955111384392, "learning_rate": 0.024000000208616257, "loss": 2.597123861312866, "step": 3980 }, { "epoch": 0.18961904761904763, "grad_norm": 0.03591640293598175, "learning_rate": 0.024000000208616257, "loss": 2.558781385421753, "step": 3982 }, { "epoch": 0.18971428571428572, "grad_norm": 0.03546721115708351, "learning_rate": 0.024000000208616257, "loss": 2.58347225189209, "step": 3984 }, { "epoch": 0.18980952380952382, "grad_norm": 0.035707972943782806, "learning_rate": 0.024000000208616257, "loss": 2.5495967864990234, "step": 3986 }, { "epoch": 0.1899047619047619, "grad_norm": 0.038125958293676376, "learning_rate": 0.024000000208616257, "loss": 2.5839104652404785, "step": 3988 }, { "epoch": 0.19, "grad_norm": 0.03766465559601784, "learning_rate": 0.024000000208616257, "loss": 2.590101718902588, "step": 3990 }, { "epoch": 0.1900952380952381, "grad_norm": 0.03524955362081528, "learning_rate": 0.024000000208616257, "loss": 2.583113670349121, "step": 3992 }, { "epoch": 0.1901904761904762, "grad_norm": 0.03453271836042404, "learning_rate": 0.024000000208616257, "loss": 2.587566375732422, "step": 3994 }, { "epoch": 0.19028571428571428, "grad_norm": 0.0349983349442482, "learning_rate": 0.024000000208616257, "loss": 2.603372097015381, "step": 3996 }, { "epoch": 0.19038095238095237, "grad_norm": 0.033327214419841766, "learning_rate": 0.024000000208616257, "loss": 2.572134494781494, "step": 3998 }, { "epoch": 0.19047619047619047, "grad_norm": 0.0345207080245018, "learning_rate": 0.024000000208616257, "loss": 2.5726029872894287, "step": 4000 }, { "epoch": 0.19057142857142856, "grad_norm": 0.035919249057769775, "learning_rate": 0.024000000208616257, "loss": 2.5764451026916504, "step": 4002 }, { "epoch": 0.19066666666666668, "grad_norm": 0.03498078137636185, "learning_rate": 0.024000000208616257, "loss": 2.543534278869629, "step": 4004 }, { "epoch": 0.19076190476190477, "grad_norm": 0.03415418416261673, "learning_rate": 0.024000000208616257, "loss": 2.5808145999908447, "step": 4006 }, { "epoch": 0.19085714285714286, "grad_norm": 0.04000689834356308, "learning_rate": 0.024000000208616257, "loss": 2.5693047046661377, "step": 4008 }, { "epoch": 0.19095238095238096, "grad_norm": 0.034647099673748016, "learning_rate": 0.024000000208616257, "loss": 2.572798490524292, "step": 4010 }, { "epoch": 0.19104761904761905, "grad_norm": 0.035181835293769836, "learning_rate": 0.024000000208616257, "loss": 2.5400123596191406, "step": 4012 }, { "epoch": 0.19114285714285714, "grad_norm": 0.0367269292473793, "learning_rate": 0.024000000208616257, "loss": 2.5885791778564453, "step": 4014 }, { "epoch": 0.19123809523809523, "grad_norm": 0.035066112875938416, "learning_rate": 0.024000000208616257, "loss": 2.5827269554138184, "step": 4016 }, { "epoch": 0.19133333333333333, "grad_norm": 0.036599427461624146, "learning_rate": 0.024000000208616257, "loss": 2.5676329135894775, "step": 4018 }, { "epoch": 0.19142857142857142, "grad_norm": 0.03744552657008171, "learning_rate": 0.024000000208616257, "loss": 2.5834617614746094, "step": 4020 }, { "epoch": 0.1915238095238095, "grad_norm": 0.03463251143693924, "learning_rate": 0.024000000208616257, "loss": 2.55588960647583, "step": 4022 }, { "epoch": 0.1916190476190476, "grad_norm": 0.036631837487220764, "learning_rate": 0.024000000208616257, "loss": 2.587717056274414, "step": 4024 }, { "epoch": 0.19171428571428573, "grad_norm": 0.035280242562294006, "learning_rate": 0.024000000208616257, "loss": 2.59883189201355, "step": 4026 }, { "epoch": 0.19180952380952382, "grad_norm": 0.03398521989583969, "learning_rate": 0.024000000208616257, "loss": 2.586668014526367, "step": 4028 }, { "epoch": 0.1919047619047619, "grad_norm": 0.03478521481156349, "learning_rate": 0.024000000208616257, "loss": 2.602464199066162, "step": 4030 }, { "epoch": 0.192, "grad_norm": 0.03603247180581093, "learning_rate": 0.024000000208616257, "loss": 2.59920072555542, "step": 4032 }, { "epoch": 0.1920952380952381, "grad_norm": 0.0360339991748333, "learning_rate": 0.024000000208616257, "loss": 2.6083576679229736, "step": 4034 }, { "epoch": 0.1921904761904762, "grad_norm": 0.03687717765569687, "learning_rate": 0.024000000208616257, "loss": 2.574791431427002, "step": 4036 }, { "epoch": 0.19228571428571428, "grad_norm": 0.03439399600028992, "learning_rate": 0.024000000208616257, "loss": 2.5542335510253906, "step": 4038 }, { "epoch": 0.19238095238095237, "grad_norm": 0.035350337624549866, "learning_rate": 0.024000000208616257, "loss": 2.5740103721618652, "step": 4040 }, { "epoch": 0.19247619047619047, "grad_norm": 0.03419196233153343, "learning_rate": 0.024000000208616257, "loss": 2.593364715576172, "step": 4042 }, { "epoch": 0.19257142857142856, "grad_norm": 0.034745100885629654, "learning_rate": 0.024000000208616257, "loss": 2.583347797393799, "step": 4044 }, { "epoch": 0.19266666666666668, "grad_norm": 0.034512653946876526, "learning_rate": 0.024000000208616257, "loss": 2.5642800331115723, "step": 4046 }, { "epoch": 0.19276190476190477, "grad_norm": 0.035629257559776306, "learning_rate": 0.024000000208616257, "loss": 2.574430227279663, "step": 4048 }, { "epoch": 0.19285714285714287, "grad_norm": 0.03505939990282059, "learning_rate": 0.024000000208616257, "loss": 2.589724063873291, "step": 4050 }, { "epoch": 0.19295238095238096, "grad_norm": 0.034282706677913666, "learning_rate": 0.024000000208616257, "loss": 2.5716278553009033, "step": 4052 }, { "epoch": 0.19304761904761905, "grad_norm": 0.03433636203408241, "learning_rate": 0.024000000208616257, "loss": 2.5909717082977295, "step": 4054 }, { "epoch": 0.19314285714285714, "grad_norm": 0.033141255378723145, "learning_rate": 0.024000000208616257, "loss": 2.586576223373413, "step": 4056 }, { "epoch": 0.19323809523809524, "grad_norm": 0.03318466618657112, "learning_rate": 0.024000000208616257, "loss": 2.582129716873169, "step": 4058 }, { "epoch": 0.19333333333333333, "grad_norm": 0.03590330109000206, "learning_rate": 0.024000000208616257, "loss": 2.5722076892852783, "step": 4060 }, { "epoch": 0.19342857142857142, "grad_norm": 0.034424442797899246, "learning_rate": 0.024000000208616257, "loss": 2.619863271713257, "step": 4062 }, { "epoch": 0.19352380952380951, "grad_norm": 0.03711072355508804, "learning_rate": 0.024000000208616257, "loss": 2.568904399871826, "step": 4064 }, { "epoch": 0.1936190476190476, "grad_norm": 0.039717428386211395, "learning_rate": 0.024000000208616257, "loss": 2.5601108074188232, "step": 4066 }, { "epoch": 0.19371428571428573, "grad_norm": 0.037900879979133606, "learning_rate": 0.024000000208616257, "loss": 2.5636086463928223, "step": 4068 }, { "epoch": 0.19380952380952382, "grad_norm": 0.03543683513998985, "learning_rate": 0.024000000208616257, "loss": 2.563335418701172, "step": 4070 }, { "epoch": 0.1939047619047619, "grad_norm": 0.036185432225465775, "learning_rate": 0.024000000208616257, "loss": 2.5899839401245117, "step": 4072 }, { "epoch": 0.194, "grad_norm": 0.03377417474985123, "learning_rate": 0.024000000208616257, "loss": 2.566890001296997, "step": 4074 }, { "epoch": 0.1940952380952381, "grad_norm": 0.03569241240620613, "learning_rate": 0.024000000208616257, "loss": 2.6012792587280273, "step": 4076 }, { "epoch": 0.1941904761904762, "grad_norm": 0.035121772438287735, "learning_rate": 0.024000000208616257, "loss": 2.5599584579467773, "step": 4078 }, { "epoch": 0.19428571428571428, "grad_norm": 0.035765938460826874, "learning_rate": 0.024000000208616257, "loss": 2.574533462524414, "step": 4080 }, { "epoch": 0.19438095238095238, "grad_norm": 0.03651375323534012, "learning_rate": 0.024000000208616257, "loss": 2.575179100036621, "step": 4082 }, { "epoch": 0.19447619047619047, "grad_norm": 0.032939594238996506, "learning_rate": 0.024000000208616257, "loss": 2.565250873565674, "step": 4084 }, { "epoch": 0.19457142857142856, "grad_norm": 0.033757809549570084, "learning_rate": 0.024000000208616257, "loss": 2.564136266708374, "step": 4086 }, { "epoch": 0.19466666666666665, "grad_norm": 0.036203041672706604, "learning_rate": 0.024000000208616257, "loss": 2.574443817138672, "step": 4088 }, { "epoch": 0.19476190476190477, "grad_norm": 0.0338924378156662, "learning_rate": 0.024000000208616257, "loss": 2.5327677726745605, "step": 4090 }, { "epoch": 0.19485714285714287, "grad_norm": 0.03631781414151192, "learning_rate": 0.024000000208616257, "loss": 2.5588722229003906, "step": 4092 }, { "epoch": 0.19495238095238096, "grad_norm": 0.03682277351617813, "learning_rate": 0.024000000208616257, "loss": 2.5773253440856934, "step": 4094 }, { "epoch": 0.19504761904761905, "grad_norm": 0.03771039471030235, "learning_rate": 0.024000000208616257, "loss": 2.6134185791015625, "step": 4096 }, { "epoch": 0.19514285714285715, "grad_norm": 0.043583620339632034, "learning_rate": 0.024000000208616257, "loss": 2.573237180709839, "step": 4098 }, { "epoch": 0.19523809523809524, "grad_norm": 0.038749683648347855, "learning_rate": 0.024000000208616257, "loss": 2.582487106323242, "step": 4100 }, { "epoch": 0.19533333333333333, "grad_norm": 0.04303133487701416, "learning_rate": 0.024000000208616257, "loss": 2.594564437866211, "step": 4102 }, { "epoch": 0.19542857142857142, "grad_norm": 0.04366550222039223, "learning_rate": 0.024000000208616257, "loss": 2.602062463760376, "step": 4104 }, { "epoch": 0.19552380952380952, "grad_norm": 0.03739605098962784, "learning_rate": 0.024000000208616257, "loss": 2.5859251022338867, "step": 4106 }, { "epoch": 0.1956190476190476, "grad_norm": 0.04063514992594719, "learning_rate": 0.024000000208616257, "loss": 2.5562491416931152, "step": 4108 }, { "epoch": 0.1957142857142857, "grad_norm": 0.0402587428689003, "learning_rate": 0.024000000208616257, "loss": 2.5946474075317383, "step": 4110 }, { "epoch": 0.19580952380952382, "grad_norm": 0.03707674890756607, "learning_rate": 0.024000000208616257, "loss": 2.563938617706299, "step": 4112 }, { "epoch": 0.19590476190476191, "grad_norm": 0.0363638699054718, "learning_rate": 0.024000000208616257, "loss": 2.5415945053100586, "step": 4114 }, { "epoch": 0.196, "grad_norm": 0.033633146435022354, "learning_rate": 0.024000000208616257, "loss": 2.539292812347412, "step": 4116 }, { "epoch": 0.1960952380952381, "grad_norm": 0.032996051013469696, "learning_rate": 0.024000000208616257, "loss": 2.5668439865112305, "step": 4118 }, { "epoch": 0.1961904761904762, "grad_norm": 0.03551589325070381, "learning_rate": 0.024000000208616257, "loss": 2.5800704956054688, "step": 4120 }, { "epoch": 0.19628571428571429, "grad_norm": 0.03535579517483711, "learning_rate": 0.024000000208616257, "loss": 2.5717945098876953, "step": 4122 }, { "epoch": 0.19638095238095238, "grad_norm": 0.0339796207845211, "learning_rate": 0.024000000208616257, "loss": 2.5824027061462402, "step": 4124 }, { "epoch": 0.19647619047619047, "grad_norm": 0.03379741683602333, "learning_rate": 0.024000000208616257, "loss": 2.5625414848327637, "step": 4126 }, { "epoch": 0.19657142857142856, "grad_norm": 0.03496759012341499, "learning_rate": 0.024000000208616257, "loss": 2.598557472229004, "step": 4128 }, { "epoch": 0.19666666666666666, "grad_norm": 0.034331172704696655, "learning_rate": 0.024000000208616257, "loss": 2.5762972831726074, "step": 4130 }, { "epoch": 0.19676190476190475, "grad_norm": 0.034758783876895905, "learning_rate": 0.024000000208616257, "loss": 2.5428030490875244, "step": 4132 }, { "epoch": 0.19685714285714287, "grad_norm": 0.0341840460896492, "learning_rate": 0.024000000208616257, "loss": 2.575894832611084, "step": 4134 }, { "epoch": 0.19695238095238096, "grad_norm": 0.03939260542392731, "learning_rate": 0.024000000208616257, "loss": 2.5734972953796387, "step": 4136 }, { "epoch": 0.19704761904761905, "grad_norm": 0.03350234031677246, "learning_rate": 0.024000000208616257, "loss": 2.5522074699401855, "step": 4138 }, { "epoch": 0.19714285714285715, "grad_norm": 0.033600788563489914, "learning_rate": 0.024000000208616257, "loss": 2.564110279083252, "step": 4140 }, { "epoch": 0.19723809523809524, "grad_norm": 0.03416472300887108, "learning_rate": 0.024000000208616257, "loss": 2.552288055419922, "step": 4142 }, { "epoch": 0.19733333333333333, "grad_norm": 0.035980742424726486, "learning_rate": 0.024000000208616257, "loss": 2.572021961212158, "step": 4144 }, { "epoch": 0.19742857142857143, "grad_norm": 0.035461146384477615, "learning_rate": 0.024000000208616257, "loss": 2.5526280403137207, "step": 4146 }, { "epoch": 0.19752380952380952, "grad_norm": 0.03308216109871864, "learning_rate": 0.024000000208616257, "loss": 2.5377674102783203, "step": 4148 }, { "epoch": 0.1976190476190476, "grad_norm": 0.03606276586651802, "learning_rate": 0.024000000208616257, "loss": 2.578195571899414, "step": 4150 }, { "epoch": 0.1977142857142857, "grad_norm": 0.034640081226825714, "learning_rate": 0.024000000208616257, "loss": 2.566316604614258, "step": 4152 }, { "epoch": 0.1978095238095238, "grad_norm": 0.03637755662202835, "learning_rate": 0.024000000208616257, "loss": 2.559434413909912, "step": 4154 }, { "epoch": 0.19790476190476192, "grad_norm": 0.035185348242521286, "learning_rate": 0.024000000208616257, "loss": 2.575758934020996, "step": 4156 }, { "epoch": 0.198, "grad_norm": 0.03437882661819458, "learning_rate": 0.024000000208616257, "loss": 2.5567078590393066, "step": 4158 }, { "epoch": 0.1980952380952381, "grad_norm": 0.03348381072282791, "learning_rate": 0.024000000208616257, "loss": 2.5781168937683105, "step": 4160 }, { "epoch": 0.1981904761904762, "grad_norm": 0.03479679301381111, "learning_rate": 0.024000000208616257, "loss": 2.5755772590637207, "step": 4162 }, { "epoch": 0.1982857142857143, "grad_norm": 0.03382532298564911, "learning_rate": 0.024000000208616257, "loss": 2.5698370933532715, "step": 4164 }, { "epoch": 0.19838095238095238, "grad_norm": 0.03474079445004463, "learning_rate": 0.024000000208616257, "loss": 2.5536069869995117, "step": 4166 }, { "epoch": 0.19847619047619047, "grad_norm": 0.034420426934957504, "learning_rate": 0.024000000208616257, "loss": 2.5331621170043945, "step": 4168 }, { "epoch": 0.19857142857142857, "grad_norm": 0.03360233083367348, "learning_rate": 0.024000000208616257, "loss": 2.5695924758911133, "step": 4170 }, { "epoch": 0.19866666666666666, "grad_norm": 0.03315082564949989, "learning_rate": 0.024000000208616257, "loss": 2.550663471221924, "step": 4172 }, { "epoch": 0.19876190476190475, "grad_norm": 0.03396622836589813, "learning_rate": 0.024000000208616257, "loss": 2.5698413848876953, "step": 4174 }, { "epoch": 0.19885714285714284, "grad_norm": 0.033119507133960724, "learning_rate": 0.024000000208616257, "loss": 2.582426071166992, "step": 4176 }, { "epoch": 0.19895238095238096, "grad_norm": 0.03445888310670853, "learning_rate": 0.024000000208616257, "loss": 2.528024196624756, "step": 4178 }, { "epoch": 0.19904761904761906, "grad_norm": 0.036749254912137985, "learning_rate": 0.024000000208616257, "loss": 2.5548200607299805, "step": 4180 }, { "epoch": 0.19914285714285715, "grad_norm": 0.03549132123589516, "learning_rate": 0.024000000208616257, "loss": 2.52915096282959, "step": 4182 }, { "epoch": 0.19923809523809524, "grad_norm": 0.03325216472148895, "learning_rate": 0.024000000208616257, "loss": 2.549269199371338, "step": 4184 }, { "epoch": 0.19933333333333333, "grad_norm": 0.034001853317022324, "learning_rate": 0.024000000208616257, "loss": 2.544243574142456, "step": 4186 }, { "epoch": 0.19942857142857143, "grad_norm": 0.03470718860626221, "learning_rate": 0.024000000208616257, "loss": 2.5854907035827637, "step": 4188 }, { "epoch": 0.19952380952380952, "grad_norm": 0.03501201793551445, "learning_rate": 0.024000000208616257, "loss": 2.594510316848755, "step": 4190 }, { "epoch": 0.1996190476190476, "grad_norm": 0.032622918486595154, "learning_rate": 0.024000000208616257, "loss": 2.5490732192993164, "step": 4192 }, { "epoch": 0.1997142857142857, "grad_norm": 0.034185562282800674, "learning_rate": 0.024000000208616257, "loss": 2.5586962699890137, "step": 4194 }, { "epoch": 0.1998095238095238, "grad_norm": 0.034773487597703934, "learning_rate": 0.024000000208616257, "loss": 2.558466911315918, "step": 4196 }, { "epoch": 0.19990476190476192, "grad_norm": 0.033346258103847504, "learning_rate": 0.024000000208616257, "loss": 2.553213596343994, "step": 4198 }, { "epoch": 0.2, "grad_norm": 0.038092419505119324, "learning_rate": 0.024000000208616257, "loss": 2.536980628967285, "step": 4200 }, { "epoch": 0.2000952380952381, "grad_norm": 0.03703172877430916, "learning_rate": 0.024000000208616257, "loss": 2.5176210403442383, "step": 4202 }, { "epoch": 0.2001904761904762, "grad_norm": 0.03579559177160263, "learning_rate": 0.024000000208616257, "loss": 2.521723985671997, "step": 4204 }, { "epoch": 0.2002857142857143, "grad_norm": 0.03691945970058441, "learning_rate": 0.024000000208616257, "loss": 2.563967227935791, "step": 4206 }, { "epoch": 0.20038095238095238, "grad_norm": 0.03375416249036789, "learning_rate": 0.024000000208616257, "loss": 2.559211254119873, "step": 4208 }, { "epoch": 0.20047619047619047, "grad_norm": 0.03508751466870308, "learning_rate": 0.024000000208616257, "loss": 2.528923988342285, "step": 4210 }, { "epoch": 0.20057142857142857, "grad_norm": 0.033974599093198776, "learning_rate": 0.024000000208616257, "loss": 2.5746030807495117, "step": 4212 }, { "epoch": 0.20066666666666666, "grad_norm": 0.035566989332437515, "learning_rate": 0.024000000208616257, "loss": 2.5523791313171387, "step": 4214 }, { "epoch": 0.20076190476190475, "grad_norm": 0.03364123776555061, "learning_rate": 0.024000000208616257, "loss": 2.532118082046509, "step": 4216 }, { "epoch": 0.20085714285714285, "grad_norm": 0.03445471078157425, "learning_rate": 0.024000000208616257, "loss": 2.529230833053589, "step": 4218 }, { "epoch": 0.20095238095238097, "grad_norm": 0.03392660245299339, "learning_rate": 0.024000000208616257, "loss": 2.5790212154388428, "step": 4220 }, { "epoch": 0.20104761904761906, "grad_norm": 0.03424451872706413, "learning_rate": 0.024000000208616257, "loss": 2.566389560699463, "step": 4222 }, { "epoch": 0.20114285714285715, "grad_norm": 0.03344564884901047, "learning_rate": 0.024000000208616257, "loss": 2.5602786540985107, "step": 4224 }, { "epoch": 0.20123809523809524, "grad_norm": 0.03338630869984627, "learning_rate": 0.024000000208616257, "loss": 2.547391176223755, "step": 4226 }, { "epoch": 0.20133333333333334, "grad_norm": 0.034130342304706573, "learning_rate": 0.024000000208616257, "loss": 2.5384676456451416, "step": 4228 }, { "epoch": 0.20142857142857143, "grad_norm": 0.03478436544537544, "learning_rate": 0.024000000208616257, "loss": 2.5631625652313232, "step": 4230 }, { "epoch": 0.20152380952380952, "grad_norm": 0.0344911552965641, "learning_rate": 0.024000000208616257, "loss": 2.5087623596191406, "step": 4232 }, { "epoch": 0.20161904761904761, "grad_norm": 0.03439908102154732, "learning_rate": 0.024000000208616257, "loss": 2.5792431831359863, "step": 4234 }, { "epoch": 0.2017142857142857, "grad_norm": 0.03591718152165413, "learning_rate": 0.024000000208616257, "loss": 2.553229331970215, "step": 4236 }, { "epoch": 0.2018095238095238, "grad_norm": 0.036291904747486115, "learning_rate": 0.024000000208616257, "loss": 2.5471065044403076, "step": 4238 }, { "epoch": 0.2019047619047619, "grad_norm": 0.03559035435318947, "learning_rate": 0.024000000208616257, "loss": 2.5428764820098877, "step": 4240 }, { "epoch": 0.202, "grad_norm": 0.03476385772228241, "learning_rate": 0.024000000208616257, "loss": 2.4972805976867676, "step": 4242 }, { "epoch": 0.2020952380952381, "grad_norm": 0.03598589077591896, "learning_rate": 0.024000000208616257, "loss": 2.5257558822631836, "step": 4244 }, { "epoch": 0.2021904761904762, "grad_norm": 0.03531322255730629, "learning_rate": 0.024000000208616257, "loss": 2.563516139984131, "step": 4246 }, { "epoch": 0.2022857142857143, "grad_norm": 0.03370671346783638, "learning_rate": 0.024000000208616257, "loss": 2.5285613536834717, "step": 4248 }, { "epoch": 0.20238095238095238, "grad_norm": 0.03372704237699509, "learning_rate": 0.024000000208616257, "loss": 2.5139267444610596, "step": 4250 }, { "epoch": 0.20247619047619048, "grad_norm": 0.038478851318359375, "learning_rate": 0.024000000208616257, "loss": 2.5600790977478027, "step": 4252 }, { "epoch": 0.20257142857142857, "grad_norm": 0.03588740527629852, "learning_rate": 0.024000000208616257, "loss": 2.5254406929016113, "step": 4254 }, { "epoch": 0.20266666666666666, "grad_norm": 0.03408046439290047, "learning_rate": 0.024000000208616257, "loss": 2.5484728813171387, "step": 4256 }, { "epoch": 0.20276190476190475, "grad_norm": 0.033602163195610046, "learning_rate": 0.024000000208616257, "loss": 2.5490241050720215, "step": 4258 }, { "epoch": 0.20285714285714285, "grad_norm": 0.03280656784772873, "learning_rate": 0.024000000208616257, "loss": 2.52659273147583, "step": 4260 }, { "epoch": 0.20295238095238094, "grad_norm": 0.03715810924768448, "learning_rate": 0.024000000208616257, "loss": 2.5310158729553223, "step": 4262 }, { "epoch": 0.20304761904761906, "grad_norm": 0.0334891676902771, "learning_rate": 0.024000000208616257, "loss": 2.569647789001465, "step": 4264 }, { "epoch": 0.20314285714285715, "grad_norm": 0.03255469724535942, "learning_rate": 0.024000000208616257, "loss": 2.5483012199401855, "step": 4266 }, { "epoch": 0.20323809523809525, "grad_norm": 0.033610180020332336, "learning_rate": 0.024000000208616257, "loss": 2.5678834915161133, "step": 4268 }, { "epoch": 0.20333333333333334, "grad_norm": 0.034170523285865784, "learning_rate": 0.024000000208616257, "loss": 2.554849147796631, "step": 4270 }, { "epoch": 0.20342857142857143, "grad_norm": 0.03450014069676399, "learning_rate": 0.024000000208616257, "loss": 2.542884349822998, "step": 4272 }, { "epoch": 0.20352380952380952, "grad_norm": 0.03735754266381264, "learning_rate": 0.024000000208616257, "loss": 2.547081470489502, "step": 4274 }, { "epoch": 0.20361904761904762, "grad_norm": 0.03440806269645691, "learning_rate": 0.024000000208616257, "loss": 2.525129795074463, "step": 4276 }, { "epoch": 0.2037142857142857, "grad_norm": 0.03361160308122635, "learning_rate": 0.024000000208616257, "loss": 2.536144256591797, "step": 4278 }, { "epoch": 0.2038095238095238, "grad_norm": 0.034731630235910416, "learning_rate": 0.024000000208616257, "loss": 2.5444281101226807, "step": 4280 }, { "epoch": 0.2039047619047619, "grad_norm": 0.03444270044565201, "learning_rate": 0.024000000208616257, "loss": 2.54176664352417, "step": 4282 }, { "epoch": 0.204, "grad_norm": 0.03534238412976265, "learning_rate": 0.024000000208616257, "loss": 2.5383758544921875, "step": 4284 }, { "epoch": 0.2040952380952381, "grad_norm": 0.0349477082490921, "learning_rate": 0.024000000208616257, "loss": 2.5721023082733154, "step": 4286 }, { "epoch": 0.2041904761904762, "grad_norm": 0.03418055921792984, "learning_rate": 0.024000000208616257, "loss": 2.5455541610717773, "step": 4288 }, { "epoch": 0.2042857142857143, "grad_norm": 0.034354519098997116, "learning_rate": 0.024000000208616257, "loss": 2.5358781814575195, "step": 4290 }, { "epoch": 0.20438095238095239, "grad_norm": 0.03376094251871109, "learning_rate": 0.024000000208616257, "loss": 2.5488271713256836, "step": 4292 }, { "epoch": 0.20447619047619048, "grad_norm": 0.03471655398607254, "learning_rate": 0.024000000208616257, "loss": 2.5654683113098145, "step": 4294 }, { "epoch": 0.20457142857142857, "grad_norm": 0.033437296748161316, "learning_rate": 0.024000000208616257, "loss": 2.5338683128356934, "step": 4296 }, { "epoch": 0.20466666666666666, "grad_norm": 0.03415635600686073, "learning_rate": 0.024000000208616257, "loss": 2.5295462608337402, "step": 4298 }, { "epoch": 0.20476190476190476, "grad_norm": 0.03446052223443985, "learning_rate": 0.024000000208616257, "loss": 2.5344467163085938, "step": 4300 }, { "epoch": 0.20485714285714285, "grad_norm": 0.03392282500863075, "learning_rate": 0.024000000208616257, "loss": 2.548213005065918, "step": 4302 }, { "epoch": 0.20495238095238094, "grad_norm": 0.035806745290756226, "learning_rate": 0.024000000208616257, "loss": 2.524418830871582, "step": 4304 }, { "epoch": 0.20504761904761903, "grad_norm": 0.03668132424354553, "learning_rate": 0.024000000208616257, "loss": 2.532484531402588, "step": 4306 }, { "epoch": 0.20514285714285715, "grad_norm": 0.03354937583208084, "learning_rate": 0.024000000208616257, "loss": 2.546436309814453, "step": 4308 }, { "epoch": 0.20523809523809525, "grad_norm": 0.03616217523813248, "learning_rate": 0.024000000208616257, "loss": 2.547828435897827, "step": 4310 }, { "epoch": 0.20533333333333334, "grad_norm": 0.03588027507066727, "learning_rate": 0.024000000208616257, "loss": 2.5271401405334473, "step": 4312 }, { "epoch": 0.20542857142857143, "grad_norm": 0.03528290241956711, "learning_rate": 0.024000000208616257, "loss": 2.5541863441467285, "step": 4314 }, { "epoch": 0.20552380952380953, "grad_norm": 0.03466029465198517, "learning_rate": 0.024000000208616257, "loss": 2.557539701461792, "step": 4316 }, { "epoch": 0.20561904761904762, "grad_norm": 0.03438291326165199, "learning_rate": 0.024000000208616257, "loss": 2.5272841453552246, "step": 4318 }, { "epoch": 0.2057142857142857, "grad_norm": 0.03285382315516472, "learning_rate": 0.024000000208616257, "loss": 2.536543846130371, "step": 4320 }, { "epoch": 0.2058095238095238, "grad_norm": 0.03604944795370102, "learning_rate": 0.024000000208616257, "loss": 2.5464882850646973, "step": 4322 }, { "epoch": 0.2059047619047619, "grad_norm": 0.034906331449747086, "learning_rate": 0.024000000208616257, "loss": 2.542004108428955, "step": 4324 }, { "epoch": 0.206, "grad_norm": 0.03771238029003143, "learning_rate": 0.024000000208616257, "loss": 2.565619945526123, "step": 4326 }, { "epoch": 0.2060952380952381, "grad_norm": 0.03677478805184364, "learning_rate": 0.024000000208616257, "loss": 2.5475664138793945, "step": 4328 }, { "epoch": 0.2061904761904762, "grad_norm": 0.034278951585292816, "learning_rate": 0.024000000208616257, "loss": 2.515104293823242, "step": 4330 }, { "epoch": 0.2062857142857143, "grad_norm": 0.03611103072762489, "learning_rate": 0.024000000208616257, "loss": 2.5490758419036865, "step": 4332 }, { "epoch": 0.2063809523809524, "grad_norm": 0.038032591342926025, "learning_rate": 0.024000000208616257, "loss": 2.5485267639160156, "step": 4334 }, { "epoch": 0.20647619047619048, "grad_norm": 0.03464003652334213, "learning_rate": 0.024000000208616257, "loss": 2.5354647636413574, "step": 4336 }, { "epoch": 0.20657142857142857, "grad_norm": 0.03314501792192459, "learning_rate": 0.024000000208616257, "loss": 2.5331592559814453, "step": 4338 }, { "epoch": 0.20666666666666667, "grad_norm": 0.032904576510190964, "learning_rate": 0.024000000208616257, "loss": 2.5358572006225586, "step": 4340 }, { "epoch": 0.20676190476190476, "grad_norm": 0.03331261873245239, "learning_rate": 0.024000000208616257, "loss": 2.5389065742492676, "step": 4342 }, { "epoch": 0.20685714285714285, "grad_norm": 0.03595581650733948, "learning_rate": 0.024000000208616257, "loss": 2.494047164916992, "step": 4344 }, { "epoch": 0.20695238095238094, "grad_norm": 0.03399411588907242, "learning_rate": 0.024000000208616257, "loss": 2.527601718902588, "step": 4346 }, { "epoch": 0.20704761904761904, "grad_norm": 0.03522687032818794, "learning_rate": 0.024000000208616257, "loss": 2.535533905029297, "step": 4348 }, { "epoch": 0.20714285714285716, "grad_norm": 0.035905659198760986, "learning_rate": 0.024000000208616257, "loss": 2.525843620300293, "step": 4350 }, { "epoch": 0.20723809523809525, "grad_norm": 0.033180661499500275, "learning_rate": 0.024000000208616257, "loss": 2.5366525650024414, "step": 4352 }, { "epoch": 0.20733333333333334, "grad_norm": 0.03493064269423485, "learning_rate": 0.024000000208616257, "loss": 2.52485728263855, "step": 4354 }, { "epoch": 0.20742857142857143, "grad_norm": 0.03337298706173897, "learning_rate": 0.024000000208616257, "loss": 2.5178732872009277, "step": 4356 }, { "epoch": 0.20752380952380953, "grad_norm": 0.034250009804964066, "learning_rate": 0.024000000208616257, "loss": 2.514664649963379, "step": 4358 }, { "epoch": 0.20761904761904762, "grad_norm": 0.03314585238695145, "learning_rate": 0.024000000208616257, "loss": 2.540104389190674, "step": 4360 }, { "epoch": 0.2077142857142857, "grad_norm": 0.03412733972072601, "learning_rate": 0.024000000208616257, "loss": 2.5046305656433105, "step": 4362 }, { "epoch": 0.2078095238095238, "grad_norm": 0.033542972058057785, "learning_rate": 0.024000000208616257, "loss": 2.528446674346924, "step": 4364 }, { "epoch": 0.2079047619047619, "grad_norm": 0.034303974360227585, "learning_rate": 0.024000000208616257, "loss": 2.5238394737243652, "step": 4366 }, { "epoch": 0.208, "grad_norm": 0.03367145359516144, "learning_rate": 0.024000000208616257, "loss": 2.53507137298584, "step": 4368 }, { "epoch": 0.20809523809523808, "grad_norm": 0.0325499027967453, "learning_rate": 0.024000000208616257, "loss": 2.5354156494140625, "step": 4370 }, { "epoch": 0.2081904761904762, "grad_norm": 0.0342954583466053, "learning_rate": 0.024000000208616257, "loss": 2.518108606338501, "step": 4372 }, { "epoch": 0.2082857142857143, "grad_norm": 0.0355491004884243, "learning_rate": 0.024000000208616257, "loss": 2.525071382522583, "step": 4374 }, { "epoch": 0.2083809523809524, "grad_norm": 0.03557267412543297, "learning_rate": 0.024000000208616257, "loss": 2.5628819465637207, "step": 4376 }, { "epoch": 0.20847619047619048, "grad_norm": 0.0363098680973053, "learning_rate": 0.024000000208616257, "loss": 2.502676010131836, "step": 4378 }, { "epoch": 0.20857142857142857, "grad_norm": 0.03658955916762352, "learning_rate": 0.024000000208616257, "loss": 2.569309711456299, "step": 4380 }, { "epoch": 0.20866666666666667, "grad_norm": 0.0328185148537159, "learning_rate": 0.024000000208616257, "loss": 2.5097224712371826, "step": 4382 }, { "epoch": 0.20876190476190476, "grad_norm": 0.033404331654310226, "learning_rate": 0.024000000208616257, "loss": 2.539158344268799, "step": 4384 }, { "epoch": 0.20885714285714285, "grad_norm": 0.033022839576005936, "learning_rate": 0.024000000208616257, "loss": 2.505321979522705, "step": 4386 }, { "epoch": 0.20895238095238095, "grad_norm": 0.03271230682730675, "learning_rate": 0.024000000208616257, "loss": 2.5423264503479004, "step": 4388 }, { "epoch": 0.20904761904761904, "grad_norm": 0.03270036354660988, "learning_rate": 0.024000000208616257, "loss": 2.536475658416748, "step": 4390 }, { "epoch": 0.20914285714285713, "grad_norm": 0.032624728977680206, "learning_rate": 0.024000000208616257, "loss": 2.513199806213379, "step": 4392 }, { "epoch": 0.20923809523809525, "grad_norm": 0.03357968106865883, "learning_rate": 0.024000000208616257, "loss": 2.5137739181518555, "step": 4394 }, { "epoch": 0.20933333333333334, "grad_norm": 0.03704063594341278, "learning_rate": 0.024000000208616257, "loss": 2.5288352966308594, "step": 4396 }, { "epoch": 0.20942857142857144, "grad_norm": 0.041204676032066345, "learning_rate": 0.024000000208616257, "loss": 2.522641181945801, "step": 4398 }, { "epoch": 0.20952380952380953, "grad_norm": 0.039927005767822266, "learning_rate": 0.024000000208616257, "loss": 2.5612282752990723, "step": 4400 }, { "epoch": 0.20961904761904762, "grad_norm": 0.03472644463181496, "learning_rate": 0.024000000208616257, "loss": 2.4999916553497314, "step": 4402 }, { "epoch": 0.20971428571428571, "grad_norm": 0.034512702375650406, "learning_rate": 0.024000000208616257, "loss": 2.4978413581848145, "step": 4404 }, { "epoch": 0.2098095238095238, "grad_norm": 0.034627534449100494, "learning_rate": 0.024000000208616257, "loss": 2.5325844287872314, "step": 4406 }, { "epoch": 0.2099047619047619, "grad_norm": 0.039979320019483566, "learning_rate": 0.024000000208616257, "loss": 2.5309534072875977, "step": 4408 }, { "epoch": 0.21, "grad_norm": 0.038033824414014816, "learning_rate": 0.024000000208616257, "loss": 2.533867359161377, "step": 4410 }, { "epoch": 0.21009523809523808, "grad_norm": 0.03281286731362343, "learning_rate": 0.024000000208616257, "loss": 2.557868480682373, "step": 4412 }, { "epoch": 0.21019047619047618, "grad_norm": 0.03455791249871254, "learning_rate": 0.024000000208616257, "loss": 2.4867100715637207, "step": 4414 }, { "epoch": 0.2102857142857143, "grad_norm": 0.032675351947546005, "learning_rate": 0.024000000208616257, "loss": 2.562894344329834, "step": 4416 }, { "epoch": 0.2103809523809524, "grad_norm": 0.032946377992630005, "learning_rate": 0.024000000208616257, "loss": 2.5473110675811768, "step": 4418 }, { "epoch": 0.21047619047619048, "grad_norm": 0.03738332539796829, "learning_rate": 0.024000000208616257, "loss": 2.544037342071533, "step": 4420 }, { "epoch": 0.21057142857142858, "grad_norm": 0.0349770188331604, "learning_rate": 0.024000000208616257, "loss": 2.514040946960449, "step": 4422 }, { "epoch": 0.21066666666666667, "grad_norm": 0.033789392560720444, "learning_rate": 0.024000000208616257, "loss": 2.5035452842712402, "step": 4424 }, { "epoch": 0.21076190476190476, "grad_norm": 0.032671403139829636, "learning_rate": 0.024000000208616257, "loss": 2.517800807952881, "step": 4426 }, { "epoch": 0.21085714285714285, "grad_norm": 0.03323913738131523, "learning_rate": 0.024000000208616257, "loss": 2.531562089920044, "step": 4428 }, { "epoch": 0.21095238095238095, "grad_norm": 0.03403555229306221, "learning_rate": 0.024000000208616257, "loss": 2.5224225521087646, "step": 4430 }, { "epoch": 0.21104761904761904, "grad_norm": 0.033003002405166626, "learning_rate": 0.024000000208616257, "loss": 2.538353443145752, "step": 4432 }, { "epoch": 0.21114285714285713, "grad_norm": 0.03236225247383118, "learning_rate": 0.024000000208616257, "loss": 2.5520615577697754, "step": 4434 }, { "epoch": 0.21123809523809522, "grad_norm": 0.03290961682796478, "learning_rate": 0.024000000208616257, "loss": 2.534841299057007, "step": 4436 }, { "epoch": 0.21133333333333335, "grad_norm": 0.035999197512865067, "learning_rate": 0.024000000208616257, "loss": 2.5638504028320312, "step": 4438 }, { "epoch": 0.21142857142857144, "grad_norm": 0.03413056582212448, "learning_rate": 0.024000000208616257, "loss": 2.5225605964660645, "step": 4440 }, { "epoch": 0.21152380952380953, "grad_norm": 0.037534695118665695, "learning_rate": 0.024000000208616257, "loss": 2.5434000492095947, "step": 4442 }, { "epoch": 0.21161904761904762, "grad_norm": 0.039412762969732285, "learning_rate": 0.024000000208616257, "loss": 2.532942295074463, "step": 4444 }, { "epoch": 0.21171428571428572, "grad_norm": 0.040636852383613586, "learning_rate": 0.024000000208616257, "loss": 2.5380477905273438, "step": 4446 }, { "epoch": 0.2118095238095238, "grad_norm": 0.0446440614759922, "learning_rate": 0.024000000208616257, "loss": 2.5187301635742188, "step": 4448 }, { "epoch": 0.2119047619047619, "grad_norm": 0.03875953331589699, "learning_rate": 0.024000000208616257, "loss": 2.5435643196105957, "step": 4450 }, { "epoch": 0.212, "grad_norm": 0.035098735243082047, "learning_rate": 0.024000000208616257, "loss": 2.50911021232605, "step": 4452 }, { "epoch": 0.2120952380952381, "grad_norm": 0.03352537006139755, "learning_rate": 0.024000000208616257, "loss": 2.5244617462158203, "step": 4454 }, { "epoch": 0.21219047619047618, "grad_norm": 0.03236570581793785, "learning_rate": 0.024000000208616257, "loss": 2.491126775741577, "step": 4456 }, { "epoch": 0.21228571428571427, "grad_norm": 0.033949751406908035, "learning_rate": 0.024000000208616257, "loss": 2.532191753387451, "step": 4458 }, { "epoch": 0.2123809523809524, "grad_norm": 0.0338665246963501, "learning_rate": 0.024000000208616257, "loss": 2.5266828536987305, "step": 4460 }, { "epoch": 0.21247619047619049, "grad_norm": 0.035945914685726166, "learning_rate": 0.024000000208616257, "loss": 2.5167245864868164, "step": 4462 }, { "epoch": 0.21257142857142858, "grad_norm": 0.0345463752746582, "learning_rate": 0.024000000208616257, "loss": 2.5311954021453857, "step": 4464 }, { "epoch": 0.21266666666666667, "grad_norm": 0.033228322863578796, "learning_rate": 0.024000000208616257, "loss": 2.5617475509643555, "step": 4466 }, { "epoch": 0.21276190476190476, "grad_norm": 0.03718763589859009, "learning_rate": 0.024000000208616257, "loss": 2.5259196758270264, "step": 4468 }, { "epoch": 0.21285714285714286, "grad_norm": 0.03823253884911537, "learning_rate": 0.024000000208616257, "loss": 2.5431456565856934, "step": 4470 }, { "epoch": 0.21295238095238095, "grad_norm": 0.036060940474271774, "learning_rate": 0.024000000208616257, "loss": 2.54702091217041, "step": 4472 }, { "epoch": 0.21304761904761904, "grad_norm": 0.035043928772211075, "learning_rate": 0.024000000208616257, "loss": 2.5182619094848633, "step": 4474 }, { "epoch": 0.21314285714285713, "grad_norm": 0.036386262625455856, "learning_rate": 0.024000000208616257, "loss": 2.5487160682678223, "step": 4476 }, { "epoch": 0.21323809523809523, "grad_norm": 0.033398017287254333, "learning_rate": 0.024000000208616257, "loss": 2.5150184631347656, "step": 4478 }, { "epoch": 0.21333333333333335, "grad_norm": 0.03358172997832298, "learning_rate": 0.024000000208616257, "loss": 2.5187830924987793, "step": 4480 }, { "epoch": 0.21342857142857144, "grad_norm": 0.03653724119067192, "learning_rate": 0.024000000208616257, "loss": 2.543489694595337, "step": 4482 }, { "epoch": 0.21352380952380953, "grad_norm": 0.03563816100358963, "learning_rate": 0.024000000208616257, "loss": 2.5448641777038574, "step": 4484 }, { "epoch": 0.21361904761904763, "grad_norm": 0.03284958377480507, "learning_rate": 0.024000000208616257, "loss": 2.5092697143554688, "step": 4486 }, { "epoch": 0.21371428571428572, "grad_norm": 0.033849239349365234, "learning_rate": 0.024000000208616257, "loss": 2.5381088256835938, "step": 4488 }, { "epoch": 0.2138095238095238, "grad_norm": 0.036182768642902374, "learning_rate": 0.024000000208616257, "loss": 2.549259662628174, "step": 4490 }, { "epoch": 0.2139047619047619, "grad_norm": 0.03546156361699104, "learning_rate": 0.024000000208616257, "loss": 2.5267562866210938, "step": 4492 }, { "epoch": 0.214, "grad_norm": 0.033753640949726105, "learning_rate": 0.024000000208616257, "loss": 2.5465245246887207, "step": 4494 }, { "epoch": 0.2140952380952381, "grad_norm": 0.03611188009381294, "learning_rate": 0.024000000208616257, "loss": 2.5199685096740723, "step": 4496 }, { "epoch": 0.21419047619047618, "grad_norm": 0.03576482832431793, "learning_rate": 0.024000000208616257, "loss": 2.527052640914917, "step": 4498 }, { "epoch": 0.21428571428571427, "grad_norm": 0.03295337036252022, "learning_rate": 0.024000000208616257, "loss": 2.5369246006011963, "step": 4500 }, { "epoch": 0.2143809523809524, "grad_norm": 0.035085730254650116, "learning_rate": 0.024000000208616257, "loss": 2.5123918056488037, "step": 4502 }, { "epoch": 0.2144761904761905, "grad_norm": 0.03674199804663658, "learning_rate": 0.024000000208616257, "loss": 2.5417592525482178, "step": 4504 }, { "epoch": 0.21457142857142858, "grad_norm": 0.037691380828619, "learning_rate": 0.024000000208616257, "loss": 2.5334744453430176, "step": 4506 }, { "epoch": 0.21466666666666667, "grad_norm": 0.03839509189128876, "learning_rate": 0.024000000208616257, "loss": 2.534432888031006, "step": 4508 }, { "epoch": 0.21476190476190476, "grad_norm": 0.03833772614598274, "learning_rate": 0.024000000208616257, "loss": 2.552985668182373, "step": 4510 }, { "epoch": 0.21485714285714286, "grad_norm": 0.0371977873146534, "learning_rate": 0.024000000208616257, "loss": 2.5208640098571777, "step": 4512 }, { "epoch": 0.21495238095238095, "grad_norm": 0.03456805273890495, "learning_rate": 0.024000000208616257, "loss": 2.531186103820801, "step": 4514 }, { "epoch": 0.21504761904761904, "grad_norm": 0.03650466725230217, "learning_rate": 0.024000000208616257, "loss": 2.5356812477111816, "step": 4516 }, { "epoch": 0.21514285714285714, "grad_norm": 0.03770649433135986, "learning_rate": 0.024000000208616257, "loss": 2.5185694694519043, "step": 4518 }, { "epoch": 0.21523809523809523, "grad_norm": 0.03444680944085121, "learning_rate": 0.024000000208616257, "loss": 2.547921657562256, "step": 4520 }, { "epoch": 0.21533333333333332, "grad_norm": 0.033605463802814484, "learning_rate": 0.024000000208616257, "loss": 2.540973663330078, "step": 4522 }, { "epoch": 0.21542857142857144, "grad_norm": 0.032531023025512695, "learning_rate": 0.024000000208616257, "loss": 2.5361900329589844, "step": 4524 }, { "epoch": 0.21552380952380953, "grad_norm": 0.034784428775310516, "learning_rate": 0.024000000208616257, "loss": 2.5268607139587402, "step": 4526 }, { "epoch": 0.21561904761904763, "grad_norm": 0.03367426618933678, "learning_rate": 0.024000000208616257, "loss": 2.5019431114196777, "step": 4528 }, { "epoch": 0.21571428571428572, "grad_norm": 0.03489496558904648, "learning_rate": 0.024000000208616257, "loss": 2.51299786567688, "step": 4530 }, { "epoch": 0.2158095238095238, "grad_norm": 0.033294208347797394, "learning_rate": 0.024000000208616257, "loss": 2.540041923522949, "step": 4532 }, { "epoch": 0.2159047619047619, "grad_norm": 0.0333281047642231, "learning_rate": 0.024000000208616257, "loss": 2.5490341186523438, "step": 4534 }, { "epoch": 0.216, "grad_norm": 0.03352000191807747, "learning_rate": 0.024000000208616257, "loss": 2.520047664642334, "step": 4536 }, { "epoch": 0.2160952380952381, "grad_norm": 0.03288310393691063, "learning_rate": 0.024000000208616257, "loss": 2.5271425247192383, "step": 4538 }, { "epoch": 0.21619047619047618, "grad_norm": 0.033776070922613144, "learning_rate": 0.024000000208616257, "loss": 2.5707273483276367, "step": 4540 }, { "epoch": 0.21628571428571428, "grad_norm": 0.03227996453642845, "learning_rate": 0.024000000208616257, "loss": 2.5074830055236816, "step": 4542 }, { "epoch": 0.21638095238095237, "grad_norm": 0.033395055681467056, "learning_rate": 0.024000000208616257, "loss": 2.512935161590576, "step": 4544 }, { "epoch": 0.2164761904761905, "grad_norm": 0.032724812626838684, "learning_rate": 0.024000000208616257, "loss": 2.526822805404663, "step": 4546 }, { "epoch": 0.21657142857142858, "grad_norm": 0.031997498124837875, "learning_rate": 0.024000000208616257, "loss": 2.5426082611083984, "step": 4548 }, { "epoch": 0.21666666666666667, "grad_norm": 0.032237350940704346, "learning_rate": 0.024000000208616257, "loss": 2.5361456871032715, "step": 4550 }, { "epoch": 0.21676190476190477, "grad_norm": 0.032982662320137024, "learning_rate": 0.024000000208616257, "loss": 2.516247272491455, "step": 4552 }, { "epoch": 0.21685714285714286, "grad_norm": 0.0333019457757473, "learning_rate": 0.024000000208616257, "loss": 2.5143885612487793, "step": 4554 }, { "epoch": 0.21695238095238095, "grad_norm": 0.040621910244226456, "learning_rate": 0.024000000208616257, "loss": 2.5446953773498535, "step": 4556 }, { "epoch": 0.21704761904761904, "grad_norm": 0.03408082574605942, "learning_rate": 0.024000000208616257, "loss": 2.5283713340759277, "step": 4558 }, { "epoch": 0.21714285714285714, "grad_norm": 0.03341643512248993, "learning_rate": 0.024000000208616257, "loss": 2.4959630966186523, "step": 4560 }, { "epoch": 0.21723809523809523, "grad_norm": 0.03297030180692673, "learning_rate": 0.024000000208616257, "loss": 2.5189292430877686, "step": 4562 }, { "epoch": 0.21733333333333332, "grad_norm": 0.03357742354273796, "learning_rate": 0.024000000208616257, "loss": 2.5043249130249023, "step": 4564 }, { "epoch": 0.21742857142857142, "grad_norm": 0.0326324924826622, "learning_rate": 0.024000000208616257, "loss": 2.516298294067383, "step": 4566 }, { "epoch": 0.21752380952380954, "grad_norm": 0.03301847726106644, "learning_rate": 0.024000000208616257, "loss": 2.528064012527466, "step": 4568 }, { "epoch": 0.21761904761904763, "grad_norm": 0.03308906778693199, "learning_rate": 0.024000000208616257, "loss": 2.5097556114196777, "step": 4570 }, { "epoch": 0.21771428571428572, "grad_norm": 0.03181307762861252, "learning_rate": 0.024000000208616257, "loss": 2.5526371002197266, "step": 4572 }, { "epoch": 0.21780952380952381, "grad_norm": 0.03568853437900543, "learning_rate": 0.024000000208616257, "loss": 2.5395641326904297, "step": 4574 }, { "epoch": 0.2179047619047619, "grad_norm": 0.033837441354990005, "learning_rate": 0.024000000208616257, "loss": 2.539579153060913, "step": 4576 }, { "epoch": 0.218, "grad_norm": 0.033466652035713196, "learning_rate": 0.024000000208616257, "loss": 2.5416531562805176, "step": 4578 }, { "epoch": 0.2180952380952381, "grad_norm": 0.03312097117304802, "learning_rate": 0.024000000208616257, "loss": 2.5247278213500977, "step": 4580 }, { "epoch": 0.21819047619047618, "grad_norm": 0.034171611070632935, "learning_rate": 0.024000000208616257, "loss": 2.5573554039001465, "step": 4582 }, { "epoch": 0.21828571428571428, "grad_norm": 0.03470749408006668, "learning_rate": 0.024000000208616257, "loss": 2.5190935134887695, "step": 4584 }, { "epoch": 0.21838095238095237, "grad_norm": 0.034388720989227295, "learning_rate": 0.024000000208616257, "loss": 2.518796682357788, "step": 4586 }, { "epoch": 0.21847619047619046, "grad_norm": 0.03461368754506111, "learning_rate": 0.024000000208616257, "loss": 2.5102837085723877, "step": 4588 }, { "epoch": 0.21857142857142858, "grad_norm": 0.03539600223302841, "learning_rate": 0.024000000208616257, "loss": 2.51753306388855, "step": 4590 }, { "epoch": 0.21866666666666668, "grad_norm": 0.03675961121916771, "learning_rate": 0.024000000208616257, "loss": 2.5339317321777344, "step": 4592 }, { "epoch": 0.21876190476190477, "grad_norm": 0.03296837955713272, "learning_rate": 0.024000000208616257, "loss": 2.5272297859191895, "step": 4594 }, { "epoch": 0.21885714285714286, "grad_norm": 0.03438437357544899, "learning_rate": 0.024000000208616257, "loss": 2.5436453819274902, "step": 4596 }, { "epoch": 0.21895238095238095, "grad_norm": 0.033531494438648224, "learning_rate": 0.024000000208616257, "loss": 2.5085911750793457, "step": 4598 }, { "epoch": 0.21904761904761905, "grad_norm": 0.034649308770895004, "learning_rate": 0.024000000208616257, "loss": 2.5385546684265137, "step": 4600 }, { "epoch": 0.21914285714285714, "grad_norm": 0.03643177077174187, "learning_rate": 0.024000000208616257, "loss": 2.498157501220703, "step": 4602 }, { "epoch": 0.21923809523809523, "grad_norm": 0.03386911004781723, "learning_rate": 0.024000000208616257, "loss": 2.5184483528137207, "step": 4604 }, { "epoch": 0.21933333333333332, "grad_norm": 0.0377119816839695, "learning_rate": 0.024000000208616257, "loss": 2.502091884613037, "step": 4606 }, { "epoch": 0.21942857142857142, "grad_norm": 0.033434417098760605, "learning_rate": 0.024000000208616257, "loss": 2.481804847717285, "step": 4608 }, { "epoch": 0.2195238095238095, "grad_norm": 0.03314419835805893, "learning_rate": 0.024000000208616257, "loss": 2.532463550567627, "step": 4610 }, { "epoch": 0.21961904761904763, "grad_norm": 0.03479830175638199, "learning_rate": 0.024000000208616257, "loss": 2.5285964012145996, "step": 4612 }, { "epoch": 0.21971428571428572, "grad_norm": 0.03205056115984917, "learning_rate": 0.024000000208616257, "loss": 2.505227565765381, "step": 4614 }, { "epoch": 0.21980952380952382, "grad_norm": 0.03296376019716263, "learning_rate": 0.024000000208616257, "loss": 2.523991584777832, "step": 4616 }, { "epoch": 0.2199047619047619, "grad_norm": 0.034120991826057434, "learning_rate": 0.024000000208616257, "loss": 2.5006637573242188, "step": 4618 }, { "epoch": 0.22, "grad_norm": 0.03352855145931244, "learning_rate": 0.024000000208616257, "loss": 2.509324312210083, "step": 4620 }, { "epoch": 0.2200952380952381, "grad_norm": 0.035176731646060944, "learning_rate": 0.024000000208616257, "loss": 2.5119457244873047, "step": 4622 }, { "epoch": 0.2201904761904762, "grad_norm": 0.03612976521253586, "learning_rate": 0.024000000208616257, "loss": 2.495800495147705, "step": 4624 }, { "epoch": 0.22028571428571428, "grad_norm": 0.03457033634185791, "learning_rate": 0.024000000208616257, "loss": 2.522073745727539, "step": 4626 }, { "epoch": 0.22038095238095237, "grad_norm": 0.03367818519473076, "learning_rate": 0.024000000208616257, "loss": 2.5222980976104736, "step": 4628 }, { "epoch": 0.22047619047619046, "grad_norm": 0.0353730246424675, "learning_rate": 0.024000000208616257, "loss": 2.504215955734253, "step": 4630 }, { "epoch": 0.22057142857142858, "grad_norm": 0.04011556878685951, "learning_rate": 0.024000000208616257, "loss": 2.510113000869751, "step": 4632 }, { "epoch": 0.22066666666666668, "grad_norm": 0.039183393120765686, "learning_rate": 0.024000000208616257, "loss": 2.5044031143188477, "step": 4634 }, { "epoch": 0.22076190476190477, "grad_norm": 0.03414406627416611, "learning_rate": 0.024000000208616257, "loss": 2.4958078861236572, "step": 4636 }, { "epoch": 0.22085714285714286, "grad_norm": 0.03203541785478592, "learning_rate": 0.024000000208616257, "loss": 2.4884376525878906, "step": 4638 }, { "epoch": 0.22095238095238096, "grad_norm": 0.03392551466822624, "learning_rate": 0.024000000208616257, "loss": 2.527801752090454, "step": 4640 }, { "epoch": 0.22104761904761905, "grad_norm": 0.0336131788790226, "learning_rate": 0.024000000208616257, "loss": 2.5130820274353027, "step": 4642 }, { "epoch": 0.22114285714285714, "grad_norm": 0.034527961164712906, "learning_rate": 0.024000000208616257, "loss": 2.509219169616699, "step": 4644 }, { "epoch": 0.22123809523809523, "grad_norm": 0.03382018953561783, "learning_rate": 0.024000000208616257, "loss": 2.5297152996063232, "step": 4646 }, { "epoch": 0.22133333333333333, "grad_norm": 0.03411689028143883, "learning_rate": 0.024000000208616257, "loss": 2.506971597671509, "step": 4648 }, { "epoch": 0.22142857142857142, "grad_norm": 0.03284739330410957, "learning_rate": 0.024000000208616257, "loss": 2.506216526031494, "step": 4650 }, { "epoch": 0.2215238095238095, "grad_norm": 0.034139879047870636, "learning_rate": 0.024000000208616257, "loss": 2.5216336250305176, "step": 4652 }, { "epoch": 0.22161904761904763, "grad_norm": 0.03302804380655289, "learning_rate": 0.024000000208616257, "loss": 2.521209239959717, "step": 4654 }, { "epoch": 0.22171428571428572, "grad_norm": 0.03416619822382927, "learning_rate": 0.024000000208616257, "loss": 2.494420051574707, "step": 4656 }, { "epoch": 0.22180952380952382, "grad_norm": 0.03703748807311058, "learning_rate": 0.024000000208616257, "loss": 2.4927563667297363, "step": 4658 }, { "epoch": 0.2219047619047619, "grad_norm": 0.03289373591542244, "learning_rate": 0.024000000208616257, "loss": 2.5145838260650635, "step": 4660 }, { "epoch": 0.222, "grad_norm": 0.033433616161346436, "learning_rate": 0.024000000208616257, "loss": 2.505565643310547, "step": 4662 }, { "epoch": 0.2220952380952381, "grad_norm": 0.034070972353219986, "learning_rate": 0.024000000208616257, "loss": 2.493682861328125, "step": 4664 }, { "epoch": 0.2221904761904762, "grad_norm": 0.03344402834773064, "learning_rate": 0.024000000208616257, "loss": 2.511896848678589, "step": 4666 }, { "epoch": 0.22228571428571428, "grad_norm": 0.033463701605796814, "learning_rate": 0.024000000208616257, "loss": 2.4925551414489746, "step": 4668 }, { "epoch": 0.22238095238095237, "grad_norm": 0.03469507396221161, "learning_rate": 0.024000000208616257, "loss": 2.4748990535736084, "step": 4670 }, { "epoch": 0.22247619047619047, "grad_norm": 0.032357338815927505, "learning_rate": 0.024000000208616257, "loss": 2.497532844543457, "step": 4672 }, { "epoch": 0.22257142857142856, "grad_norm": 0.03198781982064247, "learning_rate": 0.024000000208616257, "loss": 2.4888811111450195, "step": 4674 }, { "epoch": 0.22266666666666668, "grad_norm": 0.03293994069099426, "learning_rate": 0.024000000208616257, "loss": 2.496633529663086, "step": 4676 }, { "epoch": 0.22276190476190477, "grad_norm": 0.033590011298656464, "learning_rate": 0.024000000208616257, "loss": 2.4924890995025635, "step": 4678 }, { "epoch": 0.22285714285714286, "grad_norm": 0.03398400545120239, "learning_rate": 0.024000000208616257, "loss": 2.4944632053375244, "step": 4680 }, { "epoch": 0.22295238095238096, "grad_norm": 0.03564300760626793, "learning_rate": 0.024000000208616257, "loss": 2.493999481201172, "step": 4682 }, { "epoch": 0.22304761904761905, "grad_norm": 0.03927815705537796, "learning_rate": 0.024000000208616257, "loss": 2.490851402282715, "step": 4684 }, { "epoch": 0.22314285714285714, "grad_norm": 0.03747735917568207, "learning_rate": 0.024000000208616257, "loss": 2.482998847961426, "step": 4686 }, { "epoch": 0.22323809523809524, "grad_norm": 0.04303037375211716, "learning_rate": 0.024000000208616257, "loss": 2.4715323448181152, "step": 4688 }, { "epoch": 0.22333333333333333, "grad_norm": 0.049164779484272, "learning_rate": 0.024000000208616257, "loss": 2.4830098152160645, "step": 4690 }, { "epoch": 0.22342857142857142, "grad_norm": 0.03888080269098282, "learning_rate": 0.024000000208616257, "loss": 2.5203514099121094, "step": 4692 }, { "epoch": 0.2235238095238095, "grad_norm": 0.035994600504636765, "learning_rate": 0.024000000208616257, "loss": 2.4871225357055664, "step": 4694 }, { "epoch": 0.2236190476190476, "grad_norm": 0.03097129426896572, "learning_rate": 0.024000000208616257, "loss": 2.476266622543335, "step": 4696 }, { "epoch": 0.22371428571428573, "grad_norm": 0.03311251476407051, "learning_rate": 0.024000000208616257, "loss": 2.4871225357055664, "step": 4698 }, { "epoch": 0.22380952380952382, "grad_norm": 0.0326714888215065, "learning_rate": 0.024000000208616257, "loss": 2.529578685760498, "step": 4700 }, { "epoch": 0.2239047619047619, "grad_norm": 0.0339653342962265, "learning_rate": 0.024000000208616257, "loss": 2.5150890350341797, "step": 4702 }, { "epoch": 0.224, "grad_norm": 0.032902710139751434, "learning_rate": 0.024000000208616257, "loss": 2.486980676651001, "step": 4704 }, { "epoch": 0.2240952380952381, "grad_norm": 0.03170580416917801, "learning_rate": 0.024000000208616257, "loss": 2.481626510620117, "step": 4706 }, { "epoch": 0.2241904761904762, "grad_norm": 0.03269261121749878, "learning_rate": 0.024000000208616257, "loss": 2.4705705642700195, "step": 4708 }, { "epoch": 0.22428571428571428, "grad_norm": 0.03239228203892708, "learning_rate": 0.024000000208616257, "loss": 2.466301918029785, "step": 4710 }, { "epoch": 0.22438095238095238, "grad_norm": 0.03061547875404358, "learning_rate": 0.024000000208616257, "loss": 2.4737918376922607, "step": 4712 }, { "epoch": 0.22447619047619047, "grad_norm": 0.03311530873179436, "learning_rate": 0.024000000208616257, "loss": 2.471072196960449, "step": 4714 }, { "epoch": 0.22457142857142856, "grad_norm": 0.032783348113298416, "learning_rate": 0.024000000208616257, "loss": 2.490107536315918, "step": 4716 }, { "epoch": 0.22466666666666665, "grad_norm": 0.03285424783825874, "learning_rate": 0.024000000208616257, "loss": 2.49782133102417, "step": 4718 }, { "epoch": 0.22476190476190477, "grad_norm": 0.034729983657598495, "learning_rate": 0.024000000208616257, "loss": 2.485132932662964, "step": 4720 }, { "epoch": 0.22485714285714287, "grad_norm": 0.03551066294312477, "learning_rate": 0.024000000208616257, "loss": 2.473823070526123, "step": 4722 }, { "epoch": 0.22495238095238096, "grad_norm": 0.03586755320429802, "learning_rate": 0.024000000208616257, "loss": 2.493802070617676, "step": 4724 }, { "epoch": 0.22504761904761905, "grad_norm": 0.03400854393839836, "learning_rate": 0.024000000208616257, "loss": 2.47141695022583, "step": 4726 }, { "epoch": 0.22514285714285714, "grad_norm": 0.03495979309082031, "learning_rate": 0.024000000208616257, "loss": 2.4477648735046387, "step": 4728 }, { "epoch": 0.22523809523809524, "grad_norm": 0.03812415525317192, "learning_rate": 0.024000000208616257, "loss": 2.4533185958862305, "step": 4730 }, { "epoch": 0.22533333333333333, "grad_norm": 0.03395041823387146, "learning_rate": 0.024000000208616257, "loss": 2.4803361892700195, "step": 4732 }, { "epoch": 0.22542857142857142, "grad_norm": 0.035531654953956604, "learning_rate": 0.024000000208616257, "loss": 2.4659948348999023, "step": 4734 }, { "epoch": 0.22552380952380952, "grad_norm": 0.03184927627444267, "learning_rate": 0.024000000208616257, "loss": 2.470083236694336, "step": 4736 }, { "epoch": 0.2256190476190476, "grad_norm": 0.03539511188864708, "learning_rate": 0.024000000208616257, "loss": 2.5027284622192383, "step": 4738 }, { "epoch": 0.2257142857142857, "grad_norm": 0.03301730751991272, "learning_rate": 0.024000000208616257, "loss": 2.487987518310547, "step": 4740 }, { "epoch": 0.22580952380952382, "grad_norm": 0.03272976353764534, "learning_rate": 0.024000000208616257, "loss": 2.4850611686706543, "step": 4742 }, { "epoch": 0.2259047619047619, "grad_norm": 0.03244670107960701, "learning_rate": 0.024000000208616257, "loss": 2.463935375213623, "step": 4744 }, { "epoch": 0.226, "grad_norm": 0.033064354211091995, "learning_rate": 0.024000000208616257, "loss": 2.4852962493896484, "step": 4746 }, { "epoch": 0.2260952380952381, "grad_norm": 0.0331077016890049, "learning_rate": 0.024000000208616257, "loss": 2.453573703765869, "step": 4748 }, { "epoch": 0.2261904761904762, "grad_norm": 0.03458128869533539, "learning_rate": 0.024000000208616257, "loss": 2.4627974033355713, "step": 4750 }, { "epoch": 0.22628571428571428, "grad_norm": 0.06377746164798737, "learning_rate": 0.024000000208616257, "loss": 2.479532480239868, "step": 4752 }, { "epoch": 0.22638095238095238, "grad_norm": 0.03307657688856125, "learning_rate": 0.024000000208616257, "loss": 2.4590537548065186, "step": 4754 }, { "epoch": 0.22647619047619047, "grad_norm": 0.035469572991132736, "learning_rate": 0.024000000208616257, "loss": 2.446739912033081, "step": 4756 }, { "epoch": 0.22657142857142856, "grad_norm": 0.04844854772090912, "learning_rate": 0.024000000208616257, "loss": 2.4802634716033936, "step": 4758 }, { "epoch": 0.22666666666666666, "grad_norm": 0.034526724368333817, "learning_rate": 0.024000000208616257, "loss": 2.466519832611084, "step": 4760 }, { "epoch": 0.22676190476190478, "grad_norm": 0.033050887286663055, "learning_rate": 0.024000000208616257, "loss": 2.4680793285369873, "step": 4762 }, { "epoch": 0.22685714285714287, "grad_norm": 0.032569270581007004, "learning_rate": 0.024000000208616257, "loss": 2.503209352493286, "step": 4764 }, { "epoch": 0.22695238095238096, "grad_norm": 0.0353996679186821, "learning_rate": 0.024000000208616257, "loss": 2.511385440826416, "step": 4766 }, { "epoch": 0.22704761904761905, "grad_norm": 0.03772391378879547, "learning_rate": 0.024000000208616257, "loss": 2.46980619430542, "step": 4768 }, { "epoch": 0.22714285714285715, "grad_norm": 0.033392589539289474, "learning_rate": 0.024000000208616257, "loss": 2.467054605484009, "step": 4770 }, { "epoch": 0.22723809523809524, "grad_norm": 0.03194722533226013, "learning_rate": 0.024000000208616257, "loss": 2.470207452774048, "step": 4772 }, { "epoch": 0.22733333333333333, "grad_norm": 0.031860269606113434, "learning_rate": 0.024000000208616257, "loss": 2.480311393737793, "step": 4774 }, { "epoch": 0.22742857142857142, "grad_norm": 0.03324604406952858, "learning_rate": 0.024000000208616257, "loss": 2.4681296348571777, "step": 4776 }, { "epoch": 0.22752380952380952, "grad_norm": 0.03417322412133217, "learning_rate": 0.024000000208616257, "loss": 2.4642062187194824, "step": 4778 }, { "epoch": 0.2276190476190476, "grad_norm": 0.033834196627140045, "learning_rate": 0.024000000208616257, "loss": 2.4897236824035645, "step": 4780 }, { "epoch": 0.2277142857142857, "grad_norm": 0.034872859716415405, "learning_rate": 0.024000000208616257, "loss": 2.4771199226379395, "step": 4782 }, { "epoch": 0.22780952380952382, "grad_norm": 0.03520423546433449, "learning_rate": 0.024000000208616257, "loss": 2.4949612617492676, "step": 4784 }, { "epoch": 0.22790476190476192, "grad_norm": 0.03513408079743385, "learning_rate": 0.024000000208616257, "loss": 2.493072986602783, "step": 4786 }, { "epoch": 0.228, "grad_norm": 0.032248999923467636, "learning_rate": 0.024000000208616257, "loss": 2.4662251472473145, "step": 4788 }, { "epoch": 0.2280952380952381, "grad_norm": 0.03292598947882652, "learning_rate": 0.024000000208616257, "loss": 2.479724884033203, "step": 4790 }, { "epoch": 0.2281904761904762, "grad_norm": 0.033185381442308426, "learning_rate": 0.024000000208616257, "loss": 2.5082342624664307, "step": 4792 }, { "epoch": 0.2282857142857143, "grad_norm": 0.031624529510736465, "learning_rate": 0.024000000208616257, "loss": 2.4991869926452637, "step": 4794 }, { "epoch": 0.22838095238095238, "grad_norm": 0.03297017142176628, "learning_rate": 0.024000000208616257, "loss": 2.4560301303863525, "step": 4796 }, { "epoch": 0.22847619047619047, "grad_norm": 0.03243574872612953, "learning_rate": 0.024000000208616257, "loss": 2.4977002143859863, "step": 4798 }, { "epoch": 0.22857142857142856, "grad_norm": 0.03205079957842827, "learning_rate": 0.024000000208616257, "loss": 2.438514232635498, "step": 4800 }, { "epoch": 0.22866666666666666, "grad_norm": 0.03206086531281471, "learning_rate": 0.024000000208616257, "loss": 2.476102352142334, "step": 4802 }, { "epoch": 0.22876190476190475, "grad_norm": 0.03350791335105896, "learning_rate": 0.024000000208616257, "loss": 2.4841134548187256, "step": 4804 }, { "epoch": 0.22885714285714287, "grad_norm": 0.03163295239210129, "learning_rate": 0.024000000208616257, "loss": 2.4799461364746094, "step": 4806 }, { "epoch": 0.22895238095238096, "grad_norm": 0.03434748947620392, "learning_rate": 0.024000000208616257, "loss": 2.46063232421875, "step": 4808 }, { "epoch": 0.22904761904761906, "grad_norm": 0.035633351653814316, "learning_rate": 0.024000000208616257, "loss": 2.4727771282196045, "step": 4810 }, { "epoch": 0.22914285714285715, "grad_norm": 0.03190416097640991, "learning_rate": 0.024000000208616257, "loss": 2.4519174098968506, "step": 4812 }, { "epoch": 0.22923809523809524, "grad_norm": 0.032350797206163406, "learning_rate": 0.024000000208616257, "loss": 2.4767284393310547, "step": 4814 }, { "epoch": 0.22933333333333333, "grad_norm": 0.03166979178786278, "learning_rate": 0.024000000208616257, "loss": 2.454446315765381, "step": 4816 }, { "epoch": 0.22942857142857143, "grad_norm": 0.03233880177140236, "learning_rate": 0.024000000208616257, "loss": 2.4668867588043213, "step": 4818 }, { "epoch": 0.22952380952380952, "grad_norm": 0.03830067068338394, "learning_rate": 0.024000000208616257, "loss": 2.474236488342285, "step": 4820 }, { "epoch": 0.2296190476190476, "grad_norm": 0.03237217664718628, "learning_rate": 0.024000000208616257, "loss": 2.451942205429077, "step": 4822 }, { "epoch": 0.2297142857142857, "grad_norm": 0.031917404383420944, "learning_rate": 0.024000000208616257, "loss": 2.453573703765869, "step": 4824 }, { "epoch": 0.2298095238095238, "grad_norm": 0.031688909977674484, "learning_rate": 0.024000000208616257, "loss": 2.4952101707458496, "step": 4826 }, { "epoch": 0.22990476190476192, "grad_norm": 0.03343017399311066, "learning_rate": 0.024000000208616257, "loss": 2.4846277236938477, "step": 4828 }, { "epoch": 0.23, "grad_norm": 0.03308068588376045, "learning_rate": 0.024000000208616257, "loss": 2.4323372840881348, "step": 4830 }, { "epoch": 0.2300952380952381, "grad_norm": 0.033170945942401886, "learning_rate": 0.024000000208616257, "loss": 2.4834601879119873, "step": 4832 }, { "epoch": 0.2301904761904762, "grad_norm": 0.03166130185127258, "learning_rate": 0.024000000208616257, "loss": 2.446880340576172, "step": 4834 }, { "epoch": 0.2302857142857143, "grad_norm": 0.03428579866886139, "learning_rate": 0.024000000208616257, "loss": 2.424360752105713, "step": 4836 }, { "epoch": 0.23038095238095238, "grad_norm": 0.034932538866996765, "learning_rate": 0.024000000208616257, "loss": 2.4458723068237305, "step": 4838 }, { "epoch": 0.23047619047619047, "grad_norm": 0.03334333002567291, "learning_rate": 0.024000000208616257, "loss": 2.465362071990967, "step": 4840 }, { "epoch": 0.23057142857142857, "grad_norm": 0.03162964805960655, "learning_rate": 0.024000000208616257, "loss": 2.482130765914917, "step": 4842 }, { "epoch": 0.23066666666666666, "grad_norm": 0.03251060098409653, "learning_rate": 0.024000000208616257, "loss": 2.477529287338257, "step": 4844 }, { "epoch": 0.23076190476190475, "grad_norm": 0.03243162855505943, "learning_rate": 0.024000000208616257, "loss": 2.465276002883911, "step": 4846 }, { "epoch": 0.23085714285714284, "grad_norm": 0.03278768062591553, "learning_rate": 0.024000000208616257, "loss": 2.4764599800109863, "step": 4848 }, { "epoch": 0.23095238095238096, "grad_norm": 0.033917248249053955, "learning_rate": 0.024000000208616257, "loss": 2.4626305103302, "step": 4850 }, { "epoch": 0.23104761904761906, "grad_norm": 0.039257992058992386, "learning_rate": 0.024000000208616257, "loss": 2.4638030529022217, "step": 4852 }, { "epoch": 0.23114285714285715, "grad_norm": 0.03927663341164589, "learning_rate": 0.024000000208616257, "loss": 2.4814858436584473, "step": 4854 }, { "epoch": 0.23123809523809524, "grad_norm": 0.03866506740450859, "learning_rate": 0.024000000208616257, "loss": 2.442105770111084, "step": 4856 }, { "epoch": 0.23133333333333334, "grad_norm": 0.04029589146375656, "learning_rate": 0.024000000208616257, "loss": 2.4608798027038574, "step": 4858 }, { "epoch": 0.23142857142857143, "grad_norm": 0.03455091640353203, "learning_rate": 0.024000000208616257, "loss": 2.477128505706787, "step": 4860 }, { "epoch": 0.23152380952380952, "grad_norm": 0.03391339257359505, "learning_rate": 0.024000000208616257, "loss": 2.465222120285034, "step": 4862 }, { "epoch": 0.2316190476190476, "grad_norm": 0.03234627842903137, "learning_rate": 0.024000000208616257, "loss": 2.453758955001831, "step": 4864 }, { "epoch": 0.2317142857142857, "grad_norm": 0.03263118863105774, "learning_rate": 0.024000000208616257, "loss": 2.476637363433838, "step": 4866 }, { "epoch": 0.2318095238095238, "grad_norm": 0.031855467706918716, "learning_rate": 0.024000000208616257, "loss": 2.480131149291992, "step": 4868 }, { "epoch": 0.2319047619047619, "grad_norm": 0.03309675678610802, "learning_rate": 0.024000000208616257, "loss": 2.4571971893310547, "step": 4870 }, { "epoch": 0.232, "grad_norm": 0.03175806254148483, "learning_rate": 0.024000000208616257, "loss": 2.4686059951782227, "step": 4872 }, { "epoch": 0.2320952380952381, "grad_norm": 0.03190731629729271, "learning_rate": 0.024000000208616257, "loss": 2.4759392738342285, "step": 4874 }, { "epoch": 0.2321904761904762, "grad_norm": 0.032898932695388794, "learning_rate": 0.024000000208616257, "loss": 2.446603536605835, "step": 4876 }, { "epoch": 0.2322857142857143, "grad_norm": 0.032555270940065384, "learning_rate": 0.024000000208616257, "loss": 2.495856285095215, "step": 4878 }, { "epoch": 0.23238095238095238, "grad_norm": 0.03184015676379204, "learning_rate": 0.024000000208616257, "loss": 2.4220998287200928, "step": 4880 }, { "epoch": 0.23247619047619048, "grad_norm": 0.03126243129372597, "learning_rate": 0.024000000208616257, "loss": 2.4612503051757812, "step": 4882 }, { "epoch": 0.23257142857142857, "grad_norm": 0.032022878527641296, "learning_rate": 0.024000000208616257, "loss": 2.4338088035583496, "step": 4884 }, { "epoch": 0.23266666666666666, "grad_norm": 0.030643606558442116, "learning_rate": 0.024000000208616257, "loss": 2.4486780166625977, "step": 4886 }, { "epoch": 0.23276190476190475, "grad_norm": 0.031270235776901245, "learning_rate": 0.024000000208616257, "loss": 2.471735954284668, "step": 4888 }, { "epoch": 0.23285714285714285, "grad_norm": 0.03204530477523804, "learning_rate": 0.024000000208616257, "loss": 2.441758155822754, "step": 4890 }, { "epoch": 0.23295238095238094, "grad_norm": 0.03727259486913681, "learning_rate": 0.024000000208616257, "loss": 2.4630045890808105, "step": 4892 }, { "epoch": 0.23304761904761906, "grad_norm": 0.03198296204209328, "learning_rate": 0.024000000208616257, "loss": 2.47153377532959, "step": 4894 }, { "epoch": 0.23314285714285715, "grad_norm": 0.03212233632802963, "learning_rate": 0.024000000208616257, "loss": 2.4632205963134766, "step": 4896 }, { "epoch": 0.23323809523809524, "grad_norm": 0.0331190750002861, "learning_rate": 0.024000000208616257, "loss": 2.4490432739257812, "step": 4898 }, { "epoch": 0.23333333333333334, "grad_norm": 0.035038381814956665, "learning_rate": 0.024000000208616257, "loss": 2.467581272125244, "step": 4900 }, { "epoch": 0.23342857142857143, "grad_norm": 0.031765926629304886, "learning_rate": 0.024000000208616257, "loss": 2.4759902954101562, "step": 4902 }, { "epoch": 0.23352380952380952, "grad_norm": 0.032836996018886566, "learning_rate": 0.024000000208616257, "loss": 2.438633441925049, "step": 4904 }, { "epoch": 0.23361904761904762, "grad_norm": 0.03381795436143875, "learning_rate": 0.024000000208616257, "loss": 2.4451491832733154, "step": 4906 }, { "epoch": 0.2337142857142857, "grad_norm": 0.031464677304029465, "learning_rate": 0.024000000208616257, "loss": 2.443021774291992, "step": 4908 }, { "epoch": 0.2338095238095238, "grad_norm": 0.03581545129418373, "learning_rate": 0.024000000208616257, "loss": 2.46441388130188, "step": 4910 }, { "epoch": 0.2339047619047619, "grad_norm": 0.0351780541241169, "learning_rate": 0.024000000208616257, "loss": 2.465635299682617, "step": 4912 }, { "epoch": 0.234, "grad_norm": 0.035672012716531754, "learning_rate": 0.024000000208616257, "loss": 2.4530324935913086, "step": 4914 }, { "epoch": 0.2340952380952381, "grad_norm": 0.03306126967072487, "learning_rate": 0.024000000208616257, "loss": 2.4424428939819336, "step": 4916 }, { "epoch": 0.2341904761904762, "grad_norm": 0.03387806937098503, "learning_rate": 0.024000000208616257, "loss": 2.4585461616516113, "step": 4918 }, { "epoch": 0.2342857142857143, "grad_norm": 0.03452811390161514, "learning_rate": 0.024000000208616257, "loss": 2.450383186340332, "step": 4920 }, { "epoch": 0.23438095238095238, "grad_norm": 0.03414054214954376, "learning_rate": 0.024000000208616257, "loss": 2.459897518157959, "step": 4922 }, { "epoch": 0.23447619047619048, "grad_norm": 0.031202830374240875, "learning_rate": 0.024000000208616257, "loss": 2.4620628356933594, "step": 4924 }, { "epoch": 0.23457142857142857, "grad_norm": 0.03169819712638855, "learning_rate": 0.024000000208616257, "loss": 2.460075855255127, "step": 4926 }, { "epoch": 0.23466666666666666, "grad_norm": 0.03271928057074547, "learning_rate": 0.024000000208616257, "loss": 2.428359270095825, "step": 4928 }, { "epoch": 0.23476190476190475, "grad_norm": 0.03213587403297424, "learning_rate": 0.024000000208616257, "loss": 2.4700984954833984, "step": 4930 }, { "epoch": 0.23485714285714285, "grad_norm": 0.032468900084495544, "learning_rate": 0.024000000208616257, "loss": 2.442355155944824, "step": 4932 }, { "epoch": 0.23495238095238094, "grad_norm": 0.03291837498545647, "learning_rate": 0.024000000208616257, "loss": 2.4532408714294434, "step": 4934 }, { "epoch": 0.23504761904761906, "grad_norm": 0.032963935285806656, "learning_rate": 0.024000000208616257, "loss": 2.4598512649536133, "step": 4936 }, { "epoch": 0.23514285714285715, "grad_norm": 0.03321719914674759, "learning_rate": 0.024000000208616257, "loss": 2.432420253753662, "step": 4938 }, { "epoch": 0.23523809523809525, "grad_norm": 0.03281112387776375, "learning_rate": 0.024000000208616257, "loss": 2.485912322998047, "step": 4940 }, { "epoch": 0.23533333333333334, "grad_norm": 0.03154120221734047, "learning_rate": 0.024000000208616257, "loss": 2.415041446685791, "step": 4942 }, { "epoch": 0.23542857142857143, "grad_norm": 0.03073546662926674, "learning_rate": 0.024000000208616257, "loss": 2.4707679748535156, "step": 4944 }, { "epoch": 0.23552380952380952, "grad_norm": 0.03193007782101631, "learning_rate": 0.024000000208616257, "loss": 2.455976963043213, "step": 4946 }, { "epoch": 0.23561904761904762, "grad_norm": 0.032929353415966034, "learning_rate": 0.024000000208616257, "loss": 2.4527506828308105, "step": 4948 }, { "epoch": 0.2357142857142857, "grad_norm": 0.03670494630932808, "learning_rate": 0.024000000208616257, "loss": 2.4717772006988525, "step": 4950 }, { "epoch": 0.2358095238095238, "grad_norm": 0.036600250750780106, "learning_rate": 0.024000000208616257, "loss": 2.4486641883850098, "step": 4952 }, { "epoch": 0.2359047619047619, "grad_norm": 0.03244421258568764, "learning_rate": 0.024000000208616257, "loss": 2.4315414428710938, "step": 4954 }, { "epoch": 0.236, "grad_norm": 0.03234827518463135, "learning_rate": 0.024000000208616257, "loss": 2.4619429111480713, "step": 4956 }, { "epoch": 0.2360952380952381, "grad_norm": 0.031209534034132957, "learning_rate": 0.024000000208616257, "loss": 2.418696403503418, "step": 4958 }, { "epoch": 0.2361904761904762, "grad_norm": 0.03148431330919266, "learning_rate": 0.024000000208616257, "loss": 2.445603370666504, "step": 4960 }, { "epoch": 0.2362857142857143, "grad_norm": 0.03268168494105339, "learning_rate": 0.024000000208616257, "loss": 2.428166389465332, "step": 4962 }, { "epoch": 0.23638095238095239, "grad_norm": 0.033806633204221725, "learning_rate": 0.024000000208616257, "loss": 2.4587693214416504, "step": 4964 }, { "epoch": 0.23647619047619048, "grad_norm": 0.03122219629585743, "learning_rate": 0.024000000208616257, "loss": 2.4545626640319824, "step": 4966 }, { "epoch": 0.23657142857142857, "grad_norm": 0.03111090511083603, "learning_rate": 0.024000000208616257, "loss": 2.4455060958862305, "step": 4968 }, { "epoch": 0.23666666666666666, "grad_norm": 0.03145147114992142, "learning_rate": 0.024000000208616257, "loss": 2.465826988220215, "step": 4970 }, { "epoch": 0.23676190476190476, "grad_norm": 0.0318654403090477, "learning_rate": 0.024000000208616257, "loss": 2.438039541244507, "step": 4972 }, { "epoch": 0.23685714285714285, "grad_norm": 0.032525792717933655, "learning_rate": 0.024000000208616257, "loss": 2.4442801475524902, "step": 4974 }, { "epoch": 0.23695238095238094, "grad_norm": 0.031917039304971695, "learning_rate": 0.024000000208616257, "loss": 2.4585940837860107, "step": 4976 }, { "epoch": 0.23704761904761903, "grad_norm": 0.03169330209493637, "learning_rate": 0.024000000208616257, "loss": 2.4726791381835938, "step": 4978 }, { "epoch": 0.23714285714285716, "grad_norm": 0.031041502952575684, "learning_rate": 0.024000000208616257, "loss": 2.466341495513916, "step": 4980 }, { "epoch": 0.23723809523809525, "grad_norm": 0.03103133849799633, "learning_rate": 0.024000000208616257, "loss": 2.4716062545776367, "step": 4982 }, { "epoch": 0.23733333333333334, "grad_norm": 0.03165363147854805, "learning_rate": 0.024000000208616257, "loss": 2.466639995574951, "step": 4984 }, { "epoch": 0.23742857142857143, "grad_norm": 0.0315510593354702, "learning_rate": 0.024000000208616257, "loss": 2.4364590644836426, "step": 4986 }, { "epoch": 0.23752380952380953, "grad_norm": 0.03135395050048828, "learning_rate": 0.024000000208616257, "loss": 2.4354429244995117, "step": 4988 }, { "epoch": 0.23761904761904762, "grad_norm": 0.03122919611632824, "learning_rate": 0.024000000208616257, "loss": 2.442389488220215, "step": 4990 }, { "epoch": 0.2377142857142857, "grad_norm": 0.03389564901590347, "learning_rate": 0.024000000208616257, "loss": 2.4367103576660156, "step": 4992 }, { "epoch": 0.2378095238095238, "grad_norm": 0.03199462220072746, "learning_rate": 0.024000000208616257, "loss": 2.4272329807281494, "step": 4994 }, { "epoch": 0.2379047619047619, "grad_norm": 0.031222620978951454, "learning_rate": 0.024000000208616257, "loss": 2.448513984680176, "step": 4996 }, { "epoch": 0.238, "grad_norm": 0.03075929544866085, "learning_rate": 0.024000000208616257, "loss": 2.4437804222106934, "step": 4998 }, { "epoch": 0.23809523809523808, "grad_norm": 0.03130767121911049, "learning_rate": 0.024000000208616257, "loss": 2.455601215362549, "step": 5000 }, { "epoch": 0.2381904761904762, "grad_norm": 0.031871698796749115, "learning_rate": 0.024000000208616257, "loss": 2.4428768157958984, "step": 5002 }, { "epoch": 0.2382857142857143, "grad_norm": 0.03178258612751961, "learning_rate": 0.024000000208616257, "loss": 2.4369637966156006, "step": 5004 }, { "epoch": 0.2383809523809524, "grad_norm": 0.031145982444286346, "learning_rate": 0.024000000208616257, "loss": 2.4422659873962402, "step": 5006 }, { "epoch": 0.23847619047619048, "grad_norm": 0.030917666852474213, "learning_rate": 0.024000000208616257, "loss": 2.428359270095825, "step": 5008 }, { "epoch": 0.23857142857142857, "grad_norm": 0.03079896606504917, "learning_rate": 0.024000000208616257, "loss": 2.4289627075195312, "step": 5010 }, { "epoch": 0.23866666666666667, "grad_norm": 0.03090347908437252, "learning_rate": 0.024000000208616257, "loss": 2.435957431793213, "step": 5012 }, { "epoch": 0.23876190476190476, "grad_norm": 0.032462481409311295, "learning_rate": 0.024000000208616257, "loss": 2.4139394760131836, "step": 5014 }, { "epoch": 0.23885714285714285, "grad_norm": 0.03191038966178894, "learning_rate": 0.024000000208616257, "loss": 2.4671902656555176, "step": 5016 }, { "epoch": 0.23895238095238094, "grad_norm": 0.03304916247725487, "learning_rate": 0.024000000208616257, "loss": 2.4162731170654297, "step": 5018 }, { "epoch": 0.23904761904761904, "grad_norm": 0.030691221356391907, "learning_rate": 0.024000000208616257, "loss": 2.43278169631958, "step": 5020 }, { "epoch": 0.23914285714285713, "grad_norm": 0.031826142221689224, "learning_rate": 0.024000000208616257, "loss": 2.4596312046051025, "step": 5022 }, { "epoch": 0.23923809523809525, "grad_norm": 0.034304771572351456, "learning_rate": 0.024000000208616257, "loss": 2.439903736114502, "step": 5024 }, { "epoch": 0.23933333333333334, "grad_norm": 0.03177711367607117, "learning_rate": 0.024000000208616257, "loss": 2.4155466556549072, "step": 5026 }, { "epoch": 0.23942857142857144, "grad_norm": 0.030806483700871468, "learning_rate": 0.024000000208616257, "loss": 2.436143398284912, "step": 5028 }, { "epoch": 0.23952380952380953, "grad_norm": 0.03254144266247749, "learning_rate": 0.024000000208616257, "loss": 2.416811943054199, "step": 5030 }, { "epoch": 0.23961904761904762, "grad_norm": 0.03276721015572548, "learning_rate": 0.024000000208616257, "loss": 2.469881534576416, "step": 5032 }, { "epoch": 0.2397142857142857, "grad_norm": 0.03270953893661499, "learning_rate": 0.024000000208616257, "loss": 2.418109178543091, "step": 5034 }, { "epoch": 0.2398095238095238, "grad_norm": 0.03366115689277649, "learning_rate": 0.024000000208616257, "loss": 2.4488964080810547, "step": 5036 }, { "epoch": 0.2399047619047619, "grad_norm": 0.03302809223532677, "learning_rate": 0.024000000208616257, "loss": 2.435215473175049, "step": 5038 }, { "epoch": 0.24, "grad_norm": 0.03944186493754387, "learning_rate": 0.024000000208616257, "loss": 2.4635798931121826, "step": 5040 }, { "epoch": 0.24009523809523808, "grad_norm": 0.03841262310743332, "learning_rate": 0.024000000208616257, "loss": 2.452763080596924, "step": 5042 }, { "epoch": 0.2401904761904762, "grad_norm": 0.04079892113804817, "learning_rate": 0.024000000208616257, "loss": 2.4526853561401367, "step": 5044 }, { "epoch": 0.2402857142857143, "grad_norm": 0.03308163583278656, "learning_rate": 0.024000000208616257, "loss": 2.452526092529297, "step": 5046 }, { "epoch": 0.2403809523809524, "grad_norm": 0.031402837485075, "learning_rate": 0.024000000208616257, "loss": 2.4308643341064453, "step": 5048 }, { "epoch": 0.24047619047619048, "grad_norm": 0.03127182647585869, "learning_rate": 0.024000000208616257, "loss": 2.403402805328369, "step": 5050 }, { "epoch": 0.24057142857142857, "grad_norm": 0.032639604061841965, "learning_rate": 0.024000000208616257, "loss": 2.433781147003174, "step": 5052 }, { "epoch": 0.24066666666666667, "grad_norm": 0.031063782051205635, "learning_rate": 0.024000000208616257, "loss": 2.448647975921631, "step": 5054 }, { "epoch": 0.24076190476190476, "grad_norm": 0.030848462134599686, "learning_rate": 0.024000000208616257, "loss": 2.430347442626953, "step": 5056 }, { "epoch": 0.24085714285714285, "grad_norm": 0.03336739540100098, "learning_rate": 0.024000000208616257, "loss": 2.425234079360962, "step": 5058 }, { "epoch": 0.24095238095238095, "grad_norm": 0.03446685150265694, "learning_rate": 0.024000000208616257, "loss": 2.436471462249756, "step": 5060 }, { "epoch": 0.24104761904761904, "grad_norm": 0.03058784268796444, "learning_rate": 0.024000000208616257, "loss": 2.427539110183716, "step": 5062 }, { "epoch": 0.24114285714285713, "grad_norm": 0.03260588273406029, "learning_rate": 0.024000000208616257, "loss": 2.473959445953369, "step": 5064 }, { "epoch": 0.24123809523809525, "grad_norm": 0.03099987469613552, "learning_rate": 0.024000000208616257, "loss": 2.4212918281555176, "step": 5066 }, { "epoch": 0.24133333333333334, "grad_norm": 0.03194281831383705, "learning_rate": 0.024000000208616257, "loss": 2.4301018714904785, "step": 5068 }, { "epoch": 0.24142857142857144, "grad_norm": 0.03273751586675644, "learning_rate": 0.024000000208616257, "loss": 2.458919048309326, "step": 5070 }, { "epoch": 0.24152380952380953, "grad_norm": 0.03314734250307083, "learning_rate": 0.024000000208616257, "loss": 2.431220531463623, "step": 5072 }, { "epoch": 0.24161904761904762, "grad_norm": 0.034375905990600586, "learning_rate": 0.024000000208616257, "loss": 2.4339160919189453, "step": 5074 }, { "epoch": 0.24171428571428571, "grad_norm": 0.031142914667725563, "learning_rate": 0.024000000208616257, "loss": 2.4518933296203613, "step": 5076 }, { "epoch": 0.2418095238095238, "grad_norm": 0.03245391324162483, "learning_rate": 0.024000000208616257, "loss": 2.4439516067504883, "step": 5078 }, { "epoch": 0.2419047619047619, "grad_norm": 0.031134819611907005, "learning_rate": 0.024000000208616257, "loss": 2.4404807090759277, "step": 5080 }, { "epoch": 0.242, "grad_norm": 0.03158557042479515, "learning_rate": 0.024000000208616257, "loss": 2.4551820755004883, "step": 5082 }, { "epoch": 0.24209523809523809, "grad_norm": 0.03179480880498886, "learning_rate": 0.024000000208616257, "loss": 2.418733596801758, "step": 5084 }, { "epoch": 0.24219047619047618, "grad_norm": 0.032800834625959396, "learning_rate": 0.024000000208616257, "loss": 2.428746223449707, "step": 5086 }, { "epoch": 0.2422857142857143, "grad_norm": 0.03390571102499962, "learning_rate": 0.024000000208616257, "loss": 2.4616050720214844, "step": 5088 }, { "epoch": 0.2423809523809524, "grad_norm": 0.030443739145994186, "learning_rate": 0.024000000208616257, "loss": 2.424319267272949, "step": 5090 }, { "epoch": 0.24247619047619048, "grad_norm": 0.03076738677918911, "learning_rate": 0.024000000208616257, "loss": 2.4418957233428955, "step": 5092 }, { "epoch": 0.24257142857142858, "grad_norm": 0.03134721890091896, "learning_rate": 0.024000000208616257, "loss": 2.4438211917877197, "step": 5094 }, { "epoch": 0.24266666666666667, "grad_norm": 0.03260625898838043, "learning_rate": 0.024000000208616257, "loss": 2.426510810852051, "step": 5096 }, { "epoch": 0.24276190476190476, "grad_norm": 0.033932317048311234, "learning_rate": 0.024000000208616257, "loss": 2.4231858253479004, "step": 5098 }, { "epoch": 0.24285714285714285, "grad_norm": 0.030695075169205666, "learning_rate": 0.024000000208616257, "loss": 2.397622585296631, "step": 5100 }, { "epoch": 0.24295238095238095, "grad_norm": 0.033123329281806946, "learning_rate": 0.024000000208616257, "loss": 2.4351375102996826, "step": 5102 }, { "epoch": 0.24304761904761904, "grad_norm": 0.03179609403014183, "learning_rate": 0.024000000208616257, "loss": 2.43538761138916, "step": 5104 }, { "epoch": 0.24314285714285713, "grad_norm": 0.03398355841636658, "learning_rate": 0.024000000208616257, "loss": 2.43318510055542, "step": 5106 }, { "epoch": 0.24323809523809523, "grad_norm": 0.03147204965353012, "learning_rate": 0.024000000208616257, "loss": 2.449779510498047, "step": 5108 }, { "epoch": 0.24333333333333335, "grad_norm": 0.03160269558429718, "learning_rate": 0.024000000208616257, "loss": 2.445330858230591, "step": 5110 }, { "epoch": 0.24342857142857144, "grad_norm": 0.03240397199988365, "learning_rate": 0.024000000208616257, "loss": 2.433645248413086, "step": 5112 }, { "epoch": 0.24352380952380953, "grad_norm": 0.031592778861522675, "learning_rate": 0.024000000208616257, "loss": 2.4136691093444824, "step": 5114 }, { "epoch": 0.24361904761904762, "grad_norm": 0.03191974759101868, "learning_rate": 0.024000000208616257, "loss": 2.456718683242798, "step": 5116 }, { "epoch": 0.24371428571428572, "grad_norm": 0.0320778414607048, "learning_rate": 0.024000000208616257, "loss": 2.443239688873291, "step": 5118 }, { "epoch": 0.2438095238095238, "grad_norm": 0.03429703041911125, "learning_rate": 0.024000000208616257, "loss": 2.418954372406006, "step": 5120 }, { "epoch": 0.2439047619047619, "grad_norm": 0.03186912462115288, "learning_rate": 0.024000000208616257, "loss": 2.436079740524292, "step": 5122 }, { "epoch": 0.244, "grad_norm": 0.030619347468018532, "learning_rate": 0.024000000208616257, "loss": 2.438462257385254, "step": 5124 }, { "epoch": 0.2440952380952381, "grad_norm": 0.03212239593267441, "learning_rate": 0.024000000208616257, "loss": 2.4329280853271484, "step": 5126 }, { "epoch": 0.24419047619047618, "grad_norm": 0.03162180259823799, "learning_rate": 0.024000000208616257, "loss": 2.4421591758728027, "step": 5128 }, { "epoch": 0.24428571428571427, "grad_norm": 0.03096802905201912, "learning_rate": 0.024000000208616257, "loss": 2.442511796951294, "step": 5130 }, { "epoch": 0.2443809523809524, "grad_norm": 0.03151176497340202, "learning_rate": 0.024000000208616257, "loss": 2.4227397441864014, "step": 5132 }, { "epoch": 0.24447619047619049, "grad_norm": 0.031776197254657745, "learning_rate": 0.024000000208616257, "loss": 2.466700315475464, "step": 5134 }, { "epoch": 0.24457142857142858, "grad_norm": 0.031946975737810135, "learning_rate": 0.024000000208616257, "loss": 2.44081449508667, "step": 5136 }, { "epoch": 0.24466666666666667, "grad_norm": 0.03297324478626251, "learning_rate": 0.024000000208616257, "loss": 2.4492242336273193, "step": 5138 }, { "epoch": 0.24476190476190476, "grad_norm": 0.03135312348604202, "learning_rate": 0.024000000208616257, "loss": 2.438739776611328, "step": 5140 }, { "epoch": 0.24485714285714286, "grad_norm": 0.046802714467048645, "learning_rate": 0.024000000208616257, "loss": 2.4315261840820312, "step": 5142 }, { "epoch": 0.24495238095238095, "grad_norm": 0.032544344663619995, "learning_rate": 0.024000000208616257, "loss": 2.4568634033203125, "step": 5144 }, { "epoch": 0.24504761904761904, "grad_norm": 0.03177942335605621, "learning_rate": 0.024000000208616257, "loss": 2.4379005432128906, "step": 5146 }, { "epoch": 0.24514285714285713, "grad_norm": 0.030634824186563492, "learning_rate": 0.024000000208616257, "loss": 2.4551897048950195, "step": 5148 }, { "epoch": 0.24523809523809523, "grad_norm": 0.03122766688466072, "learning_rate": 0.024000000208616257, "loss": 2.431516170501709, "step": 5150 }, { "epoch": 0.24533333333333332, "grad_norm": 0.031842220574617386, "learning_rate": 0.024000000208616257, "loss": 2.4351577758789062, "step": 5152 }, { "epoch": 0.24542857142857144, "grad_norm": 0.032036859542131424, "learning_rate": 0.024000000208616257, "loss": 2.4063944816589355, "step": 5154 }, { "epoch": 0.24552380952380953, "grad_norm": 0.03214030712842941, "learning_rate": 0.024000000208616257, "loss": 2.454420804977417, "step": 5156 }, { "epoch": 0.24561904761904763, "grad_norm": 0.031271930783987045, "learning_rate": 0.024000000208616257, "loss": 2.43579363822937, "step": 5158 }, { "epoch": 0.24571428571428572, "grad_norm": 0.03211823105812073, "learning_rate": 0.024000000208616257, "loss": 2.4247183799743652, "step": 5160 }, { "epoch": 0.2458095238095238, "grad_norm": 0.03172464296221733, "learning_rate": 0.024000000208616257, "loss": 2.4152209758758545, "step": 5162 }, { "epoch": 0.2459047619047619, "grad_norm": 0.032295722514390945, "learning_rate": 0.024000000208616257, "loss": 2.445755958557129, "step": 5164 }, { "epoch": 0.246, "grad_norm": 0.03154406324028969, "learning_rate": 0.024000000208616257, "loss": 2.440610408782959, "step": 5166 }, { "epoch": 0.2460952380952381, "grad_norm": 0.03166312351822853, "learning_rate": 0.024000000208616257, "loss": 2.4323081970214844, "step": 5168 }, { "epoch": 0.24619047619047618, "grad_norm": 0.030796948820352554, "learning_rate": 0.024000000208616257, "loss": 2.422846794128418, "step": 5170 }, { "epoch": 0.24628571428571427, "grad_norm": 0.03561779856681824, "learning_rate": 0.024000000208616257, "loss": 2.4543561935424805, "step": 5172 }, { "epoch": 0.24638095238095237, "grad_norm": 0.031470756977796555, "learning_rate": 0.024000000208616257, "loss": 2.4222569465637207, "step": 5174 }, { "epoch": 0.2464761904761905, "grad_norm": 0.031375687569379807, "learning_rate": 0.024000000208616257, "loss": 2.4131088256835938, "step": 5176 }, { "epoch": 0.24657142857142858, "grad_norm": 0.03253437951207161, "learning_rate": 0.024000000208616257, "loss": 2.438693046569824, "step": 5178 }, { "epoch": 0.24666666666666667, "grad_norm": 0.03134525939822197, "learning_rate": 0.024000000208616257, "loss": 2.457665205001831, "step": 5180 }, { "epoch": 0.24676190476190477, "grad_norm": 0.030982406809926033, "learning_rate": 0.024000000208616257, "loss": 2.418596029281616, "step": 5182 }, { "epoch": 0.24685714285714286, "grad_norm": 0.03439369797706604, "learning_rate": 0.024000000208616257, "loss": 2.433413505554199, "step": 5184 }, { "epoch": 0.24695238095238095, "grad_norm": 0.03193904086947441, "learning_rate": 0.024000000208616257, "loss": 2.4474234580993652, "step": 5186 }, { "epoch": 0.24704761904761904, "grad_norm": 0.03063969314098358, "learning_rate": 0.024000000208616257, "loss": 2.3987245559692383, "step": 5188 }, { "epoch": 0.24714285714285714, "grad_norm": 0.032560478895902634, "learning_rate": 0.024000000208616257, "loss": 2.440870761871338, "step": 5190 }, { "epoch": 0.24723809523809523, "grad_norm": 0.031971849501132965, "learning_rate": 0.024000000208616257, "loss": 2.404054880142212, "step": 5192 }, { "epoch": 0.24733333333333332, "grad_norm": 0.03100547380745411, "learning_rate": 0.024000000208616257, "loss": 2.4261155128479004, "step": 5194 }, { "epoch": 0.24742857142857144, "grad_norm": 0.0328497551381588, "learning_rate": 0.024000000208616257, "loss": 2.4387073516845703, "step": 5196 }, { "epoch": 0.24752380952380953, "grad_norm": 0.03479984030127525, "learning_rate": 0.024000000208616257, "loss": 2.44690203666687, "step": 5198 }, { "epoch": 0.24761904761904763, "grad_norm": 0.031189991161227226, "learning_rate": 0.024000000208616257, "loss": 2.4119386672973633, "step": 5200 }, { "epoch": 0.24771428571428572, "grad_norm": 0.03439142182469368, "learning_rate": 0.024000000208616257, "loss": 2.4164228439331055, "step": 5202 }, { "epoch": 0.2478095238095238, "grad_norm": 0.03545600548386574, "learning_rate": 0.024000000208616257, "loss": 2.4502716064453125, "step": 5204 }, { "epoch": 0.2479047619047619, "grad_norm": 0.03180856630206108, "learning_rate": 0.024000000208616257, "loss": 2.4478044509887695, "step": 5206 }, { "epoch": 0.248, "grad_norm": 0.03133009374141693, "learning_rate": 0.024000000208616257, "loss": 2.4523391723632812, "step": 5208 }, { "epoch": 0.2480952380952381, "grad_norm": 0.03119414858520031, "learning_rate": 0.024000000208616257, "loss": 2.416858673095703, "step": 5210 }, { "epoch": 0.24819047619047618, "grad_norm": 0.03374669700860977, "learning_rate": 0.024000000208616257, "loss": 2.435781955718994, "step": 5212 }, { "epoch": 0.24828571428571428, "grad_norm": 0.03202417120337486, "learning_rate": 0.024000000208616257, "loss": 2.413475513458252, "step": 5214 }, { "epoch": 0.24838095238095237, "grad_norm": 0.03195689246058464, "learning_rate": 0.024000000208616257, "loss": 2.447007656097412, "step": 5216 }, { "epoch": 0.2484761904761905, "grad_norm": 0.03237782418727875, "learning_rate": 0.024000000208616257, "loss": 2.4344301223754883, "step": 5218 }, { "epoch": 0.24857142857142858, "grad_norm": 0.031695783138275146, "learning_rate": 0.024000000208616257, "loss": 2.4080629348754883, "step": 5220 }, { "epoch": 0.24866666666666667, "grad_norm": 0.03161827474832535, "learning_rate": 0.024000000208616257, "loss": 2.4282302856445312, "step": 5222 }, { "epoch": 0.24876190476190477, "grad_norm": 0.031067362055182457, "learning_rate": 0.024000000208616257, "loss": 2.413761615753174, "step": 5224 }, { "epoch": 0.24885714285714286, "grad_norm": 0.03309772536158562, "learning_rate": 0.024000000208616257, "loss": 2.4327452182769775, "step": 5226 }, { "epoch": 0.24895238095238095, "grad_norm": 0.03262703865766525, "learning_rate": 0.024000000208616257, "loss": 2.424880266189575, "step": 5228 }, { "epoch": 0.24904761904761905, "grad_norm": 0.03252482786774635, "learning_rate": 0.024000000208616257, "loss": 2.4313392639160156, "step": 5230 }, { "epoch": 0.24914285714285714, "grad_norm": 0.032344307750463486, "learning_rate": 0.024000000208616257, "loss": 2.4278221130371094, "step": 5232 }, { "epoch": 0.24923809523809523, "grad_norm": 0.032491255551576614, "learning_rate": 0.024000000208616257, "loss": 2.4541258811950684, "step": 5234 }, { "epoch": 0.24933333333333332, "grad_norm": 0.03274603188037872, "learning_rate": 0.024000000208616257, "loss": 2.418567180633545, "step": 5236 }, { "epoch": 0.24942857142857142, "grad_norm": 0.030883805826306343, "learning_rate": 0.024000000208616257, "loss": 2.3985395431518555, "step": 5238 }, { "epoch": 0.24952380952380954, "grad_norm": 0.03146642446517944, "learning_rate": 0.024000000208616257, "loss": 2.413745880126953, "step": 5240 }, { "epoch": 0.24961904761904763, "grad_norm": 0.03300030902028084, "learning_rate": 0.024000000208616257, "loss": 2.4152746200561523, "step": 5242 }, { "epoch": 0.24971428571428572, "grad_norm": 0.0304889976978302, "learning_rate": 0.024000000208616257, "loss": 2.440913438796997, "step": 5244 }, { "epoch": 0.24980952380952381, "grad_norm": 0.03135913610458374, "learning_rate": 0.024000000208616257, "loss": 2.395047664642334, "step": 5246 }, { "epoch": 0.2499047619047619, "grad_norm": 0.031235886737704277, "learning_rate": 0.024000000208616257, "loss": 2.3816640377044678, "step": 5248 }, { "epoch": 0.25, "grad_norm": 0.034407131373882294, "learning_rate": 0.024000000208616257, "loss": 2.4066357612609863, "step": 5250 }, { "epoch": 0.2500952380952381, "grad_norm": 0.03198624402284622, "learning_rate": 0.024000000208616257, "loss": 2.4351940155029297, "step": 5252 }, { "epoch": 0.2501904761904762, "grad_norm": 0.03166883811354637, "learning_rate": 0.024000000208616257, "loss": 2.4317636489868164, "step": 5254 }, { "epoch": 0.2502857142857143, "grad_norm": 0.032022763043642044, "learning_rate": 0.024000000208616257, "loss": 2.4245543479919434, "step": 5256 }, { "epoch": 0.25038095238095237, "grad_norm": 0.03431449830532074, "learning_rate": 0.024000000208616257, "loss": 2.4228672981262207, "step": 5258 }, { "epoch": 0.25047619047619046, "grad_norm": 0.030458297580480576, "learning_rate": 0.024000000208616257, "loss": 2.4261505603790283, "step": 5260 }, { "epoch": 0.25057142857142856, "grad_norm": 0.03091929480433464, "learning_rate": 0.024000000208616257, "loss": 2.4294466972351074, "step": 5262 }, { "epoch": 0.25066666666666665, "grad_norm": 0.029844267293810844, "learning_rate": 0.024000000208616257, "loss": 2.420591115951538, "step": 5264 }, { "epoch": 0.25076190476190474, "grad_norm": 0.03049897588789463, "learning_rate": 0.024000000208616257, "loss": 2.3999743461608887, "step": 5266 }, { "epoch": 0.25085714285714283, "grad_norm": 0.031119072809815407, "learning_rate": 0.024000000208616257, "loss": 2.408231258392334, "step": 5268 }, { "epoch": 0.2509523809523809, "grad_norm": 0.03101925179362297, "learning_rate": 0.024000000208616257, "loss": 2.430816650390625, "step": 5270 }, { "epoch": 0.2510476190476191, "grad_norm": 0.031917210668325424, "learning_rate": 0.024000000208616257, "loss": 2.4400694370269775, "step": 5272 }, { "epoch": 0.25114285714285717, "grad_norm": 0.03450963646173477, "learning_rate": 0.024000000208616257, "loss": 2.4098992347717285, "step": 5274 }, { "epoch": 0.25123809523809526, "grad_norm": 0.032573048025369644, "learning_rate": 0.024000000208616257, "loss": 2.377645969390869, "step": 5276 }, { "epoch": 0.25133333333333335, "grad_norm": 0.030998969450592995, "learning_rate": 0.024000000208616257, "loss": 2.4087066650390625, "step": 5278 }, { "epoch": 0.25142857142857145, "grad_norm": 0.03612903133034706, "learning_rate": 0.024000000208616257, "loss": 2.4326276779174805, "step": 5280 }, { "epoch": 0.25152380952380954, "grad_norm": 0.034261032938957214, "learning_rate": 0.024000000208616257, "loss": 2.391134738922119, "step": 5282 }, { "epoch": 0.25161904761904763, "grad_norm": 0.033529751002788544, "learning_rate": 0.024000000208616257, "loss": 2.425478935241699, "step": 5284 }, { "epoch": 0.2517142857142857, "grad_norm": 0.036629822105169296, "learning_rate": 0.024000000208616257, "loss": 2.4254398345947266, "step": 5286 }, { "epoch": 0.2518095238095238, "grad_norm": 0.0319504551589489, "learning_rate": 0.024000000208616257, "loss": 2.426347494125366, "step": 5288 }, { "epoch": 0.2519047619047619, "grad_norm": 0.03081464022397995, "learning_rate": 0.024000000208616257, "loss": 2.405913829803467, "step": 5290 }, { "epoch": 0.252, "grad_norm": 0.03011227585375309, "learning_rate": 0.024000000208616257, "loss": 2.4170477390289307, "step": 5292 }, { "epoch": 0.2520952380952381, "grad_norm": 0.03214811906218529, "learning_rate": 0.024000000208616257, "loss": 2.429774284362793, "step": 5294 }, { "epoch": 0.2521904761904762, "grad_norm": 0.03210081532597542, "learning_rate": 0.024000000208616257, "loss": 2.402398109436035, "step": 5296 }, { "epoch": 0.2522857142857143, "grad_norm": 0.03414318338036537, "learning_rate": 0.024000000208616257, "loss": 2.4434592723846436, "step": 5298 }, { "epoch": 0.2523809523809524, "grad_norm": 0.03135037049651146, "learning_rate": 0.024000000208616257, "loss": 2.440511703491211, "step": 5300 }, { "epoch": 0.25247619047619047, "grad_norm": 0.03128252923488617, "learning_rate": 0.024000000208616257, "loss": 2.405616283416748, "step": 5302 }, { "epoch": 0.25257142857142856, "grad_norm": 0.03230244666337967, "learning_rate": 0.024000000208616257, "loss": 2.418605089187622, "step": 5304 }, { "epoch": 0.25266666666666665, "grad_norm": 0.03214823454618454, "learning_rate": 0.024000000208616257, "loss": 2.40116286277771, "step": 5306 }, { "epoch": 0.25276190476190474, "grad_norm": 0.03152569755911827, "learning_rate": 0.024000000208616257, "loss": 2.412729263305664, "step": 5308 }, { "epoch": 0.25285714285714284, "grad_norm": 0.03144894540309906, "learning_rate": 0.024000000208616257, "loss": 2.4174251556396484, "step": 5310 }, { "epoch": 0.25295238095238093, "grad_norm": 0.032237786799669266, "learning_rate": 0.024000000208616257, "loss": 2.4314258098602295, "step": 5312 }, { "epoch": 0.253047619047619, "grad_norm": 0.031285855919122696, "learning_rate": 0.024000000208616257, "loss": 2.4240100383758545, "step": 5314 }, { "epoch": 0.25314285714285717, "grad_norm": 0.03219995275139809, "learning_rate": 0.024000000208616257, "loss": 2.419476270675659, "step": 5316 }, { "epoch": 0.25323809523809526, "grad_norm": 0.03115553967654705, "learning_rate": 0.024000000208616257, "loss": 2.406205892562866, "step": 5318 }, { "epoch": 0.25333333333333335, "grad_norm": 0.03059227019548416, "learning_rate": 0.024000000208616257, "loss": 2.4381625652313232, "step": 5320 }, { "epoch": 0.25342857142857145, "grad_norm": 0.03182839974761009, "learning_rate": 0.024000000208616257, "loss": 2.434796094894409, "step": 5322 }, { "epoch": 0.25352380952380954, "grad_norm": 0.032941222190856934, "learning_rate": 0.024000000208616257, "loss": 2.396784543991089, "step": 5324 }, { "epoch": 0.25361904761904763, "grad_norm": 0.033152636140584946, "learning_rate": 0.024000000208616257, "loss": 2.4145662784576416, "step": 5326 }, { "epoch": 0.2537142857142857, "grad_norm": 0.03527110815048218, "learning_rate": 0.024000000208616257, "loss": 2.419447898864746, "step": 5328 }, { "epoch": 0.2538095238095238, "grad_norm": 0.032335683703422546, "learning_rate": 0.024000000208616257, "loss": 2.423704147338867, "step": 5330 }, { "epoch": 0.2539047619047619, "grad_norm": 0.03207523748278618, "learning_rate": 0.024000000208616257, "loss": 2.423095464706421, "step": 5332 }, { "epoch": 0.254, "grad_norm": 0.03262028098106384, "learning_rate": 0.024000000208616257, "loss": 2.4136600494384766, "step": 5334 }, { "epoch": 0.2540952380952381, "grad_norm": 0.03148527815937996, "learning_rate": 0.024000000208616257, "loss": 2.425631046295166, "step": 5336 }, { "epoch": 0.2541904761904762, "grad_norm": 0.029992450028657913, "learning_rate": 0.024000000208616257, "loss": 2.422292470932007, "step": 5338 }, { "epoch": 0.2542857142857143, "grad_norm": 0.03229236602783203, "learning_rate": 0.024000000208616257, "loss": 2.3994390964508057, "step": 5340 }, { "epoch": 0.2543809523809524, "grad_norm": 0.030337641015648842, "learning_rate": 0.024000000208616257, "loss": 2.3979763984680176, "step": 5342 }, { "epoch": 0.25447619047619047, "grad_norm": 0.03170936182141304, "learning_rate": 0.024000000208616257, "loss": 2.3925299644470215, "step": 5344 }, { "epoch": 0.25457142857142856, "grad_norm": 0.032768070697784424, "learning_rate": 0.024000000208616257, "loss": 2.4084978103637695, "step": 5346 }, { "epoch": 0.25466666666666665, "grad_norm": 0.031721554696559906, "learning_rate": 0.024000000208616257, "loss": 2.4252853393554688, "step": 5348 }, { "epoch": 0.25476190476190474, "grad_norm": 0.031533535569906235, "learning_rate": 0.024000000208616257, "loss": 2.4356260299682617, "step": 5350 }, { "epoch": 0.25485714285714284, "grad_norm": 0.03436281904578209, "learning_rate": 0.024000000208616257, "loss": 2.404580593109131, "step": 5352 }, { "epoch": 0.25495238095238093, "grad_norm": 0.03212735056877136, "learning_rate": 0.024000000208616257, "loss": 2.4132721424102783, "step": 5354 }, { "epoch": 0.255047619047619, "grad_norm": 0.03106311336159706, "learning_rate": 0.024000000208616257, "loss": 2.3995931148529053, "step": 5356 }, { "epoch": 0.2551428571428571, "grad_norm": 0.029990267008543015, "learning_rate": 0.024000000208616257, "loss": 2.3959755897521973, "step": 5358 }, { "epoch": 0.25523809523809526, "grad_norm": 0.030089790001511574, "learning_rate": 0.024000000208616257, "loss": 2.3958911895751953, "step": 5360 }, { "epoch": 0.25533333333333336, "grad_norm": 0.032206807285547256, "learning_rate": 0.024000000208616257, "loss": 2.4217638969421387, "step": 5362 }, { "epoch": 0.25542857142857145, "grad_norm": 0.03144534304738045, "learning_rate": 0.024000000208616257, "loss": 2.3795628547668457, "step": 5364 }, { "epoch": 0.25552380952380954, "grad_norm": 0.030869822949171066, "learning_rate": 0.024000000208616257, "loss": 2.4128456115722656, "step": 5366 }, { "epoch": 0.25561904761904763, "grad_norm": 0.03152036666870117, "learning_rate": 0.024000000208616257, "loss": 2.3858389854431152, "step": 5368 }, { "epoch": 0.2557142857142857, "grad_norm": 0.033976323902606964, "learning_rate": 0.024000000208616257, "loss": 2.3908133506774902, "step": 5370 }, { "epoch": 0.2558095238095238, "grad_norm": 0.0344674214720726, "learning_rate": 0.024000000208616257, "loss": 2.3906283378601074, "step": 5372 }, { "epoch": 0.2559047619047619, "grad_norm": 0.032414231449365616, "learning_rate": 0.024000000208616257, "loss": 2.4296622276306152, "step": 5374 }, { "epoch": 0.256, "grad_norm": 0.03220691159367561, "learning_rate": 0.024000000208616257, "loss": 2.439225196838379, "step": 5376 }, { "epoch": 0.2560952380952381, "grad_norm": 0.03121328540146351, "learning_rate": 0.024000000208616257, "loss": 2.404726505279541, "step": 5378 }, { "epoch": 0.2561904761904762, "grad_norm": 0.030884698033332825, "learning_rate": 0.024000000208616257, "loss": 2.377146005630493, "step": 5380 }, { "epoch": 0.2562857142857143, "grad_norm": 0.03369889408349991, "learning_rate": 0.024000000208616257, "loss": 2.4146528244018555, "step": 5382 }, { "epoch": 0.2563809523809524, "grad_norm": 0.03278132528066635, "learning_rate": 0.024000000208616257, "loss": 2.3902101516723633, "step": 5384 }, { "epoch": 0.25647619047619047, "grad_norm": 0.032686688005924225, "learning_rate": 0.024000000208616257, "loss": 2.366447925567627, "step": 5386 }, { "epoch": 0.25657142857142856, "grad_norm": 0.03533146157860756, "learning_rate": 0.024000000208616257, "loss": 2.3913917541503906, "step": 5388 }, { "epoch": 0.25666666666666665, "grad_norm": 0.03409096598625183, "learning_rate": 0.024000000208616257, "loss": 2.4040393829345703, "step": 5390 }, { "epoch": 0.25676190476190475, "grad_norm": 0.0318492129445076, "learning_rate": 0.024000000208616257, "loss": 2.388803005218506, "step": 5392 }, { "epoch": 0.25685714285714284, "grad_norm": 0.031883712857961655, "learning_rate": 0.024000000208616257, "loss": 2.4073195457458496, "step": 5394 }, { "epoch": 0.25695238095238093, "grad_norm": 0.032373517751693726, "learning_rate": 0.024000000208616257, "loss": 2.423096179962158, "step": 5396 }, { "epoch": 0.257047619047619, "grad_norm": 0.03214838728308678, "learning_rate": 0.024000000208616257, "loss": 2.3928680419921875, "step": 5398 }, { "epoch": 0.2571428571428571, "grad_norm": 0.03428845852613449, "learning_rate": 0.024000000208616257, "loss": 2.3952460289001465, "step": 5400 }, { "epoch": 0.25723809523809527, "grad_norm": 0.032713066786527634, "learning_rate": 0.024000000208616257, "loss": 2.4059934616088867, "step": 5402 }, { "epoch": 0.25733333333333336, "grad_norm": 0.03380517661571503, "learning_rate": 0.024000000208616257, "loss": 2.4203948974609375, "step": 5404 }, { "epoch": 0.25742857142857145, "grad_norm": 0.03241650015115738, "learning_rate": 0.024000000208616257, "loss": 2.398283004760742, "step": 5406 }, { "epoch": 0.25752380952380954, "grad_norm": 0.030663466081023216, "learning_rate": 0.024000000208616257, "loss": 2.3838157653808594, "step": 5408 }, { "epoch": 0.25761904761904764, "grad_norm": 0.03262992203235626, "learning_rate": 0.024000000208616257, "loss": 2.3736727237701416, "step": 5410 }, { "epoch": 0.25771428571428573, "grad_norm": 0.03067677654325962, "learning_rate": 0.024000000208616257, "loss": 2.373810052871704, "step": 5412 }, { "epoch": 0.2578095238095238, "grad_norm": 0.029912728816270828, "learning_rate": 0.024000000208616257, "loss": 2.3722333908081055, "step": 5414 }, { "epoch": 0.2579047619047619, "grad_norm": 0.030815914273262024, "learning_rate": 0.024000000208616257, "loss": 2.3932852745056152, "step": 5416 }, { "epoch": 0.258, "grad_norm": 0.03538758307695389, "learning_rate": 0.024000000208616257, "loss": 2.4033913612365723, "step": 5418 }, { "epoch": 0.2580952380952381, "grad_norm": 0.03146061301231384, "learning_rate": 0.024000000208616257, "loss": 2.392453670501709, "step": 5420 }, { "epoch": 0.2581904761904762, "grad_norm": 0.03183531016111374, "learning_rate": 0.024000000208616257, "loss": 2.4103665351867676, "step": 5422 }, { "epoch": 0.2582857142857143, "grad_norm": 0.03301506116986275, "learning_rate": 0.024000000208616257, "loss": 2.4038171768188477, "step": 5424 }, { "epoch": 0.2583809523809524, "grad_norm": 0.031241508200764656, "learning_rate": 0.024000000208616257, "loss": 2.3902828693389893, "step": 5426 }, { "epoch": 0.25847619047619047, "grad_norm": 0.03147522360086441, "learning_rate": 0.024000000208616257, "loss": 2.3980908393859863, "step": 5428 }, { "epoch": 0.25857142857142856, "grad_norm": 0.03116549924015999, "learning_rate": 0.024000000208616257, "loss": 2.4042224884033203, "step": 5430 }, { "epoch": 0.25866666666666666, "grad_norm": 0.03222668915987015, "learning_rate": 0.024000000208616257, "loss": 2.420657157897949, "step": 5432 }, { "epoch": 0.25876190476190475, "grad_norm": 0.031931228935718536, "learning_rate": 0.024000000208616257, "loss": 2.3936681747436523, "step": 5434 }, { "epoch": 0.25885714285714284, "grad_norm": 0.030512044206261635, "learning_rate": 0.024000000208616257, "loss": 2.399482250213623, "step": 5436 }, { "epoch": 0.25895238095238093, "grad_norm": 0.03148795664310455, "learning_rate": 0.024000000208616257, "loss": 2.371001720428467, "step": 5438 }, { "epoch": 0.259047619047619, "grad_norm": 0.032876353710889816, "learning_rate": 0.024000000208616257, "loss": 2.417214870452881, "step": 5440 }, { "epoch": 0.2591428571428571, "grad_norm": 0.03197101876139641, "learning_rate": 0.024000000208616257, "loss": 2.3872318267822266, "step": 5442 }, { "epoch": 0.2592380952380952, "grad_norm": 0.03068718872964382, "learning_rate": 0.024000000208616257, "loss": 2.417818546295166, "step": 5444 }, { "epoch": 0.25933333333333336, "grad_norm": 0.03265013545751572, "learning_rate": 0.024000000208616257, "loss": 2.3997135162353516, "step": 5446 }, { "epoch": 0.25942857142857145, "grad_norm": 0.03128447011113167, "learning_rate": 0.024000000208616257, "loss": 2.4150614738464355, "step": 5448 }, { "epoch": 0.25952380952380955, "grad_norm": 0.03170602768659592, "learning_rate": 0.024000000208616257, "loss": 2.390566349029541, "step": 5450 }, { "epoch": 0.25961904761904764, "grad_norm": 0.031806305050849915, "learning_rate": 0.024000000208616257, "loss": 2.3988583087921143, "step": 5452 }, { "epoch": 0.25971428571428573, "grad_norm": 0.03518638014793396, "learning_rate": 0.024000000208616257, "loss": 2.3945212364196777, "step": 5454 }, { "epoch": 0.2598095238095238, "grad_norm": 0.03182811290025711, "learning_rate": 0.024000000208616257, "loss": 2.3916609287261963, "step": 5456 }, { "epoch": 0.2599047619047619, "grad_norm": 0.029905378818511963, "learning_rate": 0.024000000208616257, "loss": 2.3958840370178223, "step": 5458 }, { "epoch": 0.26, "grad_norm": 0.03145475685596466, "learning_rate": 0.024000000208616257, "loss": 2.4036684036254883, "step": 5460 }, { "epoch": 0.2600952380952381, "grad_norm": 0.031111933290958405, "learning_rate": 0.024000000208616257, "loss": 2.382187843322754, "step": 5462 }, { "epoch": 0.2601904761904762, "grad_norm": 0.03093023970723152, "learning_rate": 0.024000000208616257, "loss": 2.388195037841797, "step": 5464 }, { "epoch": 0.2602857142857143, "grad_norm": 0.03347831591963768, "learning_rate": 0.024000000208616257, "loss": 2.3881871700286865, "step": 5466 }, { "epoch": 0.2603809523809524, "grad_norm": 0.03536050394177437, "learning_rate": 0.024000000208616257, "loss": 2.38173770904541, "step": 5468 }, { "epoch": 0.2604761904761905, "grad_norm": 0.035065703094005585, "learning_rate": 0.024000000208616257, "loss": 2.3804469108581543, "step": 5470 }, { "epoch": 0.26057142857142856, "grad_norm": 0.03124040924012661, "learning_rate": 0.024000000208616257, "loss": 2.3876523971557617, "step": 5472 }, { "epoch": 0.26066666666666666, "grad_norm": 0.030609548091888428, "learning_rate": 0.024000000208616257, "loss": 2.369189739227295, "step": 5474 }, { "epoch": 0.26076190476190475, "grad_norm": 0.031035082414746284, "learning_rate": 0.024000000208616257, "loss": 2.397982120513916, "step": 5476 }, { "epoch": 0.26085714285714284, "grad_norm": 0.030819550156593323, "learning_rate": 0.024000000208616257, "loss": 2.369689702987671, "step": 5478 }, { "epoch": 0.26095238095238094, "grad_norm": 0.02973431535065174, "learning_rate": 0.024000000208616257, "loss": 2.3851356506347656, "step": 5480 }, { "epoch": 0.26104761904761903, "grad_norm": 0.030935391783714294, "learning_rate": 0.024000000208616257, "loss": 2.4049510955810547, "step": 5482 }, { "epoch": 0.2611428571428571, "grad_norm": 0.030150095000863075, "learning_rate": 0.024000000208616257, "loss": 2.392129898071289, "step": 5484 }, { "epoch": 0.2612380952380952, "grad_norm": 0.03226688504219055, "learning_rate": 0.024000000208616257, "loss": 2.39337158203125, "step": 5486 }, { "epoch": 0.2613333333333333, "grad_norm": 0.03114429861307144, "learning_rate": 0.024000000208616257, "loss": 2.3421168327331543, "step": 5488 }, { "epoch": 0.26142857142857145, "grad_norm": 0.03041151724755764, "learning_rate": 0.024000000208616257, "loss": 2.3760592937469482, "step": 5490 }, { "epoch": 0.26152380952380955, "grad_norm": 0.031533583998680115, "learning_rate": 0.024000000208616257, "loss": 2.391040325164795, "step": 5492 }, { "epoch": 0.26161904761904764, "grad_norm": 0.030382411554455757, "learning_rate": 0.024000000208616257, "loss": 2.3917789459228516, "step": 5494 }, { "epoch": 0.26171428571428573, "grad_norm": 0.03187396749854088, "learning_rate": 0.024000000208616257, "loss": 2.364685535430908, "step": 5496 }, { "epoch": 0.2618095238095238, "grad_norm": 0.03608180209994316, "learning_rate": 0.024000000208616257, "loss": 2.38401460647583, "step": 5498 }, { "epoch": 0.2619047619047619, "grad_norm": 0.030125068500638008, "learning_rate": 0.024000000208616257, "loss": 2.3981082439422607, "step": 5500 }, { "epoch": 0.262, "grad_norm": 0.03047472983598709, "learning_rate": 0.024000000208616257, "loss": 2.380566120147705, "step": 5502 }, { "epoch": 0.2620952380952381, "grad_norm": 0.030002737417817116, "learning_rate": 0.024000000208616257, "loss": 2.3586506843566895, "step": 5504 }, { "epoch": 0.2621904761904762, "grad_norm": 0.030061883851885796, "learning_rate": 0.024000000208616257, "loss": 2.3555164337158203, "step": 5506 }, { "epoch": 0.2622857142857143, "grad_norm": 0.03263762965798378, "learning_rate": 0.024000000208616257, "loss": 2.3913028240203857, "step": 5508 }, { "epoch": 0.2623809523809524, "grad_norm": 0.03217017650604248, "learning_rate": 0.024000000208616257, "loss": 2.3252928256988525, "step": 5510 }, { "epoch": 0.2624761904761905, "grad_norm": 0.03119669295847416, "learning_rate": 0.024000000208616257, "loss": 2.3905091285705566, "step": 5512 }, { "epoch": 0.26257142857142857, "grad_norm": 0.031353577971458435, "learning_rate": 0.024000000208616257, "loss": 2.3937129974365234, "step": 5514 }, { "epoch": 0.26266666666666666, "grad_norm": 0.0303814597427845, "learning_rate": 0.024000000208616257, "loss": 2.394263744354248, "step": 5516 }, { "epoch": 0.26276190476190475, "grad_norm": 0.03217311203479767, "learning_rate": 0.024000000208616257, "loss": 2.3815956115722656, "step": 5518 }, { "epoch": 0.26285714285714284, "grad_norm": 0.031240256503224373, "learning_rate": 0.024000000208616257, "loss": 2.343517780303955, "step": 5520 }, { "epoch": 0.26295238095238094, "grad_norm": 0.03436282277107239, "learning_rate": 0.024000000208616257, "loss": 2.402054786682129, "step": 5522 }, { "epoch": 0.26304761904761903, "grad_norm": 0.032754965126514435, "learning_rate": 0.024000000208616257, "loss": 2.366446018218994, "step": 5524 }, { "epoch": 0.2631428571428571, "grad_norm": 0.03386955335736275, "learning_rate": 0.024000000208616257, "loss": 2.37076997756958, "step": 5526 }, { "epoch": 0.2632380952380952, "grad_norm": 0.03378401696681976, "learning_rate": 0.024000000208616257, "loss": 2.370576858520508, "step": 5528 }, { "epoch": 0.2633333333333333, "grad_norm": 0.03179125487804413, "learning_rate": 0.024000000208616257, "loss": 2.3701069355010986, "step": 5530 }, { "epoch": 0.2634285714285714, "grad_norm": 0.030285989865660667, "learning_rate": 0.024000000208616257, "loss": 2.398491859436035, "step": 5532 }, { "epoch": 0.26352380952380955, "grad_norm": 0.03089715912938118, "learning_rate": 0.024000000208616257, "loss": 2.366664409637451, "step": 5534 }, { "epoch": 0.26361904761904764, "grad_norm": 0.03126239776611328, "learning_rate": 0.024000000208616257, "loss": 2.360291004180908, "step": 5536 }, { "epoch": 0.26371428571428573, "grad_norm": 0.029945041984319687, "learning_rate": 0.024000000208616257, "loss": 2.3588266372680664, "step": 5538 }, { "epoch": 0.2638095238095238, "grad_norm": 0.02908904291689396, "learning_rate": 0.024000000208616257, "loss": 2.349623441696167, "step": 5540 }, { "epoch": 0.2639047619047619, "grad_norm": 0.03077501803636551, "learning_rate": 0.024000000208616257, "loss": 2.3620495796203613, "step": 5542 }, { "epoch": 0.264, "grad_norm": 0.03151123970746994, "learning_rate": 0.024000000208616257, "loss": 2.358649730682373, "step": 5544 }, { "epoch": 0.2640952380952381, "grad_norm": 0.029449881985783577, "learning_rate": 0.024000000208616257, "loss": 2.373584032058716, "step": 5546 }, { "epoch": 0.2641904761904762, "grad_norm": 0.03158615902066231, "learning_rate": 0.024000000208616257, "loss": 2.3515772819519043, "step": 5548 }, { "epoch": 0.2642857142857143, "grad_norm": 0.03116215020418167, "learning_rate": 0.024000000208616257, "loss": 2.3411803245544434, "step": 5550 }, { "epoch": 0.2643809523809524, "grad_norm": 0.030420923605561256, "learning_rate": 0.024000000208616257, "loss": 2.3383848667144775, "step": 5552 }, { "epoch": 0.2644761904761905, "grad_norm": 0.030973205342888832, "learning_rate": 0.024000000208616257, "loss": 2.382458209991455, "step": 5554 }, { "epoch": 0.26457142857142857, "grad_norm": 0.0308368019759655, "learning_rate": 0.024000000208616257, "loss": 2.384258270263672, "step": 5556 }, { "epoch": 0.26466666666666666, "grad_norm": 0.0317256785929203, "learning_rate": 0.024000000208616257, "loss": 2.400378704071045, "step": 5558 }, { "epoch": 0.26476190476190475, "grad_norm": 0.03256650269031525, "learning_rate": 0.024000000208616257, "loss": 2.337237596511841, "step": 5560 }, { "epoch": 0.26485714285714285, "grad_norm": 0.03197898343205452, "learning_rate": 0.024000000208616257, "loss": 2.381927251815796, "step": 5562 }, { "epoch": 0.26495238095238094, "grad_norm": 0.03032790496945381, "learning_rate": 0.024000000208616257, "loss": 2.348811149597168, "step": 5564 }, { "epoch": 0.26504761904761903, "grad_norm": 0.031524743884801865, "learning_rate": 0.024000000208616257, "loss": 2.3604493141174316, "step": 5566 }, { "epoch": 0.2651428571428571, "grad_norm": 0.03121861256659031, "learning_rate": 0.024000000208616257, "loss": 2.354872703552246, "step": 5568 }, { "epoch": 0.2652380952380952, "grad_norm": 0.03033018857240677, "learning_rate": 0.024000000208616257, "loss": 2.357921600341797, "step": 5570 }, { "epoch": 0.2653333333333333, "grad_norm": 0.030038518831133842, "learning_rate": 0.024000000208616257, "loss": 2.336320400238037, "step": 5572 }, { "epoch": 0.2654285714285714, "grad_norm": 0.03146941587328911, "learning_rate": 0.024000000208616257, "loss": 2.3681459426879883, "step": 5574 }, { "epoch": 0.26552380952380955, "grad_norm": 0.032695941627025604, "learning_rate": 0.024000000208616257, "loss": 2.3523476123809814, "step": 5576 }, { "epoch": 0.26561904761904764, "grad_norm": 0.02979757823050022, "learning_rate": 0.024000000208616257, "loss": 2.3498802185058594, "step": 5578 }, { "epoch": 0.26571428571428574, "grad_norm": 0.030307264998555183, "learning_rate": 0.024000000208616257, "loss": 2.3460097312927246, "step": 5580 }, { "epoch": 0.26580952380952383, "grad_norm": 0.031003162264823914, "learning_rate": 0.024000000208616257, "loss": 2.3418400287628174, "step": 5582 }, { "epoch": 0.2659047619047619, "grad_norm": 0.030828263610601425, "learning_rate": 0.024000000208616257, "loss": 2.37935209274292, "step": 5584 }, { "epoch": 0.266, "grad_norm": 0.029439439997076988, "learning_rate": 0.024000000208616257, "loss": 2.3601272106170654, "step": 5586 }, { "epoch": 0.2660952380952381, "grad_norm": 0.030675796791911125, "learning_rate": 0.024000000208616257, "loss": 2.376600742340088, "step": 5588 }, { "epoch": 0.2661904761904762, "grad_norm": 0.031092649325728416, "learning_rate": 0.024000000208616257, "loss": 2.3602662086486816, "step": 5590 }, { "epoch": 0.2662857142857143, "grad_norm": 0.03197270631790161, "learning_rate": 0.024000000208616257, "loss": 2.3579111099243164, "step": 5592 }, { "epoch": 0.2663809523809524, "grad_norm": 0.030018623918294907, "learning_rate": 0.024000000208616257, "loss": 2.359997034072876, "step": 5594 }, { "epoch": 0.2664761904761905, "grad_norm": 0.031238991767168045, "learning_rate": 0.024000000208616257, "loss": 2.363828182220459, "step": 5596 }, { "epoch": 0.26657142857142857, "grad_norm": 0.031249355524778366, "learning_rate": 0.024000000208616257, "loss": 2.3664472103118896, "step": 5598 }, { "epoch": 0.26666666666666666, "grad_norm": 0.031046612188220024, "learning_rate": 0.024000000208616257, "loss": 2.3357787132263184, "step": 5600 }, { "epoch": 0.26676190476190476, "grad_norm": 0.03087741881608963, "learning_rate": 0.024000000208616257, "loss": 2.3542094230651855, "step": 5602 }, { "epoch": 0.26685714285714285, "grad_norm": 0.030984893441200256, "learning_rate": 0.024000000208616257, "loss": 2.3543248176574707, "step": 5604 }, { "epoch": 0.26695238095238094, "grad_norm": 0.030332420021295547, "learning_rate": 0.024000000208616257, "loss": 2.3311848640441895, "step": 5606 }, { "epoch": 0.26704761904761903, "grad_norm": 0.0326809398829937, "learning_rate": 0.024000000208616257, "loss": 2.346945285797119, "step": 5608 }, { "epoch": 0.2671428571428571, "grad_norm": 0.03469430282711983, "learning_rate": 0.024000000208616257, "loss": 2.350297451019287, "step": 5610 }, { "epoch": 0.2672380952380952, "grad_norm": 0.03799416124820709, "learning_rate": 0.024000000208616257, "loss": 2.3583927154541016, "step": 5612 }, { "epoch": 0.2673333333333333, "grad_norm": 0.03941074386239052, "learning_rate": 0.024000000208616257, "loss": 2.3362317085266113, "step": 5614 }, { "epoch": 0.2674285714285714, "grad_norm": 0.03505103662610054, "learning_rate": 0.024000000208616257, "loss": 2.3791117668151855, "step": 5616 }, { "epoch": 0.2675238095238095, "grad_norm": 0.032357458025217056, "learning_rate": 0.024000000208616257, "loss": 2.345334529876709, "step": 5618 }, { "epoch": 0.26761904761904765, "grad_norm": 0.03324982896447182, "learning_rate": 0.024000000208616257, "loss": 2.3328990936279297, "step": 5620 }, { "epoch": 0.26771428571428574, "grad_norm": 0.03330742567777634, "learning_rate": 0.024000000208616257, "loss": 2.317239284515381, "step": 5622 }, { "epoch": 0.26780952380952383, "grad_norm": 0.03097325749695301, "learning_rate": 0.024000000208616257, "loss": 2.3282556533813477, "step": 5624 }, { "epoch": 0.2679047619047619, "grad_norm": 0.03345143049955368, "learning_rate": 0.024000000208616257, "loss": 2.350015878677368, "step": 5626 }, { "epoch": 0.268, "grad_norm": 0.031195860356092453, "learning_rate": 0.024000000208616257, "loss": 2.32436466217041, "step": 5628 }, { "epoch": 0.2680952380952381, "grad_norm": 0.031183049082756042, "learning_rate": 0.024000000208616257, "loss": 2.335273504257202, "step": 5630 }, { "epoch": 0.2681904761904762, "grad_norm": 0.03473105654120445, "learning_rate": 0.024000000208616257, "loss": 2.3523812294006348, "step": 5632 }, { "epoch": 0.2682857142857143, "grad_norm": 0.033637866377830505, "learning_rate": 0.024000000208616257, "loss": 2.370361328125, "step": 5634 }, { "epoch": 0.2683809523809524, "grad_norm": 0.0321369394659996, "learning_rate": 0.024000000208616257, "loss": 2.3747334480285645, "step": 5636 }, { "epoch": 0.2684761904761905, "grad_norm": 0.03171514347195625, "learning_rate": 0.024000000208616257, "loss": 2.345963716506958, "step": 5638 }, { "epoch": 0.26857142857142857, "grad_norm": 0.035894837230443954, "learning_rate": 0.024000000208616257, "loss": 2.3880069255828857, "step": 5640 }, { "epoch": 0.26866666666666666, "grad_norm": 0.033222734928131104, "learning_rate": 0.024000000208616257, "loss": 2.350543737411499, "step": 5642 }, { "epoch": 0.26876190476190476, "grad_norm": 0.03295835852622986, "learning_rate": 0.024000000208616257, "loss": 2.3739542961120605, "step": 5644 }, { "epoch": 0.26885714285714285, "grad_norm": 0.03131318837404251, "learning_rate": 0.024000000208616257, "loss": 2.347900867462158, "step": 5646 }, { "epoch": 0.26895238095238094, "grad_norm": 0.030047079548239708, "learning_rate": 0.024000000208616257, "loss": 2.333242416381836, "step": 5648 }, { "epoch": 0.26904761904761904, "grad_norm": 0.03024309128522873, "learning_rate": 0.024000000208616257, "loss": 2.356759548187256, "step": 5650 }, { "epoch": 0.26914285714285713, "grad_norm": 0.029195228591561317, "learning_rate": 0.024000000208616257, "loss": 2.3740644454956055, "step": 5652 }, { "epoch": 0.2692380952380952, "grad_norm": 0.03100462816655636, "learning_rate": 0.024000000208616257, "loss": 2.3597240447998047, "step": 5654 }, { "epoch": 0.2693333333333333, "grad_norm": 0.030258873477578163, "learning_rate": 0.024000000208616257, "loss": 2.3590290546417236, "step": 5656 }, { "epoch": 0.2694285714285714, "grad_norm": 0.029631292447447777, "learning_rate": 0.024000000208616257, "loss": 2.3765764236450195, "step": 5658 }, { "epoch": 0.2695238095238095, "grad_norm": 0.029591379687190056, "learning_rate": 0.024000000208616257, "loss": 2.383760929107666, "step": 5660 }, { "epoch": 0.2696190476190476, "grad_norm": 0.029307687655091286, "learning_rate": 0.024000000208616257, "loss": 2.3615593910217285, "step": 5662 }, { "epoch": 0.26971428571428574, "grad_norm": 0.030834274366497993, "learning_rate": 0.024000000208616257, "loss": 2.323805570602417, "step": 5664 }, { "epoch": 0.26980952380952383, "grad_norm": 0.030637772753834724, "learning_rate": 0.024000000208616257, "loss": 2.38694167137146, "step": 5666 }, { "epoch": 0.2699047619047619, "grad_norm": 0.030719108879566193, "learning_rate": 0.024000000208616257, "loss": 2.370029926300049, "step": 5668 }, { "epoch": 0.27, "grad_norm": 0.03047424927353859, "learning_rate": 0.024000000208616257, "loss": 2.3631162643432617, "step": 5670 }, { "epoch": 0.2700952380952381, "grad_norm": 0.029626766219735146, "learning_rate": 0.024000000208616257, "loss": 2.3667399883270264, "step": 5672 }, { "epoch": 0.2701904761904762, "grad_norm": 0.03091883845627308, "learning_rate": 0.024000000208616257, "loss": 2.352130651473999, "step": 5674 }, { "epoch": 0.2702857142857143, "grad_norm": 0.028811350464820862, "learning_rate": 0.024000000208616257, "loss": 2.3777520656585693, "step": 5676 }, { "epoch": 0.2703809523809524, "grad_norm": 0.029614171013236046, "learning_rate": 0.024000000208616257, "loss": 2.356661319732666, "step": 5678 }, { "epoch": 0.2704761904761905, "grad_norm": 0.030678682029247284, "learning_rate": 0.024000000208616257, "loss": 2.38134503364563, "step": 5680 }, { "epoch": 0.2705714285714286, "grad_norm": 0.03133947774767876, "learning_rate": 0.024000000208616257, "loss": 2.3359451293945312, "step": 5682 }, { "epoch": 0.27066666666666667, "grad_norm": 0.031092673540115356, "learning_rate": 0.024000000208616257, "loss": 2.364501953125, "step": 5684 }, { "epoch": 0.27076190476190476, "grad_norm": 0.03010372817516327, "learning_rate": 0.024000000208616257, "loss": 2.3934712409973145, "step": 5686 }, { "epoch": 0.27085714285714285, "grad_norm": 0.029989907518029213, "learning_rate": 0.024000000208616257, "loss": 2.369211196899414, "step": 5688 }, { "epoch": 0.27095238095238094, "grad_norm": 0.029657233506441116, "learning_rate": 0.024000000208616257, "loss": 2.384408473968506, "step": 5690 }, { "epoch": 0.27104761904761904, "grad_norm": 0.031768783926963806, "learning_rate": 0.024000000208616257, "loss": 2.3514742851257324, "step": 5692 }, { "epoch": 0.27114285714285713, "grad_norm": 0.02888263389468193, "learning_rate": 0.024000000208616257, "loss": 2.3660521507263184, "step": 5694 }, { "epoch": 0.2712380952380952, "grad_norm": 0.03063563071191311, "learning_rate": 0.024000000208616257, "loss": 2.4015254974365234, "step": 5696 }, { "epoch": 0.2713333333333333, "grad_norm": 0.02979939803481102, "learning_rate": 0.024000000208616257, "loss": 2.3679232597351074, "step": 5698 }, { "epoch": 0.2714285714285714, "grad_norm": 0.029716938734054565, "learning_rate": 0.024000000208616257, "loss": 2.3737292289733887, "step": 5700 }, { "epoch": 0.2715238095238095, "grad_norm": 0.02936519682407379, "learning_rate": 0.024000000208616257, "loss": 2.357970952987671, "step": 5702 }, { "epoch": 0.2716190476190476, "grad_norm": 0.03139244392514229, "learning_rate": 0.024000000208616257, "loss": 2.389012575149536, "step": 5704 }, { "epoch": 0.27171428571428574, "grad_norm": 0.030890971422195435, "learning_rate": 0.024000000208616257, "loss": 2.383584976196289, "step": 5706 }, { "epoch": 0.27180952380952383, "grad_norm": 0.030820494517683983, "learning_rate": 0.024000000208616257, "loss": 2.3855247497558594, "step": 5708 }, { "epoch": 0.2719047619047619, "grad_norm": 0.029483675956726074, "learning_rate": 0.024000000208616257, "loss": 2.370877742767334, "step": 5710 }, { "epoch": 0.272, "grad_norm": 0.03058786317706108, "learning_rate": 0.024000000208616257, "loss": 2.3875691890716553, "step": 5712 }, { "epoch": 0.2720952380952381, "grad_norm": 0.029739484190940857, "learning_rate": 0.024000000208616257, "loss": 2.3502001762390137, "step": 5714 }, { "epoch": 0.2721904761904762, "grad_norm": 0.029705015942454338, "learning_rate": 0.024000000208616257, "loss": 2.383249282836914, "step": 5716 }, { "epoch": 0.2722857142857143, "grad_norm": 0.030878661200404167, "learning_rate": 0.024000000208616257, "loss": 2.3641953468322754, "step": 5718 }, { "epoch": 0.2723809523809524, "grad_norm": 0.030482063069939613, "learning_rate": 0.024000000208616257, "loss": 2.386033058166504, "step": 5720 }, { "epoch": 0.2724761904761905, "grad_norm": 0.03032311424612999, "learning_rate": 0.024000000208616257, "loss": 2.3667593002319336, "step": 5722 }, { "epoch": 0.2725714285714286, "grad_norm": 0.03141382336616516, "learning_rate": 0.024000000208616257, "loss": 2.394498348236084, "step": 5724 }, { "epoch": 0.27266666666666667, "grad_norm": 0.031148390844464302, "learning_rate": 0.024000000208616257, "loss": 2.3648557662963867, "step": 5726 }, { "epoch": 0.27276190476190476, "grad_norm": 0.03136315569281578, "learning_rate": 0.024000000208616257, "loss": 2.3882956504821777, "step": 5728 }, { "epoch": 0.27285714285714285, "grad_norm": 0.03153848648071289, "learning_rate": 0.024000000208616257, "loss": 2.4062252044677734, "step": 5730 }, { "epoch": 0.27295238095238095, "grad_norm": 0.03303917124867439, "learning_rate": 0.024000000208616257, "loss": 2.3766307830810547, "step": 5732 }, { "epoch": 0.27304761904761904, "grad_norm": 0.030601607635617256, "learning_rate": 0.024000000208616257, "loss": 2.4215803146362305, "step": 5734 }, { "epoch": 0.27314285714285713, "grad_norm": 0.030997153371572495, "learning_rate": 0.024000000208616257, "loss": 2.4154105186462402, "step": 5736 }, { "epoch": 0.2732380952380952, "grad_norm": 0.03183874487876892, "learning_rate": 0.024000000208616257, "loss": 2.4141149520874023, "step": 5738 }, { "epoch": 0.2733333333333333, "grad_norm": 0.032041873782873154, "learning_rate": 0.024000000208616257, "loss": 2.4305315017700195, "step": 5740 }, { "epoch": 0.2734285714285714, "grad_norm": 0.031616147607564926, "learning_rate": 0.024000000208616257, "loss": 2.3914988040924072, "step": 5742 }, { "epoch": 0.2735238095238095, "grad_norm": 0.031568653881549835, "learning_rate": 0.024000000208616257, "loss": 2.3880224227905273, "step": 5744 }, { "epoch": 0.2736190476190476, "grad_norm": 0.030253177508711815, "learning_rate": 0.024000000208616257, "loss": 2.3706729412078857, "step": 5746 }, { "epoch": 0.2737142857142857, "grad_norm": 0.030606726184487343, "learning_rate": 0.024000000208616257, "loss": 2.3803834915161133, "step": 5748 }, { "epoch": 0.27380952380952384, "grad_norm": 0.028942739591002464, "learning_rate": 0.024000000208616257, "loss": 2.4107675552368164, "step": 5750 }, { "epoch": 0.27390476190476193, "grad_norm": 0.031044071540236473, "learning_rate": 0.024000000208616257, "loss": 2.3632001876831055, "step": 5752 }, { "epoch": 0.274, "grad_norm": 0.03031793422996998, "learning_rate": 0.024000000208616257, "loss": 2.4055025577545166, "step": 5754 }, { "epoch": 0.2740952380952381, "grad_norm": 0.029864395037293434, "learning_rate": 0.024000000208616257, "loss": 2.3842110633850098, "step": 5756 }, { "epoch": 0.2741904761904762, "grad_norm": 0.03216216340661049, "learning_rate": 0.024000000208616257, "loss": 2.4126155376434326, "step": 5758 }, { "epoch": 0.2742857142857143, "grad_norm": 0.030200988054275513, "learning_rate": 0.024000000208616257, "loss": 2.3713507652282715, "step": 5760 }, { "epoch": 0.2743809523809524, "grad_norm": 0.03243393078446388, "learning_rate": 0.024000000208616257, "loss": 2.408329963684082, "step": 5762 }, { "epoch": 0.2744761904761905, "grad_norm": 0.03118664212524891, "learning_rate": 0.024000000208616257, "loss": 2.411752462387085, "step": 5764 }, { "epoch": 0.2745714285714286, "grad_norm": 0.03087531588971615, "learning_rate": 0.024000000208616257, "loss": 2.4026360511779785, "step": 5766 }, { "epoch": 0.27466666666666667, "grad_norm": 0.030484450981020927, "learning_rate": 0.024000000208616257, "loss": 2.407597541809082, "step": 5768 }, { "epoch": 0.27476190476190476, "grad_norm": 0.029965482652187347, "learning_rate": 0.024000000208616257, "loss": 2.39113187789917, "step": 5770 }, { "epoch": 0.27485714285714286, "grad_norm": 0.029695620760321617, "learning_rate": 0.024000000208616257, "loss": 2.4156126976013184, "step": 5772 }, { "epoch": 0.27495238095238095, "grad_norm": 0.02998894266784191, "learning_rate": 0.024000000208616257, "loss": 2.3926312923431396, "step": 5774 }, { "epoch": 0.27504761904761904, "grad_norm": 0.030583802610635757, "learning_rate": 0.024000000208616257, "loss": 2.3898768424987793, "step": 5776 }, { "epoch": 0.27514285714285713, "grad_norm": 0.029758738353848457, "learning_rate": 0.024000000208616257, "loss": 2.4197874069213867, "step": 5778 }, { "epoch": 0.2752380952380952, "grad_norm": 0.030063819140195847, "learning_rate": 0.024000000208616257, "loss": 2.4245834350585938, "step": 5780 }, { "epoch": 0.2753333333333333, "grad_norm": 0.036366213113069534, "learning_rate": 0.024000000208616257, "loss": 2.3916614055633545, "step": 5782 }, { "epoch": 0.2754285714285714, "grad_norm": 0.029278889298439026, "learning_rate": 0.024000000208616257, "loss": 2.4042398929595947, "step": 5784 }, { "epoch": 0.2755238095238095, "grad_norm": 0.02976561151444912, "learning_rate": 0.024000000208616257, "loss": 2.4256763458251953, "step": 5786 }, { "epoch": 0.2756190476190476, "grad_norm": 0.029811810702085495, "learning_rate": 0.024000000208616257, "loss": 2.428471088409424, "step": 5788 }, { "epoch": 0.2757142857142857, "grad_norm": 0.029828064143657684, "learning_rate": 0.024000000208616257, "loss": 2.400719404220581, "step": 5790 }, { "epoch": 0.2758095238095238, "grad_norm": 0.0323733426630497, "learning_rate": 0.024000000208616257, "loss": 2.4038443565368652, "step": 5792 }, { "epoch": 0.27590476190476193, "grad_norm": 0.030476409941911697, "learning_rate": 0.024000000208616257, "loss": 2.4149794578552246, "step": 5794 }, { "epoch": 0.276, "grad_norm": 0.02959195151925087, "learning_rate": 0.024000000208616257, "loss": 2.391429901123047, "step": 5796 }, { "epoch": 0.2760952380952381, "grad_norm": 0.058632317930459976, "learning_rate": 0.024000000208616257, "loss": 2.4086430072784424, "step": 5798 }, { "epoch": 0.2761904761904762, "grad_norm": 0.0296334158629179, "learning_rate": 0.024000000208616257, "loss": 2.422232151031494, "step": 5800 }, { "epoch": 0.2762857142857143, "grad_norm": 0.030686156824231148, "learning_rate": 0.024000000208616257, "loss": 2.4156665802001953, "step": 5802 }, { "epoch": 0.2763809523809524, "grad_norm": 0.03082870878279209, "learning_rate": 0.024000000208616257, "loss": 2.4272632598876953, "step": 5804 }, { "epoch": 0.2764761904761905, "grad_norm": 0.031824421137571335, "learning_rate": 0.024000000208616257, "loss": 2.407200574874878, "step": 5806 }, { "epoch": 0.2765714285714286, "grad_norm": 0.03195144608616829, "learning_rate": 0.024000000208616257, "loss": 2.426790237426758, "step": 5808 }, { "epoch": 0.27666666666666667, "grad_norm": 0.029865527525544167, "learning_rate": 0.024000000208616257, "loss": 2.4093780517578125, "step": 5810 }, { "epoch": 0.27676190476190476, "grad_norm": 0.03131138160824776, "learning_rate": 0.024000000208616257, "loss": 2.3871772289276123, "step": 5812 }, { "epoch": 0.27685714285714286, "grad_norm": 0.030682815238833427, "learning_rate": 0.024000000208616257, "loss": 2.434083938598633, "step": 5814 }, { "epoch": 0.27695238095238095, "grad_norm": 0.029853370040655136, "learning_rate": 0.024000000208616257, "loss": 2.4320850372314453, "step": 5816 }, { "epoch": 0.27704761904761904, "grad_norm": 0.029118241742253304, "learning_rate": 0.024000000208616257, "loss": 2.4554178714752197, "step": 5818 }, { "epoch": 0.27714285714285714, "grad_norm": 0.030012013390660286, "learning_rate": 0.024000000208616257, "loss": 2.416299343109131, "step": 5820 }, { "epoch": 0.27723809523809523, "grad_norm": 0.030942445620894432, "learning_rate": 0.024000000208616257, "loss": 2.4044718742370605, "step": 5822 }, { "epoch": 0.2773333333333333, "grad_norm": 0.03235562518239021, "learning_rate": 0.024000000208616257, "loss": 2.3971140384674072, "step": 5824 }, { "epoch": 0.2774285714285714, "grad_norm": 0.029301339760422707, "learning_rate": 0.024000000208616257, "loss": 2.4264016151428223, "step": 5826 }, { "epoch": 0.2775238095238095, "grad_norm": 0.02982015162706375, "learning_rate": 0.024000000208616257, "loss": 2.3821322917938232, "step": 5828 }, { "epoch": 0.2776190476190476, "grad_norm": 0.029927169904112816, "learning_rate": 0.024000000208616257, "loss": 2.4009532928466797, "step": 5830 }, { "epoch": 0.2777142857142857, "grad_norm": 0.030418438836932182, "learning_rate": 0.024000000208616257, "loss": 2.4005284309387207, "step": 5832 }, { "epoch": 0.2778095238095238, "grad_norm": 0.030684638768434525, "learning_rate": 0.024000000208616257, "loss": 2.414228916168213, "step": 5834 }, { "epoch": 0.27790476190476193, "grad_norm": 0.03265624865889549, "learning_rate": 0.024000000208616257, "loss": 2.433143377304077, "step": 5836 }, { "epoch": 0.278, "grad_norm": 0.03039715625345707, "learning_rate": 0.024000000208616257, "loss": 2.396028995513916, "step": 5838 }, { "epoch": 0.2780952380952381, "grad_norm": 0.03147202730178833, "learning_rate": 0.024000000208616257, "loss": 2.4114882946014404, "step": 5840 }, { "epoch": 0.2781904761904762, "grad_norm": 0.03060498647391796, "learning_rate": 0.024000000208616257, "loss": 2.4203648567199707, "step": 5842 }, { "epoch": 0.2782857142857143, "grad_norm": 0.03036491386592388, "learning_rate": 0.024000000208616257, "loss": 2.411343574523926, "step": 5844 }, { "epoch": 0.2783809523809524, "grad_norm": 0.030922388657927513, "learning_rate": 0.024000000208616257, "loss": 2.4372682571411133, "step": 5846 }, { "epoch": 0.2784761904761905, "grad_norm": 0.030658042058348656, "learning_rate": 0.024000000208616257, "loss": 2.4245033264160156, "step": 5848 }, { "epoch": 0.2785714285714286, "grad_norm": 0.030271856114268303, "learning_rate": 0.024000000208616257, "loss": 2.4290285110473633, "step": 5850 }, { "epoch": 0.2786666666666667, "grad_norm": 0.0326555073261261, "learning_rate": 0.024000000208616257, "loss": 2.4156975746154785, "step": 5852 }, { "epoch": 0.27876190476190477, "grad_norm": 0.032148003578186035, "learning_rate": 0.024000000208616257, "loss": 2.4301958084106445, "step": 5854 }, { "epoch": 0.27885714285714286, "grad_norm": 0.030641939491033554, "learning_rate": 0.024000000208616257, "loss": 2.4277498722076416, "step": 5856 }, { "epoch": 0.27895238095238095, "grad_norm": 0.03276839479804039, "learning_rate": 0.024000000208616257, "loss": 2.396897315979004, "step": 5858 }, { "epoch": 0.27904761904761904, "grad_norm": 0.030939828604459763, "learning_rate": 0.024000000208616257, "loss": 2.4265904426574707, "step": 5860 }, { "epoch": 0.27914285714285714, "grad_norm": 0.03142239525914192, "learning_rate": 0.024000000208616257, "loss": 2.4034807682037354, "step": 5862 }, { "epoch": 0.27923809523809523, "grad_norm": 0.030514512211084366, "learning_rate": 0.024000000208616257, "loss": 2.422686815261841, "step": 5864 }, { "epoch": 0.2793333333333333, "grad_norm": 0.03158054128289223, "learning_rate": 0.024000000208616257, "loss": 2.4423422813415527, "step": 5866 }, { "epoch": 0.2794285714285714, "grad_norm": 0.0318450964987278, "learning_rate": 0.024000000208616257, "loss": 2.4191980361938477, "step": 5868 }, { "epoch": 0.2795238095238095, "grad_norm": 0.03094335086643696, "learning_rate": 0.024000000208616257, "loss": 2.3904128074645996, "step": 5870 }, { "epoch": 0.2796190476190476, "grad_norm": 0.030817558988928795, "learning_rate": 0.024000000208616257, "loss": 2.407219886779785, "step": 5872 }, { "epoch": 0.2797142857142857, "grad_norm": 0.030856719240546227, "learning_rate": 0.024000000208616257, "loss": 2.4635071754455566, "step": 5874 }, { "epoch": 0.2798095238095238, "grad_norm": 0.030706841498613358, "learning_rate": 0.024000000208616257, "loss": 2.422023296356201, "step": 5876 }, { "epoch": 0.2799047619047619, "grad_norm": 0.030507419258356094, "learning_rate": 0.024000000208616257, "loss": 2.434332847595215, "step": 5878 }, { "epoch": 0.28, "grad_norm": 0.0305364690721035, "learning_rate": 0.024000000208616257, "loss": 2.4260849952697754, "step": 5880 }, { "epoch": 0.2800952380952381, "grad_norm": 0.030062181875109673, "learning_rate": 0.024000000208616257, "loss": 2.443648338317871, "step": 5882 }, { "epoch": 0.2801904761904762, "grad_norm": 0.030890069901943207, "learning_rate": 0.024000000208616257, "loss": 2.4268362522125244, "step": 5884 }, { "epoch": 0.2802857142857143, "grad_norm": 0.030952278524637222, "learning_rate": 0.024000000208616257, "loss": 2.4190869331359863, "step": 5886 }, { "epoch": 0.2803809523809524, "grad_norm": 0.03146212920546532, "learning_rate": 0.024000000208616257, "loss": 2.415541887283325, "step": 5888 }, { "epoch": 0.2804761904761905, "grad_norm": 0.033116914331912994, "learning_rate": 0.024000000208616257, "loss": 2.4002814292907715, "step": 5890 }, { "epoch": 0.2805714285714286, "grad_norm": 0.02966638281941414, "learning_rate": 0.024000000208616257, "loss": 2.4321484565734863, "step": 5892 }, { "epoch": 0.2806666666666667, "grad_norm": 0.030536027625203133, "learning_rate": 0.024000000208616257, "loss": 2.432981014251709, "step": 5894 }, { "epoch": 0.28076190476190477, "grad_norm": 0.030000286176800728, "learning_rate": 0.024000000208616257, "loss": 2.462693452835083, "step": 5896 }, { "epoch": 0.28085714285714286, "grad_norm": 0.03132905066013336, "learning_rate": 0.024000000208616257, "loss": 2.44435715675354, "step": 5898 }, { "epoch": 0.28095238095238095, "grad_norm": 0.03006170690059662, "learning_rate": 0.024000000208616257, "loss": 2.408829689025879, "step": 5900 }, { "epoch": 0.28104761904761905, "grad_norm": 0.042367253452539444, "learning_rate": 0.024000000208616257, "loss": 2.442535400390625, "step": 5902 }, { "epoch": 0.28114285714285714, "grad_norm": 0.02926708571612835, "learning_rate": 0.024000000208616257, "loss": 2.448160171508789, "step": 5904 }, { "epoch": 0.28123809523809523, "grad_norm": 0.02941136620938778, "learning_rate": 0.024000000208616257, "loss": 2.438758373260498, "step": 5906 }, { "epoch": 0.2813333333333333, "grad_norm": 0.030222484841942787, "learning_rate": 0.024000000208616257, "loss": 2.453409194946289, "step": 5908 }, { "epoch": 0.2814285714285714, "grad_norm": 0.03157392516732216, "learning_rate": 0.024000000208616257, "loss": 2.4113287925720215, "step": 5910 }, { "epoch": 0.2815238095238095, "grad_norm": 0.030759355053305626, "learning_rate": 0.024000000208616257, "loss": 2.4548630714416504, "step": 5912 }, { "epoch": 0.2816190476190476, "grad_norm": 0.03189796209335327, "learning_rate": 0.024000000208616257, "loss": 2.4435319900512695, "step": 5914 }, { "epoch": 0.2817142857142857, "grad_norm": 0.030552860349416733, "learning_rate": 0.024000000208616257, "loss": 2.4451098442077637, "step": 5916 }, { "epoch": 0.2818095238095238, "grad_norm": 0.03157641738653183, "learning_rate": 0.024000000208616257, "loss": 2.4091122150421143, "step": 5918 }, { "epoch": 0.2819047619047619, "grad_norm": 0.030215976759791374, "learning_rate": 0.024000000208616257, "loss": 2.455050230026245, "step": 5920 }, { "epoch": 0.282, "grad_norm": 0.030391469597816467, "learning_rate": 0.024000000208616257, "loss": 2.465106964111328, "step": 5922 }, { "epoch": 0.2820952380952381, "grad_norm": 0.030669523403048515, "learning_rate": 0.024000000208616257, "loss": 2.42185115814209, "step": 5924 }, { "epoch": 0.2821904761904762, "grad_norm": 0.031293995678424835, "learning_rate": 0.024000000208616257, "loss": 2.4440572261810303, "step": 5926 }, { "epoch": 0.2822857142857143, "grad_norm": 0.03026038408279419, "learning_rate": 0.024000000208616257, "loss": 2.4374523162841797, "step": 5928 }, { "epoch": 0.2823809523809524, "grad_norm": 0.03130428120493889, "learning_rate": 0.024000000208616257, "loss": 2.4716503620147705, "step": 5930 }, { "epoch": 0.2824761904761905, "grad_norm": 0.03031715378165245, "learning_rate": 0.024000000208616257, "loss": 2.4383721351623535, "step": 5932 }, { "epoch": 0.2825714285714286, "grad_norm": 0.02880058065056801, "learning_rate": 0.024000000208616257, "loss": 2.437473773956299, "step": 5934 }, { "epoch": 0.2826666666666667, "grad_norm": 0.029868222773075104, "learning_rate": 0.024000000208616257, "loss": 2.4578170776367188, "step": 5936 }, { "epoch": 0.28276190476190477, "grad_norm": 0.02971893921494484, "learning_rate": 0.024000000208616257, "loss": 2.4463019371032715, "step": 5938 }, { "epoch": 0.28285714285714286, "grad_norm": 0.03051190823316574, "learning_rate": 0.024000000208616257, "loss": 2.4293582439422607, "step": 5940 }, { "epoch": 0.28295238095238096, "grad_norm": 0.030507436022162437, "learning_rate": 0.024000000208616257, "loss": 2.422360897064209, "step": 5942 }, { "epoch": 0.28304761904761905, "grad_norm": 0.03896540775895119, "learning_rate": 0.024000000208616257, "loss": 2.4102280139923096, "step": 5944 }, { "epoch": 0.28314285714285714, "grad_norm": 0.030348259955644608, "learning_rate": 0.024000000208616257, "loss": 2.4459686279296875, "step": 5946 }, { "epoch": 0.28323809523809523, "grad_norm": 0.03088482841849327, "learning_rate": 0.024000000208616257, "loss": 2.459184169769287, "step": 5948 }, { "epoch": 0.2833333333333333, "grad_norm": 0.03666742518544197, "learning_rate": 0.024000000208616257, "loss": 2.4459586143493652, "step": 5950 }, { "epoch": 0.2834285714285714, "grad_norm": 0.0362592376768589, "learning_rate": 0.024000000208616257, "loss": 2.457650899887085, "step": 5952 }, { "epoch": 0.2835238095238095, "grad_norm": 0.0316927470266819, "learning_rate": 0.024000000208616257, "loss": 2.414156913757324, "step": 5954 }, { "epoch": 0.2836190476190476, "grad_norm": 0.030011707916855812, "learning_rate": 0.024000000208616257, "loss": 2.45534086227417, "step": 5956 }, { "epoch": 0.2837142857142857, "grad_norm": 0.03207464516162872, "learning_rate": 0.024000000208616257, "loss": 2.41400408744812, "step": 5958 }, { "epoch": 0.2838095238095238, "grad_norm": 0.031174369156360626, "learning_rate": 0.024000000208616257, "loss": 2.4285173416137695, "step": 5960 }, { "epoch": 0.2839047619047619, "grad_norm": 0.03004782274365425, "learning_rate": 0.024000000208616257, "loss": 2.4439992904663086, "step": 5962 }, { "epoch": 0.284, "grad_norm": 0.030384056270122528, "learning_rate": 0.024000000208616257, "loss": 2.467072010040283, "step": 5964 }, { "epoch": 0.2840952380952381, "grad_norm": 0.029556630179286003, "learning_rate": 0.024000000208616257, "loss": 2.4379634857177734, "step": 5966 }, { "epoch": 0.2841904761904762, "grad_norm": 0.029750768095254898, "learning_rate": 0.024000000208616257, "loss": 2.418501377105713, "step": 5968 }, { "epoch": 0.2842857142857143, "grad_norm": 0.030030805617570877, "learning_rate": 0.024000000208616257, "loss": 2.4351024627685547, "step": 5970 }, { "epoch": 0.2843809523809524, "grad_norm": 0.03052358143031597, "learning_rate": 0.024000000208616257, "loss": 2.462615966796875, "step": 5972 }, { "epoch": 0.2844761904761905, "grad_norm": 0.0323866605758667, "learning_rate": 0.024000000208616257, "loss": 2.4661035537719727, "step": 5974 }, { "epoch": 0.2845714285714286, "grad_norm": 0.036895908415317535, "learning_rate": 0.024000000208616257, "loss": 2.4586734771728516, "step": 5976 }, { "epoch": 0.2846666666666667, "grad_norm": 0.03144415467977524, "learning_rate": 0.024000000208616257, "loss": 2.4502320289611816, "step": 5978 }, { "epoch": 0.28476190476190477, "grad_norm": 0.03169401362538338, "learning_rate": 0.024000000208616257, "loss": 2.444697380065918, "step": 5980 }, { "epoch": 0.28485714285714286, "grad_norm": 0.032523639500141144, "learning_rate": 0.024000000208616257, "loss": 2.434568405151367, "step": 5982 }, { "epoch": 0.28495238095238096, "grad_norm": 0.03473818674683571, "learning_rate": 0.024000000208616257, "loss": 2.4619975090026855, "step": 5984 }, { "epoch": 0.28504761904761905, "grad_norm": 0.03704117611050606, "learning_rate": 0.024000000208616257, "loss": 2.436497211456299, "step": 5986 }, { "epoch": 0.28514285714285714, "grad_norm": 0.03641713038086891, "learning_rate": 0.024000000208616257, "loss": 2.4565939903259277, "step": 5988 }, { "epoch": 0.28523809523809524, "grad_norm": 0.029314879328012466, "learning_rate": 0.024000000208616257, "loss": 2.4084320068359375, "step": 5990 }, { "epoch": 0.2853333333333333, "grad_norm": 0.033886510878801346, "learning_rate": 0.024000000208616257, "loss": 2.450089931488037, "step": 5992 }, { "epoch": 0.2854285714285714, "grad_norm": 0.03232895955443382, "learning_rate": 0.024000000208616257, "loss": 2.4570064544677734, "step": 5994 }, { "epoch": 0.2855238095238095, "grad_norm": 0.029789892956614494, "learning_rate": 0.024000000208616257, "loss": 2.4474434852600098, "step": 5996 }, { "epoch": 0.2856190476190476, "grad_norm": 0.029370378702878952, "learning_rate": 0.024000000208616257, "loss": 2.4588401317596436, "step": 5998 }, { "epoch": 0.2857142857142857, "grad_norm": 0.02948187105357647, "learning_rate": 0.024000000208616257, "loss": 2.442338466644287, "step": 6000 }, { "epoch": 0.2858095238095238, "grad_norm": 0.028529956936836243, "learning_rate": 0.024000000208616257, "loss": 2.4520909786224365, "step": 6002 }, { "epoch": 0.2859047619047619, "grad_norm": 0.02919137477874756, "learning_rate": 0.024000000208616257, "loss": 2.428828716278076, "step": 6004 }, { "epoch": 0.286, "grad_norm": 0.030001148581504822, "learning_rate": 0.024000000208616257, "loss": 2.4451889991760254, "step": 6006 }, { "epoch": 0.28609523809523807, "grad_norm": 0.031731296330690384, "learning_rate": 0.024000000208616257, "loss": 2.4798943996429443, "step": 6008 }, { "epoch": 0.2861904761904762, "grad_norm": 0.033025581389665604, "learning_rate": 0.024000000208616257, "loss": 2.4376304149627686, "step": 6010 }, { "epoch": 0.2862857142857143, "grad_norm": 0.03402454033493996, "learning_rate": 0.024000000208616257, "loss": 2.4606308937072754, "step": 6012 }, { "epoch": 0.2863809523809524, "grad_norm": 0.03207368031144142, "learning_rate": 0.024000000208616257, "loss": 2.4566006660461426, "step": 6014 }, { "epoch": 0.2864761904761905, "grad_norm": 0.03041372261941433, "learning_rate": 0.024000000208616257, "loss": 2.402761459350586, "step": 6016 }, { "epoch": 0.2865714285714286, "grad_norm": 0.029119379818439484, "learning_rate": 0.024000000208616257, "loss": 2.4449515342712402, "step": 6018 }, { "epoch": 0.2866666666666667, "grad_norm": 0.029493533074855804, "learning_rate": 0.024000000208616257, "loss": 2.4315128326416016, "step": 6020 }, { "epoch": 0.2867619047619048, "grad_norm": 0.03053133375942707, "learning_rate": 0.024000000208616257, "loss": 2.442108631134033, "step": 6022 }, { "epoch": 0.28685714285714287, "grad_norm": 0.03064528852701187, "learning_rate": 0.024000000208616257, "loss": 2.4401040077209473, "step": 6024 }, { "epoch": 0.28695238095238096, "grad_norm": 0.03047105297446251, "learning_rate": 0.024000000208616257, "loss": 2.445969343185425, "step": 6026 }, { "epoch": 0.28704761904761905, "grad_norm": 0.030832571908831596, "learning_rate": 0.024000000208616257, "loss": 2.442370891571045, "step": 6028 }, { "epoch": 0.28714285714285714, "grad_norm": 0.02906797267496586, "learning_rate": 0.024000000208616257, "loss": 2.429640769958496, "step": 6030 }, { "epoch": 0.28723809523809524, "grad_norm": 0.030353711917996407, "learning_rate": 0.024000000208616257, "loss": 2.4413981437683105, "step": 6032 }, { "epoch": 0.28733333333333333, "grad_norm": 0.029831325635313988, "learning_rate": 0.024000000208616257, "loss": 2.4416310787200928, "step": 6034 }, { "epoch": 0.2874285714285714, "grad_norm": 0.03156975284218788, "learning_rate": 0.024000000208616257, "loss": 2.4126768112182617, "step": 6036 }, { "epoch": 0.2875238095238095, "grad_norm": 0.031732089817523956, "learning_rate": 0.024000000208616257, "loss": 2.435192108154297, "step": 6038 }, { "epoch": 0.2876190476190476, "grad_norm": 0.0311430636793375, "learning_rate": 0.024000000208616257, "loss": 2.419882297515869, "step": 6040 }, { "epoch": 0.2877142857142857, "grad_norm": 0.030729148536920547, "learning_rate": 0.024000000208616257, "loss": 2.4247310161590576, "step": 6042 }, { "epoch": 0.2878095238095238, "grad_norm": 0.02981674298644066, "learning_rate": 0.024000000208616257, "loss": 2.476203441619873, "step": 6044 }, { "epoch": 0.2879047619047619, "grad_norm": 0.030511224642395973, "learning_rate": 0.024000000208616257, "loss": 2.411952495574951, "step": 6046 }, { "epoch": 0.288, "grad_norm": 0.030743755400180817, "learning_rate": 0.024000000208616257, "loss": 2.43540358543396, "step": 6048 }, { "epoch": 0.28809523809523807, "grad_norm": 0.030877428129315376, "learning_rate": 0.024000000208616257, "loss": 2.4507858753204346, "step": 6050 }, { "epoch": 0.28819047619047616, "grad_norm": 0.03416414558887482, "learning_rate": 0.024000000208616257, "loss": 2.4343767166137695, "step": 6052 }, { "epoch": 0.2882857142857143, "grad_norm": 0.031241370365023613, "learning_rate": 0.024000000208616257, "loss": 2.4218082427978516, "step": 6054 }, { "epoch": 0.2883809523809524, "grad_norm": 0.032552652060985565, "learning_rate": 0.024000000208616257, "loss": 2.4002015590667725, "step": 6056 }, { "epoch": 0.2884761904761905, "grad_norm": 0.031226124614477158, "learning_rate": 0.024000000208616257, "loss": 2.4340744018554688, "step": 6058 }, { "epoch": 0.2885714285714286, "grad_norm": 0.03198246657848358, "learning_rate": 0.024000000208616257, "loss": 2.421462297439575, "step": 6060 }, { "epoch": 0.2886666666666667, "grad_norm": 0.03484688699245453, "learning_rate": 0.024000000208616257, "loss": 2.4347500801086426, "step": 6062 }, { "epoch": 0.2887619047619048, "grad_norm": 0.032333992421627045, "learning_rate": 0.024000000208616257, "loss": 2.4126620292663574, "step": 6064 }, { "epoch": 0.28885714285714287, "grad_norm": 0.03032061643898487, "learning_rate": 0.024000000208616257, "loss": 2.432344913482666, "step": 6066 }, { "epoch": 0.28895238095238096, "grad_norm": 0.033521492034196854, "learning_rate": 0.024000000208616257, "loss": 2.409395694732666, "step": 6068 }, { "epoch": 0.28904761904761905, "grad_norm": 0.03254038840532303, "learning_rate": 0.024000000208616257, "loss": 2.428349494934082, "step": 6070 }, { "epoch": 0.28914285714285715, "grad_norm": 0.034831512719392776, "learning_rate": 0.024000000208616257, "loss": 2.4277501106262207, "step": 6072 }, { "epoch": 0.28923809523809524, "grad_norm": 0.030766239389777184, "learning_rate": 0.024000000208616257, "loss": 2.44272518157959, "step": 6074 }, { "epoch": 0.28933333333333333, "grad_norm": 0.029845865443348885, "learning_rate": 0.024000000208616257, "loss": 2.4152283668518066, "step": 6076 }, { "epoch": 0.2894285714285714, "grad_norm": 0.029288778081536293, "learning_rate": 0.024000000208616257, "loss": 2.4004945755004883, "step": 6078 }, { "epoch": 0.2895238095238095, "grad_norm": 0.03152845799922943, "learning_rate": 0.024000000208616257, "loss": 2.41096830368042, "step": 6080 }, { "epoch": 0.2896190476190476, "grad_norm": 0.030044732615351677, "learning_rate": 0.024000000208616257, "loss": 2.414048671722412, "step": 6082 }, { "epoch": 0.2897142857142857, "grad_norm": 0.03080243244767189, "learning_rate": 0.024000000208616257, "loss": 2.390315055847168, "step": 6084 }, { "epoch": 0.2898095238095238, "grad_norm": 0.030726013705134392, "learning_rate": 0.024000000208616257, "loss": 2.4305622577667236, "step": 6086 }, { "epoch": 0.2899047619047619, "grad_norm": 0.029803413897752762, "learning_rate": 0.024000000208616257, "loss": 2.410399913787842, "step": 6088 }, { "epoch": 0.29, "grad_norm": 0.030176175758242607, "learning_rate": 0.024000000208616257, "loss": 2.425286293029785, "step": 6090 }, { "epoch": 0.2900952380952381, "grad_norm": 0.029367558658123016, "learning_rate": 0.024000000208616257, "loss": 2.4391725063323975, "step": 6092 }, { "epoch": 0.29019047619047617, "grad_norm": 0.029218891635537148, "learning_rate": 0.024000000208616257, "loss": 2.4036412239074707, "step": 6094 }, { "epoch": 0.29028571428571426, "grad_norm": 0.031588565558195114, "learning_rate": 0.024000000208616257, "loss": 2.4270992279052734, "step": 6096 }, { "epoch": 0.2903809523809524, "grad_norm": 0.03142644837498665, "learning_rate": 0.024000000208616257, "loss": 2.415203094482422, "step": 6098 }, { "epoch": 0.2904761904761905, "grad_norm": 0.03253505006432533, "learning_rate": 0.024000000208616257, "loss": 2.4203741550445557, "step": 6100 }, { "epoch": 0.2905714285714286, "grad_norm": 0.030857732519507408, "learning_rate": 0.024000000208616257, "loss": 2.390652656555176, "step": 6102 }, { "epoch": 0.2906666666666667, "grad_norm": 0.030531033873558044, "learning_rate": 0.024000000208616257, "loss": 2.408663272857666, "step": 6104 }, { "epoch": 0.2907619047619048, "grad_norm": 0.030398381873965263, "learning_rate": 0.024000000208616257, "loss": 2.399930000305176, "step": 6106 }, { "epoch": 0.29085714285714287, "grad_norm": 0.03529582917690277, "learning_rate": 0.024000000208616257, "loss": 2.4278907775878906, "step": 6108 }, { "epoch": 0.29095238095238096, "grad_norm": 0.03846205025911331, "learning_rate": 0.024000000208616257, "loss": 2.4219956398010254, "step": 6110 }, { "epoch": 0.29104761904761905, "grad_norm": 0.032568562775850296, "learning_rate": 0.024000000208616257, "loss": 2.4198341369628906, "step": 6112 }, { "epoch": 0.29114285714285715, "grad_norm": 0.03220415860414505, "learning_rate": 0.024000000208616257, "loss": 2.4088635444641113, "step": 6114 }, { "epoch": 0.29123809523809524, "grad_norm": 0.030578719452023506, "learning_rate": 0.024000000208616257, "loss": 2.432494640350342, "step": 6116 }, { "epoch": 0.29133333333333333, "grad_norm": 0.02890986204147339, "learning_rate": 0.024000000208616257, "loss": 2.392268657684326, "step": 6118 }, { "epoch": 0.2914285714285714, "grad_norm": 0.029330482706427574, "learning_rate": 0.024000000208616257, "loss": 2.392806053161621, "step": 6120 }, { "epoch": 0.2915238095238095, "grad_norm": 0.029655836522579193, "learning_rate": 0.024000000208616257, "loss": 2.4184155464172363, "step": 6122 }, { "epoch": 0.2916190476190476, "grad_norm": 0.028696781024336815, "learning_rate": 0.024000000208616257, "loss": 2.438741683959961, "step": 6124 }, { "epoch": 0.2917142857142857, "grad_norm": 0.028648799285292625, "learning_rate": 0.024000000208616257, "loss": 2.43717885017395, "step": 6126 }, { "epoch": 0.2918095238095238, "grad_norm": 0.029009662568569183, "learning_rate": 0.024000000208616257, "loss": 2.387840747833252, "step": 6128 }, { "epoch": 0.2919047619047619, "grad_norm": 0.030119992792606354, "learning_rate": 0.024000000208616257, "loss": 2.4254977703094482, "step": 6130 }, { "epoch": 0.292, "grad_norm": 0.030130447819828987, "learning_rate": 0.024000000208616257, "loss": 2.413989305496216, "step": 6132 }, { "epoch": 0.2920952380952381, "grad_norm": 0.02928055077791214, "learning_rate": 0.024000000208616257, "loss": 2.398425579071045, "step": 6134 }, { "epoch": 0.29219047619047617, "grad_norm": 0.028877263888716698, "learning_rate": 0.024000000208616257, "loss": 2.396592378616333, "step": 6136 }, { "epoch": 0.29228571428571426, "grad_norm": 0.030785128474235535, "learning_rate": 0.024000000208616257, "loss": 2.3794426918029785, "step": 6138 }, { "epoch": 0.2923809523809524, "grad_norm": 0.03520051762461662, "learning_rate": 0.024000000208616257, "loss": 2.3855576515197754, "step": 6140 }, { "epoch": 0.2924761904761905, "grad_norm": 0.030070243403315544, "learning_rate": 0.024000000208616257, "loss": 2.4246721267700195, "step": 6142 }, { "epoch": 0.2925714285714286, "grad_norm": 0.03379165381193161, "learning_rate": 0.024000000208616257, "loss": 2.408130407333374, "step": 6144 }, { "epoch": 0.2926666666666667, "grad_norm": 0.030511919409036636, "learning_rate": 0.024000000208616257, "loss": 2.4117136001586914, "step": 6146 }, { "epoch": 0.2927619047619048, "grad_norm": 0.03049665316939354, "learning_rate": 0.024000000208616257, "loss": 2.400404453277588, "step": 6148 }, { "epoch": 0.29285714285714287, "grad_norm": 0.02921309694647789, "learning_rate": 0.024000000208616257, "loss": 2.3985371589660645, "step": 6150 }, { "epoch": 0.29295238095238096, "grad_norm": 0.030633147805929184, "learning_rate": 0.024000000208616257, "loss": 2.413053512573242, "step": 6152 }, { "epoch": 0.29304761904761906, "grad_norm": 0.02924421802163124, "learning_rate": 0.024000000208616257, "loss": 2.398658514022827, "step": 6154 }, { "epoch": 0.29314285714285715, "grad_norm": 0.028627166524529457, "learning_rate": 0.024000000208616257, "loss": 2.418416976928711, "step": 6156 }, { "epoch": 0.29323809523809524, "grad_norm": 0.029889678582549095, "learning_rate": 0.024000000208616257, "loss": 2.404519557952881, "step": 6158 }, { "epoch": 0.29333333333333333, "grad_norm": 0.02967916801571846, "learning_rate": 0.024000000208616257, "loss": 2.420391798019409, "step": 6160 }, { "epoch": 0.2934285714285714, "grad_norm": 0.03018069639801979, "learning_rate": 0.024000000208616257, "loss": 2.404752254486084, "step": 6162 }, { "epoch": 0.2935238095238095, "grad_norm": 0.031207526102662086, "learning_rate": 0.024000000208616257, "loss": 2.3971452713012695, "step": 6164 }, { "epoch": 0.2936190476190476, "grad_norm": 0.029452545568346977, "learning_rate": 0.024000000208616257, "loss": 2.4290828704833984, "step": 6166 }, { "epoch": 0.2937142857142857, "grad_norm": 0.0295589379966259, "learning_rate": 0.024000000208616257, "loss": 2.4010298252105713, "step": 6168 }, { "epoch": 0.2938095238095238, "grad_norm": 0.030462097376585007, "learning_rate": 0.024000000208616257, "loss": 2.384692668914795, "step": 6170 }, { "epoch": 0.2939047619047619, "grad_norm": 0.030001798644661903, "learning_rate": 0.024000000208616257, "loss": 2.410719394683838, "step": 6172 }, { "epoch": 0.294, "grad_norm": 0.030867138877511024, "learning_rate": 0.024000000208616257, "loss": 2.387799024581909, "step": 6174 }, { "epoch": 0.2940952380952381, "grad_norm": 0.03122049756348133, "learning_rate": 0.024000000208616257, "loss": 2.408491373062134, "step": 6176 }, { "epoch": 0.29419047619047617, "grad_norm": 0.030473507940769196, "learning_rate": 0.024000000208616257, "loss": 2.4553112983703613, "step": 6178 }, { "epoch": 0.29428571428571426, "grad_norm": 0.031921081244945526, "learning_rate": 0.024000000208616257, "loss": 2.4028406143188477, "step": 6180 }, { "epoch": 0.29438095238095235, "grad_norm": 0.03799763694405556, "learning_rate": 0.024000000208616257, "loss": 2.386849880218506, "step": 6182 }, { "epoch": 0.2944761904761905, "grad_norm": 0.03744405880570412, "learning_rate": 0.024000000208616257, "loss": 2.383111000061035, "step": 6184 }, { "epoch": 0.2945714285714286, "grad_norm": 0.03520790487527847, "learning_rate": 0.024000000208616257, "loss": 2.396151065826416, "step": 6186 }, { "epoch": 0.2946666666666667, "grad_norm": 0.032545480877161026, "learning_rate": 0.024000000208616257, "loss": 2.3864550590515137, "step": 6188 }, { "epoch": 0.2947619047619048, "grad_norm": 0.029453841969370842, "learning_rate": 0.024000000208616257, "loss": 2.4271655082702637, "step": 6190 }, { "epoch": 0.2948571428571429, "grad_norm": 0.03266867995262146, "learning_rate": 0.024000000208616257, "loss": 2.376993417739868, "step": 6192 }, { "epoch": 0.29495238095238097, "grad_norm": 0.029969044029712677, "learning_rate": 0.024000000208616257, "loss": 2.396732807159424, "step": 6194 }, { "epoch": 0.29504761904761906, "grad_norm": 0.02913718856871128, "learning_rate": 0.024000000208616257, "loss": 2.404344081878662, "step": 6196 }, { "epoch": 0.29514285714285715, "grad_norm": 0.030002065002918243, "learning_rate": 0.024000000208616257, "loss": 2.4053454399108887, "step": 6198 }, { "epoch": 0.29523809523809524, "grad_norm": 0.029469219967722893, "learning_rate": 0.024000000208616257, "loss": 2.41013240814209, "step": 6200 }, { "epoch": 0.29533333333333334, "grad_norm": 0.03019625134766102, "learning_rate": 0.024000000208616257, "loss": 2.4061102867126465, "step": 6202 }, { "epoch": 0.29542857142857143, "grad_norm": 0.02869257889688015, "learning_rate": 0.024000000208616257, "loss": 2.410395622253418, "step": 6204 }, { "epoch": 0.2955238095238095, "grad_norm": 0.02923528105020523, "learning_rate": 0.024000000208616257, "loss": 2.39755916595459, "step": 6206 }, { "epoch": 0.2956190476190476, "grad_norm": 0.029516516253352165, "learning_rate": 0.024000000208616257, "loss": 2.3845150470733643, "step": 6208 }, { "epoch": 0.2957142857142857, "grad_norm": 0.02876441180706024, "learning_rate": 0.024000000208616257, "loss": 2.4046125411987305, "step": 6210 }, { "epoch": 0.2958095238095238, "grad_norm": 0.029344074428081512, "learning_rate": 0.024000000208616257, "loss": 2.381272315979004, "step": 6212 }, { "epoch": 0.2959047619047619, "grad_norm": 0.02884243056178093, "learning_rate": 0.024000000208616257, "loss": 2.379793643951416, "step": 6214 }, { "epoch": 0.296, "grad_norm": 0.028938455507159233, "learning_rate": 0.024000000208616257, "loss": 2.3947997093200684, "step": 6216 }, { "epoch": 0.2960952380952381, "grad_norm": 0.0319499671459198, "learning_rate": 0.024000000208616257, "loss": 2.3873093128204346, "step": 6218 }, { "epoch": 0.29619047619047617, "grad_norm": 0.03386876359581947, "learning_rate": 0.024000000208616257, "loss": 2.394594669342041, "step": 6220 }, { "epoch": 0.29628571428571426, "grad_norm": 0.03166278824210167, "learning_rate": 0.024000000208616257, "loss": 2.385469913482666, "step": 6222 }, { "epoch": 0.29638095238095236, "grad_norm": 0.029478229582309723, "learning_rate": 0.024000000208616257, "loss": 2.386821985244751, "step": 6224 }, { "epoch": 0.29647619047619045, "grad_norm": 0.0299871563911438, "learning_rate": 0.024000000208616257, "loss": 2.382486581802368, "step": 6226 }, { "epoch": 0.2965714285714286, "grad_norm": 0.02832522988319397, "learning_rate": 0.024000000208616257, "loss": 2.386258125305176, "step": 6228 }, { "epoch": 0.2966666666666667, "grad_norm": 0.03017774224281311, "learning_rate": 0.024000000208616257, "loss": 2.398681163787842, "step": 6230 }, { "epoch": 0.2967619047619048, "grad_norm": 0.02863307110965252, "learning_rate": 0.024000000208616257, "loss": 2.378185272216797, "step": 6232 }, { "epoch": 0.2968571428571429, "grad_norm": 0.02968939207494259, "learning_rate": 0.024000000208616257, "loss": 2.375802993774414, "step": 6234 }, { "epoch": 0.29695238095238097, "grad_norm": 0.029388248920440674, "learning_rate": 0.024000000208616257, "loss": 2.3913650512695312, "step": 6236 }, { "epoch": 0.29704761904761906, "grad_norm": 0.03103412501513958, "learning_rate": 0.024000000208616257, "loss": 2.38293719291687, "step": 6238 }, { "epoch": 0.29714285714285715, "grad_norm": 0.028028704226017, "learning_rate": 0.024000000208616257, "loss": 2.393132209777832, "step": 6240 }, { "epoch": 0.29723809523809525, "grad_norm": 0.03213810175657272, "learning_rate": 0.024000000208616257, "loss": 2.3867733478546143, "step": 6242 }, { "epoch": 0.29733333333333334, "grad_norm": 0.029475048184394836, "learning_rate": 0.024000000208616257, "loss": 2.3856635093688965, "step": 6244 }, { "epoch": 0.29742857142857143, "grad_norm": 0.03102121688425541, "learning_rate": 0.024000000208616257, "loss": 2.374415874481201, "step": 6246 }, { "epoch": 0.2975238095238095, "grad_norm": 0.029679862782359123, "learning_rate": 0.024000000208616257, "loss": 2.391484260559082, "step": 6248 }, { "epoch": 0.2976190476190476, "grad_norm": 0.028446072712540627, "learning_rate": 0.024000000208616257, "loss": 2.359140634536743, "step": 6250 }, { "epoch": 0.2977142857142857, "grad_norm": 0.028913788497447968, "learning_rate": 0.024000000208616257, "loss": 2.398242235183716, "step": 6252 }, { "epoch": 0.2978095238095238, "grad_norm": 0.028609566390514374, "learning_rate": 0.024000000208616257, "loss": 2.4083738327026367, "step": 6254 }, { "epoch": 0.2979047619047619, "grad_norm": 0.029605332762002945, "learning_rate": 0.024000000208616257, "loss": 2.3719067573547363, "step": 6256 }, { "epoch": 0.298, "grad_norm": 0.030333707109093666, "learning_rate": 0.024000000208616257, "loss": 2.374971628189087, "step": 6258 }, { "epoch": 0.2980952380952381, "grad_norm": 0.030277365818619728, "learning_rate": 0.024000000208616257, "loss": 2.362861156463623, "step": 6260 }, { "epoch": 0.2981904761904762, "grad_norm": 0.03067701682448387, "learning_rate": 0.024000000208616257, "loss": 2.3669614791870117, "step": 6262 }, { "epoch": 0.29828571428571427, "grad_norm": 0.029332464560866356, "learning_rate": 0.024000000208616257, "loss": 2.386892795562744, "step": 6264 }, { "epoch": 0.29838095238095236, "grad_norm": 0.028934013098478317, "learning_rate": 0.024000000208616257, "loss": 2.369574785232544, "step": 6266 }, { "epoch": 0.29847619047619045, "grad_norm": 0.029047660529613495, "learning_rate": 0.024000000208616257, "loss": 2.40632963180542, "step": 6268 }, { "epoch": 0.2985714285714286, "grad_norm": 0.030155565589666367, "learning_rate": 0.024000000208616257, "loss": 2.4218883514404297, "step": 6270 }, { "epoch": 0.2986666666666667, "grad_norm": 0.030807355418801308, "learning_rate": 0.024000000208616257, "loss": 2.4023821353912354, "step": 6272 }, { "epoch": 0.2987619047619048, "grad_norm": 0.030271202325820923, "learning_rate": 0.024000000208616257, "loss": 2.348284959793091, "step": 6274 }, { "epoch": 0.2988571428571429, "grad_norm": 0.030739858746528625, "learning_rate": 0.024000000208616257, "loss": 2.3717989921569824, "step": 6276 }, { "epoch": 0.29895238095238097, "grad_norm": 0.031769488006830215, "learning_rate": 0.024000000208616257, "loss": 2.3772706985473633, "step": 6278 }, { "epoch": 0.29904761904761906, "grad_norm": 0.030596574768424034, "learning_rate": 0.024000000208616257, "loss": 2.3405585289001465, "step": 6280 }, { "epoch": 0.29914285714285715, "grad_norm": 0.028767000883817673, "learning_rate": 0.024000000208616257, "loss": 2.3589296340942383, "step": 6282 }, { "epoch": 0.29923809523809525, "grad_norm": 0.02941076084971428, "learning_rate": 0.024000000208616257, "loss": 2.386852741241455, "step": 6284 }, { "epoch": 0.29933333333333334, "grad_norm": 0.030165476724505424, "learning_rate": 0.024000000208616257, "loss": 2.3803796768188477, "step": 6286 }, { "epoch": 0.29942857142857143, "grad_norm": 0.02997790463268757, "learning_rate": 0.024000000208616257, "loss": 2.380345344543457, "step": 6288 }, { "epoch": 0.2995238095238095, "grad_norm": 0.02986382693052292, "learning_rate": 0.024000000208616257, "loss": 2.3663761615753174, "step": 6290 }, { "epoch": 0.2996190476190476, "grad_norm": 0.029478663578629494, "learning_rate": 0.024000000208616257, "loss": 2.3664679527282715, "step": 6292 }, { "epoch": 0.2997142857142857, "grad_norm": 0.029559725895524025, "learning_rate": 0.024000000208616257, "loss": 2.394038677215576, "step": 6294 }, { "epoch": 0.2998095238095238, "grad_norm": 0.02897718735039234, "learning_rate": 0.024000000208616257, "loss": 2.3769140243530273, "step": 6296 }, { "epoch": 0.2999047619047619, "grad_norm": 0.033866360783576965, "learning_rate": 0.024000000208616257, "loss": 2.371870994567871, "step": 6298 }, { "epoch": 0.3, "grad_norm": 0.029873307794332504, "learning_rate": 0.024000000208616257, "loss": 2.3710203170776367, "step": 6300 }, { "epoch": 0.3000952380952381, "grad_norm": 0.03052469715476036, "learning_rate": 0.024000000208616257, "loss": 2.349310874938965, "step": 6302 }, { "epoch": 0.3001904761904762, "grad_norm": 0.028601093217730522, "learning_rate": 0.024000000208616257, "loss": 2.3943562507629395, "step": 6304 }, { "epoch": 0.30028571428571427, "grad_norm": 0.02900421991944313, "learning_rate": 0.024000000208616257, "loss": 2.3869071006774902, "step": 6306 }, { "epoch": 0.30038095238095236, "grad_norm": 0.02909754402935505, "learning_rate": 0.024000000208616257, "loss": 2.3714840412139893, "step": 6308 }, { "epoch": 0.30047619047619045, "grad_norm": 0.030261747539043427, "learning_rate": 0.024000000208616257, "loss": 2.368900775909424, "step": 6310 }, { "epoch": 0.30057142857142854, "grad_norm": 0.034732263535261154, "learning_rate": 0.024000000208616257, "loss": 2.353426933288574, "step": 6312 }, { "epoch": 0.3006666666666667, "grad_norm": 0.030732370913028717, "learning_rate": 0.024000000208616257, "loss": 2.36553955078125, "step": 6314 }, { "epoch": 0.3007619047619048, "grad_norm": 0.03006397746503353, "learning_rate": 0.024000000208616257, "loss": 2.34895396232605, "step": 6316 }, { "epoch": 0.3008571428571429, "grad_norm": 0.02850496396422386, "learning_rate": 0.024000000208616257, "loss": 2.391019821166992, "step": 6318 }, { "epoch": 0.30095238095238097, "grad_norm": 0.02953995019197464, "learning_rate": 0.024000000208616257, "loss": 2.3627352714538574, "step": 6320 }, { "epoch": 0.30104761904761906, "grad_norm": 0.03028881922364235, "learning_rate": 0.024000000208616257, "loss": 2.36260986328125, "step": 6322 }, { "epoch": 0.30114285714285716, "grad_norm": 0.02920750342309475, "learning_rate": 0.024000000208616257, "loss": 2.3778300285339355, "step": 6324 }, { "epoch": 0.30123809523809525, "grad_norm": 0.029049871489405632, "learning_rate": 0.024000000208616257, "loss": 2.34736967086792, "step": 6326 }, { "epoch": 0.30133333333333334, "grad_norm": 0.03125058859586716, "learning_rate": 0.024000000208616257, "loss": 2.3484573364257812, "step": 6328 }, { "epoch": 0.30142857142857143, "grad_norm": 0.028908133506774902, "learning_rate": 0.024000000208616257, "loss": 2.3630216121673584, "step": 6330 }, { "epoch": 0.3015238095238095, "grad_norm": 0.030415229499340057, "learning_rate": 0.024000000208616257, "loss": 2.364722490310669, "step": 6332 }, { "epoch": 0.3016190476190476, "grad_norm": 0.035677410662174225, "learning_rate": 0.024000000208616257, "loss": 2.340344190597534, "step": 6334 }, { "epoch": 0.3017142857142857, "grad_norm": 0.029970012605190277, "learning_rate": 0.024000000208616257, "loss": 2.349818229675293, "step": 6336 }, { "epoch": 0.3018095238095238, "grad_norm": 0.031508028507232666, "learning_rate": 0.024000000208616257, "loss": 2.4211959838867188, "step": 6338 }, { "epoch": 0.3019047619047619, "grad_norm": 0.03199058771133423, "learning_rate": 0.024000000208616257, "loss": 2.36906099319458, "step": 6340 }, { "epoch": 0.302, "grad_norm": 0.033742476254701614, "learning_rate": 0.024000000208616257, "loss": 2.348757743835449, "step": 6342 }, { "epoch": 0.3020952380952381, "grad_norm": 0.032974131405353546, "learning_rate": 0.024000000208616257, "loss": 2.3575143814086914, "step": 6344 }, { "epoch": 0.3021904761904762, "grad_norm": 0.0315173864364624, "learning_rate": 0.024000000208616257, "loss": 2.3412365913391113, "step": 6346 }, { "epoch": 0.30228571428571427, "grad_norm": 0.03073800541460514, "learning_rate": 0.024000000208616257, "loss": 2.370591163635254, "step": 6348 }, { "epoch": 0.30238095238095236, "grad_norm": 0.030811628326773643, "learning_rate": 0.024000000208616257, "loss": 2.35609769821167, "step": 6350 }, { "epoch": 0.30247619047619045, "grad_norm": 0.0296856127679348, "learning_rate": 0.024000000208616257, "loss": 2.3591532707214355, "step": 6352 }, { "epoch": 0.30257142857142855, "grad_norm": 0.030461115762591362, "learning_rate": 0.024000000208616257, "loss": 2.3573710918426514, "step": 6354 }, { "epoch": 0.30266666666666664, "grad_norm": 0.030828215181827545, "learning_rate": 0.024000000208616257, "loss": 2.3749890327453613, "step": 6356 }, { "epoch": 0.3027619047619048, "grad_norm": 0.02959151193499565, "learning_rate": 0.024000000208616257, "loss": 2.361171245574951, "step": 6358 }, { "epoch": 0.3028571428571429, "grad_norm": 0.029876986518502235, "learning_rate": 0.024000000208616257, "loss": 2.3493261337280273, "step": 6360 }, { "epoch": 0.302952380952381, "grad_norm": 0.030514022335410118, "learning_rate": 0.024000000208616257, "loss": 2.305880546569824, "step": 6362 }, { "epoch": 0.30304761904761907, "grad_norm": 0.029770568013191223, "learning_rate": 0.024000000208616257, "loss": 2.368907928466797, "step": 6364 }, { "epoch": 0.30314285714285716, "grad_norm": 0.029339954257011414, "learning_rate": 0.024000000208616257, "loss": 2.317441463470459, "step": 6366 }, { "epoch": 0.30323809523809525, "grad_norm": 0.03049355372786522, "learning_rate": 0.024000000208616257, "loss": 2.3394582271575928, "step": 6368 }, { "epoch": 0.30333333333333334, "grad_norm": 0.030364181846380234, "learning_rate": 0.024000000208616257, "loss": 2.3430709838867188, "step": 6370 }, { "epoch": 0.30342857142857144, "grad_norm": 0.029699547216296196, "learning_rate": 0.024000000208616257, "loss": 2.332200050354004, "step": 6372 }, { "epoch": 0.30352380952380953, "grad_norm": 0.03139529377222061, "learning_rate": 0.024000000208616257, "loss": 2.3433914184570312, "step": 6374 }, { "epoch": 0.3036190476190476, "grad_norm": 0.031691379845142365, "learning_rate": 0.024000000208616257, "loss": 2.3571670055389404, "step": 6376 }, { "epoch": 0.3037142857142857, "grad_norm": 0.039775218814611435, "learning_rate": 0.024000000208616257, "loss": 2.3537678718566895, "step": 6378 }, { "epoch": 0.3038095238095238, "grad_norm": 0.0333886444568634, "learning_rate": 0.024000000208616257, "loss": 2.33561372756958, "step": 6380 }, { "epoch": 0.3039047619047619, "grad_norm": 0.03307177871465683, "learning_rate": 0.024000000208616257, "loss": 2.352508068084717, "step": 6382 }, { "epoch": 0.304, "grad_norm": 0.0321136899292469, "learning_rate": 0.024000000208616257, "loss": 2.3266265392303467, "step": 6384 }, { "epoch": 0.3040952380952381, "grad_norm": 0.03006013110280037, "learning_rate": 0.024000000208616257, "loss": 2.3507261276245117, "step": 6386 }, { "epoch": 0.3041904761904762, "grad_norm": 0.032090723514556885, "learning_rate": 0.024000000208616257, "loss": 2.353166103363037, "step": 6388 }, { "epoch": 0.30428571428571427, "grad_norm": 0.028613679111003876, "learning_rate": 0.024000000208616257, "loss": 2.3557522296905518, "step": 6390 }, { "epoch": 0.30438095238095236, "grad_norm": 0.030914470553398132, "learning_rate": 0.024000000208616257, "loss": 2.3342013359069824, "step": 6392 }, { "epoch": 0.30447619047619046, "grad_norm": 0.032159507274627686, "learning_rate": 0.024000000208616257, "loss": 2.325378656387329, "step": 6394 }, { "epoch": 0.30457142857142855, "grad_norm": 0.030638545751571655, "learning_rate": 0.024000000208616257, "loss": 2.339792251586914, "step": 6396 }, { "epoch": 0.30466666666666664, "grad_norm": 0.030159857124090195, "learning_rate": 0.024000000208616257, "loss": 2.3391616344451904, "step": 6398 }, { "epoch": 0.3047619047619048, "grad_norm": 0.03119141422212124, "learning_rate": 0.024000000208616257, "loss": 2.325261116027832, "step": 6400 }, { "epoch": 0.3048571428571429, "grad_norm": 0.029116680845618248, "learning_rate": 0.024000000208616257, "loss": 2.340701103210449, "step": 6402 }, { "epoch": 0.304952380952381, "grad_norm": 0.028415976092219353, "learning_rate": 0.024000000208616257, "loss": 2.351290225982666, "step": 6404 }, { "epoch": 0.30504761904761907, "grad_norm": 0.03050910122692585, "learning_rate": 0.024000000208616257, "loss": 2.3352484703063965, "step": 6406 }, { "epoch": 0.30514285714285716, "grad_norm": 0.028967514634132385, "learning_rate": 0.024000000208616257, "loss": 2.3293559551239014, "step": 6408 }, { "epoch": 0.30523809523809525, "grad_norm": 0.02979886159300804, "learning_rate": 0.024000000208616257, "loss": 2.376918077468872, "step": 6410 }, { "epoch": 0.30533333333333335, "grad_norm": 0.028688542544841766, "learning_rate": 0.024000000208616257, "loss": 2.3602054119110107, "step": 6412 }, { "epoch": 0.30542857142857144, "grad_norm": 0.028866274282336235, "learning_rate": 0.024000000208616257, "loss": 2.3494038581848145, "step": 6414 }, { "epoch": 0.30552380952380953, "grad_norm": 0.029814528301358223, "learning_rate": 0.024000000208616257, "loss": 2.337566375732422, "step": 6416 }, { "epoch": 0.3056190476190476, "grad_norm": 0.02985096164047718, "learning_rate": 0.024000000208616257, "loss": 2.342189311981201, "step": 6418 }, { "epoch": 0.3057142857142857, "grad_norm": 0.031116409227252007, "learning_rate": 0.024000000208616257, "loss": 2.3239994049072266, "step": 6420 }, { "epoch": 0.3058095238095238, "grad_norm": 0.028099246323108673, "learning_rate": 0.024000000208616257, "loss": 2.3329596519470215, "step": 6422 }, { "epoch": 0.3059047619047619, "grad_norm": 0.031047286465764046, "learning_rate": 0.024000000208616257, "loss": 2.3285062313079834, "step": 6424 }, { "epoch": 0.306, "grad_norm": 0.030233638361096382, "learning_rate": 0.024000000208616257, "loss": 2.3415894508361816, "step": 6426 }, { "epoch": 0.3060952380952381, "grad_norm": 0.029204512014985085, "learning_rate": 0.024000000208616257, "loss": 2.3137500286102295, "step": 6428 }, { "epoch": 0.3061904761904762, "grad_norm": 0.029379330575466156, "learning_rate": 0.024000000208616257, "loss": 2.3079605102539062, "step": 6430 }, { "epoch": 0.3062857142857143, "grad_norm": 0.028447212651371956, "learning_rate": 0.024000000208616257, "loss": 2.3419177532196045, "step": 6432 }, { "epoch": 0.30638095238095236, "grad_norm": 0.02918078750371933, "learning_rate": 0.024000000208616257, "loss": 2.3258371353149414, "step": 6434 }, { "epoch": 0.30647619047619046, "grad_norm": 0.03030138835310936, "learning_rate": 0.024000000208616257, "loss": 2.3137145042419434, "step": 6436 }, { "epoch": 0.30657142857142855, "grad_norm": 0.028849851340055466, "learning_rate": 0.024000000208616257, "loss": 2.312994956970215, "step": 6438 }, { "epoch": 0.30666666666666664, "grad_norm": 0.034059129655361176, "learning_rate": 0.024000000208616257, "loss": 2.3687191009521484, "step": 6440 }, { "epoch": 0.30676190476190474, "grad_norm": 0.029895341023802757, "learning_rate": 0.024000000208616257, "loss": 2.320673942565918, "step": 6442 }, { "epoch": 0.3068571428571429, "grad_norm": 0.029393669217824936, "learning_rate": 0.024000000208616257, "loss": 2.334285259246826, "step": 6444 }, { "epoch": 0.306952380952381, "grad_norm": 0.02984684891998768, "learning_rate": 0.024000000208616257, "loss": 2.3269519805908203, "step": 6446 }, { "epoch": 0.30704761904761907, "grad_norm": 0.028513114899396896, "learning_rate": 0.024000000208616257, "loss": 2.3411808013916016, "step": 6448 }, { "epoch": 0.30714285714285716, "grad_norm": 0.029769014567136765, "learning_rate": 0.024000000208616257, "loss": 2.305899143218994, "step": 6450 }, { "epoch": 0.30723809523809525, "grad_norm": 0.028367046266794205, "learning_rate": 0.024000000208616257, "loss": 2.342182159423828, "step": 6452 }, { "epoch": 0.30733333333333335, "grad_norm": 0.029349738731980324, "learning_rate": 0.024000000208616257, "loss": 2.356308937072754, "step": 6454 }, { "epoch": 0.30742857142857144, "grad_norm": 0.02835014835000038, "learning_rate": 0.024000000208616257, "loss": 2.3111329078674316, "step": 6456 }, { "epoch": 0.30752380952380953, "grad_norm": 0.028373422101140022, "learning_rate": 0.024000000208616257, "loss": 2.3310675621032715, "step": 6458 }, { "epoch": 0.3076190476190476, "grad_norm": 0.03005264885723591, "learning_rate": 0.024000000208616257, "loss": 2.319322347640991, "step": 6460 }, { "epoch": 0.3077142857142857, "grad_norm": 0.028897160664200783, "learning_rate": 0.024000000208616257, "loss": 2.312281370162964, "step": 6462 }, { "epoch": 0.3078095238095238, "grad_norm": 0.02857542783021927, "learning_rate": 0.024000000208616257, "loss": 2.33115291595459, "step": 6464 }, { "epoch": 0.3079047619047619, "grad_norm": 0.029262132942676544, "learning_rate": 0.024000000208616257, "loss": 2.298640727996826, "step": 6466 }, { "epoch": 0.308, "grad_norm": 0.028896832838654518, "learning_rate": 0.024000000208616257, "loss": 2.324201822280884, "step": 6468 }, { "epoch": 0.3080952380952381, "grad_norm": 0.02913055568933487, "learning_rate": 0.024000000208616257, "loss": 2.3362958431243896, "step": 6470 }, { "epoch": 0.3081904761904762, "grad_norm": 0.028997665271162987, "learning_rate": 0.024000000208616257, "loss": 2.3058416843414307, "step": 6472 }, { "epoch": 0.3082857142857143, "grad_norm": 0.029276883229613304, "learning_rate": 0.024000000208616257, "loss": 2.290177822113037, "step": 6474 }, { "epoch": 0.30838095238095237, "grad_norm": 0.028262533247470856, "learning_rate": 0.024000000208616257, "loss": 2.327847957611084, "step": 6476 }, { "epoch": 0.30847619047619046, "grad_norm": 0.03180812671780586, "learning_rate": 0.024000000208616257, "loss": 2.2909553050994873, "step": 6478 }, { "epoch": 0.30857142857142855, "grad_norm": 0.030663711950182915, "learning_rate": 0.024000000208616257, "loss": 2.313873052597046, "step": 6480 }, { "epoch": 0.30866666666666664, "grad_norm": 0.029575012624263763, "learning_rate": 0.024000000208616257, "loss": 2.3010506629943848, "step": 6482 }, { "epoch": 0.30876190476190474, "grad_norm": 0.031017595902085304, "learning_rate": 0.024000000208616257, "loss": 2.3361008167266846, "step": 6484 }, { "epoch": 0.30885714285714283, "grad_norm": 0.030826469883322716, "learning_rate": 0.024000000208616257, "loss": 2.3304443359375, "step": 6486 }, { "epoch": 0.308952380952381, "grad_norm": 0.029857560992240906, "learning_rate": 0.024000000208616257, "loss": 2.343198299407959, "step": 6488 }, { "epoch": 0.30904761904761907, "grad_norm": 0.03165281191468239, "learning_rate": 0.024000000208616257, "loss": 2.323134422302246, "step": 6490 }, { "epoch": 0.30914285714285716, "grad_norm": 0.031169898808002472, "learning_rate": 0.024000000208616257, "loss": 2.2684202194213867, "step": 6492 }, { "epoch": 0.30923809523809526, "grad_norm": 0.030998406931757927, "learning_rate": 0.024000000208616257, "loss": 2.3110828399658203, "step": 6494 }, { "epoch": 0.30933333333333335, "grad_norm": 0.03100859746336937, "learning_rate": 0.024000000208616257, "loss": 2.317997932434082, "step": 6496 }, { "epoch": 0.30942857142857144, "grad_norm": 0.032150231301784515, "learning_rate": 0.024000000208616257, "loss": 2.2934441566467285, "step": 6498 }, { "epoch": 0.30952380952380953, "grad_norm": 0.03440959006547928, "learning_rate": 0.024000000208616257, "loss": 2.299736976623535, "step": 6500 }, { "epoch": 0.3096190476190476, "grad_norm": 0.03243481367826462, "learning_rate": 0.024000000208616257, "loss": 2.3151302337646484, "step": 6502 }, { "epoch": 0.3097142857142857, "grad_norm": 0.030160514637827873, "learning_rate": 0.024000000208616257, "loss": 2.316957473754883, "step": 6504 }, { "epoch": 0.3098095238095238, "grad_norm": 0.029033947736024857, "learning_rate": 0.024000000208616257, "loss": 2.3279778957366943, "step": 6506 }, { "epoch": 0.3099047619047619, "grad_norm": 0.032126832753419876, "learning_rate": 0.024000000208616257, "loss": 2.3131799697875977, "step": 6508 }, { "epoch": 0.31, "grad_norm": 0.029689760878682137, "learning_rate": 0.024000000208616257, "loss": 2.294799566268921, "step": 6510 }, { "epoch": 0.3100952380952381, "grad_norm": 0.030131082981824875, "learning_rate": 0.024000000208616257, "loss": 2.321272373199463, "step": 6512 }, { "epoch": 0.3101904761904762, "grad_norm": 0.029904279857873917, "learning_rate": 0.024000000208616257, "loss": 2.296316623687744, "step": 6514 }, { "epoch": 0.3102857142857143, "grad_norm": 0.029554761946201324, "learning_rate": 0.024000000208616257, "loss": 2.3266029357910156, "step": 6516 }, { "epoch": 0.31038095238095237, "grad_norm": 0.030398434028029442, "learning_rate": 0.024000000208616257, "loss": 2.3038394451141357, "step": 6518 }, { "epoch": 0.31047619047619046, "grad_norm": 0.03139033168554306, "learning_rate": 0.024000000208616257, "loss": 2.3312878608703613, "step": 6520 }, { "epoch": 0.31057142857142855, "grad_norm": 0.032367806881666183, "learning_rate": 0.024000000208616257, "loss": 2.3026113510131836, "step": 6522 }, { "epoch": 0.31066666666666665, "grad_norm": 0.028709443286061287, "learning_rate": 0.024000000208616257, "loss": 2.333828926086426, "step": 6524 }, { "epoch": 0.31076190476190474, "grad_norm": 0.028709562495350838, "learning_rate": 0.024000000208616257, "loss": 2.3659114837646484, "step": 6526 }, { "epoch": 0.31085714285714283, "grad_norm": 0.029420573264360428, "learning_rate": 0.024000000208616257, "loss": 2.3149476051330566, "step": 6528 }, { "epoch": 0.310952380952381, "grad_norm": 0.02859511412680149, "learning_rate": 0.024000000208616257, "loss": 2.3383634090423584, "step": 6530 }, { "epoch": 0.3110476190476191, "grad_norm": 0.02823934704065323, "learning_rate": 0.024000000208616257, "loss": 2.3382184505462646, "step": 6532 }, { "epoch": 0.31114285714285717, "grad_norm": 0.0287617314606905, "learning_rate": 0.024000000208616257, "loss": 2.3064022064208984, "step": 6534 }, { "epoch": 0.31123809523809526, "grad_norm": 0.02918027900159359, "learning_rate": 0.024000000208616257, "loss": 2.356049060821533, "step": 6536 }, { "epoch": 0.31133333333333335, "grad_norm": 0.03052075207233429, "learning_rate": 0.024000000208616257, "loss": 2.3003015518188477, "step": 6538 }, { "epoch": 0.31142857142857144, "grad_norm": 0.02977004647254944, "learning_rate": 0.024000000208616257, "loss": 2.310786724090576, "step": 6540 }, { "epoch": 0.31152380952380954, "grad_norm": 0.028594976291060448, "learning_rate": 0.024000000208616257, "loss": 2.3311147689819336, "step": 6542 }, { "epoch": 0.31161904761904763, "grad_norm": 0.029462821781635284, "learning_rate": 0.024000000208616257, "loss": 2.282050132751465, "step": 6544 }, { "epoch": 0.3117142857142857, "grad_norm": 0.030693713575601578, "learning_rate": 0.024000000208616257, "loss": 2.3141465187072754, "step": 6546 }, { "epoch": 0.3118095238095238, "grad_norm": 0.029452495276927948, "learning_rate": 0.024000000208616257, "loss": 2.3095901012420654, "step": 6548 }, { "epoch": 0.3119047619047619, "grad_norm": 0.029399117454886436, "learning_rate": 0.024000000208616257, "loss": 2.3280012607574463, "step": 6550 }, { "epoch": 0.312, "grad_norm": 0.028573788702487946, "learning_rate": 0.024000000208616257, "loss": 2.3171677589416504, "step": 6552 }, { "epoch": 0.3120952380952381, "grad_norm": 0.029009908437728882, "learning_rate": 0.024000000208616257, "loss": 2.2949657440185547, "step": 6554 }, { "epoch": 0.3121904761904762, "grad_norm": 0.030307289212942123, "learning_rate": 0.024000000208616257, "loss": 2.292551040649414, "step": 6556 }, { "epoch": 0.3122857142857143, "grad_norm": 0.0292578786611557, "learning_rate": 0.024000000208616257, "loss": 2.341674327850342, "step": 6558 }, { "epoch": 0.31238095238095237, "grad_norm": 0.02938046120107174, "learning_rate": 0.024000000208616257, "loss": 2.3232929706573486, "step": 6560 }, { "epoch": 0.31247619047619046, "grad_norm": 0.03140236437320709, "learning_rate": 0.024000000208616257, "loss": 2.331082344055176, "step": 6562 }, { "epoch": 0.31257142857142856, "grad_norm": 0.03176737204194069, "learning_rate": 0.024000000208616257, "loss": 2.300539970397949, "step": 6564 }, { "epoch": 0.31266666666666665, "grad_norm": 0.03085075505077839, "learning_rate": 0.024000000208616257, "loss": 2.306908130645752, "step": 6566 }, { "epoch": 0.31276190476190474, "grad_norm": 0.03405633568763733, "learning_rate": 0.024000000208616257, "loss": 2.3460350036621094, "step": 6568 }, { "epoch": 0.31285714285714283, "grad_norm": 0.03649013116955757, "learning_rate": 0.024000000208616257, "loss": 2.318842887878418, "step": 6570 }, { "epoch": 0.3129523809523809, "grad_norm": 0.03427470847964287, "learning_rate": 0.024000000208616257, "loss": 2.3351383209228516, "step": 6572 }, { "epoch": 0.3130476190476191, "grad_norm": 0.02971455082297325, "learning_rate": 0.024000000208616257, "loss": 2.311009407043457, "step": 6574 }, { "epoch": 0.31314285714285717, "grad_norm": 0.027818987146019936, "learning_rate": 0.024000000208616257, "loss": 2.3370628356933594, "step": 6576 }, { "epoch": 0.31323809523809526, "grad_norm": 0.030287202447652817, "learning_rate": 0.024000000208616257, "loss": 2.3272042274475098, "step": 6578 }, { "epoch": 0.31333333333333335, "grad_norm": 0.029654696583747864, "learning_rate": 0.024000000208616257, "loss": 2.3328592777252197, "step": 6580 }, { "epoch": 0.31342857142857145, "grad_norm": 0.030140697956085205, "learning_rate": 0.024000000208616257, "loss": 2.3344874382019043, "step": 6582 }, { "epoch": 0.31352380952380954, "grad_norm": 0.03535059466958046, "learning_rate": 0.024000000208616257, "loss": 2.3042070865631104, "step": 6584 }, { "epoch": 0.31361904761904763, "grad_norm": 0.03976230323314667, "learning_rate": 0.024000000208616257, "loss": 2.3257813453674316, "step": 6586 }, { "epoch": 0.3137142857142857, "grad_norm": 0.041739098727703094, "learning_rate": 0.024000000208616257, "loss": 2.3564138412475586, "step": 6588 }, { "epoch": 0.3138095238095238, "grad_norm": 0.03081522136926651, "learning_rate": 0.024000000208616257, "loss": 2.3330435752868652, "step": 6590 }, { "epoch": 0.3139047619047619, "grad_norm": 0.029866332188248634, "learning_rate": 0.024000000208616257, "loss": 2.3302152156829834, "step": 6592 }, { "epoch": 0.314, "grad_norm": 0.030008263885974884, "learning_rate": 0.024000000208616257, "loss": 2.342397689819336, "step": 6594 }, { "epoch": 0.3140952380952381, "grad_norm": 0.029518095776438713, "learning_rate": 0.024000000208616257, "loss": 2.331911563873291, "step": 6596 }, { "epoch": 0.3141904761904762, "grad_norm": 0.028048476204276085, "learning_rate": 0.024000000208616257, "loss": 2.363534927368164, "step": 6598 }, { "epoch": 0.3142857142857143, "grad_norm": 0.028625955805182457, "learning_rate": 0.024000000208616257, "loss": 2.335629940032959, "step": 6600 }, { "epoch": 0.31438095238095237, "grad_norm": 0.02924981154501438, "learning_rate": 0.024000000208616257, "loss": 2.300017833709717, "step": 6602 }, { "epoch": 0.31447619047619046, "grad_norm": 0.028616972267627716, "learning_rate": 0.024000000208616257, "loss": 2.3265857696533203, "step": 6604 }, { "epoch": 0.31457142857142856, "grad_norm": 0.0298260860145092, "learning_rate": 0.024000000208616257, "loss": 2.324106216430664, "step": 6606 }, { "epoch": 0.31466666666666665, "grad_norm": 0.030582770705223083, "learning_rate": 0.024000000208616257, "loss": 2.355809211730957, "step": 6608 }, { "epoch": 0.31476190476190474, "grad_norm": 0.02805759571492672, "learning_rate": 0.024000000208616257, "loss": 2.3221237659454346, "step": 6610 }, { "epoch": 0.31485714285714284, "grad_norm": 0.02839668095111847, "learning_rate": 0.024000000208616257, "loss": 2.3380656242370605, "step": 6612 }, { "epoch": 0.31495238095238093, "grad_norm": 0.029600270092487335, "learning_rate": 0.024000000208616257, "loss": 2.3537635803222656, "step": 6614 }, { "epoch": 0.315047619047619, "grad_norm": 0.029355807229876518, "learning_rate": 0.024000000208616257, "loss": 2.37713623046875, "step": 6616 }, { "epoch": 0.31514285714285717, "grad_norm": 0.029095949605107307, "learning_rate": 0.024000000208616257, "loss": 2.338749647140503, "step": 6618 }, { "epoch": 0.31523809523809526, "grad_norm": 0.02888203039765358, "learning_rate": 0.024000000208616257, "loss": 2.2921230792999268, "step": 6620 }, { "epoch": 0.31533333333333335, "grad_norm": 0.029153017327189445, "learning_rate": 0.024000000208616257, "loss": 2.289492130279541, "step": 6622 }, { "epoch": 0.31542857142857145, "grad_norm": 0.029823293909430504, "learning_rate": 0.024000000208616257, "loss": 2.346759796142578, "step": 6624 }, { "epoch": 0.31552380952380954, "grad_norm": 0.03087831288576126, "learning_rate": 0.024000000208616257, "loss": 2.3074631690979004, "step": 6626 }, { "epoch": 0.31561904761904763, "grad_norm": 0.030142977833747864, "learning_rate": 0.024000000208616257, "loss": 2.3296914100646973, "step": 6628 }, { "epoch": 0.3157142857142857, "grad_norm": 0.02920375019311905, "learning_rate": 0.024000000208616257, "loss": 2.3437232971191406, "step": 6630 }, { "epoch": 0.3158095238095238, "grad_norm": 0.031672459095716476, "learning_rate": 0.024000000208616257, "loss": 2.3556675910949707, "step": 6632 }, { "epoch": 0.3159047619047619, "grad_norm": 0.030668728053569794, "learning_rate": 0.024000000208616257, "loss": 2.354781150817871, "step": 6634 }, { "epoch": 0.316, "grad_norm": 0.029729878529906273, "learning_rate": 0.024000000208616257, "loss": 2.3499631881713867, "step": 6636 }, { "epoch": 0.3160952380952381, "grad_norm": 0.02825327217578888, "learning_rate": 0.024000000208616257, "loss": 2.359105110168457, "step": 6638 }, { "epoch": 0.3161904761904762, "grad_norm": 0.03172089532017708, "learning_rate": 0.024000000208616257, "loss": 2.3593931198120117, "step": 6640 }, { "epoch": 0.3162857142857143, "grad_norm": 0.030128180980682373, "learning_rate": 0.024000000208616257, "loss": 2.337581157684326, "step": 6642 }, { "epoch": 0.3163809523809524, "grad_norm": 0.030262082815170288, "learning_rate": 0.024000000208616257, "loss": 2.3297014236450195, "step": 6644 }, { "epoch": 0.31647619047619047, "grad_norm": 0.03131818771362305, "learning_rate": 0.024000000208616257, "loss": 2.375129461288452, "step": 6646 }, { "epoch": 0.31657142857142856, "grad_norm": 0.03253898397088051, "learning_rate": 0.024000000208616257, "loss": 2.35223388671875, "step": 6648 }, { "epoch": 0.31666666666666665, "grad_norm": 0.03146529942750931, "learning_rate": 0.024000000208616257, "loss": 2.344130039215088, "step": 6650 }, { "epoch": 0.31676190476190474, "grad_norm": 0.030744455754756927, "learning_rate": 0.024000000208616257, "loss": 2.342435836791992, "step": 6652 }, { "epoch": 0.31685714285714284, "grad_norm": 0.030047748237848282, "learning_rate": 0.024000000208616257, "loss": 2.3624284267425537, "step": 6654 }, { "epoch": 0.31695238095238093, "grad_norm": 0.028113337233662605, "learning_rate": 0.024000000208616257, "loss": 2.347626209259033, "step": 6656 }, { "epoch": 0.317047619047619, "grad_norm": 0.029134491458535194, "learning_rate": 0.024000000208616257, "loss": 2.335148334503174, "step": 6658 }, { "epoch": 0.3171428571428571, "grad_norm": 0.029101917520165443, "learning_rate": 0.024000000208616257, "loss": 2.3474507331848145, "step": 6660 }, { "epoch": 0.31723809523809526, "grad_norm": 0.03106527216732502, "learning_rate": 0.024000000208616257, "loss": 2.3615317344665527, "step": 6662 }, { "epoch": 0.31733333333333336, "grad_norm": 0.028606345877051353, "learning_rate": 0.024000000208616257, "loss": 2.3369333744049072, "step": 6664 }, { "epoch": 0.31742857142857145, "grad_norm": 0.029963959008455276, "learning_rate": 0.024000000208616257, "loss": 2.360109329223633, "step": 6666 }, { "epoch": 0.31752380952380954, "grad_norm": 0.029881037771701813, "learning_rate": 0.024000000208616257, "loss": 2.3249053955078125, "step": 6668 }, { "epoch": 0.31761904761904763, "grad_norm": 0.029798684641718864, "learning_rate": 0.024000000208616257, "loss": 2.3431034088134766, "step": 6670 }, { "epoch": 0.3177142857142857, "grad_norm": 0.030057916417717934, "learning_rate": 0.024000000208616257, "loss": 2.3436026573181152, "step": 6672 }, { "epoch": 0.3178095238095238, "grad_norm": 0.029155798256397247, "learning_rate": 0.024000000208616257, "loss": 2.3344974517822266, "step": 6674 }, { "epoch": 0.3179047619047619, "grad_norm": 0.028540829196572304, "learning_rate": 0.024000000208616257, "loss": 2.3181653022766113, "step": 6676 }, { "epoch": 0.318, "grad_norm": 0.02922496199607849, "learning_rate": 0.024000000208616257, "loss": 2.33772611618042, "step": 6678 }, { "epoch": 0.3180952380952381, "grad_norm": 0.028826560825109482, "learning_rate": 0.024000000208616257, "loss": 2.361253023147583, "step": 6680 }, { "epoch": 0.3181904761904762, "grad_norm": 0.02881036326289177, "learning_rate": 0.024000000208616257, "loss": 2.3275647163391113, "step": 6682 }, { "epoch": 0.3182857142857143, "grad_norm": 0.030000587925314903, "learning_rate": 0.024000000208616257, "loss": 2.345825672149658, "step": 6684 }, { "epoch": 0.3183809523809524, "grad_norm": 0.031596262007951736, "learning_rate": 0.024000000208616257, "loss": 2.3597512245178223, "step": 6686 }, { "epoch": 0.31847619047619047, "grad_norm": 0.028911059722304344, "learning_rate": 0.024000000208616257, "loss": 2.3646888732910156, "step": 6688 }, { "epoch": 0.31857142857142856, "grad_norm": 0.02899034135043621, "learning_rate": 0.024000000208616257, "loss": 2.35548734664917, "step": 6690 }, { "epoch": 0.31866666666666665, "grad_norm": 0.028659792616963387, "learning_rate": 0.024000000208616257, "loss": 2.355567455291748, "step": 6692 }, { "epoch": 0.31876190476190475, "grad_norm": 0.031580351293087006, "learning_rate": 0.024000000208616257, "loss": 2.36421275138855, "step": 6694 }, { "epoch": 0.31885714285714284, "grad_norm": 0.029118487611413002, "learning_rate": 0.024000000208616257, "loss": 2.3590779304504395, "step": 6696 }, { "epoch": 0.31895238095238093, "grad_norm": 0.02990548126399517, "learning_rate": 0.024000000208616257, "loss": 2.3388471603393555, "step": 6698 }, { "epoch": 0.319047619047619, "grad_norm": 0.029720649123191833, "learning_rate": 0.024000000208616257, "loss": 2.339114189147949, "step": 6700 }, { "epoch": 0.3191428571428571, "grad_norm": 0.0306615699082613, "learning_rate": 0.024000000208616257, "loss": 2.3610129356384277, "step": 6702 }, { "epoch": 0.31923809523809527, "grad_norm": 0.032338354736566544, "learning_rate": 0.024000000208616257, "loss": 2.350888729095459, "step": 6704 }, { "epoch": 0.31933333333333336, "grad_norm": 0.03412037342786789, "learning_rate": 0.024000000208616257, "loss": 2.3385887145996094, "step": 6706 }, { "epoch": 0.31942857142857145, "grad_norm": 0.03057759255170822, "learning_rate": 0.024000000208616257, "loss": 2.3421730995178223, "step": 6708 }, { "epoch": 0.31952380952380954, "grad_norm": 0.030888650566339493, "learning_rate": 0.024000000208616257, "loss": 2.3476104736328125, "step": 6710 }, { "epoch": 0.31961904761904764, "grad_norm": 0.028536031022667885, "learning_rate": 0.024000000208616257, "loss": 2.364065170288086, "step": 6712 }, { "epoch": 0.31971428571428573, "grad_norm": 0.029843401163816452, "learning_rate": 0.024000000208616257, "loss": 2.3941855430603027, "step": 6714 }, { "epoch": 0.3198095238095238, "grad_norm": 0.029957100749015808, "learning_rate": 0.024000000208616257, "loss": 2.3491902351379395, "step": 6716 }, { "epoch": 0.3199047619047619, "grad_norm": 0.029425516724586487, "learning_rate": 0.024000000208616257, "loss": 2.3537135124206543, "step": 6718 }, { "epoch": 0.32, "grad_norm": 0.02858414128422737, "learning_rate": 0.024000000208616257, "loss": 2.3724772930145264, "step": 6720 }, { "epoch": 0.3200952380952381, "grad_norm": 0.03299523890018463, "learning_rate": 0.024000000208616257, "loss": 2.360440969467163, "step": 6722 }, { "epoch": 0.3201904761904762, "grad_norm": 0.028430329635739326, "learning_rate": 0.024000000208616257, "loss": 2.3424034118652344, "step": 6724 }, { "epoch": 0.3202857142857143, "grad_norm": 0.02861458621919155, "learning_rate": 0.024000000208616257, "loss": 2.34429669380188, "step": 6726 }, { "epoch": 0.3203809523809524, "grad_norm": 0.029941774904727936, "learning_rate": 0.024000000208616257, "loss": 2.341630458831787, "step": 6728 }, { "epoch": 0.32047619047619047, "grad_norm": 0.028318598866462708, "learning_rate": 0.024000000208616257, "loss": 2.4075822830200195, "step": 6730 }, { "epoch": 0.32057142857142856, "grad_norm": 0.029113972559571266, "learning_rate": 0.024000000208616257, "loss": 2.358125686645508, "step": 6732 }, { "epoch": 0.32066666666666666, "grad_norm": 0.030636440962553024, "learning_rate": 0.024000000208616257, "loss": 2.3770601749420166, "step": 6734 }, { "epoch": 0.32076190476190475, "grad_norm": 0.028409449383616447, "learning_rate": 0.024000000208616257, "loss": 2.4204659461975098, "step": 6736 }, { "epoch": 0.32085714285714284, "grad_norm": 0.030893204733729362, "learning_rate": 0.024000000208616257, "loss": 2.3892459869384766, "step": 6738 }, { "epoch": 0.32095238095238093, "grad_norm": 0.02968692034482956, "learning_rate": 0.024000000208616257, "loss": 2.355163097381592, "step": 6740 }, { "epoch": 0.321047619047619, "grad_norm": 0.028388556092977524, "learning_rate": 0.024000000208616257, "loss": 2.372467517852783, "step": 6742 }, { "epoch": 0.3211428571428571, "grad_norm": 0.030175594612956047, "learning_rate": 0.024000000208616257, "loss": 2.407804489135742, "step": 6744 }, { "epoch": 0.3212380952380952, "grad_norm": 0.029180334880948067, "learning_rate": 0.024000000208616257, "loss": 2.361778497695923, "step": 6746 }, { "epoch": 0.32133333333333336, "grad_norm": 0.031550295650959015, "learning_rate": 0.024000000208616257, "loss": 2.374695301055908, "step": 6748 }, { "epoch": 0.32142857142857145, "grad_norm": 0.035255640745162964, "learning_rate": 0.024000000208616257, "loss": 2.335714340209961, "step": 6750 }, { "epoch": 0.32152380952380955, "grad_norm": 0.029872020706534386, "learning_rate": 0.024000000208616257, "loss": 2.3993616104125977, "step": 6752 }, { "epoch": 0.32161904761904764, "grad_norm": 0.0291373860090971, "learning_rate": 0.024000000208616257, "loss": 2.3874149322509766, "step": 6754 }, { "epoch": 0.32171428571428573, "grad_norm": 0.030344711616635323, "learning_rate": 0.024000000208616257, "loss": 2.365351676940918, "step": 6756 }, { "epoch": 0.3218095238095238, "grad_norm": 0.029092896729707718, "learning_rate": 0.024000000208616257, "loss": 2.361419677734375, "step": 6758 }, { "epoch": 0.3219047619047619, "grad_norm": 0.028762144967913628, "learning_rate": 0.024000000208616257, "loss": 2.394111156463623, "step": 6760 }, { "epoch": 0.322, "grad_norm": 0.028395377099514008, "learning_rate": 0.024000000208616257, "loss": 2.403046131134033, "step": 6762 }, { "epoch": 0.3220952380952381, "grad_norm": 0.0339694507420063, "learning_rate": 0.024000000208616257, "loss": 2.3714747428894043, "step": 6764 }, { "epoch": 0.3221904761904762, "grad_norm": 0.03127436339855194, "learning_rate": 0.024000000208616257, "loss": 2.382192611694336, "step": 6766 }, { "epoch": 0.3222857142857143, "grad_norm": 0.02861054800450802, "learning_rate": 0.024000000208616257, "loss": 2.382972240447998, "step": 6768 }, { "epoch": 0.3223809523809524, "grad_norm": 0.029353581368923187, "learning_rate": 0.024000000208616257, "loss": 2.38801908493042, "step": 6770 }, { "epoch": 0.32247619047619047, "grad_norm": 0.0296561811119318, "learning_rate": 0.024000000208616257, "loss": 2.3707282543182373, "step": 6772 }, { "epoch": 0.32257142857142856, "grad_norm": 0.02969769947230816, "learning_rate": 0.024000000208616257, "loss": 2.384158134460449, "step": 6774 }, { "epoch": 0.32266666666666666, "grad_norm": 0.03448229283094406, "learning_rate": 0.024000000208616257, "loss": 2.366119861602783, "step": 6776 }, { "epoch": 0.32276190476190475, "grad_norm": 0.029626045376062393, "learning_rate": 0.024000000208616257, "loss": 2.394411563873291, "step": 6778 }, { "epoch": 0.32285714285714284, "grad_norm": 0.030190495774149895, "learning_rate": 0.024000000208616257, "loss": 2.4092397689819336, "step": 6780 }, { "epoch": 0.32295238095238094, "grad_norm": 0.028880007565021515, "learning_rate": 0.024000000208616257, "loss": 2.38751482963562, "step": 6782 }, { "epoch": 0.32304761904761903, "grad_norm": 0.029009686782956123, "learning_rate": 0.024000000208616257, "loss": 2.403639793395996, "step": 6784 }, { "epoch": 0.3231428571428571, "grad_norm": 0.029632573947310448, "learning_rate": 0.024000000208616257, "loss": 2.3590686321258545, "step": 6786 }, { "epoch": 0.3232380952380952, "grad_norm": 0.029860898852348328, "learning_rate": 0.024000000208616257, "loss": 2.380467414855957, "step": 6788 }, { "epoch": 0.3233333333333333, "grad_norm": 0.030146099627017975, "learning_rate": 0.024000000208616257, "loss": 2.370199203491211, "step": 6790 }, { "epoch": 0.32342857142857145, "grad_norm": 0.030649010092020035, "learning_rate": 0.024000000208616257, "loss": 2.372230052947998, "step": 6792 }, { "epoch": 0.32352380952380955, "grad_norm": 0.03249740228056908, "learning_rate": 0.024000000208616257, "loss": 2.3918845653533936, "step": 6794 }, { "epoch": 0.32361904761904764, "grad_norm": 0.034145697951316833, "learning_rate": 0.024000000208616257, "loss": 2.3606655597686768, "step": 6796 }, { "epoch": 0.32371428571428573, "grad_norm": 0.03330729156732559, "learning_rate": 0.024000000208616257, "loss": 2.342175006866455, "step": 6798 }, { "epoch": 0.3238095238095238, "grad_norm": 0.03220066800713539, "learning_rate": 0.024000000208616257, "loss": 2.391664981842041, "step": 6800 }, { "epoch": 0.3239047619047619, "grad_norm": 0.029995650053024292, "learning_rate": 0.024000000208616257, "loss": 2.36269474029541, "step": 6802 }, { "epoch": 0.324, "grad_norm": 0.03163720667362213, "learning_rate": 0.024000000208616257, "loss": 2.380225658416748, "step": 6804 }, { "epoch": 0.3240952380952381, "grad_norm": 0.030561575666069984, "learning_rate": 0.024000000208616257, "loss": 2.391545534133911, "step": 6806 }, { "epoch": 0.3241904761904762, "grad_norm": 0.03141254931688309, "learning_rate": 0.024000000208616257, "loss": 2.357654094696045, "step": 6808 }, { "epoch": 0.3242857142857143, "grad_norm": 0.02883581444621086, "learning_rate": 0.024000000208616257, "loss": 2.3747992515563965, "step": 6810 }, { "epoch": 0.3243809523809524, "grad_norm": 0.039441872388124466, "learning_rate": 0.024000000208616257, "loss": 2.3972387313842773, "step": 6812 }, { "epoch": 0.3244761904761905, "grad_norm": 0.032467689365148544, "learning_rate": 0.024000000208616257, "loss": 2.339588165283203, "step": 6814 }, { "epoch": 0.32457142857142857, "grad_norm": 0.03031005524098873, "learning_rate": 0.024000000208616257, "loss": 2.3729465007781982, "step": 6816 }, { "epoch": 0.32466666666666666, "grad_norm": 0.02971688285470009, "learning_rate": 0.024000000208616257, "loss": 2.383436679840088, "step": 6818 }, { "epoch": 0.32476190476190475, "grad_norm": 0.02917535975575447, "learning_rate": 0.024000000208616257, "loss": 2.361727714538574, "step": 6820 }, { "epoch": 0.32485714285714284, "grad_norm": 0.029190370813012123, "learning_rate": 0.024000000208616257, "loss": 2.360609292984009, "step": 6822 }, { "epoch": 0.32495238095238094, "grad_norm": 0.029350455850362778, "learning_rate": 0.024000000208616257, "loss": 2.3561253547668457, "step": 6824 }, { "epoch": 0.32504761904761903, "grad_norm": 0.028233183547854424, "learning_rate": 0.024000000208616257, "loss": 2.338207244873047, "step": 6826 }, { "epoch": 0.3251428571428571, "grad_norm": 0.028721828013658524, "learning_rate": 0.024000000208616257, "loss": 2.373077392578125, "step": 6828 }, { "epoch": 0.3252380952380952, "grad_norm": 0.03025970421731472, "learning_rate": 0.024000000208616257, "loss": 2.3636488914489746, "step": 6830 }, { "epoch": 0.3253333333333333, "grad_norm": 0.02994028851389885, "learning_rate": 0.024000000208616257, "loss": 2.357119083404541, "step": 6832 }, { "epoch": 0.32542857142857146, "grad_norm": 0.030633581802248955, "learning_rate": 0.024000000208616257, "loss": 2.326077461242676, "step": 6834 }, { "epoch": 0.32552380952380955, "grad_norm": 0.0305038932710886, "learning_rate": 0.024000000208616257, "loss": 2.3835806846618652, "step": 6836 }, { "epoch": 0.32561904761904764, "grad_norm": 0.029431983828544617, "learning_rate": 0.024000000208616257, "loss": 2.3587985038757324, "step": 6838 }, { "epoch": 0.32571428571428573, "grad_norm": 0.03369675576686859, "learning_rate": 0.024000000208616257, "loss": 2.3676254749298096, "step": 6840 }, { "epoch": 0.3258095238095238, "grad_norm": 0.031320299953222275, "learning_rate": 0.024000000208616257, "loss": 2.379446029663086, "step": 6842 }, { "epoch": 0.3259047619047619, "grad_norm": 0.03001028299331665, "learning_rate": 0.024000000208616257, "loss": 2.3561086654663086, "step": 6844 }, { "epoch": 0.326, "grad_norm": 0.030707336962223053, "learning_rate": 0.024000000208616257, "loss": 2.3800477981567383, "step": 6846 }, { "epoch": 0.3260952380952381, "grad_norm": 0.03069991059601307, "learning_rate": 0.024000000208616257, "loss": 2.379668712615967, "step": 6848 }, { "epoch": 0.3261904761904762, "grad_norm": 0.030798401683568954, "learning_rate": 0.024000000208616257, "loss": 2.3752713203430176, "step": 6850 }, { "epoch": 0.3262857142857143, "grad_norm": 0.03111075609922409, "learning_rate": 0.024000000208616257, "loss": 2.381896495819092, "step": 6852 }, { "epoch": 0.3263809523809524, "grad_norm": 0.029117895290255547, "learning_rate": 0.024000000208616257, "loss": 2.3652634620666504, "step": 6854 }, { "epoch": 0.3264761904761905, "grad_norm": 0.030826520174741745, "learning_rate": 0.024000000208616257, "loss": 2.3466575145721436, "step": 6856 }, { "epoch": 0.32657142857142857, "grad_norm": 0.03189202770590782, "learning_rate": 0.024000000208616257, "loss": 2.360050678253174, "step": 6858 }, { "epoch": 0.32666666666666666, "grad_norm": 0.03183364495635033, "learning_rate": 0.024000000208616257, "loss": 2.3649508953094482, "step": 6860 }, { "epoch": 0.32676190476190475, "grad_norm": 0.0303238183259964, "learning_rate": 0.024000000208616257, "loss": 2.4177331924438477, "step": 6862 }, { "epoch": 0.32685714285714285, "grad_norm": 0.029735160991549492, "learning_rate": 0.024000000208616257, "loss": 2.3377346992492676, "step": 6864 }, { "epoch": 0.32695238095238094, "grad_norm": 0.029342984780669212, "learning_rate": 0.024000000208616257, "loss": 2.368034839630127, "step": 6866 }, { "epoch": 0.32704761904761903, "grad_norm": 0.030503233894705772, "learning_rate": 0.024000000208616257, "loss": 2.3845431804656982, "step": 6868 }, { "epoch": 0.3271428571428571, "grad_norm": 0.030803989619016647, "learning_rate": 0.024000000208616257, "loss": 2.350325107574463, "step": 6870 }, { "epoch": 0.3272380952380952, "grad_norm": 0.028206681832671165, "learning_rate": 0.024000000208616257, "loss": 2.3423924446105957, "step": 6872 }, { "epoch": 0.3273333333333333, "grad_norm": 0.028482219204306602, "learning_rate": 0.024000000208616257, "loss": 2.367105722427368, "step": 6874 }, { "epoch": 0.3274285714285714, "grad_norm": 0.02842320315539837, "learning_rate": 0.024000000208616257, "loss": 2.380890369415283, "step": 6876 }, { "epoch": 0.32752380952380955, "grad_norm": 0.030156293883919716, "learning_rate": 0.024000000208616257, "loss": 2.362187385559082, "step": 6878 }, { "epoch": 0.32761904761904764, "grad_norm": 0.029826704412698746, "learning_rate": 0.024000000208616257, "loss": 2.373478412628174, "step": 6880 }, { "epoch": 0.32771428571428574, "grad_norm": 0.0359187014400959, "learning_rate": 0.024000000208616257, "loss": 2.366511821746826, "step": 6882 }, { "epoch": 0.32780952380952383, "grad_norm": 0.03139779716730118, "learning_rate": 0.024000000208616257, "loss": 2.4161458015441895, "step": 6884 }, { "epoch": 0.3279047619047619, "grad_norm": 0.033382683992385864, "learning_rate": 0.024000000208616257, "loss": 2.390726089477539, "step": 6886 }, { "epoch": 0.328, "grad_norm": 0.031857602298259735, "learning_rate": 0.024000000208616257, "loss": 2.3766746520996094, "step": 6888 }, { "epoch": 0.3280952380952381, "grad_norm": 0.03072267398238182, "learning_rate": 0.024000000208616257, "loss": 2.3787970542907715, "step": 6890 }, { "epoch": 0.3281904761904762, "grad_norm": 0.028397629037499428, "learning_rate": 0.024000000208616257, "loss": 2.4100608825683594, "step": 6892 }, { "epoch": 0.3282857142857143, "grad_norm": 0.02880684658885002, "learning_rate": 0.024000000208616257, "loss": 2.3839926719665527, "step": 6894 }, { "epoch": 0.3283809523809524, "grad_norm": 0.029076935723423958, "learning_rate": 0.024000000208616257, "loss": 2.3692197799682617, "step": 6896 }, { "epoch": 0.3284761904761905, "grad_norm": 0.029319530352950096, "learning_rate": 0.024000000208616257, "loss": 2.398632526397705, "step": 6898 }, { "epoch": 0.32857142857142857, "grad_norm": 0.029993785545229912, "learning_rate": 0.024000000208616257, "loss": 2.388760566711426, "step": 6900 }, { "epoch": 0.32866666666666666, "grad_norm": 0.029682567343115807, "learning_rate": 0.024000000208616257, "loss": 2.340564489364624, "step": 6902 }, { "epoch": 0.32876190476190476, "grad_norm": 0.031599901616573334, "learning_rate": 0.024000000208616257, "loss": 2.330897808074951, "step": 6904 }, { "epoch": 0.32885714285714285, "grad_norm": 0.030086439102888107, "learning_rate": 0.024000000208616257, "loss": 2.3525290489196777, "step": 6906 }, { "epoch": 0.32895238095238094, "grad_norm": 0.029382184147834778, "learning_rate": 0.024000000208616257, "loss": 2.393484354019165, "step": 6908 }, { "epoch": 0.32904761904761903, "grad_norm": 0.028108954429626465, "learning_rate": 0.024000000208616257, "loss": 2.3695590496063232, "step": 6910 }, { "epoch": 0.3291428571428571, "grad_norm": 0.02977841906249523, "learning_rate": 0.024000000208616257, "loss": 2.4104251861572266, "step": 6912 }, { "epoch": 0.3292380952380952, "grad_norm": 0.02960912510752678, "learning_rate": 0.024000000208616257, "loss": 2.3727331161499023, "step": 6914 }, { "epoch": 0.3293333333333333, "grad_norm": 0.02889445051550865, "learning_rate": 0.024000000208616257, "loss": 2.386174201965332, "step": 6916 }, { "epoch": 0.3294285714285714, "grad_norm": 0.030402930453419685, "learning_rate": 0.024000000208616257, "loss": 2.3924994468688965, "step": 6918 }, { "epoch": 0.3295238095238095, "grad_norm": 0.028691446408629417, "learning_rate": 0.024000000208616257, "loss": 2.3647494316101074, "step": 6920 }, { "epoch": 0.32961904761904764, "grad_norm": 0.03016674518585205, "learning_rate": 0.024000000208616257, "loss": 2.363886833190918, "step": 6922 }, { "epoch": 0.32971428571428574, "grad_norm": 0.03133035823702812, "learning_rate": 0.024000000208616257, "loss": 2.410017967224121, "step": 6924 }, { "epoch": 0.32980952380952383, "grad_norm": 0.029157087206840515, "learning_rate": 0.024000000208616257, "loss": 2.403724193572998, "step": 6926 }, { "epoch": 0.3299047619047619, "grad_norm": 0.02887115441262722, "learning_rate": 0.024000000208616257, "loss": 2.390021324157715, "step": 6928 }, { "epoch": 0.33, "grad_norm": 0.02816702052950859, "learning_rate": 0.024000000208616257, "loss": 2.40718936920166, "step": 6930 }, { "epoch": 0.3300952380952381, "grad_norm": 0.029356172308325768, "learning_rate": 0.024000000208616257, "loss": 2.3882508277893066, "step": 6932 }, { "epoch": 0.3301904761904762, "grad_norm": 0.03039124235510826, "learning_rate": 0.024000000208616257, "loss": 2.4030556678771973, "step": 6934 }, { "epoch": 0.3302857142857143, "grad_norm": 0.03127926215529442, "learning_rate": 0.024000000208616257, "loss": 2.4271087646484375, "step": 6936 }, { "epoch": 0.3303809523809524, "grad_norm": 0.03440895676612854, "learning_rate": 0.024000000208616257, "loss": 2.3990509510040283, "step": 6938 }, { "epoch": 0.3304761904761905, "grad_norm": 0.030441921204328537, "learning_rate": 0.024000000208616257, "loss": 2.417489528656006, "step": 6940 }, { "epoch": 0.33057142857142857, "grad_norm": 0.029313666746020317, "learning_rate": 0.024000000208616257, "loss": 2.3929853439331055, "step": 6942 }, { "epoch": 0.33066666666666666, "grad_norm": 0.02986820414662361, "learning_rate": 0.024000000208616257, "loss": 2.4304940700531006, "step": 6944 }, { "epoch": 0.33076190476190476, "grad_norm": 0.029990557581186295, "learning_rate": 0.024000000208616257, "loss": 2.411107063293457, "step": 6946 }, { "epoch": 0.33085714285714285, "grad_norm": 0.034136075526475906, "learning_rate": 0.024000000208616257, "loss": 2.383619546890259, "step": 6948 }, { "epoch": 0.33095238095238094, "grad_norm": 0.02885344997048378, "learning_rate": 0.024000000208616257, "loss": 2.3991527557373047, "step": 6950 }, { "epoch": 0.33104761904761904, "grad_norm": 0.02897188812494278, "learning_rate": 0.024000000208616257, "loss": 2.3875036239624023, "step": 6952 }, { "epoch": 0.3311428571428571, "grad_norm": 0.029557017609477043, "learning_rate": 0.024000000208616257, "loss": 2.3957831859588623, "step": 6954 }, { "epoch": 0.3312380952380952, "grad_norm": 0.029947176575660706, "learning_rate": 0.024000000208616257, "loss": 2.390134811401367, "step": 6956 }, { "epoch": 0.3313333333333333, "grad_norm": 0.02990059182047844, "learning_rate": 0.024000000208616257, "loss": 2.381887912750244, "step": 6958 }, { "epoch": 0.3314285714285714, "grad_norm": 0.02921842411160469, "learning_rate": 0.024000000208616257, "loss": 2.4007344245910645, "step": 6960 }, { "epoch": 0.3315238095238095, "grad_norm": 0.028914738446474075, "learning_rate": 0.024000000208616257, "loss": 2.40413236618042, "step": 6962 }, { "epoch": 0.33161904761904765, "grad_norm": 0.029783714562654495, "learning_rate": 0.024000000208616257, "loss": 2.4362387657165527, "step": 6964 }, { "epoch": 0.33171428571428574, "grad_norm": 0.02916163206100464, "learning_rate": 0.024000000208616257, "loss": 2.4320926666259766, "step": 6966 }, { "epoch": 0.33180952380952383, "grad_norm": 0.029726408421993256, "learning_rate": 0.024000000208616257, "loss": 2.4382853507995605, "step": 6968 }, { "epoch": 0.3319047619047619, "grad_norm": 0.029048137366771698, "learning_rate": 0.024000000208616257, "loss": 2.393087863922119, "step": 6970 }, { "epoch": 0.332, "grad_norm": 0.028565706685185432, "learning_rate": 0.024000000208616257, "loss": 2.452376365661621, "step": 6972 }, { "epoch": 0.3320952380952381, "grad_norm": 0.02989874966442585, "learning_rate": 0.024000000208616257, "loss": 2.438532829284668, "step": 6974 }, { "epoch": 0.3321904761904762, "grad_norm": 0.02967716194689274, "learning_rate": 0.024000000208616257, "loss": 2.3955397605895996, "step": 6976 }, { "epoch": 0.3322857142857143, "grad_norm": 0.029272885993123055, "learning_rate": 0.024000000208616257, "loss": 2.4064364433288574, "step": 6978 }, { "epoch": 0.3323809523809524, "grad_norm": 0.028716832399368286, "learning_rate": 0.024000000208616257, "loss": 2.4012181758880615, "step": 6980 }, { "epoch": 0.3324761904761905, "grad_norm": 0.029680602252483368, "learning_rate": 0.024000000208616257, "loss": 2.4292726516723633, "step": 6982 }, { "epoch": 0.3325714285714286, "grad_norm": 0.028991740196943283, "learning_rate": 0.024000000208616257, "loss": 2.421337604522705, "step": 6984 }, { "epoch": 0.33266666666666667, "grad_norm": 0.02994304709136486, "learning_rate": 0.024000000208616257, "loss": 2.420278549194336, "step": 6986 }, { "epoch": 0.33276190476190476, "grad_norm": 0.02911573089659214, "learning_rate": 0.024000000208616257, "loss": 2.4111337661743164, "step": 6988 }, { "epoch": 0.33285714285714285, "grad_norm": 0.027842700481414795, "learning_rate": 0.024000000208616257, "loss": 2.4446821212768555, "step": 6990 }, { "epoch": 0.33295238095238094, "grad_norm": 0.028856541961431503, "learning_rate": 0.024000000208616257, "loss": 2.4105172157287598, "step": 6992 }, { "epoch": 0.33304761904761904, "grad_norm": 0.029169991612434387, "learning_rate": 0.024000000208616257, "loss": 2.4082086086273193, "step": 6994 }, { "epoch": 0.33314285714285713, "grad_norm": 0.02955012582242489, "learning_rate": 0.024000000208616257, "loss": 2.4080920219421387, "step": 6996 }, { "epoch": 0.3332380952380952, "grad_norm": 0.030604831874370575, "learning_rate": 0.024000000208616257, "loss": 2.424211025238037, "step": 6998 }, { "epoch": 0.3333333333333333, "grad_norm": 0.03272611275315285, "learning_rate": 0.024000000208616257, "loss": 2.4005627632141113, "step": 7000 }, { "epoch": 0.3334285714285714, "grad_norm": 0.03470318764448166, "learning_rate": 0.024000000208616257, "loss": 2.431544303894043, "step": 7002 }, { "epoch": 0.3335238095238095, "grad_norm": 0.034915074706077576, "learning_rate": 0.024000000208616257, "loss": 2.4524762630462646, "step": 7004 }, { "epoch": 0.3336190476190476, "grad_norm": 0.028626343235373497, "learning_rate": 0.024000000208616257, "loss": 2.4053690433502197, "step": 7006 }, { "epoch": 0.33371428571428574, "grad_norm": 0.030348224565386772, "learning_rate": 0.024000000208616257, "loss": 2.4384469985961914, "step": 7008 }, { "epoch": 0.33380952380952383, "grad_norm": 0.03393451124429703, "learning_rate": 0.024000000208616257, "loss": 2.4207677841186523, "step": 7010 }, { "epoch": 0.3339047619047619, "grad_norm": 0.028987819328904152, "learning_rate": 0.024000000208616257, "loss": 2.446026086807251, "step": 7012 }, { "epoch": 0.334, "grad_norm": 0.029999880120158195, "learning_rate": 0.024000000208616257, "loss": 2.424818754196167, "step": 7014 }, { "epoch": 0.3340952380952381, "grad_norm": 0.029403716325759888, "learning_rate": 0.024000000208616257, "loss": 2.4614667892456055, "step": 7016 }, { "epoch": 0.3341904761904762, "grad_norm": 0.030864877626299858, "learning_rate": 0.024000000208616257, "loss": 2.408066749572754, "step": 7018 }, { "epoch": 0.3342857142857143, "grad_norm": 0.028570184484124184, "learning_rate": 0.024000000208616257, "loss": 2.4517722129821777, "step": 7020 }, { "epoch": 0.3343809523809524, "grad_norm": 0.02860090136528015, "learning_rate": 0.024000000208616257, "loss": 2.3968334197998047, "step": 7022 }, { "epoch": 0.3344761904761905, "grad_norm": 0.029398715123534203, "learning_rate": 0.024000000208616257, "loss": 2.4032046794891357, "step": 7024 }, { "epoch": 0.3345714285714286, "grad_norm": 0.02817380800843239, "learning_rate": 0.024000000208616257, "loss": 2.4293770790100098, "step": 7026 }, { "epoch": 0.33466666666666667, "grad_norm": 0.02911488339304924, "learning_rate": 0.024000000208616257, "loss": 2.4307146072387695, "step": 7028 }, { "epoch": 0.33476190476190476, "grad_norm": 0.027685437351465225, "learning_rate": 0.024000000208616257, "loss": 2.4240169525146484, "step": 7030 }, { "epoch": 0.33485714285714285, "grad_norm": 0.028887353837490082, "learning_rate": 0.024000000208616257, "loss": 2.4378843307495117, "step": 7032 }, { "epoch": 0.33495238095238095, "grad_norm": 0.02963896654546261, "learning_rate": 0.024000000208616257, "loss": 2.4065303802490234, "step": 7034 }, { "epoch": 0.33504761904761904, "grad_norm": 0.03217792883515358, "learning_rate": 0.024000000208616257, "loss": 2.4400086402893066, "step": 7036 }, { "epoch": 0.33514285714285713, "grad_norm": 0.030193371698260307, "learning_rate": 0.024000000208616257, "loss": 2.421281337738037, "step": 7038 }, { "epoch": 0.3352380952380952, "grad_norm": 0.02918841689825058, "learning_rate": 0.024000000208616257, "loss": 2.459702491760254, "step": 7040 }, { "epoch": 0.3353333333333333, "grad_norm": 0.028700634837150574, "learning_rate": 0.024000000208616257, "loss": 2.4330642223358154, "step": 7042 }, { "epoch": 0.3354285714285714, "grad_norm": 0.028685132041573524, "learning_rate": 0.024000000208616257, "loss": 2.4279274940490723, "step": 7044 }, { "epoch": 0.3355238095238095, "grad_norm": 0.029339410364627838, "learning_rate": 0.024000000208616257, "loss": 2.4440269470214844, "step": 7046 }, { "epoch": 0.3356190476190476, "grad_norm": 0.029520118609070778, "learning_rate": 0.024000000208616257, "loss": 2.418275833129883, "step": 7048 }, { "epoch": 0.3357142857142857, "grad_norm": 0.030472509562969208, "learning_rate": 0.024000000208616257, "loss": 2.4447946548461914, "step": 7050 }, { "epoch": 0.33580952380952384, "grad_norm": 0.02895457297563553, "learning_rate": 0.024000000208616257, "loss": 2.4198036193847656, "step": 7052 }, { "epoch": 0.33590476190476193, "grad_norm": 0.029851580038666725, "learning_rate": 0.024000000208616257, "loss": 2.462186813354492, "step": 7054 }, { "epoch": 0.336, "grad_norm": 0.028468342497944832, "learning_rate": 0.024000000208616257, "loss": 2.4431376457214355, "step": 7056 }, { "epoch": 0.3360952380952381, "grad_norm": 0.028307003900408745, "learning_rate": 0.024000000208616257, "loss": 2.4455180168151855, "step": 7058 }, { "epoch": 0.3361904761904762, "grad_norm": 0.029147827997803688, "learning_rate": 0.024000000208616257, "loss": 2.437354564666748, "step": 7060 }, { "epoch": 0.3362857142857143, "grad_norm": 0.028990380465984344, "learning_rate": 0.024000000208616257, "loss": 2.433863878250122, "step": 7062 }, { "epoch": 0.3363809523809524, "grad_norm": 0.02805459499359131, "learning_rate": 0.024000000208616257, "loss": 2.4258453845977783, "step": 7064 }, { "epoch": 0.3364761904761905, "grad_norm": 0.02866201661527157, "learning_rate": 0.024000000208616257, "loss": 2.4297640323638916, "step": 7066 }, { "epoch": 0.3365714285714286, "grad_norm": 0.02888469584286213, "learning_rate": 0.024000000208616257, "loss": 2.422247886657715, "step": 7068 }, { "epoch": 0.33666666666666667, "grad_norm": 0.02833429165184498, "learning_rate": 0.024000000208616257, "loss": 2.473562479019165, "step": 7070 }, { "epoch": 0.33676190476190476, "grad_norm": 0.028570959344506264, "learning_rate": 0.024000000208616257, "loss": 2.482819080352783, "step": 7072 }, { "epoch": 0.33685714285714285, "grad_norm": 0.030939733609557152, "learning_rate": 0.024000000208616257, "loss": 2.4534223079681396, "step": 7074 }, { "epoch": 0.33695238095238095, "grad_norm": 0.03351357951760292, "learning_rate": 0.024000000208616257, "loss": 2.4560351371765137, "step": 7076 }, { "epoch": 0.33704761904761904, "grad_norm": 0.03135859966278076, "learning_rate": 0.024000000208616257, "loss": 2.4564695358276367, "step": 7078 }, { "epoch": 0.33714285714285713, "grad_norm": 0.028630919754505157, "learning_rate": 0.024000000208616257, "loss": 2.4311838150024414, "step": 7080 }, { "epoch": 0.3372380952380952, "grad_norm": 0.029535846784710884, "learning_rate": 0.024000000208616257, "loss": 2.486880302429199, "step": 7082 }, { "epoch": 0.3373333333333333, "grad_norm": 0.029725566506385803, "learning_rate": 0.024000000208616257, "loss": 2.4400253295898438, "step": 7084 }, { "epoch": 0.3374285714285714, "grad_norm": 0.031099854037165642, "learning_rate": 0.024000000208616257, "loss": 2.471480131149292, "step": 7086 }, { "epoch": 0.3375238095238095, "grad_norm": 0.028955642133951187, "learning_rate": 0.024000000208616257, "loss": 2.452303647994995, "step": 7088 }, { "epoch": 0.3376190476190476, "grad_norm": 0.0295866746455431, "learning_rate": 0.024000000208616257, "loss": 2.4470043182373047, "step": 7090 }, { "epoch": 0.3377142857142857, "grad_norm": 0.028985003009438515, "learning_rate": 0.024000000208616257, "loss": 2.4337213039398193, "step": 7092 }, { "epoch": 0.3378095238095238, "grad_norm": 0.029296183958649635, "learning_rate": 0.024000000208616257, "loss": 2.4490256309509277, "step": 7094 }, { "epoch": 0.33790476190476193, "grad_norm": 0.029807470738887787, "learning_rate": 0.024000000208616257, "loss": 2.463074207305908, "step": 7096 }, { "epoch": 0.338, "grad_norm": 0.03494802117347717, "learning_rate": 0.024000000208616257, "loss": 2.464341163635254, "step": 7098 }, { "epoch": 0.3380952380952381, "grad_norm": 0.0339457169175148, "learning_rate": 0.024000000208616257, "loss": 2.4417307376861572, "step": 7100 }, { "epoch": 0.3381904761904762, "grad_norm": 0.030883677303791046, "learning_rate": 0.024000000208616257, "loss": 2.4456703662872314, "step": 7102 }, { "epoch": 0.3382857142857143, "grad_norm": 0.030917132273316383, "learning_rate": 0.024000000208616257, "loss": 2.4294309616088867, "step": 7104 }, { "epoch": 0.3383809523809524, "grad_norm": 0.031940482556819916, "learning_rate": 0.024000000208616257, "loss": 2.4503893852233887, "step": 7106 }, { "epoch": 0.3384761904761905, "grad_norm": 0.02850324474275112, "learning_rate": 0.024000000208616257, "loss": 2.4551210403442383, "step": 7108 }, { "epoch": 0.3385714285714286, "grad_norm": 0.02892199344933033, "learning_rate": 0.024000000208616257, "loss": 2.4666802883148193, "step": 7110 }, { "epoch": 0.33866666666666667, "grad_norm": 0.02926999144256115, "learning_rate": 0.024000000208616257, "loss": 2.4730470180511475, "step": 7112 }, { "epoch": 0.33876190476190476, "grad_norm": 0.02862759493291378, "learning_rate": 0.024000000208616257, "loss": 2.4827075004577637, "step": 7114 }, { "epoch": 0.33885714285714286, "grad_norm": 0.03394423425197601, "learning_rate": 0.024000000208616257, "loss": 2.495112419128418, "step": 7116 }, { "epoch": 0.33895238095238095, "grad_norm": 0.03292897343635559, "learning_rate": 0.024000000208616257, "loss": 2.462902545928955, "step": 7118 }, { "epoch": 0.33904761904761904, "grad_norm": 0.029087886214256287, "learning_rate": 0.024000000208616257, "loss": 2.4767870903015137, "step": 7120 }, { "epoch": 0.33914285714285713, "grad_norm": 0.02848999947309494, "learning_rate": 0.024000000208616257, "loss": 2.4535558223724365, "step": 7122 }, { "epoch": 0.3392380952380952, "grad_norm": 0.028942549601197243, "learning_rate": 0.024000000208616257, "loss": 2.4633374214172363, "step": 7124 }, { "epoch": 0.3393333333333333, "grad_norm": 0.030422993004322052, "learning_rate": 0.024000000208616257, "loss": 2.4641377925872803, "step": 7126 }, { "epoch": 0.3394285714285714, "grad_norm": 0.0298859104514122, "learning_rate": 0.024000000208616257, "loss": 2.443366527557373, "step": 7128 }, { "epoch": 0.3395238095238095, "grad_norm": 0.02830277569591999, "learning_rate": 0.024000000208616257, "loss": 2.4580540657043457, "step": 7130 }, { "epoch": 0.3396190476190476, "grad_norm": 0.02830120548605919, "learning_rate": 0.024000000208616257, "loss": 2.4298129081726074, "step": 7132 }, { "epoch": 0.3397142857142857, "grad_norm": 0.03011920116841793, "learning_rate": 0.024000000208616257, "loss": 2.423710584640503, "step": 7134 }, { "epoch": 0.3398095238095238, "grad_norm": 0.031069522723555565, "learning_rate": 0.024000000208616257, "loss": 2.498598098754883, "step": 7136 }, { "epoch": 0.33990476190476193, "grad_norm": 0.027827180922031403, "learning_rate": 0.024000000208616257, "loss": 2.4385294914245605, "step": 7138 }, { "epoch": 0.34, "grad_norm": 0.02812875248491764, "learning_rate": 0.024000000208616257, "loss": 2.4477288722991943, "step": 7140 }, { "epoch": 0.3400952380952381, "grad_norm": 0.02960381656885147, "learning_rate": 0.024000000208616257, "loss": 2.4679620265960693, "step": 7142 }, { "epoch": 0.3401904761904762, "grad_norm": 0.028551479801535606, "learning_rate": 0.024000000208616257, "loss": 2.4510841369628906, "step": 7144 }, { "epoch": 0.3402857142857143, "grad_norm": 0.03191690146923065, "learning_rate": 0.024000000208616257, "loss": 2.4956512451171875, "step": 7146 }, { "epoch": 0.3403809523809524, "grad_norm": 0.0351298525929451, "learning_rate": 0.024000000208616257, "loss": 2.4695401191711426, "step": 7148 }, { "epoch": 0.3404761904761905, "grad_norm": 0.033132974058389664, "learning_rate": 0.024000000208616257, "loss": 2.46604585647583, "step": 7150 }, { "epoch": 0.3405714285714286, "grad_norm": 0.030658526346087456, "learning_rate": 0.024000000208616257, "loss": 2.463367462158203, "step": 7152 }, { "epoch": 0.3406666666666667, "grad_norm": 0.029598530381917953, "learning_rate": 0.024000000208616257, "loss": 2.523293972015381, "step": 7154 }, { "epoch": 0.34076190476190477, "grad_norm": 0.029483787715435028, "learning_rate": 0.024000000208616257, "loss": 2.466376781463623, "step": 7156 }, { "epoch": 0.34085714285714286, "grad_norm": 0.028604887425899506, "learning_rate": 0.024000000208616257, "loss": 2.4673075675964355, "step": 7158 }, { "epoch": 0.34095238095238095, "grad_norm": 0.029819631949067116, "learning_rate": 0.024000000208616257, "loss": 2.4544901847839355, "step": 7160 }, { "epoch": 0.34104761904761904, "grad_norm": 0.02974962256848812, "learning_rate": 0.024000000208616257, "loss": 2.4503908157348633, "step": 7162 }, { "epoch": 0.34114285714285714, "grad_norm": 0.027605820447206497, "learning_rate": 0.024000000208616257, "loss": 2.500955820083618, "step": 7164 }, { "epoch": 0.34123809523809523, "grad_norm": 0.028526684269309044, "learning_rate": 0.024000000208616257, "loss": 2.4901552200317383, "step": 7166 }, { "epoch": 0.3413333333333333, "grad_norm": 0.028147904202342033, "learning_rate": 0.024000000208616257, "loss": 2.4575531482696533, "step": 7168 }, { "epoch": 0.3414285714285714, "grad_norm": 0.029349802061915398, "learning_rate": 0.024000000208616257, "loss": 2.4632768630981445, "step": 7170 }, { "epoch": 0.3415238095238095, "grad_norm": 0.03037298657000065, "learning_rate": 0.024000000208616257, "loss": 2.457612991333008, "step": 7172 }, { "epoch": 0.3416190476190476, "grad_norm": 0.031271085143089294, "learning_rate": 0.024000000208616257, "loss": 2.464320659637451, "step": 7174 }, { "epoch": 0.3417142857142857, "grad_norm": 0.029048999771475792, "learning_rate": 0.024000000208616257, "loss": 2.463287830352783, "step": 7176 }, { "epoch": 0.3418095238095238, "grad_norm": 0.02924540266394615, "learning_rate": 0.024000000208616257, "loss": 2.4439172744750977, "step": 7178 }, { "epoch": 0.3419047619047619, "grad_norm": 0.02843838930130005, "learning_rate": 0.024000000208616257, "loss": 2.423173427581787, "step": 7180 }, { "epoch": 0.342, "grad_norm": 0.027904484421014786, "learning_rate": 0.024000000208616257, "loss": 2.4402568340301514, "step": 7182 }, { "epoch": 0.3420952380952381, "grad_norm": 0.030173301696777344, "learning_rate": 0.024000000208616257, "loss": 2.472141742706299, "step": 7184 }, { "epoch": 0.3421904761904762, "grad_norm": 0.03218153119087219, "learning_rate": 0.024000000208616257, "loss": 2.4705193042755127, "step": 7186 }, { "epoch": 0.3422857142857143, "grad_norm": 0.02841062657535076, "learning_rate": 0.024000000208616257, "loss": 2.45914363861084, "step": 7188 }, { "epoch": 0.3423809523809524, "grad_norm": 0.028493352234363556, "learning_rate": 0.024000000208616257, "loss": 2.519477128982544, "step": 7190 }, { "epoch": 0.3424761904761905, "grad_norm": 0.02945573255419731, "learning_rate": 0.024000000208616257, "loss": 2.4674437046051025, "step": 7192 }, { "epoch": 0.3425714285714286, "grad_norm": 0.028700729832053185, "learning_rate": 0.024000000208616257, "loss": 2.4787631034851074, "step": 7194 }, { "epoch": 0.3426666666666667, "grad_norm": 0.029406318441033363, "learning_rate": 0.024000000208616257, "loss": 2.4980711936950684, "step": 7196 }, { "epoch": 0.34276190476190477, "grad_norm": 0.03115459345281124, "learning_rate": 0.024000000208616257, "loss": 2.4907050132751465, "step": 7198 }, { "epoch": 0.34285714285714286, "grad_norm": 0.030964750796556473, "learning_rate": 0.024000000208616257, "loss": 2.490243911743164, "step": 7200 }, { "epoch": 0.34295238095238095, "grad_norm": 0.029313424602150917, "learning_rate": 0.024000000208616257, "loss": 2.504526138305664, "step": 7202 }, { "epoch": 0.34304761904761905, "grad_norm": 0.030464263632893562, "learning_rate": 0.024000000208616257, "loss": 2.5088295936584473, "step": 7204 }, { "epoch": 0.34314285714285714, "grad_norm": 0.031024502590298653, "learning_rate": 0.024000000208616257, "loss": 2.5073044300079346, "step": 7206 }, { "epoch": 0.34323809523809523, "grad_norm": 0.029009822756052017, "learning_rate": 0.024000000208616257, "loss": 2.462553024291992, "step": 7208 }, { "epoch": 0.3433333333333333, "grad_norm": 0.0356479249894619, "learning_rate": 0.024000000208616257, "loss": 2.450239419937134, "step": 7210 }, { "epoch": 0.3434285714285714, "grad_norm": 0.03435588628053665, "learning_rate": 0.024000000208616257, "loss": 2.4902901649475098, "step": 7212 }, { "epoch": 0.3435238095238095, "grad_norm": 0.033255435526371, "learning_rate": 0.024000000208616257, "loss": 2.4574522972106934, "step": 7214 }, { "epoch": 0.3436190476190476, "grad_norm": 0.04126044362783432, "learning_rate": 0.024000000208616257, "loss": 2.4765820503234863, "step": 7216 }, { "epoch": 0.3437142857142857, "grad_norm": 0.030936727300286293, "learning_rate": 0.024000000208616257, "loss": 2.458669662475586, "step": 7218 }, { "epoch": 0.3438095238095238, "grad_norm": 0.03068406507372856, "learning_rate": 0.024000000208616257, "loss": 2.4737532138824463, "step": 7220 }, { "epoch": 0.3439047619047619, "grad_norm": 0.03037591464817524, "learning_rate": 0.024000000208616257, "loss": 2.474289894104004, "step": 7222 }, { "epoch": 0.344, "grad_norm": 0.029864152893424034, "learning_rate": 0.024000000208616257, "loss": 2.4798991680145264, "step": 7224 }, { "epoch": 0.3440952380952381, "grad_norm": 0.02870749495923519, "learning_rate": 0.024000000208616257, "loss": 2.491424322128296, "step": 7226 }, { "epoch": 0.3441904761904762, "grad_norm": 0.02912965975701809, "learning_rate": 0.024000000208616257, "loss": 2.4716386795043945, "step": 7228 }, { "epoch": 0.3442857142857143, "grad_norm": 0.028883563354611397, "learning_rate": 0.024000000208616257, "loss": 2.468576669692993, "step": 7230 }, { "epoch": 0.3443809523809524, "grad_norm": 0.030738983303308487, "learning_rate": 0.024000000208616257, "loss": 2.5450081825256348, "step": 7232 }, { "epoch": 0.3444761904761905, "grad_norm": 0.03250139206647873, "learning_rate": 0.024000000208616257, "loss": 2.4857592582702637, "step": 7234 }, { "epoch": 0.3445714285714286, "grad_norm": 0.029801970347762108, "learning_rate": 0.024000000208616257, "loss": 2.487823486328125, "step": 7236 }, { "epoch": 0.3446666666666667, "grad_norm": 0.02863362245261669, "learning_rate": 0.024000000208616257, "loss": 2.457735538482666, "step": 7238 }, { "epoch": 0.34476190476190477, "grad_norm": 0.03034256398677826, "learning_rate": 0.024000000208616257, "loss": 2.5020687580108643, "step": 7240 }, { "epoch": 0.34485714285714286, "grad_norm": 0.02942848391830921, "learning_rate": 0.024000000208616257, "loss": 2.5086185932159424, "step": 7242 }, { "epoch": 0.34495238095238095, "grad_norm": 0.031980857253074646, "learning_rate": 0.024000000208616257, "loss": 2.4664902687072754, "step": 7244 }, { "epoch": 0.34504761904761905, "grad_norm": 0.02999952808022499, "learning_rate": 0.024000000208616257, "loss": 2.5107102394104004, "step": 7246 }, { "epoch": 0.34514285714285714, "grad_norm": 0.029638033360242844, "learning_rate": 0.024000000208616257, "loss": 2.492959499359131, "step": 7248 }, { "epoch": 0.34523809523809523, "grad_norm": 0.03213273733854294, "learning_rate": 0.024000000208616257, "loss": 2.501483201980591, "step": 7250 }, { "epoch": 0.3453333333333333, "grad_norm": 0.030824650079011917, "learning_rate": 0.024000000208616257, "loss": 2.455821990966797, "step": 7252 }, { "epoch": 0.3454285714285714, "grad_norm": 0.031094126403331757, "learning_rate": 0.024000000208616257, "loss": 2.505587577819824, "step": 7254 }, { "epoch": 0.3455238095238095, "grad_norm": 0.028878873214125633, "learning_rate": 0.024000000208616257, "loss": 2.4963369369506836, "step": 7256 }, { "epoch": 0.3456190476190476, "grad_norm": 0.03145955875515938, "learning_rate": 0.024000000208616257, "loss": 2.480407238006592, "step": 7258 }, { "epoch": 0.3457142857142857, "grad_norm": 0.029653044417500496, "learning_rate": 0.024000000208616257, "loss": 2.487546920776367, "step": 7260 }, { "epoch": 0.3458095238095238, "grad_norm": 0.028438007459044456, "learning_rate": 0.024000000208616257, "loss": 2.501030921936035, "step": 7262 }, { "epoch": 0.3459047619047619, "grad_norm": 0.0294172465801239, "learning_rate": 0.024000000208616257, "loss": 2.5115904808044434, "step": 7264 }, { "epoch": 0.346, "grad_norm": 0.03162037208676338, "learning_rate": 0.024000000208616257, "loss": 2.4564995765686035, "step": 7266 }, { "epoch": 0.3460952380952381, "grad_norm": 0.029247205704450607, "learning_rate": 0.024000000208616257, "loss": 2.4929494857788086, "step": 7268 }, { "epoch": 0.3461904761904762, "grad_norm": 0.029292277991771698, "learning_rate": 0.024000000208616257, "loss": 2.491727352142334, "step": 7270 }, { "epoch": 0.3462857142857143, "grad_norm": 0.03074842132627964, "learning_rate": 0.024000000208616257, "loss": 2.488158941268921, "step": 7272 }, { "epoch": 0.3463809523809524, "grad_norm": 0.029288263991475105, "learning_rate": 0.024000000208616257, "loss": 2.4573826789855957, "step": 7274 }, { "epoch": 0.3464761904761905, "grad_norm": 0.029053131118416786, "learning_rate": 0.024000000208616257, "loss": 2.4834744930267334, "step": 7276 }, { "epoch": 0.3465714285714286, "grad_norm": 0.03181622922420502, "learning_rate": 0.024000000208616257, "loss": 2.484112501144409, "step": 7278 }, { "epoch": 0.3466666666666667, "grad_norm": 0.029723549261689186, "learning_rate": 0.024000000208616257, "loss": 2.501946449279785, "step": 7280 }, { "epoch": 0.34676190476190477, "grad_norm": 0.02847200259566307, "learning_rate": 0.024000000208616257, "loss": 2.4886326789855957, "step": 7282 }, { "epoch": 0.34685714285714286, "grad_norm": 0.03247971087694168, "learning_rate": 0.024000000208616257, "loss": 2.4997291564941406, "step": 7284 }, { "epoch": 0.34695238095238096, "grad_norm": 0.031090058386325836, "learning_rate": 0.024000000208616257, "loss": 2.4824271202087402, "step": 7286 }, { "epoch": 0.34704761904761905, "grad_norm": 0.03372269496321678, "learning_rate": 0.024000000208616257, "loss": 2.5186023712158203, "step": 7288 }, { "epoch": 0.34714285714285714, "grad_norm": 0.030349712818861008, "learning_rate": 0.024000000208616257, "loss": 2.4743456840515137, "step": 7290 }, { "epoch": 0.34723809523809523, "grad_norm": 0.03018053062260151, "learning_rate": 0.024000000208616257, "loss": 2.495062828063965, "step": 7292 }, { "epoch": 0.3473333333333333, "grad_norm": 0.03062352165579796, "learning_rate": 0.024000000208616257, "loss": 2.4721741676330566, "step": 7294 }, { "epoch": 0.3474285714285714, "grad_norm": 0.031229838728904724, "learning_rate": 0.024000000208616257, "loss": 2.485973358154297, "step": 7296 }, { "epoch": 0.3475238095238095, "grad_norm": 0.03474581614136696, "learning_rate": 0.024000000208616257, "loss": 2.5063843727111816, "step": 7298 }, { "epoch": 0.3476190476190476, "grad_norm": 0.02930903434753418, "learning_rate": 0.024000000208616257, "loss": 2.4806158542633057, "step": 7300 }, { "epoch": 0.3477142857142857, "grad_norm": 0.030748963356018066, "learning_rate": 0.024000000208616257, "loss": 2.5157411098480225, "step": 7302 }, { "epoch": 0.3478095238095238, "grad_norm": 0.032289985567331314, "learning_rate": 0.024000000208616257, "loss": 2.4714863300323486, "step": 7304 }, { "epoch": 0.3479047619047619, "grad_norm": 0.02843460626900196, "learning_rate": 0.024000000208616257, "loss": 2.483907461166382, "step": 7306 }, { "epoch": 0.348, "grad_norm": 0.029354147613048553, "learning_rate": 0.024000000208616257, "loss": 2.4782252311706543, "step": 7308 }, { "epoch": 0.34809523809523807, "grad_norm": 0.028046205639839172, "learning_rate": 0.024000000208616257, "loss": 2.4735186100006104, "step": 7310 }, { "epoch": 0.3481904761904762, "grad_norm": 0.028843354433774948, "learning_rate": 0.024000000208616257, "loss": 2.515306234359741, "step": 7312 }, { "epoch": 0.3482857142857143, "grad_norm": 0.028741387650370598, "learning_rate": 0.024000000208616257, "loss": 2.4904439449310303, "step": 7314 }, { "epoch": 0.3483809523809524, "grad_norm": 0.029219195246696472, "learning_rate": 0.024000000208616257, "loss": 2.510493755340576, "step": 7316 }, { "epoch": 0.3484761904761905, "grad_norm": 0.02917374111711979, "learning_rate": 0.024000000208616257, "loss": 2.494441032409668, "step": 7318 }, { "epoch": 0.3485714285714286, "grad_norm": 0.02960243634879589, "learning_rate": 0.024000000208616257, "loss": 2.536618709564209, "step": 7320 }, { "epoch": 0.3486666666666667, "grad_norm": 0.03237590193748474, "learning_rate": 0.024000000208616257, "loss": 2.4856107234954834, "step": 7322 }, { "epoch": 0.3487619047619048, "grad_norm": 0.030879424884915352, "learning_rate": 0.024000000208616257, "loss": 2.5114712715148926, "step": 7324 }, { "epoch": 0.34885714285714287, "grad_norm": 0.029863355681300163, "learning_rate": 0.024000000208616257, "loss": 2.4567670822143555, "step": 7326 }, { "epoch": 0.34895238095238096, "grad_norm": 0.029317473992705345, "learning_rate": 0.024000000208616257, "loss": 2.5172688961029053, "step": 7328 }, { "epoch": 0.34904761904761905, "grad_norm": 0.03155161812901497, "learning_rate": 0.024000000208616257, "loss": 2.4531140327453613, "step": 7330 }, { "epoch": 0.34914285714285714, "grad_norm": 0.029375853016972542, "learning_rate": 0.024000000208616257, "loss": 2.5044302940368652, "step": 7332 }, { "epoch": 0.34923809523809524, "grad_norm": 0.030677493661642075, "learning_rate": 0.024000000208616257, "loss": 2.454068183898926, "step": 7334 }, { "epoch": 0.34933333333333333, "grad_norm": 0.028836466372013092, "learning_rate": 0.024000000208616257, "loss": 2.537696361541748, "step": 7336 }, { "epoch": 0.3494285714285714, "grad_norm": 0.029719866812229156, "learning_rate": 0.024000000208616257, "loss": 2.473372459411621, "step": 7338 }, { "epoch": 0.3495238095238095, "grad_norm": 0.02897462248802185, "learning_rate": 0.024000000208616257, "loss": 2.4680652618408203, "step": 7340 }, { "epoch": 0.3496190476190476, "grad_norm": 0.033235035836696625, "learning_rate": 0.024000000208616257, "loss": 2.484823703765869, "step": 7342 }, { "epoch": 0.3497142857142857, "grad_norm": 0.02991124801337719, "learning_rate": 0.024000000208616257, "loss": 2.450178623199463, "step": 7344 }, { "epoch": 0.3498095238095238, "grad_norm": 0.030203593894839287, "learning_rate": 0.024000000208616257, "loss": 2.491995334625244, "step": 7346 }, { "epoch": 0.3499047619047619, "grad_norm": 0.03270898386836052, "learning_rate": 0.024000000208616257, "loss": 2.4693045616149902, "step": 7348 }, { "epoch": 0.35, "grad_norm": 0.03570309653878212, "learning_rate": 0.024000000208616257, "loss": 2.4796905517578125, "step": 7350 }, { "epoch": 0.35009523809523807, "grad_norm": 0.034593235701322556, "learning_rate": 0.024000000208616257, "loss": 2.472975254058838, "step": 7352 }, { "epoch": 0.35019047619047616, "grad_norm": 0.030379949137568474, "learning_rate": 0.024000000208616257, "loss": 2.486605644226074, "step": 7354 }, { "epoch": 0.3502857142857143, "grad_norm": 0.030839839950203896, "learning_rate": 0.024000000208616257, "loss": 2.458967685699463, "step": 7356 }, { "epoch": 0.3503809523809524, "grad_norm": 0.029235225170850754, "learning_rate": 0.024000000208616257, "loss": 2.526707649230957, "step": 7358 }, { "epoch": 0.3504761904761905, "grad_norm": 0.03129074349999428, "learning_rate": 0.024000000208616257, "loss": 2.4783668518066406, "step": 7360 }, { "epoch": 0.3505714285714286, "grad_norm": 0.029996979981660843, "learning_rate": 0.024000000208616257, "loss": 2.4763309955596924, "step": 7362 }, { "epoch": 0.3506666666666667, "grad_norm": 0.03106936439871788, "learning_rate": 0.024000000208616257, "loss": 2.471195697784424, "step": 7364 }, { "epoch": 0.3507619047619048, "grad_norm": 0.02984689362347126, "learning_rate": 0.024000000208616257, "loss": 2.4661970138549805, "step": 7366 }, { "epoch": 0.35085714285714287, "grad_norm": 0.030764013528823853, "learning_rate": 0.024000000208616257, "loss": 2.484631061553955, "step": 7368 }, { "epoch": 0.35095238095238096, "grad_norm": 0.029097070917487144, "learning_rate": 0.024000000208616257, "loss": 2.501878261566162, "step": 7370 }, { "epoch": 0.35104761904761905, "grad_norm": 0.028702927753329277, "learning_rate": 0.024000000208616257, "loss": 2.489495277404785, "step": 7372 }, { "epoch": 0.35114285714285715, "grad_norm": 0.031982388347387314, "learning_rate": 0.024000000208616257, "loss": 2.46821665763855, "step": 7374 }, { "epoch": 0.35123809523809524, "grad_norm": 0.030151236802339554, "learning_rate": 0.024000000208616257, "loss": 2.517869472503662, "step": 7376 }, { "epoch": 0.35133333333333333, "grad_norm": 0.03283766657114029, "learning_rate": 0.024000000208616257, "loss": 2.4893906116485596, "step": 7378 }, { "epoch": 0.3514285714285714, "grad_norm": 0.030716801062226295, "learning_rate": 0.024000000208616257, "loss": 2.453476667404175, "step": 7380 }, { "epoch": 0.3515238095238095, "grad_norm": 0.030580205842852592, "learning_rate": 0.024000000208616257, "loss": 2.4545035362243652, "step": 7382 }, { "epoch": 0.3516190476190476, "grad_norm": 0.02914385125041008, "learning_rate": 0.024000000208616257, "loss": 2.437777519226074, "step": 7384 }, { "epoch": 0.3517142857142857, "grad_norm": 0.029267074540257454, "learning_rate": 0.024000000208616257, "loss": 2.466407299041748, "step": 7386 }, { "epoch": 0.3518095238095238, "grad_norm": 0.02974027581512928, "learning_rate": 0.024000000208616257, "loss": 2.472499370574951, "step": 7388 }, { "epoch": 0.3519047619047619, "grad_norm": 0.030461251735687256, "learning_rate": 0.024000000208616257, "loss": 2.5239787101745605, "step": 7390 }, { "epoch": 0.352, "grad_norm": 0.02885858155786991, "learning_rate": 0.024000000208616257, "loss": 2.482952117919922, "step": 7392 }, { "epoch": 0.3520952380952381, "grad_norm": 0.029422996565699577, "learning_rate": 0.024000000208616257, "loss": 2.463258743286133, "step": 7394 }, { "epoch": 0.35219047619047616, "grad_norm": 0.029847247526049614, "learning_rate": 0.024000000208616257, "loss": 2.5085182189941406, "step": 7396 }, { "epoch": 0.3522857142857143, "grad_norm": 0.030343718826770782, "learning_rate": 0.024000000208616257, "loss": 2.492072582244873, "step": 7398 }, { "epoch": 0.3523809523809524, "grad_norm": 0.03337286040186882, "learning_rate": 0.024000000208616257, "loss": 2.5099477767944336, "step": 7400 }, { "epoch": 0.3524761904761905, "grad_norm": 0.030504466965794563, "learning_rate": 0.024000000208616257, "loss": 2.4763784408569336, "step": 7402 }, { "epoch": 0.3525714285714286, "grad_norm": 0.03060448355972767, "learning_rate": 0.024000000208616257, "loss": 2.4875996112823486, "step": 7404 }, { "epoch": 0.3526666666666667, "grad_norm": 0.031309135258197784, "learning_rate": 0.024000000208616257, "loss": 2.478215456008911, "step": 7406 }, { "epoch": 0.3527619047619048, "grad_norm": 0.03097343258559704, "learning_rate": 0.024000000208616257, "loss": 2.499499797821045, "step": 7408 }, { "epoch": 0.35285714285714287, "grad_norm": 0.030008548870682716, "learning_rate": 0.024000000208616257, "loss": 2.510662078857422, "step": 7410 }, { "epoch": 0.35295238095238096, "grad_norm": 0.03203392028808594, "learning_rate": 0.024000000208616257, "loss": 2.477509021759033, "step": 7412 }, { "epoch": 0.35304761904761905, "grad_norm": 0.031908582895994186, "learning_rate": 0.024000000208616257, "loss": 2.5191140174865723, "step": 7414 }, { "epoch": 0.35314285714285715, "grad_norm": 0.03092641942203045, "learning_rate": 0.024000000208616257, "loss": 2.4559121131896973, "step": 7416 }, { "epoch": 0.35323809523809524, "grad_norm": 0.029326114803552628, "learning_rate": 0.024000000208616257, "loss": 2.4772567749023438, "step": 7418 }, { "epoch": 0.35333333333333333, "grad_norm": 0.03299442678689957, "learning_rate": 0.024000000208616257, "loss": 2.478175640106201, "step": 7420 }, { "epoch": 0.3534285714285714, "grad_norm": 0.029913930222392082, "learning_rate": 0.024000000208616257, "loss": 2.501631259918213, "step": 7422 }, { "epoch": 0.3535238095238095, "grad_norm": 0.02963915280997753, "learning_rate": 0.024000000208616257, "loss": 2.490828037261963, "step": 7424 }, { "epoch": 0.3536190476190476, "grad_norm": 0.029659969732165337, "learning_rate": 0.024000000208616257, "loss": 2.486884593963623, "step": 7426 }, { "epoch": 0.3537142857142857, "grad_norm": 0.02816743031144142, "learning_rate": 0.024000000208616257, "loss": 2.4832983016967773, "step": 7428 }, { "epoch": 0.3538095238095238, "grad_norm": 0.029104989022016525, "learning_rate": 0.024000000208616257, "loss": 2.5229010581970215, "step": 7430 }, { "epoch": 0.3539047619047619, "grad_norm": 0.02909243479371071, "learning_rate": 0.024000000208616257, "loss": 2.4786200523376465, "step": 7432 }, { "epoch": 0.354, "grad_norm": 0.028102625161409378, "learning_rate": 0.024000000208616257, "loss": 2.488201379776001, "step": 7434 }, { "epoch": 0.3540952380952381, "grad_norm": 0.028283845633268356, "learning_rate": 0.024000000208616257, "loss": 2.4909451007843018, "step": 7436 }, { "epoch": 0.35419047619047617, "grad_norm": 0.02982216328382492, "learning_rate": 0.024000000208616257, "loss": 2.468583583831787, "step": 7438 }, { "epoch": 0.35428571428571426, "grad_norm": 0.028986232355237007, "learning_rate": 0.024000000208616257, "loss": 2.482180118560791, "step": 7440 }, { "epoch": 0.3543809523809524, "grad_norm": 0.02950805053114891, "learning_rate": 0.024000000208616257, "loss": 2.5043275356292725, "step": 7442 }, { "epoch": 0.3544761904761905, "grad_norm": 0.028700657188892365, "learning_rate": 0.024000000208616257, "loss": 2.480087995529175, "step": 7444 }, { "epoch": 0.3545714285714286, "grad_norm": 0.029247336089611053, "learning_rate": 0.024000000208616257, "loss": 2.4753594398498535, "step": 7446 }, { "epoch": 0.3546666666666667, "grad_norm": 0.030460497364401817, "learning_rate": 0.024000000208616257, "loss": 2.4713218212127686, "step": 7448 }, { "epoch": 0.3547619047619048, "grad_norm": 0.029349435120821, "learning_rate": 0.024000000208616257, "loss": 2.4978508949279785, "step": 7450 }, { "epoch": 0.35485714285714287, "grad_norm": 0.029993444681167603, "learning_rate": 0.024000000208616257, "loss": 2.5039737224578857, "step": 7452 }, { "epoch": 0.35495238095238096, "grad_norm": 0.028877366334199905, "learning_rate": 0.024000000208616257, "loss": 2.46929931640625, "step": 7454 }, { "epoch": 0.35504761904761906, "grad_norm": 0.02925742417573929, "learning_rate": 0.024000000208616257, "loss": 2.463090419769287, "step": 7456 }, { "epoch": 0.35514285714285715, "grad_norm": 0.03274105116724968, "learning_rate": 0.024000000208616257, "loss": 2.479149103164673, "step": 7458 }, { "epoch": 0.35523809523809524, "grad_norm": 0.03168944641947746, "learning_rate": 0.024000000208616257, "loss": 2.516313314437866, "step": 7460 }, { "epoch": 0.35533333333333333, "grad_norm": 0.030370492488145828, "learning_rate": 0.024000000208616257, "loss": 2.494283437728882, "step": 7462 }, { "epoch": 0.3554285714285714, "grad_norm": 0.02851349487900734, "learning_rate": 0.024000000208616257, "loss": 2.456425428390503, "step": 7464 }, { "epoch": 0.3555238095238095, "grad_norm": 0.02843330428004265, "learning_rate": 0.024000000208616257, "loss": 2.480900764465332, "step": 7466 }, { "epoch": 0.3556190476190476, "grad_norm": 0.03043600358068943, "learning_rate": 0.024000000208616257, "loss": 2.4317424297332764, "step": 7468 }, { "epoch": 0.3557142857142857, "grad_norm": 0.029564805328845978, "learning_rate": 0.024000000208616257, "loss": 2.457010507583618, "step": 7470 }, { "epoch": 0.3558095238095238, "grad_norm": 0.029780447483062744, "learning_rate": 0.024000000208616257, "loss": 2.4544053077697754, "step": 7472 }, { "epoch": 0.3559047619047619, "grad_norm": 0.028644749894738197, "learning_rate": 0.024000000208616257, "loss": 2.4319982528686523, "step": 7474 }, { "epoch": 0.356, "grad_norm": 0.02905803732573986, "learning_rate": 0.024000000208616257, "loss": 2.476264476776123, "step": 7476 }, { "epoch": 0.3560952380952381, "grad_norm": 0.02941397950053215, "learning_rate": 0.024000000208616257, "loss": 2.497739553451538, "step": 7478 }, { "epoch": 0.35619047619047617, "grad_norm": 0.030269697308540344, "learning_rate": 0.024000000208616257, "loss": 2.450881004333496, "step": 7480 }, { "epoch": 0.35628571428571426, "grad_norm": 0.028688127174973488, "learning_rate": 0.024000000208616257, "loss": 2.448216438293457, "step": 7482 }, { "epoch": 0.35638095238095235, "grad_norm": 0.027922969311475754, "learning_rate": 0.024000000208616257, "loss": 2.4772512912750244, "step": 7484 }, { "epoch": 0.3564761904761905, "grad_norm": 0.029066462069749832, "learning_rate": 0.024000000208616257, "loss": 2.5185322761535645, "step": 7486 }, { "epoch": 0.3565714285714286, "grad_norm": 0.029376937076449394, "learning_rate": 0.024000000208616257, "loss": 2.456643581390381, "step": 7488 }, { "epoch": 0.3566666666666667, "grad_norm": 0.029913054779171944, "learning_rate": 0.024000000208616257, "loss": 2.4898881912231445, "step": 7490 }, { "epoch": 0.3567619047619048, "grad_norm": 0.029282063245773315, "learning_rate": 0.024000000208616257, "loss": 2.4743411540985107, "step": 7492 }, { "epoch": 0.3568571428571429, "grad_norm": 0.028897307813167572, "learning_rate": 0.024000000208616257, "loss": 2.4848525524139404, "step": 7494 }, { "epoch": 0.35695238095238097, "grad_norm": 0.030271543189883232, "learning_rate": 0.024000000208616257, "loss": 2.483419418334961, "step": 7496 }, { "epoch": 0.35704761904761906, "grad_norm": 0.029247567057609558, "learning_rate": 0.024000000208616257, "loss": 2.436640739440918, "step": 7498 }, { "epoch": 0.35714285714285715, "grad_norm": 0.030555840581655502, "learning_rate": 0.024000000208616257, "loss": 2.48775577545166, "step": 7500 }, { "epoch": 0.35723809523809524, "grad_norm": 0.03313332796096802, "learning_rate": 0.024000000208616257, "loss": 2.482847213745117, "step": 7502 }, { "epoch": 0.35733333333333334, "grad_norm": 0.02917507477104664, "learning_rate": 0.024000000208616257, "loss": 2.4977848529815674, "step": 7504 }, { "epoch": 0.35742857142857143, "grad_norm": 0.030479153618216515, "learning_rate": 0.024000000208616257, "loss": 2.493488311767578, "step": 7506 }, { "epoch": 0.3575238095238095, "grad_norm": 0.029542014002799988, "learning_rate": 0.024000000208616257, "loss": 2.528918981552124, "step": 7508 }, { "epoch": 0.3576190476190476, "grad_norm": 0.02890731953084469, "learning_rate": 0.024000000208616257, "loss": 2.4897751808166504, "step": 7510 }, { "epoch": 0.3577142857142857, "grad_norm": 0.028727268800139427, "learning_rate": 0.024000000208616257, "loss": 2.5099620819091797, "step": 7512 }, { "epoch": 0.3578095238095238, "grad_norm": 0.02899094671010971, "learning_rate": 0.024000000208616257, "loss": 2.478609800338745, "step": 7514 }, { "epoch": 0.3579047619047619, "grad_norm": 0.02854040078818798, "learning_rate": 0.024000000208616257, "loss": 2.4880685806274414, "step": 7516 }, { "epoch": 0.358, "grad_norm": 0.02883659116923809, "learning_rate": 0.024000000208616257, "loss": 2.4942140579223633, "step": 7518 }, { "epoch": 0.3580952380952381, "grad_norm": 0.03091655671596527, "learning_rate": 0.024000000208616257, "loss": 2.484349250793457, "step": 7520 }, { "epoch": 0.35819047619047617, "grad_norm": 0.03304492309689522, "learning_rate": 0.024000000208616257, "loss": 2.4954049587249756, "step": 7522 }, { "epoch": 0.35828571428571426, "grad_norm": 0.029811056330800056, "learning_rate": 0.024000000208616257, "loss": 2.4957375526428223, "step": 7524 }, { "epoch": 0.35838095238095236, "grad_norm": 0.028990549966692924, "learning_rate": 0.024000000208616257, "loss": 2.4696226119995117, "step": 7526 }, { "epoch": 0.3584761904761905, "grad_norm": 0.029515385627746582, "learning_rate": 0.024000000208616257, "loss": 2.499206066131592, "step": 7528 }, { "epoch": 0.3585714285714286, "grad_norm": 0.029762782156467438, "learning_rate": 0.024000000208616257, "loss": 2.504568338394165, "step": 7530 }, { "epoch": 0.3586666666666667, "grad_norm": 0.028197282925248146, "learning_rate": 0.024000000208616257, "loss": 2.473376512527466, "step": 7532 }, { "epoch": 0.3587619047619048, "grad_norm": 0.02801641635596752, "learning_rate": 0.024000000208616257, "loss": 2.5047898292541504, "step": 7534 }, { "epoch": 0.3588571428571429, "grad_norm": 0.029196398332715034, "learning_rate": 0.024000000208616257, "loss": 2.51065993309021, "step": 7536 }, { "epoch": 0.35895238095238097, "grad_norm": 0.0327506959438324, "learning_rate": 0.024000000208616257, "loss": 2.4951534271240234, "step": 7538 }, { "epoch": 0.35904761904761906, "grad_norm": 0.031637679785490036, "learning_rate": 0.024000000208616257, "loss": 2.456279754638672, "step": 7540 }, { "epoch": 0.35914285714285715, "grad_norm": 0.035517629235982895, "learning_rate": 0.024000000208616257, "loss": 2.4517698287963867, "step": 7542 }, { "epoch": 0.35923809523809525, "grad_norm": 0.032872457057237625, "learning_rate": 0.024000000208616257, "loss": 2.5081593990325928, "step": 7544 }, { "epoch": 0.35933333333333334, "grad_norm": 0.032976653426885605, "learning_rate": 0.024000000208616257, "loss": 2.483184814453125, "step": 7546 }, { "epoch": 0.35942857142857143, "grad_norm": 0.031915951520204544, "learning_rate": 0.024000000208616257, "loss": 2.478771448135376, "step": 7548 }, { "epoch": 0.3595238095238095, "grad_norm": 0.027942590415477753, "learning_rate": 0.024000000208616257, "loss": 2.488023281097412, "step": 7550 }, { "epoch": 0.3596190476190476, "grad_norm": 0.030303698033094406, "learning_rate": 0.024000000208616257, "loss": 2.4821338653564453, "step": 7552 }, { "epoch": 0.3597142857142857, "grad_norm": 0.029949450865387917, "learning_rate": 0.024000000208616257, "loss": 2.4945976734161377, "step": 7554 }, { "epoch": 0.3598095238095238, "grad_norm": 0.030359257012605667, "learning_rate": 0.024000000208616257, "loss": 2.4935851097106934, "step": 7556 }, { "epoch": 0.3599047619047619, "grad_norm": 0.02890615165233612, "learning_rate": 0.024000000208616257, "loss": 2.486807346343994, "step": 7558 }, { "epoch": 0.36, "grad_norm": 0.028664810582995415, "learning_rate": 0.024000000208616257, "loss": 2.462501287460327, "step": 7560 }, { "epoch": 0.3600952380952381, "grad_norm": 0.03124232590198517, "learning_rate": 0.024000000208616257, "loss": 2.4615330696105957, "step": 7562 }, { "epoch": 0.36019047619047617, "grad_norm": 0.028973368927836418, "learning_rate": 0.024000000208616257, "loss": 2.5193405151367188, "step": 7564 }, { "epoch": 0.36028571428571426, "grad_norm": 0.02797664888203144, "learning_rate": 0.024000000208616257, "loss": 2.4477133750915527, "step": 7566 }, { "epoch": 0.36038095238095236, "grad_norm": 0.031132953241467476, "learning_rate": 0.024000000208616257, "loss": 2.465818405151367, "step": 7568 }, { "epoch": 0.36047619047619045, "grad_norm": 0.0317101813852787, "learning_rate": 0.024000000208616257, "loss": 2.476649761199951, "step": 7570 }, { "epoch": 0.3605714285714286, "grad_norm": 0.028868285939097404, "learning_rate": 0.024000000208616257, "loss": 2.4794998168945312, "step": 7572 }, { "epoch": 0.3606666666666667, "grad_norm": 0.029143821448087692, "learning_rate": 0.024000000208616257, "loss": 2.512355327606201, "step": 7574 }, { "epoch": 0.3607619047619048, "grad_norm": 0.02819014899432659, "learning_rate": 0.024000000208616257, "loss": 2.475674629211426, "step": 7576 }, { "epoch": 0.3608571428571429, "grad_norm": 0.028959864750504494, "learning_rate": 0.024000000208616257, "loss": 2.4761769771575928, "step": 7578 }, { "epoch": 0.36095238095238097, "grad_norm": 0.02932652086019516, "learning_rate": 0.024000000208616257, "loss": 2.514834403991699, "step": 7580 }, { "epoch": 0.36104761904761906, "grad_norm": 0.02883383445441723, "learning_rate": 0.024000000208616257, "loss": 2.515957832336426, "step": 7582 }, { "epoch": 0.36114285714285715, "grad_norm": 0.030183840543031693, "learning_rate": 0.024000000208616257, "loss": 2.472200870513916, "step": 7584 }, { "epoch": 0.36123809523809525, "grad_norm": 0.028086630627512932, "learning_rate": 0.024000000208616257, "loss": 2.482262134552002, "step": 7586 }, { "epoch": 0.36133333333333334, "grad_norm": 0.03126629441976547, "learning_rate": 0.024000000208616257, "loss": 2.5165367126464844, "step": 7588 }, { "epoch": 0.36142857142857143, "grad_norm": 0.03489893674850464, "learning_rate": 0.024000000208616257, "loss": 2.4762377738952637, "step": 7590 }, { "epoch": 0.3615238095238095, "grad_norm": 0.03232874348759651, "learning_rate": 0.024000000208616257, "loss": 2.5103416442871094, "step": 7592 }, { "epoch": 0.3616190476190476, "grad_norm": 0.03388991206884384, "learning_rate": 0.024000000208616257, "loss": 2.478438377380371, "step": 7594 }, { "epoch": 0.3617142857142857, "grad_norm": 0.029955795034766197, "learning_rate": 0.024000000208616257, "loss": 2.45986008644104, "step": 7596 }, { "epoch": 0.3618095238095238, "grad_norm": 0.030252832919359207, "learning_rate": 0.024000000208616257, "loss": 2.4841837882995605, "step": 7598 }, { "epoch": 0.3619047619047619, "grad_norm": 0.030670886859297752, "learning_rate": 0.024000000208616257, "loss": 2.4674863815307617, "step": 7600 }, { "epoch": 0.362, "grad_norm": 0.029035434126853943, "learning_rate": 0.024000000208616257, "loss": 2.4723687171936035, "step": 7602 }, { "epoch": 0.3620952380952381, "grad_norm": 0.02931477688252926, "learning_rate": 0.024000000208616257, "loss": 2.4744162559509277, "step": 7604 }, { "epoch": 0.3621904761904762, "grad_norm": 0.029019296169281006, "learning_rate": 0.024000000208616257, "loss": 2.4842188358306885, "step": 7606 }, { "epoch": 0.36228571428571427, "grad_norm": 0.03260951489210129, "learning_rate": 0.024000000208616257, "loss": 2.4846415519714355, "step": 7608 }, { "epoch": 0.36238095238095236, "grad_norm": 0.028813229873776436, "learning_rate": 0.024000000208616257, "loss": 2.482565402984619, "step": 7610 }, { "epoch": 0.36247619047619045, "grad_norm": 0.029857659712433815, "learning_rate": 0.024000000208616257, "loss": 2.5206589698791504, "step": 7612 }, { "epoch": 0.36257142857142854, "grad_norm": 0.02877364680171013, "learning_rate": 0.024000000208616257, "loss": 2.4918158054351807, "step": 7614 }, { "epoch": 0.3626666666666667, "grad_norm": 0.029010774567723274, "learning_rate": 0.024000000208616257, "loss": 2.4802300930023193, "step": 7616 }, { "epoch": 0.3627619047619048, "grad_norm": 0.03279303014278412, "learning_rate": 0.024000000208616257, "loss": 2.4811625480651855, "step": 7618 }, { "epoch": 0.3628571428571429, "grad_norm": 0.030422266572713852, "learning_rate": 0.024000000208616257, "loss": 2.486894130706787, "step": 7620 }, { "epoch": 0.36295238095238097, "grad_norm": 0.03010830096900463, "learning_rate": 0.024000000208616257, "loss": 2.4806289672851562, "step": 7622 }, { "epoch": 0.36304761904761906, "grad_norm": 0.028960665687918663, "learning_rate": 0.024000000208616257, "loss": 2.4967689514160156, "step": 7624 }, { "epoch": 0.36314285714285716, "grad_norm": 0.029764987528324127, "learning_rate": 0.024000000208616257, "loss": 2.497102975845337, "step": 7626 }, { "epoch": 0.36323809523809525, "grad_norm": 0.029288968071341515, "learning_rate": 0.024000000208616257, "loss": 2.478687286376953, "step": 7628 }, { "epoch": 0.36333333333333334, "grad_norm": 0.03399905934929848, "learning_rate": 0.024000000208616257, "loss": 2.4739787578582764, "step": 7630 }, { "epoch": 0.36342857142857143, "grad_norm": 0.031617578119039536, "learning_rate": 0.024000000208616257, "loss": 2.4638476371765137, "step": 7632 }, { "epoch": 0.3635238095238095, "grad_norm": 0.02862219698727131, "learning_rate": 0.024000000208616257, "loss": 2.467074394226074, "step": 7634 }, { "epoch": 0.3636190476190476, "grad_norm": 0.028064021840691566, "learning_rate": 0.024000000208616257, "loss": 2.451108455657959, "step": 7636 }, { "epoch": 0.3637142857142857, "grad_norm": 0.028613870963454247, "learning_rate": 0.024000000208616257, "loss": 2.479719877243042, "step": 7638 }, { "epoch": 0.3638095238095238, "grad_norm": 0.028845489025115967, "learning_rate": 0.024000000208616257, "loss": 2.51174259185791, "step": 7640 }, { "epoch": 0.3639047619047619, "grad_norm": 0.028858181089162827, "learning_rate": 0.024000000208616257, "loss": 2.4570703506469727, "step": 7642 }, { "epoch": 0.364, "grad_norm": 0.02911129966378212, "learning_rate": 0.024000000208616257, "loss": 2.486337184906006, "step": 7644 }, { "epoch": 0.3640952380952381, "grad_norm": 0.029168998822569847, "learning_rate": 0.024000000208616257, "loss": 2.4589905738830566, "step": 7646 }, { "epoch": 0.3641904761904762, "grad_norm": 0.029078731313347816, "learning_rate": 0.024000000208616257, "loss": 2.4868040084838867, "step": 7648 }, { "epoch": 0.36428571428571427, "grad_norm": 0.0291838850826025, "learning_rate": 0.024000000208616257, "loss": 2.459883213043213, "step": 7650 }, { "epoch": 0.36438095238095236, "grad_norm": 0.029648853465914726, "learning_rate": 0.024000000208616257, "loss": 2.4761171340942383, "step": 7652 }, { "epoch": 0.36447619047619045, "grad_norm": 0.030141551047563553, "learning_rate": 0.024000000208616257, "loss": 2.4592690467834473, "step": 7654 }, { "epoch": 0.36457142857142855, "grad_norm": 0.02982792630791664, "learning_rate": 0.024000000208616257, "loss": 2.455930233001709, "step": 7656 }, { "epoch": 0.36466666666666664, "grad_norm": 0.031613193452358246, "learning_rate": 0.024000000208616257, "loss": 2.465869426727295, "step": 7658 }, { "epoch": 0.3647619047619048, "grad_norm": 0.03213758394122124, "learning_rate": 0.024000000208616257, "loss": 2.450643539428711, "step": 7660 }, { "epoch": 0.3648571428571429, "grad_norm": 0.02987268753349781, "learning_rate": 0.024000000208616257, "loss": 2.4448184967041016, "step": 7662 }, { "epoch": 0.364952380952381, "grad_norm": 0.02863566391170025, "learning_rate": 0.024000000208616257, "loss": 2.4726619720458984, "step": 7664 }, { "epoch": 0.36504761904761907, "grad_norm": 0.028811711817979813, "learning_rate": 0.024000000208616257, "loss": 2.4858314990997314, "step": 7666 }, { "epoch": 0.36514285714285716, "grad_norm": 0.0283164381980896, "learning_rate": 0.024000000208616257, "loss": 2.446596145629883, "step": 7668 }, { "epoch": 0.36523809523809525, "grad_norm": 0.02935020625591278, "learning_rate": 0.024000000208616257, "loss": 2.4648499488830566, "step": 7670 }, { "epoch": 0.36533333333333334, "grad_norm": 0.029865624383091927, "learning_rate": 0.024000000208616257, "loss": 2.4571075439453125, "step": 7672 }, { "epoch": 0.36542857142857144, "grad_norm": 0.029210304841399193, "learning_rate": 0.024000000208616257, "loss": 2.4717917442321777, "step": 7674 }, { "epoch": 0.36552380952380953, "grad_norm": 0.0304243341088295, "learning_rate": 0.024000000208616257, "loss": 2.496170997619629, "step": 7676 }, { "epoch": 0.3656190476190476, "grad_norm": 0.02939593605697155, "learning_rate": 0.024000000208616257, "loss": 2.4544975757598877, "step": 7678 }, { "epoch": 0.3657142857142857, "grad_norm": 0.02932063117623329, "learning_rate": 0.024000000208616257, "loss": 2.4812445640563965, "step": 7680 }, { "epoch": 0.3658095238095238, "grad_norm": 0.02930006943643093, "learning_rate": 0.024000000208616257, "loss": 2.476292371749878, "step": 7682 }, { "epoch": 0.3659047619047619, "grad_norm": 0.028567077592015266, "learning_rate": 0.024000000208616257, "loss": 2.4851808547973633, "step": 7684 }, { "epoch": 0.366, "grad_norm": 0.02893061935901642, "learning_rate": 0.024000000208616257, "loss": 2.4723830223083496, "step": 7686 }, { "epoch": 0.3660952380952381, "grad_norm": 0.03239154443144798, "learning_rate": 0.024000000208616257, "loss": 2.475691318511963, "step": 7688 }, { "epoch": 0.3661904761904762, "grad_norm": 0.03444777801632881, "learning_rate": 0.024000000208616257, "loss": 2.434414863586426, "step": 7690 }, { "epoch": 0.36628571428571427, "grad_norm": 0.03228279575705528, "learning_rate": 0.024000000208616257, "loss": 2.4844565391540527, "step": 7692 }, { "epoch": 0.36638095238095236, "grad_norm": 0.034106962382793427, "learning_rate": 0.024000000208616257, "loss": 2.435267925262451, "step": 7694 }, { "epoch": 0.36647619047619046, "grad_norm": 0.02891671285033226, "learning_rate": 0.024000000208616257, "loss": 2.474501132965088, "step": 7696 }, { "epoch": 0.36657142857142855, "grad_norm": 0.03212910518050194, "learning_rate": 0.024000000208616257, "loss": 2.456634044647217, "step": 7698 }, { "epoch": 0.36666666666666664, "grad_norm": 0.03376142680644989, "learning_rate": 0.024000000208616257, "loss": 2.4908218383789062, "step": 7700 }, { "epoch": 0.3667619047619048, "grad_norm": 0.030344713479280472, "learning_rate": 0.024000000208616257, "loss": 2.4916605949401855, "step": 7702 }, { "epoch": 0.3668571428571429, "grad_norm": 0.02952144481241703, "learning_rate": 0.024000000208616257, "loss": 2.4520771503448486, "step": 7704 }, { "epoch": 0.366952380952381, "grad_norm": 0.03057491034269333, "learning_rate": 0.024000000208616257, "loss": 2.479822874069214, "step": 7706 }, { "epoch": 0.36704761904761907, "grad_norm": 0.029973480850458145, "learning_rate": 0.024000000208616257, "loss": 2.4586353302001953, "step": 7708 }, { "epoch": 0.36714285714285716, "grad_norm": 0.030675597488880157, "learning_rate": 0.024000000208616257, "loss": 2.4854512214660645, "step": 7710 }, { "epoch": 0.36723809523809525, "grad_norm": 0.029203616082668304, "learning_rate": 0.024000000208616257, "loss": 2.4642021656036377, "step": 7712 }, { "epoch": 0.36733333333333335, "grad_norm": 0.029890678822994232, "learning_rate": 0.024000000208616257, "loss": 2.4495439529418945, "step": 7714 }, { "epoch": 0.36742857142857144, "grad_norm": 0.029768139123916626, "learning_rate": 0.024000000208616257, "loss": 2.44974946975708, "step": 7716 }, { "epoch": 0.36752380952380953, "grad_norm": 0.03182975947856903, "learning_rate": 0.024000000208616257, "loss": 2.479536533355713, "step": 7718 }, { "epoch": 0.3676190476190476, "grad_norm": 0.030254388228058815, "learning_rate": 0.024000000208616257, "loss": 2.4648499488830566, "step": 7720 }, { "epoch": 0.3677142857142857, "grad_norm": 0.03065762296319008, "learning_rate": 0.024000000208616257, "loss": 2.473808526992798, "step": 7722 }, { "epoch": 0.3678095238095238, "grad_norm": 0.03165201470255852, "learning_rate": 0.024000000208616257, "loss": 2.4754252433776855, "step": 7724 }, { "epoch": 0.3679047619047619, "grad_norm": 0.029392611235380173, "learning_rate": 0.024000000208616257, "loss": 2.461433172225952, "step": 7726 }, { "epoch": 0.368, "grad_norm": 0.03300875052809715, "learning_rate": 0.024000000208616257, "loss": 2.4809651374816895, "step": 7728 }, { "epoch": 0.3680952380952381, "grad_norm": 0.02925111912190914, "learning_rate": 0.024000000208616257, "loss": 2.458942413330078, "step": 7730 }, { "epoch": 0.3681904761904762, "grad_norm": 0.03153614327311516, "learning_rate": 0.024000000208616257, "loss": 2.462320566177368, "step": 7732 }, { "epoch": 0.36828571428571427, "grad_norm": 0.029245393350720406, "learning_rate": 0.024000000208616257, "loss": 2.4462013244628906, "step": 7734 }, { "epoch": 0.36838095238095236, "grad_norm": 0.02996732108294964, "learning_rate": 0.024000000208616257, "loss": 2.476162910461426, "step": 7736 }, { "epoch": 0.36847619047619046, "grad_norm": 0.02812080644071102, "learning_rate": 0.024000000208616257, "loss": 2.4331178665161133, "step": 7738 }, { "epoch": 0.36857142857142855, "grad_norm": 0.028248442336916924, "learning_rate": 0.024000000208616257, "loss": 2.423067569732666, "step": 7740 }, { "epoch": 0.36866666666666664, "grad_norm": 0.028244096785783768, "learning_rate": 0.024000000208616257, "loss": 2.4537453651428223, "step": 7742 }, { "epoch": 0.36876190476190474, "grad_norm": 0.029661426320672035, "learning_rate": 0.024000000208616257, "loss": 2.4783201217651367, "step": 7744 }, { "epoch": 0.3688571428571429, "grad_norm": 0.030969034880399704, "learning_rate": 0.024000000208616257, "loss": 2.46390438079834, "step": 7746 }, { "epoch": 0.368952380952381, "grad_norm": 0.030927559360861778, "learning_rate": 0.024000000208616257, "loss": 2.43117094039917, "step": 7748 }, { "epoch": 0.36904761904761907, "grad_norm": 0.02833808772265911, "learning_rate": 0.024000000208616257, "loss": 2.447091817855835, "step": 7750 }, { "epoch": 0.36914285714285716, "grad_norm": 0.02829948626458645, "learning_rate": 0.024000000208616257, "loss": 2.445448160171509, "step": 7752 }, { "epoch": 0.36923809523809525, "grad_norm": 0.029689228162169456, "learning_rate": 0.024000000208616257, "loss": 2.431213855743408, "step": 7754 }, { "epoch": 0.36933333333333335, "grad_norm": 0.02909223735332489, "learning_rate": 0.024000000208616257, "loss": 2.446207046508789, "step": 7756 }, { "epoch": 0.36942857142857144, "grad_norm": 0.029704894870519638, "learning_rate": 0.024000000208616257, "loss": 2.4604501724243164, "step": 7758 }, { "epoch": 0.36952380952380953, "grad_norm": 0.03131707012653351, "learning_rate": 0.024000000208616257, "loss": 2.4246201515197754, "step": 7760 }, { "epoch": 0.3696190476190476, "grad_norm": 0.03186832740902901, "learning_rate": 0.024000000208616257, "loss": 2.453251838684082, "step": 7762 }, { "epoch": 0.3697142857142857, "grad_norm": 0.029842182993888855, "learning_rate": 0.024000000208616257, "loss": 2.4685559272766113, "step": 7764 }, { "epoch": 0.3698095238095238, "grad_norm": 0.028950653970241547, "learning_rate": 0.024000000208616257, "loss": 2.4419355392456055, "step": 7766 }, { "epoch": 0.3699047619047619, "grad_norm": 0.0296019334346056, "learning_rate": 0.024000000208616257, "loss": 2.403416633605957, "step": 7768 }, { "epoch": 0.37, "grad_norm": 0.029091089963912964, "learning_rate": 0.024000000208616257, "loss": 2.4395499229431152, "step": 7770 }, { "epoch": 0.3700952380952381, "grad_norm": 0.029504654929041862, "learning_rate": 0.024000000208616257, "loss": 2.452195405960083, "step": 7772 }, { "epoch": 0.3701904761904762, "grad_norm": 0.028800232335925102, "learning_rate": 0.024000000208616257, "loss": 2.427269458770752, "step": 7774 }, { "epoch": 0.3702857142857143, "grad_norm": 0.028670575469732285, "learning_rate": 0.024000000208616257, "loss": 2.451760768890381, "step": 7776 }, { "epoch": 0.37038095238095237, "grad_norm": 0.029589397832751274, "learning_rate": 0.024000000208616257, "loss": 2.4747424125671387, "step": 7778 }, { "epoch": 0.37047619047619046, "grad_norm": 0.029093921184539795, "learning_rate": 0.024000000208616257, "loss": 2.447688341140747, "step": 7780 }, { "epoch": 0.37057142857142855, "grad_norm": 0.032775137573480606, "learning_rate": 0.024000000208616257, "loss": 2.433868408203125, "step": 7782 }, { "epoch": 0.37066666666666664, "grad_norm": 0.031652603298425674, "learning_rate": 0.024000000208616257, "loss": 2.4588804244995117, "step": 7784 }, { "epoch": 0.37076190476190474, "grad_norm": 0.03186587244272232, "learning_rate": 0.024000000208616257, "loss": 2.4255242347717285, "step": 7786 }, { "epoch": 0.37085714285714283, "grad_norm": 0.028897961601614952, "learning_rate": 0.024000000208616257, "loss": 2.4450230598449707, "step": 7788 }, { "epoch": 0.370952380952381, "grad_norm": 0.028758151456713676, "learning_rate": 0.024000000208616257, "loss": 2.436697006225586, "step": 7790 }, { "epoch": 0.37104761904761907, "grad_norm": 0.028884248808026314, "learning_rate": 0.024000000208616257, "loss": 2.4664530754089355, "step": 7792 }, { "epoch": 0.37114285714285716, "grad_norm": 0.029837369918823242, "learning_rate": 0.024000000208616257, "loss": 2.4731051921844482, "step": 7794 }, { "epoch": 0.37123809523809526, "grad_norm": 0.029959818348288536, "learning_rate": 0.024000000208616257, "loss": 2.5066590309143066, "step": 7796 }, { "epoch": 0.37133333333333335, "grad_norm": 0.0298271756619215, "learning_rate": 0.024000000208616257, "loss": 2.455813407897949, "step": 7798 }, { "epoch": 0.37142857142857144, "grad_norm": 0.030976271256804466, "learning_rate": 0.024000000208616257, "loss": 2.4044947624206543, "step": 7800 }, { "epoch": 0.37152380952380953, "grad_norm": 0.030658384785056114, "learning_rate": 0.024000000208616257, "loss": 2.460048198699951, "step": 7802 }, { "epoch": 0.3716190476190476, "grad_norm": 0.030296294018626213, "learning_rate": 0.024000000208616257, "loss": 2.470064163208008, "step": 7804 }, { "epoch": 0.3717142857142857, "grad_norm": 0.03031502477824688, "learning_rate": 0.024000000208616257, "loss": 2.433128595352173, "step": 7806 }, { "epoch": 0.3718095238095238, "grad_norm": 0.029653269797563553, "learning_rate": 0.024000000208616257, "loss": 2.484334945678711, "step": 7808 }, { "epoch": 0.3719047619047619, "grad_norm": 0.03042561002075672, "learning_rate": 0.024000000208616257, "loss": 2.443537712097168, "step": 7810 }, { "epoch": 0.372, "grad_norm": 0.029283063486218452, "learning_rate": 0.024000000208616257, "loss": 2.459822177886963, "step": 7812 }, { "epoch": 0.3720952380952381, "grad_norm": 0.028847619891166687, "learning_rate": 0.024000000208616257, "loss": 2.4484548568725586, "step": 7814 }, { "epoch": 0.3721904761904762, "grad_norm": 0.028816167265176773, "learning_rate": 0.024000000208616257, "loss": 2.4571311473846436, "step": 7816 }, { "epoch": 0.3722857142857143, "grad_norm": 0.03056853823363781, "learning_rate": 0.024000000208616257, "loss": 2.460139751434326, "step": 7818 }, { "epoch": 0.37238095238095237, "grad_norm": 0.03138864412903786, "learning_rate": 0.024000000208616257, "loss": 2.425081253051758, "step": 7820 }, { "epoch": 0.37247619047619046, "grad_norm": 0.029464127495884895, "learning_rate": 0.024000000208616257, "loss": 2.4527788162231445, "step": 7822 }, { "epoch": 0.37257142857142855, "grad_norm": 0.030216645449399948, "learning_rate": 0.024000000208616257, "loss": 2.436513662338257, "step": 7824 }, { "epoch": 0.37266666666666665, "grad_norm": 0.028864718973636627, "learning_rate": 0.024000000208616257, "loss": 2.423444986343384, "step": 7826 }, { "epoch": 0.37276190476190474, "grad_norm": 0.031557969748973846, "learning_rate": 0.024000000208616257, "loss": 2.458949327468872, "step": 7828 }, { "epoch": 0.37285714285714283, "grad_norm": 0.03171972557902336, "learning_rate": 0.024000000208616257, "loss": 2.452648162841797, "step": 7830 }, { "epoch": 0.372952380952381, "grad_norm": 0.03247501328587532, "learning_rate": 0.024000000208616257, "loss": 2.432769536972046, "step": 7832 }, { "epoch": 0.3730476190476191, "grad_norm": 0.03633379191160202, "learning_rate": 0.024000000208616257, "loss": 2.420285701751709, "step": 7834 }, { "epoch": 0.37314285714285716, "grad_norm": 0.036557771265506744, "learning_rate": 0.024000000208616257, "loss": 2.441042900085449, "step": 7836 }, { "epoch": 0.37323809523809526, "grad_norm": 0.03071487322449684, "learning_rate": 0.024000000208616257, "loss": 2.4126367568969727, "step": 7838 }, { "epoch": 0.37333333333333335, "grad_norm": 0.02945101074874401, "learning_rate": 0.024000000208616257, "loss": 2.4435384273529053, "step": 7840 }, { "epoch": 0.37342857142857144, "grad_norm": 0.0289284810423851, "learning_rate": 0.024000000208616257, "loss": 2.4197590351104736, "step": 7842 }, { "epoch": 0.37352380952380954, "grad_norm": 0.028454801067709923, "learning_rate": 0.024000000208616257, "loss": 2.440265655517578, "step": 7844 }, { "epoch": 0.37361904761904763, "grad_norm": 0.03025783598423004, "learning_rate": 0.024000000208616257, "loss": 2.4348204135894775, "step": 7846 }, { "epoch": 0.3737142857142857, "grad_norm": 0.03496683016419411, "learning_rate": 0.024000000208616257, "loss": 2.4629476070404053, "step": 7848 }, { "epoch": 0.3738095238095238, "grad_norm": 0.030315641313791275, "learning_rate": 0.024000000208616257, "loss": 2.44124698638916, "step": 7850 }, { "epoch": 0.3739047619047619, "grad_norm": 0.0288659930229187, "learning_rate": 0.024000000208616257, "loss": 2.4049103260040283, "step": 7852 }, { "epoch": 0.374, "grad_norm": 0.029200775548815727, "learning_rate": 0.024000000208616257, "loss": 2.43748140335083, "step": 7854 }, { "epoch": 0.3740952380952381, "grad_norm": 0.028051774948835373, "learning_rate": 0.024000000208616257, "loss": 2.4556164741516113, "step": 7856 }, { "epoch": 0.3741904761904762, "grad_norm": 0.028785381466150284, "learning_rate": 0.024000000208616257, "loss": 2.438769817352295, "step": 7858 }, { "epoch": 0.3742857142857143, "grad_norm": 0.02994595468044281, "learning_rate": 0.024000000208616257, "loss": 2.4150390625, "step": 7860 }, { "epoch": 0.37438095238095237, "grad_norm": 0.030494481325149536, "learning_rate": 0.024000000208616257, "loss": 2.4297571182250977, "step": 7862 }, { "epoch": 0.37447619047619046, "grad_norm": 0.030371379107236862, "learning_rate": 0.024000000208616257, "loss": 2.41623592376709, "step": 7864 }, { "epoch": 0.37457142857142856, "grad_norm": 0.028989948332309723, "learning_rate": 0.024000000208616257, "loss": 2.384580612182617, "step": 7866 }, { "epoch": 0.37466666666666665, "grad_norm": 0.02777065522968769, "learning_rate": 0.024000000208616257, "loss": 2.4850404262542725, "step": 7868 }, { "epoch": 0.37476190476190474, "grad_norm": 0.027975386008620262, "learning_rate": 0.024000000208616257, "loss": 2.439223289489746, "step": 7870 }, { "epoch": 0.37485714285714283, "grad_norm": 0.028820427134633064, "learning_rate": 0.024000000208616257, "loss": 2.4072394371032715, "step": 7872 }, { "epoch": 0.3749523809523809, "grad_norm": 0.028393246233463287, "learning_rate": 0.024000000208616257, "loss": 2.457364559173584, "step": 7874 }, { "epoch": 0.3750476190476191, "grad_norm": 0.02920963056385517, "learning_rate": 0.024000000208616257, "loss": 2.4492745399475098, "step": 7876 }, { "epoch": 0.37514285714285717, "grad_norm": 0.028912536799907684, "learning_rate": 0.024000000208616257, "loss": 2.421586036682129, "step": 7878 }, { "epoch": 0.37523809523809526, "grad_norm": 0.0279832910746336, "learning_rate": 0.024000000208616257, "loss": 2.469599962234497, "step": 7880 }, { "epoch": 0.37533333333333335, "grad_norm": 0.02839517593383789, "learning_rate": 0.024000000208616257, "loss": 2.424380302429199, "step": 7882 }, { "epoch": 0.37542857142857144, "grad_norm": 0.028263872489333153, "learning_rate": 0.024000000208616257, "loss": 2.4414596557617188, "step": 7884 }, { "epoch": 0.37552380952380954, "grad_norm": 0.02818380296230316, "learning_rate": 0.024000000208616257, "loss": 2.4414939880371094, "step": 7886 }, { "epoch": 0.37561904761904763, "grad_norm": 0.02882547676563263, "learning_rate": 0.024000000208616257, "loss": 2.443189859390259, "step": 7888 }, { "epoch": 0.3757142857142857, "grad_norm": 0.029784325510263443, "learning_rate": 0.024000000208616257, "loss": 2.4405150413513184, "step": 7890 }, { "epoch": 0.3758095238095238, "grad_norm": 0.03142411261796951, "learning_rate": 0.024000000208616257, "loss": 2.4202585220336914, "step": 7892 }, { "epoch": 0.3759047619047619, "grad_norm": 0.029436852782964706, "learning_rate": 0.024000000208616257, "loss": 2.443398952484131, "step": 7894 }, { "epoch": 0.376, "grad_norm": 0.028339795768260956, "learning_rate": 0.024000000208616257, "loss": 2.4409894943237305, "step": 7896 }, { "epoch": 0.3760952380952381, "grad_norm": 0.0277994554489851, "learning_rate": 0.024000000208616257, "loss": 2.4607491493225098, "step": 7898 }, { "epoch": 0.3761904761904762, "grad_norm": 0.028062719851732254, "learning_rate": 0.024000000208616257, "loss": 2.4404945373535156, "step": 7900 }, { "epoch": 0.3762857142857143, "grad_norm": 0.029599038884043694, "learning_rate": 0.024000000208616257, "loss": 2.4332189559936523, "step": 7902 }, { "epoch": 0.37638095238095237, "grad_norm": 0.029335658997297287, "learning_rate": 0.024000000208616257, "loss": 2.4495372772216797, "step": 7904 }, { "epoch": 0.37647619047619046, "grad_norm": 0.027667760848999023, "learning_rate": 0.024000000208616257, "loss": 2.410395622253418, "step": 7906 }, { "epoch": 0.37657142857142856, "grad_norm": 0.02912190370261669, "learning_rate": 0.024000000208616257, "loss": 2.4394338130950928, "step": 7908 }, { "epoch": 0.37666666666666665, "grad_norm": 0.02933194488286972, "learning_rate": 0.024000000208616257, "loss": 2.427926540374756, "step": 7910 }, { "epoch": 0.37676190476190474, "grad_norm": 0.027715632691979408, "learning_rate": 0.024000000208616257, "loss": 2.399934768676758, "step": 7912 }, { "epoch": 0.37685714285714284, "grad_norm": 0.028720274567604065, "learning_rate": 0.024000000208616257, "loss": 2.4178452491760254, "step": 7914 }, { "epoch": 0.3769523809523809, "grad_norm": 0.028340080752968788, "learning_rate": 0.024000000208616257, "loss": 2.4195823669433594, "step": 7916 }, { "epoch": 0.377047619047619, "grad_norm": 0.029521144926548004, "learning_rate": 0.024000000208616257, "loss": 2.4333229064941406, "step": 7918 }, { "epoch": 0.37714285714285717, "grad_norm": 0.029114585369825363, "learning_rate": 0.024000000208616257, "loss": 2.4116251468658447, "step": 7920 }, { "epoch": 0.37723809523809526, "grad_norm": 0.0309908427298069, "learning_rate": 0.024000000208616257, "loss": 2.454404830932617, "step": 7922 }, { "epoch": 0.37733333333333335, "grad_norm": 0.030011024326086044, "learning_rate": 0.024000000208616257, "loss": 2.4064207077026367, "step": 7924 }, { "epoch": 0.37742857142857145, "grad_norm": 0.029047660529613495, "learning_rate": 0.024000000208616257, "loss": 2.4633049964904785, "step": 7926 }, { "epoch": 0.37752380952380954, "grad_norm": 0.028000539168715477, "learning_rate": 0.024000000208616257, "loss": 2.452277183532715, "step": 7928 }, { "epoch": 0.37761904761904763, "grad_norm": 0.028581589460372925, "learning_rate": 0.024000000208616257, "loss": 2.392200469970703, "step": 7930 }, { "epoch": 0.3777142857142857, "grad_norm": 0.02968982793390751, "learning_rate": 0.024000000208616257, "loss": 2.4006316661834717, "step": 7932 }, { "epoch": 0.3778095238095238, "grad_norm": 0.02924474887549877, "learning_rate": 0.024000000208616257, "loss": 2.3983373641967773, "step": 7934 }, { "epoch": 0.3779047619047619, "grad_norm": 0.028637468814849854, "learning_rate": 0.024000000208616257, "loss": 2.439976692199707, "step": 7936 }, { "epoch": 0.378, "grad_norm": 0.03025992028415203, "learning_rate": 0.024000000208616257, "loss": 2.4477944374084473, "step": 7938 }, { "epoch": 0.3780952380952381, "grad_norm": 0.028772177174687386, "learning_rate": 0.024000000208616257, "loss": 2.4352502822875977, "step": 7940 }, { "epoch": 0.3781904761904762, "grad_norm": 0.028234926983714104, "learning_rate": 0.024000000208616257, "loss": 2.4501125812530518, "step": 7942 }, { "epoch": 0.3782857142857143, "grad_norm": 0.03026161901652813, "learning_rate": 0.024000000208616257, "loss": 2.434540271759033, "step": 7944 }, { "epoch": 0.3783809523809524, "grad_norm": 0.028540410101413727, "learning_rate": 0.024000000208616257, "loss": 2.4307427406311035, "step": 7946 }, { "epoch": 0.37847619047619047, "grad_norm": 0.029920483008027077, "learning_rate": 0.024000000208616257, "loss": 2.406980037689209, "step": 7948 }, { "epoch": 0.37857142857142856, "grad_norm": 0.029097573831677437, "learning_rate": 0.024000000208616257, "loss": 2.4063053131103516, "step": 7950 }, { "epoch": 0.37866666666666665, "grad_norm": 0.027972117066383362, "learning_rate": 0.024000000208616257, "loss": 2.4018518924713135, "step": 7952 }, { "epoch": 0.37876190476190474, "grad_norm": 0.02733480930328369, "learning_rate": 0.024000000208616257, "loss": 2.3996734619140625, "step": 7954 }, { "epoch": 0.37885714285714284, "grad_norm": 0.028437677770853043, "learning_rate": 0.024000000208616257, "loss": 2.3846287727355957, "step": 7956 }, { "epoch": 0.37895238095238093, "grad_norm": 0.029251739382743835, "learning_rate": 0.024000000208616257, "loss": 2.4032130241394043, "step": 7958 }, { "epoch": 0.379047619047619, "grad_norm": 0.03025747649371624, "learning_rate": 0.024000000208616257, "loss": 2.4173378944396973, "step": 7960 }, { "epoch": 0.37914285714285717, "grad_norm": 0.028140155598521233, "learning_rate": 0.024000000208616257, "loss": 2.3998188972473145, "step": 7962 }, { "epoch": 0.37923809523809526, "grad_norm": 0.028313225135207176, "learning_rate": 0.024000000208616257, "loss": 2.4070193767547607, "step": 7964 }, { "epoch": 0.37933333333333336, "grad_norm": 0.02984193153679371, "learning_rate": 0.024000000208616257, "loss": 2.4260950088500977, "step": 7966 }, { "epoch": 0.37942857142857145, "grad_norm": 0.029521387070417404, "learning_rate": 0.024000000208616257, "loss": 2.4084835052490234, "step": 7968 }, { "epoch": 0.37952380952380954, "grad_norm": 0.028538821265101433, "learning_rate": 0.024000000208616257, "loss": 2.443000316619873, "step": 7970 }, { "epoch": 0.37961904761904763, "grad_norm": 0.02874407172203064, "learning_rate": 0.024000000208616257, "loss": 2.405698537826538, "step": 7972 }, { "epoch": 0.3797142857142857, "grad_norm": 0.03067825548350811, "learning_rate": 0.024000000208616257, "loss": 2.4192276000976562, "step": 7974 }, { "epoch": 0.3798095238095238, "grad_norm": 0.02825484797358513, "learning_rate": 0.024000000208616257, "loss": 2.3756394386291504, "step": 7976 }, { "epoch": 0.3799047619047619, "grad_norm": 0.02877754345536232, "learning_rate": 0.024000000208616257, "loss": 2.371441602706909, "step": 7978 }, { "epoch": 0.38, "grad_norm": 0.027960767969489098, "learning_rate": 0.024000000208616257, "loss": 2.445590019226074, "step": 7980 }, { "epoch": 0.3800952380952381, "grad_norm": 0.028159404173493385, "learning_rate": 0.024000000208616257, "loss": 2.3857991695404053, "step": 7982 }, { "epoch": 0.3801904761904762, "grad_norm": 0.02837482839822769, "learning_rate": 0.024000000208616257, "loss": 2.423754930496216, "step": 7984 }, { "epoch": 0.3802857142857143, "grad_norm": 0.03342810645699501, "learning_rate": 0.024000000208616257, "loss": 2.3966898918151855, "step": 7986 }, { "epoch": 0.3803809523809524, "grad_norm": 0.03137626126408577, "learning_rate": 0.024000000208616257, "loss": 2.382143020629883, "step": 7988 }, { "epoch": 0.38047619047619047, "grad_norm": 0.02733631245791912, "learning_rate": 0.024000000208616257, "loss": 2.4120984077453613, "step": 7990 }, { "epoch": 0.38057142857142856, "grad_norm": 0.02795199304819107, "learning_rate": 0.024000000208616257, "loss": 2.406386375427246, "step": 7992 }, { "epoch": 0.38066666666666665, "grad_norm": 0.029779259115457535, "learning_rate": 0.024000000208616257, "loss": 2.4212799072265625, "step": 7994 }, { "epoch": 0.38076190476190475, "grad_norm": 0.028144316747784615, "learning_rate": 0.024000000208616257, "loss": 2.3986973762512207, "step": 7996 }, { "epoch": 0.38085714285714284, "grad_norm": 0.03164883330464363, "learning_rate": 0.024000000208616257, "loss": 2.407953977584839, "step": 7998 }, { "epoch": 0.38095238095238093, "grad_norm": 0.029638055711984634, "learning_rate": 0.024000000208616257, "loss": 2.4183053970336914, "step": 8000 }, { "epoch": 0.381047619047619, "grad_norm": 0.030216258019208908, "learning_rate": 0.024000000208616257, "loss": 2.4385006427764893, "step": 8002 }, { "epoch": 0.3811428571428571, "grad_norm": 0.03007127158343792, "learning_rate": 0.024000000208616257, "loss": 2.4138636589050293, "step": 8004 }, { "epoch": 0.38123809523809526, "grad_norm": 0.029564345255494118, "learning_rate": 0.024000000208616257, "loss": 2.4123446941375732, "step": 8006 }, { "epoch": 0.38133333333333336, "grad_norm": 0.028302181512117386, "learning_rate": 0.024000000208616257, "loss": 2.436107635498047, "step": 8008 }, { "epoch": 0.38142857142857145, "grad_norm": 0.03255651891231537, "learning_rate": 0.024000000208616257, "loss": 2.4111504554748535, "step": 8010 }, { "epoch": 0.38152380952380954, "grad_norm": 0.030574722215533257, "learning_rate": 0.024000000208616257, "loss": 2.420630931854248, "step": 8012 }, { "epoch": 0.38161904761904764, "grad_norm": 0.037482671439647675, "learning_rate": 0.024000000208616257, "loss": 2.4222002029418945, "step": 8014 }, { "epoch": 0.38171428571428573, "grad_norm": 0.04023033007979393, "learning_rate": 0.024000000208616257, "loss": 2.403219223022461, "step": 8016 }, { "epoch": 0.3818095238095238, "grad_norm": 0.03250053524971008, "learning_rate": 0.024000000208616257, "loss": 2.4136571884155273, "step": 8018 }, { "epoch": 0.3819047619047619, "grad_norm": 0.02878623828291893, "learning_rate": 0.024000000208616257, "loss": 2.4211456775665283, "step": 8020 }, { "epoch": 0.382, "grad_norm": 0.029791178181767464, "learning_rate": 0.024000000208616257, "loss": 2.4281234741210938, "step": 8022 }, { "epoch": 0.3820952380952381, "grad_norm": 0.02939440682530403, "learning_rate": 0.024000000208616257, "loss": 2.4083919525146484, "step": 8024 }, { "epoch": 0.3821904761904762, "grad_norm": 0.027963915839791298, "learning_rate": 0.024000000208616257, "loss": 2.4300785064697266, "step": 8026 }, { "epoch": 0.3822857142857143, "grad_norm": 0.029462475329637527, "learning_rate": 0.024000000208616257, "loss": 2.3846471309661865, "step": 8028 }, { "epoch": 0.3823809523809524, "grad_norm": 0.028075769543647766, "learning_rate": 0.024000000208616257, "loss": 2.415012836456299, "step": 8030 }, { "epoch": 0.38247619047619047, "grad_norm": 0.028231319040060043, "learning_rate": 0.024000000208616257, "loss": 2.3944473266601562, "step": 8032 }, { "epoch": 0.38257142857142856, "grad_norm": 0.028056960552930832, "learning_rate": 0.024000000208616257, "loss": 2.4207353591918945, "step": 8034 }, { "epoch": 0.38266666666666665, "grad_norm": 0.02782498300075531, "learning_rate": 0.024000000208616257, "loss": 2.4154305458068848, "step": 8036 }, { "epoch": 0.38276190476190475, "grad_norm": 0.027863286435604095, "learning_rate": 0.024000000208616257, "loss": 2.4337856769561768, "step": 8038 }, { "epoch": 0.38285714285714284, "grad_norm": 0.031806278973817825, "learning_rate": 0.024000000208616257, "loss": 2.3991880416870117, "step": 8040 }, { "epoch": 0.38295238095238093, "grad_norm": 0.03415636345744133, "learning_rate": 0.024000000208616257, "loss": 2.417142391204834, "step": 8042 }, { "epoch": 0.383047619047619, "grad_norm": 0.028553329408168793, "learning_rate": 0.024000000208616257, "loss": 2.417614698410034, "step": 8044 }, { "epoch": 0.3831428571428571, "grad_norm": 0.028021221980452538, "learning_rate": 0.024000000208616257, "loss": 2.399876594543457, "step": 8046 }, { "epoch": 0.3832380952380952, "grad_norm": 0.028488734737038612, "learning_rate": 0.024000000208616257, "loss": 2.3898541927337646, "step": 8048 }, { "epoch": 0.38333333333333336, "grad_norm": 0.028799377381801605, "learning_rate": 0.024000000208616257, "loss": 2.4176101684570312, "step": 8050 }, { "epoch": 0.38342857142857145, "grad_norm": 0.030246607959270477, "learning_rate": 0.024000000208616257, "loss": 2.384399652481079, "step": 8052 }, { "epoch": 0.38352380952380954, "grad_norm": 0.035926271229982376, "learning_rate": 0.024000000208616257, "loss": 2.391172409057617, "step": 8054 }, { "epoch": 0.38361904761904764, "grad_norm": 0.03170817345380783, "learning_rate": 0.024000000208616257, "loss": 2.401005744934082, "step": 8056 }, { "epoch": 0.38371428571428573, "grad_norm": 0.03140395134687424, "learning_rate": 0.024000000208616257, "loss": 2.4363880157470703, "step": 8058 }, { "epoch": 0.3838095238095238, "grad_norm": 0.030085716396570206, "learning_rate": 0.024000000208616257, "loss": 2.4224977493286133, "step": 8060 }, { "epoch": 0.3839047619047619, "grad_norm": 0.028978794813156128, "learning_rate": 0.024000000208616257, "loss": 2.360154628753662, "step": 8062 }, { "epoch": 0.384, "grad_norm": 0.029008228331804276, "learning_rate": 0.024000000208616257, "loss": 2.424927234649658, "step": 8064 }, { "epoch": 0.3840952380952381, "grad_norm": 0.028758998960256577, "learning_rate": 0.024000000208616257, "loss": 2.393003463745117, "step": 8066 }, { "epoch": 0.3841904761904762, "grad_norm": 0.028207242488861084, "learning_rate": 0.024000000208616257, "loss": 2.3995838165283203, "step": 8068 }, { "epoch": 0.3842857142857143, "grad_norm": 0.0287872776389122, "learning_rate": 0.024000000208616257, "loss": 2.4063005447387695, "step": 8070 }, { "epoch": 0.3843809523809524, "grad_norm": 0.02903800830245018, "learning_rate": 0.024000000208616257, "loss": 2.3890509605407715, "step": 8072 }, { "epoch": 0.38447619047619047, "grad_norm": 0.02937864512205124, "learning_rate": 0.024000000208616257, "loss": 2.4275288581848145, "step": 8074 }, { "epoch": 0.38457142857142856, "grad_norm": 0.030724700540304184, "learning_rate": 0.024000000208616257, "loss": 2.3872509002685547, "step": 8076 }, { "epoch": 0.38466666666666666, "grad_norm": 0.02854529581964016, "learning_rate": 0.024000000208616257, "loss": 2.402254104614258, "step": 8078 }, { "epoch": 0.38476190476190475, "grad_norm": 0.028767447918653488, "learning_rate": 0.024000000208616257, "loss": 2.391077756881714, "step": 8080 }, { "epoch": 0.38485714285714284, "grad_norm": 0.027745762839913368, "learning_rate": 0.024000000208616257, "loss": 2.406521797180176, "step": 8082 }, { "epoch": 0.38495238095238093, "grad_norm": 0.028376711532473564, "learning_rate": 0.024000000208616257, "loss": 2.4107666015625, "step": 8084 }, { "epoch": 0.385047619047619, "grad_norm": 0.027647122740745544, "learning_rate": 0.024000000208616257, "loss": 2.4156739711761475, "step": 8086 }, { "epoch": 0.3851428571428571, "grad_norm": 0.03119072876870632, "learning_rate": 0.024000000208616257, "loss": 2.4296696186065674, "step": 8088 }, { "epoch": 0.3852380952380952, "grad_norm": 0.027812017127871513, "learning_rate": 0.024000000208616257, "loss": 2.3683009147644043, "step": 8090 }, { "epoch": 0.38533333333333336, "grad_norm": 0.028261560946702957, "learning_rate": 0.024000000208616257, "loss": 2.413783550262451, "step": 8092 }, { "epoch": 0.38542857142857145, "grad_norm": 0.027989903464913368, "learning_rate": 0.024000000208616257, "loss": 2.426837205886841, "step": 8094 }, { "epoch": 0.38552380952380955, "grad_norm": 0.02883002534508705, "learning_rate": 0.024000000208616257, "loss": 2.3937430381774902, "step": 8096 }, { "epoch": 0.38561904761904764, "grad_norm": 0.0283648744225502, "learning_rate": 0.024000000208616257, "loss": 2.3749618530273438, "step": 8098 }, { "epoch": 0.38571428571428573, "grad_norm": 0.0314413458108902, "learning_rate": 0.024000000208616257, "loss": 2.4014320373535156, "step": 8100 }, { "epoch": 0.3858095238095238, "grad_norm": 0.031130686402320862, "learning_rate": 0.024000000208616257, "loss": 2.4279770851135254, "step": 8102 }, { "epoch": 0.3859047619047619, "grad_norm": 0.03453836590051651, "learning_rate": 0.024000000208616257, "loss": 2.3890111446380615, "step": 8104 }, { "epoch": 0.386, "grad_norm": 0.03142851963639259, "learning_rate": 0.024000000208616257, "loss": 2.408669948577881, "step": 8106 }, { "epoch": 0.3860952380952381, "grad_norm": 0.032724298536777496, "learning_rate": 0.024000000208616257, "loss": 2.385160446166992, "step": 8108 }, { "epoch": 0.3861904761904762, "grad_norm": 0.028042089194059372, "learning_rate": 0.024000000208616257, "loss": 2.3673155307769775, "step": 8110 }, { "epoch": 0.3862857142857143, "grad_norm": 0.02864069864153862, "learning_rate": 0.024000000208616257, "loss": 2.4150021076202393, "step": 8112 }, { "epoch": 0.3863809523809524, "grad_norm": 0.02857063151896, "learning_rate": 0.024000000208616257, "loss": 2.406463623046875, "step": 8114 }, { "epoch": 0.3864761904761905, "grad_norm": 0.030241133645176888, "learning_rate": 0.024000000208616257, "loss": 2.420328140258789, "step": 8116 }, { "epoch": 0.38657142857142857, "grad_norm": 0.02935524843633175, "learning_rate": 0.024000000208616257, "loss": 2.3876240253448486, "step": 8118 }, { "epoch": 0.38666666666666666, "grad_norm": 0.028986966237425804, "learning_rate": 0.024000000208616257, "loss": 2.4159841537475586, "step": 8120 }, { "epoch": 0.38676190476190475, "grad_norm": 0.030956147238612175, "learning_rate": 0.024000000208616257, "loss": 2.4029667377471924, "step": 8122 }, { "epoch": 0.38685714285714284, "grad_norm": 0.027675064280629158, "learning_rate": 0.024000000208616257, "loss": 2.402059555053711, "step": 8124 }, { "epoch": 0.38695238095238094, "grad_norm": 0.027650609612464905, "learning_rate": 0.024000000208616257, "loss": 2.403700351715088, "step": 8126 }, { "epoch": 0.38704761904761903, "grad_norm": 0.02726244367659092, "learning_rate": 0.024000000208616257, "loss": 2.3871469497680664, "step": 8128 }, { "epoch": 0.3871428571428571, "grad_norm": 0.029704295098781586, "learning_rate": 0.024000000208616257, "loss": 2.3965277671813965, "step": 8130 }, { "epoch": 0.3872380952380952, "grad_norm": 0.026865532621741295, "learning_rate": 0.024000000208616257, "loss": 2.396368980407715, "step": 8132 }, { "epoch": 0.3873333333333333, "grad_norm": 0.027943462133407593, "learning_rate": 0.024000000208616257, "loss": 2.375339984893799, "step": 8134 }, { "epoch": 0.38742857142857146, "grad_norm": 0.028090450912714005, "learning_rate": 0.024000000208616257, "loss": 2.3947372436523438, "step": 8136 }, { "epoch": 0.38752380952380955, "grad_norm": 0.02923293225467205, "learning_rate": 0.024000000208616257, "loss": 2.4054272174835205, "step": 8138 }, { "epoch": 0.38761904761904764, "grad_norm": 0.027735648676753044, "learning_rate": 0.024000000208616257, "loss": 2.381399154663086, "step": 8140 }, { "epoch": 0.38771428571428573, "grad_norm": 0.02893795818090439, "learning_rate": 0.024000000208616257, "loss": 2.412998676300049, "step": 8142 }, { "epoch": 0.3878095238095238, "grad_norm": 0.02903169021010399, "learning_rate": 0.024000000208616257, "loss": 2.440553903579712, "step": 8144 }, { "epoch": 0.3879047619047619, "grad_norm": 0.029780875891447067, "learning_rate": 0.024000000208616257, "loss": 2.3812618255615234, "step": 8146 }, { "epoch": 0.388, "grad_norm": 0.031076887622475624, "learning_rate": 0.024000000208616257, "loss": 2.3950014114379883, "step": 8148 }, { "epoch": 0.3880952380952381, "grad_norm": 0.030158033594489098, "learning_rate": 0.024000000208616257, "loss": 2.390374183654785, "step": 8150 }, { "epoch": 0.3881904761904762, "grad_norm": 0.03248704597353935, "learning_rate": 0.024000000208616257, "loss": 2.3606462478637695, "step": 8152 }, { "epoch": 0.3882857142857143, "grad_norm": 0.030936649069190025, "learning_rate": 0.024000000208616257, "loss": 2.421095132827759, "step": 8154 }, { "epoch": 0.3883809523809524, "grad_norm": 0.02911587990820408, "learning_rate": 0.024000000208616257, "loss": 2.382349729537964, "step": 8156 }, { "epoch": 0.3884761904761905, "grad_norm": 0.02945566549897194, "learning_rate": 0.024000000208616257, "loss": 2.3850114345550537, "step": 8158 }, { "epoch": 0.38857142857142857, "grad_norm": 0.028396569192409515, "learning_rate": 0.024000000208616257, "loss": 2.4073710441589355, "step": 8160 }, { "epoch": 0.38866666666666666, "grad_norm": 0.028683774173259735, "learning_rate": 0.024000000208616257, "loss": 2.393578052520752, "step": 8162 }, { "epoch": 0.38876190476190475, "grad_norm": 0.02782920002937317, "learning_rate": 0.024000000208616257, "loss": 2.3586039543151855, "step": 8164 }, { "epoch": 0.38885714285714285, "grad_norm": 0.02891562320291996, "learning_rate": 0.024000000208616257, "loss": 2.4334371089935303, "step": 8166 }, { "epoch": 0.38895238095238094, "grad_norm": 0.02836264856159687, "learning_rate": 0.024000000208616257, "loss": 2.392763137817383, "step": 8168 }, { "epoch": 0.38904761904761903, "grad_norm": 0.02778981812298298, "learning_rate": 0.024000000208616257, "loss": 2.439849853515625, "step": 8170 }, { "epoch": 0.3891428571428571, "grad_norm": 0.02963663451373577, "learning_rate": 0.024000000208616257, "loss": 2.4108645915985107, "step": 8172 }, { "epoch": 0.3892380952380952, "grad_norm": 0.02889464981853962, "learning_rate": 0.024000000208616257, "loss": 2.4064290523529053, "step": 8174 }, { "epoch": 0.3893333333333333, "grad_norm": 0.029959242790937424, "learning_rate": 0.024000000208616257, "loss": 2.3923683166503906, "step": 8176 }, { "epoch": 0.3894285714285714, "grad_norm": 0.02911071479320526, "learning_rate": 0.024000000208616257, "loss": 2.3882713317871094, "step": 8178 }, { "epoch": 0.38952380952380955, "grad_norm": 0.027831431478261948, "learning_rate": 0.024000000208616257, "loss": 2.3817667961120605, "step": 8180 }, { "epoch": 0.38961904761904764, "grad_norm": 0.028713926672935486, "learning_rate": 0.024000000208616257, "loss": 2.368633985519409, "step": 8182 }, { "epoch": 0.38971428571428574, "grad_norm": 0.027670959010720253, "learning_rate": 0.024000000208616257, "loss": 2.3836326599121094, "step": 8184 }, { "epoch": 0.38980952380952383, "grad_norm": 0.030387623235583305, "learning_rate": 0.024000000208616257, "loss": 2.40157151222229, "step": 8186 }, { "epoch": 0.3899047619047619, "grad_norm": 0.03013112023472786, "learning_rate": 0.024000000208616257, "loss": 2.392521381378174, "step": 8188 }, { "epoch": 0.39, "grad_norm": 0.02917291410267353, "learning_rate": 0.024000000208616257, "loss": 2.395615577697754, "step": 8190 }, { "epoch": 0.3900952380952381, "grad_norm": 0.0393579825758934, "learning_rate": 0.024000000208616257, "loss": 2.3796324729919434, "step": 8192 }, { "epoch": 0.3901904761904762, "grad_norm": 0.03853415697813034, "learning_rate": 0.024000000208616257, "loss": 2.3796048164367676, "step": 8194 }, { "epoch": 0.3902857142857143, "grad_norm": 0.040121495723724365, "learning_rate": 0.024000000208616257, "loss": 2.4220833778381348, "step": 8196 }, { "epoch": 0.3903809523809524, "grad_norm": 0.03342856094241142, "learning_rate": 0.024000000208616257, "loss": 2.40506649017334, "step": 8198 }, { "epoch": 0.3904761904761905, "grad_norm": 0.02867874875664711, "learning_rate": 0.024000000208616257, "loss": 2.430418014526367, "step": 8200 }, { "epoch": 0.39057142857142857, "grad_norm": 0.030486011877655983, "learning_rate": 0.024000000208616257, "loss": 2.3935654163360596, "step": 8202 }, { "epoch": 0.39066666666666666, "grad_norm": 0.028980495408177376, "learning_rate": 0.024000000208616257, "loss": 2.4220356941223145, "step": 8204 }, { "epoch": 0.39076190476190475, "grad_norm": 0.02748771570622921, "learning_rate": 0.024000000208616257, "loss": 2.399390697479248, "step": 8206 }, { "epoch": 0.39085714285714285, "grad_norm": 0.029958028346300125, "learning_rate": 0.024000000208616257, "loss": 2.4119906425476074, "step": 8208 }, { "epoch": 0.39095238095238094, "grad_norm": 0.029549023136496544, "learning_rate": 0.024000000208616257, "loss": 2.3912391662597656, "step": 8210 }, { "epoch": 0.39104761904761903, "grad_norm": 0.02851077914237976, "learning_rate": 0.024000000208616257, "loss": 2.378653049468994, "step": 8212 }, { "epoch": 0.3911428571428571, "grad_norm": 0.027724167332053185, "learning_rate": 0.024000000208616257, "loss": 2.414029598236084, "step": 8214 }, { "epoch": 0.3912380952380952, "grad_norm": 0.030015980824828148, "learning_rate": 0.024000000208616257, "loss": 2.3842036724090576, "step": 8216 }, { "epoch": 0.3913333333333333, "grad_norm": 0.02857678383588791, "learning_rate": 0.024000000208616257, "loss": 2.3494200706481934, "step": 8218 }, { "epoch": 0.3914285714285714, "grad_norm": 0.027653401717543602, "learning_rate": 0.024000000208616257, "loss": 2.4120776653289795, "step": 8220 }, { "epoch": 0.3915238095238095, "grad_norm": 0.02837136760354042, "learning_rate": 0.024000000208616257, "loss": 2.410022735595703, "step": 8222 }, { "epoch": 0.39161904761904764, "grad_norm": 0.03085894137620926, "learning_rate": 0.024000000208616257, "loss": 2.38316011428833, "step": 8224 }, { "epoch": 0.39171428571428574, "grad_norm": 0.028162896633148193, "learning_rate": 0.024000000208616257, "loss": 2.3826937675476074, "step": 8226 }, { "epoch": 0.39180952380952383, "grad_norm": 0.027698319405317307, "learning_rate": 0.024000000208616257, "loss": 2.425629138946533, "step": 8228 }, { "epoch": 0.3919047619047619, "grad_norm": 0.028594540432095528, "learning_rate": 0.024000000208616257, "loss": 2.4014925956726074, "step": 8230 }, { "epoch": 0.392, "grad_norm": 0.027523184195160866, "learning_rate": 0.024000000208616257, "loss": 2.40240478515625, "step": 8232 }, { "epoch": 0.3920952380952381, "grad_norm": 0.02799816243350506, "learning_rate": 0.024000000208616257, "loss": 2.382744789123535, "step": 8234 }, { "epoch": 0.3921904761904762, "grad_norm": 0.028344588354229927, "learning_rate": 0.024000000208616257, "loss": 2.366563320159912, "step": 8236 }, { "epoch": 0.3922857142857143, "grad_norm": 0.03379670903086662, "learning_rate": 0.024000000208616257, "loss": 2.401797294616699, "step": 8238 }, { "epoch": 0.3923809523809524, "grad_norm": 0.029196081683039665, "learning_rate": 0.024000000208616257, "loss": 2.4031734466552734, "step": 8240 }, { "epoch": 0.3924761904761905, "grad_norm": 0.030756859108805656, "learning_rate": 0.024000000208616257, "loss": 2.3939080238342285, "step": 8242 }, { "epoch": 0.39257142857142857, "grad_norm": 0.0316547229886055, "learning_rate": 0.024000000208616257, "loss": 2.411996841430664, "step": 8244 }, { "epoch": 0.39266666666666666, "grad_norm": 0.03331702575087547, "learning_rate": 0.024000000208616257, "loss": 2.4130964279174805, "step": 8246 }, { "epoch": 0.39276190476190476, "grad_norm": 0.031602561473846436, "learning_rate": 0.024000000208616257, "loss": 2.354173183441162, "step": 8248 }, { "epoch": 0.39285714285714285, "grad_norm": 0.028793461620807648, "learning_rate": 0.024000000208616257, "loss": 2.4169697761535645, "step": 8250 }, { "epoch": 0.39295238095238094, "grad_norm": 0.029268482699990273, "learning_rate": 0.024000000208616257, "loss": 2.408018112182617, "step": 8252 }, { "epoch": 0.39304761904761903, "grad_norm": 0.027068397030234337, "learning_rate": 0.024000000208616257, "loss": 2.3988542556762695, "step": 8254 }, { "epoch": 0.3931428571428571, "grad_norm": 0.02816309966146946, "learning_rate": 0.024000000208616257, "loss": 2.4061968326568604, "step": 8256 }, { "epoch": 0.3932380952380952, "grad_norm": 0.02733832411468029, "learning_rate": 0.024000000208616257, "loss": 2.4075047969818115, "step": 8258 }, { "epoch": 0.3933333333333333, "grad_norm": 0.031986381858587265, "learning_rate": 0.024000000208616257, "loss": 2.3895459175109863, "step": 8260 }, { "epoch": 0.3934285714285714, "grad_norm": 0.030595285817980766, "learning_rate": 0.024000000208616257, "loss": 2.413191795349121, "step": 8262 }, { "epoch": 0.3935238095238095, "grad_norm": 0.027916697785258293, "learning_rate": 0.024000000208616257, "loss": 2.363070249557495, "step": 8264 }, { "epoch": 0.39361904761904765, "grad_norm": 0.02857441082596779, "learning_rate": 0.024000000208616257, "loss": 2.398284673690796, "step": 8266 }, { "epoch": 0.39371428571428574, "grad_norm": 0.028194110840559006, "learning_rate": 0.024000000208616257, "loss": 2.376844882965088, "step": 8268 }, { "epoch": 0.39380952380952383, "grad_norm": 0.027285242453217506, "learning_rate": 0.024000000208616257, "loss": 2.40132737159729, "step": 8270 }, { "epoch": 0.3939047619047619, "grad_norm": 0.028201580047607422, "learning_rate": 0.024000000208616257, "loss": 2.395318031311035, "step": 8272 }, { "epoch": 0.394, "grad_norm": 0.0269472599029541, "learning_rate": 0.024000000208616257, "loss": 2.384045124053955, "step": 8274 }, { "epoch": 0.3940952380952381, "grad_norm": 0.02856915071606636, "learning_rate": 0.024000000208616257, "loss": 2.4184153079986572, "step": 8276 }, { "epoch": 0.3941904761904762, "grad_norm": 0.02848232351243496, "learning_rate": 0.024000000208616257, "loss": 2.3547134399414062, "step": 8278 }, { "epoch": 0.3942857142857143, "grad_norm": 0.027912689372897148, "learning_rate": 0.024000000208616257, "loss": 2.3985934257507324, "step": 8280 }, { "epoch": 0.3943809523809524, "grad_norm": 0.0296489205211401, "learning_rate": 0.024000000208616257, "loss": 2.412397861480713, "step": 8282 }, { "epoch": 0.3944761904761905, "grad_norm": 0.027641819790005684, "learning_rate": 0.024000000208616257, "loss": 2.3941755294799805, "step": 8284 }, { "epoch": 0.3945714285714286, "grad_norm": 0.02812846563756466, "learning_rate": 0.024000000208616257, "loss": 2.3984222412109375, "step": 8286 }, { "epoch": 0.39466666666666667, "grad_norm": 0.029841486364603043, "learning_rate": 0.024000000208616257, "loss": 2.400709629058838, "step": 8288 }, { "epoch": 0.39476190476190476, "grad_norm": 0.027592938393354416, "learning_rate": 0.024000000208616257, "loss": 2.390205144882202, "step": 8290 }, { "epoch": 0.39485714285714285, "grad_norm": 0.02837199717760086, "learning_rate": 0.024000000208616257, "loss": 2.3462467193603516, "step": 8292 }, { "epoch": 0.39495238095238094, "grad_norm": 0.03157012537121773, "learning_rate": 0.024000000208616257, "loss": 2.386631965637207, "step": 8294 }, { "epoch": 0.39504761904761904, "grad_norm": 0.028600599616765976, "learning_rate": 0.024000000208616257, "loss": 2.385531187057495, "step": 8296 }, { "epoch": 0.39514285714285713, "grad_norm": 0.02876421995460987, "learning_rate": 0.024000000208616257, "loss": 2.3923850059509277, "step": 8298 }, { "epoch": 0.3952380952380952, "grad_norm": 0.02994121052324772, "learning_rate": 0.024000000208616257, "loss": 2.412867546081543, "step": 8300 }, { "epoch": 0.3953333333333333, "grad_norm": 0.028619103133678436, "learning_rate": 0.024000000208616257, "loss": 2.3843612670898438, "step": 8302 }, { "epoch": 0.3954285714285714, "grad_norm": 0.028315668925642967, "learning_rate": 0.024000000208616257, "loss": 2.3896689414978027, "step": 8304 }, { "epoch": 0.3955238095238095, "grad_norm": 0.02968328818678856, "learning_rate": 0.024000000208616257, "loss": 2.3948962688446045, "step": 8306 }, { "epoch": 0.3956190476190476, "grad_norm": 0.028994450345635414, "learning_rate": 0.024000000208616257, "loss": 2.3938236236572266, "step": 8308 }, { "epoch": 0.39571428571428574, "grad_norm": 0.0287022702395916, "learning_rate": 0.024000000208616257, "loss": 2.3781380653381348, "step": 8310 }, { "epoch": 0.39580952380952383, "grad_norm": 0.02936253324151039, "learning_rate": 0.024000000208616257, "loss": 2.40885066986084, "step": 8312 }, { "epoch": 0.3959047619047619, "grad_norm": 0.029181092977523804, "learning_rate": 0.024000000208616257, "loss": 2.3969101905822754, "step": 8314 }, { "epoch": 0.396, "grad_norm": 0.03232038766145706, "learning_rate": 0.024000000208616257, "loss": 2.3807618618011475, "step": 8316 }, { "epoch": 0.3960952380952381, "grad_norm": 0.02935199998319149, "learning_rate": 0.024000000208616257, "loss": 2.3908839225769043, "step": 8318 }, { "epoch": 0.3961904761904762, "grad_norm": 0.02771443873643875, "learning_rate": 0.024000000208616257, "loss": 2.3800368309020996, "step": 8320 }, { "epoch": 0.3962857142857143, "grad_norm": 0.027311891317367554, "learning_rate": 0.024000000208616257, "loss": 2.3895773887634277, "step": 8322 }, { "epoch": 0.3963809523809524, "grad_norm": 0.02933877520263195, "learning_rate": 0.024000000208616257, "loss": 2.4067039489746094, "step": 8324 }, { "epoch": 0.3964761904761905, "grad_norm": 0.027190616354346275, "learning_rate": 0.024000000208616257, "loss": 2.400641918182373, "step": 8326 }, { "epoch": 0.3965714285714286, "grad_norm": 0.028106415644288063, "learning_rate": 0.024000000208616257, "loss": 2.401974678039551, "step": 8328 }, { "epoch": 0.39666666666666667, "grad_norm": 0.030319947749376297, "learning_rate": 0.024000000208616257, "loss": 2.379021644592285, "step": 8330 }, { "epoch": 0.39676190476190476, "grad_norm": 0.030503982678055763, "learning_rate": 0.024000000208616257, "loss": 2.38448429107666, "step": 8332 }, { "epoch": 0.39685714285714285, "grad_norm": 0.034917764365673065, "learning_rate": 0.024000000208616257, "loss": 2.3964133262634277, "step": 8334 }, { "epoch": 0.39695238095238095, "grad_norm": 0.03530740365386009, "learning_rate": 0.024000000208616257, "loss": 2.415297508239746, "step": 8336 }, { "epoch": 0.39704761904761904, "grad_norm": 0.028398558497428894, "learning_rate": 0.024000000208616257, "loss": 2.458207130432129, "step": 8338 }, { "epoch": 0.39714285714285713, "grad_norm": 0.028420789167284966, "learning_rate": 0.024000000208616257, "loss": 2.3903515338897705, "step": 8340 }, { "epoch": 0.3972380952380952, "grad_norm": 0.027277396991848946, "learning_rate": 0.024000000208616257, "loss": 2.429572820663452, "step": 8342 }, { "epoch": 0.3973333333333333, "grad_norm": 0.030627408996224403, "learning_rate": 0.024000000208616257, "loss": 2.3871617317199707, "step": 8344 }, { "epoch": 0.3974285714285714, "grad_norm": 0.028153130784630775, "learning_rate": 0.024000000208616257, "loss": 2.4435393810272217, "step": 8346 }, { "epoch": 0.3975238095238095, "grad_norm": 0.0276272501796484, "learning_rate": 0.024000000208616257, "loss": 2.383948802947998, "step": 8348 }, { "epoch": 0.3976190476190476, "grad_norm": 0.026846885681152344, "learning_rate": 0.024000000208616257, "loss": 2.396083354949951, "step": 8350 }, { "epoch": 0.3977142857142857, "grad_norm": 0.03224263712763786, "learning_rate": 0.024000000208616257, "loss": 2.381570816040039, "step": 8352 }, { "epoch": 0.39780952380952384, "grad_norm": 0.02929544262588024, "learning_rate": 0.024000000208616257, "loss": 2.451720714569092, "step": 8354 }, { "epoch": 0.3979047619047619, "grad_norm": 0.028361571952700615, "learning_rate": 0.024000000208616257, "loss": 2.4281210899353027, "step": 8356 }, { "epoch": 0.398, "grad_norm": 0.03200922906398773, "learning_rate": 0.024000000208616257, "loss": 2.403010845184326, "step": 8358 }, { "epoch": 0.3980952380952381, "grad_norm": 0.029426053166389465, "learning_rate": 0.024000000208616257, "loss": 2.4145288467407227, "step": 8360 }, { "epoch": 0.3981904761904762, "grad_norm": 0.02891813963651657, "learning_rate": 0.024000000208616257, "loss": 2.4068069458007812, "step": 8362 }, { "epoch": 0.3982857142857143, "grad_norm": 0.031707100570201874, "learning_rate": 0.024000000208616257, "loss": 2.388723134994507, "step": 8364 }, { "epoch": 0.3983809523809524, "grad_norm": 0.03351038694381714, "learning_rate": 0.024000000208616257, "loss": 2.4120843410491943, "step": 8366 }, { "epoch": 0.3984761904761905, "grad_norm": 0.02888479456305504, "learning_rate": 0.024000000208616257, "loss": 2.373612403869629, "step": 8368 }, { "epoch": 0.3985714285714286, "grad_norm": 0.029966363683342934, "learning_rate": 0.024000000208616257, "loss": 2.3948447704315186, "step": 8370 }, { "epoch": 0.39866666666666667, "grad_norm": 0.0347198061645031, "learning_rate": 0.024000000208616257, "loss": 2.425595760345459, "step": 8372 }, { "epoch": 0.39876190476190476, "grad_norm": 0.03103848174214363, "learning_rate": 0.024000000208616257, "loss": 2.4182000160217285, "step": 8374 }, { "epoch": 0.39885714285714285, "grad_norm": 0.02863946743309498, "learning_rate": 0.024000000208616257, "loss": 2.4258298873901367, "step": 8376 }, { "epoch": 0.39895238095238095, "grad_norm": 0.030011536553502083, "learning_rate": 0.024000000208616257, "loss": 2.418600082397461, "step": 8378 }, { "epoch": 0.39904761904761904, "grad_norm": 0.030882321298122406, "learning_rate": 0.024000000208616257, "loss": 2.413662910461426, "step": 8380 }, { "epoch": 0.39914285714285713, "grad_norm": 0.02987387776374817, "learning_rate": 0.024000000208616257, "loss": 2.4082579612731934, "step": 8382 }, { "epoch": 0.3992380952380952, "grad_norm": 0.02853129431605339, "learning_rate": 0.024000000208616257, "loss": 2.4323344230651855, "step": 8384 }, { "epoch": 0.3993333333333333, "grad_norm": 0.030858153477311134, "learning_rate": 0.024000000208616257, "loss": 2.396426200866699, "step": 8386 }, { "epoch": 0.3994285714285714, "grad_norm": 0.029824258759617805, "learning_rate": 0.024000000208616257, "loss": 2.3860530853271484, "step": 8388 }, { "epoch": 0.3995238095238095, "grad_norm": 0.02899234928190708, "learning_rate": 0.024000000208616257, "loss": 2.4157533645629883, "step": 8390 }, { "epoch": 0.3996190476190476, "grad_norm": 0.028678178787231445, "learning_rate": 0.024000000208616257, "loss": 2.420560359954834, "step": 8392 }, { "epoch": 0.3997142857142857, "grad_norm": 0.02889799140393734, "learning_rate": 0.024000000208616257, "loss": 2.43172550201416, "step": 8394 }, { "epoch": 0.39980952380952384, "grad_norm": 0.028679251670837402, "learning_rate": 0.024000000208616257, "loss": 2.4258341789245605, "step": 8396 }, { "epoch": 0.39990476190476193, "grad_norm": 0.0306342002004385, "learning_rate": 0.024000000208616257, "loss": 2.420658588409424, "step": 8398 }, { "epoch": 0.4, "grad_norm": 0.028866929933428764, "learning_rate": 0.024000000208616257, "loss": 2.4167237281799316, "step": 8400 }, { "epoch": 0.4000952380952381, "grad_norm": 0.027677226811647415, "learning_rate": 0.024000000208616257, "loss": 2.383977174758911, "step": 8402 }, { "epoch": 0.4001904761904762, "grad_norm": 0.028417101129889488, "learning_rate": 0.024000000208616257, "loss": 2.4031386375427246, "step": 8404 }, { "epoch": 0.4002857142857143, "grad_norm": 0.029537823051214218, "learning_rate": 0.024000000208616257, "loss": 2.3997793197631836, "step": 8406 }, { "epoch": 0.4003809523809524, "grad_norm": 0.027978166937828064, "learning_rate": 0.024000000208616257, "loss": 2.4204039573669434, "step": 8408 }, { "epoch": 0.4004761904761905, "grad_norm": 0.028987010940909386, "learning_rate": 0.024000000208616257, "loss": 2.41776704788208, "step": 8410 }, { "epoch": 0.4005714285714286, "grad_norm": 0.032575443387031555, "learning_rate": 0.024000000208616257, "loss": 2.4327659606933594, "step": 8412 }, { "epoch": 0.40066666666666667, "grad_norm": 0.028114238753914833, "learning_rate": 0.024000000208616257, "loss": 2.402665138244629, "step": 8414 }, { "epoch": 0.40076190476190476, "grad_norm": 0.02887202985584736, "learning_rate": 0.024000000208616257, "loss": 2.4323787689208984, "step": 8416 }, { "epoch": 0.40085714285714286, "grad_norm": 0.030073458328843117, "learning_rate": 0.024000000208616257, "loss": 2.4015049934387207, "step": 8418 }, { "epoch": 0.40095238095238095, "grad_norm": 0.028758374974131584, "learning_rate": 0.024000000208616257, "loss": 2.3947036266326904, "step": 8420 }, { "epoch": 0.40104761904761904, "grad_norm": 0.03157670423388481, "learning_rate": 0.024000000208616257, "loss": 2.429417133331299, "step": 8422 }, { "epoch": 0.40114285714285713, "grad_norm": 0.028206169605255127, "learning_rate": 0.024000000208616257, "loss": 2.4329676628112793, "step": 8424 }, { "epoch": 0.4012380952380952, "grad_norm": 0.027986960485577583, "learning_rate": 0.024000000208616257, "loss": 2.4135873317718506, "step": 8426 }, { "epoch": 0.4013333333333333, "grad_norm": 0.028139593079686165, "learning_rate": 0.024000000208616257, "loss": 2.4097800254821777, "step": 8428 }, { "epoch": 0.4014285714285714, "grad_norm": 0.028753571212291718, "learning_rate": 0.024000000208616257, "loss": 2.4119062423706055, "step": 8430 }, { "epoch": 0.4015238095238095, "grad_norm": 0.028460649773478508, "learning_rate": 0.024000000208616257, "loss": 2.4330291748046875, "step": 8432 }, { "epoch": 0.4016190476190476, "grad_norm": 0.028921417891979218, "learning_rate": 0.024000000208616257, "loss": 2.409811496734619, "step": 8434 }, { "epoch": 0.4017142857142857, "grad_norm": 0.029603848233819008, "learning_rate": 0.024000000208616257, "loss": 2.413332462310791, "step": 8436 }, { "epoch": 0.4018095238095238, "grad_norm": 0.028524653986096382, "learning_rate": 0.024000000208616257, "loss": 2.3986940383911133, "step": 8438 }, { "epoch": 0.40190476190476193, "grad_norm": 0.028132494539022446, "learning_rate": 0.024000000208616257, "loss": 2.423454523086548, "step": 8440 }, { "epoch": 0.402, "grad_norm": 0.02978750318288803, "learning_rate": 0.024000000208616257, "loss": 2.3883328437805176, "step": 8442 }, { "epoch": 0.4020952380952381, "grad_norm": 0.029420049861073494, "learning_rate": 0.024000000208616257, "loss": 2.425114154815674, "step": 8444 }, { "epoch": 0.4021904761904762, "grad_norm": 0.031046396121382713, "learning_rate": 0.024000000208616257, "loss": 2.4198732376098633, "step": 8446 }, { "epoch": 0.4022857142857143, "grad_norm": 0.028428737074136734, "learning_rate": 0.024000000208616257, "loss": 2.4240546226501465, "step": 8448 }, { "epoch": 0.4023809523809524, "grad_norm": 0.029311995953321457, "learning_rate": 0.024000000208616257, "loss": 2.4208474159240723, "step": 8450 }, { "epoch": 0.4024761904761905, "grad_norm": 0.03175165131688118, "learning_rate": 0.024000000208616257, "loss": 2.4246749877929688, "step": 8452 }, { "epoch": 0.4025714285714286, "grad_norm": 0.032463107258081436, "learning_rate": 0.024000000208616257, "loss": 2.4115803241729736, "step": 8454 }, { "epoch": 0.4026666666666667, "grad_norm": 0.028611235320568085, "learning_rate": 0.024000000208616257, "loss": 2.377516508102417, "step": 8456 }, { "epoch": 0.40276190476190477, "grad_norm": 0.028260845690965652, "learning_rate": 0.024000000208616257, "loss": 2.4290077686309814, "step": 8458 }, { "epoch": 0.40285714285714286, "grad_norm": 0.02725987695157528, "learning_rate": 0.024000000208616257, "loss": 2.4099388122558594, "step": 8460 }, { "epoch": 0.40295238095238095, "grad_norm": 0.027549676597118378, "learning_rate": 0.024000000208616257, "loss": 2.4085099697113037, "step": 8462 }, { "epoch": 0.40304761904761904, "grad_norm": 0.02863912843167782, "learning_rate": 0.024000000208616257, "loss": 2.4016945362091064, "step": 8464 }, { "epoch": 0.40314285714285714, "grad_norm": 0.02963332273066044, "learning_rate": 0.024000000208616257, "loss": 2.4450783729553223, "step": 8466 }, { "epoch": 0.40323809523809523, "grad_norm": 0.03126293048262596, "learning_rate": 0.024000000208616257, "loss": 2.4557037353515625, "step": 8468 }, { "epoch": 0.4033333333333333, "grad_norm": 0.02896295115351677, "learning_rate": 0.024000000208616257, "loss": 2.433246612548828, "step": 8470 }, { "epoch": 0.4034285714285714, "grad_norm": 0.028939371928572655, "learning_rate": 0.024000000208616257, "loss": 2.4067702293395996, "step": 8472 }, { "epoch": 0.4035238095238095, "grad_norm": 0.027696840465068817, "learning_rate": 0.024000000208616257, "loss": 2.4423818588256836, "step": 8474 }, { "epoch": 0.4036190476190476, "grad_norm": 0.03046509064733982, "learning_rate": 0.024000000208616257, "loss": 2.413247585296631, "step": 8476 }, { "epoch": 0.4037142857142857, "grad_norm": 0.034054018557071686, "learning_rate": 0.024000000208616257, "loss": 2.4419126510620117, "step": 8478 }, { "epoch": 0.4038095238095238, "grad_norm": 0.030712060630321503, "learning_rate": 0.024000000208616257, "loss": 2.4280776977539062, "step": 8480 }, { "epoch": 0.4039047619047619, "grad_norm": 0.02851826697587967, "learning_rate": 0.024000000208616257, "loss": 2.411872148513794, "step": 8482 }, { "epoch": 0.404, "grad_norm": 0.029300732538104057, "learning_rate": 0.024000000208616257, "loss": 2.422642707824707, "step": 8484 }, { "epoch": 0.4040952380952381, "grad_norm": 0.02849431149661541, "learning_rate": 0.024000000208616257, "loss": 2.4047927856445312, "step": 8486 }, { "epoch": 0.4041904761904762, "grad_norm": 0.030919024720788002, "learning_rate": 0.024000000208616257, "loss": 2.391296863555908, "step": 8488 }, { "epoch": 0.4042857142857143, "grad_norm": 0.029280927032232285, "learning_rate": 0.024000000208616257, "loss": 2.427553653717041, "step": 8490 }, { "epoch": 0.4043809523809524, "grad_norm": 0.027651485055685043, "learning_rate": 0.024000000208616257, "loss": 2.4192428588867188, "step": 8492 }, { "epoch": 0.4044761904761905, "grad_norm": 0.027856430038809776, "learning_rate": 0.024000000208616257, "loss": 2.427760124206543, "step": 8494 }, { "epoch": 0.4045714285714286, "grad_norm": 0.028155352920293808, "learning_rate": 0.024000000208616257, "loss": 2.3973073959350586, "step": 8496 }, { "epoch": 0.4046666666666667, "grad_norm": 0.029455874115228653, "learning_rate": 0.024000000208616257, "loss": 2.37221622467041, "step": 8498 }, { "epoch": 0.40476190476190477, "grad_norm": 0.031499918550252914, "learning_rate": 0.024000000208616257, "loss": 2.417659282684326, "step": 8500 }, { "epoch": 0.40485714285714286, "grad_norm": 0.033624183386564255, "learning_rate": 0.024000000208616257, "loss": 2.4067299365997314, "step": 8502 }, { "epoch": 0.40495238095238095, "grad_norm": 0.03704431280493736, "learning_rate": 0.024000000208616257, "loss": 2.404458999633789, "step": 8504 }, { "epoch": 0.40504761904761905, "grad_norm": 0.03259526938199997, "learning_rate": 0.024000000208616257, "loss": 2.4104981422424316, "step": 8506 }, { "epoch": 0.40514285714285714, "grad_norm": 0.03221463784575462, "learning_rate": 0.024000000208616257, "loss": 2.426957607269287, "step": 8508 }, { "epoch": 0.40523809523809523, "grad_norm": 0.029582083225250244, "learning_rate": 0.024000000208616257, "loss": 2.4252851009368896, "step": 8510 }, { "epoch": 0.4053333333333333, "grad_norm": 0.028268737718462944, "learning_rate": 0.024000000208616257, "loss": 2.406226634979248, "step": 8512 }, { "epoch": 0.4054285714285714, "grad_norm": 0.03135263919830322, "learning_rate": 0.024000000208616257, "loss": 2.37675404548645, "step": 8514 }, { "epoch": 0.4055238095238095, "grad_norm": 0.03464667871594429, "learning_rate": 0.024000000208616257, "loss": 2.4106078147888184, "step": 8516 }, { "epoch": 0.4056190476190476, "grad_norm": 0.03309556469321251, "learning_rate": 0.024000000208616257, "loss": 2.395895481109619, "step": 8518 }, { "epoch": 0.4057142857142857, "grad_norm": 0.0331445038318634, "learning_rate": 0.024000000208616257, "loss": 2.3980445861816406, "step": 8520 }, { "epoch": 0.4058095238095238, "grad_norm": 0.03293796256184578, "learning_rate": 0.024000000208616257, "loss": 2.3930985927581787, "step": 8522 }, { "epoch": 0.4059047619047619, "grad_norm": 0.034089960157871246, "learning_rate": 0.024000000208616257, "loss": 2.442255973815918, "step": 8524 }, { "epoch": 0.406, "grad_norm": 0.02809484861791134, "learning_rate": 0.024000000208616257, "loss": 2.4179234504699707, "step": 8526 }, { "epoch": 0.4060952380952381, "grad_norm": 0.030256453901529312, "learning_rate": 0.024000000208616257, "loss": 2.4024062156677246, "step": 8528 }, { "epoch": 0.4061904761904762, "grad_norm": 0.028343437239527702, "learning_rate": 0.024000000208616257, "loss": 2.394216537475586, "step": 8530 }, { "epoch": 0.4062857142857143, "grad_norm": 0.02855972945690155, "learning_rate": 0.024000000208616257, "loss": 2.3841936588287354, "step": 8532 }, { "epoch": 0.4063809523809524, "grad_norm": 0.02769876830279827, "learning_rate": 0.024000000208616257, "loss": 2.408064842224121, "step": 8534 }, { "epoch": 0.4064761904761905, "grad_norm": 0.029525890946388245, "learning_rate": 0.024000000208616257, "loss": 2.3879451751708984, "step": 8536 }, { "epoch": 0.4065714285714286, "grad_norm": 0.028882281854748726, "learning_rate": 0.024000000208616257, "loss": 2.4096553325653076, "step": 8538 }, { "epoch": 0.4066666666666667, "grad_norm": 0.028937602415680885, "learning_rate": 0.024000000208616257, "loss": 2.3812437057495117, "step": 8540 }, { "epoch": 0.40676190476190477, "grad_norm": 0.029187051579356194, "learning_rate": 0.024000000208616257, "loss": 2.424837112426758, "step": 8542 }, { "epoch": 0.40685714285714286, "grad_norm": 0.029252469539642334, "learning_rate": 0.024000000208616257, "loss": 2.3651609420776367, "step": 8544 }, { "epoch": 0.40695238095238095, "grad_norm": 0.03024929203093052, "learning_rate": 0.024000000208616257, "loss": 2.3910269737243652, "step": 8546 }, { "epoch": 0.40704761904761905, "grad_norm": 0.03314036503434181, "learning_rate": 0.024000000208616257, "loss": 2.4082157611846924, "step": 8548 }, { "epoch": 0.40714285714285714, "grad_norm": 0.027716076001524925, "learning_rate": 0.024000000208616257, "loss": 2.368626117706299, "step": 8550 }, { "epoch": 0.40723809523809523, "grad_norm": 0.0323333702981472, "learning_rate": 0.024000000208616257, "loss": 2.3986659049987793, "step": 8552 }, { "epoch": 0.4073333333333333, "grad_norm": 0.03008875995874405, "learning_rate": 0.024000000208616257, "loss": 2.3918967247009277, "step": 8554 }, { "epoch": 0.4074285714285714, "grad_norm": 0.029051316902041435, "learning_rate": 0.024000000208616257, "loss": 2.427346706390381, "step": 8556 }, { "epoch": 0.4075238095238095, "grad_norm": 0.03350785747170448, "learning_rate": 0.024000000208616257, "loss": 2.4157657623291016, "step": 8558 }, { "epoch": 0.4076190476190476, "grad_norm": 0.028726939111948013, "learning_rate": 0.024000000208616257, "loss": 2.4000539779663086, "step": 8560 }, { "epoch": 0.4077142857142857, "grad_norm": 0.029321324080228806, "learning_rate": 0.024000000208616257, "loss": 2.3538923263549805, "step": 8562 }, { "epoch": 0.4078095238095238, "grad_norm": 0.0291151013225317, "learning_rate": 0.024000000208616257, "loss": 2.415964126586914, "step": 8564 }, { "epoch": 0.4079047619047619, "grad_norm": 0.029862845316529274, "learning_rate": 0.024000000208616257, "loss": 2.3915255069732666, "step": 8566 }, { "epoch": 0.408, "grad_norm": 0.029569001868367195, "learning_rate": 0.024000000208616257, "loss": 2.3917267322540283, "step": 8568 }, { "epoch": 0.4080952380952381, "grad_norm": 0.02835746854543686, "learning_rate": 0.024000000208616257, "loss": 2.40269136428833, "step": 8570 }, { "epoch": 0.4081904761904762, "grad_norm": 0.02766149304807186, "learning_rate": 0.024000000208616257, "loss": 2.385223388671875, "step": 8572 }, { "epoch": 0.4082857142857143, "grad_norm": 0.027308430522680283, "learning_rate": 0.024000000208616257, "loss": 2.3730080127716064, "step": 8574 }, { "epoch": 0.4083809523809524, "grad_norm": 0.0279783196747303, "learning_rate": 0.024000000208616257, "loss": 2.3820314407348633, "step": 8576 }, { "epoch": 0.4084761904761905, "grad_norm": 0.03151135891675949, "learning_rate": 0.024000000208616257, "loss": 2.376762628555298, "step": 8578 }, { "epoch": 0.4085714285714286, "grad_norm": 0.02796252630650997, "learning_rate": 0.024000000208616257, "loss": 2.3783860206604004, "step": 8580 }, { "epoch": 0.4086666666666667, "grad_norm": 0.027307024225592613, "learning_rate": 0.024000000208616257, "loss": 2.38754940032959, "step": 8582 }, { "epoch": 0.40876190476190477, "grad_norm": 0.028838537633419037, "learning_rate": 0.024000000208616257, "loss": 2.3762900829315186, "step": 8584 }, { "epoch": 0.40885714285714286, "grad_norm": 0.02917453646659851, "learning_rate": 0.024000000208616257, "loss": 2.3894200325012207, "step": 8586 }, { "epoch": 0.40895238095238096, "grad_norm": 0.0298289954662323, "learning_rate": 0.024000000208616257, "loss": 2.370894432067871, "step": 8588 }, { "epoch": 0.40904761904761905, "grad_norm": 0.02913781814277172, "learning_rate": 0.024000000208616257, "loss": 2.396544933319092, "step": 8590 }, { "epoch": 0.40914285714285714, "grad_norm": 0.02824784442782402, "learning_rate": 0.024000000208616257, "loss": 2.358999013900757, "step": 8592 }, { "epoch": 0.40923809523809523, "grad_norm": 0.028237739577889442, "learning_rate": 0.024000000208616257, "loss": 2.3561625480651855, "step": 8594 }, { "epoch": 0.4093333333333333, "grad_norm": 0.028952833265066147, "learning_rate": 0.024000000208616257, "loss": 2.3888940811157227, "step": 8596 }, { "epoch": 0.4094285714285714, "grad_norm": 0.028733909130096436, "learning_rate": 0.024000000208616257, "loss": 2.3867313861846924, "step": 8598 }, { "epoch": 0.4095238095238095, "grad_norm": 0.02910713665187359, "learning_rate": 0.024000000208616257, "loss": 2.361666679382324, "step": 8600 }, { "epoch": 0.4096190476190476, "grad_norm": 0.02834095060825348, "learning_rate": 0.024000000208616257, "loss": 2.395312786102295, "step": 8602 }, { "epoch": 0.4097142857142857, "grad_norm": 0.028147846460342407, "learning_rate": 0.024000000208616257, "loss": 2.4097023010253906, "step": 8604 }, { "epoch": 0.4098095238095238, "grad_norm": 0.027452656999230385, "learning_rate": 0.024000000208616257, "loss": 2.3922781944274902, "step": 8606 }, { "epoch": 0.4099047619047619, "grad_norm": 0.030189277604222298, "learning_rate": 0.024000000208616257, "loss": 2.3967628479003906, "step": 8608 }, { "epoch": 0.41, "grad_norm": 0.02851281128823757, "learning_rate": 0.024000000208616257, "loss": 2.3694095611572266, "step": 8610 }, { "epoch": 0.41009523809523807, "grad_norm": 0.027907071635127068, "learning_rate": 0.024000000208616257, "loss": 2.3885655403137207, "step": 8612 }, { "epoch": 0.4101904761904762, "grad_norm": 0.029052453115582466, "learning_rate": 0.024000000208616257, "loss": 2.383143663406372, "step": 8614 }, { "epoch": 0.4102857142857143, "grad_norm": 0.029071267694234848, "learning_rate": 0.024000000208616257, "loss": 2.369743824005127, "step": 8616 }, { "epoch": 0.4103809523809524, "grad_norm": 0.03196486830711365, "learning_rate": 0.024000000208616257, "loss": 2.3820531368255615, "step": 8618 }, { "epoch": 0.4104761904761905, "grad_norm": 0.03251475840806961, "learning_rate": 0.024000000208616257, "loss": 2.382456064224243, "step": 8620 }, { "epoch": 0.4105714285714286, "grad_norm": 0.02794325165450573, "learning_rate": 0.024000000208616257, "loss": 2.366370677947998, "step": 8622 }, { "epoch": 0.4106666666666667, "grad_norm": 0.027666492387652397, "learning_rate": 0.024000000208616257, "loss": 2.3603758811950684, "step": 8624 }, { "epoch": 0.4107619047619048, "grad_norm": 0.02891085110604763, "learning_rate": 0.024000000208616257, "loss": 2.368713140487671, "step": 8626 }, { "epoch": 0.41085714285714287, "grad_norm": 0.02850506268441677, "learning_rate": 0.024000000208616257, "loss": 2.4133529663085938, "step": 8628 }, { "epoch": 0.41095238095238096, "grad_norm": 0.028077976778149605, "learning_rate": 0.024000000208616257, "loss": 2.4039368629455566, "step": 8630 }, { "epoch": 0.41104761904761905, "grad_norm": 0.027607256546616554, "learning_rate": 0.024000000208616257, "loss": 2.386765718460083, "step": 8632 }, { "epoch": 0.41114285714285714, "grad_norm": 0.02872728556394577, "learning_rate": 0.024000000208616257, "loss": 2.409757614135742, "step": 8634 }, { "epoch": 0.41123809523809524, "grad_norm": 0.02785702794790268, "learning_rate": 0.024000000208616257, "loss": 2.373567581176758, "step": 8636 }, { "epoch": 0.41133333333333333, "grad_norm": 0.02784176729619503, "learning_rate": 0.024000000208616257, "loss": 2.3707168102264404, "step": 8638 }, { "epoch": 0.4114285714285714, "grad_norm": 0.029232988134026527, "learning_rate": 0.024000000208616257, "loss": 2.4145069122314453, "step": 8640 }, { "epoch": 0.4115238095238095, "grad_norm": 0.03075806237757206, "learning_rate": 0.024000000208616257, "loss": 2.372728109359741, "step": 8642 }, { "epoch": 0.4116190476190476, "grad_norm": 0.02867792919278145, "learning_rate": 0.024000000208616257, "loss": 2.3946642875671387, "step": 8644 }, { "epoch": 0.4117142857142857, "grad_norm": 0.028068047016859055, "learning_rate": 0.024000000208616257, "loss": 2.3682327270507812, "step": 8646 }, { "epoch": 0.4118095238095238, "grad_norm": 0.029961643740534782, "learning_rate": 0.024000000208616257, "loss": 2.370809555053711, "step": 8648 }, { "epoch": 0.4119047619047619, "grad_norm": 0.03122568130493164, "learning_rate": 0.024000000208616257, "loss": 2.3654398918151855, "step": 8650 }, { "epoch": 0.412, "grad_norm": 0.028222404420375824, "learning_rate": 0.024000000208616257, "loss": 2.4157161712646484, "step": 8652 }, { "epoch": 0.41209523809523807, "grad_norm": 0.027757318690419197, "learning_rate": 0.024000000208616257, "loss": 2.3932766914367676, "step": 8654 }, { "epoch": 0.4121904761904762, "grad_norm": 0.03595483675599098, "learning_rate": 0.024000000208616257, "loss": 2.381175994873047, "step": 8656 }, { "epoch": 0.4122857142857143, "grad_norm": 0.028240887448191643, "learning_rate": 0.024000000208616257, "loss": 2.382108688354492, "step": 8658 }, { "epoch": 0.4123809523809524, "grad_norm": 0.029369203373789787, "learning_rate": 0.024000000208616257, "loss": 2.390958547592163, "step": 8660 }, { "epoch": 0.4124761904761905, "grad_norm": 0.031000453978776932, "learning_rate": 0.024000000208616257, "loss": 2.4081215858459473, "step": 8662 }, { "epoch": 0.4125714285714286, "grad_norm": 0.02909238077700138, "learning_rate": 0.024000000208616257, "loss": 2.384124279022217, "step": 8664 }, { "epoch": 0.4126666666666667, "grad_norm": 0.028635093942284584, "learning_rate": 0.024000000208616257, "loss": 2.3820154666900635, "step": 8666 }, { "epoch": 0.4127619047619048, "grad_norm": 0.028215985745191574, "learning_rate": 0.024000000208616257, "loss": 2.411125421524048, "step": 8668 }, { "epoch": 0.41285714285714287, "grad_norm": 0.027840478345751762, "learning_rate": 0.024000000208616257, "loss": 2.4025189876556396, "step": 8670 }, { "epoch": 0.41295238095238096, "grad_norm": 0.027813784778118134, "learning_rate": 0.024000000208616257, "loss": 2.386345863342285, "step": 8672 }, { "epoch": 0.41304761904761905, "grad_norm": 0.028114331886172295, "learning_rate": 0.024000000208616257, "loss": 2.374229669570923, "step": 8674 }, { "epoch": 0.41314285714285715, "grad_norm": 0.02865610085427761, "learning_rate": 0.024000000208616257, "loss": 2.4020609855651855, "step": 8676 }, { "epoch": 0.41323809523809524, "grad_norm": 0.033085115253925323, "learning_rate": 0.024000000208616257, "loss": 2.358088970184326, "step": 8678 }, { "epoch": 0.41333333333333333, "grad_norm": 0.030835825949907303, "learning_rate": 0.024000000208616257, "loss": 2.369656562805176, "step": 8680 }, { "epoch": 0.4134285714285714, "grad_norm": 0.029383324086666107, "learning_rate": 0.024000000208616257, "loss": 2.428968906402588, "step": 8682 }, { "epoch": 0.4135238095238095, "grad_norm": 0.028283216059207916, "learning_rate": 0.024000000208616257, "loss": 2.392409324645996, "step": 8684 }, { "epoch": 0.4136190476190476, "grad_norm": 0.027817580848932266, "learning_rate": 0.024000000208616257, "loss": 2.399590253829956, "step": 8686 }, { "epoch": 0.4137142857142857, "grad_norm": 0.029930664226412773, "learning_rate": 0.024000000208616257, "loss": 2.405524969100952, "step": 8688 }, { "epoch": 0.4138095238095238, "grad_norm": 0.028788728639483452, "learning_rate": 0.024000000208616257, "loss": 2.3226780891418457, "step": 8690 }, { "epoch": 0.4139047619047619, "grad_norm": 0.028576482087373734, "learning_rate": 0.024000000208616257, "loss": 2.397592067718506, "step": 8692 }, { "epoch": 0.414, "grad_norm": 0.028158554807305336, "learning_rate": 0.024000000208616257, "loss": 2.355776071548462, "step": 8694 }, { "epoch": 0.41409523809523807, "grad_norm": 0.03083634376525879, "learning_rate": 0.024000000208616257, "loss": 2.372908592224121, "step": 8696 }, { "epoch": 0.41419047619047616, "grad_norm": 0.03057744726538658, "learning_rate": 0.024000000208616257, "loss": 2.359283447265625, "step": 8698 }, { "epoch": 0.4142857142857143, "grad_norm": 0.02869408018887043, "learning_rate": 0.024000000208616257, "loss": 2.38350248336792, "step": 8700 }, { "epoch": 0.4143809523809524, "grad_norm": 0.029824640601873398, "learning_rate": 0.024000000208616257, "loss": 2.386735439300537, "step": 8702 }, { "epoch": 0.4144761904761905, "grad_norm": 0.028572168201208115, "learning_rate": 0.024000000208616257, "loss": 2.4037718772888184, "step": 8704 }, { "epoch": 0.4145714285714286, "grad_norm": 0.03251141309738159, "learning_rate": 0.024000000208616257, "loss": 2.42539644241333, "step": 8706 }, { "epoch": 0.4146666666666667, "grad_norm": 0.030351558700203896, "learning_rate": 0.024000000208616257, "loss": 2.389285087585449, "step": 8708 }, { "epoch": 0.4147619047619048, "grad_norm": 0.030525213107466698, "learning_rate": 0.024000000208616257, "loss": 2.3621091842651367, "step": 8710 }, { "epoch": 0.41485714285714287, "grad_norm": 0.03339897096157074, "learning_rate": 0.024000000208616257, "loss": 2.380493640899658, "step": 8712 }, { "epoch": 0.41495238095238096, "grad_norm": 0.02965432032942772, "learning_rate": 0.024000000208616257, "loss": 2.378559112548828, "step": 8714 }, { "epoch": 0.41504761904761905, "grad_norm": 0.029434259980916977, "learning_rate": 0.024000000208616257, "loss": 2.4004878997802734, "step": 8716 }, { "epoch": 0.41514285714285715, "grad_norm": 0.030041789636015892, "learning_rate": 0.024000000208616257, "loss": 2.3750994205474854, "step": 8718 }, { "epoch": 0.41523809523809524, "grad_norm": 0.02846921794116497, "learning_rate": 0.024000000208616257, "loss": 2.3939504623413086, "step": 8720 }, { "epoch": 0.41533333333333333, "grad_norm": 0.028809739276766777, "learning_rate": 0.024000000208616257, "loss": 2.3708648681640625, "step": 8722 }, { "epoch": 0.4154285714285714, "grad_norm": 0.030722646042704582, "learning_rate": 0.024000000208616257, "loss": 2.3695244789123535, "step": 8724 }, { "epoch": 0.4155238095238095, "grad_norm": 0.0291142500936985, "learning_rate": 0.024000000208616257, "loss": 2.3368406295776367, "step": 8726 }, { "epoch": 0.4156190476190476, "grad_norm": 0.030282434076070786, "learning_rate": 0.024000000208616257, "loss": 2.4001379013061523, "step": 8728 }, { "epoch": 0.4157142857142857, "grad_norm": 0.028060955926775932, "learning_rate": 0.024000000208616257, "loss": 2.3611807823181152, "step": 8730 }, { "epoch": 0.4158095238095238, "grad_norm": 0.027249889448285103, "learning_rate": 0.024000000208616257, "loss": 2.3634748458862305, "step": 8732 }, { "epoch": 0.4159047619047619, "grad_norm": 0.028116682544350624, "learning_rate": 0.024000000208616257, "loss": 2.384803533554077, "step": 8734 }, { "epoch": 0.416, "grad_norm": 0.02895679511129856, "learning_rate": 0.024000000208616257, "loss": 2.3715391159057617, "step": 8736 }, { "epoch": 0.4160952380952381, "grad_norm": 0.027556313201785088, "learning_rate": 0.024000000208616257, "loss": 2.357240915298462, "step": 8738 }, { "epoch": 0.41619047619047617, "grad_norm": 0.03009495511651039, "learning_rate": 0.024000000208616257, "loss": 2.358743667602539, "step": 8740 }, { "epoch": 0.41628571428571426, "grad_norm": 0.028083328157663345, "learning_rate": 0.024000000208616257, "loss": 2.370042085647583, "step": 8742 }, { "epoch": 0.4163809523809524, "grad_norm": 0.02936234138906002, "learning_rate": 0.024000000208616257, "loss": 2.400932788848877, "step": 8744 }, { "epoch": 0.4164761904761905, "grad_norm": 0.028744617477059364, "learning_rate": 0.024000000208616257, "loss": 2.361110210418701, "step": 8746 }, { "epoch": 0.4165714285714286, "grad_norm": 0.027416599914431572, "learning_rate": 0.024000000208616257, "loss": 2.3739113807678223, "step": 8748 }, { "epoch": 0.4166666666666667, "grad_norm": 0.028701074421405792, "learning_rate": 0.024000000208616257, "loss": 2.392134666442871, "step": 8750 }, { "epoch": 0.4167619047619048, "grad_norm": 0.02878420427441597, "learning_rate": 0.024000000208616257, "loss": 2.395235538482666, "step": 8752 }, { "epoch": 0.41685714285714287, "grad_norm": 0.028212711215019226, "learning_rate": 0.024000000208616257, "loss": 2.3982765674591064, "step": 8754 }, { "epoch": 0.41695238095238096, "grad_norm": 0.02754022926092148, "learning_rate": 0.024000000208616257, "loss": 2.3637895584106445, "step": 8756 }, { "epoch": 0.41704761904761906, "grad_norm": 0.029884127900004387, "learning_rate": 0.024000000208616257, "loss": 2.356395721435547, "step": 8758 }, { "epoch": 0.41714285714285715, "grad_norm": 0.03174874186515808, "learning_rate": 0.024000000208616257, "loss": 2.353262424468994, "step": 8760 }, { "epoch": 0.41723809523809524, "grad_norm": 0.029762398451566696, "learning_rate": 0.024000000208616257, "loss": 2.358705520629883, "step": 8762 }, { "epoch": 0.41733333333333333, "grad_norm": 0.032076217234134674, "learning_rate": 0.024000000208616257, "loss": 2.3729472160339355, "step": 8764 }, { "epoch": 0.4174285714285714, "grad_norm": 0.03749838471412659, "learning_rate": 0.024000000208616257, "loss": 2.3866167068481445, "step": 8766 }, { "epoch": 0.4175238095238095, "grad_norm": 0.034424398094415665, "learning_rate": 0.024000000208616257, "loss": 2.381244421005249, "step": 8768 }, { "epoch": 0.4176190476190476, "grad_norm": 0.030016016215085983, "learning_rate": 0.024000000208616257, "loss": 2.3936445713043213, "step": 8770 }, { "epoch": 0.4177142857142857, "grad_norm": 0.027921197935938835, "learning_rate": 0.024000000208616257, "loss": 2.367839813232422, "step": 8772 }, { "epoch": 0.4178095238095238, "grad_norm": 0.027481386438012123, "learning_rate": 0.024000000208616257, "loss": 2.343400001525879, "step": 8774 }, { "epoch": 0.4179047619047619, "grad_norm": 0.027588602155447006, "learning_rate": 0.024000000208616257, "loss": 2.3879871368408203, "step": 8776 }, { "epoch": 0.418, "grad_norm": 0.029246976599097252, "learning_rate": 0.024000000208616257, "loss": 2.345069408416748, "step": 8778 }, { "epoch": 0.4180952380952381, "grad_norm": 0.028825901448726654, "learning_rate": 0.024000000208616257, "loss": 2.377622127532959, "step": 8780 }, { "epoch": 0.41819047619047617, "grad_norm": 0.028490792959928513, "learning_rate": 0.024000000208616257, "loss": 2.3594582080841064, "step": 8782 }, { "epoch": 0.41828571428571426, "grad_norm": 0.028601666912436485, "learning_rate": 0.024000000208616257, "loss": 2.412590980529785, "step": 8784 }, { "epoch": 0.41838095238095235, "grad_norm": 0.027477338910102844, "learning_rate": 0.024000000208616257, "loss": 2.385411262512207, "step": 8786 }, { "epoch": 0.4184761904761905, "grad_norm": 0.027431245893239975, "learning_rate": 0.024000000208616257, "loss": 2.36716365814209, "step": 8788 }, { "epoch": 0.4185714285714286, "grad_norm": 0.028307203203439713, "learning_rate": 0.024000000208616257, "loss": 2.3563172817230225, "step": 8790 }, { "epoch": 0.4186666666666667, "grad_norm": 0.027588266879320145, "learning_rate": 0.024000000208616257, "loss": 2.3540444374084473, "step": 8792 }, { "epoch": 0.4187619047619048, "grad_norm": 0.02731459029018879, "learning_rate": 0.024000000208616257, "loss": 2.383279800415039, "step": 8794 }, { "epoch": 0.4188571428571429, "grad_norm": 0.03151696175336838, "learning_rate": 0.024000000208616257, "loss": 2.4120535850524902, "step": 8796 }, { "epoch": 0.41895238095238096, "grad_norm": 0.029519764706492424, "learning_rate": 0.024000000208616257, "loss": 2.404691219329834, "step": 8798 }, { "epoch": 0.41904761904761906, "grad_norm": 0.027979860082268715, "learning_rate": 0.024000000208616257, "loss": 2.4027507305145264, "step": 8800 }, { "epoch": 0.41914285714285715, "grad_norm": 0.029552049934864044, "learning_rate": 0.024000000208616257, "loss": 2.3583920001983643, "step": 8802 }, { "epoch": 0.41923809523809524, "grad_norm": 0.028702976182103157, "learning_rate": 0.024000000208616257, "loss": 2.3957467079162598, "step": 8804 }, { "epoch": 0.41933333333333334, "grad_norm": 0.028970817103981972, "learning_rate": 0.024000000208616257, "loss": 2.3716554641723633, "step": 8806 }, { "epoch": 0.41942857142857143, "grad_norm": 0.028386857360601425, "learning_rate": 0.024000000208616257, "loss": 2.3682212829589844, "step": 8808 }, { "epoch": 0.4195238095238095, "grad_norm": 0.0294032022356987, "learning_rate": 0.024000000208616257, "loss": 2.348231315612793, "step": 8810 }, { "epoch": 0.4196190476190476, "grad_norm": 0.029103854671120644, "learning_rate": 0.024000000208616257, "loss": 2.385281562805176, "step": 8812 }, { "epoch": 0.4197142857142857, "grad_norm": 0.029604949057102203, "learning_rate": 0.024000000208616257, "loss": 2.405831813812256, "step": 8814 }, { "epoch": 0.4198095238095238, "grad_norm": 0.027694756165146828, "learning_rate": 0.024000000208616257, "loss": 2.3791842460632324, "step": 8816 }, { "epoch": 0.4199047619047619, "grad_norm": 0.03466641157865524, "learning_rate": 0.024000000208616257, "loss": 2.3672256469726562, "step": 8818 }, { "epoch": 0.42, "grad_norm": 0.03190147131681442, "learning_rate": 0.024000000208616257, "loss": 2.3572263717651367, "step": 8820 }, { "epoch": 0.4200952380952381, "grad_norm": 0.030305637046694756, "learning_rate": 0.024000000208616257, "loss": 2.410675525665283, "step": 8822 }, { "epoch": 0.42019047619047617, "grad_norm": 0.029811952263116837, "learning_rate": 0.024000000208616257, "loss": 2.3767194747924805, "step": 8824 }, { "epoch": 0.42028571428571426, "grad_norm": 0.02962806262075901, "learning_rate": 0.024000000208616257, "loss": 2.410407543182373, "step": 8826 }, { "epoch": 0.42038095238095236, "grad_norm": 0.028622925281524658, "learning_rate": 0.024000000208616257, "loss": 2.405086040496826, "step": 8828 }, { "epoch": 0.4204761904761905, "grad_norm": 0.0289701409637928, "learning_rate": 0.024000000208616257, "loss": 2.407320022583008, "step": 8830 }, { "epoch": 0.4205714285714286, "grad_norm": 0.028698498383164406, "learning_rate": 0.024000000208616257, "loss": 2.3762834072113037, "step": 8832 }, { "epoch": 0.4206666666666667, "grad_norm": 0.035566240549087524, "learning_rate": 0.024000000208616257, "loss": 2.3984375, "step": 8834 }, { "epoch": 0.4207619047619048, "grad_norm": 0.03604840859770775, "learning_rate": 0.024000000208616257, "loss": 2.374535083770752, "step": 8836 }, { "epoch": 0.4208571428571429, "grad_norm": 0.03476789966225624, "learning_rate": 0.024000000208616257, "loss": 2.3782010078430176, "step": 8838 }, { "epoch": 0.42095238095238097, "grad_norm": 0.03898259252309799, "learning_rate": 0.024000000208616257, "loss": 2.374406337738037, "step": 8840 }, { "epoch": 0.42104761904761906, "grad_norm": 0.02927827648818493, "learning_rate": 0.024000000208616257, "loss": 2.355314016342163, "step": 8842 }, { "epoch": 0.42114285714285715, "grad_norm": 0.027636639773845673, "learning_rate": 0.024000000208616257, "loss": 2.3757996559143066, "step": 8844 }, { "epoch": 0.42123809523809524, "grad_norm": 0.03142423927783966, "learning_rate": 0.024000000208616257, "loss": 2.3432796001434326, "step": 8846 }, { "epoch": 0.42133333333333334, "grad_norm": 0.028128135949373245, "learning_rate": 0.024000000208616257, "loss": 2.4081358909606934, "step": 8848 }, { "epoch": 0.42142857142857143, "grad_norm": 0.028597604483366013, "learning_rate": 0.024000000208616257, "loss": 2.389889717102051, "step": 8850 }, { "epoch": 0.4215238095238095, "grad_norm": 0.029007166624069214, "learning_rate": 0.024000000208616257, "loss": 2.3809022903442383, "step": 8852 }, { "epoch": 0.4216190476190476, "grad_norm": 0.028168171644210815, "learning_rate": 0.024000000208616257, "loss": 2.377997398376465, "step": 8854 }, { "epoch": 0.4217142857142857, "grad_norm": 0.028559161350131035, "learning_rate": 0.024000000208616257, "loss": 2.3708102703094482, "step": 8856 }, { "epoch": 0.4218095238095238, "grad_norm": 0.02928326651453972, "learning_rate": 0.024000000208616257, "loss": 2.383659839630127, "step": 8858 }, { "epoch": 0.4219047619047619, "grad_norm": 0.02823219634592533, "learning_rate": 0.024000000208616257, "loss": 2.3759264945983887, "step": 8860 }, { "epoch": 0.422, "grad_norm": 0.029119038954377174, "learning_rate": 0.024000000208616257, "loss": 2.3723344802856445, "step": 8862 }, { "epoch": 0.4220952380952381, "grad_norm": 0.030809829011559486, "learning_rate": 0.024000000208616257, "loss": 2.3855221271514893, "step": 8864 }, { "epoch": 0.42219047619047617, "grad_norm": 0.03005507029592991, "learning_rate": 0.024000000208616257, "loss": 2.371222972869873, "step": 8866 }, { "epoch": 0.42228571428571426, "grad_norm": 0.027903946116566658, "learning_rate": 0.024000000208616257, "loss": 2.396554946899414, "step": 8868 }, { "epoch": 0.42238095238095236, "grad_norm": 0.027913734316825867, "learning_rate": 0.024000000208616257, "loss": 2.3996644020080566, "step": 8870 }, { "epoch": 0.42247619047619045, "grad_norm": 0.028608746826648712, "learning_rate": 0.024000000208616257, "loss": 2.3832874298095703, "step": 8872 }, { "epoch": 0.4225714285714286, "grad_norm": 0.028215594589710236, "learning_rate": 0.024000000208616257, "loss": 2.417222261428833, "step": 8874 }, { "epoch": 0.4226666666666667, "grad_norm": 0.027790335938334465, "learning_rate": 0.024000000208616257, "loss": 2.3648343086242676, "step": 8876 }, { "epoch": 0.4227619047619048, "grad_norm": 0.03357674553990364, "learning_rate": 0.024000000208616257, "loss": 2.394716262817383, "step": 8878 }, { "epoch": 0.4228571428571429, "grad_norm": 0.028430793434381485, "learning_rate": 0.024000000208616257, "loss": 2.4082422256469727, "step": 8880 }, { "epoch": 0.42295238095238097, "grad_norm": 0.027991903945803642, "learning_rate": 0.024000000208616257, "loss": 2.3973593711853027, "step": 8882 }, { "epoch": 0.42304761904761906, "grad_norm": 0.02954568713903427, "learning_rate": 0.024000000208616257, "loss": 2.401669979095459, "step": 8884 }, { "epoch": 0.42314285714285715, "grad_norm": 0.030164401978254318, "learning_rate": 0.024000000208616257, "loss": 2.398904800415039, "step": 8886 }, { "epoch": 0.42323809523809525, "grad_norm": 0.030544307082891464, "learning_rate": 0.024000000208616257, "loss": 2.3976638317108154, "step": 8888 }, { "epoch": 0.42333333333333334, "grad_norm": 0.028294509276747704, "learning_rate": 0.024000000208616257, "loss": 2.406590700149536, "step": 8890 }, { "epoch": 0.42342857142857143, "grad_norm": 0.028184019029140472, "learning_rate": 0.024000000208616257, "loss": 2.4162750244140625, "step": 8892 }, { "epoch": 0.4235238095238095, "grad_norm": 0.028247615322470665, "learning_rate": 0.024000000208616257, "loss": 2.40553879737854, "step": 8894 }, { "epoch": 0.4236190476190476, "grad_norm": 0.028638694435358047, "learning_rate": 0.024000000208616257, "loss": 2.391359329223633, "step": 8896 }, { "epoch": 0.4237142857142857, "grad_norm": 0.029370035976171494, "learning_rate": 0.024000000208616257, "loss": 2.3908352851867676, "step": 8898 }, { "epoch": 0.4238095238095238, "grad_norm": 0.02767726220190525, "learning_rate": 0.024000000208616257, "loss": 2.3958001136779785, "step": 8900 }, { "epoch": 0.4239047619047619, "grad_norm": 0.02793535217642784, "learning_rate": 0.024000000208616257, "loss": 2.394709348678589, "step": 8902 }, { "epoch": 0.424, "grad_norm": 0.028737856075167656, "learning_rate": 0.024000000208616257, "loss": 2.392455577850342, "step": 8904 }, { "epoch": 0.4240952380952381, "grad_norm": 0.028089400380849838, "learning_rate": 0.024000000208616257, "loss": 2.389030933380127, "step": 8906 }, { "epoch": 0.4241904761904762, "grad_norm": 0.02927340567111969, "learning_rate": 0.024000000208616257, "loss": 2.3838601112365723, "step": 8908 }, { "epoch": 0.42428571428571427, "grad_norm": 0.02983511984348297, "learning_rate": 0.024000000208616257, "loss": 2.4132885932922363, "step": 8910 }, { "epoch": 0.42438095238095236, "grad_norm": 0.027599100023508072, "learning_rate": 0.024000000208616257, "loss": 2.398996353149414, "step": 8912 }, { "epoch": 0.42447619047619045, "grad_norm": 0.028182635083794594, "learning_rate": 0.024000000208616257, "loss": 2.3458621501922607, "step": 8914 }, { "epoch": 0.42457142857142854, "grad_norm": 0.028079507872462273, "learning_rate": 0.024000000208616257, "loss": 2.394920825958252, "step": 8916 }, { "epoch": 0.4246666666666667, "grad_norm": 0.028593968600034714, "learning_rate": 0.024000000208616257, "loss": 2.4129323959350586, "step": 8918 }, { "epoch": 0.4247619047619048, "grad_norm": 0.02770584262907505, "learning_rate": 0.024000000208616257, "loss": 2.419157028198242, "step": 8920 }, { "epoch": 0.4248571428571429, "grad_norm": 0.029557600617408752, "learning_rate": 0.024000000208616257, "loss": 2.3848280906677246, "step": 8922 }, { "epoch": 0.42495238095238097, "grad_norm": 0.02827785536646843, "learning_rate": 0.024000000208616257, "loss": 2.3857474327087402, "step": 8924 }, { "epoch": 0.42504761904761906, "grad_norm": 0.030707335099577904, "learning_rate": 0.024000000208616257, "loss": 2.425172805786133, "step": 8926 }, { "epoch": 0.42514285714285716, "grad_norm": 0.029108062386512756, "learning_rate": 0.024000000208616257, "loss": 2.4167542457580566, "step": 8928 }, { "epoch": 0.42523809523809525, "grad_norm": 0.028227131813764572, "learning_rate": 0.024000000208616257, "loss": 2.400527000427246, "step": 8930 }, { "epoch": 0.42533333333333334, "grad_norm": 0.029098976403474808, "learning_rate": 0.024000000208616257, "loss": 2.380767345428467, "step": 8932 }, { "epoch": 0.42542857142857143, "grad_norm": 0.028575850650668144, "learning_rate": 0.024000000208616257, "loss": 2.4226958751678467, "step": 8934 }, { "epoch": 0.4255238095238095, "grad_norm": 0.027916917577385902, "learning_rate": 0.024000000208616257, "loss": 2.3965258598327637, "step": 8936 }, { "epoch": 0.4256190476190476, "grad_norm": 0.027749748900532722, "learning_rate": 0.024000000208616257, "loss": 2.390777111053467, "step": 8938 }, { "epoch": 0.4257142857142857, "grad_norm": 0.02717713452875614, "learning_rate": 0.024000000208616257, "loss": 2.3472843170166016, "step": 8940 }, { "epoch": 0.4258095238095238, "grad_norm": 0.02825913205742836, "learning_rate": 0.024000000208616257, "loss": 2.420790195465088, "step": 8942 }, { "epoch": 0.4259047619047619, "grad_norm": 0.028180385008454323, "learning_rate": 0.024000000208616257, "loss": 2.384399890899658, "step": 8944 }, { "epoch": 0.426, "grad_norm": 0.027623988687992096, "learning_rate": 0.024000000208616257, "loss": 2.39589262008667, "step": 8946 }, { "epoch": 0.4260952380952381, "grad_norm": 0.029128944501280785, "learning_rate": 0.024000000208616257, "loss": 2.4092087745666504, "step": 8948 }, { "epoch": 0.4261904761904762, "grad_norm": 0.02833976037800312, "learning_rate": 0.024000000208616257, "loss": 2.4063515663146973, "step": 8950 }, { "epoch": 0.42628571428571427, "grad_norm": 0.028124205768108368, "learning_rate": 0.024000000208616257, "loss": 2.3614089488983154, "step": 8952 }, { "epoch": 0.42638095238095236, "grad_norm": 0.029180757701396942, "learning_rate": 0.024000000208616257, "loss": 2.378551959991455, "step": 8954 }, { "epoch": 0.42647619047619045, "grad_norm": 0.029025059193372726, "learning_rate": 0.024000000208616257, "loss": 2.3874049186706543, "step": 8956 }, { "epoch": 0.42657142857142855, "grad_norm": 0.02911739982664585, "learning_rate": 0.024000000208616257, "loss": 2.3998255729675293, "step": 8958 }, { "epoch": 0.4266666666666667, "grad_norm": 0.028309162706136703, "learning_rate": 0.024000000208616257, "loss": 2.379746913909912, "step": 8960 }, { "epoch": 0.4267619047619048, "grad_norm": 0.027975736185908318, "learning_rate": 0.024000000208616257, "loss": 2.3815877437591553, "step": 8962 }, { "epoch": 0.4268571428571429, "grad_norm": 0.029874030500650406, "learning_rate": 0.024000000208616257, "loss": 2.419144630432129, "step": 8964 }, { "epoch": 0.42695238095238097, "grad_norm": 0.03617100417613983, "learning_rate": 0.024000000208616257, "loss": 2.3784449100494385, "step": 8966 }, { "epoch": 0.42704761904761906, "grad_norm": 0.036203205585479736, "learning_rate": 0.024000000208616257, "loss": 2.4012818336486816, "step": 8968 }, { "epoch": 0.42714285714285716, "grad_norm": 0.031293537467718124, "learning_rate": 0.024000000208616257, "loss": 2.4211175441741943, "step": 8970 }, { "epoch": 0.42723809523809525, "grad_norm": 0.02988698147237301, "learning_rate": 0.024000000208616257, "loss": 2.3958005905151367, "step": 8972 }, { "epoch": 0.42733333333333334, "grad_norm": 0.02878720872104168, "learning_rate": 0.024000000208616257, "loss": 2.363845109939575, "step": 8974 }, { "epoch": 0.42742857142857144, "grad_norm": 0.029942963272333145, "learning_rate": 0.024000000208616257, "loss": 2.380354404449463, "step": 8976 }, { "epoch": 0.42752380952380953, "grad_norm": 0.030672509223222733, "learning_rate": 0.024000000208616257, "loss": 2.385962724685669, "step": 8978 }, { "epoch": 0.4276190476190476, "grad_norm": 0.028806721791625023, "learning_rate": 0.024000000208616257, "loss": 2.3956751823425293, "step": 8980 }, { "epoch": 0.4277142857142857, "grad_norm": 0.028077060356736183, "learning_rate": 0.024000000208616257, "loss": 2.3872146606445312, "step": 8982 }, { "epoch": 0.4278095238095238, "grad_norm": 0.03069433383643627, "learning_rate": 0.024000000208616257, "loss": 2.3864569664001465, "step": 8984 }, { "epoch": 0.4279047619047619, "grad_norm": 0.02952544391155243, "learning_rate": 0.024000000208616257, "loss": 2.391249656677246, "step": 8986 }, { "epoch": 0.428, "grad_norm": 0.028817277401685715, "learning_rate": 0.024000000208616257, "loss": 2.4115214347839355, "step": 8988 }, { "epoch": 0.4280952380952381, "grad_norm": 0.02820689044892788, "learning_rate": 0.024000000208616257, "loss": 2.3746113777160645, "step": 8990 }, { "epoch": 0.4281904761904762, "grad_norm": 0.02865717187523842, "learning_rate": 0.024000000208616257, "loss": 2.380384922027588, "step": 8992 }, { "epoch": 0.42828571428571427, "grad_norm": 0.027404526248574257, "learning_rate": 0.024000000208616257, "loss": 2.3933982849121094, "step": 8994 }, { "epoch": 0.42838095238095236, "grad_norm": 0.02942366525530815, "learning_rate": 0.024000000208616257, "loss": 2.3903608322143555, "step": 8996 }, { "epoch": 0.42847619047619045, "grad_norm": 0.03117830492556095, "learning_rate": 0.024000000208616257, "loss": 2.373185157775879, "step": 8998 }, { "epoch": 0.42857142857142855, "grad_norm": 0.03523966670036316, "learning_rate": 0.024000000208616257, "loss": 2.4004719257354736, "step": 9000 }, { "epoch": 0.42866666666666664, "grad_norm": 0.03405916690826416, "learning_rate": 0.024000000208616257, "loss": 2.3559722900390625, "step": 9002 }, { "epoch": 0.4287619047619048, "grad_norm": 0.029005834832787514, "learning_rate": 0.024000000208616257, "loss": 2.4053149223327637, "step": 9004 }, { "epoch": 0.4288571428571429, "grad_norm": 0.030313163995742798, "learning_rate": 0.024000000208616257, "loss": 2.4025492668151855, "step": 9006 }, { "epoch": 0.428952380952381, "grad_norm": 0.02873353473842144, "learning_rate": 0.024000000208616257, "loss": 2.383552312850952, "step": 9008 }, { "epoch": 0.42904761904761907, "grad_norm": 0.030611436814069748, "learning_rate": 0.024000000208616257, "loss": 2.3798089027404785, "step": 9010 }, { "epoch": 0.42914285714285716, "grad_norm": 0.02905920520424843, "learning_rate": 0.024000000208616257, "loss": 2.4062371253967285, "step": 9012 }, { "epoch": 0.42923809523809525, "grad_norm": 0.028665609657764435, "learning_rate": 0.024000000208616257, "loss": 2.4192423820495605, "step": 9014 }, { "epoch": 0.42933333333333334, "grad_norm": 0.03634175285696983, "learning_rate": 0.024000000208616257, "loss": 2.413203239440918, "step": 9016 }, { "epoch": 0.42942857142857144, "grad_norm": 0.031697094440460205, "learning_rate": 0.024000000208616257, "loss": 2.390641689300537, "step": 9018 }, { "epoch": 0.42952380952380953, "grad_norm": 0.02975546196103096, "learning_rate": 0.024000000208616257, "loss": 2.3991880416870117, "step": 9020 }, { "epoch": 0.4296190476190476, "grad_norm": 0.029156647622585297, "learning_rate": 0.024000000208616257, "loss": 2.3745288848876953, "step": 9022 }, { "epoch": 0.4297142857142857, "grad_norm": 0.029985791072249413, "learning_rate": 0.024000000208616257, "loss": 2.378373146057129, "step": 9024 }, { "epoch": 0.4298095238095238, "grad_norm": 0.0279811043292284, "learning_rate": 0.024000000208616257, "loss": 2.3877735137939453, "step": 9026 }, { "epoch": 0.4299047619047619, "grad_norm": 0.028361229225993156, "learning_rate": 0.024000000208616257, "loss": 2.3858883380889893, "step": 9028 }, { "epoch": 0.43, "grad_norm": 0.028564590960741043, "learning_rate": 0.024000000208616257, "loss": 2.3517141342163086, "step": 9030 }, { "epoch": 0.4300952380952381, "grad_norm": 0.029876114800572395, "learning_rate": 0.024000000208616257, "loss": 2.3586623668670654, "step": 9032 }, { "epoch": 0.4301904761904762, "grad_norm": 0.02806258201599121, "learning_rate": 0.024000000208616257, "loss": 2.3926849365234375, "step": 9034 }, { "epoch": 0.43028571428571427, "grad_norm": 0.029256002977490425, "learning_rate": 0.024000000208616257, "loss": 2.3619863986968994, "step": 9036 }, { "epoch": 0.43038095238095236, "grad_norm": 0.03004753217101097, "learning_rate": 0.024000000208616257, "loss": 2.378493309020996, "step": 9038 }, { "epoch": 0.43047619047619046, "grad_norm": 0.028512585908174515, "learning_rate": 0.024000000208616257, "loss": 2.3447952270507812, "step": 9040 }, { "epoch": 0.43057142857142855, "grad_norm": 0.027756379917263985, "learning_rate": 0.024000000208616257, "loss": 2.3509650230407715, "step": 9042 }, { "epoch": 0.43066666666666664, "grad_norm": 0.029347939416766167, "learning_rate": 0.024000000208616257, "loss": 2.4130966663360596, "step": 9044 }, { "epoch": 0.43076190476190473, "grad_norm": 0.028943981975317, "learning_rate": 0.024000000208616257, "loss": 2.3701226711273193, "step": 9046 }, { "epoch": 0.4308571428571429, "grad_norm": 0.029909910634160042, "learning_rate": 0.024000000208616257, "loss": 2.364152431488037, "step": 9048 }, { "epoch": 0.430952380952381, "grad_norm": 0.027944818139076233, "learning_rate": 0.024000000208616257, "loss": 2.3523828983306885, "step": 9050 }, { "epoch": 0.43104761904761907, "grad_norm": 0.027859438210725784, "learning_rate": 0.024000000208616257, "loss": 2.352377414703369, "step": 9052 }, { "epoch": 0.43114285714285716, "grad_norm": 0.02836262248456478, "learning_rate": 0.024000000208616257, "loss": 2.3822622299194336, "step": 9054 }, { "epoch": 0.43123809523809525, "grad_norm": 0.028515787795186043, "learning_rate": 0.024000000208616257, "loss": 2.3562607765197754, "step": 9056 }, { "epoch": 0.43133333333333335, "grad_norm": 0.02780604362487793, "learning_rate": 0.024000000208616257, "loss": 2.3528590202331543, "step": 9058 }, { "epoch": 0.43142857142857144, "grad_norm": 0.026693029329180717, "learning_rate": 0.024000000208616257, "loss": 2.3281102180480957, "step": 9060 }, { "epoch": 0.43152380952380953, "grad_norm": 0.028249425813555717, "learning_rate": 0.024000000208616257, "loss": 2.35697603225708, "step": 9062 }, { "epoch": 0.4316190476190476, "grad_norm": 0.028213011100888252, "learning_rate": 0.024000000208616257, "loss": 2.3647172451019287, "step": 9064 }, { "epoch": 0.4317142857142857, "grad_norm": 0.02775024063885212, "learning_rate": 0.024000000208616257, "loss": 2.3585379123687744, "step": 9066 }, { "epoch": 0.4318095238095238, "grad_norm": 0.03312710300087929, "learning_rate": 0.024000000208616257, "loss": 2.3522555828094482, "step": 9068 }, { "epoch": 0.4319047619047619, "grad_norm": 0.027743497863411903, "learning_rate": 0.024000000208616257, "loss": 2.382769823074341, "step": 9070 }, { "epoch": 0.432, "grad_norm": 0.028522051870822906, "learning_rate": 0.024000000208616257, "loss": 2.3572816848754883, "step": 9072 }, { "epoch": 0.4320952380952381, "grad_norm": 0.03035544976592064, "learning_rate": 0.024000000208616257, "loss": 2.3590798377990723, "step": 9074 }, { "epoch": 0.4321904761904762, "grad_norm": 0.029559891670942307, "learning_rate": 0.024000000208616257, "loss": 2.3719429969787598, "step": 9076 }, { "epoch": 0.4322857142857143, "grad_norm": 0.02865804359316826, "learning_rate": 0.024000000208616257, "loss": 2.359708547592163, "step": 9078 }, { "epoch": 0.43238095238095237, "grad_norm": 0.027760835364460945, "learning_rate": 0.024000000208616257, "loss": 2.334477424621582, "step": 9080 }, { "epoch": 0.43247619047619046, "grad_norm": 0.028866374865174294, "learning_rate": 0.024000000208616257, "loss": 2.3389463424682617, "step": 9082 }, { "epoch": 0.43257142857142855, "grad_norm": 0.028205377981066704, "learning_rate": 0.024000000208616257, "loss": 2.356444835662842, "step": 9084 }, { "epoch": 0.43266666666666664, "grad_norm": 0.028116052970290184, "learning_rate": 0.024000000208616257, "loss": 2.3706278800964355, "step": 9086 }, { "epoch": 0.43276190476190474, "grad_norm": 0.028490185737609863, "learning_rate": 0.024000000208616257, "loss": 2.351410388946533, "step": 9088 }, { "epoch": 0.4328571428571429, "grad_norm": 0.029845569282770157, "learning_rate": 0.024000000208616257, "loss": 2.2891793251037598, "step": 9090 }, { "epoch": 0.432952380952381, "grad_norm": 0.029228800907731056, "learning_rate": 0.024000000208616257, "loss": 2.3575100898742676, "step": 9092 }, { "epoch": 0.43304761904761907, "grad_norm": 0.027797671034932137, "learning_rate": 0.024000000208616257, "loss": 2.3387327194213867, "step": 9094 }, { "epoch": 0.43314285714285716, "grad_norm": 0.0281207412481308, "learning_rate": 0.024000000208616257, "loss": 2.362405776977539, "step": 9096 }, { "epoch": 0.43323809523809526, "grad_norm": 0.028207965195178986, "learning_rate": 0.024000000208616257, "loss": 2.3653647899627686, "step": 9098 }, { "epoch": 0.43333333333333335, "grad_norm": 0.028742102906107903, "learning_rate": 0.024000000208616257, "loss": 2.355485200881958, "step": 9100 }, { "epoch": 0.43342857142857144, "grad_norm": 0.0288411695510149, "learning_rate": 0.024000000208616257, "loss": 2.3295974731445312, "step": 9102 }, { "epoch": 0.43352380952380953, "grad_norm": 0.0281478613615036, "learning_rate": 0.024000000208616257, "loss": 2.333043336868286, "step": 9104 }, { "epoch": 0.4336190476190476, "grad_norm": 0.02724134922027588, "learning_rate": 0.024000000208616257, "loss": 2.33766508102417, "step": 9106 }, { "epoch": 0.4337142857142857, "grad_norm": 0.028929250314831734, "learning_rate": 0.024000000208616257, "loss": 2.345017910003662, "step": 9108 }, { "epoch": 0.4338095238095238, "grad_norm": 0.028461456298828125, "learning_rate": 0.024000000208616257, "loss": 2.350186824798584, "step": 9110 }, { "epoch": 0.4339047619047619, "grad_norm": 0.0273346696048975, "learning_rate": 0.024000000208616257, "loss": 2.3620619773864746, "step": 9112 }, { "epoch": 0.434, "grad_norm": 0.028465617448091507, "learning_rate": 0.024000000208616257, "loss": 2.338608503341675, "step": 9114 }, { "epoch": 0.4340952380952381, "grad_norm": 0.02938041463494301, "learning_rate": 0.024000000208616257, "loss": 2.314039707183838, "step": 9116 }, { "epoch": 0.4341904761904762, "grad_norm": 0.027038980275392532, "learning_rate": 0.024000000208616257, "loss": 2.3947505950927734, "step": 9118 }, { "epoch": 0.4342857142857143, "grad_norm": 0.027601825073361397, "learning_rate": 0.024000000208616257, "loss": 2.3548715114593506, "step": 9120 }, { "epoch": 0.43438095238095237, "grad_norm": 0.029361777007579803, "learning_rate": 0.024000000208616257, "loss": 2.32605242729187, "step": 9122 }, { "epoch": 0.43447619047619046, "grad_norm": 0.02742251753807068, "learning_rate": 0.024000000208616257, "loss": 2.3472585678100586, "step": 9124 }, { "epoch": 0.43457142857142855, "grad_norm": 0.02849576622247696, "learning_rate": 0.024000000208616257, "loss": 2.3390560150146484, "step": 9126 }, { "epoch": 0.43466666666666665, "grad_norm": 0.028344089165329933, "learning_rate": 0.024000000208616257, "loss": 2.355100631713867, "step": 9128 }, { "epoch": 0.43476190476190474, "grad_norm": 0.028987081721425056, "learning_rate": 0.024000000208616257, "loss": 2.350504159927368, "step": 9130 }, { "epoch": 0.43485714285714283, "grad_norm": 0.027934571728110313, "learning_rate": 0.024000000208616257, "loss": 2.3519961833953857, "step": 9132 }, { "epoch": 0.434952380952381, "grad_norm": 0.027751972898840904, "learning_rate": 0.024000000208616257, "loss": 2.337620735168457, "step": 9134 }, { "epoch": 0.43504761904761907, "grad_norm": 0.029858769848942757, "learning_rate": 0.024000000208616257, "loss": 2.355635166168213, "step": 9136 }, { "epoch": 0.43514285714285716, "grad_norm": 0.03078494407236576, "learning_rate": 0.024000000208616257, "loss": 2.3213820457458496, "step": 9138 }, { "epoch": 0.43523809523809526, "grad_norm": 0.02921787090599537, "learning_rate": 0.024000000208616257, "loss": 2.3486857414245605, "step": 9140 }, { "epoch": 0.43533333333333335, "grad_norm": 0.028577422723174095, "learning_rate": 0.024000000208616257, "loss": 2.305108070373535, "step": 9142 }, { "epoch": 0.43542857142857144, "grad_norm": 0.02783380076289177, "learning_rate": 0.024000000208616257, "loss": 2.369715690612793, "step": 9144 }, { "epoch": 0.43552380952380954, "grad_norm": 0.027717089280486107, "learning_rate": 0.024000000208616257, "loss": 2.347748279571533, "step": 9146 }, { "epoch": 0.43561904761904763, "grad_norm": 0.02970797009766102, "learning_rate": 0.024000000208616257, "loss": 2.3604211807250977, "step": 9148 }, { "epoch": 0.4357142857142857, "grad_norm": 0.027706023305654526, "learning_rate": 0.024000000208616257, "loss": 2.3440728187561035, "step": 9150 }, { "epoch": 0.4358095238095238, "grad_norm": 0.0280055683106184, "learning_rate": 0.024000000208616257, "loss": 2.337491273880005, "step": 9152 }, { "epoch": 0.4359047619047619, "grad_norm": 0.02879980579018593, "learning_rate": 0.024000000208616257, "loss": 2.3120040893554688, "step": 9154 }, { "epoch": 0.436, "grad_norm": 0.027909833937883377, "learning_rate": 0.024000000208616257, "loss": 2.3361401557922363, "step": 9156 }, { "epoch": 0.4360952380952381, "grad_norm": 0.029643921181559563, "learning_rate": 0.024000000208616257, "loss": 2.3460915088653564, "step": 9158 }, { "epoch": 0.4361904761904762, "grad_norm": 0.02942373976111412, "learning_rate": 0.024000000208616257, "loss": 2.3544764518737793, "step": 9160 }, { "epoch": 0.4362857142857143, "grad_norm": 0.02738555148243904, "learning_rate": 0.024000000208616257, "loss": 2.333406448364258, "step": 9162 }, { "epoch": 0.43638095238095237, "grad_norm": 0.027961213141679764, "learning_rate": 0.024000000208616257, "loss": 2.3226091861724854, "step": 9164 }, { "epoch": 0.43647619047619046, "grad_norm": 0.031490132212638855, "learning_rate": 0.024000000208616257, "loss": 2.331057548522949, "step": 9166 }, { "epoch": 0.43657142857142855, "grad_norm": 0.029992345720529556, "learning_rate": 0.024000000208616257, "loss": 2.3297314643859863, "step": 9168 }, { "epoch": 0.43666666666666665, "grad_norm": 0.027628175914287567, "learning_rate": 0.024000000208616257, "loss": 2.3171863555908203, "step": 9170 }, { "epoch": 0.43676190476190474, "grad_norm": 0.02770528383553028, "learning_rate": 0.024000000208616257, "loss": 2.3490729331970215, "step": 9172 }, { "epoch": 0.43685714285714283, "grad_norm": 0.027597198262810707, "learning_rate": 0.024000000208616257, "loss": 2.3382749557495117, "step": 9174 }, { "epoch": 0.4369523809523809, "grad_norm": 0.02883792854845524, "learning_rate": 0.024000000208616257, "loss": 2.3087053298950195, "step": 9176 }, { "epoch": 0.4370476190476191, "grad_norm": 0.0297683198004961, "learning_rate": 0.024000000208616257, "loss": 2.3121423721313477, "step": 9178 }, { "epoch": 0.43714285714285717, "grad_norm": 0.028145257383584976, "learning_rate": 0.024000000208616257, "loss": 2.3345463275909424, "step": 9180 }, { "epoch": 0.43723809523809526, "grad_norm": 0.03166046738624573, "learning_rate": 0.024000000208616257, "loss": 2.336369037628174, "step": 9182 }, { "epoch": 0.43733333333333335, "grad_norm": 0.028022386133670807, "learning_rate": 0.024000000208616257, "loss": 2.2963857650756836, "step": 9184 }, { "epoch": 0.43742857142857144, "grad_norm": 0.02725226804614067, "learning_rate": 0.024000000208616257, "loss": 2.323737621307373, "step": 9186 }, { "epoch": 0.43752380952380954, "grad_norm": 0.03035493940114975, "learning_rate": 0.024000000208616257, "loss": 2.345534563064575, "step": 9188 }, { "epoch": 0.43761904761904763, "grad_norm": 0.029918387532234192, "learning_rate": 0.024000000208616257, "loss": 2.321889877319336, "step": 9190 }, { "epoch": 0.4377142857142857, "grad_norm": 0.03648152947425842, "learning_rate": 0.024000000208616257, "loss": 2.3370866775512695, "step": 9192 }, { "epoch": 0.4378095238095238, "grad_norm": 0.028453223407268524, "learning_rate": 0.024000000208616257, "loss": 2.2843947410583496, "step": 9194 }, { "epoch": 0.4379047619047619, "grad_norm": 0.026725279167294502, "learning_rate": 0.024000000208616257, "loss": 2.3112940788269043, "step": 9196 }, { "epoch": 0.438, "grad_norm": 0.02683115005493164, "learning_rate": 0.024000000208616257, "loss": 2.30354642868042, "step": 9198 }, { "epoch": 0.4380952380952381, "grad_norm": 0.02880522795021534, "learning_rate": 0.024000000208616257, "loss": 2.315157651901245, "step": 9200 }, { "epoch": 0.4381904761904762, "grad_norm": 0.027617620304226875, "learning_rate": 0.024000000208616257, "loss": 2.305635929107666, "step": 9202 }, { "epoch": 0.4382857142857143, "grad_norm": 0.02760431356728077, "learning_rate": 0.024000000208616257, "loss": 2.3289542198181152, "step": 9204 }, { "epoch": 0.43838095238095237, "grad_norm": 0.027735479176044464, "learning_rate": 0.024000000208616257, "loss": 2.319901943206787, "step": 9206 }, { "epoch": 0.43847619047619046, "grad_norm": 0.027308864519000053, "learning_rate": 0.024000000208616257, "loss": 2.285004138946533, "step": 9208 }, { "epoch": 0.43857142857142856, "grad_norm": 0.03012416884303093, "learning_rate": 0.024000000208616257, "loss": 2.334378480911255, "step": 9210 }, { "epoch": 0.43866666666666665, "grad_norm": 0.03310755267739296, "learning_rate": 0.024000000208616257, "loss": 2.3463902473449707, "step": 9212 }, { "epoch": 0.43876190476190474, "grad_norm": 0.028550148010253906, "learning_rate": 0.024000000208616257, "loss": 2.3071417808532715, "step": 9214 }, { "epoch": 0.43885714285714283, "grad_norm": 0.02778642065823078, "learning_rate": 0.024000000208616257, "loss": 2.3291263580322266, "step": 9216 }, { "epoch": 0.4389523809523809, "grad_norm": 0.028854526579380035, "learning_rate": 0.024000000208616257, "loss": 2.328357219696045, "step": 9218 }, { "epoch": 0.439047619047619, "grad_norm": 0.028664732351899147, "learning_rate": 0.024000000208616257, "loss": 2.337904930114746, "step": 9220 }, { "epoch": 0.43914285714285717, "grad_norm": 0.027487175539135933, "learning_rate": 0.024000000208616257, "loss": 2.3236260414123535, "step": 9222 }, { "epoch": 0.43923809523809526, "grad_norm": 0.02761923521757126, "learning_rate": 0.024000000208616257, "loss": 2.3282980918884277, "step": 9224 }, { "epoch": 0.43933333333333335, "grad_norm": 0.027788328006863594, "learning_rate": 0.024000000208616257, "loss": 2.335744619369507, "step": 9226 }, { "epoch": 0.43942857142857145, "grad_norm": 0.028515398502349854, "learning_rate": 0.024000000208616257, "loss": 2.3068628311157227, "step": 9228 }, { "epoch": 0.43952380952380954, "grad_norm": 0.02879527397453785, "learning_rate": 0.024000000208616257, "loss": 2.272233009338379, "step": 9230 }, { "epoch": 0.43961904761904763, "grad_norm": 0.028757473453879356, "learning_rate": 0.024000000208616257, "loss": 2.2855284214019775, "step": 9232 }, { "epoch": 0.4397142857142857, "grad_norm": 0.030150171369314194, "learning_rate": 0.024000000208616257, "loss": 2.3178787231445312, "step": 9234 }, { "epoch": 0.4398095238095238, "grad_norm": 0.033810000866651535, "learning_rate": 0.024000000208616257, "loss": 2.3347020149230957, "step": 9236 }, { "epoch": 0.4399047619047619, "grad_norm": 0.02755209058523178, "learning_rate": 0.024000000208616257, "loss": 2.328901767730713, "step": 9238 }, { "epoch": 0.44, "grad_norm": 0.02720773033797741, "learning_rate": 0.024000000208616257, "loss": 2.3099112510681152, "step": 9240 }, { "epoch": 0.4400952380952381, "grad_norm": 0.02991933375597, "learning_rate": 0.024000000208616257, "loss": 2.322160243988037, "step": 9242 }, { "epoch": 0.4401904761904762, "grad_norm": 0.030437249690294266, "learning_rate": 0.024000000208616257, "loss": 2.3206076622009277, "step": 9244 }, { "epoch": 0.4402857142857143, "grad_norm": 0.031191358342766762, "learning_rate": 0.024000000208616257, "loss": 2.300386905670166, "step": 9246 }, { "epoch": 0.4403809523809524, "grad_norm": 0.03177332505583763, "learning_rate": 0.024000000208616257, "loss": 2.303947925567627, "step": 9248 }, { "epoch": 0.44047619047619047, "grad_norm": 0.031711477786302567, "learning_rate": 0.024000000208616257, "loss": 2.2967166900634766, "step": 9250 }, { "epoch": 0.44057142857142856, "grad_norm": 0.03007437475025654, "learning_rate": 0.024000000208616257, "loss": 2.3379855155944824, "step": 9252 }, { "epoch": 0.44066666666666665, "grad_norm": 0.02883048728108406, "learning_rate": 0.024000000208616257, "loss": 2.306523323059082, "step": 9254 }, { "epoch": 0.44076190476190474, "grad_norm": 0.02765863947570324, "learning_rate": 0.024000000208616257, "loss": 2.320063591003418, "step": 9256 }, { "epoch": 0.44085714285714284, "grad_norm": 0.0276725422590971, "learning_rate": 0.024000000208616257, "loss": 2.319469928741455, "step": 9258 }, { "epoch": 0.44095238095238093, "grad_norm": 0.027647070586681366, "learning_rate": 0.024000000208616257, "loss": 2.3497257232666016, "step": 9260 }, { "epoch": 0.441047619047619, "grad_norm": 0.02744031511247158, "learning_rate": 0.024000000208616257, "loss": 2.306821584701538, "step": 9262 }, { "epoch": 0.44114285714285717, "grad_norm": 0.027942266315221786, "learning_rate": 0.024000000208616257, "loss": 2.3317253589630127, "step": 9264 }, { "epoch": 0.44123809523809526, "grad_norm": 0.02844003401696682, "learning_rate": 0.024000000208616257, "loss": 2.323493480682373, "step": 9266 }, { "epoch": 0.44133333333333336, "grad_norm": 0.026817871257662773, "learning_rate": 0.024000000208616257, "loss": 2.3559823036193848, "step": 9268 }, { "epoch": 0.44142857142857145, "grad_norm": 0.027005689218640327, "learning_rate": 0.024000000208616257, "loss": 2.337440013885498, "step": 9270 }, { "epoch": 0.44152380952380954, "grad_norm": 0.028705066069960594, "learning_rate": 0.024000000208616257, "loss": 2.3223071098327637, "step": 9272 }, { "epoch": 0.44161904761904763, "grad_norm": 0.027293846011161804, "learning_rate": 0.024000000208616257, "loss": 2.3067827224731445, "step": 9274 }, { "epoch": 0.4417142857142857, "grad_norm": 0.027812259271740913, "learning_rate": 0.024000000208616257, "loss": 2.3056554794311523, "step": 9276 }, { "epoch": 0.4418095238095238, "grad_norm": 0.027697600424289703, "learning_rate": 0.024000000208616257, "loss": 2.3389148712158203, "step": 9278 }, { "epoch": 0.4419047619047619, "grad_norm": 0.026890572160482407, "learning_rate": 0.024000000208616257, "loss": 2.304771900177002, "step": 9280 }, { "epoch": 0.442, "grad_norm": 0.02823222242295742, "learning_rate": 0.024000000208616257, "loss": 2.3085927963256836, "step": 9282 }, { "epoch": 0.4420952380952381, "grad_norm": 0.026768820360302925, "learning_rate": 0.024000000208616257, "loss": 2.325934410095215, "step": 9284 }, { "epoch": 0.4421904761904762, "grad_norm": 0.027939602732658386, "learning_rate": 0.024000000208616257, "loss": 2.3458828926086426, "step": 9286 }, { "epoch": 0.4422857142857143, "grad_norm": 0.03203938901424408, "learning_rate": 0.024000000208616257, "loss": 2.326932430267334, "step": 9288 }, { "epoch": 0.4423809523809524, "grad_norm": 0.03307581692934036, "learning_rate": 0.024000000208616257, "loss": 2.328409194946289, "step": 9290 }, { "epoch": 0.44247619047619047, "grad_norm": 0.030818110331892967, "learning_rate": 0.024000000208616257, "loss": 2.3399481773376465, "step": 9292 }, { "epoch": 0.44257142857142856, "grad_norm": 0.026863466948270798, "learning_rate": 0.024000000208616257, "loss": 2.3263933658599854, "step": 9294 }, { "epoch": 0.44266666666666665, "grad_norm": 0.02961041033267975, "learning_rate": 0.024000000208616257, "loss": 2.3514602184295654, "step": 9296 }, { "epoch": 0.44276190476190475, "grad_norm": 0.031652264297008514, "learning_rate": 0.024000000208616257, "loss": 2.326202630996704, "step": 9298 }, { "epoch": 0.44285714285714284, "grad_norm": 0.027950717136263847, "learning_rate": 0.024000000208616257, "loss": 2.343456745147705, "step": 9300 }, { "epoch": 0.44295238095238093, "grad_norm": 0.027578748762607574, "learning_rate": 0.024000000208616257, "loss": 2.3384766578674316, "step": 9302 }, { "epoch": 0.443047619047619, "grad_norm": 0.027901889756321907, "learning_rate": 0.024000000208616257, "loss": 2.297211170196533, "step": 9304 }, { "epoch": 0.4431428571428571, "grad_norm": 0.02748989872634411, "learning_rate": 0.024000000208616257, "loss": 2.3454885482788086, "step": 9306 }, { "epoch": 0.44323809523809526, "grad_norm": 0.03125539794564247, "learning_rate": 0.024000000208616257, "loss": 2.3265151977539062, "step": 9308 }, { "epoch": 0.44333333333333336, "grad_norm": 0.03674205020070076, "learning_rate": 0.024000000208616257, "loss": 2.3341288566589355, "step": 9310 }, { "epoch": 0.44342857142857145, "grad_norm": 0.03825412318110466, "learning_rate": 0.024000000208616257, "loss": 2.3060426712036133, "step": 9312 }, { "epoch": 0.44352380952380954, "grad_norm": 0.03219965472817421, "learning_rate": 0.024000000208616257, "loss": 2.3392367362976074, "step": 9314 }, { "epoch": 0.44361904761904764, "grad_norm": 0.026971925050020218, "learning_rate": 0.024000000208616257, "loss": 2.34959077835083, "step": 9316 }, { "epoch": 0.4437142857142857, "grad_norm": 0.028325650840997696, "learning_rate": 0.024000000208616257, "loss": 2.318349838256836, "step": 9318 }, { "epoch": 0.4438095238095238, "grad_norm": 0.030183926224708557, "learning_rate": 0.024000000208616257, "loss": 2.309781074523926, "step": 9320 }, { "epoch": 0.4439047619047619, "grad_norm": 0.029603036120533943, "learning_rate": 0.024000000208616257, "loss": 2.2945520877838135, "step": 9322 }, { "epoch": 0.444, "grad_norm": 0.027431625872850418, "learning_rate": 0.024000000208616257, "loss": 2.297065019607544, "step": 9324 }, { "epoch": 0.4440952380952381, "grad_norm": 0.029024144634604454, "learning_rate": 0.024000000208616257, "loss": 2.333747386932373, "step": 9326 }, { "epoch": 0.4441904761904762, "grad_norm": 0.029375189915299416, "learning_rate": 0.024000000208616257, "loss": 2.3567450046539307, "step": 9328 }, { "epoch": 0.4442857142857143, "grad_norm": 0.028945432975888252, "learning_rate": 0.024000000208616257, "loss": 2.304704189300537, "step": 9330 }, { "epoch": 0.4443809523809524, "grad_norm": 0.028592588379979134, "learning_rate": 0.024000000208616257, "loss": 2.3329732418060303, "step": 9332 }, { "epoch": 0.44447619047619047, "grad_norm": 0.02752716839313507, "learning_rate": 0.024000000208616257, "loss": 2.3122353553771973, "step": 9334 }, { "epoch": 0.44457142857142856, "grad_norm": 0.027412498369812965, "learning_rate": 0.024000000208616257, "loss": 2.2966272830963135, "step": 9336 }, { "epoch": 0.44466666666666665, "grad_norm": 0.028113368898630142, "learning_rate": 0.024000000208616257, "loss": 2.3240535259246826, "step": 9338 }, { "epoch": 0.44476190476190475, "grad_norm": 0.03146934136748314, "learning_rate": 0.024000000208616257, "loss": 2.366851329803467, "step": 9340 }, { "epoch": 0.44485714285714284, "grad_norm": 0.03637567162513733, "learning_rate": 0.024000000208616257, "loss": 2.3399949073791504, "step": 9342 }, { "epoch": 0.44495238095238093, "grad_norm": 0.03121298924088478, "learning_rate": 0.024000000208616257, "loss": 2.3217825889587402, "step": 9344 }, { "epoch": 0.445047619047619, "grad_norm": 0.02819632738828659, "learning_rate": 0.024000000208616257, "loss": 2.3186569213867188, "step": 9346 }, { "epoch": 0.4451428571428571, "grad_norm": 0.027306344360113144, "learning_rate": 0.024000000208616257, "loss": 2.3810973167419434, "step": 9348 }, { "epoch": 0.4452380952380952, "grad_norm": 0.02779257483780384, "learning_rate": 0.024000000208616257, "loss": 2.3331713676452637, "step": 9350 }, { "epoch": 0.44533333333333336, "grad_norm": 0.02833339013159275, "learning_rate": 0.024000000208616257, "loss": 2.3122785091400146, "step": 9352 }, { "epoch": 0.44542857142857145, "grad_norm": 0.027588196098804474, "learning_rate": 0.024000000208616257, "loss": 2.358957290649414, "step": 9354 }, { "epoch": 0.44552380952380954, "grad_norm": 0.028243109583854675, "learning_rate": 0.024000000208616257, "loss": 2.3577661514282227, "step": 9356 }, { "epoch": 0.44561904761904764, "grad_norm": 0.02889030985534191, "learning_rate": 0.024000000208616257, "loss": 2.31154203414917, "step": 9358 }, { "epoch": 0.44571428571428573, "grad_norm": 0.027423404157161713, "learning_rate": 0.024000000208616257, "loss": 2.3048300743103027, "step": 9360 }, { "epoch": 0.4458095238095238, "grad_norm": 0.028350796550512314, "learning_rate": 0.024000000208616257, "loss": 2.346247434616089, "step": 9362 }, { "epoch": 0.4459047619047619, "grad_norm": 0.028323518112301826, "learning_rate": 0.024000000208616257, "loss": 2.341341495513916, "step": 9364 }, { "epoch": 0.446, "grad_norm": 0.0291711688041687, "learning_rate": 0.024000000208616257, "loss": 2.3666720390319824, "step": 9366 }, { "epoch": 0.4460952380952381, "grad_norm": 0.03136400878429413, "learning_rate": 0.024000000208616257, "loss": 2.3444252014160156, "step": 9368 }, { "epoch": 0.4461904761904762, "grad_norm": 0.028995772823691368, "learning_rate": 0.024000000208616257, "loss": 2.4061331748962402, "step": 9370 }, { "epoch": 0.4462857142857143, "grad_norm": 0.028245816007256508, "learning_rate": 0.024000000208616257, "loss": 2.320417881011963, "step": 9372 }, { "epoch": 0.4463809523809524, "grad_norm": 0.028446059674024582, "learning_rate": 0.024000000208616257, "loss": 2.3208670616149902, "step": 9374 }, { "epoch": 0.44647619047619047, "grad_norm": 0.029107604175806046, "learning_rate": 0.024000000208616257, "loss": 2.3443875312805176, "step": 9376 }, { "epoch": 0.44657142857142856, "grad_norm": 0.028971053659915924, "learning_rate": 0.024000000208616257, "loss": 2.3428051471710205, "step": 9378 }, { "epoch": 0.44666666666666666, "grad_norm": 0.027278222143650055, "learning_rate": 0.024000000208616257, "loss": 2.310889959335327, "step": 9380 }, { "epoch": 0.44676190476190475, "grad_norm": 0.02797379344701767, "learning_rate": 0.024000000208616257, "loss": 2.3311104774475098, "step": 9382 }, { "epoch": 0.44685714285714284, "grad_norm": 0.029069215059280396, "learning_rate": 0.024000000208616257, "loss": 2.3561208248138428, "step": 9384 }, { "epoch": 0.44695238095238093, "grad_norm": 0.02846992202103138, "learning_rate": 0.024000000208616257, "loss": 2.3437466621398926, "step": 9386 }, { "epoch": 0.447047619047619, "grad_norm": 0.02759224735200405, "learning_rate": 0.024000000208616257, "loss": 2.3430566787719727, "step": 9388 }, { "epoch": 0.4471428571428571, "grad_norm": 0.027249081060290337, "learning_rate": 0.024000000208616257, "loss": 2.3393008708953857, "step": 9390 }, { "epoch": 0.4472380952380952, "grad_norm": 0.029575655236840248, "learning_rate": 0.024000000208616257, "loss": 2.344088554382324, "step": 9392 }, { "epoch": 0.44733333333333336, "grad_norm": 0.030211223289370537, "learning_rate": 0.024000000208616257, "loss": 2.317172050476074, "step": 9394 }, { "epoch": 0.44742857142857145, "grad_norm": 0.02917393110692501, "learning_rate": 0.024000000208616257, "loss": 2.3711228370666504, "step": 9396 }, { "epoch": 0.44752380952380955, "grad_norm": 0.028596844524145126, "learning_rate": 0.024000000208616257, "loss": 2.3151001930236816, "step": 9398 }, { "epoch": 0.44761904761904764, "grad_norm": 0.02734028361737728, "learning_rate": 0.024000000208616257, "loss": 2.343313217163086, "step": 9400 }, { "epoch": 0.44771428571428573, "grad_norm": 0.029025908559560776, "learning_rate": 0.024000000208616257, "loss": 2.3358941078186035, "step": 9402 }, { "epoch": 0.4478095238095238, "grad_norm": 0.027924539521336555, "learning_rate": 0.024000000208616257, "loss": 2.363172769546509, "step": 9404 }, { "epoch": 0.4479047619047619, "grad_norm": 0.026821376755833626, "learning_rate": 0.024000000208616257, "loss": 2.3435544967651367, "step": 9406 }, { "epoch": 0.448, "grad_norm": 0.02856476604938507, "learning_rate": 0.024000000208616257, "loss": 2.3566527366638184, "step": 9408 }, { "epoch": 0.4480952380952381, "grad_norm": 0.02764582261443138, "learning_rate": 0.024000000208616257, "loss": 2.3228306770324707, "step": 9410 }, { "epoch": 0.4481904761904762, "grad_norm": 0.027743563055992126, "learning_rate": 0.024000000208616257, "loss": 2.3885042667388916, "step": 9412 }, { "epoch": 0.4482857142857143, "grad_norm": 0.027027038857340813, "learning_rate": 0.024000000208616257, "loss": 2.3647990226745605, "step": 9414 }, { "epoch": 0.4483809523809524, "grad_norm": 0.02855653688311577, "learning_rate": 0.024000000208616257, "loss": 2.3775243759155273, "step": 9416 }, { "epoch": 0.4484761904761905, "grad_norm": 0.028720472007989883, "learning_rate": 0.024000000208616257, "loss": 2.3454413414001465, "step": 9418 }, { "epoch": 0.44857142857142857, "grad_norm": 0.028947889804840088, "learning_rate": 0.024000000208616257, "loss": 2.3521575927734375, "step": 9420 }, { "epoch": 0.44866666666666666, "grad_norm": 0.031203050166368484, "learning_rate": 0.024000000208616257, "loss": 2.338522434234619, "step": 9422 }, { "epoch": 0.44876190476190475, "grad_norm": 0.027892766520380974, "learning_rate": 0.024000000208616257, "loss": 2.3732895851135254, "step": 9424 }, { "epoch": 0.44885714285714284, "grad_norm": 0.029060937464237213, "learning_rate": 0.024000000208616257, "loss": 2.375776767730713, "step": 9426 }, { "epoch": 0.44895238095238094, "grad_norm": 0.02677522972226143, "learning_rate": 0.024000000208616257, "loss": 2.3854103088378906, "step": 9428 }, { "epoch": 0.44904761904761903, "grad_norm": 0.028287729248404503, "learning_rate": 0.024000000208616257, "loss": 2.3508963584899902, "step": 9430 }, { "epoch": 0.4491428571428571, "grad_norm": 0.028318390250205994, "learning_rate": 0.024000000208616257, "loss": 2.35878586769104, "step": 9432 }, { "epoch": 0.4492380952380952, "grad_norm": 0.02873067930340767, "learning_rate": 0.024000000208616257, "loss": 2.3581151962280273, "step": 9434 }, { "epoch": 0.4493333333333333, "grad_norm": 0.02905939519405365, "learning_rate": 0.024000000208616257, "loss": 2.368133068084717, "step": 9436 }, { "epoch": 0.44942857142857146, "grad_norm": 0.03444549813866615, "learning_rate": 0.024000000208616257, "loss": 2.3557329177856445, "step": 9438 }, { "epoch": 0.44952380952380955, "grad_norm": 0.029895273968577385, "learning_rate": 0.024000000208616257, "loss": 2.373685836791992, "step": 9440 }, { "epoch": 0.44961904761904764, "grad_norm": 0.027424940839409828, "learning_rate": 0.024000000208616257, "loss": 2.3646469116210938, "step": 9442 }, { "epoch": 0.44971428571428573, "grad_norm": 0.028541767969727516, "learning_rate": 0.024000000208616257, "loss": 2.363098382949829, "step": 9444 }, { "epoch": 0.4498095238095238, "grad_norm": 0.029866786673665047, "learning_rate": 0.024000000208616257, "loss": 2.3876795768737793, "step": 9446 }, { "epoch": 0.4499047619047619, "grad_norm": 0.029006849974393845, "learning_rate": 0.024000000208616257, "loss": 2.3764429092407227, "step": 9448 }, { "epoch": 0.45, "grad_norm": 0.027323361486196518, "learning_rate": 0.024000000208616257, "loss": 2.3798470497131348, "step": 9450 }, { "epoch": 0.4500952380952381, "grad_norm": 0.02812323346734047, "learning_rate": 0.024000000208616257, "loss": 2.373399496078491, "step": 9452 }, { "epoch": 0.4501904761904762, "grad_norm": 0.02928830310702324, "learning_rate": 0.024000000208616257, "loss": 2.3675971031188965, "step": 9454 }, { "epoch": 0.4502857142857143, "grad_norm": 0.02783268876373768, "learning_rate": 0.024000000208616257, "loss": 2.3551583290100098, "step": 9456 }, { "epoch": 0.4503809523809524, "grad_norm": 0.026964876800775528, "learning_rate": 0.024000000208616257, "loss": 2.3853836059570312, "step": 9458 }, { "epoch": 0.4504761904761905, "grad_norm": 0.02846411243081093, "learning_rate": 0.024000000208616257, "loss": 2.3736214637756348, "step": 9460 }, { "epoch": 0.45057142857142857, "grad_norm": 0.027485469356179237, "learning_rate": 0.024000000208616257, "loss": 2.3665194511413574, "step": 9462 }, { "epoch": 0.45066666666666666, "grad_norm": 0.03150163218379021, "learning_rate": 0.024000000208616257, "loss": 2.3583173751831055, "step": 9464 }, { "epoch": 0.45076190476190475, "grad_norm": 0.028467411175370216, "learning_rate": 0.024000000208616257, "loss": 2.389822483062744, "step": 9466 }, { "epoch": 0.45085714285714285, "grad_norm": 0.027167508378624916, "learning_rate": 0.024000000208616257, "loss": 2.400430917739868, "step": 9468 }, { "epoch": 0.45095238095238094, "grad_norm": 0.05745549872517586, "learning_rate": 0.024000000208616257, "loss": 2.3882322311401367, "step": 9470 }, { "epoch": 0.45104761904761903, "grad_norm": 0.029168561100959778, "learning_rate": 0.024000000208616257, "loss": 2.365302562713623, "step": 9472 }, { "epoch": 0.4511428571428571, "grad_norm": 0.02908279001712799, "learning_rate": 0.024000000208616257, "loss": 2.3743128776550293, "step": 9474 }, { "epoch": 0.4512380952380952, "grad_norm": 0.030048049986362457, "learning_rate": 0.024000000208616257, "loss": 2.3569440841674805, "step": 9476 }, { "epoch": 0.4513333333333333, "grad_norm": 0.02787018194794655, "learning_rate": 0.024000000208616257, "loss": 2.372798442840576, "step": 9478 }, { "epoch": 0.4514285714285714, "grad_norm": 0.03107086569070816, "learning_rate": 0.024000000208616257, "loss": 2.422485828399658, "step": 9480 }, { "epoch": 0.45152380952380955, "grad_norm": 0.035302795469760895, "learning_rate": 0.024000000208616257, "loss": 2.379471778869629, "step": 9482 }, { "epoch": 0.45161904761904764, "grad_norm": 0.030484704300761223, "learning_rate": 0.024000000208616257, "loss": 2.3697214126586914, "step": 9484 }, { "epoch": 0.45171428571428573, "grad_norm": 0.02737436071038246, "learning_rate": 0.024000000208616257, "loss": 2.391493797302246, "step": 9486 }, { "epoch": 0.4518095238095238, "grad_norm": 0.02764594927430153, "learning_rate": 0.024000000208616257, "loss": 2.3534798622131348, "step": 9488 }, { "epoch": 0.4519047619047619, "grad_norm": 0.028327714651823044, "learning_rate": 0.024000000208616257, "loss": 2.397919178009033, "step": 9490 }, { "epoch": 0.452, "grad_norm": 0.029418958351016045, "learning_rate": 0.024000000208616257, "loss": 2.3671231269836426, "step": 9492 }, { "epoch": 0.4520952380952381, "grad_norm": 0.02784191258251667, "learning_rate": 0.024000000208616257, "loss": 2.374255895614624, "step": 9494 }, { "epoch": 0.4521904761904762, "grad_norm": 0.028004489839076996, "learning_rate": 0.024000000208616257, "loss": 2.389178514480591, "step": 9496 }, { "epoch": 0.4522857142857143, "grad_norm": 0.02681109867990017, "learning_rate": 0.024000000208616257, "loss": 2.3943874835968018, "step": 9498 }, { "epoch": 0.4523809523809524, "grad_norm": 0.02777627296745777, "learning_rate": 0.024000000208616257, "loss": 2.376643419265747, "step": 9500 }, { "epoch": 0.4524761904761905, "grad_norm": 0.029439652338624, "learning_rate": 0.024000000208616257, "loss": 2.3808984756469727, "step": 9502 }, { "epoch": 0.45257142857142857, "grad_norm": 0.0284713301807642, "learning_rate": 0.024000000208616257, "loss": 2.4102888107299805, "step": 9504 }, { "epoch": 0.45266666666666666, "grad_norm": 0.028019733726978302, "learning_rate": 0.024000000208616257, "loss": 2.3703067302703857, "step": 9506 }, { "epoch": 0.45276190476190475, "grad_norm": 0.02669699303805828, "learning_rate": 0.024000000208616257, "loss": 2.3696303367614746, "step": 9508 }, { "epoch": 0.45285714285714285, "grad_norm": 0.026749474927783012, "learning_rate": 0.024000000208616257, "loss": 2.367342472076416, "step": 9510 }, { "epoch": 0.45295238095238094, "grad_norm": 0.028304141014814377, "learning_rate": 0.024000000208616257, "loss": 2.3972115516662598, "step": 9512 }, { "epoch": 0.45304761904761903, "grad_norm": 0.026691164821386337, "learning_rate": 0.024000000208616257, "loss": 2.369424343109131, "step": 9514 }, { "epoch": 0.4531428571428571, "grad_norm": 0.027282293885946274, "learning_rate": 0.024000000208616257, "loss": 2.408133029937744, "step": 9516 }, { "epoch": 0.4532380952380952, "grad_norm": 0.027041533961892128, "learning_rate": 0.024000000208616257, "loss": 2.4174842834472656, "step": 9518 }, { "epoch": 0.4533333333333333, "grad_norm": 0.027747895568609238, "learning_rate": 0.024000000208616257, "loss": 2.4196271896362305, "step": 9520 }, { "epoch": 0.4534285714285714, "grad_norm": 0.027682824060320854, "learning_rate": 0.024000000208616257, "loss": 2.440107822418213, "step": 9522 }, { "epoch": 0.45352380952380955, "grad_norm": 0.02867613546550274, "learning_rate": 0.024000000208616257, "loss": 2.400573968887329, "step": 9524 }, { "epoch": 0.45361904761904764, "grad_norm": 0.028987908735871315, "learning_rate": 0.024000000208616257, "loss": 2.3783106803894043, "step": 9526 }, { "epoch": 0.45371428571428574, "grad_norm": 0.027644844725728035, "learning_rate": 0.024000000208616257, "loss": 2.4074182510375977, "step": 9528 }, { "epoch": 0.45380952380952383, "grad_norm": 0.030129099264740944, "learning_rate": 0.024000000208616257, "loss": 2.382225513458252, "step": 9530 }, { "epoch": 0.4539047619047619, "grad_norm": 0.02961174212396145, "learning_rate": 0.024000000208616257, "loss": 2.4109396934509277, "step": 9532 }, { "epoch": 0.454, "grad_norm": 0.027216212823987007, "learning_rate": 0.024000000208616257, "loss": 2.3909192085266113, "step": 9534 }, { "epoch": 0.4540952380952381, "grad_norm": 0.027351049706339836, "learning_rate": 0.024000000208616257, "loss": 2.393967628479004, "step": 9536 }, { "epoch": 0.4541904761904762, "grad_norm": 0.02777104638516903, "learning_rate": 0.024000000208616257, "loss": 2.4091384410858154, "step": 9538 }, { "epoch": 0.4542857142857143, "grad_norm": 0.0292830690741539, "learning_rate": 0.024000000208616257, "loss": 2.3610713481903076, "step": 9540 }, { "epoch": 0.4543809523809524, "grad_norm": 0.03030133992433548, "learning_rate": 0.024000000208616257, "loss": 2.364302635192871, "step": 9542 }, { "epoch": 0.4544761904761905, "grad_norm": 0.02817436493933201, "learning_rate": 0.024000000208616257, "loss": 2.41829776763916, "step": 9544 }, { "epoch": 0.45457142857142857, "grad_norm": 0.031827934086322784, "learning_rate": 0.024000000208616257, "loss": 2.4082417488098145, "step": 9546 }, { "epoch": 0.45466666666666666, "grad_norm": 0.02843688242137432, "learning_rate": 0.024000000208616257, "loss": 2.4033021926879883, "step": 9548 }, { "epoch": 0.45476190476190476, "grad_norm": 0.028740566223859787, "learning_rate": 0.024000000208616257, "loss": 2.4150524139404297, "step": 9550 }, { "epoch": 0.45485714285714285, "grad_norm": 0.026711007580161095, "learning_rate": 0.024000000208616257, "loss": 2.375730514526367, "step": 9552 }, { "epoch": 0.45495238095238094, "grad_norm": 0.028992997482419014, "learning_rate": 0.024000000208616257, "loss": 2.4089314937591553, "step": 9554 }, { "epoch": 0.45504761904761903, "grad_norm": 0.02872411161661148, "learning_rate": 0.024000000208616257, "loss": 2.4300498962402344, "step": 9556 }, { "epoch": 0.4551428571428571, "grad_norm": 0.029075758531689644, "learning_rate": 0.024000000208616257, "loss": 2.3912532329559326, "step": 9558 }, { "epoch": 0.4552380952380952, "grad_norm": 0.027898570522665977, "learning_rate": 0.024000000208616257, "loss": 2.403975486755371, "step": 9560 }, { "epoch": 0.4553333333333333, "grad_norm": 0.0307011641561985, "learning_rate": 0.024000000208616257, "loss": 2.3919548988342285, "step": 9562 }, { "epoch": 0.4554285714285714, "grad_norm": 0.02728140912950039, "learning_rate": 0.024000000208616257, "loss": 2.378754138946533, "step": 9564 }, { "epoch": 0.4555238095238095, "grad_norm": 0.026572877541184425, "learning_rate": 0.024000000208616257, "loss": 2.3914191722869873, "step": 9566 }, { "epoch": 0.45561904761904765, "grad_norm": 0.02776160277426243, "learning_rate": 0.024000000208616257, "loss": 2.418177843093872, "step": 9568 }, { "epoch": 0.45571428571428574, "grad_norm": 0.028324859216809273, "learning_rate": 0.024000000208616257, "loss": 2.433095693588257, "step": 9570 }, { "epoch": 0.45580952380952383, "grad_norm": 0.028692277148365974, "learning_rate": 0.024000000208616257, "loss": 2.4323055744171143, "step": 9572 }, { "epoch": 0.4559047619047619, "grad_norm": 0.027788469567894936, "learning_rate": 0.024000000208616257, "loss": 2.3905270099639893, "step": 9574 }, { "epoch": 0.456, "grad_norm": 0.02931338921189308, "learning_rate": 0.024000000208616257, "loss": 2.4258956909179688, "step": 9576 }, { "epoch": 0.4560952380952381, "grad_norm": 0.02802826650440693, "learning_rate": 0.024000000208616257, "loss": 2.3914456367492676, "step": 9578 }, { "epoch": 0.4561904761904762, "grad_norm": 0.029379328712821007, "learning_rate": 0.024000000208616257, "loss": 2.3670308589935303, "step": 9580 }, { "epoch": 0.4562857142857143, "grad_norm": 0.029332218691706657, "learning_rate": 0.024000000208616257, "loss": 2.3934900760650635, "step": 9582 }, { "epoch": 0.4563809523809524, "grad_norm": 0.03357872739434242, "learning_rate": 0.024000000208616257, "loss": 2.375843048095703, "step": 9584 }, { "epoch": 0.4564761904761905, "grad_norm": 0.02923494763672352, "learning_rate": 0.024000000208616257, "loss": 2.415560245513916, "step": 9586 }, { "epoch": 0.4565714285714286, "grad_norm": 0.02801583893597126, "learning_rate": 0.024000000208616257, "loss": 2.402529716491699, "step": 9588 }, { "epoch": 0.45666666666666667, "grad_norm": 0.02959945984184742, "learning_rate": 0.024000000208616257, "loss": 2.4189181327819824, "step": 9590 }, { "epoch": 0.45676190476190476, "grad_norm": 0.027532238513231277, "learning_rate": 0.024000000208616257, "loss": 2.4381072521209717, "step": 9592 }, { "epoch": 0.45685714285714285, "grad_norm": 0.028944674879312515, "learning_rate": 0.024000000208616257, "loss": 2.3884191513061523, "step": 9594 }, { "epoch": 0.45695238095238094, "grad_norm": 0.026757895946502686, "learning_rate": 0.024000000208616257, "loss": 2.360382556915283, "step": 9596 }, { "epoch": 0.45704761904761904, "grad_norm": 0.027503514662384987, "learning_rate": 0.024000000208616257, "loss": 2.384544610977173, "step": 9598 }, { "epoch": 0.45714285714285713, "grad_norm": 0.027925431728363037, "learning_rate": 0.024000000208616257, "loss": 2.4171979427337646, "step": 9600 }, { "epoch": 0.4572380952380952, "grad_norm": 0.027668580412864685, "learning_rate": 0.024000000208616257, "loss": 2.393979787826538, "step": 9602 }, { "epoch": 0.4573333333333333, "grad_norm": 0.02744406647980213, "learning_rate": 0.024000000208616257, "loss": 2.402585506439209, "step": 9604 }, { "epoch": 0.4574285714285714, "grad_norm": 0.02696811594069004, "learning_rate": 0.024000000208616257, "loss": 2.420192241668701, "step": 9606 }, { "epoch": 0.4575238095238095, "grad_norm": 0.02883901633322239, "learning_rate": 0.024000000208616257, "loss": 2.4119696617126465, "step": 9608 }, { "epoch": 0.4576190476190476, "grad_norm": 0.027778422459959984, "learning_rate": 0.024000000208616257, "loss": 2.383331298828125, "step": 9610 }, { "epoch": 0.45771428571428574, "grad_norm": 0.03360723331570625, "learning_rate": 0.024000000208616257, "loss": 2.398616075515747, "step": 9612 }, { "epoch": 0.45780952380952383, "grad_norm": 0.028786320239305496, "learning_rate": 0.024000000208616257, "loss": 2.3967337608337402, "step": 9614 }, { "epoch": 0.4579047619047619, "grad_norm": 0.029972322285175323, "learning_rate": 0.024000000208616257, "loss": 2.3966898918151855, "step": 9616 }, { "epoch": 0.458, "grad_norm": 0.03117413818836212, "learning_rate": 0.024000000208616257, "loss": 2.4118895530700684, "step": 9618 }, { "epoch": 0.4580952380952381, "grad_norm": 0.031230362132191658, "learning_rate": 0.024000000208616257, "loss": 2.4379684925079346, "step": 9620 }, { "epoch": 0.4581904761904762, "grad_norm": 0.02990667335689068, "learning_rate": 0.024000000208616257, "loss": 2.4086246490478516, "step": 9622 }, { "epoch": 0.4582857142857143, "grad_norm": 0.028409266844391823, "learning_rate": 0.024000000208616257, "loss": 2.4185707569122314, "step": 9624 }, { "epoch": 0.4583809523809524, "grad_norm": 0.026928888633847237, "learning_rate": 0.024000000208616257, "loss": 2.405447483062744, "step": 9626 }, { "epoch": 0.4584761904761905, "grad_norm": 0.029845738783478737, "learning_rate": 0.024000000208616257, "loss": 2.4026927947998047, "step": 9628 }, { "epoch": 0.4585714285714286, "grad_norm": 0.028702422976493835, "learning_rate": 0.024000000208616257, "loss": 2.395643711090088, "step": 9630 }, { "epoch": 0.45866666666666667, "grad_norm": 0.027479980140924454, "learning_rate": 0.024000000208616257, "loss": 2.3961575031280518, "step": 9632 }, { "epoch": 0.45876190476190476, "grad_norm": 0.0297574233263731, "learning_rate": 0.024000000208616257, "loss": 2.3752875328063965, "step": 9634 }, { "epoch": 0.45885714285714285, "grad_norm": 0.02707689441740513, "learning_rate": 0.024000000208616257, "loss": 2.4272255897521973, "step": 9636 }, { "epoch": 0.45895238095238095, "grad_norm": 0.030102115124464035, "learning_rate": 0.024000000208616257, "loss": 2.4044361114501953, "step": 9638 }, { "epoch": 0.45904761904761904, "grad_norm": 0.029613139107823372, "learning_rate": 0.024000000208616257, "loss": 2.458073139190674, "step": 9640 }, { "epoch": 0.45914285714285713, "grad_norm": 0.0299572441726923, "learning_rate": 0.024000000208616257, "loss": 2.4113402366638184, "step": 9642 }, { "epoch": 0.4592380952380952, "grad_norm": 0.03133881464600563, "learning_rate": 0.024000000208616257, "loss": 2.3938775062561035, "step": 9644 }, { "epoch": 0.4593333333333333, "grad_norm": 0.027347762137651443, "learning_rate": 0.024000000208616257, "loss": 2.384188652038574, "step": 9646 }, { "epoch": 0.4594285714285714, "grad_norm": 0.027912719175219536, "learning_rate": 0.024000000208616257, "loss": 2.425873279571533, "step": 9648 }, { "epoch": 0.4595238095238095, "grad_norm": 0.029102273285388947, "learning_rate": 0.024000000208616257, "loss": 2.428652286529541, "step": 9650 }, { "epoch": 0.4596190476190476, "grad_norm": 0.028538865968585014, "learning_rate": 0.024000000208616257, "loss": 2.401113510131836, "step": 9652 }, { "epoch": 0.45971428571428574, "grad_norm": 0.02748601883649826, "learning_rate": 0.024000000208616257, "loss": 2.379128932952881, "step": 9654 }, { "epoch": 0.45980952380952383, "grad_norm": 0.028702300041913986, "learning_rate": 0.024000000208616257, "loss": 2.3759827613830566, "step": 9656 }, { "epoch": 0.4599047619047619, "grad_norm": 0.03286690637469292, "learning_rate": 0.024000000208616257, "loss": 2.3750624656677246, "step": 9658 }, { "epoch": 0.46, "grad_norm": 0.027432167902588844, "learning_rate": 0.024000000208616257, "loss": 2.4118542671203613, "step": 9660 }, { "epoch": 0.4600952380952381, "grad_norm": 0.0292705986648798, "learning_rate": 0.024000000208616257, "loss": 2.3827476501464844, "step": 9662 }, { "epoch": 0.4601904761904762, "grad_norm": 0.028063638135790825, "learning_rate": 0.024000000208616257, "loss": 2.441871166229248, "step": 9664 }, { "epoch": 0.4602857142857143, "grad_norm": 0.02958506904542446, "learning_rate": 0.024000000208616257, "loss": 2.412736415863037, "step": 9666 }, { "epoch": 0.4603809523809524, "grad_norm": 0.03151559457182884, "learning_rate": 0.024000000208616257, "loss": 2.479234218597412, "step": 9668 }, { "epoch": 0.4604761904761905, "grad_norm": 0.028072070330381393, "learning_rate": 0.024000000208616257, "loss": 2.4003896713256836, "step": 9670 }, { "epoch": 0.4605714285714286, "grad_norm": 0.028879625722765923, "learning_rate": 0.024000000208616257, "loss": 2.4045653343200684, "step": 9672 }, { "epoch": 0.46066666666666667, "grad_norm": 0.029464775696396828, "learning_rate": 0.024000000208616257, "loss": 2.4490318298339844, "step": 9674 }, { "epoch": 0.46076190476190476, "grad_norm": 0.02812976948916912, "learning_rate": 0.024000000208616257, "loss": 2.4104185104370117, "step": 9676 }, { "epoch": 0.46085714285714285, "grad_norm": 0.02979235164821148, "learning_rate": 0.024000000208616257, "loss": 2.389209032058716, "step": 9678 }, { "epoch": 0.46095238095238095, "grad_norm": 0.029084114357829094, "learning_rate": 0.024000000208616257, "loss": 2.3891959190368652, "step": 9680 }, { "epoch": 0.46104761904761904, "grad_norm": 0.026826409623026848, "learning_rate": 0.024000000208616257, "loss": 2.4062013626098633, "step": 9682 }, { "epoch": 0.46114285714285713, "grad_norm": 0.027682090178132057, "learning_rate": 0.024000000208616257, "loss": 2.3799524307250977, "step": 9684 }, { "epoch": 0.4612380952380952, "grad_norm": 0.030326949432492256, "learning_rate": 0.024000000208616257, "loss": 2.4147942066192627, "step": 9686 }, { "epoch": 0.4613333333333333, "grad_norm": 0.03130254149436951, "learning_rate": 0.024000000208616257, "loss": 2.3786330223083496, "step": 9688 }, { "epoch": 0.4614285714285714, "grad_norm": 0.03372962400317192, "learning_rate": 0.024000000208616257, "loss": 2.4513511657714844, "step": 9690 }, { "epoch": 0.4615238095238095, "grad_norm": 0.03526012971997261, "learning_rate": 0.024000000208616257, "loss": 2.427015542984009, "step": 9692 }, { "epoch": 0.4616190476190476, "grad_norm": 0.03287767618894577, "learning_rate": 0.024000000208616257, "loss": 2.454249858856201, "step": 9694 }, { "epoch": 0.4617142857142857, "grad_norm": 0.028745340183377266, "learning_rate": 0.024000000208616257, "loss": 2.4227333068847656, "step": 9696 }, { "epoch": 0.46180952380952384, "grad_norm": 0.029446735978126526, "learning_rate": 0.024000000208616257, "loss": 2.4186789989471436, "step": 9698 }, { "epoch": 0.46190476190476193, "grad_norm": 0.027752596884965897, "learning_rate": 0.024000000208616257, "loss": 2.4097514152526855, "step": 9700 }, { "epoch": 0.462, "grad_norm": 0.026990892365574837, "learning_rate": 0.024000000208616257, "loss": 2.4137215614318848, "step": 9702 }, { "epoch": 0.4620952380952381, "grad_norm": 0.027844766154885292, "learning_rate": 0.024000000208616257, "loss": 2.3930788040161133, "step": 9704 }, { "epoch": 0.4621904761904762, "grad_norm": 0.02752419002354145, "learning_rate": 0.024000000208616257, "loss": 2.410269021987915, "step": 9706 }, { "epoch": 0.4622857142857143, "grad_norm": 0.02817031927406788, "learning_rate": 0.024000000208616257, "loss": 2.3947248458862305, "step": 9708 }, { "epoch": 0.4623809523809524, "grad_norm": 0.03267033398151398, "learning_rate": 0.024000000208616257, "loss": 2.4106931686401367, "step": 9710 }, { "epoch": 0.4624761904761905, "grad_norm": 0.030359597876667976, "learning_rate": 0.024000000208616257, "loss": 2.4289374351501465, "step": 9712 }, { "epoch": 0.4625714285714286, "grad_norm": 0.028795715421438217, "learning_rate": 0.024000000208616257, "loss": 2.4231770038604736, "step": 9714 }, { "epoch": 0.46266666666666667, "grad_norm": 0.02912251465022564, "learning_rate": 0.024000000208616257, "loss": 2.4293136596679688, "step": 9716 }, { "epoch": 0.46276190476190476, "grad_norm": 0.03133673965930939, "learning_rate": 0.024000000208616257, "loss": 2.453528881072998, "step": 9718 }, { "epoch": 0.46285714285714286, "grad_norm": 0.027860889211297035, "learning_rate": 0.024000000208616257, "loss": 2.401860237121582, "step": 9720 }, { "epoch": 0.46295238095238095, "grad_norm": 0.030594371259212494, "learning_rate": 0.024000000208616257, "loss": 2.4490561485290527, "step": 9722 }, { "epoch": 0.46304761904761904, "grad_norm": 0.03640897572040558, "learning_rate": 0.024000000208616257, "loss": 2.3737952709198, "step": 9724 }, { "epoch": 0.46314285714285713, "grad_norm": 0.03470343351364136, "learning_rate": 0.024000000208616257, "loss": 2.4211573600769043, "step": 9726 }, { "epoch": 0.4632380952380952, "grad_norm": 0.0335831381380558, "learning_rate": 0.024000000208616257, "loss": 2.4340081214904785, "step": 9728 }, { "epoch": 0.4633333333333333, "grad_norm": 0.029743408784270287, "learning_rate": 0.024000000208616257, "loss": 2.4091577529907227, "step": 9730 }, { "epoch": 0.4634285714285714, "grad_norm": 0.028803130611777306, "learning_rate": 0.024000000208616257, "loss": 2.438840866088867, "step": 9732 }, { "epoch": 0.4635238095238095, "grad_norm": 0.02830471470952034, "learning_rate": 0.024000000208616257, "loss": 2.429544448852539, "step": 9734 }, { "epoch": 0.4636190476190476, "grad_norm": 0.028163528069853783, "learning_rate": 0.024000000208616257, "loss": 2.4075613021850586, "step": 9736 }, { "epoch": 0.4637142857142857, "grad_norm": 0.02927687205374241, "learning_rate": 0.024000000208616257, "loss": 2.4215495586395264, "step": 9738 }, { "epoch": 0.4638095238095238, "grad_norm": 0.030236592516303062, "learning_rate": 0.024000000208616257, "loss": 2.435542583465576, "step": 9740 }, { "epoch": 0.46390476190476193, "grad_norm": 0.02805175818502903, "learning_rate": 0.024000000208616257, "loss": 2.4077186584472656, "step": 9742 }, { "epoch": 0.464, "grad_norm": 0.027308957651257515, "learning_rate": 0.024000000208616257, "loss": 2.407886028289795, "step": 9744 }, { "epoch": 0.4640952380952381, "grad_norm": 0.028369860723614693, "learning_rate": 0.024000000208616257, "loss": 2.4117960929870605, "step": 9746 }, { "epoch": 0.4641904761904762, "grad_norm": 0.028459394350647926, "learning_rate": 0.024000000208616257, "loss": 2.421200752258301, "step": 9748 }, { "epoch": 0.4642857142857143, "grad_norm": 0.027553565800189972, "learning_rate": 0.024000000208616257, "loss": 2.419936418533325, "step": 9750 }, { "epoch": 0.4643809523809524, "grad_norm": 0.027798959985375404, "learning_rate": 0.024000000208616257, "loss": 2.433480739593506, "step": 9752 }, { "epoch": 0.4644761904761905, "grad_norm": 0.027961814776062965, "learning_rate": 0.024000000208616257, "loss": 2.393953561782837, "step": 9754 }, { "epoch": 0.4645714285714286, "grad_norm": 0.027384785935282707, "learning_rate": 0.024000000208616257, "loss": 2.4259464740753174, "step": 9756 }, { "epoch": 0.4646666666666667, "grad_norm": 0.032850634306669235, "learning_rate": 0.024000000208616257, "loss": 2.4124345779418945, "step": 9758 }, { "epoch": 0.46476190476190476, "grad_norm": 0.03907986357808113, "learning_rate": 0.024000000208616257, "loss": 2.381958246231079, "step": 9760 }, { "epoch": 0.46485714285714286, "grad_norm": 0.035401783883571625, "learning_rate": 0.024000000208616257, "loss": 2.4172120094299316, "step": 9762 }, { "epoch": 0.46495238095238095, "grad_norm": 0.028843175619840622, "learning_rate": 0.024000000208616257, "loss": 2.4277195930480957, "step": 9764 }, { "epoch": 0.46504761904761904, "grad_norm": 0.027424784377217293, "learning_rate": 0.024000000208616257, "loss": 2.4315013885498047, "step": 9766 }, { "epoch": 0.46514285714285714, "grad_norm": 0.0287105031311512, "learning_rate": 0.024000000208616257, "loss": 2.3974082469940186, "step": 9768 }, { "epoch": 0.46523809523809523, "grad_norm": 0.027529843151569366, "learning_rate": 0.024000000208616257, "loss": 2.394972801208496, "step": 9770 }, { "epoch": 0.4653333333333333, "grad_norm": 0.02898828312754631, "learning_rate": 0.024000000208616257, "loss": 2.4103245735168457, "step": 9772 }, { "epoch": 0.4654285714285714, "grad_norm": 0.02782541885972023, "learning_rate": 0.024000000208616257, "loss": 2.4231138229370117, "step": 9774 }, { "epoch": 0.4655238095238095, "grad_norm": 0.027290141209959984, "learning_rate": 0.024000000208616257, "loss": 2.3970236778259277, "step": 9776 }, { "epoch": 0.4656190476190476, "grad_norm": 0.0297524593770504, "learning_rate": 0.024000000208616257, "loss": 2.388180732727051, "step": 9778 }, { "epoch": 0.4657142857142857, "grad_norm": 0.027525220066308975, "learning_rate": 0.024000000208616257, "loss": 2.3948302268981934, "step": 9780 }, { "epoch": 0.4658095238095238, "grad_norm": 0.02752193622291088, "learning_rate": 0.024000000208616257, "loss": 2.3952696323394775, "step": 9782 }, { "epoch": 0.4659047619047619, "grad_norm": 0.026625387370586395, "learning_rate": 0.024000000208616257, "loss": 2.4264273643493652, "step": 9784 }, { "epoch": 0.466, "grad_norm": 0.02865925244987011, "learning_rate": 0.024000000208616257, "loss": 2.443699359893799, "step": 9786 }, { "epoch": 0.4660952380952381, "grad_norm": 0.028792914003133774, "learning_rate": 0.024000000208616257, "loss": 2.3822336196899414, "step": 9788 }, { "epoch": 0.4661904761904762, "grad_norm": 0.027698436751961708, "learning_rate": 0.024000000208616257, "loss": 2.384181022644043, "step": 9790 }, { "epoch": 0.4662857142857143, "grad_norm": 0.02840881422162056, "learning_rate": 0.024000000208616257, "loss": 2.404430389404297, "step": 9792 }, { "epoch": 0.4663809523809524, "grad_norm": 0.02724684588611126, "learning_rate": 0.024000000208616257, "loss": 2.428399085998535, "step": 9794 }, { "epoch": 0.4664761904761905, "grad_norm": 0.02851618267595768, "learning_rate": 0.024000000208616257, "loss": 2.3953495025634766, "step": 9796 }, { "epoch": 0.4665714285714286, "grad_norm": 0.027589641511440277, "learning_rate": 0.024000000208616257, "loss": 2.3903379440307617, "step": 9798 }, { "epoch": 0.4666666666666667, "grad_norm": 0.028072193264961243, "learning_rate": 0.024000000208616257, "loss": 2.3746042251586914, "step": 9800 }, { "epoch": 0.46676190476190477, "grad_norm": 0.02898465469479561, "learning_rate": 0.024000000208616257, "loss": 2.3924190998077393, "step": 9802 }, { "epoch": 0.46685714285714286, "grad_norm": 0.031229810789227486, "learning_rate": 0.024000000208616257, "loss": 2.421272039413452, "step": 9804 }, { "epoch": 0.46695238095238095, "grad_norm": 0.027267800644040108, "learning_rate": 0.024000000208616257, "loss": 2.4338417053222656, "step": 9806 }, { "epoch": 0.46704761904761904, "grad_norm": 0.027654821053147316, "learning_rate": 0.024000000208616257, "loss": 2.4098522663116455, "step": 9808 }, { "epoch": 0.46714285714285714, "grad_norm": 0.027849221602082253, "learning_rate": 0.024000000208616257, "loss": 2.3878118991851807, "step": 9810 }, { "epoch": 0.46723809523809523, "grad_norm": 0.0328669510781765, "learning_rate": 0.024000000208616257, "loss": 2.416998863220215, "step": 9812 }, { "epoch": 0.4673333333333333, "grad_norm": 0.02861207351088524, "learning_rate": 0.024000000208616257, "loss": 2.4045770168304443, "step": 9814 }, { "epoch": 0.4674285714285714, "grad_norm": 0.03166454657912254, "learning_rate": 0.024000000208616257, "loss": 2.421844482421875, "step": 9816 }, { "epoch": 0.4675238095238095, "grad_norm": 0.02635366842150688, "learning_rate": 0.024000000208616257, "loss": 2.4056246280670166, "step": 9818 }, { "epoch": 0.4676190476190476, "grad_norm": 0.026935560628771782, "learning_rate": 0.024000000208616257, "loss": 2.417201519012451, "step": 9820 }, { "epoch": 0.4677142857142857, "grad_norm": 0.026827208697795868, "learning_rate": 0.024000000208616257, "loss": 2.4266419410705566, "step": 9822 }, { "epoch": 0.4678095238095238, "grad_norm": 0.026519855484366417, "learning_rate": 0.024000000208616257, "loss": 2.419062614440918, "step": 9824 }, { "epoch": 0.4679047619047619, "grad_norm": 0.02895374409854412, "learning_rate": 0.024000000208616257, "loss": 2.371206521987915, "step": 9826 }, { "epoch": 0.468, "grad_norm": 0.028737282380461693, "learning_rate": 0.024000000208616257, "loss": 2.4006173610687256, "step": 9828 }, { "epoch": 0.4680952380952381, "grad_norm": 0.02778460457921028, "learning_rate": 0.024000000208616257, "loss": 2.4113423824310303, "step": 9830 }, { "epoch": 0.4681904761904762, "grad_norm": 0.02690371312201023, "learning_rate": 0.024000000208616257, "loss": 2.3814520835876465, "step": 9832 }, { "epoch": 0.4682857142857143, "grad_norm": 0.02867203764617443, "learning_rate": 0.024000000208616257, "loss": 2.4217982292175293, "step": 9834 }, { "epoch": 0.4683809523809524, "grad_norm": 0.027330975979566574, "learning_rate": 0.024000000208616257, "loss": 2.4113473892211914, "step": 9836 }, { "epoch": 0.4684761904761905, "grad_norm": 0.027006328105926514, "learning_rate": 0.024000000208616257, "loss": 2.419776439666748, "step": 9838 }, { "epoch": 0.4685714285714286, "grad_norm": 0.03005649521946907, "learning_rate": 0.024000000208616257, "loss": 2.379434823989868, "step": 9840 }, { "epoch": 0.4686666666666667, "grad_norm": 0.026849761605262756, "learning_rate": 0.024000000208616257, "loss": 2.3864314556121826, "step": 9842 }, { "epoch": 0.46876190476190477, "grad_norm": 0.028481347486376762, "learning_rate": 0.024000000208616257, "loss": 2.4037342071533203, "step": 9844 }, { "epoch": 0.46885714285714286, "grad_norm": 0.029926519840955734, "learning_rate": 0.024000000208616257, "loss": 2.397359848022461, "step": 9846 }, { "epoch": 0.46895238095238095, "grad_norm": 0.028411971405148506, "learning_rate": 0.024000000208616257, "loss": 2.3800208568573, "step": 9848 }, { "epoch": 0.46904761904761905, "grad_norm": 0.0330529659986496, "learning_rate": 0.024000000208616257, "loss": 2.4032797813415527, "step": 9850 }, { "epoch": 0.46914285714285714, "grad_norm": 0.027527455240488052, "learning_rate": 0.024000000208616257, "loss": 2.3597657680511475, "step": 9852 }, { "epoch": 0.46923809523809523, "grad_norm": 0.027093110606074333, "learning_rate": 0.024000000208616257, "loss": 2.4127449989318848, "step": 9854 }, { "epoch": 0.4693333333333333, "grad_norm": 0.029034392908215523, "learning_rate": 0.024000000208616257, "loss": 2.3762075901031494, "step": 9856 }, { "epoch": 0.4694285714285714, "grad_norm": 0.032121945172548294, "learning_rate": 0.024000000208616257, "loss": 2.3932600021362305, "step": 9858 }, { "epoch": 0.4695238095238095, "grad_norm": 0.027836289256811142, "learning_rate": 0.024000000208616257, "loss": 2.3958420753479004, "step": 9860 }, { "epoch": 0.4696190476190476, "grad_norm": 0.028180699795484543, "learning_rate": 0.024000000208616257, "loss": 2.400053024291992, "step": 9862 }, { "epoch": 0.4697142857142857, "grad_norm": 0.027426665648818016, "learning_rate": 0.024000000208616257, "loss": 2.4358956813812256, "step": 9864 }, { "epoch": 0.4698095238095238, "grad_norm": 0.028130456805229187, "learning_rate": 0.024000000208616257, "loss": 2.3990349769592285, "step": 9866 }, { "epoch": 0.4699047619047619, "grad_norm": 0.032637231051921844, "learning_rate": 0.024000000208616257, "loss": 2.393807888031006, "step": 9868 }, { "epoch": 0.47, "grad_norm": 0.030466215685009956, "learning_rate": 0.024000000208616257, "loss": 2.3856711387634277, "step": 9870 }, { "epoch": 0.4700952380952381, "grad_norm": 0.027393050491809845, "learning_rate": 0.024000000208616257, "loss": 2.3828086853027344, "step": 9872 }, { "epoch": 0.4701904761904762, "grad_norm": 0.027382301166653633, "learning_rate": 0.024000000208616257, "loss": 2.3785622119903564, "step": 9874 }, { "epoch": 0.4702857142857143, "grad_norm": 0.02788218855857849, "learning_rate": 0.024000000208616257, "loss": 2.3982553482055664, "step": 9876 }, { "epoch": 0.4703809523809524, "grad_norm": 0.027489084750413895, "learning_rate": 0.024000000208616257, "loss": 2.4008800983428955, "step": 9878 }, { "epoch": 0.4704761904761905, "grad_norm": 0.028329959139227867, "learning_rate": 0.024000000208616257, "loss": 2.4262378215789795, "step": 9880 }, { "epoch": 0.4705714285714286, "grad_norm": 0.02758204936981201, "learning_rate": 0.024000000208616257, "loss": 2.389723777770996, "step": 9882 }, { "epoch": 0.4706666666666667, "grad_norm": 0.02782687358558178, "learning_rate": 0.024000000208616257, "loss": 2.3845598697662354, "step": 9884 }, { "epoch": 0.47076190476190477, "grad_norm": 0.02746100351214409, "learning_rate": 0.024000000208616257, "loss": 2.407313346862793, "step": 9886 }, { "epoch": 0.47085714285714286, "grad_norm": 0.0273442342877388, "learning_rate": 0.024000000208616257, "loss": 2.3965110778808594, "step": 9888 }, { "epoch": 0.47095238095238096, "grad_norm": 0.026217283681035042, "learning_rate": 0.024000000208616257, "loss": 2.3792271614074707, "step": 9890 }, { "epoch": 0.47104761904761905, "grad_norm": 0.027188045904040337, "learning_rate": 0.024000000208616257, "loss": 2.3533053398132324, "step": 9892 }, { "epoch": 0.47114285714285714, "grad_norm": 0.02856392227113247, "learning_rate": 0.024000000208616257, "loss": 2.3813014030456543, "step": 9894 }, { "epoch": 0.47123809523809523, "grad_norm": 0.02760476805269718, "learning_rate": 0.024000000208616257, "loss": 2.389249563217163, "step": 9896 }, { "epoch": 0.4713333333333333, "grad_norm": 0.028427202254533768, "learning_rate": 0.024000000208616257, "loss": 2.4059650897979736, "step": 9898 }, { "epoch": 0.4714285714285714, "grad_norm": 0.028976406902074814, "learning_rate": 0.024000000208616257, "loss": 2.395256519317627, "step": 9900 }, { "epoch": 0.4715238095238095, "grad_norm": 0.029843473806977272, "learning_rate": 0.024000000208616257, "loss": 2.3877458572387695, "step": 9902 }, { "epoch": 0.4716190476190476, "grad_norm": 0.027722317725419998, "learning_rate": 0.024000000208616257, "loss": 2.384848117828369, "step": 9904 }, { "epoch": 0.4717142857142857, "grad_norm": 0.027992477640509605, "learning_rate": 0.024000000208616257, "loss": 2.38270902633667, "step": 9906 }, { "epoch": 0.4718095238095238, "grad_norm": 0.02803727239370346, "learning_rate": 0.024000000208616257, "loss": 2.3942718505859375, "step": 9908 }, { "epoch": 0.4719047619047619, "grad_norm": 0.03201549872756004, "learning_rate": 0.024000000208616257, "loss": 2.388650894165039, "step": 9910 }, { "epoch": 0.472, "grad_norm": 0.02901902049779892, "learning_rate": 0.024000000208616257, "loss": 2.3584015369415283, "step": 9912 }, { "epoch": 0.47209523809523807, "grad_norm": 0.028400003910064697, "learning_rate": 0.024000000208616257, "loss": 2.4226434230804443, "step": 9914 }, { "epoch": 0.4721904761904762, "grad_norm": 0.027030253782868385, "learning_rate": 0.024000000208616257, "loss": 2.382664203643799, "step": 9916 }, { "epoch": 0.4722857142857143, "grad_norm": 0.029758557677268982, "learning_rate": 0.024000000208616257, "loss": 2.3798375129699707, "step": 9918 }, { "epoch": 0.4723809523809524, "grad_norm": 0.026546809822320938, "learning_rate": 0.024000000208616257, "loss": 2.354029655456543, "step": 9920 }, { "epoch": 0.4724761904761905, "grad_norm": 0.029138777405023575, "learning_rate": 0.024000000208616257, "loss": 2.398613452911377, "step": 9922 }, { "epoch": 0.4725714285714286, "grad_norm": 0.029673699289560318, "learning_rate": 0.024000000208616257, "loss": 2.3799705505371094, "step": 9924 }, { "epoch": 0.4726666666666667, "grad_norm": 0.02682509459555149, "learning_rate": 0.024000000208616257, "loss": 2.3747687339782715, "step": 9926 }, { "epoch": 0.47276190476190477, "grad_norm": 0.03200381249189377, "learning_rate": 0.024000000208616257, "loss": 2.379835367202759, "step": 9928 }, { "epoch": 0.47285714285714286, "grad_norm": 0.028869330883026123, "learning_rate": 0.024000000208616257, "loss": 2.390997886657715, "step": 9930 }, { "epoch": 0.47295238095238096, "grad_norm": 0.026885351166129112, "learning_rate": 0.024000000208616257, "loss": 2.3756251335144043, "step": 9932 }, { "epoch": 0.47304761904761905, "grad_norm": 0.03048570826649666, "learning_rate": 0.024000000208616257, "loss": 2.404616117477417, "step": 9934 }, { "epoch": 0.47314285714285714, "grad_norm": 0.02878928929567337, "learning_rate": 0.024000000208616257, "loss": 2.4151835441589355, "step": 9936 }, { "epoch": 0.47323809523809524, "grad_norm": 0.028778493404388428, "learning_rate": 0.024000000208616257, "loss": 2.419722557067871, "step": 9938 }, { "epoch": 0.47333333333333333, "grad_norm": 0.02844041958451271, "learning_rate": 0.024000000208616257, "loss": 2.3810439109802246, "step": 9940 }, { "epoch": 0.4734285714285714, "grad_norm": 0.027770154178142548, "learning_rate": 0.024000000208616257, "loss": 2.4001097679138184, "step": 9942 }, { "epoch": 0.4735238095238095, "grad_norm": 0.032141733914613724, "learning_rate": 0.024000000208616257, "loss": 2.392026424407959, "step": 9944 }, { "epoch": 0.4736190476190476, "grad_norm": 0.029453713446855545, "learning_rate": 0.024000000208616257, "loss": 2.392915725708008, "step": 9946 }, { "epoch": 0.4737142857142857, "grad_norm": 0.03274424001574516, "learning_rate": 0.024000000208616257, "loss": 2.3759260177612305, "step": 9948 }, { "epoch": 0.4738095238095238, "grad_norm": 0.028404146432876587, "learning_rate": 0.024000000208616257, "loss": 2.410867214202881, "step": 9950 }, { "epoch": 0.4739047619047619, "grad_norm": 0.028306415304541588, "learning_rate": 0.024000000208616257, "loss": 2.3642899990081787, "step": 9952 }, { "epoch": 0.474, "grad_norm": 0.027273990213871002, "learning_rate": 0.024000000208616257, "loss": 2.398806095123291, "step": 9954 }, { "epoch": 0.47409523809523807, "grad_norm": 0.02936621755361557, "learning_rate": 0.024000000208616257, "loss": 2.3682875633239746, "step": 9956 }, { "epoch": 0.4741904761904762, "grad_norm": 0.030001014471054077, "learning_rate": 0.024000000208616257, "loss": 2.3932385444641113, "step": 9958 }, { "epoch": 0.4742857142857143, "grad_norm": 0.03024931624531746, "learning_rate": 0.024000000208616257, "loss": 2.4080052375793457, "step": 9960 }, { "epoch": 0.4743809523809524, "grad_norm": 0.031176205724477768, "learning_rate": 0.024000000208616257, "loss": 2.3820619583129883, "step": 9962 }, { "epoch": 0.4744761904761905, "grad_norm": 0.03262626752257347, "learning_rate": 0.024000000208616257, "loss": 2.384397506713867, "step": 9964 }, { "epoch": 0.4745714285714286, "grad_norm": 0.027785642072558403, "learning_rate": 0.024000000208616257, "loss": 2.401827573776245, "step": 9966 }, { "epoch": 0.4746666666666667, "grad_norm": 0.027613768354058266, "learning_rate": 0.024000000208616257, "loss": 2.385213851928711, "step": 9968 }, { "epoch": 0.4747619047619048, "grad_norm": 0.027302272617816925, "learning_rate": 0.024000000208616257, "loss": 2.390568733215332, "step": 9970 }, { "epoch": 0.47485714285714287, "grad_norm": 0.02754071354866028, "learning_rate": 0.024000000208616257, "loss": 2.3981831073760986, "step": 9972 }, { "epoch": 0.47495238095238096, "grad_norm": 0.02673739194869995, "learning_rate": 0.024000000208616257, "loss": 2.3774538040161133, "step": 9974 }, { "epoch": 0.47504761904761905, "grad_norm": 0.02807868830859661, "learning_rate": 0.024000000208616257, "loss": 2.4339356422424316, "step": 9976 }, { "epoch": 0.47514285714285714, "grad_norm": 0.02727210894227028, "learning_rate": 0.024000000208616257, "loss": 2.3717041015625, "step": 9978 }, { "epoch": 0.47523809523809524, "grad_norm": 0.028389863669872284, "learning_rate": 0.024000000208616257, "loss": 2.3940269947052, "step": 9980 }, { "epoch": 0.47533333333333333, "grad_norm": 0.02842022106051445, "learning_rate": 0.024000000208616257, "loss": 2.36936616897583, "step": 9982 }, { "epoch": 0.4754285714285714, "grad_norm": 0.028652695938944817, "learning_rate": 0.024000000208616257, "loss": 2.362590789794922, "step": 9984 }, { "epoch": 0.4755238095238095, "grad_norm": 0.027350710704922676, "learning_rate": 0.024000000208616257, "loss": 2.3770556449890137, "step": 9986 }, { "epoch": 0.4756190476190476, "grad_norm": 0.026875663548707962, "learning_rate": 0.024000000208616257, "loss": 2.4053473472595215, "step": 9988 }, { "epoch": 0.4757142857142857, "grad_norm": 0.02816944755613804, "learning_rate": 0.024000000208616257, "loss": 2.4024271965026855, "step": 9990 }, { "epoch": 0.4758095238095238, "grad_norm": 0.028403881937265396, "learning_rate": 0.024000000208616257, "loss": 2.41587495803833, "step": 9992 }, { "epoch": 0.4759047619047619, "grad_norm": 0.030948694795370102, "learning_rate": 0.024000000208616257, "loss": 2.3881754875183105, "step": 9994 }, { "epoch": 0.476, "grad_norm": 0.02736280858516693, "learning_rate": 0.024000000208616257, "loss": 2.379861354827881, "step": 9996 }, { "epoch": 0.47609523809523807, "grad_norm": 0.02905181795358658, "learning_rate": 0.024000000208616257, "loss": 2.409634590148926, "step": 9998 }, { "epoch": 0.47619047619047616, "grad_norm": 0.03448755666613579, "learning_rate": 0.024000000208616257, "loss": 2.362757682800293, "step": 10000 }, { "epoch": 0.4762857142857143, "grad_norm": 0.031099481508135796, "learning_rate": 0.024000000208616257, "loss": 2.395456552505493, "step": 10002 }, { "epoch": 0.4763809523809524, "grad_norm": 0.027221621945500374, "learning_rate": 0.024000000208616257, "loss": 2.387814998626709, "step": 10004 }, { "epoch": 0.4764761904761905, "grad_norm": 0.02771640755236149, "learning_rate": 0.024000000208616257, "loss": 2.414316415786743, "step": 10006 }, { "epoch": 0.4765714285714286, "grad_norm": 0.027244526892900467, "learning_rate": 0.024000000208616257, "loss": 2.3965513706207275, "step": 10008 }, { "epoch": 0.4766666666666667, "grad_norm": 0.026610156521201134, "learning_rate": 0.024000000208616257, "loss": 2.342679023742676, "step": 10010 }, { "epoch": 0.4767619047619048, "grad_norm": 0.02639857865869999, "learning_rate": 0.024000000208616257, "loss": 2.425063371658325, "step": 10012 }, { "epoch": 0.47685714285714287, "grad_norm": 0.03007633052766323, "learning_rate": 0.024000000208616257, "loss": 2.3571979999542236, "step": 10014 }, { "epoch": 0.47695238095238096, "grad_norm": 0.026919908821582794, "learning_rate": 0.024000000208616257, "loss": 2.397088050842285, "step": 10016 }, { "epoch": 0.47704761904761905, "grad_norm": 0.026890620589256287, "learning_rate": 0.024000000208616257, "loss": 2.3682713508605957, "step": 10018 }, { "epoch": 0.47714285714285715, "grad_norm": 0.027897093445062637, "learning_rate": 0.024000000208616257, "loss": 2.373136043548584, "step": 10020 }, { "epoch": 0.47723809523809524, "grad_norm": 0.02875993773341179, "learning_rate": 0.024000000208616257, "loss": 2.4095726013183594, "step": 10022 }, { "epoch": 0.47733333333333333, "grad_norm": 0.03217899054288864, "learning_rate": 0.024000000208616257, "loss": 2.41660475730896, "step": 10024 }, { "epoch": 0.4774285714285714, "grad_norm": 0.029196428135037422, "learning_rate": 0.024000000208616257, "loss": 2.349377155303955, "step": 10026 }, { "epoch": 0.4775238095238095, "grad_norm": 0.031200025230646133, "learning_rate": 0.024000000208616257, "loss": 2.3573763370513916, "step": 10028 }, { "epoch": 0.4776190476190476, "grad_norm": 0.03319297730922699, "learning_rate": 0.024000000208616257, "loss": 2.3980531692504883, "step": 10030 }, { "epoch": 0.4777142857142857, "grad_norm": 0.028772437945008278, "learning_rate": 0.024000000208616257, "loss": 2.3570303916931152, "step": 10032 }, { "epoch": 0.4778095238095238, "grad_norm": 0.029931947588920593, "learning_rate": 0.024000000208616257, "loss": 2.407946825027466, "step": 10034 }, { "epoch": 0.4779047619047619, "grad_norm": 0.027142351493239403, "learning_rate": 0.024000000208616257, "loss": 2.3768985271453857, "step": 10036 }, { "epoch": 0.478, "grad_norm": 0.02707965485751629, "learning_rate": 0.024000000208616257, "loss": 2.381023406982422, "step": 10038 }, { "epoch": 0.4780952380952381, "grad_norm": 0.02844320423901081, "learning_rate": 0.024000000208616257, "loss": 2.396423578262329, "step": 10040 }, { "epoch": 0.47819047619047617, "grad_norm": 0.02750728465616703, "learning_rate": 0.024000000208616257, "loss": 2.3781023025512695, "step": 10042 }, { "epoch": 0.47828571428571426, "grad_norm": 0.02619764767587185, "learning_rate": 0.024000000208616257, "loss": 2.3875579833984375, "step": 10044 }, { "epoch": 0.4783809523809524, "grad_norm": 0.02995794080197811, "learning_rate": 0.024000000208616257, "loss": 2.4066715240478516, "step": 10046 }, { "epoch": 0.4784761904761905, "grad_norm": 0.02667129784822464, "learning_rate": 0.024000000208616257, "loss": 2.3738455772399902, "step": 10048 }, { "epoch": 0.4785714285714286, "grad_norm": 0.027780622243881226, "learning_rate": 0.024000000208616257, "loss": 2.419355869293213, "step": 10050 }, { "epoch": 0.4786666666666667, "grad_norm": 0.027933992445468903, "learning_rate": 0.024000000208616257, "loss": 2.409144639968872, "step": 10052 }, { "epoch": 0.4787619047619048, "grad_norm": 0.02624589577317238, "learning_rate": 0.024000000208616257, "loss": 2.372213840484619, "step": 10054 }, { "epoch": 0.47885714285714287, "grad_norm": 0.030824007466435432, "learning_rate": 0.024000000208616257, "loss": 2.3850021362304688, "step": 10056 }, { "epoch": 0.47895238095238096, "grad_norm": 0.04975249618291855, "learning_rate": 0.024000000208616257, "loss": 2.3759756088256836, "step": 10058 }, { "epoch": 0.47904761904761906, "grad_norm": 0.02735336311161518, "learning_rate": 0.024000000208616257, "loss": 2.3726749420166016, "step": 10060 }, { "epoch": 0.47914285714285715, "grad_norm": 0.026581650599837303, "learning_rate": 0.024000000208616257, "loss": 2.390812873840332, "step": 10062 }, { "epoch": 0.47923809523809524, "grad_norm": 0.02958527021110058, "learning_rate": 0.024000000208616257, "loss": 2.380431652069092, "step": 10064 }, { "epoch": 0.47933333333333333, "grad_norm": 0.030373990535736084, "learning_rate": 0.024000000208616257, "loss": 2.3667640686035156, "step": 10066 }, { "epoch": 0.4794285714285714, "grad_norm": 0.027469443157315254, "learning_rate": 0.024000000208616257, "loss": 2.4038615226745605, "step": 10068 }, { "epoch": 0.4795238095238095, "grad_norm": 0.02719299867749214, "learning_rate": 0.024000000208616257, "loss": 2.342175006866455, "step": 10070 }, { "epoch": 0.4796190476190476, "grad_norm": 0.030503304675221443, "learning_rate": 0.024000000208616257, "loss": 2.378537893295288, "step": 10072 }, { "epoch": 0.4797142857142857, "grad_norm": 0.02689477801322937, "learning_rate": 0.024000000208616257, "loss": 2.346190929412842, "step": 10074 }, { "epoch": 0.4798095238095238, "grad_norm": 0.030311236158013344, "learning_rate": 0.024000000208616257, "loss": 2.3941919803619385, "step": 10076 }, { "epoch": 0.4799047619047619, "grad_norm": 0.027020586654543877, "learning_rate": 0.024000000208616257, "loss": 2.3604700565338135, "step": 10078 }, { "epoch": 0.48, "grad_norm": 0.029461253434419632, "learning_rate": 0.024000000208616257, "loss": 2.387509346008301, "step": 10080 }, { "epoch": 0.4800952380952381, "grad_norm": 0.026926415041089058, "learning_rate": 0.024000000208616257, "loss": 2.401183605194092, "step": 10082 }, { "epoch": 0.48019047619047617, "grad_norm": 0.02852713316679001, "learning_rate": 0.024000000208616257, "loss": 2.4117960929870605, "step": 10084 }, { "epoch": 0.48028571428571426, "grad_norm": 0.030431294813752174, "learning_rate": 0.024000000208616257, "loss": 2.3548054695129395, "step": 10086 }, { "epoch": 0.4803809523809524, "grad_norm": 0.03066428378224373, "learning_rate": 0.024000000208616257, "loss": 2.4255194664001465, "step": 10088 }, { "epoch": 0.4804761904761905, "grad_norm": 0.02827756106853485, "learning_rate": 0.024000000208616257, "loss": 2.3899855613708496, "step": 10090 }, { "epoch": 0.4805714285714286, "grad_norm": 0.02837781049311161, "learning_rate": 0.024000000208616257, "loss": 2.3861241340637207, "step": 10092 }, { "epoch": 0.4806666666666667, "grad_norm": 0.028624994680285454, "learning_rate": 0.024000000208616257, "loss": 2.380371570587158, "step": 10094 }, { "epoch": 0.4807619047619048, "grad_norm": 0.027287524193525314, "learning_rate": 0.024000000208616257, "loss": 2.3760323524475098, "step": 10096 }, { "epoch": 0.48085714285714287, "grad_norm": 0.027077743783593178, "learning_rate": 0.024000000208616257, "loss": 2.3969521522521973, "step": 10098 }, { "epoch": 0.48095238095238096, "grad_norm": 0.03918096795678139, "learning_rate": 0.024000000208616257, "loss": 2.387248992919922, "step": 10100 }, { "epoch": 0.48104761904761906, "grad_norm": 0.0328391008079052, "learning_rate": 0.024000000208616257, "loss": 2.3877406120300293, "step": 10102 }, { "epoch": 0.48114285714285715, "grad_norm": 0.03308192268013954, "learning_rate": 0.024000000208616257, "loss": 2.4203927516937256, "step": 10104 }, { "epoch": 0.48123809523809524, "grad_norm": 0.03151126205921173, "learning_rate": 0.024000000208616257, "loss": 2.4132914543151855, "step": 10106 }, { "epoch": 0.48133333333333334, "grad_norm": 0.028975995257496834, "learning_rate": 0.024000000208616257, "loss": 2.399506092071533, "step": 10108 }, { "epoch": 0.48142857142857143, "grad_norm": 0.027203459292650223, "learning_rate": 0.024000000208616257, "loss": 2.3901867866516113, "step": 10110 }, { "epoch": 0.4815238095238095, "grad_norm": 0.027612464502453804, "learning_rate": 0.024000000208616257, "loss": 2.3984010219573975, "step": 10112 }, { "epoch": 0.4816190476190476, "grad_norm": 0.029255075380206108, "learning_rate": 0.024000000208616257, "loss": 2.3870596885681152, "step": 10114 }, { "epoch": 0.4817142857142857, "grad_norm": 0.03142564743757248, "learning_rate": 0.024000000208616257, "loss": 2.385535478591919, "step": 10116 }, { "epoch": 0.4818095238095238, "grad_norm": 0.030324948951601982, "learning_rate": 0.024000000208616257, "loss": 2.3819799423217773, "step": 10118 }, { "epoch": 0.4819047619047619, "grad_norm": 0.033982809633016586, "learning_rate": 0.024000000208616257, "loss": 2.377683639526367, "step": 10120 }, { "epoch": 0.482, "grad_norm": 0.03045128472149372, "learning_rate": 0.024000000208616257, "loss": 2.392484426498413, "step": 10122 }, { "epoch": 0.4820952380952381, "grad_norm": 0.029974374920129776, "learning_rate": 0.024000000208616257, "loss": 2.3898448944091797, "step": 10124 }, { "epoch": 0.48219047619047617, "grad_norm": 0.03177972510457039, "learning_rate": 0.024000000208616257, "loss": 2.3759841918945312, "step": 10126 }, { "epoch": 0.48228571428571426, "grad_norm": 0.027963314205408096, "learning_rate": 0.024000000208616257, "loss": 2.384392261505127, "step": 10128 }, { "epoch": 0.48238095238095235, "grad_norm": 0.02714836224913597, "learning_rate": 0.024000000208616257, "loss": 2.3831257820129395, "step": 10130 }, { "epoch": 0.4824761904761905, "grad_norm": 0.02660280466079712, "learning_rate": 0.024000000208616257, "loss": 2.3647303581237793, "step": 10132 }, { "epoch": 0.4825714285714286, "grad_norm": 0.02706044539809227, "learning_rate": 0.024000000208616257, "loss": 2.371131420135498, "step": 10134 }, { "epoch": 0.4826666666666667, "grad_norm": 0.028194701299071312, "learning_rate": 0.024000000208616257, "loss": 2.4301764965057373, "step": 10136 }, { "epoch": 0.4827619047619048, "grad_norm": 0.028660066425800323, "learning_rate": 0.024000000208616257, "loss": 2.406299352645874, "step": 10138 }, { "epoch": 0.4828571428571429, "grad_norm": 0.02691282145678997, "learning_rate": 0.024000000208616257, "loss": 2.380547285079956, "step": 10140 }, { "epoch": 0.48295238095238097, "grad_norm": 0.02695193886756897, "learning_rate": 0.024000000208616257, "loss": 2.3613827228546143, "step": 10142 }, { "epoch": 0.48304761904761906, "grad_norm": 0.02665434591472149, "learning_rate": 0.024000000208616257, "loss": 2.342787742614746, "step": 10144 }, { "epoch": 0.48314285714285715, "grad_norm": 0.02689075842499733, "learning_rate": 0.024000000208616257, "loss": 2.4120121002197266, "step": 10146 }, { "epoch": 0.48323809523809524, "grad_norm": 0.02799226902425289, "learning_rate": 0.024000000208616257, "loss": 2.4122424125671387, "step": 10148 }, { "epoch": 0.48333333333333334, "grad_norm": 0.026937026530504227, "learning_rate": 0.024000000208616257, "loss": 2.4061670303344727, "step": 10150 }, { "epoch": 0.48342857142857143, "grad_norm": 0.027699975296854973, "learning_rate": 0.024000000208616257, "loss": 2.3900060653686523, "step": 10152 }, { "epoch": 0.4835238095238095, "grad_norm": 0.027510402724146843, "learning_rate": 0.024000000208616257, "loss": 2.4064788818359375, "step": 10154 }, { "epoch": 0.4836190476190476, "grad_norm": 0.027741950005292892, "learning_rate": 0.024000000208616257, "loss": 2.3524694442749023, "step": 10156 }, { "epoch": 0.4837142857142857, "grad_norm": 0.030192816630005836, "learning_rate": 0.024000000208616257, "loss": 2.3833401203155518, "step": 10158 }, { "epoch": 0.4838095238095238, "grad_norm": 0.03033248335123062, "learning_rate": 0.024000000208616257, "loss": 2.371107578277588, "step": 10160 }, { "epoch": 0.4839047619047619, "grad_norm": 0.02868136577308178, "learning_rate": 0.024000000208616257, "loss": 2.378054141998291, "step": 10162 }, { "epoch": 0.484, "grad_norm": 0.029922669753432274, "learning_rate": 0.024000000208616257, "loss": 2.414125919342041, "step": 10164 }, { "epoch": 0.4840952380952381, "grad_norm": 0.02896857261657715, "learning_rate": 0.024000000208616257, "loss": 2.3873491287231445, "step": 10166 }, { "epoch": 0.48419047619047617, "grad_norm": 0.03220432996749878, "learning_rate": 0.024000000208616257, "loss": 2.3905224800109863, "step": 10168 }, { "epoch": 0.48428571428571426, "grad_norm": 0.03295639529824257, "learning_rate": 0.024000000208616257, "loss": 2.3979153633117676, "step": 10170 }, { "epoch": 0.48438095238095236, "grad_norm": 0.028126195073127747, "learning_rate": 0.024000000208616257, "loss": 2.357306480407715, "step": 10172 }, { "epoch": 0.48447619047619045, "grad_norm": 0.027785276994109154, "learning_rate": 0.024000000208616257, "loss": 2.4028420448303223, "step": 10174 }, { "epoch": 0.4845714285714286, "grad_norm": 0.02644316479563713, "learning_rate": 0.024000000208616257, "loss": 2.3753714561462402, "step": 10176 }, { "epoch": 0.4846666666666667, "grad_norm": 0.028828473761677742, "learning_rate": 0.024000000208616257, "loss": 2.404844284057617, "step": 10178 }, { "epoch": 0.4847619047619048, "grad_norm": 0.02913374826312065, "learning_rate": 0.024000000208616257, "loss": 2.383476972579956, "step": 10180 }, { "epoch": 0.4848571428571429, "grad_norm": 0.028568962588906288, "learning_rate": 0.024000000208616257, "loss": 2.402207851409912, "step": 10182 }, { "epoch": 0.48495238095238097, "grad_norm": 0.029462585225701332, "learning_rate": 0.024000000208616257, "loss": 2.397925615310669, "step": 10184 }, { "epoch": 0.48504761904761906, "grad_norm": 0.027329323813319206, "learning_rate": 0.024000000208616257, "loss": 2.3756608963012695, "step": 10186 }, { "epoch": 0.48514285714285715, "grad_norm": 0.03061649203300476, "learning_rate": 0.024000000208616257, "loss": 2.3940064907073975, "step": 10188 }, { "epoch": 0.48523809523809525, "grad_norm": 0.029248856008052826, "learning_rate": 0.024000000208616257, "loss": 2.4057869911193848, "step": 10190 }, { "epoch": 0.48533333333333334, "grad_norm": 0.027735678479075432, "learning_rate": 0.024000000208616257, "loss": 2.398174285888672, "step": 10192 }, { "epoch": 0.48542857142857143, "grad_norm": 0.027309056371450424, "learning_rate": 0.024000000208616257, "loss": 2.4100871086120605, "step": 10194 }, { "epoch": 0.4855238095238095, "grad_norm": 0.029020974412560463, "learning_rate": 0.024000000208616257, "loss": 2.3965671062469482, "step": 10196 }, { "epoch": 0.4856190476190476, "grad_norm": 0.02876860275864601, "learning_rate": 0.024000000208616257, "loss": 2.414745807647705, "step": 10198 }, { "epoch": 0.4857142857142857, "grad_norm": 0.031795866787433624, "learning_rate": 0.024000000208616257, "loss": 2.4207489490509033, "step": 10200 }, { "epoch": 0.4858095238095238, "grad_norm": 0.029908791184425354, "learning_rate": 0.024000000208616257, "loss": 2.3889646530151367, "step": 10202 }, { "epoch": 0.4859047619047619, "grad_norm": 0.026536675170063972, "learning_rate": 0.024000000208616257, "loss": 2.4028429985046387, "step": 10204 }, { "epoch": 0.486, "grad_norm": 0.028548024594783783, "learning_rate": 0.024000000208616257, "loss": 2.395512104034424, "step": 10206 }, { "epoch": 0.4860952380952381, "grad_norm": 0.027985280379652977, "learning_rate": 0.024000000208616257, "loss": 2.376032829284668, "step": 10208 }, { "epoch": 0.4861904761904762, "grad_norm": 0.03454270213842392, "learning_rate": 0.024000000208616257, "loss": 2.400205612182617, "step": 10210 }, { "epoch": 0.48628571428571427, "grad_norm": 0.027781959623098373, "learning_rate": 0.024000000208616257, "loss": 2.3736801147460938, "step": 10212 }, { "epoch": 0.48638095238095236, "grad_norm": 0.028802137821912766, "learning_rate": 0.024000000208616257, "loss": 2.3977699279785156, "step": 10214 }, { "epoch": 0.48647619047619045, "grad_norm": 0.03047909587621689, "learning_rate": 0.024000000208616257, "loss": 2.4163975715637207, "step": 10216 }, { "epoch": 0.4865714285714286, "grad_norm": 0.02823873795568943, "learning_rate": 0.024000000208616257, "loss": 2.401578187942505, "step": 10218 }, { "epoch": 0.4866666666666667, "grad_norm": 0.029094893485307693, "learning_rate": 0.024000000208616257, "loss": 2.4045052528381348, "step": 10220 }, { "epoch": 0.4867619047619048, "grad_norm": 0.026411380618810654, "learning_rate": 0.024000000208616257, "loss": 2.4160115718841553, "step": 10222 }, { "epoch": 0.4868571428571429, "grad_norm": 0.027514252811670303, "learning_rate": 0.024000000208616257, "loss": 2.385097026824951, "step": 10224 }, { "epoch": 0.48695238095238097, "grad_norm": 0.02706778235733509, "learning_rate": 0.024000000208616257, "loss": 2.4313690662384033, "step": 10226 }, { "epoch": 0.48704761904761906, "grad_norm": 0.027516353875398636, "learning_rate": 0.024000000208616257, "loss": 2.4033517837524414, "step": 10228 }, { "epoch": 0.48714285714285716, "grad_norm": 0.02714160457253456, "learning_rate": 0.024000000208616257, "loss": 2.387263774871826, "step": 10230 }, { "epoch": 0.48723809523809525, "grad_norm": 0.02735537849366665, "learning_rate": 0.024000000208616257, "loss": 2.3928275108337402, "step": 10232 }, { "epoch": 0.48733333333333334, "grad_norm": 0.02976968325674534, "learning_rate": 0.024000000208616257, "loss": 2.401752233505249, "step": 10234 }, { "epoch": 0.48742857142857143, "grad_norm": 0.02955271489918232, "learning_rate": 0.024000000208616257, "loss": 2.408371925354004, "step": 10236 }, { "epoch": 0.4875238095238095, "grad_norm": 0.026625744998455048, "learning_rate": 0.024000000208616257, "loss": 2.378131866455078, "step": 10238 }, { "epoch": 0.4876190476190476, "grad_norm": 0.02860495261847973, "learning_rate": 0.024000000208616257, "loss": 2.402113914489746, "step": 10240 }, { "epoch": 0.4877142857142857, "grad_norm": 0.02826939895749092, "learning_rate": 0.024000000208616257, "loss": 2.3969550132751465, "step": 10242 }, { "epoch": 0.4878095238095238, "grad_norm": 0.0305863656103611, "learning_rate": 0.024000000208616257, "loss": 2.4257216453552246, "step": 10244 }, { "epoch": 0.4879047619047619, "grad_norm": 0.02695903554558754, "learning_rate": 0.024000000208616257, "loss": 2.438490867614746, "step": 10246 }, { "epoch": 0.488, "grad_norm": 0.030944058671593666, "learning_rate": 0.024000000208616257, "loss": 2.389352321624756, "step": 10248 }, { "epoch": 0.4880952380952381, "grad_norm": 0.03132271021604538, "learning_rate": 0.024000000208616257, "loss": 2.4251255989074707, "step": 10250 }, { "epoch": 0.4881904761904762, "grad_norm": 0.030158884823322296, "learning_rate": 0.024000000208616257, "loss": 2.409162759780884, "step": 10252 }, { "epoch": 0.48828571428571427, "grad_norm": 0.03210701048374176, "learning_rate": 0.024000000208616257, "loss": 2.401486396789551, "step": 10254 }, { "epoch": 0.48838095238095236, "grad_norm": 0.028029276058077812, "learning_rate": 0.024000000208616257, "loss": 2.3880395889282227, "step": 10256 }, { "epoch": 0.48847619047619045, "grad_norm": 0.02785279043018818, "learning_rate": 0.024000000208616257, "loss": 2.3978278636932373, "step": 10258 }, { "epoch": 0.48857142857142855, "grad_norm": 0.02776709757745266, "learning_rate": 0.024000000208616257, "loss": 2.4327378273010254, "step": 10260 }, { "epoch": 0.4886666666666667, "grad_norm": 0.029374267905950546, "learning_rate": 0.024000000208616257, "loss": 2.414071798324585, "step": 10262 }, { "epoch": 0.4887619047619048, "grad_norm": 0.02675914205610752, "learning_rate": 0.024000000208616257, "loss": 2.4138622283935547, "step": 10264 }, { "epoch": 0.4888571428571429, "grad_norm": 0.02667129784822464, "learning_rate": 0.024000000208616257, "loss": 2.4251785278320312, "step": 10266 }, { "epoch": 0.48895238095238097, "grad_norm": 0.029442772269248962, "learning_rate": 0.024000000208616257, "loss": 2.3709793090820312, "step": 10268 }, { "epoch": 0.48904761904761906, "grad_norm": 0.02904820814728737, "learning_rate": 0.024000000208616257, "loss": 2.3844997882843018, "step": 10270 }, { "epoch": 0.48914285714285716, "grad_norm": 0.02770475670695305, "learning_rate": 0.024000000208616257, "loss": 2.399033784866333, "step": 10272 }, { "epoch": 0.48923809523809525, "grad_norm": 0.02684980444610119, "learning_rate": 0.024000000208616257, "loss": 2.425713062286377, "step": 10274 }, { "epoch": 0.48933333333333334, "grad_norm": 0.029651954770088196, "learning_rate": 0.024000000208616257, "loss": 2.402139663696289, "step": 10276 }, { "epoch": 0.48942857142857144, "grad_norm": 0.028704963624477386, "learning_rate": 0.024000000208616257, "loss": 2.4109303951263428, "step": 10278 }, { "epoch": 0.4895238095238095, "grad_norm": 0.02856304869055748, "learning_rate": 0.024000000208616257, "loss": 2.4044077396392822, "step": 10280 }, { "epoch": 0.4896190476190476, "grad_norm": 0.030733058229088783, "learning_rate": 0.024000000208616257, "loss": 2.3972554206848145, "step": 10282 }, { "epoch": 0.4897142857142857, "grad_norm": 0.026952063664793968, "learning_rate": 0.024000000208616257, "loss": 2.396864891052246, "step": 10284 }, { "epoch": 0.4898095238095238, "grad_norm": 0.027185404673218727, "learning_rate": 0.024000000208616257, "loss": 2.4050590991973877, "step": 10286 }, { "epoch": 0.4899047619047619, "grad_norm": 0.02783147059381008, "learning_rate": 0.024000000208616257, "loss": 2.393479824066162, "step": 10288 }, { "epoch": 0.49, "grad_norm": 0.027866318821907043, "learning_rate": 0.024000000208616257, "loss": 2.399815082550049, "step": 10290 }, { "epoch": 0.4900952380952381, "grad_norm": 0.030500713735818863, "learning_rate": 0.024000000208616257, "loss": 2.4170444011688232, "step": 10292 }, { "epoch": 0.4901904761904762, "grad_norm": 0.02655445598065853, "learning_rate": 0.024000000208616257, "loss": 2.392690658569336, "step": 10294 }, { "epoch": 0.49028571428571427, "grad_norm": 0.02892918512225151, "learning_rate": 0.024000000208616257, "loss": 2.412971258163452, "step": 10296 }, { "epoch": 0.49038095238095236, "grad_norm": 0.027988040819764137, "learning_rate": 0.024000000208616257, "loss": 2.409470558166504, "step": 10298 }, { "epoch": 0.49047619047619045, "grad_norm": 0.02809884026646614, "learning_rate": 0.024000000208616257, "loss": 2.3994412422180176, "step": 10300 }, { "epoch": 0.49057142857142855, "grad_norm": 0.027279235422611237, "learning_rate": 0.024000000208616257, "loss": 2.3706302642822266, "step": 10302 }, { "epoch": 0.49066666666666664, "grad_norm": 0.02656668983399868, "learning_rate": 0.024000000208616257, "loss": 2.386965751647949, "step": 10304 }, { "epoch": 0.4907619047619048, "grad_norm": 0.029105477035045624, "learning_rate": 0.024000000208616257, "loss": 2.4173858165740967, "step": 10306 }, { "epoch": 0.4908571428571429, "grad_norm": 0.035119518637657166, "learning_rate": 0.024000000208616257, "loss": 2.3865482807159424, "step": 10308 }, { "epoch": 0.490952380952381, "grad_norm": 0.03714201971888542, "learning_rate": 0.024000000208616257, "loss": 2.4167704582214355, "step": 10310 }, { "epoch": 0.49104761904761907, "grad_norm": 0.029136816039681435, "learning_rate": 0.024000000208616257, "loss": 2.3885631561279297, "step": 10312 }, { "epoch": 0.49114285714285716, "grad_norm": 0.027419190853834152, "learning_rate": 0.024000000208616257, "loss": 2.3931968212127686, "step": 10314 }, { "epoch": 0.49123809523809525, "grad_norm": 0.026709571480751038, "learning_rate": 0.024000000208616257, "loss": 2.414834499359131, "step": 10316 }, { "epoch": 0.49133333333333334, "grad_norm": 0.0270709041506052, "learning_rate": 0.024000000208616257, "loss": 2.409512996673584, "step": 10318 }, { "epoch": 0.49142857142857144, "grad_norm": 0.027681641280651093, "learning_rate": 0.024000000208616257, "loss": 2.4084997177124023, "step": 10320 }, { "epoch": 0.49152380952380953, "grad_norm": 0.026396803557872772, "learning_rate": 0.024000000208616257, "loss": 2.4036223888397217, "step": 10322 }, { "epoch": 0.4916190476190476, "grad_norm": 0.02638797089457512, "learning_rate": 0.024000000208616257, "loss": 2.4137895107269287, "step": 10324 }, { "epoch": 0.4917142857142857, "grad_norm": 0.027811702340841293, "learning_rate": 0.024000000208616257, "loss": 2.4262070655822754, "step": 10326 }, { "epoch": 0.4918095238095238, "grad_norm": 0.02686273120343685, "learning_rate": 0.024000000208616257, "loss": 2.3962628841400146, "step": 10328 }, { "epoch": 0.4919047619047619, "grad_norm": 0.025733133777976036, "learning_rate": 0.024000000208616257, "loss": 2.3780581951141357, "step": 10330 }, { "epoch": 0.492, "grad_norm": 0.027483344078063965, "learning_rate": 0.024000000208616257, "loss": 2.391854763031006, "step": 10332 }, { "epoch": 0.4920952380952381, "grad_norm": 0.02856365405023098, "learning_rate": 0.024000000208616257, "loss": 2.418821334838867, "step": 10334 }, { "epoch": 0.4921904761904762, "grad_norm": 0.027196187525987625, "learning_rate": 0.024000000208616257, "loss": 2.3839521408081055, "step": 10336 }, { "epoch": 0.49228571428571427, "grad_norm": 0.02654234506189823, "learning_rate": 0.024000000208616257, "loss": 2.3845396041870117, "step": 10338 }, { "epoch": 0.49238095238095236, "grad_norm": 0.027982456609606743, "learning_rate": 0.024000000208616257, "loss": 2.3854191303253174, "step": 10340 }, { "epoch": 0.49247619047619046, "grad_norm": 0.028073176741600037, "learning_rate": 0.024000000208616257, "loss": 2.406831979751587, "step": 10342 }, { "epoch": 0.49257142857142855, "grad_norm": 0.028383901342749596, "learning_rate": 0.024000000208616257, "loss": 2.4148969650268555, "step": 10344 }, { "epoch": 0.49266666666666664, "grad_norm": 0.03246552497148514, "learning_rate": 0.024000000208616257, "loss": 2.408151388168335, "step": 10346 }, { "epoch": 0.49276190476190473, "grad_norm": 0.02916114032268524, "learning_rate": 0.024000000208616257, "loss": 2.3920297622680664, "step": 10348 }, { "epoch": 0.4928571428571429, "grad_norm": 0.029290588572621346, "learning_rate": 0.024000000208616257, "loss": 2.4164390563964844, "step": 10350 }, { "epoch": 0.492952380952381, "grad_norm": 0.027892330661416054, "learning_rate": 0.024000000208616257, "loss": 2.407414436340332, "step": 10352 }, { "epoch": 0.49304761904761907, "grad_norm": 0.029612164944410324, "learning_rate": 0.024000000208616257, "loss": 2.380706548690796, "step": 10354 }, { "epoch": 0.49314285714285716, "grad_norm": 0.02719537727534771, "learning_rate": 0.024000000208616257, "loss": 2.417814254760742, "step": 10356 }, { "epoch": 0.49323809523809525, "grad_norm": 0.028703797608613968, "learning_rate": 0.024000000208616257, "loss": 2.422257900238037, "step": 10358 }, { "epoch": 0.49333333333333335, "grad_norm": 0.026958374306559563, "learning_rate": 0.024000000208616257, "loss": 2.3758392333984375, "step": 10360 }, { "epoch": 0.49342857142857144, "grad_norm": 0.028875578194856644, "learning_rate": 0.024000000208616257, "loss": 2.4475560188293457, "step": 10362 }, { "epoch": 0.49352380952380953, "grad_norm": 0.02690201997756958, "learning_rate": 0.024000000208616257, "loss": 2.4166336059570312, "step": 10364 }, { "epoch": 0.4936190476190476, "grad_norm": 0.032832592725753784, "learning_rate": 0.024000000208616257, "loss": 2.4439778327941895, "step": 10366 }, { "epoch": 0.4937142857142857, "grad_norm": 0.03506319597363472, "learning_rate": 0.024000000208616257, "loss": 2.421558380126953, "step": 10368 }, { "epoch": 0.4938095238095238, "grad_norm": 0.030999988317489624, "learning_rate": 0.024000000208616257, "loss": 2.4165844917297363, "step": 10370 }, { "epoch": 0.4939047619047619, "grad_norm": 0.027687108144164085, "learning_rate": 0.024000000208616257, "loss": 2.4129018783569336, "step": 10372 }, { "epoch": 0.494, "grad_norm": 0.02860761620104313, "learning_rate": 0.024000000208616257, "loss": 2.415283203125, "step": 10374 }, { "epoch": 0.4940952380952381, "grad_norm": 0.02786959707736969, "learning_rate": 0.024000000208616257, "loss": 2.4275870323181152, "step": 10376 }, { "epoch": 0.4941904761904762, "grad_norm": 0.027879640460014343, "learning_rate": 0.024000000208616257, "loss": 2.408388376235962, "step": 10378 }, { "epoch": 0.4942857142857143, "grad_norm": 0.02761046215891838, "learning_rate": 0.024000000208616257, "loss": 2.404641628265381, "step": 10380 }, { "epoch": 0.49438095238095237, "grad_norm": 0.03297905996441841, "learning_rate": 0.024000000208616257, "loss": 2.403665781021118, "step": 10382 }, { "epoch": 0.49447619047619046, "grad_norm": 0.030208664014935493, "learning_rate": 0.024000000208616257, "loss": 2.4113972187042236, "step": 10384 }, { "epoch": 0.49457142857142855, "grad_norm": 0.02959398739039898, "learning_rate": 0.024000000208616257, "loss": 2.3691420555114746, "step": 10386 }, { "epoch": 0.49466666666666664, "grad_norm": 0.027961058542132378, "learning_rate": 0.024000000208616257, "loss": 2.4214978218078613, "step": 10388 }, { "epoch": 0.49476190476190474, "grad_norm": 0.027629004791378975, "learning_rate": 0.024000000208616257, "loss": 2.3918569087982178, "step": 10390 }, { "epoch": 0.4948571428571429, "grad_norm": 0.027133813127875328, "learning_rate": 0.024000000208616257, "loss": 2.405062198638916, "step": 10392 }, { "epoch": 0.494952380952381, "grad_norm": 0.030379289761185646, "learning_rate": 0.024000000208616257, "loss": 2.426683187484741, "step": 10394 }, { "epoch": 0.49504761904761907, "grad_norm": 0.03137844428420067, "learning_rate": 0.024000000208616257, "loss": 2.426130533218384, "step": 10396 }, { "epoch": 0.49514285714285716, "grad_norm": 0.02916034683585167, "learning_rate": 0.024000000208616257, "loss": 2.409576177597046, "step": 10398 }, { "epoch": 0.49523809523809526, "grad_norm": 0.02724851481616497, "learning_rate": 0.024000000208616257, "loss": 2.4183645248413086, "step": 10400 }, { "epoch": 0.49533333333333335, "grad_norm": 0.02891296148300171, "learning_rate": 0.024000000208616257, "loss": 2.4351041316986084, "step": 10402 }, { "epoch": 0.49542857142857144, "grad_norm": 0.0291142575442791, "learning_rate": 0.024000000208616257, "loss": 2.399219036102295, "step": 10404 }, { "epoch": 0.49552380952380953, "grad_norm": 0.031118957325816154, "learning_rate": 0.024000000208616257, "loss": 2.4014697074890137, "step": 10406 }, { "epoch": 0.4956190476190476, "grad_norm": 0.03247349336743355, "learning_rate": 0.024000000208616257, "loss": 2.4389960765838623, "step": 10408 }, { "epoch": 0.4957142857142857, "grad_norm": 0.030827339738607407, "learning_rate": 0.024000000208616257, "loss": 2.4184679985046387, "step": 10410 }, { "epoch": 0.4958095238095238, "grad_norm": 0.02871031127870083, "learning_rate": 0.024000000208616257, "loss": 2.4270668029785156, "step": 10412 }, { "epoch": 0.4959047619047619, "grad_norm": 0.029219098389148712, "learning_rate": 0.024000000208616257, "loss": 2.408916473388672, "step": 10414 }, { "epoch": 0.496, "grad_norm": 0.03297557309269905, "learning_rate": 0.024000000208616257, "loss": 2.434946298599243, "step": 10416 }, { "epoch": 0.4960952380952381, "grad_norm": 0.035917554050683975, "learning_rate": 0.024000000208616257, "loss": 2.414741039276123, "step": 10418 }, { "epoch": 0.4961904761904762, "grad_norm": 0.03540509566664696, "learning_rate": 0.024000000208616257, "loss": 2.4252724647521973, "step": 10420 }, { "epoch": 0.4962857142857143, "grad_norm": 0.03094058856368065, "learning_rate": 0.024000000208616257, "loss": 2.427158832550049, "step": 10422 }, { "epoch": 0.49638095238095237, "grad_norm": 0.03339220583438873, "learning_rate": 0.024000000208616257, "loss": 2.390956401824951, "step": 10424 }, { "epoch": 0.49647619047619046, "grad_norm": 0.031154071912169456, "learning_rate": 0.024000000208616257, "loss": 2.39162540435791, "step": 10426 }, { "epoch": 0.49657142857142855, "grad_norm": 0.031000295653939247, "learning_rate": 0.024000000208616257, "loss": 2.392042636871338, "step": 10428 }, { "epoch": 0.49666666666666665, "grad_norm": 0.0329836867749691, "learning_rate": 0.024000000208616257, "loss": 2.416778087615967, "step": 10430 }, { "epoch": 0.49676190476190474, "grad_norm": 0.02694794535636902, "learning_rate": 0.024000000208616257, "loss": 2.4058566093444824, "step": 10432 }, { "epoch": 0.49685714285714283, "grad_norm": 0.028465168550610542, "learning_rate": 0.024000000208616257, "loss": 2.4282660484313965, "step": 10434 }, { "epoch": 0.496952380952381, "grad_norm": 0.027982857078313828, "learning_rate": 0.024000000208616257, "loss": 2.408712148666382, "step": 10436 }, { "epoch": 0.49704761904761907, "grad_norm": 0.027554618194699287, "learning_rate": 0.024000000208616257, "loss": 2.438115119934082, "step": 10438 }, { "epoch": 0.49714285714285716, "grad_norm": 0.027580024674534798, "learning_rate": 0.024000000208616257, "loss": 2.410701274871826, "step": 10440 }, { "epoch": 0.49723809523809526, "grad_norm": 0.026654459536075592, "learning_rate": 0.024000000208616257, "loss": 2.4243993759155273, "step": 10442 }, { "epoch": 0.49733333333333335, "grad_norm": 0.026882920414209366, "learning_rate": 0.024000000208616257, "loss": 2.418551445007324, "step": 10444 }, { "epoch": 0.49742857142857144, "grad_norm": 0.027907835319638252, "learning_rate": 0.024000000208616257, "loss": 2.4145541191101074, "step": 10446 }, { "epoch": 0.49752380952380953, "grad_norm": 0.02723315916955471, "learning_rate": 0.024000000208616257, "loss": 2.4320261478424072, "step": 10448 }, { "epoch": 0.4976190476190476, "grad_norm": 0.029031608253717422, "learning_rate": 0.024000000208616257, "loss": 2.4340081214904785, "step": 10450 }, { "epoch": 0.4977142857142857, "grad_norm": 0.028427282348275185, "learning_rate": 0.024000000208616257, "loss": 2.411557197570801, "step": 10452 }, { "epoch": 0.4978095238095238, "grad_norm": 0.027455875650048256, "learning_rate": 0.024000000208616257, "loss": 2.4289140701293945, "step": 10454 }, { "epoch": 0.4979047619047619, "grad_norm": 0.026953013613820076, "learning_rate": 0.024000000208616257, "loss": 2.3944435119628906, "step": 10456 }, { "epoch": 0.498, "grad_norm": 0.026954088360071182, "learning_rate": 0.024000000208616257, "loss": 2.399995803833008, "step": 10458 }, { "epoch": 0.4980952380952381, "grad_norm": 0.026730768382549286, "learning_rate": 0.024000000208616257, "loss": 2.4306483268737793, "step": 10460 }, { "epoch": 0.4981904761904762, "grad_norm": 0.028138939291238785, "learning_rate": 0.024000000208616257, "loss": 2.4385855197906494, "step": 10462 }, { "epoch": 0.4982857142857143, "grad_norm": 0.03093055635690689, "learning_rate": 0.024000000208616257, "loss": 2.465585708618164, "step": 10464 }, { "epoch": 0.49838095238095237, "grad_norm": 0.0323898047208786, "learning_rate": 0.024000000208616257, "loss": 2.4489054679870605, "step": 10466 }, { "epoch": 0.49847619047619046, "grad_norm": 0.02801920287311077, "learning_rate": 0.024000000208616257, "loss": 2.419431209564209, "step": 10468 }, { "epoch": 0.49857142857142855, "grad_norm": 0.029940670356154442, "learning_rate": 0.024000000208616257, "loss": 2.4624452590942383, "step": 10470 }, { "epoch": 0.49866666666666665, "grad_norm": 0.028959928080439568, "learning_rate": 0.024000000208616257, "loss": 2.4016637802124023, "step": 10472 }, { "epoch": 0.49876190476190474, "grad_norm": 0.027238398790359497, "learning_rate": 0.024000000208616257, "loss": 2.417938709259033, "step": 10474 }, { "epoch": 0.49885714285714283, "grad_norm": 0.026756426319479942, "learning_rate": 0.024000000208616257, "loss": 2.4164299964904785, "step": 10476 }, { "epoch": 0.4989523809523809, "grad_norm": 0.026669859886169434, "learning_rate": 0.024000000208616257, "loss": 2.4323248863220215, "step": 10478 }, { "epoch": 0.4990476190476191, "grad_norm": 0.025992702692747116, "learning_rate": 0.024000000208616257, "loss": 2.4506709575653076, "step": 10480 }, { "epoch": 0.49914285714285717, "grad_norm": 0.027653198689222336, "learning_rate": 0.024000000208616257, "loss": 2.4417662620544434, "step": 10482 }, { "epoch": 0.49923809523809526, "grad_norm": 0.026910757645964622, "learning_rate": 0.024000000208616257, "loss": 2.402069568634033, "step": 10484 }, { "epoch": 0.49933333333333335, "grad_norm": 0.0285795871168375, "learning_rate": 0.024000000208616257, "loss": 2.4389047622680664, "step": 10486 }, { "epoch": 0.49942857142857144, "grad_norm": 0.02746466174721718, "learning_rate": 0.024000000208616257, "loss": 2.453268527984619, "step": 10488 }, { "epoch": 0.49952380952380954, "grad_norm": 0.027365917339920998, "learning_rate": 0.024000000208616257, "loss": 2.430497646331787, "step": 10490 }, { "epoch": 0.49961904761904763, "grad_norm": 0.027393141761422157, "learning_rate": 0.024000000208616257, "loss": 2.4256608486175537, "step": 10492 }, { "epoch": 0.4997142857142857, "grad_norm": 0.027603358030319214, "learning_rate": 0.024000000208616257, "loss": 2.412686824798584, "step": 10494 }, { "epoch": 0.4998095238095238, "grad_norm": 0.026735549792647362, "learning_rate": 0.024000000208616257, "loss": 2.4485809803009033, "step": 10496 }, { "epoch": 0.4999047619047619, "grad_norm": 0.02984875626862049, "learning_rate": 0.024000000208616257, "loss": 2.4758517742156982, "step": 10498 }, { "epoch": 0.5, "grad_norm": 0.030420610681176186, "learning_rate": 0.024000000208616257, "loss": 2.4374406337738037, "step": 10500 }, { "epoch": 0.5000952380952381, "grad_norm": 0.030204081907868385, "learning_rate": 0.024000000208616257, "loss": 2.4060349464416504, "step": 10502 }, { "epoch": 0.5001904761904762, "grad_norm": 0.027147255837917328, "learning_rate": 0.024000000208616257, "loss": 2.4491779804229736, "step": 10504 }, { "epoch": 0.5002857142857143, "grad_norm": 0.03571924939751625, "learning_rate": 0.024000000208616257, "loss": 2.43693208694458, "step": 10506 }, { "epoch": 0.5003809523809524, "grad_norm": 0.03682103380560875, "learning_rate": 0.024000000208616257, "loss": 2.4619345664978027, "step": 10508 }, { "epoch": 0.5004761904761905, "grad_norm": 0.02838040329515934, "learning_rate": 0.024000000208616257, "loss": 2.4433932304382324, "step": 10510 }, { "epoch": 0.5005714285714286, "grad_norm": 0.027335135266184807, "learning_rate": 0.024000000208616257, "loss": 2.4327163696289062, "step": 10512 }, { "epoch": 0.5006666666666667, "grad_norm": 0.029031334444880486, "learning_rate": 0.024000000208616257, "loss": 2.4532408714294434, "step": 10514 }, { "epoch": 0.5007619047619047, "grad_norm": 0.031321391463279724, "learning_rate": 0.024000000208616257, "loss": 2.4431686401367188, "step": 10516 }, { "epoch": 0.5008571428571429, "grad_norm": 0.03142645210027695, "learning_rate": 0.024000000208616257, "loss": 2.428006649017334, "step": 10518 }, { "epoch": 0.5009523809523809, "grad_norm": 0.03014472685754299, "learning_rate": 0.024000000208616257, "loss": 2.4350976943969727, "step": 10520 }, { "epoch": 0.5010476190476191, "grad_norm": 0.02793862484395504, "learning_rate": 0.024000000208616257, "loss": 2.4364380836486816, "step": 10522 }, { "epoch": 0.5011428571428571, "grad_norm": 0.02991153672337532, "learning_rate": 0.024000000208616257, "loss": 2.458343982696533, "step": 10524 }, { "epoch": 0.5012380952380953, "grad_norm": 0.02777714841067791, "learning_rate": 0.024000000208616257, "loss": 2.437988758087158, "step": 10526 }, { "epoch": 0.5013333333333333, "grad_norm": 0.027824705466628075, "learning_rate": 0.024000000208616257, "loss": 2.415890693664551, "step": 10528 }, { "epoch": 0.5014285714285714, "grad_norm": 0.029599815607070923, "learning_rate": 0.024000000208616257, "loss": 2.4483466148376465, "step": 10530 }, { "epoch": 0.5015238095238095, "grad_norm": 0.027131836861371994, "learning_rate": 0.024000000208616257, "loss": 2.434523582458496, "step": 10532 }, { "epoch": 0.5016190476190476, "grad_norm": 0.026493661105632782, "learning_rate": 0.024000000208616257, "loss": 2.4277215003967285, "step": 10534 }, { "epoch": 0.5017142857142857, "grad_norm": 0.02984180673956871, "learning_rate": 0.024000000208616257, "loss": 2.461825370788574, "step": 10536 }, { "epoch": 0.5018095238095238, "grad_norm": 0.026190048083662987, "learning_rate": 0.024000000208616257, "loss": 2.479802370071411, "step": 10538 }, { "epoch": 0.5019047619047619, "grad_norm": 0.027719635516405106, "learning_rate": 0.024000000208616257, "loss": 2.435533046722412, "step": 10540 }, { "epoch": 0.502, "grad_norm": 0.027317533269524574, "learning_rate": 0.024000000208616257, "loss": 2.452331066131592, "step": 10542 }, { "epoch": 0.5020952380952381, "grad_norm": 0.028682595118880272, "learning_rate": 0.024000000208616257, "loss": 2.464838981628418, "step": 10544 }, { "epoch": 0.5021904761904762, "grad_norm": 0.027929341420531273, "learning_rate": 0.024000000208616257, "loss": 2.4573774337768555, "step": 10546 }, { "epoch": 0.5022857142857143, "grad_norm": 0.02744869329035282, "learning_rate": 0.024000000208616257, "loss": 2.4293107986450195, "step": 10548 }, { "epoch": 0.5023809523809524, "grad_norm": 0.026700438931584358, "learning_rate": 0.024000000208616257, "loss": 2.4308342933654785, "step": 10550 }, { "epoch": 0.5024761904761905, "grad_norm": 0.027053477242588997, "learning_rate": 0.024000000208616257, "loss": 2.451044797897339, "step": 10552 }, { "epoch": 0.5025714285714286, "grad_norm": 0.029234807938337326, "learning_rate": 0.024000000208616257, "loss": 2.4647469520568848, "step": 10554 }, { "epoch": 0.5026666666666667, "grad_norm": 0.0276576429605484, "learning_rate": 0.024000000208616257, "loss": 2.467348337173462, "step": 10556 }, { "epoch": 0.5027619047619047, "grad_norm": 0.026910077780485153, "learning_rate": 0.024000000208616257, "loss": 2.4328184127807617, "step": 10558 }, { "epoch": 0.5028571428571429, "grad_norm": 0.028046056628227234, "learning_rate": 0.024000000208616257, "loss": 2.4527924060821533, "step": 10560 }, { "epoch": 0.5029523809523809, "grad_norm": 0.028252216055989265, "learning_rate": 0.024000000208616257, "loss": 2.4777774810791016, "step": 10562 }, { "epoch": 0.5030476190476191, "grad_norm": 0.035288192331790924, "learning_rate": 0.024000000208616257, "loss": 2.4141950607299805, "step": 10564 }, { "epoch": 0.5031428571428571, "grad_norm": 0.030102265998721123, "learning_rate": 0.024000000208616257, "loss": 2.4389536380767822, "step": 10566 }, { "epoch": 0.5032380952380953, "grad_norm": 0.029392516240477562, "learning_rate": 0.024000000208616257, "loss": 2.4202775955200195, "step": 10568 }, { "epoch": 0.5033333333333333, "grad_norm": 0.02779567614197731, "learning_rate": 0.024000000208616257, "loss": 2.4519314765930176, "step": 10570 }, { "epoch": 0.5034285714285714, "grad_norm": 0.02843274548649788, "learning_rate": 0.024000000208616257, "loss": 2.4480552673339844, "step": 10572 }, { "epoch": 0.5035238095238095, "grad_norm": 0.028056619688868523, "learning_rate": 0.024000000208616257, "loss": 2.4596121311187744, "step": 10574 }, { "epoch": 0.5036190476190476, "grad_norm": 0.029085010290145874, "learning_rate": 0.024000000208616257, "loss": 2.4349260330200195, "step": 10576 }, { "epoch": 0.5037142857142857, "grad_norm": 0.02789931744337082, "learning_rate": 0.024000000208616257, "loss": 2.463022232055664, "step": 10578 }, { "epoch": 0.5038095238095238, "grad_norm": 0.027265572920441628, "learning_rate": 0.024000000208616257, "loss": 2.4229609966278076, "step": 10580 }, { "epoch": 0.5039047619047619, "grad_norm": 0.029024740681052208, "learning_rate": 0.024000000208616257, "loss": 2.451295852661133, "step": 10582 }, { "epoch": 0.504, "grad_norm": 0.02868027798831463, "learning_rate": 0.024000000208616257, "loss": 2.4367551803588867, "step": 10584 }, { "epoch": 0.504095238095238, "grad_norm": 0.027595125138759613, "learning_rate": 0.024000000208616257, "loss": 2.4224343299865723, "step": 10586 }, { "epoch": 0.5041904761904762, "grad_norm": 0.027235988527536392, "learning_rate": 0.024000000208616257, "loss": 2.4633827209472656, "step": 10588 }, { "epoch": 0.5042857142857143, "grad_norm": 0.028152260929346085, "learning_rate": 0.024000000208616257, "loss": 2.426318645477295, "step": 10590 }, { "epoch": 0.5043809523809524, "grad_norm": 0.030847476795315742, "learning_rate": 0.024000000208616257, "loss": 2.4518537521362305, "step": 10592 }, { "epoch": 0.5044761904761905, "grad_norm": 0.0275142602622509, "learning_rate": 0.024000000208616257, "loss": 2.4528770446777344, "step": 10594 }, { "epoch": 0.5045714285714286, "grad_norm": 0.027242980897426605, "learning_rate": 0.024000000208616257, "loss": 2.423563003540039, "step": 10596 }, { "epoch": 0.5046666666666667, "grad_norm": 0.02904028631746769, "learning_rate": 0.024000000208616257, "loss": 2.447375774383545, "step": 10598 }, { "epoch": 0.5047619047619047, "grad_norm": 0.028056412935256958, "learning_rate": 0.024000000208616257, "loss": 2.4469761848449707, "step": 10600 }, { "epoch": 0.5048571428571429, "grad_norm": 0.02916330099105835, "learning_rate": 0.024000000208616257, "loss": 2.4272971153259277, "step": 10602 }, { "epoch": 0.5049523809523809, "grad_norm": 0.02669353038072586, "learning_rate": 0.024000000208616257, "loss": 2.437255859375, "step": 10604 }, { "epoch": 0.5050476190476191, "grad_norm": 0.027442852035164833, "learning_rate": 0.024000000208616257, "loss": 2.4768054485321045, "step": 10606 }, { "epoch": 0.5051428571428571, "grad_norm": 0.026943741366267204, "learning_rate": 0.024000000208616257, "loss": 2.445418357849121, "step": 10608 }, { "epoch": 0.5052380952380953, "grad_norm": 0.02796977385878563, "learning_rate": 0.024000000208616257, "loss": 2.46488881111145, "step": 10610 }, { "epoch": 0.5053333333333333, "grad_norm": 0.02829703874886036, "learning_rate": 0.024000000208616257, "loss": 2.399935722351074, "step": 10612 }, { "epoch": 0.5054285714285714, "grad_norm": 0.027495479211211205, "learning_rate": 0.024000000208616257, "loss": 2.470089912414551, "step": 10614 }, { "epoch": 0.5055238095238095, "grad_norm": 0.030557241290807724, "learning_rate": 0.024000000208616257, "loss": 2.454024314880371, "step": 10616 }, { "epoch": 0.5056190476190476, "grad_norm": 0.027526525780558586, "learning_rate": 0.024000000208616257, "loss": 2.4555253982543945, "step": 10618 }, { "epoch": 0.5057142857142857, "grad_norm": 0.02985428087413311, "learning_rate": 0.024000000208616257, "loss": 2.438883066177368, "step": 10620 }, { "epoch": 0.5058095238095238, "grad_norm": 0.027097798883914948, "learning_rate": 0.024000000208616257, "loss": 2.430593490600586, "step": 10622 }, { "epoch": 0.5059047619047619, "grad_norm": 0.02754295989871025, "learning_rate": 0.024000000208616257, "loss": 2.4198389053344727, "step": 10624 }, { "epoch": 0.506, "grad_norm": 0.027297940105199814, "learning_rate": 0.024000000208616257, "loss": 2.4563076496124268, "step": 10626 }, { "epoch": 0.506095238095238, "grad_norm": 0.02699265256524086, "learning_rate": 0.024000000208616257, "loss": 2.4345457553863525, "step": 10628 }, { "epoch": 0.5061904761904762, "grad_norm": 0.0282902829349041, "learning_rate": 0.024000000208616257, "loss": 2.4192466735839844, "step": 10630 }, { "epoch": 0.5062857142857143, "grad_norm": 0.033406540751457214, "learning_rate": 0.024000000208616257, "loss": 2.4340994358062744, "step": 10632 }, { "epoch": 0.5063809523809524, "grad_norm": 0.030291905626654625, "learning_rate": 0.024000000208616257, "loss": 2.462829828262329, "step": 10634 }, { "epoch": 0.5064761904761905, "grad_norm": 0.02736188843846321, "learning_rate": 0.024000000208616257, "loss": 2.4303998947143555, "step": 10636 }, { "epoch": 0.5065714285714286, "grad_norm": 0.02941037528216839, "learning_rate": 0.024000000208616257, "loss": 2.45393705368042, "step": 10638 }, { "epoch": 0.5066666666666667, "grad_norm": 0.026944266632199287, "learning_rate": 0.024000000208616257, "loss": 2.4170398712158203, "step": 10640 }, { "epoch": 0.5067619047619047, "grad_norm": 0.027776921167969704, "learning_rate": 0.024000000208616257, "loss": 2.4149038791656494, "step": 10642 }, { "epoch": 0.5068571428571429, "grad_norm": 0.028152089565992355, "learning_rate": 0.024000000208616257, "loss": 2.4621713161468506, "step": 10644 }, { "epoch": 0.5069523809523809, "grad_norm": 0.02801678143441677, "learning_rate": 0.024000000208616257, "loss": 2.415541172027588, "step": 10646 }, { "epoch": 0.5070476190476191, "grad_norm": 0.0284360833466053, "learning_rate": 0.024000000208616257, "loss": 2.422945499420166, "step": 10648 }, { "epoch": 0.5071428571428571, "grad_norm": 0.027714064344763756, "learning_rate": 0.024000000208616257, "loss": 2.430230140686035, "step": 10650 }, { "epoch": 0.5072380952380953, "grad_norm": 0.02753283455967903, "learning_rate": 0.024000000208616257, "loss": 2.428250551223755, "step": 10652 }, { "epoch": 0.5073333333333333, "grad_norm": 0.028864799067378044, "learning_rate": 0.024000000208616257, "loss": 2.4289631843566895, "step": 10654 }, { "epoch": 0.5074285714285715, "grad_norm": 0.02773326449096203, "learning_rate": 0.024000000208616257, "loss": 2.4538445472717285, "step": 10656 }, { "epoch": 0.5075238095238095, "grad_norm": 0.028690950945019722, "learning_rate": 0.024000000208616257, "loss": 2.4332919120788574, "step": 10658 }, { "epoch": 0.5076190476190476, "grad_norm": 0.027461759746074677, "learning_rate": 0.024000000208616257, "loss": 2.4106812477111816, "step": 10660 }, { "epoch": 0.5077142857142857, "grad_norm": 0.028255412355065346, "learning_rate": 0.024000000208616257, "loss": 2.450730323791504, "step": 10662 }, { "epoch": 0.5078095238095238, "grad_norm": 0.027058904990553856, "learning_rate": 0.024000000208616257, "loss": 2.4064207077026367, "step": 10664 }, { "epoch": 0.5079047619047619, "grad_norm": 0.031714972108602524, "learning_rate": 0.024000000208616257, "loss": 2.4432473182678223, "step": 10666 }, { "epoch": 0.508, "grad_norm": 0.026700342074036598, "learning_rate": 0.024000000208616257, "loss": 2.4073476791381836, "step": 10668 }, { "epoch": 0.508095238095238, "grad_norm": 0.02770339325070381, "learning_rate": 0.024000000208616257, "loss": 2.433797597885132, "step": 10670 }, { "epoch": 0.5081904761904762, "grad_norm": 0.026324082165956497, "learning_rate": 0.024000000208616257, "loss": 2.431698799133301, "step": 10672 }, { "epoch": 0.5082857142857143, "grad_norm": 0.028448810800909996, "learning_rate": 0.024000000208616257, "loss": 2.4154505729675293, "step": 10674 }, { "epoch": 0.5083809523809524, "grad_norm": 0.026210259646177292, "learning_rate": 0.024000000208616257, "loss": 2.4191741943359375, "step": 10676 }, { "epoch": 0.5084761904761905, "grad_norm": 0.028098348528146744, "learning_rate": 0.024000000208616257, "loss": 2.4259657859802246, "step": 10678 }, { "epoch": 0.5085714285714286, "grad_norm": 0.027027495205402374, "learning_rate": 0.024000000208616257, "loss": 2.4382333755493164, "step": 10680 }, { "epoch": 0.5086666666666667, "grad_norm": 0.027239730581641197, "learning_rate": 0.024000000208616257, "loss": 2.4388175010681152, "step": 10682 }, { "epoch": 0.5087619047619047, "grad_norm": 0.031195566058158875, "learning_rate": 0.024000000208616257, "loss": 2.4484543800354004, "step": 10684 }, { "epoch": 0.5088571428571429, "grad_norm": 0.031367089599370956, "learning_rate": 0.024000000208616257, "loss": 2.3834757804870605, "step": 10686 }, { "epoch": 0.5089523809523809, "grad_norm": 0.028450176119804382, "learning_rate": 0.024000000208616257, "loss": 2.4651589393615723, "step": 10688 }, { "epoch": 0.5090476190476191, "grad_norm": 0.02712199091911316, "learning_rate": 0.024000000208616257, "loss": 2.446445941925049, "step": 10690 }, { "epoch": 0.5091428571428571, "grad_norm": 0.0313868522644043, "learning_rate": 0.024000000208616257, "loss": 2.423309087753296, "step": 10692 }, { "epoch": 0.5092380952380953, "grad_norm": 0.02969011478126049, "learning_rate": 0.024000000208616257, "loss": 2.420013427734375, "step": 10694 }, { "epoch": 0.5093333333333333, "grad_norm": 0.02757384069263935, "learning_rate": 0.024000000208616257, "loss": 2.434798002243042, "step": 10696 }, { "epoch": 0.5094285714285715, "grad_norm": 0.029611356556415558, "learning_rate": 0.024000000208616257, "loss": 2.4420108795166016, "step": 10698 }, { "epoch": 0.5095238095238095, "grad_norm": 0.030738957226276398, "learning_rate": 0.024000000208616257, "loss": 2.428284168243408, "step": 10700 }, { "epoch": 0.5096190476190476, "grad_norm": 0.03290248662233353, "learning_rate": 0.024000000208616257, "loss": 2.433021068572998, "step": 10702 }, { "epoch": 0.5097142857142857, "grad_norm": 0.02936279959976673, "learning_rate": 0.024000000208616257, "loss": 2.437680244445801, "step": 10704 }, { "epoch": 0.5098095238095238, "grad_norm": 0.03234749287366867, "learning_rate": 0.024000000208616257, "loss": 2.422527551651001, "step": 10706 }, { "epoch": 0.5099047619047619, "grad_norm": 0.02763894759118557, "learning_rate": 0.024000000208616257, "loss": 2.41082763671875, "step": 10708 }, { "epoch": 0.51, "grad_norm": 0.026939023286104202, "learning_rate": 0.024000000208616257, "loss": 2.4541029930114746, "step": 10710 }, { "epoch": 0.510095238095238, "grad_norm": 0.0280812568962574, "learning_rate": 0.024000000208616257, "loss": 2.419034481048584, "step": 10712 }, { "epoch": 0.5101904761904762, "grad_norm": 0.027115436270833015, "learning_rate": 0.024000000208616257, "loss": 2.464656352996826, "step": 10714 }, { "epoch": 0.5102857142857142, "grad_norm": 0.028406810015439987, "learning_rate": 0.024000000208616257, "loss": 2.4440126419067383, "step": 10716 }, { "epoch": 0.5103809523809524, "grad_norm": 0.02984136901795864, "learning_rate": 0.024000000208616257, "loss": 2.433138370513916, "step": 10718 }, { "epoch": 0.5104761904761905, "grad_norm": 0.027627650648355484, "learning_rate": 0.024000000208616257, "loss": 2.439250946044922, "step": 10720 }, { "epoch": 0.5105714285714286, "grad_norm": 0.02787013165652752, "learning_rate": 0.024000000208616257, "loss": 2.4390711784362793, "step": 10722 }, { "epoch": 0.5106666666666667, "grad_norm": 0.02688511647284031, "learning_rate": 0.024000000208616257, "loss": 2.4529800415039062, "step": 10724 }, { "epoch": 0.5107619047619048, "grad_norm": 0.03191622346639633, "learning_rate": 0.024000000208616257, "loss": 2.433412551879883, "step": 10726 }, { "epoch": 0.5108571428571429, "grad_norm": 0.02716859243810177, "learning_rate": 0.024000000208616257, "loss": 2.4432907104492188, "step": 10728 }, { "epoch": 0.5109523809523809, "grad_norm": 0.029734769836068153, "learning_rate": 0.024000000208616257, "loss": 2.4042727947235107, "step": 10730 }, { "epoch": 0.5110476190476191, "grad_norm": 0.02726336382329464, "learning_rate": 0.024000000208616257, "loss": 2.4278810024261475, "step": 10732 }, { "epoch": 0.5111428571428571, "grad_norm": 0.029170295223593712, "learning_rate": 0.024000000208616257, "loss": 2.440880060195923, "step": 10734 }, { "epoch": 0.5112380952380953, "grad_norm": 0.03113229013979435, "learning_rate": 0.024000000208616257, "loss": 2.4125707149505615, "step": 10736 }, { "epoch": 0.5113333333333333, "grad_norm": 0.028234543278813362, "learning_rate": 0.024000000208616257, "loss": 2.4556307792663574, "step": 10738 }, { "epoch": 0.5114285714285715, "grad_norm": 0.02789166383445263, "learning_rate": 0.024000000208616257, "loss": 2.4220004081726074, "step": 10740 }, { "epoch": 0.5115238095238095, "grad_norm": 0.02681007795035839, "learning_rate": 0.024000000208616257, "loss": 2.4198851585388184, "step": 10742 }, { "epoch": 0.5116190476190476, "grad_norm": 0.02697092667222023, "learning_rate": 0.024000000208616257, "loss": 2.4243569374084473, "step": 10744 }, { "epoch": 0.5117142857142857, "grad_norm": 0.029569095000624657, "learning_rate": 0.024000000208616257, "loss": 2.412090301513672, "step": 10746 }, { "epoch": 0.5118095238095238, "grad_norm": 0.029564835131168365, "learning_rate": 0.024000000208616257, "loss": 2.4282002449035645, "step": 10748 }, { "epoch": 0.5119047619047619, "grad_norm": 0.02728309854865074, "learning_rate": 0.024000000208616257, "loss": 2.425595760345459, "step": 10750 }, { "epoch": 0.512, "grad_norm": 0.027898941189050674, "learning_rate": 0.024000000208616257, "loss": 2.385802745819092, "step": 10752 }, { "epoch": 0.512095238095238, "grad_norm": 0.03258281573653221, "learning_rate": 0.024000000208616257, "loss": 2.4370594024658203, "step": 10754 }, { "epoch": 0.5121904761904762, "grad_norm": 0.02785218134522438, "learning_rate": 0.024000000208616257, "loss": 2.423847198486328, "step": 10756 }, { "epoch": 0.5122857142857142, "grad_norm": 0.033212609589099884, "learning_rate": 0.024000000208616257, "loss": 2.4045321941375732, "step": 10758 }, { "epoch": 0.5123809523809524, "grad_norm": 0.02857373096048832, "learning_rate": 0.024000000208616257, "loss": 2.457590341567993, "step": 10760 }, { "epoch": 0.5124761904761905, "grad_norm": 0.028279412537813187, "learning_rate": 0.024000000208616257, "loss": 2.4311556816101074, "step": 10762 }, { "epoch": 0.5125714285714286, "grad_norm": 0.030454231426119804, "learning_rate": 0.024000000208616257, "loss": 2.4481582641601562, "step": 10764 }, { "epoch": 0.5126666666666667, "grad_norm": 0.02754177339375019, "learning_rate": 0.024000000208616257, "loss": 2.427992582321167, "step": 10766 }, { "epoch": 0.5127619047619048, "grad_norm": 0.031118139624595642, "learning_rate": 0.024000000208616257, "loss": 2.4154305458068848, "step": 10768 }, { "epoch": 0.5128571428571429, "grad_norm": 0.03571861609816551, "learning_rate": 0.024000000208616257, "loss": 2.4215152263641357, "step": 10770 }, { "epoch": 0.5129523809523809, "grad_norm": 0.043497152626514435, "learning_rate": 0.024000000208616257, "loss": 2.4135520458221436, "step": 10772 }, { "epoch": 0.5130476190476191, "grad_norm": 0.04533176124095917, "learning_rate": 0.024000000208616257, "loss": 2.418574333190918, "step": 10774 }, { "epoch": 0.5131428571428571, "grad_norm": 0.03467651829123497, "learning_rate": 0.024000000208616257, "loss": 2.444568157196045, "step": 10776 }, { "epoch": 0.5132380952380953, "grad_norm": 0.03260539099574089, "learning_rate": 0.024000000208616257, "loss": 2.4605817794799805, "step": 10778 }, { "epoch": 0.5133333333333333, "grad_norm": 0.02711736597120762, "learning_rate": 0.024000000208616257, "loss": 2.405381679534912, "step": 10780 }, { "epoch": 0.5134285714285715, "grad_norm": 0.027648475021123886, "learning_rate": 0.024000000208616257, "loss": 2.4513559341430664, "step": 10782 }, { "epoch": 0.5135238095238095, "grad_norm": 0.027604317292571068, "learning_rate": 0.024000000208616257, "loss": 2.379446506500244, "step": 10784 }, { "epoch": 0.5136190476190476, "grad_norm": 0.0269109345972538, "learning_rate": 0.024000000208616257, "loss": 2.4433422088623047, "step": 10786 }, { "epoch": 0.5137142857142857, "grad_norm": 0.02740618772804737, "learning_rate": 0.024000000208616257, "loss": 2.3776769638061523, "step": 10788 }, { "epoch": 0.5138095238095238, "grad_norm": 0.03022061660885811, "learning_rate": 0.024000000208616257, "loss": 2.4248032569885254, "step": 10790 }, { "epoch": 0.5139047619047619, "grad_norm": 0.03221261873841286, "learning_rate": 0.024000000208616257, "loss": 2.4208693504333496, "step": 10792 }, { "epoch": 0.514, "grad_norm": 0.028901338577270508, "learning_rate": 0.024000000208616257, "loss": 2.4371752738952637, "step": 10794 }, { "epoch": 0.514095238095238, "grad_norm": 0.028612300753593445, "learning_rate": 0.024000000208616257, "loss": 2.4397635459899902, "step": 10796 }, { "epoch": 0.5141904761904762, "grad_norm": 0.026482941582798958, "learning_rate": 0.024000000208616257, "loss": 2.4774627685546875, "step": 10798 }, { "epoch": 0.5142857142857142, "grad_norm": 0.027085842564702034, "learning_rate": 0.024000000208616257, "loss": 2.409822463989258, "step": 10800 }, { "epoch": 0.5143809523809524, "grad_norm": 0.030337488278746605, "learning_rate": 0.024000000208616257, "loss": 2.423346519470215, "step": 10802 }, { "epoch": 0.5144761904761905, "grad_norm": 0.03300487622618675, "learning_rate": 0.024000000208616257, "loss": 2.4265012741088867, "step": 10804 }, { "epoch": 0.5145714285714286, "grad_norm": 0.031124280765652657, "learning_rate": 0.024000000208616257, "loss": 2.426905632019043, "step": 10806 }, { "epoch": 0.5146666666666667, "grad_norm": 0.027340702712535858, "learning_rate": 0.024000000208616257, "loss": 2.438143730163574, "step": 10808 }, { "epoch": 0.5147619047619048, "grad_norm": 0.029811980202794075, "learning_rate": 0.024000000208616257, "loss": 2.45957088470459, "step": 10810 }, { "epoch": 0.5148571428571429, "grad_norm": 0.027415955439209938, "learning_rate": 0.024000000208616257, "loss": 2.431168556213379, "step": 10812 }, { "epoch": 0.5149523809523809, "grad_norm": 0.029767345637083054, "learning_rate": 0.024000000208616257, "loss": 2.411663293838501, "step": 10814 }, { "epoch": 0.5150476190476191, "grad_norm": 0.029197830706834793, "learning_rate": 0.024000000208616257, "loss": 2.404855251312256, "step": 10816 }, { "epoch": 0.5151428571428571, "grad_norm": 0.02758631482720375, "learning_rate": 0.024000000208616257, "loss": 2.420595645904541, "step": 10818 }, { "epoch": 0.5152380952380953, "grad_norm": 0.02917136810719967, "learning_rate": 0.024000000208616257, "loss": 2.4288551807403564, "step": 10820 }, { "epoch": 0.5153333333333333, "grad_norm": 0.027326438575983047, "learning_rate": 0.024000000208616257, "loss": 2.440446138381958, "step": 10822 }, { "epoch": 0.5154285714285715, "grad_norm": 0.030733846127986908, "learning_rate": 0.024000000208616257, "loss": 2.4471354484558105, "step": 10824 }, { "epoch": 0.5155238095238095, "grad_norm": 0.027158789336681366, "learning_rate": 0.024000000208616257, "loss": 2.426403045654297, "step": 10826 }, { "epoch": 0.5156190476190476, "grad_norm": 0.028114357963204384, "learning_rate": 0.024000000208616257, "loss": 2.419297218322754, "step": 10828 }, { "epoch": 0.5157142857142857, "grad_norm": 0.02671000547707081, "learning_rate": 0.024000000208616257, "loss": 2.409165859222412, "step": 10830 }, { "epoch": 0.5158095238095238, "grad_norm": 0.02869689092040062, "learning_rate": 0.024000000208616257, "loss": 2.401791572570801, "step": 10832 }, { "epoch": 0.5159047619047619, "grad_norm": 0.028429705649614334, "learning_rate": 0.024000000208616257, "loss": 2.438840389251709, "step": 10834 }, { "epoch": 0.516, "grad_norm": 0.02853168360888958, "learning_rate": 0.024000000208616257, "loss": 2.422635555267334, "step": 10836 }, { "epoch": 0.516095238095238, "grad_norm": 0.027284730225801468, "learning_rate": 0.024000000208616257, "loss": 2.434631586074829, "step": 10838 }, { "epoch": 0.5161904761904762, "grad_norm": 0.02696293033659458, "learning_rate": 0.024000000208616257, "loss": 2.4332311153411865, "step": 10840 }, { "epoch": 0.5162857142857142, "grad_norm": 0.028007159009575844, "learning_rate": 0.024000000208616257, "loss": 2.3859901428222656, "step": 10842 }, { "epoch": 0.5163809523809524, "grad_norm": 0.027695976197719574, "learning_rate": 0.024000000208616257, "loss": 2.3970654010772705, "step": 10844 }, { "epoch": 0.5164761904761904, "grad_norm": 0.029894325882196426, "learning_rate": 0.024000000208616257, "loss": 2.3980603218078613, "step": 10846 }, { "epoch": 0.5165714285714286, "grad_norm": 0.0275436844676733, "learning_rate": 0.024000000208616257, "loss": 2.4179580211639404, "step": 10848 }, { "epoch": 0.5166666666666667, "grad_norm": 0.02733805775642395, "learning_rate": 0.024000000208616257, "loss": 2.4248297214508057, "step": 10850 }, { "epoch": 0.5167619047619048, "grad_norm": 0.027735982090234756, "learning_rate": 0.024000000208616257, "loss": 2.381918430328369, "step": 10852 }, { "epoch": 0.5168571428571429, "grad_norm": 0.027335919439792633, "learning_rate": 0.024000000208616257, "loss": 2.4256386756896973, "step": 10854 }, { "epoch": 0.5169523809523809, "grad_norm": 0.027062591165304184, "learning_rate": 0.024000000208616257, "loss": 2.4205195903778076, "step": 10856 }, { "epoch": 0.5170476190476191, "grad_norm": 0.028590183705091476, "learning_rate": 0.024000000208616257, "loss": 2.4076125621795654, "step": 10858 }, { "epoch": 0.5171428571428571, "grad_norm": 0.027816032990813255, "learning_rate": 0.024000000208616257, "loss": 2.4182631969451904, "step": 10860 }, { "epoch": 0.5172380952380953, "grad_norm": 0.02840322069823742, "learning_rate": 0.024000000208616257, "loss": 2.3900861740112305, "step": 10862 }, { "epoch": 0.5173333333333333, "grad_norm": 0.02666543796658516, "learning_rate": 0.024000000208616257, "loss": 2.4119417667388916, "step": 10864 }, { "epoch": 0.5174285714285715, "grad_norm": 0.02678517997264862, "learning_rate": 0.024000000208616257, "loss": 2.4183881282806396, "step": 10866 }, { "epoch": 0.5175238095238095, "grad_norm": 0.027600247412919998, "learning_rate": 0.024000000208616257, "loss": 2.404691696166992, "step": 10868 }, { "epoch": 0.5176190476190476, "grad_norm": 0.02743578515946865, "learning_rate": 0.024000000208616257, "loss": 2.425474166870117, "step": 10870 }, { "epoch": 0.5177142857142857, "grad_norm": 0.029706701636314392, "learning_rate": 0.024000000208616257, "loss": 2.4125113487243652, "step": 10872 }, { "epoch": 0.5178095238095238, "grad_norm": 0.027538591995835304, "learning_rate": 0.024000000208616257, "loss": 2.39963436126709, "step": 10874 }, { "epoch": 0.5179047619047619, "grad_norm": 0.026627980172634125, "learning_rate": 0.024000000208616257, "loss": 2.373406410217285, "step": 10876 }, { "epoch": 0.518, "grad_norm": 0.026556629687547684, "learning_rate": 0.024000000208616257, "loss": 2.4311232566833496, "step": 10878 }, { "epoch": 0.518095238095238, "grad_norm": 0.027132030576467514, "learning_rate": 0.024000000208616257, "loss": 2.3812549114227295, "step": 10880 }, { "epoch": 0.5181904761904762, "grad_norm": 0.027945758774876595, "learning_rate": 0.024000000208616257, "loss": 2.409986972808838, "step": 10882 }, { "epoch": 0.5182857142857142, "grad_norm": 0.030229704454541206, "learning_rate": 0.024000000208616257, "loss": 2.371941328048706, "step": 10884 }, { "epoch": 0.5183809523809524, "grad_norm": 0.026768120005726814, "learning_rate": 0.024000000208616257, "loss": 2.403003215789795, "step": 10886 }, { "epoch": 0.5184761904761904, "grad_norm": 0.02787279337644577, "learning_rate": 0.024000000208616257, "loss": 2.395101547241211, "step": 10888 }, { "epoch": 0.5185714285714286, "grad_norm": 0.02718157321214676, "learning_rate": 0.024000000208616257, "loss": 2.401400566101074, "step": 10890 }, { "epoch": 0.5186666666666667, "grad_norm": 0.027039825916290283, "learning_rate": 0.024000000208616257, "loss": 2.368460178375244, "step": 10892 }, { "epoch": 0.5187619047619048, "grad_norm": 0.03323078528046608, "learning_rate": 0.024000000208616257, "loss": 2.3997457027435303, "step": 10894 }, { "epoch": 0.5188571428571429, "grad_norm": 0.027272474020719528, "learning_rate": 0.024000000208616257, "loss": 2.396824359893799, "step": 10896 }, { "epoch": 0.5189523809523809, "grad_norm": 0.027813421562314034, "learning_rate": 0.024000000208616257, "loss": 2.3734545707702637, "step": 10898 }, { "epoch": 0.5190476190476191, "grad_norm": 0.027445625513792038, "learning_rate": 0.024000000208616257, "loss": 2.376365900039673, "step": 10900 }, { "epoch": 0.5191428571428571, "grad_norm": 0.028931185603141785, "learning_rate": 0.024000000208616257, "loss": 2.4106640815734863, "step": 10902 }, { "epoch": 0.5192380952380953, "grad_norm": 0.03152277693152428, "learning_rate": 0.024000000208616257, "loss": 2.349529504776001, "step": 10904 }, { "epoch": 0.5193333333333333, "grad_norm": 0.0283840112388134, "learning_rate": 0.024000000208616257, "loss": 2.3683528900146484, "step": 10906 }, { "epoch": 0.5194285714285715, "grad_norm": 0.026969676837325096, "learning_rate": 0.024000000208616257, "loss": 2.3616185188293457, "step": 10908 }, { "epoch": 0.5195238095238095, "grad_norm": 0.02846386469900608, "learning_rate": 0.024000000208616257, "loss": 2.3853394985198975, "step": 10910 }, { "epoch": 0.5196190476190476, "grad_norm": 0.028119977563619614, "learning_rate": 0.024000000208616257, "loss": 2.3827872276306152, "step": 10912 }, { "epoch": 0.5197142857142857, "grad_norm": 0.027044815942645073, "learning_rate": 0.024000000208616257, "loss": 2.398042678833008, "step": 10914 }, { "epoch": 0.5198095238095238, "grad_norm": 0.02817191742360592, "learning_rate": 0.024000000208616257, "loss": 2.3940420150756836, "step": 10916 }, { "epoch": 0.5199047619047619, "grad_norm": 0.02781887724995613, "learning_rate": 0.024000000208616257, "loss": 2.4250102043151855, "step": 10918 }, { "epoch": 0.52, "grad_norm": 0.027518128976225853, "learning_rate": 0.024000000208616257, "loss": 2.363058090209961, "step": 10920 }, { "epoch": 0.520095238095238, "grad_norm": 0.026773935183882713, "learning_rate": 0.024000000208616257, "loss": 2.3985869884490967, "step": 10922 }, { "epoch": 0.5201904761904762, "grad_norm": 0.02828143909573555, "learning_rate": 0.024000000208616257, "loss": 2.3532557487487793, "step": 10924 }, { "epoch": 0.5202857142857142, "grad_norm": 0.028142159804701805, "learning_rate": 0.024000000208616257, "loss": 2.417469024658203, "step": 10926 }, { "epoch": 0.5203809523809524, "grad_norm": 0.028300350531935692, "learning_rate": 0.024000000208616257, "loss": 2.401857852935791, "step": 10928 }, { "epoch": 0.5204761904761904, "grad_norm": 0.028452519327402115, "learning_rate": 0.024000000208616257, "loss": 2.3957650661468506, "step": 10930 }, { "epoch": 0.5205714285714286, "grad_norm": 0.0280751995742321, "learning_rate": 0.024000000208616257, "loss": 2.3765361309051514, "step": 10932 }, { "epoch": 0.5206666666666667, "grad_norm": 0.02676212601363659, "learning_rate": 0.024000000208616257, "loss": 2.389497995376587, "step": 10934 }, { "epoch": 0.5207619047619048, "grad_norm": 0.026592198759317398, "learning_rate": 0.024000000208616257, "loss": 2.3653082847595215, "step": 10936 }, { "epoch": 0.5208571428571429, "grad_norm": 0.028094664216041565, "learning_rate": 0.024000000208616257, "loss": 2.382047176361084, "step": 10938 }, { "epoch": 0.520952380952381, "grad_norm": 0.02886667102575302, "learning_rate": 0.024000000208616257, "loss": 2.365175247192383, "step": 10940 }, { "epoch": 0.5210476190476191, "grad_norm": 0.030030475929379463, "learning_rate": 0.024000000208616257, "loss": 2.3671762943267822, "step": 10942 }, { "epoch": 0.5211428571428571, "grad_norm": 0.026599282398819923, "learning_rate": 0.024000000208616257, "loss": 2.3536267280578613, "step": 10944 }, { "epoch": 0.5212380952380953, "grad_norm": 0.02759343571960926, "learning_rate": 0.024000000208616257, "loss": 2.371765375137329, "step": 10946 }, { "epoch": 0.5213333333333333, "grad_norm": 0.02849097177386284, "learning_rate": 0.024000000208616257, "loss": 2.3817193508148193, "step": 10948 }, { "epoch": 0.5214285714285715, "grad_norm": 0.028304601088166237, "learning_rate": 0.024000000208616257, "loss": 2.3891706466674805, "step": 10950 }, { "epoch": 0.5215238095238095, "grad_norm": 0.027825558558106422, "learning_rate": 0.024000000208616257, "loss": 2.3703360557556152, "step": 10952 }, { "epoch": 0.5216190476190476, "grad_norm": 0.03053438477218151, "learning_rate": 0.024000000208616257, "loss": 2.382521629333496, "step": 10954 }, { "epoch": 0.5217142857142857, "grad_norm": 0.030610226094722748, "learning_rate": 0.024000000208616257, "loss": 2.373490333557129, "step": 10956 }, { "epoch": 0.5218095238095238, "grad_norm": 0.032395727932453156, "learning_rate": 0.024000000208616257, "loss": 2.3874850273132324, "step": 10958 }, { "epoch": 0.5219047619047619, "grad_norm": 0.02782427705824375, "learning_rate": 0.024000000208616257, "loss": 2.393272876739502, "step": 10960 }, { "epoch": 0.522, "grad_norm": 0.028692664578557014, "learning_rate": 0.024000000208616257, "loss": 2.38773250579834, "step": 10962 }, { "epoch": 0.5220952380952381, "grad_norm": 0.028684629127383232, "learning_rate": 0.024000000208616257, "loss": 2.372535228729248, "step": 10964 }, { "epoch": 0.5221904761904762, "grad_norm": 0.028519008308649063, "learning_rate": 0.024000000208616257, "loss": 2.364248275756836, "step": 10966 }, { "epoch": 0.5222857142857142, "grad_norm": 0.03039529174566269, "learning_rate": 0.024000000208616257, "loss": 2.4036483764648438, "step": 10968 }, { "epoch": 0.5223809523809524, "grad_norm": 0.027386900037527084, "learning_rate": 0.024000000208616257, "loss": 2.3781886100769043, "step": 10970 }, { "epoch": 0.5224761904761904, "grad_norm": 0.02808213420212269, "learning_rate": 0.024000000208616257, "loss": 2.377593755722046, "step": 10972 }, { "epoch": 0.5225714285714286, "grad_norm": 0.03017336316406727, "learning_rate": 0.024000000208616257, "loss": 2.3923425674438477, "step": 10974 }, { "epoch": 0.5226666666666666, "grad_norm": 0.030408494174480438, "learning_rate": 0.024000000208616257, "loss": 2.3535449504852295, "step": 10976 }, { "epoch": 0.5227619047619048, "grad_norm": 0.02894972637295723, "learning_rate": 0.024000000208616257, "loss": 2.3772740364074707, "step": 10978 }, { "epoch": 0.5228571428571429, "grad_norm": 0.028558552265167236, "learning_rate": 0.024000000208616257, "loss": 2.3603782653808594, "step": 10980 }, { "epoch": 0.522952380952381, "grad_norm": 0.028046581894159317, "learning_rate": 0.024000000208616257, "loss": 2.3754918575286865, "step": 10982 }, { "epoch": 0.5230476190476191, "grad_norm": 0.03348696231842041, "learning_rate": 0.024000000208616257, "loss": 2.3791589736938477, "step": 10984 }, { "epoch": 0.5231428571428571, "grad_norm": 0.028050348162651062, "learning_rate": 0.024000000208616257, "loss": 2.4229931831359863, "step": 10986 }, { "epoch": 0.5232380952380953, "grad_norm": 0.026278799399733543, "learning_rate": 0.024000000208616257, "loss": 2.380277633666992, "step": 10988 }, { "epoch": 0.5233333333333333, "grad_norm": 0.028793940320611, "learning_rate": 0.024000000208616257, "loss": 2.379754066467285, "step": 10990 }, { "epoch": 0.5234285714285715, "grad_norm": 0.029690174385905266, "learning_rate": 0.024000000208616257, "loss": 2.3935444355010986, "step": 10992 }, { "epoch": 0.5235238095238095, "grad_norm": 0.03092595748603344, "learning_rate": 0.024000000208616257, "loss": 2.396070957183838, "step": 10994 }, { "epoch": 0.5236190476190477, "grad_norm": 0.03342796117067337, "learning_rate": 0.024000000208616257, "loss": 2.3956539630889893, "step": 10996 }, { "epoch": 0.5237142857142857, "grad_norm": 0.028770800679922104, "learning_rate": 0.024000000208616257, "loss": 2.3547701835632324, "step": 10998 }, { "epoch": 0.5238095238095238, "grad_norm": 0.027517497539520264, "learning_rate": 0.024000000208616257, "loss": 2.3856568336486816, "step": 11000 }, { "epoch": 0.5239047619047619, "grad_norm": 0.026922021061182022, "learning_rate": 0.024000000208616257, "loss": 2.377323627471924, "step": 11002 }, { "epoch": 0.524, "grad_norm": 0.03069390170276165, "learning_rate": 0.024000000208616257, "loss": 2.3994216918945312, "step": 11004 }, { "epoch": 0.5240952380952381, "grad_norm": 0.029388021677732468, "learning_rate": 0.024000000208616257, "loss": 2.380122184753418, "step": 11006 }, { "epoch": 0.5241904761904762, "grad_norm": 0.028747260570526123, "learning_rate": 0.024000000208616257, "loss": 2.3971943855285645, "step": 11008 }, { "epoch": 0.5242857142857142, "grad_norm": 0.028057722374796867, "learning_rate": 0.024000000208616257, "loss": 2.352389335632324, "step": 11010 }, { "epoch": 0.5243809523809524, "grad_norm": 0.026997411623597145, "learning_rate": 0.024000000208616257, "loss": 2.385406494140625, "step": 11012 }, { "epoch": 0.5244761904761904, "grad_norm": 0.02697424590587616, "learning_rate": 0.024000000208616257, "loss": 2.3847432136535645, "step": 11014 }, { "epoch": 0.5245714285714286, "grad_norm": 0.027413535863161087, "learning_rate": 0.024000000208616257, "loss": 2.4013118743896484, "step": 11016 }, { "epoch": 0.5246666666666666, "grad_norm": 0.028676962479948997, "learning_rate": 0.024000000208616257, "loss": 2.4020252227783203, "step": 11018 }, { "epoch": 0.5247619047619048, "grad_norm": 0.027797499671578407, "learning_rate": 0.024000000208616257, "loss": 2.385441780090332, "step": 11020 }, { "epoch": 0.5248571428571429, "grad_norm": 0.02737533114850521, "learning_rate": 0.024000000208616257, "loss": 2.394955635070801, "step": 11022 }, { "epoch": 0.524952380952381, "grad_norm": 0.028084510937333107, "learning_rate": 0.024000000208616257, "loss": 2.399773597717285, "step": 11024 }, { "epoch": 0.5250476190476191, "grad_norm": 0.027968719601631165, "learning_rate": 0.024000000208616257, "loss": 2.3828110694885254, "step": 11026 }, { "epoch": 0.5251428571428571, "grad_norm": 0.027594784274697304, "learning_rate": 0.024000000208616257, "loss": 2.3895044326782227, "step": 11028 }, { "epoch": 0.5252380952380953, "grad_norm": 0.028636446222662926, "learning_rate": 0.024000000208616257, "loss": 2.380718231201172, "step": 11030 }, { "epoch": 0.5253333333333333, "grad_norm": 0.03015761822462082, "learning_rate": 0.024000000208616257, "loss": 2.395009994506836, "step": 11032 }, { "epoch": 0.5254285714285715, "grad_norm": 0.031124062836170197, "learning_rate": 0.024000000208616257, "loss": 2.3714871406555176, "step": 11034 }, { "epoch": 0.5255238095238095, "grad_norm": 0.031375668942928314, "learning_rate": 0.024000000208616257, "loss": 2.3795337677001953, "step": 11036 }, { "epoch": 0.5256190476190477, "grad_norm": 0.026825549080967903, "learning_rate": 0.024000000208616257, "loss": 2.395346164703369, "step": 11038 }, { "epoch": 0.5257142857142857, "grad_norm": 0.028343046084046364, "learning_rate": 0.024000000208616257, "loss": 2.378469467163086, "step": 11040 }, { "epoch": 0.5258095238095238, "grad_norm": 0.029953889548778534, "learning_rate": 0.024000000208616257, "loss": 2.3791890144348145, "step": 11042 }, { "epoch": 0.5259047619047619, "grad_norm": 0.02761927619576454, "learning_rate": 0.024000000208616257, "loss": 2.3651442527770996, "step": 11044 }, { "epoch": 0.526, "grad_norm": 0.02757984586060047, "learning_rate": 0.024000000208616257, "loss": 2.3621644973754883, "step": 11046 }, { "epoch": 0.5260952380952381, "grad_norm": 0.029991870746016502, "learning_rate": 0.024000000208616257, "loss": 2.3863306045532227, "step": 11048 }, { "epoch": 0.5261904761904762, "grad_norm": 0.0356031209230423, "learning_rate": 0.024000000208616257, "loss": 2.3561859130859375, "step": 11050 }, { "epoch": 0.5262857142857142, "grad_norm": 0.028012128546833992, "learning_rate": 0.024000000208616257, "loss": 2.3734779357910156, "step": 11052 }, { "epoch": 0.5263809523809524, "grad_norm": 0.026408618316054344, "learning_rate": 0.024000000208616257, "loss": 2.3618178367614746, "step": 11054 }, { "epoch": 0.5264761904761904, "grad_norm": 0.027616988867521286, "learning_rate": 0.024000000208616257, "loss": 2.409976005554199, "step": 11056 }, { "epoch": 0.5265714285714286, "grad_norm": 0.031077546998858452, "learning_rate": 0.024000000208616257, "loss": 2.3813650608062744, "step": 11058 }, { "epoch": 0.5266666666666666, "grad_norm": 0.028142599388957024, "learning_rate": 0.024000000208616257, "loss": 2.3801722526550293, "step": 11060 }, { "epoch": 0.5267619047619048, "grad_norm": 0.02808581292629242, "learning_rate": 0.024000000208616257, "loss": 2.389758586883545, "step": 11062 }, { "epoch": 0.5268571428571428, "grad_norm": 0.032819002866744995, "learning_rate": 0.024000000208616257, "loss": 2.407188653945923, "step": 11064 }, { "epoch": 0.526952380952381, "grad_norm": 0.027570469304919243, "learning_rate": 0.024000000208616257, "loss": 2.365492582321167, "step": 11066 }, { "epoch": 0.5270476190476191, "grad_norm": 0.030326316133141518, "learning_rate": 0.024000000208616257, "loss": 2.3539249897003174, "step": 11068 }, { "epoch": 0.5271428571428571, "grad_norm": 0.028578324243426323, "learning_rate": 0.024000000208616257, "loss": 2.3629660606384277, "step": 11070 }, { "epoch": 0.5272380952380953, "grad_norm": 0.02929593250155449, "learning_rate": 0.024000000208616257, "loss": 2.372921943664551, "step": 11072 }, { "epoch": 0.5273333333333333, "grad_norm": 0.026652446016669273, "learning_rate": 0.024000000208616257, "loss": 2.377102851867676, "step": 11074 }, { "epoch": 0.5274285714285715, "grad_norm": 0.02578708902001381, "learning_rate": 0.024000000208616257, "loss": 2.3523337841033936, "step": 11076 }, { "epoch": 0.5275238095238095, "grad_norm": 0.027509555220603943, "learning_rate": 0.024000000208616257, "loss": 2.3842384815216064, "step": 11078 }, { "epoch": 0.5276190476190477, "grad_norm": 0.027045611292123795, "learning_rate": 0.024000000208616257, "loss": 2.4017410278320312, "step": 11080 }, { "epoch": 0.5277142857142857, "grad_norm": 0.027369288727641106, "learning_rate": 0.024000000208616257, "loss": 2.351515293121338, "step": 11082 }, { "epoch": 0.5278095238095238, "grad_norm": 0.029159268364310265, "learning_rate": 0.024000000208616257, "loss": 2.348139762878418, "step": 11084 }, { "epoch": 0.5279047619047619, "grad_norm": 0.03543887659907341, "learning_rate": 0.024000000208616257, "loss": 2.3817386627197266, "step": 11086 }, { "epoch": 0.528, "grad_norm": 0.031070737168192863, "learning_rate": 0.024000000208616257, "loss": 2.354475975036621, "step": 11088 }, { "epoch": 0.5280952380952381, "grad_norm": 0.02954612858593464, "learning_rate": 0.024000000208616257, "loss": 2.3552088737487793, "step": 11090 }, { "epoch": 0.5281904761904762, "grad_norm": 0.036063302308321, "learning_rate": 0.024000000208616257, "loss": 2.3837406635284424, "step": 11092 }, { "epoch": 0.5282857142857142, "grad_norm": 0.033483944833278656, "learning_rate": 0.024000000208616257, "loss": 2.380246162414551, "step": 11094 }, { "epoch": 0.5283809523809524, "grad_norm": 0.030107146129012108, "learning_rate": 0.024000000208616257, "loss": 2.380235433578491, "step": 11096 }, { "epoch": 0.5284761904761904, "grad_norm": 0.02663325145840645, "learning_rate": 0.024000000208616257, "loss": 2.357118844985962, "step": 11098 }, { "epoch": 0.5285714285714286, "grad_norm": 0.02690831944346428, "learning_rate": 0.024000000208616257, "loss": 2.365609645843506, "step": 11100 }, { "epoch": 0.5286666666666666, "grad_norm": 0.027078067883849144, "learning_rate": 0.024000000208616257, "loss": 2.374390125274658, "step": 11102 }, { "epoch": 0.5287619047619048, "grad_norm": 0.031092600896954536, "learning_rate": 0.024000000208616257, "loss": 2.4152374267578125, "step": 11104 }, { "epoch": 0.5288571428571428, "grad_norm": 0.027397634461522102, "learning_rate": 0.024000000208616257, "loss": 2.3779001235961914, "step": 11106 }, { "epoch": 0.528952380952381, "grad_norm": 0.026688920333981514, "learning_rate": 0.024000000208616257, "loss": 2.374969244003296, "step": 11108 }, { "epoch": 0.5290476190476191, "grad_norm": 0.030637159943580627, "learning_rate": 0.024000000208616257, "loss": 2.396486282348633, "step": 11110 }, { "epoch": 0.5291428571428571, "grad_norm": 0.03063754364848137, "learning_rate": 0.024000000208616257, "loss": 2.3848512172698975, "step": 11112 }, { "epoch": 0.5292380952380953, "grad_norm": 0.029082894325256348, "learning_rate": 0.024000000208616257, "loss": 2.366140842437744, "step": 11114 }, { "epoch": 0.5293333333333333, "grad_norm": 0.027403520420193672, "learning_rate": 0.024000000208616257, "loss": 2.409027576446533, "step": 11116 }, { "epoch": 0.5294285714285715, "grad_norm": 0.02755184844136238, "learning_rate": 0.024000000208616257, "loss": 2.360198497772217, "step": 11118 }, { "epoch": 0.5295238095238095, "grad_norm": 0.02662978135049343, "learning_rate": 0.024000000208616257, "loss": 2.3225224018096924, "step": 11120 }, { "epoch": 0.5296190476190477, "grad_norm": 0.028253525495529175, "learning_rate": 0.024000000208616257, "loss": 2.3467488288879395, "step": 11122 }, { "epoch": 0.5297142857142857, "grad_norm": 0.027419311925768852, "learning_rate": 0.024000000208616257, "loss": 2.347034454345703, "step": 11124 }, { "epoch": 0.5298095238095238, "grad_norm": 0.027173228561878204, "learning_rate": 0.024000000208616257, "loss": 2.3754782676696777, "step": 11126 }, { "epoch": 0.5299047619047619, "grad_norm": 0.0273845586925745, "learning_rate": 0.024000000208616257, "loss": 2.39947509765625, "step": 11128 }, { "epoch": 0.53, "grad_norm": 0.031402427703142166, "learning_rate": 0.024000000208616257, "loss": 2.3544037342071533, "step": 11130 }, { "epoch": 0.5300952380952381, "grad_norm": 0.029914598912000656, "learning_rate": 0.024000000208616257, "loss": 2.3619093894958496, "step": 11132 }, { "epoch": 0.5301904761904762, "grad_norm": 0.03066035360097885, "learning_rate": 0.024000000208616257, "loss": 2.3275694847106934, "step": 11134 }, { "epoch": 0.5302857142857142, "grad_norm": 0.028541622683405876, "learning_rate": 0.024000000208616257, "loss": 2.38793683052063, "step": 11136 }, { "epoch": 0.5303809523809524, "grad_norm": 0.02721686102449894, "learning_rate": 0.024000000208616257, "loss": 2.4074301719665527, "step": 11138 }, { "epoch": 0.5304761904761904, "grad_norm": 0.02796047553420067, "learning_rate": 0.024000000208616257, "loss": 2.407209873199463, "step": 11140 }, { "epoch": 0.5305714285714286, "grad_norm": 0.027987850829958916, "learning_rate": 0.024000000208616257, "loss": 2.365279197692871, "step": 11142 }, { "epoch": 0.5306666666666666, "grad_norm": 0.027056042104959488, "learning_rate": 0.024000000208616257, "loss": 2.3440940380096436, "step": 11144 }, { "epoch": 0.5307619047619048, "grad_norm": 0.027407553046941757, "learning_rate": 0.024000000208616257, "loss": 2.3624470233917236, "step": 11146 }, { "epoch": 0.5308571428571428, "grad_norm": 0.029195748269557953, "learning_rate": 0.024000000208616257, "loss": 2.3518383502960205, "step": 11148 }, { "epoch": 0.530952380952381, "grad_norm": 0.027737673372030258, "learning_rate": 0.024000000208616257, "loss": 2.382370948791504, "step": 11150 }, { "epoch": 0.5310476190476191, "grad_norm": 0.02785484679043293, "learning_rate": 0.024000000208616257, "loss": 2.377800941467285, "step": 11152 }, { "epoch": 0.5311428571428571, "grad_norm": 0.02955338917672634, "learning_rate": 0.024000000208616257, "loss": 2.385396957397461, "step": 11154 }, { "epoch": 0.5312380952380953, "grad_norm": 0.027256552129983902, "learning_rate": 0.024000000208616257, "loss": 2.3587851524353027, "step": 11156 }, { "epoch": 0.5313333333333333, "grad_norm": 0.027779756113886833, "learning_rate": 0.024000000208616257, "loss": 2.395404815673828, "step": 11158 }, { "epoch": 0.5314285714285715, "grad_norm": 0.028377661481499672, "learning_rate": 0.024000000208616257, "loss": 2.355616569519043, "step": 11160 }, { "epoch": 0.5315238095238095, "grad_norm": 0.026550384238362312, "learning_rate": 0.024000000208616257, "loss": 2.3815488815307617, "step": 11162 }, { "epoch": 0.5316190476190477, "grad_norm": 0.029107529670000076, "learning_rate": 0.024000000208616257, "loss": 2.386756181716919, "step": 11164 }, { "epoch": 0.5317142857142857, "grad_norm": 0.027550548315048218, "learning_rate": 0.024000000208616257, "loss": 2.4085843563079834, "step": 11166 }, { "epoch": 0.5318095238095238, "grad_norm": 0.026696396991610527, "learning_rate": 0.024000000208616257, "loss": 2.368638277053833, "step": 11168 }, { "epoch": 0.5319047619047619, "grad_norm": 0.029446523636579514, "learning_rate": 0.024000000208616257, "loss": 2.3419272899627686, "step": 11170 }, { "epoch": 0.532, "grad_norm": 0.03325372561812401, "learning_rate": 0.024000000208616257, "loss": 2.365987539291382, "step": 11172 }, { "epoch": 0.5320952380952381, "grad_norm": 0.031305115669965744, "learning_rate": 0.024000000208616257, "loss": 2.3478620052337646, "step": 11174 }, { "epoch": 0.5321904761904762, "grad_norm": 0.027045704424381256, "learning_rate": 0.024000000208616257, "loss": 2.347343683242798, "step": 11176 }, { "epoch": 0.5322857142857143, "grad_norm": 0.03274499997496605, "learning_rate": 0.024000000208616257, "loss": 2.3712480068206787, "step": 11178 }, { "epoch": 0.5323809523809524, "grad_norm": 0.027391299605369568, "learning_rate": 0.024000000208616257, "loss": 2.353050470352173, "step": 11180 }, { "epoch": 0.5324761904761904, "grad_norm": 0.02877148613333702, "learning_rate": 0.024000000208616257, "loss": 2.350368022918701, "step": 11182 }, { "epoch": 0.5325714285714286, "grad_norm": 0.027596522122621536, "learning_rate": 0.024000000208616257, "loss": 2.3735809326171875, "step": 11184 }, { "epoch": 0.5326666666666666, "grad_norm": 0.027726229280233383, "learning_rate": 0.024000000208616257, "loss": 2.3483333587646484, "step": 11186 }, { "epoch": 0.5327619047619048, "grad_norm": 0.026665691286325455, "learning_rate": 0.024000000208616257, "loss": 2.332397222518921, "step": 11188 }, { "epoch": 0.5328571428571428, "grad_norm": 0.02678600139915943, "learning_rate": 0.024000000208616257, "loss": 2.344310760498047, "step": 11190 }, { "epoch": 0.532952380952381, "grad_norm": 0.0275727491825819, "learning_rate": 0.024000000208616257, "loss": 2.363680839538574, "step": 11192 }, { "epoch": 0.533047619047619, "grad_norm": 0.02749115787446499, "learning_rate": 0.024000000208616257, "loss": 2.3786463737487793, "step": 11194 }, { "epoch": 0.5331428571428571, "grad_norm": 0.02801203541457653, "learning_rate": 0.024000000208616257, "loss": 2.313913583755493, "step": 11196 }, { "epoch": 0.5332380952380953, "grad_norm": 0.029240012168884277, "learning_rate": 0.024000000208616257, "loss": 2.363111972808838, "step": 11198 }, { "epoch": 0.5333333333333333, "grad_norm": 0.026617715135216713, "learning_rate": 0.024000000208616257, "loss": 2.371135711669922, "step": 11200 }, { "epoch": 0.5334285714285715, "grad_norm": 0.026866406202316284, "learning_rate": 0.024000000208616257, "loss": 2.3525633811950684, "step": 11202 }, { "epoch": 0.5335238095238095, "grad_norm": 0.029019754379987717, "learning_rate": 0.024000000208616257, "loss": 2.401376485824585, "step": 11204 }, { "epoch": 0.5336190476190477, "grad_norm": 0.02689780667424202, "learning_rate": 0.024000000208616257, "loss": 2.3599209785461426, "step": 11206 }, { "epoch": 0.5337142857142857, "grad_norm": 0.030253170058131218, "learning_rate": 0.024000000208616257, "loss": 2.371490001678467, "step": 11208 }, { "epoch": 0.5338095238095238, "grad_norm": 0.02697974257171154, "learning_rate": 0.024000000208616257, "loss": 2.3434603214263916, "step": 11210 }, { "epoch": 0.5339047619047619, "grad_norm": 0.027974454686045647, "learning_rate": 0.024000000208616257, "loss": 2.3613295555114746, "step": 11212 }, { "epoch": 0.534, "grad_norm": 0.02982674539089203, "learning_rate": 0.024000000208616257, "loss": 2.3797645568847656, "step": 11214 }, { "epoch": 0.5340952380952381, "grad_norm": 0.026322640478610992, "learning_rate": 0.024000000208616257, "loss": 2.366943359375, "step": 11216 }, { "epoch": 0.5341904761904762, "grad_norm": 0.0302659273147583, "learning_rate": 0.024000000208616257, "loss": 2.3664722442626953, "step": 11218 }, { "epoch": 0.5342857142857143, "grad_norm": 0.02764955535531044, "learning_rate": 0.024000000208616257, "loss": 2.369924545288086, "step": 11220 }, { "epoch": 0.5343809523809524, "grad_norm": 0.030198704451322556, "learning_rate": 0.024000000208616257, "loss": 2.3867878913879395, "step": 11222 }, { "epoch": 0.5344761904761904, "grad_norm": 0.028805473819375038, "learning_rate": 0.024000000208616257, "loss": 2.3587377071380615, "step": 11224 }, { "epoch": 0.5345714285714286, "grad_norm": 0.0269580390304327, "learning_rate": 0.024000000208616257, "loss": 2.3616998195648193, "step": 11226 }, { "epoch": 0.5346666666666666, "grad_norm": 0.02750840038061142, "learning_rate": 0.024000000208616257, "loss": 2.375352382659912, "step": 11228 }, { "epoch": 0.5347619047619048, "grad_norm": 0.029530763626098633, "learning_rate": 0.024000000208616257, "loss": 2.38437557220459, "step": 11230 }, { "epoch": 0.5348571428571428, "grad_norm": 0.027558201923966408, "learning_rate": 0.024000000208616257, "loss": 2.354940891265869, "step": 11232 }, { "epoch": 0.534952380952381, "grad_norm": 0.02874298393726349, "learning_rate": 0.024000000208616257, "loss": 2.3428750038146973, "step": 11234 }, { "epoch": 0.535047619047619, "grad_norm": 0.02806907147169113, "learning_rate": 0.024000000208616257, "loss": 2.3691482543945312, "step": 11236 }, { "epoch": 0.5351428571428571, "grad_norm": 0.02738245017826557, "learning_rate": 0.024000000208616257, "loss": 2.3742940425872803, "step": 11238 }, { "epoch": 0.5352380952380953, "grad_norm": 0.02597632445394993, "learning_rate": 0.024000000208616257, "loss": 2.3279552459716797, "step": 11240 }, { "epoch": 0.5353333333333333, "grad_norm": 0.02695298194885254, "learning_rate": 0.024000000208616257, "loss": 2.3330740928649902, "step": 11242 }, { "epoch": 0.5354285714285715, "grad_norm": 0.025878259912133217, "learning_rate": 0.024000000208616257, "loss": 2.392328977584839, "step": 11244 }, { "epoch": 0.5355238095238095, "grad_norm": 0.02664206549525261, "learning_rate": 0.024000000208616257, "loss": 2.3753774166107178, "step": 11246 }, { "epoch": 0.5356190476190477, "grad_norm": 0.02691582404077053, "learning_rate": 0.024000000208616257, "loss": 2.3392393589019775, "step": 11248 }, { "epoch": 0.5357142857142857, "grad_norm": 0.027866017073392868, "learning_rate": 0.024000000208616257, "loss": 2.379930019378662, "step": 11250 }, { "epoch": 0.5358095238095238, "grad_norm": 0.02889213338494301, "learning_rate": 0.024000000208616257, "loss": 2.3540284633636475, "step": 11252 }, { "epoch": 0.5359047619047619, "grad_norm": 0.029019227251410484, "learning_rate": 0.024000000208616257, "loss": 2.3030784130096436, "step": 11254 }, { "epoch": 0.536, "grad_norm": 0.02821970358490944, "learning_rate": 0.024000000208616257, "loss": 2.328108310699463, "step": 11256 }, { "epoch": 0.5360952380952381, "grad_norm": 0.03890227526426315, "learning_rate": 0.024000000208616257, "loss": 2.344332218170166, "step": 11258 }, { "epoch": 0.5361904761904762, "grad_norm": 0.03116464614868164, "learning_rate": 0.024000000208616257, "loss": 2.363426685333252, "step": 11260 }, { "epoch": 0.5362857142857143, "grad_norm": 0.0287016611546278, "learning_rate": 0.024000000208616257, "loss": 2.35280179977417, "step": 11262 }, { "epoch": 0.5363809523809524, "grad_norm": 0.026743680238723755, "learning_rate": 0.024000000208616257, "loss": 2.3729398250579834, "step": 11264 }, { "epoch": 0.5364761904761904, "grad_norm": 0.02783118560910225, "learning_rate": 0.024000000208616257, "loss": 2.3434650897979736, "step": 11266 }, { "epoch": 0.5365714285714286, "grad_norm": 0.028421372175216675, "learning_rate": 0.024000000208616257, "loss": 2.344041347503662, "step": 11268 }, { "epoch": 0.5366666666666666, "grad_norm": 0.028583701699972153, "learning_rate": 0.024000000208616257, "loss": 2.354079246520996, "step": 11270 }, { "epoch": 0.5367619047619048, "grad_norm": 0.027852723374962807, "learning_rate": 0.024000000208616257, "loss": 2.321941614151001, "step": 11272 }, { "epoch": 0.5368571428571428, "grad_norm": 0.02842511236667633, "learning_rate": 0.024000000208616257, "loss": 2.3423471450805664, "step": 11274 }, { "epoch": 0.536952380952381, "grad_norm": 0.02788008563220501, "learning_rate": 0.024000000208616257, "loss": 2.381067991256714, "step": 11276 }, { "epoch": 0.537047619047619, "grad_norm": 0.029230304062366486, "learning_rate": 0.024000000208616257, "loss": 2.350654125213623, "step": 11278 }, { "epoch": 0.5371428571428571, "grad_norm": 0.02772466279566288, "learning_rate": 0.024000000208616257, "loss": 2.3466334342956543, "step": 11280 }, { "epoch": 0.5372380952380953, "grad_norm": 0.027043815702199936, "learning_rate": 0.024000000208616257, "loss": 2.3325819969177246, "step": 11282 }, { "epoch": 0.5373333333333333, "grad_norm": 0.0284291822463274, "learning_rate": 0.024000000208616257, "loss": 2.315737724304199, "step": 11284 }, { "epoch": 0.5374285714285715, "grad_norm": 0.028794461861252785, "learning_rate": 0.024000000208616257, "loss": 2.309389591217041, "step": 11286 }, { "epoch": 0.5375238095238095, "grad_norm": 0.027796590700745583, "learning_rate": 0.024000000208616257, "loss": 2.351919412612915, "step": 11288 }, { "epoch": 0.5376190476190477, "grad_norm": 0.02857709862291813, "learning_rate": 0.024000000208616257, "loss": 2.3385977745056152, "step": 11290 }, { "epoch": 0.5377142857142857, "grad_norm": 0.027550075203180313, "learning_rate": 0.024000000208616257, "loss": 2.3347578048706055, "step": 11292 }, { "epoch": 0.5378095238095238, "grad_norm": 0.02713826857507229, "learning_rate": 0.024000000208616257, "loss": 2.3463428020477295, "step": 11294 }, { "epoch": 0.5379047619047619, "grad_norm": 0.027881138026714325, "learning_rate": 0.024000000208616257, "loss": 2.307072162628174, "step": 11296 }, { "epoch": 0.538, "grad_norm": 0.027384445071220398, "learning_rate": 0.024000000208616257, "loss": 2.322704553604126, "step": 11298 }, { "epoch": 0.5380952380952381, "grad_norm": 0.02742314152419567, "learning_rate": 0.024000000208616257, "loss": 2.352038860321045, "step": 11300 }, { "epoch": 0.5381904761904762, "grad_norm": 0.03344586491584778, "learning_rate": 0.024000000208616257, "loss": 2.363370895385742, "step": 11302 }, { "epoch": 0.5382857142857143, "grad_norm": 0.026863789185881615, "learning_rate": 0.024000000208616257, "loss": 2.315906524658203, "step": 11304 }, { "epoch": 0.5383809523809524, "grad_norm": 0.028193460777401924, "learning_rate": 0.024000000208616257, "loss": 2.327467441558838, "step": 11306 }, { "epoch": 0.5384761904761904, "grad_norm": 0.02713138610124588, "learning_rate": 0.024000000208616257, "loss": 2.372037410736084, "step": 11308 }, { "epoch": 0.5385714285714286, "grad_norm": 0.02603268064558506, "learning_rate": 0.024000000208616257, "loss": 2.352116107940674, "step": 11310 }, { "epoch": 0.5386666666666666, "grad_norm": 0.030325913801789284, "learning_rate": 0.024000000208616257, "loss": 2.323071002960205, "step": 11312 }, { "epoch": 0.5387619047619048, "grad_norm": 0.0349159762263298, "learning_rate": 0.024000000208616257, "loss": 2.336726665496826, "step": 11314 }, { "epoch": 0.5388571428571428, "grad_norm": 0.030010191723704338, "learning_rate": 0.024000000208616257, "loss": 2.3407516479492188, "step": 11316 }, { "epoch": 0.538952380952381, "grad_norm": 0.0318528488278389, "learning_rate": 0.024000000208616257, "loss": 2.3268747329711914, "step": 11318 }, { "epoch": 0.539047619047619, "grad_norm": 0.0325266532599926, "learning_rate": 0.024000000208616257, "loss": 2.3324804306030273, "step": 11320 }, { "epoch": 0.5391428571428571, "grad_norm": 0.02628404274582863, "learning_rate": 0.024000000208616257, "loss": 2.3390073776245117, "step": 11322 }, { "epoch": 0.5392380952380952, "grad_norm": 0.027256371453404427, "learning_rate": 0.024000000208616257, "loss": 2.3394694328308105, "step": 11324 }, { "epoch": 0.5393333333333333, "grad_norm": 0.027137132361531258, "learning_rate": 0.024000000208616257, "loss": 2.3127965927124023, "step": 11326 }, { "epoch": 0.5394285714285715, "grad_norm": 0.028431594371795654, "learning_rate": 0.024000000208616257, "loss": 2.3514933586120605, "step": 11328 }, { "epoch": 0.5395238095238095, "grad_norm": 0.029106322675943375, "learning_rate": 0.024000000208616257, "loss": 2.3167471885681152, "step": 11330 }, { "epoch": 0.5396190476190477, "grad_norm": 0.030645618215203285, "learning_rate": 0.024000000208616257, "loss": 2.346553325653076, "step": 11332 }, { "epoch": 0.5397142857142857, "grad_norm": 0.027858396992087364, "learning_rate": 0.024000000208616257, "loss": 2.316018581390381, "step": 11334 }, { "epoch": 0.5398095238095239, "grad_norm": 0.02922271564602852, "learning_rate": 0.024000000208616257, "loss": 2.3240671157836914, "step": 11336 }, { "epoch": 0.5399047619047619, "grad_norm": 0.02769148163497448, "learning_rate": 0.024000000208616257, "loss": 2.3137869834899902, "step": 11338 }, { "epoch": 0.54, "grad_norm": 0.03195439651608467, "learning_rate": 0.024000000208616257, "loss": 2.3355460166931152, "step": 11340 }, { "epoch": 0.5400952380952381, "grad_norm": 0.02968500182032585, "learning_rate": 0.024000000208616257, "loss": 2.3550500869750977, "step": 11342 }, { "epoch": 0.5401904761904762, "grad_norm": 0.027186688035726547, "learning_rate": 0.024000000208616257, "loss": 2.343122959136963, "step": 11344 }, { "epoch": 0.5402857142857143, "grad_norm": 0.026452461257576942, "learning_rate": 0.024000000208616257, "loss": 2.2987594604492188, "step": 11346 }, { "epoch": 0.5403809523809524, "grad_norm": 0.029168227687478065, "learning_rate": 0.024000000208616257, "loss": 2.319884777069092, "step": 11348 }, { "epoch": 0.5404761904761904, "grad_norm": 0.026836229488253593, "learning_rate": 0.024000000208616257, "loss": 2.326570510864258, "step": 11350 }, { "epoch": 0.5405714285714286, "grad_norm": 0.026590637862682343, "learning_rate": 0.024000000208616257, "loss": 2.3542263507843018, "step": 11352 }, { "epoch": 0.5406666666666666, "grad_norm": 0.02848634496331215, "learning_rate": 0.024000000208616257, "loss": 2.353811025619507, "step": 11354 }, { "epoch": 0.5407619047619048, "grad_norm": 0.026729915291070938, "learning_rate": 0.024000000208616257, "loss": 2.3356571197509766, "step": 11356 }, { "epoch": 0.5408571428571428, "grad_norm": 0.027239976450800896, "learning_rate": 0.024000000208616257, "loss": 2.3033957481384277, "step": 11358 }, { "epoch": 0.540952380952381, "grad_norm": 0.028224997222423553, "learning_rate": 0.024000000208616257, "loss": 2.3063106536865234, "step": 11360 }, { "epoch": 0.541047619047619, "grad_norm": 0.02719128131866455, "learning_rate": 0.024000000208616257, "loss": 2.2901268005371094, "step": 11362 }, { "epoch": 0.5411428571428571, "grad_norm": 0.02844875305891037, "learning_rate": 0.024000000208616257, "loss": 2.3139028549194336, "step": 11364 }, { "epoch": 0.5412380952380952, "grad_norm": 0.027386561036109924, "learning_rate": 0.024000000208616257, "loss": 2.3276259899139404, "step": 11366 }, { "epoch": 0.5413333333333333, "grad_norm": 0.027147848159074783, "learning_rate": 0.024000000208616257, "loss": 2.329568862915039, "step": 11368 }, { "epoch": 0.5414285714285715, "grad_norm": 0.02728341519832611, "learning_rate": 0.024000000208616257, "loss": 2.3267714977264404, "step": 11370 }, { "epoch": 0.5415238095238095, "grad_norm": 0.03087979182600975, "learning_rate": 0.024000000208616257, "loss": 2.3554744720458984, "step": 11372 }, { "epoch": 0.5416190476190477, "grad_norm": 0.02672078087925911, "learning_rate": 0.024000000208616257, "loss": 2.302905797958374, "step": 11374 }, { "epoch": 0.5417142857142857, "grad_norm": 0.027271756902337074, "learning_rate": 0.024000000208616257, "loss": 2.3443007469177246, "step": 11376 }, { "epoch": 0.5418095238095239, "grad_norm": 0.028215689584612846, "learning_rate": 0.024000000208616257, "loss": 2.327751636505127, "step": 11378 }, { "epoch": 0.5419047619047619, "grad_norm": 0.027604691684246063, "learning_rate": 0.024000000208616257, "loss": 2.3244810104370117, "step": 11380 }, { "epoch": 0.542, "grad_norm": 0.03482496365904808, "learning_rate": 0.024000000208616257, "loss": 2.3189103603363037, "step": 11382 }, { "epoch": 0.5420952380952381, "grad_norm": 0.02731895260512829, "learning_rate": 0.024000000208616257, "loss": 2.3393666744232178, "step": 11384 }, { "epoch": 0.5421904761904762, "grad_norm": 0.027753904461860657, "learning_rate": 0.024000000208616257, "loss": 2.297027587890625, "step": 11386 }, { "epoch": 0.5422857142857143, "grad_norm": 0.027554703876376152, "learning_rate": 0.024000000208616257, "loss": 2.3342299461364746, "step": 11388 }, { "epoch": 0.5423809523809524, "grad_norm": 0.026128727942705154, "learning_rate": 0.024000000208616257, "loss": 2.3422980308532715, "step": 11390 }, { "epoch": 0.5424761904761904, "grad_norm": 0.028191369026899338, "learning_rate": 0.024000000208616257, "loss": 2.3168540000915527, "step": 11392 }, { "epoch": 0.5425714285714286, "grad_norm": 0.02873975783586502, "learning_rate": 0.024000000208616257, "loss": 2.32405424118042, "step": 11394 }, { "epoch": 0.5426666666666666, "grad_norm": 0.027144305408000946, "learning_rate": 0.024000000208616257, "loss": 2.324606418609619, "step": 11396 }, { "epoch": 0.5427619047619048, "grad_norm": 0.029704570770263672, "learning_rate": 0.024000000208616257, "loss": 2.3326940536499023, "step": 11398 }, { "epoch": 0.5428571428571428, "grad_norm": 0.03382531553506851, "learning_rate": 0.024000000208616257, "loss": 2.3406944274902344, "step": 11400 }, { "epoch": 0.542952380952381, "grad_norm": 0.030125193297863007, "learning_rate": 0.024000000208616257, "loss": 2.3276166915893555, "step": 11402 }, { "epoch": 0.543047619047619, "grad_norm": 0.02921150252223015, "learning_rate": 0.024000000208616257, "loss": 2.3157100677490234, "step": 11404 }, { "epoch": 0.5431428571428571, "grad_norm": 0.02838355116546154, "learning_rate": 0.024000000208616257, "loss": 2.355225086212158, "step": 11406 }, { "epoch": 0.5432380952380952, "grad_norm": 0.026412522420287132, "learning_rate": 0.024000000208616257, "loss": 2.2637782096862793, "step": 11408 }, { "epoch": 0.5433333333333333, "grad_norm": 0.02890828251838684, "learning_rate": 0.024000000208616257, "loss": 2.310126304626465, "step": 11410 }, { "epoch": 0.5434285714285715, "grad_norm": 0.027001991868019104, "learning_rate": 0.024000000208616257, "loss": 2.34928822517395, "step": 11412 }, { "epoch": 0.5435238095238095, "grad_norm": 0.02838956192135811, "learning_rate": 0.024000000208616257, "loss": 2.3389601707458496, "step": 11414 }, { "epoch": 0.5436190476190477, "grad_norm": 0.028525574132800102, "learning_rate": 0.024000000208616257, "loss": 2.298464775085449, "step": 11416 }, { "epoch": 0.5437142857142857, "grad_norm": 0.029226722195744514, "learning_rate": 0.024000000208616257, "loss": 2.3607170581817627, "step": 11418 }, { "epoch": 0.5438095238095239, "grad_norm": 0.02888612449169159, "learning_rate": 0.024000000208616257, "loss": 2.341249465942383, "step": 11420 }, { "epoch": 0.5439047619047619, "grad_norm": 0.028292596340179443, "learning_rate": 0.024000000208616257, "loss": 2.3353967666625977, "step": 11422 }, { "epoch": 0.544, "grad_norm": 0.02623925171792507, "learning_rate": 0.024000000208616257, "loss": 2.2992746829986572, "step": 11424 }, { "epoch": 0.5440952380952381, "grad_norm": 0.02578444965183735, "learning_rate": 0.024000000208616257, "loss": 2.2933833599090576, "step": 11426 }, { "epoch": 0.5441904761904762, "grad_norm": 0.02662685140967369, "learning_rate": 0.024000000208616257, "loss": 2.3377604484558105, "step": 11428 }, { "epoch": 0.5442857142857143, "grad_norm": 0.026670515537261963, "learning_rate": 0.024000000208616257, "loss": 2.3214359283447266, "step": 11430 }, { "epoch": 0.5443809523809524, "grad_norm": 0.02957085892558098, "learning_rate": 0.024000000208616257, "loss": 2.3313357830047607, "step": 11432 }, { "epoch": 0.5444761904761904, "grad_norm": 0.028309449553489685, "learning_rate": 0.024000000208616257, "loss": 2.338141918182373, "step": 11434 }, { "epoch": 0.5445714285714286, "grad_norm": 0.02861526422202587, "learning_rate": 0.024000000208616257, "loss": 2.3354530334472656, "step": 11436 }, { "epoch": 0.5446666666666666, "grad_norm": 0.026940099895000458, "learning_rate": 0.024000000208616257, "loss": 2.360922336578369, "step": 11438 }, { "epoch": 0.5447619047619048, "grad_norm": 0.02660289965569973, "learning_rate": 0.024000000208616257, "loss": 2.3238401412963867, "step": 11440 }, { "epoch": 0.5448571428571428, "grad_norm": 0.0282294899225235, "learning_rate": 0.024000000208616257, "loss": 2.3038415908813477, "step": 11442 }, { "epoch": 0.544952380952381, "grad_norm": 0.026802964508533478, "learning_rate": 0.024000000208616257, "loss": 2.3280913829803467, "step": 11444 }, { "epoch": 0.545047619047619, "grad_norm": 0.02935916930437088, "learning_rate": 0.024000000208616257, "loss": 2.340754508972168, "step": 11446 }, { "epoch": 0.5451428571428572, "grad_norm": 0.027455341070890427, "learning_rate": 0.024000000208616257, "loss": 2.335204601287842, "step": 11448 }, { "epoch": 0.5452380952380952, "grad_norm": 0.02842528373003006, "learning_rate": 0.024000000208616257, "loss": 2.3018689155578613, "step": 11450 }, { "epoch": 0.5453333333333333, "grad_norm": 0.027580365538597107, "learning_rate": 0.024000000208616257, "loss": 2.326573371887207, "step": 11452 }, { "epoch": 0.5454285714285714, "grad_norm": 0.03127443045377731, "learning_rate": 0.024000000208616257, "loss": 2.351747989654541, "step": 11454 }, { "epoch": 0.5455238095238095, "grad_norm": 0.03176545724272728, "learning_rate": 0.024000000208616257, "loss": 2.337864637374878, "step": 11456 }, { "epoch": 0.5456190476190477, "grad_norm": 0.03121347166597843, "learning_rate": 0.024000000208616257, "loss": 2.3298590183258057, "step": 11458 }, { "epoch": 0.5457142857142857, "grad_norm": 0.029158752411603928, "learning_rate": 0.024000000208616257, "loss": 2.3382937908172607, "step": 11460 }, { "epoch": 0.5458095238095239, "grad_norm": 0.027094358578324318, "learning_rate": 0.024000000208616257, "loss": 2.307648181915283, "step": 11462 }, { "epoch": 0.5459047619047619, "grad_norm": 0.02719585970044136, "learning_rate": 0.024000000208616257, "loss": 2.3512940406799316, "step": 11464 }, { "epoch": 0.546, "grad_norm": 0.02779252454638481, "learning_rate": 0.024000000208616257, "loss": 2.350095748901367, "step": 11466 }, { "epoch": 0.5460952380952381, "grad_norm": 0.026557421311736107, "learning_rate": 0.024000000208616257, "loss": 2.328439235687256, "step": 11468 }, { "epoch": 0.5461904761904762, "grad_norm": 0.027461452409625053, "learning_rate": 0.024000000208616257, "loss": 2.3291854858398438, "step": 11470 }, { "epoch": 0.5462857142857143, "grad_norm": 0.02789386734366417, "learning_rate": 0.024000000208616257, "loss": 2.325148105621338, "step": 11472 }, { "epoch": 0.5463809523809524, "grad_norm": 0.026754075661301613, "learning_rate": 0.024000000208616257, "loss": 2.3358876705169678, "step": 11474 }, { "epoch": 0.5464761904761904, "grad_norm": 0.02665163017809391, "learning_rate": 0.024000000208616257, "loss": 2.3180582523345947, "step": 11476 }, { "epoch": 0.5465714285714286, "grad_norm": 0.02642993815243244, "learning_rate": 0.024000000208616257, "loss": 2.321228504180908, "step": 11478 }, { "epoch": 0.5466666666666666, "grad_norm": 0.0265633687376976, "learning_rate": 0.024000000208616257, "loss": 2.3382656574249268, "step": 11480 }, { "epoch": 0.5467619047619048, "grad_norm": 0.02903806045651436, "learning_rate": 0.024000000208616257, "loss": 2.344818592071533, "step": 11482 }, { "epoch": 0.5468571428571428, "grad_norm": 0.028489191085100174, "learning_rate": 0.024000000208616257, "loss": 2.339078426361084, "step": 11484 }, { "epoch": 0.546952380952381, "grad_norm": 0.02753620222210884, "learning_rate": 0.024000000208616257, "loss": 2.3757481575012207, "step": 11486 }, { "epoch": 0.547047619047619, "grad_norm": 0.027713865041732788, "learning_rate": 0.024000000208616257, "loss": 2.336677312850952, "step": 11488 }, { "epoch": 0.5471428571428572, "grad_norm": 0.025728750973939896, "learning_rate": 0.024000000208616257, "loss": 2.3227033615112305, "step": 11490 }, { "epoch": 0.5472380952380952, "grad_norm": 0.033267516642808914, "learning_rate": 0.024000000208616257, "loss": 2.345290422439575, "step": 11492 }, { "epoch": 0.5473333333333333, "grad_norm": 0.02624606341123581, "learning_rate": 0.024000000208616257, "loss": 2.342960834503174, "step": 11494 }, { "epoch": 0.5474285714285714, "grad_norm": 0.027091940864920616, "learning_rate": 0.024000000208616257, "loss": 2.350767135620117, "step": 11496 }, { "epoch": 0.5475238095238095, "grad_norm": 0.028821831569075584, "learning_rate": 0.024000000208616257, "loss": 2.3253750801086426, "step": 11498 }, { "epoch": 0.5476190476190477, "grad_norm": 0.028333749622106552, "learning_rate": 0.024000000208616257, "loss": 2.352839469909668, "step": 11500 }, { "epoch": 0.5477142857142857, "grad_norm": 0.027134481817483902, "learning_rate": 0.024000000208616257, "loss": 2.341758966445923, "step": 11502 }, { "epoch": 0.5478095238095239, "grad_norm": 0.02842690981924534, "learning_rate": 0.024000000208616257, "loss": 2.320737361907959, "step": 11504 }, { "epoch": 0.5479047619047619, "grad_norm": 0.026952853426337242, "learning_rate": 0.024000000208616257, "loss": 2.336824417114258, "step": 11506 }, { "epoch": 0.548, "grad_norm": 0.02725117839872837, "learning_rate": 0.024000000208616257, "loss": 2.317333936691284, "step": 11508 }, { "epoch": 0.5480952380952381, "grad_norm": 0.028060687705874443, "learning_rate": 0.024000000208616257, "loss": 2.341157913208008, "step": 11510 }, { "epoch": 0.5481904761904762, "grad_norm": 0.026077980175614357, "learning_rate": 0.024000000208616257, "loss": 2.3464975357055664, "step": 11512 }, { "epoch": 0.5482857142857143, "grad_norm": 0.026468636468052864, "learning_rate": 0.024000000208616257, "loss": 2.3564586639404297, "step": 11514 }, { "epoch": 0.5483809523809524, "grad_norm": 0.02702043019235134, "learning_rate": 0.024000000208616257, "loss": 2.3315463066101074, "step": 11516 }, { "epoch": 0.5484761904761905, "grad_norm": 0.02828012965619564, "learning_rate": 0.024000000208616257, "loss": 2.3468642234802246, "step": 11518 }, { "epoch": 0.5485714285714286, "grad_norm": 0.027702011168003082, "learning_rate": 0.024000000208616257, "loss": 2.3332180976867676, "step": 11520 }, { "epoch": 0.5486666666666666, "grad_norm": 0.02634279802441597, "learning_rate": 0.024000000208616257, "loss": 2.3043928146362305, "step": 11522 }, { "epoch": 0.5487619047619048, "grad_norm": 0.02636764571070671, "learning_rate": 0.024000000208616257, "loss": 2.3362245559692383, "step": 11524 }, { "epoch": 0.5488571428571428, "grad_norm": 0.02783423475921154, "learning_rate": 0.024000000208616257, "loss": 2.342878818511963, "step": 11526 }, { "epoch": 0.548952380952381, "grad_norm": 0.027032919228076935, "learning_rate": 0.024000000208616257, "loss": 2.3478546142578125, "step": 11528 }, { "epoch": 0.549047619047619, "grad_norm": 0.02703034318983555, "learning_rate": 0.024000000208616257, "loss": 2.3160433769226074, "step": 11530 }, { "epoch": 0.5491428571428572, "grad_norm": 0.02775966003537178, "learning_rate": 0.024000000208616257, "loss": 2.346668243408203, "step": 11532 }, { "epoch": 0.5492380952380952, "grad_norm": 0.026943642646074295, "learning_rate": 0.024000000208616257, "loss": 2.333831787109375, "step": 11534 }, { "epoch": 0.5493333333333333, "grad_norm": 0.02711714617908001, "learning_rate": 0.024000000208616257, "loss": 2.357212543487549, "step": 11536 }, { "epoch": 0.5494285714285714, "grad_norm": 0.02846549078822136, "learning_rate": 0.024000000208616257, "loss": 2.3608086109161377, "step": 11538 }, { "epoch": 0.5495238095238095, "grad_norm": 0.02907215990126133, "learning_rate": 0.024000000208616257, "loss": 2.3233518600463867, "step": 11540 }, { "epoch": 0.5496190476190477, "grad_norm": 0.030146010220050812, "learning_rate": 0.024000000208616257, "loss": 2.368389129638672, "step": 11542 }, { "epoch": 0.5497142857142857, "grad_norm": 0.027005961164832115, "learning_rate": 0.024000000208616257, "loss": 2.3474745750427246, "step": 11544 }, { "epoch": 0.5498095238095239, "grad_norm": 0.027069371193647385, "learning_rate": 0.024000000208616257, "loss": 2.330440044403076, "step": 11546 }, { "epoch": 0.5499047619047619, "grad_norm": 0.02675453945994377, "learning_rate": 0.024000000208616257, "loss": 2.3367724418640137, "step": 11548 }, { "epoch": 0.55, "grad_norm": 0.027197476476430893, "learning_rate": 0.024000000208616257, "loss": 2.362034320831299, "step": 11550 }, { "epoch": 0.5500952380952381, "grad_norm": 0.026587283238768578, "learning_rate": 0.024000000208616257, "loss": 2.3671979904174805, "step": 11552 }, { "epoch": 0.5501904761904762, "grad_norm": 0.028690287843346596, "learning_rate": 0.024000000208616257, "loss": 2.358546018600464, "step": 11554 }, { "epoch": 0.5502857142857143, "grad_norm": 0.02589850127696991, "learning_rate": 0.024000000208616257, "loss": 2.345900535583496, "step": 11556 }, { "epoch": 0.5503809523809524, "grad_norm": 0.02757401205599308, "learning_rate": 0.024000000208616257, "loss": 2.33786678314209, "step": 11558 }, { "epoch": 0.5504761904761905, "grad_norm": 0.028887109830975533, "learning_rate": 0.024000000208616257, "loss": 2.3855342864990234, "step": 11560 }, { "epoch": 0.5505714285714286, "grad_norm": 0.03011605143547058, "learning_rate": 0.024000000208616257, "loss": 2.361937999725342, "step": 11562 }, { "epoch": 0.5506666666666666, "grad_norm": 0.028911270201206207, "learning_rate": 0.024000000208616257, "loss": 2.346250534057617, "step": 11564 }, { "epoch": 0.5507619047619048, "grad_norm": 0.02961224690079689, "learning_rate": 0.024000000208616257, "loss": 2.3415703773498535, "step": 11566 }, { "epoch": 0.5508571428571428, "grad_norm": 0.027090098708868027, "learning_rate": 0.024000000208616257, "loss": 2.3599281311035156, "step": 11568 }, { "epoch": 0.550952380952381, "grad_norm": 0.027486391365528107, "learning_rate": 0.024000000208616257, "loss": 2.3865761756896973, "step": 11570 }, { "epoch": 0.551047619047619, "grad_norm": 0.028731338679790497, "learning_rate": 0.024000000208616257, "loss": 2.34623122215271, "step": 11572 }, { "epoch": 0.5511428571428572, "grad_norm": 0.02670573629438877, "learning_rate": 0.024000000208616257, "loss": 2.352410316467285, "step": 11574 }, { "epoch": 0.5512380952380952, "grad_norm": 0.027536876499652863, "learning_rate": 0.024000000208616257, "loss": 2.3282277584075928, "step": 11576 }, { "epoch": 0.5513333333333333, "grad_norm": 0.026344764977693558, "learning_rate": 0.024000000208616257, "loss": 2.354245662689209, "step": 11578 }, { "epoch": 0.5514285714285714, "grad_norm": 0.026564935222268105, "learning_rate": 0.024000000208616257, "loss": 2.3455891609191895, "step": 11580 }, { "epoch": 0.5515238095238095, "grad_norm": 0.02683205157518387, "learning_rate": 0.024000000208616257, "loss": 2.3703951835632324, "step": 11582 }, { "epoch": 0.5516190476190476, "grad_norm": 0.028238506987690926, "learning_rate": 0.024000000208616257, "loss": 2.375764846801758, "step": 11584 }, { "epoch": 0.5517142857142857, "grad_norm": 0.03095724619925022, "learning_rate": 0.024000000208616257, "loss": 2.3551523685455322, "step": 11586 }, { "epoch": 0.5518095238095239, "grad_norm": 0.028508123010396957, "learning_rate": 0.024000000208616257, "loss": 2.3548922538757324, "step": 11588 }, { "epoch": 0.5519047619047619, "grad_norm": 0.02888420596718788, "learning_rate": 0.024000000208616257, "loss": 2.323737859725952, "step": 11590 }, { "epoch": 0.552, "grad_norm": 0.02904219552874565, "learning_rate": 0.024000000208616257, "loss": 2.3881301879882812, "step": 11592 }, { "epoch": 0.5520952380952381, "grad_norm": 0.02667057327926159, "learning_rate": 0.024000000208616257, "loss": 2.3683009147644043, "step": 11594 }, { "epoch": 0.5521904761904762, "grad_norm": 0.027354205027222633, "learning_rate": 0.024000000208616257, "loss": 2.331357955932617, "step": 11596 }, { "epoch": 0.5522857142857143, "grad_norm": 0.027552412822842598, "learning_rate": 0.024000000208616257, "loss": 2.3733839988708496, "step": 11598 }, { "epoch": 0.5523809523809524, "grad_norm": 0.02816098742187023, "learning_rate": 0.024000000208616257, "loss": 2.3592400550842285, "step": 11600 }, { "epoch": 0.5524761904761905, "grad_norm": 0.026311248540878296, "learning_rate": 0.024000000208616257, "loss": 2.3923707008361816, "step": 11602 }, { "epoch": 0.5525714285714286, "grad_norm": 0.027601316571235657, "learning_rate": 0.024000000208616257, "loss": 2.3495290279388428, "step": 11604 }, { "epoch": 0.5526666666666666, "grad_norm": 0.03042791038751602, "learning_rate": 0.024000000208616257, "loss": 2.3523764610290527, "step": 11606 }, { "epoch": 0.5527619047619048, "grad_norm": 0.02999754808843136, "learning_rate": 0.024000000208616257, "loss": 2.3537206649780273, "step": 11608 }, { "epoch": 0.5528571428571428, "grad_norm": 0.02760937809944153, "learning_rate": 0.024000000208616257, "loss": 2.3785505294799805, "step": 11610 }, { "epoch": 0.552952380952381, "grad_norm": 0.03170493245124817, "learning_rate": 0.024000000208616257, "loss": 2.336913585662842, "step": 11612 }, { "epoch": 0.553047619047619, "grad_norm": 0.03565357252955437, "learning_rate": 0.024000000208616257, "loss": 2.3830833435058594, "step": 11614 }, { "epoch": 0.5531428571428572, "grad_norm": 0.032544393092393875, "learning_rate": 0.024000000208616257, "loss": 2.3509232997894287, "step": 11616 }, { "epoch": 0.5532380952380952, "grad_norm": 0.03005436435341835, "learning_rate": 0.024000000208616257, "loss": 2.382276773452759, "step": 11618 }, { "epoch": 0.5533333333333333, "grad_norm": 0.028050849214196205, "learning_rate": 0.024000000208616257, "loss": 2.3539581298828125, "step": 11620 }, { "epoch": 0.5534285714285714, "grad_norm": 0.031884316354990005, "learning_rate": 0.024000000208616257, "loss": 2.374504566192627, "step": 11622 }, { "epoch": 0.5535238095238095, "grad_norm": 0.030841164290905, "learning_rate": 0.024000000208616257, "loss": 2.3495638370513916, "step": 11624 }, { "epoch": 0.5536190476190476, "grad_norm": 0.0320441871881485, "learning_rate": 0.024000000208616257, "loss": 2.3633079528808594, "step": 11626 }, { "epoch": 0.5537142857142857, "grad_norm": 0.03710407018661499, "learning_rate": 0.024000000208616257, "loss": 2.338901996612549, "step": 11628 }, { "epoch": 0.5538095238095239, "grad_norm": 0.03634733706712723, "learning_rate": 0.024000000208616257, "loss": 2.3781137466430664, "step": 11630 }, { "epoch": 0.5539047619047619, "grad_norm": 0.029237018898129463, "learning_rate": 0.024000000208616257, "loss": 2.350100517272949, "step": 11632 }, { "epoch": 0.554, "grad_norm": 0.028966136276721954, "learning_rate": 0.024000000208616257, "loss": 2.3843624591827393, "step": 11634 }, { "epoch": 0.5540952380952381, "grad_norm": 0.028479572385549545, "learning_rate": 0.024000000208616257, "loss": 2.3687233924865723, "step": 11636 }, { "epoch": 0.5541904761904762, "grad_norm": 0.027554329484701157, "learning_rate": 0.024000000208616257, "loss": 2.3665213584899902, "step": 11638 }, { "epoch": 0.5542857142857143, "grad_norm": 0.02754330262541771, "learning_rate": 0.024000000208616257, "loss": 2.4134750366210938, "step": 11640 }, { "epoch": 0.5543809523809524, "grad_norm": 0.026990201324224472, "learning_rate": 0.024000000208616257, "loss": 2.3701086044311523, "step": 11642 }, { "epoch": 0.5544761904761905, "grad_norm": 0.0267369095236063, "learning_rate": 0.024000000208616257, "loss": 2.3446578979492188, "step": 11644 }, { "epoch": 0.5545714285714286, "grad_norm": 0.02691490203142166, "learning_rate": 0.024000000208616257, "loss": 2.3850257396698, "step": 11646 }, { "epoch": 0.5546666666666666, "grad_norm": 0.029200926423072815, "learning_rate": 0.024000000208616257, "loss": 2.3730545043945312, "step": 11648 }, { "epoch": 0.5547619047619048, "grad_norm": 0.028163690119981766, "learning_rate": 0.024000000208616257, "loss": 2.3617539405822754, "step": 11650 }, { "epoch": 0.5548571428571428, "grad_norm": 0.02898457646369934, "learning_rate": 0.024000000208616257, "loss": 2.3833556175231934, "step": 11652 }, { "epoch": 0.554952380952381, "grad_norm": 0.03168214112520218, "learning_rate": 0.024000000208616257, "loss": 2.365738868713379, "step": 11654 }, { "epoch": 0.555047619047619, "grad_norm": 0.02692132443189621, "learning_rate": 0.024000000208616257, "loss": 2.3955206871032715, "step": 11656 }, { "epoch": 0.5551428571428572, "grad_norm": 0.028724946081638336, "learning_rate": 0.024000000208616257, "loss": 2.3970301151275635, "step": 11658 }, { "epoch": 0.5552380952380952, "grad_norm": 0.027694096788764, "learning_rate": 0.024000000208616257, "loss": 2.3709113597869873, "step": 11660 }, { "epoch": 0.5553333333333333, "grad_norm": 0.025902649387717247, "learning_rate": 0.024000000208616257, "loss": 2.3446760177612305, "step": 11662 }, { "epoch": 0.5554285714285714, "grad_norm": 0.028222251683473587, "learning_rate": 0.024000000208616257, "loss": 2.387937068939209, "step": 11664 }, { "epoch": 0.5555238095238095, "grad_norm": 0.02727648615837097, "learning_rate": 0.024000000208616257, "loss": 2.3992462158203125, "step": 11666 }, { "epoch": 0.5556190476190476, "grad_norm": 0.02796284109354019, "learning_rate": 0.024000000208616257, "loss": 2.383162498474121, "step": 11668 }, { "epoch": 0.5557142857142857, "grad_norm": 0.03134676441550255, "learning_rate": 0.024000000208616257, "loss": 2.3964271545410156, "step": 11670 }, { "epoch": 0.5558095238095239, "grad_norm": 0.026685362681746483, "learning_rate": 0.024000000208616257, "loss": 2.370635509490967, "step": 11672 }, { "epoch": 0.5559047619047619, "grad_norm": 0.02817283384501934, "learning_rate": 0.024000000208616257, "loss": 2.3659565448760986, "step": 11674 }, { "epoch": 0.556, "grad_norm": 0.026936767622828484, "learning_rate": 0.024000000208616257, "loss": 2.4207801818847656, "step": 11676 }, { "epoch": 0.5560952380952381, "grad_norm": 0.0289921797811985, "learning_rate": 0.024000000208616257, "loss": 2.3779191970825195, "step": 11678 }, { "epoch": 0.5561904761904762, "grad_norm": 0.0290316641330719, "learning_rate": 0.024000000208616257, "loss": 2.363281726837158, "step": 11680 }, { "epoch": 0.5562857142857143, "grad_norm": 0.026474326848983765, "learning_rate": 0.024000000208616257, "loss": 2.368346929550171, "step": 11682 }, { "epoch": 0.5563809523809524, "grad_norm": 0.02933529019355774, "learning_rate": 0.024000000208616257, "loss": 2.340019702911377, "step": 11684 }, { "epoch": 0.5564761904761905, "grad_norm": 0.028024088591337204, "learning_rate": 0.024000000208616257, "loss": 2.3529739379882812, "step": 11686 }, { "epoch": 0.5565714285714286, "grad_norm": 0.03148061782121658, "learning_rate": 0.024000000208616257, "loss": 2.401454448699951, "step": 11688 }, { "epoch": 0.5566666666666666, "grad_norm": 0.02666826732456684, "learning_rate": 0.024000000208616257, "loss": 2.3552165031433105, "step": 11690 }, { "epoch": 0.5567619047619048, "grad_norm": 0.027638984844088554, "learning_rate": 0.024000000208616257, "loss": 2.3734161853790283, "step": 11692 }, { "epoch": 0.5568571428571428, "grad_norm": 0.028412075713276863, "learning_rate": 0.024000000208616257, "loss": 2.3997890949249268, "step": 11694 }, { "epoch": 0.556952380952381, "grad_norm": 0.03170473128557205, "learning_rate": 0.024000000208616257, "loss": 2.356121063232422, "step": 11696 }, { "epoch": 0.557047619047619, "grad_norm": 0.027247890830039978, "learning_rate": 0.024000000208616257, "loss": 2.3821167945861816, "step": 11698 }, { "epoch": 0.5571428571428572, "grad_norm": 0.02652345411479473, "learning_rate": 0.024000000208616257, "loss": 2.3924365043640137, "step": 11700 }, { "epoch": 0.5572380952380952, "grad_norm": 0.02756977267563343, "learning_rate": 0.024000000208616257, "loss": 2.4149527549743652, "step": 11702 }, { "epoch": 0.5573333333333333, "grad_norm": 0.02998759038746357, "learning_rate": 0.024000000208616257, "loss": 2.404186248779297, "step": 11704 }, { "epoch": 0.5574285714285714, "grad_norm": 0.028125621378421783, "learning_rate": 0.024000000208616257, "loss": 2.3857054710388184, "step": 11706 }, { "epoch": 0.5575238095238095, "grad_norm": 0.027212129905819893, "learning_rate": 0.024000000208616257, "loss": 2.40315580368042, "step": 11708 }, { "epoch": 0.5576190476190476, "grad_norm": 0.02735554613173008, "learning_rate": 0.024000000208616257, "loss": 2.3963379859924316, "step": 11710 }, { "epoch": 0.5577142857142857, "grad_norm": 0.0264605563133955, "learning_rate": 0.024000000208616257, "loss": 2.3812031745910645, "step": 11712 }, { "epoch": 0.5578095238095238, "grad_norm": 0.027901597321033478, "learning_rate": 0.024000000208616257, "loss": 2.371077060699463, "step": 11714 }, { "epoch": 0.5579047619047619, "grad_norm": 0.027435969561338425, "learning_rate": 0.024000000208616257, "loss": 2.387395143508911, "step": 11716 }, { "epoch": 0.558, "grad_norm": 0.027148224413394928, "learning_rate": 0.024000000208616257, "loss": 2.3772969245910645, "step": 11718 }, { "epoch": 0.5580952380952381, "grad_norm": 0.029859330505132675, "learning_rate": 0.024000000208616257, "loss": 2.365114688873291, "step": 11720 }, { "epoch": 0.5581904761904762, "grad_norm": 0.03209460526704788, "learning_rate": 0.024000000208616257, "loss": 2.395850896835327, "step": 11722 }, { "epoch": 0.5582857142857143, "grad_norm": 0.027224106714129448, "learning_rate": 0.024000000208616257, "loss": 2.3623251914978027, "step": 11724 }, { "epoch": 0.5583809523809524, "grad_norm": 0.027106348425149918, "learning_rate": 0.024000000208616257, "loss": 2.373490333557129, "step": 11726 }, { "epoch": 0.5584761904761905, "grad_norm": 0.027433348819613457, "learning_rate": 0.024000000208616257, "loss": 2.434675693511963, "step": 11728 }, { "epoch": 0.5585714285714286, "grad_norm": 0.029519250616431236, "learning_rate": 0.024000000208616257, "loss": 2.369201898574829, "step": 11730 }, { "epoch": 0.5586666666666666, "grad_norm": 0.02793247438967228, "learning_rate": 0.024000000208616257, "loss": 2.3748526573181152, "step": 11732 }, { "epoch": 0.5587619047619048, "grad_norm": 0.028797732666134834, "learning_rate": 0.024000000208616257, "loss": 2.4151458740234375, "step": 11734 }, { "epoch": 0.5588571428571428, "grad_norm": 0.03396514430642128, "learning_rate": 0.024000000208616257, "loss": 2.386821746826172, "step": 11736 }, { "epoch": 0.558952380952381, "grad_norm": 0.02662402018904686, "learning_rate": 0.024000000208616257, "loss": 2.3923869132995605, "step": 11738 }, { "epoch": 0.559047619047619, "grad_norm": 0.02719794772565365, "learning_rate": 0.024000000208616257, "loss": 2.3945720195770264, "step": 11740 }, { "epoch": 0.5591428571428572, "grad_norm": 0.02929822914302349, "learning_rate": 0.024000000208616257, "loss": 2.3931643962860107, "step": 11742 }, { "epoch": 0.5592380952380952, "grad_norm": 0.02764900214970112, "learning_rate": 0.024000000208616257, "loss": 2.3858532905578613, "step": 11744 }, { "epoch": 0.5593333333333333, "grad_norm": 0.027928147464990616, "learning_rate": 0.024000000208616257, "loss": 2.3655853271484375, "step": 11746 }, { "epoch": 0.5594285714285714, "grad_norm": 0.028253493830561638, "learning_rate": 0.024000000208616257, "loss": 2.359161853790283, "step": 11748 }, { "epoch": 0.5595238095238095, "grad_norm": 0.02696853317320347, "learning_rate": 0.024000000208616257, "loss": 2.3587756156921387, "step": 11750 }, { "epoch": 0.5596190476190476, "grad_norm": 0.02765403874218464, "learning_rate": 0.024000000208616257, "loss": 2.3769583702087402, "step": 11752 }, { "epoch": 0.5597142857142857, "grad_norm": 0.030442198738455772, "learning_rate": 0.024000000208616257, "loss": 2.3707683086395264, "step": 11754 }, { "epoch": 0.5598095238095238, "grad_norm": 0.03303159028291702, "learning_rate": 0.024000000208616257, "loss": 2.3896474838256836, "step": 11756 }, { "epoch": 0.5599047619047619, "grad_norm": 0.03317727893590927, "learning_rate": 0.024000000208616257, "loss": 2.368150472640991, "step": 11758 }, { "epoch": 0.56, "grad_norm": 0.03270053490996361, "learning_rate": 0.024000000208616257, "loss": 2.4153366088867188, "step": 11760 }, { "epoch": 0.5600952380952381, "grad_norm": 0.027580972760915756, "learning_rate": 0.024000000208616257, "loss": 2.38938045501709, "step": 11762 }, { "epoch": 0.5601904761904762, "grad_norm": 0.031025800853967667, "learning_rate": 0.024000000208616257, "loss": 2.3984925746917725, "step": 11764 }, { "epoch": 0.5602857142857143, "grad_norm": 0.03170143812894821, "learning_rate": 0.024000000208616257, "loss": 2.4043025970458984, "step": 11766 }, { "epoch": 0.5603809523809524, "grad_norm": 0.02960234507918358, "learning_rate": 0.024000000208616257, "loss": 2.3729753494262695, "step": 11768 }, { "epoch": 0.5604761904761905, "grad_norm": 0.027697782963514328, "learning_rate": 0.024000000208616257, "loss": 2.3756728172302246, "step": 11770 }, { "epoch": 0.5605714285714286, "grad_norm": 0.027014564722776413, "learning_rate": 0.024000000208616257, "loss": 2.383561611175537, "step": 11772 }, { "epoch": 0.5606666666666666, "grad_norm": 0.026594802737236023, "learning_rate": 0.024000000208616257, "loss": 2.3946781158447266, "step": 11774 }, { "epoch": 0.5607619047619048, "grad_norm": 0.026822369545698166, "learning_rate": 0.024000000208616257, "loss": 2.4072062969207764, "step": 11776 }, { "epoch": 0.5608571428571428, "grad_norm": 0.02653142809867859, "learning_rate": 0.024000000208616257, "loss": 2.361722707748413, "step": 11778 }, { "epoch": 0.560952380952381, "grad_norm": 0.02665015496313572, "learning_rate": 0.024000000208616257, "loss": 2.426913261413574, "step": 11780 }, { "epoch": 0.561047619047619, "grad_norm": 0.027637140825390816, "learning_rate": 0.024000000208616257, "loss": 2.4032371044158936, "step": 11782 }, { "epoch": 0.5611428571428572, "grad_norm": 0.028320258483290672, "learning_rate": 0.024000000208616257, "loss": 2.3576879501342773, "step": 11784 }, { "epoch": 0.5612380952380952, "grad_norm": 0.02741563878953457, "learning_rate": 0.024000000208616257, "loss": 2.40246844291687, "step": 11786 }, { "epoch": 0.5613333333333334, "grad_norm": 0.026127135381102562, "learning_rate": 0.024000000208616257, "loss": 2.369079113006592, "step": 11788 }, { "epoch": 0.5614285714285714, "grad_norm": 0.027854405343532562, "learning_rate": 0.024000000208616257, "loss": 2.3997554779052734, "step": 11790 }, { "epoch": 0.5615238095238095, "grad_norm": 0.026747651398181915, "learning_rate": 0.024000000208616257, "loss": 2.3670902252197266, "step": 11792 }, { "epoch": 0.5616190476190476, "grad_norm": 0.02615051530301571, "learning_rate": 0.024000000208616257, "loss": 2.3848843574523926, "step": 11794 }, { "epoch": 0.5617142857142857, "grad_norm": 0.027781156823039055, "learning_rate": 0.024000000208616257, "loss": 2.414494752883911, "step": 11796 }, { "epoch": 0.5618095238095238, "grad_norm": 0.02637512981891632, "learning_rate": 0.024000000208616257, "loss": 2.41799259185791, "step": 11798 }, { "epoch": 0.5619047619047619, "grad_norm": 0.029127303510904312, "learning_rate": 0.024000000208616257, "loss": 2.394076347351074, "step": 11800 }, { "epoch": 0.562, "grad_norm": 0.028838852420449257, "learning_rate": 0.024000000208616257, "loss": 2.421950340270996, "step": 11802 }, { "epoch": 0.5620952380952381, "grad_norm": 0.033338211476802826, "learning_rate": 0.024000000208616257, "loss": 2.4004435539245605, "step": 11804 }, { "epoch": 0.5621904761904762, "grad_norm": 0.028502605855464935, "learning_rate": 0.024000000208616257, "loss": 2.4278056621551514, "step": 11806 }, { "epoch": 0.5622857142857143, "grad_norm": 0.02709316462278366, "learning_rate": 0.024000000208616257, "loss": 2.3776535987854004, "step": 11808 }, { "epoch": 0.5623809523809524, "grad_norm": 0.028490852564573288, "learning_rate": 0.024000000208616257, "loss": 2.366140842437744, "step": 11810 }, { "epoch": 0.5624761904761905, "grad_norm": 0.02827576920390129, "learning_rate": 0.024000000208616257, "loss": 2.410656452178955, "step": 11812 }, { "epoch": 0.5625714285714286, "grad_norm": 0.028827479109168053, "learning_rate": 0.024000000208616257, "loss": 2.398906946182251, "step": 11814 }, { "epoch": 0.5626666666666666, "grad_norm": 0.02899826504290104, "learning_rate": 0.024000000208616257, "loss": 2.4030466079711914, "step": 11816 }, { "epoch": 0.5627619047619048, "grad_norm": 0.028786828741431236, "learning_rate": 0.024000000208616257, "loss": 2.3595104217529297, "step": 11818 }, { "epoch": 0.5628571428571428, "grad_norm": 0.027258917689323425, "learning_rate": 0.024000000208616257, "loss": 2.3988544940948486, "step": 11820 }, { "epoch": 0.562952380952381, "grad_norm": 0.02712741680443287, "learning_rate": 0.024000000208616257, "loss": 2.356430768966675, "step": 11822 }, { "epoch": 0.563047619047619, "grad_norm": 0.032179877161979675, "learning_rate": 0.024000000208616257, "loss": 2.410379409790039, "step": 11824 }, { "epoch": 0.5631428571428572, "grad_norm": 0.0374365895986557, "learning_rate": 0.024000000208616257, "loss": 2.392821788787842, "step": 11826 }, { "epoch": 0.5632380952380952, "grad_norm": 0.03261224180459976, "learning_rate": 0.024000000208616257, "loss": 2.3795828819274902, "step": 11828 }, { "epoch": 0.5633333333333334, "grad_norm": 0.027875836938619614, "learning_rate": 0.024000000208616257, "loss": 2.3890552520751953, "step": 11830 }, { "epoch": 0.5634285714285714, "grad_norm": 0.02720075659453869, "learning_rate": 0.024000000208616257, "loss": 2.3892011642456055, "step": 11832 }, { "epoch": 0.5635238095238095, "grad_norm": 0.026403630152344704, "learning_rate": 0.024000000208616257, "loss": 2.4058310985565186, "step": 11834 }, { "epoch": 0.5636190476190476, "grad_norm": 0.028198963031172752, "learning_rate": 0.024000000208616257, "loss": 2.381135940551758, "step": 11836 }, { "epoch": 0.5637142857142857, "grad_norm": 0.026485325768589973, "learning_rate": 0.024000000208616257, "loss": 2.4167516231536865, "step": 11838 }, { "epoch": 0.5638095238095238, "grad_norm": 0.02617916651070118, "learning_rate": 0.024000000208616257, "loss": 2.4072370529174805, "step": 11840 }, { "epoch": 0.5639047619047619, "grad_norm": 0.02686414308845997, "learning_rate": 0.024000000208616257, "loss": 2.4178428649902344, "step": 11842 }, { "epoch": 0.564, "grad_norm": 0.028468754142522812, "learning_rate": 0.024000000208616257, "loss": 2.4135141372680664, "step": 11844 }, { "epoch": 0.5640952380952381, "grad_norm": 0.027934648096561432, "learning_rate": 0.024000000208616257, "loss": 2.396803855895996, "step": 11846 }, { "epoch": 0.5641904761904762, "grad_norm": 0.027997862547636032, "learning_rate": 0.024000000208616257, "loss": 2.370863914489746, "step": 11848 }, { "epoch": 0.5642857142857143, "grad_norm": 0.027191510424017906, "learning_rate": 0.024000000208616257, "loss": 2.4401326179504395, "step": 11850 }, { "epoch": 0.5643809523809524, "grad_norm": 0.028223494067788124, "learning_rate": 0.024000000208616257, "loss": 2.385915756225586, "step": 11852 }, { "epoch": 0.5644761904761905, "grad_norm": 0.028993984684348106, "learning_rate": 0.024000000208616257, "loss": 2.410801887512207, "step": 11854 }, { "epoch": 0.5645714285714286, "grad_norm": 0.030110890045762062, "learning_rate": 0.024000000208616257, "loss": 2.4010443687438965, "step": 11856 }, { "epoch": 0.5646666666666667, "grad_norm": 0.03209001198410988, "learning_rate": 0.024000000208616257, "loss": 2.3422765731811523, "step": 11858 }, { "epoch": 0.5647619047619048, "grad_norm": 0.02704070881009102, "learning_rate": 0.024000000208616257, "loss": 2.386552333831787, "step": 11860 }, { "epoch": 0.5648571428571428, "grad_norm": 0.02788064442574978, "learning_rate": 0.024000000208616257, "loss": 2.412464141845703, "step": 11862 }, { "epoch": 0.564952380952381, "grad_norm": 0.033810414373874664, "learning_rate": 0.024000000208616257, "loss": 2.4252872467041016, "step": 11864 }, { "epoch": 0.565047619047619, "grad_norm": 0.03061581216752529, "learning_rate": 0.024000000208616257, "loss": 2.3955793380737305, "step": 11866 }, { "epoch": 0.5651428571428572, "grad_norm": 0.028137125074863434, "learning_rate": 0.024000000208616257, "loss": 2.397726058959961, "step": 11868 }, { "epoch": 0.5652380952380952, "grad_norm": 0.02731219306588173, "learning_rate": 0.024000000208616257, "loss": 2.393878698348999, "step": 11870 }, { "epoch": 0.5653333333333334, "grad_norm": 0.02575621008872986, "learning_rate": 0.024000000208616257, "loss": 2.3558855056762695, "step": 11872 }, { "epoch": 0.5654285714285714, "grad_norm": 0.027885738760232925, "learning_rate": 0.024000000208616257, "loss": 2.3982181549072266, "step": 11874 }, { "epoch": 0.5655238095238095, "grad_norm": 0.026431666687130928, "learning_rate": 0.024000000208616257, "loss": 2.424595832824707, "step": 11876 }, { "epoch": 0.5656190476190476, "grad_norm": 0.02623271383345127, "learning_rate": 0.024000000208616257, "loss": 2.4235148429870605, "step": 11878 }, { "epoch": 0.5657142857142857, "grad_norm": 0.02769532985985279, "learning_rate": 0.024000000208616257, "loss": 2.398388147354126, "step": 11880 }, { "epoch": 0.5658095238095238, "grad_norm": 0.02768261730670929, "learning_rate": 0.024000000208616257, "loss": 2.3793158531188965, "step": 11882 }, { "epoch": 0.5659047619047619, "grad_norm": 0.026300588622689247, "learning_rate": 0.024000000208616257, "loss": 2.411929130554199, "step": 11884 }, { "epoch": 0.566, "grad_norm": 0.026283279061317444, "learning_rate": 0.024000000208616257, "loss": 2.390958309173584, "step": 11886 }, { "epoch": 0.5660952380952381, "grad_norm": 0.028361573815345764, "learning_rate": 0.024000000208616257, "loss": 2.424976348876953, "step": 11888 }, { "epoch": 0.5661904761904762, "grad_norm": 0.03472631052136421, "learning_rate": 0.024000000208616257, "loss": 2.3859362602233887, "step": 11890 }, { "epoch": 0.5662857142857143, "grad_norm": 0.026570633053779602, "learning_rate": 0.024000000208616257, "loss": 2.4072933197021484, "step": 11892 }, { "epoch": 0.5663809523809524, "grad_norm": 0.029790276661515236, "learning_rate": 0.024000000208616257, "loss": 2.4148507118225098, "step": 11894 }, { "epoch": 0.5664761904761905, "grad_norm": 0.0275239460170269, "learning_rate": 0.024000000208616257, "loss": 2.3792552947998047, "step": 11896 }, { "epoch": 0.5665714285714286, "grad_norm": 0.029938874766230583, "learning_rate": 0.024000000208616257, "loss": 2.4075934886932373, "step": 11898 }, { "epoch": 0.5666666666666667, "grad_norm": 0.027736926451325417, "learning_rate": 0.024000000208616257, "loss": 2.401994228363037, "step": 11900 }, { "epoch": 0.5667619047619048, "grad_norm": 0.02677297033369541, "learning_rate": 0.024000000208616257, "loss": 2.407911777496338, "step": 11902 }, { "epoch": 0.5668571428571428, "grad_norm": 0.02715601772069931, "learning_rate": 0.024000000208616257, "loss": 2.445923328399658, "step": 11904 }, { "epoch": 0.566952380952381, "grad_norm": 0.027524812147021294, "learning_rate": 0.024000000208616257, "loss": 2.4026103019714355, "step": 11906 }, { "epoch": 0.567047619047619, "grad_norm": 0.026737729087471962, "learning_rate": 0.024000000208616257, "loss": 2.3795862197875977, "step": 11908 }, { "epoch": 0.5671428571428572, "grad_norm": 0.02809365652501583, "learning_rate": 0.024000000208616257, "loss": 2.39754581451416, "step": 11910 }, { "epoch": 0.5672380952380952, "grad_norm": 0.026973308995366096, "learning_rate": 0.024000000208616257, "loss": 2.4105992317199707, "step": 11912 }, { "epoch": 0.5673333333333334, "grad_norm": 0.028450869023799896, "learning_rate": 0.024000000208616257, "loss": 2.42653489112854, "step": 11914 }, { "epoch": 0.5674285714285714, "grad_norm": 0.0281474981456995, "learning_rate": 0.024000000208616257, "loss": 2.3944928646087646, "step": 11916 }, { "epoch": 0.5675238095238095, "grad_norm": 0.028904829174280167, "learning_rate": 0.024000000208616257, "loss": 2.3827826976776123, "step": 11918 }, { "epoch": 0.5676190476190476, "grad_norm": 0.026810213923454285, "learning_rate": 0.024000000208616257, "loss": 2.393251419067383, "step": 11920 }, { "epoch": 0.5677142857142857, "grad_norm": 0.027721336111426353, "learning_rate": 0.024000000208616257, "loss": 2.380338191986084, "step": 11922 }, { "epoch": 0.5678095238095238, "grad_norm": 0.026056909933686256, "learning_rate": 0.024000000208616257, "loss": 2.3793418407440186, "step": 11924 }, { "epoch": 0.5679047619047619, "grad_norm": 0.02689511887729168, "learning_rate": 0.024000000208616257, "loss": 2.3818044662475586, "step": 11926 }, { "epoch": 0.568, "grad_norm": 0.025967076420783997, "learning_rate": 0.024000000208616257, "loss": 2.383652925491333, "step": 11928 }, { "epoch": 0.5680952380952381, "grad_norm": 0.0290982723236084, "learning_rate": 0.024000000208616257, "loss": 2.377939462661743, "step": 11930 }, { "epoch": 0.5681904761904762, "grad_norm": 0.0315236821770668, "learning_rate": 0.024000000208616257, "loss": 2.3754167556762695, "step": 11932 }, { "epoch": 0.5682857142857143, "grad_norm": 0.03377240151166916, "learning_rate": 0.024000000208616257, "loss": 2.376749038696289, "step": 11934 }, { "epoch": 0.5683809523809524, "grad_norm": 0.029450448229908943, "learning_rate": 0.024000000208616257, "loss": 2.3851659297943115, "step": 11936 }, { "epoch": 0.5684761904761905, "grad_norm": 0.027942262589931488, "learning_rate": 0.024000000208616257, "loss": 2.4040608406066895, "step": 11938 }, { "epoch": 0.5685714285714286, "grad_norm": 0.028733406215906143, "learning_rate": 0.024000000208616257, "loss": 2.37733793258667, "step": 11940 }, { "epoch": 0.5686666666666667, "grad_norm": 0.02714967355132103, "learning_rate": 0.024000000208616257, "loss": 2.389890670776367, "step": 11942 }, { "epoch": 0.5687619047619048, "grad_norm": 0.03358941525220871, "learning_rate": 0.024000000208616257, "loss": 2.3933796882629395, "step": 11944 }, { "epoch": 0.5688571428571428, "grad_norm": 0.026132069528102875, "learning_rate": 0.024000000208616257, "loss": 2.3476994037628174, "step": 11946 }, { "epoch": 0.568952380952381, "grad_norm": 0.026798171922564507, "learning_rate": 0.024000000208616257, "loss": 2.3667874336242676, "step": 11948 }, { "epoch": 0.569047619047619, "grad_norm": 0.02614966221153736, "learning_rate": 0.024000000208616257, "loss": 2.3871657848358154, "step": 11950 }, { "epoch": 0.5691428571428572, "grad_norm": 0.025991378352046013, "learning_rate": 0.024000000208616257, "loss": 2.3951797485351562, "step": 11952 }, { "epoch": 0.5692380952380952, "grad_norm": 0.029850678518414497, "learning_rate": 0.024000000208616257, "loss": 2.363391876220703, "step": 11954 }, { "epoch": 0.5693333333333334, "grad_norm": 0.02797987125813961, "learning_rate": 0.024000000208616257, "loss": 2.368868589401245, "step": 11956 }, { "epoch": 0.5694285714285714, "grad_norm": 0.026213806122541428, "learning_rate": 0.024000000208616257, "loss": 2.378498077392578, "step": 11958 }, { "epoch": 0.5695238095238095, "grad_norm": 0.02835642173886299, "learning_rate": 0.024000000208616257, "loss": 2.357682704925537, "step": 11960 }, { "epoch": 0.5696190476190476, "grad_norm": 0.026407821103930473, "learning_rate": 0.024000000208616257, "loss": 2.383315086364746, "step": 11962 }, { "epoch": 0.5697142857142857, "grad_norm": 0.027547726407647133, "learning_rate": 0.024000000208616257, "loss": 2.373159408569336, "step": 11964 }, { "epoch": 0.5698095238095238, "grad_norm": 0.028590090572834015, "learning_rate": 0.024000000208616257, "loss": 2.3987836837768555, "step": 11966 }, { "epoch": 0.5699047619047619, "grad_norm": 0.027351878583431244, "learning_rate": 0.024000000208616257, "loss": 2.372422695159912, "step": 11968 }, { "epoch": 0.57, "grad_norm": 0.027674036100506783, "learning_rate": 0.024000000208616257, "loss": 2.371316432952881, "step": 11970 }, { "epoch": 0.5700952380952381, "grad_norm": 0.027821380645036697, "learning_rate": 0.024000000208616257, "loss": 2.390519142150879, "step": 11972 }, { "epoch": 0.5701904761904761, "grad_norm": 0.032634418457746506, "learning_rate": 0.024000000208616257, "loss": 2.3969502449035645, "step": 11974 }, { "epoch": 0.5702857142857143, "grad_norm": 0.03397964686155319, "learning_rate": 0.024000000208616257, "loss": 2.388268232345581, "step": 11976 }, { "epoch": 0.5703809523809524, "grad_norm": 0.031192194670438766, "learning_rate": 0.024000000208616257, "loss": 2.361647129058838, "step": 11978 }, { "epoch": 0.5704761904761905, "grad_norm": 0.02768099494278431, "learning_rate": 0.024000000208616257, "loss": 2.3884663581848145, "step": 11980 }, { "epoch": 0.5705714285714286, "grad_norm": 0.02773672714829445, "learning_rate": 0.024000000208616257, "loss": 2.3836612701416016, "step": 11982 }, { "epoch": 0.5706666666666667, "grad_norm": 0.02740389108657837, "learning_rate": 0.024000000208616257, "loss": 2.3707594871520996, "step": 11984 }, { "epoch": 0.5707619047619048, "grad_norm": 0.027572067454457283, "learning_rate": 0.024000000208616257, "loss": 2.3987627029418945, "step": 11986 }, { "epoch": 0.5708571428571428, "grad_norm": 0.026267485693097115, "learning_rate": 0.024000000208616257, "loss": 2.377957344055176, "step": 11988 }, { "epoch": 0.570952380952381, "grad_norm": 0.027462778612971306, "learning_rate": 0.024000000208616257, "loss": 2.4075233936309814, "step": 11990 }, { "epoch": 0.571047619047619, "grad_norm": 0.0304377693682909, "learning_rate": 0.024000000208616257, "loss": 2.3813695907592773, "step": 11992 }, { "epoch": 0.5711428571428572, "grad_norm": 0.029131056740880013, "learning_rate": 0.024000000208616257, "loss": 2.349332332611084, "step": 11994 }, { "epoch": 0.5712380952380952, "grad_norm": 0.02791123278439045, "learning_rate": 0.024000000208616257, "loss": 2.3552846908569336, "step": 11996 }, { "epoch": 0.5713333333333334, "grad_norm": 0.026262443512678146, "learning_rate": 0.024000000208616257, "loss": 2.385002613067627, "step": 11998 }, { "epoch": 0.5714285714285714, "grad_norm": 0.028073741123080254, "learning_rate": 0.024000000208616257, "loss": 2.362030506134033, "step": 12000 }, { "epoch": 0.5715238095238095, "grad_norm": 0.02741781622171402, "learning_rate": 0.024000000208616257, "loss": 2.345831871032715, "step": 12002 }, { "epoch": 0.5716190476190476, "grad_norm": 0.029092220589518547, "learning_rate": 0.024000000208616257, "loss": 2.364293098449707, "step": 12004 }, { "epoch": 0.5717142857142857, "grad_norm": 0.02629227563738823, "learning_rate": 0.024000000208616257, "loss": 2.3524832725524902, "step": 12006 }, { "epoch": 0.5718095238095238, "grad_norm": 0.029001163318753242, "learning_rate": 0.024000000208616257, "loss": 2.3268256187438965, "step": 12008 }, { "epoch": 0.5719047619047619, "grad_norm": 0.029615288600325584, "learning_rate": 0.024000000208616257, "loss": 2.381591320037842, "step": 12010 }, { "epoch": 0.572, "grad_norm": 0.02613680437207222, "learning_rate": 0.024000000208616257, "loss": 2.3409624099731445, "step": 12012 }, { "epoch": 0.5720952380952381, "grad_norm": 0.030383866280317307, "learning_rate": 0.024000000208616257, "loss": 2.399507999420166, "step": 12014 }, { "epoch": 0.5721904761904761, "grad_norm": 0.02806154452264309, "learning_rate": 0.024000000208616257, "loss": 2.353208541870117, "step": 12016 }, { "epoch": 0.5722857142857143, "grad_norm": 0.026065826416015625, "learning_rate": 0.024000000208616257, "loss": 2.3608264923095703, "step": 12018 }, { "epoch": 0.5723809523809524, "grad_norm": 0.025845026597380638, "learning_rate": 0.024000000208616257, "loss": 2.34208607673645, "step": 12020 }, { "epoch": 0.5724761904761905, "grad_norm": 0.02599179372191429, "learning_rate": 0.024000000208616257, "loss": 2.308591365814209, "step": 12022 }, { "epoch": 0.5725714285714286, "grad_norm": 0.027212942019104958, "learning_rate": 0.024000000208616257, "loss": 2.3471596240997314, "step": 12024 }, { "epoch": 0.5726666666666667, "grad_norm": 0.02945045568048954, "learning_rate": 0.024000000208616257, "loss": 2.3460493087768555, "step": 12026 }, { "epoch": 0.5727619047619048, "grad_norm": 0.026909422129392624, "learning_rate": 0.024000000208616257, "loss": 2.4002628326416016, "step": 12028 }, { "epoch": 0.5728571428571428, "grad_norm": 0.0271657332777977, "learning_rate": 0.024000000208616257, "loss": 2.357485294342041, "step": 12030 }, { "epoch": 0.572952380952381, "grad_norm": 0.02977743186056614, "learning_rate": 0.024000000208616257, "loss": 2.3559727668762207, "step": 12032 }, { "epoch": 0.573047619047619, "grad_norm": 0.027855856344103813, "learning_rate": 0.024000000208616257, "loss": 2.3967549800872803, "step": 12034 }, { "epoch": 0.5731428571428572, "grad_norm": 0.02740192599594593, "learning_rate": 0.024000000208616257, "loss": 2.349224805831909, "step": 12036 }, { "epoch": 0.5732380952380952, "grad_norm": 0.02902146242558956, "learning_rate": 0.024000000208616257, "loss": 2.3588223457336426, "step": 12038 }, { "epoch": 0.5733333333333334, "grad_norm": 0.025933291763067245, "learning_rate": 0.024000000208616257, "loss": 2.364809989929199, "step": 12040 }, { "epoch": 0.5734285714285714, "grad_norm": 0.0273410864174366, "learning_rate": 0.024000000208616257, "loss": 2.362722873687744, "step": 12042 }, { "epoch": 0.5735238095238095, "grad_norm": 0.026517538353800774, "learning_rate": 0.024000000208616257, "loss": 2.3636093139648438, "step": 12044 }, { "epoch": 0.5736190476190476, "grad_norm": 0.03135243058204651, "learning_rate": 0.024000000208616257, "loss": 2.372227191925049, "step": 12046 }, { "epoch": 0.5737142857142857, "grad_norm": 0.026931172236800194, "learning_rate": 0.024000000208616257, "loss": 2.356426239013672, "step": 12048 }, { "epoch": 0.5738095238095238, "grad_norm": 0.027868807315826416, "learning_rate": 0.024000000208616257, "loss": 2.38834285736084, "step": 12050 }, { "epoch": 0.5739047619047619, "grad_norm": 0.025815904140472412, "learning_rate": 0.024000000208616257, "loss": 2.3761842250823975, "step": 12052 }, { "epoch": 0.574, "grad_norm": 0.02732386440038681, "learning_rate": 0.024000000208616257, "loss": 2.3679614067077637, "step": 12054 }, { "epoch": 0.5740952380952381, "grad_norm": 0.02802446484565735, "learning_rate": 0.024000000208616257, "loss": 2.3353614807128906, "step": 12056 }, { "epoch": 0.5741904761904761, "grad_norm": 0.030031096190214157, "learning_rate": 0.024000000208616257, "loss": 2.333435535430908, "step": 12058 }, { "epoch": 0.5742857142857143, "grad_norm": 0.029843872413039207, "learning_rate": 0.024000000208616257, "loss": 2.3155641555786133, "step": 12060 }, { "epoch": 0.5743809523809524, "grad_norm": 0.02829231135547161, "learning_rate": 0.024000000208616257, "loss": 2.329784870147705, "step": 12062 }, { "epoch": 0.5744761904761905, "grad_norm": 0.028612583875656128, "learning_rate": 0.024000000208616257, "loss": 2.3695459365844727, "step": 12064 }, { "epoch": 0.5745714285714286, "grad_norm": 0.02696160040795803, "learning_rate": 0.024000000208616257, "loss": 2.3367419242858887, "step": 12066 }, { "epoch": 0.5746666666666667, "grad_norm": 0.030487604439258575, "learning_rate": 0.024000000208616257, "loss": 2.362741231918335, "step": 12068 }, { "epoch": 0.5747619047619048, "grad_norm": 0.027514124289155006, "learning_rate": 0.024000000208616257, "loss": 2.344200849533081, "step": 12070 }, { "epoch": 0.5748571428571428, "grad_norm": 0.026624947786331177, "learning_rate": 0.024000000208616257, "loss": 2.3395705223083496, "step": 12072 }, { "epoch": 0.574952380952381, "grad_norm": 0.028573932126164436, "learning_rate": 0.024000000208616257, "loss": 2.317322254180908, "step": 12074 }, { "epoch": 0.575047619047619, "grad_norm": 0.027427705004811287, "learning_rate": 0.024000000208616257, "loss": 2.3413901329040527, "step": 12076 }, { "epoch": 0.5751428571428572, "grad_norm": 0.028706112876534462, "learning_rate": 0.024000000208616257, "loss": 2.3419628143310547, "step": 12078 }, { "epoch": 0.5752380952380952, "grad_norm": 0.0264842938631773, "learning_rate": 0.024000000208616257, "loss": 2.34963321685791, "step": 12080 }, { "epoch": 0.5753333333333334, "grad_norm": 0.029379885643720627, "learning_rate": 0.024000000208616257, "loss": 2.336191177368164, "step": 12082 }, { "epoch": 0.5754285714285714, "grad_norm": 0.02802962437272072, "learning_rate": 0.024000000208616257, "loss": 2.3159284591674805, "step": 12084 }, { "epoch": 0.5755238095238095, "grad_norm": 0.032924070954322815, "learning_rate": 0.024000000208616257, "loss": 2.306708812713623, "step": 12086 }, { "epoch": 0.5756190476190476, "grad_norm": 0.02585965394973755, "learning_rate": 0.024000000208616257, "loss": 2.3344597816467285, "step": 12088 }, { "epoch": 0.5757142857142857, "grad_norm": 0.030494172126054764, "learning_rate": 0.024000000208616257, "loss": 2.33652400970459, "step": 12090 }, { "epoch": 0.5758095238095238, "grad_norm": 0.03373820707201958, "learning_rate": 0.024000000208616257, "loss": 2.3337743282318115, "step": 12092 }, { "epoch": 0.5759047619047619, "grad_norm": 0.026861783117055893, "learning_rate": 0.024000000208616257, "loss": 2.3262901306152344, "step": 12094 }, { "epoch": 0.576, "grad_norm": 0.027221743017435074, "learning_rate": 0.024000000208616257, "loss": 2.341005325317383, "step": 12096 }, { "epoch": 0.5760952380952381, "grad_norm": 0.026152167469263077, "learning_rate": 0.024000000208616257, "loss": 2.3406200408935547, "step": 12098 }, { "epoch": 0.5761904761904761, "grad_norm": 0.026923242956399918, "learning_rate": 0.024000000208616257, "loss": 2.336327075958252, "step": 12100 }, { "epoch": 0.5762857142857143, "grad_norm": 0.02713662199676037, "learning_rate": 0.024000000208616257, "loss": 2.2999496459960938, "step": 12102 }, { "epoch": 0.5763809523809523, "grad_norm": 0.026998624205589294, "learning_rate": 0.024000000208616257, "loss": 2.327702045440674, "step": 12104 }, { "epoch": 0.5764761904761905, "grad_norm": 0.029741067439317703, "learning_rate": 0.024000000208616257, "loss": 2.3371896743774414, "step": 12106 }, { "epoch": 0.5765714285714286, "grad_norm": 0.027055000886321068, "learning_rate": 0.024000000208616257, "loss": 2.3546218872070312, "step": 12108 }, { "epoch": 0.5766666666666667, "grad_norm": 0.0309158805757761, "learning_rate": 0.024000000208616257, "loss": 2.364199638366699, "step": 12110 }, { "epoch": 0.5767619047619048, "grad_norm": 0.03145656734704971, "learning_rate": 0.024000000208616257, "loss": 2.3280515670776367, "step": 12112 }, { "epoch": 0.5768571428571428, "grad_norm": 0.028398284688591957, "learning_rate": 0.024000000208616257, "loss": 2.3045430183410645, "step": 12114 }, { "epoch": 0.576952380952381, "grad_norm": 0.027556344866752625, "learning_rate": 0.024000000208616257, "loss": 2.3469676971435547, "step": 12116 }, { "epoch": 0.577047619047619, "grad_norm": 0.027510613203048706, "learning_rate": 0.024000000208616257, "loss": 2.2907609939575195, "step": 12118 }, { "epoch": 0.5771428571428572, "grad_norm": 0.025948787108063698, "learning_rate": 0.024000000208616257, "loss": 2.3162035942077637, "step": 12120 }, { "epoch": 0.5772380952380952, "grad_norm": 0.02753136307001114, "learning_rate": 0.024000000208616257, "loss": 2.335094451904297, "step": 12122 }, { "epoch": 0.5773333333333334, "grad_norm": 0.02658761292695999, "learning_rate": 0.024000000208616257, "loss": 2.3481264114379883, "step": 12124 }, { "epoch": 0.5774285714285714, "grad_norm": 0.026946162804961205, "learning_rate": 0.024000000208616257, "loss": 2.3794147968292236, "step": 12126 }, { "epoch": 0.5775238095238096, "grad_norm": 0.026795808225870132, "learning_rate": 0.024000000208616257, "loss": 2.3377275466918945, "step": 12128 }, { "epoch": 0.5776190476190476, "grad_norm": 0.028012150898575783, "learning_rate": 0.024000000208616257, "loss": 2.3536791801452637, "step": 12130 }, { "epoch": 0.5777142857142857, "grad_norm": 0.028223508968949318, "learning_rate": 0.024000000208616257, "loss": 2.3557286262512207, "step": 12132 }, { "epoch": 0.5778095238095238, "grad_norm": 0.028580958023667336, "learning_rate": 0.024000000208616257, "loss": 2.3539390563964844, "step": 12134 }, { "epoch": 0.5779047619047619, "grad_norm": 0.029166195541620255, "learning_rate": 0.024000000208616257, "loss": 2.311408519744873, "step": 12136 }, { "epoch": 0.578, "grad_norm": 0.026748839765787125, "learning_rate": 0.024000000208616257, "loss": 2.3171491622924805, "step": 12138 }, { "epoch": 0.5780952380952381, "grad_norm": 0.025770820677280426, "learning_rate": 0.024000000208616257, "loss": 2.306121587753296, "step": 12140 }, { "epoch": 0.5781904761904761, "grad_norm": 0.026084300130605698, "learning_rate": 0.024000000208616257, "loss": 2.323335647583008, "step": 12142 }, { "epoch": 0.5782857142857143, "grad_norm": 0.026504257693886757, "learning_rate": 0.024000000208616257, "loss": 2.3289356231689453, "step": 12144 }, { "epoch": 0.5783809523809523, "grad_norm": 0.02665271796286106, "learning_rate": 0.024000000208616257, "loss": 2.299745559692383, "step": 12146 }, { "epoch": 0.5784761904761905, "grad_norm": 0.027084674686193466, "learning_rate": 0.024000000208616257, "loss": 2.3327455520629883, "step": 12148 }, { "epoch": 0.5785714285714286, "grad_norm": 0.028540339320898056, "learning_rate": 0.024000000208616257, "loss": 2.3244247436523438, "step": 12150 }, { "epoch": 0.5786666666666667, "grad_norm": 0.027856744825839996, "learning_rate": 0.024000000208616257, "loss": 2.3036251068115234, "step": 12152 }, { "epoch": 0.5787619047619048, "grad_norm": 0.026809196919202805, "learning_rate": 0.024000000208616257, "loss": 2.324432373046875, "step": 12154 }, { "epoch": 0.5788571428571428, "grad_norm": 0.028046058490872383, "learning_rate": 0.024000000208616257, "loss": 2.3662359714508057, "step": 12156 }, { "epoch": 0.578952380952381, "grad_norm": 0.027851583436131477, "learning_rate": 0.024000000208616257, "loss": 2.3113880157470703, "step": 12158 }, { "epoch": 0.579047619047619, "grad_norm": 0.027125252410769463, "learning_rate": 0.024000000208616257, "loss": 2.2982168197631836, "step": 12160 }, { "epoch": 0.5791428571428572, "grad_norm": 0.02890186756849289, "learning_rate": 0.024000000208616257, "loss": 2.338730812072754, "step": 12162 }, { "epoch": 0.5792380952380952, "grad_norm": 0.028973866254091263, "learning_rate": 0.024000000208616257, "loss": 2.3199520111083984, "step": 12164 }, { "epoch": 0.5793333333333334, "grad_norm": 0.027984997257590294, "learning_rate": 0.024000000208616257, "loss": 2.3168087005615234, "step": 12166 }, { "epoch": 0.5794285714285714, "grad_norm": 0.027805211022496223, "learning_rate": 0.024000000208616257, "loss": 2.310680866241455, "step": 12168 }, { "epoch": 0.5795238095238096, "grad_norm": 0.02701435051858425, "learning_rate": 0.024000000208616257, "loss": 2.30135440826416, "step": 12170 }, { "epoch": 0.5796190476190476, "grad_norm": 0.02834789641201496, "learning_rate": 0.024000000208616257, "loss": 2.345079183578491, "step": 12172 }, { "epoch": 0.5797142857142857, "grad_norm": 0.028523709625005722, "learning_rate": 0.024000000208616257, "loss": 2.3472061157226562, "step": 12174 }, { "epoch": 0.5798095238095238, "grad_norm": 0.02786180004477501, "learning_rate": 0.024000000208616257, "loss": 2.367483139038086, "step": 12176 }, { "epoch": 0.5799047619047619, "grad_norm": 0.027829425409436226, "learning_rate": 0.024000000208616257, "loss": 2.312840461730957, "step": 12178 }, { "epoch": 0.58, "grad_norm": 0.02847628854215145, "learning_rate": 0.024000000208616257, "loss": 2.342899799346924, "step": 12180 }, { "epoch": 0.5800952380952381, "grad_norm": 0.02684679627418518, "learning_rate": 0.024000000208616257, "loss": 2.3088324069976807, "step": 12182 }, { "epoch": 0.5801904761904761, "grad_norm": 0.028722072020173073, "learning_rate": 0.024000000208616257, "loss": 2.3582024574279785, "step": 12184 }, { "epoch": 0.5802857142857143, "grad_norm": 0.027050629258155823, "learning_rate": 0.024000000208616257, "loss": 2.3228578567504883, "step": 12186 }, { "epoch": 0.5803809523809523, "grad_norm": 0.026955096051096916, "learning_rate": 0.024000000208616257, "loss": 2.306852340698242, "step": 12188 }, { "epoch": 0.5804761904761905, "grad_norm": 0.027379417791962624, "learning_rate": 0.024000000208616257, "loss": 2.347888708114624, "step": 12190 }, { "epoch": 0.5805714285714285, "grad_norm": 0.026718558743596077, "learning_rate": 0.024000000208616257, "loss": 2.318300247192383, "step": 12192 }, { "epoch": 0.5806666666666667, "grad_norm": 0.028107907623052597, "learning_rate": 0.024000000208616257, "loss": 2.3139748573303223, "step": 12194 }, { "epoch": 0.5807619047619048, "grad_norm": 0.027575552463531494, "learning_rate": 0.024000000208616257, "loss": 2.3176004886627197, "step": 12196 }, { "epoch": 0.5808571428571428, "grad_norm": 0.02656383439898491, "learning_rate": 0.024000000208616257, "loss": 2.3347442150115967, "step": 12198 }, { "epoch": 0.580952380952381, "grad_norm": 0.027088945731520653, "learning_rate": 0.024000000208616257, "loss": 2.315256118774414, "step": 12200 }, { "epoch": 0.581047619047619, "grad_norm": 0.026894284412264824, "learning_rate": 0.024000000208616257, "loss": 2.315056324005127, "step": 12202 }, { "epoch": 0.5811428571428572, "grad_norm": 0.02698647417128086, "learning_rate": 0.024000000208616257, "loss": 2.334862470626831, "step": 12204 }, { "epoch": 0.5812380952380952, "grad_norm": 0.030697818845510483, "learning_rate": 0.024000000208616257, "loss": 2.3071393966674805, "step": 12206 }, { "epoch": 0.5813333333333334, "grad_norm": 0.03349713236093521, "learning_rate": 0.024000000208616257, "loss": 2.3386688232421875, "step": 12208 }, { "epoch": 0.5814285714285714, "grad_norm": 0.028439899906516075, "learning_rate": 0.024000000208616257, "loss": 2.348507881164551, "step": 12210 }, { "epoch": 0.5815238095238096, "grad_norm": 0.029070058837532997, "learning_rate": 0.024000000208616257, "loss": 2.3025574684143066, "step": 12212 }, { "epoch": 0.5816190476190476, "grad_norm": 0.027474218979477882, "learning_rate": 0.024000000208616257, "loss": 2.309096574783325, "step": 12214 }, { "epoch": 0.5817142857142857, "grad_norm": 0.02623731829226017, "learning_rate": 0.024000000208616257, "loss": 2.343217372894287, "step": 12216 }, { "epoch": 0.5818095238095238, "grad_norm": 0.026599377393722534, "learning_rate": 0.024000000208616257, "loss": 2.3469274044036865, "step": 12218 }, { "epoch": 0.5819047619047619, "grad_norm": 0.02796119637787342, "learning_rate": 0.024000000208616257, "loss": 2.34367036819458, "step": 12220 }, { "epoch": 0.582, "grad_norm": 0.03024294041097164, "learning_rate": 0.024000000208616257, "loss": 2.3057937622070312, "step": 12222 }, { "epoch": 0.5820952380952381, "grad_norm": 0.026055337861180305, "learning_rate": 0.024000000208616257, "loss": 2.3350911140441895, "step": 12224 }, { "epoch": 0.5821904761904761, "grad_norm": 0.029072187840938568, "learning_rate": 0.024000000208616257, "loss": 2.3408827781677246, "step": 12226 }, { "epoch": 0.5822857142857143, "grad_norm": 0.02599361166357994, "learning_rate": 0.024000000208616257, "loss": 2.336026668548584, "step": 12228 }, { "epoch": 0.5823809523809523, "grad_norm": 0.029126591980457306, "learning_rate": 0.024000000208616257, "loss": 2.312204122543335, "step": 12230 }, { "epoch": 0.5824761904761905, "grad_norm": 0.026838034391403198, "learning_rate": 0.024000000208616257, "loss": 2.3392133712768555, "step": 12232 }, { "epoch": 0.5825714285714285, "grad_norm": 0.0266078133136034, "learning_rate": 0.024000000208616257, "loss": 2.3402481079101562, "step": 12234 }, { "epoch": 0.5826666666666667, "grad_norm": 0.026904258877038956, "learning_rate": 0.024000000208616257, "loss": 2.312600612640381, "step": 12236 }, { "epoch": 0.5827619047619048, "grad_norm": 0.02651767060160637, "learning_rate": 0.024000000208616257, "loss": 2.339435577392578, "step": 12238 }, { "epoch": 0.5828571428571429, "grad_norm": 0.027102889493107796, "learning_rate": 0.024000000208616257, "loss": 2.312227725982666, "step": 12240 }, { "epoch": 0.582952380952381, "grad_norm": 0.025417771190404892, "learning_rate": 0.024000000208616257, "loss": 2.309314250946045, "step": 12242 }, { "epoch": 0.583047619047619, "grad_norm": 0.027607902884483337, "learning_rate": 0.024000000208616257, "loss": 2.326785087585449, "step": 12244 }, { "epoch": 0.5831428571428572, "grad_norm": 0.03293485566973686, "learning_rate": 0.024000000208616257, "loss": 2.3391613960266113, "step": 12246 }, { "epoch": 0.5832380952380952, "grad_norm": 0.03009520098567009, "learning_rate": 0.024000000208616257, "loss": 2.3243424892425537, "step": 12248 }, { "epoch": 0.5833333333333334, "grad_norm": 0.027315916493535042, "learning_rate": 0.024000000208616257, "loss": 2.2892696857452393, "step": 12250 }, { "epoch": 0.5834285714285714, "grad_norm": 0.028781428933143616, "learning_rate": 0.024000000208616257, "loss": 2.320204257965088, "step": 12252 }, { "epoch": 0.5835238095238096, "grad_norm": 0.026021920144557953, "learning_rate": 0.024000000208616257, "loss": 2.3069097995758057, "step": 12254 }, { "epoch": 0.5836190476190476, "grad_norm": 0.030875086784362793, "learning_rate": 0.024000000208616257, "loss": 2.3209919929504395, "step": 12256 }, { "epoch": 0.5837142857142857, "grad_norm": 0.027486611157655716, "learning_rate": 0.024000000208616257, "loss": 2.3185629844665527, "step": 12258 }, { "epoch": 0.5838095238095238, "grad_norm": 0.0344439335167408, "learning_rate": 0.024000000208616257, "loss": 2.3315703868865967, "step": 12260 }, { "epoch": 0.5839047619047619, "grad_norm": 0.029307818040251732, "learning_rate": 0.024000000208616257, "loss": 2.326796531677246, "step": 12262 }, { "epoch": 0.584, "grad_norm": 0.029890306293964386, "learning_rate": 0.024000000208616257, "loss": 2.351973533630371, "step": 12264 }, { "epoch": 0.5840952380952381, "grad_norm": 0.030015964061021805, "learning_rate": 0.024000000208616257, "loss": 2.3068652153015137, "step": 12266 }, { "epoch": 0.5841904761904761, "grad_norm": 0.02605317533016205, "learning_rate": 0.024000000208616257, "loss": 2.3384909629821777, "step": 12268 }, { "epoch": 0.5842857142857143, "grad_norm": 0.027455009520053864, "learning_rate": 0.024000000208616257, "loss": 2.328835964202881, "step": 12270 }, { "epoch": 0.5843809523809523, "grad_norm": 0.027896905317902565, "learning_rate": 0.024000000208616257, "loss": 2.320535898208618, "step": 12272 }, { "epoch": 0.5844761904761905, "grad_norm": 0.0275722686201334, "learning_rate": 0.024000000208616257, "loss": 2.3253555297851562, "step": 12274 }, { "epoch": 0.5845714285714285, "grad_norm": 0.027721311897039413, "learning_rate": 0.024000000208616257, "loss": 2.3308303356170654, "step": 12276 }, { "epoch": 0.5846666666666667, "grad_norm": 0.02587936446070671, "learning_rate": 0.024000000208616257, "loss": 2.3376612663269043, "step": 12278 }, { "epoch": 0.5847619047619048, "grad_norm": 0.027317168191075325, "learning_rate": 0.024000000208616257, "loss": 2.3483242988586426, "step": 12280 }, { "epoch": 0.5848571428571429, "grad_norm": 0.028771329671144485, "learning_rate": 0.024000000208616257, "loss": 2.3436343669891357, "step": 12282 }, { "epoch": 0.584952380952381, "grad_norm": 0.026538895443081856, "learning_rate": 0.024000000208616257, "loss": 2.320572853088379, "step": 12284 }, { "epoch": 0.585047619047619, "grad_norm": 0.027500299736857414, "learning_rate": 0.024000000208616257, "loss": 2.3324151039123535, "step": 12286 }, { "epoch": 0.5851428571428572, "grad_norm": 0.027250854298472404, "learning_rate": 0.024000000208616257, "loss": 2.3393595218658447, "step": 12288 }, { "epoch": 0.5852380952380952, "grad_norm": 0.02943519316613674, "learning_rate": 0.024000000208616257, "loss": 2.324178457260132, "step": 12290 }, { "epoch": 0.5853333333333334, "grad_norm": 0.03305273503065109, "learning_rate": 0.024000000208616257, "loss": 2.3183083534240723, "step": 12292 }, { "epoch": 0.5854285714285714, "grad_norm": 0.026793256402015686, "learning_rate": 0.024000000208616257, "loss": 2.303107261657715, "step": 12294 }, { "epoch": 0.5855238095238096, "grad_norm": 0.030139654874801636, "learning_rate": 0.024000000208616257, "loss": 2.3439459800720215, "step": 12296 }, { "epoch": 0.5856190476190476, "grad_norm": 0.02684975601732731, "learning_rate": 0.024000000208616257, "loss": 2.3258416652679443, "step": 12298 }, { "epoch": 0.5857142857142857, "grad_norm": 0.02996896766126156, "learning_rate": 0.024000000208616257, "loss": 2.330080509185791, "step": 12300 }, { "epoch": 0.5858095238095238, "grad_norm": 0.027806660160422325, "learning_rate": 0.024000000208616257, "loss": 2.3639535903930664, "step": 12302 }, { "epoch": 0.5859047619047619, "grad_norm": 0.026629945263266563, "learning_rate": 0.024000000208616257, "loss": 2.3559226989746094, "step": 12304 }, { "epoch": 0.586, "grad_norm": 0.02670132927596569, "learning_rate": 0.024000000208616257, "loss": 2.309173107147217, "step": 12306 }, { "epoch": 0.5860952380952381, "grad_norm": 0.02699791081249714, "learning_rate": 0.024000000208616257, "loss": 2.3401060104370117, "step": 12308 }, { "epoch": 0.5861904761904762, "grad_norm": 0.027892736718058586, "learning_rate": 0.024000000208616257, "loss": 2.341721534729004, "step": 12310 }, { "epoch": 0.5862857142857143, "grad_norm": 0.02787058986723423, "learning_rate": 0.024000000208616257, "loss": 2.356400728225708, "step": 12312 }, { "epoch": 0.5863809523809523, "grad_norm": 0.02884187549352646, "learning_rate": 0.024000000208616257, "loss": 2.3564813137054443, "step": 12314 }, { "epoch": 0.5864761904761905, "grad_norm": 0.027980411425232887, "learning_rate": 0.024000000208616257, "loss": 2.3304669857025146, "step": 12316 }, { "epoch": 0.5865714285714285, "grad_norm": 0.027060315012931824, "learning_rate": 0.024000000208616257, "loss": 2.3534576892852783, "step": 12318 }, { "epoch": 0.5866666666666667, "grad_norm": 0.02706301212310791, "learning_rate": 0.024000000208616257, "loss": 2.345503330230713, "step": 12320 }, { "epoch": 0.5867619047619047, "grad_norm": 0.02708302065730095, "learning_rate": 0.024000000208616257, "loss": 2.3420448303222656, "step": 12322 }, { "epoch": 0.5868571428571429, "grad_norm": 0.027856647968292236, "learning_rate": 0.024000000208616257, "loss": 2.3293380737304688, "step": 12324 }, { "epoch": 0.586952380952381, "grad_norm": 0.02805522084236145, "learning_rate": 0.024000000208616257, "loss": 2.3376917839050293, "step": 12326 }, { "epoch": 0.587047619047619, "grad_norm": 0.032565273344516754, "learning_rate": 0.024000000208616257, "loss": 2.340536594390869, "step": 12328 }, { "epoch": 0.5871428571428572, "grad_norm": 0.02631809376180172, "learning_rate": 0.024000000208616257, "loss": 2.319396495819092, "step": 12330 }, { "epoch": 0.5872380952380952, "grad_norm": 0.027144981548190117, "learning_rate": 0.024000000208616257, "loss": 2.3064870834350586, "step": 12332 }, { "epoch": 0.5873333333333334, "grad_norm": 0.025783292949199677, "learning_rate": 0.024000000208616257, "loss": 2.340022563934326, "step": 12334 }, { "epoch": 0.5874285714285714, "grad_norm": 0.02638058364391327, "learning_rate": 0.024000000208616257, "loss": 2.3246359825134277, "step": 12336 }, { "epoch": 0.5875238095238096, "grad_norm": 0.026182666420936584, "learning_rate": 0.024000000208616257, "loss": 2.3249261379241943, "step": 12338 }, { "epoch": 0.5876190476190476, "grad_norm": 0.033075448125600815, "learning_rate": 0.024000000208616257, "loss": 2.29268217086792, "step": 12340 }, { "epoch": 0.5877142857142857, "grad_norm": 0.02754410356283188, "learning_rate": 0.024000000208616257, "loss": 2.3230533599853516, "step": 12342 }, { "epoch": 0.5878095238095238, "grad_norm": 0.026523010805249214, "learning_rate": 0.024000000208616257, "loss": 2.343830108642578, "step": 12344 }, { "epoch": 0.5879047619047619, "grad_norm": 0.026724819093942642, "learning_rate": 0.024000000208616257, "loss": 2.331662654876709, "step": 12346 }, { "epoch": 0.588, "grad_norm": 0.028180018067359924, "learning_rate": 0.024000000208616257, "loss": 2.3533096313476562, "step": 12348 }, { "epoch": 0.5880952380952381, "grad_norm": 0.026779726147651672, "learning_rate": 0.024000000208616257, "loss": 2.3607592582702637, "step": 12350 }, { "epoch": 0.5881904761904762, "grad_norm": 0.026308685541152954, "learning_rate": 0.024000000208616257, "loss": 2.3370213508605957, "step": 12352 }, { "epoch": 0.5882857142857143, "grad_norm": 0.025329962372779846, "learning_rate": 0.024000000208616257, "loss": 2.3243541717529297, "step": 12354 }, { "epoch": 0.5883809523809523, "grad_norm": 0.026027774438261986, "learning_rate": 0.024000000208616257, "loss": 2.356414794921875, "step": 12356 }, { "epoch": 0.5884761904761905, "grad_norm": 0.029304828494787216, "learning_rate": 0.024000000208616257, "loss": 2.349241018295288, "step": 12358 }, { "epoch": 0.5885714285714285, "grad_norm": 0.027344312518835068, "learning_rate": 0.024000000208616257, "loss": 2.3188869953155518, "step": 12360 }, { "epoch": 0.5886666666666667, "grad_norm": 0.026703765615820885, "learning_rate": 0.024000000208616257, "loss": 2.336775779724121, "step": 12362 }, { "epoch": 0.5887619047619047, "grad_norm": 0.027941081672906876, "learning_rate": 0.024000000208616257, "loss": 2.343597650527954, "step": 12364 }, { "epoch": 0.5888571428571429, "grad_norm": 0.026447713375091553, "learning_rate": 0.024000000208616257, "loss": 2.3235812187194824, "step": 12366 }, { "epoch": 0.588952380952381, "grad_norm": 0.026614967733621597, "learning_rate": 0.024000000208616257, "loss": 2.3381810188293457, "step": 12368 }, { "epoch": 0.589047619047619, "grad_norm": 0.026431800797581673, "learning_rate": 0.024000000208616257, "loss": 2.327434539794922, "step": 12370 }, { "epoch": 0.5891428571428572, "grad_norm": 0.027294442057609558, "learning_rate": 0.024000000208616257, "loss": 2.3307201862335205, "step": 12372 }, { "epoch": 0.5892380952380952, "grad_norm": 0.026529692113399506, "learning_rate": 0.024000000208616257, "loss": 2.347377300262451, "step": 12374 }, { "epoch": 0.5893333333333334, "grad_norm": 0.028011338785290718, "learning_rate": 0.024000000208616257, "loss": 2.3640365600585938, "step": 12376 }, { "epoch": 0.5894285714285714, "grad_norm": 0.028010698035359383, "learning_rate": 0.024000000208616257, "loss": 2.3259787559509277, "step": 12378 }, { "epoch": 0.5895238095238096, "grad_norm": 0.028253963217139244, "learning_rate": 0.024000000208616257, "loss": 2.3724029064178467, "step": 12380 }, { "epoch": 0.5896190476190476, "grad_norm": 0.028004534542560577, "learning_rate": 0.024000000208616257, "loss": 2.335995674133301, "step": 12382 }, { "epoch": 0.5897142857142857, "grad_norm": 0.028582008555531502, "learning_rate": 0.024000000208616257, "loss": 2.3766250610351562, "step": 12384 }, { "epoch": 0.5898095238095238, "grad_norm": 0.030090680345892906, "learning_rate": 0.024000000208616257, "loss": 2.3355250358581543, "step": 12386 }, { "epoch": 0.5899047619047619, "grad_norm": 0.03152906149625778, "learning_rate": 0.024000000208616257, "loss": 2.3816866874694824, "step": 12388 }, { "epoch": 0.59, "grad_norm": 0.02908134087920189, "learning_rate": 0.024000000208616257, "loss": 2.3915066719055176, "step": 12390 }, { "epoch": 0.5900952380952381, "grad_norm": 0.027962446212768555, "learning_rate": 0.024000000208616257, "loss": 2.343268871307373, "step": 12392 }, { "epoch": 0.5901904761904762, "grad_norm": 0.03523149713873863, "learning_rate": 0.024000000208616257, "loss": 2.33189058303833, "step": 12394 }, { "epoch": 0.5902857142857143, "grad_norm": 0.029791386798024178, "learning_rate": 0.024000000208616257, "loss": 2.3295650482177734, "step": 12396 }, { "epoch": 0.5903809523809523, "grad_norm": 0.02732100524008274, "learning_rate": 0.024000000208616257, "loss": 2.3376755714416504, "step": 12398 }, { "epoch": 0.5904761904761905, "grad_norm": 0.03017984889447689, "learning_rate": 0.024000000208616257, "loss": 2.3291897773742676, "step": 12400 }, { "epoch": 0.5905714285714285, "grad_norm": 0.02772781439125538, "learning_rate": 0.024000000208616257, "loss": 2.33034086227417, "step": 12402 }, { "epoch": 0.5906666666666667, "grad_norm": 0.028456561267375946, "learning_rate": 0.024000000208616257, "loss": 2.3555893898010254, "step": 12404 }, { "epoch": 0.5907619047619047, "grad_norm": 0.02865447662770748, "learning_rate": 0.024000000208616257, "loss": 2.317617177963257, "step": 12406 }, { "epoch": 0.5908571428571429, "grad_norm": 0.027223162353038788, "learning_rate": 0.024000000208616257, "loss": 2.3155107498168945, "step": 12408 }, { "epoch": 0.590952380952381, "grad_norm": 0.026319595053792, "learning_rate": 0.024000000208616257, "loss": 2.322434186935425, "step": 12410 }, { "epoch": 0.591047619047619, "grad_norm": 0.026857294142246246, "learning_rate": 0.024000000208616257, "loss": 2.3375067710876465, "step": 12412 }, { "epoch": 0.5911428571428572, "grad_norm": 0.02672337181866169, "learning_rate": 0.024000000208616257, "loss": 2.347041130065918, "step": 12414 }, { "epoch": 0.5912380952380952, "grad_norm": 0.03202202171087265, "learning_rate": 0.024000000208616257, "loss": 2.3503715991973877, "step": 12416 }, { "epoch": 0.5913333333333334, "grad_norm": 0.02628675475716591, "learning_rate": 0.024000000208616257, "loss": 2.3528566360473633, "step": 12418 }, { "epoch": 0.5914285714285714, "grad_norm": 0.026766879484057426, "learning_rate": 0.024000000208616257, "loss": 2.3171932697296143, "step": 12420 }, { "epoch": 0.5915238095238096, "grad_norm": 0.026564452797174454, "learning_rate": 0.024000000208616257, "loss": 2.3435921669006348, "step": 12422 }, { "epoch": 0.5916190476190476, "grad_norm": 0.027140658348798752, "learning_rate": 0.024000000208616257, "loss": 2.354954957962036, "step": 12424 }, { "epoch": 0.5917142857142857, "grad_norm": 0.02736849896609783, "learning_rate": 0.024000000208616257, "loss": 2.330613613128662, "step": 12426 }, { "epoch": 0.5918095238095238, "grad_norm": 0.026462169364094734, "learning_rate": 0.024000000208616257, "loss": 2.3458335399627686, "step": 12428 }, { "epoch": 0.5919047619047619, "grad_norm": 0.02690066583454609, "learning_rate": 0.024000000208616257, "loss": 2.356632709503174, "step": 12430 }, { "epoch": 0.592, "grad_norm": 0.028632424771785736, "learning_rate": 0.024000000208616257, "loss": 2.357645034790039, "step": 12432 }, { "epoch": 0.5920952380952381, "grad_norm": 0.027319952845573425, "learning_rate": 0.024000000208616257, "loss": 2.343433380126953, "step": 12434 }, { "epoch": 0.5921904761904762, "grad_norm": 0.02761332131922245, "learning_rate": 0.024000000208616257, "loss": 2.3578267097473145, "step": 12436 }, { "epoch": 0.5922857142857143, "grad_norm": 0.03052588365972042, "learning_rate": 0.024000000208616257, "loss": 2.3333020210266113, "step": 12438 }, { "epoch": 0.5923809523809523, "grad_norm": 0.02854655683040619, "learning_rate": 0.024000000208616257, "loss": 2.355045795440674, "step": 12440 }, { "epoch": 0.5924761904761905, "grad_norm": 0.030274339020252228, "learning_rate": 0.024000000208616257, "loss": 2.3438355922698975, "step": 12442 }, { "epoch": 0.5925714285714285, "grad_norm": 0.0349469892680645, "learning_rate": 0.024000000208616257, "loss": 2.333352565765381, "step": 12444 }, { "epoch": 0.5926666666666667, "grad_norm": 0.02886793576180935, "learning_rate": 0.024000000208616257, "loss": 2.3508360385894775, "step": 12446 }, { "epoch": 0.5927619047619047, "grad_norm": 0.026890235021710396, "learning_rate": 0.024000000208616257, "loss": 2.3316636085510254, "step": 12448 }, { "epoch": 0.5928571428571429, "grad_norm": 0.02662172168493271, "learning_rate": 0.024000000208616257, "loss": 2.3562984466552734, "step": 12450 }, { "epoch": 0.5929523809523809, "grad_norm": 0.026432164013385773, "learning_rate": 0.024000000208616257, "loss": 2.3230042457580566, "step": 12452 }, { "epoch": 0.593047619047619, "grad_norm": 0.0261069368571043, "learning_rate": 0.024000000208616257, "loss": 2.348151922225952, "step": 12454 }, { "epoch": 0.5931428571428572, "grad_norm": 0.026898618787527084, "learning_rate": 0.024000000208616257, "loss": 2.350335121154785, "step": 12456 }, { "epoch": 0.5932380952380952, "grad_norm": 0.026696782559156418, "learning_rate": 0.024000000208616257, "loss": 2.365729570388794, "step": 12458 }, { "epoch": 0.5933333333333334, "grad_norm": 0.027331866323947906, "learning_rate": 0.024000000208616257, "loss": 2.3474931716918945, "step": 12460 }, { "epoch": 0.5934285714285714, "grad_norm": 0.027852287515997887, "learning_rate": 0.024000000208616257, "loss": 2.3323676586151123, "step": 12462 }, { "epoch": 0.5935238095238096, "grad_norm": 0.026050524786114693, "learning_rate": 0.024000000208616257, "loss": 2.3228673934936523, "step": 12464 }, { "epoch": 0.5936190476190476, "grad_norm": 0.02731472998857498, "learning_rate": 0.024000000208616257, "loss": 2.363190174102783, "step": 12466 }, { "epoch": 0.5937142857142857, "grad_norm": 0.030785121023654938, "learning_rate": 0.024000000208616257, "loss": 2.326927661895752, "step": 12468 }, { "epoch": 0.5938095238095238, "grad_norm": 0.027796080335974693, "learning_rate": 0.024000000208616257, "loss": 2.317498207092285, "step": 12470 }, { "epoch": 0.5939047619047619, "grad_norm": 0.02713398076593876, "learning_rate": 0.024000000208616257, "loss": 2.3475654125213623, "step": 12472 }, { "epoch": 0.594, "grad_norm": 0.026809845119714737, "learning_rate": 0.024000000208616257, "loss": 2.3509764671325684, "step": 12474 }, { "epoch": 0.5940952380952381, "grad_norm": 0.027782678604125977, "learning_rate": 0.024000000208616257, "loss": 2.3232669830322266, "step": 12476 }, { "epoch": 0.5941904761904762, "grad_norm": 0.027042880654335022, "learning_rate": 0.024000000208616257, "loss": 2.3173251152038574, "step": 12478 }, { "epoch": 0.5942857142857143, "grad_norm": 0.02868247963488102, "learning_rate": 0.024000000208616257, "loss": 2.369359254837036, "step": 12480 }, { "epoch": 0.5943809523809523, "grad_norm": 0.02755649946630001, "learning_rate": 0.024000000208616257, "loss": 2.347655773162842, "step": 12482 }, { "epoch": 0.5944761904761905, "grad_norm": 0.027663739398121834, "learning_rate": 0.024000000208616257, "loss": 2.3604249954223633, "step": 12484 }, { "epoch": 0.5945714285714285, "grad_norm": 0.026832766830921173, "learning_rate": 0.024000000208616257, "loss": 2.3375062942504883, "step": 12486 }, { "epoch": 0.5946666666666667, "grad_norm": 0.027483196929097176, "learning_rate": 0.024000000208616257, "loss": 2.3298404216766357, "step": 12488 }, { "epoch": 0.5947619047619047, "grad_norm": 0.027147145941853523, "learning_rate": 0.024000000208616257, "loss": 2.3186731338500977, "step": 12490 }, { "epoch": 0.5948571428571429, "grad_norm": 0.027380667626857758, "learning_rate": 0.024000000208616257, "loss": 2.358882427215576, "step": 12492 }, { "epoch": 0.5949523809523809, "grad_norm": 0.028413541615009308, "learning_rate": 0.024000000208616257, "loss": 2.3415164947509766, "step": 12494 }, { "epoch": 0.595047619047619, "grad_norm": 0.026057524606585503, "learning_rate": 0.024000000208616257, "loss": 2.3238089084625244, "step": 12496 }, { "epoch": 0.5951428571428572, "grad_norm": 0.026759067550301552, "learning_rate": 0.024000000208616257, "loss": 2.331364631652832, "step": 12498 }, { "epoch": 0.5952380952380952, "grad_norm": 0.02828497439622879, "learning_rate": 0.024000000208616257, "loss": 2.3108692169189453, "step": 12500 }, { "epoch": 0.5953333333333334, "grad_norm": 0.0273391492664814, "learning_rate": 0.024000000208616257, "loss": 2.3568763732910156, "step": 12502 }, { "epoch": 0.5954285714285714, "grad_norm": 0.028317231684923172, "learning_rate": 0.024000000208616257, "loss": 2.3429791927337646, "step": 12504 }, { "epoch": 0.5955238095238096, "grad_norm": 0.026133719831705093, "learning_rate": 0.024000000208616257, "loss": 2.3471639156341553, "step": 12506 }, { "epoch": 0.5956190476190476, "grad_norm": 0.027845311909914017, "learning_rate": 0.024000000208616257, "loss": 2.356475353240967, "step": 12508 }, { "epoch": 0.5957142857142858, "grad_norm": 0.02655179426074028, "learning_rate": 0.024000000208616257, "loss": 2.3567073345184326, "step": 12510 }, { "epoch": 0.5958095238095238, "grad_norm": 0.026589997112751007, "learning_rate": 0.024000000208616257, "loss": 2.333887815475464, "step": 12512 }, { "epoch": 0.5959047619047619, "grad_norm": 0.02593517303466797, "learning_rate": 0.024000000208616257, "loss": 2.3228261470794678, "step": 12514 }, { "epoch": 0.596, "grad_norm": 0.027106067165732384, "learning_rate": 0.024000000208616257, "loss": 2.358494281768799, "step": 12516 }, { "epoch": 0.5960952380952381, "grad_norm": 0.028650598600506783, "learning_rate": 0.024000000208616257, "loss": 2.3324925899505615, "step": 12518 }, { "epoch": 0.5961904761904762, "grad_norm": 0.026504117995500565, "learning_rate": 0.024000000208616257, "loss": 2.3487460613250732, "step": 12520 }, { "epoch": 0.5962857142857143, "grad_norm": 0.02852259948849678, "learning_rate": 0.024000000208616257, "loss": 2.3605175018310547, "step": 12522 }, { "epoch": 0.5963809523809523, "grad_norm": 0.02709975279867649, "learning_rate": 0.024000000208616257, "loss": 2.3561506271362305, "step": 12524 }, { "epoch": 0.5964761904761905, "grad_norm": 0.029831059277057648, "learning_rate": 0.024000000208616257, "loss": 2.357992172241211, "step": 12526 }, { "epoch": 0.5965714285714285, "grad_norm": 0.02590150758624077, "learning_rate": 0.024000000208616257, "loss": 2.3157308101654053, "step": 12528 }, { "epoch": 0.5966666666666667, "grad_norm": 0.026988904923200607, "learning_rate": 0.024000000208616257, "loss": 2.34720778465271, "step": 12530 }, { "epoch": 0.5967619047619047, "grad_norm": 0.027603531256318092, "learning_rate": 0.024000000208616257, "loss": 2.3240599632263184, "step": 12532 }, { "epoch": 0.5968571428571429, "grad_norm": 0.030643336474895477, "learning_rate": 0.024000000208616257, "loss": 2.3731141090393066, "step": 12534 }, { "epoch": 0.5969523809523809, "grad_norm": 0.028236741200089455, "learning_rate": 0.024000000208616257, "loss": 2.341582775115967, "step": 12536 }, { "epoch": 0.597047619047619, "grad_norm": 0.02848188951611519, "learning_rate": 0.024000000208616257, "loss": 2.329777717590332, "step": 12538 }, { "epoch": 0.5971428571428572, "grad_norm": 0.028160255402326584, "learning_rate": 0.024000000208616257, "loss": 2.3614683151245117, "step": 12540 }, { "epoch": 0.5972380952380952, "grad_norm": 0.025809507817029953, "learning_rate": 0.024000000208616257, "loss": 2.3435652256011963, "step": 12542 }, { "epoch": 0.5973333333333334, "grad_norm": 0.02808268368244171, "learning_rate": 0.024000000208616257, "loss": 2.3469011783599854, "step": 12544 }, { "epoch": 0.5974285714285714, "grad_norm": 0.027348650619387627, "learning_rate": 0.024000000208616257, "loss": 2.3368301391601562, "step": 12546 }, { "epoch": 0.5975238095238096, "grad_norm": 0.02758782170712948, "learning_rate": 0.024000000208616257, "loss": 2.318479537963867, "step": 12548 }, { "epoch": 0.5976190476190476, "grad_norm": 0.027248887345194817, "learning_rate": 0.024000000208616257, "loss": 2.385605812072754, "step": 12550 }, { "epoch": 0.5977142857142858, "grad_norm": 0.02952159382402897, "learning_rate": 0.024000000208616257, "loss": 2.3686916828155518, "step": 12552 }, { "epoch": 0.5978095238095238, "grad_norm": 0.026783905923366547, "learning_rate": 0.024000000208616257, "loss": 2.378345489501953, "step": 12554 }, { "epoch": 0.5979047619047619, "grad_norm": 0.026729974895715714, "learning_rate": 0.024000000208616257, "loss": 2.3604037761688232, "step": 12556 }, { "epoch": 0.598, "grad_norm": 0.02637012116611004, "learning_rate": 0.024000000208616257, "loss": 2.3488264083862305, "step": 12558 }, { "epoch": 0.5980952380952381, "grad_norm": 0.026248708367347717, "learning_rate": 0.024000000208616257, "loss": 2.3552913665771484, "step": 12560 }, { "epoch": 0.5981904761904762, "grad_norm": 0.03063446283340454, "learning_rate": 0.024000000208616257, "loss": 2.3377737998962402, "step": 12562 }, { "epoch": 0.5982857142857143, "grad_norm": 0.031327299773693085, "learning_rate": 0.024000000208616257, "loss": 2.3280606269836426, "step": 12564 }, { "epoch": 0.5983809523809523, "grad_norm": 0.025896644219756126, "learning_rate": 0.024000000208616257, "loss": 2.345973491668701, "step": 12566 }, { "epoch": 0.5984761904761905, "grad_norm": 0.02605678141117096, "learning_rate": 0.024000000208616257, "loss": 2.388899803161621, "step": 12568 }, { "epoch": 0.5985714285714285, "grad_norm": 0.031516142189502716, "learning_rate": 0.024000000208616257, "loss": 2.345851421356201, "step": 12570 }, { "epoch": 0.5986666666666667, "grad_norm": 0.026597822085022926, "learning_rate": 0.024000000208616257, "loss": 2.3399815559387207, "step": 12572 }, { "epoch": 0.5987619047619047, "grad_norm": 0.025564149022102356, "learning_rate": 0.024000000208616257, "loss": 2.3325319290161133, "step": 12574 }, { "epoch": 0.5988571428571429, "grad_norm": 0.026705164462327957, "learning_rate": 0.024000000208616257, "loss": 2.369835615158081, "step": 12576 }, { "epoch": 0.5989523809523809, "grad_norm": 0.026684381067752838, "learning_rate": 0.024000000208616257, "loss": 2.33402943611145, "step": 12578 }, { "epoch": 0.599047619047619, "grad_norm": 0.026883454993367195, "learning_rate": 0.024000000208616257, "loss": 2.344709873199463, "step": 12580 }, { "epoch": 0.5991428571428571, "grad_norm": 0.029704971238970757, "learning_rate": 0.024000000208616257, "loss": 2.354783058166504, "step": 12582 }, { "epoch": 0.5992380952380952, "grad_norm": 0.031182175502181053, "learning_rate": 0.024000000208616257, "loss": 2.3260035514831543, "step": 12584 }, { "epoch": 0.5993333333333334, "grad_norm": 0.026243455708026886, "learning_rate": 0.024000000208616257, "loss": 2.3362832069396973, "step": 12586 }, { "epoch": 0.5994285714285714, "grad_norm": 0.027291836217045784, "learning_rate": 0.024000000208616257, "loss": 2.3687081336975098, "step": 12588 }, { "epoch": 0.5995238095238096, "grad_norm": 0.025836963206529617, "learning_rate": 0.024000000208616257, "loss": 2.3225207328796387, "step": 12590 }, { "epoch": 0.5996190476190476, "grad_norm": 0.02703310176730156, "learning_rate": 0.024000000208616257, "loss": 2.3498802185058594, "step": 12592 }, { "epoch": 0.5997142857142858, "grad_norm": 0.0267189871519804, "learning_rate": 0.024000000208616257, "loss": 2.340625286102295, "step": 12594 }, { "epoch": 0.5998095238095238, "grad_norm": 0.02759486809372902, "learning_rate": 0.024000000208616257, "loss": 2.355551242828369, "step": 12596 }, { "epoch": 0.5999047619047619, "grad_norm": 0.02891211397945881, "learning_rate": 0.024000000208616257, "loss": 2.3739867210388184, "step": 12598 }, { "epoch": 0.6, "grad_norm": 0.02892109379172325, "learning_rate": 0.024000000208616257, "loss": 2.3678574562072754, "step": 12600 }, { "epoch": 0.6000952380952381, "grad_norm": 0.028089094907045364, "learning_rate": 0.024000000208616257, "loss": 2.3624000549316406, "step": 12602 }, { "epoch": 0.6001904761904762, "grad_norm": 0.03137904405593872, "learning_rate": 0.024000000208616257, "loss": 2.362485408782959, "step": 12604 }, { "epoch": 0.6002857142857143, "grad_norm": 0.028560757637023926, "learning_rate": 0.024000000208616257, "loss": 2.350247859954834, "step": 12606 }, { "epoch": 0.6003809523809523, "grad_norm": 0.027531126514077187, "learning_rate": 0.024000000208616257, "loss": 2.3453192710876465, "step": 12608 }, { "epoch": 0.6004761904761905, "grad_norm": 0.027434905990958214, "learning_rate": 0.024000000208616257, "loss": 2.3470547199249268, "step": 12610 }, { "epoch": 0.6005714285714285, "grad_norm": 0.030104635283350945, "learning_rate": 0.024000000208616257, "loss": 2.3538520336151123, "step": 12612 }, { "epoch": 0.6006666666666667, "grad_norm": 0.029940536245703697, "learning_rate": 0.024000000208616257, "loss": 2.3676249980926514, "step": 12614 }, { "epoch": 0.6007619047619047, "grad_norm": 0.03274943679571152, "learning_rate": 0.024000000208616257, "loss": 2.3707919120788574, "step": 12616 }, { "epoch": 0.6008571428571429, "grad_norm": 0.03531825914978981, "learning_rate": 0.024000000208616257, "loss": 2.339071273803711, "step": 12618 }, { "epoch": 0.6009523809523809, "grad_norm": 0.027689484879374504, "learning_rate": 0.024000000208616257, "loss": 2.358069658279419, "step": 12620 }, { "epoch": 0.601047619047619, "grad_norm": 0.025952721014618874, "learning_rate": 0.024000000208616257, "loss": 2.3007497787475586, "step": 12622 }, { "epoch": 0.6011428571428571, "grad_norm": 0.02757319249212742, "learning_rate": 0.024000000208616257, "loss": 2.3802051544189453, "step": 12624 }, { "epoch": 0.6012380952380952, "grad_norm": 0.025669243186712265, "learning_rate": 0.024000000208616257, "loss": 2.3247451782226562, "step": 12626 }, { "epoch": 0.6013333333333334, "grad_norm": 0.02647377736866474, "learning_rate": 0.024000000208616257, "loss": 2.3633780479431152, "step": 12628 }, { "epoch": 0.6014285714285714, "grad_norm": 0.027842698618769646, "learning_rate": 0.024000000208616257, "loss": 2.3507697582244873, "step": 12630 }, { "epoch": 0.6015238095238096, "grad_norm": 0.027910031378269196, "learning_rate": 0.024000000208616257, "loss": 2.3456008434295654, "step": 12632 }, { "epoch": 0.6016190476190476, "grad_norm": 0.02662724442780018, "learning_rate": 0.024000000208616257, "loss": 2.357271909713745, "step": 12634 }, { "epoch": 0.6017142857142858, "grad_norm": 0.02577401138842106, "learning_rate": 0.024000000208616257, "loss": 2.365009307861328, "step": 12636 }, { "epoch": 0.6018095238095238, "grad_norm": 0.030936935916543007, "learning_rate": 0.024000000208616257, "loss": 2.3287711143493652, "step": 12638 }, { "epoch": 0.6019047619047619, "grad_norm": 0.03194577619433403, "learning_rate": 0.024000000208616257, "loss": 2.363348960876465, "step": 12640 }, { "epoch": 0.602, "grad_norm": 0.027514800429344177, "learning_rate": 0.024000000208616257, "loss": 2.355836868286133, "step": 12642 }, { "epoch": 0.6020952380952381, "grad_norm": 0.02590446174144745, "learning_rate": 0.024000000208616257, "loss": 2.3483080863952637, "step": 12644 }, { "epoch": 0.6021904761904762, "grad_norm": 0.0288520697504282, "learning_rate": 0.024000000208616257, "loss": 2.357712507247925, "step": 12646 }, { "epoch": 0.6022857142857143, "grad_norm": 0.030240874737501144, "learning_rate": 0.024000000208616257, "loss": 2.369701623916626, "step": 12648 }, { "epoch": 0.6023809523809524, "grad_norm": 0.02838442102074623, "learning_rate": 0.024000000208616257, "loss": 2.3134970664978027, "step": 12650 }, { "epoch": 0.6024761904761905, "grad_norm": 0.02775382064282894, "learning_rate": 0.024000000208616257, "loss": 2.3728408813476562, "step": 12652 }, { "epoch": 0.6025714285714285, "grad_norm": 0.029964959248900414, "learning_rate": 0.024000000208616257, "loss": 2.355043411254883, "step": 12654 }, { "epoch": 0.6026666666666667, "grad_norm": 0.027448218315839767, "learning_rate": 0.024000000208616257, "loss": 2.343069076538086, "step": 12656 }, { "epoch": 0.6027619047619047, "grad_norm": 0.026068510487675667, "learning_rate": 0.024000000208616257, "loss": 2.3375322818756104, "step": 12658 }, { "epoch": 0.6028571428571429, "grad_norm": 0.02551000379025936, "learning_rate": 0.024000000208616257, "loss": 2.3461546897888184, "step": 12660 }, { "epoch": 0.6029523809523809, "grad_norm": 0.02859029546380043, "learning_rate": 0.024000000208616257, "loss": 2.3664181232452393, "step": 12662 }, { "epoch": 0.603047619047619, "grad_norm": 0.028291897848248482, "learning_rate": 0.024000000208616257, "loss": 2.366306781768799, "step": 12664 }, { "epoch": 0.6031428571428571, "grad_norm": 0.028434470295906067, "learning_rate": 0.024000000208616257, "loss": 2.3201684951782227, "step": 12666 }, { "epoch": 0.6032380952380952, "grad_norm": 0.02694174088537693, "learning_rate": 0.024000000208616257, "loss": 2.363816976547241, "step": 12668 }, { "epoch": 0.6033333333333334, "grad_norm": 0.027346139773726463, "learning_rate": 0.024000000208616257, "loss": 2.377267837524414, "step": 12670 }, { "epoch": 0.6034285714285714, "grad_norm": 0.02582586370408535, "learning_rate": 0.024000000208616257, "loss": 2.337599754333496, "step": 12672 }, { "epoch": 0.6035238095238096, "grad_norm": 0.027420490980148315, "learning_rate": 0.024000000208616257, "loss": 2.3488059043884277, "step": 12674 }, { "epoch": 0.6036190476190476, "grad_norm": 0.026611093431711197, "learning_rate": 0.024000000208616257, "loss": 2.3625595569610596, "step": 12676 }, { "epoch": 0.6037142857142858, "grad_norm": 0.02602340467274189, "learning_rate": 0.024000000208616257, "loss": 2.3584866523742676, "step": 12678 }, { "epoch": 0.6038095238095238, "grad_norm": 0.02645900472998619, "learning_rate": 0.024000000208616257, "loss": 2.372117519378662, "step": 12680 }, { "epoch": 0.6039047619047619, "grad_norm": 0.02749328315258026, "learning_rate": 0.024000000208616257, "loss": 2.3600754737854004, "step": 12682 }, { "epoch": 0.604, "grad_norm": 0.025918126106262207, "learning_rate": 0.024000000208616257, "loss": 2.365000009536743, "step": 12684 }, { "epoch": 0.6040952380952381, "grad_norm": 0.025258004665374756, "learning_rate": 0.024000000208616257, "loss": 2.360675811767578, "step": 12686 }, { "epoch": 0.6041904761904762, "grad_norm": 0.027397656813263893, "learning_rate": 0.024000000208616257, "loss": 2.3412179946899414, "step": 12688 }, { "epoch": 0.6042857142857143, "grad_norm": 0.028736473992466927, "learning_rate": 0.024000000208616257, "loss": 2.3601455688476562, "step": 12690 }, { "epoch": 0.6043809523809524, "grad_norm": 0.030488451942801476, "learning_rate": 0.024000000208616257, "loss": 2.381566047668457, "step": 12692 }, { "epoch": 0.6044761904761905, "grad_norm": 0.02616218663752079, "learning_rate": 0.024000000208616257, "loss": 2.345754861831665, "step": 12694 }, { "epoch": 0.6045714285714285, "grad_norm": 0.028545774519443512, "learning_rate": 0.024000000208616257, "loss": 2.3617336750030518, "step": 12696 }, { "epoch": 0.6046666666666667, "grad_norm": 0.026383956894278526, "learning_rate": 0.024000000208616257, "loss": 2.33538818359375, "step": 12698 }, { "epoch": 0.6047619047619047, "grad_norm": 0.02824481390416622, "learning_rate": 0.024000000208616257, "loss": 2.3626246452331543, "step": 12700 }, { "epoch": 0.6048571428571429, "grad_norm": 0.027490301057696342, "learning_rate": 0.024000000208616257, "loss": 2.342597723007202, "step": 12702 }, { "epoch": 0.6049523809523809, "grad_norm": 0.026940977200865746, "learning_rate": 0.024000000208616257, "loss": 2.3731257915496826, "step": 12704 }, { "epoch": 0.6050476190476191, "grad_norm": 0.030284637585282326, "learning_rate": 0.024000000208616257, "loss": 2.318316698074341, "step": 12706 }, { "epoch": 0.6051428571428571, "grad_norm": 0.03061310574412346, "learning_rate": 0.024000000208616257, "loss": 2.3584399223327637, "step": 12708 }, { "epoch": 0.6052380952380952, "grad_norm": 0.029326634481549263, "learning_rate": 0.024000000208616257, "loss": 2.3292131423950195, "step": 12710 }, { "epoch": 0.6053333333333333, "grad_norm": 0.02877846732735634, "learning_rate": 0.024000000208616257, "loss": 2.338799476623535, "step": 12712 }, { "epoch": 0.6054285714285714, "grad_norm": 0.02623998560011387, "learning_rate": 0.024000000208616257, "loss": 2.3442955017089844, "step": 12714 }, { "epoch": 0.6055238095238096, "grad_norm": 0.02787717618048191, "learning_rate": 0.024000000208616257, "loss": 2.3518052101135254, "step": 12716 }, { "epoch": 0.6056190476190476, "grad_norm": 0.028606202453374863, "learning_rate": 0.024000000208616257, "loss": 2.3512685298919678, "step": 12718 }, { "epoch": 0.6057142857142858, "grad_norm": 0.025832900777459145, "learning_rate": 0.024000000208616257, "loss": 2.340134620666504, "step": 12720 }, { "epoch": 0.6058095238095238, "grad_norm": 0.027487386018037796, "learning_rate": 0.024000000208616257, "loss": 2.3495748043060303, "step": 12722 }, { "epoch": 0.605904761904762, "grad_norm": 0.026509759947657585, "learning_rate": 0.024000000208616257, "loss": 2.351602792739868, "step": 12724 }, { "epoch": 0.606, "grad_norm": 0.025882676243782043, "learning_rate": 0.024000000208616257, "loss": 2.337894916534424, "step": 12726 }, { "epoch": 0.6060952380952381, "grad_norm": 0.029846223071217537, "learning_rate": 0.024000000208616257, "loss": 2.351273536682129, "step": 12728 }, { "epoch": 0.6061904761904762, "grad_norm": 0.026483407244086266, "learning_rate": 0.024000000208616257, "loss": 2.3457107543945312, "step": 12730 }, { "epoch": 0.6062857142857143, "grad_norm": 0.02559743821620941, "learning_rate": 0.024000000208616257, "loss": 2.350172519683838, "step": 12732 }, { "epoch": 0.6063809523809524, "grad_norm": 0.026274321600794792, "learning_rate": 0.024000000208616257, "loss": 2.338510513305664, "step": 12734 }, { "epoch": 0.6064761904761905, "grad_norm": 0.026931939646601677, "learning_rate": 0.024000000208616257, "loss": 2.32676362991333, "step": 12736 }, { "epoch": 0.6065714285714285, "grad_norm": 0.0261532012373209, "learning_rate": 0.024000000208616257, "loss": 2.368873119354248, "step": 12738 }, { "epoch": 0.6066666666666667, "grad_norm": 0.02804437093436718, "learning_rate": 0.024000000208616257, "loss": 2.364927291870117, "step": 12740 }, { "epoch": 0.6067619047619047, "grad_norm": 0.02654789388179779, "learning_rate": 0.024000000208616257, "loss": 2.350320816040039, "step": 12742 }, { "epoch": 0.6068571428571429, "grad_norm": 0.028286196291446686, "learning_rate": 0.024000000208616257, "loss": 2.3510255813598633, "step": 12744 }, { "epoch": 0.6069523809523809, "grad_norm": 0.027663538232445717, "learning_rate": 0.024000000208616257, "loss": 2.3475446701049805, "step": 12746 }, { "epoch": 0.6070476190476191, "grad_norm": 0.026444604620337486, "learning_rate": 0.024000000208616257, "loss": 2.351611614227295, "step": 12748 }, { "epoch": 0.6071428571428571, "grad_norm": 0.02652369998395443, "learning_rate": 0.024000000208616257, "loss": 2.338296890258789, "step": 12750 }, { "epoch": 0.6072380952380952, "grad_norm": 0.027506934478878975, "learning_rate": 0.024000000208616257, "loss": 2.326784610748291, "step": 12752 }, { "epoch": 0.6073333333333333, "grad_norm": 0.026085510849952698, "learning_rate": 0.024000000208616257, "loss": 2.3528716564178467, "step": 12754 }, { "epoch": 0.6074285714285714, "grad_norm": 0.025778600946068764, "learning_rate": 0.024000000208616257, "loss": 2.3453001976013184, "step": 12756 }, { "epoch": 0.6075238095238096, "grad_norm": 0.025905203074216843, "learning_rate": 0.024000000208616257, "loss": 2.3546667098999023, "step": 12758 }, { "epoch": 0.6076190476190476, "grad_norm": 0.02686414308845997, "learning_rate": 0.024000000208616257, "loss": 2.35843563079834, "step": 12760 }, { "epoch": 0.6077142857142858, "grad_norm": 0.026894737035036087, "learning_rate": 0.024000000208616257, "loss": 2.3670802116394043, "step": 12762 }, { "epoch": 0.6078095238095238, "grad_norm": 0.026996105909347534, "learning_rate": 0.024000000208616257, "loss": 2.3344674110412598, "step": 12764 }, { "epoch": 0.607904761904762, "grad_norm": 0.03081545978784561, "learning_rate": 0.024000000208616257, "loss": 2.364081859588623, "step": 12766 }, { "epoch": 0.608, "grad_norm": 0.02665305882692337, "learning_rate": 0.024000000208616257, "loss": 2.3721835613250732, "step": 12768 }, { "epoch": 0.6080952380952381, "grad_norm": 0.026531822979450226, "learning_rate": 0.024000000208616257, "loss": 2.32822322845459, "step": 12770 }, { "epoch": 0.6081904761904762, "grad_norm": 0.02942500077188015, "learning_rate": 0.024000000208616257, "loss": 2.3618335723876953, "step": 12772 }, { "epoch": 0.6082857142857143, "grad_norm": 0.02596276067197323, "learning_rate": 0.024000000208616257, "loss": 2.3395001888275146, "step": 12774 }, { "epoch": 0.6083809523809524, "grad_norm": 0.02678365632891655, "learning_rate": 0.024000000208616257, "loss": 2.359920024871826, "step": 12776 }, { "epoch": 0.6084761904761905, "grad_norm": 0.02756374143064022, "learning_rate": 0.024000000208616257, "loss": 2.365406036376953, "step": 12778 }, { "epoch": 0.6085714285714285, "grad_norm": 0.02714204415678978, "learning_rate": 0.024000000208616257, "loss": 2.3737735748291016, "step": 12780 }, { "epoch": 0.6086666666666667, "grad_norm": 0.02816883660852909, "learning_rate": 0.024000000208616257, "loss": 2.3572001457214355, "step": 12782 }, { "epoch": 0.6087619047619047, "grad_norm": 0.02875353768467903, "learning_rate": 0.024000000208616257, "loss": 2.344691276550293, "step": 12784 }, { "epoch": 0.6088571428571429, "grad_norm": 0.02732047811150551, "learning_rate": 0.024000000208616257, "loss": 2.365736961364746, "step": 12786 }, { "epoch": 0.6089523809523809, "grad_norm": 0.026692450046539307, "learning_rate": 0.024000000208616257, "loss": 2.3500590324401855, "step": 12788 }, { "epoch": 0.6090476190476191, "grad_norm": 0.029871828854084015, "learning_rate": 0.024000000208616257, "loss": 2.3860092163085938, "step": 12790 }, { "epoch": 0.6091428571428571, "grad_norm": 0.02608831226825714, "learning_rate": 0.024000000208616257, "loss": 2.3539295196533203, "step": 12792 }, { "epoch": 0.6092380952380952, "grad_norm": 0.027160095050930977, "learning_rate": 0.024000000208616257, "loss": 2.3473753929138184, "step": 12794 }, { "epoch": 0.6093333333333333, "grad_norm": 0.027485916391015053, "learning_rate": 0.024000000208616257, "loss": 2.360283374786377, "step": 12796 }, { "epoch": 0.6094285714285714, "grad_norm": 0.032361581921577454, "learning_rate": 0.024000000208616257, "loss": 2.355602741241455, "step": 12798 }, { "epoch": 0.6095238095238096, "grad_norm": 0.03563147038221359, "learning_rate": 0.024000000208616257, "loss": 2.3466663360595703, "step": 12800 }, { "epoch": 0.6096190476190476, "grad_norm": 0.02916448749601841, "learning_rate": 0.024000000208616257, "loss": 2.376577377319336, "step": 12802 }, { "epoch": 0.6097142857142858, "grad_norm": 0.028139695525169373, "learning_rate": 0.024000000208616257, "loss": 2.329564094543457, "step": 12804 }, { "epoch": 0.6098095238095238, "grad_norm": 0.02739323489367962, "learning_rate": 0.024000000208616257, "loss": 2.34096097946167, "step": 12806 }, { "epoch": 0.609904761904762, "grad_norm": 0.02622041665017605, "learning_rate": 0.024000000208616257, "loss": 2.3497166633605957, "step": 12808 }, { "epoch": 0.61, "grad_norm": 0.02889302372932434, "learning_rate": 0.024000000208616257, "loss": 2.3660449981689453, "step": 12810 }, { "epoch": 0.6100952380952381, "grad_norm": 0.029785845428705215, "learning_rate": 0.024000000208616257, "loss": 2.3726117610931396, "step": 12812 }, { "epoch": 0.6101904761904762, "grad_norm": 0.028419960290193558, "learning_rate": 0.024000000208616257, "loss": 2.3291311264038086, "step": 12814 }, { "epoch": 0.6102857142857143, "grad_norm": 0.02635877951979637, "learning_rate": 0.024000000208616257, "loss": 2.3412978649139404, "step": 12816 }, { "epoch": 0.6103809523809524, "grad_norm": 0.027006693184375763, "learning_rate": 0.024000000208616257, "loss": 2.3541855812072754, "step": 12818 }, { "epoch": 0.6104761904761905, "grad_norm": 0.027454867959022522, "learning_rate": 0.024000000208616257, "loss": 2.3455309867858887, "step": 12820 }, { "epoch": 0.6105714285714285, "grad_norm": 0.0309754665941, "learning_rate": 0.024000000208616257, "loss": 2.3741743564605713, "step": 12822 }, { "epoch": 0.6106666666666667, "grad_norm": 0.026904497295618057, "learning_rate": 0.024000000208616257, "loss": 2.343388080596924, "step": 12824 }, { "epoch": 0.6107619047619047, "grad_norm": 0.027747489511966705, "learning_rate": 0.024000000208616257, "loss": 2.363219976425171, "step": 12826 }, { "epoch": 0.6108571428571429, "grad_norm": 0.026881687343120575, "learning_rate": 0.024000000208616257, "loss": 2.3715312480926514, "step": 12828 }, { "epoch": 0.6109523809523809, "grad_norm": 0.02649783343076706, "learning_rate": 0.024000000208616257, "loss": 2.376107692718506, "step": 12830 }, { "epoch": 0.6110476190476191, "grad_norm": 0.02634841948747635, "learning_rate": 0.024000000208616257, "loss": 2.361506938934326, "step": 12832 }, { "epoch": 0.6111428571428571, "grad_norm": 0.025953246280550957, "learning_rate": 0.024000000208616257, "loss": 2.334240436553955, "step": 12834 }, { "epoch": 0.6112380952380952, "grad_norm": 0.030032964423298836, "learning_rate": 0.024000000208616257, "loss": 2.3238658905029297, "step": 12836 }, { "epoch": 0.6113333333333333, "grad_norm": 0.03030177392065525, "learning_rate": 0.024000000208616257, "loss": 2.3534207344055176, "step": 12838 }, { "epoch": 0.6114285714285714, "grad_norm": 0.02715814858675003, "learning_rate": 0.024000000208616257, "loss": 2.328643321990967, "step": 12840 }, { "epoch": 0.6115238095238095, "grad_norm": 0.026635926216840744, "learning_rate": 0.024000000208616257, "loss": 2.3326945304870605, "step": 12842 }, { "epoch": 0.6116190476190476, "grad_norm": 0.026586832478642464, "learning_rate": 0.024000000208616257, "loss": 2.325711727142334, "step": 12844 }, { "epoch": 0.6117142857142858, "grad_norm": 0.026076599955558777, "learning_rate": 0.024000000208616257, "loss": 2.33970308303833, "step": 12846 }, { "epoch": 0.6118095238095238, "grad_norm": 0.027399858459830284, "learning_rate": 0.024000000208616257, "loss": 2.3499832153320312, "step": 12848 }, { "epoch": 0.611904761904762, "grad_norm": 0.028265420347452164, "learning_rate": 0.024000000208616257, "loss": 2.3428902626037598, "step": 12850 }, { "epoch": 0.612, "grad_norm": 0.03158644586801529, "learning_rate": 0.024000000208616257, "loss": 2.348665952682495, "step": 12852 }, { "epoch": 0.6120952380952381, "grad_norm": 0.031958360224962234, "learning_rate": 0.024000000208616257, "loss": 2.345581531524658, "step": 12854 }, { "epoch": 0.6121904761904762, "grad_norm": 0.028716005384922028, "learning_rate": 0.024000000208616257, "loss": 2.3431296348571777, "step": 12856 }, { "epoch": 0.6122857142857143, "grad_norm": 0.027855079621076584, "learning_rate": 0.024000000208616257, "loss": 2.3532955646514893, "step": 12858 }, { "epoch": 0.6123809523809524, "grad_norm": 0.02773091569542885, "learning_rate": 0.024000000208616257, "loss": 2.309814929962158, "step": 12860 }, { "epoch": 0.6124761904761905, "grad_norm": 0.026979560032486916, "learning_rate": 0.024000000208616257, "loss": 2.3610196113586426, "step": 12862 }, { "epoch": 0.6125714285714285, "grad_norm": 0.02647310122847557, "learning_rate": 0.024000000208616257, "loss": 2.393610715866089, "step": 12864 }, { "epoch": 0.6126666666666667, "grad_norm": 0.0261995792388916, "learning_rate": 0.024000000208616257, "loss": 2.3271520137786865, "step": 12866 }, { "epoch": 0.6127619047619047, "grad_norm": 0.02581246942281723, "learning_rate": 0.024000000208616257, "loss": 2.356947422027588, "step": 12868 }, { "epoch": 0.6128571428571429, "grad_norm": 0.02567010186612606, "learning_rate": 0.024000000208616257, "loss": 2.3754336833953857, "step": 12870 }, { "epoch": 0.6129523809523809, "grad_norm": 0.02575204335153103, "learning_rate": 0.024000000208616257, "loss": 2.33455228805542, "step": 12872 }, { "epoch": 0.6130476190476191, "grad_norm": 0.026317493990063667, "learning_rate": 0.024000000208616257, "loss": 2.3378145694732666, "step": 12874 }, { "epoch": 0.6131428571428571, "grad_norm": 0.02593592368066311, "learning_rate": 0.024000000208616257, "loss": 2.3502063751220703, "step": 12876 }, { "epoch": 0.6132380952380952, "grad_norm": 0.02702093869447708, "learning_rate": 0.024000000208616257, "loss": 2.327630043029785, "step": 12878 }, { "epoch": 0.6133333333333333, "grad_norm": 0.027153972536325455, "learning_rate": 0.024000000208616257, "loss": 2.3436474800109863, "step": 12880 }, { "epoch": 0.6134285714285714, "grad_norm": 0.03182455897331238, "learning_rate": 0.024000000208616257, "loss": 2.345731019973755, "step": 12882 }, { "epoch": 0.6135238095238095, "grad_norm": 0.029870163649320602, "learning_rate": 0.024000000208616257, "loss": 2.3159117698669434, "step": 12884 }, { "epoch": 0.6136190476190476, "grad_norm": 0.027495993301272392, "learning_rate": 0.024000000208616257, "loss": 2.3662161827087402, "step": 12886 }, { "epoch": 0.6137142857142858, "grad_norm": 0.0274693351238966, "learning_rate": 0.024000000208616257, "loss": 2.352544069290161, "step": 12888 }, { "epoch": 0.6138095238095238, "grad_norm": 0.026357349008321762, "learning_rate": 0.024000000208616257, "loss": 2.339498996734619, "step": 12890 }, { "epoch": 0.613904761904762, "grad_norm": 0.028688982129096985, "learning_rate": 0.024000000208616257, "loss": 2.3622140884399414, "step": 12892 }, { "epoch": 0.614, "grad_norm": 0.027938995510339737, "learning_rate": 0.024000000208616257, "loss": 2.3730854988098145, "step": 12894 }, { "epoch": 0.6140952380952381, "grad_norm": 0.02657589316368103, "learning_rate": 0.024000000208616257, "loss": 2.358088970184326, "step": 12896 }, { "epoch": 0.6141904761904762, "grad_norm": 0.026451680809259415, "learning_rate": 0.024000000208616257, "loss": 2.342700958251953, "step": 12898 }, { "epoch": 0.6142857142857143, "grad_norm": 0.03307356685400009, "learning_rate": 0.024000000208616257, "loss": 2.3343896865844727, "step": 12900 }, { "epoch": 0.6143809523809524, "grad_norm": 0.029267994686961174, "learning_rate": 0.024000000208616257, "loss": 2.3502044677734375, "step": 12902 }, { "epoch": 0.6144761904761905, "grad_norm": 0.02632918581366539, "learning_rate": 0.024000000208616257, "loss": 2.3256356716156006, "step": 12904 }, { "epoch": 0.6145714285714285, "grad_norm": 0.028233729302883148, "learning_rate": 0.024000000208616257, "loss": 2.338864803314209, "step": 12906 }, { "epoch": 0.6146666666666667, "grad_norm": 0.027238944545388222, "learning_rate": 0.024000000208616257, "loss": 2.343843936920166, "step": 12908 }, { "epoch": 0.6147619047619047, "grad_norm": 0.02667461521923542, "learning_rate": 0.024000000208616257, "loss": 2.3595938682556152, "step": 12910 }, { "epoch": 0.6148571428571429, "grad_norm": 0.029039889574050903, "learning_rate": 0.024000000208616257, "loss": 2.3457095623016357, "step": 12912 }, { "epoch": 0.6149523809523809, "grad_norm": 0.025801828131079674, "learning_rate": 0.024000000208616257, "loss": 2.3462345600128174, "step": 12914 }, { "epoch": 0.6150476190476191, "grad_norm": 0.028681671246886253, "learning_rate": 0.024000000208616257, "loss": 2.3420000076293945, "step": 12916 }, { "epoch": 0.6151428571428571, "grad_norm": 0.026231132447719574, "learning_rate": 0.024000000208616257, "loss": 2.3186867237091064, "step": 12918 }, { "epoch": 0.6152380952380953, "grad_norm": 0.02707158774137497, "learning_rate": 0.024000000208616257, "loss": 2.3502004146575928, "step": 12920 }, { "epoch": 0.6153333333333333, "grad_norm": 0.02682129293680191, "learning_rate": 0.024000000208616257, "loss": 2.3260366916656494, "step": 12922 }, { "epoch": 0.6154285714285714, "grad_norm": 0.02738034352660179, "learning_rate": 0.024000000208616257, "loss": 2.3354430198669434, "step": 12924 }, { "epoch": 0.6155238095238095, "grad_norm": 0.02777954936027527, "learning_rate": 0.024000000208616257, "loss": 2.327681064605713, "step": 12926 }, { "epoch": 0.6156190476190476, "grad_norm": 0.02631993778049946, "learning_rate": 0.024000000208616257, "loss": 2.3564624786376953, "step": 12928 }, { "epoch": 0.6157142857142858, "grad_norm": 0.027443071827292442, "learning_rate": 0.024000000208616257, "loss": 2.33138108253479, "step": 12930 }, { "epoch": 0.6158095238095238, "grad_norm": 0.02753680758178234, "learning_rate": 0.024000000208616257, "loss": 2.3619441986083984, "step": 12932 }, { "epoch": 0.615904761904762, "grad_norm": 0.027325978502631187, "learning_rate": 0.024000000208616257, "loss": 2.341294288635254, "step": 12934 }, { "epoch": 0.616, "grad_norm": 0.027930129319429398, "learning_rate": 0.024000000208616257, "loss": 2.3529326915740967, "step": 12936 }, { "epoch": 0.6160952380952381, "grad_norm": 0.027044814079999924, "learning_rate": 0.024000000208616257, "loss": 2.338104486465454, "step": 12938 }, { "epoch": 0.6161904761904762, "grad_norm": 0.027509864419698715, "learning_rate": 0.024000000208616257, "loss": 2.3389954566955566, "step": 12940 }, { "epoch": 0.6162857142857143, "grad_norm": 0.02752762846648693, "learning_rate": 0.024000000208616257, "loss": 2.3171157836914062, "step": 12942 }, { "epoch": 0.6163809523809524, "grad_norm": 0.026168687269091606, "learning_rate": 0.024000000208616257, "loss": 2.327883243560791, "step": 12944 }, { "epoch": 0.6164761904761905, "grad_norm": 0.03076166659593582, "learning_rate": 0.024000000208616257, "loss": 2.3420166969299316, "step": 12946 }, { "epoch": 0.6165714285714285, "grad_norm": 0.028391912579536438, "learning_rate": 0.024000000208616257, "loss": 2.321561813354492, "step": 12948 }, { "epoch": 0.6166666666666667, "grad_norm": 0.028386501595377922, "learning_rate": 0.024000000208616257, "loss": 2.3515915870666504, "step": 12950 }, { "epoch": 0.6167619047619047, "grad_norm": 0.029425479471683502, "learning_rate": 0.024000000208616257, "loss": 2.3704466819763184, "step": 12952 }, { "epoch": 0.6168571428571429, "grad_norm": 0.027343671768903732, "learning_rate": 0.024000000208616257, "loss": 2.329987049102783, "step": 12954 }, { "epoch": 0.6169523809523809, "grad_norm": 0.028418753296136856, "learning_rate": 0.024000000208616257, "loss": 2.3359551429748535, "step": 12956 }, { "epoch": 0.6170476190476191, "grad_norm": 0.029960842803120613, "learning_rate": 0.024000000208616257, "loss": 2.340059757232666, "step": 12958 }, { "epoch": 0.6171428571428571, "grad_norm": 0.028976187109947205, "learning_rate": 0.024000000208616257, "loss": 2.3226122856140137, "step": 12960 }, { "epoch": 0.6172380952380953, "grad_norm": 0.02593802660703659, "learning_rate": 0.024000000208616257, "loss": 2.336517333984375, "step": 12962 }, { "epoch": 0.6173333333333333, "grad_norm": 0.026934603229165077, "learning_rate": 0.024000000208616257, "loss": 2.3462486267089844, "step": 12964 }, { "epoch": 0.6174285714285714, "grad_norm": 0.028260285034775734, "learning_rate": 0.024000000208616257, "loss": 2.3395333290100098, "step": 12966 }, { "epoch": 0.6175238095238095, "grad_norm": 0.02643335610628128, "learning_rate": 0.024000000208616257, "loss": 2.3279905319213867, "step": 12968 }, { "epoch": 0.6176190476190476, "grad_norm": 0.026872986927628517, "learning_rate": 0.024000000208616257, "loss": 2.347397804260254, "step": 12970 }, { "epoch": 0.6177142857142857, "grad_norm": 0.028338907286524773, "learning_rate": 0.024000000208616257, "loss": 2.3228728771209717, "step": 12972 }, { "epoch": 0.6178095238095238, "grad_norm": 0.030326539650559425, "learning_rate": 0.024000000208616257, "loss": 2.339743137359619, "step": 12974 }, { "epoch": 0.617904761904762, "grad_norm": 0.02755896933376789, "learning_rate": 0.024000000208616257, "loss": 2.335244655609131, "step": 12976 }, { "epoch": 0.618, "grad_norm": 0.026392323896288872, "learning_rate": 0.024000000208616257, "loss": 2.3412833213806152, "step": 12978 }, { "epoch": 0.6180952380952381, "grad_norm": 0.02864685282111168, "learning_rate": 0.024000000208616257, "loss": 2.2883570194244385, "step": 12980 }, { "epoch": 0.6181904761904762, "grad_norm": 0.027619389817118645, "learning_rate": 0.024000000208616257, "loss": 2.3382568359375, "step": 12982 }, { "epoch": 0.6182857142857143, "grad_norm": 0.02893819659948349, "learning_rate": 0.024000000208616257, "loss": 2.3461503982543945, "step": 12984 }, { "epoch": 0.6183809523809524, "grad_norm": 0.027293214574456215, "learning_rate": 0.024000000208616257, "loss": 2.3160572052001953, "step": 12986 }, { "epoch": 0.6184761904761905, "grad_norm": 0.031480368226766586, "learning_rate": 0.024000000208616257, "loss": 2.3249192237854004, "step": 12988 }, { "epoch": 0.6185714285714285, "grad_norm": 0.030077476054430008, "learning_rate": 0.024000000208616257, "loss": 2.3249287605285645, "step": 12990 }, { "epoch": 0.6186666666666667, "grad_norm": 0.028584914281964302, "learning_rate": 0.024000000208616257, "loss": 2.328068971633911, "step": 12992 }, { "epoch": 0.6187619047619047, "grad_norm": 0.028343742713332176, "learning_rate": 0.024000000208616257, "loss": 2.3296539783477783, "step": 12994 }, { "epoch": 0.6188571428571429, "grad_norm": 0.02689795382320881, "learning_rate": 0.024000000208616257, "loss": 2.332882881164551, "step": 12996 }, { "epoch": 0.6189523809523809, "grad_norm": 0.029558399692177773, "learning_rate": 0.024000000208616257, "loss": 2.322068214416504, "step": 12998 }, { "epoch": 0.6190476190476191, "grad_norm": 0.029502589255571365, "learning_rate": 0.024000000208616257, "loss": 2.3345022201538086, "step": 13000 }, { "epoch": 0.6191428571428571, "grad_norm": 0.02676752395927906, "learning_rate": 0.024000000208616257, "loss": 2.343841791152954, "step": 13002 }, { "epoch": 0.6192380952380953, "grad_norm": 0.026089809834957123, "learning_rate": 0.024000000208616257, "loss": 2.3298449516296387, "step": 13004 }, { "epoch": 0.6193333333333333, "grad_norm": 0.027594290673732758, "learning_rate": 0.024000000208616257, "loss": 2.321037769317627, "step": 13006 }, { "epoch": 0.6194285714285714, "grad_norm": 0.02901851199567318, "learning_rate": 0.024000000208616257, "loss": 2.3264694213867188, "step": 13008 }, { "epoch": 0.6195238095238095, "grad_norm": 0.028414925560355186, "learning_rate": 0.024000000208616257, "loss": 2.3257908821105957, "step": 13010 }, { "epoch": 0.6196190476190476, "grad_norm": 0.02687002532184124, "learning_rate": 0.024000000208616257, "loss": 2.3583552837371826, "step": 13012 }, { "epoch": 0.6197142857142857, "grad_norm": 0.025698501616716385, "learning_rate": 0.024000000208616257, "loss": 2.316253185272217, "step": 13014 }, { "epoch": 0.6198095238095238, "grad_norm": 0.02658708021044731, "learning_rate": 0.024000000208616257, "loss": 2.3366281986236572, "step": 13016 }, { "epoch": 0.619904761904762, "grad_norm": 0.026459945365786552, "learning_rate": 0.024000000208616257, "loss": 2.335707664489746, "step": 13018 }, { "epoch": 0.62, "grad_norm": 0.026817796751856804, "learning_rate": 0.024000000208616257, "loss": 2.3143582344055176, "step": 13020 }, { "epoch": 0.6200952380952381, "grad_norm": 0.028772952035069466, "learning_rate": 0.024000000208616257, "loss": 2.3484435081481934, "step": 13022 }, { "epoch": 0.6201904761904762, "grad_norm": 0.025387994945049286, "learning_rate": 0.024000000208616257, "loss": 2.332064151763916, "step": 13024 }, { "epoch": 0.6202857142857143, "grad_norm": 0.02666841819882393, "learning_rate": 0.024000000208616257, "loss": 2.332973003387451, "step": 13026 }, { "epoch": 0.6203809523809524, "grad_norm": 0.02625969797372818, "learning_rate": 0.024000000208616257, "loss": 2.352984666824341, "step": 13028 }, { "epoch": 0.6204761904761905, "grad_norm": 0.0278334841132164, "learning_rate": 0.024000000208616257, "loss": 2.3423306941986084, "step": 13030 }, { "epoch": 0.6205714285714286, "grad_norm": 0.025667568668723106, "learning_rate": 0.024000000208616257, "loss": 2.3425769805908203, "step": 13032 }, { "epoch": 0.6206666666666667, "grad_norm": 0.026157086715102196, "learning_rate": 0.024000000208616257, "loss": 2.356435775756836, "step": 13034 }, { "epoch": 0.6207619047619047, "grad_norm": 0.025584029033780098, "learning_rate": 0.024000000208616257, "loss": 2.359267234802246, "step": 13036 }, { "epoch": 0.6208571428571429, "grad_norm": 0.025980733335018158, "learning_rate": 0.024000000208616257, "loss": 2.339167594909668, "step": 13038 }, { "epoch": 0.6209523809523809, "grad_norm": 0.028092119842767715, "learning_rate": 0.024000000208616257, "loss": 2.358917713165283, "step": 13040 }, { "epoch": 0.6210476190476191, "grad_norm": 0.026068884879350662, "learning_rate": 0.024000000208616257, "loss": 2.334533929824829, "step": 13042 }, { "epoch": 0.6211428571428571, "grad_norm": 0.03022782877087593, "learning_rate": 0.024000000208616257, "loss": 2.316830635070801, "step": 13044 }, { "epoch": 0.6212380952380953, "grad_norm": 0.03148612752556801, "learning_rate": 0.024000000208616257, "loss": 2.34352970123291, "step": 13046 }, { "epoch": 0.6213333333333333, "grad_norm": 0.029063230380415916, "learning_rate": 0.024000000208616257, "loss": 2.3271143436431885, "step": 13048 }, { "epoch": 0.6214285714285714, "grad_norm": 0.02932097762823105, "learning_rate": 0.024000000208616257, "loss": 2.3287220001220703, "step": 13050 }, { "epoch": 0.6215238095238095, "grad_norm": 0.035525739192962646, "learning_rate": 0.024000000208616257, "loss": 2.337205410003662, "step": 13052 }, { "epoch": 0.6216190476190476, "grad_norm": 0.03037656471133232, "learning_rate": 0.024000000208616257, "loss": 2.3388869762420654, "step": 13054 }, { "epoch": 0.6217142857142857, "grad_norm": 0.02571563981473446, "learning_rate": 0.024000000208616257, "loss": 2.332021713256836, "step": 13056 }, { "epoch": 0.6218095238095238, "grad_norm": 0.0259187500923872, "learning_rate": 0.024000000208616257, "loss": 2.35286808013916, "step": 13058 }, { "epoch": 0.621904761904762, "grad_norm": 0.0266632828861475, "learning_rate": 0.024000000208616257, "loss": 2.331009864807129, "step": 13060 }, { "epoch": 0.622, "grad_norm": 0.025708045810461044, "learning_rate": 0.024000000208616257, "loss": 2.3289949893951416, "step": 13062 }, { "epoch": 0.6220952380952381, "grad_norm": 0.032117582857608795, "learning_rate": 0.024000000208616257, "loss": 2.3491506576538086, "step": 13064 }, { "epoch": 0.6221904761904762, "grad_norm": 0.029229093343019485, "learning_rate": 0.024000000208616257, "loss": 2.3463845252990723, "step": 13066 }, { "epoch": 0.6222857142857143, "grad_norm": 0.02686072327196598, "learning_rate": 0.024000000208616257, "loss": 2.350132465362549, "step": 13068 }, { "epoch": 0.6223809523809524, "grad_norm": 0.025928467512130737, "learning_rate": 0.024000000208616257, "loss": 2.3200888633728027, "step": 13070 }, { "epoch": 0.6224761904761905, "grad_norm": 0.026826830580830574, "learning_rate": 0.024000000208616257, "loss": 2.3480591773986816, "step": 13072 }, { "epoch": 0.6225714285714286, "grad_norm": 0.026716923341155052, "learning_rate": 0.024000000208616257, "loss": 2.3303568363189697, "step": 13074 }, { "epoch": 0.6226666666666667, "grad_norm": 0.025580182671546936, "learning_rate": 0.024000000208616257, "loss": 2.338381052017212, "step": 13076 }, { "epoch": 0.6227619047619047, "grad_norm": 0.026279643177986145, "learning_rate": 0.024000000208616257, "loss": 2.352631092071533, "step": 13078 }, { "epoch": 0.6228571428571429, "grad_norm": 0.02724381536245346, "learning_rate": 0.024000000208616257, "loss": 2.327852725982666, "step": 13080 }, { "epoch": 0.6229523809523809, "grad_norm": 0.029293382540345192, "learning_rate": 0.024000000208616257, "loss": 2.339473247528076, "step": 13082 }, { "epoch": 0.6230476190476191, "grad_norm": 0.03008410520851612, "learning_rate": 0.024000000208616257, "loss": 2.333244800567627, "step": 13084 }, { "epoch": 0.6231428571428571, "grad_norm": 0.026008648797869682, "learning_rate": 0.024000000208616257, "loss": 2.333367347717285, "step": 13086 }, { "epoch": 0.6232380952380953, "grad_norm": 0.03380769491195679, "learning_rate": 0.024000000208616257, "loss": 2.338939666748047, "step": 13088 }, { "epoch": 0.6233333333333333, "grad_norm": 0.02699250727891922, "learning_rate": 0.024000000208616257, "loss": 2.348830223083496, "step": 13090 }, { "epoch": 0.6234285714285714, "grad_norm": 0.02783210389316082, "learning_rate": 0.024000000208616257, "loss": 2.3402791023254395, "step": 13092 }, { "epoch": 0.6235238095238095, "grad_norm": 0.030070703476667404, "learning_rate": 0.024000000208616257, "loss": 2.329465627670288, "step": 13094 }, { "epoch": 0.6236190476190476, "grad_norm": 0.026239557191729546, "learning_rate": 0.024000000208616257, "loss": 2.315317153930664, "step": 13096 }, { "epoch": 0.6237142857142857, "grad_norm": 0.028721507638692856, "learning_rate": 0.024000000208616257, "loss": 2.331007957458496, "step": 13098 }, { "epoch": 0.6238095238095238, "grad_norm": 0.02645009569823742, "learning_rate": 0.024000000208616257, "loss": 2.3539180755615234, "step": 13100 }, { "epoch": 0.6239047619047619, "grad_norm": 0.02669631876051426, "learning_rate": 0.024000000208616257, "loss": 2.3314852714538574, "step": 13102 }, { "epoch": 0.624, "grad_norm": 0.02788078598678112, "learning_rate": 0.024000000208616257, "loss": 2.356544017791748, "step": 13104 }, { "epoch": 0.6240952380952381, "grad_norm": 0.037861257791519165, "learning_rate": 0.024000000208616257, "loss": 2.3444509506225586, "step": 13106 }, { "epoch": 0.6241904761904762, "grad_norm": 0.035712823271751404, "learning_rate": 0.024000000208616257, "loss": 2.342768430709839, "step": 13108 }, { "epoch": 0.6242857142857143, "grad_norm": 0.030714932829141617, "learning_rate": 0.024000000208616257, "loss": 2.3588836193084717, "step": 13110 }, { "epoch": 0.6243809523809524, "grad_norm": 0.034284692257642746, "learning_rate": 0.024000000208616257, "loss": 2.3360719680786133, "step": 13112 }, { "epoch": 0.6244761904761905, "grad_norm": 0.03196863830089569, "learning_rate": 0.024000000208616257, "loss": 2.315387725830078, "step": 13114 }, { "epoch": 0.6245714285714286, "grad_norm": 0.028304772451519966, "learning_rate": 0.024000000208616257, "loss": 2.363865852355957, "step": 13116 }, { "epoch": 0.6246666666666667, "grad_norm": 0.027470067143440247, "learning_rate": 0.024000000208616257, "loss": 2.356545925140381, "step": 13118 }, { "epoch": 0.6247619047619047, "grad_norm": 0.02636815793812275, "learning_rate": 0.024000000208616257, "loss": 2.3395042419433594, "step": 13120 }, { "epoch": 0.6248571428571429, "grad_norm": 0.027767973020672798, "learning_rate": 0.024000000208616257, "loss": 2.3665003776550293, "step": 13122 }, { "epoch": 0.6249523809523809, "grad_norm": 0.02655799314379692, "learning_rate": 0.024000000208616257, "loss": 2.3184139728546143, "step": 13124 }, { "epoch": 0.6250476190476191, "grad_norm": 0.027806339785456657, "learning_rate": 0.024000000208616257, "loss": 2.334259510040283, "step": 13126 }, { "epoch": 0.6251428571428571, "grad_norm": 0.02665984444320202, "learning_rate": 0.024000000208616257, "loss": 2.3350791931152344, "step": 13128 }, { "epoch": 0.6252380952380953, "grad_norm": 0.02760929800570011, "learning_rate": 0.024000000208616257, "loss": 2.3429179191589355, "step": 13130 }, { "epoch": 0.6253333333333333, "grad_norm": 0.028537962585687637, "learning_rate": 0.024000000208616257, "loss": 2.360612154006958, "step": 13132 }, { "epoch": 0.6254285714285714, "grad_norm": 0.02720610424876213, "learning_rate": 0.024000000208616257, "loss": 2.351634979248047, "step": 13134 }, { "epoch": 0.6255238095238095, "grad_norm": 0.026047730818390846, "learning_rate": 0.024000000208616257, "loss": 2.3387956619262695, "step": 13136 }, { "epoch": 0.6256190476190476, "grad_norm": 0.026753317564725876, "learning_rate": 0.024000000208616257, "loss": 2.380791187286377, "step": 13138 }, { "epoch": 0.6257142857142857, "grad_norm": 0.024852033704519272, "learning_rate": 0.024000000208616257, "loss": 2.338405132293701, "step": 13140 }, { "epoch": 0.6258095238095238, "grad_norm": 0.026996789500117302, "learning_rate": 0.024000000208616257, "loss": 2.3497891426086426, "step": 13142 }, { "epoch": 0.6259047619047619, "grad_norm": 0.02828226238489151, "learning_rate": 0.024000000208616257, "loss": 2.3131654262542725, "step": 13144 }, { "epoch": 0.626, "grad_norm": 0.02893942780792713, "learning_rate": 0.024000000208616257, "loss": 2.3805785179138184, "step": 13146 }, { "epoch": 0.6260952380952381, "grad_norm": 0.02911841683089733, "learning_rate": 0.024000000208616257, "loss": 2.3523168563842773, "step": 13148 }, { "epoch": 0.6261904761904762, "grad_norm": 0.028202375397086143, "learning_rate": 0.024000000208616257, "loss": 2.3342268466949463, "step": 13150 }, { "epoch": 0.6262857142857143, "grad_norm": 0.026485834270715714, "learning_rate": 0.024000000208616257, "loss": 2.2990517616271973, "step": 13152 }, { "epoch": 0.6263809523809524, "grad_norm": 0.02674563229084015, "learning_rate": 0.024000000208616257, "loss": 2.3403029441833496, "step": 13154 }, { "epoch": 0.6264761904761905, "grad_norm": 0.02641868405044079, "learning_rate": 0.024000000208616257, "loss": 2.3498191833496094, "step": 13156 }, { "epoch": 0.6265714285714286, "grad_norm": 0.026802299544215202, "learning_rate": 0.024000000208616257, "loss": 2.378974199295044, "step": 13158 }, { "epoch": 0.6266666666666667, "grad_norm": 0.02651944011449814, "learning_rate": 0.024000000208616257, "loss": 2.327601194381714, "step": 13160 }, { "epoch": 0.6267619047619047, "grad_norm": 0.030392687767744064, "learning_rate": 0.024000000208616257, "loss": 2.364305019378662, "step": 13162 }, { "epoch": 0.6268571428571429, "grad_norm": 0.02908659353852272, "learning_rate": 0.024000000208616257, "loss": 2.3539438247680664, "step": 13164 }, { "epoch": 0.6269523809523809, "grad_norm": 0.026239581406116486, "learning_rate": 0.024000000208616257, "loss": 2.3392739295959473, "step": 13166 }, { "epoch": 0.6270476190476191, "grad_norm": 0.027286497876048088, "learning_rate": 0.024000000208616257, "loss": 2.330151081085205, "step": 13168 }, { "epoch": 0.6271428571428571, "grad_norm": 0.027225591242313385, "learning_rate": 0.024000000208616257, "loss": 2.320347309112549, "step": 13170 }, { "epoch": 0.6272380952380953, "grad_norm": 0.025642985478043556, "learning_rate": 0.024000000208616257, "loss": 2.3600943088531494, "step": 13172 }, { "epoch": 0.6273333333333333, "grad_norm": 0.02858736738562584, "learning_rate": 0.024000000208616257, "loss": 2.345975399017334, "step": 13174 }, { "epoch": 0.6274285714285714, "grad_norm": 0.028882339596748352, "learning_rate": 0.024000000208616257, "loss": 2.353102445602417, "step": 13176 }, { "epoch": 0.6275238095238095, "grad_norm": 0.025990113615989685, "learning_rate": 0.024000000208616257, "loss": 2.3358817100524902, "step": 13178 }, { "epoch": 0.6276190476190476, "grad_norm": 0.026721809059381485, "learning_rate": 0.024000000208616257, "loss": 2.377204179763794, "step": 13180 }, { "epoch": 0.6277142857142857, "grad_norm": 0.027051951736211777, "learning_rate": 0.024000000208616257, "loss": 2.327648639678955, "step": 13182 }, { "epoch": 0.6278095238095238, "grad_norm": 0.026102595031261444, "learning_rate": 0.024000000208616257, "loss": 2.341144561767578, "step": 13184 }, { "epoch": 0.6279047619047619, "grad_norm": 0.026641016826033592, "learning_rate": 0.024000000208616257, "loss": 2.358377695083618, "step": 13186 }, { "epoch": 0.628, "grad_norm": 0.025288091972470284, "learning_rate": 0.024000000208616257, "loss": 2.3778769969940186, "step": 13188 }, { "epoch": 0.628095238095238, "grad_norm": 0.0259805116802454, "learning_rate": 0.024000000208616257, "loss": 2.386075019836426, "step": 13190 }, { "epoch": 0.6281904761904762, "grad_norm": 0.025714056566357613, "learning_rate": 0.024000000208616257, "loss": 2.339433193206787, "step": 13192 }, { "epoch": 0.6282857142857143, "grad_norm": 0.029378948733210564, "learning_rate": 0.024000000208616257, "loss": 2.3087551593780518, "step": 13194 }, { "epoch": 0.6283809523809524, "grad_norm": 0.030280983075499535, "learning_rate": 0.024000000208616257, "loss": 2.346682548522949, "step": 13196 }, { "epoch": 0.6284761904761905, "grad_norm": 0.029611829668283463, "learning_rate": 0.024000000208616257, "loss": 2.356922149658203, "step": 13198 }, { "epoch": 0.6285714285714286, "grad_norm": 0.026922471821308136, "learning_rate": 0.024000000208616257, "loss": 2.334521770477295, "step": 13200 }, { "epoch": 0.6286666666666667, "grad_norm": 0.029671600088477135, "learning_rate": 0.024000000208616257, "loss": 2.3604564666748047, "step": 13202 }, { "epoch": 0.6287619047619047, "grad_norm": 0.02674475684762001, "learning_rate": 0.024000000208616257, "loss": 2.337036609649658, "step": 13204 }, { "epoch": 0.6288571428571429, "grad_norm": 0.02634275332093239, "learning_rate": 0.024000000208616257, "loss": 2.362955093383789, "step": 13206 }, { "epoch": 0.6289523809523809, "grad_norm": 0.02904757671058178, "learning_rate": 0.024000000208616257, "loss": 2.361659526824951, "step": 13208 }, { "epoch": 0.6290476190476191, "grad_norm": 0.02698448859155178, "learning_rate": 0.024000000208616257, "loss": 2.329564332962036, "step": 13210 }, { "epoch": 0.6291428571428571, "grad_norm": 0.02842383086681366, "learning_rate": 0.024000000208616257, "loss": 2.3728950023651123, "step": 13212 }, { "epoch": 0.6292380952380953, "grad_norm": 0.028083156794309616, "learning_rate": 0.024000000208616257, "loss": 2.362534999847412, "step": 13214 }, { "epoch": 0.6293333333333333, "grad_norm": 0.028806017711758614, "learning_rate": 0.024000000208616257, "loss": 2.377142906188965, "step": 13216 }, { "epoch": 0.6294285714285714, "grad_norm": 0.027504319325089455, "learning_rate": 0.024000000208616257, "loss": 2.336264133453369, "step": 13218 }, { "epoch": 0.6295238095238095, "grad_norm": 0.02823621965944767, "learning_rate": 0.024000000208616257, "loss": 2.3703553676605225, "step": 13220 }, { "epoch": 0.6296190476190476, "grad_norm": 0.026188526302576065, "learning_rate": 0.024000000208616257, "loss": 2.324436902999878, "step": 13222 }, { "epoch": 0.6297142857142857, "grad_norm": 0.026743769645690918, "learning_rate": 0.024000000208616257, "loss": 2.344163417816162, "step": 13224 }, { "epoch": 0.6298095238095238, "grad_norm": 0.03134665638208389, "learning_rate": 0.024000000208616257, "loss": 2.3394763469696045, "step": 13226 }, { "epoch": 0.6299047619047619, "grad_norm": 0.026568833738565445, "learning_rate": 0.024000000208616257, "loss": 2.3826632499694824, "step": 13228 }, { "epoch": 0.63, "grad_norm": 0.026243049651384354, "learning_rate": 0.024000000208616257, "loss": 2.363494873046875, "step": 13230 }, { "epoch": 0.630095238095238, "grad_norm": 0.02748039737343788, "learning_rate": 0.024000000208616257, "loss": 2.381735324859619, "step": 13232 }, { "epoch": 0.6301904761904762, "grad_norm": 0.027415545657277107, "learning_rate": 0.024000000208616257, "loss": 2.3437297344207764, "step": 13234 }, { "epoch": 0.6302857142857143, "grad_norm": 0.02696905843913555, "learning_rate": 0.024000000208616257, "loss": 2.337087631225586, "step": 13236 }, { "epoch": 0.6303809523809524, "grad_norm": 0.02704877406358719, "learning_rate": 0.024000000208616257, "loss": 2.355355739593506, "step": 13238 }, { "epoch": 0.6304761904761905, "grad_norm": 0.029824119061231613, "learning_rate": 0.024000000208616257, "loss": 2.387906789779663, "step": 13240 }, { "epoch": 0.6305714285714286, "grad_norm": 0.026504531502723694, "learning_rate": 0.024000000208616257, "loss": 2.34358549118042, "step": 13242 }, { "epoch": 0.6306666666666667, "grad_norm": 0.026592615991830826, "learning_rate": 0.024000000208616257, "loss": 2.3630404472351074, "step": 13244 }, { "epoch": 0.6307619047619047, "grad_norm": 0.02601058967411518, "learning_rate": 0.024000000208616257, "loss": 2.352123260498047, "step": 13246 }, { "epoch": 0.6308571428571429, "grad_norm": 0.026258371770381927, "learning_rate": 0.024000000208616257, "loss": 2.3554012775421143, "step": 13248 }, { "epoch": 0.6309523809523809, "grad_norm": 0.026384511962532997, "learning_rate": 0.024000000208616257, "loss": 2.359368324279785, "step": 13250 }, { "epoch": 0.6310476190476191, "grad_norm": 0.028911087661981583, "learning_rate": 0.024000000208616257, "loss": 2.346548557281494, "step": 13252 }, { "epoch": 0.6311428571428571, "grad_norm": 0.028489289805293083, "learning_rate": 0.024000000208616257, "loss": 2.3210935592651367, "step": 13254 }, { "epoch": 0.6312380952380953, "grad_norm": 0.025476671755313873, "learning_rate": 0.024000000208616257, "loss": 2.3518218994140625, "step": 13256 }, { "epoch": 0.6313333333333333, "grad_norm": 0.026509301736950874, "learning_rate": 0.024000000208616257, "loss": 2.355173110961914, "step": 13258 }, { "epoch": 0.6314285714285715, "grad_norm": 0.027192240580916405, "learning_rate": 0.024000000208616257, "loss": 2.3471429347991943, "step": 13260 }, { "epoch": 0.6315238095238095, "grad_norm": 0.026260249316692352, "learning_rate": 0.024000000208616257, "loss": 2.3483166694641113, "step": 13262 }, { "epoch": 0.6316190476190476, "grad_norm": 0.025542164221405983, "learning_rate": 0.024000000208616257, "loss": 2.339723587036133, "step": 13264 }, { "epoch": 0.6317142857142857, "grad_norm": 0.028208520263433456, "learning_rate": 0.024000000208616257, "loss": 2.3419342041015625, "step": 13266 }, { "epoch": 0.6318095238095238, "grad_norm": 0.025465495884418488, "learning_rate": 0.024000000208616257, "loss": 2.3200159072875977, "step": 13268 }, { "epoch": 0.6319047619047619, "grad_norm": 0.0272639412432909, "learning_rate": 0.024000000208616257, "loss": 2.3477983474731445, "step": 13270 }, { "epoch": 0.632, "grad_norm": 0.025976436212658882, "learning_rate": 0.024000000208616257, "loss": 2.367870807647705, "step": 13272 }, { "epoch": 0.632095238095238, "grad_norm": 0.025922346860170364, "learning_rate": 0.024000000208616257, "loss": 2.342684745788574, "step": 13274 }, { "epoch": 0.6321904761904762, "grad_norm": 0.027227265760302544, "learning_rate": 0.024000000208616257, "loss": 2.3414273262023926, "step": 13276 }, { "epoch": 0.6322857142857143, "grad_norm": 0.025883983820676804, "learning_rate": 0.024000000208616257, "loss": 2.3567628860473633, "step": 13278 }, { "epoch": 0.6323809523809524, "grad_norm": 0.028140870854258537, "learning_rate": 0.024000000208616257, "loss": 2.3445000648498535, "step": 13280 }, { "epoch": 0.6324761904761905, "grad_norm": 0.02623731642961502, "learning_rate": 0.024000000208616257, "loss": 2.3552660942077637, "step": 13282 }, { "epoch": 0.6325714285714286, "grad_norm": 0.030410587787628174, "learning_rate": 0.024000000208616257, "loss": 2.329660415649414, "step": 13284 }, { "epoch": 0.6326666666666667, "grad_norm": 0.03061055578291416, "learning_rate": 0.024000000208616257, "loss": 2.341439723968506, "step": 13286 }, { "epoch": 0.6327619047619047, "grad_norm": 0.030651211738586426, "learning_rate": 0.024000000208616257, "loss": 2.3438053131103516, "step": 13288 }, { "epoch": 0.6328571428571429, "grad_norm": 0.02685139887034893, "learning_rate": 0.024000000208616257, "loss": 2.358914375305176, "step": 13290 }, { "epoch": 0.6329523809523809, "grad_norm": 0.0263872928917408, "learning_rate": 0.024000000208616257, "loss": 2.3717737197875977, "step": 13292 }, { "epoch": 0.6330476190476191, "grad_norm": 0.025930313393473625, "learning_rate": 0.024000000208616257, "loss": 2.335601806640625, "step": 13294 }, { "epoch": 0.6331428571428571, "grad_norm": 0.027121420949697495, "learning_rate": 0.024000000208616257, "loss": 2.3589723110198975, "step": 13296 }, { "epoch": 0.6332380952380953, "grad_norm": 0.02665618620812893, "learning_rate": 0.024000000208616257, "loss": 2.347410202026367, "step": 13298 }, { "epoch": 0.6333333333333333, "grad_norm": 0.025451792404055595, "learning_rate": 0.024000000208616257, "loss": 2.359424591064453, "step": 13300 }, { "epoch": 0.6334285714285715, "grad_norm": 0.026443740352988243, "learning_rate": 0.024000000208616257, "loss": 2.356213092803955, "step": 13302 }, { "epoch": 0.6335238095238095, "grad_norm": 0.026632634922862053, "learning_rate": 0.024000000208616257, "loss": 2.3701553344726562, "step": 13304 }, { "epoch": 0.6336190476190476, "grad_norm": 0.02673833817243576, "learning_rate": 0.024000000208616257, "loss": 2.3869645595550537, "step": 13306 }, { "epoch": 0.6337142857142857, "grad_norm": 0.03788665682077408, "learning_rate": 0.024000000208616257, "loss": 2.4009952545166016, "step": 13308 }, { "epoch": 0.6338095238095238, "grad_norm": 0.030052626505494118, "learning_rate": 0.024000000208616257, "loss": 2.334084987640381, "step": 13310 }, { "epoch": 0.6339047619047619, "grad_norm": 0.026046741753816605, "learning_rate": 0.024000000208616257, "loss": 2.369744300842285, "step": 13312 }, { "epoch": 0.634, "grad_norm": 0.02956492081284523, "learning_rate": 0.024000000208616257, "loss": 2.378357410430908, "step": 13314 }, { "epoch": 0.634095238095238, "grad_norm": 0.027855949476361275, "learning_rate": 0.024000000208616257, "loss": 2.364626407623291, "step": 13316 }, { "epoch": 0.6341904761904762, "grad_norm": 0.02710629627108574, "learning_rate": 0.024000000208616257, "loss": 2.3548429012298584, "step": 13318 }, { "epoch": 0.6342857142857142, "grad_norm": 0.027043404057621956, "learning_rate": 0.024000000208616257, "loss": 2.349822521209717, "step": 13320 }, { "epoch": 0.6343809523809524, "grad_norm": 0.025615669786930084, "learning_rate": 0.024000000208616257, "loss": 2.3526692390441895, "step": 13322 }, { "epoch": 0.6344761904761905, "grad_norm": 0.028077464550733566, "learning_rate": 0.024000000208616257, "loss": 2.3619375228881836, "step": 13324 }, { "epoch": 0.6345714285714286, "grad_norm": 0.02633608691394329, "learning_rate": 0.024000000208616257, "loss": 2.370145797729492, "step": 13326 }, { "epoch": 0.6346666666666667, "grad_norm": 0.025928296148777008, "learning_rate": 0.024000000208616257, "loss": 2.359598159790039, "step": 13328 }, { "epoch": 0.6347619047619047, "grad_norm": 0.02708764560520649, "learning_rate": 0.024000000208616257, "loss": 2.346619129180908, "step": 13330 }, { "epoch": 0.6348571428571429, "grad_norm": 0.026872066780924797, "learning_rate": 0.024000000208616257, "loss": 2.350736141204834, "step": 13332 }, { "epoch": 0.6349523809523809, "grad_norm": 0.026255780830979347, "learning_rate": 0.024000000208616257, "loss": 2.384624481201172, "step": 13334 }, { "epoch": 0.6350476190476191, "grad_norm": 0.02785901166498661, "learning_rate": 0.024000000208616257, "loss": 2.349447250366211, "step": 13336 }, { "epoch": 0.6351428571428571, "grad_norm": 0.027130229398608208, "learning_rate": 0.024000000208616257, "loss": 2.3695218563079834, "step": 13338 }, { "epoch": 0.6352380952380953, "grad_norm": 0.02628413215279579, "learning_rate": 0.024000000208616257, "loss": 2.33630108833313, "step": 13340 }, { "epoch": 0.6353333333333333, "grad_norm": 0.025782324373722076, "learning_rate": 0.024000000208616257, "loss": 2.378018856048584, "step": 13342 }, { "epoch": 0.6354285714285715, "grad_norm": 0.025963829830288887, "learning_rate": 0.024000000208616257, "loss": 2.3736064434051514, "step": 13344 }, { "epoch": 0.6355238095238095, "grad_norm": 0.0285969115793705, "learning_rate": 0.024000000208616257, "loss": 2.342434883117676, "step": 13346 }, { "epoch": 0.6356190476190476, "grad_norm": 0.026242051273584366, "learning_rate": 0.024000000208616257, "loss": 2.3645787239074707, "step": 13348 }, { "epoch": 0.6357142857142857, "grad_norm": 0.027478227391839027, "learning_rate": 0.024000000208616257, "loss": 2.362149953842163, "step": 13350 }, { "epoch": 0.6358095238095238, "grad_norm": 0.031268928200006485, "learning_rate": 0.024000000208616257, "loss": 2.335200786590576, "step": 13352 }, { "epoch": 0.6359047619047619, "grad_norm": 0.03064817376434803, "learning_rate": 0.024000000208616257, "loss": 2.3485798835754395, "step": 13354 }, { "epoch": 0.636, "grad_norm": 0.02815805934369564, "learning_rate": 0.024000000208616257, "loss": 2.360966205596924, "step": 13356 }, { "epoch": 0.636095238095238, "grad_norm": 0.028651239350438118, "learning_rate": 0.024000000208616257, "loss": 2.3647475242614746, "step": 13358 }, { "epoch": 0.6361904761904762, "grad_norm": 0.026668919250369072, "learning_rate": 0.024000000208616257, "loss": 2.3391761779785156, "step": 13360 }, { "epoch": 0.6362857142857142, "grad_norm": 0.027184240520000458, "learning_rate": 0.024000000208616257, "loss": 2.3704850673675537, "step": 13362 }, { "epoch": 0.6363809523809524, "grad_norm": 0.0273677259683609, "learning_rate": 0.024000000208616257, "loss": 2.3900303840637207, "step": 13364 }, { "epoch": 0.6364761904761905, "grad_norm": 0.026003697887063026, "learning_rate": 0.024000000208616257, "loss": 2.3781824111938477, "step": 13366 }, { "epoch": 0.6365714285714286, "grad_norm": 0.027938317507505417, "learning_rate": 0.024000000208616257, "loss": 2.364985942840576, "step": 13368 }, { "epoch": 0.6366666666666667, "grad_norm": 0.029808413237333298, "learning_rate": 0.024000000208616257, "loss": 2.373887062072754, "step": 13370 }, { "epoch": 0.6367619047619048, "grad_norm": 0.02625058963894844, "learning_rate": 0.024000000208616257, "loss": 2.3421859741210938, "step": 13372 }, { "epoch": 0.6368571428571429, "grad_norm": 0.028442129492759705, "learning_rate": 0.024000000208616257, "loss": 2.3470258712768555, "step": 13374 }, { "epoch": 0.6369523809523809, "grad_norm": 0.02755608595907688, "learning_rate": 0.024000000208616257, "loss": 2.351083755493164, "step": 13376 }, { "epoch": 0.6370476190476191, "grad_norm": 0.02796061523258686, "learning_rate": 0.024000000208616257, "loss": 2.3440046310424805, "step": 13378 }, { "epoch": 0.6371428571428571, "grad_norm": 0.025532400235533714, "learning_rate": 0.024000000208616257, "loss": 2.3781094551086426, "step": 13380 }, { "epoch": 0.6372380952380953, "grad_norm": 0.02709917724132538, "learning_rate": 0.024000000208616257, "loss": 2.3472657203674316, "step": 13382 }, { "epoch": 0.6373333333333333, "grad_norm": 0.026633059605956078, "learning_rate": 0.024000000208616257, "loss": 2.3412094116210938, "step": 13384 }, { "epoch": 0.6374285714285715, "grad_norm": 0.025416644290089607, "learning_rate": 0.024000000208616257, "loss": 2.364945888519287, "step": 13386 }, { "epoch": 0.6375238095238095, "grad_norm": 0.026156600564718246, "learning_rate": 0.024000000208616257, "loss": 2.322901725769043, "step": 13388 }, { "epoch": 0.6376190476190476, "grad_norm": 0.02949116937816143, "learning_rate": 0.024000000208616257, "loss": 2.344179630279541, "step": 13390 }, { "epoch": 0.6377142857142857, "grad_norm": 0.025809064507484436, "learning_rate": 0.024000000208616257, "loss": 2.3716988563537598, "step": 13392 }, { "epoch": 0.6378095238095238, "grad_norm": 0.02943212352693081, "learning_rate": 0.024000000208616257, "loss": 2.350942611694336, "step": 13394 }, { "epoch": 0.6379047619047619, "grad_norm": 0.029288411140441895, "learning_rate": 0.024000000208616257, "loss": 2.361762762069702, "step": 13396 }, { "epoch": 0.638, "grad_norm": 0.029567524790763855, "learning_rate": 0.024000000208616257, "loss": 2.3429641723632812, "step": 13398 }, { "epoch": 0.638095238095238, "grad_norm": 0.030667142942547798, "learning_rate": 0.024000000208616257, "loss": 2.349834442138672, "step": 13400 }, { "epoch": 0.6381904761904762, "grad_norm": 0.0313316285610199, "learning_rate": 0.024000000208616257, "loss": 2.344661235809326, "step": 13402 }, { "epoch": 0.6382857142857142, "grad_norm": 0.028920214623212814, "learning_rate": 0.024000000208616257, "loss": 2.3443844318389893, "step": 13404 }, { "epoch": 0.6383809523809524, "grad_norm": 0.026546861976385117, "learning_rate": 0.024000000208616257, "loss": 2.357767105102539, "step": 13406 }, { "epoch": 0.6384761904761905, "grad_norm": 0.026093361899256706, "learning_rate": 0.024000000208616257, "loss": 2.3573570251464844, "step": 13408 }, { "epoch": 0.6385714285714286, "grad_norm": 0.026127343997359276, "learning_rate": 0.024000000208616257, "loss": 2.3456592559814453, "step": 13410 }, { "epoch": 0.6386666666666667, "grad_norm": 0.027702340856194496, "learning_rate": 0.024000000208616257, "loss": 2.340653896331787, "step": 13412 }, { "epoch": 0.6387619047619048, "grad_norm": 0.026113569736480713, "learning_rate": 0.024000000208616257, "loss": 2.362290859222412, "step": 13414 }, { "epoch": 0.6388571428571429, "grad_norm": 0.02649441920220852, "learning_rate": 0.024000000208616257, "loss": 2.3419318199157715, "step": 13416 }, { "epoch": 0.6389523809523809, "grad_norm": 0.02544908970594406, "learning_rate": 0.024000000208616257, "loss": 2.3418614864349365, "step": 13418 }, { "epoch": 0.6390476190476191, "grad_norm": 0.026866288855671883, "learning_rate": 0.024000000208616257, "loss": 2.3468430042266846, "step": 13420 }, { "epoch": 0.6391428571428571, "grad_norm": 0.02673957869410515, "learning_rate": 0.024000000208616257, "loss": 2.3507485389709473, "step": 13422 }, { "epoch": 0.6392380952380953, "grad_norm": 0.02822943776845932, "learning_rate": 0.024000000208616257, "loss": 2.341169595718384, "step": 13424 }, { "epoch": 0.6393333333333333, "grad_norm": 0.030246516689658165, "learning_rate": 0.024000000208616257, "loss": 2.373891830444336, "step": 13426 }, { "epoch": 0.6394285714285715, "grad_norm": 0.02634945511817932, "learning_rate": 0.024000000208616257, "loss": 2.3422586917877197, "step": 13428 }, { "epoch": 0.6395238095238095, "grad_norm": 0.02584069035947323, "learning_rate": 0.024000000208616257, "loss": 2.3326973915100098, "step": 13430 }, { "epoch": 0.6396190476190476, "grad_norm": 0.02609315700829029, "learning_rate": 0.024000000208616257, "loss": 2.3399550914764404, "step": 13432 }, { "epoch": 0.6397142857142857, "grad_norm": 0.03060661070048809, "learning_rate": 0.024000000208616257, "loss": 2.3443753719329834, "step": 13434 }, { "epoch": 0.6398095238095238, "grad_norm": 0.026984723284840584, "learning_rate": 0.024000000208616257, "loss": 2.3504090309143066, "step": 13436 }, { "epoch": 0.6399047619047619, "grad_norm": 0.027948126196861267, "learning_rate": 0.024000000208616257, "loss": 2.361325263977051, "step": 13438 }, { "epoch": 0.64, "grad_norm": 0.028229210525751114, "learning_rate": 0.024000000208616257, "loss": 2.3538365364074707, "step": 13440 }, { "epoch": 0.640095238095238, "grad_norm": 0.027273451909422874, "learning_rate": 0.024000000208616257, "loss": 2.3583545684814453, "step": 13442 }, { "epoch": 0.6401904761904762, "grad_norm": 0.02593955025076866, "learning_rate": 0.024000000208616257, "loss": 2.3626389503479004, "step": 13444 }, { "epoch": 0.6402857142857142, "grad_norm": 0.026327582076191902, "learning_rate": 0.024000000208616257, "loss": 2.3540072441101074, "step": 13446 }, { "epoch": 0.6403809523809524, "grad_norm": 0.02532309666275978, "learning_rate": 0.024000000208616257, "loss": 2.294778823852539, "step": 13448 }, { "epoch": 0.6404761904761904, "grad_norm": 0.027379902079701424, "learning_rate": 0.024000000208616257, "loss": 2.337921142578125, "step": 13450 }, { "epoch": 0.6405714285714286, "grad_norm": 0.026512375101447105, "learning_rate": 0.024000000208616257, "loss": 2.3442158699035645, "step": 13452 }, { "epoch": 0.6406666666666667, "grad_norm": 0.027219144627451897, "learning_rate": 0.024000000208616257, "loss": 2.361191511154175, "step": 13454 }, { "epoch": 0.6407619047619048, "grad_norm": 0.03070605918765068, "learning_rate": 0.024000000208616257, "loss": 2.356577157974243, "step": 13456 }, { "epoch": 0.6408571428571429, "grad_norm": 0.026211144402623177, "learning_rate": 0.024000000208616257, "loss": 2.3652634620666504, "step": 13458 }, { "epoch": 0.6409523809523809, "grad_norm": 0.026318160817027092, "learning_rate": 0.024000000208616257, "loss": 2.3347320556640625, "step": 13460 }, { "epoch": 0.6410476190476191, "grad_norm": 0.029368551447987556, "learning_rate": 0.024000000208616257, "loss": 2.33782958984375, "step": 13462 }, { "epoch": 0.6411428571428571, "grad_norm": 0.02714524045586586, "learning_rate": 0.024000000208616257, "loss": 2.374044895172119, "step": 13464 }, { "epoch": 0.6412380952380953, "grad_norm": 0.029514824971556664, "learning_rate": 0.024000000208616257, "loss": 2.3542747497558594, "step": 13466 }, { "epoch": 0.6413333333333333, "grad_norm": 0.02812490612268448, "learning_rate": 0.024000000208616257, "loss": 2.3201067447662354, "step": 13468 }, { "epoch": 0.6414285714285715, "grad_norm": 0.0282831359654665, "learning_rate": 0.024000000208616257, "loss": 2.3296937942504883, "step": 13470 }, { "epoch": 0.6415238095238095, "grad_norm": 0.025226183235645294, "learning_rate": 0.024000000208616257, "loss": 2.3231940269470215, "step": 13472 }, { "epoch": 0.6416190476190476, "grad_norm": 0.029036259278655052, "learning_rate": 0.024000000208616257, "loss": 2.3450355529785156, "step": 13474 }, { "epoch": 0.6417142857142857, "grad_norm": 0.034304842352867126, "learning_rate": 0.024000000208616257, "loss": 2.314995288848877, "step": 13476 }, { "epoch": 0.6418095238095238, "grad_norm": 0.029277322813868523, "learning_rate": 0.024000000208616257, "loss": 2.337064266204834, "step": 13478 }, { "epoch": 0.6419047619047619, "grad_norm": 0.026804303750395775, "learning_rate": 0.024000000208616257, "loss": 2.317368984222412, "step": 13480 }, { "epoch": 0.642, "grad_norm": 0.025479692965745926, "learning_rate": 0.024000000208616257, "loss": 2.334815263748169, "step": 13482 }, { "epoch": 0.642095238095238, "grad_norm": 0.02695845067501068, "learning_rate": 0.024000000208616257, "loss": 2.374192953109741, "step": 13484 }, { "epoch": 0.6421904761904762, "grad_norm": 0.026551399379968643, "learning_rate": 0.024000000208616257, "loss": 2.3487930297851562, "step": 13486 }, { "epoch": 0.6422857142857142, "grad_norm": 0.029500022530555725, "learning_rate": 0.024000000208616257, "loss": 2.34096097946167, "step": 13488 }, { "epoch": 0.6423809523809524, "grad_norm": 0.02590310387313366, "learning_rate": 0.024000000208616257, "loss": 2.3620681762695312, "step": 13490 }, { "epoch": 0.6424761904761904, "grad_norm": 0.02607930824160576, "learning_rate": 0.024000000208616257, "loss": 2.352266550064087, "step": 13492 }, { "epoch": 0.6425714285714286, "grad_norm": 0.02628353051841259, "learning_rate": 0.024000000208616257, "loss": 2.3379669189453125, "step": 13494 }, { "epoch": 0.6426666666666667, "grad_norm": 0.026915421709418297, "learning_rate": 0.024000000208616257, "loss": 2.3292932510375977, "step": 13496 }, { "epoch": 0.6427619047619048, "grad_norm": 0.0271263737231493, "learning_rate": 0.024000000208616257, "loss": 2.3576302528381348, "step": 13498 }, { "epoch": 0.6428571428571429, "grad_norm": 0.02760525606572628, "learning_rate": 0.024000000208616257, "loss": 2.324751138687134, "step": 13500 }, { "epoch": 0.6429523809523809, "grad_norm": 0.028812410309910774, "learning_rate": 0.024000000208616257, "loss": 2.338317394256592, "step": 13502 }, { "epoch": 0.6430476190476191, "grad_norm": 0.025050228461623192, "learning_rate": 0.024000000208616257, "loss": 2.3290839195251465, "step": 13504 }, { "epoch": 0.6431428571428571, "grad_norm": 0.02801586128771305, "learning_rate": 0.024000000208616257, "loss": 2.3457841873168945, "step": 13506 }, { "epoch": 0.6432380952380953, "grad_norm": 0.028329478576779366, "learning_rate": 0.024000000208616257, "loss": 2.343151569366455, "step": 13508 }, { "epoch": 0.6433333333333333, "grad_norm": 0.025719739496707916, "learning_rate": 0.024000000208616257, "loss": 2.318356513977051, "step": 13510 }, { "epoch": 0.6434285714285715, "grad_norm": 0.02609795145690441, "learning_rate": 0.024000000208616257, "loss": 2.347700595855713, "step": 13512 }, { "epoch": 0.6435238095238095, "grad_norm": 0.02814757078886032, "learning_rate": 0.024000000208616257, "loss": 2.3403241634368896, "step": 13514 }, { "epoch": 0.6436190476190476, "grad_norm": 0.03170827403664589, "learning_rate": 0.024000000208616257, "loss": 2.3517096042633057, "step": 13516 }, { "epoch": 0.6437142857142857, "grad_norm": 0.026911243796348572, "learning_rate": 0.024000000208616257, "loss": 2.3059511184692383, "step": 13518 }, { "epoch": 0.6438095238095238, "grad_norm": 0.027298759669065475, "learning_rate": 0.024000000208616257, "loss": 2.3269400596618652, "step": 13520 }, { "epoch": 0.6439047619047619, "grad_norm": 0.02817448414862156, "learning_rate": 0.024000000208616257, "loss": 2.3506531715393066, "step": 13522 }, { "epoch": 0.644, "grad_norm": 0.026602545753121376, "learning_rate": 0.024000000208616257, "loss": 2.3162617683410645, "step": 13524 }, { "epoch": 0.644095238095238, "grad_norm": 0.02853209525346756, "learning_rate": 0.024000000208616257, "loss": 2.323153495788574, "step": 13526 }, { "epoch": 0.6441904761904762, "grad_norm": 0.026273304596543312, "learning_rate": 0.024000000208616257, "loss": 2.318014144897461, "step": 13528 }, { "epoch": 0.6442857142857142, "grad_norm": 0.026607876643538475, "learning_rate": 0.024000000208616257, "loss": 2.3304667472839355, "step": 13530 }, { "epoch": 0.6443809523809524, "grad_norm": 0.02666633017361164, "learning_rate": 0.024000000208616257, "loss": 2.2963356971740723, "step": 13532 }, { "epoch": 0.6444761904761904, "grad_norm": 0.02665065973997116, "learning_rate": 0.024000000208616257, "loss": 2.3375773429870605, "step": 13534 }, { "epoch": 0.6445714285714286, "grad_norm": 0.027033573016524315, "learning_rate": 0.024000000208616257, "loss": 2.325451374053955, "step": 13536 }, { "epoch": 0.6446666666666667, "grad_norm": 0.02775120548903942, "learning_rate": 0.024000000208616257, "loss": 2.3124332427978516, "step": 13538 }, { "epoch": 0.6447619047619048, "grad_norm": 0.027195533737540245, "learning_rate": 0.024000000208616257, "loss": 2.305020332336426, "step": 13540 }, { "epoch": 0.6448571428571429, "grad_norm": 0.025890275835990906, "learning_rate": 0.024000000208616257, "loss": 2.294261932373047, "step": 13542 }, { "epoch": 0.6449523809523809, "grad_norm": 0.02639383263885975, "learning_rate": 0.024000000208616257, "loss": 2.3237717151641846, "step": 13544 }, { "epoch": 0.6450476190476191, "grad_norm": 0.02628541924059391, "learning_rate": 0.024000000208616257, "loss": 2.3062546253204346, "step": 13546 }, { "epoch": 0.6451428571428571, "grad_norm": 0.026940226554870605, "learning_rate": 0.024000000208616257, "loss": 2.3182711601257324, "step": 13548 }, { "epoch": 0.6452380952380953, "grad_norm": 0.026794403791427612, "learning_rate": 0.024000000208616257, "loss": 2.320904493331909, "step": 13550 }, { "epoch": 0.6453333333333333, "grad_norm": 0.026257717981934547, "learning_rate": 0.024000000208616257, "loss": 2.3016655445098877, "step": 13552 }, { "epoch": 0.6454285714285715, "grad_norm": 0.024893393740057945, "learning_rate": 0.024000000208616257, "loss": 2.3275036811828613, "step": 13554 }, { "epoch": 0.6455238095238095, "grad_norm": 0.025481870397925377, "learning_rate": 0.024000000208616257, "loss": 2.306682825088501, "step": 13556 }, { "epoch": 0.6456190476190476, "grad_norm": 0.027414260432124138, "learning_rate": 0.024000000208616257, "loss": 2.3180091381073, "step": 13558 }, { "epoch": 0.6457142857142857, "grad_norm": 0.026401903480291367, "learning_rate": 0.024000000208616257, "loss": 2.3245818614959717, "step": 13560 }, { "epoch": 0.6458095238095238, "grad_norm": 0.026877716183662415, "learning_rate": 0.024000000208616257, "loss": 2.308922290802002, "step": 13562 }, { "epoch": 0.6459047619047619, "grad_norm": 0.0316447988152504, "learning_rate": 0.024000000208616257, "loss": 2.338894844055176, "step": 13564 }, { "epoch": 0.646, "grad_norm": 0.026317153126001358, "learning_rate": 0.024000000208616257, "loss": 2.290193557739258, "step": 13566 }, { "epoch": 0.6460952380952381, "grad_norm": 0.02751738391816616, "learning_rate": 0.024000000208616257, "loss": 2.289158344268799, "step": 13568 }, { "epoch": 0.6461904761904762, "grad_norm": 0.02563072368502617, "learning_rate": 0.024000000208616257, "loss": 2.3262548446655273, "step": 13570 }, { "epoch": 0.6462857142857142, "grad_norm": 0.027524426579475403, "learning_rate": 0.024000000208616257, "loss": 2.3006439208984375, "step": 13572 }, { "epoch": 0.6463809523809524, "grad_norm": 0.026085296645760536, "learning_rate": 0.024000000208616257, "loss": 2.292401075363159, "step": 13574 }, { "epoch": 0.6464761904761904, "grad_norm": 0.026025349274277687, "learning_rate": 0.024000000208616257, "loss": 2.3217215538024902, "step": 13576 }, { "epoch": 0.6465714285714286, "grad_norm": 0.029154418036341667, "learning_rate": 0.024000000208616257, "loss": 2.3141207695007324, "step": 13578 }, { "epoch": 0.6466666666666666, "grad_norm": 0.025658855214715004, "learning_rate": 0.024000000208616257, "loss": 2.2983479499816895, "step": 13580 }, { "epoch": 0.6467619047619048, "grad_norm": 0.026108691468834877, "learning_rate": 0.024000000208616257, "loss": 2.3144431114196777, "step": 13582 }, { "epoch": 0.6468571428571429, "grad_norm": 0.02599550224840641, "learning_rate": 0.024000000208616257, "loss": 2.3187623023986816, "step": 13584 }, { "epoch": 0.646952380952381, "grad_norm": 0.027795135974884033, "learning_rate": 0.024000000208616257, "loss": 2.3133327960968018, "step": 13586 }, { "epoch": 0.6470476190476191, "grad_norm": 0.025512276217341423, "learning_rate": 0.024000000208616257, "loss": 2.2997019290924072, "step": 13588 }, { "epoch": 0.6471428571428571, "grad_norm": 0.026510432362556458, "learning_rate": 0.024000000208616257, "loss": 2.309075355529785, "step": 13590 }, { "epoch": 0.6472380952380953, "grad_norm": 0.027374643832445145, "learning_rate": 0.024000000208616257, "loss": 2.3312361240386963, "step": 13592 }, { "epoch": 0.6473333333333333, "grad_norm": 0.02588241547346115, "learning_rate": 0.024000000208616257, "loss": 2.325127601623535, "step": 13594 }, { "epoch": 0.6474285714285715, "grad_norm": 0.02937900461256504, "learning_rate": 0.024000000208616257, "loss": 2.3067102432250977, "step": 13596 }, { "epoch": 0.6475238095238095, "grad_norm": 0.025219764560461044, "learning_rate": 0.024000000208616257, "loss": 2.2971386909484863, "step": 13598 }, { "epoch": 0.6476190476190476, "grad_norm": 0.027537552639842033, "learning_rate": 0.024000000208616257, "loss": 2.296412944793701, "step": 13600 }, { "epoch": 0.6477142857142857, "grad_norm": 0.024867098778486252, "learning_rate": 0.024000000208616257, "loss": 2.2801241874694824, "step": 13602 }, { "epoch": 0.6478095238095238, "grad_norm": 0.026617957279086113, "learning_rate": 0.024000000208616257, "loss": 2.3053860664367676, "step": 13604 }, { "epoch": 0.6479047619047619, "grad_norm": 0.027912747114896774, "learning_rate": 0.024000000208616257, "loss": 2.303957462310791, "step": 13606 }, { "epoch": 0.648, "grad_norm": 0.027019700035452843, "learning_rate": 0.024000000208616257, "loss": 2.3119401931762695, "step": 13608 }, { "epoch": 0.6480952380952381, "grad_norm": 0.02808774635195732, "learning_rate": 0.024000000208616257, "loss": 2.297861337661743, "step": 13610 }, { "epoch": 0.6481904761904762, "grad_norm": 0.027523482218384743, "learning_rate": 0.024000000208616257, "loss": 2.306699752807617, "step": 13612 }, { "epoch": 0.6482857142857142, "grad_norm": 0.02666379138827324, "learning_rate": 0.024000000208616257, "loss": 2.3144783973693848, "step": 13614 }, { "epoch": 0.6483809523809524, "grad_norm": 0.028475837782025337, "learning_rate": 0.024000000208616257, "loss": 2.338423728942871, "step": 13616 }, { "epoch": 0.6484761904761904, "grad_norm": 0.02678670361638069, "learning_rate": 0.024000000208616257, "loss": 2.311300277709961, "step": 13618 }, { "epoch": 0.6485714285714286, "grad_norm": 0.026288671419024467, "learning_rate": 0.024000000208616257, "loss": 2.3192718029022217, "step": 13620 }, { "epoch": 0.6486666666666666, "grad_norm": 0.02971000224351883, "learning_rate": 0.024000000208616257, "loss": 2.3064544200897217, "step": 13622 }, { "epoch": 0.6487619047619048, "grad_norm": 0.025677843019366264, "learning_rate": 0.024000000208616257, "loss": 2.2795891761779785, "step": 13624 }, { "epoch": 0.6488571428571429, "grad_norm": 0.026978302747011185, "learning_rate": 0.024000000208616257, "loss": 2.2849206924438477, "step": 13626 }, { "epoch": 0.648952380952381, "grad_norm": 0.02899707667529583, "learning_rate": 0.024000000208616257, "loss": 2.3065378665924072, "step": 13628 }, { "epoch": 0.6490476190476191, "grad_norm": 0.028749318793416023, "learning_rate": 0.024000000208616257, "loss": 2.273000717163086, "step": 13630 }, { "epoch": 0.6491428571428571, "grad_norm": 0.025052813813090324, "learning_rate": 0.024000000208616257, "loss": 2.3056344985961914, "step": 13632 }, { "epoch": 0.6492380952380953, "grad_norm": 0.025409992784261703, "learning_rate": 0.024000000208616257, "loss": 2.288482666015625, "step": 13634 }, { "epoch": 0.6493333333333333, "grad_norm": 0.02774510346353054, "learning_rate": 0.024000000208616257, "loss": 2.2919836044311523, "step": 13636 }, { "epoch": 0.6494285714285715, "grad_norm": 0.02521400712430477, "learning_rate": 0.024000000208616257, "loss": 2.316405773162842, "step": 13638 }, { "epoch": 0.6495238095238095, "grad_norm": 0.026741644367575645, "learning_rate": 0.024000000208616257, "loss": 2.3041515350341797, "step": 13640 }, { "epoch": 0.6496190476190477, "grad_norm": 0.028532298281788826, "learning_rate": 0.024000000208616257, "loss": 2.284761905670166, "step": 13642 }, { "epoch": 0.6497142857142857, "grad_norm": 0.027164820581674576, "learning_rate": 0.024000000208616257, "loss": 2.2970075607299805, "step": 13644 }, { "epoch": 0.6498095238095238, "grad_norm": 0.026672644540667534, "learning_rate": 0.024000000208616257, "loss": 2.2881150245666504, "step": 13646 }, { "epoch": 0.6499047619047619, "grad_norm": 0.0257740318775177, "learning_rate": 0.024000000208616257, "loss": 2.291083335876465, "step": 13648 }, { "epoch": 0.65, "grad_norm": 0.02946845069527626, "learning_rate": 0.024000000208616257, "loss": 2.294919729232788, "step": 13650 }, { "epoch": 0.6500952380952381, "grad_norm": 0.026394642889499664, "learning_rate": 0.024000000208616257, "loss": 2.3244986534118652, "step": 13652 }, { "epoch": 0.6501904761904762, "grad_norm": 0.025780141353607178, "learning_rate": 0.024000000208616257, "loss": 2.287121295928955, "step": 13654 }, { "epoch": 0.6502857142857142, "grad_norm": 0.027314767241477966, "learning_rate": 0.024000000208616257, "loss": 2.2802481651306152, "step": 13656 }, { "epoch": 0.6503809523809524, "grad_norm": 0.025982758030295372, "learning_rate": 0.024000000208616257, "loss": 2.2783379554748535, "step": 13658 }, { "epoch": 0.6504761904761904, "grad_norm": 0.02667940780520439, "learning_rate": 0.024000000208616257, "loss": 2.261268138885498, "step": 13660 }, { "epoch": 0.6505714285714286, "grad_norm": 0.024642927572131157, "learning_rate": 0.024000000208616257, "loss": 2.2585573196411133, "step": 13662 }, { "epoch": 0.6506666666666666, "grad_norm": 0.025405896827578545, "learning_rate": 0.024000000208616257, "loss": 2.2820467948913574, "step": 13664 }, { "epoch": 0.6507619047619048, "grad_norm": 0.025449328124523163, "learning_rate": 0.024000000208616257, "loss": 2.2773146629333496, "step": 13666 }, { "epoch": 0.6508571428571429, "grad_norm": 0.02605075016617775, "learning_rate": 0.024000000208616257, "loss": 2.264862298965454, "step": 13668 }, { "epoch": 0.650952380952381, "grad_norm": 0.026817327365279198, "learning_rate": 0.024000000208616257, "loss": 2.2799289226531982, "step": 13670 }, { "epoch": 0.6510476190476191, "grad_norm": 0.02777864597737789, "learning_rate": 0.024000000208616257, "loss": 2.320451259613037, "step": 13672 }, { "epoch": 0.6511428571428571, "grad_norm": 0.02644948847591877, "learning_rate": 0.024000000208616257, "loss": 2.290205478668213, "step": 13674 }, { "epoch": 0.6512380952380953, "grad_norm": 0.03851320967078209, "learning_rate": 0.024000000208616257, "loss": 2.2959935665130615, "step": 13676 }, { "epoch": 0.6513333333333333, "grad_norm": 0.02520034648478031, "learning_rate": 0.024000000208616257, "loss": 2.254105806350708, "step": 13678 }, { "epoch": 0.6514285714285715, "grad_norm": 0.026675336062908173, "learning_rate": 0.024000000208616257, "loss": 2.2972466945648193, "step": 13680 }, { "epoch": 0.6515238095238095, "grad_norm": 0.028625493869185448, "learning_rate": 0.024000000208616257, "loss": 2.260528564453125, "step": 13682 }, { "epoch": 0.6516190476190477, "grad_norm": 0.02568153291940689, "learning_rate": 0.024000000208616257, "loss": 2.317507028579712, "step": 13684 }, { "epoch": 0.6517142857142857, "grad_norm": 0.027308402583003044, "learning_rate": 0.024000000208616257, "loss": 2.275400161743164, "step": 13686 }, { "epoch": 0.6518095238095238, "grad_norm": 0.027054190635681152, "learning_rate": 0.024000000208616257, "loss": 2.3034467697143555, "step": 13688 }, { "epoch": 0.6519047619047619, "grad_norm": 0.027860185131430626, "learning_rate": 0.024000000208616257, "loss": 2.272728443145752, "step": 13690 }, { "epoch": 0.652, "grad_norm": 0.02802259474992752, "learning_rate": 0.024000000208616257, "loss": 2.2894906997680664, "step": 13692 }, { "epoch": 0.6520952380952381, "grad_norm": 0.03167901560664177, "learning_rate": 0.024000000208616257, "loss": 2.2855098247528076, "step": 13694 }, { "epoch": 0.6521904761904762, "grad_norm": 0.03477407991886139, "learning_rate": 0.024000000208616257, "loss": 2.2695364952087402, "step": 13696 }, { "epoch": 0.6522857142857142, "grad_norm": 0.036535199731588364, "learning_rate": 0.024000000208616257, "loss": 2.2631731033325195, "step": 13698 }, { "epoch": 0.6523809523809524, "grad_norm": 0.02802099660038948, "learning_rate": 0.024000000208616257, "loss": 2.2992212772369385, "step": 13700 }, { "epoch": 0.6524761904761904, "grad_norm": 0.025464460253715515, "learning_rate": 0.023996712639927864, "loss": 2.2743160724639893, "step": 13702 }, { "epoch": 0.6525714285714286, "grad_norm": 0.029032522812485695, "learning_rate": 0.02399013750255108, "loss": 2.273268699645996, "step": 13704 }, { "epoch": 0.6526666666666666, "grad_norm": 0.03167120739817619, "learning_rate": 0.023983562365174294, "loss": 2.2575554847717285, "step": 13706 }, { "epoch": 0.6527619047619048, "grad_norm": 0.031633295118808746, "learning_rate": 0.02397698536515236, "loss": 2.2865285873413086, "step": 13708 }, { "epoch": 0.6528571428571428, "grad_norm": 0.02951199561357498, "learning_rate": 0.023970412090420723, "loss": 2.2780022621154785, "step": 13710 }, { "epoch": 0.652952380952381, "grad_norm": 0.03529676795005798, "learning_rate": 0.02396383509039879, "loss": 2.297579765319824, "step": 13712 }, { "epoch": 0.6530476190476191, "grad_norm": 0.02825985476374626, "learning_rate": 0.023957259953022003, "loss": 2.278563976287842, "step": 13714 }, { "epoch": 0.6531428571428571, "grad_norm": 0.02907525561749935, "learning_rate": 0.023950684815645218, "loss": 2.282470226287842, "step": 13716 }, { "epoch": 0.6532380952380953, "grad_norm": 0.025341622531414032, "learning_rate": 0.023944109678268433, "loss": 2.262660503387451, "step": 13718 }, { "epoch": 0.6533333333333333, "grad_norm": 0.02596926875412464, "learning_rate": 0.023937534540891647, "loss": 2.271766424179077, "step": 13720 }, { "epoch": 0.6534285714285715, "grad_norm": 0.025581128895282745, "learning_rate": 0.023930959403514862, "loss": 2.25933837890625, "step": 13722 }, { "epoch": 0.6535238095238095, "grad_norm": 0.025097142904996872, "learning_rate": 0.023924384266138077, "loss": 2.2724099159240723, "step": 13724 }, { "epoch": 0.6536190476190477, "grad_norm": 0.025472167879343033, "learning_rate": 0.02391780912876129, "loss": 2.25978946685791, "step": 13726 }, { "epoch": 0.6537142857142857, "grad_norm": 0.02455117739737034, "learning_rate": 0.023911232128739357, "loss": 2.272874593734741, "step": 13728 }, { "epoch": 0.6538095238095238, "grad_norm": 0.025745170190930367, "learning_rate": 0.02390465885400772, "loss": 2.2757601737976074, "step": 13730 }, { "epoch": 0.6539047619047619, "grad_norm": 0.02689075469970703, "learning_rate": 0.023898081853985786, "loss": 2.24599027633667, "step": 13732 }, { "epoch": 0.654, "grad_norm": 0.02673168294131756, "learning_rate": 0.023891506716609, "loss": 2.265944004058838, "step": 13734 }, { "epoch": 0.6540952380952381, "grad_norm": 0.026524445042014122, "learning_rate": 0.023884931579232216, "loss": 2.2774243354797363, "step": 13736 }, { "epoch": 0.6541904761904762, "grad_norm": 0.026278622448444366, "learning_rate": 0.02387835644185543, "loss": 2.2740225791931152, "step": 13738 }, { "epoch": 0.6542857142857142, "grad_norm": 0.028179526329040527, "learning_rate": 0.023871781304478645, "loss": 2.2826642990112305, "step": 13740 }, { "epoch": 0.6543809523809524, "grad_norm": 0.025404857471585274, "learning_rate": 0.02386520616710186, "loss": 2.264451503753662, "step": 13742 }, { "epoch": 0.6544761904761904, "grad_norm": 0.026741335168480873, "learning_rate": 0.023858629167079926, "loss": 2.2815985679626465, "step": 13744 }, { "epoch": 0.6545714285714286, "grad_norm": 0.02515765279531479, "learning_rate": 0.02385205589234829, "loss": 2.2695491313934326, "step": 13746 }, { "epoch": 0.6546666666666666, "grad_norm": 0.028794948011636734, "learning_rate": 0.023845478892326355, "loss": 2.279245138168335, "step": 13748 }, { "epoch": 0.6547619047619048, "grad_norm": 0.02579338103532791, "learning_rate": 0.02383890375494957, "loss": 2.275679111480713, "step": 13750 }, { "epoch": 0.6548571428571428, "grad_norm": 0.025264017283916473, "learning_rate": 0.023832328617572784, "loss": 2.282233715057373, "step": 13752 }, { "epoch": 0.654952380952381, "grad_norm": 0.0294125284999609, "learning_rate": 0.023825753480196, "loss": 2.2902016639709473, "step": 13754 }, { "epoch": 0.6550476190476191, "grad_norm": 0.02658984437584877, "learning_rate": 0.023819178342819214, "loss": 2.2973248958587646, "step": 13756 }, { "epoch": 0.6551428571428571, "grad_norm": 0.026273882016539574, "learning_rate": 0.02381260320544243, "loss": 2.263117790222168, "step": 13758 }, { "epoch": 0.6552380952380953, "grad_norm": 0.025658229365944862, "learning_rate": 0.023806028068065643, "loss": 2.289444923400879, "step": 13760 }, { "epoch": 0.6553333333333333, "grad_norm": 0.025446997955441475, "learning_rate": 0.023799452930688858, "loss": 2.2885921001434326, "step": 13762 }, { "epoch": 0.6554285714285715, "grad_norm": 0.0275895893573761, "learning_rate": 0.023792875930666924, "loss": 2.272137403488159, "step": 13764 }, { "epoch": 0.6555238095238095, "grad_norm": 0.025913503021001816, "learning_rate": 0.023786302655935287, "loss": 2.252169132232666, "step": 13766 }, { "epoch": 0.6556190476190477, "grad_norm": 0.025615138933062553, "learning_rate": 0.023779725655913353, "loss": 2.249197006225586, "step": 13768 }, { "epoch": 0.6557142857142857, "grad_norm": 0.025481076911091805, "learning_rate": 0.023773150518536568, "loss": 2.242800235748291, "step": 13770 }, { "epoch": 0.6558095238095238, "grad_norm": 0.025282835587859154, "learning_rate": 0.023766575381159782, "loss": 2.2566332817077637, "step": 13772 }, { "epoch": 0.6559047619047619, "grad_norm": 0.025035029277205467, "learning_rate": 0.023760000243782997, "loss": 2.2835726737976074, "step": 13774 }, { "epoch": 0.656, "grad_norm": 0.02674194611608982, "learning_rate": 0.023753425106406212, "loss": 2.3074159622192383, "step": 13776 }, { "epoch": 0.6560952380952381, "grad_norm": 0.025807714089751244, "learning_rate": 0.023746849969029427, "loss": 2.2798876762390137, "step": 13778 }, { "epoch": 0.6561904761904762, "grad_norm": 0.02826703153550625, "learning_rate": 0.023740272969007492, "loss": 2.2789645195007324, "step": 13780 }, { "epoch": 0.6562857142857143, "grad_norm": 0.02717076800763607, "learning_rate": 0.023733699694275856, "loss": 2.274322986602783, "step": 13782 }, { "epoch": 0.6563809523809524, "grad_norm": 0.026506824418902397, "learning_rate": 0.02372712269425392, "loss": 2.259265899658203, "step": 13784 }, { "epoch": 0.6564761904761904, "grad_norm": 0.02817082218825817, "learning_rate": 0.023720547556877136, "loss": 2.2781312465667725, "step": 13786 }, { "epoch": 0.6565714285714286, "grad_norm": 0.026248909533023834, "learning_rate": 0.02371397241950035, "loss": 2.266162872314453, "step": 13788 }, { "epoch": 0.6566666666666666, "grad_norm": 0.028315601870417595, "learning_rate": 0.023707397282123566, "loss": 2.253896951675415, "step": 13790 }, { "epoch": 0.6567619047619048, "grad_norm": 0.026410378515720367, "learning_rate": 0.02370082214474678, "loss": 2.262472152709961, "step": 13792 }, { "epoch": 0.6568571428571428, "grad_norm": 0.02549849823117256, "learning_rate": 0.023694247007369995, "loss": 2.282336950302124, "step": 13794 }, { "epoch": 0.656952380952381, "grad_norm": 0.027858318760991096, "learning_rate": 0.02368767000734806, "loss": 2.256436824798584, "step": 13796 }, { "epoch": 0.6570476190476191, "grad_norm": 0.027909385040402412, "learning_rate": 0.023681096732616425, "loss": 2.286224603652954, "step": 13798 }, { "epoch": 0.6571428571428571, "grad_norm": 0.026916051283478737, "learning_rate": 0.02367451973259449, "loss": 2.288536548614502, "step": 13800 }, { "epoch": 0.6572380952380953, "grad_norm": 0.026226071640849113, "learning_rate": 0.023667946457862854, "loss": 2.2680749893188477, "step": 13802 }, { "epoch": 0.6573333333333333, "grad_norm": 0.027574289590120316, "learning_rate": 0.02366136945784092, "loss": 2.2563838958740234, "step": 13804 }, { "epoch": 0.6574285714285715, "grad_norm": 0.025426939129829407, "learning_rate": 0.023654794320464134, "loss": 2.2864694595336914, "step": 13806 }, { "epoch": 0.6575238095238095, "grad_norm": 0.026789775118231773, "learning_rate": 0.02364821918308735, "loss": 2.2766809463500977, "step": 13808 }, { "epoch": 0.6576190476190477, "grad_norm": 0.026164475828409195, "learning_rate": 0.023641644045710564, "loss": 2.2579832077026367, "step": 13810 }, { "epoch": 0.6577142857142857, "grad_norm": 0.026191774755716324, "learning_rate": 0.02363506890833378, "loss": 2.291581630706787, "step": 13812 }, { "epoch": 0.6578095238095238, "grad_norm": 0.026591012254357338, "learning_rate": 0.023628493770956993, "loss": 2.295480251312256, "step": 13814 }, { "epoch": 0.6579047619047619, "grad_norm": 0.02902892418205738, "learning_rate": 0.02362191677093506, "loss": 2.281113862991333, "step": 13816 }, { "epoch": 0.658, "grad_norm": 0.027053149417042732, "learning_rate": 0.023615343496203423, "loss": 2.2671358585357666, "step": 13818 }, { "epoch": 0.6580952380952381, "grad_norm": 0.025861363857984543, "learning_rate": 0.023608766496181488, "loss": 2.2370991706848145, "step": 13820 }, { "epoch": 0.6581904761904762, "grad_norm": 0.027038410305976868, "learning_rate": 0.023602191358804703, "loss": 2.2523317337036133, "step": 13822 }, { "epoch": 0.6582857142857143, "grad_norm": 0.027807842940092087, "learning_rate": 0.023595616221427917, "loss": 2.258059024810791, "step": 13824 }, { "epoch": 0.6583809523809524, "grad_norm": 0.025792643427848816, "learning_rate": 0.023589041084051132, "loss": 2.2955801486968994, "step": 13826 }, { "epoch": 0.6584761904761904, "grad_norm": 0.025646237656474113, "learning_rate": 0.023582465946674347, "loss": 2.2790369987487793, "step": 13828 }, { "epoch": 0.6585714285714286, "grad_norm": 0.026164585724473, "learning_rate": 0.02357589080929756, "loss": 2.2415771484375, "step": 13830 }, { "epoch": 0.6586666666666666, "grad_norm": 0.02517259120941162, "learning_rate": 0.023569313809275627, "loss": 2.2256357669830322, "step": 13832 }, { "epoch": 0.6587619047619048, "grad_norm": 0.02560044825077057, "learning_rate": 0.02356274053454399, "loss": 2.265007972717285, "step": 13834 }, { "epoch": 0.6588571428571428, "grad_norm": 0.02905873768031597, "learning_rate": 0.023556163534522057, "loss": 2.2762935161590576, "step": 13836 }, { "epoch": 0.658952380952381, "grad_norm": 0.027165967971086502, "learning_rate": 0.02354959025979042, "loss": 2.2719109058380127, "step": 13838 }, { "epoch": 0.659047619047619, "grad_norm": 0.029325848445296288, "learning_rate": 0.023543013259768486, "loss": 2.281890392303467, "step": 13840 }, { "epoch": 0.6591428571428571, "grad_norm": 0.026467427611351013, "learning_rate": 0.0235364381223917, "loss": 2.293773651123047, "step": 13842 }, { "epoch": 0.6592380952380953, "grad_norm": 0.02617761678993702, "learning_rate": 0.023529862985014915, "loss": 2.2562777996063232, "step": 13844 }, { "epoch": 0.6593333333333333, "grad_norm": 0.02627277560532093, "learning_rate": 0.02352328784763813, "loss": 2.2771286964416504, "step": 13846 }, { "epoch": 0.6594285714285715, "grad_norm": 0.025281181558966637, "learning_rate": 0.023516712710261345, "loss": 2.2461938858032227, "step": 13848 }, { "epoch": 0.6595238095238095, "grad_norm": 0.027801895514130592, "learning_rate": 0.02351013757288456, "loss": 2.2715492248535156, "step": 13850 }, { "epoch": 0.6596190476190477, "grad_norm": 0.029224395751953125, "learning_rate": 0.023503560572862625, "loss": 2.277886390686035, "step": 13852 }, { "epoch": 0.6597142857142857, "grad_norm": 0.03296584263443947, "learning_rate": 0.02349698729813099, "loss": 2.252753257751465, "step": 13854 }, { "epoch": 0.6598095238095238, "grad_norm": 0.028364086523652077, "learning_rate": 0.023490410298109055, "loss": 2.2690930366516113, "step": 13856 }, { "epoch": 0.6599047619047619, "grad_norm": 0.02924221381545067, "learning_rate": 0.02348383516073227, "loss": 2.2798633575439453, "step": 13858 }, { "epoch": 0.66, "grad_norm": 0.028292058035731316, "learning_rate": 0.023477260023355484, "loss": 2.2681307792663574, "step": 13860 }, { "epoch": 0.6600952380952381, "grad_norm": 0.025186484679579735, "learning_rate": 0.0234706848859787, "loss": 2.2882347106933594, "step": 13862 }, { "epoch": 0.6601904761904762, "grad_norm": 0.029062405228614807, "learning_rate": 0.023464109748601913, "loss": 2.259739875793457, "step": 13864 }, { "epoch": 0.6602857142857143, "grad_norm": 0.025963570922613144, "learning_rate": 0.023457534611225128, "loss": 2.2631802558898926, "step": 13866 }, { "epoch": 0.6603809523809524, "grad_norm": 0.02577928639948368, "learning_rate": 0.023450957611203194, "loss": 2.266839027404785, "step": 13868 }, { "epoch": 0.6604761904761904, "grad_norm": 0.025521885603666306, "learning_rate": 0.023444384336471558, "loss": 2.2554702758789062, "step": 13870 }, { "epoch": 0.6605714285714286, "grad_norm": 0.025916598737239838, "learning_rate": 0.023437807336449623, "loss": 2.2783141136169434, "step": 13872 }, { "epoch": 0.6606666666666666, "grad_norm": 0.02557511441409588, "learning_rate": 0.023431234061717987, "loss": 2.2660577297210693, "step": 13874 }, { "epoch": 0.6607619047619048, "grad_norm": 0.025885578244924545, "learning_rate": 0.023424657061696053, "loss": 2.260098934173584, "step": 13876 }, { "epoch": 0.6608571428571428, "grad_norm": 0.026084668934345245, "learning_rate": 0.023418081924319267, "loss": 2.2549071311950684, "step": 13878 }, { "epoch": 0.660952380952381, "grad_norm": 0.025693094357848167, "learning_rate": 0.023411506786942482, "loss": 2.2950663566589355, "step": 13880 }, { "epoch": 0.661047619047619, "grad_norm": 0.02928868494927883, "learning_rate": 0.023404931649565697, "loss": 2.294121503829956, "step": 13882 }, { "epoch": 0.6611428571428571, "grad_norm": 0.026167845353484154, "learning_rate": 0.02339835651218891, "loss": 2.26224684715271, "step": 13884 }, { "epoch": 0.6612380952380953, "grad_norm": 0.026921553537249565, "learning_rate": 0.023391781374812126, "loss": 2.266427516937256, "step": 13886 }, { "epoch": 0.6613333333333333, "grad_norm": 0.025991613045334816, "learning_rate": 0.02338520437479019, "loss": 2.268138885498047, "step": 13888 }, { "epoch": 0.6614285714285715, "grad_norm": 0.02666028030216694, "learning_rate": 0.023378631100058556, "loss": 2.233227252960205, "step": 13890 }, { "epoch": 0.6615238095238095, "grad_norm": 0.026277491822838783, "learning_rate": 0.02337205410003662, "loss": 2.262936592102051, "step": 13892 }, { "epoch": 0.6616190476190477, "grad_norm": 0.025200724601745605, "learning_rate": 0.023365478962659836, "loss": 2.245210647583008, "step": 13894 }, { "epoch": 0.6617142857142857, "grad_norm": 0.03177906572818756, "learning_rate": 0.02335890382528305, "loss": 2.250858783721924, "step": 13896 }, { "epoch": 0.6618095238095238, "grad_norm": 0.031245995312929153, "learning_rate": 0.023352328687906265, "loss": 2.2791543006896973, "step": 13898 }, { "epoch": 0.6619047619047619, "grad_norm": 0.032926030457019806, "learning_rate": 0.02334575355052948, "loss": 2.305793523788452, "step": 13900 }, { "epoch": 0.662, "grad_norm": 0.026515405625104904, "learning_rate": 0.023339178413152695, "loss": 2.2843427658081055, "step": 13902 }, { "epoch": 0.6620952380952381, "grad_norm": 0.02706746757030487, "learning_rate": 0.02333260327577591, "loss": 2.284080982208252, "step": 13904 }, { "epoch": 0.6621904761904762, "grad_norm": 0.028367886319756508, "learning_rate": 0.023326028138399124, "loss": 2.3024113178253174, "step": 13906 }, { "epoch": 0.6622857142857143, "grad_norm": 0.02703789435327053, "learning_rate": 0.02331945300102234, "loss": 2.273664951324463, "step": 13908 }, { "epoch": 0.6623809523809524, "grad_norm": 0.025872979313135147, "learning_rate": 0.023312876001000404, "loss": 2.3039541244506836, "step": 13910 }, { "epoch": 0.6624761904761904, "grad_norm": 0.02675330452620983, "learning_rate": 0.02330630272626877, "loss": 2.268782138824463, "step": 13912 }, { "epoch": 0.6625714285714286, "grad_norm": 0.026666825637221336, "learning_rate": 0.023299725726246834, "loss": 2.3063056468963623, "step": 13914 }, { "epoch": 0.6626666666666666, "grad_norm": 0.027085337787866592, "learning_rate": 0.023293152451515198, "loss": 2.3097283840179443, "step": 13916 }, { "epoch": 0.6627619047619048, "grad_norm": 0.027631156146526337, "learning_rate": 0.023286575451493263, "loss": 2.2930240631103516, "step": 13918 }, { "epoch": 0.6628571428571428, "grad_norm": 0.02719752863049507, "learning_rate": 0.023280000314116478, "loss": 2.2693352699279785, "step": 13920 }, { "epoch": 0.662952380952381, "grad_norm": 0.025919483974575996, "learning_rate": 0.023273425176739693, "loss": 2.277297019958496, "step": 13922 }, { "epoch": 0.663047619047619, "grad_norm": 0.02556609734892845, "learning_rate": 0.023266850039362907, "loss": 2.2915430068969727, "step": 13924 }, { "epoch": 0.6631428571428571, "grad_norm": 0.026384573429822922, "learning_rate": 0.023260274901986122, "loss": 2.263254165649414, "step": 13926 }, { "epoch": 0.6632380952380953, "grad_norm": 0.025196094065904617, "learning_rate": 0.023253699764609337, "loss": 2.2810349464416504, "step": 13928 }, { "epoch": 0.6633333333333333, "grad_norm": 0.026882421225309372, "learning_rate": 0.023247122764587402, "loss": 2.3085546493530273, "step": 13930 }, { "epoch": 0.6634285714285715, "grad_norm": 0.026140419766306877, "learning_rate": 0.023240549489855766, "loss": 2.2712302207946777, "step": 13932 }, { "epoch": 0.6635238095238095, "grad_norm": 0.02767927572131157, "learning_rate": 0.023233972489833832, "loss": 2.2727527618408203, "step": 13934 }, { "epoch": 0.6636190476190477, "grad_norm": 0.029079679399728775, "learning_rate": 0.023227397352457047, "loss": 2.280426025390625, "step": 13936 }, { "epoch": 0.6637142857142857, "grad_norm": 0.030750617384910583, "learning_rate": 0.02322082221508026, "loss": 2.2953414916992188, "step": 13938 }, { "epoch": 0.6638095238095238, "grad_norm": 0.025467796251177788, "learning_rate": 0.023214247077703476, "loss": 2.293576955795288, "step": 13940 }, { "epoch": 0.6639047619047619, "grad_norm": 0.025064382702112198, "learning_rate": 0.02320767194032669, "loss": 2.311157703399658, "step": 13942 }, { "epoch": 0.664, "grad_norm": 0.02512534148991108, "learning_rate": 0.023201096802949905, "loss": 2.256011962890625, "step": 13944 }, { "epoch": 0.6640952380952381, "grad_norm": 0.025339126586914062, "learning_rate": 0.02319451980292797, "loss": 2.25819730758667, "step": 13946 }, { "epoch": 0.6641904761904762, "grad_norm": 0.02622128650546074, "learning_rate": 0.023187946528196335, "loss": 2.286811351776123, "step": 13948 }, { "epoch": 0.6642857142857143, "grad_norm": 0.03163519129157066, "learning_rate": 0.0231813695281744, "loss": 2.2480249404907227, "step": 13950 }, { "epoch": 0.6643809523809524, "grad_norm": 0.02752911113202572, "learning_rate": 0.023174796253442764, "loss": 2.282597780227661, "step": 13952 }, { "epoch": 0.6644761904761904, "grad_norm": 0.025430748239159584, "learning_rate": 0.02316821925342083, "loss": 2.2765913009643555, "step": 13954 }, { "epoch": 0.6645714285714286, "grad_norm": 0.025307655334472656, "learning_rate": 0.023161644116044044, "loss": 2.2556121349334717, "step": 13956 }, { "epoch": 0.6646666666666666, "grad_norm": 0.02593464031815529, "learning_rate": 0.02315506897866726, "loss": 2.2779035568237305, "step": 13958 }, { "epoch": 0.6647619047619048, "grad_norm": 0.027253568172454834, "learning_rate": 0.023148493841290474, "loss": 2.273207664489746, "step": 13960 }, { "epoch": 0.6648571428571428, "grad_norm": 0.026256216689944267, "learning_rate": 0.02314191870391369, "loss": 2.276444435119629, "step": 13962 }, { "epoch": 0.664952380952381, "grad_norm": 0.02576153539121151, "learning_rate": 0.023135343566536903, "loss": 2.267192840576172, "step": 13964 }, { "epoch": 0.665047619047619, "grad_norm": 0.026722237467765808, "learning_rate": 0.02312876656651497, "loss": 2.2759742736816406, "step": 13966 }, { "epoch": 0.6651428571428571, "grad_norm": 0.02736702375113964, "learning_rate": 0.023122193291783333, "loss": 2.2797234058380127, "step": 13968 }, { "epoch": 0.6652380952380952, "grad_norm": 0.026535790413618088, "learning_rate": 0.0231156162917614, "loss": 2.255361557006836, "step": 13970 }, { "epoch": 0.6653333333333333, "grad_norm": 0.025803783908486366, "learning_rate": 0.023109041154384613, "loss": 2.270514965057373, "step": 13972 }, { "epoch": 0.6654285714285715, "grad_norm": 0.026214363053441048, "learning_rate": 0.023102466017007828, "loss": 2.268768787384033, "step": 13974 }, { "epoch": 0.6655238095238095, "grad_norm": 0.026481369510293007, "learning_rate": 0.023095890879631042, "loss": 2.2484543323516846, "step": 13976 }, { "epoch": 0.6656190476190477, "grad_norm": 0.03009878844022751, "learning_rate": 0.023089315742254257, "loss": 2.2713801860809326, "step": 13978 }, { "epoch": 0.6657142857142857, "grad_norm": 0.02564949542284012, "learning_rate": 0.023082740604877472, "loss": 2.256190776824951, "step": 13980 }, { "epoch": 0.6658095238095239, "grad_norm": 0.027910498902201653, "learning_rate": 0.023076163604855537, "loss": 2.316833972930908, "step": 13982 }, { "epoch": 0.6659047619047619, "grad_norm": 0.02563602663576603, "learning_rate": 0.0230695903301239, "loss": 2.272979259490967, "step": 13984 }, { "epoch": 0.666, "grad_norm": 0.025326784700155258, "learning_rate": 0.023063013330101967, "loss": 2.31478214263916, "step": 13986 }, { "epoch": 0.6660952380952381, "grad_norm": 0.02868674509227276, "learning_rate": 0.02305643819272518, "loss": 2.2893543243408203, "step": 13988 }, { "epoch": 0.6661904761904762, "grad_norm": 0.028063364326953888, "learning_rate": 0.023049863055348396, "loss": 2.27778697013855, "step": 13990 }, { "epoch": 0.6662857142857143, "grad_norm": 0.0252991896122694, "learning_rate": 0.02304328791797161, "loss": 2.30945086479187, "step": 13992 }, { "epoch": 0.6663809523809524, "grad_norm": 0.0266608577221632, "learning_rate": 0.023036712780594826, "loss": 2.311929702758789, "step": 13994 }, { "epoch": 0.6664761904761904, "grad_norm": 0.026484688743948936, "learning_rate": 0.02303013764321804, "loss": 2.2780027389526367, "step": 13996 }, { "epoch": 0.6665714285714286, "grad_norm": 0.026254871860146523, "learning_rate": 0.023023562505841255, "loss": 2.3104288578033447, "step": 13998 }, { "epoch": 0.6666666666666666, "grad_norm": 0.02771391160786152, "learning_rate": 0.02301698736846447, "loss": 2.266958475112915, "step": 14000 }, { "epoch": 0.6667619047619048, "grad_norm": 0.026367846876382828, "learning_rate": 0.023010410368442535, "loss": 2.2773687839508057, "step": 14002 }, { "epoch": 0.6668571428571428, "grad_norm": 0.02834508568048477, "learning_rate": 0.0230038370937109, "loss": 2.325556993484497, "step": 14004 }, { "epoch": 0.666952380952381, "grad_norm": 0.026125377044081688, "learning_rate": 0.022997260093688965, "loss": 2.2948391437530518, "step": 14006 }, { "epoch": 0.667047619047619, "grad_norm": 0.025822436437010765, "learning_rate": 0.02299068495631218, "loss": 2.2732672691345215, "step": 14008 }, { "epoch": 0.6671428571428571, "grad_norm": 0.0257906224578619, "learning_rate": 0.022984109818935394, "loss": 2.2673025131225586, "step": 14010 }, { "epoch": 0.6672380952380952, "grad_norm": 0.02586480602622032, "learning_rate": 0.02297753468155861, "loss": 2.2702507972717285, "step": 14012 }, { "epoch": 0.6673333333333333, "grad_norm": 0.027757668867707253, "learning_rate": 0.022970959544181824, "loss": 2.2946343421936035, "step": 14014 }, { "epoch": 0.6674285714285715, "grad_norm": 0.031673774123191833, "learning_rate": 0.02296438440680504, "loss": 2.293067455291748, "step": 14016 }, { "epoch": 0.6675238095238095, "grad_norm": 0.0277529526501894, "learning_rate": 0.022957807406783104, "loss": 2.2774949073791504, "step": 14018 }, { "epoch": 0.6676190476190477, "grad_norm": 0.026103375479578972, "learning_rate": 0.022951234132051468, "loss": 2.314190626144409, "step": 14020 }, { "epoch": 0.6677142857142857, "grad_norm": 0.026833752170205116, "learning_rate": 0.022944657132029533, "loss": 2.280405044555664, "step": 14022 }, { "epoch": 0.6678095238095239, "grad_norm": 0.027477525174617767, "learning_rate": 0.022938081994652748, "loss": 2.2885305881500244, "step": 14024 }, { "epoch": 0.6679047619047619, "grad_norm": 0.03226042166352272, "learning_rate": 0.022931506857275963, "loss": 2.258172035217285, "step": 14026 }, { "epoch": 0.668, "grad_norm": 0.028422068804502487, "learning_rate": 0.022924931719899178, "loss": 2.297588348388672, "step": 14028 }, { "epoch": 0.6680952380952381, "grad_norm": 0.032311033457517624, "learning_rate": 0.022918356582522392, "loss": 2.2863662242889404, "step": 14030 }, { "epoch": 0.6681904761904762, "grad_norm": 0.027216723188757896, "learning_rate": 0.022911781445145607, "loss": 2.281301975250244, "step": 14032 }, { "epoch": 0.6682857142857143, "grad_norm": 0.0285510141402483, "learning_rate": 0.02290520630776882, "loss": 2.2921667098999023, "step": 14034 }, { "epoch": 0.6683809523809524, "grad_norm": 0.029551036655902863, "learning_rate": 0.022898631170392036, "loss": 2.2981812953948975, "step": 14036 }, { "epoch": 0.6684761904761904, "grad_norm": 0.025521479547023773, "learning_rate": 0.022892054170370102, "loss": 2.265700340270996, "step": 14038 }, { "epoch": 0.6685714285714286, "grad_norm": 0.026212893426418304, "learning_rate": 0.022885480895638466, "loss": 2.2760095596313477, "step": 14040 }, { "epoch": 0.6686666666666666, "grad_norm": 0.026285521686077118, "learning_rate": 0.02287890389561653, "loss": 2.3080272674560547, "step": 14042 }, { "epoch": 0.6687619047619048, "grad_norm": 0.02663321979343891, "learning_rate": 0.022872328758239746, "loss": 2.2922840118408203, "step": 14044 }, { "epoch": 0.6688571428571428, "grad_norm": 0.026313336566090584, "learning_rate": 0.02286575362086296, "loss": 2.2860190868377686, "step": 14046 }, { "epoch": 0.668952380952381, "grad_norm": 0.026533709838986397, "learning_rate": 0.022859178483486176, "loss": 2.292598247528076, "step": 14048 }, { "epoch": 0.669047619047619, "grad_norm": 0.026156213134527206, "learning_rate": 0.02285260334610939, "loss": 2.279980182647705, "step": 14050 }, { "epoch": 0.6691428571428572, "grad_norm": 0.026830758899450302, "learning_rate": 0.022846028208732605, "loss": 2.289994478225708, "step": 14052 }, { "epoch": 0.6692380952380952, "grad_norm": 0.026487329974770546, "learning_rate": 0.02283945120871067, "loss": 2.3031153678894043, "step": 14054 }, { "epoch": 0.6693333333333333, "grad_norm": 0.0267647672444582, "learning_rate": 0.022832877933979034, "loss": 2.2672853469848633, "step": 14056 }, { "epoch": 0.6694285714285715, "grad_norm": 0.028629528358578682, "learning_rate": 0.0228263009339571, "loss": 2.314545154571533, "step": 14058 }, { "epoch": 0.6695238095238095, "grad_norm": 0.029828418046236038, "learning_rate": 0.022819725796580315, "loss": 2.271758794784546, "step": 14060 }, { "epoch": 0.6696190476190477, "grad_norm": 0.02573932707309723, "learning_rate": 0.02281315065920353, "loss": 2.2894701957702637, "step": 14062 }, { "epoch": 0.6697142857142857, "grad_norm": 0.026285521686077118, "learning_rate": 0.022806575521826744, "loss": 2.286254405975342, "step": 14064 }, { "epoch": 0.6698095238095239, "grad_norm": 0.02518671751022339, "learning_rate": 0.02280000038444996, "loss": 2.307157039642334, "step": 14066 }, { "epoch": 0.6699047619047619, "grad_norm": 0.02491891384124756, "learning_rate": 0.022793425247073174, "loss": 2.276672601699829, "step": 14068 }, { "epoch": 0.67, "grad_norm": 0.0272072721272707, "learning_rate": 0.022786850109696388, "loss": 2.3106210231781006, "step": 14070 }, { "epoch": 0.6700952380952381, "grad_norm": 0.028195669874548912, "learning_rate": 0.022780274972319603, "loss": 2.294239044189453, "step": 14072 }, { "epoch": 0.6701904761904762, "grad_norm": 0.02668914385139942, "learning_rate": 0.02277369797229767, "loss": 2.3001768589019775, "step": 14074 }, { "epoch": 0.6702857142857143, "grad_norm": 0.025903869420289993, "learning_rate": 0.022767124697566032, "loss": 2.266757011413574, "step": 14076 }, { "epoch": 0.6703809523809524, "grad_norm": 0.026203742250800133, "learning_rate": 0.022760547697544098, "loss": 2.31300687789917, "step": 14078 }, { "epoch": 0.6704761904761904, "grad_norm": 0.027895255014300346, "learning_rate": 0.022753972560167313, "loss": 2.3117313385009766, "step": 14080 }, { "epoch": 0.6705714285714286, "grad_norm": 0.0256912000477314, "learning_rate": 0.022747397422790527, "loss": 2.3287618160247803, "step": 14082 }, { "epoch": 0.6706666666666666, "grad_norm": 0.02665974199771881, "learning_rate": 0.022740822285413742, "loss": 2.3123018741607666, "step": 14084 }, { "epoch": 0.6707619047619048, "grad_norm": 0.02732139267027378, "learning_rate": 0.022734247148036957, "loss": 2.2989492416381836, "step": 14086 }, { "epoch": 0.6708571428571428, "grad_norm": 0.027926906943321228, "learning_rate": 0.02272767201066017, "loss": 2.30989933013916, "step": 14088 }, { "epoch": 0.670952380952381, "grad_norm": 0.02509789913892746, "learning_rate": 0.022721095010638237, "loss": 2.304077625274658, "step": 14090 }, { "epoch": 0.671047619047619, "grad_norm": 0.02641027420759201, "learning_rate": 0.0227145217359066, "loss": 2.307368755340576, "step": 14092 }, { "epoch": 0.6711428571428572, "grad_norm": 0.025606034323573112, "learning_rate": 0.022707944735884666, "loss": 2.334171772003174, "step": 14094 }, { "epoch": 0.6712380952380952, "grad_norm": 0.025665948167443275, "learning_rate": 0.02270136959850788, "loss": 2.2780840396881104, "step": 14096 }, { "epoch": 0.6713333333333333, "grad_norm": 0.026516180485486984, "learning_rate": 0.022694794461131096, "loss": 2.333354949951172, "step": 14098 }, { "epoch": 0.6714285714285714, "grad_norm": 0.026074102148413658, "learning_rate": 0.02268821932375431, "loss": 2.30458927154541, "step": 14100 }, { "epoch": 0.6715238095238095, "grad_norm": 0.02683558501303196, "learning_rate": 0.022681644186377525, "loss": 2.3135337829589844, "step": 14102 }, { "epoch": 0.6716190476190477, "grad_norm": 0.026696646586060524, "learning_rate": 0.02267506904900074, "loss": 2.3159937858581543, "step": 14104 }, { "epoch": 0.6717142857142857, "grad_norm": 0.02567158453166485, "learning_rate": 0.022668493911623955, "loss": 2.3226752281188965, "step": 14106 }, { "epoch": 0.6718095238095239, "grad_norm": 0.024600306525826454, "learning_rate": 0.02266191877424717, "loss": 2.306046962738037, "step": 14108 }, { "epoch": 0.6719047619047619, "grad_norm": 0.028904613107442856, "learning_rate": 0.022655341774225235, "loss": 2.325171947479248, "step": 14110 }, { "epoch": 0.672, "grad_norm": 0.02674891985952854, "learning_rate": 0.0226487684994936, "loss": 2.321098566055298, "step": 14112 }, { "epoch": 0.6720952380952381, "grad_norm": 0.025578932836651802, "learning_rate": 0.022642191499471664, "loss": 2.3364691734313965, "step": 14114 }, { "epoch": 0.6721904761904762, "grad_norm": 0.02782977931201458, "learning_rate": 0.02263561636209488, "loss": 2.2967517375946045, "step": 14116 }, { "epoch": 0.6722857142857143, "grad_norm": 0.027391355484724045, "learning_rate": 0.022629041224718094, "loss": 2.312936782836914, "step": 14118 }, { "epoch": 0.6723809523809524, "grad_norm": 0.027308614924550056, "learning_rate": 0.02262246608734131, "loss": 2.3341822624206543, "step": 14120 }, { "epoch": 0.6724761904761904, "grad_norm": 0.026905907317996025, "learning_rate": 0.022615890949964523, "loss": 2.317690372467041, "step": 14122 }, { "epoch": 0.6725714285714286, "grad_norm": 0.02542872726917267, "learning_rate": 0.022609315812587738, "loss": 2.3573782444000244, "step": 14124 }, { "epoch": 0.6726666666666666, "grad_norm": 0.026429057121276855, "learning_rate": 0.022602738812565804, "loss": 2.307079315185547, "step": 14126 }, { "epoch": 0.6727619047619048, "grad_norm": 0.025902824476361275, "learning_rate": 0.022596165537834167, "loss": 2.318695068359375, "step": 14128 }, { "epoch": 0.6728571428571428, "grad_norm": 0.025668565183877945, "learning_rate": 0.022589588537812233, "loss": 2.339277744293213, "step": 14130 }, { "epoch": 0.672952380952381, "grad_norm": 0.025559106841683388, "learning_rate": 0.022583013400435448, "loss": 2.3215181827545166, "step": 14132 }, { "epoch": 0.673047619047619, "grad_norm": 0.02565022185444832, "learning_rate": 0.022576438263058662, "loss": 2.3465447425842285, "step": 14134 }, { "epoch": 0.6731428571428572, "grad_norm": 0.02726512774825096, "learning_rate": 0.022569863125681877, "loss": 2.2976207733154297, "step": 14136 }, { "epoch": 0.6732380952380952, "grad_norm": 0.02575351670384407, "learning_rate": 0.022563287988305092, "loss": 2.3273911476135254, "step": 14138 }, { "epoch": 0.6733333333333333, "grad_norm": 0.028185267001390457, "learning_rate": 0.022556712850928307, "loss": 2.3304214477539062, "step": 14140 }, { "epoch": 0.6734285714285714, "grad_norm": 0.02671932429075241, "learning_rate": 0.022550135850906372, "loss": 2.377772569656372, "step": 14142 }, { "epoch": 0.6735238095238095, "grad_norm": 0.02573077566921711, "learning_rate": 0.022543562576174736, "loss": 2.3500499725341797, "step": 14144 }, { "epoch": 0.6736190476190477, "grad_norm": 0.026090286672115326, "learning_rate": 0.0225369855761528, "loss": 2.3311400413513184, "step": 14146 }, { "epoch": 0.6737142857142857, "grad_norm": 0.02574189007282257, "learning_rate": 0.022530412301421165, "loss": 2.346457004547119, "step": 14148 }, { "epoch": 0.6738095238095239, "grad_norm": 0.026430610567331314, "learning_rate": 0.02252383530139923, "loss": 2.3684043884277344, "step": 14150 }, { "epoch": 0.6739047619047619, "grad_norm": 0.025740336626768112, "learning_rate": 0.022517260164022446, "loss": 2.3523426055908203, "step": 14152 }, { "epoch": 0.674, "grad_norm": 0.027638215571641922, "learning_rate": 0.02251068502664566, "loss": 2.3416717052459717, "step": 14154 }, { "epoch": 0.6740952380952381, "grad_norm": 0.02584807202219963, "learning_rate": 0.022504109889268875, "loss": 2.3475918769836426, "step": 14156 }, { "epoch": 0.6741904761904762, "grad_norm": 0.02657484821975231, "learning_rate": 0.02249753475189209, "loss": 2.2797489166259766, "step": 14158 }, { "epoch": 0.6742857142857143, "grad_norm": 0.02552606165409088, "learning_rate": 0.022490959614515305, "loss": 2.3261194229125977, "step": 14160 }, { "epoch": 0.6743809523809524, "grad_norm": 0.02571888640522957, "learning_rate": 0.02248438261449337, "loss": 2.320218086242676, "step": 14162 }, { "epoch": 0.6744761904761905, "grad_norm": 0.0249288659542799, "learning_rate": 0.022477809339761734, "loss": 2.333686590194702, "step": 14164 }, { "epoch": 0.6745714285714286, "grad_norm": 0.029076458886265755, "learning_rate": 0.0224712323397398, "loss": 2.361011028289795, "step": 14166 }, { "epoch": 0.6746666666666666, "grad_norm": 0.02613682858645916, "learning_rate": 0.022464657202363014, "loss": 2.3332672119140625, "step": 14168 }, { "epoch": 0.6747619047619048, "grad_norm": 0.028046879917383194, "learning_rate": 0.02245808206498623, "loss": 2.3592653274536133, "step": 14170 }, { "epoch": 0.6748571428571428, "grad_norm": 0.02558146044611931, "learning_rate": 0.022451506927609444, "loss": 2.3431482315063477, "step": 14172 }, { "epoch": 0.674952380952381, "grad_norm": 0.025567498058080673, "learning_rate": 0.02244493179023266, "loss": 2.3682188987731934, "step": 14174 }, { "epoch": 0.675047619047619, "grad_norm": 0.026470543816685677, "learning_rate": 0.022438356652855873, "loss": 2.358126163482666, "step": 14176 }, { "epoch": 0.6751428571428572, "grad_norm": 0.02913154475390911, "learning_rate": 0.02243177965283394, "loss": 2.3738248348236084, "step": 14178 }, { "epoch": 0.6752380952380952, "grad_norm": 0.02717212587594986, "learning_rate": 0.022425206378102303, "loss": 2.3654303550720215, "step": 14180 }, { "epoch": 0.6753333333333333, "grad_norm": 0.028573499992489815, "learning_rate": 0.022418629378080368, "loss": 2.3348395824432373, "step": 14182 }, { "epoch": 0.6754285714285714, "grad_norm": 0.025991572067141533, "learning_rate": 0.022412056103348732, "loss": 2.328063488006592, "step": 14184 }, { "epoch": 0.6755238095238095, "grad_norm": 0.02600674144923687, "learning_rate": 0.022405479103326797, "loss": 2.3478035926818848, "step": 14186 }, { "epoch": 0.6756190476190476, "grad_norm": 0.025750238448381424, "learning_rate": 0.022398903965950012, "loss": 2.3517653942108154, "step": 14188 }, { "epoch": 0.6757142857142857, "grad_norm": 0.025665102526545525, "learning_rate": 0.022392328828573227, "loss": 2.38053560256958, "step": 14190 }, { "epoch": 0.6758095238095239, "grad_norm": 0.026357606053352356, "learning_rate": 0.02238575369119644, "loss": 2.3256936073303223, "step": 14192 }, { "epoch": 0.6759047619047619, "grad_norm": 0.02637265995144844, "learning_rate": 0.022379178553819656, "loss": 2.340972900390625, "step": 14194 }, { "epoch": 0.676, "grad_norm": 0.02575707621872425, "learning_rate": 0.02237260341644287, "loss": 2.3326828479766846, "step": 14196 }, { "epoch": 0.6760952380952381, "grad_norm": 0.02665610797703266, "learning_rate": 0.022366026416420937, "loss": 2.379394054412842, "step": 14198 }, { "epoch": 0.6761904761904762, "grad_norm": 0.028913678601384163, "learning_rate": 0.0223594531416893, "loss": 2.3805503845214844, "step": 14200 }, { "epoch": 0.6762857142857143, "grad_norm": 0.031401678919792175, "learning_rate": 0.022352876141667366, "loss": 2.3187222480773926, "step": 14202 }, { "epoch": 0.6763809523809524, "grad_norm": 0.026788612827658653, "learning_rate": 0.02234630100429058, "loss": 2.376297950744629, "step": 14204 }, { "epoch": 0.6764761904761905, "grad_norm": 0.027100419625639915, "learning_rate": 0.022339725866913795, "loss": 2.3527684211730957, "step": 14206 }, { "epoch": 0.6765714285714286, "grad_norm": 0.027212221175432205, "learning_rate": 0.02233315072953701, "loss": 2.334700584411621, "step": 14208 }, { "epoch": 0.6766666666666666, "grad_norm": 0.028188880532979965, "learning_rate": 0.022326575592160225, "loss": 2.359984874725342, "step": 14210 }, { "epoch": 0.6767619047619048, "grad_norm": 0.026830092072486877, "learning_rate": 0.02232000045478344, "loss": 2.3399572372436523, "step": 14212 }, { "epoch": 0.6768571428571428, "grad_norm": 0.026616139337420464, "learning_rate": 0.022313423454761505, "loss": 2.359717607498169, "step": 14214 }, { "epoch": 0.676952380952381, "grad_norm": 0.027688564732670784, "learning_rate": 0.02230685018002987, "loss": 2.348177909851074, "step": 14216 }, { "epoch": 0.677047619047619, "grad_norm": 0.025868205353617668, "learning_rate": 0.022300273180007935, "loss": 2.3673505783081055, "step": 14218 }, { "epoch": 0.6771428571428572, "grad_norm": 0.02687159925699234, "learning_rate": 0.0222936999052763, "loss": 2.3516788482666016, "step": 14220 }, { "epoch": 0.6772380952380952, "grad_norm": 0.030366528779268265, "learning_rate": 0.022287122905254364, "loss": 2.406816244125366, "step": 14222 }, { "epoch": 0.6773333333333333, "grad_norm": 0.026860591024160385, "learning_rate": 0.02228054776787758, "loss": 2.3505842685699463, "step": 14224 }, { "epoch": 0.6774285714285714, "grad_norm": 0.02672349102795124, "learning_rate": 0.022273972630500793, "loss": 2.39552903175354, "step": 14226 }, { "epoch": 0.6775238095238095, "grad_norm": 0.02936403639614582, "learning_rate": 0.022267397493124008, "loss": 2.3352115154266357, "step": 14228 }, { "epoch": 0.6776190476190476, "grad_norm": 0.026220444589853287, "learning_rate": 0.022260822355747223, "loss": 2.382309675216675, "step": 14230 }, { "epoch": 0.6777142857142857, "grad_norm": 0.02609504759311676, "learning_rate": 0.022254247218370438, "loss": 2.3698956966400146, "step": 14232 }, { "epoch": 0.6778095238095239, "grad_norm": 0.027414968237280846, "learning_rate": 0.022247670218348503, "loss": 2.366523265838623, "step": 14234 }, { "epoch": 0.6779047619047619, "grad_norm": 0.025917138904333115, "learning_rate": 0.022241096943616867, "loss": 2.364741325378418, "step": 14236 }, { "epoch": 0.678, "grad_norm": 0.02831334061920643, "learning_rate": 0.022234519943594933, "loss": 2.3743019104003906, "step": 14238 }, { "epoch": 0.6780952380952381, "grad_norm": 0.02773565612733364, "learning_rate": 0.022227944806218147, "loss": 2.4045467376708984, "step": 14240 }, { "epoch": 0.6781904761904762, "grad_norm": 0.02860456518828869, "learning_rate": 0.022221369668841362, "loss": 2.345531702041626, "step": 14242 }, { "epoch": 0.6782857142857143, "grad_norm": 0.02576429955661297, "learning_rate": 0.022214794531464577, "loss": 2.3705124855041504, "step": 14244 }, { "epoch": 0.6783809523809524, "grad_norm": 0.026126984506845474, "learning_rate": 0.02220821939408779, "loss": 2.3871092796325684, "step": 14246 }, { "epoch": 0.6784761904761905, "grad_norm": 0.026461919769644737, "learning_rate": 0.022201644256711006, "loss": 2.363941192626953, "step": 14248 }, { "epoch": 0.6785714285714286, "grad_norm": 0.026133334264159203, "learning_rate": 0.02219506725668907, "loss": 2.3858015537261963, "step": 14250 }, { "epoch": 0.6786666666666666, "grad_norm": 0.02553827501833439, "learning_rate": 0.022188493981957436, "loss": 2.4005041122436523, "step": 14252 }, { "epoch": 0.6787619047619048, "grad_norm": 0.025554582476615906, "learning_rate": 0.0221819169819355, "loss": 2.390413761138916, "step": 14254 }, { "epoch": 0.6788571428571428, "grad_norm": 0.02746669575572014, "learning_rate": 0.022175341844558716, "loss": 2.412604331970215, "step": 14256 }, { "epoch": 0.678952380952381, "grad_norm": 0.025661544874310493, "learning_rate": 0.02216876670718193, "loss": 2.3878893852233887, "step": 14258 }, { "epoch": 0.679047619047619, "grad_norm": 0.027008946985006332, "learning_rate": 0.022162191569805145, "loss": 2.4090824127197266, "step": 14260 }, { "epoch": 0.6791428571428572, "grad_norm": 0.026258356869220734, "learning_rate": 0.02215561643242836, "loss": 2.400207042694092, "step": 14262 }, { "epoch": 0.6792380952380952, "grad_norm": 0.02749725803732872, "learning_rate": 0.022149041295051575, "loss": 2.3539443016052246, "step": 14264 }, { "epoch": 0.6793333333333333, "grad_norm": 0.026628592982888222, "learning_rate": 0.02214246615767479, "loss": 2.414297580718994, "step": 14266 }, { "epoch": 0.6794285714285714, "grad_norm": 0.02638169191777706, "learning_rate": 0.022135891020298004, "loss": 2.3944127559661865, "step": 14268 }, { "epoch": 0.6795238095238095, "grad_norm": 0.025522949174046516, "learning_rate": 0.02212931402027607, "loss": 2.434760570526123, "step": 14270 }, { "epoch": 0.6796190476190476, "grad_norm": 0.02499159798026085, "learning_rate": 0.022122740745544434, "loss": 2.3967278003692627, "step": 14272 }, { "epoch": 0.6797142857142857, "grad_norm": 0.026113664731383324, "learning_rate": 0.0221161637455225, "loss": 2.412475824356079, "step": 14274 }, { "epoch": 0.6798095238095239, "grad_norm": 0.02596234902739525, "learning_rate": 0.022109588608145714, "loss": 2.4302825927734375, "step": 14276 }, { "epoch": 0.6799047619047619, "grad_norm": 0.028002314269542694, "learning_rate": 0.02210301347076893, "loss": 2.4050300121307373, "step": 14278 }, { "epoch": 0.68, "grad_norm": 0.025324463844299316, "learning_rate": 0.022096438333392143, "loss": 2.3874306678771973, "step": 14280 }, { "epoch": 0.6800952380952381, "grad_norm": 0.026687530800700188, "learning_rate": 0.022089863196015358, "loss": 2.409661293029785, "step": 14282 }, { "epoch": 0.6801904761904762, "grad_norm": 0.025254499167203903, "learning_rate": 0.022083288058638573, "loss": 2.396421432495117, "step": 14284 }, { "epoch": 0.6802857142857143, "grad_norm": 0.03022933006286621, "learning_rate": 0.022076711058616638, "loss": 2.388962507247925, "step": 14286 }, { "epoch": 0.6803809523809524, "grad_norm": 0.0307582039386034, "learning_rate": 0.022070137783885002, "loss": 2.398834705352783, "step": 14288 }, { "epoch": 0.6804761904761905, "grad_norm": 0.0290457084774971, "learning_rate": 0.022063560783863068, "loss": 2.4327034950256348, "step": 14290 }, { "epoch": 0.6805714285714286, "grad_norm": 0.02699536643922329, "learning_rate": 0.022056985646486282, "loss": 2.4164514541625977, "step": 14292 }, { "epoch": 0.6806666666666666, "grad_norm": 0.02589573711156845, "learning_rate": 0.022050410509109497, "loss": 2.4212918281555176, "step": 14294 }, { "epoch": 0.6807619047619048, "grad_norm": 0.02583828754723072, "learning_rate": 0.022043835371732712, "loss": 2.3624682426452637, "step": 14296 }, { "epoch": 0.6808571428571428, "grad_norm": 0.027167830616235733, "learning_rate": 0.022037260234355927, "loss": 2.4183242321014404, "step": 14298 }, { "epoch": 0.680952380952381, "grad_norm": 0.026475511491298676, "learning_rate": 0.02203068509697914, "loss": 2.399467945098877, "step": 14300 }, { "epoch": 0.681047619047619, "grad_norm": 0.025802485644817352, "learning_rate": 0.022024109959602356, "loss": 2.437802791595459, "step": 14302 }, { "epoch": 0.6811428571428572, "grad_norm": 0.02623749151825905, "learning_rate": 0.02201753482222557, "loss": 2.457392930984497, "step": 14304 }, { "epoch": 0.6812380952380952, "grad_norm": 0.026623068377375603, "learning_rate": 0.022010957822203636, "loss": 2.402958393096924, "step": 14306 }, { "epoch": 0.6813333333333333, "grad_norm": 0.028010301291942596, "learning_rate": 0.022004384547472, "loss": 2.441749095916748, "step": 14308 }, { "epoch": 0.6814285714285714, "grad_norm": 0.029308924451470375, "learning_rate": 0.021997809410095215, "loss": 2.436034679412842, "step": 14310 }, { "epoch": 0.6815238095238095, "grad_norm": 0.026763517409563065, "learning_rate": 0.02199123241007328, "loss": 2.45927357673645, "step": 14312 }, { "epoch": 0.6816190476190476, "grad_norm": 0.031089089810848236, "learning_rate": 0.021984659135341644, "loss": 2.4555768966674805, "step": 14314 }, { "epoch": 0.6817142857142857, "grad_norm": 0.02898036316037178, "learning_rate": 0.02197808213531971, "loss": 2.4297237396240234, "step": 14316 }, { "epoch": 0.6818095238095238, "grad_norm": 0.02564515545964241, "learning_rate": 0.021971506997942924, "loss": 2.394746780395508, "step": 14318 }, { "epoch": 0.6819047619047619, "grad_norm": 0.02700468711555004, "learning_rate": 0.02196493186056614, "loss": 2.4197678565979004, "step": 14320 }, { "epoch": 0.682, "grad_norm": 0.02571718767285347, "learning_rate": 0.021958356723189354, "loss": 2.4189515113830566, "step": 14322 }, { "epoch": 0.6820952380952381, "grad_norm": 0.02590649574995041, "learning_rate": 0.02195178158581257, "loss": 2.4208896160125732, "step": 14324 }, { "epoch": 0.6821904761904762, "grad_norm": 0.02553033083677292, "learning_rate": 0.021945206448435783, "loss": 2.485605239868164, "step": 14326 }, { "epoch": 0.6822857142857143, "grad_norm": 0.0329815074801445, "learning_rate": 0.02193862944841385, "loss": 2.4067459106445312, "step": 14328 }, { "epoch": 0.6823809523809524, "grad_norm": 0.026898540556430817, "learning_rate": 0.021932056173682213, "loss": 2.4341189861297607, "step": 14330 }, { "epoch": 0.6824761904761905, "grad_norm": 0.027871474623680115, "learning_rate": 0.02192547917366028, "loss": 2.432192802429199, "step": 14332 }, { "epoch": 0.6825714285714286, "grad_norm": 0.026132985949516296, "learning_rate": 0.021918905898928642, "loss": 2.4395804405212402, "step": 14334 }, { "epoch": 0.6826666666666666, "grad_norm": 0.024958323687314987, "learning_rate": 0.021912328898906708, "loss": 2.409780979156494, "step": 14336 }, { "epoch": 0.6827619047619048, "grad_norm": 0.026757871732115746, "learning_rate": 0.021905753761529922, "loss": 2.473374843597412, "step": 14338 }, { "epoch": 0.6828571428571428, "grad_norm": 0.02584773488342762, "learning_rate": 0.021899178624153137, "loss": 2.4597673416137695, "step": 14340 }, { "epoch": 0.682952380952381, "grad_norm": 0.026523733511567116, "learning_rate": 0.021892603486776352, "loss": 2.416377544403076, "step": 14342 }, { "epoch": 0.683047619047619, "grad_norm": 0.027639586478471756, "learning_rate": 0.021886028349399567, "loss": 2.4659852981567383, "step": 14344 }, { "epoch": 0.6831428571428572, "grad_norm": 0.02840779349207878, "learning_rate": 0.02187945321202278, "loss": 2.4775590896606445, "step": 14346 }, { "epoch": 0.6832380952380952, "grad_norm": 0.028200587257742882, "learning_rate": 0.021872876212000847, "loss": 2.510634183883667, "step": 14348 }, { "epoch": 0.6833333333333333, "grad_norm": 0.03174632042646408, "learning_rate": 0.02186630293726921, "loss": 2.444667339324951, "step": 14350 }, { "epoch": 0.6834285714285714, "grad_norm": 0.025868484750390053, "learning_rate": 0.021859725937247276, "loss": 2.476513385772705, "step": 14352 }, { "epoch": 0.6835238095238095, "grad_norm": 0.026175998151302338, "learning_rate": 0.02185315079987049, "loss": 2.4638843536376953, "step": 14354 }, { "epoch": 0.6836190476190476, "grad_norm": 0.027063759043812752, "learning_rate": 0.021846575662493706, "loss": 2.4731035232543945, "step": 14356 }, { "epoch": 0.6837142857142857, "grad_norm": 0.025788689032197, "learning_rate": 0.02184000052511692, "loss": 2.510831356048584, "step": 14358 }, { "epoch": 0.6838095238095238, "grad_norm": 0.026682864874601364, "learning_rate": 0.021833425387740135, "loss": 2.4634671211242676, "step": 14360 }, { "epoch": 0.6839047619047619, "grad_norm": 0.026866525411605835, "learning_rate": 0.02182685025036335, "loss": 2.486124277114868, "step": 14362 }, { "epoch": 0.684, "grad_norm": 0.02617553249001503, "learning_rate": 0.021820273250341415, "loss": 2.4758143424987793, "step": 14364 }, { "epoch": 0.6840952380952381, "grad_norm": 0.026921017095446587, "learning_rate": 0.02181369997560978, "loss": 2.4772210121154785, "step": 14366 }, { "epoch": 0.6841904761904762, "grad_norm": 0.026493124663829803, "learning_rate": 0.021807122975587845, "loss": 2.5057992935180664, "step": 14368 }, { "epoch": 0.6842857142857143, "grad_norm": 0.0257171168923378, "learning_rate": 0.02180054783821106, "loss": 2.5110838413238525, "step": 14370 }, { "epoch": 0.6843809523809524, "grad_norm": 0.026317063719034195, "learning_rate": 0.021793972700834274, "loss": 2.477952003479004, "step": 14372 }, { "epoch": 0.6844761904761905, "grad_norm": 0.029917581006884575, "learning_rate": 0.02178739756345749, "loss": 2.4533047676086426, "step": 14374 }, { "epoch": 0.6845714285714286, "grad_norm": 0.02744380198419094, "learning_rate": 0.021780822426080704, "loss": 2.4842727184295654, "step": 14376 }, { "epoch": 0.6846666666666666, "grad_norm": 0.02651776559650898, "learning_rate": 0.02177424728870392, "loss": 2.4573609828948975, "step": 14378 }, { "epoch": 0.6847619047619048, "grad_norm": 0.027664082124829292, "learning_rate": 0.021767672151327133, "loss": 2.472454071044922, "step": 14380 }, { "epoch": 0.6848571428571428, "grad_norm": 0.025912364944815636, "learning_rate": 0.021761097013950348, "loss": 2.467020034790039, "step": 14382 }, { "epoch": 0.684952380952381, "grad_norm": 0.02736453153192997, "learning_rate": 0.021754520013928413, "loss": 2.5155277252197266, "step": 14384 }, { "epoch": 0.685047619047619, "grad_norm": 0.027186498045921326, "learning_rate": 0.021747946739196777, "loss": 2.485295057296753, "step": 14386 }, { "epoch": 0.6851428571428572, "grad_norm": 0.027442874386906624, "learning_rate": 0.021741369739174843, "loss": 2.4860663414001465, "step": 14388 }, { "epoch": 0.6852380952380952, "grad_norm": 0.02808147855103016, "learning_rate": 0.021734794601798058, "loss": 2.478114604949951, "step": 14390 }, { "epoch": 0.6853333333333333, "grad_norm": 0.03156333044171333, "learning_rate": 0.021728219464421272, "loss": 2.4982268810272217, "step": 14392 }, { "epoch": 0.6854285714285714, "grad_norm": 0.027102423831820488, "learning_rate": 0.021721644327044487, "loss": 2.4731314182281494, "step": 14394 }, { "epoch": 0.6855238095238095, "grad_norm": 0.027780501171946526, "learning_rate": 0.0217150691896677, "loss": 2.4887125492095947, "step": 14396 }, { "epoch": 0.6856190476190476, "grad_norm": 0.0322355218231678, "learning_rate": 0.021708494052290916, "loss": 2.5231738090515137, "step": 14398 }, { "epoch": 0.6857142857142857, "grad_norm": 0.025297246873378754, "learning_rate": 0.021701917052268982, "loss": 2.4938037395477295, "step": 14400 }, { "epoch": 0.6858095238095238, "grad_norm": 0.026755668222904205, "learning_rate": 0.021695343777537346, "loss": 2.491833209991455, "step": 14402 }, { "epoch": 0.6859047619047619, "grad_norm": 0.026388071477413177, "learning_rate": 0.02168876677751541, "loss": 2.4873998165130615, "step": 14404 }, { "epoch": 0.686, "grad_norm": 0.02588014304637909, "learning_rate": 0.021682191640138626, "loss": 2.5016121864318848, "step": 14406 }, { "epoch": 0.6860952380952381, "grad_norm": 0.030544063076376915, "learning_rate": 0.02167561650276184, "loss": 2.5170769691467285, "step": 14408 }, { "epoch": 0.6861904761904762, "grad_norm": 0.026882056146860123, "learning_rate": 0.021669041365385056, "loss": 2.5012431144714355, "step": 14410 }, { "epoch": 0.6862857142857143, "grad_norm": 0.025865042582154274, "learning_rate": 0.02166246622800827, "loss": 2.5026803016662598, "step": 14412 }, { "epoch": 0.6863809523809524, "grad_norm": 0.02553933672606945, "learning_rate": 0.021655891090631485, "loss": 2.507570743560791, "step": 14414 }, { "epoch": 0.6864761904761905, "grad_norm": 0.02699315920472145, "learning_rate": 0.0216493159532547, "loss": 2.5128509998321533, "step": 14416 }, { "epoch": 0.6865714285714286, "grad_norm": 0.027075055986642838, "learning_rate": 0.021642740815877914, "loss": 2.5267462730407715, "step": 14418 }, { "epoch": 0.6866666666666666, "grad_norm": 0.02633160538971424, "learning_rate": 0.02163616381585598, "loss": 2.5350351333618164, "step": 14420 }, { "epoch": 0.6867619047619048, "grad_norm": 0.026895737275481224, "learning_rate": 0.021629590541124344, "loss": 2.5764830112457275, "step": 14422 }, { "epoch": 0.6868571428571428, "grad_norm": 0.02620691806077957, "learning_rate": 0.02162301354110241, "loss": 2.5129332542419434, "step": 14424 }, { "epoch": 0.686952380952381, "grad_norm": 0.026188381016254425, "learning_rate": 0.021616438403725624, "loss": 2.509998321533203, "step": 14426 }, { "epoch": 0.687047619047619, "grad_norm": 0.027325386181473732, "learning_rate": 0.02160986326634884, "loss": 2.5380911827087402, "step": 14428 }, { "epoch": 0.6871428571428572, "grad_norm": 0.026047343388199806, "learning_rate": 0.021603288128972054, "loss": 2.5024850368499756, "step": 14430 }, { "epoch": 0.6872380952380952, "grad_norm": 0.02661171182990074, "learning_rate": 0.021596712991595268, "loss": 2.510890245437622, "step": 14432 }, { "epoch": 0.6873333333333334, "grad_norm": 0.0272163487970829, "learning_rate": 0.021590137854218483, "loss": 2.5208826065063477, "step": 14434 }, { "epoch": 0.6874285714285714, "grad_norm": 0.03078778274357319, "learning_rate": 0.02158356085419655, "loss": 2.485194206237793, "step": 14436 }, { "epoch": 0.6875238095238095, "grad_norm": 0.02616221457719803, "learning_rate": 0.021576987579464912, "loss": 2.5186991691589355, "step": 14438 }, { "epoch": 0.6876190476190476, "grad_norm": 0.025739990174770355, "learning_rate": 0.021570410579442978, "loss": 2.5133700370788574, "step": 14440 }, { "epoch": 0.6877142857142857, "grad_norm": 0.02650393545627594, "learning_rate": 0.021563835442066193, "loss": 2.4936816692352295, "step": 14442 }, { "epoch": 0.6878095238095238, "grad_norm": 0.028089942410588264, "learning_rate": 0.021557260304689407, "loss": 2.4941787719726562, "step": 14444 }, { "epoch": 0.6879047619047619, "grad_norm": 0.026486651971936226, "learning_rate": 0.021550685167312622, "loss": 2.4993410110473633, "step": 14446 }, { "epoch": 0.688, "grad_norm": 0.03068563900887966, "learning_rate": 0.021544110029935837, "loss": 2.5324153900146484, "step": 14448 }, { "epoch": 0.6880952380952381, "grad_norm": 0.026739070191979408, "learning_rate": 0.02153753489255905, "loss": 2.5231122970581055, "step": 14450 }, { "epoch": 0.6881904761904762, "grad_norm": 0.0267905592918396, "learning_rate": 0.021530959755182266, "loss": 2.528949737548828, "step": 14452 }, { "epoch": 0.6882857142857143, "grad_norm": 0.025917910039424896, "learning_rate": 0.02152438461780548, "loss": 2.5158581733703613, "step": 14454 }, { "epoch": 0.6883809523809524, "grad_norm": 0.024836445227265358, "learning_rate": 0.021517807617783546, "loss": 2.4806480407714844, "step": 14456 }, { "epoch": 0.6884761904761905, "grad_norm": 0.02783723548054695, "learning_rate": 0.02151123434305191, "loss": 2.529407024383545, "step": 14458 }, { "epoch": 0.6885714285714286, "grad_norm": 0.026116373017430305, "learning_rate": 0.021504657343029976, "loss": 2.503361463546753, "step": 14460 }, { "epoch": 0.6886666666666666, "grad_norm": 0.027094736695289612, "learning_rate": 0.02149808220565319, "loss": 2.5524842739105225, "step": 14462 }, { "epoch": 0.6887619047619048, "grad_norm": 0.02640475519001484, "learning_rate": 0.021491507068276405, "loss": 2.5467276573181152, "step": 14464 }, { "epoch": 0.6888571428571428, "grad_norm": 0.025560077279806137, "learning_rate": 0.02148493193089962, "loss": 2.52569317817688, "step": 14466 }, { "epoch": 0.688952380952381, "grad_norm": 0.02610349841415882, "learning_rate": 0.021478356793522835, "loss": 2.4870223999023438, "step": 14468 }, { "epoch": 0.689047619047619, "grad_norm": 0.026088973507285118, "learning_rate": 0.02147178165614605, "loss": 2.5371413230895996, "step": 14470 }, { "epoch": 0.6891428571428572, "grad_norm": 0.028223123401403427, "learning_rate": 0.021465204656124115, "loss": 2.498882293701172, "step": 14472 }, { "epoch": 0.6892380952380952, "grad_norm": 0.02862071432173252, "learning_rate": 0.02145863138139248, "loss": 2.5237646102905273, "step": 14474 }, { "epoch": 0.6893333333333334, "grad_norm": 0.02579565905034542, "learning_rate": 0.021452054381370544, "loss": 2.518064022064209, "step": 14476 }, { "epoch": 0.6894285714285714, "grad_norm": 0.02788950316607952, "learning_rate": 0.02144547924399376, "loss": 2.5035693645477295, "step": 14478 }, { "epoch": 0.6895238095238095, "grad_norm": 0.026234902441501617, "learning_rate": 0.021438904106616974, "loss": 2.522111177444458, "step": 14480 }, { "epoch": 0.6896190476190476, "grad_norm": 0.02667589671909809, "learning_rate": 0.02143232896924019, "loss": 2.4777445793151855, "step": 14482 }, { "epoch": 0.6897142857142857, "grad_norm": 0.02663242258131504, "learning_rate": 0.021425753831863403, "loss": 2.511826753616333, "step": 14484 }, { "epoch": 0.6898095238095238, "grad_norm": 0.02670823037624359, "learning_rate": 0.021419178694486618, "loss": 2.4945549964904785, "step": 14486 }, { "epoch": 0.6899047619047619, "grad_norm": 0.030884264037013054, "learning_rate": 0.021412601694464684, "loss": 2.5327811241149902, "step": 14488 }, { "epoch": 0.69, "grad_norm": 0.034166306257247925, "learning_rate": 0.021406028419733047, "loss": 2.4992527961730957, "step": 14490 }, { "epoch": 0.6900952380952381, "grad_norm": 0.02955305390059948, "learning_rate": 0.021399451419711113, "loss": 2.52358341217041, "step": 14492 }, { "epoch": 0.6901904761904762, "grad_norm": 0.02889241836965084, "learning_rate": 0.021392878144979477, "loss": 2.502763271331787, "step": 14494 }, { "epoch": 0.6902857142857143, "grad_norm": 0.02886061742901802, "learning_rate": 0.021386301144957542, "loss": 2.4821791648864746, "step": 14496 }, { "epoch": 0.6903809523809524, "grad_norm": 0.025672340765595436, "learning_rate": 0.021379726007580757, "loss": 2.5150623321533203, "step": 14498 }, { "epoch": 0.6904761904761905, "grad_norm": 0.02639782801270485, "learning_rate": 0.021373150870203972, "loss": 2.4921810626983643, "step": 14500 }, { "epoch": 0.6905714285714286, "grad_norm": 0.026425331830978394, "learning_rate": 0.021366575732827187, "loss": 2.4665417671203613, "step": 14502 }, { "epoch": 0.6906666666666667, "grad_norm": 0.0264181699603796, "learning_rate": 0.0213600005954504, "loss": 2.5102055072784424, "step": 14504 }, { "epoch": 0.6907619047619048, "grad_norm": 0.026200270280241966, "learning_rate": 0.021353425458073616, "loss": 2.5381531715393066, "step": 14506 }, { "epoch": 0.6908571428571428, "grad_norm": 0.0274477768689394, "learning_rate": 0.02134684845805168, "loss": 2.508014440536499, "step": 14508 }, { "epoch": 0.690952380952381, "grad_norm": 0.026608731597661972, "learning_rate": 0.021340275183320045, "loss": 2.538602352142334, "step": 14510 }, { "epoch": 0.691047619047619, "grad_norm": 0.02725883387029171, "learning_rate": 0.02133369818329811, "loss": 2.5074362754821777, "step": 14512 }, { "epoch": 0.6911428571428572, "grad_norm": 0.028683673590421677, "learning_rate": 0.021327123045921326, "loss": 2.5001912117004395, "step": 14514 }, { "epoch": 0.6912380952380952, "grad_norm": 0.026495464146137238, "learning_rate": 0.02132054790854454, "loss": 2.5024147033691406, "step": 14516 }, { "epoch": 0.6913333333333334, "grad_norm": 0.02787492796778679, "learning_rate": 0.021313972771167755, "loss": 2.5106048583984375, "step": 14518 }, { "epoch": 0.6914285714285714, "grad_norm": 0.026119371876120567, "learning_rate": 0.02130739763379097, "loss": 2.5173349380493164, "step": 14520 }, { "epoch": 0.6915238095238095, "grad_norm": 0.025103632360696793, "learning_rate": 0.021300822496414185, "loss": 2.5435872077941895, "step": 14522 }, { "epoch": 0.6916190476190476, "grad_norm": 0.025919586420059204, "learning_rate": 0.02129424549639225, "loss": 2.5197906494140625, "step": 14524 }, { "epoch": 0.6917142857142857, "grad_norm": 0.026389971375465393, "learning_rate": 0.021287672221660614, "loss": 2.5411760807037354, "step": 14526 }, { "epoch": 0.6918095238095238, "grad_norm": 0.02538253925740719, "learning_rate": 0.02128109522163868, "loss": 2.525963068008423, "step": 14528 }, { "epoch": 0.6919047619047619, "grad_norm": 0.026247067376971245, "learning_rate": 0.021274521946907043, "loss": 2.507479190826416, "step": 14530 }, { "epoch": 0.692, "grad_norm": 0.02692943997681141, "learning_rate": 0.02126794494688511, "loss": 2.5075511932373047, "step": 14532 }, { "epoch": 0.6920952380952381, "grad_norm": 0.028877347707748413, "learning_rate": 0.021261369809508324, "loss": 2.5383219718933105, "step": 14534 }, { "epoch": 0.6921904761904762, "grad_norm": 0.028957856819033623, "learning_rate": 0.02125479467213154, "loss": 2.5175061225891113, "step": 14536 }, { "epoch": 0.6922857142857143, "grad_norm": 0.026154063642024994, "learning_rate": 0.021248219534754753, "loss": 2.5040440559387207, "step": 14538 }, { "epoch": 0.6923809523809524, "grad_norm": 0.028972141444683075, "learning_rate": 0.021241644397377968, "loss": 2.5212810039520264, "step": 14540 }, { "epoch": 0.6924761904761905, "grad_norm": 0.029285503551363945, "learning_rate": 0.021235069260001183, "loss": 2.5647873878479004, "step": 14542 }, { "epoch": 0.6925714285714286, "grad_norm": 0.02671969123184681, "learning_rate": 0.021228492259979248, "loss": 2.5056960582733154, "step": 14544 }, { "epoch": 0.6926666666666667, "grad_norm": 0.027942335233092308, "learning_rate": 0.021221918985247612, "loss": 2.540281295776367, "step": 14546 }, { "epoch": 0.6927619047619048, "grad_norm": 0.025368256494402885, "learning_rate": 0.021215341985225677, "loss": 2.4900155067443848, "step": 14548 }, { "epoch": 0.6928571428571428, "grad_norm": 0.026230528950691223, "learning_rate": 0.021208766847848892, "loss": 2.524752616882324, "step": 14550 }, { "epoch": 0.692952380952381, "grad_norm": 0.025077572092413902, "learning_rate": 0.021202191710472107, "loss": 2.4947080612182617, "step": 14552 }, { "epoch": 0.693047619047619, "grad_norm": 0.026252945885062218, "learning_rate": 0.02119561657309532, "loss": 2.518186330795288, "step": 14554 }, { "epoch": 0.6931428571428572, "grad_norm": 0.02932296134531498, "learning_rate": 0.021189041435718536, "loss": 2.476065158843994, "step": 14556 }, { "epoch": 0.6932380952380952, "grad_norm": 0.02610969915986061, "learning_rate": 0.02118246629834175, "loss": 2.4834985733032227, "step": 14558 }, { "epoch": 0.6933333333333334, "grad_norm": 0.0275430828332901, "learning_rate": 0.021175889298319817, "loss": 2.4986472129821777, "step": 14560 }, { "epoch": 0.6934285714285714, "grad_norm": 0.026103859767317772, "learning_rate": 0.02116931602358818, "loss": 2.547746181488037, "step": 14562 }, { "epoch": 0.6935238095238095, "grad_norm": 0.0278952457010746, "learning_rate": 0.021162739023566246, "loss": 2.6021852493286133, "step": 14564 }, { "epoch": 0.6936190476190476, "grad_norm": 0.026737507432699203, "learning_rate": 0.02115616574883461, "loss": 2.5392885208129883, "step": 14566 }, { "epoch": 0.6937142857142857, "grad_norm": 0.02593279629945755, "learning_rate": 0.021149588748812675, "loss": 2.5339198112487793, "step": 14568 }, { "epoch": 0.6938095238095238, "grad_norm": 0.02997896820306778, "learning_rate": 0.02114301361143589, "loss": 2.528355598449707, "step": 14570 }, { "epoch": 0.6939047619047619, "grad_norm": 0.029007168486714363, "learning_rate": 0.021136438474059105, "loss": 2.5482685565948486, "step": 14572 }, { "epoch": 0.694, "grad_norm": 0.03490349277853966, "learning_rate": 0.02112986333668232, "loss": 2.54689359664917, "step": 14574 }, { "epoch": 0.6940952380952381, "grad_norm": 0.031666599214076996, "learning_rate": 0.021123288199305534, "loss": 2.5045738220214844, "step": 14576 }, { "epoch": 0.6941904761904761, "grad_norm": 0.029333319514989853, "learning_rate": 0.02111671306192875, "loss": 2.508307456970215, "step": 14578 }, { "epoch": 0.6942857142857143, "grad_norm": 0.03230652958154678, "learning_rate": 0.021110136061906815, "loss": 2.507152557373047, "step": 14580 }, { "epoch": 0.6943809523809524, "grad_norm": 0.02691986784338951, "learning_rate": 0.02110356278717518, "loss": 2.5135295391082764, "step": 14582 }, { "epoch": 0.6944761904761905, "grad_norm": 0.028594354167580605, "learning_rate": 0.021096985787153244, "loss": 2.5378832817077637, "step": 14584 }, { "epoch": 0.6945714285714286, "grad_norm": 0.02735300548374653, "learning_rate": 0.02109041064977646, "loss": 2.5253496170043945, "step": 14586 }, { "epoch": 0.6946666666666667, "grad_norm": 0.03185562789440155, "learning_rate": 0.021083835512399673, "loss": 2.5570826530456543, "step": 14588 }, { "epoch": 0.6947619047619048, "grad_norm": 0.026325583457946777, "learning_rate": 0.021077260375022888, "loss": 2.5240161418914795, "step": 14590 }, { "epoch": 0.6948571428571428, "grad_norm": 0.029934845864772797, "learning_rate": 0.021070685237646103, "loss": 2.5226263999938965, "step": 14592 }, { "epoch": 0.694952380952381, "grad_norm": 0.0273821409791708, "learning_rate": 0.021064110100269318, "loss": 2.511660575866699, "step": 14594 }, { "epoch": 0.695047619047619, "grad_norm": 0.02660478465259075, "learning_rate": 0.021057533100247383, "loss": 2.5356764793395996, "step": 14596 }, { "epoch": 0.6951428571428572, "grad_norm": 0.026538651436567307, "learning_rate": 0.021050959825515747, "loss": 2.5073893070220947, "step": 14598 }, { "epoch": 0.6952380952380952, "grad_norm": 0.025758637115359306, "learning_rate": 0.021044382825493813, "loss": 2.5069642066955566, "step": 14600 }, { "epoch": 0.6953333333333334, "grad_norm": 0.027144264429807663, "learning_rate": 0.021037807688117027, "loss": 2.5115089416503906, "step": 14602 }, { "epoch": 0.6954285714285714, "grad_norm": 0.025766650214791298, "learning_rate": 0.021031232550740242, "loss": 2.464810371398926, "step": 14604 }, { "epoch": 0.6955238095238095, "grad_norm": 0.02697635255753994, "learning_rate": 0.021024657413363457, "loss": 2.530963897705078, "step": 14606 }, { "epoch": 0.6956190476190476, "grad_norm": 0.025838395580649376, "learning_rate": 0.02101808227598667, "loss": 2.4971041679382324, "step": 14608 }, { "epoch": 0.6957142857142857, "grad_norm": 0.025739748030900955, "learning_rate": 0.021011507138609886, "loss": 2.5004348754882812, "step": 14610 }, { "epoch": 0.6958095238095238, "grad_norm": 0.027137575671076775, "learning_rate": 0.0210049320012331, "loss": 2.5263466835021973, "step": 14612 }, { "epoch": 0.6959047619047619, "grad_norm": 0.026896720752120018, "learning_rate": 0.020998356863856316, "loss": 2.492546558380127, "step": 14614 }, { "epoch": 0.696, "grad_norm": 0.026811281219124794, "learning_rate": 0.02099177986383438, "loss": 2.5527234077453613, "step": 14616 }, { "epoch": 0.6960952380952381, "grad_norm": 0.025771405547857285, "learning_rate": 0.020985206589102745, "loss": 2.516263723373413, "step": 14618 }, { "epoch": 0.6961904761904761, "grad_norm": 0.025339940562844276, "learning_rate": 0.02097862958908081, "loss": 2.522724151611328, "step": 14620 }, { "epoch": 0.6962857142857143, "grad_norm": 0.025828110054135323, "learning_rate": 0.020972054451704025, "loss": 2.4817776679992676, "step": 14622 }, { "epoch": 0.6963809523809524, "grad_norm": 0.028312403708696365, "learning_rate": 0.02096547931432724, "loss": 2.498358726501465, "step": 14624 }, { "epoch": 0.6964761904761905, "grad_norm": 0.027928493916988373, "learning_rate": 0.020958904176950455, "loss": 2.49080228805542, "step": 14626 }, { "epoch": 0.6965714285714286, "grad_norm": 0.026526130735874176, "learning_rate": 0.02095232903957367, "loss": 2.5001049041748047, "step": 14628 }, { "epoch": 0.6966666666666667, "grad_norm": 0.0261798407882452, "learning_rate": 0.020945753902196884, "loss": 2.5447192192077637, "step": 14630 }, { "epoch": 0.6967619047619048, "grad_norm": 0.026707995682954788, "learning_rate": 0.02093917690217495, "loss": 2.5177066326141357, "step": 14632 }, { "epoch": 0.6968571428571428, "grad_norm": 0.02530074119567871, "learning_rate": 0.020932603627443314, "loss": 2.4831314086914062, "step": 14634 }, { "epoch": 0.696952380952381, "grad_norm": 0.02631053701043129, "learning_rate": 0.02092602662742138, "loss": 2.513397216796875, "step": 14636 }, { "epoch": 0.697047619047619, "grad_norm": 0.025417771190404892, "learning_rate": 0.020919451490044594, "loss": 2.4435079097747803, "step": 14638 }, { "epoch": 0.6971428571428572, "grad_norm": 0.027668830007314682, "learning_rate": 0.02091287635266781, "loss": 2.5301003456115723, "step": 14640 }, { "epoch": 0.6972380952380952, "grad_norm": 0.027569200843572617, "learning_rate": 0.020906301215291023, "loss": 2.5159215927124023, "step": 14642 }, { "epoch": 0.6973333333333334, "grad_norm": 0.03418632969260216, "learning_rate": 0.020899726077914238, "loss": 2.5296850204467773, "step": 14644 }, { "epoch": 0.6974285714285714, "grad_norm": 0.02758018486201763, "learning_rate": 0.020893150940537453, "loss": 2.513206958770752, "step": 14646 }, { "epoch": 0.6975238095238095, "grad_norm": 0.026554817333817482, "learning_rate": 0.020886575803160667, "loss": 2.4885988235473633, "step": 14648 }, { "epoch": 0.6976190476190476, "grad_norm": 0.030617624521255493, "learning_rate": 0.020880000665783882, "loss": 2.491032361984253, "step": 14650 }, { "epoch": 0.6977142857142857, "grad_norm": 0.029850374907255173, "learning_rate": 0.020873423665761948, "loss": 2.4812893867492676, "step": 14652 }, { "epoch": 0.6978095238095238, "grad_norm": 0.026162857189774513, "learning_rate": 0.02086685039103031, "loss": 2.5203301906585693, "step": 14654 }, { "epoch": 0.6979047619047619, "grad_norm": 0.0289494339376688, "learning_rate": 0.020860273391008377, "loss": 2.4732978343963623, "step": 14656 }, { "epoch": 0.698, "grad_norm": 0.026381706818938255, "learning_rate": 0.020853698253631592, "loss": 2.4741268157958984, "step": 14658 }, { "epoch": 0.6980952380952381, "grad_norm": 0.026014214381575584, "learning_rate": 0.020847123116254807, "loss": 2.4805455207824707, "step": 14660 }, { "epoch": 0.6981904761904761, "grad_norm": 0.027585921809077263, "learning_rate": 0.02084054797887802, "loss": 2.4892024993896484, "step": 14662 }, { "epoch": 0.6982857142857143, "grad_norm": 0.03039766289293766, "learning_rate": 0.020833972841501236, "loss": 2.5107932090759277, "step": 14664 }, { "epoch": 0.6983809523809524, "grad_norm": 0.026342814788222313, "learning_rate": 0.02082739770412445, "loss": 2.4532217979431152, "step": 14666 }, { "epoch": 0.6984761904761905, "grad_norm": 0.025713760405778885, "learning_rate": 0.020820820704102516, "loss": 2.5040407180786133, "step": 14668 }, { "epoch": 0.6985714285714286, "grad_norm": 0.026002630591392517, "learning_rate": 0.02081424742937088, "loss": 2.4784140586853027, "step": 14670 }, { "epoch": 0.6986666666666667, "grad_norm": 0.025589942932128906, "learning_rate": 0.020807670429348946, "loss": 2.4511795043945312, "step": 14672 }, { "epoch": 0.6987619047619048, "grad_norm": 0.0255685243755579, "learning_rate": 0.02080109529197216, "loss": 2.4442567825317383, "step": 14674 }, { "epoch": 0.6988571428571428, "grad_norm": 0.025947902351617813, "learning_rate": 0.020794520154595375, "loss": 2.47658634185791, "step": 14676 }, { "epoch": 0.698952380952381, "grad_norm": 0.025507410988211632, "learning_rate": 0.02078794501721859, "loss": 2.4993395805358887, "step": 14678 }, { "epoch": 0.699047619047619, "grad_norm": 0.028277354314923286, "learning_rate": 0.020781369879841805, "loss": 2.521207809448242, "step": 14680 }, { "epoch": 0.6991428571428572, "grad_norm": 0.02533031813800335, "learning_rate": 0.02077479474246502, "loss": 2.4552698135375977, "step": 14682 }, { "epoch": 0.6992380952380952, "grad_norm": 0.029887719079852104, "learning_rate": 0.020768219605088234, "loss": 2.468930721282959, "step": 14684 }, { "epoch": 0.6993333333333334, "grad_norm": 0.025929300114512444, "learning_rate": 0.02076164446771145, "loss": 2.422050714492798, "step": 14686 }, { "epoch": 0.6994285714285714, "grad_norm": 0.025826334953308105, "learning_rate": 0.020755067467689514, "loss": 2.4445502758026123, "step": 14688 }, { "epoch": 0.6995238095238095, "grad_norm": 0.02789626456797123, "learning_rate": 0.020748494192957878, "loss": 2.5035085678100586, "step": 14690 }, { "epoch": 0.6996190476190476, "grad_norm": 0.02760200947523117, "learning_rate": 0.020741917192935944, "loss": 2.4989027976989746, "step": 14692 }, { "epoch": 0.6997142857142857, "grad_norm": 0.025426151230931282, "learning_rate": 0.02073534205555916, "loss": 2.472100257873535, "step": 14694 }, { "epoch": 0.6998095238095238, "grad_norm": 0.02559243142604828, "learning_rate": 0.020728766918182373, "loss": 2.4777169227600098, "step": 14696 }, { "epoch": 0.6999047619047619, "grad_norm": 0.02543334662914276, "learning_rate": 0.020722191780805588, "loss": 2.473095417022705, "step": 14698 }, { "epoch": 0.7, "grad_norm": 0.02707161009311676, "learning_rate": 0.020715616643428802, "loss": 2.447995662689209, "step": 14700 }, { "epoch": 0.7000952380952381, "grad_norm": 0.027848724275827408, "learning_rate": 0.020709041506052017, "loss": 2.4494733810424805, "step": 14702 }, { "epoch": 0.7001904761904761, "grad_norm": 0.027495967224240303, "learning_rate": 0.020702464506030083, "loss": 2.4636495113372803, "step": 14704 }, { "epoch": 0.7002857142857143, "grad_norm": 0.02661939337849617, "learning_rate": 0.020695891231298447, "loss": 2.4535083770751953, "step": 14706 }, { "epoch": 0.7003809523809523, "grad_norm": 0.026650341227650642, "learning_rate": 0.020689314231276512, "loss": 2.4385886192321777, "step": 14708 }, { "epoch": 0.7004761904761905, "grad_norm": 0.02617066539824009, "learning_rate": 0.020682739093899727, "loss": 2.4547529220581055, "step": 14710 }, { "epoch": 0.7005714285714286, "grad_norm": 0.031457770615816116, "learning_rate": 0.02067616395652294, "loss": 2.478400468826294, "step": 14712 }, { "epoch": 0.7006666666666667, "grad_norm": 0.02738858014345169, "learning_rate": 0.020669588819146156, "loss": 2.4944252967834473, "step": 14714 }, { "epoch": 0.7007619047619048, "grad_norm": 0.027891816571354866, "learning_rate": 0.02066301368176937, "loss": 2.468693256378174, "step": 14716 }, { "epoch": 0.7008571428571428, "grad_norm": 0.02525424398481846, "learning_rate": 0.020656438544392586, "loss": 2.4543843269348145, "step": 14718 }, { "epoch": 0.700952380952381, "grad_norm": 0.02597595565021038, "learning_rate": 0.0206498634070158, "loss": 2.4470298290252686, "step": 14720 }, { "epoch": 0.701047619047619, "grad_norm": 0.026174940168857574, "learning_rate": 0.020643288269639015, "loss": 2.4793872833251953, "step": 14722 }, { "epoch": 0.7011428571428572, "grad_norm": 0.02627810835838318, "learning_rate": 0.02063671313226223, "loss": 2.4696269035339355, "step": 14724 }, { "epoch": 0.7012380952380952, "grad_norm": 0.02623147703707218, "learning_rate": 0.020630137994885445, "loss": 2.458425998687744, "step": 14726 }, { "epoch": 0.7013333333333334, "grad_norm": 0.0252494178712368, "learning_rate": 0.02062356285750866, "loss": 2.495882987976074, "step": 14728 }, { "epoch": 0.7014285714285714, "grad_norm": 0.025533637031912804, "learning_rate": 0.020616985857486725, "loss": 2.432713031768799, "step": 14730 }, { "epoch": 0.7015238095238095, "grad_norm": 0.02481916919350624, "learning_rate": 0.02061041258275509, "loss": 2.446664333343506, "step": 14732 }, { "epoch": 0.7016190476190476, "grad_norm": 0.028590362519025803, "learning_rate": 0.020603835582733154, "loss": 2.474175453186035, "step": 14734 }, { "epoch": 0.7017142857142857, "grad_norm": 0.025844819843769073, "learning_rate": 0.02059726044535637, "loss": 2.4432129859924316, "step": 14736 }, { "epoch": 0.7018095238095238, "grad_norm": 0.026831544935703278, "learning_rate": 0.020590685307979584, "loss": 2.465724229812622, "step": 14738 }, { "epoch": 0.7019047619047619, "grad_norm": 0.025947503745555878, "learning_rate": 0.0205841101706028, "loss": 2.467989444732666, "step": 14740 }, { "epoch": 0.702, "grad_norm": 0.027383267879486084, "learning_rate": 0.020577535033226013, "loss": 2.498831033706665, "step": 14742 }, { "epoch": 0.7020952380952381, "grad_norm": 0.02696104161441326, "learning_rate": 0.020570959895849228, "loss": 2.4423651695251465, "step": 14744 }, { "epoch": 0.7021904761904761, "grad_norm": 0.025981826707720757, "learning_rate": 0.020564382895827293, "loss": 2.4443511962890625, "step": 14746 }, { "epoch": 0.7022857142857143, "grad_norm": 0.03268289938569069, "learning_rate": 0.020557809621095657, "loss": 2.426682949066162, "step": 14748 }, { "epoch": 0.7023809523809523, "grad_norm": 0.026901239529252052, "learning_rate": 0.020551232621073723, "loss": 2.48661470413208, "step": 14750 }, { "epoch": 0.7024761904761905, "grad_norm": 0.02659415639936924, "learning_rate": 0.020544657483696938, "loss": 2.457679033279419, "step": 14752 }, { "epoch": 0.7025714285714286, "grad_norm": 0.026021037250757217, "learning_rate": 0.020538082346320152, "loss": 2.4638123512268066, "step": 14754 }, { "epoch": 0.7026666666666667, "grad_norm": 0.02905193716287613, "learning_rate": 0.020531507208943367, "loss": 2.428633213043213, "step": 14756 }, { "epoch": 0.7027619047619048, "grad_norm": 0.029797388240695, "learning_rate": 0.02052493207156658, "loss": 2.481541633605957, "step": 14758 }, { "epoch": 0.7028571428571428, "grad_norm": 0.026687024161219597, "learning_rate": 0.020518356934189796, "loss": 2.4576292037963867, "step": 14760 }, { "epoch": 0.702952380952381, "grad_norm": 0.02729600854218006, "learning_rate": 0.02051178179681301, "loss": 2.4269909858703613, "step": 14762 }, { "epoch": 0.703047619047619, "grad_norm": 0.025835195556282997, "learning_rate": 0.020505206659436226, "loss": 2.4774136543273926, "step": 14764 }, { "epoch": 0.7031428571428572, "grad_norm": 0.02574213594198227, "learning_rate": 0.02049862965941429, "loss": 2.44734525680542, "step": 14766 }, { "epoch": 0.7032380952380952, "grad_norm": 0.025931892916560173, "learning_rate": 0.020492056384682655, "loss": 2.4263641834259033, "step": 14768 }, { "epoch": 0.7033333333333334, "grad_norm": 0.025308262556791306, "learning_rate": 0.02048547938466072, "loss": 2.505408525466919, "step": 14770 }, { "epoch": 0.7034285714285714, "grad_norm": 0.026783842593431473, "learning_rate": 0.020478904247283936, "loss": 2.447723627090454, "step": 14772 }, { "epoch": 0.7035238095238096, "grad_norm": 0.02563503384590149, "learning_rate": 0.02047232910990715, "loss": 2.438994884490967, "step": 14774 }, { "epoch": 0.7036190476190476, "grad_norm": 0.02660524845123291, "learning_rate": 0.020465753972530365, "loss": 2.4511632919311523, "step": 14776 }, { "epoch": 0.7037142857142857, "grad_norm": 0.02808217518031597, "learning_rate": 0.02045917883515358, "loss": 2.4449353218078613, "step": 14778 }, { "epoch": 0.7038095238095238, "grad_norm": 0.02827282063663006, "learning_rate": 0.020452603697776794, "loss": 2.395031452178955, "step": 14780 }, { "epoch": 0.7039047619047619, "grad_norm": 0.03262253850698471, "learning_rate": 0.02044602669775486, "loss": 2.440002918243408, "step": 14782 }, { "epoch": 0.704, "grad_norm": 0.03166159242391586, "learning_rate": 0.020439453423023224, "loss": 2.4259157180786133, "step": 14784 }, { "epoch": 0.7040952380952381, "grad_norm": 0.02597934380173683, "learning_rate": 0.02043287642300129, "loss": 2.4553470611572266, "step": 14786 }, { "epoch": 0.7041904761904761, "grad_norm": 0.026835324242711067, "learning_rate": 0.020426301285624504, "loss": 2.450976848602295, "step": 14788 }, { "epoch": 0.7042857142857143, "grad_norm": 0.027155041694641113, "learning_rate": 0.02041972614824772, "loss": 2.4217944145202637, "step": 14790 }, { "epoch": 0.7043809523809523, "grad_norm": 0.028210371732711792, "learning_rate": 0.020413151010870934, "loss": 2.440734386444092, "step": 14792 }, { "epoch": 0.7044761904761905, "grad_norm": 0.027099886909127235, "learning_rate": 0.020406575873494148, "loss": 2.45415997505188, "step": 14794 }, { "epoch": 0.7045714285714286, "grad_norm": 0.026945358142256737, "learning_rate": 0.020400000736117363, "loss": 2.4393014907836914, "step": 14796 }, { "epoch": 0.7046666666666667, "grad_norm": 0.028627930209040642, "learning_rate": 0.020393425598740578, "loss": 2.434840202331543, "step": 14798 }, { "epoch": 0.7047619047619048, "grad_norm": 0.02540714293718338, "learning_rate": 0.020386850461363792, "loss": 2.4150145053863525, "step": 14800 }, { "epoch": 0.7048571428571428, "grad_norm": 0.02633458934724331, "learning_rate": 0.020380273461341858, "loss": 2.4586877822875977, "step": 14802 }, { "epoch": 0.704952380952381, "grad_norm": 0.03218131884932518, "learning_rate": 0.020373700186610222, "loss": 2.4091782569885254, "step": 14804 }, { "epoch": 0.705047619047619, "grad_norm": 0.027163943275809288, "learning_rate": 0.020367123186588287, "loss": 2.4300336837768555, "step": 14806 }, { "epoch": 0.7051428571428572, "grad_norm": 0.025312574580311775, "learning_rate": 0.020360548049211502, "loss": 2.3841023445129395, "step": 14808 }, { "epoch": 0.7052380952380952, "grad_norm": 0.025460239499807358, "learning_rate": 0.020353972911834717, "loss": 2.412843704223633, "step": 14810 }, { "epoch": 0.7053333333333334, "grad_norm": 0.02500554732978344, "learning_rate": 0.02034739777445793, "loss": 2.433201789855957, "step": 14812 }, { "epoch": 0.7054285714285714, "grad_norm": 0.026306549087166786, "learning_rate": 0.020340822637081146, "loss": 2.4185237884521484, "step": 14814 }, { "epoch": 0.7055238095238096, "grad_norm": 0.02647777646780014, "learning_rate": 0.02033424749970436, "loss": 2.4215548038482666, "step": 14816 }, { "epoch": 0.7056190476190476, "grad_norm": 0.025681423023343086, "learning_rate": 0.020327670499682426, "loss": 2.440061569213867, "step": 14818 }, { "epoch": 0.7057142857142857, "grad_norm": 0.0266441497951746, "learning_rate": 0.02032109722495079, "loss": 2.449305534362793, "step": 14820 }, { "epoch": 0.7058095238095238, "grad_norm": 0.02470308728516102, "learning_rate": 0.020314520224928856, "loss": 2.446560859680176, "step": 14822 }, { "epoch": 0.7059047619047619, "grad_norm": 0.025740686804056168, "learning_rate": 0.02030794508755207, "loss": 2.4278671741485596, "step": 14824 }, { "epoch": 0.706, "grad_norm": 0.027313893660902977, "learning_rate": 0.020301369950175285, "loss": 2.415508270263672, "step": 14826 }, { "epoch": 0.7060952380952381, "grad_norm": 0.02591228298842907, "learning_rate": 0.0202947948127985, "loss": 2.397736072540283, "step": 14828 }, { "epoch": 0.7061904761904761, "grad_norm": 0.025931086391210556, "learning_rate": 0.020288219675421715, "loss": 2.428922653198242, "step": 14830 }, { "epoch": 0.7062857142857143, "grad_norm": 0.025482216849923134, "learning_rate": 0.02028164453804493, "loss": 2.393099308013916, "step": 14832 }, { "epoch": 0.7063809523809523, "grad_norm": 0.02576802857220173, "learning_rate": 0.020275067538022995, "loss": 2.4171557426452637, "step": 14834 }, { "epoch": 0.7064761904761905, "grad_norm": 0.02613390050828457, "learning_rate": 0.02026849426329136, "loss": 2.423222064971924, "step": 14836 }, { "epoch": 0.7065714285714285, "grad_norm": 0.029068078845739365, "learning_rate": 0.020261917263269424, "loss": 2.382845878601074, "step": 14838 }, { "epoch": 0.7066666666666667, "grad_norm": 0.025449445471167564, "learning_rate": 0.02025534398853779, "loss": 2.4598746299743652, "step": 14840 }, { "epoch": 0.7067619047619048, "grad_norm": 0.026635274291038513, "learning_rate": 0.020248766988515854, "loss": 2.3971073627471924, "step": 14842 }, { "epoch": 0.7068571428571429, "grad_norm": 0.025918681174516678, "learning_rate": 0.02024219185113907, "loss": 2.423346519470215, "step": 14844 }, { "epoch": 0.706952380952381, "grad_norm": 0.026046114042401314, "learning_rate": 0.020235616713762283, "loss": 2.3658883571624756, "step": 14846 }, { "epoch": 0.707047619047619, "grad_norm": 0.02893313765525818, "learning_rate": 0.020229041576385498, "loss": 2.413499116897583, "step": 14848 }, { "epoch": 0.7071428571428572, "grad_norm": 0.028921116143465042, "learning_rate": 0.020222466439008713, "loss": 2.4388222694396973, "step": 14850 }, { "epoch": 0.7072380952380952, "grad_norm": 0.027798078954219818, "learning_rate": 0.020215891301631927, "loss": 2.3828115463256836, "step": 14852 }, { "epoch": 0.7073333333333334, "grad_norm": 0.026878971606492996, "learning_rate": 0.020209314301609993, "loss": 2.443676710128784, "step": 14854 }, { "epoch": 0.7074285714285714, "grad_norm": 0.026369938626885414, "learning_rate": 0.020202741026878357, "loss": 2.4068403244018555, "step": 14856 }, { "epoch": 0.7075238095238096, "grad_norm": 0.027162546291947365, "learning_rate": 0.020196164026856422, "loss": 2.3921568393707275, "step": 14858 }, { "epoch": 0.7076190476190476, "grad_norm": 0.026257693767547607, "learning_rate": 0.020189588889479637, "loss": 2.388038158416748, "step": 14860 }, { "epoch": 0.7077142857142857, "grad_norm": 0.02788669429719448, "learning_rate": 0.020183013752102852, "loss": 2.447648048400879, "step": 14862 }, { "epoch": 0.7078095238095238, "grad_norm": 0.025882042944431305, "learning_rate": 0.020176438614726067, "loss": 2.3850831985473633, "step": 14864 }, { "epoch": 0.7079047619047619, "grad_norm": 0.031153997406363487, "learning_rate": 0.02016986347734928, "loss": 2.421598196029663, "step": 14866 }, { "epoch": 0.708, "grad_norm": 0.026668796315789223, "learning_rate": 0.020163288339972496, "loss": 2.370969295501709, "step": 14868 }, { "epoch": 0.7080952380952381, "grad_norm": 0.025908848270773888, "learning_rate": 0.02015671133995056, "loss": 2.426736354827881, "step": 14870 }, { "epoch": 0.7081904761904761, "grad_norm": 0.027479134500026703, "learning_rate": 0.020150138065218925, "loss": 2.4187445640563965, "step": 14872 }, { "epoch": 0.7082857142857143, "grad_norm": 0.027541236951947212, "learning_rate": 0.02014356106519699, "loss": 2.407979965209961, "step": 14874 }, { "epoch": 0.7083809523809523, "grad_norm": 0.02585376240313053, "learning_rate": 0.020136987790465355, "loss": 2.437450885772705, "step": 14876 }, { "epoch": 0.7084761904761905, "grad_norm": 0.026608433574438095, "learning_rate": 0.02013041079044342, "loss": 2.425913095474243, "step": 14878 }, { "epoch": 0.7085714285714285, "grad_norm": 0.028854571282863617, "learning_rate": 0.020123835653066635, "loss": 2.4328198432922363, "step": 14880 }, { "epoch": 0.7086666666666667, "grad_norm": 0.02642941288650036, "learning_rate": 0.02011726051568985, "loss": 2.4273645877838135, "step": 14882 }, { "epoch": 0.7087619047619048, "grad_norm": 0.026003146544098854, "learning_rate": 0.020110685378313065, "loss": 2.412534713745117, "step": 14884 }, { "epoch": 0.7088571428571429, "grad_norm": 0.026492854580283165, "learning_rate": 0.02010411024093628, "loss": 2.390758991241455, "step": 14886 }, { "epoch": 0.708952380952381, "grad_norm": 0.026660682633519173, "learning_rate": 0.020097535103559494, "loss": 2.44051194190979, "step": 14888 }, { "epoch": 0.709047619047619, "grad_norm": 0.026220116764307022, "learning_rate": 0.02009095810353756, "loss": 2.441074848175049, "step": 14890 }, { "epoch": 0.7091428571428572, "grad_norm": 0.025580501183867455, "learning_rate": 0.020084384828805923, "loss": 2.3902745246887207, "step": 14892 }, { "epoch": 0.7092380952380952, "grad_norm": 0.026442281901836395, "learning_rate": 0.02007780782878399, "loss": 2.3965463638305664, "step": 14894 }, { "epoch": 0.7093333333333334, "grad_norm": 0.02684585377573967, "learning_rate": 0.020071232691407204, "loss": 2.391150712966919, "step": 14896 }, { "epoch": 0.7094285714285714, "grad_norm": 0.025941668078303337, "learning_rate": 0.02006465755403042, "loss": 2.432293653488159, "step": 14898 }, { "epoch": 0.7095238095238096, "grad_norm": 0.024845406413078308, "learning_rate": 0.020058082416653633, "loss": 2.3958823680877686, "step": 14900 }, { "epoch": 0.7096190476190476, "grad_norm": 0.02674299292266369, "learning_rate": 0.020051507279276848, "loss": 2.383371353149414, "step": 14902 }, { "epoch": 0.7097142857142857, "grad_norm": 0.02570422925055027, "learning_rate": 0.020044932141900063, "loss": 2.376857280731201, "step": 14904 }, { "epoch": 0.7098095238095238, "grad_norm": 0.028513401746749878, "learning_rate": 0.020038355141878128, "loss": 2.4147846698760986, "step": 14906 }, { "epoch": 0.7099047619047619, "grad_norm": 0.027569271624088287, "learning_rate": 0.020031781867146492, "loss": 2.388996124267578, "step": 14908 }, { "epoch": 0.71, "grad_norm": 0.027773048728704453, "learning_rate": 0.020025204867124557, "loss": 2.418844699859619, "step": 14910 }, { "epoch": 0.7100952380952381, "grad_norm": 0.02612140029668808, "learning_rate": 0.02001863159239292, "loss": 2.371701717376709, "step": 14912 }, { "epoch": 0.7101904761904761, "grad_norm": 0.028727296739816666, "learning_rate": 0.020012054592370987, "loss": 2.40533447265625, "step": 14914 }, { "epoch": 0.7102857142857143, "grad_norm": 0.02749863639473915, "learning_rate": 0.0200054794549942, "loss": 2.356374979019165, "step": 14916 }, { "epoch": 0.7103809523809523, "grad_norm": 0.0304914191365242, "learning_rate": 0.019998904317617416, "loss": 2.376025676727295, "step": 14918 }, { "epoch": 0.7104761904761905, "grad_norm": 0.02612967975437641, "learning_rate": 0.01999232918024063, "loss": 2.379204750061035, "step": 14920 }, { "epoch": 0.7105714285714285, "grad_norm": 0.02999177575111389, "learning_rate": 0.019985754042863846, "loss": 2.34993052482605, "step": 14922 }, { "epoch": 0.7106666666666667, "grad_norm": 0.029144538566470146, "learning_rate": 0.01997917890548706, "loss": 2.361457586288452, "step": 14924 }, { "epoch": 0.7107619047619048, "grad_norm": 0.026372693479061127, "learning_rate": 0.019972601905465126, "loss": 2.384807586669922, "step": 14926 }, { "epoch": 0.7108571428571429, "grad_norm": 0.02558102272450924, "learning_rate": 0.01996602863073349, "loss": 2.402895212173462, "step": 14928 }, { "epoch": 0.710952380952381, "grad_norm": 0.026863249018788338, "learning_rate": 0.019959451630711555, "loss": 2.366818428039551, "step": 14930 }, { "epoch": 0.711047619047619, "grad_norm": 0.033670712262392044, "learning_rate": 0.01995287649333477, "loss": 2.361891746520996, "step": 14932 }, { "epoch": 0.7111428571428572, "grad_norm": 0.02529686503112316, "learning_rate": 0.019946301355957985, "loss": 2.3881444931030273, "step": 14934 }, { "epoch": 0.7112380952380952, "grad_norm": 0.027151556685566902, "learning_rate": 0.0199397262185812, "loss": 2.352567434310913, "step": 14936 }, { "epoch": 0.7113333333333334, "grad_norm": 0.02554609254002571, "learning_rate": 0.019933151081204414, "loss": 2.371734142303467, "step": 14938 }, { "epoch": 0.7114285714285714, "grad_norm": 0.026667293161153793, "learning_rate": 0.01992657594382763, "loss": 2.3808164596557617, "step": 14940 }, { "epoch": 0.7115238095238096, "grad_norm": 0.028731796890497208, "learning_rate": 0.019919998943805695, "loss": 2.3731467723846436, "step": 14942 }, { "epoch": 0.7116190476190476, "grad_norm": 0.027497991919517517, "learning_rate": 0.01991342566907406, "loss": 2.400629997253418, "step": 14944 }, { "epoch": 0.7117142857142857, "grad_norm": 0.026669440791010857, "learning_rate": 0.019906848669052124, "loss": 2.386054515838623, "step": 14946 }, { "epoch": 0.7118095238095238, "grad_norm": 0.025070516392588615, "learning_rate": 0.01990027353167534, "loss": 2.397226333618164, "step": 14948 }, { "epoch": 0.7119047619047619, "grad_norm": 0.024595128372311592, "learning_rate": 0.019893698394298553, "loss": 2.4078052043914795, "step": 14950 }, { "epoch": 0.712, "grad_norm": 0.02522423304617405, "learning_rate": 0.019887123256921768, "loss": 2.341128349304199, "step": 14952 }, { "epoch": 0.7120952380952381, "grad_norm": 0.025554874911904335, "learning_rate": 0.019880548119544983, "loss": 2.3977179527282715, "step": 14954 }, { "epoch": 0.7121904761904762, "grad_norm": 0.025801749899983406, "learning_rate": 0.019873972982168198, "loss": 2.381911039352417, "step": 14956 }, { "epoch": 0.7122857142857143, "grad_norm": 0.025449909269809723, "learning_rate": 0.019867397844791412, "loss": 2.3392765522003174, "step": 14958 }, { "epoch": 0.7123809523809523, "grad_norm": 0.025686001405119896, "learning_rate": 0.019860822707414627, "loss": 2.3874855041503906, "step": 14960 }, { "epoch": 0.7124761904761905, "grad_norm": 0.02633265033364296, "learning_rate": 0.019854245707392693, "loss": 2.416311740875244, "step": 14962 }, { "epoch": 0.7125714285714285, "grad_norm": 0.027425741776823997, "learning_rate": 0.019847672432661057, "loss": 2.370887279510498, "step": 14964 }, { "epoch": 0.7126666666666667, "grad_norm": 0.0275392048060894, "learning_rate": 0.019841095432639122, "loss": 2.369263172149658, "step": 14966 }, { "epoch": 0.7127619047619047, "grad_norm": 0.02471034973859787, "learning_rate": 0.019834520295262337, "loss": 2.397378444671631, "step": 14968 }, { "epoch": 0.7128571428571429, "grad_norm": 0.025188611820340157, "learning_rate": 0.01982794515788555, "loss": 2.387019634246826, "step": 14970 }, { "epoch": 0.712952380952381, "grad_norm": 0.024481747299432755, "learning_rate": 0.019821370020508766, "loss": 2.353825569152832, "step": 14972 }, { "epoch": 0.713047619047619, "grad_norm": 0.02652350440621376, "learning_rate": 0.01981479488313198, "loss": 2.3326785564422607, "step": 14974 }, { "epoch": 0.7131428571428572, "grad_norm": 0.025368139147758484, "learning_rate": 0.019808219745755196, "loss": 2.351590633392334, "step": 14976 }, { "epoch": 0.7132380952380952, "grad_norm": 0.025594346225261688, "learning_rate": 0.01980164274573326, "loss": 2.4198453426361084, "step": 14978 }, { "epoch": 0.7133333333333334, "grad_norm": 0.028411658480763435, "learning_rate": 0.019795069471001625, "loss": 2.369096279144287, "step": 14980 }, { "epoch": 0.7134285714285714, "grad_norm": 0.026550300419330597, "learning_rate": 0.01978849247097969, "loss": 2.3685526847839355, "step": 14982 }, { "epoch": 0.7135238095238096, "grad_norm": 0.02620614692568779, "learning_rate": 0.019781917333602905, "loss": 2.373196601867676, "step": 14984 }, { "epoch": 0.7136190476190476, "grad_norm": 0.025834938511252403, "learning_rate": 0.01977534219622612, "loss": 2.357588768005371, "step": 14986 }, { "epoch": 0.7137142857142857, "grad_norm": 0.026975683867931366, "learning_rate": 0.019768767058849335, "loss": 2.349461078643799, "step": 14988 }, { "epoch": 0.7138095238095238, "grad_norm": 0.028899747878313065, "learning_rate": 0.01976219192147255, "loss": 2.315664768218994, "step": 14990 }, { "epoch": 0.7139047619047619, "grad_norm": 0.02764800935983658, "learning_rate": 0.019755616784095764, "loss": 2.3742799758911133, "step": 14992 }, { "epoch": 0.714, "grad_norm": 0.026885496452450752, "learning_rate": 0.01974904164671898, "loss": 2.364410161972046, "step": 14994 }, { "epoch": 0.7140952380952381, "grad_norm": 0.028645915910601616, "learning_rate": 0.019742466509342194, "loss": 2.3040106296539307, "step": 14996 }, { "epoch": 0.7141904761904762, "grad_norm": 0.02804999053478241, "learning_rate": 0.01973588950932026, "loss": 2.3601126670837402, "step": 14998 }, { "epoch": 0.7142857142857143, "grad_norm": 0.025633441284298897, "learning_rate": 0.019729316234588623, "loss": 2.340916633605957, "step": 15000 }, { "epoch": 0.7143809523809523, "grad_norm": 0.02800317481160164, "learning_rate": 0.01972273923456669, "loss": 2.3742449283599854, "step": 15002 }, { "epoch": 0.7144761904761905, "grad_norm": 0.027800509706139565, "learning_rate": 0.019716164097189903, "loss": 2.375584602355957, "step": 15004 }, { "epoch": 0.7145714285714285, "grad_norm": 0.02720266580581665, "learning_rate": 0.019709588959813118, "loss": 2.4019436836242676, "step": 15006 }, { "epoch": 0.7146666666666667, "grad_norm": 0.029274363070726395, "learning_rate": 0.019703013822436333, "loss": 2.380859851837158, "step": 15008 }, { "epoch": 0.7147619047619047, "grad_norm": 0.02899310737848282, "learning_rate": 0.019696438685059547, "loss": 2.337690830230713, "step": 15010 }, { "epoch": 0.7148571428571429, "grad_norm": 0.029514487832784653, "learning_rate": 0.019689863547682762, "loss": 2.4036459922790527, "step": 15012 }, { "epoch": 0.714952380952381, "grad_norm": 0.027826694771647453, "learning_rate": 0.019683286547660828, "loss": 2.3959908485412598, "step": 15014 }, { "epoch": 0.715047619047619, "grad_norm": 0.027102481573820114, "learning_rate": 0.01967671327292919, "loss": 2.3558616638183594, "step": 15016 }, { "epoch": 0.7151428571428572, "grad_norm": 0.02712608501315117, "learning_rate": 0.019670136272907257, "loss": 2.3816885948181152, "step": 15018 }, { "epoch": 0.7152380952380952, "grad_norm": 0.02554384432733059, "learning_rate": 0.019663561135530472, "loss": 2.369047164916992, "step": 15020 }, { "epoch": 0.7153333333333334, "grad_norm": 0.02522895485162735, "learning_rate": 0.019656985998153687, "loss": 2.361952304840088, "step": 15022 }, { "epoch": 0.7154285714285714, "grad_norm": 0.026136798784136772, "learning_rate": 0.0196504108607769, "loss": 2.369077444076538, "step": 15024 }, { "epoch": 0.7155238095238096, "grad_norm": 0.025469938293099403, "learning_rate": 0.019643835723400116, "loss": 2.3305726051330566, "step": 15026 }, { "epoch": 0.7156190476190476, "grad_norm": 0.02517659217119217, "learning_rate": 0.01963726058602333, "loss": 2.2993264198303223, "step": 15028 }, { "epoch": 0.7157142857142857, "grad_norm": 0.024530239403247833, "learning_rate": 0.019630685448646545, "loss": 2.3427467346191406, "step": 15030 }, { "epoch": 0.7158095238095238, "grad_norm": 0.026664065197110176, "learning_rate": 0.01962411031126976, "loss": 2.3880913257598877, "step": 15032 }, { "epoch": 0.7159047619047619, "grad_norm": 0.025874387472867966, "learning_rate": 0.019617533311247826, "loss": 2.3666815757751465, "step": 15034 }, { "epoch": 0.716, "grad_norm": 0.02533714845776558, "learning_rate": 0.01961096003651619, "loss": 2.3821568489074707, "step": 15036 }, { "epoch": 0.7160952380952381, "grad_norm": 0.025477126240730286, "learning_rate": 0.019604383036494255, "loss": 2.3420257568359375, "step": 15038 }, { "epoch": 0.7161904761904762, "grad_norm": 0.025824973359704018, "learning_rate": 0.01959780789911747, "loss": 2.3465864658355713, "step": 15040 }, { "epoch": 0.7162857142857143, "grad_norm": 0.025827759876847267, "learning_rate": 0.019591232761740685, "loss": 2.3493459224700928, "step": 15042 }, { "epoch": 0.7163809523809523, "grad_norm": 0.026343556120991707, "learning_rate": 0.0195846576243639, "loss": 2.390183687210083, "step": 15044 }, { "epoch": 0.7164761904761905, "grad_norm": 0.026261623948812485, "learning_rate": 0.019578082486987114, "loss": 2.338191509246826, "step": 15046 }, { "epoch": 0.7165714285714285, "grad_norm": 0.025530602782964706, "learning_rate": 0.01957150734961033, "loss": 2.357668876647949, "step": 15048 }, { "epoch": 0.7166666666666667, "grad_norm": 0.02969994768500328, "learning_rate": 0.019564930349588394, "loss": 2.3351666927337646, "step": 15050 }, { "epoch": 0.7167619047619047, "grad_norm": 0.026466840878129005, "learning_rate": 0.019558357074856758, "loss": 2.381925344467163, "step": 15052 }, { "epoch": 0.7168571428571429, "grad_norm": 0.02657860331237316, "learning_rate": 0.019551780074834824, "loss": 2.402562141418457, "step": 15054 }, { "epoch": 0.716952380952381, "grad_norm": 0.02918262593448162, "learning_rate": 0.01954520493745804, "loss": 2.3778810501098633, "step": 15056 }, { "epoch": 0.717047619047619, "grad_norm": 0.02623538300395012, "learning_rate": 0.019538629800081253, "loss": 2.3486320972442627, "step": 15058 }, { "epoch": 0.7171428571428572, "grad_norm": 0.025874536484479904, "learning_rate": 0.019532054662704468, "loss": 2.3394083976745605, "step": 15060 }, { "epoch": 0.7172380952380952, "grad_norm": 0.02623477391898632, "learning_rate": 0.019525479525327682, "loss": 2.366846799850464, "step": 15062 }, { "epoch": 0.7173333333333334, "grad_norm": 0.027533384039998055, "learning_rate": 0.019518904387950897, "loss": 2.366143226623535, "step": 15064 }, { "epoch": 0.7174285714285714, "grad_norm": 0.03212916478514671, "learning_rate": 0.019512327387928963, "loss": 2.297041654586792, "step": 15066 }, { "epoch": 0.7175238095238096, "grad_norm": 0.025744281709194183, "learning_rate": 0.019505754113197327, "loss": 2.3422083854675293, "step": 15068 }, { "epoch": 0.7176190476190476, "grad_norm": 0.025394855067133904, "learning_rate": 0.019499177113175392, "loss": 2.363295555114746, "step": 15070 }, { "epoch": 0.7177142857142857, "grad_norm": 0.027946067973971367, "learning_rate": 0.019492603838443756, "loss": 2.3629074096679688, "step": 15072 }, { "epoch": 0.7178095238095238, "grad_norm": 0.025905989110469818, "learning_rate": 0.01948602683842182, "loss": 2.4174933433532715, "step": 15074 }, { "epoch": 0.7179047619047619, "grad_norm": 0.025882558897137642, "learning_rate": 0.019479451701045036, "loss": 2.362771987915039, "step": 15076 }, { "epoch": 0.718, "grad_norm": 0.027264676988124847, "learning_rate": 0.01947287656366825, "loss": 2.3604178428649902, "step": 15078 }, { "epoch": 0.7180952380952381, "grad_norm": 0.025587594136595726, "learning_rate": 0.019466301426291466, "loss": 2.3631155490875244, "step": 15080 }, { "epoch": 0.7181904761904762, "grad_norm": 0.03127032145857811, "learning_rate": 0.01945972628891468, "loss": 2.3598601818084717, "step": 15082 }, { "epoch": 0.7182857142857143, "grad_norm": 0.03245281055569649, "learning_rate": 0.019453151151537895, "loss": 2.3755760192871094, "step": 15084 }, { "epoch": 0.7183809523809523, "grad_norm": 0.02561723254621029, "learning_rate": 0.01944657415151596, "loss": 2.3582077026367188, "step": 15086 }, { "epoch": 0.7184761904761905, "grad_norm": 0.027132652699947357, "learning_rate": 0.019440000876784325, "loss": 2.3988380432128906, "step": 15088 }, { "epoch": 0.7185714285714285, "grad_norm": 0.025796808302402496, "learning_rate": 0.01943342387676239, "loss": 2.4079766273498535, "step": 15090 }, { "epoch": 0.7186666666666667, "grad_norm": 0.02662590891122818, "learning_rate": 0.019426848739385605, "loss": 2.3486552238464355, "step": 15092 }, { "epoch": 0.7187619047619047, "grad_norm": 0.025438962504267693, "learning_rate": 0.01942027360200882, "loss": 2.3575451374053955, "step": 15094 }, { "epoch": 0.7188571428571429, "grad_norm": 0.026874015107750893, "learning_rate": 0.019413698464632034, "loss": 2.3410110473632812, "step": 15096 }, { "epoch": 0.7189523809523809, "grad_norm": 0.028343312442302704, "learning_rate": 0.01940712332725525, "loss": 2.313406229019165, "step": 15098 }, { "epoch": 0.719047619047619, "grad_norm": 0.026611439883708954, "learning_rate": 0.019400548189878464, "loss": 2.353070020675659, "step": 15100 }, { "epoch": 0.7191428571428572, "grad_norm": 0.02587355673313141, "learning_rate": 0.01939397118985653, "loss": 2.328432321548462, "step": 15102 }, { "epoch": 0.7192380952380952, "grad_norm": 0.02696993574500084, "learning_rate": 0.019387397915124893, "loss": 2.3398475646972656, "step": 15104 }, { "epoch": 0.7193333333333334, "grad_norm": 0.025522474199533463, "learning_rate": 0.01938082091510296, "loss": 2.3886914253234863, "step": 15106 }, { "epoch": 0.7194285714285714, "grad_norm": 0.027092069387435913, "learning_rate": 0.019374247640371323, "loss": 2.3856375217437744, "step": 15108 }, { "epoch": 0.7195238095238096, "grad_norm": 0.02791188657283783, "learning_rate": 0.019367670640349388, "loss": 2.388169288635254, "step": 15110 }, { "epoch": 0.7196190476190476, "grad_norm": 0.026186030358076096, "learning_rate": 0.019361095502972603, "loss": 2.3651366233825684, "step": 15112 }, { "epoch": 0.7197142857142858, "grad_norm": 0.026590384542942047, "learning_rate": 0.019354520365595818, "loss": 2.3676371574401855, "step": 15114 }, { "epoch": 0.7198095238095238, "grad_norm": 0.026089467108249664, "learning_rate": 0.019347945228219032, "loss": 2.411494731903076, "step": 15116 }, { "epoch": 0.7199047619047619, "grad_norm": 0.02560073882341385, "learning_rate": 0.019341370090842247, "loss": 2.386552333831787, "step": 15118 }, { "epoch": 0.72, "grad_norm": 0.02677053026854992, "learning_rate": 0.01933479495346546, "loss": 2.3700127601623535, "step": 15120 }, { "epoch": 0.7200952380952381, "grad_norm": 0.02518317475914955, "learning_rate": 0.019328219816088676, "loss": 2.381269931793213, "step": 15122 }, { "epoch": 0.7201904761904762, "grad_norm": 0.027076879516243935, "learning_rate": 0.01932164467871189, "loss": 2.3995347023010254, "step": 15124 }, { "epoch": 0.7202857142857143, "grad_norm": 0.027925478294491768, "learning_rate": 0.019315069541335106, "loss": 2.385711669921875, "step": 15126 }, { "epoch": 0.7203809523809523, "grad_norm": 0.026285843923687935, "learning_rate": 0.01930849254131317, "loss": 2.3702797889709473, "step": 15128 }, { "epoch": 0.7204761904761905, "grad_norm": 0.02596811018884182, "learning_rate": 0.019301919266581535, "loss": 2.323136329650879, "step": 15130 }, { "epoch": 0.7205714285714285, "grad_norm": 0.026843121275305748, "learning_rate": 0.0192953422665596, "loss": 2.371209144592285, "step": 15132 }, { "epoch": 0.7206666666666667, "grad_norm": 0.025846078991889954, "learning_rate": 0.019288767129182816, "loss": 2.3854970932006836, "step": 15134 }, { "epoch": 0.7207619047619047, "grad_norm": 0.02617582306265831, "learning_rate": 0.01928219199180603, "loss": 2.4090566635131836, "step": 15136 }, { "epoch": 0.7208571428571429, "grad_norm": 0.025867028161883354, "learning_rate": 0.019275616854429245, "loss": 2.3554186820983887, "step": 15138 }, { "epoch": 0.7209523809523809, "grad_norm": 0.027322279289364815, "learning_rate": 0.01926904171705246, "loss": 2.3527023792266846, "step": 15140 }, { "epoch": 0.721047619047619, "grad_norm": 0.025838598608970642, "learning_rate": 0.019262466579675674, "loss": 2.3722236156463623, "step": 15142 }, { "epoch": 0.7211428571428572, "grad_norm": 0.025581803172826767, "learning_rate": 0.01925589144229889, "loss": 2.368626117706299, "step": 15144 }, { "epoch": 0.7212380952380952, "grad_norm": 0.025134757161140442, "learning_rate": 0.019249316304922104, "loss": 2.3542633056640625, "step": 15146 }, { "epoch": 0.7213333333333334, "grad_norm": 0.026113692671060562, "learning_rate": 0.01924273930490017, "loss": 2.385822296142578, "step": 15148 }, { "epoch": 0.7214285714285714, "grad_norm": 0.026744598522782326, "learning_rate": 0.019236166030168533, "loss": 2.3841559886932373, "step": 15150 }, { "epoch": 0.7215238095238096, "grad_norm": 0.025854814797639847, "learning_rate": 0.0192295890301466, "loss": 2.436155319213867, "step": 15152 }, { "epoch": 0.7216190476190476, "grad_norm": 0.02726590633392334, "learning_rate": 0.019223013892769814, "loss": 2.3761343955993652, "step": 15154 }, { "epoch": 0.7217142857142858, "grad_norm": 0.026066027581691742, "learning_rate": 0.019216438755393028, "loss": 2.3527603149414062, "step": 15156 }, { "epoch": 0.7218095238095238, "grad_norm": 0.025994453579187393, "learning_rate": 0.019209863618016243, "loss": 2.344118595123291, "step": 15158 }, { "epoch": 0.7219047619047619, "grad_norm": 0.02608698606491089, "learning_rate": 0.019203288480639458, "loss": 2.388861656188965, "step": 15160 }, { "epoch": 0.722, "grad_norm": 0.027722882106900215, "learning_rate": 0.019196713343262672, "loss": 2.3554329872131348, "step": 15162 }, { "epoch": 0.7220952380952381, "grad_norm": 0.030190544202923775, "learning_rate": 0.019190136343240738, "loss": 2.406351089477539, "step": 15164 }, { "epoch": 0.7221904761904762, "grad_norm": 0.02588650956749916, "learning_rate": 0.019183563068509102, "loss": 2.354224681854248, "step": 15166 }, { "epoch": 0.7222857142857143, "grad_norm": 0.026674646884202957, "learning_rate": 0.019176986068487167, "loss": 2.3712873458862305, "step": 15168 }, { "epoch": 0.7223809523809523, "grad_norm": 0.025483274832367897, "learning_rate": 0.019170410931110382, "loss": 2.3746416568756104, "step": 15170 }, { "epoch": 0.7224761904761905, "grad_norm": 0.02614513970911503, "learning_rate": 0.019163835793733597, "loss": 2.3678135871887207, "step": 15172 }, { "epoch": 0.7225714285714285, "grad_norm": 0.02492862567305565, "learning_rate": 0.01915726065635681, "loss": 2.361236095428467, "step": 15174 }, { "epoch": 0.7226666666666667, "grad_norm": 0.025383593514561653, "learning_rate": 0.019150685518980026, "loss": 2.3607916831970215, "step": 15176 }, { "epoch": 0.7227619047619047, "grad_norm": 0.028080327436327934, "learning_rate": 0.01914411038160324, "loss": 2.3487820625305176, "step": 15178 }, { "epoch": 0.7228571428571429, "grad_norm": 0.02729123830795288, "learning_rate": 0.019137533381581306, "loss": 2.3665521144866943, "step": 15180 }, { "epoch": 0.7229523809523809, "grad_norm": 0.027587443590164185, "learning_rate": 0.01913096010684967, "loss": 2.384793281555176, "step": 15182 }, { "epoch": 0.723047619047619, "grad_norm": 0.02724936231970787, "learning_rate": 0.019124383106827736, "loss": 2.3424105644226074, "step": 15184 }, { "epoch": 0.7231428571428572, "grad_norm": 0.024827072396874428, "learning_rate": 0.0191178098320961, "loss": 2.3319473266601562, "step": 15186 }, { "epoch": 0.7232380952380952, "grad_norm": 0.027130398899316788, "learning_rate": 0.019111232832074165, "loss": 2.4101438522338867, "step": 15188 }, { "epoch": 0.7233333333333334, "grad_norm": 0.02750711888074875, "learning_rate": 0.01910465769469738, "loss": 2.3653171062469482, "step": 15190 }, { "epoch": 0.7234285714285714, "grad_norm": 0.02773682214319706, "learning_rate": 0.019098082557320595, "loss": 2.3753271102905273, "step": 15192 }, { "epoch": 0.7235238095238096, "grad_norm": 0.026956750079989433, "learning_rate": 0.01909150741994381, "loss": 2.4087109565734863, "step": 15194 }, { "epoch": 0.7236190476190476, "grad_norm": 0.025770237669348717, "learning_rate": 0.019084932282567024, "loss": 2.32291316986084, "step": 15196 }, { "epoch": 0.7237142857142858, "grad_norm": 0.0261429101228714, "learning_rate": 0.01907835714519024, "loss": 2.41044545173645, "step": 15198 }, { "epoch": 0.7238095238095238, "grad_norm": 0.026039518415927887, "learning_rate": 0.019071780145168304, "loss": 2.3975987434387207, "step": 15200 }, { "epoch": 0.7239047619047619, "grad_norm": 0.02910463698208332, "learning_rate": 0.01906520687043667, "loss": 2.4152209758758545, "step": 15202 }, { "epoch": 0.724, "grad_norm": 0.026574622839689255, "learning_rate": 0.019058629870414734, "loss": 2.3398470878601074, "step": 15204 }, { "epoch": 0.7240952380952381, "grad_norm": 0.026588501408696175, "learning_rate": 0.01905205473303795, "loss": 2.3941524028778076, "step": 15206 }, { "epoch": 0.7241904761904762, "grad_norm": 0.026031406596302986, "learning_rate": 0.019045479595661163, "loss": 2.357435941696167, "step": 15208 }, { "epoch": 0.7242857142857143, "grad_norm": 0.027828345075249672, "learning_rate": 0.019038904458284378, "loss": 2.378911018371582, "step": 15210 }, { "epoch": 0.7243809523809523, "grad_norm": 0.02619311958551407, "learning_rate": 0.019032329320907593, "loss": 2.4048757553100586, "step": 15212 }, { "epoch": 0.7244761904761905, "grad_norm": 0.02821364626288414, "learning_rate": 0.019025754183530807, "loss": 2.426086902618408, "step": 15214 }, { "epoch": 0.7245714285714285, "grad_norm": 0.0250778179615736, "learning_rate": 0.019019177183508873, "loss": 2.355103015899658, "step": 15216 }, { "epoch": 0.7246666666666667, "grad_norm": 0.025161664932966232, "learning_rate": 0.019012603908777237, "loss": 2.366468906402588, "step": 15218 }, { "epoch": 0.7247619047619047, "grad_norm": 0.02769194357097149, "learning_rate": 0.019006026908755302, "loss": 2.382730007171631, "step": 15220 }, { "epoch": 0.7248571428571429, "grad_norm": 0.02611970156431198, "learning_rate": 0.018999453634023666, "loss": 2.365675210952759, "step": 15222 }, { "epoch": 0.7249523809523809, "grad_norm": 0.02595735341310501, "learning_rate": 0.018992876634001732, "loss": 2.3610057830810547, "step": 15224 }, { "epoch": 0.725047619047619, "grad_norm": 0.02594320848584175, "learning_rate": 0.018986301496624947, "loss": 2.3859572410583496, "step": 15226 }, { "epoch": 0.7251428571428571, "grad_norm": 0.025332635268568993, "learning_rate": 0.01897972635924816, "loss": 2.4027457237243652, "step": 15228 }, { "epoch": 0.7252380952380952, "grad_norm": 0.024790486320853233, "learning_rate": 0.018973151221871376, "loss": 2.3800926208496094, "step": 15230 }, { "epoch": 0.7253333333333334, "grad_norm": 0.030299417674541473, "learning_rate": 0.01896657608449459, "loss": 2.3915200233459473, "step": 15232 }, { "epoch": 0.7254285714285714, "grad_norm": 0.02622968703508377, "learning_rate": 0.018960000947117805, "loss": 2.4062957763671875, "step": 15234 }, { "epoch": 0.7255238095238096, "grad_norm": 0.02652839571237564, "learning_rate": 0.01895342394709587, "loss": 2.352564811706543, "step": 15236 }, { "epoch": 0.7256190476190476, "grad_norm": 0.02752676047384739, "learning_rate": 0.018946850672364235, "loss": 2.3439879417419434, "step": 15238 }, { "epoch": 0.7257142857142858, "grad_norm": 0.025600465014576912, "learning_rate": 0.0189402736723423, "loss": 2.3665194511413574, "step": 15240 }, { "epoch": 0.7258095238095238, "grad_norm": 0.025393683463335037, "learning_rate": 0.018933698534965515, "loss": 2.3781654834747314, "step": 15242 }, { "epoch": 0.7259047619047619, "grad_norm": 0.026340622454881668, "learning_rate": 0.01892712339758873, "loss": 2.3609371185302734, "step": 15244 }, { "epoch": 0.726, "grad_norm": 0.025212280452251434, "learning_rate": 0.018920548260211945, "loss": 2.3539066314697266, "step": 15246 }, { "epoch": 0.7260952380952381, "grad_norm": 0.025481095537543297, "learning_rate": 0.01891397312283516, "loss": 2.3538413047790527, "step": 15248 }, { "epoch": 0.7261904761904762, "grad_norm": 0.02523799240589142, "learning_rate": 0.018907397985458374, "loss": 2.358488082885742, "step": 15250 }, { "epoch": 0.7262857142857143, "grad_norm": 0.02542700059711933, "learning_rate": 0.01890082098543644, "loss": 2.366429328918457, "step": 15252 }, { "epoch": 0.7263809523809523, "grad_norm": 0.025170888751745224, "learning_rate": 0.018894247710704803, "loss": 2.405271530151367, "step": 15254 }, { "epoch": 0.7264761904761905, "grad_norm": 0.02888454683125019, "learning_rate": 0.01888767071068287, "loss": 2.3885974884033203, "step": 15256 }, { "epoch": 0.7265714285714285, "grad_norm": 0.02677515707910061, "learning_rate": 0.018881097435951233, "loss": 2.355015993118286, "step": 15258 }, { "epoch": 0.7266666666666667, "grad_norm": 0.02633916214108467, "learning_rate": 0.0188745204359293, "loss": 2.364135265350342, "step": 15260 }, { "epoch": 0.7267619047619047, "grad_norm": 0.02672755718231201, "learning_rate": 0.018867945298552513, "loss": 2.3996496200561523, "step": 15262 }, { "epoch": 0.7268571428571429, "grad_norm": 0.025831835344433784, "learning_rate": 0.018861370161175728, "loss": 2.3986635208129883, "step": 15264 }, { "epoch": 0.7269523809523809, "grad_norm": 0.026527198031544685, "learning_rate": 0.018854795023798943, "loss": 2.3962652683258057, "step": 15266 }, { "epoch": 0.727047619047619, "grad_norm": 0.0278646070510149, "learning_rate": 0.018848219886422157, "loss": 2.373182773590088, "step": 15268 }, { "epoch": 0.7271428571428571, "grad_norm": 0.026290493085980415, "learning_rate": 0.018841644749045372, "loss": 2.3597848415374756, "step": 15270 }, { "epoch": 0.7272380952380952, "grad_norm": 0.02793416567146778, "learning_rate": 0.018835067749023438, "loss": 2.358440637588501, "step": 15272 }, { "epoch": 0.7273333333333334, "grad_norm": 0.025540918111801147, "learning_rate": 0.0188284944742918, "loss": 2.3604464530944824, "step": 15274 }, { "epoch": 0.7274285714285714, "grad_norm": 0.030248254537582397, "learning_rate": 0.018821917474269867, "loss": 2.426537275314331, "step": 15276 }, { "epoch": 0.7275238095238096, "grad_norm": 0.027517782524228096, "learning_rate": 0.01881534233689308, "loss": 2.4142308235168457, "step": 15278 }, { "epoch": 0.7276190476190476, "grad_norm": 0.02641669102013111, "learning_rate": 0.018808767199516296, "loss": 2.3754019737243652, "step": 15280 }, { "epoch": 0.7277142857142858, "grad_norm": 0.024802766740322113, "learning_rate": 0.01880219206213951, "loss": 2.3995003700256348, "step": 15282 }, { "epoch": 0.7278095238095238, "grad_norm": 0.02572629041969776, "learning_rate": 0.018795616924762726, "loss": 2.3884096145629883, "step": 15284 }, { "epoch": 0.7279047619047619, "grad_norm": 0.025614337995648384, "learning_rate": 0.01878904178738594, "loss": 2.36983060836792, "step": 15286 }, { "epoch": 0.728, "grad_norm": 0.026690956205129623, "learning_rate": 0.018782464787364006, "loss": 2.36472225189209, "step": 15288 }, { "epoch": 0.7280952380952381, "grad_norm": 0.026669664308428764, "learning_rate": 0.01877589151263237, "loss": 2.4027202129364014, "step": 15290 }, { "epoch": 0.7281904761904762, "grad_norm": 0.024892352521419525, "learning_rate": 0.018769314512610435, "loss": 2.3895626068115234, "step": 15292 }, { "epoch": 0.7282857142857143, "grad_norm": 0.025380335748195648, "learning_rate": 0.01876273937523365, "loss": 2.362504005432129, "step": 15294 }, { "epoch": 0.7283809523809524, "grad_norm": 0.025349317118525505, "learning_rate": 0.018756164237856865, "loss": 2.3979625701904297, "step": 15296 }, { "epoch": 0.7284761904761905, "grad_norm": 0.028007224202156067, "learning_rate": 0.01874958910048008, "loss": 2.3432817459106445, "step": 15298 }, { "epoch": 0.7285714285714285, "grad_norm": 0.025343144312500954, "learning_rate": 0.018743013963103294, "loss": 2.383787155151367, "step": 15300 }, { "epoch": 0.7286666666666667, "grad_norm": 0.02610095590353012, "learning_rate": 0.01873643882572651, "loss": 2.3993163108825684, "step": 15302 }, { "epoch": 0.7287619047619047, "grad_norm": 0.02834979072213173, "learning_rate": 0.018729863688349724, "loss": 2.4102182388305664, "step": 15304 }, { "epoch": 0.7288571428571429, "grad_norm": 0.028444720432162285, "learning_rate": 0.01872328855097294, "loss": 2.431774139404297, "step": 15306 }, { "epoch": 0.7289523809523809, "grad_norm": 0.02867240458726883, "learning_rate": 0.018716711550951004, "loss": 2.3626339435577393, "step": 15308 }, { "epoch": 0.729047619047619, "grad_norm": 0.026156583800911903, "learning_rate": 0.018710138276219368, "loss": 2.3690438270568848, "step": 15310 }, { "epoch": 0.7291428571428571, "grad_norm": 0.02542552351951599, "learning_rate": 0.018703561276197433, "loss": 2.347487688064575, "step": 15312 }, { "epoch": 0.7292380952380952, "grad_norm": 0.029663661494851112, "learning_rate": 0.018696986138820648, "loss": 2.3770551681518555, "step": 15314 }, { "epoch": 0.7293333333333333, "grad_norm": 0.03129972517490387, "learning_rate": 0.018690411001443863, "loss": 2.382101535797119, "step": 15316 }, { "epoch": 0.7294285714285714, "grad_norm": 0.025644171983003616, "learning_rate": 0.018683835864067078, "loss": 2.378249168395996, "step": 15318 }, { "epoch": 0.7295238095238096, "grad_norm": 0.02765338309109211, "learning_rate": 0.018677260726690292, "loss": 2.3457717895507812, "step": 15320 }, { "epoch": 0.7296190476190476, "grad_norm": 0.026862457394599915, "learning_rate": 0.018670685589313507, "loss": 2.397500991821289, "step": 15322 }, { "epoch": 0.7297142857142858, "grad_norm": 0.025465495884418488, "learning_rate": 0.018664108589291573, "loss": 2.3701553344726562, "step": 15324 }, { "epoch": 0.7298095238095238, "grad_norm": 0.02730472944676876, "learning_rate": 0.018657535314559937, "loss": 2.363633632659912, "step": 15326 }, { "epoch": 0.729904761904762, "grad_norm": 0.027047080919146538, "learning_rate": 0.018650958314538002, "loss": 2.4203298091888428, "step": 15328 }, { "epoch": 0.73, "grad_norm": 0.02582465671002865, "learning_rate": 0.018644383177161217, "loss": 2.374755859375, "step": 15330 }, { "epoch": 0.7300952380952381, "grad_norm": 0.03266439214348793, "learning_rate": 0.01863780803978443, "loss": 2.368558645248413, "step": 15332 }, { "epoch": 0.7301904761904762, "grad_norm": 0.02613827958703041, "learning_rate": 0.018631232902407646, "loss": 2.3933534622192383, "step": 15334 }, { "epoch": 0.7302857142857143, "grad_norm": 0.028849581256508827, "learning_rate": 0.01862465776503086, "loss": 2.3790063858032227, "step": 15336 }, { "epoch": 0.7303809523809524, "grad_norm": 0.027398420497775078, "learning_rate": 0.018618082627654076, "loss": 2.3959295749664307, "step": 15338 }, { "epoch": 0.7304761904761905, "grad_norm": 0.028846068307757378, "learning_rate": 0.01861150749027729, "loss": 2.399057626724243, "step": 15340 }, { "epoch": 0.7305714285714285, "grad_norm": 0.025816602632403374, "learning_rate": 0.018604932352900505, "loss": 2.399055004119873, "step": 15342 }, { "epoch": 0.7306666666666667, "grad_norm": 0.027379939332604408, "learning_rate": 0.01859835535287857, "loss": 2.370433807373047, "step": 15344 }, { "epoch": 0.7307619047619047, "grad_norm": 0.029091008007526398, "learning_rate": 0.018591782078146935, "loss": 2.3861892223358154, "step": 15346 }, { "epoch": 0.7308571428571429, "grad_norm": 0.028706377372145653, "learning_rate": 0.018585205078125, "loss": 2.3736205101013184, "step": 15348 }, { "epoch": 0.7309523809523809, "grad_norm": 0.026885556057095528, "learning_rate": 0.018578629940748215, "loss": 2.3927223682403564, "step": 15350 }, { "epoch": 0.7310476190476191, "grad_norm": 0.026686998084187508, "learning_rate": 0.01857205480337143, "loss": 2.430769443511963, "step": 15352 }, { "epoch": 0.7311428571428571, "grad_norm": 0.028046920895576477, "learning_rate": 0.018565479665994644, "loss": 2.389317035675049, "step": 15354 }, { "epoch": 0.7312380952380952, "grad_norm": 0.029130665585398674, "learning_rate": 0.01855890452861786, "loss": 2.422238826751709, "step": 15356 }, { "epoch": 0.7313333333333333, "grad_norm": 0.027769677340984344, "learning_rate": 0.018552329391241074, "loss": 2.380801200866699, "step": 15358 }, { "epoch": 0.7314285714285714, "grad_norm": 0.027684735134243965, "learning_rate": 0.01854575239121914, "loss": 2.3585495948791504, "step": 15360 }, { "epoch": 0.7315238095238096, "grad_norm": 0.02603060193359852, "learning_rate": 0.018539179116487503, "loss": 2.4010541439056396, "step": 15362 }, { "epoch": 0.7316190476190476, "grad_norm": 0.026965122669935226, "learning_rate": 0.01853260211646557, "loss": 2.3451766967773438, "step": 15364 }, { "epoch": 0.7317142857142858, "grad_norm": 0.02599172480404377, "learning_rate": 0.018526026979088783, "loss": 2.3914995193481445, "step": 15366 }, { "epoch": 0.7318095238095238, "grad_norm": 0.026203887537121773, "learning_rate": 0.018519451841711998, "loss": 2.390079975128174, "step": 15368 }, { "epoch": 0.731904761904762, "grad_norm": 0.028142716735601425, "learning_rate": 0.018512876704335213, "loss": 2.3558130264282227, "step": 15370 }, { "epoch": 0.732, "grad_norm": 0.026295457035303116, "learning_rate": 0.018506301566958427, "loss": 2.3454535007476807, "step": 15372 }, { "epoch": 0.7320952380952381, "grad_norm": 0.025547729805111885, "learning_rate": 0.018499726429581642, "loss": 2.36720609664917, "step": 15374 }, { "epoch": 0.7321904761904762, "grad_norm": 0.025338895618915558, "learning_rate": 0.018493151292204857, "loss": 2.3472912311553955, "step": 15376 }, { "epoch": 0.7322857142857143, "grad_norm": 0.0277293398976326, "learning_rate": 0.01848657615482807, "loss": 2.3775739669799805, "step": 15378 }, { "epoch": 0.7323809523809524, "grad_norm": 0.026738733053207397, "learning_rate": 0.018479999154806137, "loss": 2.3740074634552, "step": 15380 }, { "epoch": 0.7324761904761905, "grad_norm": 0.025275427848100662, "learning_rate": 0.0184734258800745, "loss": 2.362675666809082, "step": 15382 }, { "epoch": 0.7325714285714285, "grad_norm": 0.02684083767235279, "learning_rate": 0.018466848880052567, "loss": 2.3951191902160645, "step": 15384 }, { "epoch": 0.7326666666666667, "grad_norm": 0.024970771744847298, "learning_rate": 0.01846027374267578, "loss": 2.4005684852600098, "step": 15386 }, { "epoch": 0.7327619047619047, "grad_norm": 0.025690244510769844, "learning_rate": 0.018453698605298996, "loss": 2.3801286220550537, "step": 15388 }, { "epoch": 0.7328571428571429, "grad_norm": 0.030914129689335823, "learning_rate": 0.01844712346792221, "loss": 2.3713841438293457, "step": 15390 }, { "epoch": 0.7329523809523809, "grad_norm": 0.027420494705438614, "learning_rate": 0.018440548330545425, "loss": 2.3492565155029297, "step": 15392 }, { "epoch": 0.7330476190476191, "grad_norm": 0.027036022394895554, "learning_rate": 0.01843397319316864, "loss": 2.3786826133728027, "step": 15394 }, { "epoch": 0.7331428571428571, "grad_norm": 0.025963103398680687, "learning_rate": 0.018427396193146706, "loss": 2.3669376373291016, "step": 15396 }, { "epoch": 0.7332380952380952, "grad_norm": 0.0263023991137743, "learning_rate": 0.01842082291841507, "loss": 2.3827404975891113, "step": 15398 }, { "epoch": 0.7333333333333333, "grad_norm": 0.026546403765678406, "learning_rate": 0.018414245918393135, "loss": 2.3861284255981445, "step": 15400 }, { "epoch": 0.7334285714285714, "grad_norm": 0.025618407875299454, "learning_rate": 0.01840767078101635, "loss": 2.40620756149292, "step": 15402 }, { "epoch": 0.7335238095238096, "grad_norm": 0.026574790477752686, "learning_rate": 0.018401095643639565, "loss": 2.3783841133117676, "step": 15404 }, { "epoch": 0.7336190476190476, "grad_norm": 0.0251972246915102, "learning_rate": 0.01839452050626278, "loss": 2.4136428833007812, "step": 15406 }, { "epoch": 0.7337142857142858, "grad_norm": 0.025837894529104233, "learning_rate": 0.018387945368885994, "loss": 2.3634467124938965, "step": 15408 }, { "epoch": 0.7338095238095238, "grad_norm": 0.02684752084314823, "learning_rate": 0.01838137023150921, "loss": 2.4119598865509033, "step": 15410 }, { "epoch": 0.733904761904762, "grad_norm": 0.025651197880506516, "learning_rate": 0.018374795094132423, "loss": 2.373897075653076, "step": 15412 }, { "epoch": 0.734, "grad_norm": 0.025938594713807106, "learning_rate": 0.018368219956755638, "loss": 2.3681435585021973, "step": 15414 }, { "epoch": 0.7340952380952381, "grad_norm": 0.026270130649209023, "learning_rate": 0.018361642956733704, "loss": 2.348132848739624, "step": 15416 }, { "epoch": 0.7341904761904762, "grad_norm": 0.025986403226852417, "learning_rate": 0.018355069682002068, "loss": 2.332057476043701, "step": 15418 }, { "epoch": 0.7342857142857143, "grad_norm": 0.026202933862805367, "learning_rate": 0.018348492681980133, "loss": 2.3675220012664795, "step": 15420 }, { "epoch": 0.7343809523809524, "grad_norm": 0.026841996237635612, "learning_rate": 0.018341917544603348, "loss": 2.325416088104248, "step": 15422 }, { "epoch": 0.7344761904761905, "grad_norm": 0.025805678218603134, "learning_rate": 0.018335342407226562, "loss": 2.3587794303894043, "step": 15424 }, { "epoch": 0.7345714285714285, "grad_norm": 0.026292894035577774, "learning_rate": 0.018328767269849777, "loss": 2.3425426483154297, "step": 15426 }, { "epoch": 0.7346666666666667, "grad_norm": 0.02649039588868618, "learning_rate": 0.018322192132472992, "loss": 2.3979504108428955, "step": 15428 }, { "epoch": 0.7347619047619047, "grad_norm": 0.028186645358800888, "learning_rate": 0.018315616995096207, "loss": 2.368335008621216, "step": 15430 }, { "epoch": 0.7348571428571429, "grad_norm": 0.027124974876642227, "learning_rate": 0.018309039995074272, "loss": 2.3270816802978516, "step": 15432 }, { "epoch": 0.7349523809523809, "grad_norm": 0.026396509259939194, "learning_rate": 0.018302466720342636, "loss": 2.347776412963867, "step": 15434 }, { "epoch": 0.7350476190476191, "grad_norm": 0.025079233571887016, "learning_rate": 0.0182958897203207, "loss": 2.3425240516662598, "step": 15436 }, { "epoch": 0.7351428571428571, "grad_norm": 0.02568703517317772, "learning_rate": 0.018289314582943916, "loss": 2.3250651359558105, "step": 15438 }, { "epoch": 0.7352380952380952, "grad_norm": 0.02804923802614212, "learning_rate": 0.01828273944556713, "loss": 2.348559856414795, "step": 15440 }, { "epoch": 0.7353333333333333, "grad_norm": 0.029926897957921028, "learning_rate": 0.018276164308190346, "loss": 2.3646650314331055, "step": 15442 }, { "epoch": 0.7354285714285714, "grad_norm": 0.03155452758073807, "learning_rate": 0.01826958917081356, "loss": 2.365105152130127, "step": 15444 }, { "epoch": 0.7355238095238095, "grad_norm": 0.026557469740509987, "learning_rate": 0.018263014033436775, "loss": 2.337434768676758, "step": 15446 }, { "epoch": 0.7356190476190476, "grad_norm": 0.026180610060691833, "learning_rate": 0.01825643703341484, "loss": 2.365389347076416, "step": 15448 }, { "epoch": 0.7357142857142858, "grad_norm": 0.024962229654192924, "learning_rate": 0.018249863758683205, "loss": 2.337594985961914, "step": 15450 }, { "epoch": 0.7358095238095238, "grad_norm": 0.025834988802671432, "learning_rate": 0.01824328675866127, "loss": 2.337247848510742, "step": 15452 }, { "epoch": 0.735904761904762, "grad_norm": 0.024887770414352417, "learning_rate": 0.018236713483929634, "loss": 2.370060682296753, "step": 15454 }, { "epoch": 0.736, "grad_norm": 0.02693953365087509, "learning_rate": 0.0182301364839077, "loss": 2.374703884124756, "step": 15456 }, { "epoch": 0.7360952380952381, "grad_norm": 0.026177743449807167, "learning_rate": 0.018223561346530914, "loss": 2.36273193359375, "step": 15458 }, { "epoch": 0.7361904761904762, "grad_norm": 0.025637397542595863, "learning_rate": 0.01821698620915413, "loss": 2.355320453643799, "step": 15460 }, { "epoch": 0.7362857142857143, "grad_norm": 0.025522558018565178, "learning_rate": 0.018210411071777344, "loss": 2.3607234954833984, "step": 15462 }, { "epoch": 0.7363809523809524, "grad_norm": 0.025990338996052742, "learning_rate": 0.01820383593440056, "loss": 2.3650240898132324, "step": 15464 }, { "epoch": 0.7364761904761905, "grad_norm": 0.02626601792871952, "learning_rate": 0.018197260797023773, "loss": 2.360414981842041, "step": 15466 }, { "epoch": 0.7365714285714285, "grad_norm": 0.025338027626276016, "learning_rate": 0.01819068379700184, "loss": 2.333975315093994, "step": 15468 }, { "epoch": 0.7366666666666667, "grad_norm": 0.026090111583471298, "learning_rate": 0.018184110522270203, "loss": 2.3561692237854004, "step": 15470 }, { "epoch": 0.7367619047619047, "grad_norm": 0.0265871062874794, "learning_rate": 0.018177533522248268, "loss": 2.3327770233154297, "step": 15472 }, { "epoch": 0.7368571428571429, "grad_norm": 0.025207186117768288, "learning_rate": 0.018170958384871483, "loss": 2.3810951709747314, "step": 15474 }, { "epoch": 0.7369523809523809, "grad_norm": 0.02802153490483761, "learning_rate": 0.018164383247494698, "loss": 2.3261585235595703, "step": 15476 }, { "epoch": 0.7370476190476191, "grad_norm": 0.026032522320747375, "learning_rate": 0.018157808110117912, "loss": 2.374445676803589, "step": 15478 }, { "epoch": 0.7371428571428571, "grad_norm": 0.024956760928034782, "learning_rate": 0.018151232972741127, "loss": 2.3311667442321777, "step": 15480 }, { "epoch": 0.7372380952380952, "grad_norm": 0.029985038563609123, "learning_rate": 0.018144657835364342, "loss": 2.3467915058135986, "step": 15482 }, { "epoch": 0.7373333333333333, "grad_norm": 0.03466275706887245, "learning_rate": 0.018138080835342407, "loss": 2.3583219051361084, "step": 15484 }, { "epoch": 0.7374285714285714, "grad_norm": 0.028474224731326103, "learning_rate": 0.01813150756061077, "loss": 2.365318775177002, "step": 15486 }, { "epoch": 0.7375238095238095, "grad_norm": 0.025433536618947983, "learning_rate": 0.018124930560588837, "loss": 2.328592300415039, "step": 15488 }, { "epoch": 0.7376190476190476, "grad_norm": 0.026312559843063354, "learning_rate": 0.0181183572858572, "loss": 2.3362984657287598, "step": 15490 }, { "epoch": 0.7377142857142858, "grad_norm": 0.02632959745824337, "learning_rate": 0.018111780285835266, "loss": 2.3491628170013428, "step": 15492 }, { "epoch": 0.7378095238095238, "grad_norm": 0.02643604762852192, "learning_rate": 0.01810520514845848, "loss": 2.3690783977508545, "step": 15494 }, { "epoch": 0.737904761904762, "grad_norm": 0.026177145540714264, "learning_rate": 0.018098630011081696, "loss": 2.3959383964538574, "step": 15496 }, { "epoch": 0.738, "grad_norm": 0.02577868476510048, "learning_rate": 0.01809205487370491, "loss": 2.3120603561401367, "step": 15498 }, { "epoch": 0.7380952380952381, "grad_norm": 0.026492565870285034, "learning_rate": 0.018085479736328125, "loss": 2.3557052612304688, "step": 15500 }, { "epoch": 0.7381904761904762, "grad_norm": 0.025387611240148544, "learning_rate": 0.01807890459895134, "loss": 2.3480210304260254, "step": 15502 }, { "epoch": 0.7382857142857143, "grad_norm": 0.026227280497550964, "learning_rate": 0.018072327598929405, "loss": 2.380622386932373, "step": 15504 }, { "epoch": 0.7383809523809524, "grad_norm": 0.026438741013407707, "learning_rate": 0.01806575432419777, "loss": 2.337888717651367, "step": 15506 }, { "epoch": 0.7384761904761905, "grad_norm": 0.0300892423838377, "learning_rate": 0.018059177324175835, "loss": 2.3222532272338867, "step": 15508 }, { "epoch": 0.7385714285714285, "grad_norm": 0.025763535872101784, "learning_rate": 0.01805260218679905, "loss": 2.3574514389038086, "step": 15510 }, { "epoch": 0.7386666666666667, "grad_norm": 0.025381341576576233, "learning_rate": 0.018046027049422264, "loss": 2.366950035095215, "step": 15512 }, { "epoch": 0.7387619047619047, "grad_norm": 0.025321854278445244, "learning_rate": 0.01803945191204548, "loss": 2.3520684242248535, "step": 15514 }, { "epoch": 0.7388571428571429, "grad_norm": 0.02527572773396969, "learning_rate": 0.018032876774668694, "loss": 2.3530097007751465, "step": 15516 }, { "epoch": 0.7389523809523809, "grad_norm": 0.026988815516233444, "learning_rate": 0.018026301637291908, "loss": 2.3326668739318848, "step": 15518 }, { "epoch": 0.7390476190476191, "grad_norm": 0.025999439880251884, "learning_rate": 0.018019724637269974, "loss": 2.3460378646850586, "step": 15520 }, { "epoch": 0.7391428571428571, "grad_norm": 0.025522805750370026, "learning_rate": 0.018013151362538338, "loss": 2.328484296798706, "step": 15522 }, { "epoch": 0.7392380952380952, "grad_norm": 0.026413394138216972, "learning_rate": 0.018006574362516403, "loss": 2.358071804046631, "step": 15524 }, { "epoch": 0.7393333333333333, "grad_norm": 0.02646331861615181, "learning_rate": 0.017999999225139618, "loss": 2.347684860229492, "step": 15526 }, { "epoch": 0.7394285714285714, "grad_norm": 0.026081789284944534, "learning_rate": 0.017993425950407982, "loss": 2.329948902130127, "step": 15528 }, { "epoch": 0.7395238095238095, "grad_norm": 0.02496488206088543, "learning_rate": 0.017986848950386047, "loss": 2.3554697036743164, "step": 15530 }, { "epoch": 0.7396190476190476, "grad_norm": 0.027289673686027527, "learning_rate": 0.01798027567565441, "loss": 2.402756690979004, "step": 15532 }, { "epoch": 0.7397142857142858, "grad_norm": 0.025630872696638107, "learning_rate": 0.017973698675632477, "loss": 2.339308738708496, "step": 15534 }, { "epoch": 0.7398095238095238, "grad_norm": 0.02780371531844139, "learning_rate": 0.01796712353825569, "loss": 2.3338005542755127, "step": 15536 }, { "epoch": 0.739904761904762, "grad_norm": 0.03231804072856903, "learning_rate": 0.017960548400878906, "loss": 2.3687350749969482, "step": 15538 }, { "epoch": 0.74, "grad_norm": 0.02597762458026409, "learning_rate": 0.01795397326350212, "loss": 2.3198928833007812, "step": 15540 }, { "epoch": 0.7400952380952381, "grad_norm": 0.024800289422273636, "learning_rate": 0.017947398126125336, "loss": 2.354149103164673, "step": 15542 }, { "epoch": 0.7401904761904762, "grad_norm": 0.02641119994223118, "learning_rate": 0.01794082298874855, "loss": 2.352957248687744, "step": 15544 }, { "epoch": 0.7402857142857143, "grad_norm": 0.026838308200240135, "learning_rate": 0.017934245988726616, "loss": 2.309941291809082, "step": 15546 }, { "epoch": 0.7403809523809524, "grad_norm": 0.02619113028049469, "learning_rate": 0.01792767271399498, "loss": 2.3251538276672363, "step": 15548 }, { "epoch": 0.7404761904761905, "grad_norm": 0.026309343054890633, "learning_rate": 0.017921095713973045, "loss": 2.3199567794799805, "step": 15550 }, { "epoch": 0.7405714285714285, "grad_norm": 0.027828708291053772, "learning_rate": 0.01791452057659626, "loss": 2.3380002975463867, "step": 15552 }, { "epoch": 0.7406666666666667, "grad_norm": 0.02610698528587818, "learning_rate": 0.017907945439219475, "loss": 2.327108860015869, "step": 15554 }, { "epoch": 0.7407619047619047, "grad_norm": 0.025202888995409012, "learning_rate": 0.01790137030184269, "loss": 2.305941104888916, "step": 15556 }, { "epoch": 0.7408571428571429, "grad_norm": 0.028123941272497177, "learning_rate": 0.017894795164465904, "loss": 2.3469228744506836, "step": 15558 }, { "epoch": 0.7409523809523809, "grad_norm": 0.02756907232105732, "learning_rate": 0.01788822002708912, "loss": 2.342402935028076, "step": 15560 }, { "epoch": 0.7410476190476191, "grad_norm": 0.025955915451049805, "learning_rate": 0.017881643027067184, "loss": 2.344564437866211, "step": 15562 }, { "epoch": 0.7411428571428571, "grad_norm": 0.025975707918405533, "learning_rate": 0.01787506975233555, "loss": 2.345348358154297, "step": 15564 }, { "epoch": 0.7412380952380953, "grad_norm": 0.026285624131560326, "learning_rate": 0.017868492752313614, "loss": 2.3173465728759766, "step": 15566 }, { "epoch": 0.7413333333333333, "grad_norm": 0.026878802105784416, "learning_rate": 0.017861919477581978, "loss": 2.3525912761688232, "step": 15568 }, { "epoch": 0.7414285714285714, "grad_norm": 0.025844309478998184, "learning_rate": 0.017855342477560043, "loss": 2.341384172439575, "step": 15570 }, { "epoch": 0.7415238095238095, "grad_norm": 0.026279469951987267, "learning_rate": 0.017848767340183258, "loss": 2.3185031414031982, "step": 15572 }, { "epoch": 0.7416190476190476, "grad_norm": 0.02552093379199505, "learning_rate": 0.017842192202806473, "loss": 2.332857370376587, "step": 15574 }, { "epoch": 0.7417142857142857, "grad_norm": 0.024680597707629204, "learning_rate": 0.017835617065429688, "loss": 2.327584743499756, "step": 15576 }, { "epoch": 0.7418095238095238, "grad_norm": 0.030557727441191673, "learning_rate": 0.017829041928052902, "loss": 2.3169448375701904, "step": 15578 }, { "epoch": 0.741904761904762, "grad_norm": 0.02772785909473896, "learning_rate": 0.017822466790676117, "loss": 2.361814022064209, "step": 15580 }, { "epoch": 0.742, "grad_norm": 0.025353379547595978, "learning_rate": 0.017815889790654182, "loss": 2.3341922760009766, "step": 15582 }, { "epoch": 0.7420952380952381, "grad_norm": 0.02637895755469799, "learning_rate": 0.017809316515922546, "loss": 2.3278346061706543, "step": 15584 }, { "epoch": 0.7421904761904762, "grad_norm": 0.026542482897639275, "learning_rate": 0.017802739515900612, "loss": 2.3315510749816895, "step": 15586 }, { "epoch": 0.7422857142857143, "grad_norm": 0.02661876007914543, "learning_rate": 0.017796164378523827, "loss": 2.3526439666748047, "step": 15588 }, { "epoch": 0.7423809523809524, "grad_norm": 0.02696835622191429, "learning_rate": 0.01778958924114704, "loss": 2.3332533836364746, "step": 15590 }, { "epoch": 0.7424761904761905, "grad_norm": 0.024904955178499222, "learning_rate": 0.017783014103770256, "loss": 2.3030877113342285, "step": 15592 }, { "epoch": 0.7425714285714285, "grad_norm": 0.02643158845603466, "learning_rate": 0.01777643896639347, "loss": 2.3559577465057373, "step": 15594 }, { "epoch": 0.7426666666666667, "grad_norm": 0.02787517011165619, "learning_rate": 0.017769863829016685, "loss": 2.2801733016967773, "step": 15596 }, { "epoch": 0.7427619047619047, "grad_norm": 0.027094339951872826, "learning_rate": 0.01776328682899475, "loss": 2.2730023860931396, "step": 15598 }, { "epoch": 0.7428571428571429, "grad_norm": 0.028016643598675728, "learning_rate": 0.017756713554263115, "loss": 2.317416191101074, "step": 15600 }, { "epoch": 0.7429523809523809, "grad_norm": 0.025573773309588432, "learning_rate": 0.01775013655424118, "loss": 2.3057284355163574, "step": 15602 }, { "epoch": 0.7430476190476191, "grad_norm": 0.025539245456457138, "learning_rate": 0.017743563279509544, "loss": 2.311638355255127, "step": 15604 }, { "epoch": 0.7431428571428571, "grad_norm": 0.027940969914197922, "learning_rate": 0.01773698627948761, "loss": 2.3007876873016357, "step": 15606 }, { "epoch": 0.7432380952380953, "grad_norm": 0.03341735899448395, "learning_rate": 0.017730411142110825, "loss": 2.3369052410125732, "step": 15608 }, { "epoch": 0.7433333333333333, "grad_norm": 0.028901206329464912, "learning_rate": 0.01772383600473404, "loss": 2.3507888317108154, "step": 15610 }, { "epoch": 0.7434285714285714, "grad_norm": 0.027818255126476288, "learning_rate": 0.017717260867357254, "loss": 2.3169541358947754, "step": 15612 }, { "epoch": 0.7435238095238095, "grad_norm": 0.025007903575897217, "learning_rate": 0.01771068572998047, "loss": 2.3707547187805176, "step": 15614 }, { "epoch": 0.7436190476190476, "grad_norm": 0.027196960523724556, "learning_rate": 0.017704110592603683, "loss": 2.3037190437316895, "step": 15616 }, { "epoch": 0.7437142857142857, "grad_norm": 0.026002032682299614, "learning_rate": 0.01769753359258175, "loss": 2.3338780403137207, "step": 15618 }, { "epoch": 0.7438095238095238, "grad_norm": 0.025685282424092293, "learning_rate": 0.017690960317850113, "loss": 2.3259117603302, "step": 15620 }, { "epoch": 0.743904761904762, "grad_norm": 0.029291940852999687, "learning_rate": 0.01768438331782818, "loss": 2.3070497512817383, "step": 15622 }, { "epoch": 0.744, "grad_norm": 0.025454513728618622, "learning_rate": 0.017677808180451393, "loss": 2.3352341651916504, "step": 15624 }, { "epoch": 0.7440952380952381, "grad_norm": 0.02763959765434265, "learning_rate": 0.017671233043074608, "loss": 2.289316177368164, "step": 15626 }, { "epoch": 0.7441904761904762, "grad_norm": 0.025107964873313904, "learning_rate": 0.017664657905697823, "loss": 2.300992965698242, "step": 15628 }, { "epoch": 0.7442857142857143, "grad_norm": 0.025980591773986816, "learning_rate": 0.017658082768321037, "loss": 2.2867579460144043, "step": 15630 }, { "epoch": 0.7443809523809524, "grad_norm": 0.028337927535176277, "learning_rate": 0.017651507630944252, "loss": 2.2816200256347656, "step": 15632 }, { "epoch": 0.7444761904761905, "grad_norm": 0.025092434138059616, "learning_rate": 0.017644930630922318, "loss": 2.3408336639404297, "step": 15634 }, { "epoch": 0.7445714285714286, "grad_norm": 0.02689722739160061, "learning_rate": 0.01763835735619068, "loss": 2.3111696243286133, "step": 15636 }, { "epoch": 0.7446666666666667, "grad_norm": 0.02591930702328682, "learning_rate": 0.017631780356168747, "loss": 2.353759765625, "step": 15638 }, { "epoch": 0.7447619047619047, "grad_norm": 0.026604680344462395, "learning_rate": 0.01762520521879196, "loss": 2.3260655403137207, "step": 15640 }, { "epoch": 0.7448571428571429, "grad_norm": 0.025254525244235992, "learning_rate": 0.017618630081415176, "loss": 2.30930757522583, "step": 15642 }, { "epoch": 0.7449523809523809, "grad_norm": 0.028750525787472725, "learning_rate": 0.01761205494403839, "loss": 2.31941556930542, "step": 15644 }, { "epoch": 0.7450476190476191, "grad_norm": 0.025785226374864578, "learning_rate": 0.017605479806661606, "loss": 2.328462839126587, "step": 15646 }, { "epoch": 0.7451428571428571, "grad_norm": 0.02694571204483509, "learning_rate": 0.01759890466928482, "loss": 2.3318099975585938, "step": 15648 }, { "epoch": 0.7452380952380953, "grad_norm": 0.02823738008737564, "learning_rate": 0.017592329531908035, "loss": 2.3128108978271484, "step": 15650 }, { "epoch": 0.7453333333333333, "grad_norm": 0.027523033320903778, "learning_rate": 0.01758575439453125, "loss": 2.2967193126678467, "step": 15652 }, { "epoch": 0.7454285714285714, "grad_norm": 0.025206640362739563, "learning_rate": 0.017579177394509315, "loss": 2.349384069442749, "step": 15654 }, { "epoch": 0.7455238095238095, "grad_norm": 0.025826087221503258, "learning_rate": 0.01757260411977768, "loss": 2.3311996459960938, "step": 15656 }, { "epoch": 0.7456190476190476, "grad_norm": 0.025308458134531975, "learning_rate": 0.017566027119755745, "loss": 2.315877914428711, "step": 15658 }, { "epoch": 0.7457142857142857, "grad_norm": 0.024982865899801254, "learning_rate": 0.01755945198237896, "loss": 2.3292622566223145, "step": 15660 }, { "epoch": 0.7458095238095238, "grad_norm": 0.02726987935602665, "learning_rate": 0.017552876845002174, "loss": 2.292407512664795, "step": 15662 }, { "epoch": 0.745904761904762, "grad_norm": 0.02603534609079361, "learning_rate": 0.01754630170762539, "loss": 2.3198719024658203, "step": 15664 }, { "epoch": 0.746, "grad_norm": 0.025060297921299934, "learning_rate": 0.017539726570248604, "loss": 2.2778306007385254, "step": 15666 }, { "epoch": 0.7460952380952381, "grad_norm": 0.025332637131214142, "learning_rate": 0.01753315143287182, "loss": 2.3153865337371826, "step": 15668 }, { "epoch": 0.7461904761904762, "grad_norm": 0.02595061995089054, "learning_rate": 0.017526574432849884, "loss": 2.3036351203918457, "step": 15670 }, { "epoch": 0.7462857142857143, "grad_norm": 0.026319460943341255, "learning_rate": 0.017520001158118248, "loss": 2.3079161643981934, "step": 15672 }, { "epoch": 0.7463809523809524, "grad_norm": 0.02661813236773014, "learning_rate": 0.017513424158096313, "loss": 2.3358192443847656, "step": 15674 }, { "epoch": 0.7464761904761905, "grad_norm": 0.026765845715999603, "learning_rate": 0.017506849020719528, "loss": 2.368149518966675, "step": 15676 }, { "epoch": 0.7465714285714286, "grad_norm": 0.025871483609080315, "learning_rate": 0.017500273883342743, "loss": 2.3330066204071045, "step": 15678 }, { "epoch": 0.7466666666666667, "grad_norm": 0.025812484323978424, "learning_rate": 0.017493698745965958, "loss": 2.3020691871643066, "step": 15680 }, { "epoch": 0.7467619047619047, "grad_norm": 0.025462981313467026, "learning_rate": 0.017487123608589172, "loss": 2.3113908767700195, "step": 15682 }, { "epoch": 0.7468571428571429, "grad_norm": 0.026074349880218506, "learning_rate": 0.017480548471212387, "loss": 2.3012642860412598, "step": 15684 }, { "epoch": 0.7469523809523809, "grad_norm": 0.02581758052110672, "learning_rate": 0.017473973333835602, "loss": 2.3721771240234375, "step": 15686 }, { "epoch": 0.7470476190476191, "grad_norm": 0.02651822380721569, "learning_rate": 0.017467398196458817, "loss": 2.3386192321777344, "step": 15688 }, { "epoch": 0.7471428571428571, "grad_norm": 0.029550235718488693, "learning_rate": 0.017460821196436882, "loss": 2.3528077602386475, "step": 15690 }, { "epoch": 0.7472380952380953, "grad_norm": 0.02518484555184841, "learning_rate": 0.017454247921705246, "loss": 2.311462879180908, "step": 15692 }, { "epoch": 0.7473333333333333, "grad_norm": 0.025168655440211296, "learning_rate": 0.01744767092168331, "loss": 2.29652738571167, "step": 15694 }, { "epoch": 0.7474285714285714, "grad_norm": 0.026097258552908897, "learning_rate": 0.017441095784306526, "loss": 2.308227062225342, "step": 15696 }, { "epoch": 0.7475238095238095, "grad_norm": 0.026120008900761604, "learning_rate": 0.01743452064692974, "loss": 2.292232036590576, "step": 15698 }, { "epoch": 0.7476190476190476, "grad_norm": 0.024850936606526375, "learning_rate": 0.017427945509552956, "loss": 2.2931203842163086, "step": 15700 }, { "epoch": 0.7477142857142857, "grad_norm": 0.025767646729946136, "learning_rate": 0.01742137037217617, "loss": 2.3148651123046875, "step": 15702 }, { "epoch": 0.7478095238095238, "grad_norm": 0.02588091790676117, "learning_rate": 0.017414795234799385, "loss": 2.329885482788086, "step": 15704 }, { "epoch": 0.7479047619047619, "grad_norm": 0.025512296706438065, "learning_rate": 0.01740821823477745, "loss": 2.3152451515197754, "step": 15706 }, { "epoch": 0.748, "grad_norm": 0.02626778744161129, "learning_rate": 0.017401644960045815, "loss": 2.3046584129333496, "step": 15708 }, { "epoch": 0.7480952380952381, "grad_norm": 0.02582602947950363, "learning_rate": 0.01739506796002388, "loss": 2.297856092453003, "step": 15710 }, { "epoch": 0.7481904761904762, "grad_norm": 0.026222407817840576, "learning_rate": 0.017388492822647095, "loss": 2.3093080520629883, "step": 15712 }, { "epoch": 0.7482857142857143, "grad_norm": 0.026395166292786598, "learning_rate": 0.01738191768527031, "loss": 2.3238277435302734, "step": 15714 }, { "epoch": 0.7483809523809524, "grad_norm": 0.026226164773106575, "learning_rate": 0.017375342547893524, "loss": 2.3006796836853027, "step": 15716 }, { "epoch": 0.7484761904761905, "grad_norm": 0.02697596326470375, "learning_rate": 0.01736876741051674, "loss": 2.3389341831207275, "step": 15718 }, { "epoch": 0.7485714285714286, "grad_norm": 0.02642185613512993, "learning_rate": 0.017362192273139954, "loss": 2.3074889183044434, "step": 15720 }, { "epoch": 0.7486666666666667, "grad_norm": 0.02782079018652439, "learning_rate": 0.01735561713576317, "loss": 2.328770160675049, "step": 15722 }, { "epoch": 0.7487619047619047, "grad_norm": 0.029526278376579285, "learning_rate": 0.017349041998386383, "loss": 2.264914035797119, "step": 15724 }, { "epoch": 0.7488571428571429, "grad_norm": 0.027077285572886467, "learning_rate": 0.01734246499836445, "loss": 2.3192410469055176, "step": 15726 }, { "epoch": 0.7489523809523809, "grad_norm": 0.028856394812464714, "learning_rate": 0.017335891723632812, "loss": 2.3326239585876465, "step": 15728 }, { "epoch": 0.7490476190476191, "grad_norm": 0.02852701209485531, "learning_rate": 0.017329314723610878, "loss": 2.308624029159546, "step": 15730 }, { "epoch": 0.7491428571428571, "grad_norm": 0.026169560849666595, "learning_rate": 0.017322739586234093, "loss": 2.316768169403076, "step": 15732 }, { "epoch": 0.7492380952380953, "grad_norm": 0.02709086425602436, "learning_rate": 0.017316164448857307, "loss": 2.3272228240966797, "step": 15734 }, { "epoch": 0.7493333333333333, "grad_norm": 0.027657698839902878, "learning_rate": 0.017309589311480522, "loss": 2.3079776763916016, "step": 15736 }, { "epoch": 0.7494285714285714, "grad_norm": 0.02516268379986286, "learning_rate": 0.017303014174103737, "loss": 2.3612399101257324, "step": 15738 }, { "epoch": 0.7495238095238095, "grad_norm": 0.026182102039456367, "learning_rate": 0.01729643903672695, "loss": 2.305617094039917, "step": 15740 }, { "epoch": 0.7496190476190476, "grad_norm": 0.02609368972480297, "learning_rate": 0.017289862036705017, "loss": 2.312685489654541, "step": 15742 }, { "epoch": 0.7497142857142857, "grad_norm": 0.026187218725681305, "learning_rate": 0.01728328876197338, "loss": 2.309286117553711, "step": 15744 }, { "epoch": 0.7498095238095238, "grad_norm": 0.029577380046248436, "learning_rate": 0.017276711761951447, "loss": 2.3096208572387695, "step": 15746 }, { "epoch": 0.7499047619047619, "grad_norm": 0.02641557902097702, "learning_rate": 0.01727013662457466, "loss": 2.314117431640625, "step": 15748 }, { "epoch": 0.75, "grad_norm": 0.029240325093269348, "learning_rate": 0.017263561487197876, "loss": 2.3062260150909424, "step": 15750 } ], "logging_steps": 2, "max_steps": 21000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 1050, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.287197266138471e+19, "train_batch_size": 4, "trial_name": null, "trial_params": null }