{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.21301093839953944, "eval_steps": 500, "global_step": 4070, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0005233683990160674, "grad_norm": 1.1370724439620972, "learning_rate": 2.910112359550562e-06, "loss": 0.8003, "step": 10 }, { "epoch": 0.0010467367980321349, "grad_norm": 0.9877656102180481, "learning_rate": 3.921348314606742e-06, "loss": 0.7587, "step": 20 }, { "epoch": 0.0015701051970482022, "grad_norm": 0.8628589510917664, "learning_rate": 4.932584269662922e-06, "loss": 0.7476, "step": 30 }, { "epoch": 0.0020934735960642698, "grad_norm": 0.7837583422660828, "learning_rate": 5.943820224719102e-06, "loss": 0.7334, "step": 40 }, { "epoch": 0.002616841995080337, "grad_norm": 0.7342932224273682, "learning_rate": 6.955056179775282e-06, "loss": 0.7397, "step": 50 }, { "epoch": 0.0031402103940964044, "grad_norm": 0.9271304607391357, "learning_rate": 7.966292134831462e-06, "loss": 0.7296, "step": 60 }, { "epoch": 0.0036635787931124718, "grad_norm": 0.8066033720970154, "learning_rate": 8.977528089887641e-06, "loss": 0.6864, "step": 70 }, { "epoch": 0.0041869471921285395, "grad_norm": 0.8114457726478577, "learning_rate": 9.988764044943822e-06, "loss": 0.6792, "step": 80 }, { "epoch": 0.004710315591144607, "grad_norm": 0.8880093097686768, "learning_rate": 1.1000000000000001e-05, "loss": 0.7508, "step": 90 }, { "epoch": 0.005233683990160674, "grad_norm": 1.1273611783981323, "learning_rate": 1.2011235955056182e-05, "loss": 0.6849, "step": 100 }, { "epoch": 0.0057570523891767415, "grad_norm": 0.7791317701339722, "learning_rate": 1.3022471910112362e-05, "loss": 0.698, "step": 110 }, { "epoch": 0.006280420788192809, "grad_norm": 0.8140974044799805, "learning_rate": 1.403370786516854e-05, "loss": 0.6947, "step": 120 }, { "epoch": 0.006803789187208876, "grad_norm": 0.8656443357467651, "learning_rate": 1.504494382022472e-05, "loss": 0.7158, "step": 130 }, { "epoch": 0.0073271575862249435, "grad_norm": 0.744526743888855, "learning_rate": 1.60561797752809e-05, "loss": 0.6701, "step": 140 }, { "epoch": 0.00785052598524101, "grad_norm": 0.7715036273002625, "learning_rate": 1.706741573033708e-05, "loss": 0.6794, "step": 150 }, { "epoch": 0.008373894384257079, "grad_norm": 0.7816882729530334, "learning_rate": 1.8078651685393256e-05, "loss": 0.7059, "step": 160 }, { "epoch": 0.008897262783273146, "grad_norm": 0.7964625954627991, "learning_rate": 1.908988764044944e-05, "loss": 0.6954, "step": 170 }, { "epoch": 0.009420631182289214, "grad_norm": 1.0829215049743652, "learning_rate": 2e-05, "loss": 0.6888, "step": 180 }, { "epoch": 0.00994399958130528, "grad_norm": 0.6891264319419861, "learning_rate": 2e-05, "loss": 0.6539, "step": 190 }, { "epoch": 0.010467367980321348, "grad_norm": 0.7293897867202759, "learning_rate": 2e-05, "loss": 0.7164, "step": 200 }, { "epoch": 0.010990736379337415, "grad_norm": 0.6318921446800232, "learning_rate": 2e-05, "loss": 0.7084, "step": 210 }, { "epoch": 0.011514104778353483, "grad_norm": 0.6405470371246338, "learning_rate": 2e-05, "loss": 0.6812, "step": 220 }, { "epoch": 0.012037473177369551, "grad_norm": 0.6632219552993774, "learning_rate": 2e-05, "loss": 0.6733, "step": 230 }, { "epoch": 0.012560841576385618, "grad_norm": 0.7196585536003113, "learning_rate": 2e-05, "loss": 0.6835, "step": 240 }, { "epoch": 0.013084209975401686, "grad_norm": 0.5942214131355286, "learning_rate": 2e-05, "loss": 0.6613, "step": 250 }, { "epoch": 0.013607578374417752, "grad_norm": 0.5716996788978577, "learning_rate": 2e-05, "loss": 0.6759, "step": 260 }, { "epoch": 0.01413094677343382, "grad_norm": 0.5713549256324768, "learning_rate": 2e-05, "loss": 0.7041, "step": 270 }, { "epoch": 0.014654315172449887, "grad_norm": 0.5658433437347412, "learning_rate": 2e-05, "loss": 0.6866, "step": 280 }, { "epoch": 0.015177683571465955, "grad_norm": 0.5381125211715698, "learning_rate": 2e-05, "loss": 0.7024, "step": 290 }, { "epoch": 0.01570105197048202, "grad_norm": 0.5079479217529297, "learning_rate": 2e-05, "loss": 0.686, "step": 300 }, { "epoch": 0.016224420369498088, "grad_norm": 0.5530030727386475, "learning_rate": 2e-05, "loss": 0.6912, "step": 310 }, { "epoch": 0.016747788768514158, "grad_norm": 0.5396811962127686, "learning_rate": 2e-05, "loss": 0.6751, "step": 320 }, { "epoch": 0.017271157167530225, "grad_norm": 0.4894005060195923, "learning_rate": 2e-05, "loss": 0.6649, "step": 330 }, { "epoch": 0.01779452556654629, "grad_norm": 0.5230134129524231, "learning_rate": 2e-05, "loss": 0.684, "step": 340 }, { "epoch": 0.01831789396556236, "grad_norm": 0.5332402586936951, "learning_rate": 2e-05, "loss": 0.6767, "step": 350 }, { "epoch": 0.018841262364578427, "grad_norm": 0.5048417448997498, "learning_rate": 2e-05, "loss": 0.6922, "step": 360 }, { "epoch": 0.019364630763594494, "grad_norm": 0.5345087051391602, "learning_rate": 2e-05, "loss": 0.6976, "step": 370 }, { "epoch": 0.01988799916261056, "grad_norm": 0.511880099773407, "learning_rate": 2e-05, "loss": 0.6814, "step": 380 }, { "epoch": 0.02041136756162663, "grad_norm": 0.46280574798583984, "learning_rate": 2e-05, "loss": 0.6566, "step": 390 }, { "epoch": 0.020934735960642697, "grad_norm": 0.464054137468338, "learning_rate": 2e-05, "loss": 0.6483, "step": 400 }, { "epoch": 0.021458104359658763, "grad_norm": 0.5449008941650391, "learning_rate": 2e-05, "loss": 0.6841, "step": 410 }, { "epoch": 0.02198147275867483, "grad_norm": 0.5352079272270203, "learning_rate": 2e-05, "loss": 0.6604, "step": 420 }, { "epoch": 0.0225048411576909, "grad_norm": 0.5088271498680115, "learning_rate": 2e-05, "loss": 0.6683, "step": 430 }, { "epoch": 0.023028209556706966, "grad_norm": 0.5593430399894714, "learning_rate": 2e-05, "loss": 0.6795, "step": 440 }, { "epoch": 0.023551577955723033, "grad_norm": 0.507481575012207, "learning_rate": 2e-05, "loss": 0.6654, "step": 450 }, { "epoch": 0.024074946354739103, "grad_norm": 0.4815616011619568, "learning_rate": 2e-05, "loss": 0.6843, "step": 460 }, { "epoch": 0.02459831475375517, "grad_norm": 0.5703353881835938, "learning_rate": 2e-05, "loss": 0.6598, "step": 470 }, { "epoch": 0.025121683152771235, "grad_norm": 0.48705339431762695, "learning_rate": 2e-05, "loss": 0.6614, "step": 480 }, { "epoch": 0.025645051551787302, "grad_norm": 0.547533392906189, "learning_rate": 2e-05, "loss": 0.6585, "step": 490 }, { "epoch": 0.026168419950803372, "grad_norm": 0.6569129228591919, "learning_rate": 2e-05, "loss": 0.6716, "step": 500 }, { "epoch": 0.02669178834981944, "grad_norm": 0.5733374357223511, "learning_rate": 2e-05, "loss": 0.6465, "step": 510 }, { "epoch": 0.027215156748835505, "grad_norm": 0.4885842502117157, "learning_rate": 2e-05, "loss": 0.682, "step": 520 }, { "epoch": 0.02773852514785157, "grad_norm": 0.42785435914993286, "learning_rate": 2e-05, "loss": 0.6594, "step": 530 }, { "epoch": 0.02826189354686764, "grad_norm": 0.4955022931098938, "learning_rate": 2e-05, "loss": 0.6674, "step": 540 }, { "epoch": 0.028785261945883708, "grad_norm": 0.48021453619003296, "learning_rate": 2e-05, "loss": 0.6796, "step": 550 }, { "epoch": 0.029308630344899774, "grad_norm": 0.4767313301563263, "learning_rate": 2e-05, "loss": 0.6865, "step": 560 }, { "epoch": 0.029831998743915844, "grad_norm": 0.5284311771392822, "learning_rate": 2e-05, "loss": 0.6489, "step": 570 }, { "epoch": 0.03035536714293191, "grad_norm": 0.4461924731731415, "learning_rate": 2e-05, "loss": 0.686, "step": 580 }, { "epoch": 0.030878735541947977, "grad_norm": 0.45115983486175537, "learning_rate": 2e-05, "loss": 0.6539, "step": 590 }, { "epoch": 0.03140210394096404, "grad_norm": 0.5064119100570679, "learning_rate": 2e-05, "loss": 0.6946, "step": 600 }, { "epoch": 0.03192547233998011, "grad_norm": 0.5319550037384033, "learning_rate": 2e-05, "loss": 0.645, "step": 610 }, { "epoch": 0.032448840738996176, "grad_norm": 0.4419703781604767, "learning_rate": 2e-05, "loss": 0.7003, "step": 620 }, { "epoch": 0.03297220913801225, "grad_norm": 0.42887452244758606, "learning_rate": 2e-05, "loss": 0.6783, "step": 630 }, { "epoch": 0.033495577537028316, "grad_norm": 0.46661144495010376, "learning_rate": 2e-05, "loss": 0.6686, "step": 640 }, { "epoch": 0.03401894593604438, "grad_norm": 0.5283986330032349, "learning_rate": 2e-05, "loss": 0.6679, "step": 650 }, { "epoch": 0.03454231433506045, "grad_norm": 0.5113454461097717, "learning_rate": 2e-05, "loss": 0.6506, "step": 660 }, { "epoch": 0.035065682734076516, "grad_norm": 0.4744948148727417, "learning_rate": 2e-05, "loss": 0.6724, "step": 670 }, { "epoch": 0.03558905113309258, "grad_norm": 0.49696066975593567, "learning_rate": 2e-05, "loss": 0.6652, "step": 680 }, { "epoch": 0.03611241953210865, "grad_norm": 0.7813011407852173, "learning_rate": 2e-05, "loss": 0.6621, "step": 690 }, { "epoch": 0.03663578793112472, "grad_norm": 0.49424248933792114, "learning_rate": 2e-05, "loss": 0.6727, "step": 700 }, { "epoch": 0.03715915633014079, "grad_norm": 0.4447154104709625, "learning_rate": 2e-05, "loss": 0.6659, "step": 710 }, { "epoch": 0.037682524729156855, "grad_norm": 0.44892066717147827, "learning_rate": 2e-05, "loss": 0.6554, "step": 720 }, { "epoch": 0.03820589312817292, "grad_norm": 0.49734535813331604, "learning_rate": 2e-05, "loss": 0.6779, "step": 730 }, { "epoch": 0.03872926152718899, "grad_norm": 0.5591990947723389, "learning_rate": 2e-05, "loss": 0.6927, "step": 740 }, { "epoch": 0.039252629926205054, "grad_norm": 0.45224255323410034, "learning_rate": 2e-05, "loss": 0.6398, "step": 750 }, { "epoch": 0.03977599832522112, "grad_norm": 0.41793182492256165, "learning_rate": 2e-05, "loss": 0.6668, "step": 760 }, { "epoch": 0.04029936672423719, "grad_norm": 0.43993815779685974, "learning_rate": 2e-05, "loss": 0.6456, "step": 770 }, { "epoch": 0.04082273512325326, "grad_norm": 0.44372230768203735, "learning_rate": 2e-05, "loss": 0.6669, "step": 780 }, { "epoch": 0.04134610352226933, "grad_norm": 0.4827944040298462, "learning_rate": 2e-05, "loss": 0.657, "step": 790 }, { "epoch": 0.041869471921285394, "grad_norm": 0.4187488257884979, "learning_rate": 2e-05, "loss": 0.6456, "step": 800 }, { "epoch": 0.04239284032030146, "grad_norm": 0.47213008999824524, "learning_rate": 2e-05, "loss": 0.6555, "step": 810 }, { "epoch": 0.042916208719317527, "grad_norm": 0.43557852506637573, "learning_rate": 2e-05, "loss": 0.6545, "step": 820 }, { "epoch": 0.04343957711833359, "grad_norm": 0.45871806144714355, "learning_rate": 2e-05, "loss": 0.6538, "step": 830 }, { "epoch": 0.04396294551734966, "grad_norm": 0.46028947830200195, "learning_rate": 2e-05, "loss": 0.6356, "step": 840 }, { "epoch": 0.04448631391636573, "grad_norm": 0.548116147518158, "learning_rate": 2e-05, "loss": 0.6872, "step": 850 }, { "epoch": 0.0450096823153818, "grad_norm": 0.49427151679992676, "learning_rate": 2e-05, "loss": 0.6372, "step": 860 }, { "epoch": 0.045533050714397866, "grad_norm": 0.46103739738464355, "learning_rate": 2e-05, "loss": 0.6991, "step": 870 }, { "epoch": 0.04605641911341393, "grad_norm": 0.4400480091571808, "learning_rate": 2e-05, "loss": 0.667, "step": 880 }, { "epoch": 0.04657978751243, "grad_norm": 0.45002153515815735, "learning_rate": 2e-05, "loss": 0.6582, "step": 890 }, { "epoch": 0.047103155911446065, "grad_norm": 0.44472604990005493, "learning_rate": 2e-05, "loss": 0.6706, "step": 900 }, { "epoch": 0.04762652431046213, "grad_norm": 0.4121211767196655, "learning_rate": 2e-05, "loss": 0.6602, "step": 910 }, { "epoch": 0.048149892709478205, "grad_norm": 0.5010108351707458, "learning_rate": 2e-05, "loss": 0.6761, "step": 920 }, { "epoch": 0.04867326110849427, "grad_norm": 0.45920342206954956, "learning_rate": 2e-05, "loss": 0.6671, "step": 930 }, { "epoch": 0.04919662950751034, "grad_norm": 0.5177173018455505, "learning_rate": 2e-05, "loss": 0.652, "step": 940 }, { "epoch": 0.049719997906526404, "grad_norm": 0.49086499214172363, "learning_rate": 2e-05, "loss": 0.6795, "step": 950 }, { "epoch": 0.05024336630554247, "grad_norm": 0.582841157913208, "learning_rate": 2e-05, "loss": 0.6376, "step": 960 }, { "epoch": 0.05076673470455854, "grad_norm": 0.4690440595149994, "learning_rate": 2e-05, "loss": 0.6465, "step": 970 }, { "epoch": 0.051290103103574604, "grad_norm": 0.45363402366638184, "learning_rate": 2e-05, "loss": 0.6511, "step": 980 }, { "epoch": 0.05181347150259067, "grad_norm": 0.43920376896858215, "learning_rate": 2e-05, "loss": 0.6943, "step": 990 }, { "epoch": 0.052336839901606744, "grad_norm": 0.421144038438797, "learning_rate": 2e-05, "loss": 0.6434, "step": 1000 }, { "epoch": 0.05286020830062281, "grad_norm": 0.45188188552856445, "learning_rate": 2e-05, "loss": 0.6467, "step": 1010 }, { "epoch": 0.05338357669963888, "grad_norm": 0.4339853823184967, "learning_rate": 2e-05, "loss": 0.6596, "step": 1020 }, { "epoch": 0.05390694509865494, "grad_norm": 0.4234607517719269, "learning_rate": 2e-05, "loss": 0.674, "step": 1030 }, { "epoch": 0.05443031349767101, "grad_norm": 0.46552717685699463, "learning_rate": 2e-05, "loss": 0.6649, "step": 1040 }, { "epoch": 0.054953681896687076, "grad_norm": 0.4405843913555145, "learning_rate": 2e-05, "loss": 0.6577, "step": 1050 }, { "epoch": 0.05547705029570314, "grad_norm": 0.5044958591461182, "learning_rate": 2e-05, "loss": 0.6152, "step": 1060 }, { "epoch": 0.056000418694719216, "grad_norm": 0.43265852332115173, "learning_rate": 2e-05, "loss": 0.6317, "step": 1070 }, { "epoch": 0.05652378709373528, "grad_norm": 0.41526952385902405, "learning_rate": 2e-05, "loss": 0.6501, "step": 1080 }, { "epoch": 0.05704715549275135, "grad_norm": 0.43947693705558777, "learning_rate": 2e-05, "loss": 0.6542, "step": 1090 }, { "epoch": 0.057570523891767415, "grad_norm": 0.4375130534172058, "learning_rate": 2e-05, "loss": 0.671, "step": 1100 }, { "epoch": 0.05809389229078348, "grad_norm": 0.4554004371166229, "learning_rate": 2e-05, "loss": 0.6507, "step": 1110 }, { "epoch": 0.05861726068979955, "grad_norm": 0.5064834356307983, "learning_rate": 2e-05, "loss": 0.6467, "step": 1120 }, { "epoch": 0.059140629088815615, "grad_norm": 0.446809321641922, "learning_rate": 2e-05, "loss": 0.6751, "step": 1130 }, { "epoch": 0.05966399748783169, "grad_norm": 0.4745899736881256, "learning_rate": 2e-05, "loss": 0.6564, "step": 1140 }, { "epoch": 0.060187365886847755, "grad_norm": 0.5119066834449768, "learning_rate": 2e-05, "loss": 0.6618, "step": 1150 }, { "epoch": 0.06071073428586382, "grad_norm": 0.41898113489151, "learning_rate": 2e-05, "loss": 0.6622, "step": 1160 }, { "epoch": 0.06123410268487989, "grad_norm": 0.6409226059913635, "learning_rate": 2e-05, "loss": 0.6708, "step": 1170 }, { "epoch": 0.061757471083895954, "grad_norm": 0.439377099275589, "learning_rate": 2e-05, "loss": 0.6473, "step": 1180 }, { "epoch": 0.06228083948291202, "grad_norm": 0.4160749316215515, "learning_rate": 2e-05, "loss": 0.6798, "step": 1190 }, { "epoch": 0.06280420788192809, "grad_norm": 0.5204553604125977, "learning_rate": 2e-05, "loss": 0.6866, "step": 1200 }, { "epoch": 0.06332757628094415, "grad_norm": 0.48897305130958557, "learning_rate": 2e-05, "loss": 0.6618, "step": 1210 }, { "epoch": 0.06385094467996022, "grad_norm": 0.45014750957489014, "learning_rate": 2e-05, "loss": 0.6647, "step": 1220 }, { "epoch": 0.06437431307897629, "grad_norm": 0.4595189690589905, "learning_rate": 2e-05, "loss": 0.6625, "step": 1230 }, { "epoch": 0.06489768147799235, "grad_norm": 0.49671754240989685, "learning_rate": 2e-05, "loss": 0.663, "step": 1240 }, { "epoch": 0.06542104987700843, "grad_norm": 0.44070637226104736, "learning_rate": 2e-05, "loss": 0.6613, "step": 1250 }, { "epoch": 0.0659444182760245, "grad_norm": 0.45897576212882996, "learning_rate": 2e-05, "loss": 0.6516, "step": 1260 }, { "epoch": 0.06646778667504057, "grad_norm": 0.4450547695159912, "learning_rate": 2e-05, "loss": 0.641, "step": 1270 }, { "epoch": 0.06699115507405663, "grad_norm": 0.4288750886917114, "learning_rate": 2e-05, "loss": 0.6656, "step": 1280 }, { "epoch": 0.0675145234730727, "grad_norm": 0.47525206208229065, "learning_rate": 2e-05, "loss": 0.6915, "step": 1290 }, { "epoch": 0.06803789187208877, "grad_norm": 0.41285258531570435, "learning_rate": 2e-05, "loss": 0.6401, "step": 1300 }, { "epoch": 0.06856126027110483, "grad_norm": 0.46445295214653015, "learning_rate": 2e-05, "loss": 0.6692, "step": 1310 }, { "epoch": 0.0690846286701209, "grad_norm": 0.44153061509132385, "learning_rate": 2e-05, "loss": 0.6291, "step": 1320 }, { "epoch": 0.06960799706913696, "grad_norm": 0.7016943693161011, "learning_rate": 2e-05, "loss": 0.6405, "step": 1330 }, { "epoch": 0.07013136546815303, "grad_norm": 0.498710572719574, "learning_rate": 2e-05, "loss": 0.6433, "step": 1340 }, { "epoch": 0.0706547338671691, "grad_norm": 0.4415338337421417, "learning_rate": 2e-05, "loss": 0.673, "step": 1350 }, { "epoch": 0.07117810226618516, "grad_norm": 0.5377183556556702, "learning_rate": 2e-05, "loss": 0.6556, "step": 1360 }, { "epoch": 0.07170147066520123, "grad_norm": 0.40461525321006775, "learning_rate": 2e-05, "loss": 0.6384, "step": 1370 }, { "epoch": 0.0722248390642173, "grad_norm": 0.4240797758102417, "learning_rate": 2e-05, "loss": 0.6467, "step": 1380 }, { "epoch": 0.07274820746323336, "grad_norm": 0.4052056074142456, "learning_rate": 2e-05, "loss": 0.6448, "step": 1390 }, { "epoch": 0.07327157586224944, "grad_norm": 0.41825127601623535, "learning_rate": 2e-05, "loss": 0.6465, "step": 1400 }, { "epoch": 0.07379494426126551, "grad_norm": 0.41024652123451233, "learning_rate": 2e-05, "loss": 0.6428, "step": 1410 }, { "epoch": 0.07431831266028158, "grad_norm": 0.38469892740249634, "learning_rate": 2e-05, "loss": 0.6652, "step": 1420 }, { "epoch": 0.07484168105929764, "grad_norm": 0.4639175236225128, "learning_rate": 2e-05, "loss": 0.6503, "step": 1430 }, { "epoch": 0.07536504945831371, "grad_norm": 0.4508153200149536, "learning_rate": 2e-05, "loss": 0.6464, "step": 1440 }, { "epoch": 0.07588841785732978, "grad_norm": 0.5173973441123962, "learning_rate": 2e-05, "loss": 0.6475, "step": 1450 }, { "epoch": 0.07641178625634584, "grad_norm": 0.47181883454322815, "learning_rate": 2e-05, "loss": 0.6662, "step": 1460 }, { "epoch": 0.07693515465536191, "grad_norm": 0.43690988421440125, "learning_rate": 2e-05, "loss": 0.6459, "step": 1470 }, { "epoch": 0.07745852305437798, "grad_norm": 0.40047961473464966, "learning_rate": 2e-05, "loss": 0.6808, "step": 1480 }, { "epoch": 0.07798189145339404, "grad_norm": 0.3962308466434479, "learning_rate": 2e-05, "loss": 0.6249, "step": 1490 }, { "epoch": 0.07850525985241011, "grad_norm": 0.5075916051864624, "learning_rate": 2e-05, "loss": 0.6562, "step": 1500 }, { "epoch": 0.07902862825142618, "grad_norm": 0.44439756870269775, "learning_rate": 2e-05, "loss": 0.6744, "step": 1510 }, { "epoch": 0.07955199665044224, "grad_norm": 0.4172062575817108, "learning_rate": 2e-05, "loss": 0.6328, "step": 1520 }, { "epoch": 0.08007536504945831, "grad_norm": 0.9272112250328064, "learning_rate": 2e-05, "loss": 0.6554, "step": 1530 }, { "epoch": 0.08059873344847437, "grad_norm": 0.44365498423576355, "learning_rate": 2e-05, "loss": 0.6567, "step": 1540 }, { "epoch": 0.08112210184749045, "grad_norm": 0.5808505415916443, "learning_rate": 2e-05, "loss": 0.6671, "step": 1550 }, { "epoch": 0.08164547024650652, "grad_norm": 0.4238007068634033, "learning_rate": 2e-05, "loss": 0.6655, "step": 1560 }, { "epoch": 0.08216883864552259, "grad_norm": 0.4158059358596802, "learning_rate": 2e-05, "loss": 0.6502, "step": 1570 }, { "epoch": 0.08269220704453865, "grad_norm": 0.4266833961009979, "learning_rate": 2e-05, "loss": 0.6389, "step": 1580 }, { "epoch": 0.08321557544355472, "grad_norm": 0.4183817505836487, "learning_rate": 2e-05, "loss": 0.6297, "step": 1590 }, { "epoch": 0.08373894384257079, "grad_norm": 0.4242572784423828, "learning_rate": 2e-05, "loss": 0.6575, "step": 1600 }, { "epoch": 0.08426231224158685, "grad_norm": 0.42805418372154236, "learning_rate": 2e-05, "loss": 0.6316, "step": 1610 }, { "epoch": 0.08478568064060292, "grad_norm": 0.441866010427475, "learning_rate": 2e-05, "loss": 0.6702, "step": 1620 }, { "epoch": 0.08530904903961899, "grad_norm": 0.4371151626110077, "learning_rate": 2e-05, "loss": 0.6623, "step": 1630 }, { "epoch": 0.08583241743863505, "grad_norm": 0.43131211400032043, "learning_rate": 2e-05, "loss": 0.6448, "step": 1640 }, { "epoch": 0.08635578583765112, "grad_norm": 0.4316512644290924, "learning_rate": 2e-05, "loss": 0.6374, "step": 1650 }, { "epoch": 0.08687915423666719, "grad_norm": 0.48419904708862305, "learning_rate": 2e-05, "loss": 0.6224, "step": 1660 }, { "epoch": 0.08740252263568325, "grad_norm": 0.3933804929256439, "learning_rate": 2e-05, "loss": 0.6522, "step": 1670 }, { "epoch": 0.08792589103469932, "grad_norm": 0.4437639117240906, "learning_rate": 2e-05, "loss": 0.6237, "step": 1680 }, { "epoch": 0.08844925943371539, "grad_norm": 0.4899040460586548, "learning_rate": 2e-05, "loss": 0.6321, "step": 1690 }, { "epoch": 0.08897262783273147, "grad_norm": 0.4382249712944031, "learning_rate": 2e-05, "loss": 0.6469, "step": 1700 }, { "epoch": 0.08949599623174753, "grad_norm": 0.4095931053161621, "learning_rate": 2e-05, "loss": 0.6588, "step": 1710 }, { "epoch": 0.0900193646307636, "grad_norm": 0.43513184785842896, "learning_rate": 2e-05, "loss": 0.6569, "step": 1720 }, { "epoch": 0.09054273302977967, "grad_norm": 0.46793821454048157, "learning_rate": 2e-05, "loss": 0.6322, "step": 1730 }, { "epoch": 0.09106610142879573, "grad_norm": 0.430164098739624, "learning_rate": 2e-05, "loss": 0.6224, "step": 1740 }, { "epoch": 0.0915894698278118, "grad_norm": 0.3761891722679138, "learning_rate": 2e-05, "loss": 0.606, "step": 1750 }, { "epoch": 0.09211283822682786, "grad_norm": 0.373146116733551, "learning_rate": 2e-05, "loss": 0.6329, "step": 1760 }, { "epoch": 0.09263620662584393, "grad_norm": 0.42644017934799194, "learning_rate": 2e-05, "loss": 0.6466, "step": 1770 }, { "epoch": 0.09315957502486, "grad_norm": 0.40171223878860474, "learning_rate": 2e-05, "loss": 0.6567, "step": 1780 }, { "epoch": 0.09368294342387606, "grad_norm": 0.5002732872962952, "learning_rate": 2e-05, "loss": 0.6645, "step": 1790 }, { "epoch": 0.09420631182289213, "grad_norm": 0.45148345828056335, "learning_rate": 2e-05, "loss": 0.6735, "step": 1800 }, { "epoch": 0.0947296802219082, "grad_norm": 0.4408950209617615, "learning_rate": 2e-05, "loss": 0.64, "step": 1810 }, { "epoch": 0.09525304862092426, "grad_norm": 0.41224032640457153, "learning_rate": 2e-05, "loss": 0.6483, "step": 1820 }, { "epoch": 0.09577641701994033, "grad_norm": 0.3857000768184662, "learning_rate": 2e-05, "loss": 0.6591, "step": 1830 }, { "epoch": 0.09629978541895641, "grad_norm": 0.5142344832420349, "learning_rate": 2e-05, "loss": 0.6613, "step": 1840 }, { "epoch": 0.09682315381797248, "grad_norm": 0.43707653880119324, "learning_rate": 2e-05, "loss": 0.6463, "step": 1850 }, { "epoch": 0.09734652221698854, "grad_norm": 0.5951546430587769, "learning_rate": 2e-05, "loss": 0.6634, "step": 1860 }, { "epoch": 0.09786989061600461, "grad_norm": 0.451498419046402, "learning_rate": 2e-05, "loss": 0.6228, "step": 1870 }, { "epoch": 0.09839325901502068, "grad_norm": 0.43872302770614624, "learning_rate": 2e-05, "loss": 0.6417, "step": 1880 }, { "epoch": 0.09891662741403674, "grad_norm": 0.3905869722366333, "learning_rate": 2e-05, "loss": 0.6195, "step": 1890 }, { "epoch": 0.09943999581305281, "grad_norm": 0.46226704120635986, "learning_rate": 2e-05, "loss": 0.652, "step": 1900 }, { "epoch": 0.09996336421206888, "grad_norm": 0.4350249469280243, "learning_rate": 2e-05, "loss": 0.6814, "step": 1910 }, { "epoch": 0.10048673261108494, "grad_norm": 0.547003448009491, "learning_rate": 2e-05, "loss": 0.6376, "step": 1920 }, { "epoch": 0.10101010101010101, "grad_norm": 0.40520697832107544, "learning_rate": 2e-05, "loss": 0.6281, "step": 1930 }, { "epoch": 0.10153346940911707, "grad_norm": 0.3886966109275818, "learning_rate": 2e-05, "loss": 0.6349, "step": 1940 }, { "epoch": 0.10205683780813314, "grad_norm": 0.4416722059249878, "learning_rate": 2e-05, "loss": 0.6626, "step": 1950 }, { "epoch": 0.10258020620714921, "grad_norm": 0.4272310137748718, "learning_rate": 2e-05, "loss": 0.627, "step": 1960 }, { "epoch": 0.10310357460616527, "grad_norm": 0.4342178404331207, "learning_rate": 2e-05, "loss": 0.6616, "step": 1970 }, { "epoch": 0.10362694300518134, "grad_norm": 0.4413588047027588, "learning_rate": 2e-05, "loss": 0.6602, "step": 1980 }, { "epoch": 0.10415031140419742, "grad_norm": 0.39807382225990295, "learning_rate": 2e-05, "loss": 0.6184, "step": 1990 }, { "epoch": 0.10467367980321349, "grad_norm": 0.39922189712524414, "learning_rate": 2e-05, "loss": 0.6348, "step": 2000 }, { "epoch": 0.10519704820222955, "grad_norm": 0.4405508041381836, "learning_rate": 2e-05, "loss": 0.6527, "step": 2010 }, { "epoch": 0.10572041660124562, "grad_norm": 0.4154644310474396, "learning_rate": 2e-05, "loss": 0.6383, "step": 2020 }, { "epoch": 0.10624378500026169, "grad_norm": 0.4121659994125366, "learning_rate": 2e-05, "loss": 0.6337, "step": 2030 }, { "epoch": 0.10676715339927775, "grad_norm": 0.4231645166873932, "learning_rate": 2e-05, "loss": 0.6648, "step": 2040 }, { "epoch": 0.10729052179829382, "grad_norm": 0.5495308041572571, "learning_rate": 2e-05, "loss": 0.6655, "step": 2050 }, { "epoch": 0.10781389019730989, "grad_norm": 0.4083961546421051, "learning_rate": 2e-05, "loss": 0.6091, "step": 2060 }, { "epoch": 0.10833725859632595, "grad_norm": 0.394467830657959, "learning_rate": 2e-05, "loss": 0.6472, "step": 2070 }, { "epoch": 0.10886062699534202, "grad_norm": 0.4051300585269928, "learning_rate": 2e-05, "loss": 0.6295, "step": 2080 }, { "epoch": 0.10938399539435809, "grad_norm": 0.44103720784187317, "learning_rate": 2e-05, "loss": 0.6316, "step": 2090 }, { "epoch": 0.10990736379337415, "grad_norm": 0.4452396333217621, "learning_rate": 2e-05, "loss": 0.6367, "step": 2100 }, { "epoch": 0.11043073219239022, "grad_norm": 0.5510708689689636, "learning_rate": 2e-05, "loss": 0.6258, "step": 2110 }, { "epoch": 0.11095410059140629, "grad_norm": 0.5372933149337769, "learning_rate": 2e-05, "loss": 0.6476, "step": 2120 }, { "epoch": 0.11147746899042235, "grad_norm": 0.4383063316345215, "learning_rate": 2e-05, "loss": 0.6605, "step": 2130 }, { "epoch": 0.11200083738943843, "grad_norm": 0.4241836667060852, "learning_rate": 2e-05, "loss": 0.6362, "step": 2140 }, { "epoch": 0.1125242057884545, "grad_norm": 0.442451149225235, "learning_rate": 2e-05, "loss": 0.6433, "step": 2150 }, { "epoch": 0.11304757418747056, "grad_norm": 0.41505861282348633, "learning_rate": 2e-05, "loss": 0.6239, "step": 2160 }, { "epoch": 0.11357094258648663, "grad_norm": 0.43439918756484985, "learning_rate": 2e-05, "loss": 0.6274, "step": 2170 }, { "epoch": 0.1140943109855027, "grad_norm": 0.43937069177627563, "learning_rate": 2e-05, "loss": 0.6414, "step": 2180 }, { "epoch": 0.11461767938451876, "grad_norm": 0.43210020661354065, "learning_rate": 2e-05, "loss": 0.6257, "step": 2190 }, { "epoch": 0.11514104778353483, "grad_norm": 0.49416911602020264, "learning_rate": 2e-05, "loss": 0.6442, "step": 2200 }, { "epoch": 0.1156644161825509, "grad_norm": 0.40978503227233887, "learning_rate": 2e-05, "loss": 0.6329, "step": 2210 }, { "epoch": 0.11618778458156696, "grad_norm": 0.4340236485004425, "learning_rate": 2e-05, "loss": 0.6347, "step": 2220 }, { "epoch": 0.11671115298058303, "grad_norm": 0.41441839933395386, "learning_rate": 2e-05, "loss": 0.6205, "step": 2230 }, { "epoch": 0.1172345213795991, "grad_norm": 0.4365447461605072, "learning_rate": 2e-05, "loss": 0.6329, "step": 2240 }, { "epoch": 0.11775788977861516, "grad_norm": 0.44118615984916687, "learning_rate": 2e-05, "loss": 0.6549, "step": 2250 }, { "epoch": 0.11828125817763123, "grad_norm": 0.40321072936058044, "learning_rate": 2e-05, "loss": 0.6284, "step": 2260 }, { "epoch": 0.1188046265766473, "grad_norm": 0.4358213543891907, "learning_rate": 2e-05, "loss": 0.6375, "step": 2270 }, { "epoch": 0.11932799497566338, "grad_norm": 0.42884060740470886, "learning_rate": 2e-05, "loss": 0.6452, "step": 2280 }, { "epoch": 0.11985136337467944, "grad_norm": 0.43688151240348816, "learning_rate": 2e-05, "loss": 0.6433, "step": 2290 }, { "epoch": 0.12037473177369551, "grad_norm": 0.42834022641181946, "learning_rate": 2e-05, "loss": 0.6461, "step": 2300 }, { "epoch": 0.12089810017271158, "grad_norm": 0.44969525933265686, "learning_rate": 2e-05, "loss": 0.6704, "step": 2310 }, { "epoch": 0.12142146857172764, "grad_norm": 0.4053316116333008, "learning_rate": 2e-05, "loss": 0.6188, "step": 2320 }, { "epoch": 0.12194483697074371, "grad_norm": 0.3716852366924286, "learning_rate": 2e-05, "loss": 0.6249, "step": 2330 }, { "epoch": 0.12246820536975978, "grad_norm": 0.4359619617462158, "learning_rate": 2e-05, "loss": 0.6571, "step": 2340 }, { "epoch": 0.12299157376877584, "grad_norm": 0.38862133026123047, "learning_rate": 2e-05, "loss": 0.641, "step": 2350 }, { "epoch": 0.12351494216779191, "grad_norm": 0.4286133646965027, "learning_rate": 2e-05, "loss": 0.6514, "step": 2360 }, { "epoch": 0.12403831056680797, "grad_norm": 0.4758356809616089, "learning_rate": 2e-05, "loss": 0.628, "step": 2370 }, { "epoch": 0.12456167896582404, "grad_norm": 0.4074471592903137, "learning_rate": 2e-05, "loss": 0.6161, "step": 2380 }, { "epoch": 0.1250850473648401, "grad_norm": 0.4395975172519684, "learning_rate": 2e-05, "loss": 0.6514, "step": 2390 }, { "epoch": 0.12560841576385617, "grad_norm": 0.4212956130504608, "learning_rate": 2e-05, "loss": 0.6459, "step": 2400 }, { "epoch": 0.12613178416287224, "grad_norm": 0.43518325686454773, "learning_rate": 2e-05, "loss": 0.6631, "step": 2410 }, { "epoch": 0.1266551525618883, "grad_norm": 0.41669315099716187, "learning_rate": 2e-05, "loss": 0.6433, "step": 2420 }, { "epoch": 0.12717852096090437, "grad_norm": 0.47521886229515076, "learning_rate": 2e-05, "loss": 0.6008, "step": 2430 }, { "epoch": 0.12770188935992044, "grad_norm": 0.5306794047355652, "learning_rate": 2e-05, "loss": 0.6499, "step": 2440 }, { "epoch": 0.1282252577589365, "grad_norm": 0.4078957438468933, "learning_rate": 2e-05, "loss": 0.632, "step": 2450 }, { "epoch": 0.12874862615795257, "grad_norm": 0.4263654351234436, "learning_rate": 2e-05, "loss": 0.6367, "step": 2460 }, { "epoch": 0.12927199455696864, "grad_norm": 0.4139572083950043, "learning_rate": 2e-05, "loss": 0.642, "step": 2470 }, { "epoch": 0.1297953629559847, "grad_norm": 0.38871797919273376, "learning_rate": 2e-05, "loss": 0.6342, "step": 2480 }, { "epoch": 0.13031873135500077, "grad_norm": 0.429225891828537, "learning_rate": 2e-05, "loss": 0.6249, "step": 2490 }, { "epoch": 0.13084209975401687, "grad_norm": 0.45410633087158203, "learning_rate": 2e-05, "loss": 0.6395, "step": 2500 }, { "epoch": 0.13136546815303293, "grad_norm": 0.45400431752204895, "learning_rate": 2e-05, "loss": 0.6244, "step": 2510 }, { "epoch": 0.131888836552049, "grad_norm": 0.4065890312194824, "learning_rate": 2e-05, "loss": 0.6394, "step": 2520 }, { "epoch": 0.13241220495106507, "grad_norm": 0.4191737771034241, "learning_rate": 2e-05, "loss": 0.6409, "step": 2530 }, { "epoch": 0.13293557335008113, "grad_norm": 0.45096731185913086, "learning_rate": 2e-05, "loss": 0.6208, "step": 2540 }, { "epoch": 0.1334589417490972, "grad_norm": 0.46258044242858887, "learning_rate": 2e-05, "loss": 0.6395, "step": 2550 }, { "epoch": 0.13398231014811327, "grad_norm": 0.4282276928424835, "learning_rate": 2e-05, "loss": 0.601, "step": 2560 }, { "epoch": 0.13450567854712933, "grad_norm": 0.41605663299560547, "learning_rate": 2e-05, "loss": 0.6501, "step": 2570 }, { "epoch": 0.1350290469461454, "grad_norm": 0.41660454869270325, "learning_rate": 2e-05, "loss": 0.6546, "step": 2580 }, { "epoch": 0.13555241534516146, "grad_norm": 0.4275190234184265, "learning_rate": 2e-05, "loss": 0.6458, "step": 2590 }, { "epoch": 0.13607578374417753, "grad_norm": 0.4305119514465332, "learning_rate": 2e-05, "loss": 0.6403, "step": 2600 }, { "epoch": 0.1365991521431936, "grad_norm": 0.42454832792282104, "learning_rate": 2e-05, "loss": 0.6368, "step": 2610 }, { "epoch": 0.13712252054220966, "grad_norm": 0.44257181882858276, "learning_rate": 2e-05, "loss": 0.6343, "step": 2620 }, { "epoch": 0.13764588894122573, "grad_norm": 0.3995290696620941, "learning_rate": 2e-05, "loss": 0.6616, "step": 2630 }, { "epoch": 0.1381692573402418, "grad_norm": 0.4199754297733307, "learning_rate": 2e-05, "loss": 0.6286, "step": 2640 }, { "epoch": 0.13869262573925786, "grad_norm": 0.42020726203918457, "learning_rate": 2e-05, "loss": 0.6371, "step": 2650 }, { "epoch": 0.13921599413827393, "grad_norm": 0.39368361234664917, "learning_rate": 2e-05, "loss": 0.6517, "step": 2660 }, { "epoch": 0.13973936253729, "grad_norm": 0.4302023947238922, "learning_rate": 2e-05, "loss": 0.6139, "step": 2670 }, { "epoch": 0.14026273093630606, "grad_norm": 0.49658092856407166, "learning_rate": 2e-05, "loss": 0.6565, "step": 2680 }, { "epoch": 0.14078609933532213, "grad_norm": 0.3941155672073364, "learning_rate": 2e-05, "loss": 0.6527, "step": 2690 }, { "epoch": 0.1413094677343382, "grad_norm": 0.43608132004737854, "learning_rate": 2e-05, "loss": 0.6309, "step": 2700 }, { "epoch": 0.14183283613335426, "grad_norm": 0.4120804965496063, "learning_rate": 2e-05, "loss": 0.6326, "step": 2710 }, { "epoch": 0.14235620453237033, "grad_norm": 0.4378657639026642, "learning_rate": 2e-05, "loss": 0.6479, "step": 2720 }, { "epoch": 0.1428795729313864, "grad_norm": 0.39626598358154297, "learning_rate": 2e-05, "loss": 0.6537, "step": 2730 }, { "epoch": 0.14340294133040246, "grad_norm": 0.40195828676223755, "learning_rate": 2e-05, "loss": 0.6075, "step": 2740 }, { "epoch": 0.14392630972941853, "grad_norm": 0.3953752815723419, "learning_rate": 2e-05, "loss": 0.6179, "step": 2750 }, { "epoch": 0.1444496781284346, "grad_norm": 0.4433000385761261, "learning_rate": 2e-05, "loss": 0.6743, "step": 2760 }, { "epoch": 0.14497304652745066, "grad_norm": 0.42893922328948975, "learning_rate": 2e-05, "loss": 0.6272, "step": 2770 }, { "epoch": 0.14549641492646673, "grad_norm": 0.4065708518028259, "learning_rate": 2e-05, "loss": 0.6417, "step": 2780 }, { "epoch": 0.1460197833254828, "grad_norm": 0.4181337058544159, "learning_rate": 2e-05, "loss": 0.6392, "step": 2790 }, { "epoch": 0.1465431517244989, "grad_norm": 0.4179243743419647, "learning_rate": 2e-05, "loss": 0.6026, "step": 2800 }, { "epoch": 0.14706652012351495, "grad_norm": 0.46388933062553406, "learning_rate": 2e-05, "loss": 0.6335, "step": 2810 }, { "epoch": 0.14758988852253102, "grad_norm": 0.4350208640098572, "learning_rate": 2e-05, "loss": 0.6349, "step": 2820 }, { "epoch": 0.1481132569215471, "grad_norm": 0.4281371831893921, "learning_rate": 2e-05, "loss": 0.5927, "step": 2830 }, { "epoch": 0.14863662532056315, "grad_norm": 0.3796765208244324, "learning_rate": 2e-05, "loss": 0.6244, "step": 2840 }, { "epoch": 0.14915999371957922, "grad_norm": 0.400057315826416, "learning_rate": 2e-05, "loss": 0.6083, "step": 2850 }, { "epoch": 0.1496833621185953, "grad_norm": 0.5580277442932129, "learning_rate": 2e-05, "loss": 0.6088, "step": 2860 }, { "epoch": 0.15020673051761135, "grad_norm": 0.4220695197582245, "learning_rate": 2e-05, "loss": 0.6339, "step": 2870 }, { "epoch": 0.15073009891662742, "grad_norm": 0.4196612536907196, "learning_rate": 2e-05, "loss": 0.6415, "step": 2880 }, { "epoch": 0.1512534673156435, "grad_norm": 0.4167044162750244, "learning_rate": 2e-05, "loss": 0.6276, "step": 2890 }, { "epoch": 0.15177683571465955, "grad_norm": 0.4121061861515045, "learning_rate": 2e-05, "loss": 0.6311, "step": 2900 }, { "epoch": 0.15230020411367562, "grad_norm": 0.4583412706851959, "learning_rate": 2e-05, "loss": 0.6415, "step": 2910 }, { "epoch": 0.15282357251269169, "grad_norm": 0.4203738272190094, "learning_rate": 2e-05, "loss": 0.657, "step": 2920 }, { "epoch": 0.15334694091170775, "grad_norm": 0.4278572201728821, "learning_rate": 2e-05, "loss": 0.6457, "step": 2930 }, { "epoch": 0.15387030931072382, "grad_norm": 0.41517725586891174, "learning_rate": 2e-05, "loss": 0.6506, "step": 2940 }, { "epoch": 0.15439367770973988, "grad_norm": 0.39440619945526123, "learning_rate": 2e-05, "loss": 0.6247, "step": 2950 }, { "epoch": 0.15491704610875595, "grad_norm": 0.3762326240539551, "learning_rate": 2e-05, "loss": 0.6464, "step": 2960 }, { "epoch": 0.15544041450777202, "grad_norm": 0.43617796897888184, "learning_rate": 2e-05, "loss": 0.6162, "step": 2970 }, { "epoch": 0.15596378290678808, "grad_norm": 0.41636911034584045, "learning_rate": 2e-05, "loss": 0.6327, "step": 2980 }, { "epoch": 0.15648715130580415, "grad_norm": 0.4136853814125061, "learning_rate": 2e-05, "loss": 0.6292, "step": 2990 }, { "epoch": 0.15701051970482022, "grad_norm": 0.44505634903907776, "learning_rate": 2e-05, "loss": 0.646, "step": 3000 }, { "epoch": 0.15753388810383628, "grad_norm": 0.42681798338890076, "learning_rate": 2e-05, "loss": 0.6274, "step": 3010 }, { "epoch": 0.15805725650285235, "grad_norm": 0.3740960657596588, "learning_rate": 2e-05, "loss": 0.6233, "step": 3020 }, { "epoch": 0.15858062490186842, "grad_norm": 0.4044531285762787, "learning_rate": 2e-05, "loss": 0.655, "step": 3030 }, { "epoch": 0.15910399330088448, "grad_norm": 0.38664835691452026, "learning_rate": 2e-05, "loss": 0.6201, "step": 3040 }, { "epoch": 0.15962736169990055, "grad_norm": 0.5274628400802612, "learning_rate": 2e-05, "loss": 0.6374, "step": 3050 }, { "epoch": 0.16015073009891662, "grad_norm": 0.4279114305973053, "learning_rate": 2e-05, "loss": 0.6433, "step": 3060 }, { "epoch": 0.16067409849793268, "grad_norm": 0.396634578704834, "learning_rate": 2e-05, "loss": 0.6155, "step": 3070 }, { "epoch": 0.16119746689694875, "grad_norm": 0.41256171464920044, "learning_rate": 2e-05, "loss": 0.6274, "step": 3080 }, { "epoch": 0.16172083529596484, "grad_norm": 0.47806742787361145, "learning_rate": 2e-05, "loss": 0.6288, "step": 3090 }, { "epoch": 0.1622442036949809, "grad_norm": 0.41482001543045044, "learning_rate": 2e-05, "loss": 0.6097, "step": 3100 }, { "epoch": 0.16276757209399698, "grad_norm": 0.4124285876750946, "learning_rate": 2e-05, "loss": 0.6381, "step": 3110 }, { "epoch": 0.16329094049301304, "grad_norm": 0.39308762550354004, "learning_rate": 2e-05, "loss": 0.6418, "step": 3120 }, { "epoch": 0.1638143088920291, "grad_norm": 0.5976954698562622, "learning_rate": 2e-05, "loss": 0.6403, "step": 3130 }, { "epoch": 0.16433767729104518, "grad_norm": 0.4556901752948761, "learning_rate": 2e-05, "loss": 0.6415, "step": 3140 }, { "epoch": 0.16486104569006124, "grad_norm": 0.4634074866771698, "learning_rate": 2e-05, "loss": 0.6142, "step": 3150 }, { "epoch": 0.1653844140890773, "grad_norm": 0.4238816797733307, "learning_rate": 2e-05, "loss": 0.6528, "step": 3160 }, { "epoch": 0.16590778248809337, "grad_norm": 0.5388637185096741, "learning_rate": 2e-05, "loss": 0.6723, "step": 3170 }, { "epoch": 0.16643115088710944, "grad_norm": 0.3934621512889862, "learning_rate": 2e-05, "loss": 0.6347, "step": 3180 }, { "epoch": 0.1669545192861255, "grad_norm": 0.3961109519004822, "learning_rate": 2e-05, "loss": 0.6345, "step": 3190 }, { "epoch": 0.16747788768514157, "grad_norm": 0.41134336590766907, "learning_rate": 2e-05, "loss": 0.6227, "step": 3200 }, { "epoch": 0.16800125608415764, "grad_norm": 0.4064910411834717, "learning_rate": 2e-05, "loss": 0.6087, "step": 3210 }, { "epoch": 0.1685246244831737, "grad_norm": 0.411873459815979, "learning_rate": 2e-05, "loss": 0.6291, "step": 3220 }, { "epoch": 0.16904799288218977, "grad_norm": 0.41122299432754517, "learning_rate": 2e-05, "loss": 0.6217, "step": 3230 }, { "epoch": 0.16957136128120584, "grad_norm": 0.4552735686302185, "learning_rate": 2e-05, "loss": 0.6334, "step": 3240 }, { "epoch": 0.1700947296802219, "grad_norm": 0.457132488489151, "learning_rate": 2e-05, "loss": 0.6213, "step": 3250 }, { "epoch": 0.17061809807923797, "grad_norm": 0.38603243231773376, "learning_rate": 2e-05, "loss": 0.6363, "step": 3260 }, { "epoch": 0.17114146647825404, "grad_norm": 0.4321597218513489, "learning_rate": 2e-05, "loss": 0.6194, "step": 3270 }, { "epoch": 0.1716648348772701, "grad_norm": 0.43034639954566956, "learning_rate": 2e-05, "loss": 0.6409, "step": 3280 }, { "epoch": 0.17218820327628617, "grad_norm": 0.42103973031044006, "learning_rate": 2e-05, "loss": 0.6154, "step": 3290 }, { "epoch": 0.17271157167530224, "grad_norm": 0.3927100896835327, "learning_rate": 2e-05, "loss": 0.6313, "step": 3300 }, { "epoch": 0.1732349400743183, "grad_norm": 0.4339587688446045, "learning_rate": 2e-05, "loss": 0.614, "step": 3310 }, { "epoch": 0.17375830847333437, "grad_norm": 0.40991151332855225, "learning_rate": 2e-05, "loss": 0.6456, "step": 3320 }, { "epoch": 0.17428167687235044, "grad_norm": 0.4325578808784485, "learning_rate": 2e-05, "loss": 0.6041, "step": 3330 }, { "epoch": 0.1748050452713665, "grad_norm": 0.41213691234588623, "learning_rate": 2e-05, "loss": 0.6349, "step": 3340 }, { "epoch": 0.17532841367038257, "grad_norm": 0.47782137989997864, "learning_rate": 2e-05, "loss": 0.636, "step": 3350 }, { "epoch": 0.17585178206939864, "grad_norm": 0.42506250739097595, "learning_rate": 2e-05, "loss": 0.626, "step": 3360 }, { "epoch": 0.1763751504684147, "grad_norm": 0.3940761983394623, "learning_rate": 2e-05, "loss": 0.6193, "step": 3370 }, { "epoch": 0.17689851886743077, "grad_norm": 0.4069708287715912, "learning_rate": 2e-05, "loss": 0.6365, "step": 3380 }, { "epoch": 0.17742188726644686, "grad_norm": 0.504355788230896, "learning_rate": 2e-05, "loss": 0.5985, "step": 3390 }, { "epoch": 0.17794525566546293, "grad_norm": 0.3881029486656189, "learning_rate": 2e-05, "loss": 0.6328, "step": 3400 }, { "epoch": 0.178468624064479, "grad_norm": 2.036409854888916, "learning_rate": 2e-05, "loss": 0.6237, "step": 3410 }, { "epoch": 0.17899199246349506, "grad_norm": 0.41256919503211975, "learning_rate": 2e-05, "loss": 0.6066, "step": 3420 }, { "epoch": 0.17951536086251113, "grad_norm": 0.4488495886325836, "learning_rate": 2e-05, "loss": 0.6247, "step": 3430 }, { "epoch": 0.1800387292615272, "grad_norm": 0.4205232560634613, "learning_rate": 2e-05, "loss": 0.6094, "step": 3440 }, { "epoch": 0.18056209766054326, "grad_norm": 0.4089616537094116, "learning_rate": 2e-05, "loss": 0.6264, "step": 3450 }, { "epoch": 0.18108546605955933, "grad_norm": 0.37557995319366455, "learning_rate": 2e-05, "loss": 0.6322, "step": 3460 }, { "epoch": 0.1816088344585754, "grad_norm": 0.39397501945495605, "learning_rate": 2e-05, "loss": 0.6647, "step": 3470 }, { "epoch": 0.18213220285759146, "grad_norm": 0.4009655714035034, "learning_rate": 2e-05, "loss": 0.6203, "step": 3480 }, { "epoch": 0.18265557125660753, "grad_norm": 0.40983593463897705, "learning_rate": 2e-05, "loss": 0.6684, "step": 3490 }, { "epoch": 0.1831789396556236, "grad_norm": 0.41632992029190063, "learning_rate": 2e-05, "loss": 0.6055, "step": 3500 }, { "epoch": 0.18370230805463966, "grad_norm": 0.42826464772224426, "learning_rate": 2e-05, "loss": 0.6114, "step": 3510 }, { "epoch": 0.18422567645365573, "grad_norm": 0.4451156556606293, "learning_rate": 2e-05, "loss": 0.6164, "step": 3520 }, { "epoch": 0.1847490448526718, "grad_norm": 0.7244383692741394, "learning_rate": 2e-05, "loss": 0.643, "step": 3530 }, { "epoch": 0.18527241325168786, "grad_norm": 0.41192492842674255, "learning_rate": 2e-05, "loss": 0.6389, "step": 3540 }, { "epoch": 0.18579578165070393, "grad_norm": 0.42937004566192627, "learning_rate": 2e-05, "loss": 0.6449, "step": 3550 }, { "epoch": 0.18631915004972, "grad_norm": 0.4111078977584839, "learning_rate": 2e-05, "loss": 0.6202, "step": 3560 }, { "epoch": 0.18684251844873606, "grad_norm": 0.4172969460487366, "learning_rate": 2e-05, "loss": 0.6188, "step": 3570 }, { "epoch": 0.18736588684775213, "grad_norm": 0.38246381282806396, "learning_rate": 2e-05, "loss": 0.609, "step": 3580 }, { "epoch": 0.1878892552467682, "grad_norm": 0.467737078666687, "learning_rate": 2e-05, "loss": 0.6177, "step": 3590 }, { "epoch": 0.18841262364578426, "grad_norm": 0.3787391185760498, "learning_rate": 2e-05, "loss": 0.6156, "step": 3600 }, { "epoch": 0.18893599204480033, "grad_norm": 0.39074644446372986, "learning_rate": 2e-05, "loss": 0.6275, "step": 3610 }, { "epoch": 0.1894593604438164, "grad_norm": 0.4353400468826294, "learning_rate": 2e-05, "loss": 0.613, "step": 3620 }, { "epoch": 0.18998272884283246, "grad_norm": 0.4572504758834839, "learning_rate": 2e-05, "loss": 0.6243, "step": 3630 }, { "epoch": 0.19050609724184853, "grad_norm": 0.3868942856788635, "learning_rate": 2e-05, "loss": 0.6303, "step": 3640 }, { "epoch": 0.1910294656408646, "grad_norm": 0.41320866346359253, "learning_rate": 2e-05, "loss": 0.6255, "step": 3650 }, { "epoch": 0.19155283403988066, "grad_norm": 0.39754143357276917, "learning_rate": 2e-05, "loss": 0.6064, "step": 3660 }, { "epoch": 0.19207620243889673, "grad_norm": 0.45954880118370056, "learning_rate": 2e-05, "loss": 0.6355, "step": 3670 }, { "epoch": 0.19259957083791282, "grad_norm": 0.42518895864486694, "learning_rate": 2e-05, "loss": 0.6339, "step": 3680 }, { "epoch": 0.1931229392369289, "grad_norm": 0.40126708149909973, "learning_rate": 2e-05, "loss": 0.6226, "step": 3690 }, { "epoch": 0.19364630763594495, "grad_norm": 0.5110933184623718, "learning_rate": 2e-05, "loss": 0.6236, "step": 3700 }, { "epoch": 0.19416967603496102, "grad_norm": 0.4530631899833679, "learning_rate": 2e-05, "loss": 0.6132, "step": 3710 }, { "epoch": 0.19469304443397709, "grad_norm": 0.40570759773254395, "learning_rate": 2e-05, "loss": 0.6205, "step": 3720 }, { "epoch": 0.19521641283299315, "grad_norm": 0.4424304962158203, "learning_rate": 2e-05, "loss": 0.6318, "step": 3730 }, { "epoch": 0.19573978123200922, "grad_norm": 0.4104612171649933, "learning_rate": 2e-05, "loss": 0.6112, "step": 3740 }, { "epoch": 0.19626314963102529, "grad_norm": 0.4605982303619385, "learning_rate": 2e-05, "loss": 0.63, "step": 3750 }, { "epoch": 0.19678651803004135, "grad_norm": 0.41476568579673767, "learning_rate": 2e-05, "loss": 0.6301, "step": 3760 }, { "epoch": 0.19730988642905742, "grad_norm": 0.4510325491428375, "learning_rate": 2e-05, "loss": 0.6311, "step": 3770 }, { "epoch": 0.19783325482807348, "grad_norm": 0.3622564673423767, "learning_rate": 2e-05, "loss": 0.6028, "step": 3780 }, { "epoch": 0.19835662322708955, "grad_norm": 0.40758174657821655, "learning_rate": 2e-05, "loss": 0.6328, "step": 3790 }, { "epoch": 0.19887999162610562, "grad_norm": 0.42536821961402893, "learning_rate": 2e-05, "loss": 0.6343, "step": 3800 }, { "epoch": 0.19940336002512168, "grad_norm": 0.4246145486831665, "learning_rate": 2e-05, "loss": 0.617, "step": 3810 }, { "epoch": 0.19992672842413775, "grad_norm": 0.4054490327835083, "learning_rate": 2e-05, "loss": 0.6374, "step": 3820 }, { "epoch": 0.20045009682315382, "grad_norm": 0.4975704848766327, "learning_rate": 2e-05, "loss": 0.6006, "step": 3830 }, { "epoch": 0.20097346522216988, "grad_norm": 0.5053114891052246, "learning_rate": 2e-05, "loss": 0.6319, "step": 3840 }, { "epoch": 0.20149683362118595, "grad_norm": 0.41113340854644775, "learning_rate": 2e-05, "loss": 0.6342, "step": 3850 }, { "epoch": 0.20202020202020202, "grad_norm": 0.3836223781108856, "learning_rate": 2e-05, "loss": 0.6196, "step": 3860 }, { "epoch": 0.20254357041921808, "grad_norm": 0.3937544822692871, "learning_rate": 2e-05, "loss": 0.641, "step": 3870 }, { "epoch": 0.20306693881823415, "grad_norm": 0.4237481951713562, "learning_rate": 2e-05, "loss": 0.6125, "step": 3880 }, { "epoch": 0.20359030721725022, "grad_norm": 0.3751864731311798, "learning_rate": 2e-05, "loss": 0.6197, "step": 3890 }, { "epoch": 0.20411367561626628, "grad_norm": 0.5081929564476013, "learning_rate": 2e-05, "loss": 0.6203, "step": 3900 }, { "epoch": 0.20463704401528235, "grad_norm": 0.4540235698223114, "learning_rate": 2e-05, "loss": 0.6168, "step": 3910 }, { "epoch": 0.20516041241429842, "grad_norm": 0.41905754804611206, "learning_rate": 2e-05, "loss": 0.616, "step": 3920 }, { "epoch": 0.20568378081331448, "grad_norm": 0.5326279997825623, "learning_rate": 2e-05, "loss": 0.6211, "step": 3930 }, { "epoch": 0.20620714921233055, "grad_norm": 0.41054078936576843, "learning_rate": 2e-05, "loss": 0.6113, "step": 3940 }, { "epoch": 0.20673051761134661, "grad_norm": 0.4346046447753906, "learning_rate": 2e-05, "loss": 0.6495, "step": 3950 }, { "epoch": 0.20725388601036268, "grad_norm": 0.410095751285553, "learning_rate": 2e-05, "loss": 0.62, "step": 3960 }, { "epoch": 0.20777725440937878, "grad_norm": 0.40288132429122925, "learning_rate": 2e-05, "loss": 0.6214, "step": 3970 }, { "epoch": 0.20830062280839484, "grad_norm": 0.40218082070350647, "learning_rate": 2e-05, "loss": 0.6318, "step": 3980 }, { "epoch": 0.2088239912074109, "grad_norm": 0.43279343843460083, "learning_rate": 2e-05, "loss": 0.6341, "step": 3990 }, { "epoch": 0.20934735960642697, "grad_norm": 0.39592084288597107, "learning_rate": 2e-05, "loss": 0.6042, "step": 4000 }, { "epoch": 0.20987072800544304, "grad_norm": 0.4071950912475586, "learning_rate": 2e-05, "loss": 0.5843, "step": 4010 }, { "epoch": 0.2103940964044591, "grad_norm": 0.3897649347782135, "learning_rate": 2e-05, "loss": 0.6269, "step": 4020 }, { "epoch": 0.21091746480347517, "grad_norm": 0.7160203456878662, "learning_rate": 2e-05, "loss": 0.6499, "step": 4030 }, { "epoch": 0.21144083320249124, "grad_norm": 0.38851386308670044, "learning_rate": 2e-05, "loss": 0.6142, "step": 4040 }, { "epoch": 0.2119642016015073, "grad_norm": 0.3943970799446106, "learning_rate": 2e-05, "loss": 0.5983, "step": 4050 }, { "epoch": 0.21248757000052337, "grad_norm": 0.41590937972068787, "learning_rate": 2e-05, "loss": 0.6363, "step": 4060 }, { "epoch": 0.21301093839953944, "grad_norm": 0.38856077194213867, "learning_rate": 2e-05, "loss": 0.611, "step": 4070 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.8168590244885037e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }