{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.10650546919976972, "eval_steps": 500, "global_step": 2035, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0005233683990160674, "grad_norm": 1.1370724439620972, "learning_rate": 2.910112359550562e-06, "loss": 0.8003, "step": 10 }, { "epoch": 0.0010467367980321349, "grad_norm": 0.9877656102180481, "learning_rate": 3.921348314606742e-06, "loss": 0.7587, "step": 20 }, { "epoch": 0.0015701051970482022, "grad_norm": 0.8628589510917664, "learning_rate": 4.932584269662922e-06, "loss": 0.7476, "step": 30 }, { "epoch": 0.0020934735960642698, "grad_norm": 0.7837583422660828, "learning_rate": 5.943820224719102e-06, "loss": 0.7334, "step": 40 }, { "epoch": 0.002616841995080337, "grad_norm": 0.7342932224273682, "learning_rate": 6.955056179775282e-06, "loss": 0.7397, "step": 50 }, { "epoch": 0.0031402103940964044, "grad_norm": 0.9271304607391357, "learning_rate": 7.966292134831462e-06, "loss": 0.7296, "step": 60 }, { "epoch": 0.0036635787931124718, "grad_norm": 0.8066033720970154, "learning_rate": 8.977528089887641e-06, "loss": 0.6864, "step": 70 }, { "epoch": 0.0041869471921285395, "grad_norm": 0.8114457726478577, "learning_rate": 9.988764044943822e-06, "loss": 0.6792, "step": 80 }, { "epoch": 0.004710315591144607, "grad_norm": 0.8880093097686768, "learning_rate": 1.1000000000000001e-05, "loss": 0.7508, "step": 90 }, { "epoch": 0.005233683990160674, "grad_norm": 1.1273611783981323, "learning_rate": 1.2011235955056182e-05, "loss": 0.6849, "step": 100 }, { "epoch": 0.0057570523891767415, "grad_norm": 0.7791317701339722, "learning_rate": 1.3022471910112362e-05, "loss": 0.698, "step": 110 }, { "epoch": 0.006280420788192809, "grad_norm": 0.8140974044799805, "learning_rate": 1.403370786516854e-05, "loss": 0.6947, "step": 120 }, { "epoch": 0.006803789187208876, "grad_norm": 0.8656443357467651, "learning_rate": 1.504494382022472e-05, "loss": 0.7158, "step": 130 }, { "epoch": 0.0073271575862249435, "grad_norm": 0.744526743888855, "learning_rate": 1.60561797752809e-05, "loss": 0.6701, "step": 140 }, { "epoch": 0.00785052598524101, "grad_norm": 0.7715036273002625, "learning_rate": 1.706741573033708e-05, "loss": 0.6794, "step": 150 }, { "epoch": 0.008373894384257079, "grad_norm": 0.7816882729530334, "learning_rate": 1.8078651685393256e-05, "loss": 0.7059, "step": 160 }, { "epoch": 0.008897262783273146, "grad_norm": 0.7964625954627991, "learning_rate": 1.908988764044944e-05, "loss": 0.6954, "step": 170 }, { "epoch": 0.009420631182289214, "grad_norm": 1.0829215049743652, "learning_rate": 2e-05, "loss": 0.6888, "step": 180 }, { "epoch": 0.00994399958130528, "grad_norm": 0.6891264319419861, "learning_rate": 2e-05, "loss": 0.6539, "step": 190 }, { "epoch": 0.010467367980321348, "grad_norm": 0.7293897867202759, "learning_rate": 2e-05, "loss": 0.7164, "step": 200 }, { "epoch": 0.010990736379337415, "grad_norm": 0.6318921446800232, "learning_rate": 2e-05, "loss": 0.7084, "step": 210 }, { "epoch": 0.011514104778353483, "grad_norm": 0.6405470371246338, "learning_rate": 2e-05, "loss": 0.6812, "step": 220 }, { "epoch": 0.012037473177369551, "grad_norm": 0.6632219552993774, "learning_rate": 2e-05, "loss": 0.6733, "step": 230 }, { "epoch": 0.012560841576385618, "grad_norm": 0.7196585536003113, "learning_rate": 2e-05, "loss": 0.6835, "step": 240 }, { "epoch": 0.013084209975401686, "grad_norm": 0.5942214131355286, "learning_rate": 2e-05, "loss": 0.6613, "step": 250 }, { "epoch": 0.013607578374417752, "grad_norm": 0.5716996788978577, "learning_rate": 2e-05, "loss": 0.6759, "step": 260 }, { "epoch": 0.01413094677343382, "grad_norm": 0.5713549256324768, "learning_rate": 2e-05, "loss": 0.7041, "step": 270 }, { "epoch": 0.014654315172449887, "grad_norm": 0.5658433437347412, "learning_rate": 2e-05, "loss": 0.6866, "step": 280 }, { "epoch": 0.015177683571465955, "grad_norm": 0.5381125211715698, "learning_rate": 2e-05, "loss": 0.7024, "step": 290 }, { "epoch": 0.01570105197048202, "grad_norm": 0.5079479217529297, "learning_rate": 2e-05, "loss": 0.686, "step": 300 }, { "epoch": 0.016224420369498088, "grad_norm": 0.5530030727386475, "learning_rate": 2e-05, "loss": 0.6912, "step": 310 }, { "epoch": 0.016747788768514158, "grad_norm": 0.5396811962127686, "learning_rate": 2e-05, "loss": 0.6751, "step": 320 }, { "epoch": 0.017271157167530225, "grad_norm": 0.4894005060195923, "learning_rate": 2e-05, "loss": 0.6649, "step": 330 }, { "epoch": 0.01779452556654629, "grad_norm": 0.5230134129524231, "learning_rate": 2e-05, "loss": 0.684, "step": 340 }, { "epoch": 0.01831789396556236, "grad_norm": 0.5332402586936951, "learning_rate": 2e-05, "loss": 0.6767, "step": 350 }, { "epoch": 0.018841262364578427, "grad_norm": 0.5048417448997498, "learning_rate": 2e-05, "loss": 0.6922, "step": 360 }, { "epoch": 0.019364630763594494, "grad_norm": 0.5345087051391602, "learning_rate": 2e-05, "loss": 0.6976, "step": 370 }, { "epoch": 0.01988799916261056, "grad_norm": 0.511880099773407, "learning_rate": 2e-05, "loss": 0.6814, "step": 380 }, { "epoch": 0.02041136756162663, "grad_norm": 0.46280574798583984, "learning_rate": 2e-05, "loss": 0.6566, "step": 390 }, { "epoch": 0.020934735960642697, "grad_norm": 0.464054137468338, "learning_rate": 2e-05, "loss": 0.6483, "step": 400 }, { "epoch": 0.021458104359658763, "grad_norm": 0.5449008941650391, "learning_rate": 2e-05, "loss": 0.6841, "step": 410 }, { "epoch": 0.02198147275867483, "grad_norm": 0.5352079272270203, "learning_rate": 2e-05, "loss": 0.6604, "step": 420 }, { "epoch": 0.0225048411576909, "grad_norm": 0.5088271498680115, "learning_rate": 2e-05, "loss": 0.6683, "step": 430 }, { "epoch": 0.023028209556706966, "grad_norm": 0.5593430399894714, "learning_rate": 2e-05, "loss": 0.6795, "step": 440 }, { "epoch": 0.023551577955723033, "grad_norm": 0.507481575012207, "learning_rate": 2e-05, "loss": 0.6654, "step": 450 }, { "epoch": 0.024074946354739103, "grad_norm": 0.4815616011619568, "learning_rate": 2e-05, "loss": 0.6843, "step": 460 }, { "epoch": 0.02459831475375517, "grad_norm": 0.5703353881835938, "learning_rate": 2e-05, "loss": 0.6598, "step": 470 }, { "epoch": 0.025121683152771235, "grad_norm": 0.48705339431762695, "learning_rate": 2e-05, "loss": 0.6614, "step": 480 }, { "epoch": 0.025645051551787302, "grad_norm": 0.547533392906189, "learning_rate": 2e-05, "loss": 0.6585, "step": 490 }, { "epoch": 0.026168419950803372, "grad_norm": 0.6569129228591919, "learning_rate": 2e-05, "loss": 0.6716, "step": 500 }, { "epoch": 0.02669178834981944, "grad_norm": 0.5733374357223511, "learning_rate": 2e-05, "loss": 0.6465, "step": 510 }, { "epoch": 0.027215156748835505, "grad_norm": 0.4885842502117157, "learning_rate": 2e-05, "loss": 0.682, "step": 520 }, { "epoch": 0.02773852514785157, "grad_norm": 0.42785435914993286, "learning_rate": 2e-05, "loss": 0.6594, "step": 530 }, { "epoch": 0.02826189354686764, "grad_norm": 0.4955022931098938, "learning_rate": 2e-05, "loss": 0.6674, "step": 540 }, { "epoch": 0.028785261945883708, "grad_norm": 0.48021453619003296, "learning_rate": 2e-05, "loss": 0.6796, "step": 550 }, { "epoch": 0.029308630344899774, "grad_norm": 0.4767313301563263, "learning_rate": 2e-05, "loss": 0.6865, "step": 560 }, { "epoch": 0.029831998743915844, "grad_norm": 0.5284311771392822, "learning_rate": 2e-05, "loss": 0.6489, "step": 570 }, { "epoch": 0.03035536714293191, "grad_norm": 0.4461924731731415, "learning_rate": 2e-05, "loss": 0.686, "step": 580 }, { "epoch": 0.030878735541947977, "grad_norm": 0.45115983486175537, "learning_rate": 2e-05, "loss": 0.6539, "step": 590 }, { "epoch": 0.03140210394096404, "grad_norm": 0.5064119100570679, "learning_rate": 2e-05, "loss": 0.6946, "step": 600 }, { "epoch": 0.03192547233998011, "grad_norm": 0.5319550037384033, "learning_rate": 2e-05, "loss": 0.645, "step": 610 }, { "epoch": 0.032448840738996176, "grad_norm": 0.4419703781604767, "learning_rate": 2e-05, "loss": 0.7003, "step": 620 }, { "epoch": 0.03297220913801225, "grad_norm": 0.42887452244758606, "learning_rate": 2e-05, "loss": 0.6783, "step": 630 }, { "epoch": 0.033495577537028316, "grad_norm": 0.46661144495010376, "learning_rate": 2e-05, "loss": 0.6686, "step": 640 }, { "epoch": 0.03401894593604438, "grad_norm": 0.5283986330032349, "learning_rate": 2e-05, "loss": 0.6679, "step": 650 }, { "epoch": 0.03454231433506045, "grad_norm": 0.5113454461097717, "learning_rate": 2e-05, "loss": 0.6506, "step": 660 }, { "epoch": 0.035065682734076516, "grad_norm": 0.4744948148727417, "learning_rate": 2e-05, "loss": 0.6724, "step": 670 }, { "epoch": 0.03558905113309258, "grad_norm": 0.49696066975593567, "learning_rate": 2e-05, "loss": 0.6652, "step": 680 }, { "epoch": 0.03611241953210865, "grad_norm": 0.7813011407852173, "learning_rate": 2e-05, "loss": 0.6621, "step": 690 }, { "epoch": 0.03663578793112472, "grad_norm": 0.49424248933792114, "learning_rate": 2e-05, "loss": 0.6727, "step": 700 }, { "epoch": 0.03715915633014079, "grad_norm": 0.4447154104709625, "learning_rate": 2e-05, "loss": 0.6659, "step": 710 }, { "epoch": 0.037682524729156855, "grad_norm": 0.44892066717147827, "learning_rate": 2e-05, "loss": 0.6554, "step": 720 }, { "epoch": 0.03820589312817292, "grad_norm": 0.49734535813331604, "learning_rate": 2e-05, "loss": 0.6779, "step": 730 }, { "epoch": 0.03872926152718899, "grad_norm": 0.5591990947723389, "learning_rate": 2e-05, "loss": 0.6927, "step": 740 }, { "epoch": 0.039252629926205054, "grad_norm": 0.45224255323410034, "learning_rate": 2e-05, "loss": 0.6398, "step": 750 }, { "epoch": 0.03977599832522112, "grad_norm": 0.41793182492256165, "learning_rate": 2e-05, "loss": 0.6668, "step": 760 }, { "epoch": 0.04029936672423719, "grad_norm": 0.43993815779685974, "learning_rate": 2e-05, "loss": 0.6456, "step": 770 }, { "epoch": 0.04082273512325326, "grad_norm": 0.44372230768203735, "learning_rate": 2e-05, "loss": 0.6669, "step": 780 }, { "epoch": 0.04134610352226933, "grad_norm": 0.4827944040298462, "learning_rate": 2e-05, "loss": 0.657, "step": 790 }, { "epoch": 0.041869471921285394, "grad_norm": 0.4187488257884979, "learning_rate": 2e-05, "loss": 0.6456, "step": 800 }, { "epoch": 0.04239284032030146, "grad_norm": 0.47213008999824524, "learning_rate": 2e-05, "loss": 0.6555, "step": 810 }, { "epoch": 0.042916208719317527, "grad_norm": 0.43557852506637573, "learning_rate": 2e-05, "loss": 0.6545, "step": 820 }, { "epoch": 0.04343957711833359, "grad_norm": 0.45871806144714355, "learning_rate": 2e-05, "loss": 0.6538, "step": 830 }, { "epoch": 0.04396294551734966, "grad_norm": 0.46028947830200195, "learning_rate": 2e-05, "loss": 0.6356, "step": 840 }, { "epoch": 0.04448631391636573, "grad_norm": 0.548116147518158, "learning_rate": 2e-05, "loss": 0.6872, "step": 850 }, { "epoch": 0.0450096823153818, "grad_norm": 0.49427151679992676, "learning_rate": 2e-05, "loss": 0.6372, "step": 860 }, { "epoch": 0.045533050714397866, "grad_norm": 0.46103739738464355, "learning_rate": 2e-05, "loss": 0.6991, "step": 870 }, { "epoch": 0.04605641911341393, "grad_norm": 0.4400480091571808, "learning_rate": 2e-05, "loss": 0.667, "step": 880 }, { "epoch": 0.04657978751243, "grad_norm": 0.45002153515815735, "learning_rate": 2e-05, "loss": 0.6582, "step": 890 }, { "epoch": 0.047103155911446065, "grad_norm": 0.44472604990005493, "learning_rate": 2e-05, "loss": 0.6706, "step": 900 }, { "epoch": 0.04762652431046213, "grad_norm": 0.4121211767196655, "learning_rate": 2e-05, "loss": 0.6602, "step": 910 }, { "epoch": 0.048149892709478205, "grad_norm": 0.5010108351707458, "learning_rate": 2e-05, "loss": 0.6761, "step": 920 }, { "epoch": 0.04867326110849427, "grad_norm": 0.45920342206954956, "learning_rate": 2e-05, "loss": 0.6671, "step": 930 }, { "epoch": 0.04919662950751034, "grad_norm": 0.5177173018455505, "learning_rate": 2e-05, "loss": 0.652, "step": 940 }, { "epoch": 0.049719997906526404, "grad_norm": 0.49086499214172363, "learning_rate": 2e-05, "loss": 0.6795, "step": 950 }, { "epoch": 0.05024336630554247, "grad_norm": 0.582841157913208, "learning_rate": 2e-05, "loss": 0.6376, "step": 960 }, { "epoch": 0.05076673470455854, "grad_norm": 0.4690440595149994, "learning_rate": 2e-05, "loss": 0.6465, "step": 970 }, { "epoch": 0.051290103103574604, "grad_norm": 0.45363402366638184, "learning_rate": 2e-05, "loss": 0.6511, "step": 980 }, { "epoch": 0.05181347150259067, "grad_norm": 0.43920376896858215, "learning_rate": 2e-05, "loss": 0.6943, "step": 990 }, { "epoch": 0.052336839901606744, "grad_norm": 0.421144038438797, "learning_rate": 2e-05, "loss": 0.6434, "step": 1000 }, { "epoch": 0.05286020830062281, "grad_norm": 0.45188188552856445, "learning_rate": 2e-05, "loss": 0.6467, "step": 1010 }, { "epoch": 0.05338357669963888, "grad_norm": 0.4339853823184967, "learning_rate": 2e-05, "loss": 0.6596, "step": 1020 }, { "epoch": 0.05390694509865494, "grad_norm": 0.4234607517719269, "learning_rate": 2e-05, "loss": 0.674, "step": 1030 }, { "epoch": 0.05443031349767101, "grad_norm": 0.46552717685699463, "learning_rate": 2e-05, "loss": 0.6649, "step": 1040 }, { "epoch": 0.054953681896687076, "grad_norm": 0.4405843913555145, "learning_rate": 2e-05, "loss": 0.6577, "step": 1050 }, { "epoch": 0.05547705029570314, "grad_norm": 0.5044958591461182, "learning_rate": 2e-05, "loss": 0.6152, "step": 1060 }, { "epoch": 0.056000418694719216, "grad_norm": 0.43265852332115173, "learning_rate": 2e-05, "loss": 0.6317, "step": 1070 }, { "epoch": 0.05652378709373528, "grad_norm": 0.41526952385902405, "learning_rate": 2e-05, "loss": 0.6501, "step": 1080 }, { "epoch": 0.05704715549275135, "grad_norm": 0.43947693705558777, "learning_rate": 2e-05, "loss": 0.6542, "step": 1090 }, { "epoch": 0.057570523891767415, "grad_norm": 0.4375130534172058, "learning_rate": 2e-05, "loss": 0.671, "step": 1100 }, { "epoch": 0.05809389229078348, "grad_norm": 0.4554004371166229, "learning_rate": 2e-05, "loss": 0.6507, "step": 1110 }, { "epoch": 0.05861726068979955, "grad_norm": 0.5064834356307983, "learning_rate": 2e-05, "loss": 0.6467, "step": 1120 }, { "epoch": 0.059140629088815615, "grad_norm": 0.446809321641922, "learning_rate": 2e-05, "loss": 0.6751, "step": 1130 }, { "epoch": 0.05966399748783169, "grad_norm": 0.4745899736881256, "learning_rate": 2e-05, "loss": 0.6564, "step": 1140 }, { "epoch": 0.060187365886847755, "grad_norm": 0.5119066834449768, "learning_rate": 2e-05, "loss": 0.6618, "step": 1150 }, { "epoch": 0.06071073428586382, "grad_norm": 0.41898113489151, "learning_rate": 2e-05, "loss": 0.6622, "step": 1160 }, { "epoch": 0.06123410268487989, "grad_norm": 0.6409226059913635, "learning_rate": 2e-05, "loss": 0.6708, "step": 1170 }, { "epoch": 0.061757471083895954, "grad_norm": 0.439377099275589, "learning_rate": 2e-05, "loss": 0.6473, "step": 1180 }, { "epoch": 0.06228083948291202, "grad_norm": 0.4160749316215515, "learning_rate": 2e-05, "loss": 0.6798, "step": 1190 }, { "epoch": 0.06280420788192809, "grad_norm": 0.5204553604125977, "learning_rate": 2e-05, "loss": 0.6866, "step": 1200 }, { "epoch": 0.06332757628094415, "grad_norm": 0.48897305130958557, "learning_rate": 2e-05, "loss": 0.6618, "step": 1210 }, { "epoch": 0.06385094467996022, "grad_norm": 0.45014750957489014, "learning_rate": 2e-05, "loss": 0.6647, "step": 1220 }, { "epoch": 0.06437431307897629, "grad_norm": 0.4595189690589905, "learning_rate": 2e-05, "loss": 0.6625, "step": 1230 }, { "epoch": 0.06489768147799235, "grad_norm": 0.49671754240989685, "learning_rate": 2e-05, "loss": 0.663, "step": 1240 }, { "epoch": 0.06542104987700843, "grad_norm": 0.44070637226104736, "learning_rate": 2e-05, "loss": 0.6613, "step": 1250 }, { "epoch": 0.0659444182760245, "grad_norm": 0.45897576212882996, "learning_rate": 2e-05, "loss": 0.6516, "step": 1260 }, { "epoch": 0.06646778667504057, "grad_norm": 0.4450547695159912, "learning_rate": 2e-05, "loss": 0.641, "step": 1270 }, { "epoch": 0.06699115507405663, "grad_norm": 0.4288750886917114, "learning_rate": 2e-05, "loss": 0.6656, "step": 1280 }, { "epoch": 0.0675145234730727, "grad_norm": 0.47525206208229065, "learning_rate": 2e-05, "loss": 0.6915, "step": 1290 }, { "epoch": 0.06803789187208877, "grad_norm": 0.41285258531570435, "learning_rate": 2e-05, "loss": 0.6401, "step": 1300 }, { "epoch": 0.06856126027110483, "grad_norm": 0.46445295214653015, "learning_rate": 2e-05, "loss": 0.6692, "step": 1310 }, { "epoch": 0.0690846286701209, "grad_norm": 0.44153061509132385, "learning_rate": 2e-05, "loss": 0.6291, "step": 1320 }, { "epoch": 0.06960799706913696, "grad_norm": 0.7016943693161011, "learning_rate": 2e-05, "loss": 0.6405, "step": 1330 }, { "epoch": 0.07013136546815303, "grad_norm": 0.498710572719574, "learning_rate": 2e-05, "loss": 0.6433, "step": 1340 }, { "epoch": 0.0706547338671691, "grad_norm": 0.4415338337421417, "learning_rate": 2e-05, "loss": 0.673, "step": 1350 }, { "epoch": 0.07117810226618516, "grad_norm": 0.5377183556556702, "learning_rate": 2e-05, "loss": 0.6556, "step": 1360 }, { "epoch": 0.07170147066520123, "grad_norm": 0.40461525321006775, "learning_rate": 2e-05, "loss": 0.6384, "step": 1370 }, { "epoch": 0.0722248390642173, "grad_norm": 0.4240797758102417, "learning_rate": 2e-05, "loss": 0.6467, "step": 1380 }, { "epoch": 0.07274820746323336, "grad_norm": 0.4052056074142456, "learning_rate": 2e-05, "loss": 0.6448, "step": 1390 }, { "epoch": 0.07327157586224944, "grad_norm": 0.41825127601623535, "learning_rate": 2e-05, "loss": 0.6465, "step": 1400 }, { "epoch": 0.07379494426126551, "grad_norm": 0.41024652123451233, "learning_rate": 2e-05, "loss": 0.6428, "step": 1410 }, { "epoch": 0.07431831266028158, "grad_norm": 0.38469892740249634, "learning_rate": 2e-05, "loss": 0.6652, "step": 1420 }, { "epoch": 0.07484168105929764, "grad_norm": 0.4639175236225128, "learning_rate": 2e-05, "loss": 0.6503, "step": 1430 }, { "epoch": 0.07536504945831371, "grad_norm": 0.4508153200149536, "learning_rate": 2e-05, "loss": 0.6464, "step": 1440 }, { "epoch": 0.07588841785732978, "grad_norm": 0.5173973441123962, "learning_rate": 2e-05, "loss": 0.6475, "step": 1450 }, { "epoch": 0.07641178625634584, "grad_norm": 0.47181883454322815, "learning_rate": 2e-05, "loss": 0.6662, "step": 1460 }, { "epoch": 0.07693515465536191, "grad_norm": 0.43690988421440125, "learning_rate": 2e-05, "loss": 0.6459, "step": 1470 }, { "epoch": 0.07745852305437798, "grad_norm": 0.40047961473464966, "learning_rate": 2e-05, "loss": 0.6808, "step": 1480 }, { "epoch": 0.07798189145339404, "grad_norm": 0.3962308466434479, "learning_rate": 2e-05, "loss": 0.6249, "step": 1490 }, { "epoch": 0.07850525985241011, "grad_norm": 0.5075916051864624, "learning_rate": 2e-05, "loss": 0.6562, "step": 1500 }, { "epoch": 0.07902862825142618, "grad_norm": 0.44439756870269775, "learning_rate": 2e-05, "loss": 0.6744, "step": 1510 }, { "epoch": 0.07955199665044224, "grad_norm": 0.4172062575817108, "learning_rate": 2e-05, "loss": 0.6328, "step": 1520 }, { "epoch": 0.08007536504945831, "grad_norm": 0.9272112250328064, "learning_rate": 2e-05, "loss": 0.6554, "step": 1530 }, { "epoch": 0.08059873344847437, "grad_norm": 0.44365498423576355, "learning_rate": 2e-05, "loss": 0.6567, "step": 1540 }, { "epoch": 0.08112210184749045, "grad_norm": 0.5808505415916443, "learning_rate": 2e-05, "loss": 0.6671, "step": 1550 }, { "epoch": 0.08164547024650652, "grad_norm": 0.4238007068634033, "learning_rate": 2e-05, "loss": 0.6655, "step": 1560 }, { "epoch": 0.08216883864552259, "grad_norm": 0.4158059358596802, "learning_rate": 2e-05, "loss": 0.6502, "step": 1570 }, { "epoch": 0.08269220704453865, "grad_norm": 0.4266833961009979, "learning_rate": 2e-05, "loss": 0.6389, "step": 1580 }, { "epoch": 0.08321557544355472, "grad_norm": 0.4183817505836487, "learning_rate": 2e-05, "loss": 0.6297, "step": 1590 }, { "epoch": 0.08373894384257079, "grad_norm": 0.4242572784423828, "learning_rate": 2e-05, "loss": 0.6575, "step": 1600 }, { "epoch": 0.08426231224158685, "grad_norm": 0.42805418372154236, "learning_rate": 2e-05, "loss": 0.6316, "step": 1610 }, { "epoch": 0.08478568064060292, "grad_norm": 0.441866010427475, "learning_rate": 2e-05, "loss": 0.6702, "step": 1620 }, { "epoch": 0.08530904903961899, "grad_norm": 0.4371151626110077, "learning_rate": 2e-05, "loss": 0.6623, "step": 1630 }, { "epoch": 0.08583241743863505, "grad_norm": 0.43131211400032043, "learning_rate": 2e-05, "loss": 0.6448, "step": 1640 }, { "epoch": 0.08635578583765112, "grad_norm": 0.4316512644290924, "learning_rate": 2e-05, "loss": 0.6374, "step": 1650 }, { "epoch": 0.08687915423666719, "grad_norm": 0.48419904708862305, "learning_rate": 2e-05, "loss": 0.6224, "step": 1660 }, { "epoch": 0.08740252263568325, "grad_norm": 0.3933804929256439, "learning_rate": 2e-05, "loss": 0.6522, "step": 1670 }, { "epoch": 0.08792589103469932, "grad_norm": 0.4437639117240906, "learning_rate": 2e-05, "loss": 0.6237, "step": 1680 }, { "epoch": 0.08844925943371539, "grad_norm": 0.4899040460586548, "learning_rate": 2e-05, "loss": 0.6321, "step": 1690 }, { "epoch": 0.08897262783273147, "grad_norm": 0.4382249712944031, "learning_rate": 2e-05, "loss": 0.6469, "step": 1700 }, { "epoch": 0.08949599623174753, "grad_norm": 0.4095931053161621, "learning_rate": 2e-05, "loss": 0.6588, "step": 1710 }, { "epoch": 0.0900193646307636, "grad_norm": 0.43513184785842896, "learning_rate": 2e-05, "loss": 0.6569, "step": 1720 }, { "epoch": 0.09054273302977967, "grad_norm": 0.46793821454048157, "learning_rate": 2e-05, "loss": 0.6322, "step": 1730 }, { "epoch": 0.09106610142879573, "grad_norm": 0.430164098739624, "learning_rate": 2e-05, "loss": 0.6224, "step": 1740 }, { "epoch": 0.0915894698278118, "grad_norm": 0.3761891722679138, "learning_rate": 2e-05, "loss": 0.606, "step": 1750 }, { "epoch": 0.09211283822682786, "grad_norm": 0.373146116733551, "learning_rate": 2e-05, "loss": 0.6329, "step": 1760 }, { "epoch": 0.09263620662584393, "grad_norm": 0.42644017934799194, "learning_rate": 2e-05, "loss": 0.6466, "step": 1770 }, { "epoch": 0.09315957502486, "grad_norm": 0.40171223878860474, "learning_rate": 2e-05, "loss": 0.6567, "step": 1780 }, { "epoch": 0.09368294342387606, "grad_norm": 0.5002732872962952, "learning_rate": 2e-05, "loss": 0.6645, "step": 1790 }, { "epoch": 0.09420631182289213, "grad_norm": 0.45148345828056335, "learning_rate": 2e-05, "loss": 0.6735, "step": 1800 }, { "epoch": 0.0947296802219082, "grad_norm": 0.4408950209617615, "learning_rate": 2e-05, "loss": 0.64, "step": 1810 }, { "epoch": 0.09525304862092426, "grad_norm": 0.41224032640457153, "learning_rate": 2e-05, "loss": 0.6483, "step": 1820 }, { "epoch": 0.09577641701994033, "grad_norm": 0.3857000768184662, "learning_rate": 2e-05, "loss": 0.6591, "step": 1830 }, { "epoch": 0.09629978541895641, "grad_norm": 0.5142344832420349, "learning_rate": 2e-05, "loss": 0.6613, "step": 1840 }, { "epoch": 0.09682315381797248, "grad_norm": 0.43707653880119324, "learning_rate": 2e-05, "loss": 0.6463, "step": 1850 }, { "epoch": 0.09734652221698854, "grad_norm": 0.5951546430587769, "learning_rate": 2e-05, "loss": 0.6634, "step": 1860 }, { "epoch": 0.09786989061600461, "grad_norm": 0.451498419046402, "learning_rate": 2e-05, "loss": 0.6228, "step": 1870 }, { "epoch": 0.09839325901502068, "grad_norm": 0.43872302770614624, "learning_rate": 2e-05, "loss": 0.6417, "step": 1880 }, { "epoch": 0.09891662741403674, "grad_norm": 0.3905869722366333, "learning_rate": 2e-05, "loss": 0.6195, "step": 1890 }, { "epoch": 0.09943999581305281, "grad_norm": 0.46226704120635986, "learning_rate": 2e-05, "loss": 0.652, "step": 1900 }, { "epoch": 0.09996336421206888, "grad_norm": 0.4350249469280243, "learning_rate": 2e-05, "loss": 0.6814, "step": 1910 }, { "epoch": 0.10048673261108494, "grad_norm": 0.547003448009491, "learning_rate": 2e-05, "loss": 0.6376, "step": 1920 }, { "epoch": 0.10101010101010101, "grad_norm": 0.40520697832107544, "learning_rate": 2e-05, "loss": 0.6281, "step": 1930 }, { "epoch": 0.10153346940911707, "grad_norm": 0.3886966109275818, "learning_rate": 2e-05, "loss": 0.6349, "step": 1940 }, { "epoch": 0.10205683780813314, "grad_norm": 0.4416722059249878, "learning_rate": 2e-05, "loss": 0.6626, "step": 1950 }, { "epoch": 0.10258020620714921, "grad_norm": 0.4272310137748718, "learning_rate": 2e-05, "loss": 0.627, "step": 1960 }, { "epoch": 0.10310357460616527, "grad_norm": 0.4342178404331207, "learning_rate": 2e-05, "loss": 0.6616, "step": 1970 }, { "epoch": 0.10362694300518134, "grad_norm": 0.4413588047027588, "learning_rate": 2e-05, "loss": 0.6602, "step": 1980 }, { "epoch": 0.10415031140419742, "grad_norm": 0.39807382225990295, "learning_rate": 2e-05, "loss": 0.6184, "step": 1990 }, { "epoch": 0.10467367980321349, "grad_norm": 0.39922189712524414, "learning_rate": 2e-05, "loss": 0.6348, "step": 2000 }, { "epoch": 0.10519704820222955, "grad_norm": 0.4405508041381836, "learning_rate": 2e-05, "loss": 0.6527, "step": 2010 }, { "epoch": 0.10572041660124562, "grad_norm": 0.4154644310474396, "learning_rate": 2e-05, "loss": 0.6383, "step": 2020 }, { "epoch": 0.10624378500026169, "grad_norm": 0.4121659994125366, "learning_rate": 2e-05, "loss": 0.6337, "step": 2030 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9.084295122442519e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }