{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.46000620058905595, "eval_steps": 500, "global_step": 5935, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0007750736319950396, "grad_norm": 1.3823052644729614, "learning_rate": 2.910112359550562e-06, "loss": 0.7897, "step": 10 }, { "epoch": 0.0015501472639900791, "grad_norm": 1.15909743309021, "learning_rate": 3.921348314606742e-06, "loss": 0.7524, "step": 20 }, { "epoch": 0.002325220895985119, "grad_norm": 0.9035636186599731, "learning_rate": 4.932584269662922e-06, "loss": 0.7419, "step": 30 }, { "epoch": 0.0031002945279801583, "grad_norm": 0.7007580995559692, "learning_rate": 5.943820224719102e-06, "loss": 0.7113, "step": 40 }, { "epoch": 0.0038753681599751977, "grad_norm": 0.7174043655395508, "learning_rate": 6.955056179775282e-06, "loss": 0.7164, "step": 50 }, { "epoch": 0.004650441791970238, "grad_norm": 0.720160961151123, "learning_rate": 7.966292134831462e-06, "loss": 0.7077, "step": 60 }, { "epoch": 0.005425515423965277, "grad_norm": 0.6832423210144043, "learning_rate": 8.977528089887641e-06, "loss": 0.6898, "step": 70 }, { "epoch": 0.0062005890559603165, "grad_norm": 0.7489743232727051, "learning_rate": 9.988764044943822e-06, "loss": 0.7083, "step": 80 }, { "epoch": 0.0069756626879553555, "grad_norm": 0.7608446478843689, "learning_rate": 1.1000000000000001e-05, "loss": 0.6885, "step": 90 }, { "epoch": 0.007750736319950395, "grad_norm": 0.7493481636047363, "learning_rate": 1.2011235955056182e-05, "loss": 0.6888, "step": 100 }, { "epoch": 0.008525809951945434, "grad_norm": 0.7710257172584534, "learning_rate": 1.3022471910112362e-05, "loss": 0.6827, "step": 110 }, { "epoch": 0.009300883583940475, "grad_norm": 0.797978401184082, "learning_rate": 1.403370786516854e-05, "loss": 0.716, "step": 120 }, { "epoch": 0.010075957215935514, "grad_norm": 0.7106821537017822, "learning_rate": 1.504494382022472e-05, "loss": 0.6825, "step": 130 }, { "epoch": 0.010851030847930553, "grad_norm": 0.6821442246437073, "learning_rate": 1.60561797752809e-05, "loss": 0.699, "step": 140 }, { "epoch": 0.011626104479925592, "grad_norm": 0.7108712792396545, "learning_rate": 1.706741573033708e-05, "loss": 0.6979, "step": 150 }, { "epoch": 0.012401178111920633, "grad_norm": 0.7028000354766846, "learning_rate": 1.8078651685393256e-05, "loss": 0.6895, "step": 160 }, { "epoch": 0.013176251743915672, "grad_norm": 0.721693217754364, "learning_rate": 1.908988764044944e-05, "loss": 0.6835, "step": 170 }, { "epoch": 0.013951325375910711, "grad_norm": 0.589385449886322, "learning_rate": 2e-05, "loss": 0.6868, "step": 180 }, { "epoch": 0.014726399007905752, "grad_norm": 1.0280730724334717, "learning_rate": 2e-05, "loss": 0.7003, "step": 190 }, { "epoch": 0.01550147263990079, "grad_norm": 0.6079630255699158, "learning_rate": 2e-05, "loss": 0.6898, "step": 200 }, { "epoch": 0.01627654627189583, "grad_norm": 0.7045310139656067, "learning_rate": 2e-05, "loss": 0.6917, "step": 210 }, { "epoch": 0.01705161990389087, "grad_norm": 0.5710526704788208, "learning_rate": 2e-05, "loss": 0.6881, "step": 220 }, { "epoch": 0.01782669353588591, "grad_norm": 0.5788965225219727, "learning_rate": 2e-05, "loss": 0.702, "step": 230 }, { "epoch": 0.01860176716788095, "grad_norm": 0.6106708645820618, "learning_rate": 2e-05, "loss": 0.6864, "step": 240 }, { "epoch": 0.019376840799875988, "grad_norm": 0.561893105506897, "learning_rate": 2e-05, "loss": 0.6921, "step": 250 }, { "epoch": 0.02015191443187103, "grad_norm": 0.5690069794654846, "learning_rate": 2e-05, "loss": 0.6752, "step": 260 }, { "epoch": 0.020926988063866066, "grad_norm": 0.4941854774951935, "learning_rate": 2e-05, "loss": 0.6717, "step": 270 }, { "epoch": 0.021702061695861107, "grad_norm": 0.5330811738967896, "learning_rate": 2e-05, "loss": 0.68, "step": 280 }, { "epoch": 0.022477135327856147, "grad_norm": 0.5373284220695496, "learning_rate": 2e-05, "loss": 0.6864, "step": 290 }, { "epoch": 0.023252208959851185, "grad_norm": 0.4778149724006653, "learning_rate": 2e-05, "loss": 0.6953, "step": 300 }, { "epoch": 0.024027282591846225, "grad_norm": 0.509177565574646, "learning_rate": 2e-05, "loss": 0.6774, "step": 310 }, { "epoch": 0.024802356223841266, "grad_norm": 0.48862743377685547, "learning_rate": 2e-05, "loss": 0.6819, "step": 320 }, { "epoch": 0.025577429855836303, "grad_norm": 0.5163516402244568, "learning_rate": 2e-05, "loss": 0.688, "step": 330 }, { "epoch": 0.026352503487831344, "grad_norm": 0.48807498812675476, "learning_rate": 2e-05, "loss": 0.6817, "step": 340 }, { "epoch": 0.027127577119826385, "grad_norm": 0.5226020216941833, "learning_rate": 2e-05, "loss": 0.6873, "step": 350 }, { "epoch": 0.027902650751821422, "grad_norm": 0.48832374811172485, "learning_rate": 2e-05, "loss": 0.6793, "step": 360 }, { "epoch": 0.028677724383816463, "grad_norm": 0.5948355793952942, "learning_rate": 2e-05, "loss": 0.7136, "step": 370 }, { "epoch": 0.029452798015811504, "grad_norm": 0.47444790601730347, "learning_rate": 2e-05, "loss": 0.6893, "step": 380 }, { "epoch": 0.03022787164780654, "grad_norm": 0.46937182545661926, "learning_rate": 2e-05, "loss": 0.6799, "step": 390 }, { "epoch": 0.03100294527980158, "grad_norm": 0.4924728572368622, "learning_rate": 2e-05, "loss": 0.6882, "step": 400 }, { "epoch": 0.03177801891179662, "grad_norm": 0.46873292326927185, "learning_rate": 2e-05, "loss": 0.6784, "step": 410 }, { "epoch": 0.03255309254379166, "grad_norm": 0.5081288814544678, "learning_rate": 2e-05, "loss": 0.6673, "step": 420 }, { "epoch": 0.0333281661757867, "grad_norm": 0.48152658343315125, "learning_rate": 2e-05, "loss": 0.6891, "step": 430 }, { "epoch": 0.03410323980778174, "grad_norm": 0.5463388562202454, "learning_rate": 2e-05, "loss": 0.6737, "step": 440 }, { "epoch": 0.03487831343977678, "grad_norm": 0.493053674697876, "learning_rate": 2e-05, "loss": 0.6837, "step": 450 }, { "epoch": 0.03565338707177182, "grad_norm": 0.4562004506587982, "learning_rate": 2e-05, "loss": 0.6805, "step": 460 }, { "epoch": 0.03642846070376686, "grad_norm": 0.45049288868904114, "learning_rate": 2e-05, "loss": 0.6853, "step": 470 }, { "epoch": 0.0372035343357619, "grad_norm": 0.44892555475234985, "learning_rate": 2e-05, "loss": 0.6939, "step": 480 }, { "epoch": 0.037978607967756935, "grad_norm": 0.45876285433769226, "learning_rate": 2e-05, "loss": 0.6752, "step": 490 }, { "epoch": 0.038753681599751975, "grad_norm": 0.4538588523864746, "learning_rate": 2e-05, "loss": 0.6822, "step": 500 }, { "epoch": 0.039528755231747016, "grad_norm": 0.46754956245422363, "learning_rate": 2e-05, "loss": 0.6762, "step": 510 }, { "epoch": 0.04030382886374206, "grad_norm": 0.5183224081993103, "learning_rate": 2e-05, "loss": 0.6857, "step": 520 }, { "epoch": 0.0410789024957371, "grad_norm": 0.4643199145793915, "learning_rate": 2e-05, "loss": 0.6758, "step": 530 }, { "epoch": 0.04185397612773213, "grad_norm": 0.45650675892829895, "learning_rate": 2e-05, "loss": 0.6851, "step": 540 }, { "epoch": 0.04262904975972717, "grad_norm": 0.42580446600914, "learning_rate": 2e-05, "loss": 0.6841, "step": 550 }, { "epoch": 0.04340412339172221, "grad_norm": 0.4507347047328949, "learning_rate": 2e-05, "loss": 0.6803, "step": 560 }, { "epoch": 0.044179197023717254, "grad_norm": 0.447135329246521, "learning_rate": 2e-05, "loss": 0.6877, "step": 570 }, { "epoch": 0.044954270655712295, "grad_norm": 0.4340040981769562, "learning_rate": 2e-05, "loss": 0.6622, "step": 580 }, { "epoch": 0.045729344287707335, "grad_norm": 0.4411773383617401, "learning_rate": 2e-05, "loss": 0.6895, "step": 590 }, { "epoch": 0.04650441791970237, "grad_norm": 0.4499826729297638, "learning_rate": 2e-05, "loss": 0.6898, "step": 600 }, { "epoch": 0.04727949155169741, "grad_norm": 0.4610482156276703, "learning_rate": 2e-05, "loss": 0.6906, "step": 610 }, { "epoch": 0.04805456518369245, "grad_norm": 0.4646986126899719, "learning_rate": 2e-05, "loss": 0.6891, "step": 620 }, { "epoch": 0.04882963881568749, "grad_norm": 0.4380117654800415, "learning_rate": 2e-05, "loss": 0.6651, "step": 630 }, { "epoch": 0.04960471244768253, "grad_norm": 0.7984209656715393, "learning_rate": 2e-05, "loss": 0.675, "step": 640 }, { "epoch": 0.050379786079677566, "grad_norm": 0.45534566044807434, "learning_rate": 2e-05, "loss": 0.6737, "step": 650 }, { "epoch": 0.05115485971167261, "grad_norm": 0.43884512782096863, "learning_rate": 2e-05, "loss": 0.6748, "step": 660 }, { "epoch": 0.05192993334366765, "grad_norm": 0.45912545919418335, "learning_rate": 2e-05, "loss": 0.672, "step": 670 }, { "epoch": 0.05270500697566269, "grad_norm": 0.43527087569236755, "learning_rate": 2e-05, "loss": 0.6772, "step": 680 }, { "epoch": 0.05348008060765773, "grad_norm": 0.41790688037872314, "learning_rate": 2e-05, "loss": 0.6748, "step": 690 }, { "epoch": 0.05425515423965277, "grad_norm": 0.4713754951953888, "learning_rate": 2e-05, "loss": 0.6759, "step": 700 }, { "epoch": 0.055030227871647804, "grad_norm": 0.44159114360809326, "learning_rate": 2e-05, "loss": 0.6666, "step": 710 }, { "epoch": 0.055805301503642844, "grad_norm": 0.4281693696975708, "learning_rate": 2e-05, "loss": 0.6879, "step": 720 }, { "epoch": 0.056580375135637885, "grad_norm": 0.42915165424346924, "learning_rate": 2e-05, "loss": 0.6745, "step": 730 }, { "epoch": 0.057355448767632926, "grad_norm": 0.4454156160354614, "learning_rate": 2e-05, "loss": 0.6714, "step": 740 }, { "epoch": 0.05813052239962797, "grad_norm": 0.5239861607551575, "learning_rate": 2e-05, "loss": 0.6823, "step": 750 }, { "epoch": 0.05890559603162301, "grad_norm": 0.44252240657806396, "learning_rate": 2e-05, "loss": 0.6731, "step": 760 }, { "epoch": 0.05968066966361804, "grad_norm": 0.5074107646942139, "learning_rate": 2e-05, "loss": 0.684, "step": 770 }, { "epoch": 0.06045574329561308, "grad_norm": 0.4552975296974182, "learning_rate": 2e-05, "loss": 0.6836, "step": 780 }, { "epoch": 0.06123081692760812, "grad_norm": 0.42174383997917175, "learning_rate": 2e-05, "loss": 0.6717, "step": 790 }, { "epoch": 0.06200589055960316, "grad_norm": 0.44547125697135925, "learning_rate": 2e-05, "loss": 0.6775, "step": 800 }, { "epoch": 0.0627809641915982, "grad_norm": 0.44405683875083923, "learning_rate": 2e-05, "loss": 0.689, "step": 810 }, { "epoch": 0.06355603782359324, "grad_norm": 0.42822331190109253, "learning_rate": 2e-05, "loss": 0.6822, "step": 820 }, { "epoch": 0.06433111145558829, "grad_norm": 0.402357280254364, "learning_rate": 2e-05, "loss": 0.6716, "step": 830 }, { "epoch": 0.06510618508758333, "grad_norm": 0.43392375111579895, "learning_rate": 2e-05, "loss": 0.6689, "step": 840 }, { "epoch": 0.06588125871957835, "grad_norm": 0.4689558744430542, "learning_rate": 2e-05, "loss": 0.6846, "step": 850 }, { "epoch": 0.0666563323515734, "grad_norm": 0.4157777428627014, "learning_rate": 2e-05, "loss": 0.6812, "step": 860 }, { "epoch": 0.06743140598356843, "grad_norm": 0.5666890740394592, "learning_rate": 2e-05, "loss": 0.6693, "step": 870 }, { "epoch": 0.06820647961556348, "grad_norm": 0.40637901425361633, "learning_rate": 2e-05, "loss": 0.6894, "step": 880 }, { "epoch": 0.06898155324755852, "grad_norm": 0.42309945821762085, "learning_rate": 2e-05, "loss": 0.6705, "step": 890 }, { "epoch": 0.06975662687955356, "grad_norm": 0.429792195558548, "learning_rate": 2e-05, "loss": 0.6767, "step": 900 }, { "epoch": 0.0705317005115486, "grad_norm": 0.440060555934906, "learning_rate": 2e-05, "loss": 0.6687, "step": 910 }, { "epoch": 0.07130677414354364, "grad_norm": 0.4015533924102783, "learning_rate": 2e-05, "loss": 0.6719, "step": 920 }, { "epoch": 0.07208184777553868, "grad_norm": 0.43568137288093567, "learning_rate": 2e-05, "loss": 0.663, "step": 930 }, { "epoch": 0.07285692140753372, "grad_norm": 0.4287867844104767, "learning_rate": 2e-05, "loss": 0.677, "step": 940 }, { "epoch": 0.07363199503952876, "grad_norm": 0.43465718626976013, "learning_rate": 2e-05, "loss": 0.6782, "step": 950 }, { "epoch": 0.0744070686715238, "grad_norm": 0.4249207675457001, "learning_rate": 2e-05, "loss": 0.6627, "step": 960 }, { "epoch": 0.07518214230351883, "grad_norm": 0.42393025755882263, "learning_rate": 2e-05, "loss": 0.6832, "step": 970 }, { "epoch": 0.07595721593551387, "grad_norm": 0.442570298910141, "learning_rate": 2e-05, "loss": 0.6864, "step": 980 }, { "epoch": 0.07673228956750891, "grad_norm": 0.5258124470710754, "learning_rate": 2e-05, "loss": 0.6925, "step": 990 }, { "epoch": 0.07750736319950395, "grad_norm": 0.43202176690101624, "learning_rate": 2e-05, "loss": 0.6737, "step": 1000 }, { "epoch": 0.07828243683149899, "grad_norm": 0.39281439781188965, "learning_rate": 2e-05, "loss": 0.6673, "step": 1010 }, { "epoch": 0.07905751046349403, "grad_norm": 0.7493364214897156, "learning_rate": 2e-05, "loss": 0.6652, "step": 1020 }, { "epoch": 0.07983258409548907, "grad_norm": 0.4130217730998993, "learning_rate": 2e-05, "loss": 0.6437, "step": 1030 }, { "epoch": 0.08060765772748411, "grad_norm": 0.4456067681312561, "learning_rate": 2e-05, "loss": 0.6876, "step": 1040 }, { "epoch": 0.08138273135947915, "grad_norm": 0.50323885679245, "learning_rate": 2e-05, "loss": 0.6567, "step": 1050 }, { "epoch": 0.0821578049914742, "grad_norm": 0.44397807121276855, "learning_rate": 2e-05, "loss": 0.66, "step": 1060 }, { "epoch": 0.08293287862346924, "grad_norm": 0.4491206407546997, "learning_rate": 2e-05, "loss": 0.6703, "step": 1070 }, { "epoch": 0.08370795225546426, "grad_norm": 0.41675621271133423, "learning_rate": 2e-05, "loss": 0.675, "step": 1080 }, { "epoch": 0.0844830258874593, "grad_norm": 0.4307570457458496, "learning_rate": 2e-05, "loss": 0.6551, "step": 1090 }, { "epoch": 0.08525809951945434, "grad_norm": 0.4013335406780243, "learning_rate": 2e-05, "loss": 0.6557, "step": 1100 }, { "epoch": 0.08603317315144939, "grad_norm": 0.42541980743408203, "learning_rate": 2e-05, "loss": 0.6669, "step": 1110 }, { "epoch": 0.08680824678344443, "grad_norm": 0.4157240390777588, "learning_rate": 2e-05, "loss": 0.7118, "step": 1120 }, { "epoch": 0.08758332041543947, "grad_norm": 0.3873870074748993, "learning_rate": 2e-05, "loss": 0.6654, "step": 1130 }, { "epoch": 0.08835839404743451, "grad_norm": 0.4169309735298157, "learning_rate": 2e-05, "loss": 0.6718, "step": 1140 }, { "epoch": 0.08913346767942955, "grad_norm": 0.4192080497741699, "learning_rate": 2e-05, "loss": 0.6891, "step": 1150 }, { "epoch": 0.08990854131142459, "grad_norm": 0.3823591470718384, "learning_rate": 2e-05, "loss": 0.676, "step": 1160 }, { "epoch": 0.09068361494341963, "grad_norm": 0.4174516797065735, "learning_rate": 2e-05, "loss": 0.6688, "step": 1170 }, { "epoch": 0.09145868857541467, "grad_norm": 0.42104941606521606, "learning_rate": 2e-05, "loss": 0.6878, "step": 1180 }, { "epoch": 0.0922337622074097, "grad_norm": 0.42700275778770447, "learning_rate": 2e-05, "loss": 0.6584, "step": 1190 }, { "epoch": 0.09300883583940474, "grad_norm": 0.4459708034992218, "learning_rate": 2e-05, "loss": 0.6735, "step": 1200 }, { "epoch": 0.09378390947139978, "grad_norm": 0.4184398353099823, "learning_rate": 2e-05, "loss": 0.6737, "step": 1210 }, { "epoch": 0.09455898310339482, "grad_norm": 0.40880343317985535, "learning_rate": 2e-05, "loss": 0.6604, "step": 1220 }, { "epoch": 0.09533405673538986, "grad_norm": 0.422642320394516, "learning_rate": 2e-05, "loss": 0.6478, "step": 1230 }, { "epoch": 0.0961091303673849, "grad_norm": 0.40179723501205444, "learning_rate": 2e-05, "loss": 0.6808, "step": 1240 }, { "epoch": 0.09688420399937994, "grad_norm": 0.44401225447654724, "learning_rate": 2e-05, "loss": 0.6782, "step": 1250 }, { "epoch": 0.09765927763137498, "grad_norm": 0.4101133346557617, "learning_rate": 2e-05, "loss": 0.6558, "step": 1260 }, { "epoch": 0.09843435126337002, "grad_norm": 0.3988134562969208, "learning_rate": 2e-05, "loss": 0.6706, "step": 1270 }, { "epoch": 0.09920942489536506, "grad_norm": 0.43161827325820923, "learning_rate": 2e-05, "loss": 0.6577, "step": 1280 }, { "epoch": 0.0999844985273601, "grad_norm": 0.4305391311645508, "learning_rate": 2e-05, "loss": 0.6735, "step": 1290 }, { "epoch": 0.10075957215935513, "grad_norm": 0.5483478307723999, "learning_rate": 2e-05, "loss": 0.6824, "step": 1300 }, { "epoch": 0.10153464579135017, "grad_norm": 0.43918097019195557, "learning_rate": 2e-05, "loss": 0.6843, "step": 1310 }, { "epoch": 0.10230971942334521, "grad_norm": 0.4245496392250061, "learning_rate": 2e-05, "loss": 0.6784, "step": 1320 }, { "epoch": 0.10308479305534025, "grad_norm": 0.42245975136756897, "learning_rate": 2e-05, "loss": 0.6602, "step": 1330 }, { "epoch": 0.1038598666873353, "grad_norm": 0.42837628722190857, "learning_rate": 2e-05, "loss": 0.6665, "step": 1340 }, { "epoch": 0.10463494031933034, "grad_norm": 0.4032275080680847, "learning_rate": 2e-05, "loss": 0.6619, "step": 1350 }, { "epoch": 0.10541001395132538, "grad_norm": 0.41980066895484924, "learning_rate": 2e-05, "loss": 0.6516, "step": 1360 }, { "epoch": 0.10618508758332042, "grad_norm": 0.4778800308704376, "learning_rate": 2e-05, "loss": 0.6634, "step": 1370 }, { "epoch": 0.10696016121531546, "grad_norm": 0.4086174964904785, "learning_rate": 2e-05, "loss": 0.6706, "step": 1380 }, { "epoch": 0.1077352348473105, "grad_norm": 0.39581477642059326, "learning_rate": 2e-05, "loss": 0.6601, "step": 1390 }, { "epoch": 0.10851030847930554, "grad_norm": 0.4274316132068634, "learning_rate": 2e-05, "loss": 0.6553, "step": 1400 }, { "epoch": 0.10928538211130058, "grad_norm": 1.0265446901321411, "learning_rate": 2e-05, "loss": 0.648, "step": 1410 }, { "epoch": 0.11006045574329561, "grad_norm": 0.3895666003227234, "learning_rate": 2e-05, "loss": 0.6377, "step": 1420 }, { "epoch": 0.11083552937529065, "grad_norm": 0.40829238295555115, "learning_rate": 2e-05, "loss": 0.659, "step": 1430 }, { "epoch": 0.11161060300728569, "grad_norm": 0.417646199464798, "learning_rate": 2e-05, "loss": 0.6935, "step": 1440 }, { "epoch": 0.11238567663928073, "grad_norm": 0.4010778069496155, "learning_rate": 2e-05, "loss": 0.6758, "step": 1450 }, { "epoch": 0.11316075027127577, "grad_norm": 0.4173222780227661, "learning_rate": 2e-05, "loss": 0.6724, "step": 1460 }, { "epoch": 0.11393582390327081, "grad_norm": 0.4018092155456543, "learning_rate": 2e-05, "loss": 0.6701, "step": 1470 }, { "epoch": 0.11471089753526585, "grad_norm": 0.43614667654037476, "learning_rate": 2e-05, "loss": 0.6796, "step": 1480 }, { "epoch": 0.11548597116726089, "grad_norm": 0.41816315054893494, "learning_rate": 2e-05, "loss": 0.6773, "step": 1490 }, { "epoch": 0.11626104479925593, "grad_norm": 0.39446917176246643, "learning_rate": 2e-05, "loss": 0.6608, "step": 1500 }, { "epoch": 0.11703611843125097, "grad_norm": 0.447988897562027, "learning_rate": 2e-05, "loss": 0.6654, "step": 1510 }, { "epoch": 0.11781119206324601, "grad_norm": 0.41491132974624634, "learning_rate": 2e-05, "loss": 0.6858, "step": 1520 }, { "epoch": 0.11858626569524104, "grad_norm": 0.406842976808548, "learning_rate": 2e-05, "loss": 0.6686, "step": 1530 }, { "epoch": 0.11936133932723608, "grad_norm": 0.6441549062728882, "learning_rate": 2e-05, "loss": 0.6552, "step": 1540 }, { "epoch": 0.12013641295923112, "grad_norm": 0.4140605628490448, "learning_rate": 2e-05, "loss": 0.6547, "step": 1550 }, { "epoch": 0.12091148659122616, "grad_norm": 0.41722798347473145, "learning_rate": 2e-05, "loss": 0.6582, "step": 1560 }, { "epoch": 0.1216865602232212, "grad_norm": 0.43592479825019836, "learning_rate": 2e-05, "loss": 0.6687, "step": 1570 }, { "epoch": 0.12246163385521625, "grad_norm": 0.4203198552131653, "learning_rate": 2e-05, "loss": 0.6691, "step": 1580 }, { "epoch": 0.12323670748721129, "grad_norm": 0.4950765371322632, "learning_rate": 2e-05, "loss": 0.6769, "step": 1590 }, { "epoch": 0.12401178111920633, "grad_norm": 0.4129418432712555, "learning_rate": 2e-05, "loss": 0.6696, "step": 1600 }, { "epoch": 0.12478685475120137, "grad_norm": 0.4015454053878784, "learning_rate": 2e-05, "loss": 0.6594, "step": 1610 }, { "epoch": 0.1255619283831964, "grad_norm": 0.40145838260650635, "learning_rate": 2e-05, "loss": 0.6548, "step": 1620 }, { "epoch": 0.12633700201519144, "grad_norm": 0.40511614084243774, "learning_rate": 2e-05, "loss": 0.6583, "step": 1630 }, { "epoch": 0.1271120756471865, "grad_norm": 0.4618526101112366, "learning_rate": 2e-05, "loss": 0.6596, "step": 1640 }, { "epoch": 0.12788714927918152, "grad_norm": 0.4379795789718628, "learning_rate": 2e-05, "loss": 0.6816, "step": 1650 }, { "epoch": 0.12866222291117657, "grad_norm": 0.5952076315879822, "learning_rate": 2e-05, "loss": 0.6773, "step": 1660 }, { "epoch": 0.1294372965431716, "grad_norm": 0.39318859577178955, "learning_rate": 2e-05, "loss": 0.6531, "step": 1670 }, { "epoch": 0.13021237017516665, "grad_norm": 0.4082723557949066, "learning_rate": 2e-05, "loss": 0.6623, "step": 1680 }, { "epoch": 0.13098744380716168, "grad_norm": 0.4530302584171295, "learning_rate": 2e-05, "loss": 0.6684, "step": 1690 }, { "epoch": 0.1317625174391567, "grad_norm": 0.43130335211753845, "learning_rate": 2e-05, "loss": 0.6514, "step": 1700 }, { "epoch": 0.13253759107115176, "grad_norm": 0.4232826828956604, "learning_rate": 2e-05, "loss": 0.6621, "step": 1710 }, { "epoch": 0.1333126647031468, "grad_norm": 0.4304817318916321, "learning_rate": 2e-05, "loss": 0.6542, "step": 1720 }, { "epoch": 0.13408773833514184, "grad_norm": 0.40232929587364197, "learning_rate": 2e-05, "loss": 0.6736, "step": 1730 }, { "epoch": 0.13486281196713687, "grad_norm": 0.39328262209892273, "learning_rate": 2e-05, "loss": 0.6634, "step": 1740 }, { "epoch": 0.13563788559913192, "grad_norm": 0.384797602891922, "learning_rate": 2e-05, "loss": 0.6591, "step": 1750 }, { "epoch": 0.13641295923112695, "grad_norm": 0.39744696021080017, "learning_rate": 2e-05, "loss": 0.6552, "step": 1760 }, { "epoch": 0.137188032863122, "grad_norm": 0.8520597219467163, "learning_rate": 2e-05, "loss": 0.6649, "step": 1770 }, { "epoch": 0.13796310649511703, "grad_norm": 0.402743399143219, "learning_rate": 2e-05, "loss": 0.6639, "step": 1780 }, { "epoch": 0.1387381801271121, "grad_norm": 0.40198618173599243, "learning_rate": 2e-05, "loss": 0.6653, "step": 1790 }, { "epoch": 0.13951325375910711, "grad_norm": 0.41853809356689453, "learning_rate": 2e-05, "loss": 0.6823, "step": 1800 }, { "epoch": 0.14028832739110214, "grad_norm": 1.1882494688034058, "learning_rate": 2e-05, "loss": 0.6481, "step": 1810 }, { "epoch": 0.1410634010230972, "grad_norm": 0.5747016668319702, "learning_rate": 2e-05, "loss": 0.662, "step": 1820 }, { "epoch": 0.14183847465509222, "grad_norm": 0.41559216380119324, "learning_rate": 2e-05, "loss": 0.669, "step": 1830 }, { "epoch": 0.14261354828708728, "grad_norm": 0.3821167051792145, "learning_rate": 2e-05, "loss": 0.6656, "step": 1840 }, { "epoch": 0.1433886219190823, "grad_norm": 0.4053109884262085, "learning_rate": 2e-05, "loss": 0.658, "step": 1850 }, { "epoch": 0.14416369555107736, "grad_norm": 0.8168757557868958, "learning_rate": 2e-05, "loss": 0.67, "step": 1860 }, { "epoch": 0.14493876918307239, "grad_norm": 0.42168760299682617, "learning_rate": 2e-05, "loss": 0.6597, "step": 1870 }, { "epoch": 0.14571384281506744, "grad_norm": 0.42126354575157166, "learning_rate": 2e-05, "loss": 0.6661, "step": 1880 }, { "epoch": 0.14648891644706247, "grad_norm": 0.4499135911464691, "learning_rate": 2e-05, "loss": 0.6592, "step": 1890 }, { "epoch": 0.14726399007905752, "grad_norm": 0.42486631870269775, "learning_rate": 2e-05, "loss": 0.6424, "step": 1900 }, { "epoch": 0.14803906371105255, "grad_norm": 0.3847733736038208, "learning_rate": 2e-05, "loss": 0.6635, "step": 1910 }, { "epoch": 0.1488141373430476, "grad_norm": 0.4100988507270813, "learning_rate": 2e-05, "loss": 0.6558, "step": 1920 }, { "epoch": 0.14958921097504263, "grad_norm": 0.4142761826515198, "learning_rate": 2e-05, "loss": 0.6635, "step": 1930 }, { "epoch": 0.15036428460703766, "grad_norm": 0.40710175037384033, "learning_rate": 2e-05, "loss": 0.6742, "step": 1940 }, { "epoch": 0.1511393582390327, "grad_norm": 0.4328700602054596, "learning_rate": 2e-05, "loss": 0.6715, "step": 1950 }, { "epoch": 0.15191443187102774, "grad_norm": 0.605353593826294, "learning_rate": 2e-05, "loss": 0.6495, "step": 1960 }, { "epoch": 0.1526895055030228, "grad_norm": 0.5102190971374512, "learning_rate": 2e-05, "loss": 0.6644, "step": 1970 }, { "epoch": 0.15346457913501782, "grad_norm": 0.45153525471687317, "learning_rate": 2e-05, "loss": 0.6451, "step": 1980 }, { "epoch": 0.15423965276701287, "grad_norm": 0.4187360107898712, "learning_rate": 2e-05, "loss": 0.6549, "step": 1990 }, { "epoch": 0.1550147263990079, "grad_norm": 0.41170287132263184, "learning_rate": 2e-05, "loss": 0.6661, "step": 2000 }, { "epoch": 0.15578980003100296, "grad_norm": 0.3859499990940094, "learning_rate": 2e-05, "loss": 0.6571, "step": 2010 }, { "epoch": 0.15656487366299798, "grad_norm": 0.38852736353874207, "learning_rate": 2e-05, "loss": 0.6679, "step": 2020 }, { "epoch": 0.15733994729499304, "grad_norm": 0.4105587601661682, "learning_rate": 2e-05, "loss": 0.6436, "step": 2030 }, { "epoch": 0.15811502092698806, "grad_norm": 0.4161953628063202, "learning_rate": 2e-05, "loss": 0.6683, "step": 2040 }, { "epoch": 0.1588900945589831, "grad_norm": 0.41664355993270874, "learning_rate": 2e-05, "loss": 0.6534, "step": 2050 }, { "epoch": 0.15966516819097815, "grad_norm": 0.40171241760253906, "learning_rate": 2e-05, "loss": 0.6569, "step": 2060 }, { "epoch": 0.16044024182297317, "grad_norm": 1.195680856704712, "learning_rate": 2e-05, "loss": 0.6538, "step": 2070 }, { "epoch": 0.16121531545496823, "grad_norm": 0.446020245552063, "learning_rate": 2e-05, "loss": 0.6706, "step": 2080 }, { "epoch": 0.16199038908696325, "grad_norm": 0.4383505582809448, "learning_rate": 2e-05, "loss": 0.6488, "step": 2090 }, { "epoch": 0.1627654627189583, "grad_norm": 0.4303628206253052, "learning_rate": 2e-05, "loss": 0.6546, "step": 2100 }, { "epoch": 0.16354053635095334, "grad_norm": 0.46713578701019287, "learning_rate": 2e-05, "loss": 0.6757, "step": 2110 }, { "epoch": 0.1643156099829484, "grad_norm": 0.41250234842300415, "learning_rate": 2e-05, "loss": 0.6584, "step": 2120 }, { "epoch": 0.16509068361494342, "grad_norm": 0.4887694716453552, "learning_rate": 2e-05, "loss": 0.6659, "step": 2130 }, { "epoch": 0.16586575724693847, "grad_norm": 0.43109914660453796, "learning_rate": 2e-05, "loss": 0.6501, "step": 2140 }, { "epoch": 0.1666408308789335, "grad_norm": 0.41217032074928284, "learning_rate": 2e-05, "loss": 0.6779, "step": 2150 }, { "epoch": 0.16741590451092853, "grad_norm": 0.4060550332069397, "learning_rate": 2e-05, "loss": 0.6542, "step": 2160 }, { "epoch": 0.16819097814292358, "grad_norm": 0.4079914093017578, "learning_rate": 2e-05, "loss": 0.6702, "step": 2170 }, { "epoch": 0.1689660517749186, "grad_norm": 0.3878198266029358, "learning_rate": 2e-05, "loss": 0.6428, "step": 2180 }, { "epoch": 0.16974112540691366, "grad_norm": 0.4579482972621918, "learning_rate": 2e-05, "loss": 0.6517, "step": 2190 }, { "epoch": 0.1705161990389087, "grad_norm": 0.41060948371887207, "learning_rate": 2e-05, "loss": 0.6573, "step": 2200 }, { "epoch": 0.17129127267090374, "grad_norm": 0.3973774015903473, "learning_rate": 2e-05, "loss": 0.6547, "step": 2210 }, { "epoch": 0.17206634630289877, "grad_norm": 0.40613505244255066, "learning_rate": 2e-05, "loss": 0.6665, "step": 2220 }, { "epoch": 0.17284141993489383, "grad_norm": 0.44879674911499023, "learning_rate": 2e-05, "loss": 0.6603, "step": 2230 }, { "epoch": 0.17361649356688885, "grad_norm": 0.49533888697624207, "learning_rate": 2e-05, "loss": 0.6454, "step": 2240 }, { "epoch": 0.1743915671988839, "grad_norm": 0.5093989372253418, "learning_rate": 2e-05, "loss": 0.6702, "step": 2250 }, { "epoch": 0.17516664083087893, "grad_norm": 0.4315301477909088, "learning_rate": 2e-05, "loss": 0.6417, "step": 2260 }, { "epoch": 0.17594171446287396, "grad_norm": 0.6004558205604553, "learning_rate": 2e-05, "loss": 0.643, "step": 2270 }, { "epoch": 0.17671678809486902, "grad_norm": 0.4064202308654785, "learning_rate": 2e-05, "loss": 0.6729, "step": 2280 }, { "epoch": 0.17749186172686404, "grad_norm": 0.4044870436191559, "learning_rate": 2e-05, "loss": 0.6475, "step": 2290 }, { "epoch": 0.1782669353588591, "grad_norm": 0.38951683044433594, "learning_rate": 2e-05, "loss": 0.6509, "step": 2300 }, { "epoch": 0.17904200899085412, "grad_norm": 0.4390566647052765, "learning_rate": 2e-05, "loss": 0.6602, "step": 2310 }, { "epoch": 0.17981708262284918, "grad_norm": 0.4063456058502197, "learning_rate": 2e-05, "loss": 0.6586, "step": 2320 }, { "epoch": 0.1805921562548442, "grad_norm": 0.38408976793289185, "learning_rate": 2e-05, "loss": 0.6483, "step": 2330 }, { "epoch": 0.18136722988683926, "grad_norm": 0.39897775650024414, "learning_rate": 2e-05, "loss": 0.6658, "step": 2340 }, { "epoch": 0.1821423035188343, "grad_norm": 1.0825657844543457, "learning_rate": 2e-05, "loss": 0.6653, "step": 2350 }, { "epoch": 0.18291737715082934, "grad_norm": 0.4177400767803192, "learning_rate": 2e-05, "loss": 0.648, "step": 2360 }, { "epoch": 0.18369245078282437, "grad_norm": 0.4209858179092407, "learning_rate": 2e-05, "loss": 0.6449, "step": 2370 }, { "epoch": 0.1844675244148194, "grad_norm": 0.39963626861572266, "learning_rate": 2e-05, "loss": 0.6507, "step": 2380 }, { "epoch": 0.18524259804681445, "grad_norm": 0.39542877674102783, "learning_rate": 2e-05, "loss": 0.6475, "step": 2390 }, { "epoch": 0.18601767167880948, "grad_norm": 0.3948878049850464, "learning_rate": 2e-05, "loss": 0.6599, "step": 2400 }, { "epoch": 0.18679274531080453, "grad_norm": 0.4023815095424652, "learning_rate": 2e-05, "loss": 0.6727, "step": 2410 }, { "epoch": 0.18756781894279956, "grad_norm": 0.5075188279151917, "learning_rate": 2e-05, "loss": 0.6585, "step": 2420 }, { "epoch": 0.1883428925747946, "grad_norm": 0.3735017776489258, "learning_rate": 2e-05, "loss": 0.6591, "step": 2430 }, { "epoch": 0.18911796620678964, "grad_norm": 0.4221167266368866, "learning_rate": 2e-05, "loss": 0.6415, "step": 2440 }, { "epoch": 0.1898930398387847, "grad_norm": 0.41844654083251953, "learning_rate": 2e-05, "loss": 0.669, "step": 2450 }, { "epoch": 0.19066811347077972, "grad_norm": 0.3794083297252655, "learning_rate": 2e-05, "loss": 0.6435, "step": 2460 }, { "epoch": 0.19144318710277478, "grad_norm": 0.41103601455688477, "learning_rate": 2e-05, "loss": 0.6431, "step": 2470 }, { "epoch": 0.1922182607347698, "grad_norm": 0.39791375398635864, "learning_rate": 2e-05, "loss": 0.6619, "step": 2480 }, { "epoch": 0.19299333436676483, "grad_norm": 0.3982989192008972, "learning_rate": 2e-05, "loss": 0.6647, "step": 2490 }, { "epoch": 0.19376840799875988, "grad_norm": 0.42089393734931946, "learning_rate": 2e-05, "loss": 0.6697, "step": 2500 }, { "epoch": 0.1945434816307549, "grad_norm": 0.4063425660133362, "learning_rate": 2e-05, "loss": 0.6497, "step": 2510 }, { "epoch": 0.19531855526274997, "grad_norm": 0.37145042419433594, "learning_rate": 2e-05, "loss": 0.6432, "step": 2520 }, { "epoch": 0.196093628894745, "grad_norm": 0.4100053906440735, "learning_rate": 2e-05, "loss": 0.6688, "step": 2530 }, { "epoch": 0.19686870252674005, "grad_norm": 0.37570226192474365, "learning_rate": 2e-05, "loss": 0.6436, "step": 2540 }, { "epoch": 0.19764377615873507, "grad_norm": 0.404792457818985, "learning_rate": 2e-05, "loss": 0.6597, "step": 2550 }, { "epoch": 0.19841884979073013, "grad_norm": 0.38528645038604736, "learning_rate": 2e-05, "loss": 0.6499, "step": 2560 }, { "epoch": 0.19919392342272516, "grad_norm": 0.4154411554336548, "learning_rate": 2e-05, "loss": 0.654, "step": 2570 }, { "epoch": 0.1999689970547202, "grad_norm": 0.4468025863170624, "learning_rate": 2e-05, "loss": 0.6523, "step": 2580 }, { "epoch": 0.20074407068671524, "grad_norm": 0.43527552485466003, "learning_rate": 2e-05, "loss": 0.6736, "step": 2590 }, { "epoch": 0.20151914431871026, "grad_norm": 0.39578428864479065, "learning_rate": 2e-05, "loss": 0.6669, "step": 2600 }, { "epoch": 0.20229421795070532, "grad_norm": 0.4273620545864105, "learning_rate": 2e-05, "loss": 0.6502, "step": 2610 }, { "epoch": 0.20306929158270035, "grad_norm": 0.48650169372558594, "learning_rate": 2e-05, "loss": 0.6485, "step": 2620 }, { "epoch": 0.2038443652146954, "grad_norm": 0.4622916281223297, "learning_rate": 2e-05, "loss": 0.6569, "step": 2630 }, { "epoch": 0.20461943884669043, "grad_norm": 0.4230853021144867, "learning_rate": 2e-05, "loss": 0.6458, "step": 2640 }, { "epoch": 0.20539451247868548, "grad_norm": 0.39467793703079224, "learning_rate": 2e-05, "loss": 0.6434, "step": 2650 }, { "epoch": 0.2061695861106805, "grad_norm": 0.41830822825431824, "learning_rate": 2e-05, "loss": 0.6484, "step": 2660 }, { "epoch": 0.20694465974267556, "grad_norm": 0.5037385821342468, "learning_rate": 2e-05, "loss": 0.6443, "step": 2670 }, { "epoch": 0.2077197333746706, "grad_norm": 0.38853520154953003, "learning_rate": 2e-05, "loss": 0.6458, "step": 2680 }, { "epoch": 0.20849480700666564, "grad_norm": 0.414017915725708, "learning_rate": 2e-05, "loss": 0.6488, "step": 2690 }, { "epoch": 0.20926988063866067, "grad_norm": 0.3972592055797577, "learning_rate": 2e-05, "loss": 0.6457, "step": 2700 }, { "epoch": 0.21004495427065573, "grad_norm": 0.3871782720088959, "learning_rate": 2e-05, "loss": 0.6463, "step": 2710 }, { "epoch": 0.21082002790265075, "grad_norm": 0.3889021575450897, "learning_rate": 2e-05, "loss": 0.6526, "step": 2720 }, { "epoch": 0.21159510153464578, "grad_norm": 0.3956632614135742, "learning_rate": 2e-05, "loss": 0.6458, "step": 2730 }, { "epoch": 0.21237017516664083, "grad_norm": 0.39243122935295105, "learning_rate": 2e-05, "loss": 0.6403, "step": 2740 }, { "epoch": 0.21314524879863586, "grad_norm": 0.40234375, "learning_rate": 2e-05, "loss": 0.6545, "step": 2750 }, { "epoch": 0.21392032243063092, "grad_norm": 0.37857896089553833, "learning_rate": 2e-05, "loss": 0.6445, "step": 2760 }, { "epoch": 0.21469539606262594, "grad_norm": 0.41570788621902466, "learning_rate": 2e-05, "loss": 0.6458, "step": 2770 }, { "epoch": 0.215470469694621, "grad_norm": 0.4410853981971741, "learning_rate": 2e-05, "loss": 0.6608, "step": 2780 }, { "epoch": 0.21624554332661602, "grad_norm": 0.44700971245765686, "learning_rate": 2e-05, "loss": 0.6605, "step": 2790 }, { "epoch": 0.21702061695861108, "grad_norm": 0.40519022941589355, "learning_rate": 2e-05, "loss": 0.6407, "step": 2800 }, { "epoch": 0.2177956905906061, "grad_norm": 0.42666929960250854, "learning_rate": 2e-05, "loss": 0.6515, "step": 2810 }, { "epoch": 0.21857076422260116, "grad_norm": 0.412100225687027, "learning_rate": 2e-05, "loss": 0.6383, "step": 2820 }, { "epoch": 0.2193458378545962, "grad_norm": 0.40622761845588684, "learning_rate": 2e-05, "loss": 0.6567, "step": 2830 }, { "epoch": 0.22012091148659121, "grad_norm": 0.41891127824783325, "learning_rate": 2e-05, "loss": 0.6531, "step": 2840 }, { "epoch": 0.22089598511858627, "grad_norm": 0.4018741548061371, "learning_rate": 2e-05, "loss": 0.6469, "step": 2850 }, { "epoch": 0.2216710587505813, "grad_norm": 0.4432869851589203, "learning_rate": 2e-05, "loss": 0.6656, "step": 2860 }, { "epoch": 0.22244613238257635, "grad_norm": 0.4150429666042328, "learning_rate": 2e-05, "loss": 0.6501, "step": 2870 }, { "epoch": 0.22322120601457138, "grad_norm": 0.4564347267150879, "learning_rate": 2e-05, "loss": 0.6451, "step": 2880 }, { "epoch": 0.22399627964656643, "grad_norm": 0.37577444314956665, "learning_rate": 2e-05, "loss": 0.6438, "step": 2890 }, { "epoch": 0.22477135327856146, "grad_norm": 0.39881935715675354, "learning_rate": 2e-05, "loss": 0.6535, "step": 2900 }, { "epoch": 0.2255464269105565, "grad_norm": 0.4113995134830475, "learning_rate": 2e-05, "loss": 0.6602, "step": 2910 }, { "epoch": 0.22632150054255154, "grad_norm": 0.3787456452846527, "learning_rate": 2e-05, "loss": 0.6675, "step": 2920 }, { "epoch": 0.2270965741745466, "grad_norm": 0.4072747528553009, "learning_rate": 2e-05, "loss": 0.6665, "step": 2930 }, { "epoch": 0.22787164780654162, "grad_norm": 0.41496026515960693, "learning_rate": 2e-05, "loss": 0.6515, "step": 2940 }, { "epoch": 0.22864672143853665, "grad_norm": 0.4140514135360718, "learning_rate": 2e-05, "loss": 0.6573, "step": 2950 }, { "epoch": 0.2294217950705317, "grad_norm": 0.4361623227596283, "learning_rate": 2e-05, "loss": 0.6522, "step": 2960 }, { "epoch": 0.23019686870252673, "grad_norm": 0.3820911645889282, "learning_rate": 2e-05, "loss": 0.6398, "step": 2970 }, { "epoch": 0.23097194233452178, "grad_norm": 0.3671109974384308, "learning_rate": 2e-05, "loss": 0.6644, "step": 2980 }, { "epoch": 0.2317470159665168, "grad_norm": 0.3904815912246704, "learning_rate": 2e-05, "loss": 0.6488, "step": 2990 }, { "epoch": 0.23252208959851187, "grad_norm": 0.40013980865478516, "learning_rate": 2e-05, "loss": 0.6528, "step": 3000 }, { "epoch": 0.2332971632305069, "grad_norm": 0.42152348160743713, "learning_rate": 2e-05, "loss": 0.6436, "step": 3010 }, { "epoch": 0.23407223686250195, "grad_norm": 0.38032928109169006, "learning_rate": 2e-05, "loss": 0.6434, "step": 3020 }, { "epoch": 0.23484731049449697, "grad_norm": 0.39556047320365906, "learning_rate": 2e-05, "loss": 0.6457, "step": 3030 }, { "epoch": 0.23562238412649203, "grad_norm": 0.40398159623146057, "learning_rate": 2e-05, "loss": 0.6419, "step": 3040 }, { "epoch": 0.23639745775848706, "grad_norm": 0.4593210518360138, "learning_rate": 2e-05, "loss": 0.6428, "step": 3050 }, { "epoch": 0.23717253139048208, "grad_norm": 0.42830073833465576, "learning_rate": 2e-05, "loss": 0.654, "step": 3060 }, { "epoch": 0.23794760502247714, "grad_norm": 0.4068194329738617, "learning_rate": 2e-05, "loss": 0.6358, "step": 3070 }, { "epoch": 0.23872267865447216, "grad_norm": 2.078359603881836, "learning_rate": 2e-05, "loss": 0.6598, "step": 3080 }, { "epoch": 0.23949775228646722, "grad_norm": 0.6029475927352905, "learning_rate": 2e-05, "loss": 0.6542, "step": 3090 }, { "epoch": 0.24027282591846225, "grad_norm": 0.39002111554145813, "learning_rate": 2e-05, "loss": 0.6488, "step": 3100 }, { "epoch": 0.2410478995504573, "grad_norm": 0.39298468828201294, "learning_rate": 2e-05, "loss": 0.6605, "step": 3110 }, { "epoch": 0.24182297318245233, "grad_norm": 0.4210423529148102, "learning_rate": 2e-05, "loss": 0.6351, "step": 3120 }, { "epoch": 0.24259804681444738, "grad_norm": 0.9378540515899658, "learning_rate": 2e-05, "loss": 0.6358, "step": 3130 }, { "epoch": 0.2433731204464424, "grad_norm": 0.4258650243282318, "learning_rate": 2e-05, "loss": 0.6649, "step": 3140 }, { "epoch": 0.24414819407843746, "grad_norm": 0.40488994121551514, "learning_rate": 2e-05, "loss": 0.665, "step": 3150 }, { "epoch": 0.2449232677104325, "grad_norm": 0.4172995686531067, "learning_rate": 2e-05, "loss": 0.6691, "step": 3160 }, { "epoch": 0.24569834134242752, "grad_norm": 0.3930172920227051, "learning_rate": 2e-05, "loss": 0.6351, "step": 3170 }, { "epoch": 0.24647341497442257, "grad_norm": 0.4278660714626312, "learning_rate": 2e-05, "loss": 0.6396, "step": 3180 }, { "epoch": 0.2472484886064176, "grad_norm": 0.40976083278656006, "learning_rate": 2e-05, "loss": 0.646, "step": 3190 }, { "epoch": 0.24802356223841265, "grad_norm": 0.4093548357486725, "learning_rate": 2e-05, "loss": 0.6448, "step": 3200 }, { "epoch": 0.24879863587040768, "grad_norm": 0.39366021752357483, "learning_rate": 2e-05, "loss": 0.6557, "step": 3210 }, { "epoch": 0.24957370950240274, "grad_norm": 0.45590394735336304, "learning_rate": 2e-05, "loss": 0.6461, "step": 3220 }, { "epoch": 0.2503487831343978, "grad_norm": 0.4243846833705902, "learning_rate": 2e-05, "loss": 0.6582, "step": 3230 }, { "epoch": 0.2511238567663928, "grad_norm": 0.42751291394233704, "learning_rate": 2e-05, "loss": 0.6521, "step": 3240 }, { "epoch": 0.25189893039838784, "grad_norm": 0.3897493779659271, "learning_rate": 2e-05, "loss": 0.6483, "step": 3250 }, { "epoch": 0.25267400403038287, "grad_norm": 0.3933364450931549, "learning_rate": 2e-05, "loss": 0.6495, "step": 3260 }, { "epoch": 0.25344907766237795, "grad_norm": 0.3864021599292755, "learning_rate": 2e-05, "loss": 0.6424, "step": 3270 }, { "epoch": 0.254224151294373, "grad_norm": 0.3909198045730591, "learning_rate": 2e-05, "loss": 0.6508, "step": 3280 }, { "epoch": 0.254999224926368, "grad_norm": 0.3932095170021057, "learning_rate": 2e-05, "loss": 0.6326, "step": 3290 }, { "epoch": 0.25577429855836303, "grad_norm": 0.3967517912387848, "learning_rate": 2e-05, "loss": 0.6495, "step": 3300 }, { "epoch": 0.25654937219035806, "grad_norm": 0.4061006009578705, "learning_rate": 2e-05, "loss": 0.6433, "step": 3310 }, { "epoch": 0.25732444582235314, "grad_norm": 0.41564321517944336, "learning_rate": 2e-05, "loss": 0.6555, "step": 3320 }, { "epoch": 0.25809951945434817, "grad_norm": 0.4872203767299652, "learning_rate": 2e-05, "loss": 0.627, "step": 3330 }, { "epoch": 0.2588745930863432, "grad_norm": 0.41196078062057495, "learning_rate": 2e-05, "loss": 0.6336, "step": 3340 }, { "epoch": 0.2596496667183382, "grad_norm": 0.4241744875907898, "learning_rate": 2e-05, "loss": 0.6524, "step": 3350 }, { "epoch": 0.2604247403503333, "grad_norm": 0.40693116188049316, "learning_rate": 2e-05, "loss": 0.6443, "step": 3360 }, { "epoch": 0.26119981398232833, "grad_norm": 0.4028782546520233, "learning_rate": 2e-05, "loss": 0.6482, "step": 3370 }, { "epoch": 0.26197488761432336, "grad_norm": 0.44793808460235596, "learning_rate": 2e-05, "loss": 0.6681, "step": 3380 }, { "epoch": 0.2627499612463184, "grad_norm": 0.40758317708969116, "learning_rate": 2e-05, "loss": 0.658, "step": 3390 }, { "epoch": 0.2635250348783134, "grad_norm": 0.4020330607891083, "learning_rate": 2e-05, "loss": 0.6529, "step": 3400 }, { "epoch": 0.2643001085103085, "grad_norm": 0.4066820442676544, "learning_rate": 2e-05, "loss": 0.6361, "step": 3410 }, { "epoch": 0.2650751821423035, "grad_norm": 0.3967213034629822, "learning_rate": 2e-05, "loss": 0.6488, "step": 3420 }, { "epoch": 0.26585025577429855, "grad_norm": 0.41118374466896057, "learning_rate": 2e-05, "loss": 0.6421, "step": 3430 }, { "epoch": 0.2666253294062936, "grad_norm": 0.3936464190483093, "learning_rate": 2e-05, "loss": 0.6377, "step": 3440 }, { "epoch": 0.26740040303828866, "grad_norm": 0.38485974073410034, "learning_rate": 2e-05, "loss": 0.6641, "step": 3450 }, { "epoch": 0.2681754766702837, "grad_norm": 0.40260979533195496, "learning_rate": 2e-05, "loss": 0.6302, "step": 3460 }, { "epoch": 0.2689505503022787, "grad_norm": 0.37042638659477234, "learning_rate": 2e-05, "loss": 0.6387, "step": 3470 }, { "epoch": 0.26972562393427374, "grad_norm": 0.4179660975933075, "learning_rate": 2e-05, "loss": 0.6452, "step": 3480 }, { "epoch": 0.2705006975662688, "grad_norm": 0.41497689485549927, "learning_rate": 2e-05, "loss": 0.6442, "step": 3490 }, { "epoch": 0.27127577119826385, "grad_norm": 0.413665235042572, "learning_rate": 2e-05, "loss": 0.6477, "step": 3500 }, { "epoch": 0.2720508448302589, "grad_norm": 0.48886892199516296, "learning_rate": 2e-05, "loss": 0.6385, "step": 3510 }, { "epoch": 0.2728259184622539, "grad_norm": 0.41618990898132324, "learning_rate": 2e-05, "loss": 0.6443, "step": 3520 }, { "epoch": 0.27360099209424893, "grad_norm": 0.3849734961986542, "learning_rate": 2e-05, "loss": 0.6454, "step": 3530 }, { "epoch": 0.274376065726244, "grad_norm": 0.4238608777523041, "learning_rate": 2e-05, "loss": 0.6554, "step": 3540 }, { "epoch": 0.27515113935823904, "grad_norm": 0.4051784574985504, "learning_rate": 2e-05, "loss": 0.6725, "step": 3550 }, { "epoch": 0.27592621299023407, "grad_norm": 0.40739062428474426, "learning_rate": 2e-05, "loss": 0.6454, "step": 3560 }, { "epoch": 0.2767012866222291, "grad_norm": 0.39898690581321716, "learning_rate": 2e-05, "loss": 0.6628, "step": 3570 }, { "epoch": 0.2774763602542242, "grad_norm": 0.39826616644859314, "learning_rate": 2e-05, "loss": 0.6479, "step": 3580 }, { "epoch": 0.2782514338862192, "grad_norm": 0.45955926179885864, "learning_rate": 2e-05, "loss": 0.6449, "step": 3590 }, { "epoch": 0.27902650751821423, "grad_norm": 0.41046255826950073, "learning_rate": 2e-05, "loss": 0.6408, "step": 3600 }, { "epoch": 0.27980158115020926, "grad_norm": 0.41490477323532104, "learning_rate": 2e-05, "loss": 0.6344, "step": 3610 }, { "epoch": 0.2805766547822043, "grad_norm": 0.418863445520401, "learning_rate": 2e-05, "loss": 0.6572, "step": 3620 }, { "epoch": 0.28135172841419936, "grad_norm": 0.3723398745059967, "learning_rate": 2e-05, "loss": 0.6395, "step": 3630 }, { "epoch": 0.2821268020461944, "grad_norm": 0.4250670373439789, "learning_rate": 2e-05, "loss": 0.6428, "step": 3640 }, { "epoch": 0.2829018756781894, "grad_norm": 0.41790127754211426, "learning_rate": 2e-05, "loss": 0.6462, "step": 3650 }, { "epoch": 0.28367694931018445, "grad_norm": 0.3801466226577759, "learning_rate": 2e-05, "loss": 0.6553, "step": 3660 }, { "epoch": 0.2844520229421795, "grad_norm": 0.3941139280796051, "learning_rate": 2e-05, "loss": 0.6464, "step": 3670 }, { "epoch": 0.28522709657417455, "grad_norm": 0.3839934766292572, "learning_rate": 2e-05, "loss": 0.6357, "step": 3680 }, { "epoch": 0.2860021702061696, "grad_norm": 0.5973071455955505, "learning_rate": 2e-05, "loss": 0.6594, "step": 3690 }, { "epoch": 0.2867772438381646, "grad_norm": 0.42879819869995117, "learning_rate": 2e-05, "loss": 0.6435, "step": 3700 }, { "epoch": 0.2875523174701597, "grad_norm": 0.4851306676864624, "learning_rate": 2e-05, "loss": 0.6534, "step": 3710 }, { "epoch": 0.2883273911021547, "grad_norm": 0.3869592547416687, "learning_rate": 2e-05, "loss": 0.6456, "step": 3720 }, { "epoch": 0.28910246473414974, "grad_norm": 0.42536336183547974, "learning_rate": 2e-05, "loss": 0.6413, "step": 3730 }, { "epoch": 0.28987753836614477, "grad_norm": 0.44545114040374756, "learning_rate": 2e-05, "loss": 0.6489, "step": 3740 }, { "epoch": 0.2906526119981398, "grad_norm": 0.44202905893325806, "learning_rate": 2e-05, "loss": 0.671, "step": 3750 }, { "epoch": 0.2914276856301349, "grad_norm": 0.4026680588722229, "learning_rate": 2e-05, "loss": 0.6521, "step": 3760 }, { "epoch": 0.2922027592621299, "grad_norm": 0.4531676471233368, "learning_rate": 2e-05, "loss": 0.66, "step": 3770 }, { "epoch": 0.29297783289412493, "grad_norm": 0.5140746235847473, "learning_rate": 2e-05, "loss": 0.6237, "step": 3780 }, { "epoch": 0.29375290652611996, "grad_norm": 0.6336513161659241, "learning_rate": 2e-05, "loss": 0.6452, "step": 3790 }, { "epoch": 0.29452798015811504, "grad_norm": 0.39968904852867126, "learning_rate": 2e-05, "loss": 0.6503, "step": 3800 }, { "epoch": 0.29530305379011007, "grad_norm": 0.3805924952030182, "learning_rate": 2e-05, "loss": 0.6596, "step": 3810 }, { "epoch": 0.2960781274221051, "grad_norm": 0.38822469115257263, "learning_rate": 2e-05, "loss": 0.6417, "step": 3820 }, { "epoch": 0.2968532010541001, "grad_norm": 0.39380943775177, "learning_rate": 2e-05, "loss": 0.6461, "step": 3830 }, { "epoch": 0.2976282746860952, "grad_norm": 0.40815481543540955, "learning_rate": 2e-05, "loss": 0.6459, "step": 3840 }, { "epoch": 0.29840334831809023, "grad_norm": 0.40621674060821533, "learning_rate": 2e-05, "loss": 0.6506, "step": 3850 }, { "epoch": 0.29917842195008526, "grad_norm": 0.3831629157066345, "learning_rate": 2e-05, "loss": 0.6297, "step": 3860 }, { "epoch": 0.2999534955820803, "grad_norm": 0.5715486407279968, "learning_rate": 2e-05, "loss": 0.6342, "step": 3870 }, { "epoch": 0.3007285692140753, "grad_norm": 0.3794034719467163, "learning_rate": 2e-05, "loss": 0.6518, "step": 3880 }, { "epoch": 0.3015036428460704, "grad_norm": 0.4201430380344391, "learning_rate": 2e-05, "loss": 0.647, "step": 3890 }, { "epoch": 0.3022787164780654, "grad_norm": 0.3711002469062805, "learning_rate": 2e-05, "loss": 0.6297, "step": 3900 }, { "epoch": 0.30305379011006045, "grad_norm": 0.4040549397468567, "learning_rate": 2e-05, "loss": 0.6677, "step": 3910 }, { "epoch": 0.3038288637420555, "grad_norm": 0.4129764139652252, "learning_rate": 2e-05, "loss": 0.635, "step": 3920 }, { "epoch": 0.30460393737405056, "grad_norm": 0.41761329770088196, "learning_rate": 2e-05, "loss": 0.6571, "step": 3930 }, { "epoch": 0.3053790110060456, "grad_norm": 0.39217743277549744, "learning_rate": 2e-05, "loss": 0.638, "step": 3940 }, { "epoch": 0.3061540846380406, "grad_norm": 0.4051911234855652, "learning_rate": 2e-05, "loss": 0.6575, "step": 3950 }, { "epoch": 0.30692915827003564, "grad_norm": 0.38253021240234375, "learning_rate": 2e-05, "loss": 0.621, "step": 3960 }, { "epoch": 0.30770423190203067, "grad_norm": 0.3943375051021576, "learning_rate": 2e-05, "loss": 0.6657, "step": 3970 }, { "epoch": 0.30847930553402575, "grad_norm": 0.38000527024269104, "learning_rate": 2e-05, "loss": 0.6324, "step": 3980 }, { "epoch": 0.3092543791660208, "grad_norm": 0.40028852224349976, "learning_rate": 2e-05, "loss": 0.6393, "step": 3990 }, { "epoch": 0.3100294527980158, "grad_norm": 0.39642465114593506, "learning_rate": 2e-05, "loss": 0.6441, "step": 4000 }, { "epoch": 0.31080452643001083, "grad_norm": 0.4065065383911133, "learning_rate": 2e-05, "loss": 0.6367, "step": 4010 }, { "epoch": 0.3115796000620059, "grad_norm": 0.4016914367675781, "learning_rate": 2e-05, "loss": 0.6426, "step": 4020 }, { "epoch": 0.31235467369400094, "grad_norm": 0.3893164396286011, "learning_rate": 2e-05, "loss": 0.6348, "step": 4030 }, { "epoch": 0.31312974732599597, "grad_norm": 0.3809949457645416, "learning_rate": 2e-05, "loss": 0.6472, "step": 4040 }, { "epoch": 0.313904820957991, "grad_norm": 0.3741115629673004, "learning_rate": 2e-05, "loss": 0.6438, "step": 4050 }, { "epoch": 0.3146798945899861, "grad_norm": 0.4036007523536682, "learning_rate": 2e-05, "loss": 0.6506, "step": 4060 }, { "epoch": 0.3154549682219811, "grad_norm": 0.4299529790878296, "learning_rate": 2e-05, "loss": 0.6394, "step": 4070 }, { "epoch": 0.31623004185397613, "grad_norm": 0.42603036761283875, "learning_rate": 2e-05, "loss": 0.6531, "step": 4080 }, { "epoch": 0.31700511548597116, "grad_norm": 0.3851945400238037, "learning_rate": 2e-05, "loss": 0.6213, "step": 4090 }, { "epoch": 0.3177801891179662, "grad_norm": 0.4368724524974823, "learning_rate": 2e-05, "loss": 0.6393, "step": 4100 }, { "epoch": 0.31855526274996127, "grad_norm": 1.2080000638961792, "learning_rate": 2e-05, "loss": 0.6393, "step": 4110 }, { "epoch": 0.3193303363819563, "grad_norm": 0.38193827867507935, "learning_rate": 2e-05, "loss": 0.6368, "step": 4120 }, { "epoch": 0.3201054100139513, "grad_norm": 0.42428210377693176, "learning_rate": 2e-05, "loss": 0.6374, "step": 4130 }, { "epoch": 0.32088048364594635, "grad_norm": 0.42469552159309387, "learning_rate": 2e-05, "loss": 0.636, "step": 4140 }, { "epoch": 0.32165555727794143, "grad_norm": 0.39727783203125, "learning_rate": 2e-05, "loss": 0.6362, "step": 4150 }, { "epoch": 0.32243063090993646, "grad_norm": 0.3932878375053406, "learning_rate": 2e-05, "loss": 0.6376, "step": 4160 }, { "epoch": 0.3232057045419315, "grad_norm": 0.38844063878059387, "learning_rate": 2e-05, "loss": 0.6477, "step": 4170 }, { "epoch": 0.3239807781739265, "grad_norm": 0.4405646324157715, "learning_rate": 2e-05, "loss": 0.6518, "step": 4180 }, { "epoch": 0.32475585180592154, "grad_norm": 0.3897880017757416, "learning_rate": 2e-05, "loss": 0.6424, "step": 4190 }, { "epoch": 0.3255309254379166, "grad_norm": 0.3960212767124176, "learning_rate": 2e-05, "loss": 0.638, "step": 4200 }, { "epoch": 0.32630599906991165, "grad_norm": 0.4208945631980896, "learning_rate": 2e-05, "loss": 0.6492, "step": 4210 }, { "epoch": 0.32708107270190667, "grad_norm": 0.41353705525398254, "learning_rate": 2e-05, "loss": 0.6598, "step": 4220 }, { "epoch": 0.3278561463339017, "grad_norm": 0.41692233085632324, "learning_rate": 2e-05, "loss": 0.6379, "step": 4230 }, { "epoch": 0.3286312199658968, "grad_norm": 0.6839759349822998, "learning_rate": 2e-05, "loss": 0.6324, "step": 4240 }, { "epoch": 0.3294062935978918, "grad_norm": 0.40540701150894165, "learning_rate": 2e-05, "loss": 0.6239, "step": 4250 }, { "epoch": 0.33018136722988684, "grad_norm": 0.3870887756347656, "learning_rate": 2e-05, "loss": 0.6316, "step": 4260 }, { "epoch": 0.33095644086188186, "grad_norm": 0.6416301727294922, "learning_rate": 2e-05, "loss": 0.6442, "step": 4270 }, { "epoch": 0.33173151449387694, "grad_norm": 0.48203006386756897, "learning_rate": 2e-05, "loss": 0.639, "step": 4280 }, { "epoch": 0.33250658812587197, "grad_norm": 0.39743801951408386, "learning_rate": 2e-05, "loss": 0.6509, "step": 4290 }, { "epoch": 0.333281661757867, "grad_norm": 0.3943183422088623, "learning_rate": 2e-05, "loss": 0.637, "step": 4300 }, { "epoch": 0.334056735389862, "grad_norm": 0.44573351740837097, "learning_rate": 2e-05, "loss": 0.6365, "step": 4310 }, { "epoch": 0.33483180902185705, "grad_norm": 0.3921007812023163, "learning_rate": 2e-05, "loss": 0.6439, "step": 4320 }, { "epoch": 0.33560688265385213, "grad_norm": 0.3896481394767761, "learning_rate": 2e-05, "loss": 0.662, "step": 4330 }, { "epoch": 0.33638195628584716, "grad_norm": 0.39618930220603943, "learning_rate": 2e-05, "loss": 0.6438, "step": 4340 }, { "epoch": 0.3371570299178422, "grad_norm": 0.3820051848888397, "learning_rate": 2e-05, "loss": 0.6293, "step": 4350 }, { "epoch": 0.3379321035498372, "grad_norm": 0.3976047933101654, "learning_rate": 2e-05, "loss": 0.6283, "step": 4360 }, { "epoch": 0.3387071771818323, "grad_norm": 0.3893871307373047, "learning_rate": 2e-05, "loss": 0.6406, "step": 4370 }, { "epoch": 0.3394822508138273, "grad_norm": 0.39987680315971375, "learning_rate": 2e-05, "loss": 0.6473, "step": 4380 }, { "epoch": 0.34025732444582235, "grad_norm": 0.3805384635925293, "learning_rate": 2e-05, "loss": 0.6485, "step": 4390 }, { "epoch": 0.3410323980778174, "grad_norm": 0.38630494475364685, "learning_rate": 2e-05, "loss": 0.6291, "step": 4400 }, { "epoch": 0.3418074717098124, "grad_norm": 0.3626739978790283, "learning_rate": 2e-05, "loss": 0.6456, "step": 4410 }, { "epoch": 0.3425825453418075, "grad_norm": 0.44230303168296814, "learning_rate": 2e-05, "loss": 0.631, "step": 4420 }, { "epoch": 0.3433576189738025, "grad_norm": 0.38728994131088257, "learning_rate": 2e-05, "loss": 0.6441, "step": 4430 }, { "epoch": 0.34413269260579754, "grad_norm": 0.3877067267894745, "learning_rate": 2e-05, "loss": 0.6304, "step": 4440 }, { "epoch": 0.34490776623779257, "grad_norm": 0.39325466752052307, "learning_rate": 2e-05, "loss": 0.655, "step": 4450 }, { "epoch": 0.34568283986978765, "grad_norm": 0.38017114996910095, "learning_rate": 2e-05, "loss": 0.649, "step": 4460 }, { "epoch": 0.3464579135017827, "grad_norm": 0.41399797797203064, "learning_rate": 2e-05, "loss": 0.6425, "step": 4470 }, { "epoch": 0.3472329871337777, "grad_norm": 0.3768306076526642, "learning_rate": 2e-05, "loss": 0.6473, "step": 4480 }, { "epoch": 0.34800806076577273, "grad_norm": 0.43770062923431396, "learning_rate": 2e-05, "loss": 0.6564, "step": 4490 }, { "epoch": 0.3487831343977678, "grad_norm": 0.3727886974811554, "learning_rate": 2e-05, "loss": 0.6495, "step": 4500 }, { "epoch": 0.34955820802976284, "grad_norm": 0.40988942980766296, "learning_rate": 2e-05, "loss": 0.626, "step": 4510 }, { "epoch": 0.35033328166175787, "grad_norm": 0.45901086926460266, "learning_rate": 2e-05, "loss": 0.6393, "step": 4520 }, { "epoch": 0.3511083552937529, "grad_norm": 0.4200774133205414, "learning_rate": 2e-05, "loss": 0.6368, "step": 4530 }, { "epoch": 0.3518834289257479, "grad_norm": 0.42148029804229736, "learning_rate": 2e-05, "loss": 0.6433, "step": 4540 }, { "epoch": 0.352658502557743, "grad_norm": 0.39140892028808594, "learning_rate": 2e-05, "loss": 0.6254, "step": 4550 }, { "epoch": 0.35343357618973803, "grad_norm": 0.41720694303512573, "learning_rate": 2e-05, "loss": 0.6399, "step": 4560 }, { "epoch": 0.35420864982173306, "grad_norm": 0.5104743242263794, "learning_rate": 2e-05, "loss": 0.6277, "step": 4570 }, { "epoch": 0.3549837234537281, "grad_norm": 0.422849178314209, "learning_rate": 2e-05, "loss": 0.6163, "step": 4580 }, { "epoch": 0.35575879708572317, "grad_norm": 0.38357770442962646, "learning_rate": 2e-05, "loss": 0.6407, "step": 4590 }, { "epoch": 0.3565338707177182, "grad_norm": 0.3941023051738739, "learning_rate": 2e-05, "loss": 0.6307, "step": 4600 }, { "epoch": 0.3573089443497132, "grad_norm": 0.4773350954055786, "learning_rate": 2e-05, "loss": 0.6358, "step": 4610 }, { "epoch": 0.35808401798170825, "grad_norm": 0.4011412560939789, "learning_rate": 2e-05, "loss": 0.6364, "step": 4620 }, { "epoch": 0.35885909161370333, "grad_norm": 0.3978007733821869, "learning_rate": 2e-05, "loss": 0.6334, "step": 4630 }, { "epoch": 0.35963416524569836, "grad_norm": 0.4080989956855774, "learning_rate": 2e-05, "loss": 0.6289, "step": 4640 }, { "epoch": 0.3604092388776934, "grad_norm": 0.3811449110507965, "learning_rate": 2e-05, "loss": 0.6404, "step": 4650 }, { "epoch": 0.3611843125096884, "grad_norm": 0.41419267654418945, "learning_rate": 2e-05, "loss": 0.6292, "step": 4660 }, { "epoch": 0.36195938614168344, "grad_norm": 0.3951331377029419, "learning_rate": 2e-05, "loss": 0.6456, "step": 4670 }, { "epoch": 0.3627344597736785, "grad_norm": 0.38848650455474854, "learning_rate": 2e-05, "loss": 0.6473, "step": 4680 }, { "epoch": 0.36350953340567355, "grad_norm": 0.4406234622001648, "learning_rate": 2e-05, "loss": 0.6385, "step": 4690 }, { "epoch": 0.3642846070376686, "grad_norm": 0.38930660486221313, "learning_rate": 2e-05, "loss": 0.6249, "step": 4700 }, { "epoch": 0.3650596806696636, "grad_norm": 0.522161066532135, "learning_rate": 2e-05, "loss": 0.6325, "step": 4710 }, { "epoch": 0.3658347543016587, "grad_norm": 0.4170997440814972, "learning_rate": 2e-05, "loss": 0.6517, "step": 4720 }, { "epoch": 0.3666098279336537, "grad_norm": 0.3969718813896179, "learning_rate": 2e-05, "loss": 0.6425, "step": 4730 }, { "epoch": 0.36738490156564874, "grad_norm": 0.4235055148601532, "learning_rate": 2e-05, "loss": 0.6391, "step": 4740 }, { "epoch": 0.36815997519764376, "grad_norm": 0.47189322113990784, "learning_rate": 2e-05, "loss": 0.6379, "step": 4750 }, { "epoch": 0.3689350488296388, "grad_norm": 0.3948569595813751, "learning_rate": 2e-05, "loss": 0.6255, "step": 4760 }, { "epoch": 0.36971012246163387, "grad_norm": 0.4018995463848114, "learning_rate": 2e-05, "loss": 0.634, "step": 4770 }, { "epoch": 0.3704851960936289, "grad_norm": 0.4135935604572296, "learning_rate": 2e-05, "loss": 0.63, "step": 4780 }, { "epoch": 0.3712602697256239, "grad_norm": 0.44257670640945435, "learning_rate": 2e-05, "loss": 0.64, "step": 4790 }, { "epoch": 0.37203534335761895, "grad_norm": 0.40565165877342224, "learning_rate": 2e-05, "loss": 0.6294, "step": 4800 }, { "epoch": 0.37281041698961404, "grad_norm": 0.38942795991897583, "learning_rate": 2e-05, "loss": 0.6536, "step": 4810 }, { "epoch": 0.37358549062160906, "grad_norm": 0.42309367656707764, "learning_rate": 2e-05, "loss": 0.6306, "step": 4820 }, { "epoch": 0.3743605642536041, "grad_norm": 0.44575944542884827, "learning_rate": 2e-05, "loss": 0.6513, "step": 4830 }, { "epoch": 0.3751356378855991, "grad_norm": 0.36773574352264404, "learning_rate": 2e-05, "loss": 0.6192, "step": 4840 }, { "epoch": 0.3759107115175942, "grad_norm": 0.4058752655982971, "learning_rate": 2e-05, "loss": 0.6378, "step": 4850 }, { "epoch": 0.3766857851495892, "grad_norm": 0.3874194324016571, "learning_rate": 2e-05, "loss": 0.6252, "step": 4860 }, { "epoch": 0.37746085878158425, "grad_norm": 0.3904745280742645, "learning_rate": 2e-05, "loss": 0.6341, "step": 4870 }, { "epoch": 0.3782359324135793, "grad_norm": 0.3832138478755951, "learning_rate": 2e-05, "loss": 0.6306, "step": 4880 }, { "epoch": 0.3790110060455743, "grad_norm": 0.4503752887248993, "learning_rate": 2e-05, "loss": 0.6262, "step": 4890 }, { "epoch": 0.3797860796775694, "grad_norm": 0.38909709453582764, "learning_rate": 2e-05, "loss": 0.635, "step": 4900 }, { "epoch": 0.3805611533095644, "grad_norm": 0.5325521230697632, "learning_rate": 2e-05, "loss": 0.6374, "step": 4910 }, { "epoch": 0.38133622694155944, "grad_norm": 0.39805978536605835, "learning_rate": 2e-05, "loss": 0.6487, "step": 4920 }, { "epoch": 0.38211130057355447, "grad_norm": 0.3982967734336853, "learning_rate": 2e-05, "loss": 0.6307, "step": 4930 }, { "epoch": 0.38288637420554955, "grad_norm": 0.37822240591049194, "learning_rate": 2e-05, "loss": 0.638, "step": 4940 }, { "epoch": 0.3836614478375446, "grad_norm": 0.37436559796333313, "learning_rate": 2e-05, "loss": 0.6263, "step": 4950 }, { "epoch": 0.3844365214695396, "grad_norm": 0.5863552093505859, "learning_rate": 2e-05, "loss": 0.6331, "step": 4960 }, { "epoch": 0.38521159510153463, "grad_norm": 0.4198673963546753, "learning_rate": 2e-05, "loss": 0.6341, "step": 4970 }, { "epoch": 0.38598666873352966, "grad_norm": 0.3894166052341461, "learning_rate": 2e-05, "loss": 0.6318, "step": 4980 }, { "epoch": 0.38676174236552474, "grad_norm": 0.37254706025123596, "learning_rate": 2e-05, "loss": 0.6347, "step": 4990 }, { "epoch": 0.38753681599751977, "grad_norm": 0.3797888159751892, "learning_rate": 2e-05, "loss": 0.6163, "step": 5000 }, { "epoch": 0.3883118896295148, "grad_norm": 0.3750082552433014, "learning_rate": 2e-05, "loss": 0.6253, "step": 5010 }, { "epoch": 0.3890869632615098, "grad_norm": 0.4142601191997528, "learning_rate": 2e-05, "loss": 0.6403, "step": 5020 }, { "epoch": 0.3898620368935049, "grad_norm": 0.37522315979003906, "learning_rate": 2e-05, "loss": 0.6245, "step": 5030 }, { "epoch": 0.39063711052549993, "grad_norm": 0.3764517903327942, "learning_rate": 2e-05, "loss": 0.6287, "step": 5040 }, { "epoch": 0.39141218415749496, "grad_norm": 0.3717632591724396, "learning_rate": 2e-05, "loss": 0.6169, "step": 5050 }, { "epoch": 0.39218725778949, "grad_norm": 0.3888686001300812, "learning_rate": 2e-05, "loss": 0.6319, "step": 5060 }, { "epoch": 0.39296233142148507, "grad_norm": 0.38612762093544006, "learning_rate": 2e-05, "loss": 0.6307, "step": 5070 }, { "epoch": 0.3937374050534801, "grad_norm": 0.39416858553886414, "learning_rate": 2e-05, "loss": 0.6188, "step": 5080 }, { "epoch": 0.3945124786854751, "grad_norm": 0.9586396217346191, "learning_rate": 2e-05, "loss": 0.6311, "step": 5090 }, { "epoch": 0.39528755231747015, "grad_norm": 0.38882219791412354, "learning_rate": 2e-05, "loss": 0.6317, "step": 5100 }, { "epoch": 0.3960626259494652, "grad_norm": 0.386748731136322, "learning_rate": 2e-05, "loss": 0.6179, "step": 5110 }, { "epoch": 0.39683769958146026, "grad_norm": 0.6027523279190063, "learning_rate": 2e-05, "loss": 0.623, "step": 5120 }, { "epoch": 0.3976127732134553, "grad_norm": 0.36918896436691284, "learning_rate": 2e-05, "loss": 0.6436, "step": 5130 }, { "epoch": 0.3983878468454503, "grad_norm": 0.38792452216148376, "learning_rate": 2e-05, "loss": 0.6204, "step": 5140 }, { "epoch": 0.39916292047744534, "grad_norm": 0.48190125823020935, "learning_rate": 2e-05, "loss": 0.6441, "step": 5150 }, { "epoch": 0.3999379941094404, "grad_norm": 0.4005718529224396, "learning_rate": 2e-05, "loss": 0.6359, "step": 5160 }, { "epoch": 0.40071306774143545, "grad_norm": 0.4082946479320526, "learning_rate": 2e-05, "loss": 0.6268, "step": 5170 }, { "epoch": 0.4014881413734305, "grad_norm": 0.4058220088481903, "learning_rate": 2e-05, "loss": 0.6409, "step": 5180 }, { "epoch": 0.4022632150054255, "grad_norm": 0.36767181754112244, "learning_rate": 2e-05, "loss": 0.6376, "step": 5190 }, { "epoch": 0.4030382886374205, "grad_norm": 0.4004252851009369, "learning_rate": 2e-05, "loss": 0.6579, "step": 5200 }, { "epoch": 0.4038133622694156, "grad_norm": 0.3943789005279541, "learning_rate": 2e-05, "loss": 0.6486, "step": 5210 }, { "epoch": 0.40458843590141064, "grad_norm": 0.6699329018592834, "learning_rate": 2e-05, "loss": 0.6265, "step": 5220 }, { "epoch": 0.40536350953340566, "grad_norm": 0.4446292519569397, "learning_rate": 2e-05, "loss": 0.6232, "step": 5230 }, { "epoch": 0.4061385831654007, "grad_norm": 0.373099148273468, "learning_rate": 2e-05, "loss": 0.6116, "step": 5240 }, { "epoch": 0.4069136567973958, "grad_norm": 0.453997403383255, "learning_rate": 2e-05, "loss": 0.645, "step": 5250 }, { "epoch": 0.4076887304293908, "grad_norm": 0.40322959423065186, "learning_rate": 2e-05, "loss": 0.6292, "step": 5260 }, { "epoch": 0.4084638040613858, "grad_norm": 0.3951454758644104, "learning_rate": 2e-05, "loss": 0.6211, "step": 5270 }, { "epoch": 0.40923887769338085, "grad_norm": 0.38401883840560913, "learning_rate": 2e-05, "loss": 0.6469, "step": 5280 }, { "epoch": 0.41001395132537594, "grad_norm": 0.4328628182411194, "learning_rate": 2e-05, "loss": 0.6204, "step": 5290 }, { "epoch": 0.41078902495737096, "grad_norm": 0.40740108489990234, "learning_rate": 2e-05, "loss": 0.6354, "step": 5300 }, { "epoch": 0.411564098589366, "grad_norm": 0.41443267464637756, "learning_rate": 2e-05, "loss": 0.6424, "step": 5310 }, { "epoch": 0.412339172221361, "grad_norm": 0.36498749256134033, "learning_rate": 2e-05, "loss": 0.6337, "step": 5320 }, { "epoch": 0.41311424585335604, "grad_norm": 0.43135717511177063, "learning_rate": 2e-05, "loss": 0.6352, "step": 5330 }, { "epoch": 0.4138893194853511, "grad_norm": 0.7326414585113525, "learning_rate": 2e-05, "loss": 0.6414, "step": 5340 }, { "epoch": 0.41466439311734615, "grad_norm": 0.3837507665157318, "learning_rate": 1.999194520388485e-05, "loss": 0.6311, "step": 5350 }, { "epoch": 0.4154394667493412, "grad_norm": 0.39215368032455444, "learning_rate": 1.9959247303157763e-05, "loss": 0.6161, "step": 5360 }, { "epoch": 0.4162145403813362, "grad_norm": 0.46202924847602844, "learning_rate": 1.990149424459817e-05, "loss": 0.6389, "step": 5370 }, { "epoch": 0.4169896140133313, "grad_norm": 0.3741549551486969, "learning_rate": 1.9818847538648688e-05, "loss": 0.6292, "step": 5380 }, { "epoch": 0.4177646876453263, "grad_norm": 0.4218798875808716, "learning_rate": 1.971153831256721e-05, "loss": 0.6252, "step": 5390 }, { "epoch": 0.41853976127732134, "grad_norm": 0.3944324254989624, "learning_rate": 1.9579866664063435e-05, "loss": 0.6206, "step": 5400 }, { "epoch": 0.41931483490931637, "grad_norm": 0.43683046102523804, "learning_rate": 1.9424200822054782e-05, "loss": 0.6298, "step": 5410 }, { "epoch": 0.42008990854131145, "grad_norm": 0.3944668769836426, "learning_rate": 1.9244976116888626e-05, "loss": 0.6398, "step": 5420 }, { "epoch": 0.4208649821733065, "grad_norm": 0.4029880166053772, "learning_rate": 1.904269376291071e-05, "loss": 0.6539, "step": 5430 }, { "epoch": 0.4216400558053015, "grad_norm": 0.402089387178421, "learning_rate": 1.88179194567844e-05, "loss": 0.6266, "step": 5440 }, { "epoch": 0.42241512943729653, "grad_norm": 0.4242640733718872, "learning_rate": 1.8571281795480632e-05, "loss": 0.6418, "step": 5450 }, { "epoch": 0.42319020306929156, "grad_norm": 0.3908100128173828, "learning_rate": 1.8303470518362808e-05, "loss": 0.6373, "step": 5460 }, { "epoch": 0.42396527670128664, "grad_norm": 0.44044214487075806, "learning_rate": 1.801523457828271e-05, "loss": 0.6283, "step": 5470 }, { "epoch": 0.42474035033328167, "grad_norm": 0.40724480152130127, "learning_rate": 1.7707380047081796e-05, "loss": 0.6333, "step": 5480 }, { "epoch": 0.4255154239652767, "grad_norm": 0.397793710231781, "learning_rate": 1.7380767861355252e-05, "loss": 0.6167, "step": 5490 }, { "epoch": 0.4262904975972717, "grad_norm": 0.3732137382030487, "learning_rate": 1.703631141478299e-05, "loss": 0.6236, "step": 5500 }, { "epoch": 0.4270655712292668, "grad_norm": 0.37707749009132385, "learning_rate": 1.6674974003760705e-05, "loss": 0.6212, "step": 5510 }, { "epoch": 0.42784064486126183, "grad_norm": 0.36281004548072815, "learning_rate": 1.6297766133474556e-05, "loss": 0.6292, "step": 5520 }, { "epoch": 0.42861571849325686, "grad_norm": 0.38236552476882935, "learning_rate": 1.5905742691953186e-05, "loss": 0.5982, "step": 5530 }, { "epoch": 0.4293907921252519, "grad_norm": 0.4031112790107727, "learning_rate": 1.55e-05, "loss": 0.6329, "step": 5540 }, { "epoch": 0.4301658657572469, "grad_norm": 0.45905470848083496, "learning_rate": 1.5081672745255862e-05, "loss": 0.6362, "step": 5550 }, { "epoch": 0.430940939389242, "grad_norm": 0.5283321142196655, "learning_rate": 1.4651930808966206e-05, "loss": 0.6264, "step": 5560 }, { "epoch": 0.431716013021237, "grad_norm": 0.4312293529510498, "learning_rate": 1.4211975994326848e-05, "loss": 0.6196, "step": 5570 }, { "epoch": 0.43249108665323205, "grad_norm": 0.38796475529670715, "learning_rate": 1.376303866555779e-05, "loss": 0.6332, "step": 5580 }, { "epoch": 0.4332661602852271, "grad_norm": 0.3728007972240448, "learning_rate": 1.3306374307104164e-05, "loss": 0.6276, "step": 5590 }, { "epoch": 0.43404123391722216, "grad_norm": 0.38708752393722534, "learning_rate": 1.2843260012586718e-05, "loss": 0.6207, "step": 5600 }, { "epoch": 0.4348163075492172, "grad_norm": 0.37163254618644714, "learning_rate": 1.2374990913320726e-05, "loss": 0.6379, "step": 5610 }, { "epoch": 0.4355913811812122, "grad_norm": 0.3740164637565613, "learning_rate": 1.1902876556391247e-05, "loss": 0.6162, "step": 5620 }, { "epoch": 0.43636645481320724, "grad_norm": 0.3969056308269501, "learning_rate": 1.1428237242413685e-05, "loss": 0.6249, "step": 5630 }, { "epoch": 0.4371415284452023, "grad_norm": 0.392935186624527, "learning_rate": 1.095240033322132e-05, "loss": 0.6355, "step": 5640 }, { "epoch": 0.43791660207719735, "grad_norm": 0.39747709035873413, "learning_rate": 1.047669653980572e-05, "loss": 0.6355, "step": 5650 }, { "epoch": 0.4386916757091924, "grad_norm": 0.5514155030250549, "learning_rate": 1.0002456200890902e-05, "loss": 0.599, "step": 5660 }, { "epoch": 0.4394667493411874, "grad_norm": 0.4582012891769409, "learning_rate": 9.531005562548668e-06, "loss": 0.6125, "step": 5670 }, { "epoch": 0.44024182297318243, "grad_norm": 0.3846968114376068, "learning_rate": 9.06366306925925e-06, "loss": 0.6362, "step": 5680 }, { "epoch": 0.4410168966051775, "grad_norm": 0.38858526945114136, "learning_rate": 8.601735676789686e-06, "loss": 0.6182, "step": 5690 }, { "epoch": 0.44179197023717254, "grad_norm": 0.4033548831939697, "learning_rate": 8.14651519720118e-06, "loss": 0.6116, "step": 5700 }, { "epoch": 0.44256704386916756, "grad_norm": 0.3851390779018402, "learning_rate": 7.699274686206866e-06, "loss": 0.6039, "step": 5710 }, { "epoch": 0.4433421175011626, "grad_norm": 0.366301953792572, "learning_rate": 7.261264882983024e-06, "loss": 0.6339, "step": 5720 }, { "epoch": 0.4441171911331577, "grad_norm": 0.3673529326915741, "learning_rate": 6.8337107123900386e-06, "loss": 0.6329, "step": 5730 }, { "epoch": 0.4448922647651527, "grad_norm": 0.4046303927898407, "learning_rate": 6.417807859384881e-06, "loss": 0.6259, "step": 5740 }, { "epoch": 0.4456673383971477, "grad_norm": 0.4655354619026184, "learning_rate": 6.014719425205009e-06, "loss": 0.6203, "step": 5750 }, { "epoch": 0.44644241202914275, "grad_norm": 0.3795314133167267, "learning_rate": 5.6255726746749275e-06, "loss": 0.6186, "step": 5760 }, { "epoch": 0.4472174856611378, "grad_norm": 0.400132954120636, "learning_rate": 5.251455883731728e-06, "loss": 0.6053, "step": 5770 }, { "epoch": 0.44799255929313286, "grad_norm": 0.39265620708465576, "learning_rate": 4.893415295985812e-06, "loss": 0.6358, "step": 5780 }, { "epoch": 0.4487676329251279, "grad_norm": 0.38653743267059326, "learning_rate": 4.552452196827885e-06, "loss": 0.6254, "step": 5790 }, { "epoch": 0.4495427065571229, "grad_norm": 0.42161431908607483, "learning_rate": 4.229520113264785e-06, "loss": 0.6198, "step": 5800 }, { "epoch": 0.45031778018911794, "grad_norm": 0.4898611903190613, "learning_rate": 3.925522147314915e-06, "loss": 0.6327, "step": 5810 }, { "epoch": 0.451092853821113, "grad_norm": 0.38622191548347473, "learning_rate": 3.641308450420675e-06, "loss": 0.6214, "step": 5820 }, { "epoch": 0.45186792745310805, "grad_norm": 0.42542681097984314, "learning_rate": 3.37767384594087e-06, "loss": 0.6085, "step": 5830 }, { "epoch": 0.4526430010851031, "grad_norm": 0.3988613188266754, "learning_rate": 3.1353556063719357e-06, "loss": 0.6289, "step": 5840 }, { "epoch": 0.4534180747170981, "grad_norm": 0.4273814260959625, "learning_rate": 2.9150313915141474e-06, "loss": 0.6189, "step": 5850 }, { "epoch": 0.4541931483490932, "grad_norm": 0.3907577693462372, "learning_rate": 2.717317353348891e-06, "loss": 0.6178, "step": 5860 }, { "epoch": 0.4549682219810882, "grad_norm": 0.37921684980392456, "learning_rate": 2.5427664129268253e-06, "loss": 0.6268, "step": 5870 }, { "epoch": 0.45574329561308324, "grad_norm": 0.3783731460571289, "learning_rate": 2.391866714085717e-06, "loss": 0.6291, "step": 5880 }, { "epoch": 0.45651836924507827, "grad_norm": 0.42365536093711853, "learning_rate": 2.2650402583222753e-06, "loss": 0.6278, "step": 5890 }, { "epoch": 0.4572934428770733, "grad_norm": 0.3801100254058838, "learning_rate": 2.1626417246356398e-06, "loss": 0.628, "step": 5900 }, { "epoch": 0.4580685165090684, "grad_norm": 0.38439080119132996, "learning_rate": 2.084957477642894e-06, "loss": 0.6203, "step": 5910 }, { "epoch": 0.4588435901410634, "grad_norm": 0.3800904452800751, "learning_rate": 2.0322047667405147e-06, "loss": 0.614, "step": 5920 }, { "epoch": 0.45961866377305843, "grad_norm": 0.5425535440444946, "learning_rate": 2.0045311185513342e-06, "loss": 0.6142, "step": 5930 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.6494000762504348e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }