Download 200M/trainer_state.json from SynthCode-Project/rv2-gemma12b-g2_2_oldcode_synthcm_newcode: direct link, hf CLI and curl.
- Browser
- Download file 35.7 kB
-
https://huggingface.co/SynthCode-Project/rv2-gemma12b-g2_2_oldcode_synthcm_newcode/resolve/main/200M/trainer_state.json
- Command line
-
hf download hf://SynthCode-Project/rv2-gemma12b-g2_2_oldcode_synthcm_newcode/200M/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/SynthCode-Project/rv2-gemma12b-g2_2_oldcode_synthcm_newcode/resolve/main/200M/trainer_state.json
35.7 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.042687531465010906, | |
| "eval_steps": 500, | |
| "global_step": 2035, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.00020976673938580297, | |
| "grad_norm": 236.7567785411443, | |
| "learning_rate": 2.910112359550562e-06, | |
| "loss": 1.5920657157897948, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.00041953347877160595, | |
| "grad_norm": 152.92314363522394, | |
| "learning_rate": 3.921348314606742e-06, | |
| "loss": 0.9421598434448242, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.000629300218157409, | |
| "grad_norm": 97.19978632147773, | |
| "learning_rate": 4.932584269662922e-06, | |
| "loss": 0.7996736526489258, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.0008390669575432119, | |
| "grad_norm": 157.7423675487546, | |
| "learning_rate": 5.943820224719102e-06, | |
| "loss": 0.760670280456543, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.001048833696929015, | |
| "grad_norm": 49.50204924369943, | |
| "learning_rate": 6.955056179775282e-06, | |
| "loss": 0.7635975837707519, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.001258600436314818, | |
| "grad_norm": 16.48624285559217, | |
| "learning_rate": 7.966292134831462e-06, | |
| "loss": 0.7791356563568115, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.0014683671757006209, | |
| "grad_norm": 6.858907596379825, | |
| "learning_rate": 8.977528089887641e-06, | |
| "loss": 0.7495433330535889, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.0016781339150864238, | |
| "grad_norm": 26.435928023185784, | |
| "learning_rate": 9.988764044943822e-06, | |
| "loss": 0.7318498134613037, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.001887900654472227, | |
| "grad_norm": 214.57004030820568, | |
| "learning_rate": 1.1000000000000001e-05, | |
| "loss": 0.7413080215454102, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.00209766739385803, | |
| "grad_norm": 7.939148544393301, | |
| "learning_rate": 1.2011235955056182e-05, | |
| "loss": 0.8061410903930664, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.0023074341332438328, | |
| "grad_norm": 14.183647299272815, | |
| "learning_rate": 1.3022471910112362e-05, | |
| "loss": 0.7331802368164062, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.002517200872629636, | |
| "grad_norm": 22.423640491145502, | |
| "learning_rate": 1.403370786516854e-05, | |
| "loss": 0.7498276710510254, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.002726967612015439, | |
| "grad_norm": 3.136265232048693, | |
| "learning_rate": 1.504494382022472e-05, | |
| "loss": 0.724825668334961, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.0029367343514012417, | |
| "grad_norm": 8.214245546263463, | |
| "learning_rate": 1.60561797752809e-05, | |
| "loss": 0.6886782646179199, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.003146501090787045, | |
| "grad_norm": 5.619530923664304, | |
| "learning_rate": 1.706741573033708e-05, | |
| "loss": 0.7081296443939209, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.0033562678301728476, | |
| "grad_norm": 10.033723007819054, | |
| "learning_rate": 1.8078651685393256e-05, | |
| "loss": 0.7299324035644531, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.0035660345695586507, | |
| "grad_norm": 11.134808180954863, | |
| "learning_rate": 1.908988764044944e-05, | |
| "loss": 0.745941162109375, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.003775801308944454, | |
| "grad_norm": 2.4304907872424795, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7129830360412598, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.0039855680483302566, | |
| "grad_norm": 4.018584134102583, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7092458724975585, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.00419533478771606, | |
| "grad_norm": 5.006464475899677, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7565587520599365, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.004405101527101863, | |
| "grad_norm": 2.800599112711121, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6959824562072754, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.0046148682664876655, | |
| "grad_norm": 6.231621527897506, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6992167472839356, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.004824635005873469, | |
| "grad_norm": 10.811727778354081, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6952213287353516, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.005034401745259272, | |
| "grad_norm": 11.261067852316236, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7460278987884521, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.0052441684846450745, | |
| "grad_norm": 7.649125680617738, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7858521461486816, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.005453935224030878, | |
| "grad_norm": 4.490247060675485, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7642570018768311, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.005663701963416681, | |
| "grad_norm": 5.320163840820431, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7289691925048828, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.0058734687028024835, | |
| "grad_norm": 3.4799647445683717, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6995810508728028, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.006083235442188286, | |
| "grad_norm": 34.442893954128465, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7102492809295654, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.00629300218157409, | |
| "grad_norm": 4.179341348142214, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7110370635986328, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.0065027689209598925, | |
| "grad_norm": 4.270936726323635, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7388000011444091, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.006712535660345695, | |
| "grad_norm": 3.52144124715383, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7715152740478516, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.006922302399731499, | |
| "grad_norm": 2.1760255438109892, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7474425315856934, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.0071320691391173014, | |
| "grad_norm": 1.8391052662069023, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7086240291595459, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.007341835878503104, | |
| "grad_norm": 9.85499125185226, | |
| "learning_rate": 2e-05, | |
| "loss": 0.736334228515625, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.007551602617888908, | |
| "grad_norm": 7.061981460856605, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7058637619018555, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.00776136935727471, | |
| "grad_norm": 2.399773463771947, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7035298824310303, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.007971136096660513, | |
| "grad_norm": 1.8715337008198967, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7319884300231934, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.008180902836046316, | |
| "grad_norm": 4.402380567892121, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6931228637695312, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.00839066957543212, | |
| "grad_norm": 1.997385308499001, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6841664791107178, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.008600436314817923, | |
| "grad_norm": 8.77520106541026, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6674545288085938, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.008810203054203726, | |
| "grad_norm": 227.00469733968774, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7310820579528808, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.009019969793589528, | |
| "grad_norm": 3.283083883742064, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7967383384704589, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.009229736532975331, | |
| "grad_norm": 12.336376030486466, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7576329231262207, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.009439503272361134, | |
| "grad_norm": 1.8242777860324726, | |
| "learning_rate": 2e-05, | |
| "loss": 0.706461238861084, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.009649270011746938, | |
| "grad_norm": 1.8090965567853239, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7032674312591553, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.009859036751132741, | |
| "grad_norm": 2.5475991670097953, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7029439449310303, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.010068803490518544, | |
| "grad_norm": 1.4692934900457209, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6630709648132325, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.010278570229904346, | |
| "grad_norm": 2.1331924790853534, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7047128677368164, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.010488336969290149, | |
| "grad_norm": 2.4224465959516164, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7062530517578125, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.010698103708675952, | |
| "grad_norm": 1.9672184607046945, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6654829978942871, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.010907870448061756, | |
| "grad_norm": 1.8632555104139144, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6872918128967285, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.011117637187447559, | |
| "grad_norm": 2.696765708839419, | |
| "learning_rate": 2e-05, | |
| "loss": 0.712721586227417, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.011327403926833362, | |
| "grad_norm": 3.3114397630142145, | |
| "learning_rate": 2e-05, | |
| "loss": 0.665414571762085, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.011537170666219164, | |
| "grad_norm": 1.7287592058057928, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7328654289245605, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.011746937405604967, | |
| "grad_norm": 1.7622716775547056, | |
| "learning_rate": 2e-05, | |
| "loss": 0.692367696762085, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.01195670414499077, | |
| "grad_norm": 2.3708233226098807, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6588814735412598, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.012166470884376572, | |
| "grad_norm": 4.863667938523831, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7014576911926269, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.012376237623762377, | |
| "grad_norm": 2.1632337576331073, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7060187816619873, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.01258600436314818, | |
| "grad_norm": 2.1446479504758584, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7127746105194092, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.012795771102533982, | |
| "grad_norm": 2.103648073321234, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7010409355163574, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.013005537841919785, | |
| "grad_norm": 2.300281953023738, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7145485877990723, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.013215304581305588, | |
| "grad_norm": 2.1745603402017855, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6661243438720703, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.01342507132069139, | |
| "grad_norm": 3.3911386633188085, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7290327072143554, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.013634838060077195, | |
| "grad_norm": 2.838234667045874, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7416918754577637, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.013844604799462997, | |
| "grad_norm": 2.6030763255310494, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6962085247039795, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.0140543715388488, | |
| "grad_norm": 3.9879154447494263, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7320832729339599, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.014264138278234603, | |
| "grad_norm": 5.147234411879652, | |
| "learning_rate": 2e-05, | |
| "loss": 0.690255880355835, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.014473905017620406, | |
| "grad_norm": 4.41792994494731, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7107495784759521, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.014683671757006208, | |
| "grad_norm": 4.0092748239949465, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7144205093383789, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.014893438496392013, | |
| "grad_norm": 3.663722199190995, | |
| "learning_rate": 2e-05, | |
| "loss": 0.678815221786499, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.015103205235777815, | |
| "grad_norm": 374.6324936776676, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7061020851135253, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.015312971975163618, | |
| "grad_norm": 2.830711027072347, | |
| "learning_rate": 2e-05, | |
| "loss": 0.716461181640625, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.01552273871454942, | |
| "grad_norm": 17.687806831387658, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6958938598632812, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.015732505453935224, | |
| "grad_norm": 67.22665881659304, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6571521759033203, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.015942272193321026, | |
| "grad_norm": 3.2787186518009888, | |
| "learning_rate": 2e-05, | |
| "loss": 0.737470006942749, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.01615203893270683, | |
| "grad_norm": 5.764665619355419, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6784905433654785, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.01636180567209263, | |
| "grad_norm": 2.8187442313274156, | |
| "learning_rate": 2e-05, | |
| "loss": 0.698319387435913, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.016571572411478434, | |
| "grad_norm": 11.052681670850987, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7136563301086426, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.01678133915086424, | |
| "grad_norm": 2.738088534726021, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7217898368835449, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.016991105890250043, | |
| "grad_norm": 22.99130603074463, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6949929237365723, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.017200872629635846, | |
| "grad_norm": 2.2673846343594293, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6527021408081055, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.01741063936902165, | |
| "grad_norm": 4.040669613703935, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6478307723999024, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.01762040610840745, | |
| "grad_norm": 1.7450269280537714, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7058829307556153, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.017830172847793254, | |
| "grad_norm": 1.3888768876108615, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6917304039001465, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.018039939587179057, | |
| "grad_norm": 2.497192781134032, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6497130393981934, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.01824970632656486, | |
| "grad_norm": 2.096909255558357, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6941553115844726, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.018459473065950662, | |
| "grad_norm": 1.7631454307114556, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7313367366790772, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.018669239805336465, | |
| "grad_norm": 1.2137215799580678, | |
| "learning_rate": 2e-05, | |
| "loss": 0.734074592590332, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.018879006544722268, | |
| "grad_norm": 8.527470156498259, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7139863967895508, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.01908877328410807, | |
| "grad_norm": 1.150419868331103, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7071406364440918, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.019298540023493876, | |
| "grad_norm": 2.4598251273735596, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7090801239013672, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.01950830676287968, | |
| "grad_norm": 2.0085089193495707, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6835993766784668, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.019718073502265482, | |
| "grad_norm": 3.0778601053919536, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7152371883392334, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.019927840241651285, | |
| "grad_norm": 6.504260026804486, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6743127346038819, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.020137606981037087, | |
| "grad_norm": 1.7969857643634526, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6778482437133789, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.02034737372042289, | |
| "grad_norm": 29.433979140864412, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6873385429382324, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.020557140459808693, | |
| "grad_norm": 2.035543156408046, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6699578762054443, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.020766907199194495, | |
| "grad_norm": 1.1357536583710182, | |
| "learning_rate": 2e-05, | |
| "loss": 0.695745849609375, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.020976673938580298, | |
| "grad_norm": 3.7046794359871447, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6789576530456543, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.0211864406779661, | |
| "grad_norm": 3.130957938855976, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6930006980895996, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.021396207417351903, | |
| "grad_norm": 11.276914781871405, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6952384948730469, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.021605974156737706, | |
| "grad_norm": 6.337861678743805, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6785932064056397, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.021815740896123512, | |
| "grad_norm": 4.784777304261159, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7035085678100585, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.022025507635509315, | |
| "grad_norm": 5.679658714316126, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6616763114929199, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.022235274374895118, | |
| "grad_norm": 3.478649303767567, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6685798645019532, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.02244504111428092, | |
| "grad_norm": 5.634898233949741, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7499291896820068, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.022654807853666723, | |
| "grad_norm": 5.773543600338411, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6558557033538819, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.022864574593052526, | |
| "grad_norm": 39.700232901357666, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6942555904388428, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.02307434133243833, | |
| "grad_norm": 6.2820558818505265, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6771759033203125, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.02328410807182413, | |
| "grad_norm": 2.9316401080763823, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6969615936279296, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.023493874811209934, | |
| "grad_norm": 2.8974904226392466, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6931879997253418, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.023703641550595737, | |
| "grad_norm": 4.189761025368283, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6718255043029785, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.02391340828998154, | |
| "grad_norm": 2.417352201543177, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7471983909606934, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.024123175029367342, | |
| "grad_norm": 2.839365825197699, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6793410301208496, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.024332941768753145, | |
| "grad_norm": 3.141367299942584, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7086249351501465, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.02454270850813895, | |
| "grad_norm": 2.060642183486379, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6504176139831543, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.024752475247524754, | |
| "grad_norm": 23.95719687060173, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6888862609863281, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.024962241986910556, | |
| "grad_norm": 5.209642741753617, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6663257598876953, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.02517200872629636, | |
| "grad_norm": 4.668122000612013, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6789710521697998, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.025381775465682162, | |
| "grad_norm": 2.21317699920472, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6676199913024903, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.025591542205067964, | |
| "grad_norm": 4.368293636030707, | |
| "learning_rate": 2e-05, | |
| "loss": 0.690043592453003, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.025801308944453767, | |
| "grad_norm": 3.8199119576336176, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7009891033172607, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.02601107568383957, | |
| "grad_norm": 2.3977516666695142, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6778505325317383, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.026220842423225373, | |
| "grad_norm": 12.32747378491102, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7028230190277099, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.026430609162611175, | |
| "grad_norm": 5.6463852018519844, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6816394329071045, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.026640375901996978, | |
| "grad_norm": 3.0036641576788443, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6653374671936035, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.02685014264138278, | |
| "grad_norm": 3.963136105803816, | |
| "learning_rate": 2e-05, | |
| "loss": 0.70212721824646, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.027059909380768587, | |
| "grad_norm": 2.3922579167108338, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6652139186859131, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.02726967612015439, | |
| "grad_norm": 1.430307897978201, | |
| "learning_rate": 2e-05, | |
| "loss": 0.649704122543335, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.027479442859540192, | |
| "grad_norm": 12.579409728745457, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7093433380126953, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.027689209598925995, | |
| "grad_norm": 1.8768014730990727, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6947019100189209, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.027898976338311798, | |
| "grad_norm": 4.087020619174566, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6580727577209473, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.0281087430776976, | |
| "grad_norm": 2.2104247401520505, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6761454582214356, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.028318509817083403, | |
| "grad_norm": 1.54359381136085, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7064968109130859, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.028528276556469206, | |
| "grad_norm": 9.445161276396444, | |
| "learning_rate": 2e-05, | |
| "loss": 0.669188404083252, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.02873804329585501, | |
| "grad_norm": 2.7373325593304836, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6705168724060059, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.02894781003524081, | |
| "grad_norm": 2.276476538972258, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7053794860839844, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.029157576774626614, | |
| "grad_norm": 9.277889149036925, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6553175926208497, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.029367343514012417, | |
| "grad_norm": 3.368267525079364, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6869246959686279, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.029577110253398223, | |
| "grad_norm": 3.2226378523733645, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6814833641052246, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.029786876992784025, | |
| "grad_norm": 1.930571790233891, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6552035331726074, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.029996643732169828, | |
| "grad_norm": 3.5201808130997003, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6717945098876953, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.03020641047155563, | |
| "grad_norm": 660.3628631506493, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6539801597595215, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.030416177210941434, | |
| "grad_norm": 5.251919957664849, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6830947875976563, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.030625943950327236, | |
| "grad_norm": 5.249421083313879, | |
| "learning_rate": 2e-05, | |
| "loss": 0.681186580657959, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.03083571068971304, | |
| "grad_norm": 2.0509657202306752, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6720983028411865, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.03104547742909884, | |
| "grad_norm": 2.2734683613081064, | |
| "learning_rate": 2e-05, | |
| "loss": 0.67911696434021, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.031255244168484644, | |
| "grad_norm": 1.4795523059161764, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6568414211273194, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.03146501090787045, | |
| "grad_norm": 1.2453772205405704, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6762202262878418, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.03167477764725625, | |
| "grad_norm": 2.0010667543841123, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6813722133636475, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 0.03188454438664205, | |
| "grad_norm": 39.56264214911426, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7298669815063477, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 0.032094311126027855, | |
| "grad_norm": 1.9507720129351338, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6247622489929199, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 0.03230407786541366, | |
| "grad_norm": 1.484907363192865, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6759968757629394, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 0.03251384460479946, | |
| "grad_norm": 1.9147431404888071, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6800020217895508, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.03272361134418526, | |
| "grad_norm": 3.5428313404092, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6901631355285645, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 0.032933378083571066, | |
| "grad_norm": 4.7250773473958105, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6709762573242187, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 0.03314314482295687, | |
| "grad_norm": 5.898810367933252, | |
| "learning_rate": 2e-05, | |
| "loss": 0.66232271194458, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 0.03335291156234268, | |
| "grad_norm": 1.9369336440014253, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7334044933319092, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 0.03356267830172848, | |
| "grad_norm": 8.737915524161552, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6792474269866944, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.033772445041114284, | |
| "grad_norm": 1.9836799556383249, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7033929824829102, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 0.033982211780500086, | |
| "grad_norm": 1.1854978830042706, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6635163307189942, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 0.03419197851988589, | |
| "grad_norm": 1.2197328294566572, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6634726524353027, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 0.03440174525927169, | |
| "grad_norm": 1.4709834426885486, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6794222831726074, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 0.034611511998657495, | |
| "grad_norm": 1.5366826867181045, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6605133056640625, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.0348212787380433, | |
| "grad_norm": 2.9147800494231335, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6418501853942871, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 0.0350310454774291, | |
| "grad_norm": 1.202686476162776, | |
| "learning_rate": 2e-05, | |
| "loss": 0.633223295211792, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 0.0352408122168149, | |
| "grad_norm": 0.9631875057504979, | |
| "learning_rate": 2e-05, | |
| "loss": 0.666954517364502, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 0.035450578956200705, | |
| "grad_norm": 1.4192365422706907, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6560389518737793, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 0.03566034569558651, | |
| "grad_norm": 1.1713801817552898, | |
| "learning_rate": 2e-05, | |
| "loss": 0.641888427734375, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.03587011243497231, | |
| "grad_norm": 1.4022563568499706, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7102468013763428, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 0.036079879174358113, | |
| "grad_norm": 2.0986091486389826, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6136519908905029, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 0.036289645913743916, | |
| "grad_norm": 1.1634525834102774, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6924193382263184, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 0.03649941265312972, | |
| "grad_norm": 2.081748039936143, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6236453533172608, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 0.03670917939251552, | |
| "grad_norm": 2.484079612019191, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6446088314056396, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.036918946131901324, | |
| "grad_norm": 2.142979943466157, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6566426753997803, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 0.03712871287128713, | |
| "grad_norm": 2.727971395956995, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6372243404388428, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 0.03733847961067293, | |
| "grad_norm": 74.34931845644519, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6198902130126953, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 0.03754824635005873, | |
| "grad_norm": 2.066092794611252, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6555921554565429, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 0.037758013089444535, | |
| "grad_norm": 3.0945696621385244, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6903239250183105, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.03796777982883034, | |
| "grad_norm": 2.0553070965106786, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6789304733276367, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 0.03817754656821614, | |
| "grad_norm": 1.9236355838089434, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6835772514343261, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 0.03838731330760194, | |
| "grad_norm": 1.1647199736335656, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6774552822113037, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 0.03859708004698775, | |
| "grad_norm": 5.471968133112629, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6373446464538575, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 0.038806846786373556, | |
| "grad_norm": 1.4710591021325636, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6392849922180176, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.03901661352575936, | |
| "grad_norm": 2.6999041311336756, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6585689067840577, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 0.03922638026514516, | |
| "grad_norm": 1.1333104342309857, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6750880241394043, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 0.039436147004530964, | |
| "grad_norm": 1.8072514966793143, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6438388824462891, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 0.039645913743916766, | |
| "grad_norm": 1.0781542511331554, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6553819179534912, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 0.03985568048330257, | |
| "grad_norm": 3.0719828705316616, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6419807434082031, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.04006544722268837, | |
| "grad_norm": 1.5436345848872006, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6960256099700928, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 0.040275213962074174, | |
| "grad_norm": 1.0011408997937439, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6509086608886718, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 0.04048498070145998, | |
| "grad_norm": 1.294803313028635, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6446637153625489, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 0.04069474744084578, | |
| "grad_norm": 1.4561867936361599, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6471066474914551, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 0.04090451418023158, | |
| "grad_norm": 1.420758879294619, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6668454647064209, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.041114280919617385, | |
| "grad_norm": 1.339731233422897, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6452267646789551, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 0.04132404765900319, | |
| "grad_norm": 3.1201962896167976, | |
| "learning_rate": 2e-05, | |
| "loss": 0.643893814086914, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 0.04153381439838899, | |
| "grad_norm": 1.724067302763631, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6555222988128662, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 0.04174358113777479, | |
| "grad_norm": 2.166362359535913, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6665771484375, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 0.041953347877160596, | |
| "grad_norm": 2.744806451285816, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6609567165374756, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.0421631146165464, | |
| "grad_norm": 1.1718498443702758, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6552879333496093, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 0.0423728813559322, | |
| "grad_norm": 20.838352988266458, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6685161590576172, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 0.042582648095318004, | |
| "grad_norm": 1.0046844547391474, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6807273864746094, | |
| "step": 2030 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 5935, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 2035, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 963613493821440.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |