Download 200M/trainer_state.json from SynthCode-Project/rv2-gemma12b-g2_1_oldcode_cm_newcode: direct link, hf CLI and curl.
- Browser
- Download file 35.7 kB
-
https://huggingface.co/SynthCode-Project/rv2-gemma12b-g2_1_oldcode_cm_newcode/resolve/main/200M/trainer_state.json
- Command line
-
hf download hf://SynthCode-Project/rv2-gemma12b-g2_1_oldcode_cm_newcode/200M/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/SynthCode-Project/rv2-gemma12b-g2_1_oldcode_cm_newcode/resolve/main/200M/trainer_state.json
35.7 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.03970499287846565, | |
| "eval_steps": 500, | |
| "global_step": 2035, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0001951105301153103, | |
| "grad_norm": 1290.1151800966732, | |
| "learning_rate": 2.910112359550562e-06, | |
| "loss": 1.6666240692138672, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.0003902210602306206, | |
| "grad_norm": 2094.709006858091, | |
| "learning_rate": 3.921348314606742e-06, | |
| "loss": 0.9677549362182617, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.000585331590345931, | |
| "grad_norm": 30.714148238594614, | |
| "learning_rate": 4.932584269662922e-06, | |
| "loss": 0.7858523368835449, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.0007804421204612412, | |
| "grad_norm": 497.9186820845375, | |
| "learning_rate": 5.943820224719102e-06, | |
| "loss": 0.7518716812133789, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.0009755526505765516, | |
| "grad_norm": 40.68707475383215, | |
| "learning_rate": 6.955056179775282e-06, | |
| "loss": 0.7165522575378418, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.001170663180691862, | |
| "grad_norm": 49.16345817267902, | |
| "learning_rate": 7.966292134831462e-06, | |
| "loss": 0.6980477333068847, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.0013657737108071723, | |
| "grad_norm": 110.36540709084935, | |
| "learning_rate": 8.977528089887641e-06, | |
| "loss": 0.6940877437591553, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.0015608842409224825, | |
| "grad_norm": 45.22696804420163, | |
| "learning_rate": 9.988764044943822e-06, | |
| "loss": 0.7629052639007569, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.001755994771037793, | |
| "grad_norm": 8.589551842197837, | |
| "learning_rate": 1.1000000000000001e-05, | |
| "loss": 0.7278446197509766, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.0019511053011531032, | |
| "grad_norm": 22.256653345446292, | |
| "learning_rate": 1.2011235955056182e-05, | |
| "loss": 0.7335631370544433, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.0021462158312684134, | |
| "grad_norm": 37.8295200972987, | |
| "learning_rate": 1.3022471910112362e-05, | |
| "loss": 0.7461274623870849, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.002341326361383724, | |
| "grad_norm": 15.77833948739335, | |
| "learning_rate": 1.403370786516854e-05, | |
| "loss": 0.7302251338958741, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.0025364368914990343, | |
| "grad_norm": 662.5019348463974, | |
| "learning_rate": 1.504494382022472e-05, | |
| "loss": 0.7099417686462403, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.0027315474216143445, | |
| "grad_norm": 8.07873176220526, | |
| "learning_rate": 1.60561797752809e-05, | |
| "loss": 0.8300569534301758, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.0029266579517296548, | |
| "grad_norm": 108.63732872651582, | |
| "learning_rate": 1.706741573033708e-05, | |
| "loss": 0.7591472148895264, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.003121768481844965, | |
| "grad_norm": 12.742460468210709, | |
| "learning_rate": 1.8078651685393256e-05, | |
| "loss": 0.7846505641937256, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.0033168790119602757, | |
| "grad_norm": 19.46685500550541, | |
| "learning_rate": 1.908988764044944e-05, | |
| "loss": 0.7010777473449707, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.003511989542075586, | |
| "grad_norm": 3.79492579495788, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7221960067749024, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.003707100072190896, | |
| "grad_norm": 3.761910629826001, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7448129653930664, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.0039022106023062064, | |
| "grad_norm": 4.471289857736554, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7120450496673584, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.004097321132421517, | |
| "grad_norm": 7.832558161000839, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7076560974121093, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.004292431662536827, | |
| "grad_norm": 24.625069340034873, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7173271179199219, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.004487542192652137, | |
| "grad_norm": 10.643240144364263, | |
| "learning_rate": 2e-05, | |
| "loss": 0.8566647529602051, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.004682652722767448, | |
| "grad_norm": 17.191035538928677, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7157638549804688, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.004877763252882758, | |
| "grad_norm": 13.627404303033932, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7801154136657715, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.005072873782998069, | |
| "grad_norm": 24.99914666002505, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7654953002929688, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.005267984313113379, | |
| "grad_norm": 147.25366832545367, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7404791831970214, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.005463094843228689, | |
| "grad_norm": 6.625240044249601, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7907636165618896, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.005658205373343999, | |
| "grad_norm": 11.741773313405414, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7048698425292969, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.0058533159034593095, | |
| "grad_norm": 5.519224801929464, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7155918121337891, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.00604842643357462, | |
| "grad_norm": 11.598372302819296, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7381957054138184, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.00624353696368993, | |
| "grad_norm": 9.444939061369409, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7207625865936279, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.006438647493805241, | |
| "grad_norm": 7.801173531822594, | |
| "learning_rate": 2e-05, | |
| "loss": 0.723687744140625, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.006633758023920551, | |
| "grad_norm": 1.9811128361432186, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7044608116149902, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.0068288685540358616, | |
| "grad_norm": 5.818968297777697, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7668921947479248, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.007023979084151172, | |
| "grad_norm": 3.944741659070438, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7118455410003662, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.007219089614266482, | |
| "grad_norm": 4.311433759305494, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7700147151947021, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.007414200144381792, | |
| "grad_norm": 30.425032251061474, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7222751140594482, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.0076093106744971025, | |
| "grad_norm": 2.782539467868993, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6802415370941162, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.007804421204612413, | |
| "grad_norm": 6.499874836624361, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6992295742034912, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.007999531734727724, | |
| "grad_norm": 5.632464299732364, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7049863815307618, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.008194642264843033, | |
| "grad_norm": 11.183347233038614, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7416215419769288, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.008389752794958344, | |
| "grad_norm": 7.528401125738135, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7592568397521973, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.008584863325073654, | |
| "grad_norm": 5.002885634433326, | |
| "learning_rate": 2e-05, | |
| "loss": 0.756533145904541, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.008779973855188965, | |
| "grad_norm": 5.66603343994339, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7430764198303222, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.008975084385304274, | |
| "grad_norm": 22.314858498949487, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7967084884643555, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.009170194915419585, | |
| "grad_norm": 5.642840192700939, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7398099422454834, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.009365305445534896, | |
| "grad_norm": 2.0656284529162243, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7248655319213867, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.009560415975650206, | |
| "grad_norm": 4.657301334726203, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7701823711395264, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.009755526505765517, | |
| "grad_norm": 4.995971591382155, | |
| "learning_rate": 2e-05, | |
| "loss": 0.733971357345581, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.009950637035880826, | |
| "grad_norm": 11.657412731021536, | |
| "learning_rate": 2e-05, | |
| "loss": 0.802979564666748, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.010145747565996137, | |
| "grad_norm": 3.161728049215805, | |
| "learning_rate": 2e-05, | |
| "loss": 0.753895378112793, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.010340858096111447, | |
| "grad_norm": 24.0896519055277, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7964776992797852, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.010535968626226758, | |
| "grad_norm": 8.361986893202518, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7574877738952637, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.010731079156342067, | |
| "grad_norm": 10.53310762606766, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7854220867156982, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.010926189686457378, | |
| "grad_norm": 96.65480630904233, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7968769073486328, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.01112130021657269, | |
| "grad_norm": 1.8376056131220815, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7898524284362793, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.011316410746687999, | |
| "grad_norm": 1.446906475407358, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7536652565002442, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.01151152127680331, | |
| "grad_norm": 2.63100640718635, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7614954948425293, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.011706631806918619, | |
| "grad_norm": 1.7292424310123347, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6910699844360352, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.01190174233703393, | |
| "grad_norm": 1.6185308860071268, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7510101318359375, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.01209685286714924, | |
| "grad_norm": 9.938109528270555, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7183078765869141, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.01229196339726455, | |
| "grad_norm": 3.1451531777998762, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6925305843353271, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.01248707392737986, | |
| "grad_norm": 11.976814414360483, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6874044418334961, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.012682184457495171, | |
| "grad_norm": 2.512055129296439, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7078936576843262, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.012877294987610482, | |
| "grad_norm": 21.321440055444356, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7755936622619629, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.013072405517725792, | |
| "grad_norm": 6.027137898134079, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6783116817474365, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.013267516047841103, | |
| "grad_norm": 1.6349976601766352, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7179695129394531, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.013462626577956412, | |
| "grad_norm": 2.696759389003869, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6627010345458985, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.013657737108071723, | |
| "grad_norm": 3.094531262148124, | |
| "learning_rate": 2e-05, | |
| "loss": 0.691745662689209, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.013852847638187032, | |
| "grad_norm": 1.3167065811312815, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6898958206176757, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.014047958168302344, | |
| "grad_norm": 3.096688041091074, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6983632564544677, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.014243068698417653, | |
| "grad_norm": 1.5732201392921932, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6881768703460693, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.014438179228532964, | |
| "grad_norm": 4.179444784177794, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6782029628753662, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.014633289758648273, | |
| "grad_norm": 13.022740345020917, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7157995223999023, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.014828400288763584, | |
| "grad_norm": 2.227508854051503, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7245219230651856, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.015023510818878896, | |
| "grad_norm": 3.4074041057703774, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7473674297332764, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.015218621348994205, | |
| "grad_norm": 4.053610258594328, | |
| "learning_rate": 2e-05, | |
| "loss": 0.664447021484375, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.015413731879109516, | |
| "grad_norm": 1.6609484317874577, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6886637687683106, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.015608842409224825, | |
| "grad_norm": 1.5444399305626002, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7088738918304444, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.015803952939340137, | |
| "grad_norm": 3.1762223604517237, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7194277763366699, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.015999063469455448, | |
| "grad_norm": 3.8350609994341527, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7160842895507813, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.016194173999570755, | |
| "grad_norm": 2.315457264069663, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6816580772399903, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.016389284529686066, | |
| "grad_norm": 3.1340139053276896, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6640499114990235, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.016584395059801377, | |
| "grad_norm": 2.103288119861107, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6783723354339599, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.01677950558991669, | |
| "grad_norm": 3.7306310450926383, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6990603446960449, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.016974616120032, | |
| "grad_norm": 2.3246559374347955, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6684437751770019, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.017169726650147307, | |
| "grad_norm": 2.4616580742100016, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6759738922119141, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.01736483718026262, | |
| "grad_norm": 1.4211835502848627, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7110819816589355, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.01755994771037793, | |
| "grad_norm": 3.113362922049139, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7206232070922851, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.01775505824049324, | |
| "grad_norm": 1.5202175869081638, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6578310012817383, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.017950168770608548, | |
| "grad_norm": 1.610151123997545, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7033986568450927, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.01814527930072386, | |
| "grad_norm": 2.213950402852014, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7181561946868896, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.01834038983083917, | |
| "grad_norm": 1.0525256653678736, | |
| "learning_rate": 2e-05, | |
| "loss": 0.64858980178833, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.01853550036095448, | |
| "grad_norm": 1.1535760888310356, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6768205642700196, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.018730610891069793, | |
| "grad_norm": 2.5687267328441172, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7187290191650391, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.0189257214211851, | |
| "grad_norm": 2.363644647745971, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6914881706237793, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.01912083195130041, | |
| "grad_norm": 1.6586735289269663, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7053565979003906, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.019315942481415722, | |
| "grad_norm": 1.3154384327675313, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6894444942474365, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.019511053011531033, | |
| "grad_norm": 1.4829582302075024, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6964797019958496, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.01970616354164634, | |
| "grad_norm": 11.246853734884391, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6903947830200196, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.019901274071761652, | |
| "grad_norm": 2.130270630304158, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7131201744079589, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.020096384601876963, | |
| "grad_norm": 2.3843191059461684, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7245532989501953, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.020291495131992274, | |
| "grad_norm": 1.8036658748418921, | |
| "learning_rate": 2e-05, | |
| "loss": 0.688844633102417, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.020486605662107586, | |
| "grad_norm": 4.142854989409903, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6744081020355225, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.020681716192222893, | |
| "grad_norm": 1.472431946736185, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6328347682952881, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.020876826722338204, | |
| "grad_norm": 2.390747409072109, | |
| "learning_rate": 2e-05, | |
| "loss": 0.688608455657959, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.021071937252453515, | |
| "grad_norm": 2.538662996092993, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7029477119445801, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.021267047782568826, | |
| "grad_norm": 2.4656407868003436, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6541564464569092, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.021462158312684134, | |
| "grad_norm": 1.4483652415733586, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6665634155273438, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.021657268842799445, | |
| "grad_norm": 3.7600001493285813, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6685405731201172, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.021852379372914756, | |
| "grad_norm": 4.4698831654409785, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6686572074890137, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.022047489903030067, | |
| "grad_norm": 1.2416499167615647, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6792525291442871, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.02224260043314538, | |
| "grad_norm": 1.261439766703017, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6553254127502441, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.022437710963260686, | |
| "grad_norm": 3.0580767819341967, | |
| "learning_rate": 2e-05, | |
| "loss": 0.670100736618042, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.022632821493375997, | |
| "grad_norm": 1.9982728200546733, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6652833461761475, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.02282793202349131, | |
| "grad_norm": 1.4478470019999148, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6802016258239746, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.02302304255360662, | |
| "grad_norm": 1.390262972826178, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6520106792449951, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.023218153083721927, | |
| "grad_norm": 1.2517531765951326, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6596714973449707, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.023413263613837238, | |
| "grad_norm": 1.66285797208597, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6890499114990234, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.02360837414395255, | |
| "grad_norm": 1.4023367573944592, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6909699440002441, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.02380348467406786, | |
| "grad_norm": 2.103600383565939, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6514087677001953, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.02399859520418317, | |
| "grad_norm": 1.3538205014153204, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7010597229003906, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.02419370573429848, | |
| "grad_norm": 1.131100957434826, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6904762268066407, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.02438881626441379, | |
| "grad_norm": 0.8521222417760329, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6021539688110351, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.0245839267945291, | |
| "grad_norm": 0.9985116086981741, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6618970394134521, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.024779037324644412, | |
| "grad_norm": 1.0359703256994235, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6823967933654785, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.02497414785475972, | |
| "grad_norm": 1.2887090486112476, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6628634452819824, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.02516925838487503, | |
| "grad_norm": 3.432834498196539, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7419169425964356, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.025364368914990342, | |
| "grad_norm": 23.557815006813602, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7083474636077881, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.025559479445105653, | |
| "grad_norm": 1.3779699418257583, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6835464477539063, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.025754589975220964, | |
| "grad_norm": 1.0971280641281729, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6729559898376465, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.025949700505336272, | |
| "grad_norm": 86.50430124250552, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7425766944885254, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.026144811035451583, | |
| "grad_norm": 1.9060666983098362, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6884101867675781, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.026339921565566894, | |
| "grad_norm": 4.952310768605313, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6712810516357421, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.026535032095682205, | |
| "grad_norm": 2.1836902499589055, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6641899108886719, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.026730142625797513, | |
| "grad_norm": 0.9745030121353373, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6548121929168701, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.026925253155912824, | |
| "grad_norm": 1.0085691573367601, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6872680187225342, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.027120363686028135, | |
| "grad_norm": 1.0328562743257255, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6593247413635254, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.027315474216143446, | |
| "grad_norm": 1.7706110276938303, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6563483715057373, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.027510584746258757, | |
| "grad_norm": 1.1475044260212954, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6485116004943847, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.027705695276374065, | |
| "grad_norm": 2.1343320521467724, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6518092155456543, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.027900805806489376, | |
| "grad_norm": 19.40190752512825, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6708407402038574, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.028095916336604687, | |
| "grad_norm": 1.0429828458514099, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6531154632568359, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.028291026866719998, | |
| "grad_norm": 3.854687583398717, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6318797588348388, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.028486137396835306, | |
| "grad_norm": 1.2803239369157802, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6483430385589599, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.028681247926950617, | |
| "grad_norm": 1.7844005133176821, | |
| "learning_rate": 2e-05, | |
| "loss": 0.670600414276123, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.028876358457065928, | |
| "grad_norm": 2.638360353786163, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6612592220306397, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.02907146898718124, | |
| "grad_norm": 1.2239072376785438, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6572507381439209, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.029266579517296547, | |
| "grad_norm": 3.9817061848469457, | |
| "learning_rate": 2e-05, | |
| "loss": 0.631273603439331, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.029461690047411858, | |
| "grad_norm": 1.2083656296744134, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6754149913787841, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 0.02965680057752717, | |
| "grad_norm": 1.6701538309486328, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6359077453613281, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 0.02985191110764248, | |
| "grad_norm": 1.1088864730268388, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6407184600830078, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 0.03004702163775779, | |
| "grad_norm": 2.855041461691364, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6601726531982421, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 0.0302421321678731, | |
| "grad_norm": 1.041676019536129, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6693766593933106, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.03043724269798841, | |
| "grad_norm": 1.7903036215917778, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6842814445495605, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 0.03063235322810372, | |
| "grad_norm": 1.2275140901739492, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6563383102416992, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 0.030827463758219032, | |
| "grad_norm": 1.4416525013205308, | |
| "learning_rate": 2e-05, | |
| "loss": 0.70062255859375, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 0.03102257428833434, | |
| "grad_norm": 1.022694275409909, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6751978874206543, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 0.03121768481844965, | |
| "grad_norm": 1.5434339515015798, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6534595489501953, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.03141279534856496, | |
| "grad_norm": 4.482223058250825, | |
| "learning_rate": 2e-05, | |
| "loss": 0.679110336303711, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 0.03160790587868027, | |
| "grad_norm": 1.269130777338052, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6603041648864746, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 0.031803016408795584, | |
| "grad_norm": 3.5729377498646477, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6539816856384277, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 0.031998126938910895, | |
| "grad_norm": 2.6023274014566247, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7010405540466309, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 0.032193237469026206, | |
| "grad_norm": 9.210714854982013, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6686701774597168, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.03238834799914151, | |
| "grad_norm": 5.165666638947227, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6095908164978028, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 0.03258345852925682, | |
| "grad_norm": 9.16141664239496, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7108460903167725, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 0.03277856905937213, | |
| "grad_norm": 3.161658879203255, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6284823417663574, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 0.032973679589487444, | |
| "grad_norm": 5.944141446716445, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6405398845672607, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 0.033168790119602755, | |
| "grad_norm": 1.7808423949894736, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6491862297058105, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.033363900649718066, | |
| "grad_norm": 1.726175898675113, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6724005699157715, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 0.03355901117983338, | |
| "grad_norm": 2.376245899157911, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6525126934051514, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 0.03375412170994869, | |
| "grad_norm": 1.6653879954838984, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6367118835449219, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 0.033949232240064, | |
| "grad_norm": 1.3883560501158865, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6553079128265381, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 0.0341443427701793, | |
| "grad_norm": 11.844497956339469, | |
| "learning_rate": 2e-05, | |
| "loss": 0.5972353935241699, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.034339453300294615, | |
| "grad_norm": 1.5888196717274026, | |
| "learning_rate": 2e-05, | |
| "loss": 0.658538818359375, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 0.034534563830409926, | |
| "grad_norm": 1.2587083645893846, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6199719905853271, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 0.03472967436052524, | |
| "grad_norm": 2.0204514597287266, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6569772243499756, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 0.03492478489064055, | |
| "grad_norm": 1.1323396524728921, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6597754478454589, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 0.03511989542075586, | |
| "grad_norm": 4.803084432276915, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6832777976989746, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.03531500595087117, | |
| "grad_norm": 1.2706249626426194, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6612133026123047, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 0.03551011648098648, | |
| "grad_norm": 2.888385667334179, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6800965785980224, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 0.03570522701110179, | |
| "grad_norm": 1.7994196905308342, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6731705665588379, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 0.035900337541217096, | |
| "grad_norm": 2.2229464990180463, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6999088287353515, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 0.03609544807133241, | |
| "grad_norm": 1.7473284581429838, | |
| "learning_rate": 2e-05, | |
| "loss": 0.665509557723999, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.03629055860144772, | |
| "grad_norm": 2.2975536238797036, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6647231101989746, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 0.03648566913156303, | |
| "grad_norm": 2.6214877289682246, | |
| "learning_rate": 2e-05, | |
| "loss": 0.62739577293396, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 0.03668077966167834, | |
| "grad_norm": 2.192373938003488, | |
| "learning_rate": 2e-05, | |
| "loss": 0.7087226390838623, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 0.03687589019179365, | |
| "grad_norm": 6.62847066861488, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6841737270355225, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 0.03707100072190896, | |
| "grad_norm": 8.573387218725129, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6550696849822998, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.037266111252024274, | |
| "grad_norm": 21.81644893450406, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6534019470214844, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 0.037461221782139585, | |
| "grad_norm": 1.972315212149555, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6699990272521973, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 0.03765633231225489, | |
| "grad_norm": 1.572875023378223, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6702420234680175, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 0.0378514428423702, | |
| "grad_norm": 1.2077505710786207, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6410272121429443, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 0.03804655337248551, | |
| "grad_norm": 1.3936237416130755, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6933211803436279, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.03824166390260082, | |
| "grad_norm": 2.6969645830470323, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6899444580078125, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 0.038436774432716134, | |
| "grad_norm": 3.6883874679320745, | |
| "learning_rate": 2e-05, | |
| "loss": 0.661356258392334, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 0.038631884962831445, | |
| "grad_norm": 4.1375939813313325, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6723477840423584, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 0.038826995492946756, | |
| "grad_norm": 8.712693611376435, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6563708305358886, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 0.03902210602306207, | |
| "grad_norm": 1.7546049733134041, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6711672782897949, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.03921721655317738, | |
| "grad_norm": 1.7813893766887805, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6956442832946778, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 0.03941232708329268, | |
| "grad_norm": 1.2906449372308841, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6290652275085449, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 0.03960743761340799, | |
| "grad_norm": 1.1252587686982205, | |
| "learning_rate": 2e-05, | |
| "loss": 0.6268731117248535, | |
| "step": 2030 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 5935, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 2035, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 963613493821440.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |