rqadri's picture
Upload folder using huggingface_hub
894e45e verified
Raw History Blame Contribute Delete
35.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.03970499287846565,
"eval_steps": 500,
"global_step": 2035,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0001951105301153103,
"grad_norm": 1290.1151800966732,
"learning_rate": 2.910112359550562e-06,
"loss": 1.6666240692138672,
"step": 10
},
{
"epoch": 0.0003902210602306206,
"grad_norm": 2094.709006858091,
"learning_rate": 3.921348314606742e-06,
"loss": 0.9677549362182617,
"step": 20
},
{
"epoch": 0.000585331590345931,
"grad_norm": 30.714148238594614,
"learning_rate": 4.932584269662922e-06,
"loss": 0.7858523368835449,
"step": 30
},
{
"epoch": 0.0007804421204612412,
"grad_norm": 497.9186820845375,
"learning_rate": 5.943820224719102e-06,
"loss": 0.7518716812133789,
"step": 40
},
{
"epoch": 0.0009755526505765516,
"grad_norm": 40.68707475383215,
"learning_rate": 6.955056179775282e-06,
"loss": 0.7165522575378418,
"step": 50
},
{
"epoch": 0.001170663180691862,
"grad_norm": 49.16345817267902,
"learning_rate": 7.966292134831462e-06,
"loss": 0.6980477333068847,
"step": 60
},
{
"epoch": 0.0013657737108071723,
"grad_norm": 110.36540709084935,
"learning_rate": 8.977528089887641e-06,
"loss": 0.6940877437591553,
"step": 70
},
{
"epoch": 0.0015608842409224825,
"grad_norm": 45.22696804420163,
"learning_rate": 9.988764044943822e-06,
"loss": 0.7629052639007569,
"step": 80
},
{
"epoch": 0.001755994771037793,
"grad_norm": 8.589551842197837,
"learning_rate": 1.1000000000000001e-05,
"loss": 0.7278446197509766,
"step": 90
},
{
"epoch": 0.0019511053011531032,
"grad_norm": 22.256653345446292,
"learning_rate": 1.2011235955056182e-05,
"loss": 0.7335631370544433,
"step": 100
},
{
"epoch": 0.0021462158312684134,
"grad_norm": 37.8295200972987,
"learning_rate": 1.3022471910112362e-05,
"loss": 0.7461274623870849,
"step": 110
},
{
"epoch": 0.002341326361383724,
"grad_norm": 15.77833948739335,
"learning_rate": 1.403370786516854e-05,
"loss": 0.7302251338958741,
"step": 120
},
{
"epoch": 0.0025364368914990343,
"grad_norm": 662.5019348463974,
"learning_rate": 1.504494382022472e-05,
"loss": 0.7099417686462403,
"step": 130
},
{
"epoch": 0.0027315474216143445,
"grad_norm": 8.07873176220526,
"learning_rate": 1.60561797752809e-05,
"loss": 0.8300569534301758,
"step": 140
},
{
"epoch": 0.0029266579517296548,
"grad_norm": 108.63732872651582,
"learning_rate": 1.706741573033708e-05,
"loss": 0.7591472148895264,
"step": 150
},
{
"epoch": 0.003121768481844965,
"grad_norm": 12.742460468210709,
"learning_rate": 1.8078651685393256e-05,
"loss": 0.7846505641937256,
"step": 160
},
{
"epoch": 0.0033168790119602757,
"grad_norm": 19.46685500550541,
"learning_rate": 1.908988764044944e-05,
"loss": 0.7010777473449707,
"step": 170
},
{
"epoch": 0.003511989542075586,
"grad_norm": 3.79492579495788,
"learning_rate": 2e-05,
"loss": 0.7221960067749024,
"step": 180
},
{
"epoch": 0.003707100072190896,
"grad_norm": 3.761910629826001,
"learning_rate": 2e-05,
"loss": 0.7448129653930664,
"step": 190
},
{
"epoch": 0.0039022106023062064,
"grad_norm": 4.471289857736554,
"learning_rate": 2e-05,
"loss": 0.7120450496673584,
"step": 200
},
{
"epoch": 0.004097321132421517,
"grad_norm": 7.832558161000839,
"learning_rate": 2e-05,
"loss": 0.7076560974121093,
"step": 210
},
{
"epoch": 0.004292431662536827,
"grad_norm": 24.625069340034873,
"learning_rate": 2e-05,
"loss": 0.7173271179199219,
"step": 220
},
{
"epoch": 0.004487542192652137,
"grad_norm": 10.643240144364263,
"learning_rate": 2e-05,
"loss": 0.8566647529602051,
"step": 230
},
{
"epoch": 0.004682652722767448,
"grad_norm": 17.191035538928677,
"learning_rate": 2e-05,
"loss": 0.7157638549804688,
"step": 240
},
{
"epoch": 0.004877763252882758,
"grad_norm": 13.627404303033932,
"learning_rate": 2e-05,
"loss": 0.7801154136657715,
"step": 250
},
{
"epoch": 0.005072873782998069,
"grad_norm": 24.99914666002505,
"learning_rate": 2e-05,
"loss": 0.7654953002929688,
"step": 260
},
{
"epoch": 0.005267984313113379,
"grad_norm": 147.25366832545367,
"learning_rate": 2e-05,
"loss": 0.7404791831970214,
"step": 270
},
{
"epoch": 0.005463094843228689,
"grad_norm": 6.625240044249601,
"learning_rate": 2e-05,
"loss": 0.7907636165618896,
"step": 280
},
{
"epoch": 0.005658205373343999,
"grad_norm": 11.741773313405414,
"learning_rate": 2e-05,
"loss": 0.7048698425292969,
"step": 290
},
{
"epoch": 0.0058533159034593095,
"grad_norm": 5.519224801929464,
"learning_rate": 2e-05,
"loss": 0.7155918121337891,
"step": 300
},
{
"epoch": 0.00604842643357462,
"grad_norm": 11.598372302819296,
"learning_rate": 2e-05,
"loss": 0.7381957054138184,
"step": 310
},
{
"epoch": 0.00624353696368993,
"grad_norm": 9.444939061369409,
"learning_rate": 2e-05,
"loss": 0.7207625865936279,
"step": 320
},
{
"epoch": 0.006438647493805241,
"grad_norm": 7.801173531822594,
"learning_rate": 2e-05,
"loss": 0.723687744140625,
"step": 330
},
{
"epoch": 0.006633758023920551,
"grad_norm": 1.9811128361432186,
"learning_rate": 2e-05,
"loss": 0.7044608116149902,
"step": 340
},
{
"epoch": 0.0068288685540358616,
"grad_norm": 5.818968297777697,
"learning_rate": 2e-05,
"loss": 0.7668921947479248,
"step": 350
},
{
"epoch": 0.007023979084151172,
"grad_norm": 3.944741659070438,
"learning_rate": 2e-05,
"loss": 0.7118455410003662,
"step": 360
},
{
"epoch": 0.007219089614266482,
"grad_norm": 4.311433759305494,
"learning_rate": 2e-05,
"loss": 0.7700147151947021,
"step": 370
},
{
"epoch": 0.007414200144381792,
"grad_norm": 30.425032251061474,
"learning_rate": 2e-05,
"loss": 0.7222751140594482,
"step": 380
},
{
"epoch": 0.0076093106744971025,
"grad_norm": 2.782539467868993,
"learning_rate": 2e-05,
"loss": 0.6802415370941162,
"step": 390
},
{
"epoch": 0.007804421204612413,
"grad_norm": 6.499874836624361,
"learning_rate": 2e-05,
"loss": 0.6992295742034912,
"step": 400
},
{
"epoch": 0.007999531734727724,
"grad_norm": 5.632464299732364,
"learning_rate": 2e-05,
"loss": 0.7049863815307618,
"step": 410
},
{
"epoch": 0.008194642264843033,
"grad_norm": 11.183347233038614,
"learning_rate": 2e-05,
"loss": 0.7416215419769288,
"step": 420
},
{
"epoch": 0.008389752794958344,
"grad_norm": 7.528401125738135,
"learning_rate": 2e-05,
"loss": 0.7592568397521973,
"step": 430
},
{
"epoch": 0.008584863325073654,
"grad_norm": 5.002885634433326,
"learning_rate": 2e-05,
"loss": 0.756533145904541,
"step": 440
},
{
"epoch": 0.008779973855188965,
"grad_norm": 5.66603343994339,
"learning_rate": 2e-05,
"loss": 0.7430764198303222,
"step": 450
},
{
"epoch": 0.008975084385304274,
"grad_norm": 22.314858498949487,
"learning_rate": 2e-05,
"loss": 0.7967084884643555,
"step": 460
},
{
"epoch": 0.009170194915419585,
"grad_norm": 5.642840192700939,
"learning_rate": 2e-05,
"loss": 0.7398099422454834,
"step": 470
},
{
"epoch": 0.009365305445534896,
"grad_norm": 2.0656284529162243,
"learning_rate": 2e-05,
"loss": 0.7248655319213867,
"step": 480
},
{
"epoch": 0.009560415975650206,
"grad_norm": 4.657301334726203,
"learning_rate": 2e-05,
"loss": 0.7701823711395264,
"step": 490
},
{
"epoch": 0.009755526505765517,
"grad_norm": 4.995971591382155,
"learning_rate": 2e-05,
"loss": 0.733971357345581,
"step": 500
},
{
"epoch": 0.009950637035880826,
"grad_norm": 11.657412731021536,
"learning_rate": 2e-05,
"loss": 0.802979564666748,
"step": 510
},
{
"epoch": 0.010145747565996137,
"grad_norm": 3.161728049215805,
"learning_rate": 2e-05,
"loss": 0.753895378112793,
"step": 520
},
{
"epoch": 0.010340858096111447,
"grad_norm": 24.0896519055277,
"learning_rate": 2e-05,
"loss": 0.7964776992797852,
"step": 530
},
{
"epoch": 0.010535968626226758,
"grad_norm": 8.361986893202518,
"learning_rate": 2e-05,
"loss": 0.7574877738952637,
"step": 540
},
{
"epoch": 0.010731079156342067,
"grad_norm": 10.53310762606766,
"learning_rate": 2e-05,
"loss": 0.7854220867156982,
"step": 550
},
{
"epoch": 0.010926189686457378,
"grad_norm": 96.65480630904233,
"learning_rate": 2e-05,
"loss": 0.7968769073486328,
"step": 560
},
{
"epoch": 0.01112130021657269,
"grad_norm": 1.8376056131220815,
"learning_rate": 2e-05,
"loss": 0.7898524284362793,
"step": 570
},
{
"epoch": 0.011316410746687999,
"grad_norm": 1.446906475407358,
"learning_rate": 2e-05,
"loss": 0.7536652565002442,
"step": 580
},
{
"epoch": 0.01151152127680331,
"grad_norm": 2.63100640718635,
"learning_rate": 2e-05,
"loss": 0.7614954948425293,
"step": 590
},
{
"epoch": 0.011706631806918619,
"grad_norm": 1.7292424310123347,
"learning_rate": 2e-05,
"loss": 0.6910699844360352,
"step": 600
},
{
"epoch": 0.01190174233703393,
"grad_norm": 1.6185308860071268,
"learning_rate": 2e-05,
"loss": 0.7510101318359375,
"step": 610
},
{
"epoch": 0.01209685286714924,
"grad_norm": 9.938109528270555,
"learning_rate": 2e-05,
"loss": 0.7183078765869141,
"step": 620
},
{
"epoch": 0.01229196339726455,
"grad_norm": 3.1451531777998762,
"learning_rate": 2e-05,
"loss": 0.6925305843353271,
"step": 630
},
{
"epoch": 0.01248707392737986,
"grad_norm": 11.976814414360483,
"learning_rate": 2e-05,
"loss": 0.6874044418334961,
"step": 640
},
{
"epoch": 0.012682184457495171,
"grad_norm": 2.512055129296439,
"learning_rate": 2e-05,
"loss": 0.7078936576843262,
"step": 650
},
{
"epoch": 0.012877294987610482,
"grad_norm": 21.321440055444356,
"learning_rate": 2e-05,
"loss": 0.7755936622619629,
"step": 660
},
{
"epoch": 0.013072405517725792,
"grad_norm": 6.027137898134079,
"learning_rate": 2e-05,
"loss": 0.6783116817474365,
"step": 670
},
{
"epoch": 0.013267516047841103,
"grad_norm": 1.6349976601766352,
"learning_rate": 2e-05,
"loss": 0.7179695129394531,
"step": 680
},
{
"epoch": 0.013462626577956412,
"grad_norm": 2.696759389003869,
"learning_rate": 2e-05,
"loss": 0.6627010345458985,
"step": 690
},
{
"epoch": 0.013657737108071723,
"grad_norm": 3.094531262148124,
"learning_rate": 2e-05,
"loss": 0.691745662689209,
"step": 700
},
{
"epoch": 0.013852847638187032,
"grad_norm": 1.3167065811312815,
"learning_rate": 2e-05,
"loss": 0.6898958206176757,
"step": 710
},
{
"epoch": 0.014047958168302344,
"grad_norm": 3.096688041091074,
"learning_rate": 2e-05,
"loss": 0.6983632564544677,
"step": 720
},
{
"epoch": 0.014243068698417653,
"grad_norm": 1.5732201392921932,
"learning_rate": 2e-05,
"loss": 0.6881768703460693,
"step": 730
},
{
"epoch": 0.014438179228532964,
"grad_norm": 4.179444784177794,
"learning_rate": 2e-05,
"loss": 0.6782029628753662,
"step": 740
},
{
"epoch": 0.014633289758648273,
"grad_norm": 13.022740345020917,
"learning_rate": 2e-05,
"loss": 0.7157995223999023,
"step": 750
},
{
"epoch": 0.014828400288763584,
"grad_norm": 2.227508854051503,
"learning_rate": 2e-05,
"loss": 0.7245219230651856,
"step": 760
},
{
"epoch": 0.015023510818878896,
"grad_norm": 3.4074041057703774,
"learning_rate": 2e-05,
"loss": 0.7473674297332764,
"step": 770
},
{
"epoch": 0.015218621348994205,
"grad_norm": 4.053610258594328,
"learning_rate": 2e-05,
"loss": 0.664447021484375,
"step": 780
},
{
"epoch": 0.015413731879109516,
"grad_norm": 1.6609484317874577,
"learning_rate": 2e-05,
"loss": 0.6886637687683106,
"step": 790
},
{
"epoch": 0.015608842409224825,
"grad_norm": 1.5444399305626002,
"learning_rate": 2e-05,
"loss": 0.7088738918304444,
"step": 800
},
{
"epoch": 0.015803952939340137,
"grad_norm": 3.1762223604517237,
"learning_rate": 2e-05,
"loss": 0.7194277763366699,
"step": 810
},
{
"epoch": 0.015999063469455448,
"grad_norm": 3.8350609994341527,
"learning_rate": 2e-05,
"loss": 0.7160842895507813,
"step": 820
},
{
"epoch": 0.016194173999570755,
"grad_norm": 2.315457264069663,
"learning_rate": 2e-05,
"loss": 0.6816580772399903,
"step": 830
},
{
"epoch": 0.016389284529686066,
"grad_norm": 3.1340139053276896,
"learning_rate": 2e-05,
"loss": 0.6640499114990235,
"step": 840
},
{
"epoch": 0.016584395059801377,
"grad_norm": 2.103288119861107,
"learning_rate": 2e-05,
"loss": 0.6783723354339599,
"step": 850
},
{
"epoch": 0.01677950558991669,
"grad_norm": 3.7306310450926383,
"learning_rate": 2e-05,
"loss": 0.6990603446960449,
"step": 860
},
{
"epoch": 0.016974616120032,
"grad_norm": 2.3246559374347955,
"learning_rate": 2e-05,
"loss": 0.6684437751770019,
"step": 870
},
{
"epoch": 0.017169726650147307,
"grad_norm": 2.4616580742100016,
"learning_rate": 2e-05,
"loss": 0.6759738922119141,
"step": 880
},
{
"epoch": 0.01736483718026262,
"grad_norm": 1.4211835502848627,
"learning_rate": 2e-05,
"loss": 0.7110819816589355,
"step": 890
},
{
"epoch": 0.01755994771037793,
"grad_norm": 3.113362922049139,
"learning_rate": 2e-05,
"loss": 0.7206232070922851,
"step": 900
},
{
"epoch": 0.01775505824049324,
"grad_norm": 1.5202175869081638,
"learning_rate": 2e-05,
"loss": 0.6578310012817383,
"step": 910
},
{
"epoch": 0.017950168770608548,
"grad_norm": 1.610151123997545,
"learning_rate": 2e-05,
"loss": 0.7033986568450927,
"step": 920
},
{
"epoch": 0.01814527930072386,
"grad_norm": 2.213950402852014,
"learning_rate": 2e-05,
"loss": 0.7181561946868896,
"step": 930
},
{
"epoch": 0.01834038983083917,
"grad_norm": 1.0525256653678736,
"learning_rate": 2e-05,
"loss": 0.64858980178833,
"step": 940
},
{
"epoch": 0.01853550036095448,
"grad_norm": 1.1535760888310356,
"learning_rate": 2e-05,
"loss": 0.6768205642700196,
"step": 950
},
{
"epoch": 0.018730610891069793,
"grad_norm": 2.5687267328441172,
"learning_rate": 2e-05,
"loss": 0.7187290191650391,
"step": 960
},
{
"epoch": 0.0189257214211851,
"grad_norm": 2.363644647745971,
"learning_rate": 2e-05,
"loss": 0.6914881706237793,
"step": 970
},
{
"epoch": 0.01912083195130041,
"grad_norm": 1.6586735289269663,
"learning_rate": 2e-05,
"loss": 0.7053565979003906,
"step": 980
},
{
"epoch": 0.019315942481415722,
"grad_norm": 1.3154384327675313,
"learning_rate": 2e-05,
"loss": 0.6894444942474365,
"step": 990
},
{
"epoch": 0.019511053011531033,
"grad_norm": 1.4829582302075024,
"learning_rate": 2e-05,
"loss": 0.6964797019958496,
"step": 1000
},
{
"epoch": 0.01970616354164634,
"grad_norm": 11.246853734884391,
"learning_rate": 2e-05,
"loss": 0.6903947830200196,
"step": 1010
},
{
"epoch": 0.019901274071761652,
"grad_norm": 2.130270630304158,
"learning_rate": 2e-05,
"loss": 0.7131201744079589,
"step": 1020
},
{
"epoch": 0.020096384601876963,
"grad_norm": 2.3843191059461684,
"learning_rate": 2e-05,
"loss": 0.7245532989501953,
"step": 1030
},
{
"epoch": 0.020291495131992274,
"grad_norm": 1.8036658748418921,
"learning_rate": 2e-05,
"loss": 0.688844633102417,
"step": 1040
},
{
"epoch": 0.020486605662107586,
"grad_norm": 4.142854989409903,
"learning_rate": 2e-05,
"loss": 0.6744081020355225,
"step": 1050
},
{
"epoch": 0.020681716192222893,
"grad_norm": 1.472431946736185,
"learning_rate": 2e-05,
"loss": 0.6328347682952881,
"step": 1060
},
{
"epoch": 0.020876826722338204,
"grad_norm": 2.390747409072109,
"learning_rate": 2e-05,
"loss": 0.688608455657959,
"step": 1070
},
{
"epoch": 0.021071937252453515,
"grad_norm": 2.538662996092993,
"learning_rate": 2e-05,
"loss": 0.7029477119445801,
"step": 1080
},
{
"epoch": 0.021267047782568826,
"grad_norm": 2.4656407868003436,
"learning_rate": 2e-05,
"loss": 0.6541564464569092,
"step": 1090
},
{
"epoch": 0.021462158312684134,
"grad_norm": 1.4483652415733586,
"learning_rate": 2e-05,
"loss": 0.6665634155273438,
"step": 1100
},
{
"epoch": 0.021657268842799445,
"grad_norm": 3.7600001493285813,
"learning_rate": 2e-05,
"loss": 0.6685405731201172,
"step": 1110
},
{
"epoch": 0.021852379372914756,
"grad_norm": 4.4698831654409785,
"learning_rate": 2e-05,
"loss": 0.6686572074890137,
"step": 1120
},
{
"epoch": 0.022047489903030067,
"grad_norm": 1.2416499167615647,
"learning_rate": 2e-05,
"loss": 0.6792525291442871,
"step": 1130
},
{
"epoch": 0.02224260043314538,
"grad_norm": 1.261439766703017,
"learning_rate": 2e-05,
"loss": 0.6553254127502441,
"step": 1140
},
{
"epoch": 0.022437710963260686,
"grad_norm": 3.0580767819341967,
"learning_rate": 2e-05,
"loss": 0.670100736618042,
"step": 1150
},
{
"epoch": 0.022632821493375997,
"grad_norm": 1.9982728200546733,
"learning_rate": 2e-05,
"loss": 0.6652833461761475,
"step": 1160
},
{
"epoch": 0.02282793202349131,
"grad_norm": 1.4478470019999148,
"learning_rate": 2e-05,
"loss": 0.6802016258239746,
"step": 1170
},
{
"epoch": 0.02302304255360662,
"grad_norm": 1.390262972826178,
"learning_rate": 2e-05,
"loss": 0.6520106792449951,
"step": 1180
},
{
"epoch": 0.023218153083721927,
"grad_norm": 1.2517531765951326,
"learning_rate": 2e-05,
"loss": 0.6596714973449707,
"step": 1190
},
{
"epoch": 0.023413263613837238,
"grad_norm": 1.66285797208597,
"learning_rate": 2e-05,
"loss": 0.6890499114990234,
"step": 1200
},
{
"epoch": 0.02360837414395255,
"grad_norm": 1.4023367573944592,
"learning_rate": 2e-05,
"loss": 0.6909699440002441,
"step": 1210
},
{
"epoch": 0.02380348467406786,
"grad_norm": 2.103600383565939,
"learning_rate": 2e-05,
"loss": 0.6514087677001953,
"step": 1220
},
{
"epoch": 0.02399859520418317,
"grad_norm": 1.3538205014153204,
"learning_rate": 2e-05,
"loss": 0.7010597229003906,
"step": 1230
},
{
"epoch": 0.02419370573429848,
"grad_norm": 1.131100957434826,
"learning_rate": 2e-05,
"loss": 0.6904762268066407,
"step": 1240
},
{
"epoch": 0.02438881626441379,
"grad_norm": 0.8521222417760329,
"learning_rate": 2e-05,
"loss": 0.6021539688110351,
"step": 1250
},
{
"epoch": 0.0245839267945291,
"grad_norm": 0.9985116086981741,
"learning_rate": 2e-05,
"loss": 0.6618970394134521,
"step": 1260
},
{
"epoch": 0.024779037324644412,
"grad_norm": 1.0359703256994235,
"learning_rate": 2e-05,
"loss": 0.6823967933654785,
"step": 1270
},
{
"epoch": 0.02497414785475972,
"grad_norm": 1.2887090486112476,
"learning_rate": 2e-05,
"loss": 0.6628634452819824,
"step": 1280
},
{
"epoch": 0.02516925838487503,
"grad_norm": 3.432834498196539,
"learning_rate": 2e-05,
"loss": 0.7419169425964356,
"step": 1290
},
{
"epoch": 0.025364368914990342,
"grad_norm": 23.557815006813602,
"learning_rate": 2e-05,
"loss": 0.7083474636077881,
"step": 1300
},
{
"epoch": 0.025559479445105653,
"grad_norm": 1.3779699418257583,
"learning_rate": 2e-05,
"loss": 0.6835464477539063,
"step": 1310
},
{
"epoch": 0.025754589975220964,
"grad_norm": 1.0971280641281729,
"learning_rate": 2e-05,
"loss": 0.6729559898376465,
"step": 1320
},
{
"epoch": 0.025949700505336272,
"grad_norm": 86.50430124250552,
"learning_rate": 2e-05,
"loss": 0.7425766944885254,
"step": 1330
},
{
"epoch": 0.026144811035451583,
"grad_norm": 1.9060666983098362,
"learning_rate": 2e-05,
"loss": 0.6884101867675781,
"step": 1340
},
{
"epoch": 0.026339921565566894,
"grad_norm": 4.952310768605313,
"learning_rate": 2e-05,
"loss": 0.6712810516357421,
"step": 1350
},
{
"epoch": 0.026535032095682205,
"grad_norm": 2.1836902499589055,
"learning_rate": 2e-05,
"loss": 0.6641899108886719,
"step": 1360
},
{
"epoch": 0.026730142625797513,
"grad_norm": 0.9745030121353373,
"learning_rate": 2e-05,
"loss": 0.6548121929168701,
"step": 1370
},
{
"epoch": 0.026925253155912824,
"grad_norm": 1.0085691573367601,
"learning_rate": 2e-05,
"loss": 0.6872680187225342,
"step": 1380
},
{
"epoch": 0.027120363686028135,
"grad_norm": 1.0328562743257255,
"learning_rate": 2e-05,
"loss": 0.6593247413635254,
"step": 1390
},
{
"epoch": 0.027315474216143446,
"grad_norm": 1.7706110276938303,
"learning_rate": 2e-05,
"loss": 0.6563483715057373,
"step": 1400
},
{
"epoch": 0.027510584746258757,
"grad_norm": 1.1475044260212954,
"learning_rate": 2e-05,
"loss": 0.6485116004943847,
"step": 1410
},
{
"epoch": 0.027705695276374065,
"grad_norm": 2.1343320521467724,
"learning_rate": 2e-05,
"loss": 0.6518092155456543,
"step": 1420
},
{
"epoch": 0.027900805806489376,
"grad_norm": 19.40190752512825,
"learning_rate": 2e-05,
"loss": 0.6708407402038574,
"step": 1430
},
{
"epoch": 0.028095916336604687,
"grad_norm": 1.0429828458514099,
"learning_rate": 2e-05,
"loss": 0.6531154632568359,
"step": 1440
},
{
"epoch": 0.028291026866719998,
"grad_norm": 3.854687583398717,
"learning_rate": 2e-05,
"loss": 0.6318797588348388,
"step": 1450
},
{
"epoch": 0.028486137396835306,
"grad_norm": 1.2803239369157802,
"learning_rate": 2e-05,
"loss": 0.6483430385589599,
"step": 1460
},
{
"epoch": 0.028681247926950617,
"grad_norm": 1.7844005133176821,
"learning_rate": 2e-05,
"loss": 0.670600414276123,
"step": 1470
},
{
"epoch": 0.028876358457065928,
"grad_norm": 2.638360353786163,
"learning_rate": 2e-05,
"loss": 0.6612592220306397,
"step": 1480
},
{
"epoch": 0.02907146898718124,
"grad_norm": 1.2239072376785438,
"learning_rate": 2e-05,
"loss": 0.6572507381439209,
"step": 1490
},
{
"epoch": 0.029266579517296547,
"grad_norm": 3.9817061848469457,
"learning_rate": 2e-05,
"loss": 0.631273603439331,
"step": 1500
},
{
"epoch": 0.029461690047411858,
"grad_norm": 1.2083656296744134,
"learning_rate": 2e-05,
"loss": 0.6754149913787841,
"step": 1510
},
{
"epoch": 0.02965680057752717,
"grad_norm": 1.6701538309486328,
"learning_rate": 2e-05,
"loss": 0.6359077453613281,
"step": 1520
},
{
"epoch": 0.02985191110764248,
"grad_norm": 1.1088864730268388,
"learning_rate": 2e-05,
"loss": 0.6407184600830078,
"step": 1530
},
{
"epoch": 0.03004702163775779,
"grad_norm": 2.855041461691364,
"learning_rate": 2e-05,
"loss": 0.6601726531982421,
"step": 1540
},
{
"epoch": 0.0302421321678731,
"grad_norm": 1.041676019536129,
"learning_rate": 2e-05,
"loss": 0.6693766593933106,
"step": 1550
},
{
"epoch": 0.03043724269798841,
"grad_norm": 1.7903036215917778,
"learning_rate": 2e-05,
"loss": 0.6842814445495605,
"step": 1560
},
{
"epoch": 0.03063235322810372,
"grad_norm": 1.2275140901739492,
"learning_rate": 2e-05,
"loss": 0.6563383102416992,
"step": 1570
},
{
"epoch": 0.030827463758219032,
"grad_norm": 1.4416525013205308,
"learning_rate": 2e-05,
"loss": 0.70062255859375,
"step": 1580
},
{
"epoch": 0.03102257428833434,
"grad_norm": 1.022694275409909,
"learning_rate": 2e-05,
"loss": 0.6751978874206543,
"step": 1590
},
{
"epoch": 0.03121768481844965,
"grad_norm": 1.5434339515015798,
"learning_rate": 2e-05,
"loss": 0.6534595489501953,
"step": 1600
},
{
"epoch": 0.03141279534856496,
"grad_norm": 4.482223058250825,
"learning_rate": 2e-05,
"loss": 0.679110336303711,
"step": 1610
},
{
"epoch": 0.03160790587868027,
"grad_norm": 1.269130777338052,
"learning_rate": 2e-05,
"loss": 0.6603041648864746,
"step": 1620
},
{
"epoch": 0.031803016408795584,
"grad_norm": 3.5729377498646477,
"learning_rate": 2e-05,
"loss": 0.6539816856384277,
"step": 1630
},
{
"epoch": 0.031998126938910895,
"grad_norm": 2.6023274014566247,
"learning_rate": 2e-05,
"loss": 0.7010405540466309,
"step": 1640
},
{
"epoch": 0.032193237469026206,
"grad_norm": 9.210714854982013,
"learning_rate": 2e-05,
"loss": 0.6686701774597168,
"step": 1650
},
{
"epoch": 0.03238834799914151,
"grad_norm": 5.165666638947227,
"learning_rate": 2e-05,
"loss": 0.6095908164978028,
"step": 1660
},
{
"epoch": 0.03258345852925682,
"grad_norm": 9.16141664239496,
"learning_rate": 2e-05,
"loss": 0.7108460903167725,
"step": 1670
},
{
"epoch": 0.03277856905937213,
"grad_norm": 3.161658879203255,
"learning_rate": 2e-05,
"loss": 0.6284823417663574,
"step": 1680
},
{
"epoch": 0.032973679589487444,
"grad_norm": 5.944141446716445,
"learning_rate": 2e-05,
"loss": 0.6405398845672607,
"step": 1690
},
{
"epoch": 0.033168790119602755,
"grad_norm": 1.7808423949894736,
"learning_rate": 2e-05,
"loss": 0.6491862297058105,
"step": 1700
},
{
"epoch": 0.033363900649718066,
"grad_norm": 1.726175898675113,
"learning_rate": 2e-05,
"loss": 0.6724005699157715,
"step": 1710
},
{
"epoch": 0.03355901117983338,
"grad_norm": 2.376245899157911,
"learning_rate": 2e-05,
"loss": 0.6525126934051514,
"step": 1720
},
{
"epoch": 0.03375412170994869,
"grad_norm": 1.6653879954838984,
"learning_rate": 2e-05,
"loss": 0.6367118835449219,
"step": 1730
},
{
"epoch": 0.033949232240064,
"grad_norm": 1.3883560501158865,
"learning_rate": 2e-05,
"loss": 0.6553079128265381,
"step": 1740
},
{
"epoch": 0.0341443427701793,
"grad_norm": 11.844497956339469,
"learning_rate": 2e-05,
"loss": 0.5972353935241699,
"step": 1750
},
{
"epoch": 0.034339453300294615,
"grad_norm": 1.5888196717274026,
"learning_rate": 2e-05,
"loss": 0.658538818359375,
"step": 1760
},
{
"epoch": 0.034534563830409926,
"grad_norm": 1.2587083645893846,
"learning_rate": 2e-05,
"loss": 0.6199719905853271,
"step": 1770
},
{
"epoch": 0.03472967436052524,
"grad_norm": 2.0204514597287266,
"learning_rate": 2e-05,
"loss": 0.6569772243499756,
"step": 1780
},
{
"epoch": 0.03492478489064055,
"grad_norm": 1.1323396524728921,
"learning_rate": 2e-05,
"loss": 0.6597754478454589,
"step": 1790
},
{
"epoch": 0.03511989542075586,
"grad_norm": 4.803084432276915,
"learning_rate": 2e-05,
"loss": 0.6832777976989746,
"step": 1800
},
{
"epoch": 0.03531500595087117,
"grad_norm": 1.2706249626426194,
"learning_rate": 2e-05,
"loss": 0.6612133026123047,
"step": 1810
},
{
"epoch": 0.03551011648098648,
"grad_norm": 2.888385667334179,
"learning_rate": 2e-05,
"loss": 0.6800965785980224,
"step": 1820
},
{
"epoch": 0.03570522701110179,
"grad_norm": 1.7994196905308342,
"learning_rate": 2e-05,
"loss": 0.6731705665588379,
"step": 1830
},
{
"epoch": 0.035900337541217096,
"grad_norm": 2.2229464990180463,
"learning_rate": 2e-05,
"loss": 0.6999088287353515,
"step": 1840
},
{
"epoch": 0.03609544807133241,
"grad_norm": 1.7473284581429838,
"learning_rate": 2e-05,
"loss": 0.665509557723999,
"step": 1850
},
{
"epoch": 0.03629055860144772,
"grad_norm": 2.2975536238797036,
"learning_rate": 2e-05,
"loss": 0.6647231101989746,
"step": 1860
},
{
"epoch": 0.03648566913156303,
"grad_norm": 2.6214877289682246,
"learning_rate": 2e-05,
"loss": 0.62739577293396,
"step": 1870
},
{
"epoch": 0.03668077966167834,
"grad_norm": 2.192373938003488,
"learning_rate": 2e-05,
"loss": 0.7087226390838623,
"step": 1880
},
{
"epoch": 0.03687589019179365,
"grad_norm": 6.62847066861488,
"learning_rate": 2e-05,
"loss": 0.6841737270355225,
"step": 1890
},
{
"epoch": 0.03707100072190896,
"grad_norm": 8.573387218725129,
"learning_rate": 2e-05,
"loss": 0.6550696849822998,
"step": 1900
},
{
"epoch": 0.037266111252024274,
"grad_norm": 21.81644893450406,
"learning_rate": 2e-05,
"loss": 0.6534019470214844,
"step": 1910
},
{
"epoch": 0.037461221782139585,
"grad_norm": 1.972315212149555,
"learning_rate": 2e-05,
"loss": 0.6699990272521973,
"step": 1920
},
{
"epoch": 0.03765633231225489,
"grad_norm": 1.572875023378223,
"learning_rate": 2e-05,
"loss": 0.6702420234680175,
"step": 1930
},
{
"epoch": 0.0378514428423702,
"grad_norm": 1.2077505710786207,
"learning_rate": 2e-05,
"loss": 0.6410272121429443,
"step": 1940
},
{
"epoch": 0.03804655337248551,
"grad_norm": 1.3936237416130755,
"learning_rate": 2e-05,
"loss": 0.6933211803436279,
"step": 1950
},
{
"epoch": 0.03824166390260082,
"grad_norm": 2.6969645830470323,
"learning_rate": 2e-05,
"loss": 0.6899444580078125,
"step": 1960
},
{
"epoch": 0.038436774432716134,
"grad_norm": 3.6883874679320745,
"learning_rate": 2e-05,
"loss": 0.661356258392334,
"step": 1970
},
{
"epoch": 0.038631884962831445,
"grad_norm": 4.1375939813313325,
"learning_rate": 2e-05,
"loss": 0.6723477840423584,
"step": 1980
},
{
"epoch": 0.038826995492946756,
"grad_norm": 8.712693611376435,
"learning_rate": 2e-05,
"loss": 0.6563708305358886,
"step": 1990
},
{
"epoch": 0.03902210602306207,
"grad_norm": 1.7546049733134041,
"learning_rate": 2e-05,
"loss": 0.6711672782897949,
"step": 2000
},
{
"epoch": 0.03921721655317738,
"grad_norm": 1.7813893766887805,
"learning_rate": 2e-05,
"loss": 0.6956442832946778,
"step": 2010
},
{
"epoch": 0.03941232708329268,
"grad_norm": 1.2906449372308841,
"learning_rate": 2e-05,
"loss": 0.6290652275085449,
"step": 2020
},
{
"epoch": 0.03960743761340799,
"grad_norm": 1.1252587686982205,
"learning_rate": 2e-05,
"loss": 0.6268731117248535,
"step": 2030
}
],
"logging_steps": 10,
"max_steps": 5935,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 2035,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 963613493821440.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}