rv2-gemma12b-g1_cleanup_code / 200M /trainer_state.json
rqadri's picture
Upload folder using huggingface_hub
1279f55 verified
Raw History Blame Contribute Delete
35.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.12679127725856698,
"eval_steps": 500,
"global_step": 2035,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0006230529595015577,
"grad_norm": 63.15375442917419,
"learning_rate": 2.910112359550562e-06,
"loss": 1.372981071472168,
"step": 10
},
{
"epoch": 0.0012461059190031153,
"grad_norm": 63.39470944322245,
"learning_rate": 3.921348314606742e-06,
"loss": 0.8310403823852539,
"step": 20
},
{
"epoch": 0.001869158878504673,
"grad_norm": 11.96310343076372,
"learning_rate": 4.932584269662922e-06,
"loss": 0.7284352779388428,
"step": 30
},
{
"epoch": 0.0024922118380062306,
"grad_norm": 159.35287956464992,
"learning_rate": 5.943820224719102e-06,
"loss": 0.6918130874633789,
"step": 40
},
{
"epoch": 0.003115264797507788,
"grad_norm": 140.43690439070613,
"learning_rate": 6.955056179775282e-06,
"loss": 0.6914069652557373,
"step": 50
},
{
"epoch": 0.003738317757009346,
"grad_norm": 20.04034887568955,
"learning_rate": 7.966292134831462e-06,
"loss": 0.6684707641601563,
"step": 60
},
{
"epoch": 0.004361370716510903,
"grad_norm": 146.62158267929294,
"learning_rate": 8.977528089887641e-06,
"loss": 0.6722880363464355,
"step": 70
},
{
"epoch": 0.004984423676012461,
"grad_norm": 48.33263649592231,
"learning_rate": 9.988764044943822e-06,
"loss": 0.7312785625457764,
"step": 80
},
{
"epoch": 0.005607476635514018,
"grad_norm": 96.97131898292652,
"learning_rate": 1.1000000000000001e-05,
"loss": 0.7157273292541504,
"step": 90
},
{
"epoch": 0.006230529595015576,
"grad_norm": 95.5113244321525,
"learning_rate": 1.2011235955056182e-05,
"loss": 0.7347418785095214,
"step": 100
},
{
"epoch": 0.006853582554517134,
"grad_norm": 17.213242453649954,
"learning_rate": 1.3022471910112362e-05,
"loss": 0.7522170066833496,
"step": 110
},
{
"epoch": 0.007476635514018692,
"grad_norm": 31.300913667908624,
"learning_rate": 1.403370786516854e-05,
"loss": 0.7286031246185303,
"step": 120
},
{
"epoch": 0.00809968847352025,
"grad_norm": 69.2417895023605,
"learning_rate": 1.504494382022472e-05,
"loss": 0.6891061305999756,
"step": 130
},
{
"epoch": 0.008722741433021807,
"grad_norm": 20.324536486476994,
"learning_rate": 1.60561797752809e-05,
"loss": 1.3122027397155762,
"step": 140
},
{
"epoch": 0.009345794392523364,
"grad_norm": 4.902224214231,
"learning_rate": 1.706741573033708e-05,
"loss": 0.7708694458007812,
"step": 150
},
{
"epoch": 0.009968847352024923,
"grad_norm": 14.386566577478696,
"learning_rate": 1.8078651685393256e-05,
"loss": 0.7179630279541016,
"step": 160
},
{
"epoch": 0.01059190031152648,
"grad_norm": 7.998488720594685,
"learning_rate": 1.908988764044944e-05,
"loss": 0.684850025177002,
"step": 170
},
{
"epoch": 0.011214953271028037,
"grad_norm": 10.20788593785828,
"learning_rate": 2e-05,
"loss": 0.7212257385253906,
"step": 180
},
{
"epoch": 0.011838006230529595,
"grad_norm": 15.093739760534373,
"learning_rate": 2e-05,
"loss": 0.7274382591247559,
"step": 190
},
{
"epoch": 0.012461059190031152,
"grad_norm": 7.624987181272481,
"learning_rate": 2e-05,
"loss": 0.6997462272644043,
"step": 200
},
{
"epoch": 0.013084112149532711,
"grad_norm": 38.20889799071737,
"learning_rate": 2e-05,
"loss": 0.8538092613220215,
"step": 210
},
{
"epoch": 0.013707165109034268,
"grad_norm": 5.610917778335814,
"learning_rate": 2e-05,
"loss": 0.7119334697723388,
"step": 220
},
{
"epoch": 0.014330218068535825,
"grad_norm": 7.071002934278071,
"learning_rate": 2e-05,
"loss": 0.6945069313049317,
"step": 230
},
{
"epoch": 0.014953271028037384,
"grad_norm": 1.9779972566834714,
"learning_rate": 2e-05,
"loss": 0.6839393615722656,
"step": 240
},
{
"epoch": 0.01557632398753894,
"grad_norm": 4.542653465163337,
"learning_rate": 2e-05,
"loss": 0.6552486419677734,
"step": 250
},
{
"epoch": 0.0161993769470405,
"grad_norm": 4.1326478566474645,
"learning_rate": 2e-05,
"loss": 0.7250523567199707,
"step": 260
},
{
"epoch": 0.016822429906542057,
"grad_norm": 2.71061736504502,
"learning_rate": 2e-05,
"loss": 0.6365773677825928,
"step": 270
},
{
"epoch": 0.017445482866043614,
"grad_norm": 2.4835202986671043,
"learning_rate": 2e-05,
"loss": 0.6632792472839355,
"step": 280
},
{
"epoch": 0.01806853582554517,
"grad_norm": 22.09800173446232,
"learning_rate": 2e-05,
"loss": 0.663812780380249,
"step": 290
},
{
"epoch": 0.018691588785046728,
"grad_norm": 15.489771776735218,
"learning_rate": 2e-05,
"loss": 0.650740385055542,
"step": 300
},
{
"epoch": 0.019314641744548288,
"grad_norm": 1.8136045854235476,
"learning_rate": 2e-05,
"loss": 0.6493139266967773,
"step": 310
},
{
"epoch": 0.019937694704049845,
"grad_norm": 1.4242810637346537,
"learning_rate": 2e-05,
"loss": 0.6703683376312256,
"step": 320
},
{
"epoch": 0.020560747663551402,
"grad_norm": 2.01645414429854,
"learning_rate": 2e-05,
"loss": 0.6692399501800537,
"step": 330
},
{
"epoch": 0.02118380062305296,
"grad_norm": 1.3748624267038327,
"learning_rate": 2e-05,
"loss": 0.6543716430664063,
"step": 340
},
{
"epoch": 0.021806853582554516,
"grad_norm": 3.7632290163066595,
"learning_rate": 2e-05,
"loss": 0.6510223388671875,
"step": 350
},
{
"epoch": 0.022429906542056073,
"grad_norm": 3.069062402265582,
"learning_rate": 2e-05,
"loss": 0.6401685237884521,
"step": 360
},
{
"epoch": 0.023052959501557634,
"grad_norm": 3.9242151311515756,
"learning_rate": 2e-05,
"loss": 0.650885534286499,
"step": 370
},
{
"epoch": 0.02367601246105919,
"grad_norm": 2.5645994240054146,
"learning_rate": 2e-05,
"loss": 0.6438897132873536,
"step": 380
},
{
"epoch": 0.024299065420560748,
"grad_norm": 3.3264331329128587,
"learning_rate": 2e-05,
"loss": 0.6713788032531738,
"step": 390
},
{
"epoch": 0.024922118380062305,
"grad_norm": 5.952680558627565,
"learning_rate": 2e-05,
"loss": 0.695007610321045,
"step": 400
},
{
"epoch": 0.02554517133956386,
"grad_norm": 7.2640539794724965,
"learning_rate": 2e-05,
"loss": 0.6785341262817383,
"step": 410
},
{
"epoch": 0.026168224299065422,
"grad_norm": 12.065849294819978,
"learning_rate": 2e-05,
"loss": 0.6561185836791992,
"step": 420
},
{
"epoch": 0.02679127725856698,
"grad_norm": 2.9882502235892647,
"learning_rate": 2e-05,
"loss": 0.6439939498901367,
"step": 430
},
{
"epoch": 0.027414330218068536,
"grad_norm": 2.919046299610538,
"learning_rate": 2e-05,
"loss": 0.6663602352142334,
"step": 440
},
{
"epoch": 0.028037383177570093,
"grad_norm": 4.189627201982762,
"learning_rate": 2e-05,
"loss": 0.6693576812744141,
"step": 450
},
{
"epoch": 0.02866043613707165,
"grad_norm": 7.890660674041811,
"learning_rate": 2e-05,
"loss": 0.6684383392333985,
"step": 460
},
{
"epoch": 0.029283489096573207,
"grad_norm": 82.91478815091692,
"learning_rate": 2e-05,
"loss": 0.7290635585784913,
"step": 470
},
{
"epoch": 0.029906542056074768,
"grad_norm": 3.333359402201608,
"learning_rate": 2e-05,
"loss": 0.6626537322998047,
"step": 480
},
{
"epoch": 0.030529595015576325,
"grad_norm": 2.4351561694941313,
"learning_rate": 2e-05,
"loss": 0.6529546260833741,
"step": 490
},
{
"epoch": 0.03115264797507788,
"grad_norm": 3.5168056840413233,
"learning_rate": 2e-05,
"loss": 0.6785277843475341,
"step": 500
},
{
"epoch": 0.03177570093457944,
"grad_norm": 64.52415387460657,
"learning_rate": 2e-05,
"loss": 0.6317290306091309,
"step": 510
},
{
"epoch": 0.032398753894081,
"grad_norm": 1.9567345855965799,
"learning_rate": 2e-05,
"loss": 0.6504751205444336,
"step": 520
},
{
"epoch": 0.03302180685358255,
"grad_norm": 2.4483916233070815,
"learning_rate": 2e-05,
"loss": 0.6714927673339843,
"step": 530
},
{
"epoch": 0.03364485981308411,
"grad_norm": 6.84493838576302,
"learning_rate": 2e-05,
"loss": 0.6702317714691162,
"step": 540
},
{
"epoch": 0.03426791277258567,
"grad_norm": 1.6302467458157637,
"learning_rate": 2e-05,
"loss": 0.6749137878417969,
"step": 550
},
{
"epoch": 0.03489096573208723,
"grad_norm": 1.3830723147413793,
"learning_rate": 2e-05,
"loss": 0.6726428985595703,
"step": 560
},
{
"epoch": 0.03551401869158879,
"grad_norm": 1.816565044561178,
"learning_rate": 2e-05,
"loss": 0.6633450984954834,
"step": 570
},
{
"epoch": 0.03613707165109034,
"grad_norm": 1.4154803760531598,
"learning_rate": 2e-05,
"loss": 0.6670496940612793,
"step": 580
},
{
"epoch": 0.0367601246105919,
"grad_norm": 1.441388864695392,
"learning_rate": 2e-05,
"loss": 0.66356520652771,
"step": 590
},
{
"epoch": 0.037383177570093455,
"grad_norm": 5.297501644827849,
"learning_rate": 2e-05,
"loss": 0.6568848609924316,
"step": 600
},
{
"epoch": 0.038006230529595016,
"grad_norm": 1.3268959282636765,
"learning_rate": 2e-05,
"loss": 0.6364224433898926,
"step": 610
},
{
"epoch": 0.038629283489096576,
"grad_norm": 3.1357427218379725,
"learning_rate": 2e-05,
"loss": 0.6608361721038818,
"step": 620
},
{
"epoch": 0.03925233644859813,
"grad_norm": 3.2870153380544496,
"learning_rate": 2e-05,
"loss": 0.7057211875915528,
"step": 630
},
{
"epoch": 0.03987538940809969,
"grad_norm": 2.197431012725625,
"learning_rate": 2e-05,
"loss": 0.6897117614746093,
"step": 640
},
{
"epoch": 0.040498442367601244,
"grad_norm": 8.502549125517568,
"learning_rate": 2e-05,
"loss": 0.6920805931091308,
"step": 650
},
{
"epoch": 0.041121495327102804,
"grad_norm": 2.462320802295259,
"learning_rate": 2e-05,
"loss": 0.7063193321228027,
"step": 660
},
{
"epoch": 0.041744548286604365,
"grad_norm": 5.683201827218238,
"learning_rate": 2e-05,
"loss": 0.6920748710632324,
"step": 670
},
{
"epoch": 0.04236760124610592,
"grad_norm": 3.027115327083748,
"learning_rate": 2e-05,
"loss": 0.6580988883972168,
"step": 680
},
{
"epoch": 0.04299065420560748,
"grad_norm": 9.069631138625143,
"learning_rate": 2e-05,
"loss": 0.6772819519042969,
"step": 690
},
{
"epoch": 0.04361370716510903,
"grad_norm": 3.5222303907627026,
"learning_rate": 2e-05,
"loss": 0.6700127601623536,
"step": 700
},
{
"epoch": 0.04423676012461059,
"grad_norm": 2.539625946046831,
"learning_rate": 2e-05,
"loss": 0.6825683116912842,
"step": 710
},
{
"epoch": 0.044859813084112146,
"grad_norm": 7.530973621569606,
"learning_rate": 2e-05,
"loss": 0.6668391227722168,
"step": 720
},
{
"epoch": 0.04548286604361371,
"grad_norm": 3.10826200653366,
"learning_rate": 2e-05,
"loss": 0.6900657176971435,
"step": 730
},
{
"epoch": 0.04610591900311527,
"grad_norm": 3.021206626575616,
"learning_rate": 2e-05,
"loss": 0.666568374633789,
"step": 740
},
{
"epoch": 0.04672897196261682,
"grad_norm": 3.4063444253551793,
"learning_rate": 2e-05,
"loss": 0.6786983489990235,
"step": 750
},
{
"epoch": 0.04735202492211838,
"grad_norm": 5.674285755423112,
"learning_rate": 2e-05,
"loss": 0.6631364822387695,
"step": 760
},
{
"epoch": 0.047975077881619935,
"grad_norm": 5.447979039303706,
"learning_rate": 2e-05,
"loss": 0.6851268768310547,
"step": 770
},
{
"epoch": 0.048598130841121495,
"grad_norm": 2.0548995784325275,
"learning_rate": 2e-05,
"loss": 0.6662421703338623,
"step": 780
},
{
"epoch": 0.049221183800623056,
"grad_norm": 1.2276649895732483,
"learning_rate": 2e-05,
"loss": 0.6671768188476562,
"step": 790
},
{
"epoch": 0.04984423676012461,
"grad_norm": 1.5987199277283939,
"learning_rate": 2e-05,
"loss": 0.6489299774169922,
"step": 800
},
{
"epoch": 0.05046728971962617,
"grad_norm": 22.9031846877308,
"learning_rate": 2e-05,
"loss": 0.6675164699554443,
"step": 810
},
{
"epoch": 0.05109034267912772,
"grad_norm": 2.9034364102338985,
"learning_rate": 2e-05,
"loss": 0.6826793670654296,
"step": 820
},
{
"epoch": 0.051713395638629284,
"grad_norm": 1.8432534502921918,
"learning_rate": 2e-05,
"loss": 0.6763291835784913,
"step": 830
},
{
"epoch": 0.052336448598130844,
"grad_norm": 2.0417799918298596,
"learning_rate": 2e-05,
"loss": 0.6497424125671387,
"step": 840
},
{
"epoch": 0.0529595015576324,
"grad_norm": 22.32540564160995,
"learning_rate": 2e-05,
"loss": 0.6354857444763183,
"step": 850
},
{
"epoch": 0.05358255451713396,
"grad_norm": 6.229762616389806,
"learning_rate": 2e-05,
"loss": 0.657370662689209,
"step": 860
},
{
"epoch": 0.05420560747663551,
"grad_norm": 3.23998905516123,
"learning_rate": 2e-05,
"loss": 0.6524142265319824,
"step": 870
},
{
"epoch": 0.05482866043613707,
"grad_norm": 2.8784021094456604,
"learning_rate": 2e-05,
"loss": 0.653789472579956,
"step": 880
},
{
"epoch": 0.05545171339563863,
"grad_norm": 1.40857663500608,
"learning_rate": 2e-05,
"loss": 0.6703225612640381,
"step": 890
},
{
"epoch": 0.056074766355140186,
"grad_norm": 5.080917667561178,
"learning_rate": 2e-05,
"loss": 0.6439192771911622,
"step": 900
},
{
"epoch": 0.05669781931464175,
"grad_norm": 4.5764665849587445,
"learning_rate": 2e-05,
"loss": 0.6634146690368652,
"step": 910
},
{
"epoch": 0.0573208722741433,
"grad_norm": 3.2037710370417023,
"learning_rate": 2e-05,
"loss": 0.6824374198913574,
"step": 920
},
{
"epoch": 0.05794392523364486,
"grad_norm": 6.053033149131505,
"learning_rate": 2e-05,
"loss": 0.6423258781433105,
"step": 930
},
{
"epoch": 0.058566978193146414,
"grad_norm": 13.436486964861611,
"learning_rate": 2e-05,
"loss": 0.6521054744720459,
"step": 940
},
{
"epoch": 0.059190031152647975,
"grad_norm": 1.4820242941537698,
"learning_rate": 2e-05,
"loss": 0.6490562438964844,
"step": 950
},
{
"epoch": 0.059813084112149535,
"grad_norm": 3.970984796336633,
"learning_rate": 2e-05,
"loss": 0.6425233364105225,
"step": 960
},
{
"epoch": 0.06043613707165109,
"grad_norm": 2.606688835969579,
"learning_rate": 2e-05,
"loss": 0.6780929088592529,
"step": 970
},
{
"epoch": 0.06105919003115265,
"grad_norm": 1.6441407042964533,
"learning_rate": 2e-05,
"loss": 0.6381833553314209,
"step": 980
},
{
"epoch": 0.0616822429906542,
"grad_norm": 1.9338014114509088,
"learning_rate": 2e-05,
"loss": 0.671638298034668,
"step": 990
},
{
"epoch": 0.06230529595015576,
"grad_norm": 2.39864419114088,
"learning_rate": 2e-05,
"loss": 0.659054183959961,
"step": 1000
},
{
"epoch": 0.06292834890965732,
"grad_norm": 4.683446585267705,
"learning_rate": 2e-05,
"loss": 0.6786028861999511,
"step": 1010
},
{
"epoch": 0.06355140186915888,
"grad_norm": 2.719894383949491,
"learning_rate": 2e-05,
"loss": 0.6658808708190918,
"step": 1020
},
{
"epoch": 0.06417445482866044,
"grad_norm": 1.1588652494157246,
"learning_rate": 2e-05,
"loss": 0.6696397304534912,
"step": 1030
},
{
"epoch": 0.064797507788162,
"grad_norm": 1.0813640353054965,
"learning_rate": 2e-05,
"loss": 0.6676293849945069,
"step": 1040
},
{
"epoch": 0.06542056074766354,
"grad_norm": 1.2271064002015928,
"learning_rate": 2e-05,
"loss": 0.6389595985412597,
"step": 1050
},
{
"epoch": 0.0660436137071651,
"grad_norm": 2.8431458204110074,
"learning_rate": 2e-05,
"loss": 0.6555405616760254,
"step": 1060
},
{
"epoch": 0.06666666666666667,
"grad_norm": 3.2188265816780692,
"learning_rate": 2e-05,
"loss": 0.6418774604797364,
"step": 1070
},
{
"epoch": 0.06728971962616823,
"grad_norm": 9.465426552560904,
"learning_rate": 2e-05,
"loss": 0.6477942943572998,
"step": 1080
},
{
"epoch": 0.06791277258566979,
"grad_norm": 1.1426314291875073,
"learning_rate": 2e-05,
"loss": 0.6486814022064209,
"step": 1090
},
{
"epoch": 0.06853582554517133,
"grad_norm": 1.3614517863008955,
"learning_rate": 2e-05,
"loss": 0.6399056911468506,
"step": 1100
},
{
"epoch": 0.0691588785046729,
"grad_norm": 1.616958777603617,
"learning_rate": 2e-05,
"loss": 0.625498104095459,
"step": 1110
},
{
"epoch": 0.06978193146417445,
"grad_norm": 1.700623675066532,
"learning_rate": 2e-05,
"loss": 0.620833158493042,
"step": 1120
},
{
"epoch": 0.07040498442367601,
"grad_norm": 2.5588029176909948,
"learning_rate": 2e-05,
"loss": 0.6351099967956543,
"step": 1130
},
{
"epoch": 0.07102803738317758,
"grad_norm": 6.556254605023658,
"learning_rate": 2e-05,
"loss": 0.6419850826263428,
"step": 1140
},
{
"epoch": 0.07165109034267912,
"grad_norm": 2.4751544762969946,
"learning_rate": 2e-05,
"loss": 0.6722092628479004,
"step": 1150
},
{
"epoch": 0.07227414330218068,
"grad_norm": 1.5727047413222857,
"learning_rate": 2e-05,
"loss": 0.6558211326599122,
"step": 1160
},
{
"epoch": 0.07289719626168224,
"grad_norm": 9.438322770095112,
"learning_rate": 2e-05,
"loss": 0.6519765853881836,
"step": 1170
},
{
"epoch": 0.0735202492211838,
"grad_norm": 2.839029932122009,
"learning_rate": 2e-05,
"loss": 0.6472910881042481,
"step": 1180
},
{
"epoch": 0.07414330218068536,
"grad_norm": 1.3804888984788395,
"learning_rate": 2e-05,
"loss": 0.6604276180267334,
"step": 1190
},
{
"epoch": 0.07476635514018691,
"grad_norm": 1.0934274555239194,
"learning_rate": 2e-05,
"loss": 0.6465075969696045,
"step": 1200
},
{
"epoch": 0.07538940809968847,
"grad_norm": 1.8841069578655136,
"learning_rate": 2e-05,
"loss": 0.6400872230529785,
"step": 1210
},
{
"epoch": 0.07601246105919003,
"grad_norm": 16.12011257195063,
"learning_rate": 2e-05,
"loss": 0.655942440032959,
"step": 1220
},
{
"epoch": 0.07663551401869159,
"grad_norm": 1.9392045965213456,
"learning_rate": 2e-05,
"loss": 0.6418064117431641,
"step": 1230
},
{
"epoch": 0.07725856697819315,
"grad_norm": 1.2879388752480592,
"learning_rate": 2e-05,
"loss": 0.6534547328948974,
"step": 1240
},
{
"epoch": 0.0778816199376947,
"grad_norm": 1.3491269021694952,
"learning_rate": 2e-05,
"loss": 0.6325421333312988,
"step": 1250
},
{
"epoch": 0.07850467289719626,
"grad_norm": 1.9538179100083624,
"learning_rate": 2e-05,
"loss": 0.6555644989013671,
"step": 1260
},
{
"epoch": 0.07912772585669782,
"grad_norm": 1.686205721804821,
"learning_rate": 2e-05,
"loss": 0.6385934352874756,
"step": 1270
},
{
"epoch": 0.07975077881619938,
"grad_norm": 1.4326411502688534,
"learning_rate": 2e-05,
"loss": 0.6342977046966553,
"step": 1280
},
{
"epoch": 0.08037383177570094,
"grad_norm": 4.860024808022459,
"learning_rate": 2e-05,
"loss": 0.6609707832336426,
"step": 1290
},
{
"epoch": 0.08099688473520249,
"grad_norm": 1.2371686758942715,
"learning_rate": 2e-05,
"loss": 0.6476799964904785,
"step": 1300
},
{
"epoch": 0.08161993769470405,
"grad_norm": 1.1597203515801051,
"learning_rate": 2e-05,
"loss": 0.6473023891448975,
"step": 1310
},
{
"epoch": 0.08224299065420561,
"grad_norm": 1.8273978345410087,
"learning_rate": 2e-05,
"loss": 0.6425920009613038,
"step": 1320
},
{
"epoch": 0.08286604361370717,
"grad_norm": 1.6088638146203655,
"learning_rate": 2e-05,
"loss": 0.6325952053070069,
"step": 1330
},
{
"epoch": 0.08348909657320873,
"grad_norm": 1.0395526162178266,
"learning_rate": 2e-05,
"loss": 0.6280010223388672,
"step": 1340
},
{
"epoch": 0.08411214953271028,
"grad_norm": 1.1776111039430426,
"learning_rate": 2e-05,
"loss": 0.6420888900756836,
"step": 1350
},
{
"epoch": 0.08473520249221184,
"grad_norm": 1.144362156326936,
"learning_rate": 2e-05,
"loss": 0.6447340965270996,
"step": 1360
},
{
"epoch": 0.0853582554517134,
"grad_norm": 1.2899619747320272,
"learning_rate": 2e-05,
"loss": 0.6319891929626464,
"step": 1370
},
{
"epoch": 0.08598130841121496,
"grad_norm": 1.1503180888416502,
"learning_rate": 2e-05,
"loss": 0.6263866424560547,
"step": 1380
},
{
"epoch": 0.08660436137071652,
"grad_norm": 0.9492449615285058,
"learning_rate": 2e-05,
"loss": 0.6156892776489258,
"step": 1390
},
{
"epoch": 0.08722741433021806,
"grad_norm": 0.9840501517202644,
"learning_rate": 2e-05,
"loss": 0.6201627731323243,
"step": 1400
},
{
"epoch": 0.08785046728971962,
"grad_norm": 0.9663965412569069,
"learning_rate": 2e-05,
"loss": 0.618841552734375,
"step": 1410
},
{
"epoch": 0.08847352024922119,
"grad_norm": 1.2024904063187882,
"learning_rate": 2e-05,
"loss": 0.6406625270843506,
"step": 1420
},
{
"epoch": 0.08909657320872275,
"grad_norm": 0.9573647223711624,
"learning_rate": 2e-05,
"loss": 0.6550570487976074,
"step": 1430
},
{
"epoch": 0.08971962616822429,
"grad_norm": 1.0307197954823704,
"learning_rate": 2e-05,
"loss": 0.6338574886322021,
"step": 1440
},
{
"epoch": 0.09034267912772585,
"grad_norm": 2.305281565846579,
"learning_rate": 2e-05,
"loss": 0.6363538265228271,
"step": 1450
},
{
"epoch": 0.09096573208722741,
"grad_norm": 1.4667417153142859,
"learning_rate": 2e-05,
"loss": 0.6235406875610352,
"step": 1460
},
{
"epoch": 0.09158878504672897,
"grad_norm": 2.9584530551772437,
"learning_rate": 2e-05,
"loss": 0.6403841018676758,
"step": 1470
},
{
"epoch": 0.09221183800623053,
"grad_norm": 1.112253956223209,
"learning_rate": 2e-05,
"loss": 0.6414080619812011,
"step": 1480
},
{
"epoch": 0.09283489096573208,
"grad_norm": 1.197396557670252,
"learning_rate": 2e-05,
"loss": 0.6136775970458984,
"step": 1490
},
{
"epoch": 0.09345794392523364,
"grad_norm": 0.930725260856421,
"learning_rate": 2e-05,
"loss": 0.6281547546386719,
"step": 1500
},
{
"epoch": 0.0940809968847352,
"grad_norm": 2.246282067394849,
"learning_rate": 2e-05,
"loss": 0.6232186317443847,
"step": 1510
},
{
"epoch": 0.09470404984423676,
"grad_norm": 1.811695916729897,
"learning_rate": 2e-05,
"loss": 0.6236707210540772,
"step": 1520
},
{
"epoch": 0.09532710280373832,
"grad_norm": 1.8453018493553404,
"learning_rate": 2e-05,
"loss": 0.6396072387695313,
"step": 1530
},
{
"epoch": 0.09595015576323987,
"grad_norm": 1.4810091845213549,
"learning_rate": 2e-05,
"loss": 0.6346172332763672,
"step": 1540
},
{
"epoch": 0.09657320872274143,
"grad_norm": 1.1558342150707985,
"learning_rate": 2e-05,
"loss": 0.6340350151062012,
"step": 1550
},
{
"epoch": 0.09719626168224299,
"grad_norm": 1.1277930144534245,
"learning_rate": 2e-05,
"loss": 0.6178334712982178,
"step": 1560
},
{
"epoch": 0.09781931464174455,
"grad_norm": 1.6697265802855836,
"learning_rate": 2e-05,
"loss": 0.6273056030273437,
"step": 1570
},
{
"epoch": 0.09844236760124611,
"grad_norm": 1.1996090977492178,
"learning_rate": 2e-05,
"loss": 0.6388472557067871,
"step": 1580
},
{
"epoch": 0.09906542056074766,
"grad_norm": 4.193851985080715,
"learning_rate": 2e-05,
"loss": 0.6388599395751953,
"step": 1590
},
{
"epoch": 0.09968847352024922,
"grad_norm": 1.3073390628519994,
"learning_rate": 2e-05,
"loss": 0.6429434776306152,
"step": 1600
},
{
"epoch": 0.10031152647975078,
"grad_norm": 1.5006350300856774,
"learning_rate": 2e-05,
"loss": 0.6440896034240723,
"step": 1610
},
{
"epoch": 0.10093457943925234,
"grad_norm": 1.2275982378982346,
"learning_rate": 2e-05,
"loss": 0.6285616874694824,
"step": 1620
},
{
"epoch": 0.1015576323987539,
"grad_norm": 1.1626753929589895,
"learning_rate": 2e-05,
"loss": 0.6467322826385498,
"step": 1630
},
{
"epoch": 0.10218068535825545,
"grad_norm": 1.8546526164062445,
"learning_rate": 2e-05,
"loss": 0.6216934204101563,
"step": 1640
},
{
"epoch": 0.102803738317757,
"grad_norm": 4.204227006721846,
"learning_rate": 2e-05,
"loss": 0.6037077903747559,
"step": 1650
},
{
"epoch": 0.10342679127725857,
"grad_norm": 2.4575617089230892,
"learning_rate": 2e-05,
"loss": 0.6549998760223389,
"step": 1660
},
{
"epoch": 0.10404984423676013,
"grad_norm": 0.9831225747692173,
"learning_rate": 2e-05,
"loss": 0.6362233638763428,
"step": 1670
},
{
"epoch": 0.10467289719626169,
"grad_norm": 37.336116705288426,
"learning_rate": 2e-05,
"loss": 0.6452502250671387,
"step": 1680
},
{
"epoch": 0.10529595015576323,
"grad_norm": 10.151830562748597,
"learning_rate": 2e-05,
"loss": 0.6224545478820801,
"step": 1690
},
{
"epoch": 0.1059190031152648,
"grad_norm": 1.0474870590574359,
"learning_rate": 2e-05,
"loss": 0.6610437393188476,
"step": 1700
},
{
"epoch": 0.10654205607476636,
"grad_norm": 3.461782785767983,
"learning_rate": 2e-05,
"loss": 0.62818922996521,
"step": 1710
},
{
"epoch": 0.10716510903426792,
"grad_norm": 1.0436258381858183,
"learning_rate": 2e-05,
"loss": 0.6486543178558349,
"step": 1720
},
{
"epoch": 0.10778816199376948,
"grad_norm": 3.870674655703194,
"learning_rate": 2e-05,
"loss": 0.6329143524169922,
"step": 1730
},
{
"epoch": 0.10841121495327102,
"grad_norm": 0.8873679451298351,
"learning_rate": 2e-05,
"loss": 0.6266915798187256,
"step": 1740
},
{
"epoch": 0.10903426791277258,
"grad_norm": 1.934393771485732,
"learning_rate": 2e-05,
"loss": 0.6206174373626709,
"step": 1750
},
{
"epoch": 0.10965732087227414,
"grad_norm": 0.9788497030191609,
"learning_rate": 2e-05,
"loss": 0.617664098739624,
"step": 1760
},
{
"epoch": 0.1102803738317757,
"grad_norm": 1.3294647839474172,
"learning_rate": 2e-05,
"loss": 0.6125317573547363,
"step": 1770
},
{
"epoch": 0.11090342679127727,
"grad_norm": 0.9114337186956374,
"learning_rate": 2e-05,
"loss": 0.6136180877685546,
"step": 1780
},
{
"epoch": 0.11152647975077881,
"grad_norm": 0.9168910070389206,
"learning_rate": 2e-05,
"loss": 0.6254988670349121,
"step": 1790
},
{
"epoch": 0.11214953271028037,
"grad_norm": 1.2163942422286602,
"learning_rate": 2e-05,
"loss": 0.6339495658874512,
"step": 1800
},
{
"epoch": 0.11277258566978193,
"grad_norm": 1.0031026506964655,
"learning_rate": 2e-05,
"loss": 0.6163856506347656,
"step": 1810
},
{
"epoch": 0.1133956386292835,
"grad_norm": 1.4487390671485545,
"learning_rate": 2e-05,
"loss": 0.6172023296356202,
"step": 1820
},
{
"epoch": 0.11401869158878504,
"grad_norm": 0.971335799491775,
"learning_rate": 2e-05,
"loss": 0.603542423248291,
"step": 1830
},
{
"epoch": 0.1146417445482866,
"grad_norm": 1.0645808741308516,
"learning_rate": 2e-05,
"loss": 0.6314529418945313,
"step": 1840
},
{
"epoch": 0.11526479750778816,
"grad_norm": 1.1564622773995759,
"learning_rate": 2e-05,
"loss": 0.6358022212982177,
"step": 1850
},
{
"epoch": 0.11588785046728972,
"grad_norm": 6.250954738770854,
"learning_rate": 2e-05,
"loss": 0.6266725063323975,
"step": 1860
},
{
"epoch": 0.11651090342679128,
"grad_norm": 2.485950620772887,
"learning_rate": 2e-05,
"loss": 0.6347331047058106,
"step": 1870
},
{
"epoch": 0.11713395638629283,
"grad_norm": 1.0491315047430319,
"learning_rate": 2e-05,
"loss": 0.6353681087493896,
"step": 1880
},
{
"epoch": 0.11775700934579439,
"grad_norm": 0.9344118553673864,
"learning_rate": 2e-05,
"loss": 0.6243095397949219,
"step": 1890
},
{
"epoch": 0.11838006230529595,
"grad_norm": 1.166751507604473,
"learning_rate": 2e-05,
"loss": 0.624453353881836,
"step": 1900
},
{
"epoch": 0.11900311526479751,
"grad_norm": 1.1609173008743447,
"learning_rate": 2e-05,
"loss": 0.6156741142272949,
"step": 1910
},
{
"epoch": 0.11962616822429907,
"grad_norm": 1.2650824767917728,
"learning_rate": 2e-05,
"loss": 0.6225091457366944,
"step": 1920
},
{
"epoch": 0.12024922118380062,
"grad_norm": 1.323039674561904,
"learning_rate": 2e-05,
"loss": 0.6126754760742188,
"step": 1930
},
{
"epoch": 0.12087227414330218,
"grad_norm": 10.576149324131405,
"learning_rate": 2e-05,
"loss": 0.6002795219421386,
"step": 1940
},
{
"epoch": 0.12149532710280374,
"grad_norm": 1.1408899621175108,
"learning_rate": 2e-05,
"loss": 0.6268309593200684,
"step": 1950
},
{
"epoch": 0.1221183800623053,
"grad_norm": 1.04557318312074,
"learning_rate": 2e-05,
"loss": 0.6239619255065918,
"step": 1960
},
{
"epoch": 0.12274143302180686,
"grad_norm": 1.2159263913891547,
"learning_rate": 2e-05,
"loss": 0.6297917842864991,
"step": 1970
},
{
"epoch": 0.1233644859813084,
"grad_norm": 2.784941022644952,
"learning_rate": 2e-05,
"loss": 0.6152359008789062,
"step": 1980
},
{
"epoch": 0.12398753894080997,
"grad_norm": 0.9318872113204291,
"learning_rate": 2e-05,
"loss": 0.6123355388641357,
"step": 1990
},
{
"epoch": 0.12461059190031153,
"grad_norm": 1.6289119810248258,
"learning_rate": 2e-05,
"loss": 0.6148693084716796,
"step": 2000
},
{
"epoch": 0.1252336448598131,
"grad_norm": 6.458481915206926,
"learning_rate": 2e-05,
"loss": 0.6158293724060059,
"step": 2010
},
{
"epoch": 0.12585669781931463,
"grad_norm": 1.9163812666195066,
"learning_rate": 2e-05,
"loss": 0.6355224132537842,
"step": 2020
},
{
"epoch": 0.1264797507788162,
"grad_norm": 5.359098164590273,
"learning_rate": 2e-05,
"loss": 0.6285907745361328,
"step": 2030
}
],
"logging_steps": 10,
"max_steps": 5935,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 2035,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 963613493821440.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}