rqadri's picture
Upload folder using huggingface_hub
996373b verified
Raw History Blame Contribute Delete
33.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.10650546919976972,
"eval_steps": 500,
"global_step": 2035,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0005233683990160674,
"grad_norm": 1.1370724439620972,
"learning_rate": 2.910112359550562e-06,
"loss": 0.8003,
"step": 10
},
{
"epoch": 0.0010467367980321349,
"grad_norm": 0.9877656102180481,
"learning_rate": 3.921348314606742e-06,
"loss": 0.7587,
"step": 20
},
{
"epoch": 0.0015701051970482022,
"grad_norm": 0.8628589510917664,
"learning_rate": 4.932584269662922e-06,
"loss": 0.7476,
"step": 30
},
{
"epoch": 0.0020934735960642698,
"grad_norm": 0.7837583422660828,
"learning_rate": 5.943820224719102e-06,
"loss": 0.7334,
"step": 40
},
{
"epoch": 0.002616841995080337,
"grad_norm": 0.7342932224273682,
"learning_rate": 6.955056179775282e-06,
"loss": 0.7397,
"step": 50
},
{
"epoch": 0.0031402103940964044,
"grad_norm": 0.9271304607391357,
"learning_rate": 7.966292134831462e-06,
"loss": 0.7296,
"step": 60
},
{
"epoch": 0.0036635787931124718,
"grad_norm": 0.8066033720970154,
"learning_rate": 8.977528089887641e-06,
"loss": 0.6864,
"step": 70
},
{
"epoch": 0.0041869471921285395,
"grad_norm": 0.8114457726478577,
"learning_rate": 9.988764044943822e-06,
"loss": 0.6792,
"step": 80
},
{
"epoch": 0.004710315591144607,
"grad_norm": 0.8880093097686768,
"learning_rate": 1.1000000000000001e-05,
"loss": 0.7508,
"step": 90
},
{
"epoch": 0.005233683990160674,
"grad_norm": 1.1273611783981323,
"learning_rate": 1.2011235955056182e-05,
"loss": 0.6849,
"step": 100
},
{
"epoch": 0.0057570523891767415,
"grad_norm": 0.7791317701339722,
"learning_rate": 1.3022471910112362e-05,
"loss": 0.698,
"step": 110
},
{
"epoch": 0.006280420788192809,
"grad_norm": 0.8140974044799805,
"learning_rate": 1.403370786516854e-05,
"loss": 0.6947,
"step": 120
},
{
"epoch": 0.006803789187208876,
"grad_norm": 0.8656443357467651,
"learning_rate": 1.504494382022472e-05,
"loss": 0.7158,
"step": 130
},
{
"epoch": 0.0073271575862249435,
"grad_norm": 0.744526743888855,
"learning_rate": 1.60561797752809e-05,
"loss": 0.6701,
"step": 140
},
{
"epoch": 0.00785052598524101,
"grad_norm": 0.7715036273002625,
"learning_rate": 1.706741573033708e-05,
"loss": 0.6794,
"step": 150
},
{
"epoch": 0.008373894384257079,
"grad_norm": 0.7816882729530334,
"learning_rate": 1.8078651685393256e-05,
"loss": 0.7059,
"step": 160
},
{
"epoch": 0.008897262783273146,
"grad_norm": 0.7964625954627991,
"learning_rate": 1.908988764044944e-05,
"loss": 0.6954,
"step": 170
},
{
"epoch": 0.009420631182289214,
"grad_norm": 1.0829215049743652,
"learning_rate": 2e-05,
"loss": 0.6888,
"step": 180
},
{
"epoch": 0.00994399958130528,
"grad_norm": 0.6891264319419861,
"learning_rate": 2e-05,
"loss": 0.6539,
"step": 190
},
{
"epoch": 0.010467367980321348,
"grad_norm": 0.7293897867202759,
"learning_rate": 2e-05,
"loss": 0.7164,
"step": 200
},
{
"epoch": 0.010990736379337415,
"grad_norm": 0.6318921446800232,
"learning_rate": 2e-05,
"loss": 0.7084,
"step": 210
},
{
"epoch": 0.011514104778353483,
"grad_norm": 0.6405470371246338,
"learning_rate": 2e-05,
"loss": 0.6812,
"step": 220
},
{
"epoch": 0.012037473177369551,
"grad_norm": 0.6632219552993774,
"learning_rate": 2e-05,
"loss": 0.6733,
"step": 230
},
{
"epoch": 0.012560841576385618,
"grad_norm": 0.7196585536003113,
"learning_rate": 2e-05,
"loss": 0.6835,
"step": 240
},
{
"epoch": 0.013084209975401686,
"grad_norm": 0.5942214131355286,
"learning_rate": 2e-05,
"loss": 0.6613,
"step": 250
},
{
"epoch": 0.013607578374417752,
"grad_norm": 0.5716996788978577,
"learning_rate": 2e-05,
"loss": 0.6759,
"step": 260
},
{
"epoch": 0.01413094677343382,
"grad_norm": 0.5713549256324768,
"learning_rate": 2e-05,
"loss": 0.7041,
"step": 270
},
{
"epoch": 0.014654315172449887,
"grad_norm": 0.5658433437347412,
"learning_rate": 2e-05,
"loss": 0.6866,
"step": 280
},
{
"epoch": 0.015177683571465955,
"grad_norm": 0.5381125211715698,
"learning_rate": 2e-05,
"loss": 0.7024,
"step": 290
},
{
"epoch": 0.01570105197048202,
"grad_norm": 0.5079479217529297,
"learning_rate": 2e-05,
"loss": 0.686,
"step": 300
},
{
"epoch": 0.016224420369498088,
"grad_norm": 0.5530030727386475,
"learning_rate": 2e-05,
"loss": 0.6912,
"step": 310
},
{
"epoch": 0.016747788768514158,
"grad_norm": 0.5396811962127686,
"learning_rate": 2e-05,
"loss": 0.6751,
"step": 320
},
{
"epoch": 0.017271157167530225,
"grad_norm": 0.4894005060195923,
"learning_rate": 2e-05,
"loss": 0.6649,
"step": 330
},
{
"epoch": 0.01779452556654629,
"grad_norm": 0.5230134129524231,
"learning_rate": 2e-05,
"loss": 0.684,
"step": 340
},
{
"epoch": 0.01831789396556236,
"grad_norm": 0.5332402586936951,
"learning_rate": 2e-05,
"loss": 0.6767,
"step": 350
},
{
"epoch": 0.018841262364578427,
"grad_norm": 0.5048417448997498,
"learning_rate": 2e-05,
"loss": 0.6922,
"step": 360
},
{
"epoch": 0.019364630763594494,
"grad_norm": 0.5345087051391602,
"learning_rate": 2e-05,
"loss": 0.6976,
"step": 370
},
{
"epoch": 0.01988799916261056,
"grad_norm": 0.511880099773407,
"learning_rate": 2e-05,
"loss": 0.6814,
"step": 380
},
{
"epoch": 0.02041136756162663,
"grad_norm": 0.46280574798583984,
"learning_rate": 2e-05,
"loss": 0.6566,
"step": 390
},
{
"epoch": 0.020934735960642697,
"grad_norm": 0.464054137468338,
"learning_rate": 2e-05,
"loss": 0.6483,
"step": 400
},
{
"epoch": 0.021458104359658763,
"grad_norm": 0.5449008941650391,
"learning_rate": 2e-05,
"loss": 0.6841,
"step": 410
},
{
"epoch": 0.02198147275867483,
"grad_norm": 0.5352079272270203,
"learning_rate": 2e-05,
"loss": 0.6604,
"step": 420
},
{
"epoch": 0.0225048411576909,
"grad_norm": 0.5088271498680115,
"learning_rate": 2e-05,
"loss": 0.6683,
"step": 430
},
{
"epoch": 0.023028209556706966,
"grad_norm": 0.5593430399894714,
"learning_rate": 2e-05,
"loss": 0.6795,
"step": 440
},
{
"epoch": 0.023551577955723033,
"grad_norm": 0.507481575012207,
"learning_rate": 2e-05,
"loss": 0.6654,
"step": 450
},
{
"epoch": 0.024074946354739103,
"grad_norm": 0.4815616011619568,
"learning_rate": 2e-05,
"loss": 0.6843,
"step": 460
},
{
"epoch": 0.02459831475375517,
"grad_norm": 0.5703353881835938,
"learning_rate": 2e-05,
"loss": 0.6598,
"step": 470
},
{
"epoch": 0.025121683152771235,
"grad_norm": 0.48705339431762695,
"learning_rate": 2e-05,
"loss": 0.6614,
"step": 480
},
{
"epoch": 0.025645051551787302,
"grad_norm": 0.547533392906189,
"learning_rate": 2e-05,
"loss": 0.6585,
"step": 490
},
{
"epoch": 0.026168419950803372,
"grad_norm": 0.6569129228591919,
"learning_rate": 2e-05,
"loss": 0.6716,
"step": 500
},
{
"epoch": 0.02669178834981944,
"grad_norm": 0.5733374357223511,
"learning_rate": 2e-05,
"loss": 0.6465,
"step": 510
},
{
"epoch": 0.027215156748835505,
"grad_norm": 0.4885842502117157,
"learning_rate": 2e-05,
"loss": 0.682,
"step": 520
},
{
"epoch": 0.02773852514785157,
"grad_norm": 0.42785435914993286,
"learning_rate": 2e-05,
"loss": 0.6594,
"step": 530
},
{
"epoch": 0.02826189354686764,
"grad_norm": 0.4955022931098938,
"learning_rate": 2e-05,
"loss": 0.6674,
"step": 540
},
{
"epoch": 0.028785261945883708,
"grad_norm": 0.48021453619003296,
"learning_rate": 2e-05,
"loss": 0.6796,
"step": 550
},
{
"epoch": 0.029308630344899774,
"grad_norm": 0.4767313301563263,
"learning_rate": 2e-05,
"loss": 0.6865,
"step": 560
},
{
"epoch": 0.029831998743915844,
"grad_norm": 0.5284311771392822,
"learning_rate": 2e-05,
"loss": 0.6489,
"step": 570
},
{
"epoch": 0.03035536714293191,
"grad_norm": 0.4461924731731415,
"learning_rate": 2e-05,
"loss": 0.686,
"step": 580
},
{
"epoch": 0.030878735541947977,
"grad_norm": 0.45115983486175537,
"learning_rate": 2e-05,
"loss": 0.6539,
"step": 590
},
{
"epoch": 0.03140210394096404,
"grad_norm": 0.5064119100570679,
"learning_rate": 2e-05,
"loss": 0.6946,
"step": 600
},
{
"epoch": 0.03192547233998011,
"grad_norm": 0.5319550037384033,
"learning_rate": 2e-05,
"loss": 0.645,
"step": 610
},
{
"epoch": 0.032448840738996176,
"grad_norm": 0.4419703781604767,
"learning_rate": 2e-05,
"loss": 0.7003,
"step": 620
},
{
"epoch": 0.03297220913801225,
"grad_norm": 0.42887452244758606,
"learning_rate": 2e-05,
"loss": 0.6783,
"step": 630
},
{
"epoch": 0.033495577537028316,
"grad_norm": 0.46661144495010376,
"learning_rate": 2e-05,
"loss": 0.6686,
"step": 640
},
{
"epoch": 0.03401894593604438,
"grad_norm": 0.5283986330032349,
"learning_rate": 2e-05,
"loss": 0.6679,
"step": 650
},
{
"epoch": 0.03454231433506045,
"grad_norm": 0.5113454461097717,
"learning_rate": 2e-05,
"loss": 0.6506,
"step": 660
},
{
"epoch": 0.035065682734076516,
"grad_norm": 0.4744948148727417,
"learning_rate": 2e-05,
"loss": 0.6724,
"step": 670
},
{
"epoch": 0.03558905113309258,
"grad_norm": 0.49696066975593567,
"learning_rate": 2e-05,
"loss": 0.6652,
"step": 680
},
{
"epoch": 0.03611241953210865,
"grad_norm": 0.7813011407852173,
"learning_rate": 2e-05,
"loss": 0.6621,
"step": 690
},
{
"epoch": 0.03663578793112472,
"grad_norm": 0.49424248933792114,
"learning_rate": 2e-05,
"loss": 0.6727,
"step": 700
},
{
"epoch": 0.03715915633014079,
"grad_norm": 0.4447154104709625,
"learning_rate": 2e-05,
"loss": 0.6659,
"step": 710
},
{
"epoch": 0.037682524729156855,
"grad_norm": 0.44892066717147827,
"learning_rate": 2e-05,
"loss": 0.6554,
"step": 720
},
{
"epoch": 0.03820589312817292,
"grad_norm": 0.49734535813331604,
"learning_rate": 2e-05,
"loss": 0.6779,
"step": 730
},
{
"epoch": 0.03872926152718899,
"grad_norm": 0.5591990947723389,
"learning_rate": 2e-05,
"loss": 0.6927,
"step": 740
},
{
"epoch": 0.039252629926205054,
"grad_norm": 0.45224255323410034,
"learning_rate": 2e-05,
"loss": 0.6398,
"step": 750
},
{
"epoch": 0.03977599832522112,
"grad_norm": 0.41793182492256165,
"learning_rate": 2e-05,
"loss": 0.6668,
"step": 760
},
{
"epoch": 0.04029936672423719,
"grad_norm": 0.43993815779685974,
"learning_rate": 2e-05,
"loss": 0.6456,
"step": 770
},
{
"epoch": 0.04082273512325326,
"grad_norm": 0.44372230768203735,
"learning_rate": 2e-05,
"loss": 0.6669,
"step": 780
},
{
"epoch": 0.04134610352226933,
"grad_norm": 0.4827944040298462,
"learning_rate": 2e-05,
"loss": 0.657,
"step": 790
},
{
"epoch": 0.041869471921285394,
"grad_norm": 0.4187488257884979,
"learning_rate": 2e-05,
"loss": 0.6456,
"step": 800
},
{
"epoch": 0.04239284032030146,
"grad_norm": 0.47213008999824524,
"learning_rate": 2e-05,
"loss": 0.6555,
"step": 810
},
{
"epoch": 0.042916208719317527,
"grad_norm": 0.43557852506637573,
"learning_rate": 2e-05,
"loss": 0.6545,
"step": 820
},
{
"epoch": 0.04343957711833359,
"grad_norm": 0.45871806144714355,
"learning_rate": 2e-05,
"loss": 0.6538,
"step": 830
},
{
"epoch": 0.04396294551734966,
"grad_norm": 0.46028947830200195,
"learning_rate": 2e-05,
"loss": 0.6356,
"step": 840
},
{
"epoch": 0.04448631391636573,
"grad_norm": 0.548116147518158,
"learning_rate": 2e-05,
"loss": 0.6872,
"step": 850
},
{
"epoch": 0.0450096823153818,
"grad_norm": 0.49427151679992676,
"learning_rate": 2e-05,
"loss": 0.6372,
"step": 860
},
{
"epoch": 0.045533050714397866,
"grad_norm": 0.46103739738464355,
"learning_rate": 2e-05,
"loss": 0.6991,
"step": 870
},
{
"epoch": 0.04605641911341393,
"grad_norm": 0.4400480091571808,
"learning_rate": 2e-05,
"loss": 0.667,
"step": 880
},
{
"epoch": 0.04657978751243,
"grad_norm": 0.45002153515815735,
"learning_rate": 2e-05,
"loss": 0.6582,
"step": 890
},
{
"epoch": 0.047103155911446065,
"grad_norm": 0.44472604990005493,
"learning_rate": 2e-05,
"loss": 0.6706,
"step": 900
},
{
"epoch": 0.04762652431046213,
"grad_norm": 0.4121211767196655,
"learning_rate": 2e-05,
"loss": 0.6602,
"step": 910
},
{
"epoch": 0.048149892709478205,
"grad_norm": 0.5010108351707458,
"learning_rate": 2e-05,
"loss": 0.6761,
"step": 920
},
{
"epoch": 0.04867326110849427,
"grad_norm": 0.45920342206954956,
"learning_rate": 2e-05,
"loss": 0.6671,
"step": 930
},
{
"epoch": 0.04919662950751034,
"grad_norm": 0.5177173018455505,
"learning_rate": 2e-05,
"loss": 0.652,
"step": 940
},
{
"epoch": 0.049719997906526404,
"grad_norm": 0.49086499214172363,
"learning_rate": 2e-05,
"loss": 0.6795,
"step": 950
},
{
"epoch": 0.05024336630554247,
"grad_norm": 0.582841157913208,
"learning_rate": 2e-05,
"loss": 0.6376,
"step": 960
},
{
"epoch": 0.05076673470455854,
"grad_norm": 0.4690440595149994,
"learning_rate": 2e-05,
"loss": 0.6465,
"step": 970
},
{
"epoch": 0.051290103103574604,
"grad_norm": 0.45363402366638184,
"learning_rate": 2e-05,
"loss": 0.6511,
"step": 980
},
{
"epoch": 0.05181347150259067,
"grad_norm": 0.43920376896858215,
"learning_rate": 2e-05,
"loss": 0.6943,
"step": 990
},
{
"epoch": 0.052336839901606744,
"grad_norm": 0.421144038438797,
"learning_rate": 2e-05,
"loss": 0.6434,
"step": 1000
},
{
"epoch": 0.05286020830062281,
"grad_norm": 0.45188188552856445,
"learning_rate": 2e-05,
"loss": 0.6467,
"step": 1010
},
{
"epoch": 0.05338357669963888,
"grad_norm": 0.4339853823184967,
"learning_rate": 2e-05,
"loss": 0.6596,
"step": 1020
},
{
"epoch": 0.05390694509865494,
"grad_norm": 0.4234607517719269,
"learning_rate": 2e-05,
"loss": 0.674,
"step": 1030
},
{
"epoch": 0.05443031349767101,
"grad_norm": 0.46552717685699463,
"learning_rate": 2e-05,
"loss": 0.6649,
"step": 1040
},
{
"epoch": 0.054953681896687076,
"grad_norm": 0.4405843913555145,
"learning_rate": 2e-05,
"loss": 0.6577,
"step": 1050
},
{
"epoch": 0.05547705029570314,
"grad_norm": 0.5044958591461182,
"learning_rate": 2e-05,
"loss": 0.6152,
"step": 1060
},
{
"epoch": 0.056000418694719216,
"grad_norm": 0.43265852332115173,
"learning_rate": 2e-05,
"loss": 0.6317,
"step": 1070
},
{
"epoch": 0.05652378709373528,
"grad_norm": 0.41526952385902405,
"learning_rate": 2e-05,
"loss": 0.6501,
"step": 1080
},
{
"epoch": 0.05704715549275135,
"grad_norm": 0.43947693705558777,
"learning_rate": 2e-05,
"loss": 0.6542,
"step": 1090
},
{
"epoch": 0.057570523891767415,
"grad_norm": 0.4375130534172058,
"learning_rate": 2e-05,
"loss": 0.671,
"step": 1100
},
{
"epoch": 0.05809389229078348,
"grad_norm": 0.4554004371166229,
"learning_rate": 2e-05,
"loss": 0.6507,
"step": 1110
},
{
"epoch": 0.05861726068979955,
"grad_norm": 0.5064834356307983,
"learning_rate": 2e-05,
"loss": 0.6467,
"step": 1120
},
{
"epoch": 0.059140629088815615,
"grad_norm": 0.446809321641922,
"learning_rate": 2e-05,
"loss": 0.6751,
"step": 1130
},
{
"epoch": 0.05966399748783169,
"grad_norm": 0.4745899736881256,
"learning_rate": 2e-05,
"loss": 0.6564,
"step": 1140
},
{
"epoch": 0.060187365886847755,
"grad_norm": 0.5119066834449768,
"learning_rate": 2e-05,
"loss": 0.6618,
"step": 1150
},
{
"epoch": 0.06071073428586382,
"grad_norm": 0.41898113489151,
"learning_rate": 2e-05,
"loss": 0.6622,
"step": 1160
},
{
"epoch": 0.06123410268487989,
"grad_norm": 0.6409226059913635,
"learning_rate": 2e-05,
"loss": 0.6708,
"step": 1170
},
{
"epoch": 0.061757471083895954,
"grad_norm": 0.439377099275589,
"learning_rate": 2e-05,
"loss": 0.6473,
"step": 1180
},
{
"epoch": 0.06228083948291202,
"grad_norm": 0.4160749316215515,
"learning_rate": 2e-05,
"loss": 0.6798,
"step": 1190
},
{
"epoch": 0.06280420788192809,
"grad_norm": 0.5204553604125977,
"learning_rate": 2e-05,
"loss": 0.6866,
"step": 1200
},
{
"epoch": 0.06332757628094415,
"grad_norm": 0.48897305130958557,
"learning_rate": 2e-05,
"loss": 0.6618,
"step": 1210
},
{
"epoch": 0.06385094467996022,
"grad_norm": 0.45014750957489014,
"learning_rate": 2e-05,
"loss": 0.6647,
"step": 1220
},
{
"epoch": 0.06437431307897629,
"grad_norm": 0.4595189690589905,
"learning_rate": 2e-05,
"loss": 0.6625,
"step": 1230
},
{
"epoch": 0.06489768147799235,
"grad_norm": 0.49671754240989685,
"learning_rate": 2e-05,
"loss": 0.663,
"step": 1240
},
{
"epoch": 0.06542104987700843,
"grad_norm": 0.44070637226104736,
"learning_rate": 2e-05,
"loss": 0.6613,
"step": 1250
},
{
"epoch": 0.0659444182760245,
"grad_norm": 0.45897576212882996,
"learning_rate": 2e-05,
"loss": 0.6516,
"step": 1260
},
{
"epoch": 0.06646778667504057,
"grad_norm": 0.4450547695159912,
"learning_rate": 2e-05,
"loss": 0.641,
"step": 1270
},
{
"epoch": 0.06699115507405663,
"grad_norm": 0.4288750886917114,
"learning_rate": 2e-05,
"loss": 0.6656,
"step": 1280
},
{
"epoch": 0.0675145234730727,
"grad_norm": 0.47525206208229065,
"learning_rate": 2e-05,
"loss": 0.6915,
"step": 1290
},
{
"epoch": 0.06803789187208877,
"grad_norm": 0.41285258531570435,
"learning_rate": 2e-05,
"loss": 0.6401,
"step": 1300
},
{
"epoch": 0.06856126027110483,
"grad_norm": 0.46445295214653015,
"learning_rate": 2e-05,
"loss": 0.6692,
"step": 1310
},
{
"epoch": 0.0690846286701209,
"grad_norm": 0.44153061509132385,
"learning_rate": 2e-05,
"loss": 0.6291,
"step": 1320
},
{
"epoch": 0.06960799706913696,
"grad_norm": 0.7016943693161011,
"learning_rate": 2e-05,
"loss": 0.6405,
"step": 1330
},
{
"epoch": 0.07013136546815303,
"grad_norm": 0.498710572719574,
"learning_rate": 2e-05,
"loss": 0.6433,
"step": 1340
},
{
"epoch": 0.0706547338671691,
"grad_norm": 0.4415338337421417,
"learning_rate": 2e-05,
"loss": 0.673,
"step": 1350
},
{
"epoch": 0.07117810226618516,
"grad_norm": 0.5377183556556702,
"learning_rate": 2e-05,
"loss": 0.6556,
"step": 1360
},
{
"epoch": 0.07170147066520123,
"grad_norm": 0.40461525321006775,
"learning_rate": 2e-05,
"loss": 0.6384,
"step": 1370
},
{
"epoch": 0.0722248390642173,
"grad_norm": 0.4240797758102417,
"learning_rate": 2e-05,
"loss": 0.6467,
"step": 1380
},
{
"epoch": 0.07274820746323336,
"grad_norm": 0.4052056074142456,
"learning_rate": 2e-05,
"loss": 0.6448,
"step": 1390
},
{
"epoch": 0.07327157586224944,
"grad_norm": 0.41825127601623535,
"learning_rate": 2e-05,
"loss": 0.6465,
"step": 1400
},
{
"epoch": 0.07379494426126551,
"grad_norm": 0.41024652123451233,
"learning_rate": 2e-05,
"loss": 0.6428,
"step": 1410
},
{
"epoch": 0.07431831266028158,
"grad_norm": 0.38469892740249634,
"learning_rate": 2e-05,
"loss": 0.6652,
"step": 1420
},
{
"epoch": 0.07484168105929764,
"grad_norm": 0.4639175236225128,
"learning_rate": 2e-05,
"loss": 0.6503,
"step": 1430
},
{
"epoch": 0.07536504945831371,
"grad_norm": 0.4508153200149536,
"learning_rate": 2e-05,
"loss": 0.6464,
"step": 1440
},
{
"epoch": 0.07588841785732978,
"grad_norm": 0.5173973441123962,
"learning_rate": 2e-05,
"loss": 0.6475,
"step": 1450
},
{
"epoch": 0.07641178625634584,
"grad_norm": 0.47181883454322815,
"learning_rate": 2e-05,
"loss": 0.6662,
"step": 1460
},
{
"epoch": 0.07693515465536191,
"grad_norm": 0.43690988421440125,
"learning_rate": 2e-05,
"loss": 0.6459,
"step": 1470
},
{
"epoch": 0.07745852305437798,
"grad_norm": 0.40047961473464966,
"learning_rate": 2e-05,
"loss": 0.6808,
"step": 1480
},
{
"epoch": 0.07798189145339404,
"grad_norm": 0.3962308466434479,
"learning_rate": 2e-05,
"loss": 0.6249,
"step": 1490
},
{
"epoch": 0.07850525985241011,
"grad_norm": 0.5075916051864624,
"learning_rate": 2e-05,
"loss": 0.6562,
"step": 1500
},
{
"epoch": 0.07902862825142618,
"grad_norm": 0.44439756870269775,
"learning_rate": 2e-05,
"loss": 0.6744,
"step": 1510
},
{
"epoch": 0.07955199665044224,
"grad_norm": 0.4172062575817108,
"learning_rate": 2e-05,
"loss": 0.6328,
"step": 1520
},
{
"epoch": 0.08007536504945831,
"grad_norm": 0.9272112250328064,
"learning_rate": 2e-05,
"loss": 0.6554,
"step": 1530
},
{
"epoch": 0.08059873344847437,
"grad_norm": 0.44365498423576355,
"learning_rate": 2e-05,
"loss": 0.6567,
"step": 1540
},
{
"epoch": 0.08112210184749045,
"grad_norm": 0.5808505415916443,
"learning_rate": 2e-05,
"loss": 0.6671,
"step": 1550
},
{
"epoch": 0.08164547024650652,
"grad_norm": 0.4238007068634033,
"learning_rate": 2e-05,
"loss": 0.6655,
"step": 1560
},
{
"epoch": 0.08216883864552259,
"grad_norm": 0.4158059358596802,
"learning_rate": 2e-05,
"loss": 0.6502,
"step": 1570
},
{
"epoch": 0.08269220704453865,
"grad_norm": 0.4266833961009979,
"learning_rate": 2e-05,
"loss": 0.6389,
"step": 1580
},
{
"epoch": 0.08321557544355472,
"grad_norm": 0.4183817505836487,
"learning_rate": 2e-05,
"loss": 0.6297,
"step": 1590
},
{
"epoch": 0.08373894384257079,
"grad_norm": 0.4242572784423828,
"learning_rate": 2e-05,
"loss": 0.6575,
"step": 1600
},
{
"epoch": 0.08426231224158685,
"grad_norm": 0.42805418372154236,
"learning_rate": 2e-05,
"loss": 0.6316,
"step": 1610
},
{
"epoch": 0.08478568064060292,
"grad_norm": 0.441866010427475,
"learning_rate": 2e-05,
"loss": 0.6702,
"step": 1620
},
{
"epoch": 0.08530904903961899,
"grad_norm": 0.4371151626110077,
"learning_rate": 2e-05,
"loss": 0.6623,
"step": 1630
},
{
"epoch": 0.08583241743863505,
"grad_norm": 0.43131211400032043,
"learning_rate": 2e-05,
"loss": 0.6448,
"step": 1640
},
{
"epoch": 0.08635578583765112,
"grad_norm": 0.4316512644290924,
"learning_rate": 2e-05,
"loss": 0.6374,
"step": 1650
},
{
"epoch": 0.08687915423666719,
"grad_norm": 0.48419904708862305,
"learning_rate": 2e-05,
"loss": 0.6224,
"step": 1660
},
{
"epoch": 0.08740252263568325,
"grad_norm": 0.3933804929256439,
"learning_rate": 2e-05,
"loss": 0.6522,
"step": 1670
},
{
"epoch": 0.08792589103469932,
"grad_norm": 0.4437639117240906,
"learning_rate": 2e-05,
"loss": 0.6237,
"step": 1680
},
{
"epoch": 0.08844925943371539,
"grad_norm": 0.4899040460586548,
"learning_rate": 2e-05,
"loss": 0.6321,
"step": 1690
},
{
"epoch": 0.08897262783273147,
"grad_norm": 0.4382249712944031,
"learning_rate": 2e-05,
"loss": 0.6469,
"step": 1700
},
{
"epoch": 0.08949599623174753,
"grad_norm": 0.4095931053161621,
"learning_rate": 2e-05,
"loss": 0.6588,
"step": 1710
},
{
"epoch": 0.0900193646307636,
"grad_norm": 0.43513184785842896,
"learning_rate": 2e-05,
"loss": 0.6569,
"step": 1720
},
{
"epoch": 0.09054273302977967,
"grad_norm": 0.46793821454048157,
"learning_rate": 2e-05,
"loss": 0.6322,
"step": 1730
},
{
"epoch": 0.09106610142879573,
"grad_norm": 0.430164098739624,
"learning_rate": 2e-05,
"loss": 0.6224,
"step": 1740
},
{
"epoch": 0.0915894698278118,
"grad_norm": 0.3761891722679138,
"learning_rate": 2e-05,
"loss": 0.606,
"step": 1750
},
{
"epoch": 0.09211283822682786,
"grad_norm": 0.373146116733551,
"learning_rate": 2e-05,
"loss": 0.6329,
"step": 1760
},
{
"epoch": 0.09263620662584393,
"grad_norm": 0.42644017934799194,
"learning_rate": 2e-05,
"loss": 0.6466,
"step": 1770
},
{
"epoch": 0.09315957502486,
"grad_norm": 0.40171223878860474,
"learning_rate": 2e-05,
"loss": 0.6567,
"step": 1780
},
{
"epoch": 0.09368294342387606,
"grad_norm": 0.5002732872962952,
"learning_rate": 2e-05,
"loss": 0.6645,
"step": 1790
},
{
"epoch": 0.09420631182289213,
"grad_norm": 0.45148345828056335,
"learning_rate": 2e-05,
"loss": 0.6735,
"step": 1800
},
{
"epoch": 0.0947296802219082,
"grad_norm": 0.4408950209617615,
"learning_rate": 2e-05,
"loss": 0.64,
"step": 1810
},
{
"epoch": 0.09525304862092426,
"grad_norm": 0.41224032640457153,
"learning_rate": 2e-05,
"loss": 0.6483,
"step": 1820
},
{
"epoch": 0.09577641701994033,
"grad_norm": 0.3857000768184662,
"learning_rate": 2e-05,
"loss": 0.6591,
"step": 1830
},
{
"epoch": 0.09629978541895641,
"grad_norm": 0.5142344832420349,
"learning_rate": 2e-05,
"loss": 0.6613,
"step": 1840
},
{
"epoch": 0.09682315381797248,
"grad_norm": 0.43707653880119324,
"learning_rate": 2e-05,
"loss": 0.6463,
"step": 1850
},
{
"epoch": 0.09734652221698854,
"grad_norm": 0.5951546430587769,
"learning_rate": 2e-05,
"loss": 0.6634,
"step": 1860
},
{
"epoch": 0.09786989061600461,
"grad_norm": 0.451498419046402,
"learning_rate": 2e-05,
"loss": 0.6228,
"step": 1870
},
{
"epoch": 0.09839325901502068,
"grad_norm": 0.43872302770614624,
"learning_rate": 2e-05,
"loss": 0.6417,
"step": 1880
},
{
"epoch": 0.09891662741403674,
"grad_norm": 0.3905869722366333,
"learning_rate": 2e-05,
"loss": 0.6195,
"step": 1890
},
{
"epoch": 0.09943999581305281,
"grad_norm": 0.46226704120635986,
"learning_rate": 2e-05,
"loss": 0.652,
"step": 1900
},
{
"epoch": 0.09996336421206888,
"grad_norm": 0.4350249469280243,
"learning_rate": 2e-05,
"loss": 0.6814,
"step": 1910
},
{
"epoch": 0.10048673261108494,
"grad_norm": 0.547003448009491,
"learning_rate": 2e-05,
"loss": 0.6376,
"step": 1920
},
{
"epoch": 0.10101010101010101,
"grad_norm": 0.40520697832107544,
"learning_rate": 2e-05,
"loss": 0.6281,
"step": 1930
},
{
"epoch": 0.10153346940911707,
"grad_norm": 0.3886966109275818,
"learning_rate": 2e-05,
"loss": 0.6349,
"step": 1940
},
{
"epoch": 0.10205683780813314,
"grad_norm": 0.4416722059249878,
"learning_rate": 2e-05,
"loss": 0.6626,
"step": 1950
},
{
"epoch": 0.10258020620714921,
"grad_norm": 0.4272310137748718,
"learning_rate": 2e-05,
"loss": 0.627,
"step": 1960
},
{
"epoch": 0.10310357460616527,
"grad_norm": 0.4342178404331207,
"learning_rate": 2e-05,
"loss": 0.6616,
"step": 1970
},
{
"epoch": 0.10362694300518134,
"grad_norm": 0.4413588047027588,
"learning_rate": 2e-05,
"loss": 0.6602,
"step": 1980
},
{
"epoch": 0.10415031140419742,
"grad_norm": 0.39807382225990295,
"learning_rate": 2e-05,
"loss": 0.6184,
"step": 1990
},
{
"epoch": 0.10467367980321349,
"grad_norm": 0.39922189712524414,
"learning_rate": 2e-05,
"loss": 0.6348,
"step": 2000
},
{
"epoch": 0.10519704820222955,
"grad_norm": 0.4405508041381836,
"learning_rate": 2e-05,
"loss": 0.6527,
"step": 2010
},
{
"epoch": 0.10572041660124562,
"grad_norm": 0.4154644310474396,
"learning_rate": 2e-05,
"loss": 0.6383,
"step": 2020
},
{
"epoch": 0.10624378500026169,
"grad_norm": 0.4121659994125366,
"learning_rate": 2e-05,
"loss": 0.6337,
"step": 2030
}
],
"logging_steps": 10,
"max_steps": 5935,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 2035,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.084295122442519e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}