rqadri's picture
Upload folder using huggingface_hub
726b324 verified
Raw History Blame Contribute Delete
33.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.08691752445222739,
"eval_steps": 500,
"global_step": 2035,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00042711314227138767,
"grad_norm": 0.6801537275314331,
"learning_rate": 2.910112359550562e-06,
"loss": 0.6308,
"step": 10
},
{
"epoch": 0.0008542262845427753,
"grad_norm": 0.7330222725868225,
"learning_rate": 3.921348314606742e-06,
"loss": 0.5921,
"step": 20
},
{
"epoch": 0.001281339426814163,
"grad_norm": 0.7190220952033997,
"learning_rate": 4.932584269662922e-06,
"loss": 0.6197,
"step": 30
},
{
"epoch": 0.0017084525690855507,
"grad_norm": 0.6695777773857117,
"learning_rate": 5.943820224719102e-06,
"loss": 0.6225,
"step": 40
},
{
"epoch": 0.0021355657113569385,
"grad_norm": 0.7244643568992615,
"learning_rate": 6.955056179775282e-06,
"loss": 0.5868,
"step": 50
},
{
"epoch": 0.002562678853628326,
"grad_norm": 0.7338688373565674,
"learning_rate": 7.966292134831462e-06,
"loss": 0.602,
"step": 60
},
{
"epoch": 0.0029897919958997137,
"grad_norm": 0.7063023447990417,
"learning_rate": 8.977528089887641e-06,
"loss": 0.5962,
"step": 70
},
{
"epoch": 0.0034169051381711013,
"grad_norm": 0.7280859351158142,
"learning_rate": 9.988764044943822e-06,
"loss": 0.5849,
"step": 80
},
{
"epoch": 0.0038440182804424894,
"grad_norm": 0.6686920523643494,
"learning_rate": 1.1000000000000001e-05,
"loss": 0.5945,
"step": 90
},
{
"epoch": 0.004271131422713877,
"grad_norm": 0.6424954533576965,
"learning_rate": 1.2011235955056182e-05,
"loss": 0.5742,
"step": 100
},
{
"epoch": 0.004698244564985265,
"grad_norm": 0.7504611015319824,
"learning_rate": 1.3022471910112362e-05,
"loss": 0.6183,
"step": 110
},
{
"epoch": 0.005125357707256652,
"grad_norm": 0.7265036106109619,
"learning_rate": 1.403370786516854e-05,
"loss": 0.6288,
"step": 120
},
{
"epoch": 0.00555247084952804,
"grad_norm": 0.6728747487068176,
"learning_rate": 1.504494382022472e-05,
"loss": 0.5932,
"step": 130
},
{
"epoch": 0.005979583991799427,
"grad_norm": 0.5877931118011475,
"learning_rate": 1.60561797752809e-05,
"loss": 0.6073,
"step": 140
},
{
"epoch": 0.0064066971340708155,
"grad_norm": 0.9119960069656372,
"learning_rate": 1.706741573033708e-05,
"loss": 0.594,
"step": 150
},
{
"epoch": 0.006833810276342203,
"grad_norm": 0.6038461327552795,
"learning_rate": 1.8078651685393256e-05,
"loss": 0.6186,
"step": 160
},
{
"epoch": 0.007260923418613591,
"grad_norm": 0.6067227125167847,
"learning_rate": 1.908988764044944e-05,
"loss": 0.608,
"step": 170
},
{
"epoch": 0.007688036560884979,
"grad_norm": 0.6028957962989807,
"learning_rate": 2e-05,
"loss": 0.5816,
"step": 180
},
{
"epoch": 0.008115149703156367,
"grad_norm": 0.5894806385040283,
"learning_rate": 2e-05,
"loss": 0.604,
"step": 190
},
{
"epoch": 0.008542262845427754,
"grad_norm": 0.5551896691322327,
"learning_rate": 2e-05,
"loss": 0.6181,
"step": 200
},
{
"epoch": 0.008969375987699141,
"grad_norm": 0.48914626240730286,
"learning_rate": 2e-05,
"loss": 0.6003,
"step": 210
},
{
"epoch": 0.00939648912997053,
"grad_norm": 0.5296058058738708,
"learning_rate": 2e-05,
"loss": 0.6201,
"step": 220
},
{
"epoch": 0.009823602272241917,
"grad_norm": 0.7409117221832275,
"learning_rate": 2e-05,
"loss": 0.5938,
"step": 230
},
{
"epoch": 0.010250715414513304,
"grad_norm": 0.5655877590179443,
"learning_rate": 2e-05,
"loss": 0.5714,
"step": 240
},
{
"epoch": 0.010677828556784692,
"grad_norm": 0.4660634696483612,
"learning_rate": 2e-05,
"loss": 0.5736,
"step": 250
},
{
"epoch": 0.01110494169905608,
"grad_norm": 0.437298059463501,
"learning_rate": 2e-05,
"loss": 0.5944,
"step": 260
},
{
"epoch": 0.011532054841327468,
"grad_norm": 0.7993448376655579,
"learning_rate": 2e-05,
"loss": 0.5918,
"step": 270
},
{
"epoch": 0.011959167983598855,
"grad_norm": 0.46986427903175354,
"learning_rate": 2e-05,
"loss": 0.6001,
"step": 280
},
{
"epoch": 0.012386281125870244,
"grad_norm": 0.4165823459625244,
"learning_rate": 2e-05,
"loss": 0.5817,
"step": 290
},
{
"epoch": 0.012813394268141631,
"grad_norm": 0.4695897102355957,
"learning_rate": 2e-05,
"loss": 0.5949,
"step": 300
},
{
"epoch": 0.013240507410413018,
"grad_norm": 0.46940892934799194,
"learning_rate": 2e-05,
"loss": 0.6293,
"step": 310
},
{
"epoch": 0.013667620552684405,
"grad_norm": 0.37120378017425537,
"learning_rate": 2e-05,
"loss": 0.6057,
"step": 320
},
{
"epoch": 0.014094733694955794,
"grad_norm": 0.4567081928253174,
"learning_rate": 2e-05,
"loss": 0.6088,
"step": 330
},
{
"epoch": 0.014521846837227181,
"grad_norm": 0.5053907036781311,
"learning_rate": 2e-05,
"loss": 0.575,
"step": 340
},
{
"epoch": 0.014948959979498569,
"grad_norm": 0.4822077453136444,
"learning_rate": 2e-05,
"loss": 0.6305,
"step": 350
},
{
"epoch": 0.015376073121769957,
"grad_norm": 0.42418718338012695,
"learning_rate": 2e-05,
"loss": 0.609,
"step": 360
},
{
"epoch": 0.015803186264041345,
"grad_norm": 0.4470791816711426,
"learning_rate": 2e-05,
"loss": 0.609,
"step": 370
},
{
"epoch": 0.016230299406312734,
"grad_norm": 0.4747907221317291,
"learning_rate": 2e-05,
"loss": 0.5753,
"step": 380
},
{
"epoch": 0.01665741254858412,
"grad_norm": 0.429513156414032,
"learning_rate": 2e-05,
"loss": 0.5757,
"step": 390
},
{
"epoch": 0.017084525690855508,
"grad_norm": 1.1115094423294067,
"learning_rate": 2e-05,
"loss": 0.5973,
"step": 400
},
{
"epoch": 0.017511638833126897,
"grad_norm": 0.4465528130531311,
"learning_rate": 2e-05,
"loss": 0.6135,
"step": 410
},
{
"epoch": 0.017938751975398282,
"grad_norm": 0.45542335510253906,
"learning_rate": 2e-05,
"loss": 0.5925,
"step": 420
},
{
"epoch": 0.01836586511766967,
"grad_norm": 0.4971701204776764,
"learning_rate": 2e-05,
"loss": 0.6015,
"step": 430
},
{
"epoch": 0.01879297825994106,
"grad_norm": 0.4876435101032257,
"learning_rate": 2e-05,
"loss": 0.612,
"step": 440
},
{
"epoch": 0.019220091402212446,
"grad_norm": 0.4507445693016052,
"learning_rate": 2e-05,
"loss": 0.6096,
"step": 450
},
{
"epoch": 0.019647204544483834,
"grad_norm": 0.48777464032173157,
"learning_rate": 2e-05,
"loss": 0.5804,
"step": 460
},
{
"epoch": 0.02007431768675522,
"grad_norm": 0.42354583740234375,
"learning_rate": 2e-05,
"loss": 0.6102,
"step": 470
},
{
"epoch": 0.02050143082902661,
"grad_norm": 0.4695739448070526,
"learning_rate": 2e-05,
"loss": 0.6343,
"step": 480
},
{
"epoch": 0.020928543971297998,
"grad_norm": 0.4769243896007538,
"learning_rate": 2e-05,
"loss": 0.5989,
"step": 490
},
{
"epoch": 0.021355657113569383,
"grad_norm": 0.44087329506874084,
"learning_rate": 2e-05,
"loss": 0.5978,
"step": 500
},
{
"epoch": 0.021782770255840772,
"grad_norm": 0.42501866817474365,
"learning_rate": 2e-05,
"loss": 0.6133,
"step": 510
},
{
"epoch": 0.02220988339811216,
"grad_norm": 0.38661816716194153,
"learning_rate": 2e-05,
"loss": 0.6056,
"step": 520
},
{
"epoch": 0.022636996540383546,
"grad_norm": 0.43126940727233887,
"learning_rate": 2e-05,
"loss": 0.5679,
"step": 530
},
{
"epoch": 0.023064109682654935,
"grad_norm": 0.433454304933548,
"learning_rate": 2e-05,
"loss": 0.6074,
"step": 540
},
{
"epoch": 0.023491222824926324,
"grad_norm": 0.3950791656970978,
"learning_rate": 2e-05,
"loss": 0.6267,
"step": 550
},
{
"epoch": 0.02391833596719771,
"grad_norm": 0.42388349771499634,
"learning_rate": 2e-05,
"loss": 0.6457,
"step": 560
},
{
"epoch": 0.0243454491094691,
"grad_norm": 0.4391220510005951,
"learning_rate": 2e-05,
"loss": 0.6222,
"step": 570
},
{
"epoch": 0.024772562251740488,
"grad_norm": 0.4486788213253021,
"learning_rate": 2e-05,
"loss": 0.6232,
"step": 580
},
{
"epoch": 0.025199675394011873,
"grad_norm": 0.5258558988571167,
"learning_rate": 2e-05,
"loss": 0.6157,
"step": 590
},
{
"epoch": 0.025626788536283262,
"grad_norm": 0.3985844552516937,
"learning_rate": 2e-05,
"loss": 0.5623,
"step": 600
},
{
"epoch": 0.02605390167855465,
"grad_norm": 0.4276188910007477,
"learning_rate": 2e-05,
"loss": 0.589,
"step": 610
},
{
"epoch": 0.026481014820826036,
"grad_norm": 0.36040425300598145,
"learning_rate": 2e-05,
"loss": 0.5889,
"step": 620
},
{
"epoch": 0.026908127963097425,
"grad_norm": 0.43689343333244324,
"learning_rate": 2e-05,
"loss": 0.586,
"step": 630
},
{
"epoch": 0.02733524110536881,
"grad_norm": 0.38051506876945496,
"learning_rate": 2e-05,
"loss": 0.6155,
"step": 640
},
{
"epoch": 0.0277623542476402,
"grad_norm": 0.375367134809494,
"learning_rate": 2e-05,
"loss": 0.6267,
"step": 650
},
{
"epoch": 0.02818946738991159,
"grad_norm": 0.40035131573677063,
"learning_rate": 2e-05,
"loss": 0.6035,
"step": 660
},
{
"epoch": 0.028616580532182974,
"grad_norm": 0.429284006357193,
"learning_rate": 2e-05,
"loss": 0.5957,
"step": 670
},
{
"epoch": 0.029043693674454363,
"grad_norm": 0.4076769948005676,
"learning_rate": 2e-05,
"loss": 0.599,
"step": 680
},
{
"epoch": 0.02947080681672575,
"grad_norm": 0.39563876390457153,
"learning_rate": 2e-05,
"loss": 0.5906,
"step": 690
},
{
"epoch": 0.029897919958997137,
"grad_norm": 0.39621901512145996,
"learning_rate": 2e-05,
"loss": 0.615,
"step": 700
},
{
"epoch": 0.030325033101268526,
"grad_norm": 0.43017053604125977,
"learning_rate": 2e-05,
"loss": 0.6114,
"step": 710
},
{
"epoch": 0.030752146243539915,
"grad_norm": 0.3699895143508911,
"learning_rate": 2e-05,
"loss": 0.6024,
"step": 720
},
{
"epoch": 0.0311792593858113,
"grad_norm": 0.39387860894203186,
"learning_rate": 2e-05,
"loss": 0.5797,
"step": 730
},
{
"epoch": 0.03160637252808269,
"grad_norm": 0.36330047249794006,
"learning_rate": 2e-05,
"loss": 0.5641,
"step": 740
},
{
"epoch": 0.03203348567035408,
"grad_norm": 0.3734346628189087,
"learning_rate": 2e-05,
"loss": 0.6066,
"step": 750
},
{
"epoch": 0.03246059881262547,
"grad_norm": 0.3981451690196991,
"learning_rate": 2e-05,
"loss": 0.5708,
"step": 760
},
{
"epoch": 0.03288771195489685,
"grad_norm": 0.5013331770896912,
"learning_rate": 2e-05,
"loss": 0.5786,
"step": 770
},
{
"epoch": 0.03331482509716824,
"grad_norm": 0.4515092968940735,
"learning_rate": 2e-05,
"loss": 0.6274,
"step": 780
},
{
"epoch": 0.03374193823943963,
"grad_norm": 0.4270780682563782,
"learning_rate": 2e-05,
"loss": 0.6274,
"step": 790
},
{
"epoch": 0.034169051381711016,
"grad_norm": 0.40977057814598083,
"learning_rate": 2e-05,
"loss": 0.5903,
"step": 800
},
{
"epoch": 0.034596164523982405,
"grad_norm": 0.3862808644771576,
"learning_rate": 2e-05,
"loss": 0.591,
"step": 810
},
{
"epoch": 0.035023277666253794,
"grad_norm": 0.3566862642765045,
"learning_rate": 2e-05,
"loss": 0.5822,
"step": 820
},
{
"epoch": 0.035450390808525176,
"grad_norm": 0.47487324476242065,
"learning_rate": 2e-05,
"loss": 0.6037,
"step": 830
},
{
"epoch": 0.035877503950796565,
"grad_norm": 0.6204171180725098,
"learning_rate": 2e-05,
"loss": 0.606,
"step": 840
},
{
"epoch": 0.036304617093067953,
"grad_norm": 0.38122642040252686,
"learning_rate": 2e-05,
"loss": 0.6022,
"step": 850
},
{
"epoch": 0.03673173023533934,
"grad_norm": 0.45812979340553284,
"learning_rate": 2e-05,
"loss": 0.6134,
"step": 860
},
{
"epoch": 0.03715884337761073,
"grad_norm": 0.38281163573265076,
"learning_rate": 2e-05,
"loss": 0.5692,
"step": 870
},
{
"epoch": 0.03758595651988212,
"grad_norm": 0.44842684268951416,
"learning_rate": 2e-05,
"loss": 0.6195,
"step": 880
},
{
"epoch": 0.0380130696621535,
"grad_norm": 0.3978036642074585,
"learning_rate": 2e-05,
"loss": 0.5872,
"step": 890
},
{
"epoch": 0.03844018280442489,
"grad_norm": 0.40599605441093445,
"learning_rate": 2e-05,
"loss": 0.5896,
"step": 900
},
{
"epoch": 0.03886729594669628,
"grad_norm": 0.4849986732006073,
"learning_rate": 2e-05,
"loss": 0.5679,
"step": 910
},
{
"epoch": 0.03929440908896767,
"grad_norm": 0.3729165196418762,
"learning_rate": 2e-05,
"loss": 0.5941,
"step": 920
},
{
"epoch": 0.03972152223123906,
"grad_norm": 0.3839932680130005,
"learning_rate": 2e-05,
"loss": 0.5809,
"step": 930
},
{
"epoch": 0.04014863537351044,
"grad_norm": 0.3133138120174408,
"learning_rate": 2e-05,
"loss": 0.5909,
"step": 940
},
{
"epoch": 0.04057574851578183,
"grad_norm": 0.37946876883506775,
"learning_rate": 2e-05,
"loss": 0.5791,
"step": 950
},
{
"epoch": 0.04100286165805322,
"grad_norm": 0.3639635741710663,
"learning_rate": 2e-05,
"loss": 0.6028,
"step": 960
},
{
"epoch": 0.04142997480032461,
"grad_norm": 0.39474979043006897,
"learning_rate": 2e-05,
"loss": 0.5927,
"step": 970
},
{
"epoch": 0.041857087942595995,
"grad_norm": 0.39630550146102905,
"learning_rate": 2e-05,
"loss": 0.5861,
"step": 980
},
{
"epoch": 0.042284201084867384,
"grad_norm": 0.4038623571395874,
"learning_rate": 2e-05,
"loss": 0.5991,
"step": 990
},
{
"epoch": 0.042711314227138766,
"grad_norm": 0.46558162569999695,
"learning_rate": 2e-05,
"loss": 0.5842,
"step": 1000
},
{
"epoch": 0.043138427369410155,
"grad_norm": 0.4309065043926239,
"learning_rate": 2e-05,
"loss": 0.6021,
"step": 1010
},
{
"epoch": 0.043565540511681544,
"grad_norm": 0.3698565363883972,
"learning_rate": 2e-05,
"loss": 0.607,
"step": 1020
},
{
"epoch": 0.04399265365395293,
"grad_norm": 0.40514087677001953,
"learning_rate": 2e-05,
"loss": 0.5933,
"step": 1030
},
{
"epoch": 0.04441976679622432,
"grad_norm": 0.7474258542060852,
"learning_rate": 2e-05,
"loss": 0.5946,
"step": 1040
},
{
"epoch": 0.04484687993849571,
"grad_norm": 0.38786014914512634,
"learning_rate": 2e-05,
"loss": 0.6132,
"step": 1050
},
{
"epoch": 0.04527399308076709,
"grad_norm": 0.38152816891670227,
"learning_rate": 2e-05,
"loss": 0.5799,
"step": 1060
},
{
"epoch": 0.04570110622303848,
"grad_norm": 0.5136268734931946,
"learning_rate": 2e-05,
"loss": 0.6335,
"step": 1070
},
{
"epoch": 0.04612821936530987,
"grad_norm": 0.37756872177124023,
"learning_rate": 2e-05,
"loss": 0.5794,
"step": 1080
},
{
"epoch": 0.04655533250758126,
"grad_norm": 0.41157087683677673,
"learning_rate": 2e-05,
"loss": 0.6129,
"step": 1090
},
{
"epoch": 0.04698244564985265,
"grad_norm": 0.45449504256248474,
"learning_rate": 2e-05,
"loss": 0.6074,
"step": 1100
},
{
"epoch": 0.04740955879212403,
"grad_norm": 0.36440810561180115,
"learning_rate": 2e-05,
"loss": 0.5905,
"step": 1110
},
{
"epoch": 0.04783667193439542,
"grad_norm": 0.40203210711479187,
"learning_rate": 2e-05,
"loss": 0.5772,
"step": 1120
},
{
"epoch": 0.04826378507666681,
"grad_norm": 0.4374965727329254,
"learning_rate": 2e-05,
"loss": 0.6033,
"step": 1130
},
{
"epoch": 0.0486908982189382,
"grad_norm": 0.37814727425575256,
"learning_rate": 2e-05,
"loss": 0.6051,
"step": 1140
},
{
"epoch": 0.049118011361209586,
"grad_norm": 0.3608170449733734,
"learning_rate": 2e-05,
"loss": 0.6036,
"step": 1150
},
{
"epoch": 0.049545124503480975,
"grad_norm": 0.5163088440895081,
"learning_rate": 2e-05,
"loss": 0.5888,
"step": 1160
},
{
"epoch": 0.04997223764575236,
"grad_norm": 0.6338587403297424,
"learning_rate": 2e-05,
"loss": 0.5846,
"step": 1170
},
{
"epoch": 0.050399350788023746,
"grad_norm": 0.3570212125778198,
"learning_rate": 2e-05,
"loss": 0.5997,
"step": 1180
},
{
"epoch": 0.050826463930295135,
"grad_norm": 0.4730677604675293,
"learning_rate": 2e-05,
"loss": 0.5666,
"step": 1190
},
{
"epoch": 0.051253577072566524,
"grad_norm": 0.4634343683719635,
"learning_rate": 2e-05,
"loss": 0.6167,
"step": 1200
},
{
"epoch": 0.05168069021483791,
"grad_norm": 0.4279061555862427,
"learning_rate": 2e-05,
"loss": 0.5984,
"step": 1210
},
{
"epoch": 0.0521078033571093,
"grad_norm": 0.42280420660972595,
"learning_rate": 2e-05,
"loss": 0.5715,
"step": 1220
},
{
"epoch": 0.052534916499380684,
"grad_norm": 0.34051749110221863,
"learning_rate": 2e-05,
"loss": 0.577,
"step": 1230
},
{
"epoch": 0.05296202964165207,
"grad_norm": 0.3963359296321869,
"learning_rate": 2e-05,
"loss": 0.6313,
"step": 1240
},
{
"epoch": 0.05338914278392346,
"grad_norm": 0.5236133933067322,
"learning_rate": 2e-05,
"loss": 0.6187,
"step": 1250
},
{
"epoch": 0.05381625592619485,
"grad_norm": 0.40057671070098877,
"learning_rate": 2e-05,
"loss": 0.6118,
"step": 1260
},
{
"epoch": 0.05424336906846624,
"grad_norm": 0.4331953227519989,
"learning_rate": 2e-05,
"loss": 0.5933,
"step": 1270
},
{
"epoch": 0.05467048221073762,
"grad_norm": 0.35897260904312134,
"learning_rate": 2e-05,
"loss": 0.5776,
"step": 1280
},
{
"epoch": 0.05509759535300901,
"grad_norm": 0.40010058879852295,
"learning_rate": 2e-05,
"loss": 0.58,
"step": 1290
},
{
"epoch": 0.0555247084952804,
"grad_norm": 0.49022912979125977,
"learning_rate": 2e-05,
"loss": 0.5747,
"step": 1300
},
{
"epoch": 0.05595182163755179,
"grad_norm": 0.4582119584083557,
"learning_rate": 2e-05,
"loss": 0.5994,
"step": 1310
},
{
"epoch": 0.05637893477982318,
"grad_norm": 0.4133841097354889,
"learning_rate": 2e-05,
"loss": 0.5856,
"step": 1320
},
{
"epoch": 0.056806047922094566,
"grad_norm": 0.40341418981552124,
"learning_rate": 2e-05,
"loss": 0.615,
"step": 1330
},
{
"epoch": 0.05723316106436595,
"grad_norm": 0.3729898929595947,
"learning_rate": 2e-05,
"loss": 0.5871,
"step": 1340
},
{
"epoch": 0.05766027420663734,
"grad_norm": 0.36487877368927,
"learning_rate": 2e-05,
"loss": 0.6087,
"step": 1350
},
{
"epoch": 0.058087387348908726,
"grad_norm": 0.410173237323761,
"learning_rate": 2e-05,
"loss": 0.6106,
"step": 1360
},
{
"epoch": 0.058514500491180114,
"grad_norm": 0.4052298367023468,
"learning_rate": 2e-05,
"loss": 0.5794,
"step": 1370
},
{
"epoch": 0.0589416136334515,
"grad_norm": 0.35845524072647095,
"learning_rate": 2e-05,
"loss": 0.5818,
"step": 1380
},
{
"epoch": 0.05936872677572289,
"grad_norm": 0.39520588517189026,
"learning_rate": 2e-05,
"loss": 0.5724,
"step": 1390
},
{
"epoch": 0.059795839917994274,
"grad_norm": 0.3926452696323395,
"learning_rate": 2e-05,
"loss": 0.5787,
"step": 1400
},
{
"epoch": 0.06022295306026566,
"grad_norm": 0.3984834551811218,
"learning_rate": 2e-05,
"loss": 0.6149,
"step": 1410
},
{
"epoch": 0.06065006620253705,
"grad_norm": 0.4060869514942169,
"learning_rate": 2e-05,
"loss": 0.623,
"step": 1420
},
{
"epoch": 0.06107717934480844,
"grad_norm": 0.3899109661579132,
"learning_rate": 2e-05,
"loss": 0.606,
"step": 1430
},
{
"epoch": 0.06150429248707983,
"grad_norm": 0.41343048214912415,
"learning_rate": 2e-05,
"loss": 0.62,
"step": 1440
},
{
"epoch": 0.06193140562935121,
"grad_norm": 0.5486384630203247,
"learning_rate": 2e-05,
"loss": 0.5888,
"step": 1450
},
{
"epoch": 0.0623585187716226,
"grad_norm": 0.4260222017765045,
"learning_rate": 2e-05,
"loss": 0.5949,
"step": 1460
},
{
"epoch": 0.062785631913894,
"grad_norm": 0.5510641932487488,
"learning_rate": 2e-05,
"loss": 0.5917,
"step": 1470
},
{
"epoch": 0.06321274505616538,
"grad_norm": 0.3307860791683197,
"learning_rate": 2e-05,
"loss": 0.5966,
"step": 1480
},
{
"epoch": 0.06363985819843676,
"grad_norm": 0.37774041295051575,
"learning_rate": 2e-05,
"loss": 0.5928,
"step": 1490
},
{
"epoch": 0.06406697134070816,
"grad_norm": 0.40287962555885315,
"learning_rate": 2e-05,
"loss": 0.6018,
"step": 1500
},
{
"epoch": 0.06449408448297954,
"grad_norm": 0.3765062987804413,
"learning_rate": 2e-05,
"loss": 0.5868,
"step": 1510
},
{
"epoch": 0.06492119762525093,
"grad_norm": 0.3866639733314514,
"learning_rate": 2e-05,
"loss": 0.5918,
"step": 1520
},
{
"epoch": 0.06534831076752232,
"grad_norm": 0.3452185392379761,
"learning_rate": 2e-05,
"loss": 0.6006,
"step": 1530
},
{
"epoch": 0.0657754239097937,
"grad_norm": 0.3757578730583191,
"learning_rate": 2e-05,
"loss": 0.5885,
"step": 1540
},
{
"epoch": 0.0662025370520651,
"grad_norm": 0.6169503927230835,
"learning_rate": 2e-05,
"loss": 0.5942,
"step": 1550
},
{
"epoch": 0.06662965019433648,
"grad_norm": 0.40690863132476807,
"learning_rate": 2e-05,
"loss": 0.5846,
"step": 1560
},
{
"epoch": 0.06705676333660787,
"grad_norm": 0.40239500999450684,
"learning_rate": 2e-05,
"loss": 0.6043,
"step": 1570
},
{
"epoch": 0.06748387647887925,
"grad_norm": 0.6150453090667725,
"learning_rate": 2e-05,
"loss": 0.5687,
"step": 1580
},
{
"epoch": 0.06791098962115065,
"grad_norm": 0.3692316710948944,
"learning_rate": 2e-05,
"loss": 0.5934,
"step": 1590
},
{
"epoch": 0.06833810276342203,
"grad_norm": 0.4124865233898163,
"learning_rate": 2e-05,
"loss": 0.5784,
"step": 1600
},
{
"epoch": 0.06876521590569341,
"grad_norm": 0.40603578090667725,
"learning_rate": 2e-05,
"loss": 0.5536,
"step": 1610
},
{
"epoch": 0.06919232904796481,
"grad_norm": 0.3672163188457489,
"learning_rate": 2e-05,
"loss": 0.5949,
"step": 1620
},
{
"epoch": 0.06961944219023619,
"grad_norm": 0.4111248850822449,
"learning_rate": 2e-05,
"loss": 0.6168,
"step": 1630
},
{
"epoch": 0.07004655533250759,
"grad_norm": 0.3349396288394928,
"learning_rate": 2e-05,
"loss": 0.6096,
"step": 1640
},
{
"epoch": 0.07047366847477897,
"grad_norm": 0.35192081332206726,
"learning_rate": 2e-05,
"loss": 0.6309,
"step": 1650
},
{
"epoch": 0.07090078161705035,
"grad_norm": 0.46462368965148926,
"learning_rate": 2e-05,
"loss": 0.5827,
"step": 1660
},
{
"epoch": 0.07132789475932175,
"grad_norm": 0.4099385440349579,
"learning_rate": 2e-05,
"loss": 0.6093,
"step": 1670
},
{
"epoch": 0.07175500790159313,
"grad_norm": 0.39262962341308594,
"learning_rate": 2e-05,
"loss": 0.5959,
"step": 1680
},
{
"epoch": 0.07218212104386452,
"grad_norm": 0.4145928919315338,
"learning_rate": 2e-05,
"loss": 0.5776,
"step": 1690
},
{
"epoch": 0.07260923418613591,
"grad_norm": 0.33485323190689087,
"learning_rate": 2e-05,
"loss": 0.5864,
"step": 1700
},
{
"epoch": 0.07303634732840729,
"grad_norm": 0.3448295295238495,
"learning_rate": 2e-05,
"loss": 0.6077,
"step": 1710
},
{
"epoch": 0.07346346047067868,
"grad_norm": 0.3951145112514496,
"learning_rate": 2e-05,
"loss": 0.5667,
"step": 1720
},
{
"epoch": 0.07389057361295007,
"grad_norm": 0.36090508103370667,
"learning_rate": 2e-05,
"loss": 0.6006,
"step": 1730
},
{
"epoch": 0.07431768675522146,
"grad_norm": 0.35783612728118896,
"learning_rate": 2e-05,
"loss": 0.5698,
"step": 1740
},
{
"epoch": 0.07474479989749284,
"grad_norm": 0.4051808714866638,
"learning_rate": 2e-05,
"loss": 0.5841,
"step": 1750
},
{
"epoch": 0.07517191303976424,
"grad_norm": 0.36852049827575684,
"learning_rate": 2e-05,
"loss": 0.5812,
"step": 1760
},
{
"epoch": 0.07559902618203562,
"grad_norm": 0.47315099835395813,
"learning_rate": 2e-05,
"loss": 0.5867,
"step": 1770
},
{
"epoch": 0.076026139324307,
"grad_norm": 0.370299756526947,
"learning_rate": 2e-05,
"loss": 0.5944,
"step": 1780
},
{
"epoch": 0.0764532524665784,
"grad_norm": 0.3629041314125061,
"learning_rate": 2e-05,
"loss": 0.5895,
"step": 1790
},
{
"epoch": 0.07688036560884978,
"grad_norm": 0.4631352722644806,
"learning_rate": 2e-05,
"loss": 0.6233,
"step": 1800
},
{
"epoch": 0.07730747875112118,
"grad_norm": 0.3893195390701294,
"learning_rate": 2e-05,
"loss": 0.579,
"step": 1810
},
{
"epoch": 0.07773459189339256,
"grad_norm": 0.4197307825088501,
"learning_rate": 2e-05,
"loss": 0.6022,
"step": 1820
},
{
"epoch": 0.07816170503566394,
"grad_norm": 0.5316178798675537,
"learning_rate": 2e-05,
"loss": 0.6127,
"step": 1830
},
{
"epoch": 0.07858881817793534,
"grad_norm": 0.4087827801704407,
"learning_rate": 2e-05,
"loss": 0.6148,
"step": 1840
},
{
"epoch": 0.07901593132020672,
"grad_norm": 0.9132181406021118,
"learning_rate": 2e-05,
"loss": 0.5675,
"step": 1850
},
{
"epoch": 0.07944304446247812,
"grad_norm": 0.42939144372940063,
"learning_rate": 2e-05,
"loss": 0.5827,
"step": 1860
},
{
"epoch": 0.0798701576047495,
"grad_norm": 0.5866528749465942,
"learning_rate": 2e-05,
"loss": 0.5984,
"step": 1870
},
{
"epoch": 0.08029727074702088,
"grad_norm": 0.38625794649124146,
"learning_rate": 2e-05,
"loss": 0.5712,
"step": 1880
},
{
"epoch": 0.08072438388929228,
"grad_norm": 0.3775944411754608,
"learning_rate": 2e-05,
"loss": 0.5633,
"step": 1890
},
{
"epoch": 0.08115149703156366,
"grad_norm": 0.37404197454452515,
"learning_rate": 2e-05,
"loss": 0.5944,
"step": 1900
},
{
"epoch": 0.08157861017383505,
"grad_norm": 0.4127039611339569,
"learning_rate": 2e-05,
"loss": 0.5685,
"step": 1910
},
{
"epoch": 0.08200572331610644,
"grad_norm": 0.4228227734565735,
"learning_rate": 2e-05,
"loss": 0.5907,
"step": 1920
},
{
"epoch": 0.08243283645837783,
"grad_norm": 0.3642731010913849,
"learning_rate": 2e-05,
"loss": 0.5926,
"step": 1930
},
{
"epoch": 0.08285994960064921,
"grad_norm": 0.3753544092178345,
"learning_rate": 2e-05,
"loss": 0.598,
"step": 1940
},
{
"epoch": 0.0832870627429206,
"grad_norm": 0.35891029238700867,
"learning_rate": 2e-05,
"loss": 0.5862,
"step": 1950
},
{
"epoch": 0.08371417588519199,
"grad_norm": 0.3859628438949585,
"learning_rate": 2e-05,
"loss": 0.5787,
"step": 1960
},
{
"epoch": 0.08414128902746337,
"grad_norm": 0.3352157473564148,
"learning_rate": 2e-05,
"loss": 0.5677,
"step": 1970
},
{
"epoch": 0.08456840216973477,
"grad_norm": 0.38465848565101624,
"learning_rate": 2e-05,
"loss": 0.5651,
"step": 1980
},
{
"epoch": 0.08499551531200615,
"grad_norm": 0.8394455313682556,
"learning_rate": 2e-05,
"loss": 0.5683,
"step": 1990
},
{
"epoch": 0.08542262845427753,
"grad_norm": 0.39962485432624817,
"learning_rate": 2e-05,
"loss": 0.5793,
"step": 2000
},
{
"epoch": 0.08584974159654893,
"grad_norm": 0.3594360649585724,
"learning_rate": 2e-05,
"loss": 0.6158,
"step": 2010
},
{
"epoch": 0.08627685473882031,
"grad_norm": 0.388683557510376,
"learning_rate": 2e-05,
"loss": 0.5829,
"step": 2020
},
{
"epoch": 0.0867039678810917,
"grad_norm": 0.33351218700408936,
"learning_rate": 2e-05,
"loss": 0.5698,
"step": 2030
}
],
"logging_steps": 10,
"max_steps": 5935,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 2035,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.084295122442519e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}