rqadri's picture
Upload folder using huggingface_hub
dd86403 verified
Raw History Blame Contribute Delete
33.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.08156639544671129,
"eval_steps": 500,
"global_step": 2035,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0004008176680428073,
"grad_norm": 0.8771801590919495,
"learning_rate": 2.910112359550562e-06,
"loss": 0.5885,
"step": 10
},
{
"epoch": 0.0008016353360856146,
"grad_norm": 0.7135661840438843,
"learning_rate": 3.921348314606742e-06,
"loss": 0.5855,
"step": 20
},
{
"epoch": 0.001202453004128422,
"grad_norm": 0.684427797794342,
"learning_rate": 4.932584269662922e-06,
"loss": 0.6184,
"step": 30
},
{
"epoch": 0.0016032706721712292,
"grad_norm": 0.6721655130386353,
"learning_rate": 5.943820224719102e-06,
"loss": 0.6311,
"step": 40
},
{
"epoch": 0.0020040883402140364,
"grad_norm": 0.6820604801177979,
"learning_rate": 6.955056179775282e-06,
"loss": 0.6092,
"step": 50
},
{
"epoch": 0.002404906008256844,
"grad_norm": 0.6614678502082825,
"learning_rate": 7.966292134831462e-06,
"loss": 0.6381,
"step": 60
},
{
"epoch": 0.0028057236762996512,
"grad_norm": 0.7028018236160278,
"learning_rate": 8.977528089887641e-06,
"loss": 0.5996,
"step": 70
},
{
"epoch": 0.0032065413443424584,
"grad_norm": 0.618502140045166,
"learning_rate": 9.988764044943822e-06,
"loss": 0.5959,
"step": 80
},
{
"epoch": 0.003607359012385266,
"grad_norm": 1.102985143661499,
"learning_rate": 1.1000000000000001e-05,
"loss": 0.5787,
"step": 90
},
{
"epoch": 0.004008176680428073,
"grad_norm": 0.9070648550987244,
"learning_rate": 1.2011235955056182e-05,
"loss": 0.6572,
"step": 100
},
{
"epoch": 0.004408994348470881,
"grad_norm": 0.8499509692192078,
"learning_rate": 1.3022471910112362e-05,
"loss": 0.5635,
"step": 110
},
{
"epoch": 0.004809812016513688,
"grad_norm": 0.8052905797958374,
"learning_rate": 1.403370786516854e-05,
"loss": 0.637,
"step": 120
},
{
"epoch": 0.005210629684556495,
"grad_norm": 0.5784770250320435,
"learning_rate": 1.504494382022472e-05,
"loss": 0.621,
"step": 130
},
{
"epoch": 0.0056114473525993025,
"grad_norm": 0.7975672483444214,
"learning_rate": 1.60561797752809e-05,
"loss": 0.6094,
"step": 140
},
{
"epoch": 0.00601226502064211,
"grad_norm": 0.7009092569351196,
"learning_rate": 1.706741573033708e-05,
"loss": 0.5613,
"step": 150
},
{
"epoch": 0.006413082688684917,
"grad_norm": 0.6548627018928528,
"learning_rate": 1.8078651685393256e-05,
"loss": 0.6051,
"step": 160
},
{
"epoch": 0.006813900356727725,
"grad_norm": 0.6045688390731812,
"learning_rate": 1.908988764044944e-05,
"loss": 0.563,
"step": 170
},
{
"epoch": 0.007214718024770532,
"grad_norm": 0.6471413373947144,
"learning_rate": 2e-05,
"loss": 0.6005,
"step": 180
},
{
"epoch": 0.007615535692813339,
"grad_norm": 0.629910945892334,
"learning_rate": 2e-05,
"loss": 0.6198,
"step": 190
},
{
"epoch": 0.008016353360856146,
"grad_norm": 0.927505373954773,
"learning_rate": 2e-05,
"loss": 0.582,
"step": 200
},
{
"epoch": 0.008417171028898954,
"grad_norm": 0.5309529304504395,
"learning_rate": 2e-05,
"loss": 0.5922,
"step": 210
},
{
"epoch": 0.008817988696941762,
"grad_norm": 0.5308235287666321,
"learning_rate": 2e-05,
"loss": 0.62,
"step": 220
},
{
"epoch": 0.009218806364984568,
"grad_norm": 0.8441914319992065,
"learning_rate": 2e-05,
"loss": 0.5574,
"step": 230
},
{
"epoch": 0.009619624033027376,
"grad_norm": 0.6029269099235535,
"learning_rate": 2e-05,
"loss": 0.5807,
"step": 240
},
{
"epoch": 0.010020441701070183,
"grad_norm": 0.5120773911476135,
"learning_rate": 2e-05,
"loss": 0.6125,
"step": 250
},
{
"epoch": 0.01042125936911299,
"grad_norm": 0.5556898713111877,
"learning_rate": 2e-05,
"loss": 0.608,
"step": 260
},
{
"epoch": 0.010822077037155799,
"grad_norm": 0.550104558467865,
"learning_rate": 2e-05,
"loss": 0.603,
"step": 270
},
{
"epoch": 0.011222894705198605,
"grad_norm": 0.46029090881347656,
"learning_rate": 2e-05,
"loss": 0.6234,
"step": 280
},
{
"epoch": 0.011623712373241413,
"grad_norm": 0.4434625208377838,
"learning_rate": 2e-05,
"loss": 0.5865,
"step": 290
},
{
"epoch": 0.01202453004128422,
"grad_norm": 0.49364206194877625,
"learning_rate": 2e-05,
"loss": 0.5991,
"step": 300
},
{
"epoch": 0.012425347709327027,
"grad_norm": 0.41587820649147034,
"learning_rate": 2e-05,
"loss": 0.5954,
"step": 310
},
{
"epoch": 0.012826165377369834,
"grad_norm": 0.4016185700893402,
"learning_rate": 2e-05,
"loss": 0.5823,
"step": 320
},
{
"epoch": 0.013226983045412642,
"grad_norm": 0.42542213201522827,
"learning_rate": 2e-05,
"loss": 0.629,
"step": 330
},
{
"epoch": 0.01362780071345545,
"grad_norm": 0.5087456703186035,
"learning_rate": 2e-05,
"loss": 0.6184,
"step": 340
},
{
"epoch": 0.014028618381498256,
"grad_norm": 0.46378353238105774,
"learning_rate": 2e-05,
"loss": 0.5894,
"step": 350
},
{
"epoch": 0.014429436049541064,
"grad_norm": 0.4463004171848297,
"learning_rate": 2e-05,
"loss": 0.6111,
"step": 360
},
{
"epoch": 0.01483025371758387,
"grad_norm": 0.5027539730072021,
"learning_rate": 2e-05,
"loss": 0.5779,
"step": 370
},
{
"epoch": 0.015231071385626679,
"grad_norm": 0.4367392361164093,
"learning_rate": 2e-05,
"loss": 0.6042,
"step": 380
},
{
"epoch": 0.015631889053669485,
"grad_norm": 0.4877663254737854,
"learning_rate": 2e-05,
"loss": 0.5847,
"step": 390
},
{
"epoch": 0.01603270672171229,
"grad_norm": 0.615467369556427,
"learning_rate": 2e-05,
"loss": 0.6312,
"step": 400
},
{
"epoch": 0.0164335243897551,
"grad_norm": 0.44901445508003235,
"learning_rate": 2e-05,
"loss": 0.5789,
"step": 410
},
{
"epoch": 0.016834342057797907,
"grad_norm": 0.5024731755256653,
"learning_rate": 2e-05,
"loss": 0.5949,
"step": 420
},
{
"epoch": 0.017235159725840714,
"grad_norm": 0.47739124298095703,
"learning_rate": 2e-05,
"loss": 0.6386,
"step": 430
},
{
"epoch": 0.017635977393883524,
"grad_norm": 0.3923758864402771,
"learning_rate": 2e-05,
"loss": 0.6097,
"step": 440
},
{
"epoch": 0.01803679506192633,
"grad_norm": 0.38089510798454285,
"learning_rate": 2e-05,
"loss": 0.5916,
"step": 450
},
{
"epoch": 0.018437612729969136,
"grad_norm": 0.37581101059913635,
"learning_rate": 2e-05,
"loss": 0.6205,
"step": 460
},
{
"epoch": 0.018838430398011946,
"grad_norm": 0.4052000343799591,
"learning_rate": 2e-05,
"loss": 0.6101,
"step": 470
},
{
"epoch": 0.019239248066054752,
"grad_norm": 0.4212661385536194,
"learning_rate": 2e-05,
"loss": 0.6051,
"step": 480
},
{
"epoch": 0.01964006573409756,
"grad_norm": 0.3834267556667328,
"learning_rate": 2e-05,
"loss": 0.5524,
"step": 490
},
{
"epoch": 0.020040883402140365,
"grad_norm": 0.38489559292793274,
"learning_rate": 2e-05,
"loss": 0.595,
"step": 500
},
{
"epoch": 0.020441701070183175,
"grad_norm": 0.42016276717185974,
"learning_rate": 2e-05,
"loss": 0.5996,
"step": 510
},
{
"epoch": 0.02084251873822598,
"grad_norm": 0.38279569149017334,
"learning_rate": 2e-05,
"loss": 0.586,
"step": 520
},
{
"epoch": 0.021243336406268788,
"grad_norm": 1.364205241203308,
"learning_rate": 2e-05,
"loss": 0.5536,
"step": 530
},
{
"epoch": 0.021644154074311597,
"grad_norm": 0.4498082995414734,
"learning_rate": 2e-05,
"loss": 0.5895,
"step": 540
},
{
"epoch": 0.022044971742354404,
"grad_norm": 0.38928699493408203,
"learning_rate": 2e-05,
"loss": 0.573,
"step": 550
},
{
"epoch": 0.02244578941039721,
"grad_norm": 0.39118388295173645,
"learning_rate": 2e-05,
"loss": 0.6096,
"step": 560
},
{
"epoch": 0.022846607078440016,
"grad_norm": 0.32673704624176025,
"learning_rate": 2e-05,
"loss": 0.5765,
"step": 570
},
{
"epoch": 0.023247424746482826,
"grad_norm": 0.36165913939476013,
"learning_rate": 2e-05,
"loss": 0.6114,
"step": 580
},
{
"epoch": 0.023648242414525632,
"grad_norm": 0.3407866954803467,
"learning_rate": 2e-05,
"loss": 0.5656,
"step": 590
},
{
"epoch": 0.02404906008256844,
"grad_norm": 0.3884231150150299,
"learning_rate": 2e-05,
"loss": 0.6137,
"step": 600
},
{
"epoch": 0.02444987775061125,
"grad_norm": 0.359744668006897,
"learning_rate": 2e-05,
"loss": 0.5952,
"step": 610
},
{
"epoch": 0.024850695418654055,
"grad_norm": 0.44357308745384216,
"learning_rate": 2e-05,
"loss": 0.5999,
"step": 620
},
{
"epoch": 0.02525151308669686,
"grad_norm": 0.3912670910358429,
"learning_rate": 2e-05,
"loss": 0.6191,
"step": 630
},
{
"epoch": 0.025652330754739668,
"grad_norm": 0.34180188179016113,
"learning_rate": 2e-05,
"loss": 0.597,
"step": 640
},
{
"epoch": 0.026053148422782477,
"grad_norm": 0.4104002118110657,
"learning_rate": 2e-05,
"loss": 0.5491,
"step": 650
},
{
"epoch": 0.026453966090825284,
"grad_norm": 0.3853461742401123,
"learning_rate": 2e-05,
"loss": 0.5516,
"step": 660
},
{
"epoch": 0.02685478375886809,
"grad_norm": 0.43015527725219727,
"learning_rate": 2e-05,
"loss": 0.6129,
"step": 670
},
{
"epoch": 0.0272556014269109,
"grad_norm": 0.3709610402584076,
"learning_rate": 2e-05,
"loss": 0.6228,
"step": 680
},
{
"epoch": 0.027656419094953706,
"grad_norm": 0.42639583349227905,
"learning_rate": 2e-05,
"loss": 0.6351,
"step": 690
},
{
"epoch": 0.028057236762996512,
"grad_norm": 0.402164489030838,
"learning_rate": 2e-05,
"loss": 0.6049,
"step": 700
},
{
"epoch": 0.02845805443103932,
"grad_norm": 0.6255981922149658,
"learning_rate": 2e-05,
"loss": 0.6139,
"step": 710
},
{
"epoch": 0.02885887209908213,
"grad_norm": 0.3667871952056885,
"learning_rate": 2e-05,
"loss": 0.5691,
"step": 720
},
{
"epoch": 0.029259689767124935,
"grad_norm": 0.36819183826446533,
"learning_rate": 2e-05,
"loss": 0.6111,
"step": 730
},
{
"epoch": 0.02966050743516774,
"grad_norm": 0.40006792545318604,
"learning_rate": 2e-05,
"loss": 0.613,
"step": 740
},
{
"epoch": 0.03006132510321055,
"grad_norm": 0.397798091173172,
"learning_rate": 2e-05,
"loss": 0.5872,
"step": 750
},
{
"epoch": 0.030462142771253357,
"grad_norm": 0.3581616282463074,
"learning_rate": 2e-05,
"loss": 0.5831,
"step": 760
},
{
"epoch": 0.030862960439296164,
"grad_norm": 0.3883630931377411,
"learning_rate": 2e-05,
"loss": 0.6182,
"step": 770
},
{
"epoch": 0.03126377810733897,
"grad_norm": 0.4035130739212036,
"learning_rate": 2e-05,
"loss": 0.58,
"step": 780
},
{
"epoch": 0.031664595775381776,
"grad_norm": 0.4688993990421295,
"learning_rate": 2e-05,
"loss": 0.5971,
"step": 790
},
{
"epoch": 0.03206541344342458,
"grad_norm": 0.37623828649520874,
"learning_rate": 2e-05,
"loss": 0.5682,
"step": 800
},
{
"epoch": 0.032466231111467396,
"grad_norm": 0.38642242550849915,
"learning_rate": 2e-05,
"loss": 0.6227,
"step": 810
},
{
"epoch": 0.0328670487795102,
"grad_norm": 0.3684792220592499,
"learning_rate": 2e-05,
"loss": 0.5819,
"step": 820
},
{
"epoch": 0.03326786644755301,
"grad_norm": 0.4786039888858795,
"learning_rate": 2e-05,
"loss": 0.5936,
"step": 830
},
{
"epoch": 0.033668684115595815,
"grad_norm": 0.3609310984611511,
"learning_rate": 2e-05,
"loss": 0.5941,
"step": 840
},
{
"epoch": 0.03406950178363862,
"grad_norm": 0.3404565751552582,
"learning_rate": 2e-05,
"loss": 0.6299,
"step": 850
},
{
"epoch": 0.03447031945168143,
"grad_norm": 0.3853689134120941,
"learning_rate": 2e-05,
"loss": 0.604,
"step": 860
},
{
"epoch": 0.03487113711972424,
"grad_norm": 0.3917834162712097,
"learning_rate": 2e-05,
"loss": 0.6053,
"step": 870
},
{
"epoch": 0.03527195478776705,
"grad_norm": 0.36823081970214844,
"learning_rate": 2e-05,
"loss": 0.6171,
"step": 880
},
{
"epoch": 0.035672772455809854,
"grad_norm": 0.3762242794036865,
"learning_rate": 2e-05,
"loss": 0.64,
"step": 890
},
{
"epoch": 0.03607359012385266,
"grad_norm": 0.8369109034538269,
"learning_rate": 2e-05,
"loss": 0.6405,
"step": 900
},
{
"epoch": 0.036474407791895466,
"grad_norm": 0.4162234365940094,
"learning_rate": 2e-05,
"loss": 0.6021,
"step": 910
},
{
"epoch": 0.03687522545993827,
"grad_norm": 0.4115590453147888,
"learning_rate": 2e-05,
"loss": 0.6031,
"step": 920
},
{
"epoch": 0.03727604312798108,
"grad_norm": 0.3745420277118683,
"learning_rate": 2e-05,
"loss": 0.5785,
"step": 930
},
{
"epoch": 0.03767686079602389,
"grad_norm": 0.38241758942604065,
"learning_rate": 2e-05,
"loss": 0.6068,
"step": 940
},
{
"epoch": 0.0380776784640667,
"grad_norm": 0.37572914361953735,
"learning_rate": 2e-05,
"loss": 0.6126,
"step": 950
},
{
"epoch": 0.038478496132109505,
"grad_norm": 0.3598463535308838,
"learning_rate": 2e-05,
"loss": 0.5647,
"step": 960
},
{
"epoch": 0.03887931380015231,
"grad_norm": 0.3645531237125397,
"learning_rate": 2e-05,
"loss": 0.5874,
"step": 970
},
{
"epoch": 0.03928013146819512,
"grad_norm": 0.37088748812675476,
"learning_rate": 2e-05,
"loss": 0.5966,
"step": 980
},
{
"epoch": 0.039680949136237924,
"grad_norm": 0.3901059031486511,
"learning_rate": 2e-05,
"loss": 0.6214,
"step": 990
},
{
"epoch": 0.04008176680428073,
"grad_norm": 0.3765749931335449,
"learning_rate": 2e-05,
"loss": 0.5771,
"step": 1000
},
{
"epoch": 0.04048258447232354,
"grad_norm": 0.3934212028980255,
"learning_rate": 2e-05,
"loss": 0.5661,
"step": 1010
},
{
"epoch": 0.04088340214036635,
"grad_norm": 0.3081901967525482,
"learning_rate": 2e-05,
"loss": 0.5772,
"step": 1020
},
{
"epoch": 0.041284219808409156,
"grad_norm": 0.5176882743835449,
"learning_rate": 2e-05,
"loss": 0.5925,
"step": 1030
},
{
"epoch": 0.04168503747645196,
"grad_norm": 0.3315117657184601,
"learning_rate": 2e-05,
"loss": 0.588,
"step": 1040
},
{
"epoch": 0.04208585514449477,
"grad_norm": 0.36918768286705017,
"learning_rate": 2e-05,
"loss": 0.6049,
"step": 1050
},
{
"epoch": 0.042486672812537575,
"grad_norm": 0.42960917949676514,
"learning_rate": 2e-05,
"loss": 0.6315,
"step": 1060
},
{
"epoch": 0.04288749048058038,
"grad_norm": 0.38764506578445435,
"learning_rate": 2e-05,
"loss": 0.5556,
"step": 1070
},
{
"epoch": 0.043288308148623195,
"grad_norm": 0.38045603036880493,
"learning_rate": 2e-05,
"loss": 0.578,
"step": 1080
},
{
"epoch": 0.043689125816666,
"grad_norm": 0.40927988290786743,
"learning_rate": 2e-05,
"loss": 0.5735,
"step": 1090
},
{
"epoch": 0.04408994348470881,
"grad_norm": 0.37116703391075134,
"learning_rate": 2e-05,
"loss": 0.5898,
"step": 1100
},
{
"epoch": 0.044490761152751614,
"grad_norm": 0.4863120913505554,
"learning_rate": 2e-05,
"loss": 0.6207,
"step": 1110
},
{
"epoch": 0.04489157882079442,
"grad_norm": 0.4080751836299896,
"learning_rate": 2e-05,
"loss": 0.6031,
"step": 1120
},
{
"epoch": 0.045292396488837226,
"grad_norm": 0.38050946593284607,
"learning_rate": 2e-05,
"loss": 0.5693,
"step": 1130
},
{
"epoch": 0.04569321415688003,
"grad_norm": 0.4002411365509033,
"learning_rate": 2e-05,
"loss": 0.5546,
"step": 1140
},
{
"epoch": 0.046094031824922846,
"grad_norm": 0.337520569562912,
"learning_rate": 2e-05,
"loss": 0.5649,
"step": 1150
},
{
"epoch": 0.04649484949296565,
"grad_norm": 0.4152458608150482,
"learning_rate": 2e-05,
"loss": 0.5985,
"step": 1160
},
{
"epoch": 0.04689566716100846,
"grad_norm": 0.3427383601665497,
"learning_rate": 2e-05,
"loss": 0.5974,
"step": 1170
},
{
"epoch": 0.047296484829051265,
"grad_norm": 0.48308777809143066,
"learning_rate": 2e-05,
"loss": 0.5676,
"step": 1180
},
{
"epoch": 0.04769730249709407,
"grad_norm": 0.3868969976902008,
"learning_rate": 2e-05,
"loss": 0.5791,
"step": 1190
},
{
"epoch": 0.04809812016513688,
"grad_norm": 0.4252076745033264,
"learning_rate": 2e-05,
"loss": 0.5949,
"step": 1200
},
{
"epoch": 0.048498937833179684,
"grad_norm": 0.3403521478176117,
"learning_rate": 2e-05,
"loss": 0.5721,
"step": 1210
},
{
"epoch": 0.0488997555012225,
"grad_norm": 0.3935258090496063,
"learning_rate": 2e-05,
"loss": 0.6194,
"step": 1220
},
{
"epoch": 0.049300573169265303,
"grad_norm": 0.39958739280700684,
"learning_rate": 2e-05,
"loss": 0.5838,
"step": 1230
},
{
"epoch": 0.04970139083730811,
"grad_norm": 0.3761332035064697,
"learning_rate": 2e-05,
"loss": 0.5746,
"step": 1240
},
{
"epoch": 0.050102208505350916,
"grad_norm": 0.3709917962551117,
"learning_rate": 2e-05,
"loss": 0.5925,
"step": 1250
},
{
"epoch": 0.05050302617339372,
"grad_norm": 0.4449377954006195,
"learning_rate": 2e-05,
"loss": 0.5975,
"step": 1260
},
{
"epoch": 0.05090384384143653,
"grad_norm": 0.4874597489833832,
"learning_rate": 2e-05,
"loss": 0.6075,
"step": 1270
},
{
"epoch": 0.051304661509479335,
"grad_norm": 0.5181390047073364,
"learning_rate": 2e-05,
"loss": 0.5873,
"step": 1280
},
{
"epoch": 0.05170547917752215,
"grad_norm": 0.38032063841819763,
"learning_rate": 2e-05,
"loss": 0.5734,
"step": 1290
},
{
"epoch": 0.052106296845564955,
"grad_norm": 0.3566950857639313,
"learning_rate": 2e-05,
"loss": 0.5876,
"step": 1300
},
{
"epoch": 0.05250711451360776,
"grad_norm": 0.3316211998462677,
"learning_rate": 2e-05,
"loss": 0.5729,
"step": 1310
},
{
"epoch": 0.05290793218165057,
"grad_norm": 0.3991880416870117,
"learning_rate": 2e-05,
"loss": 0.5903,
"step": 1320
},
{
"epoch": 0.053308749849693374,
"grad_norm": 0.4019741714000702,
"learning_rate": 2e-05,
"loss": 0.5768,
"step": 1330
},
{
"epoch": 0.05370956751773618,
"grad_norm": 0.417432963848114,
"learning_rate": 2e-05,
"loss": 0.6152,
"step": 1340
},
{
"epoch": 0.054110385185778986,
"grad_norm": 0.3510989248752594,
"learning_rate": 2e-05,
"loss": 0.5694,
"step": 1350
},
{
"epoch": 0.0545112028538218,
"grad_norm": 0.4420473575592041,
"learning_rate": 2e-05,
"loss": 0.5697,
"step": 1360
},
{
"epoch": 0.054912020521864606,
"grad_norm": 0.4099363684654236,
"learning_rate": 2e-05,
"loss": 0.5891,
"step": 1370
},
{
"epoch": 0.05531283818990741,
"grad_norm": 0.44445106387138367,
"learning_rate": 2e-05,
"loss": 0.5602,
"step": 1380
},
{
"epoch": 0.05571365585795022,
"grad_norm": 0.35209330916404724,
"learning_rate": 2e-05,
"loss": 0.6442,
"step": 1390
},
{
"epoch": 0.056114473525993025,
"grad_norm": 0.3788399398326874,
"learning_rate": 2e-05,
"loss": 0.6103,
"step": 1400
},
{
"epoch": 0.05651529119403583,
"grad_norm": 0.3592466711997986,
"learning_rate": 2e-05,
"loss": 0.5739,
"step": 1410
},
{
"epoch": 0.05691610886207864,
"grad_norm": 0.3659421503543854,
"learning_rate": 2e-05,
"loss": 0.5754,
"step": 1420
},
{
"epoch": 0.05731692653012145,
"grad_norm": 0.33240798115730286,
"learning_rate": 2e-05,
"loss": 0.5657,
"step": 1430
},
{
"epoch": 0.05771774419816426,
"grad_norm": 0.3574551045894623,
"learning_rate": 2e-05,
"loss": 0.599,
"step": 1440
},
{
"epoch": 0.058118561866207064,
"grad_norm": 0.3870832920074463,
"learning_rate": 2e-05,
"loss": 0.586,
"step": 1450
},
{
"epoch": 0.05851937953424987,
"grad_norm": 0.3373236656188965,
"learning_rate": 2e-05,
"loss": 0.6046,
"step": 1460
},
{
"epoch": 0.058920197202292676,
"grad_norm": 0.3652302026748657,
"learning_rate": 2e-05,
"loss": 0.5895,
"step": 1470
},
{
"epoch": 0.05932101487033548,
"grad_norm": 0.3693019449710846,
"learning_rate": 2e-05,
"loss": 0.6038,
"step": 1480
},
{
"epoch": 0.05972183253837829,
"grad_norm": 0.4179181158542633,
"learning_rate": 2e-05,
"loss": 0.5379,
"step": 1490
},
{
"epoch": 0.0601226502064211,
"grad_norm": 0.3929535746574402,
"learning_rate": 2e-05,
"loss": 0.5814,
"step": 1500
},
{
"epoch": 0.06052346787446391,
"grad_norm": 0.34511131048202515,
"learning_rate": 2e-05,
"loss": 0.5608,
"step": 1510
},
{
"epoch": 0.060924285542506715,
"grad_norm": 0.3240802586078644,
"learning_rate": 2e-05,
"loss": 0.6026,
"step": 1520
},
{
"epoch": 0.06132510321054952,
"grad_norm": 0.3732409179210663,
"learning_rate": 2e-05,
"loss": 0.5922,
"step": 1530
},
{
"epoch": 0.06172592087859233,
"grad_norm": 0.3403308391571045,
"learning_rate": 2e-05,
"loss": 0.5784,
"step": 1540
},
{
"epoch": 0.062126738546635134,
"grad_norm": 0.43892017006874084,
"learning_rate": 2e-05,
"loss": 0.5733,
"step": 1550
},
{
"epoch": 0.06252755621467794,
"grad_norm": 0.32453539967536926,
"learning_rate": 2e-05,
"loss": 0.6164,
"step": 1560
},
{
"epoch": 0.06292837388272075,
"grad_norm": 0.4057670533657074,
"learning_rate": 2e-05,
"loss": 0.5654,
"step": 1570
},
{
"epoch": 0.06332919155076355,
"grad_norm": 0.401593953371048,
"learning_rate": 2e-05,
"loss": 0.5708,
"step": 1580
},
{
"epoch": 0.06373000921880637,
"grad_norm": 0.9239656329154968,
"learning_rate": 2e-05,
"loss": 0.6037,
"step": 1590
},
{
"epoch": 0.06413082688684917,
"grad_norm": 0.43078750371932983,
"learning_rate": 2e-05,
"loss": 0.5834,
"step": 1600
},
{
"epoch": 0.06453164455489198,
"grad_norm": 0.3466830253601074,
"learning_rate": 2e-05,
"loss": 0.5737,
"step": 1610
},
{
"epoch": 0.06493246222293479,
"grad_norm": 0.3531036078929901,
"learning_rate": 2e-05,
"loss": 0.5849,
"step": 1620
},
{
"epoch": 0.06533327989097759,
"grad_norm": 0.5453006029129028,
"learning_rate": 2e-05,
"loss": 0.5575,
"step": 1630
},
{
"epoch": 0.0657340975590204,
"grad_norm": 0.3632678687572479,
"learning_rate": 2e-05,
"loss": 0.61,
"step": 1640
},
{
"epoch": 0.0661349152270632,
"grad_norm": 0.410371869802475,
"learning_rate": 2e-05,
"loss": 0.5943,
"step": 1650
},
{
"epoch": 0.06653573289510602,
"grad_norm": 0.3581090569496155,
"learning_rate": 2e-05,
"loss": 0.583,
"step": 1660
},
{
"epoch": 0.06693655056314882,
"grad_norm": 0.3194616436958313,
"learning_rate": 2e-05,
"loss": 0.5872,
"step": 1670
},
{
"epoch": 0.06733736823119163,
"grad_norm": 0.3554430603981018,
"learning_rate": 2e-05,
"loss": 0.6039,
"step": 1680
},
{
"epoch": 0.06773818589923444,
"grad_norm": 0.3838396966457367,
"learning_rate": 2e-05,
"loss": 0.6044,
"step": 1690
},
{
"epoch": 0.06813900356727724,
"grad_norm": 0.3924729824066162,
"learning_rate": 2e-05,
"loss": 0.6208,
"step": 1700
},
{
"epoch": 0.06853982123532006,
"grad_norm": 0.3942250907421112,
"learning_rate": 2e-05,
"loss": 0.5827,
"step": 1710
},
{
"epoch": 0.06894063890336286,
"grad_norm": 0.3890213072299957,
"learning_rate": 2e-05,
"loss": 0.5413,
"step": 1720
},
{
"epoch": 0.06934145657140567,
"grad_norm": 0.3526347577571869,
"learning_rate": 2e-05,
"loss": 0.5835,
"step": 1730
},
{
"epoch": 0.06974227423944848,
"grad_norm": 0.3879394829273224,
"learning_rate": 2e-05,
"loss": 0.5952,
"step": 1740
},
{
"epoch": 0.07014309190749128,
"grad_norm": 0.33095234632492065,
"learning_rate": 2e-05,
"loss": 0.5891,
"step": 1750
},
{
"epoch": 0.0705439095755341,
"grad_norm": 0.38446444272994995,
"learning_rate": 2e-05,
"loss": 0.5971,
"step": 1760
},
{
"epoch": 0.0709447272435769,
"grad_norm": 0.4128134250640869,
"learning_rate": 2e-05,
"loss": 0.5613,
"step": 1770
},
{
"epoch": 0.07134554491161971,
"grad_norm": 0.33474040031433105,
"learning_rate": 2e-05,
"loss": 0.5702,
"step": 1780
},
{
"epoch": 0.0717463625796625,
"grad_norm": 0.36933767795562744,
"learning_rate": 2e-05,
"loss": 0.5887,
"step": 1790
},
{
"epoch": 0.07214718024770532,
"grad_norm": 0.40623337030410767,
"learning_rate": 2e-05,
"loss": 0.5752,
"step": 1800
},
{
"epoch": 0.07254799791574813,
"grad_norm": 0.34252020716667175,
"learning_rate": 2e-05,
"loss": 0.5703,
"step": 1810
},
{
"epoch": 0.07294881558379093,
"grad_norm": 0.3257846236228943,
"learning_rate": 2e-05,
"loss": 0.5845,
"step": 1820
},
{
"epoch": 0.07334963325183375,
"grad_norm": 0.3836072087287903,
"learning_rate": 2e-05,
"loss": 0.5863,
"step": 1830
},
{
"epoch": 0.07375045091987655,
"grad_norm": 0.4434497058391571,
"learning_rate": 2e-05,
"loss": 0.5607,
"step": 1840
},
{
"epoch": 0.07415126858791936,
"grad_norm": 0.369035929441452,
"learning_rate": 2e-05,
"loss": 0.5759,
"step": 1850
},
{
"epoch": 0.07455208625596216,
"grad_norm": 0.4021732807159424,
"learning_rate": 2e-05,
"loss": 0.5941,
"step": 1860
},
{
"epoch": 0.07495290392400497,
"grad_norm": 0.343211829662323,
"learning_rate": 2e-05,
"loss": 0.6035,
"step": 1870
},
{
"epoch": 0.07535372159204778,
"grad_norm": 0.3816221356391907,
"learning_rate": 2e-05,
"loss": 0.5661,
"step": 1880
},
{
"epoch": 0.07575453926009058,
"grad_norm": 0.35929223895072937,
"learning_rate": 2e-05,
"loss": 0.5867,
"step": 1890
},
{
"epoch": 0.0761553569281334,
"grad_norm": 0.36963996291160583,
"learning_rate": 2e-05,
"loss": 0.5842,
"step": 1900
},
{
"epoch": 0.0765561745961762,
"grad_norm": 0.4415839612483978,
"learning_rate": 2e-05,
"loss": 0.6102,
"step": 1910
},
{
"epoch": 0.07695699226421901,
"grad_norm": 0.3494766354560852,
"learning_rate": 2e-05,
"loss": 0.5586,
"step": 1920
},
{
"epoch": 0.07735780993226181,
"grad_norm": 0.434241384267807,
"learning_rate": 2e-05,
"loss": 0.609,
"step": 1930
},
{
"epoch": 0.07775862760030462,
"grad_norm": 0.39981046319007874,
"learning_rate": 2e-05,
"loss": 0.5942,
"step": 1940
},
{
"epoch": 0.07815944526834744,
"grad_norm": 0.3525627553462982,
"learning_rate": 2e-05,
"loss": 0.5905,
"step": 1950
},
{
"epoch": 0.07856026293639023,
"grad_norm": 0.48807239532470703,
"learning_rate": 2e-05,
"loss": 0.5696,
"step": 1960
},
{
"epoch": 0.07896108060443305,
"grad_norm": 0.35398364067077637,
"learning_rate": 2e-05,
"loss": 0.5505,
"step": 1970
},
{
"epoch": 0.07936189827247585,
"grad_norm": 0.4212177097797394,
"learning_rate": 2e-05,
"loss": 0.582,
"step": 1980
},
{
"epoch": 0.07976271594051866,
"grad_norm": 0.33485740423202515,
"learning_rate": 2e-05,
"loss": 0.5564,
"step": 1990
},
{
"epoch": 0.08016353360856146,
"grad_norm": 0.39947226643562317,
"learning_rate": 2e-05,
"loss": 0.562,
"step": 2000
},
{
"epoch": 0.08056435127660427,
"grad_norm": 0.3385741412639618,
"learning_rate": 2e-05,
"loss": 0.6098,
"step": 2010
},
{
"epoch": 0.08096516894464709,
"grad_norm": 0.3568948209285736,
"learning_rate": 2e-05,
"loss": 0.5853,
"step": 2020
},
{
"epoch": 0.08136598661268989,
"grad_norm": 0.36856064200401306,
"learning_rate": 2e-05,
"loss": 0.5616,
"step": 2030
}
],
"logging_steps": 10,
"max_steps": 5935,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 2035,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.084295122442519e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}