rqadri's picture
Upload folder using huggingface_hub
ace5ef4 verified
Raw History Blame Contribute Delete
33.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.1262406947890819,
"eval_steps": 500,
"global_step": 2035,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0006203473945409429,
"grad_norm": 1.103378415107727,
"learning_rate": 2.910112359550562e-06,
"loss": 0.8492,
"step": 10
},
{
"epoch": 0.0012406947890818859,
"grad_norm": 0.9267538189888,
"learning_rate": 3.921348314606742e-06,
"loss": 0.7944,
"step": 20
},
{
"epoch": 0.0018610421836228288,
"grad_norm": 0.8842476606369019,
"learning_rate": 4.932584269662922e-06,
"loss": 0.7628,
"step": 30
},
{
"epoch": 0.0024813895781637717,
"grad_norm": 0.8289238810539246,
"learning_rate": 5.943820224719102e-06,
"loss": 0.7342,
"step": 40
},
{
"epoch": 0.003101736972704715,
"grad_norm": 0.9065801501274109,
"learning_rate": 6.955056179775282e-06,
"loss": 0.7217,
"step": 50
},
{
"epoch": 0.0037220843672456576,
"grad_norm": 0.8170527815818787,
"learning_rate": 7.966292134831462e-06,
"loss": 0.73,
"step": 60
},
{
"epoch": 0.004342431761786601,
"grad_norm": 0.8123277425765991,
"learning_rate": 8.977528089887641e-06,
"loss": 0.7154,
"step": 70
},
{
"epoch": 0.004962779156327543,
"grad_norm": 0.7789028882980347,
"learning_rate": 9.988764044943822e-06,
"loss": 0.7083,
"step": 80
},
{
"epoch": 0.005583126550868486,
"grad_norm": 0.7920109033584595,
"learning_rate": 1.1000000000000001e-05,
"loss": 0.7252,
"step": 90
},
{
"epoch": 0.00620347394540943,
"grad_norm": 0.9307668209075928,
"learning_rate": 1.2011235955056182e-05,
"loss": 0.6857,
"step": 100
},
{
"epoch": 0.006823821339950372,
"grad_norm": 0.8309650421142578,
"learning_rate": 1.3022471910112362e-05,
"loss": 0.7,
"step": 110
},
{
"epoch": 0.007444168734491315,
"grad_norm": 0.907129168510437,
"learning_rate": 1.403370786516854e-05,
"loss": 0.7132,
"step": 120
},
{
"epoch": 0.008064516129032258,
"grad_norm": 0.8221721649169922,
"learning_rate": 1.504494382022472e-05,
"loss": 0.7001,
"step": 130
},
{
"epoch": 0.008684863523573201,
"grad_norm": 0.701308012008667,
"learning_rate": 1.60561797752809e-05,
"loss": 0.699,
"step": 140
},
{
"epoch": 0.009305210918114143,
"grad_norm": 0.7170705199241638,
"learning_rate": 1.706741573033708e-05,
"loss": 0.6725,
"step": 150
},
{
"epoch": 0.009925558312655087,
"grad_norm": 0.8029273152351379,
"learning_rate": 1.8078651685393256e-05,
"loss": 0.6839,
"step": 160
},
{
"epoch": 0.01054590570719603,
"grad_norm": 0.7059943079948425,
"learning_rate": 1.908988764044944e-05,
"loss": 0.6963,
"step": 170
},
{
"epoch": 0.011166253101736972,
"grad_norm": 0.7652074694633484,
"learning_rate": 2e-05,
"loss": 0.6906,
"step": 180
},
{
"epoch": 0.011786600496277916,
"grad_norm": 0.777823269367218,
"learning_rate": 2e-05,
"loss": 0.6697,
"step": 190
},
{
"epoch": 0.01240694789081886,
"grad_norm": 0.7011638879776001,
"learning_rate": 2e-05,
"loss": 0.6886,
"step": 200
},
{
"epoch": 0.013027295285359801,
"grad_norm": 0.7449702024459839,
"learning_rate": 2e-05,
"loss": 0.6957,
"step": 210
},
{
"epoch": 0.013647642679900745,
"grad_norm": 0.7148544192314148,
"learning_rate": 2e-05,
"loss": 0.6679,
"step": 220
},
{
"epoch": 0.014267990074441687,
"grad_norm": 0.6491106748580933,
"learning_rate": 2e-05,
"loss": 0.6916,
"step": 230
},
{
"epoch": 0.01488833746898263,
"grad_norm": 0.5647692084312439,
"learning_rate": 2e-05,
"loss": 0.6986,
"step": 240
},
{
"epoch": 0.015508684863523574,
"grad_norm": 0.5894495844841003,
"learning_rate": 2e-05,
"loss": 0.7308,
"step": 250
},
{
"epoch": 0.016129032258064516,
"grad_norm": 0.5743111371994019,
"learning_rate": 2e-05,
"loss": 0.6988,
"step": 260
},
{
"epoch": 0.016749379652605458,
"grad_norm": 0.5293608903884888,
"learning_rate": 2e-05,
"loss": 0.6821,
"step": 270
},
{
"epoch": 0.017369727047146403,
"grad_norm": 0.5631842613220215,
"learning_rate": 2e-05,
"loss": 0.6701,
"step": 280
},
{
"epoch": 0.017990074441687345,
"grad_norm": 0.5677319765090942,
"learning_rate": 2e-05,
"loss": 0.7191,
"step": 290
},
{
"epoch": 0.018610421836228287,
"grad_norm": 0.5547688603401184,
"learning_rate": 2e-05,
"loss": 0.7094,
"step": 300
},
{
"epoch": 0.019230769230769232,
"grad_norm": 0.5547721982002258,
"learning_rate": 2e-05,
"loss": 0.6783,
"step": 310
},
{
"epoch": 0.019851116625310174,
"grad_norm": 0.5873662829399109,
"learning_rate": 2e-05,
"loss": 0.707,
"step": 320
},
{
"epoch": 0.020471464019851116,
"grad_norm": 0.5058910846710205,
"learning_rate": 2e-05,
"loss": 0.663,
"step": 330
},
{
"epoch": 0.02109181141439206,
"grad_norm": 0.4962847828865051,
"learning_rate": 2e-05,
"loss": 0.6727,
"step": 340
},
{
"epoch": 0.021712158808933003,
"grad_norm": 0.49221107363700867,
"learning_rate": 2e-05,
"loss": 0.666,
"step": 350
},
{
"epoch": 0.022332506203473945,
"grad_norm": 0.4796120822429657,
"learning_rate": 2e-05,
"loss": 0.6665,
"step": 360
},
{
"epoch": 0.02295285359801489,
"grad_norm": 0.5007806420326233,
"learning_rate": 2e-05,
"loss": 0.6865,
"step": 370
},
{
"epoch": 0.02357320099255583,
"grad_norm": 0.5052497386932373,
"learning_rate": 2e-05,
"loss": 0.67,
"step": 380
},
{
"epoch": 0.024193548387096774,
"grad_norm": 0.4976111948490143,
"learning_rate": 2e-05,
"loss": 0.6971,
"step": 390
},
{
"epoch": 0.02481389578163772,
"grad_norm": 0.489734947681427,
"learning_rate": 2e-05,
"loss": 0.7244,
"step": 400
},
{
"epoch": 0.02543424317617866,
"grad_norm": 0.504808783531189,
"learning_rate": 2e-05,
"loss": 0.6574,
"step": 410
},
{
"epoch": 0.026054590570719603,
"grad_norm": 0.5242099761962891,
"learning_rate": 2e-05,
"loss": 0.6793,
"step": 420
},
{
"epoch": 0.026674937965260544,
"grad_norm": 0.48700666427612305,
"learning_rate": 2e-05,
"loss": 0.6733,
"step": 430
},
{
"epoch": 0.02729528535980149,
"grad_norm": 0.5279196500778198,
"learning_rate": 2e-05,
"loss": 0.6807,
"step": 440
},
{
"epoch": 0.02791563275434243,
"grad_norm": 1.6781505346298218,
"learning_rate": 2e-05,
"loss": 0.7033,
"step": 450
},
{
"epoch": 0.028535980148883373,
"grad_norm": 0.589901328086853,
"learning_rate": 2e-05,
"loss": 0.7007,
"step": 460
},
{
"epoch": 0.02915632754342432,
"grad_norm": 0.9268983006477356,
"learning_rate": 2e-05,
"loss": 0.6832,
"step": 470
},
{
"epoch": 0.02977667493796526,
"grad_norm": 0.47625434398651123,
"learning_rate": 2e-05,
"loss": 0.6953,
"step": 480
},
{
"epoch": 0.030397022332506202,
"grad_norm": 0.5042843818664551,
"learning_rate": 2e-05,
"loss": 0.6592,
"step": 490
},
{
"epoch": 0.031017369727047148,
"grad_norm": 0.44941166043281555,
"learning_rate": 2e-05,
"loss": 0.695,
"step": 500
},
{
"epoch": 0.03163771712158809,
"grad_norm": 0.477464497089386,
"learning_rate": 2e-05,
"loss": 0.6707,
"step": 510
},
{
"epoch": 0.03225806451612903,
"grad_norm": 0.4819585680961609,
"learning_rate": 2e-05,
"loss": 0.6708,
"step": 520
},
{
"epoch": 0.03287841191066997,
"grad_norm": 0.4723353981971741,
"learning_rate": 2e-05,
"loss": 0.6615,
"step": 530
},
{
"epoch": 0.033498759305210915,
"grad_norm": 0.4481304883956909,
"learning_rate": 2e-05,
"loss": 0.6716,
"step": 540
},
{
"epoch": 0.034119106699751864,
"grad_norm": 0.4634115993976593,
"learning_rate": 2e-05,
"loss": 0.6564,
"step": 550
},
{
"epoch": 0.034739454094292806,
"grad_norm": 0.4898909628391266,
"learning_rate": 2e-05,
"loss": 0.6783,
"step": 560
},
{
"epoch": 0.03535980148883375,
"grad_norm": 0.49201110005378723,
"learning_rate": 2e-05,
"loss": 0.6679,
"step": 570
},
{
"epoch": 0.03598014888337469,
"grad_norm": 0.4393959045410156,
"learning_rate": 2e-05,
"loss": 0.6984,
"step": 580
},
{
"epoch": 0.03660049627791563,
"grad_norm": 0.4818369746208191,
"learning_rate": 2e-05,
"loss": 0.6841,
"step": 590
},
{
"epoch": 0.03722084367245657,
"grad_norm": 0.4339914917945862,
"learning_rate": 2e-05,
"loss": 0.6787,
"step": 600
},
{
"epoch": 0.03784119106699752,
"grad_norm": 0.43327295780181885,
"learning_rate": 2e-05,
"loss": 0.6796,
"step": 610
},
{
"epoch": 0.038461538461538464,
"grad_norm": 0.4560607969760895,
"learning_rate": 2e-05,
"loss": 0.6468,
"step": 620
},
{
"epoch": 0.039081885856079406,
"grad_norm": 0.47957178950309753,
"learning_rate": 2e-05,
"loss": 0.6495,
"step": 630
},
{
"epoch": 0.03970223325062035,
"grad_norm": 0.4618580639362335,
"learning_rate": 2e-05,
"loss": 0.669,
"step": 640
},
{
"epoch": 0.04032258064516129,
"grad_norm": 0.505342423915863,
"learning_rate": 2e-05,
"loss": 0.6767,
"step": 650
},
{
"epoch": 0.04094292803970223,
"grad_norm": 0.48456406593322754,
"learning_rate": 2e-05,
"loss": 0.6804,
"step": 660
},
{
"epoch": 0.04156327543424317,
"grad_norm": 0.44942647218704224,
"learning_rate": 2e-05,
"loss": 0.6661,
"step": 670
},
{
"epoch": 0.04218362282878412,
"grad_norm": 0.4639962315559387,
"learning_rate": 2e-05,
"loss": 0.6796,
"step": 680
},
{
"epoch": 0.042803970223325064,
"grad_norm": 0.46533408761024475,
"learning_rate": 2e-05,
"loss": 0.6875,
"step": 690
},
{
"epoch": 0.043424317617866005,
"grad_norm": 0.42894449830055237,
"learning_rate": 2e-05,
"loss": 0.6436,
"step": 700
},
{
"epoch": 0.04404466501240695,
"grad_norm": 0.5065799951553345,
"learning_rate": 2e-05,
"loss": 0.6714,
"step": 710
},
{
"epoch": 0.04466501240694789,
"grad_norm": 0.4446672797203064,
"learning_rate": 2e-05,
"loss": 0.6871,
"step": 720
},
{
"epoch": 0.04528535980148883,
"grad_norm": 0.4434851109981537,
"learning_rate": 2e-05,
"loss": 0.6584,
"step": 730
},
{
"epoch": 0.04590570719602978,
"grad_norm": 0.5027102828025818,
"learning_rate": 2e-05,
"loss": 0.6791,
"step": 740
},
{
"epoch": 0.04652605459057072,
"grad_norm": 0.4595511853694916,
"learning_rate": 2e-05,
"loss": 0.6911,
"step": 750
},
{
"epoch": 0.04714640198511166,
"grad_norm": 0.4787590801715851,
"learning_rate": 2e-05,
"loss": 0.6868,
"step": 760
},
{
"epoch": 0.047766749379652605,
"grad_norm": 0.4960077106952667,
"learning_rate": 2e-05,
"loss": 0.6664,
"step": 770
},
{
"epoch": 0.04838709677419355,
"grad_norm": 0.4341469705104828,
"learning_rate": 2e-05,
"loss": 0.6501,
"step": 780
},
{
"epoch": 0.04900744416873449,
"grad_norm": 0.4147971272468567,
"learning_rate": 2e-05,
"loss": 0.6439,
"step": 790
},
{
"epoch": 0.04962779156327544,
"grad_norm": 0.4606212377548218,
"learning_rate": 2e-05,
"loss": 0.6964,
"step": 800
},
{
"epoch": 0.05024813895781638,
"grad_norm": 0.4221757650375366,
"learning_rate": 2e-05,
"loss": 0.6598,
"step": 810
},
{
"epoch": 0.05086848635235732,
"grad_norm": 0.46451857686042786,
"learning_rate": 2e-05,
"loss": 0.6503,
"step": 820
},
{
"epoch": 0.05148883374689826,
"grad_norm": 0.4234520196914673,
"learning_rate": 2e-05,
"loss": 0.6702,
"step": 830
},
{
"epoch": 0.052109181141439205,
"grad_norm": 0.5181183218955994,
"learning_rate": 2e-05,
"loss": 0.703,
"step": 840
},
{
"epoch": 0.05272952853598015,
"grad_norm": 0.43921777606010437,
"learning_rate": 2e-05,
"loss": 0.6777,
"step": 850
},
{
"epoch": 0.05334987593052109,
"grad_norm": 0.4488343894481659,
"learning_rate": 2e-05,
"loss": 0.6661,
"step": 860
},
{
"epoch": 0.05397022332506204,
"grad_norm": 0.45838460326194763,
"learning_rate": 2e-05,
"loss": 0.6438,
"step": 870
},
{
"epoch": 0.05459057071960298,
"grad_norm": 0.42543938755989075,
"learning_rate": 2e-05,
"loss": 0.6781,
"step": 880
},
{
"epoch": 0.05521091811414392,
"grad_norm": 0.44000378251075745,
"learning_rate": 2e-05,
"loss": 0.656,
"step": 890
},
{
"epoch": 0.05583126550868486,
"grad_norm": 0.4415980279445648,
"learning_rate": 2e-05,
"loss": 0.66,
"step": 900
},
{
"epoch": 0.056451612903225805,
"grad_norm": 0.4455133378505707,
"learning_rate": 2e-05,
"loss": 0.6633,
"step": 910
},
{
"epoch": 0.05707196029776675,
"grad_norm": 0.44925546646118164,
"learning_rate": 2e-05,
"loss": 0.6833,
"step": 920
},
{
"epoch": 0.057692307692307696,
"grad_norm": 0.7831513285636902,
"learning_rate": 2e-05,
"loss": 0.6649,
"step": 930
},
{
"epoch": 0.05831265508684864,
"grad_norm": 0.5281955003738403,
"learning_rate": 2e-05,
"loss": 0.66,
"step": 940
},
{
"epoch": 0.05893300248138958,
"grad_norm": 0.43578600883483887,
"learning_rate": 2e-05,
"loss": 0.6886,
"step": 950
},
{
"epoch": 0.05955334987593052,
"grad_norm": 0.43332430720329285,
"learning_rate": 2e-05,
"loss": 0.6617,
"step": 960
},
{
"epoch": 0.06017369727047146,
"grad_norm": 0.46484294533729553,
"learning_rate": 2e-05,
"loss": 0.6435,
"step": 970
},
{
"epoch": 0.060794044665012405,
"grad_norm": 0.41882455348968506,
"learning_rate": 2e-05,
"loss": 0.6602,
"step": 980
},
{
"epoch": 0.06141439205955335,
"grad_norm": 0.4295177757740021,
"learning_rate": 2e-05,
"loss": 0.6784,
"step": 990
},
{
"epoch": 0.062034739454094295,
"grad_norm": 0.4727322459220886,
"learning_rate": 2e-05,
"loss": 0.6818,
"step": 1000
},
{
"epoch": 0.06265508684863523,
"grad_norm": 0.430388480424881,
"learning_rate": 2e-05,
"loss": 0.6579,
"step": 1010
},
{
"epoch": 0.06327543424317618,
"grad_norm": 0.3914746642112732,
"learning_rate": 2e-05,
"loss": 0.6793,
"step": 1020
},
{
"epoch": 0.06389578163771713,
"grad_norm": 0.4640097916126251,
"learning_rate": 2e-05,
"loss": 0.6454,
"step": 1030
},
{
"epoch": 0.06451612903225806,
"grad_norm": 0.43572962284088135,
"learning_rate": 2e-05,
"loss": 0.6644,
"step": 1040
},
{
"epoch": 0.06513647642679901,
"grad_norm": 0.42249470949172974,
"learning_rate": 2e-05,
"loss": 0.659,
"step": 1050
},
{
"epoch": 0.06575682382133995,
"grad_norm": 0.45737001299858093,
"learning_rate": 2e-05,
"loss": 0.6563,
"step": 1060
},
{
"epoch": 0.0663771712158809,
"grad_norm": 0.39258211851119995,
"learning_rate": 2e-05,
"loss": 0.67,
"step": 1070
},
{
"epoch": 0.06699751861042183,
"grad_norm": 0.4379409849643707,
"learning_rate": 2e-05,
"loss": 0.6729,
"step": 1080
},
{
"epoch": 0.06761786600496278,
"grad_norm": 0.3982328474521637,
"learning_rate": 2e-05,
"loss": 0.659,
"step": 1090
},
{
"epoch": 0.06823821339950373,
"grad_norm": 0.42903372645378113,
"learning_rate": 2e-05,
"loss": 0.6594,
"step": 1100
},
{
"epoch": 0.06885856079404466,
"grad_norm": 0.4348221719264984,
"learning_rate": 2e-05,
"loss": 0.6313,
"step": 1110
},
{
"epoch": 0.06947890818858561,
"grad_norm": 0.43977659940719604,
"learning_rate": 2e-05,
"loss": 0.7013,
"step": 1120
},
{
"epoch": 0.07009925558312655,
"grad_norm": 0.41244375705718994,
"learning_rate": 2e-05,
"loss": 0.6474,
"step": 1130
},
{
"epoch": 0.0707196029776675,
"grad_norm": 0.4200294613838196,
"learning_rate": 2e-05,
"loss": 0.6853,
"step": 1140
},
{
"epoch": 0.07133995037220843,
"grad_norm": 0.4071672856807709,
"learning_rate": 2e-05,
"loss": 0.6773,
"step": 1150
},
{
"epoch": 0.07196029776674938,
"grad_norm": 0.4591241776943207,
"learning_rate": 2e-05,
"loss": 0.6901,
"step": 1160
},
{
"epoch": 0.07258064516129033,
"grad_norm": 0.4510512948036194,
"learning_rate": 2e-05,
"loss": 0.6751,
"step": 1170
},
{
"epoch": 0.07320099255583126,
"grad_norm": 0.4550836980342865,
"learning_rate": 2e-05,
"loss": 0.6745,
"step": 1180
},
{
"epoch": 0.07382133995037221,
"grad_norm": 0.42455634474754333,
"learning_rate": 2e-05,
"loss": 0.6852,
"step": 1190
},
{
"epoch": 0.07444168734491315,
"grad_norm": 0.4288151264190674,
"learning_rate": 2e-05,
"loss": 0.6362,
"step": 1200
},
{
"epoch": 0.0750620347394541,
"grad_norm": 0.41488656401634216,
"learning_rate": 2e-05,
"loss": 0.6555,
"step": 1210
},
{
"epoch": 0.07568238213399504,
"grad_norm": 0.41888904571533203,
"learning_rate": 2e-05,
"loss": 0.6405,
"step": 1220
},
{
"epoch": 0.07630272952853598,
"grad_norm": 0.42407098412513733,
"learning_rate": 2e-05,
"loss": 0.6869,
"step": 1230
},
{
"epoch": 0.07692307692307693,
"grad_norm": 0.43882668018341064,
"learning_rate": 2e-05,
"loss": 0.6697,
"step": 1240
},
{
"epoch": 0.07754342431761786,
"grad_norm": 0.463724285364151,
"learning_rate": 2e-05,
"loss": 0.6606,
"step": 1250
},
{
"epoch": 0.07816377171215881,
"grad_norm": 0.4122724235057831,
"learning_rate": 2e-05,
"loss": 0.683,
"step": 1260
},
{
"epoch": 0.07878411910669975,
"grad_norm": 0.4170853793621063,
"learning_rate": 2e-05,
"loss": 0.6469,
"step": 1270
},
{
"epoch": 0.0794044665012407,
"grad_norm": 0.41887524724006653,
"learning_rate": 2e-05,
"loss": 0.6613,
"step": 1280
},
{
"epoch": 0.08002481389578164,
"grad_norm": 0.5110520720481873,
"learning_rate": 2e-05,
"loss": 0.6481,
"step": 1290
},
{
"epoch": 0.08064516129032258,
"grad_norm": 0.5727337002754211,
"learning_rate": 2e-05,
"loss": 0.6602,
"step": 1300
},
{
"epoch": 0.08126550868486353,
"grad_norm": 0.45020315051078796,
"learning_rate": 2e-05,
"loss": 0.6905,
"step": 1310
},
{
"epoch": 0.08188585607940446,
"grad_norm": 0.41866007447242737,
"learning_rate": 2e-05,
"loss": 0.6458,
"step": 1320
},
{
"epoch": 0.08250620347394541,
"grad_norm": 0.4124995768070221,
"learning_rate": 2e-05,
"loss": 0.6476,
"step": 1330
},
{
"epoch": 0.08312655086848635,
"grad_norm": 0.45238474011421204,
"learning_rate": 2e-05,
"loss": 0.6722,
"step": 1340
},
{
"epoch": 0.0837468982630273,
"grad_norm": 0.44636914134025574,
"learning_rate": 2e-05,
"loss": 0.6828,
"step": 1350
},
{
"epoch": 0.08436724565756824,
"grad_norm": 0.42632195353507996,
"learning_rate": 2e-05,
"loss": 0.6974,
"step": 1360
},
{
"epoch": 0.08498759305210918,
"grad_norm": 0.4126355051994324,
"learning_rate": 2e-05,
"loss": 0.6542,
"step": 1370
},
{
"epoch": 0.08560794044665013,
"grad_norm": 0.4650143086910248,
"learning_rate": 2e-05,
"loss": 0.6402,
"step": 1380
},
{
"epoch": 0.08622828784119106,
"grad_norm": 0.4254385530948639,
"learning_rate": 2e-05,
"loss": 0.6196,
"step": 1390
},
{
"epoch": 0.08684863523573201,
"grad_norm": 0.5174993872642517,
"learning_rate": 2e-05,
"loss": 0.6566,
"step": 1400
},
{
"epoch": 0.08746898263027296,
"grad_norm": 0.4466327428817749,
"learning_rate": 2e-05,
"loss": 0.6777,
"step": 1410
},
{
"epoch": 0.0880893300248139,
"grad_norm": 0.4639355540275574,
"learning_rate": 2e-05,
"loss": 0.6518,
"step": 1420
},
{
"epoch": 0.08870967741935484,
"grad_norm": 0.49918368458747864,
"learning_rate": 2e-05,
"loss": 0.666,
"step": 1430
},
{
"epoch": 0.08933002481389578,
"grad_norm": 0.45220839977264404,
"learning_rate": 2e-05,
"loss": 0.6626,
"step": 1440
},
{
"epoch": 0.08995037220843673,
"grad_norm": 0.40696123242378235,
"learning_rate": 2e-05,
"loss": 0.6591,
"step": 1450
},
{
"epoch": 0.09057071960297766,
"grad_norm": 0.42498070001602173,
"learning_rate": 2e-05,
"loss": 0.6532,
"step": 1460
},
{
"epoch": 0.09119106699751861,
"grad_norm": 0.4117129147052765,
"learning_rate": 2e-05,
"loss": 0.6272,
"step": 1470
},
{
"epoch": 0.09181141439205956,
"grad_norm": 0.4506339132785797,
"learning_rate": 2e-05,
"loss": 0.6609,
"step": 1480
},
{
"epoch": 0.0924317617866005,
"grad_norm": 0.40215933322906494,
"learning_rate": 2e-05,
"loss": 0.6653,
"step": 1490
},
{
"epoch": 0.09305210918114144,
"grad_norm": 0.4949316382408142,
"learning_rate": 2e-05,
"loss": 0.6583,
"step": 1500
},
{
"epoch": 0.09367245657568238,
"grad_norm": 0.45883846282958984,
"learning_rate": 2e-05,
"loss": 0.6553,
"step": 1510
},
{
"epoch": 0.09429280397022333,
"grad_norm": 0.41736656427383423,
"learning_rate": 2e-05,
"loss": 0.6727,
"step": 1520
},
{
"epoch": 0.09491315136476426,
"grad_norm": 0.45958396792411804,
"learning_rate": 2e-05,
"loss": 0.6402,
"step": 1530
},
{
"epoch": 0.09553349875930521,
"grad_norm": 0.41696447134017944,
"learning_rate": 2e-05,
"loss": 0.669,
"step": 1540
},
{
"epoch": 0.09615384615384616,
"grad_norm": 0.45699238777160645,
"learning_rate": 2e-05,
"loss": 0.6421,
"step": 1550
},
{
"epoch": 0.0967741935483871,
"grad_norm": 0.46844539046287537,
"learning_rate": 2e-05,
"loss": 0.6628,
"step": 1560
},
{
"epoch": 0.09739454094292804,
"grad_norm": 0.4296782612800598,
"learning_rate": 2e-05,
"loss": 0.6468,
"step": 1570
},
{
"epoch": 0.09801488833746898,
"grad_norm": 0.43794864416122437,
"learning_rate": 2e-05,
"loss": 0.6708,
"step": 1580
},
{
"epoch": 0.09863523573200993,
"grad_norm": 0.4485463500022888,
"learning_rate": 2e-05,
"loss": 0.6537,
"step": 1590
},
{
"epoch": 0.09925558312655088,
"grad_norm": 0.44051381945610046,
"learning_rate": 2e-05,
"loss": 0.6378,
"step": 1600
},
{
"epoch": 0.09987593052109181,
"grad_norm": 0.44119101762771606,
"learning_rate": 2e-05,
"loss": 0.6503,
"step": 1610
},
{
"epoch": 0.10049627791563276,
"grad_norm": 0.4515126049518585,
"learning_rate": 2e-05,
"loss": 0.6647,
"step": 1620
},
{
"epoch": 0.1011166253101737,
"grad_norm": 0.4214085042476654,
"learning_rate": 2e-05,
"loss": 0.6483,
"step": 1630
},
{
"epoch": 0.10173697270471464,
"grad_norm": 0.4193068742752075,
"learning_rate": 2e-05,
"loss": 0.6685,
"step": 1640
},
{
"epoch": 0.10235732009925558,
"grad_norm": 0.4890860319137573,
"learning_rate": 2e-05,
"loss": 0.6529,
"step": 1650
},
{
"epoch": 0.10297766749379653,
"grad_norm": 0.5013541579246521,
"learning_rate": 2e-05,
"loss": 0.7078,
"step": 1660
},
{
"epoch": 0.10359801488833748,
"grad_norm": 0.4772087335586548,
"learning_rate": 2e-05,
"loss": 0.6574,
"step": 1670
},
{
"epoch": 0.10421836228287841,
"grad_norm": 0.5918506979942322,
"learning_rate": 2e-05,
"loss": 0.6668,
"step": 1680
},
{
"epoch": 0.10483870967741936,
"grad_norm": 0.42867156863212585,
"learning_rate": 2e-05,
"loss": 0.6556,
"step": 1690
},
{
"epoch": 0.1054590570719603,
"grad_norm": 0.4230250418186188,
"learning_rate": 2e-05,
"loss": 0.6564,
"step": 1700
},
{
"epoch": 0.10607940446650124,
"grad_norm": 0.4046623110771179,
"learning_rate": 2e-05,
"loss": 0.6691,
"step": 1710
},
{
"epoch": 0.10669975186104218,
"grad_norm": 0.4210417568683624,
"learning_rate": 2e-05,
"loss": 0.6675,
"step": 1720
},
{
"epoch": 0.10732009925558313,
"grad_norm": 0.4010581970214844,
"learning_rate": 2e-05,
"loss": 0.6402,
"step": 1730
},
{
"epoch": 0.10794044665012408,
"grad_norm": 0.4336850643157959,
"learning_rate": 2e-05,
"loss": 0.6568,
"step": 1740
},
{
"epoch": 0.10856079404466501,
"grad_norm": 0.43575379252433777,
"learning_rate": 2e-05,
"loss": 0.6493,
"step": 1750
},
{
"epoch": 0.10918114143920596,
"grad_norm": 0.42740049958229065,
"learning_rate": 2e-05,
"loss": 0.6571,
"step": 1760
},
{
"epoch": 0.1098014888337469,
"grad_norm": 0.4169295132160187,
"learning_rate": 2e-05,
"loss": 0.6611,
"step": 1770
},
{
"epoch": 0.11042183622828784,
"grad_norm": 0.5564378499984741,
"learning_rate": 2e-05,
"loss": 0.6532,
"step": 1780
},
{
"epoch": 0.11104218362282878,
"grad_norm": 0.45990580320358276,
"learning_rate": 2e-05,
"loss": 0.6262,
"step": 1790
},
{
"epoch": 0.11166253101736973,
"grad_norm": 0.4232894778251648,
"learning_rate": 2e-05,
"loss": 0.6729,
"step": 1800
},
{
"epoch": 0.11228287841191067,
"grad_norm": 0.49535107612609863,
"learning_rate": 2e-05,
"loss": 0.6808,
"step": 1810
},
{
"epoch": 0.11290322580645161,
"grad_norm": 0.4231373965740204,
"learning_rate": 2e-05,
"loss": 0.6731,
"step": 1820
},
{
"epoch": 0.11352357320099256,
"grad_norm": 0.42381367087364197,
"learning_rate": 2e-05,
"loss": 0.6672,
"step": 1830
},
{
"epoch": 0.1141439205955335,
"grad_norm": 0.40873488783836365,
"learning_rate": 2e-05,
"loss": 0.6471,
"step": 1840
},
{
"epoch": 0.11476426799007444,
"grad_norm": 0.4330880641937256,
"learning_rate": 2e-05,
"loss": 0.6653,
"step": 1850
},
{
"epoch": 0.11538461538461539,
"grad_norm": 0.47087201476097107,
"learning_rate": 2e-05,
"loss": 0.6865,
"step": 1860
},
{
"epoch": 0.11600496277915633,
"grad_norm": 0.49161598086357117,
"learning_rate": 2e-05,
"loss": 0.6625,
"step": 1870
},
{
"epoch": 0.11662531017369727,
"grad_norm": 0.40995311737060547,
"learning_rate": 2e-05,
"loss": 0.6421,
"step": 1880
},
{
"epoch": 0.11724565756823821,
"grad_norm": 0.40415555238723755,
"learning_rate": 2e-05,
"loss": 0.6407,
"step": 1890
},
{
"epoch": 0.11786600496277916,
"grad_norm": 0.42309048771858215,
"learning_rate": 2e-05,
"loss": 0.6524,
"step": 1900
},
{
"epoch": 0.1184863523573201,
"grad_norm": 0.428654283285141,
"learning_rate": 2e-05,
"loss": 0.6473,
"step": 1910
},
{
"epoch": 0.11910669975186104,
"grad_norm": 0.46681228280067444,
"learning_rate": 2e-05,
"loss": 0.665,
"step": 1920
},
{
"epoch": 0.11972704714640199,
"grad_norm": 0.5378752946853638,
"learning_rate": 2e-05,
"loss": 0.6888,
"step": 1930
},
{
"epoch": 0.12034739454094293,
"grad_norm": 0.3942810297012329,
"learning_rate": 2e-05,
"loss": 0.6693,
"step": 1940
},
{
"epoch": 0.12096774193548387,
"grad_norm": 0.40872716903686523,
"learning_rate": 2e-05,
"loss": 0.6564,
"step": 1950
},
{
"epoch": 0.12158808933002481,
"grad_norm": 0.4505879580974579,
"learning_rate": 2e-05,
"loss": 0.6651,
"step": 1960
},
{
"epoch": 0.12220843672456576,
"grad_norm": 0.46347737312316895,
"learning_rate": 2e-05,
"loss": 0.6682,
"step": 1970
},
{
"epoch": 0.1228287841191067,
"grad_norm": 0.4220800995826721,
"learning_rate": 2e-05,
"loss": 0.6633,
"step": 1980
},
{
"epoch": 0.12344913151364764,
"grad_norm": 0.39984744787216187,
"learning_rate": 2e-05,
"loss": 0.6379,
"step": 1990
},
{
"epoch": 0.12406947890818859,
"grad_norm": 0.42455461621284485,
"learning_rate": 2e-05,
"loss": 0.6442,
"step": 2000
},
{
"epoch": 0.12468982630272953,
"grad_norm": 0.4262460768222809,
"learning_rate": 2e-05,
"loss": 0.6385,
"step": 2010
},
{
"epoch": 0.12531017369727046,
"grad_norm": 0.42343422770500183,
"learning_rate": 2e-05,
"loss": 0.6541,
"step": 2020
},
{
"epoch": 0.1259305210918114,
"grad_norm": 0.4029340147972107,
"learning_rate": 2e-05,
"loss": 0.6776,
"step": 2030
}
],
"logging_steps": 10,
"max_steps": 5935,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 2035,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 9.084295122442519e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}