rqadri's picture
Upload folder using huggingface_hub
a224929 verified
Raw History Blame Contribute Delete
65.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.2524813895781638,
"eval_steps": 500,
"global_step": 4070,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0006203473945409429,
"grad_norm": 1.103378415107727,
"learning_rate": 2.910112359550562e-06,
"loss": 0.8492,
"step": 10
},
{
"epoch": 0.0012406947890818859,
"grad_norm": 0.9267538189888,
"learning_rate": 3.921348314606742e-06,
"loss": 0.7944,
"step": 20
},
{
"epoch": 0.0018610421836228288,
"grad_norm": 0.8842476606369019,
"learning_rate": 4.932584269662922e-06,
"loss": 0.7628,
"step": 30
},
{
"epoch": 0.0024813895781637717,
"grad_norm": 0.8289238810539246,
"learning_rate": 5.943820224719102e-06,
"loss": 0.7342,
"step": 40
},
{
"epoch": 0.003101736972704715,
"grad_norm": 0.9065801501274109,
"learning_rate": 6.955056179775282e-06,
"loss": 0.7217,
"step": 50
},
{
"epoch": 0.0037220843672456576,
"grad_norm": 0.8170527815818787,
"learning_rate": 7.966292134831462e-06,
"loss": 0.73,
"step": 60
},
{
"epoch": 0.004342431761786601,
"grad_norm": 0.8123277425765991,
"learning_rate": 8.977528089887641e-06,
"loss": 0.7154,
"step": 70
},
{
"epoch": 0.004962779156327543,
"grad_norm": 0.7789028882980347,
"learning_rate": 9.988764044943822e-06,
"loss": 0.7083,
"step": 80
},
{
"epoch": 0.005583126550868486,
"grad_norm": 0.7920109033584595,
"learning_rate": 1.1000000000000001e-05,
"loss": 0.7252,
"step": 90
},
{
"epoch": 0.00620347394540943,
"grad_norm": 0.9307668209075928,
"learning_rate": 1.2011235955056182e-05,
"loss": 0.6857,
"step": 100
},
{
"epoch": 0.006823821339950372,
"grad_norm": 0.8309650421142578,
"learning_rate": 1.3022471910112362e-05,
"loss": 0.7,
"step": 110
},
{
"epoch": 0.007444168734491315,
"grad_norm": 0.907129168510437,
"learning_rate": 1.403370786516854e-05,
"loss": 0.7132,
"step": 120
},
{
"epoch": 0.008064516129032258,
"grad_norm": 0.8221721649169922,
"learning_rate": 1.504494382022472e-05,
"loss": 0.7001,
"step": 130
},
{
"epoch": 0.008684863523573201,
"grad_norm": 0.701308012008667,
"learning_rate": 1.60561797752809e-05,
"loss": 0.699,
"step": 140
},
{
"epoch": 0.009305210918114143,
"grad_norm": 0.7170705199241638,
"learning_rate": 1.706741573033708e-05,
"loss": 0.6725,
"step": 150
},
{
"epoch": 0.009925558312655087,
"grad_norm": 0.8029273152351379,
"learning_rate": 1.8078651685393256e-05,
"loss": 0.6839,
"step": 160
},
{
"epoch": 0.01054590570719603,
"grad_norm": 0.7059943079948425,
"learning_rate": 1.908988764044944e-05,
"loss": 0.6963,
"step": 170
},
{
"epoch": 0.011166253101736972,
"grad_norm": 0.7652074694633484,
"learning_rate": 2e-05,
"loss": 0.6906,
"step": 180
},
{
"epoch": 0.011786600496277916,
"grad_norm": 0.777823269367218,
"learning_rate": 2e-05,
"loss": 0.6697,
"step": 190
},
{
"epoch": 0.01240694789081886,
"grad_norm": 0.7011638879776001,
"learning_rate": 2e-05,
"loss": 0.6886,
"step": 200
},
{
"epoch": 0.013027295285359801,
"grad_norm": 0.7449702024459839,
"learning_rate": 2e-05,
"loss": 0.6957,
"step": 210
},
{
"epoch": 0.013647642679900745,
"grad_norm": 0.7148544192314148,
"learning_rate": 2e-05,
"loss": 0.6679,
"step": 220
},
{
"epoch": 0.014267990074441687,
"grad_norm": 0.6491106748580933,
"learning_rate": 2e-05,
"loss": 0.6916,
"step": 230
},
{
"epoch": 0.01488833746898263,
"grad_norm": 0.5647692084312439,
"learning_rate": 2e-05,
"loss": 0.6986,
"step": 240
},
{
"epoch": 0.015508684863523574,
"grad_norm": 0.5894495844841003,
"learning_rate": 2e-05,
"loss": 0.7308,
"step": 250
},
{
"epoch": 0.016129032258064516,
"grad_norm": 0.5743111371994019,
"learning_rate": 2e-05,
"loss": 0.6988,
"step": 260
},
{
"epoch": 0.016749379652605458,
"grad_norm": 0.5293608903884888,
"learning_rate": 2e-05,
"loss": 0.6821,
"step": 270
},
{
"epoch": 0.017369727047146403,
"grad_norm": 0.5631842613220215,
"learning_rate": 2e-05,
"loss": 0.6701,
"step": 280
},
{
"epoch": 0.017990074441687345,
"grad_norm": 0.5677319765090942,
"learning_rate": 2e-05,
"loss": 0.7191,
"step": 290
},
{
"epoch": 0.018610421836228287,
"grad_norm": 0.5547688603401184,
"learning_rate": 2e-05,
"loss": 0.7094,
"step": 300
},
{
"epoch": 0.019230769230769232,
"grad_norm": 0.5547721982002258,
"learning_rate": 2e-05,
"loss": 0.6783,
"step": 310
},
{
"epoch": 0.019851116625310174,
"grad_norm": 0.5873662829399109,
"learning_rate": 2e-05,
"loss": 0.707,
"step": 320
},
{
"epoch": 0.020471464019851116,
"grad_norm": 0.5058910846710205,
"learning_rate": 2e-05,
"loss": 0.663,
"step": 330
},
{
"epoch": 0.02109181141439206,
"grad_norm": 0.4962847828865051,
"learning_rate": 2e-05,
"loss": 0.6727,
"step": 340
},
{
"epoch": 0.021712158808933003,
"grad_norm": 0.49221107363700867,
"learning_rate": 2e-05,
"loss": 0.666,
"step": 350
},
{
"epoch": 0.022332506203473945,
"grad_norm": 0.4796120822429657,
"learning_rate": 2e-05,
"loss": 0.6665,
"step": 360
},
{
"epoch": 0.02295285359801489,
"grad_norm": 0.5007806420326233,
"learning_rate": 2e-05,
"loss": 0.6865,
"step": 370
},
{
"epoch": 0.02357320099255583,
"grad_norm": 0.5052497386932373,
"learning_rate": 2e-05,
"loss": 0.67,
"step": 380
},
{
"epoch": 0.024193548387096774,
"grad_norm": 0.4976111948490143,
"learning_rate": 2e-05,
"loss": 0.6971,
"step": 390
},
{
"epoch": 0.02481389578163772,
"grad_norm": 0.489734947681427,
"learning_rate": 2e-05,
"loss": 0.7244,
"step": 400
},
{
"epoch": 0.02543424317617866,
"grad_norm": 0.504808783531189,
"learning_rate": 2e-05,
"loss": 0.6574,
"step": 410
},
{
"epoch": 0.026054590570719603,
"grad_norm": 0.5242099761962891,
"learning_rate": 2e-05,
"loss": 0.6793,
"step": 420
},
{
"epoch": 0.026674937965260544,
"grad_norm": 0.48700666427612305,
"learning_rate": 2e-05,
"loss": 0.6733,
"step": 430
},
{
"epoch": 0.02729528535980149,
"grad_norm": 0.5279196500778198,
"learning_rate": 2e-05,
"loss": 0.6807,
"step": 440
},
{
"epoch": 0.02791563275434243,
"grad_norm": 1.6781505346298218,
"learning_rate": 2e-05,
"loss": 0.7033,
"step": 450
},
{
"epoch": 0.028535980148883373,
"grad_norm": 0.589901328086853,
"learning_rate": 2e-05,
"loss": 0.7007,
"step": 460
},
{
"epoch": 0.02915632754342432,
"grad_norm": 0.9268983006477356,
"learning_rate": 2e-05,
"loss": 0.6832,
"step": 470
},
{
"epoch": 0.02977667493796526,
"grad_norm": 0.47625434398651123,
"learning_rate": 2e-05,
"loss": 0.6953,
"step": 480
},
{
"epoch": 0.030397022332506202,
"grad_norm": 0.5042843818664551,
"learning_rate": 2e-05,
"loss": 0.6592,
"step": 490
},
{
"epoch": 0.031017369727047148,
"grad_norm": 0.44941166043281555,
"learning_rate": 2e-05,
"loss": 0.695,
"step": 500
},
{
"epoch": 0.03163771712158809,
"grad_norm": 0.477464497089386,
"learning_rate": 2e-05,
"loss": 0.6707,
"step": 510
},
{
"epoch": 0.03225806451612903,
"grad_norm": 0.4819585680961609,
"learning_rate": 2e-05,
"loss": 0.6708,
"step": 520
},
{
"epoch": 0.03287841191066997,
"grad_norm": 0.4723353981971741,
"learning_rate": 2e-05,
"loss": 0.6615,
"step": 530
},
{
"epoch": 0.033498759305210915,
"grad_norm": 0.4481304883956909,
"learning_rate": 2e-05,
"loss": 0.6716,
"step": 540
},
{
"epoch": 0.034119106699751864,
"grad_norm": 0.4634115993976593,
"learning_rate": 2e-05,
"loss": 0.6564,
"step": 550
},
{
"epoch": 0.034739454094292806,
"grad_norm": 0.4898909628391266,
"learning_rate": 2e-05,
"loss": 0.6783,
"step": 560
},
{
"epoch": 0.03535980148883375,
"grad_norm": 0.49201110005378723,
"learning_rate": 2e-05,
"loss": 0.6679,
"step": 570
},
{
"epoch": 0.03598014888337469,
"grad_norm": 0.4393959045410156,
"learning_rate": 2e-05,
"loss": 0.6984,
"step": 580
},
{
"epoch": 0.03660049627791563,
"grad_norm": 0.4818369746208191,
"learning_rate": 2e-05,
"loss": 0.6841,
"step": 590
},
{
"epoch": 0.03722084367245657,
"grad_norm": 0.4339914917945862,
"learning_rate": 2e-05,
"loss": 0.6787,
"step": 600
},
{
"epoch": 0.03784119106699752,
"grad_norm": 0.43327295780181885,
"learning_rate": 2e-05,
"loss": 0.6796,
"step": 610
},
{
"epoch": 0.038461538461538464,
"grad_norm": 0.4560607969760895,
"learning_rate": 2e-05,
"loss": 0.6468,
"step": 620
},
{
"epoch": 0.039081885856079406,
"grad_norm": 0.47957178950309753,
"learning_rate": 2e-05,
"loss": 0.6495,
"step": 630
},
{
"epoch": 0.03970223325062035,
"grad_norm": 0.4618580639362335,
"learning_rate": 2e-05,
"loss": 0.669,
"step": 640
},
{
"epoch": 0.04032258064516129,
"grad_norm": 0.505342423915863,
"learning_rate": 2e-05,
"loss": 0.6767,
"step": 650
},
{
"epoch": 0.04094292803970223,
"grad_norm": 0.48456406593322754,
"learning_rate": 2e-05,
"loss": 0.6804,
"step": 660
},
{
"epoch": 0.04156327543424317,
"grad_norm": 0.44942647218704224,
"learning_rate": 2e-05,
"loss": 0.6661,
"step": 670
},
{
"epoch": 0.04218362282878412,
"grad_norm": 0.4639962315559387,
"learning_rate": 2e-05,
"loss": 0.6796,
"step": 680
},
{
"epoch": 0.042803970223325064,
"grad_norm": 0.46533408761024475,
"learning_rate": 2e-05,
"loss": 0.6875,
"step": 690
},
{
"epoch": 0.043424317617866005,
"grad_norm": 0.42894449830055237,
"learning_rate": 2e-05,
"loss": 0.6436,
"step": 700
},
{
"epoch": 0.04404466501240695,
"grad_norm": 0.5065799951553345,
"learning_rate": 2e-05,
"loss": 0.6714,
"step": 710
},
{
"epoch": 0.04466501240694789,
"grad_norm": 0.4446672797203064,
"learning_rate": 2e-05,
"loss": 0.6871,
"step": 720
},
{
"epoch": 0.04528535980148883,
"grad_norm": 0.4434851109981537,
"learning_rate": 2e-05,
"loss": 0.6584,
"step": 730
},
{
"epoch": 0.04590570719602978,
"grad_norm": 0.5027102828025818,
"learning_rate": 2e-05,
"loss": 0.6791,
"step": 740
},
{
"epoch": 0.04652605459057072,
"grad_norm": 0.4595511853694916,
"learning_rate": 2e-05,
"loss": 0.6911,
"step": 750
},
{
"epoch": 0.04714640198511166,
"grad_norm": 0.4787590801715851,
"learning_rate": 2e-05,
"loss": 0.6868,
"step": 760
},
{
"epoch": 0.047766749379652605,
"grad_norm": 0.4960077106952667,
"learning_rate": 2e-05,
"loss": 0.6664,
"step": 770
},
{
"epoch": 0.04838709677419355,
"grad_norm": 0.4341469705104828,
"learning_rate": 2e-05,
"loss": 0.6501,
"step": 780
},
{
"epoch": 0.04900744416873449,
"grad_norm": 0.4147971272468567,
"learning_rate": 2e-05,
"loss": 0.6439,
"step": 790
},
{
"epoch": 0.04962779156327544,
"grad_norm": 0.4606212377548218,
"learning_rate": 2e-05,
"loss": 0.6964,
"step": 800
},
{
"epoch": 0.05024813895781638,
"grad_norm": 0.4221757650375366,
"learning_rate": 2e-05,
"loss": 0.6598,
"step": 810
},
{
"epoch": 0.05086848635235732,
"grad_norm": 0.46451857686042786,
"learning_rate": 2e-05,
"loss": 0.6503,
"step": 820
},
{
"epoch": 0.05148883374689826,
"grad_norm": 0.4234520196914673,
"learning_rate": 2e-05,
"loss": 0.6702,
"step": 830
},
{
"epoch": 0.052109181141439205,
"grad_norm": 0.5181183218955994,
"learning_rate": 2e-05,
"loss": 0.703,
"step": 840
},
{
"epoch": 0.05272952853598015,
"grad_norm": 0.43921777606010437,
"learning_rate": 2e-05,
"loss": 0.6777,
"step": 850
},
{
"epoch": 0.05334987593052109,
"grad_norm": 0.4488343894481659,
"learning_rate": 2e-05,
"loss": 0.6661,
"step": 860
},
{
"epoch": 0.05397022332506204,
"grad_norm": 0.45838460326194763,
"learning_rate": 2e-05,
"loss": 0.6438,
"step": 870
},
{
"epoch": 0.05459057071960298,
"grad_norm": 0.42543938755989075,
"learning_rate": 2e-05,
"loss": 0.6781,
"step": 880
},
{
"epoch": 0.05521091811414392,
"grad_norm": 0.44000378251075745,
"learning_rate": 2e-05,
"loss": 0.656,
"step": 890
},
{
"epoch": 0.05583126550868486,
"grad_norm": 0.4415980279445648,
"learning_rate": 2e-05,
"loss": 0.66,
"step": 900
},
{
"epoch": 0.056451612903225805,
"grad_norm": 0.4455133378505707,
"learning_rate": 2e-05,
"loss": 0.6633,
"step": 910
},
{
"epoch": 0.05707196029776675,
"grad_norm": 0.44925546646118164,
"learning_rate": 2e-05,
"loss": 0.6833,
"step": 920
},
{
"epoch": 0.057692307692307696,
"grad_norm": 0.7831513285636902,
"learning_rate": 2e-05,
"loss": 0.6649,
"step": 930
},
{
"epoch": 0.05831265508684864,
"grad_norm": 0.5281955003738403,
"learning_rate": 2e-05,
"loss": 0.66,
"step": 940
},
{
"epoch": 0.05893300248138958,
"grad_norm": 0.43578600883483887,
"learning_rate": 2e-05,
"loss": 0.6886,
"step": 950
},
{
"epoch": 0.05955334987593052,
"grad_norm": 0.43332430720329285,
"learning_rate": 2e-05,
"loss": 0.6617,
"step": 960
},
{
"epoch": 0.06017369727047146,
"grad_norm": 0.46484294533729553,
"learning_rate": 2e-05,
"loss": 0.6435,
"step": 970
},
{
"epoch": 0.060794044665012405,
"grad_norm": 0.41882455348968506,
"learning_rate": 2e-05,
"loss": 0.6602,
"step": 980
},
{
"epoch": 0.06141439205955335,
"grad_norm": 0.4295177757740021,
"learning_rate": 2e-05,
"loss": 0.6784,
"step": 990
},
{
"epoch": 0.062034739454094295,
"grad_norm": 0.4727322459220886,
"learning_rate": 2e-05,
"loss": 0.6818,
"step": 1000
},
{
"epoch": 0.06265508684863523,
"grad_norm": 0.430388480424881,
"learning_rate": 2e-05,
"loss": 0.6579,
"step": 1010
},
{
"epoch": 0.06327543424317618,
"grad_norm": 0.3914746642112732,
"learning_rate": 2e-05,
"loss": 0.6793,
"step": 1020
},
{
"epoch": 0.06389578163771713,
"grad_norm": 0.4640097916126251,
"learning_rate": 2e-05,
"loss": 0.6454,
"step": 1030
},
{
"epoch": 0.06451612903225806,
"grad_norm": 0.43572962284088135,
"learning_rate": 2e-05,
"loss": 0.6644,
"step": 1040
},
{
"epoch": 0.06513647642679901,
"grad_norm": 0.42249470949172974,
"learning_rate": 2e-05,
"loss": 0.659,
"step": 1050
},
{
"epoch": 0.06575682382133995,
"grad_norm": 0.45737001299858093,
"learning_rate": 2e-05,
"loss": 0.6563,
"step": 1060
},
{
"epoch": 0.0663771712158809,
"grad_norm": 0.39258211851119995,
"learning_rate": 2e-05,
"loss": 0.67,
"step": 1070
},
{
"epoch": 0.06699751861042183,
"grad_norm": 0.4379409849643707,
"learning_rate": 2e-05,
"loss": 0.6729,
"step": 1080
},
{
"epoch": 0.06761786600496278,
"grad_norm": 0.3982328474521637,
"learning_rate": 2e-05,
"loss": 0.659,
"step": 1090
},
{
"epoch": 0.06823821339950373,
"grad_norm": 0.42903372645378113,
"learning_rate": 2e-05,
"loss": 0.6594,
"step": 1100
},
{
"epoch": 0.06885856079404466,
"grad_norm": 0.4348221719264984,
"learning_rate": 2e-05,
"loss": 0.6313,
"step": 1110
},
{
"epoch": 0.06947890818858561,
"grad_norm": 0.43977659940719604,
"learning_rate": 2e-05,
"loss": 0.7013,
"step": 1120
},
{
"epoch": 0.07009925558312655,
"grad_norm": 0.41244375705718994,
"learning_rate": 2e-05,
"loss": 0.6474,
"step": 1130
},
{
"epoch": 0.0707196029776675,
"grad_norm": 0.4200294613838196,
"learning_rate": 2e-05,
"loss": 0.6853,
"step": 1140
},
{
"epoch": 0.07133995037220843,
"grad_norm": 0.4071672856807709,
"learning_rate": 2e-05,
"loss": 0.6773,
"step": 1150
},
{
"epoch": 0.07196029776674938,
"grad_norm": 0.4591241776943207,
"learning_rate": 2e-05,
"loss": 0.6901,
"step": 1160
},
{
"epoch": 0.07258064516129033,
"grad_norm": 0.4510512948036194,
"learning_rate": 2e-05,
"loss": 0.6751,
"step": 1170
},
{
"epoch": 0.07320099255583126,
"grad_norm": 0.4550836980342865,
"learning_rate": 2e-05,
"loss": 0.6745,
"step": 1180
},
{
"epoch": 0.07382133995037221,
"grad_norm": 0.42455634474754333,
"learning_rate": 2e-05,
"loss": 0.6852,
"step": 1190
},
{
"epoch": 0.07444168734491315,
"grad_norm": 0.4288151264190674,
"learning_rate": 2e-05,
"loss": 0.6362,
"step": 1200
},
{
"epoch": 0.0750620347394541,
"grad_norm": 0.41488656401634216,
"learning_rate": 2e-05,
"loss": 0.6555,
"step": 1210
},
{
"epoch": 0.07568238213399504,
"grad_norm": 0.41888904571533203,
"learning_rate": 2e-05,
"loss": 0.6405,
"step": 1220
},
{
"epoch": 0.07630272952853598,
"grad_norm": 0.42407098412513733,
"learning_rate": 2e-05,
"loss": 0.6869,
"step": 1230
},
{
"epoch": 0.07692307692307693,
"grad_norm": 0.43882668018341064,
"learning_rate": 2e-05,
"loss": 0.6697,
"step": 1240
},
{
"epoch": 0.07754342431761786,
"grad_norm": 0.463724285364151,
"learning_rate": 2e-05,
"loss": 0.6606,
"step": 1250
},
{
"epoch": 0.07816377171215881,
"grad_norm": 0.4122724235057831,
"learning_rate": 2e-05,
"loss": 0.683,
"step": 1260
},
{
"epoch": 0.07878411910669975,
"grad_norm": 0.4170853793621063,
"learning_rate": 2e-05,
"loss": 0.6469,
"step": 1270
},
{
"epoch": 0.0794044665012407,
"grad_norm": 0.41887524724006653,
"learning_rate": 2e-05,
"loss": 0.6613,
"step": 1280
},
{
"epoch": 0.08002481389578164,
"grad_norm": 0.5110520720481873,
"learning_rate": 2e-05,
"loss": 0.6481,
"step": 1290
},
{
"epoch": 0.08064516129032258,
"grad_norm": 0.5727337002754211,
"learning_rate": 2e-05,
"loss": 0.6602,
"step": 1300
},
{
"epoch": 0.08126550868486353,
"grad_norm": 0.45020315051078796,
"learning_rate": 2e-05,
"loss": 0.6905,
"step": 1310
},
{
"epoch": 0.08188585607940446,
"grad_norm": 0.41866007447242737,
"learning_rate": 2e-05,
"loss": 0.6458,
"step": 1320
},
{
"epoch": 0.08250620347394541,
"grad_norm": 0.4124995768070221,
"learning_rate": 2e-05,
"loss": 0.6476,
"step": 1330
},
{
"epoch": 0.08312655086848635,
"grad_norm": 0.45238474011421204,
"learning_rate": 2e-05,
"loss": 0.6722,
"step": 1340
},
{
"epoch": 0.0837468982630273,
"grad_norm": 0.44636914134025574,
"learning_rate": 2e-05,
"loss": 0.6828,
"step": 1350
},
{
"epoch": 0.08436724565756824,
"grad_norm": 0.42632195353507996,
"learning_rate": 2e-05,
"loss": 0.6974,
"step": 1360
},
{
"epoch": 0.08498759305210918,
"grad_norm": 0.4126355051994324,
"learning_rate": 2e-05,
"loss": 0.6542,
"step": 1370
},
{
"epoch": 0.08560794044665013,
"grad_norm": 0.4650143086910248,
"learning_rate": 2e-05,
"loss": 0.6402,
"step": 1380
},
{
"epoch": 0.08622828784119106,
"grad_norm": 0.4254385530948639,
"learning_rate": 2e-05,
"loss": 0.6196,
"step": 1390
},
{
"epoch": 0.08684863523573201,
"grad_norm": 0.5174993872642517,
"learning_rate": 2e-05,
"loss": 0.6566,
"step": 1400
},
{
"epoch": 0.08746898263027296,
"grad_norm": 0.4466327428817749,
"learning_rate": 2e-05,
"loss": 0.6777,
"step": 1410
},
{
"epoch": 0.0880893300248139,
"grad_norm": 0.4639355540275574,
"learning_rate": 2e-05,
"loss": 0.6518,
"step": 1420
},
{
"epoch": 0.08870967741935484,
"grad_norm": 0.49918368458747864,
"learning_rate": 2e-05,
"loss": 0.666,
"step": 1430
},
{
"epoch": 0.08933002481389578,
"grad_norm": 0.45220839977264404,
"learning_rate": 2e-05,
"loss": 0.6626,
"step": 1440
},
{
"epoch": 0.08995037220843673,
"grad_norm": 0.40696123242378235,
"learning_rate": 2e-05,
"loss": 0.6591,
"step": 1450
},
{
"epoch": 0.09057071960297766,
"grad_norm": 0.42498070001602173,
"learning_rate": 2e-05,
"loss": 0.6532,
"step": 1460
},
{
"epoch": 0.09119106699751861,
"grad_norm": 0.4117129147052765,
"learning_rate": 2e-05,
"loss": 0.6272,
"step": 1470
},
{
"epoch": 0.09181141439205956,
"grad_norm": 0.4506339132785797,
"learning_rate": 2e-05,
"loss": 0.6609,
"step": 1480
},
{
"epoch": 0.0924317617866005,
"grad_norm": 0.40215933322906494,
"learning_rate": 2e-05,
"loss": 0.6653,
"step": 1490
},
{
"epoch": 0.09305210918114144,
"grad_norm": 0.4949316382408142,
"learning_rate": 2e-05,
"loss": 0.6583,
"step": 1500
},
{
"epoch": 0.09367245657568238,
"grad_norm": 0.45883846282958984,
"learning_rate": 2e-05,
"loss": 0.6553,
"step": 1510
},
{
"epoch": 0.09429280397022333,
"grad_norm": 0.41736656427383423,
"learning_rate": 2e-05,
"loss": 0.6727,
"step": 1520
},
{
"epoch": 0.09491315136476426,
"grad_norm": 0.45958396792411804,
"learning_rate": 2e-05,
"loss": 0.6402,
"step": 1530
},
{
"epoch": 0.09553349875930521,
"grad_norm": 0.41696447134017944,
"learning_rate": 2e-05,
"loss": 0.669,
"step": 1540
},
{
"epoch": 0.09615384615384616,
"grad_norm": 0.45699238777160645,
"learning_rate": 2e-05,
"loss": 0.6421,
"step": 1550
},
{
"epoch": 0.0967741935483871,
"grad_norm": 0.46844539046287537,
"learning_rate": 2e-05,
"loss": 0.6628,
"step": 1560
},
{
"epoch": 0.09739454094292804,
"grad_norm": 0.4296782612800598,
"learning_rate": 2e-05,
"loss": 0.6468,
"step": 1570
},
{
"epoch": 0.09801488833746898,
"grad_norm": 0.43794864416122437,
"learning_rate": 2e-05,
"loss": 0.6708,
"step": 1580
},
{
"epoch": 0.09863523573200993,
"grad_norm": 0.4485463500022888,
"learning_rate": 2e-05,
"loss": 0.6537,
"step": 1590
},
{
"epoch": 0.09925558312655088,
"grad_norm": 0.44051381945610046,
"learning_rate": 2e-05,
"loss": 0.6378,
"step": 1600
},
{
"epoch": 0.09987593052109181,
"grad_norm": 0.44119101762771606,
"learning_rate": 2e-05,
"loss": 0.6503,
"step": 1610
},
{
"epoch": 0.10049627791563276,
"grad_norm": 0.4515126049518585,
"learning_rate": 2e-05,
"loss": 0.6647,
"step": 1620
},
{
"epoch": 0.1011166253101737,
"grad_norm": 0.4214085042476654,
"learning_rate": 2e-05,
"loss": 0.6483,
"step": 1630
},
{
"epoch": 0.10173697270471464,
"grad_norm": 0.4193068742752075,
"learning_rate": 2e-05,
"loss": 0.6685,
"step": 1640
},
{
"epoch": 0.10235732009925558,
"grad_norm": 0.4890860319137573,
"learning_rate": 2e-05,
"loss": 0.6529,
"step": 1650
},
{
"epoch": 0.10297766749379653,
"grad_norm": 0.5013541579246521,
"learning_rate": 2e-05,
"loss": 0.7078,
"step": 1660
},
{
"epoch": 0.10359801488833748,
"grad_norm": 0.4772087335586548,
"learning_rate": 2e-05,
"loss": 0.6574,
"step": 1670
},
{
"epoch": 0.10421836228287841,
"grad_norm": 0.5918506979942322,
"learning_rate": 2e-05,
"loss": 0.6668,
"step": 1680
},
{
"epoch": 0.10483870967741936,
"grad_norm": 0.42867156863212585,
"learning_rate": 2e-05,
"loss": 0.6556,
"step": 1690
},
{
"epoch": 0.1054590570719603,
"grad_norm": 0.4230250418186188,
"learning_rate": 2e-05,
"loss": 0.6564,
"step": 1700
},
{
"epoch": 0.10607940446650124,
"grad_norm": 0.4046623110771179,
"learning_rate": 2e-05,
"loss": 0.6691,
"step": 1710
},
{
"epoch": 0.10669975186104218,
"grad_norm": 0.4210417568683624,
"learning_rate": 2e-05,
"loss": 0.6675,
"step": 1720
},
{
"epoch": 0.10732009925558313,
"grad_norm": 0.4010581970214844,
"learning_rate": 2e-05,
"loss": 0.6402,
"step": 1730
},
{
"epoch": 0.10794044665012408,
"grad_norm": 0.4336850643157959,
"learning_rate": 2e-05,
"loss": 0.6568,
"step": 1740
},
{
"epoch": 0.10856079404466501,
"grad_norm": 0.43575379252433777,
"learning_rate": 2e-05,
"loss": 0.6493,
"step": 1750
},
{
"epoch": 0.10918114143920596,
"grad_norm": 0.42740049958229065,
"learning_rate": 2e-05,
"loss": 0.6571,
"step": 1760
},
{
"epoch": 0.1098014888337469,
"grad_norm": 0.4169295132160187,
"learning_rate": 2e-05,
"loss": 0.6611,
"step": 1770
},
{
"epoch": 0.11042183622828784,
"grad_norm": 0.5564378499984741,
"learning_rate": 2e-05,
"loss": 0.6532,
"step": 1780
},
{
"epoch": 0.11104218362282878,
"grad_norm": 0.45990580320358276,
"learning_rate": 2e-05,
"loss": 0.6262,
"step": 1790
},
{
"epoch": 0.11166253101736973,
"grad_norm": 0.4232894778251648,
"learning_rate": 2e-05,
"loss": 0.6729,
"step": 1800
},
{
"epoch": 0.11228287841191067,
"grad_norm": 0.49535107612609863,
"learning_rate": 2e-05,
"loss": 0.6808,
"step": 1810
},
{
"epoch": 0.11290322580645161,
"grad_norm": 0.4231373965740204,
"learning_rate": 2e-05,
"loss": 0.6731,
"step": 1820
},
{
"epoch": 0.11352357320099256,
"grad_norm": 0.42381367087364197,
"learning_rate": 2e-05,
"loss": 0.6672,
"step": 1830
},
{
"epoch": 0.1141439205955335,
"grad_norm": 0.40873488783836365,
"learning_rate": 2e-05,
"loss": 0.6471,
"step": 1840
},
{
"epoch": 0.11476426799007444,
"grad_norm": 0.4330880641937256,
"learning_rate": 2e-05,
"loss": 0.6653,
"step": 1850
},
{
"epoch": 0.11538461538461539,
"grad_norm": 0.47087201476097107,
"learning_rate": 2e-05,
"loss": 0.6865,
"step": 1860
},
{
"epoch": 0.11600496277915633,
"grad_norm": 0.49161598086357117,
"learning_rate": 2e-05,
"loss": 0.6625,
"step": 1870
},
{
"epoch": 0.11662531017369727,
"grad_norm": 0.40995311737060547,
"learning_rate": 2e-05,
"loss": 0.6421,
"step": 1880
},
{
"epoch": 0.11724565756823821,
"grad_norm": 0.40415555238723755,
"learning_rate": 2e-05,
"loss": 0.6407,
"step": 1890
},
{
"epoch": 0.11786600496277916,
"grad_norm": 0.42309048771858215,
"learning_rate": 2e-05,
"loss": 0.6524,
"step": 1900
},
{
"epoch": 0.1184863523573201,
"grad_norm": 0.428654283285141,
"learning_rate": 2e-05,
"loss": 0.6473,
"step": 1910
},
{
"epoch": 0.11910669975186104,
"grad_norm": 0.46681228280067444,
"learning_rate": 2e-05,
"loss": 0.665,
"step": 1920
},
{
"epoch": 0.11972704714640199,
"grad_norm": 0.5378752946853638,
"learning_rate": 2e-05,
"loss": 0.6888,
"step": 1930
},
{
"epoch": 0.12034739454094293,
"grad_norm": 0.3942810297012329,
"learning_rate": 2e-05,
"loss": 0.6693,
"step": 1940
},
{
"epoch": 0.12096774193548387,
"grad_norm": 0.40872716903686523,
"learning_rate": 2e-05,
"loss": 0.6564,
"step": 1950
},
{
"epoch": 0.12158808933002481,
"grad_norm": 0.4505879580974579,
"learning_rate": 2e-05,
"loss": 0.6651,
"step": 1960
},
{
"epoch": 0.12220843672456576,
"grad_norm": 0.46347737312316895,
"learning_rate": 2e-05,
"loss": 0.6682,
"step": 1970
},
{
"epoch": 0.1228287841191067,
"grad_norm": 0.4220800995826721,
"learning_rate": 2e-05,
"loss": 0.6633,
"step": 1980
},
{
"epoch": 0.12344913151364764,
"grad_norm": 0.39984744787216187,
"learning_rate": 2e-05,
"loss": 0.6379,
"step": 1990
},
{
"epoch": 0.12406947890818859,
"grad_norm": 0.42455461621284485,
"learning_rate": 2e-05,
"loss": 0.6442,
"step": 2000
},
{
"epoch": 0.12468982630272953,
"grad_norm": 0.4262460768222809,
"learning_rate": 2e-05,
"loss": 0.6385,
"step": 2010
},
{
"epoch": 0.12531017369727046,
"grad_norm": 0.42343422770500183,
"learning_rate": 2e-05,
"loss": 0.6541,
"step": 2020
},
{
"epoch": 0.1259305210918114,
"grad_norm": 0.4029340147972107,
"learning_rate": 2e-05,
"loss": 0.6776,
"step": 2030
},
{
"epoch": 0.12655086848635236,
"grad_norm": 0.44888031482696533,
"learning_rate": 2e-05,
"loss": 0.6232,
"step": 2040
},
{
"epoch": 0.1271712158808933,
"grad_norm": 0.4395098388195038,
"learning_rate": 2e-05,
"loss": 0.6447,
"step": 2050
},
{
"epoch": 0.12779156327543426,
"grad_norm": 0.40587204694747925,
"learning_rate": 2e-05,
"loss": 0.6616,
"step": 2060
},
{
"epoch": 0.12841191066997518,
"grad_norm": 0.4486628472805023,
"learning_rate": 2e-05,
"loss": 0.6639,
"step": 2070
},
{
"epoch": 0.12903225806451613,
"grad_norm": 0.4576110243797302,
"learning_rate": 2e-05,
"loss": 0.6597,
"step": 2080
},
{
"epoch": 0.12965260545905707,
"grad_norm": 0.4019532799720764,
"learning_rate": 2e-05,
"loss": 0.6469,
"step": 2090
},
{
"epoch": 0.13027295285359802,
"grad_norm": 0.43723776936531067,
"learning_rate": 2e-05,
"loss": 0.6332,
"step": 2100
},
{
"epoch": 0.13089330024813894,
"grad_norm": 0.40787678956985474,
"learning_rate": 2e-05,
"loss": 0.6356,
"step": 2110
},
{
"epoch": 0.1315136476426799,
"grad_norm": 0.4124930799007416,
"learning_rate": 2e-05,
"loss": 0.6523,
"step": 2120
},
{
"epoch": 0.13213399503722084,
"grad_norm": 0.4150378108024597,
"learning_rate": 2e-05,
"loss": 0.6694,
"step": 2130
},
{
"epoch": 0.1327543424317618,
"grad_norm": 0.41935351490974426,
"learning_rate": 2e-05,
"loss": 0.6745,
"step": 2140
},
{
"epoch": 0.13337468982630274,
"grad_norm": 0.6122373938560486,
"learning_rate": 2e-05,
"loss": 0.6566,
"step": 2150
},
{
"epoch": 0.13399503722084366,
"grad_norm": 0.518964409828186,
"learning_rate": 2e-05,
"loss": 0.6281,
"step": 2160
},
{
"epoch": 0.1346153846153846,
"grad_norm": 0.45327648520469666,
"learning_rate": 2e-05,
"loss": 0.6431,
"step": 2170
},
{
"epoch": 0.13523573200992556,
"grad_norm": 0.41766470670700073,
"learning_rate": 2e-05,
"loss": 0.6707,
"step": 2180
},
{
"epoch": 0.1358560794044665,
"grad_norm": 0.43843910098075867,
"learning_rate": 2e-05,
"loss": 0.6698,
"step": 2190
},
{
"epoch": 0.13647642679900746,
"grad_norm": 0.5084978342056274,
"learning_rate": 2e-05,
"loss": 0.6347,
"step": 2200
},
{
"epoch": 0.13709677419354838,
"grad_norm": 0.4238511919975281,
"learning_rate": 2e-05,
"loss": 0.6459,
"step": 2210
},
{
"epoch": 0.13771712158808933,
"grad_norm": 0.4075576961040497,
"learning_rate": 2e-05,
"loss": 0.6248,
"step": 2220
},
{
"epoch": 0.13833746898263027,
"grad_norm": 0.4354841411113739,
"learning_rate": 2e-05,
"loss": 0.6718,
"step": 2230
},
{
"epoch": 0.13895781637717122,
"grad_norm": 0.5108729004859924,
"learning_rate": 2e-05,
"loss": 0.6477,
"step": 2240
},
{
"epoch": 0.13957816377171217,
"grad_norm": 0.4199222922325134,
"learning_rate": 2e-05,
"loss": 0.6543,
"step": 2250
},
{
"epoch": 0.1401985111662531,
"grad_norm": 0.4035865068435669,
"learning_rate": 2e-05,
"loss": 0.6269,
"step": 2260
},
{
"epoch": 0.14081885856079404,
"grad_norm": 0.4430849254131317,
"learning_rate": 2e-05,
"loss": 0.626,
"step": 2270
},
{
"epoch": 0.141439205955335,
"grad_norm": 0.4501071274280548,
"learning_rate": 2e-05,
"loss": 0.6373,
"step": 2280
},
{
"epoch": 0.14205955334987594,
"grad_norm": 0.47260135412216187,
"learning_rate": 2e-05,
"loss": 0.6503,
"step": 2290
},
{
"epoch": 0.14267990074441686,
"grad_norm": 0.3968529999256134,
"learning_rate": 2e-05,
"loss": 0.6401,
"step": 2300
},
{
"epoch": 0.1433002481389578,
"grad_norm": 0.41558271646499634,
"learning_rate": 2e-05,
"loss": 0.6624,
"step": 2310
},
{
"epoch": 0.14392059553349876,
"grad_norm": 0.46250858902931213,
"learning_rate": 2e-05,
"loss": 0.6678,
"step": 2320
},
{
"epoch": 0.1445409429280397,
"grad_norm": 0.40959519147872925,
"learning_rate": 2e-05,
"loss": 0.6381,
"step": 2330
},
{
"epoch": 0.14516129032258066,
"grad_norm": 0.431772917509079,
"learning_rate": 2e-05,
"loss": 0.6485,
"step": 2340
},
{
"epoch": 0.14578163771712158,
"grad_norm": 0.42857933044433594,
"learning_rate": 2e-05,
"loss": 0.6469,
"step": 2350
},
{
"epoch": 0.14640198511166252,
"grad_norm": 0.4006024897098541,
"learning_rate": 2e-05,
"loss": 0.6752,
"step": 2360
},
{
"epoch": 0.14702233250620347,
"grad_norm": 0.4340827763080597,
"learning_rate": 2e-05,
"loss": 0.6407,
"step": 2370
},
{
"epoch": 0.14764267990074442,
"grad_norm": 0.43578338623046875,
"learning_rate": 2e-05,
"loss": 0.6463,
"step": 2380
},
{
"epoch": 0.14826302729528537,
"grad_norm": 0.4057551920413971,
"learning_rate": 2e-05,
"loss": 0.6295,
"step": 2390
},
{
"epoch": 0.1488833746898263,
"grad_norm": 0.405994713306427,
"learning_rate": 2e-05,
"loss": 0.6639,
"step": 2400
},
{
"epoch": 0.14950372208436724,
"grad_norm": 0.4021854102611542,
"learning_rate": 2e-05,
"loss": 0.6542,
"step": 2410
},
{
"epoch": 0.1501240694789082,
"grad_norm": 0.4120284914970398,
"learning_rate": 2e-05,
"loss": 0.6456,
"step": 2420
},
{
"epoch": 0.15074441687344914,
"grad_norm": 0.4367629289627075,
"learning_rate": 2e-05,
"loss": 0.6334,
"step": 2430
},
{
"epoch": 0.1513647642679901,
"grad_norm": 0.39025968313217163,
"learning_rate": 2e-05,
"loss": 0.634,
"step": 2440
},
{
"epoch": 0.151985111662531,
"grad_norm": 0.44010090827941895,
"learning_rate": 2e-05,
"loss": 0.6346,
"step": 2450
},
{
"epoch": 0.15260545905707196,
"grad_norm": 0.4358943998813629,
"learning_rate": 2e-05,
"loss": 0.6556,
"step": 2460
},
{
"epoch": 0.1532258064516129,
"grad_norm": 0.40464046597480774,
"learning_rate": 2e-05,
"loss": 0.6405,
"step": 2470
},
{
"epoch": 0.15384615384615385,
"grad_norm": 0.43297019600868225,
"learning_rate": 2e-05,
"loss": 0.6618,
"step": 2480
},
{
"epoch": 0.15446650124069478,
"grad_norm": 0.37946197390556335,
"learning_rate": 2e-05,
"loss": 0.6338,
"step": 2490
},
{
"epoch": 0.15508684863523572,
"grad_norm": 0.44986578822135925,
"learning_rate": 2e-05,
"loss": 0.6654,
"step": 2500
},
{
"epoch": 0.15570719602977667,
"grad_norm": 0.40377217531204224,
"learning_rate": 2e-05,
"loss": 0.6261,
"step": 2510
},
{
"epoch": 0.15632754342431762,
"grad_norm": 0.4069921374320984,
"learning_rate": 2e-05,
"loss": 0.6543,
"step": 2520
},
{
"epoch": 0.15694789081885857,
"grad_norm": 0.3909223675727844,
"learning_rate": 2e-05,
"loss": 0.6449,
"step": 2530
},
{
"epoch": 0.1575682382133995,
"grad_norm": 0.37389710545539856,
"learning_rate": 2e-05,
"loss": 0.6352,
"step": 2540
},
{
"epoch": 0.15818858560794044,
"grad_norm": 0.4050366282463074,
"learning_rate": 2e-05,
"loss": 0.6554,
"step": 2550
},
{
"epoch": 0.1588089330024814,
"grad_norm": 0.41864311695098877,
"learning_rate": 2e-05,
"loss": 0.6403,
"step": 2560
},
{
"epoch": 0.15942928039702234,
"grad_norm": 0.404889315366745,
"learning_rate": 2e-05,
"loss": 0.6523,
"step": 2570
},
{
"epoch": 0.1600496277915633,
"grad_norm": 0.480149507522583,
"learning_rate": 2e-05,
"loss": 0.6254,
"step": 2580
},
{
"epoch": 0.1606699751861042,
"grad_norm": 0.41777101159095764,
"learning_rate": 2e-05,
"loss": 0.6392,
"step": 2590
},
{
"epoch": 0.16129032258064516,
"grad_norm": 0.41992273926734924,
"learning_rate": 2e-05,
"loss": 0.6283,
"step": 2600
},
{
"epoch": 0.1619106699751861,
"grad_norm": 0.3978483974933624,
"learning_rate": 2e-05,
"loss": 0.6415,
"step": 2610
},
{
"epoch": 0.16253101736972705,
"grad_norm": 0.4051460027694702,
"learning_rate": 2e-05,
"loss": 0.6325,
"step": 2620
},
{
"epoch": 0.163151364764268,
"grad_norm": 0.38797181844711304,
"learning_rate": 2e-05,
"loss": 0.6538,
"step": 2630
},
{
"epoch": 0.16377171215880892,
"grad_norm": 0.4264223575592041,
"learning_rate": 2e-05,
"loss": 0.6079,
"step": 2640
},
{
"epoch": 0.16439205955334987,
"grad_norm": 0.6309807300567627,
"learning_rate": 2e-05,
"loss": 0.6443,
"step": 2650
},
{
"epoch": 0.16501240694789082,
"grad_norm": 0.4043954610824585,
"learning_rate": 2e-05,
"loss": 0.6587,
"step": 2660
},
{
"epoch": 0.16563275434243177,
"grad_norm": 0.433071106672287,
"learning_rate": 2e-05,
"loss": 0.6458,
"step": 2670
},
{
"epoch": 0.1662531017369727,
"grad_norm": 0.43372464179992676,
"learning_rate": 2e-05,
"loss": 0.6228,
"step": 2680
},
{
"epoch": 0.16687344913151364,
"grad_norm": 0.4626196324825287,
"learning_rate": 2e-05,
"loss": 0.6406,
"step": 2690
},
{
"epoch": 0.1674937965260546,
"grad_norm": 0.379689484834671,
"learning_rate": 2e-05,
"loss": 0.6368,
"step": 2700
},
{
"epoch": 0.16811414392059554,
"grad_norm": 0.43384963274002075,
"learning_rate": 2e-05,
"loss": 0.6421,
"step": 2710
},
{
"epoch": 0.1687344913151365,
"grad_norm": 0.5025782585144043,
"learning_rate": 2e-05,
"loss": 0.6644,
"step": 2720
},
{
"epoch": 0.1693548387096774,
"grad_norm": 0.398337185382843,
"learning_rate": 2e-05,
"loss": 0.6242,
"step": 2730
},
{
"epoch": 0.16997518610421836,
"grad_norm": 0.4152053892612457,
"learning_rate": 2e-05,
"loss": 0.674,
"step": 2740
},
{
"epoch": 0.1705955334987593,
"grad_norm": 0.40534213185310364,
"learning_rate": 2e-05,
"loss": 0.6372,
"step": 2750
},
{
"epoch": 0.17121588089330025,
"grad_norm": 0.44497600197792053,
"learning_rate": 2e-05,
"loss": 0.6453,
"step": 2760
},
{
"epoch": 0.1718362282878412,
"grad_norm": 0.4441177546977997,
"learning_rate": 2e-05,
"loss": 0.6467,
"step": 2770
},
{
"epoch": 0.17245657568238212,
"grad_norm": 0.39838549494743347,
"learning_rate": 2e-05,
"loss": 0.6359,
"step": 2780
},
{
"epoch": 0.17307692307692307,
"grad_norm": 0.6976585984230042,
"learning_rate": 2e-05,
"loss": 0.6335,
"step": 2790
},
{
"epoch": 0.17369727047146402,
"grad_norm": 0.48044341802597046,
"learning_rate": 2e-05,
"loss": 0.6604,
"step": 2800
},
{
"epoch": 0.17431761786600497,
"grad_norm": 0.3987114131450653,
"learning_rate": 2e-05,
"loss": 0.6348,
"step": 2810
},
{
"epoch": 0.17493796526054592,
"grad_norm": 0.37417376041412354,
"learning_rate": 2e-05,
"loss": 0.6302,
"step": 2820
},
{
"epoch": 0.17555831265508684,
"grad_norm": 0.4066050946712494,
"learning_rate": 2e-05,
"loss": 0.6319,
"step": 2830
},
{
"epoch": 0.1761786600496278,
"grad_norm": 0.45394909381866455,
"learning_rate": 2e-05,
"loss": 0.6278,
"step": 2840
},
{
"epoch": 0.17679900744416874,
"grad_norm": 0.414578378200531,
"learning_rate": 2e-05,
"loss": 0.6317,
"step": 2850
},
{
"epoch": 0.1774193548387097,
"grad_norm": 0.4722119867801666,
"learning_rate": 2e-05,
"loss": 0.622,
"step": 2860
},
{
"epoch": 0.1780397022332506,
"grad_norm": 0.42602238059043884,
"learning_rate": 2e-05,
"loss": 0.6631,
"step": 2870
},
{
"epoch": 0.17866004962779156,
"grad_norm": 0.43522897362709045,
"learning_rate": 2e-05,
"loss": 0.6288,
"step": 2880
},
{
"epoch": 0.1792803970223325,
"grad_norm": 0.4144858121871948,
"learning_rate": 2e-05,
"loss": 0.6401,
"step": 2890
},
{
"epoch": 0.17990074441687345,
"grad_norm": 0.4240042567253113,
"learning_rate": 2e-05,
"loss": 0.6183,
"step": 2900
},
{
"epoch": 0.1805210918114144,
"grad_norm": 0.4313690662384033,
"learning_rate": 2e-05,
"loss": 0.6233,
"step": 2910
},
{
"epoch": 0.18114143920595532,
"grad_norm": 0.40647462010383606,
"learning_rate": 2e-05,
"loss": 0.6423,
"step": 2920
},
{
"epoch": 0.18176178660049627,
"grad_norm": 0.40608322620391846,
"learning_rate": 2e-05,
"loss": 0.6345,
"step": 2930
},
{
"epoch": 0.18238213399503722,
"grad_norm": 0.5110368132591248,
"learning_rate": 2e-05,
"loss": 0.6505,
"step": 2940
},
{
"epoch": 0.18300248138957817,
"grad_norm": 1.3996773958206177,
"learning_rate": 2e-05,
"loss": 0.6334,
"step": 2950
},
{
"epoch": 0.18362282878411912,
"grad_norm": 0.4118184745311737,
"learning_rate": 2e-05,
"loss": 0.6325,
"step": 2960
},
{
"epoch": 0.18424317617866004,
"grad_norm": 0.4443102777004242,
"learning_rate": 2e-05,
"loss": 0.6667,
"step": 2970
},
{
"epoch": 0.184863523573201,
"grad_norm": 0.39859694242477417,
"learning_rate": 2e-05,
"loss": 0.6389,
"step": 2980
},
{
"epoch": 0.18548387096774194,
"grad_norm": 0.42832204699516296,
"learning_rate": 2e-05,
"loss": 0.6789,
"step": 2990
},
{
"epoch": 0.18610421836228289,
"grad_norm": 0.43463531136512756,
"learning_rate": 2e-05,
"loss": 0.6296,
"step": 3000
},
{
"epoch": 0.18672456575682383,
"grad_norm": 0.441102534532547,
"learning_rate": 2e-05,
"loss": 0.6127,
"step": 3010
},
{
"epoch": 0.18734491315136476,
"grad_norm": 0.419390469789505,
"learning_rate": 2e-05,
"loss": 0.6483,
"step": 3020
},
{
"epoch": 0.1879652605459057,
"grad_norm": 0.41196301579475403,
"learning_rate": 2e-05,
"loss": 0.6404,
"step": 3030
},
{
"epoch": 0.18858560794044665,
"grad_norm": 0.3819664418697357,
"learning_rate": 2e-05,
"loss": 0.6516,
"step": 3040
},
{
"epoch": 0.1892059553349876,
"grad_norm": 0.40153929591178894,
"learning_rate": 2e-05,
"loss": 0.6237,
"step": 3050
},
{
"epoch": 0.18982630272952852,
"grad_norm": 0.4139013886451721,
"learning_rate": 2e-05,
"loss": 0.6392,
"step": 3060
},
{
"epoch": 0.19044665012406947,
"grad_norm": 0.40049391984939575,
"learning_rate": 2e-05,
"loss": 0.6432,
"step": 3070
},
{
"epoch": 0.19106699751861042,
"grad_norm": 0.4137687385082245,
"learning_rate": 2e-05,
"loss": 0.6211,
"step": 3080
},
{
"epoch": 0.19168734491315137,
"grad_norm": 0.43249863386154175,
"learning_rate": 2e-05,
"loss": 0.6478,
"step": 3090
},
{
"epoch": 0.19230769230769232,
"grad_norm": 0.4651578664779663,
"learning_rate": 2e-05,
"loss": 0.643,
"step": 3100
},
{
"epoch": 0.19292803970223324,
"grad_norm": 0.44925519824028015,
"learning_rate": 2e-05,
"loss": 0.6378,
"step": 3110
},
{
"epoch": 0.1935483870967742,
"grad_norm": 0.38708093762397766,
"learning_rate": 2e-05,
"loss": 0.6335,
"step": 3120
},
{
"epoch": 0.19416873449131514,
"grad_norm": 0.42161768674850464,
"learning_rate": 2e-05,
"loss": 0.6569,
"step": 3130
},
{
"epoch": 0.19478908188585609,
"grad_norm": 0.6364923119544983,
"learning_rate": 2e-05,
"loss": 0.617,
"step": 3140
},
{
"epoch": 0.19540942928039703,
"grad_norm": 0.43241891264915466,
"learning_rate": 2e-05,
"loss": 0.6428,
"step": 3150
},
{
"epoch": 0.19602977667493796,
"grad_norm": 0.41662028431892395,
"learning_rate": 2e-05,
"loss": 0.6495,
"step": 3160
},
{
"epoch": 0.1966501240694789,
"grad_norm": 0.4269491732120514,
"learning_rate": 2e-05,
"loss": 0.6473,
"step": 3170
},
{
"epoch": 0.19727047146401985,
"grad_norm": 0.412458211183548,
"learning_rate": 2e-05,
"loss": 0.6477,
"step": 3180
},
{
"epoch": 0.1978908188585608,
"grad_norm": 0.43503549695014954,
"learning_rate": 2e-05,
"loss": 0.6629,
"step": 3190
},
{
"epoch": 0.19851116625310175,
"grad_norm": 0.41298508644104004,
"learning_rate": 2e-05,
"loss": 0.6117,
"step": 3200
},
{
"epoch": 0.19913151364764267,
"grad_norm": 0.3883150815963745,
"learning_rate": 2e-05,
"loss": 0.628,
"step": 3210
},
{
"epoch": 0.19975186104218362,
"grad_norm": 0.4110269248485565,
"learning_rate": 2e-05,
"loss": 0.6373,
"step": 3220
},
{
"epoch": 0.20037220843672457,
"grad_norm": 0.4852235019207001,
"learning_rate": 2e-05,
"loss": 0.6269,
"step": 3230
},
{
"epoch": 0.20099255583126552,
"grad_norm": 0.3968954384326935,
"learning_rate": 2e-05,
"loss": 0.6461,
"step": 3240
},
{
"epoch": 0.20161290322580644,
"grad_norm": 0.45685458183288574,
"learning_rate": 2e-05,
"loss": 0.648,
"step": 3250
},
{
"epoch": 0.2022332506203474,
"grad_norm": 0.40747106075286865,
"learning_rate": 2e-05,
"loss": 0.6546,
"step": 3260
},
{
"epoch": 0.20285359801488834,
"grad_norm": 0.3848201632499695,
"learning_rate": 2e-05,
"loss": 0.6281,
"step": 3270
},
{
"epoch": 0.20347394540942929,
"grad_norm": 0.38959604501724243,
"learning_rate": 2e-05,
"loss": 0.6208,
"step": 3280
},
{
"epoch": 0.20409429280397023,
"grad_norm": 0.4149569571018219,
"learning_rate": 2e-05,
"loss": 0.6293,
"step": 3290
},
{
"epoch": 0.20471464019851116,
"grad_norm": 0.46731993556022644,
"learning_rate": 2e-05,
"loss": 0.6641,
"step": 3300
},
{
"epoch": 0.2053349875930521,
"grad_norm": 0.4299260675907135,
"learning_rate": 2e-05,
"loss": 0.6057,
"step": 3310
},
{
"epoch": 0.20595533498759305,
"grad_norm": 0.4170496463775635,
"learning_rate": 2e-05,
"loss": 0.6457,
"step": 3320
},
{
"epoch": 0.206575682382134,
"grad_norm": 0.43017125129699707,
"learning_rate": 2e-05,
"loss": 0.6224,
"step": 3330
},
{
"epoch": 0.20719602977667495,
"grad_norm": 0.39833810925483704,
"learning_rate": 2e-05,
"loss": 0.6397,
"step": 3340
},
{
"epoch": 0.20781637717121587,
"grad_norm": 0.4055391848087311,
"learning_rate": 2e-05,
"loss": 0.6209,
"step": 3350
},
{
"epoch": 0.20843672456575682,
"grad_norm": 0.4533246159553528,
"learning_rate": 2e-05,
"loss": 0.6224,
"step": 3360
},
{
"epoch": 0.20905707196029777,
"grad_norm": 0.3952649235725403,
"learning_rate": 2e-05,
"loss": 0.6493,
"step": 3370
},
{
"epoch": 0.20967741935483872,
"grad_norm": 0.4192732870578766,
"learning_rate": 2e-05,
"loss": 0.6293,
"step": 3380
},
{
"epoch": 0.21029776674937964,
"grad_norm": 0.40987828373908997,
"learning_rate": 2e-05,
"loss": 0.6222,
"step": 3390
},
{
"epoch": 0.2109181141439206,
"grad_norm": 0.41994917392730713,
"learning_rate": 2e-05,
"loss": 0.6556,
"step": 3400
},
{
"epoch": 0.21153846153846154,
"grad_norm": 0.42132651805877686,
"learning_rate": 2e-05,
"loss": 0.6443,
"step": 3410
},
{
"epoch": 0.21215880893300249,
"grad_norm": 0.4320928156375885,
"learning_rate": 2e-05,
"loss": 0.6461,
"step": 3420
},
{
"epoch": 0.21277915632754343,
"grad_norm": 0.435435950756073,
"learning_rate": 2e-05,
"loss": 0.6255,
"step": 3430
},
{
"epoch": 0.21339950372208435,
"grad_norm": 0.41047704219818115,
"learning_rate": 2e-05,
"loss": 0.6422,
"step": 3440
},
{
"epoch": 0.2140198511166253,
"grad_norm": 0.3944700062274933,
"learning_rate": 2e-05,
"loss": 0.621,
"step": 3450
},
{
"epoch": 0.21464019851116625,
"grad_norm": 0.42940741777420044,
"learning_rate": 2e-05,
"loss": 0.6196,
"step": 3460
},
{
"epoch": 0.2152605459057072,
"grad_norm": 0.3980760872364044,
"learning_rate": 2e-05,
"loss": 0.6412,
"step": 3470
},
{
"epoch": 0.21588089330024815,
"grad_norm": 0.39118990302085876,
"learning_rate": 2e-05,
"loss": 0.6249,
"step": 3480
},
{
"epoch": 0.21650124069478907,
"grad_norm": 0.44674456119537354,
"learning_rate": 2e-05,
"loss": 0.6394,
"step": 3490
},
{
"epoch": 0.21712158808933002,
"grad_norm": 0.42848122119903564,
"learning_rate": 2e-05,
"loss": 0.6354,
"step": 3500
},
{
"epoch": 0.21774193548387097,
"grad_norm": 0.44583410024642944,
"learning_rate": 2e-05,
"loss": 0.6453,
"step": 3510
},
{
"epoch": 0.21836228287841192,
"grad_norm": 0.44389545917510986,
"learning_rate": 2e-05,
"loss": 0.6652,
"step": 3520
},
{
"epoch": 0.21898263027295287,
"grad_norm": 0.38134288787841797,
"learning_rate": 2e-05,
"loss": 0.6203,
"step": 3530
},
{
"epoch": 0.2196029776674938,
"grad_norm": 0.4165913462638855,
"learning_rate": 2e-05,
"loss": 0.643,
"step": 3540
},
{
"epoch": 0.22022332506203474,
"grad_norm": 0.4155155420303345,
"learning_rate": 2e-05,
"loss": 0.6491,
"step": 3550
},
{
"epoch": 0.22084367245657568,
"grad_norm": 0.390639066696167,
"learning_rate": 2e-05,
"loss": 0.6182,
"step": 3560
},
{
"epoch": 0.22146401985111663,
"grad_norm": 0.43849295377731323,
"learning_rate": 2e-05,
"loss": 0.6379,
"step": 3570
},
{
"epoch": 0.22208436724565755,
"grad_norm": 0.3993423283100128,
"learning_rate": 2e-05,
"loss": 0.6588,
"step": 3580
},
{
"epoch": 0.2227047146401985,
"grad_norm": 0.4390069246292114,
"learning_rate": 2e-05,
"loss": 0.6071,
"step": 3590
},
{
"epoch": 0.22332506203473945,
"grad_norm": 0.37074384093284607,
"learning_rate": 2e-05,
"loss": 0.6336,
"step": 3600
},
{
"epoch": 0.2239454094292804,
"grad_norm": 0.4541170597076416,
"learning_rate": 2e-05,
"loss": 0.65,
"step": 3610
},
{
"epoch": 0.22456575682382135,
"grad_norm": 0.41161370277404785,
"learning_rate": 2e-05,
"loss": 0.6127,
"step": 3620
},
{
"epoch": 0.22518610421836227,
"grad_norm": 0.39428696036338806,
"learning_rate": 2e-05,
"loss": 0.6452,
"step": 3630
},
{
"epoch": 0.22580645161290322,
"grad_norm": 0.3822895586490631,
"learning_rate": 2e-05,
"loss": 0.625,
"step": 3640
},
{
"epoch": 0.22642679900744417,
"grad_norm": 0.5086479783058167,
"learning_rate": 2e-05,
"loss": 0.6069,
"step": 3650
},
{
"epoch": 0.22704714640198512,
"grad_norm": 0.43685758113861084,
"learning_rate": 2e-05,
"loss": 0.6357,
"step": 3660
},
{
"epoch": 0.22766749379652607,
"grad_norm": 0.44833698868751526,
"learning_rate": 2e-05,
"loss": 0.6288,
"step": 3670
},
{
"epoch": 0.228287841191067,
"grad_norm": 0.695853590965271,
"learning_rate": 2e-05,
"loss": 0.631,
"step": 3680
},
{
"epoch": 0.22890818858560794,
"grad_norm": 0.403007835149765,
"learning_rate": 2e-05,
"loss": 0.6306,
"step": 3690
},
{
"epoch": 0.22952853598014888,
"grad_norm": 0.45625439286231995,
"learning_rate": 2e-05,
"loss": 0.6404,
"step": 3700
},
{
"epoch": 0.23014888337468983,
"grad_norm": 0.4494592249393463,
"learning_rate": 2e-05,
"loss": 0.6482,
"step": 3710
},
{
"epoch": 0.23076923076923078,
"grad_norm": 0.39842021465301514,
"learning_rate": 2e-05,
"loss": 0.6518,
"step": 3720
},
{
"epoch": 0.2313895781637717,
"grad_norm": 0.45455050468444824,
"learning_rate": 2e-05,
"loss": 0.6392,
"step": 3730
},
{
"epoch": 0.23200992555831265,
"grad_norm": 0.40073955059051514,
"learning_rate": 2e-05,
"loss": 0.6239,
"step": 3740
},
{
"epoch": 0.2326302729528536,
"grad_norm": 0.40425387024879456,
"learning_rate": 2e-05,
"loss": 0.6233,
"step": 3750
},
{
"epoch": 0.23325062034739455,
"grad_norm": 0.38586944341659546,
"learning_rate": 2e-05,
"loss": 0.6236,
"step": 3760
},
{
"epoch": 0.23387096774193547,
"grad_norm": 0.4220291078090668,
"learning_rate": 2e-05,
"loss": 0.6245,
"step": 3770
},
{
"epoch": 0.23449131513647642,
"grad_norm": 0.39111921191215515,
"learning_rate": 2e-05,
"loss": 0.6206,
"step": 3780
},
{
"epoch": 0.23511166253101737,
"grad_norm": 0.4438347816467285,
"learning_rate": 2e-05,
"loss": 0.626,
"step": 3790
},
{
"epoch": 0.23573200992555832,
"grad_norm": 0.4105881154537201,
"learning_rate": 2e-05,
"loss": 0.6152,
"step": 3800
},
{
"epoch": 0.23635235732009927,
"grad_norm": 0.5986375212669373,
"learning_rate": 2e-05,
"loss": 0.6332,
"step": 3810
},
{
"epoch": 0.2369727047146402,
"grad_norm": 0.42196112871170044,
"learning_rate": 2e-05,
"loss": 0.6344,
"step": 3820
},
{
"epoch": 0.23759305210918114,
"grad_norm": 0.4690241813659668,
"learning_rate": 2e-05,
"loss": 0.6326,
"step": 3830
},
{
"epoch": 0.23821339950372208,
"grad_norm": 0.39249280095100403,
"learning_rate": 2e-05,
"loss": 0.644,
"step": 3840
},
{
"epoch": 0.23883374689826303,
"grad_norm": 0.3836807310581207,
"learning_rate": 2e-05,
"loss": 0.643,
"step": 3850
},
{
"epoch": 0.23945409429280398,
"grad_norm": 0.39411523938179016,
"learning_rate": 2e-05,
"loss": 0.6168,
"step": 3860
},
{
"epoch": 0.2400744416873449,
"grad_norm": 0.39570122957229614,
"learning_rate": 2e-05,
"loss": 0.6458,
"step": 3870
},
{
"epoch": 0.24069478908188585,
"grad_norm": 0.4410209059715271,
"learning_rate": 2e-05,
"loss": 0.6357,
"step": 3880
},
{
"epoch": 0.2413151364764268,
"grad_norm": 0.41891351342201233,
"learning_rate": 2e-05,
"loss": 0.645,
"step": 3890
},
{
"epoch": 0.24193548387096775,
"grad_norm": 0.3815721273422241,
"learning_rate": 2e-05,
"loss": 0.6197,
"step": 3900
},
{
"epoch": 0.2425558312655087,
"grad_norm": 0.42668625712394714,
"learning_rate": 2e-05,
"loss": 0.6512,
"step": 3910
},
{
"epoch": 0.24317617866004962,
"grad_norm": 0.44440335035324097,
"learning_rate": 2e-05,
"loss": 0.6286,
"step": 3920
},
{
"epoch": 0.24379652605459057,
"grad_norm": 0.4490135908126831,
"learning_rate": 2e-05,
"loss": 0.6429,
"step": 3930
},
{
"epoch": 0.24441687344913152,
"grad_norm": 0.3730720281600952,
"learning_rate": 2e-05,
"loss": 0.6178,
"step": 3940
},
{
"epoch": 0.24503722084367247,
"grad_norm": 0.4244785010814667,
"learning_rate": 2e-05,
"loss": 0.667,
"step": 3950
},
{
"epoch": 0.2456575682382134,
"grad_norm": 0.38650715351104736,
"learning_rate": 2e-05,
"loss": 0.6116,
"step": 3960
},
{
"epoch": 0.24627791563275434,
"grad_norm": 0.38137051463127136,
"learning_rate": 2e-05,
"loss": 0.6411,
"step": 3970
},
{
"epoch": 0.24689826302729528,
"grad_norm": 0.4392582178115845,
"learning_rate": 2e-05,
"loss": 0.6296,
"step": 3980
},
{
"epoch": 0.24751861042183623,
"grad_norm": 0.40702107548713684,
"learning_rate": 2e-05,
"loss": 0.6369,
"step": 3990
},
{
"epoch": 0.24813895781637718,
"grad_norm": 0.3724535405635834,
"learning_rate": 2e-05,
"loss": 0.6209,
"step": 4000
},
{
"epoch": 0.2487593052109181,
"grad_norm": 0.38708439469337463,
"learning_rate": 2e-05,
"loss": 0.6208,
"step": 4010
},
{
"epoch": 0.24937965260545905,
"grad_norm": 0.46000051498413086,
"learning_rate": 2e-05,
"loss": 0.6162,
"step": 4020
},
{
"epoch": 0.25,
"grad_norm": 0.41148972511291504,
"learning_rate": 2e-05,
"loss": 0.589,
"step": 4030
},
{
"epoch": 0.2506203473945409,
"grad_norm": 0.40816742181777954,
"learning_rate": 2e-05,
"loss": 0.6286,
"step": 4040
},
{
"epoch": 0.2512406947890819,
"grad_norm": 0.3669893741607666,
"learning_rate": 2e-05,
"loss": 0.6382,
"step": 4050
},
{
"epoch": 0.2518610421836228,
"grad_norm": 0.4152558743953705,
"learning_rate": 2e-05,
"loss": 0.6367,
"step": 4060
},
{
"epoch": 0.2524813895781638,
"grad_norm": 0.4094124734401703,
"learning_rate": 2e-05,
"loss": 0.6322,
"step": 4070
}
],
"logging_steps": 10,
"max_steps": 5935,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 2035,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.8168590244885037e+19,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}