lyrics-main / trainer_state.json
Jonathanmann's picture
End of training
8c858c1 verified
Raw
History Blame Contribute Delete
21.3 kB
{
"best_metric": 3.0606205463409424,
"best_model_checkpoint": "/content/drive/MyDrive/Hugh Mann/GPT2-nov24/checkpoints/checkpoint-900",
"epoch": 2.9953488372093022,
"eval_steps": 50,
"global_step": 966,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.031007751937984496,
"grad_norm": 19.903196334838867,
"learning_rate": 6.000000000000001e-07,
"loss": 3.9736,
"step": 10
},
{
"epoch": 0.06201550387596899,
"grad_norm": 13.974676132202148,
"learning_rate": 1.6000000000000001e-06,
"loss": 3.8925,
"step": 20
},
{
"epoch": 0.09302325581395349,
"grad_norm": 13.976302146911621,
"learning_rate": 2.6e-06,
"loss": 3.7375,
"step": 30
},
{
"epoch": 0.12403100775193798,
"grad_norm": 12.306398391723633,
"learning_rate": 3.6e-06,
"loss": 3.6961,
"step": 40
},
{
"epoch": 0.15503875968992248,
"grad_norm": 9.758413314819336,
"learning_rate": 4.6e-06,
"loss": 3.7651,
"step": 50
},
{
"epoch": 0.15503875968992248,
"eval_loss": 3.4887187480926514,
"eval_runtime": 4.7241,
"eval_samples_per_second": 121.08,
"eval_steps_per_second": 15.241,
"step": 50
},
{
"epoch": 0.18604651162790697,
"grad_norm": 8.832802772521973,
"learning_rate": 5.600000000000001e-06,
"loss": 3.6353,
"step": 60
},
{
"epoch": 0.21705426356589147,
"grad_norm": 11.008893013000488,
"learning_rate": 6.6e-06,
"loss": 3.5125,
"step": 70
},
{
"epoch": 0.24806201550387597,
"grad_norm": 9.586570739746094,
"learning_rate": 7.6e-06,
"loss": 3.6011,
"step": 80
},
{
"epoch": 0.27906976744186046,
"grad_norm": 8.815489768981934,
"learning_rate": 8.599999999999999e-06,
"loss": 3.552,
"step": 90
},
{
"epoch": 0.31007751937984496,
"grad_norm": 11.291627883911133,
"learning_rate": 9.600000000000001e-06,
"loss": 3.6031,
"step": 100
},
{
"epoch": 0.31007751937984496,
"eval_loss": 3.349764108657837,
"eval_runtime": 4.737,
"eval_samples_per_second": 120.752,
"eval_steps_per_second": 15.2,
"step": 100
},
{
"epoch": 0.34108527131782945,
"grad_norm": 8.584806442260742,
"learning_rate": 1.06e-05,
"loss": 3.3871,
"step": 110
},
{
"epoch": 0.37209302325581395,
"grad_norm": 9.76710033416748,
"learning_rate": 1.16e-05,
"loss": 3.4636,
"step": 120
},
{
"epoch": 0.40310077519379844,
"grad_norm": 10.434168815612793,
"learning_rate": 1.2600000000000001e-05,
"loss": 3.4924,
"step": 130
},
{
"epoch": 0.43410852713178294,
"grad_norm": 9.049373626708984,
"learning_rate": 1.3600000000000002e-05,
"loss": 3.4632,
"step": 140
},
{
"epoch": 0.46511627906976744,
"grad_norm": 9.166099548339844,
"learning_rate": 1.4599999999999999e-05,
"loss": 3.4463,
"step": 150
},
{
"epoch": 0.46511627906976744,
"eval_loss": 3.27072811126709,
"eval_runtime": 4.7291,
"eval_samples_per_second": 120.953,
"eval_steps_per_second": 15.225,
"step": 150
},
{
"epoch": 0.49612403100775193,
"grad_norm": 7.227886199951172,
"learning_rate": 1.56e-05,
"loss": 3.411,
"step": 160
},
{
"epoch": 0.5271317829457365,
"grad_norm": 9.005069732666016,
"learning_rate": 1.66e-05,
"loss": 3.2673,
"step": 170
},
{
"epoch": 0.5581395348837209,
"grad_norm": 9.941435813903809,
"learning_rate": 1.76e-05,
"loss": 3.5091,
"step": 180
},
{
"epoch": 0.5891472868217055,
"grad_norm": 10.245264053344727,
"learning_rate": 1.86e-05,
"loss": 3.4521,
"step": 190
},
{
"epoch": 0.6201550387596899,
"grad_norm": 8.744315147399902,
"learning_rate": 1.9600000000000002e-05,
"loss": 3.4016,
"step": 200
},
{
"epoch": 0.6201550387596899,
"eval_loss": 3.2324905395507812,
"eval_runtime": 4.71,
"eval_samples_per_second": 121.445,
"eval_steps_per_second": 15.287,
"step": 200
},
{
"epoch": 0.6511627906976745,
"grad_norm": 8.368231773376465,
"learning_rate": 2.06e-05,
"loss": 3.3639,
"step": 210
},
{
"epoch": 0.6821705426356589,
"grad_norm": 9.450159072875977,
"learning_rate": 2.16e-05,
"loss": 3.3308,
"step": 220
},
{
"epoch": 0.7131782945736435,
"grad_norm": 9.133488655090332,
"learning_rate": 2.26e-05,
"loss": 3.3072,
"step": 230
},
{
"epoch": 0.7441860465116279,
"grad_norm": 10.106104850769043,
"learning_rate": 2.36e-05,
"loss": 3.3585,
"step": 240
},
{
"epoch": 0.7751937984496124,
"grad_norm": 11.48149299621582,
"learning_rate": 2.46e-05,
"loss": 3.3733,
"step": 250
},
{
"epoch": 0.7751937984496124,
"eval_loss": 3.200448513031006,
"eval_runtime": 4.7453,
"eval_samples_per_second": 120.541,
"eval_steps_per_second": 15.173,
"step": 250
},
{
"epoch": 0.8062015503875969,
"grad_norm": 7.786629676818848,
"learning_rate": 2.5600000000000002e-05,
"loss": 3.3133,
"step": 260
},
{
"epoch": 0.8372093023255814,
"grad_norm": 9.597051620483398,
"learning_rate": 2.6600000000000003e-05,
"loss": 3.3562,
"step": 270
},
{
"epoch": 0.8682170542635659,
"grad_norm": 8.599666595458984,
"learning_rate": 2.7600000000000003e-05,
"loss": 3.3418,
"step": 280
},
{
"epoch": 0.8992248062015504,
"grad_norm": 7.085015296936035,
"learning_rate": 2.86e-05,
"loss": 3.3213,
"step": 290
},
{
"epoch": 0.9302325581395349,
"grad_norm": 8.608779907226562,
"learning_rate": 2.96e-05,
"loss": 3.3827,
"step": 300
},
{
"epoch": 0.9302325581395349,
"eval_loss": 3.1764185428619385,
"eval_runtime": 4.7063,
"eval_samples_per_second": 121.54,
"eval_steps_per_second": 15.299,
"step": 300
},
{
"epoch": 0.9612403100775194,
"grad_norm": 8.341065406799316,
"learning_rate": 3.06e-05,
"loss": 3.3358,
"step": 310
},
{
"epoch": 0.9922480620155039,
"grad_norm": 7.7783989906311035,
"learning_rate": 3.16e-05,
"loss": 3.3063,
"step": 320
},
{
"epoch": 1.0232558139534884,
"grad_norm": 7.145493984222412,
"learning_rate": 3.26e-05,
"loss": 3.1819,
"step": 330
},
{
"epoch": 1.054263565891473,
"grad_norm": 7.140699863433838,
"learning_rate": 3.3600000000000004e-05,
"loss": 3.249,
"step": 340
},
{
"epoch": 1.0852713178294573,
"grad_norm": 8.35848617553711,
"learning_rate": 3.46e-05,
"loss": 3.1805,
"step": 350
},
{
"epoch": 1.0852713178294573,
"eval_loss": 3.1566410064697266,
"eval_runtime": 4.7112,
"eval_samples_per_second": 121.413,
"eval_steps_per_second": 15.283,
"step": 350
},
{
"epoch": 1.1162790697674418,
"grad_norm": 7.644073963165283,
"learning_rate": 3.56e-05,
"loss": 3.3018,
"step": 360
},
{
"epoch": 1.1472868217054264,
"grad_norm": 10.410257339477539,
"learning_rate": 3.66e-05,
"loss": 3.2404,
"step": 370
},
{
"epoch": 1.178294573643411,
"grad_norm": 9.099555969238281,
"learning_rate": 3.76e-05,
"loss": 3.2445,
"step": 380
},
{
"epoch": 1.2093023255813953,
"grad_norm": 8.178119659423828,
"learning_rate": 3.86e-05,
"loss": 3.2468,
"step": 390
},
{
"epoch": 1.2403100775193798,
"grad_norm": 8.377422332763672,
"learning_rate": 3.960000000000001e-05,
"loss": 3.1353,
"step": 400
},
{
"epoch": 1.2403100775193798,
"eval_loss": 3.1435060501098633,
"eval_runtime": 4.7171,
"eval_samples_per_second": 121.262,
"eval_steps_per_second": 15.264,
"step": 400
},
{
"epoch": 1.2713178294573644,
"grad_norm": 8.308828353881836,
"learning_rate": 4.0600000000000004e-05,
"loss": 3.2141,
"step": 410
},
{
"epoch": 1.302325581395349,
"grad_norm": 10.332070350646973,
"learning_rate": 4.16e-05,
"loss": 3.2425,
"step": 420
},
{
"epoch": 1.3333333333333333,
"grad_norm": 7.949954509735107,
"learning_rate": 4.26e-05,
"loss": 3.2722,
"step": 430
},
{
"epoch": 1.3643410852713178,
"grad_norm": 7.976950168609619,
"learning_rate": 4.36e-05,
"loss": 3.2182,
"step": 440
},
{
"epoch": 1.3953488372093024,
"grad_norm": 7.078619956970215,
"learning_rate": 4.46e-05,
"loss": 3.1613,
"step": 450
},
{
"epoch": 1.3953488372093024,
"eval_loss": 3.129640579223633,
"eval_runtime": 4.7084,
"eval_samples_per_second": 121.485,
"eval_steps_per_second": 15.292,
"step": 450
},
{
"epoch": 1.4263565891472867,
"grad_norm": 8.637125968933105,
"learning_rate": 4.5600000000000004e-05,
"loss": 3.1195,
"step": 460
},
{
"epoch": 1.4573643410852712,
"grad_norm": 7.1886067390441895,
"learning_rate": 4.660000000000001e-05,
"loss": 3.2467,
"step": 470
},
{
"epoch": 1.4883720930232558,
"grad_norm": 6.580921173095703,
"learning_rate": 4.76e-05,
"loss": 3.2029,
"step": 480
},
{
"epoch": 1.5193798449612403,
"grad_norm": 7.07883882522583,
"learning_rate": 4.86e-05,
"loss": 3.1662,
"step": 490
},
{
"epoch": 1.550387596899225,
"grad_norm": 7.247085094451904,
"learning_rate": 4.96e-05,
"loss": 3.2172,
"step": 500
},
{
"epoch": 1.550387596899225,
"eval_loss": 3.12103271484375,
"eval_runtime": 4.7178,
"eval_samples_per_second": 121.243,
"eval_steps_per_second": 15.261,
"step": 500
},
{
"epoch": 1.5813953488372094,
"grad_norm": 5.985532283782959,
"learning_rate": 4.99795505698779e-05,
"loss": 3.1151,
"step": 510
},
{
"epoch": 1.6124031007751938,
"grad_norm": 5.8070759773254395,
"learning_rate": 4.9854702961190384e-05,
"loss": 3.1967,
"step": 520
},
{
"epoch": 1.6434108527131783,
"grad_norm": 6.231266021728516,
"learning_rate": 4.961693505953091e-05,
"loss": 3.1199,
"step": 530
},
{
"epoch": 1.6744186046511627,
"grad_norm": 5.798988342285156,
"learning_rate": 4.926732709591879e-05,
"loss": 3.107,
"step": 540
},
{
"epoch": 1.7054263565891472,
"grad_norm": 5.160669326782227,
"learning_rate": 4.880746741497186e-05,
"loss": 3.1419,
"step": 550
},
{
"epoch": 1.7054263565891472,
"eval_loss": 3.10736083984375,
"eval_runtime": 4.7333,
"eval_samples_per_second": 120.845,
"eval_steps_per_second": 15.211,
"step": 550
},
{
"epoch": 1.7364341085271318,
"grad_norm": 7.017159938812256,
"learning_rate": 4.8239445258713245e-05,
"loss": 3.1765,
"step": 560
},
{
"epoch": 1.7674418604651163,
"grad_norm": 5.4090375900268555,
"learning_rate": 4.75658412746928e-05,
"loss": 3.2182,
"step": 570
},
{
"epoch": 1.7984496124031009,
"grad_norm": 7.889895439147949,
"learning_rate": 4.6789715791546975e-05,
"loss": 3.2102,
"step": 580
},
{
"epoch": 1.8294573643410854,
"grad_norm": 5.4858784675598145,
"learning_rate": 4.591459491526371e-05,
"loss": 3.0703,
"step": 590
},
{
"epoch": 1.8604651162790697,
"grad_norm": 5.410943031311035,
"learning_rate": 4.494445450932003e-05,
"loss": 3.0979,
"step": 600
},
{
"epoch": 1.8604651162790697,
"eval_loss": 3.0953683853149414,
"eval_runtime": 4.7038,
"eval_samples_per_second": 121.605,
"eval_steps_per_second": 15.307,
"step": 600
},
{
"epoch": 1.8914728682170543,
"grad_norm": 5.534840106964111,
"learning_rate": 4.388370213147409e-05,
"loss": 3.1418,
"step": 610
},
{
"epoch": 1.9224806201550386,
"grad_norm": 5.086917400360107,
"learning_rate": 4.273715700927666e-05,
"loss": 3.1561,
"step": 620
},
{
"epoch": 1.9534883720930232,
"grad_norm": 6.430456161499023,
"learning_rate": 4.151002814527775e-05,
"loss": 3.1791,
"step": 630
},
{
"epoch": 1.9844961240310077,
"grad_norm": 5.168478965759277,
"learning_rate": 4.020789065140097e-05,
"loss": 3.2712,
"step": 640
},
{
"epoch": 2.0155038759689923,
"grad_norm": 5.176158905029297,
"learning_rate": 3.883666042000392e-05,
"loss": 3.1357,
"step": 650
},
{
"epoch": 2.0155038759689923,
"eval_loss": 3.0860443115234375,
"eval_runtime": 4.6975,
"eval_samples_per_second": 121.766,
"eval_steps_per_second": 15.327,
"step": 650
},
{
"epoch": 2.046511627906977,
"grad_norm": 4.712176322937012,
"learning_rate": 3.740256724669926e-05,
"loss": 2.9274,
"step": 660
},
{
"epoch": 2.0775193798449614,
"grad_norm": 5.124958038330078,
"learning_rate": 3.591212652704536e-05,
"loss": 2.9446,
"step": 670
},
{
"epoch": 2.108527131782946,
"grad_norm": 7.340769290924072,
"learning_rate": 3.4372109655694744e-05,
"loss": 3.0486,
"step": 680
},
{
"epoch": 2.13953488372093,
"grad_norm": 6.670995712280273,
"learning_rate": 3.278951326248305e-05,
"loss": 3.0568,
"step": 690
},
{
"epoch": 2.1705426356589146,
"grad_norm": 5.709664821624756,
"learning_rate": 3.117152742522603e-05,
"loss": 2.9513,
"step": 700
},
{
"epoch": 2.1705426356589146,
"eval_loss": 3.0826711654663086,
"eval_runtime": 4.7073,
"eval_samples_per_second": 121.512,
"eval_steps_per_second": 15.295,
"step": 700
},
{
"epoch": 2.201550387596899,
"grad_norm": 5.379000663757324,
"learning_rate": 2.9525503003640336e-05,
"loss": 2.9515,
"step": 710
},
{
"epoch": 2.2325581395348837,
"grad_norm": 5.246376037597656,
"learning_rate": 2.785891824279755e-05,
"loss": 3.0339,
"step": 720
},
{
"epoch": 2.2635658914728682,
"grad_norm": 6.674692153930664,
"learning_rate": 2.6179344797838774e-05,
"loss": 3.0632,
"step": 730
},
{
"epoch": 2.294573643410853,
"grad_norm": 5.437400817871094,
"learning_rate": 2.4494413334307217e-05,
"loss": 2.9205,
"step": 740
},
{
"epoch": 2.3255813953488373,
"grad_norm": 5.837658882141113,
"learning_rate": 2.28117788603837e-05,
"loss": 2.9206,
"step": 750
},
{
"epoch": 2.3255813953488373,
"eval_loss": 3.0738000869750977,
"eval_runtime": 4.7166,
"eval_samples_per_second": 121.274,
"eval_steps_per_second": 15.265,
"step": 750
},
{
"epoch": 2.356589147286822,
"grad_norm": 5.022912979125977,
"learning_rate": 2.1139085948528285e-05,
"loss": 2.9464,
"step": 760
},
{
"epoch": 2.387596899224806,
"grad_norm": 5.174287796020508,
"learning_rate": 1.9483934004533667e-05,
"loss": 2.9933,
"step": 770
},
{
"epoch": 2.4186046511627906,
"grad_norm": 4.518463611602783,
"learning_rate": 1.7853842741780474e-05,
"loss": 2.9652,
"step": 780
},
{
"epoch": 2.449612403100775,
"grad_norm": 4.628320693969727,
"learning_rate": 1.6256218017552482e-05,
"loss": 2.9812,
"step": 790
},
{
"epoch": 2.4806201550387597,
"grad_norm": 5.738299369812012,
"learning_rate": 1.4698318186624669e-05,
"loss": 2.9016,
"step": 800
},
{
"epoch": 2.4806201550387597,
"eval_loss": 3.0678045749664307,
"eval_runtime": 4.7499,
"eval_samples_per_second": 120.422,
"eval_steps_per_second": 15.158,
"step": 800
},
{
"epoch": 2.511627906976744,
"grad_norm": 6.1115641593933105,
"learning_rate": 1.3187221124987106e-05,
"loss": 3.048,
"step": 810
},
{
"epoch": 2.5426356589147288,
"grad_norm": 5.122735023498535,
"learning_rate": 1.1729792073522999e-05,
"loss": 3.0176,
"step": 820
},
{
"epoch": 2.5736434108527133,
"grad_norm": 5.320531845092773,
"learning_rate": 1.0332652447734056e-05,
"loss": 2.9813,
"step": 830
},
{
"epoch": 2.604651162790698,
"grad_norm": 5.2405900955200195,
"learning_rate": 9.002149755217246e-06,
"loss": 3.0905,
"step": 840
},
{
"epoch": 2.6356589147286824,
"grad_norm": 5.132701396942139,
"learning_rate": 7.7443287575645e-06,
"loss": 2.9043,
"step": 850
},
{
"epoch": 2.6356589147286824,
"eval_loss": 3.062049388885498,
"eval_runtime": 4.7405,
"eval_samples_per_second": 120.662,
"eval_steps_per_second": 15.188,
"step": 850
},
{
"epoch": 2.6666666666666665,
"grad_norm": 5.587965488433838,
"learning_rate": 6.5649040077030325e-06,
"loss": 2.9439,
"step": 860
},
{
"epoch": 2.697674418604651,
"grad_norm": 4.826563358306885,
"learning_rate": 5.469233887444941e-06,
"loss": 2.9252,
"step": 870
},
{
"epoch": 2.7286821705426356,
"grad_norm": 5.297211170196533,
"learning_rate": 4.462296263199381e-06,
"loss": 3.026,
"step": 880
},
{
"epoch": 2.75968992248062,
"grad_norm": 4.917094707489014,
"learning_rate": 3.5486658704484977e-06,
"loss": 2.8904,
"step": 890
},
{
"epoch": 2.7906976744186047,
"grad_norm": 4.789050579071045,
"learning_rate": 2.7324935297343147e-06,
"loss": 3.0086,
"step": 900
},
{
"epoch": 2.7906976744186047,
"eval_loss": 3.0606205463409424,
"eval_runtime": 4.7114,
"eval_samples_per_second": 121.409,
"eval_steps_per_second": 15.282,
"step": 900
},
{
"epoch": 2.8217054263565893,
"grad_norm": 5.387036323547363,
"learning_rate": 2.0174872885830113e-06,
"loss": 3.0176,
"step": 910
},
{
"epoch": 2.8527131782945734,
"grad_norm": 6.046304225921631,
"learning_rate": 1.406895575042727e-06,
"loss": 3.0501,
"step": 920
},
{
"epoch": 2.883720930232558,
"grad_norm": 5.257150650024414,
"learning_rate": 9.034924393721777e-07,
"loss": 2.9108,
"step": 930
},
{
"epoch": 2.9147286821705425,
"grad_norm": 5.8900885581970215,
"learning_rate": 5.095649509300804e-07,
"loss": 2.9864,
"step": 940
},
{
"epoch": 2.945736434108527,
"grad_norm": 5.49445104598999,
"learning_rate": 2.2690280752429292e-07,
"loss": 2.9851,
"step": 950
},
{
"epoch": 2.945736434108527,
"eval_loss": 3.060117483139038,
"eval_runtime": 4.7091,
"eval_samples_per_second": 121.466,
"eval_steps_per_second": 15.289,
"step": 950
},
{
"epoch": 2.9767441860465116,
"grad_norm": 5.116360187530518,
"learning_rate": 5.6790204427450975e-08,
"loss": 3.004,
"step": 960
},
{
"epoch": 2.9953488372093022,
"step": 966,
"total_flos": 1.4346568329068544e+16,
"train_loss": 3.2167103552176592,
"train_runtime": 2485.5794,
"train_samples_per_second": 6.223,
"train_steps_per_second": 0.389
}
],
"logging_steps": 10,
"max_steps": 966,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.4346568329068544e+16,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}