{ "best_metric": 3.0606205463409424, "best_model_checkpoint": "/content/drive/MyDrive/Hugh Mann/GPT2-nov24/checkpoints/checkpoint-900", "epoch": 2.9953488372093022, "eval_steps": 50, "global_step": 966, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.031007751937984496, "grad_norm": 19.903196334838867, "learning_rate": 6.000000000000001e-07, "loss": 3.9736, "step": 10 }, { "epoch": 0.06201550387596899, "grad_norm": 13.974676132202148, "learning_rate": 1.6000000000000001e-06, "loss": 3.8925, "step": 20 }, { "epoch": 0.09302325581395349, "grad_norm": 13.976302146911621, "learning_rate": 2.6e-06, "loss": 3.7375, "step": 30 }, { "epoch": 0.12403100775193798, "grad_norm": 12.306398391723633, "learning_rate": 3.6e-06, "loss": 3.6961, "step": 40 }, { "epoch": 0.15503875968992248, "grad_norm": 9.758413314819336, "learning_rate": 4.6e-06, "loss": 3.7651, "step": 50 }, { "epoch": 0.15503875968992248, "eval_loss": 3.4887187480926514, "eval_runtime": 4.7241, "eval_samples_per_second": 121.08, "eval_steps_per_second": 15.241, "step": 50 }, { "epoch": 0.18604651162790697, "grad_norm": 8.832802772521973, "learning_rate": 5.600000000000001e-06, "loss": 3.6353, "step": 60 }, { "epoch": 0.21705426356589147, "grad_norm": 11.008893013000488, "learning_rate": 6.6e-06, "loss": 3.5125, "step": 70 }, { "epoch": 0.24806201550387597, "grad_norm": 9.586570739746094, "learning_rate": 7.6e-06, "loss": 3.6011, "step": 80 }, { "epoch": 0.27906976744186046, "grad_norm": 8.815489768981934, "learning_rate": 8.599999999999999e-06, "loss": 3.552, "step": 90 }, { "epoch": 0.31007751937984496, "grad_norm": 11.291627883911133, "learning_rate": 9.600000000000001e-06, "loss": 3.6031, "step": 100 }, { "epoch": 0.31007751937984496, "eval_loss": 3.349764108657837, "eval_runtime": 4.737, "eval_samples_per_second": 120.752, "eval_steps_per_second": 15.2, "step": 100 }, { "epoch": 0.34108527131782945, "grad_norm": 8.584806442260742, "learning_rate": 1.06e-05, "loss": 3.3871, "step": 110 }, { "epoch": 0.37209302325581395, "grad_norm": 9.76710033416748, "learning_rate": 1.16e-05, "loss": 3.4636, "step": 120 }, { "epoch": 0.40310077519379844, "grad_norm": 10.434168815612793, "learning_rate": 1.2600000000000001e-05, "loss": 3.4924, "step": 130 }, { "epoch": 0.43410852713178294, "grad_norm": 9.049373626708984, "learning_rate": 1.3600000000000002e-05, "loss": 3.4632, "step": 140 }, { "epoch": 0.46511627906976744, "grad_norm": 9.166099548339844, "learning_rate": 1.4599999999999999e-05, "loss": 3.4463, "step": 150 }, { "epoch": 0.46511627906976744, "eval_loss": 3.27072811126709, "eval_runtime": 4.7291, "eval_samples_per_second": 120.953, "eval_steps_per_second": 15.225, "step": 150 }, { "epoch": 0.49612403100775193, "grad_norm": 7.227886199951172, "learning_rate": 1.56e-05, "loss": 3.411, "step": 160 }, { "epoch": 0.5271317829457365, "grad_norm": 9.005069732666016, "learning_rate": 1.66e-05, "loss": 3.2673, "step": 170 }, { "epoch": 0.5581395348837209, "grad_norm": 9.941435813903809, "learning_rate": 1.76e-05, "loss": 3.5091, "step": 180 }, { "epoch": 0.5891472868217055, "grad_norm": 10.245264053344727, "learning_rate": 1.86e-05, "loss": 3.4521, "step": 190 }, { "epoch": 0.6201550387596899, "grad_norm": 8.744315147399902, "learning_rate": 1.9600000000000002e-05, "loss": 3.4016, "step": 200 }, { "epoch": 0.6201550387596899, "eval_loss": 3.2324905395507812, "eval_runtime": 4.71, "eval_samples_per_second": 121.445, "eval_steps_per_second": 15.287, "step": 200 }, { "epoch": 0.6511627906976745, "grad_norm": 8.368231773376465, "learning_rate": 2.06e-05, "loss": 3.3639, "step": 210 }, { "epoch": 0.6821705426356589, "grad_norm": 9.450159072875977, "learning_rate": 2.16e-05, "loss": 3.3308, "step": 220 }, { "epoch": 0.7131782945736435, "grad_norm": 9.133488655090332, "learning_rate": 2.26e-05, "loss": 3.3072, "step": 230 }, { "epoch": 0.7441860465116279, "grad_norm": 10.106104850769043, "learning_rate": 2.36e-05, "loss": 3.3585, "step": 240 }, { "epoch": 0.7751937984496124, "grad_norm": 11.48149299621582, "learning_rate": 2.46e-05, "loss": 3.3733, "step": 250 }, { "epoch": 0.7751937984496124, "eval_loss": 3.200448513031006, "eval_runtime": 4.7453, "eval_samples_per_second": 120.541, "eval_steps_per_second": 15.173, "step": 250 }, { "epoch": 0.8062015503875969, "grad_norm": 7.786629676818848, "learning_rate": 2.5600000000000002e-05, "loss": 3.3133, "step": 260 }, { "epoch": 0.8372093023255814, "grad_norm": 9.597051620483398, "learning_rate": 2.6600000000000003e-05, "loss": 3.3562, "step": 270 }, { "epoch": 0.8682170542635659, "grad_norm": 8.599666595458984, "learning_rate": 2.7600000000000003e-05, "loss": 3.3418, "step": 280 }, { "epoch": 0.8992248062015504, "grad_norm": 7.085015296936035, "learning_rate": 2.86e-05, "loss": 3.3213, "step": 290 }, { "epoch": 0.9302325581395349, "grad_norm": 8.608779907226562, "learning_rate": 2.96e-05, "loss": 3.3827, "step": 300 }, { "epoch": 0.9302325581395349, "eval_loss": 3.1764185428619385, "eval_runtime": 4.7063, "eval_samples_per_second": 121.54, "eval_steps_per_second": 15.299, "step": 300 }, { "epoch": 0.9612403100775194, "grad_norm": 8.341065406799316, "learning_rate": 3.06e-05, "loss": 3.3358, "step": 310 }, { "epoch": 0.9922480620155039, "grad_norm": 7.7783989906311035, "learning_rate": 3.16e-05, "loss": 3.3063, "step": 320 }, { "epoch": 1.0232558139534884, "grad_norm": 7.145493984222412, "learning_rate": 3.26e-05, "loss": 3.1819, "step": 330 }, { "epoch": 1.054263565891473, "grad_norm": 7.140699863433838, "learning_rate": 3.3600000000000004e-05, "loss": 3.249, "step": 340 }, { "epoch": 1.0852713178294573, "grad_norm": 8.35848617553711, "learning_rate": 3.46e-05, "loss": 3.1805, "step": 350 }, { "epoch": 1.0852713178294573, "eval_loss": 3.1566410064697266, "eval_runtime": 4.7112, "eval_samples_per_second": 121.413, "eval_steps_per_second": 15.283, "step": 350 }, { "epoch": 1.1162790697674418, "grad_norm": 7.644073963165283, "learning_rate": 3.56e-05, "loss": 3.3018, "step": 360 }, { "epoch": 1.1472868217054264, "grad_norm": 10.410257339477539, "learning_rate": 3.66e-05, "loss": 3.2404, "step": 370 }, { "epoch": 1.178294573643411, "grad_norm": 9.099555969238281, "learning_rate": 3.76e-05, "loss": 3.2445, "step": 380 }, { "epoch": 1.2093023255813953, "grad_norm": 8.178119659423828, "learning_rate": 3.86e-05, "loss": 3.2468, "step": 390 }, { "epoch": 1.2403100775193798, "grad_norm": 8.377422332763672, "learning_rate": 3.960000000000001e-05, "loss": 3.1353, "step": 400 }, { "epoch": 1.2403100775193798, "eval_loss": 3.1435060501098633, "eval_runtime": 4.7171, "eval_samples_per_second": 121.262, "eval_steps_per_second": 15.264, "step": 400 }, { "epoch": 1.2713178294573644, "grad_norm": 8.308828353881836, "learning_rate": 4.0600000000000004e-05, "loss": 3.2141, "step": 410 }, { "epoch": 1.302325581395349, "grad_norm": 10.332070350646973, "learning_rate": 4.16e-05, "loss": 3.2425, "step": 420 }, { "epoch": 1.3333333333333333, "grad_norm": 7.949954509735107, "learning_rate": 4.26e-05, "loss": 3.2722, "step": 430 }, { "epoch": 1.3643410852713178, "grad_norm": 7.976950168609619, "learning_rate": 4.36e-05, "loss": 3.2182, "step": 440 }, { "epoch": 1.3953488372093024, "grad_norm": 7.078619956970215, "learning_rate": 4.46e-05, "loss": 3.1613, "step": 450 }, { "epoch": 1.3953488372093024, "eval_loss": 3.129640579223633, "eval_runtime": 4.7084, "eval_samples_per_second": 121.485, "eval_steps_per_second": 15.292, "step": 450 }, { "epoch": 1.4263565891472867, "grad_norm": 8.637125968933105, "learning_rate": 4.5600000000000004e-05, "loss": 3.1195, "step": 460 }, { "epoch": 1.4573643410852712, "grad_norm": 7.1886067390441895, "learning_rate": 4.660000000000001e-05, "loss": 3.2467, "step": 470 }, { "epoch": 1.4883720930232558, "grad_norm": 6.580921173095703, "learning_rate": 4.76e-05, "loss": 3.2029, "step": 480 }, { "epoch": 1.5193798449612403, "grad_norm": 7.07883882522583, "learning_rate": 4.86e-05, "loss": 3.1662, "step": 490 }, { "epoch": 1.550387596899225, "grad_norm": 7.247085094451904, "learning_rate": 4.96e-05, "loss": 3.2172, "step": 500 }, { "epoch": 1.550387596899225, "eval_loss": 3.12103271484375, "eval_runtime": 4.7178, "eval_samples_per_second": 121.243, "eval_steps_per_second": 15.261, "step": 500 }, { "epoch": 1.5813953488372094, "grad_norm": 5.985532283782959, "learning_rate": 4.99795505698779e-05, "loss": 3.1151, "step": 510 }, { "epoch": 1.6124031007751938, "grad_norm": 5.8070759773254395, "learning_rate": 4.9854702961190384e-05, "loss": 3.1967, "step": 520 }, { "epoch": 1.6434108527131783, "grad_norm": 6.231266021728516, "learning_rate": 4.961693505953091e-05, "loss": 3.1199, "step": 530 }, { "epoch": 1.6744186046511627, "grad_norm": 5.798988342285156, "learning_rate": 4.926732709591879e-05, "loss": 3.107, "step": 540 }, { "epoch": 1.7054263565891472, "grad_norm": 5.160669326782227, "learning_rate": 4.880746741497186e-05, "loss": 3.1419, "step": 550 }, { "epoch": 1.7054263565891472, "eval_loss": 3.10736083984375, "eval_runtime": 4.7333, "eval_samples_per_second": 120.845, "eval_steps_per_second": 15.211, "step": 550 }, { "epoch": 1.7364341085271318, "grad_norm": 7.017159938812256, "learning_rate": 4.8239445258713245e-05, "loss": 3.1765, "step": 560 }, { "epoch": 1.7674418604651163, "grad_norm": 5.4090375900268555, "learning_rate": 4.75658412746928e-05, "loss": 3.2182, "step": 570 }, { "epoch": 1.7984496124031009, "grad_norm": 7.889895439147949, "learning_rate": 4.6789715791546975e-05, "loss": 3.2102, "step": 580 }, { "epoch": 1.8294573643410854, "grad_norm": 5.4858784675598145, "learning_rate": 4.591459491526371e-05, "loss": 3.0703, "step": 590 }, { "epoch": 1.8604651162790697, "grad_norm": 5.410943031311035, "learning_rate": 4.494445450932003e-05, "loss": 3.0979, "step": 600 }, { "epoch": 1.8604651162790697, "eval_loss": 3.0953683853149414, "eval_runtime": 4.7038, "eval_samples_per_second": 121.605, "eval_steps_per_second": 15.307, "step": 600 }, { "epoch": 1.8914728682170543, "grad_norm": 5.534840106964111, "learning_rate": 4.388370213147409e-05, "loss": 3.1418, "step": 610 }, { "epoch": 1.9224806201550386, "grad_norm": 5.086917400360107, "learning_rate": 4.273715700927666e-05, "loss": 3.1561, "step": 620 }, { "epoch": 1.9534883720930232, "grad_norm": 6.430456161499023, "learning_rate": 4.151002814527775e-05, "loss": 3.1791, "step": 630 }, { "epoch": 1.9844961240310077, "grad_norm": 5.168478965759277, "learning_rate": 4.020789065140097e-05, "loss": 3.2712, "step": 640 }, { "epoch": 2.0155038759689923, "grad_norm": 5.176158905029297, "learning_rate": 3.883666042000392e-05, "loss": 3.1357, "step": 650 }, { "epoch": 2.0155038759689923, "eval_loss": 3.0860443115234375, "eval_runtime": 4.6975, "eval_samples_per_second": 121.766, "eval_steps_per_second": 15.327, "step": 650 }, { "epoch": 2.046511627906977, "grad_norm": 4.712176322937012, "learning_rate": 3.740256724669926e-05, "loss": 2.9274, "step": 660 }, { "epoch": 2.0775193798449614, "grad_norm": 5.124958038330078, "learning_rate": 3.591212652704536e-05, "loss": 2.9446, "step": 670 }, { "epoch": 2.108527131782946, "grad_norm": 7.340769290924072, "learning_rate": 3.4372109655694744e-05, "loss": 3.0486, "step": 680 }, { "epoch": 2.13953488372093, "grad_norm": 6.670995712280273, "learning_rate": 3.278951326248305e-05, "loss": 3.0568, "step": 690 }, { "epoch": 2.1705426356589146, "grad_norm": 5.709664821624756, "learning_rate": 3.117152742522603e-05, "loss": 2.9513, "step": 700 }, { "epoch": 2.1705426356589146, "eval_loss": 3.0826711654663086, "eval_runtime": 4.7073, "eval_samples_per_second": 121.512, "eval_steps_per_second": 15.295, "step": 700 }, { "epoch": 2.201550387596899, "grad_norm": 5.379000663757324, "learning_rate": 2.9525503003640336e-05, "loss": 2.9515, "step": 710 }, { "epoch": 2.2325581395348837, "grad_norm": 5.246376037597656, "learning_rate": 2.785891824279755e-05, "loss": 3.0339, "step": 720 }, { "epoch": 2.2635658914728682, "grad_norm": 6.674692153930664, "learning_rate": 2.6179344797838774e-05, "loss": 3.0632, "step": 730 }, { "epoch": 2.294573643410853, "grad_norm": 5.437400817871094, "learning_rate": 2.4494413334307217e-05, "loss": 2.9205, "step": 740 }, { "epoch": 2.3255813953488373, "grad_norm": 5.837658882141113, "learning_rate": 2.28117788603837e-05, "loss": 2.9206, "step": 750 }, { "epoch": 2.3255813953488373, "eval_loss": 3.0738000869750977, "eval_runtime": 4.7166, "eval_samples_per_second": 121.274, "eval_steps_per_second": 15.265, "step": 750 }, { "epoch": 2.356589147286822, "grad_norm": 5.022912979125977, "learning_rate": 2.1139085948528285e-05, "loss": 2.9464, "step": 760 }, { "epoch": 2.387596899224806, "grad_norm": 5.174287796020508, "learning_rate": 1.9483934004533667e-05, "loss": 2.9933, "step": 770 }, { "epoch": 2.4186046511627906, "grad_norm": 4.518463611602783, "learning_rate": 1.7853842741780474e-05, "loss": 2.9652, "step": 780 }, { "epoch": 2.449612403100775, "grad_norm": 4.628320693969727, "learning_rate": 1.6256218017552482e-05, "loss": 2.9812, "step": 790 }, { "epoch": 2.4806201550387597, "grad_norm": 5.738299369812012, "learning_rate": 1.4698318186624669e-05, "loss": 2.9016, "step": 800 }, { "epoch": 2.4806201550387597, "eval_loss": 3.0678045749664307, "eval_runtime": 4.7499, "eval_samples_per_second": 120.422, "eval_steps_per_second": 15.158, "step": 800 }, { "epoch": 2.511627906976744, "grad_norm": 6.1115641593933105, "learning_rate": 1.3187221124987106e-05, "loss": 3.048, "step": 810 }, { "epoch": 2.5426356589147288, "grad_norm": 5.122735023498535, "learning_rate": 1.1729792073522999e-05, "loss": 3.0176, "step": 820 }, { "epoch": 2.5736434108527133, "grad_norm": 5.320531845092773, "learning_rate": 1.0332652447734056e-05, "loss": 2.9813, "step": 830 }, { "epoch": 2.604651162790698, "grad_norm": 5.2405900955200195, "learning_rate": 9.002149755217246e-06, "loss": 3.0905, "step": 840 }, { "epoch": 2.6356589147286824, "grad_norm": 5.132701396942139, "learning_rate": 7.7443287575645e-06, "loss": 2.9043, "step": 850 }, { "epoch": 2.6356589147286824, "eval_loss": 3.062049388885498, "eval_runtime": 4.7405, "eval_samples_per_second": 120.662, "eval_steps_per_second": 15.188, "step": 850 }, { "epoch": 2.6666666666666665, "grad_norm": 5.587965488433838, "learning_rate": 6.5649040077030325e-06, "loss": 2.9439, "step": 860 }, { "epoch": 2.697674418604651, "grad_norm": 4.826563358306885, "learning_rate": 5.469233887444941e-06, "loss": 2.9252, "step": 870 }, { "epoch": 2.7286821705426356, "grad_norm": 5.297211170196533, "learning_rate": 4.462296263199381e-06, "loss": 3.026, "step": 880 }, { "epoch": 2.75968992248062, "grad_norm": 4.917094707489014, "learning_rate": 3.5486658704484977e-06, "loss": 2.8904, "step": 890 }, { "epoch": 2.7906976744186047, "grad_norm": 4.789050579071045, "learning_rate": 2.7324935297343147e-06, "loss": 3.0086, "step": 900 }, { "epoch": 2.7906976744186047, "eval_loss": 3.0606205463409424, "eval_runtime": 4.7114, "eval_samples_per_second": 121.409, "eval_steps_per_second": 15.282, "step": 900 }, { "epoch": 2.8217054263565893, "grad_norm": 5.387036323547363, "learning_rate": 2.0174872885830113e-06, "loss": 3.0176, "step": 910 }, { "epoch": 2.8527131782945734, "grad_norm": 6.046304225921631, "learning_rate": 1.406895575042727e-06, "loss": 3.0501, "step": 920 }, { "epoch": 2.883720930232558, "grad_norm": 5.257150650024414, "learning_rate": 9.034924393721777e-07, "loss": 2.9108, "step": 930 }, { "epoch": 2.9147286821705425, "grad_norm": 5.8900885581970215, "learning_rate": 5.095649509300804e-07, "loss": 2.9864, "step": 940 }, { "epoch": 2.945736434108527, "grad_norm": 5.49445104598999, "learning_rate": 2.2690280752429292e-07, "loss": 2.9851, "step": 950 }, { "epoch": 2.945736434108527, "eval_loss": 3.060117483139038, "eval_runtime": 4.7091, "eval_samples_per_second": 121.466, "eval_steps_per_second": 15.289, "step": 950 }, { "epoch": 2.9767441860465116, "grad_norm": 5.116360187530518, "learning_rate": 5.6790204427450975e-08, "loss": 3.004, "step": 960 }, { "epoch": 2.9953488372093022, "step": 966, "total_flos": 1.4346568329068544e+16, "train_loss": 3.2167103552176592, "train_runtime": 2485.5794, "train_samples_per_second": 6.223, "train_steps_per_second": 0.389 } ], "logging_steps": 10, "max_steps": 966, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.4346568329068544e+16, "train_batch_size": 8, "trial_name": null, "trial_params": null }