{ "best_global_step": 1100, "best_metric": 0.11870265007019043, "best_model_checkpoint": "./fine_tuning_results/checkpoint-1100", "epoch": 3.0, "eval_steps": 100, "global_step": 1131, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.06637902422834384, "grad_norm": 5.728163719177246, "learning_rate": 0.0001411764705882353, "loss": 9.6583, "step": 25 }, { "epoch": 0.13275804845668768, "grad_norm": 11.366268157958984, "learning_rate": 0.00019990774875676051, "loss": 4.1605, "step": 50 }, { "epoch": 0.19913707268503153, "grad_norm": 4.53806209564209, "learning_rate": 0.0001993446074245224, "loss": 2.6629, "step": 75 }, { "epoch": 0.26551609691337535, "grad_norm": 3.489072799682617, "learning_rate": 0.0001982724572970665, "loss": 1.4258, "step": 100 }, { "epoch": 0.26551609691337535, "eval_loss": 0.2438984215259552, "eval_runtime": 410.0948, "eval_samples_per_second": 0.919, "eval_steps_per_second": 0.919, "step": 100 }, { "epoch": 0.3318951211417192, "grad_norm": 3.9948933124542236, "learning_rate": 0.00019669679171579118, "loss": 1.8838, "step": 125 }, { "epoch": 0.39827414537006306, "grad_norm": 2.3741233348846436, "learning_rate": 0.0001946256838681596, "loss": 1.2398, "step": 150 }, { "epoch": 0.4646531695984069, "grad_norm": 3.841597080230713, "learning_rate": 0.00019206974542336673, "loss": 1.6213, "step": 175 }, { "epoch": 0.5310321938267507, "grad_norm": 7.553189277648926, "learning_rate": 0.00018904207216166835, "loss": 1.0164, "step": 200 }, { "epoch": 0.5310321938267507, "eval_loss": 0.19300179183483124, "eval_runtime": 409.4453, "eval_samples_per_second": 0.921, "eval_steps_per_second": 0.921, "step": 200 }, { "epoch": 0.5974112180550946, "grad_norm": 4.948668956756592, "learning_rate": 0.00018555817687594984, "loss": 1.469, "step": 225 }, { "epoch": 0.6637902422834384, "grad_norm": 1.0395816564559937, "learning_rate": 0.00018163590988932402, "loss": 0.8695, "step": 250 }, { "epoch": 0.7301692665117823, "grad_norm": 3.0940940380096436, "learning_rate": 0.00017729536759600033, "loss": 1.5099, "step": 275 }, { "epoch": 0.7965482907401261, "grad_norm": 1.1767245531082153, "learning_rate": 0.000172558789494031, "loss": 0.8654, "step": 300 }, { "epoch": 0.7965482907401261, "eval_loss": 0.1677449345588684, "eval_runtime": 409.3224, "eval_samples_per_second": 0.921, "eval_steps_per_second": 0.921, "step": 300 }, { "epoch": 0.86292731496847, "grad_norm": 3.1094260215759277, "learning_rate": 0.00016745044423750448, "loss": 1.3233, "step": 325 }, { "epoch": 0.9293063391968138, "grad_norm": 3.251939296722412, "learning_rate": 0.00016199650529201683, "loss": 0.9238, "step": 350 }, { "epoch": 0.9956853634251577, "grad_norm": 5.835708141326904, "learning_rate": 0.00015622491683052125, "loss": 1.2047, "step": 375 }, { "epoch": 1.0610687022900764, "grad_norm": 2.8808865547180176, "learning_rate": 0.00015016525055666058, "loss": 1.1297, "step": 400 }, { "epoch": 1.0610687022900764, "eval_loss": 0.13486357033252716, "eval_runtime": 408.8177, "eval_samples_per_second": 0.922, "eval_steps_per_second": 0.922, "step": 400 }, { "epoch": 1.1274477265184202, "grad_norm": 4.205045223236084, "learning_rate": 0.00014384855418917312, "loss": 0.8077, "step": 425 }, { "epoch": 1.193826750746764, "grad_norm": 2.632800817489624, "learning_rate": 0.00013730719238368662, "loss": 1.1098, "step": 450 }, { "epoch": 1.2602057749751079, "grad_norm": 2.277942180633545, "learning_rate": 0.00013057468090696495, "loss": 0.8367, "step": 475 }, { "epoch": 1.3265847992034518, "grad_norm": 2.172236680984497, "learning_rate": 0.0001236855149132436, "loss": 1.0882, "step": 500 }, { "epoch": 1.3265847992034518, "eval_loss": 0.13017548620700836, "eval_runtime": 407.3514, "eval_samples_per_second": 0.925, "eval_steps_per_second": 0.925, "step": 500 }, { "epoch": 1.3929638234317956, "grad_norm": 3.1930105686187744, "learning_rate": 0.00011667499220250804, "loss": 0.8774, "step": 525 }, { "epoch": 1.4593428476601393, "grad_norm": 2.3342959880828857, "learning_rate": 0.00010957903236628266, "loss": 1.087, "step": 550 }, { "epoch": 1.5257218718884833, "grad_norm": 2.948979377746582, "learning_rate": 0.00010243399274756564, "loss": 0.8045, "step": 575 }, { "epoch": 1.592100896116827, "grad_norm": 2.6527910232543945, "learning_rate": 9.527648215787065e-05, "loss": 1.0704, "step": 600 }, { "epoch": 1.592100896116827, "eval_loss": 0.12589675188064575, "eval_runtime": 408.7252, "eval_samples_per_second": 0.922, "eval_steps_per_second": 0.922, "step": 600 }, { "epoch": 1.658479920345171, "grad_norm": 1.180399775505066, "learning_rate": 8.814317330582753e-05, "loss": 0.8398, "step": 625 }, { "epoch": 1.7248589445735147, "grad_norm": 2.150588274002075, "learning_rate": 8.107061489839499e-05, "loss": 1.0931, "step": 650 }, { "epoch": 1.7912379688018585, "grad_norm": 1.0235155820846558, "learning_rate": 7.409504437741722e-05, "loss": 0.8223, "step": 675 }, { "epoch": 1.8576169930302024, "grad_norm": 1.9297289848327637, "learning_rate": 6.725220225099911e-05, "loss": 0.9843, "step": 700 }, { "epoch": 1.8576169930302024, "eval_loss": 0.1218644380569458, "eval_runtime": 409.0035, "eval_samples_per_second": 0.922, "eval_steps_per_second": 0.922, "step": 700 }, { "epoch": 1.9239960172585464, "grad_norm": 3.172612190246582, "learning_rate": 6.0577148971005514e-05, "loss": 0.7813, "step": 725 }, { "epoch": 1.9903750414868902, "grad_norm": 2.5401861667633057, "learning_rate": 5.4104085294942505e-05, "loss": 0.7978, "step": 750 }, { "epoch": 2.0557583803518087, "grad_norm": 2.2131431102752686, "learning_rate": 4.786617705262746e-05, "loss": 0.8183, "step": 775 }, { "epoch": 2.122137404580153, "grad_norm": 4.252758026123047, "learning_rate": 4.189538521548524e-05, "loss": 0.706, "step": 800 }, { "epoch": 2.122137404580153, "eval_loss": 0.12229160219430923, "eval_runtime": 408.8022, "eval_samples_per_second": 0.922, "eval_steps_per_second": 0.922, "step": 800 }, { "epoch": 2.1885164288084966, "grad_norm": 2.4397575855255127, "learning_rate": 3.622230213913836e-05, "loss": 0.8344, "step": 825 }, { "epoch": 2.2548954530368404, "grad_norm": 1.8311405181884766, "learning_rate": 3.0875994818330955e-05, "loss": 0.6842, "step": 850 }, { "epoch": 2.321274477265184, "grad_norm": 2.2209343910217285, "learning_rate": 2.5883855957295056e-05, "loss": 0.8642, "step": 875 }, { "epoch": 2.387653501493528, "grad_norm": 1.0353050231933594, "learning_rate": 2.1271463618625986e-05, "loss": 0.6177, "step": 900 }, { "epoch": 2.387653501493528, "eval_loss": 0.12045033276081085, "eval_runtime": 409.5523, "eval_samples_per_second": 0.921, "eval_steps_per_second": 0.921, "step": 900 }, { "epoch": 2.454032525721872, "grad_norm": 2.0583794116973877, "learning_rate": 1.706245016977931e-05, "loss": 0.8361, "step": 925 }, { "epoch": 2.5204115499502158, "grad_norm": 2.405135154724121, "learning_rate": 1.3278381198663491e-05, "loss": 0.6861, "step": 950 }, { "epoch": 2.5867905741785595, "grad_norm": 2.8698174953460693, "learning_rate": 9.938645018725523e-06, "loss": 0.8369, "step": 975 }, { "epoch": 2.6531695984069037, "grad_norm": 2.2361364364624023, "learning_rate": 7.060353329667668e-06, "loss": 0.7129, "step": 1000 }, { "epoch": 2.6531695984069037, "eval_loss": 0.11899977177381516, "eval_runtime": 409.2689, "eval_samples_per_second": 0.921, "eval_steps_per_second": 0.921, "step": 1000 }, { "epoch": 2.719548622635247, "grad_norm": 2.688868522644043, "learning_rate": 4.658253542777991e-06, "loss": 0.8243, "step": 1025 }, { "epoch": 2.785927646863591, "grad_norm": 2.82051682472229, "learning_rate": 2.7446532200894106e-06, "loss": 0.6894, "step": 1050 }, { "epoch": 2.852306671091935, "grad_norm": 2.1398074626922607, "learning_rate": 1.3293570145169743e-06, "loss": 0.7943, "step": 1075 }, { "epoch": 2.9186856953202787, "grad_norm": 2.2756364345550537, "learning_rate": 4.196164340705577e-07, "loss": 0.6947, "step": 1100 }, { "epoch": 2.9186856953202787, "eval_loss": 0.11870265007019043, "eval_runtime": 409.6404, "eval_samples_per_second": 0.92, "eval_steps_per_second": 0.92, "step": 1100 }, { "epoch": 2.985064719548623, "grad_norm": 2.8848876953125, "learning_rate": 2.0092687534589703e-08, "loss": 0.7374, "step": 1125 } ], "logging_steps": 25, "max_steps": 1131, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.5782738599655706e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }