PEFT
Safetensors
model / trainer_state.json
exiort's picture
Upload folder using huggingface_hub
9b6040e verified
Raw
History Blame Contribute Delete
11 kB
{
"best_global_step": 1100,
"best_metric": 0.11870265007019043,
"best_model_checkpoint": "./fine_tuning_results/checkpoint-1100",
"epoch": 3.0,
"eval_steps": 100,
"global_step": 1131,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.06637902422834384,
"grad_norm": 5.728163719177246,
"learning_rate": 0.0001411764705882353,
"loss": 9.6583,
"step": 25
},
{
"epoch": 0.13275804845668768,
"grad_norm": 11.366268157958984,
"learning_rate": 0.00019990774875676051,
"loss": 4.1605,
"step": 50
},
{
"epoch": 0.19913707268503153,
"grad_norm": 4.53806209564209,
"learning_rate": 0.0001993446074245224,
"loss": 2.6629,
"step": 75
},
{
"epoch": 0.26551609691337535,
"grad_norm": 3.489072799682617,
"learning_rate": 0.0001982724572970665,
"loss": 1.4258,
"step": 100
},
{
"epoch": 0.26551609691337535,
"eval_loss": 0.2438984215259552,
"eval_runtime": 410.0948,
"eval_samples_per_second": 0.919,
"eval_steps_per_second": 0.919,
"step": 100
},
{
"epoch": 0.3318951211417192,
"grad_norm": 3.9948933124542236,
"learning_rate": 0.00019669679171579118,
"loss": 1.8838,
"step": 125
},
{
"epoch": 0.39827414537006306,
"grad_norm": 2.3741233348846436,
"learning_rate": 0.0001946256838681596,
"loss": 1.2398,
"step": 150
},
{
"epoch": 0.4646531695984069,
"grad_norm": 3.841597080230713,
"learning_rate": 0.00019206974542336673,
"loss": 1.6213,
"step": 175
},
{
"epoch": 0.5310321938267507,
"grad_norm": 7.553189277648926,
"learning_rate": 0.00018904207216166835,
"loss": 1.0164,
"step": 200
},
{
"epoch": 0.5310321938267507,
"eval_loss": 0.19300179183483124,
"eval_runtime": 409.4453,
"eval_samples_per_second": 0.921,
"eval_steps_per_second": 0.921,
"step": 200
},
{
"epoch": 0.5974112180550946,
"grad_norm": 4.948668956756592,
"learning_rate": 0.00018555817687594984,
"loss": 1.469,
"step": 225
},
{
"epoch": 0.6637902422834384,
"grad_norm": 1.0395816564559937,
"learning_rate": 0.00018163590988932402,
"loss": 0.8695,
"step": 250
},
{
"epoch": 0.7301692665117823,
"grad_norm": 3.0940940380096436,
"learning_rate": 0.00017729536759600033,
"loss": 1.5099,
"step": 275
},
{
"epoch": 0.7965482907401261,
"grad_norm": 1.1767245531082153,
"learning_rate": 0.000172558789494031,
"loss": 0.8654,
"step": 300
},
{
"epoch": 0.7965482907401261,
"eval_loss": 0.1677449345588684,
"eval_runtime": 409.3224,
"eval_samples_per_second": 0.921,
"eval_steps_per_second": 0.921,
"step": 300
},
{
"epoch": 0.86292731496847,
"grad_norm": 3.1094260215759277,
"learning_rate": 0.00016745044423750448,
"loss": 1.3233,
"step": 325
},
{
"epoch": 0.9293063391968138,
"grad_norm": 3.251939296722412,
"learning_rate": 0.00016199650529201683,
"loss": 0.9238,
"step": 350
},
{
"epoch": 0.9956853634251577,
"grad_norm": 5.835708141326904,
"learning_rate": 0.00015622491683052125,
"loss": 1.2047,
"step": 375
},
{
"epoch": 1.0610687022900764,
"grad_norm": 2.8808865547180176,
"learning_rate": 0.00015016525055666058,
"loss": 1.1297,
"step": 400
},
{
"epoch": 1.0610687022900764,
"eval_loss": 0.13486357033252716,
"eval_runtime": 408.8177,
"eval_samples_per_second": 0.922,
"eval_steps_per_second": 0.922,
"step": 400
},
{
"epoch": 1.1274477265184202,
"grad_norm": 4.205045223236084,
"learning_rate": 0.00014384855418917312,
"loss": 0.8077,
"step": 425
},
{
"epoch": 1.193826750746764,
"grad_norm": 2.632800817489624,
"learning_rate": 0.00013730719238368662,
"loss": 1.1098,
"step": 450
},
{
"epoch": 1.2602057749751079,
"grad_norm": 2.277942180633545,
"learning_rate": 0.00013057468090696495,
"loss": 0.8367,
"step": 475
},
{
"epoch": 1.3265847992034518,
"grad_norm": 2.172236680984497,
"learning_rate": 0.0001236855149132436,
"loss": 1.0882,
"step": 500
},
{
"epoch": 1.3265847992034518,
"eval_loss": 0.13017548620700836,
"eval_runtime": 407.3514,
"eval_samples_per_second": 0.925,
"eval_steps_per_second": 0.925,
"step": 500
},
{
"epoch": 1.3929638234317956,
"grad_norm": 3.1930105686187744,
"learning_rate": 0.00011667499220250804,
"loss": 0.8774,
"step": 525
},
{
"epoch": 1.4593428476601393,
"grad_norm": 2.3342959880828857,
"learning_rate": 0.00010957903236628266,
"loss": 1.087,
"step": 550
},
{
"epoch": 1.5257218718884833,
"grad_norm": 2.948979377746582,
"learning_rate": 0.00010243399274756564,
"loss": 0.8045,
"step": 575
},
{
"epoch": 1.592100896116827,
"grad_norm": 2.6527910232543945,
"learning_rate": 9.527648215787065e-05,
"loss": 1.0704,
"step": 600
},
{
"epoch": 1.592100896116827,
"eval_loss": 0.12589675188064575,
"eval_runtime": 408.7252,
"eval_samples_per_second": 0.922,
"eval_steps_per_second": 0.922,
"step": 600
},
{
"epoch": 1.658479920345171,
"grad_norm": 1.180399775505066,
"learning_rate": 8.814317330582753e-05,
"loss": 0.8398,
"step": 625
},
{
"epoch": 1.7248589445735147,
"grad_norm": 2.150588274002075,
"learning_rate": 8.107061489839499e-05,
"loss": 1.0931,
"step": 650
},
{
"epoch": 1.7912379688018585,
"grad_norm": 1.0235155820846558,
"learning_rate": 7.409504437741722e-05,
"loss": 0.8223,
"step": 675
},
{
"epoch": 1.8576169930302024,
"grad_norm": 1.9297289848327637,
"learning_rate": 6.725220225099911e-05,
"loss": 0.9843,
"step": 700
},
{
"epoch": 1.8576169930302024,
"eval_loss": 0.1218644380569458,
"eval_runtime": 409.0035,
"eval_samples_per_second": 0.922,
"eval_steps_per_second": 0.922,
"step": 700
},
{
"epoch": 1.9239960172585464,
"grad_norm": 3.172612190246582,
"learning_rate": 6.0577148971005514e-05,
"loss": 0.7813,
"step": 725
},
{
"epoch": 1.9903750414868902,
"grad_norm": 2.5401861667633057,
"learning_rate": 5.4104085294942505e-05,
"loss": 0.7978,
"step": 750
},
{
"epoch": 2.0557583803518087,
"grad_norm": 2.2131431102752686,
"learning_rate": 4.786617705262746e-05,
"loss": 0.8183,
"step": 775
},
{
"epoch": 2.122137404580153,
"grad_norm": 4.252758026123047,
"learning_rate": 4.189538521548524e-05,
"loss": 0.706,
"step": 800
},
{
"epoch": 2.122137404580153,
"eval_loss": 0.12229160219430923,
"eval_runtime": 408.8022,
"eval_samples_per_second": 0.922,
"eval_steps_per_second": 0.922,
"step": 800
},
{
"epoch": 2.1885164288084966,
"grad_norm": 2.4397575855255127,
"learning_rate": 3.622230213913836e-05,
"loss": 0.8344,
"step": 825
},
{
"epoch": 2.2548954530368404,
"grad_norm": 1.8311405181884766,
"learning_rate": 3.0875994818330955e-05,
"loss": 0.6842,
"step": 850
},
{
"epoch": 2.321274477265184,
"grad_norm": 2.2209343910217285,
"learning_rate": 2.5883855957295056e-05,
"loss": 0.8642,
"step": 875
},
{
"epoch": 2.387653501493528,
"grad_norm": 1.0353050231933594,
"learning_rate": 2.1271463618625986e-05,
"loss": 0.6177,
"step": 900
},
{
"epoch": 2.387653501493528,
"eval_loss": 0.12045033276081085,
"eval_runtime": 409.5523,
"eval_samples_per_second": 0.921,
"eval_steps_per_second": 0.921,
"step": 900
},
{
"epoch": 2.454032525721872,
"grad_norm": 2.0583794116973877,
"learning_rate": 1.706245016977931e-05,
"loss": 0.8361,
"step": 925
},
{
"epoch": 2.5204115499502158,
"grad_norm": 2.405135154724121,
"learning_rate": 1.3278381198663491e-05,
"loss": 0.6861,
"step": 950
},
{
"epoch": 2.5867905741785595,
"grad_norm": 2.8698174953460693,
"learning_rate": 9.938645018725523e-06,
"loss": 0.8369,
"step": 975
},
{
"epoch": 2.6531695984069037,
"grad_norm": 2.2361364364624023,
"learning_rate": 7.060353329667668e-06,
"loss": 0.7129,
"step": 1000
},
{
"epoch": 2.6531695984069037,
"eval_loss": 0.11899977177381516,
"eval_runtime": 409.2689,
"eval_samples_per_second": 0.921,
"eval_steps_per_second": 0.921,
"step": 1000
},
{
"epoch": 2.719548622635247,
"grad_norm": 2.688868522644043,
"learning_rate": 4.658253542777991e-06,
"loss": 0.8243,
"step": 1025
},
{
"epoch": 2.785927646863591,
"grad_norm": 2.82051682472229,
"learning_rate": 2.7446532200894106e-06,
"loss": 0.6894,
"step": 1050
},
{
"epoch": 2.852306671091935,
"grad_norm": 2.1398074626922607,
"learning_rate": 1.3293570145169743e-06,
"loss": 0.7943,
"step": 1075
},
{
"epoch": 2.9186856953202787,
"grad_norm": 2.2756364345550537,
"learning_rate": 4.196164340705577e-07,
"loss": 0.6947,
"step": 1100
},
{
"epoch": 2.9186856953202787,
"eval_loss": 0.11870265007019043,
"eval_runtime": 409.6404,
"eval_samples_per_second": 0.92,
"eval_steps_per_second": 0.92,
"step": 1100
},
{
"epoch": 2.985064719548623,
"grad_norm": 2.8848876953125,
"learning_rate": 2.0092687534589703e-08,
"loss": 0.7374,
"step": 1125
}
],
"logging_steps": 25,
"max_steps": 1131,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.5782738599655706e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}