BART_Layman / trainer_state.json
harsh580g's picture
Upload folder using huggingface_hub
e7d1b5d verified
Raw History Blame Contribute Delete
4.48 kB
{
"best_metric": 1.693805456161499,
"best_model_checkpoint": "./BART/checkpoint-3080",
"epoch": 7.0,
"eval_steps": 500,
"global_step": 3080,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 1.0,
"eval_gen_len": 21.0,
"eval_loss": 1.8580667972564697,
"eval_rouge1": 15.4451,
"eval_rouge2": 7.2478,
"eval_rougeL": 13.17,
"eval_rougeLsum": 14.0774,
"eval_runtime": 9.1697,
"eval_samples_per_second": 10.905,
"eval_steps_per_second": 0.763,
"step": 440
},
{
"epoch": 1.1363636363636362,
"grad_norm": 3.0643959045410156,
"learning_rate": 1.9843637462342498e-05,
"loss": 1.9394,
"step": 500
},
{
"epoch": 2.0,
"eval_gen_len": 21.0,
"eval_loss": 1.7797517776489258,
"eval_rouge1": 15.3282,
"eval_rouge2": 7.1147,
"eval_rougeL": 13.0747,
"eval_rougeLsum": 14.2107,
"eval_runtime": 9.0361,
"eval_samples_per_second": 11.067,
"eval_steps_per_second": 0.775,
"step": 880
},
{
"epoch": 2.2727272727272725,
"grad_norm": 5.788974761962891,
"learning_rate": 1.937447803209855e-05,
"loss": 1.6636,
"step": 1000
},
{
"epoch": 3.0,
"eval_gen_len": 21.0,
"eval_loss": 1.7304754257202148,
"eval_rouge1": 15.6545,
"eval_rouge2": 6.9151,
"eval_rougeL": 13.0932,
"eval_rougeLsum": 14.3822,
"eval_runtime": 9.2209,
"eval_samples_per_second": 10.845,
"eval_steps_per_second": 0.759,
"step": 1320
},
{
"epoch": 3.409090909090909,
"grad_norm": 3.81870698928833,
"learning_rate": 1.860742027003944e-05,
"loss": 1.5132,
"step": 1500
},
{
"epoch": 4.0,
"eval_gen_len": 21.0,
"eval_loss": 1.7133750915527344,
"eval_rouge1": 16.2201,
"eval_rouge2": 8.0653,
"eval_rougeL": 14.0536,
"eval_rougeLsum": 15.088,
"eval_runtime": 7.0109,
"eval_samples_per_second": 14.264,
"eval_steps_per_second": 0.998,
"step": 1760
},
{
"epoch": 4.545454545454545,
"grad_norm": 2.5344793796539307,
"learning_rate": 1.756683942425267e-05,
"loss": 1.404,
"step": 2000
},
{
"epoch": 5.0,
"eval_gen_len": 21.0,
"eval_loss": 1.7092199325561523,
"eval_rouge1": 16.1558,
"eval_rouge2": 7.4414,
"eval_rougeL": 13.6423,
"eval_rougeLsum": 14.6771,
"eval_runtime": 7.0032,
"eval_samples_per_second": 14.279,
"eval_steps_per_second": 1.0,
"step": 2200
},
{
"epoch": 5.681818181818182,
"grad_norm": 2.570192575454712,
"learning_rate": 1.6285802647599156e-05,
"loss": 1.3153,
"step": 2500
},
{
"epoch": 6.0,
"eval_gen_len": 21.0,
"eval_loss": 1.6954882144927979,
"eval_rouge1": 15.8485,
"eval_rouge2": 7.8577,
"eval_rougeL": 13.518,
"eval_rougeLsum": 14.7491,
"eval_runtime": 6.9893,
"eval_samples_per_second": 14.308,
"eval_steps_per_second": 1.002,
"step": 2640
},
{
"epoch": 6.818181818181818,
"grad_norm": 2.7792255878448486,
"learning_rate": 1.4805018203243235e-05,
"loss": 1.2473,
"step": 3000
},
{
"epoch": 7.0,
"eval_gen_len": 21.0,
"eval_loss": 1.693805456161499,
"eval_rouge1": 17.0591,
"eval_rouge2": 8.3853,
"eval_rougeL": 14.3266,
"eval_rougeLsum": 15.6269,
"eval_runtime": 6.9975,
"eval_samples_per_second": 14.291,
"eval_steps_per_second": 1.0,
"step": 3080
}
],
"logging_steps": 500,
"max_steps": 8800,
"num_input_tokens_seen": 0,
"num_train_epochs": 20,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 4,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.0664321746993152e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}