Download trainer_state.json from harsh580g/BART_Layman: direct link, hf CLI and curl.
- Browser
- Download file 4.48 kB
-
https://huggingface.co/harsh580g/BART_Layman/resolve/main/trainer_state.json
- Command line
-
hf download hf://harsh580g/BART_Layman/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/harsh580g/BART_Layman/resolve/main/trainer_state.json
4.48 kB
| { | |
| "best_metric": 1.693805456161499, | |
| "best_model_checkpoint": "./BART/checkpoint-3080", | |
| "epoch": 7.0, | |
| "eval_steps": 500, | |
| "global_step": 3080, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 1.0, | |
| "eval_gen_len": 21.0, | |
| "eval_loss": 1.8580667972564697, | |
| "eval_rouge1": 15.4451, | |
| "eval_rouge2": 7.2478, | |
| "eval_rougeL": 13.17, | |
| "eval_rougeLsum": 14.0774, | |
| "eval_runtime": 9.1697, | |
| "eval_samples_per_second": 10.905, | |
| "eval_steps_per_second": 0.763, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 1.1363636363636362, | |
| "grad_norm": 3.0643959045410156, | |
| "learning_rate": 1.9843637462342498e-05, | |
| "loss": 1.9394, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_gen_len": 21.0, | |
| "eval_loss": 1.7797517776489258, | |
| "eval_rouge1": 15.3282, | |
| "eval_rouge2": 7.1147, | |
| "eval_rougeL": 13.0747, | |
| "eval_rougeLsum": 14.2107, | |
| "eval_runtime": 9.0361, | |
| "eval_samples_per_second": 11.067, | |
| "eval_steps_per_second": 0.775, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 2.2727272727272725, | |
| "grad_norm": 5.788974761962891, | |
| "learning_rate": 1.937447803209855e-05, | |
| "loss": 1.6636, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_gen_len": 21.0, | |
| "eval_loss": 1.7304754257202148, | |
| "eval_rouge1": 15.6545, | |
| "eval_rouge2": 6.9151, | |
| "eval_rougeL": 13.0932, | |
| "eval_rougeLsum": 14.3822, | |
| "eval_runtime": 9.2209, | |
| "eval_samples_per_second": 10.845, | |
| "eval_steps_per_second": 0.759, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 3.409090909090909, | |
| "grad_norm": 3.81870698928833, | |
| "learning_rate": 1.860742027003944e-05, | |
| "loss": 1.5132, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "eval_gen_len": 21.0, | |
| "eval_loss": 1.7133750915527344, | |
| "eval_rouge1": 16.2201, | |
| "eval_rouge2": 8.0653, | |
| "eval_rougeL": 14.0536, | |
| "eval_rougeLsum": 15.088, | |
| "eval_runtime": 7.0109, | |
| "eval_samples_per_second": 14.264, | |
| "eval_steps_per_second": 0.998, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 4.545454545454545, | |
| "grad_norm": 2.5344793796539307, | |
| "learning_rate": 1.756683942425267e-05, | |
| "loss": 1.404, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_gen_len": 21.0, | |
| "eval_loss": 1.7092199325561523, | |
| "eval_rouge1": 16.1558, | |
| "eval_rouge2": 7.4414, | |
| "eval_rougeL": 13.6423, | |
| "eval_rougeLsum": 14.6771, | |
| "eval_runtime": 7.0032, | |
| "eval_samples_per_second": 14.279, | |
| "eval_steps_per_second": 1.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 5.681818181818182, | |
| "grad_norm": 2.570192575454712, | |
| "learning_rate": 1.6285802647599156e-05, | |
| "loss": 1.3153, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "eval_gen_len": 21.0, | |
| "eval_loss": 1.6954882144927979, | |
| "eval_rouge1": 15.8485, | |
| "eval_rouge2": 7.8577, | |
| "eval_rougeL": 13.518, | |
| "eval_rougeLsum": 14.7491, | |
| "eval_runtime": 6.9893, | |
| "eval_samples_per_second": 14.308, | |
| "eval_steps_per_second": 1.002, | |
| "step": 2640 | |
| }, | |
| { | |
| "epoch": 6.818181818181818, | |
| "grad_norm": 2.7792255878448486, | |
| "learning_rate": 1.4805018203243235e-05, | |
| "loss": 1.2473, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "eval_gen_len": 21.0, | |
| "eval_loss": 1.693805456161499, | |
| "eval_rouge1": 17.0591, | |
| "eval_rouge2": 8.3853, | |
| "eval_rougeL": 14.3266, | |
| "eval_rougeLsum": 15.6269, | |
| "eval_runtime": 6.9975, | |
| "eval_samples_per_second": 14.291, | |
| "eval_steps_per_second": 1.0, | |
| "step": 3080 | |
| } | |
| ], | |
| "logging_steps": 500, | |
| "max_steps": 8800, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 20, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 4, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.0664321746993152e+17, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |