SciHigh2026-Task2-PEGASUS-XSum / trainer_state.json
kckrish21's picture
Upload folder using huggingface_hub
851f58c verified
Raw History Blame Contribute Delete
5.55 kB
{
"best_global_step": 1044,
"best_metric": 37.0629,
"best_model_checkpoint": "./results_pegasus/checkpoint-1044",
"epoch": 3.0,
"eval_steps": 500,
"global_step": 1044,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.14398848092152627,
"grad_norm": 71.70013427734375,
"learning_rate": 2.859195402298851e-05,
"loss": 29.788212890625,
"step": 50
},
{
"epoch": 0.28797696184305255,
"grad_norm": 73.66615295410156,
"learning_rate": 2.7155172413793102e-05,
"loss": 24.89407958984375,
"step": 100
},
{
"epoch": 0.4319654427645788,
"grad_norm": 70.73384094238281,
"learning_rate": 2.57183908045977e-05,
"loss": 24.67899169921875,
"step": 150
},
{
"epoch": 0.5759539236861051,
"grad_norm": 67.04731750488281,
"learning_rate": 2.4281609195402298e-05,
"loss": 23.75695068359375,
"step": 200
},
{
"epoch": 0.7199424046076314,
"grad_norm": 62.45637130737305,
"learning_rate": 2.2844827586206897e-05,
"loss": 23.85019287109375,
"step": 250
},
{
"epoch": 0.8639308855291576,
"grad_norm": 1750.8475341796875,
"learning_rate": 2.1408045977011497e-05,
"loss": 23.247626953125,
"step": 300
},
{
"epoch": 1.0,
"eval_loss": 2.6326208114624023,
"eval_model_preparation_time": 0.0127,
"eval_rouge1": 42.9633,
"eval_rouge2": 20.797,
"eval_rougeL": 36.68,
"eval_rougeLsum": 36.5897,
"eval_runtime": 183.6557,
"eval_samples_per_second": 1.889,
"eval_steps_per_second": 1.889,
"step": 348
},
{
"epoch": 1.005759539236861,
"grad_norm": 85.54132843017578,
"learning_rate": 1.997126436781609e-05,
"loss": 22.84858642578125,
"step": 350
},
{
"epoch": 1.1497480201583874,
"grad_norm": 70.81609344482422,
"learning_rate": 1.853448275862069e-05,
"loss": 22.126240234375,
"step": 400
},
{
"epoch": 1.2937365010799136,
"grad_norm": 214.08627319335938,
"learning_rate": 1.709770114942529e-05,
"loss": 21.31904052734375,
"step": 450
},
{
"epoch": 1.43772498200144,
"grad_norm": 77.83561706542969,
"learning_rate": 1.5660919540229885e-05,
"loss": 22.437314453125,
"step": 500
},
{
"epoch": 1.5817134629229663,
"grad_norm": 123.08596801757812,
"learning_rate": 1.4224137931034483e-05,
"loss": 21.7467578125,
"step": 550
},
{
"epoch": 1.7257019438444925,
"grad_norm": 60.972755432128906,
"learning_rate": 1.2787356321839081e-05,
"loss": 21.26820068359375,
"step": 600
},
{
"epoch": 1.8696904247660187,
"grad_norm": 90.81558227539062,
"learning_rate": 1.1350574712643677e-05,
"loss": 21.498505859375,
"step": 650
},
{
"epoch": 2.0,
"eval_loss": 2.586069345474243,
"eval_model_preparation_time": 0.0127,
"eval_rouge1": 43.4483,
"eval_rouge2": 21.3048,
"eval_rougeL": 36.9716,
"eval_rougeLsum": 36.8742,
"eval_runtime": 179.8863,
"eval_samples_per_second": 1.929,
"eval_steps_per_second": 1.929,
"step": 696
},
{
"epoch": 2.011519078473722,
"grad_norm": 79.58966064453125,
"learning_rate": 9.913793103448277e-06,
"loss": 21.545439453125,
"step": 700
},
{
"epoch": 2.1555075593952484,
"grad_norm": 62.96016311645508,
"learning_rate": 8.477011494252873e-06,
"loss": 21.18465576171875,
"step": 750
},
{
"epoch": 2.299496040316775,
"grad_norm": 114.29676818847656,
"learning_rate": 7.040229885057472e-06,
"loss": 20.94623291015625,
"step": 800
},
{
"epoch": 2.443484521238301,
"grad_norm": 427.0086364746094,
"learning_rate": 5.603448275862069e-06,
"loss": 21.252041015625,
"step": 850
},
{
"epoch": 2.587473002159827,
"grad_norm": 82.54395294189453,
"learning_rate": 4.166666666666667e-06,
"loss": 20.805263671875,
"step": 900
},
{
"epoch": 2.7314614830813535,
"grad_norm": 195.64202880859375,
"learning_rate": 2.7298850574712644e-06,
"loss": 20.5162548828125,
"step": 950
},
{
"epoch": 2.87544996400288,
"grad_norm": 90.92398834228516,
"learning_rate": 1.2931034482758623e-06,
"loss": 20.5969873046875,
"step": 1000
},
{
"epoch": 3.0,
"eval_loss": 2.579054832458496,
"eval_model_preparation_time": 0.0127,
"eval_rouge1": 43.6198,
"eval_rouge2": 21.2562,
"eval_rougeL": 37.0629,
"eval_rougeLsum": 36.9731,
"eval_runtime": 178.3925,
"eval_samples_per_second": 1.945,
"eval_steps_per_second": 1.945,
"step": 1044
}
],
"logging_steps": 50,
"max_steps": 1044,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4686367027249152.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}