| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.0, |
| "eval_steps": 5, |
| "global_step": 25, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.04, |
| "grad_norm": 0.3135530948638916, |
| "learning_rate": 0.0, |
| "loss": 1.8271484375, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.08, |
| "grad_norm": 0.30578845739364624, |
| "learning_rate": 5e-05, |
| "loss": 1.76904296875, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.12, |
| "grad_norm": 0.32055363059043884, |
| "learning_rate": 4.980750938091074e-05, |
| "loss": 1.8251953125, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.16, |
| "grad_norm": 0.3271876871585846, |
| "learning_rate": 4.9233331091504034e-05, |
| "loss": 1.8466796875, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.2, |
| "grad_norm": 0.3510723114013672, |
| "learning_rate": 4.8287289481503954e-05, |
| "loss": 1.89501953125, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.2, |
| "eval_loss": 1.7734375, |
| "eval_runtime": 2.2485, |
| "eval_samples_per_second": 0.889, |
| "eval_steps_per_second": 0.445, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.24, |
| "grad_norm": 0.3387308716773987, |
| "learning_rate": 4.6985571585149876e-05, |
| "loss": 1.76806640625, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.28, |
| "grad_norm": 0.34001627564430237, |
| "learning_rate": 4.535045015655279e-05, |
| "loss": 1.7548828125, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.32, |
| "grad_norm": 0.3075582683086395, |
| "learning_rate": 4.340990257669732e-05, |
| "loss": 1.6689453125, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.36, |
| "grad_norm": 0.29662805795669556, |
| "learning_rate": 4.1197132152696215e-05, |
| "loss": 1.7255859375, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.4, |
| "grad_norm": 0.28356656432151794, |
| "learning_rate": 3.875e-05, |
| "loss": 1.7080078125, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.4, |
| "eval_loss": 1.68359375, |
| "eval_runtime": 2.0485, |
| "eval_samples_per_second": 0.976, |
| "eval_steps_per_second": 0.488, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.44, |
| "grad_norm": 0.2615479826927185, |
| "learning_rate": 3.611037722821452e-05, |
| "loss": 1.66796875, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.48, |
| "grad_norm": 0.25153541564941406, |
| "learning_rate": 3.332342851480672e-05, |
| "loss": 1.6669921875, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.52, |
| "grad_norm": 0.236228808760643, |
| "learning_rate": 3.0436839324951166e-05, |
| "loss": 1.6611328125, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.56, |
| "grad_norm": 0.24782223999500275, |
| "learning_rate": 2.7500000000000004e-05, |
| "loss": 1.740234375, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.6, |
| "grad_norm": 0.2386341094970703, |
| "learning_rate": 2.4563160675048846e-05, |
| "loss": 1.64404296875, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.6, |
| "eval_loss": 1.6484375, |
| "eval_runtime": 2.051, |
| "eval_samples_per_second": 0.975, |
| "eval_steps_per_second": 0.488, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.64, |
| "grad_norm": 0.22649618983268738, |
| "learning_rate": 2.1676571485193282e-05, |
| "loss": 1.55908203125, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.68, |
| "grad_norm": 0.25247156620025635, |
| "learning_rate": 1.888962277178548e-05, |
| "loss": 1.6220703125, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.72, |
| "grad_norm": 0.2598176896572113, |
| "learning_rate": 1.6250000000000005e-05, |
| "loss": 1.662109375, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.76, |
| "grad_norm": 0.23730042576789856, |
| "learning_rate": 1.3802867847303785e-05, |
| "loss": 1.5947265625, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.8, |
| "grad_norm": 0.24574804306030273, |
| "learning_rate": 1.1590097423302684e-05, |
| "loss": 1.69921875, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.8, |
| "eval_loss": 1.625, |
| "eval_runtime": 2.0556, |
| "eval_samples_per_second": 0.973, |
| "eval_steps_per_second": 0.486, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.84, |
| "grad_norm": 0.23554882407188416, |
| "learning_rate": 9.649549843447212e-06, |
| "loss": 1.65576171875, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.88, |
| "grad_norm": 0.24011166393756866, |
| "learning_rate": 8.01442841485013e-06, |
| "loss": 1.625, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.92, |
| "grad_norm": 0.24006858468055725, |
| "learning_rate": 6.712710518496049e-06, |
| "loss": 1.611328125, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.96, |
| "grad_norm": 0.22434408962726593, |
| "learning_rate": 5.766668908495966e-06, |
| "loss": 1.5771484375, |
| "step": 24 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.21985848248004913, |
| "learning_rate": 5.192490619089267e-06, |
| "loss": 1.5849609375, |
| "step": 25 |
| }, |
| { |
| "epoch": 1.0, |
| "eval_loss": 1.62109375, |
| "eval_runtime": 2.0583, |
| "eval_samples_per_second": 0.972, |
| "eval_steps_per_second": 0.486, |
| "step": 25 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 25, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 1, |
| "save_steps": 0, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2.8168959689752576e+16, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|