{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 5, "global_step": 25, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.04, "grad_norm": 0.3135530948638916, "learning_rate": 0.0, "loss": 1.8271484375, "step": 1 }, { "epoch": 0.08, "grad_norm": 0.30578845739364624, "learning_rate": 5e-05, "loss": 1.76904296875, "step": 2 }, { "epoch": 0.12, "grad_norm": 0.32055363059043884, "learning_rate": 4.980750938091074e-05, "loss": 1.8251953125, "step": 3 }, { "epoch": 0.16, "grad_norm": 0.3271876871585846, "learning_rate": 4.9233331091504034e-05, "loss": 1.8466796875, "step": 4 }, { "epoch": 0.2, "grad_norm": 0.3510723114013672, "learning_rate": 4.8287289481503954e-05, "loss": 1.89501953125, "step": 5 }, { "epoch": 0.2, "eval_loss": 1.7734375, "eval_runtime": 2.2485, "eval_samples_per_second": 0.889, "eval_steps_per_second": 0.445, "step": 5 }, { "epoch": 0.24, "grad_norm": 0.3387308716773987, "learning_rate": 4.6985571585149876e-05, "loss": 1.76806640625, "step": 6 }, { "epoch": 0.28, "grad_norm": 0.34001627564430237, "learning_rate": 4.535045015655279e-05, "loss": 1.7548828125, "step": 7 }, { "epoch": 0.32, "grad_norm": 0.3075582683086395, "learning_rate": 4.340990257669732e-05, "loss": 1.6689453125, "step": 8 }, { "epoch": 0.36, "grad_norm": 0.29662805795669556, "learning_rate": 4.1197132152696215e-05, "loss": 1.7255859375, "step": 9 }, { "epoch": 0.4, "grad_norm": 0.28356656432151794, "learning_rate": 3.875e-05, "loss": 1.7080078125, "step": 10 }, { "epoch": 0.4, "eval_loss": 1.68359375, "eval_runtime": 2.0485, "eval_samples_per_second": 0.976, "eval_steps_per_second": 0.488, "step": 10 }, { "epoch": 0.44, "grad_norm": 0.2615479826927185, "learning_rate": 3.611037722821452e-05, "loss": 1.66796875, "step": 11 }, { "epoch": 0.48, "grad_norm": 0.25153541564941406, "learning_rate": 3.332342851480672e-05, "loss": 1.6669921875, "step": 12 }, { "epoch": 0.52, "grad_norm": 0.236228808760643, "learning_rate": 3.0436839324951166e-05, "loss": 1.6611328125, "step": 13 }, { "epoch": 0.56, "grad_norm": 0.24782223999500275, "learning_rate": 2.7500000000000004e-05, "loss": 1.740234375, "step": 14 }, { "epoch": 0.6, "grad_norm": 0.2386341094970703, "learning_rate": 2.4563160675048846e-05, "loss": 1.64404296875, "step": 15 }, { "epoch": 0.6, "eval_loss": 1.6484375, "eval_runtime": 2.051, "eval_samples_per_second": 0.975, "eval_steps_per_second": 0.488, "step": 15 }, { "epoch": 0.64, "grad_norm": 0.22649618983268738, "learning_rate": 2.1676571485193282e-05, "loss": 1.55908203125, "step": 16 }, { "epoch": 0.68, "grad_norm": 0.25247156620025635, "learning_rate": 1.888962277178548e-05, "loss": 1.6220703125, "step": 17 }, { "epoch": 0.72, "grad_norm": 0.2598176896572113, "learning_rate": 1.6250000000000005e-05, "loss": 1.662109375, "step": 18 }, { "epoch": 0.76, "grad_norm": 0.23730042576789856, "learning_rate": 1.3802867847303785e-05, "loss": 1.5947265625, "step": 19 }, { "epoch": 0.8, "grad_norm": 0.24574804306030273, "learning_rate": 1.1590097423302684e-05, "loss": 1.69921875, "step": 20 }, { "epoch": 0.8, "eval_loss": 1.625, "eval_runtime": 2.0556, "eval_samples_per_second": 0.973, "eval_steps_per_second": 0.486, "step": 20 }, { "epoch": 0.84, "grad_norm": 0.23554882407188416, "learning_rate": 9.649549843447212e-06, "loss": 1.65576171875, "step": 21 }, { "epoch": 0.88, "grad_norm": 0.24011166393756866, "learning_rate": 8.01442841485013e-06, "loss": 1.625, "step": 22 }, { "epoch": 0.92, "grad_norm": 0.24006858468055725, "learning_rate": 6.712710518496049e-06, "loss": 1.611328125, "step": 23 }, { "epoch": 0.96, "grad_norm": 0.22434408962726593, "learning_rate": 5.766668908495966e-06, "loss": 1.5771484375, "step": 24 }, { "epoch": 1.0, "grad_norm": 0.21985848248004913, "learning_rate": 5.192490619089267e-06, "loss": 1.5849609375, "step": 25 }, { "epoch": 1.0, "eval_loss": 1.62109375, "eval_runtime": 2.0583, "eval_samples_per_second": 0.972, "eval_steps_per_second": 0.486, "step": 25 } ], "logging_steps": 1.0, "max_steps": 25, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.8168959689752576e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }