{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.06666666666666667, "eval_steps": 50, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0016666666666666668, "grad_norm": 0.419921875, "learning_rate": 0.0002, "loss": 2.7259506225585937, "step": 5 }, { "epoch": 0.0033333333333333335, "grad_norm": 0.326171875, "learning_rate": 0.00045000000000000004, "loss": 2.7605268478393556, "step": 10 }, { "epoch": 0.005, "grad_norm": 0.490234375, "learning_rate": 0.0005, "loss": 2.717021179199219, "step": 15 }, { "epoch": 0.006666666666666667, "grad_norm": 0.267578125, "learning_rate": 0.0005, "loss": 2.661177635192871, "step": 20 }, { "epoch": 0.008333333333333333, "grad_norm": 0.43359375, "learning_rate": 0.0005, "loss": 2.671949768066406, "step": 25 }, { "epoch": 0.01, "grad_norm": 0.10595703125, "learning_rate": 0.0005, "loss": 2.673902893066406, "step": 30 }, { "epoch": 0.011666666666666667, "grad_norm": 0.21875, "learning_rate": 0.0005, "loss": 2.686188316345215, "step": 35 }, { "epoch": 0.013333333333333334, "grad_norm": 0.087890625, "learning_rate": 0.0005, "loss": 2.6556489944458006, "step": 40 }, { "epoch": 0.015, "grad_norm": 0.119140625, "learning_rate": 0.0005, "loss": 2.66821346282959, "step": 45 }, { "epoch": 0.016666666666666666, "grad_norm": 0.095703125, "learning_rate": 0.0005, "loss": 2.6468021392822267, "step": 50 }, { "epoch": 0.016666666666666666, "eval_loss": 3.0268919467926025, "eval_runtime": 4.7731, "eval_samples_per_second": 31.217, "eval_steps_per_second": 3.562, "step": 50 }, { "epoch": 0.018333333333333333, "grad_norm": 139.0, "learning_rate": 0.0005, "loss": 2.6445695877075197, "step": 55 }, { "epoch": 0.02, "grad_norm": 0.65234375, "learning_rate": 0.0005, "loss": 2.645796775817871, "step": 60 }, { "epoch": 0.021666666666666667, "grad_norm": 0.07421875, "learning_rate": 0.0005, "loss": 2.6811267852783205, "step": 65 }, { "epoch": 0.023333333333333334, "grad_norm": 0.08642578125, "learning_rate": 0.0005, "loss": 2.6605648040771483, "step": 70 }, { "epoch": 0.025, "grad_norm": 0.275390625, "learning_rate": 0.0005, "loss": 2.668781852722168, "step": 75 }, { "epoch": 0.02666666666666667, "grad_norm": 0.0693359375, "learning_rate": 0.0005, "loss": 2.6526798248291015, "step": 80 }, { "epoch": 0.028333333333333332, "grad_norm": 0.427734375, "learning_rate": 0.0005, "loss": 2.6234062194824217, "step": 85 }, { "epoch": 0.03, "grad_norm": 0.08447265625, "learning_rate": 0.0005, "loss": 2.6748191833496096, "step": 90 }, { "epoch": 0.03166666666666667, "grad_norm": 0.08544921875, "learning_rate": 0.0005, "loss": 2.665359878540039, "step": 95 }, { "epoch": 0.03333333333333333, "grad_norm": 0.2734375, "learning_rate": 0.0005, "loss": 2.6298377990722654, "step": 100 }, { "epoch": 0.03333333333333333, "eval_loss": 3.037663221359253, "eval_runtime": 4.6626, "eval_samples_per_second": 31.956, "eval_steps_per_second": 3.646, "step": 100 }, { "epoch": 0.035, "grad_norm": 0.1865234375, "learning_rate": 0.0005, "loss": 2.639477348327637, "step": 105 }, { "epoch": 0.03666666666666667, "grad_norm": 0.1376953125, "learning_rate": 0.0005, "loss": 2.671689987182617, "step": 110 }, { "epoch": 0.03833333333333333, "grad_norm": 0.078125, "learning_rate": 0.0005, "loss": 2.6607818603515625, "step": 115 }, { "epoch": 0.04, "grad_norm": 0.06494140625, "learning_rate": 0.0005, "loss": 2.6763479232788088, "step": 120 }, { "epoch": 0.041666666666666664, "grad_norm": 0.96875, "learning_rate": 0.0005, "loss": 2.6471065521240233, "step": 125 }, { "epoch": 0.043333333333333335, "grad_norm": 0.076171875, "learning_rate": 0.0005, "loss": 2.643071746826172, "step": 130 }, { "epoch": 0.045, "grad_norm": 0.10400390625, "learning_rate": 0.0005, "loss": 2.6617103576660157, "step": 135 }, { "epoch": 0.04666666666666667, "grad_norm": 0.06640625, "learning_rate": 0.0005, "loss": 2.617737579345703, "step": 140 }, { "epoch": 0.04833333333333333, "grad_norm": 0.3984375, "learning_rate": 0.0005, "loss": 2.7076738357543944, "step": 145 }, { "epoch": 0.05, "grad_norm": 0.09375, "learning_rate": 0.0005, "loss": 2.6471235275268556, "step": 150 }, { "epoch": 0.05, "eval_loss": 3.055941581726074, "eval_runtime": 4.6673, "eval_samples_per_second": 31.924, "eval_steps_per_second": 3.642, "step": 150 }, { "epoch": 0.051666666666666666, "grad_norm": 0.08642578125, "learning_rate": 0.0005, "loss": 2.6089550018310548, "step": 155 }, { "epoch": 0.05333333333333334, "grad_norm": 0.61328125, "learning_rate": 0.0005, "loss": 2.6288101196289064, "step": 160 }, { "epoch": 0.055, "grad_norm": 0.0703125, "learning_rate": 0.0005, "loss": 2.647333335876465, "step": 165 }, { "epoch": 0.056666666666666664, "grad_norm": 0.06689453125, "learning_rate": 0.0005, "loss": 2.6732242584228514, "step": 170 }, { "epoch": 0.058333333333333334, "grad_norm": 0.060791015625, "learning_rate": 0.0005, "loss": 2.6399274826049806, "step": 175 }, { "epoch": 0.06, "grad_norm": 0.059326171875, "learning_rate": 0.0005, "loss": 2.6433204650878905, "step": 180 }, { "epoch": 0.06166666666666667, "grad_norm": 0.05712890625, "learning_rate": 0.0005, "loss": 2.6490320205688476, "step": 185 }, { "epoch": 0.06333333333333334, "grad_norm": 0.0830078125, "learning_rate": 0.0005, "loss": 2.6651992797851562, "step": 190 }, { "epoch": 0.065, "grad_norm": 0.0712890625, "learning_rate": 0.0005, "loss": 2.6375024795532225, "step": 195 }, { "epoch": 0.06666666666666667, "grad_norm": 0.07763671875, "learning_rate": 0.0005, "loss": 2.616963768005371, "step": 200 }, { "epoch": 0.06666666666666667, "eval_loss": 3.0367250442504883, "eval_runtime": 4.6782, "eval_samples_per_second": 31.85, "eval_steps_per_second": 3.634, "step": 200 } ], "logging_steps": 5, "max_steps": 3000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6.52309029715968e+16, "train_batch_size": 9, "trial_name": null, "trial_params": null }