{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 200, "global_step": 159, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.09450679267572357, "grad_norm": 62.428157806396484, "learning_rate": 1.3333333333333336e-07, "loss": 2.397551918029785, "num_input_tokens_seen": 331280, "step": 5, "train_runtime": 75.5535, "train_tokens_per_second": 4384.707 }, { "epoch": 0.18901358535144713, "grad_norm": 52.543094635009766, "learning_rate": 3.0000000000000004e-07, "loss": 2.324905776977539, "num_input_tokens_seen": 676656, "step": 10, "train_runtime": 148.9016, "train_tokens_per_second": 4544.316 }, { "epoch": 0.2835203780271707, "grad_norm": 37.104923248291016, "learning_rate": 4.666666666666667e-07, "loss": 2.2128017425537108, "num_input_tokens_seen": 1014384, "step": 15, "train_runtime": 226.2481, "train_tokens_per_second": 4483.503 }, { "epoch": 0.37802717070289427, "grad_norm": 18.56186294555664, "learning_rate": 6.333333333333334e-07, "loss": 1.7389423370361328, "num_input_tokens_seen": 1337152, "step": 20, "train_runtime": 296.1134, "train_tokens_per_second": 4515.675 }, { "epoch": 0.47253396337861786, "grad_norm": 9.207618713378906, "learning_rate": 8.000000000000001e-07, "loss": 1.481886100769043, "num_input_tokens_seen": 1682800, "step": 25, "train_runtime": 372.6792, "train_tokens_per_second": 4515.412 }, { "epoch": 0.5670407560543415, "grad_norm": 6.93226957321167, "learning_rate": 9.666666666666668e-07, "loss": 1.2308213233947753, "num_input_tokens_seen": 2021168, "step": 30, "train_runtime": 447.3153, "train_tokens_per_second": 4518.441 }, { "epoch": 0.6615475487300649, "grad_norm": 5.4049072265625, "learning_rate": 1.1333333333333334e-06, "loss": 1.0612786293029786, "num_input_tokens_seen": 2376256, "step": 35, "train_runtime": 524.7446, "train_tokens_per_second": 4528.405 }, { "epoch": 0.7560543414057885, "grad_norm": 5.19791841506958, "learning_rate": 1.3e-06, "loss": 0.9478996276855469, "num_input_tokens_seen": 2692720, "step": 40, "train_runtime": 589.2975, "train_tokens_per_second": 4569.373 }, { "epoch": 0.8505611340815121, "grad_norm": 4.551699161529541, "learning_rate": 1.4666666666666669e-06, "loss": 0.8566524505615234, "num_input_tokens_seen": 3067824, "step": 45, "train_runtime": 670.2604, "train_tokens_per_second": 4577.063 }, { "epoch": 0.9450679267572357, "grad_norm": 3.7889368534088135, "learning_rate": 1.6333333333333335e-06, "loss": 0.8128791809082031, "num_input_tokens_seen": 3413184, "step": 50, "train_runtime": 743.4782, "train_tokens_per_second": 4590.833 }, { "epoch": 1.0378027170702895, "grad_norm": 3.7340147495269775, "learning_rate": 1.8000000000000001e-06, "loss": 0.7371133804321289, "num_input_tokens_seen": 3743824, "step": 55, "train_runtime": 813.931, "train_tokens_per_second": 4599.682 }, { "epoch": 1.132309509746013, "grad_norm": 3.7434566020965576, "learning_rate": 1.9666666666666668e-06, "loss": 0.6849042415618897, "num_input_tokens_seen": 4064576, "step": 60, "train_runtime": 879.9344, "train_tokens_per_second": 4619.18 }, { "epoch": 1.2268163024217364, "grad_norm": 3.699002504348755, "learning_rate": 2.133333333333334e-06, "loss": 0.6428406715393067, "num_input_tokens_seen": 4407728, "step": 65, "train_runtime": 954.1755, "train_tokens_per_second": 4619.41 }, { "epoch": 1.3213230950974602, "grad_norm": 3.816338300704956, "learning_rate": 2.3000000000000004e-06, "loss": 0.6510684967041016, "num_input_tokens_seen": 4753632, "step": 70, "train_runtime": 1024.7054, "train_tokens_per_second": 4639.023 }, { "epoch": 1.4158298877731836, "grad_norm": 3.3174662590026855, "learning_rate": 2.466666666666667e-06, "loss": 0.6197010040283203, "num_input_tokens_seen": 5117712, "step": 75, "train_runtime": 1104.1382, "train_tokens_per_second": 4635.029 }, { "epoch": 1.5103366804489071, "grad_norm": 3.7685296535491943, "learning_rate": 2.6333333333333332e-06, "loss": 0.5941993236541748, "num_input_tokens_seen": 5442464, "step": 80, "train_runtime": 1171.423, "train_tokens_per_second": 4646.028 }, { "epoch": 1.6048434731246308, "grad_norm": 3.62023663520813, "learning_rate": 2.8000000000000003e-06, "loss": 0.5909689903259278, "num_input_tokens_seen": 5773168, "step": 85, "train_runtime": 1241.4596, "train_tokens_per_second": 4650.307 }, { "epoch": 1.6993502658003545, "grad_norm": 3.4737110137939453, "learning_rate": 2.9666666666666673e-06, "loss": 0.5710773944854737, "num_input_tokens_seen": 6094640, "step": 90, "train_runtime": 1308.3829, "train_tokens_per_second": 4658.147 }, { "epoch": 1.793857058476078, "grad_norm": 3.37959885597229, "learning_rate": 3.133333333333334e-06, "loss": 0.559010124206543, "num_input_tokens_seen": 6445904, "step": 95, "train_runtime": 1383.7365, "train_tokens_per_second": 4658.332 }, { "epoch": 1.8883638511518015, "grad_norm": 3.294055938720703, "learning_rate": 3.3000000000000006e-06, "loss": 0.5400856018066407, "num_input_tokens_seen": 6778864, "step": 100, "train_runtime": 1452.3221, "train_tokens_per_second": 4667.604 }, { "epoch": 1.9828706438275252, "grad_norm": 3.642498731613159, "learning_rate": 3.4666666666666672e-06, "loss": 0.5734038352966309, "num_input_tokens_seen": 7128848, "step": 105, "train_runtime": 1527.0146, "train_tokens_per_second": 4668.487 }, { "epoch": 2.075605434140579, "grad_norm": 2.930677652359009, "learning_rate": 3.633333333333334e-06, "loss": 0.40219688415527344, "num_input_tokens_seen": 7457808, "step": 110, "train_runtime": 1593.9447, "train_tokens_per_second": 4678.837 }, { "epoch": 2.1701122268163022, "grad_norm": 3.647855043411255, "learning_rate": 3.8000000000000005e-06, "loss": 0.3830972194671631, "num_input_tokens_seen": 7779600, "step": 115, "train_runtime": 1663.7125, "train_tokens_per_second": 4676.048 }, { "epoch": 2.264619019492026, "grad_norm": 3.5375828742980957, "learning_rate": 3.966666666666667e-06, "loss": 0.3788310050964355, "num_input_tokens_seen": 8111072, "step": 120, "train_runtime": 1734.8264, "train_tokens_per_second": 4675.437 }, { "epoch": 2.3591258121677496, "grad_norm": 3.1107232570648193, "learning_rate": 4.133333333333333e-06, "loss": 0.359296989440918, "num_input_tokens_seen": 8440624, "step": 125, "train_runtime": 1803.6532, "train_tokens_per_second": 4679.738 }, { "epoch": 2.453632604843473, "grad_norm": 3.2923574447631836, "learning_rate": 4.3e-06, "loss": 0.35688660144805906, "num_input_tokens_seen": 8809056, "step": 130, "train_runtime": 1882.4762, "train_tokens_per_second": 4679.505 }, { "epoch": 2.5481393975191966, "grad_norm": 3.4984912872314453, "learning_rate": 4.4666666666666665e-06, "loss": 0.3418281555175781, "num_input_tokens_seen": 9149056, "step": 135, "train_runtime": 1956.4703, "train_tokens_per_second": 4676.307 }, { "epoch": 2.6426461901949203, "grad_norm": 3.569697380065918, "learning_rate": 4.633333333333334e-06, "loss": 0.3628645420074463, "num_input_tokens_seen": 9505088, "step": 140, "train_runtime": 2033.4441, "train_tokens_per_second": 4674.379 }, { "epoch": 2.7371529828706436, "grad_norm": 3.633371353149414, "learning_rate": 4.800000000000001e-06, "loss": 0.38395237922668457, "num_input_tokens_seen": 9850976, "step": 145, "train_runtime": 2106.6321, "train_tokens_per_second": 4676.173 }, { "epoch": 2.8316597755463673, "grad_norm": 3.469475269317627, "learning_rate": 4.966666666666667e-06, "loss": 0.3653783559799194, "num_input_tokens_seen": 10190224, "step": 150, "train_runtime": 2179.9706, "train_tokens_per_second": 4674.478 }, { "epoch": 2.926166568222091, "grad_norm": 3.961359977722168, "learning_rate": 2.9341204441673267e-06, "loss": 0.4053683280944824, "num_input_tokens_seen": 10530976, "step": 155, "train_runtime": 2252.5079, "train_tokens_per_second": 4675.223 }, { "epoch": 3.0, "eval_loss": 0.5101717114448547, "eval_runtime": 12.5731, "eval_samples_per_second": 28.394, "eval_steps_per_second": 14.237, "num_input_tokens_seen": 10792432, "step": 159 } ], "logging_steps": 5, "max_steps": 159, "num_input_tokens_seen": 10792432, "num_train_epochs": 3, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.236796920532828e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }