tknez's picture
Upload folder using huggingface_hub
ace6112 verified
Raw History Blame Contribute Delete
10.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 200,
"global_step": 159,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.09450679267572357,
"grad_norm": 62.428157806396484,
"learning_rate": 1.3333333333333336e-07,
"loss": 2.397551918029785,
"num_input_tokens_seen": 331280,
"step": 5,
"train_runtime": 75.5535,
"train_tokens_per_second": 4384.707
},
{
"epoch": 0.18901358535144713,
"grad_norm": 52.543094635009766,
"learning_rate": 3.0000000000000004e-07,
"loss": 2.324905776977539,
"num_input_tokens_seen": 676656,
"step": 10,
"train_runtime": 148.9016,
"train_tokens_per_second": 4544.316
},
{
"epoch": 0.2835203780271707,
"grad_norm": 37.104923248291016,
"learning_rate": 4.666666666666667e-07,
"loss": 2.2128017425537108,
"num_input_tokens_seen": 1014384,
"step": 15,
"train_runtime": 226.2481,
"train_tokens_per_second": 4483.503
},
{
"epoch": 0.37802717070289427,
"grad_norm": 18.56186294555664,
"learning_rate": 6.333333333333334e-07,
"loss": 1.7389423370361328,
"num_input_tokens_seen": 1337152,
"step": 20,
"train_runtime": 296.1134,
"train_tokens_per_second": 4515.675
},
{
"epoch": 0.47253396337861786,
"grad_norm": 9.207618713378906,
"learning_rate": 8.000000000000001e-07,
"loss": 1.481886100769043,
"num_input_tokens_seen": 1682800,
"step": 25,
"train_runtime": 372.6792,
"train_tokens_per_second": 4515.412
},
{
"epoch": 0.5670407560543415,
"grad_norm": 6.93226957321167,
"learning_rate": 9.666666666666668e-07,
"loss": 1.2308213233947753,
"num_input_tokens_seen": 2021168,
"step": 30,
"train_runtime": 447.3153,
"train_tokens_per_second": 4518.441
},
{
"epoch": 0.6615475487300649,
"grad_norm": 5.4049072265625,
"learning_rate": 1.1333333333333334e-06,
"loss": 1.0612786293029786,
"num_input_tokens_seen": 2376256,
"step": 35,
"train_runtime": 524.7446,
"train_tokens_per_second": 4528.405
},
{
"epoch": 0.7560543414057885,
"grad_norm": 5.19791841506958,
"learning_rate": 1.3e-06,
"loss": 0.9478996276855469,
"num_input_tokens_seen": 2692720,
"step": 40,
"train_runtime": 589.2975,
"train_tokens_per_second": 4569.373
},
{
"epoch": 0.8505611340815121,
"grad_norm": 4.551699161529541,
"learning_rate": 1.4666666666666669e-06,
"loss": 0.8566524505615234,
"num_input_tokens_seen": 3067824,
"step": 45,
"train_runtime": 670.2604,
"train_tokens_per_second": 4577.063
},
{
"epoch": 0.9450679267572357,
"grad_norm": 3.7889368534088135,
"learning_rate": 1.6333333333333335e-06,
"loss": 0.8128791809082031,
"num_input_tokens_seen": 3413184,
"step": 50,
"train_runtime": 743.4782,
"train_tokens_per_second": 4590.833
},
{
"epoch": 1.0378027170702895,
"grad_norm": 3.7340147495269775,
"learning_rate": 1.8000000000000001e-06,
"loss": 0.7371133804321289,
"num_input_tokens_seen": 3743824,
"step": 55,
"train_runtime": 813.931,
"train_tokens_per_second": 4599.682
},
{
"epoch": 1.132309509746013,
"grad_norm": 3.7434566020965576,
"learning_rate": 1.9666666666666668e-06,
"loss": 0.6849042415618897,
"num_input_tokens_seen": 4064576,
"step": 60,
"train_runtime": 879.9344,
"train_tokens_per_second": 4619.18
},
{
"epoch": 1.2268163024217364,
"grad_norm": 3.699002504348755,
"learning_rate": 2.133333333333334e-06,
"loss": 0.6428406715393067,
"num_input_tokens_seen": 4407728,
"step": 65,
"train_runtime": 954.1755,
"train_tokens_per_second": 4619.41
},
{
"epoch": 1.3213230950974602,
"grad_norm": 3.816338300704956,
"learning_rate": 2.3000000000000004e-06,
"loss": 0.6510684967041016,
"num_input_tokens_seen": 4753632,
"step": 70,
"train_runtime": 1024.7054,
"train_tokens_per_second": 4639.023
},
{
"epoch": 1.4158298877731836,
"grad_norm": 3.3174662590026855,
"learning_rate": 2.466666666666667e-06,
"loss": 0.6197010040283203,
"num_input_tokens_seen": 5117712,
"step": 75,
"train_runtime": 1104.1382,
"train_tokens_per_second": 4635.029
},
{
"epoch": 1.5103366804489071,
"grad_norm": 3.7685296535491943,
"learning_rate": 2.6333333333333332e-06,
"loss": 0.5941993236541748,
"num_input_tokens_seen": 5442464,
"step": 80,
"train_runtime": 1171.423,
"train_tokens_per_second": 4646.028
},
{
"epoch": 1.6048434731246308,
"grad_norm": 3.62023663520813,
"learning_rate": 2.8000000000000003e-06,
"loss": 0.5909689903259278,
"num_input_tokens_seen": 5773168,
"step": 85,
"train_runtime": 1241.4596,
"train_tokens_per_second": 4650.307
},
{
"epoch": 1.6993502658003545,
"grad_norm": 3.4737110137939453,
"learning_rate": 2.9666666666666673e-06,
"loss": 0.5710773944854737,
"num_input_tokens_seen": 6094640,
"step": 90,
"train_runtime": 1308.3829,
"train_tokens_per_second": 4658.147
},
{
"epoch": 1.793857058476078,
"grad_norm": 3.37959885597229,
"learning_rate": 3.133333333333334e-06,
"loss": 0.559010124206543,
"num_input_tokens_seen": 6445904,
"step": 95,
"train_runtime": 1383.7365,
"train_tokens_per_second": 4658.332
},
{
"epoch": 1.8883638511518015,
"grad_norm": 3.294055938720703,
"learning_rate": 3.3000000000000006e-06,
"loss": 0.5400856018066407,
"num_input_tokens_seen": 6778864,
"step": 100,
"train_runtime": 1452.3221,
"train_tokens_per_second": 4667.604
},
{
"epoch": 1.9828706438275252,
"grad_norm": 3.642498731613159,
"learning_rate": 3.4666666666666672e-06,
"loss": 0.5734038352966309,
"num_input_tokens_seen": 7128848,
"step": 105,
"train_runtime": 1527.0146,
"train_tokens_per_second": 4668.487
},
{
"epoch": 2.075605434140579,
"grad_norm": 2.930677652359009,
"learning_rate": 3.633333333333334e-06,
"loss": 0.40219688415527344,
"num_input_tokens_seen": 7457808,
"step": 110,
"train_runtime": 1593.9447,
"train_tokens_per_second": 4678.837
},
{
"epoch": 2.1701122268163022,
"grad_norm": 3.647855043411255,
"learning_rate": 3.8000000000000005e-06,
"loss": 0.3830972194671631,
"num_input_tokens_seen": 7779600,
"step": 115,
"train_runtime": 1663.7125,
"train_tokens_per_second": 4676.048
},
{
"epoch": 2.264619019492026,
"grad_norm": 3.5375828742980957,
"learning_rate": 3.966666666666667e-06,
"loss": 0.3788310050964355,
"num_input_tokens_seen": 8111072,
"step": 120,
"train_runtime": 1734.8264,
"train_tokens_per_second": 4675.437
},
{
"epoch": 2.3591258121677496,
"grad_norm": 3.1107232570648193,
"learning_rate": 4.133333333333333e-06,
"loss": 0.359296989440918,
"num_input_tokens_seen": 8440624,
"step": 125,
"train_runtime": 1803.6532,
"train_tokens_per_second": 4679.738
},
{
"epoch": 2.453632604843473,
"grad_norm": 3.2923574447631836,
"learning_rate": 4.3e-06,
"loss": 0.35688660144805906,
"num_input_tokens_seen": 8809056,
"step": 130,
"train_runtime": 1882.4762,
"train_tokens_per_second": 4679.505
},
{
"epoch": 2.5481393975191966,
"grad_norm": 3.4984912872314453,
"learning_rate": 4.4666666666666665e-06,
"loss": 0.3418281555175781,
"num_input_tokens_seen": 9149056,
"step": 135,
"train_runtime": 1956.4703,
"train_tokens_per_second": 4676.307
},
{
"epoch": 2.6426461901949203,
"grad_norm": 3.569697380065918,
"learning_rate": 4.633333333333334e-06,
"loss": 0.3628645420074463,
"num_input_tokens_seen": 9505088,
"step": 140,
"train_runtime": 2033.4441,
"train_tokens_per_second": 4674.379
},
{
"epoch": 2.7371529828706436,
"grad_norm": 3.633371353149414,
"learning_rate": 4.800000000000001e-06,
"loss": 0.38395237922668457,
"num_input_tokens_seen": 9850976,
"step": 145,
"train_runtime": 2106.6321,
"train_tokens_per_second": 4676.173
},
{
"epoch": 2.8316597755463673,
"grad_norm": 3.469475269317627,
"learning_rate": 4.966666666666667e-06,
"loss": 0.3653783559799194,
"num_input_tokens_seen": 10190224,
"step": 150,
"train_runtime": 2179.9706,
"train_tokens_per_second": 4674.478
},
{
"epoch": 2.926166568222091,
"grad_norm": 3.961359977722168,
"learning_rate": 2.9341204441673267e-06,
"loss": 0.4053683280944824,
"num_input_tokens_seen": 10530976,
"step": 155,
"train_runtime": 2252.5079,
"train_tokens_per_second": 4675.223
},
{
"epoch": 3.0,
"eval_loss": 0.5101717114448547,
"eval_runtime": 12.5731,
"eval_samples_per_second": 28.394,
"eval_steps_per_second": 14.237,
"num_input_tokens_seen": 10792432,
"step": 159
}
],
"logging_steps": 5,
"max_steps": 159,
"num_input_tokens_seen": 10792432,
"num_train_epochs": 3,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 7.236796920532828e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}