{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 66, "global_step": 66, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.030303030303030304, "grad_norm": 0.0872589573264122, "learning_rate": 0.0, "loss": 0.2969, "step": 1 }, { "epoch": 0.06060606060606061, "grad_norm": 0.07570399343967438, "learning_rate": 5e-06, "loss": 0.2534, "step": 2 }, { "epoch": 0.09090909090909091, "grad_norm": 0.0646587386727333, "learning_rate": 1e-05, "loss": 0.2195, "step": 3 }, { "epoch": 0.12121212121212122, "grad_norm": 0.08738136291503906, "learning_rate": 9.993977281025862e-06, "loss": 0.2949, "step": 4 }, { "epoch": 0.15151515151515152, "grad_norm": 0.09267034381628036, "learning_rate": 9.975923633360985e-06, "loss": 0.3128, "step": 5 }, { "epoch": 0.18181818181818182, "grad_norm": 0.0921434611082077, "learning_rate": 9.945882549823906e-06, "loss": 0.3027, "step": 6 }, { "epoch": 0.21212121212121213, "grad_norm": 0.09888184815645218, "learning_rate": 9.903926402016153e-06, "loss": 0.3188, "step": 7 }, { "epoch": 0.24242424242424243, "grad_norm": 0.09699065238237381, "learning_rate": 9.850156265972722e-06, "loss": 0.2958, "step": 8 }, { "epoch": 0.2727272727272727, "grad_norm": 0.08493418246507645, "learning_rate": 9.784701678661045e-06, "loss": 0.2584, "step": 9 }, { "epoch": 0.30303030303030304, "grad_norm": 0.07863851636648178, "learning_rate": 9.707720325915105e-06, "loss": 0.2457, "step": 10 }, { "epoch": 0.3333333333333333, "grad_norm": 0.09796863794326782, "learning_rate": 9.619397662556434e-06, "loss": 0.3038, "step": 11 }, { "epoch": 0.36363636363636365, "grad_norm": 0.06206300109624863, "learning_rate": 9.519946465617217e-06, "loss": 0.1931, "step": 12 }, { "epoch": 0.3939393939393939, "grad_norm": 0.08884033560752869, "learning_rate": 9.409606321741776e-06, "loss": 0.2729, "step": 13 }, { "epoch": 0.42424242424242425, "grad_norm": 0.06140454113483429, "learning_rate": 9.288643050001362e-06, "loss": 0.1844, "step": 14 }, { "epoch": 0.45454545454545453, "grad_norm": 0.0735398381948471, "learning_rate": 9.157348061512728e-06, "loss": 0.2258, "step": 15 }, { "epoch": 0.48484848484848486, "grad_norm": 0.08862978219985962, "learning_rate": 9.016037657403225e-06, "loss": 0.2582, "step": 16 }, { "epoch": 0.5151515151515151, "grad_norm": 0.1046353206038475, "learning_rate": 8.865052266813686e-06, "loss": 0.3167, "step": 17 }, { "epoch": 0.5454545454545454, "grad_norm": 0.07262540608644485, "learning_rate": 8.704755626774796e-06, "loss": 0.2139, "step": 18 }, { "epoch": 0.5757575757575758, "grad_norm": 0.055651213973760605, "learning_rate": 8.535533905932739e-06, "loss": 0.1626, "step": 19 }, { "epoch": 0.6060606060606061, "grad_norm": 0.06227761507034302, "learning_rate": 8.357794774235094e-06, "loss": 0.1744, "step": 20 }, { "epoch": 0.6363636363636364, "grad_norm": 0.07962284982204437, "learning_rate": 8.171966420818227e-06, "loss": 0.2164, "step": 21 }, { "epoch": 0.6666666666666666, "grad_norm": 0.06255478411912918, "learning_rate": 7.978496522462167e-06, "loss": 0.1726, "step": 22 }, { "epoch": 0.696969696969697, "grad_norm": 0.05239630118012428, "learning_rate": 7.777851165098012e-06, "loss": 0.1359, "step": 23 }, { "epoch": 0.7272727272727273, "grad_norm": 0.06619983911514282, "learning_rate": 7.570513720966108e-06, "loss": 0.1648, "step": 24 }, { "epoch": 0.7575757575757576, "grad_norm": 0.06786537170410156, "learning_rate": 7.3569836841299905e-06, "loss": 0.1703, "step": 25 }, { "epoch": 0.7878787878787878, "grad_norm": 0.051433369517326355, "learning_rate": 7.137775467151411e-06, "loss": 0.1162, "step": 26 }, { "epoch": 0.8181818181818182, "grad_norm": 0.05339939147233963, "learning_rate": 6.913417161825449e-06, "loss": 0.119, "step": 27 }, { "epoch": 0.8484848484848485, "grad_norm": 0.07627519220113754, "learning_rate": 6.684449266961101e-06, "loss": 0.1246, "step": 28 }, { "epoch": 0.8787878787878788, "grad_norm": 0.0718780905008316, "learning_rate": 6.451423386272312e-06, "loss": 0.1373, "step": 29 }, { "epoch": 0.9090909090909091, "grad_norm": 0.07383424788713455, "learning_rate": 6.21490089951632e-06, "loss": 0.1103, "step": 30 }, { "epoch": 0.9393939393939394, "grad_norm": 0.08858547359704971, "learning_rate": 5.975451610080643e-06, "loss": 0.1492, "step": 31 }, { "epoch": 0.9696969696969697, "grad_norm": 0.06277935951948166, "learning_rate": 5.733652372276809e-06, "loss": 0.1013, "step": 32 }, { "epoch": 1.0, "grad_norm": 0.0857253447175026, "learning_rate": 5.490085701647805e-06, "loss": 0.1307, "step": 33 }, { "epoch": 1.0303030303030303, "grad_norm": 0.0627182200551033, "learning_rate": 5.245338371637091e-06, "loss": 0.0952, "step": 34 }, { "epoch": 1.0606060606060606, "grad_norm": 0.05283113196492195, "learning_rate": 5e-06, "loss": 0.0755, "step": 35 }, { "epoch": 1.0909090909090908, "grad_norm": 0.04437226057052612, "learning_rate": 4.75466162836291e-06, "loss": 0.0632, "step": 36 }, { "epoch": 1.121212121212121, "grad_norm": 0.058942172676324844, "learning_rate": 4.509914298352197e-06, "loss": 0.079, "step": 37 }, { "epoch": 1.1515151515151516, "grad_norm": 0.0615689717233181, "learning_rate": 4.266347627723192e-06, "loss": 0.0799, "step": 38 }, { "epoch": 1.1818181818181819, "grad_norm": 0.05987268686294556, "learning_rate": 4.02454838991936e-06, "loss": 0.0743, "step": 39 }, { "epoch": 1.2121212121212122, "grad_norm": 0.06211871653795242, "learning_rate": 3.7850991004836813e-06, "loss": 0.0752, "step": 40 }, { "epoch": 1.2424242424242424, "grad_norm": 0.05732128396630287, "learning_rate": 3.5485766137276894e-06, "loss": 0.0707, "step": 41 }, { "epoch": 1.2727272727272727, "grad_norm": 0.05059375986456871, "learning_rate": 3.3155507330389004e-06, "loss": 0.0594, "step": 42 }, { "epoch": 1.303030303030303, "grad_norm": 0.04942630976438522, "learning_rate": 3.0865828381745515e-06, "loss": 0.0567, "step": 43 }, { "epoch": 1.3333333333333333, "grad_norm": 0.06048675253987312, "learning_rate": 2.862224532848591e-06, "loss": 0.0685, "step": 44 }, { "epoch": 1.3636363636363638, "grad_norm": 0.039925456047058105, "learning_rate": 2.6430163158700116e-06, "loss": 0.0436, "step": 45 }, { "epoch": 1.393939393939394, "grad_norm": 0.05743777006864548, "learning_rate": 2.429486279033892e-06, "loss": 0.0607, "step": 46 }, { "epoch": 1.4242424242424243, "grad_norm": 0.04005807638168335, "learning_rate": 2.2221488349019903e-06, "loss": 0.0417, "step": 47 }, { "epoch": 1.4545454545454546, "grad_norm": 0.050174467265605927, "learning_rate": 2.0215034775378336e-06, "loss": 0.0513, "step": 48 }, { "epoch": 1.4848484848484849, "grad_norm": 0.057930007576942444, "learning_rate": 1.8280335791817733e-06, "loss": 0.0589, "step": 49 }, { "epoch": 1.5151515151515151, "grad_norm": 0.07396280765533447, "learning_rate": 1.642205225764908e-06, "loss": 0.0692, "step": 50 }, { "epoch": 1.5454545454545454, "grad_norm": 0.053840093314647675, "learning_rate": 1.4644660940672628e-06, "loss": 0.0533, "step": 51 }, { "epoch": 1.5757575757575757, "grad_norm": 0.040064774453639984, "learning_rate": 1.2952443732252058e-06, "loss": 0.0386, "step": 52 }, { "epoch": 1.606060606060606, "grad_norm": 0.04430682584643364, "learning_rate": 1.134947733186315e-06, "loss": 0.0411, "step": 53 }, { "epoch": 1.6363636363636362, "grad_norm": 0.05869768187403679, "learning_rate": 9.83962342596776e-07, "loss": 0.0519, "step": 54 }, { "epoch": 1.6666666666666665, "grad_norm": 0.04796537011861801, "learning_rate": 8.426519384872733e-07, "loss": 0.0439, "step": 55 }, { "epoch": 1.696969696969697, "grad_norm": 0.04101736098527908, "learning_rate": 7.113569499986401e-07, "loss": 0.0346, "step": 56 }, { "epoch": 1.7272727272727273, "grad_norm": 0.04963319003582001, "learning_rate": 5.903936782582253e-07, "loss": 0.0419, "step": 57 }, { "epoch": 1.7575757575757576, "grad_norm": 0.05762108042836189, "learning_rate": 4.800535343827834e-07, "loss": 0.0487, "step": 58 }, { "epoch": 1.7878787878787878, "grad_norm": 0.038197822868824005, "learning_rate": 3.8060233744356634e-07, "loss": 0.0346, "step": 59 }, { "epoch": 1.8181818181818183, "grad_norm": 0.0402914397418499, "learning_rate": 2.9227967408489653e-07, "loss": 0.036, "step": 60 }, { "epoch": 1.8484848484848486, "grad_norm": 0.04647289216518402, "learning_rate": 2.152983213389559e-07, "loss": 0.0391, "step": 61 }, { "epoch": 1.878787878787879, "grad_norm": 0.05009330436587334, "learning_rate": 1.4984373402728014e-07, "loss": 0.0445, "step": 62 }, { "epoch": 1.9090909090909092, "grad_norm": 0.049318231642246246, "learning_rate": 9.607359798384785e-08, "loss": 0.0388, "step": 63 }, { "epoch": 1.9393939393939394, "grad_norm": 0.06097106263041496, "learning_rate": 5.411745017609493e-08, "loss": 0.0528, "step": 64 }, { "epoch": 1.9696969696969697, "grad_norm": 0.04419880732893944, "learning_rate": 2.4076366639015914e-08, "loss": 0.0376, "step": 65 }, { "epoch": 2.0, "grad_norm": 0.05926321819424629, "learning_rate": 6.022718974137976e-09, "loss": 0.0507, "step": 66 }, { "epoch": 2.0, "eval_loss": 0.041032154113054276, "eval_runtime": 26.3787, "eval_samples_per_second": 1.592, "eval_steps_per_second": 0.227, "step": 66 } ], "logging_steps": 1.0, "max_steps": 66, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.324201985846018e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }