RussianConcsExt / trainer_state.json
zieglerd's picture
Upload folder using huggingface_hub
e15105e verified
Raw
History Blame Contribute Delete
12.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 66,
"global_step": 66,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.030303030303030304,
"grad_norm": 0.0872589573264122,
"learning_rate": 0.0,
"loss": 0.2969,
"step": 1
},
{
"epoch": 0.06060606060606061,
"grad_norm": 0.07570399343967438,
"learning_rate": 5e-06,
"loss": 0.2534,
"step": 2
},
{
"epoch": 0.09090909090909091,
"grad_norm": 0.0646587386727333,
"learning_rate": 1e-05,
"loss": 0.2195,
"step": 3
},
{
"epoch": 0.12121212121212122,
"grad_norm": 0.08738136291503906,
"learning_rate": 9.993977281025862e-06,
"loss": 0.2949,
"step": 4
},
{
"epoch": 0.15151515151515152,
"grad_norm": 0.09267034381628036,
"learning_rate": 9.975923633360985e-06,
"loss": 0.3128,
"step": 5
},
{
"epoch": 0.18181818181818182,
"grad_norm": 0.0921434611082077,
"learning_rate": 9.945882549823906e-06,
"loss": 0.3027,
"step": 6
},
{
"epoch": 0.21212121212121213,
"grad_norm": 0.09888184815645218,
"learning_rate": 9.903926402016153e-06,
"loss": 0.3188,
"step": 7
},
{
"epoch": 0.24242424242424243,
"grad_norm": 0.09699065238237381,
"learning_rate": 9.850156265972722e-06,
"loss": 0.2958,
"step": 8
},
{
"epoch": 0.2727272727272727,
"grad_norm": 0.08493418246507645,
"learning_rate": 9.784701678661045e-06,
"loss": 0.2584,
"step": 9
},
{
"epoch": 0.30303030303030304,
"grad_norm": 0.07863851636648178,
"learning_rate": 9.707720325915105e-06,
"loss": 0.2457,
"step": 10
},
{
"epoch": 0.3333333333333333,
"grad_norm": 0.09796863794326782,
"learning_rate": 9.619397662556434e-06,
"loss": 0.3038,
"step": 11
},
{
"epoch": 0.36363636363636365,
"grad_norm": 0.06206300109624863,
"learning_rate": 9.519946465617217e-06,
"loss": 0.1931,
"step": 12
},
{
"epoch": 0.3939393939393939,
"grad_norm": 0.08884033560752869,
"learning_rate": 9.409606321741776e-06,
"loss": 0.2729,
"step": 13
},
{
"epoch": 0.42424242424242425,
"grad_norm": 0.06140454113483429,
"learning_rate": 9.288643050001362e-06,
"loss": 0.1844,
"step": 14
},
{
"epoch": 0.45454545454545453,
"grad_norm": 0.0735398381948471,
"learning_rate": 9.157348061512728e-06,
"loss": 0.2258,
"step": 15
},
{
"epoch": 0.48484848484848486,
"grad_norm": 0.08862978219985962,
"learning_rate": 9.016037657403225e-06,
"loss": 0.2582,
"step": 16
},
{
"epoch": 0.5151515151515151,
"grad_norm": 0.1046353206038475,
"learning_rate": 8.865052266813686e-06,
"loss": 0.3167,
"step": 17
},
{
"epoch": 0.5454545454545454,
"grad_norm": 0.07262540608644485,
"learning_rate": 8.704755626774796e-06,
"loss": 0.2139,
"step": 18
},
{
"epoch": 0.5757575757575758,
"grad_norm": 0.055651213973760605,
"learning_rate": 8.535533905932739e-06,
"loss": 0.1626,
"step": 19
},
{
"epoch": 0.6060606060606061,
"grad_norm": 0.06227761507034302,
"learning_rate": 8.357794774235094e-06,
"loss": 0.1744,
"step": 20
},
{
"epoch": 0.6363636363636364,
"grad_norm": 0.07962284982204437,
"learning_rate": 8.171966420818227e-06,
"loss": 0.2164,
"step": 21
},
{
"epoch": 0.6666666666666666,
"grad_norm": 0.06255478411912918,
"learning_rate": 7.978496522462167e-06,
"loss": 0.1726,
"step": 22
},
{
"epoch": 0.696969696969697,
"grad_norm": 0.05239630118012428,
"learning_rate": 7.777851165098012e-06,
"loss": 0.1359,
"step": 23
},
{
"epoch": 0.7272727272727273,
"grad_norm": 0.06619983911514282,
"learning_rate": 7.570513720966108e-06,
"loss": 0.1648,
"step": 24
},
{
"epoch": 0.7575757575757576,
"grad_norm": 0.06786537170410156,
"learning_rate": 7.3569836841299905e-06,
"loss": 0.1703,
"step": 25
},
{
"epoch": 0.7878787878787878,
"grad_norm": 0.051433369517326355,
"learning_rate": 7.137775467151411e-06,
"loss": 0.1162,
"step": 26
},
{
"epoch": 0.8181818181818182,
"grad_norm": 0.05339939147233963,
"learning_rate": 6.913417161825449e-06,
"loss": 0.119,
"step": 27
},
{
"epoch": 0.8484848484848485,
"grad_norm": 0.07627519220113754,
"learning_rate": 6.684449266961101e-06,
"loss": 0.1246,
"step": 28
},
{
"epoch": 0.8787878787878788,
"grad_norm": 0.0718780905008316,
"learning_rate": 6.451423386272312e-06,
"loss": 0.1373,
"step": 29
},
{
"epoch": 0.9090909090909091,
"grad_norm": 0.07383424788713455,
"learning_rate": 6.21490089951632e-06,
"loss": 0.1103,
"step": 30
},
{
"epoch": 0.9393939393939394,
"grad_norm": 0.08858547359704971,
"learning_rate": 5.975451610080643e-06,
"loss": 0.1492,
"step": 31
},
{
"epoch": 0.9696969696969697,
"grad_norm": 0.06277935951948166,
"learning_rate": 5.733652372276809e-06,
"loss": 0.1013,
"step": 32
},
{
"epoch": 1.0,
"grad_norm": 0.0857253447175026,
"learning_rate": 5.490085701647805e-06,
"loss": 0.1307,
"step": 33
},
{
"epoch": 1.0303030303030303,
"grad_norm": 0.0627182200551033,
"learning_rate": 5.245338371637091e-06,
"loss": 0.0952,
"step": 34
},
{
"epoch": 1.0606060606060606,
"grad_norm": 0.05283113196492195,
"learning_rate": 5e-06,
"loss": 0.0755,
"step": 35
},
{
"epoch": 1.0909090909090908,
"grad_norm": 0.04437226057052612,
"learning_rate": 4.75466162836291e-06,
"loss": 0.0632,
"step": 36
},
{
"epoch": 1.121212121212121,
"grad_norm": 0.058942172676324844,
"learning_rate": 4.509914298352197e-06,
"loss": 0.079,
"step": 37
},
{
"epoch": 1.1515151515151516,
"grad_norm": 0.0615689717233181,
"learning_rate": 4.266347627723192e-06,
"loss": 0.0799,
"step": 38
},
{
"epoch": 1.1818181818181819,
"grad_norm": 0.05987268686294556,
"learning_rate": 4.02454838991936e-06,
"loss": 0.0743,
"step": 39
},
{
"epoch": 1.2121212121212122,
"grad_norm": 0.06211871653795242,
"learning_rate": 3.7850991004836813e-06,
"loss": 0.0752,
"step": 40
},
{
"epoch": 1.2424242424242424,
"grad_norm": 0.05732128396630287,
"learning_rate": 3.5485766137276894e-06,
"loss": 0.0707,
"step": 41
},
{
"epoch": 1.2727272727272727,
"grad_norm": 0.05059375986456871,
"learning_rate": 3.3155507330389004e-06,
"loss": 0.0594,
"step": 42
},
{
"epoch": 1.303030303030303,
"grad_norm": 0.04942630976438522,
"learning_rate": 3.0865828381745515e-06,
"loss": 0.0567,
"step": 43
},
{
"epoch": 1.3333333333333333,
"grad_norm": 0.06048675253987312,
"learning_rate": 2.862224532848591e-06,
"loss": 0.0685,
"step": 44
},
{
"epoch": 1.3636363636363638,
"grad_norm": 0.039925456047058105,
"learning_rate": 2.6430163158700116e-06,
"loss": 0.0436,
"step": 45
},
{
"epoch": 1.393939393939394,
"grad_norm": 0.05743777006864548,
"learning_rate": 2.429486279033892e-06,
"loss": 0.0607,
"step": 46
},
{
"epoch": 1.4242424242424243,
"grad_norm": 0.04005807638168335,
"learning_rate": 2.2221488349019903e-06,
"loss": 0.0417,
"step": 47
},
{
"epoch": 1.4545454545454546,
"grad_norm": 0.050174467265605927,
"learning_rate": 2.0215034775378336e-06,
"loss": 0.0513,
"step": 48
},
{
"epoch": 1.4848484848484849,
"grad_norm": 0.057930007576942444,
"learning_rate": 1.8280335791817733e-06,
"loss": 0.0589,
"step": 49
},
{
"epoch": 1.5151515151515151,
"grad_norm": 0.07396280765533447,
"learning_rate": 1.642205225764908e-06,
"loss": 0.0692,
"step": 50
},
{
"epoch": 1.5454545454545454,
"grad_norm": 0.053840093314647675,
"learning_rate": 1.4644660940672628e-06,
"loss": 0.0533,
"step": 51
},
{
"epoch": 1.5757575757575757,
"grad_norm": 0.040064774453639984,
"learning_rate": 1.2952443732252058e-06,
"loss": 0.0386,
"step": 52
},
{
"epoch": 1.606060606060606,
"grad_norm": 0.04430682584643364,
"learning_rate": 1.134947733186315e-06,
"loss": 0.0411,
"step": 53
},
{
"epoch": 1.6363636363636362,
"grad_norm": 0.05869768187403679,
"learning_rate": 9.83962342596776e-07,
"loss": 0.0519,
"step": 54
},
{
"epoch": 1.6666666666666665,
"grad_norm": 0.04796537011861801,
"learning_rate": 8.426519384872733e-07,
"loss": 0.0439,
"step": 55
},
{
"epoch": 1.696969696969697,
"grad_norm": 0.04101736098527908,
"learning_rate": 7.113569499986401e-07,
"loss": 0.0346,
"step": 56
},
{
"epoch": 1.7272727272727273,
"grad_norm": 0.04963319003582001,
"learning_rate": 5.903936782582253e-07,
"loss": 0.0419,
"step": 57
},
{
"epoch": 1.7575757575757576,
"grad_norm": 0.05762108042836189,
"learning_rate": 4.800535343827834e-07,
"loss": 0.0487,
"step": 58
},
{
"epoch": 1.7878787878787878,
"grad_norm": 0.038197822868824005,
"learning_rate": 3.8060233744356634e-07,
"loss": 0.0346,
"step": 59
},
{
"epoch": 1.8181818181818183,
"grad_norm": 0.0402914397418499,
"learning_rate": 2.9227967408489653e-07,
"loss": 0.036,
"step": 60
},
{
"epoch": 1.8484848484848486,
"grad_norm": 0.04647289216518402,
"learning_rate": 2.152983213389559e-07,
"loss": 0.0391,
"step": 61
},
{
"epoch": 1.878787878787879,
"grad_norm": 0.05009330436587334,
"learning_rate": 1.4984373402728014e-07,
"loss": 0.0445,
"step": 62
},
{
"epoch": 1.9090909090909092,
"grad_norm": 0.049318231642246246,
"learning_rate": 9.607359798384785e-08,
"loss": 0.0388,
"step": 63
},
{
"epoch": 1.9393939393939394,
"grad_norm": 0.06097106263041496,
"learning_rate": 5.411745017609493e-08,
"loss": 0.0528,
"step": 64
},
{
"epoch": 1.9696969696969697,
"grad_norm": 0.04419880732893944,
"learning_rate": 2.4076366639015914e-08,
"loss": 0.0376,
"step": 65
},
{
"epoch": 2.0,
"grad_norm": 0.05926321819424629,
"learning_rate": 6.022718974137976e-09,
"loss": 0.0507,
"step": 66
},
{
"epoch": 2.0,
"eval_loss": 0.041032154113054276,
"eval_runtime": 26.3787,
"eval_samples_per_second": 1.592,
"eval_steps_per_second": 0.227,
"step": 66
}
],
"logging_steps": 1.0,
"max_steps": 66,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.324201985846018e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}