test6 / trainer_state.json
v-stone's picture
Upload folder using huggingface_hub
bd6a901 verified
Raw History Blame Contribute Delete
36.9 kB
{
"best_global_step": 200,
"best_metric": 0.0016466762172058225,
"best_model_checkpoint": "unified_sft_output/checkpoint-200",
"epoch": 50.0,
"eval_steps": 10,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.27586206896551724,
"grad_norm": 11.375,
"learning_rate": 0.0,
"loss": 1.2371,
"step": 1
},
{
"epoch": 0.5517241379310345,
"grad_norm": 10.75,
"learning_rate": 5.000000000000001e-07,
"loss": 1.249,
"step": 2
},
{
"epoch": 0.8275862068965517,
"grad_norm": 12.375,
"learning_rate": 1.0000000000000002e-06,
"loss": 1.4344,
"step": 3
},
{
"epoch": 1.0,
"grad_norm": 12.25,
"learning_rate": 1.5e-06,
"loss": 1.2445,
"step": 4
},
{
"epoch": 1.2758620689655173,
"grad_norm": 10.1875,
"learning_rate": 2.0000000000000003e-06,
"loss": 1.1814,
"step": 5
},
{
"epoch": 1.5517241379310345,
"grad_norm": 13.25,
"learning_rate": 2.5e-06,
"loss": 1.2665,
"step": 6
},
{
"epoch": 1.8275862068965516,
"grad_norm": 21.375,
"learning_rate": 3e-06,
"loss": 1.3003,
"step": 7
},
{
"epoch": 2.0,
"grad_norm": 12.0625,
"learning_rate": 3.5e-06,
"loss": 1.4292,
"step": 8
},
{
"epoch": 2.2758620689655173,
"grad_norm": 10.8125,
"learning_rate": 4.000000000000001e-06,
"loss": 1.1558,
"step": 9
},
{
"epoch": 2.5517241379310347,
"grad_norm": 8.375,
"learning_rate": 4.5e-06,
"loss": 1.2145,
"step": 10
},
{
"epoch": 2.5517241379310347,
"eval_loss": 1.21233069896698,
"eval_runtime": 1.7228,
"eval_samples_per_second": 1.741,
"eval_steps_per_second": 1.741,
"step": 10
},
{
"epoch": 2.8275862068965516,
"grad_norm": 8.8125,
"learning_rate": 5e-06,
"loss": 1.2393,
"step": 11
},
{
"epoch": 3.0,
"grad_norm": 6.875,
"learning_rate": 5.500000000000001e-06,
"loss": 1.1221,
"step": 12
},
{
"epoch": 3.2758620689655173,
"grad_norm": 5.5625,
"learning_rate": 6e-06,
"loss": 1.0858,
"step": 13
},
{
"epoch": 3.5517241379310347,
"grad_norm": 5.59375,
"learning_rate": 6.5000000000000004e-06,
"loss": 1.1747,
"step": 14
},
{
"epoch": 3.8275862068965516,
"grad_norm": 3.625,
"learning_rate": 7e-06,
"loss": 0.9076,
"step": 15
},
{
"epoch": 4.0,
"grad_norm": 4.53125,
"learning_rate": 7.500000000000001e-06,
"loss": 1.1572,
"step": 16
},
{
"epoch": 4.275862068965517,
"grad_norm": 3.453125,
"learning_rate": 8.000000000000001e-06,
"loss": 1.0446,
"step": 17
},
{
"epoch": 4.551724137931035,
"grad_norm": 3.078125,
"learning_rate": 8.5e-06,
"loss": 1.011,
"step": 18
},
{
"epoch": 4.827586206896552,
"grad_norm": 2.375,
"learning_rate": 9e-06,
"loss": 0.9294,
"step": 19
},
{
"epoch": 5.0,
"grad_norm": 1.9453125,
"learning_rate": 9.5e-06,
"loss": 0.7185,
"step": 20
},
{
"epoch": 5.0,
"eval_loss": 0.8018922209739685,
"eval_runtime": 1.7241,
"eval_samples_per_second": 1.74,
"eval_steps_per_second": 1.74,
"step": 20
},
{
"epoch": 5.275862068965517,
"grad_norm": 2.453125,
"learning_rate": 1e-05,
"loss": 0.8795,
"step": 21
},
{
"epoch": 5.551724137931035,
"grad_norm": 1.90625,
"learning_rate": 1.0500000000000001e-05,
"loss": 0.8248,
"step": 22
},
{
"epoch": 5.827586206896552,
"grad_norm": 1.7421875,
"learning_rate": 1.1000000000000001e-05,
"loss": 0.6881,
"step": 23
},
{
"epoch": 6.0,
"grad_norm": 1.671875,
"learning_rate": 1.15e-05,
"loss": 0.7153,
"step": 24
},
{
"epoch": 6.275862068965517,
"grad_norm": 3.125,
"learning_rate": 1.2e-05,
"loss": 0.6096,
"step": 25
},
{
"epoch": 6.551724137931035,
"grad_norm": 1.5234375,
"learning_rate": 1.25e-05,
"loss": 0.6779,
"step": 26
},
{
"epoch": 6.827586206896552,
"grad_norm": 2.15625,
"learning_rate": 1.3000000000000001e-05,
"loss": 0.6229,
"step": 27
},
{
"epoch": 7.0,
"grad_norm": 1.2265625,
"learning_rate": 1.3500000000000001e-05,
"loss": 0.5901,
"step": 28
},
{
"epoch": 7.275862068965517,
"grad_norm": 1.203125,
"learning_rate": 1.4e-05,
"loss": 0.593,
"step": 29
},
{
"epoch": 7.551724137931035,
"grad_norm": 1.4296875,
"learning_rate": 1.45e-05,
"loss": 0.5158,
"step": 30
},
{
"epoch": 7.551724137931035,
"eval_loss": 0.4224577248096466,
"eval_runtime": 1.7416,
"eval_samples_per_second": 1.723,
"eval_steps_per_second": 1.723,
"step": 30
},
{
"epoch": 7.827586206896552,
"grad_norm": 1.0625,
"learning_rate": 1.5000000000000002e-05,
"loss": 0.4175,
"step": 31
},
{
"epoch": 8.0,
"grad_norm": 0.96484375,
"learning_rate": 1.55e-05,
"loss": 0.478,
"step": 32
},
{
"epoch": 8.275862068965518,
"grad_norm": 0.79296875,
"learning_rate": 1.6000000000000003e-05,
"loss": 0.4238,
"step": 33
},
{
"epoch": 8.551724137931034,
"grad_norm": 1.0703125,
"learning_rate": 1.65e-05,
"loss": 0.4365,
"step": 34
},
{
"epoch": 8.827586206896552,
"grad_norm": 0.9453125,
"learning_rate": 1.7e-05,
"loss": 0.3686,
"step": 35
},
{
"epoch": 9.0,
"grad_norm": 2.328125,
"learning_rate": 1.7500000000000002e-05,
"loss": 0.4172,
"step": 36
},
{
"epoch": 9.275862068965518,
"grad_norm": 0.73046875,
"learning_rate": 1.8e-05,
"loss": 0.3731,
"step": 37
},
{
"epoch": 9.551724137931034,
"grad_norm": 0.953125,
"learning_rate": 1.8500000000000002e-05,
"loss": 0.3885,
"step": 38
},
{
"epoch": 9.827586206896552,
"grad_norm": 0.79296875,
"learning_rate": 1.9e-05,
"loss": 0.3008,
"step": 39
},
{
"epoch": 10.0,
"grad_norm": 1.265625,
"learning_rate": 1.95e-05,
"loss": 0.2395,
"step": 40
},
{
"epoch": 10.0,
"eval_loss": 0.21218304336071014,
"eval_runtime": 1.7107,
"eval_samples_per_second": 1.754,
"eval_steps_per_second": 1.754,
"step": 40
},
{
"epoch": 10.275862068965518,
"grad_norm": 0.91796875,
"learning_rate": 2e-05,
"loss": 0.2379,
"step": 41
},
{
"epoch": 10.551724137931034,
"grad_norm": 0.859375,
"learning_rate": 1.9999619230641714e-05,
"loss": 0.267,
"step": 42
},
{
"epoch": 10.827586206896552,
"grad_norm": 0.953125,
"learning_rate": 1.9998476951563914e-05,
"loss": 0.2913,
"step": 43
},
{
"epoch": 11.0,
"grad_norm": 1.2578125,
"learning_rate": 1.9996573249755573e-05,
"loss": 0.2742,
"step": 44
},
{
"epoch": 11.275862068965518,
"grad_norm": 0.875,
"learning_rate": 1.999390827019096e-05,
"loss": 0.1832,
"step": 45
},
{
"epoch": 11.551724137931034,
"grad_norm": 0.87890625,
"learning_rate": 1.999048221581858e-05,
"loss": 0.2744,
"step": 46
},
{
"epoch": 11.827586206896552,
"grad_norm": 1.1875,
"learning_rate": 1.9986295347545738e-05,
"loss": 0.1503,
"step": 47
},
{
"epoch": 12.0,
"grad_norm": 1.3125,
"learning_rate": 1.998134798421867e-05,
"loss": 0.1235,
"step": 48
},
{
"epoch": 12.275862068965518,
"grad_norm": 0.82421875,
"learning_rate": 1.9975640502598243e-05,
"loss": 0.1688,
"step": 49
},
{
"epoch": 12.551724137931034,
"grad_norm": 0.8671875,
"learning_rate": 1.9969173337331283e-05,
"loss": 0.1676,
"step": 50
},
{
"epoch": 12.551724137931034,
"eval_loss": 0.09635955095291138,
"eval_runtime": 1.7755,
"eval_samples_per_second": 1.69,
"eval_steps_per_second": 1.69,
"step": 50
},
{
"epoch": 12.827586206896552,
"grad_norm": 1.1953125,
"learning_rate": 1.9961946980917457e-05,
"loss": 0.0832,
"step": 51
},
{
"epoch": 13.0,
"grad_norm": 1.2734375,
"learning_rate": 1.9953961983671792e-05,
"loss": 0.1309,
"step": 52
},
{
"epoch": 13.275862068965518,
"grad_norm": 0.78125,
"learning_rate": 1.9945218953682736e-05,
"loss": 0.0907,
"step": 53
},
{
"epoch": 13.551724137931034,
"grad_norm": 0.796875,
"learning_rate": 1.9935718556765878e-05,
"loss": 0.094,
"step": 54
},
{
"epoch": 13.827586206896552,
"grad_norm": 1.0703125,
"learning_rate": 1.9925461516413224e-05,
"loss": 0.0985,
"step": 55
},
{
"epoch": 14.0,
"grad_norm": 1.265625,
"learning_rate": 1.9914448613738107e-05,
"loss": 0.1094,
"step": 56
},
{
"epoch": 14.275862068965518,
"grad_norm": 0.66015625,
"learning_rate": 1.9902680687415704e-05,
"loss": 0.0448,
"step": 57
},
{
"epoch": 14.551724137931034,
"grad_norm": 1.0078125,
"learning_rate": 1.989015863361917e-05,
"loss": 0.0836,
"step": 58
},
{
"epoch": 14.827586206896552,
"grad_norm": 0.8125,
"learning_rate": 1.9876883405951378e-05,
"loss": 0.0687,
"step": 59
},
{
"epoch": 15.0,
"grad_norm": 0.7890625,
"learning_rate": 1.9862856015372315e-05,
"loss": 0.0276,
"step": 60
},
{
"epoch": 15.0,
"eval_loss": 0.03497372567653656,
"eval_runtime": 1.7662,
"eval_samples_per_second": 1.699,
"eval_steps_per_second": 1.699,
"step": 60
},
{
"epoch": 15.275862068965518,
"grad_norm": 0.7265625,
"learning_rate": 1.9848077530122083e-05,
"loss": 0.0395,
"step": 61
},
{
"epoch": 15.551724137931034,
"grad_norm": 0.51953125,
"learning_rate": 1.983254907563955e-05,
"loss": 0.0248,
"step": 62
},
{
"epoch": 15.827586206896552,
"grad_norm": 1.1640625,
"learning_rate": 1.9816271834476642e-05,
"loss": 0.0355,
"step": 63
},
{
"epoch": 16.0,
"grad_norm": 0.80859375,
"learning_rate": 1.9799247046208297e-05,
"loss": 0.035,
"step": 64
},
{
"epoch": 16.275862068965516,
"grad_norm": 0.494140625,
"learning_rate": 1.9781476007338058e-05,
"loss": 0.0172,
"step": 65
},
{
"epoch": 16.551724137931036,
"grad_norm": 0.59765625,
"learning_rate": 1.9762960071199334e-05,
"loss": 0.0216,
"step": 66
},
{
"epoch": 16.82758620689655,
"grad_norm": 0.984375,
"learning_rate": 1.9743700647852356e-05,
"loss": 0.0215,
"step": 67
},
{
"epoch": 17.0,
"grad_norm": 0.875,
"learning_rate": 1.9723699203976768e-05,
"loss": 0.0206,
"step": 68
},
{
"epoch": 17.275862068965516,
"grad_norm": 0.49609375,
"learning_rate": 1.9702957262759964e-05,
"loss": 0.0142,
"step": 69
},
{
"epoch": 17.551724137931036,
"grad_norm": 0.546875,
"learning_rate": 1.968147640378108e-05,
"loss": 0.0107,
"step": 70
},
{
"epoch": 17.551724137931036,
"eval_loss": 0.010336539708077908,
"eval_runtime": 1.7352,
"eval_samples_per_second": 1.729,
"eval_steps_per_second": 1.729,
"step": 70
},
{
"epoch": 17.82758620689655,
"grad_norm": 0.50390625,
"learning_rate": 1.9659258262890683e-05,
"loss": 0.0105,
"step": 71
},
{
"epoch": 18.0,
"grad_norm": 0.58203125,
"learning_rate": 1.963630453208623e-05,
"loss": 0.012,
"step": 72
},
{
"epoch": 18.275862068965516,
"grad_norm": 0.361328125,
"learning_rate": 1.961261695938319e-05,
"loss": 0.0079,
"step": 73
},
{
"epoch": 18.551724137931036,
"grad_norm": 0.376953125,
"learning_rate": 1.958819734868193e-05,
"loss": 0.0083,
"step": 74
},
{
"epoch": 18.82758620689655,
"grad_norm": 0.2734375,
"learning_rate": 1.9563047559630356e-05,
"loss": 0.0072,
"step": 75
},
{
"epoch": 19.0,
"grad_norm": 0.310546875,
"learning_rate": 1.953716950748227e-05,
"loss": 0.0072,
"step": 76
},
{
"epoch": 19.275862068965516,
"grad_norm": 0.2392578125,
"learning_rate": 1.9510565162951538e-05,
"loss": 0.006,
"step": 77
},
{
"epoch": 19.551724137931036,
"grad_norm": 0.259765625,
"learning_rate": 1.9483236552061996e-05,
"loss": 0.0056,
"step": 78
},
{
"epoch": 19.82758620689655,
"grad_norm": 0.28125,
"learning_rate": 1.945518575599317e-05,
"loss": 0.005,
"step": 79
},
{
"epoch": 20.0,
"grad_norm": 0.439453125,
"learning_rate": 1.9426414910921785e-05,
"loss": 0.0061,
"step": 80
},
{
"epoch": 20.0,
"eval_loss": 0.005222354084253311,
"eval_runtime": 1.7373,
"eval_samples_per_second": 1.727,
"eval_steps_per_second": 1.727,
"step": 80
},
{
"epoch": 20.275862068965516,
"grad_norm": 0.2353515625,
"learning_rate": 1.9396926207859085e-05,
"loss": 0.0047,
"step": 81
},
{
"epoch": 20.551724137931036,
"grad_norm": 0.16796875,
"learning_rate": 1.9366721892483976e-05,
"loss": 0.0034,
"step": 82
},
{
"epoch": 20.82758620689655,
"grad_norm": 0.609375,
"learning_rate": 1.9335804264972018e-05,
"loss": 0.0056,
"step": 83
},
{
"epoch": 21.0,
"grad_norm": 0.1884765625,
"learning_rate": 1.9304175679820247e-05,
"loss": 0.0043,
"step": 84
},
{
"epoch": 21.275862068965516,
"grad_norm": 0.1630859375,
"learning_rate": 1.9271838545667876e-05,
"loss": 0.0031,
"step": 85
},
{
"epoch": 21.551724137931036,
"grad_norm": 0.1552734375,
"learning_rate": 1.9238795325112867e-05,
"loss": 0.0041,
"step": 86
},
{
"epoch": 21.82758620689655,
"grad_norm": 0.189453125,
"learning_rate": 1.9205048534524405e-05,
"loss": 0.0034,
"step": 87
},
{
"epoch": 22.0,
"grad_norm": 0.36328125,
"learning_rate": 1.917060074385124e-05,
"loss": 0.0043,
"step": 88
},
{
"epoch": 22.275862068965516,
"grad_norm": 0.1279296875,
"learning_rate": 1.913545457642601e-05,
"loss": 0.003,
"step": 89
},
{
"epoch": 22.551724137931036,
"grad_norm": 0.1513671875,
"learning_rate": 1.9099612708765432e-05,
"loss": 0.0033,
"step": 90
},
{
"epoch": 22.551724137931036,
"eval_loss": 0.0038691603112965822,
"eval_runtime": 1.7266,
"eval_samples_per_second": 1.738,
"eval_steps_per_second": 1.738,
"step": 90
},
{
"epoch": 22.82758620689655,
"grad_norm": 0.1689453125,
"learning_rate": 1.9063077870366504e-05,
"loss": 0.0029,
"step": 91
},
{
"epoch": 23.0,
"grad_norm": 0.1435546875,
"learning_rate": 1.902585284349861e-05,
"loss": 0.0032,
"step": 92
},
{
"epoch": 23.275862068965516,
"grad_norm": 0.1376953125,
"learning_rate": 1.8987940462991673e-05,
"loss": 0.003,
"step": 93
},
{
"epoch": 23.551724137931036,
"grad_norm": 0.1083984375,
"learning_rate": 1.894934361602025e-05,
"loss": 0.0024,
"step": 94
},
{
"epoch": 23.82758620689655,
"grad_norm": 0.08203125,
"learning_rate": 1.891006524188368e-05,
"loss": 0.0026,
"step": 95
},
{
"epoch": 24.0,
"grad_norm": 0.1748046875,
"learning_rate": 1.887010833178222e-05,
"loss": 0.0031,
"step": 96
},
{
"epoch": 24.275862068965516,
"grad_norm": 0.11474609375,
"learning_rate": 1.8829475928589272e-05,
"loss": 0.0026,
"step": 97
},
{
"epoch": 24.551724137931036,
"grad_norm": 0.109375,
"learning_rate": 1.8788171126619653e-05,
"loss": 0.002,
"step": 98
},
{
"epoch": 24.82758620689655,
"grad_norm": 0.1123046875,
"learning_rate": 1.874619707139396e-05,
"loss": 0.0026,
"step": 99
},
{
"epoch": 25.0,
"grad_norm": 0.09912109375,
"learning_rate": 1.8703556959398998e-05,
"loss": 0.0025,
"step": 100
},
{
"epoch": 25.0,
"eval_loss": 0.0027635388541966677,
"eval_runtime": 1.7315,
"eval_samples_per_second": 1.733,
"eval_steps_per_second": 1.733,
"step": 100
},
{
"epoch": 25.275862068965516,
"grad_norm": 0.0986328125,
"learning_rate": 1.866025403784439e-05,
"loss": 0.0022,
"step": 101
},
{
"epoch": 25.551724137931036,
"grad_norm": 0.08837890625,
"learning_rate": 1.861629160441526e-05,
"loss": 0.0024,
"step": 102
},
{
"epoch": 25.82758620689655,
"grad_norm": 0.09814453125,
"learning_rate": 1.8571673007021124e-05,
"loss": 0.002,
"step": 103
},
{
"epoch": 26.0,
"grad_norm": 0.103515625,
"learning_rate": 1.8526401643540924e-05,
"loss": 0.0023,
"step": 104
},
{
"epoch": 26.275862068965516,
"grad_norm": 0.09716796875,
"learning_rate": 1.848048096156426e-05,
"loss": 0.0021,
"step": 105
},
{
"epoch": 26.551724137931036,
"grad_norm": 0.0830078125,
"learning_rate": 1.843391445812886e-05,
"loss": 0.0021,
"step": 106
},
{
"epoch": 26.82758620689655,
"grad_norm": 0.06982421875,
"learning_rate": 1.8386705679454243e-05,
"loss": 0.0021,
"step": 107
},
{
"epoch": 27.0,
"grad_norm": 0.1494140625,
"learning_rate": 1.8338858220671683e-05,
"loss": 0.0022,
"step": 108
},
{
"epoch": 27.275862068965516,
"grad_norm": 0.09423828125,
"learning_rate": 1.8290375725550417e-05,
"loss": 0.0025,
"step": 109
},
{
"epoch": 27.551724137931036,
"grad_norm": 0.06982421875,
"learning_rate": 1.8241261886220155e-05,
"loss": 0.0019,
"step": 110
},
{
"epoch": 27.551724137931036,
"eval_loss": 0.0022178783547133207,
"eval_runtime": 1.7843,
"eval_samples_per_second": 1.681,
"eval_steps_per_second": 1.681,
"step": 110
},
{
"epoch": 27.82758620689655,
"grad_norm": 0.14453125,
"learning_rate": 1.819152044288992e-05,
"loss": 0.0022,
"step": 111
},
{
"epoch": 28.0,
"grad_norm": 0.06689453125,
"learning_rate": 1.8141155183563195e-05,
"loss": 0.0016,
"step": 112
},
{
"epoch": 28.275862068965516,
"grad_norm": 0.0771484375,
"learning_rate": 1.8090169943749477e-05,
"loss": 0.002,
"step": 113
},
{
"epoch": 28.551724137931036,
"grad_norm": 0.06298828125,
"learning_rate": 1.8038568606172172e-05,
"loss": 0.0018,
"step": 114
},
{
"epoch": 28.82758620689655,
"grad_norm": 0.07958984375,
"learning_rate": 1.798635510047293e-05,
"loss": 0.0017,
"step": 115
},
{
"epoch": 29.0,
"grad_norm": 0.16015625,
"learning_rate": 1.7933533402912354e-05,
"loss": 0.0022,
"step": 116
},
{
"epoch": 29.275862068965516,
"grad_norm": 0.07373046875,
"learning_rate": 1.788010753606722e-05,
"loss": 0.0018,
"step": 117
},
{
"epoch": 29.551724137931036,
"grad_norm": 0.07861328125,
"learning_rate": 1.782608156852414e-05,
"loss": 0.002,
"step": 118
},
{
"epoch": 29.82758620689655,
"grad_norm": 0.0634765625,
"learning_rate": 1.777145961456971e-05,
"loss": 0.0017,
"step": 119
},
{
"epoch": 30.0,
"grad_norm": 0.14453125,
"learning_rate": 1.7716245833877202e-05,
"loss": 0.0019,
"step": 120
},
{
"epoch": 30.0,
"eval_loss": 0.001993604702875018,
"eval_runtime": 1.7303,
"eval_samples_per_second": 1.734,
"eval_steps_per_second": 1.734,
"step": 120
},
{
"epoch": 30.275862068965516,
"grad_norm": 0.06884765625,
"learning_rate": 1.766044443118978e-05,
"loss": 0.0018,
"step": 121
},
{
"epoch": 30.551724137931036,
"grad_norm": 0.064453125,
"learning_rate": 1.7604059656000313e-05,
"loss": 0.0015,
"step": 122
},
{
"epoch": 30.82758620689655,
"grad_norm": 0.119140625,
"learning_rate": 1.7547095802227723e-05,
"loss": 0.002,
"step": 123
},
{
"epoch": 31.0,
"grad_norm": 0.09814453125,
"learning_rate": 1.7489557207890025e-05,
"loss": 0.0021,
"step": 124
},
{
"epoch": 31.275862068965516,
"grad_norm": 0.0703125,
"learning_rate": 1.7431448254773943e-05,
"loss": 0.0015,
"step": 125
},
{
"epoch": 31.551724137931036,
"grad_norm": 0.0810546875,
"learning_rate": 1.737277336810124e-05,
"loss": 0.0017,
"step": 126
},
{
"epoch": 31.82758620689655,
"grad_norm": 0.0810546875,
"learning_rate": 1.7313537016191706e-05,
"loss": 0.0018,
"step": 127
},
{
"epoch": 32.0,
"grad_norm": 0.10302734375,
"learning_rate": 1.7253743710122877e-05,
"loss": 0.0021,
"step": 128
},
{
"epoch": 32.275862068965516,
"grad_norm": 0.07080078125,
"learning_rate": 1.7193398003386514e-05,
"loss": 0.0016,
"step": 129
},
{
"epoch": 32.55172413793103,
"grad_norm": 0.08349609375,
"learning_rate": 1.713250449154182e-05,
"loss": 0.0019,
"step": 130
},
{
"epoch": 32.55172413793103,
"eval_loss": 0.0018896261462941766,
"eval_runtime": 1.787,
"eval_samples_per_second": 1.679,
"eval_steps_per_second": 1.679,
"step": 130
},
{
"epoch": 32.827586206896555,
"grad_norm": 0.0625,
"learning_rate": 1.7071067811865477e-05,
"loss": 0.0016,
"step": 131
},
{
"epoch": 33.0,
"grad_norm": 0.11865234375,
"learning_rate": 1.700909264299851e-05,
"loss": 0.0015,
"step": 132
},
{
"epoch": 33.275862068965516,
"grad_norm": 0.09326171875,
"learning_rate": 1.6946583704589973e-05,
"loss": 0.0016,
"step": 133
},
{
"epoch": 33.55172413793103,
"grad_norm": 0.056396484375,
"learning_rate": 1.688354575693754e-05,
"loss": 0.0015,
"step": 134
},
{
"epoch": 33.827586206896555,
"grad_norm": 0.0615234375,
"learning_rate": 1.6819983600624986e-05,
"loss": 0.0018,
"step": 135
},
{
"epoch": 34.0,
"grad_norm": 0.1123046875,
"learning_rate": 1.6755902076156606e-05,
"loss": 0.0015,
"step": 136
},
{
"epoch": 34.275862068965516,
"grad_norm": 0.0810546875,
"learning_rate": 1.6691306063588583e-05,
"loss": 0.0015,
"step": 137
},
{
"epoch": 34.55172413793103,
"grad_norm": 0.06591796875,
"learning_rate": 1.6626200482157378e-05,
"loss": 0.0017,
"step": 138
},
{
"epoch": 34.827586206896555,
"grad_norm": 0.0703125,
"learning_rate": 1.6560590289905074e-05,
"loss": 0.0016,
"step": 139
},
{
"epoch": 35.0,
"grad_norm": 0.08544921875,
"learning_rate": 1.6494480483301836e-05,
"loss": 0.0018,
"step": 140
},
{
"epoch": 35.0,
"eval_loss": 0.0019512426806613803,
"eval_runtime": 1.7323,
"eval_samples_per_second": 1.732,
"eval_steps_per_second": 1.732,
"step": 140
},
{
"epoch": 35.275862068965516,
"grad_norm": 0.0498046875,
"learning_rate": 1.6427876096865394e-05,
"loss": 0.0015,
"step": 141
},
{
"epoch": 35.55172413793103,
"grad_norm": 0.1044921875,
"learning_rate": 1.636078220277764e-05,
"loss": 0.0017,
"step": 142
},
{
"epoch": 35.827586206896555,
"grad_norm": 0.0927734375,
"learning_rate": 1.6293203910498375e-05,
"loss": 0.0019,
"step": 143
},
{
"epoch": 36.0,
"grad_norm": 0.10595703125,
"learning_rate": 1.6225146366376198e-05,
"loss": 0.0014,
"step": 144
},
{
"epoch": 36.275862068965516,
"grad_norm": 0.057373046875,
"learning_rate": 1.6156614753256583e-05,
"loss": 0.0017,
"step": 145
},
{
"epoch": 36.55172413793103,
"grad_norm": 0.07470703125,
"learning_rate": 1.608761429008721e-05,
"loss": 0.0014,
"step": 146
},
{
"epoch": 36.827586206896555,
"grad_norm": 0.0712890625,
"learning_rate": 1.6018150231520486e-05,
"loss": 0.0014,
"step": 147
},
{
"epoch": 37.0,
"grad_norm": 0.11328125,
"learning_rate": 1.5948227867513416e-05,
"loss": 0.0017,
"step": 148
},
{
"epoch": 37.275862068965516,
"grad_norm": 0.06103515625,
"learning_rate": 1.5877852522924733e-05,
"loss": 0.0016,
"step": 149
},
{
"epoch": 37.55172413793103,
"grad_norm": 0.08056640625,
"learning_rate": 1.5807029557109398e-05,
"loss": 0.0016,
"step": 150
},
{
"epoch": 37.55172413793103,
"eval_loss": 0.001894477754831314,
"eval_runtime": 1.7336,
"eval_samples_per_second": 1.731,
"eval_steps_per_second": 1.731,
"step": 150
},
{
"epoch": 37.827586206896555,
"grad_norm": 0.06982421875,
"learning_rate": 1.573576436351046e-05,
"loss": 0.0016,
"step": 151
},
{
"epoch": 38.0,
"grad_norm": 0.091796875,
"learning_rate": 1.566406236924833e-05,
"loss": 0.0014,
"step": 152
},
{
"epoch": 38.275862068965516,
"grad_norm": 0.05517578125,
"learning_rate": 1.5591929034707468e-05,
"loss": 0.0014,
"step": 153
},
{
"epoch": 38.55172413793103,
"grad_norm": 0.0732421875,
"learning_rate": 1.5519369853120584e-05,
"loss": 0.0018,
"step": 154
},
{
"epoch": 38.827586206896555,
"grad_norm": 0.08154296875,
"learning_rate": 1.5446390350150272e-05,
"loss": 0.0015,
"step": 155
},
{
"epoch": 39.0,
"grad_norm": 0.1083984375,
"learning_rate": 1.5372996083468242e-05,
"loss": 0.0015,
"step": 156
},
{
"epoch": 39.275862068965516,
"grad_norm": 0.06884765625,
"learning_rate": 1.529919264233205e-05,
"loss": 0.0017,
"step": 157
},
{
"epoch": 39.55172413793103,
"grad_norm": 0.052978515625,
"learning_rate": 1.5224985647159489e-05,
"loss": 0.0014,
"step": 158
},
{
"epoch": 39.827586206896555,
"grad_norm": 0.0712890625,
"learning_rate": 1.5150380749100545e-05,
"loss": 0.0015,
"step": 159
},
{
"epoch": 40.0,
"grad_norm": 0.10888671875,
"learning_rate": 1.5075383629607043e-05,
"loss": 0.0016,
"step": 160
},
{
"epoch": 40.0,
"eval_loss": 0.0018837498500943184,
"eval_runtime": 1.7505,
"eval_samples_per_second": 1.714,
"eval_steps_per_second": 1.714,
"step": 160
},
{
"epoch": 40.275862068965516,
"grad_norm": 0.07373046875,
"learning_rate": 1.5000000000000002e-05,
"loss": 0.0015,
"step": 161
},
{
"epoch": 40.55172413793103,
"grad_norm": 0.078125,
"learning_rate": 1.4924235601034673e-05,
"loss": 0.0018,
"step": 162
},
{
"epoch": 40.827586206896555,
"grad_norm": 0.06884765625,
"learning_rate": 1.4848096202463373e-05,
"loss": 0.0015,
"step": 163
},
{
"epoch": 41.0,
"grad_norm": 0.058837890625,
"learning_rate": 1.4771587602596085e-05,
"loss": 0.0013,
"step": 164
},
{
"epoch": 41.275862068965516,
"grad_norm": 0.05859375,
"learning_rate": 1.469471562785891e-05,
"loss": 0.0017,
"step": 165
},
{
"epoch": 41.55172413793103,
"grad_norm": 0.06494140625,
"learning_rate": 1.4617486132350343e-05,
"loss": 0.0014,
"step": 166
},
{
"epoch": 41.827586206896555,
"grad_norm": 0.05908203125,
"learning_rate": 1.4539904997395468e-05,
"loss": 0.0013,
"step": 167
},
{
"epoch": 42.0,
"grad_norm": 0.201171875,
"learning_rate": 1.4461978131098089e-05,
"loss": 0.0021,
"step": 168
},
{
"epoch": 42.275862068965516,
"grad_norm": 0.055908203125,
"learning_rate": 1.4383711467890776e-05,
"loss": 0.0014,
"step": 169
},
{
"epoch": 42.55172413793103,
"grad_norm": 0.07470703125,
"learning_rate": 1.4305110968082953e-05,
"loss": 0.0014,
"step": 170
},
{
"epoch": 42.55172413793103,
"eval_loss": 0.0018982401816174388,
"eval_runtime": 1.7258,
"eval_samples_per_second": 1.738,
"eval_steps_per_second": 1.738,
"step": 170
},
{
"epoch": 42.827586206896555,
"grad_norm": 0.05322265625,
"learning_rate": 1.4226182617406996e-05,
"loss": 0.0014,
"step": 171
},
{
"epoch": 43.0,
"grad_norm": 0.16015625,
"learning_rate": 1.4146932426562391e-05,
"loss": 0.0021,
"step": 172
},
{
"epoch": 43.275862068965516,
"grad_norm": 0.068359375,
"learning_rate": 1.4067366430758004e-05,
"loss": 0.0016,
"step": 173
},
{
"epoch": 43.55172413793103,
"grad_norm": 0.0693359375,
"learning_rate": 1.3987490689252463e-05,
"loss": 0.0014,
"step": 174
},
{
"epoch": 43.827586206896555,
"grad_norm": 0.07177734375,
"learning_rate": 1.3907311284892737e-05,
"loss": 0.0016,
"step": 175
},
{
"epoch": 44.0,
"grad_norm": 0.07568359375,
"learning_rate": 1.3826834323650899e-05,
"loss": 0.0013,
"step": 176
},
{
"epoch": 44.275862068965516,
"grad_norm": 0.07177734375,
"learning_rate": 1.3746065934159123e-05,
"loss": 0.0013,
"step": 177
},
{
"epoch": 44.55172413793103,
"grad_norm": 0.0595703125,
"learning_rate": 1.3665012267242974e-05,
"loss": 0.0015,
"step": 178
},
{
"epoch": 44.827586206896555,
"grad_norm": 0.0771484375,
"learning_rate": 1.3583679495453e-05,
"loss": 0.0016,
"step": 179
},
{
"epoch": 45.0,
"grad_norm": 0.11083984375,
"learning_rate": 1.3502073812594677e-05,
"loss": 0.0016,
"step": 180
},
{
"epoch": 45.0,
"eval_loss": 0.0018364647403359413,
"eval_runtime": 1.7371,
"eval_samples_per_second": 1.727,
"eval_steps_per_second": 1.727,
"step": 180
},
{
"epoch": 45.275862068965516,
"grad_norm": 0.046142578125,
"learning_rate": 1.342020143325669e-05,
"loss": 0.0014,
"step": 181
},
{
"epoch": 45.55172413793103,
"grad_norm": 0.08251953125,
"learning_rate": 1.333806859233771e-05,
"loss": 0.0015,
"step": 182
},
{
"epoch": 45.827586206896555,
"grad_norm": 0.09912109375,
"learning_rate": 1.3255681544571568e-05,
"loss": 0.0015,
"step": 183
},
{
"epoch": 46.0,
"grad_norm": 0.0986328125,
"learning_rate": 1.3173046564050923e-05,
"loss": 0.0013,
"step": 184
},
{
"epoch": 46.275862068965516,
"grad_norm": 0.07275390625,
"learning_rate": 1.3090169943749475e-05,
"loss": 0.0013,
"step": 185
},
{
"epoch": 46.55172413793103,
"grad_norm": 0.05859375,
"learning_rate": 1.300705799504273e-05,
"loss": 0.0015,
"step": 186
},
{
"epoch": 46.827586206896555,
"grad_norm": 0.06396484375,
"learning_rate": 1.2923717047227368e-05,
"loss": 0.0014,
"step": 187
},
{
"epoch": 47.0,
"grad_norm": 0.09033203125,
"learning_rate": 1.284015344703923e-05,
"loss": 0.0016,
"step": 188
},
{
"epoch": 47.275862068965516,
"grad_norm": 0.09423828125,
"learning_rate": 1.2756373558169992e-05,
"loss": 0.0015,
"step": 189
},
{
"epoch": 47.55172413793103,
"grad_norm": 0.044189453125,
"learning_rate": 1.267238376078257e-05,
"loss": 0.0013,
"step": 190
},
{
"epoch": 47.55172413793103,
"eval_loss": 0.0017142044380307198,
"eval_runtime": 1.7594,
"eval_samples_per_second": 1.705,
"eval_steps_per_second": 1.705,
"step": 190
},
{
"epoch": 47.827586206896555,
"grad_norm": 0.263671875,
"learning_rate": 1.2588190451025209e-05,
"loss": 0.0024,
"step": 191
},
{
"epoch": 48.0,
"grad_norm": 0.0712890625,
"learning_rate": 1.2503800040544417e-05,
"loss": 0.0014,
"step": 192
},
{
"epoch": 48.275862068965516,
"grad_norm": 0.08154296875,
"learning_rate": 1.2419218955996677e-05,
"loss": 0.0017,
"step": 193
},
{
"epoch": 48.55172413793103,
"grad_norm": 0.0595703125,
"learning_rate": 1.2334453638559057e-05,
"loss": 0.0013,
"step": 194
},
{
"epoch": 48.827586206896555,
"grad_norm": 0.055419921875,
"learning_rate": 1.2249510543438652e-05,
"loss": 0.0013,
"step": 195
},
{
"epoch": 49.0,
"grad_norm": 0.142578125,
"learning_rate": 1.2164396139381029e-05,
"loss": 0.0016,
"step": 196
},
{
"epoch": 49.275862068965516,
"grad_norm": 0.07177734375,
"learning_rate": 1.2079116908177592e-05,
"loss": 0.0015,
"step": 197
},
{
"epoch": 49.55172413793103,
"grad_norm": 0.059814453125,
"learning_rate": 1.1993679344171973e-05,
"loss": 0.0014,
"step": 198
},
{
"epoch": 49.827586206896555,
"grad_norm": 0.1376953125,
"learning_rate": 1.190808995376545e-05,
"loss": 0.0018,
"step": 199
},
{
"epoch": 50.0,
"grad_norm": 0.0654296875,
"learning_rate": 1.1822355254921478e-05,
"loss": 0.0012,
"step": 200
},
{
"epoch": 50.0,
"eval_loss": 0.0016466762172058225,
"eval_runtime": 1.723,
"eval_samples_per_second": 1.741,
"eval_steps_per_second": 1.741,
"step": 200
}
],
"logging_steps": 1,
"max_steps": 400,
"num_input_tokens_seen": 0,
"num_train_epochs": 100,
"save_steps": 40,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.072322663530496e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}