CodeIsAbstract commited on
Commit
80d1c52
·
verified ·
1 Parent(s): 3101aef

Training in progress, step 50, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e219b25b7e3609e604ef05ade6d200dabd377e65247e60e3e2ff5ed1c7e25fe1
3
  size 1738460416
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2ee88c21b9bdff6d676565da3d78bc24646e37fec67cf8fdfc88ba63eaf89e49
3
  size 1738460416
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cb5c19a9e3e14de1d661eba59716d3a9e1a9a87a5be68b944fb729f292c5937b
3
  size 3477327340
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bb03d531654389e8b69bb5f8d65bf87f5aab7501a7e7cc0b22cb201d2abaa419
3
  size 3477327340
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f4a9f217e852f439efa6bd32fde98d6867f11aa6ea13ddc021ba10af6a0b0934
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:01f9a0f7843a37be87edd23f4e88aa93b38b95cc2c07503eeb1cf2e4632453a2
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ac56030360eaf7d09a44b289120bcd685e39fa9a366361e9c512debf4fa01791
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f6ab4a60dabf5285d62294f6dabdfb5eda3b8675d8c862f026b8ef4fa5a2952a
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -11,112 +11,112 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
- "grad_norm": 67.5,
15
- "learning_rate": 0.0004,
16
- "loss": 271.8493,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
- "grad_norm": 68.5,
22
- "learning_rate": 0.0009000000000000001,
23
- "loss": 208.6483,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.05,
28
- "eval_loss": 7.974327087402344,
29
- "eval_runtime": 6.9602,
30
- "eval_samples_per_second": 19.252,
31
- "eval_steps_per_second": 1.006,
32
  "step": 10
33
  },
34
  {
35
  "epoch": 0.075,
36
- "grad_norm": 114.5,
37
- "learning_rate": 0.0009989068136093873,
38
- "loss": 190.7281,
39
  "step": 15
40
  },
41
  {
42
  "epoch": 0.1,
43
- "grad_norm": 26.25,
44
- "learning_rate": 0.0009944739353007343,
45
- "loss": 188.7951,
46
  "step": 20
47
  },
48
  {
49
  "epoch": 0.1,
50
- "eval_loss": 7.880503177642822,
51
- "eval_runtime": 6.6198,
52
- "eval_samples_per_second": 20.242,
53
- "eval_steps_per_second": 1.057,
54
  "step": 20
55
  },
56
  {
57
  "epoch": 0.125,
58
- "grad_norm": 23.75,
59
- "learning_rate": 0.000986663298624003,
60
- "loss": 186.3658,
61
  "step": 25
62
  },
63
  {
64
  "epoch": 0.15,
65
- "grad_norm": 14.5,
66
- "learning_rate": 0.0009755282581475768,
67
- "loss": 185.2524,
68
  "step": 30
69
  },
70
  {
71
  "epoch": 0.15,
72
- "eval_loss": 7.70925760269165,
73
- "eval_runtime": 6.8441,
74
- "eval_samples_per_second": 19.579,
75
- "eval_steps_per_second": 1.023,
76
  "step": 30
77
  },
78
  {
79
  "epoch": 0.175,
80
- "grad_norm": 20.75,
81
- "learning_rate": 0.0009611448774886924,
82
- "loss": 182.743,
83
  "step": 35
84
  },
85
  {
86
  "epoch": 0.2,
87
- "grad_norm": 146.0,
88
- "learning_rate": 0.000943611409721806,
89
- "loss": 181.0595,
90
  "step": 40
91
  },
92
  {
93
  "epoch": 0.2,
94
- "eval_loss": 7.680881023406982,
95
- "eval_runtime": 6.8778,
96
- "eval_samples_per_second": 19.483,
97
- "eval_steps_per_second": 1.018,
98
  "step": 40
99
  },
100
  {
101
  "epoch": 0.225,
102
- "grad_norm": 14336.0,
103
- "learning_rate": 0.0009230476262104677,
104
- "loss": 183.6445,
105
  "step": 45
106
  },
107
  {
108
  "epoch": 0.25,
109
- "grad_norm": 10176.0,
110
- "learning_rate": 0.0008995939984474624,
111
- "loss": 192.1855,
112
  "step": 50
113
  },
114
  {
115
  "epoch": 0.25,
116
- "eval_loss": 8.385082244873047,
117
- "eval_runtime": 6.7705,
118
- "eval_samples_per_second": 19.792,
119
- "eval_steps_per_second": 1.034,
120
  "step": 50
121
  }
122
  ],
@@ -137,8 +137,8 @@
137
  "attributes": {}
138
  }
139
  },
140
- "total_flos": 1.9622204484354048e+17,
141
- "train_batch_size": 5,
142
  "trial_name": null,
143
  "trial_params": null
144
  }
 
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
+ "grad_norm": 27.5,
15
+ "learning_rate": 4e-05,
16
+ "loss": 71.893,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
+ "grad_norm": 11.5,
22
+ "learning_rate": 9e-05,
23
+ "loss": 62.6505,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.05,
28
+ "eval_loss": 9.905916213989258,
29
+ "eval_runtime": 15.7082,
30
+ "eval_samples_per_second": 34.25,
31
+ "eval_steps_per_second": 2.292,
32
  "step": 10
33
  },
34
  {
35
  "epoch": 0.075,
36
+ "grad_norm": 9.625,
37
+ "learning_rate": 9.989068136093873e-05,
38
+ "loss": 57.5435,
39
  "step": 15
40
  },
41
  {
42
  "epoch": 0.1,
43
+ "grad_norm": 6.84375,
44
+ "learning_rate": 9.944739353007344e-05,
45
+ "loss": 53.1338,
46
  "step": 20
47
  },
48
  {
49
  "epoch": 0.1,
50
+ "eval_loss": 8.45786190032959,
51
+ "eval_runtime": 16.0113,
52
+ "eval_samples_per_second": 33.601,
53
+ "eval_steps_per_second": 2.248,
54
  "step": 20
55
  },
56
  {
57
  "epoch": 0.125,
58
+ "grad_norm": 4.8125,
59
+ "learning_rate": 9.86663298624003e-05,
60
+ "loss": 49.413,
61
  "step": 25
62
  },
63
  {
64
  "epoch": 0.15,
65
+ "grad_norm": 4.96875,
66
+ "learning_rate": 9.755282581475769e-05,
67
+ "loss": 46.6506,
68
  "step": 30
69
  },
70
  {
71
  "epoch": 0.15,
72
+ "eval_loss": 7.606866836547852,
73
+ "eval_runtime": 16.4027,
74
+ "eval_samples_per_second": 32.799,
75
+ "eval_steps_per_second": 2.195,
76
  "step": 30
77
  },
78
  {
79
  "epoch": 0.175,
80
+ "grad_norm": 4.875,
81
+ "learning_rate": 9.611448774886924e-05,
82
+ "loss": 44.8354,
83
  "step": 35
84
  },
85
  {
86
  "epoch": 0.2,
87
+ "grad_norm": 3.625,
88
+ "learning_rate": 9.43611409721806e-05,
89
+ "loss": 43.8419,
90
  "step": 40
91
  },
92
  {
93
  "epoch": 0.2,
94
+ "eval_loss": 7.288437843322754,
95
+ "eval_runtime": 16.1342,
96
+ "eval_samples_per_second": 33.345,
97
+ "eval_steps_per_second": 2.231,
98
  "step": 40
99
  },
100
  {
101
  "epoch": 0.225,
102
+ "grad_norm": 5.0,
103
+ "learning_rate": 9.230476262104677e-05,
104
+ "loss": 43.2838,
105
  "step": 45
106
  },
107
  {
108
  "epoch": 0.25,
109
+ "grad_norm": 4.40625,
110
+ "learning_rate": 8.995939984474624e-05,
111
+ "loss": 42.7483,
112
  "step": 50
113
  },
114
  {
115
  "epoch": 0.25,
116
+ "eval_loss": 7.132974147796631,
117
+ "eval_runtime": 16.0666,
118
+ "eval_samples_per_second": 33.486,
119
+ "eval_steps_per_second": 2.241,
120
  "step": 50
121
  }
122
  ],
 
137
  "attributes": {}
138
  }
139
  },
140
+ "total_flos": 3.6791633313792e+16,
141
+ "train_batch_size": 15,
142
  "trial_name": null,
143
  "trial_params": null
144
  }
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:855e4e426c5eafaf63f7a009322eb06b70910e4a4bee1286781bd91f0ef7fc5c
3
  size 5841
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7ee00a42c6101902398b3f09cb8e094a34fe74ca1ef85d5e6e740ab7c96f6947
3
  size 5841