File size: 10,304 Bytes
ace6112
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
{
  "best_global_step": null,
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 3.0,
  "eval_steps": 200,
  "global_step": 159,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.09450679267572357,
      "grad_norm": 62.428157806396484,
      "learning_rate": 1.3333333333333336e-07,
      "loss": 2.397551918029785,
      "num_input_tokens_seen": 331280,
      "step": 5,
      "train_runtime": 75.5535,
      "train_tokens_per_second": 4384.707
    },
    {
      "epoch": 0.18901358535144713,
      "grad_norm": 52.543094635009766,
      "learning_rate": 3.0000000000000004e-07,
      "loss": 2.324905776977539,
      "num_input_tokens_seen": 676656,
      "step": 10,
      "train_runtime": 148.9016,
      "train_tokens_per_second": 4544.316
    },
    {
      "epoch": 0.2835203780271707,
      "grad_norm": 37.104923248291016,
      "learning_rate": 4.666666666666667e-07,
      "loss": 2.2128017425537108,
      "num_input_tokens_seen": 1014384,
      "step": 15,
      "train_runtime": 226.2481,
      "train_tokens_per_second": 4483.503
    },
    {
      "epoch": 0.37802717070289427,
      "grad_norm": 18.56186294555664,
      "learning_rate": 6.333333333333334e-07,
      "loss": 1.7389423370361328,
      "num_input_tokens_seen": 1337152,
      "step": 20,
      "train_runtime": 296.1134,
      "train_tokens_per_second": 4515.675
    },
    {
      "epoch": 0.47253396337861786,
      "grad_norm": 9.207618713378906,
      "learning_rate": 8.000000000000001e-07,
      "loss": 1.481886100769043,
      "num_input_tokens_seen": 1682800,
      "step": 25,
      "train_runtime": 372.6792,
      "train_tokens_per_second": 4515.412
    },
    {
      "epoch": 0.5670407560543415,
      "grad_norm": 6.93226957321167,
      "learning_rate": 9.666666666666668e-07,
      "loss": 1.2308213233947753,
      "num_input_tokens_seen": 2021168,
      "step": 30,
      "train_runtime": 447.3153,
      "train_tokens_per_second": 4518.441
    },
    {
      "epoch": 0.6615475487300649,
      "grad_norm": 5.4049072265625,
      "learning_rate": 1.1333333333333334e-06,
      "loss": 1.0612786293029786,
      "num_input_tokens_seen": 2376256,
      "step": 35,
      "train_runtime": 524.7446,
      "train_tokens_per_second": 4528.405
    },
    {
      "epoch": 0.7560543414057885,
      "grad_norm": 5.19791841506958,
      "learning_rate": 1.3e-06,
      "loss": 0.9478996276855469,
      "num_input_tokens_seen": 2692720,
      "step": 40,
      "train_runtime": 589.2975,
      "train_tokens_per_second": 4569.373
    },
    {
      "epoch": 0.8505611340815121,
      "grad_norm": 4.551699161529541,
      "learning_rate": 1.4666666666666669e-06,
      "loss": 0.8566524505615234,
      "num_input_tokens_seen": 3067824,
      "step": 45,
      "train_runtime": 670.2604,
      "train_tokens_per_second": 4577.063
    },
    {
      "epoch": 0.9450679267572357,
      "grad_norm": 3.7889368534088135,
      "learning_rate": 1.6333333333333335e-06,
      "loss": 0.8128791809082031,
      "num_input_tokens_seen": 3413184,
      "step": 50,
      "train_runtime": 743.4782,
      "train_tokens_per_second": 4590.833
    },
    {
      "epoch": 1.0378027170702895,
      "grad_norm": 3.7340147495269775,
      "learning_rate": 1.8000000000000001e-06,
      "loss": 0.7371133804321289,
      "num_input_tokens_seen": 3743824,
      "step": 55,
      "train_runtime": 813.931,
      "train_tokens_per_second": 4599.682
    },
    {
      "epoch": 1.132309509746013,
      "grad_norm": 3.7434566020965576,
      "learning_rate": 1.9666666666666668e-06,
      "loss": 0.6849042415618897,
      "num_input_tokens_seen": 4064576,
      "step": 60,
      "train_runtime": 879.9344,
      "train_tokens_per_second": 4619.18
    },
    {
      "epoch": 1.2268163024217364,
      "grad_norm": 3.699002504348755,
      "learning_rate": 2.133333333333334e-06,
      "loss": 0.6428406715393067,
      "num_input_tokens_seen": 4407728,
      "step": 65,
      "train_runtime": 954.1755,
      "train_tokens_per_second": 4619.41
    },
    {
      "epoch": 1.3213230950974602,
      "grad_norm": 3.816338300704956,
      "learning_rate": 2.3000000000000004e-06,
      "loss": 0.6510684967041016,
      "num_input_tokens_seen": 4753632,
      "step": 70,
      "train_runtime": 1024.7054,
      "train_tokens_per_second": 4639.023
    },
    {
      "epoch": 1.4158298877731836,
      "grad_norm": 3.3174662590026855,
      "learning_rate": 2.466666666666667e-06,
      "loss": 0.6197010040283203,
      "num_input_tokens_seen": 5117712,
      "step": 75,
      "train_runtime": 1104.1382,
      "train_tokens_per_second": 4635.029
    },
    {
      "epoch": 1.5103366804489071,
      "grad_norm": 3.7685296535491943,
      "learning_rate": 2.6333333333333332e-06,
      "loss": 0.5941993236541748,
      "num_input_tokens_seen": 5442464,
      "step": 80,
      "train_runtime": 1171.423,
      "train_tokens_per_second": 4646.028
    },
    {
      "epoch": 1.6048434731246308,
      "grad_norm": 3.62023663520813,
      "learning_rate": 2.8000000000000003e-06,
      "loss": 0.5909689903259278,
      "num_input_tokens_seen": 5773168,
      "step": 85,
      "train_runtime": 1241.4596,
      "train_tokens_per_second": 4650.307
    },
    {
      "epoch": 1.6993502658003545,
      "grad_norm": 3.4737110137939453,
      "learning_rate": 2.9666666666666673e-06,
      "loss": 0.5710773944854737,
      "num_input_tokens_seen": 6094640,
      "step": 90,
      "train_runtime": 1308.3829,
      "train_tokens_per_second": 4658.147
    },
    {
      "epoch": 1.793857058476078,
      "grad_norm": 3.37959885597229,
      "learning_rate": 3.133333333333334e-06,
      "loss": 0.559010124206543,
      "num_input_tokens_seen": 6445904,
      "step": 95,
      "train_runtime": 1383.7365,
      "train_tokens_per_second": 4658.332
    },
    {
      "epoch": 1.8883638511518015,
      "grad_norm": 3.294055938720703,
      "learning_rate": 3.3000000000000006e-06,
      "loss": 0.5400856018066407,
      "num_input_tokens_seen": 6778864,
      "step": 100,
      "train_runtime": 1452.3221,
      "train_tokens_per_second": 4667.604
    },
    {
      "epoch": 1.9828706438275252,
      "grad_norm": 3.642498731613159,
      "learning_rate": 3.4666666666666672e-06,
      "loss": 0.5734038352966309,
      "num_input_tokens_seen": 7128848,
      "step": 105,
      "train_runtime": 1527.0146,
      "train_tokens_per_second": 4668.487
    },
    {
      "epoch": 2.075605434140579,
      "grad_norm": 2.930677652359009,
      "learning_rate": 3.633333333333334e-06,
      "loss": 0.40219688415527344,
      "num_input_tokens_seen": 7457808,
      "step": 110,
      "train_runtime": 1593.9447,
      "train_tokens_per_second": 4678.837
    },
    {
      "epoch": 2.1701122268163022,
      "grad_norm": 3.647855043411255,
      "learning_rate": 3.8000000000000005e-06,
      "loss": 0.3830972194671631,
      "num_input_tokens_seen": 7779600,
      "step": 115,
      "train_runtime": 1663.7125,
      "train_tokens_per_second": 4676.048
    },
    {
      "epoch": 2.264619019492026,
      "grad_norm": 3.5375828742980957,
      "learning_rate": 3.966666666666667e-06,
      "loss": 0.3788310050964355,
      "num_input_tokens_seen": 8111072,
      "step": 120,
      "train_runtime": 1734.8264,
      "train_tokens_per_second": 4675.437
    },
    {
      "epoch": 2.3591258121677496,
      "grad_norm": 3.1107232570648193,
      "learning_rate": 4.133333333333333e-06,
      "loss": 0.359296989440918,
      "num_input_tokens_seen": 8440624,
      "step": 125,
      "train_runtime": 1803.6532,
      "train_tokens_per_second": 4679.738
    },
    {
      "epoch": 2.453632604843473,
      "grad_norm": 3.2923574447631836,
      "learning_rate": 4.3e-06,
      "loss": 0.35688660144805906,
      "num_input_tokens_seen": 8809056,
      "step": 130,
      "train_runtime": 1882.4762,
      "train_tokens_per_second": 4679.505
    },
    {
      "epoch": 2.5481393975191966,
      "grad_norm": 3.4984912872314453,
      "learning_rate": 4.4666666666666665e-06,
      "loss": 0.3418281555175781,
      "num_input_tokens_seen": 9149056,
      "step": 135,
      "train_runtime": 1956.4703,
      "train_tokens_per_second": 4676.307
    },
    {
      "epoch": 2.6426461901949203,
      "grad_norm": 3.569697380065918,
      "learning_rate": 4.633333333333334e-06,
      "loss": 0.3628645420074463,
      "num_input_tokens_seen": 9505088,
      "step": 140,
      "train_runtime": 2033.4441,
      "train_tokens_per_second": 4674.379
    },
    {
      "epoch": 2.7371529828706436,
      "grad_norm": 3.633371353149414,
      "learning_rate": 4.800000000000001e-06,
      "loss": 0.38395237922668457,
      "num_input_tokens_seen": 9850976,
      "step": 145,
      "train_runtime": 2106.6321,
      "train_tokens_per_second": 4676.173
    },
    {
      "epoch": 2.8316597755463673,
      "grad_norm": 3.469475269317627,
      "learning_rate": 4.966666666666667e-06,
      "loss": 0.3653783559799194,
      "num_input_tokens_seen": 10190224,
      "step": 150,
      "train_runtime": 2179.9706,
      "train_tokens_per_second": 4674.478
    },
    {
      "epoch": 2.926166568222091,
      "grad_norm": 3.961359977722168,
      "learning_rate": 2.9341204441673267e-06,
      "loss": 0.4053683280944824,
      "num_input_tokens_seen": 10530976,
      "step": 155,
      "train_runtime": 2252.5079,
      "train_tokens_per_second": 4675.223
    },
    {
      "epoch": 3.0,
      "eval_loss": 0.5101717114448547,
      "eval_runtime": 12.5731,
      "eval_samples_per_second": 28.394,
      "eval_steps_per_second": 14.237,
      "num_input_tokens_seen": 10792432,
      "step": 159
    }
  ],
  "logging_steps": 5,
  "max_steps": 159,
  "num_input_tokens_seen": 10792432,
  "num_train_epochs": 3,
  "save_steps": 200,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": true
      },
      "attributes": {}
    }
  },
  "total_flos": 7.236796920532828e+17,
  "train_batch_size": 2,
  "trial_name": null,
  "trial_params": null
}