CodeIsAbstract commited on
Commit
80f77ca
·
verified ·
1 Parent(s): 01bb5f3

Training in progress, step 9000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b70a13b36c334ea1f54ffb5f3083227095b25b5a7b40c9345fd167df916b4f37
3
  size 570000656
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:25daec079aa80cd442292d34ae9d873f8a9267ecd9f2aeef7b9a48b444c47ee1
3
  size 570000656
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cfba6df2db077359f1b6a3b4c158123cf247fbe3722ab6673662579a6d3ece88
3
  size 1622091
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:69fb1bb9b64b5f4a7bf23282e8dc9ea8c37def5ab69dfdd2f9b3c6bd5c8a324b
3
  size 1622091
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:007c0d0a2eb71534a8a1baf1f475fbb7a66ae8beddb78e51908b49e21c5a509a
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7b61ff27b6922c34153fbf03ac386fe0a756cd98733dd45d5a0ef95c8d5649c5
3
  size 14469
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:58c96086aeb31fae909f44e88cd0e5bbb7f83885f15203654fb87d48097549d3
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7cae364e7cf38097315c3ef3b0f622833c3b1da572a0b8fdaa4146ae71eba341
3
  size 14469
last-checkpoint/rng_state_2.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b5c22022412951b29e6b4330f406b1870d817188c07bdd9fa6a45c3da0d1f54d
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:de03bb38bd2f03e2b491e76ba5e85ebc6c1c932d6775bf6a719f2932b85d90b7
3
  size 14469
last-checkpoint/rng_state_3.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1202abbc6d8d2b5239bcc7f56278a3fd03bbbbb920178d0e0d6537473daa4dd2
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:badf05b4369ee9be3ff96687da8330f3881cd2466e19a797479011694b1e2fc0
3
  size 14469
last-checkpoint/rng_state_4.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4fc776887b6da6bd34428b5a85b7023e965964cac8547ee61d3ff0c605d1b3db
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ebc5b0944514c0301ec9d148f163a685abafbce8607513264faee4a1598baf22
3
  size 14469
last-checkpoint/rng_state_5.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4067b82a397b1b9cfb160a353dd480602084dc0ff6c8083d08871025370291dd
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:63ac613d410082080b68756a552c9d14327f087f1b6a185023aa73b220e29feb
3
  size 14469
last-checkpoint/rng_state_6.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bc6596052b9d37c1297136d9615160f12ea20996b7d0fc9eea96275cff5bc705
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:99e9305aa1cd8522d5a7c8505c182973bb47b262f9d5d1c69921c48050ab7328
3
  size 14469
last-checkpoint/rng_state_7.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:69301e8b8bfa56b7f3e0c8ea3e281698b644a7523f1065bd5823da4af4a55fd9
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0164255d679a6ba1b8dd248450ea3998324ef7163b69441493c8153561efabb1
3
  size 14469
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:64bf1268db145ba00529ee988b56673a5a34ca5dc516afb868dd3555f40e2ba2
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:459b45dd9801b618e07700636012d164748c45e8cc4fe00a1caecc86da8ca65b
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.7272727272727273,
6
  "eval_steps": 100,
7
- "global_step": 8000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
@@ -6248,6 +6248,786 @@
6248
  "eval_samples_per_second": 16.498,
6249
  "eval_steps_per_second": 0.917,
6250
  "step": 8000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
6251
  }
6252
  ],
6253
  "logging_steps": 10,
@@ -6267,7 +7047,7 @@
6267
  "attributes": {}
6268
  }
6269
  },
6270
- "total_flos": 7.2478781079552e+16,
6271
  "train_batch_size": 4,
6272
  "trial_name": null,
6273
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.8181818181818182,
6
  "eval_steps": 100,
7
+ "global_step": 9000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
 
6248
  "eval_samples_per_second": 16.498,
6249
  "eval_steps_per_second": 0.917,
6250
  "step": 8000
6251
+ },
6252
+ {
6253
+ "epoch": 0.7281818181818182,
6254
+ "grad_norm": 204158569283584.0,
6255
+ "learning_rate": 1.7159942866861132e-07,
6256
+ "loss": 26.29222412109375,
6257
+ "step": 8010
6258
+ },
6259
+ {
6260
+ "epoch": 0.7290909090909091,
6261
+ "grad_norm": 145085589094400.0,
6262
+ "learning_rate": 1.7052396883314152e-07,
6263
+ "loss": 26.959561157226563,
6264
+ "step": 8020
6265
+ },
6266
+ {
6267
+ "epoch": 0.73,
6268
+ "grad_norm": 110825029238784.0,
6269
+ "learning_rate": 1.6945119643228072e-07,
6270
+ "loss": 26.370242309570312,
6271
+ "step": 8030
6272
+ },
6273
+ {
6274
+ "epoch": 0.730909090909091,
6275
+ "grad_norm": 252334294695936.0,
6276
+ "learning_rate": 1.6838112021630356e-07,
6277
+ "loss": 26.4259765625,
6278
+ "step": 8040
6279
+ },
6280
+ {
6281
+ "epoch": 0.7318181818181818,
6282
+ "grad_norm": 193456450306048.0,
6283
+ "learning_rate": 1.673137489134921e-07,
6284
+ "loss": 26.351275634765624,
6285
+ "step": 8050
6286
+ },
6287
+ {
6288
+ "epoch": 0.7327272727272728,
6289
+ "grad_norm": 61600425836544.0,
6290
+ "learning_rate": 1.6624909123006575e-07,
6291
+ "loss": 26.925289916992188,
6292
+ "step": 8060
6293
+ },
6294
+ {
6295
+ "epoch": 0.7336363636363636,
6296
+ "grad_norm": 259621981782016.0,
6297
+ "learning_rate": 1.651871558501099e-07,
6298
+ "loss": 26.745242309570312,
6299
+ "step": 8070
6300
+ },
6301
+ {
6302
+ "epoch": 0.7345454545454545,
6303
+ "grad_norm": 150932784414720.0,
6304
+ "learning_rate": 1.6412795143550427e-07,
6305
+ "loss": 26.458816528320312,
6306
+ "step": 8080
6307
+ },
6308
+ {
6309
+ "epoch": 0.7354545454545455,
6310
+ "grad_norm": 522992664707072.0,
6311
+ "learning_rate": 1.6307148662585362e-07,
6312
+ "loss": 26.513919067382812,
6313
+ "step": 8090
6314
+ },
6315
+ {
6316
+ "epoch": 0.7363636363636363,
6317
+ "grad_norm": 129581780566016.0,
6318
+ "learning_rate": 1.6201777003841633e-07,
6319
+ "loss": 26.6354248046875,
6320
+ "step": 8100
6321
+ },
6322
+ {
6323
+ "epoch": 0.7363636363636363,
6324
+ "eval_loss": 26.260547637939453,
6325
+ "eval_runtime": 2.1543,
6326
+ "eval_samples_per_second": 16.711,
6327
+ "eval_steps_per_second": 0.928,
6328
+ "step": 8100
6329
+ },
6330
+ {
6331
+ "epoch": 0.7372727272727273,
6332
+ "grad_norm": 220818277662720.0,
6333
+ "learning_rate": 1.6096681026803443e-07,
6334
+ "loss": 26.771890258789064,
6335
+ "step": 8110
6336
+ },
6337
+ {
6338
+ "epoch": 0.7381818181818182,
6339
+ "grad_norm": 389124204789760.0,
6340
+ "learning_rate": 1.5991861588706306e-07,
6341
+ "loss": 26.528866577148438,
6342
+ "step": 8120
6343
+ },
6344
+ {
6345
+ "epoch": 0.7390909090909091,
6346
+ "grad_norm": 421828568809472.0,
6347
+ "learning_rate": 1.588731954453018e-07,
6348
+ "loss": 26.294219970703125,
6349
+ "step": 8130
6350
+ },
6351
+ {
6352
+ "epoch": 0.74,
6353
+ "grad_norm": 186962057101312.0,
6354
+ "learning_rate": 1.5783055746992312e-07,
6355
+ "loss": 26.486737060546876,
6356
+ "step": 8140
6357
+ },
6358
+ {
6359
+ "epoch": 0.740909090909091,
6360
+ "grad_norm": 320954349649920.0,
6361
+ "learning_rate": 1.5679071046540432e-07,
6362
+ "loss": 26.416116333007814,
6363
+ "step": 8150
6364
+ },
6365
+ {
6366
+ "epoch": 0.7418181818181818,
6367
+ "grad_norm": 448088032411648.0,
6368
+ "learning_rate": 1.5575366291345759e-07,
6369
+ "loss": 26.369647216796874,
6370
+ "step": 8160
6371
+ },
6372
+ {
6373
+ "epoch": 0.7427272727272727,
6374
+ "grad_norm": 405070747271168.0,
6375
+ "learning_rate": 1.547194232729604e-07,
6376
+ "loss": 26.7183837890625,
6377
+ "step": 8170
6378
+ },
6379
+ {
6380
+ "epoch": 0.7436363636363637,
6381
+ "grad_norm": 392587995250688.0,
6382
+ "learning_rate": 1.536879999798874e-07,
6383
+ "loss": 26.57523193359375,
6384
+ "step": 8180
6385
+ },
6386
+ {
6387
+ "epoch": 0.7445454545454545,
6388
+ "grad_norm": 414031860989952.0,
6389
+ "learning_rate": 1.5265940144724114e-07,
6390
+ "loss": 26.745343017578126,
6391
+ "step": 8190
6392
+ },
6393
+ {
6394
+ "epoch": 0.7454545454545455,
6395
+ "grad_norm": 151567047065600.0,
6396
+ "learning_rate": 1.516336360649834e-07,
6397
+ "loss": 26.580767822265624,
6398
+ "step": 8200
6399
+ },
6400
+ {
6401
+ "epoch": 0.7454545454545455,
6402
+ "eval_loss": 26.26454734802246,
6403
+ "eval_runtime": 2.1459,
6404
+ "eval_samples_per_second": 16.776,
6405
+ "eval_steps_per_second": 0.932,
6406
+ "step": 8200
6407
+ },
6408
+ {
6409
+ "epoch": 0.7463636363636363,
6410
+ "grad_norm": 140819075956736.0,
6411
+ "learning_rate": 1.506107121999664e-07,
6412
+ "loss": 26.278732299804688,
6413
+ "step": 8210
6414
+ },
6415
+ {
6416
+ "epoch": 0.7472727272727273,
6417
+ "grad_norm": 66263875321856.0,
6418
+ "learning_rate": 1.4959063819586593e-07,
6419
+ "loss": 26.610507202148437,
6420
+ "step": 8220
6421
+ },
6422
+ {
6423
+ "epoch": 0.7481818181818182,
6424
+ "grad_norm": 438402814050304.0,
6425
+ "learning_rate": 1.4857342237311138e-07,
6426
+ "loss": 26.609988403320312,
6427
+ "step": 8230
6428
+ },
6429
+ {
6430
+ "epoch": 0.7490909090909091,
6431
+ "grad_norm": 509375739330560.0,
6432
+ "learning_rate": 1.4755907302881927e-07,
6433
+ "loss": 26.591030883789063,
6434
+ "step": 8240
6435
+ },
6436
+ {
6437
+ "epoch": 0.75,
6438
+ "grad_norm": 469766544293888.0,
6439
+ "learning_rate": 1.465475984367253e-07,
6440
+ "loss": 26.608944702148438,
6441
+ "step": 8250
6442
+ },
6443
+ {
6444
+ "epoch": 0.7509090909090909,
6445
+ "grad_norm": 205435751628800.0,
6446
+ "learning_rate": 1.4553900684711623e-07,
6447
+ "loss": 26.571286010742188,
6448
+ "step": 8260
6449
+ },
6450
+ {
6451
+ "epoch": 0.7518181818181818,
6452
+ "grad_norm": 146254860386304.0,
6453
+ "learning_rate": 1.4453330648676338e-07,
6454
+ "loss": 26.6401611328125,
6455
+ "step": 8270
6456
+ },
6457
+ {
6458
+ "epoch": 0.7527272727272727,
6459
+ "grad_norm": 406260688093184.0,
6460
+ "learning_rate": 1.435305055588552e-07,
6461
+ "loss": 26.502618408203126,
6462
+ "step": 8280
6463
+ },
6464
+ {
6465
+ "epoch": 0.7536363636363637,
6466
+ "grad_norm": 163714019885056.0,
6467
+ "learning_rate": 1.425306122429305e-07,
6468
+ "loss": 26.30799560546875,
6469
+ "step": 8290
6470
+ },
6471
+ {
6472
+ "epoch": 0.7545454545454545,
6473
+ "grad_norm": 265974758506496.0,
6474
+ "learning_rate": 1.4153363469481107e-07,
6475
+ "loss": 26.497518920898436,
6476
+ "step": 8300
6477
+ },
6478
+ {
6479
+ "epoch": 0.7545454545454545,
6480
+ "eval_loss": 26.25794792175293,
6481
+ "eval_runtime": 2.1488,
6482
+ "eval_samples_per_second": 16.753,
6483
+ "eval_steps_per_second": 0.931,
6484
+ "step": 8300
6485
+ },
6486
+ {
6487
+ "epoch": 0.7554545454545455,
6488
+ "grad_norm": 144185525010432.0,
6489
+ "learning_rate": 1.4053958104653612e-07,
6490
+ "loss": 26.401416015625,
6491
+ "step": 8310
6492
+ },
6493
+ {
6494
+ "epoch": 0.7563636363636363,
6495
+ "grad_norm": 80316861513728.0,
6496
+ "learning_rate": 1.395484594062954e-07,
6497
+ "loss": 26.3766357421875,
6498
+ "step": 8320
6499
+ },
6500
+ {
6501
+ "epoch": 0.7572727272727273,
6502
+ "grad_norm": 405346531147776.0,
6503
+ "learning_rate": 1.3856027785836333e-07,
6504
+ "loss": 26.344137573242186,
6505
+ "step": 8330
6506
+ },
6507
+ {
6508
+ "epoch": 0.7581818181818182,
6509
+ "grad_norm": 155818091610112.0,
6510
+ "learning_rate": 1.3757504446303248e-07,
6511
+ "loss": 26.66131591796875,
6512
+ "step": 8340
6513
+ },
6514
+ {
6515
+ "epoch": 0.759090909090909,
6516
+ "grad_norm": 264115809419264.0,
6517
+ "learning_rate": 1.365927672565486e-07,
6518
+ "loss": 26.72258605957031,
6519
+ "step": 8350
6520
+ },
6521
+ {
6522
+ "epoch": 0.76,
6523
+ "grad_norm": 289586693537792.0,
6524
+ "learning_rate": 1.356134542510448e-07,
6525
+ "loss": 26.394635009765626,
6526
+ "step": 8360
6527
+ },
6528
+ {
6529
+ "epoch": 0.7609090909090909,
6530
+ "grad_norm": 74874424918016.0,
6531
+ "learning_rate": 1.3463711343447547e-07,
6532
+ "loss": 26.273269653320312,
6533
+ "step": 8370
6534
+ },
6535
+ {
6536
+ "epoch": 0.7618181818181818,
6537
+ "grad_norm": 576587481219072.0,
6538
+ "learning_rate": 1.336637527705529e-07,
6539
+ "loss": 26.7587890625,
6540
+ "step": 8380
6541
+ },
6542
+ {
6543
+ "epoch": 0.7627272727272727,
6544
+ "grad_norm": 132786539200512.0,
6545
+ "learning_rate": 1.3269338019868003e-07,
6546
+ "loss": 26.890203857421874,
6547
+ "step": 8390
6548
+ },
6549
+ {
6550
+ "epoch": 0.7636363636363637,
6551
+ "grad_norm": 113306773749760.0,
6552
+ "learning_rate": 1.3172600363388752e-07,
6553
+ "loss": 26.88782958984375,
6554
+ "step": 8400
6555
+ },
6556
+ {
6557
+ "epoch": 0.7636363636363637,
6558
+ "eval_loss": 26.261314392089844,
6559
+ "eval_runtime": 2.1523,
6560
+ "eval_samples_per_second": 16.726,
6561
+ "eval_steps_per_second": 0.929,
6562
+ "step": 8400
6563
+ },
6564
+ {
6565
+ "epoch": 0.7645454545454545,
6566
+ "grad_norm": 287690733912064.0,
6567
+ "learning_rate": 1.3076163096676828e-07,
6568
+ "loss": 25.92532958984375,
6569
+ "step": 8410
6570
+ },
6571
+ {
6572
+ "epoch": 0.7654545454545455,
6573
+ "grad_norm": 170665340567552.0,
6574
+ "learning_rate": 1.2980027006341371e-07,
6575
+ "loss": 26.285894775390624,
6576
+ "step": 8420
6577
+ },
6578
+ {
6579
+ "epoch": 0.7663636363636364,
6580
+ "grad_norm": 293886157127680.0,
6581
+ "learning_rate": 1.288419287653485e-07,
6582
+ "loss": 26.6665771484375,
6583
+ "step": 8430
6584
+ },
6585
+ {
6586
+ "epoch": 0.7672727272727272,
6587
+ "grad_norm": 211919927508992.0,
6588
+ "learning_rate": 1.2788661488946788e-07,
6589
+ "loss": 26.39056396484375,
6590
+ "step": 8440
6591
+ },
6592
+ {
6593
+ "epoch": 0.7681818181818182,
6594
+ "grad_norm": 160566647717888.0,
6595
+ "learning_rate": 1.2693433622797346e-07,
6596
+ "loss": 26.330914306640626,
6597
+ "step": 8450
6598
+ },
6599
+ {
6600
+ "epoch": 0.769090909090909,
6601
+ "grad_norm": 168821155430400.0,
6602
+ "learning_rate": 1.2598510054830885e-07,
6603
+ "loss": 26.57433166503906,
6604
+ "step": 8460
6605
+ },
6606
+ {
6607
+ "epoch": 0.77,
6608
+ "grad_norm": 341319708835840.0,
6609
+ "learning_rate": 1.250389155930976e-07,
6610
+ "loss": 26.557040405273437,
6611
+ "step": 8470
6612
+ },
6613
+ {
6614
+ "epoch": 0.7709090909090909,
6615
+ "grad_norm": 291579591917568.0,
6616
+ "learning_rate": 1.240957890800793e-07,
6617
+ "loss": 26.230010986328125,
6618
+ "step": 8480
6619
+ },
6620
+ {
6621
+ "epoch": 0.7718181818181818,
6622
+ "grad_norm": 246938574258176.0,
6623
+ "learning_rate": 1.2315572870204665e-07,
6624
+ "loss": 26.432733154296876,
6625
+ "step": 8490
6626
+ },
6627
+ {
6628
+ "epoch": 0.7727272727272727,
6629
+ "grad_norm": 275942924615680.0,
6630
+ "learning_rate": 1.2221874212678295e-07,
6631
+ "loss": 26.655825805664062,
6632
+ "step": 8500
6633
+ },
6634
+ {
6635
+ "epoch": 0.7727272727272727,
6636
+ "eval_loss": 26.262447357177734,
6637
+ "eval_runtime": 2.1593,
6638
+ "eval_samples_per_second": 16.672,
6639
+ "eval_steps_per_second": 0.926,
6640
+ "step": 8500
6641
+ },
6642
+ {
6643
+ "epoch": 0.7736363636363637,
6644
+ "grad_norm": 252627107446784.0,
6645
+ "learning_rate": 1.212848369969996e-07,
6646
+ "loss": 26.5862548828125,
6647
+ "step": 8510
6648
+ },
6649
+ {
6650
+ "epoch": 0.7745454545454545,
6651
+ "grad_norm": 349064071741440.0,
6652
+ "learning_rate": 1.2035402093027298e-07,
6653
+ "loss": 26.767044067382812,
6654
+ "step": 8520
6655
+ },
6656
+ {
6657
+ "epoch": 0.7754545454545455,
6658
+ "grad_norm": 215884400427008.0,
6659
+ "learning_rate": 1.1942630151898353e-07,
6660
+ "loss": 26.34154357910156,
6661
+ "step": 8530
6662
+ },
6663
+ {
6664
+ "epoch": 0.7763636363636364,
6665
+ "grad_norm": 109126453559296.0,
6666
+ "learning_rate": 1.1850168633025321e-07,
6667
+ "loss": 26.6445556640625,
6668
+ "step": 8540
6669
+ },
6670
+ {
6671
+ "epoch": 0.7772727272727272,
6672
+ "grad_norm": 59685176606720.0,
6673
+ "learning_rate": 1.1758018290588328e-07,
6674
+ "loss": 26.464410400390626,
6675
+ "step": 8550
6676
+ },
6677
+ {
6678
+ "epoch": 0.7781818181818182,
6679
+ "grad_norm": 336345364955136.0,
6680
+ "learning_rate": 1.1666179876229382e-07,
6681
+ "loss": 26.180218505859376,
6682
+ "step": 8560
6683
+ },
6684
+ {
6685
+ "epoch": 0.7790909090909091,
6686
+ "grad_norm": 258242475196416.0,
6687
+ "learning_rate": 1.1574654139046169e-07,
6688
+ "loss": 26.63001708984375,
6689
+ "step": 8570
6690
+ },
6691
+ {
6692
+ "epoch": 0.78,
6693
+ "grad_norm": 308295034208256.0,
6694
+ "learning_rate": 1.1483441825585982e-07,
6695
+ "loss": 26.5321044921875,
6696
+ "step": 8580
6697
+ },
6698
+ {
6699
+ "epoch": 0.7809090909090909,
6700
+ "grad_norm": 256095578750976.0,
6701
+ "learning_rate": 1.139254367983955e-07,
6702
+ "loss": 26.616192626953126,
6703
+ "step": 8590
6704
+ },
6705
+ {
6706
+ "epoch": 0.7818181818181819,
6707
+ "grad_norm": 433377970749440.0,
6708
+ "learning_rate": 1.1301960443235137e-07,
6709
+ "loss": 26.703271484375,
6710
+ "step": 8600
6711
+ },
6712
+ {
6713
+ "epoch": 0.7818181818181819,
6714
+ "eval_loss": 26.259233474731445,
6715
+ "eval_runtime": 2.1684,
6716
+ "eval_samples_per_second": 16.602,
6717
+ "eval_steps_per_second": 0.922,
6718
+ "step": 8600
6719
+ },
6720
+ {
6721
+ "epoch": 0.7827272727272727,
6722
+ "grad_norm": 91433688104960.0,
6723
+ "learning_rate": 1.1211692854632292e-07,
6724
+ "loss": 26.381759643554688,
6725
+ "step": 8610
6726
+ },
6727
+ {
6728
+ "epoch": 0.7836363636363637,
6729
+ "grad_norm": 323897308217344.0,
6730
+ "learning_rate": 1.1121741650315975e-07,
6731
+ "loss": 26.4834228515625,
6732
+ "step": 8620
6733
+ },
6734
+ {
6735
+ "epoch": 0.7845454545454545,
6736
+ "grad_norm": 615513239584768.0,
6737
+ "learning_rate": 1.1032107563990489e-07,
6738
+ "loss": 26.638949584960937,
6739
+ "step": 8630
6740
+ },
6741
+ {
6742
+ "epoch": 0.7854545454545454,
6743
+ "grad_norm": 144044713836544.0,
6744
+ "learning_rate": 1.0942791326773481e-07,
6745
+ "loss": 26.390069580078126,
6746
+ "step": 8640
6747
+ },
6748
+ {
6749
+ "epoch": 0.7863636363636364,
6750
+ "grad_norm": 226855877607424.0,
6751
+ "learning_rate": 1.085379366719002e-07,
6752
+ "loss": 26.581057739257812,
6753
+ "step": 8650
6754
+ },
6755
+ {
6756
+ "epoch": 0.7872727272727272,
6757
+ "grad_norm": 750627542007808.0,
6758
+ "learning_rate": 1.0765115311166634e-07,
6759
+ "loss": 26.551568603515626,
6760
+ "step": 8660
6761
+ },
6762
+ {
6763
+ "epoch": 0.7881818181818182,
6764
+ "grad_norm": 386196177944576.0,
6765
+ "learning_rate": 1.0676756982025403e-07,
6766
+ "loss": 26.428280639648438,
6767
+ "step": 8670
6768
+ },
6769
+ {
6770
+ "epoch": 0.7890909090909091,
6771
+ "grad_norm": 159711546572800.0,
6772
+ "learning_rate": 1.0588719400478002e-07,
6773
+ "loss": 26.626437377929687,
6774
+ "step": 8680
6775
+ },
6776
+ {
6777
+ "epoch": 0.79,
6778
+ "grad_norm": 170563821633536.0,
6779
+ "learning_rate": 1.0501003284619908e-07,
6780
+ "loss": 26.475860595703125,
6781
+ "step": 8690
6782
+ },
6783
+ {
6784
+ "epoch": 0.7909090909090909,
6785
+ "grad_norm": 134558968184832.0,
6786
+ "learning_rate": 1.041360934992449e-07,
6787
+ "loss": 26.157559204101563,
6788
+ "step": 8700
6789
+ },
6790
+ {
6791
+ "epoch": 0.7909090909090909,
6792
+ "eval_loss": 26.25774574279785,
6793
+ "eval_runtime": 2.1872,
6794
+ "eval_samples_per_second": 16.46,
6795
+ "eval_steps_per_second": 0.914,
6796
+ "step": 8700
6797
+ },
6798
+ {
6799
+ "epoch": 0.7918181818181819,
6800
+ "grad_norm": 72320622264320.0,
6801
+ "learning_rate": 1.0326538309237198e-07,
6802
+ "loss": 26.85352478027344,
6803
+ "step": 8710
6804
+ },
6805
+ {
6806
+ "epoch": 0.7927272727272727,
6807
+ "grad_norm": 481769501491200.0,
6808
+ "learning_rate": 1.0239790872769688e-07,
6809
+ "loss": 26.115414428710938,
6810
+ "step": 8720
6811
+ },
6812
+ {
6813
+ "epoch": 0.7936363636363636,
6814
+ "grad_norm": 342039317184512.0,
6815
+ "learning_rate": 1.0153367748094126e-07,
6816
+ "loss": 26.53397216796875,
6817
+ "step": 8730
6818
+ },
6819
+ {
6820
+ "epoch": 0.7945454545454546,
6821
+ "grad_norm": 404055557931008.0,
6822
+ "learning_rate": 1.006726964013736e-07,
6823
+ "loss": 26.39664306640625,
6824
+ "step": 8740
6825
+ },
6826
+ {
6827
+ "epoch": 0.7954545454545454,
6828
+ "grad_norm": 81613387988992.0,
6829
+ "learning_rate": 9.98149725117512e-08,
6830
+ "loss": 26.064663696289063,
6831
+ "step": 8750
6832
+ },
6833
+ {
6834
+ "epoch": 0.7963636363636364,
6835
+ "grad_norm": 350235490516992.0,
6836
+ "learning_rate": 9.896051280826451e-08,
6837
+ "loss": 26.903762817382812,
6838
+ "step": 8760
6839
+ },
6840
+ {
6841
+ "epoch": 0.7972727272727272,
6842
+ "grad_norm": 459837653647360.0,
6843
+ "learning_rate": 9.810932426047802e-08,
6844
+ "loss": 26.57601318359375,
6845
+ "step": 8770
6846
+ },
6847
+ {
6848
+ "epoch": 0.7981818181818182,
6849
+ "grad_norm": 147279679848448.0,
6850
+ "learning_rate": 9.72614138112749e-08,
6851
+ "loss": 26.590640258789062,
6852
+ "step": 8780
6853
+ },
6854
+ {
6855
+ "epoch": 0.7990909090909091,
6856
+ "grad_norm": 417567155945472.0,
6857
+ "learning_rate": 9.641678837679983e-08,
6858
+ "loss": 26.296502685546876,
6859
+ "step": 8790
6860
+ },
6861
+ {
6862
+ "epoch": 0.8,
6863
+ "grad_norm": 84892301918208.0,
6864
+ "learning_rate": 9.557545484640273e-08,
6865
+ "loss": 26.586184692382812,
6866
+ "step": 8800
6867
+ },
6868
+ {
6869
+ "epoch": 0.8,
6870
+ "eval_loss": 26.26275634765625,
6871
+ "eval_runtime": 2.1775,
6872
+ "eval_samples_per_second": 16.532,
6873
+ "eval_steps_per_second": 0.918,
6874
+ "step": 8800
6875
+ },
6876
+ {
6877
+ "epoch": 0.8009090909090909,
6878
+ "grad_norm": 709094000295936.0,
6879
+ "learning_rate": 9.4737420082582e-08,
6880
+ "loss": 26.503372192382812,
6881
+ "step": 8810
6882
+ },
6883
+ {
6884
+ "epoch": 0.8018181818181818,
6885
+ "grad_norm": 214880770588672.0,
6886
+ "learning_rate": 9.390269092092956e-08,
6887
+ "loss": 26.727926635742186,
6888
+ "step": 8820
6889
+ },
6890
+ {
6891
+ "epoch": 0.8027272727272727,
6892
+ "grad_norm": 206503084556288.0,
6893
+ "learning_rate": 9.307127417007444e-08,
6894
+ "loss": 26.764566040039064,
6895
+ "step": 8830
6896
+ },
6897
+ {
6898
+ "epoch": 0.8036363636363636,
6899
+ "grad_norm": 105237830434816.0,
6900
+ "learning_rate": 9.224317661162684e-08,
6901
+ "loss": 26.60999755859375,
6902
+ "step": 8840
6903
+ },
6904
+ {
6905
+ "epoch": 0.8045454545454546,
6906
+ "grad_norm": 101385144107008.0,
6907
+ "learning_rate": 9.141840500012437e-08,
6908
+ "loss": 26.486932373046876,
6909
+ "step": 8850
6910
+ },
6911
+ {
6912
+ "epoch": 0.8054545454545454,
6913
+ "grad_norm": 195066056409088.0,
6914
+ "learning_rate": 9.059696606297479e-08,
6915
+ "loss": 26.113775634765624,
6916
+ "step": 8860
6917
+ },
6918
+ {
6919
+ "epoch": 0.8063636363636364,
6920
+ "grad_norm": 116232594391040.0,
6921
+ "learning_rate": 8.977886650040289e-08,
6922
+ "loss": 26.361734008789064,
6923
+ "step": 8870
6924
+ },
6925
+ {
6926
+ "epoch": 0.8072727272727273,
6927
+ "grad_norm": 459080464334848.0,
6928
+ "learning_rate": 8.89641129853952e-08,
6929
+ "loss": 26.5644287109375,
6930
+ "step": 8880
6931
+ },
6932
+ {
6933
+ "epoch": 0.8081818181818182,
6934
+ "grad_norm": 279257364299776.0,
6935
+ "learning_rate": 8.81527121636454e-08,
6936
+ "loss": 26.242138671875,
6937
+ "step": 8890
6938
+ },
6939
+ {
6940
+ "epoch": 0.8090909090909091,
6941
+ "grad_norm": 177674492313600.0,
6942
+ "learning_rate": 8.734467065350021e-08,
6943
+ "loss": 26.649420166015624,
6944
+ "step": 8900
6945
+ },
6946
+ {
6947
+ "epoch": 0.8090909090909091,
6948
+ "eval_loss": 26.255714416503906,
6949
+ "eval_runtime": 2.1572,
6950
+ "eval_samples_per_second": 16.689,
6951
+ "eval_steps_per_second": 0.927,
6952
+ "step": 8900
6953
+ },
6954
+ {
6955
+ "epoch": 0.81,
6956
+ "grad_norm": 408893402382336.0,
6957
+ "learning_rate": 8.65399950459057e-08,
6958
+ "loss": 26.4176025390625,
6959
+ "step": 8910
6960
+ },
6961
+ {
6962
+ "epoch": 0.8109090909090909,
6963
+ "grad_norm": 166783998754816.0,
6964
+ "learning_rate": 8.573869190435335e-08,
6965
+ "loss": 26.493902587890624,
6966
+ "step": 8920
6967
+ },
6968
+ {
6969
+ "epoch": 0.8118181818181818,
6970
+ "grad_norm": 176515757113344.0,
6971
+ "learning_rate": 8.4940767764826e-08,
6972
+ "loss": 26.102850341796874,
6973
+ "step": 8930
6974
+ },
6975
+ {
6976
+ "epoch": 0.8127272727272727,
6977
+ "grad_norm": 542467724148736.0,
6978
+ "learning_rate": 8.414622913574549e-08,
6979
+ "loss": 26.501849365234374,
6980
+ "step": 8940
6981
+ },
6982
+ {
6983
+ "epoch": 0.8136363636363636,
6984
+ "grad_norm": 216477290463232.0,
6985
+ "learning_rate": 8.3355082497919e-08,
6986
+ "loss": 26.50646057128906,
6987
+ "step": 8950
6988
+ },
6989
+ {
6990
+ "epoch": 0.8145454545454546,
6991
+ "grad_norm": 122593944272896.0,
6992
+ "learning_rate": 8.256733430448637e-08,
6993
+ "loss": 26.44368896484375,
6994
+ "step": 8960
6995
+ },
6996
+ {
6997
+ "epoch": 0.8154545454545454,
6998
+ "grad_norm": 182341729255424.0,
6999
+ "learning_rate": 8.178299098086678e-08,
7000
+ "loss": 26.42027893066406,
7001
+ "step": 8970
7002
+ },
7003
+ {
7004
+ "epoch": 0.8163636363636364,
7005
+ "grad_norm": 612390999687168.0,
7006
+ "learning_rate": 8.100205892470785e-08,
7007
+ "loss": 27.214886474609376,
7008
+ "step": 8980
7009
+ },
7010
+ {
7011
+ "epoch": 0.8172727272727273,
7012
+ "grad_norm": 336913676369920.0,
7013
+ "learning_rate": 8.022454450583183e-08,
7014
+ "loss": 26.410107421875,
7015
+ "step": 8990
7016
+ },
7017
+ {
7018
+ "epoch": 0.8181818181818182,
7019
+ "grad_norm": 358478572945408.0,
7020
+ "learning_rate": 7.945045406618462e-08,
7021
+ "loss": 26.294644165039063,
7022
+ "step": 9000
7023
+ },
7024
+ {
7025
+ "epoch": 0.8181818181818182,
7026
+ "eval_loss": 26.25908088684082,
7027
+ "eval_runtime": 2.195,
7028
+ "eval_samples_per_second": 16.401,
7029
+ "eval_steps_per_second": 0.911,
7030
+ "step": 9000
7031
  }
7032
  ],
7033
  "logging_steps": 10,
 
7047
  "attributes": {}
7048
  }
7049
  },
7050
+ "total_flos": 8.1538628714496e+16,
7051
  "train_batch_size": 4,
7052
  "trial_name": null,
7053
  "trial_params": null