CodeIsAbstract commited on
Commit
b97ec67
·
verified ·
1 Parent(s): 3182b3c

Training in progress, step 8000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a000fbccdb35daf2266aee700b6416df5d706b2e1ab338bdaf2865bd45ae9cba
3
  size 570000656
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b70a13b36c334ea1f54ffb5f3083227095b25b5a7b40c9345fd167df916b4f37
3
  size 570000656
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8eb6acce7ccf2cb8305165f2fd9c13795130a0c57087b32b61bb62aecab4b395
3
  size 1622091
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cfba6df2db077359f1b6a3b4c158123cf247fbe3722ab6673662579a6d3ece88
3
  size 1622091
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d5920ac4f0bba99259462ed725e7e621beec906b352c1c25b8030b235ade5e09
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:007c0d0a2eb71534a8a1baf1f475fbb7a66ae8beddb78e51908b49e21c5a509a
3
  size 14469
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b4804038d40e072898353507105f7ec5bb84f06c500c6c77f9b23c1ffba69da2
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:58c96086aeb31fae909f44e88cd0e5bbb7f83885f15203654fb87d48097549d3
3
  size 14469
last-checkpoint/rng_state_2.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:13efeffdbbe1ff32e561220c2dda4e0981a0eea5d6d98be9a53ce5e4516700b4
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b5c22022412951b29e6b4330f406b1870d817188c07bdd9fa6a45c3da0d1f54d
3
  size 14469
last-checkpoint/rng_state_3.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2378f6335467d6824d5991555117a905cfacd66d8e20475c21b6217632b4ac67
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1202abbc6d8d2b5239bcc7f56278a3fd03bbbbb920178d0e0d6537473daa4dd2
3
  size 14469
last-checkpoint/rng_state_4.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:55025d46de2da78115d789b4623359037ec52573b190c40bc6dd0fc9edee6cb2
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4fc776887b6da6bd34428b5a85b7023e965964cac8547ee61d3ff0c605d1b3db
3
  size 14469
last-checkpoint/rng_state_5.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b493d4f290fe42ef5f1784d5efbf107e6b51d92117c6d516dbead5fb235bd991
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4067b82a397b1b9cfb160a353dd480602084dc0ff6c8083d08871025370291dd
3
  size 14469
last-checkpoint/rng_state_6.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:55a739c31e021e2247343b9ee6a1dd0907ecba3b8b539617e181504bf40d05fd
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bc6596052b9d37c1297136d9615160f12ea20996b7d0fc9eea96275cff5bc705
3
  size 14469
last-checkpoint/rng_state_7.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2a27be9081fd95a72cd55c9d8dae191778ab5451c500377cd2773cecbb45418f
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:69301e8b8bfa56b7f3e0c8ea3e281698b644a7523f1065bd5823da4af4a55fd9
3
  size 14469
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fb3660dc7c29e236f64dc7b388f5a9bcf2201e9e232665f64d728ff2de7b4a50
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:64bf1268db145ba00529ee988b56673a5a34ca5dc516afb868dd3555f40e2ba2
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.6363636363636364,
6
  "eval_steps": 100,
7
- "global_step": 7000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
@@ -5468,6 +5468,786 @@
5468
  "eval_samples_per_second": 16.559,
5469
  "eval_steps_per_second": 0.92,
5470
  "step": 7000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
5471
  }
5472
  ],
5473
  "logging_steps": 10,
@@ -5487,7 +6267,7 @@
5487
  "attributes": {}
5488
  }
5489
  },
5490
- "total_flos": 6.3418933444608e+16,
5491
  "train_batch_size": 4,
5492
  "trial_name": null,
5493
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.7272727272727273,
6
  "eval_steps": 100,
7
+ "global_step": 8000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
 
5468
  "eval_samples_per_second": 16.559,
5469
  "eval_steps_per_second": 0.92,
5470
  "step": 7000
5471
+ },
5472
+ {
5473
+ "epoch": 0.6372727272727273,
5474
+ "grad_norm": 208354400010240.0,
5475
+ "learning_rate": 2.9112412463330807e-07,
5476
+ "loss": 26.38590087890625,
5477
+ "step": 7010
5478
+ },
5479
+ {
5480
+ "epoch": 0.6381818181818182,
5481
+ "grad_norm": 615660476432384.0,
5482
+ "learning_rate": 2.8982755588934925e-07,
5483
+ "loss": 26.374246215820314,
5484
+ "step": 7020
5485
+ },
5486
+ {
5487
+ "epoch": 0.639090909090909,
5488
+ "grad_norm": 227794512510976.0,
5489
+ "learning_rate": 2.885327014573484e-07,
5490
+ "loss": 26.50068359375,
5491
+ "step": 7030
5492
+ },
5493
+ {
5494
+ "epoch": 0.64,
5495
+ "grad_norm": 649978070433792.0,
5496
+ "learning_rate": 2.8723957189903495e-07,
5497
+ "loss": 26.3570556640625,
5498
+ "step": 7040
5499
+ },
5500
+ {
5501
+ "epoch": 0.6409090909090909,
5502
+ "grad_norm": 92747755159552.0,
5503
+ "learning_rate": 2.859481777620688e-07,
5504
+ "loss": 26.351593017578125,
5505
+ "step": 7050
5506
+ },
5507
+ {
5508
+ "epoch": 0.6418181818181818,
5509
+ "grad_norm": 547461831589888.0,
5510
+ "learning_rate": 2.8465852957995485e-07,
5511
+ "loss": 26.504672241210937,
5512
+ "step": 7060
5513
+ },
5514
+ {
5515
+ "epoch": 0.6427272727272727,
5516
+ "grad_norm": 256846124285952.0,
5517
+ "learning_rate": 2.833706378719559e-07,
5518
+ "loss": 27.03226318359375,
5519
+ "step": 7070
5520
+ },
5521
+ {
5522
+ "epoch": 0.6436363636363637,
5523
+ "grad_norm": 146097339105280.0,
5524
+ "learning_rate": 2.8208451314300876e-07,
5525
+ "loss": 26.550949096679688,
5526
+ "step": 7080
5527
+ },
5528
+ {
5529
+ "epoch": 0.6445454545454545,
5530
+ "grad_norm": 463059382435840.0,
5531
+ "learning_rate": 2.80800165883637e-07,
5532
+ "loss": 26.586752319335936,
5533
+ "step": 7090
5534
+ },
5535
+ {
5536
+ "epoch": 0.6454545454545455,
5537
+ "grad_norm": 184904549662720.0,
5538
+ "learning_rate": 2.7951760656986625e-07,
5539
+ "loss": 26.651223754882814,
5540
+ "step": 7100
5541
+ },
5542
+ {
5543
+ "epoch": 0.6454545454545455,
5544
+ "eval_loss": 26.276838302612305,
5545
+ "eval_runtime": 2.1813,
5546
+ "eval_samples_per_second": 16.504,
5547
+ "eval_steps_per_second": 0.917,
5548
+ "step": 7100
5549
+ },
5550
+ {
5551
+ "epoch": 0.6463636363636364,
5552
+ "grad_norm": 497082469187584.0,
5553
+ "learning_rate": 2.782368456631378e-07,
5554
+ "loss": 26.286236572265626,
5555
+ "step": 7110
5556
+ },
5557
+ {
5558
+ "epoch": 0.6472727272727272,
5559
+ "grad_norm": 164335598960640.0,
5560
+ "learning_rate": 2.769578936102245e-07,
5561
+ "loss": 26.465399169921874,
5562
+ "step": 7120
5563
+ },
5564
+ {
5565
+ "epoch": 0.6481818181818182,
5566
+ "grad_norm": 223688372781056.0,
5567
+ "learning_rate": 2.756807608431447e-07,
5568
+ "loss": 26.540838623046874,
5569
+ "step": 7130
5570
+ },
5571
+ {
5572
+ "epoch": 0.649090909090909,
5573
+ "grad_norm": 362925608927232.0,
5574
+ "learning_rate": 2.744054577790774e-07,
5575
+ "loss": 26.485153198242188,
5576
+ "step": 7140
5577
+ },
5578
+ {
5579
+ "epoch": 0.65,
5580
+ "grad_norm": 118669761839104.0,
5581
+ "learning_rate": 2.731319948202776e-07,
5582
+ "loss": 26.7018798828125,
5583
+ "step": 7150
5584
+ },
5585
+ {
5586
+ "epoch": 0.6509090909090909,
5587
+ "grad_norm": 440564222787584.0,
5588
+ "learning_rate": 2.7186038235399027e-07,
5589
+ "loss": 26.294155883789063,
5590
+ "step": 7160
5591
+ },
5592
+ {
5593
+ "epoch": 0.6518181818181819,
5594
+ "grad_norm": 391212498419712.0,
5595
+ "learning_rate": 2.705906307523673e-07,
5596
+ "loss": 26.423309326171875,
5597
+ "step": 7170
5598
+ },
5599
+ {
5600
+ "epoch": 0.6527272727272727,
5601
+ "grad_norm": 291606871670784.0,
5602
+ "learning_rate": 2.693227503723819e-07,
5603
+ "loss": 26.983016967773438,
5604
+ "step": 7180
5605
+ },
5606
+ {
5607
+ "epoch": 0.6536363636363637,
5608
+ "grad_norm": 239193305382912.0,
5609
+ "learning_rate": 2.6805675155574425e-07,
5610
+ "loss": 26.53931884765625,
5611
+ "step": 7190
5612
+ },
5613
+ {
5614
+ "epoch": 0.6545454545454545,
5615
+ "grad_norm": 95832472813568.0,
5616
+ "learning_rate": 2.667926446288169e-07,
5617
+ "loss": 26.326837158203126,
5618
+ "step": 7200
5619
+ },
5620
+ {
5621
+ "epoch": 0.6545454545454545,
5622
+ "eval_loss": 26.273149490356445,
5623
+ "eval_runtime": 2.1822,
5624
+ "eval_samples_per_second": 16.497,
5625
+ "eval_steps_per_second": 0.916,
5626
+ "step": 7200
5627
+ },
5628
+ {
5629
+ "epoch": 0.6554545454545454,
5630
+ "grad_norm": 246679919919104.0,
5631
+ "learning_rate": 2.655304399025312e-07,
5632
+ "loss": 26.533935546875,
5633
+ "step": 7210
5634
+ },
5635
+ {
5636
+ "epoch": 0.6563636363636364,
5637
+ "grad_norm": 521899461312512.0,
5638
+ "learning_rate": 2.6427014767230294e-07,
5639
+ "loss": 26.514251708984375,
5640
+ "step": 7220
5641
+ },
5642
+ {
5643
+ "epoch": 0.6572727272727272,
5644
+ "grad_norm": 228885098659840.0,
5645
+ "learning_rate": 2.630117782179475e-07,
5646
+ "loss": 26.712460327148438,
5647
+ "step": 7230
5648
+ },
5649
+ {
5650
+ "epoch": 0.6581818181818182,
5651
+ "grad_norm": 271884381847552.0,
5652
+ "learning_rate": 2.6175534180359813e-07,
5653
+ "loss": 26.149929809570313,
5654
+ "step": 7240
5655
+ },
5656
+ {
5657
+ "epoch": 0.6590909090909091,
5658
+ "grad_norm": 474217908797440.0,
5659
+ "learning_rate": 2.605008486776195e-07,
5660
+ "loss": 26.453692626953124,
5661
+ "step": 7250
5662
+ },
5663
+ {
5664
+ "epoch": 0.66,
5665
+ "grad_norm": 357043785433088.0,
5666
+ "learning_rate": 2.5924830907252614e-07,
5667
+ "loss": 26.58966064453125,
5668
+ "step": 7260
5669
+ },
5670
+ {
5671
+ "epoch": 0.6609090909090909,
5672
+ "grad_norm": 641387800297472.0,
5673
+ "learning_rate": 2.5799773320489827e-07,
5674
+ "loss": 26.886062622070312,
5675
+ "step": 7270
5676
+ },
5677
+ {
5678
+ "epoch": 0.6618181818181819,
5679
+ "grad_norm": 117462062333952.0,
5680
+ "learning_rate": 2.5674913127529867e-07,
5681
+ "loss": 26.308395385742188,
5682
+ "step": 7280
5683
+ },
5684
+ {
5685
+ "epoch": 0.6627272727272727,
5686
+ "grad_norm": 351057137893376.0,
5687
+ "learning_rate": 2.555025134681886e-07,
5688
+ "loss": 26.34556884765625,
5689
+ "step": 7290
5690
+ },
5691
+ {
5692
+ "epoch": 0.6636363636363637,
5693
+ "grad_norm": 148489820438528.0,
5694
+ "learning_rate": 2.542578899518463e-07,
5695
+ "loss": 26.660372924804687,
5696
+ "step": 7300
5697
+ },
5698
+ {
5699
+ "epoch": 0.6636363636363637,
5700
+ "eval_loss": 26.275470733642578,
5701
+ "eval_runtime": 2.1726,
5702
+ "eval_samples_per_second": 16.57,
5703
+ "eval_steps_per_second": 0.921,
5704
+ "step": 7300
5705
+ },
5706
+ {
5707
+ "epoch": 0.6645454545454546,
5708
+ "grad_norm": 291709548232704.0,
5709
+ "learning_rate": 2.5301527087828287e-07,
5710
+ "loss": 26.54521789550781,
5711
+ "step": 7310
5712
+ },
5713
+ {
5714
+ "epoch": 0.6654545454545454,
5715
+ "grad_norm": 360566128377856.0,
5716
+ "learning_rate": 2.5177466638315945e-07,
5717
+ "loss": 26.633468627929688,
5718
+ "step": 7320
5719
+ },
5720
+ {
5721
+ "epoch": 0.6663636363636364,
5722
+ "grad_norm": 262026844700672.0,
5723
+ "learning_rate": 2.505360865857054e-07,
5724
+ "loss": 26.330783081054687,
5725
+ "step": 7330
5726
+ },
5727
+ {
5728
+ "epoch": 0.6672727272727272,
5729
+ "grad_norm": 365513158950912.0,
5730
+ "learning_rate": 2.492995415886349e-07,
5731
+ "loss": 26.3236572265625,
5732
+ "step": 7340
5733
+ },
5734
+ {
5735
+ "epoch": 0.6681818181818182,
5736
+ "grad_norm": 80057695469568.0,
5737
+ "learning_rate": 2.480650414780653e-07,
5738
+ "loss": 26.489703369140624,
5739
+ "step": 7350
5740
+ },
5741
+ {
5742
+ "epoch": 0.6690909090909091,
5743
+ "grad_norm": 269574847070208.0,
5744
+ "learning_rate": 2.4683259632343364e-07,
5745
+ "loss": 26.589083862304687,
5746
+ "step": 7360
5747
+ },
5748
+ {
5749
+ "epoch": 0.67,
5750
+ "grad_norm": 106464077152256.0,
5751
+ "learning_rate": 2.456022161774164e-07,
5752
+ "loss": 26.390362548828126,
5753
+ "step": 7370
5754
+ },
5755
+ {
5756
+ "epoch": 0.6709090909090909,
5757
+ "grad_norm": 200526067138560.0,
5758
+ "learning_rate": 2.4437391107584556e-07,
5759
+ "loss": 26.3364990234375,
5760
+ "step": 7380
5761
+ },
5762
+ {
5763
+ "epoch": 0.6718181818181819,
5764
+ "grad_norm": 174280209858560.0,
5765
+ "learning_rate": 2.4314769103762784e-07,
5766
+ "loss": 26.455654907226563,
5767
+ "step": 7390
5768
+ },
5769
+ {
5770
+ "epoch": 0.6727272727272727,
5771
+ "grad_norm": 114393173983232.0,
5772
+ "learning_rate": 2.4192356606466303e-07,
5773
+ "loss": 26.521585083007814,
5774
+ "step": 7400
5775
+ },
5776
+ {
5777
+ "epoch": 0.6727272727272727,
5778
+ "eval_loss": 26.27696418762207,
5779
+ "eval_runtime": 2.1578,
5780
+ "eval_samples_per_second": 16.684,
5781
+ "eval_steps_per_second": 0.927,
5782
+ "step": 7400
5783
+ },
5784
+ {
5785
+ "epoch": 0.6736363636363636,
5786
+ "grad_norm": 203887600467968.0,
5787
+ "learning_rate": 2.407015461417616e-07,
5788
+ "loss": 26.397149658203126,
5789
+ "step": 7410
5790
+ },
5791
+ {
5792
+ "epoch": 0.6745454545454546,
5793
+ "grad_norm": 152426476732416.0,
5794
+ "learning_rate": 2.394816412365642e-07,
5795
+ "loss": 26.610260009765625,
5796
+ "step": 7420
5797
+ },
5798
+ {
5799
+ "epoch": 0.6754545454545454,
5800
+ "grad_norm": 281785892077568.0,
5801
+ "learning_rate": 2.3826386129945976e-07,
5802
+ "loss": 26.886895751953126,
5803
+ "step": 7430
5804
+ },
5805
+ {
5806
+ "epoch": 0.6763636363636364,
5807
+ "grad_norm": 123647452774400.0,
5808
+ "learning_rate": 2.3704821626350468e-07,
5809
+ "loss": 26.532232666015624,
5810
+ "step": 7440
5811
+ },
5812
+ {
5813
+ "epoch": 0.6772727272727272,
5814
+ "grad_norm": 195468189499392.0,
5815
+ "learning_rate": 2.358347160443412e-07,
5816
+ "loss": 26.519247436523436,
5817
+ "step": 7450
5818
+ },
5819
+ {
5820
+ "epoch": 0.6781818181818182,
5821
+ "grad_norm": 55197703340032.0,
5822
+ "learning_rate": 2.3462337054011732e-07,
5823
+ "loss": 26.758151245117187,
5824
+ "step": 7460
5825
+ },
5826
+ {
5827
+ "epoch": 0.6790909090909091,
5828
+ "grad_norm": 67209904783360.0,
5829
+ "learning_rate": 2.334141896314057e-07,
5830
+ "loss": 26.347998046875,
5831
+ "step": 7470
5832
+ },
5833
+ {
5834
+ "epoch": 0.68,
5835
+ "grad_norm": 134699796135936.0,
5836
+ "learning_rate": 2.3220718318112281e-07,
5837
+ "loss": 26.302090454101563,
5838
+ "step": 7480
5839
+ },
5840
+ {
5841
+ "epoch": 0.6809090909090909,
5842
+ "grad_norm": 224456467283968.0,
5843
+ "learning_rate": 2.310023610344492e-07,
5844
+ "loss": 26.276641845703125,
5845
+ "step": 7490
5846
+ },
5847
+ {
5848
+ "epoch": 0.6818181818181818,
5849
+ "grad_norm": 669328441606144.0,
5850
+ "learning_rate": 2.2979973301874795e-07,
5851
+ "loss": 26.991085815429688,
5852
+ "step": 7500
5853
+ },
5854
+ {
5855
+ "epoch": 0.6818181818181818,
5856
+ "eval_loss": 26.273746490478516,
5857
+ "eval_runtime": 2.155,
5858
+ "eval_samples_per_second": 16.705,
5859
+ "eval_steps_per_second": 0.928,
5860
+ "step": 7500
5861
+ },
5862
+ {
5863
+ "epoch": 0.6827272727272727,
5864
+ "grad_norm": 246346388865024.0,
5865
+ "learning_rate": 2.2859930894348594e-07,
5866
+ "loss": 26.169650268554687,
5867
+ "step": 7510
5868
+ },
5869
+ {
5870
+ "epoch": 0.6836363636363636,
5871
+ "grad_norm": 117372857876480.0,
5872
+ "learning_rate": 2.2740109860015304e-07,
5873
+ "loss": 26.467178344726562,
5874
+ "step": 7520
5875
+ },
5876
+ {
5877
+ "epoch": 0.6845454545454546,
5878
+ "grad_norm": 186215957528576.0,
5879
+ "learning_rate": 2.2620511176218255e-07,
5880
+ "loss": 26.1698486328125,
5881
+ "step": 7530
5882
+ },
5883
+ {
5884
+ "epoch": 0.6854545454545454,
5885
+ "grad_norm": 167226934034432.0,
5886
+ "learning_rate": 2.250113581848706e-07,
5887
+ "loss": 26.436212158203126,
5888
+ "step": 7540
5889
+ },
5890
+ {
5891
+ "epoch": 0.6863636363636364,
5892
+ "grad_norm": 54176792969216.0,
5893
+ "learning_rate": 2.2381984760529816e-07,
5894
+ "loss": 26.699081420898438,
5895
+ "step": 7550
5896
+ },
5897
+ {
5898
+ "epoch": 0.6872727272727273,
5899
+ "grad_norm": 131126349791232.0,
5900
+ "learning_rate": 2.2263058974225023e-07,
5901
+ "loss": 26.650469970703124,
5902
+ "step": 7560
5903
+ },
5904
+ {
5905
+ "epoch": 0.6881818181818182,
5906
+ "grad_norm": 190212038721536.0,
5907
+ "learning_rate": 2.214435942961377e-07,
5908
+ "loss": 26.493695068359376,
5909
+ "step": 7570
5910
+ },
5911
+ {
5912
+ "epoch": 0.6890909090909091,
5913
+ "grad_norm": 263704901844992.0,
5914
+ "learning_rate": 2.2025887094891655e-07,
5915
+ "loss": 26.46141662597656,
5916
+ "step": 7580
5917
+ },
5918
+ {
5919
+ "epoch": 0.69,
5920
+ "grad_norm": 391329167179776.0,
5921
+ "learning_rate": 2.19076429364011e-07,
5922
+ "loss": 26.3736083984375,
5923
+ "step": 7590
5924
+ },
5925
+ {
5926
+ "epoch": 0.6909090909090909,
5927
+ "grad_norm": 119184780427264.0,
5928
+ "learning_rate": 2.178962791862333e-07,
5929
+ "loss": 26.546969604492187,
5930
+ "step": 7600
5931
+ },
5932
+ {
5933
+ "epoch": 0.6909090909090909,
5934
+ "eval_loss": 26.27129364013672,
5935
+ "eval_runtime": 2.1527,
5936
+ "eval_samples_per_second": 16.723,
5937
+ "eval_steps_per_second": 0.929,
5938
+ "step": 7600
5939
+ },
5940
+ {
5941
+ "epoch": 0.6918181818181818,
5942
+ "grad_norm": 177234845368320.0,
5943
+ "learning_rate": 2.1671843004170483e-07,
5944
+ "loss": 26.3050048828125,
5945
+ "step": 7610
5946
+ },
5947
+ {
5948
+ "epoch": 0.6927272727272727,
5949
+ "grad_norm": 323850130685952.0,
5950
+ "learning_rate": 2.1554289153777933e-07,
5951
+ "loss": 26.890570068359374,
5952
+ "step": 7620
5953
+ },
5954
+ {
5955
+ "epoch": 0.6936363636363636,
5956
+ "grad_norm": 153877135491072.0,
5957
+ "learning_rate": 2.1436967326296213e-07,
5958
+ "loss": 26.495651245117188,
5959
+ "step": 7630
5960
+ },
5961
+ {
5962
+ "epoch": 0.6945454545454546,
5963
+ "grad_norm": 196137852076032.0,
5964
+ "learning_rate": 2.1319878478683396e-07,
5965
+ "loss": 26.359036254882813,
5966
+ "step": 7640
5967
+ },
5968
+ {
5969
+ "epoch": 0.6954545454545454,
5970
+ "grad_norm": 99828335902720.0,
5971
+ "learning_rate": 2.1203023565997173e-07,
5972
+ "loss": 26.25531005859375,
5973
+ "step": 7650
5974
+ },
5975
+ {
5976
+ "epoch": 0.6963636363636364,
5977
+ "grad_norm": 566579267895296.0,
5978
+ "learning_rate": 2.1086403541387144e-07,
5979
+ "loss": 26.096768188476563,
5980
+ "step": 7660
5981
+ },
5982
+ {
5983
+ "epoch": 0.6972727272727273,
5984
+ "grad_norm": 206705417781248.0,
5985
+ "learning_rate": 2.097001935608692e-07,
5986
+ "loss": 26.354949951171875,
5987
+ "step": 7670
5988
+ },
5989
+ {
5990
+ "epoch": 0.6981818181818182,
5991
+ "grad_norm": 88147518029824.0,
5992
+ "learning_rate": 2.085387195940651e-07,
5993
+ "loss": 26.522039794921874,
5994
+ "step": 7680
5995
+ },
5996
+ {
5997
+ "epoch": 0.6990909090909091,
5998
+ "grad_norm": 223890320130048.0,
5999
+ "learning_rate": 2.073796229872451e-07,
6000
+ "loss": 26.2290283203125,
6001
+ "step": 7690
6002
+ },
6003
+ {
6004
+ "epoch": 0.7,
6005
+ "grad_norm": 142860158500864.0,
6006
+ "learning_rate": 2.0622291319480316e-07,
6007
+ "loss": 26.3935791015625,
6008
+ "step": 7700
6009
+ },
6010
+ {
6011
+ "epoch": 0.7,
6012
+ "eval_loss": 26.27055549621582,
6013
+ "eval_runtime": 2.1622,
6014
+ "eval_samples_per_second": 16.649,
6015
+ "eval_steps_per_second": 0.925,
6016
+ "step": 7700
6017
+ },
6018
+ {
6019
+ "epoch": 0.7009090909090909,
6020
+ "grad_norm": 76660552499200.0,
6021
+ "learning_rate": 2.0506859965166546e-07,
6022
+ "loss": 26.559854125976564,
6023
+ "step": 7710
6024
+ },
6025
+ {
6026
+ "epoch": 0.7018181818181818,
6027
+ "grad_norm": 165078661857280.0,
6028
+ "learning_rate": 2.039166917732123e-07,
6029
+ "loss": 26.336550903320312,
6030
+ "step": 7720
6031
+ },
6032
+ {
6033
+ "epoch": 0.7027272727272728,
6034
+ "grad_norm": 131228850192384.0,
6035
+ "learning_rate": 2.02767198955202e-07,
6036
+ "loss": 26.307232666015626,
6037
+ "step": 7730
6038
+ },
6039
+ {
6040
+ "epoch": 0.7036363636363636,
6041
+ "grad_norm": 158765814906880.0,
6042
+ "learning_rate": 2.0162013057369327e-07,
6043
+ "loss": 26.472689819335937,
6044
+ "step": 7740
6045
+ },
6046
+ {
6047
+ "epoch": 0.7045454545454546,
6048
+ "grad_norm": 415826083577856.0,
6049
+ "learning_rate": 2.0047549598497064e-07,
6050
+ "loss": 26.57115478515625,
6051
+ "step": 7750
6052
+ },
6053
+ {
6054
+ "epoch": 0.7054545454545454,
6055
+ "grad_norm": 340710863667200.0,
6056
+ "learning_rate": 1.9933330452546575e-07,
6057
+ "loss": 26.334005737304686,
6058
+ "step": 7760
6059
+ },
6060
+ {
6061
+ "epoch": 0.7063636363636364,
6062
+ "grad_norm": 200871073808384.0,
6063
+ "learning_rate": 1.9819356551168304e-07,
6064
+ "loss": 26.425982666015624,
6065
+ "step": 7770
6066
+ },
6067
+ {
6068
+ "epoch": 0.7072727272727273,
6069
+ "grad_norm": 326121094643712.0,
6070
+ "learning_rate": 1.9705628824012315e-07,
6071
+ "loss": 26.586672973632812,
6072
+ "step": 7780
6073
+ },
6074
+ {
6075
+ "epoch": 0.7081818181818181,
6076
+ "grad_norm": 311439185149952.0,
6077
+ "learning_rate": 1.9592148198720655e-07,
6078
+ "loss": 26.54600830078125,
6079
+ "step": 7790
6080
+ },
6081
+ {
6082
+ "epoch": 0.7090909090909091,
6083
+ "grad_norm": 154627949461504.0,
6084
+ "learning_rate": 1.9478915600919877e-07,
6085
+ "loss": 26.687026977539062,
6086
+ "step": 7800
6087
+ },
6088
+ {
6089
+ "epoch": 0.7090909090909091,
6090
+ "eval_loss": 26.266042709350586,
6091
+ "eval_runtime": 2.1833,
6092
+ "eval_samples_per_second": 16.489,
6093
+ "eval_steps_per_second": 0.916,
6094
+ "step": 7800
6095
+ },
6096
+ {
6097
+ "epoch": 0.71,
6098
+ "grad_norm": 325412290822144.0,
6099
+ "learning_rate": 1.9365931954213443e-07,
6100
+ "loss": 26.345108032226562,
6101
+ "step": 7810
6102
+ },
6103
+ {
6104
+ "epoch": 0.7109090909090909,
6105
+ "grad_norm": 103427434610688.0,
6106
+ "learning_rate": 1.9253198180174213e-07,
6107
+ "loss": 26.439935302734376,
6108
+ "step": 7820
6109
+ },
6110
+ {
6111
+ "epoch": 0.7118181818181818,
6112
+ "grad_norm": 491774460035072.0,
6113
+ "learning_rate": 1.9140715198336844e-07,
6114
+ "loss": 26.82066650390625,
6115
+ "step": 7830
6116
+ },
6117
+ {
6118
+ "epoch": 0.7127272727272728,
6119
+ "grad_norm": 210541125566464.0,
6120
+ "learning_rate": 1.9028483926190474e-07,
6121
+ "loss": 26.39219970703125,
6122
+ "step": 7840
6123
+ },
6124
+ {
6125
+ "epoch": 0.7136363636363636,
6126
+ "grad_norm": 856512243171328.0,
6127
+ "learning_rate": 1.8916505279171007e-07,
6128
+ "loss": 26.36131591796875,
6129
+ "step": 7850
6130
+ },
6131
+ {
6132
+ "epoch": 0.7145454545454546,
6133
+ "grad_norm": 417027902668800.0,
6134
+ "learning_rate": 1.8804780170653833e-07,
6135
+ "loss": 26.504092407226562,
6136
+ "step": 7860
6137
+ },
6138
+ {
6139
+ "epoch": 0.7154545454545455,
6140
+ "grad_norm": 292983341580288.0,
6141
+ "learning_rate": 1.8693309511946304e-07,
6142
+ "loss": 26.41829833984375,
6143
+ "step": 7870
6144
+ },
6145
+ {
6146
+ "epoch": 0.7163636363636363,
6147
+ "grad_norm": 327994371473408.0,
6148
+ "learning_rate": 1.8582094212280237e-07,
6149
+ "loss": 26.64545593261719,
6150
+ "step": 7880
6151
+ },
6152
+ {
6153
+ "epoch": 0.7172727272727273,
6154
+ "grad_norm": 218186469343232.0,
6155
+ "learning_rate": 1.8471135178804641e-07,
6156
+ "loss": 26.180670166015624,
6157
+ "step": 7890
6158
+ },
6159
+ {
6160
+ "epoch": 0.7181818181818181,
6161
+ "grad_norm": 82476139544576.0,
6162
+ "learning_rate": 1.8360433316578205e-07,
6163
+ "loss": 26.653558349609376,
6164
+ "step": 7900
6165
+ },
6166
+ {
6167
+ "epoch": 0.7181818181818181,
6168
+ "eval_loss": 26.26190948486328,
6169
+ "eval_runtime": 2.1559,
6170
+ "eval_samples_per_second": 16.698,
6171
+ "eval_steps_per_second": 0.928,
6172
+ "step": 7900
6173
+ },
6174
+ {
6175
+ "epoch": 0.7190909090909091,
6176
+ "grad_norm": 118652909125632.0,
6177
+ "learning_rate": 1.8249989528561976e-07,
6178
+ "loss": 26.234396362304686,
6179
+ "step": 7910
6180
+ },
6181
+ {
6182
+ "epoch": 0.72,
6183
+ "grad_norm": 125824606928896.0,
6184
+ "learning_rate": 1.8139804715611916e-07,
6185
+ "loss": 26.377532958984375,
6186
+ "step": 7920
6187
+ },
6188
+ {
6189
+ "epoch": 0.7209090909090909,
6190
+ "grad_norm": 130430497980416.0,
6191
+ "learning_rate": 1.8029879776471661e-07,
6192
+ "loss": 26.323135375976562,
6193
+ "step": 7930
6194
+ },
6195
+ {
6196
+ "epoch": 0.7218181818181818,
6197
+ "grad_norm": 189826951282688.0,
6198
+ "learning_rate": 1.792021560776511e-07,
6199
+ "loss": 26.728903198242186,
6200
+ "step": 7940
6201
+ },
6202
+ {
6203
+ "epoch": 0.7227272727272728,
6204
+ "grad_norm": 148400968302592.0,
6205
+ "learning_rate": 1.781081310398917e-07,
6206
+ "loss": 26.242092895507813,
6207
+ "step": 7950
6208
+ },
6209
+ {
6210
+ "epoch": 0.7236363636363636,
6211
+ "grad_norm": 134777038438400.0,
6212
+ "learning_rate": 1.770167315750636e-07,
6213
+ "loss": 26.503350830078126,
6214
+ "step": 7960
6215
+ },
6216
+ {
6217
+ "epoch": 0.7245454545454545,
6218
+ "grad_norm": 511105268973568.0,
6219
+ "learning_rate": 1.7592796658537658e-07,
6220
+ "loss": 26.567254638671876,
6221
+ "step": 7970
6222
+ },
6223
+ {
6224
+ "epoch": 0.7254545454545455,
6225
+ "grad_norm": 110472221163520.0,
6226
+ "learning_rate": 1.748418449515519e-07,
6227
+ "loss": 26.81078186035156,
6228
+ "step": 7980
6229
+ },
6230
+ {
6231
+ "epoch": 0.7263636363636363,
6232
+ "grad_norm": 329754871857152.0,
6233
+ "learning_rate": 1.7375837553274897e-07,
6234
+ "loss": 26.368780517578124,
6235
+ "step": 7990
6236
+ },
6237
+ {
6238
+ "epoch": 0.7272727272727273,
6239
+ "grad_norm": 74490444775424.0,
6240
+ "learning_rate": 1.7267756716649523e-07,
6241
+ "loss": 26.744158935546874,
6242
+ "step": 8000
6243
+ },
6244
+ {
6245
+ "epoch": 0.7272727272727273,
6246
+ "eval_loss": 26.262548446655273,
6247
+ "eval_runtime": 2.1821,
6248
+ "eval_samples_per_second": 16.498,
6249
+ "eval_steps_per_second": 0.917,
6250
+ "step": 8000
6251
  }
6252
  ],
6253
  "logging_steps": 10,
 
6267
  "attributes": {}
6268
  }
6269
  },
6270
+ "total_flos": 7.2478781079552e+16,
6271
  "train_batch_size": 4,
6272
  "trial_name": null,
6273
  "trial_params": null