CodeIsAbstract commited on
Commit
77cedfc
·
verified ·
1 Parent(s): fa9fb77

Training in progress, step 600, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d6b5c8ae3ce3b75a3efb3cea4f0f22e522106b7a7a11f76b184da7ea8f0464cc
3
  size 234681136
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c1d34d69dffb2c4b13f69101d37856a75aa09dc083a674348259bfa0f2c28ab9
3
  size 234681136
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:abe10937b2346f32a25ef8a726c3a45c358a8eb207991431dcbb7ddc785c611f
3
  size 469516363
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:39504b7c024bff9fa0fb04bf688ef360e9faf081aaec354fe731018ad0d7e11a
3
  size 469516363
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ba03b8c06ab7ab86dfbcbefe7ba1358ea78b1ce004b09a6a9e08759669880b0f
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:25e3cd90b4b52da1b6dd5f1c3a7c71a1534283f13013c59ba10d201654481663
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b1c37070e6eb9d511a4f7c71d2c3f18ff0f2b091f4acb310e39c4f3f39019ddf
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bf2ddddac28bab3ce3bced5d6f919d64d2cfe7cd07c4a0f8d5c9ad1b67097bee
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.4,
6
  "eval_steps": 50,
7
- "global_step": 400,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -632,6 +632,318 @@
632
  "eval_samples_per_second": 5.482,
633
  "eval_steps_per_second": 2.815,
634
  "step": 400
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
635
  }
636
  ],
637
  "logging_steps": 5,
@@ -651,7 +963,7 @@
651
  "attributes": {}
652
  }
653
  },
654
- "total_flos": 1.159660497272832e+17,
655
  "train_batch_size": 2,
656
  "trial_name": null,
657
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.6,
6
  "eval_steps": 50,
7
+ "global_step": 600,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
632
  "eval_samples_per_second": 5.482,
633
  "eval_steps_per_second": 2.815,
634
  "step": 400
635
+ },
636
+ {
637
+ "epoch": 0.405,
638
+ "grad_norm": 24.5,
639
+ "learning_rate": 5e-05,
640
+ "loss": 3.0751102447509764,
641
+ "step": 405
642
+ },
643
+ {
644
+ "epoch": 0.41,
645
+ "grad_norm": 2.65625,
646
+ "learning_rate": 5e-05,
647
+ "loss": 3.0429092407226563,
648
+ "step": 410
649
+ },
650
+ {
651
+ "epoch": 0.415,
652
+ "grad_norm": 16.0,
653
+ "learning_rate": 5e-05,
654
+ "loss": 3.0210216522216795,
655
+ "step": 415
656
+ },
657
+ {
658
+ "epoch": 0.42,
659
+ "grad_norm": 7.53125,
660
+ "learning_rate": 5e-05,
661
+ "loss": 3.065318489074707,
662
+ "step": 420
663
+ },
664
+ {
665
+ "epoch": 0.425,
666
+ "grad_norm": 24.375,
667
+ "learning_rate": 5e-05,
668
+ "loss": 3.0230634689331053,
669
+ "step": 425
670
+ },
671
+ {
672
+ "epoch": 0.43,
673
+ "grad_norm": 5.625,
674
+ "learning_rate": 5e-05,
675
+ "loss": 3.02874698638916,
676
+ "step": 430
677
+ },
678
+ {
679
+ "epoch": 0.435,
680
+ "grad_norm": 16.5,
681
+ "learning_rate": 5e-05,
682
+ "loss": 3.052432632446289,
683
+ "step": 435
684
+ },
685
+ {
686
+ "epoch": 0.44,
687
+ "grad_norm": 15.9375,
688
+ "learning_rate": 5e-05,
689
+ "loss": 3.0222875595092775,
690
+ "step": 440
691
+ },
692
+ {
693
+ "epoch": 0.445,
694
+ "grad_norm": 19.0,
695
+ "learning_rate": 5e-05,
696
+ "loss": 3.053955841064453,
697
+ "step": 445
698
+ },
699
+ {
700
+ "epoch": 0.45,
701
+ "grad_norm": 86.5,
702
+ "learning_rate": 5e-05,
703
+ "loss": 3.0460411071777345,
704
+ "step": 450
705
+ },
706
+ {
707
+ "epoch": 0.45,
708
+ "eval_loss": 3.317772626876831,
709
+ "eval_runtime": 6.7179,
710
+ "eval_samples_per_second": 5.508,
711
+ "eval_steps_per_second": 2.828,
712
+ "step": 450
713
+ },
714
+ {
715
+ "epoch": 0.455,
716
+ "grad_norm": 1.84375,
717
+ "learning_rate": 5e-05,
718
+ "loss": 3.115060806274414,
719
+ "step": 455
720
+ },
721
+ {
722
+ "epoch": 0.46,
723
+ "grad_norm": 19.375,
724
+ "learning_rate": 5e-05,
725
+ "loss": 3.071373176574707,
726
+ "step": 460
727
+ },
728
+ {
729
+ "epoch": 0.465,
730
+ "grad_norm": 6.6875,
731
+ "learning_rate": 5e-05,
732
+ "loss": 3.0433387756347656,
733
+ "step": 465
734
+ },
735
+ {
736
+ "epoch": 0.47,
737
+ "grad_norm": 2.09375,
738
+ "learning_rate": 5e-05,
739
+ "loss": 3.049169921875,
740
+ "step": 470
741
+ },
742
+ {
743
+ "epoch": 0.475,
744
+ "grad_norm": 3.9375,
745
+ "learning_rate": 5e-05,
746
+ "loss": 3.079736328125,
747
+ "step": 475
748
+ },
749
+ {
750
+ "epoch": 0.48,
751
+ "grad_norm": 3.796875,
752
+ "learning_rate": 5e-05,
753
+ "loss": 3.0374773025512694,
754
+ "step": 480
755
+ },
756
+ {
757
+ "epoch": 0.485,
758
+ "grad_norm": 37.25,
759
+ "learning_rate": 5e-05,
760
+ "loss": 3.022678756713867,
761
+ "step": 485
762
+ },
763
+ {
764
+ "epoch": 0.49,
765
+ "grad_norm": 65.0,
766
+ "learning_rate": 5e-05,
767
+ "loss": 3.032781410217285,
768
+ "step": 490
769
+ },
770
+ {
771
+ "epoch": 0.495,
772
+ "grad_norm": 10.375,
773
+ "learning_rate": 5e-05,
774
+ "loss": 3.0296302795410157,
775
+ "step": 495
776
+ },
777
+ {
778
+ "epoch": 0.5,
779
+ "grad_norm": 7.9375,
780
+ "learning_rate": 5e-05,
781
+ "loss": 3.0553735733032226,
782
+ "step": 500
783
+ },
784
+ {
785
+ "epoch": 0.5,
786
+ "eval_loss": 3.3104944229125977,
787
+ "eval_runtime": 6.7677,
788
+ "eval_samples_per_second": 5.467,
789
+ "eval_steps_per_second": 2.807,
790
+ "step": 500
791
+ },
792
+ {
793
+ "epoch": 0.505,
794
+ "grad_norm": 2.71875,
795
+ "learning_rate": 5e-05,
796
+ "loss": 3.063258743286133,
797
+ "step": 505
798
+ },
799
+ {
800
+ "epoch": 0.51,
801
+ "grad_norm": 10.4375,
802
+ "learning_rate": 5e-05,
803
+ "loss": 3.0316259384155275,
804
+ "step": 510
805
+ },
806
+ {
807
+ "epoch": 0.515,
808
+ "grad_norm": 9.5,
809
+ "learning_rate": 5e-05,
810
+ "loss": 3.0448724746704103,
811
+ "step": 515
812
+ },
813
+ {
814
+ "epoch": 0.52,
815
+ "grad_norm": 2.109375,
816
+ "learning_rate": 5e-05,
817
+ "loss": 3.0403762817382813,
818
+ "step": 520
819
+ },
820
+ {
821
+ "epoch": 0.525,
822
+ "grad_norm": 3.609375,
823
+ "learning_rate": 5e-05,
824
+ "loss": 2.9868940353393554,
825
+ "step": 525
826
+ },
827
+ {
828
+ "epoch": 0.53,
829
+ "grad_norm": 3.875,
830
+ "learning_rate": 5e-05,
831
+ "loss": 3.010245704650879,
832
+ "step": 530
833
+ },
834
+ {
835
+ "epoch": 0.535,
836
+ "grad_norm": 1.5859375,
837
+ "learning_rate": 5e-05,
838
+ "loss": 3.039686393737793,
839
+ "step": 535
840
+ },
841
+ {
842
+ "epoch": 0.54,
843
+ "grad_norm": 25.5,
844
+ "learning_rate": 5e-05,
845
+ "loss": 3.041441535949707,
846
+ "step": 540
847
+ },
848
+ {
849
+ "epoch": 0.545,
850
+ "grad_norm": 8.0,
851
+ "learning_rate": 5e-05,
852
+ "loss": 3.0453310012817383,
853
+ "step": 545
854
+ },
855
+ {
856
+ "epoch": 0.55,
857
+ "grad_norm": 9.6875,
858
+ "learning_rate": 5e-05,
859
+ "loss": 3.0214563369750977,
860
+ "step": 550
861
+ },
862
+ {
863
+ "epoch": 0.55,
864
+ "eval_loss": 3.3045036792755127,
865
+ "eval_runtime": 6.7272,
866
+ "eval_samples_per_second": 5.5,
867
+ "eval_steps_per_second": 2.824,
868
+ "step": 550
869
+ },
870
+ {
871
+ "epoch": 0.555,
872
+ "grad_norm": 64.0,
873
+ "learning_rate": 5e-05,
874
+ "loss": 3.0599187850952148,
875
+ "step": 555
876
+ },
877
+ {
878
+ "epoch": 0.56,
879
+ "grad_norm": 5.5,
880
+ "learning_rate": 5e-05,
881
+ "loss": 3.0171770095825194,
882
+ "step": 560
883
+ },
884
+ {
885
+ "epoch": 0.565,
886
+ "grad_norm": 2.0625,
887
+ "learning_rate": 5e-05,
888
+ "loss": 3.0361049652099608,
889
+ "step": 565
890
+ },
891
+ {
892
+ "epoch": 0.57,
893
+ "grad_norm": 1.296875,
894
+ "learning_rate": 5e-05,
895
+ "loss": 3.0191267013549803,
896
+ "step": 570
897
+ },
898
+ {
899
+ "epoch": 0.575,
900
+ "grad_norm": 2.28125,
901
+ "learning_rate": 5e-05,
902
+ "loss": 3.0235448837280274,
903
+ "step": 575
904
+ },
905
+ {
906
+ "epoch": 0.58,
907
+ "grad_norm": 4.0625,
908
+ "learning_rate": 5e-05,
909
+ "loss": 3.0432418823242187,
910
+ "step": 580
911
+ },
912
+ {
913
+ "epoch": 0.585,
914
+ "grad_norm": 28.25,
915
+ "learning_rate": 5e-05,
916
+ "loss": 3.0085990905761717,
917
+ "step": 585
918
+ },
919
+ {
920
+ "epoch": 0.59,
921
+ "grad_norm": 1.546875,
922
+ "learning_rate": 5e-05,
923
+ "loss": 2.9956476211547853,
924
+ "step": 590
925
+ },
926
+ {
927
+ "epoch": 0.595,
928
+ "grad_norm": 28.125,
929
+ "learning_rate": 5e-05,
930
+ "loss": 3.0316390991210938,
931
+ "step": 595
932
+ },
933
+ {
934
+ "epoch": 0.6,
935
+ "grad_norm": 13.6875,
936
+ "learning_rate": 5e-05,
937
+ "loss": 3.040385627746582,
938
+ "step": 600
939
+ },
940
+ {
941
+ "epoch": 0.6,
942
+ "eval_loss": 3.2979705333709717,
943
+ "eval_runtime": 6.7492,
944
+ "eval_samples_per_second": 5.482,
945
+ "eval_steps_per_second": 2.815,
946
+ "step": 600
947
  }
948
  ],
949
  "logging_steps": 5,
 
963
  "attributes": {}
964
  }
965
  },
966
+ "total_flos": 1.739490745909248e+17,
967
  "train_batch_size": 2,
968
  "trial_name": null,
969
  "trial_params": null