CodeIsAbstract commited on
Commit
67140ce
·
verified ·
1 Parent(s): d92e62c

Training in progress, step 40000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8e271f094dc095c867358bb6157221396d158922b11c316900c8d79c1e09d0f6
3
  size 541154336
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b8302b42850bb9a971a92bf21001a99a1b108886f1a1c6d46589b31593094b2b
3
  size 541154336
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:55e5fe87fe81d7cb83f3ed0295308626dfebead62fc3b096c5571405aeeab756
3
  size 1082379659
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:56878bd403ec25d1287ace7a734c802826405ce51180d174a63debd4614a56de
3
  size 1082379659
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:87b07b911601d04abcbcc91c12340e18730f0dbec6517e92e9000c51517972c9
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ae2914830368f46e9c6d2b2e5cbe7fbed0fa5772149d7c8cbec7c8589a46483c
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e9eea36234165600a5923f1ab0a2e7e9de4f1d318a06ca4c532030966bdcc676
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a009a4564c35728dfec89ffdf58a6a6918940a3d67f64f03a0ddf9185dba8b9e
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.4675324675324675,
6
  "eval_steps": 1000,
7
- "global_step": 36000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -2816,6 +2816,318 @@
2816
  "eval_samples_per_second": 37.393,
2817
  "eval_steps_per_second": 9.348,
2818
  "step": 36000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
2819
  }
2820
  ],
2821
  "logging_steps": 100,
@@ -2835,7 +3147,7 @@
2835
  "attributes": {}
2836
  }
2837
  },
2838
- "total_flos": 1.07169529724928e+18,
2839
  "train_batch_size": 22,
2840
  "trial_name": null,
2841
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.5194805194805194,
6
  "eval_steps": 1000,
7
+ "global_step": 40000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
2816
  "eval_samples_per_second": 37.393,
2817
  "eval_steps_per_second": 9.348,
2818
  "step": 36000
2819
+ },
2820
+ {
2821
+ "epoch": 0.4688311688311688,
2822
+ "grad_norm": 0.22442568838596344,
2823
+ "learning_rate": 0.0007656575591625415,
2824
+ "loss": 2.7954,
2825
+ "step": 36100
2826
+ },
2827
+ {
2828
+ "epoch": 0.4701298701298701,
2829
+ "grad_norm": 0.2147638201713562,
2830
+ "learning_rate": 0.0007644350353789997,
2831
+ "loss": 2.7897,
2832
+ "step": 36200
2833
+ },
2834
+ {
2835
+ "epoch": 0.4714285714285714,
2836
+ "grad_norm": 0.20484313368797302,
2837
+ "learning_rate": 0.0007632103129056145,
2838
+ "loss": 2.7859,
2839
+ "step": 36300
2840
+ },
2841
+ {
2842
+ "epoch": 0.4727272727272727,
2843
+ "grad_norm": 0.19691170752048492,
2844
+ "learning_rate": 0.0007619834019255482,
2845
+ "loss": 2.8251,
2846
+ "step": 36400
2847
+ },
2848
+ {
2849
+ "epoch": 0.474025974025974,
2850
+ "grad_norm": 0.2177974134683609,
2851
+ "learning_rate": 0.0007607543126401597,
2852
+ "loss": 2.7771,
2853
+ "step": 36500
2854
+ },
2855
+ {
2856
+ "epoch": 0.4753246753246753,
2857
+ "grad_norm": 0.24122121930122375,
2858
+ "learning_rate": 0.0007595230552689201,
2859
+ "loss": 2.7973,
2860
+ "step": 36600
2861
+ },
2862
+ {
2863
+ "epoch": 0.4766233766233766,
2864
+ "grad_norm": 0.2524343729019165,
2865
+ "learning_rate": 0.0007582896400493266,
2866
+ "loss": 2.82,
2867
+ "step": 36700
2868
+ },
2869
+ {
2870
+ "epoch": 0.4779220779220779,
2871
+ "grad_norm": 0.21695558726787567,
2872
+ "learning_rate": 0.000757054077236819,
2873
+ "loss": 2.802,
2874
+ "step": 36800
2875
+ },
2876
+ {
2877
+ "epoch": 0.4792207792207792,
2878
+ "grad_norm": 0.2205599695444107,
2879
+ "learning_rate": 0.0007558163771046934,
2880
+ "loss": 2.7509,
2881
+ "step": 36900
2882
+ },
2883
+ {
2884
+ "epoch": 0.4805194805194805,
2885
+ "grad_norm": 0.2173157036304474,
2886
+ "learning_rate": 0.0007545765499440169,
2887
+ "loss": 2.7978,
2888
+ "step": 37000
2889
+ },
2890
+ {
2891
+ "epoch": 0.4805194805194805,
2892
+ "eval_loss": 3.170949935913086,
2893
+ "eval_runtime": 16.3367,
2894
+ "eval_samples_per_second": 35.258,
2895
+ "eval_steps_per_second": 8.815,
2896
+ "step": 37000
2897
+ },
2898
+ {
2899
+ "epoch": 0.4818181818181818,
2900
+ "grad_norm": 0.21395540237426758,
2901
+ "learning_rate": 0.0007533346060635424,
2902
+ "loss": 2.775,
2903
+ "step": 37100
2904
+ },
2905
+ {
2906
+ "epoch": 0.4831168831168831,
2907
+ "grad_norm": 0.2262965440750122,
2908
+ "learning_rate": 0.0007520905557896221,
2909
+ "loss": 2.779,
2910
+ "step": 37200
2911
+ },
2912
+ {
2913
+ "epoch": 0.4844155844155844,
2914
+ "grad_norm": 0.2124248743057251,
2915
+ "learning_rate": 0.0007508444094661227,
2916
+ "loss": 2.8141,
2917
+ "step": 37300
2918
+ },
2919
+ {
2920
+ "epoch": 0.4857142857142857,
2921
+ "grad_norm": 0.24149860441684723,
2922
+ "learning_rate": 0.0007495961774543385,
2923
+ "loss": 2.8091,
2924
+ "step": 37400
2925
+ },
2926
+ {
2927
+ "epoch": 0.487012987012987,
2928
+ "grad_norm": 0.2356308251619339,
2929
+ "learning_rate": 0.0007483458701329059,
2930
+ "loss": 2.7898,
2931
+ "step": 37500
2932
+ },
2933
+ {
2934
+ "epoch": 0.4883116883116883,
2935
+ "grad_norm": 0.21705743670463562,
2936
+ "learning_rate": 0.0007470934978977167,
2937
+ "loss": 2.8022,
2938
+ "step": 37600
2939
+ },
2940
+ {
2941
+ "epoch": 0.4896103896103896,
2942
+ "grad_norm": 0.21993373334407806,
2943
+ "learning_rate": 0.0007458390711618315,
2944
+ "loss": 2.7881,
2945
+ "step": 37700
2946
+ },
2947
+ {
2948
+ "epoch": 0.4909090909090909,
2949
+ "grad_norm": 0.21296945214271545,
2950
+ "learning_rate": 0.0007445826003553939,
2951
+ "loss": 2.7987,
2952
+ "step": 37800
2953
+ },
2954
+ {
2955
+ "epoch": 0.4922077922077922,
2956
+ "grad_norm": 0.23273344337940216,
2957
+ "learning_rate": 0.000743324095925543,
2958
+ "loss": 2.8253,
2959
+ "step": 37900
2960
+ },
2961
+ {
2962
+ "epoch": 0.4935064935064935,
2963
+ "grad_norm": 0.2104436457157135,
2964
+ "learning_rate": 0.0007420635683363268,
2965
+ "loss": 2.7807,
2966
+ "step": 38000
2967
+ },
2968
+ {
2969
+ "epoch": 0.4935064935064935,
2970
+ "eval_loss": 3.151848316192627,
2971
+ "eval_runtime": 15.3437,
2972
+ "eval_samples_per_second": 37.54,
2973
+ "eval_steps_per_second": 9.385,
2974
+ "step": 38000
2975
+ },
2976
+ {
2977
+ "epoch": 0.4948051948051948,
2978
+ "grad_norm": 0.2078818380832672,
2979
+ "learning_rate": 0.0007408010280686151,
2980
+ "loss": 2.7504,
2981
+ "step": 38100
2982
+ },
2983
+ {
2984
+ "epoch": 0.4961038961038961,
2985
+ "grad_norm": 0.22127191722393036,
2986
+ "learning_rate": 0.0007395364856200127,
2987
+ "loss": 2.7698,
2988
+ "step": 38200
2989
+ },
2990
+ {
2991
+ "epoch": 0.4974025974025974,
2992
+ "grad_norm": 0.20785515010356903,
2993
+ "learning_rate": 0.0007382699515047715,
2994
+ "loss": 2.804,
2995
+ "step": 38300
2996
+ },
2997
+ {
2998
+ "epoch": 0.4987012987012987,
2999
+ "grad_norm": 0.267839640378952,
3000
+ "learning_rate": 0.0007370014362537041,
3001
+ "loss": 2.778,
3002
+ "step": 38400
3003
+ },
3004
+ {
3005
+ "epoch": 0.5,
3006
+ "grad_norm": 0.22827385365962982,
3007
+ "learning_rate": 0.0007357309504140948,
3008
+ "loss": 2.7786,
3009
+ "step": 38500
3010
+ },
3011
+ {
3012
+ "epoch": 0.5012987012987012,
3013
+ "grad_norm": 0.22568035125732422,
3014
+ "learning_rate": 0.0007344585045496133,
3015
+ "loss": 2.7655,
3016
+ "step": 38600
3017
+ },
3018
+ {
3019
+ "epoch": 0.5025974025974026,
3020
+ "grad_norm": 0.2355123907327652,
3021
+ "learning_rate": 0.000733184109240226,
3022
+ "loss": 2.7714,
3023
+ "step": 38700
3024
+ },
3025
+ {
3026
+ "epoch": 0.5038961038961038,
3027
+ "grad_norm": 0.2227976769208908,
3028
+ "learning_rate": 0.0007319077750821084,
3029
+ "loss": 2.7534,
3030
+ "step": 38800
3031
+ },
3032
+ {
3033
+ "epoch": 0.5051948051948052,
3034
+ "grad_norm": 0.25165653228759766,
3035
+ "learning_rate": 0.0007306295126875566,
3036
+ "loss": 2.7832,
3037
+ "step": 38900
3038
+ },
3039
+ {
3040
+ "epoch": 0.5064935064935064,
3041
+ "grad_norm": 0.24306100606918335,
3042
+ "learning_rate": 0.0007293493326848997,
3043
+ "loss": 2.774,
3044
+ "step": 39000
3045
+ },
3046
+ {
3047
+ "epoch": 0.5064935064935064,
3048
+ "eval_loss": 3.1421139240264893,
3049
+ "eval_runtime": 15.2375,
3050
+ "eval_samples_per_second": 37.801,
3051
+ "eval_steps_per_second": 9.45,
3052
+ "step": 39000
3053
+ },
3054
+ {
3055
+ "epoch": 0.5077922077922078,
3056
+ "grad_norm": 0.23936377465724945,
3057
+ "learning_rate": 0.0007280672457184108,
3058
+ "loss": 2.7569,
3059
+ "step": 39100
3060
+ },
3061
+ {
3062
+ "epoch": 0.509090909090909,
3063
+ "grad_norm": 0.2100268453359604,
3064
+ "learning_rate": 0.0007267832624482191,
3065
+ "loss": 2.7524,
3066
+ "step": 39200
3067
+ },
3068
+ {
3069
+ "epoch": 0.5103896103896104,
3070
+ "grad_norm": 0.21765153110027313,
3071
+ "learning_rate": 0.0007254973935502207,
3072
+ "loss": 2.7636,
3073
+ "step": 39300
3074
+ },
3075
+ {
3076
+ "epoch": 0.5116883116883116,
3077
+ "grad_norm": 0.22430171072483063,
3078
+ "learning_rate": 0.0007242096497159902,
3079
+ "loss": 2.7875,
3080
+ "step": 39400
3081
+ },
3082
+ {
3083
+ "epoch": 0.512987012987013,
3084
+ "grad_norm": 0.23513422906398773,
3085
+ "learning_rate": 0.0007229200416526911,
3086
+ "loss": 2.7606,
3087
+ "step": 39500
3088
+ },
3089
+ {
3090
+ "epoch": 0.5142857142857142,
3091
+ "grad_norm": 0.24426428973674774,
3092
+ "learning_rate": 0.0007216285800829885,
3093
+ "loss": 2.7867,
3094
+ "step": 39600
3095
+ },
3096
+ {
3097
+ "epoch": 0.5155844155844156,
3098
+ "grad_norm": 0.313528835773468,
3099
+ "learning_rate": 0.0007203352757449577,
3100
+ "loss": 2.7645,
3101
+ "step": 39700
3102
+ },
3103
+ {
3104
+ "epoch": 0.5168831168831168,
3105
+ "grad_norm": 0.23338325321674347,
3106
+ "learning_rate": 0.0007190401393919968,
3107
+ "loss": 2.7358,
3108
+ "step": 39800
3109
+ },
3110
+ {
3111
+ "epoch": 0.5181818181818182,
3112
+ "grad_norm": 0.2229086011648178,
3113
+ "learning_rate": 0.0007177431817927358,
3114
+ "loss": 2.7574,
3115
+ "step": 39900
3116
+ },
3117
+ {
3118
+ "epoch": 0.5194805194805194,
3119
+ "grad_norm": 0.22037512063980103,
3120
+ "learning_rate": 0.000716444413730948,
3121
+ "loss": 2.7507,
3122
+ "step": 40000
3123
+ },
3124
+ {
3125
+ "epoch": 0.5194805194805194,
3126
+ "eval_loss": 3.1465635299682617,
3127
+ "eval_runtime": 15.78,
3128
+ "eval_samples_per_second": 36.502,
3129
+ "eval_steps_per_second": 9.125,
3130
+ "step": 40000
3131
  }
3132
  ],
3133
  "logging_steps": 100,
 
3147
  "attributes": {}
3148
  }
3149
  },
3150
+ "total_flos": 1.1907725524992e+18,
3151
  "train_batch_size": 22,
3152
  "trial_name": null,
3153
  "trial_params": null