CodeIsAbstract commited on
Commit
48d5311
·
verified ·
1 Parent(s): e53f296

Training in progress, step 800, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c1d34d69dffb2c4b13f69101d37856a75aa09dc083a674348259bfa0f2c28ab9
3
  size 234681136
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2809364a64b35c0d5cde9c200be9f916ec43e713ca4cb99b004942f6fe12b016
3
  size 234681136
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:39504b7c024bff9fa0fb04bf688ef360e9faf081aaec354fe731018ad0d7e11a
3
  size 469516363
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6603b84995733c3c123fd03098b901e146787f48e8efa3a7b2cfa5001df10bf6
3
  size 469516363
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:25e3cd90b4b52da1b6dd5f1c3a7c71a1534283f13013c59ba10d201654481663
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1dfb8359e21fdc9be973e48050f0f83da35c6f4ef563006494ede01971aef578
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bf2ddddac28bab3ce3bced5d6f919d64d2cfe7cd07c4a0f8d5c9ad1b67097bee
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2d95cb2fcd6948e86339af624a28d1c1121924096b5ac15eb53417186944a3ee
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.6,
6
  "eval_steps": 50,
7
- "global_step": 600,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -944,6 +944,318 @@
944
  "eval_samples_per_second": 5.482,
945
  "eval_steps_per_second": 2.815,
946
  "step": 600
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
947
  }
948
  ],
949
  "logging_steps": 5,
@@ -963,7 +1275,7 @@
963
  "attributes": {}
964
  }
965
  },
966
- "total_flos": 1.739490745909248e+17,
967
  "train_batch_size": 2,
968
  "trial_name": null,
969
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.8,
6
  "eval_steps": 50,
7
+ "global_step": 800,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
944
  "eval_samples_per_second": 5.482,
945
  "eval_steps_per_second": 2.815,
946
  "step": 600
947
+ },
948
+ {
949
+ "epoch": 0.605,
950
+ "grad_norm": 26.125,
951
+ "learning_rate": 5e-05,
952
+ "loss": 3.0119483947753904,
953
+ "step": 605
954
+ },
955
+ {
956
+ "epoch": 0.61,
957
+ "grad_norm": 1.3515625,
958
+ "learning_rate": 5e-05,
959
+ "loss": 3.0221290588378906,
960
+ "step": 610
961
+ },
962
+ {
963
+ "epoch": 0.615,
964
+ "grad_norm": 1.328125,
965
+ "learning_rate": 5e-05,
966
+ "loss": 3.034591484069824,
967
+ "step": 615
968
+ },
969
+ {
970
+ "epoch": 0.62,
971
+ "grad_norm": 1.8359375,
972
+ "learning_rate": 5e-05,
973
+ "loss": 3.0486448287963865,
974
+ "step": 620
975
+ },
976
+ {
977
+ "epoch": 0.625,
978
+ "grad_norm": 6.125,
979
+ "learning_rate": 5e-05,
980
+ "loss": 3.0161321640014647,
981
+ "step": 625
982
+ },
983
+ {
984
+ "epoch": 0.63,
985
+ "grad_norm": 47.75,
986
+ "learning_rate": 5e-05,
987
+ "loss": 3.034286880493164,
988
+ "step": 630
989
+ },
990
+ {
991
+ "epoch": 0.635,
992
+ "grad_norm": 22.5,
993
+ "learning_rate": 5e-05,
994
+ "loss": 3.05667667388916,
995
+ "step": 635
996
+ },
997
+ {
998
+ "epoch": 0.64,
999
+ "grad_norm": 4.28125,
1000
+ "learning_rate": 5e-05,
1001
+ "loss": 3.0220699310302734,
1002
+ "step": 640
1003
+ },
1004
+ {
1005
+ "epoch": 0.645,
1006
+ "grad_norm": 2.640625,
1007
+ "learning_rate": 5e-05,
1008
+ "loss": 2.995787811279297,
1009
+ "step": 645
1010
+ },
1011
+ {
1012
+ "epoch": 0.65,
1013
+ "grad_norm": 3.140625,
1014
+ "learning_rate": 5e-05,
1015
+ "loss": 3.030243492126465,
1016
+ "step": 650
1017
+ },
1018
+ {
1019
+ "epoch": 0.65,
1020
+ "eval_loss": 3.2928740978240967,
1021
+ "eval_runtime": 6.768,
1022
+ "eval_samples_per_second": 5.467,
1023
+ "eval_steps_per_second": 2.807,
1024
+ "step": 650
1025
+ },
1026
+ {
1027
+ "epoch": 0.655,
1028
+ "grad_norm": 1.7734375,
1029
+ "learning_rate": 5e-05,
1030
+ "loss": 2.9878942489624025,
1031
+ "step": 655
1032
+ },
1033
+ {
1034
+ "epoch": 0.66,
1035
+ "grad_norm": 21.75,
1036
+ "learning_rate": 5e-05,
1037
+ "loss": 3.0131813049316407,
1038
+ "step": 660
1039
+ },
1040
+ {
1041
+ "epoch": 0.665,
1042
+ "grad_norm": 2.0,
1043
+ "learning_rate": 5e-05,
1044
+ "loss": 2.988085174560547,
1045
+ "step": 665
1046
+ },
1047
+ {
1048
+ "epoch": 0.67,
1049
+ "grad_norm": 1.4296875,
1050
+ "learning_rate": 5e-05,
1051
+ "loss": 3.022294044494629,
1052
+ "step": 670
1053
+ },
1054
+ {
1055
+ "epoch": 0.675,
1056
+ "grad_norm": 6.875,
1057
+ "learning_rate": 5e-05,
1058
+ "loss": 3.0046091079711914,
1059
+ "step": 675
1060
+ },
1061
+ {
1062
+ "epoch": 0.68,
1063
+ "grad_norm": 2.875,
1064
+ "learning_rate": 5e-05,
1065
+ "loss": 3.013047981262207,
1066
+ "step": 680
1067
+ },
1068
+ {
1069
+ "epoch": 0.685,
1070
+ "grad_norm": 17.0,
1071
+ "learning_rate": 5e-05,
1072
+ "loss": 2.9954095840454102,
1073
+ "step": 685
1074
+ },
1075
+ {
1076
+ "epoch": 0.69,
1077
+ "grad_norm": 7.03125,
1078
+ "learning_rate": 5e-05,
1079
+ "loss": 3.004934310913086,
1080
+ "step": 690
1081
+ },
1082
+ {
1083
+ "epoch": 0.695,
1084
+ "grad_norm": 1.84375,
1085
+ "learning_rate": 5e-05,
1086
+ "loss": 3.037328910827637,
1087
+ "step": 695
1088
+ },
1089
+ {
1090
+ "epoch": 0.7,
1091
+ "grad_norm": 11.25,
1092
+ "learning_rate": 5e-05,
1093
+ "loss": 3.022724914550781,
1094
+ "step": 700
1095
+ },
1096
+ {
1097
+ "epoch": 0.7,
1098
+ "eval_loss": 3.2860541343688965,
1099
+ "eval_runtime": 6.7324,
1100
+ "eval_samples_per_second": 5.496,
1101
+ "eval_steps_per_second": 2.822,
1102
+ "step": 700
1103
+ },
1104
+ {
1105
+ "epoch": 0.705,
1106
+ "grad_norm": 1.7890625,
1107
+ "learning_rate": 5e-05,
1108
+ "loss": 2.9891803741455076,
1109
+ "step": 705
1110
+ },
1111
+ {
1112
+ "epoch": 0.71,
1113
+ "grad_norm": 8.5,
1114
+ "learning_rate": 5e-05,
1115
+ "loss": 3.0228837966918944,
1116
+ "step": 710
1117
+ },
1118
+ {
1119
+ "epoch": 0.715,
1120
+ "grad_norm": 2.171875,
1121
+ "learning_rate": 5e-05,
1122
+ "loss": 3.0380273818969727,
1123
+ "step": 715
1124
+ },
1125
+ {
1126
+ "epoch": 0.72,
1127
+ "grad_norm": 1.6484375,
1128
+ "learning_rate": 5e-05,
1129
+ "loss": 3.013555335998535,
1130
+ "step": 720
1131
+ },
1132
+ {
1133
+ "epoch": 0.725,
1134
+ "grad_norm": 1.3984375,
1135
+ "learning_rate": 5e-05,
1136
+ "loss": 2.9776601791381836,
1137
+ "step": 725
1138
+ },
1139
+ {
1140
+ "epoch": 0.73,
1141
+ "grad_norm": 2.46875,
1142
+ "learning_rate": 5e-05,
1143
+ "loss": 3.0011289596557615,
1144
+ "step": 730
1145
+ },
1146
+ {
1147
+ "epoch": 0.735,
1148
+ "grad_norm": 2.0625,
1149
+ "learning_rate": 5e-05,
1150
+ "loss": 2.99926872253418,
1151
+ "step": 735
1152
+ },
1153
+ {
1154
+ "epoch": 0.74,
1155
+ "grad_norm": 3.453125,
1156
+ "learning_rate": 5e-05,
1157
+ "loss": 2.9941511154174805,
1158
+ "step": 740
1159
+ },
1160
+ {
1161
+ "epoch": 0.745,
1162
+ "grad_norm": 6.625,
1163
+ "learning_rate": 5e-05,
1164
+ "loss": 3.0118370056152344,
1165
+ "step": 745
1166
+ },
1167
+ {
1168
+ "epoch": 0.75,
1169
+ "grad_norm": 7.28125,
1170
+ "learning_rate": 5e-05,
1171
+ "loss": 2.9928028106689455,
1172
+ "step": 750
1173
+ },
1174
+ {
1175
+ "epoch": 0.75,
1176
+ "eval_loss": 3.280454158782959,
1177
+ "eval_runtime": 6.7672,
1178
+ "eval_samples_per_second": 5.468,
1179
+ "eval_steps_per_second": 2.808,
1180
+ "step": 750
1181
+ },
1182
+ {
1183
+ "epoch": 0.755,
1184
+ "grad_norm": 4.34375,
1185
+ "learning_rate": 5e-05,
1186
+ "loss": 3.012207794189453,
1187
+ "step": 755
1188
+ },
1189
+ {
1190
+ "epoch": 0.76,
1191
+ "grad_norm": 1.6796875,
1192
+ "learning_rate": 5e-05,
1193
+ "loss": 2.9685001373291016,
1194
+ "step": 760
1195
+ },
1196
+ {
1197
+ "epoch": 0.765,
1198
+ "grad_norm": 0.95703125,
1199
+ "learning_rate": 5e-05,
1200
+ "loss": 3.032526397705078,
1201
+ "step": 765
1202
+ },
1203
+ {
1204
+ "epoch": 0.77,
1205
+ "grad_norm": 2.0625,
1206
+ "learning_rate": 5e-05,
1207
+ "loss": 3.018193244934082,
1208
+ "step": 770
1209
+ },
1210
+ {
1211
+ "epoch": 0.775,
1212
+ "grad_norm": 160.0,
1213
+ "learning_rate": 5e-05,
1214
+ "loss": 2.9998651504516602,
1215
+ "step": 775
1216
+ },
1217
+ {
1218
+ "epoch": 0.78,
1219
+ "grad_norm": 182.0,
1220
+ "learning_rate": 5e-05,
1221
+ "loss": 3.0007757186889648,
1222
+ "step": 780
1223
+ },
1224
+ {
1225
+ "epoch": 0.785,
1226
+ "grad_norm": 3.03125,
1227
+ "learning_rate": 5e-05,
1228
+ "loss": 2.9936758041381837,
1229
+ "step": 785
1230
+ },
1231
+ {
1232
+ "epoch": 0.79,
1233
+ "grad_norm": 3.4375,
1234
+ "learning_rate": 5e-05,
1235
+ "loss": 2.9737762451171874,
1236
+ "step": 790
1237
+ },
1238
+ {
1239
+ "epoch": 0.795,
1240
+ "grad_norm": 63.5,
1241
+ "learning_rate": 5e-05,
1242
+ "loss": 3.0091293334960936,
1243
+ "step": 795
1244
+ },
1245
+ {
1246
+ "epoch": 0.8,
1247
+ "grad_norm": 46.0,
1248
+ "learning_rate": 5e-05,
1249
+ "loss": 3.021886444091797,
1250
+ "step": 800
1251
+ },
1252
+ {
1253
+ "epoch": 0.8,
1254
+ "eval_loss": 3.2757456302642822,
1255
+ "eval_runtime": 6.7253,
1256
+ "eval_samples_per_second": 5.502,
1257
+ "eval_steps_per_second": 2.825,
1258
+ "step": 800
1259
  }
1260
  ],
1261
  "logging_steps": 5,
 
1275
  "attributes": {}
1276
  }
1277
  },
1278
+ "total_flos": 2.319320994545664e+17,
1279
  "train_batch_size": 2,
1280
  "trial_name": null,
1281
  "trial_params": null