CodeIsAbstract commited on
Commit
6e7ca9b
·
verified ·
1 Parent(s): 39b73bc

Training in progress, step 1000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2809364a64b35c0d5cde9c200be9f916ec43e713ca4cb99b004942f6fe12b016
3
  size 234681136
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:98d2fe0f6c71fc451029e15d3adda76c167de5a1de26fc9f1e9f7395acc07ef0
3
  size 234681136
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6603b84995733c3c123fd03098b901e146787f48e8efa3a7b2cfa5001df10bf6
3
  size 469516363
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6c7d3c211b32962f1c875c875c023927c7b5b2b29912c2c797fbd8a9e787a13a
3
  size 469516363
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1dfb8359e21fdc9be973e48050f0f83da35c6f4ef563006494ede01971aef578
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d193220051de5dc024d5f45a08741acdec0884c4a3d4ecd0669567f27b83c7d4
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2d95cb2fcd6948e86339af624a28d1c1121924096b5ac15eb53417186944a3ee
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:68aec417c91400a5fbe9c98d7447dabd74ed3b0812272a5f21d640985e919bad
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.8,
6
  "eval_steps": 50,
7
- "global_step": 800,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -1256,6 +1256,318 @@
1256
  "eval_samples_per_second": 5.502,
1257
  "eval_steps_per_second": 2.825,
1258
  "step": 800
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1259
  }
1260
  ],
1261
  "logging_steps": 5,
@@ -1270,12 +1582,12 @@
1270
  "should_evaluate": false,
1271
  "should_log": false,
1272
  "should_save": true,
1273
- "should_training_stop": false
1274
  },
1275
  "attributes": {}
1276
  }
1277
  },
1278
- "total_flos": 2.319320994545664e+17,
1279
  "train_batch_size": 2,
1280
  "trial_name": null,
1281
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 1.0,
6
  "eval_steps": 50,
7
+ "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
1256
  "eval_samples_per_second": 5.502,
1257
  "eval_steps_per_second": 2.825,
1258
  "step": 800
1259
+ },
1260
+ {
1261
+ "epoch": 0.805,
1262
+ "grad_norm": 8.3125,
1263
+ "learning_rate": 5e-05,
1264
+ "loss": 2.9799240112304686,
1265
+ "step": 805
1266
+ },
1267
+ {
1268
+ "epoch": 0.81,
1269
+ "grad_norm": 7.9375,
1270
+ "learning_rate": 5e-05,
1271
+ "loss": 3.0026453018188475,
1272
+ "step": 810
1273
+ },
1274
+ {
1275
+ "epoch": 0.815,
1276
+ "grad_norm": 1.65625,
1277
+ "learning_rate": 5e-05,
1278
+ "loss": 2.999722480773926,
1279
+ "step": 815
1280
+ },
1281
+ {
1282
+ "epoch": 0.82,
1283
+ "grad_norm": 1.265625,
1284
+ "learning_rate": 5e-05,
1285
+ "loss": 2.966134452819824,
1286
+ "step": 820
1287
+ },
1288
+ {
1289
+ "epoch": 0.825,
1290
+ "grad_norm": 340.0,
1291
+ "learning_rate": 5e-05,
1292
+ "loss": 2.979732322692871,
1293
+ "step": 825
1294
+ },
1295
+ {
1296
+ "epoch": 0.83,
1297
+ "grad_norm": 34.5,
1298
+ "learning_rate": 5e-05,
1299
+ "loss": 3.0184419631958006,
1300
+ "step": 830
1301
+ },
1302
+ {
1303
+ "epoch": 0.835,
1304
+ "grad_norm": 4.71875,
1305
+ "learning_rate": 5e-05,
1306
+ "loss": 2.978903961181641,
1307
+ "step": 835
1308
+ },
1309
+ {
1310
+ "epoch": 0.84,
1311
+ "grad_norm": 7.75,
1312
+ "learning_rate": 5e-05,
1313
+ "loss": 3.000539016723633,
1314
+ "step": 840
1315
+ },
1316
+ {
1317
+ "epoch": 0.845,
1318
+ "grad_norm": 3.0,
1319
+ "learning_rate": 5e-05,
1320
+ "loss": 2.962353515625,
1321
+ "step": 845
1322
+ },
1323
+ {
1324
+ "epoch": 0.85,
1325
+ "grad_norm": 2.171875,
1326
+ "learning_rate": 5e-05,
1327
+ "loss": 2.9898805618286133,
1328
+ "step": 850
1329
+ },
1330
+ {
1331
+ "epoch": 0.85,
1332
+ "eval_loss": 3.2711822986602783,
1333
+ "eval_runtime": 6.7266,
1334
+ "eval_samples_per_second": 5.501,
1335
+ "eval_steps_per_second": 2.825,
1336
+ "step": 850
1337
+ },
1338
+ {
1339
+ "epoch": 0.855,
1340
+ "grad_norm": 4.34375,
1341
+ "learning_rate": 5e-05,
1342
+ "loss": 2.973104476928711,
1343
+ "step": 855
1344
+ },
1345
+ {
1346
+ "epoch": 0.86,
1347
+ "grad_norm": 6.21875,
1348
+ "learning_rate": 5e-05,
1349
+ "loss": 3.00762996673584,
1350
+ "step": 860
1351
+ },
1352
+ {
1353
+ "epoch": 0.865,
1354
+ "grad_norm": 3.96875,
1355
+ "learning_rate": 5e-05,
1356
+ "loss": 2.9680364608764647,
1357
+ "step": 865
1358
+ },
1359
+ {
1360
+ "epoch": 0.87,
1361
+ "grad_norm": 3.546875,
1362
+ "learning_rate": 5e-05,
1363
+ "loss": 2.9908233642578126,
1364
+ "step": 870
1365
+ },
1366
+ {
1367
+ "epoch": 0.875,
1368
+ "grad_norm": 5.25,
1369
+ "learning_rate": 5e-05,
1370
+ "loss": 2.9942108154296876,
1371
+ "step": 875
1372
+ },
1373
+ {
1374
+ "epoch": 0.88,
1375
+ "grad_norm": 7.25,
1376
+ "learning_rate": 5e-05,
1377
+ "loss": 2.966433525085449,
1378
+ "step": 880
1379
+ },
1380
+ {
1381
+ "epoch": 0.885,
1382
+ "grad_norm": 6.84375,
1383
+ "learning_rate": 5e-05,
1384
+ "loss": 2.9872104644775392,
1385
+ "step": 885
1386
+ },
1387
+ {
1388
+ "epoch": 0.89,
1389
+ "grad_norm": 2.3125,
1390
+ "learning_rate": 5e-05,
1391
+ "loss": 2.9889734268188475,
1392
+ "step": 890
1393
+ },
1394
+ {
1395
+ "epoch": 0.895,
1396
+ "grad_norm": 4.46875,
1397
+ "learning_rate": 5e-05,
1398
+ "loss": 2.9673152923583985,
1399
+ "step": 895
1400
+ },
1401
+ {
1402
+ "epoch": 0.9,
1403
+ "grad_norm": 5.15625,
1404
+ "learning_rate": 5e-05,
1405
+ "loss": 2.992472267150879,
1406
+ "step": 900
1407
+ },
1408
+ {
1409
+ "epoch": 0.9,
1410
+ "eval_loss": 3.269010066986084,
1411
+ "eval_runtime": 6.7827,
1412
+ "eval_samples_per_second": 5.455,
1413
+ "eval_steps_per_second": 2.801,
1414
+ "step": 900
1415
+ },
1416
+ {
1417
+ "epoch": 0.905,
1418
+ "grad_norm": 1.7890625,
1419
+ "learning_rate": 5e-05,
1420
+ "loss": 2.982642936706543,
1421
+ "step": 905
1422
+ },
1423
+ {
1424
+ "epoch": 0.91,
1425
+ "grad_norm": 7.4375,
1426
+ "learning_rate": 5e-05,
1427
+ "loss": 3.015847396850586,
1428
+ "step": 910
1429
+ },
1430
+ {
1431
+ "epoch": 0.915,
1432
+ "grad_norm": 5376.0,
1433
+ "learning_rate": 5e-05,
1434
+ "loss": 3.003455924987793,
1435
+ "step": 915
1436
+ },
1437
+ {
1438
+ "epoch": 0.92,
1439
+ "grad_norm": 0.83984375,
1440
+ "learning_rate": 5e-05,
1441
+ "loss": 2.987352180480957,
1442
+ "step": 920
1443
+ },
1444
+ {
1445
+ "epoch": 0.925,
1446
+ "grad_norm": 1.9921875,
1447
+ "learning_rate": 5e-05,
1448
+ "loss": 2.9890872955322267,
1449
+ "step": 925
1450
+ },
1451
+ {
1452
+ "epoch": 0.93,
1453
+ "grad_norm": 352.0,
1454
+ "learning_rate": 5e-05,
1455
+ "loss": 2.990787315368652,
1456
+ "step": 930
1457
+ },
1458
+ {
1459
+ "epoch": 0.935,
1460
+ "grad_norm": 9.5,
1461
+ "learning_rate": 5e-05,
1462
+ "loss": 2.950652313232422,
1463
+ "step": 935
1464
+ },
1465
+ {
1466
+ "epoch": 0.94,
1467
+ "grad_norm": 84.5,
1468
+ "learning_rate": 5e-05,
1469
+ "loss": 2.978129768371582,
1470
+ "step": 940
1471
+ },
1472
+ {
1473
+ "epoch": 0.945,
1474
+ "grad_norm": 900.0,
1475
+ "learning_rate": 5e-05,
1476
+ "loss": 2.9651300430297853,
1477
+ "step": 945
1478
+ },
1479
+ {
1480
+ "epoch": 0.95,
1481
+ "grad_norm": 17.75,
1482
+ "learning_rate": 5e-05,
1483
+ "loss": 2.940041351318359,
1484
+ "step": 950
1485
+ },
1486
+ {
1487
+ "epoch": 0.95,
1488
+ "eval_loss": 3.2654120922088623,
1489
+ "eval_runtime": 6.7595,
1490
+ "eval_samples_per_second": 5.474,
1491
+ "eval_steps_per_second": 2.811,
1492
+ "step": 950
1493
+ },
1494
+ {
1495
+ "epoch": 0.955,
1496
+ "grad_norm": 5.25,
1497
+ "learning_rate": 5e-05,
1498
+ "loss": 2.9906681060791014,
1499
+ "step": 955
1500
+ },
1501
+ {
1502
+ "epoch": 0.96,
1503
+ "grad_norm": 1.65625,
1504
+ "learning_rate": 5e-05,
1505
+ "loss": 2.965926933288574,
1506
+ "step": 960
1507
+ },
1508
+ {
1509
+ "epoch": 0.965,
1510
+ "grad_norm": 1.9609375,
1511
+ "learning_rate": 5e-05,
1512
+ "loss": 3.0010139465332033,
1513
+ "step": 965
1514
+ },
1515
+ {
1516
+ "epoch": 0.97,
1517
+ "grad_norm": 24.625,
1518
+ "learning_rate": 5e-05,
1519
+ "loss": 2.9550275802612305,
1520
+ "step": 970
1521
+ },
1522
+ {
1523
+ "epoch": 0.975,
1524
+ "grad_norm": 2.515625,
1525
+ "learning_rate": 5e-05,
1526
+ "loss": 2.970465660095215,
1527
+ "step": 975
1528
+ },
1529
+ {
1530
+ "epoch": 0.98,
1531
+ "grad_norm": 3.4375,
1532
+ "learning_rate": 5e-05,
1533
+ "loss": 2.9523544311523438,
1534
+ "step": 980
1535
+ },
1536
+ {
1537
+ "epoch": 0.985,
1538
+ "grad_norm": 14.625,
1539
+ "learning_rate": 5e-05,
1540
+ "loss": 3.002934455871582,
1541
+ "step": 985
1542
+ },
1543
+ {
1544
+ "epoch": 0.99,
1545
+ "grad_norm": 2.921875,
1546
+ "learning_rate": 5e-05,
1547
+ "loss": 2.964326286315918,
1548
+ "step": 990
1549
+ },
1550
+ {
1551
+ "epoch": 0.995,
1552
+ "grad_norm": 3.625,
1553
+ "learning_rate": 5e-05,
1554
+ "loss": 2.9944055557250975,
1555
+ "step": 995
1556
+ },
1557
+ {
1558
+ "epoch": 1.0,
1559
+ "grad_norm": 11.9375,
1560
+ "learning_rate": 5e-05,
1561
+ "loss": 2.9779850006103517,
1562
+ "step": 1000
1563
+ },
1564
+ {
1565
+ "epoch": 1.0,
1566
+ "eval_loss": 3.2615818977355957,
1567
+ "eval_runtime": 6.7329,
1568
+ "eval_samples_per_second": 5.495,
1569
+ "eval_steps_per_second": 2.822,
1570
+ "step": 1000
1571
  }
1572
  ],
1573
  "logging_steps": 5,
 
1582
  "should_evaluate": false,
1583
  "should_log": false,
1584
  "should_save": true,
1585
+ "should_training_stop": true
1586
  },
1587
  "attributes": {}
1588
  }
1589
  },
1590
+ "total_flos": 2.89915124318208e+17,
1591
  "train_batch_size": 2,
1592
  "trial_name": null,
1593
  "trial_params": null