CodeIsAbstract commited on
Commit
331e351
·
verified ·
1 Parent(s): d4baa95

Training in progress, step 400, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f1667d99a96ad5cb29eb160a75cf57e6261a57f94a6977cb349352b60b474348
3
  size 234681136
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d6b5c8ae3ce3b75a3efb3cea4f0f22e522106b7a7a11f76b184da7ea8f0464cc
3
  size 234681136
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d71d76688106c6022a569bff766a27999a94d992a3474abcb023497e879be7d6
3
  size 469516363
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:abe10937b2346f32a25ef8a726c3a45c358a8eb207991431dcbb7ddc785c611f
3
  size 469516363
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ca0548a1b90eaf6590b9f6afac3530aaed1157198c5a087c4229ad15001933d9
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ba03b8c06ab7ab86dfbcbefe7ba1358ea78b1ce004b09a6a9e08759669880b0f
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c6478687c94fc773ca07ae69fabf281a4cf0d33eb166ffa8a9b1ab472661ba00
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b1c37070e6eb9d511a4f7c71d2c3f18ff0f2b091f4acb310e39c4f3f39019ddf
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.2,
6
  "eval_steps": 50,
7
- "global_step": 200,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -320,6 +320,318 @@
320
  "eval_samples_per_second": 5.514,
321
  "eval_steps_per_second": 2.832,
322
  "step": 200
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
323
  }
324
  ],
325
  "logging_steps": 5,
@@ -339,7 +651,7 @@
339
  "attributes": {}
340
  }
341
  },
342
- "total_flos": 5.79830248636416e+16,
343
  "train_batch_size": 2,
344
  "trial_name": null,
345
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.4,
6
  "eval_steps": 50,
7
+ "global_step": 400,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
320
  "eval_samples_per_second": 5.514,
321
  "eval_steps_per_second": 2.832,
322
  "step": 200
323
+ },
324
+ {
325
+ "epoch": 0.205,
326
+ "grad_norm": 9.0625,
327
+ "learning_rate": 5e-05,
328
+ "loss": 3.09683895111084,
329
+ "step": 205
330
+ },
331
+ {
332
+ "epoch": 0.21,
333
+ "grad_norm": 43.25,
334
+ "learning_rate": 5e-05,
335
+ "loss": 3.141134834289551,
336
+ "step": 210
337
+ },
338
+ {
339
+ "epoch": 0.215,
340
+ "grad_norm": 2.4375,
341
+ "learning_rate": 5e-05,
342
+ "loss": 3.100748825073242,
343
+ "step": 215
344
+ },
345
+ {
346
+ "epoch": 0.22,
347
+ "grad_norm": 12.5625,
348
+ "learning_rate": 5e-05,
349
+ "loss": 3.0931968688964844,
350
+ "step": 220
351
+ },
352
+ {
353
+ "epoch": 0.225,
354
+ "grad_norm": 4.53125,
355
+ "learning_rate": 5e-05,
356
+ "loss": 3.0807849884033205,
357
+ "step": 225
358
+ },
359
+ {
360
+ "epoch": 0.23,
361
+ "grad_norm": 5.03125,
362
+ "learning_rate": 5e-05,
363
+ "loss": 3.1373645782470705,
364
+ "step": 230
365
+ },
366
+ {
367
+ "epoch": 0.235,
368
+ "grad_norm": 482.0,
369
+ "learning_rate": 5e-05,
370
+ "loss": 3.086713409423828,
371
+ "step": 235
372
+ },
373
+ {
374
+ "epoch": 0.24,
375
+ "grad_norm": 8.8125,
376
+ "learning_rate": 5e-05,
377
+ "loss": 3.107415199279785,
378
+ "step": 240
379
+ },
380
+ {
381
+ "epoch": 0.245,
382
+ "grad_norm": 35.25,
383
+ "learning_rate": 5e-05,
384
+ "loss": 3.1350580215454102,
385
+ "step": 245
386
+ },
387
+ {
388
+ "epoch": 0.25,
389
+ "grad_norm": 10.8125,
390
+ "learning_rate": 5e-05,
391
+ "loss": 3.085038757324219,
392
+ "step": 250
393
+ },
394
+ {
395
+ "epoch": 0.25,
396
+ "eval_loss": 3.35124135017395,
397
+ "eval_runtime": 6.7488,
398
+ "eval_samples_per_second": 5.482,
399
+ "eval_steps_per_second": 2.815,
400
+ "step": 250
401
+ },
402
+ {
403
+ "epoch": 0.255,
404
+ "grad_norm": 7.78125,
405
+ "learning_rate": 5e-05,
406
+ "loss": 3.0779041290283202,
407
+ "step": 255
408
+ },
409
+ {
410
+ "epoch": 0.26,
411
+ "grad_norm": 8.9375,
412
+ "learning_rate": 5e-05,
413
+ "loss": 3.0426475524902346,
414
+ "step": 260
415
+ },
416
+ {
417
+ "epoch": 0.265,
418
+ "grad_norm": 1.9765625,
419
+ "learning_rate": 5e-05,
420
+ "loss": 3.108402442932129,
421
+ "step": 265
422
+ },
423
+ {
424
+ "epoch": 0.27,
425
+ "grad_norm": 10.125,
426
+ "learning_rate": 5e-05,
427
+ "loss": 3.068155288696289,
428
+ "step": 270
429
+ },
430
+ {
431
+ "epoch": 0.275,
432
+ "grad_norm": 25.625,
433
+ "learning_rate": 5e-05,
434
+ "loss": 3.0750944137573244,
435
+ "step": 275
436
+ },
437
+ {
438
+ "epoch": 0.28,
439
+ "grad_norm": 1.609375,
440
+ "learning_rate": 5e-05,
441
+ "loss": 3.0479175567626955,
442
+ "step": 280
443
+ },
444
+ {
445
+ "epoch": 0.285,
446
+ "grad_norm": 50.75,
447
+ "learning_rate": 5e-05,
448
+ "loss": 3.088734817504883,
449
+ "step": 285
450
+ },
451
+ {
452
+ "epoch": 0.29,
453
+ "grad_norm": 8.8125,
454
+ "learning_rate": 5e-05,
455
+ "loss": 3.0425872802734375,
456
+ "step": 290
457
+ },
458
+ {
459
+ "epoch": 0.295,
460
+ "grad_norm": 18.5,
461
+ "learning_rate": 5e-05,
462
+ "loss": 3.0785484313964844,
463
+ "step": 295
464
+ },
465
+ {
466
+ "epoch": 0.3,
467
+ "grad_norm": 7.3125,
468
+ "learning_rate": 5e-05,
469
+ "loss": 3.067402648925781,
470
+ "step": 300
471
+ },
472
+ {
473
+ "epoch": 0.3,
474
+ "eval_loss": 3.339944839477539,
475
+ "eval_runtime": 6.7462,
476
+ "eval_samples_per_second": 5.485,
477
+ "eval_steps_per_second": 2.816,
478
+ "step": 300
479
+ },
480
+ {
481
+ "epoch": 0.305,
482
+ "grad_norm": 7.25,
483
+ "learning_rate": 5e-05,
484
+ "loss": 3.063138961791992,
485
+ "step": 305
486
+ },
487
+ {
488
+ "epoch": 0.31,
489
+ "grad_norm": 22.5,
490
+ "learning_rate": 5e-05,
491
+ "loss": 3.0437475204467774,
492
+ "step": 310
493
+ },
494
+ {
495
+ "epoch": 0.315,
496
+ "grad_norm": 9.75,
497
+ "learning_rate": 5e-05,
498
+ "loss": 3.0719404220581055,
499
+ "step": 315
500
+ },
501
+ {
502
+ "epoch": 0.32,
503
+ "grad_norm": 8.75,
504
+ "learning_rate": 5e-05,
505
+ "loss": 3.0688711166381837,
506
+ "step": 320
507
+ },
508
+ {
509
+ "epoch": 0.325,
510
+ "grad_norm": 2.671875,
511
+ "learning_rate": 5e-05,
512
+ "loss": 3.0548662185668944,
513
+ "step": 325
514
+ },
515
+ {
516
+ "epoch": 0.33,
517
+ "grad_norm": 12.6875,
518
+ "learning_rate": 5e-05,
519
+ "loss": 3.057333564758301,
520
+ "step": 330
521
+ },
522
+ {
523
+ "epoch": 0.335,
524
+ "grad_norm": 298.0,
525
+ "learning_rate": 5e-05,
526
+ "loss": 3.0870180130004883,
527
+ "step": 335
528
+ },
529
+ {
530
+ "epoch": 0.34,
531
+ "grad_norm": 18.375,
532
+ "learning_rate": 5e-05,
533
+ "loss": 3.051515579223633,
534
+ "step": 340
535
+ },
536
+ {
537
+ "epoch": 0.345,
538
+ "grad_norm": 44.0,
539
+ "learning_rate": 5e-05,
540
+ "loss": 3.0610748291015626,
541
+ "step": 345
542
+ },
543
+ {
544
+ "epoch": 0.35,
545
+ "grad_norm": 11.6875,
546
+ "learning_rate": 5e-05,
547
+ "loss": 3.02484016418457,
548
+ "step": 350
549
+ },
550
+ {
551
+ "epoch": 0.35,
552
+ "eval_loss": 3.328155755996704,
553
+ "eval_runtime": 6.6732,
554
+ "eval_samples_per_second": 5.545,
555
+ "eval_steps_per_second": 2.847,
556
+ "step": 350
557
+ },
558
+ {
559
+ "epoch": 0.355,
560
+ "grad_norm": 17.875,
561
+ "learning_rate": 5e-05,
562
+ "loss": 3.0564363479614256,
563
+ "step": 355
564
+ },
565
+ {
566
+ "epoch": 0.36,
567
+ "grad_norm": 2.6875,
568
+ "learning_rate": 5e-05,
569
+ "loss": 3.068992805480957,
570
+ "step": 360
571
+ },
572
+ {
573
+ "epoch": 0.365,
574
+ "grad_norm": 1.5078125,
575
+ "learning_rate": 5e-05,
576
+ "loss": 3.0664575576782225,
577
+ "step": 365
578
+ },
579
+ {
580
+ "epoch": 0.37,
581
+ "grad_norm": 204.0,
582
+ "learning_rate": 5e-05,
583
+ "loss": 3.015609931945801,
584
+ "step": 370
585
+ },
586
+ {
587
+ "epoch": 0.375,
588
+ "grad_norm": 296.0,
589
+ "learning_rate": 5e-05,
590
+ "loss": 3.0494104385375977,
591
+ "step": 375
592
+ },
593
+ {
594
+ "epoch": 0.38,
595
+ "grad_norm": 1024.0,
596
+ "learning_rate": 5e-05,
597
+ "loss": 3.0338293075561524,
598
+ "step": 380
599
+ },
600
+ {
601
+ "epoch": 0.385,
602
+ "grad_norm": 7.4375,
603
+ "learning_rate": 5e-05,
604
+ "loss": 3.037934684753418,
605
+ "step": 385
606
+ },
607
+ {
608
+ "epoch": 0.39,
609
+ "grad_norm": 3.28125,
610
+ "learning_rate": 5e-05,
611
+ "loss": 3.0603221893310546,
612
+ "step": 390
613
+ },
614
+ {
615
+ "epoch": 0.395,
616
+ "grad_norm": 17.125,
617
+ "learning_rate": 5e-05,
618
+ "loss": 3.0717981338500975,
619
+ "step": 395
620
+ },
621
+ {
622
+ "epoch": 0.4,
623
+ "grad_norm": 44.75,
624
+ "learning_rate": 5e-05,
625
+ "loss": 3.0237457275390627,
626
+ "step": 400
627
+ },
628
+ {
629
+ "epoch": 0.4,
630
+ "eval_loss": 3.322870969772339,
631
+ "eval_runtime": 6.749,
632
+ "eval_samples_per_second": 5.482,
633
+ "eval_steps_per_second": 2.815,
634
+ "step": 400
635
  }
636
  ],
637
  "logging_steps": 5,
 
651
  "attributes": {}
652
  }
653
  },
654
+ "total_flos": 1.159660497272832e+17,
655
  "train_batch_size": 2,
656
  "trial_name": null,
657
  "trial_params": null