CodeIsAbstract commited on
Commit
d01bdb9
·
verified ·
1 Parent(s): dd79142

Training in progress, step 4000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b9d9ea30bd9c708493572bd44e3256c83dc3c2f0da6636321410d4a296da4fce
3
  size 570000656
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3fb7bbba242fd1734bca682ecab7164010d011d4bae150f9c01b35c4e5ae214b
3
  size 570000656
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8c473a88f8a30921081abbf5456efaacd00f88eda77799e15230de46b74af750
3
  size 1622091
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:07069eb476da26ea80f4f21b5c52a128f07b59f88d65cea432ed4249827df3da
3
  size 1622091
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5b3ee6aa25e2d997147f110f0106bfa09c947f3a17a42ac631fe9fd10d359c64
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1103853b7e1b9edd1b48dc1d37f3d3e771a7bed8926820b7285cfab008291eee
3
  size 14469
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:312862b75420285bfb1144ee02e5d98151fa644e025e2b8bdf98a1cfb6bf1784
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f6e4157ae1d527e6faa3a1b54958e4ae79ca685866a1b9d3709ada96cdc5544b
3
  size 14469
last-checkpoint/rng_state_2.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:08c57e79b84a1cd74caf1436d7ba51e307367bec5d0e696893db9df56dd4534a
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3b3bc5cd9e8e23fa067544f348f6a8002cb45b6bc46d49ad8514270519590978
3
  size 14469
last-checkpoint/rng_state_3.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f85ac9ae48e62b6c6e8aa06bdecb611b6e6ee537c6d82b6b083d470d2f737981
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e0ed2314742cc9d6eae821f0a37ec34c1acb9b5f1a15a96a7124b4b01078fc4d
3
  size 14469
last-checkpoint/rng_state_4.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:aff24c8c76bc594a4ec846173c30674664beb048676e34f910d356116d9444f2
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:010b49e7e7f05f696c7422ea191c7f01febd0be1e95a28d27a82ba29233a5c3c
3
  size 14469
last-checkpoint/rng_state_5.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9bf16c3d4ba315c00cb40b017cfa96465f22cde05a0b5413db32688107d9373b
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c344937f1eb80674ed90208df930eefdfa96d1305c5ecdd6f71c88884d9618c4
3
  size 14469
last-checkpoint/rng_state_6.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9c75e30f4407f49e03a0397235b46bd9e402554a12147d65fe85d21a0fbfedb6
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:47845359879e4287eb6b33abc23646b7b3c47e35ecfc2924ee9249c6266386da
3
  size 14469
last-checkpoint/rng_state_7.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d9413bda3b0c7ad2808ddc0f627a8614796347dd04936bc178f8cb262d5460fd
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9b9614a31010cd351d1cda78d31fd350abfc95e0db8e88f38df316e5bf0e3457
3
  size 14469
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:aa66f2dbce1093003d024195070a3c39d20fa11c87dce6abb88ed9710e3bf6f3
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ccc95881d63aeb232a0d233120305836db2087b7d53cc84df6ba9d3559169ce0
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.2727272727272727,
6
  "eval_steps": 100,
7
- "global_step": 3000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
@@ -2348,6 +2348,786 @@
2348
  "eval_samples_per_second": 1.784,
2349
  "eval_steps_per_second": 0.446,
2350
  "step": 3000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
2351
  }
2352
  ],
2353
  "logging_steps": 10,
@@ -2367,7 +3147,7 @@
2367
  "attributes": {}
2368
  }
2369
  },
2370
- "total_flos": 1.3589771452416e+16,
2371
  "train_batch_size": 1,
2372
  "trial_name": null,
2373
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.36363636363636365,
6
  "eval_steps": 100,
7
+ "global_step": 4000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
 
2348
  "eval_samples_per_second": 1.784,
2349
  "eval_steps_per_second": 0.446,
2350
  "step": 3000
2351
+ },
2352
+ {
2353
+ "epoch": 0.2736363636363636,
2354
+ "grad_norm": 44478215749632.0,
2355
+ "learning_rate": 8.26457999307125e-07,
2356
+ "loss": 30.9502685546875,
2357
+ "step": 3010
2358
+ },
2359
+ {
2360
+ "epoch": 0.27454545454545454,
2361
+ "grad_norm": 75005027155968.0,
2362
+ "learning_rate": 8.253750613925234e-07,
2363
+ "loss": 31.542059326171874,
2364
+ "step": 3020
2365
+ },
2366
+ {
2367
+ "epoch": 0.27545454545454545,
2368
+ "grad_norm": 47266672934912.0,
2369
+ "learning_rate": 8.242894694936614e-07,
2370
+ "loss": 30.897921752929687,
2371
+ "step": 3030
2372
+ },
2373
+ {
2374
+ "epoch": 0.27636363636363637,
2375
+ "grad_norm": 45886398791680.0,
2376
+ "learning_rate": 8.23201232465378e-07,
2377
+ "loss": 31.505227661132814,
2378
+ "step": 3040
2379
+ },
2380
+ {
2381
+ "epoch": 0.2772727272727273,
2382
+ "grad_norm": 127583672860672.0,
2383
+ "learning_rate": 8.221103591840881e-07,
2384
+ "loss": 31.139892578125,
2385
+ "step": 3050
2386
+ },
2387
+ {
2388
+ "epoch": 0.2781818181818182,
2389
+ "grad_norm": 174062391263232.0,
2390
+ "learning_rate": 8.210168585477091e-07,
2391
+ "loss": 31.437637329101562,
2392
+ "step": 3060
2393
+ },
2394
+ {
2395
+ "epoch": 0.2790909090909091,
2396
+ "grad_norm": 210010848100352.0,
2397
+ "learning_rate": 8.199207394755891e-07,
2398
+ "loss": 30.945309448242188,
2399
+ "step": 3070
2400
+ },
2401
+ {
2402
+ "epoch": 0.28,
2403
+ "grad_norm": 141527191912448.0,
2404
+ "learning_rate": 8.188220109084346e-07,
2405
+ "loss": 31.963729858398438,
2406
+ "step": 3080
2407
+ },
2408
+ {
2409
+ "epoch": 0.2809090909090909,
2410
+ "grad_norm": 269273947701248.0,
2411
+ "learning_rate": 8.17720681808236e-07,
2412
+ "loss": 31.625100708007814,
2413
+ "step": 3090
2414
+ },
2415
+ {
2416
+ "epoch": 0.2818181818181818,
2417
+ "grad_norm": 90777153699840.0,
2418
+ "learning_rate": 8.16616761158196e-07,
2419
+ "loss": 31.37896728515625,
2420
+ "step": 3100
2421
+ },
2422
+ {
2423
+ "epoch": 0.2818181818181818,
2424
+ "eval_loss": 31.08748435974121,
2425
+ "eval_runtime": 2.2472,
2426
+ "eval_samples_per_second": 1.78,
2427
+ "eval_steps_per_second": 0.445,
2428
+ "step": 3100
2429
+ },
2430
+ {
2431
+ "epoch": 0.2827272727272727,
2432
+ "grad_norm": 85872594649088.0,
2433
+ "learning_rate": 8.155102579626558e-07,
2434
+ "loss": 31.415878295898438,
2435
+ "step": 3110
2436
+ },
2437
+ {
2438
+ "epoch": 0.28363636363636363,
2439
+ "grad_norm": 128033721679872.0,
2440
+ "learning_rate": 8.144011812470215e-07,
2441
+ "loss": 31.359136962890624,
2442
+ "step": 3120
2443
+ },
2444
+ {
2445
+ "epoch": 0.28454545454545455,
2446
+ "grad_norm": 58961826938880.0,
2447
+ "learning_rate": 8.132895400576904e-07,
2448
+ "loss": 31.53883056640625,
2449
+ "step": 3130
2450
+ },
2451
+ {
2452
+ "epoch": 0.28545454545454546,
2453
+ "grad_norm": 130452350304256.0,
2454
+ "learning_rate": 8.121753434619778e-07,
2455
+ "loss": 31.31527099609375,
2456
+ "step": 3140
2457
+ },
2458
+ {
2459
+ "epoch": 0.2863636363636364,
2460
+ "grad_norm": 39132558524416.0,
2461
+ "learning_rate": 8.110586005480426e-07,
2462
+ "loss": 30.843875122070312,
2463
+ "step": 3150
2464
+ },
2465
+ {
2466
+ "epoch": 0.2872727272727273,
2467
+ "grad_norm": 162498661580800.0,
2468
+ "learning_rate": 8.09939320424813e-07,
2469
+ "loss": 30.928125,
2470
+ "step": 3160
2471
+ },
2472
+ {
2473
+ "epoch": 0.2881818181818182,
2474
+ "grad_norm": 30503648362496.0,
2475
+ "learning_rate": 8.088175122219127e-07,
2476
+ "loss": 31.2546142578125,
2477
+ "step": 3170
2478
+ },
2479
+ {
2480
+ "epoch": 0.28909090909090907,
2481
+ "grad_norm": 264652227346432.0,
2482
+ "learning_rate": 8.076931850895858e-07,
2483
+ "loss": 31.682107543945314,
2484
+ "step": 3180
2485
+ },
2486
+ {
2487
+ "epoch": 0.29,
2488
+ "grad_norm": 43181974487040.0,
2489
+ "learning_rate": 8.065663481986229e-07,
2490
+ "loss": 31.056671142578125,
2491
+ "step": 3190
2492
+ },
2493
+ {
2494
+ "epoch": 0.2909090909090909,
2495
+ "grad_norm": 81322110353408.0,
2496
+ "learning_rate": 8.054370107402858e-07,
2497
+ "loss": 31.157467651367188,
2498
+ "step": 3200
2499
+ },
2500
+ {
2501
+ "epoch": 0.2909090909090909,
2502
+ "eval_loss": 31.095945358276367,
2503
+ "eval_runtime": 2.2422,
2504
+ "eval_samples_per_second": 1.784,
2505
+ "eval_steps_per_second": 0.446,
2506
+ "step": 3200
2507
+ },
2508
+ {
2509
+ "epoch": 0.2918181818181818,
2510
+ "grad_norm": 82796911525888.0,
2511
+ "learning_rate": 8.043051819262327e-07,
2512
+ "loss": 31.241659545898436,
2513
+ "step": 3210
2514
+ },
2515
+ {
2516
+ "epoch": 0.2927272727272727,
2517
+ "grad_norm": 66819532521472.0,
2518
+ "learning_rate": 8.031708709884429e-07,
2519
+ "loss": 31.24657287597656,
2520
+ "step": 3220
2521
+ },
2522
+ {
2523
+ "epoch": 0.29363636363636364,
2524
+ "grad_norm": 151652912857088.0,
2525
+ "learning_rate": 8.020340871791417e-07,
2526
+ "loss": 31.857916259765624,
2527
+ "step": 3230
2528
+ },
2529
+ {
2530
+ "epoch": 0.29454545454545455,
2531
+ "grad_norm": 33395514015744.0,
2532
+ "learning_rate": 8.008948397707252e-07,
2533
+ "loss": 31.493441772460937,
2534
+ "step": 3240
2535
+ },
2536
+ {
2537
+ "epoch": 0.29545454545454547,
2538
+ "grad_norm": 186848542457856.0,
2539
+ "learning_rate": 7.997531380556833e-07,
2540
+ "loss": 31.500466918945314,
2541
+ "step": 3250
2542
+ },
2543
+ {
2544
+ "epoch": 0.2963636363636364,
2545
+ "grad_norm": 87677269442560.0,
2546
+ "learning_rate": 7.986089913465261e-07,
2547
+ "loss": 30.997119140625,
2548
+ "step": 3260
2549
+ },
2550
+ {
2551
+ "epoch": 0.2972727272727273,
2552
+ "grad_norm": 73329570480128.0,
2553
+ "learning_rate": 7.974624089757064e-07,
2554
+ "loss": 31.911077880859374,
2555
+ "step": 3270
2556
+ },
2557
+ {
2558
+ "epoch": 0.29818181818181816,
2559
+ "grad_norm": 134268890120192.0,
2560
+ "learning_rate": 7.963134002955431e-07,
2561
+ "loss": 31.09755859375,
2562
+ "step": 3280
2563
+ },
2564
+ {
2565
+ "epoch": 0.2990909090909091,
2566
+ "grad_norm": 57569158627328.0,
2567
+ "learning_rate": 7.951619746781472e-07,
2568
+ "loss": 31.29901123046875,
2569
+ "step": 3290
2570
+ },
2571
+ {
2572
+ "epoch": 0.3,
2573
+ "grad_norm": 58610235211776.0,
2574
+ "learning_rate": 7.940081415153428e-07,
2575
+ "loss": 31.30848388671875,
2576
+ "step": 3300
2577
+ },
2578
+ {
2579
+ "epoch": 0.3,
2580
+ "eval_loss": 31.100173950195312,
2581
+ "eval_runtime": 2.2403,
2582
+ "eval_samples_per_second": 1.785,
2583
+ "eval_steps_per_second": 0.446,
2584
+ "step": 3300
2585
+ },
2586
+ {
2587
+ "epoch": 0.3009090909090909,
2588
+ "grad_norm": 386970849116160.0,
2589
+ "learning_rate": 7.928519102185922e-07,
2590
+ "loss": 31.135516357421874,
2591
+ "step": 3310
2592
+ },
2593
+ {
2594
+ "epoch": 0.3018181818181818,
2595
+ "grad_norm": 288033458880512.0,
2596
+ "learning_rate": 7.91693290218918e-07,
2597
+ "loss": 31.321795654296874,
2598
+ "step": 3320
2599
+ },
2600
+ {
2601
+ "epoch": 0.30272727272727273,
2602
+ "grad_norm": 83541618589696.0,
2603
+ "learning_rate": 7.905322909668272e-07,
2604
+ "loss": 30.953836059570314,
2605
+ "step": 3330
2606
+ },
2607
+ {
2608
+ "epoch": 0.30363636363636365,
2609
+ "grad_norm": 77461295464448.0,
2610
+ "learning_rate": 7.893689219322336e-07,
2611
+ "loss": 31.53773193359375,
2612
+ "step": 3340
2613
+ },
2614
+ {
2615
+ "epoch": 0.30454545454545456,
2616
+ "grad_norm": 75457584168960.0,
2617
+ "learning_rate": 7.882031926043803e-07,
2618
+ "loss": 31.441778564453124,
2619
+ "step": 3350
2620
+ },
2621
+ {
2622
+ "epoch": 0.3054545454545455,
2623
+ "grad_norm": 52945127211008.0,
2624
+ "learning_rate": 7.870351124917629e-07,
2625
+ "loss": 31.60285339355469,
2626
+ "step": 3360
2627
+ },
2628
+ {
2629
+ "epoch": 0.30636363636363634,
2630
+ "grad_norm": 81810528665600.0,
2631
+ "learning_rate": 7.858646911220512e-07,
2632
+ "loss": 31.419757080078124,
2633
+ "step": 3370
2634
+ },
2635
+ {
2636
+ "epoch": 0.30727272727272725,
2637
+ "grad_norm": 103102694817792.0,
2638
+ "learning_rate": 7.846919380420125e-07,
2639
+ "loss": 31.411013793945312,
2640
+ "step": 3380
2641
+ },
2642
+ {
2643
+ "epoch": 0.30818181818181817,
2644
+ "grad_norm": 181314292547584.0,
2645
+ "learning_rate": 7.835168628174325e-07,
2646
+ "loss": 30.9938232421875,
2647
+ "step": 3390
2648
+ },
2649
+ {
2650
+ "epoch": 0.3090909090909091,
2651
+ "grad_norm": 64268049317888.0,
2652
+ "learning_rate": 7.823394750330386e-07,
2653
+ "loss": 31.72479248046875,
2654
+ "step": 3400
2655
+ },
2656
+ {
2657
+ "epoch": 0.3090909090909091,
2658
+ "eval_loss": 31.11138153076172,
2659
+ "eval_runtime": 2.2524,
2660
+ "eval_samples_per_second": 1.776,
2661
+ "eval_steps_per_second": 0.444,
2662
+ "step": 3400
2663
+ },
2664
+ {
2665
+ "epoch": 0.31,
2666
+ "grad_norm": 223006160846848.0,
2667
+ "learning_rate": 7.811597842924203e-07,
2668
+ "loss": 31.49818115234375,
2669
+ "step": 3410
2670
+ },
2671
+ {
2672
+ "epoch": 0.3109090909090909,
2673
+ "grad_norm": 152988916121600.0,
2674
+ "learning_rate": 7.799778002179523e-07,
2675
+ "loss": 31.330535888671875,
2676
+ "step": 3420
2677
+ },
2678
+ {
2679
+ "epoch": 0.3118181818181818,
2680
+ "grad_norm": 115639947624448.0,
2681
+ "learning_rate": 7.787935324507149e-07,
2682
+ "loss": 31.248580932617188,
2683
+ "step": 3430
2684
+ },
2685
+ {
2686
+ "epoch": 0.31272727272727274,
2687
+ "grad_norm": 52082308546560.0,
2688
+ "learning_rate": 7.776069906504159e-07,
2689
+ "loss": 30.949420166015624,
2690
+ "step": 3440
2691
+ },
2692
+ {
2693
+ "epoch": 0.31363636363636366,
2694
+ "grad_norm": 70850158002176.0,
2695
+ "learning_rate": 7.764181844953116e-07,
2696
+ "loss": 31.362625122070312,
2697
+ "step": 3450
2698
+ },
2699
+ {
2700
+ "epoch": 0.3145454545454546,
2701
+ "grad_norm": 78591157075968.0,
2702
+ "learning_rate": 7.752271236821282e-07,
2703
+ "loss": 31.381210327148438,
2704
+ "step": 3460
2705
+ },
2706
+ {
2707
+ "epoch": 0.31545454545454543,
2708
+ "grad_norm": 153667252518912.0,
2709
+ "learning_rate": 7.74033817925982e-07,
2710
+ "loss": 31.4740478515625,
2711
+ "step": 3470
2712
+ },
2713
+ {
2714
+ "epoch": 0.31636363636363635,
2715
+ "grad_norm": 52006664273920.0,
2716
+ "learning_rate": 7.728382769603011e-07,
2717
+ "loss": 31.210354614257813,
2718
+ "step": 3480
2719
+ },
2720
+ {
2721
+ "epoch": 0.31727272727272726,
2722
+ "grad_norm": 186123246632960.0,
2723
+ "learning_rate": 7.716405105367452e-07,
2724
+ "loss": 30.999267578125,
2725
+ "step": 3490
2726
+ },
2727
+ {
2728
+ "epoch": 0.3181818181818182,
2729
+ "grad_norm": 232983285989376.0,
2730
+ "learning_rate": 7.704405284251267e-07,
2731
+ "loss": 30.719741821289062,
2732
+ "step": 3500
2733
+ },
2734
+ {
2735
+ "epoch": 0.3181818181818182,
2736
+ "eval_loss": 31.12489891052246,
2737
+ "eval_runtime": 2.2583,
2738
+ "eval_samples_per_second": 1.771,
2739
+ "eval_steps_per_second": 0.443,
2740
+ "step": 3500
2741
+ },
2742
+ {
2743
+ "epoch": 0.3190909090909091,
2744
+ "grad_norm": 142378786619392.0,
2745
+ "learning_rate": 7.6923834041333e-07,
2746
+ "loss": 31.163070678710938,
2747
+ "step": 3510
2748
+ },
2749
+ {
2750
+ "epoch": 0.32,
2751
+ "grad_norm": 373457472716800.0,
2752
+ "learning_rate": 7.680339563072333e-07,
2753
+ "loss": 30.965121459960937,
2754
+ "step": 3520
2755
+ },
2756
+ {
2757
+ "epoch": 0.3209090909090909,
2758
+ "grad_norm": 59119444688896.0,
2759
+ "learning_rate": 7.668273859306269e-07,
2760
+ "loss": 31.44709167480469,
2761
+ "step": 3530
2762
+ },
2763
+ {
2764
+ "epoch": 0.32181818181818184,
2765
+ "grad_norm": 96141030981632.0,
2766
+ "learning_rate": 7.656186391251341e-07,
2767
+ "loss": 31.224566650390624,
2768
+ "step": 3540
2769
+ },
2770
+ {
2771
+ "epoch": 0.32272727272727275,
2772
+ "grad_norm": 277230374617088.0,
2773
+ "learning_rate": 7.644077257501308e-07,
2774
+ "loss": 31.22548828125,
2775
+ "step": 3550
2776
+ },
2777
+ {
2778
+ "epoch": 0.3236363636363636,
2779
+ "grad_norm": 238855160594432.0,
2780
+ "learning_rate": 7.631946556826647e-07,
2781
+ "loss": 31.30469665527344,
2782
+ "step": 3560
2783
+ },
2784
+ {
2785
+ "epoch": 0.3245454545454545,
2786
+ "grad_norm": 65425522032640.0,
2787
+ "learning_rate": 7.619794388173751e-07,
2788
+ "loss": 31.599795532226562,
2789
+ "step": 3570
2790
+ },
2791
+ {
2792
+ "epoch": 0.32545454545454544,
2793
+ "grad_norm": 51770529153024.0,
2794
+ "learning_rate": 7.60762085066412e-07,
2795
+ "loss": 30.914794921875,
2796
+ "step": 3580
2797
+ },
2798
+ {
2799
+ "epoch": 0.32636363636363636,
2800
+ "grad_norm": 100869840306176.0,
2801
+ "learning_rate": 7.595426043593556e-07,
2802
+ "loss": 31.482501220703124,
2803
+ "step": 3590
2804
+ },
2805
+ {
2806
+ "epoch": 0.32727272727272727,
2807
+ "grad_norm": 71489554481152.0,
2808
+ "learning_rate": 7.583210066431346e-07,
2809
+ "loss": 31.595437622070314,
2810
+ "step": 3600
2811
+ },
2812
+ {
2813
+ "epoch": 0.32727272727272727,
2814
+ "eval_loss": 31.137432098388672,
2815
+ "eval_runtime": 2.2584,
2816
+ "eval_samples_per_second": 1.771,
2817
+ "eval_steps_per_second": 0.443,
2818
+ "step": 3600
2819
+ },
2820
+ {
2821
+ "epoch": 0.3281818181818182,
2822
+ "grad_norm": 128388249419776.0,
2823
+ "learning_rate": 7.570973018819458e-07,
2824
+ "loss": 31.67999267578125,
2825
+ "step": 3610
2826
+ },
2827
+ {
2828
+ "epoch": 0.3290909090909091,
2829
+ "grad_norm": 48917999779840.0,
2830
+ "learning_rate": 7.558715000571725e-07,
2831
+ "loss": 31.7310791015625,
2832
+ "step": 3620
2833
+ },
2834
+ {
2835
+ "epoch": 0.33,
2836
+ "grad_norm": 81801485746176.0,
2837
+ "learning_rate": 7.546436111673027e-07,
2838
+ "loss": 31.565594482421876,
2839
+ "step": 3630
2840
+ },
2841
+ {
2842
+ "epoch": 0.33090909090909093,
2843
+ "grad_norm": 70281771089920.0,
2844
+ "learning_rate": 7.534136452278486e-07,
2845
+ "loss": 31.4003173828125,
2846
+ "step": 3640
2847
+ },
2848
+ {
2849
+ "epoch": 0.33181818181818185,
2850
+ "grad_norm": 268885236383744.0,
2851
+ "learning_rate": 7.521816122712637e-07,
2852
+ "loss": 30.847274780273438,
2853
+ "step": 3650
2854
+ },
2855
+ {
2856
+ "epoch": 0.3327272727272727,
2857
+ "grad_norm": 188701753737216.0,
2858
+ "learning_rate": 7.509475223468618e-07,
2859
+ "loss": 31.30968017578125,
2860
+ "step": 3660
2861
+ },
2862
+ {
2863
+ "epoch": 0.3336363636363636,
2864
+ "grad_norm": 203268269539328.0,
2865
+ "learning_rate": 7.497113855207347e-07,
2866
+ "loss": 31.730929565429687,
2867
+ "step": 3670
2868
+ },
2869
+ {
2870
+ "epoch": 0.33454545454545453,
2871
+ "grad_norm": 40551332184064.0,
2872
+ "learning_rate": 7.4847321187567e-07,
2873
+ "loss": 31.19182434082031,
2874
+ "step": 3680
2875
+ },
2876
+ {
2877
+ "epoch": 0.33545454545454545,
2878
+ "grad_norm": 120100707368960.0,
2879
+ "learning_rate": 7.472330115110696e-07,
2880
+ "loss": 31.216766357421875,
2881
+ "step": 3690
2882
+ },
2883
+ {
2884
+ "epoch": 0.33636363636363636,
2885
+ "grad_norm": 123142987055104.0,
2886
+ "learning_rate": 7.459907945428657e-07,
2887
+ "loss": 31.759628295898438,
2888
+ "step": 3700
2889
+ },
2890
+ {
2891
+ "epoch": 0.33636363636363636,
2892
+ "eval_loss": 31.1546630859375,
2893
+ "eval_runtime": 2.2729,
2894
+ "eval_samples_per_second": 1.76,
2895
+ "eval_steps_per_second": 0.44,
2896
+ "step": 3700
2897
+ },
2898
+ {
2899
+ "epoch": 0.3372727272727273,
2900
+ "grad_norm": 65411789881344.0,
2901
+ "learning_rate": 7.447465711034404e-07,
2902
+ "loss": 31.438787841796874,
2903
+ "step": 3710
2904
+ },
2905
+ {
2906
+ "epoch": 0.3381818181818182,
2907
+ "grad_norm": 179227156545536.0,
2908
+ "learning_rate": 7.43500351341541e-07,
2909
+ "loss": 31.2360595703125,
2910
+ "step": 3720
2911
+ },
2912
+ {
2913
+ "epoch": 0.3390909090909091,
2914
+ "grad_norm": 259052831506432.0,
2915
+ "learning_rate": 7.422521454221989e-07,
2916
+ "loss": 31.520187377929688,
2917
+ "step": 3730
2918
+ },
2919
+ {
2920
+ "epoch": 0.34,
2921
+ "grad_norm": 102227595231232.0,
2922
+ "learning_rate": 7.410019635266459e-07,
2923
+ "loss": 31.39177551269531,
2924
+ "step": 3740
2925
+ },
2926
+ {
2927
+ "epoch": 0.3409090909090909,
2928
+ "grad_norm": 68988482617344.0,
2929
+ "learning_rate": 7.397498158522306e-07,
2930
+ "loss": 31.17947998046875,
2931
+ "step": 3750
2932
+ },
2933
+ {
2934
+ "epoch": 0.3418181818181818,
2935
+ "grad_norm": 46946144223232.0,
2936
+ "learning_rate": 7.384957126123365e-07,
2937
+ "loss": 30.96776428222656,
2938
+ "step": 3760
2939
+ },
2940
+ {
2941
+ "epoch": 0.3427272727272727,
2942
+ "grad_norm": 178196901265408.0,
2943
+ "learning_rate": 7.37239664036298e-07,
2944
+ "loss": 31.246176147460936,
2945
+ "step": 3770
2946
+ },
2947
+ {
2948
+ "epoch": 0.34363636363636363,
2949
+ "grad_norm": 77915882520576.0,
2950
+ "learning_rate": 7.359816803693166e-07,
2951
+ "loss": 30.79324951171875,
2952
+ "step": 3780
2953
+ },
2954
+ {
2955
+ "epoch": 0.34454545454545454,
2956
+ "grad_norm": 78789707038720.0,
2957
+ "learning_rate": 7.347217718723783e-07,
2958
+ "loss": 31.38133850097656,
2959
+ "step": 3790
2960
+ },
2961
+ {
2962
+ "epoch": 0.34545454545454546,
2963
+ "grad_norm": 26140632678400.0,
2964
+ "learning_rate": 7.334599488221689e-07,
2965
+ "loss": 31.2718505859375,
2966
+ "step": 3800
2967
+ },
2968
+ {
2969
+ "epoch": 0.34545454545454546,
2970
+ "eval_loss": 31.167020797729492,
2971
+ "eval_runtime": 2.2566,
2972
+ "eval_samples_per_second": 1.773,
2973
+ "eval_steps_per_second": 0.443,
2974
+ "step": 3800
2975
+ },
2976
+ {
2977
+ "epoch": 0.3463636363636364,
2978
+ "grad_norm": 154810032586752.0,
2979
+ "learning_rate": 7.321962215109906e-07,
2980
+ "loss": 30.819577026367188,
2981
+ "step": 3810
2982
+ },
2983
+ {
2984
+ "epoch": 0.3472727272727273,
2985
+ "grad_norm": 118487854874624.0,
2986
+ "learning_rate": 7.309306002466787e-07,
2987
+ "loss": 31.2808837890625,
2988
+ "step": 3820
2989
+ },
2990
+ {
2991
+ "epoch": 0.3481818181818182,
2992
+ "grad_norm": 108455390085120.0,
2993
+ "learning_rate": 7.296630953525158e-07,
2994
+ "loss": 31.507012939453126,
2995
+ "step": 3830
2996
+ },
2997
+ {
2998
+ "epoch": 0.3490909090909091,
2999
+ "grad_norm": 174323612516352.0,
3000
+ "learning_rate": 7.283937171671497e-07,
3001
+ "loss": 31.171493530273438,
3002
+ "step": 3840
3003
+ },
3004
+ {
3005
+ "epoch": 0.35,
3006
+ "grad_norm": 52621549240320.0,
3007
+ "learning_rate": 7.271224760445079e-07,
3008
+ "loss": 31.58785400390625,
3009
+ "step": 3850
3010
+ },
3011
+ {
3012
+ "epoch": 0.3509090909090909,
3013
+ "grad_norm": 245216510476288.0,
3014
+ "learning_rate": 7.258493823537124e-07,
3015
+ "loss": 31.41130676269531,
3016
+ "step": 3860
3017
+ },
3018
+ {
3019
+ "epoch": 0.3518181818181818,
3020
+ "grad_norm": 40472269553664.0,
3021
+ "learning_rate": 7.245744464789973e-07,
3022
+ "loss": 31.25943603515625,
3023
+ "step": 3870
3024
+ },
3025
+ {
3026
+ "epoch": 0.3527272727272727,
3027
+ "grad_norm": 152244192280576.0,
3028
+ "learning_rate": 7.232976788196221e-07,
3029
+ "loss": 31.55677490234375,
3030
+ "step": 3880
3031
+ },
3032
+ {
3033
+ "epoch": 0.35363636363636364,
3034
+ "grad_norm": 163018369400832.0,
3035
+ "learning_rate": 7.220190897897877e-07,
3036
+ "loss": 31.163226318359374,
3037
+ "step": 3890
3038
+ },
3039
+ {
3040
+ "epoch": 0.35454545454545455,
3041
+ "grad_norm": 31649326694400.0,
3042
+ "learning_rate": 7.207386898185515e-07,
3043
+ "loss": 31.222012329101563,
3044
+ "step": 3900
3045
+ },
3046
+ {
3047
+ "epoch": 0.35454545454545455,
3048
+ "eval_loss": 31.183151245117188,
3049
+ "eval_runtime": 2.2888,
3050
+ "eval_samples_per_second": 1.748,
3051
+ "eval_steps_per_second": 0.437,
3052
+ "step": 3900
3053
+ },
3054
+ {
3055
+ "epoch": 0.35545454545454547,
3056
+ "grad_norm": 120699922415616.0,
3057
+ "learning_rate": 7.194564893497419e-07,
3058
+ "loss": 31.556930541992188,
3059
+ "step": 3910
3060
+ },
3061
+ {
3062
+ "epoch": 0.3563636363636364,
3063
+ "grad_norm": 143552671645696.0,
3064
+ "learning_rate": 7.181724988418737e-07,
3065
+ "loss": 31.260910034179688,
3066
+ "step": 3920
3067
+ },
3068
+ {
3069
+ "epoch": 0.3572727272727273,
3070
+ "grad_norm": 66354916884480.0,
3071
+ "learning_rate": 7.168867287680627e-07,
3072
+ "loss": 31.252059936523438,
3073
+ "step": 3930
3074
+ },
3075
+ {
3076
+ "epoch": 0.35818181818181816,
3077
+ "grad_norm": 142235978956800.0,
3078
+ "learning_rate": 7.155991896159392e-07,
3079
+ "loss": 31.511947631835938,
3080
+ "step": 3940
3081
+ },
3082
+ {
3083
+ "epoch": 0.35909090909090907,
3084
+ "grad_norm": 331125603958784.0,
3085
+ "learning_rate": 7.143098918875642e-07,
3086
+ "loss": 31.4046630859375,
3087
+ "step": 3950
3088
+ },
3089
+ {
3090
+ "epoch": 0.36,
3091
+ "grad_norm": 163280043638784.0,
3092
+ "learning_rate": 7.130188460993426e-07,
3093
+ "loss": 31.372503662109374,
3094
+ "step": 3960
3095
+ },
3096
+ {
3097
+ "epoch": 0.3609090909090909,
3098
+ "grad_norm": 78036493926400.0,
3099
+ "learning_rate": 7.117260627819376e-07,
3100
+ "loss": 31.743682861328125,
3101
+ "step": 3970
3102
+ },
3103
+ {
3104
+ "epoch": 0.3618181818181818,
3105
+ "grad_norm": 141398275784704.0,
3106
+ "learning_rate": 7.104315524801848e-07,
3107
+ "loss": 31.348150634765624,
3108
+ "step": 3980
3109
+ },
3110
+ {
3111
+ "epoch": 0.36272727272727273,
3112
+ "grad_norm": 34922429415424.0,
3113
+ "learning_rate": 7.091353257530068e-07,
3114
+ "loss": 31.071649169921876,
3115
+ "step": 3990
3116
+ },
3117
+ {
3118
+ "epoch": 0.36363636363636365,
3119
+ "grad_norm": 114211183132672.0,
3120
+ "learning_rate": 7.078373931733258e-07,
3121
+ "loss": 31.188916015625,
3122
+ "step": 4000
3123
+ },
3124
+ {
3125
+ "epoch": 0.36363636363636365,
3126
+ "eval_loss": 31.198307037353516,
3127
+ "eval_runtime": 2.261,
3128
+ "eval_samples_per_second": 1.769,
3129
+ "eval_steps_per_second": 0.442,
3130
+ "step": 4000
3131
  }
3132
  ],
3133
  "logging_steps": 10,
 
3147
  "attributes": {}
3148
  }
3149
  },
3150
+ "total_flos": 1.8119695269888e+16,
3151
  "train_batch_size": 1,
3152
  "trial_name": null,
3153
  "trial_params": null