CodeIsAbstract's picture
Training in progress, step 1000, checkpoint
6e7ca9b verified
Raw History Blame Contribute Delete
33.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 50,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.005,
"grad_norm": 88.5,
"learning_rate": 2e-05,
"loss": 3.2215267181396485,
"step": 5
},
{
"epoch": 0.01,
"grad_norm": 78.0,
"learning_rate": 4.5e-05,
"loss": 3.2558315277099608,
"step": 10
},
{
"epoch": 0.015,
"grad_norm": 8.9375,
"learning_rate": 5e-05,
"loss": 3.2168857574462892,
"step": 15
},
{
"epoch": 0.02,
"grad_norm": 65.0,
"learning_rate": 5e-05,
"loss": 3.222028350830078,
"step": 20
},
{
"epoch": 0.025,
"grad_norm": 6.75,
"learning_rate": 5e-05,
"loss": 3.170660209655762,
"step": 25
},
{
"epoch": 0.03,
"grad_norm": 9.625,
"learning_rate": 5e-05,
"loss": 3.2056911468505858,
"step": 30
},
{
"epoch": 0.035,
"grad_norm": 7.5,
"learning_rate": 5e-05,
"loss": 3.1706233978271485,
"step": 35
},
{
"epoch": 0.04,
"grad_norm": 20.5,
"learning_rate": 5e-05,
"loss": 3.1928180694580077,
"step": 40
},
{
"epoch": 0.045,
"grad_norm": 30.0,
"learning_rate": 5e-05,
"loss": 3.1856739044189455,
"step": 45
},
{
"epoch": 0.05,
"grad_norm": 3.171875,
"learning_rate": 5e-05,
"loss": 3.1777238845825195,
"step": 50
},
{
"epoch": 0.05,
"eval_loss": 3.4269402027130127,
"eval_runtime": 6.7462,
"eval_samples_per_second": 5.485,
"eval_steps_per_second": 2.816,
"step": 50
},
{
"epoch": 0.055,
"grad_norm": 9.5,
"learning_rate": 5e-05,
"loss": 3.150863265991211,
"step": 55
},
{
"epoch": 0.06,
"grad_norm": 18.0,
"learning_rate": 5e-05,
"loss": 3.149982452392578,
"step": 60
},
{
"epoch": 0.065,
"grad_norm": 836.0,
"learning_rate": 5e-05,
"loss": 3.147908592224121,
"step": 65
},
{
"epoch": 0.07,
"grad_norm": 5.34375,
"learning_rate": 5e-05,
"loss": 3.1658950805664063,
"step": 70
},
{
"epoch": 0.075,
"grad_norm": 4.65625,
"learning_rate": 5e-05,
"loss": 3.175393295288086,
"step": 75
},
{
"epoch": 0.08,
"grad_norm": 19.875,
"learning_rate": 5e-05,
"loss": 3.1660781860351563,
"step": 80
},
{
"epoch": 0.085,
"grad_norm": 3.46875,
"learning_rate": 5e-05,
"loss": 3.155829429626465,
"step": 85
},
{
"epoch": 0.09,
"grad_norm": 9.9375,
"learning_rate": 5e-05,
"loss": 3.153760528564453,
"step": 90
},
{
"epoch": 0.095,
"grad_norm": 298.0,
"learning_rate": 5e-05,
"loss": 3.131403160095215,
"step": 95
},
{
"epoch": 0.1,
"grad_norm": 208.0,
"learning_rate": 5e-05,
"loss": 3.160065269470215,
"step": 100
},
{
"epoch": 0.1,
"eval_loss": 3.3961074352264404,
"eval_runtime": 6.6964,
"eval_samples_per_second": 5.525,
"eval_steps_per_second": 2.837,
"step": 100
},
{
"epoch": 0.105,
"grad_norm": 5.5625,
"learning_rate": 5e-05,
"loss": 3.15795955657959,
"step": 105
},
{
"epoch": 0.11,
"grad_norm": 77.5,
"learning_rate": 5e-05,
"loss": 3.112112045288086,
"step": 110
},
{
"epoch": 0.115,
"grad_norm": 16.25,
"learning_rate": 5e-05,
"loss": 3.1197088241577147,
"step": 115
},
{
"epoch": 0.12,
"grad_norm": 14.25,
"learning_rate": 5e-05,
"loss": 3.1374229431152343,
"step": 120
},
{
"epoch": 0.125,
"grad_norm": 28.75,
"learning_rate": 5e-05,
"loss": 3.1513505935668946,
"step": 125
},
{
"epoch": 0.13,
"grad_norm": 6.15625,
"learning_rate": 5e-05,
"loss": 3.145720863342285,
"step": 130
},
{
"epoch": 0.135,
"grad_norm": 8.125,
"learning_rate": 5e-05,
"loss": 3.1482744216918945,
"step": 135
},
{
"epoch": 0.14,
"grad_norm": 12.8125,
"learning_rate": 5e-05,
"loss": 3.124919319152832,
"step": 140
},
{
"epoch": 0.145,
"grad_norm": 432.0,
"learning_rate": 5e-05,
"loss": 3.122653579711914,
"step": 145
},
{
"epoch": 0.15,
"grad_norm": 38.0,
"learning_rate": 5e-05,
"loss": 3.1383148193359376,
"step": 150
},
{
"epoch": 0.15,
"eval_loss": 3.3837645053863525,
"eval_runtime": 6.6931,
"eval_samples_per_second": 5.528,
"eval_steps_per_second": 2.839,
"step": 150
},
{
"epoch": 0.155,
"grad_norm": 20.5,
"learning_rate": 5e-05,
"loss": 3.1009441375732423,
"step": 155
},
{
"epoch": 0.16,
"grad_norm": 7.0625,
"learning_rate": 5e-05,
"loss": 3.1632896423339845,
"step": 160
},
{
"epoch": 0.165,
"grad_norm": 11.25,
"learning_rate": 5e-05,
"loss": 3.129340171813965,
"step": 165
},
{
"epoch": 0.17,
"grad_norm": 7.5,
"learning_rate": 5e-05,
"loss": 3.0880687713623045,
"step": 170
},
{
"epoch": 0.175,
"grad_norm": 264.0,
"learning_rate": 5e-05,
"loss": 3.1132593154907227,
"step": 175
},
{
"epoch": 0.18,
"grad_norm": 32.5,
"learning_rate": 5e-05,
"loss": 3.096790313720703,
"step": 180
},
{
"epoch": 0.185,
"grad_norm": 21.5,
"learning_rate": 5e-05,
"loss": 3.1038497924804687,
"step": 185
},
{
"epoch": 0.19,
"grad_norm": 13.1875,
"learning_rate": 5e-05,
"loss": 3.1320869445800783,
"step": 190
},
{
"epoch": 0.195,
"grad_norm": 19.0,
"learning_rate": 5e-05,
"loss": 3.0939069747924806,
"step": 195
},
{
"epoch": 0.2,
"grad_norm": 3.90625,
"learning_rate": 5e-05,
"loss": 3.084807777404785,
"step": 200
},
{
"epoch": 0.2,
"eval_loss": 3.3661341667175293,
"eval_runtime": 6.7101,
"eval_samples_per_second": 5.514,
"eval_steps_per_second": 2.832,
"step": 200
},
{
"epoch": 0.205,
"grad_norm": 9.0625,
"learning_rate": 5e-05,
"loss": 3.09683895111084,
"step": 205
},
{
"epoch": 0.21,
"grad_norm": 43.25,
"learning_rate": 5e-05,
"loss": 3.141134834289551,
"step": 210
},
{
"epoch": 0.215,
"grad_norm": 2.4375,
"learning_rate": 5e-05,
"loss": 3.100748825073242,
"step": 215
},
{
"epoch": 0.22,
"grad_norm": 12.5625,
"learning_rate": 5e-05,
"loss": 3.0931968688964844,
"step": 220
},
{
"epoch": 0.225,
"grad_norm": 4.53125,
"learning_rate": 5e-05,
"loss": 3.0807849884033205,
"step": 225
},
{
"epoch": 0.23,
"grad_norm": 5.03125,
"learning_rate": 5e-05,
"loss": 3.1373645782470705,
"step": 230
},
{
"epoch": 0.235,
"grad_norm": 482.0,
"learning_rate": 5e-05,
"loss": 3.086713409423828,
"step": 235
},
{
"epoch": 0.24,
"grad_norm": 8.8125,
"learning_rate": 5e-05,
"loss": 3.107415199279785,
"step": 240
},
{
"epoch": 0.245,
"grad_norm": 35.25,
"learning_rate": 5e-05,
"loss": 3.1350580215454102,
"step": 245
},
{
"epoch": 0.25,
"grad_norm": 10.8125,
"learning_rate": 5e-05,
"loss": 3.085038757324219,
"step": 250
},
{
"epoch": 0.25,
"eval_loss": 3.35124135017395,
"eval_runtime": 6.7488,
"eval_samples_per_second": 5.482,
"eval_steps_per_second": 2.815,
"step": 250
},
{
"epoch": 0.255,
"grad_norm": 7.78125,
"learning_rate": 5e-05,
"loss": 3.0779041290283202,
"step": 255
},
{
"epoch": 0.26,
"grad_norm": 8.9375,
"learning_rate": 5e-05,
"loss": 3.0426475524902346,
"step": 260
},
{
"epoch": 0.265,
"grad_norm": 1.9765625,
"learning_rate": 5e-05,
"loss": 3.108402442932129,
"step": 265
},
{
"epoch": 0.27,
"grad_norm": 10.125,
"learning_rate": 5e-05,
"loss": 3.068155288696289,
"step": 270
},
{
"epoch": 0.275,
"grad_norm": 25.625,
"learning_rate": 5e-05,
"loss": 3.0750944137573244,
"step": 275
},
{
"epoch": 0.28,
"grad_norm": 1.609375,
"learning_rate": 5e-05,
"loss": 3.0479175567626955,
"step": 280
},
{
"epoch": 0.285,
"grad_norm": 50.75,
"learning_rate": 5e-05,
"loss": 3.088734817504883,
"step": 285
},
{
"epoch": 0.29,
"grad_norm": 8.8125,
"learning_rate": 5e-05,
"loss": 3.0425872802734375,
"step": 290
},
{
"epoch": 0.295,
"grad_norm": 18.5,
"learning_rate": 5e-05,
"loss": 3.0785484313964844,
"step": 295
},
{
"epoch": 0.3,
"grad_norm": 7.3125,
"learning_rate": 5e-05,
"loss": 3.067402648925781,
"step": 300
},
{
"epoch": 0.3,
"eval_loss": 3.339944839477539,
"eval_runtime": 6.7462,
"eval_samples_per_second": 5.485,
"eval_steps_per_second": 2.816,
"step": 300
},
{
"epoch": 0.305,
"grad_norm": 7.25,
"learning_rate": 5e-05,
"loss": 3.063138961791992,
"step": 305
},
{
"epoch": 0.31,
"grad_norm": 22.5,
"learning_rate": 5e-05,
"loss": 3.0437475204467774,
"step": 310
},
{
"epoch": 0.315,
"grad_norm": 9.75,
"learning_rate": 5e-05,
"loss": 3.0719404220581055,
"step": 315
},
{
"epoch": 0.32,
"grad_norm": 8.75,
"learning_rate": 5e-05,
"loss": 3.0688711166381837,
"step": 320
},
{
"epoch": 0.325,
"grad_norm": 2.671875,
"learning_rate": 5e-05,
"loss": 3.0548662185668944,
"step": 325
},
{
"epoch": 0.33,
"grad_norm": 12.6875,
"learning_rate": 5e-05,
"loss": 3.057333564758301,
"step": 330
},
{
"epoch": 0.335,
"grad_norm": 298.0,
"learning_rate": 5e-05,
"loss": 3.0870180130004883,
"step": 335
},
{
"epoch": 0.34,
"grad_norm": 18.375,
"learning_rate": 5e-05,
"loss": 3.051515579223633,
"step": 340
},
{
"epoch": 0.345,
"grad_norm": 44.0,
"learning_rate": 5e-05,
"loss": 3.0610748291015626,
"step": 345
},
{
"epoch": 0.35,
"grad_norm": 11.6875,
"learning_rate": 5e-05,
"loss": 3.02484016418457,
"step": 350
},
{
"epoch": 0.35,
"eval_loss": 3.328155755996704,
"eval_runtime": 6.6732,
"eval_samples_per_second": 5.545,
"eval_steps_per_second": 2.847,
"step": 350
},
{
"epoch": 0.355,
"grad_norm": 17.875,
"learning_rate": 5e-05,
"loss": 3.0564363479614256,
"step": 355
},
{
"epoch": 0.36,
"grad_norm": 2.6875,
"learning_rate": 5e-05,
"loss": 3.068992805480957,
"step": 360
},
{
"epoch": 0.365,
"grad_norm": 1.5078125,
"learning_rate": 5e-05,
"loss": 3.0664575576782225,
"step": 365
},
{
"epoch": 0.37,
"grad_norm": 204.0,
"learning_rate": 5e-05,
"loss": 3.015609931945801,
"step": 370
},
{
"epoch": 0.375,
"grad_norm": 296.0,
"learning_rate": 5e-05,
"loss": 3.0494104385375977,
"step": 375
},
{
"epoch": 0.38,
"grad_norm": 1024.0,
"learning_rate": 5e-05,
"loss": 3.0338293075561524,
"step": 380
},
{
"epoch": 0.385,
"grad_norm": 7.4375,
"learning_rate": 5e-05,
"loss": 3.037934684753418,
"step": 385
},
{
"epoch": 0.39,
"grad_norm": 3.28125,
"learning_rate": 5e-05,
"loss": 3.0603221893310546,
"step": 390
},
{
"epoch": 0.395,
"grad_norm": 17.125,
"learning_rate": 5e-05,
"loss": 3.0717981338500975,
"step": 395
},
{
"epoch": 0.4,
"grad_norm": 44.75,
"learning_rate": 5e-05,
"loss": 3.0237457275390627,
"step": 400
},
{
"epoch": 0.4,
"eval_loss": 3.322870969772339,
"eval_runtime": 6.749,
"eval_samples_per_second": 5.482,
"eval_steps_per_second": 2.815,
"step": 400
},
{
"epoch": 0.405,
"grad_norm": 24.5,
"learning_rate": 5e-05,
"loss": 3.0751102447509764,
"step": 405
},
{
"epoch": 0.41,
"grad_norm": 2.65625,
"learning_rate": 5e-05,
"loss": 3.0429092407226563,
"step": 410
},
{
"epoch": 0.415,
"grad_norm": 16.0,
"learning_rate": 5e-05,
"loss": 3.0210216522216795,
"step": 415
},
{
"epoch": 0.42,
"grad_norm": 7.53125,
"learning_rate": 5e-05,
"loss": 3.065318489074707,
"step": 420
},
{
"epoch": 0.425,
"grad_norm": 24.375,
"learning_rate": 5e-05,
"loss": 3.0230634689331053,
"step": 425
},
{
"epoch": 0.43,
"grad_norm": 5.625,
"learning_rate": 5e-05,
"loss": 3.02874698638916,
"step": 430
},
{
"epoch": 0.435,
"grad_norm": 16.5,
"learning_rate": 5e-05,
"loss": 3.052432632446289,
"step": 435
},
{
"epoch": 0.44,
"grad_norm": 15.9375,
"learning_rate": 5e-05,
"loss": 3.0222875595092775,
"step": 440
},
{
"epoch": 0.445,
"grad_norm": 19.0,
"learning_rate": 5e-05,
"loss": 3.053955841064453,
"step": 445
},
{
"epoch": 0.45,
"grad_norm": 86.5,
"learning_rate": 5e-05,
"loss": 3.0460411071777345,
"step": 450
},
{
"epoch": 0.45,
"eval_loss": 3.317772626876831,
"eval_runtime": 6.7179,
"eval_samples_per_second": 5.508,
"eval_steps_per_second": 2.828,
"step": 450
},
{
"epoch": 0.455,
"grad_norm": 1.84375,
"learning_rate": 5e-05,
"loss": 3.115060806274414,
"step": 455
},
{
"epoch": 0.46,
"grad_norm": 19.375,
"learning_rate": 5e-05,
"loss": 3.071373176574707,
"step": 460
},
{
"epoch": 0.465,
"grad_norm": 6.6875,
"learning_rate": 5e-05,
"loss": 3.0433387756347656,
"step": 465
},
{
"epoch": 0.47,
"grad_norm": 2.09375,
"learning_rate": 5e-05,
"loss": 3.049169921875,
"step": 470
},
{
"epoch": 0.475,
"grad_norm": 3.9375,
"learning_rate": 5e-05,
"loss": 3.079736328125,
"step": 475
},
{
"epoch": 0.48,
"grad_norm": 3.796875,
"learning_rate": 5e-05,
"loss": 3.0374773025512694,
"step": 480
},
{
"epoch": 0.485,
"grad_norm": 37.25,
"learning_rate": 5e-05,
"loss": 3.022678756713867,
"step": 485
},
{
"epoch": 0.49,
"grad_norm": 65.0,
"learning_rate": 5e-05,
"loss": 3.032781410217285,
"step": 490
},
{
"epoch": 0.495,
"grad_norm": 10.375,
"learning_rate": 5e-05,
"loss": 3.0296302795410157,
"step": 495
},
{
"epoch": 0.5,
"grad_norm": 7.9375,
"learning_rate": 5e-05,
"loss": 3.0553735733032226,
"step": 500
},
{
"epoch": 0.5,
"eval_loss": 3.3104944229125977,
"eval_runtime": 6.7677,
"eval_samples_per_second": 5.467,
"eval_steps_per_second": 2.807,
"step": 500
},
{
"epoch": 0.505,
"grad_norm": 2.71875,
"learning_rate": 5e-05,
"loss": 3.063258743286133,
"step": 505
},
{
"epoch": 0.51,
"grad_norm": 10.4375,
"learning_rate": 5e-05,
"loss": 3.0316259384155275,
"step": 510
},
{
"epoch": 0.515,
"grad_norm": 9.5,
"learning_rate": 5e-05,
"loss": 3.0448724746704103,
"step": 515
},
{
"epoch": 0.52,
"grad_norm": 2.109375,
"learning_rate": 5e-05,
"loss": 3.0403762817382813,
"step": 520
},
{
"epoch": 0.525,
"grad_norm": 3.609375,
"learning_rate": 5e-05,
"loss": 2.9868940353393554,
"step": 525
},
{
"epoch": 0.53,
"grad_norm": 3.875,
"learning_rate": 5e-05,
"loss": 3.010245704650879,
"step": 530
},
{
"epoch": 0.535,
"grad_norm": 1.5859375,
"learning_rate": 5e-05,
"loss": 3.039686393737793,
"step": 535
},
{
"epoch": 0.54,
"grad_norm": 25.5,
"learning_rate": 5e-05,
"loss": 3.041441535949707,
"step": 540
},
{
"epoch": 0.545,
"grad_norm": 8.0,
"learning_rate": 5e-05,
"loss": 3.0453310012817383,
"step": 545
},
{
"epoch": 0.55,
"grad_norm": 9.6875,
"learning_rate": 5e-05,
"loss": 3.0214563369750977,
"step": 550
},
{
"epoch": 0.55,
"eval_loss": 3.3045036792755127,
"eval_runtime": 6.7272,
"eval_samples_per_second": 5.5,
"eval_steps_per_second": 2.824,
"step": 550
},
{
"epoch": 0.555,
"grad_norm": 64.0,
"learning_rate": 5e-05,
"loss": 3.0599187850952148,
"step": 555
},
{
"epoch": 0.56,
"grad_norm": 5.5,
"learning_rate": 5e-05,
"loss": 3.0171770095825194,
"step": 560
},
{
"epoch": 0.565,
"grad_norm": 2.0625,
"learning_rate": 5e-05,
"loss": 3.0361049652099608,
"step": 565
},
{
"epoch": 0.57,
"grad_norm": 1.296875,
"learning_rate": 5e-05,
"loss": 3.0191267013549803,
"step": 570
},
{
"epoch": 0.575,
"grad_norm": 2.28125,
"learning_rate": 5e-05,
"loss": 3.0235448837280274,
"step": 575
},
{
"epoch": 0.58,
"grad_norm": 4.0625,
"learning_rate": 5e-05,
"loss": 3.0432418823242187,
"step": 580
},
{
"epoch": 0.585,
"grad_norm": 28.25,
"learning_rate": 5e-05,
"loss": 3.0085990905761717,
"step": 585
},
{
"epoch": 0.59,
"grad_norm": 1.546875,
"learning_rate": 5e-05,
"loss": 2.9956476211547853,
"step": 590
},
{
"epoch": 0.595,
"grad_norm": 28.125,
"learning_rate": 5e-05,
"loss": 3.0316390991210938,
"step": 595
},
{
"epoch": 0.6,
"grad_norm": 13.6875,
"learning_rate": 5e-05,
"loss": 3.040385627746582,
"step": 600
},
{
"epoch": 0.6,
"eval_loss": 3.2979705333709717,
"eval_runtime": 6.7492,
"eval_samples_per_second": 5.482,
"eval_steps_per_second": 2.815,
"step": 600
},
{
"epoch": 0.605,
"grad_norm": 26.125,
"learning_rate": 5e-05,
"loss": 3.0119483947753904,
"step": 605
},
{
"epoch": 0.61,
"grad_norm": 1.3515625,
"learning_rate": 5e-05,
"loss": 3.0221290588378906,
"step": 610
},
{
"epoch": 0.615,
"grad_norm": 1.328125,
"learning_rate": 5e-05,
"loss": 3.034591484069824,
"step": 615
},
{
"epoch": 0.62,
"grad_norm": 1.8359375,
"learning_rate": 5e-05,
"loss": 3.0486448287963865,
"step": 620
},
{
"epoch": 0.625,
"grad_norm": 6.125,
"learning_rate": 5e-05,
"loss": 3.0161321640014647,
"step": 625
},
{
"epoch": 0.63,
"grad_norm": 47.75,
"learning_rate": 5e-05,
"loss": 3.034286880493164,
"step": 630
},
{
"epoch": 0.635,
"grad_norm": 22.5,
"learning_rate": 5e-05,
"loss": 3.05667667388916,
"step": 635
},
{
"epoch": 0.64,
"grad_norm": 4.28125,
"learning_rate": 5e-05,
"loss": 3.0220699310302734,
"step": 640
},
{
"epoch": 0.645,
"grad_norm": 2.640625,
"learning_rate": 5e-05,
"loss": 2.995787811279297,
"step": 645
},
{
"epoch": 0.65,
"grad_norm": 3.140625,
"learning_rate": 5e-05,
"loss": 3.030243492126465,
"step": 650
},
{
"epoch": 0.65,
"eval_loss": 3.2928740978240967,
"eval_runtime": 6.768,
"eval_samples_per_second": 5.467,
"eval_steps_per_second": 2.807,
"step": 650
},
{
"epoch": 0.655,
"grad_norm": 1.7734375,
"learning_rate": 5e-05,
"loss": 2.9878942489624025,
"step": 655
},
{
"epoch": 0.66,
"grad_norm": 21.75,
"learning_rate": 5e-05,
"loss": 3.0131813049316407,
"step": 660
},
{
"epoch": 0.665,
"grad_norm": 2.0,
"learning_rate": 5e-05,
"loss": 2.988085174560547,
"step": 665
},
{
"epoch": 0.67,
"grad_norm": 1.4296875,
"learning_rate": 5e-05,
"loss": 3.022294044494629,
"step": 670
},
{
"epoch": 0.675,
"grad_norm": 6.875,
"learning_rate": 5e-05,
"loss": 3.0046091079711914,
"step": 675
},
{
"epoch": 0.68,
"grad_norm": 2.875,
"learning_rate": 5e-05,
"loss": 3.013047981262207,
"step": 680
},
{
"epoch": 0.685,
"grad_norm": 17.0,
"learning_rate": 5e-05,
"loss": 2.9954095840454102,
"step": 685
},
{
"epoch": 0.69,
"grad_norm": 7.03125,
"learning_rate": 5e-05,
"loss": 3.004934310913086,
"step": 690
},
{
"epoch": 0.695,
"grad_norm": 1.84375,
"learning_rate": 5e-05,
"loss": 3.037328910827637,
"step": 695
},
{
"epoch": 0.7,
"grad_norm": 11.25,
"learning_rate": 5e-05,
"loss": 3.022724914550781,
"step": 700
},
{
"epoch": 0.7,
"eval_loss": 3.2860541343688965,
"eval_runtime": 6.7324,
"eval_samples_per_second": 5.496,
"eval_steps_per_second": 2.822,
"step": 700
},
{
"epoch": 0.705,
"grad_norm": 1.7890625,
"learning_rate": 5e-05,
"loss": 2.9891803741455076,
"step": 705
},
{
"epoch": 0.71,
"grad_norm": 8.5,
"learning_rate": 5e-05,
"loss": 3.0228837966918944,
"step": 710
},
{
"epoch": 0.715,
"grad_norm": 2.171875,
"learning_rate": 5e-05,
"loss": 3.0380273818969727,
"step": 715
},
{
"epoch": 0.72,
"grad_norm": 1.6484375,
"learning_rate": 5e-05,
"loss": 3.013555335998535,
"step": 720
},
{
"epoch": 0.725,
"grad_norm": 1.3984375,
"learning_rate": 5e-05,
"loss": 2.9776601791381836,
"step": 725
},
{
"epoch": 0.73,
"grad_norm": 2.46875,
"learning_rate": 5e-05,
"loss": 3.0011289596557615,
"step": 730
},
{
"epoch": 0.735,
"grad_norm": 2.0625,
"learning_rate": 5e-05,
"loss": 2.99926872253418,
"step": 735
},
{
"epoch": 0.74,
"grad_norm": 3.453125,
"learning_rate": 5e-05,
"loss": 2.9941511154174805,
"step": 740
},
{
"epoch": 0.745,
"grad_norm": 6.625,
"learning_rate": 5e-05,
"loss": 3.0118370056152344,
"step": 745
},
{
"epoch": 0.75,
"grad_norm": 7.28125,
"learning_rate": 5e-05,
"loss": 2.9928028106689455,
"step": 750
},
{
"epoch": 0.75,
"eval_loss": 3.280454158782959,
"eval_runtime": 6.7672,
"eval_samples_per_second": 5.468,
"eval_steps_per_second": 2.808,
"step": 750
},
{
"epoch": 0.755,
"grad_norm": 4.34375,
"learning_rate": 5e-05,
"loss": 3.012207794189453,
"step": 755
},
{
"epoch": 0.76,
"grad_norm": 1.6796875,
"learning_rate": 5e-05,
"loss": 2.9685001373291016,
"step": 760
},
{
"epoch": 0.765,
"grad_norm": 0.95703125,
"learning_rate": 5e-05,
"loss": 3.032526397705078,
"step": 765
},
{
"epoch": 0.77,
"grad_norm": 2.0625,
"learning_rate": 5e-05,
"loss": 3.018193244934082,
"step": 770
},
{
"epoch": 0.775,
"grad_norm": 160.0,
"learning_rate": 5e-05,
"loss": 2.9998651504516602,
"step": 775
},
{
"epoch": 0.78,
"grad_norm": 182.0,
"learning_rate": 5e-05,
"loss": 3.0007757186889648,
"step": 780
},
{
"epoch": 0.785,
"grad_norm": 3.03125,
"learning_rate": 5e-05,
"loss": 2.9936758041381837,
"step": 785
},
{
"epoch": 0.79,
"grad_norm": 3.4375,
"learning_rate": 5e-05,
"loss": 2.9737762451171874,
"step": 790
},
{
"epoch": 0.795,
"grad_norm": 63.5,
"learning_rate": 5e-05,
"loss": 3.0091293334960936,
"step": 795
},
{
"epoch": 0.8,
"grad_norm": 46.0,
"learning_rate": 5e-05,
"loss": 3.021886444091797,
"step": 800
},
{
"epoch": 0.8,
"eval_loss": 3.2757456302642822,
"eval_runtime": 6.7253,
"eval_samples_per_second": 5.502,
"eval_steps_per_second": 2.825,
"step": 800
},
{
"epoch": 0.805,
"grad_norm": 8.3125,
"learning_rate": 5e-05,
"loss": 2.9799240112304686,
"step": 805
},
{
"epoch": 0.81,
"grad_norm": 7.9375,
"learning_rate": 5e-05,
"loss": 3.0026453018188475,
"step": 810
},
{
"epoch": 0.815,
"grad_norm": 1.65625,
"learning_rate": 5e-05,
"loss": 2.999722480773926,
"step": 815
},
{
"epoch": 0.82,
"grad_norm": 1.265625,
"learning_rate": 5e-05,
"loss": 2.966134452819824,
"step": 820
},
{
"epoch": 0.825,
"grad_norm": 340.0,
"learning_rate": 5e-05,
"loss": 2.979732322692871,
"step": 825
},
{
"epoch": 0.83,
"grad_norm": 34.5,
"learning_rate": 5e-05,
"loss": 3.0184419631958006,
"step": 830
},
{
"epoch": 0.835,
"grad_norm": 4.71875,
"learning_rate": 5e-05,
"loss": 2.978903961181641,
"step": 835
},
{
"epoch": 0.84,
"grad_norm": 7.75,
"learning_rate": 5e-05,
"loss": 3.000539016723633,
"step": 840
},
{
"epoch": 0.845,
"grad_norm": 3.0,
"learning_rate": 5e-05,
"loss": 2.962353515625,
"step": 845
},
{
"epoch": 0.85,
"grad_norm": 2.171875,
"learning_rate": 5e-05,
"loss": 2.9898805618286133,
"step": 850
},
{
"epoch": 0.85,
"eval_loss": 3.2711822986602783,
"eval_runtime": 6.7266,
"eval_samples_per_second": 5.501,
"eval_steps_per_second": 2.825,
"step": 850
},
{
"epoch": 0.855,
"grad_norm": 4.34375,
"learning_rate": 5e-05,
"loss": 2.973104476928711,
"step": 855
},
{
"epoch": 0.86,
"grad_norm": 6.21875,
"learning_rate": 5e-05,
"loss": 3.00762996673584,
"step": 860
},
{
"epoch": 0.865,
"grad_norm": 3.96875,
"learning_rate": 5e-05,
"loss": 2.9680364608764647,
"step": 865
},
{
"epoch": 0.87,
"grad_norm": 3.546875,
"learning_rate": 5e-05,
"loss": 2.9908233642578126,
"step": 870
},
{
"epoch": 0.875,
"grad_norm": 5.25,
"learning_rate": 5e-05,
"loss": 2.9942108154296876,
"step": 875
},
{
"epoch": 0.88,
"grad_norm": 7.25,
"learning_rate": 5e-05,
"loss": 2.966433525085449,
"step": 880
},
{
"epoch": 0.885,
"grad_norm": 6.84375,
"learning_rate": 5e-05,
"loss": 2.9872104644775392,
"step": 885
},
{
"epoch": 0.89,
"grad_norm": 2.3125,
"learning_rate": 5e-05,
"loss": 2.9889734268188475,
"step": 890
},
{
"epoch": 0.895,
"grad_norm": 4.46875,
"learning_rate": 5e-05,
"loss": 2.9673152923583985,
"step": 895
},
{
"epoch": 0.9,
"grad_norm": 5.15625,
"learning_rate": 5e-05,
"loss": 2.992472267150879,
"step": 900
},
{
"epoch": 0.9,
"eval_loss": 3.269010066986084,
"eval_runtime": 6.7827,
"eval_samples_per_second": 5.455,
"eval_steps_per_second": 2.801,
"step": 900
},
{
"epoch": 0.905,
"grad_norm": 1.7890625,
"learning_rate": 5e-05,
"loss": 2.982642936706543,
"step": 905
},
{
"epoch": 0.91,
"grad_norm": 7.4375,
"learning_rate": 5e-05,
"loss": 3.015847396850586,
"step": 910
},
{
"epoch": 0.915,
"grad_norm": 5376.0,
"learning_rate": 5e-05,
"loss": 3.003455924987793,
"step": 915
},
{
"epoch": 0.92,
"grad_norm": 0.83984375,
"learning_rate": 5e-05,
"loss": 2.987352180480957,
"step": 920
},
{
"epoch": 0.925,
"grad_norm": 1.9921875,
"learning_rate": 5e-05,
"loss": 2.9890872955322267,
"step": 925
},
{
"epoch": 0.93,
"grad_norm": 352.0,
"learning_rate": 5e-05,
"loss": 2.990787315368652,
"step": 930
},
{
"epoch": 0.935,
"grad_norm": 9.5,
"learning_rate": 5e-05,
"loss": 2.950652313232422,
"step": 935
},
{
"epoch": 0.94,
"grad_norm": 84.5,
"learning_rate": 5e-05,
"loss": 2.978129768371582,
"step": 940
},
{
"epoch": 0.945,
"grad_norm": 900.0,
"learning_rate": 5e-05,
"loss": 2.9651300430297853,
"step": 945
},
{
"epoch": 0.95,
"grad_norm": 17.75,
"learning_rate": 5e-05,
"loss": 2.940041351318359,
"step": 950
},
{
"epoch": 0.95,
"eval_loss": 3.2654120922088623,
"eval_runtime": 6.7595,
"eval_samples_per_second": 5.474,
"eval_steps_per_second": 2.811,
"step": 950
},
{
"epoch": 0.955,
"grad_norm": 5.25,
"learning_rate": 5e-05,
"loss": 2.9906681060791014,
"step": 955
},
{
"epoch": 0.96,
"grad_norm": 1.65625,
"learning_rate": 5e-05,
"loss": 2.965926933288574,
"step": 960
},
{
"epoch": 0.965,
"grad_norm": 1.9609375,
"learning_rate": 5e-05,
"loss": 3.0010139465332033,
"step": 965
},
{
"epoch": 0.97,
"grad_norm": 24.625,
"learning_rate": 5e-05,
"loss": 2.9550275802612305,
"step": 970
},
{
"epoch": 0.975,
"grad_norm": 2.515625,
"learning_rate": 5e-05,
"loss": 2.970465660095215,
"step": 975
},
{
"epoch": 0.98,
"grad_norm": 3.4375,
"learning_rate": 5e-05,
"loss": 2.9523544311523438,
"step": 980
},
{
"epoch": 0.985,
"grad_norm": 14.625,
"learning_rate": 5e-05,
"loss": 3.002934455871582,
"step": 985
},
{
"epoch": 0.99,
"grad_norm": 2.921875,
"learning_rate": 5e-05,
"loss": 2.964326286315918,
"step": 990
},
{
"epoch": 0.995,
"grad_norm": 3.625,
"learning_rate": 5e-05,
"loss": 2.9944055557250975,
"step": 995
},
{
"epoch": 1.0,
"grad_norm": 11.9375,
"learning_rate": 5e-05,
"loss": 2.9779850006103517,
"step": 1000
},
{
"epoch": 1.0,
"eval_loss": 3.2615818977355957,
"eval_runtime": 6.7329,
"eval_samples_per_second": 5.495,
"eval_steps_per_second": 2.822,
"step": 1000
}
],
"logging_steps": 5,
"max_steps": 1000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.89915124318208e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}