CodeIsAbstract's picture
Training in progress, step 4500, checkpoint
23c6797 verified
Raw History Blame Contribute Delete
77.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9,
"eval_steps": 100,
"global_step": 4500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002,
"grad_norm": 366.0,
"learning_rate": 1.7999999999999997e-05,
"loss": 3.335772705078125,
"step": 10
},
{
"epoch": 0.004,
"grad_norm": 76.0,
"learning_rate": 3.8e-05,
"loss": 3.325016403198242,
"step": 20
},
{
"epoch": 0.006,
"grad_norm": 426.0,
"learning_rate": 5.7999999999999994e-05,
"loss": 3.355701446533203,
"step": 30
},
{
"epoch": 0.008,
"grad_norm": 194.0,
"learning_rate": 7.8e-05,
"loss": 3.3106155395507812,
"step": 40
},
{
"epoch": 0.01,
"grad_norm": 712.0,
"learning_rate": 9.799999999999998e-05,
"loss": 3.270039367675781,
"step": 50
},
{
"epoch": 0.012,
"grad_norm": 164.0,
"learning_rate": 0.00011799999999999998,
"loss": 3.2886486053466797,
"step": 60
},
{
"epoch": 0.014,
"grad_norm": 162.0,
"learning_rate": 0.000138,
"loss": 3.2564620971679688,
"step": 70
},
{
"epoch": 0.016,
"grad_norm": 234.0,
"learning_rate": 0.00015799999999999996,
"loss": 3.267023468017578,
"step": 80
},
{
"epoch": 0.018,
"grad_norm": 1536.0,
"learning_rate": 0.000178,
"loss": 3.231563949584961,
"step": 90
},
{
"epoch": 0.02,
"grad_norm": 39.5,
"learning_rate": 0.000198,
"loss": 3.2340599060058595,
"step": 100
},
{
"epoch": 0.02,
"eval_loss": 3.491870403289795,
"eval_runtime": 4.5004,
"eval_samples_per_second": 66.216,
"eval_steps_per_second": 3.777,
"step": 100
},
{
"epoch": 0.022,
"grad_norm": 23.0,
"learning_rate": 0.00021799999999999999,
"loss": 3.20191650390625,
"step": 110
},
{
"epoch": 0.024,
"grad_norm": 32.0,
"learning_rate": 0.00023799999999999998,
"loss": 3.2040287017822267,
"step": 120
},
{
"epoch": 0.026,
"grad_norm": 136.0,
"learning_rate": 0.000258,
"loss": 3.1589597702026366,
"step": 130
},
{
"epoch": 0.028,
"grad_norm": 238.0,
"learning_rate": 0.000278,
"loss": 3.150320625305176,
"step": 140
},
{
"epoch": 0.03,
"grad_norm": 540.0,
"learning_rate": 0.000298,
"loss": 3.172740364074707,
"step": 150
},
{
"epoch": 0.032,
"grad_norm": 58.0,
"learning_rate": 0.0003,
"loss": 3.149807167053223,
"step": 160
},
{
"epoch": 0.034,
"grad_norm": 196.0,
"learning_rate": 0.0003,
"loss": 3.169495391845703,
"step": 170
},
{
"epoch": 0.036,
"grad_norm": 444.0,
"learning_rate": 0.0003,
"loss": 3.1639734268188477,
"step": 180
},
{
"epoch": 0.038,
"grad_norm": 378.0,
"learning_rate": 0.0003,
"loss": 3.221640777587891,
"step": 190
},
{
"epoch": 0.04,
"grad_norm": 2272.0,
"learning_rate": 0.0003,
"loss": 3.1916147232055665,
"step": 200
},
{
"epoch": 0.04,
"eval_loss": 3.4648807048797607,
"eval_runtime": 4.3534,
"eval_samples_per_second": 68.452,
"eval_steps_per_second": 3.905,
"step": 200
},
{
"epoch": 0.042,
"grad_norm": 520.0,
"learning_rate": 0.0003,
"loss": 3.1814949035644533,
"step": 210
},
{
"epoch": 0.044,
"grad_norm": 87.0,
"learning_rate": 0.0003,
"loss": 3.1746402740478517,
"step": 220
},
{
"epoch": 0.046,
"grad_norm": 39.0,
"learning_rate": 0.0003,
"loss": 3.172597885131836,
"step": 230
},
{
"epoch": 0.048,
"grad_norm": 50.5,
"learning_rate": 0.0003,
"loss": 3.1576799392700194,
"step": 240
},
{
"epoch": 0.05,
"grad_norm": 29.0,
"learning_rate": 0.0003,
"loss": 3.1418006896972654,
"step": 250
},
{
"epoch": 0.052,
"grad_norm": 50.5,
"learning_rate": 0.0003,
"loss": 3.1035797119140627,
"step": 260
},
{
"epoch": 0.054,
"grad_norm": 568.0,
"learning_rate": 0.0003,
"loss": 3.095198059082031,
"step": 270
},
{
"epoch": 0.056,
"grad_norm": 15.5625,
"learning_rate": 0.0003,
"loss": 3.079079818725586,
"step": 280
},
{
"epoch": 0.058,
"grad_norm": 17.625,
"learning_rate": 0.0003,
"loss": 3.060195732116699,
"step": 290
},
{
"epoch": 0.06,
"grad_norm": 56.25,
"learning_rate": 0.0003,
"loss": 3.0736625671386717,
"step": 300
},
{
"epoch": 0.06,
"eval_loss": 3.349555015563965,
"eval_runtime": 4.3918,
"eval_samples_per_second": 67.854,
"eval_steps_per_second": 3.871,
"step": 300
},
{
"epoch": 0.062,
"grad_norm": 432.0,
"learning_rate": 0.0003,
"loss": 3.0508825302124025,
"step": 310
},
{
"epoch": 0.064,
"grad_norm": 6.28125,
"learning_rate": 0.0003,
"loss": 3.021405792236328,
"step": 320
},
{
"epoch": 0.066,
"grad_norm": 161.0,
"learning_rate": 0.0003,
"loss": 3.011042022705078,
"step": 330
},
{
"epoch": 0.068,
"grad_norm": 29.625,
"learning_rate": 0.0003,
"loss": 2.9988969802856444,
"step": 340
},
{
"epoch": 0.07,
"grad_norm": 24.625,
"learning_rate": 0.0003,
"loss": 2.9939882278442385,
"step": 350
},
{
"epoch": 0.072,
"grad_norm": 61.0,
"learning_rate": 0.0003,
"loss": 2.979990768432617,
"step": 360
},
{
"epoch": 0.074,
"grad_norm": 13.6875,
"learning_rate": 0.0003,
"loss": 2.9845876693725586,
"step": 370
},
{
"epoch": 0.076,
"grad_norm": 280.0,
"learning_rate": 0.0003,
"loss": 2.975000762939453,
"step": 380
},
{
"epoch": 0.078,
"grad_norm": 21.125,
"learning_rate": 0.0003,
"loss": 2.958791732788086,
"step": 390
},
{
"epoch": 0.08,
"grad_norm": 12.8125,
"learning_rate": 0.0003,
"loss": 2.956746482849121,
"step": 400
},
{
"epoch": 0.08,
"eval_loss": 3.2549893856048584,
"eval_runtime": 4.4045,
"eval_samples_per_second": 67.658,
"eval_steps_per_second": 3.86,
"step": 400
},
{
"epoch": 0.082,
"grad_norm": 314.0,
"learning_rate": 0.0003,
"loss": 2.9515405654907227,
"step": 410
},
{
"epoch": 0.084,
"grad_norm": 2.125,
"learning_rate": 0.0003,
"loss": 2.910631561279297,
"step": 420
},
{
"epoch": 0.086,
"grad_norm": 24.75,
"learning_rate": 0.0003,
"loss": 2.8589399337768553,
"step": 430
},
{
"epoch": 0.088,
"grad_norm": 3.78125,
"learning_rate": 0.0003,
"loss": 2.844576835632324,
"step": 440
},
{
"epoch": 0.09,
"grad_norm": 1.6171875,
"learning_rate": 0.0003,
"loss": 2.7850717544555663,
"step": 450
},
{
"epoch": 0.092,
"grad_norm": 6.5625,
"learning_rate": 0.0003,
"loss": 2.7605606079101563,
"step": 460
},
{
"epoch": 0.094,
"grad_norm": 12.5625,
"learning_rate": 0.0003,
"loss": 2.747697639465332,
"step": 470
},
{
"epoch": 0.096,
"grad_norm": 0.7734375,
"learning_rate": 0.0003,
"loss": 2.7024419784545897,
"step": 480
},
{
"epoch": 0.098,
"grad_norm": 0.55078125,
"learning_rate": 0.0003,
"loss": 2.727059173583984,
"step": 490
},
{
"epoch": 0.1,
"grad_norm": 1.3046875,
"learning_rate": 0.0003,
"loss": 2.688610076904297,
"step": 500
},
{
"epoch": 0.1,
"eval_loss": 3.0536108016967773,
"eval_runtime": 4.4183,
"eval_samples_per_second": 67.447,
"eval_steps_per_second": 3.848,
"step": 500
},
{
"epoch": 0.102,
"grad_norm": 0.66796875,
"learning_rate": 0.0003,
"loss": 2.6653621673583983,
"step": 510
},
{
"epoch": 0.104,
"grad_norm": 2.53125,
"learning_rate": 0.0003,
"loss": 2.6938413619995116,
"step": 520
},
{
"epoch": 0.106,
"grad_norm": 1.578125,
"learning_rate": 0.0003,
"loss": 2.6589494705200196,
"step": 530
},
{
"epoch": 0.108,
"grad_norm": 1.453125,
"learning_rate": 0.0003,
"loss": 2.6775186538696287,
"step": 540
},
{
"epoch": 0.11,
"grad_norm": 0.1806640625,
"learning_rate": 0.0003,
"loss": 2.659619140625,
"step": 550
},
{
"epoch": 0.112,
"grad_norm": 0.212890625,
"learning_rate": 0.0003,
"loss": 2.644103240966797,
"step": 560
},
{
"epoch": 0.114,
"grad_norm": 0.73046875,
"learning_rate": 0.0003,
"loss": 2.65213565826416,
"step": 570
},
{
"epoch": 0.116,
"grad_norm": 1.1796875,
"learning_rate": 0.0003,
"loss": 2.6230279922485353,
"step": 580
},
{
"epoch": 0.118,
"grad_norm": 0.166015625,
"learning_rate": 0.0003,
"loss": 2.6443111419677736,
"step": 590
},
{
"epoch": 0.12,
"grad_norm": 0.8203125,
"learning_rate": 0.0003,
"loss": 2.6569570541381835,
"step": 600
},
{
"epoch": 0.12,
"eval_loss": 3.0349245071411133,
"eval_runtime": 4.4206,
"eval_samples_per_second": 67.412,
"eval_steps_per_second": 3.846,
"step": 600
},
{
"epoch": 0.122,
"grad_norm": 0.1181640625,
"learning_rate": 0.0003,
"loss": 2.6595781326293944,
"step": 610
},
{
"epoch": 0.124,
"grad_norm": 0.232421875,
"learning_rate": 0.0003,
"loss": 2.610936737060547,
"step": 620
},
{
"epoch": 0.126,
"grad_norm": 0.1435546875,
"learning_rate": 0.0003,
"loss": 2.6387302398681642,
"step": 630
},
{
"epoch": 0.128,
"grad_norm": 0.14453125,
"learning_rate": 0.0003,
"loss": 2.62979793548584,
"step": 640
},
{
"epoch": 0.13,
"grad_norm": 2.34375,
"learning_rate": 0.0003,
"loss": 2.649636650085449,
"step": 650
},
{
"epoch": 0.132,
"grad_norm": 0.2041015625,
"learning_rate": 0.0003,
"loss": 2.622520637512207,
"step": 660
},
{
"epoch": 0.134,
"grad_norm": 0.97265625,
"learning_rate": 0.0003,
"loss": 2.646112823486328,
"step": 670
},
{
"epoch": 0.136,
"grad_norm": 5.8125,
"learning_rate": 0.0003,
"loss": 2.6434356689453127,
"step": 680
},
{
"epoch": 0.138,
"grad_norm": 0.10693359375,
"learning_rate": 0.0003,
"loss": 2.623065376281738,
"step": 690
},
{
"epoch": 0.14,
"grad_norm": 0.90625,
"learning_rate": 0.0003,
"loss": 2.6090648651123045,
"step": 700
},
{
"epoch": 0.14,
"eval_loss": 3.0306036472320557,
"eval_runtime": 4.4176,
"eval_samples_per_second": 67.457,
"eval_steps_per_second": 3.848,
"step": 700
},
{
"epoch": 0.142,
"grad_norm": 0.6328125,
"learning_rate": 0.0003,
"loss": 2.6384559631347657,
"step": 710
},
{
"epoch": 0.144,
"grad_norm": 0.640625,
"learning_rate": 0.0003,
"loss": 2.6472700119018553,
"step": 720
},
{
"epoch": 0.146,
"grad_norm": 0.07177734375,
"learning_rate": 0.0003,
"loss": 2.6483619689941404,
"step": 730
},
{
"epoch": 0.148,
"grad_norm": 0.322265625,
"learning_rate": 0.0003,
"loss": 2.626618766784668,
"step": 740
},
{
"epoch": 0.15,
"grad_norm": 0.099609375,
"learning_rate": 0.0003,
"loss": 2.6325525283813476,
"step": 750
},
{
"epoch": 0.152,
"grad_norm": 0.1611328125,
"learning_rate": 0.0003,
"loss": 2.6193023681640626,
"step": 760
},
{
"epoch": 0.154,
"grad_norm": 0.072265625,
"learning_rate": 0.0003,
"loss": 2.618332862854004,
"step": 770
},
{
"epoch": 0.156,
"grad_norm": 0.87109375,
"learning_rate": 0.0003,
"loss": 2.610393524169922,
"step": 780
},
{
"epoch": 0.158,
"grad_norm": 0.09716796875,
"learning_rate": 0.0003,
"loss": 2.6242008209228516,
"step": 790
},
{
"epoch": 0.16,
"grad_norm": 0.072265625,
"learning_rate": 0.0003,
"loss": 2.638929748535156,
"step": 800
},
{
"epoch": 0.16,
"eval_loss": 3.0286974906921387,
"eval_runtime": 4.4633,
"eval_samples_per_second": 66.766,
"eval_steps_per_second": 3.809,
"step": 800
},
{
"epoch": 0.162,
"grad_norm": 0.29296875,
"learning_rate": 0.0003,
"loss": 2.638911247253418,
"step": 810
},
{
"epoch": 0.164,
"grad_norm": 0.62890625,
"learning_rate": 0.0003,
"loss": 2.6282770156860353,
"step": 820
},
{
"epoch": 0.166,
"grad_norm": 0.0859375,
"learning_rate": 0.0003,
"loss": 2.668540382385254,
"step": 830
},
{
"epoch": 0.168,
"grad_norm": 0.08349609375,
"learning_rate": 0.0003,
"loss": 2.6025644302368165,
"step": 840
},
{
"epoch": 0.17,
"grad_norm": 0.251953125,
"learning_rate": 0.0003,
"loss": 2.614345932006836,
"step": 850
},
{
"epoch": 0.172,
"grad_norm": 1.2421875,
"learning_rate": 0.0003,
"loss": 2.6097484588623048,
"step": 860
},
{
"epoch": 0.174,
"grad_norm": 0.10107421875,
"learning_rate": 0.0003,
"loss": 2.5976139068603517,
"step": 870
},
{
"epoch": 0.176,
"grad_norm": 0.0634765625,
"learning_rate": 0.0003,
"loss": 2.609291648864746,
"step": 880
},
{
"epoch": 0.178,
"grad_norm": 0.060302734375,
"learning_rate": 0.0003,
"loss": 2.6136356353759767,
"step": 890
},
{
"epoch": 0.18,
"grad_norm": 0.306640625,
"learning_rate": 0.0003,
"loss": 2.6354192733764648,
"step": 900
},
{
"epoch": 0.18,
"eval_loss": 3.028738021850586,
"eval_runtime": 4.4125,
"eval_samples_per_second": 67.536,
"eval_steps_per_second": 3.853,
"step": 900
},
{
"epoch": 0.182,
"grad_norm": 0.65234375,
"learning_rate": 0.0003,
"loss": 2.6325847625732424,
"step": 910
},
{
"epoch": 0.184,
"grad_norm": 0.4921875,
"learning_rate": 0.0003,
"loss": 2.6379472732543947,
"step": 920
},
{
"epoch": 0.186,
"grad_norm": 0.216796875,
"learning_rate": 0.0003,
"loss": 2.647774505615234,
"step": 930
},
{
"epoch": 0.188,
"grad_norm": 0.083984375,
"learning_rate": 0.0003,
"loss": 2.628580665588379,
"step": 940
},
{
"epoch": 0.19,
"grad_norm": 0.09033203125,
"learning_rate": 0.0003,
"loss": 2.63638973236084,
"step": 950
},
{
"epoch": 0.192,
"grad_norm": 0.08056640625,
"learning_rate": 0.0003,
"loss": 2.628683853149414,
"step": 960
},
{
"epoch": 0.194,
"grad_norm": 0.06787109375,
"learning_rate": 0.0003,
"loss": 2.628560256958008,
"step": 970
},
{
"epoch": 0.196,
"grad_norm": 0.1328125,
"learning_rate": 0.0003,
"loss": 2.627498435974121,
"step": 980
},
{
"epoch": 0.198,
"grad_norm": 0.1796875,
"learning_rate": 0.0003,
"loss": 2.613533782958984,
"step": 990
},
{
"epoch": 0.2,
"grad_norm": 0.265625,
"learning_rate": 0.0003,
"loss": 2.615587615966797,
"step": 1000
},
{
"epoch": 0.2,
"eval_loss": 3.0314836502075195,
"eval_runtime": 4.4355,
"eval_samples_per_second": 67.186,
"eval_steps_per_second": 3.833,
"step": 1000
},
{
"epoch": 0.202,
"grad_norm": 0.0859375,
"learning_rate": 0.0003,
"loss": 2.621230697631836,
"step": 1010
},
{
"epoch": 0.204,
"grad_norm": 0.056640625,
"learning_rate": 0.0003,
"loss": 2.6316347122192383,
"step": 1020
},
{
"epoch": 0.206,
"grad_norm": 0.2431640625,
"learning_rate": 0.0003,
"loss": 2.6155324935913087,
"step": 1030
},
{
"epoch": 0.208,
"grad_norm": 0.06298828125,
"learning_rate": 0.0003,
"loss": 2.634638214111328,
"step": 1040
},
{
"epoch": 0.21,
"grad_norm": 0.1064453125,
"learning_rate": 0.0003,
"loss": 2.6131080627441405,
"step": 1050
},
{
"epoch": 0.212,
"grad_norm": 0.06689453125,
"learning_rate": 0.0003,
"loss": 2.616171646118164,
"step": 1060
},
{
"epoch": 0.214,
"grad_norm": 0.08984375,
"learning_rate": 0.0003,
"loss": 2.603512191772461,
"step": 1070
},
{
"epoch": 0.216,
"grad_norm": 0.0625,
"learning_rate": 0.0003,
"loss": 2.6277271270751954,
"step": 1080
},
{
"epoch": 0.218,
"grad_norm": 0.0673828125,
"learning_rate": 0.0003,
"loss": 2.615810775756836,
"step": 1090
},
{
"epoch": 0.22,
"grad_norm": 0.060791015625,
"learning_rate": 0.0003,
"loss": 2.6153131484985352,
"step": 1100
},
{
"epoch": 0.22,
"eval_loss": 3.0302107334136963,
"eval_runtime": 4.4032,
"eval_samples_per_second": 67.678,
"eval_steps_per_second": 3.861,
"step": 1100
},
{
"epoch": 0.222,
"grad_norm": 0.064453125,
"learning_rate": 0.0003,
"loss": 2.623016357421875,
"step": 1110
},
{
"epoch": 0.224,
"grad_norm": 0.0712890625,
"learning_rate": 0.0003,
"loss": 2.6170467376708983,
"step": 1120
},
{
"epoch": 0.226,
"grad_norm": 0.59375,
"learning_rate": 0.0003,
"loss": 2.620796775817871,
"step": 1130
},
{
"epoch": 0.228,
"grad_norm": 0.30078125,
"learning_rate": 0.0003,
"loss": 2.6082935333251953,
"step": 1140
},
{
"epoch": 0.23,
"grad_norm": 0.80078125,
"learning_rate": 0.0003,
"loss": 2.6210090637207033,
"step": 1150
},
{
"epoch": 0.232,
"grad_norm": 0.0634765625,
"learning_rate": 0.0003,
"loss": 2.636818695068359,
"step": 1160
},
{
"epoch": 0.234,
"grad_norm": 0.07080078125,
"learning_rate": 0.0003,
"loss": 2.5969371795654297,
"step": 1170
},
{
"epoch": 0.236,
"grad_norm": 0.107421875,
"learning_rate": 0.0003,
"loss": 2.6085494995117187,
"step": 1180
},
{
"epoch": 0.238,
"grad_norm": 0.1826171875,
"learning_rate": 0.0003,
"loss": 2.6118932723999024,
"step": 1190
},
{
"epoch": 0.24,
"grad_norm": 0.0625,
"learning_rate": 0.0003,
"loss": 2.6277448654174806,
"step": 1200
},
{
"epoch": 0.24,
"eval_loss": 3.0262646675109863,
"eval_runtime": 4.3768,
"eval_samples_per_second": 68.087,
"eval_steps_per_second": 3.884,
"step": 1200
},
{
"epoch": 0.242,
"grad_norm": 0.08837890625,
"learning_rate": 0.0003,
"loss": 2.6076292037963866,
"step": 1210
},
{
"epoch": 0.244,
"grad_norm": 0.0869140625,
"learning_rate": 0.0003,
"loss": 2.6239038467407227,
"step": 1220
},
{
"epoch": 0.246,
"grad_norm": 0.06201171875,
"learning_rate": 0.0003,
"loss": 2.598759651184082,
"step": 1230
},
{
"epoch": 0.248,
"grad_norm": 0.054443359375,
"learning_rate": 0.0003,
"loss": 2.623333549499512,
"step": 1240
},
{
"epoch": 0.25,
"grad_norm": 0.056884765625,
"learning_rate": 0.0003,
"loss": 2.595660400390625,
"step": 1250
},
{
"epoch": 0.252,
"grad_norm": 0.07470703125,
"learning_rate": 0.0003,
"loss": 2.6085866928100585,
"step": 1260
},
{
"epoch": 0.254,
"grad_norm": 0.06201171875,
"learning_rate": 0.0003,
"loss": 2.6313194274902343,
"step": 1270
},
{
"epoch": 0.256,
"grad_norm": 0.05126953125,
"learning_rate": 0.0003,
"loss": 2.624466323852539,
"step": 1280
},
{
"epoch": 0.258,
"grad_norm": 0.0693359375,
"learning_rate": 0.0003,
"loss": 2.61032657623291,
"step": 1290
},
{
"epoch": 0.26,
"grad_norm": 0.95703125,
"learning_rate": 0.0003,
"loss": 2.611441230773926,
"step": 1300
},
{
"epoch": 0.26,
"eval_loss": 3.0270800590515137,
"eval_runtime": 4.4364,
"eval_samples_per_second": 67.171,
"eval_steps_per_second": 3.832,
"step": 1300
},
{
"epoch": 0.262,
"grad_norm": 0.416015625,
"learning_rate": 0.0003,
"loss": 2.622879981994629,
"step": 1310
},
{
"epoch": 0.264,
"grad_norm": 2.015625,
"learning_rate": 0.0003,
"loss": 2.6255945205688476,
"step": 1320
},
{
"epoch": 0.266,
"grad_norm": 0.419921875,
"learning_rate": 0.0003,
"loss": 2.619590950012207,
"step": 1330
},
{
"epoch": 0.268,
"grad_norm": 0.057861328125,
"learning_rate": 0.0003,
"loss": 2.618213081359863,
"step": 1340
},
{
"epoch": 0.27,
"grad_norm": 0.054443359375,
"learning_rate": 0.0003,
"loss": 2.6290687561035155,
"step": 1350
},
{
"epoch": 0.272,
"grad_norm": 0.2080078125,
"learning_rate": 0.0003,
"loss": 2.5912906646728517,
"step": 1360
},
{
"epoch": 0.274,
"grad_norm": 0.06787109375,
"learning_rate": 0.0003,
"loss": 2.608586311340332,
"step": 1370
},
{
"epoch": 0.276,
"grad_norm": 0.2734375,
"learning_rate": 0.0003,
"loss": 2.6140621185302733,
"step": 1380
},
{
"epoch": 0.278,
"grad_norm": 0.060546875,
"learning_rate": 0.0003,
"loss": 2.6242074966430664,
"step": 1390
},
{
"epoch": 0.28,
"grad_norm": 0.056640625,
"learning_rate": 0.0003,
"loss": 2.6025035858154295,
"step": 1400
},
{
"epoch": 0.28,
"eval_loss": 3.0289111137390137,
"eval_runtime": 4.3992,
"eval_samples_per_second": 67.739,
"eval_steps_per_second": 3.864,
"step": 1400
},
{
"epoch": 0.282,
"grad_norm": 0.09228515625,
"learning_rate": 0.0003,
"loss": 2.6210390090942384,
"step": 1410
},
{
"epoch": 0.284,
"grad_norm": 0.087890625,
"learning_rate": 0.0003,
"loss": 2.6299697875976564,
"step": 1420
},
{
"epoch": 0.286,
"grad_norm": 0.060546875,
"learning_rate": 0.0003,
"loss": 2.60406494140625,
"step": 1430
},
{
"epoch": 0.288,
"grad_norm": 0.060546875,
"learning_rate": 0.0003,
"loss": 2.599949264526367,
"step": 1440
},
{
"epoch": 0.29,
"grad_norm": 0.212890625,
"learning_rate": 0.0003,
"loss": 2.5918996810913084,
"step": 1450
},
{
"epoch": 0.292,
"grad_norm": 0.51953125,
"learning_rate": 0.0003,
"loss": 2.5961977005004884,
"step": 1460
},
{
"epoch": 0.294,
"grad_norm": 0.0634765625,
"learning_rate": 0.0003,
"loss": 2.5982738494873048,
"step": 1470
},
{
"epoch": 0.296,
"grad_norm": 0.0771484375,
"learning_rate": 0.0003,
"loss": 2.6246980667114257,
"step": 1480
},
{
"epoch": 0.298,
"grad_norm": 0.515625,
"learning_rate": 0.0003,
"loss": 2.583383560180664,
"step": 1490
},
{
"epoch": 0.3,
"grad_norm": 0.068359375,
"learning_rate": 0.0003,
"loss": 2.6035650253295897,
"step": 1500
},
{
"epoch": 0.3,
"eval_loss": 3.0258114337921143,
"eval_runtime": 4.3825,
"eval_samples_per_second": 67.998,
"eval_steps_per_second": 3.879,
"step": 1500
},
{
"epoch": 0.302,
"grad_norm": 0.058349609375,
"learning_rate": 0.0003,
"loss": 2.601143646240234,
"step": 1510
},
{
"epoch": 0.304,
"grad_norm": 0.177734375,
"learning_rate": 0.0003,
"loss": 2.6228967666625977,
"step": 1520
},
{
"epoch": 0.306,
"grad_norm": 0.12158203125,
"learning_rate": 0.0003,
"loss": 2.611318588256836,
"step": 1530
},
{
"epoch": 0.308,
"grad_norm": 0.06201171875,
"learning_rate": 0.0003,
"loss": 2.61364860534668,
"step": 1540
},
{
"epoch": 0.31,
"grad_norm": 0.05419921875,
"learning_rate": 0.0003,
"loss": 2.6139429092407225,
"step": 1550
},
{
"epoch": 0.312,
"grad_norm": 0.08837890625,
"learning_rate": 0.0003,
"loss": 2.6160503387451173,
"step": 1560
},
{
"epoch": 0.314,
"grad_norm": 0.0673828125,
"learning_rate": 0.0003,
"loss": 2.615163230895996,
"step": 1570
},
{
"epoch": 0.316,
"grad_norm": 0.055419921875,
"learning_rate": 0.0003,
"loss": 2.592479705810547,
"step": 1580
},
{
"epoch": 0.318,
"grad_norm": 0.41796875,
"learning_rate": 0.0003,
"loss": 2.587255668640137,
"step": 1590
},
{
"epoch": 0.32,
"grad_norm": 0.11181640625,
"learning_rate": 0.0003,
"loss": 2.6103662490844726,
"step": 1600
},
{
"epoch": 0.32,
"eval_loss": 3.0303030014038086,
"eval_runtime": 4.4554,
"eval_samples_per_second": 66.885,
"eval_steps_per_second": 3.816,
"step": 1600
},
{
"epoch": 0.322,
"grad_norm": 0.056884765625,
"learning_rate": 0.0003,
"loss": 2.602743911743164,
"step": 1610
},
{
"epoch": 0.324,
"grad_norm": 0.08642578125,
"learning_rate": 0.0003,
"loss": 2.604319953918457,
"step": 1620
},
{
"epoch": 0.326,
"grad_norm": 0.5859375,
"learning_rate": 0.0003,
"loss": 2.602446174621582,
"step": 1630
},
{
"epoch": 0.328,
"grad_norm": 0.056396484375,
"learning_rate": 0.0003,
"loss": 2.6054025650024415,
"step": 1640
},
{
"epoch": 0.33,
"grad_norm": 0.0791015625,
"learning_rate": 0.0003,
"loss": 2.597785758972168,
"step": 1650
},
{
"epoch": 0.332,
"grad_norm": 0.1259765625,
"learning_rate": 0.0003,
"loss": 2.5736499786376954,
"step": 1660
},
{
"epoch": 0.334,
"grad_norm": 0.07470703125,
"learning_rate": 0.0003,
"loss": 2.5932741165161133,
"step": 1670
},
{
"epoch": 0.336,
"grad_norm": 0.058837890625,
"learning_rate": 0.0003,
"loss": 2.6116256713867188,
"step": 1680
},
{
"epoch": 0.338,
"grad_norm": 0.057861328125,
"learning_rate": 0.0003,
"loss": 2.625630187988281,
"step": 1690
},
{
"epoch": 0.34,
"grad_norm": 0.06640625,
"learning_rate": 0.0003,
"loss": 2.596027374267578,
"step": 1700
},
{
"epoch": 0.34,
"eval_loss": 3.028986692428589,
"eval_runtime": 4.4483,
"eval_samples_per_second": 66.992,
"eval_steps_per_second": 3.822,
"step": 1700
},
{
"epoch": 0.342,
"grad_norm": 0.25,
"learning_rate": 0.0003,
"loss": 2.6015995025634764,
"step": 1710
},
{
"epoch": 0.344,
"grad_norm": 0.057373046875,
"learning_rate": 0.0003,
"loss": 2.598787307739258,
"step": 1720
},
{
"epoch": 0.346,
"grad_norm": 0.08544921875,
"learning_rate": 0.0003,
"loss": 2.6199289321899415,
"step": 1730
},
{
"epoch": 0.348,
"grad_norm": 0.060302734375,
"learning_rate": 0.0003,
"loss": 2.602091598510742,
"step": 1740
},
{
"epoch": 0.35,
"grad_norm": 4.875,
"learning_rate": 0.0003,
"loss": 2.5984159469604493,
"step": 1750
},
{
"epoch": 0.352,
"grad_norm": 0.05224609375,
"learning_rate": 0.0003,
"loss": 2.6147043228149416,
"step": 1760
},
{
"epoch": 0.354,
"grad_norm": 0.1982421875,
"learning_rate": 0.0003,
"loss": 2.6081768035888673,
"step": 1770
},
{
"epoch": 0.356,
"grad_norm": 0.1328125,
"learning_rate": 0.0003,
"loss": 2.6030120849609375,
"step": 1780
},
{
"epoch": 0.358,
"grad_norm": 0.08642578125,
"learning_rate": 0.0003,
"loss": 2.6104217529296876,
"step": 1790
},
{
"epoch": 0.36,
"grad_norm": 0.051025390625,
"learning_rate": 0.0003,
"loss": 2.5706939697265625,
"step": 1800
},
{
"epoch": 0.36,
"eval_loss": 3.0339813232421875,
"eval_runtime": 4.452,
"eval_samples_per_second": 66.937,
"eval_steps_per_second": 3.819,
"step": 1800
},
{
"epoch": 0.362,
"grad_norm": 0.1376953125,
"learning_rate": 0.0003,
"loss": 2.576882743835449,
"step": 1810
},
{
"epoch": 0.364,
"grad_norm": 0.1162109375,
"learning_rate": 0.0003,
"loss": 2.601199913024902,
"step": 1820
},
{
"epoch": 0.366,
"grad_norm": 0.062255859375,
"learning_rate": 0.0003,
"loss": 2.570973777770996,
"step": 1830
},
{
"epoch": 0.368,
"grad_norm": 0.05859375,
"learning_rate": 0.0003,
"loss": 2.618685722351074,
"step": 1840
},
{
"epoch": 0.37,
"grad_norm": 0.05859375,
"learning_rate": 0.0003,
"loss": 2.613678550720215,
"step": 1850
},
{
"epoch": 0.372,
"grad_norm": 0.06640625,
"learning_rate": 0.0003,
"loss": 2.595960235595703,
"step": 1860
},
{
"epoch": 0.374,
"grad_norm": 0.0595703125,
"learning_rate": 0.0003,
"loss": 2.6117223739624023,
"step": 1870
},
{
"epoch": 0.376,
"grad_norm": 0.09423828125,
"learning_rate": 0.0003,
"loss": 2.5977685928344725,
"step": 1880
},
{
"epoch": 0.378,
"grad_norm": 0.060791015625,
"learning_rate": 0.0003,
"loss": 2.619519805908203,
"step": 1890
},
{
"epoch": 0.38,
"grad_norm": 0.12060546875,
"learning_rate": 0.0003,
"loss": 2.606584930419922,
"step": 1900
},
{
"epoch": 0.38,
"eval_loss": 3.0274596214294434,
"eval_runtime": 4.4258,
"eval_samples_per_second": 67.332,
"eval_steps_per_second": 3.841,
"step": 1900
},
{
"epoch": 0.382,
"grad_norm": 0.052734375,
"learning_rate": 0.0003,
"loss": 2.598057174682617,
"step": 1910
},
{
"epoch": 0.384,
"grad_norm": 0.09228515625,
"learning_rate": 0.0003,
"loss": 2.5836353302001953,
"step": 1920
},
{
"epoch": 0.386,
"grad_norm": 0.68359375,
"learning_rate": 0.0003,
"loss": 2.5969900131225585,
"step": 1930
},
{
"epoch": 0.388,
"grad_norm": 0.06982421875,
"learning_rate": 0.0003,
"loss": 2.610474395751953,
"step": 1940
},
{
"epoch": 0.39,
"grad_norm": 0.16015625,
"learning_rate": 0.0003,
"loss": 2.589932441711426,
"step": 1950
},
{
"epoch": 0.392,
"grad_norm": 0.05908203125,
"learning_rate": 0.0003,
"loss": 2.616892433166504,
"step": 1960
},
{
"epoch": 0.394,
"grad_norm": 0.054931640625,
"learning_rate": 0.0003,
"loss": 2.5918600082397463,
"step": 1970
},
{
"epoch": 0.396,
"grad_norm": 0.1064453125,
"learning_rate": 0.0003,
"loss": 2.6085411071777345,
"step": 1980
},
{
"epoch": 0.398,
"grad_norm": 0.0576171875,
"learning_rate": 0.0003,
"loss": 2.598824691772461,
"step": 1990
},
{
"epoch": 0.4,
"grad_norm": 0.07861328125,
"learning_rate": 0.0003,
"loss": 2.5938999176025392,
"step": 2000
},
{
"epoch": 0.4,
"eval_loss": 3.030641794204712,
"eval_runtime": 4.4468,
"eval_samples_per_second": 67.014,
"eval_steps_per_second": 3.823,
"step": 2000
},
{
"epoch": 0.402,
"grad_norm": 0.059326171875,
"learning_rate": 0.0003,
"loss": 2.608153533935547,
"step": 2010
},
{
"epoch": 0.404,
"grad_norm": 0.20703125,
"learning_rate": 0.0003,
"loss": 2.6085268020629884,
"step": 2020
},
{
"epoch": 0.406,
"grad_norm": 0.9296875,
"learning_rate": 0.0003,
"loss": 2.605429267883301,
"step": 2030
},
{
"epoch": 0.408,
"grad_norm": 0.08056640625,
"learning_rate": 0.0003,
"loss": 2.6161428451538087,
"step": 2040
},
{
"epoch": 0.41,
"grad_norm": 0.0576171875,
"learning_rate": 0.0003,
"loss": 2.587337112426758,
"step": 2050
},
{
"epoch": 0.412,
"grad_norm": 1.5546875,
"learning_rate": 0.0003,
"loss": 2.613199996948242,
"step": 2060
},
{
"epoch": 0.414,
"grad_norm": 0.4375,
"learning_rate": 0.0003,
"loss": 2.595570945739746,
"step": 2070
},
{
"epoch": 0.416,
"grad_norm": 0.059326171875,
"learning_rate": 0.0003,
"loss": 2.614238166809082,
"step": 2080
},
{
"epoch": 0.418,
"grad_norm": 0.050537109375,
"learning_rate": 0.0003,
"loss": 2.5990161895751953,
"step": 2090
},
{
"epoch": 0.42,
"grad_norm": 0.05126953125,
"learning_rate": 0.0003,
"loss": 2.6036991119384765,
"step": 2100
},
{
"epoch": 0.42,
"eval_loss": 3.0276641845703125,
"eval_runtime": 4.4443,
"eval_samples_per_second": 67.052,
"eval_steps_per_second": 3.825,
"step": 2100
},
{
"epoch": 0.422,
"grad_norm": 0.05126953125,
"learning_rate": 0.0003,
"loss": 2.5789426803588866,
"step": 2110
},
{
"epoch": 0.424,
"grad_norm": 0.083984375,
"learning_rate": 0.0003,
"loss": 2.592574119567871,
"step": 2120
},
{
"epoch": 0.426,
"grad_norm": 0.049072265625,
"learning_rate": 0.0003,
"loss": 2.592014122009277,
"step": 2130
},
{
"epoch": 0.428,
"grad_norm": 0.0859375,
"learning_rate": 0.0003,
"loss": 2.5774700164794924,
"step": 2140
},
{
"epoch": 0.43,
"grad_norm": 0.05615234375,
"learning_rate": 0.0003,
"loss": 2.613265037536621,
"step": 2150
},
{
"epoch": 0.432,
"grad_norm": 0.068359375,
"learning_rate": 0.0003,
"loss": 2.5970441818237306,
"step": 2160
},
{
"epoch": 0.434,
"grad_norm": 0.08447265625,
"learning_rate": 0.0003,
"loss": 2.6015340805053713,
"step": 2170
},
{
"epoch": 0.436,
"grad_norm": 0.640625,
"learning_rate": 0.0003,
"loss": 2.58035945892334,
"step": 2180
},
{
"epoch": 0.438,
"grad_norm": 0.06640625,
"learning_rate": 0.0003,
"loss": 2.609104537963867,
"step": 2190
},
{
"epoch": 0.44,
"grad_norm": 0.057861328125,
"learning_rate": 0.0003,
"loss": 2.5889204025268553,
"step": 2200
},
{
"epoch": 0.44,
"eval_loss": 3.0296566486358643,
"eval_runtime": 4.4076,
"eval_samples_per_second": 67.61,
"eval_steps_per_second": 3.857,
"step": 2200
},
{
"epoch": 0.442,
"grad_norm": 0.054931640625,
"learning_rate": 0.0003,
"loss": 2.582586097717285,
"step": 2210
},
{
"epoch": 0.444,
"grad_norm": 0.06787109375,
"learning_rate": 0.0003,
"loss": 2.606948471069336,
"step": 2220
},
{
"epoch": 0.446,
"grad_norm": 0.7421875,
"learning_rate": 0.0003,
"loss": 2.5844865798950196,
"step": 2230
},
{
"epoch": 0.448,
"grad_norm": 0.1025390625,
"learning_rate": 0.0003,
"loss": 2.5672168731689453,
"step": 2240
},
{
"epoch": 0.45,
"grad_norm": 0.05810546875,
"learning_rate": 0.0003,
"loss": 2.588663673400879,
"step": 2250
},
{
"epoch": 0.452,
"grad_norm": 0.05224609375,
"learning_rate": 0.0003,
"loss": 2.594828987121582,
"step": 2260
},
{
"epoch": 0.454,
"grad_norm": 0.060546875,
"learning_rate": 0.0003,
"loss": 2.6015480041503904,
"step": 2270
},
{
"epoch": 0.456,
"grad_norm": 0.0576171875,
"learning_rate": 0.0003,
"loss": 2.6068796157836913,
"step": 2280
},
{
"epoch": 0.458,
"grad_norm": 0.5859375,
"learning_rate": 0.0003,
"loss": 2.59091854095459,
"step": 2290
},
{
"epoch": 0.46,
"grad_norm": 0.1142578125,
"learning_rate": 0.0003,
"loss": 2.5947988510131834,
"step": 2300
},
{
"epoch": 0.46,
"eval_loss": 3.028251886367798,
"eval_runtime": 4.4313,
"eval_samples_per_second": 67.249,
"eval_steps_per_second": 3.836,
"step": 2300
},
{
"epoch": 0.462,
"grad_norm": 0.0673828125,
"learning_rate": 0.0003,
"loss": 2.604340744018555,
"step": 2310
},
{
"epoch": 0.464,
"grad_norm": 0.08203125,
"learning_rate": 0.0003,
"loss": 2.610575866699219,
"step": 2320
},
{
"epoch": 0.466,
"grad_norm": 0.26953125,
"learning_rate": 0.0003,
"loss": 2.5987600326538085,
"step": 2330
},
{
"epoch": 0.468,
"grad_norm": 0.1572265625,
"learning_rate": 0.0003,
"loss": 2.5745519638061523,
"step": 2340
},
{
"epoch": 0.47,
"grad_norm": 0.0751953125,
"learning_rate": 0.0003,
"loss": 2.5737417221069334,
"step": 2350
},
{
"epoch": 0.472,
"grad_norm": 0.061279296875,
"learning_rate": 0.0003,
"loss": 2.586330795288086,
"step": 2360
},
{
"epoch": 0.474,
"grad_norm": 0.04931640625,
"learning_rate": 0.0003,
"loss": 2.6139583587646484,
"step": 2370
},
{
"epoch": 0.476,
"grad_norm": 0.05908203125,
"learning_rate": 0.0003,
"loss": 2.55531005859375,
"step": 2380
},
{
"epoch": 0.478,
"grad_norm": 0.060302734375,
"learning_rate": 0.0003,
"loss": 2.601852226257324,
"step": 2390
},
{
"epoch": 0.48,
"grad_norm": 0.05712890625,
"learning_rate": 0.0003,
"loss": 2.6031288146972655,
"step": 2400
},
{
"epoch": 0.48,
"eval_loss": 3.02764892578125,
"eval_runtime": 4.4578,
"eval_samples_per_second": 66.849,
"eval_steps_per_second": 3.814,
"step": 2400
},
{
"epoch": 0.482,
"grad_norm": 0.053466796875,
"learning_rate": 0.0003,
"loss": 2.5988203048706056,
"step": 2410
},
{
"epoch": 0.484,
"grad_norm": 0.05517578125,
"learning_rate": 0.0003,
"loss": 2.5995391845703124,
"step": 2420
},
{
"epoch": 0.486,
"grad_norm": 0.054443359375,
"learning_rate": 0.0003,
"loss": 2.5926639556884767,
"step": 2430
},
{
"epoch": 0.488,
"grad_norm": 0.050537109375,
"learning_rate": 0.0003,
"loss": 2.615771484375,
"step": 2440
},
{
"epoch": 0.49,
"grad_norm": 0.216796875,
"learning_rate": 0.0003,
"loss": 2.5967260360717774,
"step": 2450
},
{
"epoch": 0.492,
"grad_norm": 0.1171875,
"learning_rate": 0.0003,
"loss": 2.6070770263671874,
"step": 2460
},
{
"epoch": 0.494,
"grad_norm": 0.04931640625,
"learning_rate": 0.0003,
"loss": 2.632620620727539,
"step": 2470
},
{
"epoch": 0.496,
"grad_norm": 0.08056640625,
"learning_rate": 0.0003,
"loss": 2.6182647705078126,
"step": 2480
},
{
"epoch": 0.498,
"grad_norm": 0.0537109375,
"learning_rate": 0.0003,
"loss": 2.6368099212646485,
"step": 2490
},
{
"epoch": 0.5,
"grad_norm": 0.80078125,
"learning_rate": 0.0003,
"loss": 2.607630729675293,
"step": 2500
},
{
"epoch": 0.5,
"eval_loss": 3.0262646675109863,
"eval_runtime": 4.4503,
"eval_samples_per_second": 66.962,
"eval_steps_per_second": 3.82,
"step": 2500
},
{
"epoch": 0.502,
"grad_norm": 0.048095703125,
"learning_rate": 0.0003,
"loss": 2.600408363342285,
"step": 2510
},
{
"epoch": 0.504,
"grad_norm": 0.052001953125,
"learning_rate": 0.0003,
"loss": 2.6103189468383787,
"step": 2520
},
{
"epoch": 0.506,
"grad_norm": 0.05712890625,
"learning_rate": 0.0003,
"loss": 2.5979167938232424,
"step": 2530
},
{
"epoch": 0.508,
"grad_norm": 0.049560546875,
"learning_rate": 0.0003,
"loss": 2.5972728729248047,
"step": 2540
},
{
"epoch": 0.51,
"grad_norm": 0.050048828125,
"learning_rate": 0.0003,
"loss": 2.608352851867676,
"step": 2550
},
{
"epoch": 0.512,
"grad_norm": 0.07275390625,
"learning_rate": 0.0003,
"loss": 2.600900650024414,
"step": 2560
},
{
"epoch": 0.514,
"grad_norm": 0.052734375,
"learning_rate": 0.0003,
"loss": 2.638876533508301,
"step": 2570
},
{
"epoch": 0.516,
"grad_norm": 0.05126953125,
"learning_rate": 0.0003,
"loss": 2.610831069946289,
"step": 2580
},
{
"epoch": 0.518,
"grad_norm": 0.051513671875,
"learning_rate": 0.0003,
"loss": 2.6283756256103517,
"step": 2590
},
{
"epoch": 0.52,
"grad_norm": 0.0791015625,
"learning_rate": 0.0003,
"loss": 2.6440673828125,
"step": 2600
},
{
"epoch": 0.52,
"eval_loss": 3.0254361629486084,
"eval_runtime": 4.3572,
"eval_samples_per_second": 68.392,
"eval_steps_per_second": 3.902,
"step": 2600
},
{
"epoch": 0.522,
"grad_norm": 0.05029296875,
"learning_rate": 0.0003,
"loss": 2.625893211364746,
"step": 2610
},
{
"epoch": 0.524,
"grad_norm": 0.061767578125,
"learning_rate": 0.0003,
"loss": 2.6046930313110352,
"step": 2620
},
{
"epoch": 0.526,
"grad_norm": 0.055419921875,
"learning_rate": 0.0003,
"loss": 2.623915100097656,
"step": 2630
},
{
"epoch": 0.528,
"grad_norm": 0.058349609375,
"learning_rate": 0.0003,
"loss": 2.6163360595703127,
"step": 2640
},
{
"epoch": 0.53,
"grad_norm": 0.04736328125,
"learning_rate": 0.0003,
"loss": 2.5871484756469725,
"step": 2650
},
{
"epoch": 0.532,
"grad_norm": 0.059326171875,
"learning_rate": 0.0003,
"loss": 2.6428932189941405,
"step": 2660
},
{
"epoch": 0.534,
"grad_norm": 0.0498046875,
"learning_rate": 0.0003,
"loss": 2.608722686767578,
"step": 2670
},
{
"epoch": 0.536,
"grad_norm": 0.224609375,
"learning_rate": 0.0003,
"loss": 2.6207298278808593,
"step": 2680
},
{
"epoch": 0.538,
"grad_norm": 0.056884765625,
"learning_rate": 0.0003,
"loss": 2.598964309692383,
"step": 2690
},
{
"epoch": 0.54,
"grad_norm": 0.185546875,
"learning_rate": 0.0003,
"loss": 2.6367502212524414,
"step": 2700
},
{
"epoch": 0.54,
"eval_loss": 3.0251870155334473,
"eval_runtime": 4.446,
"eval_samples_per_second": 67.027,
"eval_steps_per_second": 3.824,
"step": 2700
},
{
"epoch": 0.542,
"grad_norm": 0.0732421875,
"learning_rate": 0.0003,
"loss": 2.625163269042969,
"step": 2710
},
{
"epoch": 0.544,
"grad_norm": 0.054931640625,
"learning_rate": 0.0003,
"loss": 2.641737365722656,
"step": 2720
},
{
"epoch": 0.546,
"grad_norm": 0.1845703125,
"learning_rate": 0.0003,
"loss": 2.6120086669921876,
"step": 2730
},
{
"epoch": 0.548,
"grad_norm": 0.049560546875,
"learning_rate": 0.0003,
"loss": 2.5945173263549806,
"step": 2740
},
{
"epoch": 0.55,
"grad_norm": 0.060302734375,
"learning_rate": 0.0003,
"loss": 2.635161590576172,
"step": 2750
},
{
"epoch": 0.552,
"grad_norm": 1.8046875,
"learning_rate": 0.0003,
"loss": 2.6317985534667967,
"step": 2760
},
{
"epoch": 0.554,
"grad_norm": 0.0517578125,
"learning_rate": 0.0003,
"loss": 2.6268796920776367,
"step": 2770
},
{
"epoch": 0.556,
"grad_norm": 2.015625,
"learning_rate": 0.0003,
"loss": 2.639748382568359,
"step": 2780
},
{
"epoch": 0.558,
"grad_norm": 0.061767578125,
"learning_rate": 0.0003,
"loss": 2.6535463333129883,
"step": 2790
},
{
"epoch": 0.56,
"grad_norm": 0.06396484375,
"learning_rate": 0.0003,
"loss": 2.609045219421387,
"step": 2800
},
{
"epoch": 0.56,
"eval_loss": 3.024867534637451,
"eval_runtime": 4.4522,
"eval_samples_per_second": 66.933,
"eval_steps_per_second": 3.818,
"step": 2800
},
{
"epoch": 0.562,
"grad_norm": 0.064453125,
"learning_rate": 0.0003,
"loss": 2.6145769119262696,
"step": 2810
},
{
"epoch": 0.564,
"grad_norm": 0.052978515625,
"learning_rate": 0.0003,
"loss": 2.603018379211426,
"step": 2820
},
{
"epoch": 0.566,
"grad_norm": 0.05615234375,
"learning_rate": 0.0003,
"loss": 2.6036045074462892,
"step": 2830
},
{
"epoch": 0.568,
"grad_norm": 0.049560546875,
"learning_rate": 0.0003,
"loss": 2.610326385498047,
"step": 2840
},
{
"epoch": 0.57,
"grad_norm": 0.060546875,
"learning_rate": 0.0003,
"loss": 2.5892526626586916,
"step": 2850
},
{
"epoch": 0.572,
"grad_norm": 0.06103515625,
"learning_rate": 0.0003,
"loss": 2.6054714202880858,
"step": 2860
},
{
"epoch": 0.574,
"grad_norm": 0.05810546875,
"learning_rate": 0.0003,
"loss": 2.622623062133789,
"step": 2870
},
{
"epoch": 0.576,
"grad_norm": 0.384765625,
"learning_rate": 0.0003,
"loss": 2.6183904647827148,
"step": 2880
},
{
"epoch": 0.578,
"grad_norm": 4.875,
"learning_rate": 0.0003,
"loss": 2.5992977142333986,
"step": 2890
},
{
"epoch": 0.58,
"grad_norm": 0.154296875,
"learning_rate": 0.0003,
"loss": 2.6220735549926757,
"step": 2900
},
{
"epoch": 0.58,
"eval_loss": 3.024597644805908,
"eval_runtime": 4.4485,
"eval_samples_per_second": 66.989,
"eval_steps_per_second": 3.822,
"step": 2900
},
{
"epoch": 0.582,
"grad_norm": 0.046875,
"learning_rate": 0.0003,
"loss": 2.6097631454467773,
"step": 2910
},
{
"epoch": 0.584,
"grad_norm": 0.435546875,
"learning_rate": 0.0003,
"loss": 2.6088932037353514,
"step": 2920
},
{
"epoch": 0.586,
"grad_norm": 0.06494140625,
"learning_rate": 0.0003,
"loss": 2.6292213439941405,
"step": 2930
},
{
"epoch": 0.588,
"grad_norm": 0.052734375,
"learning_rate": 0.0003,
"loss": 2.6273422241210938,
"step": 2940
},
{
"epoch": 0.59,
"grad_norm": 0.09716796875,
"learning_rate": 0.0003,
"loss": 2.622287368774414,
"step": 2950
},
{
"epoch": 0.592,
"grad_norm": 0.0498046875,
"learning_rate": 0.0003,
"loss": 2.5906503677368162,
"step": 2960
},
{
"epoch": 0.594,
"grad_norm": 0.057373046875,
"learning_rate": 0.0003,
"loss": 2.631303596496582,
"step": 2970
},
{
"epoch": 0.596,
"grad_norm": 0.054443359375,
"learning_rate": 0.0003,
"loss": 2.6114727020263673,
"step": 2980
},
{
"epoch": 0.598,
"grad_norm": 0.0908203125,
"learning_rate": 0.0003,
"loss": 2.603567886352539,
"step": 2990
},
{
"epoch": 0.6,
"grad_norm": 0.0556640625,
"learning_rate": 0.0003,
"loss": 2.585314178466797,
"step": 3000
},
{
"epoch": 0.6,
"eval_loss": 3.0278046131134033,
"eval_runtime": 4.4444,
"eval_samples_per_second": 67.051,
"eval_steps_per_second": 3.825,
"step": 3000
},
{
"epoch": 0.602,
"grad_norm": 0.055908203125,
"learning_rate": 0.0003,
"loss": 2.6127801895141602,
"step": 3010
},
{
"epoch": 0.604,
"grad_norm": 0.1455078125,
"learning_rate": 0.0003,
"loss": 2.5975704193115234,
"step": 3020
},
{
"epoch": 0.606,
"grad_norm": 15.0625,
"learning_rate": 0.0003,
"loss": 2.5873924255371095,
"step": 3030
},
{
"epoch": 0.608,
"grad_norm": 0.0478515625,
"learning_rate": 0.0003,
"loss": 2.5901187896728515,
"step": 3040
},
{
"epoch": 0.61,
"grad_norm": 0.166015625,
"learning_rate": 0.0003,
"loss": 2.585931968688965,
"step": 3050
},
{
"epoch": 0.612,
"grad_norm": 0.053466796875,
"learning_rate": 0.0003,
"loss": 2.6187633514404296,
"step": 3060
},
{
"epoch": 0.614,
"grad_norm": 0.0556640625,
"learning_rate": 0.0003,
"loss": 2.6473546981811524,
"step": 3070
},
{
"epoch": 0.616,
"grad_norm": 0.055908203125,
"learning_rate": 0.0003,
"loss": 2.606519317626953,
"step": 3080
},
{
"epoch": 0.618,
"grad_norm": 12.0,
"learning_rate": 0.0003,
"loss": 2.6005083084106446,
"step": 3090
},
{
"epoch": 0.62,
"grad_norm": 0.0615234375,
"learning_rate": 0.0003,
"loss": 2.6309852600097656,
"step": 3100
},
{
"epoch": 0.62,
"eval_loss": 3.0271658897399902,
"eval_runtime": 4.4454,
"eval_samples_per_second": 67.036,
"eval_steps_per_second": 3.824,
"step": 3100
},
{
"epoch": 0.622,
"grad_norm": 0.107421875,
"learning_rate": 0.0003,
"loss": 2.6178503036499023,
"step": 3110
},
{
"epoch": 0.624,
"grad_norm": 0.06640625,
"learning_rate": 0.0003,
"loss": 2.614837646484375,
"step": 3120
},
{
"epoch": 0.626,
"grad_norm": 1.203125,
"learning_rate": 0.0003,
"loss": 2.62316837310791,
"step": 3130
},
{
"epoch": 0.628,
"grad_norm": 0.0517578125,
"learning_rate": 0.0003,
"loss": 2.59710693359375,
"step": 3140
},
{
"epoch": 0.63,
"grad_norm": 0.058349609375,
"learning_rate": 0.0003,
"loss": 2.6030540466308594,
"step": 3150
},
{
"epoch": 0.632,
"grad_norm": 0.05029296875,
"learning_rate": 0.0003,
"loss": 2.5992559432983398,
"step": 3160
},
{
"epoch": 0.634,
"grad_norm": 0.052490234375,
"learning_rate": 0.0003,
"loss": 2.6360668182373046,
"step": 3170
},
{
"epoch": 0.636,
"grad_norm": 0.11279296875,
"learning_rate": 0.0003,
"loss": 2.6165666580200195,
"step": 3180
},
{
"epoch": 0.638,
"grad_norm": 0.052978515625,
"learning_rate": 0.0003,
"loss": 2.636544036865234,
"step": 3190
},
{
"epoch": 0.64,
"grad_norm": 0.0947265625,
"learning_rate": 0.0003,
"loss": 2.6081783294677736,
"step": 3200
},
{
"epoch": 0.64,
"eval_loss": 3.0295300483703613,
"eval_runtime": 4.4243,
"eval_samples_per_second": 67.356,
"eval_steps_per_second": 3.842,
"step": 3200
},
{
"epoch": 0.642,
"grad_norm": 0.07470703125,
"learning_rate": 0.0003,
"loss": 2.6136301040649412,
"step": 3210
},
{
"epoch": 0.644,
"grad_norm": 5.59375,
"learning_rate": 0.0003,
"loss": 2.611122703552246,
"step": 3220
},
{
"epoch": 0.646,
"grad_norm": 0.0888671875,
"learning_rate": 0.0003,
"loss": 2.611610984802246,
"step": 3230
},
{
"epoch": 0.648,
"grad_norm": 6.4375,
"learning_rate": 0.0003,
"loss": 2.6010536193847655,
"step": 3240
},
{
"epoch": 0.65,
"grad_norm": 0.051513671875,
"learning_rate": 0.0003,
"loss": 2.623811149597168,
"step": 3250
},
{
"epoch": 0.652,
"grad_norm": 0.06005859375,
"learning_rate": 0.0003,
"loss": 2.5976247787475586,
"step": 3260
},
{
"epoch": 0.654,
"grad_norm": 0.05859375,
"learning_rate": 0.0003,
"loss": 2.593853569030762,
"step": 3270
},
{
"epoch": 0.656,
"grad_norm": 0.060546875,
"learning_rate": 0.0003,
"loss": 2.645317268371582,
"step": 3280
},
{
"epoch": 0.658,
"grad_norm": 0.0595703125,
"learning_rate": 0.0003,
"loss": 2.592297172546387,
"step": 3290
},
{
"epoch": 0.66,
"grad_norm": 2.21875,
"learning_rate": 0.0003,
"loss": 2.60241641998291,
"step": 3300
},
{
"epoch": 0.66,
"eval_loss": 3.0250847339630127,
"eval_runtime": 4.4783,
"eval_samples_per_second": 66.543,
"eval_steps_per_second": 3.796,
"step": 3300
},
{
"epoch": 0.662,
"grad_norm": 0.052490234375,
"learning_rate": 0.0003,
"loss": 2.600591278076172,
"step": 3310
},
{
"epoch": 0.664,
"grad_norm": 0.052978515625,
"learning_rate": 0.0003,
"loss": 2.6144927978515624,
"step": 3320
},
{
"epoch": 0.666,
"grad_norm": 0.057861328125,
"learning_rate": 0.0003,
"loss": 2.593229866027832,
"step": 3330
},
{
"epoch": 0.668,
"grad_norm": 0.0546875,
"learning_rate": 0.0003,
"loss": 2.6041738510131838,
"step": 3340
},
{
"epoch": 0.67,
"grad_norm": 0.052978515625,
"learning_rate": 0.0003,
"loss": 2.607752227783203,
"step": 3350
},
{
"epoch": 0.672,
"grad_norm": 1.671875,
"learning_rate": 0.0003,
"loss": 2.6296701431274414,
"step": 3360
},
{
"epoch": 0.674,
"grad_norm": 0.55859375,
"learning_rate": 0.0003,
"loss": 2.5772432327270507,
"step": 3370
},
{
"epoch": 0.676,
"grad_norm": 0.052734375,
"learning_rate": 0.0003,
"loss": 2.6260414123535156,
"step": 3380
},
{
"epoch": 0.678,
"grad_norm": 0.062255859375,
"learning_rate": 0.0003,
"loss": 2.5910011291503907,
"step": 3390
},
{
"epoch": 0.68,
"grad_norm": 0.0546875,
"learning_rate": 0.0003,
"loss": 2.5773406982421876,
"step": 3400
},
{
"epoch": 0.68,
"eval_loss": 3.0262410640716553,
"eval_runtime": 4.4195,
"eval_samples_per_second": 67.428,
"eval_steps_per_second": 3.847,
"step": 3400
},
{
"epoch": 0.682,
"grad_norm": 0.056640625,
"learning_rate": 0.0003,
"loss": 2.602094268798828,
"step": 3410
},
{
"epoch": 0.684,
"grad_norm": 0.04931640625,
"learning_rate": 0.0003,
"loss": 2.6283613204956056,
"step": 3420
},
{
"epoch": 0.686,
"grad_norm": 0.26171875,
"learning_rate": 0.0003,
"loss": 2.58358211517334,
"step": 3430
},
{
"epoch": 0.688,
"grad_norm": 0.052978515625,
"learning_rate": 0.0003,
"loss": 2.5964986801147463,
"step": 3440
},
{
"epoch": 0.69,
"grad_norm": 0.05322265625,
"learning_rate": 0.0003,
"loss": 2.5851970672607423,
"step": 3450
},
{
"epoch": 0.692,
"grad_norm": 0.051025390625,
"learning_rate": 0.0003,
"loss": 2.6003726959228515,
"step": 3460
},
{
"epoch": 0.694,
"grad_norm": 0.050048828125,
"learning_rate": 0.0003,
"loss": 2.6186376571655274,
"step": 3470
},
{
"epoch": 0.696,
"grad_norm": 0.052001953125,
"learning_rate": 0.0003,
"loss": 2.624268341064453,
"step": 3480
},
{
"epoch": 0.698,
"grad_norm": 0.05029296875,
"learning_rate": 0.0003,
"loss": 2.5755191802978517,
"step": 3490
},
{
"epoch": 0.7,
"grad_norm": 0.244140625,
"learning_rate": 0.0003,
"loss": 2.593659782409668,
"step": 3500
},
{
"epoch": 0.7,
"eval_loss": 3.0274429321289062,
"eval_runtime": 4.4166,
"eval_samples_per_second": 67.472,
"eval_steps_per_second": 3.849,
"step": 3500
},
{
"epoch": 0.702,
"grad_norm": 0.053466796875,
"learning_rate": 0.0003,
"loss": 2.599693489074707,
"step": 3510
},
{
"epoch": 0.704,
"grad_norm": 0.07275390625,
"learning_rate": 0.0003,
"loss": 2.599070167541504,
"step": 3520
},
{
"epoch": 0.706,
"grad_norm": 0.055419921875,
"learning_rate": 0.0003,
"loss": 2.6012365341186525,
"step": 3530
},
{
"epoch": 0.708,
"grad_norm": 0.05224609375,
"learning_rate": 0.0003,
"loss": 2.576295852661133,
"step": 3540
},
{
"epoch": 0.71,
"grad_norm": 0.0517578125,
"learning_rate": 0.0003,
"loss": 2.6024765014648437,
"step": 3550
},
{
"epoch": 0.712,
"grad_norm": 0.0693359375,
"learning_rate": 0.0003,
"loss": 2.5685857772827148,
"step": 3560
},
{
"epoch": 0.714,
"grad_norm": 0.1220703125,
"learning_rate": 0.0003,
"loss": 2.584480094909668,
"step": 3570
},
{
"epoch": 0.716,
"grad_norm": 0.06396484375,
"learning_rate": 0.0003,
"loss": 2.6187564849853517,
"step": 3580
},
{
"epoch": 0.718,
"grad_norm": 0.05126953125,
"learning_rate": 0.0003,
"loss": 2.608148384094238,
"step": 3590
},
{
"epoch": 0.72,
"grad_norm": 0.056396484375,
"learning_rate": 0.0003,
"loss": 2.596156883239746,
"step": 3600
},
{
"epoch": 0.72,
"eval_loss": 3.0285751819610596,
"eval_runtime": 4.4537,
"eval_samples_per_second": 66.91,
"eval_steps_per_second": 3.817,
"step": 3600
},
{
"epoch": 0.722,
"grad_norm": 2.265625,
"learning_rate": 0.0003,
"loss": 2.6053913116455076,
"step": 3610
},
{
"epoch": 0.724,
"grad_norm": 0.1259765625,
"learning_rate": 0.0003,
"loss": 2.5906614303588866,
"step": 3620
},
{
"epoch": 0.726,
"grad_norm": 0.058349609375,
"learning_rate": 0.0003,
"loss": 2.6229223251342773,
"step": 3630
},
{
"epoch": 0.728,
"grad_norm": 0.054443359375,
"learning_rate": 0.0003,
"loss": 2.6100414276123045,
"step": 3640
},
{
"epoch": 0.73,
"grad_norm": 0.05078125,
"learning_rate": 0.0003,
"loss": 2.5861778259277344,
"step": 3650
},
{
"epoch": 0.732,
"grad_norm": 0.06884765625,
"learning_rate": 0.0003,
"loss": 2.6088991165161133,
"step": 3660
},
{
"epoch": 0.734,
"grad_norm": 0.0546875,
"learning_rate": 0.0003,
"loss": 2.5957805633544924,
"step": 3670
},
{
"epoch": 0.736,
"grad_norm": 0.08447265625,
"learning_rate": 0.0003,
"loss": 2.5968517303466796,
"step": 3680
},
{
"epoch": 0.738,
"grad_norm": 0.06396484375,
"learning_rate": 0.0003,
"loss": 2.590867614746094,
"step": 3690
},
{
"epoch": 0.74,
"grad_norm": 0.057373046875,
"learning_rate": 0.0003,
"loss": 2.6020263671875,
"step": 3700
},
{
"epoch": 0.74,
"eval_loss": 3.033440113067627,
"eval_runtime": 4.4438,
"eval_samples_per_second": 67.059,
"eval_steps_per_second": 3.826,
"step": 3700
},
{
"epoch": 0.742,
"grad_norm": 1.8359375,
"learning_rate": 0.0003,
"loss": 2.624915885925293,
"step": 3710
},
{
"epoch": 0.744,
"grad_norm": 0.05322265625,
"learning_rate": 0.0003,
"loss": 2.6158367156982423,
"step": 3720
},
{
"epoch": 0.746,
"grad_norm": 0.052978515625,
"learning_rate": 0.0003,
"loss": 2.5968292236328123,
"step": 3730
},
{
"epoch": 0.748,
"grad_norm": 0.0849609375,
"learning_rate": 0.0003,
"loss": 2.61802978515625,
"step": 3740
},
{
"epoch": 0.75,
"grad_norm": 0.05517578125,
"learning_rate": 0.0003,
"loss": 2.5647909164428713,
"step": 3750
},
{
"epoch": 0.752,
"grad_norm": 0.060791015625,
"learning_rate": 0.0003,
"loss": 2.601895332336426,
"step": 3760
},
{
"epoch": 0.754,
"grad_norm": 0.0556640625,
"learning_rate": 0.0003,
"loss": 2.605121612548828,
"step": 3770
},
{
"epoch": 0.756,
"grad_norm": 0.09716796875,
"learning_rate": 0.0003,
"loss": 2.6213621139526366,
"step": 3780
},
{
"epoch": 0.758,
"grad_norm": 0.05078125,
"learning_rate": 0.0003,
"loss": 2.5848875045776367,
"step": 3790
},
{
"epoch": 0.76,
"grad_norm": 0.05859375,
"learning_rate": 0.0003,
"loss": 2.585398483276367,
"step": 3800
},
{
"epoch": 0.76,
"eval_loss": 3.0310301780700684,
"eval_runtime": 4.4352,
"eval_samples_per_second": 67.19,
"eval_steps_per_second": 3.833,
"step": 3800
},
{
"epoch": 0.762,
"grad_norm": 0.0830078125,
"learning_rate": 0.0003,
"loss": 2.5891979217529295,
"step": 3810
},
{
"epoch": 0.764,
"grad_norm": 0.048828125,
"learning_rate": 0.0003,
"loss": 2.587088203430176,
"step": 3820
},
{
"epoch": 0.766,
"grad_norm": 0.056884765625,
"learning_rate": 0.0003,
"loss": 2.6202329635620116,
"step": 3830
},
{
"epoch": 0.768,
"grad_norm": 0.058349609375,
"learning_rate": 0.0003,
"loss": 2.588342475891113,
"step": 3840
},
{
"epoch": 0.77,
"grad_norm": 0.051513671875,
"learning_rate": 0.0003,
"loss": 2.570342445373535,
"step": 3850
},
{
"epoch": 0.772,
"grad_norm": 0.054443359375,
"learning_rate": 0.0003,
"loss": 2.5928205490112304,
"step": 3860
},
{
"epoch": 0.774,
"grad_norm": 1.1484375,
"learning_rate": 0.0003,
"loss": 2.562236785888672,
"step": 3870
},
{
"epoch": 0.776,
"grad_norm": 0.05322265625,
"learning_rate": 0.0003,
"loss": 2.5821876525878906,
"step": 3880
},
{
"epoch": 0.778,
"grad_norm": 0.05029296875,
"learning_rate": 0.0003,
"loss": 2.583372688293457,
"step": 3890
},
{
"epoch": 0.78,
"grad_norm": 0.197265625,
"learning_rate": 0.0003,
"loss": 2.5738046646118162,
"step": 3900
},
{
"epoch": 0.78,
"eval_loss": 3.029505491256714,
"eval_runtime": 4.3771,
"eval_samples_per_second": 68.082,
"eval_steps_per_second": 3.884,
"step": 3900
},
{
"epoch": 0.782,
"grad_norm": 0.173828125,
"learning_rate": 0.0003,
"loss": 2.576494598388672,
"step": 3910
},
{
"epoch": 0.784,
"grad_norm": 0.380859375,
"learning_rate": 0.0003,
"loss": 2.5919593811035155,
"step": 3920
},
{
"epoch": 0.786,
"grad_norm": 0.048095703125,
"learning_rate": 0.0003,
"loss": 2.621496391296387,
"step": 3930
},
{
"epoch": 0.788,
"grad_norm": 0.052490234375,
"learning_rate": 0.0003,
"loss": 2.584731101989746,
"step": 3940
},
{
"epoch": 0.79,
"grad_norm": 0.0498046875,
"learning_rate": 0.0003,
"loss": 2.568536567687988,
"step": 3950
},
{
"epoch": 0.792,
"grad_norm": 0.0615234375,
"learning_rate": 0.0003,
"loss": 2.590066909790039,
"step": 3960
},
{
"epoch": 0.794,
"grad_norm": 0.060791015625,
"learning_rate": 0.0003,
"loss": 2.613643264770508,
"step": 3970
},
{
"epoch": 0.796,
"grad_norm": 0.052734375,
"learning_rate": 0.0003,
"loss": 2.614491081237793,
"step": 3980
},
{
"epoch": 0.798,
"grad_norm": 0.0517578125,
"learning_rate": 0.0003,
"loss": 2.591320037841797,
"step": 3990
},
{
"epoch": 0.8,
"grad_norm": 0.04931640625,
"learning_rate": 0.0003,
"loss": 2.605324554443359,
"step": 4000
},
{
"epoch": 0.8,
"eval_loss": 3.0305187702178955,
"eval_runtime": 4.4657,
"eval_samples_per_second": 66.73,
"eval_steps_per_second": 3.807,
"step": 4000
},
{
"epoch": 0.802,
"grad_norm": 0.054931640625,
"learning_rate": 0.0003,
"loss": 2.5756288528442384,
"step": 4010
},
{
"epoch": 0.804,
"grad_norm": 0.5546875,
"learning_rate": 0.0003,
"loss": 2.591953468322754,
"step": 4020
},
{
"epoch": 0.806,
"grad_norm": 0.05029296875,
"learning_rate": 0.0003,
"loss": 2.5956727981567385,
"step": 4030
},
{
"epoch": 0.808,
"grad_norm": 0.05224609375,
"learning_rate": 0.0003,
"loss": 2.60211067199707,
"step": 4040
},
{
"epoch": 0.81,
"grad_norm": 0.049072265625,
"learning_rate": 0.0003,
"loss": 2.5871608734130858,
"step": 4050
},
{
"epoch": 0.812,
"grad_norm": 0.10693359375,
"learning_rate": 0.0003,
"loss": 2.5698373794555662,
"step": 4060
},
{
"epoch": 0.814,
"grad_norm": 0.05810546875,
"learning_rate": 0.0003,
"loss": 2.6126802444458006,
"step": 4070
},
{
"epoch": 0.816,
"grad_norm": 0.05029296875,
"learning_rate": 0.0003,
"loss": 2.5981868743896483,
"step": 4080
},
{
"epoch": 0.818,
"grad_norm": 0.052978515625,
"learning_rate": 0.0003,
"loss": 2.580386161804199,
"step": 4090
},
{
"epoch": 0.82,
"grad_norm": 0.07080078125,
"learning_rate": 0.0003,
"loss": 2.5840375900268553,
"step": 4100
},
{
"epoch": 0.82,
"eval_loss": 3.0312201976776123,
"eval_runtime": 4.4429,
"eval_samples_per_second": 67.074,
"eval_steps_per_second": 3.826,
"step": 4100
},
{
"epoch": 0.822,
"grad_norm": 0.052978515625,
"learning_rate": 0.0003,
"loss": 2.6040040969848635,
"step": 4110
},
{
"epoch": 0.824,
"grad_norm": 0.05224609375,
"learning_rate": 0.0003,
"loss": 2.5784271240234373,
"step": 4120
},
{
"epoch": 0.826,
"grad_norm": 0.05078125,
"learning_rate": 0.0003,
"loss": 2.5992313385009767,
"step": 4130
},
{
"epoch": 0.828,
"grad_norm": 0.62109375,
"learning_rate": 0.0003,
"loss": 2.607274055480957,
"step": 4140
},
{
"epoch": 0.83,
"grad_norm": 0.05126953125,
"learning_rate": 0.0003,
"loss": 2.5900325775146484,
"step": 4150
},
{
"epoch": 0.832,
"grad_norm": 0.0556640625,
"learning_rate": 0.0003,
"loss": 2.584280586242676,
"step": 4160
},
{
"epoch": 0.834,
"grad_norm": 0.06103515625,
"learning_rate": 0.0003,
"loss": 2.578823471069336,
"step": 4170
},
{
"epoch": 0.836,
"grad_norm": 0.05908203125,
"learning_rate": 0.0003,
"loss": 2.600706672668457,
"step": 4180
},
{
"epoch": 0.838,
"grad_norm": 0.054931640625,
"learning_rate": 0.0003,
"loss": 2.5908893585205077,
"step": 4190
},
{
"epoch": 0.84,
"grad_norm": 0.08740234375,
"learning_rate": 0.0003,
"loss": 2.6078845977783205,
"step": 4200
},
{
"epoch": 0.84,
"eval_loss": 3.0311102867126465,
"eval_runtime": 4.4714,
"eval_samples_per_second": 66.645,
"eval_steps_per_second": 3.802,
"step": 4200
},
{
"epoch": 0.842,
"grad_norm": 0.0556640625,
"learning_rate": 0.0003,
"loss": 2.630947303771973,
"step": 4210
},
{
"epoch": 0.844,
"grad_norm": 0.09423828125,
"learning_rate": 0.0003,
"loss": 2.623428726196289,
"step": 4220
},
{
"epoch": 0.846,
"grad_norm": 0.111328125,
"learning_rate": 0.0003,
"loss": 2.5977907180786133,
"step": 4230
},
{
"epoch": 0.848,
"grad_norm": 0.455078125,
"learning_rate": 0.0003,
"loss": 2.6008005142211914,
"step": 4240
},
{
"epoch": 0.85,
"grad_norm": 1.6015625,
"learning_rate": 0.0003,
"loss": 2.5678030014038087,
"step": 4250
},
{
"epoch": 0.852,
"grad_norm": 0.052490234375,
"learning_rate": 0.0003,
"loss": 2.613857650756836,
"step": 4260
},
{
"epoch": 0.854,
"grad_norm": 0.08349609375,
"learning_rate": 0.0003,
"loss": 2.579903221130371,
"step": 4270
},
{
"epoch": 0.856,
"grad_norm": 0.049560546875,
"learning_rate": 0.0003,
"loss": 2.579732131958008,
"step": 4280
},
{
"epoch": 0.858,
"grad_norm": 0.181640625,
"learning_rate": 0.0003,
"loss": 2.5955440521240236,
"step": 4290
},
{
"epoch": 0.86,
"grad_norm": 0.05712890625,
"learning_rate": 0.0003,
"loss": 2.592930793762207,
"step": 4300
},
{
"epoch": 0.86,
"eval_loss": 3.031736373901367,
"eval_runtime": 4.4299,
"eval_samples_per_second": 67.27,
"eval_steps_per_second": 3.838,
"step": 4300
},
{
"epoch": 0.862,
"grad_norm": 0.05419921875,
"learning_rate": 0.0003,
"loss": 2.592413902282715,
"step": 4310
},
{
"epoch": 0.864,
"grad_norm": 0.10986328125,
"learning_rate": 0.0003,
"loss": 2.569998931884766,
"step": 4320
},
{
"epoch": 0.866,
"grad_norm": 0.048583984375,
"learning_rate": 0.0003,
"loss": 2.5922664642333983,
"step": 4330
},
{
"epoch": 0.868,
"grad_norm": 0.052734375,
"learning_rate": 0.0003,
"loss": 2.6012556076049806,
"step": 4340
},
{
"epoch": 0.87,
"grad_norm": 0.07177734375,
"learning_rate": 0.0003,
"loss": 2.6031923294067383,
"step": 4350
},
{
"epoch": 0.872,
"grad_norm": 0.07763671875,
"learning_rate": 0.0003,
"loss": 2.59698543548584,
"step": 4360
},
{
"epoch": 0.874,
"grad_norm": 0.051513671875,
"learning_rate": 0.0003,
"loss": 2.6096282958984376,
"step": 4370
},
{
"epoch": 0.876,
"grad_norm": 0.052734375,
"learning_rate": 0.0003,
"loss": 2.6013412475585938,
"step": 4380
},
{
"epoch": 0.878,
"grad_norm": 0.051025390625,
"learning_rate": 0.0003,
"loss": 2.570247268676758,
"step": 4390
},
{
"epoch": 0.88,
"grad_norm": 0.19140625,
"learning_rate": 0.0003,
"loss": 2.6004173278808596,
"step": 4400
},
{
"epoch": 0.88,
"eval_loss": 3.032118320465088,
"eval_runtime": 4.4552,
"eval_samples_per_second": 66.887,
"eval_steps_per_second": 3.816,
"step": 4400
},
{
"epoch": 0.882,
"grad_norm": 0.050048828125,
"learning_rate": 0.0003,
"loss": 2.60999755859375,
"step": 4410
},
{
"epoch": 0.884,
"grad_norm": 0.1044921875,
"learning_rate": 0.0003,
"loss": 2.5999217987060548,
"step": 4420
},
{
"epoch": 0.886,
"grad_norm": 0.255859375,
"learning_rate": 0.0003,
"loss": 2.57828369140625,
"step": 4430
},
{
"epoch": 0.888,
"grad_norm": 0.0556640625,
"learning_rate": 0.0003,
"loss": 2.5876300811767576,
"step": 4440
},
{
"epoch": 0.89,
"grad_norm": 0.052490234375,
"learning_rate": 0.0003,
"loss": 2.5927480697631835,
"step": 4450
},
{
"epoch": 0.892,
"grad_norm": 0.076171875,
"learning_rate": 0.0003,
"loss": 2.6045318603515626,
"step": 4460
},
{
"epoch": 0.894,
"grad_norm": 0.06201171875,
"learning_rate": 0.0003,
"loss": 2.585988235473633,
"step": 4470
},
{
"epoch": 0.896,
"grad_norm": 0.050048828125,
"learning_rate": 0.0003,
"loss": 2.613155555725098,
"step": 4480
},
{
"epoch": 0.898,
"grad_norm": 4.125,
"learning_rate": 0.0003,
"loss": 2.592078971862793,
"step": 4490
},
{
"epoch": 0.9,
"grad_norm": 0.048095703125,
"learning_rate": 0.0003,
"loss": 2.591631317138672,
"step": 4500
},
{
"epoch": 0.9,
"eval_loss": 3.028334617614746,
"eval_runtime": 4.4441,
"eval_samples_per_second": 67.055,
"eval_steps_per_second": 3.825,
"step": 4500
}
],
"logging_steps": 10,
"max_steps": 5000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.467695316860928e+18,
"train_batch_size": 18,
"trial_name": null,
"trial_params": null
}