{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9, "eval_steps": 100, "global_step": 4500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002, "grad_norm": 366.0, "learning_rate": 1.7999999999999997e-05, "loss": 3.335772705078125, "step": 10 }, { "epoch": 0.004, "grad_norm": 76.0, "learning_rate": 3.8e-05, "loss": 3.325016403198242, "step": 20 }, { "epoch": 0.006, "grad_norm": 426.0, "learning_rate": 5.7999999999999994e-05, "loss": 3.355701446533203, "step": 30 }, { "epoch": 0.008, "grad_norm": 194.0, "learning_rate": 7.8e-05, "loss": 3.3106155395507812, "step": 40 }, { "epoch": 0.01, "grad_norm": 712.0, "learning_rate": 9.799999999999998e-05, "loss": 3.270039367675781, "step": 50 }, { "epoch": 0.012, "grad_norm": 164.0, "learning_rate": 0.00011799999999999998, "loss": 3.2886486053466797, "step": 60 }, { "epoch": 0.014, "grad_norm": 162.0, "learning_rate": 0.000138, "loss": 3.2564620971679688, "step": 70 }, { "epoch": 0.016, "grad_norm": 234.0, "learning_rate": 0.00015799999999999996, "loss": 3.267023468017578, "step": 80 }, { "epoch": 0.018, "grad_norm": 1536.0, "learning_rate": 0.000178, "loss": 3.231563949584961, "step": 90 }, { "epoch": 0.02, "grad_norm": 39.5, "learning_rate": 0.000198, "loss": 3.2340599060058595, "step": 100 }, { "epoch": 0.02, "eval_loss": 3.491870403289795, "eval_runtime": 4.5004, "eval_samples_per_second": 66.216, "eval_steps_per_second": 3.777, "step": 100 }, { "epoch": 0.022, "grad_norm": 23.0, "learning_rate": 0.00021799999999999999, "loss": 3.20191650390625, "step": 110 }, { "epoch": 0.024, "grad_norm": 32.0, "learning_rate": 0.00023799999999999998, "loss": 3.2040287017822267, "step": 120 }, { "epoch": 0.026, "grad_norm": 136.0, "learning_rate": 0.000258, "loss": 3.1589597702026366, "step": 130 }, { "epoch": 0.028, "grad_norm": 238.0, "learning_rate": 0.000278, "loss": 3.150320625305176, "step": 140 }, { "epoch": 0.03, "grad_norm": 540.0, "learning_rate": 0.000298, "loss": 3.172740364074707, "step": 150 }, { "epoch": 0.032, "grad_norm": 58.0, "learning_rate": 0.0003, "loss": 3.149807167053223, "step": 160 }, { "epoch": 0.034, "grad_norm": 196.0, "learning_rate": 0.0003, "loss": 3.169495391845703, "step": 170 }, { "epoch": 0.036, "grad_norm": 444.0, "learning_rate": 0.0003, "loss": 3.1639734268188477, "step": 180 }, { "epoch": 0.038, "grad_norm": 378.0, "learning_rate": 0.0003, "loss": 3.221640777587891, "step": 190 }, { "epoch": 0.04, "grad_norm": 2272.0, "learning_rate": 0.0003, "loss": 3.1916147232055665, "step": 200 }, { "epoch": 0.04, "eval_loss": 3.4648807048797607, "eval_runtime": 4.3534, "eval_samples_per_second": 68.452, "eval_steps_per_second": 3.905, "step": 200 }, { "epoch": 0.042, "grad_norm": 520.0, "learning_rate": 0.0003, "loss": 3.1814949035644533, "step": 210 }, { "epoch": 0.044, "grad_norm": 87.0, "learning_rate": 0.0003, "loss": 3.1746402740478517, "step": 220 }, { "epoch": 0.046, "grad_norm": 39.0, "learning_rate": 0.0003, "loss": 3.172597885131836, "step": 230 }, { "epoch": 0.048, "grad_norm": 50.5, "learning_rate": 0.0003, "loss": 3.1576799392700194, "step": 240 }, { "epoch": 0.05, "grad_norm": 29.0, "learning_rate": 0.0003, "loss": 3.1418006896972654, "step": 250 }, { "epoch": 0.052, "grad_norm": 50.5, "learning_rate": 0.0003, "loss": 3.1035797119140627, "step": 260 }, { "epoch": 0.054, "grad_norm": 568.0, "learning_rate": 0.0003, "loss": 3.095198059082031, "step": 270 }, { "epoch": 0.056, "grad_norm": 15.5625, "learning_rate": 0.0003, "loss": 3.079079818725586, "step": 280 }, { "epoch": 0.058, "grad_norm": 17.625, "learning_rate": 0.0003, "loss": 3.060195732116699, "step": 290 }, { "epoch": 0.06, "grad_norm": 56.25, "learning_rate": 0.0003, "loss": 3.0736625671386717, "step": 300 }, { "epoch": 0.06, "eval_loss": 3.349555015563965, "eval_runtime": 4.3918, "eval_samples_per_second": 67.854, "eval_steps_per_second": 3.871, "step": 300 }, { "epoch": 0.062, "grad_norm": 432.0, "learning_rate": 0.0003, "loss": 3.0508825302124025, "step": 310 }, { "epoch": 0.064, "grad_norm": 6.28125, "learning_rate": 0.0003, "loss": 3.021405792236328, "step": 320 }, { "epoch": 0.066, "grad_norm": 161.0, "learning_rate": 0.0003, "loss": 3.011042022705078, "step": 330 }, { "epoch": 0.068, "grad_norm": 29.625, "learning_rate": 0.0003, "loss": 2.9988969802856444, "step": 340 }, { "epoch": 0.07, "grad_norm": 24.625, "learning_rate": 0.0003, "loss": 2.9939882278442385, "step": 350 }, { "epoch": 0.072, "grad_norm": 61.0, "learning_rate": 0.0003, "loss": 2.979990768432617, "step": 360 }, { "epoch": 0.074, "grad_norm": 13.6875, "learning_rate": 0.0003, "loss": 2.9845876693725586, "step": 370 }, { "epoch": 0.076, "grad_norm": 280.0, "learning_rate": 0.0003, "loss": 2.975000762939453, "step": 380 }, { "epoch": 0.078, "grad_norm": 21.125, "learning_rate": 0.0003, "loss": 2.958791732788086, "step": 390 }, { "epoch": 0.08, "grad_norm": 12.8125, "learning_rate": 0.0003, "loss": 2.956746482849121, "step": 400 }, { "epoch": 0.08, "eval_loss": 3.2549893856048584, "eval_runtime": 4.4045, "eval_samples_per_second": 67.658, "eval_steps_per_second": 3.86, "step": 400 }, { "epoch": 0.082, "grad_norm": 314.0, "learning_rate": 0.0003, "loss": 2.9515405654907227, "step": 410 }, { "epoch": 0.084, "grad_norm": 2.125, "learning_rate": 0.0003, "loss": 2.910631561279297, "step": 420 }, { "epoch": 0.086, "grad_norm": 24.75, "learning_rate": 0.0003, "loss": 2.8589399337768553, "step": 430 }, { "epoch": 0.088, "grad_norm": 3.78125, "learning_rate": 0.0003, "loss": 2.844576835632324, "step": 440 }, { "epoch": 0.09, "grad_norm": 1.6171875, "learning_rate": 0.0003, "loss": 2.7850717544555663, "step": 450 }, { "epoch": 0.092, "grad_norm": 6.5625, "learning_rate": 0.0003, "loss": 2.7605606079101563, "step": 460 }, { "epoch": 0.094, "grad_norm": 12.5625, "learning_rate": 0.0003, "loss": 2.747697639465332, "step": 470 }, { "epoch": 0.096, "grad_norm": 0.7734375, "learning_rate": 0.0003, "loss": 2.7024419784545897, "step": 480 }, { "epoch": 0.098, "grad_norm": 0.55078125, "learning_rate": 0.0003, "loss": 2.727059173583984, "step": 490 }, { "epoch": 0.1, "grad_norm": 1.3046875, "learning_rate": 0.0003, "loss": 2.688610076904297, "step": 500 }, { "epoch": 0.1, "eval_loss": 3.0536108016967773, "eval_runtime": 4.4183, "eval_samples_per_second": 67.447, "eval_steps_per_second": 3.848, "step": 500 }, { "epoch": 0.102, "grad_norm": 0.66796875, "learning_rate": 0.0003, "loss": 2.6653621673583983, "step": 510 }, { "epoch": 0.104, "grad_norm": 2.53125, "learning_rate": 0.0003, "loss": 2.6938413619995116, "step": 520 }, { "epoch": 0.106, "grad_norm": 1.578125, "learning_rate": 0.0003, "loss": 2.6589494705200196, "step": 530 }, { "epoch": 0.108, "grad_norm": 1.453125, "learning_rate": 0.0003, "loss": 2.6775186538696287, "step": 540 }, { "epoch": 0.11, "grad_norm": 0.1806640625, "learning_rate": 0.0003, "loss": 2.659619140625, "step": 550 }, { "epoch": 0.112, "grad_norm": 0.212890625, "learning_rate": 0.0003, "loss": 2.644103240966797, "step": 560 }, { "epoch": 0.114, "grad_norm": 0.73046875, "learning_rate": 0.0003, "loss": 2.65213565826416, "step": 570 }, { "epoch": 0.116, "grad_norm": 1.1796875, "learning_rate": 0.0003, "loss": 2.6230279922485353, "step": 580 }, { "epoch": 0.118, "grad_norm": 0.166015625, "learning_rate": 0.0003, "loss": 2.6443111419677736, "step": 590 }, { "epoch": 0.12, "grad_norm": 0.8203125, "learning_rate": 0.0003, "loss": 2.6569570541381835, "step": 600 }, { "epoch": 0.12, "eval_loss": 3.0349245071411133, "eval_runtime": 4.4206, "eval_samples_per_second": 67.412, "eval_steps_per_second": 3.846, "step": 600 }, { "epoch": 0.122, "grad_norm": 0.1181640625, "learning_rate": 0.0003, "loss": 2.6595781326293944, "step": 610 }, { "epoch": 0.124, "grad_norm": 0.232421875, "learning_rate": 0.0003, "loss": 2.610936737060547, "step": 620 }, { "epoch": 0.126, "grad_norm": 0.1435546875, "learning_rate": 0.0003, "loss": 2.6387302398681642, "step": 630 }, { "epoch": 0.128, "grad_norm": 0.14453125, "learning_rate": 0.0003, "loss": 2.62979793548584, "step": 640 }, { "epoch": 0.13, "grad_norm": 2.34375, "learning_rate": 0.0003, "loss": 2.649636650085449, "step": 650 }, { "epoch": 0.132, "grad_norm": 0.2041015625, "learning_rate": 0.0003, "loss": 2.622520637512207, "step": 660 }, { "epoch": 0.134, "grad_norm": 0.97265625, "learning_rate": 0.0003, "loss": 2.646112823486328, "step": 670 }, { "epoch": 0.136, "grad_norm": 5.8125, "learning_rate": 0.0003, "loss": 2.6434356689453127, "step": 680 }, { "epoch": 0.138, "grad_norm": 0.10693359375, "learning_rate": 0.0003, "loss": 2.623065376281738, "step": 690 }, { "epoch": 0.14, "grad_norm": 0.90625, "learning_rate": 0.0003, "loss": 2.6090648651123045, "step": 700 }, { "epoch": 0.14, "eval_loss": 3.0306036472320557, "eval_runtime": 4.4176, "eval_samples_per_second": 67.457, "eval_steps_per_second": 3.848, "step": 700 }, { "epoch": 0.142, "grad_norm": 0.6328125, "learning_rate": 0.0003, "loss": 2.6384559631347657, "step": 710 }, { "epoch": 0.144, "grad_norm": 0.640625, "learning_rate": 0.0003, "loss": 2.6472700119018553, "step": 720 }, { "epoch": 0.146, "grad_norm": 0.07177734375, "learning_rate": 0.0003, "loss": 2.6483619689941404, "step": 730 }, { "epoch": 0.148, "grad_norm": 0.322265625, "learning_rate": 0.0003, "loss": 2.626618766784668, "step": 740 }, { "epoch": 0.15, "grad_norm": 0.099609375, "learning_rate": 0.0003, "loss": 2.6325525283813476, "step": 750 }, { "epoch": 0.152, "grad_norm": 0.1611328125, "learning_rate": 0.0003, "loss": 2.6193023681640626, "step": 760 }, { "epoch": 0.154, "grad_norm": 0.072265625, "learning_rate": 0.0003, "loss": 2.618332862854004, "step": 770 }, { "epoch": 0.156, "grad_norm": 0.87109375, "learning_rate": 0.0003, "loss": 2.610393524169922, "step": 780 }, { "epoch": 0.158, "grad_norm": 0.09716796875, "learning_rate": 0.0003, "loss": 2.6242008209228516, "step": 790 }, { "epoch": 0.16, "grad_norm": 0.072265625, "learning_rate": 0.0003, "loss": 2.638929748535156, "step": 800 }, { "epoch": 0.16, "eval_loss": 3.0286974906921387, "eval_runtime": 4.4633, "eval_samples_per_second": 66.766, "eval_steps_per_second": 3.809, "step": 800 }, { "epoch": 0.162, "grad_norm": 0.29296875, "learning_rate": 0.0003, "loss": 2.638911247253418, "step": 810 }, { "epoch": 0.164, "grad_norm": 0.62890625, "learning_rate": 0.0003, "loss": 2.6282770156860353, "step": 820 }, { "epoch": 0.166, "grad_norm": 0.0859375, "learning_rate": 0.0003, "loss": 2.668540382385254, "step": 830 }, { "epoch": 0.168, "grad_norm": 0.08349609375, "learning_rate": 0.0003, "loss": 2.6025644302368165, "step": 840 }, { "epoch": 0.17, "grad_norm": 0.251953125, "learning_rate": 0.0003, "loss": 2.614345932006836, "step": 850 }, { "epoch": 0.172, "grad_norm": 1.2421875, "learning_rate": 0.0003, "loss": 2.6097484588623048, "step": 860 }, { "epoch": 0.174, "grad_norm": 0.10107421875, "learning_rate": 0.0003, "loss": 2.5976139068603517, "step": 870 }, { "epoch": 0.176, "grad_norm": 0.0634765625, "learning_rate": 0.0003, "loss": 2.609291648864746, "step": 880 }, { "epoch": 0.178, "grad_norm": 0.060302734375, "learning_rate": 0.0003, "loss": 2.6136356353759767, "step": 890 }, { "epoch": 0.18, "grad_norm": 0.306640625, "learning_rate": 0.0003, "loss": 2.6354192733764648, "step": 900 }, { "epoch": 0.18, "eval_loss": 3.028738021850586, "eval_runtime": 4.4125, "eval_samples_per_second": 67.536, "eval_steps_per_second": 3.853, "step": 900 }, { "epoch": 0.182, "grad_norm": 0.65234375, "learning_rate": 0.0003, "loss": 2.6325847625732424, "step": 910 }, { "epoch": 0.184, "grad_norm": 0.4921875, "learning_rate": 0.0003, "loss": 2.6379472732543947, "step": 920 }, { "epoch": 0.186, "grad_norm": 0.216796875, "learning_rate": 0.0003, "loss": 2.647774505615234, "step": 930 }, { "epoch": 0.188, "grad_norm": 0.083984375, "learning_rate": 0.0003, "loss": 2.628580665588379, "step": 940 }, { "epoch": 0.19, "grad_norm": 0.09033203125, "learning_rate": 0.0003, "loss": 2.63638973236084, "step": 950 }, { "epoch": 0.192, "grad_norm": 0.08056640625, "learning_rate": 0.0003, "loss": 2.628683853149414, "step": 960 }, { "epoch": 0.194, "grad_norm": 0.06787109375, "learning_rate": 0.0003, "loss": 2.628560256958008, "step": 970 }, { "epoch": 0.196, "grad_norm": 0.1328125, "learning_rate": 0.0003, "loss": 2.627498435974121, "step": 980 }, { "epoch": 0.198, "grad_norm": 0.1796875, "learning_rate": 0.0003, "loss": 2.613533782958984, "step": 990 }, { "epoch": 0.2, "grad_norm": 0.265625, "learning_rate": 0.0003, "loss": 2.615587615966797, "step": 1000 }, { "epoch": 0.2, "eval_loss": 3.0314836502075195, "eval_runtime": 4.4355, "eval_samples_per_second": 67.186, "eval_steps_per_second": 3.833, "step": 1000 }, { "epoch": 0.202, "grad_norm": 0.0859375, "learning_rate": 0.0003, "loss": 2.621230697631836, "step": 1010 }, { "epoch": 0.204, "grad_norm": 0.056640625, "learning_rate": 0.0003, "loss": 2.6316347122192383, "step": 1020 }, { "epoch": 0.206, "grad_norm": 0.2431640625, "learning_rate": 0.0003, "loss": 2.6155324935913087, "step": 1030 }, { "epoch": 0.208, "grad_norm": 0.06298828125, "learning_rate": 0.0003, "loss": 2.634638214111328, "step": 1040 }, { "epoch": 0.21, "grad_norm": 0.1064453125, "learning_rate": 0.0003, "loss": 2.6131080627441405, "step": 1050 }, { "epoch": 0.212, "grad_norm": 0.06689453125, "learning_rate": 0.0003, "loss": 2.616171646118164, "step": 1060 }, { "epoch": 0.214, "grad_norm": 0.08984375, "learning_rate": 0.0003, "loss": 2.603512191772461, "step": 1070 }, { "epoch": 0.216, "grad_norm": 0.0625, "learning_rate": 0.0003, "loss": 2.6277271270751954, "step": 1080 }, { "epoch": 0.218, "grad_norm": 0.0673828125, "learning_rate": 0.0003, "loss": 2.615810775756836, "step": 1090 }, { "epoch": 0.22, "grad_norm": 0.060791015625, "learning_rate": 0.0003, "loss": 2.6153131484985352, "step": 1100 }, { "epoch": 0.22, "eval_loss": 3.0302107334136963, "eval_runtime": 4.4032, "eval_samples_per_second": 67.678, "eval_steps_per_second": 3.861, "step": 1100 }, { "epoch": 0.222, "grad_norm": 0.064453125, "learning_rate": 0.0003, "loss": 2.623016357421875, "step": 1110 }, { "epoch": 0.224, "grad_norm": 0.0712890625, "learning_rate": 0.0003, "loss": 2.6170467376708983, "step": 1120 }, { "epoch": 0.226, "grad_norm": 0.59375, "learning_rate": 0.0003, "loss": 2.620796775817871, "step": 1130 }, { "epoch": 0.228, "grad_norm": 0.30078125, "learning_rate": 0.0003, "loss": 2.6082935333251953, "step": 1140 }, { "epoch": 0.23, "grad_norm": 0.80078125, "learning_rate": 0.0003, "loss": 2.6210090637207033, "step": 1150 }, { "epoch": 0.232, "grad_norm": 0.0634765625, "learning_rate": 0.0003, "loss": 2.636818695068359, "step": 1160 }, { "epoch": 0.234, "grad_norm": 0.07080078125, "learning_rate": 0.0003, "loss": 2.5969371795654297, "step": 1170 }, { "epoch": 0.236, "grad_norm": 0.107421875, "learning_rate": 0.0003, "loss": 2.6085494995117187, "step": 1180 }, { "epoch": 0.238, "grad_norm": 0.1826171875, "learning_rate": 0.0003, "loss": 2.6118932723999024, "step": 1190 }, { "epoch": 0.24, "grad_norm": 0.0625, "learning_rate": 0.0003, "loss": 2.6277448654174806, "step": 1200 }, { "epoch": 0.24, "eval_loss": 3.0262646675109863, "eval_runtime": 4.3768, "eval_samples_per_second": 68.087, "eval_steps_per_second": 3.884, "step": 1200 }, { "epoch": 0.242, "grad_norm": 0.08837890625, "learning_rate": 0.0003, "loss": 2.6076292037963866, "step": 1210 }, { "epoch": 0.244, "grad_norm": 0.0869140625, "learning_rate": 0.0003, "loss": 2.6239038467407227, "step": 1220 }, { "epoch": 0.246, "grad_norm": 0.06201171875, "learning_rate": 0.0003, "loss": 2.598759651184082, "step": 1230 }, { "epoch": 0.248, "grad_norm": 0.054443359375, "learning_rate": 0.0003, "loss": 2.623333549499512, "step": 1240 }, { "epoch": 0.25, "grad_norm": 0.056884765625, "learning_rate": 0.0003, "loss": 2.595660400390625, "step": 1250 }, { "epoch": 0.252, "grad_norm": 0.07470703125, "learning_rate": 0.0003, "loss": 2.6085866928100585, "step": 1260 }, { "epoch": 0.254, "grad_norm": 0.06201171875, "learning_rate": 0.0003, "loss": 2.6313194274902343, "step": 1270 }, { "epoch": 0.256, "grad_norm": 0.05126953125, "learning_rate": 0.0003, "loss": 2.624466323852539, "step": 1280 }, { "epoch": 0.258, "grad_norm": 0.0693359375, "learning_rate": 0.0003, "loss": 2.61032657623291, "step": 1290 }, { "epoch": 0.26, "grad_norm": 0.95703125, "learning_rate": 0.0003, "loss": 2.611441230773926, "step": 1300 }, { "epoch": 0.26, "eval_loss": 3.0270800590515137, "eval_runtime": 4.4364, "eval_samples_per_second": 67.171, "eval_steps_per_second": 3.832, "step": 1300 }, { "epoch": 0.262, "grad_norm": 0.416015625, "learning_rate": 0.0003, "loss": 2.622879981994629, "step": 1310 }, { "epoch": 0.264, "grad_norm": 2.015625, "learning_rate": 0.0003, "loss": 2.6255945205688476, "step": 1320 }, { "epoch": 0.266, "grad_norm": 0.419921875, "learning_rate": 0.0003, "loss": 2.619590950012207, "step": 1330 }, { "epoch": 0.268, "grad_norm": 0.057861328125, "learning_rate": 0.0003, "loss": 2.618213081359863, "step": 1340 }, { "epoch": 0.27, "grad_norm": 0.054443359375, "learning_rate": 0.0003, "loss": 2.6290687561035155, "step": 1350 }, { "epoch": 0.272, "grad_norm": 0.2080078125, "learning_rate": 0.0003, "loss": 2.5912906646728517, "step": 1360 }, { "epoch": 0.274, "grad_norm": 0.06787109375, "learning_rate": 0.0003, "loss": 2.608586311340332, "step": 1370 }, { "epoch": 0.276, "grad_norm": 0.2734375, "learning_rate": 0.0003, "loss": 2.6140621185302733, "step": 1380 }, { "epoch": 0.278, "grad_norm": 0.060546875, "learning_rate": 0.0003, "loss": 2.6242074966430664, "step": 1390 }, { "epoch": 0.28, "grad_norm": 0.056640625, "learning_rate": 0.0003, "loss": 2.6025035858154295, "step": 1400 }, { "epoch": 0.28, "eval_loss": 3.0289111137390137, "eval_runtime": 4.3992, "eval_samples_per_second": 67.739, "eval_steps_per_second": 3.864, "step": 1400 }, { "epoch": 0.282, "grad_norm": 0.09228515625, "learning_rate": 0.0003, "loss": 2.6210390090942384, "step": 1410 }, { "epoch": 0.284, "grad_norm": 0.087890625, "learning_rate": 0.0003, "loss": 2.6299697875976564, "step": 1420 }, { "epoch": 0.286, "grad_norm": 0.060546875, "learning_rate": 0.0003, "loss": 2.60406494140625, "step": 1430 }, { "epoch": 0.288, "grad_norm": 0.060546875, "learning_rate": 0.0003, "loss": 2.599949264526367, "step": 1440 }, { "epoch": 0.29, "grad_norm": 0.212890625, "learning_rate": 0.0003, "loss": 2.5918996810913084, "step": 1450 }, { "epoch": 0.292, "grad_norm": 0.51953125, "learning_rate": 0.0003, "loss": 2.5961977005004884, "step": 1460 }, { "epoch": 0.294, "grad_norm": 0.0634765625, "learning_rate": 0.0003, "loss": 2.5982738494873048, "step": 1470 }, { "epoch": 0.296, "grad_norm": 0.0771484375, "learning_rate": 0.0003, "loss": 2.6246980667114257, "step": 1480 }, { "epoch": 0.298, "grad_norm": 0.515625, "learning_rate": 0.0003, "loss": 2.583383560180664, "step": 1490 }, { "epoch": 0.3, "grad_norm": 0.068359375, "learning_rate": 0.0003, "loss": 2.6035650253295897, "step": 1500 }, { "epoch": 0.3, "eval_loss": 3.0258114337921143, "eval_runtime": 4.3825, "eval_samples_per_second": 67.998, "eval_steps_per_second": 3.879, "step": 1500 }, { "epoch": 0.302, "grad_norm": 0.058349609375, "learning_rate": 0.0003, "loss": 2.601143646240234, "step": 1510 }, { "epoch": 0.304, "grad_norm": 0.177734375, "learning_rate": 0.0003, "loss": 2.6228967666625977, "step": 1520 }, { "epoch": 0.306, "grad_norm": 0.12158203125, "learning_rate": 0.0003, "loss": 2.611318588256836, "step": 1530 }, { "epoch": 0.308, "grad_norm": 0.06201171875, "learning_rate": 0.0003, "loss": 2.61364860534668, "step": 1540 }, { "epoch": 0.31, "grad_norm": 0.05419921875, "learning_rate": 0.0003, "loss": 2.6139429092407225, "step": 1550 }, { "epoch": 0.312, "grad_norm": 0.08837890625, "learning_rate": 0.0003, "loss": 2.6160503387451173, "step": 1560 }, { "epoch": 0.314, "grad_norm": 0.0673828125, "learning_rate": 0.0003, "loss": 2.615163230895996, "step": 1570 }, { "epoch": 0.316, "grad_norm": 0.055419921875, "learning_rate": 0.0003, "loss": 2.592479705810547, "step": 1580 }, { "epoch": 0.318, "grad_norm": 0.41796875, "learning_rate": 0.0003, "loss": 2.587255668640137, "step": 1590 }, { "epoch": 0.32, "grad_norm": 0.11181640625, "learning_rate": 0.0003, "loss": 2.6103662490844726, "step": 1600 }, { "epoch": 0.32, "eval_loss": 3.0303030014038086, "eval_runtime": 4.4554, "eval_samples_per_second": 66.885, "eval_steps_per_second": 3.816, "step": 1600 }, { "epoch": 0.322, "grad_norm": 0.056884765625, "learning_rate": 0.0003, "loss": 2.602743911743164, "step": 1610 }, { "epoch": 0.324, "grad_norm": 0.08642578125, "learning_rate": 0.0003, "loss": 2.604319953918457, "step": 1620 }, { "epoch": 0.326, "grad_norm": 0.5859375, "learning_rate": 0.0003, "loss": 2.602446174621582, "step": 1630 }, { "epoch": 0.328, "grad_norm": 0.056396484375, "learning_rate": 0.0003, "loss": 2.6054025650024415, "step": 1640 }, { "epoch": 0.33, "grad_norm": 0.0791015625, "learning_rate": 0.0003, "loss": 2.597785758972168, "step": 1650 }, { "epoch": 0.332, "grad_norm": 0.1259765625, "learning_rate": 0.0003, "loss": 2.5736499786376954, "step": 1660 }, { "epoch": 0.334, "grad_norm": 0.07470703125, "learning_rate": 0.0003, "loss": 2.5932741165161133, "step": 1670 }, { "epoch": 0.336, "grad_norm": 0.058837890625, "learning_rate": 0.0003, "loss": 2.6116256713867188, "step": 1680 }, { "epoch": 0.338, "grad_norm": 0.057861328125, "learning_rate": 0.0003, "loss": 2.625630187988281, "step": 1690 }, { "epoch": 0.34, "grad_norm": 0.06640625, "learning_rate": 0.0003, "loss": 2.596027374267578, "step": 1700 }, { "epoch": 0.34, "eval_loss": 3.028986692428589, "eval_runtime": 4.4483, "eval_samples_per_second": 66.992, "eval_steps_per_second": 3.822, "step": 1700 }, { "epoch": 0.342, "grad_norm": 0.25, "learning_rate": 0.0003, "loss": 2.6015995025634764, "step": 1710 }, { "epoch": 0.344, "grad_norm": 0.057373046875, "learning_rate": 0.0003, "loss": 2.598787307739258, "step": 1720 }, { "epoch": 0.346, "grad_norm": 0.08544921875, "learning_rate": 0.0003, "loss": 2.6199289321899415, "step": 1730 }, { "epoch": 0.348, "grad_norm": 0.060302734375, "learning_rate": 0.0003, "loss": 2.602091598510742, "step": 1740 }, { "epoch": 0.35, "grad_norm": 4.875, "learning_rate": 0.0003, "loss": 2.5984159469604493, "step": 1750 }, { "epoch": 0.352, "grad_norm": 0.05224609375, "learning_rate": 0.0003, "loss": 2.6147043228149416, "step": 1760 }, { "epoch": 0.354, "grad_norm": 0.1982421875, "learning_rate": 0.0003, "loss": 2.6081768035888673, "step": 1770 }, { "epoch": 0.356, "grad_norm": 0.1328125, "learning_rate": 0.0003, "loss": 2.6030120849609375, "step": 1780 }, { "epoch": 0.358, "grad_norm": 0.08642578125, "learning_rate": 0.0003, "loss": 2.6104217529296876, "step": 1790 }, { "epoch": 0.36, "grad_norm": 0.051025390625, "learning_rate": 0.0003, "loss": 2.5706939697265625, "step": 1800 }, { "epoch": 0.36, "eval_loss": 3.0339813232421875, "eval_runtime": 4.452, "eval_samples_per_second": 66.937, "eval_steps_per_second": 3.819, "step": 1800 }, { "epoch": 0.362, "grad_norm": 0.1376953125, "learning_rate": 0.0003, "loss": 2.576882743835449, "step": 1810 }, { "epoch": 0.364, "grad_norm": 0.1162109375, "learning_rate": 0.0003, "loss": 2.601199913024902, "step": 1820 }, { "epoch": 0.366, "grad_norm": 0.062255859375, "learning_rate": 0.0003, "loss": 2.570973777770996, "step": 1830 }, { "epoch": 0.368, "grad_norm": 0.05859375, "learning_rate": 0.0003, "loss": 2.618685722351074, "step": 1840 }, { "epoch": 0.37, "grad_norm": 0.05859375, "learning_rate": 0.0003, "loss": 2.613678550720215, "step": 1850 }, { "epoch": 0.372, "grad_norm": 0.06640625, "learning_rate": 0.0003, "loss": 2.595960235595703, "step": 1860 }, { "epoch": 0.374, "grad_norm": 0.0595703125, "learning_rate": 0.0003, "loss": 2.6117223739624023, "step": 1870 }, { "epoch": 0.376, "grad_norm": 0.09423828125, "learning_rate": 0.0003, "loss": 2.5977685928344725, "step": 1880 }, { "epoch": 0.378, "grad_norm": 0.060791015625, "learning_rate": 0.0003, "loss": 2.619519805908203, "step": 1890 }, { "epoch": 0.38, "grad_norm": 0.12060546875, "learning_rate": 0.0003, "loss": 2.606584930419922, "step": 1900 }, { "epoch": 0.38, "eval_loss": 3.0274596214294434, "eval_runtime": 4.4258, "eval_samples_per_second": 67.332, "eval_steps_per_second": 3.841, "step": 1900 }, { "epoch": 0.382, "grad_norm": 0.052734375, "learning_rate": 0.0003, "loss": 2.598057174682617, "step": 1910 }, { "epoch": 0.384, "grad_norm": 0.09228515625, "learning_rate": 0.0003, "loss": 2.5836353302001953, "step": 1920 }, { "epoch": 0.386, "grad_norm": 0.68359375, "learning_rate": 0.0003, "loss": 2.5969900131225585, "step": 1930 }, { "epoch": 0.388, "grad_norm": 0.06982421875, "learning_rate": 0.0003, "loss": 2.610474395751953, "step": 1940 }, { "epoch": 0.39, "grad_norm": 0.16015625, "learning_rate": 0.0003, "loss": 2.589932441711426, "step": 1950 }, { "epoch": 0.392, "grad_norm": 0.05908203125, "learning_rate": 0.0003, "loss": 2.616892433166504, "step": 1960 }, { "epoch": 0.394, "grad_norm": 0.054931640625, "learning_rate": 0.0003, "loss": 2.5918600082397463, "step": 1970 }, { "epoch": 0.396, "grad_norm": 0.1064453125, "learning_rate": 0.0003, "loss": 2.6085411071777345, "step": 1980 }, { "epoch": 0.398, "grad_norm": 0.0576171875, "learning_rate": 0.0003, "loss": 2.598824691772461, "step": 1990 }, { "epoch": 0.4, "grad_norm": 0.07861328125, "learning_rate": 0.0003, "loss": 2.5938999176025392, "step": 2000 }, { "epoch": 0.4, "eval_loss": 3.030641794204712, "eval_runtime": 4.4468, "eval_samples_per_second": 67.014, "eval_steps_per_second": 3.823, "step": 2000 }, { "epoch": 0.402, "grad_norm": 0.059326171875, "learning_rate": 0.0003, "loss": 2.608153533935547, "step": 2010 }, { "epoch": 0.404, "grad_norm": 0.20703125, "learning_rate": 0.0003, "loss": 2.6085268020629884, "step": 2020 }, { "epoch": 0.406, "grad_norm": 0.9296875, "learning_rate": 0.0003, "loss": 2.605429267883301, "step": 2030 }, { "epoch": 0.408, "grad_norm": 0.08056640625, "learning_rate": 0.0003, "loss": 2.6161428451538087, "step": 2040 }, { "epoch": 0.41, "grad_norm": 0.0576171875, "learning_rate": 0.0003, "loss": 2.587337112426758, "step": 2050 }, { "epoch": 0.412, "grad_norm": 1.5546875, "learning_rate": 0.0003, "loss": 2.613199996948242, "step": 2060 }, { "epoch": 0.414, "grad_norm": 0.4375, "learning_rate": 0.0003, "loss": 2.595570945739746, "step": 2070 }, { "epoch": 0.416, "grad_norm": 0.059326171875, "learning_rate": 0.0003, "loss": 2.614238166809082, "step": 2080 }, { "epoch": 0.418, "grad_norm": 0.050537109375, "learning_rate": 0.0003, "loss": 2.5990161895751953, "step": 2090 }, { "epoch": 0.42, "grad_norm": 0.05126953125, "learning_rate": 0.0003, "loss": 2.6036991119384765, "step": 2100 }, { "epoch": 0.42, "eval_loss": 3.0276641845703125, "eval_runtime": 4.4443, "eval_samples_per_second": 67.052, "eval_steps_per_second": 3.825, "step": 2100 }, { "epoch": 0.422, "grad_norm": 0.05126953125, "learning_rate": 0.0003, "loss": 2.5789426803588866, "step": 2110 }, { "epoch": 0.424, "grad_norm": 0.083984375, "learning_rate": 0.0003, "loss": 2.592574119567871, "step": 2120 }, { "epoch": 0.426, "grad_norm": 0.049072265625, "learning_rate": 0.0003, "loss": 2.592014122009277, "step": 2130 }, { "epoch": 0.428, "grad_norm": 0.0859375, "learning_rate": 0.0003, "loss": 2.5774700164794924, "step": 2140 }, { "epoch": 0.43, "grad_norm": 0.05615234375, "learning_rate": 0.0003, "loss": 2.613265037536621, "step": 2150 }, { "epoch": 0.432, "grad_norm": 0.068359375, "learning_rate": 0.0003, "loss": 2.5970441818237306, "step": 2160 }, { "epoch": 0.434, "grad_norm": 0.08447265625, "learning_rate": 0.0003, "loss": 2.6015340805053713, "step": 2170 }, { "epoch": 0.436, "grad_norm": 0.640625, "learning_rate": 0.0003, "loss": 2.58035945892334, "step": 2180 }, { "epoch": 0.438, "grad_norm": 0.06640625, "learning_rate": 0.0003, "loss": 2.609104537963867, "step": 2190 }, { "epoch": 0.44, "grad_norm": 0.057861328125, "learning_rate": 0.0003, "loss": 2.5889204025268553, "step": 2200 }, { "epoch": 0.44, "eval_loss": 3.0296566486358643, "eval_runtime": 4.4076, "eval_samples_per_second": 67.61, "eval_steps_per_second": 3.857, "step": 2200 }, { "epoch": 0.442, "grad_norm": 0.054931640625, "learning_rate": 0.0003, "loss": 2.582586097717285, "step": 2210 }, { "epoch": 0.444, "grad_norm": 0.06787109375, "learning_rate": 0.0003, "loss": 2.606948471069336, "step": 2220 }, { "epoch": 0.446, "grad_norm": 0.7421875, "learning_rate": 0.0003, "loss": 2.5844865798950196, "step": 2230 }, { "epoch": 0.448, "grad_norm": 0.1025390625, "learning_rate": 0.0003, "loss": 2.5672168731689453, "step": 2240 }, { "epoch": 0.45, "grad_norm": 0.05810546875, "learning_rate": 0.0003, "loss": 2.588663673400879, "step": 2250 }, { "epoch": 0.452, "grad_norm": 0.05224609375, "learning_rate": 0.0003, "loss": 2.594828987121582, "step": 2260 }, { "epoch": 0.454, "grad_norm": 0.060546875, "learning_rate": 0.0003, "loss": 2.6015480041503904, "step": 2270 }, { "epoch": 0.456, "grad_norm": 0.0576171875, "learning_rate": 0.0003, "loss": 2.6068796157836913, "step": 2280 }, { "epoch": 0.458, "grad_norm": 0.5859375, "learning_rate": 0.0003, "loss": 2.59091854095459, "step": 2290 }, { "epoch": 0.46, "grad_norm": 0.1142578125, "learning_rate": 0.0003, "loss": 2.5947988510131834, "step": 2300 }, { "epoch": 0.46, "eval_loss": 3.028251886367798, "eval_runtime": 4.4313, "eval_samples_per_second": 67.249, "eval_steps_per_second": 3.836, "step": 2300 }, { "epoch": 0.462, "grad_norm": 0.0673828125, "learning_rate": 0.0003, "loss": 2.604340744018555, "step": 2310 }, { "epoch": 0.464, "grad_norm": 0.08203125, "learning_rate": 0.0003, "loss": 2.610575866699219, "step": 2320 }, { "epoch": 0.466, "grad_norm": 0.26953125, "learning_rate": 0.0003, "loss": 2.5987600326538085, "step": 2330 }, { "epoch": 0.468, "grad_norm": 0.1572265625, "learning_rate": 0.0003, "loss": 2.5745519638061523, "step": 2340 }, { "epoch": 0.47, "grad_norm": 0.0751953125, "learning_rate": 0.0003, "loss": 2.5737417221069334, "step": 2350 }, { "epoch": 0.472, "grad_norm": 0.061279296875, "learning_rate": 0.0003, "loss": 2.586330795288086, "step": 2360 }, { "epoch": 0.474, "grad_norm": 0.04931640625, "learning_rate": 0.0003, "loss": 2.6139583587646484, "step": 2370 }, { "epoch": 0.476, "grad_norm": 0.05908203125, "learning_rate": 0.0003, "loss": 2.55531005859375, "step": 2380 }, { "epoch": 0.478, "grad_norm": 0.060302734375, "learning_rate": 0.0003, "loss": 2.601852226257324, "step": 2390 }, { "epoch": 0.48, "grad_norm": 0.05712890625, "learning_rate": 0.0003, "loss": 2.6031288146972655, "step": 2400 }, { "epoch": 0.48, "eval_loss": 3.02764892578125, "eval_runtime": 4.4578, "eval_samples_per_second": 66.849, "eval_steps_per_second": 3.814, "step": 2400 }, { "epoch": 0.482, "grad_norm": 0.053466796875, "learning_rate": 0.0003, "loss": 2.5988203048706056, "step": 2410 }, { "epoch": 0.484, "grad_norm": 0.05517578125, "learning_rate": 0.0003, "loss": 2.5995391845703124, "step": 2420 }, { "epoch": 0.486, "grad_norm": 0.054443359375, "learning_rate": 0.0003, "loss": 2.5926639556884767, "step": 2430 }, { "epoch": 0.488, "grad_norm": 0.050537109375, "learning_rate": 0.0003, "loss": 2.615771484375, "step": 2440 }, { "epoch": 0.49, "grad_norm": 0.216796875, "learning_rate": 0.0003, "loss": 2.5967260360717774, "step": 2450 }, { "epoch": 0.492, "grad_norm": 0.1171875, "learning_rate": 0.0003, "loss": 2.6070770263671874, "step": 2460 }, { "epoch": 0.494, "grad_norm": 0.04931640625, "learning_rate": 0.0003, "loss": 2.632620620727539, "step": 2470 }, { "epoch": 0.496, "grad_norm": 0.08056640625, "learning_rate": 0.0003, "loss": 2.6182647705078126, "step": 2480 }, { "epoch": 0.498, "grad_norm": 0.0537109375, "learning_rate": 0.0003, "loss": 2.6368099212646485, "step": 2490 }, { "epoch": 0.5, "grad_norm": 0.80078125, "learning_rate": 0.0003, "loss": 2.607630729675293, "step": 2500 }, { "epoch": 0.5, "eval_loss": 3.0262646675109863, "eval_runtime": 4.4503, "eval_samples_per_second": 66.962, "eval_steps_per_second": 3.82, "step": 2500 }, { "epoch": 0.502, "grad_norm": 0.048095703125, "learning_rate": 0.0003, "loss": 2.600408363342285, "step": 2510 }, { "epoch": 0.504, "grad_norm": 0.052001953125, "learning_rate": 0.0003, "loss": 2.6103189468383787, "step": 2520 }, { "epoch": 0.506, "grad_norm": 0.05712890625, "learning_rate": 0.0003, "loss": 2.5979167938232424, "step": 2530 }, { "epoch": 0.508, "grad_norm": 0.049560546875, "learning_rate": 0.0003, "loss": 2.5972728729248047, "step": 2540 }, { "epoch": 0.51, "grad_norm": 0.050048828125, "learning_rate": 0.0003, "loss": 2.608352851867676, "step": 2550 }, { "epoch": 0.512, "grad_norm": 0.07275390625, "learning_rate": 0.0003, "loss": 2.600900650024414, "step": 2560 }, { "epoch": 0.514, "grad_norm": 0.052734375, "learning_rate": 0.0003, "loss": 2.638876533508301, "step": 2570 }, { "epoch": 0.516, "grad_norm": 0.05126953125, "learning_rate": 0.0003, "loss": 2.610831069946289, "step": 2580 }, { "epoch": 0.518, "grad_norm": 0.051513671875, "learning_rate": 0.0003, "loss": 2.6283756256103517, "step": 2590 }, { "epoch": 0.52, "grad_norm": 0.0791015625, "learning_rate": 0.0003, "loss": 2.6440673828125, "step": 2600 }, { "epoch": 0.52, "eval_loss": 3.0254361629486084, "eval_runtime": 4.3572, "eval_samples_per_second": 68.392, "eval_steps_per_second": 3.902, "step": 2600 }, { "epoch": 0.522, "grad_norm": 0.05029296875, "learning_rate": 0.0003, "loss": 2.625893211364746, "step": 2610 }, { "epoch": 0.524, "grad_norm": 0.061767578125, "learning_rate": 0.0003, "loss": 2.6046930313110352, "step": 2620 }, { "epoch": 0.526, "grad_norm": 0.055419921875, "learning_rate": 0.0003, "loss": 2.623915100097656, "step": 2630 }, { "epoch": 0.528, "grad_norm": 0.058349609375, "learning_rate": 0.0003, "loss": 2.6163360595703127, "step": 2640 }, { "epoch": 0.53, "grad_norm": 0.04736328125, "learning_rate": 0.0003, "loss": 2.5871484756469725, "step": 2650 }, { "epoch": 0.532, "grad_norm": 0.059326171875, "learning_rate": 0.0003, "loss": 2.6428932189941405, "step": 2660 }, { "epoch": 0.534, "grad_norm": 0.0498046875, "learning_rate": 0.0003, "loss": 2.608722686767578, "step": 2670 }, { "epoch": 0.536, "grad_norm": 0.224609375, "learning_rate": 0.0003, "loss": 2.6207298278808593, "step": 2680 }, { "epoch": 0.538, "grad_norm": 0.056884765625, "learning_rate": 0.0003, "loss": 2.598964309692383, "step": 2690 }, { "epoch": 0.54, "grad_norm": 0.185546875, "learning_rate": 0.0003, "loss": 2.6367502212524414, "step": 2700 }, { "epoch": 0.54, "eval_loss": 3.0251870155334473, "eval_runtime": 4.446, "eval_samples_per_second": 67.027, "eval_steps_per_second": 3.824, "step": 2700 }, { "epoch": 0.542, "grad_norm": 0.0732421875, "learning_rate": 0.0003, "loss": 2.625163269042969, "step": 2710 }, { "epoch": 0.544, "grad_norm": 0.054931640625, "learning_rate": 0.0003, "loss": 2.641737365722656, "step": 2720 }, { "epoch": 0.546, "grad_norm": 0.1845703125, "learning_rate": 0.0003, "loss": 2.6120086669921876, "step": 2730 }, { "epoch": 0.548, "grad_norm": 0.049560546875, "learning_rate": 0.0003, "loss": 2.5945173263549806, "step": 2740 }, { "epoch": 0.55, "grad_norm": 0.060302734375, "learning_rate": 0.0003, "loss": 2.635161590576172, "step": 2750 }, { "epoch": 0.552, "grad_norm": 1.8046875, "learning_rate": 0.0003, "loss": 2.6317985534667967, "step": 2760 }, { "epoch": 0.554, "grad_norm": 0.0517578125, "learning_rate": 0.0003, "loss": 2.6268796920776367, "step": 2770 }, { "epoch": 0.556, "grad_norm": 2.015625, "learning_rate": 0.0003, "loss": 2.639748382568359, "step": 2780 }, { "epoch": 0.558, "grad_norm": 0.061767578125, "learning_rate": 0.0003, "loss": 2.6535463333129883, "step": 2790 }, { "epoch": 0.56, "grad_norm": 0.06396484375, "learning_rate": 0.0003, "loss": 2.609045219421387, "step": 2800 }, { "epoch": 0.56, "eval_loss": 3.024867534637451, "eval_runtime": 4.4522, "eval_samples_per_second": 66.933, "eval_steps_per_second": 3.818, "step": 2800 }, { "epoch": 0.562, "grad_norm": 0.064453125, "learning_rate": 0.0003, "loss": 2.6145769119262696, "step": 2810 }, { "epoch": 0.564, "grad_norm": 0.052978515625, "learning_rate": 0.0003, "loss": 2.603018379211426, "step": 2820 }, { "epoch": 0.566, "grad_norm": 0.05615234375, "learning_rate": 0.0003, "loss": 2.6036045074462892, "step": 2830 }, { "epoch": 0.568, "grad_norm": 0.049560546875, "learning_rate": 0.0003, "loss": 2.610326385498047, "step": 2840 }, { "epoch": 0.57, "grad_norm": 0.060546875, "learning_rate": 0.0003, "loss": 2.5892526626586916, "step": 2850 }, { "epoch": 0.572, "grad_norm": 0.06103515625, "learning_rate": 0.0003, "loss": 2.6054714202880858, "step": 2860 }, { "epoch": 0.574, "grad_norm": 0.05810546875, "learning_rate": 0.0003, "loss": 2.622623062133789, "step": 2870 }, { "epoch": 0.576, "grad_norm": 0.384765625, "learning_rate": 0.0003, "loss": 2.6183904647827148, "step": 2880 }, { "epoch": 0.578, "grad_norm": 4.875, "learning_rate": 0.0003, "loss": 2.5992977142333986, "step": 2890 }, { "epoch": 0.58, "grad_norm": 0.154296875, "learning_rate": 0.0003, "loss": 2.6220735549926757, "step": 2900 }, { "epoch": 0.58, "eval_loss": 3.024597644805908, "eval_runtime": 4.4485, "eval_samples_per_second": 66.989, "eval_steps_per_second": 3.822, "step": 2900 }, { "epoch": 0.582, "grad_norm": 0.046875, "learning_rate": 0.0003, "loss": 2.6097631454467773, "step": 2910 }, { "epoch": 0.584, "grad_norm": 0.435546875, "learning_rate": 0.0003, "loss": 2.6088932037353514, "step": 2920 }, { "epoch": 0.586, "grad_norm": 0.06494140625, "learning_rate": 0.0003, "loss": 2.6292213439941405, "step": 2930 }, { "epoch": 0.588, "grad_norm": 0.052734375, "learning_rate": 0.0003, "loss": 2.6273422241210938, "step": 2940 }, { "epoch": 0.59, "grad_norm": 0.09716796875, "learning_rate": 0.0003, "loss": 2.622287368774414, "step": 2950 }, { "epoch": 0.592, "grad_norm": 0.0498046875, "learning_rate": 0.0003, "loss": 2.5906503677368162, "step": 2960 }, { "epoch": 0.594, "grad_norm": 0.057373046875, "learning_rate": 0.0003, "loss": 2.631303596496582, "step": 2970 }, { "epoch": 0.596, "grad_norm": 0.054443359375, "learning_rate": 0.0003, "loss": 2.6114727020263673, "step": 2980 }, { "epoch": 0.598, "grad_norm": 0.0908203125, "learning_rate": 0.0003, "loss": 2.603567886352539, "step": 2990 }, { "epoch": 0.6, "grad_norm": 0.0556640625, "learning_rate": 0.0003, "loss": 2.585314178466797, "step": 3000 }, { "epoch": 0.6, "eval_loss": 3.0278046131134033, "eval_runtime": 4.4444, "eval_samples_per_second": 67.051, "eval_steps_per_second": 3.825, "step": 3000 }, { "epoch": 0.602, "grad_norm": 0.055908203125, "learning_rate": 0.0003, "loss": 2.6127801895141602, "step": 3010 }, { "epoch": 0.604, "grad_norm": 0.1455078125, "learning_rate": 0.0003, "loss": 2.5975704193115234, "step": 3020 }, { "epoch": 0.606, "grad_norm": 15.0625, "learning_rate": 0.0003, "loss": 2.5873924255371095, "step": 3030 }, { "epoch": 0.608, "grad_norm": 0.0478515625, "learning_rate": 0.0003, "loss": 2.5901187896728515, "step": 3040 }, { "epoch": 0.61, "grad_norm": 0.166015625, "learning_rate": 0.0003, "loss": 2.585931968688965, "step": 3050 }, { "epoch": 0.612, "grad_norm": 0.053466796875, "learning_rate": 0.0003, "loss": 2.6187633514404296, "step": 3060 }, { "epoch": 0.614, "grad_norm": 0.0556640625, "learning_rate": 0.0003, "loss": 2.6473546981811524, "step": 3070 }, { "epoch": 0.616, "grad_norm": 0.055908203125, "learning_rate": 0.0003, "loss": 2.606519317626953, "step": 3080 }, { "epoch": 0.618, "grad_norm": 12.0, "learning_rate": 0.0003, "loss": 2.6005083084106446, "step": 3090 }, { "epoch": 0.62, "grad_norm": 0.0615234375, "learning_rate": 0.0003, "loss": 2.6309852600097656, "step": 3100 }, { "epoch": 0.62, "eval_loss": 3.0271658897399902, "eval_runtime": 4.4454, "eval_samples_per_second": 67.036, "eval_steps_per_second": 3.824, "step": 3100 }, { "epoch": 0.622, "grad_norm": 0.107421875, "learning_rate": 0.0003, "loss": 2.6178503036499023, "step": 3110 }, { "epoch": 0.624, "grad_norm": 0.06640625, "learning_rate": 0.0003, "loss": 2.614837646484375, "step": 3120 }, { "epoch": 0.626, "grad_norm": 1.203125, "learning_rate": 0.0003, "loss": 2.62316837310791, "step": 3130 }, { "epoch": 0.628, "grad_norm": 0.0517578125, "learning_rate": 0.0003, "loss": 2.59710693359375, "step": 3140 }, { "epoch": 0.63, "grad_norm": 0.058349609375, "learning_rate": 0.0003, "loss": 2.6030540466308594, "step": 3150 }, { "epoch": 0.632, "grad_norm": 0.05029296875, "learning_rate": 0.0003, "loss": 2.5992559432983398, "step": 3160 }, { "epoch": 0.634, "grad_norm": 0.052490234375, "learning_rate": 0.0003, "loss": 2.6360668182373046, "step": 3170 }, { "epoch": 0.636, "grad_norm": 0.11279296875, "learning_rate": 0.0003, "loss": 2.6165666580200195, "step": 3180 }, { "epoch": 0.638, "grad_norm": 0.052978515625, "learning_rate": 0.0003, "loss": 2.636544036865234, "step": 3190 }, { "epoch": 0.64, "grad_norm": 0.0947265625, "learning_rate": 0.0003, "loss": 2.6081783294677736, "step": 3200 }, { "epoch": 0.64, "eval_loss": 3.0295300483703613, "eval_runtime": 4.4243, "eval_samples_per_second": 67.356, "eval_steps_per_second": 3.842, "step": 3200 }, { "epoch": 0.642, "grad_norm": 0.07470703125, "learning_rate": 0.0003, "loss": 2.6136301040649412, "step": 3210 }, { "epoch": 0.644, "grad_norm": 5.59375, "learning_rate": 0.0003, "loss": 2.611122703552246, "step": 3220 }, { "epoch": 0.646, "grad_norm": 0.0888671875, "learning_rate": 0.0003, "loss": 2.611610984802246, "step": 3230 }, { "epoch": 0.648, "grad_norm": 6.4375, "learning_rate": 0.0003, "loss": 2.6010536193847655, "step": 3240 }, { "epoch": 0.65, "grad_norm": 0.051513671875, "learning_rate": 0.0003, "loss": 2.623811149597168, "step": 3250 }, { "epoch": 0.652, "grad_norm": 0.06005859375, "learning_rate": 0.0003, "loss": 2.5976247787475586, "step": 3260 }, { "epoch": 0.654, "grad_norm": 0.05859375, "learning_rate": 0.0003, "loss": 2.593853569030762, "step": 3270 }, { "epoch": 0.656, "grad_norm": 0.060546875, "learning_rate": 0.0003, "loss": 2.645317268371582, "step": 3280 }, { "epoch": 0.658, "grad_norm": 0.0595703125, "learning_rate": 0.0003, "loss": 2.592297172546387, "step": 3290 }, { "epoch": 0.66, "grad_norm": 2.21875, "learning_rate": 0.0003, "loss": 2.60241641998291, "step": 3300 }, { "epoch": 0.66, "eval_loss": 3.0250847339630127, "eval_runtime": 4.4783, "eval_samples_per_second": 66.543, "eval_steps_per_second": 3.796, "step": 3300 }, { "epoch": 0.662, "grad_norm": 0.052490234375, "learning_rate": 0.0003, "loss": 2.600591278076172, "step": 3310 }, { "epoch": 0.664, "grad_norm": 0.052978515625, "learning_rate": 0.0003, "loss": 2.6144927978515624, "step": 3320 }, { "epoch": 0.666, "grad_norm": 0.057861328125, "learning_rate": 0.0003, "loss": 2.593229866027832, "step": 3330 }, { "epoch": 0.668, "grad_norm": 0.0546875, "learning_rate": 0.0003, "loss": 2.6041738510131838, "step": 3340 }, { "epoch": 0.67, "grad_norm": 0.052978515625, "learning_rate": 0.0003, "loss": 2.607752227783203, "step": 3350 }, { "epoch": 0.672, "grad_norm": 1.671875, "learning_rate": 0.0003, "loss": 2.6296701431274414, "step": 3360 }, { "epoch": 0.674, "grad_norm": 0.55859375, "learning_rate": 0.0003, "loss": 2.5772432327270507, "step": 3370 }, { "epoch": 0.676, "grad_norm": 0.052734375, "learning_rate": 0.0003, "loss": 2.6260414123535156, "step": 3380 }, { "epoch": 0.678, "grad_norm": 0.062255859375, "learning_rate": 0.0003, "loss": 2.5910011291503907, "step": 3390 }, { "epoch": 0.68, "grad_norm": 0.0546875, "learning_rate": 0.0003, "loss": 2.5773406982421876, "step": 3400 }, { "epoch": 0.68, "eval_loss": 3.0262410640716553, "eval_runtime": 4.4195, "eval_samples_per_second": 67.428, "eval_steps_per_second": 3.847, "step": 3400 }, { "epoch": 0.682, "grad_norm": 0.056640625, "learning_rate": 0.0003, "loss": 2.602094268798828, "step": 3410 }, { "epoch": 0.684, "grad_norm": 0.04931640625, "learning_rate": 0.0003, "loss": 2.6283613204956056, "step": 3420 }, { "epoch": 0.686, "grad_norm": 0.26171875, "learning_rate": 0.0003, "loss": 2.58358211517334, "step": 3430 }, { "epoch": 0.688, "grad_norm": 0.052978515625, "learning_rate": 0.0003, "loss": 2.5964986801147463, "step": 3440 }, { "epoch": 0.69, "grad_norm": 0.05322265625, "learning_rate": 0.0003, "loss": 2.5851970672607423, "step": 3450 }, { "epoch": 0.692, "grad_norm": 0.051025390625, "learning_rate": 0.0003, "loss": 2.6003726959228515, "step": 3460 }, { "epoch": 0.694, "grad_norm": 0.050048828125, "learning_rate": 0.0003, "loss": 2.6186376571655274, "step": 3470 }, { "epoch": 0.696, "grad_norm": 0.052001953125, "learning_rate": 0.0003, "loss": 2.624268341064453, "step": 3480 }, { "epoch": 0.698, "grad_norm": 0.05029296875, "learning_rate": 0.0003, "loss": 2.5755191802978517, "step": 3490 }, { "epoch": 0.7, "grad_norm": 0.244140625, "learning_rate": 0.0003, "loss": 2.593659782409668, "step": 3500 }, { "epoch": 0.7, "eval_loss": 3.0274429321289062, "eval_runtime": 4.4166, "eval_samples_per_second": 67.472, "eval_steps_per_second": 3.849, "step": 3500 }, { "epoch": 0.702, "grad_norm": 0.053466796875, "learning_rate": 0.0003, "loss": 2.599693489074707, "step": 3510 }, { "epoch": 0.704, "grad_norm": 0.07275390625, "learning_rate": 0.0003, "loss": 2.599070167541504, "step": 3520 }, { "epoch": 0.706, "grad_norm": 0.055419921875, "learning_rate": 0.0003, "loss": 2.6012365341186525, "step": 3530 }, { "epoch": 0.708, "grad_norm": 0.05224609375, "learning_rate": 0.0003, "loss": 2.576295852661133, "step": 3540 }, { "epoch": 0.71, "grad_norm": 0.0517578125, "learning_rate": 0.0003, "loss": 2.6024765014648437, "step": 3550 }, { "epoch": 0.712, "grad_norm": 0.0693359375, "learning_rate": 0.0003, "loss": 2.5685857772827148, "step": 3560 }, { "epoch": 0.714, "grad_norm": 0.1220703125, "learning_rate": 0.0003, "loss": 2.584480094909668, "step": 3570 }, { "epoch": 0.716, "grad_norm": 0.06396484375, "learning_rate": 0.0003, "loss": 2.6187564849853517, "step": 3580 }, { "epoch": 0.718, "grad_norm": 0.05126953125, "learning_rate": 0.0003, "loss": 2.608148384094238, "step": 3590 }, { "epoch": 0.72, "grad_norm": 0.056396484375, "learning_rate": 0.0003, "loss": 2.596156883239746, "step": 3600 }, { "epoch": 0.72, "eval_loss": 3.0285751819610596, "eval_runtime": 4.4537, "eval_samples_per_second": 66.91, "eval_steps_per_second": 3.817, "step": 3600 }, { "epoch": 0.722, "grad_norm": 2.265625, "learning_rate": 0.0003, "loss": 2.6053913116455076, "step": 3610 }, { "epoch": 0.724, "grad_norm": 0.1259765625, "learning_rate": 0.0003, "loss": 2.5906614303588866, "step": 3620 }, { "epoch": 0.726, "grad_norm": 0.058349609375, "learning_rate": 0.0003, "loss": 2.6229223251342773, "step": 3630 }, { "epoch": 0.728, "grad_norm": 0.054443359375, "learning_rate": 0.0003, "loss": 2.6100414276123045, "step": 3640 }, { "epoch": 0.73, "grad_norm": 0.05078125, "learning_rate": 0.0003, "loss": 2.5861778259277344, "step": 3650 }, { "epoch": 0.732, "grad_norm": 0.06884765625, "learning_rate": 0.0003, "loss": 2.6088991165161133, "step": 3660 }, { "epoch": 0.734, "grad_norm": 0.0546875, "learning_rate": 0.0003, "loss": 2.5957805633544924, "step": 3670 }, { "epoch": 0.736, "grad_norm": 0.08447265625, "learning_rate": 0.0003, "loss": 2.5968517303466796, "step": 3680 }, { "epoch": 0.738, "grad_norm": 0.06396484375, "learning_rate": 0.0003, "loss": 2.590867614746094, "step": 3690 }, { "epoch": 0.74, "grad_norm": 0.057373046875, "learning_rate": 0.0003, "loss": 2.6020263671875, "step": 3700 }, { "epoch": 0.74, "eval_loss": 3.033440113067627, "eval_runtime": 4.4438, "eval_samples_per_second": 67.059, "eval_steps_per_second": 3.826, "step": 3700 }, { "epoch": 0.742, "grad_norm": 1.8359375, "learning_rate": 0.0003, "loss": 2.624915885925293, "step": 3710 }, { "epoch": 0.744, "grad_norm": 0.05322265625, "learning_rate": 0.0003, "loss": 2.6158367156982423, "step": 3720 }, { "epoch": 0.746, "grad_norm": 0.052978515625, "learning_rate": 0.0003, "loss": 2.5968292236328123, "step": 3730 }, { "epoch": 0.748, "grad_norm": 0.0849609375, "learning_rate": 0.0003, "loss": 2.61802978515625, "step": 3740 }, { "epoch": 0.75, "grad_norm": 0.05517578125, "learning_rate": 0.0003, "loss": 2.5647909164428713, "step": 3750 }, { "epoch": 0.752, "grad_norm": 0.060791015625, "learning_rate": 0.0003, "loss": 2.601895332336426, "step": 3760 }, { "epoch": 0.754, "grad_norm": 0.0556640625, "learning_rate": 0.0003, "loss": 2.605121612548828, "step": 3770 }, { "epoch": 0.756, "grad_norm": 0.09716796875, "learning_rate": 0.0003, "loss": 2.6213621139526366, "step": 3780 }, { "epoch": 0.758, "grad_norm": 0.05078125, "learning_rate": 0.0003, "loss": 2.5848875045776367, "step": 3790 }, { "epoch": 0.76, "grad_norm": 0.05859375, "learning_rate": 0.0003, "loss": 2.585398483276367, "step": 3800 }, { "epoch": 0.76, "eval_loss": 3.0310301780700684, "eval_runtime": 4.4352, "eval_samples_per_second": 67.19, "eval_steps_per_second": 3.833, "step": 3800 }, { "epoch": 0.762, "grad_norm": 0.0830078125, "learning_rate": 0.0003, "loss": 2.5891979217529295, "step": 3810 }, { "epoch": 0.764, "grad_norm": 0.048828125, "learning_rate": 0.0003, "loss": 2.587088203430176, "step": 3820 }, { "epoch": 0.766, "grad_norm": 0.056884765625, "learning_rate": 0.0003, "loss": 2.6202329635620116, "step": 3830 }, { "epoch": 0.768, "grad_norm": 0.058349609375, "learning_rate": 0.0003, "loss": 2.588342475891113, "step": 3840 }, { "epoch": 0.77, "grad_norm": 0.051513671875, "learning_rate": 0.0003, "loss": 2.570342445373535, "step": 3850 }, { "epoch": 0.772, "grad_norm": 0.054443359375, "learning_rate": 0.0003, "loss": 2.5928205490112304, "step": 3860 }, { "epoch": 0.774, "grad_norm": 1.1484375, "learning_rate": 0.0003, "loss": 2.562236785888672, "step": 3870 }, { "epoch": 0.776, "grad_norm": 0.05322265625, "learning_rate": 0.0003, "loss": 2.5821876525878906, "step": 3880 }, { "epoch": 0.778, "grad_norm": 0.05029296875, "learning_rate": 0.0003, "loss": 2.583372688293457, "step": 3890 }, { "epoch": 0.78, "grad_norm": 0.197265625, "learning_rate": 0.0003, "loss": 2.5738046646118162, "step": 3900 }, { "epoch": 0.78, "eval_loss": 3.029505491256714, "eval_runtime": 4.3771, "eval_samples_per_second": 68.082, "eval_steps_per_second": 3.884, "step": 3900 }, { "epoch": 0.782, "grad_norm": 0.173828125, "learning_rate": 0.0003, "loss": 2.576494598388672, "step": 3910 }, { "epoch": 0.784, "grad_norm": 0.380859375, "learning_rate": 0.0003, "loss": 2.5919593811035155, "step": 3920 }, { "epoch": 0.786, "grad_norm": 0.048095703125, "learning_rate": 0.0003, "loss": 2.621496391296387, "step": 3930 }, { "epoch": 0.788, "grad_norm": 0.052490234375, "learning_rate": 0.0003, "loss": 2.584731101989746, "step": 3940 }, { "epoch": 0.79, "grad_norm": 0.0498046875, "learning_rate": 0.0003, "loss": 2.568536567687988, "step": 3950 }, { "epoch": 0.792, "grad_norm": 0.0615234375, "learning_rate": 0.0003, "loss": 2.590066909790039, "step": 3960 }, { "epoch": 0.794, "grad_norm": 0.060791015625, "learning_rate": 0.0003, "loss": 2.613643264770508, "step": 3970 }, { "epoch": 0.796, "grad_norm": 0.052734375, "learning_rate": 0.0003, "loss": 2.614491081237793, "step": 3980 }, { "epoch": 0.798, "grad_norm": 0.0517578125, "learning_rate": 0.0003, "loss": 2.591320037841797, "step": 3990 }, { "epoch": 0.8, "grad_norm": 0.04931640625, "learning_rate": 0.0003, "loss": 2.605324554443359, "step": 4000 }, { "epoch": 0.8, "eval_loss": 3.0305187702178955, "eval_runtime": 4.4657, "eval_samples_per_second": 66.73, "eval_steps_per_second": 3.807, "step": 4000 }, { "epoch": 0.802, "grad_norm": 0.054931640625, "learning_rate": 0.0003, "loss": 2.5756288528442384, "step": 4010 }, { "epoch": 0.804, "grad_norm": 0.5546875, "learning_rate": 0.0003, "loss": 2.591953468322754, "step": 4020 }, { "epoch": 0.806, "grad_norm": 0.05029296875, "learning_rate": 0.0003, "loss": 2.5956727981567385, "step": 4030 }, { "epoch": 0.808, "grad_norm": 0.05224609375, "learning_rate": 0.0003, "loss": 2.60211067199707, "step": 4040 }, { "epoch": 0.81, "grad_norm": 0.049072265625, "learning_rate": 0.0003, "loss": 2.5871608734130858, "step": 4050 }, { "epoch": 0.812, "grad_norm": 0.10693359375, "learning_rate": 0.0003, "loss": 2.5698373794555662, "step": 4060 }, { "epoch": 0.814, "grad_norm": 0.05810546875, "learning_rate": 0.0003, "loss": 2.6126802444458006, "step": 4070 }, { "epoch": 0.816, "grad_norm": 0.05029296875, "learning_rate": 0.0003, "loss": 2.5981868743896483, "step": 4080 }, { "epoch": 0.818, "grad_norm": 0.052978515625, "learning_rate": 0.0003, "loss": 2.580386161804199, "step": 4090 }, { "epoch": 0.82, "grad_norm": 0.07080078125, "learning_rate": 0.0003, "loss": 2.5840375900268553, "step": 4100 }, { "epoch": 0.82, "eval_loss": 3.0312201976776123, "eval_runtime": 4.4429, "eval_samples_per_second": 67.074, "eval_steps_per_second": 3.826, "step": 4100 }, { "epoch": 0.822, "grad_norm": 0.052978515625, "learning_rate": 0.0003, "loss": 2.6040040969848635, "step": 4110 }, { "epoch": 0.824, "grad_norm": 0.05224609375, "learning_rate": 0.0003, "loss": 2.5784271240234373, "step": 4120 }, { "epoch": 0.826, "grad_norm": 0.05078125, "learning_rate": 0.0003, "loss": 2.5992313385009767, "step": 4130 }, { "epoch": 0.828, "grad_norm": 0.62109375, "learning_rate": 0.0003, "loss": 2.607274055480957, "step": 4140 }, { "epoch": 0.83, "grad_norm": 0.05126953125, "learning_rate": 0.0003, "loss": 2.5900325775146484, "step": 4150 }, { "epoch": 0.832, "grad_norm": 0.0556640625, "learning_rate": 0.0003, "loss": 2.584280586242676, "step": 4160 }, { "epoch": 0.834, "grad_norm": 0.06103515625, "learning_rate": 0.0003, "loss": 2.578823471069336, "step": 4170 }, { "epoch": 0.836, "grad_norm": 0.05908203125, "learning_rate": 0.0003, "loss": 2.600706672668457, "step": 4180 }, { "epoch": 0.838, "grad_norm": 0.054931640625, "learning_rate": 0.0003, "loss": 2.5908893585205077, "step": 4190 }, { "epoch": 0.84, "grad_norm": 0.08740234375, "learning_rate": 0.0003, "loss": 2.6078845977783205, "step": 4200 }, { "epoch": 0.84, "eval_loss": 3.0311102867126465, "eval_runtime": 4.4714, "eval_samples_per_second": 66.645, "eval_steps_per_second": 3.802, "step": 4200 }, { "epoch": 0.842, "grad_norm": 0.0556640625, "learning_rate": 0.0003, "loss": 2.630947303771973, "step": 4210 }, { "epoch": 0.844, "grad_norm": 0.09423828125, "learning_rate": 0.0003, "loss": 2.623428726196289, "step": 4220 }, { "epoch": 0.846, "grad_norm": 0.111328125, "learning_rate": 0.0003, "loss": 2.5977907180786133, "step": 4230 }, { "epoch": 0.848, "grad_norm": 0.455078125, "learning_rate": 0.0003, "loss": 2.6008005142211914, "step": 4240 }, { "epoch": 0.85, "grad_norm": 1.6015625, "learning_rate": 0.0003, "loss": 2.5678030014038087, "step": 4250 }, { "epoch": 0.852, "grad_norm": 0.052490234375, "learning_rate": 0.0003, "loss": 2.613857650756836, "step": 4260 }, { "epoch": 0.854, "grad_norm": 0.08349609375, "learning_rate": 0.0003, "loss": 2.579903221130371, "step": 4270 }, { "epoch": 0.856, "grad_norm": 0.049560546875, "learning_rate": 0.0003, "loss": 2.579732131958008, "step": 4280 }, { "epoch": 0.858, "grad_norm": 0.181640625, "learning_rate": 0.0003, "loss": 2.5955440521240236, "step": 4290 }, { "epoch": 0.86, "grad_norm": 0.05712890625, "learning_rate": 0.0003, "loss": 2.592930793762207, "step": 4300 }, { "epoch": 0.86, "eval_loss": 3.031736373901367, "eval_runtime": 4.4299, "eval_samples_per_second": 67.27, "eval_steps_per_second": 3.838, "step": 4300 }, { "epoch": 0.862, "grad_norm": 0.05419921875, "learning_rate": 0.0003, "loss": 2.592413902282715, "step": 4310 }, { "epoch": 0.864, "grad_norm": 0.10986328125, "learning_rate": 0.0003, "loss": 2.569998931884766, "step": 4320 }, { "epoch": 0.866, "grad_norm": 0.048583984375, "learning_rate": 0.0003, "loss": 2.5922664642333983, "step": 4330 }, { "epoch": 0.868, "grad_norm": 0.052734375, "learning_rate": 0.0003, "loss": 2.6012556076049806, "step": 4340 }, { "epoch": 0.87, "grad_norm": 0.07177734375, "learning_rate": 0.0003, "loss": 2.6031923294067383, "step": 4350 }, { "epoch": 0.872, "grad_norm": 0.07763671875, "learning_rate": 0.0003, "loss": 2.59698543548584, "step": 4360 }, { "epoch": 0.874, "grad_norm": 0.051513671875, "learning_rate": 0.0003, "loss": 2.6096282958984376, "step": 4370 }, { "epoch": 0.876, "grad_norm": 0.052734375, "learning_rate": 0.0003, "loss": 2.6013412475585938, "step": 4380 }, { "epoch": 0.878, "grad_norm": 0.051025390625, "learning_rate": 0.0003, "loss": 2.570247268676758, "step": 4390 }, { "epoch": 0.88, "grad_norm": 0.19140625, "learning_rate": 0.0003, "loss": 2.6004173278808596, "step": 4400 }, { "epoch": 0.88, "eval_loss": 3.032118320465088, "eval_runtime": 4.4552, "eval_samples_per_second": 66.887, "eval_steps_per_second": 3.816, "step": 4400 }, { "epoch": 0.882, "grad_norm": 0.050048828125, "learning_rate": 0.0003, "loss": 2.60999755859375, "step": 4410 }, { "epoch": 0.884, "grad_norm": 0.1044921875, "learning_rate": 0.0003, "loss": 2.5999217987060548, "step": 4420 }, { "epoch": 0.886, "grad_norm": 0.255859375, "learning_rate": 0.0003, "loss": 2.57828369140625, "step": 4430 }, { "epoch": 0.888, "grad_norm": 0.0556640625, "learning_rate": 0.0003, "loss": 2.5876300811767576, "step": 4440 }, { "epoch": 0.89, "grad_norm": 0.052490234375, "learning_rate": 0.0003, "loss": 2.5927480697631835, "step": 4450 }, { "epoch": 0.892, "grad_norm": 0.076171875, "learning_rate": 0.0003, "loss": 2.6045318603515626, "step": 4460 }, { "epoch": 0.894, "grad_norm": 0.06201171875, "learning_rate": 0.0003, "loss": 2.585988235473633, "step": 4470 }, { "epoch": 0.896, "grad_norm": 0.050048828125, "learning_rate": 0.0003, "loss": 2.613155555725098, "step": 4480 }, { "epoch": 0.898, "grad_norm": 4.125, "learning_rate": 0.0003, "loss": 2.592078971862793, "step": 4490 }, { "epoch": 0.9, "grad_norm": 0.048095703125, "learning_rate": 0.0003, "loss": 2.591631317138672, "step": 4500 }, { "epoch": 0.9, "eval_loss": 3.028334617614746, "eval_runtime": 4.4441, "eval_samples_per_second": 67.055, "eval_steps_per_second": 3.825, "step": 4500 } ], "logging_steps": 10, "max_steps": 5000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.467695316860928e+18, "train_batch_size": 18, "trial_name": null, "trial_params": null }