Download last-checkpoint/trainer_state.json from CodeIsAbstract/HybridTimeScaleModel_conti1: direct link, hf CLI and curl.
- Browser
- Download file 77.5 kB
-
https://huggingface.co/CodeIsAbstract/HybridTimeScaleModel_conti1/resolve/main/last-checkpoint/trainer_state.json
- Command line
-
hf download hf://CodeIsAbstract/HybridTimeScaleModel_conti1/last-checkpoint/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/CodeIsAbstract/HybridTimeScaleModel_conti1/resolve/main/last-checkpoint/trainer_state.json
77.5 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.9, | |
| "eval_steps": 100, | |
| "global_step": 4500, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.002, | |
| "grad_norm": 366.0, | |
| "learning_rate": 1.7999999999999997e-05, | |
| "loss": 3.335772705078125, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.004, | |
| "grad_norm": 76.0, | |
| "learning_rate": 3.8e-05, | |
| "loss": 3.325016403198242, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.006, | |
| "grad_norm": 426.0, | |
| "learning_rate": 5.7999999999999994e-05, | |
| "loss": 3.355701446533203, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.008, | |
| "grad_norm": 194.0, | |
| "learning_rate": 7.8e-05, | |
| "loss": 3.3106155395507812, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 712.0, | |
| "learning_rate": 9.799999999999998e-05, | |
| "loss": 3.270039367675781, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.012, | |
| "grad_norm": 164.0, | |
| "learning_rate": 0.00011799999999999998, | |
| "loss": 3.2886486053466797, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.014, | |
| "grad_norm": 162.0, | |
| "learning_rate": 0.000138, | |
| "loss": 3.2564620971679688, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.016, | |
| "grad_norm": 234.0, | |
| "learning_rate": 0.00015799999999999996, | |
| "loss": 3.267023468017578, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.018, | |
| "grad_norm": 1536.0, | |
| "learning_rate": 0.000178, | |
| "loss": 3.231563949584961, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 39.5, | |
| "learning_rate": 0.000198, | |
| "loss": 3.2340599060058595, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "eval_loss": 3.491870403289795, | |
| "eval_runtime": 4.5004, | |
| "eval_samples_per_second": 66.216, | |
| "eval_steps_per_second": 3.777, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.022, | |
| "grad_norm": 23.0, | |
| "learning_rate": 0.00021799999999999999, | |
| "loss": 3.20191650390625, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.024, | |
| "grad_norm": 32.0, | |
| "learning_rate": 0.00023799999999999998, | |
| "loss": 3.2040287017822267, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.026, | |
| "grad_norm": 136.0, | |
| "learning_rate": 0.000258, | |
| "loss": 3.1589597702026366, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.028, | |
| "grad_norm": 238.0, | |
| "learning_rate": 0.000278, | |
| "loss": 3.150320625305176, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 540.0, | |
| "learning_rate": 0.000298, | |
| "loss": 3.172740364074707, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.032, | |
| "grad_norm": 58.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.149807167053223, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.034, | |
| "grad_norm": 196.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.169495391845703, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.036, | |
| "grad_norm": 444.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.1639734268188477, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.038, | |
| "grad_norm": 378.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.221640777587891, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 2272.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.1916147232055665, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "eval_loss": 3.4648807048797607, | |
| "eval_runtime": 4.3534, | |
| "eval_samples_per_second": 68.452, | |
| "eval_steps_per_second": 3.905, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.042, | |
| "grad_norm": 520.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.1814949035644533, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.044, | |
| "grad_norm": 87.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.1746402740478517, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.046, | |
| "grad_norm": 39.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.172597885131836, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.048, | |
| "grad_norm": 50.5, | |
| "learning_rate": 0.0003, | |
| "loss": 3.1576799392700194, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.05, | |
| "grad_norm": 29.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.1418006896972654, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.052, | |
| "grad_norm": 50.5, | |
| "learning_rate": 0.0003, | |
| "loss": 3.1035797119140627, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.054, | |
| "grad_norm": 568.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.095198059082031, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.056, | |
| "grad_norm": 15.5625, | |
| "learning_rate": 0.0003, | |
| "loss": 3.079079818725586, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.058, | |
| "grad_norm": 17.625, | |
| "learning_rate": 0.0003, | |
| "loss": 3.060195732116699, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "grad_norm": 56.25, | |
| "learning_rate": 0.0003, | |
| "loss": 3.0736625671386717, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.06, | |
| "eval_loss": 3.349555015563965, | |
| "eval_runtime": 4.3918, | |
| "eval_samples_per_second": 67.854, | |
| "eval_steps_per_second": 3.871, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.062, | |
| "grad_norm": 432.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.0508825302124025, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.064, | |
| "grad_norm": 6.28125, | |
| "learning_rate": 0.0003, | |
| "loss": 3.021405792236328, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.066, | |
| "grad_norm": 161.0, | |
| "learning_rate": 0.0003, | |
| "loss": 3.011042022705078, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.068, | |
| "grad_norm": 29.625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.9988969802856444, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.07, | |
| "grad_norm": 24.625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.9939882278442385, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.072, | |
| "grad_norm": 61.0, | |
| "learning_rate": 0.0003, | |
| "loss": 2.979990768432617, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.074, | |
| "grad_norm": 13.6875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.9845876693725586, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.076, | |
| "grad_norm": 280.0, | |
| "learning_rate": 0.0003, | |
| "loss": 2.975000762939453, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.078, | |
| "grad_norm": 21.125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.958791732788086, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 12.8125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.956746482849121, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "eval_loss": 3.2549893856048584, | |
| "eval_runtime": 4.4045, | |
| "eval_samples_per_second": 67.658, | |
| "eval_steps_per_second": 3.86, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.082, | |
| "grad_norm": 314.0, | |
| "learning_rate": 0.0003, | |
| "loss": 2.9515405654907227, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.084, | |
| "grad_norm": 2.125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.910631561279297, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.086, | |
| "grad_norm": 24.75, | |
| "learning_rate": 0.0003, | |
| "loss": 2.8589399337768553, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.088, | |
| "grad_norm": 3.78125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.844576835632324, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.09, | |
| "grad_norm": 1.6171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.7850717544555663, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.092, | |
| "grad_norm": 6.5625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.7605606079101563, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.094, | |
| "grad_norm": 12.5625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.747697639465332, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.096, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.7024419784545897, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.098, | |
| "grad_norm": 0.55078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.727059173583984, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "grad_norm": 1.3046875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.688610076904297, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.1, | |
| "eval_loss": 3.0536108016967773, | |
| "eval_runtime": 4.4183, | |
| "eval_samples_per_second": 67.447, | |
| "eval_steps_per_second": 3.848, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.102, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6653621673583983, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.104, | |
| "grad_norm": 2.53125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6938413619995116, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.106, | |
| "grad_norm": 1.578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6589494705200196, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.108, | |
| "grad_norm": 1.453125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6775186538696287, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.11, | |
| "grad_norm": 0.1806640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.659619140625, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.112, | |
| "grad_norm": 0.212890625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.644103240966797, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.114, | |
| "grad_norm": 0.73046875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.65213565826416, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.116, | |
| "grad_norm": 1.1796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6230279922485353, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.118, | |
| "grad_norm": 0.166015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6443111419677736, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 0.8203125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6569570541381835, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "eval_loss": 3.0349245071411133, | |
| "eval_runtime": 4.4206, | |
| "eval_samples_per_second": 67.412, | |
| "eval_steps_per_second": 3.846, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.122, | |
| "grad_norm": 0.1181640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6595781326293944, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.124, | |
| "grad_norm": 0.232421875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.610936737060547, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.126, | |
| "grad_norm": 0.1435546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6387302398681642, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.128, | |
| "grad_norm": 0.14453125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.62979793548584, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.13, | |
| "grad_norm": 2.34375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.649636650085449, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.132, | |
| "grad_norm": 0.2041015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.622520637512207, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.134, | |
| "grad_norm": 0.97265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.646112823486328, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.136, | |
| "grad_norm": 5.8125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6434356689453127, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.138, | |
| "grad_norm": 0.10693359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.623065376281738, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "grad_norm": 0.90625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6090648651123045, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.14, | |
| "eval_loss": 3.0306036472320557, | |
| "eval_runtime": 4.4176, | |
| "eval_samples_per_second": 67.457, | |
| "eval_steps_per_second": 3.848, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.142, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6384559631347657, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.144, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6472700119018553, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.146, | |
| "grad_norm": 0.07177734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6483619689941404, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.148, | |
| "grad_norm": 0.322265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.626618766784668, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.15, | |
| "grad_norm": 0.099609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6325525283813476, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.152, | |
| "grad_norm": 0.1611328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6193023681640626, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.154, | |
| "grad_norm": 0.072265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.618332862854004, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.156, | |
| "grad_norm": 0.87109375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.610393524169922, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.158, | |
| "grad_norm": 0.09716796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6242008209228516, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 0.072265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.638929748535156, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "eval_loss": 3.0286974906921387, | |
| "eval_runtime": 4.4633, | |
| "eval_samples_per_second": 66.766, | |
| "eval_steps_per_second": 3.809, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.162, | |
| "grad_norm": 0.29296875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.638911247253418, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.164, | |
| "grad_norm": 0.62890625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6282770156860353, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.166, | |
| "grad_norm": 0.0859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.668540382385254, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.168, | |
| "grad_norm": 0.08349609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6025644302368165, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.17, | |
| "grad_norm": 0.251953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.614345932006836, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.172, | |
| "grad_norm": 1.2421875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6097484588623048, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.174, | |
| "grad_norm": 0.10107421875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5976139068603517, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.176, | |
| "grad_norm": 0.0634765625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.609291648864746, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.178, | |
| "grad_norm": 0.060302734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6136356353759767, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "grad_norm": 0.306640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6354192733764648, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.18, | |
| "eval_loss": 3.028738021850586, | |
| "eval_runtime": 4.4125, | |
| "eval_samples_per_second": 67.536, | |
| "eval_steps_per_second": 3.853, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.182, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6325847625732424, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.184, | |
| "grad_norm": 0.4921875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6379472732543947, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.186, | |
| "grad_norm": 0.216796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.647774505615234, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.188, | |
| "grad_norm": 0.083984375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.628580665588379, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.19, | |
| "grad_norm": 0.09033203125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.63638973236084, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.192, | |
| "grad_norm": 0.08056640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.628683853149414, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.194, | |
| "grad_norm": 0.06787109375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.628560256958008, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.196, | |
| "grad_norm": 0.1328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.627498435974121, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.198, | |
| "grad_norm": 0.1796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.613533782958984, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 0.265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.615587615966797, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "eval_loss": 3.0314836502075195, | |
| "eval_runtime": 4.4355, | |
| "eval_samples_per_second": 67.186, | |
| "eval_steps_per_second": 3.833, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.202, | |
| "grad_norm": 0.0859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.621230697631836, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.204, | |
| "grad_norm": 0.056640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6316347122192383, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.206, | |
| "grad_norm": 0.2431640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6155324935913087, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.208, | |
| "grad_norm": 0.06298828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.634638214111328, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.21, | |
| "grad_norm": 0.1064453125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6131080627441405, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.212, | |
| "grad_norm": 0.06689453125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.616171646118164, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.214, | |
| "grad_norm": 0.08984375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.603512191772461, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.216, | |
| "grad_norm": 0.0625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6277271270751954, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.218, | |
| "grad_norm": 0.0673828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.615810775756836, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "grad_norm": 0.060791015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6153131484985352, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.22, | |
| "eval_loss": 3.0302107334136963, | |
| "eval_runtime": 4.4032, | |
| "eval_samples_per_second": 67.678, | |
| "eval_steps_per_second": 3.861, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.222, | |
| "grad_norm": 0.064453125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.623016357421875, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.224, | |
| "grad_norm": 0.0712890625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6170467376708983, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.226, | |
| "grad_norm": 0.59375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.620796775817871, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.228, | |
| "grad_norm": 0.30078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6082935333251953, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.23, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6210090637207033, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.232, | |
| "grad_norm": 0.0634765625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.636818695068359, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.234, | |
| "grad_norm": 0.07080078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5969371795654297, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.236, | |
| "grad_norm": 0.107421875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6085494995117187, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.238, | |
| "grad_norm": 0.1826171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6118932723999024, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 0.0625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6277448654174806, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "eval_loss": 3.0262646675109863, | |
| "eval_runtime": 4.3768, | |
| "eval_samples_per_second": 68.087, | |
| "eval_steps_per_second": 3.884, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.242, | |
| "grad_norm": 0.08837890625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6076292037963866, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.244, | |
| "grad_norm": 0.0869140625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6239038467407227, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.246, | |
| "grad_norm": 0.06201171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.598759651184082, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.248, | |
| "grad_norm": 0.054443359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.623333549499512, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.25, | |
| "grad_norm": 0.056884765625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.595660400390625, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.252, | |
| "grad_norm": 0.07470703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6085866928100585, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.254, | |
| "grad_norm": 0.06201171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6313194274902343, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.256, | |
| "grad_norm": 0.05126953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.624466323852539, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.258, | |
| "grad_norm": 0.0693359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.61032657623291, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "grad_norm": 0.95703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.611441230773926, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.26, | |
| "eval_loss": 3.0270800590515137, | |
| "eval_runtime": 4.4364, | |
| "eval_samples_per_second": 67.171, | |
| "eval_steps_per_second": 3.832, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.262, | |
| "grad_norm": 0.416015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.622879981994629, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.264, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6255945205688476, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.266, | |
| "grad_norm": 0.419921875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.619590950012207, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.268, | |
| "grad_norm": 0.057861328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.618213081359863, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.27, | |
| "grad_norm": 0.054443359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6290687561035155, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.272, | |
| "grad_norm": 0.2080078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5912906646728517, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.274, | |
| "grad_norm": 0.06787109375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.608586311340332, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.276, | |
| "grad_norm": 0.2734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6140621185302733, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.278, | |
| "grad_norm": 0.060546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6242074966430664, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 0.056640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6025035858154295, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "eval_loss": 3.0289111137390137, | |
| "eval_runtime": 4.3992, | |
| "eval_samples_per_second": 67.739, | |
| "eval_steps_per_second": 3.864, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.282, | |
| "grad_norm": 0.09228515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6210390090942384, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.284, | |
| "grad_norm": 0.087890625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6299697875976564, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.286, | |
| "grad_norm": 0.060546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.60406494140625, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.288, | |
| "grad_norm": 0.060546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.599949264526367, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.29, | |
| "grad_norm": 0.212890625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5918996810913084, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.292, | |
| "grad_norm": 0.51953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5961977005004884, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.294, | |
| "grad_norm": 0.0634765625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5982738494873048, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.296, | |
| "grad_norm": 0.0771484375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6246980667114257, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.298, | |
| "grad_norm": 0.515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.583383560180664, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "grad_norm": 0.068359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6035650253295897, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.3, | |
| "eval_loss": 3.0258114337921143, | |
| "eval_runtime": 4.3825, | |
| "eval_samples_per_second": 67.998, | |
| "eval_steps_per_second": 3.879, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.302, | |
| "grad_norm": 0.058349609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.601143646240234, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 0.304, | |
| "grad_norm": 0.177734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6228967666625977, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 0.306, | |
| "grad_norm": 0.12158203125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.611318588256836, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 0.308, | |
| "grad_norm": 0.06201171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.61364860534668, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 0.31, | |
| "grad_norm": 0.05419921875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6139429092407225, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.312, | |
| "grad_norm": 0.08837890625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6160503387451173, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 0.314, | |
| "grad_norm": 0.0673828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.615163230895996, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 0.316, | |
| "grad_norm": 0.055419921875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.592479705810547, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 0.318, | |
| "grad_norm": 0.41796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.587255668640137, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 0.11181640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6103662490844726, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "eval_loss": 3.0303030014038086, | |
| "eval_runtime": 4.4554, | |
| "eval_samples_per_second": 66.885, | |
| "eval_steps_per_second": 3.816, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.322, | |
| "grad_norm": 0.056884765625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.602743911743164, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 0.324, | |
| "grad_norm": 0.08642578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.604319953918457, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 0.326, | |
| "grad_norm": 0.5859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.602446174621582, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 0.328, | |
| "grad_norm": 0.056396484375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6054025650024415, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 0.33, | |
| "grad_norm": 0.0791015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.597785758972168, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 0.332, | |
| "grad_norm": 0.1259765625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5736499786376954, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 0.334, | |
| "grad_norm": 0.07470703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5932741165161133, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 0.336, | |
| "grad_norm": 0.058837890625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6116256713867188, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 0.338, | |
| "grad_norm": 0.057861328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.625630187988281, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "grad_norm": 0.06640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.596027374267578, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.34, | |
| "eval_loss": 3.028986692428589, | |
| "eval_runtime": 4.4483, | |
| "eval_samples_per_second": 66.992, | |
| "eval_steps_per_second": 3.822, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 0.342, | |
| "grad_norm": 0.25, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6015995025634764, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 0.344, | |
| "grad_norm": 0.057373046875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.598787307739258, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 0.346, | |
| "grad_norm": 0.08544921875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6199289321899415, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 0.348, | |
| "grad_norm": 0.060302734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.602091598510742, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 0.35, | |
| "grad_norm": 4.875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5984159469604493, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.352, | |
| "grad_norm": 0.05224609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6147043228149416, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 0.354, | |
| "grad_norm": 0.1982421875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6081768035888673, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 0.356, | |
| "grad_norm": 0.1328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6030120849609375, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 0.358, | |
| "grad_norm": 0.08642578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6104217529296876, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 0.051025390625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5706939697265625, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "eval_loss": 3.0339813232421875, | |
| "eval_runtime": 4.452, | |
| "eval_samples_per_second": 66.937, | |
| "eval_steps_per_second": 3.819, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 0.362, | |
| "grad_norm": 0.1376953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.576882743835449, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 0.364, | |
| "grad_norm": 0.1162109375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.601199913024902, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 0.366, | |
| "grad_norm": 0.062255859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.570973777770996, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 0.368, | |
| "grad_norm": 0.05859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.618685722351074, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 0.37, | |
| "grad_norm": 0.05859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.613678550720215, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 0.372, | |
| "grad_norm": 0.06640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.595960235595703, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 0.374, | |
| "grad_norm": 0.0595703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6117223739624023, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 0.376, | |
| "grad_norm": 0.09423828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5977685928344725, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 0.378, | |
| "grad_norm": 0.060791015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.619519805908203, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "grad_norm": 0.12060546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.606584930419922, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.38, | |
| "eval_loss": 3.0274596214294434, | |
| "eval_runtime": 4.4258, | |
| "eval_samples_per_second": 67.332, | |
| "eval_steps_per_second": 3.841, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 0.382, | |
| "grad_norm": 0.052734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.598057174682617, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 0.384, | |
| "grad_norm": 0.09228515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5836353302001953, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 0.386, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5969900131225585, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 0.388, | |
| "grad_norm": 0.06982421875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.610474395751953, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 0.39, | |
| "grad_norm": 0.16015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.589932441711426, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 0.392, | |
| "grad_norm": 0.05908203125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.616892433166504, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 0.394, | |
| "grad_norm": 0.054931640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5918600082397463, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 0.396, | |
| "grad_norm": 0.1064453125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6085411071777345, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 0.398, | |
| "grad_norm": 0.0576171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.598824691772461, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 0.07861328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5938999176025392, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "eval_loss": 3.030641794204712, | |
| "eval_runtime": 4.4468, | |
| "eval_samples_per_second": 67.014, | |
| "eval_steps_per_second": 3.823, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.402, | |
| "grad_norm": 0.059326171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.608153533935547, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 0.404, | |
| "grad_norm": 0.20703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6085268020629884, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 0.406, | |
| "grad_norm": 0.9296875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.605429267883301, | |
| "step": 2030 | |
| }, | |
| { | |
| "epoch": 0.408, | |
| "grad_norm": 0.08056640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6161428451538087, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 0.41, | |
| "grad_norm": 0.0576171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.587337112426758, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 0.412, | |
| "grad_norm": 1.5546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.613199996948242, | |
| "step": 2060 | |
| }, | |
| { | |
| "epoch": 0.414, | |
| "grad_norm": 0.4375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.595570945739746, | |
| "step": 2070 | |
| }, | |
| { | |
| "epoch": 0.416, | |
| "grad_norm": 0.059326171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.614238166809082, | |
| "step": 2080 | |
| }, | |
| { | |
| "epoch": 0.418, | |
| "grad_norm": 0.050537109375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5990161895751953, | |
| "step": 2090 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "grad_norm": 0.05126953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6036991119384765, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 0.42, | |
| "eval_loss": 3.0276641845703125, | |
| "eval_runtime": 4.4443, | |
| "eval_samples_per_second": 67.052, | |
| "eval_steps_per_second": 3.825, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 0.422, | |
| "grad_norm": 0.05126953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5789426803588866, | |
| "step": 2110 | |
| }, | |
| { | |
| "epoch": 0.424, | |
| "grad_norm": 0.083984375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.592574119567871, | |
| "step": 2120 | |
| }, | |
| { | |
| "epoch": 0.426, | |
| "grad_norm": 0.049072265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.592014122009277, | |
| "step": 2130 | |
| }, | |
| { | |
| "epoch": 0.428, | |
| "grad_norm": 0.0859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5774700164794924, | |
| "step": 2140 | |
| }, | |
| { | |
| "epoch": 0.43, | |
| "grad_norm": 0.05615234375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.613265037536621, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 0.432, | |
| "grad_norm": 0.068359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5970441818237306, | |
| "step": 2160 | |
| }, | |
| { | |
| "epoch": 0.434, | |
| "grad_norm": 0.08447265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6015340805053713, | |
| "step": 2170 | |
| }, | |
| { | |
| "epoch": 0.436, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.58035945892334, | |
| "step": 2180 | |
| }, | |
| { | |
| "epoch": 0.438, | |
| "grad_norm": 0.06640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.609104537963867, | |
| "step": 2190 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 0.057861328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5889204025268553, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "eval_loss": 3.0296566486358643, | |
| "eval_runtime": 4.4076, | |
| "eval_samples_per_second": 67.61, | |
| "eval_steps_per_second": 3.857, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 0.442, | |
| "grad_norm": 0.054931640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.582586097717285, | |
| "step": 2210 | |
| }, | |
| { | |
| "epoch": 0.444, | |
| "grad_norm": 0.06787109375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.606948471069336, | |
| "step": 2220 | |
| }, | |
| { | |
| "epoch": 0.446, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5844865798950196, | |
| "step": 2230 | |
| }, | |
| { | |
| "epoch": 0.448, | |
| "grad_norm": 0.1025390625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5672168731689453, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 0.45, | |
| "grad_norm": 0.05810546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.588663673400879, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 0.452, | |
| "grad_norm": 0.05224609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.594828987121582, | |
| "step": 2260 | |
| }, | |
| { | |
| "epoch": 0.454, | |
| "grad_norm": 0.060546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6015480041503904, | |
| "step": 2270 | |
| }, | |
| { | |
| "epoch": 0.456, | |
| "grad_norm": 0.0576171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6068796157836913, | |
| "step": 2280 | |
| }, | |
| { | |
| "epoch": 0.458, | |
| "grad_norm": 0.5859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.59091854095459, | |
| "step": 2290 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "grad_norm": 0.1142578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5947988510131834, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 0.46, | |
| "eval_loss": 3.028251886367798, | |
| "eval_runtime": 4.4313, | |
| "eval_samples_per_second": 67.249, | |
| "eval_steps_per_second": 3.836, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 0.462, | |
| "grad_norm": 0.0673828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.604340744018555, | |
| "step": 2310 | |
| }, | |
| { | |
| "epoch": 0.464, | |
| "grad_norm": 0.08203125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.610575866699219, | |
| "step": 2320 | |
| }, | |
| { | |
| "epoch": 0.466, | |
| "grad_norm": 0.26953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5987600326538085, | |
| "step": 2330 | |
| }, | |
| { | |
| "epoch": 0.468, | |
| "grad_norm": 0.1572265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5745519638061523, | |
| "step": 2340 | |
| }, | |
| { | |
| "epoch": 0.47, | |
| "grad_norm": 0.0751953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5737417221069334, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 0.472, | |
| "grad_norm": 0.061279296875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.586330795288086, | |
| "step": 2360 | |
| }, | |
| { | |
| "epoch": 0.474, | |
| "grad_norm": 0.04931640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6139583587646484, | |
| "step": 2370 | |
| }, | |
| { | |
| "epoch": 0.476, | |
| "grad_norm": 0.05908203125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.55531005859375, | |
| "step": 2380 | |
| }, | |
| { | |
| "epoch": 0.478, | |
| "grad_norm": 0.060302734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.601852226257324, | |
| "step": 2390 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 0.05712890625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6031288146972655, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "eval_loss": 3.02764892578125, | |
| "eval_runtime": 4.4578, | |
| "eval_samples_per_second": 66.849, | |
| "eval_steps_per_second": 3.814, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 0.482, | |
| "grad_norm": 0.053466796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5988203048706056, | |
| "step": 2410 | |
| }, | |
| { | |
| "epoch": 0.484, | |
| "grad_norm": 0.05517578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5995391845703124, | |
| "step": 2420 | |
| }, | |
| { | |
| "epoch": 0.486, | |
| "grad_norm": 0.054443359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5926639556884767, | |
| "step": 2430 | |
| }, | |
| { | |
| "epoch": 0.488, | |
| "grad_norm": 0.050537109375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.615771484375, | |
| "step": 2440 | |
| }, | |
| { | |
| "epoch": 0.49, | |
| "grad_norm": 0.216796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5967260360717774, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 0.492, | |
| "grad_norm": 0.1171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6070770263671874, | |
| "step": 2460 | |
| }, | |
| { | |
| "epoch": 0.494, | |
| "grad_norm": 0.04931640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.632620620727539, | |
| "step": 2470 | |
| }, | |
| { | |
| "epoch": 0.496, | |
| "grad_norm": 0.08056640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6182647705078126, | |
| "step": 2480 | |
| }, | |
| { | |
| "epoch": 0.498, | |
| "grad_norm": 0.0537109375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6368099212646485, | |
| "step": 2490 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.607630729675293, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "eval_loss": 3.0262646675109863, | |
| "eval_runtime": 4.4503, | |
| "eval_samples_per_second": 66.962, | |
| "eval_steps_per_second": 3.82, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.502, | |
| "grad_norm": 0.048095703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.600408363342285, | |
| "step": 2510 | |
| }, | |
| { | |
| "epoch": 0.504, | |
| "grad_norm": 0.052001953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6103189468383787, | |
| "step": 2520 | |
| }, | |
| { | |
| "epoch": 0.506, | |
| "grad_norm": 0.05712890625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5979167938232424, | |
| "step": 2530 | |
| }, | |
| { | |
| "epoch": 0.508, | |
| "grad_norm": 0.049560546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5972728729248047, | |
| "step": 2540 | |
| }, | |
| { | |
| "epoch": 0.51, | |
| "grad_norm": 0.050048828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.608352851867676, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 0.512, | |
| "grad_norm": 0.07275390625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.600900650024414, | |
| "step": 2560 | |
| }, | |
| { | |
| "epoch": 0.514, | |
| "grad_norm": 0.052734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.638876533508301, | |
| "step": 2570 | |
| }, | |
| { | |
| "epoch": 0.516, | |
| "grad_norm": 0.05126953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.610831069946289, | |
| "step": 2580 | |
| }, | |
| { | |
| "epoch": 0.518, | |
| "grad_norm": 0.051513671875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6283756256103517, | |
| "step": 2590 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 0.0791015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6440673828125, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "eval_loss": 3.0254361629486084, | |
| "eval_runtime": 4.3572, | |
| "eval_samples_per_second": 68.392, | |
| "eval_steps_per_second": 3.902, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 0.522, | |
| "grad_norm": 0.05029296875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.625893211364746, | |
| "step": 2610 | |
| }, | |
| { | |
| "epoch": 0.524, | |
| "grad_norm": 0.061767578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6046930313110352, | |
| "step": 2620 | |
| }, | |
| { | |
| "epoch": 0.526, | |
| "grad_norm": 0.055419921875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.623915100097656, | |
| "step": 2630 | |
| }, | |
| { | |
| "epoch": 0.528, | |
| "grad_norm": 0.058349609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6163360595703127, | |
| "step": 2640 | |
| }, | |
| { | |
| "epoch": 0.53, | |
| "grad_norm": 0.04736328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5871484756469725, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 0.532, | |
| "grad_norm": 0.059326171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6428932189941405, | |
| "step": 2660 | |
| }, | |
| { | |
| "epoch": 0.534, | |
| "grad_norm": 0.0498046875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.608722686767578, | |
| "step": 2670 | |
| }, | |
| { | |
| "epoch": 0.536, | |
| "grad_norm": 0.224609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6207298278808593, | |
| "step": 2680 | |
| }, | |
| { | |
| "epoch": 0.538, | |
| "grad_norm": 0.056884765625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.598964309692383, | |
| "step": 2690 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "grad_norm": 0.185546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6367502212524414, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 0.54, | |
| "eval_loss": 3.0251870155334473, | |
| "eval_runtime": 4.446, | |
| "eval_samples_per_second": 67.027, | |
| "eval_steps_per_second": 3.824, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 0.542, | |
| "grad_norm": 0.0732421875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.625163269042969, | |
| "step": 2710 | |
| }, | |
| { | |
| "epoch": 0.544, | |
| "grad_norm": 0.054931640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.641737365722656, | |
| "step": 2720 | |
| }, | |
| { | |
| "epoch": 0.546, | |
| "grad_norm": 0.1845703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6120086669921876, | |
| "step": 2730 | |
| }, | |
| { | |
| "epoch": 0.548, | |
| "grad_norm": 0.049560546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5945173263549806, | |
| "step": 2740 | |
| }, | |
| { | |
| "epoch": 0.55, | |
| "grad_norm": 0.060302734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.635161590576172, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 0.552, | |
| "grad_norm": 1.8046875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6317985534667967, | |
| "step": 2760 | |
| }, | |
| { | |
| "epoch": 0.554, | |
| "grad_norm": 0.0517578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6268796920776367, | |
| "step": 2770 | |
| }, | |
| { | |
| "epoch": 0.556, | |
| "grad_norm": 2.015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.639748382568359, | |
| "step": 2780 | |
| }, | |
| { | |
| "epoch": 0.558, | |
| "grad_norm": 0.061767578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6535463333129883, | |
| "step": 2790 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 0.06396484375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.609045219421387, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "eval_loss": 3.024867534637451, | |
| "eval_runtime": 4.4522, | |
| "eval_samples_per_second": 66.933, | |
| "eval_steps_per_second": 3.818, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 0.562, | |
| "grad_norm": 0.064453125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6145769119262696, | |
| "step": 2810 | |
| }, | |
| { | |
| "epoch": 0.564, | |
| "grad_norm": 0.052978515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.603018379211426, | |
| "step": 2820 | |
| }, | |
| { | |
| "epoch": 0.566, | |
| "grad_norm": 0.05615234375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6036045074462892, | |
| "step": 2830 | |
| }, | |
| { | |
| "epoch": 0.568, | |
| "grad_norm": 0.049560546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.610326385498047, | |
| "step": 2840 | |
| }, | |
| { | |
| "epoch": 0.57, | |
| "grad_norm": 0.060546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5892526626586916, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 0.572, | |
| "grad_norm": 0.06103515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6054714202880858, | |
| "step": 2860 | |
| }, | |
| { | |
| "epoch": 0.574, | |
| "grad_norm": 0.05810546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.622623062133789, | |
| "step": 2870 | |
| }, | |
| { | |
| "epoch": 0.576, | |
| "grad_norm": 0.384765625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6183904647827148, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 0.578, | |
| "grad_norm": 4.875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5992977142333986, | |
| "step": 2890 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "grad_norm": 0.154296875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6220735549926757, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 0.58, | |
| "eval_loss": 3.024597644805908, | |
| "eval_runtime": 4.4485, | |
| "eval_samples_per_second": 66.989, | |
| "eval_steps_per_second": 3.822, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 0.582, | |
| "grad_norm": 0.046875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6097631454467773, | |
| "step": 2910 | |
| }, | |
| { | |
| "epoch": 0.584, | |
| "grad_norm": 0.435546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6088932037353514, | |
| "step": 2920 | |
| }, | |
| { | |
| "epoch": 0.586, | |
| "grad_norm": 0.06494140625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6292213439941405, | |
| "step": 2930 | |
| }, | |
| { | |
| "epoch": 0.588, | |
| "grad_norm": 0.052734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6273422241210938, | |
| "step": 2940 | |
| }, | |
| { | |
| "epoch": 0.59, | |
| "grad_norm": 0.09716796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.622287368774414, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 0.592, | |
| "grad_norm": 0.0498046875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5906503677368162, | |
| "step": 2960 | |
| }, | |
| { | |
| "epoch": 0.594, | |
| "grad_norm": 0.057373046875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.631303596496582, | |
| "step": 2970 | |
| }, | |
| { | |
| "epoch": 0.596, | |
| "grad_norm": 0.054443359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6114727020263673, | |
| "step": 2980 | |
| }, | |
| { | |
| "epoch": 0.598, | |
| "grad_norm": 0.0908203125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.603567886352539, | |
| "step": 2990 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 0.0556640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.585314178466797, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "eval_loss": 3.0278046131134033, | |
| "eval_runtime": 4.4444, | |
| "eval_samples_per_second": 67.051, | |
| "eval_steps_per_second": 3.825, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.602, | |
| "grad_norm": 0.055908203125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6127801895141602, | |
| "step": 3010 | |
| }, | |
| { | |
| "epoch": 0.604, | |
| "grad_norm": 0.1455078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5975704193115234, | |
| "step": 3020 | |
| }, | |
| { | |
| "epoch": 0.606, | |
| "grad_norm": 15.0625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5873924255371095, | |
| "step": 3030 | |
| }, | |
| { | |
| "epoch": 0.608, | |
| "grad_norm": 0.0478515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5901187896728515, | |
| "step": 3040 | |
| }, | |
| { | |
| "epoch": 0.61, | |
| "grad_norm": 0.166015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.585931968688965, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 0.612, | |
| "grad_norm": 0.053466796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6187633514404296, | |
| "step": 3060 | |
| }, | |
| { | |
| "epoch": 0.614, | |
| "grad_norm": 0.0556640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6473546981811524, | |
| "step": 3070 | |
| }, | |
| { | |
| "epoch": 0.616, | |
| "grad_norm": 0.055908203125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.606519317626953, | |
| "step": 3080 | |
| }, | |
| { | |
| "epoch": 0.618, | |
| "grad_norm": 12.0, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6005083084106446, | |
| "step": 3090 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "grad_norm": 0.0615234375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6309852600097656, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 0.62, | |
| "eval_loss": 3.0271658897399902, | |
| "eval_runtime": 4.4454, | |
| "eval_samples_per_second": 67.036, | |
| "eval_steps_per_second": 3.824, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 0.622, | |
| "grad_norm": 0.107421875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6178503036499023, | |
| "step": 3110 | |
| }, | |
| { | |
| "epoch": 0.624, | |
| "grad_norm": 0.06640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.614837646484375, | |
| "step": 3120 | |
| }, | |
| { | |
| "epoch": 0.626, | |
| "grad_norm": 1.203125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.62316837310791, | |
| "step": 3130 | |
| }, | |
| { | |
| "epoch": 0.628, | |
| "grad_norm": 0.0517578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.59710693359375, | |
| "step": 3140 | |
| }, | |
| { | |
| "epoch": 0.63, | |
| "grad_norm": 0.058349609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6030540466308594, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 0.632, | |
| "grad_norm": 0.05029296875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5992559432983398, | |
| "step": 3160 | |
| }, | |
| { | |
| "epoch": 0.634, | |
| "grad_norm": 0.052490234375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6360668182373046, | |
| "step": 3170 | |
| }, | |
| { | |
| "epoch": 0.636, | |
| "grad_norm": 0.11279296875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6165666580200195, | |
| "step": 3180 | |
| }, | |
| { | |
| "epoch": 0.638, | |
| "grad_norm": 0.052978515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.636544036865234, | |
| "step": 3190 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 0.0947265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6081783294677736, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "eval_loss": 3.0295300483703613, | |
| "eval_runtime": 4.4243, | |
| "eval_samples_per_second": 67.356, | |
| "eval_steps_per_second": 3.842, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 0.642, | |
| "grad_norm": 0.07470703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6136301040649412, | |
| "step": 3210 | |
| }, | |
| { | |
| "epoch": 0.644, | |
| "grad_norm": 5.59375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.611122703552246, | |
| "step": 3220 | |
| }, | |
| { | |
| "epoch": 0.646, | |
| "grad_norm": 0.0888671875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.611610984802246, | |
| "step": 3230 | |
| }, | |
| { | |
| "epoch": 0.648, | |
| "grad_norm": 6.4375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6010536193847655, | |
| "step": 3240 | |
| }, | |
| { | |
| "epoch": 0.65, | |
| "grad_norm": 0.051513671875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.623811149597168, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 0.652, | |
| "grad_norm": 0.06005859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5976247787475586, | |
| "step": 3260 | |
| }, | |
| { | |
| "epoch": 0.654, | |
| "grad_norm": 0.05859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.593853569030762, | |
| "step": 3270 | |
| }, | |
| { | |
| "epoch": 0.656, | |
| "grad_norm": 0.060546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.645317268371582, | |
| "step": 3280 | |
| }, | |
| { | |
| "epoch": 0.658, | |
| "grad_norm": 0.0595703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.592297172546387, | |
| "step": 3290 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "grad_norm": 2.21875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.60241641998291, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 0.66, | |
| "eval_loss": 3.0250847339630127, | |
| "eval_runtime": 4.4783, | |
| "eval_samples_per_second": 66.543, | |
| "eval_steps_per_second": 3.796, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 0.662, | |
| "grad_norm": 0.052490234375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.600591278076172, | |
| "step": 3310 | |
| }, | |
| { | |
| "epoch": 0.664, | |
| "grad_norm": 0.052978515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6144927978515624, | |
| "step": 3320 | |
| }, | |
| { | |
| "epoch": 0.666, | |
| "grad_norm": 0.057861328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.593229866027832, | |
| "step": 3330 | |
| }, | |
| { | |
| "epoch": 0.668, | |
| "grad_norm": 0.0546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6041738510131838, | |
| "step": 3340 | |
| }, | |
| { | |
| "epoch": 0.67, | |
| "grad_norm": 0.052978515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.607752227783203, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 0.672, | |
| "grad_norm": 1.671875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6296701431274414, | |
| "step": 3360 | |
| }, | |
| { | |
| "epoch": 0.674, | |
| "grad_norm": 0.55859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5772432327270507, | |
| "step": 3370 | |
| }, | |
| { | |
| "epoch": 0.676, | |
| "grad_norm": 0.052734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6260414123535156, | |
| "step": 3380 | |
| }, | |
| { | |
| "epoch": 0.678, | |
| "grad_norm": 0.062255859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5910011291503907, | |
| "step": 3390 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 0.0546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5773406982421876, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "eval_loss": 3.0262410640716553, | |
| "eval_runtime": 4.4195, | |
| "eval_samples_per_second": 67.428, | |
| "eval_steps_per_second": 3.847, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 0.682, | |
| "grad_norm": 0.056640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.602094268798828, | |
| "step": 3410 | |
| }, | |
| { | |
| "epoch": 0.684, | |
| "grad_norm": 0.04931640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6283613204956056, | |
| "step": 3420 | |
| }, | |
| { | |
| "epoch": 0.686, | |
| "grad_norm": 0.26171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.58358211517334, | |
| "step": 3430 | |
| }, | |
| { | |
| "epoch": 0.688, | |
| "grad_norm": 0.052978515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5964986801147463, | |
| "step": 3440 | |
| }, | |
| { | |
| "epoch": 0.69, | |
| "grad_norm": 0.05322265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5851970672607423, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 0.692, | |
| "grad_norm": 0.051025390625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6003726959228515, | |
| "step": 3460 | |
| }, | |
| { | |
| "epoch": 0.694, | |
| "grad_norm": 0.050048828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6186376571655274, | |
| "step": 3470 | |
| }, | |
| { | |
| "epoch": 0.696, | |
| "grad_norm": 0.052001953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.624268341064453, | |
| "step": 3480 | |
| }, | |
| { | |
| "epoch": 0.698, | |
| "grad_norm": 0.05029296875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5755191802978517, | |
| "step": 3490 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "grad_norm": 0.244140625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.593659782409668, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.7, | |
| "eval_loss": 3.0274429321289062, | |
| "eval_runtime": 4.4166, | |
| "eval_samples_per_second": 67.472, | |
| "eval_steps_per_second": 3.849, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.702, | |
| "grad_norm": 0.053466796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.599693489074707, | |
| "step": 3510 | |
| }, | |
| { | |
| "epoch": 0.704, | |
| "grad_norm": 0.07275390625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.599070167541504, | |
| "step": 3520 | |
| }, | |
| { | |
| "epoch": 0.706, | |
| "grad_norm": 0.055419921875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6012365341186525, | |
| "step": 3530 | |
| }, | |
| { | |
| "epoch": 0.708, | |
| "grad_norm": 0.05224609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.576295852661133, | |
| "step": 3540 | |
| }, | |
| { | |
| "epoch": 0.71, | |
| "grad_norm": 0.0517578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6024765014648437, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 0.712, | |
| "grad_norm": 0.0693359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5685857772827148, | |
| "step": 3560 | |
| }, | |
| { | |
| "epoch": 0.714, | |
| "grad_norm": 0.1220703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.584480094909668, | |
| "step": 3570 | |
| }, | |
| { | |
| "epoch": 0.716, | |
| "grad_norm": 0.06396484375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6187564849853517, | |
| "step": 3580 | |
| }, | |
| { | |
| "epoch": 0.718, | |
| "grad_norm": 0.05126953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.608148384094238, | |
| "step": 3590 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 0.056396484375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.596156883239746, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "eval_loss": 3.0285751819610596, | |
| "eval_runtime": 4.4537, | |
| "eval_samples_per_second": 66.91, | |
| "eval_steps_per_second": 3.817, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 0.722, | |
| "grad_norm": 2.265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6053913116455076, | |
| "step": 3610 | |
| }, | |
| { | |
| "epoch": 0.724, | |
| "grad_norm": 0.1259765625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5906614303588866, | |
| "step": 3620 | |
| }, | |
| { | |
| "epoch": 0.726, | |
| "grad_norm": 0.058349609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6229223251342773, | |
| "step": 3630 | |
| }, | |
| { | |
| "epoch": 0.728, | |
| "grad_norm": 0.054443359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6100414276123045, | |
| "step": 3640 | |
| }, | |
| { | |
| "epoch": 0.73, | |
| "grad_norm": 0.05078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5861778259277344, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 0.732, | |
| "grad_norm": 0.06884765625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6088991165161133, | |
| "step": 3660 | |
| }, | |
| { | |
| "epoch": 0.734, | |
| "grad_norm": 0.0546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5957805633544924, | |
| "step": 3670 | |
| }, | |
| { | |
| "epoch": 0.736, | |
| "grad_norm": 0.08447265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5968517303466796, | |
| "step": 3680 | |
| }, | |
| { | |
| "epoch": 0.738, | |
| "grad_norm": 0.06396484375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.590867614746094, | |
| "step": 3690 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "grad_norm": 0.057373046875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6020263671875, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 0.74, | |
| "eval_loss": 3.033440113067627, | |
| "eval_runtime": 4.4438, | |
| "eval_samples_per_second": 67.059, | |
| "eval_steps_per_second": 3.826, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 0.742, | |
| "grad_norm": 1.8359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.624915885925293, | |
| "step": 3710 | |
| }, | |
| { | |
| "epoch": 0.744, | |
| "grad_norm": 0.05322265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6158367156982423, | |
| "step": 3720 | |
| }, | |
| { | |
| "epoch": 0.746, | |
| "grad_norm": 0.052978515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5968292236328123, | |
| "step": 3730 | |
| }, | |
| { | |
| "epoch": 0.748, | |
| "grad_norm": 0.0849609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.61802978515625, | |
| "step": 3740 | |
| }, | |
| { | |
| "epoch": 0.75, | |
| "grad_norm": 0.05517578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5647909164428713, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 0.752, | |
| "grad_norm": 0.060791015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.601895332336426, | |
| "step": 3760 | |
| }, | |
| { | |
| "epoch": 0.754, | |
| "grad_norm": 0.0556640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.605121612548828, | |
| "step": 3770 | |
| }, | |
| { | |
| "epoch": 0.756, | |
| "grad_norm": 0.09716796875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6213621139526366, | |
| "step": 3780 | |
| }, | |
| { | |
| "epoch": 0.758, | |
| "grad_norm": 0.05078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5848875045776367, | |
| "step": 3790 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 0.05859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.585398483276367, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "eval_loss": 3.0310301780700684, | |
| "eval_runtime": 4.4352, | |
| "eval_samples_per_second": 67.19, | |
| "eval_steps_per_second": 3.833, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 0.762, | |
| "grad_norm": 0.0830078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5891979217529295, | |
| "step": 3810 | |
| }, | |
| { | |
| "epoch": 0.764, | |
| "grad_norm": 0.048828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.587088203430176, | |
| "step": 3820 | |
| }, | |
| { | |
| "epoch": 0.766, | |
| "grad_norm": 0.056884765625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6202329635620116, | |
| "step": 3830 | |
| }, | |
| { | |
| "epoch": 0.768, | |
| "grad_norm": 0.058349609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.588342475891113, | |
| "step": 3840 | |
| }, | |
| { | |
| "epoch": 0.77, | |
| "grad_norm": 0.051513671875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.570342445373535, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 0.772, | |
| "grad_norm": 0.054443359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5928205490112304, | |
| "step": 3860 | |
| }, | |
| { | |
| "epoch": 0.774, | |
| "grad_norm": 1.1484375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.562236785888672, | |
| "step": 3870 | |
| }, | |
| { | |
| "epoch": 0.776, | |
| "grad_norm": 0.05322265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5821876525878906, | |
| "step": 3880 | |
| }, | |
| { | |
| "epoch": 0.778, | |
| "grad_norm": 0.05029296875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.583372688293457, | |
| "step": 3890 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "grad_norm": 0.197265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5738046646118162, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 0.78, | |
| "eval_loss": 3.029505491256714, | |
| "eval_runtime": 4.3771, | |
| "eval_samples_per_second": 68.082, | |
| "eval_steps_per_second": 3.884, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 0.782, | |
| "grad_norm": 0.173828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.576494598388672, | |
| "step": 3910 | |
| }, | |
| { | |
| "epoch": 0.784, | |
| "grad_norm": 0.380859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5919593811035155, | |
| "step": 3920 | |
| }, | |
| { | |
| "epoch": 0.786, | |
| "grad_norm": 0.048095703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.621496391296387, | |
| "step": 3930 | |
| }, | |
| { | |
| "epoch": 0.788, | |
| "grad_norm": 0.052490234375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.584731101989746, | |
| "step": 3940 | |
| }, | |
| { | |
| "epoch": 0.79, | |
| "grad_norm": 0.0498046875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.568536567687988, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 0.792, | |
| "grad_norm": 0.0615234375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.590066909790039, | |
| "step": 3960 | |
| }, | |
| { | |
| "epoch": 0.794, | |
| "grad_norm": 0.060791015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.613643264770508, | |
| "step": 3970 | |
| }, | |
| { | |
| "epoch": 0.796, | |
| "grad_norm": 0.052734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.614491081237793, | |
| "step": 3980 | |
| }, | |
| { | |
| "epoch": 0.798, | |
| "grad_norm": 0.0517578125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.591320037841797, | |
| "step": 3990 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.04931640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.605324554443359, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "eval_loss": 3.0305187702178955, | |
| "eval_runtime": 4.4657, | |
| "eval_samples_per_second": 66.73, | |
| "eval_steps_per_second": 3.807, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.802, | |
| "grad_norm": 0.054931640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5756288528442384, | |
| "step": 4010 | |
| }, | |
| { | |
| "epoch": 0.804, | |
| "grad_norm": 0.5546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.591953468322754, | |
| "step": 4020 | |
| }, | |
| { | |
| "epoch": 0.806, | |
| "grad_norm": 0.05029296875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5956727981567385, | |
| "step": 4030 | |
| }, | |
| { | |
| "epoch": 0.808, | |
| "grad_norm": 0.05224609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.60211067199707, | |
| "step": 4040 | |
| }, | |
| { | |
| "epoch": 0.81, | |
| "grad_norm": 0.049072265625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5871608734130858, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 0.812, | |
| "grad_norm": 0.10693359375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5698373794555662, | |
| "step": 4060 | |
| }, | |
| { | |
| "epoch": 0.814, | |
| "grad_norm": 0.05810546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6126802444458006, | |
| "step": 4070 | |
| }, | |
| { | |
| "epoch": 0.816, | |
| "grad_norm": 0.05029296875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5981868743896483, | |
| "step": 4080 | |
| }, | |
| { | |
| "epoch": 0.818, | |
| "grad_norm": 0.052978515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.580386161804199, | |
| "step": 4090 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "grad_norm": 0.07080078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5840375900268553, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 0.82, | |
| "eval_loss": 3.0312201976776123, | |
| "eval_runtime": 4.4429, | |
| "eval_samples_per_second": 67.074, | |
| "eval_steps_per_second": 3.826, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 0.822, | |
| "grad_norm": 0.052978515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6040040969848635, | |
| "step": 4110 | |
| }, | |
| { | |
| "epoch": 0.824, | |
| "grad_norm": 0.05224609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5784271240234373, | |
| "step": 4120 | |
| }, | |
| { | |
| "epoch": 0.826, | |
| "grad_norm": 0.05078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5992313385009767, | |
| "step": 4130 | |
| }, | |
| { | |
| "epoch": 0.828, | |
| "grad_norm": 0.62109375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.607274055480957, | |
| "step": 4140 | |
| }, | |
| { | |
| "epoch": 0.83, | |
| "grad_norm": 0.05126953125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5900325775146484, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 0.832, | |
| "grad_norm": 0.0556640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.584280586242676, | |
| "step": 4160 | |
| }, | |
| { | |
| "epoch": 0.834, | |
| "grad_norm": 0.06103515625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.578823471069336, | |
| "step": 4170 | |
| }, | |
| { | |
| "epoch": 0.836, | |
| "grad_norm": 0.05908203125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.600706672668457, | |
| "step": 4180 | |
| }, | |
| { | |
| "epoch": 0.838, | |
| "grad_norm": 0.054931640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5908893585205077, | |
| "step": 4190 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 0.08740234375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6078845977783205, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "eval_loss": 3.0311102867126465, | |
| "eval_runtime": 4.4714, | |
| "eval_samples_per_second": 66.645, | |
| "eval_steps_per_second": 3.802, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 0.842, | |
| "grad_norm": 0.0556640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.630947303771973, | |
| "step": 4210 | |
| }, | |
| { | |
| "epoch": 0.844, | |
| "grad_norm": 0.09423828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.623428726196289, | |
| "step": 4220 | |
| }, | |
| { | |
| "epoch": 0.846, | |
| "grad_norm": 0.111328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5977907180786133, | |
| "step": 4230 | |
| }, | |
| { | |
| "epoch": 0.848, | |
| "grad_norm": 0.455078125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6008005142211914, | |
| "step": 4240 | |
| }, | |
| { | |
| "epoch": 0.85, | |
| "grad_norm": 1.6015625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5678030014038087, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 0.852, | |
| "grad_norm": 0.052490234375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.613857650756836, | |
| "step": 4260 | |
| }, | |
| { | |
| "epoch": 0.854, | |
| "grad_norm": 0.08349609375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.579903221130371, | |
| "step": 4270 | |
| }, | |
| { | |
| "epoch": 0.856, | |
| "grad_norm": 0.049560546875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.579732131958008, | |
| "step": 4280 | |
| }, | |
| { | |
| "epoch": 0.858, | |
| "grad_norm": 0.181640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5955440521240236, | |
| "step": 4290 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "grad_norm": 0.05712890625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.592930793762207, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 0.86, | |
| "eval_loss": 3.031736373901367, | |
| "eval_runtime": 4.4299, | |
| "eval_samples_per_second": 67.27, | |
| "eval_steps_per_second": 3.838, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 0.862, | |
| "grad_norm": 0.05419921875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.592413902282715, | |
| "step": 4310 | |
| }, | |
| { | |
| "epoch": 0.864, | |
| "grad_norm": 0.10986328125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.569998931884766, | |
| "step": 4320 | |
| }, | |
| { | |
| "epoch": 0.866, | |
| "grad_norm": 0.048583984375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5922664642333983, | |
| "step": 4330 | |
| }, | |
| { | |
| "epoch": 0.868, | |
| "grad_norm": 0.052734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6012556076049806, | |
| "step": 4340 | |
| }, | |
| { | |
| "epoch": 0.87, | |
| "grad_norm": 0.07177734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6031923294067383, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 0.872, | |
| "grad_norm": 0.07763671875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.59698543548584, | |
| "step": 4360 | |
| }, | |
| { | |
| "epoch": 0.874, | |
| "grad_norm": 0.051513671875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6096282958984376, | |
| "step": 4370 | |
| }, | |
| { | |
| "epoch": 0.876, | |
| "grad_norm": 0.052734375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6013412475585938, | |
| "step": 4380 | |
| }, | |
| { | |
| "epoch": 0.878, | |
| "grad_norm": 0.051025390625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.570247268676758, | |
| "step": 4390 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 0.19140625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6004173278808596, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "eval_loss": 3.032118320465088, | |
| "eval_runtime": 4.4552, | |
| "eval_samples_per_second": 66.887, | |
| "eval_steps_per_second": 3.816, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 0.882, | |
| "grad_norm": 0.050048828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.60999755859375, | |
| "step": 4410 | |
| }, | |
| { | |
| "epoch": 0.884, | |
| "grad_norm": 0.1044921875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5999217987060548, | |
| "step": 4420 | |
| }, | |
| { | |
| "epoch": 0.886, | |
| "grad_norm": 0.255859375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.57828369140625, | |
| "step": 4430 | |
| }, | |
| { | |
| "epoch": 0.888, | |
| "grad_norm": 0.0556640625, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5876300811767576, | |
| "step": 4440 | |
| }, | |
| { | |
| "epoch": 0.89, | |
| "grad_norm": 0.052490234375, | |
| "learning_rate": 0.0003, | |
| "loss": 2.5927480697631835, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 0.892, | |
| "grad_norm": 0.076171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.6045318603515626, | |
| "step": 4460 | |
| }, | |
| { | |
| "epoch": 0.894, | |
| "grad_norm": 0.06201171875, | |
| "learning_rate": 0.0003, | |
| "loss": 2.585988235473633, | |
| "step": 4470 | |
| }, | |
| { | |
| "epoch": 0.896, | |
| "grad_norm": 0.050048828125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.613155555725098, | |
| "step": 4480 | |
| }, | |
| { | |
| "epoch": 0.898, | |
| "grad_norm": 4.125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.592078971862793, | |
| "step": 4490 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "grad_norm": 0.048095703125, | |
| "learning_rate": 0.0003, | |
| "loss": 2.591631317138672, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.9, | |
| "eval_loss": 3.028334617614746, | |
| "eval_runtime": 4.4441, | |
| "eval_samples_per_second": 67.055, | |
| "eval_steps_per_second": 3.825, | |
| "step": 4500 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 5000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 9223372036854775807, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.467695316860928e+18, | |
| "train_batch_size": 18, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |