Text Generation
Transformers
Safetensors
English
modern_llm
custom-architecture
rope
gqa
swiglu
rmsnorm
custom_code
Instructions to use devoppro/FastLLM with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use devoppro/FastLLM with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="devoppro/FastLLM", trust_remote_code=True)# Load model directly from transformers import AutoModelForCausalLM model = AutoModelForCausalLM.from_pretrained("devoppro/FastLLM", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use devoppro/FastLLM with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "devoppro/FastLLM" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "devoppro/FastLLM", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/devoppro/FastLLM
- SGLang
How to use devoppro/FastLLM with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "devoppro/FastLLM" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "devoppro/FastLLM", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "devoppro/FastLLM" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "devoppro/FastLLM", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use devoppro/FastLLM with Docker Model Runner:
docker model run hf.co/devoppro/FastLLM
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN,
"... is not valid JSON
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 24.0017, | |
| "eval_steps": 500, | |
| "global_step": 4100, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0002, | |
| "grad_norm": 226.5673828125, | |
| "learning_rate": 2.6999999999999996e-05, | |
| "loss": 67.51285400390626, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.0004, | |
| "grad_norm": 30.177888870239258, | |
| "learning_rate": 5.6999999999999996e-05, | |
| "loss": 29.44110107421875, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.0006, | |
| "grad_norm": 7.557392120361328, | |
| "learning_rate": 8.699999999999999e-05, | |
| "loss": 16.708602905273438, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.0008, | |
| "grad_norm": 4.4042744636535645, | |
| "learning_rate": 0.000117, | |
| "loss": 16.181797790527344, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.001, | |
| "grad_norm": 2.3703675270080566, | |
| "learning_rate": 0.000147, | |
| "loss": 13.265884399414062, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.0012, | |
| "grad_norm": 0.868837296962738, | |
| "learning_rate": 0.00017699999999999997, | |
| "loss": 11.693977355957031, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.0014, | |
| "grad_norm": 1.1192706823349, | |
| "learning_rate": 0.00020699999999999996, | |
| "loss": 12.454998016357422, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.0016, | |
| "grad_norm": 1.4453760385513306, | |
| "learning_rate": 0.000237, | |
| "loss": 13.03106231689453, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.0018, | |
| "grad_norm": 1.499172568321228, | |
| "learning_rate": 0.000267, | |
| "loss": 10.518834686279297, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.002, | |
| "grad_norm": 2.132214069366455, | |
| "learning_rate": 0.00029699999999999996, | |
| "loss": 12.466087341308594, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.0022, | |
| "grad_norm": 0.9064206480979919, | |
| "learning_rate": 0.0002999458917835671, | |
| "loss": 12.170447540283202, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.0024, | |
| "grad_norm": 4.273526191711426, | |
| "learning_rate": 0.00029988577154308615, | |
| "loss": 10.753311157226562, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.0026, | |
| "grad_norm": 1.101340889930725, | |
| "learning_rate": 0.0002998256513026052, | |
| "loss": 12.582955932617187, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.0028, | |
| "grad_norm": 0.7963618040084839, | |
| "learning_rate": 0.0002997655310621242, | |
| "loss": 12.283400726318359, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.003, | |
| "grad_norm": 1.5654473304748535, | |
| "learning_rate": 0.00029970541082164324, | |
| "loss": 11.285658264160157, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.0032, | |
| "grad_norm": 1.8542180061340332, | |
| "learning_rate": 0.0002996452905811623, | |
| "loss": 10.847380065917969, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.0034, | |
| "grad_norm": 2.580841302871704, | |
| "learning_rate": 0.00029958517034068134, | |
| "loss": 9.636419677734375, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.0036, | |
| "grad_norm": 1.7422585487365723, | |
| "learning_rate": 0.0002995250501002004, | |
| "loss": 12.142258453369141, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.0038, | |
| "grad_norm": 1.7994998693466187, | |
| "learning_rate": 0.00029946492985971943, | |
| "loss": 11.316072845458985, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.004, | |
| "grad_norm": 0.8520310521125793, | |
| "learning_rate": 0.0002994048096192384, | |
| "loss": 9.44781723022461, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.0042, | |
| "grad_norm": 1.9302258491516113, | |
| "learning_rate": 0.0002993446893787575, | |
| "loss": 11.585807800292969, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.0044, | |
| "grad_norm": 1.4165903329849243, | |
| "learning_rate": 0.0002992845691382765, | |
| "loss": 10.411253356933594, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.0046, | |
| "grad_norm": 2.6108484268188477, | |
| "learning_rate": 0.00029922444889779557, | |
| "loss": 13.10027618408203, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.0048, | |
| "grad_norm": 2.317113161087036, | |
| "learning_rate": 0.00029916432865731456, | |
| "loss": 10.390520477294922, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.005, | |
| "grad_norm": 2.3662290573120117, | |
| "learning_rate": 0.00029910420841683367, | |
| "loss": 11.516622924804688, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.0052, | |
| "grad_norm": 1.1160132884979248, | |
| "learning_rate": 0.0002990440881763527, | |
| "loss": 10.796371459960938, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.0054, | |
| "grad_norm": 2.113326072692871, | |
| "learning_rate": 0.0002989839679358717, | |
| "loss": 12.288037109375, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.0056, | |
| "grad_norm": 1.6802517175674438, | |
| "learning_rate": 0.00029892384769539075, | |
| "loss": 9.989302062988282, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.0058, | |
| "grad_norm": 0.667611300945282, | |
| "learning_rate": 0.0002988637274549098, | |
| "loss": 10.866537475585938, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.006, | |
| "grad_norm": 0.9238641858100891, | |
| "learning_rate": 0.00029880360721442885, | |
| "loss": 10.386916351318359, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.0062, | |
| "grad_norm": 2.5315372943878174, | |
| "learning_rate": 0.00029874348697394784, | |
| "loss": 8.981736755371093, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.0064, | |
| "grad_norm": 1.1698753833770752, | |
| "learning_rate": 0.0002986833667334669, | |
| "loss": 8.788543701171875, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.0066, | |
| "grad_norm": 1.353128433227539, | |
| "learning_rate": 0.00029862324649298594, | |
| "loss": 9.83536148071289, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.0068, | |
| "grad_norm": 1.1758288145065308, | |
| "learning_rate": 0.000298563126252505, | |
| "loss": 11.545357513427735, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.007, | |
| "grad_norm": 1.2862794399261475, | |
| "learning_rate": 0.00029850300601202403, | |
| "loss": 9.087370300292969, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.0072, | |
| "grad_norm": 1.449062466621399, | |
| "learning_rate": 0.0002984428857715431, | |
| "loss": 11.168739318847656, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.0074, | |
| "grad_norm": 0.5698562264442444, | |
| "learning_rate": 0.00029838276553106213, | |
| "loss": 7.454578399658203, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.0076, | |
| "grad_norm": 0.9205979108810425, | |
| "learning_rate": 0.0002983226452905811, | |
| "loss": 11.321672058105468, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.0078, | |
| "grad_norm": 0.8094843626022339, | |
| "learning_rate": 0.00029826252505010017, | |
| "loss": 9.661857604980469, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.008, | |
| "grad_norm": 0.9517568945884705, | |
| "learning_rate": 0.0002982024048096192, | |
| "loss": 7.4337646484375, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.0082, | |
| "grad_norm": 28.707782745361328, | |
| "learning_rate": 0.00029814228456913827, | |
| "loss": 103.1381591796875, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.0084, | |
| "grad_norm": 12.400252342224121, | |
| "learning_rate": 0.00029808216432865726, | |
| "loss": 83.130029296875, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.0086, | |
| "grad_norm": 7.325169563293457, | |
| "learning_rate": 0.0002980220440881763, | |
| "loss": 73.54479370117187, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.0088, | |
| "grad_norm": 11.358526229858398, | |
| "learning_rate": 0.00029796192384769535, | |
| "loss": 77.26640625, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.009, | |
| "grad_norm": 8.655184745788574, | |
| "learning_rate": 0.0002979018036072144, | |
| "loss": 77.83007202148437, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.0092, | |
| "grad_norm": 10.999149322509766, | |
| "learning_rate": 0.00029784168336673345, | |
| "loss": 78.61140747070313, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.0094, | |
| "grad_norm": 9.994011878967285, | |
| "learning_rate": 0.0002977815631262525, | |
| "loss": 71.70507202148437, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.0096, | |
| "grad_norm": 7.690250873565674, | |
| "learning_rate": 0.00029772144288577155, | |
| "loss": 73.41466674804687, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.0098, | |
| "grad_norm": 9.543883323669434, | |
| "learning_rate": 0.00029766132264529054, | |
| "loss": 75.77626953125, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.01, | |
| "grad_norm": 11.137728691101074, | |
| "learning_rate": 0.0002976012024048096, | |
| "loss": 78.9918212890625, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.0102, | |
| "grad_norm": 15.467362403869629, | |
| "learning_rate": 0.00029754108216432863, | |
| "loss": 124.401513671875, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.0104, | |
| "grad_norm": 13.991318702697754, | |
| "learning_rate": 0.0002974809619238477, | |
| "loss": 110.567431640625, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.0106, | |
| "grad_norm": 17.036069869995117, | |
| "learning_rate": 0.0002974208416833667, | |
| "loss": 104.7319580078125, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.0108, | |
| "grad_norm": 13.922304153442383, | |
| "learning_rate": 0.0002973607214428857, | |
| "loss": 100.63988647460937, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.011, | |
| "grad_norm": 13.223531723022461, | |
| "learning_rate": 0.0002973006012024048, | |
| "loss": 99.96443481445313, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.0112, | |
| "grad_norm": 14.53707504272461, | |
| "learning_rate": 0.0002972404809619238, | |
| "loss": 95.74251098632813, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.0114, | |
| "grad_norm": 14.91770076751709, | |
| "learning_rate": 0.00029718036072144287, | |
| "loss": 94.661767578125, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.0116, | |
| "grad_norm": 13.45614242553711, | |
| "learning_rate": 0.0002971202404809619, | |
| "loss": 90.941796875, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.0118, | |
| "grad_norm": 13.695131301879883, | |
| "learning_rate": 0.00029706012024048096, | |
| "loss": 92.9096923828125, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.012, | |
| "grad_norm": 16.406902313232422, | |
| "learning_rate": 0.00029699999999999996, | |
| "loss": 90.14566650390626, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.0122, | |
| "grad_norm": 11.779080390930176, | |
| "learning_rate": 0.000296939879759519, | |
| "loss": 86.8746826171875, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.0124, | |
| "grad_norm": 13.758212089538574, | |
| "learning_rate": 0.00029687975951903805, | |
| "loss": 87.3355224609375, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.0126, | |
| "grad_norm": 12.833357810974121, | |
| "learning_rate": 0.0002968196392785571, | |
| "loss": 89.81148071289063, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.0128, | |
| "grad_norm": 14.684094429016113, | |
| "learning_rate": 0.0002967595190380761, | |
| "loss": 89.44540405273438, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.013, | |
| "grad_norm": 10.780083656311035, | |
| "learning_rate": 0.0002966993987975952, | |
| "loss": 88.07953491210938, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.0132, | |
| "grad_norm": 11.908385276794434, | |
| "learning_rate": 0.0002966392785571142, | |
| "loss": 87.04054565429688, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.0134, | |
| "grad_norm": 15.518954277038574, | |
| "learning_rate": 0.00029657915831663323, | |
| "loss": 85.9423583984375, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.0136, | |
| "grad_norm": 10.570508003234863, | |
| "learning_rate": 0.0002965190380761523, | |
| "loss": 86.79979858398437, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.0138, | |
| "grad_norm": 14.696393013000488, | |
| "learning_rate": 0.00029645891783567133, | |
| "loss": 79.76475219726562, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.014, | |
| "grad_norm": 12.92392349243164, | |
| "learning_rate": 0.0002963987975951904, | |
| "loss": 87.0448974609375, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.0142, | |
| "grad_norm": 13.465226173400879, | |
| "learning_rate": 0.00029633867735470937, | |
| "loss": 90.22592163085938, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.0144, | |
| "grad_norm": 12.435464859008789, | |
| "learning_rate": 0.0002962785571142284, | |
| "loss": 86.32198486328124, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.0146, | |
| "grad_norm": 12.340784072875977, | |
| "learning_rate": 0.00029621843687374747, | |
| "loss": 89.89630737304688, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.0148, | |
| "grad_norm": 14.63569164276123, | |
| "learning_rate": 0.0002961583166332665, | |
| "loss": 86.31669921875, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.015, | |
| "grad_norm": 10.646244049072266, | |
| "learning_rate": 0.00029609819639278556, | |
| "loss": 85.20569458007813, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.0152, | |
| "grad_norm": 8.930062294006348, | |
| "learning_rate": 0.0002960380761523046, | |
| "loss": 86.44678955078125, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.0154, | |
| "grad_norm": 12.228261947631836, | |
| "learning_rate": 0.0002959779559118236, | |
| "loss": 84.96986083984375, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.0156, | |
| "grad_norm": 9.189741134643555, | |
| "learning_rate": 0.00029591783567134265, | |
| "loss": 86.03868408203125, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.0158, | |
| "grad_norm": 12.331954956054688, | |
| "learning_rate": 0.0002958577154308617, | |
| "loss": 85.13253784179688, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.016, | |
| "grad_norm": 14.345333099365234, | |
| "learning_rate": 0.00029579759519038075, | |
| "loss": 86.58322143554688, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.0162, | |
| "grad_norm": 10.961579322814941, | |
| "learning_rate": 0.00029573747494989974, | |
| "loss": 84.83054809570312, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.0164, | |
| "grad_norm": 11.578486442565918, | |
| "learning_rate": 0.0002956773547094188, | |
| "loss": 87.94888305664062, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.0166, | |
| "grad_norm": 13.537806510925293, | |
| "learning_rate": 0.00029561723446893784, | |
| "loss": 87.522900390625, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.0168, | |
| "grad_norm": 10.907570838928223, | |
| "learning_rate": 0.0002955571142284569, | |
| "loss": 84.80013427734374, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.017, | |
| "grad_norm": 13.713836669921875, | |
| "learning_rate": 0.00029549699398797593, | |
| "loss": 86.79594116210937, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.0172, | |
| "grad_norm": 12.571099281311035, | |
| "learning_rate": 0.000295436873747495, | |
| "loss": 84.85569458007812, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.0174, | |
| "grad_norm": 9.433479309082031, | |
| "learning_rate": 0.000295376753507014, | |
| "loss": 85.20677490234375, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.0176, | |
| "grad_norm": 12.85809326171875, | |
| "learning_rate": 0.000295316633266533, | |
| "loss": 79.00835571289062, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.0178, | |
| "grad_norm": 11.075084686279297, | |
| "learning_rate": 0.00029525651302605207, | |
| "loss": 80.06212158203125, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.018, | |
| "grad_norm": 14.64054012298584, | |
| "learning_rate": 0.0002951963927855711, | |
| "loss": 83.31229248046876, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.0182, | |
| "grad_norm": 11.558423042297363, | |
| "learning_rate": 0.00029513627254509016, | |
| "loss": 78.82657470703126, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.0184, | |
| "grad_norm": 22.44339942932129, | |
| "learning_rate": 0.00029507615230460916, | |
| "loss": 81.31973266601562, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.0186, | |
| "grad_norm": 10.331223487854004, | |
| "learning_rate": 0.0002950160320641282, | |
| "loss": 83.343115234375, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.0188, | |
| "grad_norm": 9.869694709777832, | |
| "learning_rate": 0.0002949559118236473, | |
| "loss": 79.85993041992188, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.019, | |
| "grad_norm": 10.701475143432617, | |
| "learning_rate": 0.0002948957915831663, | |
| "loss": 84.02029418945312, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.0192, | |
| "grad_norm": 12.234188079833984, | |
| "learning_rate": 0.00029483567134268535, | |
| "loss": 83.42827758789062, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.0194, | |
| "grad_norm": 11.610219955444336, | |
| "learning_rate": 0.0002947755511022044, | |
| "loss": 80.161669921875, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.0196, | |
| "grad_norm": 8.672530174255371, | |
| "learning_rate": 0.00029471543086172344, | |
| "loss": 81.43499145507812, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.0198, | |
| "grad_norm": 11.546252250671387, | |
| "learning_rate": 0.00029465531062124244, | |
| "loss": 79.0343017578125, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.02, | |
| "grad_norm": 11.632270812988281, | |
| "learning_rate": 0.0002945951903807615, | |
| "loss": 80.40287475585937, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.0202, | |
| "grad_norm": 10.527654647827148, | |
| "learning_rate": 0.00029453507014028053, | |
| "loss": 80.63410034179688, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.0204, | |
| "grad_norm": 15.636934280395508, | |
| "learning_rate": 0.0002944749498997996, | |
| "loss": 81.25313720703124, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.0206, | |
| "grad_norm": 8.874528884887695, | |
| "learning_rate": 0.00029441482965931857, | |
| "loss": 82.75345458984376, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.0208, | |
| "grad_norm": 9.90005874633789, | |
| "learning_rate": 0.0002943547094188377, | |
| "loss": 82.091015625, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.021, | |
| "grad_norm": 13.979220390319824, | |
| "learning_rate": 0.0002942945891783567, | |
| "loss": 78.61309814453125, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.0212, | |
| "grad_norm": 12.40916919708252, | |
| "learning_rate": 0.0002942344689378757, | |
| "loss": 77.57515258789063, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.0214, | |
| "grad_norm": 10.719722747802734, | |
| "learning_rate": 0.00029417434869739476, | |
| "loss": 81.308154296875, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.0216, | |
| "grad_norm": 11.862334251403809, | |
| "learning_rate": 0.0002941142284569138, | |
| "loss": 82.37334594726562, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.0218, | |
| "grad_norm": 9.369874954223633, | |
| "learning_rate": 0.00029405410821643286, | |
| "loss": 83.06602783203125, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.022, | |
| "grad_norm": 12.45842456817627, | |
| "learning_rate": 0.00029399398797595185, | |
| "loss": 80.74660034179688, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.0222, | |
| "grad_norm": 10.802011489868164, | |
| "learning_rate": 0.0002939338677354709, | |
| "loss": 82.18253784179687, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.0224, | |
| "grad_norm": 11.504124641418457, | |
| "learning_rate": 0.00029387374749498995, | |
| "loss": 82.32182006835937, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.0226, | |
| "grad_norm": 11.662162780761719, | |
| "learning_rate": 0.000293813627254509, | |
| "loss": 77.90712890625, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.0228, | |
| "grad_norm": 10.139030456542969, | |
| "learning_rate": 0.00029375350701402804, | |
| "loss": 80.47349853515625, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.023, | |
| "grad_norm": 10.677655220031738, | |
| "learning_rate": 0.0002936933867735471, | |
| "loss": 83.250830078125, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.0232, | |
| "grad_norm": 9.329009056091309, | |
| "learning_rate": 0.00029363326653306614, | |
| "loss": 78.31179809570312, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.0234, | |
| "grad_norm": 11.546579360961914, | |
| "learning_rate": 0.00029357314629258513, | |
| "loss": 84.429248046875, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.0236, | |
| "grad_norm": 11.815690040588379, | |
| "learning_rate": 0.0002935130260521042, | |
| "loss": 81.21365966796876, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.0238, | |
| "grad_norm": 11.184410095214844, | |
| "learning_rate": 0.0002934529058116232, | |
| "loss": 79.05919189453125, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.024, | |
| "grad_norm": 10.736798286437988, | |
| "learning_rate": 0.0002933927855711423, | |
| "loss": 80.73649291992187, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.0242, | |
| "grad_norm": 8.631206512451172, | |
| "learning_rate": 0.00029333266533066127, | |
| "loss": 78.77828979492188, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.0244, | |
| "grad_norm": 10.169127464294434, | |
| "learning_rate": 0.0002932725450901803, | |
| "loss": 75.32427978515625, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.0246, | |
| "grad_norm": 9.112273216247559, | |
| "learning_rate": 0.00029321242484969936, | |
| "loss": 80.11078491210938, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.0248, | |
| "grad_norm": 12.80979061126709, | |
| "learning_rate": 0.0002931523046092184, | |
| "loss": 80.26668090820313, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.025, | |
| "grad_norm": 11.88176155090332, | |
| "learning_rate": 0.00029309218436873746, | |
| "loss": 76.81950073242187, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.0252, | |
| "grad_norm": 9.650444984436035, | |
| "learning_rate": 0.0002930320641282565, | |
| "loss": 79.194091796875, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.0254, | |
| "grad_norm": 14.309748649597168, | |
| "learning_rate": 0.00029297194388777555, | |
| "loss": 76.17477416992188, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.0256, | |
| "grad_norm": 8.881438255310059, | |
| "learning_rate": 0.00029291182364729455, | |
| "loss": 76.45478515625, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.0258, | |
| "grad_norm": 13.313039779663086, | |
| "learning_rate": 0.0002928517034068136, | |
| "loss": 82.49783325195312, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.026, | |
| "grad_norm": 10.125815391540527, | |
| "learning_rate": 0.00029279158316633264, | |
| "loss": 74.025732421875, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.0262, | |
| "grad_norm": 9.924642562866211, | |
| "learning_rate": 0.0002927314629258517, | |
| "loss": 78.94208374023438, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.0264, | |
| "grad_norm": 12.754880905151367, | |
| "learning_rate": 0.0002926713426853707, | |
| "loss": 77.15728759765625, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.0266, | |
| "grad_norm": 10.190311431884766, | |
| "learning_rate": 0.0002926112224448898, | |
| "loss": 80.74267578125, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.0268, | |
| "grad_norm": 11.177680969238281, | |
| "learning_rate": 0.0002925511022044088, | |
| "loss": 76.56298828125, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.027, | |
| "grad_norm": 10.974754333496094, | |
| "learning_rate": 0.00029249098196392783, | |
| "loss": 77.54933471679688, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.0272, | |
| "grad_norm": 10.333001136779785, | |
| "learning_rate": 0.0002924308617234469, | |
| "loss": 76.95223999023438, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.0274, | |
| "grad_norm": 9.6028470993042, | |
| "learning_rate": 0.0002923707414829659, | |
| "loss": 76.2347900390625, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.0276, | |
| "grad_norm": 9.229351997375488, | |
| "learning_rate": 0.00029231062124248497, | |
| "loss": 84.37387084960938, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.0278, | |
| "grad_norm": 11.785066604614258, | |
| "learning_rate": 0.00029225050100200396, | |
| "loss": 77.95558471679688, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.028, | |
| "grad_norm": 8.809196472167969, | |
| "learning_rate": 0.000292190380761523, | |
| "loss": 75.076611328125, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.0282, | |
| "grad_norm": 13.894006729125977, | |
| "learning_rate": 0.00029213026052104206, | |
| "loss": 74.74369506835937, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.0284, | |
| "grad_norm": 11.996317863464355, | |
| "learning_rate": 0.0002920701402805611, | |
| "loss": 80.37234497070312, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.0286, | |
| "grad_norm": 9.478863716125488, | |
| "learning_rate": 0.00029201002004008015, | |
| "loss": 76.234619140625, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.0288, | |
| "grad_norm": 11.88571834564209, | |
| "learning_rate": 0.0002919498997995992, | |
| "loss": 82.56802368164062, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.029, | |
| "grad_norm": 10.63763427734375, | |
| "learning_rate": 0.0002918897795591182, | |
| "loss": 80.0512939453125, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.0292, | |
| "grad_norm": 12.671412467956543, | |
| "learning_rate": 0.00029182965931863724, | |
| "loss": 76.4797607421875, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.0294, | |
| "grad_norm": 11.89295482635498, | |
| "learning_rate": 0.0002917695390781563, | |
| "loss": 81.70416259765625, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.0296, | |
| "grad_norm": 10.384812355041504, | |
| "learning_rate": 0.00029170941883767534, | |
| "loss": 76.416650390625, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.0298, | |
| "grad_norm": 12.619583129882812, | |
| "learning_rate": 0.00029164929859719433, | |
| "loss": 82.743701171875, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.03, | |
| "grad_norm": 10.555590629577637, | |
| "learning_rate": 0.0002915891783567134, | |
| "loss": 77.63518676757812, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.0002, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00029152905811623243, | |
| "loss": 107136583467008.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 1.0004, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0002914689378757515, | |
| "loss": 3583383070310.4, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 1.0006, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0002914088176352705, | |
| "loss": 36528589478297.6, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 1.0008, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00029134869739478957, | |
| "loss": 1132657744281.6, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 1.001, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0002912885771543086, | |
| "loss": 9138627379.2, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 1.0012, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0002912284569138276, | |
| "loss": 1681122891975884.8, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 1.0014, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00029116833667334666, | |
| "loss": 929300570596966.4, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 1.0016, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0002911082164328657, | |
| "loss": 9330961573478.4, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 1.0018, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00029104809619238476, | |
| "loss": 63892658271027.2, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 1.002, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00029098797595190375, | |
| "loss": 3103321489408.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 1.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002909278557114228, | |
| "loss": 95.5510498046875, | |
| "step": 1610 | |
| }, | |
| { | |
| "epoch": 1.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00029086773547094184, | |
| "loss": 98.69436645507812, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 1.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002908076152304609, | |
| "loss": 99.0325439453125, | |
| "step": 1630 | |
| }, | |
| { | |
| "epoch": 1.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00029074749498997994, | |
| "loss": 97.31904296875, | |
| "step": 1640 | |
| }, | |
| { | |
| "epoch": 1.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000290687374749499, | |
| "loss": 98.40114135742188, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 1.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00029062725450901803, | |
| "loss": 99.31021728515626, | |
| "step": 1660 | |
| }, | |
| { | |
| "epoch": 1.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00029056713426853703, | |
| "loss": 99.4878662109375, | |
| "step": 1670 | |
| }, | |
| { | |
| "epoch": 1.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002905070140280561, | |
| "loss": 99.3884521484375, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 1.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002904468937875751, | |
| "loss": 99.46731567382812, | |
| "step": 1690 | |
| }, | |
| { | |
| "epoch": 1.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00029038677354709417, | |
| "loss": 99.4464599609375, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 2.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00029032665330661317, | |
| "loss": 104.66427001953124, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 2.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002902665330661322, | |
| "loss": 98.24152221679688, | |
| "step": 1720 | |
| }, | |
| { | |
| "epoch": 2.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002902064128256513, | |
| "loss": 99.4651123046875, | |
| "step": 1730 | |
| }, | |
| { | |
| "epoch": 2.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002901462925851703, | |
| "loss": 99.3810546875, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 2.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00029008617234468936, | |
| "loss": 96.20846557617188, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 2.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002900260521042084, | |
| "loss": 99.44166259765625, | |
| "step": 1760 | |
| }, | |
| { | |
| "epoch": 2.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028996593186372745, | |
| "loss": 99.43170776367188, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 2.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028990581162324644, | |
| "loss": 99.37213134765625, | |
| "step": 1780 | |
| }, | |
| { | |
| "epoch": 2.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002898456913827655, | |
| "loss": 99.51829223632812, | |
| "step": 1790 | |
| }, | |
| { | |
| "epoch": 2.0019, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028978557114228454, | |
| "loss": 99.27789306640625, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 2.0021, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002897254509018036, | |
| "loss": 99.44300537109375, | |
| "step": 1810 | |
| }, | |
| { | |
| "epoch": 3.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028966533066132264, | |
| "loss": 103.58494873046875, | |
| "step": 1820 | |
| }, | |
| { | |
| "epoch": 3.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002896052104208417, | |
| "loss": 99.35955810546875, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 3.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028954509018036073, | |
| "loss": 99.25761108398437, | |
| "step": 1840 | |
| }, | |
| { | |
| "epoch": 3.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002894849699398797, | |
| "loss": 97.34839477539063, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 3.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028942484969939877, | |
| "loss": 98.359326171875, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 3.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002893647294589178, | |
| "loss": 99.25703735351563, | |
| "step": 1870 | |
| }, | |
| { | |
| "epoch": 3.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028930460921843687, | |
| "loss": 99.42723388671875, | |
| "step": 1880 | |
| }, | |
| { | |
| "epoch": 3.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028924448897795586, | |
| "loss": 99.32404174804688, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 3.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002891843687374749, | |
| "loss": 99.3990966796875, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 3.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028912424849699396, | |
| "loss": 99.39078369140626, | |
| "step": 1910 | |
| }, | |
| { | |
| "epoch": 4.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000289064128256513, | |
| "loss": 104.5905517578125, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 4.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028900400801603205, | |
| "loss": 98.17286987304688, | |
| "step": 1930 | |
| }, | |
| { | |
| "epoch": 4.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002889438877755511, | |
| "loss": 99.40567016601562, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 4.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028888376753507015, | |
| "loss": 99.32139892578125, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 4.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028882364729458914, | |
| "loss": 96.15136108398437, | |
| "step": 1960 | |
| }, | |
| { | |
| "epoch": 4.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002887635270541082, | |
| "loss": 99.3803466796875, | |
| "step": 1970 | |
| }, | |
| { | |
| "epoch": 4.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028870340681362724, | |
| "loss": 99.37009887695312, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 4.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002886432865731463, | |
| "loss": 99.310498046875, | |
| "step": 1990 | |
| }, | |
| { | |
| "epoch": 4.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002885831663326653, | |
| "loss": 99.45986938476562, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 4.0019, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002885230460921843, | |
| "loss": 99.21234741210938, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 4.0021, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028846292585170337, | |
| "loss": 99.381591796875, | |
| "step": 2020 | |
| }, | |
| { | |
| "epoch": 5.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002884028056112224, | |
| "loss": 103.5211669921875, | |
| "step": 2030 | |
| }, | |
| { | |
| "epoch": 5.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028834268537074147, | |
| "loss": 99.30160522460938, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 5.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002882825651302605, | |
| "loss": 99.195703125, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 5.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002882224448897795, | |
| "loss": 97.29168090820312, | |
| "step": 2060 | |
| }, | |
| { | |
| "epoch": 5.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028816232464929856, | |
| "loss": 98.30964965820313, | |
| "step": 2070 | |
| }, | |
| { | |
| "epoch": 5.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002881022044088176, | |
| "loss": 99.19823608398437, | |
| "step": 2080 | |
| }, | |
| { | |
| "epoch": 5.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028804208416833665, | |
| "loss": 99.3675048828125, | |
| "step": 2090 | |
| }, | |
| { | |
| "epoch": 5.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002879819639278557, | |
| "loss": 99.27457275390626, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 5.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002879218436873747, | |
| "loss": 99.3427490234375, | |
| "step": 2110 | |
| }, | |
| { | |
| "epoch": 5.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002878617234468938, | |
| "loss": 99.33101806640624, | |
| "step": 2120 | |
| }, | |
| { | |
| "epoch": 6.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002878016032064128, | |
| "loss": 104.52410888671875, | |
| "step": 2130 | |
| }, | |
| { | |
| "epoch": 6.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028774148296593184, | |
| "loss": 98.11661376953126, | |
| "step": 2140 | |
| }, | |
| { | |
| "epoch": 6.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002876813627254509, | |
| "loss": 99.35023193359375, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 6.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028762124248496993, | |
| "loss": 99.27654418945312, | |
| "step": 2160 | |
| }, | |
| { | |
| "epoch": 6.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002875611222444889, | |
| "loss": 96.09561767578126, | |
| "step": 2170 | |
| }, | |
| { | |
| "epoch": 6.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000287501002004008, | |
| "loss": 99.32379760742188, | |
| "step": 2180 | |
| }, | |
| { | |
| "epoch": 6.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000287440881763527, | |
| "loss": 99.31390991210938, | |
| "step": 2190 | |
| }, | |
| { | |
| "epoch": 6.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028738076152304607, | |
| "loss": 99.25233764648438, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 6.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002873206412825651, | |
| "loss": 99.400146484375, | |
| "step": 2210 | |
| }, | |
| { | |
| "epoch": 6.0019, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028726052104208416, | |
| "loss": 99.16478271484375, | |
| "step": 2220 | |
| }, | |
| { | |
| "epoch": 6.0021, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002872004008016032, | |
| "loss": 99.3350830078125, | |
| "step": 2230 | |
| }, | |
| { | |
| "epoch": 7.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002871402805611222, | |
| "loss": 103.46038818359375, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 7.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028708016032064125, | |
| "loss": 99.24920043945312, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 7.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002870200400801603, | |
| "loss": 99.14209594726563, | |
| "step": 2260 | |
| }, | |
| { | |
| "epoch": 7.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028695991983967935, | |
| "loss": 97.23970336914063, | |
| "step": 2270 | |
| }, | |
| { | |
| "epoch": 7.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028689979959919834, | |
| "loss": 98.25855712890625, | |
| "step": 2280 | |
| }, | |
| { | |
| "epoch": 7.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002868396793587174, | |
| "loss": 99.14596557617188, | |
| "step": 2290 | |
| }, | |
| { | |
| "epoch": 7.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028677955911823644, | |
| "loss": 99.317333984375, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 7.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002867194388777555, | |
| "loss": 99.22235107421875, | |
| "step": 2310 | |
| }, | |
| { | |
| "epoch": 7.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028665931863727453, | |
| "loss": 99.2902587890625, | |
| "step": 2320 | |
| }, | |
| { | |
| "epoch": 7.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002865991983967936, | |
| "loss": 99.27511596679688, | |
| "step": 2330 | |
| }, | |
| { | |
| "epoch": 8.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028653907815631263, | |
| "loss": 104.4739990234375, | |
| "step": 2340 | |
| }, | |
| { | |
| "epoch": 8.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002864789579158316, | |
| "loss": 98.07261352539062, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 8.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028641883767535067, | |
| "loss": 99.2950439453125, | |
| "step": 2360 | |
| }, | |
| { | |
| "epoch": 8.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002863587174348697, | |
| "loss": 99.22308959960938, | |
| "step": 2370 | |
| }, | |
| { | |
| "epoch": 8.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028629859719438876, | |
| "loss": 96.060498046875, | |
| "step": 2380 | |
| }, | |
| { | |
| "epoch": 8.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028623847695390776, | |
| "loss": 99.27498168945313, | |
| "step": 2390 | |
| }, | |
| { | |
| "epoch": 8.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002861783567134268, | |
| "loss": 99.27508544921875, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 8.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002861182364729459, | |
| "loss": 99.20576782226563, | |
| "step": 2410 | |
| }, | |
| { | |
| "epoch": 8.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002860581162324649, | |
| "loss": 99.35106811523437, | |
| "step": 2420 | |
| }, | |
| { | |
| "epoch": 8.0019, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028599799599198395, | |
| "loss": 99.11838989257812, | |
| "step": 2430 | |
| }, | |
| { | |
| "epoch": 8.0021, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000285937875751503, | |
| "loss": 99.290185546875, | |
| "step": 2440 | |
| }, | |
| { | |
| "epoch": 9.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028587775551102204, | |
| "loss": 103.40933837890626, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 9.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028581763527054104, | |
| "loss": 99.20323486328125, | |
| "step": 2460 | |
| }, | |
| { | |
| "epoch": 9.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002857575150300601, | |
| "loss": 99.10476684570312, | |
| "step": 2470 | |
| }, | |
| { | |
| "epoch": 9.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028569739478957913, | |
| "loss": 97.20264282226563, | |
| "step": 2480 | |
| }, | |
| { | |
| "epoch": 9.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002856372745490982, | |
| "loss": 98.21160278320312, | |
| "step": 2490 | |
| }, | |
| { | |
| "epoch": 9.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002855771543086172, | |
| "loss": 99.10530395507813, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 9.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002855170340681363, | |
| "loss": 99.27515258789063, | |
| "step": 2510 | |
| }, | |
| { | |
| "epoch": 9.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002854569138276553, | |
| "loss": 99.17865600585938, | |
| "step": 2520 | |
| }, | |
| { | |
| "epoch": 9.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002853967935871743, | |
| "loss": 99.24905395507812, | |
| "step": 2530 | |
| }, | |
| { | |
| "epoch": 9.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028533667334669336, | |
| "loss": 99.2433837890625, | |
| "step": 2540 | |
| }, | |
| { | |
| "epoch": 10.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002852765531062124, | |
| "loss": 104.4260498046875, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 10.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028521643286573146, | |
| "loss": 98.03045043945312, | |
| "step": 2560 | |
| }, | |
| { | |
| "epoch": 10.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028515631262525045, | |
| "loss": 99.26333618164062, | |
| "step": 2570 | |
| }, | |
| { | |
| "epoch": 10.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002850961923847695, | |
| "loss": 99.18395385742187, | |
| "step": 2580 | |
| }, | |
| { | |
| "epoch": 10.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028503607214428855, | |
| "loss": 96.02274169921876, | |
| "step": 2590 | |
| }, | |
| { | |
| "epoch": 10.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002849759519038076, | |
| "loss": 99.23676147460938, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 10.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028491583166332664, | |
| "loss": 99.226318359375, | |
| "step": 2610 | |
| }, | |
| { | |
| "epoch": 10.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002848557114228457, | |
| "loss": 99.171044921875, | |
| "step": 2620 | |
| }, | |
| { | |
| "epoch": 10.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028479559118236474, | |
| "loss": 99.31712036132812, | |
| "step": 2630 | |
| }, | |
| { | |
| "epoch": 10.0019, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028473547094188373, | |
| "loss": 99.08142700195313, | |
| "step": 2640 | |
| }, | |
| { | |
| "epoch": 10.0021, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002846753507014028, | |
| "loss": 99.24673461914062, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 11.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028461523046092183, | |
| "loss": 103.37125244140626, | |
| "step": 2660 | |
| }, | |
| { | |
| "epoch": 11.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002845551102204409, | |
| "loss": 99.16270141601562, | |
| "step": 2670 | |
| }, | |
| { | |
| "epoch": 11.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028449498997995987, | |
| "loss": 99.06387329101562, | |
| "step": 2680 | |
| }, | |
| { | |
| "epoch": 11.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002844348697394789, | |
| "loss": 97.17066040039063, | |
| "step": 2690 | |
| }, | |
| { | |
| "epoch": 11.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028437474949899797, | |
| "loss": 98.17435302734376, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 11.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000284314629258517, | |
| "loss": 99.06696166992188, | |
| "step": 2710 | |
| }, | |
| { | |
| "epoch": 11.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028425450901803606, | |
| "loss": 99.23809814453125, | |
| "step": 2720 | |
| }, | |
| { | |
| "epoch": 11.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002841943887775551, | |
| "loss": 99.14588623046875, | |
| "step": 2730 | |
| }, | |
| { | |
| "epoch": 11.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002841342685370741, | |
| "loss": 99.21581420898437, | |
| "step": 2740 | |
| }, | |
| { | |
| "epoch": 11.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028407414829659315, | |
| "loss": 99.2086181640625, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 12.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002840140280561122, | |
| "loss": 104.3935546875, | |
| "step": 2760 | |
| }, | |
| { | |
| "epoch": 12.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028395390781563125, | |
| "loss": 97.99188842773438, | |
| "step": 2770 | |
| }, | |
| { | |
| "epoch": 12.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002838937875751503, | |
| "loss": 99.22097778320312, | |
| "step": 2780 | |
| }, | |
| { | |
| "epoch": 12.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002838336673346693, | |
| "loss": 99.151953125, | |
| "step": 2790 | |
| }, | |
| { | |
| "epoch": 12.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028377354709418833, | |
| "loss": 95.98749389648438, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 12.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002837134268537074, | |
| "loss": 99.2070556640625, | |
| "step": 2810 | |
| }, | |
| { | |
| "epoch": 12.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028365330661322643, | |
| "loss": 99.2055419921875, | |
| "step": 2820 | |
| }, | |
| { | |
| "epoch": 12.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002835931863727455, | |
| "loss": 99.14091186523437, | |
| "step": 2830 | |
| }, | |
| { | |
| "epoch": 12.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002835330661322645, | |
| "loss": 99.283544921875, | |
| "step": 2840 | |
| }, | |
| { | |
| "epoch": 12.0019, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002834729458917835, | |
| "loss": 99.05504150390625, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 12.0021, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028341282565130257, | |
| "loss": 99.22215576171875, | |
| "step": 2860 | |
| }, | |
| { | |
| "epoch": 13.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002833527054108216, | |
| "loss": 103.33685302734375, | |
| "step": 2870 | |
| }, | |
| { | |
| "epoch": 13.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028329258517034066, | |
| "loss": 99.140380859375, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 13.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028323246492985965, | |
| "loss": 99.0400634765625, | |
| "step": 2890 | |
| }, | |
| { | |
| "epoch": 13.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002831723446893787, | |
| "loss": 97.14813842773438, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 13.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002831122244488978, | |
| "loss": 98.15328979492188, | |
| "step": 2910 | |
| }, | |
| { | |
| "epoch": 13.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002830521042084168, | |
| "loss": 99.04591674804688, | |
| "step": 2920 | |
| }, | |
| { | |
| "epoch": 13.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028299198396793585, | |
| "loss": 99.20752563476563, | |
| "step": 2930 | |
| }, | |
| { | |
| "epoch": 13.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002829318637274549, | |
| "loss": 99.11998291015625, | |
| "step": 2940 | |
| }, | |
| { | |
| "epoch": 13.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028287174348697394, | |
| "loss": 99.19060668945312, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 13.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028281162324649293, | |
| "loss": 99.18587036132813, | |
| "step": 2960 | |
| }, | |
| { | |
| "epoch": 14.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000282751503006012, | |
| "loss": 104.3642578125, | |
| "step": 2970 | |
| }, | |
| { | |
| "epoch": 14.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028269138276553103, | |
| "loss": 97.97385864257812, | |
| "step": 2980 | |
| }, | |
| { | |
| "epoch": 14.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002826312625250501, | |
| "loss": 99.20270385742188, | |
| "step": 2990 | |
| }, | |
| { | |
| "epoch": 14.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002825711422845691, | |
| "loss": 99.12491455078126, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 14.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028251102204408817, | |
| "loss": 95.97457275390624, | |
| "step": 3010 | |
| }, | |
| { | |
| "epoch": 14.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002824509018036072, | |
| "loss": 99.18565673828125, | |
| "step": 3020 | |
| }, | |
| { | |
| "epoch": 14.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002823907815631262, | |
| "loss": 99.17833251953125, | |
| "step": 3030 | |
| }, | |
| { | |
| "epoch": 14.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028233066132264526, | |
| "loss": 99.11763305664063, | |
| "step": 3040 | |
| }, | |
| { | |
| "epoch": 14.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002822705410821643, | |
| "loss": 99.26400146484374, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 14.0019, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028221042084168336, | |
| "loss": 99.02830200195312, | |
| "step": 3060 | |
| }, | |
| { | |
| "epoch": 14.0021, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028215030060120235, | |
| "loss": 99.20048217773437, | |
| "step": 3070 | |
| }, | |
| { | |
| "epoch": 15.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002820901803607214, | |
| "loss": 103.31695556640625, | |
| "step": 3080 | |
| }, | |
| { | |
| "epoch": 15.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028203006012024045, | |
| "loss": 99.11974487304687, | |
| "step": 3090 | |
| }, | |
| { | |
| "epoch": 15.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002819699398797595, | |
| "loss": 99.01674194335938, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 15.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028190981963927854, | |
| "loss": 97.12745361328125, | |
| "step": 3110 | |
| }, | |
| { | |
| "epoch": 15.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002818496993987976, | |
| "loss": 98.1295654296875, | |
| "step": 3120 | |
| }, | |
| { | |
| "epoch": 15.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028178957915831664, | |
| "loss": 99.0256591796875, | |
| "step": 3130 | |
| }, | |
| { | |
| "epoch": 15.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028172945891783563, | |
| "loss": 99.1876220703125, | |
| "step": 3140 | |
| }, | |
| { | |
| "epoch": 15.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002816693386773547, | |
| "loss": 99.0940673828125, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 15.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002816092184368737, | |
| "loss": 99.16301879882812, | |
| "step": 3160 | |
| }, | |
| { | |
| "epoch": 15.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002815490981963928, | |
| "loss": 99.16691284179687, | |
| "step": 3170 | |
| }, | |
| { | |
| "epoch": 16.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028148897795591177, | |
| "loss": 104.3411865234375, | |
| "step": 3180 | |
| }, | |
| { | |
| "epoch": 16.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002814288577154308, | |
| "loss": 97.95174560546874, | |
| "step": 3190 | |
| }, | |
| { | |
| "epoch": 16.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002813687374749499, | |
| "loss": 99.18150024414062, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 16.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002813086172344689, | |
| "loss": 99.10928344726562, | |
| "step": 3210 | |
| }, | |
| { | |
| "epoch": 16.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028124849699398796, | |
| "loss": 95.95228881835938, | |
| "step": 3220 | |
| }, | |
| { | |
| "epoch": 16.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000281188376753507, | |
| "loss": 99.16500244140624, | |
| "step": 3230 | |
| }, | |
| { | |
| "epoch": 16.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028112825651302605, | |
| "loss": 99.16441040039062, | |
| "step": 3240 | |
| }, | |
| { | |
| "epoch": 16.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028106813627254505, | |
| "loss": 99.10928955078126, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 16.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002810080160320641, | |
| "loss": 99.24561157226563, | |
| "step": 3260 | |
| }, | |
| { | |
| "epoch": 16.0019, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028094789579158314, | |
| "loss": 99.01414184570312, | |
| "step": 3270 | |
| }, | |
| { | |
| "epoch": 16.0021, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002808877755511022, | |
| "loss": 99.175, | |
| "step": 3280 | |
| }, | |
| { | |
| "epoch": 17.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002808276553106212, | |
| "loss": 103.296435546875, | |
| "step": 3290 | |
| }, | |
| { | |
| "epoch": 17.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002807675350701403, | |
| "loss": 99.10460205078125, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 17.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002807074148296593, | |
| "loss": 99.00741577148438, | |
| "step": 3310 | |
| }, | |
| { | |
| "epoch": 17.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002806472945891783, | |
| "loss": 97.1107177734375, | |
| "step": 3320 | |
| }, | |
| { | |
| "epoch": 17.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002805871743486974, | |
| "loss": 98.12017211914062, | |
| "step": 3330 | |
| }, | |
| { | |
| "epoch": 17.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002805270541082164, | |
| "loss": 99.01578979492187, | |
| "step": 3340 | |
| }, | |
| { | |
| "epoch": 17.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028046693386773547, | |
| "loss": 99.17923583984376, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 17.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028040681362725446, | |
| "loss": 99.08976440429687, | |
| "step": 3360 | |
| }, | |
| { | |
| "epoch": 17.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002803466933867735, | |
| "loss": 99.15631103515625, | |
| "step": 3370 | |
| }, | |
| { | |
| "epoch": 17.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028028657314629256, | |
| "loss": 99.15965576171875, | |
| "step": 3380 | |
| }, | |
| { | |
| "epoch": 18.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002802264529058116, | |
| "loss": 104.33367919921875, | |
| "step": 3390 | |
| }, | |
| { | |
| "epoch": 18.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00028016633266533065, | |
| "loss": 97.9498779296875, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 18.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002801062124248497, | |
| "loss": 99.17077026367187, | |
| "step": 3410 | |
| }, | |
| { | |
| "epoch": 18.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002800460921843687, | |
| "loss": 99.10169677734375, | |
| "step": 3420 | |
| }, | |
| { | |
| "epoch": 18.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027998597194388774, | |
| "loss": 95.9587158203125, | |
| "step": 3430 | |
| }, | |
| { | |
| "epoch": 18.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002799258517034068, | |
| "loss": 99.152587890625, | |
| "step": 3440 | |
| }, | |
| { | |
| "epoch": 18.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027986573146292584, | |
| "loss": 99.15311889648437, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 18.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002798056112224449, | |
| "loss": 99.09374389648437, | |
| "step": 3460 | |
| }, | |
| { | |
| "epoch": 18.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002797454909819639, | |
| "loss": 99.24362182617188, | |
| "step": 3470 | |
| }, | |
| { | |
| "epoch": 18.0019, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002796853707414829, | |
| "loss": 99.01097412109375, | |
| "step": 3480 | |
| }, | |
| { | |
| "epoch": 18.0021, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000279625250501002, | |
| "loss": 99.16884155273438, | |
| "step": 3490 | |
| }, | |
| { | |
| "epoch": 19.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000279565130260521, | |
| "loss": 103.30040283203125, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 19.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027950501002004007, | |
| "loss": 99.10455932617188, | |
| "step": 3510 | |
| }, | |
| { | |
| "epoch": 19.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002794448897795591, | |
| "loss": 98.99957275390625, | |
| "step": 3520 | |
| }, | |
| { | |
| "epoch": 19.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002793847695390781, | |
| "loss": 97.1145751953125, | |
| "step": 3530 | |
| }, | |
| { | |
| "epoch": 19.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027932464929859716, | |
| "loss": 98.1151123046875, | |
| "step": 3540 | |
| }, | |
| { | |
| "epoch": 19.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002792645290581162, | |
| "loss": 99.0079833984375, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 19.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027920440881763525, | |
| "loss": 99.1750732421875, | |
| "step": 3560 | |
| }, | |
| { | |
| "epoch": 19.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027914428857715425, | |
| "loss": 99.08978271484375, | |
| "step": 3570 | |
| }, | |
| { | |
| "epoch": 19.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002790841683366733, | |
| "loss": 99.1601806640625, | |
| "step": 3580 | |
| }, | |
| { | |
| "epoch": 19.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002790240480961924, | |
| "loss": 99.15270385742187, | |
| "step": 3590 | |
| }, | |
| { | |
| "epoch": 20.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002789639278557114, | |
| "loss": 104.329833984375, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 20.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027890380761523044, | |
| "loss": 97.94336547851563, | |
| "step": 3610 | |
| }, | |
| { | |
| "epoch": 20.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002788436873747495, | |
| "loss": 99.16564331054687, | |
| "step": 3620 | |
| }, | |
| { | |
| "epoch": 20.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027878356713426853, | |
| "loss": 99.0989990234375, | |
| "step": 3630 | |
| }, | |
| { | |
| "epoch": 20.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027872344689378753, | |
| "loss": 95.96222534179688, | |
| "step": 3640 | |
| }, | |
| { | |
| "epoch": 20.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002786633266533066, | |
| "loss": 99.14838256835938, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 20.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002786032064128256, | |
| "loss": 99.150390625, | |
| "step": 3660 | |
| }, | |
| { | |
| "epoch": 20.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027854308617234467, | |
| "loss": 99.0933837890625, | |
| "step": 3670 | |
| }, | |
| { | |
| "epoch": 20.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027848296593186366, | |
| "loss": 99.23428955078126, | |
| "step": 3680 | |
| }, | |
| { | |
| "epoch": 20.0019, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027842284569138277, | |
| "loss": 99.016259765625, | |
| "step": 3690 | |
| }, | |
| { | |
| "epoch": 20.0021, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002783627254509018, | |
| "loss": 99.17916870117188, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 21.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002783026052104208, | |
| "loss": 103.300244140625, | |
| "step": 3710 | |
| }, | |
| { | |
| "epoch": 21.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027824248496993985, | |
| "loss": 99.09691162109375, | |
| "step": 3720 | |
| }, | |
| { | |
| "epoch": 21.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002781823647294589, | |
| "loss": 99.0059326171875, | |
| "step": 3730 | |
| }, | |
| { | |
| "epoch": 21.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027812224448897795, | |
| "loss": 97.12512817382813, | |
| "step": 3740 | |
| }, | |
| { | |
| "epoch": 21.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027806212424849694, | |
| "loss": 98.11283569335937, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 21.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000278002004008016, | |
| "loss": 99.00809326171876, | |
| "step": 3760 | |
| }, | |
| { | |
| "epoch": 21.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027794188376753504, | |
| "loss": 99.1753662109375, | |
| "step": 3770 | |
| }, | |
| { | |
| "epoch": 21.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002778817635270541, | |
| "loss": 99.08587036132812, | |
| "step": 3780 | |
| }, | |
| { | |
| "epoch": 21.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027782164328657313, | |
| "loss": 99.15759887695313, | |
| "step": 3790 | |
| }, | |
| { | |
| "epoch": 21.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002777615230460922, | |
| "loss": 99.1598388671875, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 22.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027770140280561123, | |
| "loss": 104.32696533203125, | |
| "step": 3810 | |
| }, | |
| { | |
| "epoch": 22.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002776412825651302, | |
| "loss": 97.95064697265624, | |
| "step": 3820 | |
| }, | |
| { | |
| "epoch": 22.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027758116232464927, | |
| "loss": 99.16984252929687, | |
| "step": 3830 | |
| }, | |
| { | |
| "epoch": 22.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002775210420841683, | |
| "loss": 99.10538940429687, | |
| "step": 3840 | |
| }, | |
| { | |
| "epoch": 22.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027746092184368737, | |
| "loss": 95.97281494140626, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 22.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027740080160320636, | |
| "loss": 99.15985717773438, | |
| "step": 3860 | |
| }, | |
| { | |
| "epoch": 22.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002773406813627254, | |
| "loss": 99.1621826171875, | |
| "step": 3870 | |
| }, | |
| { | |
| "epoch": 22.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027728056112224446, | |
| "loss": 99.09931030273438, | |
| "step": 3880 | |
| }, | |
| { | |
| "epoch": 22.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002772204408817635, | |
| "loss": 99.2378662109375, | |
| "step": 3890 | |
| }, | |
| { | |
| "epoch": 22.0019, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027716032064128255, | |
| "loss": 99.01779174804688, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 22.0021, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002771002004008016, | |
| "loss": 99.17398071289062, | |
| "step": 3910 | |
| }, | |
| { | |
| "epoch": 23.0002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027704008016032065, | |
| "loss": 103.30367431640624, | |
| "step": 3920 | |
| }, | |
| { | |
| "epoch": 23.0004, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027697995991983964, | |
| "loss": 99.10546875, | |
| "step": 3930 | |
| }, | |
| { | |
| "epoch": 23.0006, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002769198396793587, | |
| "loss": 99.01024780273437, | |
| "step": 3940 | |
| }, | |
| { | |
| "epoch": 23.0008, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027685971943887773, | |
| "loss": 97.12568969726563, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 23.001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002767995991983968, | |
| "loss": 98.12539672851562, | |
| "step": 3960 | |
| }, | |
| { | |
| "epoch": 23.0012, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002767394789579158, | |
| "loss": 99.0267578125, | |
| "step": 3970 | |
| }, | |
| { | |
| "epoch": 23.0014, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002766793587174348, | |
| "loss": 99.17804565429688, | |
| "step": 3980 | |
| }, | |
| { | |
| "epoch": 23.0016, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027661923847695387, | |
| "loss": 99.09422607421875, | |
| "step": 3990 | |
| }, | |
| { | |
| "epoch": 23.0018, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002765591182364729, | |
| "loss": 99.1647705078125, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 23.002, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027649899799599197, | |
| "loss": 99.16721801757812, | |
| "step": 4010 | |
| }, | |
| { | |
| "epoch": 24.0001, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.000276438877755511, | |
| "loss": 104.34345703125, | |
| "step": 4020 | |
| }, | |
| { | |
| "epoch": 24.0003, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027637875751503006, | |
| "loss": 97.96480712890624, | |
| "step": 4030 | |
| }, | |
| { | |
| "epoch": 24.0005, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027631863727454906, | |
| "loss": 99.17822265625, | |
| "step": 4040 | |
| }, | |
| { | |
| "epoch": 24.0007, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002762585170340681, | |
| "loss": 99.11380615234376, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 24.0009, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027619839679358715, | |
| "loss": 95.99370727539062, | |
| "step": 4060 | |
| }, | |
| { | |
| "epoch": 24.0011, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002761382765531062, | |
| "loss": 99.17216186523437, | |
| "step": 4070 | |
| }, | |
| { | |
| "epoch": 24.0013, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.00027607815631262525, | |
| "loss": 99.17363891601562, | |
| "step": 4080 | |
| }, | |
| { | |
| "epoch": 24.0015, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002760180360721443, | |
| "loss": 99.11543579101563, | |
| "step": 4090 | |
| }, | |
| { | |
| "epoch": 24.0017, | |
| "grad_norm": 0.0, | |
| "learning_rate": 0.0002759579158316633, | |
| "loss": 99.25667724609374, | |
| "step": 4100 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 50000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 9223372036854775807, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.832807993700608e+16, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |