Text Generation
Transformers
Safetensors
English
qwen2
arduino
esp32
raspberry-pi
micropython
circuitpython
embedded-systems
code-generation
lora
continued-pretraining
conversational
text-generation-inference
Instructions to use EzioDevio/ArduinoLLM-7B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use EzioDevio/ArduinoLLM-7B with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="EzioDevio/ArduinoLLM-7B") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("EzioDevio/ArduinoLLM-7B") model = AutoModelForCausalLM.from_pretrained("EzioDevio/ArduinoLLM-7B", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=256) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use EzioDevio/ArduinoLLM-7B with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "EzioDevio/ArduinoLLM-7B" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "EzioDevio/ArduinoLLM-7B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/EzioDevio/ArduinoLLM-7B
- SGLang
How to use EzioDevio/ArduinoLLM-7B with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "EzioDevio/ArduinoLLM-7B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "EzioDevio/ArduinoLLM-7B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "EzioDevio/ArduinoLLM-7B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "EzioDevio/ArduinoLLM-7B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use EzioDevio/ArduinoLLM-7B with Docker Model Runner:
docker model run hf.co/EzioDevio/ArduinoLLM-7B
Download checkpoint-282/trainer_state.json from EzioDevio/ArduinoLLM-7B: direct link, hf CLI and curl.
- Browser
- Download file 53 kB
-
https://huggingface.co/EzioDevio/ArduinoLLM-7B/resolve/main/checkpoint-282/trainer_state.json
- Command line
-
hf download hf://EzioDevio/ArduinoLLM-7B/checkpoint-282/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/EzioDevio/ArduinoLLM-7B/resolve/main/checkpoint-282/trainer_state.json
53 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 282, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.010723860589812333, | |
| "grad_norm": 0.09956473857164383, | |
| "learning_rate": 0.0, | |
| "loss": 1.187880516052246, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.021447721179624665, | |
| "grad_norm": 0.11292029917240143, | |
| "learning_rate": 6.896551724137932e-06, | |
| "loss": 1.2154676914215088, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.032171581769437, | |
| "grad_norm": 0.10153086483478546, | |
| "learning_rate": 1.3793103448275863e-05, | |
| "loss": 1.0373685359954834, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.04289544235924933, | |
| "grad_norm": 0.11490683257579803, | |
| "learning_rate": 2.0689655172413793e-05, | |
| "loss": 1.1642744541168213, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.05361930294906166, | |
| "grad_norm": 0.10738470405340195, | |
| "learning_rate": 2.7586206896551727e-05, | |
| "loss": 1.0547881126403809, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.064343163538874, | |
| "grad_norm": 0.09365780651569366, | |
| "learning_rate": 3.4482758620689657e-05, | |
| "loss": 0.9747384190559387, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.07506702412868632, | |
| "grad_norm": 0.11804107576608658, | |
| "learning_rate": 4.1379310344827587e-05, | |
| "loss": 1.1494673490524292, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.08579088471849866, | |
| "grad_norm": 0.1242947056889534, | |
| "learning_rate": 4.827586206896552e-05, | |
| "loss": 1.1914423704147339, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.09651474530831099, | |
| "grad_norm": 0.11152593791484833, | |
| "learning_rate": 5.517241379310345e-05, | |
| "loss": 0.9928394556045532, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.10723860589812333, | |
| "grad_norm": 0.11541841924190521, | |
| "learning_rate": 6.206896551724138e-05, | |
| "loss": 0.9315593242645264, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.11796246648793565, | |
| "grad_norm": 0.11834950000047684, | |
| "learning_rate": 6.896551724137931e-05, | |
| "loss": 0.8903577327728271, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.128686327077748, | |
| "grad_norm": 0.14892849326133728, | |
| "learning_rate": 7.586206896551724e-05, | |
| "loss": 1.0821267366409302, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.13941018766756033, | |
| "grad_norm": 0.1506800651550293, | |
| "learning_rate": 8.275862068965517e-05, | |
| "loss": 1.0795198678970337, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.15013404825737264, | |
| "grad_norm": 0.14844302833080292, | |
| "learning_rate": 8.96551724137931e-05, | |
| "loss": 1.026419758796692, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.16085790884718498, | |
| "grad_norm": 0.16847245395183563, | |
| "learning_rate": 9.655172413793105e-05, | |
| "loss": 1.0807701349258423, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.17158176943699732, | |
| "grad_norm": 0.1590828001499176, | |
| "learning_rate": 0.00010344827586206898, | |
| "loss": 0.9547437429428101, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.18230563002680966, | |
| "grad_norm": 0.1714753657579422, | |
| "learning_rate": 0.0001103448275862069, | |
| "loss": 0.9339712858200073, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.19302949061662197, | |
| "grad_norm": 0.17293080687522888, | |
| "learning_rate": 0.00011724137931034482, | |
| "loss": 0.9700860977172852, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.2037533512064343, | |
| "grad_norm": 0.18182949721813202, | |
| "learning_rate": 0.00012413793103448277, | |
| "loss": 0.9788463115692139, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.21447721179624665, | |
| "grad_norm": 0.14979304373264313, | |
| "learning_rate": 0.00013103448275862068, | |
| "loss": 0.7673980593681335, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.225201072386059, | |
| "grad_norm": 0.1847337931394577, | |
| "learning_rate": 0.00013793103448275863, | |
| "loss": 0.8736073970794678, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.2359249329758713, | |
| "grad_norm": 0.1613779366016388, | |
| "learning_rate": 0.00014482758620689657, | |
| "loss": 0.7171751260757446, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.24664879356568364, | |
| "grad_norm": 0.20078714191913605, | |
| "learning_rate": 0.00015172413793103449, | |
| "loss": 0.8132349848747253, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.257372654155496, | |
| "grad_norm": 0.23513053357601166, | |
| "learning_rate": 0.00015862068965517243, | |
| "loss": 0.767032265663147, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.2680965147453083, | |
| "grad_norm": 0.264248788356781, | |
| "learning_rate": 0.00016551724137931035, | |
| "loss": 0.9374470114707947, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.27882037533512066, | |
| "grad_norm": 0.23587241768836975, | |
| "learning_rate": 0.00017241379310344826, | |
| "loss": 0.85521000623703, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.289544235924933, | |
| "grad_norm": 0.2163752019405365, | |
| "learning_rate": 0.0001793103448275862, | |
| "loss": 0.685062050819397, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.3002680965147453, | |
| "grad_norm": 0.23211570084095, | |
| "learning_rate": 0.00018620689655172415, | |
| "loss": 0.7995907068252563, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.3109919571045576, | |
| "grad_norm": 0.28809505701065063, | |
| "learning_rate": 0.0001931034482758621, | |
| "loss": 0.7216339111328125, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.32171581769436997, | |
| "grad_norm": 0.306933730840683, | |
| "learning_rate": 0.0002, | |
| "loss": 0.7865221500396729, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.3324396782841823, | |
| "grad_norm": 0.23336660861968994, | |
| "learning_rate": 0.00019920948616600792, | |
| "loss": 0.5897479057312012, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.34316353887399464, | |
| "grad_norm": 0.2930724024772644, | |
| "learning_rate": 0.00019841897233201583, | |
| "loss": 0.7502959966659546, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.353887399463807, | |
| "grad_norm": 0.2703939974308014, | |
| "learning_rate": 0.0001976284584980237, | |
| "loss": 0.659548282623291, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.3646112600536193, | |
| "grad_norm": 0.2767476737499237, | |
| "learning_rate": 0.00019683794466403162, | |
| "loss": 0.7053808569908142, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.3753351206434316, | |
| "grad_norm": 0.31025224924087524, | |
| "learning_rate": 0.00019604743083003953, | |
| "loss": 0.7129980325698853, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.38605898123324395, | |
| "grad_norm": 0.24430641531944275, | |
| "learning_rate": 0.00019525691699604744, | |
| "loss": 0.6667079925537109, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.3967828418230563, | |
| "grad_norm": 0.23834890127182007, | |
| "learning_rate": 0.00019446640316205535, | |
| "loss": 0.6788681149482727, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.4075067024128686, | |
| "grad_norm": 0.24645410478115082, | |
| "learning_rate": 0.00019367588932806324, | |
| "loss": 0.6573145389556885, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.41823056300268097, | |
| "grad_norm": 0.2453237771987915, | |
| "learning_rate": 0.00019288537549407115, | |
| "loss": 0.6146591901779175, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.4289544235924933, | |
| "grad_norm": 0.28095656633377075, | |
| "learning_rate": 0.00019209486166007906, | |
| "loss": 0.8814584612846375, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.43967828418230565, | |
| "grad_norm": 0.2434511035680771, | |
| "learning_rate": 0.00019130434782608697, | |
| "loss": 0.5752735137939453, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.450402144772118, | |
| "grad_norm": 0.2717647850513458, | |
| "learning_rate": 0.00019051383399209488, | |
| "loss": 0.7667861580848694, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.46112600536193027, | |
| "grad_norm": 0.2082528918981552, | |
| "learning_rate": 0.00018972332015810276, | |
| "loss": 0.4807273745536804, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.4718498659517426, | |
| "grad_norm": 0.2160937786102295, | |
| "learning_rate": 0.00018893280632411067, | |
| "loss": 0.6491277813911438, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.48257372654155495, | |
| "grad_norm": 0.2040049135684967, | |
| "learning_rate": 0.00018814229249011858, | |
| "loss": 0.5802018642425537, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.4932975871313673, | |
| "grad_norm": 0.2226921021938324, | |
| "learning_rate": 0.0001873517786561265, | |
| "loss": 0.5459230542182922, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.5040214477211796, | |
| "grad_norm": 0.2842342257499695, | |
| "learning_rate": 0.0001865612648221344, | |
| "loss": 0.6073319315910339, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.514745308310992, | |
| "grad_norm": 0.27150487899780273, | |
| "learning_rate": 0.00018577075098814228, | |
| "loss": 0.5493534803390503, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.5254691689008043, | |
| "grad_norm": 0.3216560482978821, | |
| "learning_rate": 0.0001849802371541502, | |
| "loss": 0.6763379573822021, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.5361930294906166, | |
| "grad_norm": 0.25345465540885925, | |
| "learning_rate": 0.0001841897233201581, | |
| "loss": 0.6142692565917969, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.546916890080429, | |
| "grad_norm": 0.2614583671092987, | |
| "learning_rate": 0.00018339920948616601, | |
| "loss": 0.5745217204093933, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.5576407506702413, | |
| "grad_norm": 0.2511961758136749, | |
| "learning_rate": 0.00018260869565217392, | |
| "loss": 0.5694140195846558, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.5683646112600537, | |
| "grad_norm": 0.2542041540145874, | |
| "learning_rate": 0.00018181818181818183, | |
| "loss": 0.58800208568573, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.579088471849866, | |
| "grad_norm": 0.3461075723171234, | |
| "learning_rate": 0.00018102766798418972, | |
| "loss": 0.6247663497924805, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.5898123324396782, | |
| "grad_norm": 0.30197465419769287, | |
| "learning_rate": 0.00018023715415019763, | |
| "loss": 0.5455595254898071, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.6005361930294906, | |
| "grad_norm": 0.28050318360328674, | |
| "learning_rate": 0.00017944664031620554, | |
| "loss": 0.5253524780273438, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.6112600536193029, | |
| "grad_norm": 0.25096285343170166, | |
| "learning_rate": 0.00017865612648221345, | |
| "loss": 0.47590434551239014, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.6219839142091153, | |
| "grad_norm": 0.24267607927322388, | |
| "learning_rate": 0.00017786561264822136, | |
| "loss": 0.533282995223999, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.6327077747989276, | |
| "grad_norm": 0.2805137038230896, | |
| "learning_rate": 0.00017707509881422927, | |
| "loss": 0.5030880570411682, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.6434316353887399, | |
| "grad_norm": 0.2617737650871277, | |
| "learning_rate": 0.00017628458498023718, | |
| "loss": 0.5744041800498962, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.6541554959785523, | |
| "grad_norm": 0.2669621407985687, | |
| "learning_rate": 0.0001754940711462451, | |
| "loss": 0.622750997543335, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.6648793565683646, | |
| "grad_norm": 0.3352331817150116, | |
| "learning_rate": 0.00017470355731225297, | |
| "loss": 0.6852260231971741, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.675603217158177, | |
| "grad_norm": 0.29469311237335205, | |
| "learning_rate": 0.00017391304347826088, | |
| "loss": 0.5582889318466187, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.6863270777479893, | |
| "grad_norm": 0.28165683150291443, | |
| "learning_rate": 0.0001731225296442688, | |
| "loss": 0.5959634184837341, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.6970509383378016, | |
| "grad_norm": 0.27457600831985474, | |
| "learning_rate": 0.0001723320158102767, | |
| "loss": 0.5719581842422485, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.707774798927614, | |
| "grad_norm": 0.25963717699050903, | |
| "learning_rate": 0.0001715415019762846, | |
| "loss": 0.5438885688781738, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.7184986595174263, | |
| "grad_norm": 0.2500856816768646, | |
| "learning_rate": 0.0001707509881422925, | |
| "loss": 0.4802711606025696, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.7292225201072386, | |
| "grad_norm": 0.33261388540267944, | |
| "learning_rate": 0.0001699604743083004, | |
| "loss": 0.5482622981071472, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.739946380697051, | |
| "grad_norm": 0.32809919118881226, | |
| "learning_rate": 0.00016916996047430832, | |
| "loss": 0.5493278503417969, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.7506702412868632, | |
| "grad_norm": 0.30052393674850464, | |
| "learning_rate": 0.00016837944664031623, | |
| "loss": 0.571394681930542, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.7613941018766756, | |
| "grad_norm": 0.2913955748081207, | |
| "learning_rate": 0.00016758893280632414, | |
| "loss": 0.5969862341880798, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.7721179624664879, | |
| "grad_norm": 0.29803213477134705, | |
| "learning_rate": 0.00016679841897233202, | |
| "loss": 0.5084568858146667, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.7828418230563002, | |
| "grad_norm": 0.25044989585876465, | |
| "learning_rate": 0.00016600790513833993, | |
| "loss": 0.4812390208244324, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.7935656836461126, | |
| "grad_norm": 0.2839549779891968, | |
| "learning_rate": 0.00016521739130434784, | |
| "loss": 0.5099290609359741, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.8042895442359249, | |
| "grad_norm": 0.3287063539028168, | |
| "learning_rate": 0.00016442687747035575, | |
| "loss": 0.6249513626098633, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.8150134048257373, | |
| "grad_norm": 0.26829907298088074, | |
| "learning_rate": 0.00016363636363636366, | |
| "loss": 0.5250214338302612, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.8257372654155496, | |
| "grad_norm": 0.29728639125823975, | |
| "learning_rate": 0.00016284584980237154, | |
| "loss": 0.5088335275650024, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.8364611260053619, | |
| "grad_norm": 0.33355408906936646, | |
| "learning_rate": 0.00016205533596837945, | |
| "loss": 0.5413830876350403, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.8471849865951743, | |
| "grad_norm": 0.29799699783325195, | |
| "learning_rate": 0.00016126482213438736, | |
| "loss": 0.5053578615188599, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.8579088471849866, | |
| "grad_norm": 0.3381000757217407, | |
| "learning_rate": 0.00016047430830039527, | |
| "loss": 0.5565289258956909, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.868632707774799, | |
| "grad_norm": 0.3973819315433502, | |
| "learning_rate": 0.00015968379446640318, | |
| "loss": 0.711586594581604, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.8793565683646113, | |
| "grad_norm": 0.40298908948898315, | |
| "learning_rate": 0.00015889328063241107, | |
| "loss": 0.6098839044570923, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.8900804289544236, | |
| "grad_norm": 0.30284130573272705, | |
| "learning_rate": 0.00015810276679841898, | |
| "loss": 0.4950011372566223, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.900804289544236, | |
| "grad_norm": 0.3403407037258148, | |
| "learning_rate": 0.00015731225296442689, | |
| "loss": 0.6132961511611938, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.9115281501340483, | |
| "grad_norm": 0.2879418432712555, | |
| "learning_rate": 0.0001565217391304348, | |
| "loss": 0.43917202949523926, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.9222520107238605, | |
| "grad_norm": 0.33686619997024536, | |
| "learning_rate": 0.00015573122529644268, | |
| "loss": 0.5142088532447815, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.9329758713136729, | |
| "grad_norm": 0.325030654668808, | |
| "learning_rate": 0.0001549407114624506, | |
| "loss": 0.5654577016830444, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.9436997319034852, | |
| "grad_norm": 0.33111876249313354, | |
| "learning_rate": 0.0001541501976284585, | |
| "loss": 0.5170025825500488, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.9544235924932976, | |
| "grad_norm": 0.27954328060150146, | |
| "learning_rate": 0.0001533596837944664, | |
| "loss": 0.4477558135986328, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.9651474530831099, | |
| "grad_norm": 0.32940271496772766, | |
| "learning_rate": 0.00015256916996047432, | |
| "loss": 0.5770028829574585, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.9758713136729222, | |
| "grad_norm": 0.2901531755924225, | |
| "learning_rate": 0.0001517786561264822, | |
| "loss": 0.5113964080810547, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.9865951742627346, | |
| "grad_norm": 0.35382938385009766, | |
| "learning_rate": 0.0001509881422924901, | |
| "loss": 0.5637056827545166, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.9973190348525469, | |
| "grad_norm": 0.3409457802772522, | |
| "learning_rate": 0.00015019762845849802, | |
| "loss": 0.6113982200622559, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.9160968661308289, | |
| "learning_rate": 0.00014940711462450593, | |
| "loss": 0.6628789901733398, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 1.0107238605898123, | |
| "grad_norm": 0.29314255714416504, | |
| "learning_rate": 0.00014861660079051384, | |
| "loss": 0.46988680958747864, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 1.0214477211796247, | |
| "grad_norm": 0.25285112857818604, | |
| "learning_rate": 0.00014782608695652173, | |
| "loss": 0.37834423780441284, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 1.032171581769437, | |
| "grad_norm": 0.333655446767807, | |
| "learning_rate": 0.00014703557312252964, | |
| "loss": 0.4831538498401642, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 1.0428954423592494, | |
| "grad_norm": 0.2649567127227783, | |
| "learning_rate": 0.00014624505928853755, | |
| "loss": 0.41907089948654175, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 1.0536193029490617, | |
| "grad_norm": 0.27437201142311096, | |
| "learning_rate": 0.00014545454545454546, | |
| "loss": 0.2983744144439697, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 1.064343163538874, | |
| "grad_norm": 0.3050195276737213, | |
| "learning_rate": 0.00014466403162055337, | |
| "loss": 0.3996342718601227, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.0750670241286864, | |
| "grad_norm": 0.31925857067108154, | |
| "learning_rate": 0.00014387351778656125, | |
| "loss": 0.5546276569366455, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 1.0857908847184987, | |
| "grad_norm": 0.32142284512519836, | |
| "learning_rate": 0.00014308300395256916, | |
| "loss": 0.4055824279785156, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 1.096514745308311, | |
| "grad_norm": 0.307692289352417, | |
| "learning_rate": 0.00014229249011857707, | |
| "loss": 0.3661179840564728, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 1.1072386058981234, | |
| "grad_norm": 0.3772393763065338, | |
| "learning_rate": 0.00014150197628458498, | |
| "loss": 0.33995968103408813, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 1.1179624664879357, | |
| "grad_norm": 0.33760136365890503, | |
| "learning_rate": 0.0001407114624505929, | |
| "loss": 0.3819088935852051, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 1.128686327077748, | |
| "grad_norm": 0.4074546694755554, | |
| "learning_rate": 0.0001399209486166008, | |
| "loss": 0.41713619232177734, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 1.1394101876675604, | |
| "grad_norm": 0.37227675318717957, | |
| "learning_rate": 0.0001391304347826087, | |
| "loss": 0.42982980608940125, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 1.1501340482573728, | |
| "grad_norm": 0.4107712209224701, | |
| "learning_rate": 0.00013833992094861662, | |
| "loss": 0.4299226403236389, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 1.160857908847185, | |
| "grad_norm": 0.5368478894233704, | |
| "learning_rate": 0.00013754940711462453, | |
| "loss": 0.5186800956726074, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 1.1715817694369974, | |
| "grad_norm": 0.45028287172317505, | |
| "learning_rate": 0.00013675889328063244, | |
| "loss": 0.5149720311164856, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 1.1823056300268098, | |
| "grad_norm": 0.34304189682006836, | |
| "learning_rate": 0.00013596837944664032, | |
| "loss": 0.375017374753952, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 1.193029490616622, | |
| "grad_norm": 0.32003459334373474, | |
| "learning_rate": 0.00013517786561264823, | |
| "loss": 0.34155839681625366, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 1.2037533512064342, | |
| "grad_norm": 0.3889811933040619, | |
| "learning_rate": 0.00013438735177865614, | |
| "loss": 0.40539929270744324, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 1.2144772117962466, | |
| "grad_norm": 0.3523079752922058, | |
| "learning_rate": 0.00013359683794466405, | |
| "loss": 0.458846777677536, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 1.225201072386059, | |
| "grad_norm": 0.37520793080329895, | |
| "learning_rate": 0.00013280632411067196, | |
| "loss": 0.39731982350349426, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 1.2359249329758712, | |
| "grad_norm": 0.4330201745033264, | |
| "learning_rate": 0.00013201581027667985, | |
| "loss": 0.5581794381141663, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 1.2466487935656836, | |
| "grad_norm": 0.3163258135318756, | |
| "learning_rate": 0.00013122529644268776, | |
| "loss": 0.3818089962005615, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 1.257372654155496, | |
| "grad_norm": 0.3622339069843292, | |
| "learning_rate": 0.00013043478260869567, | |
| "loss": 0.5328987240791321, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 1.2680965147453083, | |
| "grad_norm": 0.30175745487213135, | |
| "learning_rate": 0.00012964426877470358, | |
| "loss": 0.39232969284057617, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 1.2788203753351206, | |
| "grad_norm": 0.3683181703090668, | |
| "learning_rate": 0.0001288537549407115, | |
| "loss": 0.3934139013290405, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 1.289544235924933, | |
| "grad_norm": 0.3973405957221985, | |
| "learning_rate": 0.00012806324110671937, | |
| "loss": 0.43174073100090027, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 1.3002680965147453, | |
| "grad_norm": 0.33689525723457336, | |
| "learning_rate": 0.00012727272727272728, | |
| "loss": 0.38391372561454773, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 1.3109919571045576, | |
| "grad_norm": 0.3917376399040222, | |
| "learning_rate": 0.0001264822134387352, | |
| "loss": 0.505753219127655, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 1.32171581769437, | |
| "grad_norm": 0.44805291295051575, | |
| "learning_rate": 0.0001256916996047431, | |
| "loss": 0.39223286509513855, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 1.3324396782841823, | |
| "grad_norm": 0.41950568556785583, | |
| "learning_rate": 0.00012490118577075098, | |
| "loss": 0.4417312741279602, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 1.3431635388739946, | |
| "grad_norm": 0.36143216490745544, | |
| "learning_rate": 0.0001241106719367589, | |
| "loss": 0.3527093231678009, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 1.353887399463807, | |
| "grad_norm": 0.3897385895252228, | |
| "learning_rate": 0.0001233201581027668, | |
| "loss": 0.3796389698982239, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 1.3646112600536193, | |
| "grad_norm": 0.36867862939834595, | |
| "learning_rate": 0.00012252964426877472, | |
| "loss": 0.3496738374233246, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 1.3753351206434317, | |
| "grad_norm": 0.4386043846607208, | |
| "learning_rate": 0.00012173913043478263, | |
| "loss": 0.5254644751548767, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 1.386058981233244, | |
| "grad_norm": 0.40041038393974304, | |
| "learning_rate": 0.00012094861660079051, | |
| "loss": 0.4998672604560852, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 1.3967828418230563, | |
| "grad_norm": 0.4058981239795685, | |
| "learning_rate": 0.00012015810276679842, | |
| "loss": 0.358295202255249, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 1.4075067024128687, | |
| "grad_norm": 0.4888080656528473, | |
| "learning_rate": 0.00011936758893280633, | |
| "loss": 0.4625028073787689, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 1.418230563002681, | |
| "grad_norm": 0.43401890993118286, | |
| "learning_rate": 0.00011857707509881424, | |
| "loss": 0.4242851138114929, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 1.4289544235924934, | |
| "grad_norm": 0.4579969346523285, | |
| "learning_rate": 0.00011778656126482215, | |
| "loss": 0.37796008586883545, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 1.4396782841823057, | |
| "grad_norm": 0.4127224385738373, | |
| "learning_rate": 0.00011699604743083003, | |
| "loss": 0.38415277004241943, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 1.450402144772118, | |
| "grad_norm": 0.47420403361320496, | |
| "learning_rate": 0.00011620553359683794, | |
| "loss": 0.42805853486061096, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 1.4611260053619302, | |
| "grad_norm": 0.549434244632721, | |
| "learning_rate": 0.00011541501976284585, | |
| "loss": 0.449143648147583, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 1.4718498659517425, | |
| "grad_norm": 0.45274561643600464, | |
| "learning_rate": 0.00011462450592885376, | |
| "loss": 0.42617177963256836, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 1.4825737265415548, | |
| "grad_norm": 0.4037245213985443, | |
| "learning_rate": 0.00011383399209486167, | |
| "loss": 0.4060184955596924, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 1.4932975871313672, | |
| "grad_norm": 0.35869210958480835, | |
| "learning_rate": 0.00011304347826086956, | |
| "loss": 0.3349171280860901, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 1.5040214477211795, | |
| "grad_norm": 0.4207170903682709, | |
| "learning_rate": 0.00011225296442687747, | |
| "loss": 0.4263383448123932, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 1.5147453083109919, | |
| "grad_norm": 0.5284790992736816, | |
| "learning_rate": 0.00011146245059288538, | |
| "loss": 0.5672209858894348, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 1.5254691689008042, | |
| "grad_norm": 0.41607561707496643, | |
| "learning_rate": 0.00011067193675889329, | |
| "loss": 0.4448755979537964, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 1.5361930294906165, | |
| "grad_norm": 0.4201499819755554, | |
| "learning_rate": 0.0001098814229249012, | |
| "loss": 0.46206071972846985, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 1.5469168900804289, | |
| "grad_norm": 0.4577239155769348, | |
| "learning_rate": 0.00010909090909090909, | |
| "loss": 0.4559464454650879, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 1.5576407506702412, | |
| "grad_norm": 0.3478381931781769, | |
| "learning_rate": 0.000108300395256917, | |
| "loss": 0.3294685482978821, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 1.5683646112600536, | |
| "grad_norm": 0.4360603988170624, | |
| "learning_rate": 0.00010750988142292491, | |
| "loss": 0.3287108540534973, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 1.579088471849866, | |
| "grad_norm": 0.39799708127975464, | |
| "learning_rate": 0.00010671936758893282, | |
| "loss": 0.3988645374774933, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 1.5898123324396782, | |
| "grad_norm": 0.3618183732032776, | |
| "learning_rate": 0.00010592885375494073, | |
| "loss": 0.38425952196121216, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 1.6005361930294906, | |
| "grad_norm": 0.4565318524837494, | |
| "learning_rate": 0.00010513833992094862, | |
| "loss": 0.3619772493839264, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.611260053619303, | |
| "grad_norm": 0.3710864782333374, | |
| "learning_rate": 0.00010434782608695653, | |
| "loss": 0.34765082597732544, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 1.6219839142091153, | |
| "grad_norm": 0.43709254264831543, | |
| "learning_rate": 0.00010355731225296444, | |
| "loss": 0.36712560057640076, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 1.6327077747989276, | |
| "grad_norm": 0.41445794701576233, | |
| "learning_rate": 0.00010276679841897235, | |
| "loss": 0.46864867210388184, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 1.64343163538874, | |
| "grad_norm": 0.4972689747810364, | |
| "learning_rate": 0.00010197628458498026, | |
| "loss": 0.46844732761383057, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 1.6541554959785523, | |
| "grad_norm": 0.37691959738731384, | |
| "learning_rate": 0.00010118577075098814, | |
| "loss": 0.3644738793373108, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 1.6648793565683646, | |
| "grad_norm": 0.3355158269405365, | |
| "learning_rate": 0.00010039525691699605, | |
| "loss": 0.2941320538520813, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 1.675603217158177, | |
| "grad_norm": 0.47247281670570374, | |
| "learning_rate": 9.960474308300396e-05, | |
| "loss": 0.3141013979911804, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 1.6863270777479893, | |
| "grad_norm": 0.46272745728492737, | |
| "learning_rate": 9.881422924901186e-05, | |
| "loss": 0.36926206946372986, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 1.6970509383378016, | |
| "grad_norm": 0.38559988141059875, | |
| "learning_rate": 9.802371541501977e-05, | |
| "loss": 0.35696208477020264, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 1.707774798927614, | |
| "grad_norm": 0.380924791097641, | |
| "learning_rate": 9.723320158102768e-05, | |
| "loss": 0.3731119632720947, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 1.7184986595174263, | |
| "grad_norm": 0.3812347650527954, | |
| "learning_rate": 9.644268774703557e-05, | |
| "loss": 0.36795520782470703, | |
| "step": 161 | |
| }, | |
| { | |
| "epoch": 1.7292225201072386, | |
| "grad_norm": 0.42182034254074097, | |
| "learning_rate": 9.565217391304348e-05, | |
| "loss": 0.38642388582229614, | |
| "step": 162 | |
| }, | |
| { | |
| "epoch": 1.739946380697051, | |
| "grad_norm": 0.4464418292045593, | |
| "learning_rate": 9.486166007905138e-05, | |
| "loss": 0.3390141427516937, | |
| "step": 163 | |
| }, | |
| { | |
| "epoch": 1.7506702412868633, | |
| "grad_norm": 0.41914135217666626, | |
| "learning_rate": 9.407114624505929e-05, | |
| "loss": 0.3221234679222107, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 1.7613941018766757, | |
| "grad_norm": 0.478661447763443, | |
| "learning_rate": 9.32806324110672e-05, | |
| "loss": 0.5106721520423889, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 1.772117962466488, | |
| "grad_norm": 0.4210912585258484, | |
| "learning_rate": 9.24901185770751e-05, | |
| "loss": 0.38831913471221924, | |
| "step": 166 | |
| }, | |
| { | |
| "epoch": 1.7828418230563003, | |
| "grad_norm": 0.3871179223060608, | |
| "learning_rate": 9.169960474308301e-05, | |
| "loss": 0.34748589992523193, | |
| "step": 167 | |
| }, | |
| { | |
| "epoch": 1.7935656836461127, | |
| "grad_norm": 0.4435052275657654, | |
| "learning_rate": 9.090909090909092e-05, | |
| "loss": 0.48339927196502686, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 1.804289544235925, | |
| "grad_norm": 0.4627319276332855, | |
| "learning_rate": 9.011857707509881e-05, | |
| "loss": 0.4779326319694519, | |
| "step": 169 | |
| }, | |
| { | |
| "epoch": 1.8150134048257374, | |
| "grad_norm": 0.4093571603298187, | |
| "learning_rate": 8.932806324110672e-05, | |
| "loss": 0.3994932174682617, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 1.8257372654155497, | |
| "grad_norm": 0.3777295649051666, | |
| "learning_rate": 8.853754940711463e-05, | |
| "loss": 0.29758769273757935, | |
| "step": 171 | |
| }, | |
| { | |
| "epoch": 1.836461126005362, | |
| "grad_norm": 0.4444163143634796, | |
| "learning_rate": 8.774703557312254e-05, | |
| "loss": 0.5211812257766724, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 1.8471849865951744, | |
| "grad_norm": 0.44008299708366394, | |
| "learning_rate": 8.695652173913044e-05, | |
| "loss": 0.4367752969264984, | |
| "step": 173 | |
| }, | |
| { | |
| "epoch": 1.8579088471849867, | |
| "grad_norm": 0.3680829703807831, | |
| "learning_rate": 8.616600790513835e-05, | |
| "loss": 0.38142716884613037, | |
| "step": 174 | |
| }, | |
| { | |
| "epoch": 1.868632707774799, | |
| "grad_norm": 0.42378222942352295, | |
| "learning_rate": 8.537549407114625e-05, | |
| "loss": 0.3738633394241333, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 1.8793565683646114, | |
| "grad_norm": 0.447982519865036, | |
| "learning_rate": 8.458498023715416e-05, | |
| "loss": 0.3980375826358795, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 1.8900804289544237, | |
| "grad_norm": 0.4780956506729126, | |
| "learning_rate": 8.379446640316207e-05, | |
| "loss": 0.3593772053718567, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 1.900804289544236, | |
| "grad_norm": 0.4041815996170044, | |
| "learning_rate": 8.300395256916996e-05, | |
| "loss": 0.32343748211860657, | |
| "step": 178 | |
| }, | |
| { | |
| "epoch": 1.9115281501340484, | |
| "grad_norm": 0.40126705169677734, | |
| "learning_rate": 8.221343873517787e-05, | |
| "loss": 0.39796900749206543, | |
| "step": 179 | |
| }, | |
| { | |
| "epoch": 1.9222520107238605, | |
| "grad_norm": 0.4228574335575104, | |
| "learning_rate": 8.142292490118577e-05, | |
| "loss": 0.30352118611335754, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.9329758713136729, | |
| "grad_norm": 0.3965367078781128, | |
| "learning_rate": 8.063241106719368e-05, | |
| "loss": 0.4007437229156494, | |
| "step": 181 | |
| }, | |
| { | |
| "epoch": 1.9436997319034852, | |
| "grad_norm": 0.520819365978241, | |
| "learning_rate": 7.984189723320159e-05, | |
| "loss": 0.4561784863471985, | |
| "step": 182 | |
| }, | |
| { | |
| "epoch": 1.9544235924932976, | |
| "grad_norm": 0.4546199142932892, | |
| "learning_rate": 7.905138339920949e-05, | |
| "loss": 0.42645519971847534, | |
| "step": 183 | |
| }, | |
| { | |
| "epoch": 1.96514745308311, | |
| "grad_norm": 0.4249766170978546, | |
| "learning_rate": 7.82608695652174e-05, | |
| "loss": 0.40960007905960083, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 1.9758713136729222, | |
| "grad_norm": 0.43849310278892517, | |
| "learning_rate": 7.74703557312253e-05, | |
| "loss": 0.3888928294181824, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 1.9865951742627346, | |
| "grad_norm": 0.3805074095726013, | |
| "learning_rate": 7.66798418972332e-05, | |
| "loss": 0.33679670095443726, | |
| "step": 186 | |
| }, | |
| { | |
| "epoch": 1.997319034852547, | |
| "grad_norm": 0.3982532024383545, | |
| "learning_rate": 7.58893280632411e-05, | |
| "loss": 0.4251680374145508, | |
| "step": 187 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.8578111529350281, | |
| "learning_rate": 7.509881422924901e-05, | |
| "loss": 0.3112189769744873, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 2.0107238605898123, | |
| "grad_norm": 0.3796326518058777, | |
| "learning_rate": 7.430830039525692e-05, | |
| "loss": 0.3179461658000946, | |
| "step": 189 | |
| }, | |
| { | |
| "epoch": 2.0214477211796247, | |
| "grad_norm": 0.4111069440841675, | |
| "learning_rate": 7.351778656126482e-05, | |
| "loss": 0.2951521873474121, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 2.032171581769437, | |
| "grad_norm": 0.47031712532043457, | |
| "learning_rate": 7.272727272727273e-05, | |
| "loss": 0.356897234916687, | |
| "step": 191 | |
| }, | |
| { | |
| "epoch": 2.0428954423592494, | |
| "grad_norm": 0.42409181594848633, | |
| "learning_rate": 7.193675889328062e-05, | |
| "loss": 0.29118770360946655, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 2.0536193029490617, | |
| "grad_norm": 0.41851696372032166, | |
| "learning_rate": 7.114624505928854e-05, | |
| "loss": 0.28936752676963806, | |
| "step": 193 | |
| }, | |
| { | |
| "epoch": 2.064343163538874, | |
| "grad_norm": 0.4010869264602661, | |
| "learning_rate": 7.035573122529645e-05, | |
| "loss": 0.26238322257995605, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 2.0750670241286864, | |
| "grad_norm": 0.3862994313240051, | |
| "learning_rate": 6.956521739130436e-05, | |
| "loss": 0.27142423391342163, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 2.0857908847184987, | |
| "grad_norm": 0.4864669442176819, | |
| "learning_rate": 6.877470355731227e-05, | |
| "loss": 0.37142568826675415, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 2.096514745308311, | |
| "grad_norm": 0.4558348059654236, | |
| "learning_rate": 6.798418972332016e-05, | |
| "loss": 0.24382558465003967, | |
| "step": 197 | |
| }, | |
| { | |
| "epoch": 2.1072386058981234, | |
| "grad_norm": 0.4399399161338806, | |
| "learning_rate": 6.719367588932807e-05, | |
| "loss": 0.2435164749622345, | |
| "step": 198 | |
| }, | |
| { | |
| "epoch": 2.1179624664879357, | |
| "grad_norm": 0.4485020041465759, | |
| "learning_rate": 6.640316205533598e-05, | |
| "loss": 0.2527099549770355, | |
| "step": 199 | |
| }, | |
| { | |
| "epoch": 2.128686327077748, | |
| "grad_norm": 0.5087027549743652, | |
| "learning_rate": 6.561264822134388e-05, | |
| "loss": 0.2982422113418579, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 2.1394101876675604, | |
| "grad_norm": 0.48561012744903564, | |
| "learning_rate": 6.482213438735179e-05, | |
| "loss": 0.2485373616218567, | |
| "step": 201 | |
| }, | |
| { | |
| "epoch": 2.1501340482573728, | |
| "grad_norm": 0.5011835098266602, | |
| "learning_rate": 6.403162055335969e-05, | |
| "loss": 0.2464626431465149, | |
| "step": 202 | |
| }, | |
| { | |
| "epoch": 2.160857908847185, | |
| "grad_norm": 0.45680928230285645, | |
| "learning_rate": 6.32411067193676e-05, | |
| "loss": 0.2839566469192505, | |
| "step": 203 | |
| }, | |
| { | |
| "epoch": 2.1715817694369974, | |
| "grad_norm": 0.4385458528995514, | |
| "learning_rate": 6.245059288537549e-05, | |
| "loss": 0.23959431052207947, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 2.1823056300268098, | |
| "grad_norm": 0.43261128664016724, | |
| "learning_rate": 6.16600790513834e-05, | |
| "loss": 0.21801936626434326, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 2.193029490616622, | |
| "grad_norm": 0.4627765715122223, | |
| "learning_rate": 6.086956521739131e-05, | |
| "loss": 0.23210036754608154, | |
| "step": 206 | |
| }, | |
| { | |
| "epoch": 2.2037533512064345, | |
| "grad_norm": 0.502792477607727, | |
| "learning_rate": 6.007905138339921e-05, | |
| "loss": 0.2555053234100342, | |
| "step": 207 | |
| }, | |
| { | |
| "epoch": 2.214477211796247, | |
| "grad_norm": 0.49858319759368896, | |
| "learning_rate": 5.928853754940712e-05, | |
| "loss": 0.37681910395622253, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 2.225201072386059, | |
| "grad_norm": 0.5667821764945984, | |
| "learning_rate": 5.8498023715415016e-05, | |
| "loss": 0.31617334485054016, | |
| "step": 209 | |
| }, | |
| { | |
| "epoch": 2.2359249329758715, | |
| "grad_norm": 0.46932312846183777, | |
| "learning_rate": 5.7707509881422926e-05, | |
| "loss": 0.19316962361335754, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 2.246648793565684, | |
| "grad_norm": 0.6215251684188843, | |
| "learning_rate": 5.6916996047430836e-05, | |
| "loss": 0.3278288245201111, | |
| "step": 211 | |
| }, | |
| { | |
| "epoch": 2.257372654155496, | |
| "grad_norm": 0.5422892570495605, | |
| "learning_rate": 5.612648221343873e-05, | |
| "loss": 0.291220486164093, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 2.2680965147453085, | |
| "grad_norm": 0.5241540670394897, | |
| "learning_rate": 5.533596837944664e-05, | |
| "loss": 0.24275189638137817, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 2.278820375335121, | |
| "grad_norm": 0.49944326281547546, | |
| "learning_rate": 5.4545454545454546e-05, | |
| "loss": 0.34785425662994385, | |
| "step": 214 | |
| }, | |
| { | |
| "epoch": 2.289544235924933, | |
| "grad_norm": 0.43588748574256897, | |
| "learning_rate": 5.3754940711462456e-05, | |
| "loss": 0.2969186305999756, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 2.3002680965147455, | |
| "grad_norm": 0.6216847896575928, | |
| "learning_rate": 5.2964426877470366e-05, | |
| "loss": 0.39824792742729187, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 2.310991957104558, | |
| "grad_norm": 0.4306747615337372, | |
| "learning_rate": 5.217391304347826e-05, | |
| "loss": 0.2311907559633255, | |
| "step": 217 | |
| }, | |
| { | |
| "epoch": 2.32171581769437, | |
| "grad_norm": 0.40540629625320435, | |
| "learning_rate": 5.138339920948617e-05, | |
| "loss": 0.2750304937362671, | |
| "step": 218 | |
| }, | |
| { | |
| "epoch": 2.3324396782841825, | |
| "grad_norm": 0.4646793305873871, | |
| "learning_rate": 5.059288537549407e-05, | |
| "loss": 0.3514980673789978, | |
| "step": 219 | |
| }, | |
| { | |
| "epoch": 2.343163538873995, | |
| "grad_norm": 0.5125492215156555, | |
| "learning_rate": 4.980237154150198e-05, | |
| "loss": 0.2827247679233551, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 2.353887399463807, | |
| "grad_norm": 0.4126996099948883, | |
| "learning_rate": 4.901185770750988e-05, | |
| "loss": 0.28631478548049927, | |
| "step": 221 | |
| }, | |
| { | |
| "epoch": 2.3646112600536195, | |
| "grad_norm": 0.554176926612854, | |
| "learning_rate": 4.822134387351779e-05, | |
| "loss": 0.2757015824317932, | |
| "step": 222 | |
| }, | |
| { | |
| "epoch": 2.3753351206434314, | |
| "grad_norm": 0.498518168926239, | |
| "learning_rate": 4.743083003952569e-05, | |
| "loss": 0.4271239638328552, | |
| "step": 223 | |
| }, | |
| { | |
| "epoch": 2.386058981233244, | |
| "grad_norm": 0.48358744382858276, | |
| "learning_rate": 4.66403162055336e-05, | |
| "loss": 0.24824775755405426, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 2.396782841823056, | |
| "grad_norm": 0.4421731233596802, | |
| "learning_rate": 4.5849802371541504e-05, | |
| "loss": 0.24138133227825165, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 2.4075067024128685, | |
| "grad_norm": 0.5678989291191101, | |
| "learning_rate": 4.505928853754941e-05, | |
| "loss": 0.3733794689178467, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 2.418230563002681, | |
| "grad_norm": 0.3931693434715271, | |
| "learning_rate": 4.426877470355732e-05, | |
| "loss": 0.21732917428016663, | |
| "step": 227 | |
| }, | |
| { | |
| "epoch": 2.428954423592493, | |
| "grad_norm": 0.5858852863311768, | |
| "learning_rate": 4.347826086956522e-05, | |
| "loss": 0.27989453077316284, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 2.4396782841823055, | |
| "grad_norm": 0.563900887966156, | |
| "learning_rate": 4.2687747035573124e-05, | |
| "loss": 0.24179348349571228, | |
| "step": 229 | |
| }, | |
| { | |
| "epoch": 2.450402144772118, | |
| "grad_norm": 0.560583233833313, | |
| "learning_rate": 4.1897233201581034e-05, | |
| "loss": 0.32947486639022827, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 2.46112600536193, | |
| "grad_norm": 0.44924235343933105, | |
| "learning_rate": 4.110671936758894e-05, | |
| "loss": 0.22358451783657074, | |
| "step": 231 | |
| }, | |
| { | |
| "epoch": 2.4718498659517425, | |
| "grad_norm": 0.45432764291763306, | |
| "learning_rate": 4.031620553359684e-05, | |
| "loss": 0.27067574858665466, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 2.482573726541555, | |
| "grad_norm": 0.593735933303833, | |
| "learning_rate": 3.9525691699604744e-05, | |
| "loss": 0.2724727988243103, | |
| "step": 233 | |
| }, | |
| { | |
| "epoch": 2.493297587131367, | |
| "grad_norm": 0.4509212374687195, | |
| "learning_rate": 3.873517786561265e-05, | |
| "loss": 0.2286791056394577, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 2.5040214477211795, | |
| "grad_norm": 0.574708104133606, | |
| "learning_rate": 3.794466403162055e-05, | |
| "loss": 0.39047005772590637, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 2.514745308310992, | |
| "grad_norm": 0.4967159330844879, | |
| "learning_rate": 3.715415019762846e-05, | |
| "loss": 0.3607536852359772, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 2.525469168900804, | |
| "grad_norm": 0.5810816884040833, | |
| "learning_rate": 3.6363636363636364e-05, | |
| "loss": 0.28996798396110535, | |
| "step": 237 | |
| }, | |
| { | |
| "epoch": 2.5361930294906165, | |
| "grad_norm": 0.605388879776001, | |
| "learning_rate": 3.557312252964427e-05, | |
| "loss": 0.3083586096763611, | |
| "step": 238 | |
| }, | |
| { | |
| "epoch": 2.546916890080429, | |
| "grad_norm": 0.5502549409866333, | |
| "learning_rate": 3.478260869565218e-05, | |
| "loss": 0.26683732867240906, | |
| "step": 239 | |
| }, | |
| { | |
| "epoch": 2.557640750670241, | |
| "grad_norm": 0.5668724179267883, | |
| "learning_rate": 3.399209486166008e-05, | |
| "loss": 0.2840242385864258, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 2.5683646112600536, | |
| "grad_norm": 0.44743263721466064, | |
| "learning_rate": 3.320158102766799e-05, | |
| "loss": 0.2404075413942337, | |
| "step": 241 | |
| }, | |
| { | |
| "epoch": 2.579088471849866, | |
| "grad_norm": 0.7013267278671265, | |
| "learning_rate": 3.2411067193675894e-05, | |
| "loss": 0.3185945749282837, | |
| "step": 242 | |
| }, | |
| { | |
| "epoch": 2.5898123324396782, | |
| "grad_norm": 0.6694422364234924, | |
| "learning_rate": 3.16205533596838e-05, | |
| "loss": 0.28978461027145386, | |
| "step": 243 | |
| }, | |
| { | |
| "epoch": 2.6005361930294906, | |
| "grad_norm": 0.4603322446346283, | |
| "learning_rate": 3.08300395256917e-05, | |
| "loss": 0.2629821002483368, | |
| "step": 244 | |
| }, | |
| { | |
| "epoch": 2.611260053619303, | |
| "grad_norm": 0.5630055665969849, | |
| "learning_rate": 3.0039525691699605e-05, | |
| "loss": 0.2665753960609436, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 2.6219839142091153, | |
| "grad_norm": 0.3915822207927704, | |
| "learning_rate": 2.9249011857707508e-05, | |
| "loss": 0.2179432064294815, | |
| "step": 246 | |
| }, | |
| { | |
| "epoch": 2.6327077747989276, | |
| "grad_norm": 0.5798822045326233, | |
| "learning_rate": 2.8458498023715418e-05, | |
| "loss": 0.31813907623291016, | |
| "step": 247 | |
| }, | |
| { | |
| "epoch": 2.64343163538874, | |
| "grad_norm": 0.5073499083518982, | |
| "learning_rate": 2.766798418972332e-05, | |
| "loss": 0.2670523524284363, | |
| "step": 248 | |
| }, | |
| { | |
| "epoch": 2.6541554959785523, | |
| "grad_norm": 0.44620683789253235, | |
| "learning_rate": 2.6877470355731228e-05, | |
| "loss": 0.25869786739349365, | |
| "step": 249 | |
| }, | |
| { | |
| "epoch": 2.6648793565683646, | |
| "grad_norm": 0.5914870500564575, | |
| "learning_rate": 2.608695652173913e-05, | |
| "loss": 0.3205704391002655, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 2.675603217158177, | |
| "grad_norm": 0.5035210251808167, | |
| "learning_rate": 2.5296442687747035e-05, | |
| "loss": 0.2746676504611969, | |
| "step": 251 | |
| }, | |
| { | |
| "epoch": 2.6863270777479893, | |
| "grad_norm": 0.4630255103111267, | |
| "learning_rate": 2.450592885375494e-05, | |
| "loss": 0.262162446975708, | |
| "step": 252 | |
| }, | |
| { | |
| "epoch": 2.6970509383378016, | |
| "grad_norm": 0.5340390205383301, | |
| "learning_rate": 2.3715415019762845e-05, | |
| "loss": 0.22825723886489868, | |
| "step": 253 | |
| }, | |
| { | |
| "epoch": 2.707774798927614, | |
| "grad_norm": 0.555592954158783, | |
| "learning_rate": 2.2924901185770752e-05, | |
| "loss": 0.24794229865074158, | |
| "step": 254 | |
| }, | |
| { | |
| "epoch": 2.7184986595174263, | |
| "grad_norm": 0.4784729480743408, | |
| "learning_rate": 2.213438735177866e-05, | |
| "loss": 0.20105186104774475, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 2.7292225201072386, | |
| "grad_norm": 0.7181131839752197, | |
| "learning_rate": 2.1343873517786562e-05, | |
| "loss": 0.3564614951610565, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 2.739946380697051, | |
| "grad_norm": 0.4376419484615326, | |
| "learning_rate": 2.055335968379447e-05, | |
| "loss": 0.20554706454277039, | |
| "step": 257 | |
| }, | |
| { | |
| "epoch": 2.7506702412868633, | |
| "grad_norm": 0.5815340876579285, | |
| "learning_rate": 1.9762845849802372e-05, | |
| "loss": 0.2694174349308014, | |
| "step": 258 | |
| }, | |
| { | |
| "epoch": 2.7613941018766757, | |
| "grad_norm": 0.48075157403945923, | |
| "learning_rate": 1.8972332015810275e-05, | |
| "loss": 0.21963372826576233, | |
| "step": 259 | |
| }, | |
| { | |
| "epoch": 2.772117962466488, | |
| "grad_norm": 0.620573103427887, | |
| "learning_rate": 1.8181818181818182e-05, | |
| "loss": 0.3293127715587616, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 2.7828418230563003, | |
| "grad_norm": 0.5430031418800354, | |
| "learning_rate": 1.739130434782609e-05, | |
| "loss": 0.25511273741722107, | |
| "step": 261 | |
| }, | |
| { | |
| "epoch": 2.7935656836461127, | |
| "grad_norm": 0.6154038906097412, | |
| "learning_rate": 1.6600790513833996e-05, | |
| "loss": 0.28183019161224365, | |
| "step": 262 | |
| }, | |
| { | |
| "epoch": 2.804289544235925, | |
| "grad_norm": 0.5438246726989746, | |
| "learning_rate": 1.58102766798419e-05, | |
| "loss": 0.2609254717826843, | |
| "step": 263 | |
| }, | |
| { | |
| "epoch": 2.8150134048257374, | |
| "grad_norm": 0.671107828617096, | |
| "learning_rate": 1.5019762845849802e-05, | |
| "loss": 0.3069862723350525, | |
| "step": 264 | |
| }, | |
| { | |
| "epoch": 2.8257372654155497, | |
| "grad_norm": 0.5226935148239136, | |
| "learning_rate": 1.4229249011857709e-05, | |
| "loss": 0.2255355566740036, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 2.836461126005362, | |
| "grad_norm": 0.5719597339630127, | |
| "learning_rate": 1.3438735177865614e-05, | |
| "loss": 0.2844502329826355, | |
| "step": 266 | |
| }, | |
| { | |
| "epoch": 2.8471849865951744, | |
| "grad_norm": 0.5313884615898132, | |
| "learning_rate": 1.2648221343873517e-05, | |
| "loss": 0.3107653558254242, | |
| "step": 267 | |
| }, | |
| { | |
| "epoch": 2.8579088471849867, | |
| "grad_norm": 0.5169429183006287, | |
| "learning_rate": 1.1857707509881423e-05, | |
| "loss": 0.2877541184425354, | |
| "step": 268 | |
| }, | |
| { | |
| "epoch": 2.868632707774799, | |
| "grad_norm": 0.5085014700889587, | |
| "learning_rate": 1.106719367588933e-05, | |
| "loss": 0.21509462594985962, | |
| "step": 269 | |
| }, | |
| { | |
| "epoch": 2.8793565683646114, | |
| "grad_norm": 0.4762232005596161, | |
| "learning_rate": 1.0276679841897234e-05, | |
| "loss": 0.23946139216423035, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 2.8900804289544237, | |
| "grad_norm": 0.5875873565673828, | |
| "learning_rate": 9.486166007905138e-06, | |
| "loss": 0.288002073764801, | |
| "step": 271 | |
| }, | |
| { | |
| "epoch": 2.900804289544236, | |
| "grad_norm": 0.6287146210670471, | |
| "learning_rate": 8.695652173913044e-06, | |
| "loss": 0.28586676716804504, | |
| "step": 272 | |
| }, | |
| { | |
| "epoch": 2.9115281501340484, | |
| "grad_norm": 0.5751309990882874, | |
| "learning_rate": 7.90513833992095e-06, | |
| "loss": 0.26002803444862366, | |
| "step": 273 | |
| }, | |
| { | |
| "epoch": 2.9222520107238603, | |
| "grad_norm": 0.5319899916648865, | |
| "learning_rate": 7.1146245059288545e-06, | |
| "loss": 0.2816118597984314, | |
| "step": 274 | |
| }, | |
| { | |
| "epoch": 2.9329758713136727, | |
| "grad_norm": 0.580845057964325, | |
| "learning_rate": 6.324110671936759e-06, | |
| "loss": 0.2594989538192749, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 2.943699731903485, | |
| "grad_norm": 0.6090609431266785, | |
| "learning_rate": 5.533596837944665e-06, | |
| "loss": 0.30808189511299133, | |
| "step": 276 | |
| }, | |
| { | |
| "epoch": 2.9544235924932973, | |
| "grad_norm": 0.5708959698677063, | |
| "learning_rate": 4.743083003952569e-06, | |
| "loss": 0.3111344873905182, | |
| "step": 277 | |
| }, | |
| { | |
| "epoch": 2.9651474530831097, | |
| "grad_norm": 0.4517657458782196, | |
| "learning_rate": 3.952569169960475e-06, | |
| "loss": 0.244952991604805, | |
| "step": 278 | |
| }, | |
| { | |
| "epoch": 2.975871313672922, | |
| "grad_norm": 0.4914667308330536, | |
| "learning_rate": 3.1620553359683794e-06, | |
| "loss": 0.25697410106658936, | |
| "step": 279 | |
| }, | |
| { | |
| "epoch": 2.9865951742627344, | |
| "grad_norm": 0.5489192008972168, | |
| "learning_rate": 2.3715415019762844e-06, | |
| "loss": 0.2900347113609314, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 2.9973190348525467, | |
| "grad_norm": 0.5205079317092896, | |
| "learning_rate": 1.5810276679841897e-06, | |
| "loss": 0.2045833170413971, | |
| "step": 281 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 1.3801476955413818, | |
| "learning_rate": 7.905138339920948e-07, | |
| "loss": 0.26903223991394043, | |
| "step": 282 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 282, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.313385319070822e+16, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |