Instructions to use wefamm/aiAI_coder_V1.4B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use wefamm/aiAI_coder_V1.4B with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/root/autodl-tmp/Qwen3.5-4B-Thinking") model = PeftModel.from_pretrained(base_model, "wefamm/aiAI_coder_V1.4B") - Transformers
How to use wefamm/aiAI_coder_V1.4B with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="wefamm/aiAI_coder_V1.4B") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# pip install -U transformers accelerate # Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("wefamm/aiAI_coder_V1.4B", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use wefamm/aiAI_coder_V1.4B with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "wefamm/aiAI_coder_V1.4B" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "wefamm/aiAI_coder_V1.4B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/wefamm/aiAI_coder_V1.4B
- SGLang
How to use wefamm/aiAI_coder_V1.4B with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "wefamm/aiAI_coder_V1.4B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "wefamm/aiAI_coder_V1.4B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "wefamm/aiAI_coder_V1.4B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "wefamm/aiAI_coder_V1.4B", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use wefamm/aiAI_coder_V1.4B with Docker Model Runner:
docker model run hf.co/wefamm/aiAI_coder_V1.4B
Download trainer_state.json from wefamm/aiAI_coder_V1.4B: direct link, hf CLI and curl.
- Browser
- Download file 20.1 kB
-
https://huggingface.co/wefamm/aiAI_coder_V1.4B/resolve/main/trainer_state.json
- Command line
-
hf download hf://wefamm/aiAI_coder_V1.4B/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/wefamm/aiAI_coder_V1.4B/resolve/main/trainer_state.json
20.1 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 315, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.01591723040191007, | |
| "grad_norm": 0.5680273771286011, | |
| "learning_rate": 4.998010925565448e-05, | |
| "loss": 0.722562837600708, | |
| "num_input_tokens_seen": 18800, | |
| "step": 5, | |
| "train_runtime": 39.8867, | |
| "train_tokens_per_second": 471.335 | |
| }, | |
| { | |
| "epoch": 0.03183446080382014, | |
| "grad_norm": 0.5171770453453064, | |
| "learning_rate": 4.989935734988098e-05, | |
| "loss": 0.2945201873779297, | |
| "num_input_tokens_seen": 37088, | |
| "step": 10, | |
| "train_runtime": 77.9226, | |
| "train_tokens_per_second": 475.959 | |
| }, | |
| { | |
| "epoch": 0.0477516912057302, | |
| "grad_norm": 0.26242855191230774, | |
| "learning_rate": 4.975670171853926e-05, | |
| "loss": 0.17604056596755982, | |
| "num_input_tokens_seen": 55072, | |
| "step": 15, | |
| "train_runtime": 115.5379, | |
| "train_tokens_per_second": 476.657 | |
| }, | |
| { | |
| "epoch": 0.06366892160764027, | |
| "grad_norm": 0.31670883297920227, | |
| "learning_rate": 4.9552497026005974e-05, | |
| "loss": 0.11049227714538574, | |
| "num_input_tokens_seen": 73632, | |
| "step": 20, | |
| "train_runtime": 153.8933, | |
| "train_tokens_per_second": 478.461 | |
| }, | |
| { | |
| "epoch": 0.07958615200955034, | |
| "grad_norm": 0.34576132893562317, | |
| "learning_rate": 4.928725095732169e-05, | |
| "loss": 0.09105676412582397, | |
| "num_input_tokens_seen": 92480, | |
| "step": 25, | |
| "train_runtime": 191.9367, | |
| "train_tokens_per_second": 481.825 | |
| }, | |
| { | |
| "epoch": 0.0955033824114604, | |
| "grad_norm": 0.3635248839855194, | |
| "learning_rate": 4.896162295600589e-05, | |
| "loss": 0.10165604352951049, | |
| "num_input_tokens_seen": 112464, | |
| "step": 30, | |
| "train_runtime": 230.1162, | |
| "train_tokens_per_second": 488.727 | |
| }, | |
| { | |
| "epoch": 0.11142061281337047, | |
| "grad_norm": 0.1722227931022644, | |
| "learning_rate": 4.8576422584576514e-05, | |
| "loss": 0.06480070948600769, | |
| "num_input_tokens_seen": 130432, | |
| "step": 35, | |
| "train_runtime": 267.8665, | |
| "train_tokens_per_second": 486.929 | |
| }, | |
| { | |
| "epoch": 0.12733784321528055, | |
| "grad_norm": 1.0766868591308594, | |
| "learning_rate": 4.813260751184992e-05, | |
| "loss": 0.0799346923828125, | |
| "num_input_tokens_seen": 147776, | |
| "step": 40, | |
| "train_runtime": 305.7922, | |
| "train_tokens_per_second": 483.256 | |
| }, | |
| { | |
| "epoch": 0.14325507361719061, | |
| "grad_norm": 0.37821757793426514, | |
| "learning_rate": 4.763128113202537e-05, | |
| "loss": 0.11464616060256957, | |
| "num_input_tokens_seen": 166960, | |
| "step": 45, | |
| "train_runtime": 343.7831, | |
| "train_tokens_per_second": 485.655 | |
| }, | |
| { | |
| "epoch": 0.15917230401910068, | |
| "grad_norm": 0.19431939721107483, | |
| "learning_rate": 4.707368982147318e-05, | |
| "loss": 0.036882424354553224, | |
| "num_input_tokens_seen": 184656, | |
| "step": 50, | |
| "train_runtime": 381.8072, | |
| "train_tokens_per_second": 483.637 | |
| }, | |
| { | |
| "epoch": 0.17508953442101075, | |
| "grad_norm": 0.21434476971626282, | |
| "learning_rate": 4.6461219840046654e-05, | |
| "loss": 0.05201725363731384, | |
| "num_input_tokens_seen": 201600, | |
| "step": 55, | |
| "train_runtime": 419.5866, | |
| "train_tokens_per_second": 480.473 | |
| }, | |
| { | |
| "epoch": 0.1910067648229208, | |
| "grad_norm": 0.18612508475780487, | |
| "learning_rate": 4.579539388462173e-05, | |
| "loss": 0.02669697403907776, | |
| "num_input_tokens_seen": 219424, | |
| "step": 60, | |
| "train_runtime": 457.3463, | |
| "train_tokens_per_second": 479.776 | |
| }, | |
| { | |
| "epoch": 0.20692399522483088, | |
| "grad_norm": 0.24218444526195526, | |
| "learning_rate": 4.5077867303432546e-05, | |
| "loss": 0.04229282438755035, | |
| "num_input_tokens_seen": 237328, | |
| "step": 65, | |
| "train_runtime": 495.2157, | |
| "train_tokens_per_second": 479.242 | |
| }, | |
| { | |
| "epoch": 0.22284122562674094, | |
| "grad_norm": 0.17901809513568878, | |
| "learning_rate": 4.431042398061499e-05, | |
| "loss": 0.07041661143302917, | |
| "num_input_tokens_seen": 256384, | |
| "step": 70, | |
| "train_runtime": 533.4026, | |
| "train_tokens_per_second": 480.658 | |
| }, | |
| { | |
| "epoch": 0.238758456028651, | |
| "grad_norm": 0.14054907858371735, | |
| "learning_rate": 4.34949719011896e-05, | |
| "loss": 0.07058953046798706, | |
| "num_input_tokens_seen": 275760, | |
| "step": 75, | |
| "train_runtime": 571.426, | |
| "train_tokens_per_second": 482.582 | |
| }, | |
| { | |
| "epoch": 0.2546756864305611, | |
| "grad_norm": 0.3583498001098633, | |
| "learning_rate": 4.263353840751022e-05, | |
| "loss": 0.04999509751796723, | |
| "num_input_tokens_seen": 294912, | |
| "step": 80, | |
| "train_runtime": 609.9469, | |
| "train_tokens_per_second": 483.504 | |
| }, | |
| { | |
| "epoch": 0.27059291683247116, | |
| "grad_norm": 0.1266777068376541, | |
| "learning_rate": 4.172826515897146e-05, | |
| "loss": 0.023084172606468202, | |
| "num_input_tokens_seen": 312864, | |
| "step": 85, | |
| "train_runtime": 647.7469, | |
| "train_tokens_per_second": 483.004 | |
| }, | |
| { | |
| "epoch": 0.28651014723438123, | |
| "grad_norm": 0.19594649970531464, | |
| "learning_rate": 4.078140280750597e-05, | |
| "loss": 0.027250510454177857, | |
| "num_input_tokens_seen": 331824, | |
| "step": 90, | |
| "train_runtime": 685.5215, | |
| "train_tokens_per_second": 484.046 | |
| }, | |
| { | |
| "epoch": 0.3024273776362913, | |
| "grad_norm": 0.13930079340934753, | |
| "learning_rate": 3.9795305402109195e-05, | |
| "loss": 0.021656049787998198, | |
| "num_input_tokens_seen": 349248, | |
| "step": 95, | |
| "train_runtime": 723.3163, | |
| "train_tokens_per_second": 482.843 | |
| }, | |
| { | |
| "epoch": 0.31834460803820136, | |
| "grad_norm": 0.09126997739076614, | |
| "learning_rate": 3.8772424536302564e-05, | |
| "loss": 0.01830628514289856, | |
| "num_input_tokens_seen": 368960, | |
| "step": 100, | |
| "train_runtime": 761.4003, | |
| "train_tokens_per_second": 484.581 | |
| }, | |
| { | |
| "epoch": 0.3342618384401114, | |
| "grad_norm": 0.182926744222641, | |
| "learning_rate": 3.771530325308579e-05, | |
| "loss": 0.02595718502998352, | |
| "num_input_tokens_seen": 387312, | |
| "step": 105, | |
| "train_runtime": 799.8123, | |
| "train_tokens_per_second": 484.254 | |
| }, | |
| { | |
| "epoch": 0.3501790688420215, | |
| "grad_norm": 0.36613690853118896, | |
| "learning_rate": 3.662656972253127e-05, | |
| "loss": 0.03506172299385071, | |
| "num_input_tokens_seen": 405344, | |
| "step": 110, | |
| "train_runtime": 837.7863, | |
| "train_tokens_per_second": 483.827 | |
| }, | |
| { | |
| "epoch": 0.36609629924393156, | |
| "grad_norm": 0.09526461362838745, | |
| "learning_rate": 3.550893070773914e-05, | |
| "loss": 0.02651476263999939, | |
| "num_input_tokens_seen": 423760, | |
| "step": 115, | |
| "train_runtime": 876.0853, | |
| "train_tokens_per_second": 483.697 | |
| }, | |
| { | |
| "epoch": 0.3820135296458416, | |
| "grad_norm": 0.11225307732820511, | |
| "learning_rate": 3.436516483539781e-05, | |
| "loss": 0.019444951415061952, | |
| "num_input_tokens_seen": 442656, | |
| "step": 120, | |
| "train_runtime": 914.1546, | |
| "train_tokens_per_second": 484.224 | |
| }, | |
| { | |
| "epoch": 0.3979307600477517, | |
| "grad_norm": 0.2590346932411194, | |
| "learning_rate": 3.3198115687680115e-05, | |
| "loss": 0.03442502021789551, | |
| "num_input_tokens_seen": 460592, | |
| "step": 125, | |
| "train_runtime": 952.2049, | |
| "train_tokens_per_second": 483.711 | |
| }, | |
| { | |
| "epoch": 0.41384799044966175, | |
| "grad_norm": 0.2646162211894989, | |
| "learning_rate": 3.201068473265007e-05, | |
| "loss": 0.01847824454307556, | |
| "num_input_tokens_seen": 478992, | |
| "step": 130, | |
| "train_runtime": 990.3961, | |
| "train_tokens_per_second": 483.637 | |
| }, | |
| { | |
| "epoch": 0.4297652208515718, | |
| "grad_norm": 0.07014801353216171, | |
| "learning_rate": 3.0805824110756064e-05, | |
| "loss": 0.019786083698272706, | |
| "num_input_tokens_seen": 498912, | |
| "step": 135, | |
| "train_runtime": 1028.6211, | |
| "train_tokens_per_second": 485.03 | |
| }, | |
| { | |
| "epoch": 0.4456824512534819, | |
| "grad_norm": 0.07959283143281937, | |
| "learning_rate": 2.958652929534456e-05, | |
| "loss": 0.018977819383144377, | |
| "num_input_tokens_seen": 519280, | |
| "step": 140, | |
| "train_runtime": 1067.2867, | |
| "train_tokens_per_second": 486.542 | |
| }, | |
| { | |
| "epoch": 0.46159968165539195, | |
| "grad_norm": 0.06549182534217834, | |
| "learning_rate": 2.8355831645441388e-05, | |
| "loss": 0.013403435051441193, | |
| "num_input_tokens_seen": 537680, | |
| "step": 145, | |
| "train_runtime": 1105.3776, | |
| "train_tokens_per_second": 486.422 | |
| }, | |
| { | |
| "epoch": 0.477516912057302, | |
| "grad_norm": 0.1639358103275299, | |
| "learning_rate": 2.7116790869315582e-05, | |
| "loss": 0.016910630464553832, | |
| "num_input_tokens_seen": 556736, | |
| "step": 150, | |
| "train_runtime": 1143.7746, | |
| "train_tokens_per_second": 486.753 | |
| }, | |
| { | |
| "epoch": 0.4934341424592121, | |
| "grad_norm": 0.08243564516305923, | |
| "learning_rate": 2.587248741756253e-05, | |
| "loss": 0.026160690188407897, | |
| "num_input_tokens_seen": 574848, | |
| "step": 155, | |
| "train_runtime": 1181.63, | |
| "train_tokens_per_second": 486.487 | |
| }, | |
| { | |
| "epoch": 0.5093513728611222, | |
| "grad_norm": 0.03133539482951164, | |
| "learning_rate": 2.4626014824618415e-05, | |
| "loss": 0.014300110936164855, | |
| "num_input_tokens_seen": 595184, | |
| "step": 160, | |
| "train_runtime": 1220.1612, | |
| "train_tokens_per_second": 487.791 | |
| }, | |
| { | |
| "epoch": 0.5252686032630323, | |
| "grad_norm": 0.18265235424041748, | |
| "learning_rate": 2.3380472017746202e-05, | |
| "loss": 0.01761966049671173, | |
| "num_input_tokens_seen": 614240, | |
| "step": 165, | |
| "train_runtime": 1258.4126, | |
| "train_tokens_per_second": 488.107 | |
| }, | |
| { | |
| "epoch": 0.5411858336649423, | |
| "grad_norm": 0.3756831884384155, | |
| "learning_rate": 2.2138955612614207e-05, | |
| "loss": 0.02411275953054428, | |
| "num_input_tokens_seen": 634816, | |
| "step": 170, | |
| "train_runtime": 1297.0269, | |
| "train_tokens_per_second": 489.439 | |
| }, | |
| { | |
| "epoch": 0.5571030640668524, | |
| "grad_norm": 0.07078292965888977, | |
| "learning_rate": 2.090455221462156e-05, | |
| "loss": 0.02472930997610092, | |
| "num_input_tokens_seen": 653200, | |
| "step": 175, | |
| "train_runtime": 1334.905, | |
| "train_tokens_per_second": 489.323 | |
| }, | |
| { | |
| "epoch": 0.5730202944687625, | |
| "grad_norm": 0.08629941940307617, | |
| "learning_rate": 1.9680330745110954e-05, | |
| "loss": 0.0432051956653595, | |
| "num_input_tokens_seen": 671184, | |
| "step": 180, | |
| "train_runtime": 1372.8961, | |
| "train_tokens_per_second": 488.882 | |
| }, | |
| { | |
| "epoch": 0.5889375248706725, | |
| "grad_norm": 0.07341516762971878, | |
| "learning_rate": 1.8469334811546542e-05, | |
| "loss": 0.015968725085258484, | |
| "num_input_tokens_seen": 689328, | |
| "step": 185, | |
| "train_runtime": 1411.3785, | |
| "train_tokens_per_second": 488.408 | |
| }, | |
| { | |
| "epoch": 0.6048547552725826, | |
| "grad_norm": 0.042029932141304016, | |
| "learning_rate": 1.7274575140626318e-05, | |
| "loss": 0.020535998046398163, | |
| "num_input_tokens_seen": 707312, | |
| "step": 190, | |
| "train_runtime": 1449.4543, | |
| "train_tokens_per_second": 487.985 | |
| }, | |
| { | |
| "epoch": 0.6207719856744927, | |
| "grad_norm": 0.09814783930778503, | |
| "learning_rate": 1.609902209314108e-05, | |
| "loss": 0.017926733195781707, | |
| "num_input_tokens_seen": 726832, | |
| "step": 195, | |
| "train_runtime": 1487.8712, | |
| "train_tokens_per_second": 488.505 | |
| }, | |
| { | |
| "epoch": 0.6366892160764027, | |
| "grad_norm": 0.06525809317827225, | |
| "learning_rate": 1.4945598279189565e-05, | |
| "loss": 0.020335957407951355, | |
| "num_input_tokens_seen": 745184, | |
| "step": 200, | |
| "train_runtime": 1526.3493, | |
| "train_tokens_per_second": 488.213 | |
| }, | |
| { | |
| "epoch": 0.6526064464783128, | |
| "grad_norm": 0.11451390385627747, | |
| "learning_rate": 1.3817171292109183e-05, | |
| "loss": 0.012867054343223572, | |
| "num_input_tokens_seen": 764064, | |
| "step": 205, | |
| "train_runtime": 1565.3137, | |
| "train_tokens_per_second": 488.122 | |
| }, | |
| { | |
| "epoch": 0.6685236768802229, | |
| "grad_norm": 0.06963406503200531, | |
| "learning_rate": 1.271654657918722e-05, | |
| "loss": 0.012676186859607697, | |
| "num_input_tokens_seen": 783216, | |
| "step": 210, | |
| "train_runtime": 1603.6122, | |
| "train_tokens_per_second": 488.407 | |
| }, | |
| { | |
| "epoch": 0.6844409072821329, | |
| "grad_norm": 0.03970273584127426, | |
| "learning_rate": 1.1646460466876783e-05, | |
| "loss": 0.013275411725044251, | |
| "num_input_tokens_seen": 803760, | |
| "step": 215, | |
| "train_runtime": 1643.1241, | |
| "train_tokens_per_second": 489.166 | |
| }, | |
| { | |
| "epoch": 0.700358137684043, | |
| "grad_norm": 0.0629667267203331, | |
| "learning_rate": 1.0609573357858166e-05, | |
| "loss": 0.015906769037246703, | |
| "num_input_tokens_seen": 822352, | |
| "step": 220, | |
| "train_runtime": 1681.4489, | |
| "train_tokens_per_second": 489.073 | |
| }, | |
| { | |
| "epoch": 0.716275368085953, | |
| "grad_norm": 0.46428775787353516, | |
| "learning_rate": 9.608463116858542e-06, | |
| "loss": 0.06054983139038086, | |
| "num_input_tokens_seen": 839776, | |
| "step": 225, | |
| "train_runtime": 1719.5754, | |
| "train_tokens_per_second": 488.362 | |
| }, | |
| { | |
| "epoch": 0.7321925984878631, | |
| "grad_norm": 0.04607592523097992, | |
| "learning_rate": 8.645618661674142e-06, | |
| "loss": 0.0126905158162117, | |
| "num_input_tokens_seen": 857904, | |
| "step": 230, | |
| "train_runtime": 1758.1484, | |
| "train_tokens_per_second": 487.959 | |
| }, | |
| { | |
| "epoch": 0.7481098288897732, | |
| "grad_norm": 0.05666354298591614, | |
| "learning_rate": 7.723433775328384e-06, | |
| "loss": 0.018532435595989227, | |
| "num_input_tokens_seen": 875536, | |
| "step": 235, | |
| "train_runtime": 1796.0767, | |
| "train_tokens_per_second": 487.471 | |
| }, | |
| { | |
| "epoch": 0.7640270592916832, | |
| "grad_norm": 0.2170793116092682, | |
| "learning_rate": 6.844201154750177e-06, | |
| "loss": 0.017641636729240417, | |
| "num_input_tokens_seen": 893952, | |
| "step": 240, | |
| "train_runtime": 1834.3144, | |
| "train_tokens_per_second": 487.349 | |
| }, | |
| { | |
| "epoch": 0.7799442896935933, | |
| "grad_norm": 0.0820794478058815, | |
| "learning_rate": 6.010106710768052e-06, | |
| "loss": 0.014852634072303772, | |
| "num_input_tokens_seen": 911888, | |
| "step": 245, | |
| "train_runtime": 1872.6499, | |
| "train_tokens_per_second": 486.951 | |
| }, | |
| { | |
| "epoch": 0.7958615200955034, | |
| "grad_norm": 0.07925046235322952, | |
| "learning_rate": 5.223224133591476e-06, | |
| "loss": 0.013549965620040894, | |
| "num_input_tokens_seen": 931552, | |
| "step": 250, | |
| "train_runtime": 1911.0896, | |
| "train_tokens_per_second": 487.445 | |
| }, | |
| { | |
| "epoch": 0.8117787504974134, | |
| "grad_norm": 0.04383081570267677, | |
| "learning_rate": 4.4855097372902135e-06, | |
| "loss": 0.016868625581264497, | |
| "num_input_tokens_seen": 951232, | |
| "step": 255, | |
| "train_runtime": 1949.3262, | |
| "train_tokens_per_second": 487.98 | |
| }, | |
| { | |
| "epoch": 0.8276959808993235, | |
| "grad_norm": 0.04657934233546257, | |
| "learning_rate": 3.798797596089351e-06, | |
| "loss": 0.02409391403198242, | |
| "num_input_tokens_seen": 971248, | |
| "step": 260, | |
| "train_runtime": 1988.2601, | |
| "train_tokens_per_second": 488.491 | |
| }, | |
| { | |
| "epoch": 0.8436132113012336, | |
| "grad_norm": 0.04718421772122383, | |
| "learning_rate": 3.164794984571759e-06, | |
| "loss": 0.014366105198860168, | |
| "num_input_tokens_seen": 989568, | |
| "step": 265, | |
| "train_runtime": 2026.3445, | |
| "train_tokens_per_second": 488.351 | |
| }, | |
| { | |
| "epoch": 0.8595304417031436, | |
| "grad_norm": 0.056470856070518494, | |
| "learning_rate": 2.58507813312448e-06, | |
| "loss": 0.019769111275672914, | |
| "num_input_tokens_seen": 1008400, | |
| "step": 270, | |
| "train_runtime": 2064.7275, | |
| "train_tokens_per_second": 488.394 | |
| }, | |
| { | |
| "epoch": 0.8754476721050537, | |
| "grad_norm": 0.05699534714221954, | |
| "learning_rate": 2.0610883091816525e-06, | |
| "loss": 0.012975563108921052, | |
| "num_input_tokens_seen": 1026832, | |
| "step": 275, | |
| "train_runtime": 2103.4641, | |
| "train_tokens_per_second": 488.162 | |
| }, | |
| { | |
| "epoch": 0.8913649025069638, | |
| "grad_norm": 0.05100962892174721, | |
| "learning_rate": 1.59412823400657e-06, | |
| "loss": 0.02301923781633377, | |
| "num_input_tokens_seen": 1045568, | |
| "step": 280, | |
| "train_runtime": 2141.531, | |
| "train_tokens_per_second": 488.234 | |
| }, | |
| { | |
| "epoch": 0.9072821329088738, | |
| "grad_norm": 0.056496769189834595, | |
| "learning_rate": 1.1853588439213442e-06, | |
| "loss": 0.013730129599571228, | |
| "num_input_tokens_seen": 1064448, | |
| "step": 285, | |
| "train_runtime": 2180.0384, | |
| "train_tokens_per_second": 488.27 | |
| }, | |
| { | |
| "epoch": 0.9231993633107839, | |
| "grad_norm": 0.05061493441462517, | |
| "learning_rate": 8.357964040363209e-07, | |
| "loss": 0.01429380029439926, | |
| "num_input_tokens_seen": 1082240, | |
| "step": 290, | |
| "train_runtime": 2218.224, | |
| "train_tokens_per_second": 487.886 | |
| }, | |
| { | |
| "epoch": 0.939116593712694, | |
| "grad_norm": 0.06360100954771042, | |
| "learning_rate": 5.463099816548579e-07, | |
| "loss": 0.01451290100812912, | |
| "num_input_tokens_seen": 1100608, | |
| "step": 295, | |
| "train_runtime": 2256.2766, | |
| "train_tokens_per_second": 487.798 | |
| }, | |
| { | |
| "epoch": 0.955033824114604, | |
| "grad_norm": 0.09003032743930817, | |
| "learning_rate": 3.1761928563510955e-07, | |
| "loss": 0.015449412167072296, | |
| "num_input_tokens_seen": 1119264, | |
| "step": 300, | |
| "train_runtime": 2294.4496, | |
| "train_tokens_per_second": 487.814 | |
| }, | |
| { | |
| "epoch": 0.9709510545165141, | |
| "grad_norm": 0.06692849099636078, | |
| "learning_rate": 1.5029287708036854e-07, | |
| "loss": 0.01347261518239975, | |
| "num_input_tokens_seen": 1137216, | |
| "step": 305, | |
| "train_runtime": 2333.19, | |
| "train_tokens_per_second": 487.408 | |
| }, | |
| { | |
| "epoch": 0.9868682849184242, | |
| "grad_norm": 0.07066839933395386, | |
| "learning_rate": 4.474675580662113e-08, | |
| "loss": 0.020735736191272735, | |
| "num_input_tokens_seen": 1155552, | |
| "step": 310, | |
| "train_runtime": 2371.0827, | |
| "train_tokens_per_second": 487.352 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.26579365134239197, | |
| "learning_rate": 1.2433261014244136e-09, | |
| "loss": 0.01795462816953659, | |
| "num_input_tokens_seen": 1170680, | |
| "step": 315, | |
| "train_runtime": 2402.7005, | |
| "train_tokens_per_second": 487.235 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "num_input_tokens_seen": 1170680, | |
| "step": 315, | |
| "total_flos": 2.751640835887104e+16, | |
| "train_loss": 0.04861170140996812, | |
| "train_runtime": 2403.2583, | |
| "train_samples_per_second": 2.091, | |
| "train_steps_per_second": 0.131 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 315, | |
| "num_input_tokens_seen": 1170680, | |
| "num_train_epochs": 1, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.751640835887104e+16, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |