Text Generation
Transformers
PyTorch
TensorBoard
Safetensors
gpt2
Generated from Trainer
text-generation-inference
Instructions to use Jonathanmann/lyrics-main with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Jonathanmann/lyrics-main with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Jonathanmann/lyrics-main")# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("Jonathanmann/lyrics-main") model = AutoModelForCausalLM.from_pretrained("Jonathanmann/lyrics-main", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Jonathanmann/lyrics-main with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Jonathanmann/lyrics-main" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jonathanmann/lyrics-main", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/Jonathanmann/lyrics-main
- SGLang
How to use Jonathanmann/lyrics-main with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Jonathanmann/lyrics-main" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jonathanmann/lyrics-main", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Jonathanmann/lyrics-main" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jonathanmann/lyrics-main", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use Jonathanmann/lyrics-main with Docker Model Runner:
docker model run hf.co/Jonathanmann/lyrics-main
| { | |
| "best_metric": 3.0606205463409424, | |
| "best_model_checkpoint": "/content/drive/MyDrive/Hugh Mann/GPT2-nov24/checkpoints/checkpoint-900", | |
| "epoch": 2.9953488372093022, | |
| "eval_steps": 50, | |
| "global_step": 966, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.031007751937984496, | |
| "grad_norm": 19.903196334838867, | |
| "learning_rate": 6.000000000000001e-07, | |
| "loss": 3.9736, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.06201550387596899, | |
| "grad_norm": 13.974676132202148, | |
| "learning_rate": 1.6000000000000001e-06, | |
| "loss": 3.8925, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.09302325581395349, | |
| "grad_norm": 13.976302146911621, | |
| "learning_rate": 2.6e-06, | |
| "loss": 3.7375, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.12403100775193798, | |
| "grad_norm": 12.306398391723633, | |
| "learning_rate": 3.6e-06, | |
| "loss": 3.6961, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.15503875968992248, | |
| "grad_norm": 9.758413314819336, | |
| "learning_rate": 4.6e-06, | |
| "loss": 3.7651, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.15503875968992248, | |
| "eval_loss": 3.4887187480926514, | |
| "eval_runtime": 4.7241, | |
| "eval_samples_per_second": 121.08, | |
| "eval_steps_per_second": 15.241, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.18604651162790697, | |
| "grad_norm": 8.832802772521973, | |
| "learning_rate": 5.600000000000001e-06, | |
| "loss": 3.6353, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.21705426356589147, | |
| "grad_norm": 11.008893013000488, | |
| "learning_rate": 6.6e-06, | |
| "loss": 3.5125, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.24806201550387597, | |
| "grad_norm": 9.586570739746094, | |
| "learning_rate": 7.6e-06, | |
| "loss": 3.6011, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.27906976744186046, | |
| "grad_norm": 8.815489768981934, | |
| "learning_rate": 8.599999999999999e-06, | |
| "loss": 3.552, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.31007751937984496, | |
| "grad_norm": 11.291627883911133, | |
| "learning_rate": 9.600000000000001e-06, | |
| "loss": 3.6031, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.31007751937984496, | |
| "eval_loss": 3.349764108657837, | |
| "eval_runtime": 4.737, | |
| "eval_samples_per_second": 120.752, | |
| "eval_steps_per_second": 15.2, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.34108527131782945, | |
| "grad_norm": 8.584806442260742, | |
| "learning_rate": 1.06e-05, | |
| "loss": 3.3871, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.37209302325581395, | |
| "grad_norm": 9.76710033416748, | |
| "learning_rate": 1.16e-05, | |
| "loss": 3.4636, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.40310077519379844, | |
| "grad_norm": 10.434168815612793, | |
| "learning_rate": 1.2600000000000001e-05, | |
| "loss": 3.4924, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.43410852713178294, | |
| "grad_norm": 9.049373626708984, | |
| "learning_rate": 1.3600000000000002e-05, | |
| "loss": 3.4632, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.46511627906976744, | |
| "grad_norm": 9.166099548339844, | |
| "learning_rate": 1.4599999999999999e-05, | |
| "loss": 3.4463, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.46511627906976744, | |
| "eval_loss": 3.27072811126709, | |
| "eval_runtime": 4.7291, | |
| "eval_samples_per_second": 120.953, | |
| "eval_steps_per_second": 15.225, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.49612403100775193, | |
| "grad_norm": 7.227886199951172, | |
| "learning_rate": 1.56e-05, | |
| "loss": 3.411, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.5271317829457365, | |
| "grad_norm": 9.005069732666016, | |
| "learning_rate": 1.66e-05, | |
| "loss": 3.2673, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.5581395348837209, | |
| "grad_norm": 9.941435813903809, | |
| "learning_rate": 1.76e-05, | |
| "loss": 3.5091, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.5891472868217055, | |
| "grad_norm": 10.245264053344727, | |
| "learning_rate": 1.86e-05, | |
| "loss": 3.4521, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.6201550387596899, | |
| "grad_norm": 8.744315147399902, | |
| "learning_rate": 1.9600000000000002e-05, | |
| "loss": 3.4016, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.6201550387596899, | |
| "eval_loss": 3.2324905395507812, | |
| "eval_runtime": 4.71, | |
| "eval_samples_per_second": 121.445, | |
| "eval_steps_per_second": 15.287, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.6511627906976745, | |
| "grad_norm": 8.368231773376465, | |
| "learning_rate": 2.06e-05, | |
| "loss": 3.3639, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.6821705426356589, | |
| "grad_norm": 9.450159072875977, | |
| "learning_rate": 2.16e-05, | |
| "loss": 3.3308, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.7131782945736435, | |
| "grad_norm": 9.133488655090332, | |
| "learning_rate": 2.26e-05, | |
| "loss": 3.3072, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.7441860465116279, | |
| "grad_norm": 10.106104850769043, | |
| "learning_rate": 2.36e-05, | |
| "loss": 3.3585, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.7751937984496124, | |
| "grad_norm": 11.48149299621582, | |
| "learning_rate": 2.46e-05, | |
| "loss": 3.3733, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.7751937984496124, | |
| "eval_loss": 3.200448513031006, | |
| "eval_runtime": 4.7453, | |
| "eval_samples_per_second": 120.541, | |
| "eval_steps_per_second": 15.173, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.8062015503875969, | |
| "grad_norm": 7.786629676818848, | |
| "learning_rate": 2.5600000000000002e-05, | |
| "loss": 3.3133, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.8372093023255814, | |
| "grad_norm": 9.597051620483398, | |
| "learning_rate": 2.6600000000000003e-05, | |
| "loss": 3.3562, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.8682170542635659, | |
| "grad_norm": 8.599666595458984, | |
| "learning_rate": 2.7600000000000003e-05, | |
| "loss": 3.3418, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.8992248062015504, | |
| "grad_norm": 7.085015296936035, | |
| "learning_rate": 2.86e-05, | |
| "loss": 3.3213, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.9302325581395349, | |
| "grad_norm": 8.608779907226562, | |
| "learning_rate": 2.96e-05, | |
| "loss": 3.3827, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.9302325581395349, | |
| "eval_loss": 3.1764185428619385, | |
| "eval_runtime": 4.7063, | |
| "eval_samples_per_second": 121.54, | |
| "eval_steps_per_second": 15.299, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.9612403100775194, | |
| "grad_norm": 8.341065406799316, | |
| "learning_rate": 3.06e-05, | |
| "loss": 3.3358, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.9922480620155039, | |
| "grad_norm": 7.7783989906311035, | |
| "learning_rate": 3.16e-05, | |
| "loss": 3.3063, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 1.0232558139534884, | |
| "grad_norm": 7.145493984222412, | |
| "learning_rate": 3.26e-05, | |
| "loss": 3.1819, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 1.054263565891473, | |
| "grad_norm": 7.140699863433838, | |
| "learning_rate": 3.3600000000000004e-05, | |
| "loss": 3.249, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 1.0852713178294573, | |
| "grad_norm": 8.35848617553711, | |
| "learning_rate": 3.46e-05, | |
| "loss": 3.1805, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 1.0852713178294573, | |
| "eval_loss": 3.1566410064697266, | |
| "eval_runtime": 4.7112, | |
| "eval_samples_per_second": 121.413, | |
| "eval_steps_per_second": 15.283, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 1.1162790697674418, | |
| "grad_norm": 7.644073963165283, | |
| "learning_rate": 3.56e-05, | |
| "loss": 3.3018, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 1.1472868217054264, | |
| "grad_norm": 10.410257339477539, | |
| "learning_rate": 3.66e-05, | |
| "loss": 3.2404, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 1.178294573643411, | |
| "grad_norm": 9.099555969238281, | |
| "learning_rate": 3.76e-05, | |
| "loss": 3.2445, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 1.2093023255813953, | |
| "grad_norm": 8.178119659423828, | |
| "learning_rate": 3.86e-05, | |
| "loss": 3.2468, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 1.2403100775193798, | |
| "grad_norm": 8.377422332763672, | |
| "learning_rate": 3.960000000000001e-05, | |
| "loss": 3.1353, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.2403100775193798, | |
| "eval_loss": 3.1435060501098633, | |
| "eval_runtime": 4.7171, | |
| "eval_samples_per_second": 121.262, | |
| "eval_steps_per_second": 15.264, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.2713178294573644, | |
| "grad_norm": 8.308828353881836, | |
| "learning_rate": 4.0600000000000004e-05, | |
| "loss": 3.2141, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 1.302325581395349, | |
| "grad_norm": 10.332070350646973, | |
| "learning_rate": 4.16e-05, | |
| "loss": 3.2425, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 1.3333333333333333, | |
| "grad_norm": 7.949954509735107, | |
| "learning_rate": 4.26e-05, | |
| "loss": 3.2722, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 1.3643410852713178, | |
| "grad_norm": 7.976950168609619, | |
| "learning_rate": 4.36e-05, | |
| "loss": 3.2182, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 1.3953488372093024, | |
| "grad_norm": 7.078619956970215, | |
| "learning_rate": 4.46e-05, | |
| "loss": 3.1613, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 1.3953488372093024, | |
| "eval_loss": 3.129640579223633, | |
| "eval_runtime": 4.7084, | |
| "eval_samples_per_second": 121.485, | |
| "eval_steps_per_second": 15.292, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 1.4263565891472867, | |
| "grad_norm": 8.637125968933105, | |
| "learning_rate": 4.5600000000000004e-05, | |
| "loss": 3.1195, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 1.4573643410852712, | |
| "grad_norm": 7.1886067390441895, | |
| "learning_rate": 4.660000000000001e-05, | |
| "loss": 3.2467, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 1.4883720930232558, | |
| "grad_norm": 6.580921173095703, | |
| "learning_rate": 4.76e-05, | |
| "loss": 3.2029, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 1.5193798449612403, | |
| "grad_norm": 7.07883882522583, | |
| "learning_rate": 4.86e-05, | |
| "loss": 3.1662, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 1.550387596899225, | |
| "grad_norm": 7.247085094451904, | |
| "learning_rate": 4.96e-05, | |
| "loss": 3.2172, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 1.550387596899225, | |
| "eval_loss": 3.12103271484375, | |
| "eval_runtime": 4.7178, | |
| "eval_samples_per_second": 121.243, | |
| "eval_steps_per_second": 15.261, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 1.5813953488372094, | |
| "grad_norm": 5.985532283782959, | |
| "learning_rate": 4.99795505698779e-05, | |
| "loss": 3.1151, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 1.6124031007751938, | |
| "grad_norm": 5.8070759773254395, | |
| "learning_rate": 4.9854702961190384e-05, | |
| "loss": 3.1967, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 1.6434108527131783, | |
| "grad_norm": 6.231266021728516, | |
| "learning_rate": 4.961693505953091e-05, | |
| "loss": 3.1199, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 1.6744186046511627, | |
| "grad_norm": 5.798988342285156, | |
| "learning_rate": 4.926732709591879e-05, | |
| "loss": 3.107, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 1.7054263565891472, | |
| "grad_norm": 5.160669326782227, | |
| "learning_rate": 4.880746741497186e-05, | |
| "loss": 3.1419, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 1.7054263565891472, | |
| "eval_loss": 3.10736083984375, | |
| "eval_runtime": 4.7333, | |
| "eval_samples_per_second": 120.845, | |
| "eval_steps_per_second": 15.211, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 1.7364341085271318, | |
| "grad_norm": 7.017159938812256, | |
| "learning_rate": 4.8239445258713245e-05, | |
| "loss": 3.1765, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 1.7674418604651163, | |
| "grad_norm": 5.4090375900268555, | |
| "learning_rate": 4.75658412746928e-05, | |
| "loss": 3.2182, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 1.7984496124031009, | |
| "grad_norm": 7.889895439147949, | |
| "learning_rate": 4.6789715791546975e-05, | |
| "loss": 3.2102, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 1.8294573643410854, | |
| "grad_norm": 5.4858784675598145, | |
| "learning_rate": 4.591459491526371e-05, | |
| "loss": 3.0703, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 1.8604651162790697, | |
| "grad_norm": 5.410943031311035, | |
| "learning_rate": 4.494445450932003e-05, | |
| "loss": 3.0979, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 1.8604651162790697, | |
| "eval_loss": 3.0953683853149414, | |
| "eval_runtime": 4.7038, | |
| "eval_samples_per_second": 121.605, | |
| "eval_steps_per_second": 15.307, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 1.8914728682170543, | |
| "grad_norm": 5.534840106964111, | |
| "learning_rate": 4.388370213147409e-05, | |
| "loss": 3.1418, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 1.9224806201550386, | |
| "grad_norm": 5.086917400360107, | |
| "learning_rate": 4.273715700927666e-05, | |
| "loss": 3.1561, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 1.9534883720930232, | |
| "grad_norm": 6.430456161499023, | |
| "learning_rate": 4.151002814527775e-05, | |
| "loss": 3.1791, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 1.9844961240310077, | |
| "grad_norm": 5.168478965759277, | |
| "learning_rate": 4.020789065140097e-05, | |
| "loss": 3.2712, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 2.0155038759689923, | |
| "grad_norm": 5.176158905029297, | |
| "learning_rate": 3.883666042000392e-05, | |
| "loss": 3.1357, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 2.0155038759689923, | |
| "eval_loss": 3.0860443115234375, | |
| "eval_runtime": 4.6975, | |
| "eval_samples_per_second": 121.766, | |
| "eval_steps_per_second": 15.327, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 2.046511627906977, | |
| "grad_norm": 4.712176322937012, | |
| "learning_rate": 3.740256724669926e-05, | |
| "loss": 2.9274, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 2.0775193798449614, | |
| "grad_norm": 5.124958038330078, | |
| "learning_rate": 3.591212652704536e-05, | |
| "loss": 2.9446, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 2.108527131782946, | |
| "grad_norm": 7.340769290924072, | |
| "learning_rate": 3.4372109655694744e-05, | |
| "loss": 3.0486, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 2.13953488372093, | |
| "grad_norm": 6.670995712280273, | |
| "learning_rate": 3.278951326248305e-05, | |
| "loss": 3.0568, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 2.1705426356589146, | |
| "grad_norm": 5.709664821624756, | |
| "learning_rate": 3.117152742522603e-05, | |
| "loss": 2.9513, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 2.1705426356589146, | |
| "eval_loss": 3.0826711654663086, | |
| "eval_runtime": 4.7073, | |
| "eval_samples_per_second": 121.512, | |
| "eval_steps_per_second": 15.295, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 2.201550387596899, | |
| "grad_norm": 5.379000663757324, | |
| "learning_rate": 2.9525503003640336e-05, | |
| "loss": 2.9515, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 2.2325581395348837, | |
| "grad_norm": 5.246376037597656, | |
| "learning_rate": 2.785891824279755e-05, | |
| "loss": 3.0339, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 2.2635658914728682, | |
| "grad_norm": 6.674692153930664, | |
| "learning_rate": 2.6179344797838774e-05, | |
| "loss": 3.0632, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 2.294573643410853, | |
| "grad_norm": 5.437400817871094, | |
| "learning_rate": 2.4494413334307217e-05, | |
| "loss": 2.9205, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 2.3255813953488373, | |
| "grad_norm": 5.837658882141113, | |
| "learning_rate": 2.28117788603837e-05, | |
| "loss": 2.9206, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 2.3255813953488373, | |
| "eval_loss": 3.0738000869750977, | |
| "eval_runtime": 4.7166, | |
| "eval_samples_per_second": 121.274, | |
| "eval_steps_per_second": 15.265, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 2.356589147286822, | |
| "grad_norm": 5.022912979125977, | |
| "learning_rate": 2.1139085948528285e-05, | |
| "loss": 2.9464, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 2.387596899224806, | |
| "grad_norm": 5.174287796020508, | |
| "learning_rate": 1.9483934004533667e-05, | |
| "loss": 2.9933, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 2.4186046511627906, | |
| "grad_norm": 4.518463611602783, | |
| "learning_rate": 1.7853842741780474e-05, | |
| "loss": 2.9652, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 2.449612403100775, | |
| "grad_norm": 4.628320693969727, | |
| "learning_rate": 1.6256218017552482e-05, | |
| "loss": 2.9812, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 2.4806201550387597, | |
| "grad_norm": 5.738299369812012, | |
| "learning_rate": 1.4698318186624669e-05, | |
| "loss": 2.9016, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 2.4806201550387597, | |
| "eval_loss": 3.0678045749664307, | |
| "eval_runtime": 4.7499, | |
| "eval_samples_per_second": 120.422, | |
| "eval_steps_per_second": 15.158, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 2.511627906976744, | |
| "grad_norm": 6.1115641593933105, | |
| "learning_rate": 1.3187221124987106e-05, | |
| "loss": 3.048, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 2.5426356589147288, | |
| "grad_norm": 5.122735023498535, | |
| "learning_rate": 1.1729792073522999e-05, | |
| "loss": 3.0176, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 2.5736434108527133, | |
| "grad_norm": 5.320531845092773, | |
| "learning_rate": 1.0332652447734056e-05, | |
| "loss": 2.9813, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 2.604651162790698, | |
| "grad_norm": 5.2405900955200195, | |
| "learning_rate": 9.002149755217246e-06, | |
| "loss": 3.0905, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 2.6356589147286824, | |
| "grad_norm": 5.132701396942139, | |
| "learning_rate": 7.7443287575645e-06, | |
| "loss": 2.9043, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 2.6356589147286824, | |
| "eval_loss": 3.062049388885498, | |
| "eval_runtime": 4.7405, | |
| "eval_samples_per_second": 120.662, | |
| "eval_steps_per_second": 15.188, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 2.6666666666666665, | |
| "grad_norm": 5.587965488433838, | |
| "learning_rate": 6.5649040077030325e-06, | |
| "loss": 2.9439, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 2.697674418604651, | |
| "grad_norm": 4.826563358306885, | |
| "learning_rate": 5.469233887444941e-06, | |
| "loss": 2.9252, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 2.7286821705426356, | |
| "grad_norm": 5.297211170196533, | |
| "learning_rate": 4.462296263199381e-06, | |
| "loss": 3.026, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 2.75968992248062, | |
| "grad_norm": 4.917094707489014, | |
| "learning_rate": 3.5486658704484977e-06, | |
| "loss": 2.8904, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 2.7906976744186047, | |
| "grad_norm": 4.789050579071045, | |
| "learning_rate": 2.7324935297343147e-06, | |
| "loss": 3.0086, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 2.7906976744186047, | |
| "eval_loss": 3.0606205463409424, | |
| "eval_runtime": 4.7114, | |
| "eval_samples_per_second": 121.409, | |
| "eval_steps_per_second": 15.282, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 2.8217054263565893, | |
| "grad_norm": 5.387036323547363, | |
| "learning_rate": 2.0174872885830113e-06, | |
| "loss": 3.0176, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 2.8527131782945734, | |
| "grad_norm": 6.046304225921631, | |
| "learning_rate": 1.406895575042727e-06, | |
| "loss": 3.0501, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 2.883720930232558, | |
| "grad_norm": 5.257150650024414, | |
| "learning_rate": 9.034924393721777e-07, | |
| "loss": 2.9108, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 2.9147286821705425, | |
| "grad_norm": 5.8900885581970215, | |
| "learning_rate": 5.095649509300804e-07, | |
| "loss": 2.9864, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 2.945736434108527, | |
| "grad_norm": 5.49445104598999, | |
| "learning_rate": 2.2690280752429292e-07, | |
| "loss": 2.9851, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 2.945736434108527, | |
| "eval_loss": 3.060117483139038, | |
| "eval_runtime": 4.7091, | |
| "eval_samples_per_second": 121.466, | |
| "eval_steps_per_second": 15.289, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 2.9767441860465116, | |
| "grad_norm": 5.116360187530518, | |
| "learning_rate": 5.6790204427450975e-08, | |
| "loss": 3.004, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 2.9953488372093022, | |
| "step": 966, | |
| "total_flos": 1.4346568329068544e+16, | |
| "train_loss": 3.2167103552176592, | |
| "train_runtime": 2485.5794, | |
| "train_samples_per_second": 6.223, | |
| "train_steps_per_second": 0.389 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 966, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.4346568329068544e+16, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |