Instructions to use sravanthib/model_working with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use sravanthib/model_working with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.2-3B-Instruct") model = PeftModel.from_pretrained(base_model, "sravanthib/model_working") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.82648401826484, | |
| "eval_steps": 0, | |
| "global_step": 1000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0182648401826484, | |
| "grad_norm": 1.210837721824646, | |
| "learning_rate": 8.384962462644227e-05, | |
| "loss": 4.3885, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.0365296803652968, | |
| "grad_norm": 0.05364489555358887, | |
| "learning_rate": 9.403937698096759e-05, | |
| "loss": 0.0377, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.0547945205479452, | |
| "grad_norm": 0.05466941371560097, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0304, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.0730593607305936, | |
| "grad_norm": 0.05443768575787544, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0286, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.091324200913242, | |
| "grad_norm": 0.04316823184490204, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0269, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.1095890410958904, | |
| "grad_norm": 0.040838971734046936, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0253, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.1278538812785388, | |
| "grad_norm": 0.033302322030067444, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0246, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.1461187214611872, | |
| "grad_norm": 0.033719729632139206, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0236, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.1643835616438356, | |
| "grad_norm": 0.035154491662979126, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0225, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.182648401826484, | |
| "grad_norm": 0.04473581910133362, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0215, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.2009132420091324, | |
| "grad_norm": 0.03445715084671974, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0206, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.2191780821917808, | |
| "grad_norm": 0.038836944848299026, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0192, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.2374429223744292, | |
| "grad_norm": 0.03825332224369049, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0175, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.2557077625570776, | |
| "grad_norm": 0.06607168912887573, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0163, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.273972602739726, | |
| "grad_norm": 0.06894340366125107, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0145, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.2922374429223744, | |
| "grad_norm": 0.05710868164896965, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0135, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.3105022831050228, | |
| "grad_norm": 0.21631816029548645, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0124, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.3287671232876712, | |
| "grad_norm": 0.02653978019952774, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0108, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.3470319634703196, | |
| "grad_norm": 0.02567458152770996, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0096, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.365296803652968, | |
| "grad_norm": 0.02634381130337715, | |
| "learning_rate": 0.0001, | |
| "loss": 0.009, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.3835616438356164, | |
| "grad_norm": 0.0267449039965868, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0082, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.4018264840182648, | |
| "grad_norm": 0.021301211789250374, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0074, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.4200913242009132, | |
| "grad_norm": 0.019044479355216026, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0065, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.4383561643835616, | |
| "grad_norm": 0.029325349256396294, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0058, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.45662100456621, | |
| "grad_norm": 0.020611237734556198, | |
| "learning_rate": 0.0001, | |
| "loss": 0.005, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.4748858447488584, | |
| "grad_norm": 0.013526758179068565, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0048, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.4931506849315068, | |
| "grad_norm": 0.013649986125528812, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0044, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.5114155251141552, | |
| "grad_norm": 0.010144168511033058, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0039, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.5296803652968036, | |
| "grad_norm": 0.010870883241295815, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0037, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.547945205479452, | |
| "grad_norm": 0.013004078529775143, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0035, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.5662100456621004, | |
| "grad_norm": 0.011805733665823936, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0032, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.5844748858447488, | |
| "grad_norm": 0.009305172599852085, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0032, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.6027397260273972, | |
| "grad_norm": 0.010236217640340328, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0032, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.6210045662100456, | |
| "grad_norm": 0.006890588905662298, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0029, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.639269406392694, | |
| "grad_norm": 0.009779484011232853, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0029, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.6575342465753424, | |
| "grad_norm": 0.00785751547664404, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0028, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.6757990867579908, | |
| "grad_norm": 0.0072973244823515415, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0029, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.6940639269406392, | |
| "grad_norm": 0.007814369164407253, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0026, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.7123287671232876, | |
| "grad_norm": 0.009240522980690002, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0027, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.730593607305936, | |
| "grad_norm": 0.009443056769669056, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0026, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.7488584474885844, | |
| "grad_norm": 0.007976274006068707, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0025, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.7671232876712328, | |
| "grad_norm": 0.007670409046113491, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0026, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.7853881278538812, | |
| "grad_norm": 0.007698874454945326, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0026, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.8036529680365296, | |
| "grad_norm": 0.0064626955427229404, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0023, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.821917808219178, | |
| "grad_norm": 0.00718158483505249, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0026, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.8401826484018264, | |
| "grad_norm": 0.00720883859321475, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0024, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.8584474885844748, | |
| "grad_norm": 0.0070312367752194405, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0022, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.8767123287671232, | |
| "grad_norm": 0.006656646262854338, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0022, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.8949771689497716, | |
| "grad_norm": 0.005672188475728035, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0023, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.91324200913242, | |
| "grad_norm": 0.006890942342579365, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0023, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.9315068493150684, | |
| "grad_norm": 0.007466984912753105, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0023, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.9497716894977168, | |
| "grad_norm": 0.004908357746899128, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0023, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.9680365296803652, | |
| "grad_norm": 0.006489965599030256, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0022, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.9863013698630136, | |
| "grad_norm": 0.004896162543445826, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0022, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 1.004566210045662, | |
| "grad_norm": 0.006576609797775745, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0022, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 1.0228310502283104, | |
| "grad_norm": 0.005738385953009129, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0022, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 1.0410958904109588, | |
| "grad_norm": 0.004859850741922855, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0021, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 1.0593607305936072, | |
| "grad_norm": 0.0058967191725969315, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0022, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 1.0776255707762556, | |
| "grad_norm": 0.006550053600221872, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0022, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 1.095890410958904, | |
| "grad_norm": 0.005125932861119509, | |
| "learning_rate": 0.0001, | |
| "loss": 0.002, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 1.1141552511415524, | |
| "grad_norm": 0.006288828328251839, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0021, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 1.1324200913242009, | |
| "grad_norm": 0.005583199672400951, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0021, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 1.1506849315068493, | |
| "grad_norm": 0.009129468351602554, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0021, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 1.1689497716894977, | |
| "grad_norm": 0.007402694784104824, | |
| "learning_rate": 0.0001, | |
| "loss": 0.002, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 1.187214611872146, | |
| "grad_norm": 0.006056242622435093, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0019, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 1.2054794520547945, | |
| "grad_norm": 0.006746839266270399, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0021, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 1.2237442922374429, | |
| "grad_norm": 0.005732604302465916, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0019, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 1.2420091324200913, | |
| "grad_norm": 0.005662497598677874, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0019, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 1.2602739726027397, | |
| "grad_norm": 0.005395127926021814, | |
| "learning_rate": 0.0001, | |
| "loss": 0.002, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 1.278538812785388, | |
| "grad_norm": 0.006477879825979471, | |
| "learning_rate": 0.0001, | |
| "loss": 0.002, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 1.2968036529680365, | |
| "grad_norm": 0.00455828383564949, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0018, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 1.3150684931506849, | |
| "grad_norm": 0.006546813528984785, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0019, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 1.3333333333333333, | |
| "grad_norm": 0.004749835003167391, | |
| "learning_rate": 0.0001, | |
| "loss": 0.002, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 1.3515981735159817, | |
| "grad_norm": 0.0060322824865579605, | |
| "learning_rate": 0.0001, | |
| "loss": 0.002, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 1.36986301369863, | |
| "grad_norm": 0.004833315033465624, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0019, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 1.3881278538812785, | |
| "grad_norm": 0.006321150343865156, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0018, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 1.4063926940639269, | |
| "grad_norm": 0.00560184707865119, | |
| "learning_rate": 0.0001, | |
| "loss": 0.002, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 1.4246575342465753, | |
| "grad_norm": 0.005110142752528191, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0018, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 1.4429223744292237, | |
| "grad_norm": 0.005219564773142338, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0019, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 1.461187214611872, | |
| "grad_norm": 0.004923923406749964, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0018, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 1.4794520547945205, | |
| "grad_norm": 0.004175902344286442, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0017, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 1.4977168949771689, | |
| "grad_norm": 0.005314885172992945, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0019, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 1.5159817351598175, | |
| "grad_norm": 0.004691184964030981, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0018, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 1.5342465753424657, | |
| "grad_norm": 0.006277224514633417, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0018, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 1.5525114155251143, | |
| "grad_norm": 0.004492647014558315, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0017, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 1.5707762557077625, | |
| "grad_norm": 0.00427781417965889, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0017, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 1.589041095890411, | |
| "grad_norm": 0.005225111730396748, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0019, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 1.6073059360730593, | |
| "grad_norm": 0.004722876939922571, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0019, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 1.625570776255708, | |
| "grad_norm": 0.0056340452283620834, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0019, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 1.643835616438356, | |
| "grad_norm": 0.004999073222279549, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0018, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 1.6621004566210047, | |
| "grad_norm": 0.005323594436049461, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0018, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 1.6803652968036529, | |
| "grad_norm": 0.006069580093026161, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0018, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 1.6986301369863015, | |
| "grad_norm": 0.006003932561725378, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0017, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 1.7168949771689497, | |
| "grad_norm": 0.005637574940919876, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0017, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 1.7351598173515983, | |
| "grad_norm": 0.004971097223460674, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0017, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 1.7534246575342465, | |
| "grad_norm": 0.005295970477163792, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0017, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 1.771689497716895, | |
| "grad_norm": 0.0048394943587481976, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0017, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 1.7899543378995433, | |
| "grad_norm": 0.005681538488715887, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0017, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 1.808219178082192, | |
| "grad_norm": 0.007275606505572796, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0018, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 1.82648401826484, | |
| "grad_norm": 0.004521261900663376, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0016, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 1.82648401826484, | |
| "step": 1000, | |
| "total_flos": 5.565784553370419e+18, | |
| "train_loss": 0.04975467654503882, | |
| "train_runtime": 15752.6954, | |
| "train_samples_per_second": 10.157, | |
| "train_steps_per_second": 0.063 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 1000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 5.565784553370419e+18, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |