Instructions to use exiort/model with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use exiort/model with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("google/gemma-3-12b-it") model = PeftModel.from_pretrained(base_model, "exiort/model") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 1100, | |
| "best_metric": 0.11870265007019043, | |
| "best_model_checkpoint": "./fine_tuning_results/checkpoint-1100", | |
| "epoch": 3.0, | |
| "eval_steps": 100, | |
| "global_step": 1131, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.06637902422834384, | |
| "grad_norm": 5.728163719177246, | |
| "learning_rate": 0.0001411764705882353, | |
| "loss": 9.6583, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.13275804845668768, | |
| "grad_norm": 11.366268157958984, | |
| "learning_rate": 0.00019990774875676051, | |
| "loss": 4.1605, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.19913707268503153, | |
| "grad_norm": 4.53806209564209, | |
| "learning_rate": 0.0001993446074245224, | |
| "loss": 2.6629, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.26551609691337535, | |
| "grad_norm": 3.489072799682617, | |
| "learning_rate": 0.0001982724572970665, | |
| "loss": 1.4258, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.26551609691337535, | |
| "eval_loss": 0.2438984215259552, | |
| "eval_runtime": 410.0948, | |
| "eval_samples_per_second": 0.919, | |
| "eval_steps_per_second": 0.919, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.3318951211417192, | |
| "grad_norm": 3.9948933124542236, | |
| "learning_rate": 0.00019669679171579118, | |
| "loss": 1.8838, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.39827414537006306, | |
| "grad_norm": 2.3741233348846436, | |
| "learning_rate": 0.0001946256838681596, | |
| "loss": 1.2398, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.4646531695984069, | |
| "grad_norm": 3.841597080230713, | |
| "learning_rate": 0.00019206974542336673, | |
| "loss": 1.6213, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.5310321938267507, | |
| "grad_norm": 7.553189277648926, | |
| "learning_rate": 0.00018904207216166835, | |
| "loss": 1.0164, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.5310321938267507, | |
| "eval_loss": 0.19300179183483124, | |
| "eval_runtime": 409.4453, | |
| "eval_samples_per_second": 0.921, | |
| "eval_steps_per_second": 0.921, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.5974112180550946, | |
| "grad_norm": 4.948668956756592, | |
| "learning_rate": 0.00018555817687594984, | |
| "loss": 1.469, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 0.6637902422834384, | |
| "grad_norm": 1.0395816564559937, | |
| "learning_rate": 0.00018163590988932402, | |
| "loss": 0.8695, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.7301692665117823, | |
| "grad_norm": 3.0940940380096436, | |
| "learning_rate": 0.00017729536759600033, | |
| "loss": 1.5099, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 0.7965482907401261, | |
| "grad_norm": 1.1767245531082153, | |
| "learning_rate": 0.000172558789494031, | |
| "loss": 0.8654, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.7965482907401261, | |
| "eval_loss": 0.1677449345588684, | |
| "eval_runtime": 409.3224, | |
| "eval_samples_per_second": 0.921, | |
| "eval_steps_per_second": 0.921, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.86292731496847, | |
| "grad_norm": 3.1094260215759277, | |
| "learning_rate": 0.00016745044423750448, | |
| "loss": 1.3233, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 0.9293063391968138, | |
| "grad_norm": 3.251939296722412, | |
| "learning_rate": 0.00016199650529201683, | |
| "loss": 0.9238, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.9956853634251577, | |
| "grad_norm": 5.835708141326904, | |
| "learning_rate": 0.00015622491683052125, | |
| "loss": 1.2047, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 1.0610687022900764, | |
| "grad_norm": 2.8808865547180176, | |
| "learning_rate": 0.00015016525055666058, | |
| "loss": 1.1297, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.0610687022900764, | |
| "eval_loss": 0.13486357033252716, | |
| "eval_runtime": 408.8177, | |
| "eval_samples_per_second": 0.922, | |
| "eval_steps_per_second": 0.922, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.1274477265184202, | |
| "grad_norm": 4.205045223236084, | |
| "learning_rate": 0.00014384855418917312, | |
| "loss": 0.8077, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 1.193826750746764, | |
| "grad_norm": 2.632800817489624, | |
| "learning_rate": 0.00013730719238368662, | |
| "loss": 1.1098, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 1.2602057749751079, | |
| "grad_norm": 2.277942180633545, | |
| "learning_rate": 0.00013057468090696495, | |
| "loss": 0.8367, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 1.3265847992034518, | |
| "grad_norm": 2.172236680984497, | |
| "learning_rate": 0.0001236855149132436, | |
| "loss": 1.0882, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 1.3265847992034518, | |
| "eval_loss": 0.13017548620700836, | |
| "eval_runtime": 407.3514, | |
| "eval_samples_per_second": 0.925, | |
| "eval_steps_per_second": 0.925, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 1.3929638234317956, | |
| "grad_norm": 3.1930105686187744, | |
| "learning_rate": 0.00011667499220250804, | |
| "loss": 0.8774, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 1.4593428476601393, | |
| "grad_norm": 2.3342959880828857, | |
| "learning_rate": 0.00010957903236628266, | |
| "loss": 1.087, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 1.5257218718884833, | |
| "grad_norm": 2.948979377746582, | |
| "learning_rate": 0.00010243399274756564, | |
| "loss": 0.8045, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 1.592100896116827, | |
| "grad_norm": 2.6527910232543945, | |
| "learning_rate": 9.527648215787065e-05, | |
| "loss": 1.0704, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 1.592100896116827, | |
| "eval_loss": 0.12589675188064575, | |
| "eval_runtime": 408.7252, | |
| "eval_samples_per_second": 0.922, | |
| "eval_steps_per_second": 0.922, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 1.658479920345171, | |
| "grad_norm": 1.180399775505066, | |
| "learning_rate": 8.814317330582753e-05, | |
| "loss": 0.8398, | |
| "step": 625 | |
| }, | |
| { | |
| "epoch": 1.7248589445735147, | |
| "grad_norm": 2.150588274002075, | |
| "learning_rate": 8.107061489839499e-05, | |
| "loss": 1.0931, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 1.7912379688018585, | |
| "grad_norm": 1.0235155820846558, | |
| "learning_rate": 7.409504437741722e-05, | |
| "loss": 0.8223, | |
| "step": 675 | |
| }, | |
| { | |
| "epoch": 1.8576169930302024, | |
| "grad_norm": 1.9297289848327637, | |
| "learning_rate": 6.725220225099911e-05, | |
| "loss": 0.9843, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 1.8576169930302024, | |
| "eval_loss": 0.1218644380569458, | |
| "eval_runtime": 409.0035, | |
| "eval_samples_per_second": 0.922, | |
| "eval_steps_per_second": 0.922, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 1.9239960172585464, | |
| "grad_norm": 3.172612190246582, | |
| "learning_rate": 6.0577148971005514e-05, | |
| "loss": 0.7813, | |
| "step": 725 | |
| }, | |
| { | |
| "epoch": 1.9903750414868902, | |
| "grad_norm": 2.5401861667633057, | |
| "learning_rate": 5.4104085294942505e-05, | |
| "loss": 0.7978, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 2.0557583803518087, | |
| "grad_norm": 2.2131431102752686, | |
| "learning_rate": 4.786617705262746e-05, | |
| "loss": 0.8183, | |
| "step": 775 | |
| }, | |
| { | |
| "epoch": 2.122137404580153, | |
| "grad_norm": 4.252758026123047, | |
| "learning_rate": 4.189538521548524e-05, | |
| "loss": 0.706, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 2.122137404580153, | |
| "eval_loss": 0.12229160219430923, | |
| "eval_runtime": 408.8022, | |
| "eval_samples_per_second": 0.922, | |
| "eval_steps_per_second": 0.922, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 2.1885164288084966, | |
| "grad_norm": 2.4397575855255127, | |
| "learning_rate": 3.622230213913836e-05, | |
| "loss": 0.8344, | |
| "step": 825 | |
| }, | |
| { | |
| "epoch": 2.2548954530368404, | |
| "grad_norm": 1.8311405181884766, | |
| "learning_rate": 3.0875994818330955e-05, | |
| "loss": 0.6842, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 2.321274477265184, | |
| "grad_norm": 2.2209343910217285, | |
| "learning_rate": 2.5883855957295056e-05, | |
| "loss": 0.8642, | |
| "step": 875 | |
| }, | |
| { | |
| "epoch": 2.387653501493528, | |
| "grad_norm": 1.0353050231933594, | |
| "learning_rate": 2.1271463618625986e-05, | |
| "loss": 0.6177, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 2.387653501493528, | |
| "eval_loss": 0.12045033276081085, | |
| "eval_runtime": 409.5523, | |
| "eval_samples_per_second": 0.921, | |
| "eval_steps_per_second": 0.921, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 2.454032525721872, | |
| "grad_norm": 2.0583794116973877, | |
| "learning_rate": 1.706245016977931e-05, | |
| "loss": 0.8361, | |
| "step": 925 | |
| }, | |
| { | |
| "epoch": 2.5204115499502158, | |
| "grad_norm": 2.405135154724121, | |
| "learning_rate": 1.3278381198663491e-05, | |
| "loss": 0.6861, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 2.5867905741785595, | |
| "grad_norm": 2.8698174953460693, | |
| "learning_rate": 9.938645018725523e-06, | |
| "loss": 0.8369, | |
| "step": 975 | |
| }, | |
| { | |
| "epoch": 2.6531695984069037, | |
| "grad_norm": 2.2361364364624023, | |
| "learning_rate": 7.060353329667668e-06, | |
| "loss": 0.7129, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 2.6531695984069037, | |
| "eval_loss": 0.11899977177381516, | |
| "eval_runtime": 409.2689, | |
| "eval_samples_per_second": 0.921, | |
| "eval_steps_per_second": 0.921, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 2.719548622635247, | |
| "grad_norm": 2.688868522644043, | |
| "learning_rate": 4.658253542777991e-06, | |
| "loss": 0.8243, | |
| "step": 1025 | |
| }, | |
| { | |
| "epoch": 2.785927646863591, | |
| "grad_norm": 2.82051682472229, | |
| "learning_rate": 2.7446532200894106e-06, | |
| "loss": 0.6894, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 2.852306671091935, | |
| "grad_norm": 2.1398074626922607, | |
| "learning_rate": 1.3293570145169743e-06, | |
| "loss": 0.7943, | |
| "step": 1075 | |
| }, | |
| { | |
| "epoch": 2.9186856953202787, | |
| "grad_norm": 2.2756364345550537, | |
| "learning_rate": 4.196164340705577e-07, | |
| "loss": 0.6947, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 2.9186856953202787, | |
| "eval_loss": 0.11870265007019043, | |
| "eval_runtime": 409.6404, | |
| "eval_samples_per_second": 0.92, | |
| "eval_steps_per_second": 0.92, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 2.985064719548623, | |
| "grad_norm": 2.8848876953125, | |
| "learning_rate": 2.0092687534589703e-08, | |
| "loss": 0.7374, | |
| "step": 1125 | |
| } | |
| ], | |
| "logging_steps": 25, | |
| "max_steps": 1131, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.5782738599655706e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |