Download trainer_state.json from Anderson1000/DPTeeHee: direct link, hf CLI and curl.
- Browser
- Download file 8.31 kB
-
https://huggingface.co/Anderson1000/DPTeeHee/resolve/main/trainer_state.json
- Command line
-
hf download hf://Anderson1000/DPTeeHee/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/Anderson1000/DPTeeHee/resolve/main/trainer_state.json
8.31 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 1500, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 1440.0, | |
| "learning_rate": 2.9818992729986362e-05, | |
| "logits/chosen": -0.7303402423858643, | |
| "logits/rejected": -0.45186057686805725, | |
| "logps/chosen": -394.23968505859375, | |
| "logps/rejected": -349.1568298339844, | |
| "loss": 3.1086, | |
| "rewards/accuracies": 0.48500001430511475, | |
| "rewards/chosen": -4.4438581466674805, | |
| "rewards/margins": -0.3193548321723938, | |
| "rewards/rejected": -4.124503135681152, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 556.0, | |
| "learning_rate": 2.9273111183047722e-05, | |
| "logits/chosen": -0.5820356011390686, | |
| "logits/rejected": -0.45071941614151, | |
| "logps/chosen": -419.5753479003906, | |
| "logps/rejected": -373.3916320800781, | |
| "loss": 3.3459, | |
| "rewards/accuracies": 0.5299999713897705, | |
| "rewards/chosen": -6.157695770263672, | |
| "rewards/margins": 0.3280045986175537, | |
| "rewards/rejected": -6.4857001304626465, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 1688.0, | |
| "learning_rate": 2.837577826904226e-05, | |
| "logits/chosen": -0.8348171710968018, | |
| "logits/rejected": -0.6238606572151184, | |
| "logps/chosen": -443.1069030761719, | |
| "logps/rejected": -385.998779296875, | |
| "loss": 3.7071, | |
| "rewards/accuracies": 0.5849999785423279, | |
| "rewards/chosen": -7.805955410003662, | |
| "rewards/margins": 0.8645437359809875, | |
| "rewards/rejected": -8.67049789428711, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 7.75, | |
| "learning_rate": 2.714908930238998e-05, | |
| "logits/chosen": -0.915019690990448, | |
| "logits/rejected": -0.7366578578948975, | |
| "logps/chosen": -466.5214538574219, | |
| "logps/rejected": -348.214111328125, | |
| "loss": 4.0855, | |
| "rewards/accuracies": 0.4699999988079071, | |
| "rewards/chosen": -7.924253463745117, | |
| "rewards/margins": -0.6686192154884338, | |
| "rewards/rejected": -7.255634784698486, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 1392.0, | |
| "learning_rate": 2.5623249436597142e-05, | |
| "logits/chosen": -1.1756317615509033, | |
| "logits/rejected": -1.0033434629440308, | |
| "logps/chosen": -446.835693359375, | |
| "logps/rejected": -426.72015380859375, | |
| "loss": 2.9222, | |
| "rewards/accuracies": 0.5, | |
| "rewards/chosen": -9.632830619812012, | |
| "rewards/margins": 0.8283342123031616, | |
| "rewards/rejected": -10.461165428161621, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 12.0, | |
| "learning_rate": 2.3835829913131745e-05, | |
| "logits/chosen": -1.8936198949813843, | |
| "logits/rejected": -1.6783454418182373, | |
| "logps/chosen": -393.1761474609375, | |
| "logps/rejected": -409.0048522949219, | |
| "loss": 0.2294, | |
| "rewards/accuracies": 0.9599999785423279, | |
| "rewards/chosen": 5.744272232055664, | |
| "rewards/margins": 40.307220458984375, | |
| "rewards/rejected": -34.562950134277344, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 0.0, | |
| "learning_rate": 2.1830842932766803e-05, | |
| "logits/chosen": -2.0007760524749756, | |
| "logits/rejected": -1.7464280128479004, | |
| "logps/chosen": -385.68499755859375, | |
| "logps/rejected": -453.5122985839844, | |
| "loss": 0.3262, | |
| "rewards/accuracies": 0.9549999833106995, | |
| "rewards/chosen": 8.030089378356934, | |
| "rewards/margins": 44.05226516723633, | |
| "rewards/rejected": -36.022178649902344, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 9.12696123123169e-08, | |
| "learning_rate": 1.9657657929129185e-05, | |
| "logits/chosen": -1.8635623455047607, | |
| "logits/rejected": -1.603875994682312, | |
| "logps/chosen": -411.04840087890625, | |
| "logps/rejected": -464.8753967285156, | |
| "loss": 0.1132, | |
| "rewards/accuracies": 0.9700000286102295, | |
| "rewards/chosen": 11.565813064575195, | |
| "rewards/margins": 47.49372100830078, | |
| "rewards/rejected": -35.92790985107422, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 0.0, | |
| "learning_rate": 1.736978592939598e-05, | |
| "logits/chosen": -1.9231587648391724, | |
| "logits/rejected": -1.6588664054870605, | |
| "logps/chosen": -414.5479736328125, | |
| "logps/rejected": -444.71441650390625, | |
| "loss": 0.0873, | |
| "rewards/accuracies": 0.9750000238418579, | |
| "rewards/chosen": 10.788975715637207, | |
| "rewards/margins": 44.054561614990234, | |
| "rewards/rejected": -33.26558303833008, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.091796875, | |
| "learning_rate": 1.5023561935212463e-05, | |
| "logits/chosen": -1.952134132385254, | |
| "logits/rejected": -1.622839093208313, | |
| "logps/chosen": -362.3935852050781, | |
| "logps/rejected": -455.61383056640625, | |
| "loss": 0.3025, | |
| "rewards/accuracies": 0.9750000238418579, | |
| "rewards/chosen": 9.277441024780273, | |
| "rewards/margins": 44.19200134277344, | |
| "rewards/rejected": -34.91455078125, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 2.2, | |
| "grad_norm": 6.288290023803711e-06, | |
| "learning_rate": 1.2676757767986436e-05, | |
| "logits/chosen": -1.8726714849472046, | |
| "logits/rejected": -1.6393769979476929, | |
| "logps/chosen": -369.1127624511719, | |
| "logps/rejected": -453.4897766113281, | |
| "loss": 0.0, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 9.544073104858398, | |
| "rewards/margins": 45.42412185668945, | |
| "rewards/rejected": -35.88005065917969, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 2.4, | |
| "grad_norm": 4.26173210144043e-06, | |
| "learning_rate": 1.038715953491149e-05, | |
| "logits/chosen": -1.909058690071106, | |
| "logits/rejected": -1.5853359699249268, | |
| "logps/chosen": -406.30902099609375, | |
| "logps/rejected": -417.96429443359375, | |
| "loss": 0.0, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 12.841102600097656, | |
| "rewards/margins": 48.4782829284668, | |
| "rewards/rejected": -35.63717269897461, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 2.6, | |
| "grad_norm": 0.09912109375, | |
| "learning_rate": 8.211144743226819e-06, | |
| "logits/chosen": -1.847670555114746, | |
| "logits/rejected": -1.6100419759750366, | |
| "logps/chosen": -385.2706298828125, | |
| "logps/rejected": -452.8170166015625, | |
| "loss": 0.0, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 12.797687530517578, | |
| "rewards/margins": 51.022464752197266, | |
| "rewards/rejected": -38.22477722167969, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 2.8, | |
| "grad_norm": 6.693881005048752e-10, | |
| "learning_rate": 6.202294098882747e-06, | |
| "logits/chosen": -1.887666940689087, | |
| "logits/rejected": -1.6139150857925415, | |
| "logps/chosen": -366.9139709472656, | |
| "logps/rejected": -446.2010803222656, | |
| "loss": 0.0002, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 10.917724609375, | |
| "rewards/margins": 48.82371139526367, | |
| "rewards/rejected": -37.90598678588867, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 1.0695657692849636e-09, | |
| "learning_rate": 4.410072171736081e-06, | |
| "logits/chosen": -1.8766179084777832, | |
| "logits/rejected": -1.5880229473114014, | |
| "logps/chosen": -401.2027587890625, | |
| "logps/rejected": -485.7976989746094, | |
| "loss": 0.0001, | |
| "rewards/accuracies": 1.0, | |
| "rewards/chosen": 14.522769927978516, | |
| "rewards/margins": 52.987579345703125, | |
| "rewards/rejected": -38.46479797363281, | |
| "step": 1500 | |
| } | |
| ], | |
| "logging_steps": 100, | |
| "max_steps": 2000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 4, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |