DPTeeHee / trainer_state.json
Anderson1000's picture
Upload folder using huggingface_hub
58453a4 verified
Raw History Blame Contribute Delete
8.31 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 1500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.2,
"grad_norm": 1440.0,
"learning_rate": 2.9818992729986362e-05,
"logits/chosen": -0.7303402423858643,
"logits/rejected": -0.45186057686805725,
"logps/chosen": -394.23968505859375,
"logps/rejected": -349.1568298339844,
"loss": 3.1086,
"rewards/accuracies": 0.48500001430511475,
"rewards/chosen": -4.4438581466674805,
"rewards/margins": -0.3193548321723938,
"rewards/rejected": -4.124503135681152,
"step": 100
},
{
"epoch": 0.4,
"grad_norm": 556.0,
"learning_rate": 2.9273111183047722e-05,
"logits/chosen": -0.5820356011390686,
"logits/rejected": -0.45071941614151,
"logps/chosen": -419.5753479003906,
"logps/rejected": -373.3916320800781,
"loss": 3.3459,
"rewards/accuracies": 0.5299999713897705,
"rewards/chosen": -6.157695770263672,
"rewards/margins": 0.3280045986175537,
"rewards/rejected": -6.4857001304626465,
"step": 200
},
{
"epoch": 0.6,
"grad_norm": 1688.0,
"learning_rate": 2.837577826904226e-05,
"logits/chosen": -0.8348171710968018,
"logits/rejected": -0.6238606572151184,
"logps/chosen": -443.1069030761719,
"logps/rejected": -385.998779296875,
"loss": 3.7071,
"rewards/accuracies": 0.5849999785423279,
"rewards/chosen": -7.805955410003662,
"rewards/margins": 0.8645437359809875,
"rewards/rejected": -8.67049789428711,
"step": 300
},
{
"epoch": 0.8,
"grad_norm": 7.75,
"learning_rate": 2.714908930238998e-05,
"logits/chosen": -0.915019690990448,
"logits/rejected": -0.7366578578948975,
"logps/chosen": -466.5214538574219,
"logps/rejected": -348.214111328125,
"loss": 4.0855,
"rewards/accuracies": 0.4699999988079071,
"rewards/chosen": -7.924253463745117,
"rewards/margins": -0.6686192154884338,
"rewards/rejected": -7.255634784698486,
"step": 400
},
{
"epoch": 1.0,
"grad_norm": 1392.0,
"learning_rate": 2.5623249436597142e-05,
"logits/chosen": -1.1756317615509033,
"logits/rejected": -1.0033434629440308,
"logps/chosen": -446.835693359375,
"logps/rejected": -426.72015380859375,
"loss": 2.9222,
"rewards/accuracies": 0.5,
"rewards/chosen": -9.632830619812012,
"rewards/margins": 0.8283342123031616,
"rewards/rejected": -10.461165428161621,
"step": 500
},
{
"epoch": 1.2,
"grad_norm": 12.0,
"learning_rate": 2.3835829913131745e-05,
"logits/chosen": -1.8936198949813843,
"logits/rejected": -1.6783454418182373,
"logps/chosen": -393.1761474609375,
"logps/rejected": -409.0048522949219,
"loss": 0.2294,
"rewards/accuracies": 0.9599999785423279,
"rewards/chosen": 5.744272232055664,
"rewards/margins": 40.307220458984375,
"rewards/rejected": -34.562950134277344,
"step": 600
},
{
"epoch": 1.4,
"grad_norm": 0.0,
"learning_rate": 2.1830842932766803e-05,
"logits/chosen": -2.0007760524749756,
"logits/rejected": -1.7464280128479004,
"logps/chosen": -385.68499755859375,
"logps/rejected": -453.5122985839844,
"loss": 0.3262,
"rewards/accuracies": 0.9549999833106995,
"rewards/chosen": 8.030089378356934,
"rewards/margins": 44.05226516723633,
"rewards/rejected": -36.022178649902344,
"step": 700
},
{
"epoch": 1.6,
"grad_norm": 9.12696123123169e-08,
"learning_rate": 1.9657657929129185e-05,
"logits/chosen": -1.8635623455047607,
"logits/rejected": -1.603875994682312,
"logps/chosen": -411.04840087890625,
"logps/rejected": -464.8753967285156,
"loss": 0.1132,
"rewards/accuracies": 0.9700000286102295,
"rewards/chosen": 11.565813064575195,
"rewards/margins": 47.49372100830078,
"rewards/rejected": -35.92790985107422,
"step": 800
},
{
"epoch": 1.8,
"grad_norm": 0.0,
"learning_rate": 1.736978592939598e-05,
"logits/chosen": -1.9231587648391724,
"logits/rejected": -1.6588664054870605,
"logps/chosen": -414.5479736328125,
"logps/rejected": -444.71441650390625,
"loss": 0.0873,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 10.788975715637207,
"rewards/margins": 44.054561614990234,
"rewards/rejected": -33.26558303833008,
"step": 900
},
{
"epoch": 2.0,
"grad_norm": 0.091796875,
"learning_rate": 1.5023561935212463e-05,
"logits/chosen": -1.952134132385254,
"logits/rejected": -1.622839093208313,
"logps/chosen": -362.3935852050781,
"logps/rejected": -455.61383056640625,
"loss": 0.3025,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 9.277441024780273,
"rewards/margins": 44.19200134277344,
"rewards/rejected": -34.91455078125,
"step": 1000
},
{
"epoch": 2.2,
"grad_norm": 6.288290023803711e-06,
"learning_rate": 1.2676757767986436e-05,
"logits/chosen": -1.8726714849472046,
"logits/rejected": -1.6393769979476929,
"logps/chosen": -369.1127624511719,
"logps/rejected": -453.4897766113281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 9.544073104858398,
"rewards/margins": 45.42412185668945,
"rewards/rejected": -35.88005065917969,
"step": 1100
},
{
"epoch": 2.4,
"grad_norm": 4.26173210144043e-06,
"learning_rate": 1.038715953491149e-05,
"logits/chosen": -1.909058690071106,
"logits/rejected": -1.5853359699249268,
"logps/chosen": -406.30902099609375,
"logps/rejected": -417.96429443359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 12.841102600097656,
"rewards/margins": 48.4782829284668,
"rewards/rejected": -35.63717269897461,
"step": 1200
},
{
"epoch": 2.6,
"grad_norm": 0.09912109375,
"learning_rate": 8.211144743226819e-06,
"logits/chosen": -1.847670555114746,
"logits/rejected": -1.6100419759750366,
"logps/chosen": -385.2706298828125,
"logps/rejected": -452.8170166015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 12.797687530517578,
"rewards/margins": 51.022464752197266,
"rewards/rejected": -38.22477722167969,
"step": 1300
},
{
"epoch": 2.8,
"grad_norm": 6.693881005048752e-10,
"learning_rate": 6.202294098882747e-06,
"logits/chosen": -1.887666940689087,
"logits/rejected": -1.6139150857925415,
"logps/chosen": -366.9139709472656,
"logps/rejected": -446.2010803222656,
"loss": 0.0002,
"rewards/accuracies": 1.0,
"rewards/chosen": 10.917724609375,
"rewards/margins": 48.82371139526367,
"rewards/rejected": -37.90598678588867,
"step": 1400
},
{
"epoch": 3.0,
"grad_norm": 1.0695657692849636e-09,
"learning_rate": 4.410072171736081e-06,
"logits/chosen": -1.8766179084777832,
"logits/rejected": -1.5880229473114014,
"logps/chosen": -401.2027587890625,
"logps/rejected": -485.7976989746094,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 14.522769927978516,
"rewards/margins": 52.987579345703125,
"rewards/rejected": -38.46479797363281,
"step": 1500
}
],
"logging_steps": 100,
"max_steps": 2000,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}