{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.2, "grad_norm": 1440.0, "learning_rate": 2.9818992729986362e-05, "logits/chosen": -0.7303402423858643, "logits/rejected": -0.45186057686805725, "logps/chosen": -394.23968505859375, "logps/rejected": -349.1568298339844, "loss": 3.1086, "rewards/accuracies": 0.48500001430511475, "rewards/chosen": -4.4438581466674805, "rewards/margins": -0.3193548321723938, "rewards/rejected": -4.124503135681152, "step": 100 }, { "epoch": 0.4, "grad_norm": 556.0, "learning_rate": 2.9273111183047722e-05, "logits/chosen": -0.5820356011390686, "logits/rejected": -0.45071941614151, "logps/chosen": -419.5753479003906, "logps/rejected": -373.3916320800781, "loss": 3.3459, "rewards/accuracies": 0.5299999713897705, "rewards/chosen": -6.157695770263672, "rewards/margins": 0.3280045986175537, "rewards/rejected": -6.4857001304626465, "step": 200 }, { "epoch": 0.6, "grad_norm": 1688.0, "learning_rate": 2.837577826904226e-05, "logits/chosen": -0.8348171710968018, "logits/rejected": -0.6238606572151184, "logps/chosen": -443.1069030761719, "logps/rejected": -385.998779296875, "loss": 3.7071, "rewards/accuracies": 0.5849999785423279, "rewards/chosen": -7.805955410003662, "rewards/margins": 0.8645437359809875, "rewards/rejected": -8.67049789428711, "step": 300 }, { "epoch": 0.8, "grad_norm": 7.75, "learning_rate": 2.714908930238998e-05, "logits/chosen": -0.915019690990448, "logits/rejected": -0.7366578578948975, "logps/chosen": -466.5214538574219, "logps/rejected": -348.214111328125, "loss": 4.0855, "rewards/accuracies": 0.4699999988079071, "rewards/chosen": -7.924253463745117, "rewards/margins": -0.6686192154884338, "rewards/rejected": -7.255634784698486, "step": 400 }, { "epoch": 1.0, "grad_norm": 1392.0, "learning_rate": 2.5623249436597142e-05, "logits/chosen": -1.1756317615509033, "logits/rejected": -1.0033434629440308, "logps/chosen": -446.835693359375, "logps/rejected": -426.72015380859375, "loss": 2.9222, "rewards/accuracies": 0.5, "rewards/chosen": -9.632830619812012, "rewards/margins": 0.8283342123031616, "rewards/rejected": -10.461165428161621, "step": 500 }, { "epoch": 1.2, "grad_norm": 12.0, "learning_rate": 2.3835829913131745e-05, "logits/chosen": -1.8936198949813843, "logits/rejected": -1.6783454418182373, "logps/chosen": -393.1761474609375, "logps/rejected": -409.0048522949219, "loss": 0.2294, "rewards/accuracies": 0.9599999785423279, "rewards/chosen": 5.744272232055664, "rewards/margins": 40.307220458984375, "rewards/rejected": -34.562950134277344, "step": 600 }, { "epoch": 1.4, "grad_norm": 0.0, "learning_rate": 2.1830842932766803e-05, "logits/chosen": -2.0007760524749756, "logits/rejected": -1.7464280128479004, "logps/chosen": -385.68499755859375, "logps/rejected": -453.5122985839844, "loss": 0.3262, "rewards/accuracies": 0.9549999833106995, "rewards/chosen": 8.030089378356934, "rewards/margins": 44.05226516723633, "rewards/rejected": -36.022178649902344, "step": 700 }, { "epoch": 1.6, "grad_norm": 9.12696123123169e-08, "learning_rate": 1.9657657929129185e-05, "logits/chosen": -1.8635623455047607, "logits/rejected": -1.603875994682312, "logps/chosen": -411.04840087890625, "logps/rejected": -464.8753967285156, "loss": 0.1132, "rewards/accuracies": 0.9700000286102295, "rewards/chosen": 11.565813064575195, "rewards/margins": 47.49372100830078, "rewards/rejected": -35.92790985107422, "step": 800 }, { "epoch": 1.8, "grad_norm": 0.0, "learning_rate": 1.736978592939598e-05, "logits/chosen": -1.9231587648391724, "logits/rejected": -1.6588664054870605, "logps/chosen": -414.5479736328125, "logps/rejected": -444.71441650390625, "loss": 0.0873, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": 10.788975715637207, "rewards/margins": 44.054561614990234, "rewards/rejected": -33.26558303833008, "step": 900 }, { "epoch": 2.0, "grad_norm": 0.091796875, "learning_rate": 1.5023561935212463e-05, "logits/chosen": -1.952134132385254, "logits/rejected": -1.622839093208313, "logps/chosen": -362.3935852050781, "logps/rejected": -455.61383056640625, "loss": 0.3025, "rewards/accuracies": 0.9750000238418579, "rewards/chosen": 9.277441024780273, "rewards/margins": 44.19200134277344, "rewards/rejected": -34.91455078125, "step": 1000 }, { "epoch": 2.2, "grad_norm": 6.288290023803711e-06, "learning_rate": 1.2676757767986436e-05, "logits/chosen": -1.8726714849472046, "logits/rejected": -1.6393769979476929, "logps/chosen": -369.1127624511719, "logps/rejected": -453.4897766113281, "loss": 0.0, "rewards/accuracies": 1.0, "rewards/chosen": 9.544073104858398, "rewards/margins": 45.42412185668945, "rewards/rejected": -35.88005065917969, "step": 1100 }, { "epoch": 2.4, "grad_norm": 4.26173210144043e-06, "learning_rate": 1.038715953491149e-05, "logits/chosen": -1.909058690071106, "logits/rejected": -1.5853359699249268, "logps/chosen": -406.30902099609375, "logps/rejected": -417.96429443359375, "loss": 0.0, "rewards/accuracies": 1.0, "rewards/chosen": 12.841102600097656, "rewards/margins": 48.4782829284668, "rewards/rejected": -35.63717269897461, "step": 1200 }, { "epoch": 2.6, "grad_norm": 0.09912109375, "learning_rate": 8.211144743226819e-06, "logits/chosen": -1.847670555114746, "logits/rejected": -1.6100419759750366, "logps/chosen": -385.2706298828125, "logps/rejected": -452.8170166015625, "loss": 0.0, "rewards/accuracies": 1.0, "rewards/chosen": 12.797687530517578, "rewards/margins": 51.022464752197266, "rewards/rejected": -38.22477722167969, "step": 1300 }, { "epoch": 2.8, "grad_norm": 6.693881005048752e-10, "learning_rate": 6.202294098882747e-06, "logits/chosen": -1.887666940689087, "logits/rejected": -1.6139150857925415, "logps/chosen": -366.9139709472656, "logps/rejected": -446.2010803222656, "loss": 0.0002, "rewards/accuracies": 1.0, "rewards/chosen": 10.917724609375, "rewards/margins": 48.82371139526367, "rewards/rejected": -37.90598678588867, "step": 1400 }, { "epoch": 3.0, "grad_norm": 1.0695657692849636e-09, "learning_rate": 4.410072171736081e-06, "logits/chosen": -1.8766179084777832, "logits/rejected": -1.5880229473114014, "logps/chosen": -401.2027587890625, "logps/rejected": -485.7976989746094, "loss": 0.0001, "rewards/accuracies": 1.0, "rewards/chosen": 14.522769927978516, "rewards/margins": 52.987579345703125, "rewards/rejected": -38.46479797363281, "step": 1500 } ], "logging_steps": 100, "max_steps": 2000, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }