PrefDrive / PrefDrive_LoRA_Checkpoints /trainer_state.json
liyun0607's picture
Upload 11 files
d49b680 verified
Raw
History Blame Contribute Delete
471 kB
{
"best_metric": 3.39335244348149e-08,
"best_model_checkpoint": "/home/yunli/PycharmProjects/lmdrive/pythonProject/LMDrive_backup_20241129_230741/checkpoints/dpo-llama-7b-0119/checkpoint-7350",
"epoch": 2.978119935170178,
"eval_steps": 50,
"global_step": 7350,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.004051863857374392,
"grad_norm": 5.274203777313232,
"learning_rate": 1.3495276653171392e-07,
"logits/chosen": -1.389871597290039,
"logits/rejected": -1.7107175588607788,
"logps/chosen": -140.73594665527344,
"logps/rejected": -174.1074981689453,
"loss": 0.6924,
"rewards/accuracies": 0.4037036895751953,
"rewards/chosen": 0.0005688929231837392,
"rewards/margins": 0.0017482050461694598,
"rewards/rejected": -0.0011793121229857206,
"step": 10
},
{
"epoch": 0.008103727714748784,
"grad_norm": 5.223576545715332,
"learning_rate": 2.6990553306342785e-07,
"logits/chosen": -1.389092206954956,
"logits/rejected": -1.7161346673965454,
"logps/chosen": -140.68429565429688,
"logps/rejected": -173.65988159179688,
"loss": 0.692,
"rewards/accuracies": 0.5148148536682129,
"rewards/chosen": 0.0010909124976024032,
"rewards/margins": 0.0025206839200109243,
"rewards/rejected": -0.0014297709567472339,
"step": 20
},
{
"epoch": 0.012155591572123177,
"grad_norm": 4.924193859100342,
"learning_rate": 4.048582995951417e-07,
"logits/chosen": -1.3841500282287598,
"logits/rejected": -1.7277183532714844,
"logps/chosen": -141.29672241210938,
"logps/rejected": -173.36868286132812,
"loss": 0.6956,
"rewards/accuracies": 0.45555558800697327,
"rewards/chosen": -0.0018164401408284903,
"rewards/margins": -0.004576291423290968,
"rewards/rejected": 0.0027598512824624777,
"step": 30
},
{
"epoch": 0.01620745542949757,
"grad_norm": 4.993196964263916,
"learning_rate": 5.398110661268557e-07,
"logits/chosen": -1.3897249698638916,
"logits/rejected": -1.7075787782669067,
"logps/chosen": -140.5751495361328,
"logps/rejected": -173.57781982421875,
"loss": 0.6935,
"rewards/accuracies": 0.5333333611488342,
"rewards/chosen": -8.312358113471419e-05,
"rewards/margins": -0.0004725111648440361,
"rewards/rejected": 0.0003893872199114412,
"step": 40
},
{
"epoch": 0.02025931928687196,
"grad_norm": 5.012182712554932,
"learning_rate": 6.747638326585696e-07,
"logits/chosen": -1.3940094709396362,
"logits/rejected": -1.6996283531188965,
"logps/chosen": -140.99449157714844,
"logps/rejected": -173.8045196533203,
"loss": 0.6916,
"rewards/accuracies": 0.5851852297782898,
"rewards/chosen": 0.0015224766684696078,
"rewards/margins": 0.003430356504395604,
"rewards/rejected": -0.0019078799523413181,
"step": 50
},
{
"epoch": 0.02025931928687196,
"eval_logits/chosen": -1.4222594499588013,
"eval_logits/rejected": -1.712165355682373,
"eval_logps/chosen": -140.99501037597656,
"eval_logps/rejected": -173.00729370117188,
"eval_loss": 0.6892081499099731,
"eval_rewards/accuracies": 0.5962783098220825,
"eval_rewards/chosen": 0.0016927955439314246,
"eval_rewards/margins": 0.008146832697093487,
"eval_rewards/rejected": -0.006454036571085453,
"eval_runtime": 658.3826,
"eval_samples_per_second": 11.246,
"eval_steps_per_second": 0.626,
"step": 50
},
{
"epoch": 0.024311183144246355,
"grad_norm": 5.27742338180542,
"learning_rate": 8.097165991902834e-07,
"logits/chosen": -1.397972583770752,
"logits/rejected": -1.7362706661224365,
"logps/chosen": -141.21109008789062,
"logps/rejected": -173.7831573486328,
"loss": 0.6885,
"rewards/accuracies": 0.614814817905426,
"rewards/chosen": 0.0034686957951635122,
"rewards/margins": 0.009599005803465843,
"rewards/rejected": -0.006130308844149113,
"step": 60
},
{
"epoch": 0.028363047001620744,
"grad_norm": 5.308858394622803,
"learning_rate": 9.446693657219974e-07,
"logits/chosen": -1.4025647640228271,
"logits/rejected": -1.7040235996246338,
"logps/chosen": -140.78334045410156,
"logps/rejected": -173.06678771972656,
"loss": 0.6825,
"rewards/accuracies": 0.7444444894790649,
"rewards/chosen": 0.008767657913267612,
"rewards/margins": 0.02172079123556614,
"rewards/rejected": -0.012953130528330803,
"step": 70
},
{
"epoch": 0.03241491085899514,
"grad_norm": 5.703453540802002,
"learning_rate": 1.0796221322537114e-06,
"logits/chosen": -1.3840010166168213,
"logits/rejected": -1.6990751028060913,
"logps/chosen": -140.64222717285156,
"logps/rejected": -173.1254119873047,
"loss": 0.6762,
"rewards/accuracies": 0.8370370864868164,
"rewards/chosen": 0.014597690664231777,
"rewards/margins": 0.034553270787000656,
"rewards/rejected": -0.019955581054091454,
"step": 80
},
{
"epoch": 0.03646677471636953,
"grad_norm": 5.481204986572266,
"learning_rate": 1.214574898785425e-06,
"logits/chosen": -1.3807578086853027,
"logits/rejected": -1.6951088905334473,
"logps/chosen": -141.15838623046875,
"logps/rejected": -173.69468688964844,
"loss": 0.6647,
"rewards/accuracies": 0.9481481909751892,
"rewards/chosen": 0.021328728646039963,
"rewards/margins": 0.05808370187878609,
"rewards/rejected": -0.036754969507455826,
"step": 90
},
{
"epoch": 0.04051863857374392,
"grad_norm": 6.070982456207275,
"learning_rate": 1.3495276653171391e-06,
"logits/chosen": -1.385872483253479,
"logits/rejected": -1.6873222589492798,
"logps/chosen": -139.72789001464844,
"logps/rejected": -175.5059356689453,
"loss": 0.6509,
"rewards/accuracies": 0.9851852059364319,
"rewards/chosen": 0.03459228575229645,
"rewards/margins": 0.08671749383211136,
"rewards/rejected": -0.052125200629234314,
"step": 100
},
{
"epoch": 0.04051863857374392,
"eval_logits/chosen": -1.407914400100708,
"eval_logits/rejected": -1.7055085897445679,
"eval_logps/chosen": -140.61990356445312,
"eval_logps/rejected": -173.56077575683594,
"eval_loss": 0.6440849900245667,
"eval_rewards/accuracies": 0.9978424906730652,
"eval_rewards/chosen": 0.039202068001031876,
"eval_rewards/margins": 0.10100384056568146,
"eval_rewards/rejected": -0.06180177628993988,
"eval_runtime": 658.1987,
"eval_samples_per_second": 11.249,
"eval_steps_per_second": 0.626,
"step": 100
},
{
"epoch": 0.04457050243111831,
"grad_norm": 6.017471790313721,
"learning_rate": 1.4844804318488532e-06,
"logits/chosen": -1.3702425956726074,
"logits/rejected": -1.7028979063034058,
"logps/chosen": -140.50172424316406,
"logps/rejected": -174.5872039794922,
"loss": 0.6319,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.046755120158195496,
"rewards/margins": 0.12688639760017395,
"rewards/rejected": -0.08013126999139786,
"step": 110
},
{
"epoch": 0.04862236628849271,
"grad_norm": 6.183459758758545,
"learning_rate": 1.6194331983805669e-06,
"logits/chosen": -1.3835982084274292,
"logits/rejected": -1.6761491298675537,
"logps/chosen": -141.2493133544922,
"logps/rejected": -174.39820861816406,
"loss": 0.6077,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.06035376712679863,
"rewards/margins": 0.17960818111896515,
"rewards/rejected": -0.11925441771745682,
"step": 120
},
{
"epoch": 0.0526742301458671,
"grad_norm": 6.137373447418213,
"learning_rate": 1.7543859649122807e-06,
"logits/chosen": -1.3722988367080688,
"logits/rejected": -1.683157205581665,
"logps/chosen": -140.2217254638672,
"logps/rejected": -174.78143310546875,
"loss": 0.5756,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.09007852524518967,
"rewards/margins": 0.2515007555484772,
"rewards/rejected": -0.1614222228527069,
"step": 130
},
{
"epoch": 0.05672609400324149,
"grad_norm": 6.078924655914307,
"learning_rate": 1.8893387314439948e-06,
"logits/chosen": -1.3697142601013184,
"logits/rejected": -1.7017598152160645,
"logps/chosen": -140.21607971191406,
"logps/rejected": -175.9543914794922,
"loss": 0.5324,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.12757784128189087,
"rewards/margins": 0.3537607789039612,
"rewards/rejected": -0.2261829674243927,
"step": 140
},
{
"epoch": 0.060777957860615885,
"grad_norm": 6.127475738525391,
"learning_rate": 2.0242914979757085e-06,
"logits/chosen": -1.3413002490997314,
"logits/rejected": -1.6914191246032715,
"logps/chosen": -139.25411987304688,
"logps/rejected": -176.62246704101562,
"loss": 0.4718,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.17613837122917175,
"rewards/margins": 0.5081630349159241,
"rewards/rejected": -0.3320246636867523,
"step": 150
},
{
"epoch": 0.060777957860615885,
"eval_logits/chosen": -1.3611022233963013,
"eval_logits/rejected": -1.6823441982269287,
"eval_logps/chosen": -138.89381408691406,
"eval_logps/rejected": -176.76927185058594,
"eval_loss": 0.4402141571044922,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 0.21181075274944305,
"eval_rewards/margins": 0.5944603085517883,
"eval_rewards/rejected": -0.38264963030815125,
"eval_runtime": 658.4077,
"eval_samples_per_second": 11.245,
"eval_steps_per_second": 0.626,
"step": 150
},
{
"epoch": 0.06482982171799027,
"grad_norm": 5.659084320068359,
"learning_rate": 2.1592442645074228e-06,
"logits/chosen": -1.3335126638412476,
"logits/rejected": -1.6974385976791382,
"logps/chosen": -138.15963745117188,
"logps/rejected": -178.5204620361328,
"loss": 0.3991,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.23877687752246857,
"rewards/margins": 0.7170161008834839,
"rewards/rejected": -0.4782392084598541,
"step": 160
},
{
"epoch": 0.06888168557536467,
"grad_norm": 5.250364303588867,
"learning_rate": 2.2941970310391366e-06,
"logits/chosen": -1.3537461757659912,
"logits/rejected": -1.6897337436676025,
"logps/chosen": -138.07557678222656,
"logps/rejected": -179.66754150390625,
"loss": 0.3186,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.31979554891586304,
"rewards/margins": 0.9889208078384399,
"rewards/rejected": -0.6691252589225769,
"step": 170
},
{
"epoch": 0.07293354943273905,
"grad_norm": 4.185105323791504,
"learning_rate": 2.42914979757085e-06,
"logits/chosen": -1.3450257778167725,
"logits/rejected": -1.6798862218856812,
"logps/chosen": -136.57334899902344,
"logps/rejected": -182.96791076660156,
"loss": 0.233,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.41608288884162903,
"rewards/margins": 1.3557884693145752,
"rewards/rejected": -0.939705491065979,
"step": 180
},
{
"epoch": 0.07698541329011345,
"grad_norm": 3.020256757736206,
"learning_rate": 2.564102564102564e-06,
"logits/chosen": -1.3098284006118774,
"logits/rejected": -1.6822631359100342,
"logps/chosen": -135.35049438476562,
"logps/rejected": -186.5647430419922,
"loss": 0.147,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.542268693447113,
"rewards/margins": 1.874348521232605,
"rewards/rejected": -1.3320801258087158,
"step": 190
},
{
"epoch": 0.08103727714748785,
"grad_norm": 1.9457216262817383,
"learning_rate": 2.6990553306342783e-06,
"logits/chosen": -1.299726963043213,
"logits/rejected": -1.669050693511963,
"logps/chosen": -134.02984619140625,
"logps/rejected": -189.47650146484375,
"loss": 0.0919,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6734461188316345,
"rewards/margins": 2.4008948802948,
"rewards/rejected": -1.72744882106781,
"step": 200
},
{
"epoch": 0.08103727714748785,
"eval_logits/chosen": -1.3029390573501587,
"eval_logits/rejected": -1.6757805347442627,
"eval_logps/chosen": -133.63436889648438,
"eval_logps/rejected": -193.24513244628906,
"eval_loss": 0.06510648131370544,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 0.737756073474884,
"eval_rewards/margins": 2.767993927001953,
"eval_rewards/rejected": -2.030237913131714,
"eval_runtime": 658.3066,
"eval_samples_per_second": 11.247,
"eval_steps_per_second": 0.626,
"step": 200
},
{
"epoch": 0.08508914100486224,
"grad_norm": 0.9668936729431152,
"learning_rate": 2.834008097165992e-06,
"logits/chosen": -1.265693187713623,
"logits/rejected": -1.6668410301208496,
"logps/chosen": -132.6597137451172,
"logps/rejected": -195.42698669433594,
"loss": 0.0489,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.8187379837036133,
"rewards/margins": 3.1014816761016846,
"rewards/rejected": -2.2827439308166504,
"step": 210
},
{
"epoch": 0.08914100486223663,
"grad_norm": 0.540846586227417,
"learning_rate": 2.9689608636977064e-06,
"logits/chosen": -1.2424174547195435,
"logits/rejected": -1.6324236392974854,
"logps/chosen": -130.07528686523438,
"logps/rejected": -203.93658447265625,
"loss": 0.0213,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.9762877225875854,
"rewards/margins": 4.0026092529296875,
"rewards/rejected": -3.0263214111328125,
"step": 220
},
{
"epoch": 0.09319286871961102,
"grad_norm": 0.24707287549972534,
"learning_rate": 3.10391363022942e-06,
"logits/chosen": -1.196012020111084,
"logits/rejected": -1.600135326385498,
"logps/chosen": -128.6001434326172,
"logps/rejected": -211.2908172607422,
"loss": 0.0094,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.1740548610687256,
"rewards/margins": 4.888430595397949,
"rewards/rejected": -3.7143759727478027,
"step": 230
},
{
"epoch": 0.09724473257698542,
"grad_norm": 0.13641344010829926,
"learning_rate": 3.2388663967611337e-06,
"logits/chosen": -1.1732877492904663,
"logits/rejected": -1.5239564180374146,
"logps/chosen": -127.9998550415039,
"logps/rejected": -216.40830993652344,
"loss": 0.0041,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.3555636405944824,
"rewards/margins": 5.810600757598877,
"rewards/rejected": -4.455036640167236,
"step": 240
},
{
"epoch": 0.1012965964343598,
"grad_norm": 0.08147130161523819,
"learning_rate": 3.373819163292848e-06,
"logits/chosen": -1.123272180557251,
"logits/rejected": -1.5325947999954224,
"logps/chosen": -124.99156188964844,
"logps/rejected": -224.6184844970703,
"loss": 0.002,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.5564848184585571,
"rewards/margins": 6.633443832397461,
"rewards/rejected": -5.076958656311035,
"step": 250
},
{
"epoch": 0.1012965964343598,
"eval_logits/chosen": -1.1526036262512207,
"eval_logits/rejected": -1.5364301204681396,
"eval_logps/chosen": -125.28230285644531,
"eval_logps/rejected": -226.2448272705078,
"eval_loss": 0.0015159068861976266,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 1.572962760925293,
"eval_rewards/margins": 6.90316915512085,
"eval_rewards/rejected": -5.330205917358398,
"eval_runtime": 658.1337,
"eval_samples_per_second": 11.25,
"eval_steps_per_second": 0.626,
"step": 250
},
{
"epoch": 0.1053484602917342,
"grad_norm": 0.06831583380699158,
"learning_rate": 3.5087719298245615e-06,
"logits/chosen": -1.11264169216156,
"logits/rejected": -1.521393060684204,
"logps/chosen": -124.75511169433594,
"logps/rejected": -229.17233276367188,
"loss": 0.0012,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.65181565284729,
"rewards/margins": 7.160605430603027,
"rewards/rejected": -5.508789539337158,
"step": 260
},
{
"epoch": 0.1094003241491086,
"grad_norm": 0.021368836984038353,
"learning_rate": 3.6437246963562758e-06,
"logits/chosen": -1.126573920249939,
"logits/rejected": -1.5180697441101074,
"logps/chosen": -124.58089447021484,
"logps/rejected": -231.1531219482422,
"loss": 0.0008,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.7233182191848755,
"rewards/margins": 7.557948112487793,
"rewards/rejected": -5.834630489349365,
"step": 270
},
{
"epoch": 0.11345218800648298,
"grad_norm": 0.022432563826441765,
"learning_rate": 3.7786774628879896e-06,
"logits/chosen": -1.1377226114273071,
"logits/rejected": -1.5355565547943115,
"logps/chosen": -122.95037078857422,
"logps/rejected": -234.68670654296875,
"loss": 0.0005,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.7897114753723145,
"rewards/margins": 7.988018989562988,
"rewards/rejected": -6.198306083679199,
"step": 280
},
{
"epoch": 0.11750405186385737,
"grad_norm": 0.019663700833916664,
"learning_rate": 3.9136302294197035e-06,
"logits/chosen": -1.131860613822937,
"logits/rejected": -1.4960014820098877,
"logps/chosen": -122.1822738647461,
"logps/rejected": -235.7807159423828,
"loss": 0.0005,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.825466513633728,
"rewards/margins": 8.117959022521973,
"rewards/rejected": -6.292492389678955,
"step": 290
},
{
"epoch": 0.12155591572123177,
"grad_norm": 0.017695888876914978,
"learning_rate": 4.048582995951417e-06,
"logits/chosen": -1.13109290599823,
"logits/rejected": -1.53248929977417,
"logps/chosen": -122.07437133789062,
"logps/rejected": -237.8642120361328,
"loss": 0.0005,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.871293306350708,
"rewards/margins": 8.233868598937988,
"rewards/rejected": -6.362576484680176,
"step": 300
},
{
"epoch": 0.12155591572123177,
"eval_logits/chosen": -1.134786605834961,
"eval_logits/rejected": -1.5121405124664307,
"eval_logps/chosen": -122.26962280273438,
"eval_logps/rejected": -237.97372436523438,
"eval_loss": 0.00040686846477910876,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 1.8742293119430542,
"eval_rewards/margins": 8.377324104309082,
"eval_rewards/rejected": -6.50309419631958,
"eval_runtime": 658.1422,
"eval_samples_per_second": 11.25,
"eval_steps_per_second": 0.626,
"step": 300
},
{
"epoch": 0.12560777957860617,
"grad_norm": 0.012135895900428295,
"learning_rate": 4.183535762483131e-06,
"logits/chosen": -1.109740972518921,
"logits/rejected": -1.5193902254104614,
"logps/chosen": -121.0916519165039,
"logps/rejected": -240.30992126464844,
"loss": 0.0004,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.9484295845031738,
"rewards/margins": 8.592082023620605,
"rewards/rejected": -6.643653392791748,
"step": 310
},
{
"epoch": 0.12965964343598055,
"grad_norm": 0.010144763626158237,
"learning_rate": 4.3184885290148456e-06,
"logits/chosen": -1.1031049489974976,
"logits/rejected": -1.533254861831665,
"logps/chosen": -120.3249282836914,
"logps/rejected": -242.37258911132812,
"loss": 0.0003,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.9627697467803955,
"rewards/margins": 8.811460494995117,
"rewards/rejected": -6.848690986633301,
"step": 320
},
{
"epoch": 0.13371150729335493,
"grad_norm": 0.010636514984071255,
"learning_rate": 4.453441295546559e-06,
"logits/chosen": -1.1099517345428467,
"logits/rejected": -1.4838870763778687,
"logps/chosen": -120.37928771972656,
"logps/rejected": -243.31271362304688,
"loss": 0.0002,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.9846471548080444,
"rewards/margins": 8.979297637939453,
"rewards/rejected": -6.994650363922119,
"step": 330
},
{
"epoch": 0.13776337115072934,
"grad_norm": 0.011891559697687626,
"learning_rate": 4.588394062078273e-06,
"logits/chosen": -1.1261647939682007,
"logits/rejected": -1.5122199058532715,
"logps/chosen": -120.46336364746094,
"logps/rejected": -244.4058380126953,
"loss": 0.0002,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.024125337600708,
"rewards/margins": 9.096206665039062,
"rewards/rejected": -7.072080135345459,
"step": 340
},
{
"epoch": 0.14181523500810372,
"grad_norm": 0.008843648247420788,
"learning_rate": 4.723346828609987e-06,
"logits/chosen": -1.117754340171814,
"logits/rejected": -1.5109072923660278,
"logps/chosen": -120.10042572021484,
"logps/rejected": -245.29542541503906,
"loss": 0.0002,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.0470709800720215,
"rewards/margins": 9.163729667663574,
"rewards/rejected": -7.116659164428711,
"step": 350
},
{
"epoch": 0.14181523500810372,
"eval_logits/chosen": -1.1409276723861694,
"eval_logits/rejected": -1.519826889038086,
"eval_logps/chosen": -120.77721405029297,
"eval_logps/rejected": -244.39198303222656,
"eval_loss": 0.0002016112848650664,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.023472547531128,
"eval_rewards/margins": 9.168397903442383,
"eval_rewards/rejected": -7.144925117492676,
"eval_runtime": 658.0871,
"eval_samples_per_second": 11.251,
"eval_steps_per_second": 0.626,
"step": 350
},
{
"epoch": 0.1458670988654781,
"grad_norm": 0.01200284343212843,
"learning_rate": 4.8582995951417e-06,
"logits/chosen": -1.1370290517807007,
"logits/rejected": -1.5248901844024658,
"logps/chosen": -120.55464172363281,
"logps/rejected": -247.7692413330078,
"loss": 0.0002,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.083092212677002,
"rewards/margins": 9.412875175476074,
"rewards/rejected": -7.3297834396362305,
"step": 360
},
{
"epoch": 0.14991896272285252,
"grad_norm": 0.005621300544589758,
"learning_rate": 4.9932523616734145e-06,
"logits/chosen": -1.1131725311279297,
"logits/rejected": -1.519146203994751,
"logps/chosen": -120.15304565429688,
"logps/rejected": -246.8217315673828,
"loss": 0.0002,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.124485731124878,
"rewards/margins": 9.502544403076172,
"rewards/rejected": -7.378057956695557,
"step": 370
},
{
"epoch": 0.1539708265802269,
"grad_norm": 0.004424644634127617,
"learning_rate": 5.128205128205128e-06,
"logits/chosen": -1.1332614421844482,
"logits/rejected": -1.5120524168014526,
"logps/chosen": -120.06082916259766,
"logps/rejected": -248.7280731201172,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.0993828773498535,
"rewards/margins": 9.636995315551758,
"rewards/rejected": -7.5376129150390625,
"step": 380
},
{
"epoch": 0.1580226904376013,
"grad_norm": 0.005630790255963802,
"learning_rate": 5.263157894736842e-06,
"logits/chosen": -1.116791844367981,
"logits/rejected": -1.5200690031051636,
"logps/chosen": -118.8879165649414,
"logps/rejected": -248.0203399658203,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.148820400238037,
"rewards/margins": 9.649928092956543,
"rewards/rejected": -7.501107215881348,
"step": 390
},
{
"epoch": 0.1620745542949757,
"grad_norm": 0.007051733788102865,
"learning_rate": 5.3981106612685565e-06,
"logits/chosen": -1.099058747291565,
"logits/rejected": -1.481469988822937,
"logps/chosen": -119.5155258178711,
"logps/rejected": -250.01971435546875,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.180222749710083,
"rewards/margins": 9.90124797821045,
"rewards/rejected": -7.721026420593262,
"step": 400
},
{
"epoch": 0.1620745542949757,
"eval_logits/chosen": -1.1320279836654663,
"eval_logits/rejected": -1.522124171257019,
"eval_logps/chosen": -119.53314971923828,
"eval_logps/rejected": -249.70321655273438,
"eval_loss": 0.00011243653716519475,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.1478781700134277,
"eval_rewards/margins": 9.82392692565918,
"eval_rewards/rejected": -7.6760478019714355,
"eval_runtime": 658.0443,
"eval_samples_per_second": 11.252,
"eval_steps_per_second": 0.626,
"step": 400
},
{
"epoch": 0.16612641815235007,
"grad_norm": 0.007869623601436615,
"learning_rate": 5.533063427800271e-06,
"logits/chosen": -1.1087368726730347,
"logits/rejected": -1.4966099262237549,
"logps/chosen": -118.79527282714844,
"logps/rejected": -250.2746124267578,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.1891911029815674,
"rewards/margins": 9.879663467407227,
"rewards/rejected": -7.6904730796813965,
"step": 410
},
{
"epoch": 0.17017828200972449,
"grad_norm": 0.0037466222420334816,
"learning_rate": 5.668016194331984e-06,
"logits/chosen": -1.1184862852096558,
"logits/rejected": -1.503065586090088,
"logps/chosen": -118.98182678222656,
"logps/rejected": -252.21949768066406,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.2015702724456787,
"rewards/margins": 10.133565902709961,
"rewards/rejected": -7.931995868682861,
"step": 420
},
{
"epoch": 0.17423014586709887,
"grad_norm": 0.002610385650768876,
"learning_rate": 5.8029689608636986e-06,
"logits/chosen": -1.0745251178741455,
"logits/rejected": -1.5020885467529297,
"logps/chosen": -118.70890045166016,
"logps/rejected": -254.2556915283203,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.255699396133423,
"rewards/margins": 10.259760856628418,
"rewards/rejected": -8.004060745239258,
"step": 430
},
{
"epoch": 0.17828200972447325,
"grad_norm": 0.0037527934182435274,
"learning_rate": 5.937921727395413e-06,
"logits/chosen": -1.0715187788009644,
"logits/rejected": -1.4950731992721558,
"logps/chosen": -117.52845001220703,
"logps/rejected": -253.7173614501953,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.288992404937744,
"rewards/margins": 10.322542190551758,
"rewards/rejected": -8.033550262451172,
"step": 440
},
{
"epoch": 0.18233387358184766,
"grad_norm": 0.004331698641180992,
"learning_rate": 6.0728744939271254e-06,
"logits/chosen": -1.0888125896453857,
"logits/rejected": -1.5274492502212524,
"logps/chosen": -118.01427459716797,
"logps/rejected": -256.4695739746094,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.280319929122925,
"rewards/margins": 10.511781692504883,
"rewards/rejected": -8.231461524963379,
"step": 450
},
{
"epoch": 0.18233387358184766,
"eval_logits/chosen": -1.091180443763733,
"eval_logits/rejected": -1.5023369789123535,
"eval_logps/chosen": -118.44429016113281,
"eval_logps/rejected": -254.42095947265625,
"eval_loss": 6.72021706122905e-05,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.2567639350891113,
"eval_rewards/margins": 10.404584884643555,
"eval_rewards/rejected": -8.147821426391602,
"eval_runtime": 658.0769,
"eval_samples_per_second": 11.251,
"eval_steps_per_second": 0.626,
"step": 450
},
{
"epoch": 0.18638573743922204,
"grad_norm": 0.0027279488276690245,
"learning_rate": 6.20782726045884e-06,
"logits/chosen": -1.087437391281128,
"logits/rejected": -1.5125293731689453,
"logps/chosen": -118.81121063232422,
"logps/rejected": -255.43765258789062,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.273927927017212,
"rewards/margins": 10.494739532470703,
"rewards/rejected": -8.220812797546387,
"step": 460
},
{
"epoch": 0.19043760129659643,
"grad_norm": 0.0034659032244235277,
"learning_rate": 6.342780026990554e-06,
"logits/chosen": -1.077628493309021,
"logits/rejected": -1.4835717678070068,
"logps/chosen": -117.53942108154297,
"logps/rejected": -256.7050476074219,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.338557720184326,
"rewards/margins": 10.676908493041992,
"rewards/rejected": -8.33835220336914,
"step": 470
},
{
"epoch": 0.19448946515397084,
"grad_norm": 0.0018187056994065642,
"learning_rate": 6.4777327935222675e-06,
"logits/chosen": -1.0798588991165161,
"logits/rejected": -1.5022971630096436,
"logps/chosen": -116.7596664428711,
"logps/rejected": -258.91400146484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.3907530307769775,
"rewards/margins": 10.954094886779785,
"rewards/rejected": -8.563342094421387,
"step": 480
},
{
"epoch": 0.19854132901134522,
"grad_norm": 0.003787844907492399,
"learning_rate": 6.612685560053982e-06,
"logits/chosen": -1.0318020582199097,
"logits/rejected": -1.4701728820800781,
"logps/chosen": -118.04106903076172,
"logps/rejected": -257.62615966796875,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.336604118347168,
"rewards/margins": 10.68603515625,
"rewards/rejected": -8.349430084228516,
"step": 490
},
{
"epoch": 0.2025931928687196,
"grad_norm": 0.001693087164312601,
"learning_rate": 6.747638326585696e-06,
"logits/chosen": -1.0626085996627808,
"logits/rejected": -1.4769538640975952,
"logps/chosen": -117.07071685791016,
"logps/rejected": -257.8610534667969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.3624086380004883,
"rewards/margins": 10.87511157989502,
"rewards/rejected": -8.512703895568848,
"step": 500
},
{
"epoch": 0.2025931928687196,
"eval_logits/chosen": -1.078675627708435,
"eval_logits/rejected": -1.4860773086547852,
"eval_logps/chosen": -117.57008361816406,
"eval_logps/rejected": -258.2732849121094,
"eval_loss": 4.4150063331471756e-05,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.3441848754882812,
"eval_rewards/margins": 10.877237319946289,
"eval_rewards/rejected": -8.533052444458008,
"eval_runtime": 657.9761,
"eval_samples_per_second": 11.253,
"eval_steps_per_second": 0.626,
"step": 500
},
{
"epoch": 0.206645056726094,
"grad_norm": 0.001665365183725953,
"learning_rate": 6.882591093117409e-06,
"logits/chosen": -1.0459882020950317,
"logits/rejected": -1.4801123142242432,
"logps/chosen": -116.1864242553711,
"logps/rejected": -259.5511779785156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.4086875915527344,
"rewards/margins": 11.01952838897705,
"rewards/rejected": -8.610840797424316,
"step": 510
},
{
"epoch": 0.2106969205834684,
"grad_norm": 0.0014464287087321281,
"learning_rate": 7.017543859649123e-06,
"logits/chosen": -1.0493347644805908,
"logits/rejected": -1.4791755676269531,
"logps/chosen": -115.95133972167969,
"logps/rejected": -260.8875427246094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.4290733337402344,
"rewards/margins": 11.176859855651855,
"rewards/rejected": -8.747786521911621,
"step": 520
},
{
"epoch": 0.21474878444084278,
"grad_norm": 0.0018413382349535823,
"learning_rate": 7.152496626180837e-06,
"logits/chosen": -1.0302752256393433,
"logits/rejected": -1.4574908018112183,
"logps/chosen": -116.60781860351562,
"logps/rejected": -261.29876708984375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.466017484664917,
"rewards/margins": 11.22760009765625,
"rewards/rejected": -8.761584281921387,
"step": 530
},
{
"epoch": 0.2188006482982172,
"grad_norm": 0.0014453129842877388,
"learning_rate": 7.2874493927125516e-06,
"logits/chosen": -1.05780827999115,
"logits/rejected": -1.4844599962234497,
"logps/chosen": -116.33468627929688,
"logps/rejected": -260.7745666503906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.44503116607666,
"rewards/margins": 11.185885429382324,
"rewards/rejected": -8.74085521697998,
"step": 540
},
{
"epoch": 0.22285251215559157,
"grad_norm": 0.002703328849747777,
"learning_rate": 7.422402159244265e-06,
"logits/chosen": -1.0520823001861572,
"logits/rejected": -1.4584662914276123,
"logps/chosen": -116.45873260498047,
"logps/rejected": -262.7840576171875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.4690232276916504,
"rewards/margins": 11.33821964263916,
"rewards/rejected": -8.869195938110352,
"step": 550
},
{
"epoch": 0.22285251215559157,
"eval_logits/chosen": -1.0702204704284668,
"eval_logits/rejected": -1.4801982641220093,
"eval_logps/chosen": -116.69920349121094,
"eval_logps/rejected": -261.5146789550781,
"eval_loss": 3.066386852879077e-05,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.4312729835510254,
"eval_rewards/margins": 11.288468360900879,
"eval_rewards/rejected": -8.857195854187012,
"eval_runtime": 657.8882,
"eval_samples_per_second": 11.254,
"eval_steps_per_second": 0.626,
"step": 550
},
{
"epoch": 0.22690437601296595,
"grad_norm": 0.0012216470204293728,
"learning_rate": 7.557354925775979e-06,
"logits/chosen": -1.0269840955734253,
"logits/rejected": -1.4592022895812988,
"logps/chosen": -116.34583282470703,
"logps/rejected": -263.69110107421875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.5144259929656982,
"rewards/margins": 11.517362594604492,
"rewards/rejected": -9.002935409545898,
"step": 560
},
{
"epoch": 0.23095623987034036,
"grad_norm": 0.0007370927487500012,
"learning_rate": 7.692307692307694e-06,
"logits/chosen": -1.0158203840255737,
"logits/rejected": -1.447105050086975,
"logps/chosen": -116.02507781982422,
"logps/rejected": -264.2305603027344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.493821382522583,
"rewards/margins": 11.59961986541748,
"rewards/rejected": -9.105795860290527,
"step": 570
},
{
"epoch": 0.23500810372771475,
"grad_norm": 0.0022627676371484995,
"learning_rate": 7.827260458839407e-06,
"logits/chosen": -1.0068782567977905,
"logits/rejected": -1.4721413850784302,
"logps/chosen": -116.01976776123047,
"logps/rejected": -264.0223083496094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.528806209564209,
"rewards/margins": 11.57716178894043,
"rewards/rejected": -9.048355102539062,
"step": 580
},
{
"epoch": 0.23905996758508913,
"grad_norm": 0.0015734812477603555,
"learning_rate": 7.96221322537112e-06,
"logits/chosen": -1.008754014968872,
"logits/rejected": -1.4133723974227905,
"logps/chosen": -116.37065124511719,
"logps/rejected": -264.7450866699219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.539128065109253,
"rewards/margins": 11.731771469116211,
"rewards/rejected": -9.192643165588379,
"step": 590
},
{
"epoch": 0.24311183144246354,
"grad_norm": 0.0008875586208887398,
"learning_rate": 8.097165991902834e-06,
"logits/chosen": -1.0271269083023071,
"logits/rejected": -1.4361445903778076,
"logps/chosen": -115.80826568603516,
"logps/rejected": -264.06683349609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.54843807220459,
"rewards/margins": 11.632083892822266,
"rewards/rejected": -9.083645820617676,
"step": 600
},
{
"epoch": 0.24311183144246354,
"eval_logits/chosen": -1.0300260782241821,
"eval_logits/rejected": -1.443122386932373,
"eval_logps/chosen": -115.9371109008789,
"eval_logps/rejected": -264.74847412109375,
"eval_loss": 2.165735168091487e-05,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.507481813430786,
"eval_rewards/margins": 11.688055038452148,
"eval_rewards/rejected": -9.180574417114258,
"eval_runtime": 658.0461,
"eval_samples_per_second": 11.251,
"eval_steps_per_second": 0.626,
"step": 600
},
{
"epoch": 0.24716369529983792,
"grad_norm": 0.0007235104567371309,
"learning_rate": 8.232118758434549e-06,
"logits/chosen": -1.0256165266036987,
"logits/rejected": -1.4475750923156738,
"logps/chosen": -114.85009765625,
"logps/rejected": -264.8584289550781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.5647478103637695,
"rewards/margins": 11.745806694030762,
"rewards/rejected": -9.181057929992676,
"step": 610
},
{
"epoch": 0.25121555915721233,
"grad_norm": 0.0009592686546966434,
"learning_rate": 8.367071524966263e-06,
"logits/chosen": -0.9948481917381287,
"logits/rejected": -1.4419747591018677,
"logps/chosen": -116.20551300048828,
"logps/rejected": -267.3464660644531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.584946870803833,
"rewards/margins": 11.9420747756958,
"rewards/rejected": -9.357129096984863,
"step": 620
},
{
"epoch": 0.2552674230145867,
"grad_norm": 0.0018740741070359945,
"learning_rate": 8.502024291497976e-06,
"logits/chosen": -1.0022295713424683,
"logits/rejected": -1.404227614402771,
"logps/chosen": -115.06513214111328,
"logps/rejected": -266.9801025390625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.606013774871826,
"rewards/margins": 11.995136260986328,
"rewards/rejected": -9.389123916625977,
"step": 630
},
{
"epoch": 0.2593192868719611,
"grad_norm": 0.0010919544147327542,
"learning_rate": 8.636977058029691e-06,
"logits/chosen": -0.9951332211494446,
"logits/rejected": -1.448172926902771,
"logps/chosen": -114.10124969482422,
"logps/rejected": -268.3458557128906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.6123576164245605,
"rewards/margins": 12.068544387817383,
"rewards/rejected": -9.45618724822998,
"step": 640
},
{
"epoch": 0.2633711507293355,
"grad_norm": 0.0008402303792536259,
"learning_rate": 8.771929824561405e-06,
"logits/chosen": -1.0138694047927856,
"logits/rejected": -1.4006102085113525,
"logps/chosen": -115.1278076171875,
"logps/rejected": -268.4206237792969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.596374750137329,
"rewards/margins": 12.014070510864258,
"rewards/rejected": -9.417695999145508,
"step": 650
},
{
"epoch": 0.2633711507293355,
"eval_logits/chosen": -1.031700849533081,
"eval_logits/rejected": -1.4289768934249878,
"eval_logps/chosen": -115.24848175048828,
"eval_logps/rejected": -267.67767333984375,
"eval_loss": 1.5523668480454944e-05,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.576345682144165,
"eval_rewards/margins": 12.049837112426758,
"eval_rewards/rejected": -9.473491668701172,
"eval_runtime": 658.0307,
"eval_samples_per_second": 11.252,
"eval_steps_per_second": 0.626,
"step": 650
},
{
"epoch": 0.26742301458670986,
"grad_norm": 0.0010203344281762838,
"learning_rate": 8.906882591093118e-06,
"logits/chosen": -0.9803736209869385,
"logits/rejected": -1.3996490240097046,
"logps/chosen": -113.33806610107422,
"logps/rejected": -269.2818603515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.6770434379577637,
"rewards/margins": 12.208734512329102,
"rewards/rejected": -9.53169059753418,
"step": 660
},
{
"epoch": 0.2714748784440843,
"grad_norm": 0.0009641316719353199,
"learning_rate": 9.041835357624831e-06,
"logits/chosen": -1.0069340467453003,
"logits/rejected": -1.416864275932312,
"logps/chosen": -114.13117218017578,
"logps/rejected": -268.98675537109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.6602096557617188,
"rewards/margins": 12.218779563903809,
"rewards/rejected": -9.558568954467773,
"step": 670
},
{
"epoch": 0.2755267423014587,
"grad_norm": 0.0004945212276652455,
"learning_rate": 9.176788124156547e-06,
"logits/chosen": -1.000825047492981,
"logits/rejected": -1.411185622215271,
"logps/chosen": -114.98800659179688,
"logps/rejected": -272.5845031738281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.673659563064575,
"rewards/margins": 12.43789005279541,
"rewards/rejected": -9.764229774475098,
"step": 680
},
{
"epoch": 0.27957860615883307,
"grad_norm": 0.0016324473544955254,
"learning_rate": 9.31174089068826e-06,
"logits/chosen": -0.980940043926239,
"logits/rejected": -1.3893826007843018,
"logps/chosen": -114.27484893798828,
"logps/rejected": -269.0587158203125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.6675384044647217,
"rewards/margins": 12.248590469360352,
"rewards/rejected": -9.58105182647705,
"step": 690
},
{
"epoch": 0.28363047001620745,
"grad_norm": 0.0005120071582496166,
"learning_rate": 9.446693657219973e-06,
"logits/chosen": -0.9979413747787476,
"logits/rejected": -1.3880137205123901,
"logps/chosen": -113.4884262084961,
"logps/rejected": -270.5970764160156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.6926565170288086,
"rewards/margins": 12.41943359375,
"rewards/rejected": -9.726777076721191,
"step": 700
},
{
"epoch": 0.28363047001620745,
"eval_logits/chosen": -1.0087049007415771,
"eval_logits/rejected": -1.3951642513275146,
"eval_logps/chosen": -114.66770935058594,
"eval_logps/rejected": -270.48291015625,
"eval_loss": 1.1520413863763679e-05,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.6344213485717773,
"eval_rewards/margins": 12.388434410095215,
"eval_rewards/rejected": -9.754013061523438,
"eval_runtime": 658.0487,
"eval_samples_per_second": 11.251,
"eval_steps_per_second": 0.626,
"step": 700
},
{
"epoch": 0.28768233387358183,
"grad_norm": 0.0006853205850347877,
"learning_rate": 9.581646423751689e-06,
"logits/chosen": -0.9878454208374023,
"logits/rejected": -1.3959782123565674,
"logps/chosen": -113.78047943115234,
"logps/rejected": -272.41021728515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.711303949356079,
"rewards/margins": 12.54239559173584,
"rewards/rejected": -9.831093788146973,
"step": 710
},
{
"epoch": 0.2917341977309562,
"grad_norm": 0.0004263566224835813,
"learning_rate": 9.7165991902834e-06,
"logits/chosen": -0.9797188639640808,
"logits/rejected": -1.3997111320495605,
"logps/chosen": -113.36839294433594,
"logps/rejected": -272.79583740234375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.742356300354004,
"rewards/margins": 12.54971981048584,
"rewards/rejected": -9.807363510131836,
"step": 720
},
{
"epoch": 0.29578606158833065,
"grad_norm": 0.00023152201902121305,
"learning_rate": 9.851551956815116e-06,
"logits/chosen": -0.9830971956253052,
"logits/rejected": -1.3845362663269043,
"logps/chosen": -113.41996765136719,
"logps/rejected": -273.1960144042969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.721712350845337,
"rewards/margins": 12.736370086669922,
"rewards/rejected": -10.014657974243164,
"step": 730
},
{
"epoch": 0.29983792544570503,
"grad_norm": 0.0005608124774880707,
"learning_rate": 9.986504723346829e-06,
"logits/chosen": -0.9742939472198486,
"logits/rejected": -1.3444586992263794,
"logps/chosen": -113.43490600585938,
"logps/rejected": -274.0641174316406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.6840059757232666,
"rewards/margins": 12.688366889953613,
"rewards/rejected": -10.00436019897461,
"step": 740
},
{
"epoch": 0.3038897893030794,
"grad_norm": 0.0005869499291293323,
"learning_rate": 9.986492570914004e-06,
"logits/chosen": -0.9667108654975891,
"logits/rejected": -1.383889079093933,
"logps/chosen": -113.077392578125,
"logps/rejected": -273.8304138183594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.772247552871704,
"rewards/margins": 12.869462966918945,
"rewards/rejected": -10.09721565246582,
"step": 750
},
{
"epoch": 0.3038897893030794,
"eval_logits/chosen": -1.0030393600463867,
"eval_logits/rejected": -1.3840956687927246,
"eval_logps/chosen": -114.08601379394531,
"eval_logps/rejected": -272.99749755859375,
"eval_loss": 8.76898684509797e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.6925902366638184,
"eval_rewards/margins": 12.6980619430542,
"eval_rewards/rejected": -10.005472183227539,
"eval_runtime": 657.9195,
"eval_samples_per_second": 11.254,
"eval_steps_per_second": 0.626,
"step": 750
},
{
"epoch": 0.3079416531604538,
"grad_norm": 0.0002582529850769788,
"learning_rate": 9.971484316374006e-06,
"logits/chosen": -0.9930279850959778,
"logits/rejected": -1.3527050018310547,
"logps/chosen": -114.37895202636719,
"logps/rejected": -273.5732421875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.73421573638916,
"rewards/margins": 12.774086952209473,
"rewards/rejected": -10.039870262145996,
"step": 760
},
{
"epoch": 0.3119935170178282,
"grad_norm": 0.00047567905858159065,
"learning_rate": 9.95647606183401e-06,
"logits/chosen": -0.9919410943984985,
"logits/rejected": -1.3644182682037354,
"logps/chosen": -113.54793548583984,
"logps/rejected": -275.1521911621094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.78049373626709,
"rewards/margins": 12.89228343963623,
"rewards/rejected": -10.11178970336914,
"step": 770
},
{
"epoch": 0.3160453808752026,
"grad_norm": 0.0004460848867893219,
"learning_rate": 9.941467807294013e-06,
"logits/chosen": -0.9861297011375427,
"logits/rejected": -1.3743053674697876,
"logps/chosen": -112.3475570678711,
"logps/rejected": -275.0509948730469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.791991710662842,
"rewards/margins": 12.899449348449707,
"rewards/rejected": -10.107457160949707,
"step": 780
},
{
"epoch": 0.320097244732577,
"grad_norm": 0.00035315827699378133,
"learning_rate": 9.926459552754015e-06,
"logits/chosen": -0.9596935510635376,
"logits/rejected": -1.3788365125656128,
"logps/chosen": -113.31448364257812,
"logps/rejected": -276.55328369140625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.783583641052246,
"rewards/margins": 13.183259963989258,
"rewards/rejected": -10.399676322937012,
"step": 790
},
{
"epoch": 0.3241491085899514,
"grad_norm": 0.0005995644023641944,
"learning_rate": 9.911451298214018e-06,
"logits/chosen": -0.9586429595947266,
"logits/rejected": -1.3155739307403564,
"logps/chosen": -112.5149917602539,
"logps/rejected": -275.69073486328125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.829101324081421,
"rewards/margins": 13.077914237976074,
"rewards/rejected": -10.248811721801758,
"step": 800
},
{
"epoch": 0.3241491085899514,
"eval_logits/chosen": -1.0101659297943115,
"eval_logits/rejected": -1.3674921989440918,
"eval_logps/chosen": -113.71437072753906,
"eval_logps/rejected": -275.37432861328125,
"eval_loss": 6.814159860368818e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.72975492477417,
"eval_rewards/margins": 12.972909927368164,
"eval_rewards/rejected": -10.243154525756836,
"eval_runtime": 660.0291,
"eval_samples_per_second": 11.218,
"eval_steps_per_second": 0.624,
"step": 800
},
{
"epoch": 0.32820097244732577,
"grad_norm": 0.0001659575937082991,
"learning_rate": 9.896443043674022e-06,
"logits/chosen": -0.9594641327857971,
"logits/rejected": -1.3676989078521729,
"logps/chosen": -111.76673889160156,
"logps/rejected": -277.4734802246094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.8681840896606445,
"rewards/margins": 13.216644287109375,
"rewards/rejected": -10.34846019744873,
"step": 810
},
{
"epoch": 0.33225283630470015,
"grad_norm": 0.00022199955128598958,
"learning_rate": 9.881434789134025e-06,
"logits/chosen": -0.979736328125,
"logits/rejected": -1.3501309156417847,
"logps/chosen": -112.58365631103516,
"logps/rejected": -277.4759521484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.794842481613159,
"rewards/margins": 13.254104614257812,
"rewards/rejected": -10.459260940551758,
"step": 820
},
{
"epoch": 0.33630470016207453,
"grad_norm": 0.0002384011313552037,
"learning_rate": 9.866426534594028e-06,
"logits/chosen": -0.970429539680481,
"logits/rejected": -1.355580449104309,
"logps/chosen": -112.8162612915039,
"logps/rejected": -277.3512268066406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.7844314575195312,
"rewards/margins": 13.164278030395508,
"rewards/rejected": -10.379846572875977,
"step": 830
},
{
"epoch": 0.34035656401944897,
"grad_norm": 0.0003860573924612254,
"learning_rate": 9.85141828005403e-06,
"logits/chosen": -0.9769508242607117,
"logits/rejected": -1.3295193910598755,
"logps/chosen": -113.16212463378906,
"logps/rejected": -277.39874267578125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.831162691116333,
"rewards/margins": 13.187525749206543,
"rewards/rejected": -10.356362342834473,
"step": 840
},
{
"epoch": 0.34440842787682335,
"grad_norm": 0.00017003035463858396,
"learning_rate": 9.836410025514034e-06,
"logits/chosen": -0.9663823246955872,
"logits/rejected": -1.3480101823806763,
"logps/chosen": -112.63446807861328,
"logps/rejected": -278.4540100097656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.832660675048828,
"rewards/margins": 13.384835243225098,
"rewards/rejected": -10.552173614501953,
"step": 850
},
{
"epoch": 0.34440842787682335,
"eval_logits/chosen": -1.0045629739761353,
"eval_logits/rejected": -1.3488807678222656,
"eval_logps/chosen": -113.40267181396484,
"eval_logps/rejected": -277.4642333984375,
"eval_loss": 5.4946622185525484e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.760925531387329,
"eval_rewards/margins": 13.213071823120117,
"eval_rewards/rejected": -10.452144622802734,
"eval_runtime": 658.0453,
"eval_samples_per_second": 11.252,
"eval_steps_per_second": 0.626,
"step": 850
},
{
"epoch": 0.34846029173419774,
"grad_norm": 0.000273724872386083,
"learning_rate": 9.821401770974035e-06,
"logits/chosen": -0.9551014304161072,
"logits/rejected": -1.3251674175262451,
"logps/chosen": -112.65969848632812,
"logps/rejected": -278.6461486816406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.8454368114471436,
"rewards/margins": 13.34626293182373,
"rewards/rejected": -10.500825881958008,
"step": 860
},
{
"epoch": 0.3525121555915721,
"grad_norm": 0.0002813730388879776,
"learning_rate": 9.806393516434039e-06,
"logits/chosen": -0.9453781247138977,
"logits/rejected": -1.3513928651809692,
"logps/chosen": -112.64397430419922,
"logps/rejected": -279.1123352050781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.8162314891815186,
"rewards/margins": 13.449708938598633,
"rewards/rejected": -10.633478164672852,
"step": 870
},
{
"epoch": 0.3565640194489465,
"grad_norm": 0.00038633422809652984,
"learning_rate": 9.791385261894044e-06,
"logits/chosen": -0.9620229005813599,
"logits/rejected": -1.3113970756530762,
"logps/chosen": -112.11418914794922,
"logps/rejected": -280.71514892578125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.852627754211426,
"rewards/margins": 13.574984550476074,
"rewards/rejected": -10.722359657287598,
"step": 880
},
{
"epoch": 0.3606158833063209,
"grad_norm": 0.00038599190884269774,
"learning_rate": 9.776377007354046e-06,
"logits/chosen": -0.9710432887077332,
"logits/rejected": -1.3242309093475342,
"logps/chosen": -112.74330139160156,
"logps/rejected": -279.4281005859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.8442838191986084,
"rewards/margins": 13.384805679321289,
"rewards/rejected": -10.540522575378418,
"step": 890
},
{
"epoch": 0.3646677471636953,
"grad_norm": 0.0003790074260905385,
"learning_rate": 9.761368752814049e-06,
"logits/chosen": -0.9823834896087646,
"logits/rejected": -1.3220099210739136,
"logps/chosen": -113.65370178222656,
"logps/rejected": -279.15252685546875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.85807204246521,
"rewards/margins": 13.438652992248535,
"rewards/rejected": -10.580580711364746,
"step": 900
},
{
"epoch": 0.3646677471636953,
"eval_logits/chosen": -0.9927268028259277,
"eval_logits/rejected": -1.3295562267303467,
"eval_logps/chosen": -113.10031127929688,
"eval_logps/rejected": -279.3315124511719,
"eval_loss": 4.538566827250179e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.7911629676818848,
"eval_rewards/margins": 13.430037498474121,
"eval_rewards/rejected": -10.638875007629395,
"eval_runtime": 659.9746,
"eval_samples_per_second": 11.219,
"eval_steps_per_second": 0.624,
"step": 900
},
{
"epoch": 0.3687196110210697,
"grad_norm": 0.00014131773787084967,
"learning_rate": 9.74636049827405e-06,
"logits/chosen": -0.9639739990234375,
"logits/rejected": -1.318598985671997,
"logps/chosen": -112.04338836669922,
"logps/rejected": -279.8641357421875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.8556644916534424,
"rewards/margins": 13.507773399353027,
"rewards/rejected": -10.652108192443848,
"step": 910
},
{
"epoch": 0.3727714748784441,
"grad_norm": 0.00025860543246380985,
"learning_rate": 9.731352243734054e-06,
"logits/chosen": -0.9789298176765442,
"logits/rejected": -1.3201037645339966,
"logps/chosen": -112.76766204833984,
"logps/rejected": -280.4600830078125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.8445730209350586,
"rewards/margins": 13.659768104553223,
"rewards/rejected": -10.815194129943848,
"step": 920
},
{
"epoch": 0.37682333873581847,
"grad_norm": 0.00032551950425840914,
"learning_rate": 9.716343989194058e-06,
"logits/chosen": -0.9662618637084961,
"logits/rejected": -1.3028830289840698,
"logps/chosen": -111.63435363769531,
"logps/rejected": -280.16644287109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.8973257541656494,
"rewards/margins": 13.563043594360352,
"rewards/rejected": -10.665717124938965,
"step": 930
},
{
"epoch": 0.38087520259319285,
"grad_norm": 0.0003041207673959434,
"learning_rate": 9.701335734654061e-06,
"logits/chosen": -0.9609310030937195,
"logits/rejected": -1.3017886877059937,
"logps/chosen": -112.3936996459961,
"logps/rejected": -281.9355163574219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.8747782707214355,
"rewards/margins": 13.720125198364258,
"rewards/rejected": -10.84534740447998,
"step": 940
},
{
"epoch": 0.38492706645056723,
"grad_norm": 0.0007778910803608596,
"learning_rate": 9.686327480114064e-06,
"logits/chosen": -0.9676986932754517,
"logits/rejected": -1.3104395866394043,
"logps/chosen": -112.07537078857422,
"logps/rejected": -281.6306457519531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.8806912899017334,
"rewards/margins": 13.744512557983398,
"rewards/rejected": -10.863818168640137,
"step": 950
},
{
"epoch": 0.38492706645056723,
"eval_logits/chosen": -0.9823371171951294,
"eval_logits/rejected": -1.3137986660003662,
"eval_logps/chosen": -112.68508911132812,
"eval_logps/rejected": -281.2151794433594,
"eval_loss": 3.7383849758043652e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.83268404006958,
"eval_rewards/margins": 13.659927368164062,
"eval_rewards/rejected": -10.827244758605957,
"eval_runtime": 660.2661,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 950
},
{
"epoch": 0.3889789303079417,
"grad_norm": 0.00016004052304197103,
"learning_rate": 9.671319225574066e-06,
"logits/chosen": -0.9678320288658142,
"logits/rejected": -1.3027371168136597,
"logps/chosen": -112.4660415649414,
"logps/rejected": -281.6878662109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.886528491973877,
"rewards/margins": 13.726334571838379,
"rewards/rejected": -10.839804649353027,
"step": 960
},
{
"epoch": 0.39303079416531606,
"grad_norm": 0.0001520434016129002,
"learning_rate": 9.65631097103407e-06,
"logits/chosen": -0.9582164883613586,
"logits/rejected": -1.2870689630508423,
"logps/chosen": -112.67086029052734,
"logps/rejected": -283.65972900390625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.869288682937622,
"rewards/margins": 13.861096382141113,
"rewards/rejected": -10.991806983947754,
"step": 970
},
{
"epoch": 0.39708265802269044,
"grad_norm": 0.00021535011183004826,
"learning_rate": 9.641302716494071e-06,
"logits/chosen": -0.9589084386825562,
"logits/rejected": -1.2887883186340332,
"logps/chosen": -111.85392761230469,
"logps/rejected": -281.7579345703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.8492848873138428,
"rewards/margins": 13.705706596374512,
"rewards/rejected": -10.856423377990723,
"step": 980
},
{
"epoch": 0.4011345218800648,
"grad_norm": 0.00020488310838118196,
"learning_rate": 9.626294461954075e-06,
"logits/chosen": -0.9616044759750366,
"logits/rejected": -1.2965401411056519,
"logps/chosen": -111.1251449584961,
"logps/rejected": -283.02923583984375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.951281785964966,
"rewards/margins": 13.97263240814209,
"rewards/rejected": -11.021352767944336,
"step": 990
},
{
"epoch": 0.4051863857374392,
"grad_norm": 0.00014300347538664937,
"learning_rate": 9.611286207414078e-06,
"logits/chosen": -0.957852303981781,
"logits/rejected": -1.2917855978012085,
"logps/chosen": -111.81720733642578,
"logps/rejected": -283.7075500488281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.923614263534546,
"rewards/margins": 13.97872257232666,
"rewards/rejected": -11.055109024047852,
"step": 1000
},
{
"epoch": 0.4051863857374392,
"eval_logits/chosen": -0.9789116382598877,
"eval_logits/rejected": -1.3010200262069702,
"eval_logps/chosen": -112.41659545898438,
"eval_logps/rejected": -282.9280090332031,
"eval_loss": 3.1251206564775202e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.8595333099365234,
"eval_rewards/margins": 13.858057975769043,
"eval_rewards/rejected": -10.998525619506836,
"eval_runtime": 660.269,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 1000
},
{
"epoch": 0.40923824959481364,
"grad_norm": 0.0005220123566687107,
"learning_rate": 9.596277952874082e-06,
"logits/chosen": -0.9391909241676331,
"logits/rejected": -1.297073483467102,
"logps/chosen": -111.75109100341797,
"logps/rejected": -283.1003112792969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9314379692077637,
"rewards/margins": 13.907914161682129,
"rewards/rejected": -10.97647762298584,
"step": 1010
},
{
"epoch": 0.413290113452188,
"grad_norm": 0.0003276396309956908,
"learning_rate": 9.581269698334085e-06,
"logits/chosen": -0.960158109664917,
"logits/rejected": -1.3214308023452759,
"logps/chosen": -111.71788787841797,
"logps/rejected": -283.8362121582031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.924668550491333,
"rewards/margins": 13.982831001281738,
"rewards/rejected": -11.0581636428833,
"step": 1020
},
{
"epoch": 0.4173419773095624,
"grad_norm": 0.0001340145245194435,
"learning_rate": 9.566261443794087e-06,
"logits/chosen": -0.974898099899292,
"logits/rejected": -1.3104703426361084,
"logps/chosen": -111.79582214355469,
"logps/rejected": -285.63092041015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9361088275909424,
"rewards/margins": 14.022080421447754,
"rewards/rejected": -11.08597183227539,
"step": 1030
},
{
"epoch": 0.4213938411669368,
"grad_norm": 0.00012633968435693532,
"learning_rate": 9.55125318925409e-06,
"logits/chosen": -0.9730085730552673,
"logits/rejected": -1.2769588232040405,
"logps/chosen": -110.78377532958984,
"logps/rejected": -284.2268981933594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9252431392669678,
"rewards/margins": 14.092554092407227,
"rewards/rejected": -11.167312622070312,
"step": 1040
},
{
"epoch": 0.42544570502431117,
"grad_norm": 0.00010579601803328842,
"learning_rate": 9.536244934714094e-06,
"logits/chosen": -0.96152663230896,
"logits/rejected": -1.2916251420974731,
"logps/chosen": -109.97510528564453,
"logps/rejected": -284.11175537109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9813199043273926,
"rewards/margins": 14.068181037902832,
"rewards/rejected": -11.086858749389648,
"step": 1050
},
{
"epoch": 0.42544570502431117,
"eval_logits/chosen": -0.9753500819206238,
"eval_logits/rejected": -1.287696361541748,
"eval_logps/chosen": -112.18319702148438,
"eval_logps/rejected": -284.8260803222656,
"eval_loss": 2.570784999988973e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.8828725814819336,
"eval_rewards/margins": 14.071202278137207,
"eval_rewards/rejected": -11.18833065032959,
"eval_runtime": 660.368,
"eval_samples_per_second": 11.212,
"eval_steps_per_second": 0.624,
"step": 1050
},
{
"epoch": 0.42949756888168555,
"grad_norm": 0.0001430579723091796,
"learning_rate": 9.521236680174097e-06,
"logits/chosen": -0.9688810110092163,
"logits/rejected": -1.2829087972640991,
"logps/chosen": -112.16279602050781,
"logps/rejected": -285.31756591796875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9200236797332764,
"rewards/margins": 14.141681671142578,
"rewards/rejected": -11.221658706665039,
"step": 1060
},
{
"epoch": 0.43354943273906,
"grad_norm": 6.991266855038702e-05,
"learning_rate": 9.5062284256341e-06,
"logits/chosen": -0.9442747235298157,
"logits/rejected": -1.262116551399231,
"logps/chosen": -111.14962768554688,
"logps/rejected": -285.7078552246094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9615018367767334,
"rewards/margins": 14.187654495239258,
"rewards/rejected": -11.226153373718262,
"step": 1070
},
{
"epoch": 0.4376012965964344,
"grad_norm": 0.00022211392933968455,
"learning_rate": 9.491220171094102e-06,
"logits/chosen": -0.9678923487663269,
"logits/rejected": -1.2818944454193115,
"logps/chosen": -111.69573211669922,
"logps/rejected": -287.5627136230469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9129486083984375,
"rewards/margins": 14.332964897155762,
"rewards/rejected": -11.420016288757324,
"step": 1080
},
{
"epoch": 0.44165316045380876,
"grad_norm": 0.00014934873615857214,
"learning_rate": 9.476211916554106e-06,
"logits/chosen": -0.9637159705162048,
"logits/rejected": -1.263195276260376,
"logps/chosen": -112.36006164550781,
"logps/rejected": -286.6079406738281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.8961293697357178,
"rewards/margins": 14.229351997375488,
"rewards/rejected": -11.333223342895508,
"step": 1090
},
{
"epoch": 0.44570502431118314,
"grad_norm": 0.00023202145530376583,
"learning_rate": 9.461203662014109e-06,
"logits/chosen": -0.9612440466880798,
"logits/rejected": -1.2696155309677124,
"logps/chosen": -112.3745346069336,
"logps/rejected": -287.69012451171875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9029252529144287,
"rewards/margins": 14.36845588684082,
"rewards/rejected": -11.465531349182129,
"step": 1100
},
{
"epoch": 0.44570502431118314,
"eval_logits/chosen": -0.973721981048584,
"eval_logits/rejected": -1.2801706790924072,
"eval_logps/chosen": -112.02223205566406,
"eval_logps/rejected": -286.2309875488281,
"eval_loss": 2.2304900539893424e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.8989689350128174,
"eval_rewards/margins": 14.227792739868164,
"eval_rewards/rejected": -11.32882308959961,
"eval_runtime": 660.246,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 1100
},
{
"epoch": 0.4497568881685575,
"grad_norm": 8.071884803939611e-05,
"learning_rate": 9.446195407474111e-06,
"logits/chosen": -0.9535583853721619,
"logits/rejected": -1.287434458732605,
"logps/chosen": -111.23747253417969,
"logps/rejected": -286.5403747558594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9855968952178955,
"rewards/margins": 14.391644477844238,
"rewards/rejected": -11.406046867370605,
"step": 1110
},
{
"epoch": 0.4538087520259319,
"grad_norm": 0.0004843325004912913,
"learning_rate": 9.431187152934114e-06,
"logits/chosen": -0.9513693451881409,
"logits/rejected": -1.2654842138290405,
"logps/chosen": -110.70319366455078,
"logps/rejected": -287.89312744140625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.96667218208313,
"rewards/margins": 14.396854400634766,
"rewards/rejected": -11.430181503295898,
"step": 1120
},
{
"epoch": 0.45786061588330634,
"grad_norm": 0.00020084546122234315,
"learning_rate": 9.416178898394118e-06,
"logits/chosen": -0.9512994289398193,
"logits/rejected": -1.2680131196975708,
"logps/chosen": -111.81349182128906,
"logps/rejected": -286.9837341308594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.921030282974243,
"rewards/margins": 14.246526718139648,
"rewards/rejected": -11.325496673583984,
"step": 1130
},
{
"epoch": 0.4619124797406807,
"grad_norm": 7.329774962272495e-05,
"learning_rate": 9.401170643854121e-06,
"logits/chosen": -0.9566375017166138,
"logits/rejected": -1.278363585472107,
"logps/chosen": -110.75605010986328,
"logps/rejected": -288.46820068359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9941275119781494,
"rewards/margins": 14.503043174743652,
"rewards/rejected": -11.508919715881348,
"step": 1140
},
{
"epoch": 0.4659643435980551,
"grad_norm": 8.835856715450063e-05,
"learning_rate": 9.386162389314125e-06,
"logits/chosen": -0.9616451263427734,
"logits/rejected": -1.2581592798233032,
"logps/chosen": -110.53977966308594,
"logps/rejected": -288.35699462890625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9831340312957764,
"rewards/margins": 14.568155288696289,
"rewards/rejected": -11.585020065307617,
"step": 1150
},
{
"epoch": 0.4659643435980551,
"eval_logits/chosen": -0.9735735058784485,
"eval_logits/rejected": -1.2739366292953491,
"eval_logps/chosen": -111.88179016113281,
"eval_logps/rejected": -287.6111755371094,
"eval_loss": 1.9441790755081456e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.9130136966705322,
"eval_rewards/margins": 14.379854202270508,
"eval_rewards/rejected": -11.466840744018555,
"eval_runtime": 660.2556,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 1150
},
{
"epoch": 0.4700162074554295,
"grad_norm": 8.497169619658962e-05,
"learning_rate": 9.371154134774126e-06,
"logits/chosen": -0.9573142528533936,
"logits/rejected": -1.2469346523284912,
"logps/chosen": -111.91331481933594,
"logps/rejected": -288.5337219238281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.956511974334717,
"rewards/margins": 14.44264030456543,
"rewards/rejected": -11.486127853393555,
"step": 1160
},
{
"epoch": 0.4740680713128039,
"grad_norm": 0.00022965000243857503,
"learning_rate": 9.35614588023413e-06,
"logits/chosen": -0.9571576714515686,
"logits/rejected": -1.271868109703064,
"logps/chosen": -110.45994567871094,
"logps/rejected": -288.6113586425781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0243794918060303,
"rewards/margins": 14.56635856628418,
"rewards/rejected": -11.54197883605957,
"step": 1170
},
{
"epoch": 0.47811993517017826,
"grad_norm": 0.0003564605431165546,
"learning_rate": 9.341137625694131e-06,
"logits/chosen": -0.9566469192504883,
"logits/rejected": -1.26055908203125,
"logps/chosen": -110.68568420410156,
"logps/rejected": -288.16619873046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9829514026641846,
"rewards/margins": 14.538333892822266,
"rewards/rejected": -11.555380821228027,
"step": 1180
},
{
"epoch": 0.4821717990275527,
"grad_norm": 8.522019197698683e-05,
"learning_rate": 9.326129371154135e-06,
"logits/chosen": -0.961935818195343,
"logits/rejected": -1.2638294696807861,
"logps/chosen": -111.3947525024414,
"logps/rejected": -289.1004943847656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9743118286132812,
"rewards/margins": 14.57591438293457,
"rewards/rejected": -11.601603507995605,
"step": 1190
},
{
"epoch": 0.4862236628849271,
"grad_norm": 0.00014217206626199186,
"learning_rate": 9.311121116614138e-06,
"logits/chosen": -0.9611042141914368,
"logits/rejected": -1.2734590768814087,
"logps/chosen": -111.36783599853516,
"logps/rejected": -290.3299255371094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.9741716384887695,
"rewards/margins": 14.585290908813477,
"rewards/rejected": -11.611119270324707,
"step": 1200
},
{
"epoch": 0.4862236628849271,
"eval_logits/chosen": -0.9973398447036743,
"eval_logits/rejected": -1.2864365577697754,
"eval_logps/chosen": -111.73997497558594,
"eval_logps/rejected": -289.3089294433594,
"eval_loss": 1.631402483326383e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.9271950721740723,
"eval_rewards/margins": 14.563812255859375,
"eval_rewards/rejected": -11.636616706848145,
"eval_runtime": 660.2673,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 1200
},
{
"epoch": 0.49027552674230146,
"grad_norm": 8.652352698845789e-05,
"learning_rate": 9.296112862074142e-06,
"logits/chosen": -0.962738573551178,
"logits/rejected": -1.257235050201416,
"logps/chosen": -111.7171859741211,
"logps/rejected": -290.6097106933594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.958895206451416,
"rewards/margins": 14.682781219482422,
"rewards/rejected": -11.723886489868164,
"step": 1210
},
{
"epoch": 0.49432739059967584,
"grad_norm": 5.8049598010256886e-05,
"learning_rate": 9.281104607534145e-06,
"logits/chosen": -0.9487282037734985,
"logits/rejected": -1.249599575996399,
"logps/chosen": -109.90348052978516,
"logps/rejected": -290.8208312988281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0212409496307373,
"rewards/margins": 14.790689468383789,
"rewards/rejected": -11.769448280334473,
"step": 1220
},
{
"epoch": 0.4983792544570502,
"grad_norm": 9.261705417884514e-05,
"learning_rate": 9.266096352994147e-06,
"logits/chosen": -0.9655988812446594,
"logits/rejected": -1.2366749048233032,
"logps/chosen": -111.27457427978516,
"logps/rejected": -290.5723876953125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.993466377258301,
"rewards/margins": 14.69091510772705,
"rewards/rejected": -11.697447776794434,
"step": 1230
},
{
"epoch": 0.5024311183144247,
"grad_norm": 0.00016064975352492183,
"learning_rate": 9.25108809845415e-06,
"logits/chosen": -0.9459314346313477,
"logits/rejected": -1.2686599493026733,
"logps/chosen": -111.96553039550781,
"logps/rejected": -291.0901184082031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.974982976913452,
"rewards/margins": 14.71306324005127,
"rewards/rejected": -11.738081932067871,
"step": 1240
},
{
"epoch": 0.506482982171799,
"grad_norm": 8.82770837051794e-05,
"learning_rate": 9.236079843914154e-06,
"logits/chosen": -0.9558974504470825,
"logits/rejected": -1.2635960578918457,
"logps/chosen": -110.29508209228516,
"logps/rejected": -290.46405029296875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.025198459625244,
"rewards/margins": 14.70692253112793,
"rewards/rejected": -11.681722640991211,
"step": 1250
},
{
"epoch": 0.506482982171799,
"eval_logits/chosen": -0.9870012402534485,
"eval_logits/rejected": -1.2686045169830322,
"eval_logps/chosen": -111.6612548828125,
"eval_logps/rejected": -290.4904479980469,
"eval_loss": 1.4487125099549303e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.9350662231445312,
"eval_rewards/margins": 14.689835548400879,
"eval_rewards/rejected": -11.754766464233398,
"eval_runtime": 660.3028,
"eval_samples_per_second": 11.213,
"eval_steps_per_second": 0.624,
"step": 1250
},
{
"epoch": 0.5105348460291734,
"grad_norm": 0.0001483349915361032,
"learning_rate": 9.221071589374157e-06,
"logits/chosen": -0.9602691531181335,
"logits/rejected": -1.2540396451950073,
"logps/chosen": -110.69275665283203,
"logps/rejected": -290.8595275878906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0299112796783447,
"rewards/margins": 14.76969051361084,
"rewards/rejected": -11.739777565002441,
"step": 1260
},
{
"epoch": 0.5145867098865479,
"grad_norm": 6.636109901592135e-05,
"learning_rate": 9.20606333483416e-06,
"logits/chosen": -0.954090416431427,
"logits/rejected": -1.258052110671997,
"logps/chosen": -109.84585571289062,
"logps/rejected": -292.0687561035156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.058316946029663,
"rewards/margins": 14.921138763427734,
"rewards/rejected": -11.862822532653809,
"step": 1270
},
{
"epoch": 0.5186385737439222,
"grad_norm": 0.00013109849533066154,
"learning_rate": 9.191055080294162e-06,
"logits/chosen": -0.9620006680488586,
"logits/rejected": -1.2502659559249878,
"logps/chosen": -111.36671447753906,
"logps/rejected": -291.8580627441406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0132246017456055,
"rewards/margins": 14.834657669067383,
"rewards/rejected": -11.821431159973145,
"step": 1280
},
{
"epoch": 0.5226904376012966,
"grad_norm": 5.540152778849006e-05,
"learning_rate": 9.176046825754166e-06,
"logits/chosen": -0.9571611881256104,
"logits/rejected": -1.2665116786956787,
"logps/chosen": -110.1987075805664,
"logps/rejected": -293.12457275390625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0355942249298096,
"rewards/margins": 14.982242584228516,
"rewards/rejected": -11.946649551391602,
"step": 1290
},
{
"epoch": 0.526742301458671,
"grad_norm": 8.706421067472547e-05,
"learning_rate": 9.161038571214168e-06,
"logits/chosen": -0.956296980381012,
"logits/rejected": -1.2626007795333862,
"logps/chosen": -109.61963653564453,
"logps/rejected": -292.52056884765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0315158367156982,
"rewards/margins": 14.91031265258789,
"rewards/rejected": -11.87879753112793,
"step": 1300
},
{
"epoch": 0.526742301458671,
"eval_logits/chosen": -0.9715558290481567,
"eval_logits/rejected": -1.2562642097473145,
"eval_logps/chosen": -111.44157409667969,
"eval_logps/rejected": -291.3668518066406,
"eval_loss": 1.3256604916023207e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.9570353031158447,
"eval_rewards/margins": 14.799443244934082,
"eval_rewards/rejected": -11.842409133911133,
"eval_runtime": 660.2464,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 1300
},
{
"epoch": 0.5307941653160454,
"grad_norm": 6.619278428843245e-05,
"learning_rate": 9.146030316674171e-06,
"logits/chosen": -0.9809182286262512,
"logits/rejected": -1.2584463357925415,
"logps/chosen": -111.23551940917969,
"logps/rejected": -290.51751708984375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.009885311126709,
"rewards/margins": 14.80660629272461,
"rewards/rejected": -11.79671859741211,
"step": 1310
},
{
"epoch": 0.5348460291734197,
"grad_norm": 6.740832759533077e-05,
"learning_rate": 9.131022062134174e-06,
"logits/chosen": -0.9744822978973389,
"logits/rejected": -1.2522770166397095,
"logps/chosen": -110.54716491699219,
"logps/rejected": -293.0761413574219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0305418968200684,
"rewards/margins": 14.981204986572266,
"rewards/rejected": -11.950662612915039,
"step": 1320
},
{
"epoch": 0.5388978930307942,
"grad_norm": 4.477183392737061e-05,
"learning_rate": 9.116013807594178e-06,
"logits/chosen": -0.953049898147583,
"logits/rejected": -1.261191964149475,
"logps/chosen": -110.87936401367188,
"logps/rejected": -292.4115295410156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.050781726837158,
"rewards/margins": 14.959651947021484,
"rewards/rejected": -11.908870697021484,
"step": 1330
},
{
"epoch": 0.5429497568881686,
"grad_norm": 5.2174516895320266e-05,
"learning_rate": 9.101005553054181e-06,
"logits/chosen": -0.960311770439148,
"logits/rejected": -1.246680736541748,
"logps/chosen": -111.20600891113281,
"logps/rejected": -291.935546875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0119898319244385,
"rewards/margins": 14.858885765075684,
"rewards/rejected": -11.846895217895508,
"step": 1340
},
{
"epoch": 0.5470016207455429,
"grad_norm": 0.00010178080992773175,
"learning_rate": 9.085997298514183e-06,
"logits/chosen": -0.9307942986488342,
"logits/rejected": -1.2356764078140259,
"logps/chosen": -110.38352966308594,
"logps/rejected": -291.8614501953125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0522117614746094,
"rewards/margins": 14.910490989685059,
"rewards/rejected": -11.85827922821045,
"step": 1350
},
{
"epoch": 0.5470016207455429,
"eval_logits/chosen": -0.9828789234161377,
"eval_logits/rejected": -1.2572388648986816,
"eval_logps/chosen": -111.41586303710938,
"eval_logps/rejected": -292.48114013671875,
"eval_loss": 1.1854280046463828e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.9596071243286133,
"eval_rewards/margins": 14.913446426391602,
"eval_rewards/rejected": -11.953838348388672,
"eval_runtime": 660.2565,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 1350
},
{
"epoch": 0.5510534846029174,
"grad_norm": 0.00022050880943425,
"learning_rate": 9.070989043974186e-06,
"logits/chosen": -0.9654724597930908,
"logits/rejected": -1.2213767766952515,
"logps/chosen": -110.69276428222656,
"logps/rejected": -292.5841064453125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0184366703033447,
"rewards/margins": 14.926412582397461,
"rewards/rejected": -11.907977104187012,
"step": 1360
},
{
"epoch": 0.5551053484602917,
"grad_norm": 9.077700087800622e-05,
"learning_rate": 9.05598078943419e-06,
"logits/chosen": -0.9437484741210938,
"logits/rejected": -1.2385755777359009,
"logps/chosen": -110.29655456542969,
"logps/rejected": -293.9698486328125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.072600841522217,
"rewards/margins": 15.177414894104004,
"rewards/rejected": -12.104813575744629,
"step": 1370
},
{
"epoch": 0.5591572123176661,
"grad_norm": 6.290877354331315e-05,
"learning_rate": 9.040972534894192e-06,
"logits/chosen": -0.9499402642250061,
"logits/rejected": -1.262143611907959,
"logps/chosen": -109.24268341064453,
"logps/rejected": -294.36883544921875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.056851625442505,
"rewards/margins": 15.167757987976074,
"rewards/rejected": -12.110904693603516,
"step": 1380
},
{
"epoch": 0.5632090761750406,
"grad_norm": 0.0001979395019588992,
"learning_rate": 9.025964280354197e-06,
"logits/chosen": -0.9501563310623169,
"logits/rejected": -1.2465254068374634,
"logps/chosen": -109.71662902832031,
"logps/rejected": -294.7782897949219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.016782522201538,
"rewards/margins": 15.195131301879883,
"rewards/rejected": -12.17834758758545,
"step": 1390
},
{
"epoch": 0.5672609400324149,
"grad_norm": 9.179364860756323e-05,
"learning_rate": 9.010956025814198e-06,
"logits/chosen": -0.9448656439781189,
"logits/rejected": -1.2433806657791138,
"logps/chosen": -109.48567199707031,
"logps/rejected": -294.6673889160156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0524191856384277,
"rewards/margins": 15.18110179901123,
"rewards/rejected": -12.128682136535645,
"step": 1400
},
{
"epoch": 0.5672609400324149,
"eval_logits/chosen": -0.9666537642478943,
"eval_logits/rejected": -1.245568871498108,
"eval_logps/chosen": -111.20926666259766,
"eval_logps/rejected": -293.1695251464844,
"eval_loss": 1.1026525044144364e-06,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.9802653789520264,
"eval_rewards/margins": 15.00294017791748,
"eval_rewards/rejected": -12.022675514221191,
"eval_runtime": 657.9972,
"eval_samples_per_second": 11.252,
"eval_steps_per_second": 0.626,
"step": 1400
},
{
"epoch": 0.5713128038897893,
"grad_norm": 7.402592018479481e-05,
"learning_rate": 8.995947771274202e-06,
"logits/chosen": -0.9521650671958923,
"logits/rejected": -1.2431867122650146,
"logps/chosen": -110.92412567138672,
"logps/rejected": -295.1664733886719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0659775733947754,
"rewards/margins": 15.19791030883789,
"rewards/rejected": -12.131933212280273,
"step": 1410
},
{
"epoch": 0.5753646677471637,
"grad_norm": 5.878585216123611e-05,
"learning_rate": 8.980939516734205e-06,
"logits/chosen": -0.9558809399604797,
"logits/rejected": -1.237985610961914,
"logps/chosen": -110.80642700195312,
"logps/rejected": -294.6929931640625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.028352975845337,
"rewards/margins": 15.155354499816895,
"rewards/rejected": -12.127002716064453,
"step": 1420
},
{
"epoch": 0.5794165316045381,
"grad_norm": 7.350226223934442e-05,
"learning_rate": 8.965931262194207e-06,
"logits/chosen": -0.9748159646987915,
"logits/rejected": -1.2480131387710571,
"logps/chosen": -111.68008422851562,
"logps/rejected": -294.0392761230469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0166327953338623,
"rewards/margins": 15.060970306396484,
"rewards/rejected": -12.044337272644043,
"step": 1430
},
{
"epoch": 0.5834683954619124,
"grad_norm": 0.00010062765795737505,
"learning_rate": 8.95092300765421e-06,
"logits/chosen": -0.956743597984314,
"logits/rejected": -1.2324788570404053,
"logps/chosen": -111.09513854980469,
"logps/rejected": -294.4328308105469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.027946710586548,
"rewards/margins": 15.142075538635254,
"rewards/rejected": -12.114130973815918,
"step": 1440
},
{
"epoch": 0.5875202593192869,
"grad_norm": 3.6476340028457344e-05,
"learning_rate": 8.935914753114214e-06,
"logits/chosen": -0.93390291929245,
"logits/rejected": -1.2643619775772095,
"logps/chosen": -110.3382339477539,
"logps/rejected": -295.6949157714844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0454061031341553,
"rewards/margins": 15.326750755310059,
"rewards/rejected": -12.281344413757324,
"step": 1450
},
{
"epoch": 0.5875202593192869,
"eval_logits/chosen": -0.9941796660423279,
"eval_logits/rejected": -1.2666490077972412,
"eval_logps/chosen": -111.17910766601562,
"eval_logps/rejected": -294.23052978515625,
"eval_loss": 9.906432296702405e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.983280897140503,
"eval_rewards/margins": 15.112060546875,
"eval_rewards/rejected": -12.128779411315918,
"eval_runtime": 660.0408,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 1450
},
{
"epoch": 0.5915721231766613,
"grad_norm": 3.417656262172386e-05,
"learning_rate": 8.920906498574217e-06,
"logits/chosen": -0.9628769159317017,
"logits/rejected": -1.2284659147262573,
"logps/chosen": -111.88285827636719,
"logps/rejected": -295.775390625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 2.999023914337158,
"rewards/margins": 15.234338760375977,
"rewards/rejected": -12.23531436920166,
"step": 1460
},
{
"epoch": 0.5956239870340356,
"grad_norm": 3.768848910112865e-05,
"learning_rate": 8.90589824403422e-06,
"logits/chosen": -0.9420002698898315,
"logits/rejected": -1.2281954288482666,
"logps/chosen": -110.00930786132812,
"logps/rejected": -294.4632873535156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0742979049682617,
"rewards/margins": 15.22895336151123,
"rewards/rejected": -12.154653549194336,
"step": 1470
},
{
"epoch": 0.5996758508914101,
"grad_norm": 4.7602912673028186e-05,
"learning_rate": 8.890889989494222e-06,
"logits/chosen": -0.9583718180656433,
"logits/rejected": -1.2395317554473877,
"logps/chosen": -109.17208099365234,
"logps/rejected": -295.4866638183594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.069913625717163,
"rewards/margins": 15.283977508544922,
"rewards/rejected": -12.214064598083496,
"step": 1480
},
{
"epoch": 0.6037277147487844,
"grad_norm": 3.677717177197337e-05,
"learning_rate": 8.875881734954226e-06,
"logits/chosen": -0.9670850038528442,
"logits/rejected": -1.2482547760009766,
"logps/chosen": -111.20230102539062,
"logps/rejected": -296.07672119140625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0110421180725098,
"rewards/margins": 15.339611053466797,
"rewards/rejected": -12.328569412231445,
"step": 1490
},
{
"epoch": 0.6077795786061588,
"grad_norm": 6.113961717346683e-05,
"learning_rate": 8.860873480414228e-06,
"logits/chosen": -0.9546039700508118,
"logits/rejected": -1.239587426185608,
"logps/chosen": -110.67524719238281,
"logps/rejected": -295.7835388183594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0471036434173584,
"rewards/margins": 15.220789909362793,
"rewards/rejected": -12.173686027526855,
"step": 1500
},
{
"epoch": 0.6077795786061588,
"eval_logits/chosen": -0.9696044921875,
"eval_logits/rejected": -1.242756962776184,
"eval_logps/chosen": -111.04248809814453,
"eval_logps/rejected": -294.9416198730469,
"eval_loss": 9.284163979828008e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.9969444274902344,
"eval_rewards/margins": 15.196829795837402,
"eval_rewards/rejected": -12.199886322021484,
"eval_runtime": 659.9648,
"eval_samples_per_second": 11.219,
"eval_steps_per_second": 0.624,
"step": 1500
},
{
"epoch": 0.6118314424635333,
"grad_norm": 0.00010565384582150728,
"learning_rate": 8.845865225874231e-06,
"logits/chosen": -0.9540724158287048,
"logits/rejected": -1.2362232208251953,
"logps/chosen": -110.95648956298828,
"logps/rejected": -295.4747314453125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0460703372955322,
"rewards/margins": 15.277571678161621,
"rewards/rejected": -12.231502532958984,
"step": 1510
},
{
"epoch": 0.6158833063209076,
"grad_norm": 6.378133548423648e-05,
"learning_rate": 8.830856971334234e-06,
"logits/chosen": -0.954107940196991,
"logits/rejected": -1.2532161474227905,
"logps/chosen": -108.83919525146484,
"logps/rejected": -296.8812255859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1111133098602295,
"rewards/margins": 15.391324043273926,
"rewards/rejected": -12.2802095413208,
"step": 1520
},
{
"epoch": 0.619935170178282,
"grad_norm": 4.6979050239315256e-05,
"learning_rate": 8.815848716794238e-06,
"logits/chosen": -0.9490892291069031,
"logits/rejected": -1.237484335899353,
"logps/chosen": -109.17033386230469,
"logps/rejected": -296.7481994628906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.074795961380005,
"rewards/margins": 15.35445499420166,
"rewards/rejected": -12.279657363891602,
"step": 1530
},
{
"epoch": 0.6239870340356564,
"grad_norm": 6.864364695502445e-05,
"learning_rate": 8.800840462254241e-06,
"logits/chosen": -0.9532595872879028,
"logits/rejected": -1.2381584644317627,
"logps/chosen": -110.54261016845703,
"logps/rejected": -297.6771545410156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.061347246170044,
"rewards/margins": 15.484623908996582,
"rewards/rejected": -12.4232759475708,
"step": 1540
},
{
"epoch": 0.6280388978930308,
"grad_norm": 5.509885886567645e-05,
"learning_rate": 8.785832207714243e-06,
"logits/chosen": -0.9511829614639282,
"logits/rejected": -1.2367159128189087,
"logps/chosen": -109.2529525756836,
"logps/rejected": -298.1808776855469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0861127376556396,
"rewards/margins": 15.517443656921387,
"rewards/rejected": -12.431331634521484,
"step": 1550
},
{
"epoch": 0.6280388978930308,
"eval_logits/chosen": -0.9912152290344238,
"eval_logits/rejected": -1.259311318397522,
"eval_logps/chosen": -111.05461120605469,
"eval_logps/rejected": -295.8396911621094,
"eval_loss": 8.481291047246486e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 2.9957311153411865,
"eval_rewards/margins": 15.28542423248291,
"eval_rewards/rejected": -12.289692878723145,
"eval_runtime": 660.0901,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 1550
},
{
"epoch": 0.6320907617504052,
"grad_norm": 7.277915574377403e-05,
"learning_rate": 8.770823953174246e-06,
"logits/chosen": -0.9516242742538452,
"logits/rejected": -1.2391493320465088,
"logps/chosen": -111.23517608642578,
"logps/rejected": -296.1101379394531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0449342727661133,
"rewards/margins": 15.367486000061035,
"rewards/rejected": -12.322551727294922,
"step": 1560
},
{
"epoch": 0.6361426256077796,
"grad_norm": 4.478929258766584e-05,
"learning_rate": 8.75581569863425e-06,
"logits/chosen": -0.9553163051605225,
"logits/rejected": -1.2346341609954834,
"logps/chosen": -110.90254211425781,
"logps/rejected": -296.3621826171875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0853469371795654,
"rewards/margins": 15.453842163085938,
"rewards/rejected": -12.368496894836426,
"step": 1570
},
{
"epoch": 0.640194489465154,
"grad_norm": 4.4538293877849355e-05,
"learning_rate": 8.740807444094253e-06,
"logits/chosen": -0.9542552828788757,
"logits/rejected": -1.2168352603912354,
"logps/chosen": -111.39136505126953,
"logps/rejected": -295.93505859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.039647340774536,
"rewards/margins": 15.247894287109375,
"rewards/rejected": -12.208246231079102,
"step": 1580
},
{
"epoch": 0.6442463533225283,
"grad_norm": 4.4035768951289356e-05,
"learning_rate": 8.725799189554257e-06,
"logits/chosen": -0.9646400809288025,
"logits/rejected": -1.2394483089447021,
"logps/chosen": -110.61803436279297,
"logps/rejected": -298.1299743652344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0604629516601562,
"rewards/margins": 15.54178237915039,
"rewards/rejected": -12.481318473815918,
"step": 1590
},
{
"epoch": 0.6482982171799028,
"grad_norm": 4.055317185702734e-05,
"learning_rate": 8.710790935014258e-06,
"logits/chosen": -0.9540335536003113,
"logits/rejected": -1.226391077041626,
"logps/chosen": -110.3465347290039,
"logps/rejected": -296.5976867675781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0967838764190674,
"rewards/margins": 15.452139854431152,
"rewards/rejected": -12.355356216430664,
"step": 1600
},
{
"epoch": 0.6482982171799028,
"eval_logits/chosen": -0.9963459372520447,
"eval_logits/rejected": -1.2614251375198364,
"eval_logps/chosen": -110.98289489746094,
"eval_logps/rejected": -296.5805358886719,
"eval_loss": 7.882362069722149e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.0029025077819824,
"eval_rewards/margins": 15.366681098937988,
"eval_rewards/rejected": -12.363778114318848,
"eval_runtime": 660.0614,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 1600
},
{
"epoch": 0.6523500810372771,
"grad_norm": 3.0179848181433044e-05,
"learning_rate": 8.695782680474262e-06,
"logits/chosen": -0.9439318776130676,
"logits/rejected": -1.216618299484253,
"logps/chosen": -110.74729919433594,
"logps/rejected": -296.43804931640625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.056190252304077,
"rewards/margins": 15.361733436584473,
"rewards/rejected": -12.3055419921875,
"step": 1610
},
{
"epoch": 0.6564019448946515,
"grad_norm": 0.00011598259152378887,
"learning_rate": 8.680774425934264e-06,
"logits/chosen": -0.9612037539482117,
"logits/rejected": -1.2288869619369507,
"logps/chosen": -110.16704559326172,
"logps/rejected": -297.1379699707031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.057806968688965,
"rewards/margins": 15.488568305969238,
"rewards/rejected": -12.430760383605957,
"step": 1620
},
{
"epoch": 0.660453808752026,
"grad_norm": 4.8609501391183585e-05,
"learning_rate": 8.665766171394267e-06,
"logits/chosen": -0.9516136050224304,
"logits/rejected": -1.2299059629440308,
"logps/chosen": -108.99888610839844,
"logps/rejected": -299.0168762207031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1037096977233887,
"rewards/margins": 15.597698211669922,
"rewards/rejected": -12.493988990783691,
"step": 1630
},
{
"epoch": 0.6645056726094003,
"grad_norm": 6.331945769488811e-05,
"learning_rate": 8.65075791685427e-06,
"logits/chosen": -0.9660440683364868,
"logits/rejected": -1.2430554628372192,
"logps/chosen": -110.30313110351562,
"logps/rejected": -297.8039245605469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0342953205108643,
"rewards/margins": 15.4889554977417,
"rewards/rejected": -12.454659461975098,
"step": 1640
},
{
"epoch": 0.6685575364667747,
"grad_norm": 6.663906970061362e-05,
"learning_rate": 8.635749662314274e-06,
"logits/chosen": -0.9538125395774841,
"logits/rejected": -1.2279130220413208,
"logps/chosen": -109.44841766357422,
"logps/rejected": -297.01837158203125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.114189863204956,
"rewards/margins": 15.4672212600708,
"rewards/rejected": -12.353031158447266,
"step": 1650
},
{
"epoch": 0.6685575364667747,
"eval_logits/chosen": -0.9842001795768738,
"eval_logits/rejected": -1.2457659244537354,
"eval_logps/chosen": -110.90794372558594,
"eval_logps/rejected": -297.2918395996094,
"eval_loss": 7.317187851185736e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.0103981494903564,
"eval_rewards/margins": 15.445306777954102,
"eval_rewards/rejected": -12.434906959533691,
"eval_runtime": 660.1054,
"eval_samples_per_second": 11.216,
"eval_steps_per_second": 0.624,
"step": 1650
},
{
"epoch": 0.6726094003241491,
"grad_norm": 4.348358925199136e-05,
"learning_rate": 8.620741407774277e-06,
"logits/chosen": -0.9552786946296692,
"logits/rejected": -1.2268904447555542,
"logps/chosen": -111.0877914428711,
"logps/rejected": -296.8569030761719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0642521381378174,
"rewards/margins": 15.461289405822754,
"rewards/rejected": -12.397037506103516,
"step": 1660
},
{
"epoch": 0.6766612641815235,
"grad_norm": 0.00014763206127099693,
"learning_rate": 8.605733153234279e-06,
"logits/chosen": -0.9552820920944214,
"logits/rejected": -1.2488830089569092,
"logps/chosen": -110.29084014892578,
"logps/rejected": -299.09515380859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.092834949493408,
"rewards/margins": 15.636582374572754,
"rewards/rejected": -12.54374885559082,
"step": 1670
},
{
"epoch": 0.6807131280388979,
"grad_norm": 5.1606773922685534e-05,
"learning_rate": 8.590724898694282e-06,
"logits/chosen": -0.9457971453666687,
"logits/rejected": -1.206853985786438,
"logps/chosen": -110.04716491699219,
"logps/rejected": -296.72747802734375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1184566020965576,
"rewards/margins": 15.559531211853027,
"rewards/rejected": -12.441073417663574,
"step": 1680
},
{
"epoch": 0.6847649918962723,
"grad_norm": 3.092627230216749e-05,
"learning_rate": 8.575716644154286e-06,
"logits/chosen": -0.9578930139541626,
"logits/rejected": -1.231552243232727,
"logps/chosen": -110.51782989501953,
"logps/rejected": -298.4883728027344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.064654588699341,
"rewards/margins": 15.591686248779297,
"rewards/rejected": -12.527032852172852,
"step": 1690
},
{
"epoch": 0.6888168557536467,
"grad_norm": 0.00016064252122305334,
"learning_rate": 8.560708389614288e-06,
"logits/chosen": -0.9631405472755432,
"logits/rejected": -1.2213727235794067,
"logps/chosen": -110.19290161132812,
"logps/rejected": -298.48150634765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.097748279571533,
"rewards/margins": 15.561808586120605,
"rewards/rejected": -12.464061737060547,
"step": 1700
},
{
"epoch": 0.6888168557536467,
"eval_logits/chosen": -0.9839051365852356,
"eval_logits/rejected": -1.2429444789886475,
"eval_logps/chosen": -110.84707641601562,
"eval_logps/rejected": -298.07794189453125,
"eval_loss": 6.767778586436179e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.0164856910705566,
"eval_rewards/margins": 15.530004501342773,
"eval_rewards/rejected": -12.513520240783691,
"eval_runtime": 660.1439,
"eval_samples_per_second": 11.216,
"eval_steps_per_second": 0.624,
"step": 1700
},
{
"epoch": 0.692868719611021,
"grad_norm": 4.53038519481197e-05,
"learning_rate": 8.545700135074291e-06,
"logits/chosen": -0.963180661201477,
"logits/rejected": -1.2384047508239746,
"logps/chosen": -110.7230224609375,
"logps/rejected": -298.0184020996094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0918118953704834,
"rewards/margins": 15.59386157989502,
"rewards/rejected": -12.502050399780273,
"step": 1710
},
{
"epoch": 0.6969205834683955,
"grad_norm": 1.722994420561008e-05,
"learning_rate": 8.530691880534295e-06,
"logits/chosen": -0.9652491211891174,
"logits/rejected": -1.2031772136688232,
"logps/chosen": -111.2859115600586,
"logps/rejected": -299.26641845703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0548810958862305,
"rewards/margins": 15.71076774597168,
"rewards/rejected": -12.655885696411133,
"step": 1720
},
{
"epoch": 0.7009724473257699,
"grad_norm": 5.003461774322204e-05,
"learning_rate": 8.515683625994298e-06,
"logits/chosen": -0.9635353088378906,
"logits/rejected": -1.227256178855896,
"logps/chosen": -109.7396240234375,
"logps/rejected": -297.9764709472656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0842108726501465,
"rewards/margins": 15.59292984008789,
"rewards/rejected": -12.508719444274902,
"step": 1730
},
{
"epoch": 0.7050243111831442,
"grad_norm": 4.6853474486852065e-05,
"learning_rate": 8.500675371454301e-06,
"logits/chosen": -0.9571965932846069,
"logits/rejected": -1.2346524000167847,
"logps/chosen": -110.17761993408203,
"logps/rejected": -300.9472961425781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.07942795753479,
"rewards/margins": 15.799840927124023,
"rewards/rejected": -12.720414161682129,
"step": 1740
},
{
"epoch": 0.7090761750405187,
"grad_norm": 7.191787153715268e-05,
"learning_rate": 8.485667116914303e-06,
"logits/chosen": -0.9528246521949768,
"logits/rejected": -1.2193206548690796,
"logps/chosen": -110.28775787353516,
"logps/rejected": -299.3614807128906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.083807945251465,
"rewards/margins": 15.71611499786377,
"rewards/rejected": -12.632307052612305,
"step": 1750
},
{
"epoch": 0.7090761750405187,
"eval_logits/chosen": -0.9769449830055237,
"eval_logits/rejected": -1.2357670068740845,
"eval_logps/chosen": -110.7610855102539,
"eval_logps/rejected": -298.78265380859375,
"eval_loss": 6.295198318184703e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.025084972381592,
"eval_rewards/margins": 15.609077453613281,
"eval_rewards/rejected": -12.583992958068848,
"eval_runtime": 660.0968,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 1750
},
{
"epoch": 0.713128038897893,
"grad_norm": 6.214807945070788e-05,
"learning_rate": 8.470658862374307e-06,
"logits/chosen": -0.9671065807342529,
"logits/rejected": -1.2267494201660156,
"logps/chosen": -111.212646484375,
"logps/rejected": -297.99432373046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.069645643234253,
"rewards/margins": 15.604259490966797,
"rewards/rejected": -12.534612655639648,
"step": 1760
},
{
"epoch": 0.7171799027552674,
"grad_norm": 2.1496705812751316e-05,
"learning_rate": 8.45565060783431e-06,
"logits/chosen": -0.9392750859260559,
"logits/rejected": -1.2306023836135864,
"logps/chosen": -109.73208618164062,
"logps/rejected": -300.1722412109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0873124599456787,
"rewards/margins": 15.78653335571289,
"rewards/rejected": -12.699220657348633,
"step": 1770
},
{
"epoch": 0.7212317666126418,
"grad_norm": 4.5025444705970585e-05,
"learning_rate": 8.440642353294313e-06,
"logits/chosen": -0.9593215584754944,
"logits/rejected": -1.2293932437896729,
"logps/chosen": -109.81471252441406,
"logps/rejected": -299.7237854003906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0805766582489014,
"rewards/margins": 15.711773872375488,
"rewards/rejected": -12.631196022033691,
"step": 1780
},
{
"epoch": 0.7252836304700162,
"grad_norm": 9.227264672517776e-05,
"learning_rate": 8.425634098754315e-06,
"logits/chosen": -0.950941801071167,
"logits/rejected": -1.231359839439392,
"logps/chosen": -110.4205093383789,
"logps/rejected": -301.0591735839844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0956263542175293,
"rewards/margins": 15.80740737915039,
"rewards/rejected": -12.711782455444336,
"step": 1790
},
{
"epoch": 0.7293354943273906,
"grad_norm": 2.5774721507332288e-05,
"learning_rate": 8.410625844214319e-06,
"logits/chosen": -0.9582427144050598,
"logits/rejected": -1.2166783809661865,
"logps/chosen": -111.40494537353516,
"logps/rejected": -300.53167724609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.071667432785034,
"rewards/margins": 15.72705364227295,
"rewards/rejected": -12.65538501739502,
"step": 1800
},
{
"epoch": 0.7293354943273906,
"eval_logits/chosen": -0.9738713502883911,
"eval_logits/rejected": -1.2305481433868408,
"eval_logps/chosen": -110.67764282226562,
"eval_logps/rejected": -299.36517333984375,
"eval_loss": 5.93142544857983e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.0334293842315674,
"eval_rewards/margins": 15.67567253112793,
"eval_rewards/rejected": -12.642244338989258,
"eval_runtime": 660.1429,
"eval_samples_per_second": 11.216,
"eval_steps_per_second": 0.624,
"step": 1800
},
{
"epoch": 0.733387358184765,
"grad_norm": 1.6181831597350538e-05,
"learning_rate": 8.395617589674322e-06,
"logits/chosen": -0.9676950573921204,
"logits/rejected": -1.2319369316101074,
"logps/chosen": -109.94116973876953,
"logps/rejected": -300.9438781738281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0895590782165527,
"rewards/margins": 15.79028034210205,
"rewards/rejected": -12.70072078704834,
"step": 1810
},
{
"epoch": 0.7374392220421394,
"grad_norm": 2.0902380128973164e-05,
"learning_rate": 8.380609335134324e-06,
"logits/chosen": -0.9366939663887024,
"logits/rejected": -1.229324460029602,
"logps/chosen": -109.44600677490234,
"logps/rejected": -302.6067810058594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.142228841781616,
"rewards/margins": 16.04191017150879,
"rewards/rejected": -12.899679183959961,
"step": 1820
},
{
"epoch": 0.7414910858995137,
"grad_norm": 2.0663153918576427e-05,
"learning_rate": 8.365601080594327e-06,
"logits/chosen": -0.9395460486412048,
"logits/rejected": -1.2137764692306519,
"logps/chosen": -109.63568878173828,
"logps/rejected": -301.1596984863281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.148167133331299,
"rewards/margins": 15.912049293518066,
"rewards/rejected": -12.763882637023926,
"step": 1830
},
{
"epoch": 0.7455429497568882,
"grad_norm": 2.4156342988135293e-05,
"learning_rate": 8.35059282605433e-06,
"logits/chosen": -0.9509289860725403,
"logits/rejected": -1.2320055961608887,
"logps/chosen": -109.17674255371094,
"logps/rejected": -300.7659606933594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.152684450149536,
"rewards/margins": 15.885882377624512,
"rewards/rejected": -12.733199119567871,
"step": 1840
},
{
"epoch": 0.7495948136142626,
"grad_norm": 5.195208723307587e-05,
"learning_rate": 8.335584571514334e-06,
"logits/chosen": -0.9608786702156067,
"logits/rejected": -1.2239487171173096,
"logps/chosen": -111.0685043334961,
"logps/rejected": -300.0669860839844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0595474243164062,
"rewards/margins": 15.727933883666992,
"rewards/rejected": -12.668384552001953,
"step": 1850
},
{
"epoch": 0.7495948136142626,
"eval_logits/chosen": -0.9690695405006409,
"eval_logits/rejected": -1.2296942472457886,
"eval_logps/chosen": -110.52428436279297,
"eval_logps/rejected": -299.7806091308594,
"eval_loss": 5.65465313684399e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.04876446723938,
"eval_rewards/margins": 15.732549667358398,
"eval_rewards/rejected": -12.683784484863281,
"eval_runtime": 658.0929,
"eval_samples_per_second": 11.251,
"eval_steps_per_second": 0.626,
"step": 1850
},
{
"epoch": 0.7536466774716369,
"grad_norm": 2.637179204612039e-05,
"learning_rate": 8.320576316974337e-06,
"logits/chosen": -0.9759941697120667,
"logits/rejected": -1.222524642944336,
"logps/chosen": -110.23280334472656,
"logps/rejected": -301.49127197265625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.082556962966919,
"rewards/margins": 15.849783897399902,
"rewards/rejected": -12.767226219177246,
"step": 1860
},
{
"epoch": 0.7576985413290114,
"grad_norm": 2.6323505153413862e-05,
"learning_rate": 8.305568062434339e-06,
"logits/chosen": -0.9682739973068237,
"logits/rejected": -1.2260493040084839,
"logps/chosen": -111.04216766357422,
"logps/rejected": -301.8972473144531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0877504348754883,
"rewards/margins": 15.785056114196777,
"rewards/rejected": -12.697306632995605,
"step": 1870
},
{
"epoch": 0.7617504051863857,
"grad_norm": 2.6471077944734134e-05,
"learning_rate": 8.290559807894343e-06,
"logits/chosen": -0.9587245583534241,
"logits/rejected": -1.235076904296875,
"logps/chosen": -109.97119140625,
"logps/rejected": -301.52105712890625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1070733070373535,
"rewards/margins": 15.876703262329102,
"rewards/rejected": -12.76962947845459,
"step": 1880
},
{
"epoch": 0.7658022690437601,
"grad_norm": 2.7889856937690638e-05,
"learning_rate": 8.275551553354344e-06,
"logits/chosen": -0.9489023685455322,
"logits/rejected": -1.22849440574646,
"logps/chosen": -107.74160766601562,
"logps/rejected": -300.9273986816406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1654727458953857,
"rewards/margins": 15.985053062438965,
"rewards/rejected": -12.819581031799316,
"step": 1890
},
{
"epoch": 0.7698541329011345,
"grad_norm": 2.9925871785962954e-05,
"learning_rate": 8.26054329881435e-06,
"logits/chosen": -0.9606993198394775,
"logits/rejected": -1.2304047346115112,
"logps/chosen": -110.7623062133789,
"logps/rejected": -301.9601745605469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0822935104370117,
"rewards/margins": 15.915146827697754,
"rewards/rejected": -12.832853317260742,
"step": 1900
},
{
"epoch": 0.7698541329011345,
"eval_logits/chosen": -0.9868106245994568,
"eval_logits/rejected": -1.241007924079895,
"eval_logps/chosen": -110.56230926513672,
"eval_logps/rejected": -300.6956481933594,
"eval_loss": 5.184895144338952e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.044961929321289,
"eval_rewards/margins": 15.820250511169434,
"eval_rewards/rejected": -12.775288581848145,
"eval_runtime": 658.0376,
"eval_samples_per_second": 11.252,
"eval_steps_per_second": 0.626,
"step": 1900
},
{
"epoch": 0.7739059967585089,
"grad_norm": 4.860399349126965e-05,
"learning_rate": 8.245535044274353e-06,
"logits/chosen": -0.9716636538505554,
"logits/rejected": -1.2283477783203125,
"logps/chosen": -110.34529876708984,
"logps/rejected": -301.6912841796875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0592539310455322,
"rewards/margins": 15.871448516845703,
"rewards/rejected": -12.812193870544434,
"step": 1910
},
{
"epoch": 0.7779578606158833,
"grad_norm": 6.4569860114716e-05,
"learning_rate": 8.230526789734355e-06,
"logits/chosen": -0.9652984738349915,
"logits/rejected": -1.2083947658538818,
"logps/chosen": -110.9874496459961,
"logps/rejected": -302.92138671875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.103862762451172,
"rewards/margins": 16.010520935058594,
"rewards/rejected": -12.906659126281738,
"step": 1920
},
{
"epoch": 0.7820097244732577,
"grad_norm": 4.364985943539068e-05,
"learning_rate": 8.215518535194358e-06,
"logits/chosen": -0.9482593536376953,
"logits/rejected": -1.2342857122421265,
"logps/chosen": -108.68612670898438,
"logps/rejected": -301.5144958496094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1161887645721436,
"rewards/margins": 15.925652503967285,
"rewards/rejected": -12.809463500976562,
"step": 1930
},
{
"epoch": 0.7860615883306321,
"grad_norm": 5.059886825620197e-05,
"learning_rate": 8.20051028065436e-06,
"logits/chosen": -0.9467249512672424,
"logits/rejected": -1.2305415868759155,
"logps/chosen": -110.29265594482422,
"logps/rejected": -301.26641845703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.125284433364868,
"rewards/margins": 15.913708686828613,
"rewards/rejected": -12.788424491882324,
"step": 1940
},
{
"epoch": 0.7901134521880064,
"grad_norm": 3.123753413092345e-05,
"learning_rate": 8.185502026114363e-06,
"logits/chosen": -0.9409447312355042,
"logits/rejected": -1.2227845191955566,
"logps/chosen": -109.94808197021484,
"logps/rejected": -302.04449462890625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1201517581939697,
"rewards/margins": 16.04159927368164,
"rewards/rejected": -12.92144775390625,
"step": 1950
},
{
"epoch": 0.7901134521880064,
"eval_logits/chosen": -0.983956515789032,
"eval_logits/rejected": -1.2356351613998413,
"eval_logps/chosen": -110.52811431884766,
"eval_logps/rejected": -301.3548278808594,
"eval_loss": 4.869766598858405e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.048381805419922,
"eval_rewards/margins": 15.889588356018066,
"eval_rewards/rejected": -12.841206550598145,
"eval_runtime": 660.0123,
"eval_samples_per_second": 11.218,
"eval_steps_per_second": 0.624,
"step": 1950
},
{
"epoch": 0.7941653160453809,
"grad_norm": 1.6401634638896212e-05,
"learning_rate": 8.170493771574367e-06,
"logits/chosen": -0.9526603817939758,
"logits/rejected": -1.2315199375152588,
"logps/chosen": -110.46824645996094,
"logps/rejected": -302.6124267578125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1375341415405273,
"rewards/margins": 16.068687438964844,
"rewards/rejected": -12.931153297424316,
"step": 1960
},
{
"epoch": 0.7982171799027553,
"grad_norm": 3.981655390816741e-05,
"learning_rate": 8.15548551703437e-06,
"logits/chosen": -0.9453114867210388,
"logits/rejected": -1.215904951095581,
"logps/chosen": -108.2788314819336,
"logps/rejected": -302.3946533203125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.17598032951355,
"rewards/margins": 16.017545700073242,
"rewards/rejected": -12.841565132141113,
"step": 1970
},
{
"epoch": 0.8022690437601296,
"grad_norm": 1.9739898561965674e-05,
"learning_rate": 8.140477262494373e-06,
"logits/chosen": -0.9491396546363831,
"logits/rejected": -1.2109198570251465,
"logps/chosen": -109.99365997314453,
"logps/rejected": -302.4257507324219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1579694747924805,
"rewards/margins": 16.02589225769043,
"rewards/rejected": -12.86792278289795,
"step": 1980
},
{
"epoch": 0.8063209076175041,
"grad_norm": 3.2942043617367744e-05,
"learning_rate": 8.125469007954375e-06,
"logits/chosen": -0.941801905632019,
"logits/rejected": -1.2268625497817993,
"logps/chosen": -109.67646026611328,
"logps/rejected": -302.0210266113281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1409685611724854,
"rewards/margins": 16.054298400878906,
"rewards/rejected": -12.913330078125,
"step": 1990
},
{
"epoch": 0.8103727714748784,
"grad_norm": 3.328973980387673e-05,
"learning_rate": 8.110460753414379e-06,
"logits/chosen": -0.9555728435516357,
"logits/rejected": -1.2261112928390503,
"logps/chosen": -110.30085754394531,
"logps/rejected": -303.8353271484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1162924766540527,
"rewards/margins": 16.052085876464844,
"rewards/rejected": -12.935792922973633,
"step": 2000
},
{
"epoch": 0.8103727714748784,
"eval_logits/chosen": -0.9666898250579834,
"eval_logits/rejected": -1.2228957414627075,
"eval_logps/chosen": -110.36251068115234,
"eval_logps/rejected": -301.76934814453125,
"eval_loss": 4.659783314764354e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.06494140625,
"eval_rewards/margins": 15.947602272033691,
"eval_rewards/rejected": -12.882659912109375,
"eval_runtime": 660.0284,
"eval_samples_per_second": 11.218,
"eval_steps_per_second": 0.624,
"step": 2000
},
{
"epoch": 0.8144246353322528,
"grad_norm": 1.4460420061368495e-05,
"learning_rate": 8.095452498874382e-06,
"logits/chosen": -0.9715719819068909,
"logits/rejected": -1.2192199230194092,
"logps/chosen": -109.86674499511719,
"logps/rejected": -301.76434326171875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1414902210235596,
"rewards/margins": 16.00307846069336,
"rewards/rejected": -12.861587524414062,
"step": 2010
},
{
"epoch": 0.8184764991896273,
"grad_norm": 6.478391878772527e-05,
"learning_rate": 8.080444244334384e-06,
"logits/chosen": -0.9564737677574158,
"logits/rejected": -1.2045562267303467,
"logps/chosen": -108.61962890625,
"logps/rejected": -303.49786376953125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1600611209869385,
"rewards/margins": 16.183496475219727,
"rewards/rejected": -13.023435592651367,
"step": 2020
},
{
"epoch": 0.8225283630470016,
"grad_norm": 2.9472497772076167e-05,
"learning_rate": 8.065435989794387e-06,
"logits/chosen": -0.9578773379325867,
"logits/rejected": -1.223385214805603,
"logps/chosen": -109.77428436279297,
"logps/rejected": -303.5888671875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1244020462036133,
"rewards/margins": 16.179670333862305,
"rewards/rejected": -13.055269241333008,
"step": 2030
},
{
"epoch": 0.826580226904376,
"grad_norm": 5.243470150162466e-05,
"learning_rate": 8.05042773525439e-06,
"logits/chosen": -0.9719753265380859,
"logits/rejected": -1.2280404567718506,
"logps/chosen": -110.10773468017578,
"logps/rejected": -303.7828674316406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.111752986907959,
"rewards/margins": 16.16956901550293,
"rewards/rejected": -13.057815551757812,
"step": 2040
},
{
"epoch": 0.8306320907617504,
"grad_norm": 3.237457713112235e-05,
"learning_rate": 8.035419480714394e-06,
"logits/chosen": -0.9367961883544922,
"logits/rejected": -1.209633708000183,
"logps/chosen": -109.77885437011719,
"logps/rejected": -304.89691162109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1424176692962646,
"rewards/margins": 16.200634002685547,
"rewards/rejected": -13.058215141296387,
"step": 2050
},
{
"epoch": 0.8306320907617504,
"eval_logits/chosen": -0.9693470001220703,
"eval_logits/rejected": -1.2243363857269287,
"eval_logps/chosen": -110.29119873046875,
"eval_logps/rejected": -302.1759338378906,
"eval_loss": 4.4409716792870313e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.0720736980438232,
"eval_rewards/margins": 15.995390892028809,
"eval_rewards/rejected": -12.92331600189209,
"eval_runtime": 659.9755,
"eval_samples_per_second": 11.219,
"eval_steps_per_second": 0.624,
"step": 2050
},
{
"epoch": 0.8346839546191248,
"grad_norm": 1.5255555808835197e-05,
"learning_rate": 8.020411226174396e-06,
"logits/chosen": -0.9544581174850464,
"logits/rejected": -1.2138450145721436,
"logps/chosen": -108.7799301147461,
"logps/rejected": -302.1813659667969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1372766494750977,
"rewards/margins": 16.07466697692871,
"rewards/rejected": -12.937390327453613,
"step": 2060
},
{
"epoch": 0.8387358184764991,
"grad_norm": 3.847632615361363e-05,
"learning_rate": 8.0054029716344e-06,
"logits/chosen": -0.9481338858604431,
"logits/rejected": -1.2043477296829224,
"logps/chosen": -110.19457244873047,
"logps/rejected": -302.8457946777344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1281635761260986,
"rewards/margins": 16.106060028076172,
"rewards/rejected": -12.97789478302002,
"step": 2070
},
{
"epoch": 0.8427876823338736,
"grad_norm": 4.2611958633642644e-05,
"learning_rate": 7.990394717094403e-06,
"logits/chosen": -0.9538971781730652,
"logits/rejected": -1.2121487855911255,
"logps/chosen": -109.85386657714844,
"logps/rejected": -303.5600891113281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.137418270111084,
"rewards/margins": 16.140491485595703,
"rewards/rejected": -13.003071784973145,
"step": 2080
},
{
"epoch": 0.846839546191248,
"grad_norm": 4.119348886888474e-05,
"learning_rate": 7.975386462554406e-06,
"logits/chosen": -0.9455956220626831,
"logits/rejected": -1.2411589622497559,
"logps/chosen": -108.50851440429688,
"logps/rejected": -304.57586669921875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2042062282562256,
"rewards/margins": 16.30094337463379,
"rewards/rejected": -13.096736907958984,
"step": 2090
},
{
"epoch": 0.8508914100486223,
"grad_norm": 4.610854739439674e-05,
"learning_rate": 7.96037820801441e-06,
"logits/chosen": -0.9589834809303284,
"logits/rejected": -1.2162960767745972,
"logps/chosen": -110.89701080322266,
"logps/rejected": -302.62799072265625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0954887866973877,
"rewards/margins": 16.030658721923828,
"rewards/rejected": -12.935168266296387,
"step": 2100
},
{
"epoch": 0.8508914100486223,
"eval_logits/chosen": -0.9647515416145325,
"eval_logits/rejected": -1.2190096378326416,
"eval_logps/chosen": -110.22238159179688,
"eval_logps/rejected": -302.7558288574219,
"eval_loss": 4.1841948927867634e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.0789549350738525,
"eval_rewards/margins": 16.06026268005371,
"eval_rewards/rejected": -12.981307029724121,
"eval_runtime": 659.9091,
"eval_samples_per_second": 11.22,
"eval_steps_per_second": 0.624,
"step": 2100
},
{
"epoch": 0.8549432739059968,
"grad_norm": 7.719548011664301e-05,
"learning_rate": 7.945369953474411e-06,
"logits/chosen": -0.9446741938591003,
"logits/rejected": -1.22459876537323,
"logps/chosen": -110.51274108886719,
"logps/rejected": -303.3446044921875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.129234790802002,
"rewards/margins": 16.153383255004883,
"rewards/rejected": -13.024148941040039,
"step": 2110
},
{
"epoch": 0.8589951377633711,
"grad_norm": 2.026069341809489e-05,
"learning_rate": 7.930361698934415e-06,
"logits/chosen": -0.9670036435127258,
"logits/rejected": -1.215293288230896,
"logps/chosen": -109.58710479736328,
"logps/rejected": -304.4532775878906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.140310764312744,
"rewards/margins": 16.27900505065918,
"rewards/rejected": -13.138696670532227,
"step": 2120
},
{
"epoch": 0.8630470016207455,
"grad_norm": 4.710930079454556e-05,
"learning_rate": 7.915353444394418e-06,
"logits/chosen": -0.9606796503067017,
"logits/rejected": -1.200211763381958,
"logps/chosen": -108.72264099121094,
"logps/rejected": -304.9479064941406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1467487812042236,
"rewards/margins": 16.292722702026367,
"rewards/rejected": -13.145975112915039,
"step": 2130
},
{
"epoch": 0.86709886547812,
"grad_norm": 4.4419884943636134e-05,
"learning_rate": 7.90034518985442e-06,
"logits/chosen": -0.9616580605506897,
"logits/rejected": -1.2213574647903442,
"logps/chosen": -110.62073516845703,
"logps/rejected": -304.69097900390625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.0965681076049805,
"rewards/margins": 16.208520889282227,
"rewards/rejected": -13.111952781677246,
"step": 2140
},
{
"epoch": 0.8711507293354943,
"grad_norm": 4.5354092435445637e-05,
"learning_rate": 7.885336935314423e-06,
"logits/chosen": -0.9539754986763,
"logits/rejected": -1.2153164148330688,
"logps/chosen": -110.38399505615234,
"logps/rejected": -303.0393981933594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.09737491607666,
"rewards/margins": 16.079133987426758,
"rewards/rejected": -12.981756210327148,
"step": 2150
},
{
"epoch": 0.8711507293354943,
"eval_logits/chosen": -0.964377224445343,
"eval_logits/rejected": -1.217590093612671,
"eval_logps/chosen": -110.18504333496094,
"eval_logps/rejected": -303.2809753417969,
"eval_loss": 3.976499272084766e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.082688808441162,
"eval_rewards/margins": 16.11651039123535,
"eval_rewards/rejected": -13.033820152282715,
"eval_runtime": 658.0257,
"eval_samples_per_second": 11.252,
"eval_steps_per_second": 0.626,
"step": 2150
},
{
"epoch": 0.8752025931928687,
"grad_norm": 6.480027514044195e-05,
"learning_rate": 7.870328680774427e-06,
"logits/chosen": -0.9567605257034302,
"logits/rejected": -1.2163498401641846,
"logps/chosen": -108.91773223876953,
"logps/rejected": -304.4596252441406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.154085636138916,
"rewards/margins": 16.183382034301758,
"rewards/rejected": -13.029295921325684,
"step": 2160
},
{
"epoch": 0.8792544570502431,
"grad_norm": 2.1783509509987198e-05,
"learning_rate": 7.85532042623443e-06,
"logits/chosen": -0.9555526375770569,
"logits/rejected": -1.2262533903121948,
"logps/chosen": -110.84054565429688,
"logps/rejected": -306.3641357421875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1060667037963867,
"rewards/margins": 16.345033645629883,
"rewards/rejected": -13.23896598815918,
"step": 2170
},
{
"epoch": 0.8833063209076175,
"grad_norm": 4.148611333221197e-05,
"learning_rate": 7.840312171694434e-06,
"logits/chosen": -0.9608704447746277,
"logits/rejected": -1.2355401515960693,
"logps/chosen": -108.211669921875,
"logps/rejected": -306.52606201171875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.148042917251587,
"rewards/margins": 16.463624954223633,
"rewards/rejected": -13.315583229064941,
"step": 2180
},
{
"epoch": 0.8873581847649918,
"grad_norm": 1.6699072148185223e-05,
"learning_rate": 7.825303917154435e-06,
"logits/chosen": -0.9467074871063232,
"logits/rejected": -1.2218189239501953,
"logps/chosen": -107.47708129882812,
"logps/rejected": -306.47119140625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.200939178466797,
"rewards/margins": 16.48932647705078,
"rewards/rejected": -13.288387298583984,
"step": 2190
},
{
"epoch": 0.8914100486223663,
"grad_norm": 3.9296108298003674e-05,
"learning_rate": 7.810295662614439e-06,
"logits/chosen": -0.9578278660774231,
"logits/rejected": -1.1927484273910522,
"logps/chosen": -109.21939849853516,
"logps/rejected": -303.5795593261719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1450209617614746,
"rewards/margins": 16.233585357666016,
"rewards/rejected": -13.088563919067383,
"step": 2200
},
{
"epoch": 0.8914100486223663,
"eval_logits/chosen": -0.9689859747886658,
"eval_logits/rejected": -1.220730185508728,
"eval_logps/chosen": -110.15634155273438,
"eval_logps/rejected": -303.7755126953125,
"eval_loss": 3.7930050211798516e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.0855586528778076,
"eval_rewards/margins": 16.16883659362793,
"eval_rewards/rejected": -13.083277702331543,
"eval_runtime": 657.9854,
"eval_samples_per_second": 11.253,
"eval_steps_per_second": 0.626,
"step": 2200
},
{
"epoch": 0.8954619124797407,
"grad_norm": 9.78490697889356e-06,
"learning_rate": 7.79528740807444e-06,
"logits/chosen": -0.9606353044509888,
"logits/rejected": -1.2140560150146484,
"logps/chosen": -109.4519271850586,
"logps/rejected": -303.8180847167969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1682541370391846,
"rewards/margins": 16.253660202026367,
"rewards/rejected": -13.085405349731445,
"step": 2210
},
{
"epoch": 0.899513776337115,
"grad_norm": 3.433896563365124e-05,
"learning_rate": 7.780279153534444e-06,
"logits/chosen": -0.9603633284568787,
"logits/rejected": -1.2174922227859497,
"logps/chosen": -108.57514190673828,
"logps/rejected": -304.82806396484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1801135540008545,
"rewards/margins": 16.351207733154297,
"rewards/rejected": -13.17109489440918,
"step": 2220
},
{
"epoch": 0.9035656401944895,
"grad_norm": 1.7691954781184904e-05,
"learning_rate": 7.765270898994447e-06,
"logits/chosen": -0.95579594373703,
"logits/rejected": -1.2212696075439453,
"logps/chosen": -110.44479370117188,
"logps/rejected": -305.1944274902344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.132660150527954,
"rewards/margins": 16.284616470336914,
"rewards/rejected": -13.151957511901855,
"step": 2230
},
{
"epoch": 0.9076175040518638,
"grad_norm": 2.412088360870257e-05,
"learning_rate": 7.75026264445445e-06,
"logits/chosen": -0.9635848999023438,
"logits/rejected": -1.2182646989822388,
"logps/chosen": -109.63471984863281,
"logps/rejected": -304.3304443359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.115788459777832,
"rewards/margins": 16.186290740966797,
"rewards/rejected": -13.070501327514648,
"step": 2240
},
{
"epoch": 0.9116693679092382,
"grad_norm": 2.194743683503475e-05,
"learning_rate": 7.735254389914454e-06,
"logits/chosen": -0.9533272981643677,
"logits/rejected": -1.2021334171295166,
"logps/chosen": -110.09785461425781,
"logps/rejected": -305.65771484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.130030393600464,
"rewards/margins": 16.36699104309082,
"rewards/rejected": -13.236960411071777,
"step": 2250
},
{
"epoch": 0.9116693679092382,
"eval_logits/chosen": -0.9838148951530457,
"eval_logits/rejected": -1.2295185327529907,
"eval_logps/chosen": -110.23644256591797,
"eval_logps/rejected": -304.6207580566406,
"eval_loss": 3.502078413930576e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.0775492191314697,
"eval_rewards/margins": 16.245349884033203,
"eval_rewards/rejected": -13.167800903320312,
"eval_runtime": 657.9779,
"eval_samples_per_second": 11.253,
"eval_steps_per_second": 0.626,
"step": 2250
},
{
"epoch": 0.9157212317666127,
"grad_norm": 1.3532581760955509e-05,
"learning_rate": 7.720246135374456e-06,
"logits/chosen": -0.9631421566009521,
"logits/rejected": -1.1869605779647827,
"logps/chosen": -110.19988250732422,
"logps/rejected": -303.62103271484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.128401041030884,
"rewards/margins": 16.225181579589844,
"rewards/rejected": -13.096781730651855,
"step": 2260
},
{
"epoch": 0.919773095623987,
"grad_norm": 2.268419848405756e-05,
"learning_rate": 7.70523788083446e-06,
"logits/chosen": -0.9476529955863953,
"logits/rejected": -1.217498779296875,
"logps/chosen": -108.96920776367188,
"logps/rejected": -305.6793212890625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1439383029937744,
"rewards/margins": 16.39657974243164,
"rewards/rejected": -13.252642631530762,
"step": 2270
},
{
"epoch": 0.9238249594813615,
"grad_norm": 7.45236175134778e-05,
"learning_rate": 7.690229626294463e-06,
"logits/chosen": -0.9605175256729126,
"logits/rejected": -1.2135826349258423,
"logps/chosen": -110.78817749023438,
"logps/rejected": -306.30999755859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1067616939544678,
"rewards/margins": 16.265913009643555,
"rewards/rejected": -13.159149169921875,
"step": 2280
},
{
"epoch": 0.9278768233387358,
"grad_norm": 1.7361502614221536e-05,
"learning_rate": 7.675221371754466e-06,
"logits/chosen": -0.9507707953453064,
"logits/rejected": -1.2035835981369019,
"logps/chosen": -109.37841796875,
"logps/rejected": -305.3598937988281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1481592655181885,
"rewards/margins": 16.325180053710938,
"rewards/rejected": -13.177021026611328,
"step": 2290
},
{
"epoch": 0.9319286871961102,
"grad_norm": 7.1184422267833725e-06,
"learning_rate": 7.66021311721447e-06,
"logits/chosen": -0.9573420286178589,
"logits/rejected": -1.236305594444275,
"logps/chosen": -109.24344635009766,
"logps/rejected": -307.2495422363281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.155404806137085,
"rewards/margins": 16.50580406188965,
"rewards/rejected": -13.3503999710083,
"step": 2300
},
{
"epoch": 0.9319286871961102,
"eval_logits/chosen": -0.9896643161773682,
"eval_logits/rejected": -1.2349047660827637,
"eval_logps/chosen": -110.19889831542969,
"eval_logps/rejected": -305.12225341796875,
"eval_loss": 3.330087849917618e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.0813028812408447,
"eval_rewards/margins": 16.299251556396484,
"eval_rewards/rejected": -13.217947959899902,
"eval_runtime": 658.0447,
"eval_samples_per_second": 11.252,
"eval_steps_per_second": 0.626,
"step": 2300
},
{
"epoch": 0.9359805510534847,
"grad_norm": 1.445604630134767e-05,
"learning_rate": 7.645204862674471e-06,
"logits/chosen": -0.9550139307975769,
"logits/rejected": -1.2085530757904053,
"logps/chosen": -108.17741394042969,
"logps/rejected": -305.9125671386719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1891822814941406,
"rewards/margins": 16.470483779907227,
"rewards/rejected": -13.281301498413086,
"step": 2310
},
{
"epoch": 0.940032414910859,
"grad_norm": 4.8019915993791074e-05,
"learning_rate": 7.630196608134475e-06,
"logits/chosen": -0.9634786248207092,
"logits/rejected": -1.2144436836242676,
"logps/chosen": -110.15174865722656,
"logps/rejected": -306.0100402832031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1174349784851074,
"rewards/margins": 16.30495834350586,
"rewards/rejected": -13.18752384185791,
"step": 2320
},
{
"epoch": 0.9440842787682334,
"grad_norm": 1.4580664355889894e-05,
"learning_rate": 7.615188353594477e-06,
"logits/chosen": -0.942629873752594,
"logits/rejected": -1.216013789176941,
"logps/chosen": -108.79090881347656,
"logps/rejected": -306.5632629394531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1543760299682617,
"rewards/margins": 16.500843048095703,
"rewards/rejected": -13.34646987915039,
"step": 2330
},
{
"epoch": 0.9481361426256077,
"grad_norm": 1.3364463484322187e-05,
"learning_rate": 7.600180099054481e-06,
"logits/chosen": -0.9466074705123901,
"logits/rejected": -1.2142013311386108,
"logps/chosen": -108.32075500488281,
"logps/rejected": -307.10748291015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.168116807937622,
"rewards/margins": 16.500261306762695,
"rewards/rejected": -13.33214282989502,
"step": 2340
},
{
"epoch": 0.9521880064829822,
"grad_norm": 3.1726067390991375e-05,
"learning_rate": 7.585171844514484e-06,
"logits/chosen": -0.9811385869979858,
"logits/rejected": -1.2290759086608887,
"logps/chosen": -110.23688507080078,
"logps/rejected": -306.6099548339844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.13777232170105,
"rewards/margins": 16.42414093017578,
"rewards/rejected": -13.286368370056152,
"step": 2350
},
{
"epoch": 0.9521880064829822,
"eval_logits/chosen": -0.9722626805305481,
"eval_logits/rejected": -1.2209999561309814,
"eval_logps/chosen": -110.04175567626953,
"eval_logps/rejected": -305.3106994628906,
"eval_loss": 3.2545648309678654e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.097018003463745,
"eval_rewards/margins": 16.333810806274414,
"eval_rewards/rejected": -13.236793518066406,
"eval_runtime": 658.0383,
"eval_samples_per_second": 11.252,
"eval_steps_per_second": 0.626,
"step": 2350
},
{
"epoch": 0.9562398703403565,
"grad_norm": 2.971366666315589e-05,
"learning_rate": 7.570163589974486e-06,
"logits/chosen": -0.9537125825881958,
"logits/rejected": -1.2295702695846558,
"logps/chosen": -109.1019515991211,
"logps/rejected": -306.8534240722656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.152003765106201,
"rewards/margins": 16.544950485229492,
"rewards/rejected": -13.39294719696045,
"step": 2360
},
{
"epoch": 0.960291734197731,
"grad_norm": 9.768622840056196e-05,
"learning_rate": 7.55515533543449e-06,
"logits/chosen": -0.98313307762146,
"logits/rejected": -1.2179185152053833,
"logps/chosen": -111.0000228881836,
"logps/rejected": -305.8616638183594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.125744104385376,
"rewards/margins": 16.362468719482422,
"rewards/rejected": -13.236722946166992,
"step": 2370
},
{
"epoch": 0.9643435980551054,
"grad_norm": 8.749291009735316e-05,
"learning_rate": 7.540147080894492e-06,
"logits/chosen": -0.9686611294746399,
"logits/rejected": -1.219423532485962,
"logps/chosen": -109.52857208251953,
"logps/rejected": -306.1866455078125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1496975421905518,
"rewards/margins": 16.51058578491211,
"rewards/rejected": -13.360889434814453,
"step": 2380
},
{
"epoch": 0.9683954619124797,
"grad_norm": 1.0122907951881643e-05,
"learning_rate": 7.525138826354495e-06,
"logits/chosen": -0.9360008835792542,
"logits/rejected": -1.204994797706604,
"logps/chosen": -108.57238006591797,
"logps/rejected": -307.67620849609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.18050217628479,
"rewards/margins": 16.660018920898438,
"rewards/rejected": -13.479516983032227,
"step": 2390
},
{
"epoch": 0.9724473257698542,
"grad_norm": 1.0658640348992776e-05,
"learning_rate": 7.510130571814499e-06,
"logits/chosen": -0.9478757977485657,
"logits/rejected": -1.1838241815567017,
"logps/chosen": -108.75774383544922,
"logps/rejected": -307.07232666015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1749796867370605,
"rewards/margins": 16.550107955932617,
"rewards/rejected": -13.375128746032715,
"step": 2400
},
{
"epoch": 0.9724473257698542,
"eval_logits/chosen": -0.9685700535774231,
"eval_logits/rejected": -1.216765284538269,
"eval_logps/chosen": -109.97445678710938,
"eval_logps/rejected": -305.79486083984375,
"eval_loss": 3.088084667979274e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.103747844696045,
"eval_rewards/margins": 16.38895606994629,
"eval_rewards/rejected": -13.285209655761719,
"eval_runtime": 658.1341,
"eval_samples_per_second": 11.25,
"eval_steps_per_second": 0.626,
"step": 2400
},
{
"epoch": 0.9764991896272285,
"grad_norm": 3.388383629499003e-05,
"learning_rate": 7.495122317274501e-06,
"logits/chosen": -0.960583508014679,
"logits/rejected": -1.2182528972625732,
"logps/chosen": -109.86973571777344,
"logps/rejected": -306.9446716308594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.136913537979126,
"rewards/margins": 16.53013038635254,
"rewards/rejected": -13.393216133117676,
"step": 2410
},
{
"epoch": 0.9805510534846029,
"grad_norm": 1.2524588782980572e-05,
"learning_rate": 7.480114062734505e-06,
"logits/chosen": -0.9616130590438843,
"logits/rejected": -1.2080204486846924,
"logps/chosen": -108.43402862548828,
"logps/rejected": -308.57305908203125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1996264457702637,
"rewards/margins": 16.611858367919922,
"rewards/rejected": -13.412230491638184,
"step": 2420
},
{
"epoch": 0.9846029173419774,
"grad_norm": 3.357211244292557e-05,
"learning_rate": 7.465105808194507e-06,
"logits/chosen": -0.9700466394424438,
"logits/rejected": -1.2211939096450806,
"logps/chosen": -108.138427734375,
"logps/rejected": -309.7015686035156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.188143014907837,
"rewards/margins": 16.78921127319336,
"rewards/rejected": -13.601068496704102,
"step": 2430
},
{
"epoch": 0.9886547811993517,
"grad_norm": 2.0380715795909055e-05,
"learning_rate": 7.450097553654511e-06,
"logits/chosen": -0.9535197019577026,
"logits/rejected": -1.2204744815826416,
"logps/chosen": -109.47471618652344,
"logps/rejected": -306.65875244140625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1321237087249756,
"rewards/margins": 16.443172454833984,
"rewards/rejected": -13.31104850769043,
"step": 2440
},
{
"epoch": 0.9927066450567261,
"grad_norm": 1.2417739526426885e-05,
"learning_rate": 7.435089299114514e-06,
"logits/chosen": -0.9472233057022095,
"logits/rejected": -1.2015880346298218,
"logps/chosen": -108.79183197021484,
"logps/rejected": -305.70318603515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1425604820251465,
"rewards/margins": 16.415618896484375,
"rewards/rejected": -13.273058891296387,
"step": 2450
},
{
"epoch": 0.9927066450567261,
"eval_logits/chosen": -0.9706429839134216,
"eval_logits/rejected": -1.217729926109314,
"eval_logps/chosen": -109.95721435546875,
"eval_logps/rejected": -306.3364562988281,
"eval_loss": 2.9294906767063367e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1054720878601074,
"eval_rewards/margins": 16.444839477539062,
"eval_rewards/rejected": -13.339369773864746,
"eval_runtime": 660.0731,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 2450
},
{
"epoch": 0.9967585089141004,
"grad_norm": 1.7658723663771525e-05,
"learning_rate": 7.420081044574517e-06,
"logits/chosen": -0.9635002017021179,
"logits/rejected": -1.2199903726577759,
"logps/chosen": -108.45741271972656,
"logps/rejected": -308.1318359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1865954399108887,
"rewards/margins": 16.701438903808594,
"rewards/rejected": -13.51484489440918,
"step": 2460
},
{
"epoch": 1.0008103727714748,
"grad_norm": 1.2052866622980218e-05,
"learning_rate": 7.40507279003452e-06,
"logits/chosen": -0.9616323113441467,
"logits/rejected": -1.208625316619873,
"logps/chosen": -109.19210815429688,
"logps/rejected": -307.1117858886719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1796886920928955,
"rewards/margins": 16.61495590209961,
"rewards/rejected": -13.435267448425293,
"step": 2470
},
{
"epoch": 1.0048622366288493,
"grad_norm": 7.082668162183836e-05,
"learning_rate": 7.390064535494522e-06,
"logits/chosen": -0.9665688872337341,
"logits/rejected": -1.2241923809051514,
"logps/chosen": -109.77351379394531,
"logps/rejected": -307.30645751953125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.18113112449646,
"rewards/margins": 16.553733825683594,
"rewards/rejected": -13.372599601745605,
"step": 2480
},
{
"epoch": 1.0089141004862237,
"grad_norm": 9.002913429867476e-06,
"learning_rate": 7.375056280954525e-06,
"logits/chosen": -0.945849597454071,
"logits/rejected": -1.2262566089630127,
"logps/chosen": -109.76206970214844,
"logps/rejected": -308.98834228515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1569628715515137,
"rewards/margins": 16.612316131591797,
"rewards/rejected": -13.455352783203125,
"step": 2490
},
{
"epoch": 1.012965964343598,
"grad_norm": 2.3271795726031996e-05,
"learning_rate": 7.360048026414529e-06,
"logits/chosen": -0.9565450549125671,
"logits/rejected": -1.2092770338058472,
"logps/chosen": -109.36769104003906,
"logps/rejected": -307.6745910644531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1507160663604736,
"rewards/margins": 16.6374454498291,
"rewards/rejected": -13.486729621887207,
"step": 2500
},
{
"epoch": 1.012965964343598,
"eval_logits/chosen": -0.9681739211082458,
"eval_logits/rejected": -1.2141157388687134,
"eval_logps/chosen": -109.94417572021484,
"eval_logps/rejected": -306.7958984375,
"eval_loss": 2.7970889959760825e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.106775999069214,
"eval_rewards/margins": 16.492088317871094,
"eval_rewards/rejected": -13.385313034057617,
"eval_runtime": 660.045,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 2500
},
{
"epoch": 1.0170178282009725,
"grad_norm": 6.652682350249961e-05,
"learning_rate": 7.345039771874531e-06,
"logits/chosen": -0.9601606130599976,
"logits/rejected": -1.192555546760559,
"logps/chosen": -110.04460906982422,
"logps/rejected": -307.0443115234375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1392316818237305,
"rewards/margins": 16.51374053955078,
"rewards/rejected": -13.37450885772705,
"step": 2510
},
{
"epoch": 1.0210696920583469,
"grad_norm": 1.2063643225701526e-05,
"learning_rate": 7.330031517334535e-06,
"logits/chosen": -0.9684518575668335,
"logits/rejected": -1.202974557876587,
"logps/chosen": -110.22441864013672,
"logps/rejected": -306.74822998046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1343910694122314,
"rewards/margins": 16.446535110473633,
"rewards/rejected": -13.312140464782715,
"step": 2520
},
{
"epoch": 1.0251215559157212,
"grad_norm": 1.1835069017251953e-05,
"learning_rate": 7.315023262794537e-06,
"logits/chosen": -0.9609777331352234,
"logits/rejected": -1.1967358589172363,
"logps/chosen": -108.42552947998047,
"logps/rejected": -308.50885009765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1840617656707764,
"rewards/margins": 16.66929817199707,
"rewards/rejected": -13.485235214233398,
"step": 2530
},
{
"epoch": 1.0291734197730957,
"grad_norm": 5.298601081449306e-06,
"learning_rate": 7.300015008254541e-06,
"logits/chosen": -0.9574286937713623,
"logits/rejected": -1.218118667602539,
"logps/chosen": -109.4346694946289,
"logps/rejected": -308.8258056640625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.176945686340332,
"rewards/margins": 16.675168991088867,
"rewards/rejected": -13.498223304748535,
"step": 2540
},
{
"epoch": 1.03322528363047,
"grad_norm": 1.3952515473647509e-05,
"learning_rate": 7.285006753714544e-06,
"logits/chosen": -0.9570482969284058,
"logits/rejected": -1.2174618244171143,
"logps/chosen": -110.29024505615234,
"logps/rejected": -308.82611083984375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.126805067062378,
"rewards/margins": 16.703540802001953,
"rewards/rejected": -13.57673454284668,
"step": 2550
},
{
"epoch": 1.03322528363047,
"eval_logits/chosen": -0.9698132276535034,
"eval_logits/rejected": -1.2148218154907227,
"eval_logps/chosen": -109.87054443359375,
"eval_logps/rejected": -307.2029724121094,
"eval_loss": 2.692640350687725e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1141395568847656,
"eval_rewards/margins": 16.540159225463867,
"eval_rewards/rejected": -13.426016807556152,
"eval_runtime": 657.969,
"eval_samples_per_second": 11.253,
"eval_steps_per_second": 0.626,
"step": 2550
},
{
"epoch": 1.0372771474878444,
"grad_norm": 9.740067980601452e-06,
"learning_rate": 7.269998499174547e-06,
"logits/chosen": -0.9624655246734619,
"logits/rejected": -1.219292163848877,
"logps/chosen": -109.78215789794922,
"logps/rejected": -309.5098876953125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1512138843536377,
"rewards/margins": 16.796560287475586,
"rewards/rejected": -13.645344734191895,
"step": 2560
},
{
"epoch": 1.0413290113452187,
"grad_norm": 4.33393579442054e-05,
"learning_rate": 7.25499024463455e-06,
"logits/chosen": -0.961388885974884,
"logits/rejected": -1.2088836431503296,
"logps/chosen": -108.20442199707031,
"logps/rejected": -307.0656433105469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2014071941375732,
"rewards/margins": 16.71923065185547,
"rewards/rejected": -13.517821311950684,
"step": 2570
},
{
"epoch": 1.0453808752025933,
"grad_norm": 1.0012409802584443e-05,
"learning_rate": 7.239981990094552e-06,
"logits/chosen": -0.9583010077476501,
"logits/rejected": -1.2122553586959839,
"logps/chosen": -108.27478790283203,
"logps/rejected": -309.6136474609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2165255546569824,
"rewards/margins": 16.80967903137207,
"rewards/rejected": -13.59315299987793,
"step": 2580
},
{
"epoch": 1.0494327390599676,
"grad_norm": 3.054554690606892e-05,
"learning_rate": 7.224973735554555e-06,
"logits/chosen": -0.9547958374023438,
"logits/rejected": -1.217245101928711,
"logps/chosen": -110.09384155273438,
"logps/rejected": -306.6957702636719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.198312282562256,
"rewards/margins": 16.49526596069336,
"rewards/rejected": -13.296950340270996,
"step": 2590
},
{
"epoch": 1.053484602917342,
"grad_norm": 1.1041483958251774e-05,
"learning_rate": 7.209965481014558e-06,
"logits/chosen": -0.9645355939865112,
"logits/rejected": -1.234001636505127,
"logps/chosen": -108.32767486572266,
"logps/rejected": -308.9895324707031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.186584711074829,
"rewards/margins": 16.76895523071289,
"rewards/rejected": -13.582369804382324,
"step": 2600
},
{
"epoch": 1.053484602917342,
"eval_logits/chosen": -0.9692774415016174,
"eval_logits/rejected": -1.2138540744781494,
"eval_logps/chosen": -109.85295867919922,
"eval_logps/rejected": -307.5146484375,
"eval_loss": 2.5956160243367776e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1158974170684814,
"eval_rewards/margins": 16.57308578491211,
"eval_rewards/rejected": -13.457188606262207,
"eval_runtime": 660.0129,
"eval_samples_per_second": 11.218,
"eval_steps_per_second": 0.624,
"step": 2600
},
{
"epoch": 1.0575364667747165,
"grad_norm": 1.8728651411947794e-05,
"learning_rate": 7.194957226474561e-06,
"logits/chosen": -0.9509859085083008,
"logits/rejected": -1.2229541540145874,
"logps/chosen": -109.80980682373047,
"logps/rejected": -307.8365173339844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1706836223602295,
"rewards/margins": 16.656150817871094,
"rewards/rejected": -13.485466957092285,
"step": 2610
},
{
"epoch": 1.0615883306320908,
"grad_norm": 1.7515225408715196e-05,
"learning_rate": 7.179948971934565e-06,
"logits/chosen": -0.9719070196151733,
"logits/rejected": -1.2121365070343018,
"logps/chosen": -109.24164581298828,
"logps/rejected": -309.3529968261719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.152325391769409,
"rewards/margins": 16.653779983520508,
"rewards/rejected": -13.50145435333252,
"step": 2620
},
{
"epoch": 1.0656401944894651,
"grad_norm": 3.066382487304509e-05,
"learning_rate": 7.1649407173945674e-06,
"logits/chosen": -0.9582745432853699,
"logits/rejected": -1.2080187797546387,
"logps/chosen": -110.07678985595703,
"logps/rejected": -308.70703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.156878709793091,
"rewards/margins": 16.607290267944336,
"rewards/rejected": -13.450408935546875,
"step": 2630
},
{
"epoch": 1.0696920583468394,
"grad_norm": 1.7575619494891725e-05,
"learning_rate": 7.149932462854571e-06,
"logits/chosen": -0.960273802280426,
"logits/rejected": -1.197909951210022,
"logps/chosen": -109.26360321044922,
"logps/rejected": -310.2976379394531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1560423374176025,
"rewards/margins": 16.926837921142578,
"rewards/rejected": -13.770796775817871,
"step": 2640
},
{
"epoch": 1.073743922204214,
"grad_norm": 1.885088022390846e-05,
"learning_rate": 7.1349242083145734e-06,
"logits/chosen": -0.9642795324325562,
"logits/rejected": -1.2084158658981323,
"logps/chosen": -109.43455505371094,
"logps/rejected": -308.03277587890625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1592416763305664,
"rewards/margins": 16.610139846801758,
"rewards/rejected": -13.450898170471191,
"step": 2650
},
{
"epoch": 1.073743922204214,
"eval_logits/chosen": -0.9705721139907837,
"eval_logits/rejected": -1.213883638381958,
"eval_logps/chosen": -109.81368255615234,
"eval_logps/rejected": -308.0562744140625,
"eval_loss": 2.4671899723216484e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.119823932647705,
"eval_rewards/margins": 16.631174087524414,
"eval_rewards/rejected": -13.511351585388184,
"eval_runtime": 660.1147,
"eval_samples_per_second": 11.216,
"eval_steps_per_second": 0.624,
"step": 2650
},
{
"epoch": 1.0777957860615883,
"grad_norm": 1.9579389118007384e-05,
"learning_rate": 7.119915953774577e-06,
"logits/chosen": -0.9679809808731079,
"logits/rejected": -1.21659517288208,
"logps/chosen": -109.89112854003906,
"logps/rejected": -309.0220947265625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.161513328552246,
"rewards/margins": 16.76967430114746,
"rewards/rejected": -13.608160018920898,
"step": 2660
},
{
"epoch": 1.0818476499189627,
"grad_norm": 7.737518899375573e-06,
"learning_rate": 7.10490769923458e-06,
"logits/chosen": -0.9529644846916199,
"logits/rejected": -1.1993566751480103,
"logps/chosen": -108.52783966064453,
"logps/rejected": -310.7772521972656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.216148853302002,
"rewards/margins": 16.948780059814453,
"rewards/rejected": -13.73263168334961,
"step": 2670
},
{
"epoch": 1.0858995137763372,
"grad_norm": 1.2826951206079684e-05,
"learning_rate": 7.089899444694582e-06,
"logits/chosen": -0.9718688130378723,
"logits/rejected": -1.2110012769699097,
"logps/chosen": -109.75894165039062,
"logps/rejected": -309.4825134277344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.167945623397827,
"rewards/margins": 16.783924102783203,
"rewards/rejected": -13.61597728729248,
"step": 2680
},
{
"epoch": 1.0899513776337115,
"grad_norm": 1.1608887689362746e-05,
"learning_rate": 7.0748911901545855e-06,
"logits/chosen": -0.966856837272644,
"logits/rejected": -1.2022080421447754,
"logps/chosen": -110.1280288696289,
"logps/rejected": -307.17724609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1565988063812256,
"rewards/margins": 16.637836456298828,
"rewards/rejected": -13.48123550415039,
"step": 2690
},
{
"epoch": 1.0940032414910859,
"grad_norm": 7.56221852498129e-05,
"learning_rate": 7.059882935614588e-06,
"logits/chosen": -0.9639146327972412,
"logits/rejected": -1.2138209342956543,
"logps/chosen": -109.44894409179688,
"logps/rejected": -308.7769775390625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.192052125930786,
"rewards/margins": 16.716800689697266,
"rewards/rejected": -13.524748802185059,
"step": 2700
},
{
"epoch": 1.0940032414910859,
"eval_logits/chosen": -0.9828658699989319,
"eval_logits/rejected": -1.2210161685943604,
"eval_logps/chosen": -109.9037094116211,
"eval_logps/rejected": -308.7952880859375,
"eval_loss": 2.3104557556052896e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1108219623565674,
"eval_rewards/margins": 16.69607162475586,
"eval_rewards/rejected": -13.585249900817871,
"eval_runtime": 660.189,
"eval_samples_per_second": 11.215,
"eval_steps_per_second": 0.624,
"step": 2700
},
{
"epoch": 1.0980551053484602,
"grad_norm": 2.3086533474270254e-05,
"learning_rate": 7.0448746810745915e-06,
"logits/chosen": -0.9712207913398743,
"logits/rejected": -1.207464575767517,
"logps/chosen": -109.36491394042969,
"logps/rejected": -310.7517395019531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1938600540161133,
"rewards/margins": 16.914466857910156,
"rewards/rejected": -13.72060775756836,
"step": 2710
},
{
"epoch": 1.1021069692058347,
"grad_norm": 8.873008482623845e-06,
"learning_rate": 7.029866426534595e-06,
"logits/chosen": -0.9603047966957092,
"logits/rejected": -1.2173120975494385,
"logps/chosen": -108.4090347290039,
"logps/rejected": -309.2873840332031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.239743232727051,
"rewards/margins": 16.840497970581055,
"rewards/rejected": -13.600753784179688,
"step": 2720
},
{
"epoch": 1.106158833063209,
"grad_norm": 9.48353590501938e-06,
"learning_rate": 7.0148581719945975e-06,
"logits/chosen": -0.9486533403396606,
"logits/rejected": -1.2198814153671265,
"logps/chosen": -109.09212493896484,
"logps/rejected": -310.3663635253906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.19498348236084,
"rewards/margins": 16.885324478149414,
"rewards/rejected": -13.690340042114258,
"step": 2730
},
{
"epoch": 1.1102106969205834,
"grad_norm": 1.4153183656162582e-05,
"learning_rate": 6.999849917454601e-06,
"logits/chosen": -0.9536285996437073,
"logits/rejected": -1.2051887512207031,
"logps/chosen": -109.12940979003906,
"logps/rejected": -311.1226806640625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.199876070022583,
"rewards/margins": 16.80828857421875,
"rewards/rejected": -13.608412742614746,
"step": 2740
},
{
"epoch": 1.114262560777958,
"grad_norm": 8.834592335915659e-06,
"learning_rate": 6.9848416629146035e-06,
"logits/chosen": -0.9559447169303894,
"logits/rejected": -1.213094711303711,
"logps/chosen": -107.90196228027344,
"logps/rejected": -310.5301818847656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.203704595565796,
"rewards/margins": 16.849332809448242,
"rewards/rejected": -13.645628929138184,
"step": 2750
},
{
"epoch": 1.114262560777958,
"eval_logits/chosen": -0.9668858647346497,
"eval_logits/rejected": -1.2091883420944214,
"eval_logps/chosen": -109.76824951171875,
"eval_logps/rejected": -308.951904296875,
"eval_loss": 2.2648006847703073e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1243679523468018,
"eval_rewards/margins": 16.725284576416016,
"eval_rewards/rejected": -13.60091495513916,
"eval_runtime": 660.0675,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 2750
},
{
"epoch": 1.1183144246353323,
"grad_norm": 9.556223631079774e-06,
"learning_rate": 6.969833408374607e-06,
"logits/chosen": -0.9617080092430115,
"logits/rejected": -1.2125369310379028,
"logps/chosen": -108.94612884521484,
"logps/rejected": -309.7747497558594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1654481887817383,
"rewards/margins": 16.90652084350586,
"rewards/rejected": -13.741071701049805,
"step": 2760
},
{
"epoch": 1.1223662884927066,
"grad_norm": 1.3097763257974293e-05,
"learning_rate": 6.95482515383461e-06,
"logits/chosen": -0.9512226581573486,
"logits/rejected": -1.2244887351989746,
"logps/chosen": -108.65338897705078,
"logps/rejected": -310.4426574707031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.196953296661377,
"rewards/margins": 16.88877296447754,
"rewards/rejected": -13.691821098327637,
"step": 2770
},
{
"epoch": 1.1264181523500811,
"grad_norm": 4.03745298171998e-06,
"learning_rate": 6.939816899294612e-06,
"logits/chosen": -0.9613186717033386,
"logits/rejected": -1.2134889364242554,
"logps/chosen": -108.67975616455078,
"logps/rejected": -311.4523010253906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2251639366149902,
"rewards/margins": 16.996583938598633,
"rewards/rejected": -13.7714204788208,
"step": 2780
},
{
"epoch": 1.1304700162074555,
"grad_norm": 1.7077558368328027e-05,
"learning_rate": 6.9248086447546155e-06,
"logits/chosen": -0.9708888530731201,
"logits/rejected": -1.2140629291534424,
"logps/chosen": -110.174072265625,
"logps/rejected": -309.85662841796875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1481001377105713,
"rewards/margins": 16.778745651245117,
"rewards/rejected": -13.630645751953125,
"step": 2790
},
{
"epoch": 1.1345218800648298,
"grad_norm": 8.170194632839411e-06,
"learning_rate": 6.909800390214618e-06,
"logits/chosen": -0.9594457149505615,
"logits/rejected": -1.1950657367706299,
"logps/chosen": -109.31538391113281,
"logps/rejected": -309.1491394042969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.198590040206909,
"rewards/margins": 16.764400482177734,
"rewards/rejected": -13.565810203552246,
"step": 2800
},
{
"epoch": 1.1345218800648298,
"eval_logits/chosen": -0.9978938698768616,
"eval_logits/rejected": -1.2356668710708618,
"eval_logps/chosen": -109.79161071777344,
"eval_logps/rejected": -309.6037292480469,
"eval_loss": 2.1162637153793185e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1220312118530273,
"eval_rewards/margins": 16.788131713867188,
"eval_rewards/rejected": -13.66610050201416,
"eval_runtime": 661.7278,
"eval_samples_per_second": 11.189,
"eval_steps_per_second": 0.623,
"step": 2800
},
{
"epoch": 1.1385737439222041,
"grad_norm": 1.399219036102295e-05,
"learning_rate": 6.8947921356746215e-06,
"logits/chosen": -0.9749470949172974,
"logits/rejected": -1.2154656648635864,
"logps/chosen": -109.16936492919922,
"logps/rejected": -310.18341064453125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1595356464385986,
"rewards/margins": 16.84941864013672,
"rewards/rejected": -13.689882278442383,
"step": 2810
},
{
"epoch": 1.1426256077795787,
"grad_norm": 2.8051452318322845e-05,
"learning_rate": 6.879783881134625e-06,
"logits/chosen": -0.9578418135643005,
"logits/rejected": -1.2031115293502808,
"logps/chosen": -109.2094497680664,
"logps/rejected": -311.97772216796875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.177567958831787,
"rewards/margins": 16.95680046081543,
"rewards/rejected": -13.779232025146484,
"step": 2820
},
{
"epoch": 1.146677471636953,
"grad_norm": 2.0797868273803033e-05,
"learning_rate": 6.8647756265946275e-06,
"logits/chosen": -0.9547550678253174,
"logits/rejected": -1.1948775053024292,
"logps/chosen": -108.92700958251953,
"logps/rejected": -310.82525634765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2154428958892822,
"rewards/margins": 16.930280685424805,
"rewards/rejected": -13.714838027954102,
"step": 2830
},
{
"epoch": 1.1507293354943273,
"grad_norm": 1.0841012226592284e-05,
"learning_rate": 6.849767372054631e-06,
"logits/chosen": -0.9574143290519714,
"logits/rejected": -1.2079883813858032,
"logps/chosen": -109.1623306274414,
"logps/rejected": -311.0281677246094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.185199499130249,
"rewards/margins": 16.914926528930664,
"rewards/rejected": -13.72972583770752,
"step": 2840
},
{
"epoch": 1.1547811993517019,
"grad_norm": 1.7846401533461176e-05,
"learning_rate": 6.8347591175146335e-06,
"logits/chosen": -0.9691399931907654,
"logits/rejected": -1.219811201095581,
"logps/chosen": -108.34465789794922,
"logps/rejected": -310.8151550292969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2249460220336914,
"rewards/margins": 17.007930755615234,
"rewards/rejected": -13.782984733581543,
"step": 2850
},
{
"epoch": 1.1547811993517019,
"eval_logits/chosen": -0.9882211685180664,
"eval_logits/rejected": -1.2233705520629883,
"eval_logps/chosen": -109.82547760009766,
"eval_logps/rejected": -310.0188293457031,
"eval_loss": 2.0442119819108484e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1186447143554688,
"eval_rewards/margins": 16.82625389099121,
"eval_rewards/rejected": -13.707608222961426,
"eval_runtime": 676.0561,
"eval_samples_per_second": 10.952,
"eval_steps_per_second": 0.609,
"step": 2850
},
{
"epoch": 1.1588330632090762,
"grad_norm": 3.249685687478632e-05,
"learning_rate": 6.819750862974637e-06,
"logits/chosen": -0.9430721402168274,
"logits/rejected": -1.2220674753189087,
"logps/chosen": -107.54280090332031,
"logps/rejected": -311.5782470703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.235630750656128,
"rewards/margins": 17.058828353881836,
"rewards/rejected": -13.823197364807129,
"step": 2860
},
{
"epoch": 1.1628849270664505,
"grad_norm": 2.4229198970715515e-05,
"learning_rate": 6.804742608434639e-06,
"logits/chosen": -0.9694324135780334,
"logits/rejected": -1.2041586637496948,
"logps/chosen": -110.08727264404297,
"logps/rejected": -310.7659912109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.178534984588623,
"rewards/margins": 16.909570693969727,
"rewards/rejected": -13.731036186218262,
"step": 2870
},
{
"epoch": 1.1669367909238249,
"grad_norm": 4.381558028399013e-05,
"learning_rate": 6.789734353894643e-06,
"logits/chosen": -0.9603563547134399,
"logits/rejected": -1.2125976085662842,
"logps/chosen": -109.15208435058594,
"logps/rejected": -309.8031311035156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.184885263442993,
"rewards/margins": 16.767210006713867,
"rewards/rejected": -13.582324028015137,
"step": 2880
},
{
"epoch": 1.1709886547811994,
"grad_norm": 1.5234799320751335e-05,
"learning_rate": 6.774726099354646e-06,
"logits/chosen": -0.9676933884620667,
"logits/rejected": -1.2179750204086304,
"logps/chosen": -109.15142059326172,
"logps/rejected": -310.5060729980469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2184736728668213,
"rewards/margins": 17.02947425842285,
"rewards/rejected": -13.81100082397461,
"step": 2890
},
{
"epoch": 1.1750405186385737,
"grad_norm": 9.855923963186797e-06,
"learning_rate": 6.759717844814648e-06,
"logits/chosen": -0.9541704654693604,
"logits/rejected": -1.201403021812439,
"logps/chosen": -109.80725860595703,
"logps/rejected": -310.9417724609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.17207932472229,
"rewards/margins": 16.8778018951416,
"rewards/rejected": -13.705724716186523,
"step": 2900
},
{
"epoch": 1.1750405186385737,
"eval_logits/chosen": -0.9700528979301453,
"eval_logits/rejected": -1.2112122774124146,
"eval_logps/chosen": -109.64909362792969,
"eval_logps/rejected": -310.08612060546875,
"eval_loss": 2.0142599055361643e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1362838745117188,
"eval_rewards/margins": 16.850624084472656,
"eval_rewards/rejected": -13.714340209960938,
"eval_runtime": 689.3816,
"eval_samples_per_second": 10.74,
"eval_steps_per_second": 0.598,
"step": 2900
},
{
"epoch": 1.179092382495948,
"grad_norm": 3.834591552731581e-05,
"learning_rate": 6.7447095902746515e-06,
"logits/chosen": -0.9695179462432861,
"logits/rejected": -1.1922355890274048,
"logps/chosen": -109.74037170410156,
"logps/rejected": -311.2341003417969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.206512689590454,
"rewards/margins": 16.96829605102539,
"rewards/rejected": -13.761781692504883,
"step": 2910
},
{
"epoch": 1.1831442463533226,
"grad_norm": 3.295067654107697e-05,
"learning_rate": 6.729701335734654e-06,
"logits/chosen": -0.9576932191848755,
"logits/rejected": -1.2104113101959229,
"logps/chosen": -107.79331970214844,
"logps/rejected": -310.0033874511719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.241929531097412,
"rewards/margins": 16.90349578857422,
"rewards/rejected": -13.661564826965332,
"step": 2920
},
{
"epoch": 1.187196110210697,
"grad_norm": 3.6701349017675966e-05,
"learning_rate": 6.7146930811946575e-06,
"logits/chosen": -0.9661968350410461,
"logits/rejected": -1.218201994895935,
"logps/chosen": -108.45980072021484,
"logps/rejected": -311.50604248046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2053275108337402,
"rewards/margins": 17.048315048217773,
"rewards/rejected": -13.842986106872559,
"step": 2930
},
{
"epoch": 1.1912479740680713,
"grad_norm": 1.0536626177781727e-05,
"learning_rate": 6.699684826654661e-06,
"logits/chosen": -0.9455077648162842,
"logits/rejected": -1.207572340965271,
"logps/chosen": -108.63707733154297,
"logps/rejected": -312.3814392089844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2204668521881104,
"rewards/margins": 17.038225173950195,
"rewards/rejected": -13.817757606506348,
"step": 2940
},
{
"epoch": 1.1952998379254458,
"grad_norm": 1.333241834799992e-05,
"learning_rate": 6.6846765721146636e-06,
"logits/chosen": -0.9706599116325378,
"logits/rejected": -1.2194017171859741,
"logps/chosen": -109.55686950683594,
"logps/rejected": -310.6762390136719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1767683029174805,
"rewards/margins": 16.9427433013916,
"rewards/rejected": -13.765974998474121,
"step": 2950
},
{
"epoch": 1.1952998379254458,
"eval_logits/chosen": -0.9654695987701416,
"eval_logits/rejected": -1.2049760818481445,
"eval_logps/chosen": -109.65506744384766,
"eval_logps/rejected": -310.4198303222656,
"eval_loss": 1.9477491264296987e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1356868743896484,
"eval_rewards/margins": 16.883392333984375,
"eval_rewards/rejected": -13.747706413269043,
"eval_runtime": 657.3556,
"eval_samples_per_second": 11.263,
"eval_steps_per_second": 0.627,
"step": 2950
},
{
"epoch": 1.1993517017828201,
"grad_norm": 1.7855747501016594e-05,
"learning_rate": 6.669668317574667e-06,
"logits/chosen": -0.978232204914093,
"logits/rejected": -1.2113639116287231,
"logps/chosen": -108.95658111572266,
"logps/rejected": -311.7427978515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1936254501342773,
"rewards/margins": 17.014652252197266,
"rewards/rejected": -13.821026802062988,
"step": 2960
},
{
"epoch": 1.2034035656401945,
"grad_norm": 7.74248837842606e-06,
"learning_rate": 6.6546600630346696e-06,
"logits/chosen": -0.9706756472587585,
"logits/rejected": -1.2182252407073975,
"logps/chosen": -109.6180648803711,
"logps/rejected": -311.6573486328125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.184460163116455,
"rewards/margins": 17.020050048828125,
"rewards/rejected": -13.835589408874512,
"step": 2970
},
{
"epoch": 1.2074554294975688,
"grad_norm": 2.9659451683983207e-05,
"learning_rate": 6.639651808494673e-06,
"logits/chosen": -0.9520205855369568,
"logits/rejected": -1.2165043354034424,
"logps/chosen": -108.52173614501953,
"logps/rejected": -312.7424621582031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.274117946624756,
"rewards/margins": 17.17621612548828,
"rewards/rejected": -13.902097702026367,
"step": 2980
},
{
"epoch": 1.2115072933549433,
"grad_norm": 3.948523590224795e-05,
"learning_rate": 6.624643553954676e-06,
"logits/chosen": -0.9564474821090698,
"logits/rejected": -1.2092334032058716,
"logps/chosen": -106.98612976074219,
"logps/rejected": -312.2510070800781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.25746488571167,
"rewards/margins": 17.082439422607422,
"rewards/rejected": -13.82497501373291,
"step": 2990
},
{
"epoch": 1.2155591572123177,
"grad_norm": 1.3657989256898873e-05,
"learning_rate": 6.609635299414678e-06,
"logits/chosen": -0.9624108672142029,
"logits/rejected": -1.1985855102539062,
"logps/chosen": -109.48686218261719,
"logps/rejected": -310.64849853515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1811981201171875,
"rewards/margins": 16.845518112182617,
"rewards/rejected": -13.664319038391113,
"step": 3000
},
{
"epoch": 1.2155591572123177,
"eval_logits/chosen": -0.9728745222091675,
"eval_logits/rejected": -1.211281418800354,
"eval_logps/chosen": -109.64574432373047,
"eval_logps/rejected": -310.9217529296875,
"eval_loss": 1.861751570686465e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.136619806289673,
"eval_rewards/margins": 16.934520721435547,
"eval_rewards/rejected": -13.797901153564453,
"eval_runtime": 668.7462,
"eval_samples_per_second": 11.071,
"eval_steps_per_second": 0.616,
"step": 3000
},
{
"epoch": 1.219611021069692,
"grad_norm": 6.40754951746203e-05,
"learning_rate": 6.5946270448746816e-06,
"logits/chosen": -0.9686071276664734,
"logits/rejected": -1.2071101665496826,
"logps/chosen": -110.0566177368164,
"logps/rejected": -312.8505554199219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1576898097991943,
"rewards/margins": 17.086423873901367,
"rewards/rejected": -13.928732872009277,
"step": 3010
},
{
"epoch": 1.2236628849270665,
"grad_norm": 2.9892496968386695e-05,
"learning_rate": 6.579618790334684e-06,
"logits/chosen": -0.9622131586074829,
"logits/rejected": -1.193557858467102,
"logps/chosen": -109.8584976196289,
"logps/rejected": -311.5018310546875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1661813259124756,
"rewards/margins": 16.959264755249023,
"rewards/rejected": -13.793082237243652,
"step": 3020
},
{
"epoch": 1.2277147487844409,
"grad_norm": 3.853169982903637e-05,
"learning_rate": 6.564610535794688e-06,
"logits/chosen": -0.9711416959762573,
"logits/rejected": -1.2121407985687256,
"logps/chosen": -110.18315124511719,
"logps/rejected": -310.7025451660156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1713101863861084,
"rewards/margins": 16.95589256286621,
"rewards/rejected": -13.784581184387207,
"step": 3030
},
{
"epoch": 1.2317666126418152,
"grad_norm": 2.0132029021624476e-05,
"learning_rate": 6.549602281254691e-06,
"logits/chosen": -0.9588344097137451,
"logits/rejected": -1.2041640281677246,
"logps/chosen": -108.35846710205078,
"logps/rejected": -312.06689453125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2102229595184326,
"rewards/margins": 17.149709701538086,
"rewards/rejected": -13.939485549926758,
"step": 3040
},
{
"epoch": 1.2358184764991895,
"grad_norm": 7.818654921720736e-06,
"learning_rate": 6.534594026714694e-06,
"logits/chosen": -0.9599415063858032,
"logits/rejected": -1.2277412414550781,
"logps/chosen": -108.01351928710938,
"logps/rejected": -313.9948425292969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.244805097579956,
"rewards/margins": 17.302661895751953,
"rewards/rejected": -14.057855606079102,
"step": 3050
},
{
"epoch": 1.2358184764991895,
"eval_logits/chosen": -0.9753085374832153,
"eval_logits/rejected": -1.2139606475830078,
"eval_logps/chosen": -109.60204315185547,
"eval_logps/rejected": -311.3223571777344,
"eval_loss": 1.7824810072397668e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.140988826751709,
"eval_rewards/margins": 16.97894859313965,
"eval_rewards/rejected": -13.837959289550781,
"eval_runtime": 683.1407,
"eval_samples_per_second": 10.838,
"eval_steps_per_second": 0.603,
"step": 3050
},
{
"epoch": 1.239870340356564,
"grad_norm": 7.812601324985735e-06,
"learning_rate": 6.519585772174697e-06,
"logits/chosen": -0.9611976146697998,
"logits/rejected": -1.2113627195358276,
"logps/chosen": -108.8201675415039,
"logps/rejected": -312.1944274902344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2425155639648438,
"rewards/margins": 17.1594295501709,
"rewards/rejected": -13.916913032531738,
"step": 3060
},
{
"epoch": 1.2439222042139384,
"grad_norm": 7.239479145937366e-06,
"learning_rate": 6.5045775176347e-06,
"logits/chosen": -0.9635852575302124,
"logits/rejected": -1.214555025100708,
"logps/chosen": -108.35509490966797,
"logps/rejected": -312.2405090332031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.231051206588745,
"rewards/margins": 17.1818790435791,
"rewards/rejected": -13.950826644897461,
"step": 3070
},
{
"epoch": 1.2479740680713127,
"grad_norm": 2.3521504772361368e-05,
"learning_rate": 6.489569263094703e-06,
"logits/chosen": -0.9610281586647034,
"logits/rejected": -1.218076229095459,
"logps/chosen": -109.09011840820312,
"logps/rejected": -311.3946533203125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1831178665161133,
"rewards/margins": 17.014116287231445,
"rewards/rejected": -13.830997467041016,
"step": 3080
},
{
"epoch": 1.2520259319286873,
"grad_norm": 9.943691111402586e-06,
"learning_rate": 6.4745610085547065e-06,
"logits/chosen": -0.9672773480415344,
"logits/rejected": -1.20703125,
"logps/chosen": -108.8431625366211,
"logps/rejected": -313.36944580078125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2411019802093506,
"rewards/margins": 17.166112899780273,
"rewards/rejected": -13.925012588500977,
"step": 3090
},
{
"epoch": 1.2560777957860616,
"grad_norm": 9.48311026149895e-06,
"learning_rate": 6.459552754014708e-06,
"logits/chosen": -0.9685242772102356,
"logits/rejected": -1.2248913049697876,
"logps/chosen": -109.63764190673828,
"logps/rejected": -314.3175964355469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.185171604156494,
"rewards/margins": 17.155221939086914,
"rewards/rejected": -13.970049858093262,
"step": 3100
},
{
"epoch": 1.2560777957860616,
"eval_logits/chosen": -0.9879578351974487,
"eval_logits/rejected": -1.2205256223678589,
"eval_logps/chosen": -109.65383911132812,
"eval_logps/rejected": -311.7254333496094,
"eval_loss": 1.7127376850112341e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1358084678649902,
"eval_rewards/margins": 17.014074325561523,
"eval_rewards/rejected": -13.878265380859375,
"eval_runtime": 670.5917,
"eval_samples_per_second": 11.041,
"eval_steps_per_second": 0.614,
"step": 3100
},
{
"epoch": 1.260129659643436,
"grad_norm": 5.6280673561559524e-06,
"learning_rate": 6.444544499474712e-06,
"logits/chosen": -0.9702467322349548,
"logits/rejected": -1.2132569551467896,
"logps/chosen": -110.29287719726562,
"logps/rejected": -313.4588623046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.165759563446045,
"rewards/margins": 17.14694595336914,
"rewards/rejected": -13.98118782043457,
"step": 3110
},
{
"epoch": 1.2641815235008105,
"grad_norm": 2.7766443963628262e-05,
"learning_rate": 6.429536244934714e-06,
"logits/chosen": -0.9578903317451477,
"logits/rejected": -1.2012211084365845,
"logps/chosen": -109.4847183227539,
"logps/rejected": -311.3115234375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1903371810913086,
"rewards/margins": 17.070411682128906,
"rewards/rejected": -13.88007640838623,
"step": 3120
},
{
"epoch": 1.2682333873581848,
"grad_norm": 8.8372298705508e-06,
"learning_rate": 6.414527990394718e-06,
"logits/chosen": -0.9595220685005188,
"logits/rejected": -1.2112177610397339,
"logps/chosen": -108.19755554199219,
"logps/rejected": -312.2407531738281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.194171190261841,
"rewards/margins": 17.092443466186523,
"rewards/rejected": -13.898271560668945,
"step": 3130
},
{
"epoch": 1.2722852512155591,
"grad_norm": 5.094006610306678e-06,
"learning_rate": 6.39951973585472e-06,
"logits/chosen": -0.9771420955657959,
"logits/rejected": -1.2134661674499512,
"logps/chosen": -109.30355834960938,
"logps/rejected": -312.1795959472656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2299623489379883,
"rewards/margins": 17.149782180786133,
"rewards/rejected": -13.919818878173828,
"step": 3140
},
{
"epoch": 1.2763371150729337,
"grad_norm": 3.5263063182355836e-05,
"learning_rate": 6.384511481314724e-06,
"logits/chosen": -0.9556463956832886,
"logits/rejected": -1.201846957206726,
"logps/chosen": -109.28461456298828,
"logps/rejected": -311.3385925292969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1858484745025635,
"rewards/margins": 16.945899963378906,
"rewards/rejected": -13.760053634643555,
"step": 3150
},
{
"epoch": 1.2763371150729337,
"eval_logits/chosen": -0.9694511890411377,
"eval_logits/rejected": -1.2067033052444458,
"eval_logps/chosen": -109.51664733886719,
"eval_logps/rejected": -311.8854064941406,
"eval_loss": 1.675977472359591e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1495275497436523,
"eval_rewards/margins": 17.043792724609375,
"eval_rewards/rejected": -13.894266128540039,
"eval_runtime": 667.8441,
"eval_samples_per_second": 11.086,
"eval_steps_per_second": 0.617,
"step": 3150
},
{
"epoch": 1.280388978930308,
"grad_norm": 8.296900887216907e-06,
"learning_rate": 6.369503226774727e-06,
"logits/chosen": -0.9759266376495361,
"logits/rejected": -1.2088817358016968,
"logps/chosen": -108.7704086303711,
"logps/rejected": -313.3003845214844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2279977798461914,
"rewards/margins": 17.15936279296875,
"rewards/rejected": -13.931365966796875,
"step": 3160
},
{
"epoch": 1.2844408427876823,
"grad_norm": 2.008057890634518e-05,
"learning_rate": 6.35449497223473e-06,
"logits/chosen": -0.9693723320960999,
"logits/rejected": -1.2205625772476196,
"logps/chosen": -108.16254425048828,
"logps/rejected": -312.3143005371094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.24662446975708,
"rewards/margins": 17.193058013916016,
"rewards/rejected": -13.94643497467041,
"step": 3170
},
{
"epoch": 1.2884927066450567,
"grad_norm": 7.960902621562127e-06,
"learning_rate": 6.339486717694733e-06,
"logits/chosen": -0.9644364714622498,
"logits/rejected": -1.2073167562484741,
"logps/chosen": -109.11122131347656,
"logps/rejected": -314.1689453125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.24955153465271,
"rewards/margins": 17.34427833557129,
"rewards/rejected": -14.09472942352295,
"step": 3180
},
{
"epoch": 1.292544570502431,
"grad_norm": 1.7171289073303342e-05,
"learning_rate": 6.324478463154735e-06,
"logits/chosen": -0.9464921355247498,
"logits/rejected": -1.191055417060852,
"logps/chosen": -109.27963256835938,
"logps/rejected": -312.8675842285156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2031736373901367,
"rewards/margins": 17.16599464416504,
"rewards/rejected": -13.962823867797852,
"step": 3190
},
{
"epoch": 1.2965964343598055,
"grad_norm": 1.7018590369843878e-05,
"learning_rate": 6.309470208614738e-06,
"logits/chosen": -0.9641759991645813,
"logits/rejected": -1.2251524925231934,
"logps/chosen": -106.86421203613281,
"logps/rejected": -313.9484558105469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2740588188171387,
"rewards/margins": 17.36844825744629,
"rewards/rejected": -14.094389915466309,
"step": 3200
},
{
"epoch": 1.2965964343598055,
"eval_logits/chosen": -0.9669303297996521,
"eval_logits/rejected": -1.2042489051818848,
"eval_logps/chosen": -109.52879333496094,
"eval_logps/rejected": -312.3120422363281,
"eval_loss": 1.6180324280412606e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1483137607574463,
"eval_rewards/margins": 17.085241317749023,
"eval_rewards/rejected": -13.936927795410156,
"eval_runtime": 681.2481,
"eval_samples_per_second": 10.868,
"eval_steps_per_second": 0.605,
"step": 3200
},
{
"epoch": 1.3006482982171799,
"grad_norm": 9.484376278123818e-06,
"learning_rate": 6.294461954074742e-06,
"logits/chosen": -0.9570868611335754,
"logits/rejected": -1.188042402267456,
"logps/chosen": -108.84678649902344,
"logps/rejected": -312.2694396972656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.214073896408081,
"rewards/margins": 17.14763832092285,
"rewards/rejected": -13.933562278747559,
"step": 3210
},
{
"epoch": 1.3047001620745542,
"grad_norm": 4.871696091868216e-06,
"learning_rate": 6.279453699534744e-06,
"logits/chosen": -0.9526418447494507,
"logits/rejected": -1.220396637916565,
"logps/chosen": -108.03825378417969,
"logps/rejected": -314.1305236816406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2451412677764893,
"rewards/margins": 17.401790618896484,
"rewards/rejected": -14.156647682189941,
"step": 3220
},
{
"epoch": 1.3087520259319287,
"grad_norm": 6.676681550743524e-06,
"learning_rate": 6.264445444994748e-06,
"logits/chosen": -0.9678587317466736,
"logits/rejected": -1.2017152309417725,
"logps/chosen": -109.80901336669922,
"logps/rejected": -313.3891906738281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1907846927642822,
"rewards/margins": 17.13675880432129,
"rewards/rejected": -13.945975303649902,
"step": 3230
},
{
"epoch": 1.312803889789303,
"grad_norm": 1.5305944543797523e-05,
"learning_rate": 6.24943719045475e-06,
"logits/chosen": -0.9755159020423889,
"logits/rejected": -1.1885570287704468,
"logps/chosen": -110.71768188476562,
"logps/rejected": -313.28118896484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.169814109802246,
"rewards/margins": 17.160905838012695,
"rewards/rejected": -13.991090774536133,
"step": 3240
},
{
"epoch": 1.3168557536466774,
"grad_norm": 8.812554369796999e-06,
"learning_rate": 6.234428935914754e-06,
"logits/chosen": -0.9581737518310547,
"logits/rejected": -1.1885933876037598,
"logps/chosen": -109.94810485839844,
"logps/rejected": -313.65667724609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.169693946838379,
"rewards/margins": 17.15659523010254,
"rewards/rejected": -13.98690128326416,
"step": 3250
},
{
"epoch": 1.3168557536466774,
"eval_logits/chosen": -0.9879531264305115,
"eval_logits/rejected": -1.217955470085144,
"eval_logps/chosen": -109.622802734375,
"eval_logps/rejected": -313.0201721191406,
"eval_loss": 1.512936904646267e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.138913154602051,
"eval_rewards/margins": 17.146656036376953,
"eval_rewards/rejected": -14.007742881774902,
"eval_runtime": 662.6363,
"eval_samples_per_second": 11.174,
"eval_steps_per_second": 0.622,
"step": 3250
},
{
"epoch": 1.320907617504052,
"grad_norm": 1.7330803530057892e-05,
"learning_rate": 6.219420681374757e-06,
"logits/chosen": -0.9541265368461609,
"logits/rejected": -1.212295413017273,
"logps/chosen": -108.89168548583984,
"logps/rejected": -313.27557373046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2004942893981934,
"rewards/margins": 17.252246856689453,
"rewards/rejected": -14.051752090454102,
"step": 3260
},
{
"epoch": 1.3249594813614263,
"grad_norm": 1.0267608558933716e-05,
"learning_rate": 6.20441242683476e-06,
"logits/chosen": -0.959732174873352,
"logits/rejected": -1.187722086906433,
"logps/chosen": -108.71839141845703,
"logps/rejected": -313.2086486816406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.211418628692627,
"rewards/margins": 17.164676666259766,
"rewards/rejected": -13.953258514404297,
"step": 3270
},
{
"epoch": 1.3290113452188006,
"grad_norm": 1.5800977053004317e-05,
"learning_rate": 6.189404172294763e-06,
"logits/chosen": -0.9553423523902893,
"logits/rejected": -1.1899616718292236,
"logps/chosen": -109.203369140625,
"logps/rejected": -314.1956787109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.207944631576538,
"rewards/margins": 17.303342819213867,
"rewards/rejected": -14.095399856567383,
"step": 3280
},
{
"epoch": 1.3330632090761751,
"grad_norm": 1.0804586963786278e-05,
"learning_rate": 6.174395917754765e-06,
"logits/chosen": -0.9881101250648499,
"logits/rejected": -1.1937135457992554,
"logps/chosen": -109.8092269897461,
"logps/rejected": -314.1241149902344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.205904960632324,
"rewards/margins": 17.211772918701172,
"rewards/rejected": -14.005867958068848,
"step": 3290
},
{
"epoch": 1.3371150729335495,
"grad_norm": 1.2788170351996087e-05,
"learning_rate": 6.159387663214768e-06,
"logits/chosen": -0.9444805383682251,
"logits/rejected": -1.2099872827529907,
"logps/chosen": -108.5473403930664,
"logps/rejected": -314.2455749511719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.225715160369873,
"rewards/margins": 17.341238021850586,
"rewards/rejected": -14.115520477294922,
"step": 3300
},
{
"epoch": 1.3371150729335495,
"eval_logits/chosen": -0.9682581424713135,
"eval_logits/rejected": -1.2041715383529663,
"eval_logps/chosen": -109.43754577636719,
"eval_logps/rejected": -313.0159606933594,
"eval_loss": 1.4919004343028064e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.157438039779663,
"eval_rewards/margins": 17.164758682250977,
"eval_rewards/rejected": -14.007320404052734,
"eval_runtime": 660.6432,
"eval_samples_per_second": 11.207,
"eval_steps_per_second": 0.624,
"step": 3300
},
{
"epoch": 1.3411669367909238,
"grad_norm": 7.93843537394423e-06,
"learning_rate": 6.1443794086747725e-06,
"logits/chosen": -0.9528685808181763,
"logits/rejected": -1.20863938331604,
"logps/chosen": -108.23860931396484,
"logps/rejected": -312.99127197265625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.248526096343994,
"rewards/margins": 17.247163772583008,
"rewards/rejected": -13.998639106750488,
"step": 3310
},
{
"epoch": 1.3452188006482984,
"grad_norm": 8.834734217089135e-06,
"learning_rate": 6.129371154134774e-06,
"logits/chosen": -0.9572389125823975,
"logits/rejected": -1.2056647539138794,
"logps/chosen": -108.65901947021484,
"logps/rejected": -314.50128173828125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1915442943573,
"rewards/margins": 17.344852447509766,
"rewards/rejected": -14.153307914733887,
"step": 3320
},
{
"epoch": 1.3492706645056727,
"grad_norm": 3.8810932892374694e-05,
"learning_rate": 6.114362899594778e-06,
"logits/chosen": -0.9432046413421631,
"logits/rejected": -1.2089511156082153,
"logps/chosen": -108.8655776977539,
"logps/rejected": -315.0828857421875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2165868282318115,
"rewards/margins": 17.300975799560547,
"rewards/rejected": -14.084390640258789,
"step": 3330
},
{
"epoch": 1.353322528363047,
"grad_norm": 4.887206614512252e-06,
"learning_rate": 6.09935464505478e-06,
"logits/chosen": -0.9624608159065247,
"logits/rejected": -1.2240010499954224,
"logps/chosen": -108.18408966064453,
"logps/rejected": -315.2415466308594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.214587688446045,
"rewards/margins": 17.451108932495117,
"rewards/rejected": -14.236522674560547,
"step": 3340
},
{
"epoch": 1.3573743922204213,
"grad_norm": 5.749606771132676e-06,
"learning_rate": 6.084346390514784e-06,
"logits/chosen": -0.9573169946670532,
"logits/rejected": -1.190148115158081,
"logps/chosen": -109.55158233642578,
"logps/rejected": -312.7564392089844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2026069164276123,
"rewards/margins": 17.133691787719727,
"rewards/rejected": -13.931085586547852,
"step": 3350
},
{
"epoch": 1.3573743922204213,
"eval_logits/chosen": -0.970223605632782,
"eval_logits/rejected": -1.2049980163574219,
"eval_logps/chosen": -109.43147277832031,
"eval_logps/rejected": -313.37371826171875,
"eval_loss": 1.445255435328363e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1580469608306885,
"eval_rewards/margins": 17.201139450073242,
"eval_rewards/rejected": -14.043091773986816,
"eval_runtime": 660.5803,
"eval_samples_per_second": 11.208,
"eval_steps_per_second": 0.624,
"step": 3350
},
{
"epoch": 1.3614262560777957,
"grad_norm": 6.225182005437091e-06,
"learning_rate": 6.069338135974787e-06,
"logits/chosen": -0.9479268193244934,
"logits/rejected": -1.1831086874008179,
"logps/chosen": -108.24063873291016,
"logps/rejected": -314.0235900878906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.241534471511841,
"rewards/margins": 17.33696174621582,
"rewards/rejected": -14.095426559448242,
"step": 3360
},
{
"epoch": 1.3654781199351702,
"grad_norm": 3.8037185277062235e-06,
"learning_rate": 6.05432988143479e-06,
"logits/chosen": -0.9577153325080872,
"logits/rejected": -1.196504831314087,
"logps/chosen": -109.3306655883789,
"logps/rejected": -315.1477966308594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2319626808166504,
"rewards/margins": 17.362394332885742,
"rewards/rejected": -14.130433082580566,
"step": 3370
},
{
"epoch": 1.3695299837925445,
"grad_norm": 7.264603027579142e-06,
"learning_rate": 6.039321626894793e-06,
"logits/chosen": -0.960659384727478,
"logits/rejected": -1.21016526222229,
"logps/chosen": -109.74238586425781,
"logps/rejected": -314.30889892578125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1629416942596436,
"rewards/margins": 17.332054138183594,
"rewards/rejected": -14.169112205505371,
"step": 3380
},
{
"epoch": 1.3735818476499189,
"grad_norm": 5.798762686026748e-06,
"learning_rate": 6.024313372354796e-06,
"logits/chosen": -0.9659271240234375,
"logits/rejected": -1.2181833982467651,
"logps/chosen": -108.92655944824219,
"logps/rejected": -314.48583984375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2449417114257812,
"rewards/margins": 17.421527862548828,
"rewards/rejected": -14.17658519744873,
"step": 3390
},
{
"epoch": 1.3776337115072934,
"grad_norm": 9.220641004503705e-06,
"learning_rate": 6.009305117814799e-06,
"logits/chosen": -0.9584363102912903,
"logits/rejected": -1.1954525709152222,
"logps/chosen": -108.27457427978516,
"logps/rejected": -315.4519348144531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2615156173706055,
"rewards/margins": 17.52600860595703,
"rewards/rejected": -14.264492988586426,
"step": 3400
},
{
"epoch": 1.3776337115072934,
"eval_logits/chosen": -0.9918527007102966,
"eval_logits/rejected": -1.220714807510376,
"eval_logps/chosen": -109.54891204833984,
"eval_logps/rejected": -314.1236877441406,
"eval_loss": 1.3570124224315805e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.146301746368408,
"eval_rewards/margins": 17.26439094543457,
"eval_rewards/rejected": -14.118091583251953,
"eval_runtime": 662.5143,
"eval_samples_per_second": 11.176,
"eval_steps_per_second": 0.622,
"step": 3400
},
{
"epoch": 1.3816855753646677,
"grad_norm": 6.401640348485671e-06,
"learning_rate": 5.994296863274801e-06,
"logits/chosen": -0.9543588757514954,
"logits/rejected": -1.2096937894821167,
"logps/chosen": -108.40690612792969,
"logps/rejected": -316.5176086425781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.250415563583374,
"rewards/margins": 17.588228225708008,
"rewards/rejected": -14.337810516357422,
"step": 3410
},
{
"epoch": 1.385737439222042,
"grad_norm": 7.610854027007008e-06,
"learning_rate": 5.979288608734804e-06,
"logits/chosen": -0.9576588273048401,
"logits/rejected": -1.1955324411392212,
"logps/chosen": -109.1751708984375,
"logps/rejected": -314.9342346191406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2158362865448,
"rewards/margins": 17.415836334228516,
"rewards/rejected": -14.199999809265137,
"step": 3420
},
{
"epoch": 1.3897893030794166,
"grad_norm": 4.906746198685141e-06,
"learning_rate": 5.964280354194808e-06,
"logits/chosen": -0.9672905206680298,
"logits/rejected": -1.1918128728866577,
"logps/chosen": -109.35330963134766,
"logps/rejected": -315.4357604980469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1970880031585693,
"rewards/margins": 17.4501895904541,
"rewards/rejected": -14.253100395202637,
"step": 3430
},
{
"epoch": 1.393841166936791,
"grad_norm": 1.7268190276809037e-05,
"learning_rate": 5.94927209965481e-06,
"logits/chosen": -0.9625003933906555,
"logits/rejected": -1.2034894227981567,
"logps/chosen": -108.31163787841797,
"logps/rejected": -316.0549621582031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.240849733352661,
"rewards/margins": 17.41853904724121,
"rewards/rejected": -14.177687644958496,
"step": 3440
},
{
"epoch": 1.3978930307941653,
"grad_norm": 7.347574864979833e-06,
"learning_rate": 5.934263845114814e-06,
"logits/chosen": -0.9486963152885437,
"logits/rejected": -1.216882348060608,
"logps/chosen": -108.84146881103516,
"logps/rejected": -315.2445068359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2250006198883057,
"rewards/margins": 17.36940574645996,
"rewards/rejected": -14.144404411315918,
"step": 3450
},
{
"epoch": 1.3978930307941653,
"eval_logits/chosen": -0.9700472950935364,
"eval_logits/rejected": -1.2043304443359375,
"eval_logps/chosen": -109.39541625976562,
"eval_logps/rejected": -314.0571594238281,
"eval_loss": 1.3514242880319216e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.161651849746704,
"eval_rewards/margins": 17.273088455200195,
"eval_rewards/rejected": -14.111435890197754,
"eval_runtime": 663.1123,
"eval_samples_per_second": 11.166,
"eval_steps_per_second": 0.621,
"step": 3450
},
{
"epoch": 1.4019448946515398,
"grad_norm": 8.939105100580491e-06,
"learning_rate": 5.919255590574816e-06,
"logits/chosen": -0.9727906584739685,
"logits/rejected": -1.19076406955719,
"logps/chosen": -109.75849914550781,
"logps/rejected": -313.2750549316406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1896746158599854,
"rewards/margins": 17.198753356933594,
"rewards/rejected": -14.009076118469238,
"step": 3460
},
{
"epoch": 1.4059967585089141,
"grad_norm": 8.345450623892248e-06,
"learning_rate": 5.90424733603482e-06,
"logits/chosen": -0.9543637633323669,
"logits/rejected": -1.2029889822006226,
"logps/chosen": -108.40011596679688,
"logps/rejected": -314.6285095214844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2274868488311768,
"rewards/margins": 17.273284912109375,
"rewards/rejected": -14.045796394348145,
"step": 3470
},
{
"epoch": 1.4100486223662885,
"grad_norm": 4.251101927366108e-06,
"learning_rate": 5.889239081494823e-06,
"logits/chosen": -0.9565185308456421,
"logits/rejected": -1.1892540454864502,
"logps/chosen": -108.2246322631836,
"logps/rejected": -315.8067932128906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2416796684265137,
"rewards/margins": 17.44449806213379,
"rewards/rejected": -14.20281982421875,
"step": 3480
},
{
"epoch": 1.414100486223663,
"grad_norm": 6.270918674999848e-06,
"learning_rate": 5.874230826954826e-06,
"logits/chosen": -0.9648173451423645,
"logits/rejected": -1.2057849168777466,
"logps/chosen": -108.76558685302734,
"logps/rejected": -315.7758483886719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2343640327453613,
"rewards/margins": 17.45017433166504,
"rewards/rejected": -14.21580982208252,
"step": 3490
},
{
"epoch": 1.4181523500810373,
"grad_norm": 6.242263225431088e-06,
"learning_rate": 5.859222572414829e-06,
"logits/chosen": -0.9528531432151794,
"logits/rejected": -1.2007869482040405,
"logps/chosen": -108.47574615478516,
"logps/rejected": -317.7001953125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.273150682449341,
"rewards/margins": 17.647972106933594,
"rewards/rejected": -14.3748197555542,
"step": 3500
},
{
"epoch": 1.4181523500810373,
"eval_logits/chosen": -0.9920565485954285,
"eval_logits/rejected": -1.2199008464813232,
"eval_logps/chosen": -109.49647521972656,
"eval_logps/rejected": -314.68231201171875,
"eval_loss": 1.28018996292667e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1515462398529053,
"eval_rewards/margins": 17.325502395629883,
"eval_rewards/rejected": -14.173955917358398,
"eval_runtime": 662.9428,
"eval_samples_per_second": 11.168,
"eval_steps_per_second": 0.621,
"step": 3500
},
{
"epoch": 1.4222042139384117,
"grad_norm": 8.54422523843823e-06,
"learning_rate": 5.844214317874831e-06,
"logits/chosen": -0.9673510789871216,
"logits/rejected": -1.2166383266448975,
"logps/chosen": -108.13471984863281,
"logps/rejected": -315.3136901855469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2391507625579834,
"rewards/margins": 17.3529052734375,
"rewards/rejected": -14.113754272460938,
"step": 3510
},
{
"epoch": 1.426256077795786,
"grad_norm": 9.1289157353458e-06,
"learning_rate": 5.829206063334834e-06,
"logits/chosen": -0.9765715003013611,
"logits/rejected": -1.208653211593628,
"logps/chosen": -109.50243377685547,
"logps/rejected": -316.7020568847656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2334234714508057,
"rewards/margins": 17.64775848388672,
"rewards/rejected": -14.414335250854492,
"step": 3520
},
{
"epoch": 1.4303079416531603,
"grad_norm": 1.0726081200118642e-05,
"learning_rate": 5.814197808794838e-06,
"logits/chosen": -0.9649112224578857,
"logits/rejected": -1.216942310333252,
"logps/chosen": -109.17703247070312,
"logps/rejected": -315.6427917480469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2589776515960693,
"rewards/margins": 17.56110382080078,
"rewards/rejected": -14.302124977111816,
"step": 3530
},
{
"epoch": 1.4343598055105349,
"grad_norm": 7.605322480230825e-06,
"learning_rate": 5.79918955425484e-06,
"logits/chosen": -0.9684303402900696,
"logits/rejected": -1.2046997547149658,
"logps/chosen": -108.52332305908203,
"logps/rejected": -315.15814208984375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2342731952667236,
"rewards/margins": 17.40003776550293,
"rewards/rejected": -14.165764808654785,
"step": 3540
},
{
"epoch": 1.4384116693679092,
"grad_norm": 1.0980385923176073e-05,
"learning_rate": 5.784181299714844e-06,
"logits/chosen": -0.9674128293991089,
"logits/rejected": -1.2049371004104614,
"logps/chosen": -107.88756561279297,
"logps/rejected": -315.3216857910156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.239750862121582,
"rewards/margins": 17.433073043823242,
"rewards/rejected": -14.193323135375977,
"step": 3550
},
{
"epoch": 1.4384116693679092,
"eval_logits/chosen": -0.9761521220207214,
"eval_logits/rejected": -1.2098267078399658,
"eval_logps/chosen": -109.37076568603516,
"eval_logps/rejected": -314.67626953125,
"eval_loss": 1.2733954690702376e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.164116144180298,
"eval_rewards/margins": 17.337467193603516,
"eval_rewards/rejected": -14.173351287841797,
"eval_runtime": 662.9539,
"eval_samples_per_second": 11.168,
"eval_steps_per_second": 0.621,
"step": 3550
},
{
"epoch": 1.4424635332252835,
"grad_norm": 6.137217496871017e-06,
"learning_rate": 5.769173045174846e-06,
"logits/chosen": -0.9557913541793823,
"logits/rejected": -1.2017483711242676,
"logps/chosen": -107.53488159179688,
"logps/rejected": -316.9659118652344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2536418437957764,
"rewards/margins": 17.57965087890625,
"rewards/rejected": -14.326007843017578,
"step": 3560
},
{
"epoch": 1.446515397082658,
"grad_norm": 3.537427255650982e-05,
"learning_rate": 5.75416479063485e-06,
"logits/chosen": -0.9414838552474976,
"logits/rejected": -1.2034283876419067,
"logps/chosen": -107.01081085205078,
"logps/rejected": -316.0235595703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.271057605743408,
"rewards/margins": 17.381750106811523,
"rewards/rejected": -14.110692977905273,
"step": 3570
},
{
"epoch": 1.4505672609400324,
"grad_norm": 6.594872047571698e-06,
"learning_rate": 5.739156536094853e-06,
"logits/chosen": -0.9697946906089783,
"logits/rejected": -1.1990686655044556,
"logps/chosen": -108.61802673339844,
"logps/rejected": -316.5038757324219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.230477809906006,
"rewards/margins": 17.491981506347656,
"rewards/rejected": -14.261506080627441,
"step": 3580
},
{
"epoch": 1.4546191247974067,
"grad_norm": 1.4138061487756204e-05,
"learning_rate": 5.724148281554856e-06,
"logits/chosen": -0.9630403518676758,
"logits/rejected": -1.2050740718841553,
"logps/chosen": -108.44572448730469,
"logps/rejected": -315.1803894042969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2415361404418945,
"rewards/margins": 17.399463653564453,
"rewards/rejected": -14.157925605773926,
"step": 3590
},
{
"epoch": 1.4586709886547813,
"grad_norm": 7.2224402174470015e-06,
"learning_rate": 5.709140027014859e-06,
"logits/chosen": -0.9400904774665833,
"logits/rejected": -1.1875113248825073,
"logps/chosen": -108.74930572509766,
"logps/rejected": -315.8128356933594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.231011152267456,
"rewards/margins": 17.45760726928711,
"rewards/rejected": -14.226595878601074,
"step": 3600
},
{
"epoch": 1.4586709886547813,
"eval_logits/chosen": -0.9722992181777954,
"eval_logits/rejected": -1.2060984373092651,
"eval_logps/chosen": -109.30361938476562,
"eval_logps/rejected": -314.8688659667969,
"eval_loss": 1.2434720986220782e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1708314418792725,
"eval_rewards/margins": 17.36344337463379,
"eval_rewards/rejected": -14.192611694335938,
"eval_runtime": 663.4166,
"eval_samples_per_second": 11.16,
"eval_steps_per_second": 0.621,
"step": 3600
},
{
"epoch": 1.4627228525121556,
"grad_norm": 6.3852685343590565e-06,
"learning_rate": 5.694131772474861e-06,
"logits/chosen": -0.9639496207237244,
"logits/rejected": -1.2003190517425537,
"logps/chosen": -108.68683624267578,
"logps/rejected": -316.43585205078125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2357661724090576,
"rewards/margins": 17.586694717407227,
"rewards/rejected": -14.350927352905273,
"step": 3610
},
{
"epoch": 1.46677471636953,
"grad_norm": 9.98025916487677e-06,
"learning_rate": 5.679123517934864e-06,
"logits/chosen": -0.9612903594970703,
"logits/rejected": -1.1824277639389038,
"logps/chosen": -107.56800079345703,
"logps/rejected": -314.85516357421875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2589564323425293,
"rewards/margins": 17.432729721069336,
"rewards/rejected": -14.173775672912598,
"step": 3620
},
{
"epoch": 1.4708265802269045,
"grad_norm": 2.0052910258527845e-05,
"learning_rate": 5.664115263394868e-06,
"logits/chosen": -0.9558570384979248,
"logits/rejected": -1.2040566205978394,
"logps/chosen": -108.70698547363281,
"logps/rejected": -315.31787109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.264512062072754,
"rewards/margins": 17.43938636779785,
"rewards/rejected": -14.174872398376465,
"step": 3630
},
{
"epoch": 1.4748784440842788,
"grad_norm": 7.068727427395061e-06,
"learning_rate": 5.64910700885487e-06,
"logits/chosen": -0.9596124887466431,
"logits/rejected": -1.2153346538543701,
"logps/chosen": -108.03771209716797,
"logps/rejected": -318.3464660644531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.210784912109375,
"rewards/margins": 17.65658950805664,
"rewards/rejected": -14.44580364227295,
"step": 3640
},
{
"epoch": 1.4789303079416531,
"grad_norm": 8.767375220486429e-06,
"learning_rate": 5.634098754314874e-06,
"logits/chosen": -0.9488992691040039,
"logits/rejected": -1.1887593269348145,
"logps/chosen": -107.88094329833984,
"logps/rejected": -315.5525817871094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.292868137359619,
"rewards/margins": 17.515554428100586,
"rewards/rejected": -14.222685813903809,
"step": 3650
},
{
"epoch": 1.4789303079416531,
"eval_logits/chosen": -0.9733116626739502,
"eval_logits/rejected": -1.2053263187408447,
"eval_logps/chosen": -109.34339141845703,
"eval_logps/rejected": -315.2198791503906,
"eval_loss": 1.2054697151597793e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1668541431427,
"eval_rewards/margins": 17.39456558227539,
"eval_rewards/rejected": -14.22771167755127,
"eval_runtime": 663.5102,
"eval_samples_per_second": 11.159,
"eval_steps_per_second": 0.621,
"step": 3650
},
{
"epoch": 1.4829821717990275,
"grad_norm": 7.54353550291853e-06,
"learning_rate": 5.619090499774876e-06,
"logits/chosen": -0.9498493075370789,
"logits/rejected": -1.2062077522277832,
"logps/chosen": -109.1008071899414,
"logps/rejected": -315.29022216796875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1963202953338623,
"rewards/margins": 17.379905700683594,
"rewards/rejected": -14.183587074279785,
"step": 3660
},
{
"epoch": 1.487034035656402,
"grad_norm": 2.701729727050406e-06,
"learning_rate": 5.60408224523488e-06,
"logits/chosen": -0.954522967338562,
"logits/rejected": -1.197543740272522,
"logps/chosen": -108.44230651855469,
"logps/rejected": -318.29608154296875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.25152587890625,
"rewards/margins": 17.643075942993164,
"rewards/rejected": -14.39155101776123,
"step": 3670
},
{
"epoch": 1.4910858995137763,
"grad_norm": 5.08013636135729e-06,
"learning_rate": 5.589073990694882e-06,
"logits/chosen": -0.9814316630363464,
"logits/rejected": -1.2127686738967896,
"logps/chosen": -109.36546325683594,
"logps/rejected": -315.67999267578125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.18919038772583,
"rewards/margins": 17.470264434814453,
"rewards/rejected": -14.281076431274414,
"step": 3680
},
{
"epoch": 1.4951377633711507,
"grad_norm": 8.137954864650965e-06,
"learning_rate": 5.574065736154886e-06,
"logits/chosen": -0.9642794728279114,
"logits/rejected": -1.1955642700195312,
"logps/chosen": -108.89013671875,
"logps/rejected": -316.7543029785156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2404532432556152,
"rewards/margins": 17.62625503540039,
"rewards/rejected": -14.385802268981934,
"step": 3690
},
{
"epoch": 1.499189627228525,
"grad_norm": 2.0117735402891412e-05,
"learning_rate": 5.559057481614889e-06,
"logits/chosen": -0.9436579942703247,
"logits/rejected": -1.1839931011199951,
"logps/chosen": -108.5077133178711,
"logps/rejected": -316.2707214355469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2324440479278564,
"rewards/margins": 17.492176055908203,
"rewards/rejected": -14.259733200073242,
"step": 3700
},
{
"epoch": 1.499189627228525,
"eval_logits/chosen": -0.974548876285553,
"eval_logits/rejected": -1.2070963382720947,
"eval_logps/chosen": -109.29476928710938,
"eval_logps/rejected": -315.4743347167969,
"eval_loss": 1.1724890924824649e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.171715497970581,
"eval_rewards/margins": 17.42487335205078,
"eval_rewards/rejected": -14.253158569335938,
"eval_runtime": 663.4897,
"eval_samples_per_second": 11.159,
"eval_steps_per_second": 0.621,
"step": 3700
},
{
"epoch": 1.5032414910858996,
"grad_norm": 4.992085450794548e-06,
"learning_rate": 5.544049227074891e-06,
"logits/chosen": -0.9674142003059387,
"logits/rejected": -1.1863280534744263,
"logps/chosen": -109.25318908691406,
"logps/rejected": -314.8880615234375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2352867126464844,
"rewards/margins": 17.398120880126953,
"rewards/rejected": -14.162833213806152,
"step": 3710
},
{
"epoch": 1.5072933549432739,
"grad_norm": 4.062382231495576e-06,
"learning_rate": 5.529040972534894e-06,
"logits/chosen": -0.9425821304321289,
"logits/rejected": -1.1931798458099365,
"logps/chosen": -108.00586700439453,
"logps/rejected": -315.8692626953125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2697389125823975,
"rewards/margins": 17.538049697875977,
"rewards/rejected": -14.268309593200684,
"step": 3720
},
{
"epoch": 1.5113452188006482,
"grad_norm": 1.9489334590616636e-05,
"learning_rate": 5.514032717994897e-06,
"logits/chosen": -0.9636507630348206,
"logits/rejected": -1.2020808458328247,
"logps/chosen": -109.30130004882812,
"logps/rejected": -316.9945373535156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1893112659454346,
"rewards/margins": 17.497333526611328,
"rewards/rejected": -14.308022499084473,
"step": 3730
},
{
"epoch": 1.5153970826580228,
"grad_norm": 1.9115646864520386e-05,
"learning_rate": 5.4990244634549004e-06,
"logits/chosen": -0.9532636404037476,
"logits/rejected": -1.192227840423584,
"logps/chosen": -108.51616668701172,
"logps/rejected": -315.6667175292969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.240192174911499,
"rewards/margins": 17.530908584594727,
"rewards/rejected": -14.290714263916016,
"step": 3740
},
{
"epoch": 1.519448946515397,
"grad_norm": 5.272378075460438e-06,
"learning_rate": 5.484016208914904e-06,
"logits/chosen": -0.9705985188484192,
"logits/rejected": -1.2012253999710083,
"logps/chosen": -108.23621368408203,
"logps/rejected": -317.6721496582031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2313127517700195,
"rewards/margins": 17.620288848876953,
"rewards/rejected": -14.388975143432617,
"step": 3750
},
{
"epoch": 1.519448946515397,
"eval_logits/chosen": -0.9684827327728271,
"eval_logits/rejected": -1.2004016637802124,
"eval_logps/chosen": -109.24481964111328,
"eval_logps/rejected": -315.8060302734375,
"eval_loss": 1.130395119730565e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1767098903656006,
"eval_rewards/margins": 17.46303939819336,
"eval_rewards/rejected": -14.28632926940918,
"eval_runtime": 663.4432,
"eval_samples_per_second": 11.16,
"eval_steps_per_second": 0.621,
"step": 3750
},
{
"epoch": 1.5235008103727714,
"grad_norm": 6.1954165175848175e-06,
"learning_rate": 5.4690079543749064e-06,
"logits/chosen": -0.9727413654327393,
"logits/rejected": -1.2027579545974731,
"logps/chosen": -108.85786437988281,
"logps/rejected": -317.4558410644531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.218287229537964,
"rewards/margins": 17.62915802001953,
"rewards/rejected": -14.410872459411621,
"step": 3760
},
{
"epoch": 1.527552674230146,
"grad_norm": 5.180510925129056e-06,
"learning_rate": 5.45399969983491e-06,
"logits/chosen": -0.9645715951919556,
"logits/rejected": -1.1870073080062866,
"logps/chosen": -109.94966125488281,
"logps/rejected": -316.37982177734375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.1916048526763916,
"rewards/margins": 17.476436614990234,
"rewards/rejected": -14.284832954406738,
"step": 3770
},
{
"epoch": 1.5316045380875203,
"grad_norm": 7.327073490159819e-06,
"learning_rate": 5.4389914452949124e-06,
"logits/chosen": -0.9505946040153503,
"logits/rejected": -1.202714443206787,
"logps/chosen": -108.26834869384766,
"logps/rejected": -316.9022216796875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.238265037536621,
"rewards/margins": 17.610530853271484,
"rewards/rejected": -14.37226676940918,
"step": 3780
},
{
"epoch": 1.5356564019448946,
"grad_norm": 7.510065188398585e-06,
"learning_rate": 5.423983190754916e-06,
"logits/chosen": -0.9567342400550842,
"logits/rejected": -1.1898601055145264,
"logps/chosen": -107.89736938476562,
"logps/rejected": -316.4672546386719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2650341987609863,
"rewards/margins": 17.62150001525879,
"rewards/rejected": -14.356466293334961,
"step": 3790
},
{
"epoch": 1.5397082658022692,
"grad_norm": 6.228626261872705e-06,
"learning_rate": 5.408974936214919e-06,
"logits/chosen": -0.9419568777084351,
"logits/rejected": -1.1964390277862549,
"logps/chosen": -107.32307434082031,
"logps/rejected": -318.02191162109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2831625938415527,
"rewards/margins": 17.69293212890625,
"rewards/rejected": -14.409770965576172,
"step": 3800
},
{
"epoch": 1.5397082658022692,
"eval_logits/chosen": -0.9724193811416626,
"eval_logits/rejected": -1.20346999168396,
"eval_logps/chosen": -109.28492736816406,
"eval_logps/rejected": -316.20904541015625,
"eval_loss": 1.0901329261514547e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.172699213027954,
"eval_rewards/margins": 17.49932861328125,
"eval_rewards/rejected": -14.326629638671875,
"eval_runtime": 663.4698,
"eval_samples_per_second": 11.16,
"eval_steps_per_second": 0.621,
"step": 3800
},
{
"epoch": 1.5437601296596435,
"grad_norm": 1.283068831980927e-05,
"learning_rate": 5.393966681674921e-06,
"logits/chosen": -0.9620767831802368,
"logits/rejected": -1.1938879489898682,
"logps/chosen": -108.77943420410156,
"logps/rejected": -318.4185485839844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.229729175567627,
"rewards/margins": 17.725805282592773,
"rewards/rejected": -14.496077537536621,
"step": 3810
},
{
"epoch": 1.5478119935170178,
"grad_norm": 2.9260332667035982e-05,
"learning_rate": 5.378958427134925e-06,
"logits/chosen": -0.9631065726280212,
"logits/rejected": -1.2083336114883423,
"logps/chosen": -108.52242279052734,
"logps/rejected": -317.4120178222656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.296027660369873,
"rewards/margins": 17.68168830871582,
"rewards/rejected": -14.385659217834473,
"step": 3820
},
{
"epoch": 1.5518638573743924,
"grad_norm": 4.707081188826123e-06,
"learning_rate": 5.363950172594927e-06,
"logits/chosen": -0.9571763277053833,
"logits/rejected": -1.2118968963623047,
"logps/chosen": -108.25720977783203,
"logps/rejected": -318.5433654785156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.246180295944214,
"rewards/margins": 17.719322204589844,
"rewards/rejected": -14.47314167022705,
"step": 3830
},
{
"epoch": 1.5559157212317665,
"grad_norm": 1.0459262739459518e-05,
"learning_rate": 5.3489419180549305e-06,
"logits/chosen": -0.977500855922699,
"logits/rejected": -1.1893442869186401,
"logps/chosen": -109.2089614868164,
"logps/rejected": -319.8080749511719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.246575117111206,
"rewards/margins": 17.779726028442383,
"rewards/rejected": -14.533150672912598,
"step": 3840
},
{
"epoch": 1.559967585089141,
"grad_norm": 3.85352041121223e-06,
"learning_rate": 5.333933663514934e-06,
"logits/chosen": -0.9658922553062439,
"logits/rejected": -1.201623558998108,
"logps/chosen": -109.0021743774414,
"logps/rejected": -317.1396484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.187291383743286,
"rewards/margins": 17.594905853271484,
"rewards/rejected": -14.407611846923828,
"step": 3850
},
{
"epoch": 1.559967585089141,
"eval_logits/chosen": -0.9734312891960144,
"eval_logits/rejected": -1.204223394393921,
"eval_logps/chosen": -109.30084991455078,
"eval_logps/rejected": -316.61053466796875,
"eval_loss": 1.0523393711991957e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.171109437942505,
"eval_rewards/margins": 17.537887573242188,
"eval_rewards/rejected": -14.366777420043945,
"eval_runtime": 663.7938,
"eval_samples_per_second": 11.154,
"eval_steps_per_second": 0.621,
"step": 3850
},
{
"epoch": 1.5640194489465153,
"grad_norm": 3.579104486561846e-06,
"learning_rate": 5.3189254089749365e-06,
"logits/chosen": -0.9664371609687805,
"logits/rejected": -1.2130407094955444,
"logps/chosen": -108.39588165283203,
"logps/rejected": -317.6293029785156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.246037721633911,
"rewards/margins": 17.729427337646484,
"rewards/rejected": -14.483388900756836,
"step": 3860
},
{
"epoch": 1.5680713128038897,
"grad_norm": 6.614993253606372e-06,
"learning_rate": 5.30391715443494e-06,
"logits/chosen": -0.9652690291404724,
"logits/rejected": -1.2071861028671265,
"logps/chosen": -108.62710571289062,
"logps/rejected": -317.63916015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.22904896736145,
"rewards/margins": 17.600061416625977,
"rewards/rejected": -14.371011734008789,
"step": 3870
},
{
"epoch": 1.5721231766612642,
"grad_norm": 4.290187007427448e-06,
"learning_rate": 5.2889088998949425e-06,
"logits/chosen": -0.9534419775009155,
"logits/rejected": -1.1890816688537598,
"logps/chosen": -108.34811401367188,
"logps/rejected": -317.65673828125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2479617595672607,
"rewards/margins": 17.63799476623535,
"rewards/rejected": -14.390031814575195,
"step": 3880
},
{
"epoch": 1.5761750405186385,
"grad_norm": 5.77761829845258e-06,
"learning_rate": 5.273900645354946e-06,
"logits/chosen": -0.9653971791267395,
"logits/rejected": -1.1733673810958862,
"logps/chosen": -109.12783813476562,
"logps/rejected": -316.7720642089844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.249236583709717,
"rewards/margins": 17.553876876831055,
"rewards/rejected": -14.304642677307129,
"step": 3890
},
{
"epoch": 1.5802269043760129,
"grad_norm": 5.493533080880297e-06,
"learning_rate": 5.258892390814949e-06,
"logits/chosen": -0.9704580903053284,
"logits/rejected": -1.2150682210922241,
"logps/chosen": -108.91256713867188,
"logps/rejected": -319.23419189453125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2321040630340576,
"rewards/margins": 17.845125198364258,
"rewards/rejected": -14.613018989562988,
"step": 3900
},
{
"epoch": 1.5802269043760129,
"eval_logits/chosen": -0.9785429835319519,
"eval_logits/rejected": -1.2089550495147705,
"eval_logps/chosen": -109.25596618652344,
"eval_logps/rejected": -316.824951171875,
"eval_loss": 1.0255480731302669e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1755969524383545,
"eval_rewards/margins": 17.56381607055664,
"eval_rewards/rejected": -14.388218879699707,
"eval_runtime": 663.5303,
"eval_samples_per_second": 11.158,
"eval_steps_per_second": 0.621,
"step": 3900
},
{
"epoch": 1.5842787682333874,
"grad_norm": 5.203523869568016e-06,
"learning_rate": 5.243884136274952e-06,
"logits/chosen": -0.9706067442893982,
"logits/rejected": -1.2097996473312378,
"logps/chosen": -107.60671997070312,
"logps/rejected": -318.22271728515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2841460704803467,
"rewards/margins": 17.731903076171875,
"rewards/rejected": -14.447755813598633,
"step": 3910
},
{
"epoch": 1.5883306320907618,
"grad_norm": 6.18762533122208e-06,
"learning_rate": 5.228875881734955e-06,
"logits/chosen": -0.9635491967201233,
"logits/rejected": -1.1880855560302734,
"logps/chosen": -107.89752960205078,
"logps/rejected": -318.7754211425781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2739787101745605,
"rewards/margins": 17.841236114501953,
"rewards/rejected": -14.567258834838867,
"step": 3920
},
{
"epoch": 1.592382495948136,
"grad_norm": 1.798323319235351e-05,
"learning_rate": 5.213867627194957e-06,
"logits/chosen": -0.973612368106842,
"logits/rejected": -1.1960965394973755,
"logps/chosen": -109.48294830322266,
"logps/rejected": -318.3647766113281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.19464111328125,
"rewards/margins": 17.724042892456055,
"rewards/rejected": -14.529403686523438,
"step": 3930
},
{
"epoch": 1.5964343598055106,
"grad_norm": 1.4453021321969572e-05,
"learning_rate": 5.1988593726549605e-06,
"logits/chosen": -0.9594123959541321,
"logits/rejected": -1.2001526355743408,
"logps/chosen": -108.56301879882812,
"logps/rejected": -318.62384033203125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.201404094696045,
"rewards/margins": 17.75627899169922,
"rewards/rejected": -14.554872512817383,
"step": 3940
},
{
"epoch": 1.600486223662885,
"grad_norm": 1.7161020878120326e-05,
"learning_rate": 5.183851118114963e-06,
"logits/chosen": -0.9724298715591431,
"logits/rejected": -1.2018600702285767,
"logps/chosen": -109.44165802001953,
"logps/rejected": -317.9696960449219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2142207622528076,
"rewards/margins": 17.690942764282227,
"rewards/rejected": -14.47671890258789,
"step": 3950
},
{
"epoch": 1.600486223662885,
"eval_logits/chosen": -0.977683961391449,
"eval_logits/rejected": -1.2075324058532715,
"eval_logps/chosen": -109.19850158691406,
"eval_logps/rejected": -317.0234680175781,
"eval_loss": 1.0080263734835171e-07,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1813430786132812,
"eval_rewards/margins": 17.589412689208984,
"eval_rewards/rejected": -14.40807056427002,
"eval_runtime": 673.7,
"eval_samples_per_second": 10.99,
"eval_steps_per_second": 0.612,
"step": 3950
},
{
"epoch": 1.6045380875202593,
"grad_norm": 1.2696204066742212e-05,
"learning_rate": 5.1688428635749665e-06,
"logits/chosen": -0.9766330718994141,
"logits/rejected": -1.2089101076126099,
"logps/chosen": -107.4908676147461,
"logps/rejected": -317.90374755859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.255730152130127,
"rewards/margins": 17.775943756103516,
"rewards/rejected": -14.52021312713623,
"step": 3960
},
{
"epoch": 1.6085899513776338,
"grad_norm": 7.823682608432136e-06,
"learning_rate": 5.15383460903497e-06,
"logits/chosen": -0.9714142084121704,
"logits/rejected": -1.1973127126693726,
"logps/chosen": -108.08839416503906,
"logps/rejected": -316.92938232421875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2525742053985596,
"rewards/margins": 17.704811096191406,
"rewards/rejected": -14.452237129211426,
"step": 3970
},
{
"epoch": 1.6126418152350082,
"grad_norm": 6.02427917328896e-06,
"learning_rate": 5.1388263544949725e-06,
"logits/chosen": -0.9654116034507751,
"logits/rejected": -1.2230839729309082,
"logps/chosen": -108.58455657958984,
"logps/rejected": -319.99609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2604827880859375,
"rewards/margins": 17.88028907775879,
"rewards/rejected": -14.619808197021484,
"step": 3980
},
{
"epoch": 1.6166936790923825,
"grad_norm": 8.140964382619131e-06,
"learning_rate": 5.123818099954976e-06,
"logits/chosen": -0.9634442925453186,
"logits/rejected": -1.199520468711853,
"logps/chosen": -109.39273071289062,
"logps/rejected": -317.8063049316406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.23472261428833,
"rewards/margins": 17.63693618774414,
"rewards/rejected": -14.402215957641602,
"step": 3990
},
{
"epoch": 1.620745542949757,
"grad_norm": 8.955745215644129e-06,
"learning_rate": 5.1088098454149785e-06,
"logits/chosen": -0.9667535424232483,
"logits/rejected": -1.2081085443496704,
"logps/chosen": -107.45613861083984,
"logps/rejected": -320.45849609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.265660047531128,
"rewards/margins": 17.913358688354492,
"rewards/rejected": -14.647696495056152,
"step": 4000
},
{
"epoch": 1.620745542949757,
"eval_logits/chosen": -0.9739937782287598,
"eval_logits/rejected": -1.2036855220794678,
"eval_logps/chosen": -109.220947265625,
"eval_logps/rejected": -317.4233093261719,
"eval_loss": 9.71496092461166e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.179098129272461,
"eval_rewards/margins": 17.627151489257812,
"eval_rewards/rejected": -14.448055267333984,
"eval_runtime": 660.0616,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 4000
},
{
"epoch": 1.6247974068071311,
"grad_norm": 3.5037126053794054e-06,
"learning_rate": 5.093801590874982e-06,
"logits/chosen": -0.9621725082397461,
"logits/rejected": -1.1956188678741455,
"logps/chosen": -109.2527084350586,
"logps/rejected": -318.2307434082031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2300877571105957,
"rewards/margins": 17.69159698486328,
"rewards/rejected": -14.461508750915527,
"step": 4010
},
{
"epoch": 1.6288492706645057,
"grad_norm": 4.9843401939142495e-06,
"learning_rate": 5.078793336334985e-06,
"logits/chosen": -0.9534133076667786,
"logits/rejected": -1.1932679414749146,
"logps/chosen": -107.59471893310547,
"logps/rejected": -319.98193359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.285687208175659,
"rewards/margins": 17.901277542114258,
"rewards/rejected": -14.615589141845703,
"step": 4020
},
{
"epoch": 1.63290113452188,
"grad_norm": 2.6889072159974603e-06,
"learning_rate": 5.063785081794987e-06,
"logits/chosen": -0.9574196934700012,
"logits/rejected": -1.197640299797058,
"logps/chosen": -107.38705444335938,
"logps/rejected": -317.0834655761719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.266223907470703,
"rewards/margins": 17.728179931640625,
"rewards/rejected": -14.461956977844238,
"step": 4030
},
{
"epoch": 1.6369529983792543,
"grad_norm": 2.5947690573957516e-06,
"learning_rate": 5.0487768272549905e-06,
"logits/chosen": -0.9642937779426575,
"logits/rejected": -1.2198621034622192,
"logps/chosen": -107.37706756591797,
"logps/rejected": -318.87896728515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.257359266281128,
"rewards/margins": 17.830778121948242,
"rewards/rejected": -14.573415756225586,
"step": 4040
},
{
"epoch": 1.641004862236629,
"grad_norm": 8.20930927147856e-06,
"learning_rate": 5.033768572714993e-06,
"logits/chosen": -0.958414614200592,
"logits/rejected": -1.1930384635925293,
"logps/chosen": -107.63899230957031,
"logps/rejected": -319.4289245605469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2218847274780273,
"rewards/margins": 17.83708381652832,
"rewards/rejected": -14.615198135375977,
"step": 4050
},
{
"epoch": 1.641004862236629,
"eval_logits/chosen": -0.975097119808197,
"eval_logits/rejected": -1.2044233083724976,
"eval_logps/chosen": -109.19059753417969,
"eval_logps/rejected": -317.51708984375,
"eval_loss": 9.533959399732339e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1821327209472656,
"eval_rewards/margins": 17.63956642150879,
"eval_rewards/rejected": -14.457432746887207,
"eval_runtime": 660.5812,
"eval_samples_per_second": 11.208,
"eval_steps_per_second": 0.624,
"step": 4050
},
{
"epoch": 1.6450567260940032,
"grad_norm": 1.4627960808866192e-05,
"learning_rate": 5.0187603181749965e-06,
"logits/chosen": -0.9663168787956238,
"logits/rejected": -1.1901664733886719,
"logps/chosen": -107.59746551513672,
"logps/rejected": -318.67193603515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2689335346221924,
"rewards/margins": 17.76458168029785,
"rewards/rejected": -14.495648384094238,
"step": 4060
},
{
"epoch": 1.6491085899513775,
"grad_norm": 4.622088908945443e-06,
"learning_rate": 5.003752063635e-06,
"logits/chosen": -0.9560664892196655,
"logits/rejected": -1.1980023384094238,
"logps/chosen": -108.25928497314453,
"logps/rejected": -317.87664794921875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.250584602355957,
"rewards/margins": 17.7623348236084,
"rewards/rejected": -14.511751174926758,
"step": 4070
},
{
"epoch": 1.653160453808752,
"grad_norm": 2.349050009797793e-05,
"learning_rate": 4.9887438090950026e-06,
"logits/chosen": -0.9641364216804504,
"logits/rejected": -1.1876428127288818,
"logps/chosen": -107.60128784179688,
"logps/rejected": -319.0780334472656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2614548206329346,
"rewards/margins": 17.83684730529785,
"rewards/rejected": -14.575393676757812,
"step": 4080
},
{
"epoch": 1.6572123176661264,
"grad_norm": 5.146464900462888e-06,
"learning_rate": 4.973735554555006e-06,
"logits/chosen": -0.9657267928123474,
"logits/rejected": -1.1887136697769165,
"logps/chosen": -108.01840209960938,
"logps/rejected": -318.5270690917969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2487587928771973,
"rewards/margins": 17.866899490356445,
"rewards/rejected": -14.618142127990723,
"step": 4090
},
{
"epoch": 1.6612641815235007,
"grad_norm": 1.2196490388305392e-05,
"learning_rate": 4.9587273000150086e-06,
"logits/chosen": -0.9598487615585327,
"logits/rejected": -1.201452612876892,
"logps/chosen": -107.60063171386719,
"logps/rejected": -318.6435852050781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.257800817489624,
"rewards/margins": 17.75874137878418,
"rewards/rejected": -14.50094223022461,
"step": 4100
},
{
"epoch": 1.6612641815235007,
"eval_logits/chosen": -0.9671822190284729,
"eval_logits/rejected": -1.1948264837265015,
"eval_logps/chosen": -109.20098114013672,
"eval_logps/rejected": -317.9280090332031,
"eval_loss": 9.195412076223874e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1810953617095947,
"eval_rewards/margins": 17.67962074279785,
"eval_rewards/rejected": -14.498525619506836,
"eval_runtime": 663.6517,
"eval_samples_per_second": 11.156,
"eval_steps_per_second": 0.621,
"step": 4100
},
{
"epoch": 1.6653160453808753,
"grad_norm": 2.757898528216174e-06,
"learning_rate": 4.943719045475012e-06,
"logits/chosen": -0.9675645232200623,
"logits/rejected": -1.189418911933899,
"logps/chosen": -107.36319732666016,
"logps/rejected": -318.67498779296875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.253856658935547,
"rewards/margins": 17.851980209350586,
"rewards/rejected": -14.598124504089355,
"step": 4110
},
{
"epoch": 1.6693679092382496,
"grad_norm": 3.7102433907421073e-06,
"learning_rate": 4.9287107909350146e-06,
"logits/chosen": -0.9603763222694397,
"logits/rejected": -1.1864895820617676,
"logps/chosen": -107.8660659790039,
"logps/rejected": -319.4140930175781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.261554002761841,
"rewards/margins": 17.922758102416992,
"rewards/rejected": -14.66120433807373,
"step": 4120
},
{
"epoch": 1.673419773095624,
"grad_norm": 1.7009240764309652e-05,
"learning_rate": 4.913702536395017e-06,
"logits/chosen": -0.966614842414856,
"logits/rejected": -1.1995640993118286,
"logps/chosen": -108.76692962646484,
"logps/rejected": -319.5960388183594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.229149103164673,
"rewards/margins": 17.841875076293945,
"rewards/rejected": -14.612726211547852,
"step": 4130
},
{
"epoch": 1.6774716369529985,
"grad_norm": 5.367153789848089e-06,
"learning_rate": 4.898694281855021e-06,
"logits/chosen": -0.9619210958480835,
"logits/rejected": -1.194135308265686,
"logps/chosen": -108.61856079101562,
"logps/rejected": -317.7147521972656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.242100954055786,
"rewards/margins": 17.756872177124023,
"rewards/rejected": -14.5147705078125,
"step": 4140
},
{
"epoch": 1.6815235008103726,
"grad_norm": 3.283277465015999e-06,
"learning_rate": 4.883686027315024e-06,
"logits/chosen": -0.9638760089874268,
"logits/rejected": -1.205974817276001,
"logps/chosen": -107.50321960449219,
"logps/rejected": -317.22576904296875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.268812894821167,
"rewards/margins": 17.68256950378418,
"rewards/rejected": -14.413758277893066,
"step": 4150
},
{
"epoch": 1.6815235008103726,
"eval_logits/chosen": -0.9770015478134155,
"eval_logits/rejected": -1.2045894861221313,
"eval_logps/chosen": -109.17327117919922,
"eval_logps/rejected": -318.26959228515625,
"eval_loss": 8.916208571463358e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.183866024017334,
"eval_rewards/margins": 17.716548919677734,
"eval_rewards/rejected": -14.532684326171875,
"eval_runtime": 663.031,
"eval_samples_per_second": 11.167,
"eval_steps_per_second": 0.621,
"step": 4150
},
{
"epoch": 1.6855753646677472,
"grad_norm": 5.341072665032698e-06,
"learning_rate": 4.868677772775027e-06,
"logits/chosen": -0.966580331325531,
"logits/rejected": -1.2173370122909546,
"logps/chosen": -108.13761138916016,
"logps/rejected": -322.0377197265625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2559990882873535,
"rewards/margins": 18.029720306396484,
"rewards/rejected": -14.773722648620605,
"step": 4160
},
{
"epoch": 1.6896272285251217,
"grad_norm": 5.1339147830731235e-06,
"learning_rate": 4.85366951823503e-06,
"logits/chosen": -0.9749870300292969,
"logits/rejected": -1.2149051427841187,
"logps/chosen": -107.59915924072266,
"logps/rejected": -320.6737060546875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2866246700286865,
"rewards/margins": 17.952587127685547,
"rewards/rejected": -14.665961265563965,
"step": 4170
},
{
"epoch": 1.6936790923824958,
"grad_norm": 4.617202648660168e-06,
"learning_rate": 4.838661263695033e-06,
"logits/chosen": -0.966048538684845,
"logits/rejected": -1.20872163772583,
"logps/chosen": -107.75770568847656,
"logps/rejected": -320.81640625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.31170916557312,
"rewards/margins": 18.048131942749023,
"rewards/rejected": -14.73642349243164,
"step": 4180
},
{
"epoch": 1.6977309562398704,
"grad_norm": 8.695402357261628e-06,
"learning_rate": 4.823653009155035e-06,
"logits/chosen": -0.9720503091812134,
"logits/rejected": -1.2081489562988281,
"logps/chosen": -108.02511596679688,
"logps/rejected": -320.03839111328125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2493691444396973,
"rewards/margins": 17.917095184326172,
"rewards/rejected": -14.667726516723633,
"step": 4190
},
{
"epoch": 1.7017828200972447,
"grad_norm": 6.944351753190858e-06,
"learning_rate": 4.808644754615039e-06,
"logits/chosen": -0.9694951176643372,
"logits/rejected": -1.2126491069793701,
"logps/chosen": -107.50739288330078,
"logps/rejected": -320.3431701660156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3132131099700928,
"rewards/margins": 18.086727142333984,
"rewards/rejected": -14.773515701293945,
"step": 4200
},
{
"epoch": 1.7017828200972447,
"eval_logits/chosen": -0.9932587146759033,
"eval_logits/rejected": -1.215240240097046,
"eval_logps/chosen": -109.29456329345703,
"eval_logps/rejected": -318.77752685546875,
"eval_loss": 8.563549158679962e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1717369556427,
"eval_rewards/margins": 17.75521469116211,
"eval_rewards/rejected": -14.583476066589355,
"eval_runtime": 664.1116,
"eval_samples_per_second": 11.149,
"eval_steps_per_second": 0.62,
"step": 4200
},
{
"epoch": 1.705834683954619,
"grad_norm": 8.203344805224333e-06,
"learning_rate": 4.793636500075042e-06,
"logits/chosen": -0.962543249130249,
"logits/rejected": -1.1963212490081787,
"logps/chosen": -107.7632064819336,
"logps/rejected": -319.73724365234375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.301147222518921,
"rewards/margins": 17.937274932861328,
"rewards/rejected": -14.636128425598145,
"step": 4210
},
{
"epoch": 1.7098865478119936,
"grad_norm": 1.5218613953038584e-05,
"learning_rate": 4.778628245535045e-06,
"logits/chosen": -0.9696997404098511,
"logits/rejected": -1.1978899240493774,
"logps/chosen": -107.52715301513672,
"logps/rejected": -319.97869873046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2426681518554688,
"rewards/margins": 17.97463035583496,
"rewards/rejected": -14.731962203979492,
"step": 4220
},
{
"epoch": 1.713938411669368,
"grad_norm": 2.6728112061391585e-05,
"learning_rate": 4.763619990995047e-06,
"logits/chosen": -0.9696226716041565,
"logits/rejected": -1.2055093050003052,
"logps/chosen": -107.90619659423828,
"logps/rejected": -319.2203674316406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2442867755889893,
"rewards/margins": 17.835180282592773,
"rewards/rejected": -14.590893745422363,
"step": 4230
},
{
"epoch": 1.7179902755267422,
"grad_norm": 4.324649125919677e-06,
"learning_rate": 4.748611736455051e-06,
"logits/chosen": -0.9708512425422668,
"logits/rejected": -1.2109978199005127,
"logps/chosen": -108.79696655273438,
"logps/rejected": -319.5374755859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.270660877227783,
"rewards/margins": 17.86390495300293,
"rewards/rejected": -14.593246459960938,
"step": 4240
},
{
"epoch": 1.7220421393841168,
"grad_norm": 6.176253918965813e-06,
"learning_rate": 4.733603481915054e-06,
"logits/chosen": -0.9561964273452759,
"logits/rejected": -1.1975693702697754,
"logps/chosen": -108.15457916259766,
"logps/rejected": -320.9573974609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2581639289855957,
"rewards/margins": 18.00908660888672,
"rewards/rejected": -14.750924110412598,
"step": 4250
},
{
"epoch": 1.7220421393841168,
"eval_logits/chosen": -0.9719837307929993,
"eval_logits/rejected": -1.1987754106521606,
"eval_logps/chosen": -109.13520050048828,
"eval_logps/rejected": -318.714111328125,
"eval_loss": 8.510431115382744e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1876730918884277,
"eval_rewards/margins": 17.76481056213379,
"eval_rewards/rejected": -14.57713794708252,
"eval_runtime": 665.5016,
"eval_samples_per_second": 11.125,
"eval_steps_per_second": 0.619,
"step": 4250
},
{
"epoch": 1.726094003241491,
"grad_norm": 7.230630217236467e-06,
"learning_rate": 4.718595227375057e-06,
"logits/chosen": -0.9625142216682434,
"logits/rejected": -1.1945154666900635,
"logps/chosen": -107.9782485961914,
"logps/rejected": -318.8968505859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.266047954559326,
"rewards/margins": 17.839750289916992,
"rewards/rejected": -14.57370376586914,
"step": 4260
},
{
"epoch": 1.7301458670988654,
"grad_norm": 6.9535558395728e-06,
"learning_rate": 4.70358697283506e-06,
"logits/chosen": -0.9719042181968689,
"logits/rejected": -1.2067571878433228,
"logps/chosen": -108.28577423095703,
"logps/rejected": -319.3832702636719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.296572685241699,
"rewards/margins": 17.96100425720215,
"rewards/rejected": -14.66443157196045,
"step": 4270
},
{
"epoch": 1.73419773095624,
"grad_norm": 4.54012160844286e-06,
"learning_rate": 4.688578718295063e-06,
"logits/chosen": -0.9618276357650757,
"logits/rejected": -1.1899430751800537,
"logps/chosen": -108.38196563720703,
"logps/rejected": -320.1663513183594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2343204021453857,
"rewards/margins": 17.94451332092285,
"rewards/rejected": -14.710190773010254,
"step": 4280
},
{
"epoch": 1.7382495948136143,
"grad_norm": 4.2299789129174314e-06,
"learning_rate": 4.673570463755065e-06,
"logits/chosen": -0.9642791748046875,
"logits/rejected": -1.2018933296203613,
"logps/chosen": -107.65156555175781,
"logps/rejected": -319.62750244140625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2711496353149414,
"rewards/margins": 17.844547271728516,
"rewards/rejected": -14.573396682739258,
"step": 4290
},
{
"epoch": 1.7423014586709886,
"grad_norm": 1.1666396858345252e-05,
"learning_rate": 4.658562209215069e-06,
"logits/chosen": -0.9570120573043823,
"logits/rejected": -1.187798023223877,
"logps/chosen": -108.56417846679688,
"logps/rejected": -319.67279052734375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2457265853881836,
"rewards/margins": 17.93968391418457,
"rewards/rejected": -14.69395923614502,
"step": 4300
},
{
"epoch": 1.7423014586709886,
"eval_logits/chosen": -0.9662920832633972,
"eval_logits/rejected": -1.1940561532974243,
"eval_logps/chosen": -109.10293579101562,
"eval_logps/rejected": -318.8600158691406,
"eval_loss": 8.35769000673281e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1909005641937256,
"eval_rewards/margins": 17.782625198364258,
"eval_rewards/rejected": -14.59172534942627,
"eval_runtime": 686.8154,
"eval_samples_per_second": 10.78,
"eval_steps_per_second": 0.6,
"step": 4300
},
{
"epoch": 1.7463533225283632,
"grad_norm": 8.781639735389035e-06,
"learning_rate": 4.643553954675072e-06,
"logits/chosen": -0.9702736139297485,
"logits/rejected": -1.2177287340164185,
"logps/chosen": -109.19371032714844,
"logps/rejected": -319.2940673828125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.216906785964966,
"rewards/margins": 17.830280303955078,
"rewards/rejected": -14.613371849060059,
"step": 4310
},
{
"epoch": 1.7504051863857373,
"grad_norm": 5.20419280292117e-06,
"learning_rate": 4.628545700135075e-06,
"logits/chosen": -0.9795908331871033,
"logits/rejected": -1.2105401754379272,
"logps/chosen": -108.30752563476562,
"logps/rejected": -319.4550476074219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2215776443481445,
"rewards/margins": 17.895877838134766,
"rewards/rejected": -14.67430305480957,
"step": 4320
},
{
"epoch": 1.7544570502431118,
"grad_norm": 2.9489826829376398e-06,
"learning_rate": 4.613537445595078e-06,
"logits/chosen": -0.9719784259796143,
"logits/rejected": -1.1975128650665283,
"logps/chosen": -107.42411041259766,
"logps/rejected": -321.16790771484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3067071437835693,
"rewards/margins": 18.113649368286133,
"rewards/rejected": -14.806941986083984,
"step": 4330
},
{
"epoch": 1.7585089141004864,
"grad_norm": 1.4856002962915227e-05,
"learning_rate": 4.598529191055081e-06,
"logits/chosen": -0.9707692265510559,
"logits/rejected": -1.192682147026062,
"logps/chosen": -109.07689666748047,
"logps/rejected": -320.1982116699219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2610487937927246,
"rewards/margins": 17.966022491455078,
"rewards/rejected": -14.704972267150879,
"step": 4340
},
{
"epoch": 1.7625607779578605,
"grad_norm": 8.642625289212447e-06,
"learning_rate": 4.583520936515083e-06,
"logits/chosen": -0.9686830639839172,
"logits/rejected": -1.1929088830947876,
"logps/chosen": -108.37218475341797,
"logps/rejected": -320.23455810546875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2672200202941895,
"rewards/margins": 17.942583084106445,
"rewards/rejected": -14.675362586975098,
"step": 4350
},
{
"epoch": 1.7625607779578605,
"eval_logits/chosen": -0.9792025089263916,
"eval_logits/rejected": -1.2058296203613281,
"eval_logps/chosen": -109.13961029052734,
"eval_logps/rejected": -319.3219299316406,
"eval_loss": 8.068646906167487e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1872334480285645,
"eval_rewards/margins": 17.825153350830078,
"eval_rewards/rejected": -14.637920379638672,
"eval_runtime": 660.0292,
"eval_samples_per_second": 11.218,
"eval_steps_per_second": 0.624,
"step": 4350
},
{
"epoch": 1.766612641815235,
"grad_norm": 6.106893579271855e-06,
"learning_rate": 4.568512681975087e-06,
"logits/chosen": -0.9581748247146606,
"logits/rejected": -1.1933001279830933,
"logps/chosen": -107.26266479492188,
"logps/rejected": -319.28619384765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3186635971069336,
"rewards/margins": 18.03749656677246,
"rewards/rejected": -14.718830108642578,
"step": 4360
},
{
"epoch": 1.7706645056726094,
"grad_norm": 3.562696065273485e-06,
"learning_rate": 4.55350442743509e-06,
"logits/chosen": -0.9714043140411377,
"logits/rejected": -1.2021480798721313,
"logps/chosen": -109.37030792236328,
"logps/rejected": -321.1347961425781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2486050128936768,
"rewards/margins": 18.014080047607422,
"rewards/rejected": -14.76547622680664,
"step": 4370
},
{
"epoch": 1.7747163695299837,
"grad_norm": 1.0784347068693023e-05,
"learning_rate": 4.538496172895093e-06,
"logits/chosen": -0.9613971710205078,
"logits/rejected": -1.178953766822815,
"logps/chosen": -108.04612731933594,
"logps/rejected": -320.51702880859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.295865058898926,
"rewards/margins": 18.03044891357422,
"rewards/rejected": -14.73458480834961,
"step": 4380
},
{
"epoch": 1.7787682333873582,
"grad_norm": 3.7314644032448996e-06,
"learning_rate": 4.523487918355095e-06,
"logits/chosen": -0.9538978934288025,
"logits/rejected": -1.1952236890792847,
"logps/chosen": -107.91067504882812,
"logps/rejected": -320.8572692871094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2640373706817627,
"rewards/margins": 17.994760513305664,
"rewards/rejected": -14.730725288391113,
"step": 4390
},
{
"epoch": 1.7828200972447326,
"grad_norm": 7.644155630259775e-06,
"learning_rate": 4.508479663815099e-06,
"logits/chosen": -0.9672717452049255,
"logits/rejected": -1.2072142362594604,
"logps/chosen": -108.7569351196289,
"logps/rejected": -319.16082763671875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2584824562072754,
"rewards/margins": 17.830446243286133,
"rewards/rejected": -14.571964263916016,
"step": 4400
},
{
"epoch": 1.7828200972447326,
"eval_logits/chosen": -0.978135883808136,
"eval_logits/rejected": -1.204634189605713,
"eval_logps/chosen": -109.13714599609375,
"eval_logps/rejected": -319.49810791015625,
"eval_loss": 7.920481692735848e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.18747878074646,
"eval_rewards/margins": 17.843013763427734,
"eval_rewards/rejected": -14.655535697937012,
"eval_runtime": 660.3223,
"eval_samples_per_second": 11.213,
"eval_steps_per_second": 0.624,
"step": 4400
},
{
"epoch": 1.7868719611021069,
"grad_norm": 2.2184389308677055e-05,
"learning_rate": 4.493471409275102e-06,
"logits/chosen": -0.9621807336807251,
"logits/rejected": -1.1890910863876343,
"logps/chosen": -107.69747924804688,
"logps/rejected": -319.6680908203125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2675540447235107,
"rewards/margins": 17.856769561767578,
"rewards/rejected": -14.589217185974121,
"step": 4410
},
{
"epoch": 1.7909238249594814,
"grad_norm": 4.1998664528364316e-06,
"learning_rate": 4.478463154735105e-06,
"logits/chosen": -0.9652020335197449,
"logits/rejected": -1.2166922092437744,
"logps/chosen": -109.41399383544922,
"logps/rejected": -321.5539245605469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2054331302642822,
"rewards/margins": 17.88554573059082,
"rewards/rejected": -14.680112838745117,
"step": 4420
},
{
"epoch": 1.7949756888168558,
"grad_norm": 7.153143542382168e-06,
"learning_rate": 4.463454900195108e-06,
"logits/chosen": -0.9790211915969849,
"logits/rejected": -1.2030084133148193,
"logps/chosen": -108.37751007080078,
"logps/rejected": -322.23651123046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2648351192474365,
"rewards/margins": 18.033552169799805,
"rewards/rejected": -14.768719673156738,
"step": 4430
},
{
"epoch": 1.79902755267423,
"grad_norm": 3.3711171454342548e-06,
"learning_rate": 4.448446645655111e-06,
"logits/chosen": -0.9689657688140869,
"logits/rejected": -1.2139739990234375,
"logps/chosen": -107.65309143066406,
"logps/rejected": -323.7328796386719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2879128456115723,
"rewards/margins": 18.25405502319336,
"rewards/rejected": -14.966139793395996,
"step": 4440
},
{
"epoch": 1.8030794165316046,
"grad_norm": 1.208314415634959e-06,
"learning_rate": 4.433438391115113e-06,
"logits/chosen": -0.9697353839874268,
"logits/rejected": -1.2005465030670166,
"logps/chosen": -107.74067687988281,
"logps/rejected": -320.22296142578125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2932724952697754,
"rewards/margins": 18.093793869018555,
"rewards/rejected": -14.800522804260254,
"step": 4450
},
{
"epoch": 1.8030794165316046,
"eval_logits/chosen": -0.9763341546058655,
"eval_logits/rejected": -1.2022850513458252,
"eval_logps/chosen": -109.07799530029297,
"eval_logps/rejected": -319.63885498046875,
"eval_loss": 7.777131116881719e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1933939456939697,
"eval_rewards/margins": 17.86300277709961,
"eval_rewards/rejected": -14.669608116149902,
"eval_runtime": 660.4874,
"eval_samples_per_second": 11.21,
"eval_steps_per_second": 0.624,
"step": 4450
},
{
"epoch": 1.807131280388979,
"grad_norm": 6.018221938575152e-06,
"learning_rate": 4.418430136575117e-06,
"logits/chosen": -0.9695747494697571,
"logits/rejected": -1.2011383771896362,
"logps/chosen": -108.23741912841797,
"logps/rejected": -322.4383850097656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2775845527648926,
"rewards/margins": 18.15408706665039,
"rewards/rejected": -14.87650203704834,
"step": 4460
},
{
"epoch": 1.8111831442463533,
"grad_norm": 7.861935046094004e-06,
"learning_rate": 4.40342188203512e-06,
"logits/chosen": -0.9580012559890747,
"logits/rejected": -1.2017271518707275,
"logps/chosen": -109.01265716552734,
"logps/rejected": -321.8054504394531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.274156332015991,
"rewards/margins": 18.100004196166992,
"rewards/rejected": -14.825848579406738,
"step": 4470
},
{
"epoch": 1.8152350081037278,
"grad_norm": 4.612465545505984e-06,
"learning_rate": 4.388413627495123e-06,
"logits/chosen": -0.9677801132202148,
"logits/rejected": -1.18340003490448,
"logps/chosen": -108.96244049072266,
"logps/rejected": -320.5141296386719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.234553098678589,
"rewards/margins": 17.92672348022461,
"rewards/rejected": -14.692172050476074,
"step": 4480
},
{
"epoch": 1.819286871961102,
"grad_norm": 2.053400976365083e-06,
"learning_rate": 4.373405372955125e-06,
"logits/chosen": -0.9691886901855469,
"logits/rejected": -1.1938700675964355,
"logps/chosen": -109.02762603759766,
"logps/rejected": -320.2586364746094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2385077476501465,
"rewards/margins": 17.953767776489258,
"rewards/rejected": -14.715259552001953,
"step": 4490
},
{
"epoch": 1.8233387358184765,
"grad_norm": 5.526775566977449e-06,
"learning_rate": 4.358397118415129e-06,
"logits/chosen": -0.9505713582038879,
"logits/rejected": -1.1996839046478271,
"logps/chosen": -106.17263793945312,
"logps/rejected": -322.22296142578125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2986068725585938,
"rewards/margins": 18.22445297241211,
"rewards/rejected": -14.925846099853516,
"step": 4500
},
{
"epoch": 1.8233387358184765,
"eval_logits/chosen": -0.9807091951370239,
"eval_logits/rejected": -1.2058302164077759,
"eval_logps/chosen": -109.1124267578125,
"eval_logps/rejected": -320.0847473144531,
"eval_loss": 7.469225948852909e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1899495124816895,
"eval_rewards/margins": 17.90414810180664,
"eval_rewards/rejected": -14.71419906616211,
"eval_runtime": 660.4248,
"eval_samples_per_second": 11.211,
"eval_steps_per_second": 0.624,
"step": 4500
},
{
"epoch": 1.827390599675851,
"grad_norm": 7.4045251494681e-06,
"learning_rate": 4.343388863875131e-06,
"logits/chosen": -0.9733620882034302,
"logits/rejected": -1.2026481628417969,
"logps/chosen": -108.2680435180664,
"logps/rejected": -322.1900329589844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2477121353149414,
"rewards/margins": 18.169279098510742,
"rewards/rejected": -14.921568870544434,
"step": 4510
},
{
"epoch": 1.8314424635332252,
"grad_norm": 3.332833330205176e-06,
"learning_rate": 4.328380609335135e-06,
"logits/chosen": -0.966694712638855,
"logits/rejected": -1.1901875734329224,
"logps/chosen": -107.82235717773438,
"logps/rejected": -322.0663757324219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.270493745803833,
"rewards/margins": 18.053882598876953,
"rewards/rejected": -14.783388137817383,
"step": 4520
},
{
"epoch": 1.8354943273905997,
"grad_norm": 3.3187377539434237e-06,
"learning_rate": 4.313372354795138e-06,
"logits/chosen": -0.9629502892494202,
"logits/rejected": -1.1885720491409302,
"logps/chosen": -108.7431869506836,
"logps/rejected": -322.45867919921875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2092270851135254,
"rewards/margins": 18.075258255004883,
"rewards/rejected": -14.866032600402832,
"step": 4530
},
{
"epoch": 1.839546191247974,
"grad_norm": 4.360450475360267e-06,
"learning_rate": 4.298364100255141e-06,
"logits/chosen": -0.974517285823822,
"logits/rejected": -1.1914209127426147,
"logps/chosen": -108.77423858642578,
"logps/rejected": -320.7426452636719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2381083965301514,
"rewards/margins": 17.959489822387695,
"rewards/rejected": -14.721381187438965,
"step": 4540
},
{
"epoch": 1.8435980551053484,
"grad_norm": 2.29799570661271e-06,
"learning_rate": 4.283355845715143e-06,
"logits/chosen": -0.9552022814750671,
"logits/rejected": -1.2001949548721313,
"logps/chosen": -107.79722595214844,
"logps/rejected": -321.5192565917969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.274078369140625,
"rewards/margins": 18.0383358001709,
"rewards/rejected": -14.76425838470459,
"step": 4550
},
{
"epoch": 1.8435980551053484,
"eval_logits/chosen": -0.9842467904090881,
"eval_logits/rejected": -1.2096879482269287,
"eval_logps/chosen": -109.08003234863281,
"eval_logps/rejected": -320.178466796875,
"eval_loss": 7.409251878698342e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.193190813064575,
"eval_rewards/margins": 17.91676139831543,
"eval_rewards/rejected": -14.723569869995117,
"eval_runtime": 660.4845,
"eval_samples_per_second": 11.21,
"eval_steps_per_second": 0.624,
"step": 4550
},
{
"epoch": 1.847649918962723,
"grad_norm": 2.519145255064359e-06,
"learning_rate": 4.268347591175147e-06,
"logits/chosen": -0.9676612615585327,
"logits/rejected": -1.1968157291412354,
"logps/chosen": -108.7945327758789,
"logps/rejected": -321.25469970703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.273383378982544,
"rewards/margins": 17.944278717041016,
"rewards/rejected": -14.670894622802734,
"step": 4560
},
{
"epoch": 1.8517017828200972,
"grad_norm": 1.055786015058402e-05,
"learning_rate": 4.253339336635149e-06,
"logits/chosen": -0.9639263153076172,
"logits/rejected": -1.2146022319793701,
"logps/chosen": -108.0430908203125,
"logps/rejected": -322.0449523925781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2333381175994873,
"rewards/margins": 18.162742614746094,
"rewards/rejected": -14.929403305053711,
"step": 4570
},
{
"epoch": 1.8557536466774716,
"grad_norm": 3.715491629918688e-06,
"learning_rate": 4.238331082095153e-06,
"logits/chosen": -0.9830486178398132,
"logits/rejected": -1.2109137773513794,
"logps/chosen": -108.03145599365234,
"logps/rejected": -321.6439514160156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2837610244750977,
"rewards/margins": 18.121925354003906,
"rewards/rejected": -14.838165283203125,
"step": 4580
},
{
"epoch": 1.859805510534846,
"grad_norm": 3.2888442547118757e-06,
"learning_rate": 4.223322827555156e-06,
"logits/chosen": -0.9521467089653015,
"logits/rejected": -1.2002835273742676,
"logps/chosen": -108.80928802490234,
"logps/rejected": -322.5191955566406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2589292526245117,
"rewards/margins": 18.116209030151367,
"rewards/rejected": -14.857280731201172,
"step": 4590
},
{
"epoch": 1.8638573743922204,
"grad_norm": 3.29683621203003e-06,
"learning_rate": 4.208314573015159e-06,
"logits/chosen": -0.9633061289787292,
"logits/rejected": -1.2022969722747803,
"logps/chosen": -107.3350601196289,
"logps/rejected": -320.0856628417969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3103652000427246,
"rewards/margins": 18.04131507873535,
"rewards/rejected": -14.730950355529785,
"step": 4600
},
{
"epoch": 1.8638573743922204,
"eval_logits/chosen": -0.9786840081214905,
"eval_logits/rejected": -1.202929139137268,
"eval_logps/chosen": -109.06305694580078,
"eval_logps/rejected": -320.3982849121094,
"eval_loss": 7.233222021341135e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1948869228363037,
"eval_rewards/margins": 17.940439224243164,
"eval_rewards/rejected": -14.745550155639648,
"eval_runtime": 660.4953,
"eval_samples_per_second": 11.21,
"eval_steps_per_second": 0.624,
"step": 4600
},
{
"epoch": 1.8679092382495948,
"grad_norm": 4.971577709511621e-06,
"learning_rate": 4.193306318475161e-06,
"logits/chosen": -0.9493335485458374,
"logits/rejected": -1.1981040239334106,
"logps/chosen": -108.59446716308594,
"logps/rejected": -320.84735107421875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2676663398742676,
"rewards/margins": 18.01744270324707,
"rewards/rejected": -14.749775886535645,
"step": 4610
},
{
"epoch": 1.8719611021069693,
"grad_norm": 5.5384443840011954e-06,
"learning_rate": 4.178298063935165e-06,
"logits/chosen": -0.9665194749832153,
"logits/rejected": -1.1918801069259644,
"logps/chosen": -108.53473663330078,
"logps/rejected": -321.12249755859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.248072385787964,
"rewards/margins": 18.042972564697266,
"rewards/rejected": -14.794903755187988,
"step": 4620
},
{
"epoch": 1.8760129659643436,
"grad_norm": 6.041650067345472e-06,
"learning_rate": 4.163289809395168e-06,
"logits/chosen": -0.9764280915260315,
"logits/rejected": -1.203399658203125,
"logps/chosen": -108.33360290527344,
"logps/rejected": -319.94610595703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.24983811378479,
"rewards/margins": 17.952869415283203,
"rewards/rejected": -14.703031539916992,
"step": 4630
},
{
"epoch": 1.880064829821718,
"grad_norm": 2.5019787699420704e-06,
"learning_rate": 4.148281554855171e-06,
"logits/chosen": -0.9812704920768738,
"logits/rejected": -1.2009217739105225,
"logps/chosen": -108.75373077392578,
"logps/rejected": -320.7171630859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.269096612930298,
"rewards/margins": 17.954044342041016,
"rewards/rejected": -14.684948921203613,
"step": 4640
},
{
"epoch": 1.8841166936790925,
"grad_norm": 3.9666892917011864e-06,
"learning_rate": 4.133273300315173e-06,
"logits/chosen": -0.9929503202438354,
"logits/rejected": -1.2013704776763916,
"logps/chosen": -107.94710540771484,
"logps/rejected": -321.26123046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2891159057617188,
"rewards/margins": 18.05217742919922,
"rewards/rejected": -14.7630615234375,
"step": 4650
},
{
"epoch": 1.8841166936790925,
"eval_logits/chosen": -0.9783722162246704,
"eval_logits/rejected": -1.202864170074463,
"eval_logps/chosen": -109.06450653076172,
"eval_logps/rejected": -320.7001647949219,
"eval_loss": 7.021466785772645e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.194742441177368,
"eval_rewards/margins": 17.970481872558594,
"eval_rewards/rejected": -14.775740623474121,
"eval_runtime": 660.4769,
"eval_samples_per_second": 11.21,
"eval_steps_per_second": 0.624,
"step": 4650
},
{
"epoch": 1.8881685575364666,
"grad_norm": 3.1112033411773155e-06,
"learning_rate": 4.118265045775177e-06,
"logits/chosen": -0.967117190361023,
"logits/rejected": -1.19990873336792,
"logps/chosen": -108.15768432617188,
"logps/rejected": -321.8457336425781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.283776044845581,
"rewards/margins": 18.083831787109375,
"rewards/rejected": -14.800055503845215,
"step": 4660
},
{
"epoch": 1.8922204213938412,
"grad_norm": 2.5846559310593875e-06,
"learning_rate": 4.103256791235179e-06,
"logits/chosen": -0.9678542017936707,
"logits/rejected": -1.1994032859802246,
"logps/chosen": -107.25688171386719,
"logps/rejected": -321.7806091308594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.290947437286377,
"rewards/margins": 18.137258529663086,
"rewards/rejected": -14.846309661865234,
"step": 4670
},
{
"epoch": 1.8962722852512157,
"grad_norm": 5.48166917724302e-06,
"learning_rate": 4.088248536695183e-06,
"logits/chosen": -0.9686475396156311,
"logits/rejected": -1.2068462371826172,
"logps/chosen": -107.35350036621094,
"logps/rejected": -321.7884826660156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2941713333129883,
"rewards/margins": 18.086830139160156,
"rewards/rejected": -14.7926607131958,
"step": 4680
},
{
"epoch": 1.9003241491085898,
"grad_norm": 4.694249128078809e-06,
"learning_rate": 4.073240282155186e-06,
"logits/chosen": -0.9648269414901733,
"logits/rejected": -1.2069343328475952,
"logps/chosen": -107.65116882324219,
"logps/rejected": -323.0342102050781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2500650882720947,
"rewards/margins": 18.1915283203125,
"rewards/rejected": -14.941463470458984,
"step": 4690
},
{
"epoch": 1.9043760129659644,
"grad_norm": 5.962758677924285e-06,
"learning_rate": 4.058232027615189e-06,
"logits/chosen": -0.9601716995239258,
"logits/rejected": -1.1852545738220215,
"logps/chosen": -108.1944580078125,
"logps/rejected": -320.3160095214844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.262619972229004,
"rewards/margins": 17.96957778930664,
"rewards/rejected": -14.706958770751953,
"step": 4700
},
{
"epoch": 1.9043760129659644,
"eval_logits/chosen": -0.9788442254066467,
"eval_logits/rejected": -1.2020491361618042,
"eval_logps/chosen": -109.03036499023438,
"eval_logps/rejected": -320.9104919433594,
"eval_loss": 6.850030587202127e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.198155164718628,
"eval_rewards/margins": 17.994932174682617,
"eval_rewards/rejected": -14.79677677154541,
"eval_runtime": 660.5364,
"eval_samples_per_second": 11.209,
"eval_steps_per_second": 0.624,
"step": 4700
},
{
"epoch": 1.9084278768233387,
"grad_norm": 2.8154815936431987e-06,
"learning_rate": 4.043223773075191e-06,
"logits/chosen": -0.9590250253677368,
"logits/rejected": -1.198261022567749,
"logps/chosen": -107.40636444091797,
"logps/rejected": -322.0196533203125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.272249937057495,
"rewards/margins": 18.1776065826416,
"rewards/rejected": -14.905356407165527,
"step": 4710
},
{
"epoch": 1.912479740680713,
"grad_norm": 3.019512178070727e-06,
"learning_rate": 4.028215518535195e-06,
"logits/chosen": -0.9678371548652649,
"logits/rejected": -1.1993069648742676,
"logps/chosen": -108.16641998291016,
"logps/rejected": -321.8016357421875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2627205848693848,
"rewards/margins": 18.09998321533203,
"rewards/rejected": -14.837262153625488,
"step": 4720
},
{
"epoch": 1.9165316045380876,
"grad_norm": 4.8556812544120476e-06,
"learning_rate": 4.013207263995197e-06,
"logits/chosen": -0.977064311504364,
"logits/rejected": -1.1923290491104126,
"logps/chosen": -108.24919891357422,
"logps/rejected": -322.5245361328125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2549569606781006,
"rewards/margins": 18.176767349243164,
"rewards/rejected": -14.921812057495117,
"step": 4730
},
{
"epoch": 1.920583468395462,
"grad_norm": 2.067858531518141e-06,
"learning_rate": 3.998199009455201e-06,
"logits/chosen": -0.9402839541435242,
"logits/rejected": -1.2003926038742065,
"logps/chosen": -106.45325469970703,
"logps/rejected": -324.4967956542969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3108747005462646,
"rewards/margins": 18.355466842651367,
"rewards/rejected": -15.044590950012207,
"step": 4740
},
{
"epoch": 1.9246353322528362,
"grad_norm": 5.996467280056095e-06,
"learning_rate": 3.983190754915203e-06,
"logits/chosen": -0.9844788312911987,
"logits/rejected": -1.195417881011963,
"logps/chosen": -109.07532501220703,
"logps/rejected": -322.93695068359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2502410411834717,
"rewards/margins": 18.149274826049805,
"rewards/rejected": -14.89903450012207,
"step": 4750
},
{
"epoch": 1.9246353322528362,
"eval_logits/chosen": -0.9755988121032715,
"eval_logits/rejected": -1.1990272998809814,
"eval_logps/chosen": -109.0657958984375,
"eval_logps/rejected": -321.15057373046875,
"eval_loss": 6.730191159931564e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.1946122646331787,
"eval_rewards/margins": 18.015398025512695,
"eval_rewards/rejected": -14.820784568786621,
"eval_runtime": 660.4034,
"eval_samples_per_second": 11.211,
"eval_steps_per_second": 0.624,
"step": 4750
},
{
"epoch": 1.9286871961102108,
"grad_norm": 3.9852939153206535e-06,
"learning_rate": 3.968182500375207e-06,
"logits/chosen": -0.9592065215110779,
"logits/rejected": -1.2046445608139038,
"logps/chosen": -107.64582824707031,
"logps/rejected": -321.4580078125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.260378837585449,
"rewards/margins": 18.183618545532227,
"rewards/rejected": -14.923238754272461,
"step": 4760
},
{
"epoch": 1.932739059967585,
"grad_norm": 3.716176934176474e-06,
"learning_rate": 3.953174245835209e-06,
"logits/chosen": -0.9753321409225464,
"logits/rejected": -1.2032028436660767,
"logps/chosen": -108.28763580322266,
"logps/rejected": -321.4541015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2404139041900635,
"rewards/margins": 17.986602783203125,
"rewards/rejected": -14.746188163757324,
"step": 4770
},
{
"epoch": 1.9367909238249594,
"grad_norm": 3.635807843238581e-06,
"learning_rate": 3.938165991295213e-06,
"logits/chosen": -0.9639159440994263,
"logits/rejected": -1.196582555770874,
"logps/chosen": -108.30272674560547,
"logps/rejected": -323.1302185058594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2664296627044678,
"rewards/margins": 18.24969482421875,
"rewards/rejected": -14.98326587677002,
"step": 4780
},
{
"epoch": 1.940842787682334,
"grad_norm": 3.2924308470683172e-06,
"learning_rate": 3.923157736755216e-06,
"logits/chosen": -0.972676694393158,
"logits/rejected": -1.176472544670105,
"logps/chosen": -108.53832244873047,
"logps/rejected": -322.3914794921875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2719764709472656,
"rewards/margins": 18.195058822631836,
"rewards/rejected": -14.923080444335938,
"step": 4790
},
{
"epoch": 1.9448946515397083,
"grad_norm": 2.680646275621257e-06,
"learning_rate": 3.908149482215219e-06,
"logits/chosen": -0.9661304354667664,
"logits/rejected": -1.1976679563522339,
"logps/chosen": -107.57020568847656,
"logps/rejected": -323.94757080078125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2382466793060303,
"rewards/margins": 18.25577735900879,
"rewards/rejected": -15.017531394958496,
"step": 4800
},
{
"epoch": 1.9448946515397083,
"eval_logits/chosen": -0.9803680181503296,
"eval_logits/rejected": -1.2040807008743286,
"eval_logps/chosen": -109.0024185180664,
"eval_logps/rejected": -321.3273620605469,
"eval_loss": 6.577239730631845e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2009496688842773,
"eval_rewards/margins": 18.039411544799805,
"eval_rewards/rejected": -14.838460922241211,
"eval_runtime": 660.4735,
"eval_samples_per_second": 11.21,
"eval_steps_per_second": 0.624,
"step": 4800
},
{
"epoch": 1.9489465153970826,
"grad_norm": 2.6189354684902355e-06,
"learning_rate": 3.893141227675221e-06,
"logits/chosen": -0.9728685021400452,
"logits/rejected": -1.2008436918258667,
"logps/chosen": -108.86917114257812,
"logps/rejected": -323.2511901855469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.238666534423828,
"rewards/margins": 18.227935791015625,
"rewards/rejected": -14.989269256591797,
"step": 4810
},
{
"epoch": 1.9529983792544572,
"grad_norm": 1.0494446541997604e-05,
"learning_rate": 3.878132973135225e-06,
"logits/chosen": -0.9686774611473083,
"logits/rejected": -1.1878249645233154,
"logps/chosen": -109.44641876220703,
"logps/rejected": -322.2353210449219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2077255249023438,
"rewards/margins": 18.08070182800293,
"rewards/rejected": -14.872976303100586,
"step": 4820
},
{
"epoch": 1.9570502431118313,
"grad_norm": 2.662289489308023e-06,
"learning_rate": 3.863124718595227e-06,
"logits/chosen": -0.9683530926704407,
"logits/rejected": -1.205175518989563,
"logps/chosen": -108.19351959228516,
"logps/rejected": -323.36212158203125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.245283842086792,
"rewards/margins": 18.26123046875,
"rewards/rejected": -15.015947341918945,
"step": 4830
},
{
"epoch": 1.9611021069692058,
"grad_norm": 3.1114741432247683e-06,
"learning_rate": 3.848116464055231e-06,
"logits/chosen": -0.9755093455314636,
"logits/rejected": -1.1997181177139282,
"logps/chosen": -108.98912048339844,
"logps/rejected": -323.6244201660156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2453114986419678,
"rewards/margins": 18.16748046875,
"rewards/rejected": -14.922168731689453,
"step": 4840
},
{
"epoch": 1.9651539708265804,
"grad_norm": 5.440684617497027e-06,
"learning_rate": 3.833108209515234e-06,
"logits/chosen": -0.961645245552063,
"logits/rejected": -1.2061594724655151,
"logps/chosen": -108.36994171142578,
"logps/rejected": -321.2346496582031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2903635501861572,
"rewards/margins": 18.091514587402344,
"rewards/rejected": -14.80115032196045,
"step": 4850
},
{
"epoch": 1.9651539708265804,
"eval_logits/chosen": -0.9778537154197693,
"eval_logits/rejected": -1.200571894645691,
"eval_logps/chosen": -109.01957702636719,
"eval_logps/rejected": -321.4977111816406,
"eval_loss": 6.502763483240415e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.199235439300537,
"eval_rewards/margins": 18.054733276367188,
"eval_rewards/rejected": -14.855497360229492,
"eval_runtime": 660.4953,
"eval_samples_per_second": 11.21,
"eval_steps_per_second": 0.624,
"step": 4850
},
{
"epoch": 1.9692058346839545,
"grad_norm": 3.1822473829379305e-06,
"learning_rate": 3.818099954975237e-06,
"logits/chosen": -0.9647846817970276,
"logits/rejected": -1.1994272470474243,
"logps/chosen": -108.41690826416016,
"logps/rejected": -323.28631591796875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.290191173553467,
"rewards/margins": 18.278629302978516,
"rewards/rejected": -14.988438606262207,
"step": 4860
},
{
"epoch": 1.973257698541329,
"grad_norm": 2.5745391667442163e-06,
"learning_rate": 3.80309170043524e-06,
"logits/chosen": -0.9744833111763,
"logits/rejected": -1.1996198892593384,
"logps/chosen": -107.52901458740234,
"logps/rejected": -323.8044128417969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2914023399353027,
"rewards/margins": 18.269445419311523,
"rewards/rejected": -14.978041648864746,
"step": 4870
},
{
"epoch": 1.9773095623987034,
"grad_norm": 4.465393885766389e-06,
"learning_rate": 3.7880834458952424e-06,
"logits/chosen": -0.9575149416923523,
"logits/rejected": -1.1838562488555908,
"logps/chosen": -107.7874984741211,
"logps/rejected": -323.15985107421875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2660937309265137,
"rewards/margins": 18.230712890625,
"rewards/rejected": -14.964617729187012,
"step": 4880
},
{
"epoch": 1.9813614262560777,
"grad_norm": 2.848352551154676e-06,
"learning_rate": 3.7730751913552454e-06,
"logits/chosen": -0.9726042151451111,
"logits/rejected": -1.202985167503357,
"logps/chosen": -109.6990737915039,
"logps/rejected": -323.98907470703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2264673709869385,
"rewards/margins": 18.20193099975586,
"rewards/rejected": -14.9754638671875,
"step": 4890
},
{
"epoch": 1.9854132901134522,
"grad_norm": 2.8638380626944127e-06,
"learning_rate": 3.758066936815249e-06,
"logits/chosen": -0.970777153968811,
"logits/rejected": -1.1936142444610596,
"logps/chosen": -108.6916732788086,
"logps/rejected": -322.7779846191406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.31592059135437,
"rewards/margins": 18.30429458618164,
"rewards/rejected": -14.988374710083008,
"step": 4900
},
{
"epoch": 1.9854132901134522,
"eval_logits/chosen": -0.9825440049171448,
"eval_logits/rejected": -1.20473051071167,
"eval_logps/chosen": -109.0003890991211,
"eval_logps/rejected": -321.789794921875,
"eval_loss": 6.325069534796057e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2011539936065674,
"eval_rewards/margins": 18.08585548400879,
"eval_rewards/rejected": -14.884700775146484,
"eval_runtime": 660.5882,
"eval_samples_per_second": 11.208,
"eval_steps_per_second": 0.624,
"step": 4900
},
{
"epoch": 1.9894651539708266,
"grad_norm": 2.4442233552690595e-05,
"learning_rate": 3.743058682275252e-06,
"logits/chosen": -0.9682837128639221,
"logits/rejected": -1.1897228956222534,
"logps/chosen": -108.81273651123047,
"logps/rejected": -321.91217041015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2439818382263184,
"rewards/margins": 18.088844299316406,
"rewards/rejected": -14.844861030578613,
"step": 4910
},
{
"epoch": 1.993517017828201,
"grad_norm": 2.8480183118517743e-06,
"learning_rate": 3.728050427735255e-06,
"logits/chosen": -0.9716948866844177,
"logits/rejected": -1.217131495475769,
"logps/chosen": -107.93961334228516,
"logps/rejected": -322.7872009277344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2950081825256348,
"rewards/margins": 18.22598648071289,
"rewards/rejected": -14.930974960327148,
"step": 4920
},
{
"epoch": 1.9975688816855754,
"grad_norm": 3.2138655114977155e-06,
"learning_rate": 3.7130421731952575e-06,
"logits/chosen": -0.9685840606689453,
"logits/rejected": -1.2002424001693726,
"logps/chosen": -109.53565979003906,
"logps/rejected": -323.6005554199219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.233421802520752,
"rewards/margins": 18.15231704711914,
"rewards/rejected": -14.91889476776123,
"step": 4930
},
{
"epoch": 2.0016207455429496,
"grad_norm": 1.2053304999426473e-05,
"learning_rate": 3.6980339186552605e-06,
"logits/chosen": -0.9570005536079407,
"logits/rejected": -1.176553726196289,
"logps/chosen": -107.43694305419922,
"logps/rejected": -323.06964111328125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2987098693847656,
"rewards/margins": 18.21400260925293,
"rewards/rejected": -14.91529369354248,
"step": 4940
},
{
"epoch": 2.005672609400324,
"grad_norm": 3.1240876978699816e-06,
"learning_rate": 3.683025664115264e-06,
"logits/chosen": -0.9605010747909546,
"logits/rejected": -1.1978155374526978,
"logps/chosen": -107.3221435546875,
"logps/rejected": -322.78021240234375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2937347888946533,
"rewards/margins": 18.2900390625,
"rewards/rejected": -14.996304512023926,
"step": 4950
},
{
"epoch": 2.005672609400324,
"eval_logits/chosen": -0.9806666970252991,
"eval_logits/rejected": -1.2025675773620605,
"eval_logps/chosen": -109.00515747070312,
"eval_logps/rejected": -322.0491027832031,
"eval_loss": 6.160802712429359e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2006771564483643,
"eval_rewards/margins": 18.11131477355957,
"eval_rewards/rejected": -14.910634994506836,
"eval_runtime": 660.5404,
"eval_samples_per_second": 11.209,
"eval_steps_per_second": 0.624,
"step": 4950
},
{
"epoch": 2.0097244732576987,
"grad_norm": 3.8034179397072876e-06,
"learning_rate": 3.668017409575267e-06,
"logits/chosen": -0.9739381074905396,
"logits/rejected": -1.2024341821670532,
"logps/chosen": -107.70148468017578,
"logps/rejected": -322.88226318359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.279003620147705,
"rewards/margins": 18.232358932495117,
"rewards/rejected": -14.953354835510254,
"step": 4960
},
{
"epoch": 2.0137763371150728,
"grad_norm": 4.456906026462093e-06,
"learning_rate": 3.65300915503527e-06,
"logits/chosen": -0.9753895998001099,
"logits/rejected": -1.188686728477478,
"logps/chosen": -108.8790054321289,
"logps/rejected": -324.54022216796875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.249891996383667,
"rewards/margins": 18.289875030517578,
"rewards/rejected": -15.0399808883667,
"step": 4970
},
{
"epoch": 2.0178282009724473,
"grad_norm": 4.742184955830453e-06,
"learning_rate": 3.6380009004952725e-06,
"logits/chosen": -0.9557638168334961,
"logits/rejected": -1.2003400325775146,
"logps/chosen": -107.69667053222656,
"logps/rejected": -324.84954833984375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2877097129821777,
"rewards/margins": 18.38192367553711,
"rewards/rejected": -15.094216346740723,
"step": 4980
},
{
"epoch": 2.021880064829822,
"grad_norm": 1.4145489330985583e-05,
"learning_rate": 3.6229926459552755e-06,
"logits/chosen": -0.9673196077346802,
"logits/rejected": -1.2091333866119385,
"logps/chosen": -107.90608978271484,
"logps/rejected": -323.47991943359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3074872493743896,
"rewards/margins": 18.368791580200195,
"rewards/rejected": -15.06130313873291,
"step": 4990
},
{
"epoch": 2.025931928687196,
"grad_norm": 3.324122644698946e-06,
"learning_rate": 3.6079843914152785e-06,
"logits/chosen": -0.9694700241088867,
"logits/rejected": -1.197292685508728,
"logps/chosen": -108.34423828125,
"logps/rejected": -322.24957275390625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2302982807159424,
"rewards/margins": 18.173320770263672,
"rewards/rejected": -14.943023681640625,
"step": 5000
},
{
"epoch": 2.025931928687196,
"eval_logits/chosen": -0.9766953587532043,
"eval_logits/rejected": -1.1986485719680786,
"eval_logps/chosen": -108.99577331542969,
"eval_logps/rejected": -322.276123046875,
"eval_loss": 6.022185061738128e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2016162872314453,
"eval_rewards/margins": 18.134952545166016,
"eval_rewards/rejected": -14.933335304260254,
"eval_runtime": 660.5052,
"eval_samples_per_second": 11.21,
"eval_steps_per_second": 0.624,
"step": 5000
},
{
"epoch": 2.0299837925445705,
"grad_norm": 2.3767845505062724e-06,
"learning_rate": 3.592976136875282e-06,
"logits/chosen": -0.965735137462616,
"logits/rejected": -1.2081549167633057,
"logps/chosen": -108.78414916992188,
"logps/rejected": -323.2518005371094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.245922803878784,
"rewards/margins": 18.177051544189453,
"rewards/rejected": -14.931127548217773,
"step": 5010
},
{
"epoch": 2.034035656401945,
"grad_norm": 3.4225790841446724e-06,
"learning_rate": 3.577967882335285e-06,
"logits/chosen": -0.9643774628639221,
"logits/rejected": -1.2113484144210815,
"logps/chosen": -107.67012786865234,
"logps/rejected": -323.9315185546875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3138530254364014,
"rewards/margins": 18.391572952270508,
"rewards/rejected": -15.077719688415527,
"step": 5020
},
{
"epoch": 2.038087520259319,
"grad_norm": 2.2828062355984002e-06,
"learning_rate": 3.5629596277952875e-06,
"logits/chosen": -0.986914873123169,
"logits/rejected": -1.1938860416412354,
"logps/chosen": -109.88799285888672,
"logps/rejected": -323.33282470703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.202239751815796,
"rewards/margins": 18.149791717529297,
"rewards/rejected": -14.947552680969238,
"step": 5030
},
{
"epoch": 2.0421393841166937,
"grad_norm": 3.3493358841951704e-06,
"learning_rate": 3.5479513732552905e-06,
"logits/chosen": -0.9507116079330444,
"logits/rejected": -1.1881414651870728,
"logps/chosen": -107.72386932373047,
"logps/rejected": -323.3999938964844,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3047282695770264,
"rewards/margins": 18.352764129638672,
"rewards/rejected": -15.048036575317383,
"step": 5040
},
{
"epoch": 2.0461912479740683,
"grad_norm": 2.662564611455309e-06,
"learning_rate": 3.5329431187152935e-06,
"logits/chosen": -0.969707727432251,
"logits/rejected": -1.2067253589630127,
"logps/chosen": -108.2742691040039,
"logps/rejected": -325.4738464355469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2910315990448,
"rewards/margins": 18.40937042236328,
"rewards/rejected": -15.118340492248535,
"step": 5050
},
{
"epoch": 2.0461912479740683,
"eval_logits/chosen": -0.9814975261688232,
"eval_logits/rejected": -1.2026540040969849,
"eval_logps/chosen": -109.00423431396484,
"eval_logps/rejected": -322.4521484375,
"eval_loss": 5.9376258576548935e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2007694244384766,
"eval_rewards/margins": 18.151708602905273,
"eval_rewards/rejected": -14.950939178466797,
"eval_runtime": 660.3857,
"eval_samples_per_second": 11.212,
"eval_steps_per_second": 0.624,
"step": 5050
},
{
"epoch": 2.0502431118314424,
"grad_norm": 2.619849965412868e-06,
"learning_rate": 3.517934864175297e-06,
"logits/chosen": -0.9573184847831726,
"logits/rejected": -1.1907227039337158,
"logps/chosen": -107.8059310913086,
"logps/rejected": -323.6286315917969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.290532350540161,
"rewards/margins": 18.276216506958008,
"rewards/rejected": -14.985685348510742,
"step": 5060
},
{
"epoch": 2.054294975688817,
"grad_norm": 4.405702384246979e-06,
"learning_rate": 3.5029266096353e-06,
"logits/chosen": -0.967184841632843,
"logits/rejected": -1.199464201927185,
"logps/chosen": -107.3981704711914,
"logps/rejected": -323.74755859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2805373668670654,
"rewards/margins": 18.303253173828125,
"rewards/rejected": -15.022714614868164,
"step": 5070
},
{
"epoch": 2.0583468395461915,
"grad_norm": 7.713757440797053e-06,
"learning_rate": 3.487918355095303e-06,
"logits/chosen": -0.9631035327911377,
"logits/rejected": -1.2093658447265625,
"logps/chosen": -108.29039001464844,
"logps/rejected": -323.6645812988281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2754151821136475,
"rewards/margins": 18.31420135498047,
"rewards/rejected": -15.038785934448242,
"step": 5080
},
{
"epoch": 2.0623987034035656,
"grad_norm": 1.4878126421535853e-05,
"learning_rate": 3.4729101005553055e-06,
"logits/chosen": -0.9696425795555115,
"logits/rejected": -1.2049078941345215,
"logps/chosen": -109.19393920898438,
"logps/rejected": -324.4574890136719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.255068063735962,
"rewards/margins": 18.34342384338379,
"rewards/rejected": -15.088356971740723,
"step": 5090
},
{
"epoch": 2.06645056726094,
"grad_norm": 2.702791562114726e-06,
"learning_rate": 3.4579018460153085e-06,
"logits/chosen": -0.9682046175003052,
"logits/rejected": -1.2046129703521729,
"logps/chosen": -107.95789337158203,
"logps/rejected": -324.50592041015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.274998188018799,
"rewards/margins": 18.40148162841797,
"rewards/rejected": -15.126481056213379,
"step": 5100
},
{
"epoch": 2.06645056726094,
"eval_logits/chosen": -0.9781537055969238,
"eval_logits/rejected": -1.2004783153533936,
"eval_logps/chosen": -108.95247650146484,
"eval_logps/rejected": -322.5989685058594,
"eval_loss": 5.821843984676889e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2059435844421387,
"eval_rewards/margins": 18.17156410217285,
"eval_rewards/rejected": -14.965620994567871,
"eval_runtime": 660.3943,
"eval_samples_per_second": 11.211,
"eval_steps_per_second": 0.624,
"step": 5100
},
{
"epoch": 2.0705024311183142,
"grad_norm": 7.003120117587969e-06,
"learning_rate": 3.4428935914753115e-06,
"logits/chosen": -0.9700896143913269,
"logits/rejected": -1.196824312210083,
"logps/chosen": -109.01053619384766,
"logps/rejected": -323.7058410644531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2263805866241455,
"rewards/margins": 18.2646484375,
"rewards/rejected": -15.0382661819458,
"step": 5110
},
{
"epoch": 2.0745542949756888,
"grad_norm": 4.903948138235137e-06,
"learning_rate": 3.427885336935315e-06,
"logits/chosen": -0.9765785336494446,
"logits/rejected": -1.1949435472488403,
"logps/chosen": -108.376220703125,
"logps/rejected": -322.2400817871094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2593820095062256,
"rewards/margins": 18.187374114990234,
"rewards/rejected": -14.92799186706543,
"step": 5120
},
{
"epoch": 2.0786061588330633,
"grad_norm": 6.223580385267269e-06,
"learning_rate": 3.412877082395318e-06,
"logits/chosen": -0.9860423803329468,
"logits/rejected": -1.2049118280410767,
"logps/chosen": -108.06117248535156,
"logps/rejected": -323.1683654785156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.259824514389038,
"rewards/margins": 18.323781967163086,
"rewards/rejected": -15.063958168029785,
"step": 5130
},
{
"epoch": 2.0826580226904374,
"grad_norm": 5.068562131782528e-06,
"learning_rate": 3.3978688278553205e-06,
"logits/chosen": -0.9900915026664734,
"logits/rejected": -1.203590750694275,
"logps/chosen": -108.75131225585938,
"logps/rejected": -322.52978515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.251455783843994,
"rewards/margins": 18.286420822143555,
"rewards/rejected": -15.034967422485352,
"step": 5140
},
{
"epoch": 2.086709886547812,
"grad_norm": 6.225033757800702e-06,
"learning_rate": 3.3828605733153235e-06,
"logits/chosen": -0.9706783294677734,
"logits/rejected": -1.197087049484253,
"logps/chosen": -107.81609344482422,
"logps/rejected": -324.9122009277344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3132641315460205,
"rewards/margins": 18.430654525756836,
"rewards/rejected": -15.117389678955078,
"step": 5150
},
{
"epoch": 2.086709886547812,
"eval_logits/chosen": -0.9727792143821716,
"eval_logits/rejected": -1.1945335865020752,
"eval_logps/chosen": -108.9156723022461,
"eval_logps/rejected": -322.7347412109375,
"eval_loss": 5.735015307095637e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.209625005722046,
"eval_rewards/margins": 18.18882179260254,
"eval_rewards/rejected": -14.979195594787598,
"eval_runtime": 660.3492,
"eval_samples_per_second": 11.212,
"eval_steps_per_second": 0.624,
"step": 5150
},
{
"epoch": 2.0907617504051865,
"grad_norm": 1.959013388841413e-06,
"learning_rate": 3.3678523187753265e-06,
"logits/chosen": -0.9617520570755005,
"logits/rejected": -1.209423303604126,
"logps/chosen": -107.73186492919922,
"logps/rejected": -325.5774841308594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.303151845932007,
"rewards/margins": 18.433210372924805,
"rewards/rejected": -15.130060195922852,
"step": 5160
},
{
"epoch": 2.0948136142625606,
"grad_norm": 1.271650762646459e-05,
"learning_rate": 3.35284406423533e-06,
"logits/chosen": -0.9642054438591003,
"logits/rejected": -1.1936373710632324,
"logps/chosen": -107.96542358398438,
"logps/rejected": -324.3305358886719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.314751625061035,
"rewards/margins": 18.342897415161133,
"rewards/rejected": -15.028146743774414,
"step": 5170
},
{
"epoch": 2.098865478119935,
"grad_norm": 3.4079785109497607e-06,
"learning_rate": 3.337835809695333e-06,
"logits/chosen": -0.975328803062439,
"logits/rejected": -1.1903932094573975,
"logps/chosen": -108.29900360107422,
"logps/rejected": -323.8041687011719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.284480571746826,
"rewards/margins": 18.29322052001953,
"rewards/rejected": -15.008742332458496,
"step": 5180
},
{
"epoch": 2.1029173419773097,
"grad_norm": 5.6164235502365045e-06,
"learning_rate": 3.3228275551553356e-06,
"logits/chosen": -0.9733341932296753,
"logits/rejected": -1.199615478515625,
"logps/chosen": -108.6965560913086,
"logps/rejected": -323.5589904785156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.225916624069214,
"rewards/margins": 18.289762496948242,
"rewards/rejected": -15.063846588134766,
"step": 5190
},
{
"epoch": 2.106969205834684,
"grad_norm": 1.4267629012465477e-05,
"learning_rate": 3.3078193006153386e-06,
"logits/chosen": -0.97093266248703,
"logits/rejected": -1.1911667585372925,
"logps/chosen": -108.9158706665039,
"logps/rejected": -323.22509765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.261925458908081,
"rewards/margins": 18.200176239013672,
"rewards/rejected": -14.938252449035645,
"step": 5200
},
{
"epoch": 2.106969205834684,
"eval_logits/chosen": -0.9828716516494751,
"eval_logits/rejected": -1.2042107582092285,
"eval_logps/chosen": -108.9614028930664,
"eval_logps/rejected": -323.08966064453125,
"eval_loss": 5.55416228564809e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.205052614212036,
"eval_rewards/margins": 18.219741821289062,
"eval_rewards/rejected": -15.014689445495605,
"eval_runtime": 660.2431,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 5200
},
{
"epoch": 2.1110210696920584,
"grad_norm": 6.4765258684928995e-06,
"learning_rate": 3.2928110460753416e-06,
"logits/chosen": -0.9671388268470764,
"logits/rejected": -1.1946061849594116,
"logps/chosen": -107.32749938964844,
"logps/rejected": -322.5291442871094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.310100793838501,
"rewards/margins": 18.20550537109375,
"rewards/rejected": -14.895402908325195,
"step": 5210
},
{
"epoch": 2.115072933549433,
"grad_norm": 4.7925177568686195e-06,
"learning_rate": 3.277802791535345e-06,
"logits/chosen": -0.9682778120040894,
"logits/rejected": -1.2034763097763062,
"logps/chosen": -107.63131713867188,
"logps/rejected": -323.91400146484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2772161960601807,
"rewards/margins": 18.31756591796875,
"rewards/rejected": -15.040349006652832,
"step": 5220
},
{
"epoch": 2.119124797406807,
"grad_norm": 3.860869583149906e-06,
"learning_rate": 3.262794536995348e-06,
"logits/chosen": -0.9654537439346313,
"logits/rejected": -1.1890361309051514,
"logps/chosen": -107.89448547363281,
"logps/rejected": -325.5076904296875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2871017456054688,
"rewards/margins": 18.467273712158203,
"rewards/rejected": -15.180171966552734,
"step": 5230
},
{
"epoch": 2.1231766612641816,
"grad_norm": 4.159672243986279e-06,
"learning_rate": 3.2477862824553506e-06,
"logits/chosen": -0.9758961796760559,
"logits/rejected": -1.1945488452911377,
"logps/chosen": -108.34893035888672,
"logps/rejected": -323.9273681640625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.283567190170288,
"rewards/margins": 18.373409271240234,
"rewards/rejected": -15.089844703674316,
"step": 5240
},
{
"epoch": 2.1272285251215557,
"grad_norm": 6.8004319473402575e-06,
"learning_rate": 3.2327780279153536e-06,
"logits/chosen": -0.9748916029930115,
"logits/rejected": -1.1907340288162231,
"logps/chosen": -107.96294403076172,
"logps/rejected": -323.5213317871094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2687954902648926,
"rewards/margins": 18.268680572509766,
"rewards/rejected": -14.999883651733398,
"step": 5250
},
{
"epoch": 2.1272285251215557,
"eval_logits/chosen": -0.98344886302948,
"eval_logits/rejected": -1.2038557529449463,
"eval_logps/chosen": -108.96256256103516,
"eval_logps/rejected": -323.3043518066406,
"eval_loss": 5.466652197583244e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.204936981201172,
"eval_rewards/margins": 18.241092681884766,
"eval_rewards/rejected": -15.036153793334961,
"eval_runtime": 660.1991,
"eval_samples_per_second": 11.215,
"eval_steps_per_second": 0.624,
"step": 5250
},
{
"epoch": 2.1312803889789302,
"grad_norm": 1.8782106963044498e-06,
"learning_rate": 3.2177697733753566e-06,
"logits/chosen": -0.966810941696167,
"logits/rejected": -1.203284502029419,
"logps/chosen": -107.60391998291016,
"logps/rejected": -323.45367431640625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.270557165145874,
"rewards/margins": 18.329856872558594,
"rewards/rejected": -15.059297561645508,
"step": 5260
},
{
"epoch": 2.135332252836305,
"grad_norm": 2.830571929735015e-06,
"learning_rate": 3.2027615188353596e-06,
"logits/chosen": -0.9731746315956116,
"logits/rejected": -1.197896122932434,
"logps/chosen": -108.33968353271484,
"logps/rejected": -323.3170166015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.293929100036621,
"rewards/margins": 18.29970359802246,
"rewards/rejected": -15.005772590637207,
"step": 5270
},
{
"epoch": 2.139384116693679,
"grad_norm": 4.248033746989677e-06,
"learning_rate": 3.187753264295363e-06,
"logits/chosen": -0.9772968888282776,
"logits/rejected": -1.196101427078247,
"logps/chosen": -108.44367980957031,
"logps/rejected": -322.9093017578125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.244723081588745,
"rewards/margins": 18.279142379760742,
"rewards/rejected": -15.034419059753418,
"step": 5280
},
{
"epoch": 2.1434359805510534,
"grad_norm": 1.4391961485671345e-05,
"learning_rate": 3.172745009755366e-06,
"logits/chosen": -0.9665384888648987,
"logits/rejected": -1.1853383779525757,
"logps/chosen": -108.29757690429688,
"logps/rejected": -324.8900451660156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2725987434387207,
"rewards/margins": 18.356849670410156,
"rewards/rejected": -15.084248542785645,
"step": 5290
},
{
"epoch": 2.147487844408428,
"grad_norm": 1.2224590136611369e-05,
"learning_rate": 3.1577367552153686e-06,
"logits/chosen": -0.9722302556037903,
"logits/rejected": -1.1998592615127563,
"logps/chosen": -107.06742858886719,
"logps/rejected": -324.5314025878906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.324317455291748,
"rewards/margins": 18.51911735534668,
"rewards/rejected": -15.19480037689209,
"step": 5300
},
{
"epoch": 2.147487844408428,
"eval_logits/chosen": -0.9770769476890564,
"eval_logits/rejected": -1.1975880861282349,
"eval_logps/chosen": -108.89502716064453,
"eval_logps/rejected": -323.43988037109375,
"eval_loss": 5.37000168776558e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.211690664291382,
"eval_rewards/margins": 18.26140022277832,
"eval_rewards/rejected": -15.049712181091309,
"eval_runtime": 660.2684,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 5300
},
{
"epoch": 2.151539708265802,
"grad_norm": 2.9248267310322262e-06,
"learning_rate": 3.1427285006753716e-06,
"logits/chosen": -0.973681628704071,
"logits/rejected": -1.1873669624328613,
"logps/chosen": -107.95748901367188,
"logps/rejected": -325.4280700683594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2351701259613037,
"rewards/margins": 18.447160720825195,
"rewards/rejected": -15.211992263793945,
"step": 5310
},
{
"epoch": 2.1555915721231766,
"grad_norm": 1.981665036510094e-06,
"learning_rate": 3.1277202461353746e-06,
"logits/chosen": -0.9693456888198853,
"logits/rejected": -1.2035704851150513,
"logps/chosen": -108.5029296875,
"logps/rejected": -323.0021667480469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2811708450317383,
"rewards/margins": 18.27227210998535,
"rewards/rejected": -14.991100311279297,
"step": 5320
},
{
"epoch": 2.159643435980551,
"grad_norm": 1.3219345191828324e-06,
"learning_rate": 3.112711991595378e-06,
"logits/chosen": -0.9648329615592957,
"logits/rejected": -1.1890065670013428,
"logps/chosen": -108.34164428710938,
"logps/rejected": -324.6376037597656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.306445360183716,
"rewards/margins": 18.42658042907715,
"rewards/rejected": -15.120135307312012,
"step": 5330
},
{
"epoch": 2.1636952998379253,
"grad_norm": 3.4673894333536737e-06,
"learning_rate": 3.097703737055381e-06,
"logits/chosen": -0.9712263345718384,
"logits/rejected": -1.203616976737976,
"logps/chosen": -108.90235137939453,
"logps/rejected": -324.6282043457031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2427356243133545,
"rewards/margins": 18.48871612548828,
"rewards/rejected": -15.24598217010498,
"step": 5340
},
{
"epoch": 2.1677471636953,
"grad_norm": 3.3253777473873924e-06,
"learning_rate": 3.0826954825153836e-06,
"logits/chosen": -0.964225709438324,
"logits/rejected": -1.1941708326339722,
"logps/chosen": -106.68071746826172,
"logps/rejected": -323.4434509277344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3373284339904785,
"rewards/margins": 18.364030838012695,
"rewards/rejected": -15.026701927185059,
"step": 5350
},
{
"epoch": 2.1677471636953,
"eval_logits/chosen": -0.9809548854827881,
"eval_logits/rejected": -1.2015058994293213,
"eval_logps/chosen": -108.94307708740234,
"eval_logps/rejected": -323.71051025390625,
"eval_loss": 5.263171587444049e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2068848609924316,
"eval_rewards/margins": 18.283662796020508,
"eval_rewards/rejected": -15.076776504516602,
"eval_runtime": 660.3412,
"eval_samples_per_second": 11.212,
"eval_steps_per_second": 0.624,
"step": 5350
},
{
"epoch": 2.1717990275526744,
"grad_norm": 1.5193423905657255e-06,
"learning_rate": 3.0676872279753866e-06,
"logits/chosen": -0.9592820405960083,
"logits/rejected": -1.2157377004623413,
"logps/chosen": -107.88704681396484,
"logps/rejected": -324.0573425292969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.274031162261963,
"rewards/margins": 18.420141220092773,
"rewards/rejected": -15.146111488342285,
"step": 5360
},
{
"epoch": 2.1758508914100485,
"grad_norm": 5.895638878428144e-06,
"learning_rate": 3.0526789734353896e-06,
"logits/chosen": -0.9689838290214539,
"logits/rejected": -1.1949576139450073,
"logps/chosen": -108.58103942871094,
"logps/rejected": -323.4375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.242347478866577,
"rewards/margins": 18.375865936279297,
"rewards/rejected": -15.133517265319824,
"step": 5370
},
{
"epoch": 2.179902755267423,
"grad_norm": 2.4637804472149583e-06,
"learning_rate": 3.0376707188953926e-06,
"logits/chosen": -0.9821479916572571,
"logits/rejected": -1.2009549140930176,
"logps/chosen": -107.96622467041016,
"logps/rejected": -325.5393371582031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3129758834838867,
"rewards/margins": 18.526084899902344,
"rewards/rejected": -15.213109970092773,
"step": 5380
},
{
"epoch": 2.1839546191247976,
"grad_norm": 2.9899647415732034e-06,
"learning_rate": 3.022662464355396e-06,
"logits/chosen": -0.9616569876670837,
"logits/rejected": -1.1876670122146606,
"logps/chosen": -107.5402603149414,
"logps/rejected": -326.1862487792969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.279315710067749,
"rewards/margins": 18.54355239868164,
"rewards/rejected": -15.264236450195312,
"step": 5390
},
{
"epoch": 2.1880064829821717,
"grad_norm": 2.1008820567658404e-06,
"learning_rate": 3.0076542098153986e-06,
"logits/chosen": -0.9718561768531799,
"logits/rejected": -1.2166821956634521,
"logps/chosen": -107.14775085449219,
"logps/rejected": -326.3721618652344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.334036111831665,
"rewards/margins": 18.727115631103516,
"rewards/rejected": -15.393081665039062,
"step": 5400
},
{
"epoch": 2.1880064829821717,
"eval_logits/chosen": -0.9820877313613892,
"eval_logits/rejected": -1.2017114162445068,
"eval_logps/chosen": -108.98477172851562,
"eval_logps/rejected": -323.9667663574219,
"eval_loss": 5.144721271221897e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2027156352996826,
"eval_rewards/margins": 18.30511474609375,
"eval_rewards/rejected": -15.102398872375488,
"eval_runtime": 660.2732,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 5400
},
{
"epoch": 2.1920583468395463,
"grad_norm": 1.4790945215281681e-06,
"learning_rate": 2.9926459552754016e-06,
"logits/chosen": -0.9718219041824341,
"logits/rejected": -1.2032488584518433,
"logps/chosen": -108.09237670898438,
"logps/rejected": -326.63763427734375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2692630290985107,
"rewards/margins": 18.560598373413086,
"rewards/rejected": -15.291335105895996,
"step": 5410
},
{
"epoch": 2.1961102106969204,
"grad_norm": 8.114738193398807e-06,
"learning_rate": 2.9776377007354046e-06,
"logits/chosen": -0.9763138890266418,
"logits/rejected": -1.1922379732131958,
"logps/chosen": -108.22923278808594,
"logps/rejected": -324.1781311035156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2659127712249756,
"rewards/margins": 18.3449649810791,
"rewards/rejected": -15.07905101776123,
"step": 5420
},
{
"epoch": 2.200162074554295,
"grad_norm": 8.105959750537295e-06,
"learning_rate": 2.9626294461954076e-06,
"logits/chosen": -0.9747027158737183,
"logits/rejected": -1.19993257522583,
"logps/chosen": -107.4315414428711,
"logps/rejected": -324.6253356933594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.30452299118042,
"rewards/margins": 18.396106719970703,
"rewards/rejected": -15.091582298278809,
"step": 5430
},
{
"epoch": 2.2042139384116695,
"grad_norm": 2.2363303742167773e-06,
"learning_rate": 2.947621191655411e-06,
"logits/chosen": -0.9820188283920288,
"logits/rejected": -1.1995137929916382,
"logps/chosen": -108.4027328491211,
"logps/rejected": -325.0263671875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2489047050476074,
"rewards/margins": 18.37090492248535,
"rewards/rejected": -15.121999740600586,
"step": 5440
},
{
"epoch": 2.2082658022690436,
"grad_norm": 2.9256420930323657e-06,
"learning_rate": 2.9326129371154137e-06,
"logits/chosen": -0.9694913625717163,
"logits/rejected": -1.2016642093658447,
"logps/chosen": -108.28238677978516,
"logps/rejected": -325.5596618652344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.278430461883545,
"rewards/margins": 18.484956741333008,
"rewards/rejected": -15.206525802612305,
"step": 5450
},
{
"epoch": 2.2082658022690436,
"eval_logits/chosen": -0.978270947933197,
"eval_logits/rejected": -1.1978684663772583,
"eval_logps/chosen": -108.904296875,
"eval_logps/rejected": -323.9855651855469,
"eval_loss": 5.096885757893688e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2107620239257812,
"eval_rewards/margins": 18.31504249572754,
"eval_rewards/rejected": -15.104281425476074,
"eval_runtime": 660.2106,
"eval_samples_per_second": 11.215,
"eval_steps_per_second": 0.624,
"step": 5450
},
{
"epoch": 2.212317666126418,
"grad_norm": 8.608948519395199e-06,
"learning_rate": 2.9176046825754167e-06,
"logits/chosen": -0.9615970849990845,
"logits/rejected": -1.193094253540039,
"logps/chosen": -108.58715057373047,
"logps/rejected": -324.37799072265625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2963144779205322,
"rewards/margins": 18.419776916503906,
"rewards/rejected": -15.123462677001953,
"step": 5460
},
{
"epoch": 2.2163695299837927,
"grad_norm": 5.135224000696326e-06,
"learning_rate": 2.9025964280354197e-06,
"logits/chosen": -0.9636695981025696,
"logits/rejected": -1.1896305084228516,
"logps/chosen": -107.08964538574219,
"logps/rejected": -324.77850341796875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3007524013519287,
"rewards/margins": 18.336854934692383,
"rewards/rejected": -15.036102294921875,
"step": 5470
},
{
"epoch": 2.2204213938411668,
"grad_norm": 6.5549256760277785e-06,
"learning_rate": 2.8875881734954227e-06,
"logits/chosen": -0.9712886810302734,
"logits/rejected": -1.2023524045944214,
"logps/chosen": -108.814453125,
"logps/rejected": -326.064453125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2594046592712402,
"rewards/margins": 18.47957992553711,
"rewards/rejected": -15.220173835754395,
"step": 5480
},
{
"epoch": 2.2244732576985413,
"grad_norm": 3.4416129892633762e-06,
"learning_rate": 2.872579918955426e-06,
"logits/chosen": -0.9645144939422607,
"logits/rejected": -1.1906704902648926,
"logps/chosen": -108.19139862060547,
"logps/rejected": -325.2495422363281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.277437686920166,
"rewards/margins": 18.48769760131836,
"rewards/rejected": -15.210260391235352,
"step": 5490
},
{
"epoch": 2.228525121555916,
"grad_norm": 5.491361207532464e-06,
"learning_rate": 2.8575716644154287e-06,
"logits/chosen": -0.961846113204956,
"logits/rejected": -1.190273642539978,
"logps/chosen": -107.55595397949219,
"logps/rejected": -326.3609924316406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.284193515777588,
"rewards/margins": 18.561208724975586,
"rewards/rejected": -15.277012825012207,
"step": 5500
},
{
"epoch": 2.228525121555916,
"eval_logits/chosen": -0.9809632301330566,
"eval_logits/rejected": -1.2005460262298584,
"eval_logps/chosen": -108.89672088623047,
"eval_logps/rejected": -324.2535400390625,
"eval_loss": 4.9650584088567484e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2115213871002197,
"eval_rewards/margins": 18.342599868774414,
"eval_rewards/rejected": -15.131077766418457,
"eval_runtime": 660.3362,
"eval_samples_per_second": 11.212,
"eval_steps_per_second": 0.624,
"step": 5500
},
{
"epoch": 2.23257698541329,
"grad_norm": 2.52136965173122e-06,
"learning_rate": 2.8425634098754317e-06,
"logits/chosen": -0.9671697616577148,
"logits/rejected": -1.1808946132659912,
"logps/chosen": -107.77230072021484,
"logps/rejected": -325.3393249511719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2875375747680664,
"rewards/margins": 18.484088897705078,
"rewards/rejected": -15.196552276611328,
"step": 5510
},
{
"epoch": 2.2366288492706645,
"grad_norm": 6.712255071761319e-06,
"learning_rate": 2.8275551553354347e-06,
"logits/chosen": -0.9800280928611755,
"logits/rejected": -1.184509515762329,
"logps/chosen": -108.50052642822266,
"logps/rejected": -325.2090759277344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2751975059509277,
"rewards/margins": 18.468046188354492,
"rewards/rejected": -15.192850112915039,
"step": 5520
},
{
"epoch": 2.240680713128039,
"grad_norm": 5.123366918269312e-06,
"learning_rate": 2.8125469007954377e-06,
"logits/chosen": -0.9732328653335571,
"logits/rejected": -1.1967648267745972,
"logps/chosen": -108.0207748413086,
"logps/rejected": -324.44873046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2871508598327637,
"rewards/margins": 18.425617218017578,
"rewards/rejected": -15.138466835021973,
"step": 5530
},
{
"epoch": 2.244732576985413,
"grad_norm": 1.9682167931023287e-06,
"learning_rate": 2.7975386462554403e-06,
"logits/chosen": -0.9738643765449524,
"logits/rejected": -1.2164760828018188,
"logps/chosen": -108.87864685058594,
"logps/rejected": -325.7362976074219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.29534912109375,
"rewards/margins": 18.526559829711914,
"rewards/rejected": -15.231209754943848,
"step": 5540
},
{
"epoch": 2.2487844408427877,
"grad_norm": 3.375124833837617e-06,
"learning_rate": 2.782530391715444e-06,
"logits/chosen": -0.9724031686782837,
"logits/rejected": -1.215806484222412,
"logps/chosen": -108.00154876708984,
"logps/rejected": -324.9290466308594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.30460262298584,
"rewards/margins": 18.49542999267578,
"rewards/rejected": -15.190828323364258,
"step": 5550
},
{
"epoch": 2.2487844408427877,
"eval_logits/chosen": -1.0021088123321533,
"eval_logits/rejected": -1.216044306755066,
"eval_logps/chosen": -109.04871368408203,
"eval_logps/rejected": -324.6860656738281,
"eval_loss": 4.834061329006545e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.196322202682495,
"eval_rewards/margins": 18.370651245117188,
"eval_rewards/rejected": -15.174327850341797,
"eval_runtime": 660.2646,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 5550
},
{
"epoch": 2.2528363047001623,
"grad_norm": 4.11156997870421e-06,
"learning_rate": 2.7675221371754467e-06,
"logits/chosen": -0.959725022315979,
"logits/rejected": -1.182191252708435,
"logps/chosen": -109.10403442382812,
"logps/rejected": -325.5591125488281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.234382390975952,
"rewards/margins": 18.426700592041016,
"rewards/rejected": -15.192317962646484,
"step": 5560
},
{
"epoch": 2.2568881685575364,
"grad_norm": 2.655802745721303e-06,
"learning_rate": 2.7525138826354497e-06,
"logits/chosen": -0.9779143929481506,
"logits/rejected": -1.2030993700027466,
"logps/chosen": -108.81770324707031,
"logps/rejected": -326.4799499511719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2410504817962646,
"rewards/margins": 18.449491500854492,
"rewards/rejected": -15.208441734313965,
"step": 5570
},
{
"epoch": 2.260940032414911,
"grad_norm": 4.91537412017351e-06,
"learning_rate": 2.7375056280954527e-06,
"logits/chosen": -0.9816739559173584,
"logits/rejected": -1.1951929330825806,
"logps/chosen": -108.85587310791016,
"logps/rejected": -324.6351623535156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.281838893890381,
"rewards/margins": 18.444608688354492,
"rewards/rejected": -15.16277027130127,
"step": 5580
},
{
"epoch": 2.264991896272285,
"grad_norm": 4.137316409469349e-06,
"learning_rate": 2.7224973735554557e-06,
"logits/chosen": -0.9698922634124756,
"logits/rejected": -1.201400876045227,
"logps/chosen": -109.29122924804688,
"logps/rejected": -324.98504638671875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.235358715057373,
"rewards/margins": 18.49024200439453,
"rewards/rejected": -15.254883766174316,
"step": 5590
},
{
"epoch": 2.2690437601296596,
"grad_norm": 3.5918981211580103e-06,
"learning_rate": 2.707489119015459e-06,
"logits/chosen": -0.9636077284812927,
"logits/rejected": -1.1759008169174194,
"logps/chosen": -107.51180267333984,
"logps/rejected": -322.8291320800781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.270862102508545,
"rewards/margins": 18.282569885253906,
"rewards/rejected": -15.011709213256836,
"step": 5600
},
{
"epoch": 2.2690437601296596,
"eval_logits/chosen": -0.9744959473609924,
"eval_logits/rejected": -1.1937018632888794,
"eval_logps/chosen": -108.83885192871094,
"eval_logps/rejected": -324.4743347167969,
"eval_loss": 4.8358597126707537e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2173092365264893,
"eval_rewards/margins": 18.37046241760254,
"eval_rewards/rejected": -15.153154373168945,
"eval_runtime": 660.3298,
"eval_samples_per_second": 11.213,
"eval_steps_per_second": 0.624,
"step": 5600
},
{
"epoch": 2.273095623987034,
"grad_norm": 5.159456122783013e-06,
"learning_rate": 2.6924808644754617e-06,
"logits/chosen": -0.9723551273345947,
"logits/rejected": -1.2006233930587769,
"logps/chosen": -108.35022735595703,
"logps/rejected": -326.8168640136719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2803404331207275,
"rewards/margins": 18.527671813964844,
"rewards/rejected": -15.247331619262695,
"step": 5610
},
{
"epoch": 2.2771474878444082,
"grad_norm": 4.119930508750258e-06,
"learning_rate": 2.6774726099354647e-06,
"logits/chosen": -0.9690415859222412,
"logits/rejected": -1.2194011211395264,
"logps/chosen": -107.32176208496094,
"logps/rejected": -327.4947509765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.294969081878662,
"rewards/margins": 18.68514060974121,
"rewards/rejected": -15.39017105102539,
"step": 5620
},
{
"epoch": 2.281199351701783,
"grad_norm": 3.2292373361997306e-06,
"learning_rate": 2.6624643553954677e-06,
"logits/chosen": -0.9724549055099487,
"logits/rejected": -1.1870734691619873,
"logps/chosen": -109.0750732421875,
"logps/rejected": -324.3908996582031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2350621223449707,
"rewards/margins": 18.347484588623047,
"rewards/rejected": -15.112425804138184,
"step": 5630
},
{
"epoch": 2.2852512155591573,
"grad_norm": 1.92338734450459e-06,
"learning_rate": 2.6474561008554707e-06,
"logits/chosen": -0.9774371981620789,
"logits/rejected": -1.1965054273605347,
"logps/chosen": -108.20509338378906,
"logps/rejected": -325.67022705078125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2764956951141357,
"rewards/margins": 18.494312286376953,
"rewards/rejected": -15.217818260192871,
"step": 5640
},
{
"epoch": 2.2893030794165314,
"grad_norm": 3.3345258998451754e-06,
"learning_rate": 2.6324478463154733e-06,
"logits/chosen": -0.9700595736503601,
"logits/rejected": -1.1860406398773193,
"logps/chosen": -108.3021469116211,
"logps/rejected": -325.4642333984375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.295811176300049,
"rewards/margins": 18.52042579650879,
"rewards/rejected": -15.224616050720215,
"step": 5650
},
{
"epoch": 2.2893030794165314,
"eval_logits/chosen": -0.9985373616218567,
"eval_logits/rejected": -1.2101703882217407,
"eval_logps/chosen": -109.0257568359375,
"eval_logps/rejected": -324.98095703125,
"eval_loss": 4.685679755311867e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.198617696762085,
"eval_rewards/margins": 18.40243911743164,
"eval_rewards/rejected": -15.203819274902344,
"eval_runtime": 660.2906,
"eval_samples_per_second": 11.213,
"eval_steps_per_second": 0.624,
"step": 5650
},
{
"epoch": 2.293354943273906,
"grad_norm": 2.9136933790141484e-06,
"learning_rate": 2.6174395917754767e-06,
"logits/chosen": -0.9681564569473267,
"logits/rejected": -1.2030173540115356,
"logps/chosen": -108.33345031738281,
"logps/rejected": -326.4482727050781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2615244388580322,
"rewards/margins": 18.537817001342773,
"rewards/rejected": -15.27629280090332,
"step": 5660
},
{
"epoch": 2.2974068071312805,
"grad_norm": 3.6357732824399136e-06,
"learning_rate": 2.6024313372354797e-06,
"logits/chosen": -0.9570192694664001,
"logits/rejected": -1.1811176538467407,
"logps/chosen": -107.85875701904297,
"logps/rejected": -325.16668701171875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2770462036132812,
"rewards/margins": 18.38956069946289,
"rewards/rejected": -15.112512588500977,
"step": 5670
},
{
"epoch": 2.3014586709886546,
"grad_norm": 5.2873547247145325e-06,
"learning_rate": 2.5874230826954827e-06,
"logits/chosen": -0.9654983282089233,
"logits/rejected": -1.2084449529647827,
"logps/chosen": -107.34917449951172,
"logps/rejected": -327.28460693359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3275811672210693,
"rewards/margins": 18.592912673950195,
"rewards/rejected": -15.265332221984863,
"step": 5680
},
{
"epoch": 2.305510534846029,
"grad_norm": 1.9631031591416104e-06,
"learning_rate": 2.5724148281554857e-06,
"logits/chosen": -0.9772531390190125,
"logits/rejected": -1.1914225816726685,
"logps/chosen": -108.16785430908203,
"logps/rejected": -325.9184265136719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.30417799949646,
"rewards/margins": 18.541934967041016,
"rewards/rejected": -15.23775863647461,
"step": 5690
},
{
"epoch": 2.3095623987034037,
"grad_norm": 3.304847723484272e-06,
"learning_rate": 2.5574065736154883e-06,
"logits/chosen": -0.9695168733596802,
"logits/rejected": -1.1988223791122437,
"logps/chosen": -107.34342193603516,
"logps/rejected": -326.7132873535156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2983932495117188,
"rewards/margins": 18.564241409301758,
"rewards/rejected": -15.265847206115723,
"step": 5700
},
{
"epoch": 2.3095623987034037,
"eval_logits/chosen": -0.9801631569862366,
"eval_logits/rejected": -1.1987709999084473,
"eval_logps/chosen": -108.88590240478516,
"eval_logps/rejected": -324.906982421875,
"eval_loss": 4.6702645306595514e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2126026153564453,
"eval_rewards/margins": 18.409025192260742,
"eval_rewards/rejected": -15.19642162322998,
"eval_runtime": 660.2445,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 5700
},
{
"epoch": 2.313614262560778,
"grad_norm": 2.3572217742184876e-06,
"learning_rate": 2.5423983190754918e-06,
"logits/chosen": -0.9702841639518738,
"logits/rejected": -1.180479645729065,
"logps/chosen": -108.51237487792969,
"logps/rejected": -324.76800537109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.285172462463379,
"rewards/margins": 18.476665496826172,
"rewards/rejected": -15.191494941711426,
"step": 5710
},
{
"epoch": 2.3176661264181524,
"grad_norm": 6.990411748120096e-06,
"learning_rate": 2.5273900645354948e-06,
"logits/chosen": -0.9684751033782959,
"logits/rejected": -1.1934318542480469,
"logps/chosen": -107.60021209716797,
"logps/rejected": -325.96014404296875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2991745471954346,
"rewards/margins": 18.551288604736328,
"rewards/rejected": -15.252111434936523,
"step": 5720
},
{
"epoch": 2.321717990275527,
"grad_norm": 2.516685981390765e-06,
"learning_rate": 2.5123818099954978e-06,
"logits/chosen": -0.9524480104446411,
"logits/rejected": -1.1807420253753662,
"logps/chosen": -107.41260528564453,
"logps/rejected": -326.22760009765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.293351888656616,
"rewards/margins": 18.598726272583008,
"rewards/rejected": -15.305375099182129,
"step": 5730
},
{
"epoch": 2.325769854132901,
"grad_norm": 3.3768424145819154e-06,
"learning_rate": 2.4973735554555008e-06,
"logits/chosen": -0.9682026505470276,
"logits/rejected": -1.1985716819763184,
"logps/chosen": -107.61695098876953,
"logps/rejected": -327.2942199707031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2812089920043945,
"rewards/margins": 18.669212341308594,
"rewards/rejected": -15.388001441955566,
"step": 5740
},
{
"epoch": 2.3298217179902756,
"grad_norm": 1.915690290843486e-06,
"learning_rate": 2.4823653009155038e-06,
"logits/chosen": -0.9773512482643127,
"logits/rejected": -1.214605450630188,
"logps/chosen": -106.96377563476562,
"logps/rejected": -326.2522888183594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.290473461151123,
"rewards/margins": 18.603700637817383,
"rewards/rejected": -15.313227653503418,
"step": 5750
},
{
"epoch": 2.3298217179902756,
"eval_logits/chosen": -0.9762807488441467,
"eval_logits/rejected": -1.1947269439697266,
"eval_logps/chosen": -108.86436462402344,
"eval_logps/rejected": -325.0529479980469,
"eval_loss": 4.620364535412591e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.214757204055786,
"eval_rewards/margins": 18.4257755279541,
"eval_rewards/rejected": -15.211020469665527,
"eval_runtime": 660.4013,
"eval_samples_per_second": 11.211,
"eval_steps_per_second": 0.624,
"step": 5750
},
{
"epoch": 2.3338735818476497,
"grad_norm": 2.1481794192368397e-06,
"learning_rate": 2.4673570463755068e-06,
"logits/chosen": -0.9639620184898376,
"logits/rejected": -1.1970309019088745,
"logps/chosen": -108.05836486816406,
"logps/rejected": -326.10137939453125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2734692096710205,
"rewards/margins": 18.534753799438477,
"rewards/rejected": -15.261284828186035,
"step": 5760
},
{
"epoch": 2.3379254457050243,
"grad_norm": 1.016176520352019e-05,
"learning_rate": 2.4523487918355098e-06,
"logits/chosen": -0.9729595184326172,
"logits/rejected": -1.1997188329696655,
"logps/chosen": -109.29617309570312,
"logps/rejected": -326.4288330078125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2463324069976807,
"rewards/margins": 18.55828857421875,
"rewards/rejected": -15.311954498291016,
"step": 5770
},
{
"epoch": 2.341977309562399,
"grad_norm": 2.3624691039003665e-06,
"learning_rate": 2.4373405372955128e-06,
"logits/chosen": -0.9771804809570312,
"logits/rejected": -1.1958061456680298,
"logps/chosen": -108.30644989013672,
"logps/rejected": -326.2595520019531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.318211317062378,
"rewards/margins": 18.56531524658203,
"rewards/rejected": -15.24710464477539,
"step": 5780
},
{
"epoch": 2.346029173419773,
"grad_norm": 2.9252137210278306e-06,
"learning_rate": 2.4223322827555158e-06,
"logits/chosen": -0.9689458012580872,
"logits/rejected": -1.1969562768936157,
"logps/chosen": -108.24433898925781,
"logps/rejected": -326.3622131347656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.266651153564453,
"rewards/margins": 18.574663162231445,
"rewards/rejected": -15.308012962341309,
"step": 5790
},
{
"epoch": 2.3500810372771475,
"grad_norm": 4.0559393710282166e-06,
"learning_rate": 2.4073240282155188e-06,
"logits/chosen": -0.9673594236373901,
"logits/rejected": -1.1805312633514404,
"logps/chosen": -107.56311798095703,
"logps/rejected": -326.7265625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2976877689361572,
"rewards/margins": 18.496929168701172,
"rewards/rejected": -15.199243545532227,
"step": 5800
},
{
"epoch": 2.3500810372771475,
"eval_logits/chosen": -0.9792886972427368,
"eval_logits/rejected": -1.1983641386032104,
"eval_logps/chosen": -108.89390563964844,
"eval_logps/rejected": -325.24957275390625,
"eval_loss": 4.520941132568623e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2118031978607178,
"eval_rewards/margins": 18.442487716674805,
"eval_rewards/rejected": -15.230685234069824,
"eval_runtime": 660.2343,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 5800
},
{
"epoch": 2.354132901134522,
"grad_norm": 4.35237234341912e-06,
"learning_rate": 2.392315773675522e-06,
"logits/chosen": -0.9659538865089417,
"logits/rejected": -1.1955288648605347,
"logps/chosen": -107.923095703125,
"logps/rejected": -326.80548095703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2637534141540527,
"rewards/margins": 18.59938621520996,
"rewards/rejected": -15.335634231567383,
"step": 5810
},
{
"epoch": 2.358184764991896,
"grad_norm": 4.2245274016750045e-06,
"learning_rate": 2.377307519135525e-06,
"logits/chosen": -0.9580984115600586,
"logits/rejected": -1.1906923055648804,
"logps/chosen": -106.16527557373047,
"logps/rejected": -327.8320617675781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.35353684425354,
"rewards/margins": 18.727663040161133,
"rewards/rejected": -15.374124526977539,
"step": 5820
},
{
"epoch": 2.3622366288492707,
"grad_norm": 2.9806258226017235e-06,
"learning_rate": 2.362299264595528e-06,
"logits/chosen": -0.9636472463607788,
"logits/rejected": -1.1913896799087524,
"logps/chosen": -107.6203842163086,
"logps/rejected": -326.91571044921875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.282270908355713,
"rewards/margins": 18.575559616088867,
"rewards/rejected": -15.293288230895996,
"step": 5830
},
{
"epoch": 2.366288492706645,
"grad_norm": 2.2583449208468664e-06,
"learning_rate": 2.347291010055531e-06,
"logits/chosen": -0.969796895980835,
"logits/rejected": -1.2006282806396484,
"logps/chosen": -108.57011413574219,
"logps/rejected": -326.08673095703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.253269672393799,
"rewards/margins": 18.5068302154541,
"rewards/rejected": -15.253559112548828,
"step": 5840
},
{
"epoch": 2.3703403565640193,
"grad_norm": 1.3829013596478035e-06,
"learning_rate": 2.332282755515534e-06,
"logits/chosen": -0.9795759916305542,
"logits/rejected": -1.1850019693374634,
"logps/chosen": -107.93074035644531,
"logps/rejected": -328.0816650390625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3043065071105957,
"rewards/margins": 18.752573013305664,
"rewards/rejected": -15.448267936706543,
"step": 5850
},
{
"epoch": 2.3703403565640193,
"eval_logits/chosen": -0.9805318117141724,
"eval_logits/rejected": -1.1991779804229736,
"eval_logps/chosen": -108.85604858398438,
"eval_logps/rejected": -325.3434143066406,
"eval_loss": 4.4704442814236245e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.215588092803955,
"eval_rewards/margins": 18.455656051635742,
"eval_rewards/rejected": -15.240068435668945,
"eval_runtime": 660.3357,
"eval_samples_per_second": 11.212,
"eval_steps_per_second": 0.624,
"step": 5850
},
{
"epoch": 2.374392220421394,
"grad_norm": 5.7766483223531395e-06,
"learning_rate": 2.317274500975537e-06,
"logits/chosen": -0.9744726419448853,
"logits/rejected": -1.1932746171951294,
"logps/chosen": -107.19166564941406,
"logps/rejected": -326.4128723144531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3251421451568604,
"rewards/margins": 18.652881622314453,
"rewards/rejected": -15.327739715576172,
"step": 5860
},
{
"epoch": 2.3784440842787684,
"grad_norm": 2.2121885194792412e-06,
"learning_rate": 2.30226624643554e-06,
"logits/chosen": -0.9748661518096924,
"logits/rejected": -1.1863662004470825,
"logps/chosen": -109.22135925292969,
"logps/rejected": -327.0158996582031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2374141216278076,
"rewards/margins": 18.587627410888672,
"rewards/rejected": -15.350215911865234,
"step": 5870
},
{
"epoch": 2.3824959481361425,
"grad_norm": 2.1627809019264532e-06,
"learning_rate": 2.287257991895543e-06,
"logits/chosen": -0.9746767282485962,
"logits/rejected": -1.2033764123916626,
"logps/chosen": -107.47755432128906,
"logps/rejected": -325.9498596191406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3126156330108643,
"rewards/margins": 18.64901351928711,
"rewards/rejected": -15.336398124694824,
"step": 5880
},
{
"epoch": 2.386547811993517,
"grad_norm": 3.7836791761947097e-06,
"learning_rate": 2.272249737355546e-06,
"logits/chosen": -0.9714968800544739,
"logits/rejected": -1.1881319284439087,
"logps/chosen": -108.20919799804688,
"logps/rejected": -326.4745178222656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2788820266723633,
"rewards/margins": 18.569578170776367,
"rewards/rejected": -15.290694236755371,
"step": 5890
},
{
"epoch": 2.3905996758508916,
"grad_norm": 3.031146434295806e-06,
"learning_rate": 2.257241482815549e-06,
"logits/chosen": -0.9792813658714294,
"logits/rejected": -1.1891095638275146,
"logps/chosen": -107.79071807861328,
"logps/rejected": -328.1285705566406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3049774169921875,
"rewards/margins": 18.71900749206543,
"rewards/rejected": -15.414031028747559,
"step": 5900
},
{
"epoch": 2.3905996758508916,
"eval_logits/chosen": -0.9776058793067932,
"eval_logits/rejected": -1.1963112354278564,
"eval_logps/chosen": -108.84764099121094,
"eval_logps/rejected": -325.557861328125,
"eval_loss": 4.389031715845704e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.21642804145813,
"eval_rewards/margins": 18.477937698364258,
"eval_rewards/rejected": -15.261509895324707,
"eval_runtime": 660.2995,
"eval_samples_per_second": 11.213,
"eval_steps_per_second": 0.624,
"step": 5900
},
{
"epoch": 2.3946515397082657,
"grad_norm": 1.5837250657568802e-06,
"learning_rate": 2.242233228275552e-06,
"logits/chosen": -0.9707351922988892,
"logits/rejected": -1.2112205028533936,
"logps/chosen": -107.20185089111328,
"logps/rejected": -329.29925537109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3092434406280518,
"rewards/margins": 18.771028518676758,
"rewards/rejected": -15.461783409118652,
"step": 5910
},
{
"epoch": 2.3987034035656403,
"grad_norm": 1.4248274737838074e-06,
"learning_rate": 2.227224973735555e-06,
"logits/chosen": -0.9622972011566162,
"logits/rejected": -1.1854596138000488,
"logps/chosen": -107.843994140625,
"logps/rejected": -325.9154968261719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3007805347442627,
"rewards/margins": 18.525949478149414,
"rewards/rejected": -15.225168228149414,
"step": 5920
},
{
"epoch": 2.4027552674230144,
"grad_norm": 2.0499478523561265e-06,
"learning_rate": 2.212216719195558e-06,
"logits/chosen": -0.9776632785797119,
"logits/rejected": -1.2132608890533447,
"logps/chosen": -107.80943298339844,
"logps/rejected": -326.85223388671875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3134846687316895,
"rewards/margins": 18.68709373474121,
"rewards/rejected": -15.373608589172363,
"step": 5930
},
{
"epoch": 2.406807131280389,
"grad_norm": 4.022785560664488e-06,
"learning_rate": 2.197208464655561e-06,
"logits/chosen": -0.9736822843551636,
"logits/rejected": -1.1963258981704712,
"logps/chosen": -107.04643249511719,
"logps/rejected": -327.04217529296875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3099985122680664,
"rewards/margins": 18.62815284729004,
"rewards/rejected": -15.318156242370605,
"step": 5940
},
{
"epoch": 2.4108589951377635,
"grad_norm": 7.282645128725562e-06,
"learning_rate": 2.182200210115564e-06,
"logits/chosen": -0.9786582589149475,
"logits/rejected": -1.195390224456787,
"logps/chosen": -109.43639373779297,
"logps/rejected": -327.4029846191406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.279670000076294,
"rewards/margins": 18.617467880249023,
"rewards/rejected": -15.337796211242676,
"step": 5950
},
{
"epoch": 2.4108589951377635,
"eval_logits/chosen": -0.9759088158607483,
"eval_logits/rejected": -1.1941173076629639,
"eval_logps/chosen": -108.82359313964844,
"eval_logps/rejected": -325.46142578125,
"eval_loss": 4.3986084108382784e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2188332080841064,
"eval_rewards/margins": 18.470699310302734,
"eval_rewards/rejected": -15.25186824798584,
"eval_runtime": 660.487,
"eval_samples_per_second": 11.21,
"eval_steps_per_second": 0.624,
"step": 5950
},
{
"epoch": 2.4149108589951376,
"grad_norm": 5.016336672269972e-06,
"learning_rate": 2.1671919555755664e-06,
"logits/chosen": -0.9681698083877563,
"logits/rejected": -1.1931991577148438,
"logps/chosen": -107.51768493652344,
"logps/rejected": -327.22802734375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.334961175918579,
"rewards/margins": 18.64361000061035,
"rewards/rejected": -15.308646202087402,
"step": 5960
},
{
"epoch": 2.418962722852512,
"grad_norm": 8.80508559930604e-06,
"learning_rate": 2.15218370103557e-06,
"logits/chosen": -0.9631980061531067,
"logits/rejected": -1.2213531732559204,
"logps/chosen": -107.55696105957031,
"logps/rejected": -327.5552978515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.278275966644287,
"rewards/margins": 18.78751564025879,
"rewards/rejected": -15.509241104125977,
"step": 5970
},
{
"epoch": 2.4230145867098867,
"grad_norm": 6.065507477615029e-06,
"learning_rate": 2.137175446495573e-06,
"logits/chosen": -0.9734798669815063,
"logits/rejected": -1.1926671266555786,
"logps/chosen": -108.64668273925781,
"logps/rejected": -325.3752746582031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2668917179107666,
"rewards/margins": 18.480018615722656,
"rewards/rejected": -15.213125228881836,
"step": 5980
},
{
"epoch": 2.427066450567261,
"grad_norm": 4.074761818628758e-06,
"learning_rate": 2.122167191955576e-06,
"logits/chosen": -0.9733186364173889,
"logits/rejected": -1.1757533550262451,
"logps/chosen": -108.77658081054688,
"logps/rejected": -325.20086669921875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.256643772125244,
"rewards/margins": 18.523258209228516,
"rewards/rejected": -15.266615867614746,
"step": 5990
},
{
"epoch": 2.4311183144246353,
"grad_norm": 1.9911642539227614e-06,
"learning_rate": 2.107158937415579e-06,
"logits/chosen": -0.9687005877494812,
"logits/rejected": -1.2020748853683472,
"logps/chosen": -107.47844696044922,
"logps/rejected": -327.5688171386719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2923924922943115,
"rewards/margins": 18.662755966186523,
"rewards/rejected": -15.370365142822266,
"step": 6000
},
{
"epoch": 2.4311183144246353,
"eval_logits/chosen": -0.9808048605918884,
"eval_logits/rejected": -1.1985182762145996,
"eval_logps/chosen": -108.8628921508789,
"eval_logps/rejected": -325.8635559082031,
"eval_loss": 4.268249753636155e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2149031162261963,
"eval_rewards/margins": 18.506982803344727,
"eval_rewards/rejected": -15.29207992553711,
"eval_runtime": 660.2726,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 6000
},
{
"epoch": 2.43517017828201,
"grad_norm": 3.6586802707461175e-06,
"learning_rate": 2.0921506828755814e-06,
"logits/chosen": -0.9805698990821838,
"logits/rejected": -1.1940364837646484,
"logps/chosen": -108.60276794433594,
"logps/rejected": -327.7688903808594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3031599521636963,
"rewards/margins": 18.747312545776367,
"rewards/rejected": -15.444150924682617,
"step": 6010
},
{
"epoch": 2.439222042139384,
"grad_norm": 2.5668534817668842e-06,
"learning_rate": 2.077142428335585e-06,
"logits/chosen": -0.9724539518356323,
"logits/rejected": -1.1866434812545776,
"logps/chosen": -108.19477844238281,
"logps/rejected": -327.85968017578125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.309955596923828,
"rewards/margins": 18.663129806518555,
"rewards/rejected": -15.35317611694336,
"step": 6020
},
{
"epoch": 2.4432739059967585,
"grad_norm": 2.2230321974348044e-06,
"learning_rate": 2.062134173795588e-06,
"logits/chosen": -0.9716467261314392,
"logits/rejected": -1.1950808763504028,
"logps/chosen": -107.60568237304688,
"logps/rejected": -326.04302978515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3049800395965576,
"rewards/margins": 18.607084274291992,
"rewards/rejected": -15.302105903625488,
"step": 6030
},
{
"epoch": 2.447325769854133,
"grad_norm": 4.1039793359232135e-06,
"learning_rate": 2.0471259192555905e-06,
"logits/chosen": -0.9728240370750427,
"logits/rejected": -1.2006126642227173,
"logps/chosen": -107.84103393554688,
"logps/rejected": -327.4736633300781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3131470680236816,
"rewards/margins": 18.78127670288086,
"rewards/rejected": -15.468131065368652,
"step": 6040
},
{
"epoch": 2.451377633711507,
"grad_norm": 1.3657091813001898e-06,
"learning_rate": 2.032117664715594e-06,
"logits/chosen": -0.9755275249481201,
"logits/rejected": -1.1849957704544067,
"logps/chosen": -107.99736785888672,
"logps/rejected": -325.5821533203125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2840635776519775,
"rewards/margins": 18.56288719177246,
"rewards/rejected": -15.278822898864746,
"step": 6050
},
{
"epoch": 2.451377633711507,
"eval_logits/chosen": -0.9780051708221436,
"eval_logits/rejected": -1.1961445808410645,
"eval_logps/chosen": -108.83138275146484,
"eval_logps/rejected": -325.86334228515625,
"eval_loss": 4.2394276533741504e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2180542945861816,
"eval_rewards/margins": 18.510120391845703,
"eval_rewards/rejected": -15.29206371307373,
"eval_runtime": 660.5379,
"eval_samples_per_second": 11.209,
"eval_steps_per_second": 0.624,
"step": 6050
},
{
"epoch": 2.4554294975688817,
"grad_norm": 1.4931745226931525e-06,
"learning_rate": 2.017109410175597e-06,
"logits/chosen": -0.9615519046783447,
"logits/rejected": -1.1878507137298584,
"logps/chosen": -107.65083312988281,
"logps/rejected": -329.0572509765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3118786811828613,
"rewards/margins": 18.859901428222656,
"rewards/rejected": -15.54802417755127,
"step": 6060
},
{
"epoch": 2.4594813614262563,
"grad_norm": 1.7799682609620504e-05,
"learning_rate": 2.0021011556356e-06,
"logits/chosen": -0.96705561876297,
"logits/rejected": -1.204535961151123,
"logps/chosen": -108.06282806396484,
"logps/rejected": -327.4886169433594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.256913661956787,
"rewards/margins": 18.616802215576172,
"rewards/rejected": -15.359890937805176,
"step": 6070
},
{
"epoch": 2.4635332252836304,
"grad_norm": 1.7383925978720072e-06,
"learning_rate": 1.987092901095603e-06,
"logits/chosen": -0.9585224390029907,
"logits/rejected": -1.1837499141693115,
"logps/chosen": -107.86884307861328,
"logps/rejected": -328.6343994140625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.318385601043701,
"rewards/margins": 18.738054275512695,
"rewards/rejected": -15.41966724395752,
"step": 6080
},
{
"epoch": 2.467585089141005,
"grad_norm": 1.1537390491866972e-06,
"learning_rate": 1.9720846465556055e-06,
"logits/chosen": -0.9602194428443909,
"logits/rejected": -1.1984214782714844,
"logps/chosen": -106.77111053466797,
"logps/rejected": -325.6100158691406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.313378095626831,
"rewards/margins": 18.595895767211914,
"rewards/rejected": -15.28251838684082,
"step": 6090
},
{
"epoch": 2.471636952998379,
"grad_norm": 1.8969084294440108e-06,
"learning_rate": 1.957076392015609e-06,
"logits/chosen": -0.9807277917861938,
"logits/rejected": -1.20936918258667,
"logps/chosen": -108.0311050415039,
"logps/rejected": -326.1614685058594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3173441886901855,
"rewards/margins": 18.628530502319336,
"rewards/rejected": -15.311185836791992,
"step": 6100
},
{
"epoch": 2.471636952998379,
"eval_logits/chosen": -0.9830069541931152,
"eval_logits/rejected": -1.2014747858047485,
"eval_logps/chosen": -108.8082504272461,
"eval_logps/rejected": -326.0628662109375,
"eval_loss": 4.179652890456964e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.220367908477783,
"eval_rewards/margins": 18.532384872436523,
"eval_rewards/rejected": -15.312015533447266,
"eval_runtime": 660.4553,
"eval_samples_per_second": 11.21,
"eval_steps_per_second": 0.624,
"step": 6100
},
{
"epoch": 2.4756888168557536,
"grad_norm": 3.357650712132454e-06,
"learning_rate": 1.942068137475612e-06,
"logits/chosen": -0.9689719080924988,
"logits/rejected": -1.1983363628387451,
"logps/chosen": -107.31026458740234,
"logps/rejected": -327.8813781738281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3255045413970947,
"rewards/margins": 18.77232551574707,
"rewards/rejected": -15.446820259094238,
"step": 6110
},
{
"epoch": 2.479740680713128,
"grad_norm": 2.8045988074154593e-06,
"learning_rate": 1.9270598829356145e-06,
"logits/chosen": -0.9831250309944153,
"logits/rejected": -1.2013838291168213,
"logps/chosen": -109.80864715576172,
"logps/rejected": -328.51336669921875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2356388568878174,
"rewards/margins": 18.75834083557129,
"rewards/rejected": -15.522703170776367,
"step": 6120
},
{
"epoch": 2.4837925445705022,
"grad_norm": 4.265214556653518e-06,
"learning_rate": 1.912051628395618e-06,
"logits/chosen": -0.9854481220245361,
"logits/rejected": -1.2226250171661377,
"logps/chosen": -107.80648040771484,
"logps/rejected": -328.3800354003906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2958462238311768,
"rewards/margins": 18.70480728149414,
"rewards/rejected": -15.408963203430176,
"step": 6130
},
{
"epoch": 2.487844408427877,
"grad_norm": 3.7762381452921545e-06,
"learning_rate": 1.8970433738556207e-06,
"logits/chosen": -0.9553852677345276,
"logits/rejected": -1.2117712497711182,
"logps/chosen": -107.25263977050781,
"logps/rejected": -327.5824279785156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.309253454208374,
"rewards/margins": 18.762123107910156,
"rewards/rejected": -15.45287036895752,
"step": 6140
},
{
"epoch": 2.4918962722852513,
"grad_norm": 2.9514881134673487e-06,
"learning_rate": 1.882035119315624e-06,
"logits/chosen": -0.9714182615280151,
"logits/rejected": -1.1771537065505981,
"logps/chosen": -108.69279479980469,
"logps/rejected": -324.65771484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3242886066436768,
"rewards/margins": 18.51775360107422,
"rewards/rejected": -15.193465232849121,
"step": 6150
},
{
"epoch": 2.4918962722852513,
"eval_logits/chosen": -0.9813016057014465,
"eval_logits/rejected": -1.1988472938537598,
"eval_logps/chosen": -108.86288452148438,
"eval_logps/rejected": -326.3122253417969,
"eval_loss": 4.100524009231776e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.214904546737671,
"eval_rewards/margins": 18.55185317993164,
"eval_rewards/rejected": -15.33694839477539,
"eval_runtime": 660.6059,
"eval_samples_per_second": 11.208,
"eval_steps_per_second": 0.624,
"step": 6150
},
{
"epoch": 2.4959481361426255,
"grad_norm": 3.1905897230899427e-06,
"learning_rate": 1.8670268647756267e-06,
"logits/chosen": -0.9699487090110779,
"logits/rejected": -1.1912376880645752,
"logps/chosen": -107.7493896484375,
"logps/rejected": -327.40380859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2711246013641357,
"rewards/margins": 18.685203552246094,
"rewards/rejected": -15.414080619812012,
"step": 6160
},
{
"epoch": 2.5,
"grad_norm": 1.7918980574904708e-06,
"learning_rate": 1.8520186102356297e-06,
"logits/chosen": -0.9669857025146484,
"logits/rejected": -1.1998149156570435,
"logps/chosen": -108.14031219482422,
"logps/rejected": -327.1600341796875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.298938512802124,
"rewards/margins": 18.699140548706055,
"rewards/rejected": -15.400202751159668,
"step": 6170
},
{
"epoch": 2.5040518638573745,
"grad_norm": 1.860858105828811e-06,
"learning_rate": 1.837010355695633e-06,
"logits/chosen": -0.9667934775352478,
"logits/rejected": -1.1925849914550781,
"logps/chosen": -107.15023040771484,
"logps/rejected": -325.98974609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.313432216644287,
"rewards/margins": 18.61665916442871,
"rewards/rejected": -15.303226470947266,
"step": 6180
},
{
"epoch": 2.5081037277147487,
"grad_norm": 1.3164225265427376e-06,
"learning_rate": 1.8220021011556357e-06,
"logits/chosen": -0.9643639326095581,
"logits/rejected": -1.1708581447601318,
"logps/chosen": -108.03089141845703,
"logps/rejected": -327.45391845703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3030054569244385,
"rewards/margins": 18.699365615844727,
"rewards/rejected": -15.396356582641602,
"step": 6190
},
{
"epoch": 2.512155591572123,
"grad_norm": 4.9158657020598184e-06,
"learning_rate": 1.8069938466156387e-06,
"logits/chosen": -0.9764487147331238,
"logits/rejected": -1.1940850019454956,
"logps/chosen": -109.26360321044922,
"logps/rejected": -327.9493103027344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2739195823669434,
"rewards/margins": 18.715007781982422,
"rewards/rejected": -15.441088676452637,
"step": 6200
},
{
"epoch": 2.512155591572123,
"eval_logits/chosen": -1.0008020401000977,
"eval_logits/rejected": -1.2112467288970947,
"eval_logps/chosen": -108.94487762451172,
"eval_logps/rejected": -326.58551025390625,
"eval_loss": 3.98079578189936e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.206705093383789,
"eval_rewards/margins": 18.570980072021484,
"eval_rewards/rejected": -15.364276885986328,
"eval_runtime": 660.6193,
"eval_samples_per_second": 11.208,
"eval_steps_per_second": 0.624,
"step": 6200
},
{
"epoch": 2.5162074554294973,
"grad_norm": 3.4435008728905814e-06,
"learning_rate": 1.7919855920756417e-06,
"logits/chosen": -0.9690682888031006,
"logits/rejected": -1.2002158164978027,
"logps/chosen": -107.30548858642578,
"logps/rejected": -326.1789855957031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.261204242706299,
"rewards/margins": 18.585628509521484,
"rewards/rejected": -15.32442569732666,
"step": 6210
},
{
"epoch": 2.520259319286872,
"grad_norm": 2.629633627293515e-06,
"learning_rate": 1.7769773375356447e-06,
"logits/chosen": -0.9658797979354858,
"logits/rejected": -1.1845813989639282,
"logps/chosen": -108.27976989746094,
"logps/rejected": -326.8075256347656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2834341526031494,
"rewards/margins": 18.606882095336914,
"rewards/rejected": -15.323447227478027,
"step": 6220
},
{
"epoch": 2.5243111831442464,
"grad_norm": 2.3243953819473973e-06,
"learning_rate": 1.7619690829956475e-06,
"logits/chosen": -0.9618611931800842,
"logits/rejected": -1.174437165260315,
"logps/chosen": -108.25444793701172,
"logps/rejected": -325.98699951171875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2668089866638184,
"rewards/margins": 18.61248207092285,
"rewards/rejected": -15.345672607421875,
"step": 6230
},
{
"epoch": 2.528363047001621,
"grad_norm": 1.5239019148793886e-06,
"learning_rate": 1.7469608284556507e-06,
"logits/chosen": -0.9782617092132568,
"logits/rejected": -1.1967428922653198,
"logps/chosen": -108.69795989990234,
"logps/rejected": -328.13104248046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.244070529937744,
"rewards/margins": 18.628637313842773,
"rewards/rejected": -15.384567260742188,
"step": 6240
},
{
"epoch": 2.532414910858995,
"grad_norm": 1.023332742988714e-06,
"learning_rate": 1.7319525739156537e-06,
"logits/chosen": -0.9639495015144348,
"logits/rejected": -1.196813702583313,
"logps/chosen": -108.13853454589844,
"logps/rejected": -327.58502197265625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3000214099884033,
"rewards/margins": 18.681150436401367,
"rewards/rejected": -15.381129264831543,
"step": 6250
},
{
"epoch": 2.532414910858995,
"eval_logits/chosen": -0.9815783500671387,
"eval_logits/rejected": -1.1993688344955444,
"eval_logps/chosen": -108.81712341308594,
"eval_logps/rejected": -326.4479064941406,
"eval_loss": 4.022196975483894e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.21947979927063,
"eval_rewards/margins": 18.569995880126953,
"eval_rewards/rejected": -15.350517272949219,
"eval_runtime": 662.1518,
"eval_samples_per_second": 11.182,
"eval_steps_per_second": 0.622,
"step": 6250
},
{
"epoch": 2.5364667747163696,
"grad_norm": 5.988872089801589e-06,
"learning_rate": 1.716944319375657e-06,
"logits/chosen": -0.9757972955703735,
"logits/rejected": -1.191314458847046,
"logps/chosen": -107.9080581665039,
"logps/rejected": -329.70318603515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3165342807769775,
"rewards/margins": 18.844295501708984,
"rewards/rejected": -15.52776050567627,
"step": 6260
},
{
"epoch": 2.5405186385737437,
"grad_norm": 1.207193508889759e-05,
"learning_rate": 1.7019360648356598e-06,
"logits/chosen": -0.9672058820724487,
"logits/rejected": -1.1961170434951782,
"logps/chosen": -107.99466705322266,
"logps/rejected": -327.3460998535156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2853333950042725,
"rewards/margins": 18.698740005493164,
"rewards/rejected": -15.413406372070312,
"step": 6270
},
{
"epoch": 2.5445705024311183,
"grad_norm": 1.291679382120492e-06,
"learning_rate": 1.6869278102956628e-06,
"logits/chosen": -0.9546921253204346,
"logits/rejected": -1.1888737678527832,
"logps/chosen": -107.12965393066406,
"logps/rejected": -327.9710998535156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3467442989349365,
"rewards/margins": 18.808881759643555,
"rewards/rejected": -15.462138175964355,
"step": 6280
},
{
"epoch": 2.548622366288493,
"grad_norm": 3.3810204058681848e-06,
"learning_rate": 1.6719195557556658e-06,
"logits/chosen": -0.9795487523078918,
"logits/rejected": -1.197702407836914,
"logps/chosen": -108.23588562011719,
"logps/rejected": -327.83807373046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2980990409851074,
"rewards/margins": 18.747577667236328,
"rewards/rejected": -15.449479103088379,
"step": 6290
},
{
"epoch": 2.5526742301458674,
"grad_norm": 3.419266022319789e-06,
"learning_rate": 1.6569113012156688e-06,
"logits/chosen": -0.9572386145591736,
"logits/rejected": -1.1906791925430298,
"logps/chosen": -107.73524475097656,
"logps/rejected": -327.8420715332031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2752833366394043,
"rewards/margins": 18.61233139038086,
"rewards/rejected": -15.337051391601562,
"step": 6300
},
{
"epoch": 2.5526742301458674,
"eval_logits/chosen": -0.9776512980461121,
"eval_logits/rejected": -1.1944934129714966,
"eval_logps/chosen": -108.82562255859375,
"eval_logps/rejected": -326.63250732421875,
"eval_loss": 3.954363592129084e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2186315059661865,
"eval_rewards/margins": 18.58760643005371,
"eval_rewards/rejected": -15.368974685668945,
"eval_runtime": 670.5606,
"eval_samples_per_second": 11.042,
"eval_steps_per_second": 0.614,
"step": 6300
},
{
"epoch": 2.5567260940032415,
"grad_norm": 5.7838697102852166e-06,
"learning_rate": 1.6419030466756716e-06,
"logits/chosen": -0.9636346697807312,
"logits/rejected": -1.187281847000122,
"logps/chosen": -107.17536163330078,
"logps/rejected": -328.47930908203125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3024773597717285,
"rewards/margins": 18.8435001373291,
"rewards/rejected": -15.541020393371582,
"step": 6310
},
{
"epoch": 2.560777957860616,
"grad_norm": 3.5440295960142976e-06,
"learning_rate": 1.6268947921356748e-06,
"logits/chosen": -0.9722870588302612,
"logits/rejected": -1.1834774017333984,
"logps/chosen": -109.13838958740234,
"logps/rejected": -327.3340148925781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2597129344940186,
"rewards/margins": 18.711063385009766,
"rewards/rejected": -15.451351165771484,
"step": 6320
},
{
"epoch": 2.56482982171799,
"grad_norm": 1.9810686353594065e-06,
"learning_rate": 1.6118865375956778e-06,
"logits/chosen": -0.9808294177055359,
"logits/rejected": -1.2147830724716187,
"logps/chosen": -108.866943359375,
"logps/rejected": -329.5595397949219,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.288322925567627,
"rewards/margins": 18.934534072875977,
"rewards/rejected": -15.646211624145508,
"step": 6330
},
{
"epoch": 2.5688816855753647,
"grad_norm": 3.13096870740992e-06,
"learning_rate": 1.5968782830556808e-06,
"logits/chosen": -0.9726601839065552,
"logits/rejected": -1.1958694458007812,
"logps/chosen": -108.95462799072266,
"logps/rejected": -327.8139953613281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2538976669311523,
"rewards/margins": 18.66844940185547,
"rewards/rejected": -15.41455078125,
"step": 6340
},
{
"epoch": 2.572933549432739,
"grad_norm": 1.2461340475056204e-06,
"learning_rate": 1.5818700285156838e-06,
"logits/chosen": -0.9781768918037415,
"logits/rejected": -1.1878637075424194,
"logps/chosen": -108.5665054321289,
"logps/rejected": -328.9209289550781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.26299786567688,
"rewards/margins": 18.812883377075195,
"rewards/rejected": -15.549882888793945,
"step": 6350
},
{
"epoch": 2.572933549432739,
"eval_logits/chosen": -0.9855466485023499,
"eval_logits/rejected": -1.202751636505127,
"eval_logps/chosen": -108.78968811035156,
"eval_logps/rejected": -326.6907653808594,
"eval_loss": 3.922154334645711e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.222224235534668,
"eval_rewards/margins": 18.597021102905273,
"eval_rewards/rejected": -15.374796867370605,
"eval_runtime": 660.8039,
"eval_samples_per_second": 11.205,
"eval_steps_per_second": 0.623,
"step": 6350
},
{
"epoch": 2.5769854132901133,
"grad_norm": 5.123989467392676e-06,
"learning_rate": 1.5668617739756866e-06,
"logits/chosen": -0.9808394312858582,
"logits/rejected": -1.2014094591140747,
"logps/chosen": -108.37004089355469,
"logps/rejected": -327.8202209472656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.29618239402771,
"rewards/margins": 18.780914306640625,
"rewards/rejected": -15.484735488891602,
"step": 6360
},
{
"epoch": 2.581037277147488,
"grad_norm": 1.168843937193742e-06,
"learning_rate": 1.5518535194356898e-06,
"logits/chosen": -0.9609886407852173,
"logits/rejected": -1.1898174285888672,
"logps/chosen": -108.14075469970703,
"logps/rejected": -328.1893310546875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.315068244934082,
"rewards/margins": 18.79088592529297,
"rewards/rejected": -15.47581672668457,
"step": 6370
},
{
"epoch": 2.585089141004862,
"grad_norm": 2.1414846287370892e-06,
"learning_rate": 1.5368452648956928e-06,
"logits/chosen": -0.9728871583938599,
"logits/rejected": -1.1902121305465698,
"logps/chosen": -108.35099792480469,
"logps/rejected": -327.84222412109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2617249488830566,
"rewards/margins": 18.661222457885742,
"rewards/rejected": -15.399496078491211,
"step": 6380
},
{
"epoch": 2.5891410048622365,
"grad_norm": 1.1244234201512882e-06,
"learning_rate": 1.5218370103556956e-06,
"logits/chosen": -0.9578056931495667,
"logits/rejected": -1.1797066926956177,
"logps/chosen": -107.15328216552734,
"logps/rejected": -328.0039978027344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3418495655059814,
"rewards/margins": 18.829952239990234,
"rewards/rejected": -15.488102912902832,
"step": 6390
},
{
"epoch": 2.593192868719611,
"grad_norm": 6.752874924131902e-06,
"learning_rate": 1.5068287558156988e-06,
"logits/chosen": -0.9773401021957397,
"logits/rejected": -1.1944974660873413,
"logps/chosen": -108.75959777832031,
"logps/rejected": -330.46429443359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2552199363708496,
"rewards/margins": 18.80958366394043,
"rewards/rejected": -15.554365158081055,
"step": 6400
},
{
"epoch": 2.593192868719611,
"eval_logits/chosen": -0.9779274463653564,
"eval_logits/rejected": -1.1951502561569214,
"eval_logps/chosen": -108.78299713134766,
"eval_logps/rejected": -326.7506103515625,
"eval_loss": 3.899987888189571e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.222893238067627,
"eval_rewards/margins": 18.603673934936523,
"eval_rewards/rejected": -15.380780220031738,
"eval_runtime": 661.3907,
"eval_samples_per_second": 11.195,
"eval_steps_per_second": 0.623,
"step": 6400
},
{
"epoch": 2.5972447325769856,
"grad_norm": 1.3012622730457224e-06,
"learning_rate": 1.4918205012757018e-06,
"logits/chosen": -0.962655246257782,
"logits/rejected": -1.1892623901367188,
"logps/chosen": -106.69053649902344,
"logps/rejected": -327.73455810546875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3535757064819336,
"rewards/margins": 18.768230438232422,
"rewards/rejected": -15.414655685424805,
"step": 6410
},
{
"epoch": 2.6012965964343597,
"grad_norm": 1.678008970884548e-06,
"learning_rate": 1.4768122467357048e-06,
"logits/chosen": -0.9705030918121338,
"logits/rejected": -1.2016093730926514,
"logps/chosen": -107.60749053955078,
"logps/rejected": -329.26025390625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.301589250564575,
"rewards/margins": 18.92018699645996,
"rewards/rejected": -15.618597030639648,
"step": 6420
},
{
"epoch": 2.6053484602917343,
"grad_norm": 1.2321225767664146e-05,
"learning_rate": 1.4618039921957078e-06,
"logits/chosen": -0.9854863286018372,
"logits/rejected": -1.2013943195343018,
"logps/chosen": -108.88626861572266,
"logps/rejected": -328.6309814453125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.246922254562378,
"rewards/margins": 18.843786239624023,
"rewards/rejected": -15.59686279296875,
"step": 6430
},
{
"epoch": 2.6094003241491084,
"grad_norm": 4.80731796415057e-06,
"learning_rate": 1.4467957376557106e-06,
"logits/chosen": -0.9673572778701782,
"logits/rejected": -1.2005420923233032,
"logps/chosen": -106.57898712158203,
"logps/rejected": -328.31396484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.35111403465271,
"rewards/margins": 18.79676628112793,
"rewards/rejected": -15.44565200805664,
"step": 6440
},
{
"epoch": 2.613452188006483,
"grad_norm": 2.3030111151456367e-06,
"learning_rate": 1.4317874831157138e-06,
"logits/chosen": -0.9817792177200317,
"logits/rejected": -1.1919387578964233,
"logps/chosen": -108.42607116699219,
"logps/rejected": -327.2312316894531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2762937545776367,
"rewards/margins": 18.632549285888672,
"rewards/rejected": -15.356255531311035,
"step": 6450
},
{
"epoch": 2.613452188006483,
"eval_logits/chosen": -0.9837523698806763,
"eval_logits/rejected": -1.2007975578308105,
"eval_logps/chosen": -108.7887191772461,
"eval_logps/rejected": -327.0396728515625,
"eval_loss": 3.796148817514222e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2223217487335205,
"eval_rewards/margins": 18.632015228271484,
"eval_rewards/rejected": -15.409693717956543,
"eval_runtime": 659.9782,
"eval_samples_per_second": 11.219,
"eval_steps_per_second": 0.624,
"step": 6450
},
{
"epoch": 2.6175040518638575,
"grad_norm": 1.7890401068143547e-05,
"learning_rate": 1.4167792285757168e-06,
"logits/chosen": -0.9685986638069153,
"logits/rejected": -1.2094436883926392,
"logps/chosen": -107.218017578125,
"logps/rejected": -327.6186218261719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3231217861175537,
"rewards/margins": 18.779752731323242,
"rewards/rejected": -15.456629753112793,
"step": 6460
},
{
"epoch": 2.621555915721232,
"grad_norm": 2.380106025157147e-06,
"learning_rate": 1.4017709740357196e-06,
"logits/chosen": -0.971544623374939,
"logits/rejected": -1.1954891681671143,
"logps/chosen": -107.54015350341797,
"logps/rejected": -327.93792724609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2983453273773193,
"rewards/margins": 18.725475311279297,
"rewards/rejected": -15.427130699157715,
"step": 6470
},
{
"epoch": 2.625607779578606,
"grad_norm": 2.2546776108356426e-06,
"learning_rate": 1.3867627194957228e-06,
"logits/chosen": -0.9820596575737,
"logits/rejected": -1.1837631464004517,
"logps/chosen": -108.93296813964844,
"logps/rejected": -327.3031005859375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.26320743560791,
"rewards/margins": 18.705913543701172,
"rewards/rejected": -15.442708015441895,
"step": 6480
},
{
"epoch": 2.6296596434359807,
"grad_norm": 2.7140899874211755e-06,
"learning_rate": 1.3717544649557256e-06,
"logits/chosen": -0.9743025898933411,
"logits/rejected": -1.2002640962600708,
"logps/chosen": -108.07935333251953,
"logps/rejected": -328.34503173828125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.272324562072754,
"rewards/margins": 18.76234245300293,
"rewards/rejected": -15.490017890930176,
"step": 6490
},
{
"epoch": 2.633711507293355,
"grad_norm": 2.2897106646269094e-06,
"learning_rate": 1.3567462104157286e-06,
"logits/chosen": -0.9556276798248291,
"logits/rejected": -1.1725317239761353,
"logps/chosen": -107.97649383544922,
"logps/rejected": -328.3132629394531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3200385570526123,
"rewards/margins": 18.83300018310547,
"rewards/rejected": -15.512959480285645,
"step": 6500
},
{
"epoch": 2.633711507293355,
"eval_logits/chosen": -0.9754812717437744,
"eval_logits/rejected": -1.1918588876724243,
"eval_logps/chosen": -108.743408203125,
"eval_logps/rejected": -326.9277038574219,
"eval_loss": 3.817614313561535e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.22685170173645,
"eval_rewards/margins": 18.62534523010254,
"eval_rewards/rejected": -15.398492813110352,
"eval_runtime": 663.7926,
"eval_samples_per_second": 11.154,
"eval_steps_per_second": 0.621,
"step": 6500
},
{
"epoch": 2.6377633711507293,
"grad_norm": 1.1392465239623562e-05,
"learning_rate": 1.3417379558757318e-06,
"logits/chosen": -0.9725505113601685,
"logits/rejected": -1.1995872259140015,
"logps/chosen": -108.75624084472656,
"logps/rejected": -327.79815673828125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2533085346221924,
"rewards/margins": 18.761568069458008,
"rewards/rejected": -15.508259773254395,
"step": 6510
},
{
"epoch": 2.641815235008104,
"grad_norm": 3.2896393804549007e-06,
"learning_rate": 1.3267297013357346e-06,
"logits/chosen": -0.978614091873169,
"logits/rejected": -1.1826672554016113,
"logps/chosen": -107.8505859375,
"logps/rejected": -328.4673156738281,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3108980655670166,
"rewards/margins": 18.78472900390625,
"rewards/rejected": -15.473831176757812,
"step": 6520
},
{
"epoch": 2.645867098865478,
"grad_norm": 2.180285036956775e-06,
"learning_rate": 1.3117214467957378e-06,
"logits/chosen": -0.9547456502914429,
"logits/rejected": -1.1693174839019775,
"logps/chosen": -107.28286743164062,
"logps/rejected": -326.9376525878906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.31911563873291,
"rewards/margins": 18.735675811767578,
"rewards/rejected": -15.416559219360352,
"step": 6530
},
{
"epoch": 2.6499189627228525,
"grad_norm": 2.427897243251209e-06,
"learning_rate": 1.2967131922557409e-06,
"logits/chosen": -0.9694584012031555,
"logits/rejected": -1.1888294219970703,
"logps/chosen": -107.25581359863281,
"logps/rejected": -329.0333251953125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3289191722869873,
"rewards/margins": 18.88922882080078,
"rewards/rejected": -15.560308456420898,
"step": 6540
},
{
"epoch": 2.6539708265802266,
"grad_norm": 5.982232778478647e-06,
"learning_rate": 1.2817049377157436e-06,
"logits/chosen": -0.9642473459243774,
"logits/rejected": -1.1938378810882568,
"logps/chosen": -108.4251937866211,
"logps/rejected": -329.1801452636719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.263878107070923,
"rewards/margins": 18.861995697021484,
"rewards/rejected": -15.598118782043457,
"step": 6550
},
{
"epoch": 2.6539708265802266,
"eval_logits/chosen": -0.9800311326980591,
"eval_logits/rejected": -1.196731448173523,
"eval_logps/chosen": -108.75553894042969,
"eval_logps/rejected": -327.10906982421875,
"eval_loss": 3.7646959327730656e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2256405353546143,
"eval_rewards/margins": 18.64227294921875,
"eval_rewards/rejected": -15.416630744934082,
"eval_runtime": 660.9228,
"eval_samples_per_second": 11.203,
"eval_steps_per_second": 0.623,
"step": 6550
},
{
"epoch": 2.658022690437601,
"grad_norm": 6.1209575505927205e-06,
"learning_rate": 1.2666966831757469e-06,
"logits/chosen": -0.9827333688735962,
"logits/rejected": -1.2020137310028076,
"logps/chosen": -109.26451110839844,
"logps/rejected": -327.8392333984375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2394943237304688,
"rewards/margins": 18.677507400512695,
"rewards/rejected": -15.438010215759277,
"step": 6560
},
{
"epoch": 2.6620745542949757,
"grad_norm": 3.7437689570651855e-06,
"learning_rate": 1.2516884286357497e-06,
"logits/chosen": -0.9661514759063721,
"logits/rejected": -1.187090516090393,
"logps/chosen": -108.47927856445312,
"logps/rejected": -328.90728759765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3015549182891846,
"rewards/margins": 18.853607177734375,
"rewards/rejected": -15.552051544189453,
"step": 6570
},
{
"epoch": 2.6661264181523503,
"grad_norm": 2.605788267828757e-06,
"learning_rate": 1.2366801740957529e-06,
"logits/chosen": -0.9742575287818909,
"logits/rejected": -1.186073899269104,
"logps/chosen": -108.8031997680664,
"logps/rejected": -326.662109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2990267276763916,
"rewards/margins": 18.651639938354492,
"rewards/rejected": -15.352612495422363,
"step": 6580
},
{
"epoch": 2.6701782820097244,
"grad_norm": 1.6996804106383934e-06,
"learning_rate": 1.2216719195557559e-06,
"logits/chosen": -0.9773194789886475,
"logits/rejected": -1.1909611225128174,
"logps/chosen": -107.54708099365234,
"logps/rejected": -327.1669006347656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2739102840423584,
"rewards/margins": 18.743066787719727,
"rewards/rejected": -15.469155311584473,
"step": 6590
},
{
"epoch": 2.674230145867099,
"grad_norm": 2.250463694508653e-06,
"learning_rate": 1.2066636650157587e-06,
"logits/chosen": -0.9738913774490356,
"logits/rejected": -1.1955630779266357,
"logps/chosen": -108.31841278076172,
"logps/rejected": -328.6866149902344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.345407724380493,
"rewards/margins": 18.886333465576172,
"rewards/rejected": -15.54092788696289,
"step": 6600
},
{
"epoch": 2.674230145867099,
"eval_logits/chosen": -0.9773862361907959,
"eval_logits/rejected": -1.1934053897857666,
"eval_logps/chosen": -108.75808715820312,
"eval_logps/rejected": -327.1883239746094,
"eval_loss": 3.73986921431424e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.22538423538208,
"eval_rewards/margins": 18.649938583374023,
"eval_rewards/rejected": -15.424555778503418,
"eval_runtime": 660.0959,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 6600
},
{
"epoch": 2.678282009724473,
"grad_norm": 1.7172280422528274e-05,
"learning_rate": 1.1916554104757617e-06,
"logits/chosen": -0.9561381936073303,
"logits/rejected": -1.1864134073257446,
"logps/chosen": -106.45145416259766,
"logps/rejected": -327.47332763671875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.330907106399536,
"rewards/margins": 18.795562744140625,
"rewards/rejected": -15.464655876159668,
"step": 6610
},
{
"epoch": 2.6823338735818476,
"grad_norm": 2.226166770924465e-06,
"learning_rate": 1.1766471559357649e-06,
"logits/chosen": -0.9810739159584045,
"logits/rejected": -1.2017022371292114,
"logps/chosen": -107.25318145751953,
"logps/rejected": -327.8432312011719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.287501096725464,
"rewards/margins": 18.69404411315918,
"rewards/rejected": -15.406542778015137,
"step": 6620
},
{
"epoch": 2.686385737439222,
"grad_norm": 1.5006548892415594e-06,
"learning_rate": 1.1616389013957679e-06,
"logits/chosen": -0.9777254462242126,
"logits/rejected": -1.1854885816574097,
"logps/chosen": -108.16984558105469,
"logps/rejected": -328.51971435546875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2975127696990967,
"rewards/margins": 18.87528419494629,
"rewards/rejected": -15.577771186828613,
"step": 6630
},
{
"epoch": 2.6904376012965967,
"grad_norm": 1.0780703405544045e-06,
"learning_rate": 1.1466306468557707e-06,
"logits/chosen": -0.9816153645515442,
"logits/rejected": -1.1960108280181885,
"logps/chosen": -108.11849212646484,
"logps/rejected": -328.8614196777344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3232884407043457,
"rewards/margins": 18.841562271118164,
"rewards/rejected": -15.51827335357666,
"step": 6640
},
{
"epoch": 2.694489465153971,
"grad_norm": 1.7732330661601736e-06,
"learning_rate": 1.1316223923157737e-06,
"logits/chosen": -0.9946374297142029,
"logits/rejected": -1.1932036876678467,
"logps/chosen": -108.26897430419922,
"logps/rejected": -327.3341064453125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2642621994018555,
"rewards/margins": 18.655010223388672,
"rewards/rejected": -15.390748023986816,
"step": 6650
},
{
"epoch": 2.694489465153971,
"eval_logits/chosen": -0.9796309471130371,
"eval_logits/rejected": -1.196200966835022,
"eval_logps/chosen": -108.73944854736328,
"eval_logps/rejected": -327.26641845703125,
"eval_loss": 3.71922439512673e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2272489070892334,
"eval_rewards/margins": 18.65962028503418,
"eval_rewards/rejected": -15.432371139526367,
"eval_runtime": 660.0752,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 6650
},
{
"epoch": 2.6985413290113454,
"grad_norm": 4.143021669733571e-06,
"learning_rate": 1.1166141377757767e-06,
"logits/chosen": -0.9760237336158752,
"logits/rejected": -1.1893646717071533,
"logps/chosen": -108.61851501464844,
"logps/rejected": -327.9139404296875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.271268367767334,
"rewards/margins": 18.741382598876953,
"rewards/rejected": -15.470113754272461,
"step": 6660
},
{
"epoch": 2.7025931928687195,
"grad_norm": 2.5221820578735787e-06,
"learning_rate": 1.10160588323578e-06,
"logits/chosen": -0.9682928323745728,
"logits/rejected": -1.1885979175567627,
"logps/chosen": -107.11003875732422,
"logps/rejected": -328.7527770996094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.328941822052002,
"rewards/margins": 18.782878875732422,
"rewards/rejected": -15.453938484191895,
"step": 6670
},
{
"epoch": 2.706645056726094,
"grad_norm": 3.2951190860330826e-06,
"learning_rate": 1.0865976286957827e-06,
"logits/chosen": -0.9695104956626892,
"logits/rejected": -1.1906455755233765,
"logps/chosen": -107.94957733154297,
"logps/rejected": -327.61492919921875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3171699047088623,
"rewards/margins": 18.681623458862305,
"rewards/rejected": -15.364453315734863,
"step": 6680
},
{
"epoch": 2.7106969205834686,
"grad_norm": 1.9521098693076055e-06,
"learning_rate": 1.0715893741557857e-06,
"logits/chosen": -0.9845353364944458,
"logits/rejected": -1.1906646490097046,
"logps/chosen": -109.4488296508789,
"logps/rejected": -326.2509765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2422358989715576,
"rewards/margins": 18.503803253173828,
"rewards/rejected": -15.261566162109375,
"step": 6690
},
{
"epoch": 2.7147487844408427,
"grad_norm": 3.5517336982593406e-06,
"learning_rate": 1.0565811196157887e-06,
"logits/chosen": -0.9753643870353699,
"logits/rejected": -1.1850273609161377,
"logps/chosen": -108.79093933105469,
"logps/rejected": -327.6737060546875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.246598720550537,
"rewards/margins": 18.710622787475586,
"rewards/rejected": -15.46402359008789,
"step": 6700
},
{
"epoch": 2.7147487844408427,
"eval_logits/chosen": -0.978154182434082,
"eval_logits/rejected": -1.194498062133789,
"eval_logps/chosen": -108.75652313232422,
"eval_logps/rejected": -327.4468994140625,
"eval_loss": 3.6394169455888914e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2255406379699707,
"eval_rewards/margins": 18.675954818725586,
"eval_rewards/rejected": -15.450413703918457,
"eval_runtime": 660.1153,
"eval_samples_per_second": 11.216,
"eval_steps_per_second": 0.624,
"step": 6700
},
{
"epoch": 2.718800648298217,
"grad_norm": 4.4465300561569165e-06,
"learning_rate": 1.041572865075792e-06,
"logits/chosen": -0.974888265132904,
"logits/rejected": -1.1830838918685913,
"logps/chosen": -108.81172180175781,
"logps/rejected": -328.89105224609375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.28983211517334,
"rewards/margins": 18.738496780395508,
"rewards/rejected": -15.448664665222168,
"step": 6710
},
{
"epoch": 2.7228525121555913,
"grad_norm": 5.820764727104688e-06,
"learning_rate": 1.0265646105357947e-06,
"logits/chosen": -0.9631332159042358,
"logits/rejected": -1.198506474494934,
"logps/chosen": -108.20296478271484,
"logps/rejected": -329.89849853515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2834346294403076,
"rewards/margins": 18.84991455078125,
"rewards/rejected": -15.566479682922363,
"step": 6720
},
{
"epoch": 2.726904376012966,
"grad_norm": 1.8593394770505256e-06,
"learning_rate": 1.0115563559957977e-06,
"logits/chosen": -0.9674119353294373,
"logits/rejected": -1.1959097385406494,
"logps/chosen": -107.18940734863281,
"logps/rejected": -329.5528869628906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3657302856445312,
"rewards/margins": 18.96901512145996,
"rewards/rejected": -15.60328483581543,
"step": 6730
},
{
"epoch": 2.7309562398703404,
"grad_norm": 2.07598645829421e-06,
"learning_rate": 9.965481014558007e-07,
"logits/chosen": -0.9660282135009766,
"logits/rejected": -1.2024939060211182,
"logps/chosen": -107.80119323730469,
"logps/rejected": -329.72637939453125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.331458806991577,
"rewards/margins": 18.926374435424805,
"rewards/rejected": -15.594915390014648,
"step": 6740
},
{
"epoch": 2.735008103727715,
"grad_norm": 9.826493396758451e-07,
"learning_rate": 9.81539846915804e-07,
"logits/chosen": -0.9771832227706909,
"logits/rejected": -1.191651463508606,
"logps/chosen": -109.6639404296875,
"logps/rejected": -328.5887145996094,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.218618631362915,
"rewards/margins": 18.78942108154297,
"rewards/rejected": -15.570802688598633,
"step": 6750
},
{
"epoch": 2.735008103727715,
"eval_logits/chosen": -1.0023131370544434,
"eval_logits/rejected": -1.211345911026001,
"eval_logps/chosen": -108.87815856933594,
"eval_logps/rejected": -327.7980041503906,
"eval_loss": 3.559854278023522e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2133777141571045,
"eval_rewards/margins": 18.698904037475586,
"eval_rewards/rejected": -15.48552417755127,
"eval_runtime": 660.0792,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 6750
},
{
"epoch": 2.739059967585089,
"grad_norm": 1.8573822444523103e-06,
"learning_rate": 9.665315923758067e-07,
"logits/chosen": -0.9557449221611023,
"logits/rejected": -1.1949938535690308,
"logps/chosen": -107.61819458007812,
"logps/rejected": -330.19622802734375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.296236991882324,
"rewards/margins": 18.978748321533203,
"rewards/rejected": -15.682511329650879,
"step": 6760
},
{
"epoch": 2.7431118314424636,
"grad_norm": 4.063704636791954e-06,
"learning_rate": 9.515233378358097e-07,
"logits/chosen": -0.9694454073905945,
"logits/rejected": -1.2075059413909912,
"logps/chosen": -107.1187515258789,
"logps/rejected": -327.4303283691406,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3184962272644043,
"rewards/margins": 18.786420822143555,
"rewards/rejected": -15.467925071716309,
"step": 6770
},
{
"epoch": 2.7471636952998377,
"grad_norm": 5.965304808341898e-06,
"learning_rate": 9.365150832958128e-07,
"logits/chosen": -0.9721193909645081,
"logits/rejected": -1.2048670053482056,
"logps/chosen": -108.52510833740234,
"logps/rejected": -328.89630126953125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2876505851745605,
"rewards/margins": 18.767431259155273,
"rewards/rejected": -15.479781150817871,
"step": 6780
},
{
"epoch": 2.7512155591572123,
"grad_norm": 1.0380433650425402e-06,
"learning_rate": 9.215068287558157e-07,
"logits/chosen": -0.9637234807014465,
"logits/rejected": -1.194984793663025,
"logps/chosen": -107.27920532226562,
"logps/rejected": -328.76885986328125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3212697505950928,
"rewards/margins": 18.82971954345703,
"rewards/rejected": -15.508450508117676,
"step": 6790
},
{
"epoch": 2.755267423014587,
"grad_norm": 5.067347046860959e-06,
"learning_rate": 9.064985742158187e-07,
"logits/chosen": -0.975241482257843,
"logits/rejected": -1.1849026679992676,
"logps/chosen": -106.6024169921875,
"logps/rejected": -328.2080993652344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.352440118789673,
"rewards/margins": 18.906578063964844,
"rewards/rejected": -15.554136276245117,
"step": 6800
},
{
"epoch": 2.755267423014587,
"eval_logits/chosen": -0.9843966364860535,
"eval_logits/rejected": -1.2008051872253418,
"eval_logps/chosen": -108.77916717529297,
"eval_logps/rejected": -327.68450927734375,
"eval_loss": 3.5788882968290636e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.223276138305664,
"eval_rewards/margins": 18.697452545166016,
"eval_rewards/rejected": -15.474178314208984,
"eval_runtime": 660.1503,
"eval_samples_per_second": 11.216,
"eval_steps_per_second": 0.624,
"step": 6800
},
{
"epoch": 2.7593192868719614,
"grad_norm": 6.067515641916543e-06,
"learning_rate": 8.914903196758217e-07,
"logits/chosen": -0.9731653332710266,
"logits/rejected": -1.206840991973877,
"logps/chosen": -109.11463928222656,
"logps/rejected": -329.27374267578125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2963597774505615,
"rewards/margins": 18.844810485839844,
"rewards/rejected": -15.54845142364502,
"step": 6810
},
{
"epoch": 2.7633711507293355,
"grad_norm": 2.348689349673805e-06,
"learning_rate": 8.764820651358249e-07,
"logits/chosen": -0.986677885055542,
"logits/rejected": -1.2064417600631714,
"logps/chosen": -108.65538787841797,
"logps/rejected": -327.7326965332031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.285518169403076,
"rewards/margins": 18.810688018798828,
"rewards/rejected": -15.525167465209961,
"step": 6820
},
{
"epoch": 2.76742301458671,
"grad_norm": 5.050430900155334e-06,
"learning_rate": 8.614738105958278e-07,
"logits/chosen": -0.9671355485916138,
"logits/rejected": -1.181667447090149,
"logps/chosen": -107.4686050415039,
"logps/rejected": -328.76409912109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.312302589416504,
"rewards/margins": 18.85050392150879,
"rewards/rejected": -15.538204193115234,
"step": 6830
},
{
"epoch": 2.771474878444084,
"grad_norm": 3.911934072675649e-06,
"learning_rate": 8.464655560558308e-07,
"logits/chosen": -0.9895461797714233,
"logits/rejected": -1.1977813243865967,
"logps/chosen": -109.29845428466797,
"logps/rejected": -327.5505065917969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.289475440979004,
"rewards/margins": 18.74016761779785,
"rewards/rejected": -15.450695037841797,
"step": 6840
},
{
"epoch": 2.7755267423014587,
"grad_norm": 1.965021510841325e-06,
"learning_rate": 8.314573015158338e-07,
"logits/chosen": -0.9708042144775391,
"logits/rejected": -1.1981844902038574,
"logps/chosen": -106.59725189208984,
"logps/rejected": -330.02972412109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3511555194854736,
"rewards/margins": 18.995262145996094,
"rewards/rejected": -15.644104957580566,
"step": 6850
},
{
"epoch": 2.7755267423014587,
"eval_logits/chosen": -1.0009392499923706,
"eval_logits/rejected": -1.2106529474258423,
"eval_logps/chosen": -108.86872100830078,
"eval_logps/rejected": -327.986572265625,
"eval_loss": 3.468585774157873e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2143208980560303,
"eval_rewards/margins": 18.71870231628418,
"eval_rewards/rejected": -15.50438404083252,
"eval_runtime": 660.0623,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 6850
},
{
"epoch": 2.7795786061588332,
"grad_norm": 3.210667728126282e-06,
"learning_rate": 8.164490469758369e-07,
"logits/chosen": -0.9684648513793945,
"logits/rejected": -1.1943256855010986,
"logps/chosen": -108.81153106689453,
"logps/rejected": -328.4454345703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2552523612976074,
"rewards/margins": 18.796825408935547,
"rewards/rejected": -15.541571617126465,
"step": 6860
},
{
"epoch": 2.7836304700162073,
"grad_norm": 1.2010252703475999e-06,
"learning_rate": 8.014407924358398e-07,
"logits/chosen": -0.9661147594451904,
"logits/rejected": -1.2026818990707397,
"logps/chosen": -108.54756164550781,
"logps/rejected": -328.1592102050781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2764689922332764,
"rewards/margins": 18.8625545501709,
"rewards/rejected": -15.58608627319336,
"step": 6870
},
{
"epoch": 2.787682333873582,
"grad_norm": 4.421299763635034e-06,
"learning_rate": 7.864325378958428e-07,
"logits/chosen": -0.9725923538208008,
"logits/rejected": -1.1912277936935425,
"logps/chosen": -108.68296813964844,
"logps/rejected": -328.15887451171875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2545135021209717,
"rewards/margins": 18.749614715576172,
"rewards/rejected": -15.495102882385254,
"step": 6880
},
{
"epoch": 2.791734197730956,
"grad_norm": 5.234048330748919e-06,
"learning_rate": 7.714242833558458e-07,
"logits/chosen": -0.9834954738616943,
"logits/rejected": -1.2085795402526855,
"logps/chosen": -106.94400024414062,
"logps/rejected": -328.7509765625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.296764612197876,
"rewards/margins": 18.812835693359375,
"rewards/rejected": -15.516067504882812,
"step": 6890
},
{
"epoch": 2.7957860615883305,
"grad_norm": 2.2638657810603036e-06,
"learning_rate": 7.564160288158488e-07,
"logits/chosen": -0.9776025414466858,
"logits/rejected": -1.1949238777160645,
"logps/chosen": -107.86272430419922,
"logps/rejected": -327.9671936035156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2815756797790527,
"rewards/margins": 18.835134506225586,
"rewards/rejected": -15.553556442260742,
"step": 6900
},
{
"epoch": 2.7957860615883305,
"eval_logits/chosen": -0.9994562864303589,
"eval_logits/rejected": -1.2082576751708984,
"eval_logps/chosen": -108.87102508544922,
"eval_logps/rejected": -328.0704650878906,
"eval_loss": 3.4673938387186354e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.214090347290039,
"eval_rewards/margins": 18.72686195373535,
"eval_rewards/rejected": -15.512771606445312,
"eval_runtime": 660.1232,
"eval_samples_per_second": 11.216,
"eval_steps_per_second": 0.624,
"step": 6900
},
{
"epoch": 2.799837925445705,
"grad_norm": 1.272898316528881e-06,
"learning_rate": 7.414077742758517e-07,
"logits/chosen": -0.9717825651168823,
"logits/rejected": -1.1962286233901978,
"logps/chosen": -107.53852081298828,
"logps/rejected": -329.1290588378906,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3080146312713623,
"rewards/margins": 18.90289306640625,
"rewards/rejected": -15.594879150390625,
"step": 6910
},
{
"epoch": 2.8038897893030796,
"grad_norm": 2.171340611312189e-06,
"learning_rate": 7.263995197358548e-07,
"logits/chosen": -0.9800161719322205,
"logits/rejected": -1.1981581449508667,
"logps/chosen": -108.62446594238281,
"logps/rejected": -328.65447998046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2291815280914307,
"rewards/margins": 18.77030372619629,
"rewards/rejected": -15.54112434387207,
"step": 6920
},
{
"epoch": 2.8079416531604537,
"grad_norm": 2.7905246042791987e-06,
"learning_rate": 7.113912651958578e-07,
"logits/chosen": -0.9674810767173767,
"logits/rejected": -1.1972414255142212,
"logps/chosen": -107.71682739257812,
"logps/rejected": -328.8835754394531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.32235050201416,
"rewards/margins": 18.848758697509766,
"rewards/rejected": -15.526408195495605,
"step": 6930
},
{
"epoch": 2.8119935170178283,
"grad_norm": 3.5024731914745644e-06,
"learning_rate": 6.963830106558608e-07,
"logits/chosen": -0.9778474569320679,
"logits/rejected": -1.1916078329086304,
"logps/chosen": -108.36911010742188,
"logps/rejected": -327.77008056640625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.303269147872925,
"rewards/margins": 18.71904945373535,
"rewards/rejected": -15.41578197479248,
"step": 6940
},
{
"epoch": 2.8160453808752024,
"grad_norm": 1.0694878938011243e-06,
"learning_rate": 6.813747561158637e-07,
"logits/chosen": -0.9754053354263306,
"logits/rejected": -1.2015597820281982,
"logps/chosen": -107.3707046508789,
"logps/rejected": -329.3548889160156,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3287465572357178,
"rewards/margins": 19.000261306762695,
"rewards/rejected": -15.671514511108398,
"step": 6950
},
{
"epoch": 2.8160453808752024,
"eval_logits/chosen": -1.0035643577575684,
"eval_logits/rejected": -1.2130249738693237,
"eval_logps/chosen": -108.90617370605469,
"eval_logps/rejected": -328.15283203125,
"eval_loss": 3.4547639415904996e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.210576295852661,
"eval_rewards/margins": 18.731584548950195,
"eval_rewards/rejected": -15.521010398864746,
"eval_runtime": 660.1721,
"eval_samples_per_second": 11.215,
"eval_steps_per_second": 0.624,
"step": 6950
},
{
"epoch": 2.820097244732577,
"grad_norm": 2.2863562207930954e-06,
"learning_rate": 6.663665015758668e-07,
"logits/chosen": -0.9680902361869812,
"logits/rejected": -1.1875684261322021,
"logps/chosen": -108.46826171875,
"logps/rejected": -329.11334228515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.278618812561035,
"rewards/margins": 18.850582122802734,
"rewards/rejected": -15.571962356567383,
"step": 6960
},
{
"epoch": 2.8241491085899515,
"grad_norm": 2.9234643079689704e-06,
"learning_rate": 6.513582470358698e-07,
"logits/chosen": -0.9727660417556763,
"logits/rejected": -1.2107149362564087,
"logps/chosen": -106.91544342041016,
"logps/rejected": -329.1871337890625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.328211545944214,
"rewards/margins": 18.9506778717041,
"rewards/rejected": -15.622466087341309,
"step": 6970
},
{
"epoch": 2.828200972447326,
"grad_norm": 2.178443310185685e-06,
"learning_rate": 6.363499924958728e-07,
"logits/chosen": -0.9760904908180237,
"logits/rejected": -1.1950515508651733,
"logps/chosen": -108.16962432861328,
"logps/rejected": -328.8347473144531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.301807403564453,
"rewards/margins": 18.828533172607422,
"rewards/rejected": -15.526728630065918,
"step": 6980
},
{
"epoch": 2.8322528363047,
"grad_norm": 1.2093514669686556e-06,
"learning_rate": 6.213417379558758e-07,
"logits/chosen": -0.9775959253311157,
"logits/rejected": -1.197165846824646,
"logps/chosen": -108.63644409179688,
"logps/rejected": -329.37310791015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3316054344177246,
"rewards/margins": 18.91165542602539,
"rewards/rejected": -15.58005142211914,
"step": 6990
},
{
"epoch": 2.8363047001620747,
"grad_norm": 3.0348555810633115e-06,
"learning_rate": 6.063334834158788e-07,
"logits/chosen": -0.9617421627044678,
"logits/rejected": -1.1999685764312744,
"logps/chosen": -108.18900299072266,
"logps/rejected": -329.33526611328125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2798407077789307,
"rewards/margins": 18.769933700561523,
"rewards/rejected": -15.490091323852539,
"step": 7000
},
{
"epoch": 2.8363047001620747,
"eval_logits/chosen": -0.9975866079330444,
"eval_logits/rejected": -1.2070943117141724,
"eval_logps/chosen": -108.84796905517578,
"eval_logps/rejected": -328.05340576171875,
"eval_loss": 3.4508691015844306e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.216395139694214,
"eval_rewards/margins": 18.727460861206055,
"eval_rewards/rejected": -15.511064529418945,
"eval_runtime": 660.1542,
"eval_samples_per_second": 11.216,
"eval_steps_per_second": 0.624,
"step": 7000
},
{
"epoch": 2.840356564019449,
"grad_norm": 1.0463385478942655e-05,
"learning_rate": 5.913252288758818e-07,
"logits/chosen": -0.9831451773643494,
"logits/rejected": -1.1934568881988525,
"logps/chosen": -107.50833129882812,
"logps/rejected": -329.0498046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2817866802215576,
"rewards/margins": 18.812671661376953,
"rewards/rejected": -15.530885696411133,
"step": 7010
},
{
"epoch": 2.8444084278768234,
"grad_norm": 2.905329438362969e-06,
"learning_rate": 5.763169743358848e-07,
"logits/chosen": -0.9958447813987732,
"logits/rejected": -1.2032657861709595,
"logps/chosen": -108.56275939941406,
"logps/rejected": -327.8564758300781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2593607902526855,
"rewards/margins": 18.71350860595703,
"rewards/rejected": -15.454147338867188,
"step": 7020
},
{
"epoch": 2.848460291734198,
"grad_norm": 1.7165253893836052e-06,
"learning_rate": 5.613087197958878e-07,
"logits/chosen": -0.9777650833129883,
"logits/rejected": -1.19744873046875,
"logps/chosen": -107.13492584228516,
"logps/rejected": -328.3821716308594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3172495365142822,
"rewards/margins": 18.87519645690918,
"rewards/rejected": -15.557950019836426,
"step": 7030
},
{
"epoch": 2.852512155591572,
"grad_norm": 2.8005056265101302e-06,
"learning_rate": 5.463004652558908e-07,
"logits/chosen": -0.9703860878944397,
"logits/rejected": -1.1866936683654785,
"logps/chosen": -108.95934295654297,
"logps/rejected": -329.2110595703125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.302504062652588,
"rewards/margins": 18.789155960083008,
"rewards/rejected": -15.486650466918945,
"step": 7040
},
{
"epoch": 2.8565640194489466,
"grad_norm": 8.147613698383793e-06,
"learning_rate": 5.312922107158938e-07,
"logits/chosen": -0.967191755771637,
"logits/rejected": -1.184667706489563,
"logps/chosen": -108.0377197265625,
"logps/rejected": -329.3889465332031,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3172271251678467,
"rewards/margins": 18.912214279174805,
"rewards/rejected": -15.594986915588379,
"step": 7050
},
{
"epoch": 2.8565640194489466,
"eval_logits/chosen": -0.9790101051330566,
"eval_logits/rejected": -1.1940275430679321,
"eval_logps/chosen": -108.73690032958984,
"eval_logps/rejected": -327.8504638671875,
"eval_loss": 3.5015222721312966e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2275032997131348,
"eval_rewards/margins": 18.71827507019043,
"eval_rewards/rejected": -15.490771293640137,
"eval_runtime": 660.0292,
"eval_samples_per_second": 11.218,
"eval_steps_per_second": 0.624,
"step": 7050
},
{
"epoch": 2.8606158833063207,
"grad_norm": 4.085312411916675e-06,
"learning_rate": 5.162839561758968e-07,
"logits/chosen": -0.9736948609352112,
"logits/rejected": -1.1846613883972168,
"logps/chosen": -107.7497329711914,
"logps/rejected": -327.30706787109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.323688507080078,
"rewards/margins": 18.717166900634766,
"rewards/rejected": -15.393479347229004,
"step": 7060
},
{
"epoch": 2.864667747163695,
"grad_norm": 1.921224566103774e-06,
"learning_rate": 5.012757016358997e-07,
"logits/chosen": -0.9630138874053955,
"logits/rejected": -1.1948740482330322,
"logps/chosen": -107.47679901123047,
"logps/rejected": -328.63006591796875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3184473514556885,
"rewards/margins": 18.853111267089844,
"rewards/rejected": -15.534664154052734,
"step": 7070
},
{
"epoch": 2.8687196110210698,
"grad_norm": 2.2141130102681927e-06,
"learning_rate": 4.862674470959027e-07,
"logits/chosen": -0.9536378383636475,
"logits/rejected": -1.1748371124267578,
"logps/chosen": -108.21116638183594,
"logps/rejected": -327.82659912109375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3113667964935303,
"rewards/margins": 18.751161575317383,
"rewards/rejected": -15.43979549407959,
"step": 7080
},
{
"epoch": 2.8727714748784443,
"grad_norm": 1.8589283854453242e-06,
"learning_rate": 4.7125919255590574e-07,
"logits/chosen": -0.9696993231773376,
"logits/rejected": -1.186915636062622,
"logps/chosen": -108.62277221679688,
"logps/rejected": -328.4823303222656,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2551004886627197,
"rewards/margins": 18.794811248779297,
"rewards/rejected": -15.539711952209473,
"step": 7090
},
{
"epoch": 2.8768233387358184,
"grad_norm": 2.2271383386396337e-06,
"learning_rate": 4.562509380159088e-07,
"logits/chosen": -0.965175449848175,
"logits/rejected": -1.1976407766342163,
"logps/chosen": -106.50357055664062,
"logps/rejected": -329.94818115234375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.301396131515503,
"rewards/margins": 18.945039749145508,
"rewards/rejected": -15.643644332885742,
"step": 7100
},
{
"epoch": 2.8768233387358184,
"eval_logits/chosen": -0.9760178327560425,
"eval_logits/rejected": -1.1918087005615234,
"eval_logps/chosen": -108.72132110595703,
"eval_logps/rejected": -327.9184875488281,
"eval_loss": 3.470502107916218e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.229060411453247,
"eval_rewards/margins": 18.72663688659668,
"eval_rewards/rejected": -15.497576713562012,
"eval_runtime": 660.2318,
"eval_samples_per_second": 11.214,
"eval_steps_per_second": 0.624,
"step": 7100
},
{
"epoch": 2.880875202593193,
"grad_norm": 1.2730063190247165e-06,
"learning_rate": 4.4124268347591175e-07,
"logits/chosen": -0.9811935424804688,
"logits/rejected": -1.1913543939590454,
"logps/chosen": -107.50218200683594,
"logps/rejected": -330.5213623046875,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3310484886169434,
"rewards/margins": 19.015869140625,
"rewards/rejected": -15.684819221496582,
"step": 7110
},
{
"epoch": 2.884927066450567,
"grad_norm": 4.248605364409741e-06,
"learning_rate": 4.262344289359148e-07,
"logits/chosen": -0.9625168442726135,
"logits/rejected": -1.1951909065246582,
"logps/chosen": -108.038818359375,
"logps/rejected": -329.1755065917969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3060390949249268,
"rewards/margins": 18.852630615234375,
"rewards/rejected": -15.546589851379395,
"step": 7120
},
{
"epoch": 2.8889789303079416,
"grad_norm": 1.0449755791341886e-05,
"learning_rate": 4.1122617439591776e-07,
"logits/chosen": -0.9882882237434387,
"logits/rejected": -1.2146639823913574,
"logps/chosen": -108.18170928955078,
"logps/rejected": -329.3057556152344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3227803707122803,
"rewards/margins": 18.88628387451172,
"rewards/rejected": -15.563502311706543,
"step": 7130
},
{
"epoch": 2.893030794165316,
"grad_norm": 1.9005619833478704e-06,
"learning_rate": 3.962179198559208e-07,
"logits/chosen": -0.9830000996589661,
"logits/rejected": -1.2070900201797485,
"logps/chosen": -106.76356506347656,
"logps/rejected": -328.2959289550781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.338989734649658,
"rewards/margins": 18.85256004333496,
"rewards/rejected": -15.513567924499512,
"step": 7140
},
{
"epoch": 2.8970826580226903,
"grad_norm": 1.0993232990585966e-06,
"learning_rate": 3.8120966531592377e-07,
"logits/chosen": -0.964229941368103,
"logits/rejected": -1.2030060291290283,
"logps/chosen": -107.37648010253906,
"logps/rejected": -328.80023193359375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3193697929382324,
"rewards/margins": 18.8880558013916,
"rewards/rejected": -15.568682670593262,
"step": 7150
},
{
"epoch": 2.8970826580226903,
"eval_logits/chosen": -0.9820052981376648,
"eval_logits/rejected": -1.1988831758499146,
"eval_logps/chosen": -108.72232818603516,
"eval_logps/rejected": -327.9479675292969,
"eval_loss": 3.464391085117313e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.228959083557129,
"eval_rewards/margins": 18.729480743408203,
"eval_rewards/rejected": -15.50052261352539,
"eval_runtime": 659.9129,
"eval_samples_per_second": 11.22,
"eval_steps_per_second": 0.624,
"step": 7150
},
{
"epoch": 2.901134521880065,
"grad_norm": 1.8366931726632174e-06,
"learning_rate": 3.662014107759268e-07,
"logits/chosen": -0.9971921443939209,
"logits/rejected": -1.206737995147705,
"logps/chosen": -108.55390167236328,
"logps/rejected": -329.0882263183594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2648727893829346,
"rewards/margins": 18.834712982177734,
"rewards/rejected": -15.569838523864746,
"step": 7160
},
{
"epoch": 2.9051863857374394,
"grad_norm": 7.031257155176718e-06,
"learning_rate": 3.511931562359298e-07,
"logits/chosen": -0.960989236831665,
"logits/rejected": -1.181280255317688,
"logps/chosen": -108.57195281982422,
"logps/rejected": -328.79034423828125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.295433521270752,
"rewards/margins": 18.852262496948242,
"rewards/rejected": -15.556829452514648,
"step": 7170
},
{
"epoch": 2.9092382495948135,
"grad_norm": 5.850887987435271e-07,
"learning_rate": 3.3618490169593283e-07,
"logits/chosen": -0.981634259223938,
"logits/rejected": -1.1981111764907837,
"logps/chosen": -108.1755599975586,
"logps/rejected": -329.65478515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3291821479797363,
"rewards/margins": 18.9754581451416,
"rewards/rejected": -15.646275520324707,
"step": 7180
},
{
"epoch": 2.913290113452188,
"grad_norm": 2.3675963802816113e-06,
"learning_rate": 3.211766471559358e-07,
"logits/chosen": -0.9758962392807007,
"logits/rejected": -1.2017302513122559,
"logps/chosen": -106.78636169433594,
"logps/rejected": -328.0531921386719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.330303907394409,
"rewards/margins": 18.92644691467285,
"rewards/rejected": -15.59614086151123,
"step": 7190
},
{
"epoch": 2.9173419773095626,
"grad_norm": 1.4073903003009036e-06,
"learning_rate": 3.061683926159388e-07,
"logits/chosen": -0.9870431423187256,
"logits/rejected": -1.2174499034881592,
"logps/chosen": -107.156494140625,
"logps/rejected": -330.21923828125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3315341472625732,
"rewards/margins": 18.96674346923828,
"rewards/rejected": -15.635211944580078,
"step": 7200
},
{
"epoch": 2.9173419773095626,
"eval_logits/chosen": -0.9757615327835083,
"eval_logits/rejected": -1.191585898399353,
"eval_logps/chosen": -108.72256469726562,
"eval_logps/rejected": -328.0598449707031,
"eval_loss": 3.425428474201908e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.2289371490478516,
"eval_rewards/margins": 18.74064826965332,
"eval_rewards/rejected": -15.511712074279785,
"eval_runtime": 660.0554,
"eval_samples_per_second": 11.217,
"eval_steps_per_second": 0.624,
"step": 7200
},
{
"epoch": 2.9213938411669367,
"grad_norm": 1.2767155794790597e-06,
"learning_rate": 2.911601380759418e-07,
"logits/chosen": -0.9767635464668274,
"logits/rejected": -1.2136743068695068,
"logps/chosen": -108.12942504882812,
"logps/rejected": -329.66217041015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.31459379196167,
"rewards/margins": 18.887969970703125,
"rewards/rejected": -15.573376655578613,
"step": 7210
},
{
"epoch": 2.9254457050243112,
"grad_norm": 1.7550073607708327e-06,
"learning_rate": 2.761518835359448e-07,
"logits/chosen": -0.9704033136367798,
"logits/rejected": -1.2008793354034424,
"logps/chosen": -108.53214263916016,
"logps/rejected": -329.1427917480469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2905702590942383,
"rewards/margins": 18.85349464416504,
"rewards/rejected": -15.562925338745117,
"step": 7220
},
{
"epoch": 2.9294975688816853,
"grad_norm": 3.6414326132216956e-06,
"learning_rate": 2.611436289959478e-07,
"logits/chosen": -0.9911782145500183,
"logits/rejected": -1.2128431797027588,
"logps/chosen": -108.56273651123047,
"logps/rejected": -330.3154602050781,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.275686025619507,
"rewards/margins": 18.83922004699707,
"rewards/rejected": -15.563532829284668,
"step": 7230
},
{
"epoch": 2.93354943273906,
"grad_norm": 2.858848802134162e-06,
"learning_rate": 2.461353744559508e-07,
"logits/chosen": -0.9635599255561829,
"logits/rejected": -1.1884490251541138,
"logps/chosen": -106.62367248535156,
"logps/rejected": -328.25146484375,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3598275184631348,
"rewards/margins": 18.809885025024414,
"rewards/rejected": -15.450057029724121,
"step": 7240
},
{
"epoch": 2.9376012965964344,
"grad_norm": 1.2439679721865105e-06,
"learning_rate": 2.3112711991595378e-07,
"logits/chosen": -0.9607151746749878,
"logits/rejected": -1.1821510791778564,
"logps/chosen": -106.63765716552734,
"logps/rejected": -328.87701416015625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.344393491744995,
"rewards/margins": 18.921140670776367,
"rewards/rejected": -15.576745986938477,
"step": 7250
},
{
"epoch": 2.9376012965964344,
"eval_logits/chosen": -0.9811464548110962,
"eval_logits/rejected": -1.196897268295288,
"eval_logps/chosen": -108.70677185058594,
"eval_logps/rejected": -328.0516662597656,
"eval_loss": 3.425665440204284e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.230515956878662,
"eval_rewards/margins": 18.741403579711914,
"eval_rewards/rejected": -15.510887145996094,
"eval_runtime": 659.9462,
"eval_samples_per_second": 11.219,
"eval_steps_per_second": 0.624,
"step": 7250
},
{
"epoch": 2.941653160453809,
"grad_norm": 1.9038395748793846e-06,
"learning_rate": 2.1611886537595678e-07,
"logits/chosen": -0.9633909463882446,
"logits/rejected": -1.1942411661148071,
"logps/chosen": -107.4720230102539,
"logps/rejected": -328.3365478515625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3182427883148193,
"rewards/margins": 18.803630828857422,
"rewards/rejected": -15.485390663146973,
"step": 7260
},
{
"epoch": 2.945705024311183,
"grad_norm": 1.439689867765992e-06,
"learning_rate": 2.0111061083595979e-07,
"logits/chosen": -0.9990869164466858,
"logits/rejected": -1.2175521850585938,
"logps/chosen": -107.74435424804688,
"logps/rejected": -331.8654479980469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.2828431129455566,
"rewards/margins": 19.112253189086914,
"rewards/rejected": -15.829410552978516,
"step": 7270
},
{
"epoch": 2.9497568881685576,
"grad_norm": 1.8770879250951111e-06,
"learning_rate": 1.861023562959628e-07,
"logits/chosen": -0.9633672833442688,
"logits/rejected": -1.185795545578003,
"logps/chosen": -108.7204818725586,
"logps/rejected": -329.3869323730469,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.327587127685547,
"rewards/margins": 18.815723419189453,
"rewards/rejected": -15.488137245178223,
"step": 7280
},
{
"epoch": 2.9538087520259317,
"grad_norm": 2.6701447950472357e-06,
"learning_rate": 1.710941017559658e-07,
"logits/chosen": -0.9650854468345642,
"logits/rejected": -1.1963393688201904,
"logps/chosen": -107.19867706298828,
"logps/rejected": -328.4620056152344,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3577048778533936,
"rewards/margins": 18.849342346191406,
"rewards/rejected": -15.491637229919434,
"step": 7290
},
{
"epoch": 2.9578606158833063,
"grad_norm": 7.110392743925331e-06,
"learning_rate": 1.560858472159688e-07,
"logits/chosen": -0.9818698763847351,
"logits/rejected": -1.1954624652862549,
"logps/chosen": -106.72434997558594,
"logps/rejected": -328.2565612792969,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.324738025665283,
"rewards/margins": 18.763063430786133,
"rewards/rejected": -15.438325881958008,
"step": 7300
},
{
"epoch": 2.9578606158833063,
"eval_logits/chosen": -0.9837020039558411,
"eval_logits/rejected": -1.1994996070861816,
"eval_logps/chosen": -108.7364730834961,
"eval_logps/rejected": -328.1881103515625,
"eval_loss": 3.400739245762452e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.227546453475952,
"eval_rewards/margins": 18.752079010009766,
"eval_rewards/rejected": -15.524532318115234,
"eval_runtime": 659.4143,
"eval_samples_per_second": 11.228,
"eval_steps_per_second": 0.625,
"step": 7300
},
{
"epoch": 2.961912479740681,
"grad_norm": 9.207852258441562e-07,
"learning_rate": 1.410775926759718e-07,
"logits/chosen": -0.9928681254386902,
"logits/rejected": -1.2284150123596191,
"logps/chosen": -106.771240234375,
"logps/rejected": -330.71417236328125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.34260630607605,
"rewards/margins": 19.015148162841797,
"rewards/rejected": -15.6725435256958,
"step": 7310
},
{
"epoch": 2.965964343598055,
"grad_norm": 1.3852826441507204e-06,
"learning_rate": 1.260693381359748e-07,
"logits/chosen": -0.9731549620628357,
"logits/rejected": -1.200088620185852,
"logps/chosen": -107.93476867675781,
"logps/rejected": -329.5440673828125,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.272829532623291,
"rewards/margins": 18.86159324645996,
"rewards/rejected": -15.588763236999512,
"step": 7320
},
{
"epoch": 2.9700162074554295,
"grad_norm": 2.1593209567072336e-06,
"learning_rate": 1.110610835959778e-07,
"logits/chosen": -0.9732111692428589,
"logits/rejected": -1.1930580139160156,
"logps/chosen": -108.34236907958984,
"logps/rejected": -329.2429504394531,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3482120037078857,
"rewards/margins": 18.90915870666504,
"rewards/rejected": -15.56094741821289,
"step": 7330
},
{
"epoch": 2.974068071312804,
"grad_norm": 1.5361877103714505e-06,
"learning_rate": 9.60528290559808e-08,
"logits/chosen": -0.977744996547699,
"logits/rejected": -1.1999133825302124,
"logps/chosen": -107.92412567138672,
"logps/rejected": -330.2553405761719,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.3247008323669434,
"rewards/margins": 19.007099151611328,
"rewards/rejected": -15.682397842407227,
"step": 7340
},
{
"epoch": 2.978119935170178,
"grad_norm": 1.2273446373001207e-05,
"learning_rate": 8.10445745159838e-08,
"logits/chosen": -0.9679704308509827,
"logits/rejected": -1.1986968517303467,
"logps/chosen": -107.73753356933594,
"logps/rejected": -331.9222106933594,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": 3.320899724960327,
"rewards/margins": 19.121126174926758,
"rewards/rejected": -15.800227165222168,
"step": 7350
},
{
"epoch": 2.978119935170178,
"eval_logits/chosen": -0.9848833680152893,
"eval_logits/rejected": -1.20034921169281,
"eval_logps/chosen": -108.74987030029297,
"eval_logps/rejected": -328.1879577636719,
"eval_loss": 3.39335244348149e-08,
"eval_rewards/accuracies": 1.0,
"eval_rewards/chosen": 3.226205587387085,
"eval_rewards/margins": 18.750720977783203,
"eval_rewards/rejected": -15.524516105651855,
"eval_runtime": 660.1187,
"eval_samples_per_second": 11.216,
"eval_steps_per_second": 0.624,
"step": 7350
}
],
"logging_steps": 10,
"max_steps": 7404,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 9,
"trial_name": null,
"trial_params": null
}