{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 80, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 76.0, "completions/mean_terminated_length": 76.0, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.5930478672186533, "epoch": 0.0125, "frac_reward_zero_std": 0.0, "grad_norm": 90.51835632324219, "learning_rate": 0.0, "loss": 0.0148, "num_tokens": 31696.0, "reward": 5.76389217376709, "reward_std": 3.3388309478759766, "rewards/traffic_reward_func/mean": 5.763891696929932, "rewards/traffic_reward_func/std": 3.277735948562622, "step": 1 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 78.0, "completions/max_terminated_length": 78.0, "completions/mean_length": 65.33333587646484, "completions/mean_terminated_length": 65.33333587646484, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.48857787748177844, "epoch": 0.025, "frac_reward_zero_std": 0.0, "grad_norm": 48.55084228515625, "learning_rate": 2.3137821315975918e-07, "loss": 0.0205, "num_tokens": 55156.0, "reward": 4.936108589172363, "reward_std": 3.530048370361328, "rewards/traffic_reward_func/mean": 4.936108112335205, "rewards/traffic_reward_func/std": 3.691174030303955, "step": 2 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 109.0, "completions/max_terminated_length": 109.0, "completions/mean_length": 75.0, "completions/mean_terminated_length": 75.0, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.587461918592453, "epoch": 0.0375, "frac_reward_zero_std": 0.0, "grad_norm": 48.531009674072266, "learning_rate": 3.6672579134208467e-07, "loss": -0.0191, "num_tokens": 93576.0, "reward": 4.0694499015808105, "reward_std": 3.6731364727020264, "rewards/traffic_reward_func/mean": 4.0694499015808105, "rewards/traffic_reward_func/std": 3.8600118160247803, "step": 3 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 87.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 74.33333587646484, "completions/mean_terminated_length": 74.33333587646484, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.5151417702436447, "epoch": 0.05, "frac_reward_zero_std": 0.0, "grad_norm": 134.0212860107422, "learning_rate": 4.6275642631951835e-07, "loss": 0.0286, "num_tokens": 136940.0, "reward": 3.7013919353485107, "reward_std": 1.9124457836151123, "rewards/traffic_reward_func/mean": 3.7013919353485107, "rewards/traffic_reward_func/std": 3.7552192211151123, "step": 4 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 110.0, "completions/max_terminated_length": 110.0, "completions/mean_length": 84.83333587646484, "completions/mean_terminated_length": 84.83333587646484, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.5207065145174662, "epoch": 0.0625, "frac_reward_zero_std": 0.0, "grad_norm": 45.01969528198242, "learning_rate": 5.372435736804816e-07, "loss": 0.0097, "num_tokens": 170278.0, "reward": 3.5027918815612793, "reward_std": 1.3773735761642456, "rewards/traffic_reward_func/mean": 3.5027916431427, "rewards/traffic_reward_func/std": 4.128313064575195, "step": 5 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 97.0, "completions/max_terminated_length": 97.0, "completions/mean_length": 73.41667175292969, "completions/mean_terminated_length": 73.41667175292969, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.5358039538065592, "epoch": 0.075, "frac_reward_zero_std": 0.0, "grad_norm": 62.962738037109375, "learning_rate": 5.981040045018438e-07, "loss": -0.0652, "num_tokens": 184675.0, "reward": 6.37082576751709, "reward_std": 2.680429458618164, "rewards/traffic_reward_func/mean": 6.370825290679932, "rewards/traffic_reward_func/std": 2.830486536026001, "step": 6 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 99.0, "completions/max_terminated_length": 99.0, "completions/mean_length": 72.16667175292969, "completions/mean_terminated_length": 72.16667175292969, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.5199788709481558, "epoch": 0.0875, "frac_reward_zero_std": 0.0, "grad_norm": 48.52009201049805, "learning_rate": 6.495607655709434e-07, "loss": -0.0538, "num_tokens": 220077.0, "reward": 2.575000286102295, "reward_std": 2.032099723815918, "rewards/traffic_reward_func/mean": 2.575000047683716, "rewards/traffic_reward_func/std": 3.287407159805298, "step": 7 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 93.0, "completions/max_terminated_length": 93.0, "completions/mean_length": 74.41667175292969, "completions/mean_terminated_length": 74.41667175292969, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.5326513946056366, "epoch": 0.1, "frac_reward_zero_std": 0.0, "grad_norm": 51.77104949951172, "learning_rate": 6.941346394792774e-07, "loss": 0.0029, "num_tokens": 254770.0, "reward": 4.1870503425598145, "reward_std": 3.616281509399414, "rewards/traffic_reward_func/mean": 4.1870503425598145, "rewards/traffic_reward_func/std": 3.6269490718841553, "step": 8 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 120.0, "completions/max_terminated_length": 120.0, "completions/mean_length": 75.75, "completions/mean_terminated_length": 75.75, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.5402362247308096, "epoch": 0.1125, "frac_reward_zero_std": 0.0, "grad_norm": 24.48263168334961, "learning_rate": 7.334515826841693e-07, "loss": -0.043, "num_tokens": 284315.0, "reward": 3.6986165046691895, "reward_std": 3.3095173835754395, "rewards/traffic_reward_func/mean": 3.6986167430877686, "rewards/traffic_reward_func/std": 3.810101270675659, "step": 9 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 133.0, "completions/max_terminated_length": 133.0, "completions/mean_length": 91.66667175292969, "completions/mean_terminated_length": 91.66667175292969, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.5282839934031168, "epoch": 0.125, "frac_reward_zero_std": 0.0, "grad_norm": 21.92542266845703, "learning_rate": 7.686217868402409e-07, "loss": 0.0344, "num_tokens": 342115.0, "reward": 4.9666666984558105, "reward_std": 3.0202672481536865, "rewards/traffic_reward_func/mean": 4.9666666984558105, "rewards/traffic_reward_func/std": 4.13976526260376, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 104.0, "completions/max_terminated_length": 104.0, "completions/mean_length": 82.75, "completions/mean_terminated_length": 82.75, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.5616102963685989, "epoch": 0.1375, "frac_reward_zero_std": 0.0, "grad_norm": 60.28784942626953, "learning_rate": 8.004371064686714e-07, "loss": 0.0296, "num_tokens": 391732.0, "reward": 3.715291976928711, "reward_std": 2.362664222717285, "rewards/traffic_reward_func/mean": 3.715291976928711, "rewards/traffic_reward_func/std": 3.636319637298584, "step": 11 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 95.0, "completions/max_terminated_length": 95.0, "completions/mean_length": 75.33333587646484, "completions/mean_terminated_length": 75.33333587646484, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.5451353937387466, "epoch": 0.15, "frac_reward_zero_std": 0.0, "grad_norm": 51.164581298828125, "learning_rate": 8.29482217661603e-07, "loss": 0.0875, "num_tokens": 419576.0, "reward": 3.2374916076660156, "reward_std": 1.5012121200561523, "rewards/traffic_reward_func/mean": 3.2374916076660156, "rewards/traffic_reward_func/std": 4.025315284729004, "step": 12 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 101.0, "completions/max_terminated_length": 101.0, "completions/mean_length": 78.83333587646484, "completions/mean_terminated_length": 78.83333587646484, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.4967418909072876, "epoch": 0.1625, "frac_reward_zero_std": 0.0, "grad_norm": 39.67502212524414, "learning_rate": 8.562011298888888e-07, "loss": 0.0542, "num_tokens": 451066.0, "reward": 3.8458499908447266, "reward_std": 3.0185961723327637, "rewards/traffic_reward_func/mean": 3.8458499908447266, "rewards/traffic_reward_func/std": 3.0665249824523926, "step": 13 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 85.0, "completions/max_terminated_length": 85.0, "completions/mean_length": 72.16667175292969, "completions/mean_terminated_length": 72.16667175292969, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.46256470680236816, "epoch": 0.175, "frac_reward_zero_std": 0.0, "grad_norm": 36.632110595703125, "learning_rate": 8.809389787307026e-07, "loss": 0.0518, "num_tokens": 481264.0, "reward": 5.415283203125, "reward_std": 3.098494529724121, "rewards/traffic_reward_func/mean": 5.415283203125, "rewards/traffic_reward_func/std": 3.7558400630950928, "step": 14 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 119.0, "completions/max_terminated_length": 119.0, "completions/mean_length": 81.83333587646484, "completions/mean_terminated_length": 81.83333587646484, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.4841439475615819, "epoch": 0.1875, "frac_reward_zero_std": 0.0, "grad_norm": 49.08949279785156, "learning_rate": 9.039693650225662e-07, "loss": -0.0929, "num_tokens": 516870.0, "reward": 5.422224998474121, "reward_std": 2.106595039367676, "rewards/traffic_reward_func/mean": 5.422224521636963, "rewards/traffic_reward_func/std": 2.377295970916748, "step": 15 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 116.0, "completions/max_terminated_length": 116.0, "completions/mean_length": 82.25, "completions/mean_terminated_length": 82.25, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.5850350757439932, "epoch": 0.2, "frac_reward_zero_std": 0.0, "grad_norm": 32.39323425292969, "learning_rate": 9.255128526390367e-07, "loss": 0.0266, "num_tokens": 554513.0, "reward": 3.019458293914795, "reward_std": 0.3986830711364746, "rewards/traffic_reward_func/mean": 3.019458055496216, "rewards/traffic_reward_func/std": 3.730907678604126, "step": 16 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 114.0, "completions/max_terminated_length": 114.0, "completions/mean_length": 85.75, "completions/mean_terminated_length": 85.75, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.506961981455485, "epoch": 0.2125, "frac_reward_zero_std": 0.0, "grad_norm": 188.8520050048828, "learning_rate": 9.45749848565416e-07, "loss": -0.0265, "num_tokens": 578918.0, "reward": 6.918058395385742, "reward_std": 0.7207190990447998, "rewards/traffic_reward_func/mean": 6.918058395385742, "rewards/traffic_reward_func/std": 0.8269808292388916, "step": 17 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 106.0, "completions/max_terminated_length": 106.0, "completions/mean_length": 81.75, "completions/mean_terminated_length": 81.75, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.5057271818319956, "epoch": 0.225, "frac_reward_zero_std": 0.0, "grad_norm": 52.07399368286133, "learning_rate": 9.648297958439284e-07, "loss": -0.0183, "num_tokens": 604291.0, "reward": 2.5041751861572266, "reward_std": 2.239223003387451, "rewards/traffic_reward_func/mean": 2.5041749477386475, "rewards/traffic_reward_func/std": 2.6732337474823, "step": 18 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 107.0, "completions/max_terminated_length": 107.0, "completions/mean_length": 79.33333587646484, "completions/mean_terminated_length": 79.33333587646484, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.49002426366011304, "epoch": 0.2375, "frac_reward_zero_std": 0.0, "grad_norm": 49.835079193115234, "learning_rate": 9.828778776927557e-07, "loss": 0.0385, "num_tokens": 620123.0, "reward": 5.941667079925537, "reward_std": 0.5195273160934448, "rewards/traffic_reward_func/mean": 5.941667079925537, "rewards/traffic_reward_func/std": 4.17319917678833, "step": 19 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 94.0, "completions/max_terminated_length": 94.0, "completions/mean_length": 77.08333587646484, "completions/mean_terminated_length": 77.08333587646484, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.5183714032173157, "epoch": 0.25, "frac_reward_zero_std": 0.0, "grad_norm": 36.613128662109375, "learning_rate": 1e-06, "loss": 0.0062, "num_tokens": 666712.0, "reward": 1.4916582107543945, "reward_std": 1.6954081058502197, "rewards/traffic_reward_func/mean": 1.491658329963684, "rewards/traffic_reward_func/std": 2.9001410007476807, "step": 20 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 115.0, "completions/max_terminated_length": 115.0, "completions/mean_length": 89.75, "completions/mean_terminated_length": 89.75, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.5492318073908488, "epoch": 0.2625, "frac_reward_zero_std": 0.0, "grad_norm": 24.955896377563477, "learning_rate": 1e-06, "loss": -0.0454, "num_tokens": 707297.0, "reward": 4.256950378417969, "reward_std": 3.439373731613159, "rewards/traffic_reward_func/mean": 4.2569499015808105, "rewards/traffic_reward_func/std": 3.1874282360076904, "step": 21 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 102.0, "completions/max_terminated_length": 102.0, "completions/mean_length": 81.58333587646484, "completions/mean_terminated_length": 81.58333587646484, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.5593699812889099, "epoch": 0.275, "frac_reward_zero_std": 0.0, "grad_norm": 41.32038116455078, "learning_rate": 1e-06, "loss": -0.0316, "num_tokens": 727540.0, "reward": 3.834716796875, "reward_std": 3.1437413692474365, "rewards/traffic_reward_func/mean": 3.834716796875, "rewards/traffic_reward_func/std": 2.9495410919189453, "step": 22 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 104.0, "completions/max_terminated_length": 104.0, "completions/mean_length": 79.91667175292969, "completions/mean_terminated_length": 79.91667175292969, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.47043687105178833, "epoch": 0.2875, "frac_reward_zero_std": 0.0, "grad_norm": 38.11423873901367, "learning_rate": 1e-06, "loss": 0.0469, "num_tokens": 768527.0, "reward": 5.273616790771484, "reward_std": 1.5386489629745483, "rewards/traffic_reward_func/mean": 5.273616313934326, "rewards/traffic_reward_func/std": 3.3327481746673584, "step": 23 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 92.0, "completions/max_terminated_length": 92.0, "completions/mean_length": 73.75, "completions/mean_terminated_length": 73.75, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.491796538233757, "epoch": 0.3, "frac_reward_zero_std": 0.0, "grad_norm": 34.17938995361328, "learning_rate": 1e-06, "loss": -0.0535, "num_tokens": 798836.0, "reward": 5.034725189208984, "reward_std": 3.6063766479492188, "rewards/traffic_reward_func/mean": 5.034725189208984, "rewards/traffic_reward_func/std": 3.413700819015503, "step": 24 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 105.0, "completions/max_terminated_length": 105.0, "completions/mean_length": 78.58333587646484, "completions/mean_terminated_length": 78.58333587646484, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.515800267457962, "epoch": 0.3125, "frac_reward_zero_std": 0.0, "grad_norm": 49.790279388427734, "learning_rate": 1e-06, "loss": 0.1052, "num_tokens": 850955.0, "reward": 5.030575275421143, "reward_std": 1.0347952842712402, "rewards/traffic_reward_func/mean": 5.030575275421143, "rewards/traffic_reward_func/std": 3.7490885257720947, "step": 25 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 100.0, "completions/max_terminated_length": 100.0, "completions/mean_length": 80.75, "completions/mean_terminated_length": 80.75, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.5148407767216364, "epoch": 0.325, "frac_reward_zero_std": 0.0, "grad_norm": 40.39106369018555, "learning_rate": 1e-06, "loss": -0.0604, "num_tokens": 887936.0, "reward": 3.543058395385742, "reward_std": 1.2134441137313843, "rewards/traffic_reward_func/mean": 3.543058395385742, "rewards/traffic_reward_func/std": 3.9768006801605225, "step": 26 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 94.0, "completions/max_terminated_length": 94.0, "completions/mean_length": 70.91667175292969, "completions/mean_terminated_length": 70.91667175292969, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.43037260075410205, "epoch": 0.3375, "frac_reward_zero_std": 0.0, "grad_norm": 51.63254165649414, "learning_rate": 1e-06, "loss": -0.0275, "num_tokens": 923235.0, "reward": 4.638883590698242, "reward_std": 2.003594160079956, "rewards/traffic_reward_func/mean": 4.638883113861084, "rewards/traffic_reward_func/std": 4.541528224945068, "step": 27 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 114.0, "completions/max_terminated_length": 114.0, "completions/mean_length": 77.83333587646484, "completions/mean_terminated_length": 77.83333587646484, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.4802086055278778, "epoch": 0.35, "frac_reward_zero_std": 0.0, "grad_norm": 50.77159118652344, "learning_rate": 1e-06, "loss": 0.0246, "num_tokens": 975865.0, "reward": 5.4055585861206055, "reward_std": 0.9993247389793396, "rewards/traffic_reward_func/mean": 5.405558109283447, "rewards/traffic_reward_func/std": 4.432521820068359, "step": 28 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 111.0, "completions/max_terminated_length": 111.0, "completions/mean_length": 75.83333587646484, "completions/mean_terminated_length": 75.83333587646484, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.5248066335916519, "epoch": 0.3625, "frac_reward_zero_std": 0.0, "grad_norm": 29.308929443359375, "learning_rate": 1e-06, "loss": -0.0054, "num_tokens": 1021355.0, "reward": 5.527783393859863, "reward_std": 0.9038121700286865, "rewards/traffic_reward_func/mean": 5.527782917022705, "rewards/traffic_reward_func/std": 4.4734015464782715, "step": 29 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 94.0, "completions/max_terminated_length": 94.0, "completions/mean_length": 70.5, "completions/mean_terminated_length": 70.5, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.49029021461804706, "epoch": 0.375, "frac_reward_zero_std": 0.0, "grad_norm": 36.470375061035156, "learning_rate": 1e-06, "loss": 0.0945, "num_tokens": 1041501.0, "reward": 7.425000190734863, "reward_std": 2.3710060119628906, "rewards/traffic_reward_func/mean": 7.424999713897705, "rewards/traffic_reward_func/std": 3.4395759105682373, "step": 30 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 115.0, "completions/max_terminated_length": 115.0, "completions/mean_length": 74.91667175292969, "completions/mean_terminated_length": 74.91667175292969, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.4614233573277791, "epoch": 0.3875, "frac_reward_zero_std": 0.0, "grad_norm": 40.14723587036133, "learning_rate": 1e-06, "loss": -0.0033, "num_tokens": 1082024.0, "reward": 2.5138919353485107, "reward_std": 3.217278242111206, "rewards/traffic_reward_func/mean": 2.5138919353485107, "rewards/traffic_reward_func/std": 3.1958131790161133, "step": 31 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 113.0, "completions/max_terminated_length": 113.0, "completions/mean_length": 82.25, "completions/mean_terminated_length": 82.25, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.47699304421742755, "epoch": 0.4, "frac_reward_zero_std": 0.0, "grad_norm": 35.038387298583984, "learning_rate": 1e-06, "loss": 0.0313, "num_tokens": 1111535.0, "reward": 3.4027748107910156, "reward_std": 2.7580385208129883, "rewards/traffic_reward_func/mean": 3.4027748107910156, "rewards/traffic_reward_func/std": 3.510051965713501, "step": 32 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 109.0, "completions/max_terminated_length": 109.0, "completions/mean_length": 81.83333587646484, "completions/mean_terminated_length": 81.83333587646484, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.4661006381114324, "epoch": 0.4125, "frac_reward_zero_std": 0.0, "grad_norm": 27.36323356628418, "learning_rate": 1e-06, "loss": 0.0217, "num_tokens": 1129873.0, "reward": 3.373616933822632, "reward_std": 0.5916072130203247, "rewards/traffic_reward_func/mean": 3.373616933822632, "rewards/traffic_reward_func/std": 3.97894549369812, "step": 33 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 106.0, "completions/max_terminated_length": 106.0, "completions/mean_length": 79.91667175292969, "completions/mean_terminated_length": 79.91667175292969, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.5415816406408945, "epoch": 0.425, "frac_reward_zero_std": 0.0, "grad_norm": 49.570030212402344, "learning_rate": 1e-06, "loss": 0.0021, "num_tokens": 1168776.0, "reward": 3.1805667877197266, "reward_std": 1.868180751800537, "rewards/traffic_reward_func/mean": 3.1805667877197266, "rewards/traffic_reward_func/std": 3.855158567428589, "step": 34 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 100.0, "completions/max_terminated_length": 100.0, "completions/mean_length": 76.41667175292969, "completions/mean_terminated_length": 76.41667175292969, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.4782920181751251, "epoch": 0.4375, "frac_reward_zero_std": 0.0, "grad_norm": 43.71452713012695, "learning_rate": 1e-06, "loss": 0.0029, "num_tokens": 1185697.0, "reward": 4.708350658416748, "reward_std": 3.080965757369995, "rewards/traffic_reward_func/mean": 4.708349704742432, "rewards/traffic_reward_func/std": 3.2441697120666504, "step": 35 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 81.0, "completions/max_terminated_length": 81.0, "completions/mean_length": 66.5, "completions/mean_terminated_length": 66.5, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.39282474915186566, "epoch": 0.45, "frac_reward_zero_std": 0.0, "grad_norm": 21.168304443359375, "learning_rate": 1e-06, "loss": -0.0108, "num_tokens": 1197535.0, "reward": 4.433341979980469, "reward_std": 1.4528138637542725, "rewards/traffic_reward_func/mean": 4.4333415031433105, "rewards/traffic_reward_func/std": 4.101103782653809, "step": 36 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 90.0, "completions/max_terminated_length": 90.0, "completions/mean_length": 70.0, "completions/mean_terminated_length": 70.0, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.5816979706287384, "epoch": 0.4625, "frac_reward_zero_std": 0.0, "grad_norm": 29.439083099365234, "learning_rate": 1e-06, "loss": -0.0492, "num_tokens": 1234363.0, "reward": 2.4597251415252686, "reward_std": 2.4156336784362793, "rewards/traffic_reward_func/mean": 2.4597251415252686, "rewards/traffic_reward_func/std": 3.5065743923187256, "step": 37 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 99.0, "completions/max_terminated_length": 99.0, "completions/mean_length": 74.5, "completions/mean_terminated_length": 74.5, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.5000238766272863, "epoch": 0.475, "frac_reward_zero_std": 0.0, "grad_norm": 23.74506187438965, "learning_rate": 1e-06, "loss": -0.0571, "num_tokens": 1263281.0, "reward": 5.895825386047363, "reward_std": 1.9191408157348633, "rewards/traffic_reward_func/mean": 5.895824909210205, "rewards/traffic_reward_func/std": 3.6174724102020264, "step": 38 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 108.0, "completions/max_terminated_length": 108.0, "completions/mean_length": 76.25, "completions/mean_terminated_length": 76.25, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.45793966948986053, "epoch": 0.4875, "frac_reward_zero_std": 0.0, "grad_norm": 39.483516693115234, "learning_rate": 1e-06, "loss": 0.022, "num_tokens": 1289744.0, "reward": 3.5625, "reward_std": 2.4533605575561523, "rewards/traffic_reward_func/mean": 3.5625, "rewards/traffic_reward_func/std": 3.552657127380371, "step": 39 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 103.0, "completions/max_terminated_length": 103.0, "completions/mean_length": 80.83333587646484, "completions/mean_terminated_length": 80.83333587646484, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.44789523382981616, "epoch": 0.5, "frac_reward_zero_std": 0.0, "grad_norm": 25.56493377685547, "learning_rate": 1e-06, "loss": -0.0273, "num_tokens": 1343614.0, "reward": 2.5388917922973633, "reward_std": 2.4047036170959473, "rewards/traffic_reward_func/mean": 2.5388917922973633, "rewards/traffic_reward_func/std": 3.872169256210327, "step": 40 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 119.0, "completions/max_terminated_length": 119.0, "completions/mean_length": 89.08333587646484, "completions/mean_terminated_length": 89.08333587646484, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.5121592978636423, "epoch": 0.5125, "frac_reward_zero_std": 0.0, "grad_norm": 36.71591567993164, "learning_rate": 1e-06, "loss": 0.0195, "num_tokens": 1374299.0, "reward": 3.6777751445770264, "reward_std": 1.8058867454528809, "rewards/traffic_reward_func/mean": 3.6777751445770264, "rewards/traffic_reward_func/std": 3.704275608062744, "step": 41 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 110.0, "completions/max_terminated_length": 110.0, "completions/mean_length": 78.83333587646484, "completions/mean_terminated_length": 78.83333587646484, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.4801830897728602, "epoch": 0.525, "frac_reward_zero_std": 0.0, "grad_norm": 52.765411376953125, "learning_rate": 1e-06, "loss": 0.0219, "num_tokens": 1407609.0, "reward": 5.170842170715332, "reward_std": 1.01166832447052, "rewards/traffic_reward_func/mean": 5.170841693878174, "rewards/traffic_reward_func/std": 3.720168352127075, "step": 42 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 103.0, "completions/max_terminated_length": 103.0, "completions/mean_length": 77.5, "completions/mean_terminated_length": 77.5, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.4042755365371704, "epoch": 0.5375, "frac_reward_zero_std": 0.0, "grad_norm": 33.306434631347656, "learning_rate": 1e-06, "loss": -0.0567, "num_tokens": 1450599.0, "reward": 3.8472251892089844, "reward_std": 1.5399649143218994, "rewards/traffic_reward_func/mean": 3.8472251892089844, "rewards/traffic_reward_func/std": 3.8577704429626465, "step": 43 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 103.0, "completions/max_terminated_length": 103.0, "completions/mean_length": 76.91667175292969, "completions/mean_terminated_length": 76.91667175292969, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.49547875424226123, "epoch": 0.55, "frac_reward_zero_std": 0.0, "grad_norm": 20.690107345581055, "learning_rate": 1e-06, "loss": 0.0282, "num_tokens": 1472430.0, "reward": 4.722233772277832, "reward_std": 3.454416275024414, "rewards/traffic_reward_func/mean": 4.722233295440674, "rewards/traffic_reward_func/std": 3.424010992050171, "step": 44 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 112.0, "completions/max_terminated_length": 112.0, "completions/mean_length": 80.25, "completions/mean_terminated_length": 80.25, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.5444711943467458, "epoch": 0.5625, "frac_reward_zero_std": 0.0, "grad_norm": 38.43059539794922, "learning_rate": 1e-06, "loss": 0.0068, "num_tokens": 1517721.0, "reward": 3.4486002922058105, "reward_std": 3.676071882247925, "rewards/traffic_reward_func/mean": 3.4486000537872314, "rewards/traffic_reward_func/std": 3.447497606277466, "step": 45 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 95.0, "completions/max_terminated_length": 95.0, "completions/mean_length": 70.16667175292969, "completions/mean_terminated_length": 70.16667175292969, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.4563195804754893, "epoch": 0.575, "frac_reward_zero_std": 0.0, "grad_norm": 42.63100814819336, "learning_rate": 1e-06, "loss": 0.0322, "num_tokens": 1546679.0, "reward": 6.715291500091553, "reward_std": 0.7320005893707275, "rewards/traffic_reward_func/mean": 6.715291500091553, "rewards/traffic_reward_func/std": 0.8352113962173462, "step": 46 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 111.0, "completions/max_terminated_length": 111.0, "completions/mean_length": 78.5, "completions/mean_terminated_length": 78.5, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.49592259029547375, "epoch": 0.5875, "frac_reward_zero_std": 0.0, "grad_norm": 29.279052734375, "learning_rate": 1e-06, "loss": 0.0151, "num_tokens": 1586877.0, "reward": 5.087500095367432, "reward_std": 0.6266295909881592, "rewards/traffic_reward_func/mean": 5.087500095367432, "rewards/traffic_reward_func/std": 4.1403374671936035, "step": 47 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 121.0, "completions/max_terminated_length": 121.0, "completions/mean_length": 87.58333587646484, "completions/mean_terminated_length": 87.58333587646484, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.5477126836776733, "epoch": 0.6, "frac_reward_zero_std": 0.0, "grad_norm": 27.99470329284668, "learning_rate": 1e-06, "loss": -0.0028, "num_tokens": 1625432.0, "reward": 6.4972333908081055, "reward_std": 1.9132798910140991, "rewards/traffic_reward_func/mean": 6.497232913970947, "rewards/traffic_reward_func/std": 2.49464750289917, "step": 48 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 105.0, "completions/max_terminated_length": 105.0, "completions/mean_length": 74.91667175292969, "completions/mean_terminated_length": 74.91667175292969, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.48915834228197735, "epoch": 0.6125, "frac_reward_zero_std": 0.0, "grad_norm": 44.14060974121094, "learning_rate": 1e-06, "loss": -0.0755, "num_tokens": 1668459.0, "reward": 6.130550384521484, "reward_std": 1.7243244647979736, "rewards/traffic_reward_func/mean": 6.130549907684326, "rewards/traffic_reward_func/std": 3.7066969871520996, "step": 49 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 90.0, "completions/max_terminated_length": 90.0, "completions/mean_length": 71.91667175292969, "completions/mean_terminated_length": 71.91667175292969, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.4961145718892415, "epoch": 0.625, "frac_reward_zero_std": 0.0, "grad_norm": 37.630306243896484, "learning_rate": 1e-06, "loss": -0.0181, "num_tokens": 1696266.0, "reward": 6.0013837814331055, "reward_std": 2.947798490524292, "rewards/traffic_reward_func/mean": 6.001383304595947, "rewards/traffic_reward_func/std": 3.299156904220581, "step": 50 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 93.0, "completions/max_terminated_length": 93.0, "completions/mean_length": 75.58333587646484, "completions/mean_terminated_length": 75.58333587646484, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.514509250720342, "epoch": 0.6375, "frac_reward_zero_std": 0.0, "grad_norm": 25.36536407470703, "learning_rate": 1e-06, "loss": 0.0056, "num_tokens": 1741293.0, "reward": 3.527791976928711, "reward_std": 2.566014289855957, "rewards/traffic_reward_func/mean": 3.527791976928711, "rewards/traffic_reward_func/std": 3.951629877090454, "step": 51 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 113.0, "completions/max_terminated_length": 113.0, "completions/mean_length": 72.66667175292969, "completions/mean_terminated_length": 72.66667175292969, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.43037161727746326, "epoch": 0.65, "frac_reward_zero_std": 0.0, "grad_norm": 40.816951751708984, "learning_rate": 1e-06, "loss": 0.0862, "num_tokens": 1766649.0, "reward": 3.526400089263916, "reward_std": 3.911458969116211, "rewards/traffic_reward_func/mean": 3.526399850845337, "rewards/traffic_reward_func/std": 4.082000732421875, "step": 52 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 88.0, "completions/max_terminated_length": 88.0, "completions/mean_length": 70.33333587646484, "completions/mean_terminated_length": 70.33333587646484, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.4433082193136215, "epoch": 0.6625, "frac_reward_zero_std": 0.0, "grad_norm": 41.49685287475586, "learning_rate": 1e-06, "loss": -0.0666, "num_tokens": 1788665.0, "reward": 6.010425567626953, "reward_std": 2.2142837047576904, "rewards/traffic_reward_func/mean": 6.010425567626953, "rewards/traffic_reward_func/std": 2.868074893951416, "step": 53 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 72.0, "completions/max_terminated_length": 72.0, "completions/mean_length": 66.16667175292969, "completions/mean_terminated_length": 66.16667175292969, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.42625242471694946, "epoch": 0.675, "frac_reward_zero_std": 0.0, "grad_norm": 75.25613403320312, "learning_rate": 1e-06, "loss": 0.0035, "num_tokens": 1799695.0, "reward": 5.708341598510742, "reward_std": 3.315927505493164, "rewards/traffic_reward_func/mean": 5.708341598510742, "rewards/traffic_reward_func/std": 3.45544171333313, "step": 54 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 114.0, "completions/max_terminated_length": 114.0, "completions/mean_length": 80.75, "completions/mean_terminated_length": 80.75, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.48757071793079376, "epoch": 0.6875, "frac_reward_zero_std": 0.0, "grad_norm": 46.29209899902344, "learning_rate": 1e-06, "loss": 0.0402, "num_tokens": 1843940.0, "reward": 1.2527916431427002, "reward_std": 2.0610151290893555, "rewards/traffic_reward_func/mean": 1.2527916431427002, "rewards/traffic_reward_func/std": 2.429760694503784, "step": 55 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 97.0, "completions/max_terminated_length": 97.0, "completions/mean_length": 81.16667175292969, "completions/mean_terminated_length": 81.16667175292969, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.4852754424015681, "epoch": 0.7, "frac_reward_zero_std": 0.0, "grad_norm": 35.69535827636719, "learning_rate": 1e-06, "loss": -0.0109, "num_tokens": 1858694.0, "reward": 5.95139217376709, "reward_std": 2.6155526638031006, "rewards/traffic_reward_func/mean": 5.951391696929932, "rewards/traffic_reward_func/std": 3.5514721870422363, "step": 56 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 94.0, "completions/max_terminated_length": 94.0, "completions/mean_length": 71.83333587646484, "completions/mean_terminated_length": 71.83333587646484, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.4291141629219055, "epoch": 0.7125, "frac_reward_zero_std": 0.0, "grad_norm": 18.40599822998047, "learning_rate": 1e-06, "loss": -0.0273, "num_tokens": 1896504.0, "reward": 4.475000381469727, "reward_std": 1.1392022371292114, "rewards/traffic_reward_func/mean": 4.474999904632568, "rewards/traffic_reward_func/std": 3.0868356227874756, "step": 57 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 103.0, "completions/max_terminated_length": 103.0, "completions/mean_length": 75.16667175292969, "completions/mean_terminated_length": 75.16667175292969, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.46632436911265057, "epoch": 0.725, "frac_reward_zero_std": 0.0, "grad_norm": 93.88121032714844, "learning_rate": 1e-06, "loss": 0.0942, "num_tokens": 1910122.0, "reward": 5.680558681488037, "reward_std": 0.7012208700180054, "rewards/traffic_reward_func/mean": 5.680558681488037, "rewards/traffic_reward_func/std": 3.769535541534424, "step": 58 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 111.0, "completions/max_terminated_length": 111.0, "completions/mean_length": 80.91667175292969, "completions/mean_terminated_length": 80.91667175292969, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.4988810867071152, "epoch": 0.7375, "frac_reward_zero_std": 0.0, "grad_norm": 30.007566452026367, "learning_rate": 1e-06, "loss": 0.0406, "num_tokens": 1927093.0, "reward": 6.993066787719727, "reward_std": 1.729572057723999, "rewards/traffic_reward_func/mean": 6.993066787719727, "rewards/traffic_reward_func/std": 1.8516473770141602, "step": 59 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 92.0, "completions/max_terminated_length": 92.0, "completions/mean_length": 66.58333587646484, "completions/mean_terminated_length": 66.58333587646484, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.4902360637982686, "epoch": 0.75, "frac_reward_zero_std": 0.0, "grad_norm": 34.398563385009766, "learning_rate": 1e-06, "loss": 0.0276, "num_tokens": 1962172.0, "reward": 4.361116886138916, "reward_std": 2.2953672409057617, "rewards/traffic_reward_func/mean": 4.361116886138916, "rewards/traffic_reward_func/std": 3.6648292541503906, "step": 60 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 95.0, "completions/max_terminated_length": 95.0, "completions/mean_length": 81.66667175292969, "completions/mean_terminated_length": 81.66667175292969, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.49865709245204926, "epoch": 0.7625, "frac_reward_zero_std": 0.0, "grad_norm": 28.541831970214844, "learning_rate": 1e-06, "loss": 0.0503, "num_tokens": 1979688.0, "reward": 5.8874921798706055, "reward_std": 4.0627641677856445, "rewards/traffic_reward_func/mean": 5.887491703033447, "rewards/traffic_reward_func/std": 3.9809792041778564, "step": 61 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 106.0, "completions/max_terminated_length": 106.0, "completions/mean_length": 81.66667175292969, "completions/mean_terminated_length": 81.66667175292969, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.47512758274873096, "epoch": 0.775, "frac_reward_zero_std": 0.0, "grad_norm": 25.184757232666016, "learning_rate": 1e-06, "loss": 0.0753, "num_tokens": 2024532.0, "reward": 3.6756999492645264, "reward_std": 1.5340656042099, "rewards/traffic_reward_func/mean": 3.6756999492645264, "rewards/traffic_reward_func/std": 3.737661361694336, "step": 62 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 98.0, "completions/max_terminated_length": 98.0, "completions/mean_length": 75.58333587646484, "completions/mean_terminated_length": 75.58333587646484, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.5664225220680237, "epoch": 0.7875, "frac_reward_zero_std": 0.0, "grad_norm": 33.457435607910156, "learning_rate": 1e-06, "loss": -0.0652, "num_tokens": 2047719.0, "reward": 6.995833396911621, "reward_std": 1.5328638553619385, "rewards/traffic_reward_func/mean": 6.995832920074463, "rewards/traffic_reward_func/std": 1.7922395467758179, "step": 63 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 99.0, "completions/max_terminated_length": 99.0, "completions/mean_length": 79.16667175292969, "completions/mean_terminated_length": 79.16667175292969, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.46559110780556995, "epoch": 0.8, "frac_reward_zero_std": 0.0, "grad_norm": 52.608306884765625, "learning_rate": 1e-06, "loss": -0.0275, "num_tokens": 2070705.0, "reward": 6.859725475311279, "reward_std": 1.9864501953125, "rewards/traffic_reward_func/mean": 6.859724521636963, "rewards/traffic_reward_func/std": 2.8455488681793213, "step": 64 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 121.0, "completions/max_terminated_length": 121.0, "completions/mean_length": 80.41667175292969, "completions/mean_terminated_length": 80.41667175292969, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.5632809400558472, "epoch": 0.8125, "frac_reward_zero_std": 0.0, "grad_norm": 45.61239242553711, "learning_rate": 1e-06, "loss": -0.0431, "num_tokens": 2115514.0, "reward": 5.90695858001709, "reward_std": 2.309171199798584, "rewards/traffic_reward_func/mean": 5.906958103179932, "rewards/traffic_reward_func/std": 3.0801453590393066, "step": 65 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 112.0, "completions/max_terminated_length": 112.0, "completions/mean_length": 81.91667175292969, "completions/mean_terminated_length": 81.91667175292969, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.44120916227499646, "epoch": 0.825, "frac_reward_zero_std": 0.0, "grad_norm": 125.84535217285156, "learning_rate": 1e-06, "loss": -0.0359, "num_tokens": 2149929.0, "reward": 7.644450664520264, "reward_std": 0.8775724768638611, "rewards/traffic_reward_func/mean": 7.644450664520264, "rewards/traffic_reward_func/std": 1.285986065864563, "step": 66 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 87.0, "completions/max_terminated_length": 87.0, "completions/mean_length": 66.41667175292969, "completions/mean_terminated_length": 66.41667175292969, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.40261663496494293, "epoch": 0.8375, "frac_reward_zero_std": 0.3333333432674408, "grad_norm": 41.06476974487305, "learning_rate": 1e-06, "loss": -0.005, "num_tokens": 2193706.0, "reward": 2.2083334922790527, "reward_std": 0.5382140874862671, "rewards/traffic_reward_func/mean": 2.2083332538604736, "rewards/traffic_reward_func/std": 4.327429294586182, "step": 67 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 105.0, "completions/max_terminated_length": 105.0, "completions/mean_length": 76.33333587646484, "completions/mean_terminated_length": 76.33333587646484, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.46220987538496655, "epoch": 0.85, "frac_reward_zero_std": 0.0, "grad_norm": 125.66222381591797, "learning_rate": 1e-06, "loss": 0.0004, "num_tokens": 2243534.0, "reward": 4.913891792297363, "reward_std": 1.3074228763580322, "rewards/traffic_reward_func/mean": 4.913891792297363, "rewards/traffic_reward_func/std": 4.387299060821533, "step": 68 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 97.0, "completions/max_terminated_length": 97.0, "completions/mean_length": 80.5, "completions/mean_terminated_length": 80.5, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.4722747306029002, "epoch": 0.8625, "frac_reward_zero_std": 0.0, "grad_norm": 85.23870086669922, "learning_rate": 1e-06, "loss": -0.0049, "num_tokens": 2280168.0, "reward": 5.401400566101074, "reward_std": 2.607510566711426, "rewards/traffic_reward_func/mean": 5.401400089263916, "rewards/traffic_reward_func/std": 3.2133615016937256, "step": 69 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 108.0, "completions/max_terminated_length": 108.0, "completions/mean_length": 84.91667175292969, "completions/mean_terminated_length": 84.91667175292969, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "entropy": 0.4877086232105891, "epoch": 0.875, "frac_reward_zero_std": 0.0, "grad_norm": 31.59532356262207, "learning_rate": 1e-06, "loss": 0.0217, "num_tokens": 2320043.0, "reward": 4.733333587646484, "reward_std": 1.9133939743041992, "rewards/traffic_reward_func/mean": 4.733333110809326, "rewards/traffic_reward_func/std": 3.7761902809143066, "step": 70 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 89.0, "completions/max_terminated_length": 89.0, "completions/mean_length": 78.16667175292969, "completions/mean_terminated_length": 78.16667175292969, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.5284179349740347, "epoch": 0.8875, "frac_reward_zero_std": 0.0, "grad_norm": 160.29534912109375, "learning_rate": 1e-06, "loss": -0.0229, "num_tokens": 2364281.0, "reward": 5.315283298492432, "reward_std": 2.4020538330078125, "rewards/traffic_reward_func/mean": 5.315283298492432, "rewards/traffic_reward_func/std": 3.021080732345581, "step": 71 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 114.0, "completions/max_terminated_length": 114.0, "completions/mean_length": 76.16667175292969, "completions/mean_terminated_length": 76.16667175292969, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.37924371659755707, "epoch": 0.9, "frac_reward_zero_std": 0.0, "grad_norm": 27.164525985717773, "learning_rate": 1e-06, "loss": 0.0432, "num_tokens": 2403319.0, "reward": 5.695833206176758, "reward_std": 2.448166608810425, "rewards/traffic_reward_func/mean": 5.695833683013916, "rewards/traffic_reward_func/std": 3.723893404006958, "step": 72 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 106.0, "completions/max_terminated_length": 106.0, "completions/mean_length": 73.5, "completions/mean_terminated_length": 73.5, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.43939289450645447, "epoch": 0.9125, "frac_reward_zero_std": 0.0, "grad_norm": 96.966796875, "learning_rate": 1e-06, "loss": 0.0218, "num_tokens": 2430789.0, "reward": 5.0513916015625, "reward_std": 2.6253767013549805, "rewards/traffic_reward_func/mean": 5.0513916015625, "rewards/traffic_reward_func/std": 3.912121057510376, "step": 73 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 99.0, "completions/max_terminated_length": 99.0, "completions/mean_length": 74.16667175292969, "completions/mean_terminated_length": 74.16667175292969, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.49607772131760913, "epoch": 0.925, "frac_reward_zero_std": 0.0, "grad_norm": 85.89688873291016, "learning_rate": 1e-06, "loss": 0.0757, "num_tokens": 2474387.0, "reward": 1.7944416999816895, "reward_std": 2.5643858909606934, "rewards/traffic_reward_func/mean": 1.7944416999816895, "rewards/traffic_reward_func/std": 3.5703654289245605, "step": 74 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 65.25, "completions/mean_terminated_length": 65.25, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.48170402149359387, "epoch": 0.9375, "frac_reward_zero_std": 0.0, "grad_norm": 41.65302658081055, "learning_rate": 1e-06, "loss": 0.008, "num_tokens": 2497166.0, "reward": 5.569441795349121, "reward_std": 1.2931416034698486, "rewards/traffic_reward_func/mean": 5.569442272186279, "rewards/traffic_reward_func/std": 3.766671657562256, "step": 75 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 118.0, "completions/max_terminated_length": 118.0, "completions/mean_length": 82.83333587646484, "completions/mean_terminated_length": 82.83333587646484, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.4894588639338811, "epoch": 0.95, "frac_reward_zero_std": 0.0, "grad_norm": 50.02711868286133, "learning_rate": 1e-06, "loss": 0.0131, "num_tokens": 2540048.0, "reward": 3.2583415508270264, "reward_std": 3.812685966491699, "rewards/traffic_reward_func/mean": 3.2583415508270264, "rewards/traffic_reward_func/std": 3.675389051437378, "step": 76 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 101.0, "completions/max_terminated_length": 101.0, "completions/mean_length": 79.33333587646484, "completions/mean_terminated_length": 79.33333587646484, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.39634905755519867, "epoch": 0.9625, "frac_reward_zero_std": 0.0, "grad_norm": 29.42837142944336, "learning_rate": 1e-06, "loss": 0.036, "num_tokens": 2583088.0, "reward": 4.486100196838379, "reward_std": 1.4785020351409912, "rewards/traffic_reward_func/mean": 4.486099720001221, "rewards/traffic_reward_func/std": 3.721147060394287, "step": 77 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 76.0, "completions/max_terminated_length": 76.0, "completions/mean_length": 66.16667175292969, "completions/mean_terminated_length": 66.16667175292969, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.4373449335495631, "epoch": 0.975, "frac_reward_zero_std": 0.0, "grad_norm": 22.252880096435547, "learning_rate": 1e-06, "loss": 0.0321, "num_tokens": 2605074.0, "reward": 7.447225093841553, "reward_std": 1.0464049577713013, "rewards/traffic_reward_func/mean": 7.447225093841553, "rewards/traffic_reward_func/std": 1.274503231048584, "step": 78 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 88.0, "completions/max_terminated_length": 88.0, "completions/mean_length": 71.0, "completions/mean_terminated_length": 71.0, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.38675158222516376, "epoch": 0.9875, "frac_reward_zero_std": 0.0, "grad_norm": 44.07793426513672, "learning_rate": 1e-06, "loss": 0.0143, "num_tokens": 2635262.0, "reward": 6.008333206176758, "reward_std": 1.6903867721557617, "rewards/traffic_reward_func/mean": 6.008333206176758, "rewards/traffic_reward_func/std": 3.7762653827667236, "step": 79 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 84.0, "completions/max_terminated_length": 84.0, "completions/mean_length": 69.91667175292969, "completions/mean_terminated_length": 69.91667175292969, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.4307720164457957, "epoch": 1.0, "frac_reward_zero_std": 0.0, "grad_norm": 45.57075881958008, "learning_rate": 1e-06, "loss": 0.0387, "num_tokens": 2681497.0, "reward": 3.2916667461395264, "reward_std": 1.6892813444137573, "rewards/traffic_reward_func/mean": 3.2916667461395264, "rewards/traffic_reward_func/std": 3.932587146759033, "step": 80 } ], "logging_steps": 1.0, "max_steps": 80, "num_input_tokens_seen": 2681497, "num_train_epochs": 1, "save_steps": 40, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }