| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.0, |
| "eval_steps": 500, |
| "global_step": 80, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 86.0, |
| "completions/max_terminated_length": 86.0, |
| "completions/mean_length": 76.0, |
| "completions/mean_terminated_length": 76.0, |
| "completions/min_length": 64.0, |
| "completions/min_terminated_length": 64.0, |
| "entropy": 0.5930478672186533, |
| "epoch": 0.0125, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 90.51835632324219, |
| "learning_rate": 0.0, |
| "loss": 0.0148, |
| "num_tokens": 31696.0, |
| "reward": 5.76389217376709, |
| "reward_std": 3.3388309478759766, |
| "rewards/traffic_reward_func/mean": 5.763891696929932, |
| "rewards/traffic_reward_func/std": 3.277735948562622, |
| "step": 1 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 78.0, |
| "completions/max_terminated_length": 78.0, |
| "completions/mean_length": 65.33333587646484, |
| "completions/mean_terminated_length": 65.33333587646484, |
| "completions/min_length": 50.0, |
| "completions/min_terminated_length": 50.0, |
| "entropy": 0.48857787748177844, |
| "epoch": 0.025, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 48.55084228515625, |
| "learning_rate": 2.3137821315975918e-07, |
| "loss": 0.0205, |
| "num_tokens": 55156.0, |
| "reward": 4.936108589172363, |
| "reward_std": 3.530048370361328, |
| "rewards/traffic_reward_func/mean": 4.936108112335205, |
| "rewards/traffic_reward_func/std": 3.691174030303955, |
| "step": 2 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 109.0, |
| "completions/max_terminated_length": 109.0, |
| "completions/mean_length": 75.0, |
| "completions/mean_terminated_length": 75.0, |
| "completions/min_length": 59.0, |
| "completions/min_terminated_length": 59.0, |
| "entropy": 0.587461918592453, |
| "epoch": 0.0375, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 48.531009674072266, |
| "learning_rate": 3.6672579134208467e-07, |
| "loss": -0.0191, |
| "num_tokens": 93576.0, |
| "reward": 4.0694499015808105, |
| "reward_std": 3.6731364727020264, |
| "rewards/traffic_reward_func/mean": 4.0694499015808105, |
| "rewards/traffic_reward_func/std": 3.8600118160247803, |
| "step": 3 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 87.0, |
| "completions/max_terminated_length": 87.0, |
| "completions/mean_length": 74.33333587646484, |
| "completions/mean_terminated_length": 74.33333587646484, |
| "completions/min_length": 55.0, |
| "completions/min_terminated_length": 55.0, |
| "entropy": 0.5151417702436447, |
| "epoch": 0.05, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 134.0212860107422, |
| "learning_rate": 4.6275642631951835e-07, |
| "loss": 0.0286, |
| "num_tokens": 136940.0, |
| "reward": 3.7013919353485107, |
| "reward_std": 1.9124457836151123, |
| "rewards/traffic_reward_func/mean": 3.7013919353485107, |
| "rewards/traffic_reward_func/std": 3.7552192211151123, |
| "step": 4 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 110.0, |
| "completions/max_terminated_length": 110.0, |
| "completions/mean_length": 84.83333587646484, |
| "completions/mean_terminated_length": 84.83333587646484, |
| "completions/min_length": 54.0, |
| "completions/min_terminated_length": 54.0, |
| "entropy": 0.5207065145174662, |
| "epoch": 0.0625, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 45.01969528198242, |
| "learning_rate": 5.372435736804816e-07, |
| "loss": 0.0097, |
| "num_tokens": 170278.0, |
| "reward": 3.5027918815612793, |
| "reward_std": 1.3773735761642456, |
| "rewards/traffic_reward_func/mean": 3.5027916431427, |
| "rewards/traffic_reward_func/std": 4.128313064575195, |
| "step": 5 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 97.0, |
| "completions/max_terminated_length": 97.0, |
| "completions/mean_length": 73.41667175292969, |
| "completions/mean_terminated_length": 73.41667175292969, |
| "completions/min_length": 62.0, |
| "completions/min_terminated_length": 62.0, |
| "entropy": 0.5358039538065592, |
| "epoch": 0.075, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 62.962738037109375, |
| "learning_rate": 5.981040045018438e-07, |
| "loss": -0.0652, |
| "num_tokens": 184675.0, |
| "reward": 6.37082576751709, |
| "reward_std": 2.680429458618164, |
| "rewards/traffic_reward_func/mean": 6.370825290679932, |
| "rewards/traffic_reward_func/std": 2.830486536026001, |
| "step": 6 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 99.0, |
| "completions/max_terminated_length": 99.0, |
| "completions/mean_length": 72.16667175292969, |
| "completions/mean_terminated_length": 72.16667175292969, |
| "completions/min_length": 54.0, |
| "completions/min_terminated_length": 54.0, |
| "entropy": 0.5199788709481558, |
| "epoch": 0.0875, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 48.52009201049805, |
| "learning_rate": 6.495607655709434e-07, |
| "loss": -0.0538, |
| "num_tokens": 220077.0, |
| "reward": 2.575000286102295, |
| "reward_std": 2.032099723815918, |
| "rewards/traffic_reward_func/mean": 2.575000047683716, |
| "rewards/traffic_reward_func/std": 3.287407159805298, |
| "step": 7 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 93.0, |
| "completions/max_terminated_length": 93.0, |
| "completions/mean_length": 74.41667175292969, |
| "completions/mean_terminated_length": 74.41667175292969, |
| "completions/min_length": 56.0, |
| "completions/min_terminated_length": 56.0, |
| "entropy": 0.5326513946056366, |
| "epoch": 0.1, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 51.77104949951172, |
| "learning_rate": 6.941346394792774e-07, |
| "loss": 0.0029, |
| "num_tokens": 254770.0, |
| "reward": 4.1870503425598145, |
| "reward_std": 3.616281509399414, |
| "rewards/traffic_reward_func/mean": 4.1870503425598145, |
| "rewards/traffic_reward_func/std": 3.6269490718841553, |
| "step": 8 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 120.0, |
| "completions/max_terminated_length": 120.0, |
| "completions/mean_length": 75.75, |
| "completions/mean_terminated_length": 75.75, |
| "completions/min_length": 47.0, |
| "completions/min_terminated_length": 47.0, |
| "entropy": 0.5402362247308096, |
| "epoch": 0.1125, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 24.48263168334961, |
| "learning_rate": 7.334515826841693e-07, |
| "loss": -0.043, |
| "num_tokens": 284315.0, |
| "reward": 3.6986165046691895, |
| "reward_std": 3.3095173835754395, |
| "rewards/traffic_reward_func/mean": 3.6986167430877686, |
| "rewards/traffic_reward_func/std": 3.810101270675659, |
| "step": 9 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 133.0, |
| "completions/max_terminated_length": 133.0, |
| "completions/mean_length": 91.66667175292969, |
| "completions/mean_terminated_length": 91.66667175292969, |
| "completions/min_length": 66.0, |
| "completions/min_terminated_length": 66.0, |
| "entropy": 0.5282839934031168, |
| "epoch": 0.125, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 21.92542266845703, |
| "learning_rate": 7.686217868402409e-07, |
| "loss": 0.0344, |
| "num_tokens": 342115.0, |
| "reward": 4.9666666984558105, |
| "reward_std": 3.0202672481536865, |
| "rewards/traffic_reward_func/mean": 4.9666666984558105, |
| "rewards/traffic_reward_func/std": 4.13976526260376, |
| "step": 10 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 104.0, |
| "completions/max_terminated_length": 104.0, |
| "completions/mean_length": 82.75, |
| "completions/mean_terminated_length": 82.75, |
| "completions/min_length": 62.0, |
| "completions/min_terminated_length": 62.0, |
| "entropy": 0.5616102963685989, |
| "epoch": 0.1375, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 60.28784942626953, |
| "learning_rate": 8.004371064686714e-07, |
| "loss": 0.0296, |
| "num_tokens": 391732.0, |
| "reward": 3.715291976928711, |
| "reward_std": 2.362664222717285, |
| "rewards/traffic_reward_func/mean": 3.715291976928711, |
| "rewards/traffic_reward_func/std": 3.636319637298584, |
| "step": 11 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 95.0, |
| "completions/max_terminated_length": 95.0, |
| "completions/mean_length": 75.33333587646484, |
| "completions/mean_terminated_length": 75.33333587646484, |
| "completions/min_length": 49.0, |
| "completions/min_terminated_length": 49.0, |
| "entropy": 0.5451353937387466, |
| "epoch": 0.15, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 51.164581298828125, |
| "learning_rate": 8.29482217661603e-07, |
| "loss": 0.0875, |
| "num_tokens": 419576.0, |
| "reward": 3.2374916076660156, |
| "reward_std": 1.5012121200561523, |
| "rewards/traffic_reward_func/mean": 3.2374916076660156, |
| "rewards/traffic_reward_func/std": 4.025315284729004, |
| "step": 12 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 101.0, |
| "completions/max_terminated_length": 101.0, |
| "completions/mean_length": 78.83333587646484, |
| "completions/mean_terminated_length": 78.83333587646484, |
| "completions/min_length": 64.0, |
| "completions/min_terminated_length": 64.0, |
| "entropy": 0.4967418909072876, |
| "epoch": 0.1625, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 39.67502212524414, |
| "learning_rate": 8.562011298888888e-07, |
| "loss": 0.0542, |
| "num_tokens": 451066.0, |
| "reward": 3.8458499908447266, |
| "reward_std": 3.0185961723327637, |
| "rewards/traffic_reward_func/mean": 3.8458499908447266, |
| "rewards/traffic_reward_func/std": 3.0665249824523926, |
| "step": 13 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 85.0, |
| "completions/max_terminated_length": 85.0, |
| "completions/mean_length": 72.16667175292969, |
| "completions/mean_terminated_length": 72.16667175292969, |
| "completions/min_length": 61.0, |
| "completions/min_terminated_length": 61.0, |
| "entropy": 0.46256470680236816, |
| "epoch": 0.175, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 36.632110595703125, |
| "learning_rate": 8.809389787307026e-07, |
| "loss": 0.0518, |
| "num_tokens": 481264.0, |
| "reward": 5.415283203125, |
| "reward_std": 3.098494529724121, |
| "rewards/traffic_reward_func/mean": 5.415283203125, |
| "rewards/traffic_reward_func/std": 3.7558400630950928, |
| "step": 14 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 119.0, |
| "completions/max_terminated_length": 119.0, |
| "completions/mean_length": 81.83333587646484, |
| "completions/mean_terminated_length": 81.83333587646484, |
| "completions/min_length": 63.0, |
| "completions/min_terminated_length": 63.0, |
| "entropy": 0.4841439475615819, |
| "epoch": 0.1875, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 49.08949279785156, |
| "learning_rate": 9.039693650225662e-07, |
| "loss": -0.0929, |
| "num_tokens": 516870.0, |
| "reward": 5.422224998474121, |
| "reward_std": 2.106595039367676, |
| "rewards/traffic_reward_func/mean": 5.422224521636963, |
| "rewards/traffic_reward_func/std": 2.377295970916748, |
| "step": 15 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 116.0, |
| "completions/max_terminated_length": 116.0, |
| "completions/mean_length": 82.25, |
| "completions/mean_terminated_length": 82.25, |
| "completions/min_length": 56.0, |
| "completions/min_terminated_length": 56.0, |
| "entropy": 0.5850350757439932, |
| "epoch": 0.2, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 32.39323425292969, |
| "learning_rate": 9.255128526390367e-07, |
| "loss": 0.0266, |
| "num_tokens": 554513.0, |
| "reward": 3.019458293914795, |
| "reward_std": 0.3986830711364746, |
| "rewards/traffic_reward_func/mean": 3.019458055496216, |
| "rewards/traffic_reward_func/std": 3.730907678604126, |
| "step": 16 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 114.0, |
| "completions/max_terminated_length": 114.0, |
| "completions/mean_length": 85.75, |
| "completions/mean_terminated_length": 85.75, |
| "completions/min_length": 68.0, |
| "completions/min_terminated_length": 68.0, |
| "entropy": 0.506961981455485, |
| "epoch": 0.2125, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 188.8520050048828, |
| "learning_rate": 9.45749848565416e-07, |
| "loss": -0.0265, |
| "num_tokens": 578918.0, |
| "reward": 6.918058395385742, |
| "reward_std": 0.7207190990447998, |
| "rewards/traffic_reward_func/mean": 6.918058395385742, |
| "rewards/traffic_reward_func/std": 0.8269808292388916, |
| "step": 17 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 106.0, |
| "completions/max_terminated_length": 106.0, |
| "completions/mean_length": 81.75, |
| "completions/mean_terminated_length": 81.75, |
| "completions/min_length": 64.0, |
| "completions/min_terminated_length": 64.0, |
| "entropy": 0.5057271818319956, |
| "epoch": 0.225, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 52.07399368286133, |
| "learning_rate": 9.648297958439284e-07, |
| "loss": -0.0183, |
| "num_tokens": 604291.0, |
| "reward": 2.5041751861572266, |
| "reward_std": 2.239223003387451, |
| "rewards/traffic_reward_func/mean": 2.5041749477386475, |
| "rewards/traffic_reward_func/std": 2.6732337474823, |
| "step": 18 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 107.0, |
| "completions/max_terminated_length": 107.0, |
| "completions/mean_length": 79.33333587646484, |
| "completions/mean_terminated_length": 79.33333587646484, |
| "completions/min_length": 62.0, |
| "completions/min_terminated_length": 62.0, |
| "entropy": 0.49002426366011304, |
| "epoch": 0.2375, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 49.835079193115234, |
| "learning_rate": 9.828778776927557e-07, |
| "loss": 0.0385, |
| "num_tokens": 620123.0, |
| "reward": 5.941667079925537, |
| "reward_std": 0.5195273160934448, |
| "rewards/traffic_reward_func/mean": 5.941667079925537, |
| "rewards/traffic_reward_func/std": 4.17319917678833, |
| "step": 19 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 94.0, |
| "completions/max_terminated_length": 94.0, |
| "completions/mean_length": 77.08333587646484, |
| "completions/mean_terminated_length": 77.08333587646484, |
| "completions/min_length": 61.0, |
| "completions/min_terminated_length": 61.0, |
| "entropy": 0.5183714032173157, |
| "epoch": 0.25, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 36.613128662109375, |
| "learning_rate": 1e-06, |
| "loss": 0.0062, |
| "num_tokens": 666712.0, |
| "reward": 1.4916582107543945, |
| "reward_std": 1.6954081058502197, |
| "rewards/traffic_reward_func/mean": 1.491658329963684, |
| "rewards/traffic_reward_func/std": 2.9001410007476807, |
| "step": 20 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 115.0, |
| "completions/max_terminated_length": 115.0, |
| "completions/mean_length": 89.75, |
| "completions/mean_terminated_length": 89.75, |
| "completions/min_length": 67.0, |
| "completions/min_terminated_length": 67.0, |
| "entropy": 0.5492318073908488, |
| "epoch": 0.2625, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 24.955896377563477, |
| "learning_rate": 1e-06, |
| "loss": -0.0454, |
| "num_tokens": 707297.0, |
| "reward": 4.256950378417969, |
| "reward_std": 3.439373731613159, |
| "rewards/traffic_reward_func/mean": 4.2569499015808105, |
| "rewards/traffic_reward_func/std": 3.1874282360076904, |
| "step": 21 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 102.0, |
| "completions/max_terminated_length": 102.0, |
| "completions/mean_length": 81.58333587646484, |
| "completions/mean_terminated_length": 81.58333587646484, |
| "completions/min_length": 62.0, |
| "completions/min_terminated_length": 62.0, |
| "entropy": 0.5593699812889099, |
| "epoch": 0.275, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 41.32038116455078, |
| "learning_rate": 1e-06, |
| "loss": -0.0316, |
| "num_tokens": 727540.0, |
| "reward": 3.834716796875, |
| "reward_std": 3.1437413692474365, |
| "rewards/traffic_reward_func/mean": 3.834716796875, |
| "rewards/traffic_reward_func/std": 2.9495410919189453, |
| "step": 22 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 104.0, |
| "completions/max_terminated_length": 104.0, |
| "completions/mean_length": 79.91667175292969, |
| "completions/mean_terminated_length": 79.91667175292969, |
| "completions/min_length": 68.0, |
| "completions/min_terminated_length": 68.0, |
| "entropy": 0.47043687105178833, |
| "epoch": 0.2875, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 38.11423873901367, |
| "learning_rate": 1e-06, |
| "loss": 0.0469, |
| "num_tokens": 768527.0, |
| "reward": 5.273616790771484, |
| "reward_std": 1.5386489629745483, |
| "rewards/traffic_reward_func/mean": 5.273616313934326, |
| "rewards/traffic_reward_func/std": 3.3327481746673584, |
| "step": 23 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 92.0, |
| "completions/max_terminated_length": 92.0, |
| "completions/mean_length": 73.75, |
| "completions/mean_terminated_length": 73.75, |
| "completions/min_length": 55.0, |
| "completions/min_terminated_length": 55.0, |
| "entropy": 0.491796538233757, |
| "epoch": 0.3, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 34.17938995361328, |
| "learning_rate": 1e-06, |
| "loss": -0.0535, |
| "num_tokens": 798836.0, |
| "reward": 5.034725189208984, |
| "reward_std": 3.6063766479492188, |
| "rewards/traffic_reward_func/mean": 5.034725189208984, |
| "rewards/traffic_reward_func/std": 3.413700819015503, |
| "step": 24 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 105.0, |
| "completions/max_terminated_length": 105.0, |
| "completions/mean_length": 78.58333587646484, |
| "completions/mean_terminated_length": 78.58333587646484, |
| "completions/min_length": 55.0, |
| "completions/min_terminated_length": 55.0, |
| "entropy": 0.515800267457962, |
| "epoch": 0.3125, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 49.790279388427734, |
| "learning_rate": 1e-06, |
| "loss": 0.1052, |
| "num_tokens": 850955.0, |
| "reward": 5.030575275421143, |
| "reward_std": 1.0347952842712402, |
| "rewards/traffic_reward_func/mean": 5.030575275421143, |
| "rewards/traffic_reward_func/std": 3.7490885257720947, |
| "step": 25 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 100.0, |
| "completions/max_terminated_length": 100.0, |
| "completions/mean_length": 80.75, |
| "completions/mean_terminated_length": 80.75, |
| "completions/min_length": 61.0, |
| "completions/min_terminated_length": 61.0, |
| "entropy": 0.5148407767216364, |
| "epoch": 0.325, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 40.39106369018555, |
| "learning_rate": 1e-06, |
| "loss": -0.0604, |
| "num_tokens": 887936.0, |
| "reward": 3.543058395385742, |
| "reward_std": 1.2134441137313843, |
| "rewards/traffic_reward_func/mean": 3.543058395385742, |
| "rewards/traffic_reward_func/std": 3.9768006801605225, |
| "step": 26 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 94.0, |
| "completions/max_terminated_length": 94.0, |
| "completions/mean_length": 70.91667175292969, |
| "completions/mean_terminated_length": 70.91667175292969, |
| "completions/min_length": 61.0, |
| "completions/min_terminated_length": 61.0, |
| "entropy": 0.43037260075410205, |
| "epoch": 0.3375, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 51.63254165649414, |
| "learning_rate": 1e-06, |
| "loss": -0.0275, |
| "num_tokens": 923235.0, |
| "reward": 4.638883590698242, |
| "reward_std": 2.003594160079956, |
| "rewards/traffic_reward_func/mean": 4.638883113861084, |
| "rewards/traffic_reward_func/std": 4.541528224945068, |
| "step": 27 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 114.0, |
| "completions/max_terminated_length": 114.0, |
| "completions/mean_length": 77.83333587646484, |
| "completions/mean_terminated_length": 77.83333587646484, |
| "completions/min_length": 57.0, |
| "completions/min_terminated_length": 57.0, |
| "entropy": 0.4802086055278778, |
| "epoch": 0.35, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 50.77159118652344, |
| "learning_rate": 1e-06, |
| "loss": 0.0246, |
| "num_tokens": 975865.0, |
| "reward": 5.4055585861206055, |
| "reward_std": 0.9993247389793396, |
| "rewards/traffic_reward_func/mean": 5.405558109283447, |
| "rewards/traffic_reward_func/std": 4.432521820068359, |
| "step": 28 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 111.0, |
| "completions/max_terminated_length": 111.0, |
| "completions/mean_length": 75.83333587646484, |
| "completions/mean_terminated_length": 75.83333587646484, |
| "completions/min_length": 58.0, |
| "completions/min_terminated_length": 58.0, |
| "entropy": 0.5248066335916519, |
| "epoch": 0.3625, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 29.308929443359375, |
| "learning_rate": 1e-06, |
| "loss": -0.0054, |
| "num_tokens": 1021355.0, |
| "reward": 5.527783393859863, |
| "reward_std": 0.9038121700286865, |
| "rewards/traffic_reward_func/mean": 5.527782917022705, |
| "rewards/traffic_reward_func/std": 4.4734015464782715, |
| "step": 29 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 94.0, |
| "completions/max_terminated_length": 94.0, |
| "completions/mean_length": 70.5, |
| "completions/mean_terminated_length": 70.5, |
| "completions/min_length": 58.0, |
| "completions/min_terminated_length": 58.0, |
| "entropy": 0.49029021461804706, |
| "epoch": 0.375, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 36.470375061035156, |
| "learning_rate": 1e-06, |
| "loss": 0.0945, |
| "num_tokens": 1041501.0, |
| "reward": 7.425000190734863, |
| "reward_std": 2.3710060119628906, |
| "rewards/traffic_reward_func/mean": 7.424999713897705, |
| "rewards/traffic_reward_func/std": 3.4395759105682373, |
| "step": 30 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 115.0, |
| "completions/max_terminated_length": 115.0, |
| "completions/mean_length": 74.91667175292969, |
| "completions/mean_terminated_length": 74.91667175292969, |
| "completions/min_length": 54.0, |
| "completions/min_terminated_length": 54.0, |
| "entropy": 0.4614233573277791, |
| "epoch": 0.3875, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 40.14723587036133, |
| "learning_rate": 1e-06, |
| "loss": -0.0033, |
| "num_tokens": 1082024.0, |
| "reward": 2.5138919353485107, |
| "reward_std": 3.217278242111206, |
| "rewards/traffic_reward_func/mean": 2.5138919353485107, |
| "rewards/traffic_reward_func/std": 3.1958131790161133, |
| "step": 31 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 113.0, |
| "completions/max_terminated_length": 113.0, |
| "completions/mean_length": 82.25, |
| "completions/mean_terminated_length": 82.25, |
| "completions/min_length": 60.0, |
| "completions/min_terminated_length": 60.0, |
| "entropy": 0.47699304421742755, |
| "epoch": 0.4, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 35.038387298583984, |
| "learning_rate": 1e-06, |
| "loss": 0.0313, |
| "num_tokens": 1111535.0, |
| "reward": 3.4027748107910156, |
| "reward_std": 2.7580385208129883, |
| "rewards/traffic_reward_func/mean": 3.4027748107910156, |
| "rewards/traffic_reward_func/std": 3.510051965713501, |
| "step": 32 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 109.0, |
| "completions/max_terminated_length": 109.0, |
| "completions/mean_length": 81.83333587646484, |
| "completions/mean_terminated_length": 81.83333587646484, |
| "completions/min_length": 63.0, |
| "completions/min_terminated_length": 63.0, |
| "entropy": 0.4661006381114324, |
| "epoch": 0.4125, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 27.36323356628418, |
| "learning_rate": 1e-06, |
| "loss": 0.0217, |
| "num_tokens": 1129873.0, |
| "reward": 3.373616933822632, |
| "reward_std": 0.5916072130203247, |
| "rewards/traffic_reward_func/mean": 3.373616933822632, |
| "rewards/traffic_reward_func/std": 3.97894549369812, |
| "step": 33 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 106.0, |
| "completions/max_terminated_length": 106.0, |
| "completions/mean_length": 79.91667175292969, |
| "completions/mean_terminated_length": 79.91667175292969, |
| "completions/min_length": 50.0, |
| "completions/min_terminated_length": 50.0, |
| "entropy": 0.5415816406408945, |
| "epoch": 0.425, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 49.570030212402344, |
| "learning_rate": 1e-06, |
| "loss": 0.0021, |
| "num_tokens": 1168776.0, |
| "reward": 3.1805667877197266, |
| "reward_std": 1.868180751800537, |
| "rewards/traffic_reward_func/mean": 3.1805667877197266, |
| "rewards/traffic_reward_func/std": 3.855158567428589, |
| "step": 34 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 100.0, |
| "completions/max_terminated_length": 100.0, |
| "completions/mean_length": 76.41667175292969, |
| "completions/mean_terminated_length": 76.41667175292969, |
| "completions/min_length": 61.0, |
| "completions/min_terminated_length": 61.0, |
| "entropy": 0.4782920181751251, |
| "epoch": 0.4375, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 43.71452713012695, |
| "learning_rate": 1e-06, |
| "loss": 0.0029, |
| "num_tokens": 1185697.0, |
| "reward": 4.708350658416748, |
| "reward_std": 3.080965757369995, |
| "rewards/traffic_reward_func/mean": 4.708349704742432, |
| "rewards/traffic_reward_func/std": 3.2441697120666504, |
| "step": 35 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 81.0, |
| "completions/max_terminated_length": 81.0, |
| "completions/mean_length": 66.5, |
| "completions/mean_terminated_length": 66.5, |
| "completions/min_length": 60.0, |
| "completions/min_terminated_length": 60.0, |
| "entropy": 0.39282474915186566, |
| "epoch": 0.45, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 21.168304443359375, |
| "learning_rate": 1e-06, |
| "loss": -0.0108, |
| "num_tokens": 1197535.0, |
| "reward": 4.433341979980469, |
| "reward_std": 1.4528138637542725, |
| "rewards/traffic_reward_func/mean": 4.4333415031433105, |
| "rewards/traffic_reward_func/std": 4.101103782653809, |
| "step": 36 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 90.0, |
| "completions/max_terminated_length": 90.0, |
| "completions/mean_length": 70.0, |
| "completions/mean_terminated_length": 70.0, |
| "completions/min_length": 59.0, |
| "completions/min_terminated_length": 59.0, |
| "entropy": 0.5816979706287384, |
| "epoch": 0.4625, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 29.439083099365234, |
| "learning_rate": 1e-06, |
| "loss": -0.0492, |
| "num_tokens": 1234363.0, |
| "reward": 2.4597251415252686, |
| "reward_std": 2.4156336784362793, |
| "rewards/traffic_reward_func/mean": 2.4597251415252686, |
| "rewards/traffic_reward_func/std": 3.5065743923187256, |
| "step": 37 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 99.0, |
| "completions/max_terminated_length": 99.0, |
| "completions/mean_length": 74.5, |
| "completions/mean_terminated_length": 74.5, |
| "completions/min_length": 38.0, |
| "completions/min_terminated_length": 38.0, |
| "entropy": 0.5000238766272863, |
| "epoch": 0.475, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 23.74506187438965, |
| "learning_rate": 1e-06, |
| "loss": -0.0571, |
| "num_tokens": 1263281.0, |
| "reward": 5.895825386047363, |
| "reward_std": 1.9191408157348633, |
| "rewards/traffic_reward_func/mean": 5.895824909210205, |
| "rewards/traffic_reward_func/std": 3.6174724102020264, |
| "step": 38 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 108.0, |
| "completions/max_terminated_length": 108.0, |
| "completions/mean_length": 76.25, |
| "completions/mean_terminated_length": 76.25, |
| "completions/min_length": 61.0, |
| "completions/min_terminated_length": 61.0, |
| "entropy": 0.45793966948986053, |
| "epoch": 0.4875, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 39.483516693115234, |
| "learning_rate": 1e-06, |
| "loss": 0.022, |
| "num_tokens": 1289744.0, |
| "reward": 3.5625, |
| "reward_std": 2.4533605575561523, |
| "rewards/traffic_reward_func/mean": 3.5625, |
| "rewards/traffic_reward_func/std": 3.552657127380371, |
| "step": 39 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 103.0, |
| "completions/max_terminated_length": 103.0, |
| "completions/mean_length": 80.83333587646484, |
| "completions/mean_terminated_length": 80.83333587646484, |
| "completions/min_length": 61.0, |
| "completions/min_terminated_length": 61.0, |
| "entropy": 0.44789523382981616, |
| "epoch": 0.5, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 25.56493377685547, |
| "learning_rate": 1e-06, |
| "loss": -0.0273, |
| "num_tokens": 1343614.0, |
| "reward": 2.5388917922973633, |
| "reward_std": 2.4047036170959473, |
| "rewards/traffic_reward_func/mean": 2.5388917922973633, |
| "rewards/traffic_reward_func/std": 3.872169256210327, |
| "step": 40 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 119.0, |
| "completions/max_terminated_length": 119.0, |
| "completions/mean_length": 89.08333587646484, |
| "completions/mean_terminated_length": 89.08333587646484, |
| "completions/min_length": 63.0, |
| "completions/min_terminated_length": 63.0, |
| "entropy": 0.5121592978636423, |
| "epoch": 0.5125, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 36.71591567993164, |
| "learning_rate": 1e-06, |
| "loss": 0.0195, |
| "num_tokens": 1374299.0, |
| "reward": 3.6777751445770264, |
| "reward_std": 1.8058867454528809, |
| "rewards/traffic_reward_func/mean": 3.6777751445770264, |
| "rewards/traffic_reward_func/std": 3.704275608062744, |
| "step": 41 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 110.0, |
| "completions/max_terminated_length": 110.0, |
| "completions/mean_length": 78.83333587646484, |
| "completions/mean_terminated_length": 78.83333587646484, |
| "completions/min_length": 64.0, |
| "completions/min_terminated_length": 64.0, |
| "entropy": 0.4801830897728602, |
| "epoch": 0.525, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 52.765411376953125, |
| "learning_rate": 1e-06, |
| "loss": 0.0219, |
| "num_tokens": 1407609.0, |
| "reward": 5.170842170715332, |
| "reward_std": 1.01166832447052, |
| "rewards/traffic_reward_func/mean": 5.170841693878174, |
| "rewards/traffic_reward_func/std": 3.720168352127075, |
| "step": 42 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 103.0, |
| "completions/max_terminated_length": 103.0, |
| "completions/mean_length": 77.5, |
| "completions/mean_terminated_length": 77.5, |
| "completions/min_length": 59.0, |
| "completions/min_terminated_length": 59.0, |
| "entropy": 0.4042755365371704, |
| "epoch": 0.5375, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 33.306434631347656, |
| "learning_rate": 1e-06, |
| "loss": -0.0567, |
| "num_tokens": 1450599.0, |
| "reward": 3.8472251892089844, |
| "reward_std": 1.5399649143218994, |
| "rewards/traffic_reward_func/mean": 3.8472251892089844, |
| "rewards/traffic_reward_func/std": 3.8577704429626465, |
| "step": 43 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 103.0, |
| "completions/max_terminated_length": 103.0, |
| "completions/mean_length": 76.91667175292969, |
| "completions/mean_terminated_length": 76.91667175292969, |
| "completions/min_length": 63.0, |
| "completions/min_terminated_length": 63.0, |
| "entropy": 0.49547875424226123, |
| "epoch": 0.55, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 20.690107345581055, |
| "learning_rate": 1e-06, |
| "loss": 0.0282, |
| "num_tokens": 1472430.0, |
| "reward": 4.722233772277832, |
| "reward_std": 3.454416275024414, |
| "rewards/traffic_reward_func/mean": 4.722233295440674, |
| "rewards/traffic_reward_func/std": 3.424010992050171, |
| "step": 44 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 112.0, |
| "completions/max_terminated_length": 112.0, |
| "completions/mean_length": 80.25, |
| "completions/mean_terminated_length": 80.25, |
| "completions/min_length": 58.0, |
| "completions/min_terminated_length": 58.0, |
| "entropy": 0.5444711943467458, |
| "epoch": 0.5625, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 38.43059539794922, |
| "learning_rate": 1e-06, |
| "loss": 0.0068, |
| "num_tokens": 1517721.0, |
| "reward": 3.4486002922058105, |
| "reward_std": 3.676071882247925, |
| "rewards/traffic_reward_func/mean": 3.4486000537872314, |
| "rewards/traffic_reward_func/std": 3.447497606277466, |
| "step": 45 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 95.0, |
| "completions/max_terminated_length": 95.0, |
| "completions/mean_length": 70.16667175292969, |
| "completions/mean_terminated_length": 70.16667175292969, |
| "completions/min_length": 56.0, |
| "completions/min_terminated_length": 56.0, |
| "entropy": 0.4563195804754893, |
| "epoch": 0.575, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 42.63100814819336, |
| "learning_rate": 1e-06, |
| "loss": 0.0322, |
| "num_tokens": 1546679.0, |
| "reward": 6.715291500091553, |
| "reward_std": 0.7320005893707275, |
| "rewards/traffic_reward_func/mean": 6.715291500091553, |
| "rewards/traffic_reward_func/std": 0.8352113962173462, |
| "step": 46 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 111.0, |
| "completions/max_terminated_length": 111.0, |
| "completions/mean_length": 78.5, |
| "completions/mean_terminated_length": 78.5, |
| "completions/min_length": 57.0, |
| "completions/min_terminated_length": 57.0, |
| "entropy": 0.49592259029547375, |
| "epoch": 0.5875, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 29.279052734375, |
| "learning_rate": 1e-06, |
| "loss": 0.0151, |
| "num_tokens": 1586877.0, |
| "reward": 5.087500095367432, |
| "reward_std": 0.6266295909881592, |
| "rewards/traffic_reward_func/mean": 5.087500095367432, |
| "rewards/traffic_reward_func/std": 4.1403374671936035, |
| "step": 47 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 121.0, |
| "completions/max_terminated_length": 121.0, |
| "completions/mean_length": 87.58333587646484, |
| "completions/mean_terminated_length": 87.58333587646484, |
| "completions/min_length": 67.0, |
| "completions/min_terminated_length": 67.0, |
| "entropy": 0.5477126836776733, |
| "epoch": 0.6, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 27.99470329284668, |
| "learning_rate": 1e-06, |
| "loss": -0.0028, |
| "num_tokens": 1625432.0, |
| "reward": 6.4972333908081055, |
| "reward_std": 1.9132798910140991, |
| "rewards/traffic_reward_func/mean": 6.497232913970947, |
| "rewards/traffic_reward_func/std": 2.49464750289917, |
| "step": 48 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 105.0, |
| "completions/max_terminated_length": 105.0, |
| "completions/mean_length": 74.91667175292969, |
| "completions/mean_terminated_length": 74.91667175292969, |
| "completions/min_length": 57.0, |
| "completions/min_terminated_length": 57.0, |
| "entropy": 0.48915834228197735, |
| "epoch": 0.6125, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 44.14060974121094, |
| "learning_rate": 1e-06, |
| "loss": -0.0755, |
| "num_tokens": 1668459.0, |
| "reward": 6.130550384521484, |
| "reward_std": 1.7243244647979736, |
| "rewards/traffic_reward_func/mean": 6.130549907684326, |
| "rewards/traffic_reward_func/std": 3.7066969871520996, |
| "step": 49 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 90.0, |
| "completions/max_terminated_length": 90.0, |
| "completions/mean_length": 71.91667175292969, |
| "completions/mean_terminated_length": 71.91667175292969, |
| "completions/min_length": 61.0, |
| "completions/min_terminated_length": 61.0, |
| "entropy": 0.4961145718892415, |
| "epoch": 0.625, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 37.630306243896484, |
| "learning_rate": 1e-06, |
| "loss": -0.0181, |
| "num_tokens": 1696266.0, |
| "reward": 6.0013837814331055, |
| "reward_std": 2.947798490524292, |
| "rewards/traffic_reward_func/mean": 6.001383304595947, |
| "rewards/traffic_reward_func/std": 3.299156904220581, |
| "step": 50 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 93.0, |
| "completions/max_terminated_length": 93.0, |
| "completions/mean_length": 75.58333587646484, |
| "completions/mean_terminated_length": 75.58333587646484, |
| "completions/min_length": 59.0, |
| "completions/min_terminated_length": 59.0, |
| "entropy": 0.514509250720342, |
| "epoch": 0.6375, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 25.36536407470703, |
| "learning_rate": 1e-06, |
| "loss": 0.0056, |
| "num_tokens": 1741293.0, |
| "reward": 3.527791976928711, |
| "reward_std": 2.566014289855957, |
| "rewards/traffic_reward_func/mean": 3.527791976928711, |
| "rewards/traffic_reward_func/std": 3.951629877090454, |
| "step": 51 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 113.0, |
| "completions/max_terminated_length": 113.0, |
| "completions/mean_length": 72.66667175292969, |
| "completions/mean_terminated_length": 72.66667175292969, |
| "completions/min_length": 58.0, |
| "completions/min_terminated_length": 58.0, |
| "entropy": 0.43037161727746326, |
| "epoch": 0.65, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 40.816951751708984, |
| "learning_rate": 1e-06, |
| "loss": 0.0862, |
| "num_tokens": 1766649.0, |
| "reward": 3.526400089263916, |
| "reward_std": 3.911458969116211, |
| "rewards/traffic_reward_func/mean": 3.526399850845337, |
| "rewards/traffic_reward_func/std": 4.082000732421875, |
| "step": 52 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 88.0, |
| "completions/max_terminated_length": 88.0, |
| "completions/mean_length": 70.33333587646484, |
| "completions/mean_terminated_length": 70.33333587646484, |
| "completions/min_length": 57.0, |
| "completions/min_terminated_length": 57.0, |
| "entropy": 0.4433082193136215, |
| "epoch": 0.6625, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 41.49685287475586, |
| "learning_rate": 1e-06, |
| "loss": -0.0666, |
| "num_tokens": 1788665.0, |
| "reward": 6.010425567626953, |
| "reward_std": 2.2142837047576904, |
| "rewards/traffic_reward_func/mean": 6.010425567626953, |
| "rewards/traffic_reward_func/std": 2.868074893951416, |
| "step": 53 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 72.0, |
| "completions/max_terminated_length": 72.0, |
| "completions/mean_length": 66.16667175292969, |
| "completions/mean_terminated_length": 66.16667175292969, |
| "completions/min_length": 51.0, |
| "completions/min_terminated_length": 51.0, |
| "entropy": 0.42625242471694946, |
| "epoch": 0.675, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 75.25613403320312, |
| "learning_rate": 1e-06, |
| "loss": 0.0035, |
| "num_tokens": 1799695.0, |
| "reward": 5.708341598510742, |
| "reward_std": 3.315927505493164, |
| "rewards/traffic_reward_func/mean": 5.708341598510742, |
| "rewards/traffic_reward_func/std": 3.45544171333313, |
| "step": 54 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 114.0, |
| "completions/max_terminated_length": 114.0, |
| "completions/mean_length": 80.75, |
| "completions/mean_terminated_length": 80.75, |
| "completions/min_length": 61.0, |
| "completions/min_terminated_length": 61.0, |
| "entropy": 0.48757071793079376, |
| "epoch": 0.6875, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 46.29209899902344, |
| "learning_rate": 1e-06, |
| "loss": 0.0402, |
| "num_tokens": 1843940.0, |
| "reward": 1.2527916431427002, |
| "reward_std": 2.0610151290893555, |
| "rewards/traffic_reward_func/mean": 1.2527916431427002, |
| "rewards/traffic_reward_func/std": 2.429760694503784, |
| "step": 55 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 97.0, |
| "completions/max_terminated_length": 97.0, |
| "completions/mean_length": 81.16667175292969, |
| "completions/mean_terminated_length": 81.16667175292969, |
| "completions/min_length": 64.0, |
| "completions/min_terminated_length": 64.0, |
| "entropy": 0.4852754424015681, |
| "epoch": 0.7, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 35.69535827636719, |
| "learning_rate": 1e-06, |
| "loss": -0.0109, |
| "num_tokens": 1858694.0, |
| "reward": 5.95139217376709, |
| "reward_std": 2.6155526638031006, |
| "rewards/traffic_reward_func/mean": 5.951391696929932, |
| "rewards/traffic_reward_func/std": 3.5514721870422363, |
| "step": 56 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 94.0, |
| "completions/max_terminated_length": 94.0, |
| "completions/mean_length": 71.83333587646484, |
| "completions/mean_terminated_length": 71.83333587646484, |
| "completions/min_length": 55.0, |
| "completions/min_terminated_length": 55.0, |
| "entropy": 0.4291141629219055, |
| "epoch": 0.7125, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 18.40599822998047, |
| "learning_rate": 1e-06, |
| "loss": -0.0273, |
| "num_tokens": 1896504.0, |
| "reward": 4.475000381469727, |
| "reward_std": 1.1392022371292114, |
| "rewards/traffic_reward_func/mean": 4.474999904632568, |
| "rewards/traffic_reward_func/std": 3.0868356227874756, |
| "step": 57 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 103.0, |
| "completions/max_terminated_length": 103.0, |
| "completions/mean_length": 75.16667175292969, |
| "completions/mean_terminated_length": 75.16667175292969, |
| "completions/min_length": 59.0, |
| "completions/min_terminated_length": 59.0, |
| "entropy": 0.46632436911265057, |
| "epoch": 0.725, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 93.88121032714844, |
| "learning_rate": 1e-06, |
| "loss": 0.0942, |
| "num_tokens": 1910122.0, |
| "reward": 5.680558681488037, |
| "reward_std": 0.7012208700180054, |
| "rewards/traffic_reward_func/mean": 5.680558681488037, |
| "rewards/traffic_reward_func/std": 3.769535541534424, |
| "step": 58 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 111.0, |
| "completions/max_terminated_length": 111.0, |
| "completions/mean_length": 80.91667175292969, |
| "completions/mean_terminated_length": 80.91667175292969, |
| "completions/min_length": 59.0, |
| "completions/min_terminated_length": 59.0, |
| "entropy": 0.4988810867071152, |
| "epoch": 0.7375, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 30.007566452026367, |
| "learning_rate": 1e-06, |
| "loss": 0.0406, |
| "num_tokens": 1927093.0, |
| "reward": 6.993066787719727, |
| "reward_std": 1.729572057723999, |
| "rewards/traffic_reward_func/mean": 6.993066787719727, |
| "rewards/traffic_reward_func/std": 1.8516473770141602, |
| "step": 59 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 92.0, |
| "completions/max_terminated_length": 92.0, |
| "completions/mean_length": 66.58333587646484, |
| "completions/mean_terminated_length": 66.58333587646484, |
| "completions/min_length": 49.0, |
| "completions/min_terminated_length": 49.0, |
| "entropy": 0.4902360637982686, |
| "epoch": 0.75, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 34.398563385009766, |
| "learning_rate": 1e-06, |
| "loss": 0.0276, |
| "num_tokens": 1962172.0, |
| "reward": 4.361116886138916, |
| "reward_std": 2.2953672409057617, |
| "rewards/traffic_reward_func/mean": 4.361116886138916, |
| "rewards/traffic_reward_func/std": 3.6648292541503906, |
| "step": 60 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 95.0, |
| "completions/max_terminated_length": 95.0, |
| "completions/mean_length": 81.66667175292969, |
| "completions/mean_terminated_length": 81.66667175292969, |
| "completions/min_length": 65.0, |
| "completions/min_terminated_length": 65.0, |
| "entropy": 0.49865709245204926, |
| "epoch": 0.7625, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 28.541831970214844, |
| "learning_rate": 1e-06, |
| "loss": 0.0503, |
| "num_tokens": 1979688.0, |
| "reward": 5.8874921798706055, |
| "reward_std": 4.0627641677856445, |
| "rewards/traffic_reward_func/mean": 5.887491703033447, |
| "rewards/traffic_reward_func/std": 3.9809792041778564, |
| "step": 61 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 106.0, |
| "completions/max_terminated_length": 106.0, |
| "completions/mean_length": 81.66667175292969, |
| "completions/mean_terminated_length": 81.66667175292969, |
| "completions/min_length": 59.0, |
| "completions/min_terminated_length": 59.0, |
| "entropy": 0.47512758274873096, |
| "epoch": 0.775, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 25.184757232666016, |
| "learning_rate": 1e-06, |
| "loss": 0.0753, |
| "num_tokens": 2024532.0, |
| "reward": 3.6756999492645264, |
| "reward_std": 1.5340656042099, |
| "rewards/traffic_reward_func/mean": 3.6756999492645264, |
| "rewards/traffic_reward_func/std": 3.737661361694336, |
| "step": 62 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 98.0, |
| "completions/max_terminated_length": 98.0, |
| "completions/mean_length": 75.58333587646484, |
| "completions/mean_terminated_length": 75.58333587646484, |
| "completions/min_length": 56.0, |
| "completions/min_terminated_length": 56.0, |
| "entropy": 0.5664225220680237, |
| "epoch": 0.7875, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 33.457435607910156, |
| "learning_rate": 1e-06, |
| "loss": -0.0652, |
| "num_tokens": 2047719.0, |
| "reward": 6.995833396911621, |
| "reward_std": 1.5328638553619385, |
| "rewards/traffic_reward_func/mean": 6.995832920074463, |
| "rewards/traffic_reward_func/std": 1.7922395467758179, |
| "step": 63 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 99.0, |
| "completions/max_terminated_length": 99.0, |
| "completions/mean_length": 79.16667175292969, |
| "completions/mean_terminated_length": 79.16667175292969, |
| "completions/min_length": 64.0, |
| "completions/min_terminated_length": 64.0, |
| "entropy": 0.46559110780556995, |
| "epoch": 0.8, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 52.608306884765625, |
| "learning_rate": 1e-06, |
| "loss": -0.0275, |
| "num_tokens": 2070705.0, |
| "reward": 6.859725475311279, |
| "reward_std": 1.9864501953125, |
| "rewards/traffic_reward_func/mean": 6.859724521636963, |
| "rewards/traffic_reward_func/std": 2.8455488681793213, |
| "step": 64 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 121.0, |
| "completions/max_terminated_length": 121.0, |
| "completions/mean_length": 80.41667175292969, |
| "completions/mean_terminated_length": 80.41667175292969, |
| "completions/min_length": 57.0, |
| "completions/min_terminated_length": 57.0, |
| "entropy": 0.5632809400558472, |
| "epoch": 0.8125, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 45.61239242553711, |
| "learning_rate": 1e-06, |
| "loss": -0.0431, |
| "num_tokens": 2115514.0, |
| "reward": 5.90695858001709, |
| "reward_std": 2.309171199798584, |
| "rewards/traffic_reward_func/mean": 5.906958103179932, |
| "rewards/traffic_reward_func/std": 3.0801453590393066, |
| "step": 65 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 112.0, |
| "completions/max_terminated_length": 112.0, |
| "completions/mean_length": 81.91667175292969, |
| "completions/mean_terminated_length": 81.91667175292969, |
| "completions/min_length": 52.0, |
| "completions/min_terminated_length": 52.0, |
| "entropy": 0.44120916227499646, |
| "epoch": 0.825, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 125.84535217285156, |
| "learning_rate": 1e-06, |
| "loss": -0.0359, |
| "num_tokens": 2149929.0, |
| "reward": 7.644450664520264, |
| "reward_std": 0.8775724768638611, |
| "rewards/traffic_reward_func/mean": 7.644450664520264, |
| "rewards/traffic_reward_func/std": 1.285986065864563, |
| "step": 66 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 87.0, |
| "completions/max_terminated_length": 87.0, |
| "completions/mean_length": 66.41667175292969, |
| "completions/mean_terminated_length": 66.41667175292969, |
| "completions/min_length": 51.0, |
| "completions/min_terminated_length": 51.0, |
| "entropy": 0.40261663496494293, |
| "epoch": 0.8375, |
| "frac_reward_zero_std": 0.3333333432674408, |
| "grad_norm": 41.06476974487305, |
| "learning_rate": 1e-06, |
| "loss": -0.005, |
| "num_tokens": 2193706.0, |
| "reward": 2.2083334922790527, |
| "reward_std": 0.5382140874862671, |
| "rewards/traffic_reward_func/mean": 2.2083332538604736, |
| "rewards/traffic_reward_func/std": 4.327429294586182, |
| "step": 67 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 105.0, |
| "completions/max_terminated_length": 105.0, |
| "completions/mean_length": 76.33333587646484, |
| "completions/mean_terminated_length": 76.33333587646484, |
| "completions/min_length": 53.0, |
| "completions/min_terminated_length": 53.0, |
| "entropy": 0.46220987538496655, |
| "epoch": 0.85, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 125.66222381591797, |
| "learning_rate": 1e-06, |
| "loss": 0.0004, |
| "num_tokens": 2243534.0, |
| "reward": 4.913891792297363, |
| "reward_std": 1.3074228763580322, |
| "rewards/traffic_reward_func/mean": 4.913891792297363, |
| "rewards/traffic_reward_func/std": 4.387299060821533, |
| "step": 68 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 97.0, |
| "completions/max_terminated_length": 97.0, |
| "completions/mean_length": 80.5, |
| "completions/mean_terminated_length": 80.5, |
| "completions/min_length": 61.0, |
| "completions/min_terminated_length": 61.0, |
| "entropy": 0.4722747306029002, |
| "epoch": 0.8625, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 85.23870086669922, |
| "learning_rate": 1e-06, |
| "loss": -0.0049, |
| "num_tokens": 2280168.0, |
| "reward": 5.401400566101074, |
| "reward_std": 2.607510566711426, |
| "rewards/traffic_reward_func/mean": 5.401400089263916, |
| "rewards/traffic_reward_func/std": 3.2133615016937256, |
| "step": 69 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 108.0, |
| "completions/max_terminated_length": 108.0, |
| "completions/mean_length": 84.91667175292969, |
| "completions/mean_terminated_length": 84.91667175292969, |
| "completions/min_length": 71.0, |
| "completions/min_terminated_length": 71.0, |
| "entropy": 0.4877086232105891, |
| "epoch": 0.875, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 31.59532356262207, |
| "learning_rate": 1e-06, |
| "loss": 0.0217, |
| "num_tokens": 2320043.0, |
| "reward": 4.733333587646484, |
| "reward_std": 1.9133939743041992, |
| "rewards/traffic_reward_func/mean": 4.733333110809326, |
| "rewards/traffic_reward_func/std": 3.7761902809143066, |
| "step": 70 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 89.0, |
| "completions/max_terminated_length": 89.0, |
| "completions/mean_length": 78.16667175292969, |
| "completions/mean_terminated_length": 78.16667175292969, |
| "completions/min_length": 67.0, |
| "completions/min_terminated_length": 67.0, |
| "entropy": 0.5284179349740347, |
| "epoch": 0.8875, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 160.29534912109375, |
| "learning_rate": 1e-06, |
| "loss": -0.0229, |
| "num_tokens": 2364281.0, |
| "reward": 5.315283298492432, |
| "reward_std": 2.4020538330078125, |
| "rewards/traffic_reward_func/mean": 5.315283298492432, |
| "rewards/traffic_reward_func/std": 3.021080732345581, |
| "step": 71 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 114.0, |
| "completions/max_terminated_length": 114.0, |
| "completions/mean_length": 76.16667175292969, |
| "completions/mean_terminated_length": 76.16667175292969, |
| "completions/min_length": 59.0, |
| "completions/min_terminated_length": 59.0, |
| "entropy": 0.37924371659755707, |
| "epoch": 0.9, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 27.164525985717773, |
| "learning_rate": 1e-06, |
| "loss": 0.0432, |
| "num_tokens": 2403319.0, |
| "reward": 5.695833206176758, |
| "reward_std": 2.448166608810425, |
| "rewards/traffic_reward_func/mean": 5.695833683013916, |
| "rewards/traffic_reward_func/std": 3.723893404006958, |
| "step": 72 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 106.0, |
| "completions/max_terminated_length": 106.0, |
| "completions/mean_length": 73.5, |
| "completions/mean_terminated_length": 73.5, |
| "completions/min_length": 55.0, |
| "completions/min_terminated_length": 55.0, |
| "entropy": 0.43939289450645447, |
| "epoch": 0.9125, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 96.966796875, |
| "learning_rate": 1e-06, |
| "loss": 0.0218, |
| "num_tokens": 2430789.0, |
| "reward": 5.0513916015625, |
| "reward_std": 2.6253767013549805, |
| "rewards/traffic_reward_func/mean": 5.0513916015625, |
| "rewards/traffic_reward_func/std": 3.912121057510376, |
| "step": 73 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 99.0, |
| "completions/max_terminated_length": 99.0, |
| "completions/mean_length": 74.16667175292969, |
| "completions/mean_terminated_length": 74.16667175292969, |
| "completions/min_length": 54.0, |
| "completions/min_terminated_length": 54.0, |
| "entropy": 0.49607772131760913, |
| "epoch": 0.925, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 85.89688873291016, |
| "learning_rate": 1e-06, |
| "loss": 0.0757, |
| "num_tokens": 2474387.0, |
| "reward": 1.7944416999816895, |
| "reward_std": 2.5643858909606934, |
| "rewards/traffic_reward_func/mean": 1.7944416999816895, |
| "rewards/traffic_reward_func/std": 3.5703654289245605, |
| "step": 74 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 82.0, |
| "completions/max_terminated_length": 82.0, |
| "completions/mean_length": 65.25, |
| "completions/mean_terminated_length": 65.25, |
| "completions/min_length": 48.0, |
| "completions/min_terminated_length": 48.0, |
| "entropy": 0.48170402149359387, |
| "epoch": 0.9375, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 41.65302658081055, |
| "learning_rate": 1e-06, |
| "loss": 0.008, |
| "num_tokens": 2497166.0, |
| "reward": 5.569441795349121, |
| "reward_std": 1.2931416034698486, |
| "rewards/traffic_reward_func/mean": 5.569442272186279, |
| "rewards/traffic_reward_func/std": 3.766671657562256, |
| "step": 75 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 118.0, |
| "completions/max_terminated_length": 118.0, |
| "completions/mean_length": 82.83333587646484, |
| "completions/mean_terminated_length": 82.83333587646484, |
| "completions/min_length": 65.0, |
| "completions/min_terminated_length": 65.0, |
| "entropy": 0.4894588639338811, |
| "epoch": 0.95, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 50.02711868286133, |
| "learning_rate": 1e-06, |
| "loss": 0.0131, |
| "num_tokens": 2540048.0, |
| "reward": 3.2583415508270264, |
| "reward_std": 3.812685966491699, |
| "rewards/traffic_reward_func/mean": 3.2583415508270264, |
| "rewards/traffic_reward_func/std": 3.675389051437378, |
| "step": 76 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 101.0, |
| "completions/max_terminated_length": 101.0, |
| "completions/mean_length": 79.33333587646484, |
| "completions/mean_terminated_length": 79.33333587646484, |
| "completions/min_length": 64.0, |
| "completions/min_terminated_length": 64.0, |
| "entropy": 0.39634905755519867, |
| "epoch": 0.9625, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 29.42837142944336, |
| "learning_rate": 1e-06, |
| "loss": 0.036, |
| "num_tokens": 2583088.0, |
| "reward": 4.486100196838379, |
| "reward_std": 1.4785020351409912, |
| "rewards/traffic_reward_func/mean": 4.486099720001221, |
| "rewards/traffic_reward_func/std": 3.721147060394287, |
| "step": 77 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 76.0, |
| "completions/max_terminated_length": 76.0, |
| "completions/mean_length": 66.16667175292969, |
| "completions/mean_terminated_length": 66.16667175292969, |
| "completions/min_length": 58.0, |
| "completions/min_terminated_length": 58.0, |
| "entropy": 0.4373449335495631, |
| "epoch": 0.975, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 22.252880096435547, |
| "learning_rate": 1e-06, |
| "loss": 0.0321, |
| "num_tokens": 2605074.0, |
| "reward": 7.447225093841553, |
| "reward_std": 1.0464049577713013, |
| "rewards/traffic_reward_func/mean": 7.447225093841553, |
| "rewards/traffic_reward_func/std": 1.274503231048584, |
| "step": 78 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 88.0, |
| "completions/max_terminated_length": 88.0, |
| "completions/mean_length": 71.0, |
| "completions/mean_terminated_length": 71.0, |
| "completions/min_length": 59.0, |
| "completions/min_terminated_length": 59.0, |
| "entropy": 0.38675158222516376, |
| "epoch": 0.9875, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 44.07793426513672, |
| "learning_rate": 1e-06, |
| "loss": 0.0143, |
| "num_tokens": 2635262.0, |
| "reward": 6.008333206176758, |
| "reward_std": 1.6903867721557617, |
| "rewards/traffic_reward_func/mean": 6.008333206176758, |
| "rewards/traffic_reward_func/std": 3.7762653827667236, |
| "step": 79 |
| }, |
| { |
| "clip_ratio/high_max": 0.0, |
| "clip_ratio/high_mean": 0.0, |
| "clip_ratio/low_mean": 0.0, |
| "clip_ratio/low_min": 0.0, |
| "clip_ratio/region_mean": 0.0, |
| "completions/clipped_ratio": 0.0, |
| "completions/max_length": 84.0, |
| "completions/max_terminated_length": 84.0, |
| "completions/mean_length": 69.91667175292969, |
| "completions/mean_terminated_length": 69.91667175292969, |
| "completions/min_length": 59.0, |
| "completions/min_terminated_length": 59.0, |
| "entropy": 0.4307720164457957, |
| "epoch": 1.0, |
| "frac_reward_zero_std": 0.0, |
| "grad_norm": 45.57075881958008, |
| "learning_rate": 1e-06, |
| "loss": 0.0387, |
| "num_tokens": 2681497.0, |
| "reward": 3.2916667461395264, |
| "reward_std": 1.6892813444137573, |
| "rewards/traffic_reward_func/mean": 3.2916667461395264, |
| "rewards/traffic_reward_func/std": 3.932587146759033, |
| "step": 80 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 80, |
| "num_input_tokens_seen": 2681497, |
| "num_train_epochs": 1, |
| "save_steps": 40, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 0.0, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|