TAU-R1-Summarizer / trainer_state.json
yl4300's picture
Upload folder using huggingface_hub
7ec0f81 verified
Raw
History Blame Contribute Delete
76 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 80,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 86.0,
"completions/max_terminated_length": 86.0,
"completions/mean_length": 76.0,
"completions/mean_terminated_length": 76.0,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.5930478672186533,
"epoch": 0.0125,
"frac_reward_zero_std": 0.0,
"grad_norm": 90.51835632324219,
"learning_rate": 0.0,
"loss": 0.0148,
"num_tokens": 31696.0,
"reward": 5.76389217376709,
"reward_std": 3.3388309478759766,
"rewards/traffic_reward_func/mean": 5.763891696929932,
"rewards/traffic_reward_func/std": 3.277735948562622,
"step": 1
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 78.0,
"completions/max_terminated_length": 78.0,
"completions/mean_length": 65.33333587646484,
"completions/mean_terminated_length": 65.33333587646484,
"completions/min_length": 50.0,
"completions/min_terminated_length": 50.0,
"entropy": 0.48857787748177844,
"epoch": 0.025,
"frac_reward_zero_std": 0.0,
"grad_norm": 48.55084228515625,
"learning_rate": 2.3137821315975918e-07,
"loss": 0.0205,
"num_tokens": 55156.0,
"reward": 4.936108589172363,
"reward_std": 3.530048370361328,
"rewards/traffic_reward_func/mean": 4.936108112335205,
"rewards/traffic_reward_func/std": 3.691174030303955,
"step": 2
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 109.0,
"completions/max_terminated_length": 109.0,
"completions/mean_length": 75.0,
"completions/mean_terminated_length": 75.0,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.587461918592453,
"epoch": 0.0375,
"frac_reward_zero_std": 0.0,
"grad_norm": 48.531009674072266,
"learning_rate": 3.6672579134208467e-07,
"loss": -0.0191,
"num_tokens": 93576.0,
"reward": 4.0694499015808105,
"reward_std": 3.6731364727020264,
"rewards/traffic_reward_func/mean": 4.0694499015808105,
"rewards/traffic_reward_func/std": 3.8600118160247803,
"step": 3
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 87.0,
"completions/max_terminated_length": 87.0,
"completions/mean_length": 74.33333587646484,
"completions/mean_terminated_length": 74.33333587646484,
"completions/min_length": 55.0,
"completions/min_terminated_length": 55.0,
"entropy": 0.5151417702436447,
"epoch": 0.05,
"frac_reward_zero_std": 0.0,
"grad_norm": 134.0212860107422,
"learning_rate": 4.6275642631951835e-07,
"loss": 0.0286,
"num_tokens": 136940.0,
"reward": 3.7013919353485107,
"reward_std": 1.9124457836151123,
"rewards/traffic_reward_func/mean": 3.7013919353485107,
"rewards/traffic_reward_func/std": 3.7552192211151123,
"step": 4
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 110.0,
"completions/max_terminated_length": 110.0,
"completions/mean_length": 84.83333587646484,
"completions/mean_terminated_length": 84.83333587646484,
"completions/min_length": 54.0,
"completions/min_terminated_length": 54.0,
"entropy": 0.5207065145174662,
"epoch": 0.0625,
"frac_reward_zero_std": 0.0,
"grad_norm": 45.01969528198242,
"learning_rate": 5.372435736804816e-07,
"loss": 0.0097,
"num_tokens": 170278.0,
"reward": 3.5027918815612793,
"reward_std": 1.3773735761642456,
"rewards/traffic_reward_func/mean": 3.5027916431427,
"rewards/traffic_reward_func/std": 4.128313064575195,
"step": 5
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 97.0,
"completions/max_terminated_length": 97.0,
"completions/mean_length": 73.41667175292969,
"completions/mean_terminated_length": 73.41667175292969,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.5358039538065592,
"epoch": 0.075,
"frac_reward_zero_std": 0.0,
"grad_norm": 62.962738037109375,
"learning_rate": 5.981040045018438e-07,
"loss": -0.0652,
"num_tokens": 184675.0,
"reward": 6.37082576751709,
"reward_std": 2.680429458618164,
"rewards/traffic_reward_func/mean": 6.370825290679932,
"rewards/traffic_reward_func/std": 2.830486536026001,
"step": 6
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 99.0,
"completions/max_terminated_length": 99.0,
"completions/mean_length": 72.16667175292969,
"completions/mean_terminated_length": 72.16667175292969,
"completions/min_length": 54.0,
"completions/min_terminated_length": 54.0,
"entropy": 0.5199788709481558,
"epoch": 0.0875,
"frac_reward_zero_std": 0.0,
"grad_norm": 48.52009201049805,
"learning_rate": 6.495607655709434e-07,
"loss": -0.0538,
"num_tokens": 220077.0,
"reward": 2.575000286102295,
"reward_std": 2.032099723815918,
"rewards/traffic_reward_func/mean": 2.575000047683716,
"rewards/traffic_reward_func/std": 3.287407159805298,
"step": 7
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 93.0,
"completions/max_terminated_length": 93.0,
"completions/mean_length": 74.41667175292969,
"completions/mean_terminated_length": 74.41667175292969,
"completions/min_length": 56.0,
"completions/min_terminated_length": 56.0,
"entropy": 0.5326513946056366,
"epoch": 0.1,
"frac_reward_zero_std": 0.0,
"grad_norm": 51.77104949951172,
"learning_rate": 6.941346394792774e-07,
"loss": 0.0029,
"num_tokens": 254770.0,
"reward": 4.1870503425598145,
"reward_std": 3.616281509399414,
"rewards/traffic_reward_func/mean": 4.1870503425598145,
"rewards/traffic_reward_func/std": 3.6269490718841553,
"step": 8
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 120.0,
"completions/max_terminated_length": 120.0,
"completions/mean_length": 75.75,
"completions/mean_terminated_length": 75.75,
"completions/min_length": 47.0,
"completions/min_terminated_length": 47.0,
"entropy": 0.5402362247308096,
"epoch": 0.1125,
"frac_reward_zero_std": 0.0,
"grad_norm": 24.48263168334961,
"learning_rate": 7.334515826841693e-07,
"loss": -0.043,
"num_tokens": 284315.0,
"reward": 3.6986165046691895,
"reward_std": 3.3095173835754395,
"rewards/traffic_reward_func/mean": 3.6986167430877686,
"rewards/traffic_reward_func/std": 3.810101270675659,
"step": 9
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 133.0,
"completions/max_terminated_length": 133.0,
"completions/mean_length": 91.66667175292969,
"completions/mean_terminated_length": 91.66667175292969,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"entropy": 0.5282839934031168,
"epoch": 0.125,
"frac_reward_zero_std": 0.0,
"grad_norm": 21.92542266845703,
"learning_rate": 7.686217868402409e-07,
"loss": 0.0344,
"num_tokens": 342115.0,
"reward": 4.9666666984558105,
"reward_std": 3.0202672481536865,
"rewards/traffic_reward_func/mean": 4.9666666984558105,
"rewards/traffic_reward_func/std": 4.13976526260376,
"step": 10
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 104.0,
"completions/max_terminated_length": 104.0,
"completions/mean_length": 82.75,
"completions/mean_terminated_length": 82.75,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.5616102963685989,
"epoch": 0.1375,
"frac_reward_zero_std": 0.0,
"grad_norm": 60.28784942626953,
"learning_rate": 8.004371064686714e-07,
"loss": 0.0296,
"num_tokens": 391732.0,
"reward": 3.715291976928711,
"reward_std": 2.362664222717285,
"rewards/traffic_reward_func/mean": 3.715291976928711,
"rewards/traffic_reward_func/std": 3.636319637298584,
"step": 11
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 95.0,
"completions/max_terminated_length": 95.0,
"completions/mean_length": 75.33333587646484,
"completions/mean_terminated_length": 75.33333587646484,
"completions/min_length": 49.0,
"completions/min_terminated_length": 49.0,
"entropy": 0.5451353937387466,
"epoch": 0.15,
"frac_reward_zero_std": 0.0,
"grad_norm": 51.164581298828125,
"learning_rate": 8.29482217661603e-07,
"loss": 0.0875,
"num_tokens": 419576.0,
"reward": 3.2374916076660156,
"reward_std": 1.5012121200561523,
"rewards/traffic_reward_func/mean": 3.2374916076660156,
"rewards/traffic_reward_func/std": 4.025315284729004,
"step": 12
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 101.0,
"completions/max_terminated_length": 101.0,
"completions/mean_length": 78.83333587646484,
"completions/mean_terminated_length": 78.83333587646484,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.4967418909072876,
"epoch": 0.1625,
"frac_reward_zero_std": 0.0,
"grad_norm": 39.67502212524414,
"learning_rate": 8.562011298888888e-07,
"loss": 0.0542,
"num_tokens": 451066.0,
"reward": 3.8458499908447266,
"reward_std": 3.0185961723327637,
"rewards/traffic_reward_func/mean": 3.8458499908447266,
"rewards/traffic_reward_func/std": 3.0665249824523926,
"step": 13
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 85.0,
"completions/max_terminated_length": 85.0,
"completions/mean_length": 72.16667175292969,
"completions/mean_terminated_length": 72.16667175292969,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.46256470680236816,
"epoch": 0.175,
"frac_reward_zero_std": 0.0,
"grad_norm": 36.632110595703125,
"learning_rate": 8.809389787307026e-07,
"loss": 0.0518,
"num_tokens": 481264.0,
"reward": 5.415283203125,
"reward_std": 3.098494529724121,
"rewards/traffic_reward_func/mean": 5.415283203125,
"rewards/traffic_reward_func/std": 3.7558400630950928,
"step": 14
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 119.0,
"completions/max_terminated_length": 119.0,
"completions/mean_length": 81.83333587646484,
"completions/mean_terminated_length": 81.83333587646484,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.4841439475615819,
"epoch": 0.1875,
"frac_reward_zero_std": 0.0,
"grad_norm": 49.08949279785156,
"learning_rate": 9.039693650225662e-07,
"loss": -0.0929,
"num_tokens": 516870.0,
"reward": 5.422224998474121,
"reward_std": 2.106595039367676,
"rewards/traffic_reward_func/mean": 5.422224521636963,
"rewards/traffic_reward_func/std": 2.377295970916748,
"step": 15
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 116.0,
"completions/max_terminated_length": 116.0,
"completions/mean_length": 82.25,
"completions/mean_terminated_length": 82.25,
"completions/min_length": 56.0,
"completions/min_terminated_length": 56.0,
"entropy": 0.5850350757439932,
"epoch": 0.2,
"frac_reward_zero_std": 0.0,
"grad_norm": 32.39323425292969,
"learning_rate": 9.255128526390367e-07,
"loss": 0.0266,
"num_tokens": 554513.0,
"reward": 3.019458293914795,
"reward_std": 0.3986830711364746,
"rewards/traffic_reward_func/mean": 3.019458055496216,
"rewards/traffic_reward_func/std": 3.730907678604126,
"step": 16
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 114.0,
"completions/max_terminated_length": 114.0,
"completions/mean_length": 85.75,
"completions/mean_terminated_length": 85.75,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.506961981455485,
"epoch": 0.2125,
"frac_reward_zero_std": 0.0,
"grad_norm": 188.8520050048828,
"learning_rate": 9.45749848565416e-07,
"loss": -0.0265,
"num_tokens": 578918.0,
"reward": 6.918058395385742,
"reward_std": 0.7207190990447998,
"rewards/traffic_reward_func/mean": 6.918058395385742,
"rewards/traffic_reward_func/std": 0.8269808292388916,
"step": 17
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 106.0,
"completions/max_terminated_length": 106.0,
"completions/mean_length": 81.75,
"completions/mean_terminated_length": 81.75,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.5057271818319956,
"epoch": 0.225,
"frac_reward_zero_std": 0.0,
"grad_norm": 52.07399368286133,
"learning_rate": 9.648297958439284e-07,
"loss": -0.0183,
"num_tokens": 604291.0,
"reward": 2.5041751861572266,
"reward_std": 2.239223003387451,
"rewards/traffic_reward_func/mean": 2.5041749477386475,
"rewards/traffic_reward_func/std": 2.6732337474823,
"step": 18
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 107.0,
"completions/max_terminated_length": 107.0,
"completions/mean_length": 79.33333587646484,
"completions/mean_terminated_length": 79.33333587646484,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.49002426366011304,
"epoch": 0.2375,
"frac_reward_zero_std": 0.0,
"grad_norm": 49.835079193115234,
"learning_rate": 9.828778776927557e-07,
"loss": 0.0385,
"num_tokens": 620123.0,
"reward": 5.941667079925537,
"reward_std": 0.5195273160934448,
"rewards/traffic_reward_func/mean": 5.941667079925537,
"rewards/traffic_reward_func/std": 4.17319917678833,
"step": 19
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 94.0,
"completions/max_terminated_length": 94.0,
"completions/mean_length": 77.08333587646484,
"completions/mean_terminated_length": 77.08333587646484,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.5183714032173157,
"epoch": 0.25,
"frac_reward_zero_std": 0.0,
"grad_norm": 36.613128662109375,
"learning_rate": 1e-06,
"loss": 0.0062,
"num_tokens": 666712.0,
"reward": 1.4916582107543945,
"reward_std": 1.6954081058502197,
"rewards/traffic_reward_func/mean": 1.491658329963684,
"rewards/traffic_reward_func/std": 2.9001410007476807,
"step": 20
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 115.0,
"completions/max_terminated_length": 115.0,
"completions/mean_length": 89.75,
"completions/mean_terminated_length": 89.75,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.5492318073908488,
"epoch": 0.2625,
"frac_reward_zero_std": 0.0,
"grad_norm": 24.955896377563477,
"learning_rate": 1e-06,
"loss": -0.0454,
"num_tokens": 707297.0,
"reward": 4.256950378417969,
"reward_std": 3.439373731613159,
"rewards/traffic_reward_func/mean": 4.2569499015808105,
"rewards/traffic_reward_func/std": 3.1874282360076904,
"step": 21
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 102.0,
"completions/max_terminated_length": 102.0,
"completions/mean_length": 81.58333587646484,
"completions/mean_terminated_length": 81.58333587646484,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"entropy": 0.5593699812889099,
"epoch": 0.275,
"frac_reward_zero_std": 0.0,
"grad_norm": 41.32038116455078,
"learning_rate": 1e-06,
"loss": -0.0316,
"num_tokens": 727540.0,
"reward": 3.834716796875,
"reward_std": 3.1437413692474365,
"rewards/traffic_reward_func/mean": 3.834716796875,
"rewards/traffic_reward_func/std": 2.9495410919189453,
"step": 22
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 104.0,
"completions/max_terminated_length": 104.0,
"completions/mean_length": 79.91667175292969,
"completions/mean_terminated_length": 79.91667175292969,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"entropy": 0.47043687105178833,
"epoch": 0.2875,
"frac_reward_zero_std": 0.0,
"grad_norm": 38.11423873901367,
"learning_rate": 1e-06,
"loss": 0.0469,
"num_tokens": 768527.0,
"reward": 5.273616790771484,
"reward_std": 1.5386489629745483,
"rewards/traffic_reward_func/mean": 5.273616313934326,
"rewards/traffic_reward_func/std": 3.3327481746673584,
"step": 23
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 92.0,
"completions/max_terminated_length": 92.0,
"completions/mean_length": 73.75,
"completions/mean_terminated_length": 73.75,
"completions/min_length": 55.0,
"completions/min_terminated_length": 55.0,
"entropy": 0.491796538233757,
"epoch": 0.3,
"frac_reward_zero_std": 0.0,
"grad_norm": 34.17938995361328,
"learning_rate": 1e-06,
"loss": -0.0535,
"num_tokens": 798836.0,
"reward": 5.034725189208984,
"reward_std": 3.6063766479492188,
"rewards/traffic_reward_func/mean": 5.034725189208984,
"rewards/traffic_reward_func/std": 3.413700819015503,
"step": 24
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 105.0,
"completions/max_terminated_length": 105.0,
"completions/mean_length": 78.58333587646484,
"completions/mean_terminated_length": 78.58333587646484,
"completions/min_length": 55.0,
"completions/min_terminated_length": 55.0,
"entropy": 0.515800267457962,
"epoch": 0.3125,
"frac_reward_zero_std": 0.0,
"grad_norm": 49.790279388427734,
"learning_rate": 1e-06,
"loss": 0.1052,
"num_tokens": 850955.0,
"reward": 5.030575275421143,
"reward_std": 1.0347952842712402,
"rewards/traffic_reward_func/mean": 5.030575275421143,
"rewards/traffic_reward_func/std": 3.7490885257720947,
"step": 25
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 100.0,
"completions/max_terminated_length": 100.0,
"completions/mean_length": 80.75,
"completions/mean_terminated_length": 80.75,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.5148407767216364,
"epoch": 0.325,
"frac_reward_zero_std": 0.0,
"grad_norm": 40.39106369018555,
"learning_rate": 1e-06,
"loss": -0.0604,
"num_tokens": 887936.0,
"reward": 3.543058395385742,
"reward_std": 1.2134441137313843,
"rewards/traffic_reward_func/mean": 3.543058395385742,
"rewards/traffic_reward_func/std": 3.9768006801605225,
"step": 26
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 94.0,
"completions/max_terminated_length": 94.0,
"completions/mean_length": 70.91667175292969,
"completions/mean_terminated_length": 70.91667175292969,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.43037260075410205,
"epoch": 0.3375,
"frac_reward_zero_std": 0.0,
"grad_norm": 51.63254165649414,
"learning_rate": 1e-06,
"loss": -0.0275,
"num_tokens": 923235.0,
"reward": 4.638883590698242,
"reward_std": 2.003594160079956,
"rewards/traffic_reward_func/mean": 4.638883113861084,
"rewards/traffic_reward_func/std": 4.541528224945068,
"step": 27
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 114.0,
"completions/max_terminated_length": 114.0,
"completions/mean_length": 77.83333587646484,
"completions/mean_terminated_length": 77.83333587646484,
"completions/min_length": 57.0,
"completions/min_terminated_length": 57.0,
"entropy": 0.4802086055278778,
"epoch": 0.35,
"frac_reward_zero_std": 0.0,
"grad_norm": 50.77159118652344,
"learning_rate": 1e-06,
"loss": 0.0246,
"num_tokens": 975865.0,
"reward": 5.4055585861206055,
"reward_std": 0.9993247389793396,
"rewards/traffic_reward_func/mean": 5.405558109283447,
"rewards/traffic_reward_func/std": 4.432521820068359,
"step": 28
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 111.0,
"completions/max_terminated_length": 111.0,
"completions/mean_length": 75.83333587646484,
"completions/mean_terminated_length": 75.83333587646484,
"completions/min_length": 58.0,
"completions/min_terminated_length": 58.0,
"entropy": 0.5248066335916519,
"epoch": 0.3625,
"frac_reward_zero_std": 0.0,
"grad_norm": 29.308929443359375,
"learning_rate": 1e-06,
"loss": -0.0054,
"num_tokens": 1021355.0,
"reward": 5.527783393859863,
"reward_std": 0.9038121700286865,
"rewards/traffic_reward_func/mean": 5.527782917022705,
"rewards/traffic_reward_func/std": 4.4734015464782715,
"step": 29
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 94.0,
"completions/max_terminated_length": 94.0,
"completions/mean_length": 70.5,
"completions/mean_terminated_length": 70.5,
"completions/min_length": 58.0,
"completions/min_terminated_length": 58.0,
"entropy": 0.49029021461804706,
"epoch": 0.375,
"frac_reward_zero_std": 0.0,
"grad_norm": 36.470375061035156,
"learning_rate": 1e-06,
"loss": 0.0945,
"num_tokens": 1041501.0,
"reward": 7.425000190734863,
"reward_std": 2.3710060119628906,
"rewards/traffic_reward_func/mean": 7.424999713897705,
"rewards/traffic_reward_func/std": 3.4395759105682373,
"step": 30
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 115.0,
"completions/max_terminated_length": 115.0,
"completions/mean_length": 74.91667175292969,
"completions/mean_terminated_length": 74.91667175292969,
"completions/min_length": 54.0,
"completions/min_terminated_length": 54.0,
"entropy": 0.4614233573277791,
"epoch": 0.3875,
"frac_reward_zero_std": 0.0,
"grad_norm": 40.14723587036133,
"learning_rate": 1e-06,
"loss": -0.0033,
"num_tokens": 1082024.0,
"reward": 2.5138919353485107,
"reward_std": 3.217278242111206,
"rewards/traffic_reward_func/mean": 2.5138919353485107,
"rewards/traffic_reward_func/std": 3.1958131790161133,
"step": 31
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 113.0,
"completions/max_terminated_length": 113.0,
"completions/mean_length": 82.25,
"completions/mean_terminated_length": 82.25,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"entropy": 0.47699304421742755,
"epoch": 0.4,
"frac_reward_zero_std": 0.0,
"grad_norm": 35.038387298583984,
"learning_rate": 1e-06,
"loss": 0.0313,
"num_tokens": 1111535.0,
"reward": 3.4027748107910156,
"reward_std": 2.7580385208129883,
"rewards/traffic_reward_func/mean": 3.4027748107910156,
"rewards/traffic_reward_func/std": 3.510051965713501,
"step": 32
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 109.0,
"completions/max_terminated_length": 109.0,
"completions/mean_length": 81.83333587646484,
"completions/mean_terminated_length": 81.83333587646484,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.4661006381114324,
"epoch": 0.4125,
"frac_reward_zero_std": 0.0,
"grad_norm": 27.36323356628418,
"learning_rate": 1e-06,
"loss": 0.0217,
"num_tokens": 1129873.0,
"reward": 3.373616933822632,
"reward_std": 0.5916072130203247,
"rewards/traffic_reward_func/mean": 3.373616933822632,
"rewards/traffic_reward_func/std": 3.97894549369812,
"step": 33
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 106.0,
"completions/max_terminated_length": 106.0,
"completions/mean_length": 79.91667175292969,
"completions/mean_terminated_length": 79.91667175292969,
"completions/min_length": 50.0,
"completions/min_terminated_length": 50.0,
"entropy": 0.5415816406408945,
"epoch": 0.425,
"frac_reward_zero_std": 0.0,
"grad_norm": 49.570030212402344,
"learning_rate": 1e-06,
"loss": 0.0021,
"num_tokens": 1168776.0,
"reward": 3.1805667877197266,
"reward_std": 1.868180751800537,
"rewards/traffic_reward_func/mean": 3.1805667877197266,
"rewards/traffic_reward_func/std": 3.855158567428589,
"step": 34
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 100.0,
"completions/max_terminated_length": 100.0,
"completions/mean_length": 76.41667175292969,
"completions/mean_terminated_length": 76.41667175292969,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.4782920181751251,
"epoch": 0.4375,
"frac_reward_zero_std": 0.0,
"grad_norm": 43.71452713012695,
"learning_rate": 1e-06,
"loss": 0.0029,
"num_tokens": 1185697.0,
"reward": 4.708350658416748,
"reward_std": 3.080965757369995,
"rewards/traffic_reward_func/mean": 4.708349704742432,
"rewards/traffic_reward_func/std": 3.2441697120666504,
"step": 35
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 81.0,
"completions/max_terminated_length": 81.0,
"completions/mean_length": 66.5,
"completions/mean_terminated_length": 66.5,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"entropy": 0.39282474915186566,
"epoch": 0.45,
"frac_reward_zero_std": 0.0,
"grad_norm": 21.168304443359375,
"learning_rate": 1e-06,
"loss": -0.0108,
"num_tokens": 1197535.0,
"reward": 4.433341979980469,
"reward_std": 1.4528138637542725,
"rewards/traffic_reward_func/mean": 4.4333415031433105,
"rewards/traffic_reward_func/std": 4.101103782653809,
"step": 36
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 90.0,
"completions/max_terminated_length": 90.0,
"completions/mean_length": 70.0,
"completions/mean_terminated_length": 70.0,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.5816979706287384,
"epoch": 0.4625,
"frac_reward_zero_std": 0.0,
"grad_norm": 29.439083099365234,
"learning_rate": 1e-06,
"loss": -0.0492,
"num_tokens": 1234363.0,
"reward": 2.4597251415252686,
"reward_std": 2.4156336784362793,
"rewards/traffic_reward_func/mean": 2.4597251415252686,
"rewards/traffic_reward_func/std": 3.5065743923187256,
"step": 37
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 99.0,
"completions/max_terminated_length": 99.0,
"completions/mean_length": 74.5,
"completions/mean_terminated_length": 74.5,
"completions/min_length": 38.0,
"completions/min_terminated_length": 38.0,
"entropy": 0.5000238766272863,
"epoch": 0.475,
"frac_reward_zero_std": 0.0,
"grad_norm": 23.74506187438965,
"learning_rate": 1e-06,
"loss": -0.0571,
"num_tokens": 1263281.0,
"reward": 5.895825386047363,
"reward_std": 1.9191408157348633,
"rewards/traffic_reward_func/mean": 5.895824909210205,
"rewards/traffic_reward_func/std": 3.6174724102020264,
"step": 38
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 108.0,
"completions/max_terminated_length": 108.0,
"completions/mean_length": 76.25,
"completions/mean_terminated_length": 76.25,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.45793966948986053,
"epoch": 0.4875,
"frac_reward_zero_std": 0.0,
"grad_norm": 39.483516693115234,
"learning_rate": 1e-06,
"loss": 0.022,
"num_tokens": 1289744.0,
"reward": 3.5625,
"reward_std": 2.4533605575561523,
"rewards/traffic_reward_func/mean": 3.5625,
"rewards/traffic_reward_func/std": 3.552657127380371,
"step": 39
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 103.0,
"completions/max_terminated_length": 103.0,
"completions/mean_length": 80.83333587646484,
"completions/mean_terminated_length": 80.83333587646484,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.44789523382981616,
"epoch": 0.5,
"frac_reward_zero_std": 0.0,
"grad_norm": 25.56493377685547,
"learning_rate": 1e-06,
"loss": -0.0273,
"num_tokens": 1343614.0,
"reward": 2.5388917922973633,
"reward_std": 2.4047036170959473,
"rewards/traffic_reward_func/mean": 2.5388917922973633,
"rewards/traffic_reward_func/std": 3.872169256210327,
"step": 40
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 119.0,
"completions/max_terminated_length": 119.0,
"completions/mean_length": 89.08333587646484,
"completions/mean_terminated_length": 89.08333587646484,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.5121592978636423,
"epoch": 0.5125,
"frac_reward_zero_std": 0.0,
"grad_norm": 36.71591567993164,
"learning_rate": 1e-06,
"loss": 0.0195,
"num_tokens": 1374299.0,
"reward": 3.6777751445770264,
"reward_std": 1.8058867454528809,
"rewards/traffic_reward_func/mean": 3.6777751445770264,
"rewards/traffic_reward_func/std": 3.704275608062744,
"step": 41
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 110.0,
"completions/max_terminated_length": 110.0,
"completions/mean_length": 78.83333587646484,
"completions/mean_terminated_length": 78.83333587646484,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.4801830897728602,
"epoch": 0.525,
"frac_reward_zero_std": 0.0,
"grad_norm": 52.765411376953125,
"learning_rate": 1e-06,
"loss": 0.0219,
"num_tokens": 1407609.0,
"reward": 5.170842170715332,
"reward_std": 1.01166832447052,
"rewards/traffic_reward_func/mean": 5.170841693878174,
"rewards/traffic_reward_func/std": 3.720168352127075,
"step": 42
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 103.0,
"completions/max_terminated_length": 103.0,
"completions/mean_length": 77.5,
"completions/mean_terminated_length": 77.5,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.4042755365371704,
"epoch": 0.5375,
"frac_reward_zero_std": 0.0,
"grad_norm": 33.306434631347656,
"learning_rate": 1e-06,
"loss": -0.0567,
"num_tokens": 1450599.0,
"reward": 3.8472251892089844,
"reward_std": 1.5399649143218994,
"rewards/traffic_reward_func/mean": 3.8472251892089844,
"rewards/traffic_reward_func/std": 3.8577704429626465,
"step": 43
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 103.0,
"completions/max_terminated_length": 103.0,
"completions/mean_length": 76.91667175292969,
"completions/mean_terminated_length": 76.91667175292969,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.49547875424226123,
"epoch": 0.55,
"frac_reward_zero_std": 0.0,
"grad_norm": 20.690107345581055,
"learning_rate": 1e-06,
"loss": 0.0282,
"num_tokens": 1472430.0,
"reward": 4.722233772277832,
"reward_std": 3.454416275024414,
"rewards/traffic_reward_func/mean": 4.722233295440674,
"rewards/traffic_reward_func/std": 3.424010992050171,
"step": 44
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 112.0,
"completions/max_terminated_length": 112.0,
"completions/mean_length": 80.25,
"completions/mean_terminated_length": 80.25,
"completions/min_length": 58.0,
"completions/min_terminated_length": 58.0,
"entropy": 0.5444711943467458,
"epoch": 0.5625,
"frac_reward_zero_std": 0.0,
"grad_norm": 38.43059539794922,
"learning_rate": 1e-06,
"loss": 0.0068,
"num_tokens": 1517721.0,
"reward": 3.4486002922058105,
"reward_std": 3.676071882247925,
"rewards/traffic_reward_func/mean": 3.4486000537872314,
"rewards/traffic_reward_func/std": 3.447497606277466,
"step": 45
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 95.0,
"completions/max_terminated_length": 95.0,
"completions/mean_length": 70.16667175292969,
"completions/mean_terminated_length": 70.16667175292969,
"completions/min_length": 56.0,
"completions/min_terminated_length": 56.0,
"entropy": 0.4563195804754893,
"epoch": 0.575,
"frac_reward_zero_std": 0.0,
"grad_norm": 42.63100814819336,
"learning_rate": 1e-06,
"loss": 0.0322,
"num_tokens": 1546679.0,
"reward": 6.715291500091553,
"reward_std": 0.7320005893707275,
"rewards/traffic_reward_func/mean": 6.715291500091553,
"rewards/traffic_reward_func/std": 0.8352113962173462,
"step": 46
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 111.0,
"completions/max_terminated_length": 111.0,
"completions/mean_length": 78.5,
"completions/mean_terminated_length": 78.5,
"completions/min_length": 57.0,
"completions/min_terminated_length": 57.0,
"entropy": 0.49592259029547375,
"epoch": 0.5875,
"frac_reward_zero_std": 0.0,
"grad_norm": 29.279052734375,
"learning_rate": 1e-06,
"loss": 0.0151,
"num_tokens": 1586877.0,
"reward": 5.087500095367432,
"reward_std": 0.6266295909881592,
"rewards/traffic_reward_func/mean": 5.087500095367432,
"rewards/traffic_reward_func/std": 4.1403374671936035,
"step": 47
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 121.0,
"completions/max_terminated_length": 121.0,
"completions/mean_length": 87.58333587646484,
"completions/mean_terminated_length": 87.58333587646484,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.5477126836776733,
"epoch": 0.6,
"frac_reward_zero_std": 0.0,
"grad_norm": 27.99470329284668,
"learning_rate": 1e-06,
"loss": -0.0028,
"num_tokens": 1625432.0,
"reward": 6.4972333908081055,
"reward_std": 1.9132798910140991,
"rewards/traffic_reward_func/mean": 6.497232913970947,
"rewards/traffic_reward_func/std": 2.49464750289917,
"step": 48
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 105.0,
"completions/max_terminated_length": 105.0,
"completions/mean_length": 74.91667175292969,
"completions/mean_terminated_length": 74.91667175292969,
"completions/min_length": 57.0,
"completions/min_terminated_length": 57.0,
"entropy": 0.48915834228197735,
"epoch": 0.6125,
"frac_reward_zero_std": 0.0,
"grad_norm": 44.14060974121094,
"learning_rate": 1e-06,
"loss": -0.0755,
"num_tokens": 1668459.0,
"reward": 6.130550384521484,
"reward_std": 1.7243244647979736,
"rewards/traffic_reward_func/mean": 6.130549907684326,
"rewards/traffic_reward_func/std": 3.7066969871520996,
"step": 49
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 90.0,
"completions/max_terminated_length": 90.0,
"completions/mean_length": 71.91667175292969,
"completions/mean_terminated_length": 71.91667175292969,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.4961145718892415,
"epoch": 0.625,
"frac_reward_zero_std": 0.0,
"grad_norm": 37.630306243896484,
"learning_rate": 1e-06,
"loss": -0.0181,
"num_tokens": 1696266.0,
"reward": 6.0013837814331055,
"reward_std": 2.947798490524292,
"rewards/traffic_reward_func/mean": 6.001383304595947,
"rewards/traffic_reward_func/std": 3.299156904220581,
"step": 50
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 93.0,
"completions/max_terminated_length": 93.0,
"completions/mean_length": 75.58333587646484,
"completions/mean_terminated_length": 75.58333587646484,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.514509250720342,
"epoch": 0.6375,
"frac_reward_zero_std": 0.0,
"grad_norm": 25.36536407470703,
"learning_rate": 1e-06,
"loss": 0.0056,
"num_tokens": 1741293.0,
"reward": 3.527791976928711,
"reward_std": 2.566014289855957,
"rewards/traffic_reward_func/mean": 3.527791976928711,
"rewards/traffic_reward_func/std": 3.951629877090454,
"step": 51
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 113.0,
"completions/max_terminated_length": 113.0,
"completions/mean_length": 72.66667175292969,
"completions/mean_terminated_length": 72.66667175292969,
"completions/min_length": 58.0,
"completions/min_terminated_length": 58.0,
"entropy": 0.43037161727746326,
"epoch": 0.65,
"frac_reward_zero_std": 0.0,
"grad_norm": 40.816951751708984,
"learning_rate": 1e-06,
"loss": 0.0862,
"num_tokens": 1766649.0,
"reward": 3.526400089263916,
"reward_std": 3.911458969116211,
"rewards/traffic_reward_func/mean": 3.526399850845337,
"rewards/traffic_reward_func/std": 4.082000732421875,
"step": 52
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 88.0,
"completions/max_terminated_length": 88.0,
"completions/mean_length": 70.33333587646484,
"completions/mean_terminated_length": 70.33333587646484,
"completions/min_length": 57.0,
"completions/min_terminated_length": 57.0,
"entropy": 0.4433082193136215,
"epoch": 0.6625,
"frac_reward_zero_std": 0.0,
"grad_norm": 41.49685287475586,
"learning_rate": 1e-06,
"loss": -0.0666,
"num_tokens": 1788665.0,
"reward": 6.010425567626953,
"reward_std": 2.2142837047576904,
"rewards/traffic_reward_func/mean": 6.010425567626953,
"rewards/traffic_reward_func/std": 2.868074893951416,
"step": 53
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 72.0,
"completions/max_terminated_length": 72.0,
"completions/mean_length": 66.16667175292969,
"completions/mean_terminated_length": 66.16667175292969,
"completions/min_length": 51.0,
"completions/min_terminated_length": 51.0,
"entropy": 0.42625242471694946,
"epoch": 0.675,
"frac_reward_zero_std": 0.0,
"grad_norm": 75.25613403320312,
"learning_rate": 1e-06,
"loss": 0.0035,
"num_tokens": 1799695.0,
"reward": 5.708341598510742,
"reward_std": 3.315927505493164,
"rewards/traffic_reward_func/mean": 5.708341598510742,
"rewards/traffic_reward_func/std": 3.45544171333313,
"step": 54
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 114.0,
"completions/max_terminated_length": 114.0,
"completions/mean_length": 80.75,
"completions/mean_terminated_length": 80.75,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.48757071793079376,
"epoch": 0.6875,
"frac_reward_zero_std": 0.0,
"grad_norm": 46.29209899902344,
"learning_rate": 1e-06,
"loss": 0.0402,
"num_tokens": 1843940.0,
"reward": 1.2527916431427002,
"reward_std": 2.0610151290893555,
"rewards/traffic_reward_func/mean": 1.2527916431427002,
"rewards/traffic_reward_func/std": 2.429760694503784,
"step": 55
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 97.0,
"completions/max_terminated_length": 97.0,
"completions/mean_length": 81.16667175292969,
"completions/mean_terminated_length": 81.16667175292969,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.4852754424015681,
"epoch": 0.7,
"frac_reward_zero_std": 0.0,
"grad_norm": 35.69535827636719,
"learning_rate": 1e-06,
"loss": -0.0109,
"num_tokens": 1858694.0,
"reward": 5.95139217376709,
"reward_std": 2.6155526638031006,
"rewards/traffic_reward_func/mean": 5.951391696929932,
"rewards/traffic_reward_func/std": 3.5514721870422363,
"step": 56
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 94.0,
"completions/max_terminated_length": 94.0,
"completions/mean_length": 71.83333587646484,
"completions/mean_terminated_length": 71.83333587646484,
"completions/min_length": 55.0,
"completions/min_terminated_length": 55.0,
"entropy": 0.4291141629219055,
"epoch": 0.7125,
"frac_reward_zero_std": 0.0,
"grad_norm": 18.40599822998047,
"learning_rate": 1e-06,
"loss": -0.0273,
"num_tokens": 1896504.0,
"reward": 4.475000381469727,
"reward_std": 1.1392022371292114,
"rewards/traffic_reward_func/mean": 4.474999904632568,
"rewards/traffic_reward_func/std": 3.0868356227874756,
"step": 57
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 103.0,
"completions/max_terminated_length": 103.0,
"completions/mean_length": 75.16667175292969,
"completions/mean_terminated_length": 75.16667175292969,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.46632436911265057,
"epoch": 0.725,
"frac_reward_zero_std": 0.0,
"grad_norm": 93.88121032714844,
"learning_rate": 1e-06,
"loss": 0.0942,
"num_tokens": 1910122.0,
"reward": 5.680558681488037,
"reward_std": 0.7012208700180054,
"rewards/traffic_reward_func/mean": 5.680558681488037,
"rewards/traffic_reward_func/std": 3.769535541534424,
"step": 58
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 111.0,
"completions/max_terminated_length": 111.0,
"completions/mean_length": 80.91667175292969,
"completions/mean_terminated_length": 80.91667175292969,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.4988810867071152,
"epoch": 0.7375,
"frac_reward_zero_std": 0.0,
"grad_norm": 30.007566452026367,
"learning_rate": 1e-06,
"loss": 0.0406,
"num_tokens": 1927093.0,
"reward": 6.993066787719727,
"reward_std": 1.729572057723999,
"rewards/traffic_reward_func/mean": 6.993066787719727,
"rewards/traffic_reward_func/std": 1.8516473770141602,
"step": 59
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 92.0,
"completions/max_terminated_length": 92.0,
"completions/mean_length": 66.58333587646484,
"completions/mean_terminated_length": 66.58333587646484,
"completions/min_length": 49.0,
"completions/min_terminated_length": 49.0,
"entropy": 0.4902360637982686,
"epoch": 0.75,
"frac_reward_zero_std": 0.0,
"grad_norm": 34.398563385009766,
"learning_rate": 1e-06,
"loss": 0.0276,
"num_tokens": 1962172.0,
"reward": 4.361116886138916,
"reward_std": 2.2953672409057617,
"rewards/traffic_reward_func/mean": 4.361116886138916,
"rewards/traffic_reward_func/std": 3.6648292541503906,
"step": 60
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 95.0,
"completions/max_terminated_length": 95.0,
"completions/mean_length": 81.66667175292969,
"completions/mean_terminated_length": 81.66667175292969,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.49865709245204926,
"epoch": 0.7625,
"frac_reward_zero_std": 0.0,
"grad_norm": 28.541831970214844,
"learning_rate": 1e-06,
"loss": 0.0503,
"num_tokens": 1979688.0,
"reward": 5.8874921798706055,
"reward_std": 4.0627641677856445,
"rewards/traffic_reward_func/mean": 5.887491703033447,
"rewards/traffic_reward_func/std": 3.9809792041778564,
"step": 61
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 106.0,
"completions/max_terminated_length": 106.0,
"completions/mean_length": 81.66667175292969,
"completions/mean_terminated_length": 81.66667175292969,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.47512758274873096,
"epoch": 0.775,
"frac_reward_zero_std": 0.0,
"grad_norm": 25.184757232666016,
"learning_rate": 1e-06,
"loss": 0.0753,
"num_tokens": 2024532.0,
"reward": 3.6756999492645264,
"reward_std": 1.5340656042099,
"rewards/traffic_reward_func/mean": 3.6756999492645264,
"rewards/traffic_reward_func/std": 3.737661361694336,
"step": 62
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 98.0,
"completions/max_terminated_length": 98.0,
"completions/mean_length": 75.58333587646484,
"completions/mean_terminated_length": 75.58333587646484,
"completions/min_length": 56.0,
"completions/min_terminated_length": 56.0,
"entropy": 0.5664225220680237,
"epoch": 0.7875,
"frac_reward_zero_std": 0.0,
"grad_norm": 33.457435607910156,
"learning_rate": 1e-06,
"loss": -0.0652,
"num_tokens": 2047719.0,
"reward": 6.995833396911621,
"reward_std": 1.5328638553619385,
"rewards/traffic_reward_func/mean": 6.995832920074463,
"rewards/traffic_reward_func/std": 1.7922395467758179,
"step": 63
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 99.0,
"completions/max_terminated_length": 99.0,
"completions/mean_length": 79.16667175292969,
"completions/mean_terminated_length": 79.16667175292969,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.46559110780556995,
"epoch": 0.8,
"frac_reward_zero_std": 0.0,
"grad_norm": 52.608306884765625,
"learning_rate": 1e-06,
"loss": -0.0275,
"num_tokens": 2070705.0,
"reward": 6.859725475311279,
"reward_std": 1.9864501953125,
"rewards/traffic_reward_func/mean": 6.859724521636963,
"rewards/traffic_reward_func/std": 2.8455488681793213,
"step": 64
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 121.0,
"completions/max_terminated_length": 121.0,
"completions/mean_length": 80.41667175292969,
"completions/mean_terminated_length": 80.41667175292969,
"completions/min_length": 57.0,
"completions/min_terminated_length": 57.0,
"entropy": 0.5632809400558472,
"epoch": 0.8125,
"frac_reward_zero_std": 0.0,
"grad_norm": 45.61239242553711,
"learning_rate": 1e-06,
"loss": -0.0431,
"num_tokens": 2115514.0,
"reward": 5.90695858001709,
"reward_std": 2.309171199798584,
"rewards/traffic_reward_func/mean": 5.906958103179932,
"rewards/traffic_reward_func/std": 3.0801453590393066,
"step": 65
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 112.0,
"completions/max_terminated_length": 112.0,
"completions/mean_length": 81.91667175292969,
"completions/mean_terminated_length": 81.91667175292969,
"completions/min_length": 52.0,
"completions/min_terminated_length": 52.0,
"entropy": 0.44120916227499646,
"epoch": 0.825,
"frac_reward_zero_std": 0.0,
"grad_norm": 125.84535217285156,
"learning_rate": 1e-06,
"loss": -0.0359,
"num_tokens": 2149929.0,
"reward": 7.644450664520264,
"reward_std": 0.8775724768638611,
"rewards/traffic_reward_func/mean": 7.644450664520264,
"rewards/traffic_reward_func/std": 1.285986065864563,
"step": 66
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 87.0,
"completions/max_terminated_length": 87.0,
"completions/mean_length": 66.41667175292969,
"completions/mean_terminated_length": 66.41667175292969,
"completions/min_length": 51.0,
"completions/min_terminated_length": 51.0,
"entropy": 0.40261663496494293,
"epoch": 0.8375,
"frac_reward_zero_std": 0.3333333432674408,
"grad_norm": 41.06476974487305,
"learning_rate": 1e-06,
"loss": -0.005,
"num_tokens": 2193706.0,
"reward": 2.2083334922790527,
"reward_std": 0.5382140874862671,
"rewards/traffic_reward_func/mean": 2.2083332538604736,
"rewards/traffic_reward_func/std": 4.327429294586182,
"step": 67
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 105.0,
"completions/max_terminated_length": 105.0,
"completions/mean_length": 76.33333587646484,
"completions/mean_terminated_length": 76.33333587646484,
"completions/min_length": 53.0,
"completions/min_terminated_length": 53.0,
"entropy": 0.46220987538496655,
"epoch": 0.85,
"frac_reward_zero_std": 0.0,
"grad_norm": 125.66222381591797,
"learning_rate": 1e-06,
"loss": 0.0004,
"num_tokens": 2243534.0,
"reward": 4.913891792297363,
"reward_std": 1.3074228763580322,
"rewards/traffic_reward_func/mean": 4.913891792297363,
"rewards/traffic_reward_func/std": 4.387299060821533,
"step": 68
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 97.0,
"completions/max_terminated_length": 97.0,
"completions/mean_length": 80.5,
"completions/mean_terminated_length": 80.5,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"entropy": 0.4722747306029002,
"epoch": 0.8625,
"frac_reward_zero_std": 0.0,
"grad_norm": 85.23870086669922,
"learning_rate": 1e-06,
"loss": -0.0049,
"num_tokens": 2280168.0,
"reward": 5.401400566101074,
"reward_std": 2.607510566711426,
"rewards/traffic_reward_func/mean": 5.401400089263916,
"rewards/traffic_reward_func/std": 3.2133615016937256,
"step": 69
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 108.0,
"completions/max_terminated_length": 108.0,
"completions/mean_length": 84.91667175292969,
"completions/mean_terminated_length": 84.91667175292969,
"completions/min_length": 71.0,
"completions/min_terminated_length": 71.0,
"entropy": 0.4877086232105891,
"epoch": 0.875,
"frac_reward_zero_std": 0.0,
"grad_norm": 31.59532356262207,
"learning_rate": 1e-06,
"loss": 0.0217,
"num_tokens": 2320043.0,
"reward": 4.733333587646484,
"reward_std": 1.9133939743041992,
"rewards/traffic_reward_func/mean": 4.733333110809326,
"rewards/traffic_reward_func/std": 3.7761902809143066,
"step": 70
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 89.0,
"completions/max_terminated_length": 89.0,
"completions/mean_length": 78.16667175292969,
"completions/mean_terminated_length": 78.16667175292969,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"entropy": 0.5284179349740347,
"epoch": 0.8875,
"frac_reward_zero_std": 0.0,
"grad_norm": 160.29534912109375,
"learning_rate": 1e-06,
"loss": -0.0229,
"num_tokens": 2364281.0,
"reward": 5.315283298492432,
"reward_std": 2.4020538330078125,
"rewards/traffic_reward_func/mean": 5.315283298492432,
"rewards/traffic_reward_func/std": 3.021080732345581,
"step": 71
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 114.0,
"completions/max_terminated_length": 114.0,
"completions/mean_length": 76.16667175292969,
"completions/mean_terminated_length": 76.16667175292969,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.37924371659755707,
"epoch": 0.9,
"frac_reward_zero_std": 0.0,
"grad_norm": 27.164525985717773,
"learning_rate": 1e-06,
"loss": 0.0432,
"num_tokens": 2403319.0,
"reward": 5.695833206176758,
"reward_std": 2.448166608810425,
"rewards/traffic_reward_func/mean": 5.695833683013916,
"rewards/traffic_reward_func/std": 3.723893404006958,
"step": 72
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 106.0,
"completions/max_terminated_length": 106.0,
"completions/mean_length": 73.5,
"completions/mean_terminated_length": 73.5,
"completions/min_length": 55.0,
"completions/min_terminated_length": 55.0,
"entropy": 0.43939289450645447,
"epoch": 0.9125,
"frac_reward_zero_std": 0.0,
"grad_norm": 96.966796875,
"learning_rate": 1e-06,
"loss": 0.0218,
"num_tokens": 2430789.0,
"reward": 5.0513916015625,
"reward_std": 2.6253767013549805,
"rewards/traffic_reward_func/mean": 5.0513916015625,
"rewards/traffic_reward_func/std": 3.912121057510376,
"step": 73
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 99.0,
"completions/max_terminated_length": 99.0,
"completions/mean_length": 74.16667175292969,
"completions/mean_terminated_length": 74.16667175292969,
"completions/min_length": 54.0,
"completions/min_terminated_length": 54.0,
"entropy": 0.49607772131760913,
"epoch": 0.925,
"frac_reward_zero_std": 0.0,
"grad_norm": 85.89688873291016,
"learning_rate": 1e-06,
"loss": 0.0757,
"num_tokens": 2474387.0,
"reward": 1.7944416999816895,
"reward_std": 2.5643858909606934,
"rewards/traffic_reward_func/mean": 1.7944416999816895,
"rewards/traffic_reward_func/std": 3.5703654289245605,
"step": 74
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 82.0,
"completions/max_terminated_length": 82.0,
"completions/mean_length": 65.25,
"completions/mean_terminated_length": 65.25,
"completions/min_length": 48.0,
"completions/min_terminated_length": 48.0,
"entropy": 0.48170402149359387,
"epoch": 0.9375,
"frac_reward_zero_std": 0.0,
"grad_norm": 41.65302658081055,
"learning_rate": 1e-06,
"loss": 0.008,
"num_tokens": 2497166.0,
"reward": 5.569441795349121,
"reward_std": 1.2931416034698486,
"rewards/traffic_reward_func/mean": 5.569442272186279,
"rewards/traffic_reward_func/std": 3.766671657562256,
"step": 75
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 118.0,
"completions/max_terminated_length": 118.0,
"completions/mean_length": 82.83333587646484,
"completions/mean_terminated_length": 82.83333587646484,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"entropy": 0.4894588639338811,
"epoch": 0.95,
"frac_reward_zero_std": 0.0,
"grad_norm": 50.02711868286133,
"learning_rate": 1e-06,
"loss": 0.0131,
"num_tokens": 2540048.0,
"reward": 3.2583415508270264,
"reward_std": 3.812685966491699,
"rewards/traffic_reward_func/mean": 3.2583415508270264,
"rewards/traffic_reward_func/std": 3.675389051437378,
"step": 76
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 101.0,
"completions/max_terminated_length": 101.0,
"completions/mean_length": 79.33333587646484,
"completions/mean_terminated_length": 79.33333587646484,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"entropy": 0.39634905755519867,
"epoch": 0.9625,
"frac_reward_zero_std": 0.0,
"grad_norm": 29.42837142944336,
"learning_rate": 1e-06,
"loss": 0.036,
"num_tokens": 2583088.0,
"reward": 4.486100196838379,
"reward_std": 1.4785020351409912,
"rewards/traffic_reward_func/mean": 4.486099720001221,
"rewards/traffic_reward_func/std": 3.721147060394287,
"step": 77
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 76.0,
"completions/max_terminated_length": 76.0,
"completions/mean_length": 66.16667175292969,
"completions/mean_terminated_length": 66.16667175292969,
"completions/min_length": 58.0,
"completions/min_terminated_length": 58.0,
"entropy": 0.4373449335495631,
"epoch": 0.975,
"frac_reward_zero_std": 0.0,
"grad_norm": 22.252880096435547,
"learning_rate": 1e-06,
"loss": 0.0321,
"num_tokens": 2605074.0,
"reward": 7.447225093841553,
"reward_std": 1.0464049577713013,
"rewards/traffic_reward_func/mean": 7.447225093841553,
"rewards/traffic_reward_func/std": 1.274503231048584,
"step": 78
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 88.0,
"completions/max_terminated_length": 88.0,
"completions/mean_length": 71.0,
"completions/mean_terminated_length": 71.0,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.38675158222516376,
"epoch": 0.9875,
"frac_reward_zero_std": 0.0,
"grad_norm": 44.07793426513672,
"learning_rate": 1e-06,
"loss": 0.0143,
"num_tokens": 2635262.0,
"reward": 6.008333206176758,
"reward_std": 1.6903867721557617,
"rewards/traffic_reward_func/mean": 6.008333206176758,
"rewards/traffic_reward_func/std": 3.7762653827667236,
"step": 79
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 84.0,
"completions/max_terminated_length": 84.0,
"completions/mean_length": 69.91667175292969,
"completions/mean_terminated_length": 69.91667175292969,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"entropy": 0.4307720164457957,
"epoch": 1.0,
"frac_reward_zero_std": 0.0,
"grad_norm": 45.57075881958008,
"learning_rate": 1e-06,
"loss": 0.0387,
"num_tokens": 2681497.0,
"reward": 3.2916667461395264,
"reward_std": 1.6892813444137573,
"rewards/traffic_reward_func/mean": 3.2916667461395264,
"rewards/traffic_reward_func/std": 3.932587146759033,
"step": 80
}
],
"logging_steps": 1.0,
"max_steps": 80,
"num_input_tokens_seen": 2681497,
"num_train_epochs": 1,
"save_steps": 40,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}