SFT-RLCR-math / trainer_state.json
jhuang265's picture
Model save
4b2f96b verified
Raw History Blame Contribute Delete
77.1 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.5,
"eval_steps": 50,
"global_step": 234,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.041015625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4000.4,
"completions/mean_length": 1164.1234375,
"completions/mean_terminated_length": 1038.845556640625,
"completions/min_length": 247.2,
"completions/min_terminated_length": 247.2,
"entropy": 0.29370769949164244,
"epoch": 0.010683760683760684,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.14847157895565033,
"learning_rate": 4.2553191489361704e-07,
"loss": -0.0248,
"num_tokens": 14698896.0,
"reward": 2.5872025966644285,
"reward_std": 1.4765283107757567,
"rewards/accuracy_reward/mean": 0.34619140625,
"rewards/accuracy_reward/std": 0.4755214035511017,
"rewards/brier_reward/mean": 0.49328577518463135,
"rewards/brier_reward/std": 0.44167842864990237,
"rewards/confidence_one_or_zero/mean": 0.431640625,
"rewards/confidence_one_or_zero/std": 0.49507494568824767,
"rewards/format_reward/mean": 0.7203125,
"rewards/format_reward/std": 0.44880709052085876,
"rewards/mean_confidence_reward/mean": 0.5957722783088684,
"rewards/mean_confidence_reward/std": 0.39281755685806274,
"step": 5,
"step_time": 367.5162501453742
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04013671875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4028.0,
"completions/mean_length": 1158.4236328125,
"completions/mean_terminated_length": 1035.5475341796875,
"completions/min_length": 236.0,
"completions/min_terminated_length": 236.0,
"entropy": 0.2964494117535651,
"epoch": 0.021367521367521368,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.14055821299552917,
"learning_rate": 9.574468085106384e-07,
"loss": -0.0212,
"num_tokens": 29323618.0,
"reward": 2.626321029663086,
"reward_std": 1.4372277736663819,
"rewards/accuracy_reward/mean": 0.3529296875,
"rewards/accuracy_reward/std": 0.4779347002506256,
"rewards/brier_reward/mean": 0.5081964015960694,
"rewards/brier_reward/std": 0.43526085615158083,
"rewards/confidence_one_or_zero/mean": 0.41826171875,
"rewards/confidence_one_or_zero/std": 0.49299114346504214,
"rewards/format_reward/mean": 0.746875,
"rewards/format_reward/std": 0.4341681182384491,
"rewards/mean_confidence_reward/mean": 0.6000582456588746,
"rewards/mean_confidence_reward/std": 0.38636099696159365,
"step": 10,
"step_time": 321.1076524061791
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04140625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3991.8,
"completions/mean_length": 1159.415625,
"completions/mean_terminated_length": 1033.0634399414062,
"completions/min_length": 130.2,
"completions/min_terminated_length": 130.2,
"entropy": 0.2963161684107035,
"epoch": 0.03205128205128205,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.38358214497566223,
"learning_rate": 1.4893617021276596e-06,
"loss": -0.0239,
"num_tokens": 43913314.0,
"reward": 2.622881555557251,
"reward_std": 1.4426464796066285,
"rewards/accuracy_reward/mean": 0.35615234375,
"rewards/accuracy_reward/std": 0.4773412704467773,
"rewards/brier_reward/mean": 0.5073358297348023,
"rewards/brier_reward/std": 0.43741809129714965,
"rewards/confidence_one_or_zero/mean": 0.42236328125,
"rewards/confidence_one_or_zero/std": 0.4939651072025299,
"rewards/format_reward/mean": 0.74052734375,
"rewards/format_reward/std": 0.43735886216163633,
"rewards/mean_confidence_reward/mean": 0.5965027928352356,
"rewards/mean_confidence_reward/std": 0.3892210364341736,
"step": 15,
"step_time": 320.404392082378
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04677734375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4007.2,
"completions/mean_length": 1199.3455078125,
"completions/mean_terminated_length": 1057.2992553710938,
"completions/min_length": 263.6,
"completions/min_terminated_length": 263.6,
"entropy": 0.2863605673890561,
"epoch": 0.042735042735042736,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.0963141918182373,
"learning_rate": 2.021276595744681e-06,
"loss": -0.0233,
"num_tokens": 58973652.0,
"reward": 2.4881054878234865,
"reward_std": 1.4243582010269165,
"rewards/accuracy_reward/mean": 0.303515625,
"rewards/accuracy_reward/std": 0.4579374611377716,
"rewards/brier_reward/mean": 0.48311116695404055,
"rewards/brier_reward/std": 0.4374946057796478,
"rewards/confidence_one_or_zero/mean": 0.41103515625,
"rewards/confidence_one_or_zero/std": 0.4917535543441772,
"rewards/format_reward/mean": 0.71962890625,
"rewards/format_reward/std": 0.4489608943462372,
"rewards/mean_confidence_reward/mean": 0.570814573764801,
"rewards/mean_confidence_reward/std": 0.39406808614730837,
"step": 20,
"step_time": 332.20311605894824
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03974609375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3903.0,
"completions/mean_length": 1148.490234375,
"completions/mean_terminated_length": 1026.6469360351562,
"completions/min_length": 243.6,
"completions/min_terminated_length": 243.6,
"entropy": 0.2810601927805692,
"epoch": 0.053418803418803416,
"frac_reward_zero_std": 0.0,
"grad_norm": 3.739562749862671,
"learning_rate": 2.553191489361702e-06,
"loss": -0.02,
"num_tokens": 73469776.0,
"reward": 2.631763458251953,
"reward_std": 1.4347328186035155,
"rewards/accuracy_reward/mean": 0.34892578125,
"rewards/accuracy_reward/std": 0.47504717111587524,
"rewards/brier_reward/mean": 0.5076832473278046,
"rewards/brier_reward/std": 0.4349519371986389,
"rewards/confidence_one_or_zero/mean": 0.420703125,
"rewards/confidence_one_or_zero/std": 0.49354149103164674,
"rewards/format_reward/mean": 0.748046875,
"rewards/format_reward/std": 0.4338900506496429,
"rewards/mean_confidence_reward/mean": 0.6064043879508972,
"rewards/mean_confidence_reward/std": 0.3849062204360962,
"step": 25,
"step_time": 320.1903787172225
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0404296875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4019.2,
"completions/mean_length": 1165.85546875,
"completions/mean_terminated_length": 1042.3886474609376,
"completions/min_length": 220.4,
"completions/min_terminated_length": 220.4,
"entropy": 0.2301187983015552,
"epoch": 0.0641025641025641,
"frac_reward_zero_std": 0.0,
"grad_norm": 199.96067810058594,
"learning_rate": 3.0851063829787237e-06,
"loss": -0.0199,
"num_tokens": 88222312.0,
"reward": 2.6316072940826416,
"reward_std": 1.4807042837142945,
"rewards/accuracy_reward/mean": 0.35673828125,
"rewards/accuracy_reward/std": 0.47840901613235476,
"rewards/brier_reward/mean": 0.506071788072586,
"rewards/brier_reward/std": 0.4398545265197754,
"rewards/confidence_one_or_zero/mean": 0.43662109375,
"rewards/confidence_one_or_zero/std": 0.49545411467552186,
"rewards/format_reward/mean": 0.73134765625,
"rewards/format_reward/std": 0.4433063805103302,
"rewards/mean_confidence_reward/mean": 0.6008285045623779,
"rewards/mean_confidence_reward/std": 0.3925713062286377,
"step": 30,
"step_time": 326.57087952201545
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0490234375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3916.0,
"completions/mean_length": 1185.3583984375,
"completions/mean_terminated_length": 1035.7810302734374,
"completions/min_length": 239.4,
"completions/min_terminated_length": 239.4,
"entropy": 0.2210580409388058,
"epoch": 0.07478632478632478,
"frac_reward_zero_std": 0.0,
"grad_norm": 133.9806365966797,
"learning_rate": 3.6170212765957453e-06,
"loss": -0.0226,
"num_tokens": 103107902.0,
"reward": 2.585563850402832,
"reward_std": 1.454831600189209,
"rewards/accuracy_reward/mean": 0.33759765625,
"rewards/accuracy_reward/std": 0.47166956663131715,
"rewards/brier_reward/mean": 0.5002726972103119,
"rewards/brier_reward/std": 0.4371703028678894,
"rewards/confidence_one_or_zero/mean": 0.41552734375,
"rewards/confidence_one_or_zero/std": 0.4925929605960846,
"rewards/format_reward/mean": 0.73896484375,
"rewards/format_reward/std": 0.4386298477649689,
"rewards/mean_confidence_reward/mean": 0.5932011604309082,
"rewards/mean_confidence_reward/std": 0.38995088934898375,
"step": 35,
"step_time": 325.6446264376165
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0408203125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4019.4,
"completions/mean_length": 1149.20869140625,
"completions/mean_terminated_length": 1023.7782958984375,
"completions/min_length": 284.2,
"completions/min_terminated_length": 284.2,
"entropy": 0.3068808923708275,
"epoch": 0.08547008547008547,
"frac_reward_zero_std": 0.0,
"grad_norm": 113.78675079345703,
"learning_rate": 4.148936170212766e-06,
"loss": -0.017,
"num_tokens": 117596471.0,
"reward": 2.62867956161499,
"reward_std": 1.4407520055770875,
"rewards/accuracy_reward/mean": 0.34384765625,
"rewards/accuracy_reward/std": 0.4746952474117279,
"rewards/brier_reward/mean": 0.5058294236660004,
"rewards/brier_reward/std": 0.43723568320274353,
"rewards/confidence_one_or_zero/mean": 0.43291015625,
"rewards/confidence_one_or_zero/std": 0.4955411970615387,
"rewards/format_reward/mean": 0.74208984375,
"rewards/format_reward/std": 0.43702192902565,
"rewards/mean_confidence_reward/mean": 0.6040024995803833,
"rewards/mean_confidence_reward/std": 0.3885011911392212,
"step": 40,
"step_time": 325.2610327706119
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04638671875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3996.8,
"completions/mean_length": 1179.61962890625,
"completions/mean_terminated_length": 1037.8166137695312,
"completions/min_length": 251.2,
"completions/min_terminated_length": 251.2,
"entropy": 0.3366824609809555,
"epoch": 0.09615384615384616,
"frac_reward_zero_std": 0.0,
"grad_norm": 124.41181182861328,
"learning_rate": 4.680851063829788e-06,
"loss": -0.0239,
"num_tokens": 132464704.0,
"reward": 2.6292791843414305,
"reward_std": 1.4946486711502076,
"rewards/accuracy_reward/mean": 0.35771484375,
"rewards/accuracy_reward/std": 0.4783689081668854,
"rewards/brier_reward/mean": 0.5130708456039429,
"rewards/brier_reward/std": 0.44048008918762205,
"rewards/confidence_one_or_zero/mean": 0.42802734375,
"rewards/confidence_one_or_zero/std": 0.4943909227848053,
"rewards/format_reward/mean": 0.73212890625,
"rewards/format_reward/std": 0.44279989004135134,
"rewards/mean_confidence_reward/mean": 0.5983372449874877,
"rewards/mean_confidence_reward/std": 0.39211158752441405,
"step": 45,
"step_time": 329.7312524779816
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0419921875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3980.4,
"completions/mean_length": 1176.43818359375,
"completions/mean_terminated_length": 1048.7527954101563,
"completions/min_length": 247.4,
"completions/min_terminated_length": 247.4,
"entropy": 0.418773017404601,
"epoch": 0.10683760683760683,
"frac_reward_zero_std": 0.0,
"grad_norm": 62.133018493652344,
"learning_rate": 4.9465240641711236e-06,
"loss": -0.0165,
"num_tokens": 147298055.0,
"reward": 2.5864771366119386,
"reward_std": 1.4536908149719239,
"rewards/accuracy_reward/mean": 0.3388671875,
"rewards/accuracy_reward/std": 0.4714273869991302,
"rewards/brier_reward/mean": 0.4910121440887451,
"rewards/brier_reward/std": 0.44000319242477415,
"rewards/confidence_one_or_zero/mean": 0.43486328125,
"rewards/confidence_one_or_zero/std": 0.4950097680091858,
"rewards/format_reward/mean": 0.728515625,
"rewards/format_reward/std": 0.4440678656101227,
"rewards/mean_confidence_reward/mean": 0.5932189226150513,
"rewards/mean_confidence_reward/std": 0.39245480895042417,
"step": 50,
"step_time": 322.2430747395556
},
{
"epoch": 0.10683760683760683,
"eval_clip_ratio/high_max": 0.0,
"eval_clip_ratio/high_mean": 0.0,
"eval_clip_ratio/low_mean": 0.0,
"eval_clip_ratio/low_min": 0.0,
"eval_clip_ratio/region_mean": 0.0,
"eval_completions/clipped_ratio": 0.0478515625,
"eval_completions/max_length": 3660.875,
"eval_completions/max_terminated_length": 2446.375,
"eval_completions/mean_length": 1183.4482421875,
"eval_completions/mean_terminated_length": 1035.961950302124,
"eval_completions/min_length": 449.375,
"eval_completions/min_terminated_length": 449.375,
"eval_entropy": 0.4594858642667532,
"eval_frac_reward_zero_std": 1.0,
"eval_loss": 0.0,
"eval_num_tokens": 147298055.0,
"eval_reward": 2.5969152376055717,
"eval_reward_std": 1.4885545708239079,
"eval_rewards/accuracy_reward/mean": 0.34765625,
"eval_rewards/accuracy_reward/std": 0.4782447386533022,
"eval_rewards/brier_reward/mean": 0.5097439922392368,
"eval_rewards/brier_reward/std": 0.438809622079134,
"eval_rewards/confidence_one_or_zero/mean": 0.4150390625,
"eval_rewards/confidence_one_or_zero/std": 0.49284233059734106,
"eval_rewards/format_reward/mean": 0.7451171875,
"eval_rewards/format_reward/std": 0.43596830405294895,
"eval_rewards/mean_confidence_reward/mean": 0.5793587230145931,
"eval_rewards/mean_confidence_reward/std": 0.39388769399374723,
"eval_runtime": 1149.3092,
"eval_samples_per_second": 0.87,
"eval_steps_per_second": 0.028,
"step": 50
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04443359375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3851.6,
"completions/mean_length": 1186.297265625,
"completions/mean_terminated_length": 1051.1856811523437,
"completions/min_length": 253.8,
"completions/min_terminated_length": 253.8,
"entropy": 0.4116662655491382,
"epoch": 0.11752136752136752,
"frac_reward_zero_std": 0.0,
"grad_norm": 69.27256774902344,
"learning_rate": 4.812834224598931e-06,
"loss": -0.0233,
"num_tokens": 162181707.0,
"reward": 2.5811704635620116,
"reward_std": 1.4448149919509887,
"rewards/accuracy_reward/mean": 0.33203125,
"rewards/accuracy_reward/std": 0.4704195737838745,
"rewards/brier_reward/mean": 0.4908031582832336,
"rewards/brier_reward/std": 0.43675305843353274,
"rewards/confidence_one_or_zero/mean": 0.42431640625,
"rewards/confidence_one_or_zero/std": 0.4941523432731628,
"rewards/format_reward/mean": 0.735546875,
"rewards/format_reward/std": 0.44057986736297605,
"rewards/mean_confidence_reward/mean": 0.5984728097915649,
"rewards/mean_confidence_reward/std": 0.3909616231918335,
"step": 55,
"step_time": 330.042653635249
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04189453125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3965.2,
"completions/mean_length": 1177.36982421875,
"completions/mean_terminated_length": 1050.1990234375,
"completions/min_length": 251.2,
"completions/min_terminated_length": 251.2,
"entropy": 0.4373515026643872,
"epoch": 0.1282051282051282,
"frac_reward_zero_std": 0.0,
"grad_norm": 101.64539337158203,
"learning_rate": 4.6791443850267385e-06,
"loss": -0.0211,
"num_tokens": 176994198.0,
"reward": 2.591030979156494,
"reward_std": 1.45223228931427,
"rewards/accuracy_reward/mean": 0.337109375,
"rewards/accuracy_reward/std": 0.4722390055656433,
"rewards/brier_reward/mean": 0.5020074665546417,
"rewards/brier_reward/std": 0.43737395405769347,
"rewards/confidence_one_or_zero/mean": 0.41845703125,
"rewards/confidence_one_or_zero/std": 0.49311497807502747,
"rewards/format_reward/mean": 0.734765625,
"rewards/format_reward/std": 0.44106330871582033,
"rewards/mean_confidence_reward/mean": 0.5986914038658142,
"rewards/mean_confidence_reward/std": 0.38671804666519166,
"step": 60,
"step_time": 347.4772788655682
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.05126953125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4001.0,
"completions/mean_length": 1238.319921875,
"completions/mean_terminated_length": 1084.0480224609375,
"completions/min_length": 282.6,
"completions/min_terminated_length": 282.6,
"entropy": 0.4563113780459389,
"epoch": 0.1388888888888889,
"frac_reward_zero_std": 0.0,
"grad_norm": 53.89928436279297,
"learning_rate": 4.5454545454545455e-06,
"loss": -0.028,
"num_tokens": 192411170.0,
"reward": 2.531825304031372,
"reward_std": 1.4431338548660277,
"rewards/accuracy_reward/mean": 0.3255859375,
"rewards/accuracy_reward/std": 0.4675427436828613,
"rewards/brier_reward/mean": 0.49114506840705874,
"rewards/brier_reward/std": 0.43718346357345583,
"rewards/confidence_one_or_zero/mean": 0.412890625,
"rewards/confidence_one_or_zero/std": 0.4916431367397308,
"rewards/format_reward/mean": 0.7236328125,
"rewards/format_reward/std": 0.4470420956611633,
"rewards/mean_confidence_reward/mean": 0.5785707950592041,
"rewards/mean_confidence_reward/std": 0.39329431056976316,
"step": 65,
"step_time": 391.79989567998564
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.046484375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3956.0,
"completions/mean_length": 1216.59765625,
"completions/mean_terminated_length": 1076.82607421875,
"completions/min_length": 245.6,
"completions/min_terminated_length": 245.6,
"entropy": 0.4711520684882998,
"epoch": 0.14957264957264957,
"frac_reward_zero_std": 0.0,
"grad_norm": 57.16364669799805,
"learning_rate": 4.411764705882353e-06,
"loss": -0.0207,
"num_tokens": 207638154.0,
"reward": 2.516926908493042,
"reward_std": 1.428751039505005,
"rewards/accuracy_reward/mean": 0.314453125,
"rewards/accuracy_reward/std": 0.4608186721801758,
"rewards/brier_reward/mean": 0.49181228280067446,
"rewards/brier_reward/std": 0.4358379542827606,
"rewards/confidence_one_or_zero/mean": 0.41123046875,
"rewards/confidence_one_or_zero/std": 0.491403067111969,
"rewards/format_reward/mean": 0.725390625,
"rewards/format_reward/std": 0.44508775472640993,
"rewards/mean_confidence_reward/mean": 0.574040412902832,
"rewards/mean_confidence_reward/std": 0.3923916518688202,
"step": 70,
"step_time": 330.1905146706442
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04140625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3948.4,
"completions/mean_length": 1172.76875,
"completions/mean_terminated_length": 1046.49931640625,
"completions/min_length": 231.4,
"completions/min_terminated_length": 231.4,
"entropy": 0.4409632431343198,
"epoch": 0.16025641025641027,
"frac_reward_zero_std": 0.0,
"grad_norm": 50.008419036865234,
"learning_rate": 4.2780748663101604e-06,
"loss": -0.0224,
"num_tokens": 222380138.0,
"reward": 2.5926557064056395,
"reward_std": 1.463102674484253,
"rewards/accuracy_reward/mean": 0.33291015625,
"rewards/accuracy_reward/std": 0.4709408342838287,
"rewards/brier_reward/mean": 0.5047689855098725,
"rewards/brier_reward/std": 0.4396240770816803,
"rewards/confidence_one_or_zero/mean": 0.4283203125,
"rewards/confidence_one_or_zero/std": 0.49480087161064146,
"rewards/format_reward/mean": 0.7337890625,
"rewards/format_reward/std": 0.4413725435733795,
"rewards/mean_confidence_reward/mean": 0.5928672432899476,
"rewards/mean_confidence_reward/std": 0.3934659421443939,
"step": 75,
"step_time": 326.668984343193
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04423828125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3992.6,
"completions/mean_length": 1149.94189453125,
"completions/mean_terminated_length": 1013.5361328125,
"completions/min_length": 282.6,
"completions/min_terminated_length": 282.6,
"entropy": 0.4194035842316225,
"epoch": 0.17094017094017094,
"frac_reward_zero_std": 0.0,
"grad_norm": 64.48490142822266,
"learning_rate": 4.144385026737968e-06,
"loss": -0.0261,
"num_tokens": 236899959.0,
"reward": 2.5700586795806886,
"reward_std": 1.4412338256835937,
"rewards/accuracy_reward/mean": 0.32666015625,
"rewards/accuracy_reward/std": 0.46828957796096804,
"rewards/brier_reward/mean": 0.4898384869098663,
"rewards/brier_reward/std": 0.4382441997528076,
"rewards/confidence_one_or_zero/mean": 0.42744140625,
"rewards/confidence_one_or_zero/std": 0.49459370970726013,
"rewards/format_reward/mean": 0.7330078125,
"rewards/format_reward/std": 0.4424092710018158,
"rewards/mean_confidence_reward/mean": 0.5931108236312866,
"rewards/mean_confidence_reward/std": 0.39181647896766664,
"step": 80,
"step_time": 323.0481036014127
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04208984375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3887.0,
"completions/mean_length": 1177.4208984375,
"completions/mean_terminated_length": 1049.3630737304688,
"completions/min_length": 202.6,
"completions/min_terminated_length": 202.6,
"entropy": 0.39985626018606124,
"epoch": 0.18162393162393162,
"frac_reward_zero_std": 0.0,
"grad_norm": 45.62771987915039,
"learning_rate": 4.010695187165775e-06,
"loss": -0.0225,
"num_tokens": 251679821.0,
"reward": 2.59846568107605,
"reward_std": 1.4533775568008422,
"rewards/accuracy_reward/mean": 0.34990234375,
"rewards/accuracy_reward/std": 0.4756861090660095,
"rewards/brier_reward/mean": 0.5023018896579743,
"rewards/brier_reward/std": 0.4387582540512085,
"rewards/confidence_one_or_zero/mean": 0.427734375,
"rewards/confidence_one_or_zero/std": 0.494358617067337,
"rewards/format_reward/mean": 0.73212890625,
"rewards/format_reward/std": 0.44288029670715334,
"rewards/mean_confidence_reward/mean": 0.5863980650901794,
"rewards/mean_confidence_reward/std": 0.3929993689060211,
"step": 85,
"step_time": 326.0249995706487
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0462890625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3998.4,
"completions/mean_length": 1179.9412109375,
"completions/mean_terminated_length": 1038.520068359375,
"completions/min_length": 259.2,
"completions/min_terminated_length": 259.2,
"entropy": 0.386576225515455,
"epoch": 0.19230769230769232,
"frac_reward_zero_std": 0.0,
"grad_norm": 193.96762084960938,
"learning_rate": 3.877005347593583e-06,
"loss": -0.0228,
"num_tokens": 266478067.0,
"reward": 2.579456090927124,
"reward_std": 1.4271894216537475,
"rewards/accuracy_reward/mean": 0.32578125,
"rewards/accuracy_reward/std": 0.46765764355659484,
"rewards/brier_reward/mean": 0.4961786985397339,
"rewards/brier_reward/std": 0.4369286894798279,
"rewards/confidence_one_or_zero/mean": 0.4203125,
"rewards/confidence_one_or_zero/std": 0.4934973418712616,
"rewards/format_reward/mean": 0.74404296875,
"rewards/format_reward/std": 0.43625056743621826,
"rewards/mean_confidence_reward/mean": 0.5931406259536743,
"rewards/mean_confidence_reward/std": 0.39092748165130614,
"step": 90,
"step_time": 322.8700365928322
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04658203125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3999.6,
"completions/mean_length": 1198.956640625,
"completions/mean_terminated_length": 1057.507568359375,
"completions/min_length": 263.8,
"completions/min_terminated_length": 263.8,
"entropy": 0.40121041517704725,
"epoch": 0.202991452991453,
"frac_reward_zero_std": 0.0,
"grad_norm": 41.008140563964844,
"learning_rate": 3.7433155080213907e-06,
"loss": -0.0227,
"num_tokens": 281502167.0,
"reward": 2.608871269226074,
"reward_std": 1.4490824222564698,
"rewards/accuracy_reward/mean": 0.344921875,
"rewards/accuracy_reward/std": 0.47531471252441404,
"rewards/brier_reward/mean": 0.5078621506690979,
"rewards/brier_reward/std": 0.43720985054969785,
"rewards/confidence_one_or_zero/mean": 0.421875,
"rewards/confidence_one_or_zero/std": 0.4936180472373962,
"rewards/format_reward/mean": 0.742578125,
"rewards/format_reward/std": 0.4370300233364105,
"rewards/mean_confidence_reward/mean": 0.5916341543197632,
"rewards/mean_confidence_reward/std": 0.39123871326446535,
"step": 95,
"step_time": 323.7242567136098
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0431640625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3955.4,
"completions/mean_length": 1154.41572265625,
"completions/mean_terminated_length": 1021.7558959960937,
"completions/min_length": 272.8,
"completions/min_terminated_length": 272.8,
"entropy": 0.4168419130612165,
"epoch": 0.21367521367521367,
"frac_reward_zero_std": 0.0,
"grad_norm": 57.19181442260742,
"learning_rate": 3.609625668449198e-06,
"loss": -0.0236,
"num_tokens": 296056888.0,
"reward": 2.6315658569335936,
"reward_std": 1.4593602418899536,
"rewards/accuracy_reward/mean": 0.35224609375,
"rewards/accuracy_reward/std": 0.47758880257606506,
"rewards/brier_reward/mean": 0.5140846490859985,
"rewards/brier_reward/std": 0.4383812129497528,
"rewards/confidence_one_or_zero/mean": 0.42919921875,
"rewards/confidence_one_or_zero/std": 0.494834303855896,
"rewards/format_reward/mean": 0.741796875,
"rewards/format_reward/std": 0.43728084564208985,
"rewards/mean_confidence_reward/mean": 0.5942391753196716,
"rewards/mean_confidence_reward/std": 0.39173622727394103,
"step": 100,
"step_time": 341.3402804447949
},
{
"epoch": 0.21367521367521367,
"eval_clip_ratio/high_max": 0.0,
"eval_clip_ratio/high_mean": 0.0,
"eval_clip_ratio/low_mean": 0.0,
"eval_clip_ratio/low_min": 0.0,
"eval_clip_ratio/region_mean": 0.0,
"eval_completions/clipped_ratio": 0.044921875,
"eval_completions/max_length": 3675.625,
"eval_completions/max_terminated_length": 2566.5625,
"eval_completions/mean_length": 1191.265625,
"eval_completions/mean_terminated_length": 1054.0882835388184,
"eval_completions/min_length": 447.875,
"eval_completions/min_terminated_length": 447.875,
"eval_entropy": 0.3911281004548073,
"eval_frac_reward_zero_std": 1.0,
"eval_loss": 0.0,
"eval_num_tokens": 296056888.0,
"eval_reward": 2.5998095087707043,
"eval_reward_std": 1.4141752794384956,
"eval_rewards/accuracy_reward/mean": 0.3369140625,
"eval_rewards/accuracy_reward/std": 0.4713865462690592,
"eval_rewards/brier_reward/mean": 0.4994282014667988,
"eval_rewards/brier_reward/std": 0.44008473958820105,
"eval_rewards/confidence_one_or_zero/mean": 0.419921875,
"eval_rewards/confidence_one_or_zero/std": 0.49413473159074783,
"eval_rewards/format_reward/mean": 0.7421875,
"eval_rewards/format_reward/std": 0.4395229946821928,
"eval_rewards/mean_confidence_reward/mean": 0.6013578549027443,
"eval_rewards/mean_confidence_reward/std": 0.38793430011719465,
"eval_runtime": 1211.1914,
"eval_samples_per_second": 0.826,
"eval_steps_per_second": 0.026,
"step": 100
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03994140625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4009.4,
"completions/mean_length": 1162.73779296875,
"completions/mean_terminated_length": 1040.7655639648438,
"completions/min_length": 195.2,
"completions/min_terminated_length": 195.2,
"entropy": 0.4001290183980018,
"epoch": 0.22435897435897437,
"frac_reward_zero_std": 0.0,
"grad_norm": 41.48870849609375,
"learning_rate": 3.4759358288770056e-06,
"loss": -0.0209,
"num_tokens": 310698331.0,
"reward": 2.588319683074951,
"reward_std": 1.4540923595428468,
"rewards/accuracy_reward/mean": 0.33447265625,
"rewards/accuracy_reward/std": 0.47117613554000853,
"rewards/brier_reward/mean": 0.4937448620796204,
"rewards/brier_reward/std": 0.43921745419502256,
"rewards/confidence_one_or_zero/mean": 0.429296875,
"rewards/confidence_one_or_zero/std": 0.49498026371002196,
"rewards/format_reward/mean": 0.73095703125,
"rewards/format_reward/std": 0.4429859757423401,
"rewards/mean_confidence_reward/mean": 0.5998483061790466,
"rewards/mean_confidence_reward/std": 0.3917877316474915,
"step": 105,
"step_time": 338.7956139975722
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.035546875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3968.0,
"completions/mean_length": 1152.4916015625,
"completions/mean_terminated_length": 1043.9873779296875,
"completions/min_length": 216.2,
"completions/min_terminated_length": 216.2,
"entropy": 0.4095216895919293,
"epoch": 0.23504273504273504,
"frac_reward_zero_std": 0.0,
"grad_norm": 78.59355163574219,
"learning_rate": 3.342245989304813e-06,
"loss": -0.0159,
"num_tokens": 325250693.0,
"reward": 2.6221971035003664,
"reward_std": 1.4129359245300293,
"rewards/accuracy_reward/mean": 0.34150390625,
"rewards/accuracy_reward/std": 0.4733522355556488,
"rewards/brier_reward/mean": 0.4949895441532135,
"rewards/brier_reward/std": 0.43677046298980715,
"rewards/confidence_one_or_zero/mean": 0.42919921875,
"rewards/confidence_one_or_zero/std": 0.49494434595108033,
"rewards/format_reward/mean": 0.748828125,
"rewards/format_reward/std": 0.43359296917915346,
"rewards/mean_confidence_reward/mean": 0.607676339149475,
"rewards/mean_confidence_reward/std": 0.3874302625656128,
"step": 110,
"step_time": 319.2142815226136
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04208984375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3922.4,
"completions/mean_length": 1179.708203125,
"completions/mean_terminated_length": 1051.603564453125,
"completions/min_length": 263.0,
"completions/min_terminated_length": 263.0,
"entropy": 0.3744899015408009,
"epoch": 0.24572649572649571,
"frac_reward_zero_std": 0.0,
"grad_norm": 44.732879638671875,
"learning_rate": 3.2085561497326205e-06,
"loss": -0.0202,
"num_tokens": 340073081.0,
"reward": 2.59310622215271,
"reward_std": 1.4364994049072266,
"rewards/accuracy_reward/mean": 0.35048828125,
"rewards/accuracy_reward/std": 0.4767671048641205,
"rewards/brier_reward/mean": 0.5079159557819366,
"rewards/brier_reward/std": 0.4364722192287445,
"rewards/confidence_one_or_zero/mean": 0.41123046875,
"rewards/confidence_one_or_zero/std": 0.4919556140899658,
"rewards/format_reward/mean": 0.7400390625,
"rewards/format_reward/std": 0.4384325683116913,
"rewards/mean_confidence_reward/mean": 0.583432388305664,
"rewards/mean_confidence_reward/std": 0.3897099018096924,
"step": 115,
"step_time": 326.647366704233
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04453125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3945.0,
"completions/mean_length": 1200.745703125,
"completions/mean_terminated_length": 1066.298779296875,
"completions/min_length": 227.4,
"completions/min_terminated_length": 227.4,
"entropy": 0.34471772906836123,
"epoch": 0.2564102564102564,
"frac_reward_zero_std": 0.0,
"grad_norm": 61.09455871582031,
"learning_rate": 3.074866310160428e-06,
"loss": -0.0255,
"num_tokens": 355119949.0,
"reward": 2.5888769149780275,
"reward_std": 1.432522964477539,
"rewards/accuracy_reward/mean": 0.33251953125,
"rewards/accuracy_reward/std": 0.4707206726074219,
"rewards/brier_reward/mean": 0.49854403734207153,
"rewards/brier_reward/std": 0.43708345890045164,
"rewards/confidence_one_or_zero/mean": 0.421875,
"rewards/confidence_one_or_zero/std": 0.49373169541358947,
"rewards/format_reward/mean": 0.7423828125,
"rewards/format_reward/std": 0.43607338666915896,
"rewards/mean_confidence_reward/mean": 0.5935555100440979,
"rewards/mean_confidence_reward/std": 0.39031049609184265,
"step": 120,
"step_time": 324.7173171197093
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04765625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3938.0,
"completions/mean_length": 1179.1443359375,
"completions/mean_terminated_length": 1033.1288330078125,
"completions/min_length": 279.4,
"completions/min_terminated_length": 279.4,
"entropy": 0.32342109945602715,
"epoch": 0.2670940170940171,
"frac_reward_zero_std": 0.0,
"grad_norm": 57.27123260498047,
"learning_rate": 2.9411764705882355e-06,
"loss": -0.0236,
"num_tokens": 369945203.0,
"reward": 2.578601837158203,
"reward_std": 1.4519781589508056,
"rewards/accuracy_reward/mean": 0.347265625,
"rewards/accuracy_reward/std": 0.4754137098789215,
"rewards/brier_reward/mean": 0.5017790496349335,
"rewards/brier_reward/std": 0.43707227110862734,
"rewards/confidence_one_or_zero/mean": 0.41171875,
"rewards/confidence_one_or_zero/std": 0.4922350883483887,
"rewards/format_reward/mean": 0.73779296875,
"rewards/format_reward/std": 0.4398411691188812,
"rewards/mean_confidence_reward/mean": 0.5800454020500183,
"rewards/mean_confidence_reward/std": 0.39250563979148867,
"step": 125,
"step_time": 346.2828420913778
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0419921875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4003.6,
"completions/mean_length": 1171.39365234375,
"completions/mean_terminated_length": 1043.3955444335938,
"completions/min_length": 271.0,
"completions/min_terminated_length": 271.0,
"entropy": 0.35659047805238514,
"epoch": 0.2777777777777778,
"frac_reward_zero_std": 0.0,
"grad_norm": 113.86180877685547,
"learning_rate": 2.807486631016043e-06,
"loss": -0.0234,
"num_tokens": 384686290.0,
"reward": 2.6278841972351072,
"reward_std": 1.4369913339614868,
"rewards/accuracy_reward/mean": 0.34736328125,
"rewards/accuracy_reward/std": 0.475992888212204,
"rewards/brier_reward/mean": 0.5168704152107239,
"rewards/brier_reward/std": 0.4365030348300934,
"rewards/confidence_one_or_zero/mean": 0.42607421875,
"rewards/confidence_one_or_zero/std": 0.4945238888263702,
"rewards/format_reward/mean": 0.74873046875,
"rewards/format_reward/std": 0.4332437634468079,
"rewards/mean_confidence_reward/mean": 0.5888458251953125,
"rewards/mean_confidence_reward/std": 0.39102033972740174,
"step": 130,
"step_time": 321.3360222982825
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03935546875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3972.4,
"completions/mean_length": 1128.96396484375,
"completions/mean_terminated_length": 1007.7831909179688,
"completions/min_length": 282.4,
"completions/min_terminated_length": 282.4,
"entropy": 0.35520400705281646,
"epoch": 0.28846153846153844,
"frac_reward_zero_std": 0.0,
"grad_norm": 51.285396575927734,
"learning_rate": 2.673796791443851e-06,
"loss": -0.0227,
"num_tokens": 398983489.0,
"reward": 2.612396001815796,
"reward_std": 1.4276126384735108,
"rewards/accuracy_reward/mean": 0.3345703125,
"rewards/accuracy_reward/std": 0.47118029594421384,
"rewards/brier_reward/mean": 0.49303132891654966,
"rewards/brier_reward/std": 0.4375665545463562,
"rewards/confidence_one_or_zero/mean": 0.4322265625,
"rewards/confidence_one_or_zero/std": 0.49502651691436766,
"rewards/format_reward/mean": 0.74296875,
"rewards/format_reward/std": 0.43659918904304507,
"rewards/mean_confidence_reward/mean": 0.6095991253852844,
"rewards/mean_confidence_reward/std": 0.38876975774765016,
"step": 135,
"step_time": 317.259214475425
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03896484375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4068.4,
"completions/mean_length": 1158.2162109375,
"completions/mean_terminated_length": 1039.444482421875,
"completions/min_length": 250.0,
"completions/min_terminated_length": 250.0,
"entropy": 0.3379080446669832,
"epoch": 0.29914529914529914,
"frac_reward_zero_std": 0.0,
"grad_norm": 47.08708953857422,
"learning_rate": 2.5401069518716583e-06,
"loss": -0.0164,
"num_tokens": 413628743.0,
"reward": 2.624250793457031,
"reward_std": 1.4579155921936036,
"rewards/accuracy_reward/mean": 0.35654296875,
"rewards/accuracy_reward/std": 0.4779155910015106,
"rewards/brier_reward/mean": 0.5080420076847076,
"rewards/brier_reward/std": 0.4370752513408661,
"rewards/confidence_one_or_zero/mean": 0.41474609375,
"rewards/confidence_one_or_zero/std": 0.49261121153831483,
"rewards/format_reward/mean": 0.73642578125,
"rewards/format_reward/std": 0.44039976596832275,
"rewards/mean_confidence_reward/mean": 0.6084939122200013,
"rewards/mean_confidence_reward/std": 0.3848548471927643,
"step": 140,
"step_time": 322.5389275003457
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04482421875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4020.0,
"completions/mean_length": 1198.82666015625,
"completions/mean_terminated_length": 1063.138720703125,
"completions/min_length": 259.2,
"completions/min_terminated_length": 259.2,
"entropy": 0.3416525034001097,
"epoch": 0.30982905982905984,
"frac_reward_zero_std": 0.0,
"grad_norm": 49.23389434814453,
"learning_rate": 2.4064171122994653e-06,
"loss": -0.0207,
"num_tokens": 428679224.0,
"reward": 2.584191846847534,
"reward_std": 1.4531973361968995,
"rewards/accuracy_reward/mean": 0.33994140625,
"rewards/accuracy_reward/std": 0.472433865070343,
"rewards/brier_reward/mean": 0.4880970597267151,
"rewards/brier_reward/std": 0.438845157623291,
"rewards/confidence_one_or_zero/mean": 0.4294921875,
"rewards/confidence_one_or_zero/std": 0.49454295039176943,
"rewards/format_reward/mean": 0.73310546875,
"rewards/format_reward/std": 0.4407926738262177,
"rewards/mean_confidence_reward/mean": 0.5935557723045349,
"rewards/mean_confidence_reward/std": 0.3939161837100983,
"step": 145,
"step_time": 324.0329591148824
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04072265625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3972.4,
"completions/mean_length": 1154.97421875,
"completions/mean_terminated_length": 1030.1244262695313,
"completions/min_length": 221.4,
"completions/min_terminated_length": 221.4,
"entropy": 0.3519633636577055,
"epoch": 0.32051282051282054,
"frac_reward_zero_std": 0.0,
"grad_norm": 54.82425308227539,
"learning_rate": 2.2727272727272728e-06,
"loss": -0.019,
"num_tokens": 443254160.0,
"reward": 2.583753252029419,
"reward_std": 1.4211549758911133,
"rewards/accuracy_reward/mean": 0.32998046875,
"rewards/accuracy_reward/std": 0.46994357705116274,
"rewards/brier_reward/mean": 0.503885543346405,
"rewards/brier_reward/std": 0.433600527048111,
"rewards/confidence_one_or_zero/mean": 0.41416015625,
"rewards/confidence_one_or_zero/std": 0.4925421476364136,
"rewards/format_reward/mean": 0.74814453125,
"rewards/format_reward/std": 0.4341081440448761,
"rewards/mean_confidence_reward/mean": 0.5875824809074401,
"rewards/mean_confidence_reward/std": 0.388624894618988,
"step": 150,
"step_time": 322.4442724415218
},
{
"epoch": 0.32051282051282054,
"eval_clip_ratio/high_max": 0.0,
"eval_clip_ratio/high_mean": 0.0,
"eval_clip_ratio/low_mean": 0.0,
"eval_clip_ratio/low_min": 0.0,
"eval_clip_ratio/region_mean": 0.0,
"eval_completions/clipped_ratio": 0.0390625,
"eval_completions/max_length": 3729.6875,
"eval_completions/max_terminated_length": 2385.375,
"eval_completions/mean_length": 1152.037109375,
"eval_completions/mean_terminated_length": 1031.337080001831,
"eval_completions/min_length": 444.15625,
"eval_completions/min_terminated_length": 444.15625,
"eval_entropy": 0.32576982071623206,
"eval_frac_reward_zero_std": 1.0,
"eval_loss": 0.0,
"eval_num_tokens": 443254160.0,
"eval_reward": 2.609559252858162,
"eval_reward_std": 1.437463615089655,
"eval_rewards/accuracy_reward/mean": 0.3466796875,
"eval_rewards/accuracy_reward/std": 0.4741403367370367,
"eval_rewards/brier_reward/mean": 0.49707255978137255,
"eval_rewards/brier_reward/std": 0.4325491338968277,
"eval_rewards/confidence_one_or_zero/mean": 0.4345703125,
"eval_rewards/confidence_one_or_zero/std": 0.4974057199433446,
"eval_rewards/format_reward/mean": 0.740234375,
"eval_rewards/format_reward/std": 0.43520408356562257,
"eval_rewards/mean_confidence_reward/mean": 0.591002281755209,
"eval_rewards/mean_confidence_reward/std": 0.3949732268229127,
"eval_runtime": 1184.2626,
"eval_samples_per_second": 0.844,
"eval_steps_per_second": 0.027,
"step": 150
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0337890625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3998.0,
"completions/mean_length": 1110.99599609375,
"completions/mean_terminated_length": 1006.7109252929688,
"completions/min_length": 238.0,
"completions/min_terminated_length": 238.0,
"entropy": 0.340514807915315,
"epoch": 0.3311965811965812,
"frac_reward_zero_std": 0.0,
"grad_norm": 42.09675979614258,
"learning_rate": 2.1390374331550802e-06,
"loss": -0.0158,
"num_tokens": 457382311.0,
"reward": 2.6362682342529298,
"reward_std": 1.4206720113754272,
"rewards/accuracy_reward/mean": 0.33486328125,
"rewards/accuracy_reward/std": 0.47186189889907837,
"rewards/brier_reward/mean": 0.5024402737617493,
"rewards/brier_reward/std": 0.43651157021522524,
"rewards/confidence_one_or_zero/mean": 0.43583984375,
"rewards/confidence_one_or_zero/std": 0.49555398225784303,
"rewards/format_reward/mean": 0.7517578125,
"rewards/format_reward/std": 0.43134459257125857,
"rewards/mean_confidence_reward/mean": 0.6113669753074646,
"rewards/mean_confidence_reward/std": 0.38755360841751096,
"step": 155,
"step_time": 317.9468389595451
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03837890625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3940.8,
"completions/mean_length": 1123.14443359375,
"completions/mean_terminated_length": 1004.75517578125,
"completions/min_length": 282.8,
"completions/min_terminated_length": 282.8,
"entropy": 0.3312236491590738,
"epoch": 0.3418803418803419,
"frac_reward_zero_std": 0.0,
"grad_norm": 51.59230041503906,
"learning_rate": 2.0053475935828877e-06,
"loss": -0.018,
"num_tokens": 471616750.0,
"reward": 2.6946078300476075,
"reward_std": 1.4457947969436646,
"rewards/accuracy_reward/mean": 0.36123046875,
"rewards/accuracy_reward/std": 0.4788636863231659,
"rewards/brier_reward/mean": 0.5252399325370789,
"rewards/brier_reward/std": 0.4370757818222046,
"rewards/confidence_one_or_zero/mean": 0.43427734375,
"rewards/confidence_one_or_zero/std": 0.4952123582363129,
"rewards/format_reward/mean": 0.76083984375,
"rewards/format_reward/std": 0.42635048627853395,
"rewards/mean_confidence_reward/mean": 0.6130202889442444,
"rewards/mean_confidence_reward/std": 0.3868469834327698,
"step": 160,
"step_time": 320.616255954816
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03603515625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3912.8,
"completions/mean_length": 1148.70595703125,
"completions/mean_terminated_length": 1038.7396850585938,
"completions/min_length": 254.6,
"completions/min_terminated_length": 254.6,
"entropy": 0.3219002692261711,
"epoch": 0.3525641025641026,
"frac_reward_zero_std": 0.0,
"grad_norm": 44.704288482666016,
"learning_rate": 1.8716577540106954e-06,
"loss": -0.0202,
"num_tokens": 486130507.0,
"reward": 2.67243070602417,
"reward_std": 1.4341658115386964,
"rewards/accuracy_reward/mean": 0.3478515625,
"rewards/accuracy_reward/std": 0.4750068366527557,
"rewards/brier_reward/mean": 0.5088487803936005,
"rewards/brier_reward/std": 0.4378484785556793,
"rewards/confidence_one_or_zero/mean": 0.446875,
"rewards/confidence_one_or_zero/std": 0.4969118058681488,
"rewards/format_reward/mean": 0.7537109375,
"rewards/format_reward/std": 0.43048771023750304,
"rewards/mean_confidence_reward/mean": 0.6151445508003235,
"rewards/mean_confidence_reward/std": 0.38804330229759215,
"step": 165,
"step_time": 318.20381522698443
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04267578125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4009.8,
"completions/mean_length": 1193.27939453125,
"completions/mean_terminated_length": 1064.359521484375,
"completions/min_length": 272.6,
"completions/min_terminated_length": 272.6,
"entropy": 0.31800271323882046,
"epoch": 0.36324786324786323,
"frac_reward_zero_std": 0.0,
"grad_norm": 45.46564865112305,
"learning_rate": 1.7379679144385028e-06,
"loss": -0.0204,
"num_tokens": 501104760.0,
"reward": 2.635536003112793,
"reward_std": 1.4441087245941162,
"rewards/accuracy_reward/mean": 0.3525390625,
"rewards/accuracy_reward/std": 0.4760962724685669,
"rewards/brier_reward/mean": 0.5073639392852783,
"rewards/brier_reward/std": 0.43809244632720945,
"rewards/confidence_one_or_zero/mean": 0.433203125,
"rewards/confidence_one_or_zero/std": 0.49548872113227843,
"rewards/format_reward/mean": 0.745703125,
"rewards/format_reward/std": 0.43517242670059203,
"rewards/mean_confidence_reward/mean": 0.5967267632484436,
"rewards/mean_confidence_reward/std": 0.3925954043865204,
"step": 170,
"step_time": 324.3902578342066
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03447265625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3978.8,
"completions/mean_length": 1120.2951171875,
"completions/mean_terminated_length": 1014.105224609375,
"completions/min_length": 285.0,
"completions/min_terminated_length": 285.0,
"entropy": 0.3251201260834932,
"epoch": 0.37393162393162394,
"frac_reward_zero_std": 0.0,
"grad_norm": 65.23611450195312,
"learning_rate": 1.6042780748663103e-06,
"loss": -0.0164,
"num_tokens": 515338566.0,
"reward": 2.6606284618377685,
"reward_std": 1.4600170612335206,
"rewards/accuracy_reward/mean": 0.36572265625,
"rewards/accuracy_reward/std": 0.4810932517051697,
"rewards/brier_reward/mean": 0.5115406513214111,
"rewards/brier_reward/std": 0.43966758251190186,
"rewards/confidence_one_or_zero/mean": 0.433203125,
"rewards/confidence_one_or_zero/std": 0.4955389678478241,
"rewards/format_reward/mean": 0.73984375,
"rewards/format_reward/std": 0.43864802122116087,
"rewards/mean_confidence_reward/mean": 0.6103182315826416,
"rewards/mean_confidence_reward/std": 0.3892994046211243,
"step": 175,
"step_time": 320.5348702490388
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03662109375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3997.6,
"completions/mean_length": 1140.8505859375,
"completions/mean_terminated_length": 1028.3723876953125,
"completions/min_length": 276.0,
"completions/min_terminated_length": 276.0,
"entropy": 0.32873620714526625,
"epoch": 0.38461538461538464,
"frac_reward_zero_std": 0.0,
"grad_norm": 51.08501052856445,
"learning_rate": 1.4705882352941177e-06,
"loss": -0.0196,
"num_tokens": 529769868.0,
"reward": 2.6234814167022704,
"reward_std": 1.4477176189422607,
"rewards/accuracy_reward/mean": 0.3451171875,
"rewards/accuracy_reward/std": 0.4743470072746277,
"rewards/brier_reward/mean": 0.5132450461387634,
"rewards/brier_reward/std": 0.4347148656845093,
"rewards/confidence_one_or_zero/mean": 0.4205078125,
"rewards/confidence_one_or_zero/std": 0.4931892991065979,
"rewards/format_reward/mean": 0.7466796875,
"rewards/format_reward/std": 0.43422102332115176,
"rewards/mean_confidence_reward/mean": 0.5979317545890808,
"rewards/mean_confidence_reward/std": 0.3880310356616974,
"step": 180,
"step_time": 325.9552943095856
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04052734375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4005.2,
"completions/mean_length": 1181.13349609375,
"completions/mean_terminated_length": 1058.2173706054687,
"completions/min_length": 288.0,
"completions/min_terminated_length": 288.0,
"entropy": 0.31275777535047383,
"epoch": 0.3952991452991453,
"frac_reward_zero_std": 0.0,
"grad_norm": 44.81126022338867,
"learning_rate": 1.3368983957219254e-06,
"loss": -0.0205,
"num_tokens": 544664387.0,
"reward": 2.5762894630432127,
"reward_std": 1.4388552904129028,
"rewards/accuracy_reward/mean": 0.3298828125,
"rewards/accuracy_reward/std": 0.4654023349285126,
"rewards/brier_reward/mean": 0.4998352527618408,
"rewards/brier_reward/std": 0.4382630228996277,
"rewards/confidence_one_or_zero/mean": 0.42275390625,
"rewards/confidence_one_or_zero/std": 0.49179916381835936,
"rewards/format_reward/mean": 0.73115234375,
"rewards/format_reward/std": 0.4424052357673645,
"rewards/mean_confidence_reward/mean": 0.5926651358604431,
"rewards/mean_confidence_reward/std": 0.38963629603385924,
"step": 185,
"step_time": 407.50393955440376
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3929.2,
"completions/mean_length": 1182.69365234375,
"completions/mean_terminated_length": 1069.9430908203126,
"completions/min_length": 270.2,
"completions/min_terminated_length": 270.2,
"entropy": 0.30875583661254496,
"epoch": 0.405982905982906,
"frac_reward_zero_std": 0.0,
"grad_norm": 46.6525993347168,
"learning_rate": 1.2032085561497326e-06,
"loss": -0.0198,
"num_tokens": 559514658.0,
"reward": 2.5919751167297362,
"reward_std": 1.4350115060806274,
"rewards/accuracy_reward/mean": 0.3408203125,
"rewards/accuracy_reward/std": 0.47263641357421876,
"rewards/brier_reward/mean": 0.49980634450912476,
"rewards/brier_reward/std": 0.4361814737319946,
"rewards/confidence_one_or_zero/mean": 0.4193359375,
"rewards/confidence_one_or_zero/std": 0.49343532919883726,
"rewards/format_reward/mean": 0.73642578125,
"rewards/format_reward/std": 0.4384405970573425,
"rewards/mean_confidence_reward/mean": 0.5955868244171143,
"rewards/mean_confidence_reward/std": 0.38822770714759824,
"step": 190,
"step_time": 322.8024162671703
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04228515625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3993.0,
"completions/mean_length": 1174.65224609375,
"completions/mean_terminated_length": 1046.3890502929687,
"completions/min_length": 255.8,
"completions/min_terminated_length": 255.8,
"entropy": 0.31124953711405395,
"epoch": 0.4166666666666667,
"frac_reward_zero_std": 0.0,
"grad_norm": 50.37832260131836,
"learning_rate": 1.0695187165775401e-06,
"loss": -0.0215,
"num_tokens": 574310297.0,
"reward": 2.6151120185852053,
"reward_std": 1.4608880996704101,
"rewards/accuracy_reward/mean": 0.344140625,
"rewards/accuracy_reward/std": 0.4716655910015106,
"rewards/brier_reward/mean": 0.5032954812049866,
"rewards/brier_reward/std": 0.4398936152458191,
"rewards/confidence_one_or_zero/mean": 0.43369140625,
"rewards/confidence_one_or_zero/std": 0.4940564870834351,
"rewards/format_reward/mean": 0.73154296875,
"rewards/format_reward/std": 0.442363041639328,
"rewards/mean_confidence_reward/mean": 0.6024415254592895,
"rewards/mean_confidence_reward/std": 0.3903405725955963,
"step": 195,
"step_time": 321.9405225500348
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04658203125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3911.0,
"completions/mean_length": 1195.96796875,
"completions/mean_terminated_length": 1054.292431640625,
"completions/min_length": 218.4,
"completions/min_terminated_length": 218.4,
"entropy": 0.3140326828230172,
"epoch": 0.42735042735042733,
"frac_reward_zero_std": 0.0,
"grad_norm": 52.459930419921875,
"learning_rate": 9.358288770053477e-07,
"loss": -0.0244,
"num_tokens": 589303217.0,
"reward": 2.6150192737579347,
"reward_std": 1.4392563343048095,
"rewards/accuracy_reward/mean": 0.3431640625,
"rewards/accuracy_reward/std": 0.47419439554214476,
"rewards/brier_reward/mean": 0.4979334771633148,
"rewards/brier_reward/std": 0.4386617362499237,
"rewards/confidence_one_or_zero/mean": 0.43544921875,
"rewards/confidence_one_or_zero/std": 0.49546384811401367,
"rewards/format_reward/mean": 0.74296875,
"rewards/format_reward/std": 0.43653143644332887,
"rewards/mean_confidence_reward/mean": 0.5955037713050843,
"rewards/mean_confidence_reward/std": 0.393673437833786,
"step": 200,
"step_time": 327.2914565466228
},
{
"epoch": 0.42735042735042733,
"eval_clip_ratio/high_max": 0.0,
"eval_clip_ratio/high_mean": 0.0,
"eval_clip_ratio/low_mean": 0.0,
"eval_clip_ratio/low_min": 0.0,
"eval_clip_ratio/region_mean": 0.0,
"eval_completions/clipped_ratio": 0.0439453125,
"eval_completions/max_length": 3846.3125,
"eval_completions/max_terminated_length": 2380.96875,
"eval_completions/mean_length": 1170.236328125,
"eval_completions/mean_terminated_length": 1035.2478408813477,
"eval_completions/min_length": 453.4375,
"eval_completions/min_terminated_length": 453.4375,
"eval_entropy": 0.3072325438261032,
"eval_frac_reward_zero_std": 1.0,
"eval_loss": 0.0,
"eval_num_tokens": 589303217.0,
"eval_reward": 2.593014381825924,
"eval_reward_std": 1.4711584821343422,
"eval_rewards/accuracy_reward/mean": 0.341796875,
"eval_rewards/accuracy_reward/std": 0.4742839252576232,
"eval_rewards/brier_reward/mean": 0.4914909126237035,
"eval_rewards/brier_reward/std": 0.4407998891547322,
"eval_rewards/confidence_one_or_zero/mean": 0.447265625,
"eval_rewards/confidence_one_or_zero/std": 0.498204636387527,
"eval_rewards/format_reward/mean": 0.7216796875,
"eval_rewards/format_reward/std": 0.44888558331876993,
"eval_rewards/mean_confidence_reward/mean": 0.5907812491059303,
"eval_rewards/mean_confidence_reward/std": 0.39370104763656855,
"eval_runtime": 1185.0883,
"eval_samples_per_second": 0.844,
"eval_steps_per_second": 0.027,
"step": 200
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0373046875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3964.4,
"completions/mean_length": 1128.76904296875,
"completions/mean_terminated_length": 1013.8509521484375,
"completions/min_length": 235.8,
"completions/min_terminated_length": 235.8,
"entropy": 0.32033217654097823,
"epoch": 0.43803418803418803,
"frac_reward_zero_std": 0.0,
"grad_norm": 109.52311706542969,
"learning_rate": 8.021390374331551e-07,
"loss": -0.014,
"num_tokens": 603609268.0,
"reward": 2.658170557022095,
"reward_std": 1.431856918334961,
"rewards/accuracy_reward/mean": 0.34990234375,
"rewards/accuracy_reward/std": 0.4752007782459259,
"rewards/brier_reward/mean": 0.5081121861934662,
"rewards/brier_reward/std": 0.43636615872383117,
"rewards/confidence_one_or_zero/mean": 0.44365234375,
"rewards/confidence_one_or_zero/std": 0.49671694040298464,
"rewards/format_reward/mean": 0.75224609375,
"rewards/format_reward/std": 0.43108250498771666,
"rewards/mean_confidence_reward/mean": 0.6042575478553772,
"rewards/mean_confidence_reward/std": 0.38912311792373655,
"step": 205,
"step_time": 321.3963442307548
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0412109375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3887.4,
"completions/mean_length": 1184.64619140625,
"completions/mean_terminated_length": 1059.6198486328126,
"completions/min_length": 246.8,
"completions/min_terminated_length": 246.8,
"entropy": 0.3036916059441864,
"epoch": 0.44871794871794873,
"frac_reward_zero_std": 0.0,
"grad_norm": 46.13463592529297,
"learning_rate": 6.684491978609627e-07,
"loss": -0.0219,
"num_tokens": 618507469.0,
"reward": 2.5911818981170653,
"reward_std": 1.4422379732131958,
"rewards/accuracy_reward/mean": 0.33408203125,
"rewards/accuracy_reward/std": 0.47096659541130065,
"rewards/brier_reward/mean": 0.49200026988983153,
"rewards/brier_reward/std": 0.43940954804420473,
"rewards/confidence_one_or_zero/mean": 0.43505859375,
"rewards/confidence_one_or_zero/std": 0.4954834520816803,
"rewards/format_reward/mean": 0.73203125,
"rewards/format_reward/std": 0.44260523915290834,
"rewards/mean_confidence_reward/mean": 0.598009729385376,
"rewards/mean_confidence_reward/std": 0.39167081713676455,
"step": 210,
"step_time": 323.0747571212065
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0435546875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3939.6,
"completions/mean_length": 1168.0533203125,
"completions/mean_terminated_length": 1034.6664672851562,
"completions/min_length": 224.2,
"completions/min_terminated_length": 224.2,
"entropy": 0.31387688296381383,
"epoch": 0.4594017094017094,
"frac_reward_zero_std": 0.0,
"grad_norm": 36.15897750854492,
"learning_rate": 5.347593582887701e-07,
"loss": -0.021,
"num_tokens": 633201967.0,
"reward": 2.620379829406738,
"reward_std": 1.4509658813476562,
"rewards/accuracy_reward/mean": 0.35732421875,
"rewards/accuracy_reward/std": 0.4786747872829437,
"rewards/brier_reward/mean": 0.5078815937042236,
"rewards/brier_reward/std": 0.43832914233207704,
"rewards/confidence_one_or_zero/mean": 0.4224609375,
"rewards/confidence_one_or_zero/std": 0.49330766797065734,
"rewards/format_reward/mean": 0.74013671875,
"rewards/format_reward/std": 0.4384992718696594,
"rewards/mean_confidence_reward/mean": 0.5925763964653015,
"rewards/mean_confidence_reward/std": 0.3911791563034058,
"step": 215,
"step_time": 326.1934914130543
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04453125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4025.4,
"completions/mean_length": 1179.8091796875,
"completions/mean_terminated_length": 1044.0080932617188,
"completions/min_length": 254.6,
"completions/min_terminated_length": 254.6,
"entropy": 0.3016074412036687,
"epoch": 0.4700854700854701,
"frac_reward_zero_std": 0.0,
"grad_norm": 62.14570999145508,
"learning_rate": 4.0106951871657757e-07,
"loss": -0.0236,
"num_tokens": 648016717.0,
"reward": 2.6373492240905763,
"reward_std": 1.4634708881378173,
"rewards/accuracy_reward/mean": 0.35615234375,
"rewards/accuracy_reward/std": 0.47809425592422483,
"rewards/brier_reward/mean": 0.5045531094074249,
"rewards/brier_reward/std": 0.44011043310165404,
"rewards/confidence_one_or_zero/mean": 0.43154296875,
"rewards/confidence_one_or_zero/std": 0.4952175259590149,
"rewards/format_reward/mean": 0.7416015625,
"rewards/format_reward/std": 0.43776689767837523,
"rewards/mean_confidence_reward/mean": 0.6034992337226868,
"rewards/mean_confidence_reward/std": 0.3924152433872223,
"step": 220,
"step_time": 321.48763779564763
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03720703125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3961.0,
"completions/mean_length": 1166.6537109375,
"completions/mean_terminated_length": 1053.6300415039063,
"completions/min_length": 254.8,
"completions/min_terminated_length": 254.8,
"entropy": 0.30844552812632176,
"epoch": 0.4807692307692308,
"frac_reward_zero_std": 0.0,
"grad_norm": 151.7078094482422,
"learning_rate": 2.6737967914438503e-07,
"loss": -0.0172,
"num_tokens": 662686483.0,
"reward": 2.641693115234375,
"reward_std": 1.4303761720657349,
"rewards/accuracy_reward/mean": 0.34609375,
"rewards/accuracy_reward/std": 0.47535844445228576,
"rewards/brier_reward/mean": 0.5199149966239929,
"rewards/brier_reward/std": 0.4357679784297943,
"rewards/confidence_one_or_zero/mean": 0.42568359375,
"rewards/confidence_one_or_zero/std": 0.49414241313934326,
"rewards/format_reward/mean": 0.7541015625,
"rewards/format_reward/std": 0.4301507592201233,
"rewards/mean_confidence_reward/mean": 0.5958992719650269,
"rewards/mean_confidence_reward/std": 0.38701295852661133,
"step": 225,
"step_time": 327.222905562527
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.041796875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3919.0,
"completions/mean_length": 1171.34111328125,
"completions/mean_terminated_length": 1043.8849853515626,
"completions/min_length": 235.4,
"completions/min_terminated_length": 235.4,
"entropy": 0.30160802758764477,
"epoch": 0.49145299145299143,
"frac_reward_zero_std": 0.0,
"grad_norm": 126.87531280517578,
"learning_rate": 1.3368983957219251e-07,
"loss": -0.0223,
"num_tokens": 677407768.0,
"reward": 2.662746286392212,
"reward_std": 1.4676513671875,
"rewards/accuracy_reward/mean": 0.3689453125,
"rewards/accuracy_reward/std": 0.4824755251407623,
"rewards/brier_reward/mean": 0.515411776304245,
"rewards/brier_reward/std": 0.43887125253677367,
"rewards/confidence_one_or_zero/mean": 0.44208984375,
"rewards/confidence_one_or_zero/std": 0.4962202250957489,
"rewards/format_reward/mean": 0.742578125,
"rewards/format_reward/std": 0.4369687378406525,
"rewards/mean_confidence_reward/mean": 0.5937211871147156,
"rewards/mean_confidence_reward/std": 0.39389788508415224,
"step": 230,
"step_time": 318.9965775484394
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.043212890625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4027.5,
"completions/mean_length": 1166.7020263671875,
"completions/mean_terminated_length": 1034.5452728271484,
"completions/min_length": 155.0,
"completions/min_terminated_length": 155.0,
"entropy": 0.30643512052483857,
"epoch": 0.5,
"frac_reward_zero_std": 0.0,
"num_tokens": 689170639.0,
"reward": 2.711099922657013,
"reward_std": 1.4795014560222626,
"rewards/accuracy_reward/mean": 0.3792724609375,
"rewards/accuracy_reward/std": 0.4842975437641144,
"rewards/brier_reward/mean": 0.5229446142911911,
"rewards/brier_reward/std": 0.4396687373518944,
"rewards/confidence_one_or_zero/mean": 0.439453125,
"rewards/confidence_one_or_zero/std": 0.49557578563690186,
"rewards/format_reward/mean": 0.75439453125,
"rewards/format_reward/std": 0.4301748499274254,
"rewards/mean_confidence_reward/mean": 0.6150352358818054,
"rewards/mean_confidence_reward/std": 0.388339601457119,
"step": 234,
"step_time": 323.7886903610197,
"total_flos": 0.0,
"train_loss": -0.004756694548150413,
"train_runtime": 20325.6125,
"train_samples_per_second": 0.738,
"train_steps_per_second": 0.012
}
],
"logging_steps": 5,
"max_steps": 234,
"num_input_tokens_seen": 689170639,
"num_train_epochs": 1,
"save_steps": 60,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}