{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.5, "eval_steps": 50, "global_step": 234, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.041015625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4000.4, "completions/mean_length": 1164.1234375, "completions/mean_terminated_length": 1038.845556640625, "completions/min_length": 247.2, "completions/min_terminated_length": 247.2, "entropy": 0.29370769949164244, "epoch": 0.010683760683760684, "frac_reward_zero_std": 0.0, "grad_norm": 0.14847157895565033, "learning_rate": 4.2553191489361704e-07, "loss": -0.0248, "num_tokens": 14698896.0, "reward": 2.5872025966644285, "reward_std": 1.4765283107757567, "rewards/accuracy_reward/mean": 0.34619140625, "rewards/accuracy_reward/std": 0.4755214035511017, "rewards/brier_reward/mean": 0.49328577518463135, "rewards/brier_reward/std": 0.44167842864990237, "rewards/confidence_one_or_zero/mean": 0.431640625, "rewards/confidence_one_or_zero/std": 0.49507494568824767, "rewards/format_reward/mean": 0.7203125, "rewards/format_reward/std": 0.44880709052085876, "rewards/mean_confidence_reward/mean": 0.5957722783088684, "rewards/mean_confidence_reward/std": 0.39281755685806274, "step": 5, "step_time": 367.5162501453742 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04013671875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4028.0, "completions/mean_length": 1158.4236328125, "completions/mean_terminated_length": 1035.5475341796875, "completions/min_length": 236.0, "completions/min_terminated_length": 236.0, "entropy": 0.2964494117535651, "epoch": 0.021367521367521368, "frac_reward_zero_std": 0.0, "grad_norm": 0.14055821299552917, "learning_rate": 9.574468085106384e-07, "loss": -0.0212, "num_tokens": 29323618.0, "reward": 2.626321029663086, "reward_std": 1.4372277736663819, "rewards/accuracy_reward/mean": 0.3529296875, "rewards/accuracy_reward/std": 0.4779347002506256, "rewards/brier_reward/mean": 0.5081964015960694, "rewards/brier_reward/std": 0.43526085615158083, "rewards/confidence_one_or_zero/mean": 0.41826171875, "rewards/confidence_one_or_zero/std": 0.49299114346504214, "rewards/format_reward/mean": 0.746875, "rewards/format_reward/std": 0.4341681182384491, "rewards/mean_confidence_reward/mean": 0.6000582456588746, "rewards/mean_confidence_reward/std": 0.38636099696159365, "step": 10, "step_time": 321.1076524061791 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04140625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3991.8, "completions/mean_length": 1159.415625, "completions/mean_terminated_length": 1033.0634399414062, "completions/min_length": 130.2, "completions/min_terminated_length": 130.2, "entropy": 0.2963161684107035, "epoch": 0.03205128205128205, "frac_reward_zero_std": 0.0, "grad_norm": 0.38358214497566223, "learning_rate": 1.4893617021276596e-06, "loss": -0.0239, "num_tokens": 43913314.0, "reward": 2.622881555557251, "reward_std": 1.4426464796066285, "rewards/accuracy_reward/mean": 0.35615234375, "rewards/accuracy_reward/std": 0.4773412704467773, "rewards/brier_reward/mean": 0.5073358297348023, "rewards/brier_reward/std": 0.43741809129714965, "rewards/confidence_one_or_zero/mean": 0.42236328125, "rewards/confidence_one_or_zero/std": 0.4939651072025299, "rewards/format_reward/mean": 0.74052734375, "rewards/format_reward/std": 0.43735886216163633, "rewards/mean_confidence_reward/mean": 0.5965027928352356, "rewards/mean_confidence_reward/std": 0.3892210364341736, "step": 15, "step_time": 320.404392082378 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04677734375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4007.2, "completions/mean_length": 1199.3455078125, "completions/mean_terminated_length": 1057.2992553710938, "completions/min_length": 263.6, "completions/min_terminated_length": 263.6, "entropy": 0.2863605673890561, "epoch": 0.042735042735042736, "frac_reward_zero_std": 0.0, "grad_norm": 1.0963141918182373, "learning_rate": 2.021276595744681e-06, "loss": -0.0233, "num_tokens": 58973652.0, "reward": 2.4881054878234865, "reward_std": 1.4243582010269165, "rewards/accuracy_reward/mean": 0.303515625, "rewards/accuracy_reward/std": 0.4579374611377716, "rewards/brier_reward/mean": 0.48311116695404055, "rewards/brier_reward/std": 0.4374946057796478, "rewards/confidence_one_or_zero/mean": 0.41103515625, "rewards/confidence_one_or_zero/std": 0.4917535543441772, "rewards/format_reward/mean": 0.71962890625, "rewards/format_reward/std": 0.4489608943462372, "rewards/mean_confidence_reward/mean": 0.570814573764801, "rewards/mean_confidence_reward/std": 0.39406808614730837, "step": 20, "step_time": 332.20311605894824 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03974609375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3903.0, "completions/mean_length": 1148.490234375, "completions/mean_terminated_length": 1026.6469360351562, "completions/min_length": 243.6, "completions/min_terminated_length": 243.6, "entropy": 0.2810601927805692, "epoch": 0.053418803418803416, "frac_reward_zero_std": 0.0, "grad_norm": 3.739562749862671, "learning_rate": 2.553191489361702e-06, "loss": -0.02, "num_tokens": 73469776.0, "reward": 2.631763458251953, "reward_std": 1.4347328186035155, "rewards/accuracy_reward/mean": 0.34892578125, "rewards/accuracy_reward/std": 0.47504717111587524, "rewards/brier_reward/mean": 0.5076832473278046, "rewards/brier_reward/std": 0.4349519371986389, "rewards/confidence_one_or_zero/mean": 0.420703125, "rewards/confidence_one_or_zero/std": 0.49354149103164674, "rewards/format_reward/mean": 0.748046875, "rewards/format_reward/std": 0.4338900506496429, "rewards/mean_confidence_reward/mean": 0.6064043879508972, "rewards/mean_confidence_reward/std": 0.3849062204360962, "step": 25, "step_time": 320.1903787172225 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0404296875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4019.2, "completions/mean_length": 1165.85546875, "completions/mean_terminated_length": 1042.3886474609376, "completions/min_length": 220.4, "completions/min_terminated_length": 220.4, "entropy": 0.2301187983015552, "epoch": 0.0641025641025641, "frac_reward_zero_std": 0.0, "grad_norm": 199.96067810058594, "learning_rate": 3.0851063829787237e-06, "loss": -0.0199, "num_tokens": 88222312.0, "reward": 2.6316072940826416, "reward_std": 1.4807042837142945, "rewards/accuracy_reward/mean": 0.35673828125, "rewards/accuracy_reward/std": 0.47840901613235476, "rewards/brier_reward/mean": 0.506071788072586, "rewards/brier_reward/std": 0.4398545265197754, "rewards/confidence_one_or_zero/mean": 0.43662109375, "rewards/confidence_one_or_zero/std": 0.49545411467552186, "rewards/format_reward/mean": 0.73134765625, "rewards/format_reward/std": 0.4433063805103302, "rewards/mean_confidence_reward/mean": 0.6008285045623779, "rewards/mean_confidence_reward/std": 0.3925713062286377, "step": 30, "step_time": 326.57087952201545 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0490234375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3916.0, "completions/mean_length": 1185.3583984375, "completions/mean_terminated_length": 1035.7810302734374, "completions/min_length": 239.4, "completions/min_terminated_length": 239.4, "entropy": 0.2210580409388058, "epoch": 0.07478632478632478, "frac_reward_zero_std": 0.0, "grad_norm": 133.9806365966797, "learning_rate": 3.6170212765957453e-06, "loss": -0.0226, "num_tokens": 103107902.0, "reward": 2.585563850402832, "reward_std": 1.454831600189209, "rewards/accuracy_reward/mean": 0.33759765625, "rewards/accuracy_reward/std": 0.47166956663131715, "rewards/brier_reward/mean": 0.5002726972103119, "rewards/brier_reward/std": 0.4371703028678894, "rewards/confidence_one_or_zero/mean": 0.41552734375, "rewards/confidence_one_or_zero/std": 0.4925929605960846, "rewards/format_reward/mean": 0.73896484375, "rewards/format_reward/std": 0.4386298477649689, "rewards/mean_confidence_reward/mean": 0.5932011604309082, "rewards/mean_confidence_reward/std": 0.38995088934898375, "step": 35, "step_time": 325.6446264376165 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0408203125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4019.4, "completions/mean_length": 1149.20869140625, "completions/mean_terminated_length": 1023.7782958984375, "completions/min_length": 284.2, "completions/min_terminated_length": 284.2, "entropy": 0.3068808923708275, "epoch": 0.08547008547008547, "frac_reward_zero_std": 0.0, "grad_norm": 113.78675079345703, "learning_rate": 4.148936170212766e-06, "loss": -0.017, "num_tokens": 117596471.0, "reward": 2.62867956161499, "reward_std": 1.4407520055770875, "rewards/accuracy_reward/mean": 0.34384765625, "rewards/accuracy_reward/std": 0.4746952474117279, "rewards/brier_reward/mean": 0.5058294236660004, "rewards/brier_reward/std": 0.43723568320274353, "rewards/confidence_one_or_zero/mean": 0.43291015625, "rewards/confidence_one_or_zero/std": 0.4955411970615387, "rewards/format_reward/mean": 0.74208984375, "rewards/format_reward/std": 0.43702192902565, "rewards/mean_confidence_reward/mean": 0.6040024995803833, "rewards/mean_confidence_reward/std": 0.3885011911392212, "step": 40, "step_time": 325.2610327706119 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04638671875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3996.8, "completions/mean_length": 1179.61962890625, "completions/mean_terminated_length": 1037.8166137695312, "completions/min_length": 251.2, "completions/min_terminated_length": 251.2, "entropy": 0.3366824609809555, "epoch": 0.09615384615384616, "frac_reward_zero_std": 0.0, "grad_norm": 124.41181182861328, "learning_rate": 4.680851063829788e-06, "loss": -0.0239, "num_tokens": 132464704.0, "reward": 2.6292791843414305, "reward_std": 1.4946486711502076, "rewards/accuracy_reward/mean": 0.35771484375, "rewards/accuracy_reward/std": 0.4783689081668854, "rewards/brier_reward/mean": 0.5130708456039429, "rewards/brier_reward/std": 0.44048008918762205, "rewards/confidence_one_or_zero/mean": 0.42802734375, "rewards/confidence_one_or_zero/std": 0.4943909227848053, "rewards/format_reward/mean": 0.73212890625, "rewards/format_reward/std": 0.44279989004135134, "rewards/mean_confidence_reward/mean": 0.5983372449874877, "rewards/mean_confidence_reward/std": 0.39211158752441405, "step": 45, "step_time": 329.7312524779816 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0419921875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3980.4, "completions/mean_length": 1176.43818359375, "completions/mean_terminated_length": 1048.7527954101563, "completions/min_length": 247.4, "completions/min_terminated_length": 247.4, "entropy": 0.418773017404601, "epoch": 0.10683760683760683, "frac_reward_zero_std": 0.0, "grad_norm": 62.133018493652344, "learning_rate": 4.9465240641711236e-06, "loss": -0.0165, "num_tokens": 147298055.0, "reward": 2.5864771366119386, "reward_std": 1.4536908149719239, "rewards/accuracy_reward/mean": 0.3388671875, "rewards/accuracy_reward/std": 0.4714273869991302, "rewards/brier_reward/mean": 0.4910121440887451, "rewards/brier_reward/std": 0.44000319242477415, "rewards/confidence_one_or_zero/mean": 0.43486328125, "rewards/confidence_one_or_zero/std": 0.4950097680091858, "rewards/format_reward/mean": 0.728515625, "rewards/format_reward/std": 0.4440678656101227, "rewards/mean_confidence_reward/mean": 0.5932189226150513, "rewards/mean_confidence_reward/std": 0.39245480895042417, "step": 50, "step_time": 322.2430747395556 }, { "epoch": 0.10683760683760683, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.0478515625, "eval_completions/max_length": 3660.875, "eval_completions/max_terminated_length": 2446.375, "eval_completions/mean_length": 1183.4482421875, "eval_completions/mean_terminated_length": 1035.961950302124, "eval_completions/min_length": 449.375, "eval_completions/min_terminated_length": 449.375, "eval_entropy": 0.4594858642667532, "eval_frac_reward_zero_std": 1.0, "eval_loss": 0.0, "eval_num_tokens": 147298055.0, "eval_reward": 2.5969152376055717, "eval_reward_std": 1.4885545708239079, "eval_rewards/accuracy_reward/mean": 0.34765625, "eval_rewards/accuracy_reward/std": 0.4782447386533022, "eval_rewards/brier_reward/mean": 0.5097439922392368, "eval_rewards/brier_reward/std": 0.438809622079134, "eval_rewards/confidence_one_or_zero/mean": 0.4150390625, "eval_rewards/confidence_one_or_zero/std": 0.49284233059734106, "eval_rewards/format_reward/mean": 0.7451171875, "eval_rewards/format_reward/std": 0.43596830405294895, "eval_rewards/mean_confidence_reward/mean": 0.5793587230145931, "eval_rewards/mean_confidence_reward/std": 0.39388769399374723, "eval_runtime": 1149.3092, "eval_samples_per_second": 0.87, "eval_steps_per_second": 0.028, "step": 50 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04443359375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3851.6, "completions/mean_length": 1186.297265625, "completions/mean_terminated_length": 1051.1856811523437, "completions/min_length": 253.8, "completions/min_terminated_length": 253.8, "entropy": 0.4116662655491382, "epoch": 0.11752136752136752, "frac_reward_zero_std": 0.0, "grad_norm": 69.27256774902344, "learning_rate": 4.812834224598931e-06, "loss": -0.0233, "num_tokens": 162181707.0, "reward": 2.5811704635620116, "reward_std": 1.4448149919509887, "rewards/accuracy_reward/mean": 0.33203125, "rewards/accuracy_reward/std": 0.4704195737838745, "rewards/brier_reward/mean": 0.4908031582832336, "rewards/brier_reward/std": 0.43675305843353274, "rewards/confidence_one_or_zero/mean": 0.42431640625, "rewards/confidence_one_or_zero/std": 0.4941523432731628, "rewards/format_reward/mean": 0.735546875, "rewards/format_reward/std": 0.44057986736297605, "rewards/mean_confidence_reward/mean": 0.5984728097915649, "rewards/mean_confidence_reward/std": 0.3909616231918335, "step": 55, "step_time": 330.042653635249 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04189453125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3965.2, "completions/mean_length": 1177.36982421875, "completions/mean_terminated_length": 1050.1990234375, "completions/min_length": 251.2, "completions/min_terminated_length": 251.2, "entropy": 0.4373515026643872, "epoch": 0.1282051282051282, "frac_reward_zero_std": 0.0, "grad_norm": 101.64539337158203, "learning_rate": 4.6791443850267385e-06, "loss": -0.0211, "num_tokens": 176994198.0, "reward": 2.591030979156494, "reward_std": 1.45223228931427, "rewards/accuracy_reward/mean": 0.337109375, "rewards/accuracy_reward/std": 0.4722390055656433, "rewards/brier_reward/mean": 0.5020074665546417, "rewards/brier_reward/std": 0.43737395405769347, "rewards/confidence_one_or_zero/mean": 0.41845703125, "rewards/confidence_one_or_zero/std": 0.49311497807502747, "rewards/format_reward/mean": 0.734765625, "rewards/format_reward/std": 0.44106330871582033, "rewards/mean_confidence_reward/mean": 0.5986914038658142, "rewards/mean_confidence_reward/std": 0.38671804666519166, "step": 60, "step_time": 347.4772788655682 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.05126953125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4001.0, "completions/mean_length": 1238.319921875, "completions/mean_terminated_length": 1084.0480224609375, "completions/min_length": 282.6, "completions/min_terminated_length": 282.6, "entropy": 0.4563113780459389, "epoch": 0.1388888888888889, "frac_reward_zero_std": 0.0, "grad_norm": 53.89928436279297, "learning_rate": 4.5454545454545455e-06, "loss": -0.028, "num_tokens": 192411170.0, "reward": 2.531825304031372, "reward_std": 1.4431338548660277, "rewards/accuracy_reward/mean": 0.3255859375, "rewards/accuracy_reward/std": 0.4675427436828613, "rewards/brier_reward/mean": 0.49114506840705874, "rewards/brier_reward/std": 0.43718346357345583, "rewards/confidence_one_or_zero/mean": 0.412890625, "rewards/confidence_one_or_zero/std": 0.4916431367397308, "rewards/format_reward/mean": 0.7236328125, "rewards/format_reward/std": 0.4470420956611633, "rewards/mean_confidence_reward/mean": 0.5785707950592041, "rewards/mean_confidence_reward/std": 0.39329431056976316, "step": 65, "step_time": 391.79989567998564 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.046484375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3956.0, "completions/mean_length": 1216.59765625, "completions/mean_terminated_length": 1076.82607421875, "completions/min_length": 245.6, "completions/min_terminated_length": 245.6, "entropy": 0.4711520684882998, "epoch": 0.14957264957264957, "frac_reward_zero_std": 0.0, "grad_norm": 57.16364669799805, "learning_rate": 4.411764705882353e-06, "loss": -0.0207, "num_tokens": 207638154.0, "reward": 2.516926908493042, "reward_std": 1.428751039505005, "rewards/accuracy_reward/mean": 0.314453125, "rewards/accuracy_reward/std": 0.4608186721801758, "rewards/brier_reward/mean": 0.49181228280067446, "rewards/brier_reward/std": 0.4358379542827606, "rewards/confidence_one_or_zero/mean": 0.41123046875, "rewards/confidence_one_or_zero/std": 0.491403067111969, "rewards/format_reward/mean": 0.725390625, "rewards/format_reward/std": 0.44508775472640993, "rewards/mean_confidence_reward/mean": 0.574040412902832, "rewards/mean_confidence_reward/std": 0.3923916518688202, "step": 70, "step_time": 330.1905146706442 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04140625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3948.4, "completions/mean_length": 1172.76875, "completions/mean_terminated_length": 1046.49931640625, "completions/min_length": 231.4, "completions/min_terminated_length": 231.4, "entropy": 0.4409632431343198, "epoch": 0.16025641025641027, "frac_reward_zero_std": 0.0, "grad_norm": 50.008419036865234, "learning_rate": 4.2780748663101604e-06, "loss": -0.0224, "num_tokens": 222380138.0, "reward": 2.5926557064056395, "reward_std": 1.463102674484253, "rewards/accuracy_reward/mean": 0.33291015625, "rewards/accuracy_reward/std": 0.4709408342838287, "rewards/brier_reward/mean": 0.5047689855098725, "rewards/brier_reward/std": 0.4396240770816803, "rewards/confidence_one_or_zero/mean": 0.4283203125, "rewards/confidence_one_or_zero/std": 0.49480087161064146, "rewards/format_reward/mean": 0.7337890625, "rewards/format_reward/std": 0.4413725435733795, "rewards/mean_confidence_reward/mean": 0.5928672432899476, "rewards/mean_confidence_reward/std": 0.3934659421443939, "step": 75, "step_time": 326.668984343193 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04423828125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3992.6, "completions/mean_length": 1149.94189453125, "completions/mean_terminated_length": 1013.5361328125, "completions/min_length": 282.6, "completions/min_terminated_length": 282.6, "entropy": 0.4194035842316225, "epoch": 0.17094017094017094, "frac_reward_zero_std": 0.0, "grad_norm": 64.48490142822266, "learning_rate": 4.144385026737968e-06, "loss": -0.0261, "num_tokens": 236899959.0, "reward": 2.5700586795806886, "reward_std": 1.4412338256835937, "rewards/accuracy_reward/mean": 0.32666015625, "rewards/accuracy_reward/std": 0.46828957796096804, "rewards/brier_reward/mean": 0.4898384869098663, "rewards/brier_reward/std": 0.4382441997528076, "rewards/confidence_one_or_zero/mean": 0.42744140625, "rewards/confidence_one_or_zero/std": 0.49459370970726013, "rewards/format_reward/mean": 0.7330078125, "rewards/format_reward/std": 0.4424092710018158, "rewards/mean_confidence_reward/mean": 0.5931108236312866, "rewards/mean_confidence_reward/std": 0.39181647896766664, "step": 80, "step_time": 323.0481036014127 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04208984375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3887.0, "completions/mean_length": 1177.4208984375, "completions/mean_terminated_length": 1049.3630737304688, "completions/min_length": 202.6, "completions/min_terminated_length": 202.6, "entropy": 0.39985626018606124, "epoch": 0.18162393162393162, "frac_reward_zero_std": 0.0, "grad_norm": 45.62771987915039, "learning_rate": 4.010695187165775e-06, "loss": -0.0225, "num_tokens": 251679821.0, "reward": 2.59846568107605, "reward_std": 1.4533775568008422, "rewards/accuracy_reward/mean": 0.34990234375, "rewards/accuracy_reward/std": 0.4756861090660095, "rewards/brier_reward/mean": 0.5023018896579743, "rewards/brier_reward/std": 0.4387582540512085, "rewards/confidence_one_or_zero/mean": 0.427734375, "rewards/confidence_one_or_zero/std": 0.494358617067337, "rewards/format_reward/mean": 0.73212890625, "rewards/format_reward/std": 0.44288029670715334, "rewards/mean_confidence_reward/mean": 0.5863980650901794, "rewards/mean_confidence_reward/std": 0.3929993689060211, "step": 85, "step_time": 326.0249995706487 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0462890625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3998.4, "completions/mean_length": 1179.9412109375, "completions/mean_terminated_length": 1038.520068359375, "completions/min_length": 259.2, "completions/min_terminated_length": 259.2, "entropy": 0.386576225515455, "epoch": 0.19230769230769232, "frac_reward_zero_std": 0.0, "grad_norm": 193.96762084960938, "learning_rate": 3.877005347593583e-06, "loss": -0.0228, "num_tokens": 266478067.0, "reward": 2.579456090927124, "reward_std": 1.4271894216537475, "rewards/accuracy_reward/mean": 0.32578125, "rewards/accuracy_reward/std": 0.46765764355659484, "rewards/brier_reward/mean": 0.4961786985397339, "rewards/brier_reward/std": 0.4369286894798279, "rewards/confidence_one_or_zero/mean": 0.4203125, "rewards/confidence_one_or_zero/std": 0.4934973418712616, "rewards/format_reward/mean": 0.74404296875, "rewards/format_reward/std": 0.43625056743621826, "rewards/mean_confidence_reward/mean": 0.5931406259536743, "rewards/mean_confidence_reward/std": 0.39092748165130614, "step": 90, "step_time": 322.8700365928322 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04658203125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3999.6, "completions/mean_length": 1198.956640625, "completions/mean_terminated_length": 1057.507568359375, "completions/min_length": 263.8, "completions/min_terminated_length": 263.8, "entropy": 0.40121041517704725, "epoch": 0.202991452991453, "frac_reward_zero_std": 0.0, "grad_norm": 41.008140563964844, "learning_rate": 3.7433155080213907e-06, "loss": -0.0227, "num_tokens": 281502167.0, "reward": 2.608871269226074, "reward_std": 1.4490824222564698, "rewards/accuracy_reward/mean": 0.344921875, "rewards/accuracy_reward/std": 0.47531471252441404, "rewards/brier_reward/mean": 0.5078621506690979, "rewards/brier_reward/std": 0.43720985054969785, "rewards/confidence_one_or_zero/mean": 0.421875, "rewards/confidence_one_or_zero/std": 0.4936180472373962, "rewards/format_reward/mean": 0.742578125, "rewards/format_reward/std": 0.4370300233364105, "rewards/mean_confidence_reward/mean": 0.5916341543197632, "rewards/mean_confidence_reward/std": 0.39123871326446535, "step": 95, "step_time": 323.7242567136098 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0431640625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3955.4, "completions/mean_length": 1154.41572265625, "completions/mean_terminated_length": 1021.7558959960937, "completions/min_length": 272.8, "completions/min_terminated_length": 272.8, "entropy": 0.4168419130612165, "epoch": 0.21367521367521367, "frac_reward_zero_std": 0.0, "grad_norm": 57.19181442260742, "learning_rate": 3.609625668449198e-06, "loss": -0.0236, "num_tokens": 296056888.0, "reward": 2.6315658569335936, "reward_std": 1.4593602418899536, "rewards/accuracy_reward/mean": 0.35224609375, "rewards/accuracy_reward/std": 0.47758880257606506, "rewards/brier_reward/mean": 0.5140846490859985, "rewards/brier_reward/std": 0.4383812129497528, "rewards/confidence_one_or_zero/mean": 0.42919921875, "rewards/confidence_one_or_zero/std": 0.494834303855896, "rewards/format_reward/mean": 0.741796875, "rewards/format_reward/std": 0.43728084564208985, "rewards/mean_confidence_reward/mean": 0.5942391753196716, "rewards/mean_confidence_reward/std": 0.39173622727394103, "step": 100, "step_time": 341.3402804447949 }, { "epoch": 0.21367521367521367, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.044921875, "eval_completions/max_length": 3675.625, "eval_completions/max_terminated_length": 2566.5625, "eval_completions/mean_length": 1191.265625, "eval_completions/mean_terminated_length": 1054.0882835388184, "eval_completions/min_length": 447.875, "eval_completions/min_terminated_length": 447.875, "eval_entropy": 0.3911281004548073, "eval_frac_reward_zero_std": 1.0, "eval_loss": 0.0, "eval_num_tokens": 296056888.0, "eval_reward": 2.5998095087707043, "eval_reward_std": 1.4141752794384956, "eval_rewards/accuracy_reward/mean": 0.3369140625, "eval_rewards/accuracy_reward/std": 0.4713865462690592, "eval_rewards/brier_reward/mean": 0.4994282014667988, "eval_rewards/brier_reward/std": 0.44008473958820105, "eval_rewards/confidence_one_or_zero/mean": 0.419921875, "eval_rewards/confidence_one_or_zero/std": 0.49413473159074783, "eval_rewards/format_reward/mean": 0.7421875, "eval_rewards/format_reward/std": 0.4395229946821928, "eval_rewards/mean_confidence_reward/mean": 0.6013578549027443, "eval_rewards/mean_confidence_reward/std": 0.38793430011719465, "eval_runtime": 1211.1914, "eval_samples_per_second": 0.826, "eval_steps_per_second": 0.026, "step": 100 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03994140625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4009.4, "completions/mean_length": 1162.73779296875, "completions/mean_terminated_length": 1040.7655639648438, "completions/min_length": 195.2, "completions/min_terminated_length": 195.2, "entropy": 0.4001290183980018, "epoch": 0.22435897435897437, "frac_reward_zero_std": 0.0, "grad_norm": 41.48870849609375, "learning_rate": 3.4759358288770056e-06, "loss": -0.0209, "num_tokens": 310698331.0, "reward": 2.588319683074951, "reward_std": 1.4540923595428468, "rewards/accuracy_reward/mean": 0.33447265625, "rewards/accuracy_reward/std": 0.47117613554000853, "rewards/brier_reward/mean": 0.4937448620796204, "rewards/brier_reward/std": 0.43921745419502256, "rewards/confidence_one_or_zero/mean": 0.429296875, "rewards/confidence_one_or_zero/std": 0.49498026371002196, "rewards/format_reward/mean": 0.73095703125, "rewards/format_reward/std": 0.4429859757423401, "rewards/mean_confidence_reward/mean": 0.5998483061790466, "rewards/mean_confidence_reward/std": 0.3917877316474915, "step": 105, "step_time": 338.7956139975722 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.035546875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3968.0, "completions/mean_length": 1152.4916015625, "completions/mean_terminated_length": 1043.9873779296875, "completions/min_length": 216.2, "completions/min_terminated_length": 216.2, "entropy": 0.4095216895919293, "epoch": 0.23504273504273504, "frac_reward_zero_std": 0.0, "grad_norm": 78.59355163574219, "learning_rate": 3.342245989304813e-06, "loss": -0.0159, "num_tokens": 325250693.0, "reward": 2.6221971035003664, "reward_std": 1.4129359245300293, "rewards/accuracy_reward/mean": 0.34150390625, "rewards/accuracy_reward/std": 0.4733522355556488, "rewards/brier_reward/mean": 0.4949895441532135, "rewards/brier_reward/std": 0.43677046298980715, "rewards/confidence_one_or_zero/mean": 0.42919921875, "rewards/confidence_one_or_zero/std": 0.49494434595108033, "rewards/format_reward/mean": 0.748828125, "rewards/format_reward/std": 0.43359296917915346, "rewards/mean_confidence_reward/mean": 0.607676339149475, "rewards/mean_confidence_reward/std": 0.3874302625656128, "step": 110, "step_time": 319.2142815226136 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04208984375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3922.4, "completions/mean_length": 1179.708203125, "completions/mean_terminated_length": 1051.603564453125, "completions/min_length": 263.0, "completions/min_terminated_length": 263.0, "entropy": 0.3744899015408009, "epoch": 0.24572649572649571, "frac_reward_zero_std": 0.0, "grad_norm": 44.732879638671875, "learning_rate": 3.2085561497326205e-06, "loss": -0.0202, "num_tokens": 340073081.0, "reward": 2.59310622215271, "reward_std": 1.4364994049072266, "rewards/accuracy_reward/mean": 0.35048828125, "rewards/accuracy_reward/std": 0.4767671048641205, "rewards/brier_reward/mean": 0.5079159557819366, "rewards/brier_reward/std": 0.4364722192287445, "rewards/confidence_one_or_zero/mean": 0.41123046875, "rewards/confidence_one_or_zero/std": 0.4919556140899658, "rewards/format_reward/mean": 0.7400390625, "rewards/format_reward/std": 0.4384325683116913, "rewards/mean_confidence_reward/mean": 0.583432388305664, "rewards/mean_confidence_reward/std": 0.3897099018096924, "step": 115, "step_time": 326.647366704233 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04453125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3945.0, "completions/mean_length": 1200.745703125, "completions/mean_terminated_length": 1066.298779296875, "completions/min_length": 227.4, "completions/min_terminated_length": 227.4, "entropy": 0.34471772906836123, "epoch": 0.2564102564102564, "frac_reward_zero_std": 0.0, "grad_norm": 61.09455871582031, "learning_rate": 3.074866310160428e-06, "loss": -0.0255, "num_tokens": 355119949.0, "reward": 2.5888769149780275, "reward_std": 1.432522964477539, "rewards/accuracy_reward/mean": 0.33251953125, "rewards/accuracy_reward/std": 0.4707206726074219, "rewards/brier_reward/mean": 0.49854403734207153, "rewards/brier_reward/std": 0.43708345890045164, "rewards/confidence_one_or_zero/mean": 0.421875, "rewards/confidence_one_or_zero/std": 0.49373169541358947, "rewards/format_reward/mean": 0.7423828125, "rewards/format_reward/std": 0.43607338666915896, "rewards/mean_confidence_reward/mean": 0.5935555100440979, "rewards/mean_confidence_reward/std": 0.39031049609184265, "step": 120, "step_time": 324.7173171197093 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04765625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3938.0, "completions/mean_length": 1179.1443359375, "completions/mean_terminated_length": 1033.1288330078125, "completions/min_length": 279.4, "completions/min_terminated_length": 279.4, "entropy": 0.32342109945602715, "epoch": 0.2670940170940171, "frac_reward_zero_std": 0.0, "grad_norm": 57.27123260498047, "learning_rate": 2.9411764705882355e-06, "loss": -0.0236, "num_tokens": 369945203.0, "reward": 2.578601837158203, "reward_std": 1.4519781589508056, "rewards/accuracy_reward/mean": 0.347265625, "rewards/accuracy_reward/std": 0.4754137098789215, "rewards/brier_reward/mean": 0.5017790496349335, "rewards/brier_reward/std": 0.43707227110862734, "rewards/confidence_one_or_zero/mean": 0.41171875, "rewards/confidence_one_or_zero/std": 0.4922350883483887, "rewards/format_reward/mean": 0.73779296875, "rewards/format_reward/std": 0.4398411691188812, "rewards/mean_confidence_reward/mean": 0.5800454020500183, "rewards/mean_confidence_reward/std": 0.39250563979148867, "step": 125, "step_time": 346.2828420913778 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0419921875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4003.6, "completions/mean_length": 1171.39365234375, "completions/mean_terminated_length": 1043.3955444335938, "completions/min_length": 271.0, "completions/min_terminated_length": 271.0, "entropy": 0.35659047805238514, "epoch": 0.2777777777777778, "frac_reward_zero_std": 0.0, "grad_norm": 113.86180877685547, "learning_rate": 2.807486631016043e-06, "loss": -0.0234, "num_tokens": 384686290.0, "reward": 2.6278841972351072, "reward_std": 1.4369913339614868, "rewards/accuracy_reward/mean": 0.34736328125, "rewards/accuracy_reward/std": 0.475992888212204, "rewards/brier_reward/mean": 0.5168704152107239, "rewards/brier_reward/std": 0.4365030348300934, "rewards/confidence_one_or_zero/mean": 0.42607421875, "rewards/confidence_one_or_zero/std": 0.4945238888263702, "rewards/format_reward/mean": 0.74873046875, "rewards/format_reward/std": 0.4332437634468079, "rewards/mean_confidence_reward/mean": 0.5888458251953125, "rewards/mean_confidence_reward/std": 0.39102033972740174, "step": 130, "step_time": 321.3360222982825 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03935546875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3972.4, "completions/mean_length": 1128.96396484375, "completions/mean_terminated_length": 1007.7831909179688, "completions/min_length": 282.4, "completions/min_terminated_length": 282.4, "entropy": 0.35520400705281646, "epoch": 0.28846153846153844, "frac_reward_zero_std": 0.0, "grad_norm": 51.285396575927734, "learning_rate": 2.673796791443851e-06, "loss": -0.0227, "num_tokens": 398983489.0, "reward": 2.612396001815796, "reward_std": 1.4276126384735108, "rewards/accuracy_reward/mean": 0.3345703125, "rewards/accuracy_reward/std": 0.47118029594421384, "rewards/brier_reward/mean": 0.49303132891654966, "rewards/brier_reward/std": 0.4375665545463562, "rewards/confidence_one_or_zero/mean": 0.4322265625, "rewards/confidence_one_or_zero/std": 0.49502651691436766, "rewards/format_reward/mean": 0.74296875, "rewards/format_reward/std": 0.43659918904304507, "rewards/mean_confidence_reward/mean": 0.6095991253852844, "rewards/mean_confidence_reward/std": 0.38876975774765016, "step": 135, "step_time": 317.259214475425 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03896484375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4068.4, "completions/mean_length": 1158.2162109375, "completions/mean_terminated_length": 1039.444482421875, "completions/min_length": 250.0, "completions/min_terminated_length": 250.0, "entropy": 0.3379080446669832, "epoch": 0.29914529914529914, "frac_reward_zero_std": 0.0, "grad_norm": 47.08708953857422, "learning_rate": 2.5401069518716583e-06, "loss": -0.0164, "num_tokens": 413628743.0, "reward": 2.624250793457031, "reward_std": 1.4579155921936036, "rewards/accuracy_reward/mean": 0.35654296875, "rewards/accuracy_reward/std": 0.4779155910015106, "rewards/brier_reward/mean": 0.5080420076847076, "rewards/brier_reward/std": 0.4370752513408661, "rewards/confidence_one_or_zero/mean": 0.41474609375, "rewards/confidence_one_or_zero/std": 0.49261121153831483, "rewards/format_reward/mean": 0.73642578125, "rewards/format_reward/std": 0.44039976596832275, "rewards/mean_confidence_reward/mean": 0.6084939122200013, "rewards/mean_confidence_reward/std": 0.3848548471927643, "step": 140, "step_time": 322.5389275003457 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04482421875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4020.0, "completions/mean_length": 1198.82666015625, "completions/mean_terminated_length": 1063.138720703125, "completions/min_length": 259.2, "completions/min_terminated_length": 259.2, "entropy": 0.3416525034001097, "epoch": 0.30982905982905984, "frac_reward_zero_std": 0.0, "grad_norm": 49.23389434814453, "learning_rate": 2.4064171122994653e-06, "loss": -0.0207, "num_tokens": 428679224.0, "reward": 2.584191846847534, "reward_std": 1.4531973361968995, "rewards/accuracy_reward/mean": 0.33994140625, "rewards/accuracy_reward/std": 0.472433865070343, "rewards/brier_reward/mean": 0.4880970597267151, "rewards/brier_reward/std": 0.438845157623291, "rewards/confidence_one_or_zero/mean": 0.4294921875, "rewards/confidence_one_or_zero/std": 0.49454295039176943, "rewards/format_reward/mean": 0.73310546875, "rewards/format_reward/std": 0.4407926738262177, "rewards/mean_confidence_reward/mean": 0.5935557723045349, "rewards/mean_confidence_reward/std": 0.3939161837100983, "step": 145, "step_time": 324.0329591148824 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04072265625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3972.4, "completions/mean_length": 1154.97421875, "completions/mean_terminated_length": 1030.1244262695313, "completions/min_length": 221.4, "completions/min_terminated_length": 221.4, "entropy": 0.3519633636577055, "epoch": 0.32051282051282054, "frac_reward_zero_std": 0.0, "grad_norm": 54.82425308227539, "learning_rate": 2.2727272727272728e-06, "loss": -0.019, "num_tokens": 443254160.0, "reward": 2.583753252029419, "reward_std": 1.4211549758911133, "rewards/accuracy_reward/mean": 0.32998046875, "rewards/accuracy_reward/std": 0.46994357705116274, "rewards/brier_reward/mean": 0.503885543346405, "rewards/brier_reward/std": 0.433600527048111, "rewards/confidence_one_or_zero/mean": 0.41416015625, "rewards/confidence_one_or_zero/std": 0.4925421476364136, "rewards/format_reward/mean": 0.74814453125, "rewards/format_reward/std": 0.4341081440448761, "rewards/mean_confidence_reward/mean": 0.5875824809074401, "rewards/mean_confidence_reward/std": 0.388624894618988, "step": 150, "step_time": 322.4442724415218 }, { "epoch": 0.32051282051282054, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.0390625, "eval_completions/max_length": 3729.6875, "eval_completions/max_terminated_length": 2385.375, "eval_completions/mean_length": 1152.037109375, "eval_completions/mean_terminated_length": 1031.337080001831, "eval_completions/min_length": 444.15625, "eval_completions/min_terminated_length": 444.15625, "eval_entropy": 0.32576982071623206, "eval_frac_reward_zero_std": 1.0, "eval_loss": 0.0, "eval_num_tokens": 443254160.0, "eval_reward": 2.609559252858162, "eval_reward_std": 1.437463615089655, "eval_rewards/accuracy_reward/mean": 0.3466796875, "eval_rewards/accuracy_reward/std": 0.4741403367370367, "eval_rewards/brier_reward/mean": 0.49707255978137255, "eval_rewards/brier_reward/std": 0.4325491338968277, "eval_rewards/confidence_one_or_zero/mean": 0.4345703125, "eval_rewards/confidence_one_or_zero/std": 0.4974057199433446, "eval_rewards/format_reward/mean": 0.740234375, "eval_rewards/format_reward/std": 0.43520408356562257, "eval_rewards/mean_confidence_reward/mean": 0.591002281755209, "eval_rewards/mean_confidence_reward/std": 0.3949732268229127, "eval_runtime": 1184.2626, "eval_samples_per_second": 0.844, "eval_steps_per_second": 0.027, "step": 150 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0337890625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3998.0, "completions/mean_length": 1110.99599609375, "completions/mean_terminated_length": 1006.7109252929688, "completions/min_length": 238.0, "completions/min_terminated_length": 238.0, "entropy": 0.340514807915315, "epoch": 0.3311965811965812, "frac_reward_zero_std": 0.0, "grad_norm": 42.09675979614258, "learning_rate": 2.1390374331550802e-06, "loss": -0.0158, "num_tokens": 457382311.0, "reward": 2.6362682342529298, "reward_std": 1.4206720113754272, "rewards/accuracy_reward/mean": 0.33486328125, "rewards/accuracy_reward/std": 0.47186189889907837, "rewards/brier_reward/mean": 0.5024402737617493, "rewards/brier_reward/std": 0.43651157021522524, "rewards/confidence_one_or_zero/mean": 0.43583984375, "rewards/confidence_one_or_zero/std": 0.49555398225784303, "rewards/format_reward/mean": 0.7517578125, "rewards/format_reward/std": 0.43134459257125857, "rewards/mean_confidence_reward/mean": 0.6113669753074646, "rewards/mean_confidence_reward/std": 0.38755360841751096, "step": 155, "step_time": 317.9468389595451 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03837890625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3940.8, "completions/mean_length": 1123.14443359375, "completions/mean_terminated_length": 1004.75517578125, "completions/min_length": 282.8, "completions/min_terminated_length": 282.8, "entropy": 0.3312236491590738, "epoch": 0.3418803418803419, "frac_reward_zero_std": 0.0, "grad_norm": 51.59230041503906, "learning_rate": 2.0053475935828877e-06, "loss": -0.018, "num_tokens": 471616750.0, "reward": 2.6946078300476075, "reward_std": 1.4457947969436646, "rewards/accuracy_reward/mean": 0.36123046875, "rewards/accuracy_reward/std": 0.4788636863231659, "rewards/brier_reward/mean": 0.5252399325370789, "rewards/brier_reward/std": 0.4370757818222046, "rewards/confidence_one_or_zero/mean": 0.43427734375, "rewards/confidence_one_or_zero/std": 0.4952123582363129, "rewards/format_reward/mean": 0.76083984375, "rewards/format_reward/std": 0.42635048627853395, "rewards/mean_confidence_reward/mean": 0.6130202889442444, "rewards/mean_confidence_reward/std": 0.3868469834327698, "step": 160, "step_time": 320.616255954816 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03603515625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3912.8, "completions/mean_length": 1148.70595703125, "completions/mean_terminated_length": 1038.7396850585938, "completions/min_length": 254.6, "completions/min_terminated_length": 254.6, "entropy": 0.3219002692261711, "epoch": 0.3525641025641026, "frac_reward_zero_std": 0.0, "grad_norm": 44.704288482666016, "learning_rate": 1.8716577540106954e-06, "loss": -0.0202, "num_tokens": 486130507.0, "reward": 2.67243070602417, "reward_std": 1.4341658115386964, "rewards/accuracy_reward/mean": 0.3478515625, "rewards/accuracy_reward/std": 0.4750068366527557, "rewards/brier_reward/mean": 0.5088487803936005, "rewards/brier_reward/std": 0.4378484785556793, "rewards/confidence_one_or_zero/mean": 0.446875, "rewards/confidence_one_or_zero/std": 0.4969118058681488, "rewards/format_reward/mean": 0.7537109375, "rewards/format_reward/std": 0.43048771023750304, "rewards/mean_confidence_reward/mean": 0.6151445508003235, "rewards/mean_confidence_reward/std": 0.38804330229759215, "step": 165, "step_time": 318.20381522698443 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04267578125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4009.8, "completions/mean_length": 1193.27939453125, "completions/mean_terminated_length": 1064.359521484375, "completions/min_length": 272.6, "completions/min_terminated_length": 272.6, "entropy": 0.31800271323882046, "epoch": 0.36324786324786323, "frac_reward_zero_std": 0.0, "grad_norm": 45.46564865112305, "learning_rate": 1.7379679144385028e-06, "loss": -0.0204, "num_tokens": 501104760.0, "reward": 2.635536003112793, "reward_std": 1.4441087245941162, "rewards/accuracy_reward/mean": 0.3525390625, "rewards/accuracy_reward/std": 0.4760962724685669, "rewards/brier_reward/mean": 0.5073639392852783, "rewards/brier_reward/std": 0.43809244632720945, "rewards/confidence_one_or_zero/mean": 0.433203125, "rewards/confidence_one_or_zero/std": 0.49548872113227843, "rewards/format_reward/mean": 0.745703125, "rewards/format_reward/std": 0.43517242670059203, "rewards/mean_confidence_reward/mean": 0.5967267632484436, "rewards/mean_confidence_reward/std": 0.3925954043865204, "step": 170, "step_time": 324.3902578342066 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03447265625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3978.8, "completions/mean_length": 1120.2951171875, "completions/mean_terminated_length": 1014.105224609375, "completions/min_length": 285.0, "completions/min_terminated_length": 285.0, "entropy": 0.3251201260834932, "epoch": 0.37393162393162394, "frac_reward_zero_std": 0.0, "grad_norm": 65.23611450195312, "learning_rate": 1.6042780748663103e-06, "loss": -0.0164, "num_tokens": 515338566.0, "reward": 2.6606284618377685, "reward_std": 1.4600170612335206, "rewards/accuracy_reward/mean": 0.36572265625, "rewards/accuracy_reward/std": 0.4810932517051697, "rewards/brier_reward/mean": 0.5115406513214111, "rewards/brier_reward/std": 0.43966758251190186, "rewards/confidence_one_or_zero/mean": 0.433203125, "rewards/confidence_one_or_zero/std": 0.4955389678478241, "rewards/format_reward/mean": 0.73984375, "rewards/format_reward/std": 0.43864802122116087, "rewards/mean_confidence_reward/mean": 0.6103182315826416, "rewards/mean_confidence_reward/std": 0.3892994046211243, "step": 175, "step_time": 320.5348702490388 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03662109375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3997.6, "completions/mean_length": 1140.8505859375, "completions/mean_terminated_length": 1028.3723876953125, "completions/min_length": 276.0, "completions/min_terminated_length": 276.0, "entropy": 0.32873620714526625, "epoch": 0.38461538461538464, "frac_reward_zero_std": 0.0, "grad_norm": 51.08501052856445, "learning_rate": 1.4705882352941177e-06, "loss": -0.0196, "num_tokens": 529769868.0, "reward": 2.6234814167022704, "reward_std": 1.4477176189422607, "rewards/accuracy_reward/mean": 0.3451171875, "rewards/accuracy_reward/std": 0.4743470072746277, "rewards/brier_reward/mean": 0.5132450461387634, "rewards/brier_reward/std": 0.4347148656845093, "rewards/confidence_one_or_zero/mean": 0.4205078125, "rewards/confidence_one_or_zero/std": 0.4931892991065979, "rewards/format_reward/mean": 0.7466796875, "rewards/format_reward/std": 0.43422102332115176, "rewards/mean_confidence_reward/mean": 0.5979317545890808, "rewards/mean_confidence_reward/std": 0.3880310356616974, "step": 180, "step_time": 325.9552943095856 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04052734375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4005.2, "completions/mean_length": 1181.13349609375, "completions/mean_terminated_length": 1058.2173706054687, "completions/min_length": 288.0, "completions/min_terminated_length": 288.0, "entropy": 0.31275777535047383, "epoch": 0.3952991452991453, "frac_reward_zero_std": 0.0, "grad_norm": 44.81126022338867, "learning_rate": 1.3368983957219254e-06, "loss": -0.0205, "num_tokens": 544664387.0, "reward": 2.5762894630432127, "reward_std": 1.4388552904129028, "rewards/accuracy_reward/mean": 0.3298828125, "rewards/accuracy_reward/std": 0.4654023349285126, "rewards/brier_reward/mean": 0.4998352527618408, "rewards/brier_reward/std": 0.4382630228996277, "rewards/confidence_one_or_zero/mean": 0.42275390625, "rewards/confidence_one_or_zero/std": 0.49179916381835936, "rewards/format_reward/mean": 0.73115234375, "rewards/format_reward/std": 0.4424052357673645, "rewards/mean_confidence_reward/mean": 0.5926651358604431, "rewards/mean_confidence_reward/std": 0.38963629603385924, "step": 185, "step_time": 407.50393955440376 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3929.2, "completions/mean_length": 1182.69365234375, "completions/mean_terminated_length": 1069.9430908203126, "completions/min_length": 270.2, "completions/min_terminated_length": 270.2, "entropy": 0.30875583661254496, "epoch": 0.405982905982906, "frac_reward_zero_std": 0.0, "grad_norm": 46.6525993347168, "learning_rate": 1.2032085561497326e-06, "loss": -0.0198, "num_tokens": 559514658.0, "reward": 2.5919751167297362, "reward_std": 1.4350115060806274, "rewards/accuracy_reward/mean": 0.3408203125, "rewards/accuracy_reward/std": 0.47263641357421876, "rewards/brier_reward/mean": 0.49980634450912476, "rewards/brier_reward/std": 0.4361814737319946, "rewards/confidence_one_or_zero/mean": 0.4193359375, "rewards/confidence_one_or_zero/std": 0.49343532919883726, "rewards/format_reward/mean": 0.73642578125, "rewards/format_reward/std": 0.4384405970573425, "rewards/mean_confidence_reward/mean": 0.5955868244171143, "rewards/mean_confidence_reward/std": 0.38822770714759824, "step": 190, "step_time": 322.8024162671703 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04228515625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3993.0, "completions/mean_length": 1174.65224609375, "completions/mean_terminated_length": 1046.3890502929687, "completions/min_length": 255.8, "completions/min_terminated_length": 255.8, "entropy": 0.31124953711405395, "epoch": 0.4166666666666667, "frac_reward_zero_std": 0.0, "grad_norm": 50.37832260131836, "learning_rate": 1.0695187165775401e-06, "loss": -0.0215, "num_tokens": 574310297.0, "reward": 2.6151120185852053, "reward_std": 1.4608880996704101, "rewards/accuracy_reward/mean": 0.344140625, "rewards/accuracy_reward/std": 0.4716655910015106, "rewards/brier_reward/mean": 0.5032954812049866, "rewards/brier_reward/std": 0.4398936152458191, "rewards/confidence_one_or_zero/mean": 0.43369140625, "rewards/confidence_one_or_zero/std": 0.4940564870834351, "rewards/format_reward/mean": 0.73154296875, "rewards/format_reward/std": 0.442363041639328, "rewards/mean_confidence_reward/mean": 0.6024415254592895, "rewards/mean_confidence_reward/std": 0.3903405725955963, "step": 195, "step_time": 321.9405225500348 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04658203125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3911.0, "completions/mean_length": 1195.96796875, "completions/mean_terminated_length": 1054.292431640625, "completions/min_length": 218.4, "completions/min_terminated_length": 218.4, "entropy": 0.3140326828230172, "epoch": 0.42735042735042733, "frac_reward_zero_std": 0.0, "grad_norm": 52.459930419921875, "learning_rate": 9.358288770053477e-07, "loss": -0.0244, "num_tokens": 589303217.0, "reward": 2.6150192737579347, "reward_std": 1.4392563343048095, "rewards/accuracy_reward/mean": 0.3431640625, "rewards/accuracy_reward/std": 0.47419439554214476, "rewards/brier_reward/mean": 0.4979334771633148, "rewards/brier_reward/std": 0.4386617362499237, "rewards/confidence_one_or_zero/mean": 0.43544921875, "rewards/confidence_one_or_zero/std": 0.49546384811401367, "rewards/format_reward/mean": 0.74296875, "rewards/format_reward/std": 0.43653143644332887, "rewards/mean_confidence_reward/mean": 0.5955037713050843, "rewards/mean_confidence_reward/std": 0.393673437833786, "step": 200, "step_time": 327.2914565466228 }, { "epoch": 0.42735042735042733, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_completions/clipped_ratio": 0.0439453125, "eval_completions/max_length": 3846.3125, "eval_completions/max_terminated_length": 2380.96875, "eval_completions/mean_length": 1170.236328125, "eval_completions/mean_terminated_length": 1035.2478408813477, "eval_completions/min_length": 453.4375, "eval_completions/min_terminated_length": 453.4375, "eval_entropy": 0.3072325438261032, "eval_frac_reward_zero_std": 1.0, "eval_loss": 0.0, "eval_num_tokens": 589303217.0, "eval_reward": 2.593014381825924, "eval_reward_std": 1.4711584821343422, "eval_rewards/accuracy_reward/mean": 0.341796875, "eval_rewards/accuracy_reward/std": 0.4742839252576232, "eval_rewards/brier_reward/mean": 0.4914909126237035, "eval_rewards/brier_reward/std": 0.4407998891547322, "eval_rewards/confidence_one_or_zero/mean": 0.447265625, "eval_rewards/confidence_one_or_zero/std": 0.498204636387527, "eval_rewards/format_reward/mean": 0.7216796875, "eval_rewards/format_reward/std": 0.44888558331876993, "eval_rewards/mean_confidence_reward/mean": 0.5907812491059303, "eval_rewards/mean_confidence_reward/std": 0.39370104763656855, "eval_runtime": 1185.0883, "eval_samples_per_second": 0.844, "eval_steps_per_second": 0.027, "step": 200 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0373046875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3964.4, "completions/mean_length": 1128.76904296875, "completions/mean_terminated_length": 1013.8509521484375, "completions/min_length": 235.8, "completions/min_terminated_length": 235.8, "entropy": 0.32033217654097823, "epoch": 0.43803418803418803, "frac_reward_zero_std": 0.0, "grad_norm": 109.52311706542969, "learning_rate": 8.021390374331551e-07, "loss": -0.014, "num_tokens": 603609268.0, "reward": 2.658170557022095, "reward_std": 1.431856918334961, "rewards/accuracy_reward/mean": 0.34990234375, "rewards/accuracy_reward/std": 0.4752007782459259, "rewards/brier_reward/mean": 0.5081121861934662, "rewards/brier_reward/std": 0.43636615872383117, "rewards/confidence_one_or_zero/mean": 0.44365234375, "rewards/confidence_one_or_zero/std": 0.49671694040298464, "rewards/format_reward/mean": 0.75224609375, "rewards/format_reward/std": 0.43108250498771666, "rewards/mean_confidence_reward/mean": 0.6042575478553772, "rewards/mean_confidence_reward/std": 0.38912311792373655, "step": 205, "step_time": 321.3963442307548 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0412109375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3887.4, "completions/mean_length": 1184.64619140625, "completions/mean_terminated_length": 1059.6198486328126, "completions/min_length": 246.8, "completions/min_terminated_length": 246.8, "entropy": 0.3036916059441864, "epoch": 0.44871794871794873, "frac_reward_zero_std": 0.0, "grad_norm": 46.13463592529297, "learning_rate": 6.684491978609627e-07, "loss": -0.0219, "num_tokens": 618507469.0, "reward": 2.5911818981170653, "reward_std": 1.4422379732131958, "rewards/accuracy_reward/mean": 0.33408203125, "rewards/accuracy_reward/std": 0.47096659541130065, "rewards/brier_reward/mean": 0.49200026988983153, "rewards/brier_reward/std": 0.43940954804420473, "rewards/confidence_one_or_zero/mean": 0.43505859375, "rewards/confidence_one_or_zero/std": 0.4954834520816803, "rewards/format_reward/mean": 0.73203125, "rewards/format_reward/std": 0.44260523915290834, "rewards/mean_confidence_reward/mean": 0.598009729385376, "rewards/mean_confidence_reward/std": 0.39167081713676455, "step": 210, "step_time": 323.0747571212065 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0435546875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3939.6, "completions/mean_length": 1168.0533203125, "completions/mean_terminated_length": 1034.6664672851562, "completions/min_length": 224.2, "completions/min_terminated_length": 224.2, "entropy": 0.31387688296381383, "epoch": 0.4594017094017094, "frac_reward_zero_std": 0.0, "grad_norm": 36.15897750854492, "learning_rate": 5.347593582887701e-07, "loss": -0.021, "num_tokens": 633201967.0, "reward": 2.620379829406738, "reward_std": 1.4509658813476562, "rewards/accuracy_reward/mean": 0.35732421875, "rewards/accuracy_reward/std": 0.4786747872829437, "rewards/brier_reward/mean": 0.5078815937042236, "rewards/brier_reward/std": 0.43832914233207704, "rewards/confidence_one_or_zero/mean": 0.4224609375, "rewards/confidence_one_or_zero/std": 0.49330766797065734, "rewards/format_reward/mean": 0.74013671875, "rewards/format_reward/std": 0.4384992718696594, "rewards/mean_confidence_reward/mean": 0.5925763964653015, "rewards/mean_confidence_reward/std": 0.3911791563034058, "step": 215, "step_time": 326.1934914130543 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04453125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4025.4, "completions/mean_length": 1179.8091796875, "completions/mean_terminated_length": 1044.0080932617188, "completions/min_length": 254.6, "completions/min_terminated_length": 254.6, "entropy": 0.3016074412036687, "epoch": 0.4700854700854701, "frac_reward_zero_std": 0.0, "grad_norm": 62.14570999145508, "learning_rate": 4.0106951871657757e-07, "loss": -0.0236, "num_tokens": 648016717.0, "reward": 2.6373492240905763, "reward_std": 1.4634708881378173, "rewards/accuracy_reward/mean": 0.35615234375, "rewards/accuracy_reward/std": 0.47809425592422483, "rewards/brier_reward/mean": 0.5045531094074249, "rewards/brier_reward/std": 0.44011043310165404, "rewards/confidence_one_or_zero/mean": 0.43154296875, "rewards/confidence_one_or_zero/std": 0.4952175259590149, "rewards/format_reward/mean": 0.7416015625, "rewards/format_reward/std": 0.43776689767837523, "rewards/mean_confidence_reward/mean": 0.6034992337226868, "rewards/mean_confidence_reward/std": 0.3924152433872223, "step": 220, "step_time": 321.48763779564763 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03720703125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3961.0, "completions/mean_length": 1166.6537109375, "completions/mean_terminated_length": 1053.6300415039063, "completions/min_length": 254.8, "completions/min_terminated_length": 254.8, "entropy": 0.30844552812632176, "epoch": 0.4807692307692308, "frac_reward_zero_std": 0.0, "grad_norm": 151.7078094482422, "learning_rate": 2.6737967914438503e-07, "loss": -0.0172, "num_tokens": 662686483.0, "reward": 2.641693115234375, "reward_std": 1.4303761720657349, "rewards/accuracy_reward/mean": 0.34609375, "rewards/accuracy_reward/std": 0.47535844445228576, "rewards/brier_reward/mean": 0.5199149966239929, "rewards/brier_reward/std": 0.4357679784297943, "rewards/confidence_one_or_zero/mean": 0.42568359375, "rewards/confidence_one_or_zero/std": 0.49414241313934326, "rewards/format_reward/mean": 0.7541015625, "rewards/format_reward/std": 0.4301507592201233, "rewards/mean_confidence_reward/mean": 0.5958992719650269, "rewards/mean_confidence_reward/std": 0.38701295852661133, "step": 225, "step_time": 327.222905562527 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.041796875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3919.0, "completions/mean_length": 1171.34111328125, "completions/mean_terminated_length": 1043.8849853515626, "completions/min_length": 235.4, "completions/min_terminated_length": 235.4, "entropy": 0.30160802758764477, "epoch": 0.49145299145299143, "frac_reward_zero_std": 0.0, "grad_norm": 126.87531280517578, "learning_rate": 1.3368983957219251e-07, "loss": -0.0223, "num_tokens": 677407768.0, "reward": 2.662746286392212, "reward_std": 1.4676513671875, "rewards/accuracy_reward/mean": 0.3689453125, "rewards/accuracy_reward/std": 0.4824755251407623, "rewards/brier_reward/mean": 0.515411776304245, "rewards/brier_reward/std": 0.43887125253677367, "rewards/confidence_one_or_zero/mean": 0.44208984375, "rewards/confidence_one_or_zero/std": 0.4962202250957489, "rewards/format_reward/mean": 0.742578125, "rewards/format_reward/std": 0.4369687378406525, "rewards/mean_confidence_reward/mean": 0.5937211871147156, "rewards/mean_confidence_reward/std": 0.39389788508415224, "step": 230, "step_time": 318.9965775484394 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.043212890625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4027.5, "completions/mean_length": 1166.7020263671875, "completions/mean_terminated_length": 1034.5452728271484, "completions/min_length": 155.0, "completions/min_terminated_length": 155.0, "entropy": 0.30643512052483857, "epoch": 0.5, "frac_reward_zero_std": 0.0, "num_tokens": 689170639.0, "reward": 2.711099922657013, "reward_std": 1.4795014560222626, "rewards/accuracy_reward/mean": 0.3792724609375, "rewards/accuracy_reward/std": 0.4842975437641144, "rewards/brier_reward/mean": 0.5229446142911911, "rewards/brier_reward/std": 0.4396687373518944, "rewards/confidence_one_or_zero/mean": 0.439453125, "rewards/confidence_one_or_zero/std": 0.49557578563690186, "rewards/format_reward/mean": 0.75439453125, "rewards/format_reward/std": 0.4301748499274254, "rewards/mean_confidence_reward/mean": 0.6150352358818054, "rewards/mean_confidence_reward/std": 0.388339601457119, "step": 234, "step_time": 323.7886903610197, "total_flos": 0.0, "train_loss": -0.004756694548150413, "train_runtime": 20325.6125, "train_samples_per_second": 0.738, "train_steps_per_second": 0.012 } ], "logging_steps": 5, "max_steps": 234, "num_input_tokens_seen": 689170639, "num_train_epochs": 1, "save_steps": 60, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }