| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 0.009894622272794735, |
| "eval_steps": 500, |
| "global_step": 100, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "completion_length": 6.0, |
| "epoch": 9.894622272794736e-05, |
| "grad_norm": 22.976070404052734, |
| "kl": 0.0, |
| "learning_rate": 1e-06, |
| "loss": -0.0, |
| "reward": 0.125, |
| "reward_std": 0.25, |
| "rewards/accuracy_reward": 0.125, |
| "rewards/format_reward": 0.0, |
| "step": 1 |
| }, |
| { |
| "completion_length": 6.5, |
| "epoch": 0.00019789244545589471, |
| "grad_norm": 32.8896369934082, |
| "kl": 0.0035400390625, |
| "learning_rate": 9.989999999999999e-07, |
| "loss": 0.0001, |
| "reward": 0.3125, |
| "reward_std": 0.5193375647068024, |
| "rewards/accuracy_reward": 0.3125, |
| "rewards/format_reward": 0.0, |
| "step": 2 |
| }, |
| { |
| "completion_length": 5.0625, |
| "epoch": 0.0002968386681838421, |
| "grad_norm": 45.44774627685547, |
| "kl": 0.00732421875, |
| "learning_rate": 9.98e-07, |
| "loss": 0.0003, |
| "reward": 0.3125, |
| "reward_std": 0.26933756470680237, |
| "rewards/accuracy_reward": 0.3125, |
| "rewards/format_reward": 0.0, |
| "step": 3 |
| }, |
| { |
| "completion_length": 6.25, |
| "epoch": 0.00039578489091178943, |
| "grad_norm": 35.005924224853516, |
| "kl": 0.003936767578125, |
| "learning_rate": 9.97e-07, |
| "loss": 0.0002, |
| "reward": 0.375, |
| "reward_std": 0.39433756470680237, |
| "rewards/accuracy_reward": 0.375, |
| "rewards/format_reward": 0.0, |
| "step": 4 |
| }, |
| { |
| "completion_length": 4.5625, |
| "epoch": 0.0004947311136397368, |
| "grad_norm": 39.57672882080078, |
| "kl": 0.00762176513671875, |
| "learning_rate": 9.959999999999999e-07, |
| "loss": 0.0003, |
| "reward": 0.625, |
| "reward_std": 0.39433756470680237, |
| "rewards/accuracy_reward": 0.625, |
| "rewards/format_reward": 0.0, |
| "step": 5 |
| }, |
| { |
| "completion_length": 4.125, |
| "epoch": 0.0005936773363676842, |
| "grad_norm": 23.2183837890625, |
| "kl": 0.03729248046875, |
| "learning_rate": 9.95e-07, |
| "loss": 0.0015, |
| "reward": 0.5625, |
| "reward_std": 0.375, |
| "rewards/accuracy_reward": 0.5625, |
| "rewards/format_reward": 0.0, |
| "step": 6 |
| }, |
| { |
| "completion_length": 3.3125, |
| "epoch": 0.0006926235590956315, |
| "grad_norm": 47.74429702758789, |
| "kl": 0.06170654296875, |
| "learning_rate": 9.94e-07, |
| "loss": 0.0025, |
| "reward": 0.4375, |
| "reward_std": 0.41367512941360474, |
| "rewards/accuracy_reward": 0.4375, |
| "rewards/format_reward": 0.0, |
| "step": 7 |
| }, |
| { |
| "completion_length": 3.8125, |
| "epoch": 0.0007915697818235789, |
| "grad_norm": 49.124691009521484, |
| "kl": 0.09912109375, |
| "learning_rate": 9.929999999999999e-07, |
| "loss": 0.004, |
| "reward": 0.3125, |
| "reward_std": 0.375, |
| "rewards/accuracy_reward": 0.3125, |
| "rewards/format_reward": 0.0, |
| "step": 8 |
| }, |
| { |
| "completion_length": 3.5625, |
| "epoch": 0.0008905160045515262, |
| "grad_norm": 43.116676330566406, |
| "kl": 0.02130126953125, |
| "learning_rate": 9.92e-07, |
| "loss": 0.0009, |
| "reward": 0.4375, |
| "reward_std": 0.5193375647068024, |
| "rewards/accuracy_reward": 0.4375, |
| "rewards/format_reward": 0.0, |
| "step": 9 |
| }, |
| { |
| "completion_length": 3.5625, |
| "epoch": 0.0009894622272794737, |
| "grad_norm": 42.24452209472656, |
| "kl": 0.030517578125, |
| "learning_rate": 9.91e-07, |
| "loss": 0.0012, |
| "reward": 0.4375, |
| "reward_std": 0.26933756470680237, |
| "rewards/accuracy_reward": 0.4375, |
| "rewards/format_reward": 0.0, |
| "step": 10 |
| }, |
| { |
| "completion_length": 4.5625, |
| "epoch": 0.001088408450007421, |
| "grad_norm": 9.293623924255371, |
| "kl": 0.386474609375, |
| "learning_rate": 9.9e-07, |
| "loss": 0.0155, |
| "reward": 0.75, |
| "reward_std": 0.25, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 11 |
| }, |
| { |
| "completion_length": 2.75, |
| "epoch": 0.0011873546727353683, |
| "grad_norm": 27.51582908630371, |
| "kl": 0.119140625, |
| "learning_rate": 9.89e-07, |
| "loss": 0.0048, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 12 |
| }, |
| { |
| "completion_length": 4.125, |
| "epoch": 0.0012863008954633157, |
| "grad_norm": 42.183692932128906, |
| "kl": 1.232391357421875, |
| "learning_rate": 9.88e-07, |
| "loss": 0.0494, |
| "reward": 0.375, |
| "reward_std": 0.39433756470680237, |
| "rewards/accuracy_reward": 0.375, |
| "rewards/format_reward": 0.0, |
| "step": 13 |
| }, |
| { |
| "completion_length": 3.75, |
| "epoch": 0.001385247118191263, |
| "grad_norm": 16.871009826660156, |
| "kl": 0.02880859375, |
| "learning_rate": 9.87e-07, |
| "loss": 0.0012, |
| "reward": 0.8125, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.8125, |
| "rewards/format_reward": 0.0, |
| "step": 14 |
| }, |
| { |
| "completion_length": 3.1875, |
| "epoch": 0.0014841933409192104, |
| "grad_norm": 9.070819854736328, |
| "kl": 0.31671142578125, |
| "learning_rate": 9.86e-07, |
| "loss": 0.0127, |
| "reward": 0.5, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.5, |
| "rewards/format_reward": 0.0, |
| "step": 15 |
| }, |
| { |
| "completion_length": 3.875, |
| "epoch": 0.0015831395636471577, |
| "grad_norm": 34.1285285949707, |
| "kl": 0.1123046875, |
| "learning_rate": 9.849999999999999e-07, |
| "loss": 0.0045, |
| "reward": 0.8125, |
| "reward_std": 0.26933756470680237, |
| "rewards/accuracy_reward": 0.8125, |
| "rewards/format_reward": 0.0, |
| "step": 16 |
| }, |
| { |
| "completion_length": 4.5, |
| "epoch": 0.001682085786375105, |
| "grad_norm": 28.27692985534668, |
| "kl": 0.06103515625, |
| "learning_rate": 9.84e-07, |
| "loss": 0.0024, |
| "reward": 0.375, |
| "reward_std": 0.14433756470680237, |
| "rewards/accuracy_reward": 0.375, |
| "rewards/format_reward": 0.0, |
| "step": 17 |
| }, |
| { |
| "completion_length": 3.625, |
| "epoch": 0.0017810320091030524, |
| "grad_norm": 43.93234634399414, |
| "kl": 0.04833984375, |
| "learning_rate": 9.83e-07, |
| "loss": 0.0019, |
| "reward": 0.4375, |
| "reward_std": 0.375, |
| "rewards/accuracy_reward": 0.4375, |
| "rewards/format_reward": 0.0, |
| "step": 18 |
| }, |
| { |
| "completion_length": 4.875, |
| "epoch": 0.001879978231831, |
| "grad_norm": 35.52457046508789, |
| "kl": 0.1285400390625, |
| "learning_rate": 9.819999999999999e-07, |
| "loss": 0.0052, |
| "reward": 0.25, |
| "reward_std": 0.25, |
| "rewards/accuracy_reward": 0.25, |
| "rewards/format_reward": 0.0, |
| "step": 19 |
| }, |
| { |
| "completion_length": 4.6875, |
| "epoch": 0.0019789244545589473, |
| "grad_norm": 5.439634799957275, |
| "kl": 0.283935546875, |
| "learning_rate": 9.81e-07, |
| "loss": 0.0114, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 20 |
| }, |
| { |
| "completion_length": 2.875, |
| "epoch": 0.0020778706772868944, |
| "grad_norm": 35.29671859741211, |
| "kl": 0.076904296875, |
| "learning_rate": 9.8e-07, |
| "loss": 0.0031, |
| "reward": 0.75, |
| "reward_std": 0.25, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 21 |
| }, |
| { |
| "completion_length": 3.1875, |
| "epoch": 0.002176816900014842, |
| "grad_norm": 0.33881574869155884, |
| "kl": 0.03955078125, |
| "learning_rate": 9.789999999999999e-07, |
| "loss": 0.0016, |
| "reward": 0.5, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.5, |
| "rewards/format_reward": 0.0, |
| "step": 22 |
| }, |
| { |
| "completion_length": 3.875, |
| "epoch": 0.002275763122742789, |
| "grad_norm": 18.542280197143555, |
| "kl": 0.13916015625, |
| "learning_rate": 9.78e-07, |
| "loss": 0.0056, |
| "reward": 0.875, |
| "reward_std": 0.14433756470680237, |
| "rewards/accuracy_reward": 0.875, |
| "rewards/format_reward": 0.0, |
| "step": 23 |
| }, |
| { |
| "completion_length": 3.9375, |
| "epoch": 0.0023747093454707367, |
| "grad_norm": 22.113807678222656, |
| "kl": 0.46295166015625, |
| "learning_rate": 9.77e-07, |
| "loss": 0.0185, |
| "reward": 0.5625, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.5625, |
| "rewards/format_reward": 0.0, |
| "step": 24 |
| }, |
| { |
| "completion_length": 2.875, |
| "epoch": 0.002473655568198684, |
| "grad_norm": 28.871366500854492, |
| "kl": 0.0540771484375, |
| "learning_rate": 9.759999999999998e-07, |
| "loss": 0.0022, |
| "reward": 0.75, |
| "reward_std": 0.25, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 25 |
| }, |
| { |
| "completion_length": 2.75, |
| "epoch": 0.0025726017909266314, |
| "grad_norm": 13.429852485656738, |
| "kl": 0.0830078125, |
| "learning_rate": 9.75e-07, |
| "loss": 0.0033, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 26 |
| }, |
| { |
| "completion_length": 3.3125, |
| "epoch": 0.002671548013654579, |
| "grad_norm": 25.259496688842773, |
| "kl": 0.08380126953125, |
| "learning_rate": 9.74e-07, |
| "loss": 0.0034, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 27 |
| }, |
| { |
| "completion_length": 4.6875, |
| "epoch": 0.002770494236382526, |
| "grad_norm": 35.60582733154297, |
| "kl": 0.017974853515625, |
| "learning_rate": 9.729999999999998e-07, |
| "loss": 0.0007, |
| "reward": 0.875, |
| "reward_std": 0.14433756470680237, |
| "rewards/accuracy_reward": 0.875, |
| "rewards/format_reward": 0.0, |
| "step": 28 |
| }, |
| { |
| "completion_length": 2.625, |
| "epoch": 0.0028694404591104736, |
| "grad_norm": 35.21329116821289, |
| "kl": 0.107421875, |
| "learning_rate": 9.72e-07, |
| "loss": 0.0043, |
| "reward": 0.625, |
| "reward_std": 0.25, |
| "rewards/accuracy_reward": 0.625, |
| "rewards/format_reward": 0.0, |
| "step": 29 |
| }, |
| { |
| "completion_length": 3.4375, |
| "epoch": 0.0029683866818384207, |
| "grad_norm": 41.33916091918945, |
| "kl": 0.14288330078125, |
| "learning_rate": 9.709999999999999e-07, |
| "loss": 0.0057, |
| "reward": 0.8125, |
| "reward_std": 0.26933756470680237, |
| "rewards/accuracy_reward": 0.8125, |
| "rewards/format_reward": 0.0, |
| "step": 30 |
| }, |
| { |
| "completion_length": 3.1875, |
| "epoch": 0.0030673329045663683, |
| "grad_norm": 35.675777435302734, |
| "kl": 0.1474609375, |
| "learning_rate": 9.7e-07, |
| "loss": 0.0059, |
| "reward": 0.625, |
| "reward_std": 0.25, |
| "rewards/accuracy_reward": 0.625, |
| "rewards/format_reward": 0.0, |
| "step": 31 |
| }, |
| { |
| "completion_length": 4.0, |
| "epoch": 0.0031662791272943154, |
| "grad_norm": 18.264066696166992, |
| "kl": 0.087646484375, |
| "learning_rate": 9.69e-07, |
| "loss": 0.0035, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 32 |
| }, |
| { |
| "completion_length": 3.5, |
| "epoch": 0.003265225350022263, |
| "grad_norm": 0.011650191619992256, |
| "kl": 0.0262451171875, |
| "learning_rate": 9.679999999999999e-07, |
| "loss": 0.001, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 33 |
| }, |
| { |
| "completion_length": 3.5, |
| "epoch": 0.00336417157275021, |
| "grad_norm": 52.62285614013672, |
| "kl": 0.115966796875, |
| "learning_rate": 9.67e-07, |
| "loss": 0.0046, |
| "reward": 0.5625, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.5625, |
| "rewards/format_reward": 0.0, |
| "step": 34 |
| }, |
| { |
| "completion_length": 3.625, |
| "epoch": 0.0034631177954781577, |
| "grad_norm": 82.99117279052734, |
| "kl": 3.158203125, |
| "learning_rate": 9.66e-07, |
| "loss": 0.1264, |
| "reward": 0.4375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.4375, |
| "rewards/format_reward": 0.0, |
| "step": 35 |
| }, |
| { |
| "completion_length": 2.4375, |
| "epoch": 0.003562064018206105, |
| "grad_norm": 33.630123138427734, |
| "kl": 0.109375, |
| "learning_rate": 9.649999999999999e-07, |
| "loss": 0.0044, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 36 |
| }, |
| { |
| "completion_length": 3.1875, |
| "epoch": 0.0036610102409340524, |
| "grad_norm": 31.628652572631836, |
| "kl": 0.61328125, |
| "learning_rate": 9.64e-07, |
| "loss": 0.0246, |
| "reward": 0.625, |
| "reward_std": 0.14433756470680237, |
| "rewards/accuracy_reward": 0.625, |
| "rewards/format_reward": 0.0, |
| "step": 37 |
| }, |
| { |
| "completion_length": 4.1875, |
| "epoch": 0.003759956463662, |
| "grad_norm": 19.04951286315918, |
| "kl": 0.2353515625, |
| "learning_rate": 9.63e-07, |
| "loss": 0.0095, |
| "reward": 0.8125, |
| "reward_std": 0.26933756470680237, |
| "rewards/accuracy_reward": 0.8125, |
| "rewards/format_reward": 0.0, |
| "step": 38 |
| }, |
| { |
| "completion_length": 4.3125, |
| "epoch": 0.003858902686389947, |
| "grad_norm": 26.543506622314453, |
| "kl": 0.0684814453125, |
| "learning_rate": 9.619999999999999e-07, |
| "loss": 0.0027, |
| "reward": 0.875, |
| "reward_std": 0.25, |
| "rewards/accuracy_reward": 0.875, |
| "rewards/format_reward": 0.0, |
| "step": 39 |
| }, |
| { |
| "completion_length": 4.0, |
| "epoch": 0.003957848909117895, |
| "grad_norm": 13.690553665161133, |
| "kl": 0.13409423828125, |
| "learning_rate": 9.61e-07, |
| "loss": 0.0054, |
| "reward": 0.5625, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.5625, |
| "rewards/format_reward": 0.0, |
| "step": 40 |
| }, |
| { |
| "completion_length": 3.6875, |
| "epoch": 0.004056795131845842, |
| "grad_norm": 13.923758506774902, |
| "kl": 0.0458984375, |
| "learning_rate": 9.6e-07, |
| "loss": 0.0018, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 41 |
| }, |
| { |
| "completion_length": 5.875, |
| "epoch": 0.004155741354573789, |
| "grad_norm": 18.20030403137207, |
| "kl": 0.115478515625, |
| "learning_rate": 9.589999999999998e-07, |
| "loss": 0.0046, |
| "reward": 0.625, |
| "reward_std": 0.14433756470680237, |
| "rewards/accuracy_reward": 0.625, |
| "rewards/format_reward": 0.0, |
| "step": 42 |
| }, |
| { |
| "completion_length": 2.75, |
| "epoch": 0.004254687577301737, |
| "grad_norm": 43.371185302734375, |
| "kl": 0.097412109375, |
| "learning_rate": 9.58e-07, |
| "loss": 0.0039, |
| "reward": 0.625, |
| "reward_std": 0.14433756470680237, |
| "rewards/accuracy_reward": 0.625, |
| "rewards/format_reward": 0.0, |
| "step": 43 |
| }, |
| { |
| "completion_length": 3.1875, |
| "epoch": 0.004353633800029684, |
| "grad_norm": 69.18988037109375, |
| "kl": 0.15380859375, |
| "learning_rate": 9.57e-07, |
| "loss": 0.0062, |
| "reward": 0.5625, |
| "reward_std": 0.26933756470680237, |
| "rewards/accuracy_reward": 0.5625, |
| "rewards/format_reward": 0.0, |
| "step": 44 |
| }, |
| { |
| "completion_length": 3.5, |
| "epoch": 0.004452580022757631, |
| "grad_norm": 42.821083068847656, |
| "kl": 0.29052734375, |
| "learning_rate": 9.559999999999998e-07, |
| "loss": 0.0116, |
| "reward": 0.8125, |
| "reward_std": 0.26933756470680237, |
| "rewards/accuracy_reward": 0.8125, |
| "rewards/format_reward": 0.0, |
| "step": 45 |
| }, |
| { |
| "completion_length": 2.75, |
| "epoch": 0.004551526245485578, |
| "grad_norm": 0.00253496621735394, |
| "kl": 0.042724609375, |
| "learning_rate": 9.55e-07, |
| "loss": 0.0017, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 46 |
| }, |
| { |
| "completion_length": 2.75, |
| "epoch": 0.004650472468213526, |
| "grad_norm": 28.470979690551758, |
| "kl": 0.1875, |
| "learning_rate": 9.539999999999999e-07, |
| "loss": 0.0075, |
| "reward": 0.6875, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.6875, |
| "rewards/format_reward": 0.0, |
| "step": 47 |
| }, |
| { |
| "completion_length": 3.125, |
| "epoch": 0.004749418690941473, |
| "grad_norm": 78.60997772216797, |
| "kl": 0.44921875, |
| "learning_rate": 9.529999999999999e-07, |
| "loss": 0.018, |
| "reward": 0.8125, |
| "reward_std": 0.26933756470680237, |
| "rewards/accuracy_reward": 0.8125, |
| "rewards/format_reward": 0.0, |
| "step": 48 |
| }, |
| { |
| "completion_length": 3.5, |
| "epoch": 0.0048483649136694205, |
| "grad_norm": 0.15050888061523438, |
| "kl": 0.028778076171875, |
| "learning_rate": 9.52e-07, |
| "loss": 0.0011, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 49 |
| }, |
| { |
| "completion_length": 3.6875, |
| "epoch": 0.004947311136397368, |
| "grad_norm": 8.970772743225098, |
| "kl": 0.3662109375, |
| "learning_rate": 9.509999999999999e-07, |
| "loss": 0.0146, |
| "reward": 0.4375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.4375, |
| "rewards/format_reward": 0.0, |
| "step": 50 |
| }, |
| { |
| "completion_length": 3.5, |
| "epoch": 0.005046257359125316, |
| "grad_norm": 42.177669525146484, |
| "kl": 0.20263671875, |
| "learning_rate": 9.499999999999999e-07, |
| "loss": 0.0081, |
| "reward": 0.875, |
| "reward_std": 0.14433756470680237, |
| "rewards/accuracy_reward": 0.875, |
| "rewards/format_reward": 0.0, |
| "step": 51 |
| }, |
| { |
| "completion_length": 3.125, |
| "epoch": 0.005145203581853263, |
| "grad_norm": 11.261039733886719, |
| "kl": 0.14239501953125, |
| "learning_rate": 9.489999999999999e-07, |
| "loss": 0.0057, |
| "reward": 0.6875, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.6875, |
| "rewards/format_reward": 0.0, |
| "step": 52 |
| }, |
| { |
| "completion_length": 3.25, |
| "epoch": 0.00524414980458121, |
| "grad_norm": 0.3226803243160248, |
| "kl": 0.0335235595703125, |
| "learning_rate": 9.479999999999999e-07, |
| "loss": 0.0013, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 53 |
| }, |
| { |
| "completion_length": 2.9375, |
| "epoch": 0.005343096027309158, |
| "grad_norm": 27.19357681274414, |
| "kl": 0.1173553466796875, |
| "learning_rate": 9.469999999999999e-07, |
| "loss": 0.0047, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 54 |
| }, |
| { |
| "completion_length": 2.25, |
| "epoch": 0.005442042250037105, |
| "grad_norm": 0.14267660677433014, |
| "kl": 0.0958251953125, |
| "learning_rate": 9.459999999999999e-07, |
| "loss": 0.0038, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 55 |
| }, |
| { |
| "completion_length": 3.125, |
| "epoch": 0.005540988472765052, |
| "grad_norm": 1.3845109939575195, |
| "kl": 0.070556640625, |
| "learning_rate": 9.45e-07, |
| "loss": 0.0028, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 56 |
| }, |
| { |
| "completion_length": 3.5, |
| "epoch": 0.005639934695492999, |
| "grad_norm": 0.3318254351615906, |
| "kl": 0.07275390625, |
| "learning_rate": 9.439999999999999e-07, |
| "loss": 0.0029, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 57 |
| }, |
| { |
| "completion_length": 3.5, |
| "epoch": 0.005738880918220947, |
| "grad_norm": 79.56658172607422, |
| "kl": 0.147705078125, |
| "learning_rate": 9.429999999999999e-07, |
| "loss": 0.0059, |
| "reward": 0.625, |
| "reward_std": 0.14433756470680237, |
| "rewards/accuracy_reward": 0.625, |
| "rewards/format_reward": 0.0, |
| "step": 58 |
| }, |
| { |
| "completion_length": 3.25, |
| "epoch": 0.005837827140948894, |
| "grad_norm": 29.595632553100586, |
| "kl": 0.08984375, |
| "learning_rate": 9.419999999999999e-07, |
| "loss": 0.0036, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 59 |
| }, |
| { |
| "completion_length": 3.375, |
| "epoch": 0.0059367733636768415, |
| "grad_norm": 1.569680094718933, |
| "kl": 0.1719970703125, |
| "learning_rate": 9.409999999999999e-07, |
| "loss": 0.0069, |
| "reward": 0.5, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.5, |
| "rewards/format_reward": 0.0, |
| "step": 60 |
| }, |
| { |
| "completion_length": 3.4375, |
| "epoch": 0.006035719586404789, |
| "grad_norm": 20.28252601623535, |
| "kl": 0.01580810546875, |
| "learning_rate": 9.399999999999999e-07, |
| "loss": 0.0006, |
| "reward": 0.6875, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.6875, |
| "rewards/format_reward": 0.0, |
| "step": 61 |
| }, |
| { |
| "completion_length": 4.0, |
| "epoch": 0.006134665809132737, |
| "grad_norm": 0.009604735299944878, |
| "kl": 0.016845703125, |
| "learning_rate": 9.389999999999999e-07, |
| "loss": 0.0007, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 62 |
| }, |
| { |
| "completion_length": 3.0, |
| "epoch": 0.006233612031860684, |
| "grad_norm": 0.054051682353019714, |
| "kl": 0.1220703125, |
| "learning_rate": 9.379999999999998e-07, |
| "loss": 0.0049, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 63 |
| }, |
| { |
| "completion_length": 3.25, |
| "epoch": 0.006332558254588631, |
| "grad_norm": 43.524681091308594, |
| "kl": 0.41552734375, |
| "learning_rate": 9.37e-07, |
| "loss": 0.0166, |
| "reward": 0.5625, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.5625, |
| "rewards/format_reward": 0.0, |
| "step": 64 |
| }, |
| { |
| "completion_length": 3.3125, |
| "epoch": 0.006431504477316579, |
| "grad_norm": 19.583276748657227, |
| "kl": 0.4501953125, |
| "learning_rate": 9.36e-07, |
| "loss": 0.018, |
| "reward": 0.6875, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.6875, |
| "rewards/format_reward": 0.0, |
| "step": 65 |
| }, |
| { |
| "completion_length": 3.5, |
| "epoch": 0.006530450700044526, |
| "grad_norm": 29.74109649658203, |
| "kl": 0.42333984375, |
| "learning_rate": 9.35e-07, |
| "loss": 0.0169, |
| "reward": 0.625, |
| "reward_std": 0.25, |
| "rewards/accuracy_reward": 0.625, |
| "rewards/format_reward": 0.0, |
| "step": 66 |
| }, |
| { |
| "completion_length": 3.5625, |
| "epoch": 0.006629396922772473, |
| "grad_norm": 51.01466369628906, |
| "kl": 0.45574951171875, |
| "learning_rate": 9.34e-07, |
| "loss": 0.0182, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 67 |
| }, |
| { |
| "completion_length": 2.875, |
| "epoch": 0.00672834314550042, |
| "grad_norm": 40.87276840209961, |
| "kl": 0.11376953125, |
| "learning_rate": 9.33e-07, |
| "loss": 0.0046, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 68 |
| }, |
| { |
| "completion_length": 4.375, |
| "epoch": 0.006827289368228368, |
| "grad_norm": 920.1598510742188, |
| "kl": 30.021240234375, |
| "learning_rate": 9.32e-07, |
| "loss": 1.1998, |
| "reward": 0.6875, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.6875, |
| "rewards/format_reward": 0.0, |
| "step": 69 |
| }, |
| { |
| "completion_length": 3.25, |
| "epoch": 0.006926235590956315, |
| "grad_norm": 0.07895195484161377, |
| "kl": 0.0203857421875, |
| "learning_rate": 9.31e-07, |
| "loss": 0.0008, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 70 |
| }, |
| { |
| "completion_length": 2.9375, |
| "epoch": 0.0070251818136842625, |
| "grad_norm": 72.71320343017578, |
| "kl": 0.9306640625, |
| "learning_rate": 9.3e-07, |
| "loss": 0.0373, |
| "reward": 0.6875, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.6875, |
| "rewards/format_reward": 0.0, |
| "step": 71 |
| }, |
| { |
| "completion_length": 3.5, |
| "epoch": 0.00712412803641221, |
| "grad_norm": 0.04532546177506447, |
| "kl": 0.07568359375, |
| "learning_rate": 9.29e-07, |
| "loss": 0.003, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 72 |
| }, |
| { |
| "completion_length": 3.5, |
| "epoch": 0.007223074259140158, |
| "grad_norm": 59.64799118041992, |
| "kl": 0.309326171875, |
| "learning_rate": 9.28e-07, |
| "loss": 0.0123, |
| "reward": 0.625, |
| "reward_std": 0.14433756470680237, |
| "rewards/accuracy_reward": 0.625, |
| "rewards/format_reward": 0.0, |
| "step": 73 |
| }, |
| { |
| "completion_length": 4.25, |
| "epoch": 0.007322020481868105, |
| "grad_norm": 0.022819090634584427, |
| "kl": 0.129150390625, |
| "learning_rate": 9.27e-07, |
| "loss": 0.0052, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 74 |
| }, |
| { |
| "completion_length": 2.5, |
| "epoch": 0.007420966704596052, |
| "grad_norm": 0.4349958598613739, |
| "kl": 0.1767578125, |
| "learning_rate": 9.26e-07, |
| "loss": 0.0071, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 75 |
| }, |
| { |
| "completion_length": 3.25, |
| "epoch": 0.007519912927324, |
| "grad_norm": 0.9703753590583801, |
| "kl": 0.1021728515625, |
| "learning_rate": 9.25e-07, |
| "loss": 0.0041, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 76 |
| }, |
| { |
| "completion_length": 3.6875, |
| "epoch": 0.007618859150051947, |
| "grad_norm": 0.20156638324260712, |
| "kl": 0.0416259765625, |
| "learning_rate": 9.24e-07, |
| "loss": 0.0017, |
| "reward": 0.5, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.5, |
| "rewards/format_reward": 0.0, |
| "step": 77 |
| }, |
| { |
| "completion_length": 3.0, |
| "epoch": 0.007717805372779894, |
| "grad_norm": 0.1729861944913864, |
| "kl": 0.1273193359375, |
| "learning_rate": 9.23e-07, |
| "loss": 0.0051, |
| "reward": 0.5, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.5, |
| "rewards/format_reward": 0.0, |
| "step": 78 |
| }, |
| { |
| "completion_length": 2.75, |
| "epoch": 0.007816751595507841, |
| "grad_norm": 0.019643617793917656, |
| "kl": 0.0714111328125, |
| "learning_rate": 9.22e-07, |
| "loss": 0.0029, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 79 |
| }, |
| { |
| "completion_length": 3.25, |
| "epoch": 0.00791569781823579, |
| "grad_norm": 0.017483701929450035, |
| "kl": 0.23956298828125, |
| "learning_rate": 9.21e-07, |
| "loss": 0.0096, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 80 |
| }, |
| { |
| "completion_length": 3.75, |
| "epoch": 0.008014644040963735, |
| "grad_norm": 0.02477215975522995, |
| "kl": 0.056396484375, |
| "learning_rate": 9.2e-07, |
| "loss": 0.0023, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 81 |
| }, |
| { |
| "completion_length": 2.25, |
| "epoch": 0.008113590263691683, |
| "grad_norm": 57.296180725097656, |
| "kl": 0.0313720703125, |
| "learning_rate": 9.19e-07, |
| "loss": 0.0013, |
| "reward": 0.875, |
| "reward_std": 0.14433756470680237, |
| "rewards/accuracy_reward": 0.875, |
| "rewards/format_reward": 0.0, |
| "step": 82 |
| }, |
| { |
| "completion_length": 2.75, |
| "epoch": 0.008212536486419631, |
| "grad_norm": 0.0005820893566124141, |
| "kl": 0.030029296875, |
| "learning_rate": 9.18e-07, |
| "loss": 0.0012, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 83 |
| }, |
| { |
| "completion_length": 2.75, |
| "epoch": 0.008311482709147578, |
| "grad_norm": 0.007898775860667229, |
| "kl": 0.0718994140625, |
| "learning_rate": 9.17e-07, |
| "loss": 0.0029, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 84 |
| }, |
| { |
| "completion_length": 5.25, |
| "epoch": 0.008410428931875526, |
| "grad_norm": 17.927873611450195, |
| "kl": 0.056640625, |
| "learning_rate": 9.16e-07, |
| "loss": 0.0023, |
| "reward": 0.8125, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.8125, |
| "rewards/format_reward": 0.0, |
| "step": 85 |
| }, |
| { |
| "completion_length": 2.9375, |
| "epoch": 0.008509375154603474, |
| "grad_norm": 0.6610168814659119, |
| "kl": 0.05419921875, |
| "learning_rate": 9.15e-07, |
| "loss": 0.0022, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 86 |
| }, |
| { |
| "completion_length": 6.0625, |
| "epoch": 0.00860832137733142, |
| "grad_norm": 35.296607971191406, |
| "kl": 1.230712890625, |
| "learning_rate": 9.14e-07, |
| "loss": 0.0497, |
| "reward": 0.625, |
| "reward_std": 0.25, |
| "rewards/accuracy_reward": 0.625, |
| "rewards/format_reward": 0.0, |
| "step": 87 |
| }, |
| { |
| "completion_length": 2.5, |
| "epoch": 0.008707267600059368, |
| "grad_norm": 0.06378056854009628, |
| "kl": 0.06463623046875, |
| "learning_rate": 9.13e-07, |
| "loss": 0.0026, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 88 |
| }, |
| { |
| "completion_length": 3.1875, |
| "epoch": 0.008806213822787316, |
| "grad_norm": 227.54002380371094, |
| "kl": 0.4443359375, |
| "learning_rate": 9.12e-07, |
| "loss": 0.0178, |
| "reward": 0.4375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.4375, |
| "rewards/format_reward": 0.0, |
| "step": 89 |
| }, |
| { |
| "completion_length": 2.75, |
| "epoch": 0.008905160045515262, |
| "grad_norm": 0.0024500866420567036, |
| "kl": 0.0645751953125, |
| "learning_rate": 9.109999999999999e-07, |
| "loss": 0.0026, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 90 |
| }, |
| { |
| "completion_length": 3.0, |
| "epoch": 0.00900410626824321, |
| "grad_norm": 33.444313049316406, |
| "kl": 0.10693359375, |
| "learning_rate": 9.1e-07, |
| "loss": 0.0043, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 91 |
| }, |
| { |
| "completion_length": 3.6875, |
| "epoch": 0.009103052490971156, |
| "grad_norm": 19.867097854614258, |
| "kl": 0.14208984375, |
| "learning_rate": 9.09e-07, |
| "loss": 0.0057, |
| "reward": 0.6875, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.6875, |
| "rewards/format_reward": 0.0, |
| "step": 92 |
| }, |
| { |
| "completion_length": 3.625, |
| "epoch": 0.009201998713699104, |
| "grad_norm": 3.6420788764953613, |
| "kl": 0.177490234375, |
| "learning_rate": 9.08e-07, |
| "loss": 0.0071, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 93 |
| }, |
| { |
| "completion_length": 2.0, |
| "epoch": 0.009300944936427052, |
| "grad_norm": 0.008027822710573673, |
| "kl": 0.13671875, |
| "learning_rate": 9.07e-07, |
| "loss": 0.0055, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 94 |
| }, |
| { |
| "completion_length": 3.625, |
| "epoch": 0.009399891159154999, |
| "grad_norm": 51.053592681884766, |
| "kl": 0.162353515625, |
| "learning_rate": 9.06e-07, |
| "loss": 0.0065, |
| "reward": 0.8125, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.8125, |
| "rewards/format_reward": 0.0, |
| "step": 95 |
| }, |
| { |
| "completion_length": 2.5, |
| "epoch": 0.009498837381882947, |
| "grad_norm": 0.0023729894310235977, |
| "kl": 0.025390625, |
| "learning_rate": 9.05e-07, |
| "loss": 0.001, |
| "reward": 1.0, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 1.0, |
| "rewards/format_reward": 0.0, |
| "step": 96 |
| }, |
| { |
| "completion_length": 3.0, |
| "epoch": 0.009597783604610895, |
| "grad_norm": 0.1433296650648117, |
| "kl": 0.1759033203125, |
| "learning_rate": 9.039999999999999e-07, |
| "loss": 0.0071, |
| "reward": 0.75, |
| "reward_std": 0.0, |
| "rewards/accuracy_reward": 0.75, |
| "rewards/format_reward": 0.0, |
| "step": 97 |
| }, |
| { |
| "completion_length": 3.25, |
| "epoch": 0.009696729827338841, |
| "grad_norm": 46.357540130615234, |
| "kl": 0.344024658203125, |
| "learning_rate": 9.03e-07, |
| "loss": 0.0137, |
| "reward": 0.9375, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.9375, |
| "rewards/format_reward": 0.0, |
| "step": 98 |
| }, |
| { |
| "completion_length": 4.5625, |
| "epoch": 0.009795676050066789, |
| "grad_norm": 25.5620059967041, |
| "kl": 0.1181640625, |
| "learning_rate": 9.02e-07, |
| "loss": 0.0047, |
| "reward": 0.625, |
| "reward_std": 0.25, |
| "rewards/accuracy_reward": 0.625, |
| "rewards/format_reward": 0.0, |
| "step": 99 |
| }, |
| { |
| "completion_length": 3.8125, |
| "epoch": 0.009894622272794735, |
| "grad_norm": 31.894678115844727, |
| "kl": 0.300445556640625, |
| "learning_rate": 9.01e-07, |
| "loss": 0.012, |
| "reward": 0.3125, |
| "reward_std": 0.125, |
| "rewards/accuracy_reward": 0.3125, |
| "rewards/format_reward": 0.0, |
| "step": 100 |
| } |
| ], |
| "logging_steps": 1, |
| "max_steps": 1000, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 1, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 0.0, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|