{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.009894622272794735, "eval_steps": 500, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "completion_length": 6.0, "epoch": 9.894622272794736e-05, "grad_norm": 22.976070404052734, "kl": 0.0, "learning_rate": 1e-06, "loss": -0.0, "reward": 0.125, "reward_std": 0.25, "rewards/accuracy_reward": 0.125, "rewards/format_reward": 0.0, "step": 1 }, { "completion_length": 6.5, "epoch": 0.00019789244545589471, "grad_norm": 32.8896369934082, "kl": 0.0035400390625, "learning_rate": 9.989999999999999e-07, "loss": 0.0001, "reward": 0.3125, "reward_std": 0.5193375647068024, "rewards/accuracy_reward": 0.3125, "rewards/format_reward": 0.0, "step": 2 }, { "completion_length": 5.0625, "epoch": 0.0002968386681838421, "grad_norm": 45.44774627685547, "kl": 0.00732421875, "learning_rate": 9.98e-07, "loss": 0.0003, "reward": 0.3125, "reward_std": 0.26933756470680237, "rewards/accuracy_reward": 0.3125, "rewards/format_reward": 0.0, "step": 3 }, { "completion_length": 6.25, "epoch": 0.00039578489091178943, "grad_norm": 35.005924224853516, "kl": 0.003936767578125, "learning_rate": 9.97e-07, "loss": 0.0002, "reward": 0.375, "reward_std": 0.39433756470680237, "rewards/accuracy_reward": 0.375, "rewards/format_reward": 0.0, "step": 4 }, { "completion_length": 4.5625, "epoch": 0.0004947311136397368, "grad_norm": 39.57672882080078, "kl": 0.00762176513671875, "learning_rate": 9.959999999999999e-07, "loss": 0.0003, "reward": 0.625, "reward_std": 0.39433756470680237, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.0, "step": 5 }, { "completion_length": 4.125, "epoch": 0.0005936773363676842, "grad_norm": 23.2183837890625, "kl": 0.03729248046875, "learning_rate": 9.95e-07, "loss": 0.0015, "reward": 0.5625, "reward_std": 0.375, "rewards/accuracy_reward": 0.5625, "rewards/format_reward": 0.0, "step": 6 }, { "completion_length": 3.3125, "epoch": 0.0006926235590956315, "grad_norm": 47.74429702758789, "kl": 0.06170654296875, "learning_rate": 9.94e-07, "loss": 0.0025, "reward": 0.4375, "reward_std": 0.41367512941360474, "rewards/accuracy_reward": 0.4375, "rewards/format_reward": 0.0, "step": 7 }, { "completion_length": 3.8125, "epoch": 0.0007915697818235789, "grad_norm": 49.124691009521484, "kl": 0.09912109375, "learning_rate": 9.929999999999999e-07, "loss": 0.004, "reward": 0.3125, "reward_std": 0.375, "rewards/accuracy_reward": 0.3125, "rewards/format_reward": 0.0, "step": 8 }, { "completion_length": 3.5625, "epoch": 0.0008905160045515262, "grad_norm": 43.116676330566406, "kl": 0.02130126953125, "learning_rate": 9.92e-07, "loss": 0.0009, "reward": 0.4375, "reward_std": 0.5193375647068024, "rewards/accuracy_reward": 0.4375, "rewards/format_reward": 0.0, "step": 9 }, { "completion_length": 3.5625, "epoch": 0.0009894622272794737, "grad_norm": 42.24452209472656, "kl": 0.030517578125, "learning_rate": 9.91e-07, "loss": 0.0012, "reward": 0.4375, "reward_std": 0.26933756470680237, "rewards/accuracy_reward": 0.4375, "rewards/format_reward": 0.0, "step": 10 }, { "completion_length": 4.5625, "epoch": 0.001088408450007421, "grad_norm": 9.293623924255371, "kl": 0.386474609375, "learning_rate": 9.9e-07, "loss": 0.0155, "reward": 0.75, "reward_std": 0.25, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 11 }, { "completion_length": 2.75, "epoch": 0.0011873546727353683, "grad_norm": 27.51582908630371, "kl": 0.119140625, "learning_rate": 9.89e-07, "loss": 0.0048, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 12 }, { "completion_length": 4.125, "epoch": 0.0012863008954633157, "grad_norm": 42.183692932128906, "kl": 1.232391357421875, "learning_rate": 9.88e-07, "loss": 0.0494, "reward": 0.375, "reward_std": 0.39433756470680237, "rewards/accuracy_reward": 0.375, "rewards/format_reward": 0.0, "step": 13 }, { "completion_length": 3.75, "epoch": 0.001385247118191263, "grad_norm": 16.871009826660156, "kl": 0.02880859375, "learning_rate": 9.87e-07, "loss": 0.0012, "reward": 0.8125, "reward_std": 0.125, "rewards/accuracy_reward": 0.8125, "rewards/format_reward": 0.0, "step": 14 }, { "completion_length": 3.1875, "epoch": 0.0014841933409192104, "grad_norm": 9.070819854736328, "kl": 0.31671142578125, "learning_rate": 9.86e-07, "loss": 0.0127, "reward": 0.5, "reward_std": 0.0, "rewards/accuracy_reward": 0.5, "rewards/format_reward": 0.0, "step": 15 }, { "completion_length": 3.875, "epoch": 0.0015831395636471577, "grad_norm": 34.1285285949707, "kl": 0.1123046875, "learning_rate": 9.849999999999999e-07, "loss": 0.0045, "reward": 0.8125, "reward_std": 0.26933756470680237, "rewards/accuracy_reward": 0.8125, "rewards/format_reward": 0.0, "step": 16 }, { "completion_length": 4.5, "epoch": 0.001682085786375105, "grad_norm": 28.27692985534668, "kl": 0.06103515625, "learning_rate": 9.84e-07, "loss": 0.0024, "reward": 0.375, "reward_std": 0.14433756470680237, "rewards/accuracy_reward": 0.375, "rewards/format_reward": 0.0, "step": 17 }, { "completion_length": 3.625, "epoch": 0.0017810320091030524, "grad_norm": 43.93234634399414, "kl": 0.04833984375, "learning_rate": 9.83e-07, "loss": 0.0019, "reward": 0.4375, "reward_std": 0.375, "rewards/accuracy_reward": 0.4375, "rewards/format_reward": 0.0, "step": 18 }, { "completion_length": 4.875, "epoch": 0.001879978231831, "grad_norm": 35.52457046508789, "kl": 0.1285400390625, "learning_rate": 9.819999999999999e-07, "loss": 0.0052, "reward": 0.25, "reward_std": 0.25, "rewards/accuracy_reward": 0.25, "rewards/format_reward": 0.0, "step": 19 }, { "completion_length": 4.6875, "epoch": 0.0019789244545589473, "grad_norm": 5.439634799957275, "kl": 0.283935546875, "learning_rate": 9.81e-07, "loss": 0.0114, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 20 }, { "completion_length": 2.875, "epoch": 0.0020778706772868944, "grad_norm": 35.29671859741211, "kl": 0.076904296875, "learning_rate": 9.8e-07, "loss": 0.0031, "reward": 0.75, "reward_std": 0.25, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 21 }, { "completion_length": 3.1875, "epoch": 0.002176816900014842, "grad_norm": 0.33881574869155884, "kl": 0.03955078125, "learning_rate": 9.789999999999999e-07, "loss": 0.0016, "reward": 0.5, "reward_std": 0.0, "rewards/accuracy_reward": 0.5, "rewards/format_reward": 0.0, "step": 22 }, { "completion_length": 3.875, "epoch": 0.002275763122742789, "grad_norm": 18.542280197143555, "kl": 0.13916015625, "learning_rate": 9.78e-07, "loss": 0.0056, "reward": 0.875, "reward_std": 0.14433756470680237, "rewards/accuracy_reward": 0.875, "rewards/format_reward": 0.0, "step": 23 }, { "completion_length": 3.9375, "epoch": 0.0023747093454707367, "grad_norm": 22.113807678222656, "kl": 0.46295166015625, "learning_rate": 9.77e-07, "loss": 0.0185, "reward": 0.5625, "reward_std": 0.125, "rewards/accuracy_reward": 0.5625, "rewards/format_reward": 0.0, "step": 24 }, { "completion_length": 2.875, "epoch": 0.002473655568198684, "grad_norm": 28.871366500854492, "kl": 0.0540771484375, "learning_rate": 9.759999999999998e-07, "loss": 0.0022, "reward": 0.75, "reward_std": 0.25, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 25 }, { "completion_length": 2.75, "epoch": 0.0025726017909266314, "grad_norm": 13.429852485656738, "kl": 0.0830078125, "learning_rate": 9.75e-07, "loss": 0.0033, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 26 }, { "completion_length": 3.3125, "epoch": 0.002671548013654579, "grad_norm": 25.259496688842773, "kl": 0.08380126953125, "learning_rate": 9.74e-07, "loss": 0.0034, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 27 }, { "completion_length": 4.6875, "epoch": 0.002770494236382526, "grad_norm": 35.60582733154297, "kl": 0.017974853515625, "learning_rate": 9.729999999999998e-07, "loss": 0.0007, "reward": 0.875, "reward_std": 0.14433756470680237, "rewards/accuracy_reward": 0.875, "rewards/format_reward": 0.0, "step": 28 }, { "completion_length": 2.625, "epoch": 0.0028694404591104736, "grad_norm": 35.21329116821289, "kl": 0.107421875, "learning_rate": 9.72e-07, "loss": 0.0043, "reward": 0.625, "reward_std": 0.25, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.0, "step": 29 }, { "completion_length": 3.4375, "epoch": 0.0029683866818384207, "grad_norm": 41.33916091918945, "kl": 0.14288330078125, "learning_rate": 9.709999999999999e-07, "loss": 0.0057, "reward": 0.8125, "reward_std": 0.26933756470680237, "rewards/accuracy_reward": 0.8125, "rewards/format_reward": 0.0, "step": 30 }, { "completion_length": 3.1875, "epoch": 0.0030673329045663683, "grad_norm": 35.675777435302734, "kl": 0.1474609375, "learning_rate": 9.7e-07, "loss": 0.0059, "reward": 0.625, "reward_std": 0.25, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.0, "step": 31 }, { "completion_length": 4.0, "epoch": 0.0031662791272943154, "grad_norm": 18.264066696166992, "kl": 0.087646484375, "learning_rate": 9.69e-07, "loss": 0.0035, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 32 }, { "completion_length": 3.5, "epoch": 0.003265225350022263, "grad_norm": 0.011650191619992256, "kl": 0.0262451171875, "learning_rate": 9.679999999999999e-07, "loss": 0.001, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 33 }, { "completion_length": 3.5, "epoch": 0.00336417157275021, "grad_norm": 52.62285614013672, "kl": 0.115966796875, "learning_rate": 9.67e-07, "loss": 0.0046, "reward": 0.5625, "reward_std": 0.125, "rewards/accuracy_reward": 0.5625, "rewards/format_reward": 0.0, "step": 34 }, { "completion_length": 3.625, "epoch": 0.0034631177954781577, "grad_norm": 82.99117279052734, "kl": 3.158203125, "learning_rate": 9.66e-07, "loss": 0.1264, "reward": 0.4375, "reward_std": 0.125, "rewards/accuracy_reward": 0.4375, "rewards/format_reward": 0.0, "step": 35 }, { "completion_length": 2.4375, "epoch": 0.003562064018206105, "grad_norm": 33.630123138427734, "kl": 0.109375, "learning_rate": 9.649999999999999e-07, "loss": 0.0044, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 36 }, { "completion_length": 3.1875, "epoch": 0.0036610102409340524, "grad_norm": 31.628652572631836, "kl": 0.61328125, "learning_rate": 9.64e-07, "loss": 0.0246, "reward": 0.625, "reward_std": 0.14433756470680237, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.0, "step": 37 }, { "completion_length": 4.1875, "epoch": 0.003759956463662, "grad_norm": 19.04951286315918, "kl": 0.2353515625, "learning_rate": 9.63e-07, "loss": 0.0095, "reward": 0.8125, "reward_std": 0.26933756470680237, "rewards/accuracy_reward": 0.8125, "rewards/format_reward": 0.0, "step": 38 }, { "completion_length": 4.3125, "epoch": 0.003858902686389947, "grad_norm": 26.543506622314453, "kl": 0.0684814453125, "learning_rate": 9.619999999999999e-07, "loss": 0.0027, "reward": 0.875, "reward_std": 0.25, "rewards/accuracy_reward": 0.875, "rewards/format_reward": 0.0, "step": 39 }, { "completion_length": 4.0, "epoch": 0.003957848909117895, "grad_norm": 13.690553665161133, "kl": 0.13409423828125, "learning_rate": 9.61e-07, "loss": 0.0054, "reward": 0.5625, "reward_std": 0.125, "rewards/accuracy_reward": 0.5625, "rewards/format_reward": 0.0, "step": 40 }, { "completion_length": 3.6875, "epoch": 0.004056795131845842, "grad_norm": 13.923758506774902, "kl": 0.0458984375, "learning_rate": 9.6e-07, "loss": 0.0018, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 41 }, { "completion_length": 5.875, "epoch": 0.004155741354573789, "grad_norm": 18.20030403137207, "kl": 0.115478515625, "learning_rate": 9.589999999999998e-07, "loss": 0.0046, "reward": 0.625, "reward_std": 0.14433756470680237, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.0, "step": 42 }, { "completion_length": 2.75, "epoch": 0.004254687577301737, "grad_norm": 43.371185302734375, "kl": 0.097412109375, "learning_rate": 9.58e-07, "loss": 0.0039, "reward": 0.625, "reward_std": 0.14433756470680237, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.0, "step": 43 }, { "completion_length": 3.1875, "epoch": 0.004353633800029684, "grad_norm": 69.18988037109375, "kl": 0.15380859375, "learning_rate": 9.57e-07, "loss": 0.0062, "reward": 0.5625, "reward_std": 0.26933756470680237, "rewards/accuracy_reward": 0.5625, "rewards/format_reward": 0.0, "step": 44 }, { "completion_length": 3.5, "epoch": 0.004452580022757631, "grad_norm": 42.821083068847656, "kl": 0.29052734375, "learning_rate": 9.559999999999998e-07, "loss": 0.0116, "reward": 0.8125, "reward_std": 0.26933756470680237, "rewards/accuracy_reward": 0.8125, "rewards/format_reward": 0.0, "step": 45 }, { "completion_length": 2.75, "epoch": 0.004551526245485578, "grad_norm": 0.00253496621735394, "kl": 0.042724609375, "learning_rate": 9.55e-07, "loss": 0.0017, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 46 }, { "completion_length": 2.75, "epoch": 0.004650472468213526, "grad_norm": 28.470979690551758, "kl": 0.1875, "learning_rate": 9.539999999999999e-07, "loss": 0.0075, "reward": 0.6875, "reward_std": 0.125, "rewards/accuracy_reward": 0.6875, "rewards/format_reward": 0.0, "step": 47 }, { "completion_length": 3.125, "epoch": 0.004749418690941473, "grad_norm": 78.60997772216797, "kl": 0.44921875, "learning_rate": 9.529999999999999e-07, "loss": 0.018, "reward": 0.8125, "reward_std": 0.26933756470680237, "rewards/accuracy_reward": 0.8125, "rewards/format_reward": 0.0, "step": 48 }, { "completion_length": 3.5, "epoch": 0.0048483649136694205, "grad_norm": 0.15050888061523438, "kl": 0.028778076171875, "learning_rate": 9.52e-07, "loss": 0.0011, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 49 }, { "completion_length": 3.6875, "epoch": 0.004947311136397368, "grad_norm": 8.970772743225098, "kl": 0.3662109375, "learning_rate": 9.509999999999999e-07, "loss": 0.0146, "reward": 0.4375, "reward_std": 0.125, "rewards/accuracy_reward": 0.4375, "rewards/format_reward": 0.0, "step": 50 }, { "completion_length": 3.5, "epoch": 0.005046257359125316, "grad_norm": 42.177669525146484, "kl": 0.20263671875, "learning_rate": 9.499999999999999e-07, "loss": 0.0081, "reward": 0.875, "reward_std": 0.14433756470680237, "rewards/accuracy_reward": 0.875, "rewards/format_reward": 0.0, "step": 51 }, { "completion_length": 3.125, "epoch": 0.005145203581853263, "grad_norm": 11.261039733886719, "kl": 0.14239501953125, "learning_rate": 9.489999999999999e-07, "loss": 0.0057, "reward": 0.6875, "reward_std": 0.125, "rewards/accuracy_reward": 0.6875, "rewards/format_reward": 0.0, "step": 52 }, { "completion_length": 3.25, "epoch": 0.00524414980458121, "grad_norm": 0.3226803243160248, "kl": 0.0335235595703125, "learning_rate": 9.479999999999999e-07, "loss": 0.0013, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 53 }, { "completion_length": 2.9375, "epoch": 0.005343096027309158, "grad_norm": 27.19357681274414, "kl": 0.1173553466796875, "learning_rate": 9.469999999999999e-07, "loss": 0.0047, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 54 }, { "completion_length": 2.25, "epoch": 0.005442042250037105, "grad_norm": 0.14267660677433014, "kl": 0.0958251953125, "learning_rate": 9.459999999999999e-07, "loss": 0.0038, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 55 }, { "completion_length": 3.125, "epoch": 0.005540988472765052, "grad_norm": 1.3845109939575195, "kl": 0.070556640625, "learning_rate": 9.45e-07, "loss": 0.0028, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 56 }, { "completion_length": 3.5, "epoch": 0.005639934695492999, "grad_norm": 0.3318254351615906, "kl": 0.07275390625, "learning_rate": 9.439999999999999e-07, "loss": 0.0029, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 57 }, { "completion_length": 3.5, "epoch": 0.005738880918220947, "grad_norm": 79.56658172607422, "kl": 0.147705078125, "learning_rate": 9.429999999999999e-07, "loss": 0.0059, "reward": 0.625, "reward_std": 0.14433756470680237, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.0, "step": 58 }, { "completion_length": 3.25, "epoch": 0.005837827140948894, "grad_norm": 29.595632553100586, "kl": 0.08984375, "learning_rate": 9.419999999999999e-07, "loss": 0.0036, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 59 }, { "completion_length": 3.375, "epoch": 0.0059367733636768415, "grad_norm": 1.569680094718933, "kl": 0.1719970703125, "learning_rate": 9.409999999999999e-07, "loss": 0.0069, "reward": 0.5, "reward_std": 0.0, "rewards/accuracy_reward": 0.5, "rewards/format_reward": 0.0, "step": 60 }, { "completion_length": 3.4375, "epoch": 0.006035719586404789, "grad_norm": 20.28252601623535, "kl": 0.01580810546875, "learning_rate": 9.399999999999999e-07, "loss": 0.0006, "reward": 0.6875, "reward_std": 0.125, "rewards/accuracy_reward": 0.6875, "rewards/format_reward": 0.0, "step": 61 }, { "completion_length": 4.0, "epoch": 0.006134665809132737, "grad_norm": 0.009604735299944878, "kl": 0.016845703125, "learning_rate": 9.389999999999999e-07, "loss": 0.0007, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 62 }, { "completion_length": 3.0, "epoch": 0.006233612031860684, "grad_norm": 0.054051682353019714, "kl": 0.1220703125, "learning_rate": 9.379999999999998e-07, "loss": 0.0049, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 63 }, { "completion_length": 3.25, "epoch": 0.006332558254588631, "grad_norm": 43.524681091308594, "kl": 0.41552734375, "learning_rate": 9.37e-07, "loss": 0.0166, "reward": 0.5625, "reward_std": 0.125, "rewards/accuracy_reward": 0.5625, "rewards/format_reward": 0.0, "step": 64 }, { "completion_length": 3.3125, "epoch": 0.006431504477316579, "grad_norm": 19.583276748657227, "kl": 0.4501953125, "learning_rate": 9.36e-07, "loss": 0.018, "reward": 0.6875, "reward_std": 0.125, "rewards/accuracy_reward": 0.6875, "rewards/format_reward": 0.0, "step": 65 }, { "completion_length": 3.5, "epoch": 0.006530450700044526, "grad_norm": 29.74109649658203, "kl": 0.42333984375, "learning_rate": 9.35e-07, "loss": 0.0169, "reward": 0.625, "reward_std": 0.25, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.0, "step": 66 }, { "completion_length": 3.5625, "epoch": 0.006629396922772473, "grad_norm": 51.01466369628906, "kl": 0.45574951171875, "learning_rate": 9.34e-07, "loss": 0.0182, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 67 }, { "completion_length": 2.875, "epoch": 0.00672834314550042, "grad_norm": 40.87276840209961, "kl": 0.11376953125, "learning_rate": 9.33e-07, "loss": 0.0046, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 68 }, { "completion_length": 4.375, "epoch": 0.006827289368228368, "grad_norm": 920.1598510742188, "kl": 30.021240234375, "learning_rate": 9.32e-07, "loss": 1.1998, "reward": 0.6875, "reward_std": 0.125, "rewards/accuracy_reward": 0.6875, "rewards/format_reward": 0.0, "step": 69 }, { "completion_length": 3.25, "epoch": 0.006926235590956315, "grad_norm": 0.07895195484161377, "kl": 0.0203857421875, "learning_rate": 9.31e-07, "loss": 0.0008, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 70 }, { "completion_length": 2.9375, "epoch": 0.0070251818136842625, "grad_norm": 72.71320343017578, "kl": 0.9306640625, "learning_rate": 9.3e-07, "loss": 0.0373, "reward": 0.6875, "reward_std": 0.125, "rewards/accuracy_reward": 0.6875, "rewards/format_reward": 0.0, "step": 71 }, { "completion_length": 3.5, "epoch": 0.00712412803641221, "grad_norm": 0.04532546177506447, "kl": 0.07568359375, "learning_rate": 9.29e-07, "loss": 0.003, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 72 }, { "completion_length": 3.5, "epoch": 0.007223074259140158, "grad_norm": 59.64799118041992, "kl": 0.309326171875, "learning_rate": 9.28e-07, "loss": 0.0123, "reward": 0.625, "reward_std": 0.14433756470680237, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.0, "step": 73 }, { "completion_length": 4.25, "epoch": 0.007322020481868105, "grad_norm": 0.022819090634584427, "kl": 0.129150390625, "learning_rate": 9.27e-07, "loss": 0.0052, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 74 }, { "completion_length": 2.5, "epoch": 0.007420966704596052, "grad_norm": 0.4349958598613739, "kl": 0.1767578125, "learning_rate": 9.26e-07, "loss": 0.0071, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 75 }, { "completion_length": 3.25, "epoch": 0.007519912927324, "grad_norm": 0.9703753590583801, "kl": 0.1021728515625, "learning_rate": 9.25e-07, "loss": 0.0041, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 76 }, { "completion_length": 3.6875, "epoch": 0.007618859150051947, "grad_norm": 0.20156638324260712, "kl": 0.0416259765625, "learning_rate": 9.24e-07, "loss": 0.0017, "reward": 0.5, "reward_std": 0.0, "rewards/accuracy_reward": 0.5, "rewards/format_reward": 0.0, "step": 77 }, { "completion_length": 3.0, "epoch": 0.007717805372779894, "grad_norm": 0.1729861944913864, "kl": 0.1273193359375, "learning_rate": 9.23e-07, "loss": 0.0051, "reward": 0.5, "reward_std": 0.0, "rewards/accuracy_reward": 0.5, "rewards/format_reward": 0.0, "step": 78 }, { "completion_length": 2.75, "epoch": 0.007816751595507841, "grad_norm": 0.019643617793917656, "kl": 0.0714111328125, "learning_rate": 9.22e-07, "loss": 0.0029, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 79 }, { "completion_length": 3.25, "epoch": 0.00791569781823579, "grad_norm": 0.017483701929450035, "kl": 0.23956298828125, "learning_rate": 9.21e-07, "loss": 0.0096, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 80 }, { "completion_length": 3.75, "epoch": 0.008014644040963735, "grad_norm": 0.02477215975522995, "kl": 0.056396484375, "learning_rate": 9.2e-07, "loss": 0.0023, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 81 }, { "completion_length": 2.25, "epoch": 0.008113590263691683, "grad_norm": 57.296180725097656, "kl": 0.0313720703125, "learning_rate": 9.19e-07, "loss": 0.0013, "reward": 0.875, "reward_std": 0.14433756470680237, "rewards/accuracy_reward": 0.875, "rewards/format_reward": 0.0, "step": 82 }, { "completion_length": 2.75, "epoch": 0.008212536486419631, "grad_norm": 0.0005820893566124141, "kl": 0.030029296875, "learning_rate": 9.18e-07, "loss": 0.0012, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 83 }, { "completion_length": 2.75, "epoch": 0.008311482709147578, "grad_norm": 0.007898775860667229, "kl": 0.0718994140625, "learning_rate": 9.17e-07, "loss": 0.0029, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 84 }, { "completion_length": 5.25, "epoch": 0.008410428931875526, "grad_norm": 17.927873611450195, "kl": 0.056640625, "learning_rate": 9.16e-07, "loss": 0.0023, "reward": 0.8125, "reward_std": 0.125, "rewards/accuracy_reward": 0.8125, "rewards/format_reward": 0.0, "step": 85 }, { "completion_length": 2.9375, "epoch": 0.008509375154603474, "grad_norm": 0.6610168814659119, "kl": 0.05419921875, "learning_rate": 9.15e-07, "loss": 0.0022, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 86 }, { "completion_length": 6.0625, "epoch": 0.00860832137733142, "grad_norm": 35.296607971191406, "kl": 1.230712890625, "learning_rate": 9.14e-07, "loss": 0.0497, "reward": 0.625, "reward_std": 0.25, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.0, "step": 87 }, { "completion_length": 2.5, "epoch": 0.008707267600059368, "grad_norm": 0.06378056854009628, "kl": 0.06463623046875, "learning_rate": 9.13e-07, "loss": 0.0026, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 88 }, { "completion_length": 3.1875, "epoch": 0.008806213822787316, "grad_norm": 227.54002380371094, "kl": 0.4443359375, "learning_rate": 9.12e-07, "loss": 0.0178, "reward": 0.4375, "reward_std": 0.125, "rewards/accuracy_reward": 0.4375, "rewards/format_reward": 0.0, "step": 89 }, { "completion_length": 2.75, "epoch": 0.008905160045515262, "grad_norm": 0.0024500866420567036, "kl": 0.0645751953125, "learning_rate": 9.109999999999999e-07, "loss": 0.0026, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 90 }, { "completion_length": 3.0, "epoch": 0.00900410626824321, "grad_norm": 33.444313049316406, "kl": 0.10693359375, "learning_rate": 9.1e-07, "loss": 0.0043, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 91 }, { "completion_length": 3.6875, "epoch": 0.009103052490971156, "grad_norm": 19.867097854614258, "kl": 0.14208984375, "learning_rate": 9.09e-07, "loss": 0.0057, "reward": 0.6875, "reward_std": 0.125, "rewards/accuracy_reward": 0.6875, "rewards/format_reward": 0.0, "step": 92 }, { "completion_length": 3.625, "epoch": 0.009201998713699104, "grad_norm": 3.6420788764953613, "kl": 0.177490234375, "learning_rate": 9.08e-07, "loss": 0.0071, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 93 }, { "completion_length": 2.0, "epoch": 0.009300944936427052, "grad_norm": 0.008027822710573673, "kl": 0.13671875, "learning_rate": 9.07e-07, "loss": 0.0055, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 94 }, { "completion_length": 3.625, "epoch": 0.009399891159154999, "grad_norm": 51.053592681884766, "kl": 0.162353515625, "learning_rate": 9.06e-07, "loss": 0.0065, "reward": 0.8125, "reward_std": 0.125, "rewards/accuracy_reward": 0.8125, "rewards/format_reward": 0.0, "step": 95 }, { "completion_length": 2.5, "epoch": 0.009498837381882947, "grad_norm": 0.0023729894310235977, "kl": 0.025390625, "learning_rate": 9.05e-07, "loss": 0.001, "reward": 1.0, "reward_std": 0.0, "rewards/accuracy_reward": 1.0, "rewards/format_reward": 0.0, "step": 96 }, { "completion_length": 3.0, "epoch": 0.009597783604610895, "grad_norm": 0.1433296650648117, "kl": 0.1759033203125, "learning_rate": 9.039999999999999e-07, "loss": 0.0071, "reward": 0.75, "reward_std": 0.0, "rewards/accuracy_reward": 0.75, "rewards/format_reward": 0.0, "step": 97 }, { "completion_length": 3.25, "epoch": 0.009696729827338841, "grad_norm": 46.357540130615234, "kl": 0.344024658203125, "learning_rate": 9.03e-07, "loss": 0.0137, "reward": 0.9375, "reward_std": 0.125, "rewards/accuracy_reward": 0.9375, "rewards/format_reward": 0.0, "step": 98 }, { "completion_length": 4.5625, "epoch": 0.009795676050066789, "grad_norm": 25.5620059967041, "kl": 0.1181640625, "learning_rate": 9.02e-07, "loss": 0.0047, "reward": 0.625, "reward_std": 0.25, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.0, "step": 99 }, { "completion_length": 3.8125, "epoch": 0.009894622272794735, "grad_norm": 31.894678115844727, "kl": 0.300445556640625, "learning_rate": 9.01e-07, "loss": 0.012, "reward": 0.3125, "reward_std": 0.125, "rewards/accuracy_reward": 0.3125, "rewards/format_reward": 0.0, "step": 100 } ], "logging_steps": 1, "max_steps": 1000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }