Omni-R1 / trainer_state.json
UnFaZeD07's picture
Add files using upload-large-folder tool
776ef5c verified
Raw
History Blame Contribute Delete
36.2 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.009894622272794735,
"eval_steps": 500,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"completion_length": 6.0,
"epoch": 9.894622272794736e-05,
"grad_norm": 22.976070404052734,
"kl": 0.0,
"learning_rate": 1e-06,
"loss": -0.0,
"reward": 0.125,
"reward_std": 0.25,
"rewards/accuracy_reward": 0.125,
"rewards/format_reward": 0.0,
"step": 1
},
{
"completion_length": 6.5,
"epoch": 0.00019789244545589471,
"grad_norm": 32.8896369934082,
"kl": 0.0035400390625,
"learning_rate": 9.989999999999999e-07,
"loss": 0.0001,
"reward": 0.3125,
"reward_std": 0.5193375647068024,
"rewards/accuracy_reward": 0.3125,
"rewards/format_reward": 0.0,
"step": 2
},
{
"completion_length": 5.0625,
"epoch": 0.0002968386681838421,
"grad_norm": 45.44774627685547,
"kl": 0.00732421875,
"learning_rate": 9.98e-07,
"loss": 0.0003,
"reward": 0.3125,
"reward_std": 0.26933756470680237,
"rewards/accuracy_reward": 0.3125,
"rewards/format_reward": 0.0,
"step": 3
},
{
"completion_length": 6.25,
"epoch": 0.00039578489091178943,
"grad_norm": 35.005924224853516,
"kl": 0.003936767578125,
"learning_rate": 9.97e-07,
"loss": 0.0002,
"reward": 0.375,
"reward_std": 0.39433756470680237,
"rewards/accuracy_reward": 0.375,
"rewards/format_reward": 0.0,
"step": 4
},
{
"completion_length": 4.5625,
"epoch": 0.0004947311136397368,
"grad_norm": 39.57672882080078,
"kl": 0.00762176513671875,
"learning_rate": 9.959999999999999e-07,
"loss": 0.0003,
"reward": 0.625,
"reward_std": 0.39433756470680237,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.0,
"step": 5
},
{
"completion_length": 4.125,
"epoch": 0.0005936773363676842,
"grad_norm": 23.2183837890625,
"kl": 0.03729248046875,
"learning_rate": 9.95e-07,
"loss": 0.0015,
"reward": 0.5625,
"reward_std": 0.375,
"rewards/accuracy_reward": 0.5625,
"rewards/format_reward": 0.0,
"step": 6
},
{
"completion_length": 3.3125,
"epoch": 0.0006926235590956315,
"grad_norm": 47.74429702758789,
"kl": 0.06170654296875,
"learning_rate": 9.94e-07,
"loss": 0.0025,
"reward": 0.4375,
"reward_std": 0.41367512941360474,
"rewards/accuracy_reward": 0.4375,
"rewards/format_reward": 0.0,
"step": 7
},
{
"completion_length": 3.8125,
"epoch": 0.0007915697818235789,
"grad_norm": 49.124691009521484,
"kl": 0.09912109375,
"learning_rate": 9.929999999999999e-07,
"loss": 0.004,
"reward": 0.3125,
"reward_std": 0.375,
"rewards/accuracy_reward": 0.3125,
"rewards/format_reward": 0.0,
"step": 8
},
{
"completion_length": 3.5625,
"epoch": 0.0008905160045515262,
"grad_norm": 43.116676330566406,
"kl": 0.02130126953125,
"learning_rate": 9.92e-07,
"loss": 0.0009,
"reward": 0.4375,
"reward_std": 0.5193375647068024,
"rewards/accuracy_reward": 0.4375,
"rewards/format_reward": 0.0,
"step": 9
},
{
"completion_length": 3.5625,
"epoch": 0.0009894622272794737,
"grad_norm": 42.24452209472656,
"kl": 0.030517578125,
"learning_rate": 9.91e-07,
"loss": 0.0012,
"reward": 0.4375,
"reward_std": 0.26933756470680237,
"rewards/accuracy_reward": 0.4375,
"rewards/format_reward": 0.0,
"step": 10
},
{
"completion_length": 4.5625,
"epoch": 0.001088408450007421,
"grad_norm": 9.293623924255371,
"kl": 0.386474609375,
"learning_rate": 9.9e-07,
"loss": 0.0155,
"reward": 0.75,
"reward_std": 0.25,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 11
},
{
"completion_length": 2.75,
"epoch": 0.0011873546727353683,
"grad_norm": 27.51582908630371,
"kl": 0.119140625,
"learning_rate": 9.89e-07,
"loss": 0.0048,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 12
},
{
"completion_length": 4.125,
"epoch": 0.0012863008954633157,
"grad_norm": 42.183692932128906,
"kl": 1.232391357421875,
"learning_rate": 9.88e-07,
"loss": 0.0494,
"reward": 0.375,
"reward_std": 0.39433756470680237,
"rewards/accuracy_reward": 0.375,
"rewards/format_reward": 0.0,
"step": 13
},
{
"completion_length": 3.75,
"epoch": 0.001385247118191263,
"grad_norm": 16.871009826660156,
"kl": 0.02880859375,
"learning_rate": 9.87e-07,
"loss": 0.0012,
"reward": 0.8125,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.8125,
"rewards/format_reward": 0.0,
"step": 14
},
{
"completion_length": 3.1875,
"epoch": 0.0014841933409192104,
"grad_norm": 9.070819854736328,
"kl": 0.31671142578125,
"learning_rate": 9.86e-07,
"loss": 0.0127,
"reward": 0.5,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.5,
"rewards/format_reward": 0.0,
"step": 15
},
{
"completion_length": 3.875,
"epoch": 0.0015831395636471577,
"grad_norm": 34.1285285949707,
"kl": 0.1123046875,
"learning_rate": 9.849999999999999e-07,
"loss": 0.0045,
"reward": 0.8125,
"reward_std": 0.26933756470680237,
"rewards/accuracy_reward": 0.8125,
"rewards/format_reward": 0.0,
"step": 16
},
{
"completion_length": 4.5,
"epoch": 0.001682085786375105,
"grad_norm": 28.27692985534668,
"kl": 0.06103515625,
"learning_rate": 9.84e-07,
"loss": 0.0024,
"reward": 0.375,
"reward_std": 0.14433756470680237,
"rewards/accuracy_reward": 0.375,
"rewards/format_reward": 0.0,
"step": 17
},
{
"completion_length": 3.625,
"epoch": 0.0017810320091030524,
"grad_norm": 43.93234634399414,
"kl": 0.04833984375,
"learning_rate": 9.83e-07,
"loss": 0.0019,
"reward": 0.4375,
"reward_std": 0.375,
"rewards/accuracy_reward": 0.4375,
"rewards/format_reward": 0.0,
"step": 18
},
{
"completion_length": 4.875,
"epoch": 0.001879978231831,
"grad_norm": 35.52457046508789,
"kl": 0.1285400390625,
"learning_rate": 9.819999999999999e-07,
"loss": 0.0052,
"reward": 0.25,
"reward_std": 0.25,
"rewards/accuracy_reward": 0.25,
"rewards/format_reward": 0.0,
"step": 19
},
{
"completion_length": 4.6875,
"epoch": 0.0019789244545589473,
"grad_norm": 5.439634799957275,
"kl": 0.283935546875,
"learning_rate": 9.81e-07,
"loss": 0.0114,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 20
},
{
"completion_length": 2.875,
"epoch": 0.0020778706772868944,
"grad_norm": 35.29671859741211,
"kl": 0.076904296875,
"learning_rate": 9.8e-07,
"loss": 0.0031,
"reward": 0.75,
"reward_std": 0.25,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 21
},
{
"completion_length": 3.1875,
"epoch": 0.002176816900014842,
"grad_norm": 0.33881574869155884,
"kl": 0.03955078125,
"learning_rate": 9.789999999999999e-07,
"loss": 0.0016,
"reward": 0.5,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.5,
"rewards/format_reward": 0.0,
"step": 22
},
{
"completion_length": 3.875,
"epoch": 0.002275763122742789,
"grad_norm": 18.542280197143555,
"kl": 0.13916015625,
"learning_rate": 9.78e-07,
"loss": 0.0056,
"reward": 0.875,
"reward_std": 0.14433756470680237,
"rewards/accuracy_reward": 0.875,
"rewards/format_reward": 0.0,
"step": 23
},
{
"completion_length": 3.9375,
"epoch": 0.0023747093454707367,
"grad_norm": 22.113807678222656,
"kl": 0.46295166015625,
"learning_rate": 9.77e-07,
"loss": 0.0185,
"reward": 0.5625,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.5625,
"rewards/format_reward": 0.0,
"step": 24
},
{
"completion_length": 2.875,
"epoch": 0.002473655568198684,
"grad_norm": 28.871366500854492,
"kl": 0.0540771484375,
"learning_rate": 9.759999999999998e-07,
"loss": 0.0022,
"reward": 0.75,
"reward_std": 0.25,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 25
},
{
"completion_length": 2.75,
"epoch": 0.0025726017909266314,
"grad_norm": 13.429852485656738,
"kl": 0.0830078125,
"learning_rate": 9.75e-07,
"loss": 0.0033,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 26
},
{
"completion_length": 3.3125,
"epoch": 0.002671548013654579,
"grad_norm": 25.259496688842773,
"kl": 0.08380126953125,
"learning_rate": 9.74e-07,
"loss": 0.0034,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 27
},
{
"completion_length": 4.6875,
"epoch": 0.002770494236382526,
"grad_norm": 35.60582733154297,
"kl": 0.017974853515625,
"learning_rate": 9.729999999999998e-07,
"loss": 0.0007,
"reward": 0.875,
"reward_std": 0.14433756470680237,
"rewards/accuracy_reward": 0.875,
"rewards/format_reward": 0.0,
"step": 28
},
{
"completion_length": 2.625,
"epoch": 0.0028694404591104736,
"grad_norm": 35.21329116821289,
"kl": 0.107421875,
"learning_rate": 9.72e-07,
"loss": 0.0043,
"reward": 0.625,
"reward_std": 0.25,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.0,
"step": 29
},
{
"completion_length": 3.4375,
"epoch": 0.0029683866818384207,
"grad_norm": 41.33916091918945,
"kl": 0.14288330078125,
"learning_rate": 9.709999999999999e-07,
"loss": 0.0057,
"reward": 0.8125,
"reward_std": 0.26933756470680237,
"rewards/accuracy_reward": 0.8125,
"rewards/format_reward": 0.0,
"step": 30
},
{
"completion_length": 3.1875,
"epoch": 0.0030673329045663683,
"grad_norm": 35.675777435302734,
"kl": 0.1474609375,
"learning_rate": 9.7e-07,
"loss": 0.0059,
"reward": 0.625,
"reward_std": 0.25,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.0,
"step": 31
},
{
"completion_length": 4.0,
"epoch": 0.0031662791272943154,
"grad_norm": 18.264066696166992,
"kl": 0.087646484375,
"learning_rate": 9.69e-07,
"loss": 0.0035,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 32
},
{
"completion_length": 3.5,
"epoch": 0.003265225350022263,
"grad_norm": 0.011650191619992256,
"kl": 0.0262451171875,
"learning_rate": 9.679999999999999e-07,
"loss": 0.001,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 33
},
{
"completion_length": 3.5,
"epoch": 0.00336417157275021,
"grad_norm": 52.62285614013672,
"kl": 0.115966796875,
"learning_rate": 9.67e-07,
"loss": 0.0046,
"reward": 0.5625,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.5625,
"rewards/format_reward": 0.0,
"step": 34
},
{
"completion_length": 3.625,
"epoch": 0.0034631177954781577,
"grad_norm": 82.99117279052734,
"kl": 3.158203125,
"learning_rate": 9.66e-07,
"loss": 0.1264,
"reward": 0.4375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.4375,
"rewards/format_reward": 0.0,
"step": 35
},
{
"completion_length": 2.4375,
"epoch": 0.003562064018206105,
"grad_norm": 33.630123138427734,
"kl": 0.109375,
"learning_rate": 9.649999999999999e-07,
"loss": 0.0044,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 36
},
{
"completion_length": 3.1875,
"epoch": 0.0036610102409340524,
"grad_norm": 31.628652572631836,
"kl": 0.61328125,
"learning_rate": 9.64e-07,
"loss": 0.0246,
"reward": 0.625,
"reward_std": 0.14433756470680237,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.0,
"step": 37
},
{
"completion_length": 4.1875,
"epoch": 0.003759956463662,
"grad_norm": 19.04951286315918,
"kl": 0.2353515625,
"learning_rate": 9.63e-07,
"loss": 0.0095,
"reward": 0.8125,
"reward_std": 0.26933756470680237,
"rewards/accuracy_reward": 0.8125,
"rewards/format_reward": 0.0,
"step": 38
},
{
"completion_length": 4.3125,
"epoch": 0.003858902686389947,
"grad_norm": 26.543506622314453,
"kl": 0.0684814453125,
"learning_rate": 9.619999999999999e-07,
"loss": 0.0027,
"reward": 0.875,
"reward_std": 0.25,
"rewards/accuracy_reward": 0.875,
"rewards/format_reward": 0.0,
"step": 39
},
{
"completion_length": 4.0,
"epoch": 0.003957848909117895,
"grad_norm": 13.690553665161133,
"kl": 0.13409423828125,
"learning_rate": 9.61e-07,
"loss": 0.0054,
"reward": 0.5625,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.5625,
"rewards/format_reward": 0.0,
"step": 40
},
{
"completion_length": 3.6875,
"epoch": 0.004056795131845842,
"grad_norm": 13.923758506774902,
"kl": 0.0458984375,
"learning_rate": 9.6e-07,
"loss": 0.0018,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 41
},
{
"completion_length": 5.875,
"epoch": 0.004155741354573789,
"grad_norm": 18.20030403137207,
"kl": 0.115478515625,
"learning_rate": 9.589999999999998e-07,
"loss": 0.0046,
"reward": 0.625,
"reward_std": 0.14433756470680237,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.0,
"step": 42
},
{
"completion_length": 2.75,
"epoch": 0.004254687577301737,
"grad_norm": 43.371185302734375,
"kl": 0.097412109375,
"learning_rate": 9.58e-07,
"loss": 0.0039,
"reward": 0.625,
"reward_std": 0.14433756470680237,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.0,
"step": 43
},
{
"completion_length": 3.1875,
"epoch": 0.004353633800029684,
"grad_norm": 69.18988037109375,
"kl": 0.15380859375,
"learning_rate": 9.57e-07,
"loss": 0.0062,
"reward": 0.5625,
"reward_std": 0.26933756470680237,
"rewards/accuracy_reward": 0.5625,
"rewards/format_reward": 0.0,
"step": 44
},
{
"completion_length": 3.5,
"epoch": 0.004452580022757631,
"grad_norm": 42.821083068847656,
"kl": 0.29052734375,
"learning_rate": 9.559999999999998e-07,
"loss": 0.0116,
"reward": 0.8125,
"reward_std": 0.26933756470680237,
"rewards/accuracy_reward": 0.8125,
"rewards/format_reward": 0.0,
"step": 45
},
{
"completion_length": 2.75,
"epoch": 0.004551526245485578,
"grad_norm": 0.00253496621735394,
"kl": 0.042724609375,
"learning_rate": 9.55e-07,
"loss": 0.0017,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 46
},
{
"completion_length": 2.75,
"epoch": 0.004650472468213526,
"grad_norm": 28.470979690551758,
"kl": 0.1875,
"learning_rate": 9.539999999999999e-07,
"loss": 0.0075,
"reward": 0.6875,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.6875,
"rewards/format_reward": 0.0,
"step": 47
},
{
"completion_length": 3.125,
"epoch": 0.004749418690941473,
"grad_norm": 78.60997772216797,
"kl": 0.44921875,
"learning_rate": 9.529999999999999e-07,
"loss": 0.018,
"reward": 0.8125,
"reward_std": 0.26933756470680237,
"rewards/accuracy_reward": 0.8125,
"rewards/format_reward": 0.0,
"step": 48
},
{
"completion_length": 3.5,
"epoch": 0.0048483649136694205,
"grad_norm": 0.15050888061523438,
"kl": 0.028778076171875,
"learning_rate": 9.52e-07,
"loss": 0.0011,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 49
},
{
"completion_length": 3.6875,
"epoch": 0.004947311136397368,
"grad_norm": 8.970772743225098,
"kl": 0.3662109375,
"learning_rate": 9.509999999999999e-07,
"loss": 0.0146,
"reward": 0.4375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.4375,
"rewards/format_reward": 0.0,
"step": 50
},
{
"completion_length": 3.5,
"epoch": 0.005046257359125316,
"grad_norm": 42.177669525146484,
"kl": 0.20263671875,
"learning_rate": 9.499999999999999e-07,
"loss": 0.0081,
"reward": 0.875,
"reward_std": 0.14433756470680237,
"rewards/accuracy_reward": 0.875,
"rewards/format_reward": 0.0,
"step": 51
},
{
"completion_length": 3.125,
"epoch": 0.005145203581853263,
"grad_norm": 11.261039733886719,
"kl": 0.14239501953125,
"learning_rate": 9.489999999999999e-07,
"loss": 0.0057,
"reward": 0.6875,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.6875,
"rewards/format_reward": 0.0,
"step": 52
},
{
"completion_length": 3.25,
"epoch": 0.00524414980458121,
"grad_norm": 0.3226803243160248,
"kl": 0.0335235595703125,
"learning_rate": 9.479999999999999e-07,
"loss": 0.0013,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 53
},
{
"completion_length": 2.9375,
"epoch": 0.005343096027309158,
"grad_norm": 27.19357681274414,
"kl": 0.1173553466796875,
"learning_rate": 9.469999999999999e-07,
"loss": 0.0047,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 54
},
{
"completion_length": 2.25,
"epoch": 0.005442042250037105,
"grad_norm": 0.14267660677433014,
"kl": 0.0958251953125,
"learning_rate": 9.459999999999999e-07,
"loss": 0.0038,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 55
},
{
"completion_length": 3.125,
"epoch": 0.005540988472765052,
"grad_norm": 1.3845109939575195,
"kl": 0.070556640625,
"learning_rate": 9.45e-07,
"loss": 0.0028,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 56
},
{
"completion_length": 3.5,
"epoch": 0.005639934695492999,
"grad_norm": 0.3318254351615906,
"kl": 0.07275390625,
"learning_rate": 9.439999999999999e-07,
"loss": 0.0029,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 57
},
{
"completion_length": 3.5,
"epoch": 0.005738880918220947,
"grad_norm": 79.56658172607422,
"kl": 0.147705078125,
"learning_rate": 9.429999999999999e-07,
"loss": 0.0059,
"reward": 0.625,
"reward_std": 0.14433756470680237,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.0,
"step": 58
},
{
"completion_length": 3.25,
"epoch": 0.005837827140948894,
"grad_norm": 29.595632553100586,
"kl": 0.08984375,
"learning_rate": 9.419999999999999e-07,
"loss": 0.0036,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 59
},
{
"completion_length": 3.375,
"epoch": 0.0059367733636768415,
"grad_norm": 1.569680094718933,
"kl": 0.1719970703125,
"learning_rate": 9.409999999999999e-07,
"loss": 0.0069,
"reward": 0.5,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.5,
"rewards/format_reward": 0.0,
"step": 60
},
{
"completion_length": 3.4375,
"epoch": 0.006035719586404789,
"grad_norm": 20.28252601623535,
"kl": 0.01580810546875,
"learning_rate": 9.399999999999999e-07,
"loss": 0.0006,
"reward": 0.6875,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.6875,
"rewards/format_reward": 0.0,
"step": 61
},
{
"completion_length": 4.0,
"epoch": 0.006134665809132737,
"grad_norm": 0.009604735299944878,
"kl": 0.016845703125,
"learning_rate": 9.389999999999999e-07,
"loss": 0.0007,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 62
},
{
"completion_length": 3.0,
"epoch": 0.006233612031860684,
"grad_norm": 0.054051682353019714,
"kl": 0.1220703125,
"learning_rate": 9.379999999999998e-07,
"loss": 0.0049,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 63
},
{
"completion_length": 3.25,
"epoch": 0.006332558254588631,
"grad_norm": 43.524681091308594,
"kl": 0.41552734375,
"learning_rate": 9.37e-07,
"loss": 0.0166,
"reward": 0.5625,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.5625,
"rewards/format_reward": 0.0,
"step": 64
},
{
"completion_length": 3.3125,
"epoch": 0.006431504477316579,
"grad_norm": 19.583276748657227,
"kl": 0.4501953125,
"learning_rate": 9.36e-07,
"loss": 0.018,
"reward": 0.6875,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.6875,
"rewards/format_reward": 0.0,
"step": 65
},
{
"completion_length": 3.5,
"epoch": 0.006530450700044526,
"grad_norm": 29.74109649658203,
"kl": 0.42333984375,
"learning_rate": 9.35e-07,
"loss": 0.0169,
"reward": 0.625,
"reward_std": 0.25,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.0,
"step": 66
},
{
"completion_length": 3.5625,
"epoch": 0.006629396922772473,
"grad_norm": 51.01466369628906,
"kl": 0.45574951171875,
"learning_rate": 9.34e-07,
"loss": 0.0182,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 67
},
{
"completion_length": 2.875,
"epoch": 0.00672834314550042,
"grad_norm": 40.87276840209961,
"kl": 0.11376953125,
"learning_rate": 9.33e-07,
"loss": 0.0046,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 68
},
{
"completion_length": 4.375,
"epoch": 0.006827289368228368,
"grad_norm": 920.1598510742188,
"kl": 30.021240234375,
"learning_rate": 9.32e-07,
"loss": 1.1998,
"reward": 0.6875,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.6875,
"rewards/format_reward": 0.0,
"step": 69
},
{
"completion_length": 3.25,
"epoch": 0.006926235590956315,
"grad_norm": 0.07895195484161377,
"kl": 0.0203857421875,
"learning_rate": 9.31e-07,
"loss": 0.0008,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 70
},
{
"completion_length": 2.9375,
"epoch": 0.0070251818136842625,
"grad_norm": 72.71320343017578,
"kl": 0.9306640625,
"learning_rate": 9.3e-07,
"loss": 0.0373,
"reward": 0.6875,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.6875,
"rewards/format_reward": 0.0,
"step": 71
},
{
"completion_length": 3.5,
"epoch": 0.00712412803641221,
"grad_norm": 0.04532546177506447,
"kl": 0.07568359375,
"learning_rate": 9.29e-07,
"loss": 0.003,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 72
},
{
"completion_length": 3.5,
"epoch": 0.007223074259140158,
"grad_norm": 59.64799118041992,
"kl": 0.309326171875,
"learning_rate": 9.28e-07,
"loss": 0.0123,
"reward": 0.625,
"reward_std": 0.14433756470680237,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.0,
"step": 73
},
{
"completion_length": 4.25,
"epoch": 0.007322020481868105,
"grad_norm": 0.022819090634584427,
"kl": 0.129150390625,
"learning_rate": 9.27e-07,
"loss": 0.0052,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 74
},
{
"completion_length": 2.5,
"epoch": 0.007420966704596052,
"grad_norm": 0.4349958598613739,
"kl": 0.1767578125,
"learning_rate": 9.26e-07,
"loss": 0.0071,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 75
},
{
"completion_length": 3.25,
"epoch": 0.007519912927324,
"grad_norm": 0.9703753590583801,
"kl": 0.1021728515625,
"learning_rate": 9.25e-07,
"loss": 0.0041,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 76
},
{
"completion_length": 3.6875,
"epoch": 0.007618859150051947,
"grad_norm": 0.20156638324260712,
"kl": 0.0416259765625,
"learning_rate": 9.24e-07,
"loss": 0.0017,
"reward": 0.5,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.5,
"rewards/format_reward": 0.0,
"step": 77
},
{
"completion_length": 3.0,
"epoch": 0.007717805372779894,
"grad_norm": 0.1729861944913864,
"kl": 0.1273193359375,
"learning_rate": 9.23e-07,
"loss": 0.0051,
"reward": 0.5,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.5,
"rewards/format_reward": 0.0,
"step": 78
},
{
"completion_length": 2.75,
"epoch": 0.007816751595507841,
"grad_norm": 0.019643617793917656,
"kl": 0.0714111328125,
"learning_rate": 9.22e-07,
"loss": 0.0029,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 79
},
{
"completion_length": 3.25,
"epoch": 0.00791569781823579,
"grad_norm": 0.017483701929450035,
"kl": 0.23956298828125,
"learning_rate": 9.21e-07,
"loss": 0.0096,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 80
},
{
"completion_length": 3.75,
"epoch": 0.008014644040963735,
"grad_norm": 0.02477215975522995,
"kl": 0.056396484375,
"learning_rate": 9.2e-07,
"loss": 0.0023,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 81
},
{
"completion_length": 2.25,
"epoch": 0.008113590263691683,
"grad_norm": 57.296180725097656,
"kl": 0.0313720703125,
"learning_rate": 9.19e-07,
"loss": 0.0013,
"reward": 0.875,
"reward_std": 0.14433756470680237,
"rewards/accuracy_reward": 0.875,
"rewards/format_reward": 0.0,
"step": 82
},
{
"completion_length": 2.75,
"epoch": 0.008212536486419631,
"grad_norm": 0.0005820893566124141,
"kl": 0.030029296875,
"learning_rate": 9.18e-07,
"loss": 0.0012,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 83
},
{
"completion_length": 2.75,
"epoch": 0.008311482709147578,
"grad_norm": 0.007898775860667229,
"kl": 0.0718994140625,
"learning_rate": 9.17e-07,
"loss": 0.0029,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 84
},
{
"completion_length": 5.25,
"epoch": 0.008410428931875526,
"grad_norm": 17.927873611450195,
"kl": 0.056640625,
"learning_rate": 9.16e-07,
"loss": 0.0023,
"reward": 0.8125,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.8125,
"rewards/format_reward": 0.0,
"step": 85
},
{
"completion_length": 2.9375,
"epoch": 0.008509375154603474,
"grad_norm": 0.6610168814659119,
"kl": 0.05419921875,
"learning_rate": 9.15e-07,
"loss": 0.0022,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 86
},
{
"completion_length": 6.0625,
"epoch": 0.00860832137733142,
"grad_norm": 35.296607971191406,
"kl": 1.230712890625,
"learning_rate": 9.14e-07,
"loss": 0.0497,
"reward": 0.625,
"reward_std": 0.25,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.0,
"step": 87
},
{
"completion_length": 2.5,
"epoch": 0.008707267600059368,
"grad_norm": 0.06378056854009628,
"kl": 0.06463623046875,
"learning_rate": 9.13e-07,
"loss": 0.0026,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 88
},
{
"completion_length": 3.1875,
"epoch": 0.008806213822787316,
"grad_norm": 227.54002380371094,
"kl": 0.4443359375,
"learning_rate": 9.12e-07,
"loss": 0.0178,
"reward": 0.4375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.4375,
"rewards/format_reward": 0.0,
"step": 89
},
{
"completion_length": 2.75,
"epoch": 0.008905160045515262,
"grad_norm": 0.0024500866420567036,
"kl": 0.0645751953125,
"learning_rate": 9.109999999999999e-07,
"loss": 0.0026,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 90
},
{
"completion_length": 3.0,
"epoch": 0.00900410626824321,
"grad_norm": 33.444313049316406,
"kl": 0.10693359375,
"learning_rate": 9.1e-07,
"loss": 0.0043,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 91
},
{
"completion_length": 3.6875,
"epoch": 0.009103052490971156,
"grad_norm": 19.867097854614258,
"kl": 0.14208984375,
"learning_rate": 9.09e-07,
"loss": 0.0057,
"reward": 0.6875,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.6875,
"rewards/format_reward": 0.0,
"step": 92
},
{
"completion_length": 3.625,
"epoch": 0.009201998713699104,
"grad_norm": 3.6420788764953613,
"kl": 0.177490234375,
"learning_rate": 9.08e-07,
"loss": 0.0071,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 93
},
{
"completion_length": 2.0,
"epoch": 0.009300944936427052,
"grad_norm": 0.008027822710573673,
"kl": 0.13671875,
"learning_rate": 9.07e-07,
"loss": 0.0055,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 94
},
{
"completion_length": 3.625,
"epoch": 0.009399891159154999,
"grad_norm": 51.053592681884766,
"kl": 0.162353515625,
"learning_rate": 9.06e-07,
"loss": 0.0065,
"reward": 0.8125,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.8125,
"rewards/format_reward": 0.0,
"step": 95
},
{
"completion_length": 2.5,
"epoch": 0.009498837381882947,
"grad_norm": 0.0023729894310235977,
"kl": 0.025390625,
"learning_rate": 9.05e-07,
"loss": 0.001,
"reward": 1.0,
"reward_std": 0.0,
"rewards/accuracy_reward": 1.0,
"rewards/format_reward": 0.0,
"step": 96
},
{
"completion_length": 3.0,
"epoch": 0.009597783604610895,
"grad_norm": 0.1433296650648117,
"kl": 0.1759033203125,
"learning_rate": 9.039999999999999e-07,
"loss": 0.0071,
"reward": 0.75,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.75,
"rewards/format_reward": 0.0,
"step": 97
},
{
"completion_length": 3.25,
"epoch": 0.009696729827338841,
"grad_norm": 46.357540130615234,
"kl": 0.344024658203125,
"learning_rate": 9.03e-07,
"loss": 0.0137,
"reward": 0.9375,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.9375,
"rewards/format_reward": 0.0,
"step": 98
},
{
"completion_length": 4.5625,
"epoch": 0.009795676050066789,
"grad_norm": 25.5620059967041,
"kl": 0.1181640625,
"learning_rate": 9.02e-07,
"loss": 0.0047,
"reward": 0.625,
"reward_std": 0.25,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.0,
"step": 99
},
{
"completion_length": 3.8125,
"epoch": 0.009894622272794735,
"grad_norm": 31.894678115844727,
"kl": 0.300445556640625,
"learning_rate": 9.01e-07,
"loss": 0.012,
"reward": 0.3125,
"reward_std": 0.125,
"rewards/accuracy_reward": 0.3125,
"rewards/format_reward": 0.0,
"step": 100
}
],
"logging_steps": 1,
"max_steps": 1000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}